{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.585308750365818, "eval_steps": 3000, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 8.189694690704346, "epoch": 0.0009755145839430299, "grad_norm": 1.1171875, "learning_rate": 2e-06, "loss": 8.1213, "mean_token_accuracy": 0.0928520105779171, "num_tokens": 17120.0, "step": 5 }, { "entropy": 8.088421869277955, "epoch": 0.0019510291678860598, "grad_norm": 1.328125, "learning_rate": 4.5e-06, "loss": 8.0338, "mean_token_accuracy": 0.09805552884936333, "num_tokens": 34182.0, "step": 10 }, { "entropy": 8.10444598197937, "epoch": 0.0029265437518290896, "grad_norm": 1.0625, "learning_rate": 7e-06, "loss": 8.0761, "mean_token_accuracy": 0.0990721695125103, "num_tokens": 51205.0, "step": 15 }, { "entropy": 8.136365795135498, "epoch": 0.0039020583357721197, "grad_norm": 0.9453125, "learning_rate": 9.5e-06, "loss": 8.1057, "mean_token_accuracy": 0.09148216098546982, "num_tokens": 67722.0, "step": 20 }, { "entropy": 8.127794647216797, "epoch": 0.00487757291971515, "grad_norm": 1.0078125, "learning_rate": 1.2e-05, "loss": 8.1015, "mean_token_accuracy": 0.09162097275257111, "num_tokens": 84230.0, "step": 25 }, { "entropy": 8.140947341918945, "epoch": 0.005853087503658179, "grad_norm": 0.82421875, "learning_rate": 1.4500000000000002e-05, "loss": 8.0101, "mean_token_accuracy": 0.10145255476236344, "num_tokens": 100967.0, "step": 30 }, { "entropy": 8.193094825744629, "epoch": 0.00682860208760121, "grad_norm": 0.88671875, "learning_rate": 1.7000000000000003e-05, "loss": 8.0798, "mean_token_accuracy": 0.09109266102313995, "num_tokens": 117450.0, "step": 35 }, { "entropy": 8.167135286331177, "epoch": 0.007804116671544239, "grad_norm": 0.8671875, "learning_rate": 1.95e-05, "loss": 7.9719, "mean_token_accuracy": 0.10474523082375527, "num_tokens": 135328.0, "step": 40 }, { "entropy": 8.237839794158935, "epoch": 0.00877963125548727, "grad_norm": 0.87890625, "learning_rate": 2.2e-05, "loss": 8.0049, "mean_token_accuracy": 0.09647766500711441, "num_tokens": 152571.0, "step": 45 }, { "entropy": 8.21173391342163, "epoch": 0.0097551458394303, "grad_norm": 0.91015625, "learning_rate": 2.4500000000000003e-05, "loss": 7.987, "mean_token_accuracy": 0.09857306927442551, "num_tokens": 170216.0, "step": 50 }, { "entropy": 8.188056182861327, "epoch": 0.010730660423373329, "grad_norm": 0.828125, "learning_rate": 2.7e-05, "loss": 8.0418, "mean_token_accuracy": 0.09847658723592759, "num_tokens": 186513.0, "step": 55 }, { "entropy": 8.209293651580811, "epoch": 0.011706175007316359, "grad_norm": 1.015625, "learning_rate": 2.95e-05, "loss": 8.0308, "mean_token_accuracy": 0.09393074885010719, "num_tokens": 202600.0, "step": 60 }, { "entropy": 8.16935420036316, "epoch": 0.01268168959125939, "grad_norm": 1.3125, "learning_rate": 3.2e-05, "loss": 7.9625, "mean_token_accuracy": 0.10780214741826058, "num_tokens": 220270.0, "step": 65 }, { "entropy": 8.189718246459961, "epoch": 0.01365720417520242, "grad_norm": 0.8203125, "learning_rate": 3.4500000000000005e-05, "loss": 7.9753, "mean_token_accuracy": 0.10615965947508813, "num_tokens": 236810.0, "step": 70 }, { "entropy": 8.23555679321289, "epoch": 0.014632718759145449, "grad_norm": 0.734375, "learning_rate": 3.7e-05, "loss": 8.0265, "mean_token_accuracy": 0.09320793077349662, "num_tokens": 252559.0, "step": 75 }, { "entropy": 8.191197776794434, "epoch": 0.015608233343088479, "grad_norm": 0.87890625, "learning_rate": 3.95e-05, "loss": 7.9595, "mean_token_accuracy": 0.10167472660541535, "num_tokens": 268507.0, "step": 80 }, { "entropy": 8.220345592498779, "epoch": 0.01658374792703151, "grad_norm": 0.79296875, "learning_rate": 4.2000000000000004e-05, "loss": 7.9799, "mean_token_accuracy": 0.09989922642707824, "num_tokens": 284776.0, "step": 85 }, { "entropy": 8.225536727905274, "epoch": 0.01755926251097454, "grad_norm": 0.9296875, "learning_rate": 4.45e-05, "loss": 8.0477, "mean_token_accuracy": 0.09435278922319412, "num_tokens": 300937.0, "step": 90 }, { "entropy": 8.22456979751587, "epoch": 0.01853477709491757, "grad_norm": 0.875, "learning_rate": 4.7000000000000004e-05, "loss": 8.0291, "mean_token_accuracy": 0.09500815868377685, "num_tokens": 317464.0, "step": 95 }, { "entropy": 8.196868324279786, "epoch": 0.0195102916788606, "grad_norm": 0.91796875, "learning_rate": 4.9500000000000004e-05, "loss": 7.9297, "mean_token_accuracy": 0.10513664558529853, "num_tokens": 334022.0, "step": 100 }, { "entropy": 8.174358654022218, "epoch": 0.02048580626280363, "grad_norm": 0.87109375, "learning_rate": 5.2e-05, "loss": 8.012, "mean_token_accuracy": 0.09847316145896912, "num_tokens": 350545.0, "step": 105 }, { "entropy": 8.142373085021973, "epoch": 0.021461320846746658, "grad_norm": 0.83984375, "learning_rate": 5.45e-05, "loss": 7.8485, "mean_token_accuracy": 0.11419763416051865, "num_tokens": 368878.0, "step": 110 }, { "entropy": 8.165599918365478, "epoch": 0.022436835430689687, "grad_norm": 0.86328125, "learning_rate": 5.7e-05, "loss": 8.0301, "mean_token_accuracy": 0.09600666835904122, "num_tokens": 388381.0, "step": 115 }, { "entropy": 8.214081382751464, "epoch": 0.023412350014632717, "grad_norm": 0.92578125, "learning_rate": 5.9499999999999996e-05, "loss": 8.048, "mean_token_accuracy": 0.09097032994031906, "num_tokens": 403727.0, "step": 120 }, { "entropy": 8.2991042137146, "epoch": 0.02438786459857575, "grad_norm": 0.921875, "learning_rate": 6.2e-05, "loss": 8.0491, "mean_token_accuracy": 0.0942738875746727, "num_tokens": 419046.0, "step": 125 }, { "entropy": 8.182039546966553, "epoch": 0.02536337918251878, "grad_norm": 1.640625, "learning_rate": 6.450000000000001e-05, "loss": 7.9433, "mean_token_accuracy": 0.10728831514716149, "num_tokens": 435186.0, "step": 130 }, { "entropy": 8.232324981689453, "epoch": 0.02633889376646181, "grad_norm": 0.953125, "learning_rate": 6.7e-05, "loss": 8.0395, "mean_token_accuracy": 0.09328199326992034, "num_tokens": 451552.0, "step": 135 }, { "entropy": 8.199801969528199, "epoch": 0.02731440835040484, "grad_norm": 1.3125, "learning_rate": 6.950000000000001e-05, "loss": 8.0061, "mean_token_accuracy": 0.09671647101640701, "num_tokens": 468006.0, "step": 140 }, { "entropy": 8.274113845825195, "epoch": 0.02828992293434787, "grad_norm": 0.984375, "learning_rate": 7.2e-05, "loss": 8.0112, "mean_token_accuracy": 0.09868691936135292, "num_tokens": 484381.0, "step": 145 }, { "entropy": 8.25528917312622, "epoch": 0.029265437518290898, "grad_norm": 1.421875, "learning_rate": 7.45e-05, "loss": 8.0257, "mean_token_accuracy": 0.0955542728304863, "num_tokens": 501309.0, "step": 150 }, { "entropy": 8.226487350463866, "epoch": 0.030240952102233928, "grad_norm": 0.99609375, "learning_rate": 7.7e-05, "loss": 7.9828, "mean_token_accuracy": 0.09746505990624428, "num_tokens": 518290.0, "step": 155 }, { "entropy": 8.181639671325684, "epoch": 0.031216466686176957, "grad_norm": 0.828125, "learning_rate": 7.950000000000001e-05, "loss": 7.9965, "mean_token_accuracy": 0.09464227110147476, "num_tokens": 533700.0, "step": 160 }, { "entropy": 8.192685508728028, "epoch": 0.03219198127011999, "grad_norm": 1.0078125, "learning_rate": 8.2e-05, "loss": 7.8837, "mean_token_accuracy": 0.10680020377039909, "num_tokens": 548935.0, "step": 165 }, { "entropy": 8.122217988967895, "epoch": 0.03316749585406302, "grad_norm": 0.78515625, "learning_rate": 8.450000000000001e-05, "loss": 7.9809, "mean_token_accuracy": 0.09729720130562783, "num_tokens": 565869.0, "step": 170 }, { "entropy": 8.255708599090577, "epoch": 0.03414301043800605, "grad_norm": 0.921875, "learning_rate": 8.7e-05, "loss": 7.9426, "mean_token_accuracy": 0.10057656094431877, "num_tokens": 583065.0, "step": 175 }, { "entropy": 8.147002172470092, "epoch": 0.03511852502194908, "grad_norm": 0.8359375, "learning_rate": 8.95e-05, "loss": 7.9597, "mean_token_accuracy": 0.10024290233850479, "num_tokens": 599875.0, "step": 180 }, { "entropy": 8.198067951202393, "epoch": 0.03609403960589211, "grad_norm": 0.890625, "learning_rate": 9.2e-05, "loss": 7.9192, "mean_token_accuracy": 0.1043715499341488, "num_tokens": 616296.0, "step": 185 }, { "entropy": 8.178347730636597, "epoch": 0.03706955418983514, "grad_norm": 0.8828125, "learning_rate": 9.45e-05, "loss": 7.8936, "mean_token_accuracy": 0.0991103172302246, "num_tokens": 632548.0, "step": 190 }, { "entropy": 8.182952737808227, "epoch": 0.03804506877377817, "grad_norm": 0.921875, "learning_rate": 9.7e-05, "loss": 7.9026, "mean_token_accuracy": 0.10161520764231682, "num_tokens": 650395.0, "step": 195 }, { "entropy": 8.191309070587158, "epoch": 0.0390205833577212, "grad_norm": 0.95703125, "learning_rate": 9.95e-05, "loss": 7.9511, "mean_token_accuracy": 0.10279864966869354, "num_tokens": 668453.0, "step": 200 }, { "entropy": 8.106355381011962, "epoch": 0.03999609794166423, "grad_norm": 0.89453125, "learning_rate": 0.000102, "loss": 7.822, "mean_token_accuracy": 0.11003539934754372, "num_tokens": 683914.0, "step": 205 }, { "entropy": 8.108619880676269, "epoch": 0.04097161252560726, "grad_norm": 0.94140625, "learning_rate": 0.00010449999999999999, "loss": 7.9833, "mean_token_accuracy": 0.09929522946476936, "num_tokens": 700480.0, "step": 210 }, { "entropy": 8.311169815063476, "epoch": 0.041947127109550286, "grad_norm": 0.96875, "learning_rate": 0.000107, "loss": 7.9705, "mean_token_accuracy": 0.0956616073846817, "num_tokens": 716604.0, "step": 215 }, { "entropy": 8.151149940490722, "epoch": 0.042922641693493316, "grad_norm": 0.95703125, "learning_rate": 0.0001095, "loss": 7.9283, "mean_token_accuracy": 0.09996144995093345, "num_tokens": 732697.0, "step": 220 }, { "entropy": 8.261075973510742, "epoch": 0.043898156277436345, "grad_norm": 0.953125, "learning_rate": 0.000112, "loss": 8.0403, "mean_token_accuracy": 0.09186563193798065, "num_tokens": 749072.0, "step": 225 }, { "entropy": 8.180721092224122, "epoch": 0.044873670861379375, "grad_norm": 0.94140625, "learning_rate": 0.0001145, "loss": 7.9417, "mean_token_accuracy": 0.09489826485514641, "num_tokens": 767826.0, "step": 230 }, { "entropy": 8.116961860656739, "epoch": 0.045849185445322405, "grad_norm": 0.9765625, "learning_rate": 0.00011700000000000001, "loss": 7.8815, "mean_token_accuracy": 0.101999169588089, "num_tokens": 786863.0, "step": 235 }, { "entropy": 8.151587963104248, "epoch": 0.046824700029265434, "grad_norm": 0.8984375, "learning_rate": 0.00011949999999999999, "loss": 7.8594, "mean_token_accuracy": 0.11106476187705994, "num_tokens": 803925.0, "step": 240 }, { "entropy": 8.16553840637207, "epoch": 0.04780021461320847, "grad_norm": 1.046875, "learning_rate": 0.000122, "loss": 7.9056, "mean_token_accuracy": 0.09941518381237983, "num_tokens": 822088.0, "step": 245 }, { "entropy": 8.204985809326171, "epoch": 0.0487757291971515, "grad_norm": 0.94140625, "learning_rate": 0.0001245, "loss": 7.9578, "mean_token_accuracy": 0.09502575322985649, "num_tokens": 837991.0, "step": 250 }, { "entropy": 8.094996738433839, "epoch": 0.04975124378109453, "grad_norm": 0.83984375, "learning_rate": 0.000127, "loss": 7.8384, "mean_token_accuracy": 0.11150547713041306, "num_tokens": 855593.0, "step": 255 }, { "entropy": 8.22648229598999, "epoch": 0.05072675836503756, "grad_norm": 0.8203125, "learning_rate": 0.0001295, "loss": 7.8555, "mean_token_accuracy": 0.1016038067638874, "num_tokens": 873696.0, "step": 260 }, { "entropy": 8.093446922302245, "epoch": 0.05170227294898059, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 7.7945, "mean_token_accuracy": 0.1079544596374035, "num_tokens": 890023.0, "step": 265 }, { "entropy": 8.219519519805909, "epoch": 0.05267778753292362, "grad_norm": 1.09375, "learning_rate": 0.00013450000000000002, "loss": 8.0193, "mean_token_accuracy": 0.09408034533262252, "num_tokens": 906492.0, "step": 270 }, { "entropy": 8.144463109970093, "epoch": 0.05365330211686665, "grad_norm": 1.3203125, "learning_rate": 0.00013700000000000002, "loss": 7.8985, "mean_token_accuracy": 0.09895867183804512, "num_tokens": 921837.0, "step": 275 }, { "entropy": 8.176286315917968, "epoch": 0.05462881670080968, "grad_norm": 1.0234375, "learning_rate": 0.0001395, "loss": 7.797, "mean_token_accuracy": 0.10809003040194512, "num_tokens": 938771.0, "step": 280 }, { "entropy": 8.145763206481934, "epoch": 0.05560433128475271, "grad_norm": 0.96875, "learning_rate": 0.00014199999999999998, "loss": 7.9095, "mean_token_accuracy": 0.09854145273566246, "num_tokens": 954562.0, "step": 285 }, { "entropy": 8.14554295539856, "epoch": 0.05657984586869574, "grad_norm": 0.9765625, "learning_rate": 0.0001445, "loss": 7.8002, "mean_token_accuracy": 0.10630740001797676, "num_tokens": 973700.0, "step": 290 }, { "entropy": 8.05322551727295, "epoch": 0.05755536045263877, "grad_norm": 0.7734375, "learning_rate": 0.000147, "loss": 7.9073, "mean_token_accuracy": 0.09839207902550698, "num_tokens": 990688.0, "step": 295 }, { "entropy": 8.224873065948486, "epoch": 0.058530875036581796, "grad_norm": 0.93359375, "learning_rate": 0.0001495, "loss": 8.0062, "mean_token_accuracy": 0.09405675381422043, "num_tokens": 1008144.0, "step": 300 }, { "entropy": 8.18083577156067, "epoch": 0.059506389620524826, "grad_norm": 0.7890625, "learning_rate": 0.000152, "loss": 7.9383, "mean_token_accuracy": 0.09709960296750068, "num_tokens": 1027379.0, "step": 305 }, { "entropy": 8.178252029418946, "epoch": 0.060481904204467855, "grad_norm": 0.984375, "learning_rate": 0.00015450000000000001, "loss": 7.8793, "mean_token_accuracy": 0.10311919152736664, "num_tokens": 1043999.0, "step": 310 }, { "entropy": 8.098154592514039, "epoch": 0.061457418788410885, "grad_norm": 1.1171875, "learning_rate": 0.000157, "loss": 7.9274, "mean_token_accuracy": 0.09602248296141624, "num_tokens": 1062237.0, "step": 315 }, { "entropy": 8.244752025604248, "epoch": 0.062432933372353915, "grad_norm": 1.734375, "learning_rate": 0.0001595, "loss": 7.8576, "mean_token_accuracy": 0.10373107567429543, "num_tokens": 1078092.0, "step": 320 }, { "entropy": 8.097948360443116, "epoch": 0.06340844795629695, "grad_norm": 1.0078125, "learning_rate": 0.000162, "loss": 7.8987, "mean_token_accuracy": 0.10294966548681259, "num_tokens": 1095124.0, "step": 325 }, { "entropy": 8.17255973815918, "epoch": 0.06438396254023998, "grad_norm": 0.87890625, "learning_rate": 0.00016450000000000001, "loss": 7.8855, "mean_token_accuracy": 0.09729674383997917, "num_tokens": 1112775.0, "step": 330 }, { "entropy": 8.077517557144166, "epoch": 0.06535947712418301, "grad_norm": 1.0234375, "learning_rate": 0.00016700000000000002, "loss": 7.7933, "mean_token_accuracy": 0.10203502476215362, "num_tokens": 1129726.0, "step": 335 }, { "entropy": 8.185189342498779, "epoch": 0.06633499170812604, "grad_norm": 1.0546875, "learning_rate": 0.00016950000000000003, "loss": 7.8883, "mean_token_accuracy": 0.10449600592255592, "num_tokens": 1144034.0, "step": 340 }, { "entropy": 8.129604816436768, "epoch": 0.06731050629206907, "grad_norm": 0.9375, "learning_rate": 0.00017199999999999998, "loss": 7.8179, "mean_token_accuracy": 0.10270989686250687, "num_tokens": 1159633.0, "step": 345 }, { "entropy": 8.0196063041687, "epoch": 0.0682860208760121, "grad_norm": 1.015625, "learning_rate": 0.00017449999999999999, "loss": 7.8085, "mean_token_accuracy": 0.0996285319328308, "num_tokens": 1175350.0, "step": 350 }, { "entropy": 8.027859020233155, "epoch": 0.06926153545995513, "grad_norm": 1.6796875, "learning_rate": 0.000177, "loss": 7.7379, "mean_token_accuracy": 0.10451692193746567, "num_tokens": 1193121.0, "step": 355 }, { "entropy": 8.143134546279907, "epoch": 0.07023705004389816, "grad_norm": 1.0390625, "learning_rate": 0.0001795, "loss": 7.8633, "mean_token_accuracy": 0.09846432060003281, "num_tokens": 1209896.0, "step": 360 }, { "entropy": 8.091192197799682, "epoch": 0.07121256462784119, "grad_norm": 1.015625, "learning_rate": 0.000182, "loss": 7.8953, "mean_token_accuracy": 0.09844174087047577, "num_tokens": 1227011.0, "step": 365 }, { "entropy": 8.028723001480103, "epoch": 0.07218807921178422, "grad_norm": 1.0390625, "learning_rate": 0.0001845, "loss": 7.7943, "mean_token_accuracy": 0.09941637516021729, "num_tokens": 1241595.0, "step": 370 }, { "entropy": 8.113645601272584, "epoch": 0.07316359379572725, "grad_norm": 1.0546875, "learning_rate": 0.000187, "loss": 7.8044, "mean_token_accuracy": 0.09797000885009766, "num_tokens": 1256919.0, "step": 375 }, { "entropy": 8.04976544380188, "epoch": 0.07413910837967028, "grad_norm": 1.1484375, "learning_rate": 0.0001895, "loss": 7.7862, "mean_token_accuracy": 0.1137398436665535, "num_tokens": 1274344.0, "step": 380 }, { "entropy": 8.014974355697632, "epoch": 0.0751146229636133, "grad_norm": 0.91796875, "learning_rate": 0.000192, "loss": 7.7822, "mean_token_accuracy": 0.10938268229365349, "num_tokens": 1290252.0, "step": 385 }, { "entropy": 8.139637756347657, "epoch": 0.07609013754755634, "grad_norm": 0.9609375, "learning_rate": 0.0001945, "loss": 7.835, "mean_token_accuracy": 0.09761641547083855, "num_tokens": 1306987.0, "step": 390 }, { "entropy": 8.127484035491943, "epoch": 0.07706565213149937, "grad_norm": 1.09375, "learning_rate": 0.00019700000000000002, "loss": 7.8599, "mean_token_accuracy": 0.09425433501601219, "num_tokens": 1323031.0, "step": 395 }, { "entropy": 8.023318195343018, "epoch": 0.0780411667154424, "grad_norm": 0.875, "learning_rate": 0.00019950000000000002, "loss": 7.8194, "mean_token_accuracy": 0.09804570376873016, "num_tokens": 1339592.0, "step": 400 }, { "entropy": 8.08116374015808, "epoch": 0.07901668129938542, "grad_norm": 1.0078125, "learning_rate": 0.000202, "loss": 7.7704, "mean_token_accuracy": 0.10749435946345329, "num_tokens": 1358131.0, "step": 405 }, { "entropy": 8.001975107192994, "epoch": 0.07999219588332845, "grad_norm": 0.94921875, "learning_rate": 0.00020449999999999998, "loss": 7.6943, "mean_token_accuracy": 0.11095809042453766, "num_tokens": 1375705.0, "step": 410 }, { "entropy": 7.946876573562622, "epoch": 0.08096771046727148, "grad_norm": 1.1875, "learning_rate": 0.000207, "loss": 7.7367, "mean_token_accuracy": 0.10697664991021157, "num_tokens": 1392736.0, "step": 415 }, { "entropy": 8.051513481140137, "epoch": 0.08194322505121451, "grad_norm": 0.8515625, "learning_rate": 0.0002095, "loss": 7.7993, "mean_token_accuracy": 0.10061158984899521, "num_tokens": 1408536.0, "step": 420 }, { "entropy": 7.932209205627442, "epoch": 0.08291873963515754, "grad_norm": 0.9375, "learning_rate": 0.000212, "loss": 7.7882, "mean_token_accuracy": 0.10027184262871743, "num_tokens": 1425423.0, "step": 425 }, { "entropy": 8.056283235549927, "epoch": 0.08389425421910057, "grad_norm": 1.1171875, "learning_rate": 0.0002145, "loss": 7.7772, "mean_token_accuracy": 0.10296398922801017, "num_tokens": 1442420.0, "step": 430 }, { "entropy": 8.07236189842224, "epoch": 0.0848697688030436, "grad_norm": 1.1640625, "learning_rate": 0.00021700000000000002, "loss": 7.7303, "mean_token_accuracy": 0.10705514326691627, "num_tokens": 1458835.0, "step": 435 }, { "entropy": 8.004169511795045, "epoch": 0.08584528338698663, "grad_norm": 1.046875, "learning_rate": 0.0002195, "loss": 7.8228, "mean_token_accuracy": 0.09661487340927125, "num_tokens": 1475563.0, "step": 440 }, { "entropy": 8.09420862197876, "epoch": 0.08682079797092966, "grad_norm": 1.0, "learning_rate": 0.000222, "loss": 7.7797, "mean_token_accuracy": 0.10943613573908806, "num_tokens": 1492687.0, "step": 445 }, { "entropy": 8.086115980148316, "epoch": 0.08779631255487269, "grad_norm": 1.4140625, "learning_rate": 0.0002245, "loss": 7.7887, "mean_token_accuracy": 0.097627442330122, "num_tokens": 1508394.0, "step": 450 }, { "entropy": 7.934510850906372, "epoch": 0.08877182713881572, "grad_norm": 1.140625, "learning_rate": 0.00022700000000000002, "loss": 7.754, "mean_token_accuracy": 0.10472490787506103, "num_tokens": 1527112.0, "step": 455 }, { "entropy": 8.001490831375122, "epoch": 0.08974734172275875, "grad_norm": 1.328125, "learning_rate": 0.00022950000000000002, "loss": 7.798, "mean_token_accuracy": 0.10435827821493149, "num_tokens": 1545401.0, "step": 460 }, { "entropy": 7.947861576080323, "epoch": 0.09072285630670178, "grad_norm": 1.109375, "learning_rate": 0.00023200000000000003, "loss": 7.6915, "mean_token_accuracy": 0.10466418415307999, "num_tokens": 1561621.0, "step": 465 }, { "entropy": 8.044413089752197, "epoch": 0.09169837089064481, "grad_norm": 0.9765625, "learning_rate": 0.00023449999999999998, "loss": 7.8059, "mean_token_accuracy": 0.09883959665894508, "num_tokens": 1579225.0, "step": 470 }, { "entropy": 8.022387886047364, "epoch": 0.09267388547458784, "grad_norm": 1.0390625, "learning_rate": 0.000237, "loss": 7.7096, "mean_token_accuracy": 0.10403750389814377, "num_tokens": 1596125.0, "step": 475 }, { "entropy": 7.9631647109985355, "epoch": 0.09364940005853087, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 7.8258, "mean_token_accuracy": 0.0952387198805809, "num_tokens": 1613451.0, "step": 480 }, { "entropy": 8.017077445983887, "epoch": 0.09462491464247391, "grad_norm": 0.953125, "learning_rate": 0.000242, "loss": 7.803, "mean_token_accuracy": 0.09880654960870743, "num_tokens": 1630929.0, "step": 485 }, { "entropy": 8.025622653961182, "epoch": 0.09560042922641694, "grad_norm": 1.0078125, "learning_rate": 0.0002445, "loss": 7.7924, "mean_token_accuracy": 0.10142078548669815, "num_tokens": 1647379.0, "step": 490 }, { "entropy": 7.718832302093506, "epoch": 0.09657594381035997, "grad_norm": 1.0390625, "learning_rate": 0.000247, "loss": 7.5342, "mean_token_accuracy": 0.12226327732205391, "num_tokens": 1664415.0, "step": 495 }, { "entropy": 7.8884869575500485, "epoch": 0.097551458394303, "grad_norm": 0.9140625, "learning_rate": 0.0002495, "loss": 7.653, "mean_token_accuracy": 0.10562271177768708, "num_tokens": 1679556.0, "step": 500 }, { "entropy": 7.949688959121704, "epoch": 0.09852697297824603, "grad_norm": 0.9296875, "learning_rate": 0.000252, "loss": 7.6052, "mean_token_accuracy": 0.11016268655657768, "num_tokens": 1696727.0, "step": 505 }, { "entropy": 7.83725757598877, "epoch": 0.09950248756218906, "grad_norm": 0.98828125, "learning_rate": 0.0002545, "loss": 7.6089, "mean_token_accuracy": 0.11472497954964637, "num_tokens": 1713918.0, "step": 510 }, { "entropy": 7.953091287612915, "epoch": 0.10047800214613209, "grad_norm": 1.0078125, "learning_rate": 0.000257, "loss": 7.7951, "mean_token_accuracy": 0.0945059321820736, "num_tokens": 1729581.0, "step": 515 }, { "entropy": 7.921047019958496, "epoch": 0.10145351673007512, "grad_norm": 0.99609375, "learning_rate": 0.0002595, "loss": 7.6469, "mean_token_accuracy": 0.0992059625685215, "num_tokens": 1746367.0, "step": 520 }, { "entropy": 7.967546033859253, "epoch": 0.10242903131401815, "grad_norm": 1.0234375, "learning_rate": 0.000262, "loss": 7.7465, "mean_token_accuracy": 0.09730863869190216, "num_tokens": 1765009.0, "step": 525 }, { "entropy": 7.927223825454712, "epoch": 0.10340454589796118, "grad_norm": 0.9765625, "learning_rate": 0.00026450000000000003, "loss": 7.7539, "mean_token_accuracy": 0.09873774722218513, "num_tokens": 1782113.0, "step": 530 }, { "entropy": 7.883999395370483, "epoch": 0.10438006048190421, "grad_norm": 0.93359375, "learning_rate": 0.00026700000000000004, "loss": 7.6519, "mean_token_accuracy": 0.10443588495254516, "num_tokens": 1798301.0, "step": 535 }, { "entropy": 7.911849689483643, "epoch": 0.10535557506584724, "grad_norm": 1.0625, "learning_rate": 0.00026950000000000005, "loss": 7.6931, "mean_token_accuracy": 0.10224330425262451, "num_tokens": 1815059.0, "step": 540 }, { "entropy": 7.769307279586792, "epoch": 0.10633108964979027, "grad_norm": 0.9921875, "learning_rate": 0.00027200000000000005, "loss": 7.6051, "mean_token_accuracy": 0.10878376364707946, "num_tokens": 1831699.0, "step": 545 }, { "entropy": 7.925337314605713, "epoch": 0.1073066042337333, "grad_norm": 0.94921875, "learning_rate": 0.0002745, "loss": 7.6755, "mean_token_accuracy": 0.10547427088022232, "num_tokens": 1847993.0, "step": 550 }, { "entropy": 7.875313425064087, "epoch": 0.10828211881767633, "grad_norm": 0.85546875, "learning_rate": 0.000277, "loss": 7.5326, "mean_token_accuracy": 0.10610557869076728, "num_tokens": 1864753.0, "step": 555 }, { "entropy": 7.869585037231445, "epoch": 0.10925763340161936, "grad_norm": 0.94140625, "learning_rate": 0.0002795, "loss": 7.6888, "mean_token_accuracy": 0.1044863447546959, "num_tokens": 1882154.0, "step": 560 }, { "entropy": 7.754839944839477, "epoch": 0.11023314798556239, "grad_norm": 0.95703125, "learning_rate": 0.00028199999999999997, "loss": 7.5623, "mean_token_accuracy": 0.11065352857112884, "num_tokens": 1899683.0, "step": 565 }, { "entropy": 7.821217679977417, "epoch": 0.11120866256950541, "grad_norm": 1.1171875, "learning_rate": 0.0002845, "loss": 7.5912, "mean_token_accuracy": 0.10635183900594711, "num_tokens": 1918489.0, "step": 570 }, { "entropy": 7.833246660232544, "epoch": 0.11218417715344844, "grad_norm": 1.03125, "learning_rate": 0.000287, "loss": 7.6345, "mean_token_accuracy": 0.10072939395904541, "num_tokens": 1935609.0, "step": 575 }, { "entropy": 7.7502540111541744, "epoch": 0.11315969173739147, "grad_norm": 0.96484375, "learning_rate": 0.0002895, "loss": 7.6882, "mean_token_accuracy": 0.09968181252479554, "num_tokens": 1951311.0, "step": 580 }, { "entropy": 7.9223309516906735, "epoch": 0.1141352063213345, "grad_norm": 0.92578125, "learning_rate": 0.000292, "loss": 7.7251, "mean_token_accuracy": 0.09712948650121689, "num_tokens": 1968908.0, "step": 585 }, { "entropy": 7.88884711265564, "epoch": 0.11511072090527753, "grad_norm": 0.98046875, "learning_rate": 0.0002945, "loss": 7.6394, "mean_token_accuracy": 0.10047843605279923, "num_tokens": 1983807.0, "step": 590 }, { "entropy": 7.878595304489136, "epoch": 0.11608623548922056, "grad_norm": 1.109375, "learning_rate": 0.000297, "loss": 7.6755, "mean_token_accuracy": 0.1005166418850422, "num_tokens": 2000219.0, "step": 595 }, { "entropy": 7.826176500320434, "epoch": 0.11706175007316359, "grad_norm": 1.0390625, "learning_rate": 0.0002995, "loss": 7.6359, "mean_token_accuracy": 0.10865101143717766, "num_tokens": 2017360.0, "step": 600 }, { "entropy": 7.724283885955811, "epoch": 0.11803726465710662, "grad_norm": 0.859375, "learning_rate": 0.000302, "loss": 7.6093, "mean_token_accuracy": 0.10661007612943649, "num_tokens": 2034953.0, "step": 605 }, { "entropy": 7.793875885009766, "epoch": 0.11901277924104965, "grad_norm": 1.0546875, "learning_rate": 0.0003045, "loss": 7.5775, "mean_token_accuracy": 0.10660225003957749, "num_tokens": 2051551.0, "step": 610 }, { "entropy": 7.78004674911499, "epoch": 0.11998829382499268, "grad_norm": 1.0, "learning_rate": 0.000307, "loss": 7.5478, "mean_token_accuracy": 0.11335186585783959, "num_tokens": 2067188.0, "step": 615 }, { "entropy": 7.790237903594971, "epoch": 0.12096380840893571, "grad_norm": 0.99609375, "learning_rate": 0.0003095, "loss": 7.6232, "mean_token_accuracy": 0.10700822845101357, "num_tokens": 2082569.0, "step": 620 }, { "entropy": 7.847408294677734, "epoch": 0.12193932299287874, "grad_norm": 0.86328125, "learning_rate": 0.000312, "loss": 7.6786, "mean_token_accuracy": 0.10037213563919067, "num_tokens": 2099446.0, "step": 625 }, { "entropy": 7.824612283706665, "epoch": 0.12291483757682177, "grad_norm": 0.94921875, "learning_rate": 0.0003145, "loss": 7.6309, "mean_token_accuracy": 0.10579207465052605, "num_tokens": 2116526.0, "step": 630 }, { "entropy": 7.7642529010772705, "epoch": 0.1238903521607648, "grad_norm": 0.9140625, "learning_rate": 0.000317, "loss": 7.6948, "mean_token_accuracy": 0.09671583101153373, "num_tokens": 2134624.0, "step": 635 }, { "entropy": 7.721237707138061, "epoch": 0.12486586674470783, "grad_norm": 1.109375, "learning_rate": 0.0003195, "loss": 7.5155, "mean_token_accuracy": 0.11177115440368653, "num_tokens": 2152872.0, "step": 640 }, { "entropy": 7.853572702407837, "epoch": 0.12584138132865086, "grad_norm": 0.98046875, "learning_rate": 0.000322, "loss": 7.6533, "mean_token_accuracy": 0.10234769731760025, "num_tokens": 2169480.0, "step": 645 }, { "entropy": 7.71003680229187, "epoch": 0.1268168959125939, "grad_norm": 0.859375, "learning_rate": 0.00032450000000000003, "loss": 7.51, "mean_token_accuracy": 0.11612471118569374, "num_tokens": 2186054.0, "step": 650 }, { "entropy": 7.783114385604859, "epoch": 0.12779241049653692, "grad_norm": 1.078125, "learning_rate": 0.00032700000000000003, "loss": 7.6688, "mean_token_accuracy": 0.09879108145833015, "num_tokens": 2202320.0, "step": 655 }, { "entropy": 7.6497093677520756, "epoch": 0.12876792508047996, "grad_norm": 0.95703125, "learning_rate": 0.00032950000000000004, "loss": 7.5481, "mean_token_accuracy": 0.1086566023528576, "num_tokens": 2218817.0, "step": 660 }, { "entropy": 7.880639505386353, "epoch": 0.12974343966442298, "grad_norm": 1.0625, "learning_rate": 0.00033200000000000005, "loss": 7.7054, "mean_token_accuracy": 0.09768114015460014, "num_tokens": 2234845.0, "step": 665 }, { "entropy": 7.780311632156372, "epoch": 0.13071895424836602, "grad_norm": 1.0625, "learning_rate": 0.00033450000000000005, "loss": 7.6545, "mean_token_accuracy": 0.10292254686355591, "num_tokens": 2251904.0, "step": 670 }, { "entropy": 7.706472587585449, "epoch": 0.13169446883230904, "grad_norm": 1.0625, "learning_rate": 0.000337, "loss": 7.6584, "mean_token_accuracy": 0.10477369427680969, "num_tokens": 2268343.0, "step": 675 }, { "entropy": 7.830237913131714, "epoch": 0.13266998341625208, "grad_norm": 1.125, "learning_rate": 0.0003395, "loss": 7.651, "mean_token_accuracy": 0.10206437036395073, "num_tokens": 2284524.0, "step": 680 }, { "entropy": 7.651451110839844, "epoch": 0.1336454980001951, "grad_norm": 0.92578125, "learning_rate": 0.000342, "loss": 7.5627, "mean_token_accuracy": 0.11217835396528245, "num_tokens": 2302350.0, "step": 685 }, { "entropy": 7.810202407836914, "epoch": 0.13462101258413814, "grad_norm": 0.99609375, "learning_rate": 0.00034449999999999997, "loss": 7.6484, "mean_token_accuracy": 0.10006091371178627, "num_tokens": 2319953.0, "step": 690 }, { "entropy": 7.6707275867462155, "epoch": 0.13559652716808115, "grad_norm": 0.9296875, "learning_rate": 0.000347, "loss": 7.5379, "mean_token_accuracy": 0.11016602963209152, "num_tokens": 2336698.0, "step": 695 }, { "entropy": 7.65397081375122, "epoch": 0.1365720417520242, "grad_norm": 1.0390625, "learning_rate": 0.0003495, "loss": 7.5069, "mean_token_accuracy": 0.11032541692256928, "num_tokens": 2353986.0, "step": 700 }, { "entropy": 7.720977354049682, "epoch": 0.1375475563359672, "grad_norm": 0.984375, "learning_rate": 0.000352, "loss": 7.5481, "mean_token_accuracy": 0.10689252316951751, "num_tokens": 2370320.0, "step": 705 }, { "entropy": 7.749428844451904, "epoch": 0.13852307091991026, "grad_norm": 0.90234375, "learning_rate": 0.0003545, "loss": 7.6172, "mean_token_accuracy": 0.10306816101074219, "num_tokens": 2385453.0, "step": 710 }, { "entropy": 7.7098816394805905, "epoch": 0.13949858550385327, "grad_norm": 0.9375, "learning_rate": 0.000357, "loss": 7.5977, "mean_token_accuracy": 0.10320264920592308, "num_tokens": 2401545.0, "step": 715 }, { "entropy": 7.686821317672729, "epoch": 0.14047410008779632, "grad_norm": 0.91015625, "learning_rate": 0.0003595, "loss": 7.6155, "mean_token_accuracy": 0.10371157601475715, "num_tokens": 2418414.0, "step": 720 }, { "entropy": 7.748217391967773, "epoch": 0.14144961467173933, "grad_norm": 1.0703125, "learning_rate": 0.000362, "loss": 7.6492, "mean_token_accuracy": 0.10145975425839424, "num_tokens": 2434973.0, "step": 725 }, { "entropy": 7.769000911712647, "epoch": 0.14242512925568238, "grad_norm": 1.109375, "learning_rate": 0.0003645, "loss": 7.6624, "mean_token_accuracy": 0.09807511419057846, "num_tokens": 2451053.0, "step": 730 }, { "entropy": 7.700602865219116, "epoch": 0.1434006438396254, "grad_norm": 0.91796875, "learning_rate": 0.000367, "loss": 7.616, "mean_token_accuracy": 0.09884371384978294, "num_tokens": 2467280.0, "step": 735 }, { "entropy": 7.650289630889892, "epoch": 0.14437615842356843, "grad_norm": 1.0, "learning_rate": 0.0003695, "loss": 7.5466, "mean_token_accuracy": 0.11135434210300446, "num_tokens": 2484588.0, "step": 740 }, { "entropy": 7.705961132049561, "epoch": 0.14535167300751145, "grad_norm": 1.109375, "learning_rate": 0.000372, "loss": 7.5657, "mean_token_accuracy": 0.10915652140974999, "num_tokens": 2501200.0, "step": 745 }, { "entropy": 7.66199746131897, "epoch": 0.1463271875914545, "grad_norm": 1.0, "learning_rate": 0.0003745, "loss": 7.5078, "mean_token_accuracy": 0.11285350546240806, "num_tokens": 2517199.0, "step": 750 }, { "entropy": 7.6683488368988035, "epoch": 0.1473027021753975, "grad_norm": 0.8828125, "learning_rate": 0.000377, "loss": 7.5928, "mean_token_accuracy": 0.09981210231781006, "num_tokens": 2534824.0, "step": 755 }, { "entropy": 7.523636436462402, "epoch": 0.14827821675934055, "grad_norm": 1.0078125, "learning_rate": 0.0003795, "loss": 7.4851, "mean_token_accuracy": 0.11066361516714096, "num_tokens": 2550842.0, "step": 760 }, { "entropy": 7.629826021194458, "epoch": 0.14925373134328357, "grad_norm": 0.98046875, "learning_rate": 0.000382, "loss": 7.4176, "mean_token_accuracy": 0.11151769161224365, "num_tokens": 2567878.0, "step": 765 }, { "entropy": 7.6675316333770756, "epoch": 0.1502292459272266, "grad_norm": 0.91015625, "learning_rate": 0.0003845, "loss": 7.5154, "mean_token_accuracy": 0.10651935636997223, "num_tokens": 2584148.0, "step": 770 }, { "entropy": 7.593663120269776, "epoch": 0.15120476051116966, "grad_norm": 0.96875, "learning_rate": 0.00038700000000000003, "loss": 7.556, "mean_token_accuracy": 0.10755399614572525, "num_tokens": 2600067.0, "step": 775 }, { "entropy": 7.689086866378784, "epoch": 0.15218027509511267, "grad_norm": 0.96875, "learning_rate": 0.00038950000000000003, "loss": 7.5272, "mean_token_accuracy": 0.10445193201303482, "num_tokens": 2615746.0, "step": 780 }, { "entropy": 7.613615942001343, "epoch": 0.15315578967905571, "grad_norm": 0.95703125, "learning_rate": 0.00039200000000000004, "loss": 7.5604, "mean_token_accuracy": 0.10300727486610413, "num_tokens": 2631641.0, "step": 785 }, { "entropy": 7.590198183059693, "epoch": 0.15413130426299873, "grad_norm": 0.921875, "learning_rate": 0.00039450000000000005, "loss": 7.5502, "mean_token_accuracy": 0.10660960003733636, "num_tokens": 2647015.0, "step": 790 }, { "entropy": 7.6192991733551025, "epoch": 0.15510681884694177, "grad_norm": 0.953125, "learning_rate": 0.00039700000000000005, "loss": 7.4552, "mean_token_accuracy": 0.10671902745962143, "num_tokens": 2664045.0, "step": 795 }, { "entropy": 7.630334043502808, "epoch": 0.1560823334308848, "grad_norm": 1.5703125, "learning_rate": 0.0003995, "loss": 7.4689, "mean_token_accuracy": 0.10270929858088493, "num_tokens": 2680774.0, "step": 800 }, { "entropy": 7.6249841213226315, "epoch": 0.15705784801482783, "grad_norm": 0.8984375, "learning_rate": 0.000402, "loss": 7.593, "mean_token_accuracy": 0.10395026803016663, "num_tokens": 2697719.0, "step": 805 }, { "entropy": 7.620457458496094, "epoch": 0.15803336259877085, "grad_norm": 1.09375, "learning_rate": 0.0004045, "loss": 7.5247, "mean_token_accuracy": 0.09749212935566902, "num_tokens": 2714518.0, "step": 810 }, { "entropy": 7.627707242965698, "epoch": 0.1590088771827139, "grad_norm": 0.9296875, "learning_rate": 0.00040699999999999997, "loss": 7.5828, "mean_token_accuracy": 0.10642224773764611, "num_tokens": 2729288.0, "step": 815 }, { "entropy": 7.668026733398437, "epoch": 0.1599843917666569, "grad_norm": 1.0703125, "learning_rate": 0.0004095, "loss": 7.558, "mean_token_accuracy": 0.1009812332689762, "num_tokens": 2746782.0, "step": 820 }, { "entropy": 7.59692063331604, "epoch": 0.16095990635059995, "grad_norm": 0.99609375, "learning_rate": 0.000412, "loss": 7.606, "mean_token_accuracy": 0.09608046188950539, "num_tokens": 2763159.0, "step": 825 }, { "entropy": 7.587530517578125, "epoch": 0.16193542093454297, "grad_norm": 0.85546875, "learning_rate": 0.0004145, "loss": 7.5677, "mean_token_accuracy": 0.10232978016138077, "num_tokens": 2780338.0, "step": 830 }, { "entropy": 7.5702805519104, "epoch": 0.162910935518486, "grad_norm": 0.90234375, "learning_rate": 0.000417, "loss": 7.4619, "mean_token_accuracy": 0.1076440267264843, "num_tokens": 2796214.0, "step": 835 }, { "entropy": 7.637975788116455, "epoch": 0.16388645010242903, "grad_norm": 0.90625, "learning_rate": 0.0004195, "loss": 7.584, "mean_token_accuracy": 0.09872226789593697, "num_tokens": 2812745.0, "step": 840 }, { "entropy": 7.524194765090942, "epoch": 0.16486196468637207, "grad_norm": 0.9765625, "learning_rate": 0.000422, "loss": 7.4454, "mean_token_accuracy": 0.10416454449295998, "num_tokens": 2828288.0, "step": 845 }, { "entropy": 7.608716773986816, "epoch": 0.16583747927031509, "grad_norm": 0.8984375, "learning_rate": 0.0004245, "loss": 7.5874, "mean_token_accuracy": 0.0974365383386612, "num_tokens": 2843618.0, "step": 850 }, { "entropy": 7.5106102466583256, "epoch": 0.16681299385425813, "grad_norm": 1.3203125, "learning_rate": 0.000427, "loss": 7.3893, "mean_token_accuracy": 0.10364697575569153, "num_tokens": 2860659.0, "step": 855 }, { "entropy": 7.55679759979248, "epoch": 0.16778850843820114, "grad_norm": 0.86328125, "learning_rate": 0.0004295, "loss": 7.4876, "mean_token_accuracy": 0.10175744146108627, "num_tokens": 2877482.0, "step": 860 }, { "entropy": 7.586041831970215, "epoch": 0.1687640230221442, "grad_norm": 0.85546875, "learning_rate": 0.000432, "loss": 7.5667, "mean_token_accuracy": 0.09685270413756371, "num_tokens": 2895868.0, "step": 865 }, { "entropy": 7.574951267242431, "epoch": 0.1697395376060872, "grad_norm": 0.95703125, "learning_rate": 0.0004345, "loss": 7.5706, "mean_token_accuracy": 0.10406396687030792, "num_tokens": 2913103.0, "step": 870 }, { "entropy": 7.5868103981018065, "epoch": 0.17071505219003025, "grad_norm": 1.171875, "learning_rate": 0.000437, "loss": 7.4942, "mean_token_accuracy": 0.10660254284739494, "num_tokens": 2928291.0, "step": 875 }, { "entropy": 7.551671886444092, "epoch": 0.17169056677397326, "grad_norm": 0.95703125, "learning_rate": 0.0004395, "loss": 7.5347, "mean_token_accuracy": 0.10479419305920601, "num_tokens": 2945115.0, "step": 880 }, { "entropy": 7.54897518157959, "epoch": 0.1726660813579163, "grad_norm": 0.953125, "learning_rate": 0.000442, "loss": 7.4282, "mean_token_accuracy": 0.10494303852319717, "num_tokens": 2962869.0, "step": 885 }, { "entropy": 7.5557914733886715, "epoch": 0.17364159594185932, "grad_norm": 0.921875, "learning_rate": 0.0004445, "loss": 7.5715, "mean_token_accuracy": 0.09901110231876373, "num_tokens": 2979298.0, "step": 890 }, { "entropy": 7.518081378936768, "epoch": 0.17461711052580237, "grad_norm": 0.96875, "learning_rate": 0.000447, "loss": 7.4595, "mean_token_accuracy": 0.10685873478651046, "num_tokens": 2996146.0, "step": 895 }, { "entropy": 7.518190670013428, "epoch": 0.17559262510974538, "grad_norm": 0.96484375, "learning_rate": 0.00044950000000000003, "loss": 7.5431, "mean_token_accuracy": 0.10059425905346871, "num_tokens": 3013075.0, "step": 900 }, { "entropy": 7.553641653060913, "epoch": 0.17656813969368843, "grad_norm": 1.1015625, "learning_rate": 0.00045200000000000004, "loss": 7.4995, "mean_token_accuracy": 0.10074936151504517, "num_tokens": 3029494.0, "step": 905 }, { "entropy": 7.493304920196533, "epoch": 0.17754365427763144, "grad_norm": 0.859375, "learning_rate": 0.00045450000000000004, "loss": 7.5081, "mean_token_accuracy": 0.10531372874975205, "num_tokens": 3046333.0, "step": 910 }, { "entropy": 7.5904456615448, "epoch": 0.17851916886157448, "grad_norm": 0.87890625, "learning_rate": 0.00045700000000000005, "loss": 7.4867, "mean_token_accuracy": 0.10380415394902229, "num_tokens": 3062714.0, "step": 915 }, { "entropy": 7.521370792388916, "epoch": 0.1794946834455175, "grad_norm": 0.86328125, "learning_rate": 0.00045950000000000006, "loss": 7.4754, "mean_token_accuracy": 0.10096871256828308, "num_tokens": 3080711.0, "step": 920 }, { "entropy": 7.505842781066894, "epoch": 0.18047019802946054, "grad_norm": 0.953125, "learning_rate": 0.000462, "loss": 7.5654, "mean_token_accuracy": 0.09803933352231979, "num_tokens": 3096885.0, "step": 925 }, { "entropy": 7.509501171112061, "epoch": 0.18144571261340356, "grad_norm": 1.03125, "learning_rate": 0.0004645, "loss": 7.4553, "mean_token_accuracy": 0.10695251300930977, "num_tokens": 3114536.0, "step": 930 }, { "entropy": 7.500088119506836, "epoch": 0.1824212271973466, "grad_norm": 0.79296875, "learning_rate": 0.000467, "loss": 7.4054, "mean_token_accuracy": 0.11017186567187309, "num_tokens": 3131921.0, "step": 935 }, { "entropy": 7.524385738372803, "epoch": 0.18339674178128962, "grad_norm": 0.98046875, "learning_rate": 0.0004695, "loss": 7.5662, "mean_token_accuracy": 0.09947125390172004, "num_tokens": 3148064.0, "step": 940 }, { "entropy": 7.416093254089356, "epoch": 0.18437225636523266, "grad_norm": 0.8046875, "learning_rate": 0.000472, "loss": 7.3813, "mean_token_accuracy": 0.11295887902379036, "num_tokens": 3165822.0, "step": 945 }, { "entropy": 7.466145849227905, "epoch": 0.18534777094917568, "grad_norm": 1.2421875, "learning_rate": 0.0004745, "loss": 7.4716, "mean_token_accuracy": 0.10708810836076736, "num_tokens": 3183286.0, "step": 950 }, { "entropy": 7.5944517135620115, "epoch": 0.18632328553311872, "grad_norm": 1.0234375, "learning_rate": 0.000477, "loss": 7.5058, "mean_token_accuracy": 0.10114045292139054, "num_tokens": 3198522.0, "step": 955 }, { "entropy": 7.4455090999603275, "epoch": 0.18729880011706174, "grad_norm": 1.1171875, "learning_rate": 0.0004795, "loss": 7.5287, "mean_token_accuracy": 0.10372934117913246, "num_tokens": 3218422.0, "step": 960 }, { "entropy": 7.534113931655884, "epoch": 0.18827431470100478, "grad_norm": 0.8828125, "learning_rate": 0.000482, "loss": 7.5642, "mean_token_accuracy": 0.09645498842000962, "num_tokens": 3236407.0, "step": 965 }, { "entropy": 7.551708793640136, "epoch": 0.18924982928494782, "grad_norm": 1.078125, "learning_rate": 0.0004845, "loss": 7.4922, "mean_token_accuracy": 0.10387791618704796, "num_tokens": 3252740.0, "step": 970 }, { "entropy": 7.470359468460083, "epoch": 0.19022534386889084, "grad_norm": 0.84765625, "learning_rate": 0.000487, "loss": 7.4286, "mean_token_accuracy": 0.10193498730659485, "num_tokens": 3269874.0, "step": 975 }, { "entropy": 7.435076713562012, "epoch": 0.19120085845283388, "grad_norm": 0.9921875, "learning_rate": 0.0004895, "loss": 7.502, "mean_token_accuracy": 0.10077228620648385, "num_tokens": 3286515.0, "step": 980 }, { "entropy": 7.378189039230347, "epoch": 0.1921763730367769, "grad_norm": 1.7421875, "learning_rate": 0.000492, "loss": 7.2799, "mean_token_accuracy": 0.12222360447049141, "num_tokens": 3303700.0, "step": 985 }, { "entropy": 7.442311334609985, "epoch": 0.19315188762071994, "grad_norm": 0.890625, "learning_rate": 0.0004945, "loss": 7.4712, "mean_token_accuracy": 0.10699821785092353, "num_tokens": 3319768.0, "step": 990 }, { "entropy": 7.479348468780517, "epoch": 0.19412740220466296, "grad_norm": 1.1328125, "learning_rate": 0.000497, "loss": 7.3723, "mean_token_accuracy": 0.1109627477824688, "num_tokens": 3336555.0, "step": 995 }, { "entropy": 7.386620044708252, "epoch": 0.195102916788606, "grad_norm": 0.828125, "learning_rate": 0.0004995, "loss": 7.4026, "mean_token_accuracy": 0.10794939920306205, "num_tokens": 3353273.0, "step": 1000 }, { "entropy": 7.3974672794342045, "epoch": 0.19607843137254902, "grad_norm": 0.84375, "learning_rate": 0.0004999999929644166, "loss": 7.2766, "mean_token_accuracy": 0.11775518953800201, "num_tokens": 3369408.0, "step": 1005 }, { "entropy": 7.376392459869384, "epoch": 0.19705394595649206, "grad_norm": 0.8671875, "learning_rate": 0.0004999999643823598, "loss": 7.332, "mean_token_accuracy": 0.11445832625031471, "num_tokens": 3385834.0, "step": 1010 }, { "entropy": 7.386595392227173, "epoch": 0.19802946054043508, "grad_norm": 0.91015625, "learning_rate": 0.0004999999138141084, "loss": 7.4388, "mean_token_accuracy": 0.10919031649827957, "num_tokens": 3401407.0, "step": 1015 }, { "entropy": 7.5447615623474125, "epoch": 0.19900497512437812, "grad_norm": 0.828125, "learning_rate": 0.0004999998412596673, "loss": 7.4617, "mean_token_accuracy": 0.10121053159236908, "num_tokens": 3418256.0, "step": 1020 }, { "entropy": 7.328778457641602, "epoch": 0.19998048970832114, "grad_norm": 0.96484375, "learning_rate": 0.0004999997467190435, "loss": 7.4308, "mean_token_accuracy": 0.10942661762237549, "num_tokens": 3433932.0, "step": 1025 }, { "entropy": 7.4000791072845455, "epoch": 0.20095600429226418, "grad_norm": 0.890625, "learning_rate": 0.0004999996301922465, "loss": 7.464, "mean_token_accuracy": 0.09955221861600876, "num_tokens": 3451723.0, "step": 1030 }, { "entropy": 7.486557340621948, "epoch": 0.2019315188762072, "grad_norm": 0.9140625, "learning_rate": 0.0004999994916792876, "loss": 7.4268, "mean_token_accuracy": 0.10579116493463517, "num_tokens": 3469170.0, "step": 1035 }, { "entropy": 7.439934206008911, "epoch": 0.20290703346015024, "grad_norm": 0.84765625, "learning_rate": 0.0004999993311801802, "loss": 7.4632, "mean_token_accuracy": 0.10232352912425995, "num_tokens": 3485282.0, "step": 1040 }, { "entropy": 7.457415437698364, "epoch": 0.20388254804409325, "grad_norm": 0.88671875, "learning_rate": 0.00049999914869494, "loss": 7.449, "mean_token_accuracy": 0.09637642353773117, "num_tokens": 3502206.0, "step": 1045 }, { "entropy": 7.423295640945435, "epoch": 0.2048580626280363, "grad_norm": 0.85546875, "learning_rate": 0.000499998944223585, "loss": 7.391, "mean_token_accuracy": 0.10561487749218941, "num_tokens": 3520384.0, "step": 1050 }, { "entropy": 7.305895376205444, "epoch": 0.2058335772119793, "grad_norm": 0.80078125, "learning_rate": 0.0004999987177661351, "loss": 7.389, "mean_token_accuracy": 0.10617925822734833, "num_tokens": 3536314.0, "step": 1055 }, { "entropy": 7.391325521469116, "epoch": 0.20680909179592236, "grad_norm": 0.875, "learning_rate": 0.0004999984693226124, "loss": 7.3376, "mean_token_accuracy": 0.11349749490618706, "num_tokens": 3551510.0, "step": 1060 }, { "entropy": 7.388658809661865, "epoch": 0.20778460637986537, "grad_norm": 0.93359375, "learning_rate": 0.0004999981988930411, "loss": 7.3434, "mean_token_accuracy": 0.11000111326575279, "num_tokens": 3568515.0, "step": 1065 }, { "entropy": 7.3375438213348385, "epoch": 0.20876012096380842, "grad_norm": 0.86328125, "learning_rate": 0.0004999979064774478, "loss": 7.3821, "mean_token_accuracy": 0.11078001037240029, "num_tokens": 3585183.0, "step": 1070 }, { "entropy": 7.363852548599243, "epoch": 0.20973563554775143, "grad_norm": 1.2734375, "learning_rate": 0.000499997592075861, "loss": 7.3389, "mean_token_accuracy": 0.11243807971477508, "num_tokens": 3601898.0, "step": 1075 }, { "entropy": 7.434067678451538, "epoch": 0.21071115013169447, "grad_norm": 0.9921875, "learning_rate": 0.0004999972556883113, "loss": 7.3884, "mean_token_accuracy": 0.10824741944670677, "num_tokens": 3616699.0, "step": 1080 }, { "entropy": 7.355287313461304, "epoch": 0.2116866647156375, "grad_norm": 0.87109375, "learning_rate": 0.0004999968973148318, "loss": 7.4124, "mean_token_accuracy": 0.10511938706040383, "num_tokens": 3634030.0, "step": 1085 }, { "entropy": 7.44262728691101, "epoch": 0.21266217929958053, "grad_norm": 0.80078125, "learning_rate": 0.0004999965169554573, "loss": 7.4147, "mean_token_accuracy": 0.10464555099606514, "num_tokens": 3650495.0, "step": 1090 }, { "entropy": 7.384248971939087, "epoch": 0.21363769388352355, "grad_norm": 0.91796875, "learning_rate": 0.0004999961146102251, "loss": 7.3562, "mean_token_accuracy": 0.1107444167137146, "num_tokens": 3666926.0, "step": 1095 }, { "entropy": 7.320687627792358, "epoch": 0.2146132084674666, "grad_norm": 0.81640625, "learning_rate": 0.0004999956902791746, "loss": 7.3405, "mean_token_accuracy": 0.11776096150279045, "num_tokens": 3683061.0, "step": 1100 }, { "entropy": 7.306242418289185, "epoch": 0.2155887230514096, "grad_norm": 0.75, "learning_rate": 0.0004999952439623469, "loss": 7.4162, "mean_token_accuracy": 0.10687667801976204, "num_tokens": 3703013.0, "step": 1105 }, { "entropy": 7.352738571166992, "epoch": 0.21656423763535265, "grad_norm": 0.8828125, "learning_rate": 0.000499994775659786, "loss": 7.2601, "mean_token_accuracy": 0.11846758648753167, "num_tokens": 3719885.0, "step": 1110 }, { "entropy": 7.383596754074096, "epoch": 0.21753975221929567, "grad_norm": 0.9140625, "learning_rate": 0.0004999942853715375, "loss": 7.4022, "mean_token_accuracy": 0.10562850683927535, "num_tokens": 3735122.0, "step": 1115 }, { "entropy": 7.362527561187744, "epoch": 0.2185152668032387, "grad_norm": 0.8046875, "learning_rate": 0.0004999937730976494, "loss": 7.3778, "mean_token_accuracy": 0.10143291056156159, "num_tokens": 3751627.0, "step": 1120 }, { "entropy": 7.2828888416290285, "epoch": 0.21949078138718173, "grad_norm": 0.94140625, "learning_rate": 0.0004999932388381716, "loss": 7.3892, "mean_token_accuracy": 0.10415156185626984, "num_tokens": 3768165.0, "step": 1125 }, { "entropy": 7.505846929550171, "epoch": 0.22046629597112477, "grad_norm": 0.9296875, "learning_rate": 0.0004999926825931564, "loss": 7.4244, "mean_token_accuracy": 0.10518527254462243, "num_tokens": 3784245.0, "step": 1130 }, { "entropy": 7.223800945281982, "epoch": 0.2214418105550678, "grad_norm": 0.8359375, "learning_rate": 0.0004999921043626582, "loss": 7.1589, "mean_token_accuracy": 0.12127066403627396, "num_tokens": 3802057.0, "step": 1135 }, { "entropy": 7.311485624313354, "epoch": 0.22241732513901083, "grad_norm": 0.94140625, "learning_rate": 0.0004999915041467333, "loss": 7.3624, "mean_token_accuracy": 0.10803040713071824, "num_tokens": 3817104.0, "step": 1140 }, { "entropy": 7.385139131546021, "epoch": 0.22339283972295385, "grad_norm": 0.80078125, "learning_rate": 0.0004999908819454407, "loss": 7.3468, "mean_token_accuracy": 0.10780640989542008, "num_tokens": 3833037.0, "step": 1145 }, { "entropy": 7.259801578521729, "epoch": 0.2243683543068969, "grad_norm": 0.8515625, "learning_rate": 0.0004999902377588408, "loss": 7.2262, "mean_token_accuracy": 0.11170127764344215, "num_tokens": 3849634.0, "step": 1150 }, { "entropy": 7.339283418655396, "epoch": 0.2253438688908399, "grad_norm": 0.89453125, "learning_rate": 0.000499989571586997, "loss": 7.4162, "mean_token_accuracy": 0.10458956733345985, "num_tokens": 3865949.0, "step": 1155 }, { "entropy": 7.189256191253662, "epoch": 0.22631938347478295, "grad_norm": 0.8515625, "learning_rate": 0.0004999888834299739, "loss": 7.2902, "mean_token_accuracy": 0.11521978452801704, "num_tokens": 3884646.0, "step": 1160 }, { "entropy": 7.392727613449097, "epoch": 0.227294898058726, "grad_norm": 0.8984375, "learning_rate": 0.0004999881732878391, "loss": 7.3759, "mean_token_accuracy": 0.10717562288045883, "num_tokens": 3900740.0, "step": 1165 }, { "entropy": 7.320269823074341, "epoch": 0.228270412642669, "grad_norm": 0.86328125, "learning_rate": 0.0004999874411606618, "loss": 7.3326, "mean_token_accuracy": 0.11450612768530846, "num_tokens": 3918619.0, "step": 1170 }, { "entropy": 7.379632997512817, "epoch": 0.22924592722661205, "grad_norm": 0.8671875, "learning_rate": 0.0004999866870485137, "loss": 7.3004, "mean_token_accuracy": 0.11032224223017692, "num_tokens": 3938161.0, "step": 1175 }, { "entropy": 7.34798526763916, "epoch": 0.23022144181055507, "grad_norm": 0.94921875, "learning_rate": 0.0004999859109514684, "loss": 7.3542, "mean_token_accuracy": 0.10768297165632248, "num_tokens": 3953582.0, "step": 1180 }, { "entropy": 7.30758113861084, "epoch": 0.2311969563944981, "grad_norm": 0.8125, "learning_rate": 0.0004999851128696017, "loss": 7.3213, "mean_token_accuracy": 0.1020158052444458, "num_tokens": 3969747.0, "step": 1185 }, { "entropy": 7.3781046867370605, "epoch": 0.23217247097844113, "grad_norm": 0.859375, "learning_rate": 0.0004999842928029917, "loss": 7.3586, "mean_token_accuracy": 0.10794111490249633, "num_tokens": 3984646.0, "step": 1190 }, { "entropy": 7.299358987808228, "epoch": 0.23314798556238417, "grad_norm": 0.85546875, "learning_rate": 0.0004999834507517184, "loss": 7.3486, "mean_token_accuracy": 0.10666156932711601, "num_tokens": 4003108.0, "step": 1195 }, { "entropy": 7.3120873928070065, "epoch": 0.23412350014632718, "grad_norm": 0.875, "learning_rate": 0.0004999825867158642, "loss": 7.4151, "mean_token_accuracy": 0.1019670806825161, "num_tokens": 4019944.0, "step": 1200 }, { "entropy": 7.3608317375183105, "epoch": 0.23509901473027023, "grad_norm": 0.8984375, "learning_rate": 0.0004999817006955134, "loss": 7.2993, "mean_token_accuracy": 0.1109683245420456, "num_tokens": 4037617.0, "step": 1205 }, { "entropy": 7.282232141494751, "epoch": 0.23607452931421324, "grad_norm": 0.84765625, "learning_rate": 0.0004999807926907527, "loss": 7.2855, "mean_token_accuracy": 0.10396898314356803, "num_tokens": 4053483.0, "step": 1210 }, { "entropy": 7.354314088821411, "epoch": 0.2370500438981563, "grad_norm": 0.85546875, "learning_rate": 0.0004999798627016707, "loss": 7.3621, "mean_token_accuracy": 0.10965256318449974, "num_tokens": 4070165.0, "step": 1215 }, { "entropy": 7.324768304824829, "epoch": 0.2380255584820993, "grad_norm": 0.890625, "learning_rate": 0.0004999789107283586, "loss": 7.3414, "mean_token_accuracy": 0.10487294420599938, "num_tokens": 4086208.0, "step": 1220 }, { "entropy": 7.26507248878479, "epoch": 0.23900107306604235, "grad_norm": 0.89453125, "learning_rate": 0.000499977936770909, "loss": 7.303, "mean_token_accuracy": 0.11123988702893257, "num_tokens": 4101790.0, "step": 1225 }, { "entropy": 7.320441770553589, "epoch": 0.23997658764998536, "grad_norm": 0.90234375, "learning_rate": 0.0004999769408294173, "loss": 7.2266, "mean_token_accuracy": 0.11657417044043542, "num_tokens": 4117633.0, "step": 1230 }, { "entropy": 7.265048789978027, "epoch": 0.2409521022339284, "grad_norm": 0.8203125, "learning_rate": 0.0004999759229039807, "loss": 7.3035, "mean_token_accuracy": 0.11276578083634377, "num_tokens": 4132634.0, "step": 1235 }, { "entropy": 7.320464944839477, "epoch": 0.24192761681787142, "grad_norm": 0.77734375, "learning_rate": 0.0004999748829946988, "loss": 7.3391, "mean_token_accuracy": 0.10908927693963051, "num_tokens": 4150702.0, "step": 1240 }, { "entropy": 7.26134147644043, "epoch": 0.24290313140181446, "grad_norm": 0.86328125, "learning_rate": 0.0004999738211016732, "loss": 7.2057, "mean_token_accuracy": 0.12152880877256393, "num_tokens": 4168483.0, "step": 1245 }, { "entropy": 7.158234167098999, "epoch": 0.24387864598575748, "grad_norm": 0.84375, "learning_rate": 0.0004999727372250076, "loss": 7.1701, "mean_token_accuracy": 0.11431463360786438, "num_tokens": 4186199.0, "step": 1250 }, { "entropy": 7.278416919708252, "epoch": 0.24485416056970052, "grad_norm": 0.8828125, "learning_rate": 0.0004999716313648079, "loss": 7.3169, "mean_token_accuracy": 0.1068569652736187, "num_tokens": 4202303.0, "step": 1255 }, { "entropy": 7.338901853561401, "epoch": 0.24582967515364354, "grad_norm": 0.90625, "learning_rate": 0.0004999705035211822, "loss": 7.3571, "mean_token_accuracy": 0.10634541511535645, "num_tokens": 4218541.0, "step": 1260 }, { "entropy": 7.319312906265258, "epoch": 0.24680518973758658, "grad_norm": 0.8984375, "learning_rate": 0.0004999693536942406, "loss": 7.3192, "mean_token_accuracy": 0.10624103397130966, "num_tokens": 4234025.0, "step": 1265 }, { "entropy": 7.292185544967651, "epoch": 0.2477807043215296, "grad_norm": 1.0546875, "learning_rate": 0.0004999681818840957, "loss": 7.3435, "mean_token_accuracy": 0.10807270258665085, "num_tokens": 4250798.0, "step": 1270 }, { "entropy": 7.286764860153198, "epoch": 0.24875621890547264, "grad_norm": 0.89453125, "learning_rate": 0.000499966988090862, "loss": 7.3177, "mean_token_accuracy": 0.10285230055451393, "num_tokens": 4266453.0, "step": 1275 }, { "entropy": 7.35591869354248, "epoch": 0.24973173348941566, "grad_norm": 1.140625, "learning_rate": 0.0004999657723146558, "loss": 7.2729, "mean_token_accuracy": 0.10762197226285934, "num_tokens": 4281825.0, "step": 1280 }, { "entropy": 7.098993587493896, "epoch": 0.2507072480733587, "grad_norm": 0.81640625, "learning_rate": 0.0004999645345555962, "loss": 7.1453, "mean_token_accuracy": 0.12227144241333007, "num_tokens": 4298821.0, "step": 1285 }, { "entropy": 7.248935031890869, "epoch": 0.2516827626573017, "grad_norm": 0.89453125, "learning_rate": 0.0004999632748138041, "loss": 7.1552, "mean_token_accuracy": 0.11829453259706497, "num_tokens": 4314076.0, "step": 1290 }, { "entropy": 7.217565107345581, "epoch": 0.25265827724124473, "grad_norm": 0.91015625, "learning_rate": 0.0004999619930894025, "loss": 7.1797, "mean_token_accuracy": 0.11851233690977096, "num_tokens": 4330909.0, "step": 1295 }, { "entropy": 7.284217786788941, "epoch": 0.2536337918251878, "grad_norm": 0.8828125, "learning_rate": 0.0004999606893825168, "loss": 7.2681, "mean_token_accuracy": 0.1124707892537117, "num_tokens": 4346927.0, "step": 1300 }, { "entropy": 7.240284633636475, "epoch": 0.2546093064091308, "grad_norm": 0.8203125, "learning_rate": 0.0004999593636932742, "loss": 7.3215, "mean_token_accuracy": 0.10526167303323745, "num_tokens": 4364956.0, "step": 1305 }, { "entropy": 7.290760946273804, "epoch": 0.25558482099307384, "grad_norm": 0.80078125, "learning_rate": 0.0004999580160218044, "loss": 7.2381, "mean_token_accuracy": 0.10958634614944458, "num_tokens": 4383014.0, "step": 1310 }, { "entropy": 7.144275045394897, "epoch": 0.25656033557701685, "grad_norm": 0.80859375, "learning_rate": 0.0004999566463682391, "loss": 7.3101, "mean_token_accuracy": 0.10827136710286141, "num_tokens": 4401050.0, "step": 1315 }, { "entropy": 7.248860025405884, "epoch": 0.2575358501609599, "grad_norm": 0.890625, "learning_rate": 0.0004999552547327119, "loss": 7.2175, "mean_token_accuracy": 0.11122509092092514, "num_tokens": 4415453.0, "step": 1320 }, { "entropy": 7.1784752368927, "epoch": 0.25851136474490294, "grad_norm": 0.80859375, "learning_rate": 0.0004999538411153591, "loss": 7.183, "mean_token_accuracy": 0.11985458731651306, "num_tokens": 4433107.0, "step": 1325 }, { "entropy": 7.25650372505188, "epoch": 0.25948687932884595, "grad_norm": 0.8828125, "learning_rate": 0.0004999524055163187, "loss": 7.2758, "mean_token_accuracy": 0.10543364882469178, "num_tokens": 4449440.0, "step": 1330 }, { "entropy": 7.275032186508179, "epoch": 0.26046239391278897, "grad_norm": 0.86328125, "learning_rate": 0.000499950947935731, "loss": 7.2647, "mean_token_accuracy": 0.10925490632653237, "num_tokens": 4465327.0, "step": 1335 }, { "entropy": 7.2784374237060545, "epoch": 0.26143790849673204, "grad_norm": 0.890625, "learning_rate": 0.0004999494683737384, "loss": 7.2899, "mean_token_accuracy": 0.10701772198081017, "num_tokens": 4481518.0, "step": 1340 }, { "entropy": 7.292396831512451, "epoch": 0.26241342308067506, "grad_norm": 0.8125, "learning_rate": 0.0004999479668304854, "loss": 7.3115, "mean_token_accuracy": 0.10881960839033127, "num_tokens": 4497632.0, "step": 1345 }, { "entropy": 7.030213069915772, "epoch": 0.2633889376646181, "grad_norm": 0.8984375, "learning_rate": 0.0004999464433061188, "loss": 7.0711, "mean_token_accuracy": 0.12342782318592072, "num_tokens": 4513790.0, "step": 1350 }, { "entropy": 7.235921001434326, "epoch": 0.26436445224856114, "grad_norm": 0.84375, "learning_rate": 0.0004999448978007876, "loss": 7.1959, "mean_token_accuracy": 0.11445838510990143, "num_tokens": 4530802.0, "step": 1355 }, { "entropy": 7.2668671131134035, "epoch": 0.26533996683250416, "grad_norm": 0.87109375, "learning_rate": 0.0004999433303146426, "loss": 7.2485, "mean_token_accuracy": 0.10927580818533897, "num_tokens": 4546208.0, "step": 1360 }, { "entropy": 7.22170729637146, "epoch": 0.2663154814164472, "grad_norm": 0.765625, "learning_rate": 0.0004999417408478371, "loss": 7.3095, "mean_token_accuracy": 0.11063284948468208, "num_tokens": 4563753.0, "step": 1365 }, { "entropy": 7.213341140747071, "epoch": 0.2672909960003902, "grad_norm": 1.0, "learning_rate": 0.0004999401294005264, "loss": 7.1897, "mean_token_accuracy": 0.11640307679772377, "num_tokens": 4580274.0, "step": 1370 }, { "entropy": 7.195255708694458, "epoch": 0.26826651058433326, "grad_norm": 0.91015625, "learning_rate": 0.000499938495972868, "loss": 7.2656, "mean_token_accuracy": 0.10936984345316887, "num_tokens": 4596085.0, "step": 1375 }, { "entropy": 7.2880692958831785, "epoch": 0.2692420251682763, "grad_norm": 0.84375, "learning_rate": 0.0004999368405650214, "loss": 7.3116, "mean_token_accuracy": 0.10627636015415191, "num_tokens": 4613258.0, "step": 1380 }, { "entropy": 7.1051576137542725, "epoch": 0.2702175397522193, "grad_norm": 0.80078125, "learning_rate": 0.0004999351631771485, "loss": 7.1188, "mean_token_accuracy": 0.11826564893126487, "num_tokens": 4630128.0, "step": 1385 }, { "entropy": 7.252414560317993, "epoch": 0.2711930543361623, "grad_norm": 0.8125, "learning_rate": 0.0004999334638094131, "loss": 7.1382, "mean_token_accuracy": 0.1179644674062729, "num_tokens": 4646181.0, "step": 1390 }, { "entropy": 7.185850667953491, "epoch": 0.2721685689201054, "grad_norm": 0.859375, "learning_rate": 0.0004999317424619812, "loss": 7.2119, "mean_token_accuracy": 0.10765682607889175, "num_tokens": 4661804.0, "step": 1395 }, { "entropy": 7.16576886177063, "epoch": 0.2731440835040484, "grad_norm": 0.8203125, "learning_rate": 0.0004999299991350212, "loss": 7.1211, "mean_token_accuracy": 0.11724445223808289, "num_tokens": 4678163.0, "step": 1400 }, { "entropy": 7.2082353115081785, "epoch": 0.2741195980879914, "grad_norm": 1.2578125, "learning_rate": 0.0004999282338287034, "loss": 7.1126, "mean_token_accuracy": 0.11289523839950562, "num_tokens": 4695469.0, "step": 1405 }, { "entropy": 7.2161016941070555, "epoch": 0.2750951126719344, "grad_norm": 0.875, "learning_rate": 0.0004999264465432001, "loss": 7.2651, "mean_token_accuracy": 0.1120416909456253, "num_tokens": 4711599.0, "step": 1410 }, { "entropy": 7.22179012298584, "epoch": 0.2760706272558775, "grad_norm": 0.8359375, "learning_rate": 0.0004999246372786862, "loss": 7.2664, "mean_token_accuracy": 0.10617031827569008, "num_tokens": 4728381.0, "step": 1415 }, { "entropy": 7.18099422454834, "epoch": 0.2770461418398205, "grad_norm": 0.8359375, "learning_rate": 0.0004999228060353385, "loss": 7.249, "mean_token_accuracy": 0.10983582735061645, "num_tokens": 4745348.0, "step": 1420 }, { "entropy": 7.252281141281128, "epoch": 0.27802165642376353, "grad_norm": 0.94921875, "learning_rate": 0.0004999209528133357, "loss": 7.2657, "mean_token_accuracy": 0.10274152681231499, "num_tokens": 4763011.0, "step": 1425 }, { "entropy": 7.224287223815918, "epoch": 0.27899717100770655, "grad_norm": 0.9140625, "learning_rate": 0.000499919077612859, "loss": 7.2037, "mean_token_accuracy": 0.1110018789768219, "num_tokens": 4779462.0, "step": 1430 }, { "entropy": 7.078258800506592, "epoch": 0.2799726855916496, "grad_norm": 0.83984375, "learning_rate": 0.0004999171804340917, "loss": 7.1645, "mean_token_accuracy": 0.11882285252213479, "num_tokens": 4796844.0, "step": 1435 }, { "entropy": 7.212335729598999, "epoch": 0.28094820017559263, "grad_norm": 0.8671875, "learning_rate": 0.0004999152612772191, "loss": 7.1761, "mean_token_accuracy": 0.11435465589165687, "num_tokens": 4812851.0, "step": 1440 }, { "entropy": 7.095452976226807, "epoch": 0.28192371475953565, "grad_norm": 1.0546875, "learning_rate": 0.0004999133201424288, "loss": 7.1163, "mean_token_accuracy": 0.11493284702301025, "num_tokens": 4830144.0, "step": 1445 }, { "entropy": 7.22363805770874, "epoch": 0.28289922934347866, "grad_norm": 0.9609375, "learning_rate": 0.0004999113570299105, "loss": 7.2114, "mean_token_accuracy": 0.10577581152319908, "num_tokens": 4846981.0, "step": 1450 }, { "entropy": 7.309843254089356, "epoch": 0.28387474392742174, "grad_norm": 0.78515625, "learning_rate": 0.0004999093719398561, "loss": 7.3844, "mean_token_accuracy": 0.10269515588879585, "num_tokens": 4864404.0, "step": 1455 }, { "entropy": 7.181564807891846, "epoch": 0.28485025851136475, "grad_norm": 0.92578125, "learning_rate": 0.0004999073648724592, "loss": 7.2608, "mean_token_accuracy": 0.10562214255332947, "num_tokens": 4882004.0, "step": 1460 }, { "entropy": 7.243942594528198, "epoch": 0.28582577309530777, "grad_norm": 0.86328125, "learning_rate": 0.0004999053358279164, "loss": 7.1962, "mean_token_accuracy": 0.1058816634118557, "num_tokens": 4899444.0, "step": 1465 }, { "entropy": 7.221729326248169, "epoch": 0.2868012876792508, "grad_norm": 0.8828125, "learning_rate": 0.0004999032848064256, "loss": 7.1964, "mean_token_accuracy": 0.10939600914716721, "num_tokens": 4917214.0, "step": 1470 }, { "entropy": 7.120475912094117, "epoch": 0.28777680226319385, "grad_norm": 1.015625, "learning_rate": 0.0004999012118081875, "loss": 7.2906, "mean_token_accuracy": 0.102950569242239, "num_tokens": 4934534.0, "step": 1475 }, { "entropy": 7.26613483428955, "epoch": 0.28875231684713687, "grad_norm": 0.875, "learning_rate": 0.0004998991168334045, "loss": 7.1991, "mean_token_accuracy": 0.10897819027304649, "num_tokens": 4950740.0, "step": 1480 }, { "entropy": 7.185323762893677, "epoch": 0.2897278314310799, "grad_norm": 0.96484375, "learning_rate": 0.0004998969998822814, "loss": 7.2858, "mean_token_accuracy": 0.1056202620267868, "num_tokens": 4966720.0, "step": 1485 }, { "entropy": 7.229295015335083, "epoch": 0.2907033460150229, "grad_norm": 0.9140625, "learning_rate": 0.0004998948609550249, "loss": 7.1584, "mean_token_accuracy": 0.10480799153447151, "num_tokens": 4982195.0, "step": 1490 }, { "entropy": 7.172478818893433, "epoch": 0.29167886059896597, "grad_norm": 0.95703125, "learning_rate": 0.0004998927000518442, "loss": 7.2806, "mean_token_accuracy": 0.10777373760938644, "num_tokens": 4997487.0, "step": 1495 }, { "entropy": 7.191869068145752, "epoch": 0.292654375182909, "grad_norm": 0.90625, "learning_rate": 0.0004998905171729505, "loss": 7.1667, "mean_token_accuracy": 0.10947065055370331, "num_tokens": 5012913.0, "step": 1500 }, { "entropy": 7.098269653320313, "epoch": 0.293629889766852, "grad_norm": 0.93359375, "learning_rate": 0.0004998883123185568, "loss": 7.1303, "mean_token_accuracy": 0.11931669116020202, "num_tokens": 5031462.0, "step": 1505 }, { "entropy": 7.170979738235474, "epoch": 0.294605404350795, "grad_norm": 0.94921875, "learning_rate": 0.0004998860854888788, "loss": 7.1056, "mean_token_accuracy": 0.11914367899298668, "num_tokens": 5047354.0, "step": 1510 }, { "entropy": 7.102825689315796, "epoch": 0.2955809189347381, "grad_norm": 0.765625, "learning_rate": 0.0004998838366841341, "loss": 7.1882, "mean_token_accuracy": 0.11276983618736267, "num_tokens": 5065268.0, "step": 1515 }, { "entropy": 7.182042598724365, "epoch": 0.2965564335186811, "grad_norm": 0.91015625, "learning_rate": 0.0004998815659045423, "loss": 7.1841, "mean_token_accuracy": 0.10845357850193978, "num_tokens": 5081066.0, "step": 1520 }, { "entropy": 7.147319793701172, "epoch": 0.2975319481026241, "grad_norm": 0.8046875, "learning_rate": 0.0004998792731503254, "loss": 7.2147, "mean_token_accuracy": 0.11445605456829071, "num_tokens": 5099440.0, "step": 1525 }, { "entropy": 7.120917463302613, "epoch": 0.29850746268656714, "grad_norm": 0.890625, "learning_rate": 0.0004998769584217074, "loss": 7.1576, "mean_token_accuracy": 0.11984050646424294, "num_tokens": 5116573.0, "step": 1530 }, { "entropy": 7.006188821792603, "epoch": 0.2994829772705102, "grad_norm": 0.86328125, "learning_rate": 0.0004998746217189145, "loss": 6.9406, "mean_token_accuracy": 0.12909065559506416, "num_tokens": 5132920.0, "step": 1535 }, { "entropy": 7.300417137145996, "epoch": 0.3004584918544532, "grad_norm": 0.83203125, "learning_rate": 0.000499872263042175, "loss": 7.2107, "mean_token_accuracy": 0.10663213208317757, "num_tokens": 5150681.0, "step": 1540 }, { "entropy": 6.995895576477051, "epoch": 0.30143400643839624, "grad_norm": 0.9140625, "learning_rate": 0.0004998698823917196, "loss": 6.9672, "mean_token_accuracy": 0.12855525091290473, "num_tokens": 5167473.0, "step": 1545 }, { "entropy": 7.170604419708252, "epoch": 0.3024095210223393, "grad_norm": 0.7734375, "learning_rate": 0.0004998674797677805, "loss": 7.2533, "mean_token_accuracy": 0.1055234856903553, "num_tokens": 5183847.0, "step": 1550 }, { "entropy": 7.117762517929077, "epoch": 0.3033850356062823, "grad_norm": 0.8984375, "learning_rate": 0.0004998650551705929, "loss": 7.2047, "mean_token_accuracy": 0.10641410052776337, "num_tokens": 5200019.0, "step": 1555 }, { "entropy": 7.073120164871216, "epoch": 0.30436055019022534, "grad_norm": 1.1796875, "learning_rate": 0.0004998626086003934, "loss": 7.074, "mean_token_accuracy": 0.11620460152626037, "num_tokens": 5217245.0, "step": 1560 }, { "entropy": 7.112638330459594, "epoch": 0.30533606477416836, "grad_norm": 0.75, "learning_rate": 0.0004998601400574213, "loss": 6.9782, "mean_token_accuracy": 0.12163180261850357, "num_tokens": 5234822.0, "step": 1565 }, { "entropy": 7.115424585342407, "epoch": 0.30631157935811143, "grad_norm": 0.96484375, "learning_rate": 0.0004998576495419177, "loss": 7.1305, "mean_token_accuracy": 0.11187227442860603, "num_tokens": 5251282.0, "step": 1570 }, { "entropy": 7.066088104248047, "epoch": 0.30728709394205445, "grad_norm": 0.77734375, "learning_rate": 0.000499855137054126, "loss": 7.0935, "mean_token_accuracy": 0.11060698553919793, "num_tokens": 5269630.0, "step": 1575 }, { "entropy": 7.150989151000976, "epoch": 0.30826260852599746, "grad_norm": 0.94140625, "learning_rate": 0.0004998526025942917, "loss": 7.1563, "mean_token_accuracy": 0.11012233942747116, "num_tokens": 5287106.0, "step": 1580 }, { "entropy": 7.177860069274902, "epoch": 0.3092381231099405, "grad_norm": 0.875, "learning_rate": 0.0004998500461626625, "loss": 7.1918, "mean_token_accuracy": 0.10584679394960403, "num_tokens": 5303387.0, "step": 1585 }, { "entropy": 7.231128740310669, "epoch": 0.31021363769388355, "grad_norm": 0.79296875, "learning_rate": 0.000499847467759488, "loss": 7.1797, "mean_token_accuracy": 0.10859874933958054, "num_tokens": 5320482.0, "step": 1590 }, { "entropy": 7.100463199615478, "epoch": 0.31118915227782656, "grad_norm": 0.84765625, "learning_rate": 0.0004998448673850205, "loss": 7.1404, "mean_token_accuracy": 0.11622472479939461, "num_tokens": 5336420.0, "step": 1595 }, { "entropy": 7.01635103225708, "epoch": 0.3121646668617696, "grad_norm": 0.921875, "learning_rate": 0.0004998422450395139, "loss": 7.0872, "mean_token_accuracy": 0.11045913249254227, "num_tokens": 5353464.0, "step": 1600 }, { "entropy": 7.137714147567749, "epoch": 0.3131401814457126, "grad_norm": 0.8828125, "learning_rate": 0.0004998396007232244, "loss": 7.1475, "mean_token_accuracy": 0.1154401995241642, "num_tokens": 5372607.0, "step": 1605 }, { "entropy": 7.122408390045166, "epoch": 0.31411569602965567, "grad_norm": 0.92578125, "learning_rate": 0.0004998369344364105, "loss": 7.1723, "mean_token_accuracy": 0.11676934882998466, "num_tokens": 5390134.0, "step": 1610 }, { "entropy": 7.0988771438598635, "epoch": 0.3150912106135987, "grad_norm": 0.8125, "learning_rate": 0.0004998342461793328, "loss": 7.0821, "mean_token_accuracy": 0.1153003416955471, "num_tokens": 5407083.0, "step": 1615 }, { "entropy": 6.936686992645264, "epoch": 0.3160667251975417, "grad_norm": 0.93359375, "learning_rate": 0.0004998315359522538, "loss": 6.9746, "mean_token_accuracy": 0.12812903001904488, "num_tokens": 5424617.0, "step": 1620 }, { "entropy": 7.118428945541382, "epoch": 0.3170422397814847, "grad_norm": 0.84765625, "learning_rate": 0.0004998288037554383, "loss": 7.1248, "mean_token_accuracy": 0.12060828432440758, "num_tokens": 5440913.0, "step": 1625 }, { "entropy": 7.1336418151855465, "epoch": 0.3180177543654278, "grad_norm": 0.83984375, "learning_rate": 0.0004998260495891535, "loss": 7.1488, "mean_token_accuracy": 0.11536478698253631, "num_tokens": 5457157.0, "step": 1630 }, { "entropy": 7.052104187011719, "epoch": 0.3189932689493708, "grad_norm": 0.73828125, "learning_rate": 0.0004998232734536685, "loss": 7.0581, "mean_token_accuracy": 0.11604453399777412, "num_tokens": 5474520.0, "step": 1635 }, { "entropy": 7.146209955215454, "epoch": 0.3199687835333138, "grad_norm": 1.0546875, "learning_rate": 0.0004998204753492544, "loss": 7.1398, "mean_token_accuracy": 0.11600466221570968, "num_tokens": 5490599.0, "step": 1640 }, { "entropy": 7.127297306060791, "epoch": 0.32094429811725683, "grad_norm": 0.875, "learning_rate": 0.0004998176552761848, "loss": 7.2087, "mean_token_accuracy": 0.10203930661082268, "num_tokens": 5506714.0, "step": 1645 }, { "entropy": 7.160216569900513, "epoch": 0.3219198127011999, "grad_norm": 0.84765625, "learning_rate": 0.0004998148132347352, "loss": 7.1485, "mean_token_accuracy": 0.10920300856232643, "num_tokens": 5522894.0, "step": 1650 }, { "entropy": 7.043737173080444, "epoch": 0.3228953272851429, "grad_norm": 0.79296875, "learning_rate": 0.0004998119492251832, "loss": 7.0243, "mean_token_accuracy": 0.12240474671125412, "num_tokens": 5540054.0, "step": 1655 }, { "entropy": 7.168790626525879, "epoch": 0.32387084186908593, "grad_norm": 0.95703125, "learning_rate": 0.0004998090632478088, "loss": 7.1947, "mean_token_accuracy": 0.10093299672007561, "num_tokens": 5556189.0, "step": 1660 }, { "entropy": 7.159790563583374, "epoch": 0.32484635645302895, "grad_norm": 0.82421875, "learning_rate": 0.000499806155302894, "loss": 7.2081, "mean_token_accuracy": 0.10658285319805146, "num_tokens": 5572562.0, "step": 1665 }, { "entropy": 7.182238483428955, "epoch": 0.325821871036972, "grad_norm": 0.8125, "learning_rate": 0.000499803225390723, "loss": 7.188, "mean_token_accuracy": 0.11000551506876946, "num_tokens": 5588992.0, "step": 1670 }, { "entropy": 7.151162958145141, "epoch": 0.32679738562091504, "grad_norm": 0.83203125, "learning_rate": 0.0004998002735115819, "loss": 7.1148, "mean_token_accuracy": 0.11034396961331368, "num_tokens": 5604143.0, "step": 1675 }, { "entropy": 7.119655466079712, "epoch": 0.32777290020485805, "grad_norm": 0.87890625, "learning_rate": 0.0004997972996657593, "loss": 7.2398, "mean_token_accuracy": 0.10105421096086502, "num_tokens": 5620887.0, "step": 1680 }, { "entropy": 7.158847618103027, "epoch": 0.32874841478880107, "grad_norm": 0.9140625, "learning_rate": 0.0004997943038535459, "loss": 7.1709, "mean_token_accuracy": 0.1110181026160717, "num_tokens": 5637156.0, "step": 1685 }, { "entropy": 7.153251838684082, "epoch": 0.32972392937274414, "grad_norm": 0.7578125, "learning_rate": 0.0004997912860752341, "loss": 7.1217, "mean_token_accuracy": 0.10916642993688583, "num_tokens": 5654024.0, "step": 1690 }, { "entropy": 7.088912582397461, "epoch": 0.33069944395668716, "grad_norm": 1.1328125, "learning_rate": 0.0004997882463311192, "loss": 7.062, "mean_token_accuracy": 0.11368629187345505, "num_tokens": 5671538.0, "step": 1695 }, { "entropy": 7.089573669433594, "epoch": 0.33167495854063017, "grad_norm": 0.83984375, "learning_rate": 0.0004997851846214979, "loss": 7.1212, "mean_token_accuracy": 0.11628169491887093, "num_tokens": 5688788.0, "step": 1700 }, { "entropy": 7.056381750106811, "epoch": 0.3326504731245732, "grad_norm": 0.76171875, "learning_rate": 0.0004997821009466695, "loss": 7.0529, "mean_token_accuracy": 0.11595623269677162, "num_tokens": 5706066.0, "step": 1705 }, { "entropy": 7.03841462135315, "epoch": 0.33362598770851626, "grad_norm": 0.99609375, "learning_rate": 0.0004997789953069354, "loss": 7.0434, "mean_token_accuracy": 0.11439799889922142, "num_tokens": 5722100.0, "step": 1710 }, { "entropy": 7.124280977249145, "epoch": 0.3346015022924593, "grad_norm": 0.76171875, "learning_rate": 0.0004997758677025989, "loss": 7.1696, "mean_token_accuracy": 0.10830180943012238, "num_tokens": 5739068.0, "step": 1715 }, { "entropy": 7.088494777679443, "epoch": 0.3355770168764023, "grad_norm": 0.7578125, "learning_rate": 0.0004997727181339658, "loss": 7.1296, "mean_token_accuracy": 0.11222045645117759, "num_tokens": 5756147.0, "step": 1720 }, { "entropy": 7.158913946151733, "epoch": 0.3365525314603453, "grad_norm": 0.8359375, "learning_rate": 0.0004997695466013438, "loss": 7.1013, "mean_token_accuracy": 0.11348066926002502, "num_tokens": 5772157.0, "step": 1725 }, { "entropy": 7.1085058689117435, "epoch": 0.3375280460442884, "grad_norm": 0.8984375, "learning_rate": 0.0004997663531050427, "loss": 7.133, "mean_token_accuracy": 0.11211565360426903, "num_tokens": 5788128.0, "step": 1730 }, { "entropy": 7.048029518127441, "epoch": 0.3385035606282314, "grad_norm": 0.90625, "learning_rate": 0.0004997631376453749, "loss": 7.117, "mean_token_accuracy": 0.11303148567676544, "num_tokens": 5804793.0, "step": 1735 }, { "entropy": 7.091092491149903, "epoch": 0.3394790752121744, "grad_norm": 0.87890625, "learning_rate": 0.0004997599002226541, "loss": 7.0445, "mean_token_accuracy": 0.11384404823184013, "num_tokens": 5822409.0, "step": 1740 }, { "entropy": 6.988621425628662, "epoch": 0.3404545897961175, "grad_norm": 1.0234375, "learning_rate": 0.000499756640837197, "loss": 7.0837, "mean_token_accuracy": 0.11030225455760956, "num_tokens": 5839023.0, "step": 1745 }, { "entropy": 7.136508464813232, "epoch": 0.3414301043800605, "grad_norm": 0.85546875, "learning_rate": 0.000499753359489322, "loss": 7.1018, "mean_token_accuracy": 0.10952565595507621, "num_tokens": 5855804.0, "step": 1750 }, { "entropy": 7.064236307144165, "epoch": 0.3424056189640035, "grad_norm": 0.86328125, "learning_rate": 0.0004997500561793498, "loss": 7.1143, "mean_token_accuracy": 0.11261064410209656, "num_tokens": 5872372.0, "step": 1755 }, { "entropy": 7.140656232833862, "epoch": 0.3433811335479465, "grad_norm": 0.80859375, "learning_rate": 0.0004997467309076031, "loss": 7.1523, "mean_token_accuracy": 0.1071063719689846, "num_tokens": 5888666.0, "step": 1760 }, { "entropy": 6.9952013969421385, "epoch": 0.3443566481318896, "grad_norm": 0.84765625, "learning_rate": 0.0004997433836744069, "loss": 7.0905, "mean_token_accuracy": 0.1121178537607193, "num_tokens": 5905577.0, "step": 1765 }, { "entropy": 7.113792610168457, "epoch": 0.3453321627158326, "grad_norm": 0.9609375, "learning_rate": 0.0004997400144800882, "loss": 7.065, "mean_token_accuracy": 0.11290777698159218, "num_tokens": 5922570.0, "step": 1770 }, { "entropy": 6.972097253799438, "epoch": 0.34630767729977563, "grad_norm": 1.0078125, "learning_rate": 0.0004997366233249762, "loss": 7.0204, "mean_token_accuracy": 0.12438111305236817, "num_tokens": 5938995.0, "step": 1775 }, { "entropy": 7.042465877532959, "epoch": 0.34728319188371864, "grad_norm": 0.83203125, "learning_rate": 0.0004997332102094024, "loss": 7.0303, "mean_token_accuracy": 0.1208010382950306, "num_tokens": 5954869.0, "step": 1780 }, { "entropy": 7.181672048568726, "epoch": 0.3482587064676617, "grad_norm": 0.8515625, "learning_rate": 0.0004997297751337004, "loss": 7.1467, "mean_token_accuracy": 0.11480126529932022, "num_tokens": 5972750.0, "step": 1785 }, { "entropy": 7.021099853515625, "epoch": 0.34923422105160473, "grad_norm": 0.8515625, "learning_rate": 0.0004997263180982055, "loss": 7.0622, "mean_token_accuracy": 0.11614978462457656, "num_tokens": 5989004.0, "step": 1790 }, { "entropy": 7.017993831634522, "epoch": 0.35020973563554775, "grad_norm": 0.81640625, "learning_rate": 0.0004997228391032559, "loss": 7.0776, "mean_token_accuracy": 0.11161015629768371, "num_tokens": 6004749.0, "step": 1795 }, { "entropy": 6.965499401092529, "epoch": 0.35118525021949076, "grad_norm": 0.83203125, "learning_rate": 0.0004997193381491913, "loss": 6.9504, "mean_token_accuracy": 0.11921020373702049, "num_tokens": 6022235.0, "step": 1800 }, { "entropy": 7.04525671005249, "epoch": 0.35216076480343383, "grad_norm": 0.83984375, "learning_rate": 0.000499715815236354, "loss": 7.1238, "mean_token_accuracy": 0.10555350333452225, "num_tokens": 6039194.0, "step": 1805 }, { "entropy": 7.0818140506744385, "epoch": 0.35313627938737685, "grad_norm": 0.7890625, "learning_rate": 0.000499712270365088, "loss": 6.9903, "mean_token_accuracy": 0.11186902597546577, "num_tokens": 6055376.0, "step": 1810 }, { "entropy": 7.07976222038269, "epoch": 0.35411179397131987, "grad_norm": 0.80859375, "learning_rate": 0.0004997087035357398, "loss": 7.0482, "mean_token_accuracy": 0.1155602365732193, "num_tokens": 6071105.0, "step": 1815 }, { "entropy": 6.994044351577759, "epoch": 0.3550873085552629, "grad_norm": 1.0703125, "learning_rate": 0.0004997051147486582, "loss": 6.9829, "mean_token_accuracy": 0.11727840378880501, "num_tokens": 6087964.0, "step": 1820 }, { "entropy": 6.997056674957276, "epoch": 0.35606282313920595, "grad_norm": 0.83984375, "learning_rate": 0.0004997015040041935, "loss": 7.0576, "mean_token_accuracy": 0.10933208093047142, "num_tokens": 6105245.0, "step": 1825 }, { "entropy": 7.0379139423370365, "epoch": 0.35703833772314897, "grad_norm": 0.92578125, "learning_rate": 0.0004996978713026986, "loss": 7.0079, "mean_token_accuracy": 0.12135875448584557, "num_tokens": 6121736.0, "step": 1830 }, { "entropy": 7.041876888275146, "epoch": 0.358013852307092, "grad_norm": 0.93359375, "learning_rate": 0.0004996942166445287, "loss": 7.0581, "mean_token_accuracy": 0.11438895165920257, "num_tokens": 6137751.0, "step": 1835 }, { "entropy": 7.019932746887207, "epoch": 0.358989366891035, "grad_norm": 0.8046875, "learning_rate": 0.0004996905400300407, "loss": 7.1101, "mean_token_accuracy": 0.1149475984275341, "num_tokens": 6154655.0, "step": 1840 }, { "entropy": 7.147087574005127, "epoch": 0.35996488147497807, "grad_norm": 0.828125, "learning_rate": 0.000499686841459594, "loss": 7.1113, "mean_token_accuracy": 0.10812506079673767, "num_tokens": 6172230.0, "step": 1845 }, { "entropy": 6.977477312088013, "epoch": 0.3609403960589211, "grad_norm": 0.9140625, "learning_rate": 0.0004996831209335497, "loss": 7.072, "mean_token_accuracy": 0.10572083070874214, "num_tokens": 6188520.0, "step": 1850 }, { "entropy": 7.082860088348388, "epoch": 0.3619159106428641, "grad_norm": 0.796875, "learning_rate": 0.0004996793784522719, "loss": 7.0966, "mean_token_accuracy": 0.11021933704614639, "num_tokens": 6205555.0, "step": 1855 }, { "entropy": 7.090164709091186, "epoch": 0.3628914252268071, "grad_norm": 0.85546875, "learning_rate": 0.0004996756140161259, "loss": 7.0792, "mean_token_accuracy": 0.11376980021595955, "num_tokens": 6223548.0, "step": 1860 }, { "entropy": 7.03369836807251, "epoch": 0.3638669398107502, "grad_norm": 0.83984375, "learning_rate": 0.0004996718276254797, "loss": 7.089, "mean_token_accuracy": 0.1082814022898674, "num_tokens": 6239266.0, "step": 1865 }, { "entropy": 7.072378301620484, "epoch": 0.3648424543946932, "grad_norm": 0.84765625, "learning_rate": 0.0004996680192807032, "loss": 7.0513, "mean_token_accuracy": 0.11285683810710907, "num_tokens": 6255020.0, "step": 1870 }, { "entropy": 7.046410369873047, "epoch": 0.3658179689786362, "grad_norm": 0.83203125, "learning_rate": 0.0004996641889821686, "loss": 6.9917, "mean_token_accuracy": 0.1103696033358574, "num_tokens": 6272774.0, "step": 1875 }, { "entropy": 6.994774389266968, "epoch": 0.36679348356257924, "grad_norm": 0.87890625, "learning_rate": 0.0004996603367302502, "loss": 7.0055, "mean_token_accuracy": 0.11505129560828209, "num_tokens": 6290478.0, "step": 1880 }, { "entropy": 7.055514526367188, "epoch": 0.3677689981465223, "grad_norm": 0.78515625, "learning_rate": 0.0004996564625253244, "loss": 7.0872, "mean_token_accuracy": 0.11461991667747498, "num_tokens": 6308003.0, "step": 1885 }, { "entropy": 7.011760663986206, "epoch": 0.3687445127304653, "grad_norm": 0.8359375, "learning_rate": 0.0004996525663677697, "loss": 7.0486, "mean_token_accuracy": 0.10762766152620315, "num_tokens": 6325748.0, "step": 1890 }, { "entropy": 7.06716947555542, "epoch": 0.36972002731440834, "grad_norm": 1.1796875, "learning_rate": 0.000499648648257967, "loss": 6.9936, "mean_token_accuracy": 0.12201232090592384, "num_tokens": 6344031.0, "step": 1895 }, { "entropy": 6.942547082901001, "epoch": 0.37069554189835136, "grad_norm": 0.828125, "learning_rate": 0.000499644708196299, "loss": 7.0461, "mean_token_accuracy": 0.11835477128624916, "num_tokens": 6359821.0, "step": 1900 }, { "entropy": 6.970766019821167, "epoch": 0.3716710564822944, "grad_norm": 0.828125, "learning_rate": 0.0004996407461831507, "loss": 6.888, "mean_token_accuracy": 0.1269619345664978, "num_tokens": 6376464.0, "step": 1905 }, { "entropy": 7.020088863372803, "epoch": 0.37264657106623744, "grad_norm": 0.81640625, "learning_rate": 0.0004996367622189094, "loss": 7.0657, "mean_token_accuracy": 0.1099945642054081, "num_tokens": 6392415.0, "step": 1910 }, { "entropy": 6.974881839752197, "epoch": 0.37362208565018046, "grad_norm": 0.80859375, "learning_rate": 0.0004996327563039643, "loss": 7.0612, "mean_token_accuracy": 0.11171750500798225, "num_tokens": 6409151.0, "step": 1915 }, { "entropy": 7.1153641700744625, "epoch": 0.3745976002341235, "grad_norm": 0.76953125, "learning_rate": 0.0004996287284387068, "loss": 7.0241, "mean_token_accuracy": 0.11637166067957878, "num_tokens": 6426997.0, "step": 1920 }, { "entropy": 6.979948997497559, "epoch": 0.37557311481806654, "grad_norm": 0.80859375, "learning_rate": 0.0004996246786235306, "loss": 7.0189, "mean_token_accuracy": 0.11474493220448494, "num_tokens": 6442871.0, "step": 1925 }, { "entropy": 6.961305904388428, "epoch": 0.37654862940200956, "grad_norm": 0.8828125, "learning_rate": 0.0004996206068588314, "loss": 7.0048, "mean_token_accuracy": 0.11208005249500275, "num_tokens": 6459677.0, "step": 1930 }, { "entropy": 7.101429510116577, "epoch": 0.3775241439859526, "grad_norm": 0.859375, "learning_rate": 0.0004996165131450071, "loss": 7.1353, "mean_token_accuracy": 0.10877176895737647, "num_tokens": 6477239.0, "step": 1935 }, { "entropy": 7.059422874450684, "epoch": 0.37849965856989565, "grad_norm": 0.82421875, "learning_rate": 0.0004996123974824576, "loss": 7.0037, "mean_token_accuracy": 0.11793602928519249, "num_tokens": 6493277.0, "step": 1940 }, { "entropy": 6.967101335525513, "epoch": 0.37947517315383866, "grad_norm": 0.86328125, "learning_rate": 0.0004996082598715852, "loss": 7.0137, "mean_token_accuracy": 0.11420942023396492, "num_tokens": 6509204.0, "step": 1945 }, { "entropy": 6.933266544342041, "epoch": 0.3804506877377817, "grad_norm": 0.93359375, "learning_rate": 0.000499604100312794, "loss": 6.8819, "mean_token_accuracy": 0.1260261982679367, "num_tokens": 6525486.0, "step": 1950 }, { "entropy": 6.971220445632935, "epoch": 0.3814262023217247, "grad_norm": 0.78515625, "learning_rate": 0.0004995999188064908, "loss": 7.0954, "mean_token_accuracy": 0.1095791406929493, "num_tokens": 6542227.0, "step": 1955 }, { "entropy": 7.0703741073608395, "epoch": 0.38240171690566777, "grad_norm": 0.9140625, "learning_rate": 0.000499595715353084, "loss": 7.1663, "mean_token_accuracy": 0.1052120178937912, "num_tokens": 6558951.0, "step": 1960 }, { "entropy": 7.107343959808349, "epoch": 0.3833772314896108, "grad_norm": 0.88671875, "learning_rate": 0.0004995914899529844, "loss": 7.0602, "mean_token_accuracy": 0.11332785338163376, "num_tokens": 6574696.0, "step": 1965 }, { "entropy": 7.097244834899902, "epoch": 0.3843527460735538, "grad_norm": 0.890625, "learning_rate": 0.0004995872426066048, "loss": 7.0934, "mean_token_accuracy": 0.10992669835686683, "num_tokens": 6591628.0, "step": 1970 }, { "entropy": 7.00416316986084, "epoch": 0.3853282606574968, "grad_norm": 1.0390625, "learning_rate": 0.0004995829733143602, "loss": 6.9752, "mean_token_accuracy": 0.11769431084394455, "num_tokens": 6608107.0, "step": 1975 }, { "entropy": 7.009332847595215, "epoch": 0.3863037752414399, "grad_norm": 0.84375, "learning_rate": 0.000499578682076668, "loss": 7.1112, "mean_token_accuracy": 0.11527311876416206, "num_tokens": 6626699.0, "step": 1980 }, { "entropy": 7.1108642578125, "epoch": 0.3872792898253829, "grad_norm": 0.875, "learning_rate": 0.0004995743688939474, "loss": 7.1356, "mean_token_accuracy": 0.10339468270540238, "num_tokens": 6644540.0, "step": 1985 }, { "entropy": 7.082017087936402, "epoch": 0.3882548044093259, "grad_norm": 0.76171875, "learning_rate": 0.0004995700337666199, "loss": 7.0632, "mean_token_accuracy": 0.10787386372685433, "num_tokens": 6660653.0, "step": 1990 }, { "entropy": 7.05488920211792, "epoch": 0.38923031899326893, "grad_norm": 0.84375, "learning_rate": 0.000499565676695109, "loss": 7.055, "mean_token_accuracy": 0.10950738564133644, "num_tokens": 6677553.0, "step": 1995 }, { "entropy": 7.056804180145264, "epoch": 0.390205833577212, "grad_norm": 0.92578125, "learning_rate": 0.0004995612976798406, "loss": 7.0546, "mean_token_accuracy": 0.10897849723696709, "num_tokens": 6695274.0, "step": 2000 }, { "entropy": 6.96084771156311, "epoch": 0.391181348161155, "grad_norm": 0.85546875, "learning_rate": 0.0004995568967212425, "loss": 6.9898, "mean_token_accuracy": 0.1134484887123108, "num_tokens": 6711166.0, "step": 2005 }, { "entropy": 6.97249550819397, "epoch": 0.39215686274509803, "grad_norm": 0.87109375, "learning_rate": 0.0004995524738197448, "loss": 6.9709, "mean_token_accuracy": 0.11566549465060234, "num_tokens": 6728827.0, "step": 2010 }, { "entropy": 6.880181360244751, "epoch": 0.39313237732904105, "grad_norm": 0.83203125, "learning_rate": 0.0004995480289757796, "loss": 6.9491, "mean_token_accuracy": 0.12184445783495904, "num_tokens": 6745901.0, "step": 2015 }, { "entropy": 6.927216005325318, "epoch": 0.3941078919129841, "grad_norm": 0.78515625, "learning_rate": 0.0004995435621897815, "loss": 6.9157, "mean_token_accuracy": 0.12079904079437256, "num_tokens": 6762176.0, "step": 2020 }, { "entropy": 6.997888612747192, "epoch": 0.39508340649692714, "grad_norm": 0.8984375, "learning_rate": 0.0004995390734621867, "loss": 7.0721, "mean_token_accuracy": 0.10900324806571007, "num_tokens": 6779322.0, "step": 2025 }, { "entropy": 7.120794105529785, "epoch": 0.39605892108087015, "grad_norm": 0.89453125, "learning_rate": 0.0004995345627934338, "loss": 7.0008, "mean_token_accuracy": 0.1168686531484127, "num_tokens": 6794293.0, "step": 2030 }, { "entropy": 6.7111622333526615, "epoch": 0.39703443566481317, "grad_norm": 0.85546875, "learning_rate": 0.0004995300301839637, "loss": 6.8367, "mean_token_accuracy": 0.13236104398965837, "num_tokens": 6812880.0, "step": 2035 }, { "entropy": 7.063685464859009, "epoch": 0.39800995024875624, "grad_norm": 0.8671875, "learning_rate": 0.0004995254756342194, "loss": 7.0484, "mean_token_accuracy": 0.1098434530198574, "num_tokens": 6829230.0, "step": 2040 }, { "entropy": 7.021308040618896, "epoch": 0.39898546483269925, "grad_norm": 0.90234375, "learning_rate": 0.0004995208991446458, "loss": 7.0422, "mean_token_accuracy": 0.11086834147572518, "num_tokens": 6846787.0, "step": 2045 }, { "entropy": 6.921110916137695, "epoch": 0.39996097941664227, "grad_norm": 0.97265625, "learning_rate": 0.0004995163007156902, "loss": 6.9141, "mean_token_accuracy": 0.11068061590194703, "num_tokens": 6862990.0, "step": 2050 }, { "entropy": 7.045805883407593, "epoch": 0.4009364940005853, "grad_norm": 0.88671875, "learning_rate": 0.0004995116803478018, "loss": 7.0557, "mean_token_accuracy": 0.10982215702533722, "num_tokens": 6879170.0, "step": 2055 }, { "entropy": 6.93969578742981, "epoch": 0.40191200858452836, "grad_norm": 0.90625, "learning_rate": 0.0004995070380414321, "loss": 7.0471, "mean_token_accuracy": 0.11072775200009347, "num_tokens": 6895635.0, "step": 2060 }, { "entropy": 7.018460369110107, "epoch": 0.4028875231684714, "grad_norm": 0.84765625, "learning_rate": 0.000499502373797035, "loss": 6.9495, "mean_token_accuracy": 0.11848736256361007, "num_tokens": 6912836.0, "step": 2065 }, { "entropy": 6.938055992126465, "epoch": 0.4038630377524144, "grad_norm": 0.89453125, "learning_rate": 0.000499497687615066, "loss": 6.9925, "mean_token_accuracy": 0.11958426535129547, "num_tokens": 6929507.0, "step": 2070 }, { "entropy": 7.012846374511719, "epoch": 0.4048385523363574, "grad_norm": 0.8515625, "learning_rate": 0.000499492979495983, "loss": 7.0108, "mean_token_accuracy": 0.11071802526712418, "num_tokens": 6946527.0, "step": 2075 }, { "entropy": 7.006974458694458, "epoch": 0.4058140669203005, "grad_norm": 0.9921875, "learning_rate": 0.0004994882494402462, "loss": 7.0069, "mean_token_accuracy": 0.11493440046906471, "num_tokens": 6962582.0, "step": 2080 }, { "entropy": 7.00134916305542, "epoch": 0.4067895815042435, "grad_norm": 0.828125, "learning_rate": 0.0004994834974483178, "loss": 6.9966, "mean_token_accuracy": 0.1160830058157444, "num_tokens": 6979389.0, "step": 2085 }, { "entropy": 6.925145530700684, "epoch": 0.4077650960881865, "grad_norm": 0.82421875, "learning_rate": 0.0004994787235206621, "loss": 6.9717, "mean_token_accuracy": 0.11536258235573768, "num_tokens": 6996637.0, "step": 2090 }, { "entropy": 7.0829870223999025, "epoch": 0.4087406106721295, "grad_norm": 0.79296875, "learning_rate": 0.0004994739276577456, "loss": 7.0683, "mean_token_accuracy": 0.10761817693710327, "num_tokens": 7013013.0, "step": 2095 }, { "entropy": 6.928919935226441, "epoch": 0.4097161252560726, "grad_norm": 0.74609375, "learning_rate": 0.0004994691098600369, "loss": 7.0302, "mean_token_accuracy": 0.11743959337472916, "num_tokens": 7031476.0, "step": 2100 }, { "entropy": 7.063517665863037, "epoch": 0.4106916398400156, "grad_norm": 0.85546875, "learning_rate": 0.0004994642701280068, "loss": 6.9326, "mean_token_accuracy": 0.11514554470777512, "num_tokens": 7047424.0, "step": 2105 }, { "entropy": 6.928591346740722, "epoch": 0.4116671544239586, "grad_norm": 0.76171875, "learning_rate": 0.0004994594084621282, "loss": 7.0055, "mean_token_accuracy": 0.110958231985569, "num_tokens": 7063793.0, "step": 2110 }, { "entropy": 7.087340021133423, "epoch": 0.41264266900790164, "grad_norm": 0.859375, "learning_rate": 0.0004994545248628762, "loss": 7.0733, "mean_token_accuracy": 0.10909361913800239, "num_tokens": 7079026.0, "step": 2115 }, { "entropy": 6.97515983581543, "epoch": 0.4136181835918447, "grad_norm": 0.9453125, "learning_rate": 0.000499449619330728, "loss": 7.0004, "mean_token_accuracy": 0.1165304310619831, "num_tokens": 7097524.0, "step": 2120 }, { "entropy": 7.0495555877685545, "epoch": 0.41459369817578773, "grad_norm": 0.8203125, "learning_rate": 0.000499444691866163, "loss": 7.0737, "mean_token_accuracy": 0.11175737231969833, "num_tokens": 7115514.0, "step": 2125 }, { "entropy": 6.996109342575073, "epoch": 0.41556921275973074, "grad_norm": 0.94921875, "learning_rate": 0.0004994397424696625, "loss": 7.0165, "mean_token_accuracy": 0.1140232503414154, "num_tokens": 7132589.0, "step": 2130 }, { "entropy": 7.000941753387451, "epoch": 0.4165447273436738, "grad_norm": 0.90234375, "learning_rate": 0.0004994347711417105, "loss": 7.0172, "mean_token_accuracy": 0.1115983322262764, "num_tokens": 7149416.0, "step": 2135 }, { "entropy": 6.923533773422241, "epoch": 0.41752024192761683, "grad_norm": 0.88671875, "learning_rate": 0.0004994297778827924, "loss": 6.9598, "mean_token_accuracy": 0.11849450021982193, "num_tokens": 7165763.0, "step": 2140 }, { "entropy": 6.934512424468994, "epoch": 0.41849575651155985, "grad_norm": 0.8359375, "learning_rate": 0.0004994247626933964, "loss": 6.9401, "mean_token_accuracy": 0.12275434285402298, "num_tokens": 7183131.0, "step": 2145 }, { "entropy": 6.95603723526001, "epoch": 0.41947127109550286, "grad_norm": 0.86328125, "learning_rate": 0.0004994197255740124, "loss": 6.968, "mean_token_accuracy": 0.1182591237127781, "num_tokens": 7200467.0, "step": 2150 }, { "entropy": 6.983357381820679, "epoch": 0.42044678567944593, "grad_norm": 0.8671875, "learning_rate": 0.0004994146665251327, "loss": 6.9547, "mean_token_accuracy": 0.11873010322451591, "num_tokens": 7217311.0, "step": 2155 }, { "entropy": 6.967365360260009, "epoch": 0.42142230026338895, "grad_norm": 0.75390625, "learning_rate": 0.0004994095855472516, "loss": 6.9618, "mean_token_accuracy": 0.11772591844201089, "num_tokens": 7235244.0, "step": 2160 }, { "entropy": 6.99353609085083, "epoch": 0.42239781484733196, "grad_norm": 0.796875, "learning_rate": 0.0004994044826408656, "loss": 6.9931, "mean_token_accuracy": 0.11206987127661705, "num_tokens": 7252235.0, "step": 2165 }, { "entropy": 6.952538728713989, "epoch": 0.423373329431275, "grad_norm": 0.82421875, "learning_rate": 0.0004993993578064733, "loss": 7.0059, "mean_token_accuracy": 0.11217687204480171, "num_tokens": 7269367.0, "step": 2170 }, { "entropy": 7.075891733169556, "epoch": 0.42434884401521805, "grad_norm": 1.0546875, "learning_rate": 0.0004993942110445756, "loss": 6.9881, "mean_token_accuracy": 0.1137772336602211, "num_tokens": 7287198.0, "step": 2175 }, { "entropy": 6.9127795696258545, "epoch": 0.42532435859916107, "grad_norm": 0.97265625, "learning_rate": 0.0004993890423556753, "loss": 6.9142, "mean_token_accuracy": 0.11559901610016823, "num_tokens": 7302356.0, "step": 2180 }, { "entropy": 6.960020351409912, "epoch": 0.4262998731831041, "grad_norm": 0.85546875, "learning_rate": 0.0004993838517402775, "loss": 6.9235, "mean_token_accuracy": 0.12155768349766731, "num_tokens": 7318530.0, "step": 2185 }, { "entropy": 6.953242349624634, "epoch": 0.4272753877670471, "grad_norm": 0.8203125, "learning_rate": 0.0004993786391988894, "loss": 6.9095, "mean_token_accuracy": 0.11496350169181824, "num_tokens": 7335195.0, "step": 2190 }, { "entropy": 6.883234643936158, "epoch": 0.42825090235099017, "grad_norm": 0.8359375, "learning_rate": 0.0004993734047320206, "loss": 6.9147, "mean_token_accuracy": 0.11316282376646995, "num_tokens": 7352233.0, "step": 2195 }, { "entropy": 6.983979988098144, "epoch": 0.4292264169349332, "grad_norm": 0.828125, "learning_rate": 0.0004993681483401821, "loss": 6.9696, "mean_token_accuracy": 0.11637645065784455, "num_tokens": 7368569.0, "step": 2200 }, { "entropy": 6.933692598342896, "epoch": 0.4302019315188762, "grad_norm": 0.9140625, "learning_rate": 0.0004993628700238879, "loss": 7.0137, "mean_token_accuracy": 0.114168231934309, "num_tokens": 7384669.0, "step": 2205 }, { "entropy": 7.095562601089478, "epoch": 0.4311774461028192, "grad_norm": 0.84375, "learning_rate": 0.0004993575697836537, "loss": 7.0289, "mean_token_accuracy": 0.11071271151304245, "num_tokens": 7401833.0, "step": 2210 }, { "entropy": 6.924860429763794, "epoch": 0.4321529606867623, "grad_norm": 0.83203125, "learning_rate": 0.0004993522476199975, "loss": 6.9162, "mean_token_accuracy": 0.1127213828265667, "num_tokens": 7418663.0, "step": 2215 }, { "entropy": 6.971612501144409, "epoch": 0.4331284752707053, "grad_norm": 0.83203125, "learning_rate": 0.0004993469035334392, "loss": 6.9014, "mean_token_accuracy": 0.1250322349369526, "num_tokens": 7434701.0, "step": 2220 }, { "entropy": 6.9419066429138185, "epoch": 0.4341039898546483, "grad_norm": 0.83984375, "learning_rate": 0.000499341537524501, "loss": 6.9828, "mean_token_accuracy": 0.10986461192369461, "num_tokens": 7450154.0, "step": 2225 }, { "entropy": 6.791154384613037, "epoch": 0.43507950443859134, "grad_norm": 0.8984375, "learning_rate": 0.0004993361495937074, "loss": 6.7912, "mean_token_accuracy": 0.13519535660743714, "num_tokens": 7468110.0, "step": 2230 }, { "entropy": 6.939401054382325, "epoch": 0.4360550190225344, "grad_norm": 0.8671875, "learning_rate": 0.0004993307397415848, "loss": 6.9107, "mean_token_accuracy": 0.11550685539841651, "num_tokens": 7482962.0, "step": 2235 }, { "entropy": 7.027690649032593, "epoch": 0.4370305336064774, "grad_norm": 0.76171875, "learning_rate": 0.0004993253079686619, "loss": 7.0536, "mean_token_accuracy": 0.1094849169254303, "num_tokens": 7499116.0, "step": 2240 }, { "entropy": 6.978180360794068, "epoch": 0.43800604819042044, "grad_norm": 0.82421875, "learning_rate": 0.0004993198542754692, "loss": 6.9999, "mean_token_accuracy": 0.11379628702998161, "num_tokens": 7515765.0, "step": 2245 }, { "entropy": 6.975172281265259, "epoch": 0.43898156277436345, "grad_norm": 0.87109375, "learning_rate": 0.0004993143786625401, "loss": 6.9918, "mean_token_accuracy": 0.11214097291231155, "num_tokens": 7532074.0, "step": 2250 }, { "entropy": 6.84090781211853, "epoch": 0.4399570773583065, "grad_norm": 0.8515625, "learning_rate": 0.0004993088811304092, "loss": 6.8176, "mean_token_accuracy": 0.1292093053460121, "num_tokens": 7547704.0, "step": 2255 }, { "entropy": 6.949747610092163, "epoch": 0.44093259194224954, "grad_norm": 0.88671875, "learning_rate": 0.0004993033616796139, "loss": 6.9434, "mean_token_accuracy": 0.11486721858382225, "num_tokens": 7563317.0, "step": 2260 }, { "entropy": 6.861780452728271, "epoch": 0.44190810652619256, "grad_norm": 0.81640625, "learning_rate": 0.0004992978203106936, "loss": 6.9432, "mean_token_accuracy": 0.11190066412091255, "num_tokens": 7580770.0, "step": 2265 }, { "entropy": 6.96252031326294, "epoch": 0.4428836211101356, "grad_norm": 0.796875, "learning_rate": 0.0004992922570241896, "loss": 6.9184, "mean_token_accuracy": 0.11765873730182648, "num_tokens": 7598181.0, "step": 2270 }, { "entropy": 6.973319005966187, "epoch": 0.44385913569407864, "grad_norm": 0.859375, "learning_rate": 0.0004992866718206457, "loss": 6.9181, "mean_token_accuracy": 0.11969833001494408, "num_tokens": 7613739.0, "step": 2275 }, { "entropy": 6.935301446914673, "epoch": 0.44483465027802166, "grad_norm": 0.875, "learning_rate": 0.0004992810647006077, "loss": 7.0022, "mean_token_accuracy": 0.1112263709306717, "num_tokens": 7629297.0, "step": 2280 }, { "entropy": 7.030787324905395, "epoch": 0.4458101648619647, "grad_norm": 0.7890625, "learning_rate": 0.0004992754356646234, "loss": 6.9824, "mean_token_accuracy": 0.11118089407682419, "num_tokens": 7645273.0, "step": 2285 }, { "entropy": 6.963811206817627, "epoch": 0.4467856794459077, "grad_norm": 0.80078125, "learning_rate": 0.0004992697847132427, "loss": 6.9328, "mean_token_accuracy": 0.11047199815511703, "num_tokens": 7661296.0, "step": 2290 }, { "entropy": 6.7955968379974365, "epoch": 0.44776119402985076, "grad_norm": 0.8125, "learning_rate": 0.000499264111847018, "loss": 6.9373, "mean_token_accuracy": 0.11633702144026756, "num_tokens": 7678658.0, "step": 2295 }, { "entropy": 7.02021017074585, "epoch": 0.4487367086137938, "grad_norm": 0.8125, "learning_rate": 0.0004992584170665037, "loss": 6.9728, "mean_token_accuracy": 0.11074585020542145, "num_tokens": 7693678.0, "step": 2300 }, { "entropy": 6.931669616699219, "epoch": 0.4497122231977368, "grad_norm": 0.84375, "learning_rate": 0.000499252700372256, "loss": 6.9621, "mean_token_accuracy": 0.11443416476249695, "num_tokens": 7709526.0, "step": 2305 }, { "entropy": 6.949428653717041, "epoch": 0.4506877377816798, "grad_norm": 0.86328125, "learning_rate": 0.0004992469617648337, "loss": 6.8567, "mean_token_accuracy": 0.11352990642189979, "num_tokens": 7725055.0, "step": 2310 }, { "entropy": 6.787866640090942, "epoch": 0.4516632523656229, "grad_norm": 0.92578125, "learning_rate": 0.0004992412012447976, "loss": 6.7685, "mean_token_accuracy": 0.13319482654333115, "num_tokens": 7742047.0, "step": 2315 }, { "entropy": 6.923736810684204, "epoch": 0.4526387669495659, "grad_norm": 0.85546875, "learning_rate": 0.0004992354188127105, "loss": 6.9335, "mean_token_accuracy": 0.11316853016614914, "num_tokens": 7758283.0, "step": 2320 }, { "entropy": 6.89393982887268, "epoch": 0.4536142815335089, "grad_norm": 0.85546875, "learning_rate": 0.0004992296144691375, "loss": 6.8739, "mean_token_accuracy": 0.11695389747619629, "num_tokens": 7774660.0, "step": 2325 }, { "entropy": 6.8337976932525635, "epoch": 0.454589796117452, "grad_norm": 0.90625, "learning_rate": 0.0004992237882146456, "loss": 6.8903, "mean_token_accuracy": 0.12075782865285874, "num_tokens": 7792147.0, "step": 2330 }, { "entropy": 6.886572599411011, "epoch": 0.455565310701395, "grad_norm": 0.8203125, "learning_rate": 0.0004992179400498044, "loss": 6.8362, "mean_token_accuracy": 0.12014108300209045, "num_tokens": 7809021.0, "step": 2335 }, { "entropy": 6.939410781860351, "epoch": 0.456540825285338, "grad_norm": 0.87890625, "learning_rate": 0.0004992120699751852, "loss": 6.9025, "mean_token_accuracy": 0.11456301808357239, "num_tokens": 7825074.0, "step": 2340 }, { "entropy": 6.76352219581604, "epoch": 0.45751633986928103, "grad_norm": 0.91796875, "learning_rate": 0.0004992061779913616, "loss": 6.8407, "mean_token_accuracy": 0.11945309415459633, "num_tokens": 7843413.0, "step": 2345 }, { "entropy": 6.984707689285278, "epoch": 0.4584918544532241, "grad_norm": 0.80078125, "learning_rate": 0.0004992002640989094, "loss": 6.9299, "mean_token_accuracy": 0.10952871888875962, "num_tokens": 7859874.0, "step": 2350 }, { "entropy": 6.80113639831543, "epoch": 0.4594673690371671, "grad_norm": 0.80078125, "learning_rate": 0.0004991943282984065, "loss": 6.865, "mean_token_accuracy": 0.12114636227488518, "num_tokens": 7877302.0, "step": 2355 }, { "entropy": 6.925329256057739, "epoch": 0.46044288362111013, "grad_norm": 0.88671875, "learning_rate": 0.0004991883705904328, "loss": 6.976, "mean_token_accuracy": 0.11222620382905006, "num_tokens": 7893207.0, "step": 2360 }, { "entropy": 6.8837878704071045, "epoch": 0.46141839820505315, "grad_norm": 0.8359375, "learning_rate": 0.0004991823909755705, "loss": 6.8151, "mean_token_accuracy": 0.12659919783473014, "num_tokens": 7910239.0, "step": 2365 }, { "entropy": 6.920702743530273, "epoch": 0.4623939127889962, "grad_norm": 0.83203125, "learning_rate": 0.0004991763894544041, "loss": 6.958, "mean_token_accuracy": 0.11296103447675705, "num_tokens": 7928030.0, "step": 2370 }, { "entropy": 6.890843772888184, "epoch": 0.46336942737293924, "grad_norm": 0.87109375, "learning_rate": 0.0004991703660275199, "loss": 6.8931, "mean_token_accuracy": 0.11770829334855079, "num_tokens": 7943653.0, "step": 2375 }, { "entropy": 6.974278211593628, "epoch": 0.46434494195688225, "grad_norm": 0.828125, "learning_rate": 0.0004991643206955064, "loss": 6.9705, "mean_token_accuracy": 0.11404236927628517, "num_tokens": 7960564.0, "step": 2380 }, { "entropy": 6.9140668392181395, "epoch": 0.46532045654082527, "grad_norm": 0.8203125, "learning_rate": 0.0004991582534589544, "loss": 6.9254, "mean_token_accuracy": 0.1193073645234108, "num_tokens": 7978045.0, "step": 2385 }, { "entropy": 6.957419967651367, "epoch": 0.46629597112476834, "grad_norm": 0.86328125, "learning_rate": 0.0004991521643184567, "loss": 6.9591, "mean_token_accuracy": 0.11141033694148064, "num_tokens": 7995074.0, "step": 2390 }, { "entropy": 6.947557401657105, "epoch": 0.46727148570871135, "grad_norm": 0.8359375, "learning_rate": 0.0004991460532746087, "loss": 6.9844, "mean_token_accuracy": 0.10783464983105659, "num_tokens": 8011800.0, "step": 2395 }, { "entropy": 6.9592297077178955, "epoch": 0.46824700029265437, "grad_norm": 0.86328125, "learning_rate": 0.000499139920328007, "loss": 6.9432, "mean_token_accuracy": 0.1144430011510849, "num_tokens": 8028090.0, "step": 2400 }, { "entropy": 6.912628507614135, "epoch": 0.4692225148765974, "grad_norm": 0.8984375, "learning_rate": 0.0004991337654792512, "loss": 6.9, "mean_token_accuracy": 0.11696527898311615, "num_tokens": 8044140.0, "step": 2405 }, { "entropy": 6.872697257995606, "epoch": 0.47019802946054046, "grad_norm": 0.921875, "learning_rate": 0.0004991275887289427, "loss": 6.8495, "mean_token_accuracy": 0.1179678663611412, "num_tokens": 8060030.0, "step": 2410 }, { "entropy": 6.8621447563171385, "epoch": 0.47117354404448347, "grad_norm": 0.8359375, "learning_rate": 0.0004991213900776849, "loss": 6.8854, "mean_token_accuracy": 0.11339947506785393, "num_tokens": 8075445.0, "step": 2415 }, { "entropy": 6.974141788482666, "epoch": 0.4721490586284265, "grad_norm": 0.796875, "learning_rate": 0.0004991151695260838, "loss": 6.8922, "mean_token_accuracy": 0.11236568167805672, "num_tokens": 8093250.0, "step": 2420 }, { "entropy": 6.816811847686767, "epoch": 0.4731245732123695, "grad_norm": 0.921875, "learning_rate": 0.000499108927074747, "loss": 6.837, "mean_token_accuracy": 0.12727442309260367, "num_tokens": 8109615.0, "step": 2425 }, { "entropy": 6.8544200420379635, "epoch": 0.4741000877963126, "grad_norm": 0.859375, "learning_rate": 0.0004991026627242846, "loss": 6.9403, "mean_token_accuracy": 0.11186167597770691, "num_tokens": 8126591.0, "step": 2430 }, { "entropy": 6.9048929691314695, "epoch": 0.4750756023802556, "grad_norm": 0.87109375, "learning_rate": 0.0004990963764753088, "loss": 6.8668, "mean_token_accuracy": 0.11707579866051673, "num_tokens": 8141360.0, "step": 2435 }, { "entropy": 6.942644453048706, "epoch": 0.4760511169641986, "grad_norm": 0.84375, "learning_rate": 0.0004990900683284337, "loss": 6.9608, "mean_token_accuracy": 0.12016337439417839, "num_tokens": 8159688.0, "step": 2440 }, { "entropy": 6.867148971557617, "epoch": 0.4770266315481416, "grad_norm": 0.87109375, "learning_rate": 0.0004990837382842758, "loss": 6.9146, "mean_token_accuracy": 0.11586871594190598, "num_tokens": 8176887.0, "step": 2445 }, { "entropy": 6.805676031112671, "epoch": 0.4780021461320847, "grad_norm": 0.7890625, "learning_rate": 0.0004990773863434537, "loss": 6.7335, "mean_token_accuracy": 0.12699671015143393, "num_tokens": 8193372.0, "step": 2450 }, { "entropy": 6.888016700744629, "epoch": 0.4789776607160277, "grad_norm": 0.796875, "learning_rate": 0.0004990710125065879, "loss": 6.9435, "mean_token_accuracy": 0.1139527752995491, "num_tokens": 8209713.0, "step": 2455 }, { "entropy": 6.959731769561768, "epoch": 0.4799531752999707, "grad_norm": 0.859375, "learning_rate": 0.0004990646167743015, "loss": 6.9477, "mean_token_accuracy": 0.11611981242895127, "num_tokens": 8226359.0, "step": 2460 }, { "entropy": 6.841183757781982, "epoch": 0.48092868988391374, "grad_norm": 0.8203125, "learning_rate": 0.0004990581991472193, "loss": 6.9187, "mean_token_accuracy": 0.11466511264443398, "num_tokens": 8243182.0, "step": 2465 }, { "entropy": 6.923015356063843, "epoch": 0.4819042044678568, "grad_norm": 0.84765625, "learning_rate": 0.0004990517596259684, "loss": 6.9206, "mean_token_accuracy": 0.1125547505915165, "num_tokens": 8259185.0, "step": 2470 }, { "entropy": 6.927219390869141, "epoch": 0.4828797190517998, "grad_norm": 0.8125, "learning_rate": 0.0004990452982111781, "loss": 6.983, "mean_token_accuracy": 0.11010222509503365, "num_tokens": 8275941.0, "step": 2475 }, { "entropy": 6.935208940505982, "epoch": 0.48385523363574284, "grad_norm": 0.94140625, "learning_rate": 0.0004990388149034797, "loss": 6.9253, "mean_token_accuracy": 0.11687990576028824, "num_tokens": 8292535.0, "step": 2480 }, { "entropy": 6.887890434265136, "epoch": 0.48483074821968586, "grad_norm": 0.7578125, "learning_rate": 0.0004990323097035069, "loss": 6.8769, "mean_token_accuracy": 0.12070949226617814, "num_tokens": 8310562.0, "step": 2485 }, { "entropy": 6.870615386962891, "epoch": 0.48580626280362893, "grad_norm": 0.78125, "learning_rate": 0.0004990257826118952, "loss": 6.9097, "mean_token_accuracy": 0.1069605253636837, "num_tokens": 8327241.0, "step": 2490 }, { "entropy": 6.865695381164551, "epoch": 0.48678177738757195, "grad_norm": 0.8125, "learning_rate": 0.0004990192336292824, "loss": 6.8423, "mean_token_accuracy": 0.12054572403430938, "num_tokens": 8343516.0, "step": 2495 }, { "entropy": 6.737391328811645, "epoch": 0.48775729197151496, "grad_norm": 0.796875, "learning_rate": 0.0004990126627563087, "loss": 6.709, "mean_token_accuracy": 0.12692616656422614, "num_tokens": 8361809.0, "step": 2500 }, { "entropy": 6.767363262176514, "epoch": 0.488732806555458, "grad_norm": 0.828125, "learning_rate": 0.0004990060699936159, "loss": 6.7707, "mean_token_accuracy": 0.13018333539366722, "num_tokens": 8378632.0, "step": 2505 }, { "entropy": 6.899938678741455, "epoch": 0.48970832113940105, "grad_norm": 0.80078125, "learning_rate": 0.0004989994553418483, "loss": 6.9353, "mean_token_accuracy": 0.110991932451725, "num_tokens": 8396201.0, "step": 2510 }, { "entropy": 6.8594200134277346, "epoch": 0.49068383572334406, "grad_norm": 0.7734375, "learning_rate": 0.0004989928188016522, "loss": 6.8072, "mean_token_accuracy": 0.12356401160359383, "num_tokens": 8412851.0, "step": 2515 }, { "entropy": 6.718408012390137, "epoch": 0.4916593503072871, "grad_norm": 0.90234375, "learning_rate": 0.0004989861603736762, "loss": 6.6376, "mean_token_accuracy": 0.13155316412448884, "num_tokens": 8430026.0, "step": 2520 }, { "entropy": 6.828795909881592, "epoch": 0.49263486489123015, "grad_norm": 0.87890625, "learning_rate": 0.0004989794800585711, "loss": 6.8795, "mean_token_accuracy": 0.11511812061071396, "num_tokens": 8446696.0, "step": 2525 }, { "entropy": 6.973077297210693, "epoch": 0.49361037947517317, "grad_norm": 0.87109375, "learning_rate": 0.0004989727778569893, "loss": 6.9693, "mean_token_accuracy": 0.11310434341430664, "num_tokens": 8464827.0, "step": 2530 }, { "entropy": 6.9201208591461185, "epoch": 0.4945858940591162, "grad_norm": 0.8515625, "learning_rate": 0.0004989660537695859, "loss": 6.9251, "mean_token_accuracy": 0.11566059663891792, "num_tokens": 8480185.0, "step": 2535 }, { "entropy": 6.761337852478027, "epoch": 0.4955614086430592, "grad_norm": 0.80859375, "learning_rate": 0.000498959307797018, "loss": 6.8128, "mean_token_accuracy": 0.12708098366856574, "num_tokens": 8497511.0, "step": 2540 }, { "entropy": 6.904820108413697, "epoch": 0.49653692322700227, "grad_norm": 0.91796875, "learning_rate": 0.0004989525399399447, "loss": 6.8702, "mean_token_accuracy": 0.11620474085211754, "num_tokens": 8514394.0, "step": 2545 }, { "entropy": 6.879853820800781, "epoch": 0.4975124378109453, "grad_norm": 0.7890625, "learning_rate": 0.0004989457501990275, "loss": 6.8792, "mean_token_accuracy": 0.11609909012913704, "num_tokens": 8531659.0, "step": 2550 }, { "entropy": 6.903630208969116, "epoch": 0.4984879523948883, "grad_norm": 0.79296875, "learning_rate": 0.0004989389385749297, "loss": 6.9287, "mean_token_accuracy": 0.11620916053652763, "num_tokens": 8547986.0, "step": 2555 }, { "entropy": 6.872329998016357, "epoch": 0.4994634669788313, "grad_norm": 0.76171875, "learning_rate": 0.0004989321050683169, "loss": 6.8751, "mean_token_accuracy": 0.11848173439502716, "num_tokens": 8565021.0, "step": 2560 }, { "entropy": 6.9056610584259035, "epoch": 0.5004389815627743, "grad_norm": 0.90234375, "learning_rate": 0.000498925249679857, "loss": 6.8744, "mean_token_accuracy": 0.11459636986255646, "num_tokens": 8582135.0, "step": 2565 }, { "entropy": 6.792390298843384, "epoch": 0.5014144961467174, "grad_norm": 0.953125, "learning_rate": 0.0004989183724102196, "loss": 6.8993, "mean_token_accuracy": 0.11787593364715576, "num_tokens": 8599946.0, "step": 2570 }, { "entropy": 6.958661413192749, "epoch": 0.5023900107306605, "grad_norm": 0.8203125, "learning_rate": 0.0004989114732600771, "loss": 6.923, "mean_token_accuracy": 0.11336629018187523, "num_tokens": 8615831.0, "step": 2575 }, { "entropy": 6.779950428009033, "epoch": 0.5033655253146034, "grad_norm": 0.8671875, "learning_rate": 0.0004989045522301033, "loss": 6.8112, "mean_token_accuracy": 0.11558634489774704, "num_tokens": 8631886.0, "step": 2580 }, { "entropy": 6.94764461517334, "epoch": 0.5043410398985465, "grad_norm": 0.9375, "learning_rate": 0.0004988976093209747, "loss": 6.8613, "mean_token_accuracy": 0.11486466601490974, "num_tokens": 8647520.0, "step": 2585 }, { "entropy": 6.8138525009155275, "epoch": 0.5053165544824895, "grad_norm": 0.83984375, "learning_rate": 0.0004988906445333698, "loss": 6.7713, "mean_token_accuracy": 0.12794217690825463, "num_tokens": 8663995.0, "step": 2590 }, { "entropy": 6.822241306304932, "epoch": 0.5062920690664325, "grad_norm": 0.89453125, "learning_rate": 0.0004988836578679691, "loss": 6.8511, "mean_token_accuracy": 0.11445828303694724, "num_tokens": 8680201.0, "step": 2595 }, { "entropy": 6.8948572158813475, "epoch": 0.5072675836503756, "grad_norm": 0.78515625, "learning_rate": 0.0004988766493254552, "loss": 6.8433, "mean_token_accuracy": 0.12341629490256309, "num_tokens": 8696978.0, "step": 2600 }, { "entropy": 6.804700136184692, "epoch": 0.5082430982343186, "grad_norm": 0.83984375, "learning_rate": 0.000498869618906513, "loss": 6.8946, "mean_token_accuracy": 0.11857298016548157, "num_tokens": 8713335.0, "step": 2605 }, { "entropy": 6.870307731628418, "epoch": 0.5092186128182616, "grad_norm": 0.859375, "learning_rate": 0.0004988625666118296, "loss": 6.8823, "mean_token_accuracy": 0.1196676455438137, "num_tokens": 8730722.0, "step": 2610 }, { "entropy": 6.774832820892334, "epoch": 0.5101941274022047, "grad_norm": 0.83984375, "learning_rate": 0.000498855492442094, "loss": 6.7952, "mean_token_accuracy": 0.12054291889071464, "num_tokens": 8747430.0, "step": 2615 }, { "entropy": 6.9103686809539795, "epoch": 0.5111696419861477, "grad_norm": 0.77734375, "learning_rate": 0.0004988483963979975, "loss": 6.8884, "mean_token_accuracy": 0.11560614630579949, "num_tokens": 8764817.0, "step": 2620 }, { "entropy": 6.927261114120483, "epoch": 0.5121451565700907, "grad_norm": 0.8671875, "learning_rate": 0.0004988412784802336, "loss": 6.9015, "mean_token_accuracy": 0.11360720023512841, "num_tokens": 8780412.0, "step": 2625 }, { "entropy": 6.932803821563721, "epoch": 0.5131206711540337, "grad_norm": 0.89453125, "learning_rate": 0.0004988341386894977, "loss": 6.9679, "mean_token_accuracy": 0.1152969904243946, "num_tokens": 8795526.0, "step": 2630 }, { "entropy": 6.7840962409973145, "epoch": 0.5140961857379768, "grad_norm": 0.8046875, "learning_rate": 0.0004988269770264876, "loss": 6.7672, "mean_token_accuracy": 0.12347180098295212, "num_tokens": 8813568.0, "step": 2635 }, { "entropy": 6.938270092010498, "epoch": 0.5150717003219198, "grad_norm": 0.796875, "learning_rate": 0.0004988197934919029, "loss": 6.9232, "mean_token_accuracy": 0.1144092097878456, "num_tokens": 8831807.0, "step": 2640 }, { "entropy": 6.955628967285156, "epoch": 0.5160472149058628, "grad_norm": 0.82421875, "learning_rate": 0.0004988125880864458, "loss": 6.9261, "mean_token_accuracy": 0.11702951192855834, "num_tokens": 8848875.0, "step": 2645 }, { "entropy": 6.676701450347901, "epoch": 0.5170227294898059, "grad_norm": 0.828125, "learning_rate": 0.0004988053608108203, "loss": 6.6355, "mean_token_accuracy": 0.12377685308456421, "num_tokens": 8866317.0, "step": 2650 }, { "entropy": 6.782362079620361, "epoch": 0.517998244073749, "grad_norm": 0.8671875, "learning_rate": 0.0004987981116657325, "loss": 6.7683, "mean_token_accuracy": 0.11874385476112366, "num_tokens": 8882543.0, "step": 2655 }, { "entropy": 6.862992858886718, "epoch": 0.5189737586576919, "grad_norm": 0.8828125, "learning_rate": 0.0004987908406518909, "loss": 6.7972, "mean_token_accuracy": 0.11631387770175934, "num_tokens": 8898640.0, "step": 2660 }, { "entropy": 6.851989984512329, "epoch": 0.519949273241635, "grad_norm": 0.83203125, "learning_rate": 0.000498783547770006, "loss": 6.9017, "mean_token_accuracy": 0.11561635807156563, "num_tokens": 8914649.0, "step": 2665 }, { "entropy": 6.909957075119019, "epoch": 0.5209247878255779, "grad_norm": 1.046875, "learning_rate": 0.0004987762330207903, "loss": 6.9236, "mean_token_accuracy": 0.11679632440209389, "num_tokens": 8931585.0, "step": 2670 }, { "entropy": 6.771302366256714, "epoch": 0.521900302409521, "grad_norm": 0.90625, "learning_rate": 0.0004987688964049587, "loss": 6.7928, "mean_token_accuracy": 0.12180419787764549, "num_tokens": 8948827.0, "step": 2675 }, { "entropy": 6.790069627761841, "epoch": 0.5228758169934641, "grad_norm": 0.7890625, "learning_rate": 0.000498761537923228, "loss": 6.7745, "mean_token_accuracy": 0.1269575834274292, "num_tokens": 8965680.0, "step": 2680 }, { "entropy": 6.952053117752075, "epoch": 0.523851331577407, "grad_norm": 0.82421875, "learning_rate": 0.0004987541575763175, "loss": 6.9065, "mean_token_accuracy": 0.11049905940890312, "num_tokens": 8982813.0, "step": 2685 }, { "entropy": 6.867544031143188, "epoch": 0.5248268461613501, "grad_norm": 0.81640625, "learning_rate": 0.000498746755364948, "loss": 6.8833, "mean_token_accuracy": 0.11713560670614243, "num_tokens": 9000497.0, "step": 2690 }, { "entropy": 6.830367136001587, "epoch": 0.5258023607452932, "grad_norm": 0.78515625, "learning_rate": 0.0004987393312898431, "loss": 6.8102, "mean_token_accuracy": 0.11786004677414894, "num_tokens": 9016195.0, "step": 2695 }, { "entropy": 6.761811113357544, "epoch": 0.5267778753292361, "grad_norm": 0.8125, "learning_rate": 0.0004987318853517282, "loss": 6.7723, "mean_token_accuracy": 0.12615545392036437, "num_tokens": 9033295.0, "step": 2700 }, { "entropy": 6.844594049453735, "epoch": 0.5277533899131792, "grad_norm": 0.85546875, "learning_rate": 0.0004987244175513308, "loss": 6.872, "mean_token_accuracy": 0.1141127772629261, "num_tokens": 9050725.0, "step": 2705 }, { "entropy": 6.833688688278198, "epoch": 0.5287289044971223, "grad_norm": 0.90625, "learning_rate": 0.0004987169278893807, "loss": 6.8168, "mean_token_accuracy": 0.11935415118932724, "num_tokens": 9067842.0, "step": 2710 }, { "entropy": 6.86349515914917, "epoch": 0.5297044190810652, "grad_norm": 0.80859375, "learning_rate": 0.0004987094163666098, "loss": 6.8351, "mean_token_accuracy": 0.11330854967236519, "num_tokens": 9084602.0, "step": 2715 }, { "entropy": 6.789287185668945, "epoch": 0.5306799336650083, "grad_norm": 0.8359375, "learning_rate": 0.000498701882983752, "loss": 6.7657, "mean_token_accuracy": 0.12709601148962973, "num_tokens": 9100530.0, "step": 2720 }, { "entropy": 6.867527198791504, "epoch": 0.5316554482489513, "grad_norm": 0.84375, "learning_rate": 0.0004986943277415435, "loss": 6.8614, "mean_token_accuracy": 0.12204445227980613, "num_tokens": 9117304.0, "step": 2725 }, { "entropy": 6.752386522293091, "epoch": 0.5326309628328944, "grad_norm": 0.7734375, "learning_rate": 0.0004986867506407225, "loss": 6.806, "mean_token_accuracy": 0.13167238086462021, "num_tokens": 9133974.0, "step": 2730 }, { "entropy": 6.860329008102417, "epoch": 0.5336064774168374, "grad_norm": 0.80859375, "learning_rate": 0.0004986791516820295, "loss": 6.772, "mean_token_accuracy": 0.12175974771380424, "num_tokens": 9150600.0, "step": 2735 }, { "entropy": 6.737002849578857, "epoch": 0.5345819920007804, "grad_norm": 0.765625, "learning_rate": 0.000498671530866207, "loss": 6.7722, "mean_token_accuracy": 0.11789723262190818, "num_tokens": 9167449.0, "step": 2740 }, { "entropy": 6.818783092498779, "epoch": 0.5355575065847235, "grad_norm": 0.83203125, "learning_rate": 0.0004986638881939997, "loss": 6.7219, "mean_token_accuracy": 0.12201179042458535, "num_tokens": 9184570.0, "step": 2745 }, { "entropy": 6.784221220016479, "epoch": 0.5365330211686665, "grad_norm": 0.8515625, "learning_rate": 0.0004986562236661544, "loss": 6.9045, "mean_token_accuracy": 0.10912108793854713, "num_tokens": 9200537.0, "step": 2750 }, { "entropy": 6.902917003631591, "epoch": 0.5375085357526095, "grad_norm": 0.8046875, "learning_rate": 0.00049864853728342, "loss": 6.8037, "mean_token_accuracy": 0.12473463490605355, "num_tokens": 9217252.0, "step": 2755 }, { "entropy": 6.864479970932007, "epoch": 0.5384840503365526, "grad_norm": 0.828125, "learning_rate": 0.0004986408290465476, "loss": 6.8555, "mean_token_accuracy": 0.11590055152773857, "num_tokens": 9234108.0, "step": 2760 }, { "entropy": 6.812731981277466, "epoch": 0.5394595649204955, "grad_norm": 0.8828125, "learning_rate": 0.0004986330989562906, "loss": 6.7575, "mean_token_accuracy": 0.12097472175955773, "num_tokens": 9251017.0, "step": 2765 }, { "entropy": 6.7629071235656735, "epoch": 0.5404350795044386, "grad_norm": 0.78515625, "learning_rate": 0.0004986253470134042, "loss": 6.7091, "mean_token_accuracy": 0.1275697208940983, "num_tokens": 9267922.0, "step": 2770 }, { "entropy": 6.700593709945679, "epoch": 0.5414105940883817, "grad_norm": 0.76953125, "learning_rate": 0.0004986175732186459, "loss": 6.703, "mean_token_accuracy": 0.13123294040560723, "num_tokens": 9284954.0, "step": 2775 }, { "entropy": 6.885139465332031, "epoch": 0.5423861086723246, "grad_norm": 0.83203125, "learning_rate": 0.0004986097775727752, "loss": 6.8334, "mean_token_accuracy": 0.12190918251872063, "num_tokens": 9303306.0, "step": 2780 }, { "entropy": 6.733374404907226, "epoch": 0.5433616232562677, "grad_norm": 0.7734375, "learning_rate": 0.0004986019600765541, "loss": 6.7219, "mean_token_accuracy": 0.12711875960230828, "num_tokens": 9319754.0, "step": 2785 }, { "entropy": 6.743921375274658, "epoch": 0.5443371378402108, "grad_norm": 0.92578125, "learning_rate": 0.0004985941207307462, "loss": 6.8122, "mean_token_accuracy": 0.12274460345506669, "num_tokens": 9335736.0, "step": 2790 }, { "entropy": 6.8163683891296385, "epoch": 0.5453126524241537, "grad_norm": 0.9296875, "learning_rate": 0.0004985862595361179, "loss": 6.7784, "mean_token_accuracy": 0.12290315851569175, "num_tokens": 9350435.0, "step": 2795 }, { "entropy": 6.86185622215271, "epoch": 0.5462881670080968, "grad_norm": 0.87109375, "learning_rate": 0.0004985783764934372, "loss": 6.8427, "mean_token_accuracy": 0.11779003739356994, "num_tokens": 9367613.0, "step": 2800 }, { "entropy": 6.787689065933227, "epoch": 0.5472636815920398, "grad_norm": 0.83984375, "learning_rate": 0.0004985704716034744, "loss": 6.749, "mean_token_accuracy": 0.1232517659664154, "num_tokens": 9385590.0, "step": 2805 }, { "entropy": 6.836340427398682, "epoch": 0.5482391961759828, "grad_norm": 1.3125, "learning_rate": 0.0004985625448670019, "loss": 6.8774, "mean_token_accuracy": 0.11052649319171906, "num_tokens": 9403286.0, "step": 2810 }, { "entropy": 6.910646963119507, "epoch": 0.5492147107599259, "grad_norm": 0.89453125, "learning_rate": 0.0004985545962847943, "loss": 6.8702, "mean_token_accuracy": 0.1125256858766079, "num_tokens": 9419880.0, "step": 2815 }, { "entropy": 6.7993169784545895, "epoch": 0.5501902253438689, "grad_norm": 0.84765625, "learning_rate": 0.0004985466258576283, "loss": 6.8319, "mean_token_accuracy": 0.11432699039578438, "num_tokens": 9436579.0, "step": 2820 }, { "entropy": 6.884487915039062, "epoch": 0.5511657399278119, "grad_norm": 0.8671875, "learning_rate": 0.0004985386335862829, "loss": 6.8841, "mean_token_accuracy": 0.11265967264771462, "num_tokens": 9452802.0, "step": 2825 }, { "entropy": 6.851714277267456, "epoch": 0.552141254511755, "grad_norm": 0.9296875, "learning_rate": 0.0004985306194715387, "loss": 6.8927, "mean_token_accuracy": 0.11446214690804482, "num_tokens": 9468297.0, "step": 2830 }, { "entropy": 6.883763599395752, "epoch": 0.553116769095698, "grad_norm": 0.921875, "learning_rate": 0.0004985225835141792, "loss": 6.8999, "mean_token_accuracy": 0.11260369718074799, "num_tokens": 9484954.0, "step": 2835 }, { "entropy": 6.9504420280456545, "epoch": 0.554092283679641, "grad_norm": 0.83984375, "learning_rate": 0.0004985145257149895, "loss": 6.9496, "mean_token_accuracy": 0.1100885510444641, "num_tokens": 9502211.0, "step": 2840 }, { "entropy": 6.860951280593872, "epoch": 0.555067798263584, "grad_norm": 0.78125, "learning_rate": 0.0004985064460747569, "loss": 6.8337, "mean_token_accuracy": 0.11309531480073928, "num_tokens": 9518103.0, "step": 2845 }, { "entropy": 6.764395809173584, "epoch": 0.5560433128475271, "grad_norm": 0.8515625, "learning_rate": 0.000498498344594271, "loss": 6.7779, "mean_token_accuracy": 0.11637641638517379, "num_tokens": 9534155.0, "step": 2850 }, { "entropy": 6.738689994812011, "epoch": 0.5570188274314701, "grad_norm": 0.859375, "learning_rate": 0.0004984902212743234, "loss": 6.7507, "mean_token_accuracy": 0.12972750812768935, "num_tokens": 9549972.0, "step": 2855 }, { "entropy": 6.696974754333496, "epoch": 0.5579943420154131, "grad_norm": 0.859375, "learning_rate": 0.0004984820761157079, "loss": 6.6617, "mean_token_accuracy": 0.13014516234397888, "num_tokens": 9567306.0, "step": 2860 }, { "entropy": 6.883365678787231, "epoch": 0.5589698565993562, "grad_norm": 0.8359375, "learning_rate": 0.0004984739091192205, "loss": 6.885, "mean_token_accuracy": 0.11657564714550972, "num_tokens": 9583488.0, "step": 2865 }, { "entropy": 6.694728088378906, "epoch": 0.5599453711832992, "grad_norm": 0.93359375, "learning_rate": 0.0004984657202856592, "loss": 6.6662, "mean_token_accuracy": 0.13098273277282715, "num_tokens": 9600030.0, "step": 2870 }, { "entropy": 6.725077056884766, "epoch": 0.5609208857672422, "grad_norm": 0.92578125, "learning_rate": 0.000498457509615824, "loss": 6.7896, "mean_token_accuracy": 0.12264834940433503, "num_tokens": 9615791.0, "step": 2875 }, { "entropy": 6.910763216018677, "epoch": 0.5618964003511853, "grad_norm": 0.9375, "learning_rate": 0.0004984492771105175, "loss": 6.8578, "mean_token_accuracy": 0.11508372128009796, "num_tokens": 9630955.0, "step": 2880 }, { "entropy": 6.71947979927063, "epoch": 0.5628719149351282, "grad_norm": 0.953125, "learning_rate": 0.0004984410227705439, "loss": 6.7604, "mean_token_accuracy": 0.1295547068119049, "num_tokens": 9647743.0, "step": 2885 }, { "entropy": 6.745148420333862, "epoch": 0.5638474295190713, "grad_norm": 0.828125, "learning_rate": 0.0004984327465967101, "loss": 6.7171, "mean_token_accuracy": 0.12684635668992997, "num_tokens": 9665495.0, "step": 2890 }, { "entropy": 6.785642194747925, "epoch": 0.5648229441030144, "grad_norm": 0.8046875, "learning_rate": 0.0004984244485898246, "loss": 6.7367, "mean_token_accuracy": 0.12310076728463173, "num_tokens": 9683489.0, "step": 2895 }, { "entropy": 6.579546022415161, "epoch": 0.5657984586869573, "grad_norm": 0.796875, "learning_rate": 0.0004984161287506982, "loss": 6.6762, "mean_token_accuracy": 0.1427179493010044, "num_tokens": 9700491.0, "step": 2900 }, { "entropy": 6.925921773910522, "epoch": 0.5667739732709004, "grad_norm": 0.84765625, "learning_rate": 0.000498407787080144, "loss": 6.8309, "mean_token_accuracy": 0.11485328450798989, "num_tokens": 9715694.0, "step": 2905 }, { "entropy": 6.817408847808838, "epoch": 0.5677494878548435, "grad_norm": 0.8515625, "learning_rate": 0.000498399423578977, "loss": 6.8899, "mean_token_accuracy": 0.11257752552628517, "num_tokens": 9731317.0, "step": 2910 }, { "entropy": 6.870456409454346, "epoch": 0.5687250024387864, "grad_norm": 0.86328125, "learning_rate": 0.0004983910382480146, "loss": 6.8671, "mean_token_accuracy": 0.11242569237947464, "num_tokens": 9747928.0, "step": 2915 }, { "entropy": 6.837937736511231, "epoch": 0.5697005170227295, "grad_norm": 1.0390625, "learning_rate": 0.0004983826310880762, "loss": 6.8039, "mean_token_accuracy": 0.11309616193175316, "num_tokens": 9765454.0, "step": 2920 }, { "entropy": 6.897300434112549, "epoch": 0.5706760316066726, "grad_norm": 0.84375, "learning_rate": 0.0004983742020999832, "loss": 6.8669, "mean_token_accuracy": 0.10900059267878533, "num_tokens": 9782255.0, "step": 2925 }, { "entropy": 6.696663665771484, "epoch": 0.5716515461906155, "grad_norm": 0.796875, "learning_rate": 0.0004983657512845593, "loss": 6.6753, "mean_token_accuracy": 0.12878145053982734, "num_tokens": 9798680.0, "step": 2930 }, { "entropy": 6.806471347808838, "epoch": 0.5726270607745586, "grad_norm": 0.84765625, "learning_rate": 0.0004983572786426302, "loss": 6.8175, "mean_token_accuracy": 0.11593940034508705, "num_tokens": 9813955.0, "step": 2935 }, { "entropy": 6.701576662063599, "epoch": 0.5736025753585016, "grad_norm": 0.859375, "learning_rate": 0.0004983487841750239, "loss": 6.711, "mean_token_accuracy": 0.129136098921299, "num_tokens": 9830692.0, "step": 2940 }, { "entropy": 6.839662647247314, "epoch": 0.5745780899424446, "grad_norm": 0.83203125, "learning_rate": 0.0004983402678825705, "loss": 6.8308, "mean_token_accuracy": 0.11594207361340522, "num_tokens": 9848825.0, "step": 2945 }, { "entropy": 6.809984397888184, "epoch": 0.5755536045263877, "grad_norm": 0.85546875, "learning_rate": 0.0004983317297661021, "loss": 6.8305, "mean_token_accuracy": 0.12007160931825638, "num_tokens": 9865802.0, "step": 2950 }, { "entropy": 6.848187828063965, "epoch": 0.5765291191103307, "grad_norm": 0.79296875, "learning_rate": 0.0004983231698264531, "loss": 6.8632, "mean_token_accuracy": 0.11418323591351509, "num_tokens": 9883540.0, "step": 2955 }, { "entropy": 6.871307277679444, "epoch": 0.5775046336942737, "grad_norm": 0.91015625, "learning_rate": 0.0004983145880644597, "loss": 6.8059, "mean_token_accuracy": 0.1159649781882763, "num_tokens": 9897724.0, "step": 2960 }, { "entropy": 6.807016468048095, "epoch": 0.5784801482782168, "grad_norm": 0.8203125, "learning_rate": 0.0004983059844809608, "loss": 6.7525, "mean_token_accuracy": 0.12290950119495392, "num_tokens": 9914710.0, "step": 2965 }, { "entropy": 6.785981321334839, "epoch": 0.5794556628621598, "grad_norm": 0.76953125, "learning_rate": 0.0004982973590767969, "loss": 6.8696, "mean_token_accuracy": 0.12116017490625382, "num_tokens": 9932362.0, "step": 2970 }, { "entropy": 6.751751852035523, "epoch": 0.5804311774461028, "grad_norm": 0.80859375, "learning_rate": 0.000498288711852811, "loss": 6.6607, "mean_token_accuracy": 0.12567465156316757, "num_tokens": 9949409.0, "step": 2975 }, { "entropy": 6.827619361877441, "epoch": 0.5814066920300458, "grad_norm": 0.86328125, "learning_rate": 0.000498280042809848, "loss": 6.8126, "mean_token_accuracy": 0.11727285012602806, "num_tokens": 9967467.0, "step": 2980 }, { "entropy": 6.7890321731567385, "epoch": 0.5823822066139889, "grad_norm": 0.859375, "learning_rate": 0.0004982713519487549, "loss": 6.7552, "mean_token_accuracy": 0.1225271537899971, "num_tokens": 9983082.0, "step": 2985 }, { "entropy": 6.790068006515503, "epoch": 0.5833577211979319, "grad_norm": 0.80078125, "learning_rate": 0.0004982626392703812, "loss": 6.8259, "mean_token_accuracy": 0.11854807063937187, "num_tokens": 10000046.0, "step": 2990 }, { "entropy": 6.802617406845092, "epoch": 0.5843332357818749, "grad_norm": 0.890625, "learning_rate": 0.000498253904775578, "loss": 6.7577, "mean_token_accuracy": 0.11755326986312867, "num_tokens": 10014674.0, "step": 2995 }, { "entropy": 6.694525718688965, "epoch": 0.585308750365818, "grad_norm": 0.8515625, "learning_rate": 0.0004982451484651988, "loss": 6.6491, "mean_token_accuracy": 0.12509795725345613, "num_tokens": 10030647.0, "step": 3000 }, { "epoch": 0.585308750365818, "eval_entropy": 6.631029434728553, "eval_loss": 6.8121867179870605, "eval_mean_token_accuracy": 0.12184531028524896, "eval_num_tokens": 10030647.0, "eval_runtime": 15.3329, "eval_samples_per_second": 1081.139, "eval_steps_per_second": 135.199, "step": 3000 } ], "logging_steps": 5, "max_steps": 51250, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.3581706696704e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }