{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 6.064693659796709, "eval_steps": 3000, "global_step": 54000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691954421997071, "epoch": 0.0005615769079575448, "grad_norm": 13.75, "learning_rate": 2e-06, "loss": 10.8494, "mean_token_accuracy": 0.0, "num_tokens": 10897.0, "step": 5 }, { "entropy": 10.692028713226318, "epoch": 0.0011231538159150896, "grad_norm": 13.375, "learning_rate": 4.5e-06, "loss": 10.783, "mean_token_accuracy": 7.102272938936949e-05, "num_tokens": 23084.0, "step": 10 }, { "entropy": 10.69119052886963, "epoch": 0.0016847307238726343, "grad_norm": 10.5, "learning_rate": 7e-06, "loss": 10.5147, "mean_token_accuracy": 0.01880119484849274, "num_tokens": 35810.0, "step": 15 }, { "entropy": 10.683763885498047, "epoch": 0.0022463076318301792, "grad_norm": 6.15625, "learning_rate": 9.5e-06, "loss": 10.1375, "mean_token_accuracy": 0.03672755789011717, "num_tokens": 46019.0, "step": 20 }, { "entropy": 10.640995311737061, "epoch": 0.002807884539787724, "grad_norm": 4.375, "learning_rate": 1.2e-05, "loss": 9.8065, "mean_token_accuracy": 0.0391056377440691, "num_tokens": 57272.0, "step": 25 }, { "entropy": 10.578758907318115, "epoch": 0.0033694614477452686, "grad_norm": 3.28125, "learning_rate": 1.4500000000000002e-05, "loss": 9.6789, "mean_token_accuracy": 0.036402178928256035, "num_tokens": 68686.0, "step": 30 }, { "entropy": 10.573095703125, "epoch": 0.003931038355702813, "grad_norm": 2.90625, "learning_rate": 1.7000000000000003e-05, "loss": 9.5714, "mean_token_accuracy": 0.04141928404569626, "num_tokens": 79187.0, "step": 35 }, { "entropy": 10.575594806671143, "epoch": 0.0044926152636603585, "grad_norm": 2.75, "learning_rate": 1.95e-05, "loss": 9.5576, "mean_token_accuracy": 0.044133822247385976, "num_tokens": 90293.0, "step": 40 }, { "entropy": 10.556080150604249, "epoch": 0.005054192171617903, "grad_norm": 2.578125, "learning_rate": 2.2e-05, "loss": 9.4673, "mean_token_accuracy": 0.04080899097025394, "num_tokens": 100420.0, "step": 45 }, { "entropy": 10.538790798187256, "epoch": 0.005615769079575448, "grad_norm": 2.515625, "learning_rate": 2.4500000000000003e-05, "loss": 9.4858, "mean_token_accuracy": 0.03646625243127346, "num_tokens": 111198.0, "step": 50 }, { "entropy": 10.547248840332031, "epoch": 0.006177345987532993, "grad_norm": 2.34375, "learning_rate": 2.7e-05, "loss": 9.3988, "mean_token_accuracy": 0.05780095718801022, "num_tokens": 124723.0, "step": 55 }, { "entropy": 10.461988258361817, "epoch": 0.006738922895490537, "grad_norm": 2.46875, "learning_rate": 2.95e-05, "loss": 9.2587, "mean_token_accuracy": 0.061974577233195306, "num_tokens": 136366.0, "step": 60 }, { "entropy": 10.363299369812012, "epoch": 0.007300499803448083, "grad_norm": 2.4375, "learning_rate": 3.2e-05, "loss": 9.1817, "mean_token_accuracy": 0.06283607967197895, "num_tokens": 146536.0, "step": 65 }, { "entropy": 10.396018791198731, "epoch": 0.007862076711405626, "grad_norm": 2.21875, "learning_rate": 3.4500000000000005e-05, "loss": 9.097, "mean_token_accuracy": 0.0707736562937498, "num_tokens": 157005.0, "step": 70 }, { "entropy": 10.386055850982666, "epoch": 0.008423653619363172, "grad_norm": 2.328125, "learning_rate": 3.7e-05, "loss": 9.017, "mean_token_accuracy": 0.07136933580040931, "num_tokens": 167864.0, "step": 75 }, { "entropy": 10.352816581726074, "epoch": 0.008985230527320717, "grad_norm": 2.5625, "learning_rate": 3.95e-05, "loss": 8.9484, "mean_token_accuracy": 0.06433885768055916, "num_tokens": 179635.0, "step": 80 }, { "entropy": 10.24338674545288, "epoch": 0.00954680743527826, "grad_norm": 2.671875, "learning_rate": 4.2000000000000004e-05, "loss": 8.8572, "mean_token_accuracy": 0.07211834266781807, "num_tokens": 190614.0, "step": 85 }, { "entropy": 10.245021152496339, "epoch": 0.010108384343235806, "grad_norm": 2.21875, "learning_rate": 4.45e-05, "loss": 8.7198, "mean_token_accuracy": 0.07616456523537636, "num_tokens": 201496.0, "step": 90 }, { "entropy": 10.094779968261719, "epoch": 0.010669961251193351, "grad_norm": 2.46875, "learning_rate": 4.7000000000000004e-05, "loss": 8.6055, "mean_token_accuracy": 0.0780682846903801, "num_tokens": 211606.0, "step": 95 }, { "entropy": 10.115865230560303, "epoch": 0.011231538159150897, "grad_norm": 2.625, "learning_rate": 4.9500000000000004e-05, "loss": 8.4856, "mean_token_accuracy": 0.07667104676365852, "num_tokens": 223503.0, "step": 100 }, { "entropy": 10.032721042633057, "epoch": 0.01179311506710844, "grad_norm": 2.421875, "learning_rate": 5.2e-05, "loss": 8.4196, "mean_token_accuracy": 0.0808894768357277, "num_tokens": 234744.0, "step": 105 }, { "entropy": 9.90083703994751, "epoch": 0.012354691975065986, "grad_norm": 1.7890625, "learning_rate": 5.45e-05, "loss": 8.3419, "mean_token_accuracy": 0.08203728273510932, "num_tokens": 247663.0, "step": 110 }, { "entropy": 9.945332717895507, "epoch": 0.012916268883023531, "grad_norm": 1.96875, "learning_rate": 5.7e-05, "loss": 8.2013, "mean_token_accuracy": 0.08452324643731117, "num_tokens": 260326.0, "step": 115 }, { "entropy": 9.736694145202637, "epoch": 0.013477845790981074, "grad_norm": 2.1875, "learning_rate": 5.9499999999999996e-05, "loss": 8.0563, "mean_token_accuracy": 0.0793469488620758, "num_tokens": 271568.0, "step": 120 }, { "entropy": 9.62724199295044, "epoch": 0.01403942269893862, "grad_norm": 2.359375, "learning_rate": 6.2e-05, "loss": 7.8825, "mean_token_accuracy": 0.08820232152938842, "num_tokens": 282651.0, "step": 125 }, { "entropy": 9.494030666351318, "epoch": 0.014600999606896165, "grad_norm": 1.96875, "learning_rate": 6.450000000000001e-05, "loss": 7.719, "mean_token_accuracy": 0.08837165534496308, "num_tokens": 292753.0, "step": 130 }, { "entropy": 9.272327136993407, "epoch": 0.015162576514853709, "grad_norm": 1.609375, "learning_rate": 6.7e-05, "loss": 7.7167, "mean_token_accuracy": 0.0898565836250782, "num_tokens": 302981.0, "step": 135 }, { "entropy": 9.16934871673584, "epoch": 0.015724153422811252, "grad_norm": 1.5, "learning_rate": 6.950000000000001e-05, "loss": 7.6775, "mean_token_accuracy": 0.08807501792907715, "num_tokens": 314461.0, "step": 140 }, { "entropy": 8.914916038513184, "epoch": 0.0162857303307688, "grad_norm": 1.6796875, "learning_rate": 7.2e-05, "loss": 7.6052, "mean_token_accuracy": 0.09032118767499923, "num_tokens": 326877.0, "step": 145 }, { "entropy": 8.733859825134278, "epoch": 0.016847307238726343, "grad_norm": 1.5546875, "learning_rate": 7.45e-05, "loss": 7.3998, "mean_token_accuracy": 0.09276190958917141, "num_tokens": 337831.0, "step": 150 }, { "entropy": 8.528983402252198, "epoch": 0.017408884146683887, "grad_norm": 1.5703125, "learning_rate": 7.7e-05, "loss": 7.337, "mean_token_accuracy": 0.09177347123622895, "num_tokens": 348233.0, "step": 155 }, { "entropy": 8.35361089706421, "epoch": 0.017970461054641434, "grad_norm": 1.4609375, "learning_rate": 7.950000000000001e-05, "loss": 7.2213, "mean_token_accuracy": 0.09552499204874039, "num_tokens": 359113.0, "step": 160 }, { "entropy": 8.23711051940918, "epoch": 0.018532037962598977, "grad_norm": 2.703125, "learning_rate": 8.2e-05, "loss": 7.336, "mean_token_accuracy": 0.10098176226019859, "num_tokens": 370284.0, "step": 165 }, { "entropy": 8.123040294647216, "epoch": 0.01909361487055652, "grad_norm": 1.7734375, "learning_rate": 8.450000000000001e-05, "loss": 7.3538, "mean_token_accuracy": 0.08904306292533874, "num_tokens": 381415.0, "step": 170 }, { "entropy": 7.9991672992706295, "epoch": 0.019655191778514068, "grad_norm": 1.34375, "learning_rate": 8.7e-05, "loss": 7.2764, "mean_token_accuracy": 0.09914608523249627, "num_tokens": 392080.0, "step": 175 }, { "entropy": 7.944419240951538, "epoch": 0.020216768686471612, "grad_norm": 1.3359375, "learning_rate": 8.95e-05, "loss": 7.2597, "mean_token_accuracy": 0.09534113705158234, "num_tokens": 402551.0, "step": 180 }, { "entropy": 7.984531497955322, "epoch": 0.020778345594429155, "grad_norm": 1.296875, "learning_rate": 9.2e-05, "loss": 7.2418, "mean_token_accuracy": 0.09288135915994644, "num_tokens": 414670.0, "step": 185 }, { "entropy": 7.863457107543946, "epoch": 0.021339922502386702, "grad_norm": 1.1484375, "learning_rate": 9.45e-05, "loss": 7.2269, "mean_token_accuracy": 0.09570453688502312, "num_tokens": 427162.0, "step": 190 }, { "entropy": 7.844120883941651, "epoch": 0.021901499410344246, "grad_norm": 1.4296875, "learning_rate": 9.7e-05, "loss": 7.125, "mean_token_accuracy": 0.09662900492548943, "num_tokens": 438628.0, "step": 195 }, { "entropy": 7.827740716934204, "epoch": 0.022463076318301793, "grad_norm": 1.3984375, "learning_rate": 9.95e-05, "loss": 7.0534, "mean_token_accuracy": 0.10476038753986358, "num_tokens": 449248.0, "step": 200 }, { "entropy": 7.613120603561401, "epoch": 0.023024653226259337, "grad_norm": 1.2265625, "learning_rate": 0.000102, "loss": 7.0291, "mean_token_accuracy": 0.10421562120318413, "num_tokens": 460815.0, "step": 205 }, { "entropy": 7.653258895874023, "epoch": 0.02358623013421688, "grad_norm": 1.3671875, "learning_rate": 0.00010449999999999999, "loss": 7.1939, "mean_token_accuracy": 0.09638625457882881, "num_tokens": 471972.0, "step": 210 }, { "entropy": 7.694521474838257, "epoch": 0.024147807042174427, "grad_norm": 1.265625, "learning_rate": 0.000107, "loss": 7.1589, "mean_token_accuracy": 0.1014483891427517, "num_tokens": 482775.0, "step": 215 }, { "entropy": 7.650409984588623, "epoch": 0.02470938395013197, "grad_norm": 1.2421875, "learning_rate": 0.0001095, "loss": 7.087, "mean_token_accuracy": 0.10187960937619209, "num_tokens": 495151.0, "step": 220 }, { "entropy": 7.605823087692261, "epoch": 0.025270960858089515, "grad_norm": 1.328125, "learning_rate": 0.000112, "loss": 7.0608, "mean_token_accuracy": 0.10176030248403549, "num_tokens": 506947.0, "step": 225 }, { "entropy": 7.604726552963257, "epoch": 0.025832537766047062, "grad_norm": 1.421875, "learning_rate": 0.0001145, "loss": 7.0892, "mean_token_accuracy": 0.10170613378286361, "num_tokens": 519153.0, "step": 230 }, { "entropy": 7.570750951766968, "epoch": 0.026394114674004605, "grad_norm": 1.21875, "learning_rate": 0.00011700000000000001, "loss": 7.07, "mean_token_accuracy": 0.10081414431333542, "num_tokens": 531050.0, "step": 235 }, { "entropy": 7.4688334465026855, "epoch": 0.02695569158196215, "grad_norm": 1.3046875, "learning_rate": 0.00011949999999999999, "loss": 7.006, "mean_token_accuracy": 0.10289591774344445, "num_tokens": 542744.0, "step": 240 }, { "entropy": 7.563732862472534, "epoch": 0.027517268489919696, "grad_norm": 1.453125, "learning_rate": 0.000122, "loss": 7.0923, "mean_token_accuracy": 0.0983924463391304, "num_tokens": 554748.0, "step": 245 }, { "entropy": 7.534366416931152, "epoch": 0.02807884539787724, "grad_norm": 1.4765625, "learning_rate": 0.0001245, "loss": 7.0106, "mean_token_accuracy": 0.10552474185824394, "num_tokens": 564868.0, "step": 250 }, { "entropy": 7.530099248886108, "epoch": 0.028640422305834783, "grad_norm": 1.375, "learning_rate": 0.000127, "loss": 7.0091, "mean_token_accuracy": 0.11061361208558082, "num_tokens": 575668.0, "step": 255 }, { "entropy": 7.455753898620605, "epoch": 0.02920199921379233, "grad_norm": 1.1015625, "learning_rate": 0.0001295, "loss": 7.1352, "mean_token_accuracy": 0.10184136554598808, "num_tokens": 587956.0, "step": 260 }, { "entropy": 7.4932270526885985, "epoch": 0.029763576121749874, "grad_norm": 1.3984375, "learning_rate": 0.000132, "loss": 6.9785, "mean_token_accuracy": 0.10903615280985832, "num_tokens": 598246.0, "step": 265 }, { "entropy": 7.416919708251953, "epoch": 0.030325153029707418, "grad_norm": 1.2578125, "learning_rate": 0.00013450000000000002, "loss": 7.1108, "mean_token_accuracy": 0.10414381325244904, "num_tokens": 610628.0, "step": 270 }, { "entropy": 7.3690831661224365, "epoch": 0.030886729937664965, "grad_norm": 1.453125, "learning_rate": 0.00013700000000000002, "loss": 6.8616, "mean_token_accuracy": 0.1097691647708416, "num_tokens": 621214.0, "step": 275 }, { "entropy": 7.360501384735107, "epoch": 0.031448306845622505, "grad_norm": 1.3046875, "learning_rate": 0.0001395, "loss": 6.957, "mean_token_accuracy": 0.1151120163500309, "num_tokens": 631123.0, "step": 280 }, { "entropy": 7.397417736053467, "epoch": 0.032009883753580055, "grad_norm": 1.296875, "learning_rate": 0.00014199999999999998, "loss": 6.9474, "mean_token_accuracy": 0.10703005790710449, "num_tokens": 643434.0, "step": 285 }, { "entropy": 7.342480707168579, "epoch": 0.0325714606615376, "grad_norm": 1.1796875, "learning_rate": 0.0001445, "loss": 6.9321, "mean_token_accuracy": 0.11211270317435265, "num_tokens": 655336.0, "step": 290 }, { "entropy": 7.372163486480713, "epoch": 0.03313303756949514, "grad_norm": 1.5, "learning_rate": 0.000147, "loss": 6.9245, "mean_token_accuracy": 0.10963715985417366, "num_tokens": 666591.0, "step": 295 }, { "entropy": 7.286645698547363, "epoch": 0.033694614477452686, "grad_norm": 1.328125, "learning_rate": 0.0001495, "loss": 6.9458, "mean_token_accuracy": 0.10590762570500374, "num_tokens": 678288.0, "step": 300 }, { "entropy": 7.292938613891602, "epoch": 0.03425619138541023, "grad_norm": 1.21875, "learning_rate": 0.000152, "loss": 6.8788, "mean_token_accuracy": 0.11080723032355308, "num_tokens": 688526.0, "step": 305 }, { "entropy": 7.20158314704895, "epoch": 0.03481776829336777, "grad_norm": 1.1015625, "learning_rate": 0.00015450000000000001, "loss": 6.7955, "mean_token_accuracy": 0.12063507586717606, "num_tokens": 698727.0, "step": 310 }, { "entropy": 7.281469917297363, "epoch": 0.035379345201325324, "grad_norm": 1.359375, "learning_rate": 0.000157, "loss": 6.8411, "mean_token_accuracy": 0.1111941859126091, "num_tokens": 710042.0, "step": 315 }, { "entropy": 7.2135881900787355, "epoch": 0.03594092210928287, "grad_norm": 1.3125, "learning_rate": 0.0001595, "loss": 6.7838, "mean_token_accuracy": 0.11598038524389268, "num_tokens": 721390.0, "step": 320 }, { "entropy": 7.166607904434204, "epoch": 0.03650249901724041, "grad_norm": 1.3828125, "learning_rate": 0.000162, "loss": 6.9676, "mean_token_accuracy": 0.11324010118842125, "num_tokens": 732949.0, "step": 325 }, { "entropy": 7.382533311843872, "epoch": 0.037064075925197955, "grad_norm": 1.2578125, "learning_rate": 0.00016450000000000001, "loss": 6.983, "mean_token_accuracy": 0.11112697571516036, "num_tokens": 744943.0, "step": 330 }, { "entropy": 7.1175624370574955, "epoch": 0.0376256528331555, "grad_norm": 1.265625, "learning_rate": 0.00016700000000000002, "loss": 6.7549, "mean_token_accuracy": 0.11743907704949379, "num_tokens": 756579.0, "step": 335 }, { "entropy": 7.059293413162232, "epoch": 0.03818722974111304, "grad_norm": 1.3515625, "learning_rate": 0.00016950000000000003, "loss": 6.7064, "mean_token_accuracy": 0.11693573296070099, "num_tokens": 767260.0, "step": 340 }, { "entropy": 7.129382991790772, "epoch": 0.03874880664907059, "grad_norm": 1.1640625, "learning_rate": 0.00017199999999999998, "loss": 6.8055, "mean_token_accuracy": 0.11503136828541756, "num_tokens": 778163.0, "step": 345 }, { "entropy": 7.21411828994751, "epoch": 0.039310383557028136, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 6.841, "mean_token_accuracy": 0.11127241551876069, "num_tokens": 788912.0, "step": 350 }, { "entropy": 7.170050191879272, "epoch": 0.03987196046498568, "grad_norm": 1.2578125, "learning_rate": 0.000177, "loss": 6.9508, "mean_token_accuracy": 0.1135722354054451, "num_tokens": 801405.0, "step": 355 }, { "entropy": 7.058458709716797, "epoch": 0.040433537372943223, "grad_norm": 1.2890625, "learning_rate": 0.0001795, "loss": 6.7437, "mean_token_accuracy": 0.11591695919632912, "num_tokens": 813023.0, "step": 360 }, { "entropy": 7.132532978057862, "epoch": 0.04099511428090077, "grad_norm": 1.15625, "learning_rate": 0.000182, "loss": 6.7692, "mean_token_accuracy": 0.1168873094022274, "num_tokens": 823993.0, "step": 365 }, { "entropy": 7.123906469345092, "epoch": 0.04155669118885831, "grad_norm": 1.5078125, "learning_rate": 0.0001845, "loss": 6.8202, "mean_token_accuracy": 0.1134017400443554, "num_tokens": 836642.0, "step": 370 }, { "entropy": 7.020151281356812, "epoch": 0.04211826809681586, "grad_norm": 1.2421875, "learning_rate": 0.000187, "loss": 6.6249, "mean_token_accuracy": 0.12558069303631783, "num_tokens": 847475.0, "step": 375 }, { "entropy": 7.032984447479248, "epoch": 0.042679845004773405, "grad_norm": 1.15625, "learning_rate": 0.0001895, "loss": 6.6947, "mean_token_accuracy": 0.12115299850702285, "num_tokens": 857949.0, "step": 380 }, { "entropy": 7.027848196029663, "epoch": 0.04324142191273095, "grad_norm": 1.1796875, "learning_rate": 0.000192, "loss": 6.7528, "mean_token_accuracy": 0.11466690823435784, "num_tokens": 868661.0, "step": 385 }, { "entropy": 7.095096111297607, "epoch": 0.04380299882068849, "grad_norm": 1.1640625, "learning_rate": 0.0001945, "loss": 6.7906, "mean_token_accuracy": 0.11758541241288185, "num_tokens": 879651.0, "step": 390 }, { "entropy": 7.0685296058654785, "epoch": 0.044364575728646036, "grad_norm": 1.046875, "learning_rate": 0.00019700000000000002, "loss": 6.7722, "mean_token_accuracy": 0.10885974839329719, "num_tokens": 891189.0, "step": 395 }, { "entropy": 6.994202566146851, "epoch": 0.044926152636603586, "grad_norm": 1.125, "learning_rate": 0.00019950000000000002, "loss": 6.6748, "mean_token_accuracy": 0.119440957903862, "num_tokens": 902915.0, "step": 400 }, { "entropy": 7.045473241806031, "epoch": 0.04548772954456113, "grad_norm": 1.453125, "learning_rate": 0.000202, "loss": 6.7649, "mean_token_accuracy": 0.11777753084897995, "num_tokens": 914108.0, "step": 405 }, { "entropy": 7.049249458312988, "epoch": 0.046049306452518673, "grad_norm": 1.1484375, "learning_rate": 0.00020449999999999998, "loss": 6.7918, "mean_token_accuracy": 0.11295270174741745, "num_tokens": 925729.0, "step": 410 }, { "entropy": 7.0732354640960695, "epoch": 0.04661088336047622, "grad_norm": 1.3359375, "learning_rate": 0.000207, "loss": 6.7993, "mean_token_accuracy": 0.11720411777496338, "num_tokens": 936912.0, "step": 415 }, { "entropy": 6.98739104270935, "epoch": 0.04717246026843376, "grad_norm": 1.1796875, "learning_rate": 0.0002095, "loss": 6.7739, "mean_token_accuracy": 0.11668220460414887, "num_tokens": 948576.0, "step": 420 }, { "entropy": 6.989003896713257, "epoch": 0.047734037176391304, "grad_norm": 1.15625, "learning_rate": 0.000212, "loss": 6.6228, "mean_token_accuracy": 0.12309176921844482, "num_tokens": 959346.0, "step": 425 }, { "entropy": 6.867386531829834, "epoch": 0.048295614084348855, "grad_norm": 1.3125, "learning_rate": 0.0002145, "loss": 6.6393, "mean_token_accuracy": 0.12302001640200615, "num_tokens": 970124.0, "step": 430 }, { "entropy": 7.04110198020935, "epoch": 0.0488571909923064, "grad_norm": 1.3046875, "learning_rate": 0.00021700000000000002, "loss": 6.7167, "mean_token_accuracy": 0.12065900415182114, "num_tokens": 981628.0, "step": 435 }, { "entropy": 6.839612150192261, "epoch": 0.04941876790026394, "grad_norm": 1.1015625, "learning_rate": 0.0002195, "loss": 6.6603, "mean_token_accuracy": 0.12483339831233024, "num_tokens": 992423.0, "step": 440 }, { "entropy": 7.010668039321899, "epoch": 0.049980344808221486, "grad_norm": 1.1796875, "learning_rate": 0.000222, "loss": 6.6703, "mean_token_accuracy": 0.11580908223986626, "num_tokens": 1002954.0, "step": 445 }, { "entropy": 6.892636823654175, "epoch": 0.05054192171617903, "grad_norm": 1.15625, "learning_rate": 0.0002245, "loss": 6.5524, "mean_token_accuracy": 0.12802066281437874, "num_tokens": 1013351.0, "step": 450 }, { "entropy": 6.97490382194519, "epoch": 0.05110349862413657, "grad_norm": 1.1953125, "learning_rate": 0.00022700000000000002, "loss": 6.6699, "mean_token_accuracy": 0.11892755851149558, "num_tokens": 1023781.0, "step": 455 }, { "entropy": 7.029914331436157, "epoch": 0.051665075532094124, "grad_norm": 1.2109375, "learning_rate": 0.00022950000000000002, "loss": 6.7291, "mean_token_accuracy": 0.12224347591400146, "num_tokens": 1034565.0, "step": 460 }, { "entropy": 6.768797492980957, "epoch": 0.05222665244005167, "grad_norm": 1.4375, "learning_rate": 0.00023200000000000003, "loss": 6.5403, "mean_token_accuracy": 0.12486013248562813, "num_tokens": 1045595.0, "step": 465 }, { "entropy": 6.811560869216919, "epoch": 0.05278822934800921, "grad_norm": 1.25, "learning_rate": 0.00023449999999999998, "loss": 6.5365, "mean_token_accuracy": 0.12281112596392632, "num_tokens": 1056084.0, "step": 470 }, { "entropy": 6.891090345382691, "epoch": 0.053349806255966754, "grad_norm": 1.125, "learning_rate": 0.000237, "loss": 6.5832, "mean_token_accuracy": 0.12444683387875558, "num_tokens": 1067014.0, "step": 475 }, { "entropy": 6.7909644603729244, "epoch": 0.0539113831639243, "grad_norm": 1.2109375, "learning_rate": 0.0002395, "loss": 6.549, "mean_token_accuracy": 0.1283904306590557, "num_tokens": 1078557.0, "step": 480 }, { "entropy": 6.747442579269409, "epoch": 0.05447296007188184, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.6193, "mean_token_accuracy": 0.1250327579677105, "num_tokens": 1090541.0, "step": 485 }, { "entropy": 6.929131269454956, "epoch": 0.05503453697983939, "grad_norm": 1.2421875, "learning_rate": 0.0002445, "loss": 6.6901, "mean_token_accuracy": 0.12543862983584403, "num_tokens": 1101851.0, "step": 490 }, { "entropy": 6.778433561325073, "epoch": 0.055596113887796936, "grad_norm": 1.421875, "learning_rate": 0.000247, "loss": 6.5898, "mean_token_accuracy": 0.12135263979434967, "num_tokens": 1112728.0, "step": 495 }, { "entropy": 6.916776704788208, "epoch": 0.05615769079575448, "grad_norm": 1.359375, "learning_rate": 0.0002495, "loss": 6.7185, "mean_token_accuracy": 0.12112508118152618, "num_tokens": 1124537.0, "step": 500 }, { "entropy": 6.7057990550994875, "epoch": 0.05671926770371202, "grad_norm": 1.3125, "learning_rate": 0.000252, "loss": 6.6177, "mean_token_accuracy": 0.11861735060811043, "num_tokens": 1135749.0, "step": 505 }, { "entropy": 6.887033128738404, "epoch": 0.05728084461166957, "grad_norm": 1.1640625, "learning_rate": 0.0002545, "loss": 6.523, "mean_token_accuracy": 0.12177179381251335, "num_tokens": 1147597.0, "step": 510 }, { "entropy": 6.736017560958862, "epoch": 0.05784242151962711, "grad_norm": 1.125, "learning_rate": 0.000257, "loss": 6.483, "mean_token_accuracy": 0.13104297444224358, "num_tokens": 1158975.0, "step": 515 }, { "entropy": 6.74561619758606, "epoch": 0.05840399842758466, "grad_norm": 1.078125, "learning_rate": 0.0002595, "loss": 6.6127, "mean_token_accuracy": 0.12473157271742821, "num_tokens": 1170556.0, "step": 520 }, { "entropy": 6.734094333648682, "epoch": 0.058965575335542204, "grad_norm": 1.25, "learning_rate": 0.000262, "loss": 6.4825, "mean_token_accuracy": 0.12628087177872657, "num_tokens": 1180757.0, "step": 525 }, { "entropy": 6.786943149566651, "epoch": 0.05952715224349975, "grad_norm": 1.25, "learning_rate": 0.00026450000000000003, "loss": 6.5112, "mean_token_accuracy": 0.12826752737164498, "num_tokens": 1192428.0, "step": 530 }, { "entropy": 6.773551893234253, "epoch": 0.06008872915145729, "grad_norm": 1.171875, "learning_rate": 0.00026700000000000004, "loss": 6.5812, "mean_token_accuracy": 0.1194170169532299, "num_tokens": 1203867.0, "step": 535 }, { "entropy": 6.7591596126556395, "epoch": 0.060650306059414835, "grad_norm": 1.1875, "learning_rate": 0.00026950000000000005, "loss": 6.5734, "mean_token_accuracy": 0.1305850028991699, "num_tokens": 1214059.0, "step": 540 }, { "entropy": 6.792087364196777, "epoch": 0.06121188296737238, "grad_norm": 1.375, "learning_rate": 0.00027200000000000005, "loss": 6.6338, "mean_token_accuracy": 0.13109224960207938, "num_tokens": 1224750.0, "step": 545 }, { "entropy": 6.816738271713257, "epoch": 0.06177345987532993, "grad_norm": 1.2421875, "learning_rate": 0.0002745, "loss": 6.7109, "mean_token_accuracy": 0.11931365355849266, "num_tokens": 1235936.0, "step": 550 }, { "entropy": 6.697342395782471, "epoch": 0.06233503678328747, "grad_norm": 1.0625, "learning_rate": 0.000277, "loss": 6.5229, "mean_token_accuracy": 0.12435328289866447, "num_tokens": 1247619.0, "step": 555 }, { "entropy": 6.797955465316773, "epoch": 0.06289661369124501, "grad_norm": 1.1484375, "learning_rate": 0.0002795, "loss": 6.5973, "mean_token_accuracy": 0.12734515964984894, "num_tokens": 1258089.0, "step": 560 }, { "entropy": 6.7907819747924805, "epoch": 0.06345819059920256, "grad_norm": 0.984375, "learning_rate": 0.00028199999999999997, "loss": 6.6714, "mean_token_accuracy": 0.12250098884105683, "num_tokens": 1270727.0, "step": 565 }, { "entropy": 6.718038558959961, "epoch": 0.06401976750716011, "grad_norm": 1.171875, "learning_rate": 0.0002845, "loss": 6.5278, "mean_token_accuracy": 0.12575457990169525, "num_tokens": 1280886.0, "step": 570 }, { "entropy": 6.816065120697021, "epoch": 0.06458134441511765, "grad_norm": 1.2265625, "learning_rate": 0.000287, "loss": 6.5532, "mean_token_accuracy": 0.13024218007922173, "num_tokens": 1292205.0, "step": 575 }, { "entropy": 6.724169111251831, "epoch": 0.0651429213230752, "grad_norm": 1.0625, "learning_rate": 0.0002895, "loss": 6.5387, "mean_token_accuracy": 0.12204434722661972, "num_tokens": 1304621.0, "step": 580 }, { "entropy": 6.828542423248291, "epoch": 0.06570449823103273, "grad_norm": 1.2109375, "learning_rate": 0.000292, "loss": 6.6198, "mean_token_accuracy": 0.12465316653251649, "num_tokens": 1315481.0, "step": 585 }, { "entropy": 6.641292333602905, "epoch": 0.06626607513899029, "grad_norm": 1.0078125, "learning_rate": 0.0002945, "loss": 6.6021, "mean_token_accuracy": 0.12428974732756615, "num_tokens": 1328726.0, "step": 590 }, { "entropy": 6.790183639526367, "epoch": 0.06682765204694784, "grad_norm": 1.1171875, "learning_rate": 0.000297, "loss": 6.6603, "mean_token_accuracy": 0.12199008911848068, "num_tokens": 1340151.0, "step": 595 }, { "entropy": 6.6274354457855225, "epoch": 0.06738922895490537, "grad_norm": 1.1484375, "learning_rate": 0.0002995, "loss": 6.4411, "mean_token_accuracy": 0.12323693186044693, "num_tokens": 1350833.0, "step": 600 }, { "entropy": 6.738854312896729, "epoch": 0.06795080586286292, "grad_norm": 1.234375, "learning_rate": 0.000302, "loss": 6.6111, "mean_token_accuracy": 0.12676038667559625, "num_tokens": 1362332.0, "step": 605 }, { "entropy": 6.6895301818847654, "epoch": 0.06851238277082046, "grad_norm": 1.0625, "learning_rate": 0.0003045, "loss": 6.5002, "mean_token_accuracy": 0.13042355701327324, "num_tokens": 1373696.0, "step": 610 }, { "entropy": 6.526501417160034, "epoch": 0.06907395967877801, "grad_norm": 1.2109375, "learning_rate": 0.000307, "loss": 6.4218, "mean_token_accuracy": 0.1356612041592598, "num_tokens": 1383553.0, "step": 615 }, { "entropy": 6.660169887542724, "epoch": 0.06963553658673555, "grad_norm": 1.2578125, "learning_rate": 0.0003095, "loss": 6.5499, "mean_token_accuracy": 0.1267920345067978, "num_tokens": 1394487.0, "step": 620 }, { "entropy": 6.846566820144654, "epoch": 0.0701971134946931, "grad_norm": 1.015625, "learning_rate": 0.000312, "loss": 6.5606, "mean_token_accuracy": 0.13110520616173743, "num_tokens": 1404928.0, "step": 625 }, { "entropy": 6.503131103515625, "epoch": 0.07075869040265065, "grad_norm": 1.25, "learning_rate": 0.0003145, "loss": 6.4294, "mean_token_accuracy": 0.1311935856938362, "num_tokens": 1415854.0, "step": 630 }, { "entropy": 6.592182874679565, "epoch": 0.07132026731060818, "grad_norm": 1.171875, "learning_rate": 0.000317, "loss": 6.4816, "mean_token_accuracy": 0.1329976461827755, "num_tokens": 1427153.0, "step": 635 }, { "entropy": 6.661157464981079, "epoch": 0.07188184421856574, "grad_norm": 1.1875, "learning_rate": 0.0003195, "loss": 6.5885, "mean_token_accuracy": 0.12770819365978242, "num_tokens": 1438907.0, "step": 640 }, { "entropy": 6.7143834114074705, "epoch": 0.07244342112652327, "grad_norm": 1.046875, "learning_rate": 0.000322, "loss": 6.4669, "mean_token_accuracy": 0.12574334740638732, "num_tokens": 1449975.0, "step": 645 }, { "entropy": 6.589789390563965, "epoch": 0.07300499803448082, "grad_norm": 1.0390625, "learning_rate": 0.00032450000000000003, "loss": 6.4557, "mean_token_accuracy": 0.12991306632757188, "num_tokens": 1460815.0, "step": 650 }, { "entropy": 6.6092170715332035, "epoch": 0.07356657494243837, "grad_norm": 1.0625, "learning_rate": 0.00032700000000000003, "loss": 6.5044, "mean_token_accuracy": 0.1279452659189701, "num_tokens": 1472403.0, "step": 655 }, { "entropy": 6.639557504653931, "epoch": 0.07412815185039591, "grad_norm": 1.09375, "learning_rate": 0.00032950000000000004, "loss": 6.5141, "mean_token_accuracy": 0.12161320745944977, "num_tokens": 1484015.0, "step": 660 }, { "entropy": 6.653767776489258, "epoch": 0.07468972875835346, "grad_norm": 1.203125, "learning_rate": 0.00033200000000000005, "loss": 6.5425, "mean_token_accuracy": 0.12279097139835357, "num_tokens": 1495383.0, "step": 665 }, { "entropy": 6.608673715591431, "epoch": 0.075251305666311, "grad_norm": 1.0859375, "learning_rate": 0.00033450000000000005, "loss": 6.468, "mean_token_accuracy": 0.1286981873214245, "num_tokens": 1505893.0, "step": 670 }, { "entropy": 6.724495363235474, "epoch": 0.07581288257426855, "grad_norm": 1.15625, "learning_rate": 0.000337, "loss": 6.6061, "mean_token_accuracy": 0.12201442718505859, "num_tokens": 1518933.0, "step": 675 }, { "entropy": 6.7100588321685795, "epoch": 0.07637445948222608, "grad_norm": 1.0625, "learning_rate": 0.0003395, "loss": 6.6149, "mean_token_accuracy": 0.1266277812421322, "num_tokens": 1530603.0, "step": 680 }, { "entropy": 6.643559837341309, "epoch": 0.07693603639018363, "grad_norm": 1.1171875, "learning_rate": 0.000342, "loss": 6.4551, "mean_token_accuracy": 0.131996688246727, "num_tokens": 1540977.0, "step": 685 }, { "entropy": 6.6613860607147215, "epoch": 0.07749761329814119, "grad_norm": 1.0625, "learning_rate": 0.00034449999999999997, "loss": 6.5621, "mean_token_accuracy": 0.12197319865226745, "num_tokens": 1553004.0, "step": 690 }, { "entropy": 6.604646968841553, "epoch": 0.07805919020609872, "grad_norm": 1.140625, "learning_rate": 0.000347, "loss": 6.4726, "mean_token_accuracy": 0.12990233227610587, "num_tokens": 1563446.0, "step": 695 }, { "entropy": 6.59793119430542, "epoch": 0.07862076711405627, "grad_norm": 1.140625, "learning_rate": 0.0003495, "loss": 6.5153, "mean_token_accuracy": 0.1260698601603508, "num_tokens": 1573884.0, "step": 700 }, { "entropy": 6.554755544662475, "epoch": 0.07918234402201381, "grad_norm": 1.1328125, "learning_rate": 0.000352, "loss": 6.3739, "mean_token_accuracy": 0.13849396333098413, "num_tokens": 1585396.0, "step": 705 }, { "entropy": 6.4631202697753904, "epoch": 0.07974392092997136, "grad_norm": 1.1953125, "learning_rate": 0.0003545, "loss": 6.3757, "mean_token_accuracy": 0.1374616429209709, "num_tokens": 1596934.0, "step": 710 }, { "entropy": 6.508552122116089, "epoch": 0.08030549783792891, "grad_norm": 1.0625, "learning_rate": 0.000357, "loss": 6.4243, "mean_token_accuracy": 0.13476341739296913, "num_tokens": 1608069.0, "step": 715 }, { "entropy": 6.504626750946045, "epoch": 0.08086707474588645, "grad_norm": 1.234375, "learning_rate": 0.0003595, "loss": 6.345, "mean_token_accuracy": 0.1367340750992298, "num_tokens": 1619532.0, "step": 720 }, { "entropy": 6.577574253082275, "epoch": 0.081428651653844, "grad_norm": 1.15625, "learning_rate": 0.000362, "loss": 6.5057, "mean_token_accuracy": 0.12562305480241776, "num_tokens": 1630697.0, "step": 725 }, { "entropy": 6.569473791122436, "epoch": 0.08199022856180153, "grad_norm": 1.1640625, "learning_rate": 0.0003645, "loss": 6.483, "mean_token_accuracy": 0.12953646928071977, "num_tokens": 1641854.0, "step": 730 }, { "entropy": 6.676255798339843, "epoch": 0.08255180546975908, "grad_norm": 1.078125, "learning_rate": 0.000367, "loss": 6.6127, "mean_token_accuracy": 0.1251482017338276, "num_tokens": 1653036.0, "step": 735 }, { "entropy": 6.500600099563599, "epoch": 0.08311338237771662, "grad_norm": 1.1015625, "learning_rate": 0.0003695, "loss": 6.3686, "mean_token_accuracy": 0.12898936495184898, "num_tokens": 1664096.0, "step": 740 }, { "entropy": 6.575688219070434, "epoch": 0.08367495928567417, "grad_norm": 0.96875, "learning_rate": 0.000372, "loss": 6.5405, "mean_token_accuracy": 0.12776357308030128, "num_tokens": 1677890.0, "step": 745 }, { "entropy": 6.513050270080567, "epoch": 0.08423653619363172, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 6.4039, "mean_token_accuracy": 0.13092774003744126, "num_tokens": 1687627.0, "step": 750 }, { "entropy": 6.6496001243591305, "epoch": 0.08479811310158926, "grad_norm": 1.1015625, "learning_rate": 0.000377, "loss": 6.6299, "mean_token_accuracy": 0.12669486477971076, "num_tokens": 1700843.0, "step": 755 }, { "entropy": 6.54553918838501, "epoch": 0.08535969000954681, "grad_norm": 1.0703125, "learning_rate": 0.0003795, "loss": 6.4485, "mean_token_accuracy": 0.12898636609315872, "num_tokens": 1712356.0, "step": 760 }, { "entropy": 6.5033485889434814, "epoch": 0.08592126691750435, "grad_norm": 1.1484375, "learning_rate": 0.000382, "loss": 6.44, "mean_token_accuracy": 0.1329922027885914, "num_tokens": 1722041.0, "step": 765 }, { "entropy": 6.540292739868164, "epoch": 0.0864828438254619, "grad_norm": 1.1171875, "learning_rate": 0.0003845, "loss": 6.5334, "mean_token_accuracy": 0.12715438082814218, "num_tokens": 1733628.0, "step": 770 }, { "entropy": 6.52957124710083, "epoch": 0.08704442073341945, "grad_norm": 1.0546875, "learning_rate": 0.00038700000000000003, "loss": 6.3951, "mean_token_accuracy": 0.13516492396593094, "num_tokens": 1745174.0, "step": 775 }, { "entropy": 6.472682189941406, "epoch": 0.08760599764137698, "grad_norm": 1.0390625, "learning_rate": 0.00038950000000000003, "loss": 6.3261, "mean_token_accuracy": 0.13572794049978257, "num_tokens": 1757117.0, "step": 780 }, { "entropy": 6.4541521072387695, "epoch": 0.08816757454933453, "grad_norm": 1.0078125, "learning_rate": 0.00039200000000000004, "loss": 6.3477, "mean_token_accuracy": 0.13643818646669387, "num_tokens": 1767343.0, "step": 785 }, { "entropy": 6.52891354560852, "epoch": 0.08872915145729207, "grad_norm": 1.0859375, "learning_rate": 0.00039450000000000005, "loss": 6.4341, "mean_token_accuracy": 0.1295755423605442, "num_tokens": 1778500.0, "step": 790 }, { "entropy": 6.495887565612793, "epoch": 0.08929072836524962, "grad_norm": 1.1015625, "learning_rate": 0.00039700000000000005, "loss": 6.4257, "mean_token_accuracy": 0.13391977846622466, "num_tokens": 1788474.0, "step": 795 }, { "entropy": 6.669151258468628, "epoch": 0.08985230527320717, "grad_norm": 1.1171875, "learning_rate": 0.0003995, "loss": 6.6066, "mean_token_accuracy": 0.12243209406733513, "num_tokens": 1800756.0, "step": 800 }, { "entropy": 6.264161491394043, "epoch": 0.09041388218116471, "grad_norm": 1.0703125, "learning_rate": 0.000402, "loss": 6.3051, "mean_token_accuracy": 0.13255022764205932, "num_tokens": 1812172.0, "step": 805 }, { "entropy": 6.581796360015869, "epoch": 0.09097545908912226, "grad_norm": 1.1640625, "learning_rate": 0.0004045, "loss": 6.4369, "mean_token_accuracy": 0.13564810305833816, "num_tokens": 1822057.0, "step": 810 }, { "entropy": 6.388931703567505, "epoch": 0.0915370359970798, "grad_norm": 0.97265625, "learning_rate": 0.00040699999999999997, "loss": 6.3692, "mean_token_accuracy": 0.13979063034057618, "num_tokens": 1833074.0, "step": 815 }, { "entropy": 6.4439905166625975, "epoch": 0.09209861290503735, "grad_norm": 1.1015625, "learning_rate": 0.0004095, "loss": 6.3689, "mean_token_accuracy": 0.1369178406894207, "num_tokens": 1844932.0, "step": 820 }, { "entropy": 6.451093339920044, "epoch": 0.09266018981299488, "grad_norm": 1.09375, "learning_rate": 0.000412, "loss": 6.3812, "mean_token_accuracy": 0.13171854838728905, "num_tokens": 1855591.0, "step": 825 }, { "entropy": 6.412005949020386, "epoch": 0.09322176672095243, "grad_norm": 0.98828125, "learning_rate": 0.0004145, "loss": 6.3368, "mean_token_accuracy": 0.13641790226101874, "num_tokens": 1866726.0, "step": 830 }, { "entropy": 6.4959104537963865, "epoch": 0.09378334362890998, "grad_norm": 1.140625, "learning_rate": 0.000417, "loss": 6.3763, "mean_token_accuracy": 0.13648990392684937, "num_tokens": 1877385.0, "step": 835 }, { "entropy": 6.375614738464355, "epoch": 0.09434492053686752, "grad_norm": 1.125, "learning_rate": 0.0004195, "loss": 6.2828, "mean_token_accuracy": 0.1361901879310608, "num_tokens": 1887905.0, "step": 840 }, { "entropy": 6.32490758895874, "epoch": 0.09490649744482507, "grad_norm": 1.09375, "learning_rate": 0.000422, "loss": 6.3418, "mean_token_accuracy": 0.13226142525672913, "num_tokens": 1898649.0, "step": 845 }, { "entropy": 6.440097618103027, "epoch": 0.09546807435278261, "grad_norm": 1.25, "learning_rate": 0.0004245, "loss": 6.3581, "mean_token_accuracy": 0.12981755211949347, "num_tokens": 1908808.0, "step": 850 }, { "entropy": 6.449653148651123, "epoch": 0.09602965126074016, "grad_norm": 1.0859375, "learning_rate": 0.000427, "loss": 6.4636, "mean_token_accuracy": 0.13088747188448907, "num_tokens": 1920360.0, "step": 855 }, { "entropy": 6.425679159164429, "epoch": 0.09659122816869771, "grad_norm": 1.171875, "learning_rate": 0.0004295, "loss": 6.3601, "mean_token_accuracy": 0.13659372106194495, "num_tokens": 1931082.0, "step": 860 }, { "entropy": 6.450051259994507, "epoch": 0.09715280507665525, "grad_norm": 1.0859375, "learning_rate": 0.000432, "loss": 6.5104, "mean_token_accuracy": 0.13292263224720954, "num_tokens": 1942712.0, "step": 865 }, { "entropy": 6.353779935836792, "epoch": 0.0977143819846128, "grad_norm": 1.234375, "learning_rate": 0.0004345, "loss": 6.2649, "mean_token_accuracy": 0.13690216466784477, "num_tokens": 1953316.0, "step": 870 }, { "entropy": 6.438309907913208, "epoch": 0.09827595889257033, "grad_norm": 1.2265625, "learning_rate": 0.000437, "loss": 6.3389, "mean_token_accuracy": 0.13307465687394143, "num_tokens": 1963936.0, "step": 875 }, { "entropy": 6.4518403053283695, "epoch": 0.09883753580052788, "grad_norm": 1.1484375, "learning_rate": 0.0004395, "loss": 6.3619, "mean_token_accuracy": 0.1389799363911152, "num_tokens": 1974502.0, "step": 880 }, { "entropy": 6.3525231838226315, "epoch": 0.09939911270848542, "grad_norm": 0.90625, "learning_rate": 0.000442, "loss": 6.2961, "mean_token_accuracy": 0.14234573692083358, "num_tokens": 1985746.0, "step": 885 }, { "entropy": 6.370750093460083, "epoch": 0.09996068961644297, "grad_norm": 1.109375, "learning_rate": 0.0004445, "loss": 6.3998, "mean_token_accuracy": 0.1339979127049446, "num_tokens": 1997696.0, "step": 890 }, { "entropy": 6.476981210708618, "epoch": 0.10052226652440052, "grad_norm": 1.078125, "learning_rate": 0.000447, "loss": 6.3688, "mean_token_accuracy": 0.13148148730397224, "num_tokens": 2009462.0, "step": 895 }, { "entropy": 6.306058502197265, "epoch": 0.10108384343235806, "grad_norm": 1.1015625, "learning_rate": 0.00044950000000000003, "loss": 6.3004, "mean_token_accuracy": 0.13532110527157784, "num_tokens": 2019547.0, "step": 900 }, { "entropy": 6.276200008392334, "epoch": 0.10164542034031561, "grad_norm": 1.1015625, "learning_rate": 0.00045200000000000004, "loss": 6.3087, "mean_token_accuracy": 0.1303063564002514, "num_tokens": 2030990.0, "step": 905 }, { "entropy": 6.328003215789795, "epoch": 0.10220699724827315, "grad_norm": 0.8984375, "learning_rate": 0.00045450000000000004, "loss": 6.379, "mean_token_accuracy": 0.13275872617959977, "num_tokens": 2042488.0, "step": 910 }, { "entropy": 6.5090795993804935, "epoch": 0.1027685741562307, "grad_norm": 1.125, "learning_rate": 0.00045700000000000005, "loss": 6.4124, "mean_token_accuracy": 0.13137131109833716, "num_tokens": 2052822.0, "step": 915 }, { "entropy": 6.463271427154541, "epoch": 0.10333015106418825, "grad_norm": 1.015625, "learning_rate": 0.00045950000000000006, "loss": 6.3703, "mean_token_accuracy": 0.1341596059501171, "num_tokens": 2063274.0, "step": 920 }, { "entropy": 6.4825742721557615, "epoch": 0.10389172797214578, "grad_norm": 1.0703125, "learning_rate": 0.000462, "loss": 6.4069, "mean_token_accuracy": 0.13037585765123366, "num_tokens": 2074424.0, "step": 925 }, { "entropy": 6.314002275466919, "epoch": 0.10445330488010333, "grad_norm": 1.0546875, "learning_rate": 0.0004645, "loss": 6.4013, "mean_token_accuracy": 0.13306034207344056, "num_tokens": 2085776.0, "step": 930 }, { "entropy": 6.591546201705933, "epoch": 0.10501488178806087, "grad_norm": 0.96484375, "learning_rate": 0.000467, "loss": 6.4721, "mean_token_accuracy": 0.13484944850206376, "num_tokens": 2096789.0, "step": 935 }, { "entropy": 6.330018711090088, "epoch": 0.10557645869601842, "grad_norm": 1.0546875, "learning_rate": 0.0004695, "loss": 6.3848, "mean_token_accuracy": 0.13674520328640938, "num_tokens": 2108335.0, "step": 940 }, { "entropy": 6.46536111831665, "epoch": 0.10613803560397596, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.4749, "mean_token_accuracy": 0.13200692012906073, "num_tokens": 2121063.0, "step": 945 }, { "entropy": 6.343993902206421, "epoch": 0.10669961251193351, "grad_norm": 1.0625, "learning_rate": 0.0004745, "loss": 6.3351, "mean_token_accuracy": 0.1397795021533966, "num_tokens": 2132442.0, "step": 950 }, { "entropy": 6.362326002120971, "epoch": 0.10726118941989106, "grad_norm": 1.0625, "learning_rate": 0.000477, "loss": 6.2455, "mean_token_accuracy": 0.1406833589076996, "num_tokens": 2142155.0, "step": 955 }, { "entropy": 6.290420150756836, "epoch": 0.1078227663278486, "grad_norm": 1.1171875, "learning_rate": 0.0004795, "loss": 6.3118, "mean_token_accuracy": 0.13632866069674493, "num_tokens": 2152923.0, "step": 960 }, { "entropy": 6.347664928436279, "epoch": 0.10838434323580615, "grad_norm": 1.0390625, "learning_rate": 0.000482, "loss": 6.3058, "mean_token_accuracy": 0.13932796120643615, "num_tokens": 2164640.0, "step": 965 }, { "entropy": 6.229414701461792, "epoch": 0.10894592014376368, "grad_norm": 1.0703125, "learning_rate": 0.0004845, "loss": 6.2222, "mean_token_accuracy": 0.13819631040096284, "num_tokens": 2175403.0, "step": 970 }, { "entropy": 6.34880313873291, "epoch": 0.10950749705172123, "grad_norm": 1.0625, "learning_rate": 0.000487, "loss": 6.3313, "mean_token_accuracy": 0.1353020928800106, "num_tokens": 2186031.0, "step": 975 }, { "entropy": 6.380644750595093, "epoch": 0.11006907395967878, "grad_norm": 1.21875, "learning_rate": 0.0004895, "loss": 6.3329, "mean_token_accuracy": 0.13262429535388948, "num_tokens": 2198152.0, "step": 980 }, { "entropy": 6.278173971176147, "epoch": 0.11063065086763632, "grad_norm": 1.0859375, "learning_rate": 0.000492, "loss": 6.338, "mean_token_accuracy": 0.13674701675772666, "num_tokens": 2209435.0, "step": 985 }, { "entropy": 6.350253009796143, "epoch": 0.11119222777559387, "grad_norm": 1.1015625, "learning_rate": 0.0004945, "loss": 6.2994, "mean_token_accuracy": 0.14112076461315154, "num_tokens": 2219476.0, "step": 990 }, { "entropy": 6.3657073974609375, "epoch": 0.11175380468355141, "grad_norm": 1.0546875, "learning_rate": 0.000497, "loss": 6.3837, "mean_token_accuracy": 0.13610237762331961, "num_tokens": 2231131.0, "step": 995 }, { "entropy": 6.300810956954956, "epoch": 0.11231538159150896, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.2892, "mean_token_accuracy": 0.1371823087334633, "num_tokens": 2242309.0, "step": 1000 }, { "entropy": 6.2305169105529785, "epoch": 0.1128769584994665, "grad_norm": 1.0078125, "learning_rate": 0.000499999997707492, "loss": 6.1273, "mean_token_accuracy": 0.1387334682047367, "num_tokens": 2252236.0, "step": 1005 }, { "entropy": 6.3840419292449955, "epoch": 0.11343853540742405, "grad_norm": 1.1640625, "learning_rate": 0.0004999999883941787, "loss": 6.4504, "mean_token_accuracy": 0.1293959580361843, "num_tokens": 2263529.0, "step": 1010 }, { "entropy": 6.223633098602295, "epoch": 0.1140001123153816, "grad_norm": 1.0859375, "learning_rate": 0.0004999999719167785, "loss": 6.2809, "mean_token_accuracy": 0.13737061843276024, "num_tokens": 2275318.0, "step": 1015 }, { "entropy": 6.3728053092956545, "epoch": 0.11456168922333913, "grad_norm": 1.125, "learning_rate": 0.0004999999482752917, "loss": 6.3265, "mean_token_accuracy": 0.13787831887602806, "num_tokens": 2287434.0, "step": 1020 }, { "entropy": 6.254129695892334, "epoch": 0.11512326613129668, "grad_norm": 1.0859375, "learning_rate": 0.0004999999174697195, "loss": 6.2315, "mean_token_accuracy": 0.13839245587587357, "num_tokens": 2299145.0, "step": 1025 }, { "entropy": 6.261599349975586, "epoch": 0.11568484303925422, "grad_norm": 1.03125, "learning_rate": 0.0004999998795000627, "loss": 6.3257, "mean_token_accuracy": 0.13926222771406174, "num_tokens": 2309841.0, "step": 1030 }, { "entropy": 6.315525674819947, "epoch": 0.11624641994721177, "grad_norm": 0.9375, "learning_rate": 0.0004999998343663223, "loss": 6.3193, "mean_token_accuracy": 0.1403449870646, "num_tokens": 2322143.0, "step": 1035 }, { "entropy": 6.261302518844604, "epoch": 0.11680799685516932, "grad_norm": 1.0234375, "learning_rate": 0.0004999997820685, "loss": 6.2402, "mean_token_accuracy": 0.13240669071674346, "num_tokens": 2333207.0, "step": 1040 }, { "entropy": 6.1786919116973875, "epoch": 0.11736957376312686, "grad_norm": 0.9140625, "learning_rate": 0.0004999997226065974, "loss": 6.3105, "mean_token_accuracy": 0.13664863780140876, "num_tokens": 2345542.0, "step": 1045 }, { "entropy": 6.371749353408814, "epoch": 0.11793115067108441, "grad_norm": 1.03125, "learning_rate": 0.0004999996559806163, "loss": 6.3079, "mean_token_accuracy": 0.14061758145689965, "num_tokens": 2356612.0, "step": 1050 }, { "entropy": 6.225208377838134, "epoch": 0.11849272757904195, "grad_norm": 0.99609375, "learning_rate": 0.0004999995821905589, "loss": 6.2306, "mean_token_accuracy": 0.13814162313938141, "num_tokens": 2368204.0, "step": 1055 }, { "entropy": 6.262781095504761, "epoch": 0.1190543044869995, "grad_norm": 1.1640625, "learning_rate": 0.0004999995012364276, "loss": 6.264, "mean_token_accuracy": 0.14789239913225175, "num_tokens": 2379114.0, "step": 1060 }, { "entropy": 6.258517122268676, "epoch": 0.11961588139495703, "grad_norm": 0.91015625, "learning_rate": 0.0004999994131182248, "loss": 6.3024, "mean_token_accuracy": 0.1361288011074066, "num_tokens": 2390562.0, "step": 1065 }, { "entropy": 6.30267333984375, "epoch": 0.12017745830291458, "grad_norm": 1.046875, "learning_rate": 0.0004999993178359535, "loss": 6.3561, "mean_token_accuracy": 0.13576339259743692, "num_tokens": 2402352.0, "step": 1070 }, { "entropy": 6.422991371154785, "epoch": 0.12073903521087213, "grad_norm": 1.046875, "learning_rate": 0.0004999992153896166, "loss": 6.3906, "mean_token_accuracy": 0.1379263438284397, "num_tokens": 2415140.0, "step": 1075 }, { "entropy": 6.226438283920288, "epoch": 0.12130061211882967, "grad_norm": 1.0703125, "learning_rate": 0.0004999991057792175, "loss": 6.2828, "mean_token_accuracy": 0.13986248895525932, "num_tokens": 2426679.0, "step": 1080 }, { "entropy": 6.307008361816406, "epoch": 0.12186218902678722, "grad_norm": 1.0625, "learning_rate": 0.0004999989890047596, "loss": 6.3213, "mean_token_accuracy": 0.14080586433410644, "num_tokens": 2437735.0, "step": 1085 }, { "entropy": 6.244773292541504, "epoch": 0.12242376593474476, "grad_norm": 1.0703125, "learning_rate": 0.0004999988650662467, "loss": 6.2433, "mean_token_accuracy": 0.13999149277806283, "num_tokens": 2448611.0, "step": 1090 }, { "entropy": 6.176812791824341, "epoch": 0.12298534284270231, "grad_norm": 0.96875, "learning_rate": 0.0004999987339636825, "loss": 6.1729, "mean_token_accuracy": 0.14464567825198174, "num_tokens": 2461101.0, "step": 1095 }, { "entropy": 6.265973329544067, "epoch": 0.12354691975065986, "grad_norm": 1.046875, "learning_rate": 0.0004999985956970713, "loss": 6.3176, "mean_token_accuracy": 0.13885853216052055, "num_tokens": 2473569.0, "step": 1100 }, { "entropy": 6.171710395812989, "epoch": 0.1241084966586174, "grad_norm": 1.1328125, "learning_rate": 0.0004999984502664178, "loss": 6.2382, "mean_token_accuracy": 0.13876865357160567, "num_tokens": 2483970.0, "step": 1105 }, { "entropy": 6.363559436798096, "epoch": 0.12467007356657495, "grad_norm": 0.9296875, "learning_rate": 0.0004999982976717261, "loss": 6.2895, "mean_token_accuracy": 0.14146780967712402, "num_tokens": 2494184.0, "step": 1110 }, { "entropy": 6.217218828201294, "epoch": 0.1252316504745325, "grad_norm": 0.93359375, "learning_rate": 0.0004999981379130016, "loss": 6.3041, "mean_token_accuracy": 0.14307402372360228, "num_tokens": 2505715.0, "step": 1115 }, { "entropy": 6.386610078811645, "epoch": 0.12579322738249002, "grad_norm": 1.0546875, "learning_rate": 0.000499997970990249, "loss": 6.3412, "mean_token_accuracy": 0.14221135526895523, "num_tokens": 2517168.0, "step": 1120 }, { "entropy": 6.303906965255737, "epoch": 0.12635480429044757, "grad_norm": 0.9375, "learning_rate": 0.0004999977969034737, "loss": 6.3674, "mean_token_accuracy": 0.1398570343852043, "num_tokens": 2528296.0, "step": 1125 }, { "entropy": 6.249405193328857, "epoch": 0.12691638119840512, "grad_norm": 1.1171875, "learning_rate": 0.0004999976156526814, "loss": 6.3056, "mean_token_accuracy": 0.14569928944110871, "num_tokens": 2540648.0, "step": 1130 }, { "entropy": 6.177938985824585, "epoch": 0.12747795810636267, "grad_norm": 1.078125, "learning_rate": 0.0004999974272378776, "loss": 6.1885, "mean_token_accuracy": 0.14313262403011323, "num_tokens": 2551840.0, "step": 1135 }, { "entropy": 6.324184131622315, "epoch": 0.12803953501432022, "grad_norm": 1.0703125, "learning_rate": 0.0004999972316590685, "loss": 6.2524, "mean_token_accuracy": 0.1379991091787815, "num_tokens": 2561362.0, "step": 1140 }, { "entropy": 6.31357970237732, "epoch": 0.12860111192227774, "grad_norm": 0.9765625, "learning_rate": 0.0004999970289162604, "loss": 6.298, "mean_token_accuracy": 0.14433052241802216, "num_tokens": 2573584.0, "step": 1145 }, { "entropy": 6.446721315383911, "epoch": 0.1291626888302353, "grad_norm": 1.109375, "learning_rate": 0.0004999968190094595, "loss": 6.4204, "mean_token_accuracy": 0.1336354859173298, "num_tokens": 2585255.0, "step": 1150 }, { "entropy": 6.054596328735352, "epoch": 0.12972426573819285, "grad_norm": 1.0078125, "learning_rate": 0.0004999966019386727, "loss": 6.226, "mean_token_accuracy": 0.14078792110085486, "num_tokens": 2596849.0, "step": 1155 }, { "entropy": 6.258234024047852, "epoch": 0.1302858426461504, "grad_norm": 1.0546875, "learning_rate": 0.0004999963777039067, "loss": 6.2622, "mean_token_accuracy": 0.13961924761533737, "num_tokens": 2606918.0, "step": 1160 }, { "entropy": 6.1849829196929935, "epoch": 0.13084741955410795, "grad_norm": 0.984375, "learning_rate": 0.000499996146305169, "loss": 6.1952, "mean_token_accuracy": 0.14556236416101456, "num_tokens": 2617779.0, "step": 1165 }, { "entropy": 6.273143911361695, "epoch": 0.13140899646206547, "grad_norm": 0.9921875, "learning_rate": 0.0004999959077424665, "loss": 6.2513, "mean_token_accuracy": 0.13997638300061227, "num_tokens": 2630294.0, "step": 1170 }, { "entropy": 6.12783145904541, "epoch": 0.13197057337002302, "grad_norm": 0.9609375, "learning_rate": 0.0004999956620158072, "loss": 6.1548, "mean_token_accuracy": 0.14402848556637765, "num_tokens": 2641002.0, "step": 1175 }, { "entropy": 6.1911145687103275, "epoch": 0.13253215027798057, "grad_norm": 0.9375, "learning_rate": 0.0004999954091251987, "loss": 6.1448, "mean_token_accuracy": 0.14548660516738893, "num_tokens": 2652188.0, "step": 1180 }, { "entropy": 6.125283575057983, "epoch": 0.13309372718593812, "grad_norm": 1.1484375, "learning_rate": 0.0004999951490706491, "loss": 6.1865, "mean_token_accuracy": 0.14291539043188095, "num_tokens": 2662542.0, "step": 1185 }, { "entropy": 6.296076965332031, "epoch": 0.13365530409389567, "grad_norm": 0.92578125, "learning_rate": 0.0004999948818521667, "loss": 6.2038, "mean_token_accuracy": 0.1425152152776718, "num_tokens": 2673292.0, "step": 1190 }, { "entropy": 6.177773904800415, "epoch": 0.1342168810018532, "grad_norm": 0.99609375, "learning_rate": 0.00049999460746976, "loss": 6.2022, "mean_token_accuracy": 0.1450867235660553, "num_tokens": 2684042.0, "step": 1195 }, { "entropy": 6.199269771575928, "epoch": 0.13477845790981074, "grad_norm": 1.0625, "learning_rate": 0.0004999943259234377, "loss": 6.1304, "mean_token_accuracy": 0.1481417030096054, "num_tokens": 2694716.0, "step": 1200 }, { "entropy": 6.261506462097168, "epoch": 0.1353400348177683, "grad_norm": 0.98046875, "learning_rate": 0.0004999940372132089, "loss": 6.2723, "mean_token_accuracy": 0.1427570842206478, "num_tokens": 2706200.0, "step": 1205 }, { "entropy": 6.097541093826294, "epoch": 0.13590161172572585, "grad_norm": 0.9375, "learning_rate": 0.0004999937413390826, "loss": 6.0978, "mean_token_accuracy": 0.14956343919038773, "num_tokens": 2716814.0, "step": 1210 }, { "entropy": 6.26879563331604, "epoch": 0.1364631886336834, "grad_norm": 1.0546875, "learning_rate": 0.0004999934383010683, "loss": 6.2646, "mean_token_accuracy": 0.13633433505892753, "num_tokens": 2728042.0, "step": 1215 }, { "entropy": 6.117309093475342, "epoch": 0.13702476554164092, "grad_norm": 1.1171875, "learning_rate": 0.0004999931280991757, "loss": 6.2276, "mean_token_accuracy": 0.13767654895782472, "num_tokens": 2739093.0, "step": 1220 }, { "entropy": 6.323478746414184, "epoch": 0.13758634244959847, "grad_norm": 0.984375, "learning_rate": 0.0004999928107334146, "loss": 6.2653, "mean_token_accuracy": 0.14359876736998559, "num_tokens": 2750307.0, "step": 1225 }, { "entropy": 6.146844863891602, "epoch": 0.13814791935755602, "grad_norm": 1.0234375, "learning_rate": 0.0004999924862037952, "loss": 6.1785, "mean_token_accuracy": 0.142026449739933, "num_tokens": 2760534.0, "step": 1230 }, { "entropy": 6.146856021881104, "epoch": 0.13870949626551357, "grad_norm": 0.9296875, "learning_rate": 0.0004999921545103278, "loss": 6.2017, "mean_token_accuracy": 0.1402510516345501, "num_tokens": 2772459.0, "step": 1235 }, { "entropy": 6.118765497207642, "epoch": 0.1392710731734711, "grad_norm": 0.97265625, "learning_rate": 0.0004999918156530229, "loss": 6.1162, "mean_token_accuracy": 0.15379080772399903, "num_tokens": 2784038.0, "step": 1240 }, { "entropy": 6.237395238876343, "epoch": 0.13983265008142864, "grad_norm": 0.88671875, "learning_rate": 0.0004999914696318913, "loss": 6.24, "mean_token_accuracy": 0.14800693467259407, "num_tokens": 2795756.0, "step": 1245 }, { "entropy": 6.129542446136474, "epoch": 0.1403942269893862, "grad_norm": 1.0078125, "learning_rate": 0.0004999911164469441, "loss": 6.1721, "mean_token_accuracy": 0.14674090445041657, "num_tokens": 2806242.0, "step": 1250 }, { "entropy": 6.290287971496582, "epoch": 0.14095580389734375, "grad_norm": 0.9609375, "learning_rate": 0.0004999907560981925, "loss": 6.2556, "mean_token_accuracy": 0.14589913040399552, "num_tokens": 2817017.0, "step": 1255 }, { "entropy": 6.189040660858154, "epoch": 0.1415173808053013, "grad_norm": 0.93359375, "learning_rate": 0.0004999903885856479, "loss": 6.1629, "mean_token_accuracy": 0.15110919922590255, "num_tokens": 2827415.0, "step": 1260 }, { "entropy": 6.141000080108642, "epoch": 0.14207895771325882, "grad_norm": 1.0859375, "learning_rate": 0.000499990013909322, "loss": 6.1726, "mean_token_accuracy": 0.14932918325066566, "num_tokens": 2837595.0, "step": 1265 }, { "entropy": 6.088430595397949, "epoch": 0.14264053462121637, "grad_norm": 1.03125, "learning_rate": 0.000499989632069227, "loss": 6.1339, "mean_token_accuracy": 0.14398894980549812, "num_tokens": 2847906.0, "step": 1270 }, { "entropy": 6.23743634223938, "epoch": 0.14320211152917392, "grad_norm": 1.03125, "learning_rate": 0.0004999892430653747, "loss": 6.2346, "mean_token_accuracy": 0.13501434922218322, "num_tokens": 2859145.0, "step": 1275 }, { "entropy": 6.056405162811279, "epoch": 0.14376368843713147, "grad_norm": 0.90234375, "learning_rate": 0.0004999888468977776, "loss": 6.1648, "mean_token_accuracy": 0.14927329123020172, "num_tokens": 2870704.0, "step": 1280 }, { "entropy": 6.249700832366943, "epoch": 0.14432526534508902, "grad_norm": 0.90625, "learning_rate": 0.0004999884435664485, "loss": 6.2647, "mean_token_accuracy": 0.14412776455283166, "num_tokens": 2881861.0, "step": 1285 }, { "entropy": 6.240557241439819, "epoch": 0.14488684225304654, "grad_norm": 1.53125, "learning_rate": 0.0004999880330714, "loss": 6.1861, "mean_token_accuracy": 0.14692625999450684, "num_tokens": 2893247.0, "step": 1290 }, { "entropy": 6.075284337997436, "epoch": 0.1454484191610041, "grad_norm": 0.9375, "learning_rate": 0.0004999876154126453, "loss": 6.0185, "mean_token_accuracy": 0.1487583711743355, "num_tokens": 2905351.0, "step": 1295 }, { "entropy": 6.0624950408935545, "epoch": 0.14600999606896164, "grad_norm": 1.125, "learning_rate": 0.0004999871905901977, "loss": 6.1821, "mean_token_accuracy": 0.14871341213583947, "num_tokens": 2915153.0, "step": 1300 }, { "entropy": 6.169287776947021, "epoch": 0.1465715729769192, "grad_norm": 1.0078125, "learning_rate": 0.0004999867586040706, "loss": 6.1416, "mean_token_accuracy": 0.13760501518845558, "num_tokens": 2926234.0, "step": 1305 }, { "entropy": 6.069522142410278, "epoch": 0.14713314988487675, "grad_norm": 0.88671875, "learning_rate": 0.0004999863194542779, "loss": 6.0943, "mean_token_accuracy": 0.14693765938282013, "num_tokens": 2937033.0, "step": 1310 }, { "entropy": 6.068335819244385, "epoch": 0.14769472679283427, "grad_norm": 0.984375, "learning_rate": 0.0004999858731408336, "loss": 6.0518, "mean_token_accuracy": 0.14859263896942138, "num_tokens": 2945904.0, "step": 1315 }, { "entropy": 6.208248567581177, "epoch": 0.14825630370079182, "grad_norm": 1.1015625, "learning_rate": 0.0004999854196637518, "loss": 6.253, "mean_token_accuracy": 0.14146910086274148, "num_tokens": 2956298.0, "step": 1320 }, { "entropy": 6.151482725143433, "epoch": 0.14881788060874937, "grad_norm": 0.98828125, "learning_rate": 0.0004999849590230469, "loss": 6.1522, "mean_token_accuracy": 0.14781234338879584, "num_tokens": 2967660.0, "step": 1325 }, { "entropy": 6.198898839950561, "epoch": 0.14937945751670692, "grad_norm": 1.0390625, "learning_rate": 0.0004999844912187336, "loss": 6.2205, "mean_token_accuracy": 0.1416272446513176, "num_tokens": 2978616.0, "step": 1330 }, { "entropy": 6.0869788646698, "epoch": 0.14994103442466447, "grad_norm": 1.0234375, "learning_rate": 0.000499984016250827, "loss": 6.0738, "mean_token_accuracy": 0.15207655876874923, "num_tokens": 2989731.0, "step": 1335 }, { "entropy": 6.171562576293946, "epoch": 0.150502611332622, "grad_norm": 0.9453125, "learning_rate": 0.000499983534119342, "loss": 6.177, "mean_token_accuracy": 0.14310620874166488, "num_tokens": 3002110.0, "step": 1340 }, { "entropy": 5.928503322601318, "epoch": 0.15106418824057954, "grad_norm": 0.984375, "learning_rate": 0.0004999830448242941, "loss": 6.0135, "mean_token_accuracy": 0.15312863737344742, "num_tokens": 3012709.0, "step": 1345 }, { "entropy": 6.257901430130005, "epoch": 0.1516257651485371, "grad_norm": 0.93359375, "learning_rate": 0.0004999825483656986, "loss": 6.3139, "mean_token_accuracy": 0.13134505301713945, "num_tokens": 3025738.0, "step": 1350 }, { "entropy": 6.151828098297119, "epoch": 0.15218734205649465, "grad_norm": 0.953125, "learning_rate": 0.0004999820447435716, "loss": 6.1416, "mean_token_accuracy": 0.14338411912322044, "num_tokens": 3037711.0, "step": 1355 }, { "entropy": 6.239610385894776, "epoch": 0.15274891896445217, "grad_norm": 1.15625, "learning_rate": 0.0004999815339579291, "loss": 6.3286, "mean_token_accuracy": 0.13714671283960342, "num_tokens": 3048929.0, "step": 1360 }, { "entropy": 6.117274618148803, "epoch": 0.15331049587240972, "grad_norm": 1.171875, "learning_rate": 0.0004999810160087872, "loss": 6.0739, "mean_token_accuracy": 0.15920419096946717, "num_tokens": 3059717.0, "step": 1365 }, { "entropy": 6.133962488174438, "epoch": 0.15387207278036727, "grad_norm": 1.0703125, "learning_rate": 0.0004999804908961626, "loss": 6.0778, "mean_token_accuracy": 0.15217963755130767, "num_tokens": 3069530.0, "step": 1370 }, { "entropy": 6.133673429489136, "epoch": 0.15443364968832482, "grad_norm": 0.96875, "learning_rate": 0.0004999799586200719, "loss": 6.2715, "mean_token_accuracy": 0.14009033963084222, "num_tokens": 3080705.0, "step": 1375 }, { "entropy": 6.1995704650878904, "epoch": 0.15499522659628237, "grad_norm": 1.0, "learning_rate": 0.000499979419180532, "loss": 6.1198, "mean_token_accuracy": 0.1425781100988388, "num_tokens": 3092553.0, "step": 1380 }, { "entropy": 6.193589210510254, "epoch": 0.1555568035042399, "grad_norm": 1.15625, "learning_rate": 0.0004999788725775601, "loss": 6.2416, "mean_token_accuracy": 0.1423923633992672, "num_tokens": 3102947.0, "step": 1385 }, { "entropy": 6.08302493095398, "epoch": 0.15611838041219744, "grad_norm": 0.99609375, "learning_rate": 0.0004999783188111737, "loss": 6.0833, "mean_token_accuracy": 0.15142102390527726, "num_tokens": 3114157.0, "step": 1390 }, { "entropy": 6.019034147262573, "epoch": 0.156679957320155, "grad_norm": 1.015625, "learning_rate": 0.0004999777578813904, "loss": 5.9512, "mean_token_accuracy": 0.14669259935617446, "num_tokens": 3125739.0, "step": 1395 }, { "entropy": 6.063040637969971, "epoch": 0.15724153422811254, "grad_norm": 0.953125, "learning_rate": 0.000499977189788228, "loss": 6.1128, "mean_token_accuracy": 0.15026577562093735, "num_tokens": 3136970.0, "step": 1400 }, { "entropy": 6.108362627029419, "epoch": 0.1578031111360701, "grad_norm": 0.8828125, "learning_rate": 0.0004999766145317046, "loss": 6.0792, "mean_token_accuracy": 0.14896431863307952, "num_tokens": 3148512.0, "step": 1405 }, { "entropy": 6.111115980148315, "epoch": 0.15836468804402762, "grad_norm": 0.92578125, "learning_rate": 0.0004999760321118385, "loss": 6.1135, "mean_token_accuracy": 0.15590201914310456, "num_tokens": 3159477.0, "step": 1410 }, { "entropy": 6.05187873840332, "epoch": 0.15892626495198517, "grad_norm": 0.9921875, "learning_rate": 0.0004999754425286483, "loss": 6.128, "mean_token_accuracy": 0.15035361796617508, "num_tokens": 3171361.0, "step": 1415 }, { "entropy": 6.220038843154907, "epoch": 0.15948784185994272, "grad_norm": 0.92578125, "learning_rate": 0.0004999748457821529, "loss": 6.2881, "mean_token_accuracy": 0.13868645653128625, "num_tokens": 3184652.0, "step": 1420 }, { "entropy": 6.1836763381958, "epoch": 0.16004941876790027, "grad_norm": 0.98046875, "learning_rate": 0.000499974241872371, "loss": 6.1675, "mean_token_accuracy": 0.14523480385541915, "num_tokens": 3195557.0, "step": 1425 }, { "entropy": 6.168182754516602, "epoch": 0.16061099567585782, "grad_norm": 1.0546875, "learning_rate": 0.0004999736307993221, "loss": 6.1987, "mean_token_accuracy": 0.1331624984741211, "num_tokens": 3207139.0, "step": 1430 }, { "entropy": 6.287556171417236, "epoch": 0.16117257258381534, "grad_norm": 0.93359375, "learning_rate": 0.0004999730125630255, "loss": 6.2968, "mean_token_accuracy": 0.13671731874346732, "num_tokens": 3218967.0, "step": 1435 }, { "entropy": 6.173974084854126, "epoch": 0.1617341494917729, "grad_norm": 0.9765625, "learning_rate": 0.0004999723871635008, "loss": 6.1019, "mean_token_accuracy": 0.1492471754550934, "num_tokens": 3230168.0, "step": 1440 }, { "entropy": 6.022477769851685, "epoch": 0.16229572639973044, "grad_norm": 1.0390625, "learning_rate": 0.0004999717546007681, "loss": 6.1451, "mean_token_accuracy": 0.1437738373875618, "num_tokens": 3241829.0, "step": 1445 }, { "entropy": 6.239676189422608, "epoch": 0.162857303307688, "grad_norm": 1.0, "learning_rate": 0.0004999711148748476, "loss": 6.1597, "mean_token_accuracy": 0.14430854842066765, "num_tokens": 3253195.0, "step": 1450 }, { "entropy": 6.084852933883667, "epoch": 0.16341888021564555, "grad_norm": 0.9609375, "learning_rate": 0.0004999704679857594, "loss": 6.2113, "mean_token_accuracy": 0.14120337069034578, "num_tokens": 3264951.0, "step": 1455 }, { "entropy": 6.022989225387573, "epoch": 0.16398045712360307, "grad_norm": 0.953125, "learning_rate": 0.0004999698139335243, "loss": 6.0438, "mean_token_accuracy": 0.14825797379016875, "num_tokens": 3276054.0, "step": 1460 }, { "entropy": 6.0944970607757565, "epoch": 0.16454203403156062, "grad_norm": 1.0546875, "learning_rate": 0.0004999691527181632, "loss": 6.0089, "mean_token_accuracy": 0.1612110674381256, "num_tokens": 3285540.0, "step": 1465 }, { "entropy": 6.161299562454223, "epoch": 0.16510361093951817, "grad_norm": 0.9765625, "learning_rate": 0.0004999684843396968, "loss": 6.1427, "mean_token_accuracy": 0.14661948680877684, "num_tokens": 3296869.0, "step": 1470 }, { "entropy": 6.089122295379639, "epoch": 0.16566518784747572, "grad_norm": 0.98828125, "learning_rate": 0.0004999678087981467, "loss": 6.0813, "mean_token_accuracy": 0.1550757810473442, "num_tokens": 3307554.0, "step": 1475 }, { "entropy": 5.974129676818848, "epoch": 0.16622676475543324, "grad_norm": 0.95703125, "learning_rate": 0.0004999671260935343, "loss": 6.0369, "mean_token_accuracy": 0.14905909150838853, "num_tokens": 3319685.0, "step": 1480 }, { "entropy": 6.121063327789306, "epoch": 0.1667883416633908, "grad_norm": 0.98828125, "learning_rate": 0.0004999664362258814, "loss": 6.1516, "mean_token_accuracy": 0.14900618344545363, "num_tokens": 3330742.0, "step": 1485 }, { "entropy": 6.037702798843384, "epoch": 0.16734991857134834, "grad_norm": 0.8828125, "learning_rate": 0.0004999657391952099, "loss": 6.1774, "mean_token_accuracy": 0.14220552295446395, "num_tokens": 3343613.0, "step": 1490 }, { "entropy": 6.289458322525024, "epoch": 0.1679114954793059, "grad_norm": 0.875, "learning_rate": 0.000499965035001542, "loss": 6.2146, "mean_token_accuracy": 0.1457619272172451, "num_tokens": 3355162.0, "step": 1495 }, { "entropy": 6.107675218582154, "epoch": 0.16847307238726345, "grad_norm": 0.90625, "learning_rate": 0.0004999643236449001, "loss": 6.1513, "mean_token_accuracy": 0.15243639126420022, "num_tokens": 3366324.0, "step": 1500 }, { "entropy": 6.264118766784668, "epoch": 0.16903464929522097, "grad_norm": 0.9921875, "learning_rate": 0.0004999636051253069, "loss": 6.292, "mean_token_accuracy": 0.13710838407278061, "num_tokens": 3378571.0, "step": 1505 }, { "entropy": 6.134381484985352, "epoch": 0.16959622620317852, "grad_norm": 1.078125, "learning_rate": 0.0004999628794427854, "loss": 6.1696, "mean_token_accuracy": 0.13963365852832793, "num_tokens": 3390605.0, "step": 1510 }, { "entropy": 6.0607460021972654, "epoch": 0.17015780311113607, "grad_norm": 0.9609375, "learning_rate": 0.0004999621465973583, "loss": 6.0866, "mean_token_accuracy": 0.14871912077069283, "num_tokens": 3402735.0, "step": 1515 }, { "entropy": 6.100008773803711, "epoch": 0.17071938001909362, "grad_norm": 1.03125, "learning_rate": 0.0004999614065890495, "loss": 6.0991, "mean_token_accuracy": 0.15326170325279237, "num_tokens": 3413079.0, "step": 1520 }, { "entropy": 6.077723407745362, "epoch": 0.17128095692705117, "grad_norm": 1.0, "learning_rate": 0.0004999606594178821, "loss": 6.0422, "mean_token_accuracy": 0.14912576824426652, "num_tokens": 3423098.0, "step": 1525 }, { "entropy": 6.100780582427978, "epoch": 0.1718425338350087, "grad_norm": 0.90234375, "learning_rate": 0.00049995990508388, "loss": 6.0769, "mean_token_accuracy": 0.14803334027528764, "num_tokens": 3435794.0, "step": 1530 }, { "entropy": 6.115665483474731, "epoch": 0.17240411074296624, "grad_norm": 0.95703125, "learning_rate": 0.0004999591435870674, "loss": 6.2069, "mean_token_accuracy": 0.13976619020104408, "num_tokens": 3448125.0, "step": 1535 }, { "entropy": 6.065301561355591, "epoch": 0.1729656876509238, "grad_norm": 1.0234375, "learning_rate": 0.0004999583749274684, "loss": 6.0397, "mean_token_accuracy": 0.14901299476623536, "num_tokens": 3458217.0, "step": 1540 }, { "entropy": 6.002480125427246, "epoch": 0.17352726455888134, "grad_norm": 0.94921875, "learning_rate": 0.0004999575991051074, "loss": 6.0901, "mean_token_accuracy": 0.1483938679099083, "num_tokens": 3469553.0, "step": 1545 }, { "entropy": 6.146899223327637, "epoch": 0.1740888414668389, "grad_norm": 0.9375, "learning_rate": 0.0004999568161200093, "loss": 6.0427, "mean_token_accuracy": 0.15437329113483428, "num_tokens": 3480928.0, "step": 1550 }, { "entropy": 6.065676021575928, "epoch": 0.17465041837479642, "grad_norm": 1.03125, "learning_rate": 0.0004999560259721989, "loss": 6.1347, "mean_token_accuracy": 0.1498277299106121, "num_tokens": 3492074.0, "step": 1555 }, { "entropy": 6.13408784866333, "epoch": 0.17521199528275397, "grad_norm": 0.984375, "learning_rate": 0.0004999552286617014, "loss": 6.1425, "mean_token_accuracy": 0.14677510857582093, "num_tokens": 3503320.0, "step": 1560 }, { "entropy": 6.015400695800781, "epoch": 0.17577357219071152, "grad_norm": 1.375, "learning_rate": 0.0004999544241885421, "loss": 6.136, "mean_token_accuracy": 0.15524707436561586, "num_tokens": 3515466.0, "step": 1565 }, { "entropy": 6.1630960464477536, "epoch": 0.17633514909866907, "grad_norm": 0.9921875, "learning_rate": 0.0004999536125527467, "loss": 6.0079, "mean_token_accuracy": 0.15108589679002762, "num_tokens": 3525584.0, "step": 1570 }, { "entropy": 5.98162202835083, "epoch": 0.17689672600662662, "grad_norm": 0.9375, "learning_rate": 0.000499952793754341, "loss": 6.0963, "mean_token_accuracy": 0.1469439223408699, "num_tokens": 3536973.0, "step": 1575 }, { "entropy": 6.10207724571228, "epoch": 0.17745830291458414, "grad_norm": 0.9609375, "learning_rate": 0.0004999519677933512, "loss": 6.1286, "mean_token_accuracy": 0.14693209826946257, "num_tokens": 3547799.0, "step": 1580 }, { "entropy": 6.159058141708374, "epoch": 0.1780198798225417, "grad_norm": 0.95703125, "learning_rate": 0.0004999511346698035, "loss": 6.1786, "mean_token_accuracy": 0.15070472061634063, "num_tokens": 3558436.0, "step": 1585 }, { "entropy": 6.149427270889282, "epoch": 0.17858145673049924, "grad_norm": 1.078125, "learning_rate": 0.0004999502943837244, "loss": 6.1659, "mean_token_accuracy": 0.15004989951848985, "num_tokens": 3569851.0, "step": 1590 }, { "entropy": 6.135163640975952, "epoch": 0.1791430336384568, "grad_norm": 0.953125, "learning_rate": 0.0004999494469351406, "loss": 6.0449, "mean_token_accuracy": 0.14947315603494643, "num_tokens": 3580797.0, "step": 1595 }, { "entropy": 6.05308346748352, "epoch": 0.17970461054641435, "grad_norm": 0.89453125, "learning_rate": 0.0004999485923240793, "loss": 6.0467, "mean_token_accuracy": 0.1534357637166977, "num_tokens": 3592552.0, "step": 1600 }, { "entropy": 5.9738929748535154, "epoch": 0.18026618745437187, "grad_norm": 1.015625, "learning_rate": 0.0004999477305505675, "loss": 6.0287, "mean_token_accuracy": 0.15556652545928956, "num_tokens": 3603932.0, "step": 1605 }, { "entropy": 6.095688581466675, "epoch": 0.18082776436232942, "grad_norm": 1.015625, "learning_rate": 0.0004999468616146328, "loss": 6.052, "mean_token_accuracy": 0.1578151524066925, "num_tokens": 3614865.0, "step": 1610 }, { "entropy": 5.861964559555053, "epoch": 0.18138934127028697, "grad_norm": 0.93359375, "learning_rate": 0.0004999459855163026, "loss": 5.9784, "mean_token_accuracy": 0.1593295931816101, "num_tokens": 3626275.0, "step": 1615 }, { "entropy": 6.140000581741333, "epoch": 0.18195091817824452, "grad_norm": 1.0234375, "learning_rate": 0.000499945102255605, "loss": 6.1078, "mean_token_accuracy": 0.1455901011824608, "num_tokens": 3638416.0, "step": 1620 }, { "entropy": 5.946600866317749, "epoch": 0.18251249508620204, "grad_norm": 0.9453125, "learning_rate": 0.0004999442118325682, "loss": 5.9553, "mean_token_accuracy": 0.1524277485907078, "num_tokens": 3649651.0, "step": 1625 }, { "entropy": 6.132726192474365, "epoch": 0.1830740719941596, "grad_norm": 1.0234375, "learning_rate": 0.0004999433142472205, "loss": 6.192, "mean_token_accuracy": 0.15279360264539718, "num_tokens": 3661172.0, "step": 1630 }, { "entropy": 6.108269739151001, "epoch": 0.18363564890211714, "grad_norm": 1.1015625, "learning_rate": 0.0004999424094995902, "loss": 6.0268, "mean_token_accuracy": 0.15440748035907745, "num_tokens": 3672086.0, "step": 1635 }, { "entropy": 6.029655122756958, "epoch": 0.1841972258100747, "grad_norm": 0.921875, "learning_rate": 0.0004999414975897066, "loss": 6.0021, "mean_token_accuracy": 0.14995888769626617, "num_tokens": 3682579.0, "step": 1640 }, { "entropy": 6.10533299446106, "epoch": 0.18475880271803224, "grad_norm": 0.9453125, "learning_rate": 0.0004999405785175983, "loss": 6.1253, "mean_token_accuracy": 0.14912039935588836, "num_tokens": 3694616.0, "step": 1645 }, { "entropy": 5.989877414703369, "epoch": 0.18532037962598977, "grad_norm": 0.87109375, "learning_rate": 0.0004999396522832949, "loss": 5.909, "mean_token_accuracy": 0.1535977005958557, "num_tokens": 3706821.0, "step": 1650 }, { "entropy": 5.970361423492432, "epoch": 0.18588195653394732, "grad_norm": 1.0078125, "learning_rate": 0.0004999387188868256, "loss": 5.9652, "mean_token_accuracy": 0.1572886511683464, "num_tokens": 3717552.0, "step": 1655 }, { "entropy": 5.978477573394775, "epoch": 0.18644353344190487, "grad_norm": 0.953125, "learning_rate": 0.0004999377783282203, "loss": 6.043, "mean_token_accuracy": 0.15294748544692993, "num_tokens": 3728300.0, "step": 1660 }, { "entropy": 6.069652843475342, "epoch": 0.18700511034986242, "grad_norm": 0.9921875, "learning_rate": 0.0004999368306075089, "loss": 6.0383, "mean_token_accuracy": 0.15796971321105957, "num_tokens": 3738545.0, "step": 1665 }, { "entropy": 6.053223991394043, "epoch": 0.18756668725781997, "grad_norm": 1.1015625, "learning_rate": 0.0004999358757247215, "loss": 6.031, "mean_token_accuracy": 0.14949157685041428, "num_tokens": 3749190.0, "step": 1670 }, { "entropy": 5.973500061035156, "epoch": 0.1881282641657775, "grad_norm": 1.0859375, "learning_rate": 0.0004999349136798886, "loss": 6.0387, "mean_token_accuracy": 0.15051646381616593, "num_tokens": 3760978.0, "step": 1675 }, { "entropy": 5.94163761138916, "epoch": 0.18868984107373504, "grad_norm": 1.0546875, "learning_rate": 0.0004999339444730409, "loss": 5.9304, "mean_token_accuracy": 0.1564078763127327, "num_tokens": 3771339.0, "step": 1680 }, { "entropy": 6.000215005874634, "epoch": 0.1892514179816926, "grad_norm": 1.0078125, "learning_rate": 0.0004999329681042092, "loss": 5.9158, "mean_token_accuracy": 0.15469563752412796, "num_tokens": 3781550.0, "step": 1685 }, { "entropy": 5.960664081573486, "epoch": 0.18981299488965014, "grad_norm": 0.9140625, "learning_rate": 0.0004999319845734243, "loss": 6.1339, "mean_token_accuracy": 0.14286689832806587, "num_tokens": 3793700.0, "step": 1690 }, { "entropy": 6.237479496002197, "epoch": 0.1903745717976077, "grad_norm": 0.94140625, "learning_rate": 0.0004999309938807181, "loss": 6.1323, "mean_token_accuracy": 0.14619217813014984, "num_tokens": 3806114.0, "step": 1695 }, { "entropy": 5.988754749298096, "epoch": 0.19093614870556522, "grad_norm": 0.9921875, "learning_rate": 0.0004999299960261216, "loss": 6.0421, "mean_token_accuracy": 0.15423230230808258, "num_tokens": 3817251.0, "step": 1700 }, { "entropy": 6.091027498245239, "epoch": 0.19149772561352277, "grad_norm": 0.9296875, "learning_rate": 0.0004999289910096669, "loss": 6.0464, "mean_token_accuracy": 0.15106936246156694, "num_tokens": 3828544.0, "step": 1705 }, { "entropy": 5.994654273986816, "epoch": 0.19205930252148032, "grad_norm": 1.0078125, "learning_rate": 0.0004999279788313858, "loss": 6.1189, "mean_token_accuracy": 0.14720231145620347, "num_tokens": 3840423.0, "step": 1710 }, { "entropy": 6.1074625015258786, "epoch": 0.19262087942943787, "grad_norm": 0.90625, "learning_rate": 0.0004999269594913107, "loss": 6.0199, "mean_token_accuracy": 0.15324137806892396, "num_tokens": 3852751.0, "step": 1715 }, { "entropy": 5.966987991333008, "epoch": 0.19318245633739542, "grad_norm": 0.9453125, "learning_rate": 0.0004999259329894739, "loss": 6.0043, "mean_token_accuracy": 0.15583723783493042, "num_tokens": 3863382.0, "step": 1720 }, { "entropy": 5.978365659713745, "epoch": 0.19374403324535294, "grad_norm": 1.078125, "learning_rate": 0.0004999248993259081, "loss": 6.0004, "mean_token_accuracy": 0.1522401787340641, "num_tokens": 3874294.0, "step": 1725 }, { "entropy": 6.057207489013672, "epoch": 0.1943056101533105, "grad_norm": 1.0234375, "learning_rate": 0.0004999238585006463, "loss": 6.0364, "mean_token_accuracy": 0.14614153355360032, "num_tokens": 3886693.0, "step": 1730 }, { "entropy": 5.985201740264893, "epoch": 0.19486718706126804, "grad_norm": 0.98828125, "learning_rate": 0.0004999228105137218, "loss": 5.9488, "mean_token_accuracy": 0.1587449014186859, "num_tokens": 3897755.0, "step": 1735 }, { "entropy": 5.956290817260742, "epoch": 0.1954287639692256, "grad_norm": 1.0703125, "learning_rate": 0.0004999217553651676, "loss": 5.9546, "mean_token_accuracy": 0.15806302726268767, "num_tokens": 3909418.0, "step": 1740 }, { "entropy": 6.051894617080689, "epoch": 0.19599034087718312, "grad_norm": 1.15625, "learning_rate": 0.0004999206930550175, "loss": 6.1081, "mean_token_accuracy": 0.14818969666957854, "num_tokens": 3919992.0, "step": 1745 }, { "entropy": 6.063493871688843, "epoch": 0.19655191778514067, "grad_norm": 0.95703125, "learning_rate": 0.0004999196235833054, "loss": 5.9663, "mean_token_accuracy": 0.16147716641426085, "num_tokens": 3930648.0, "step": 1750 }, { "entropy": 5.885579061508179, "epoch": 0.19711349469309822, "grad_norm": 0.95703125, "learning_rate": 0.0004999185469500651, "loss": 5.9529, "mean_token_accuracy": 0.15516203343868257, "num_tokens": 3941883.0, "step": 1755 }, { "entropy": 6.019442367553711, "epoch": 0.19767507160105577, "grad_norm": 1.0625, "learning_rate": 0.000499917463155331, "loss": 5.9987, "mean_token_accuracy": 0.15911805033683776, "num_tokens": 3952005.0, "step": 1760 }, { "entropy": 5.935513496398926, "epoch": 0.19823664850901332, "grad_norm": 1.078125, "learning_rate": 0.0004999163721991378, "loss": 5.9213, "mean_token_accuracy": 0.15570384711027146, "num_tokens": 3963720.0, "step": 1765 }, { "entropy": 5.93169755935669, "epoch": 0.19879822541697084, "grad_norm": 1.0078125, "learning_rate": 0.00049991527408152, "loss": 6.0081, "mean_token_accuracy": 0.15529269427061082, "num_tokens": 3974998.0, "step": 1770 }, { "entropy": 6.000465297698975, "epoch": 0.1993598023249284, "grad_norm": 0.9296875, "learning_rate": 0.0004999141688025127, "loss": 6.048, "mean_token_accuracy": 0.14723881632089614, "num_tokens": 3986469.0, "step": 1775 }, { "entropy": 6.037735271453857, "epoch": 0.19992137923288594, "grad_norm": 0.8984375, "learning_rate": 0.000499913056362151, "loss": 5.8733, "mean_token_accuracy": 0.1559750333428383, "num_tokens": 3997553.0, "step": 1780 }, { "entropy": 5.848225831985474, "epoch": 0.2004829561408435, "grad_norm": 0.90234375, "learning_rate": 0.0004999119367604703, "loss": 5.958, "mean_token_accuracy": 0.15345809012651443, "num_tokens": 4008613.0, "step": 1785 }, { "entropy": 6.148313570022583, "epoch": 0.20104453304880104, "grad_norm": 1.046875, "learning_rate": 0.0004999108099975064, "loss": 6.1178, "mean_token_accuracy": 0.1494819074869156, "num_tokens": 4019860.0, "step": 1790 }, { "entropy": 5.971745538711548, "epoch": 0.20160610995675857, "grad_norm": 1.0859375, "learning_rate": 0.000499909676073295, "loss": 6.0125, "mean_token_accuracy": 0.15912038534879686, "num_tokens": 4030602.0, "step": 1795 }, { "entropy": 5.967540597915649, "epoch": 0.20216768686471612, "grad_norm": 1.046875, "learning_rate": 0.0004999085349878723, "loss": 5.8881, "mean_token_accuracy": 0.1551676794886589, "num_tokens": 4041878.0, "step": 1800 }, { "entropy": 5.902796602249145, "epoch": 0.20272926377267367, "grad_norm": 1.03125, "learning_rate": 0.0004999073867412746, "loss": 5.985, "mean_token_accuracy": 0.15298098027706147, "num_tokens": 4052799.0, "step": 1805 }, { "entropy": 6.052335357666015, "epoch": 0.20329084068063122, "grad_norm": 0.98046875, "learning_rate": 0.0004999062313335385, "loss": 5.977, "mean_token_accuracy": 0.1513774089515209, "num_tokens": 4064339.0, "step": 1810 }, { "entropy": 5.881051683425904, "epoch": 0.20385241758858877, "grad_norm": 1.0234375, "learning_rate": 0.0004999050687647008, "loss": 5.9321, "mean_token_accuracy": 0.15355904400348663, "num_tokens": 4076246.0, "step": 1815 }, { "entropy": 5.9952904224395756, "epoch": 0.2044139944965463, "grad_norm": 0.9375, "learning_rate": 0.0004999038990347984, "loss": 6.0102, "mean_token_accuracy": 0.15132154226303102, "num_tokens": 4088006.0, "step": 1820 }, { "entropy": 5.986813735961914, "epoch": 0.20497557140450384, "grad_norm": 1.078125, "learning_rate": 0.0004999027221438688, "loss": 6.0135, "mean_token_accuracy": 0.1533118411898613, "num_tokens": 4098122.0, "step": 1825 }, { "entropy": 6.179859924316406, "epoch": 0.2055371483124614, "grad_norm": 1.0703125, "learning_rate": 0.000499901538091949, "loss": 6.2072, "mean_token_accuracy": 0.14116512686014177, "num_tokens": 4109958.0, "step": 1830 }, { "entropy": 6.044462394714356, "epoch": 0.20609872522041894, "grad_norm": 1.0078125, "learning_rate": 0.0004999003468790773, "loss": 6.0967, "mean_token_accuracy": 0.14568886607885362, "num_tokens": 4121262.0, "step": 1835 }, { "entropy": 6.016641092300415, "epoch": 0.2066603021283765, "grad_norm": 1.015625, "learning_rate": 0.0004998991485052911, "loss": 5.87, "mean_token_accuracy": 0.16044027954339982, "num_tokens": 4130958.0, "step": 1840 }, { "entropy": 5.966278457641602, "epoch": 0.20722187903633402, "grad_norm": 0.97265625, "learning_rate": 0.000499897942970629, "loss": 6.0778, "mean_token_accuracy": 0.1423511266708374, "num_tokens": 4143779.0, "step": 1845 }, { "entropy": 6.1042670726776125, "epoch": 0.20778345594429157, "grad_norm": 0.94921875, "learning_rate": 0.000499896730275129, "loss": 6.1007, "mean_token_accuracy": 0.14468785226345063, "num_tokens": 4155367.0, "step": 1850 }, { "entropy": 5.985637760162353, "epoch": 0.20834503285224912, "grad_norm": 1.015625, "learning_rate": 0.00049989551041883, "loss": 5.9152, "mean_token_accuracy": 0.15388040691614152, "num_tokens": 4166657.0, "step": 1855 }, { "entropy": 5.961990070343018, "epoch": 0.20890660976020667, "grad_norm": 1.0390625, "learning_rate": 0.0004998942834017707, "loss": 6.0298, "mean_token_accuracy": 0.15152619555592536, "num_tokens": 4177517.0, "step": 1860 }, { "entropy": 5.9690758228302006, "epoch": 0.2094681866681642, "grad_norm": 1.0234375, "learning_rate": 0.0004998930492239901, "loss": 5.8913, "mean_token_accuracy": 0.15565723478794097, "num_tokens": 4188182.0, "step": 1865 }, { "entropy": 6.060051155090332, "epoch": 0.21002976357612174, "grad_norm": 1.03125, "learning_rate": 0.0004998918078855277, "loss": 6.0221, "mean_token_accuracy": 0.1551324889063835, "num_tokens": 4199415.0, "step": 1870 }, { "entropy": 5.884836721420288, "epoch": 0.2105913404840793, "grad_norm": 1.0078125, "learning_rate": 0.0004998905593864227, "loss": 5.967, "mean_token_accuracy": 0.15338498651981353, "num_tokens": 4210025.0, "step": 1875 }, { "entropy": 5.985698986053467, "epoch": 0.21115291739203684, "grad_norm": 1.015625, "learning_rate": 0.0004998893037267153, "loss": 5.8966, "mean_token_accuracy": 0.15888059735298157, "num_tokens": 4219920.0, "step": 1880 }, { "entropy": 5.979580545425415, "epoch": 0.2117144942999944, "grad_norm": 0.9921875, "learning_rate": 0.0004998880409064452, "loss": 6.0678, "mean_token_accuracy": 0.1490791544318199, "num_tokens": 4232647.0, "step": 1885 }, { "entropy": 6.082404136657715, "epoch": 0.21227607120795192, "grad_norm": 1.0859375, "learning_rate": 0.0004998867709256527, "loss": 5.9527, "mean_token_accuracy": 0.15514377057552337, "num_tokens": 4242637.0, "step": 1890 }, { "entropy": 5.876793336868286, "epoch": 0.21283764811590947, "grad_norm": 1.015625, "learning_rate": 0.000499885493784378, "loss": 5.9242, "mean_token_accuracy": 0.15735216736793517, "num_tokens": 4253633.0, "step": 1895 }, { "entropy": 5.9101646900177, "epoch": 0.21339922502386702, "grad_norm": 0.9296875, "learning_rate": 0.0004998842094826621, "loss": 5.8893, "mean_token_accuracy": 0.15901758521795273, "num_tokens": 4264472.0, "step": 1900 }, { "entropy": 6.013765573501587, "epoch": 0.21396080193182457, "grad_norm": 0.953125, "learning_rate": 0.0004998829180205458, "loss": 6.0058, "mean_token_accuracy": 0.15594724267721177, "num_tokens": 4275233.0, "step": 1905 }, { "entropy": 6.0052587509155275, "epoch": 0.21452237883978212, "grad_norm": 1.03125, "learning_rate": 0.0004998816193980701, "loss": 5.9606, "mean_token_accuracy": 0.15338825732469558, "num_tokens": 4287063.0, "step": 1910 }, { "entropy": 6.001710557937622, "epoch": 0.21508395574773964, "grad_norm": 1.0234375, "learning_rate": 0.0004998803136152764, "loss": 5.9866, "mean_token_accuracy": 0.15025851130485535, "num_tokens": 4298761.0, "step": 1915 }, { "entropy": 5.735988998413086, "epoch": 0.2156455326556972, "grad_norm": 0.99609375, "learning_rate": 0.0004998790006722063, "loss": 5.8469, "mean_token_accuracy": 0.16698734015226363, "num_tokens": 4309650.0, "step": 1920 }, { "entropy": 6.018524694442749, "epoch": 0.21620710956365474, "grad_norm": 1.0, "learning_rate": 0.0004998776805689016, "loss": 5.9063, "mean_token_accuracy": 0.16533491015434265, "num_tokens": 4320403.0, "step": 1925 }, { "entropy": 5.84126296043396, "epoch": 0.2167686864716123, "grad_norm": 0.95703125, "learning_rate": 0.0004998763533054045, "loss": 5.932, "mean_token_accuracy": 0.1564387321472168, "num_tokens": 4332049.0, "step": 1930 }, { "entropy": 5.947682619094849, "epoch": 0.21733026337956984, "grad_norm": 0.98046875, "learning_rate": 0.0004998750188817568, "loss": 5.8358, "mean_token_accuracy": 0.16291145533323287, "num_tokens": 4342551.0, "step": 1935 }, { "entropy": 5.899789810180664, "epoch": 0.21789184028752737, "grad_norm": 0.87890625, "learning_rate": 0.0004998736772980015, "loss": 5.9692, "mean_token_accuracy": 0.1594847857952118, "num_tokens": 4355156.0, "step": 1940 }, { "entropy": 5.908867359161377, "epoch": 0.21845341719548492, "grad_norm": 1.0, "learning_rate": 0.000499872328554181, "loss": 6.0218, "mean_token_accuracy": 0.15519974678754805, "num_tokens": 4367402.0, "step": 1945 }, { "entropy": 6.017113590240479, "epoch": 0.21901499410344247, "grad_norm": 0.890625, "learning_rate": 0.0004998709726503383, "loss": 5.8973, "mean_token_accuracy": 0.16066040098667145, "num_tokens": 4378687.0, "step": 1950 }, { "entropy": 5.973746299743652, "epoch": 0.21957657101140002, "grad_norm": 1.0390625, "learning_rate": 0.0004998696095865168, "loss": 6.0371, "mean_token_accuracy": 0.1629161447286606, "num_tokens": 4388871.0, "step": 1955 }, { "entropy": 5.922299194335937, "epoch": 0.22013814791935757, "grad_norm": 0.984375, "learning_rate": 0.0004998682393627595, "loss": 5.8576, "mean_token_accuracy": 0.16151300221681594, "num_tokens": 4399440.0, "step": 1960 }, { "entropy": 5.825509119033813, "epoch": 0.2206997248273151, "grad_norm": 1.0546875, "learning_rate": 0.0004998668619791104, "loss": 5.8555, "mean_token_accuracy": 0.16079302430152892, "num_tokens": 4409989.0, "step": 1965 }, { "entropy": 6.02225980758667, "epoch": 0.22126130173527264, "grad_norm": 1.0234375, "learning_rate": 0.0004998654774356131, "loss": 6.0152, "mean_token_accuracy": 0.15131131708621978, "num_tokens": 4422149.0, "step": 1970 }, { "entropy": 6.051222705841065, "epoch": 0.2218228786432302, "grad_norm": 1.109375, "learning_rate": 0.0004998640857323118, "loss": 6.0486, "mean_token_accuracy": 0.15000825822353364, "num_tokens": 4433157.0, "step": 1975 }, { "entropy": 6.00563907623291, "epoch": 0.22238445555118774, "grad_norm": 0.89453125, "learning_rate": 0.0004998626868692509, "loss": 5.973, "mean_token_accuracy": 0.15266723185777664, "num_tokens": 4444595.0, "step": 1980 }, { "entropy": 6.015877962112427, "epoch": 0.2229460324591453, "grad_norm": 0.94140625, "learning_rate": 0.0004998612808464748, "loss": 6.1061, "mean_token_accuracy": 0.14999096170067788, "num_tokens": 4456592.0, "step": 1985 }, { "entropy": 6.005351543426514, "epoch": 0.22350760936710282, "grad_norm": 0.96484375, "learning_rate": 0.0004998598676640283, "loss": 5.8623, "mean_token_accuracy": 0.16657372564077377, "num_tokens": 4467624.0, "step": 1990 }, { "entropy": 5.870333099365235, "epoch": 0.22406918627506037, "grad_norm": 0.94140625, "learning_rate": 0.0004998584473219563, "loss": 6.0578, "mean_token_accuracy": 0.1522249922156334, "num_tokens": 4479766.0, "step": 1995 }, { "entropy": 6.041551637649536, "epoch": 0.22463076318301792, "grad_norm": 1.0078125, "learning_rate": 0.0004998570198203043, "loss": 5.927, "mean_token_accuracy": 0.1541971117258072, "num_tokens": 4490023.0, "step": 2000 }, { "entropy": 5.939703559875488, "epoch": 0.22519234009097547, "grad_norm": 0.9921875, "learning_rate": 0.0004998555851591175, "loss": 5.9578, "mean_token_accuracy": 0.15466774851083756, "num_tokens": 4500651.0, "step": 2005 }, { "entropy": 6.019627428054809, "epoch": 0.225753916998933, "grad_norm": 0.9453125, "learning_rate": 0.0004998541433384416, "loss": 6.0605, "mean_token_accuracy": 0.1519089847803116, "num_tokens": 4512934.0, "step": 2010 }, { "entropy": 5.9258240222930905, "epoch": 0.22631549390689054, "grad_norm": 0.92578125, "learning_rate": 0.0004998526943583226, "loss": 5.9379, "mean_token_accuracy": 0.16064678132534027, "num_tokens": 4524251.0, "step": 2015 }, { "entropy": 5.996880960464478, "epoch": 0.2268770708148481, "grad_norm": 1.0, "learning_rate": 0.0004998512382188066, "loss": 6.022, "mean_token_accuracy": 0.14892027527093887, "num_tokens": 4536025.0, "step": 2020 }, { "entropy": 6.004436492919922, "epoch": 0.22743864772280564, "grad_norm": 0.99609375, "learning_rate": 0.0004998497749199401, "loss": 5.9701, "mean_token_accuracy": 0.158987794816494, "num_tokens": 4546717.0, "step": 2025 }, { "entropy": 5.910756921768188, "epoch": 0.2280002246307632, "grad_norm": 0.97265625, "learning_rate": 0.0004998483044617694, "loss": 5.8651, "mean_token_accuracy": 0.1554678872227669, "num_tokens": 4557206.0, "step": 2030 }, { "entropy": 5.822503995895386, "epoch": 0.22856180153872072, "grad_norm": 0.98046875, "learning_rate": 0.0004998468268443416, "loss": 5.8574, "mean_token_accuracy": 0.16205435246229172, "num_tokens": 4568123.0, "step": 2035 }, { "entropy": 5.961733341217041, "epoch": 0.22912337844667827, "grad_norm": 1.0, "learning_rate": 0.0004998453420677034, "loss": 5.9819, "mean_token_accuracy": 0.15619362890720367, "num_tokens": 4579385.0, "step": 2040 }, { "entropy": 5.9808855056762695, "epoch": 0.22968495535463582, "grad_norm": 0.9140625, "learning_rate": 0.0004998438501319025, "loss": 6.0248, "mean_token_accuracy": 0.15128423795104026, "num_tokens": 4590514.0, "step": 2045 }, { "entropy": 6.025481367111206, "epoch": 0.23024653226259337, "grad_norm": 0.8984375, "learning_rate": 0.0004998423510369862, "loss": 5.9706, "mean_token_accuracy": 0.15017401427030563, "num_tokens": 4601624.0, "step": 2050 }, { "entropy": 5.990740871429443, "epoch": 0.23080810917055092, "grad_norm": 1.0625, "learning_rate": 0.0004998408447830022, "loss": 5.9518, "mean_token_accuracy": 0.16115492284297944, "num_tokens": 4612822.0, "step": 2055 }, { "entropy": 5.939420604705811, "epoch": 0.23136968607850844, "grad_norm": 1.0234375, "learning_rate": 0.0004998393313699985, "loss": 5.9466, "mean_token_accuracy": 0.16056140810251235, "num_tokens": 4623443.0, "step": 2060 }, { "entropy": 5.930271577835083, "epoch": 0.231931262986466, "grad_norm": 1.0, "learning_rate": 0.0004998378107980233, "loss": 5.8579, "mean_token_accuracy": 0.16032032370567323, "num_tokens": 4633600.0, "step": 2065 }, { "entropy": 5.932555675506592, "epoch": 0.23249283989442354, "grad_norm": 1.1015625, "learning_rate": 0.0004998362830671249, "loss": 6.0102, "mean_token_accuracy": 0.15435325503349304, "num_tokens": 4644217.0, "step": 2070 }, { "entropy": 5.97379846572876, "epoch": 0.2330544168023811, "grad_norm": 1.078125, "learning_rate": 0.0004998347481773522, "loss": 6.0249, "mean_token_accuracy": 0.1527538165450096, "num_tokens": 4654671.0, "step": 2075 }, { "entropy": 5.9626545906066895, "epoch": 0.23361599371033864, "grad_norm": 1.0546875, "learning_rate": 0.0004998332061287538, "loss": 6.0209, "mean_token_accuracy": 0.1507769837975502, "num_tokens": 4665920.0, "step": 2080 }, { "entropy": 5.939901208877563, "epoch": 0.23417757061829617, "grad_norm": 1.1796875, "learning_rate": 0.000499831656921379, "loss": 5.8997, "mean_token_accuracy": 0.1583072543144226, "num_tokens": 4675406.0, "step": 2085 }, { "entropy": 6.018610954284668, "epoch": 0.23473914752625372, "grad_norm": 0.9921875, "learning_rate": 0.000499830100555277, "loss": 5.9357, "mean_token_accuracy": 0.15790688395500183, "num_tokens": 4686870.0, "step": 2090 }, { "entropy": 5.953982305526734, "epoch": 0.23530072443421127, "grad_norm": 0.98046875, "learning_rate": 0.0004998285370304974, "loss": 6.0124, "mean_token_accuracy": 0.15949206352233886, "num_tokens": 4698926.0, "step": 2095 }, { "entropy": 6.0622725009918215, "epoch": 0.23586230134216882, "grad_norm": 0.9921875, "learning_rate": 0.00049982696634709, "loss": 6.0882, "mean_token_accuracy": 0.14462199285626412, "num_tokens": 4709318.0, "step": 2100 }, { "entropy": 5.849839591979981, "epoch": 0.23642387825012637, "grad_norm": 0.99609375, "learning_rate": 0.0004998253885051048, "loss": 5.7796, "mean_token_accuracy": 0.16810209602117537, "num_tokens": 4718819.0, "step": 2105 }, { "entropy": 5.884680938720703, "epoch": 0.2369854551580839, "grad_norm": 1.0, "learning_rate": 0.000499823803504592, "loss": 5.8314, "mean_token_accuracy": 0.16093335300683975, "num_tokens": 4729513.0, "step": 2110 }, { "entropy": 5.859940433502198, "epoch": 0.23754703206604144, "grad_norm": 1.0546875, "learning_rate": 0.0004998222113456022, "loss": 5.9287, "mean_token_accuracy": 0.15834257006645203, "num_tokens": 4739875.0, "step": 2115 }, { "entropy": 6.060333490371704, "epoch": 0.238108608973999, "grad_norm": 0.96875, "learning_rate": 0.0004998206120281858, "loss": 6.0609, "mean_token_accuracy": 0.14767249599099158, "num_tokens": 4752933.0, "step": 2120 }, { "entropy": 5.938970279693604, "epoch": 0.23867018588195654, "grad_norm": 1.1015625, "learning_rate": 0.000499819005552394, "loss": 5.8526, "mean_token_accuracy": 0.16048028618097304, "num_tokens": 4762969.0, "step": 2125 }, { "entropy": 5.958646631240844, "epoch": 0.23923176278991407, "grad_norm": 1.0, "learning_rate": 0.0004998173919182779, "loss": 5.9439, "mean_token_accuracy": 0.15564859807491302, "num_tokens": 4773495.0, "step": 2130 }, { "entropy": 5.948372316360474, "epoch": 0.23979333969787162, "grad_norm": 0.9765625, "learning_rate": 0.000499815771125889, "loss": 5.9773, "mean_token_accuracy": 0.16150738894939423, "num_tokens": 4785335.0, "step": 2135 }, { "entropy": 6.081469774246216, "epoch": 0.24035491660582917, "grad_norm": 0.90234375, "learning_rate": 0.0004998141431752785, "loss": 6.1175, "mean_token_accuracy": 0.14878264293074608, "num_tokens": 4798068.0, "step": 2140 }, { "entropy": 5.92440824508667, "epoch": 0.24091649351378672, "grad_norm": 0.9765625, "learning_rate": 0.0004998125080664987, "loss": 5.9373, "mean_token_accuracy": 0.1596187397837639, "num_tokens": 4809338.0, "step": 2145 }, { "entropy": 5.900418853759765, "epoch": 0.24147807042174427, "grad_norm": 1.078125, "learning_rate": 0.0004998108657996012, "loss": 5.9278, "mean_token_accuracy": 0.1604372188448906, "num_tokens": 4819636.0, "step": 2150 }, { "entropy": 5.9336934089660645, "epoch": 0.2420396473297018, "grad_norm": 0.87890625, "learning_rate": 0.0004998092163746387, "loss": 5.9066, "mean_token_accuracy": 0.16119810789823533, "num_tokens": 4830975.0, "step": 2155 }, { "entropy": 5.893611574172974, "epoch": 0.24260122423765934, "grad_norm": 0.9375, "learning_rate": 0.0004998075597916636, "loss": 5.9428, "mean_token_accuracy": 0.15798580050468444, "num_tokens": 4841951.0, "step": 2160 }, { "entropy": 6.011291074752807, "epoch": 0.2431628011456169, "grad_norm": 1.015625, "learning_rate": 0.0004998058960507286, "loss": 5.9185, "mean_token_accuracy": 0.15732098147273063, "num_tokens": 4852919.0, "step": 2165 }, { "entropy": 5.955287456512451, "epoch": 0.24372437805357444, "grad_norm": 1.046875, "learning_rate": 0.0004998042251518866, "loss": 5.9264, "mean_token_accuracy": 0.1588020294904709, "num_tokens": 4863433.0, "step": 2170 }, { "entropy": 6.019167184829712, "epoch": 0.244285954961532, "grad_norm": 0.9296875, "learning_rate": 0.0004998025470951908, "loss": 6.0132, "mean_token_accuracy": 0.15414848923683167, "num_tokens": 4875685.0, "step": 2175 }, { "entropy": 5.848620128631592, "epoch": 0.24484753186948952, "grad_norm": 0.96875, "learning_rate": 0.0004998008618806949, "loss": 5.9081, "mean_token_accuracy": 0.15716440230607986, "num_tokens": 4886347.0, "step": 2180 }, { "entropy": 5.924430418014526, "epoch": 0.24540910877744707, "grad_norm": 0.953125, "learning_rate": 0.0004997991695084523, "loss": 5.8998, "mean_token_accuracy": 0.16334613561630248, "num_tokens": 4896898.0, "step": 2185 }, { "entropy": 5.999474620819091, "epoch": 0.24597068568540462, "grad_norm": 0.93359375, "learning_rate": 0.0004997974699785169, "loss": 6.0128, "mean_token_accuracy": 0.15362882167100905, "num_tokens": 4908892.0, "step": 2190 }, { "entropy": 5.907583093643188, "epoch": 0.24653226259336217, "grad_norm": 0.9140625, "learning_rate": 0.0004997957632909429, "loss": 5.9471, "mean_token_accuracy": 0.15109152495861053, "num_tokens": 4920855.0, "step": 2195 }, { "entropy": 6.013603639602661, "epoch": 0.24709383950131972, "grad_norm": 1.078125, "learning_rate": 0.0004997940494457846, "loss": 5.9325, "mean_token_accuracy": 0.16000126004219056, "num_tokens": 4932857.0, "step": 2200 }, { "entropy": 5.8864202976226805, "epoch": 0.24765541640927724, "grad_norm": 0.98828125, "learning_rate": 0.0004997923284430967, "loss": 5.9747, "mean_token_accuracy": 0.15626695305109023, "num_tokens": 4944063.0, "step": 2205 }, { "entropy": 5.871590852737427, "epoch": 0.2482169933172348, "grad_norm": 0.97265625, "learning_rate": 0.0004997906002829338, "loss": 5.8432, "mean_token_accuracy": 0.16545321345329284, "num_tokens": 4955126.0, "step": 2210 }, { "entropy": 6.042226839065552, "epoch": 0.24877857022519234, "grad_norm": 1.0078125, "learning_rate": 0.000499788864965351, "loss": 6.0353, "mean_token_accuracy": 0.15824319273233414, "num_tokens": 4965738.0, "step": 2215 }, { "entropy": 6.032025718688965, "epoch": 0.2493401471331499, "grad_norm": 1.109375, "learning_rate": 0.0004997871224904036, "loss": 6.0553, "mean_token_accuracy": 0.15088909566402436, "num_tokens": 4976963.0, "step": 2220 }, { "entropy": 5.968750953674316, "epoch": 0.24990172404110744, "grad_norm": 1.03125, "learning_rate": 0.0004997853728581468, "loss": 5.9356, "mean_token_accuracy": 0.15454284846782684, "num_tokens": 4987577.0, "step": 2225 }, { "entropy": 5.988882637023925, "epoch": 0.250463300949065, "grad_norm": 0.9453125, "learning_rate": 0.0004997836160686368, "loss": 6.0657, "mean_token_accuracy": 0.15284020453691483, "num_tokens": 5000234.0, "step": 2230 }, { "entropy": 5.972144842147827, "epoch": 0.25102487785702254, "grad_norm": 1.0234375, "learning_rate": 0.0004997818521219291, "loss": 5.8895, "mean_token_accuracy": 0.15354024320840837, "num_tokens": 5011652.0, "step": 2235 }, { "entropy": 5.973802328109741, "epoch": 0.25158645476498004, "grad_norm": 0.98828125, "learning_rate": 0.0004997800810180803, "loss": 5.9329, "mean_token_accuracy": 0.1593118280172348, "num_tokens": 5023603.0, "step": 2240 }, { "entropy": 5.892467927932739, "epoch": 0.2521480316729376, "grad_norm": 1.0, "learning_rate": 0.0004997783027571464, "loss": 5.9091, "mean_token_accuracy": 0.15956079661846162, "num_tokens": 5034427.0, "step": 2245 }, { "entropy": 5.859362268447876, "epoch": 0.25270960858089514, "grad_norm": 1.0546875, "learning_rate": 0.0004997765173391841, "loss": 5.8988, "mean_token_accuracy": 0.15956594049930573, "num_tokens": 5045738.0, "step": 2250 }, { "entropy": 5.869083404541016, "epoch": 0.2532711854888527, "grad_norm": 1.0546875, "learning_rate": 0.0004997747247642505, "loss": 5.8353, "mean_token_accuracy": 0.15759642720222472, "num_tokens": 5057021.0, "step": 2255 }, { "entropy": 5.92234172821045, "epoch": 0.25383276239681024, "grad_norm": 0.9765625, "learning_rate": 0.0004997729250324023, "loss": 5.9244, "mean_token_accuracy": 0.15921089351177214, "num_tokens": 5067676.0, "step": 2260 }, { "entropy": 5.886710166931152, "epoch": 0.2543943393047678, "grad_norm": 0.97265625, "learning_rate": 0.0004997711181436971, "loss": 5.8615, "mean_token_accuracy": 0.15837088972330093, "num_tokens": 5079422.0, "step": 2265 }, { "entropy": 5.822842216491699, "epoch": 0.25495591621272534, "grad_norm": 0.96484375, "learning_rate": 0.0004997693040981922, "loss": 5.8851, "mean_token_accuracy": 0.16085467636585235, "num_tokens": 5091242.0, "step": 2270 }, { "entropy": 6.006762552261352, "epoch": 0.2555174931206829, "grad_norm": 0.98046875, "learning_rate": 0.0004997674828959456, "loss": 5.8909, "mean_token_accuracy": 0.15583527684211732, "num_tokens": 5102251.0, "step": 2275 }, { "entropy": 5.857793092727661, "epoch": 0.25607907002864044, "grad_norm": 1.5, "learning_rate": 0.0004997656545370151, "loss": 5.9104, "mean_token_accuracy": 0.1610156461596489, "num_tokens": 5113276.0, "step": 2280 }, { "entropy": 5.934245014190674, "epoch": 0.256640646936598, "grad_norm": 1.0625, "learning_rate": 0.000499763819021459, "loss": 5.9191, "mean_token_accuracy": 0.15731906294822692, "num_tokens": 5124472.0, "step": 2285 }, { "entropy": 5.863279104232788, "epoch": 0.2572022238445555, "grad_norm": 0.95703125, "learning_rate": 0.0004997619763493357, "loss": 5.8698, "mean_token_accuracy": 0.1613835647702217, "num_tokens": 5134896.0, "step": 2290 }, { "entropy": 5.962464809417725, "epoch": 0.25776380075251304, "grad_norm": 1.0625, "learning_rate": 0.000499760126520704, "loss": 5.95, "mean_token_accuracy": 0.1634097322821617, "num_tokens": 5145115.0, "step": 2295 }, { "entropy": 5.927261829376221, "epoch": 0.2583253776604706, "grad_norm": 1.015625, "learning_rate": 0.0004997582695356225, "loss": 5.9289, "mean_token_accuracy": 0.15928202718496323, "num_tokens": 5155620.0, "step": 2300 }, { "entropy": 6.070884418487549, "epoch": 0.25888695456842814, "grad_norm": 1.015625, "learning_rate": 0.0004997564053941507, "loss": 6.0126, "mean_token_accuracy": 0.15451653599739074, "num_tokens": 5166260.0, "step": 2305 }, { "entropy": 5.954886245727539, "epoch": 0.2594485314763857, "grad_norm": 0.9921875, "learning_rate": 0.0004997545340963478, "loss": 5.8733, "mean_token_accuracy": 0.15934662520885468, "num_tokens": 5177143.0, "step": 2310 }, { "entropy": 5.921825218200683, "epoch": 0.26001010838434324, "grad_norm": 0.98828125, "learning_rate": 0.0004997526556422733, "loss": 6.0233, "mean_token_accuracy": 0.15293444991111754, "num_tokens": 5187795.0, "step": 2315 }, { "entropy": 5.922110557556152, "epoch": 0.2605716852923008, "grad_norm": 0.92578125, "learning_rate": 0.0004997507700319872, "loss": 5.8811, "mean_token_accuracy": 0.16001545637845993, "num_tokens": 5199365.0, "step": 2320 }, { "entropy": 5.971580982208252, "epoch": 0.26113326220025834, "grad_norm": 1.2890625, "learning_rate": 0.0004997488772655492, "loss": 6.0976, "mean_token_accuracy": 0.15617025047540664, "num_tokens": 5212264.0, "step": 2325 }, { "entropy": 6.042904090881348, "epoch": 0.2616948391082159, "grad_norm": 1.0546875, "learning_rate": 0.0004997469773430199, "loss": 5.9253, "mean_token_accuracy": 0.15450814068317414, "num_tokens": 5223544.0, "step": 2330 }, { "entropy": 5.868034029006958, "epoch": 0.2622564160161734, "grad_norm": 0.94140625, "learning_rate": 0.0004997450702644596, "loss": 5.875, "mean_token_accuracy": 0.1604365214705467, "num_tokens": 5234713.0, "step": 2335 }, { "entropy": 5.9823534965515135, "epoch": 0.26281799292413094, "grad_norm": 1.0078125, "learning_rate": 0.0004997431560299292, "loss": 5.9591, "mean_token_accuracy": 0.15298095047473909, "num_tokens": 5246103.0, "step": 2340 }, { "entropy": 5.814671277999878, "epoch": 0.2633795698320885, "grad_norm": 1.0859375, "learning_rate": 0.0004997412346394894, "loss": 5.7917, "mean_token_accuracy": 0.16624176353216172, "num_tokens": 5257372.0, "step": 2345 }, { "entropy": 5.792899942398071, "epoch": 0.26394114674004604, "grad_norm": 0.9921875, "learning_rate": 0.0004997393060932017, "loss": 5.8609, "mean_token_accuracy": 0.16722605973482133, "num_tokens": 5268677.0, "step": 2350 }, { "entropy": 5.997194576263428, "epoch": 0.2645027236480036, "grad_norm": 1.0234375, "learning_rate": 0.0004997373703911273, "loss": 5.9247, "mean_token_accuracy": 0.16152105778455733, "num_tokens": 5279056.0, "step": 2355 }, { "entropy": 5.786316013336181, "epoch": 0.26506430055596114, "grad_norm": 1.0234375, "learning_rate": 0.0004997354275333277, "loss": 5.8069, "mean_token_accuracy": 0.16789699494838714, "num_tokens": 5289310.0, "step": 2360 }, { "entropy": 5.953582143783569, "epoch": 0.2656258774639187, "grad_norm": 0.91015625, "learning_rate": 0.000499733477519865, "loss": 5.8956, "mean_token_accuracy": 0.16771894991397857, "num_tokens": 5300619.0, "step": 2365 }, { "entropy": 6.053738594055176, "epoch": 0.26618745437187624, "grad_norm": 1.078125, "learning_rate": 0.0004997315203508013, "loss": 6.0608, "mean_token_accuracy": 0.1562006339430809, "num_tokens": 5311554.0, "step": 2370 }, { "entropy": 5.966435718536377, "epoch": 0.2667490312798338, "grad_norm": 1.0, "learning_rate": 0.0004997295560261988, "loss": 5.883, "mean_token_accuracy": 0.1612299293279648, "num_tokens": 5323592.0, "step": 2375 }, { "entropy": 5.942288255691528, "epoch": 0.26731060818779134, "grad_norm": 1.0625, "learning_rate": 0.00049972758454612, "loss": 5.9767, "mean_token_accuracy": 0.15383181422948838, "num_tokens": 5334978.0, "step": 2380 }, { "entropy": 5.898320913314819, "epoch": 0.26787218509574884, "grad_norm": 0.98828125, "learning_rate": 0.0004997256059106279, "loss": 5.8667, "mean_token_accuracy": 0.15778945684432982, "num_tokens": 5345724.0, "step": 2385 }, { "entropy": 5.94132432937622, "epoch": 0.2684337620037064, "grad_norm": 1.125, "learning_rate": 0.0004997236201197853, "loss": 5.9989, "mean_token_accuracy": 0.15381949245929719, "num_tokens": 5357141.0, "step": 2390 }, { "entropy": 5.9436756610870365, "epoch": 0.26899533891166394, "grad_norm": 0.97265625, "learning_rate": 0.0004997216271736554, "loss": 5.995, "mean_token_accuracy": 0.15819256901741027, "num_tokens": 5367889.0, "step": 2395 }, { "entropy": 5.786690282821655, "epoch": 0.2695569158196215, "grad_norm": 0.94921875, "learning_rate": 0.0004997196270723018, "loss": 5.7261, "mean_token_accuracy": 0.16399870365858077, "num_tokens": 5379329.0, "step": 2400 }, { "entropy": 5.895531129837036, "epoch": 0.27011849272757904, "grad_norm": 0.9375, "learning_rate": 0.0004997176198157881, "loss": 5.8852, "mean_token_accuracy": 0.1617034539580345, "num_tokens": 5389525.0, "step": 2405 }, { "entropy": 5.895331811904907, "epoch": 0.2706800696355366, "grad_norm": 0.93359375, "learning_rate": 0.0004997156054041781, "loss": 5.7958, "mean_token_accuracy": 0.16883354038000106, "num_tokens": 5401061.0, "step": 2410 }, { "entropy": 5.873462343215943, "epoch": 0.27124164654349414, "grad_norm": 1.0078125, "learning_rate": 0.0004997135838375362, "loss": 5.8949, "mean_token_accuracy": 0.1616640195250511, "num_tokens": 5411791.0, "step": 2415 }, { "entropy": 5.908325338363648, "epoch": 0.2718032234514517, "grad_norm": 1.0546875, "learning_rate": 0.0004997115551159267, "loss": 5.8467, "mean_token_accuracy": 0.16689947098493577, "num_tokens": 5422790.0, "step": 2420 }, { "entropy": 5.738713026046753, "epoch": 0.27236480035940924, "grad_norm": 0.9765625, "learning_rate": 0.000499709519239414, "loss": 5.7951, "mean_token_accuracy": 0.1616228774189949, "num_tokens": 5434170.0, "step": 2425 }, { "entropy": 5.972346496582031, "epoch": 0.2729263772673668, "grad_norm": 1.9453125, "learning_rate": 0.0004997074762080632, "loss": 5.922, "mean_token_accuracy": 0.15746588557958602, "num_tokens": 5445948.0, "step": 2430 }, { "entropy": 5.907391738891602, "epoch": 0.2734879541753243, "grad_norm": 0.9609375, "learning_rate": 0.000499705426021939, "loss": 5.8828, "mean_token_accuracy": 0.15904785543680192, "num_tokens": 5457786.0, "step": 2435 }, { "entropy": 5.784610605239868, "epoch": 0.27404953108328184, "grad_norm": 1.0625, "learning_rate": 0.000499703368681107, "loss": 5.8589, "mean_token_accuracy": 0.16070218682289122, "num_tokens": 5469434.0, "step": 2440 }, { "entropy": 5.8818888664245605, "epoch": 0.2746111079912394, "grad_norm": 1.046875, "learning_rate": 0.0004997013041856326, "loss": 5.8549, "mean_token_accuracy": 0.1531570464372635, "num_tokens": 5480393.0, "step": 2445 }, { "entropy": 5.844133996963501, "epoch": 0.27517268489919694, "grad_norm": 1.0703125, "learning_rate": 0.0004996992325355815, "loss": 5.8264, "mean_token_accuracy": 0.16376967430114747, "num_tokens": 5490452.0, "step": 2450 }, { "entropy": 5.843231868743897, "epoch": 0.2757342618071545, "grad_norm": 1.0546875, "learning_rate": 0.0004996971537310198, "loss": 5.7996, "mean_token_accuracy": 0.16604796648025513, "num_tokens": 5501404.0, "step": 2455 }, { "entropy": 5.97615795135498, "epoch": 0.27629583871511204, "grad_norm": 0.96484375, "learning_rate": 0.0004996950677720133, "loss": 5.9411, "mean_token_accuracy": 0.15309768170118332, "num_tokens": 5512938.0, "step": 2460 }, { "entropy": 5.879659843444824, "epoch": 0.2768574156230696, "grad_norm": 1.0078125, "learning_rate": 0.000499692974658629, "loss": 5.8641, "mean_token_accuracy": 0.15448336452245712, "num_tokens": 5524009.0, "step": 2465 }, { "entropy": 5.961763477325439, "epoch": 0.27741899253102714, "grad_norm": 1.1015625, "learning_rate": 0.0004996908743909331, "loss": 5.9491, "mean_token_accuracy": 0.15658549070358277, "num_tokens": 5535930.0, "step": 2470 }, { "entropy": 5.943891477584839, "epoch": 0.2779805694389847, "grad_norm": 1.109375, "learning_rate": 0.0004996887669689926, "loss": 5.9378, "mean_token_accuracy": 0.1560988336801529, "num_tokens": 5547295.0, "step": 2475 }, { "entropy": 5.934115314483643, "epoch": 0.2785421463469422, "grad_norm": 0.9921875, "learning_rate": 0.0004996866523928747, "loss": 5.8393, "mean_token_accuracy": 0.1640307277441025, "num_tokens": 5558447.0, "step": 2480 }, { "entropy": 5.91972165107727, "epoch": 0.27910372325489974, "grad_norm": 1.015625, "learning_rate": 0.0004996845306626467, "loss": 5.9369, "mean_token_accuracy": 0.16300042271614074, "num_tokens": 5569822.0, "step": 2485 }, { "entropy": 5.9508904933929445, "epoch": 0.2796653001628573, "grad_norm": 1.0078125, "learning_rate": 0.0004996824017783759, "loss": 5.9902, "mean_token_accuracy": 0.15508754998445512, "num_tokens": 5582284.0, "step": 2490 }, { "entropy": 5.9683637619018555, "epoch": 0.28022687707081484, "grad_norm": 1.0234375, "learning_rate": 0.0004996802657401304, "loss": 5.879, "mean_token_accuracy": 0.1611318975687027, "num_tokens": 5593765.0, "step": 2495 }, { "entropy": 5.801318073272705, "epoch": 0.2807884539787724, "grad_norm": 1.0, "learning_rate": 0.0004996781225479781, "loss": 5.8487, "mean_token_accuracy": 0.15998225808143615, "num_tokens": 5605080.0, "step": 2500 }, { "entropy": 6.015531349182129, "epoch": 0.28135003088672994, "grad_norm": 0.98046875, "learning_rate": 0.0004996759722019872, "loss": 6.011, "mean_token_accuracy": 0.15439892411231995, "num_tokens": 5616739.0, "step": 2505 }, { "entropy": 5.904989242553711, "epoch": 0.2819116077946875, "grad_norm": 1.03125, "learning_rate": 0.0004996738147022262, "loss": 5.8735, "mean_token_accuracy": 0.1576665908098221, "num_tokens": 5628779.0, "step": 2510 }, { "entropy": 5.889083909988403, "epoch": 0.28247318470264504, "grad_norm": 1.125, "learning_rate": 0.0004996716500487638, "loss": 5.909, "mean_token_accuracy": 0.15748686641454696, "num_tokens": 5639168.0, "step": 2515 }, { "entropy": 5.893275928497315, "epoch": 0.2830347616106026, "grad_norm": 1.03125, "learning_rate": 0.000499669478241669, "loss": 5.885, "mean_token_accuracy": 0.15599167197942734, "num_tokens": 5650739.0, "step": 2520 }, { "entropy": 5.933381366729736, "epoch": 0.28359633851856014, "grad_norm": 1.1171875, "learning_rate": 0.0004996672992810108, "loss": 5.9054, "mean_token_accuracy": 0.15816623866558074, "num_tokens": 5662630.0, "step": 2525 }, { "entropy": 5.921469497680664, "epoch": 0.28415791542651764, "grad_norm": 1.0078125, "learning_rate": 0.0004996651131668587, "loss": 5.9083, "mean_token_accuracy": 0.1671989306807518, "num_tokens": 5673473.0, "step": 2530 }, { "entropy": 5.915191793441773, "epoch": 0.2847194923344752, "grad_norm": 1.0234375, "learning_rate": 0.0004996629198992823, "loss": 6.0544, "mean_token_accuracy": 0.15136269852519035, "num_tokens": 5686577.0, "step": 2535 }, { "entropy": 5.963024854660034, "epoch": 0.28528106924243274, "grad_norm": 1.0390625, "learning_rate": 0.0004996607194783513, "loss": 5.8035, "mean_token_accuracy": 0.15977411419153215, "num_tokens": 5697570.0, "step": 2540 }, { "entropy": 5.849263906478882, "epoch": 0.2858426461503903, "grad_norm": 1.03125, "learning_rate": 0.0004996585119041359, "loss": 5.8717, "mean_token_accuracy": 0.15102790147066117, "num_tokens": 5708601.0, "step": 2545 }, { "entropy": 5.817156410217285, "epoch": 0.28640422305834784, "grad_norm": 0.9765625, "learning_rate": 0.0004996562971767063, "loss": 5.8333, "mean_token_accuracy": 0.1580057695508003, "num_tokens": 5719619.0, "step": 2550 }, { "entropy": 5.881134510040283, "epoch": 0.2869657999663054, "grad_norm": 1.1171875, "learning_rate": 0.000499654075296133, "loss": 5.854, "mean_token_accuracy": 0.16304896473884584, "num_tokens": 5730061.0, "step": 2555 }, { "entropy": 5.887245082855225, "epoch": 0.28752737687426294, "grad_norm": 1.0078125, "learning_rate": 0.000499651846262487, "loss": 5.8781, "mean_token_accuracy": 0.16307636797428132, "num_tokens": 5741579.0, "step": 2560 }, { "entropy": 5.929854440689087, "epoch": 0.2880889537822205, "grad_norm": 0.984375, "learning_rate": 0.0004996496100758389, "loss": 5.8899, "mean_token_accuracy": 0.16015600562095642, "num_tokens": 5754001.0, "step": 2565 }, { "entropy": 5.956954383850098, "epoch": 0.28865053069017804, "grad_norm": 1.0859375, "learning_rate": 0.0004996473667362604, "loss": 5.9762, "mean_token_accuracy": 0.15367593243718147, "num_tokens": 5766224.0, "step": 2570 }, { "entropy": 5.9173064708709715, "epoch": 0.28921210759813554, "grad_norm": 0.99609375, "learning_rate": 0.0004996451162438224, "loss": 5.9514, "mean_token_accuracy": 0.1529170662164688, "num_tokens": 5777475.0, "step": 2575 }, { "entropy": 5.9922263622283936, "epoch": 0.2897736845060931, "grad_norm": 1.109375, "learning_rate": 0.0004996428585985967, "loss": 5.9243, "mean_token_accuracy": 0.15300409942865373, "num_tokens": 5788359.0, "step": 2580 }, { "entropy": 5.833764743804932, "epoch": 0.29033526141405064, "grad_norm": 1.0390625, "learning_rate": 0.0004996405938006553, "loss": 5.88, "mean_token_accuracy": 0.1589822694659233, "num_tokens": 5799116.0, "step": 2585 }, { "entropy": 5.849058294296265, "epoch": 0.2908968383220082, "grad_norm": 0.99609375, "learning_rate": 0.0004996383218500703, "loss": 5.8163, "mean_token_accuracy": 0.16485902518033982, "num_tokens": 5811221.0, "step": 2590 }, { "entropy": 5.903125619888305, "epoch": 0.29145841522996574, "grad_norm": 1.046875, "learning_rate": 0.000499636042746914, "loss": 5.8986, "mean_token_accuracy": 0.1597510278224945, "num_tokens": 5822099.0, "step": 2595 }, { "entropy": 5.908592653274536, "epoch": 0.2920199921379233, "grad_norm": 1.0546875, "learning_rate": 0.000499633756491259, "loss": 5.8603, "mean_token_accuracy": 0.154727041721344, "num_tokens": 5832836.0, "step": 2600 }, { "entropy": 5.813444709777832, "epoch": 0.29258156904588084, "grad_norm": 1.109375, "learning_rate": 0.0004996314630831781, "loss": 5.8066, "mean_token_accuracy": 0.15686748921871185, "num_tokens": 5842892.0, "step": 2605 }, { "entropy": 5.8215662956237795, "epoch": 0.2931431459538384, "grad_norm": 1.09375, "learning_rate": 0.0004996291625227443, "loss": 5.7707, "mean_token_accuracy": 0.17027000188827515, "num_tokens": 5852909.0, "step": 2610 }, { "entropy": 5.975628280639649, "epoch": 0.29370472286179594, "grad_norm": 1.1015625, "learning_rate": 0.0004996268548100307, "loss": 5.9509, "mean_token_accuracy": 0.15499749705195426, "num_tokens": 5864676.0, "step": 2615 }, { "entropy": 5.67653169631958, "epoch": 0.2942662997697535, "grad_norm": 1.0625, "learning_rate": 0.000499624539945111, "loss": 5.6832, "mean_token_accuracy": 0.17367247641086578, "num_tokens": 5875258.0, "step": 2620 }, { "entropy": 5.918656921386718, "epoch": 0.294827876677711, "grad_norm": 1.0078125, "learning_rate": 0.0004996222179280589, "loss": 5.8505, "mean_token_accuracy": 0.16116076856851577, "num_tokens": 5885611.0, "step": 2625 }, { "entropy": 5.846941518783569, "epoch": 0.29538945358566854, "grad_norm": 1.0859375, "learning_rate": 0.0004996198887589481, "loss": 5.8257, "mean_token_accuracy": 0.15930989608168603, "num_tokens": 5896726.0, "step": 2630 }, { "entropy": 5.917367076873779, "epoch": 0.2959510304936261, "grad_norm": 1.0625, "learning_rate": 0.0004996175524378531, "loss": 5.851, "mean_token_accuracy": 0.1528210312128067, "num_tokens": 5907860.0, "step": 2635 }, { "entropy": 5.806666278839112, "epoch": 0.29651260740158364, "grad_norm": 1.09375, "learning_rate": 0.000499615208964848, "loss": 5.798, "mean_token_accuracy": 0.1638117402791977, "num_tokens": 5918676.0, "step": 2640 }, { "entropy": 5.9251220703125, "epoch": 0.2970741843095412, "grad_norm": 1.0859375, "learning_rate": 0.0004996128583400077, "loss": 5.8618, "mean_token_accuracy": 0.16403974294662477, "num_tokens": 5928646.0, "step": 2645 }, { "entropy": 5.816641330718994, "epoch": 0.29763576121749874, "grad_norm": 1.1640625, "learning_rate": 0.0004996105005634066, "loss": 5.8735, "mean_token_accuracy": 0.1569816768169403, "num_tokens": 5938990.0, "step": 2650 }, { "entropy": 5.8617603302001955, "epoch": 0.2981973381254563, "grad_norm": 1.1015625, "learning_rate": 0.0004996081356351202, "loss": 5.8194, "mean_token_accuracy": 0.16183129400014878, "num_tokens": 5948811.0, "step": 2655 }, { "entropy": 5.812265920639038, "epoch": 0.29875891503341384, "grad_norm": 1.046875, "learning_rate": 0.0004996057635552237, "loss": 5.8406, "mean_token_accuracy": 0.16514092236757277, "num_tokens": 5959227.0, "step": 2660 }, { "entropy": 5.8553258895874025, "epoch": 0.2993204919413714, "grad_norm": 1.1015625, "learning_rate": 0.0004996033843237925, "loss": 5.7535, "mean_token_accuracy": 0.16563905775547028, "num_tokens": 5970546.0, "step": 2665 }, { "entropy": 5.982068204879761, "epoch": 0.29988206884932894, "grad_norm": 1.5625, "learning_rate": 0.0004996009979409025, "loss": 6.0502, "mean_token_accuracy": 0.147099506855011, "num_tokens": 5983936.0, "step": 2670 }, { "entropy": 5.802636957168579, "epoch": 0.30044364575728644, "grad_norm": 1.1484375, "learning_rate": 0.0004995986044066295, "loss": 5.8494, "mean_token_accuracy": 0.15568828135728835, "num_tokens": 5994963.0, "step": 2675 }, { "entropy": 5.762459421157837, "epoch": 0.301005222665244, "grad_norm": 1.0390625, "learning_rate": 0.00049959620372105, "loss": 5.8079, "mean_token_accuracy": 0.16270437240600585, "num_tokens": 6005836.0, "step": 2680 }, { "entropy": 5.895258378982544, "epoch": 0.30156679957320154, "grad_norm": 1.0859375, "learning_rate": 0.0004995937958842401, "loss": 5.8057, "mean_token_accuracy": 0.16682981103658676, "num_tokens": 6017408.0, "step": 2685 }, { "entropy": 5.811723136901856, "epoch": 0.3021283764811591, "grad_norm": 1.109375, "learning_rate": 0.0004995913808962767, "loss": 5.8192, "mean_token_accuracy": 0.15878787338733674, "num_tokens": 6029281.0, "step": 2690 }, { "entropy": 5.850067806243897, "epoch": 0.30268995338911664, "grad_norm": 1.0703125, "learning_rate": 0.0004995889587572366, "loss": 5.8088, "mean_token_accuracy": 0.16636761128902436, "num_tokens": 6039354.0, "step": 2695 }, { "entropy": 5.8515503883361815, "epoch": 0.3032515302970742, "grad_norm": 1.09375, "learning_rate": 0.000499586529467197, "loss": 5.785, "mean_token_accuracy": 0.15962323993444444, "num_tokens": 6050053.0, "step": 2700 }, { "entropy": 5.90614161491394, "epoch": 0.30381310720503174, "grad_norm": 1.09375, "learning_rate": 0.0004995840930262351, "loss": 5.8451, "mean_token_accuracy": 0.15831548869609832, "num_tokens": 6060221.0, "step": 2705 }, { "entropy": 5.824668931961059, "epoch": 0.3043746841129893, "grad_norm": 1.03125, "learning_rate": 0.0004995816494344287, "loss": 5.859, "mean_token_accuracy": 0.1601285994052887, "num_tokens": 6070963.0, "step": 2710 }, { "entropy": 5.989436864852905, "epoch": 0.30493626102094684, "grad_norm": 1.0390625, "learning_rate": 0.0004995791986918554, "loss": 5.9386, "mean_token_accuracy": 0.15705745071172714, "num_tokens": 6082028.0, "step": 2715 }, { "entropy": 5.949339580535889, "epoch": 0.30549783792890434, "grad_norm": 1.0703125, "learning_rate": 0.0004995767407985933, "loss": 5.8736, "mean_token_accuracy": 0.16265355795621872, "num_tokens": 6092778.0, "step": 2720 }, { "entropy": 5.677318954467774, "epoch": 0.3060594148368619, "grad_norm": 1.09375, "learning_rate": 0.0004995742757547207, "loss": 5.6421, "mean_token_accuracy": 0.16859253942966462, "num_tokens": 6103093.0, "step": 2725 }, { "entropy": 5.772259378433228, "epoch": 0.30662099174481944, "grad_norm": 1.09375, "learning_rate": 0.000499571803560316, "loss": 5.7347, "mean_token_accuracy": 0.16355275958776475, "num_tokens": 6113516.0, "step": 2730 }, { "entropy": 5.810375738143921, "epoch": 0.307182568652777, "grad_norm": 1.0703125, "learning_rate": 0.0004995693242154581, "loss": 5.8036, "mean_token_accuracy": 0.15890752524137497, "num_tokens": 6125723.0, "step": 2735 }, { "entropy": 5.847309589385986, "epoch": 0.30774414556073454, "grad_norm": 1.21875, "learning_rate": 0.0004995668377202258, "loss": 5.8136, "mean_token_accuracy": 0.16112632900476456, "num_tokens": 6137091.0, "step": 2740 }, { "entropy": 5.77405891418457, "epoch": 0.3083057224686921, "grad_norm": 1.0703125, "learning_rate": 0.0004995643440746982, "loss": 5.7528, "mean_token_accuracy": 0.16945552676916123, "num_tokens": 6147941.0, "step": 2745 }, { "entropy": 5.732852792739868, "epoch": 0.30886729937664964, "grad_norm": 1.109375, "learning_rate": 0.0004995618432789548, "loss": 5.7549, "mean_token_accuracy": 0.16648126393556595, "num_tokens": 6158493.0, "step": 2750 }, { "entropy": 5.8287242412567135, "epoch": 0.3094288762846072, "grad_norm": 1.03125, "learning_rate": 0.0004995593353330753, "loss": 5.8915, "mean_token_accuracy": 0.15722588896751405, "num_tokens": 6170759.0, "step": 2755 }, { "entropy": 5.898643875122071, "epoch": 0.30999045319256474, "grad_norm": 1.109375, "learning_rate": 0.0004995568202371393, "loss": 5.724, "mean_token_accuracy": 0.16514806002378463, "num_tokens": 6182488.0, "step": 2760 }, { "entropy": 5.841040992736817, "epoch": 0.3105520301005223, "grad_norm": 1.09375, "learning_rate": 0.0004995542979912272, "loss": 5.9165, "mean_token_accuracy": 0.15282527059316636, "num_tokens": 6193849.0, "step": 2765 }, { "entropy": 5.800279855728149, "epoch": 0.3111136070084798, "grad_norm": 1.1015625, "learning_rate": 0.0004995517685954192, "loss": 5.7598, "mean_token_accuracy": 0.16608615219593048, "num_tokens": 6204132.0, "step": 2770 }, { "entropy": 5.946976375579834, "epoch": 0.31167518391643734, "grad_norm": 0.99609375, "learning_rate": 0.0004995492320497958, "loss": 5.9018, "mean_token_accuracy": 0.1554347574710846, "num_tokens": 6215547.0, "step": 2775 }, { "entropy": 5.905535459518433, "epoch": 0.3122367608243949, "grad_norm": 1.015625, "learning_rate": 0.0004995466883544376, "loss": 5.9293, "mean_token_accuracy": 0.15042147785425186, "num_tokens": 6227150.0, "step": 2780 }, { "entropy": 5.8855243682861325, "epoch": 0.31279833773235244, "grad_norm": 1.09375, "learning_rate": 0.0004995441375094258, "loss": 5.9248, "mean_token_accuracy": 0.15840522199869156, "num_tokens": 6237387.0, "step": 2785 }, { "entropy": 5.872175312042236, "epoch": 0.31335991464031, "grad_norm": 1.09375, "learning_rate": 0.0004995415795148417, "loss": 5.812, "mean_token_accuracy": 0.16368252038955688, "num_tokens": 6248623.0, "step": 2790 }, { "entropy": 5.76340684890747, "epoch": 0.31392149154826754, "grad_norm": 1.109375, "learning_rate": 0.0004995390143707665, "loss": 5.7152, "mean_token_accuracy": 0.17597836554050444, "num_tokens": 6258596.0, "step": 2795 }, { "entropy": 5.822847366333008, "epoch": 0.3144830684562251, "grad_norm": 1.0234375, "learning_rate": 0.0004995364420772821, "loss": 5.9642, "mean_token_accuracy": 0.15163593217730523, "num_tokens": 6270529.0, "step": 2800 }, { "entropy": 6.0933667659759525, "epoch": 0.31504464536418264, "grad_norm": 1.0703125, "learning_rate": 0.0004995338626344702, "loss": 5.8579, "mean_token_accuracy": 0.16046109050512314, "num_tokens": 6280891.0, "step": 2805 }, { "entropy": 5.7229210376739506, "epoch": 0.3156062222721402, "grad_norm": 1.0078125, "learning_rate": 0.000499531276042413, "loss": 5.7988, "mean_token_accuracy": 0.15810492336750032, "num_tokens": 6292247.0, "step": 2810 }, { "entropy": 5.79867639541626, "epoch": 0.31616779918009774, "grad_norm": 1.140625, "learning_rate": 0.0004995286823011929, "loss": 5.7847, "mean_token_accuracy": 0.16373041421175002, "num_tokens": 6302403.0, "step": 2815 }, { "entropy": 5.7128393173217775, "epoch": 0.31672937608805524, "grad_norm": 1.1484375, "learning_rate": 0.0004995260814108926, "loss": 5.6696, "mean_token_accuracy": 0.1683839187026024, "num_tokens": 6313901.0, "step": 2820 }, { "entropy": 5.921040821075439, "epoch": 0.3172909529960128, "grad_norm": 1.0625, "learning_rate": 0.0004995234733715947, "loss": 5.8928, "mean_token_accuracy": 0.15783516615629195, "num_tokens": 6323711.0, "step": 2825 }, { "entropy": 5.817658710479736, "epoch": 0.31785252990397034, "grad_norm": 1.0, "learning_rate": 0.0004995208581833824, "loss": 5.7877, "mean_token_accuracy": 0.1626381605863571, "num_tokens": 6334937.0, "step": 2830 }, { "entropy": 5.928051614761353, "epoch": 0.3184141068119279, "grad_norm": 1.109375, "learning_rate": 0.0004995182358463388, "loss": 5.8838, "mean_token_accuracy": 0.15879348814487457, "num_tokens": 6345723.0, "step": 2835 }, { "entropy": 5.844352579116821, "epoch": 0.31897568371988544, "grad_norm": 1.03125, "learning_rate": 0.0004995156063605475, "loss": 5.8219, "mean_token_accuracy": 0.15776338502764703, "num_tokens": 6357573.0, "step": 2840 }, { "entropy": 5.8675610542297365, "epoch": 0.319537260627843, "grad_norm": 1.15625, "learning_rate": 0.0004995129697260922, "loss": 5.8322, "mean_token_accuracy": 0.16539549678564072, "num_tokens": 6367417.0, "step": 2845 }, { "entropy": 5.872849082946777, "epoch": 0.32009883753580054, "grad_norm": 1.0546875, "learning_rate": 0.0004995103259430569, "loss": 5.841, "mean_token_accuracy": 0.16827336698770523, "num_tokens": 6377753.0, "step": 2850 }, { "entropy": 5.839739036560059, "epoch": 0.3206604144437581, "grad_norm": 1.078125, "learning_rate": 0.0004995076750115258, "loss": 5.8514, "mean_token_accuracy": 0.15937740802764894, "num_tokens": 6388613.0, "step": 2855 }, { "entropy": 5.815576601028442, "epoch": 0.32122199135171564, "grad_norm": 1.078125, "learning_rate": 0.0004995050169315832, "loss": 5.796, "mean_token_accuracy": 0.1593346953392029, "num_tokens": 6399415.0, "step": 2860 }, { "entropy": 5.867472791671753, "epoch": 0.32178356825967314, "grad_norm": 1.0234375, "learning_rate": 0.0004995023517033138, "loss": 5.8285, "mean_token_accuracy": 0.15754698514938353, "num_tokens": 6411435.0, "step": 2865 }, { "entropy": 5.926137781143188, "epoch": 0.3223451451676307, "grad_norm": 1.0703125, "learning_rate": 0.0004994996793268024, "loss": 5.976, "mean_token_accuracy": 0.15850219279527664, "num_tokens": 6423030.0, "step": 2870 }, { "entropy": 5.888271427154541, "epoch": 0.32290672207558824, "grad_norm": 1.0390625, "learning_rate": 0.0004994969998021342, "loss": 5.7765, "mean_token_accuracy": 0.16209373772144317, "num_tokens": 6434330.0, "step": 2875 }, { "entropy": 5.859491014480591, "epoch": 0.3234682989835458, "grad_norm": 1.03125, "learning_rate": 0.0004994943131293944, "loss": 5.8646, "mean_token_accuracy": 0.16070864647626876, "num_tokens": 6446452.0, "step": 2880 }, { "entropy": 5.8355710983276365, "epoch": 0.32402987589150334, "grad_norm": 1.0703125, "learning_rate": 0.0004994916193086687, "loss": 5.8139, "mean_token_accuracy": 0.1690973237156868, "num_tokens": 6456723.0, "step": 2885 }, { "entropy": 5.899684286117553, "epoch": 0.3245914527994609, "grad_norm": 1.1328125, "learning_rate": 0.0004994889183400428, "loss": 5.9365, "mean_token_accuracy": 0.15811522603034972, "num_tokens": 6468117.0, "step": 2890 }, { "entropy": 5.826454973220825, "epoch": 0.32515302970741844, "grad_norm": 1.125, "learning_rate": 0.0004994862102236025, "loss": 5.7204, "mean_token_accuracy": 0.16832807213068007, "num_tokens": 6479465.0, "step": 2895 }, { "entropy": 5.89757194519043, "epoch": 0.325714606615376, "grad_norm": 1.1796875, "learning_rate": 0.0004994834949594342, "loss": 5.9526, "mean_token_accuracy": 0.1629941999912262, "num_tokens": 6490868.0, "step": 2900 }, { "entropy": 5.972553682327271, "epoch": 0.32627618352333354, "grad_norm": 1.0703125, "learning_rate": 0.0004994807725476246, "loss": 5.8245, "mean_token_accuracy": 0.16008032113313675, "num_tokens": 6502126.0, "step": 2905 }, { "entropy": 5.72076644897461, "epoch": 0.3268377604312911, "grad_norm": 1.0, "learning_rate": 0.0004994780429882599, "loss": 5.9091, "mean_token_accuracy": 0.15670095086097718, "num_tokens": 6514382.0, "step": 2910 }, { "entropy": 5.882012605667114, "epoch": 0.3273993373392486, "grad_norm": 0.9765625, "learning_rate": 0.0004994753062814274, "loss": 5.7914, "mean_token_accuracy": 0.15964423269033431, "num_tokens": 6526272.0, "step": 2915 }, { "entropy": 5.866258335113526, "epoch": 0.32796091424720614, "grad_norm": 1.0, "learning_rate": 0.0004994725624272139, "loss": 5.8134, "mean_token_accuracy": 0.16369341611862182, "num_tokens": 6537511.0, "step": 2920 }, { "entropy": 5.805434799194336, "epoch": 0.3285224911551637, "grad_norm": 1.0703125, "learning_rate": 0.0004994698114257071, "loss": 5.7523, "mean_token_accuracy": 0.16356185525655748, "num_tokens": 6549737.0, "step": 2925 }, { "entropy": 5.735032749176026, "epoch": 0.32908406806312124, "grad_norm": 1.2109375, "learning_rate": 0.0004994670532769944, "loss": 5.842, "mean_token_accuracy": 0.16296304613351822, "num_tokens": 6560318.0, "step": 2930 }, { "entropy": 5.818574094772339, "epoch": 0.3296456449710788, "grad_norm": 1.125, "learning_rate": 0.0004994642879811637, "loss": 5.7497, "mean_token_accuracy": 0.16560823023319243, "num_tokens": 6570575.0, "step": 2935 }, { "entropy": 5.807329988479614, "epoch": 0.33020722187903634, "grad_norm": 1.0703125, "learning_rate": 0.000499461515538303, "loss": 5.8172, "mean_token_accuracy": 0.1601566642522812, "num_tokens": 6582083.0, "step": 2940 }, { "entropy": 6.00074577331543, "epoch": 0.3307687987869939, "grad_norm": 1.109375, "learning_rate": 0.0004994587359485006, "loss": 5.9414, "mean_token_accuracy": 0.16097475886344909, "num_tokens": 6592240.0, "step": 2945 }, { "entropy": 5.806456136703491, "epoch": 0.33133037569495144, "grad_norm": 1.046875, "learning_rate": 0.000499455949211845, "loss": 5.7185, "mean_token_accuracy": 0.1677255555987358, "num_tokens": 6602680.0, "step": 2950 }, { "entropy": 5.796722078323365, "epoch": 0.331891952602909, "grad_norm": 1.078125, "learning_rate": 0.0004994531553284248, "loss": 5.8381, "mean_token_accuracy": 0.16280671954154968, "num_tokens": 6613399.0, "step": 2955 }, { "entropy": 5.918023681640625, "epoch": 0.3324535295108665, "grad_norm": 1.046875, "learning_rate": 0.0004994503542983293, "loss": 5.91, "mean_token_accuracy": 0.15692875981330873, "num_tokens": 6624410.0, "step": 2960 }, { "entropy": 5.893260526657104, "epoch": 0.33301510641882404, "grad_norm": 1.15625, "learning_rate": 0.0004994475461216472, "loss": 5.7623, "mean_token_accuracy": 0.1689491778612137, "num_tokens": 6635523.0, "step": 2965 }, { "entropy": 5.8270707607269285, "epoch": 0.3335766833267816, "grad_norm": 1.2109375, "learning_rate": 0.0004994447307984684, "loss": 5.9249, "mean_token_accuracy": 0.1531895712018013, "num_tokens": 6648416.0, "step": 2970 }, { "entropy": 5.764549970626831, "epoch": 0.33413826023473914, "grad_norm": 1.0390625, "learning_rate": 0.0004994419083288823, "loss": 5.7112, "mean_token_accuracy": 0.16065409630537034, "num_tokens": 6658907.0, "step": 2975 }, { "entropy": 5.840141725540161, "epoch": 0.3346998371426967, "grad_norm": 1.125, "learning_rate": 0.0004994390787129787, "loss": 5.8754, "mean_token_accuracy": 0.1610553666949272, "num_tokens": 6669682.0, "step": 2980 }, { "entropy": 5.9260087490081785, "epoch": 0.33526141405065424, "grad_norm": 1.109375, "learning_rate": 0.0004994362419508478, "loss": 5.9334, "mean_token_accuracy": 0.1567075252532959, "num_tokens": 6681919.0, "step": 2985 }, { "entropy": 5.9462815284729, "epoch": 0.3358229909586118, "grad_norm": 0.9921875, "learning_rate": 0.00049943339804258, "loss": 5.8707, "mean_token_accuracy": 0.1613776594400406, "num_tokens": 6693988.0, "step": 2990 }, { "entropy": 5.7616931915283205, "epoch": 0.33638456786656934, "grad_norm": 1.2578125, "learning_rate": 0.0004994305469882657, "loss": 5.8059, "mean_token_accuracy": 0.15830975472927095, "num_tokens": 6705413.0, "step": 2995 }, { "entropy": 5.859702157974243, "epoch": 0.3369461447745269, "grad_norm": 1.0546875, "learning_rate": 0.0004994276887879957, "loss": 5.763, "mean_token_accuracy": 0.16223098933696747, "num_tokens": 6716217.0, "step": 3000 }, { "epoch": 0.3369461447745269, "eval_entropy": 5.720634406333059, "eval_loss": 5.844816207885742, "eval_mean_token_accuracy": 0.1682441681402459, "eval_num_tokens": 6716217.0, "eval_runtime": 23.7412, "eval_samples_per_second": 1306.296, "eval_steps_per_second": 163.303, "step": 3000 }, { "entropy": 5.799144506454468, "epoch": 0.33750772168248444, "grad_norm": 1.0234375, "learning_rate": 0.0004994248234418611, "loss": 5.8366, "mean_token_accuracy": 0.162978595495224, "num_tokens": 6728059.0, "step": 3005 }, { "entropy": 5.893440103530883, "epoch": 0.33806929859044194, "grad_norm": 1.03125, "learning_rate": 0.000499421950949953, "loss": 5.7807, "mean_token_accuracy": 0.16390309780836104, "num_tokens": 6740650.0, "step": 3010 }, { "entropy": 5.698744678497315, "epoch": 0.3386308754983995, "grad_norm": 1.03125, "learning_rate": 0.000499419071312363, "loss": 5.6836, "mean_token_accuracy": 0.16469298750162126, "num_tokens": 6751467.0, "step": 3015 }, { "entropy": 5.7961132526397705, "epoch": 0.33919245240635704, "grad_norm": 1.0625, "learning_rate": 0.0004994161845291828, "loss": 5.7861, "mean_token_accuracy": 0.16712161004543305, "num_tokens": 6761377.0, "step": 3020 }, { "entropy": 5.79654335975647, "epoch": 0.3397540293143146, "grad_norm": 1.0078125, "learning_rate": 0.0004994132906005041, "loss": 5.7393, "mean_token_accuracy": 0.16078124195337296, "num_tokens": 6773296.0, "step": 3025 }, { "entropy": 5.845974779129028, "epoch": 0.34031560622227214, "grad_norm": 1.015625, "learning_rate": 0.0004994103895264193, "loss": 5.7954, "mean_token_accuracy": 0.15900143682956697, "num_tokens": 6784122.0, "step": 3030 }, { "entropy": 5.704025363922119, "epoch": 0.3408771831302297, "grad_norm": 1.078125, "learning_rate": 0.0004994074813070207, "loss": 5.6383, "mean_token_accuracy": 0.16705414056777954, "num_tokens": 6795604.0, "step": 3035 }, { "entropy": 5.769487285614014, "epoch": 0.34143876003818724, "grad_norm": 1.015625, "learning_rate": 0.0004994045659424007, "loss": 5.7981, "mean_token_accuracy": 0.16261281818151474, "num_tokens": 6806671.0, "step": 3040 }, { "entropy": 5.9057597637176515, "epoch": 0.3420003369461448, "grad_norm": 1.0078125, "learning_rate": 0.0004994016434326524, "loss": 5.8216, "mean_token_accuracy": 0.16332198679447174, "num_tokens": 6818271.0, "step": 3045 }, { "entropy": 5.7448649406433105, "epoch": 0.34256191385410234, "grad_norm": 1.0703125, "learning_rate": 0.0004993987137778687, "loss": 5.8169, "mean_token_accuracy": 0.1635512739419937, "num_tokens": 6830049.0, "step": 3050 }, { "entropy": 5.942811059951782, "epoch": 0.3431234907620599, "grad_norm": 0.9609375, "learning_rate": 0.000499395776978143, "loss": 5.9403, "mean_token_accuracy": 0.15486131906509398, "num_tokens": 6842275.0, "step": 3055 }, { "entropy": 5.956660890579224, "epoch": 0.3436850676700174, "grad_norm": 1.015625, "learning_rate": 0.0004993928330335686, "loss": 5.8766, "mean_token_accuracy": 0.1637545719742775, "num_tokens": 6854910.0, "step": 3060 }, { "entropy": 5.791312170028687, "epoch": 0.34424664457797494, "grad_norm": 1.0234375, "learning_rate": 0.0004993898819442395, "loss": 5.8284, "mean_token_accuracy": 0.16965375244617462, "num_tokens": 6866031.0, "step": 3065 }, { "entropy": 5.93616361618042, "epoch": 0.3448082214859325, "grad_norm": 1.046875, "learning_rate": 0.0004993869237102494, "loss": 5.8471, "mean_token_accuracy": 0.15883387625217438, "num_tokens": 6877672.0, "step": 3070 }, { "entropy": 5.765334987640381, "epoch": 0.34536979839389004, "grad_norm": 1.125, "learning_rate": 0.0004993839583316927, "loss": 5.7543, "mean_token_accuracy": 0.16836509853601456, "num_tokens": 6889089.0, "step": 3075 }, { "entropy": 5.673844814300537, "epoch": 0.3459313753018476, "grad_norm": 1.015625, "learning_rate": 0.0004993809858086638, "loss": 5.6994, "mean_token_accuracy": 0.1676324874162674, "num_tokens": 6899877.0, "step": 3080 }, { "entropy": 5.793374395370483, "epoch": 0.34649295220980514, "grad_norm": 1.09375, "learning_rate": 0.0004993780061412571, "loss": 5.6829, "mean_token_accuracy": 0.1715866893529892, "num_tokens": 6910686.0, "step": 3085 }, { "entropy": 5.734429454803466, "epoch": 0.3470545291177627, "grad_norm": 1.078125, "learning_rate": 0.0004993750193295678, "loss": 5.7143, "mean_token_accuracy": 0.17135517448186874, "num_tokens": 6920867.0, "step": 3090 }, { "entropy": 5.899741554260254, "epoch": 0.34761610602572024, "grad_norm": 1.0625, "learning_rate": 0.0004993720253736909, "loss": 5.9044, "mean_token_accuracy": 0.16466446667909623, "num_tokens": 6932779.0, "step": 3095 }, { "entropy": 5.86834020614624, "epoch": 0.3481776829336778, "grad_norm": 1.234375, "learning_rate": 0.0004993690242737216, "loss": 5.8055, "mean_token_accuracy": 0.16673210114240647, "num_tokens": 6943378.0, "step": 3100 }, { "entropy": 5.760788822174073, "epoch": 0.3487392598416353, "grad_norm": 1.0546875, "learning_rate": 0.0004993660160297555, "loss": 5.7867, "mean_token_accuracy": 0.16799272298812867, "num_tokens": 6955469.0, "step": 3105 }, { "entropy": 5.971051931381226, "epoch": 0.34930083674959284, "grad_norm": 1.3125, "learning_rate": 0.0004993630006418885, "loss": 5.8788, "mean_token_accuracy": 0.16197884529829026, "num_tokens": 6966750.0, "step": 3110 }, { "entropy": 5.811239528656006, "epoch": 0.3498624136575504, "grad_norm": 1.0234375, "learning_rate": 0.0004993599781102166, "loss": 5.7912, "mean_token_accuracy": 0.16256844401359558, "num_tokens": 6979010.0, "step": 3115 }, { "entropy": 5.775843524932862, "epoch": 0.35042399056550794, "grad_norm": 1.0859375, "learning_rate": 0.0004993569484348359, "loss": 5.7764, "mean_token_accuracy": 0.16187913715839386, "num_tokens": 6990566.0, "step": 3120 }, { "entropy": 5.8379576206207275, "epoch": 0.3509855674734655, "grad_norm": 1.1640625, "learning_rate": 0.0004993539116158429, "loss": 5.7852, "mean_token_accuracy": 0.1654660627245903, "num_tokens": 7000288.0, "step": 3125 }, { "entropy": 5.689918518066406, "epoch": 0.35154714438142304, "grad_norm": 1.0, "learning_rate": 0.0004993508676533346, "loss": 5.7248, "mean_token_accuracy": 0.16818051636219025, "num_tokens": 7011143.0, "step": 3130 }, { "entropy": 5.967591333389282, "epoch": 0.3521087212893806, "grad_norm": 1.125, "learning_rate": 0.0004993478165474074, "loss": 5.8802, "mean_token_accuracy": 0.15500763505697251, "num_tokens": 7022797.0, "step": 3135 }, { "entropy": 5.829250907897949, "epoch": 0.35267029819733814, "grad_norm": 1.0625, "learning_rate": 0.0004993447582981588, "loss": 5.8523, "mean_token_accuracy": 0.15978631526231765, "num_tokens": 7033477.0, "step": 3140 }, { "entropy": 5.825192642211914, "epoch": 0.3532318751052957, "grad_norm": 1.0234375, "learning_rate": 0.000499341692905686, "loss": 5.8713, "mean_token_accuracy": 0.16687492281198502, "num_tokens": 7045249.0, "step": 3145 }, { "entropy": 5.924324893951416, "epoch": 0.35379345201325324, "grad_norm": 1.09375, "learning_rate": 0.0004993386203700868, "loss": 5.8924, "mean_token_accuracy": 0.16145936846733094, "num_tokens": 7056890.0, "step": 3150 }, { "entropy": 5.861443424224854, "epoch": 0.35435502892121074, "grad_norm": 1.109375, "learning_rate": 0.0004993355406914589, "loss": 5.7678, "mean_token_accuracy": 0.1675198808312416, "num_tokens": 7067181.0, "step": 3155 }, { "entropy": 5.785042476654053, "epoch": 0.3549166058291683, "grad_norm": 1.0859375, "learning_rate": 0.0004993324538699003, "loss": 5.7324, "mean_token_accuracy": 0.16697331219911576, "num_tokens": 7078220.0, "step": 3160 }, { "entropy": 5.833939266204834, "epoch": 0.35547818273712584, "grad_norm": 1.1015625, "learning_rate": 0.0004993293599055094, "loss": 5.8066, "mean_token_accuracy": 0.16511004269123078, "num_tokens": 7089536.0, "step": 3165 }, { "entropy": 5.8496153354644775, "epoch": 0.3560397596450834, "grad_norm": 1.0078125, "learning_rate": 0.0004993262587983848, "loss": 5.8848, "mean_token_accuracy": 0.16400568187236786, "num_tokens": 7101535.0, "step": 3170 }, { "entropy": 5.862979078292847, "epoch": 0.35660133655304094, "grad_norm": 1.1171875, "learning_rate": 0.000499323150548625, "loss": 5.7782, "mean_token_accuracy": 0.1608920007944107, "num_tokens": 7112468.0, "step": 3175 }, { "entropy": 5.801843690872192, "epoch": 0.3571629134609985, "grad_norm": 1.1640625, "learning_rate": 0.0004993200351563291, "loss": 5.7695, "mean_token_accuracy": 0.16856954991817474, "num_tokens": 7123192.0, "step": 3180 }, { "entropy": 5.776076078414917, "epoch": 0.35772449036895604, "grad_norm": 1.0703125, "learning_rate": 0.0004993169126215962, "loss": 5.6971, "mean_token_accuracy": 0.17152681350708007, "num_tokens": 7133063.0, "step": 3185 }, { "entropy": 5.832470464706421, "epoch": 0.3582860672769136, "grad_norm": 1.0625, "learning_rate": 0.0004993137829445259, "loss": 5.7899, "mean_token_accuracy": 0.16362055987119675, "num_tokens": 7144190.0, "step": 3190 }, { "entropy": 5.7901458740234375, "epoch": 0.35884764418487114, "grad_norm": 1.1171875, "learning_rate": 0.0004993106461252177, "loss": 5.779, "mean_token_accuracy": 0.1660066932439804, "num_tokens": 7155433.0, "step": 3195 }, { "entropy": 5.8804432392120365, "epoch": 0.3594092210928287, "grad_norm": 1.0859375, "learning_rate": 0.0004993075021637716, "loss": 5.8442, "mean_token_accuracy": 0.16579061150550842, "num_tokens": 7166084.0, "step": 3200 }, { "entropy": 5.849256277084351, "epoch": 0.3599707980007862, "grad_norm": 1.1171875, "learning_rate": 0.0004993043510602875, "loss": 5.8714, "mean_token_accuracy": 0.1630292773246765, "num_tokens": 7176948.0, "step": 3205 }, { "entropy": 5.846883821487427, "epoch": 0.36053237490874374, "grad_norm": 1.09375, "learning_rate": 0.000499301192814866, "loss": 5.7289, "mean_token_accuracy": 0.16961728185415267, "num_tokens": 7188601.0, "step": 3210 }, { "entropy": 5.7951243877410885, "epoch": 0.3610939518167013, "grad_norm": 1.1640625, "learning_rate": 0.0004992980274276074, "loss": 5.7635, "mean_token_accuracy": 0.16846298575401306, "num_tokens": 7198495.0, "step": 3215 }, { "entropy": 5.826298189163208, "epoch": 0.36165552872465884, "grad_norm": 1.15625, "learning_rate": 0.0004992948548986128, "loss": 5.753, "mean_token_accuracy": 0.16387602537870408, "num_tokens": 7209848.0, "step": 3220 }, { "entropy": 5.814381456375122, "epoch": 0.3622171056326164, "grad_norm": 1.1640625, "learning_rate": 0.0004992916752279829, "loss": 5.8787, "mean_token_accuracy": 0.16065715700387956, "num_tokens": 7220366.0, "step": 3225 }, { "entropy": 5.806219387054443, "epoch": 0.36277868254057394, "grad_norm": 1.15625, "learning_rate": 0.000499288488415819, "loss": 5.7833, "mean_token_accuracy": 0.16056074649095536, "num_tokens": 7231442.0, "step": 3230 }, { "entropy": 5.850152111053466, "epoch": 0.3633402594485315, "grad_norm": 1.4140625, "learning_rate": 0.0004992852944622229, "loss": 5.825, "mean_token_accuracy": 0.1608233243227005, "num_tokens": 7242391.0, "step": 3235 }, { "entropy": 5.733070659637451, "epoch": 0.36390183635648904, "grad_norm": 1.21875, "learning_rate": 0.0004992820933672958, "loss": 5.7124, "mean_token_accuracy": 0.16292389035224913, "num_tokens": 7252061.0, "step": 3240 }, { "entropy": 5.832701826095581, "epoch": 0.3644634132644466, "grad_norm": 1.0703125, "learning_rate": 0.0004992788851311399, "loss": 5.7926, "mean_token_accuracy": 0.1660913810133934, "num_tokens": 7264035.0, "step": 3245 }, { "entropy": 5.919405937194824, "epoch": 0.3650249901724041, "grad_norm": 1.140625, "learning_rate": 0.0004992756697538574, "loss": 5.8652, "mean_token_accuracy": 0.16157617121934892, "num_tokens": 7275988.0, "step": 3250 }, { "entropy": 5.77119779586792, "epoch": 0.36558656708036164, "grad_norm": 1.109375, "learning_rate": 0.0004992724472355505, "loss": 5.7206, "mean_token_accuracy": 0.16446294635534286, "num_tokens": 7286509.0, "step": 3255 }, { "entropy": 5.865907192230225, "epoch": 0.3661481439883192, "grad_norm": 1.2109375, "learning_rate": 0.0004992692175763219, "loss": 5.8134, "mean_token_accuracy": 0.16690248399972915, "num_tokens": 7296916.0, "step": 3260 }, { "entropy": 5.820225429534912, "epoch": 0.36670972089627674, "grad_norm": 1.109375, "learning_rate": 0.0004992659807762745, "loss": 5.8982, "mean_token_accuracy": 0.15828224942088126, "num_tokens": 7309563.0, "step": 3265 }, { "entropy": 5.88502197265625, "epoch": 0.3672712978042343, "grad_norm": 1.140625, "learning_rate": 0.0004992627368355112, "loss": 5.7505, "mean_token_accuracy": 0.16168039441108703, "num_tokens": 7320264.0, "step": 3270 }, { "entropy": 5.719604015350342, "epoch": 0.36783287471219184, "grad_norm": 1.15625, "learning_rate": 0.0004992594857541355, "loss": 5.7186, "mean_token_accuracy": 0.16655558794736863, "num_tokens": 7330442.0, "step": 3275 }, { "entropy": 5.853730297088623, "epoch": 0.3683944516201494, "grad_norm": 1.296875, "learning_rate": 0.0004992562275322506, "loss": 5.9159, "mean_token_accuracy": 0.1572217419743538, "num_tokens": 7342292.0, "step": 3280 }, { "entropy": 5.909031820297241, "epoch": 0.36895602852810694, "grad_norm": 1.1953125, "learning_rate": 0.0004992529621699606, "loss": 5.8141, "mean_token_accuracy": 0.16075354367494582, "num_tokens": 7353857.0, "step": 3285 }, { "entropy": 5.804742479324341, "epoch": 0.3695176054360645, "grad_norm": 1.0234375, "learning_rate": 0.0004992496896673692, "loss": 5.7377, "mean_token_accuracy": 0.16423878073692322, "num_tokens": 7365653.0, "step": 3290 }, { "entropy": 5.790262269973755, "epoch": 0.37007918234402204, "grad_norm": 1.1484375, "learning_rate": 0.0004992464100245809, "loss": 5.7455, "mean_token_accuracy": 0.15999912321567536, "num_tokens": 7376522.0, "step": 3295 }, { "entropy": 5.796634531021118, "epoch": 0.37064075925197953, "grad_norm": 1.1328125, "learning_rate": 0.0004992431232416997, "loss": 5.7407, "mean_token_accuracy": 0.1694473460316658, "num_tokens": 7388562.0, "step": 3300 }, { "entropy": 5.8152648448944095, "epoch": 0.3712023361599371, "grad_norm": 1.140625, "learning_rate": 0.0004992398293188307, "loss": 5.794, "mean_token_accuracy": 0.16164605543017388, "num_tokens": 7398597.0, "step": 3305 }, { "entropy": 5.75906810760498, "epoch": 0.37176391306789464, "grad_norm": 1.0859375, "learning_rate": 0.0004992365282560784, "loss": 5.7432, "mean_token_accuracy": 0.16698759496212007, "num_tokens": 7409656.0, "step": 3310 }, { "entropy": 5.769649410247803, "epoch": 0.3723254899758522, "grad_norm": 1.203125, "learning_rate": 0.0004992332200535483, "loss": 5.7906, "mean_token_accuracy": 0.1635170191526413, "num_tokens": 7420621.0, "step": 3315 }, { "entropy": 5.914590549468994, "epoch": 0.37288706688380974, "grad_norm": 1.09375, "learning_rate": 0.0004992299047113452, "loss": 5.8258, "mean_token_accuracy": 0.1644177705049515, "num_tokens": 7432951.0, "step": 3320 }, { "entropy": 5.746472978591919, "epoch": 0.3734486437917673, "grad_norm": 1.1015625, "learning_rate": 0.0004992265822295752, "loss": 5.8086, "mean_token_accuracy": 0.1657330572605133, "num_tokens": 7443630.0, "step": 3325 }, { "entropy": 5.878232765197754, "epoch": 0.37401022069972484, "grad_norm": 1.0234375, "learning_rate": 0.0004992232526083438, "loss": 5.7904, "mean_token_accuracy": 0.1630190759897232, "num_tokens": 7454535.0, "step": 3330 }, { "entropy": 5.851468801498413, "epoch": 0.3745717976076824, "grad_norm": 1.0859375, "learning_rate": 0.000499219915847757, "loss": 5.8617, "mean_token_accuracy": 0.16609936952590942, "num_tokens": 7467751.0, "step": 3335 }, { "entropy": 5.7327392578125, "epoch": 0.37513337451563994, "grad_norm": 1.0625, "learning_rate": 0.0004992165719479211, "loss": 5.7229, "mean_token_accuracy": 0.1723914325237274, "num_tokens": 7479347.0, "step": 3340 }, { "entropy": 5.792557239532471, "epoch": 0.37569495142359743, "grad_norm": 1.1171875, "learning_rate": 0.0004992132209089427, "loss": 5.7559, "mean_token_accuracy": 0.16422603875398636, "num_tokens": 7490916.0, "step": 3345 }, { "entropy": 5.839074325561524, "epoch": 0.376256528331555, "grad_norm": 1.1171875, "learning_rate": 0.0004992098627309283, "loss": 5.7285, "mean_token_accuracy": 0.16606951653957366, "num_tokens": 7500824.0, "step": 3350 }, { "entropy": 5.8109547138214115, "epoch": 0.37681810523951254, "grad_norm": 1.15625, "learning_rate": 0.000499206497413985, "loss": 5.8818, "mean_token_accuracy": 0.15842843651771546, "num_tokens": 7511778.0, "step": 3355 }, { "entropy": 5.980834197998047, "epoch": 0.3773796821474701, "grad_norm": 1.078125, "learning_rate": 0.0004992031249582197, "loss": 5.9424, "mean_token_accuracy": 0.15256146043539048, "num_tokens": 7522616.0, "step": 3360 }, { "entropy": 5.881027460098267, "epoch": 0.37794125905542764, "grad_norm": 1.15625, "learning_rate": 0.0004991997453637401, "loss": 5.8116, "mean_token_accuracy": 0.1650218188762665, "num_tokens": 7533019.0, "step": 3365 }, { "entropy": 5.749409818649292, "epoch": 0.3785028359633852, "grad_norm": 1.09375, "learning_rate": 0.0004991963586306536, "loss": 5.7544, "mean_token_accuracy": 0.16154202967882156, "num_tokens": 7544139.0, "step": 3370 }, { "entropy": 5.80066704750061, "epoch": 0.37906441287134274, "grad_norm": 1.1328125, "learning_rate": 0.0004991929647590682, "loss": 5.7377, "mean_token_accuracy": 0.16260901242494583, "num_tokens": 7554638.0, "step": 3375 }, { "entropy": 5.953235530853272, "epoch": 0.3796259897793003, "grad_norm": 1.1640625, "learning_rate": 0.0004991895637490917, "loss": 5.8049, "mean_token_accuracy": 0.16714229732751845, "num_tokens": 7565158.0, "step": 3380 }, { "entropy": 5.809656095504761, "epoch": 0.38018756668725784, "grad_norm": 1.0625, "learning_rate": 0.0004991861556008326, "loss": 5.811, "mean_token_accuracy": 0.16301512867212295, "num_tokens": 7576381.0, "step": 3385 }, { "entropy": 5.718403387069702, "epoch": 0.3807491435952154, "grad_norm": 1.0859375, "learning_rate": 0.0004991827403143992, "loss": 5.6948, "mean_token_accuracy": 0.1689286082983017, "num_tokens": 7586631.0, "step": 3390 }, { "entropy": 5.807317209243775, "epoch": 0.3813107205031729, "grad_norm": 1.109375, "learning_rate": 0.0004991793178899006, "loss": 5.7382, "mean_token_accuracy": 0.165502168238163, "num_tokens": 7598321.0, "step": 3395 }, { "entropy": 5.771745109558106, "epoch": 0.38187229741113043, "grad_norm": 1.1484375, "learning_rate": 0.0004991758883274455, "loss": 5.7698, "mean_token_accuracy": 0.1654894694685936, "num_tokens": 7609336.0, "step": 3400 }, { "entropy": 5.721436452865601, "epoch": 0.382433874319088, "grad_norm": 1.3203125, "learning_rate": 0.0004991724516271432, "loss": 5.6716, "mean_token_accuracy": 0.16680669486522676, "num_tokens": 7619116.0, "step": 3405 }, { "entropy": 5.82664680480957, "epoch": 0.38299545122704554, "grad_norm": 1.140625, "learning_rate": 0.0004991690077891032, "loss": 5.8092, "mean_token_accuracy": 0.15846319049596785, "num_tokens": 7630567.0, "step": 3410 }, { "entropy": 5.8768939018249515, "epoch": 0.3835570281350031, "grad_norm": 1.1484375, "learning_rate": 0.0004991655568134348, "loss": 5.8718, "mean_token_accuracy": 0.16050247251987457, "num_tokens": 7642564.0, "step": 3415 }, { "entropy": 5.909596014022827, "epoch": 0.38411860504296064, "grad_norm": 1.171875, "learning_rate": 0.0004991620987002483, "loss": 5.8983, "mean_token_accuracy": 0.15932083278894424, "num_tokens": 7654588.0, "step": 3420 }, { "entropy": 5.780777931213379, "epoch": 0.3846801819509182, "grad_norm": 1.21875, "learning_rate": 0.0004991586334496536, "loss": 5.6903, "mean_token_accuracy": 0.1646028310060501, "num_tokens": 7666120.0, "step": 3425 }, { "entropy": 5.796514987945557, "epoch": 0.38524175885887574, "grad_norm": 1.171875, "learning_rate": 0.0004991551610617611, "loss": 5.8408, "mean_token_accuracy": 0.16049385517835618, "num_tokens": 7677132.0, "step": 3430 }, { "entropy": 5.968781232833862, "epoch": 0.3858033357668333, "grad_norm": 1.1484375, "learning_rate": 0.0004991516815366812, "loss": 5.9041, "mean_token_accuracy": 0.1601366326212883, "num_tokens": 7687515.0, "step": 3435 }, { "entropy": 5.767029762268066, "epoch": 0.38636491267479084, "grad_norm": 1.109375, "learning_rate": 0.000499148194874525, "loss": 5.7118, "mean_token_accuracy": 0.16504708528518677, "num_tokens": 7698454.0, "step": 3440 }, { "entropy": 5.698157548904419, "epoch": 0.38692648958274833, "grad_norm": 1.1171875, "learning_rate": 0.0004991447010754032, "loss": 5.6899, "mean_token_accuracy": 0.1678033024072647, "num_tokens": 7708940.0, "step": 3445 }, { "entropy": 5.8262519359588625, "epoch": 0.3874880664907059, "grad_norm": 1.1796875, "learning_rate": 0.0004991412001394273, "loss": 5.7239, "mean_token_accuracy": 0.16594443321228028, "num_tokens": 7719705.0, "step": 3450 }, { "entropy": 5.863242149353027, "epoch": 0.38804964339866344, "grad_norm": 1.109375, "learning_rate": 0.0004991376920667086, "loss": 5.8811, "mean_token_accuracy": 0.15880899280309677, "num_tokens": 7730649.0, "step": 3455 }, { "entropy": 5.779720497131348, "epoch": 0.388611220306621, "grad_norm": 1.046875, "learning_rate": 0.0004991341768573589, "loss": 5.8953, "mean_token_accuracy": 0.1590091198682785, "num_tokens": 7742014.0, "step": 3460 }, { "entropy": 5.901068115234375, "epoch": 0.38917279721457854, "grad_norm": 1.0625, "learning_rate": 0.00049913065451149, "loss": 5.799, "mean_token_accuracy": 0.1558951511979103, "num_tokens": 7752892.0, "step": 3465 }, { "entropy": 5.8446044921875, "epoch": 0.3897343741225361, "grad_norm": 1.1640625, "learning_rate": 0.0004991271250292141, "loss": 5.81, "mean_token_accuracy": 0.157416270673275, "num_tokens": 7762959.0, "step": 3470 }, { "entropy": 5.81669659614563, "epoch": 0.39029595103049364, "grad_norm": 1.1015625, "learning_rate": 0.0004991235884106437, "loss": 5.7144, "mean_token_accuracy": 0.16509674340486527, "num_tokens": 7773566.0, "step": 3475 }, { "entropy": 5.7814857959747314, "epoch": 0.3908575279384512, "grad_norm": 1.0390625, "learning_rate": 0.0004991200446558913, "loss": 5.748, "mean_token_accuracy": 0.15518904775381087, "num_tokens": 7785782.0, "step": 3480 }, { "entropy": 5.841710948944092, "epoch": 0.39141910484640874, "grad_norm": 1.078125, "learning_rate": 0.0004991164937650698, "loss": 5.9032, "mean_token_accuracy": 0.16198572665452957, "num_tokens": 7797551.0, "step": 3485 }, { "entropy": 5.751931428909302, "epoch": 0.39198068175436623, "grad_norm": 1.03125, "learning_rate": 0.0004991129357382922, "loss": 5.6772, "mean_token_accuracy": 0.17679855972528458, "num_tokens": 7808819.0, "step": 3490 }, { "entropy": 5.647474765777588, "epoch": 0.3925422586623238, "grad_norm": 1.1171875, "learning_rate": 0.0004991093705756718, "loss": 5.6283, "mean_token_accuracy": 0.16952918767929076, "num_tokens": 7818940.0, "step": 3495 }, { "entropy": 5.671689987182617, "epoch": 0.39310383557028133, "grad_norm": 1.1171875, "learning_rate": 0.0004991057982773221, "loss": 5.6507, "mean_token_accuracy": 0.17054159790277482, "num_tokens": 7829733.0, "step": 3500 }, { "entropy": 5.847164916992187, "epoch": 0.3936654124782389, "grad_norm": 1.0625, "learning_rate": 0.0004991022188433569, "loss": 5.7133, "mean_token_accuracy": 0.17065165787935258, "num_tokens": 7840427.0, "step": 3505 }, { "entropy": 5.859947633743286, "epoch": 0.39422698938619644, "grad_norm": 1.125, "learning_rate": 0.00049909863227389, "loss": 5.775, "mean_token_accuracy": 0.16124107241630553, "num_tokens": 7852834.0, "step": 3510 }, { "entropy": 5.7385765552520756, "epoch": 0.394788566294154, "grad_norm": 1.1171875, "learning_rate": 0.0004990950385690358, "loss": 5.8178, "mean_token_accuracy": 0.1656463325023651, "num_tokens": 7864993.0, "step": 3515 }, { "entropy": 5.750460052490235, "epoch": 0.39535014320211154, "grad_norm": 1.109375, "learning_rate": 0.0004990914377289088, "loss": 5.793, "mean_token_accuracy": 0.16076247096061708, "num_tokens": 7876578.0, "step": 3520 }, { "entropy": 5.729760694503784, "epoch": 0.3959117201100691, "grad_norm": 1.015625, "learning_rate": 0.0004990878297536233, "loss": 5.6272, "mean_token_accuracy": 0.17054133117198944, "num_tokens": 7886770.0, "step": 3525 }, { "entropy": 5.800265884399414, "epoch": 0.39647329701802664, "grad_norm": 1.2265625, "learning_rate": 0.0004990842146432946, "loss": 5.7904, "mean_token_accuracy": 0.1667746052145958, "num_tokens": 7897106.0, "step": 3530 }, { "entropy": 5.749977684020996, "epoch": 0.3970348739259842, "grad_norm": 1.1015625, "learning_rate": 0.0004990805923980375, "loss": 5.6444, "mean_token_accuracy": 0.17652151733636856, "num_tokens": 7907321.0, "step": 3535 }, { "entropy": 5.651272344589233, "epoch": 0.3975964508339417, "grad_norm": 1.0546875, "learning_rate": 0.0004990769630179673, "loss": 5.6569, "mean_token_accuracy": 0.170053867995739, "num_tokens": 7918628.0, "step": 3540 }, { "entropy": 5.872209167480468, "epoch": 0.39815802774189923, "grad_norm": 1.2265625, "learning_rate": 0.0004990733265032, "loss": 5.8387, "mean_token_accuracy": 0.15291183888912202, "num_tokens": 7929387.0, "step": 3545 }, { "entropy": 5.92167649269104, "epoch": 0.3987196046498568, "grad_norm": 1.015625, "learning_rate": 0.0004990696828538508, "loss": 5.8595, "mean_token_accuracy": 0.16960857212543487, "num_tokens": 7940840.0, "step": 3550 }, { "entropy": 5.664200639724731, "epoch": 0.39928118155781434, "grad_norm": 1.078125, "learning_rate": 0.000499066032070036, "loss": 5.7269, "mean_token_accuracy": 0.1674627184867859, "num_tokens": 7952243.0, "step": 3555 }, { "entropy": 5.863605737686157, "epoch": 0.3998427584657719, "grad_norm": 1.2109375, "learning_rate": 0.0004990623741518719, "loss": 5.7724, "mean_token_accuracy": 0.16179074645042418, "num_tokens": 7963150.0, "step": 3560 }, { "entropy": 5.818461227416992, "epoch": 0.40040433537372944, "grad_norm": 1.1015625, "learning_rate": 0.000499058709099475, "loss": 5.8741, "mean_token_accuracy": 0.15937056988477707, "num_tokens": 7974862.0, "step": 3565 }, { "entropy": 5.877570915222168, "epoch": 0.400965912281687, "grad_norm": 1.1640625, "learning_rate": 0.0004990550369129618, "loss": 5.8819, "mean_token_accuracy": 0.16194065660238266, "num_tokens": 7986438.0, "step": 3570 }, { "entropy": 5.8217613697052, "epoch": 0.40152748918964454, "grad_norm": 1.28125, "learning_rate": 0.0004990513575924494, "loss": 5.7173, "mean_token_accuracy": 0.16897953897714615, "num_tokens": 7996958.0, "step": 3575 }, { "entropy": 5.835204267501831, "epoch": 0.4020890660976021, "grad_norm": 1.1328125, "learning_rate": 0.0004990476711380548, "loss": 5.8001, "mean_token_accuracy": 0.1581471100449562, "num_tokens": 8008862.0, "step": 3580 }, { "entropy": 5.774871110916138, "epoch": 0.40265064300555964, "grad_norm": 1.1328125, "learning_rate": 0.0004990439775498954, "loss": 5.7798, "mean_token_accuracy": 0.1676494598388672, "num_tokens": 8018940.0, "step": 3585 }, { "entropy": 5.914262056350708, "epoch": 0.40321221991351713, "grad_norm": 1.1328125, "learning_rate": 0.000499040276828089, "loss": 5.7946, "mean_token_accuracy": 0.15799015909433364, "num_tokens": 8029148.0, "step": 3590 }, { "entropy": 5.742766189575195, "epoch": 0.4037737968214747, "grad_norm": 1.1015625, "learning_rate": 0.0004990365689727533, "loss": 5.7104, "mean_token_accuracy": 0.1686326339840889, "num_tokens": 8039618.0, "step": 3595 }, { "entropy": 5.744286060333252, "epoch": 0.40433537372943223, "grad_norm": 1.0859375, "learning_rate": 0.0004990328539840062, "loss": 5.6934, "mean_token_accuracy": 0.16474545300006865, "num_tokens": 8051145.0, "step": 3600 }, { "entropy": 5.7836991310119625, "epoch": 0.4048969506373898, "grad_norm": 1.1640625, "learning_rate": 0.0004990291318619663, "loss": 5.7609, "mean_token_accuracy": 0.1606362998485565, "num_tokens": 8061520.0, "step": 3605 }, { "entropy": 5.726670598983764, "epoch": 0.40545852754534734, "grad_norm": 1.0546875, "learning_rate": 0.0004990254026067518, "loss": 5.7099, "mean_token_accuracy": 0.16285099536180497, "num_tokens": 8072876.0, "step": 3610 }, { "entropy": 5.934379577636719, "epoch": 0.4060201044533049, "grad_norm": 1.1328125, "learning_rate": 0.0004990216662184817, "loss": 5.8154, "mean_token_accuracy": 0.16516112834215163, "num_tokens": 8084240.0, "step": 3615 }, { "entropy": 5.753713512420655, "epoch": 0.40658168136126244, "grad_norm": 1.1015625, "learning_rate": 0.0004990179226972749, "loss": 5.6932, "mean_token_accuracy": 0.16864500045776368, "num_tokens": 8095773.0, "step": 3620 }, { "entropy": 5.629334354400635, "epoch": 0.40714325826922, "grad_norm": 1.1484375, "learning_rate": 0.0004990141720432504, "loss": 5.6819, "mean_token_accuracy": 0.167998369038105, "num_tokens": 8107003.0, "step": 3625 }, { "entropy": 5.72817096710205, "epoch": 0.40770483517717754, "grad_norm": 1.1484375, "learning_rate": 0.0004990104142565279, "loss": 5.6439, "mean_token_accuracy": 0.17401827424764632, "num_tokens": 8117864.0, "step": 3630 }, { "entropy": 5.835469007492065, "epoch": 0.40826641208513503, "grad_norm": 1.0859375, "learning_rate": 0.000499006649337227, "loss": 5.86, "mean_token_accuracy": 0.16062401831150055, "num_tokens": 8129363.0, "step": 3635 }, { "entropy": 5.805969905853272, "epoch": 0.4088279889930926, "grad_norm": 1.0703125, "learning_rate": 0.0004990028772854674, "loss": 5.7791, "mean_token_accuracy": 0.1627799391746521, "num_tokens": 8141319.0, "step": 3640 }, { "entropy": 5.784128999710083, "epoch": 0.40938956590105013, "grad_norm": 1.2421875, "learning_rate": 0.0004989990981013693, "loss": 5.6802, "mean_token_accuracy": 0.1702434554696083, "num_tokens": 8153344.0, "step": 3645 }, { "entropy": 5.774145793914795, "epoch": 0.4099511428090077, "grad_norm": 1.15625, "learning_rate": 0.000498995311785053, "loss": 5.8402, "mean_token_accuracy": 0.162425434589386, "num_tokens": 8164196.0, "step": 3650 }, { "entropy": 5.816594219207763, "epoch": 0.41051271971696524, "grad_norm": 1.1484375, "learning_rate": 0.0004989915183366392, "loss": 5.7159, "mean_token_accuracy": 0.16790103316307067, "num_tokens": 8174663.0, "step": 3655 }, { "entropy": 5.713854694366455, "epoch": 0.4110742966249228, "grad_norm": 1.078125, "learning_rate": 0.0004989877177562485, "loss": 5.683, "mean_token_accuracy": 0.1685110315680504, "num_tokens": 8185215.0, "step": 3660 }, { "entropy": 5.739247465133667, "epoch": 0.41163587353288034, "grad_norm": 1.234375, "learning_rate": 0.000498983910044002, "loss": 5.7765, "mean_token_accuracy": 0.17141249477863313, "num_tokens": 8195694.0, "step": 3665 }, { "entropy": 5.681199550628662, "epoch": 0.4121974504408379, "grad_norm": 1.125, "learning_rate": 0.0004989800952000209, "loss": 5.6616, "mean_token_accuracy": 0.17553078830242158, "num_tokens": 8206112.0, "step": 3670 }, { "entropy": 5.731632661819458, "epoch": 0.41275902734879544, "grad_norm": 1.15625, "learning_rate": 0.0004989762732244268, "loss": 5.7515, "mean_token_accuracy": 0.1661844179034233, "num_tokens": 8216548.0, "step": 3675 }, { "entropy": 5.843146276473999, "epoch": 0.413320604256753, "grad_norm": 1.15625, "learning_rate": 0.0004989724441173413, "loss": 5.7867, "mean_token_accuracy": 0.16781337559223175, "num_tokens": 8226643.0, "step": 3680 }, { "entropy": 5.857947587966919, "epoch": 0.4138821811647105, "grad_norm": 1.078125, "learning_rate": 0.0004989686078788862, "loss": 5.8183, "mean_token_accuracy": 0.16166319102048873, "num_tokens": 8236755.0, "step": 3685 }, { "entropy": 5.782751274108887, "epoch": 0.41444375807266803, "grad_norm": 1.2890625, "learning_rate": 0.0004989647645091839, "loss": 5.6963, "mean_token_accuracy": 0.16801404505968093, "num_tokens": 8247526.0, "step": 3690 }, { "entropy": 5.734130477905273, "epoch": 0.4150053349806256, "grad_norm": 1.5078125, "learning_rate": 0.0004989609140083565, "loss": 5.794, "mean_token_accuracy": 0.15583045184612274, "num_tokens": 8258649.0, "step": 3695 }, { "entropy": 5.765203428268433, "epoch": 0.41556691188858313, "grad_norm": 1.1953125, "learning_rate": 0.0004989570563765269, "loss": 5.676, "mean_token_accuracy": 0.1731864795088768, "num_tokens": 8268260.0, "step": 3700 }, { "entropy": 5.9308096408844, "epoch": 0.4161284887965407, "grad_norm": 1.1171875, "learning_rate": 0.0004989531916138176, "loss": 5.8785, "mean_token_accuracy": 0.1627708837389946, "num_tokens": 8280090.0, "step": 3705 }, { "entropy": 5.841350793838501, "epoch": 0.41669006570449824, "grad_norm": 1.0078125, "learning_rate": 0.0004989493197203519, "loss": 5.7489, "mean_token_accuracy": 0.1697134330868721, "num_tokens": 8291217.0, "step": 3710 }, { "entropy": 5.754220199584961, "epoch": 0.4172516426124558, "grad_norm": 1.0546875, "learning_rate": 0.000498945440696253, "loss": 5.6683, "mean_token_accuracy": 0.17081218361854553, "num_tokens": 8303541.0, "step": 3715 }, { "entropy": 5.719450426101685, "epoch": 0.41781321952041334, "grad_norm": 1.1015625, "learning_rate": 0.0004989415545416444, "loss": 5.7355, "mean_token_accuracy": 0.1609584018588066, "num_tokens": 8316104.0, "step": 3720 }, { "entropy": 5.714957666397095, "epoch": 0.4183747964283709, "grad_norm": 1.09375, "learning_rate": 0.0004989376612566498, "loss": 5.6832, "mean_token_accuracy": 0.16480520740151405, "num_tokens": 8327158.0, "step": 3725 }, { "entropy": 5.846664381027222, "epoch": 0.4189363733363284, "grad_norm": 1.125, "learning_rate": 0.0004989337608413933, "loss": 5.8338, "mean_token_accuracy": 0.16076735854148866, "num_tokens": 8337685.0, "step": 3730 }, { "entropy": 5.870333480834961, "epoch": 0.41949795024428593, "grad_norm": 1.140625, "learning_rate": 0.0004989298532959989, "loss": 5.8683, "mean_token_accuracy": 0.16113072335720063, "num_tokens": 8349778.0, "step": 3735 }, { "entropy": 5.7798456192016605, "epoch": 0.4200595271522435, "grad_norm": 1.1171875, "learning_rate": 0.0004989259386205912, "loss": 5.7038, "mean_token_accuracy": 0.176594515144825, "num_tokens": 8361041.0, "step": 3740 }, { "entropy": 5.8628821849823, "epoch": 0.42062110406020103, "grad_norm": 1.25, "learning_rate": 0.0004989220168152948, "loss": 5.8965, "mean_token_accuracy": 0.15907129645347595, "num_tokens": 8373227.0, "step": 3745 }, { "entropy": 5.7868818759918215, "epoch": 0.4211826809681586, "grad_norm": 1.1640625, "learning_rate": 0.0004989180878802346, "loss": 5.7209, "mean_token_accuracy": 0.16800411641597748, "num_tokens": 8384223.0, "step": 3750 }, { "entropy": 5.731780624389648, "epoch": 0.42174425787611614, "grad_norm": 1.2421875, "learning_rate": 0.0004989141518155354, "loss": 5.7506, "mean_token_accuracy": 0.1691988691687584, "num_tokens": 8395014.0, "step": 3755 }, { "entropy": 5.823819208145141, "epoch": 0.4223058347840737, "grad_norm": 1.1171875, "learning_rate": 0.0004989102086213229, "loss": 5.7283, "mean_token_accuracy": 0.16270644217729568, "num_tokens": 8406445.0, "step": 3760 }, { "entropy": 5.693364000320434, "epoch": 0.42286741169203124, "grad_norm": 1.203125, "learning_rate": 0.0004989062582977225, "loss": 5.665, "mean_token_accuracy": 0.1706314980983734, "num_tokens": 8417488.0, "step": 3765 }, { "entropy": 5.793571662902832, "epoch": 0.4234289885999888, "grad_norm": 1.0390625, "learning_rate": 0.0004989023008448599, "loss": 5.8689, "mean_token_accuracy": 0.15837376266717912, "num_tokens": 8430582.0, "step": 3770 }, { "entropy": 5.831238794326782, "epoch": 0.42399056550794634, "grad_norm": 1.2265625, "learning_rate": 0.0004988983362628614, "loss": 5.6906, "mean_token_accuracy": 0.164572674036026, "num_tokens": 8442033.0, "step": 3775 }, { "entropy": 5.690927267074585, "epoch": 0.42455214241590383, "grad_norm": 1.2890625, "learning_rate": 0.0004988943645518528, "loss": 5.6636, "mean_token_accuracy": 0.16775935739278794, "num_tokens": 8451722.0, "step": 3780 }, { "entropy": 5.668238401412964, "epoch": 0.4251137193238614, "grad_norm": 1.2734375, "learning_rate": 0.0004988903857119611, "loss": 5.75, "mean_token_accuracy": 0.1658486858010292, "num_tokens": 8462753.0, "step": 3785 }, { "entropy": 5.861290073394775, "epoch": 0.42567529623181893, "grad_norm": 1.109375, "learning_rate": 0.0004988863997433125, "loss": 5.7587, "mean_token_accuracy": 0.16550534069538117, "num_tokens": 8472755.0, "step": 3790 }, { "entropy": 5.766337490081787, "epoch": 0.4262368731397765, "grad_norm": 1.15625, "learning_rate": 0.0004988824066460341, "loss": 5.7399, "mean_token_accuracy": 0.16958845853805543, "num_tokens": 8483296.0, "step": 3795 }, { "entropy": 5.7786054611206055, "epoch": 0.42679845004773403, "grad_norm": 1.2421875, "learning_rate": 0.000498878406420253, "loss": 5.6058, "mean_token_accuracy": 0.17350622415542602, "num_tokens": 8493739.0, "step": 3800 }, { "entropy": 5.682381916046142, "epoch": 0.4273600269556916, "grad_norm": 1.1640625, "learning_rate": 0.0004988743990660967, "loss": 5.7767, "mean_token_accuracy": 0.162274731695652, "num_tokens": 8504788.0, "step": 3805 }, { "entropy": 5.797802543640136, "epoch": 0.42792160386364914, "grad_norm": 1.4296875, "learning_rate": 0.0004988703845836927, "loss": 5.7306, "mean_token_accuracy": 0.1645368903875351, "num_tokens": 8514708.0, "step": 3810 }, { "entropy": 5.790168046951294, "epoch": 0.4284831807716067, "grad_norm": 1.1171875, "learning_rate": 0.0004988663629731687, "loss": 5.6135, "mean_token_accuracy": 0.17496834099292755, "num_tokens": 8525227.0, "step": 3815 }, { "entropy": 5.622102165222168, "epoch": 0.42904475767956424, "grad_norm": 1.171875, "learning_rate": 0.000498862334234653, "loss": 5.6619, "mean_token_accuracy": 0.17011212110519408, "num_tokens": 8536502.0, "step": 3820 }, { "entropy": 5.7700787544250485, "epoch": 0.4296063345875218, "grad_norm": 1.1484375, "learning_rate": 0.0004988582983682737, "loss": 5.8033, "mean_token_accuracy": 0.16546136736869813, "num_tokens": 8548087.0, "step": 3825 }, { "entropy": 5.85570330619812, "epoch": 0.4301679114954793, "grad_norm": 1.1796875, "learning_rate": 0.0004988542553741594, "loss": 5.809, "mean_token_accuracy": 0.1667978622019291, "num_tokens": 8560856.0, "step": 3830 }, { "entropy": 5.931719970703125, "epoch": 0.43072948840343683, "grad_norm": 1.328125, "learning_rate": 0.0004988502052524388, "loss": 5.9145, "mean_token_accuracy": 0.16501590609550476, "num_tokens": 8572521.0, "step": 3835 }, { "entropy": 5.84990963935852, "epoch": 0.4312910653113944, "grad_norm": 1.2890625, "learning_rate": 0.0004988461480032408, "loss": 5.7442, "mean_token_accuracy": 0.1674473449587822, "num_tokens": 8583977.0, "step": 3840 }, { "entropy": 5.704129409790039, "epoch": 0.43185264221935193, "grad_norm": 1.0546875, "learning_rate": 0.0004988420836266946, "loss": 5.6924, "mean_token_accuracy": 0.16754663586616517, "num_tokens": 8594441.0, "step": 3845 }, { "entropy": 5.84066071510315, "epoch": 0.4324142191273095, "grad_norm": 1.2890625, "learning_rate": 0.0004988380121229298, "loss": 5.7392, "mean_token_accuracy": 0.16255563497543335, "num_tokens": 8604843.0, "step": 3850 }, { "entropy": 5.746822309494019, "epoch": 0.43297579603526704, "grad_norm": 1.1328125, "learning_rate": 0.0004988339334920757, "loss": 5.7298, "mean_token_accuracy": 0.16818083822727203, "num_tokens": 8616059.0, "step": 3855 }, { "entropy": 5.74391360282898, "epoch": 0.4335373729432246, "grad_norm": 1.15625, "learning_rate": 0.0004988298477342625, "loss": 5.6845, "mean_token_accuracy": 0.17156679034233094, "num_tokens": 8626203.0, "step": 3860 }, { "entropy": 5.739895057678223, "epoch": 0.43409894985118214, "grad_norm": 1.2265625, "learning_rate": 0.00049882575484962, "loss": 5.684, "mean_token_accuracy": 0.16509181261062622, "num_tokens": 8636921.0, "step": 3865 }, { "entropy": 5.6815019130706785, "epoch": 0.4346605267591397, "grad_norm": 1.109375, "learning_rate": 0.0004988216548382787, "loss": 5.6579, "mean_token_accuracy": 0.17124742418527603, "num_tokens": 8648526.0, "step": 3870 }, { "entropy": 5.796351671218872, "epoch": 0.4352221036670972, "grad_norm": 1.2890625, "learning_rate": 0.0004988175477003691, "loss": 5.8049, "mean_token_accuracy": 0.15377746522426605, "num_tokens": 8660339.0, "step": 3875 }, { "entropy": 5.9060732364654545, "epoch": 0.43578368057505473, "grad_norm": 1.2421875, "learning_rate": 0.000498813433436022, "loss": 5.8632, "mean_token_accuracy": 0.1561919257044792, "num_tokens": 8671835.0, "step": 3880 }, { "entropy": 5.678639030456543, "epoch": 0.4363452574830123, "grad_norm": 1.15625, "learning_rate": 0.0004988093120453684, "loss": 5.5652, "mean_token_accuracy": 0.17134900540113449, "num_tokens": 8681146.0, "step": 3885 }, { "entropy": 5.650815439224243, "epoch": 0.43690683439096983, "grad_norm": 1.2265625, "learning_rate": 0.0004988051835285394, "loss": 5.6231, "mean_token_accuracy": 0.17194372713565825, "num_tokens": 8691623.0, "step": 3890 }, { "entropy": 5.765362548828125, "epoch": 0.4374684112989274, "grad_norm": 1.3046875, "learning_rate": 0.0004988010478856667, "loss": 5.7243, "mean_token_accuracy": 0.16024973541498183, "num_tokens": 8703702.0, "step": 3895 }, { "entropy": 5.937811851501465, "epoch": 0.43802998820688493, "grad_norm": 1.203125, "learning_rate": 0.0004987969051168816, "loss": 5.8895, "mean_token_accuracy": 0.16733449399471284, "num_tokens": 8715434.0, "step": 3900 }, { "entropy": 5.7049939155578615, "epoch": 0.4385915651148425, "grad_norm": 1.109375, "learning_rate": 0.0004987927552223165, "loss": 5.6636, "mean_token_accuracy": 0.17958703339099885, "num_tokens": 8726135.0, "step": 3905 }, { "entropy": 5.635489463806152, "epoch": 0.43915314202280004, "grad_norm": 1.140625, "learning_rate": 0.0004987885982021032, "loss": 5.761, "mean_token_accuracy": 0.16973788887262345, "num_tokens": 8736538.0, "step": 3910 }, { "entropy": 5.879006290435791, "epoch": 0.4397147189307576, "grad_norm": 1.15625, "learning_rate": 0.0004987844340563741, "loss": 5.6806, "mean_token_accuracy": 0.17044662386178971, "num_tokens": 8746456.0, "step": 3915 }, { "entropy": 5.7940206050872805, "epoch": 0.44027629583871514, "grad_norm": 1.359375, "learning_rate": 0.0004987802627852619, "loss": 5.7909, "mean_token_accuracy": 0.16806718856096267, "num_tokens": 8757143.0, "step": 3920 }, { "entropy": 5.737888336181641, "epoch": 0.44083787274667263, "grad_norm": 1.1171875, "learning_rate": 0.0004987760843888992, "loss": 5.7794, "mean_token_accuracy": 0.17163707613945006, "num_tokens": 8769084.0, "step": 3925 }, { "entropy": 5.792534828186035, "epoch": 0.4413994496546302, "grad_norm": 1.171875, "learning_rate": 0.0004987718988674193, "loss": 5.7753, "mean_token_accuracy": 0.16346744000911712, "num_tokens": 8780707.0, "step": 3930 }, { "entropy": 5.78266863822937, "epoch": 0.44196102656258773, "grad_norm": 1.234375, "learning_rate": 0.0004987677062209552, "loss": 5.7305, "mean_token_accuracy": 0.16145867258310317, "num_tokens": 8792157.0, "step": 3935 }, { "entropy": 5.824311637878418, "epoch": 0.4425226034705453, "grad_norm": 1.2578125, "learning_rate": 0.0004987635064496407, "loss": 5.7576, "mean_token_accuracy": 0.16702643185853958, "num_tokens": 8802691.0, "step": 3940 }, { "entropy": 5.8741062641143795, "epoch": 0.44308418037850283, "grad_norm": 1.140625, "learning_rate": 0.0004987592995536093, "loss": 5.7672, "mean_token_accuracy": 0.1658184953033924, "num_tokens": 8814869.0, "step": 3945 }, { "entropy": 5.73998441696167, "epoch": 0.4436457572864604, "grad_norm": 1.171875, "learning_rate": 0.0004987550855329951, "loss": 5.7099, "mean_token_accuracy": 0.17231065332889556, "num_tokens": 8825264.0, "step": 3950 }, { "entropy": 5.8049551486969, "epoch": 0.44420733419441794, "grad_norm": 1.1171875, "learning_rate": 0.0004987508643879322, "loss": 5.787, "mean_token_accuracy": 0.16581701785326003, "num_tokens": 8837128.0, "step": 3955 }, { "entropy": 5.801353025436401, "epoch": 0.4447689111023755, "grad_norm": 1.1640625, "learning_rate": 0.0004987466361185549, "loss": 5.7861, "mean_token_accuracy": 0.15883654057979585, "num_tokens": 8848587.0, "step": 3960 }, { "entropy": 5.848768043518066, "epoch": 0.44533048801033304, "grad_norm": 1.15625, "learning_rate": 0.0004987424007249979, "loss": 5.8546, "mean_token_accuracy": 0.16280081868171692, "num_tokens": 8859219.0, "step": 3965 }, { "entropy": 5.788423871994018, "epoch": 0.4458920649182906, "grad_norm": 1.2734375, "learning_rate": 0.0004987381582073962, "loss": 5.7406, "mean_token_accuracy": 0.17112360298633575, "num_tokens": 8868780.0, "step": 3970 }, { "entropy": 5.834964323043823, "epoch": 0.4464536418262481, "grad_norm": 1.203125, "learning_rate": 0.0004987339085658848, "loss": 5.7172, "mean_token_accuracy": 0.1637463465332985, "num_tokens": 8880903.0, "step": 3975 }, { "entropy": 5.660829162597656, "epoch": 0.44701521873420563, "grad_norm": 1.2890625, "learning_rate": 0.0004987296518005988, "loss": 5.5606, "mean_token_accuracy": 0.17245692163705825, "num_tokens": 8890335.0, "step": 3980 }, { "entropy": 5.665368318557739, "epoch": 0.4475767956421632, "grad_norm": 1.1015625, "learning_rate": 0.000498725387911674, "loss": 5.7033, "mean_token_accuracy": 0.16330161690711975, "num_tokens": 8904104.0, "step": 3985 }, { "entropy": 5.9002443790435795, "epoch": 0.44813837255012073, "grad_norm": 1.1328125, "learning_rate": 0.0004987211168992461, "loss": 5.7955, "mean_token_accuracy": 0.1588960111141205, "num_tokens": 8915118.0, "step": 3990 }, { "entropy": 5.748874807357788, "epoch": 0.4486999494580783, "grad_norm": 1.0703125, "learning_rate": 0.000498716838763451, "loss": 5.7518, "mean_token_accuracy": 0.16183157116174698, "num_tokens": 8927450.0, "step": 3995 }, { "entropy": 5.855266857147217, "epoch": 0.44926152636603583, "grad_norm": 1.1484375, "learning_rate": 0.000498712553504425, "loss": 5.8327, "mean_token_accuracy": 0.16530437469482423, "num_tokens": 8939902.0, "step": 4000 }, { "entropy": 5.803925609588623, "epoch": 0.4498231032739934, "grad_norm": 1.1953125, "learning_rate": 0.0004987082611223046, "loss": 5.6966, "mean_token_accuracy": 0.16004012376070023, "num_tokens": 8951736.0, "step": 4005 }, { "entropy": 5.824748182296753, "epoch": 0.45038468018195094, "grad_norm": 1.09375, "learning_rate": 0.0004987039616172265, "loss": 5.7918, "mean_token_accuracy": 0.16543588787317276, "num_tokens": 8963283.0, "step": 4010 }, { "entropy": 5.746975517272949, "epoch": 0.4509462570899085, "grad_norm": 1.140625, "learning_rate": 0.0004986996549893273, "loss": 5.6875, "mean_token_accuracy": 0.1728332132101059, "num_tokens": 8974323.0, "step": 4015 }, { "entropy": 5.742187404632569, "epoch": 0.451507833997866, "grad_norm": 1.0546875, "learning_rate": 0.0004986953412387445, "loss": 5.7779, "mean_token_accuracy": 0.1621204733848572, "num_tokens": 8986687.0, "step": 4020 }, { "entropy": 5.705374097824096, "epoch": 0.45206941090582353, "grad_norm": 1.5390625, "learning_rate": 0.0004986910203656151, "loss": 5.6662, "mean_token_accuracy": 0.17241707146167756, "num_tokens": 8997734.0, "step": 4025 }, { "entropy": 5.743109798431396, "epoch": 0.4526309878137811, "grad_norm": 1.21875, "learning_rate": 0.0004986866923700769, "loss": 5.79, "mean_token_accuracy": 0.15861670374870301, "num_tokens": 9008743.0, "step": 4030 }, { "entropy": 5.864490699768067, "epoch": 0.45319256472173863, "grad_norm": 1.1171875, "learning_rate": 0.0004986823572522677, "loss": 5.649, "mean_token_accuracy": 0.167484150826931, "num_tokens": 9019495.0, "step": 4035 }, { "entropy": 5.750733947753906, "epoch": 0.4537541416296962, "grad_norm": 1.203125, "learning_rate": 0.0004986780150123254, "loss": 5.7626, "mean_token_accuracy": 0.16347892284393312, "num_tokens": 9029546.0, "step": 4040 }, { "entropy": 5.62654070854187, "epoch": 0.45431571853765373, "grad_norm": 1.078125, "learning_rate": 0.0004986736656503885, "loss": 5.5203, "mean_token_accuracy": 0.17364439517259597, "num_tokens": 9040393.0, "step": 4045 }, { "entropy": 5.732595634460449, "epoch": 0.4548772954456113, "grad_norm": 1.1640625, "learning_rate": 0.0004986693091665952, "loss": 5.7232, "mean_token_accuracy": 0.16511399149894715, "num_tokens": 9050840.0, "step": 4050 }, { "entropy": 5.76080846786499, "epoch": 0.45543887235356884, "grad_norm": 1.171875, "learning_rate": 0.0004986649455610845, "loss": 5.6551, "mean_token_accuracy": 0.16657507717609404, "num_tokens": 9061615.0, "step": 4055 }, { "entropy": 5.688541269302368, "epoch": 0.4560004492615264, "grad_norm": 1.328125, "learning_rate": 0.000498660574833995, "loss": 5.6307, "mean_token_accuracy": 0.17303157597780228, "num_tokens": 9071902.0, "step": 4060 }, { "entropy": 5.747698211669922, "epoch": 0.45656202616948394, "grad_norm": 1.1171875, "learning_rate": 0.0004986561969854661, "loss": 5.7872, "mean_token_accuracy": 0.16532022655010223, "num_tokens": 9083613.0, "step": 4065 }, { "entropy": 5.754197359085083, "epoch": 0.45712360307744143, "grad_norm": 1.171875, "learning_rate": 0.0004986518120156373, "loss": 5.6888, "mean_token_accuracy": 0.16673017293214798, "num_tokens": 9095678.0, "step": 4070 }, { "entropy": 5.761954212188721, "epoch": 0.457685179985399, "grad_norm": 1.1796875, "learning_rate": 0.000498647419924648, "loss": 5.696, "mean_token_accuracy": 0.17291476875543593, "num_tokens": 9106637.0, "step": 4075 }, { "entropy": 5.667988586425781, "epoch": 0.45824675689335653, "grad_norm": 1.1328125, "learning_rate": 0.000498643020712638, "loss": 5.6597, "mean_token_accuracy": 0.17288853377103805, "num_tokens": 9117343.0, "step": 4080 }, { "entropy": 5.798785257339477, "epoch": 0.4588083338013141, "grad_norm": 1.0390625, "learning_rate": 0.0004986386143797475, "loss": 5.7887, "mean_token_accuracy": 0.15990065932273864, "num_tokens": 9129315.0, "step": 4085 }, { "entropy": 5.7697852611541744, "epoch": 0.45936991070927163, "grad_norm": 1.25, "learning_rate": 0.0004986342009261169, "loss": 5.6784, "mean_token_accuracy": 0.16411612257361413, "num_tokens": 9139701.0, "step": 4090 }, { "entropy": 5.79812912940979, "epoch": 0.4599314876172292, "grad_norm": 1.21875, "learning_rate": 0.0004986297803518865, "loss": 5.8133, "mean_token_accuracy": 0.16509659737348556, "num_tokens": 9152334.0, "step": 4095 }, { "entropy": 5.762947416305542, "epoch": 0.46049306452518673, "grad_norm": 1.171875, "learning_rate": 0.0004986253526571971, "loss": 5.6195, "mean_token_accuracy": 0.17192814201116563, "num_tokens": 9163277.0, "step": 4100 }, { "entropy": 5.772461366653443, "epoch": 0.4610546414331443, "grad_norm": 1.046875, "learning_rate": 0.0004986209178421899, "loss": 5.802, "mean_token_accuracy": 0.1619513064622879, "num_tokens": 9174909.0, "step": 4105 }, { "entropy": 5.647283840179443, "epoch": 0.46161621834110184, "grad_norm": 1.1796875, "learning_rate": 0.000498616475907006, "loss": 5.5928, "mean_token_accuracy": 0.16549195647239684, "num_tokens": 9186058.0, "step": 4110 }, { "entropy": 5.73241286277771, "epoch": 0.46217779524905933, "grad_norm": 1.3203125, "learning_rate": 0.0004986120268517865, "loss": 5.7547, "mean_token_accuracy": 0.16822669506072999, "num_tokens": 9196919.0, "step": 4115 }, { "entropy": 5.772916507720947, "epoch": 0.4627393721570169, "grad_norm": 1.25, "learning_rate": 0.0004986075706766736, "loss": 5.7294, "mean_token_accuracy": 0.16655745655298232, "num_tokens": 9208452.0, "step": 4120 }, { "entropy": 5.783675956726074, "epoch": 0.46330094906497443, "grad_norm": 1.203125, "learning_rate": 0.0004986031073818088, "loss": 5.7842, "mean_token_accuracy": 0.1649884581565857, "num_tokens": 9219605.0, "step": 4125 }, { "entropy": 5.74765625, "epoch": 0.463862525972932, "grad_norm": 1.2734375, "learning_rate": 0.0004985986369673343, "loss": 5.6159, "mean_token_accuracy": 0.17641097754240037, "num_tokens": 9230491.0, "step": 4130 }, { "entropy": 5.717433166503906, "epoch": 0.46442410288088953, "grad_norm": 1.28125, "learning_rate": 0.0004985941594333926, "loss": 5.7567, "mean_token_accuracy": 0.16423618644475937, "num_tokens": 9241768.0, "step": 4135 }, { "entropy": 5.800970554351807, "epoch": 0.4649856797888471, "grad_norm": 1.1015625, "learning_rate": 0.000498589674780126, "loss": 5.7934, "mean_token_accuracy": 0.16235399544239043, "num_tokens": 9253779.0, "step": 4140 }, { "entropy": 5.94872088432312, "epoch": 0.46554725669680463, "grad_norm": 1.265625, "learning_rate": 0.0004985851830076775, "loss": 5.6916, "mean_token_accuracy": 0.17534759044647216, "num_tokens": 9264567.0, "step": 4145 }, { "entropy": 5.591338491439819, "epoch": 0.4661088336047622, "grad_norm": 1.4296875, "learning_rate": 0.0004985806841161901, "loss": 5.6529, "mean_token_accuracy": 0.17427073419094086, "num_tokens": 9275960.0, "step": 4150 }, { "entropy": 5.708569431304932, "epoch": 0.46667041051271974, "grad_norm": 1.390625, "learning_rate": 0.000498576178105807, "loss": 5.7891, "mean_token_accuracy": 0.17374880164861678, "num_tokens": 9288305.0, "step": 4155 }, { "entropy": 5.802067136764526, "epoch": 0.4672319874206773, "grad_norm": 1.1640625, "learning_rate": 0.0004985716649766717, "loss": 5.6165, "mean_token_accuracy": 0.17416664063930512, "num_tokens": 9299579.0, "step": 4160 }, { "entropy": 5.667328643798828, "epoch": 0.4677935643286348, "grad_norm": 1.203125, "learning_rate": 0.0004985671447289277, "loss": 5.6468, "mean_token_accuracy": 0.16909621357917787, "num_tokens": 9311221.0, "step": 4165 }, { "entropy": 5.732243394851684, "epoch": 0.46835514123659233, "grad_norm": 1.2578125, "learning_rate": 0.0004985626173627194, "loss": 5.7524, "mean_token_accuracy": 0.16208277642726898, "num_tokens": 9322488.0, "step": 4170 }, { "entropy": 5.74122986793518, "epoch": 0.4689167181445499, "grad_norm": 1.3203125, "learning_rate": 0.0004985580828781904, "loss": 5.7099, "mean_token_accuracy": 0.16819628775119783, "num_tokens": 9333672.0, "step": 4175 }, { "entropy": 5.8608152866363525, "epoch": 0.46947829505250743, "grad_norm": 1.3125, "learning_rate": 0.0004985535412754855, "loss": 5.7418, "mean_token_accuracy": 0.16545120030641555, "num_tokens": 9344449.0, "step": 4180 }, { "entropy": 5.826900577545166, "epoch": 0.470039871960465, "grad_norm": 1.2734375, "learning_rate": 0.000498548992554749, "loss": 5.8074, "mean_token_accuracy": 0.1609753578901291, "num_tokens": 9355279.0, "step": 4185 }, { "entropy": 5.751828336715699, "epoch": 0.47060144886842253, "grad_norm": 1.125, "learning_rate": 0.0004985444367161259, "loss": 5.7103, "mean_token_accuracy": 0.16859401911497116, "num_tokens": 9366942.0, "step": 4190 }, { "entropy": 5.685658740997314, "epoch": 0.4711630257763801, "grad_norm": 1.109375, "learning_rate": 0.0004985398737597614, "loss": 5.6355, "mean_token_accuracy": 0.1736157312989235, "num_tokens": 9378129.0, "step": 4195 }, { "entropy": 5.801950359344483, "epoch": 0.47172460268433763, "grad_norm": 1.140625, "learning_rate": 0.0004985353036858004, "loss": 5.7287, "mean_token_accuracy": 0.16660770624876023, "num_tokens": 9388757.0, "step": 4200 }, { "entropy": 5.744151067733765, "epoch": 0.4722861795922952, "grad_norm": 1.171875, "learning_rate": 0.0004985307264943887, "loss": 5.6745, "mean_token_accuracy": 0.16941459774971007, "num_tokens": 9399112.0, "step": 4205 }, { "entropy": 5.7844664573669435, "epoch": 0.47284775650025274, "grad_norm": 1.1875, "learning_rate": 0.0004985261421856721, "loss": 5.7691, "mean_token_accuracy": 0.16700249612331391, "num_tokens": 9410156.0, "step": 4210 }, { "entropy": 5.833684635162354, "epoch": 0.47340933340821023, "grad_norm": 1.203125, "learning_rate": 0.0004985215507597963, "loss": 5.7515, "mean_token_accuracy": 0.17010293602943422, "num_tokens": 9420402.0, "step": 4215 }, { "entropy": 5.729236125946045, "epoch": 0.4739709103161678, "grad_norm": 1.265625, "learning_rate": 0.0004985169522169076, "loss": 5.7532, "mean_token_accuracy": 0.1657623678445816, "num_tokens": 9431159.0, "step": 4220 }, { "entropy": 5.701308298110962, "epoch": 0.47453248722412533, "grad_norm": 1.109375, "learning_rate": 0.0004985123465571526, "loss": 5.6592, "mean_token_accuracy": 0.17336241155862808, "num_tokens": 9441737.0, "step": 4225 }, { "entropy": 5.6865349292755125, "epoch": 0.4750940641320829, "grad_norm": 1.0390625, "learning_rate": 0.0004985077337806777, "loss": 5.6196, "mean_token_accuracy": 0.1779865562915802, "num_tokens": 9452756.0, "step": 4230 }, { "entropy": 5.739285612106324, "epoch": 0.47565564104004043, "grad_norm": 1.109375, "learning_rate": 0.0004985031138876299, "loss": 5.6878, "mean_token_accuracy": 0.1680801346898079, "num_tokens": 9464231.0, "step": 4235 }, { "entropy": 5.764004802703857, "epoch": 0.476217217947998, "grad_norm": 1.125, "learning_rate": 0.0004984984868781563, "loss": 5.7067, "mean_token_accuracy": 0.1760090947151184, "num_tokens": 9475648.0, "step": 4240 }, { "entropy": 5.744698429107666, "epoch": 0.47677879485595553, "grad_norm": 1.15625, "learning_rate": 0.0004984938527524041, "loss": 5.751, "mean_token_accuracy": 0.16820831894874572, "num_tokens": 9486594.0, "step": 4245 }, { "entropy": 5.672558355331421, "epoch": 0.4773403717639131, "grad_norm": 1.1875, "learning_rate": 0.000498489211510521, "loss": 5.6621, "mean_token_accuracy": 0.17208858728408813, "num_tokens": 9497085.0, "step": 4250 }, { "entropy": 5.784761142730713, "epoch": 0.47790194867187064, "grad_norm": 1.125, "learning_rate": 0.0004984845631526547, "loss": 5.7477, "mean_token_accuracy": 0.16722307056188584, "num_tokens": 9509765.0, "step": 4255 }, { "entropy": 5.725100564956665, "epoch": 0.47846352557982813, "grad_norm": 1.1171875, "learning_rate": 0.0004984799076789534, "loss": 5.5731, "mean_token_accuracy": 0.16857376992702483, "num_tokens": 9521341.0, "step": 4260 }, { "entropy": 5.630601024627685, "epoch": 0.4790251024877857, "grad_norm": 1.1328125, "learning_rate": 0.0004984752450895649, "loss": 5.6929, "mean_token_accuracy": 0.1659396380186081, "num_tokens": 9533196.0, "step": 4265 }, { "entropy": 5.8102864742279055, "epoch": 0.47958667939574323, "grad_norm": 1.3203125, "learning_rate": 0.000498470575384638, "loss": 5.8286, "mean_token_accuracy": 0.15910447090864183, "num_tokens": 9543687.0, "step": 4270 }, { "entropy": 5.903976631164551, "epoch": 0.4801482563037008, "grad_norm": 1.2421875, "learning_rate": 0.0004984658985643214, "loss": 5.7156, "mean_token_accuracy": 0.16543746441602708, "num_tokens": 9555320.0, "step": 4275 }, { "entropy": 5.636949110031128, "epoch": 0.48070983321165833, "grad_norm": 1.21875, "learning_rate": 0.0004984612146287638, "loss": 5.6659, "mean_token_accuracy": 0.16941267549991607, "num_tokens": 9566347.0, "step": 4280 }, { "entropy": 5.636159801483155, "epoch": 0.4812714101196159, "grad_norm": 1.15625, "learning_rate": 0.0004984565235781147, "loss": 5.6669, "mean_token_accuracy": 0.16980277746915817, "num_tokens": 9577111.0, "step": 4285 }, { "entropy": 5.761268234252929, "epoch": 0.48183298702757343, "grad_norm": 1.5, "learning_rate": 0.000498451825412523, "loss": 5.671, "mean_token_accuracy": 0.16593389809131623, "num_tokens": 9586612.0, "step": 4290 }, { "entropy": 5.774903297424316, "epoch": 0.482394563935531, "grad_norm": 1.078125, "learning_rate": 0.0004984471201321386, "loss": 5.6786, "mean_token_accuracy": 0.17062007635831833, "num_tokens": 9597347.0, "step": 4295 }, { "entropy": 5.674345445632935, "epoch": 0.48295614084348854, "grad_norm": 1.1328125, "learning_rate": 0.0004984424077371112, "loss": 5.6524, "mean_token_accuracy": 0.17706192433834075, "num_tokens": 9608507.0, "step": 4300 }, { "entropy": 5.708226156234741, "epoch": 0.4835177177514461, "grad_norm": 1.296875, "learning_rate": 0.0004984376882275909, "loss": 5.7082, "mean_token_accuracy": 0.17436117678880692, "num_tokens": 9619449.0, "step": 4305 }, { "entropy": 5.680789613723755, "epoch": 0.4840792946594036, "grad_norm": 1.3125, "learning_rate": 0.0004984329616037279, "loss": 5.6346, "mean_token_accuracy": 0.16903165727853775, "num_tokens": 9630613.0, "step": 4310 }, { "entropy": 5.761481714248657, "epoch": 0.48464087156736113, "grad_norm": 1.0546875, "learning_rate": 0.0004984282278656727, "loss": 5.7086, "mean_token_accuracy": 0.16750625967979432, "num_tokens": 9642149.0, "step": 4315 }, { "entropy": 5.755221033096314, "epoch": 0.4852024484753187, "grad_norm": 1.15625, "learning_rate": 0.0004984234870135762, "loss": 5.6496, "mean_token_accuracy": 0.17484654635190963, "num_tokens": 9652960.0, "step": 4320 }, { "entropy": 5.68124532699585, "epoch": 0.48576402538327623, "grad_norm": 1.2109375, "learning_rate": 0.0004984187390475891, "loss": 5.6417, "mean_token_accuracy": 0.17295996993780136, "num_tokens": 9662676.0, "step": 4325 }, { "entropy": 5.838757276535034, "epoch": 0.4863256022912338, "grad_norm": 1.21875, "learning_rate": 0.0004984139839678628, "loss": 5.7493, "mean_token_accuracy": 0.16618652939796447, "num_tokens": 9674138.0, "step": 4330 }, { "entropy": 5.714073657989502, "epoch": 0.48688717919919133, "grad_norm": 1.296875, "learning_rate": 0.0004984092217745486, "loss": 5.7113, "mean_token_accuracy": 0.1709674835205078, "num_tokens": 9685397.0, "step": 4335 }, { "entropy": 5.790579319000244, "epoch": 0.4874487561071489, "grad_norm": 1.125, "learning_rate": 0.0004984044524677981, "loss": 5.8231, "mean_token_accuracy": 0.1605924040079117, "num_tokens": 9697266.0, "step": 4340 }, { "entropy": 5.828333997726441, "epoch": 0.48801033301510643, "grad_norm": 1.1328125, "learning_rate": 0.0004983996760477632, "loss": 5.6552, "mean_token_accuracy": 0.16677314341068267, "num_tokens": 9707967.0, "step": 4345 }, { "entropy": 5.62044587135315, "epoch": 0.488571909923064, "grad_norm": 1.2421875, "learning_rate": 0.000498394892514596, "loss": 5.6341, "mean_token_accuracy": 0.17084338515996933, "num_tokens": 9718162.0, "step": 4350 }, { "entropy": 5.717535734176636, "epoch": 0.48913348683102154, "grad_norm": 1.2890625, "learning_rate": 0.0004983901018684486, "loss": 5.6886, "mean_token_accuracy": 0.16895658969879152, "num_tokens": 9729439.0, "step": 4355 }, { "entropy": 5.775072956085205, "epoch": 0.48969506373897903, "grad_norm": 1.0859375, "learning_rate": 0.0004983853041094739, "loss": 5.7112, "mean_token_accuracy": 0.16845377534627914, "num_tokens": 9741383.0, "step": 4360 }, { "entropy": 5.712487268447876, "epoch": 0.4902566406469366, "grad_norm": 1.15625, "learning_rate": 0.0004983804992378243, "loss": 5.7325, "mean_token_accuracy": 0.17263987958431243, "num_tokens": 9753050.0, "step": 4365 }, { "entropy": 5.681834554672241, "epoch": 0.49081821755489413, "grad_norm": 1.296875, "learning_rate": 0.0004983756872536532, "loss": 5.6141, "mean_token_accuracy": 0.1744478538632393, "num_tokens": 9763715.0, "step": 4370 }, { "entropy": 5.699193477630615, "epoch": 0.4913797944628517, "grad_norm": 1.15625, "learning_rate": 0.0004983708681571134, "loss": 5.5872, "mean_token_accuracy": 0.1801524966955185, "num_tokens": 9774145.0, "step": 4375 }, { "entropy": 5.711805200576782, "epoch": 0.49194137137080923, "grad_norm": 1.1640625, "learning_rate": 0.0004983660419483586, "loss": 5.6484, "mean_token_accuracy": 0.1740181788802147, "num_tokens": 9784703.0, "step": 4380 }, { "entropy": 5.7284644603729244, "epoch": 0.4925029482787668, "grad_norm": 1.125, "learning_rate": 0.0004983612086275424, "loss": 5.6657, "mean_token_accuracy": 0.16666370034217834, "num_tokens": 9795426.0, "step": 4385 }, { "entropy": 5.744356107711792, "epoch": 0.49306452518672433, "grad_norm": 1.2890625, "learning_rate": 0.0004983563681948187, "loss": 5.7488, "mean_token_accuracy": 0.16563860327005386, "num_tokens": 9806539.0, "step": 4390 }, { "entropy": 5.838592100143432, "epoch": 0.4936261020946819, "grad_norm": 1.15625, "learning_rate": 0.0004983515206503416, "loss": 5.7354, "mean_token_accuracy": 0.16389266550540924, "num_tokens": 9816806.0, "step": 4395 }, { "entropy": 5.741393136978149, "epoch": 0.49418767900263944, "grad_norm": 1.171875, "learning_rate": 0.0004983466659942655, "loss": 5.6239, "mean_token_accuracy": 0.1763622909784317, "num_tokens": 9828001.0, "step": 4400 }, { "entropy": 5.568348503112793, "epoch": 0.49474925591059693, "grad_norm": 1.234375, "learning_rate": 0.0004983418042267449, "loss": 5.6675, "mean_token_accuracy": 0.17209520637989045, "num_tokens": 9838773.0, "step": 4405 }, { "entropy": 5.723768329620361, "epoch": 0.4953108328185545, "grad_norm": 1.0390625, "learning_rate": 0.0004983369353479345, "loss": 5.664, "mean_token_accuracy": 0.17434099316596985, "num_tokens": 9848680.0, "step": 4410 }, { "entropy": 5.700279903411865, "epoch": 0.49587240972651203, "grad_norm": 1.1171875, "learning_rate": 0.0004983320593579895, "loss": 5.6349, "mean_token_accuracy": 0.16858525723218917, "num_tokens": 9859168.0, "step": 4415 }, { "entropy": 5.66675705909729, "epoch": 0.4964339866344696, "grad_norm": 1.1640625, "learning_rate": 0.0004983271762570653, "loss": 5.671, "mean_token_accuracy": 0.17040987610816954, "num_tokens": 9869071.0, "step": 4420 }, { "entropy": 5.750021266937256, "epoch": 0.49699556354242713, "grad_norm": 1.1015625, "learning_rate": 0.000498322286045317, "loss": 5.6767, "mean_token_accuracy": 0.17082203477621077, "num_tokens": 9880208.0, "step": 4425 }, { "entropy": 5.7331212043762205, "epoch": 0.4975571404503847, "grad_norm": 1.4296875, "learning_rate": 0.0004983173887229006, "loss": 5.7172, "mean_token_accuracy": 0.17034917324781418, "num_tokens": 9891192.0, "step": 4430 }, { "entropy": 5.790711212158203, "epoch": 0.49811871735834223, "grad_norm": 1.09375, "learning_rate": 0.0004983124842899719, "loss": 5.7379, "mean_token_accuracy": 0.16513569355010987, "num_tokens": 9903038.0, "step": 4435 }, { "entropy": 5.830787420272827, "epoch": 0.4986802942662998, "grad_norm": 1.1484375, "learning_rate": 0.0004983075727466871, "loss": 5.7921, "mean_token_accuracy": 0.1677357569336891, "num_tokens": 9916104.0, "step": 4440 }, { "entropy": 5.6895956039428714, "epoch": 0.49924187117425733, "grad_norm": 1.4296875, "learning_rate": 0.0004983026540932026, "loss": 5.6103, "mean_token_accuracy": 0.171831975877285, "num_tokens": 9927094.0, "step": 4445 }, { "entropy": 5.784496068954468, "epoch": 0.4998034480822149, "grad_norm": 1.28125, "learning_rate": 0.0004982977283296749, "loss": 5.8228, "mean_token_accuracy": 0.1600668027997017, "num_tokens": 9937964.0, "step": 4450 }, { "entropy": 5.8589826107025145, "epoch": 0.5003650249901724, "grad_norm": 1.2578125, "learning_rate": 0.000498292795456261, "loss": 5.7841, "mean_token_accuracy": 0.16068200916051864, "num_tokens": 9949238.0, "step": 4455 }, { "entropy": 5.740886306762695, "epoch": 0.50092660189813, "grad_norm": 1.3203125, "learning_rate": 0.0004982878554731178, "loss": 5.6144, "mean_token_accuracy": 0.17186491191387177, "num_tokens": 9960125.0, "step": 4460 }, { "entropy": 5.579822969436646, "epoch": 0.5014881788060875, "grad_norm": 1.1484375, "learning_rate": 0.0004982829083804028, "loss": 5.6379, "mean_token_accuracy": 0.1658797100186348, "num_tokens": 9971130.0, "step": 4465 }, { "entropy": 5.683795070648193, "epoch": 0.5020497557140451, "grad_norm": 1.09375, "learning_rate": 0.0004982779541782733, "loss": 5.5301, "mean_token_accuracy": 0.17982134222984314, "num_tokens": 9981516.0, "step": 4470 }, { "entropy": 5.691908359527588, "epoch": 0.5026113326220026, "grad_norm": 1.2109375, "learning_rate": 0.0004982729928668872, "loss": 5.765, "mean_token_accuracy": 0.16426052749156952, "num_tokens": 9992360.0, "step": 4475 }, { "entropy": 5.844257497787476, "epoch": 0.5031729095299601, "grad_norm": 1.2421875, "learning_rate": 0.0004982680244464024, "loss": 5.865, "mean_token_accuracy": 0.16424636989831926, "num_tokens": 10003410.0, "step": 4480 }, { "entropy": 5.831128740310669, "epoch": 0.5037344864379176, "grad_norm": 1.1328125, "learning_rate": 0.0004982630489169771, "loss": 5.6665, "mean_token_accuracy": 0.1697389677166939, "num_tokens": 10014974.0, "step": 4485 }, { "entropy": 5.730645370483399, "epoch": 0.5042960633458752, "grad_norm": 1.203125, "learning_rate": 0.0004982580662787697, "loss": 5.7355, "mean_token_accuracy": 0.1644341304898262, "num_tokens": 10026702.0, "step": 4490 }, { "entropy": 5.7113964557647705, "epoch": 0.5048576402538327, "grad_norm": 1.1953125, "learning_rate": 0.0004982530765319389, "loss": 5.7192, "mean_token_accuracy": 0.1672709807753563, "num_tokens": 10039318.0, "step": 4495 }, { "entropy": 5.741805553436279, "epoch": 0.5054192171617903, "grad_norm": 1.2265625, "learning_rate": 0.0004982480796766436, "loss": 5.6632, "mean_token_accuracy": 0.1635326474905014, "num_tokens": 10049726.0, "step": 4500 }, { "entropy": 5.691263341903687, "epoch": 0.5059807940697478, "grad_norm": 1.1953125, "learning_rate": 0.0004982430757130429, "loss": 5.5585, "mean_token_accuracy": 0.1718662425875664, "num_tokens": 10059663.0, "step": 4505 }, { "entropy": 5.583151340484619, "epoch": 0.5065423709777054, "grad_norm": 1.28125, "learning_rate": 0.0004982380646412959, "loss": 5.6013, "mean_token_accuracy": 0.16774161756038666, "num_tokens": 10071195.0, "step": 4510 }, { "entropy": 5.827329444885254, "epoch": 0.5071039478856629, "grad_norm": 1.2578125, "learning_rate": 0.0004982330464615625, "loss": 5.8071, "mean_token_accuracy": 0.16533977538347244, "num_tokens": 10082014.0, "step": 4515 }, { "entropy": 5.811189365386963, "epoch": 0.5076655247936205, "grad_norm": 1.2734375, "learning_rate": 0.0004982280211740023, "loss": 5.6143, "mean_token_accuracy": 0.17575001269578933, "num_tokens": 10093156.0, "step": 4520 }, { "entropy": 5.631749963760376, "epoch": 0.508227101701578, "grad_norm": 1.28125, "learning_rate": 0.0004982229887787753, "loss": 5.7599, "mean_token_accuracy": 0.1561910793185234, "num_tokens": 10104993.0, "step": 4525 }, { "entropy": 5.7125547409057615, "epoch": 0.5087886786095356, "grad_norm": 1.3828125, "learning_rate": 0.0004982179492760418, "loss": 5.5668, "mean_token_accuracy": 0.18113714456558228, "num_tokens": 10114590.0, "step": 4530 }, { "entropy": 5.67285680770874, "epoch": 0.5093502555174931, "grad_norm": 1.1484375, "learning_rate": 0.0004982129026659621, "loss": 5.5738, "mean_token_accuracy": 0.17499979734420776, "num_tokens": 10125849.0, "step": 4535 }, { "entropy": 5.626177024841309, "epoch": 0.5099118324254507, "grad_norm": 1.3984375, "learning_rate": 0.0004982078489486972, "loss": 5.5941, "mean_token_accuracy": 0.17779029458761214, "num_tokens": 10135493.0, "step": 4540 }, { "entropy": 5.7630730152130125, "epoch": 0.5104734093334082, "grad_norm": 1.1640625, "learning_rate": 0.0004982027881244076, "loss": 5.7775, "mean_token_accuracy": 0.1641564130783081, "num_tokens": 10146987.0, "step": 4545 }, { "entropy": 5.765534067153931, "epoch": 0.5110349862413658, "grad_norm": 1.2109375, "learning_rate": 0.0004981977201932549, "loss": 5.7086, "mean_token_accuracy": 0.17529913783073425, "num_tokens": 10157823.0, "step": 4550 }, { "entropy": 5.639018440246582, "epoch": 0.5115965631493233, "grad_norm": 1.4609375, "learning_rate": 0.0004981926451554001, "loss": 5.6758, "mean_token_accuracy": 0.17088306099176406, "num_tokens": 10169305.0, "step": 4555 }, { "entropy": 5.824262237548828, "epoch": 0.5121581400572809, "grad_norm": 1.1484375, "learning_rate": 0.0004981875630110048, "loss": 5.7553, "mean_token_accuracy": 0.1605099081993103, "num_tokens": 10180346.0, "step": 4560 }, { "entropy": 5.753881549835205, "epoch": 0.5127197169652384, "grad_norm": 1.265625, "learning_rate": 0.0004981824737602311, "loss": 5.6425, "mean_token_accuracy": 0.17663276344537734, "num_tokens": 10190870.0, "step": 4565 }, { "entropy": 5.745822525024414, "epoch": 0.513281293873196, "grad_norm": 1.2734375, "learning_rate": 0.0004981773774032409, "loss": 5.7113, "mean_token_accuracy": 0.15780248045921325, "num_tokens": 10202408.0, "step": 4570 }, { "entropy": 5.637575244903564, "epoch": 0.5138428707811534, "grad_norm": 1.53125, "learning_rate": 0.0004981722739401962, "loss": 5.5405, "mean_token_accuracy": 0.17590135782957078, "num_tokens": 10213367.0, "step": 4575 }, { "entropy": 5.701434135437012, "epoch": 0.514404447689111, "grad_norm": 1.3125, "learning_rate": 0.00049816716337126, "loss": 5.6765, "mean_token_accuracy": 0.16563864946365356, "num_tokens": 10223865.0, "step": 4580 }, { "entropy": 5.599912309646607, "epoch": 0.5149660245970685, "grad_norm": 1.203125, "learning_rate": 0.0004981620456965946, "loss": 5.4468, "mean_token_accuracy": 0.17510706782341004, "num_tokens": 10235268.0, "step": 4585 }, { "entropy": 5.6726030826568605, "epoch": 0.5155276015050261, "grad_norm": 1.359375, "learning_rate": 0.0004981569209163633, "loss": 5.7124, "mean_token_accuracy": 0.16576266586780547, "num_tokens": 10247700.0, "step": 4590 }, { "entropy": 5.761053800582886, "epoch": 0.5160891784129836, "grad_norm": 1.28125, "learning_rate": 0.0004981517890307288, "loss": 5.76, "mean_token_accuracy": 0.16685858815908433, "num_tokens": 10258553.0, "step": 4595 }, { "entropy": 5.758320093154907, "epoch": 0.5166507553209412, "grad_norm": 1.2578125, "learning_rate": 0.000498146650039855, "loss": 5.6481, "mean_token_accuracy": 0.17269993275403978, "num_tokens": 10268496.0, "step": 4600 }, { "entropy": 5.774955701828003, "epoch": 0.5172123322288987, "grad_norm": 1.328125, "learning_rate": 0.0004981415039439054, "loss": 5.7253, "mean_token_accuracy": 0.16718546748161317, "num_tokens": 10278803.0, "step": 4605 }, { "entropy": 5.711667108535766, "epoch": 0.5177739091368563, "grad_norm": 1.28125, "learning_rate": 0.0004981363507430436, "loss": 5.5835, "mean_token_accuracy": 0.1724689558148384, "num_tokens": 10289805.0, "step": 4610 }, { "entropy": 5.688625192642212, "epoch": 0.5183354860448138, "grad_norm": 1.28125, "learning_rate": 0.0004981311904374339, "loss": 5.7046, "mean_token_accuracy": 0.174521566927433, "num_tokens": 10300295.0, "step": 4615 }, { "entropy": 5.841267871856689, "epoch": 0.5188970629527714, "grad_norm": 1.3203125, "learning_rate": 0.0004981260230272405, "loss": 5.7889, "mean_token_accuracy": 0.16799403876066207, "num_tokens": 10312175.0, "step": 4620 }, { "entropy": 5.63864483833313, "epoch": 0.5194586398607289, "grad_norm": 1.3515625, "learning_rate": 0.0004981208485126281, "loss": 5.6779, "mean_token_accuracy": 0.1660699799656868, "num_tokens": 10322888.0, "step": 4625 }, { "entropy": 5.693124485015869, "epoch": 0.5200202167686865, "grad_norm": 1.1796875, "learning_rate": 0.0004981156668937613, "loss": 5.6516, "mean_token_accuracy": 0.17714009433984756, "num_tokens": 10333305.0, "step": 4630 }, { "entropy": 5.757165384292603, "epoch": 0.520581793676644, "grad_norm": 1.5078125, "learning_rate": 0.0004981104781708051, "loss": 5.6988, "mean_token_accuracy": 0.16862452477216722, "num_tokens": 10344190.0, "step": 4635 }, { "entropy": 5.797582530975342, "epoch": 0.5211433705846016, "grad_norm": 1.3203125, "learning_rate": 0.0004981052823439247, "loss": 5.7742, "mean_token_accuracy": 0.16717695221304893, "num_tokens": 10356271.0, "step": 4640 }, { "entropy": 5.836018705368042, "epoch": 0.5217049474925591, "grad_norm": 1.2734375, "learning_rate": 0.0004981000794132858, "loss": 5.8366, "mean_token_accuracy": 0.15832895487546922, "num_tokens": 10368756.0, "step": 4645 }, { "entropy": 5.814976835250855, "epoch": 0.5222665244005167, "grad_norm": 1.265625, "learning_rate": 0.0004980948693790536, "loss": 5.6962, "mean_token_accuracy": 0.1687784492969513, "num_tokens": 10380029.0, "step": 4650 }, { "entropy": 5.691782474517822, "epoch": 0.5228281013084742, "grad_norm": 1.25, "learning_rate": 0.0004980896522413943, "loss": 5.6803, "mean_token_accuracy": 0.16841885596513748, "num_tokens": 10390358.0, "step": 4655 }, { "entropy": 5.686275625228882, "epoch": 0.5233896782164318, "grad_norm": 1.2421875, "learning_rate": 0.0004980844280004739, "loss": 5.6551, "mean_token_accuracy": 0.1711376890540123, "num_tokens": 10401331.0, "step": 4660 }, { "entropy": 5.753196573257446, "epoch": 0.5239512551243893, "grad_norm": 1.4453125, "learning_rate": 0.0004980791966564589, "loss": 5.6783, "mean_token_accuracy": 0.16949976235628128, "num_tokens": 10412755.0, "step": 4665 }, { "entropy": 5.692148733139038, "epoch": 0.5245128320323468, "grad_norm": 1.359375, "learning_rate": 0.0004980739582095158, "loss": 5.6194, "mean_token_accuracy": 0.17993575930595399, "num_tokens": 10422698.0, "step": 4670 }, { "entropy": 5.739432430267334, "epoch": 0.5250744089403043, "grad_norm": 1.1484375, "learning_rate": 0.0004980687126598111, "loss": 5.753, "mean_token_accuracy": 0.16443512141704558, "num_tokens": 10434467.0, "step": 4675 }, { "entropy": 5.691123342514038, "epoch": 0.5256359858482619, "grad_norm": 1.2578125, "learning_rate": 0.0004980634600075123, "loss": 5.6647, "mean_token_accuracy": 0.17190593779087066, "num_tokens": 10446007.0, "step": 4680 }, { "entropy": 5.758034658432007, "epoch": 0.5261975627562194, "grad_norm": 1.2578125, "learning_rate": 0.0004980582002527863, "loss": 5.6857, "mean_token_accuracy": 0.17210673540830612, "num_tokens": 10457538.0, "step": 4685 }, { "entropy": 5.737921142578125, "epoch": 0.526759139664177, "grad_norm": 1.3203125, "learning_rate": 0.0004980529333958008, "loss": 5.6438, "mean_token_accuracy": 0.17155391573905945, "num_tokens": 10468389.0, "step": 4690 }, { "entropy": 5.64755654335022, "epoch": 0.5273207165721345, "grad_norm": 1.28125, "learning_rate": 0.0004980476594367233, "loss": 5.6167, "mean_token_accuracy": 0.166074176132679, "num_tokens": 10479032.0, "step": 4695 }, { "entropy": 5.7380961894989015, "epoch": 0.5278822934800921, "grad_norm": 1.1796875, "learning_rate": 0.0004980423783757219, "loss": 5.6203, "mean_token_accuracy": 0.1761274218559265, "num_tokens": 10490505.0, "step": 4700 }, { "entropy": 5.777146339416504, "epoch": 0.5284438703880496, "grad_norm": 1.34375, "learning_rate": 0.0004980370902129646, "loss": 5.6841, "mean_token_accuracy": 0.17220447063446045, "num_tokens": 10501382.0, "step": 4705 }, { "entropy": 5.7597027778625485, "epoch": 0.5290054472960072, "grad_norm": 1.171875, "learning_rate": 0.00049803179494862, "loss": 5.6519, "mean_token_accuracy": 0.17078416049480438, "num_tokens": 10512727.0, "step": 4710 }, { "entropy": 5.627700519561768, "epoch": 0.5295670242039647, "grad_norm": 1.4296875, "learning_rate": 0.0004980264925828563, "loss": 5.6379, "mean_token_accuracy": 0.17503894567489625, "num_tokens": 10523383.0, "step": 4715 }, { "entropy": 5.723991012573242, "epoch": 0.5301286011119223, "grad_norm": 1.3671875, "learning_rate": 0.0004980211831158427, "loss": 5.6443, "mean_token_accuracy": 0.17036737948656083, "num_tokens": 10534416.0, "step": 4720 }, { "entropy": 5.713537502288818, "epoch": 0.5306901780198798, "grad_norm": 1.3046875, "learning_rate": 0.0004980158665477481, "loss": 5.6192, "mean_token_accuracy": 0.1723712608218193, "num_tokens": 10544291.0, "step": 4725 }, { "entropy": 5.703956174850464, "epoch": 0.5312517549278374, "grad_norm": 1.25, "learning_rate": 0.0004980105428787419, "loss": 5.585, "mean_token_accuracy": 0.1744757741689682, "num_tokens": 10555291.0, "step": 4730 }, { "entropy": 5.739058351516723, "epoch": 0.5318133318357949, "grad_norm": 1.3515625, "learning_rate": 0.0004980052121089934, "loss": 5.6839, "mean_token_accuracy": 0.1688266322016716, "num_tokens": 10565812.0, "step": 4735 }, { "entropy": 5.644025564193726, "epoch": 0.5323749087437525, "grad_norm": 1.21875, "learning_rate": 0.0004979998742386725, "loss": 5.6093, "mean_token_accuracy": 0.17441638559103012, "num_tokens": 10577351.0, "step": 4740 }, { "entropy": 5.761340379714966, "epoch": 0.53293648565171, "grad_norm": 1.140625, "learning_rate": 0.0004979945292679492, "loss": 5.6919, "mean_token_accuracy": 0.1682047963142395, "num_tokens": 10589236.0, "step": 4745 }, { "entropy": 5.650798368453979, "epoch": 0.5334980625596676, "grad_norm": 1.328125, "learning_rate": 0.0004979891771969935, "loss": 5.6363, "mean_token_accuracy": 0.17235926836729049, "num_tokens": 10599926.0, "step": 4750 }, { "entropy": 5.7528852939605715, "epoch": 0.5340596394676251, "grad_norm": 1.2421875, "learning_rate": 0.000497983818025976, "loss": 5.7496, "mean_token_accuracy": 0.16808155328035354, "num_tokens": 10611495.0, "step": 4755 }, { "entropy": 5.749897480010986, "epoch": 0.5346212163755827, "grad_norm": 1.28125, "learning_rate": 0.0004979784517550671, "loss": 5.7608, "mean_token_accuracy": 0.1683972179889679, "num_tokens": 10622455.0, "step": 4760 }, { "entropy": 5.70879487991333, "epoch": 0.5351827932835401, "grad_norm": 1.1015625, "learning_rate": 0.0004979730783844379, "loss": 5.6031, "mean_token_accuracy": 0.17482960671186448, "num_tokens": 10634255.0, "step": 4765 }, { "entropy": 5.737195301055908, "epoch": 0.5357443701914977, "grad_norm": 1.2265625, "learning_rate": 0.0004979676979142595, "loss": 5.7169, "mean_token_accuracy": 0.1722305104136467, "num_tokens": 10644816.0, "step": 4770 }, { "entropy": 5.732215309143067, "epoch": 0.5363059470994552, "grad_norm": 1.2421875, "learning_rate": 0.000497962310344703, "loss": 5.6459, "mean_token_accuracy": 0.17166779786348343, "num_tokens": 10655449.0, "step": 4775 }, { "entropy": 5.718864822387696, "epoch": 0.5368675240074128, "grad_norm": 1.2890625, "learning_rate": 0.00049795691567594, "loss": 5.6553, "mean_token_accuracy": 0.16806258261203766, "num_tokens": 10666343.0, "step": 4780 }, { "entropy": 5.72328372001648, "epoch": 0.5374291009153703, "grad_norm": 1.421875, "learning_rate": 0.0004979515139081426, "loss": 5.7064, "mean_token_accuracy": 0.16548898369073867, "num_tokens": 10678511.0, "step": 4785 }, { "entropy": 5.665549087524414, "epoch": 0.5379906778233279, "grad_norm": 1.265625, "learning_rate": 0.0004979461050414822, "loss": 5.6909, "mean_token_accuracy": 0.17560625523328782, "num_tokens": 10690005.0, "step": 4790 }, { "entropy": 5.679067897796631, "epoch": 0.5385522547312854, "grad_norm": 1.6953125, "learning_rate": 0.0004979406890761315, "loss": 5.681, "mean_token_accuracy": 0.1686423435807228, "num_tokens": 10701062.0, "step": 4795 }, { "entropy": 5.821629285812378, "epoch": 0.539113831639243, "grad_norm": 1.1328125, "learning_rate": 0.0004979352660122629, "loss": 5.5993, "mean_token_accuracy": 0.1772200345993042, "num_tokens": 10711986.0, "step": 4800 }, { "entropy": 5.744456338882446, "epoch": 0.5396754085472005, "grad_norm": 1.1796875, "learning_rate": 0.0004979298358500488, "loss": 5.7093, "mean_token_accuracy": 0.16843186989426612, "num_tokens": 10722509.0, "step": 4805 }, { "entropy": 5.742955589294434, "epoch": 0.5402369854551581, "grad_norm": 1.453125, "learning_rate": 0.0004979243985896624, "loss": 5.6577, "mean_token_accuracy": 0.16745564192533494, "num_tokens": 10733755.0, "step": 4810 }, { "entropy": 5.69589319229126, "epoch": 0.5407985623631156, "grad_norm": 1.34375, "learning_rate": 0.0004979189542312765, "loss": 5.688, "mean_token_accuracy": 0.16879853308200837, "num_tokens": 10744356.0, "step": 4815 }, { "entropy": 5.710256290435791, "epoch": 0.5413601392710732, "grad_norm": 1.9921875, "learning_rate": 0.0004979135027750649, "loss": 5.5928, "mean_token_accuracy": 0.17196511775255202, "num_tokens": 10756474.0, "step": 4820 }, { "entropy": 5.702636575698852, "epoch": 0.5419217161790307, "grad_norm": 1.4375, "learning_rate": 0.0004979080442212007, "loss": 5.6718, "mean_token_accuracy": 0.17200553864240647, "num_tokens": 10767551.0, "step": 4825 }, { "entropy": 5.7792284965515135, "epoch": 0.5424832930869883, "grad_norm": 1.265625, "learning_rate": 0.0004979025785698581, "loss": 5.7624, "mean_token_accuracy": 0.16749392002820968, "num_tokens": 10778524.0, "step": 4830 }, { "entropy": 5.679055833816529, "epoch": 0.5430448699949458, "grad_norm": 1.28125, "learning_rate": 0.0004978971058212108, "loss": 5.6711, "mean_token_accuracy": 0.17368635684251785, "num_tokens": 10789798.0, "step": 4835 }, { "entropy": 5.730114889144898, "epoch": 0.5436064469029034, "grad_norm": 1.2421875, "learning_rate": 0.0004978916259754331, "loss": 5.6202, "mean_token_accuracy": 0.1732513874769211, "num_tokens": 10800500.0, "step": 4840 }, { "entropy": 5.761911201477051, "epoch": 0.5441680238108609, "grad_norm": 1.2109375, "learning_rate": 0.0004978861390326998, "loss": 5.6492, "mean_token_accuracy": 0.17786261439323425, "num_tokens": 10812047.0, "step": 4845 }, { "entropy": 5.655855131149292, "epoch": 0.5447296007188185, "grad_norm": 1.171875, "learning_rate": 0.0004978806449931854, "loss": 5.6656, "mean_token_accuracy": 0.1673392355442047, "num_tokens": 10823272.0, "step": 4850 }, { "entropy": 5.585034036636353, "epoch": 0.545291177626776, "grad_norm": 1.421875, "learning_rate": 0.0004978751438570647, "loss": 5.5368, "mean_token_accuracy": 0.17088105529546738, "num_tokens": 10834485.0, "step": 4855 }, { "entropy": 5.683445978164673, "epoch": 0.5458527545347336, "grad_norm": 1.265625, "learning_rate": 0.0004978696356245129, "loss": 5.614, "mean_token_accuracy": 0.16837672442197799, "num_tokens": 10843547.0, "step": 4860 }, { "entropy": 5.719631719589233, "epoch": 0.546414331442691, "grad_norm": 1.296875, "learning_rate": 0.0004978641202957057, "loss": 5.7497, "mean_token_accuracy": 0.16445043236017226, "num_tokens": 10855890.0, "step": 4865 }, { "entropy": 5.91353702545166, "epoch": 0.5469759083506486, "grad_norm": 1.234375, "learning_rate": 0.0004978585978708183, "loss": 5.7949, "mean_token_accuracy": 0.16377429962158202, "num_tokens": 10868060.0, "step": 4870 }, { "entropy": 5.783869218826294, "epoch": 0.5475374852586061, "grad_norm": 1.2578125, "learning_rate": 0.0004978530683500267, "loss": 5.7163, "mean_token_accuracy": 0.1670852780342102, "num_tokens": 10879323.0, "step": 4875 }, { "entropy": 5.661490631103516, "epoch": 0.5480990621665637, "grad_norm": 1.2421875, "learning_rate": 0.0004978475317335071, "loss": 5.5598, "mean_token_accuracy": 0.1758361741900444, "num_tokens": 10890545.0, "step": 4880 }, { "entropy": 5.658501005172729, "epoch": 0.5486606390745212, "grad_norm": 1.296875, "learning_rate": 0.0004978419880214356, "loss": 5.6612, "mean_token_accuracy": 0.16851151436567308, "num_tokens": 10900761.0, "step": 4885 }, { "entropy": 5.717454147338867, "epoch": 0.5492222159824788, "grad_norm": 1.2109375, "learning_rate": 0.0004978364372139887, "loss": 5.6471, "mean_token_accuracy": 0.17221338003873826, "num_tokens": 10911874.0, "step": 4890 }, { "entropy": 5.68519868850708, "epoch": 0.5497837928904363, "grad_norm": 1.5859375, "learning_rate": 0.0004978308793113434, "loss": 5.5666, "mean_token_accuracy": 0.1797461986541748, "num_tokens": 10922949.0, "step": 4895 }, { "entropy": 5.734178066253662, "epoch": 0.5503453697983939, "grad_norm": 1.34375, "learning_rate": 0.0004978253143136762, "loss": 5.7637, "mean_token_accuracy": 0.16003435403108596, "num_tokens": 10935415.0, "step": 4900 }, { "entropy": 5.712212610244751, "epoch": 0.5509069467063514, "grad_norm": 1.3515625, "learning_rate": 0.0004978197422211647, "loss": 5.5989, "mean_token_accuracy": 0.1794376477599144, "num_tokens": 10946983.0, "step": 4905 }, { "entropy": 5.645990180969238, "epoch": 0.551468523614309, "grad_norm": 1.453125, "learning_rate": 0.0004978141630339863, "loss": 5.6755, "mean_token_accuracy": 0.16025410294532777, "num_tokens": 10957884.0, "step": 4910 }, { "entropy": 5.732716608047485, "epoch": 0.5520301005222665, "grad_norm": 1.2890625, "learning_rate": 0.0004978085767523184, "loss": 5.6752, "mean_token_accuracy": 0.17449066042900085, "num_tokens": 10968518.0, "step": 4915 }, { "entropy": 5.708969449996948, "epoch": 0.5525916774302241, "grad_norm": 1.3515625, "learning_rate": 0.000497802983376339, "loss": 5.6864, "mean_token_accuracy": 0.16695939302444457, "num_tokens": 10979621.0, "step": 4920 }, { "entropy": 5.764673709869385, "epoch": 0.5531532543381816, "grad_norm": 1.9296875, "learning_rate": 0.0004977973829062263, "loss": 5.619, "mean_token_accuracy": 0.1710394114255905, "num_tokens": 10990158.0, "step": 4925 }, { "entropy": 5.673544979095459, "epoch": 0.5537148312461392, "grad_norm": 1.2734375, "learning_rate": 0.0004977917753421585, "loss": 5.7305, "mean_token_accuracy": 0.16447483003139496, "num_tokens": 11001732.0, "step": 4930 }, { "entropy": 5.843268728256225, "epoch": 0.5542764081540967, "grad_norm": 1.390625, "learning_rate": 0.000497786160684314, "loss": 5.7428, "mean_token_accuracy": 0.1634986564517021, "num_tokens": 11013483.0, "step": 4935 }, { "entropy": 5.796664619445801, "epoch": 0.5548379850620543, "grad_norm": 1.46875, "learning_rate": 0.0004977805389328719, "loss": 5.7391, "mean_token_accuracy": 0.16766392290592194, "num_tokens": 11025423.0, "step": 4940 }, { "entropy": 5.703360080718994, "epoch": 0.5553995619700118, "grad_norm": 1.5078125, "learning_rate": 0.000497774910088011, "loss": 5.5716, "mean_token_accuracy": 0.17025255560874938, "num_tokens": 11037041.0, "step": 4945 }, { "entropy": 5.723888826370239, "epoch": 0.5559611388779694, "grad_norm": 1.1875, "learning_rate": 0.0004977692741499106, "loss": 5.7208, "mean_token_accuracy": 0.16566304564476014, "num_tokens": 11049206.0, "step": 4950 }, { "entropy": 5.74290828704834, "epoch": 0.5565227157859269, "grad_norm": 1.4921875, "learning_rate": 0.00049776363111875, "loss": 5.6884, "mean_token_accuracy": 0.17315239310264588, "num_tokens": 11060407.0, "step": 4955 }, { "entropy": 5.688162040710449, "epoch": 0.5570842926938844, "grad_norm": 1.328125, "learning_rate": 0.0004977579809947091, "loss": 5.6215, "mean_token_accuracy": 0.1681760311126709, "num_tokens": 11071269.0, "step": 4960 }, { "entropy": 5.701694965362549, "epoch": 0.5576458696018419, "grad_norm": 1.59375, "learning_rate": 0.0004977523237779676, "loss": 5.6215, "mean_token_accuracy": 0.17521134316921233, "num_tokens": 11082078.0, "step": 4965 }, { "entropy": 5.906933164596557, "epoch": 0.5582074465097995, "grad_norm": 1.21875, "learning_rate": 0.0004977466594687057, "loss": 5.8526, "mean_token_accuracy": 0.1614489182829857, "num_tokens": 11094596.0, "step": 4970 }, { "entropy": 5.737157964706421, "epoch": 0.558769023417757, "grad_norm": 1.2265625, "learning_rate": 0.0004977409880671039, "loss": 5.7163, "mean_token_accuracy": 0.16220240145921708, "num_tokens": 11107705.0, "step": 4975 }, { "entropy": 5.703377056121826, "epoch": 0.5593306003257146, "grad_norm": 1.3125, "learning_rate": 0.0004977353095733427, "loss": 5.622, "mean_token_accuracy": 0.17367908358573914, "num_tokens": 11118152.0, "step": 4980 }, { "entropy": 5.711778259277343, "epoch": 0.5598921772336721, "grad_norm": 1.7421875, "learning_rate": 0.0004977296239876026, "loss": 5.6611, "mean_token_accuracy": 0.17005926817655564, "num_tokens": 11129261.0, "step": 4985 }, { "entropy": 5.815555191040039, "epoch": 0.5604537541416297, "grad_norm": 1.203125, "learning_rate": 0.000497723931310065, "loss": 5.7661, "mean_token_accuracy": 0.1613462135195732, "num_tokens": 11142227.0, "step": 4990 }, { "entropy": 5.781078052520752, "epoch": 0.5610153310495872, "grad_norm": 1.140625, "learning_rate": 0.0004977182315409111, "loss": 5.6717, "mean_token_accuracy": 0.1686568960547447, "num_tokens": 11154277.0, "step": 4995 }, { "entropy": 5.681065464019776, "epoch": 0.5615769079575448, "grad_norm": 1.3203125, "learning_rate": 0.0004977125246803224, "loss": 5.6813, "mean_token_accuracy": 0.1690026491880417, "num_tokens": 11164902.0, "step": 5000 }, { "entropy": 5.634833431243896, "epoch": 0.5621384848655023, "grad_norm": 1.2578125, "learning_rate": 0.0004977068107284803, "loss": 5.5775, "mean_token_accuracy": 0.16621919125318527, "num_tokens": 11176010.0, "step": 5005 }, { "entropy": 5.798631000518799, "epoch": 0.5627000617734599, "grad_norm": 1.375, "learning_rate": 0.0004977010896855672, "loss": 5.6064, "mean_token_accuracy": 0.17368722558021546, "num_tokens": 11187773.0, "step": 5010 }, { "entropy": 5.680552387237549, "epoch": 0.5632616386814174, "grad_norm": 1.1328125, "learning_rate": 0.0004976953615517649, "loss": 5.6802, "mean_token_accuracy": 0.17477964162826537, "num_tokens": 11198420.0, "step": 5015 }, { "entropy": 5.5892163753509525, "epoch": 0.563823215589375, "grad_norm": 2.109375, "learning_rate": 0.000497689626327256, "loss": 5.4906, "mean_token_accuracy": 0.17867352068424225, "num_tokens": 11208553.0, "step": 5020 }, { "entropy": 5.70281949043274, "epoch": 0.5643847924973325, "grad_norm": 1.4921875, "learning_rate": 0.000497683884012223, "loss": 5.6524, "mean_token_accuracy": 0.1714022785425186, "num_tokens": 11219737.0, "step": 5025 }, { "entropy": 5.650163793563843, "epoch": 0.5649463694052901, "grad_norm": 1.265625, "learning_rate": 0.0004976781346068487, "loss": 5.6602, "mean_token_accuracy": 0.16621274948120118, "num_tokens": 11230997.0, "step": 5030 }, { "entropy": 5.775289058685303, "epoch": 0.5655079463132476, "grad_norm": 1.21875, "learning_rate": 0.0004976723781113163, "loss": 5.658, "mean_token_accuracy": 0.17257270216941833, "num_tokens": 11242338.0, "step": 5035 }, { "entropy": 5.775376224517823, "epoch": 0.5660695232212052, "grad_norm": 1.328125, "learning_rate": 0.0004976666145258089, "loss": 5.6957, "mean_token_accuracy": 0.17020781189203263, "num_tokens": 11252671.0, "step": 5040 }, { "entropy": 5.555762767791748, "epoch": 0.5666311001291627, "grad_norm": 1.25, "learning_rate": 0.0004976608438505103, "loss": 5.5207, "mean_token_accuracy": 0.17949869185686113, "num_tokens": 11262721.0, "step": 5045 }, { "entropy": 5.700231218338013, "epoch": 0.5671926770371203, "grad_norm": 1.296875, "learning_rate": 0.0004976550660856041, "loss": 5.7102, "mean_token_accuracy": 0.16806024610996245, "num_tokens": 11274074.0, "step": 5050 }, { "entropy": 5.789868927001953, "epoch": 0.5677542539450777, "grad_norm": 1.1328125, "learning_rate": 0.000497649281231274, "loss": 5.6467, "mean_token_accuracy": 0.1738978683948517, "num_tokens": 11286051.0, "step": 5055 }, { "entropy": 5.801263046264649, "epoch": 0.5683158308530353, "grad_norm": 1.2421875, "learning_rate": 0.0004976434892877046, "loss": 5.7707, "mean_token_accuracy": 0.16562236547470094, "num_tokens": 11298841.0, "step": 5060 }, { "entropy": 5.760428190231323, "epoch": 0.5688774077609928, "grad_norm": 1.359375, "learning_rate": 0.0004976376902550802, "loss": 5.7601, "mean_token_accuracy": 0.1714622288942337, "num_tokens": 11309898.0, "step": 5065 }, { "entropy": 5.770657253265381, "epoch": 0.5694389846689504, "grad_norm": 1.2578125, "learning_rate": 0.0004976318841335854, "loss": 5.7862, "mean_token_accuracy": 0.16856923401355745, "num_tokens": 11322163.0, "step": 5070 }, { "entropy": 5.779578781127929, "epoch": 0.5700005615769079, "grad_norm": 1.3359375, "learning_rate": 0.0004976260709234049, "loss": 5.7287, "mean_token_accuracy": 0.165048947930336, "num_tokens": 11333405.0, "step": 5075 }, { "entropy": 5.838383293151855, "epoch": 0.5705621384848655, "grad_norm": 1.1875, "learning_rate": 0.000497620250624724, "loss": 5.7896, "mean_token_accuracy": 0.16699133217334747, "num_tokens": 11345037.0, "step": 5080 }, { "entropy": 5.788431072235108, "epoch": 0.571123715392823, "grad_norm": 1.40625, "learning_rate": 0.000497614423237728, "loss": 5.7095, "mean_token_accuracy": 0.16881436556577684, "num_tokens": 11356403.0, "step": 5085 }, { "entropy": 5.6463860988616945, "epoch": 0.5716852923007806, "grad_norm": 2.15625, "learning_rate": 0.0004976085887626026, "loss": 5.6361, "mean_token_accuracy": 0.1750362992286682, "num_tokens": 11367913.0, "step": 5090 }, { "entropy": 5.6775815963745115, "epoch": 0.5722468692087381, "grad_norm": 1.359375, "learning_rate": 0.0004976027471995331, "loss": 5.6461, "mean_token_accuracy": 0.17520785629749297, "num_tokens": 11378519.0, "step": 5095 }, { "entropy": 5.759826040267944, "epoch": 0.5728084461166957, "grad_norm": 1.3203125, "learning_rate": 0.000497596898548706, "loss": 5.6073, "mean_token_accuracy": 0.17434988915920258, "num_tokens": 11389530.0, "step": 5100 }, { "entropy": 5.59257664680481, "epoch": 0.5733700230246532, "grad_norm": 1.46875, "learning_rate": 0.0004975910428103072, "loss": 5.5348, "mean_token_accuracy": 0.17843396216630936, "num_tokens": 11400468.0, "step": 5105 }, { "entropy": 5.500880479812622, "epoch": 0.5739315999326108, "grad_norm": 1.7578125, "learning_rate": 0.0004975851799845233, "loss": 5.544, "mean_token_accuracy": 0.1740495353937149, "num_tokens": 11411242.0, "step": 5110 }, { "entropy": 5.757795429229736, "epoch": 0.5744931768405683, "grad_norm": 1.375, "learning_rate": 0.000497579310071541, "loss": 5.6211, "mean_token_accuracy": 0.17112922221422194, "num_tokens": 11420909.0, "step": 5115 }, { "entropy": 5.599933767318726, "epoch": 0.5750547537485259, "grad_norm": 1.375, "learning_rate": 0.0004975734330715471, "loss": 5.5078, "mean_token_accuracy": 0.17252909243106843, "num_tokens": 11431791.0, "step": 5120 }, { "entropy": 5.802357625961304, "epoch": 0.5756163306564834, "grad_norm": 1.3203125, "learning_rate": 0.0004975675489847287, "loss": 5.7397, "mean_token_accuracy": 0.16458898186683654, "num_tokens": 11443056.0, "step": 5125 }, { "entropy": 5.745362329483032, "epoch": 0.576177907564441, "grad_norm": 1.34375, "learning_rate": 0.0004975616578112734, "loss": 5.7048, "mean_token_accuracy": 0.17184705585241317, "num_tokens": 11453413.0, "step": 5130 }, { "entropy": 5.848228311538696, "epoch": 0.5767394844723985, "grad_norm": 1.3828125, "learning_rate": 0.0004975557595513684, "loss": 5.9266, "mean_token_accuracy": 0.15690554976463317, "num_tokens": 11465457.0, "step": 5135 }, { "entropy": 5.914571619033813, "epoch": 0.5773010613803561, "grad_norm": 1.328125, "learning_rate": 0.0004975498542052018, "loss": 5.7023, "mean_token_accuracy": 0.1729892149567604, "num_tokens": 11476899.0, "step": 5140 }, { "entropy": 5.682943296432495, "epoch": 0.5778626382883136, "grad_norm": 1.4375, "learning_rate": 0.0004975439417729615, "loss": 5.6611, "mean_token_accuracy": 0.17298050820827485, "num_tokens": 11488652.0, "step": 5145 }, { "entropy": 5.711069393157959, "epoch": 0.5784242151962711, "grad_norm": 1.3203125, "learning_rate": 0.0004975380222548358, "loss": 5.7013, "mean_token_accuracy": 0.16747490912675858, "num_tokens": 11499540.0, "step": 5150 }, { "entropy": 5.864771842956543, "epoch": 0.5789857921042286, "grad_norm": 1.328125, "learning_rate": 0.0004975320956510131, "loss": 5.7277, "mean_token_accuracy": 0.17383481860160827, "num_tokens": 11511156.0, "step": 5155 }, { "entropy": 5.793862915039062, "epoch": 0.5795473690121862, "grad_norm": 1.203125, "learning_rate": 0.0004975261619616822, "loss": 5.7969, "mean_token_accuracy": 0.16044799983501434, "num_tokens": 11523489.0, "step": 5160 }, { "entropy": 5.701024532318115, "epoch": 0.5801089459201437, "grad_norm": 1.203125, "learning_rate": 0.0004975202211870321, "loss": 5.62, "mean_token_accuracy": 0.16963277608156205, "num_tokens": 11534497.0, "step": 5165 }, { "entropy": 5.849947166442871, "epoch": 0.5806705228281013, "grad_norm": 1.3515625, "learning_rate": 0.0004975142733272518, "loss": 5.7043, "mean_token_accuracy": 0.16341470927000046, "num_tokens": 11545585.0, "step": 5170 }, { "entropy": 5.594762372970581, "epoch": 0.5812320997360588, "grad_norm": 1.2109375, "learning_rate": 0.0004975083183825306, "loss": 5.553, "mean_token_accuracy": 0.17195095419883727, "num_tokens": 11556278.0, "step": 5175 }, { "entropy": 5.634889745712281, "epoch": 0.5817936766440164, "grad_norm": 1.21875, "learning_rate": 0.0004975023563530584, "loss": 5.6343, "mean_token_accuracy": 0.17483613938093184, "num_tokens": 11568358.0, "step": 5180 }, { "entropy": 5.6792529106140135, "epoch": 0.5823552535519739, "grad_norm": 1.28125, "learning_rate": 0.0004974963872390249, "loss": 5.6092, "mean_token_accuracy": 0.17366641908884048, "num_tokens": 11579777.0, "step": 5185 }, { "entropy": 5.678589296340943, "epoch": 0.5829168304599315, "grad_norm": 1.3046875, "learning_rate": 0.00049749041104062, "loss": 5.6641, "mean_token_accuracy": 0.1732245460152626, "num_tokens": 11591479.0, "step": 5190 }, { "entropy": 5.741658306121826, "epoch": 0.583478407367889, "grad_norm": 1.4375, "learning_rate": 0.0004974844277580343, "loss": 5.6151, "mean_token_accuracy": 0.1689417690038681, "num_tokens": 11601452.0, "step": 5195 }, { "entropy": 5.639203977584839, "epoch": 0.5840399842758466, "grad_norm": 1.484375, "learning_rate": 0.0004974784373914579, "loss": 5.479, "mean_token_accuracy": 0.1778860330581665, "num_tokens": 11611661.0, "step": 5200 }, { "entropy": 5.637208557128906, "epoch": 0.5846015611838041, "grad_norm": 1.609375, "learning_rate": 0.0004974724399410818, "loss": 5.662, "mean_token_accuracy": 0.16758041232824325, "num_tokens": 11622940.0, "step": 5205 }, { "entropy": 5.700867700576782, "epoch": 0.5851631380917617, "grad_norm": 1.3125, "learning_rate": 0.0004974664354070971, "loss": 5.6744, "mean_token_accuracy": 0.17014639526605607, "num_tokens": 11634290.0, "step": 5210 }, { "entropy": 5.802171611785889, "epoch": 0.5857247149997192, "grad_norm": 1.390625, "learning_rate": 0.0004974604237896947, "loss": 5.7173, "mean_token_accuracy": 0.16413109749555588, "num_tokens": 11645812.0, "step": 5215 }, { "entropy": 5.730967092514038, "epoch": 0.5862862919076768, "grad_norm": 1.2734375, "learning_rate": 0.0004974544050890662, "loss": 5.711, "mean_token_accuracy": 0.16343657672405243, "num_tokens": 11657520.0, "step": 5220 }, { "entropy": 5.6769603252410885, "epoch": 0.5868478688156343, "grad_norm": 1.328125, "learning_rate": 0.000497448379305403, "loss": 5.567, "mean_token_accuracy": 0.17653037905693053, "num_tokens": 11666887.0, "step": 5225 }, { "entropy": 5.796042203903198, "epoch": 0.5874094457235919, "grad_norm": 1.484375, "learning_rate": 0.0004974423464388973, "loss": 5.7423, "mean_token_accuracy": 0.16953345388174057, "num_tokens": 11677337.0, "step": 5230 }, { "entropy": 5.756515645980835, "epoch": 0.5879710226315494, "grad_norm": 1.453125, "learning_rate": 0.000497436306489741, "loss": 5.6623, "mean_token_accuracy": 0.17309503853321076, "num_tokens": 11688203.0, "step": 5235 }, { "entropy": 5.702898836135864, "epoch": 0.588532599539507, "grad_norm": 1.3359375, "learning_rate": 0.0004974302594581264, "loss": 5.702, "mean_token_accuracy": 0.16658136248588562, "num_tokens": 11699727.0, "step": 5240 }, { "entropy": 5.732393646240235, "epoch": 0.5890941764474645, "grad_norm": 1.4296875, "learning_rate": 0.0004974242053442461, "loss": 5.7085, "mean_token_accuracy": 0.16990188509225845, "num_tokens": 11710956.0, "step": 5245 }, { "entropy": 5.743574380874634, "epoch": 0.589655753355422, "grad_norm": 1.21875, "learning_rate": 0.0004974181441482927, "loss": 5.5437, "mean_token_accuracy": 0.17698764950037002, "num_tokens": 11721681.0, "step": 5250 }, { "entropy": 5.713166904449463, "epoch": 0.5902173302633795, "grad_norm": 1.4375, "learning_rate": 0.0004974120758704595, "loss": 5.6719, "mean_token_accuracy": 0.16816408634185792, "num_tokens": 11731679.0, "step": 5255 }, { "entropy": 5.8048162937164305, "epoch": 0.5907789071713371, "grad_norm": 1.53125, "learning_rate": 0.0004974060005109394, "loss": 5.8048, "mean_token_accuracy": 0.1657121554017067, "num_tokens": 11743953.0, "step": 5260 }, { "entropy": 5.6638165473937985, "epoch": 0.5913404840792946, "grad_norm": 1.3125, "learning_rate": 0.000497399918069926, "loss": 5.5795, "mean_token_accuracy": 0.17744518518447877, "num_tokens": 11754091.0, "step": 5265 }, { "entropy": 5.639192199707031, "epoch": 0.5919020609872522, "grad_norm": 1.5859375, "learning_rate": 0.0004973938285476131, "loss": 5.6066, "mean_token_accuracy": 0.1745060995221138, "num_tokens": 11764771.0, "step": 5270 }, { "entropy": 5.734188079833984, "epoch": 0.5924636378952097, "grad_norm": 1.3125, "learning_rate": 0.0004973877319441943, "loss": 5.6757, "mean_token_accuracy": 0.16847294121980666, "num_tokens": 11776287.0, "step": 5275 }, { "entropy": 5.747639417648315, "epoch": 0.5930252148031673, "grad_norm": 1.4609375, "learning_rate": 0.0004973816282598639, "loss": 5.6861, "mean_token_accuracy": 0.16214133352041243, "num_tokens": 11787142.0, "step": 5280 }, { "entropy": 5.72074031829834, "epoch": 0.5935867917111248, "grad_norm": 1.3359375, "learning_rate": 0.0004973755174948162, "loss": 5.6593, "mean_token_accuracy": 0.16755084693431854, "num_tokens": 11798966.0, "step": 5285 }, { "entropy": 5.771004104614258, "epoch": 0.5941483686190824, "grad_norm": 1.3515625, "learning_rate": 0.0004973693996492458, "loss": 5.7396, "mean_token_accuracy": 0.16607423722743989, "num_tokens": 11810529.0, "step": 5290 }, { "entropy": 5.65753321647644, "epoch": 0.5947099455270399, "grad_norm": 1.296875, "learning_rate": 0.0004973632747233475, "loss": 5.584, "mean_token_accuracy": 0.1776696190237999, "num_tokens": 11821965.0, "step": 5295 }, { "entropy": 5.7572873592376705, "epoch": 0.5952715224349975, "grad_norm": 1.2890625, "learning_rate": 0.0004973571427173163, "loss": 5.7412, "mean_token_accuracy": 0.1662243828177452, "num_tokens": 11833936.0, "step": 5300 }, { "entropy": 5.793422603607178, "epoch": 0.595833099342955, "grad_norm": 1.28125, "learning_rate": 0.0004973510036313473, "loss": 5.6572, "mean_token_accuracy": 0.17151601612567902, "num_tokens": 11845245.0, "step": 5305 }, { "entropy": 5.701361179351807, "epoch": 0.5963946762509126, "grad_norm": 1.359375, "learning_rate": 0.0004973448574656362, "loss": 5.6248, "mean_token_accuracy": 0.17118371576070784, "num_tokens": 11856010.0, "step": 5310 }, { "entropy": 5.748444557189941, "epoch": 0.5969562531588701, "grad_norm": 1.5546875, "learning_rate": 0.0004973387042203786, "loss": 5.7801, "mean_token_accuracy": 0.16333963572978974, "num_tokens": 11866194.0, "step": 5315 }, { "entropy": 5.785281944274902, "epoch": 0.5975178300668277, "grad_norm": 1.3359375, "learning_rate": 0.0004973325438957704, "loss": 5.6244, "mean_token_accuracy": 0.170792356133461, "num_tokens": 11877224.0, "step": 5320 }, { "entropy": 5.662514305114746, "epoch": 0.5980794069747852, "grad_norm": 1.3984375, "learning_rate": 0.0004973263764920079, "loss": 5.5478, "mean_token_accuracy": 0.17639639377593994, "num_tokens": 11887410.0, "step": 5325 }, { "entropy": 5.627243566513061, "epoch": 0.5986409838827428, "grad_norm": 1.2578125, "learning_rate": 0.0004973202020092871, "loss": 5.7129, "mean_token_accuracy": 0.1726754367351532, "num_tokens": 11898816.0, "step": 5330 }, { "entropy": 5.750458002090454, "epoch": 0.5992025607907003, "grad_norm": 1.6484375, "learning_rate": 0.000497314020447805, "loss": 5.6623, "mean_token_accuracy": 0.16915512531995774, "num_tokens": 11909220.0, "step": 5335 }, { "entropy": 5.7871287822723385, "epoch": 0.5997641376986579, "grad_norm": 1.4296875, "learning_rate": 0.0004973078318077583, "loss": 5.6694, "mean_token_accuracy": 0.16608534008264542, "num_tokens": 11919584.0, "step": 5340 }, { "entropy": 5.664968776702881, "epoch": 0.6003257146066153, "grad_norm": 1.2734375, "learning_rate": 0.000497301636089344, "loss": 5.6782, "mean_token_accuracy": 0.16855976581573487, "num_tokens": 11929298.0, "step": 5345 }, { "entropy": 5.701796770095825, "epoch": 0.6008872915145729, "grad_norm": 1.40625, "learning_rate": 0.0004972954332927592, "loss": 5.6465, "mean_token_accuracy": 0.17208643406629562, "num_tokens": 11939809.0, "step": 5350 }, { "entropy": 5.727794981002807, "epoch": 0.6014488684225304, "grad_norm": 1.5234375, "learning_rate": 0.0004972892234182018, "loss": 5.541, "mean_token_accuracy": 0.1775716796517372, "num_tokens": 11950292.0, "step": 5355 }, { "entropy": 5.610636901855469, "epoch": 0.602010445330488, "grad_norm": 1.4140625, "learning_rate": 0.0004972830064658692, "loss": 5.568, "mean_token_accuracy": 0.17599292993545532, "num_tokens": 11961774.0, "step": 5360 }, { "entropy": 5.764124965667724, "epoch": 0.6025720222384455, "grad_norm": 1.484375, "learning_rate": 0.0004972767824359596, "loss": 5.6824, "mean_token_accuracy": 0.16461727768182755, "num_tokens": 11973351.0, "step": 5365 }, { "entropy": 5.664096021652222, "epoch": 0.6031335991464031, "grad_norm": 1.5546875, "learning_rate": 0.0004972705513286709, "loss": 5.5476, "mean_token_accuracy": 0.178704696893692, "num_tokens": 11984472.0, "step": 5370 }, { "entropy": 5.647040939331054, "epoch": 0.6036951760543606, "grad_norm": 1.328125, "learning_rate": 0.0004972643131442017, "loss": 5.6518, "mean_token_accuracy": 0.17527108937501906, "num_tokens": 11994271.0, "step": 5375 }, { "entropy": 5.860633420944214, "epoch": 0.6042567529623182, "grad_norm": 1.3984375, "learning_rate": 0.0004972580678827506, "loss": 5.7576, "mean_token_accuracy": 0.16238637864589692, "num_tokens": 12007647.0, "step": 5380 }, { "entropy": 5.786860418319702, "epoch": 0.6048183298702757, "grad_norm": 1.2109375, "learning_rate": 0.0004972518155445163, "loss": 5.7092, "mean_token_accuracy": 0.16535102427005768, "num_tokens": 12020331.0, "step": 5385 }, { "entropy": 5.657439231872559, "epoch": 0.6053799067782333, "grad_norm": 2.59375, "learning_rate": 0.0004972455561296982, "loss": 5.7088, "mean_token_accuracy": 0.16050323843955994, "num_tokens": 12031616.0, "step": 5390 }, { "entropy": 5.811110305786133, "epoch": 0.6059414836861908, "grad_norm": 1.6015625, "learning_rate": 0.0004972392896384952, "loss": 5.6699, "mean_token_accuracy": 0.1691645324230194, "num_tokens": 12044107.0, "step": 5395 }, { "entropy": 5.748564100265503, "epoch": 0.6065030605941484, "grad_norm": 1.46875, "learning_rate": 0.0004972330160711071, "loss": 5.6608, "mean_token_accuracy": 0.17236095368862153, "num_tokens": 12055747.0, "step": 5400 }, { "entropy": 5.757844591140747, "epoch": 0.6070646375021059, "grad_norm": 1.25, "learning_rate": 0.0004972267354277336, "loss": 5.6581, "mean_token_accuracy": 0.17029646039009094, "num_tokens": 12067849.0, "step": 5405 }, { "entropy": 5.722942781448364, "epoch": 0.6076262144100635, "grad_norm": 1.265625, "learning_rate": 0.0004972204477085746, "loss": 5.6759, "mean_token_accuracy": 0.16894526779651642, "num_tokens": 12078534.0, "step": 5410 }, { "entropy": 5.657567405700684, "epoch": 0.608187791318021, "grad_norm": 1.3125, "learning_rate": 0.0004972141529138303, "loss": 5.6041, "mean_token_accuracy": 0.17073164135217667, "num_tokens": 12089534.0, "step": 5415 }, { "entropy": 5.70810079574585, "epoch": 0.6087493682259786, "grad_norm": 1.1796875, "learning_rate": 0.0004972078510437013, "loss": 5.5066, "mean_token_accuracy": 0.18743069767951964, "num_tokens": 12099513.0, "step": 5420 }, { "entropy": 5.70379114151001, "epoch": 0.6093109451339361, "grad_norm": 1.4921875, "learning_rate": 0.0004972015420983882, "loss": 5.712, "mean_token_accuracy": 0.17635903805494307, "num_tokens": 12110106.0, "step": 5425 }, { "entropy": 5.705994033813477, "epoch": 0.6098725220418937, "grad_norm": 1.3359375, "learning_rate": 0.0004971952260780915, "loss": 5.604, "mean_token_accuracy": 0.1767367586493492, "num_tokens": 12121302.0, "step": 5430 }, { "entropy": 5.692618274688721, "epoch": 0.6104340989498512, "grad_norm": 1.328125, "learning_rate": 0.000497188902983013, "loss": 5.6502, "mean_token_accuracy": 0.17055889666080476, "num_tokens": 12132879.0, "step": 5435 }, { "entropy": 5.642355585098267, "epoch": 0.6109956758578087, "grad_norm": 1.5859375, "learning_rate": 0.0004971825728133535, "loss": 5.5734, "mean_token_accuracy": 0.17844846993684768, "num_tokens": 12143597.0, "step": 5440 }, { "entropy": 5.729561996459961, "epoch": 0.6115572527657662, "grad_norm": 1.2734375, "learning_rate": 0.0004971762355693146, "loss": 5.6705, "mean_token_accuracy": 0.17112083733081818, "num_tokens": 12156036.0, "step": 5445 }, { "entropy": 5.774557399749756, "epoch": 0.6121188296737238, "grad_norm": 1.4453125, "learning_rate": 0.0004971698912510983, "loss": 5.6849, "mean_token_accuracy": 0.1741700991988182, "num_tokens": 12167305.0, "step": 5450 }, { "entropy": 5.718290376663208, "epoch": 0.6126804065816813, "grad_norm": 1.3125, "learning_rate": 0.0004971635398589066, "loss": 5.6458, "mean_token_accuracy": 0.17421892285346985, "num_tokens": 12176772.0, "step": 5455 }, { "entropy": 5.706922245025635, "epoch": 0.6132419834896389, "grad_norm": 1.359375, "learning_rate": 0.0004971571813929415, "loss": 5.6452, "mean_token_accuracy": 0.17209067046642304, "num_tokens": 12187852.0, "step": 5460 }, { "entropy": 5.790262699127197, "epoch": 0.6138035603975964, "grad_norm": 1.359375, "learning_rate": 0.0004971508158534056, "loss": 5.7057, "mean_token_accuracy": 0.17010461091995238, "num_tokens": 12198574.0, "step": 5465 }, { "entropy": 5.622075748443604, "epoch": 0.614365137305554, "grad_norm": 1.65625, "learning_rate": 0.0004971444432405015, "loss": 5.4607, "mean_token_accuracy": 0.18198293149471284, "num_tokens": 12209463.0, "step": 5470 }, { "entropy": 5.731533527374268, "epoch": 0.6149267142135115, "grad_norm": 1.1640625, "learning_rate": 0.0004971380635544323, "loss": 5.7366, "mean_token_accuracy": 0.16922779083251954, "num_tokens": 12220993.0, "step": 5475 }, { "entropy": 5.730971240997315, "epoch": 0.6154882911214691, "grad_norm": 1.421875, "learning_rate": 0.0004971316767954009, "loss": 5.6102, "mean_token_accuracy": 0.17507601529359818, "num_tokens": 12232648.0, "step": 5480 }, { "entropy": 5.736530876159668, "epoch": 0.6160498680294266, "grad_norm": 1.625, "learning_rate": 0.0004971252829636108, "loss": 5.65, "mean_token_accuracy": 0.17610020488500594, "num_tokens": 12243931.0, "step": 5485 }, { "entropy": 5.787777423858643, "epoch": 0.6166114449373842, "grad_norm": 1.3984375, "learning_rate": 0.0004971188820592656, "loss": 5.6509, "mean_token_accuracy": 0.17270122319459916, "num_tokens": 12254821.0, "step": 5490 }, { "entropy": 5.583421754837036, "epoch": 0.6171730218453417, "grad_norm": 1.203125, "learning_rate": 0.000497112474082569, "loss": 5.6572, "mean_token_accuracy": 0.17220793664455414, "num_tokens": 12265440.0, "step": 5495 }, { "entropy": 5.727280187606811, "epoch": 0.6177345987532993, "grad_norm": 1.3671875, "learning_rate": 0.000497106059033725, "loss": 5.6329, "mean_token_accuracy": 0.17365415692329406, "num_tokens": 12276636.0, "step": 5500 }, { "entropy": 5.766627502441406, "epoch": 0.6182961756612568, "grad_norm": 1.265625, "learning_rate": 0.0004970996369129381, "loss": 5.5133, "mean_token_accuracy": 0.17947188764810562, "num_tokens": 12287404.0, "step": 5505 }, { "entropy": 5.672186088562012, "epoch": 0.6188577525692144, "grad_norm": 1.2578125, "learning_rate": 0.0004970932077204125, "loss": 5.7397, "mean_token_accuracy": 0.1642993837594986, "num_tokens": 12299283.0, "step": 5510 }, { "entropy": 5.666852855682373, "epoch": 0.6194193294771719, "grad_norm": 1.296875, "learning_rate": 0.000497086771456353, "loss": 5.6404, "mean_token_accuracy": 0.16676075011491776, "num_tokens": 12310281.0, "step": 5515 }, { "entropy": 5.804997062683105, "epoch": 0.6199809063851295, "grad_norm": 1.203125, "learning_rate": 0.0004970803281209646, "loss": 5.6661, "mean_token_accuracy": 0.17195305079221726, "num_tokens": 12320839.0, "step": 5520 }, { "entropy": 5.676700162887573, "epoch": 0.620542483293087, "grad_norm": 1.4609375, "learning_rate": 0.0004970738777144524, "loss": 5.6211, "mean_token_accuracy": 0.17245084047317505, "num_tokens": 12332845.0, "step": 5525 }, { "entropy": 5.554922676086425, "epoch": 0.6211040602010446, "grad_norm": 1.4296875, "learning_rate": 0.0004970674202370218, "loss": 5.5204, "mean_token_accuracy": 0.1806936517357826, "num_tokens": 12343327.0, "step": 5530 }, { "entropy": 5.72095046043396, "epoch": 0.621665637109002, "grad_norm": 1.6328125, "learning_rate": 0.0004970609556888785, "loss": 5.6445, "mean_token_accuracy": 0.17047364860773087, "num_tokens": 12353224.0, "step": 5535 }, { "entropy": 5.682199335098266, "epoch": 0.6222272140169596, "grad_norm": 1.3828125, "learning_rate": 0.0004970544840702282, "loss": 5.5634, "mean_token_accuracy": 0.17255714684724807, "num_tokens": 12363981.0, "step": 5540 }, { "entropy": 5.584892797470093, "epoch": 0.6227887909249171, "grad_norm": 1.3671875, "learning_rate": 0.0004970480053812771, "loss": 5.5853, "mean_token_accuracy": 0.1800747200846672, "num_tokens": 12374769.0, "step": 5545 }, { "entropy": 5.814059019088745, "epoch": 0.6233503678328747, "grad_norm": 1.1953125, "learning_rate": 0.0004970415196222312, "loss": 5.8038, "mean_token_accuracy": 0.16921334117650985, "num_tokens": 12387247.0, "step": 5550 }, { "entropy": 5.793169641494751, "epoch": 0.6239119447408322, "grad_norm": 1.2578125, "learning_rate": 0.0004970350267932973, "loss": 5.6566, "mean_token_accuracy": 0.17780971080064772, "num_tokens": 12398347.0, "step": 5555 }, { "entropy": 5.531301593780517, "epoch": 0.6244735216487898, "grad_norm": 1.3203125, "learning_rate": 0.000497028526894682, "loss": 5.5502, "mean_token_accuracy": 0.17427618205547332, "num_tokens": 12409763.0, "step": 5560 }, { "entropy": 5.740422582626342, "epoch": 0.6250350985567473, "grad_norm": 1.2578125, "learning_rate": 0.0004970220199265923, "loss": 5.6429, "mean_token_accuracy": 0.17239355593919753, "num_tokens": 12420658.0, "step": 5565 }, { "entropy": 5.830804109573364, "epoch": 0.6255966754647049, "grad_norm": 1.390625, "learning_rate": 0.0004970155058892354, "loss": 5.7334, "mean_token_accuracy": 0.16390733271837235, "num_tokens": 12433959.0, "step": 5570 }, { "entropy": 5.738416051864624, "epoch": 0.6261582523726624, "grad_norm": 1.5, "learning_rate": 0.0004970089847828187, "loss": 5.7218, "mean_token_accuracy": 0.16629742383956908, "num_tokens": 12444756.0, "step": 5575 }, { "entropy": 5.73380479812622, "epoch": 0.62671982928062, "grad_norm": 1.6875, "learning_rate": 0.0004970024566075497, "loss": 5.6352, "mean_token_accuracy": 0.17590337246656418, "num_tokens": 12456114.0, "step": 5580 }, { "entropy": 5.736455249786377, "epoch": 0.6272814061885775, "grad_norm": 1.3515625, "learning_rate": 0.0004969959213636365, "loss": 5.6718, "mean_token_accuracy": 0.17344282269477845, "num_tokens": 12466927.0, "step": 5585 }, { "entropy": 5.701116847991943, "epoch": 0.6278429830965351, "grad_norm": 1.3828125, "learning_rate": 0.0004969893790512871, "loss": 5.723, "mean_token_accuracy": 0.16070540398359298, "num_tokens": 12477834.0, "step": 5590 }, { "entropy": 5.750099849700928, "epoch": 0.6284045600044926, "grad_norm": 1.265625, "learning_rate": 0.0004969828296707097, "loss": 5.6247, "mean_token_accuracy": 0.1745440736413002, "num_tokens": 12488219.0, "step": 5595 }, { "entropy": 5.8359832763671875, "epoch": 0.6289661369124502, "grad_norm": 1.140625, "learning_rate": 0.0004969762732221129, "loss": 5.7385, "mean_token_accuracy": 0.17294516116380693, "num_tokens": 12498947.0, "step": 5600 }, { "entropy": 5.66269965171814, "epoch": 0.6295277138204077, "grad_norm": 1.3671875, "learning_rate": 0.0004969697097057054, "loss": 5.6343, "mean_token_accuracy": 0.1720503583550453, "num_tokens": 12510142.0, "step": 5605 }, { "entropy": 5.79200439453125, "epoch": 0.6300892907283653, "grad_norm": 1.2421875, "learning_rate": 0.0004969631391216964, "loss": 5.6472, "mean_token_accuracy": 0.1704936742782593, "num_tokens": 12521350.0, "step": 5610 }, { "entropy": 5.521368408203125, "epoch": 0.6306508676363228, "grad_norm": 1.3046875, "learning_rate": 0.0004969565614702948, "loss": 5.4855, "mean_token_accuracy": 0.1774906650185585, "num_tokens": 12532579.0, "step": 5615 }, { "entropy": 5.734045362472534, "epoch": 0.6312124445442804, "grad_norm": 1.34375, "learning_rate": 0.0004969499767517104, "loss": 5.6044, "mean_token_accuracy": 0.17279993891716003, "num_tokens": 12542885.0, "step": 5620 }, { "entropy": 5.80007586479187, "epoch": 0.6317740214522379, "grad_norm": 1.1875, "learning_rate": 0.0004969433849661525, "loss": 5.7554, "mean_token_accuracy": 0.1622144266963005, "num_tokens": 12554881.0, "step": 5625 }, { "entropy": 5.737228202819824, "epoch": 0.6323355983601955, "grad_norm": 1.71875, "learning_rate": 0.0004969367861138313, "loss": 5.6993, "mean_token_accuracy": 0.16859257966279984, "num_tokens": 12564626.0, "step": 5630 }, { "entropy": 5.745629692077637, "epoch": 0.6328971752681529, "grad_norm": 1.3984375, "learning_rate": 0.0004969301801949565, "loss": 5.5502, "mean_token_accuracy": 0.17777176648378373, "num_tokens": 12576180.0, "step": 5635 }, { "entropy": 5.658581924438477, "epoch": 0.6334587521761105, "grad_norm": 1.234375, "learning_rate": 0.000496923567209739, "loss": 5.6427, "mean_token_accuracy": 0.16927312016487123, "num_tokens": 12587487.0, "step": 5640 }, { "entropy": 5.788752126693725, "epoch": 0.634020329084068, "grad_norm": 1.5078125, "learning_rate": 0.0004969169471583889, "loss": 5.7908, "mean_token_accuracy": 0.16504471004009247, "num_tokens": 12598268.0, "step": 5645 }, { "entropy": 5.807561635971069, "epoch": 0.6345819059920256, "grad_norm": 1.234375, "learning_rate": 0.0004969103200411171, "loss": 5.6686, "mean_token_accuracy": 0.1691132053732872, "num_tokens": 12609287.0, "step": 5650 }, { "entropy": 5.669478559494019, "epoch": 0.6351434828999831, "grad_norm": 1.6015625, "learning_rate": 0.0004969036858581346, "loss": 5.5726, "mean_token_accuracy": 0.17225826978683473, "num_tokens": 12620317.0, "step": 5655 }, { "entropy": 5.70239109992981, "epoch": 0.6357050598079407, "grad_norm": 1.484375, "learning_rate": 0.0004968970446096527, "loss": 5.6395, "mean_token_accuracy": 0.17853050231933593, "num_tokens": 12631420.0, "step": 5660 }, { "entropy": 5.694774198532104, "epoch": 0.6362666367158982, "grad_norm": 1.3984375, "learning_rate": 0.000496890396295883, "loss": 5.5798, "mean_token_accuracy": 0.1807517871260643, "num_tokens": 12641319.0, "step": 5665 }, { "entropy": 5.760483884811402, "epoch": 0.6368282136238558, "grad_norm": 1.6328125, "learning_rate": 0.0004968837409170368, "loss": 5.6805, "mean_token_accuracy": 0.1660526767373085, "num_tokens": 12651662.0, "step": 5670 }, { "entropy": 5.768562316894531, "epoch": 0.6373897905318133, "grad_norm": 1.3828125, "learning_rate": 0.0004968770784733263, "loss": 5.7284, "mean_token_accuracy": 0.1657192662358284, "num_tokens": 12663488.0, "step": 5675 }, { "entropy": 5.687350702285767, "epoch": 0.6379513674397709, "grad_norm": 2.1875, "learning_rate": 0.0004968704089649636, "loss": 5.6362, "mean_token_accuracy": 0.1720639333128929, "num_tokens": 12675848.0, "step": 5680 }, { "entropy": 5.735997581481934, "epoch": 0.6385129443477284, "grad_norm": 1.4921875, "learning_rate": 0.0004968637323921611, "loss": 5.6178, "mean_token_accuracy": 0.1734489381313324, "num_tokens": 12686541.0, "step": 5685 }, { "entropy": 5.710645627975464, "epoch": 0.639074521255686, "grad_norm": 1.546875, "learning_rate": 0.0004968570487551312, "loss": 5.6499, "mean_token_accuracy": 0.17180876433849335, "num_tokens": 12698001.0, "step": 5690 }, { "entropy": 5.720677328109741, "epoch": 0.6396360981636435, "grad_norm": 1.40625, "learning_rate": 0.0004968503580540869, "loss": 5.6477, "mean_token_accuracy": 0.1650005429983139, "num_tokens": 12709069.0, "step": 5695 }, { "entropy": 5.759660863876343, "epoch": 0.6401976750716011, "grad_norm": 1.390625, "learning_rate": 0.0004968436602892411, "loss": 5.6475, "mean_token_accuracy": 0.16808155924081802, "num_tokens": 12719916.0, "step": 5700 }, { "entropy": 5.743867063522339, "epoch": 0.6407592519795586, "grad_norm": 1.5546875, "learning_rate": 0.0004968369554608071, "loss": 5.7584, "mean_token_accuracy": 0.16313536167144777, "num_tokens": 12732079.0, "step": 5705 }, { "entropy": 5.852132272720337, "epoch": 0.6413208288875162, "grad_norm": 1.6875, "learning_rate": 0.0004968302435689985, "loss": 5.7338, "mean_token_accuracy": 0.16560664474964143, "num_tokens": 12742708.0, "step": 5710 }, { "entropy": 5.792535924911499, "epoch": 0.6418824057954737, "grad_norm": 2.40625, "learning_rate": 0.0004968235246140288, "loss": 5.6781, "mean_token_accuracy": 0.1690981075167656, "num_tokens": 12753952.0, "step": 5715 }, { "entropy": 5.677698373794556, "epoch": 0.6424439827034313, "grad_norm": 1.4375, "learning_rate": 0.0004968167985961121, "loss": 5.6078, "mean_token_accuracy": 0.17256635576486587, "num_tokens": 12765226.0, "step": 5720 }, { "entropy": 5.602059602737427, "epoch": 0.6430055596113888, "grad_norm": 1.5, "learning_rate": 0.0004968100655154625, "loss": 5.5366, "mean_token_accuracy": 0.17826073467731476, "num_tokens": 12776455.0, "step": 5725 }, { "entropy": 5.672917366027832, "epoch": 0.6435671365193463, "grad_norm": 1.390625, "learning_rate": 0.0004968033253722943, "loss": 5.5564, "mean_token_accuracy": 0.17404053062200547, "num_tokens": 12787054.0, "step": 5730 }, { "entropy": 5.719582462310791, "epoch": 0.6441287134273038, "grad_norm": 1.3359375, "learning_rate": 0.0004967965781668223, "loss": 5.6866, "mean_token_accuracy": 0.170250004529953, "num_tokens": 12798223.0, "step": 5735 }, { "entropy": 5.715972423553467, "epoch": 0.6446902903352614, "grad_norm": 1.4140625, "learning_rate": 0.0004967898238992613, "loss": 5.5732, "mean_token_accuracy": 0.17579154819250106, "num_tokens": 12809388.0, "step": 5740 }, { "entropy": 5.686679077148438, "epoch": 0.6452518672432189, "grad_norm": 1.3046875, "learning_rate": 0.0004967830625698262, "loss": 5.6769, "mean_token_accuracy": 0.17444596737623214, "num_tokens": 12820116.0, "step": 5745 }, { "entropy": 5.6671665668487545, "epoch": 0.6458134441511765, "grad_norm": 1.4921875, "learning_rate": 0.0004967762941787323, "loss": 5.5967, "mean_token_accuracy": 0.17919077277183532, "num_tokens": 12831590.0, "step": 5750 }, { "entropy": 5.747342586517334, "epoch": 0.646375021059134, "grad_norm": 1.3359375, "learning_rate": 0.0004967695187261952, "loss": 5.7564, "mean_token_accuracy": 0.16459435522556304, "num_tokens": 12843510.0, "step": 5755 }, { "entropy": 5.7117125511169435, "epoch": 0.6469365979670916, "grad_norm": 1.3125, "learning_rate": 0.0004967627362124306, "loss": 5.6307, "mean_token_accuracy": 0.1705598846077919, "num_tokens": 12854907.0, "step": 5760 }, { "entropy": 5.658813190460205, "epoch": 0.6474981748750491, "grad_norm": 1.5078125, "learning_rate": 0.0004967559466376546, "loss": 5.5959, "mean_token_accuracy": 0.1710912510752678, "num_tokens": 12865753.0, "step": 5765 }, { "entropy": 5.6811473846435545, "epoch": 0.6480597517830067, "grad_norm": 1.9921875, "learning_rate": 0.0004967491500020831, "loss": 5.5035, "mean_token_accuracy": 0.17676436007022858, "num_tokens": 12877116.0, "step": 5770 }, { "entropy": 5.5508228778839115, "epoch": 0.6486213286909642, "grad_norm": 1.265625, "learning_rate": 0.0004967423463059328, "loss": 5.4959, "mean_token_accuracy": 0.17579397261142732, "num_tokens": 12887685.0, "step": 5775 }, { "entropy": 5.713850355148315, "epoch": 0.6491829055989218, "grad_norm": 1.40625, "learning_rate": 0.0004967355355494201, "loss": 5.6584, "mean_token_accuracy": 0.1692407101392746, "num_tokens": 12898519.0, "step": 5780 }, { "entropy": 5.742898797988891, "epoch": 0.6497444825068793, "grad_norm": 1.2734375, "learning_rate": 0.000496728717732762, "loss": 5.586, "mean_token_accuracy": 0.17314111143350602, "num_tokens": 12908400.0, "step": 5785 }, { "entropy": 5.602768039703369, "epoch": 0.6503060594148369, "grad_norm": 1.296875, "learning_rate": 0.0004967218928561755, "loss": 5.56, "mean_token_accuracy": 0.17106268554925919, "num_tokens": 12919159.0, "step": 5790 }, { "entropy": 5.631039237976074, "epoch": 0.6508676363227944, "grad_norm": 1.2109375, "learning_rate": 0.0004967150609198779, "loss": 5.523, "mean_token_accuracy": 0.1793055310845375, "num_tokens": 12929838.0, "step": 5795 }, { "entropy": 5.732568550109863, "epoch": 0.651429213230752, "grad_norm": 1.4453125, "learning_rate": 0.0004967082219240869, "loss": 5.6285, "mean_token_accuracy": 0.1695741206407547, "num_tokens": 12939976.0, "step": 5800 }, { "entropy": 5.758488702774048, "epoch": 0.6519907901387095, "grad_norm": 1.5625, "learning_rate": 0.0004967013758690199, "loss": 5.6404, "mean_token_accuracy": 0.1749062106013298, "num_tokens": 12950493.0, "step": 5805 }, { "entropy": 5.654942989349365, "epoch": 0.6525523670466671, "grad_norm": 1.296875, "learning_rate": 0.0004966945227548953, "loss": 5.6052, "mean_token_accuracy": 0.17201246023178102, "num_tokens": 12961267.0, "step": 5810 }, { "entropy": 5.66741909980774, "epoch": 0.6531139439546246, "grad_norm": 1.25, "learning_rate": 0.0004966876625819309, "loss": 5.6493, "mean_token_accuracy": 0.16587674468755723, "num_tokens": 12972720.0, "step": 5815 }, { "entropy": 5.8147331237792965, "epoch": 0.6536755208625822, "grad_norm": 1.375, "learning_rate": 0.0004966807953503456, "loss": 5.7294, "mean_token_accuracy": 0.16530007719993592, "num_tokens": 12984025.0, "step": 5820 }, { "entropy": 5.751352405548095, "epoch": 0.6542370977705396, "grad_norm": 1.265625, "learning_rate": 0.0004966739210603578, "loss": 5.6064, "mean_token_accuracy": 0.17820507735013963, "num_tokens": 12994422.0, "step": 5825 }, { "entropy": 5.753329849243164, "epoch": 0.6547986746784972, "grad_norm": 1.5, "learning_rate": 0.0004966670397121862, "loss": 5.7651, "mean_token_accuracy": 0.1632770538330078, "num_tokens": 13005040.0, "step": 5830 }, { "entropy": 5.65441665649414, "epoch": 0.6553602515864547, "grad_norm": 1.359375, "learning_rate": 0.0004966601513060502, "loss": 5.5259, "mean_token_accuracy": 0.17237963378429413, "num_tokens": 13015720.0, "step": 5835 }, { "entropy": 5.689071893692017, "epoch": 0.6559218284944123, "grad_norm": 1.25, "learning_rate": 0.000496653255842169, "loss": 5.4925, "mean_token_accuracy": 0.17613681703805922, "num_tokens": 13026269.0, "step": 5840 }, { "entropy": 5.638681697845459, "epoch": 0.6564834054023698, "grad_norm": 1.359375, "learning_rate": 0.0004966463533207621, "loss": 5.6659, "mean_token_accuracy": 0.16914643421769143, "num_tokens": 13037102.0, "step": 5845 }, { "entropy": 5.634537220001221, "epoch": 0.6570449823103274, "grad_norm": 1.2578125, "learning_rate": 0.0004966394437420493, "loss": 5.5301, "mean_token_accuracy": 0.1786402016878128, "num_tokens": 13047149.0, "step": 5850 }, { "entropy": 5.6855401515960695, "epoch": 0.6576065592182849, "grad_norm": 1.5078125, "learning_rate": 0.0004966325271062508, "loss": 5.5626, "mean_token_accuracy": 0.17522660344839097, "num_tokens": 13058196.0, "step": 5855 }, { "entropy": 5.617813682556152, "epoch": 0.6581681361262425, "grad_norm": 1.3125, "learning_rate": 0.0004966256034135866, "loss": 5.575, "mean_token_accuracy": 0.17152782380580903, "num_tokens": 13067897.0, "step": 5860 }, { "entropy": 5.704078626632691, "epoch": 0.6587297130342, "grad_norm": 1.2265625, "learning_rate": 0.0004966186726642772, "loss": 5.6755, "mean_token_accuracy": 0.1717715382575989, "num_tokens": 13079720.0, "step": 5865 }, { "entropy": 5.634116268157959, "epoch": 0.6592912899421576, "grad_norm": 1.34375, "learning_rate": 0.0004966117348585434, "loss": 5.5258, "mean_token_accuracy": 0.167197148501873, "num_tokens": 13090995.0, "step": 5870 }, { "entropy": 5.605711269378662, "epoch": 0.6598528668501151, "grad_norm": 1.1953125, "learning_rate": 0.0004966047899966059, "loss": 5.572, "mean_token_accuracy": 0.17753074020147325, "num_tokens": 13101945.0, "step": 5875 }, { "entropy": 5.679044914245606, "epoch": 0.6604144437580727, "grad_norm": 1.3125, "learning_rate": 0.000496597838078686, "loss": 5.5155, "mean_token_accuracy": 0.1752203419804573, "num_tokens": 13112869.0, "step": 5880 }, { "entropy": 5.710168552398682, "epoch": 0.6609760206660302, "grad_norm": 1.390625, "learning_rate": 0.000496590879105005, "loss": 5.6074, "mean_token_accuracy": 0.16586030423641204, "num_tokens": 13123242.0, "step": 5885 }, { "entropy": 5.776198816299439, "epoch": 0.6615375975739878, "grad_norm": 1.265625, "learning_rate": 0.0004965839130757845, "loss": 5.7182, "mean_token_accuracy": 0.1584482118487358, "num_tokens": 13133981.0, "step": 5890 }, { "entropy": 5.67058835029602, "epoch": 0.6620991744819453, "grad_norm": 1.3828125, "learning_rate": 0.0004965769399912462, "loss": 5.6804, "mean_token_accuracy": 0.16925962790846824, "num_tokens": 13144696.0, "step": 5895 }, { "entropy": 5.770441007614136, "epoch": 0.6626607513899029, "grad_norm": 1.3125, "learning_rate": 0.0004965699598516122, "loss": 5.7219, "mean_token_accuracy": 0.17378196567296983, "num_tokens": 13156674.0, "step": 5900 }, { "entropy": 5.704008340835571, "epoch": 0.6632223282978604, "grad_norm": 1.21875, "learning_rate": 0.0004965629726571047, "loss": 5.5632, "mean_token_accuracy": 0.17381847351789476, "num_tokens": 13167757.0, "step": 5905 }, { "entropy": 5.748448419570923, "epoch": 0.663783905205818, "grad_norm": 1.40625, "learning_rate": 0.0004965559784079463, "loss": 5.6488, "mean_token_accuracy": 0.16911055743694306, "num_tokens": 13177701.0, "step": 5910 }, { "entropy": 5.785614109039306, "epoch": 0.6643454821137755, "grad_norm": 1.2578125, "learning_rate": 0.0004965489771043596, "loss": 5.6658, "mean_token_accuracy": 0.16642796993255615, "num_tokens": 13189840.0, "step": 5915 }, { "entropy": 5.5934004306793215, "epoch": 0.664907059021733, "grad_norm": 1.3125, "learning_rate": 0.0004965419687465676, "loss": 5.4739, "mean_token_accuracy": 0.17768412381410598, "num_tokens": 13200206.0, "step": 5920 }, { "entropy": 5.586026859283447, "epoch": 0.6654686359296905, "grad_norm": 1.53125, "learning_rate": 0.0004965349533347934, "loss": 5.588, "mean_token_accuracy": 0.17564436197280883, "num_tokens": 13211474.0, "step": 5925 }, { "entropy": 5.733428430557251, "epoch": 0.6660302128376481, "grad_norm": 1.3359375, "learning_rate": 0.0004965279308692602, "loss": 5.6484, "mean_token_accuracy": 0.1843220919370651, "num_tokens": 13223337.0, "step": 5930 }, { "entropy": 5.801119422912597, "epoch": 0.6665917897456056, "grad_norm": 1.4765625, "learning_rate": 0.0004965209013501919, "loss": 5.7285, "mean_token_accuracy": 0.17110735177993774, "num_tokens": 13234977.0, "step": 5935 }, { "entropy": 5.70616512298584, "epoch": 0.6671533666535632, "grad_norm": 1.3203125, "learning_rate": 0.0004965138647778122, "loss": 5.6768, "mean_token_accuracy": 0.17690228521823884, "num_tokens": 13245315.0, "step": 5940 }, { "entropy": 5.685105466842652, "epoch": 0.6677149435615207, "grad_norm": 1.453125, "learning_rate": 0.000496506821152345, "loss": 5.5582, "mean_token_accuracy": 0.1749824121594429, "num_tokens": 13255829.0, "step": 5945 }, { "entropy": 5.66689453125, "epoch": 0.6682765204694783, "grad_norm": 1.2890625, "learning_rate": 0.0004964997704740147, "loss": 5.6256, "mean_token_accuracy": 0.170874160528183, "num_tokens": 13266964.0, "step": 5950 }, { "entropy": 5.796186685562134, "epoch": 0.6688380973774358, "grad_norm": 1.1640625, "learning_rate": 0.000496492712743046, "loss": 5.6614, "mean_token_accuracy": 0.1689567595720291, "num_tokens": 13279416.0, "step": 5955 }, { "entropy": 5.723680639266968, "epoch": 0.6693996742853934, "grad_norm": 1.546875, "learning_rate": 0.0004964856479596632, "loss": 5.6919, "mean_token_accuracy": 0.1676722764968872, "num_tokens": 13290633.0, "step": 5960 }, { "entropy": 5.7067337989807125, "epoch": 0.6699612511933509, "grad_norm": 1.3046875, "learning_rate": 0.0004964785761240915, "loss": 5.5734, "mean_token_accuracy": 0.17108363509178162, "num_tokens": 13302236.0, "step": 5965 }, { "entropy": 5.7176580905914305, "epoch": 0.6705228281013085, "grad_norm": 1.3359375, "learning_rate": 0.0004964714972365562, "loss": 5.6724, "mean_token_accuracy": 0.17194082885980605, "num_tokens": 13315356.0, "step": 5970 }, { "entropy": 5.516757583618164, "epoch": 0.671084405009266, "grad_norm": 1.453125, "learning_rate": 0.0004964644112972824, "loss": 5.5327, "mean_token_accuracy": 0.1755928486585617, "num_tokens": 13326037.0, "step": 5975 }, { "entropy": 5.632549905776978, "epoch": 0.6716459819172236, "grad_norm": 1.4140625, "learning_rate": 0.0004964573183064959, "loss": 5.5914, "mean_token_accuracy": 0.17360655069351197, "num_tokens": 13336278.0, "step": 5980 }, { "entropy": 5.736466360092163, "epoch": 0.6722075588251811, "grad_norm": 1.2734375, "learning_rate": 0.0004964502182644225, "loss": 5.7065, "mean_token_accuracy": 0.17162298858165742, "num_tokens": 13348147.0, "step": 5985 }, { "entropy": 5.71574764251709, "epoch": 0.6727691357331387, "grad_norm": 1.6484375, "learning_rate": 0.0004964431111712883, "loss": 5.6413, "mean_token_accuracy": 0.17189154624938965, "num_tokens": 13360181.0, "step": 5990 }, { "entropy": 5.774587678909302, "epoch": 0.6733307126410962, "grad_norm": 1.421875, "learning_rate": 0.0004964359970273195, "loss": 5.7266, "mean_token_accuracy": 0.16633295267820358, "num_tokens": 13372258.0, "step": 5995 }, { "entropy": 5.71021146774292, "epoch": 0.6738922895490538, "grad_norm": 1.28125, "learning_rate": 0.0004964288758327426, "loss": 5.6378, "mean_token_accuracy": 0.16402822285890578, "num_tokens": 13384332.0, "step": 6000 }, { "epoch": 0.6738922895490538, "eval_entropy": 5.5617586172269675, "eval_loss": 5.65424108505249, "eval_mean_token_accuracy": 0.17736698931749925, "eval_num_tokens": 13384332.0, "eval_runtime": 23.6897, "eval_samples_per_second": 1309.134, "eval_steps_per_second": 163.658, "step": 6000 }, { "entropy": 5.7171698093414305, "epoch": 0.6744538664570113, "grad_norm": 1.34375, "learning_rate": 0.0004964217475877846, "loss": 5.6314, "mean_token_accuracy": 0.16942399442195893, "num_tokens": 13396345.0, "step": 6005 }, { "entropy": 5.591657829284668, "epoch": 0.6750154433649689, "grad_norm": 1.3984375, "learning_rate": 0.000496414612292672, "loss": 5.4644, "mean_token_accuracy": 0.17689456790685654, "num_tokens": 13407325.0, "step": 6010 }, { "entropy": 5.689947080612183, "epoch": 0.6755770202729264, "grad_norm": 1.4609375, "learning_rate": 0.0004964074699476325, "loss": 5.6021, "mean_token_accuracy": 0.17259112149477004, "num_tokens": 13417476.0, "step": 6015 }, { "entropy": 5.656712484359741, "epoch": 0.6761385971808839, "grad_norm": 1.203125, "learning_rate": 0.0004964003205528933, "loss": 5.6096, "mean_token_accuracy": 0.1726845309138298, "num_tokens": 13428792.0, "step": 6020 }, { "entropy": 5.700129842758178, "epoch": 0.6767001740888414, "grad_norm": 1.4140625, "learning_rate": 0.0004963931641086819, "loss": 5.6682, "mean_token_accuracy": 0.1713205248117447, "num_tokens": 13440043.0, "step": 6025 }, { "entropy": 5.7401378631591795, "epoch": 0.677261750996799, "grad_norm": 1.265625, "learning_rate": 0.0004963860006152262, "loss": 5.6353, "mean_token_accuracy": 0.17090512961149215, "num_tokens": 13451637.0, "step": 6030 }, { "entropy": 5.824400568008423, "epoch": 0.6778233279047565, "grad_norm": 1.4375, "learning_rate": 0.0004963788300727546, "loss": 5.6046, "mean_token_accuracy": 0.17313029766082763, "num_tokens": 13463205.0, "step": 6035 }, { "entropy": 5.660120248794556, "epoch": 0.6783849048127141, "grad_norm": 1.40625, "learning_rate": 0.0004963716524814951, "loss": 5.6569, "mean_token_accuracy": 0.17166511565446854, "num_tokens": 13474201.0, "step": 6040 }, { "entropy": 5.62141170501709, "epoch": 0.6789464817206716, "grad_norm": 1.359375, "learning_rate": 0.0004963644678416763, "loss": 5.5434, "mean_token_accuracy": 0.17378048449754716, "num_tokens": 13485439.0, "step": 6045 }, { "entropy": 5.730491065979004, "epoch": 0.6795080586286292, "grad_norm": 1.1875, "learning_rate": 0.000496357276153527, "loss": 5.7492, "mean_token_accuracy": 0.16852689236402513, "num_tokens": 13497257.0, "step": 6050 }, { "entropy": 5.730785655975342, "epoch": 0.6800696355365867, "grad_norm": 1.125, "learning_rate": 0.0004963500774172763, "loss": 5.5958, "mean_token_accuracy": 0.17269592732191086, "num_tokens": 13508689.0, "step": 6055 }, { "entropy": 5.698699808120727, "epoch": 0.6806312124445443, "grad_norm": 1.2265625, "learning_rate": 0.000496342871633153, "loss": 5.5497, "mean_token_accuracy": 0.18048133552074433, "num_tokens": 13519392.0, "step": 6060 }, { "entropy": 5.62058744430542, "epoch": 0.6811927893525018, "grad_norm": 1.3359375, "learning_rate": 0.0004963356588013871, "loss": 5.605, "mean_token_accuracy": 0.1779961258172989, "num_tokens": 13530503.0, "step": 6065 }, { "entropy": 5.707237100601196, "epoch": 0.6817543662604594, "grad_norm": 1.28125, "learning_rate": 0.0004963284389222078, "loss": 5.674, "mean_token_accuracy": 0.1740332290530205, "num_tokens": 13541668.0, "step": 6070 }, { "entropy": 5.699452447891235, "epoch": 0.6823159431684169, "grad_norm": 1.25, "learning_rate": 0.0004963212119958453, "loss": 5.5067, "mean_token_accuracy": 0.1787132978439331, "num_tokens": 13552692.0, "step": 6075 }, { "entropy": 5.577724456787109, "epoch": 0.6828775200763745, "grad_norm": 1.34375, "learning_rate": 0.0004963139780225295, "loss": 5.6074, "mean_token_accuracy": 0.1706698417663574, "num_tokens": 13563813.0, "step": 6080 }, { "entropy": 5.6306346416473385, "epoch": 0.683439096984332, "grad_norm": 1.1796875, "learning_rate": 0.0004963067370024909, "loss": 5.5537, "mean_token_accuracy": 0.17718004286289216, "num_tokens": 13573818.0, "step": 6085 }, { "entropy": 5.760622024536133, "epoch": 0.6840006738922896, "grad_norm": 1.28125, "learning_rate": 0.0004962994889359598, "loss": 5.6771, "mean_token_accuracy": 0.16787791550159453, "num_tokens": 13585416.0, "step": 6090 }, { "entropy": 5.631905651092529, "epoch": 0.6845622508002471, "grad_norm": 2.046875, "learning_rate": 0.0004962922338231673, "loss": 5.5727, "mean_token_accuracy": 0.17555365860462188, "num_tokens": 13596645.0, "step": 6095 }, { "entropy": 5.68451681137085, "epoch": 0.6851238277082047, "grad_norm": 1.15625, "learning_rate": 0.0004962849716643441, "loss": 5.5218, "mean_token_accuracy": 0.177066071331501, "num_tokens": 13607206.0, "step": 6100 }, { "entropy": 5.7633359909057615, "epoch": 0.6856854046161622, "grad_norm": 1.2265625, "learning_rate": 0.0004962777024597216, "loss": 5.7316, "mean_token_accuracy": 0.16855940222740173, "num_tokens": 13619418.0, "step": 6105 }, { "entropy": 5.643983459472656, "epoch": 0.6862469815241198, "grad_norm": 1.4140625, "learning_rate": 0.0004962704262095314, "loss": 5.5224, "mean_token_accuracy": 0.17984748929738997, "num_tokens": 13630098.0, "step": 6110 }, { "entropy": 5.625010013580322, "epoch": 0.6868085584320772, "grad_norm": 1.328125, "learning_rate": 0.0004962631429140048, "loss": 5.6491, "mean_token_accuracy": 0.17171284705400466, "num_tokens": 13641401.0, "step": 6115 }, { "entropy": 5.739342164993286, "epoch": 0.6873701353400348, "grad_norm": 1.3046875, "learning_rate": 0.000496255852573374, "loss": 5.6075, "mean_token_accuracy": 0.1670444905757904, "num_tokens": 13653099.0, "step": 6120 }, { "entropy": 5.795357084274292, "epoch": 0.6879317122479923, "grad_norm": 1.3125, "learning_rate": 0.0004962485551878711, "loss": 5.622, "mean_token_accuracy": 0.16640905737876893, "num_tokens": 13665381.0, "step": 6125 }, { "entropy": 5.661467742919922, "epoch": 0.6884932891559499, "grad_norm": 1.2734375, "learning_rate": 0.0004962412507577283, "loss": 5.6346, "mean_token_accuracy": 0.17221850603818895, "num_tokens": 13676767.0, "step": 6130 }, { "entropy": 5.627943468093872, "epoch": 0.6890548660639074, "grad_norm": 1.40625, "learning_rate": 0.0004962339392831783, "loss": 5.6228, "mean_token_accuracy": 0.17215524911880492, "num_tokens": 13688552.0, "step": 6135 }, { "entropy": 5.70760407447815, "epoch": 0.689616442971865, "grad_norm": 1.46875, "learning_rate": 0.000496226620764454, "loss": 5.5953, "mean_token_accuracy": 0.17065925300121307, "num_tokens": 13700160.0, "step": 6140 }, { "entropy": 5.671698188781738, "epoch": 0.6901780198798225, "grad_norm": 2.015625, "learning_rate": 0.000496219295201788, "loss": 5.6011, "mean_token_accuracy": 0.1736286088824272, "num_tokens": 13710828.0, "step": 6145 }, { "entropy": 5.744783687591553, "epoch": 0.6907395967877801, "grad_norm": 1.4453125, "learning_rate": 0.0004962119625954141, "loss": 5.7163, "mean_token_accuracy": 0.16494496762752534, "num_tokens": 13721912.0, "step": 6150 }, { "entropy": 5.773995733261108, "epoch": 0.6913011736957376, "grad_norm": 1.3515625, "learning_rate": 0.0004962046229455653, "loss": 5.7312, "mean_token_accuracy": 0.1703624963760376, "num_tokens": 13733662.0, "step": 6155 }, { "entropy": 5.625052499771118, "epoch": 0.6918627506036952, "grad_norm": 1.3671875, "learning_rate": 0.0004961972762524757, "loss": 5.549, "mean_token_accuracy": 0.1760735273361206, "num_tokens": 13743699.0, "step": 6160 }, { "entropy": 5.629493951797485, "epoch": 0.6924243275116527, "grad_norm": 1.3046875, "learning_rate": 0.000496189922516379, "loss": 5.5554, "mean_token_accuracy": 0.17835567742586136, "num_tokens": 13754918.0, "step": 6165 }, { "entropy": 5.802048397064209, "epoch": 0.6929859044196103, "grad_norm": 1.234375, "learning_rate": 0.0004961825617375093, "loss": 5.589, "mean_token_accuracy": 0.1810780867934227, "num_tokens": 13764432.0, "step": 6170 }, { "entropy": 5.56612720489502, "epoch": 0.6935474813275678, "grad_norm": 1.4375, "learning_rate": 0.0004961751939161011, "loss": 5.5101, "mean_token_accuracy": 0.1665957048535347, "num_tokens": 13777049.0, "step": 6175 }, { "entropy": 5.613159084320069, "epoch": 0.6941090582355254, "grad_norm": 1.3828125, "learning_rate": 0.000496167819052389, "loss": 5.6285, "mean_token_accuracy": 0.17187547385692598, "num_tokens": 13788324.0, "step": 6180 }, { "entropy": 5.774720954895019, "epoch": 0.6946706351434829, "grad_norm": 1.3359375, "learning_rate": 0.0004961604371466077, "loss": 5.7071, "mean_token_accuracy": 0.1715664029121399, "num_tokens": 13800443.0, "step": 6185 }, { "entropy": 5.813463592529297, "epoch": 0.6952322120514405, "grad_norm": 1.1953125, "learning_rate": 0.0004961530481989923, "loss": 5.7471, "mean_token_accuracy": 0.1697026953101158, "num_tokens": 13811982.0, "step": 6190 }, { "entropy": 5.664430713653564, "epoch": 0.695793788959398, "grad_norm": 1.2890625, "learning_rate": 0.0004961456522097782, "loss": 5.5307, "mean_token_accuracy": 0.17545289546251297, "num_tokens": 13822005.0, "step": 6195 }, { "entropy": 5.580399084091186, "epoch": 0.6963553658673556, "grad_norm": 1.6484375, "learning_rate": 0.0004961382491792006, "loss": 5.5458, "mean_token_accuracy": 0.1745297133922577, "num_tokens": 13831943.0, "step": 6200 }, { "entropy": 5.800264644622803, "epoch": 0.6969169427753131, "grad_norm": 1.1953125, "learning_rate": 0.0004961308391074953, "loss": 5.7382, "mean_token_accuracy": 0.16787344366312026, "num_tokens": 13842517.0, "step": 6205 }, { "entropy": 5.726728725433349, "epoch": 0.6974785196832706, "grad_norm": 1.2265625, "learning_rate": 0.0004961234219948986, "loss": 5.6109, "mean_token_accuracy": 0.1686943292617798, "num_tokens": 13853636.0, "step": 6210 }, { "entropy": 5.655916929244995, "epoch": 0.6980400965912281, "grad_norm": 1.234375, "learning_rate": 0.0004961159978416461, "loss": 5.5513, "mean_token_accuracy": 0.1721298947930336, "num_tokens": 13864378.0, "step": 6215 }, { "entropy": 5.713779544830322, "epoch": 0.6986016734991857, "grad_norm": 1.2890625, "learning_rate": 0.0004961085666479746, "loss": 5.5778, "mean_token_accuracy": 0.17656196355819703, "num_tokens": 13874964.0, "step": 6220 }, { "entropy": 5.689186382293701, "epoch": 0.6991632504071432, "grad_norm": 1.4453125, "learning_rate": 0.0004961011284141206, "loss": 5.5644, "mean_token_accuracy": 0.16974303126335144, "num_tokens": 13885852.0, "step": 6225 }, { "entropy": 5.630877304077148, "epoch": 0.6997248273151008, "grad_norm": 1.390625, "learning_rate": 0.0004960936831403209, "loss": 5.6134, "mean_token_accuracy": 0.17150009721517562, "num_tokens": 13896101.0, "step": 6230 }, { "entropy": 5.648992586135864, "epoch": 0.7002864042230583, "grad_norm": 1.359375, "learning_rate": 0.0004960862308268126, "loss": 5.5052, "mean_token_accuracy": 0.17886769622564316, "num_tokens": 13907129.0, "step": 6235 }, { "entropy": 5.720948791503906, "epoch": 0.7008479811310159, "grad_norm": 1.234375, "learning_rate": 0.0004960787714738329, "loss": 5.6951, "mean_token_accuracy": 0.1737249031662941, "num_tokens": 13918662.0, "step": 6240 }, { "entropy": 5.685187721252442, "epoch": 0.7014095580389734, "grad_norm": 1.1640625, "learning_rate": 0.0004960713050816194, "loss": 5.6562, "mean_token_accuracy": 0.17299176901578903, "num_tokens": 13930717.0, "step": 6245 }, { "entropy": 5.633158874511719, "epoch": 0.701971134946931, "grad_norm": 1.40625, "learning_rate": 0.0004960638316504098, "loss": 5.5279, "mean_token_accuracy": 0.17130255252122878, "num_tokens": 13941299.0, "step": 6250 }, { "entropy": 5.780350589752198, "epoch": 0.7025327118548885, "grad_norm": 1.296875, "learning_rate": 0.0004960563511804421, "loss": 5.6119, "mean_token_accuracy": 0.17323518246412278, "num_tokens": 13951807.0, "step": 6255 }, { "entropy": 5.650942611694336, "epoch": 0.7030942887628461, "grad_norm": 1.15625, "learning_rate": 0.0004960488636719545, "loss": 5.5209, "mean_token_accuracy": 0.17925544530153276, "num_tokens": 13962994.0, "step": 6260 }, { "entropy": 5.566241312026977, "epoch": 0.7036558656708036, "grad_norm": 1.4921875, "learning_rate": 0.0004960413691251852, "loss": 5.5587, "mean_token_accuracy": 0.17189284712076186, "num_tokens": 13973731.0, "step": 6265 }, { "entropy": 5.686014032363891, "epoch": 0.7042174425787612, "grad_norm": 1.4140625, "learning_rate": 0.0004960338675403731, "loss": 5.6194, "mean_token_accuracy": 0.16850770264863968, "num_tokens": 13983772.0, "step": 6270 }, { "entropy": 5.6831377983093265, "epoch": 0.7047790194867187, "grad_norm": 1.4375, "learning_rate": 0.0004960263589177568, "loss": 5.6285, "mean_token_accuracy": 0.17523877322673798, "num_tokens": 13994935.0, "step": 6275 }, { "entropy": 5.693459796905517, "epoch": 0.7053405963946763, "grad_norm": 1.625, "learning_rate": 0.0004960188432575757, "loss": 5.5889, "mean_token_accuracy": 0.17878624945878982, "num_tokens": 14006225.0, "step": 6280 }, { "entropy": 5.69208722114563, "epoch": 0.7059021733026338, "grad_norm": 1.4765625, "learning_rate": 0.0004960113205600688, "loss": 5.6025, "mean_token_accuracy": 0.18202067613601686, "num_tokens": 14017693.0, "step": 6285 }, { "entropy": 5.67942214012146, "epoch": 0.7064637502105914, "grad_norm": 1.484375, "learning_rate": 0.0004960037908254757, "loss": 5.5771, "mean_token_accuracy": 0.17393409013748168, "num_tokens": 14027264.0, "step": 6290 }, { "entropy": 5.7325080871582035, "epoch": 0.7070253271185489, "grad_norm": 1.2109375, "learning_rate": 0.0004959962540540361, "loss": 5.6781, "mean_token_accuracy": 0.17509326040744783, "num_tokens": 14039422.0, "step": 6295 }, { "entropy": 5.694810819625855, "epoch": 0.7075869040265065, "grad_norm": 1.171875, "learning_rate": 0.0004959887102459903, "loss": 5.6026, "mean_token_accuracy": 0.17309763431549072, "num_tokens": 14051619.0, "step": 6300 }, { "entropy": 5.518226671218872, "epoch": 0.7081484809344639, "grad_norm": 1.328125, "learning_rate": 0.0004959811594015781, "loss": 5.6008, "mean_token_accuracy": 0.17118653059005737, "num_tokens": 14061752.0, "step": 6305 }, { "entropy": 5.7187727928161625, "epoch": 0.7087100578424215, "grad_norm": 1.6171875, "learning_rate": 0.0004959736015210401, "loss": 5.5499, "mean_token_accuracy": 0.17870223075151442, "num_tokens": 14072931.0, "step": 6310 }, { "entropy": 5.670480346679687, "epoch": 0.709271634750379, "grad_norm": 1.390625, "learning_rate": 0.0004959660366046169, "loss": 5.6354, "mean_token_accuracy": 0.1812950477004051, "num_tokens": 14084137.0, "step": 6315 }, { "entropy": 5.733542203903198, "epoch": 0.7098332116583366, "grad_norm": 1.453125, "learning_rate": 0.0004959584646525494, "loss": 5.643, "mean_token_accuracy": 0.16594423800706865, "num_tokens": 14096251.0, "step": 6320 }, { "entropy": 5.834647226333618, "epoch": 0.7103947885662941, "grad_norm": 1.6796875, "learning_rate": 0.0004959508856650788, "loss": 5.747, "mean_token_accuracy": 0.15990046858787538, "num_tokens": 14107844.0, "step": 6325 }, { "entropy": 5.701244258880616, "epoch": 0.7109563654742517, "grad_norm": 1.3046875, "learning_rate": 0.0004959432996424463, "loss": 5.5159, "mean_token_accuracy": 0.1764766052365303, "num_tokens": 14118344.0, "step": 6330 }, { "entropy": 5.683355712890625, "epoch": 0.7115179423822092, "grad_norm": 1.296875, "learning_rate": 0.0004959357065848932, "loss": 5.5731, "mean_token_accuracy": 0.17560436129570006, "num_tokens": 14128767.0, "step": 6335 }, { "entropy": 5.676946210861206, "epoch": 0.7120795192901668, "grad_norm": 1.5390625, "learning_rate": 0.0004959281064926618, "loss": 5.7624, "mean_token_accuracy": 0.1625056892633438, "num_tokens": 14141593.0, "step": 6340 }, { "entropy": 5.787940835952758, "epoch": 0.7126410961981243, "grad_norm": 1.375, "learning_rate": 0.0004959204993659936, "loss": 5.658, "mean_token_accuracy": 0.16435816437005996, "num_tokens": 14151488.0, "step": 6345 }, { "entropy": 5.709534454345703, "epoch": 0.7132026731060819, "grad_norm": 1.6171875, "learning_rate": 0.0004959128852051311, "loss": 5.6446, "mean_token_accuracy": 0.17000896334648133, "num_tokens": 14162399.0, "step": 6350 }, { "entropy": 5.681110572814942, "epoch": 0.7137642500140394, "grad_norm": 1.515625, "learning_rate": 0.0004959052640103167, "loss": 5.6154, "mean_token_accuracy": 0.1655770495533943, "num_tokens": 14173528.0, "step": 6355 }, { "entropy": 5.737189197540284, "epoch": 0.714325826921997, "grad_norm": 1.578125, "learning_rate": 0.000495897635781793, "loss": 5.5977, "mean_token_accuracy": 0.1738772988319397, "num_tokens": 14184119.0, "step": 6360 }, { "entropy": 5.783509731292725, "epoch": 0.7148874038299545, "grad_norm": 1.5859375, "learning_rate": 0.0004958900005198029, "loss": 5.6966, "mean_token_accuracy": 0.16666410118341446, "num_tokens": 14196225.0, "step": 6365 }, { "entropy": 5.5992560386657715, "epoch": 0.7154489807379121, "grad_norm": 1.3671875, "learning_rate": 0.0004958823582245894, "loss": 5.5122, "mean_token_accuracy": 0.1770908787846565, "num_tokens": 14207541.0, "step": 6370 }, { "entropy": 5.713044595718384, "epoch": 0.7160105576458696, "grad_norm": 1.7578125, "learning_rate": 0.0004958747088963961, "loss": 5.62, "mean_token_accuracy": 0.17931632846593856, "num_tokens": 14218713.0, "step": 6375 }, { "entropy": 5.576667070388794, "epoch": 0.7165721345538272, "grad_norm": 1.3125, "learning_rate": 0.0004958670525354663, "loss": 5.4876, "mean_token_accuracy": 0.17556754648685455, "num_tokens": 14229626.0, "step": 6380 }, { "entropy": 5.67002272605896, "epoch": 0.7171337114617847, "grad_norm": 1.421875, "learning_rate": 0.000495859389142044, "loss": 5.6633, "mean_token_accuracy": 0.16710093021392822, "num_tokens": 14240320.0, "step": 6385 }, { "entropy": 5.830556774139405, "epoch": 0.7176952883697423, "grad_norm": 1.390625, "learning_rate": 0.000495851718716373, "loss": 5.719, "mean_token_accuracy": 0.17310031801462172, "num_tokens": 14252233.0, "step": 6390 }, { "entropy": 5.79133095741272, "epoch": 0.7182568652776998, "grad_norm": 1.4296875, "learning_rate": 0.0004958440412586977, "loss": 5.7307, "mean_token_accuracy": 0.15904613435268403, "num_tokens": 14264421.0, "step": 6395 }, { "entropy": 5.731802177429199, "epoch": 0.7188184421856574, "grad_norm": 1.2578125, "learning_rate": 0.0004958363567692624, "loss": 5.6031, "mean_token_accuracy": 0.17360225617885588, "num_tokens": 14275320.0, "step": 6400 }, { "entropy": 5.638220739364624, "epoch": 0.7193800190936148, "grad_norm": 1.5078125, "learning_rate": 0.0004958286652483118, "loss": 5.5668, "mean_token_accuracy": 0.1780466377735138, "num_tokens": 14286099.0, "step": 6405 }, { "entropy": 5.66323037147522, "epoch": 0.7199415960015724, "grad_norm": 1.3984375, "learning_rate": 0.0004958209666960909, "loss": 5.6835, "mean_token_accuracy": 0.16914550662040712, "num_tokens": 14297795.0, "step": 6410 }, { "entropy": 5.638380813598633, "epoch": 0.7205031729095299, "grad_norm": 1.5234375, "learning_rate": 0.0004958132611128448, "loss": 5.5828, "mean_token_accuracy": 0.17390582710504532, "num_tokens": 14309424.0, "step": 6415 }, { "entropy": 5.784746742248535, "epoch": 0.7210647498174875, "grad_norm": 1.234375, "learning_rate": 0.0004958055484988188, "loss": 5.6623, "mean_token_accuracy": 0.16943105459213256, "num_tokens": 14320763.0, "step": 6420 }, { "entropy": 5.7342438220977785, "epoch": 0.721626326725445, "grad_norm": 1.28125, "learning_rate": 0.0004957978288542585, "loss": 5.6264, "mean_token_accuracy": 0.1723559558391571, "num_tokens": 14331704.0, "step": 6425 }, { "entropy": 5.756981945037841, "epoch": 0.7221879036334026, "grad_norm": 1.4140625, "learning_rate": 0.0004957901021794098, "loss": 5.675, "mean_token_accuracy": 0.16486780792474748, "num_tokens": 14343694.0, "step": 6430 }, { "entropy": 5.680773448944092, "epoch": 0.7227494805413601, "grad_norm": 1.421875, "learning_rate": 0.0004957823684745184, "loss": 5.572, "mean_token_accuracy": 0.17167100310325623, "num_tokens": 14355408.0, "step": 6435 }, { "entropy": 5.703755664825439, "epoch": 0.7233110574493177, "grad_norm": 1.421875, "learning_rate": 0.0004957746277398309, "loss": 5.7254, "mean_token_accuracy": 0.16364069730043412, "num_tokens": 14366778.0, "step": 6440 }, { "entropy": 5.712000751495362, "epoch": 0.7238726343572752, "grad_norm": 1.359375, "learning_rate": 0.0004957668799755937, "loss": 5.5799, "mean_token_accuracy": 0.17299263626337053, "num_tokens": 14377947.0, "step": 6445 }, { "entropy": 5.705758762359619, "epoch": 0.7244342112652328, "grad_norm": 1.3203125, "learning_rate": 0.0004957591251820532, "loss": 5.6688, "mean_token_accuracy": 0.1714080259203911, "num_tokens": 14389571.0, "step": 6450 }, { "entropy": 5.8451415538787845, "epoch": 0.7249957881731903, "grad_norm": 1.296875, "learning_rate": 0.0004957513633594567, "loss": 5.7455, "mean_token_accuracy": 0.1655985251069069, "num_tokens": 14401865.0, "step": 6455 }, { "entropy": 5.643240690231323, "epoch": 0.7255573650811479, "grad_norm": 1.6328125, "learning_rate": 0.0004957435945080512, "loss": 5.576, "mean_token_accuracy": 0.17257309556007386, "num_tokens": 14413676.0, "step": 6460 }, { "entropy": 5.6537106990814205, "epoch": 0.7261189419891054, "grad_norm": 1.40625, "learning_rate": 0.0004957358186280839, "loss": 5.6016, "mean_token_accuracy": 0.1794086754322052, "num_tokens": 14424675.0, "step": 6465 }, { "entropy": 5.618784666061401, "epoch": 0.726680518897063, "grad_norm": 1.2265625, "learning_rate": 0.0004957280357198026, "loss": 5.5149, "mean_token_accuracy": 0.17647840976715087, "num_tokens": 14437238.0, "step": 6470 }, { "entropy": 5.549806547164917, "epoch": 0.7272420958050205, "grad_norm": 1.265625, "learning_rate": 0.0004957202457834551, "loss": 5.4673, "mean_token_accuracy": 0.17938644886016847, "num_tokens": 14448003.0, "step": 6475 }, { "entropy": 5.528613138198852, "epoch": 0.7278036727129781, "grad_norm": 1.5234375, "learning_rate": 0.0004957124488192893, "loss": 5.4236, "mean_token_accuracy": 0.18780238777399064, "num_tokens": 14458440.0, "step": 6480 }, { "entropy": 5.688983345031739, "epoch": 0.7283652496209356, "grad_norm": 1.28125, "learning_rate": 0.0004957046448275535, "loss": 5.6076, "mean_token_accuracy": 0.17096126079559326, "num_tokens": 14470127.0, "step": 6485 }, { "entropy": 5.652023792266846, "epoch": 0.7289268265288932, "grad_norm": 1.265625, "learning_rate": 0.0004956968338084961, "loss": 5.5194, "mean_token_accuracy": 0.17799320966005325, "num_tokens": 14480993.0, "step": 6490 }, { "entropy": 5.667353630065918, "epoch": 0.7294884034368507, "grad_norm": 1.4296875, "learning_rate": 0.0004956890157623661, "loss": 5.6216, "mean_token_accuracy": 0.16608051508665084, "num_tokens": 14492789.0, "step": 6495 }, { "entropy": 5.735092353820801, "epoch": 0.7300499803448082, "grad_norm": 1.40625, "learning_rate": 0.0004956811906894122, "loss": 5.7142, "mean_token_accuracy": 0.16898949593305587, "num_tokens": 14504528.0, "step": 6500 }, { "entropy": 5.777708959579468, "epoch": 0.7306115572527657, "grad_norm": 1.3203125, "learning_rate": 0.0004956733585898836, "loss": 5.6052, "mean_token_accuracy": 0.17461458444595337, "num_tokens": 14515739.0, "step": 6505 }, { "entropy": 5.7372722148895265, "epoch": 0.7311731341607233, "grad_norm": 1.296875, "learning_rate": 0.0004956655194640297, "loss": 5.7253, "mean_token_accuracy": 0.165912227332592, "num_tokens": 14527120.0, "step": 6510 }, { "entropy": 5.734869432449341, "epoch": 0.7317347110686808, "grad_norm": 1.234375, "learning_rate": 0.0004956576733121, "loss": 5.6732, "mean_token_accuracy": 0.17188447639346122, "num_tokens": 14539390.0, "step": 6515 }, { "entropy": 5.7428192615509035, "epoch": 0.7322962879766384, "grad_norm": 1.3671875, "learning_rate": 0.0004956498201343444, "loss": 5.6542, "mean_token_accuracy": 0.17126702666282653, "num_tokens": 14549905.0, "step": 6520 }, { "entropy": 5.7277122974395756, "epoch": 0.7328578648845959, "grad_norm": 1.3203125, "learning_rate": 0.000495641959931013, "loss": 5.7013, "mean_token_accuracy": 0.17059755474328994, "num_tokens": 14561519.0, "step": 6525 }, { "entropy": 5.656032657623291, "epoch": 0.7334194417925535, "grad_norm": 1.234375, "learning_rate": 0.0004956340927023561, "loss": 5.4721, "mean_token_accuracy": 0.17097557485103607, "num_tokens": 14572704.0, "step": 6530 }, { "entropy": 5.733268117904663, "epoch": 0.733981018700511, "grad_norm": 1.2265625, "learning_rate": 0.000495626218448624, "loss": 5.6477, "mean_token_accuracy": 0.17309343367815017, "num_tokens": 14584055.0, "step": 6535 }, { "entropy": 5.528829097747803, "epoch": 0.7345425956084686, "grad_norm": 1.421875, "learning_rate": 0.0004956183371700676, "loss": 5.4578, "mean_token_accuracy": 0.17761017978191376, "num_tokens": 14595271.0, "step": 6540 }, { "entropy": 5.687887334823609, "epoch": 0.7351041725164261, "grad_norm": 1.5234375, "learning_rate": 0.0004956104488669377, "loss": 5.6217, "mean_token_accuracy": 0.1771188572049141, "num_tokens": 14605748.0, "step": 6545 }, { "entropy": 5.658285093307495, "epoch": 0.7356657494243837, "grad_norm": 1.3984375, "learning_rate": 0.0004956025535394856, "loss": 5.5326, "mean_token_accuracy": 0.18142949491739274, "num_tokens": 14616295.0, "step": 6550 }, { "entropy": 5.633347415924073, "epoch": 0.7362273263323412, "grad_norm": 1.5234375, "learning_rate": 0.0004955946511879626, "loss": 5.625, "mean_token_accuracy": 0.16703985631465912, "num_tokens": 14626690.0, "step": 6555 }, { "entropy": 5.678591918945313, "epoch": 0.7367889032402988, "grad_norm": 1.3515625, "learning_rate": 0.0004955867418126205, "loss": 5.6293, "mean_token_accuracy": 0.17487271279096603, "num_tokens": 14637685.0, "step": 6560 }, { "entropy": 5.738638973236084, "epoch": 0.7373504801482563, "grad_norm": 1.3671875, "learning_rate": 0.0004955788254137108, "loss": 5.5306, "mean_token_accuracy": 0.17113898396492006, "num_tokens": 14648098.0, "step": 6565 }, { "entropy": 5.746050071716309, "epoch": 0.7379120570562139, "grad_norm": 1.2734375, "learning_rate": 0.0004955709019914857, "loss": 5.6727, "mean_token_accuracy": 0.16656773388385773, "num_tokens": 14661134.0, "step": 6570 }, { "entropy": 5.746538877487183, "epoch": 0.7384736339641714, "grad_norm": 1.5546875, "learning_rate": 0.0004955629715461977, "loss": 5.6445, "mean_token_accuracy": 0.17216980457305908, "num_tokens": 14672699.0, "step": 6575 }, { "entropy": 5.747246170043946, "epoch": 0.739035210872129, "grad_norm": 1.6171875, "learning_rate": 0.0004955550340780991, "loss": 5.6143, "mean_token_accuracy": 0.16882283240556717, "num_tokens": 14682994.0, "step": 6580 }, { "entropy": 5.672818374633789, "epoch": 0.7395967877800865, "grad_norm": 1.4140625, "learning_rate": 0.0004955470895874427, "loss": 5.6186, "mean_token_accuracy": 0.17457711100578308, "num_tokens": 14694828.0, "step": 6585 }, { "entropy": 5.648428583145142, "epoch": 0.7401583646880441, "grad_norm": 1.40625, "learning_rate": 0.0004955391380744813, "loss": 5.6108, "mean_token_accuracy": 0.17359036207199097, "num_tokens": 14705975.0, "step": 6590 }, { "entropy": 5.726032495498657, "epoch": 0.7407199415960015, "grad_norm": 1.453125, "learning_rate": 0.0004955311795394684, "loss": 5.5944, "mean_token_accuracy": 0.1734750136733055, "num_tokens": 14717717.0, "step": 6595 }, { "entropy": 5.711815071105957, "epoch": 0.7412815185039591, "grad_norm": 1.3984375, "learning_rate": 0.000495523213982657, "loss": 5.5662, "mean_token_accuracy": 0.1741805464029312, "num_tokens": 14729254.0, "step": 6600 }, { "entropy": 5.6931883811950685, "epoch": 0.7418430954119166, "grad_norm": 1.359375, "learning_rate": 0.0004955152414043011, "loss": 5.7119, "mean_token_accuracy": 0.1718486949801445, "num_tokens": 14739733.0, "step": 6605 }, { "entropy": 5.752079057693481, "epoch": 0.7424046723198742, "grad_norm": 1.4140625, "learning_rate": 0.0004955072618046543, "loss": 5.6666, "mean_token_accuracy": 0.17087932378053666, "num_tokens": 14750855.0, "step": 6610 }, { "entropy": 5.71418023109436, "epoch": 0.7429662492278317, "grad_norm": 1.2578125, "learning_rate": 0.0004954992751839708, "loss": 5.6614, "mean_token_accuracy": 0.1698993593454361, "num_tokens": 14762762.0, "step": 6615 }, { "entropy": 5.688072967529297, "epoch": 0.7435278261357893, "grad_norm": 1.5546875, "learning_rate": 0.0004954912815425048, "loss": 5.5299, "mean_token_accuracy": 0.1700862854719162, "num_tokens": 14773690.0, "step": 6620 }, { "entropy": 5.640633058547974, "epoch": 0.7440894030437468, "grad_norm": 1.390625, "learning_rate": 0.000495483280880511, "loss": 5.6447, "mean_token_accuracy": 0.17218244969844818, "num_tokens": 14785019.0, "step": 6625 }, { "entropy": 5.643097877502441, "epoch": 0.7446509799517044, "grad_norm": 1.1640625, "learning_rate": 0.000495475273198244, "loss": 5.6206, "mean_token_accuracy": 0.16789701133966445, "num_tokens": 14795638.0, "step": 6630 }, { "entropy": 5.715163087844848, "epoch": 0.7452125568596619, "grad_norm": 1.3828125, "learning_rate": 0.0004954672584959588, "loss": 5.549, "mean_token_accuracy": 0.17813322842121124, "num_tokens": 14806546.0, "step": 6635 }, { "entropy": 5.596341991424561, "epoch": 0.7457741337676195, "grad_norm": 1.3203125, "learning_rate": 0.0004954592367739104, "loss": 5.5626, "mean_token_accuracy": 0.17497475147247316, "num_tokens": 14816918.0, "step": 6640 }, { "entropy": 5.6133809089660645, "epoch": 0.746335710675577, "grad_norm": 1.75, "learning_rate": 0.0004954512080323546, "loss": 5.5571, "mean_token_accuracy": 0.18172363042831421, "num_tokens": 14827420.0, "step": 6645 }, { "entropy": 5.7528026580810545, "epoch": 0.7468972875835346, "grad_norm": 1.296875, "learning_rate": 0.0004954431722715468, "loss": 5.7731, "mean_token_accuracy": 0.17284041196107863, "num_tokens": 14839209.0, "step": 6650 }, { "entropy": 5.772123146057129, "epoch": 0.7474588644914921, "grad_norm": 1.390625, "learning_rate": 0.0004954351294917428, "loss": 5.6546, "mean_token_accuracy": 0.16983917206525803, "num_tokens": 14849916.0, "step": 6655 }, { "entropy": 5.593883991241455, "epoch": 0.7480204413994497, "grad_norm": 1.7890625, "learning_rate": 0.0004954270796931989, "loss": 5.5467, "mean_token_accuracy": 0.17545504868030548, "num_tokens": 14860946.0, "step": 6660 }, { "entropy": 5.773710012435913, "epoch": 0.7485820183074072, "grad_norm": 1.28125, "learning_rate": 0.0004954190228761712, "loss": 5.6383, "mean_token_accuracy": 0.16717524081468582, "num_tokens": 14872750.0, "step": 6665 }, { "entropy": 5.68846116065979, "epoch": 0.7491435952153648, "grad_norm": 1.296875, "learning_rate": 0.0004954109590409164, "loss": 5.6227, "mean_token_accuracy": 0.17093631327152253, "num_tokens": 14883714.0, "step": 6670 }, { "entropy": 5.633935451507568, "epoch": 0.7497051721233223, "grad_norm": 1.3671875, "learning_rate": 0.0004954028881876911, "loss": 5.6325, "mean_token_accuracy": 0.17225925624370575, "num_tokens": 14895147.0, "step": 6675 }, { "entropy": 5.698961019515991, "epoch": 0.7502667490312799, "grad_norm": 1.375, "learning_rate": 0.0004953948103167524, "loss": 5.5536, "mean_token_accuracy": 0.1762816697359085, "num_tokens": 14905914.0, "step": 6680 }, { "entropy": 5.582836866378784, "epoch": 0.7508283259392374, "grad_norm": 1.578125, "learning_rate": 0.0004953867254283575, "loss": 5.5428, "mean_token_accuracy": 0.17713676244020463, "num_tokens": 14916988.0, "step": 6685 }, { "entropy": 5.6897834777832035, "epoch": 0.7513899028471949, "grad_norm": 1.5, "learning_rate": 0.0004953786335227636, "loss": 5.6518, "mean_token_accuracy": 0.17040350288152695, "num_tokens": 14928675.0, "step": 6690 }, { "entropy": 5.795252656936645, "epoch": 0.7519514797551524, "grad_norm": 1.4765625, "learning_rate": 0.0004953705346002287, "loss": 5.6581, "mean_token_accuracy": 0.17117824405431747, "num_tokens": 14939422.0, "step": 6695 }, { "entropy": 5.6437677383422855, "epoch": 0.75251305666311, "grad_norm": 1.546875, "learning_rate": 0.0004953624286610106, "loss": 5.6086, "mean_token_accuracy": 0.17704180479049683, "num_tokens": 14950156.0, "step": 6700 }, { "entropy": 5.65733003616333, "epoch": 0.7530746335710675, "grad_norm": 1.3828125, "learning_rate": 0.0004953543157053672, "loss": 5.5983, "mean_token_accuracy": 0.1764406979084015, "num_tokens": 14960535.0, "step": 6705 }, { "entropy": 5.767850303649903, "epoch": 0.7536362104790251, "grad_norm": 1.34375, "learning_rate": 0.0004953461957335569, "loss": 5.6239, "mean_token_accuracy": 0.1750498056411743, "num_tokens": 14970975.0, "step": 6710 }, { "entropy": 5.632910871505738, "epoch": 0.7541977873869826, "grad_norm": 1.375, "learning_rate": 0.0004953380687458382, "loss": 5.4731, "mean_token_accuracy": 0.18237796127796174, "num_tokens": 14981204.0, "step": 6715 }, { "entropy": 5.653511953353882, "epoch": 0.7547593642949402, "grad_norm": 1.3671875, "learning_rate": 0.0004953299347424701, "loss": 5.6468, "mean_token_accuracy": 0.17152471095323563, "num_tokens": 14991631.0, "step": 6720 }, { "entropy": 5.657448101043701, "epoch": 0.7553209412028977, "grad_norm": 1.34375, "learning_rate": 0.0004953217937237114, "loss": 5.5735, "mean_token_accuracy": 0.17640465199947358, "num_tokens": 15003873.0, "step": 6725 }, { "entropy": 5.69847002029419, "epoch": 0.7558825181108553, "grad_norm": 1.5, "learning_rate": 0.0004953136456898212, "loss": 5.6493, "mean_token_accuracy": 0.17125397473573684, "num_tokens": 15014890.0, "step": 6730 }, { "entropy": 5.604665327072143, "epoch": 0.7564440950188128, "grad_norm": 1.515625, "learning_rate": 0.0004953054906410593, "loss": 5.5194, "mean_token_accuracy": 0.18065904527902604, "num_tokens": 15025037.0, "step": 6735 }, { "entropy": 5.690511035919189, "epoch": 0.7570056719267704, "grad_norm": 1.953125, "learning_rate": 0.0004952973285776848, "loss": 5.6233, "mean_token_accuracy": 0.17375240176916124, "num_tokens": 15035722.0, "step": 6740 }, { "entropy": 5.696527576446533, "epoch": 0.7575672488347279, "grad_norm": 1.4375, "learning_rate": 0.0004952891594999582, "loss": 5.6224, "mean_token_accuracy": 0.16907656490802764, "num_tokens": 15047138.0, "step": 6745 }, { "entropy": 5.616460132598877, "epoch": 0.7581288257426855, "grad_norm": 1.71875, "learning_rate": 0.0004952809834081392, "loss": 5.5799, "mean_token_accuracy": 0.17677342891693115, "num_tokens": 15058559.0, "step": 6750 }, { "entropy": 5.669347715377808, "epoch": 0.758690402650643, "grad_norm": 1.4765625, "learning_rate": 0.0004952728003024883, "loss": 5.6034, "mean_token_accuracy": 0.17386410832405091, "num_tokens": 15070481.0, "step": 6755 }, { "entropy": 5.746075916290283, "epoch": 0.7592519795586006, "grad_norm": 1.3046875, "learning_rate": 0.0004952646101832659, "loss": 5.525, "mean_token_accuracy": 0.1773831456899643, "num_tokens": 15079844.0, "step": 6760 }, { "entropy": 5.575839519500732, "epoch": 0.7598135564665581, "grad_norm": 1.4140625, "learning_rate": 0.0004952564130507331, "loss": 5.5459, "mean_token_accuracy": 0.1829729363322258, "num_tokens": 15091197.0, "step": 6765 }, { "entropy": 5.63728141784668, "epoch": 0.7603751333745157, "grad_norm": 1.421875, "learning_rate": 0.0004952482089051506, "loss": 5.6395, "mean_token_accuracy": 0.16757640540599822, "num_tokens": 15102130.0, "step": 6770 }, { "entropy": 5.80513825416565, "epoch": 0.7609367102824732, "grad_norm": 1.34375, "learning_rate": 0.0004952399977467796, "loss": 5.7159, "mean_token_accuracy": 0.164860138297081, "num_tokens": 15113886.0, "step": 6775 }, { "entropy": 5.695002603530884, "epoch": 0.7614982871904308, "grad_norm": 1.5390625, "learning_rate": 0.0004952317795758817, "loss": 5.5309, "mean_token_accuracy": 0.1707255095243454, "num_tokens": 15125284.0, "step": 6780 }, { "entropy": 5.693516254425049, "epoch": 0.7620598640983883, "grad_norm": 1.375, "learning_rate": 0.0004952235543927185, "loss": 5.6013, "mean_token_accuracy": 0.17872631102800368, "num_tokens": 15136486.0, "step": 6785 }, { "entropy": 5.5827912330627445, "epoch": 0.7626214410063458, "grad_norm": 1.4296875, "learning_rate": 0.000495215322197552, "loss": 5.4942, "mean_token_accuracy": 0.1766755223274231, "num_tokens": 15145937.0, "step": 6790 }, { "entropy": 5.606060981750488, "epoch": 0.7631830179143033, "grad_norm": 1.3046875, "learning_rate": 0.0004952070829906442, "loss": 5.5703, "mean_token_accuracy": 0.17622093558311464, "num_tokens": 15156923.0, "step": 6795 }, { "entropy": 5.764186716079712, "epoch": 0.7637445948222609, "grad_norm": 1.5546875, "learning_rate": 0.0004951988367722574, "loss": 5.701, "mean_token_accuracy": 0.17148951441049576, "num_tokens": 15169793.0, "step": 6800 }, { "entropy": 5.666046524047852, "epoch": 0.7643061717302184, "grad_norm": 1.3984375, "learning_rate": 0.0004951905835426544, "loss": 5.4701, "mean_token_accuracy": 0.18407936692237853, "num_tokens": 15180679.0, "step": 6805 }, { "entropy": 5.658257055282593, "epoch": 0.764867748638176, "grad_norm": 1.609375, "learning_rate": 0.0004951823233020976, "loss": 5.6771, "mean_token_accuracy": 0.1721682906150818, "num_tokens": 15192298.0, "step": 6810 }, { "entropy": 5.657361793518066, "epoch": 0.7654293255461335, "grad_norm": 1.3984375, "learning_rate": 0.0004951740560508504, "loss": 5.7427, "mean_token_accuracy": 0.1654340222477913, "num_tokens": 15204759.0, "step": 6815 }, { "entropy": 5.795834302902222, "epoch": 0.7659909024540911, "grad_norm": 1.59375, "learning_rate": 0.0004951657817891758, "loss": 5.6181, "mean_token_accuracy": 0.17172770649194719, "num_tokens": 15217166.0, "step": 6820 }, { "entropy": 5.596086502075195, "epoch": 0.7665524793620486, "grad_norm": 1.5234375, "learning_rate": 0.0004951575005173373, "loss": 5.5908, "mean_token_accuracy": 0.17772889286279678, "num_tokens": 15227022.0, "step": 6825 }, { "entropy": 5.7071445941925045, "epoch": 0.7671140562700062, "grad_norm": 1.53125, "learning_rate": 0.0004951492122355986, "loss": 5.6438, "mean_token_accuracy": 0.16916121244430543, "num_tokens": 15239088.0, "step": 6830 }, { "entropy": 5.74067268371582, "epoch": 0.7676756331779637, "grad_norm": 1.390625, "learning_rate": 0.0004951409169442236, "loss": 5.6636, "mean_token_accuracy": 0.17377155274152756, "num_tokens": 15250263.0, "step": 6835 }, { "entropy": 5.614690923690796, "epoch": 0.7682372100859213, "grad_norm": 1.5234375, "learning_rate": 0.0004951326146434765, "loss": 5.56, "mean_token_accuracy": 0.17508067339658737, "num_tokens": 15263014.0, "step": 6840 }, { "entropy": 5.698054409027099, "epoch": 0.7687987869938788, "grad_norm": 1.3046875, "learning_rate": 0.0004951243053336214, "loss": 5.5488, "mean_token_accuracy": 0.17616119384765624, "num_tokens": 15274261.0, "step": 6845 }, { "entropy": 5.617717838287353, "epoch": 0.7693603639018364, "grad_norm": 1.3359375, "learning_rate": 0.0004951159890149232, "loss": 5.4812, "mean_token_accuracy": 0.17868284434080123, "num_tokens": 15284929.0, "step": 6850 }, { "entropy": 5.601969814300537, "epoch": 0.7699219408097939, "grad_norm": 1.2890625, "learning_rate": 0.0004951076656876466, "loss": 5.5905, "mean_token_accuracy": 0.1784390926361084, "num_tokens": 15296622.0, "step": 6855 }, { "entropy": 5.671678590774536, "epoch": 0.7704835177177515, "grad_norm": 1.3203125, "learning_rate": 0.0004950993353520564, "loss": 5.6416, "mean_token_accuracy": 0.16959952116012572, "num_tokens": 15308373.0, "step": 6860 }, { "entropy": 5.633020448684692, "epoch": 0.771045094625709, "grad_norm": 1.515625, "learning_rate": 0.000495090998008418, "loss": 5.5145, "mean_token_accuracy": 0.18185887783765792, "num_tokens": 15319705.0, "step": 6865 }, { "entropy": 5.718202543258667, "epoch": 0.7716066715336666, "grad_norm": 1.3984375, "learning_rate": 0.000495082653656997, "loss": 5.6745, "mean_token_accuracy": 0.16872720867395402, "num_tokens": 15330883.0, "step": 6870 }, { "entropy": 5.695891237258911, "epoch": 0.7721682484416241, "grad_norm": 1.40625, "learning_rate": 0.0004950743022980587, "loss": 5.5826, "mean_token_accuracy": 0.17275900691747664, "num_tokens": 15342294.0, "step": 6875 }, { "entropy": 5.698135662078857, "epoch": 0.7727298253495817, "grad_norm": 1.390625, "learning_rate": 0.0004950659439318696, "loss": 5.5901, "mean_token_accuracy": 0.1722102403640747, "num_tokens": 15352615.0, "step": 6880 }, { "entropy": 5.6508818626403805, "epoch": 0.7732914022575391, "grad_norm": 1.7578125, "learning_rate": 0.0004950575785586952, "loss": 5.6341, "mean_token_accuracy": 0.168660968542099, "num_tokens": 15364516.0, "step": 6885 }, { "entropy": 5.67797999382019, "epoch": 0.7738529791654967, "grad_norm": 1.3359375, "learning_rate": 0.0004950492061788023, "loss": 5.527, "mean_token_accuracy": 0.173749241232872, "num_tokens": 15374877.0, "step": 6890 }, { "entropy": 5.673302030563354, "epoch": 0.7744145560734542, "grad_norm": 1.6875, "learning_rate": 0.0004950408267924573, "loss": 5.4688, "mean_token_accuracy": 0.18849669992923737, "num_tokens": 15385250.0, "step": 6895 }, { "entropy": 5.630706882476806, "epoch": 0.7749761329814118, "grad_norm": 1.5859375, "learning_rate": 0.0004950324403999271, "loss": 5.6217, "mean_token_accuracy": 0.178818379342556, "num_tokens": 15397074.0, "step": 6900 }, { "entropy": 5.6523487091064455, "epoch": 0.7755377098893693, "grad_norm": 1.5, "learning_rate": 0.0004950240470014785, "loss": 5.6633, "mean_token_accuracy": 0.16847054213285445, "num_tokens": 15408575.0, "step": 6905 }, { "entropy": 5.721060371398925, "epoch": 0.7760992867973269, "grad_norm": 1.5703125, "learning_rate": 0.0004950156465973791, "loss": 5.5786, "mean_token_accuracy": 0.17714389264583588, "num_tokens": 15419071.0, "step": 6910 }, { "entropy": 5.595917701721191, "epoch": 0.7766608637052844, "grad_norm": 1.4609375, "learning_rate": 0.000495007239187896, "loss": 5.4627, "mean_token_accuracy": 0.1753948897123337, "num_tokens": 15430137.0, "step": 6915 }, { "entropy": 5.549996185302734, "epoch": 0.777222440613242, "grad_norm": 1.3203125, "learning_rate": 0.0004949988247732972, "loss": 5.536, "mean_token_accuracy": 0.18008177876472473, "num_tokens": 15440661.0, "step": 6920 }, { "entropy": 5.577071666717529, "epoch": 0.7777840175211995, "grad_norm": 1.8984375, "learning_rate": 0.0004949904033538504, "loss": 5.5443, "mean_token_accuracy": 0.18011982291936873, "num_tokens": 15451909.0, "step": 6925 }, { "entropy": 5.744392728805542, "epoch": 0.7783455944291571, "grad_norm": 1.390625, "learning_rate": 0.000494981974929824, "loss": 5.6133, "mean_token_accuracy": 0.17083452343940736, "num_tokens": 15462244.0, "step": 6930 }, { "entropy": 5.644606256484986, "epoch": 0.7789071713371146, "grad_norm": 1.375, "learning_rate": 0.000494973539501486, "loss": 5.6585, "mean_token_accuracy": 0.17281380891799927, "num_tokens": 15473284.0, "step": 6935 }, { "entropy": 5.587286949157715, "epoch": 0.7794687482450722, "grad_norm": 1.3125, "learning_rate": 0.0004949650970691052, "loss": 5.5591, "mean_token_accuracy": 0.1845861554145813, "num_tokens": 15484964.0, "step": 6940 }, { "entropy": 5.646401405334473, "epoch": 0.7800303251530297, "grad_norm": 1.359375, "learning_rate": 0.0004949566476329505, "loss": 5.5877, "mean_token_accuracy": 0.17619993090629577, "num_tokens": 15495922.0, "step": 6945 }, { "entropy": 5.780960130691528, "epoch": 0.7805919020609873, "grad_norm": 2.015625, "learning_rate": 0.0004949481911932908, "loss": 5.6492, "mean_token_accuracy": 0.17256713807582855, "num_tokens": 15507173.0, "step": 6950 }, { "entropy": 5.70377368927002, "epoch": 0.7811534789689448, "grad_norm": 1.671875, "learning_rate": 0.0004949397277503954, "loss": 5.6209, "mean_token_accuracy": 0.17474339306354522, "num_tokens": 15517720.0, "step": 6955 }, { "entropy": 5.71235990524292, "epoch": 0.7817150558769024, "grad_norm": 1.421875, "learning_rate": 0.0004949312573045338, "loss": 5.6394, "mean_token_accuracy": 0.1703775092959404, "num_tokens": 15529482.0, "step": 6960 }, { "entropy": 5.76483187675476, "epoch": 0.7822766327848599, "grad_norm": 1.59375, "learning_rate": 0.0004949227798559757, "loss": 5.6429, "mean_token_accuracy": 0.1658545657992363, "num_tokens": 15540522.0, "step": 6965 }, { "entropy": 5.700478982925415, "epoch": 0.7828382096928175, "grad_norm": 1.671875, "learning_rate": 0.0004949142954049909, "loss": 5.6267, "mean_token_accuracy": 0.17000363171100616, "num_tokens": 15552443.0, "step": 6970 }, { "entropy": 5.766734600067139, "epoch": 0.783399786600775, "grad_norm": 1.3828125, "learning_rate": 0.0004949058039518496, "loss": 5.664, "mean_token_accuracy": 0.17442309558391572, "num_tokens": 15563418.0, "step": 6975 }, { "entropy": 5.721600914001465, "epoch": 0.7839613635087325, "grad_norm": 1.484375, "learning_rate": 0.0004948973054968222, "loss": 5.6809, "mean_token_accuracy": 0.1688017174601555, "num_tokens": 15574301.0, "step": 6980 }, { "entropy": 5.780105543136597, "epoch": 0.78452294041669, "grad_norm": 1.3671875, "learning_rate": 0.0004948888000401794, "loss": 5.5844, "mean_token_accuracy": 0.1704667940735817, "num_tokens": 15585125.0, "step": 6985 }, { "entropy": 5.7562014102935795, "epoch": 0.7850845173246476, "grad_norm": 1.265625, "learning_rate": 0.0004948802875821918, "loss": 5.6937, "mean_token_accuracy": 0.17066754549741744, "num_tokens": 15595822.0, "step": 6990 }, { "entropy": 5.5500236511230465, "epoch": 0.7856460942326051, "grad_norm": 1.6171875, "learning_rate": 0.0004948717681231308, "loss": 5.5279, "mean_token_accuracy": 0.17664736062288283, "num_tokens": 15606835.0, "step": 6995 }, { "entropy": 5.632187032699585, "epoch": 0.7862076711405627, "grad_norm": 3.125, "learning_rate": 0.0004948632416632672, "loss": 5.6124, "mean_token_accuracy": 0.17274107187986373, "num_tokens": 15617287.0, "step": 7000 }, { "entropy": 5.8710390567779545, "epoch": 0.7867692480485202, "grad_norm": 1.5234375, "learning_rate": 0.0004948547082028728, "loss": 5.6573, "mean_token_accuracy": 0.16424071788787842, "num_tokens": 15628440.0, "step": 7005 }, { "entropy": 5.7740159034729, "epoch": 0.7873308249564778, "grad_norm": 1.421875, "learning_rate": 0.0004948461677422193, "loss": 5.7659, "mean_token_accuracy": 0.16086588203907012, "num_tokens": 15640677.0, "step": 7010 }, { "entropy": 5.702903985977173, "epoch": 0.7878924018644353, "grad_norm": 1.4921875, "learning_rate": 0.0004948376202815785, "loss": 5.5799, "mean_token_accuracy": 0.17863162457942963, "num_tokens": 15651941.0, "step": 7015 }, { "entropy": 5.643584585189819, "epoch": 0.7884539787723929, "grad_norm": 1.6015625, "learning_rate": 0.0004948290658212225, "loss": 5.5872, "mean_token_accuracy": 0.1744334802031517, "num_tokens": 15663513.0, "step": 7020 }, { "entropy": 5.612797451019287, "epoch": 0.7890155556803504, "grad_norm": 1.515625, "learning_rate": 0.0004948205043614239, "loss": 5.5694, "mean_token_accuracy": 0.17362559586763382, "num_tokens": 15675548.0, "step": 7025 }, { "entropy": 5.7275231838226315, "epoch": 0.789577132588308, "grad_norm": 1.6484375, "learning_rate": 0.0004948119359024551, "loss": 5.6234, "mean_token_accuracy": 0.17916473597288132, "num_tokens": 15685365.0, "step": 7030 }, { "entropy": 5.686577701568604, "epoch": 0.7901387094962655, "grad_norm": 1.3046875, "learning_rate": 0.0004948033604445891, "loss": 5.6126, "mean_token_accuracy": 0.17018286287784576, "num_tokens": 15696112.0, "step": 7035 }, { "entropy": 5.621775579452515, "epoch": 0.7907002864042231, "grad_norm": 1.40625, "learning_rate": 0.0004947947779880988, "loss": 5.5484, "mean_token_accuracy": 0.1771180063486099, "num_tokens": 15707414.0, "step": 7040 }, { "entropy": 5.734884214401245, "epoch": 0.7912618633121806, "grad_norm": 1.4296875, "learning_rate": 0.0004947861885332576, "loss": 5.6507, "mean_token_accuracy": 0.17650367319583893, "num_tokens": 15719077.0, "step": 7045 }, { "entropy": 5.712475728988648, "epoch": 0.7918234402201382, "grad_norm": 1.375, "learning_rate": 0.0004947775920803388, "loss": 5.6426, "mean_token_accuracy": 0.1715145543217659, "num_tokens": 15730497.0, "step": 7050 }, { "entropy": 5.666735076904297, "epoch": 0.7923850171280957, "grad_norm": 1.4921875, "learning_rate": 0.0004947689886296162, "loss": 5.5464, "mean_token_accuracy": 0.1741068556904793, "num_tokens": 15741724.0, "step": 7055 }, { "entropy": 5.691272640228272, "epoch": 0.7929465940360533, "grad_norm": 1.8125, "learning_rate": 0.000494760378181364, "loss": 5.627, "mean_token_accuracy": 0.1703273355960846, "num_tokens": 15751868.0, "step": 7060 }, { "entropy": 5.659696960449219, "epoch": 0.7935081709440108, "grad_norm": 1.5625, "learning_rate": 0.0004947517607358559, "loss": 5.6401, "mean_token_accuracy": 0.16680581122636795, "num_tokens": 15762783.0, "step": 7065 }, { "entropy": 5.722996759414673, "epoch": 0.7940697478519684, "grad_norm": 1.5078125, "learning_rate": 0.0004947431362933666, "loss": 5.6208, "mean_token_accuracy": 0.17095878720283508, "num_tokens": 15774155.0, "step": 7070 }, { "entropy": 5.82449369430542, "epoch": 0.7946313247599258, "grad_norm": 1.2890625, "learning_rate": 0.0004947345048541706, "loss": 5.6404, "mean_token_accuracy": 0.1689218834042549, "num_tokens": 15785034.0, "step": 7075 }, { "entropy": 5.595941543579102, "epoch": 0.7951929016678834, "grad_norm": 1.515625, "learning_rate": 0.0004947258664185427, "loss": 5.5844, "mean_token_accuracy": 0.17003095299005508, "num_tokens": 15795959.0, "step": 7080 }, { "entropy": 5.658422422409058, "epoch": 0.7957544785758409, "grad_norm": 1.4375, "learning_rate": 0.0004947172209867581, "loss": 5.4638, "mean_token_accuracy": 0.18406398892402648, "num_tokens": 15805561.0, "step": 7085 }, { "entropy": 5.713173961639404, "epoch": 0.7963160554837985, "grad_norm": 1.3359375, "learning_rate": 0.0004947085685590919, "loss": 5.5692, "mean_token_accuracy": 0.17338566929101945, "num_tokens": 15816883.0, "step": 7090 }, { "entropy": 5.580157470703125, "epoch": 0.796877632391756, "grad_norm": 1.2890625, "learning_rate": 0.0004946999091358196, "loss": 5.5261, "mean_token_accuracy": 0.17477951496839522, "num_tokens": 15827753.0, "step": 7095 }, { "entropy": 5.665834951400757, "epoch": 0.7974392092997136, "grad_norm": 1.2890625, "learning_rate": 0.000494691242717217, "loss": 5.6449, "mean_token_accuracy": 0.1671520546078682, "num_tokens": 15840346.0, "step": 7100 }, { "entropy": 5.718213987350464, "epoch": 0.7980007862076711, "grad_norm": 1.828125, "learning_rate": 0.0004946825693035601, "loss": 5.5982, "mean_token_accuracy": 0.17325277775526046, "num_tokens": 15851036.0, "step": 7105 }, { "entropy": 5.6614522457122805, "epoch": 0.7985623631156287, "grad_norm": 1.25, "learning_rate": 0.000494673888895125, "loss": 5.5575, "mean_token_accuracy": 0.16837076246738433, "num_tokens": 15863154.0, "step": 7110 }, { "entropy": 5.720604181289673, "epoch": 0.7991239400235862, "grad_norm": 1.4453125, "learning_rate": 0.0004946652014921881, "loss": 5.6639, "mean_token_accuracy": 0.16528711915016175, "num_tokens": 15874543.0, "step": 7115 }, { "entropy": 5.706193590164185, "epoch": 0.7996855169315438, "grad_norm": 1.53125, "learning_rate": 0.0004946565070950259, "loss": 5.5968, "mean_token_accuracy": 0.17797693461179734, "num_tokens": 15886221.0, "step": 7120 }, { "entropy": 5.709640121459961, "epoch": 0.8002470938395013, "grad_norm": 1.6328125, "learning_rate": 0.0004946478057039153, "loss": 5.6053, "mean_token_accuracy": 0.17097271531820296, "num_tokens": 15897602.0, "step": 7125 }, { "entropy": 5.709883308410644, "epoch": 0.8008086707474589, "grad_norm": 1.4375, "learning_rate": 0.0004946390973191335, "loss": 5.6058, "mean_token_accuracy": 0.171327905356884, "num_tokens": 15908030.0, "step": 7130 }, { "entropy": 5.781009912490845, "epoch": 0.8013702476554164, "grad_norm": 1.6796875, "learning_rate": 0.0004946303819409575, "loss": 5.6467, "mean_token_accuracy": 0.17163679897785186, "num_tokens": 15918341.0, "step": 7135 }, { "entropy": 5.623637104034424, "epoch": 0.801931824563374, "grad_norm": 1.6796875, "learning_rate": 0.0004946216595696652, "loss": 5.6264, "mean_token_accuracy": 0.17764584273099898, "num_tokens": 15929144.0, "step": 7140 }, { "entropy": 5.7017920970916744, "epoch": 0.8024934014713315, "grad_norm": 1.4453125, "learning_rate": 0.0004946129302055338, "loss": 5.5534, "mean_token_accuracy": 0.1748026505112648, "num_tokens": 15940013.0, "step": 7145 }, { "entropy": 5.746622562408447, "epoch": 0.8030549783792891, "grad_norm": 1.7421875, "learning_rate": 0.0004946041938488417, "loss": 5.6151, "mean_token_accuracy": 0.17079914808273317, "num_tokens": 15950680.0, "step": 7150 }, { "entropy": 5.644058322906494, "epoch": 0.8036165552872466, "grad_norm": 1.625, "learning_rate": 0.0004945954504998668, "loss": 5.6012, "mean_token_accuracy": 0.17851518392562865, "num_tokens": 15961462.0, "step": 7155 }, { "entropy": 5.67428412437439, "epoch": 0.8041781321952042, "grad_norm": 1.375, "learning_rate": 0.0004945867001588877, "loss": 5.5232, "mean_token_accuracy": 0.17970660775899888, "num_tokens": 15972788.0, "step": 7160 }, { "entropy": 5.655921173095703, "epoch": 0.8047397091031617, "grad_norm": 1.8125, "learning_rate": 0.0004945779428261827, "loss": 5.5807, "mean_token_accuracy": 0.17457723915576934, "num_tokens": 15983244.0, "step": 7165 }, { "entropy": 5.596137046813965, "epoch": 0.8053012860111193, "grad_norm": 1.5703125, "learning_rate": 0.000494569178502031, "loss": 5.6844, "mean_token_accuracy": 0.16675399839878083, "num_tokens": 15994325.0, "step": 7170 }, { "entropy": 5.77509298324585, "epoch": 0.8058628629190767, "grad_norm": 1.3828125, "learning_rate": 0.0004945604071867114, "loss": 5.6754, "mean_token_accuracy": 0.1712609902024269, "num_tokens": 16005237.0, "step": 7175 }, { "entropy": 5.679333925247192, "epoch": 0.8064244398270343, "grad_norm": 1.3359375, "learning_rate": 0.0004945516288805035, "loss": 5.5028, "mean_token_accuracy": 0.180667944252491, "num_tokens": 16015943.0, "step": 7180 }, { "entropy": 5.576353931427002, "epoch": 0.8069860167349918, "grad_norm": 1.921875, "learning_rate": 0.0004945428435836864, "loss": 5.5114, "mean_token_accuracy": 0.17413717806339263, "num_tokens": 16026727.0, "step": 7185 }, { "entropy": 5.622631072998047, "epoch": 0.8075475936429494, "grad_norm": 1.5859375, "learning_rate": 0.0004945340512965401, "loss": 5.5532, "mean_token_accuracy": 0.16718171387910843, "num_tokens": 16039021.0, "step": 7190 }, { "entropy": 5.626061344146729, "epoch": 0.8081091705509069, "grad_norm": 1.796875, "learning_rate": 0.0004945252520193443, "loss": 5.5031, "mean_token_accuracy": 0.17845340073108673, "num_tokens": 16050312.0, "step": 7195 }, { "entropy": 5.668435192108154, "epoch": 0.8086707474588645, "grad_norm": 1.5390625, "learning_rate": 0.0004945164457523795, "loss": 5.4561, "mean_token_accuracy": 0.18104152232408524, "num_tokens": 16060009.0, "step": 7200 }, { "entropy": 5.589456796646118, "epoch": 0.809232324366822, "grad_norm": 1.5390625, "learning_rate": 0.0004945076324959258, "loss": 5.5798, "mean_token_accuracy": 0.17277259826660157, "num_tokens": 16072025.0, "step": 7205 }, { "entropy": 5.730244207382202, "epoch": 0.8097939012747796, "grad_norm": 1.4296875, "learning_rate": 0.0004944988122502641, "loss": 5.6001, "mean_token_accuracy": 0.17296409606933594, "num_tokens": 16083229.0, "step": 7210 }, { "entropy": 5.6034921169281, "epoch": 0.8103554781827371, "grad_norm": 1.5078125, "learning_rate": 0.000494489985015675, "loss": 5.4848, "mean_token_accuracy": 0.17338486462831498, "num_tokens": 16094936.0, "step": 7215 }, { "entropy": 5.629249382019043, "epoch": 0.8109170550906947, "grad_norm": 1.390625, "learning_rate": 0.0004944811507924396, "loss": 5.5966, "mean_token_accuracy": 0.17871529906988143, "num_tokens": 16106182.0, "step": 7220 }, { "entropy": 5.612615060806275, "epoch": 0.8114786319986522, "grad_norm": 1.25, "learning_rate": 0.0004944723095808393, "loss": 5.5095, "mean_token_accuracy": 0.18377710580825807, "num_tokens": 16117006.0, "step": 7225 }, { "entropy": 5.6077577590942385, "epoch": 0.8120402089066098, "grad_norm": 1.484375, "learning_rate": 0.0004944634613811555, "loss": 5.5422, "mean_token_accuracy": 0.1714983433485031, "num_tokens": 16128892.0, "step": 7230 }, { "entropy": 5.727390718460083, "epoch": 0.8126017858145673, "grad_norm": 1.3984375, "learning_rate": 0.00049445460619367, "loss": 5.6503, "mean_token_accuracy": 0.17741401940584184, "num_tokens": 16139953.0, "step": 7235 }, { "entropy": 5.771072483062744, "epoch": 0.8131633627225249, "grad_norm": 1.734375, "learning_rate": 0.0004944457440186648, "loss": 5.6187, "mean_token_accuracy": 0.1663561910390854, "num_tokens": 16150103.0, "step": 7240 }, { "entropy": 5.621788215637207, "epoch": 0.8137249396304824, "grad_norm": 2.03125, "learning_rate": 0.0004944368748564219, "loss": 5.7002, "mean_token_accuracy": 0.167274634540081, "num_tokens": 16161666.0, "step": 7245 }, { "entropy": 5.6615965366363525, "epoch": 0.81428651653844, "grad_norm": 1.7109375, "learning_rate": 0.0004944279987072238, "loss": 5.6388, "mean_token_accuracy": 0.16890483051538469, "num_tokens": 16172524.0, "step": 7250 }, { "entropy": 5.7637022018432615, "epoch": 0.8148480934463975, "grad_norm": 1.546875, "learning_rate": 0.0004944191155713531, "loss": 5.5756, "mean_token_accuracy": 0.1765427216887474, "num_tokens": 16183023.0, "step": 7255 }, { "entropy": 5.686658239364624, "epoch": 0.8154096703543551, "grad_norm": 1.8828125, "learning_rate": 0.0004944102254490928, "loss": 5.5918, "mean_token_accuracy": 0.17796089202165605, "num_tokens": 16193504.0, "step": 7260 }, { "entropy": 5.630303049087525, "epoch": 0.8159712472623126, "grad_norm": 1.5234375, "learning_rate": 0.0004944013283407257, "loss": 5.5496, "mean_token_accuracy": 0.17709226608276368, "num_tokens": 16204730.0, "step": 7265 }, { "entropy": 5.6650426387786865, "epoch": 0.8165328241702701, "grad_norm": 1.4921875, "learning_rate": 0.0004943924242465352, "loss": 5.5613, "mean_token_accuracy": 0.1778118908405304, "num_tokens": 16214496.0, "step": 7270 }, { "entropy": 5.608745145797729, "epoch": 0.8170944010782276, "grad_norm": 1.4765625, "learning_rate": 0.0004943835131668049, "loss": 5.5023, "mean_token_accuracy": 0.18091920465230943, "num_tokens": 16225494.0, "step": 7275 }, { "entropy": 5.569278240203857, "epoch": 0.8176559779861852, "grad_norm": 1.359375, "learning_rate": 0.0004943745951018184, "loss": 5.4483, "mean_token_accuracy": 0.17797216773033142, "num_tokens": 16236385.0, "step": 7280 }, { "entropy": 5.640453624725342, "epoch": 0.8182175548941427, "grad_norm": 1.640625, "learning_rate": 0.0004943656700518597, "loss": 5.6211, "mean_token_accuracy": 0.1828884169459343, "num_tokens": 16247300.0, "step": 7285 }, { "entropy": 5.715027952194214, "epoch": 0.8187791318021003, "grad_norm": 1.2734375, "learning_rate": 0.0004943567380172129, "loss": 5.6553, "mean_token_accuracy": 0.17173643559217452, "num_tokens": 16259326.0, "step": 7290 }, { "entropy": 5.711592769622802, "epoch": 0.8193407087100578, "grad_norm": 1.6171875, "learning_rate": 0.0004943477989981627, "loss": 5.6291, "mean_token_accuracy": 0.17496313005685807, "num_tokens": 16270559.0, "step": 7295 }, { "entropy": 5.681230926513672, "epoch": 0.8199022856180154, "grad_norm": 1.5546875, "learning_rate": 0.0004943388529949933, "loss": 5.6011, "mean_token_accuracy": 0.16669342219829558, "num_tokens": 16283120.0, "step": 7300 }, { "entropy": 5.798020315170288, "epoch": 0.8204638625259729, "grad_norm": 1.4375, "learning_rate": 0.0004943299000079899, "loss": 5.6213, "mean_token_accuracy": 0.17745826691389083, "num_tokens": 16293449.0, "step": 7305 }, { "entropy": 5.665607500076294, "epoch": 0.8210254394339305, "grad_norm": 1.6328125, "learning_rate": 0.0004943209400374373, "loss": 5.6342, "mean_token_accuracy": 0.16801470518112183, "num_tokens": 16305144.0, "step": 7310 }, { "entropy": 5.592559432983398, "epoch": 0.821587016341888, "grad_norm": 1.3203125, "learning_rate": 0.000494311973083621, "loss": 5.4582, "mean_token_accuracy": 0.17840937823057174, "num_tokens": 16316728.0, "step": 7315 }, { "entropy": 5.7071305274963375, "epoch": 0.8221485932498456, "grad_norm": 1.8984375, "learning_rate": 0.0004943029991468264, "loss": 5.7375, "mean_token_accuracy": 0.16938112676143646, "num_tokens": 16329117.0, "step": 7320 }, { "entropy": 5.769921779632568, "epoch": 0.8227101701578031, "grad_norm": 1.3828125, "learning_rate": 0.0004942940182273393, "loss": 5.6999, "mean_token_accuracy": 0.1706177443265915, "num_tokens": 16341651.0, "step": 7325 }, { "entropy": 5.79766092300415, "epoch": 0.8232717470657607, "grad_norm": 1.34375, "learning_rate": 0.0004942850303254455, "loss": 5.6691, "mean_token_accuracy": 0.17348309159278869, "num_tokens": 16353220.0, "step": 7330 }, { "entropy": 5.774486017227173, "epoch": 0.8238333239737182, "grad_norm": 1.359375, "learning_rate": 0.0004942760354414313, "loss": 5.706, "mean_token_accuracy": 0.1695014789700508, "num_tokens": 16363748.0, "step": 7335 }, { "entropy": 5.521135091781616, "epoch": 0.8243949008816758, "grad_norm": 1.3828125, "learning_rate": 0.0004942670335755831, "loss": 5.3854, "mean_token_accuracy": 0.18615321964025497, "num_tokens": 16374086.0, "step": 7340 }, { "entropy": 5.6541694641113285, "epoch": 0.8249564777896333, "grad_norm": 1.4609375, "learning_rate": 0.0004942580247281876, "loss": 5.5564, "mean_token_accuracy": 0.17574853003025054, "num_tokens": 16384140.0, "step": 7345 }, { "entropy": 5.707195806503296, "epoch": 0.8255180546975909, "grad_norm": 1.5625, "learning_rate": 0.0004942490088995315, "loss": 5.6636, "mean_token_accuracy": 0.1692671984434128, "num_tokens": 16395940.0, "step": 7350 }, { "entropy": 5.629947328567505, "epoch": 0.8260796316055484, "grad_norm": 1.34375, "learning_rate": 0.0004942399860899018, "loss": 5.5087, "mean_token_accuracy": 0.18015119284391404, "num_tokens": 16406667.0, "step": 7355 }, { "entropy": 5.7489300727844235, "epoch": 0.826641208513506, "grad_norm": 1.3203125, "learning_rate": 0.0004942309562995862, "loss": 5.6606, "mean_token_accuracy": 0.165461665391922, "num_tokens": 16418621.0, "step": 7360 }, { "entropy": 5.661215448379517, "epoch": 0.8272027854214634, "grad_norm": 1.40625, "learning_rate": 0.0004942219195288716, "loss": 5.5629, "mean_token_accuracy": 0.1782558485865593, "num_tokens": 16429576.0, "step": 7365 }, { "entropy": 5.675850677490234, "epoch": 0.827764362329421, "grad_norm": 1.4140625, "learning_rate": 0.0004942128757780463, "loss": 5.6791, "mean_token_accuracy": 0.16648157685995102, "num_tokens": 16441004.0, "step": 7370 }, { "entropy": 5.695897388458252, "epoch": 0.8283259392373785, "grad_norm": 1.34375, "learning_rate": 0.0004942038250473979, "loss": 5.6208, "mean_token_accuracy": 0.16576655954122543, "num_tokens": 16452183.0, "step": 7375 }, { "entropy": 5.650100517272949, "epoch": 0.8288875161453361, "grad_norm": 1.4765625, "learning_rate": 0.0004941947673372147, "loss": 5.5744, "mean_token_accuracy": 0.17556263953447343, "num_tokens": 16463552.0, "step": 7380 }, { "entropy": 5.723178291320801, "epoch": 0.8294490930532936, "grad_norm": 1.4375, "learning_rate": 0.0004941857026477851, "loss": 5.6099, "mean_token_accuracy": 0.1799635797739029, "num_tokens": 16474062.0, "step": 7385 }, { "entropy": 5.752410173416138, "epoch": 0.8300106699612512, "grad_norm": 1.390625, "learning_rate": 0.0004941766309793978, "loss": 5.6976, "mean_token_accuracy": 0.17354531735181808, "num_tokens": 16487377.0, "step": 7390 }, { "entropy": 5.755760908126831, "epoch": 0.8305722468692087, "grad_norm": 1.390625, "learning_rate": 0.0004941675523323414, "loss": 5.6332, "mean_token_accuracy": 0.18097470849752426, "num_tokens": 16499704.0, "step": 7395 }, { "entropy": 5.6458765983581545, "epoch": 0.8311338237771663, "grad_norm": 1.4609375, "learning_rate": 0.0004941584667069052, "loss": 5.6438, "mean_token_accuracy": 0.17571662366390228, "num_tokens": 16511954.0, "step": 7400 }, { "entropy": 5.5650115489959715, "epoch": 0.8316954006851238, "grad_norm": 1.53125, "learning_rate": 0.0004941493741033784, "loss": 5.479, "mean_token_accuracy": 0.1725131541490555, "num_tokens": 16522602.0, "step": 7405 }, { "entropy": 5.740706253051758, "epoch": 0.8322569775930814, "grad_norm": 1.609375, "learning_rate": 0.0004941402745220507, "loss": 5.6325, "mean_token_accuracy": 0.16962281316518785, "num_tokens": 16534233.0, "step": 7410 }, { "entropy": 5.7556068897247314, "epoch": 0.8328185545010389, "grad_norm": 1.5859375, "learning_rate": 0.0004941311679632115, "loss": 5.7121, "mean_token_accuracy": 0.17037609368562698, "num_tokens": 16546120.0, "step": 7415 }, { "entropy": 5.709545755386353, "epoch": 0.8333801314089965, "grad_norm": 1.421875, "learning_rate": 0.000494122054427151, "loss": 5.5935, "mean_token_accuracy": 0.1746015027165413, "num_tokens": 16556830.0, "step": 7420 }, { "entropy": 5.644628953933716, "epoch": 0.833941708316954, "grad_norm": 1.671875, "learning_rate": 0.0004941129339141592, "loss": 5.5573, "mean_token_accuracy": 0.17804006040096282, "num_tokens": 16567436.0, "step": 7425 }, { "entropy": 5.660109615325927, "epoch": 0.8345032852249116, "grad_norm": 1.328125, "learning_rate": 0.0004941038064245267, "loss": 5.5257, "mean_token_accuracy": 0.1747888594865799, "num_tokens": 16577807.0, "step": 7430 }, { "entropy": 5.707765102386475, "epoch": 0.8350648621328691, "grad_norm": 1.2734375, "learning_rate": 0.000494094671958544, "loss": 5.6211, "mean_token_accuracy": 0.17427547425031661, "num_tokens": 16589745.0, "step": 7435 }, { "entropy": 5.779169940948487, "epoch": 0.8356264390408267, "grad_norm": 1.515625, "learning_rate": 0.0004940855305165019, "loss": 5.6572, "mean_token_accuracy": 0.17683361768722533, "num_tokens": 16600727.0, "step": 7440 }, { "entropy": 5.661066389083862, "epoch": 0.8361880159487842, "grad_norm": 1.828125, "learning_rate": 0.0004940763820986916, "loss": 5.5597, "mean_token_accuracy": 0.17430997490882874, "num_tokens": 16611091.0, "step": 7445 }, { "entropy": 5.582389688491821, "epoch": 0.8367495928567418, "grad_norm": 1.34375, "learning_rate": 0.0004940672267054044, "loss": 5.5401, "mean_token_accuracy": 0.17366688549518586, "num_tokens": 16622550.0, "step": 7450 }, { "entropy": 5.662583303451538, "epoch": 0.8373111697646993, "grad_norm": 1.3046875, "learning_rate": 0.0004940580643369316, "loss": 5.5482, "mean_token_accuracy": 0.17264899015426635, "num_tokens": 16634243.0, "step": 7455 }, { "entropy": 5.637042140960693, "epoch": 0.8378727466726568, "grad_norm": 1.390625, "learning_rate": 0.0004940488949935651, "loss": 5.5622, "mean_token_accuracy": 0.1711127832531929, "num_tokens": 16645266.0, "step": 7460 }, { "entropy": 5.686684608459473, "epoch": 0.8384343235806143, "grad_norm": 1.5234375, "learning_rate": 0.0004940397186755968, "loss": 5.5659, "mean_token_accuracy": 0.17493919879198075, "num_tokens": 16654365.0, "step": 7465 }, { "entropy": 5.683757019042969, "epoch": 0.8389959004885719, "grad_norm": 1.6171875, "learning_rate": 0.0004940305353833191, "loss": 5.5409, "mean_token_accuracy": 0.18146927505731583, "num_tokens": 16665251.0, "step": 7470 }, { "entropy": 5.676362562179565, "epoch": 0.8395574773965294, "grad_norm": 1.390625, "learning_rate": 0.000494021345117024, "loss": 5.5938, "mean_token_accuracy": 0.17529145181179046, "num_tokens": 16676209.0, "step": 7475 }, { "entropy": 5.618336915969849, "epoch": 0.840119054304487, "grad_norm": 1.703125, "learning_rate": 0.0004940121478770044, "loss": 5.5403, "mean_token_accuracy": 0.17493845522403717, "num_tokens": 16687213.0, "step": 7480 }, { "entropy": 5.630944728851318, "epoch": 0.8406806312124445, "grad_norm": 1.4375, "learning_rate": 0.0004940029436635531, "loss": 5.5802, "mean_token_accuracy": 0.18078657239675522, "num_tokens": 16697920.0, "step": 7485 }, { "entropy": 5.627004718780517, "epoch": 0.8412422081204021, "grad_norm": 1.7109375, "learning_rate": 0.0004939937324769631, "loss": 5.5623, "mean_token_accuracy": 0.17084627151489257, "num_tokens": 16707815.0, "step": 7490 }, { "entropy": 5.632286834716797, "epoch": 0.8418037850283596, "grad_norm": 1.53125, "learning_rate": 0.0004939845143175276, "loss": 5.4714, "mean_token_accuracy": 0.1783707097172737, "num_tokens": 16719221.0, "step": 7495 }, { "entropy": 5.597582626342773, "epoch": 0.8423653619363172, "grad_norm": 1.90625, "learning_rate": 0.0004939752891855404, "loss": 5.5105, "mean_token_accuracy": 0.17155885994434356, "num_tokens": 16731741.0, "step": 7500 }, { "entropy": 5.613684749603271, "epoch": 0.8429269388442747, "grad_norm": 1.546875, "learning_rate": 0.0004939660570812951, "loss": 5.5279, "mean_token_accuracy": 0.18077764958143233, "num_tokens": 16742795.0, "step": 7505 }, { "entropy": 5.636168098449707, "epoch": 0.8434885157522323, "grad_norm": 1.8125, "learning_rate": 0.0004939568180050855, "loss": 5.524, "mean_token_accuracy": 0.177456533908844, "num_tokens": 16753139.0, "step": 7510 }, { "entropy": 5.653849363327026, "epoch": 0.8440500926601898, "grad_norm": 1.453125, "learning_rate": 0.0004939475719572059, "loss": 5.5368, "mean_token_accuracy": 0.17530351132154465, "num_tokens": 16764246.0, "step": 7515 }, { "entropy": 5.70451078414917, "epoch": 0.8446116695681474, "grad_norm": 1.546875, "learning_rate": 0.0004939383189379507, "loss": 5.6509, "mean_token_accuracy": 0.1700239211320877, "num_tokens": 16776039.0, "step": 7520 }, { "entropy": 5.718337535858154, "epoch": 0.8451732464761049, "grad_norm": 1.6484375, "learning_rate": 0.0004939290589476145, "loss": 5.6344, "mean_token_accuracy": 0.17975671738386154, "num_tokens": 16786979.0, "step": 7525 }, { "entropy": 5.705946540832519, "epoch": 0.8457348233840625, "grad_norm": 1.3828125, "learning_rate": 0.0004939197919864922, "loss": 5.6571, "mean_token_accuracy": 0.17143665701150895, "num_tokens": 16798113.0, "step": 7530 }, { "entropy": 5.6824140548706055, "epoch": 0.84629640029202, "grad_norm": 1.5625, "learning_rate": 0.0004939105180548788, "loss": 5.5921, "mean_token_accuracy": 0.17321973741054536, "num_tokens": 16809072.0, "step": 7535 }, { "entropy": 5.61365909576416, "epoch": 0.8468579771999776, "grad_norm": 1.5, "learning_rate": 0.0004939012371530696, "loss": 5.3964, "mean_token_accuracy": 0.17975719422101974, "num_tokens": 16819548.0, "step": 7540 }, { "entropy": 5.733366680145264, "epoch": 0.8474195541079351, "grad_norm": 1.78125, "learning_rate": 0.0004938919492813601, "loss": 5.7082, "mean_token_accuracy": 0.16560092866420745, "num_tokens": 16831935.0, "step": 7545 }, { "entropy": 5.675737428665161, "epoch": 0.8479811310158927, "grad_norm": 1.8359375, "learning_rate": 0.0004938826544400461, "loss": 5.604, "mean_token_accuracy": 0.17931524962186812, "num_tokens": 16842961.0, "step": 7550 }, { "entropy": 5.6335454940795895, "epoch": 0.8485427079238502, "grad_norm": 1.4609375, "learning_rate": 0.0004938733526294234, "loss": 5.5092, "mean_token_accuracy": 0.17333014458417892, "num_tokens": 16854392.0, "step": 7555 }, { "entropy": 5.620349311828614, "epoch": 0.8491042848318077, "grad_norm": 1.6328125, "learning_rate": 0.0004938640438497883, "loss": 5.5988, "mean_token_accuracy": 0.16811076998710633, "num_tokens": 16865443.0, "step": 7560 }, { "entropy": 5.677863216400146, "epoch": 0.8496658617397652, "grad_norm": 1.453125, "learning_rate": 0.0004938547281014372, "loss": 5.5517, "mean_token_accuracy": 0.17474559247493743, "num_tokens": 16876854.0, "step": 7565 }, { "entropy": 5.7703766345977785, "epoch": 0.8502274386477228, "grad_norm": 1.4921875, "learning_rate": 0.0004938454053846666, "loss": 5.6388, "mean_token_accuracy": 0.1716684192419052, "num_tokens": 16888823.0, "step": 7570 }, { "entropy": 5.61264853477478, "epoch": 0.8507890155556803, "grad_norm": 1.875, "learning_rate": 0.0004938360756997735, "loss": 5.565, "mean_token_accuracy": 0.1738715797662735, "num_tokens": 16898807.0, "step": 7575 }, { "entropy": 5.690545082092285, "epoch": 0.8513505924636379, "grad_norm": 1.84375, "learning_rate": 0.0004938267390470547, "loss": 5.6812, "mean_token_accuracy": 0.16348067820072174, "num_tokens": 16911258.0, "step": 7580 }, { "entropy": 5.783576726913452, "epoch": 0.8519121693715954, "grad_norm": 1.625, "learning_rate": 0.0004938173954268079, "loss": 5.6417, "mean_token_accuracy": 0.17234276682138444, "num_tokens": 16922557.0, "step": 7585 }, { "entropy": 5.723300170898438, "epoch": 0.852473746279553, "grad_norm": 1.5390625, "learning_rate": 0.0004938080448393302, "loss": 5.66, "mean_token_accuracy": 0.16851891279220582, "num_tokens": 16935330.0, "step": 7590 }, { "entropy": 5.723967742919922, "epoch": 0.8530353231875105, "grad_norm": 1.4765625, "learning_rate": 0.0004937986872849195, "loss": 5.5626, "mean_token_accuracy": 0.1776669666171074, "num_tokens": 16945361.0, "step": 7595 }, { "entropy": 5.565654373168945, "epoch": 0.8535969000954681, "grad_norm": 1.671875, "learning_rate": 0.0004937893227638738, "loss": 5.4383, "mean_token_accuracy": 0.18152663558721543, "num_tokens": 16955363.0, "step": 7600 }, { "entropy": 5.56234769821167, "epoch": 0.8541584770034256, "grad_norm": 1.640625, "learning_rate": 0.0004937799512764912, "loss": 5.5148, "mean_token_accuracy": 0.17852590829133988, "num_tokens": 16965267.0, "step": 7605 }, { "entropy": 5.671128654479981, "epoch": 0.8547200539113832, "grad_norm": 1.6796875, "learning_rate": 0.00049377057282307, "loss": 5.7321, "mean_token_accuracy": 0.17176787555217743, "num_tokens": 16977528.0, "step": 7610 }, { "entropy": 5.715606927871704, "epoch": 0.8552816308193407, "grad_norm": 1.796875, "learning_rate": 0.000493761187403909, "loss": 5.5643, "mean_token_accuracy": 0.17219118773937225, "num_tokens": 16987326.0, "step": 7615 }, { "entropy": 5.799017238616943, "epoch": 0.8558432077272983, "grad_norm": 2.078125, "learning_rate": 0.000493751795019307, "loss": 5.6114, "mean_token_accuracy": 0.1744072198867798, "num_tokens": 16999127.0, "step": 7620 }, { "entropy": 5.582177782058716, "epoch": 0.8564047846352558, "grad_norm": 1.4453125, "learning_rate": 0.0004937423956695629, "loss": 5.5232, "mean_token_accuracy": 0.18371396213769914, "num_tokens": 17009929.0, "step": 7625 }, { "entropy": 5.713424921035767, "epoch": 0.8569663615432134, "grad_norm": 1.546875, "learning_rate": 0.0004937329893549762, "loss": 5.6514, "mean_token_accuracy": 0.17402349263429642, "num_tokens": 17020909.0, "step": 7630 }, { "entropy": 5.744926929473877, "epoch": 0.8575279384511709, "grad_norm": 1.390625, "learning_rate": 0.0004937235760758462, "loss": 5.5807, "mean_token_accuracy": 0.17321668565273285, "num_tokens": 17031358.0, "step": 7635 }, { "entropy": 5.654985761642456, "epoch": 0.8580895153591285, "grad_norm": 1.7421875, "learning_rate": 0.0004937141558324726, "loss": 5.6242, "mean_token_accuracy": 0.17349520176649094, "num_tokens": 17042566.0, "step": 7640 }, { "entropy": 5.677562236785889, "epoch": 0.858651092267086, "grad_norm": 1.46875, "learning_rate": 0.0004937047286251556, "loss": 5.6472, "mean_token_accuracy": 0.16312987059354783, "num_tokens": 17054998.0, "step": 7645 }, { "entropy": 5.6565553665161135, "epoch": 0.8592126691750436, "grad_norm": 1.9296875, "learning_rate": 0.0004936952944541952, "loss": 5.512, "mean_token_accuracy": 0.17477733939886092, "num_tokens": 17064876.0, "step": 7650 }, { "entropy": 5.647423267364502, "epoch": 0.859774246083001, "grad_norm": 1.5390625, "learning_rate": 0.0004936858533198917, "loss": 5.5621, "mean_token_accuracy": 0.17949966639280318, "num_tokens": 17075310.0, "step": 7655 }, { "entropy": 5.519606304168701, "epoch": 0.8603358229909586, "grad_norm": 1.4921875, "learning_rate": 0.000493676405222546, "loss": 5.4676, "mean_token_accuracy": 0.17772774249315262, "num_tokens": 17086023.0, "step": 7660 }, { "entropy": 5.5962433338165285, "epoch": 0.8608973998989161, "grad_norm": 1.328125, "learning_rate": 0.0004936669501624586, "loss": 5.5539, "mean_token_accuracy": 0.17585509717464448, "num_tokens": 17097554.0, "step": 7665 }, { "entropy": 5.8958173274993895, "epoch": 0.8614589768068737, "grad_norm": 6.15625, "learning_rate": 0.0004936574881399308, "loss": 5.6789, "mean_token_accuracy": 0.17030972838401795, "num_tokens": 17108890.0, "step": 7670 }, { "entropy": 5.694438219070435, "epoch": 0.8620205537148312, "grad_norm": 1.5546875, "learning_rate": 0.0004936480191552637, "loss": 5.5134, "mean_token_accuracy": 0.17637402266263963, "num_tokens": 17120651.0, "step": 7675 }, { "entropy": 5.666385555267334, "epoch": 0.8625821306227888, "grad_norm": 1.546875, "learning_rate": 0.0004936385432087589, "loss": 5.651, "mean_token_accuracy": 0.17565001398324967, "num_tokens": 17131306.0, "step": 7680 }, { "entropy": 5.812044906616211, "epoch": 0.8631437075307463, "grad_norm": 1.640625, "learning_rate": 0.0004936290603007181, "loss": 5.798, "mean_token_accuracy": 0.16602026224136351, "num_tokens": 17142779.0, "step": 7685 }, { "entropy": 5.860309505462647, "epoch": 0.8637052844387039, "grad_norm": 1.46875, "learning_rate": 0.0004936195704314432, "loss": 5.6687, "mean_token_accuracy": 0.18110954910516738, "num_tokens": 17154992.0, "step": 7690 }, { "entropy": 5.662728500366211, "epoch": 0.8642668613466614, "grad_norm": 1.7578125, "learning_rate": 0.0004936100736012363, "loss": 5.6427, "mean_token_accuracy": 0.17859661132097243, "num_tokens": 17166089.0, "step": 7695 }, { "entropy": 5.610977554321289, "epoch": 0.864828438254619, "grad_norm": 1.7578125, "learning_rate": 0.0004936005698104, "loss": 5.5468, "mean_token_accuracy": 0.1707144245505333, "num_tokens": 17175691.0, "step": 7700 }, { "entropy": 5.6774708271026615, "epoch": 0.8653900151625765, "grad_norm": 1.515625, "learning_rate": 0.0004935910590592367, "loss": 5.602, "mean_token_accuracy": 0.16899661272764205, "num_tokens": 17186466.0, "step": 7705 }, { "entropy": 5.582030820846557, "epoch": 0.8659515920705341, "grad_norm": 1.7265625, "learning_rate": 0.0004935815413480494, "loss": 5.3873, "mean_token_accuracy": 0.18827227801084517, "num_tokens": 17198520.0, "step": 7710 }, { "entropy": 5.670034170150757, "epoch": 0.8665131689784916, "grad_norm": 1.7578125, "learning_rate": 0.000493572016677141, "loss": 5.6234, "mean_token_accuracy": 0.16890666335821153, "num_tokens": 17210496.0, "step": 7715 }, { "entropy": 5.68838415145874, "epoch": 0.8670747458864492, "grad_norm": 3.328125, "learning_rate": 0.0004935624850468148, "loss": 5.6152, "mean_token_accuracy": 0.17695807665586472, "num_tokens": 17221631.0, "step": 7720 }, { "entropy": 5.682717370986938, "epoch": 0.8676363227944067, "grad_norm": 1.578125, "learning_rate": 0.0004935529464573742, "loss": 5.65, "mean_token_accuracy": 0.16548071503639222, "num_tokens": 17233316.0, "step": 7725 }, { "entropy": 5.678200769424438, "epoch": 0.8681978997023643, "grad_norm": 1.6640625, "learning_rate": 0.0004935434009091232, "loss": 5.5573, "mean_token_accuracy": 0.1785666510462761, "num_tokens": 17245761.0, "step": 7730 }, { "entropy": 5.697708415985107, "epoch": 0.8687594766103218, "grad_norm": 1.4375, "learning_rate": 0.0004935338484023655, "loss": 5.5596, "mean_token_accuracy": 0.1804763749241829, "num_tokens": 17255007.0, "step": 7735 }, { "entropy": 5.644683218002319, "epoch": 0.8693210535182794, "grad_norm": 1.8828125, "learning_rate": 0.0004935242889374052, "loss": 5.536, "mean_token_accuracy": 0.17835524082183837, "num_tokens": 17265378.0, "step": 7740 }, { "entropy": 5.724565315246582, "epoch": 0.8698826304262369, "grad_norm": 1.734375, "learning_rate": 0.0004935147225145469, "loss": 5.6105, "mean_token_accuracy": 0.17023085206747054, "num_tokens": 17277202.0, "step": 7745 }, { "entropy": 5.6139226913452145, "epoch": 0.8704442073341944, "grad_norm": 1.5390625, "learning_rate": 0.0004935051491340951, "loss": 5.5543, "mean_token_accuracy": 0.1805954396724701, "num_tokens": 17287006.0, "step": 7750 }, { "entropy": 5.649082994461059, "epoch": 0.8710057842421519, "grad_norm": 1.5078125, "learning_rate": 0.0004934955687963546, "loss": 5.52, "mean_token_accuracy": 0.18563045263290406, "num_tokens": 17297387.0, "step": 7755 }, { "entropy": 5.797161531448364, "epoch": 0.8715673611501095, "grad_norm": 1.40625, "learning_rate": 0.0004934859815016304, "loss": 5.7537, "mean_token_accuracy": 0.16585738137364386, "num_tokens": 17310364.0, "step": 7760 }, { "entropy": 5.6904988288879395, "epoch": 0.872128938058067, "grad_norm": 1.578125, "learning_rate": 0.0004934763872502278, "loss": 5.5897, "mean_token_accuracy": 0.17995432764291763, "num_tokens": 17321282.0, "step": 7765 }, { "entropy": 5.684155511856079, "epoch": 0.8726905149660246, "grad_norm": 1.625, "learning_rate": 0.0004934667860424523, "loss": 5.632, "mean_token_accuracy": 0.1700143799185753, "num_tokens": 17331755.0, "step": 7770 }, { "entropy": 5.656625986099243, "epoch": 0.8732520918739821, "grad_norm": 1.40625, "learning_rate": 0.0004934571778786096, "loss": 5.5745, "mean_token_accuracy": 0.17331324964761735, "num_tokens": 17342542.0, "step": 7775 }, { "entropy": 5.652045154571534, "epoch": 0.8738136687819397, "grad_norm": 1.515625, "learning_rate": 0.0004934475627590057, "loss": 5.5215, "mean_token_accuracy": 0.17376778274774551, "num_tokens": 17353150.0, "step": 7780 }, { "entropy": 5.65459680557251, "epoch": 0.8743752456898972, "grad_norm": 1.484375, "learning_rate": 0.0004934379406839466, "loss": 5.5644, "mean_token_accuracy": 0.17380731254816056, "num_tokens": 17363901.0, "step": 7785 }, { "entropy": 5.67426061630249, "epoch": 0.8749368225978548, "grad_norm": 1.8203125, "learning_rate": 0.0004934283116537387, "loss": 5.488, "mean_token_accuracy": 0.17831778526306152, "num_tokens": 17374429.0, "step": 7790 }, { "entropy": 5.673512268066406, "epoch": 0.8754983995058123, "grad_norm": 1.6015625, "learning_rate": 0.0004934186756686888, "loss": 5.6291, "mean_token_accuracy": 0.17127451598644255, "num_tokens": 17384952.0, "step": 7795 }, { "entropy": 5.670864820480347, "epoch": 0.8760599764137699, "grad_norm": 1.6328125, "learning_rate": 0.0004934090327291034, "loss": 5.5948, "mean_token_accuracy": 0.17161913961172104, "num_tokens": 17397771.0, "step": 7800 }, { "entropy": 5.670876312255859, "epoch": 0.8766215533217274, "grad_norm": 1.6328125, "learning_rate": 0.0004933993828352898, "loss": 5.5027, "mean_token_accuracy": 0.17967257499694825, "num_tokens": 17407748.0, "step": 7805 }, { "entropy": 5.611726522445679, "epoch": 0.877183130229685, "grad_norm": 1.484375, "learning_rate": 0.0004933897259875551, "loss": 5.4843, "mean_token_accuracy": 0.175080007314682, "num_tokens": 17418572.0, "step": 7810 }, { "entropy": 5.52510027885437, "epoch": 0.8777447071376425, "grad_norm": 1.6015625, "learning_rate": 0.0004933800621862069, "loss": 5.5306, "mean_token_accuracy": 0.17571943253278732, "num_tokens": 17429909.0, "step": 7815 }, { "entropy": 5.638761234283447, "epoch": 0.8783062840456001, "grad_norm": 1.359375, "learning_rate": 0.0004933703914315527, "loss": 5.5553, "mean_token_accuracy": 0.1714665785431862, "num_tokens": 17441143.0, "step": 7820 }, { "entropy": 5.736855459213257, "epoch": 0.8788678609535576, "grad_norm": 2.140625, "learning_rate": 0.0004933607137239006, "loss": 5.6724, "mean_token_accuracy": 0.16394690573215484, "num_tokens": 17452156.0, "step": 7825 }, { "entropy": 5.618521738052368, "epoch": 0.8794294378615152, "grad_norm": 1.5, "learning_rate": 0.0004933510290635587, "loss": 5.574, "mean_token_accuracy": 0.17211691588163375, "num_tokens": 17463873.0, "step": 7830 }, { "entropy": 5.598127937316894, "epoch": 0.8799910147694727, "grad_norm": 1.4609375, "learning_rate": 0.0004933413374508353, "loss": 5.5071, "mean_token_accuracy": 0.17668081372976302, "num_tokens": 17474180.0, "step": 7835 }, { "entropy": 5.652832412719727, "epoch": 0.8805525916774303, "grad_norm": 1.46875, "learning_rate": 0.0004933316388860391, "loss": 5.539, "mean_token_accuracy": 0.1772014617919922, "num_tokens": 17486903.0, "step": 7840 }, { "entropy": 5.573214387893676, "epoch": 0.8811141685853877, "grad_norm": 1.75, "learning_rate": 0.0004933219333694787, "loss": 5.567, "mean_token_accuracy": 0.17032884508371354, "num_tokens": 17498790.0, "step": 7845 }, { "entropy": 5.723428106307983, "epoch": 0.8816757454933453, "grad_norm": 1.546875, "learning_rate": 0.0004933122209014634, "loss": 5.5983, "mean_token_accuracy": 0.16774654984474183, "num_tokens": 17510061.0, "step": 7850 }, { "entropy": 5.679811573028564, "epoch": 0.8822373224013028, "grad_norm": 1.359375, "learning_rate": 0.0004933025014823022, "loss": 5.6114, "mean_token_accuracy": 0.17310027331113814, "num_tokens": 17522414.0, "step": 7855 }, { "entropy": 5.8511148452758786, "epoch": 0.8827988993092604, "grad_norm": 1.515625, "learning_rate": 0.0004932927751123048, "loss": 5.7443, "mean_token_accuracy": 0.16237847954034806, "num_tokens": 17532745.0, "step": 7860 }, { "entropy": 5.631840419769287, "epoch": 0.8833604762172179, "grad_norm": 1.4765625, "learning_rate": 0.0004932830417917808, "loss": 5.5358, "mean_token_accuracy": 0.17639891058206558, "num_tokens": 17545329.0, "step": 7865 }, { "entropy": 5.729234743118286, "epoch": 0.8839220531251755, "grad_norm": 1.3671875, "learning_rate": 0.00049327330152104, "loss": 5.6476, "mean_token_accuracy": 0.1724901929497719, "num_tokens": 17557789.0, "step": 7870 }, { "entropy": 5.672587299346924, "epoch": 0.884483630033133, "grad_norm": 1.359375, "learning_rate": 0.0004932635543003927, "loss": 5.4769, "mean_token_accuracy": 0.18150333017110826, "num_tokens": 17568338.0, "step": 7875 }, { "entropy": 5.638689804077148, "epoch": 0.8850452069410906, "grad_norm": 1.6171875, "learning_rate": 0.0004932538001301491, "loss": 5.5781, "mean_token_accuracy": 0.1726062461733818, "num_tokens": 17581199.0, "step": 7880 }, { "entropy": 5.544777345657349, "epoch": 0.8856067838490481, "grad_norm": 1.8046875, "learning_rate": 0.0004932440390106199, "loss": 5.5334, "mean_token_accuracy": 0.1764208197593689, "num_tokens": 17592937.0, "step": 7885 }, { "entropy": 5.629625701904297, "epoch": 0.8861683607570057, "grad_norm": 1.4921875, "learning_rate": 0.0004932342709421159, "loss": 5.5926, "mean_token_accuracy": 0.17708465456962585, "num_tokens": 17604003.0, "step": 7890 }, { "entropy": 5.90011510848999, "epoch": 0.8867299376649632, "grad_norm": 1.3125, "learning_rate": 0.000493224495924948, "loss": 5.7302, "mean_token_accuracy": 0.16930215954780578, "num_tokens": 17617283.0, "step": 7895 }, { "entropy": 5.677170133590698, "epoch": 0.8872915145729208, "grad_norm": 1.4375, "learning_rate": 0.0004932147139594276, "loss": 5.5707, "mean_token_accuracy": 0.1770807087421417, "num_tokens": 17628161.0, "step": 7900 }, { "entropy": 5.728165149688721, "epoch": 0.8878530914808783, "grad_norm": 1.484375, "learning_rate": 0.0004932049250458659, "loss": 5.6503, "mean_token_accuracy": 0.16944217383861543, "num_tokens": 17639226.0, "step": 7905 }, { "entropy": 5.592314767837524, "epoch": 0.8884146683888359, "grad_norm": 1.4140625, "learning_rate": 0.0004931951291845749, "loss": 5.4893, "mean_token_accuracy": 0.18333953768014907, "num_tokens": 17652114.0, "step": 7910 }, { "entropy": 5.5825001239776615, "epoch": 0.8889762452967934, "grad_norm": 1.65625, "learning_rate": 0.0004931853263758663, "loss": 5.529, "mean_token_accuracy": 0.18106401562690735, "num_tokens": 17663280.0, "step": 7915 }, { "entropy": 5.623987007141113, "epoch": 0.889537822204751, "grad_norm": 1.3984375, "learning_rate": 0.0004931755166200523, "loss": 5.6155, "mean_token_accuracy": 0.17368122637271882, "num_tokens": 17674445.0, "step": 7920 }, { "entropy": 5.691004753112793, "epoch": 0.8900993991127085, "grad_norm": 1.578125, "learning_rate": 0.0004931656999174452, "loss": 5.5071, "mean_token_accuracy": 0.17749142944812774, "num_tokens": 17685046.0, "step": 7925 }, { "entropy": 5.591828203201294, "epoch": 0.8906609760206661, "grad_norm": 1.703125, "learning_rate": 0.0004931558762683577, "loss": 5.507, "mean_token_accuracy": 0.17967617213726045, "num_tokens": 17695269.0, "step": 7930 }, { "entropy": 5.559813833236694, "epoch": 0.8912225529286236, "grad_norm": 1.859375, "learning_rate": 0.0004931460456731024, "loss": 5.5466, "mean_token_accuracy": 0.17714540660381317, "num_tokens": 17706296.0, "step": 7935 }, { "entropy": 5.6044251918792725, "epoch": 0.8917841298365812, "grad_norm": 1.6640625, "learning_rate": 0.0004931362081319925, "loss": 5.4769, "mean_token_accuracy": 0.17915261387825013, "num_tokens": 17716262.0, "step": 7940 }, { "entropy": 5.66194977760315, "epoch": 0.8923457067445386, "grad_norm": 1.5078125, "learning_rate": 0.0004931263636453409, "loss": 5.5201, "mean_token_accuracy": 0.17992712408304215, "num_tokens": 17726818.0, "step": 7945 }, { "entropy": 5.589525651931763, "epoch": 0.8929072836524962, "grad_norm": 1.421875, "learning_rate": 0.0004931165122134616, "loss": 5.5256, "mean_token_accuracy": 0.18117809742689134, "num_tokens": 17737112.0, "step": 7950 }, { "entropy": 5.660979413986206, "epoch": 0.8934688605604537, "grad_norm": 1.53125, "learning_rate": 0.0004931066538366677, "loss": 5.5984, "mean_token_accuracy": 0.17052928656339644, "num_tokens": 17747558.0, "step": 7955 }, { "entropy": 5.712664318084717, "epoch": 0.8940304374684113, "grad_norm": 1.421875, "learning_rate": 0.0004930967885152734, "loss": 5.536, "mean_token_accuracy": 0.17624609172344208, "num_tokens": 17757495.0, "step": 7960 }, { "entropy": 5.624363279342651, "epoch": 0.8945920143763688, "grad_norm": 1.5234375, "learning_rate": 0.0004930869162495929, "loss": 5.5294, "mean_token_accuracy": 0.1765795186161995, "num_tokens": 17767562.0, "step": 7965 }, { "entropy": 5.6667194843292235, "epoch": 0.8951535912843264, "grad_norm": 1.3984375, "learning_rate": 0.0004930770370399403, "loss": 5.6186, "mean_token_accuracy": 0.16974660009145737, "num_tokens": 17779800.0, "step": 7970 }, { "entropy": 5.610093069076538, "epoch": 0.8957151681922839, "grad_norm": 1.3828125, "learning_rate": 0.0004930671508866303, "loss": 5.4308, "mean_token_accuracy": 0.17751775681972504, "num_tokens": 17791183.0, "step": 7975 }, { "entropy": 5.681202840805054, "epoch": 0.8962767451002415, "grad_norm": 1.4453125, "learning_rate": 0.0004930572577899776, "loss": 5.5975, "mean_token_accuracy": 0.1753363460302353, "num_tokens": 17802547.0, "step": 7980 }, { "entropy": 5.511297702789307, "epoch": 0.896838322008199, "grad_norm": 1.9921875, "learning_rate": 0.0004930473577502972, "loss": 5.492, "mean_token_accuracy": 0.17547860294580458, "num_tokens": 17815406.0, "step": 7985 }, { "entropy": 5.631451606750488, "epoch": 0.8973998989161566, "grad_norm": 1.5703125, "learning_rate": 0.0004930374507679044, "loss": 5.521, "mean_token_accuracy": 0.17684534192085266, "num_tokens": 17826516.0, "step": 7990 }, { "entropy": 5.646472406387329, "epoch": 0.8979614758241141, "grad_norm": 1.4296875, "learning_rate": 0.0004930275368431146, "loss": 5.4978, "mean_token_accuracy": 0.1771871417760849, "num_tokens": 17838193.0, "step": 7995 }, { "entropy": 5.624480295181274, "epoch": 0.8985230527320717, "grad_norm": 1.3671875, "learning_rate": 0.0004930176159762435, "loss": 5.5205, "mean_token_accuracy": 0.1750570610165596, "num_tokens": 17849564.0, "step": 8000 }, { "entropy": 5.736857175827026, "epoch": 0.8990846296400292, "grad_norm": 1.328125, "learning_rate": 0.0004930076881676069, "loss": 5.662, "mean_token_accuracy": 0.17136270999908448, "num_tokens": 17861874.0, "step": 8005 }, { "entropy": 5.575713205337524, "epoch": 0.8996462065479868, "grad_norm": 1.6796875, "learning_rate": 0.0004929977534175211, "loss": 5.5055, "mean_token_accuracy": 0.17983078062534333, "num_tokens": 17873139.0, "step": 8010 }, { "entropy": 5.736148262023926, "epoch": 0.9002077834559443, "grad_norm": 1.5546875, "learning_rate": 0.0004929878117263021, "loss": 5.572, "mean_token_accuracy": 0.17753154337406157, "num_tokens": 17883262.0, "step": 8015 }, { "entropy": 5.554032325744629, "epoch": 0.9007693603639019, "grad_norm": 1.328125, "learning_rate": 0.0004929778630942668, "loss": 5.4604, "mean_token_accuracy": 0.18278993517160416, "num_tokens": 17895041.0, "step": 8020 }, { "entropy": 5.528722429275513, "epoch": 0.9013309372718594, "grad_norm": 1.4140625, "learning_rate": 0.0004929679075217317, "loss": 5.5034, "mean_token_accuracy": 0.17425708770751952, "num_tokens": 17905154.0, "step": 8025 }, { "entropy": 5.616612911224365, "epoch": 0.901892514179817, "grad_norm": 2.109375, "learning_rate": 0.0004929579450090139, "loss": 5.5601, "mean_token_accuracy": 0.17341381311416626, "num_tokens": 17916287.0, "step": 8030 }, { "entropy": 5.7543384552001955, "epoch": 0.9024540910877745, "grad_norm": 1.4375, "learning_rate": 0.0004929479755564305, "loss": 5.5673, "mean_token_accuracy": 0.17662589699029924, "num_tokens": 17927269.0, "step": 8035 }, { "entropy": 5.6863922595977785, "epoch": 0.903015667995732, "grad_norm": 1.78125, "learning_rate": 0.0004929379991642991, "loss": 5.5818, "mean_token_accuracy": 0.1742201864719391, "num_tokens": 17938142.0, "step": 8040 }, { "entropy": 5.675807046890259, "epoch": 0.9035772449036895, "grad_norm": 1.4609375, "learning_rate": 0.0004929280158329373, "loss": 5.5645, "mean_token_accuracy": 0.1757965698838234, "num_tokens": 17950229.0, "step": 8045 }, { "entropy": 5.612723159790039, "epoch": 0.9041388218116471, "grad_norm": 1.4453125, "learning_rate": 0.000492918025562663, "loss": 5.548, "mean_token_accuracy": 0.18230236321687698, "num_tokens": 17961757.0, "step": 8050 }, { "entropy": 5.685063695907592, "epoch": 0.9047003987196046, "grad_norm": 1.5, "learning_rate": 0.0004929080283537942, "loss": 5.6233, "mean_token_accuracy": 0.1663338214159012, "num_tokens": 17972564.0, "step": 8055 }, { "entropy": 5.735013771057129, "epoch": 0.9052619756275622, "grad_norm": 1.34375, "learning_rate": 0.0004928980242066492, "loss": 5.5325, "mean_token_accuracy": 0.18212261348962783, "num_tokens": 17982776.0, "step": 8060 }, { "entropy": 5.688648509979248, "epoch": 0.9058235525355197, "grad_norm": 1.3046875, "learning_rate": 0.0004928880131215467, "loss": 5.6463, "mean_token_accuracy": 0.1749667137861252, "num_tokens": 17994460.0, "step": 8065 }, { "entropy": 5.624743270874023, "epoch": 0.9063851294434773, "grad_norm": 1.734375, "learning_rate": 0.0004928779950988053, "loss": 5.62, "mean_token_accuracy": 0.17174448817968369, "num_tokens": 18005744.0, "step": 8070 }, { "entropy": 5.611772775650024, "epoch": 0.9069467063514348, "grad_norm": 1.4375, "learning_rate": 0.000492867970138744, "loss": 5.4754, "mean_token_accuracy": 0.18351303040981293, "num_tokens": 18016517.0, "step": 8075 }, { "entropy": 5.675594282150269, "epoch": 0.9075082832593924, "grad_norm": 1.3359375, "learning_rate": 0.0004928579382416821, "loss": 5.5975, "mean_token_accuracy": 0.16978041380643843, "num_tokens": 18027653.0, "step": 8080 }, { "entropy": 5.675237369537354, "epoch": 0.9080698601673499, "grad_norm": 1.3984375, "learning_rate": 0.000492847899407939, "loss": 5.636, "mean_token_accuracy": 0.17045610696077346, "num_tokens": 18038741.0, "step": 8085 }, { "entropy": 5.7510435581207275, "epoch": 0.9086314370753075, "grad_norm": 1.21875, "learning_rate": 0.0004928378536378341, "loss": 5.5802, "mean_token_accuracy": 0.17184377759695052, "num_tokens": 18049188.0, "step": 8090 }, { "entropy": 5.608703708648681, "epoch": 0.909193013983265, "grad_norm": 1.5390625, "learning_rate": 0.0004928278009316877, "loss": 5.482, "mean_token_accuracy": 0.17725870013237, "num_tokens": 18059979.0, "step": 8095 }, { "entropy": 5.6458415508270265, "epoch": 0.9097545908912226, "grad_norm": 1.265625, "learning_rate": 0.0004928177412898195, "loss": 5.4967, "mean_token_accuracy": 0.1831892564892769, "num_tokens": 18070712.0, "step": 8100 }, { "entropy": 5.670635318756103, "epoch": 0.9103161677991801, "grad_norm": 1.40625, "learning_rate": 0.0004928076747125499, "loss": 5.5632, "mean_token_accuracy": 0.18162725418806075, "num_tokens": 18081372.0, "step": 8105 }, { "entropy": 5.577960062026977, "epoch": 0.9108777447071377, "grad_norm": 1.3125, "learning_rate": 0.0004927976012001995, "loss": 5.4888, "mean_token_accuracy": 0.17665131241083146, "num_tokens": 18093033.0, "step": 8110 }, { "entropy": 5.555771923065185, "epoch": 0.9114393216150952, "grad_norm": 1.7265625, "learning_rate": 0.0004927875207530889, "loss": 5.4461, "mean_token_accuracy": 0.18108128160238265, "num_tokens": 18104808.0, "step": 8115 }, { "entropy": 5.730599784851075, "epoch": 0.9120008985230528, "grad_norm": 1.4921875, "learning_rate": 0.0004927774333715394, "loss": 5.5846, "mean_token_accuracy": 0.17475593835115433, "num_tokens": 18115450.0, "step": 8120 }, { "entropy": 5.730729341506958, "epoch": 0.9125624754310103, "grad_norm": 2.90625, "learning_rate": 0.0004927673390558718, "loss": 5.6786, "mean_token_accuracy": 0.17357307821512222, "num_tokens": 18127437.0, "step": 8125 }, { "entropy": 5.705981349945068, "epoch": 0.9131240523389679, "grad_norm": 1.5, "learning_rate": 0.0004927572378064077, "loss": 5.5123, "mean_token_accuracy": 0.1819301575422287, "num_tokens": 18137371.0, "step": 8130 }, { "entropy": 5.618573713302612, "epoch": 0.9136856292469253, "grad_norm": 1.3828125, "learning_rate": 0.0004927471296234687, "loss": 5.5725, "mean_token_accuracy": 0.17275052070617675, "num_tokens": 18148332.0, "step": 8135 }, { "entropy": 5.588826656341553, "epoch": 0.9142472061548829, "grad_norm": 1.5, "learning_rate": 0.0004927370145073767, "loss": 5.5549, "mean_token_accuracy": 0.17383279651403427, "num_tokens": 18159918.0, "step": 8140 }, { "entropy": 5.65464768409729, "epoch": 0.9148087830628404, "grad_norm": 1.6015625, "learning_rate": 0.0004927268924584536, "loss": 5.5406, "mean_token_accuracy": 0.18160120993852616, "num_tokens": 18170911.0, "step": 8145 }, { "entropy": 5.667963266372681, "epoch": 0.915370359970798, "grad_norm": 1.375, "learning_rate": 0.0004927167634770219, "loss": 5.5562, "mean_token_accuracy": 0.17828303426504136, "num_tokens": 18183089.0, "step": 8150 }, { "entropy": 5.7810358047485355, "epoch": 0.9159319368787555, "grad_norm": 1.3359375, "learning_rate": 0.000492706627563404, "loss": 5.8173, "mean_token_accuracy": 0.15935783535242082, "num_tokens": 18195467.0, "step": 8155 }, { "entropy": 5.740857410430908, "epoch": 0.9164935137867131, "grad_norm": 1.7265625, "learning_rate": 0.0004926964847179225, "loss": 5.572, "mean_token_accuracy": 0.1790512040257454, "num_tokens": 18206766.0, "step": 8160 }, { "entropy": 5.679031610488892, "epoch": 0.9170550906946706, "grad_norm": 1.375, "learning_rate": 0.0004926863349409006, "loss": 5.5629, "mean_token_accuracy": 0.17597046494483948, "num_tokens": 18217840.0, "step": 8165 }, { "entropy": 5.649716377258301, "epoch": 0.9176166676026282, "grad_norm": 2.0, "learning_rate": 0.0004926761782326613, "loss": 5.5758, "mean_token_accuracy": 0.17311379611492156, "num_tokens": 18229514.0, "step": 8170 }, { "entropy": 5.5854212760925295, "epoch": 0.9181782445105857, "grad_norm": 1.8984375, "learning_rate": 0.0004926660145935282, "loss": 5.5559, "mean_token_accuracy": 0.1705981135368347, "num_tokens": 18241949.0, "step": 8175 }, { "entropy": 5.651837682723999, "epoch": 0.9187398214185433, "grad_norm": 1.2578125, "learning_rate": 0.0004926558440238247, "loss": 5.5314, "mean_token_accuracy": 0.17833069413900376, "num_tokens": 18252938.0, "step": 8180 }, { "entropy": 5.624422931671143, "epoch": 0.9193013983265008, "grad_norm": 1.421875, "learning_rate": 0.0004926456665238746, "loss": 5.479, "mean_token_accuracy": 0.18345132768154143, "num_tokens": 18263417.0, "step": 8185 }, { "entropy": 5.661493015289307, "epoch": 0.9198629752344584, "grad_norm": 1.375, "learning_rate": 0.0004926354820940023, "loss": 5.6485, "mean_token_accuracy": 0.17259145379066468, "num_tokens": 18275595.0, "step": 8190 }, { "entropy": 5.592373466491699, "epoch": 0.9204245521424159, "grad_norm": 1.5390625, "learning_rate": 0.0004926252907345317, "loss": 5.4836, "mean_token_accuracy": 0.17857701629400252, "num_tokens": 18287510.0, "step": 8195 }, { "entropy": 5.717923927307129, "epoch": 0.9209861290503735, "grad_norm": 1.7734375, "learning_rate": 0.0004926150924457874, "loss": 5.5838, "mean_token_accuracy": 0.17386380732059478, "num_tokens": 18298764.0, "step": 8200 }, { "entropy": 5.588229608535767, "epoch": 0.921547705958331, "grad_norm": 1.359375, "learning_rate": 0.0004926048872280943, "loss": 5.4009, "mean_token_accuracy": 0.17802754789590836, "num_tokens": 18310427.0, "step": 8205 }, { "entropy": 5.580872583389282, "epoch": 0.9221092828662886, "grad_norm": 1.1953125, "learning_rate": 0.000492594675081777, "loss": 5.532, "mean_token_accuracy": 0.17346930950880052, "num_tokens": 18322174.0, "step": 8210 }, { "entropy": 5.584685850143432, "epoch": 0.9226708597742461, "grad_norm": 2.8125, "learning_rate": 0.000492584456007161, "loss": 5.4795, "mean_token_accuracy": 0.17690377533435822, "num_tokens": 18332372.0, "step": 8215 }, { "entropy": 5.672969627380371, "epoch": 0.9232324366822037, "grad_norm": 1.46875, "learning_rate": 0.0004925742300045716, "loss": 5.5459, "mean_token_accuracy": 0.1704122766852379, "num_tokens": 18343201.0, "step": 8220 }, { "entropy": 5.634353446960449, "epoch": 0.9237940135901612, "grad_norm": 1.53125, "learning_rate": 0.0004925639970743341, "loss": 5.5613, "mean_token_accuracy": 0.1783763960003853, "num_tokens": 18354124.0, "step": 8225 }, { "entropy": 5.626930046081543, "epoch": 0.9243555904981187, "grad_norm": 1.5078125, "learning_rate": 0.0004925537572167746, "loss": 5.5138, "mean_token_accuracy": 0.18148281127214433, "num_tokens": 18365148.0, "step": 8230 }, { "entropy": 5.467441701889038, "epoch": 0.9249171674060762, "grad_norm": 1.5234375, "learning_rate": 0.0004925435104322192, "loss": 5.3908, "mean_token_accuracy": 0.18088495582342148, "num_tokens": 18376244.0, "step": 8235 }, { "entropy": 5.6002789497375485, "epoch": 0.9254787443140338, "grad_norm": 1.4140625, "learning_rate": 0.000492533256720994, "loss": 5.5533, "mean_token_accuracy": 0.17563220411539077, "num_tokens": 18386728.0, "step": 8240 }, { "entropy": 5.666000461578369, "epoch": 0.9260403212219913, "grad_norm": 1.4453125, "learning_rate": 0.0004925229960834256, "loss": 5.5451, "mean_token_accuracy": 0.17448101937770844, "num_tokens": 18397008.0, "step": 8245 }, { "entropy": 5.637777423858642, "epoch": 0.9266018981299489, "grad_norm": 1.7734375, "learning_rate": 0.0004925127285198407, "loss": 5.5305, "mean_token_accuracy": 0.18294473737478256, "num_tokens": 18408348.0, "step": 8250 }, { "entropy": 5.5927502632141115, "epoch": 0.9271634750379064, "grad_norm": 1.5234375, "learning_rate": 0.000492502454030566, "loss": 5.5562, "mean_token_accuracy": 0.18002525418996812, "num_tokens": 18419239.0, "step": 8255 }, { "entropy": 5.727730941772461, "epoch": 0.927725051945864, "grad_norm": 1.28125, "learning_rate": 0.0004924921726159288, "loss": 5.561, "mean_token_accuracy": 0.17431779056787491, "num_tokens": 18428918.0, "step": 8260 }, { "entropy": 5.725991296768188, "epoch": 0.9282866288538215, "grad_norm": 1.546875, "learning_rate": 0.0004924818842762565, "loss": 5.5523, "mean_token_accuracy": 0.1816506192088127, "num_tokens": 18440361.0, "step": 8265 }, { "entropy": 5.559592771530151, "epoch": 0.9288482057617791, "grad_norm": 1.578125, "learning_rate": 0.0004924715890118768, "loss": 5.4345, "mean_token_accuracy": 0.180571249127388, "num_tokens": 18450678.0, "step": 8270 }, { "entropy": 5.608138799667358, "epoch": 0.9294097826697366, "grad_norm": 1.3671875, "learning_rate": 0.0004924612868231173, "loss": 5.6334, "mean_token_accuracy": 0.17058404982089997, "num_tokens": 18462364.0, "step": 8275 }, { "entropy": 5.645278215408325, "epoch": 0.9299713595776942, "grad_norm": 1.3203125, "learning_rate": 0.0004924509777103059, "loss": 5.5226, "mean_token_accuracy": 0.17628366500139236, "num_tokens": 18472896.0, "step": 8280 }, { "entropy": 5.787207078933716, "epoch": 0.9305329364856517, "grad_norm": 1.4765625, "learning_rate": 0.0004924406616737712, "loss": 5.6589, "mean_token_accuracy": 0.16721024066209794, "num_tokens": 18484951.0, "step": 8285 }, { "entropy": 5.628914451599121, "epoch": 0.9310945133936093, "grad_norm": 1.375, "learning_rate": 0.0004924303387138415, "loss": 5.5925, "mean_token_accuracy": 0.174946691095829, "num_tokens": 18496006.0, "step": 8290 }, { "entropy": 5.748250484466553, "epoch": 0.9316560903015668, "grad_norm": 2.015625, "learning_rate": 0.0004924200088308455, "loss": 5.5748, "mean_token_accuracy": 0.17472342401742935, "num_tokens": 18508069.0, "step": 8295 }, { "entropy": 5.7464500904083256, "epoch": 0.9322176672095244, "grad_norm": 1.390625, "learning_rate": 0.000492409672025112, "loss": 5.6889, "mean_token_accuracy": 0.16791522353887559, "num_tokens": 18519746.0, "step": 8300 }, { "entropy": 5.742476892471314, "epoch": 0.9327792441174819, "grad_norm": 1.921875, "learning_rate": 0.0004923993282969703, "loss": 5.592, "mean_token_accuracy": 0.17625355273485183, "num_tokens": 18530249.0, "step": 8305 }, { "entropy": 5.6794898986816404, "epoch": 0.9333408210254395, "grad_norm": 1.3984375, "learning_rate": 0.0004923889776467495, "loss": 5.613, "mean_token_accuracy": 0.17979559898376465, "num_tokens": 18543306.0, "step": 8310 }, { "entropy": 5.634688186645508, "epoch": 0.933902397933397, "grad_norm": 1.796875, "learning_rate": 0.0004923786200747795, "loss": 5.6575, "mean_token_accuracy": 0.17098734974861146, "num_tokens": 18555250.0, "step": 8315 }, { "entropy": 5.6697102069854735, "epoch": 0.9344639748413546, "grad_norm": 1.40625, "learning_rate": 0.00049236825558139, "loss": 5.402, "mean_token_accuracy": 0.1727229595184326, "num_tokens": 18566378.0, "step": 8320 }, { "entropy": 5.67743182182312, "epoch": 0.9350255517493121, "grad_norm": 1.546875, "learning_rate": 0.0004923578841669108, "loss": 5.6108, "mean_token_accuracy": 0.17351700663566588, "num_tokens": 18576827.0, "step": 8325 }, { "entropy": 5.616914176940918, "epoch": 0.9355871286572696, "grad_norm": 1.7421875, "learning_rate": 0.0004923475058316723, "loss": 5.5397, "mean_token_accuracy": 0.17626303136348725, "num_tokens": 18589209.0, "step": 8330 }, { "entropy": 5.6495646953582765, "epoch": 0.9361487055652271, "grad_norm": 1.34375, "learning_rate": 0.0004923371205760049, "loss": 5.5529, "mean_token_accuracy": 0.17969396114349365, "num_tokens": 18599367.0, "step": 8335 }, { "entropy": 5.666165113449097, "epoch": 0.9367102824731847, "grad_norm": 1.4375, "learning_rate": 0.0004923267284002394, "loss": 5.5904, "mean_token_accuracy": 0.1729588732123375, "num_tokens": 18610505.0, "step": 8340 }, { "entropy": 5.692822408676148, "epoch": 0.9372718593811422, "grad_norm": 1.6171875, "learning_rate": 0.0004923163293047065, "loss": 5.5945, "mean_token_accuracy": 0.17593003809452057, "num_tokens": 18622616.0, "step": 8345 }, { "entropy": 5.594743490219116, "epoch": 0.9378334362890998, "grad_norm": 1.640625, "learning_rate": 0.0004923059232897374, "loss": 5.4359, "mean_token_accuracy": 0.18015130013227462, "num_tokens": 18634127.0, "step": 8350 }, { "entropy": 5.634627008438111, "epoch": 0.9383950131970573, "grad_norm": 1.3515625, "learning_rate": 0.0004922955103556633, "loss": 5.6466, "mean_token_accuracy": 0.17177557200193405, "num_tokens": 18646196.0, "step": 8355 }, { "entropy": 5.645306730270386, "epoch": 0.9389565901050149, "grad_norm": 1.296875, "learning_rate": 0.000492285090502816, "loss": 5.552, "mean_token_accuracy": 0.1770355746150017, "num_tokens": 18656911.0, "step": 8360 }, { "entropy": 5.7078851699829105, "epoch": 0.9395181670129724, "grad_norm": 1.484375, "learning_rate": 0.0004922746637315272, "loss": 5.5278, "mean_token_accuracy": 0.1755846068263054, "num_tokens": 18667553.0, "step": 8365 }, { "entropy": 5.620309591293335, "epoch": 0.94007974392093, "grad_norm": 1.421875, "learning_rate": 0.0004922642300421288, "loss": 5.5011, "mean_token_accuracy": 0.1790532335639, "num_tokens": 18678087.0, "step": 8370 }, { "entropy": 5.6581525802612305, "epoch": 0.9406413208288875, "grad_norm": 1.484375, "learning_rate": 0.000492253789434953, "loss": 5.6158, "mean_token_accuracy": 0.1750505179166794, "num_tokens": 18689946.0, "step": 8375 }, { "entropy": 5.625391101837158, "epoch": 0.9412028977368451, "grad_norm": 1.6484375, "learning_rate": 0.0004922433419103323, "loss": 5.5269, "mean_token_accuracy": 0.18149401843547822, "num_tokens": 18700944.0, "step": 8380 }, { "entropy": 5.687411165237426, "epoch": 0.9417644746448026, "grad_norm": 1.578125, "learning_rate": 0.0004922328874685993, "loss": 5.6265, "mean_token_accuracy": 0.17350946068763734, "num_tokens": 18712901.0, "step": 8385 }, { "entropy": 5.6175501346588135, "epoch": 0.9423260515527602, "grad_norm": 2.515625, "learning_rate": 0.0004922224261100869, "loss": 5.4589, "mean_token_accuracy": 0.17959638684988022, "num_tokens": 18724322.0, "step": 8390 }, { "entropy": 5.593675136566162, "epoch": 0.9428876284607177, "grad_norm": 1.7890625, "learning_rate": 0.0004922119578351283, "loss": 5.5165, "mean_token_accuracy": 0.17416234016418458, "num_tokens": 18735315.0, "step": 8395 }, { "entropy": 5.61961555480957, "epoch": 0.9434492053686753, "grad_norm": 1.4296875, "learning_rate": 0.0004922014826440566, "loss": 5.5541, "mean_token_accuracy": 0.18015410602092743, "num_tokens": 18747497.0, "step": 8400 }, { "entropy": 5.691785049438477, "epoch": 0.9440107822766328, "grad_norm": 1.65625, "learning_rate": 0.0004921910005372056, "loss": 5.5891, "mean_token_accuracy": 0.1704226091504097, "num_tokens": 18758835.0, "step": 8405 }, { "entropy": 5.671810340881348, "epoch": 0.9445723591845904, "grad_norm": 1.3515625, "learning_rate": 0.0004921805115149088, "loss": 5.483, "mean_token_accuracy": 0.18468721210956573, "num_tokens": 18770325.0, "step": 8410 }, { "entropy": 5.520982933044434, "epoch": 0.9451339360925479, "grad_norm": 1.34375, "learning_rate": 0.0004921700155775002, "loss": 5.3773, "mean_token_accuracy": 0.18612601608037949, "num_tokens": 18781204.0, "step": 8415 }, { "entropy": 5.526636171340942, "epoch": 0.9456955130005055, "grad_norm": 1.6328125, "learning_rate": 0.0004921595127253142, "loss": 5.4905, "mean_token_accuracy": 0.18205440640449524, "num_tokens": 18791899.0, "step": 8420 }, { "entropy": 5.603455257415772, "epoch": 0.9462570899084629, "grad_norm": 1.34375, "learning_rate": 0.0004921490029586852, "loss": 5.4779, "mean_token_accuracy": 0.1817940965294838, "num_tokens": 18803043.0, "step": 8425 }, { "entropy": 5.60422306060791, "epoch": 0.9468186668164205, "grad_norm": 1.4375, "learning_rate": 0.0004921384862779475, "loss": 5.4969, "mean_token_accuracy": 0.17535765916109086, "num_tokens": 18814316.0, "step": 8430 }, { "entropy": 5.586996269226074, "epoch": 0.947380243724378, "grad_norm": 1.6875, "learning_rate": 0.0004921279626834363, "loss": 5.5614, "mean_token_accuracy": 0.17469020187854767, "num_tokens": 18825490.0, "step": 8435 }, { "entropy": 5.758854627609253, "epoch": 0.9479418206323356, "grad_norm": 1.5, "learning_rate": 0.0004921174321754865, "loss": 5.6497, "mean_token_accuracy": 0.1785335808992386, "num_tokens": 18836479.0, "step": 8440 }, { "entropy": 5.655997276306152, "epoch": 0.9485033975402931, "grad_norm": 1.78125, "learning_rate": 0.0004921068947544335, "loss": 5.5424, "mean_token_accuracy": 0.17748990803956985, "num_tokens": 18848634.0, "step": 8445 }, { "entropy": 5.593111944198609, "epoch": 0.9490649744482507, "grad_norm": 1.46875, "learning_rate": 0.0004920963504206128, "loss": 5.5003, "mean_token_accuracy": 0.18238631188869475, "num_tokens": 18858451.0, "step": 8450 }, { "entropy": 5.757823705673218, "epoch": 0.9496265513562082, "grad_norm": 1.578125, "learning_rate": 0.00049208579917436, "loss": 5.6392, "mean_token_accuracy": 0.16730133891105653, "num_tokens": 18869561.0, "step": 8455 }, { "entropy": 5.777918672561645, "epoch": 0.9501881282641658, "grad_norm": 1.5859375, "learning_rate": 0.0004920752410160113, "loss": 5.6417, "mean_token_accuracy": 0.16759925112128257, "num_tokens": 18880232.0, "step": 8460 }, { "entropy": 5.7202564716339115, "epoch": 0.9507497051721233, "grad_norm": 1.3984375, "learning_rate": 0.0004920646759459026, "loss": 5.6543, "mean_token_accuracy": 0.17059721201658248, "num_tokens": 18892562.0, "step": 8465 }, { "entropy": 5.640997695922851, "epoch": 0.9513112820800809, "grad_norm": 2.125, "learning_rate": 0.0004920541039643705, "loss": 5.5844, "mean_token_accuracy": 0.17161750495433808, "num_tokens": 18903566.0, "step": 8470 }, { "entropy": 5.633873176574707, "epoch": 0.9518728589880384, "grad_norm": 1.4765625, "learning_rate": 0.0004920435250717515, "loss": 5.5761, "mean_token_accuracy": 0.17739747911691667, "num_tokens": 18914619.0, "step": 8475 }, { "entropy": 5.76814079284668, "epoch": 0.952434435895996, "grad_norm": 1.484375, "learning_rate": 0.0004920329392683826, "loss": 5.6495, "mean_token_accuracy": 0.17262647897005082, "num_tokens": 18927039.0, "step": 8480 }, { "entropy": 5.777394104003906, "epoch": 0.9529960128039535, "grad_norm": 1.59375, "learning_rate": 0.0004920223465546006, "loss": 5.7291, "mean_token_accuracy": 0.16832094341516496, "num_tokens": 18940449.0, "step": 8485 }, { "entropy": 5.695525121688843, "epoch": 0.9535575897119111, "grad_norm": 1.625, "learning_rate": 0.0004920117469307429, "loss": 5.6045, "mean_token_accuracy": 0.17119804620742798, "num_tokens": 18950798.0, "step": 8490 }, { "entropy": 5.686978483200074, "epoch": 0.9541191666198686, "grad_norm": 1.40625, "learning_rate": 0.0004920011403971471, "loss": 5.4587, "mean_token_accuracy": 0.17551997900009156, "num_tokens": 18960958.0, "step": 8495 }, { "entropy": 5.588903331756592, "epoch": 0.9546807435278262, "grad_norm": 1.3203125, "learning_rate": 0.0004919905269541508, "loss": 5.4933, "mean_token_accuracy": 0.17877306193113326, "num_tokens": 18971890.0, "step": 8500 }, { "entropy": 5.560519123077393, "epoch": 0.9552423204357837, "grad_norm": 1.78125, "learning_rate": 0.000491979906602092, "loss": 5.4282, "mean_token_accuracy": 0.18534162938594817, "num_tokens": 18982309.0, "step": 8505 }, { "entropy": 5.67816572189331, "epoch": 0.9558038973437413, "grad_norm": 1.6171875, "learning_rate": 0.0004919692793413089, "loss": 5.6482, "mean_token_accuracy": 0.16850887835025788, "num_tokens": 18993648.0, "step": 8510 }, { "entropy": 5.667968082427978, "epoch": 0.9563654742516988, "grad_norm": 1.390625, "learning_rate": 0.0004919586451721396, "loss": 5.4243, "mean_token_accuracy": 0.18356293588876724, "num_tokens": 19003613.0, "step": 8515 }, { "entropy": 5.685746192932129, "epoch": 0.9569270511596563, "grad_norm": 1.3515625, "learning_rate": 0.0004919480040949229, "loss": 5.5428, "mean_token_accuracy": 0.17324323505163192, "num_tokens": 19014720.0, "step": 8520 }, { "entropy": 5.643367195129395, "epoch": 0.9574886280676138, "grad_norm": 1.40625, "learning_rate": 0.0004919373561099977, "loss": 5.5788, "mean_token_accuracy": 0.17302146852016448, "num_tokens": 19026635.0, "step": 8525 }, { "entropy": 5.673974132537841, "epoch": 0.9580502049755714, "grad_norm": 1.6875, "learning_rate": 0.000491926701217703, "loss": 5.5794, "mean_token_accuracy": 0.1681892067193985, "num_tokens": 19037433.0, "step": 8530 }, { "entropy": 5.6716055393219, "epoch": 0.9586117818835289, "grad_norm": 2.375, "learning_rate": 0.0004919160394183779, "loss": 5.4346, "mean_token_accuracy": 0.18276526629924775, "num_tokens": 19047351.0, "step": 8535 }, { "entropy": 5.513965892791748, "epoch": 0.9591733587914865, "grad_norm": 1.34375, "learning_rate": 0.000491905370712362, "loss": 5.4747, "mean_token_accuracy": 0.1769762381911278, "num_tokens": 19058561.0, "step": 8540 }, { "entropy": 5.654763650894165, "epoch": 0.959734935699444, "grad_norm": 1.390625, "learning_rate": 0.0004918946950999949, "loss": 5.5741, "mean_token_accuracy": 0.16921738386154175, "num_tokens": 19069877.0, "step": 8545 }, { "entropy": 5.7251872539520265, "epoch": 0.9602965126074016, "grad_norm": 1.390625, "learning_rate": 0.0004918840125816167, "loss": 5.5792, "mean_token_accuracy": 0.17826244831085206, "num_tokens": 19081962.0, "step": 8550 }, { "entropy": 5.646814775466919, "epoch": 0.9608580895153591, "grad_norm": 1.4140625, "learning_rate": 0.0004918733231575673, "loss": 5.6367, "mean_token_accuracy": 0.1751244530081749, "num_tokens": 19092955.0, "step": 8555 }, { "entropy": 5.690008735656738, "epoch": 0.9614196664233167, "grad_norm": 1.4609375, "learning_rate": 0.0004918626268281874, "loss": 5.4435, "mean_token_accuracy": 0.18832328021526337, "num_tokens": 19103521.0, "step": 8560 }, { "entropy": 5.521415567398071, "epoch": 0.9619812433312742, "grad_norm": 1.3984375, "learning_rate": 0.0004918519235938171, "loss": 5.4644, "mean_token_accuracy": 0.18721356838941575, "num_tokens": 19114190.0, "step": 8565 }, { "entropy": 5.628028392791748, "epoch": 0.9625428202392318, "grad_norm": 1.4921875, "learning_rate": 0.0004918412134547976, "loss": 5.5215, "mean_token_accuracy": 0.1752006560564041, "num_tokens": 19123815.0, "step": 8570 }, { "entropy": 5.675377082824707, "epoch": 0.9631043971471893, "grad_norm": 2.015625, "learning_rate": 0.0004918304964114696, "loss": 5.6645, "mean_token_accuracy": 0.17109055519104005, "num_tokens": 19135805.0, "step": 8575 }, { "entropy": 5.735991382598877, "epoch": 0.9636659740551469, "grad_norm": 1.6015625, "learning_rate": 0.0004918197724641747, "loss": 5.4943, "mean_token_accuracy": 0.17655572593212127, "num_tokens": 19146656.0, "step": 8580 }, { "entropy": 5.620199251174927, "epoch": 0.9642275509631044, "grad_norm": 1.28125, "learning_rate": 0.000491809041613254, "loss": 5.5713, "mean_token_accuracy": 0.1704343155026436, "num_tokens": 19158271.0, "step": 8585 }, { "entropy": 5.580804252624512, "epoch": 0.964789127871062, "grad_norm": 1.59375, "learning_rate": 0.0004917983038590495, "loss": 5.484, "mean_token_accuracy": 0.17846604883670808, "num_tokens": 19168439.0, "step": 8590 }, { "entropy": 5.6851584911346436, "epoch": 0.9653507047790195, "grad_norm": 1.3515625, "learning_rate": 0.0004917875592019028, "loss": 5.5721, "mean_token_accuracy": 0.17893614768981933, "num_tokens": 19179411.0, "step": 8595 }, { "entropy": 5.689495515823364, "epoch": 0.9659122816869771, "grad_norm": 1.515625, "learning_rate": 0.0004917768076421561, "loss": 5.5917, "mean_token_accuracy": 0.174559023976326, "num_tokens": 19189377.0, "step": 8600 }, { "entropy": 5.615097713470459, "epoch": 0.9664738585949346, "grad_norm": 1.3359375, "learning_rate": 0.0004917660491801518, "loss": 5.5604, "mean_token_accuracy": 0.17394228130578995, "num_tokens": 19200662.0, "step": 8605 }, { "entropy": 5.648424863815308, "epoch": 0.9670354355028922, "grad_norm": 1.4765625, "learning_rate": 0.0004917552838162324, "loss": 5.4598, "mean_token_accuracy": 0.18265042901039125, "num_tokens": 19211535.0, "step": 8610 }, { "entropy": 5.628148460388184, "epoch": 0.9675970124108496, "grad_norm": 1.953125, "learning_rate": 0.0004917445115507408, "loss": 5.4433, "mean_token_accuracy": 0.18630209118127822, "num_tokens": 19223402.0, "step": 8615 }, { "entropy": 5.487207746505737, "epoch": 0.9681585893188072, "grad_norm": 1.3828125, "learning_rate": 0.0004917337323840198, "loss": 5.5248, "mean_token_accuracy": 0.17707892805337905, "num_tokens": 19234976.0, "step": 8620 }, { "entropy": 5.468156814575195, "epoch": 0.9687201662267647, "grad_norm": 1.5546875, "learning_rate": 0.0004917229463164128, "loss": 5.3766, "mean_token_accuracy": 0.18640546053647994, "num_tokens": 19247328.0, "step": 8625 }, { "entropy": 5.678643655776978, "epoch": 0.9692817431347223, "grad_norm": 1.40625, "learning_rate": 0.0004917121533482631, "loss": 5.5186, "mean_token_accuracy": 0.17082815170288085, "num_tokens": 19259021.0, "step": 8630 }, { "entropy": 5.5514545917510985, "epoch": 0.9698433200426798, "grad_norm": 1.84375, "learning_rate": 0.0004917013534799144, "loss": 5.4829, "mean_token_accuracy": 0.17271644324064256, "num_tokens": 19270021.0, "step": 8635 }, { "entropy": 5.603173446655274, "epoch": 0.9704048969506374, "grad_norm": 1.5234375, "learning_rate": 0.0004916905467117104, "loss": 5.5294, "mean_token_accuracy": 0.18102877885103225, "num_tokens": 19281520.0, "step": 8640 }, { "entropy": 5.627556180953979, "epoch": 0.9709664738585949, "grad_norm": 1.7578125, "learning_rate": 0.0004916797330439955, "loss": 5.4723, "mean_token_accuracy": 0.1788710445165634, "num_tokens": 19292761.0, "step": 8645 }, { "entropy": 5.644547462463379, "epoch": 0.9715280507665525, "grad_norm": 1.8359375, "learning_rate": 0.0004916689124771138, "loss": 5.5805, "mean_token_accuracy": 0.17524223029613495, "num_tokens": 19305022.0, "step": 8650 }, { "entropy": 5.744730758666992, "epoch": 0.97208962767451, "grad_norm": 1.6953125, "learning_rate": 0.0004916580850114099, "loss": 5.6912, "mean_token_accuracy": 0.1697470173239708, "num_tokens": 19316162.0, "step": 8655 }, { "entropy": 5.853869438171387, "epoch": 0.9726512045824676, "grad_norm": 1.53125, "learning_rate": 0.0004916472506472286, "loss": 5.6904, "mean_token_accuracy": 0.16199478805065154, "num_tokens": 19327015.0, "step": 8660 }, { "entropy": 5.628166675567627, "epoch": 0.9732127814904251, "grad_norm": 2.703125, "learning_rate": 0.0004916364093849147, "loss": 5.5602, "mean_token_accuracy": 0.1737251363694668, "num_tokens": 19338384.0, "step": 8665 }, { "entropy": 5.600831985473633, "epoch": 0.9737743583983827, "grad_norm": 2.0625, "learning_rate": 0.0004916255612248136, "loss": 5.4773, "mean_token_accuracy": 0.18174067735671998, "num_tokens": 19349846.0, "step": 8670 }, { "entropy": 5.7154128074646, "epoch": 0.9743359353063402, "grad_norm": 1.4609375, "learning_rate": 0.0004916147061672706, "loss": 5.5172, "mean_token_accuracy": 0.17738369554281236, "num_tokens": 19361399.0, "step": 8675 }, { "entropy": 5.6050217628479, "epoch": 0.9748975122142978, "grad_norm": 1.4765625, "learning_rate": 0.0004916038442126314, "loss": 5.4925, "mean_token_accuracy": 0.1719199925661087, "num_tokens": 19371990.0, "step": 8680 }, { "entropy": 5.553276252746582, "epoch": 0.9754590891222553, "grad_norm": 1.6953125, "learning_rate": 0.0004915929753612416, "loss": 5.4993, "mean_token_accuracy": 0.17748630344867705, "num_tokens": 19383135.0, "step": 8685 }, { "entropy": 5.666282701492309, "epoch": 0.9760206660302129, "grad_norm": 2.625, "learning_rate": 0.0004915820996134477, "loss": 5.5743, "mean_token_accuracy": 0.17527981400489806, "num_tokens": 19393942.0, "step": 8690 }, { "entropy": 5.59716305732727, "epoch": 0.9765822429381704, "grad_norm": 1.5078125, "learning_rate": 0.0004915712169695956, "loss": 5.411, "mean_token_accuracy": 0.1805658981204033, "num_tokens": 19404255.0, "step": 8695 }, { "entropy": 5.596176338195801, "epoch": 0.977143819846128, "grad_norm": 1.8515625, "learning_rate": 0.000491560327430032, "loss": 5.5122, "mean_token_accuracy": 0.17859420478343963, "num_tokens": 19415425.0, "step": 8700 }, { "entropy": 5.594195079803467, "epoch": 0.9777053967540855, "grad_norm": 1.921875, "learning_rate": 0.0004915494309951035, "loss": 5.4588, "mean_token_accuracy": 0.18495271801948548, "num_tokens": 19426050.0, "step": 8705 }, { "entropy": 5.647588205337525, "epoch": 0.9782669736620431, "grad_norm": 2.015625, "learning_rate": 0.0004915385276651573, "loss": 5.5586, "mean_token_accuracy": 0.1710285097360611, "num_tokens": 19437471.0, "step": 8710 }, { "entropy": 5.6465130805969235, "epoch": 0.9788285505700005, "grad_norm": 1.546875, "learning_rate": 0.0004915276174405403, "loss": 5.587, "mean_token_accuracy": 0.17624323666095734, "num_tokens": 19449569.0, "step": 8715 }, { "entropy": 5.666909074783325, "epoch": 0.9793901274779581, "grad_norm": 1.421875, "learning_rate": 0.0004915167003215999, "loss": 5.6053, "mean_token_accuracy": 0.17028293907642364, "num_tokens": 19461630.0, "step": 8720 }, { "entropy": 5.637751913070678, "epoch": 0.9799517043859156, "grad_norm": 1.4375, "learning_rate": 0.0004915057763086838, "loss": 5.5337, "mean_token_accuracy": 0.17756096571683883, "num_tokens": 19472626.0, "step": 8725 }, { "entropy": 5.57206540107727, "epoch": 0.9805132812938732, "grad_norm": 1.78125, "learning_rate": 0.00049149484540214, "loss": 5.5253, "mean_token_accuracy": 0.1777624398469925, "num_tokens": 19483141.0, "step": 8730 }, { "entropy": 5.650867986679077, "epoch": 0.9810748582018307, "grad_norm": 1.28125, "learning_rate": 0.0004914839076023161, "loss": 5.499, "mean_token_accuracy": 0.18341919481754304, "num_tokens": 19495052.0, "step": 8735 }, { "entropy": 5.702249383926391, "epoch": 0.9816364351097883, "grad_norm": 1.4453125, "learning_rate": 0.0004914729629095609, "loss": 5.5682, "mean_token_accuracy": 0.17288218587636947, "num_tokens": 19506911.0, "step": 8740 }, { "entropy": 5.562432861328125, "epoch": 0.9821980120177458, "grad_norm": 1.578125, "learning_rate": 0.0004914620113242224, "loss": 5.4369, "mean_token_accuracy": 0.18190908581018447, "num_tokens": 19517812.0, "step": 8745 }, { "entropy": 5.673620414733887, "epoch": 0.9827595889257034, "grad_norm": 1.59375, "learning_rate": 0.0004914510528466495, "loss": 5.5298, "mean_token_accuracy": 0.176532019674778, "num_tokens": 19529857.0, "step": 8750 }, { "entropy": 5.6598528861999515, "epoch": 0.9833211658336609, "grad_norm": 1.40625, "learning_rate": 0.0004914400874771913, "loss": 5.5514, "mean_token_accuracy": 0.17500680088996887, "num_tokens": 19541082.0, "step": 8755 }, { "entropy": 5.5744036674499515, "epoch": 0.9838827427416185, "grad_norm": 1.5234375, "learning_rate": 0.0004914291152161967, "loss": 5.4743, "mean_token_accuracy": 0.18563976138830185, "num_tokens": 19551266.0, "step": 8760 }, { "entropy": 5.674076700210572, "epoch": 0.984444319649576, "grad_norm": 1.59375, "learning_rate": 0.000491418136064015, "loss": 5.662, "mean_token_accuracy": 0.17542957365512848, "num_tokens": 19563381.0, "step": 8765 }, { "entropy": 5.752225589752197, "epoch": 0.9850058965575336, "grad_norm": 1.421875, "learning_rate": 0.000491407150020996, "loss": 5.6875, "mean_token_accuracy": 0.174013951420784, "num_tokens": 19575078.0, "step": 8770 }, { "entropy": 5.6871308326721195, "epoch": 0.9855674734654911, "grad_norm": 1.65625, "learning_rate": 0.0004913961570874895, "loss": 5.4838, "mean_token_accuracy": 0.1798838794231415, "num_tokens": 19585273.0, "step": 8775 }, { "entropy": 5.567116832733154, "epoch": 0.9861290503734487, "grad_norm": 1.65625, "learning_rate": 0.0004913851572638453, "loss": 5.4983, "mean_token_accuracy": 0.17919607013463973, "num_tokens": 19594245.0, "step": 8780 }, { "entropy": 5.678967380523682, "epoch": 0.9866906272814062, "grad_norm": 1.6484375, "learning_rate": 0.0004913741505504138, "loss": 5.5321, "mean_token_accuracy": 0.17172959744930266, "num_tokens": 19604920.0, "step": 8785 }, { "entropy": 5.7392435550689695, "epoch": 0.9872522041893638, "grad_norm": 2.015625, "learning_rate": 0.0004913631369475454, "loss": 5.6313, "mean_token_accuracy": 0.17030101865530015, "num_tokens": 19616592.0, "step": 8790 }, { "entropy": 5.726884555816651, "epoch": 0.9878137810973213, "grad_norm": 1.59375, "learning_rate": 0.0004913521164555909, "loss": 5.5896, "mean_token_accuracy": 0.17396857142448424, "num_tokens": 19627359.0, "step": 8795 }, { "entropy": 5.6828028678894045, "epoch": 0.9883753580052789, "grad_norm": 1.859375, "learning_rate": 0.000491341089074901, "loss": 5.5506, "mean_token_accuracy": 0.1802465796470642, "num_tokens": 19639685.0, "step": 8800 }, { "entropy": 5.56529130935669, "epoch": 0.9889369349132364, "grad_norm": 1.8359375, "learning_rate": 0.000491330054805827, "loss": 5.3945, "mean_token_accuracy": 0.18767881393432617, "num_tokens": 19650525.0, "step": 8805 }, { "entropy": 5.508602094650269, "epoch": 0.9894985118211939, "grad_norm": 2.1875, "learning_rate": 0.0004913190136487201, "loss": 5.4621, "mean_token_accuracy": 0.1844386488199234, "num_tokens": 19662241.0, "step": 8810 }, { "entropy": 5.670568418502808, "epoch": 0.9900600887291514, "grad_norm": 1.640625, "learning_rate": 0.0004913079656039318, "loss": 5.5329, "mean_token_accuracy": 0.17866535037755965, "num_tokens": 19673752.0, "step": 8815 }, { "entropy": 5.600825834274292, "epoch": 0.990621665637109, "grad_norm": 1.875, "learning_rate": 0.0004912969106718142, "loss": 5.5253, "mean_token_accuracy": 0.17793213129043578, "num_tokens": 19685309.0, "step": 8820 }, { "entropy": 5.5946839332580565, "epoch": 0.9911832425450665, "grad_norm": 1.46875, "learning_rate": 0.000491285848852719, "loss": 5.6214, "mean_token_accuracy": 0.1743100419640541, "num_tokens": 19697391.0, "step": 8825 }, { "entropy": 5.695317173004151, "epoch": 0.9917448194530241, "grad_norm": 1.5, "learning_rate": 0.0004912747801469984, "loss": 5.5893, "mean_token_accuracy": 0.17411051988601683, "num_tokens": 19707426.0, "step": 8830 }, { "entropy": 5.710868787765503, "epoch": 0.9923063963609816, "grad_norm": 1.65625, "learning_rate": 0.000491263704555005, "loss": 5.6053, "mean_token_accuracy": 0.17150882482528687, "num_tokens": 19719800.0, "step": 8835 }, { "entropy": 5.579995489120483, "epoch": 0.9928679732689392, "grad_norm": 1.578125, "learning_rate": 0.0004912526220770913, "loss": 5.5116, "mean_token_accuracy": 0.17503908276557922, "num_tokens": 19731600.0, "step": 8840 }, { "entropy": 5.720822381973266, "epoch": 0.9934295501768967, "grad_norm": 1.46875, "learning_rate": 0.0004912415327136103, "loss": 5.5118, "mean_token_accuracy": 0.1760959282517433, "num_tokens": 19742610.0, "step": 8845 }, { "entropy": 5.776559829711914, "epoch": 0.9939911270848543, "grad_norm": 1.453125, "learning_rate": 0.000491230436464915, "loss": 5.721, "mean_token_accuracy": 0.1640644207596779, "num_tokens": 19754207.0, "step": 8850 }, { "entropy": 5.636538934707642, "epoch": 0.9945527039928118, "grad_norm": 1.7265625, "learning_rate": 0.0004912193333313589, "loss": 5.4245, "mean_token_accuracy": 0.1815497785806656, "num_tokens": 19765894.0, "step": 8855 }, { "entropy": 5.662306404113769, "epoch": 0.9951142809007694, "grad_norm": 2.0, "learning_rate": 0.0004912082233132951, "loss": 5.5738, "mean_token_accuracy": 0.17184434235095977, "num_tokens": 19777867.0, "step": 8860 }, { "entropy": 5.616130352020264, "epoch": 0.9956758578087269, "grad_norm": 1.515625, "learning_rate": 0.0004911971064110778, "loss": 5.461, "mean_token_accuracy": 0.1819846212863922, "num_tokens": 19788346.0, "step": 8865 }, { "entropy": 5.745035696029663, "epoch": 0.9962374347166845, "grad_norm": 1.8125, "learning_rate": 0.0004911859826250607, "loss": 5.6139, "mean_token_accuracy": 0.18041548728942872, "num_tokens": 19799752.0, "step": 8870 }, { "entropy": 5.649567937850952, "epoch": 0.996799011624642, "grad_norm": 2.09375, "learning_rate": 0.0004911748519555981, "loss": 5.5514, "mean_token_accuracy": 0.1762547880411148, "num_tokens": 19810387.0, "step": 8875 }, { "entropy": 5.572876071929931, "epoch": 0.9973605885325996, "grad_norm": 1.53125, "learning_rate": 0.0004911637144030444, "loss": 5.521, "mean_token_accuracy": 0.17834608554840087, "num_tokens": 19822092.0, "step": 8880 }, { "entropy": 5.707835960388183, "epoch": 0.9979221654405571, "grad_norm": 1.6796875, "learning_rate": 0.0004911525699677541, "loss": 5.6279, "mean_token_accuracy": 0.16719121038913726, "num_tokens": 19833731.0, "step": 8885 }, { "entropy": 5.668497037887573, "epoch": 0.9984837423485147, "grad_norm": 1.8203125, "learning_rate": 0.0004911414186500822, "loss": 5.5636, "mean_token_accuracy": 0.1742876499891281, "num_tokens": 19845101.0, "step": 8890 }, { "entropy": 5.6994829177856445, "epoch": 0.9990453192564722, "grad_norm": 1.6484375, "learning_rate": 0.0004911302604503837, "loss": 5.6231, "mean_token_accuracy": 0.17030643969774245, "num_tokens": 19857006.0, "step": 8895 }, { "entropy": 5.674806213378906, "epoch": 0.9996068961644298, "grad_norm": 1.7734375, "learning_rate": 0.0004911190953690139, "loss": 5.4978, "mean_token_accuracy": 0.18147013634443282, "num_tokens": 19868007.0, "step": 8900 }, { "entropy": 5.7907646497090655, "epoch": 1.0001123153815914, "grad_norm": 1.5625, "learning_rate": 0.0004911079234063284, "loss": 5.4717, "mean_token_accuracy": 0.18072778979937235, "num_tokens": 19877897.0, "step": 8905 }, { "entropy": 5.650493812561035, "epoch": 1.000673892289549, "grad_norm": 1.75, "learning_rate": 0.0004910967445626826, "loss": 5.496, "mean_token_accuracy": 0.17796591967344283, "num_tokens": 19888449.0, "step": 8910 }, { "entropy": 5.612166070938111, "epoch": 1.0012354691975065, "grad_norm": 1.53125, "learning_rate": 0.0004910855588384327, "loss": 5.4678, "mean_token_accuracy": 0.17649304419755935, "num_tokens": 19898998.0, "step": 8915 }, { "entropy": 5.6738122463226315, "epoch": 1.0017970461054642, "grad_norm": 1.6484375, "learning_rate": 0.0004910743662339348, "loss": 5.4831, "mean_token_accuracy": 0.18333123475313187, "num_tokens": 19910369.0, "step": 8920 }, { "entropy": 5.721463680267334, "epoch": 1.0023586230134216, "grad_norm": 1.703125, "learning_rate": 0.0004910631667495452, "loss": 5.5219, "mean_token_accuracy": 0.1823783427476883, "num_tokens": 19921936.0, "step": 8925 }, { "entropy": 5.657253789901733, "epoch": 1.0029201999213793, "grad_norm": 1.9140625, "learning_rate": 0.0004910519603856207, "loss": 5.5097, "mean_token_accuracy": 0.17559026032686234, "num_tokens": 19933943.0, "step": 8930 }, { "entropy": 5.494042158126831, "epoch": 1.0034817768293367, "grad_norm": 1.5859375, "learning_rate": 0.0004910407471425179, "loss": 5.3106, "mean_token_accuracy": 0.18985848128795624, "num_tokens": 19944377.0, "step": 8935 }, { "entropy": 5.521006155014038, "epoch": 1.0040433537372944, "grad_norm": 1.6875, "learning_rate": 0.000491029527020594, "loss": 5.4144, "mean_token_accuracy": 0.18066316545009614, "num_tokens": 19954865.0, "step": 8940 }, { "entropy": 5.543346166610718, "epoch": 1.0046049306452518, "grad_norm": 1.8203125, "learning_rate": 0.0004910183000202061, "loss": 5.3318, "mean_token_accuracy": 0.19103278070688248, "num_tokens": 19965021.0, "step": 8945 }, { "entropy": 5.634443902969361, "epoch": 1.0051665075532095, "grad_norm": 1.3828125, "learning_rate": 0.0004910070661417119, "loss": 5.4471, "mean_token_accuracy": 0.17768314927816392, "num_tokens": 19977068.0, "step": 8950 }, { "entropy": 5.5534903049469, "epoch": 1.005728084461167, "grad_norm": 1.6171875, "learning_rate": 0.0004909958253854687, "loss": 5.474, "mean_token_accuracy": 0.17667020857334137, "num_tokens": 19987994.0, "step": 8955 }, { "entropy": 5.651862049102784, "epoch": 1.0062896613691246, "grad_norm": 1.75, "learning_rate": 0.0004909845777518347, "loss": 5.4939, "mean_token_accuracy": 0.17481962591409683, "num_tokens": 19998598.0, "step": 8960 }, { "entropy": 5.622123050689697, "epoch": 1.006851238277082, "grad_norm": 2.984375, "learning_rate": 0.0004909733232411681, "loss": 5.385, "mean_token_accuracy": 0.1836555555462837, "num_tokens": 20008881.0, "step": 8965 }, { "entropy": 5.586540174484253, "epoch": 1.0074128151850397, "grad_norm": 1.4765625, "learning_rate": 0.0004909620618538271, "loss": 5.4177, "mean_token_accuracy": 0.17951451539993285, "num_tokens": 20019105.0, "step": 8970 }, { "entropy": 5.579048728942871, "epoch": 1.007974392092997, "grad_norm": 1.7734375, "learning_rate": 0.0004909507935901702, "loss": 5.4769, "mean_token_accuracy": 0.17605098336935043, "num_tokens": 20031805.0, "step": 8975 }, { "entropy": 5.62233076095581, "epoch": 1.0085359690009548, "grad_norm": 1.796875, "learning_rate": 0.0004909395184505564, "loss": 5.4234, "mean_token_accuracy": 0.18534507006406784, "num_tokens": 20041493.0, "step": 8980 }, { "entropy": 5.607890892028808, "epoch": 1.0090975459089122, "grad_norm": 1.734375, "learning_rate": 0.0004909282364353445, "loss": 5.4807, "mean_token_accuracy": 0.18110638111829758, "num_tokens": 20052489.0, "step": 8985 }, { "entropy": 5.46955451965332, "epoch": 1.0096591228168699, "grad_norm": 1.4609375, "learning_rate": 0.0004909169475448938, "loss": 5.4328, "mean_token_accuracy": 0.1797465994954109, "num_tokens": 20064252.0, "step": 8990 }, { "entropy": 5.621907567977905, "epoch": 1.0102206997248273, "grad_norm": 1.546875, "learning_rate": 0.0004909056517795638, "loss": 5.3744, "mean_token_accuracy": 0.17497411817312242, "num_tokens": 20075171.0, "step": 8995 }, { "entropy": 5.624486780166626, "epoch": 1.010782276632785, "grad_norm": 1.640625, "learning_rate": 0.0004908943491397141, "loss": 5.376, "mean_token_accuracy": 0.18161926418542862, "num_tokens": 20085746.0, "step": 9000 }, { "epoch": 1.010782276632785, "eval_entropy": 5.459080059872112, "eval_loss": 5.578691005706787, "eval_mean_token_accuracy": 0.1821541891581993, "eval_num_tokens": 20085746.0, "eval_runtime": 23.814, "eval_samples_per_second": 1302.304, "eval_steps_per_second": 162.804, "step": 9000 }, { "entropy": 5.554215002059936, "epoch": 1.0113438535407424, "grad_norm": 1.5078125, "learning_rate": 0.0004908830396257045, "loss": 5.4536, "mean_token_accuracy": 0.17544384002685548, "num_tokens": 20097435.0, "step": 9005 }, { "entropy": 5.565097761154175, "epoch": 1.0119054304486998, "grad_norm": 1.65625, "learning_rate": 0.0004908717232378953, "loss": 5.4455, "mean_token_accuracy": 0.17849185615777968, "num_tokens": 20108100.0, "step": 9010 }, { "entropy": 5.682046175003052, "epoch": 1.0124670073566575, "grad_norm": 1.734375, "learning_rate": 0.0004908603999766467, "loss": 5.4581, "mean_token_accuracy": 0.17797257453203202, "num_tokens": 20119042.0, "step": 9015 }, { "entropy": 5.565086078643799, "epoch": 1.013028584264615, "grad_norm": 1.8984375, "learning_rate": 0.0004908490698423191, "loss": 5.5158, "mean_token_accuracy": 0.17789216041564943, "num_tokens": 20130275.0, "step": 9020 }, { "entropy": 5.555480098724365, "epoch": 1.0135901611725726, "grad_norm": 1.859375, "learning_rate": 0.0004908377328352736, "loss": 5.4629, "mean_token_accuracy": 0.17693307846784592, "num_tokens": 20142523.0, "step": 9025 }, { "entropy": 5.602287340164184, "epoch": 1.01415173808053, "grad_norm": 1.3671875, "learning_rate": 0.0004908263889558709, "loss": 5.4208, "mean_token_accuracy": 0.18608217239379882, "num_tokens": 20153732.0, "step": 9030 }, { "entropy": 5.6788112163543705, "epoch": 1.0147133149884877, "grad_norm": 1.28125, "learning_rate": 0.0004908150382044722, "loss": 5.4983, "mean_token_accuracy": 0.17320408672094345, "num_tokens": 20165136.0, "step": 9035 }, { "entropy": 5.568822240829467, "epoch": 1.0152748918964452, "grad_norm": 1.359375, "learning_rate": 0.000490803680581439, "loss": 5.4291, "mean_token_accuracy": 0.18082266598939895, "num_tokens": 20175326.0, "step": 9040 }, { "entropy": 5.587617254257202, "epoch": 1.0158364688044028, "grad_norm": 1.84375, "learning_rate": 0.000490792316087133, "loss": 5.3695, "mean_token_accuracy": 0.18594837188720703, "num_tokens": 20186678.0, "step": 9045 }, { "entropy": 5.539478063583374, "epoch": 1.0163980457123603, "grad_norm": 1.34375, "learning_rate": 0.0004907809447219158, "loss": 5.3786, "mean_token_accuracy": 0.18022306710481645, "num_tokens": 20196696.0, "step": 9050 }, { "entropy": 5.565349864959717, "epoch": 1.016959622620318, "grad_norm": 1.65625, "learning_rate": 0.0004907695664861498, "loss": 5.4002, "mean_token_accuracy": 0.18411532640457154, "num_tokens": 20207566.0, "step": 9055 }, { "entropy": 5.537447357177735, "epoch": 1.0175211995282754, "grad_norm": 1.3984375, "learning_rate": 0.0004907581813801971, "loss": 5.4409, "mean_token_accuracy": 0.17487737089395522, "num_tokens": 20218233.0, "step": 9060 }, { "entropy": 5.616069173812866, "epoch": 1.018082776436233, "grad_norm": 1.3515625, "learning_rate": 0.0004907467894044202, "loss": 5.3577, "mean_token_accuracy": 0.18108492195606232, "num_tokens": 20228524.0, "step": 9065 }, { "entropy": 5.5232336044311525, "epoch": 1.0186443533441905, "grad_norm": 1.421875, "learning_rate": 0.0004907353905591817, "loss": 5.4619, "mean_token_accuracy": 0.1800857111811638, "num_tokens": 20240821.0, "step": 9070 }, { "entropy": 5.537438440322876, "epoch": 1.0192059302521481, "grad_norm": 1.4453125, "learning_rate": 0.000490723984844845, "loss": 5.4308, "mean_token_accuracy": 0.18032869696617126, "num_tokens": 20252282.0, "step": 9075 }, { "entropy": 5.6138331413269045, "epoch": 1.0197675071601056, "grad_norm": 1.375, "learning_rate": 0.0004907125722617727, "loss": 5.4367, "mean_token_accuracy": 0.18050792068243027, "num_tokens": 20263462.0, "step": 9080 }, { "entropy": 5.6108558177948, "epoch": 1.0203290840680632, "grad_norm": 1.7265625, "learning_rate": 0.0004907011528103285, "loss": 5.4753, "mean_token_accuracy": 0.17466021329164505, "num_tokens": 20275062.0, "step": 9085 }, { "entropy": 5.608004331588745, "epoch": 1.0208906609760207, "grad_norm": 1.46875, "learning_rate": 0.0004906897264908759, "loss": 5.4529, "mean_token_accuracy": 0.1767593130469322, "num_tokens": 20286243.0, "step": 9090 }, { "entropy": 5.569535255432129, "epoch": 1.0214522378839783, "grad_norm": 1.515625, "learning_rate": 0.0004906782933037789, "loss": 5.4607, "mean_token_accuracy": 0.17864596843719482, "num_tokens": 20296929.0, "step": 9095 }, { "entropy": 5.589272975921631, "epoch": 1.0220138147919358, "grad_norm": 1.46875, "learning_rate": 0.0004906668532494012, "loss": 5.3494, "mean_token_accuracy": 0.18342964649200438, "num_tokens": 20308354.0, "step": 9100 }, { "entropy": 5.610014581680298, "epoch": 1.0225753916998932, "grad_norm": 1.75, "learning_rate": 0.0004906554063281074, "loss": 5.5226, "mean_token_accuracy": 0.1788520559668541, "num_tokens": 20319487.0, "step": 9105 }, { "entropy": 5.516573715209961, "epoch": 1.0231369686078509, "grad_norm": 2.296875, "learning_rate": 0.0004906439525402618, "loss": 5.4296, "mean_token_accuracy": 0.18768656700849534, "num_tokens": 20329967.0, "step": 9110 }, { "entropy": 5.652112627029419, "epoch": 1.0236985455158083, "grad_norm": 1.4765625, "learning_rate": 0.0004906324918862291, "loss": 5.5061, "mean_token_accuracy": 0.17268284261226655, "num_tokens": 20341442.0, "step": 9115 }, { "entropy": 5.684236621856689, "epoch": 1.024260122423766, "grad_norm": 1.859375, "learning_rate": 0.0004906210243663742, "loss": 5.6184, "mean_token_accuracy": 0.1690230995416641, "num_tokens": 20352818.0, "step": 9120 }, { "entropy": 5.731576585769654, "epoch": 1.0248216993317234, "grad_norm": 1.359375, "learning_rate": 0.0004906095499810622, "loss": 5.5189, "mean_token_accuracy": 0.17407773584127426, "num_tokens": 20364787.0, "step": 9125 }, { "entropy": 5.6368835926055905, "epoch": 1.025383276239681, "grad_norm": 1.71875, "learning_rate": 0.0004905980687306586, "loss": 5.3863, "mean_token_accuracy": 0.193366876244545, "num_tokens": 20375491.0, "step": 9130 }, { "entropy": 5.580576801300049, "epoch": 1.0259448531476385, "grad_norm": 1.5, "learning_rate": 0.0004905865806155288, "loss": 5.449, "mean_token_accuracy": 0.18474821895360946, "num_tokens": 20386270.0, "step": 9135 }, { "entropy": 5.697377729415893, "epoch": 1.0265064300555962, "grad_norm": 1.53125, "learning_rate": 0.0004905750856360387, "loss": 5.5493, "mean_token_accuracy": 0.17359945625066758, "num_tokens": 20397953.0, "step": 9140 }, { "entropy": 5.658065843582153, "epoch": 1.0270680069635536, "grad_norm": 2.046875, "learning_rate": 0.0004905635837925543, "loss": 5.5395, "mean_token_accuracy": 0.17324478775262833, "num_tokens": 20409847.0, "step": 9145 }, { "entropy": 5.628514909744263, "epoch": 1.0276295838715113, "grad_norm": 1.4140625, "learning_rate": 0.0004905520750854418, "loss": 5.5244, "mean_token_accuracy": 0.18113597482442856, "num_tokens": 20420737.0, "step": 9150 }, { "entropy": 5.598775434494018, "epoch": 1.0281911607794687, "grad_norm": 1.84375, "learning_rate": 0.0004905405595150674, "loss": 5.4158, "mean_token_accuracy": 0.17999387234449388, "num_tokens": 20432395.0, "step": 9155 }, { "entropy": 5.570962142944336, "epoch": 1.0287527376874264, "grad_norm": 1.375, "learning_rate": 0.0004905290370817982, "loss": 5.4113, "mean_token_accuracy": 0.1848587855696678, "num_tokens": 20442964.0, "step": 9160 }, { "entropy": 5.589252853393555, "epoch": 1.0293143145953838, "grad_norm": 1.46875, "learning_rate": 0.000490517507786001, "loss": 5.4535, "mean_token_accuracy": 0.1752680480480194, "num_tokens": 20454050.0, "step": 9165 }, { "entropy": 5.611699819564819, "epoch": 1.0298758915033415, "grad_norm": 1.4609375, "learning_rate": 0.0004905059716280425, "loss": 5.4671, "mean_token_accuracy": 0.17207229137420654, "num_tokens": 20465335.0, "step": 9170 }, { "entropy": 5.591488790512085, "epoch": 1.030437468411299, "grad_norm": 1.9921875, "learning_rate": 0.0004904944286082904, "loss": 5.439, "mean_token_accuracy": 0.1793852284550667, "num_tokens": 20476781.0, "step": 9175 }, { "entropy": 5.579262685775757, "epoch": 1.0309990453192566, "grad_norm": 1.5234375, "learning_rate": 0.0004904828787271121, "loss": 5.4773, "mean_token_accuracy": 0.17789653241634368, "num_tokens": 20488599.0, "step": 9180 }, { "entropy": 5.502214145660401, "epoch": 1.031560622227214, "grad_norm": 1.5078125, "learning_rate": 0.0004904713219848753, "loss": 5.3622, "mean_token_accuracy": 0.18779534250497817, "num_tokens": 20498215.0, "step": 9185 }, { "entropy": 5.621550893783569, "epoch": 1.0321221991351717, "grad_norm": 1.953125, "learning_rate": 0.0004904597583819481, "loss": 5.3901, "mean_token_accuracy": 0.1827726513147354, "num_tokens": 20509764.0, "step": 9190 }, { "entropy": 5.771495628356933, "epoch": 1.032683776043129, "grad_norm": 1.5390625, "learning_rate": 0.0004904481879186987, "loss": 5.6073, "mean_token_accuracy": 0.17733301371335983, "num_tokens": 20521582.0, "step": 9195 }, { "entropy": 5.563735485076904, "epoch": 1.0332453529510865, "grad_norm": 1.3359375, "learning_rate": 0.0004904366105954954, "loss": 5.4825, "mean_token_accuracy": 0.17996705174446107, "num_tokens": 20532050.0, "step": 9200 }, { "entropy": 5.589707326889038, "epoch": 1.0338069298590442, "grad_norm": 1.7421875, "learning_rate": 0.0004904250264127067, "loss": 5.4864, "mean_token_accuracy": 0.17125514298677444, "num_tokens": 20543733.0, "step": 9205 }, { "entropy": 5.674970865249634, "epoch": 1.0343685067670016, "grad_norm": 1.2734375, "learning_rate": 0.0004904134353707018, "loss": 5.511, "mean_token_accuracy": 0.17877715229988098, "num_tokens": 20554898.0, "step": 9210 }, { "entropy": 5.539908313751221, "epoch": 1.0349300836749593, "grad_norm": 1.921875, "learning_rate": 0.0004904018374698496, "loss": 5.3852, "mean_token_accuracy": 0.18103183954954147, "num_tokens": 20565243.0, "step": 9215 }, { "entropy": 5.526424217224121, "epoch": 1.0354916605829168, "grad_norm": 1.3984375, "learning_rate": 0.0004903902327105191, "loss": 5.3783, "mean_token_accuracy": 0.18287476301193237, "num_tokens": 20575321.0, "step": 9220 }, { "entropy": 5.642215061187744, "epoch": 1.0360532374908744, "grad_norm": 1.5078125, "learning_rate": 0.0004903786210930803, "loss": 5.55, "mean_token_accuracy": 0.16923462599515915, "num_tokens": 20586450.0, "step": 9225 }, { "entropy": 5.652804899215698, "epoch": 1.0366148143988319, "grad_norm": 1.375, "learning_rate": 0.0004903670026179025, "loss": 5.5276, "mean_token_accuracy": 0.18359616696834563, "num_tokens": 20596996.0, "step": 9230 }, { "entropy": 5.593594217300415, "epoch": 1.0371763913067895, "grad_norm": 3.09375, "learning_rate": 0.000490355377285356, "loss": 5.4321, "mean_token_accuracy": 0.1745638743042946, "num_tokens": 20609136.0, "step": 9235 }, { "entropy": 5.649332761764526, "epoch": 1.037737968214747, "grad_norm": 1.59375, "learning_rate": 0.0004903437450958106, "loss": 5.509, "mean_token_accuracy": 0.17722001522779465, "num_tokens": 20620246.0, "step": 9240 }, { "entropy": 5.5271008014678955, "epoch": 1.0382995451227046, "grad_norm": 1.5625, "learning_rate": 0.0004903321060496369, "loss": 5.4402, "mean_token_accuracy": 0.17385232001543044, "num_tokens": 20631678.0, "step": 9245 }, { "entropy": 5.603906536102295, "epoch": 1.038861122030662, "grad_norm": 1.8359375, "learning_rate": 0.0004903204601472054, "loss": 5.3884, "mean_token_accuracy": 0.18640923500061035, "num_tokens": 20643287.0, "step": 9250 }, { "entropy": 5.604735088348389, "epoch": 1.0394226989386197, "grad_norm": 1.765625, "learning_rate": 0.0004903088073888869, "loss": 5.4314, "mean_token_accuracy": 0.18265591114759444, "num_tokens": 20655091.0, "step": 9255 }, { "entropy": 5.589794301986695, "epoch": 1.0399842758465772, "grad_norm": 1.5078125, "learning_rate": 0.0004902971477750526, "loss": 5.4618, "mean_token_accuracy": 0.18000126481056214, "num_tokens": 20665043.0, "step": 9260 }, { "entropy": 5.543551874160767, "epoch": 1.0405458527545348, "grad_norm": 1.3984375, "learning_rate": 0.0004902854813060736, "loss": 5.3904, "mean_token_accuracy": 0.18817973136901855, "num_tokens": 20675225.0, "step": 9265 }, { "entropy": 5.551910877227783, "epoch": 1.0411074296624923, "grad_norm": 1.5703125, "learning_rate": 0.0004902738079823213, "loss": 5.4656, "mean_token_accuracy": 0.17844348698854445, "num_tokens": 20686542.0, "step": 9270 }, { "entropy": 5.541519689559936, "epoch": 1.04166900657045, "grad_norm": 1.3515625, "learning_rate": 0.0004902621278041674, "loss": 5.3959, "mean_token_accuracy": 0.18315559178590773, "num_tokens": 20697926.0, "step": 9275 }, { "entropy": 5.589543962478638, "epoch": 1.0422305834784074, "grad_norm": 1.4609375, "learning_rate": 0.0004902504407719839, "loss": 5.5135, "mean_token_accuracy": 0.17791294157505036, "num_tokens": 20707890.0, "step": 9280 }, { "entropy": 5.623344087600708, "epoch": 1.042792160386365, "grad_norm": 1.53125, "learning_rate": 0.0004902387468861429, "loss": 5.4447, "mean_token_accuracy": 0.17739499360322952, "num_tokens": 20719554.0, "step": 9285 }, { "entropy": 5.6102501392364506, "epoch": 1.0433537372943225, "grad_norm": 1.9375, "learning_rate": 0.0004902270461470169, "loss": 5.4078, "mean_token_accuracy": 0.18083870112895967, "num_tokens": 20730899.0, "step": 9290 }, { "entropy": 5.58493447303772, "epoch": 1.04391531420228, "grad_norm": 1.3671875, "learning_rate": 0.000490215338554978, "loss": 5.522, "mean_token_accuracy": 0.17751231491565705, "num_tokens": 20741839.0, "step": 9295 }, { "entropy": 5.591024684906006, "epoch": 1.0444768911102376, "grad_norm": 1.7109375, "learning_rate": 0.0004902036241103994, "loss": 5.4857, "mean_token_accuracy": 0.18067652583122254, "num_tokens": 20753199.0, "step": 9300 }, { "entropy": 5.661981391906738, "epoch": 1.045038468018195, "grad_norm": 1.3984375, "learning_rate": 0.0004901919028136539, "loss": 5.5496, "mean_token_accuracy": 0.17503437399864197, "num_tokens": 20764827.0, "step": 9305 }, { "entropy": 5.610328722000122, "epoch": 1.0456000449261527, "grad_norm": 1.5390625, "learning_rate": 0.0004901801746651147, "loss": 5.4256, "mean_token_accuracy": 0.18545343726873398, "num_tokens": 20774953.0, "step": 9310 }, { "entropy": 5.571823215484619, "epoch": 1.04616162183411, "grad_norm": 1.4609375, "learning_rate": 0.0004901684396651554, "loss": 5.4427, "mean_token_accuracy": 0.18092939853668213, "num_tokens": 20784428.0, "step": 9315 }, { "entropy": 5.598528337478638, "epoch": 1.0467231987420678, "grad_norm": 1.640625, "learning_rate": 0.0004901566978141494, "loss": 5.512, "mean_token_accuracy": 0.17941481471061707, "num_tokens": 20795672.0, "step": 9320 }, { "entropy": 5.651431894302368, "epoch": 1.0472847756500252, "grad_norm": 1.515625, "learning_rate": 0.0004901449491124708, "loss": 5.5068, "mean_token_accuracy": 0.1770174965262413, "num_tokens": 20806972.0, "step": 9325 }, { "entropy": 5.64578070640564, "epoch": 1.0478463525579829, "grad_norm": 1.484375, "learning_rate": 0.0004901331935604936, "loss": 5.5248, "mean_token_accuracy": 0.17678644359111786, "num_tokens": 20817867.0, "step": 9330 }, { "entropy": 5.498245143890381, "epoch": 1.0484079294659403, "grad_norm": 1.3671875, "learning_rate": 0.000490121431158592, "loss": 5.3575, "mean_token_accuracy": 0.18257005363702775, "num_tokens": 20829205.0, "step": 9335 }, { "entropy": 5.572736358642578, "epoch": 1.048969506373898, "grad_norm": 1.5625, "learning_rate": 0.0004901096619071407, "loss": 5.4797, "mean_token_accuracy": 0.18204336166381835, "num_tokens": 20840478.0, "step": 9340 }, { "entropy": 5.658757066726684, "epoch": 1.0495310832818554, "grad_norm": 1.328125, "learning_rate": 0.0004900978858065142, "loss": 5.4306, "mean_token_accuracy": 0.18008593916893006, "num_tokens": 20850752.0, "step": 9345 }, { "entropy": 5.604446268081665, "epoch": 1.050092660189813, "grad_norm": 1.28125, "learning_rate": 0.0004900861028570877, "loss": 5.4501, "mean_token_accuracy": 0.17572760283946992, "num_tokens": 20862261.0, "step": 9350 }, { "entropy": 5.5822326183319095, "epoch": 1.0506542370977705, "grad_norm": 1.34375, "learning_rate": 0.0004900743130592362, "loss": 5.4086, "mean_token_accuracy": 0.18594421893358232, "num_tokens": 20872604.0, "step": 9355 }, { "entropy": 5.4873597621917725, "epoch": 1.0512158140057282, "grad_norm": 1.3828125, "learning_rate": 0.0004900625164133351, "loss": 5.3491, "mean_token_accuracy": 0.19344383776187896, "num_tokens": 20882751.0, "step": 9360 }, { "entropy": 5.581871128082275, "epoch": 1.0517773909136856, "grad_norm": 1.9375, "learning_rate": 0.0004900507129197601, "loss": 5.4704, "mean_token_accuracy": 0.17706203758716582, "num_tokens": 20893809.0, "step": 9365 }, { "entropy": 5.692767477035522, "epoch": 1.0523389678216433, "grad_norm": 1.59375, "learning_rate": 0.0004900389025788871, "loss": 5.3872, "mean_token_accuracy": 0.18640353083610534, "num_tokens": 20904201.0, "step": 9370 }, { "entropy": 5.554631233215332, "epoch": 1.0529005447296007, "grad_norm": 1.3515625, "learning_rate": 0.000490027085391092, "loss": 5.4679, "mean_token_accuracy": 0.17571618407964706, "num_tokens": 20915226.0, "step": 9375 }, { "entropy": 5.554903602600097, "epoch": 1.0534621216375584, "grad_norm": 1.59375, "learning_rate": 0.000490015261356751, "loss": 5.4384, "mean_token_accuracy": 0.1765777975320816, "num_tokens": 20926040.0, "step": 9380 }, { "entropy": 5.656567096710205, "epoch": 1.0540236985455158, "grad_norm": 1.46875, "learning_rate": 0.0004900034304762408, "loss": 5.4719, "mean_token_accuracy": 0.18317525684833527, "num_tokens": 20937051.0, "step": 9385 }, { "entropy": 5.586511945724487, "epoch": 1.0545852754534732, "grad_norm": 1.4140625, "learning_rate": 0.000489991592749938, "loss": 5.4956, "mean_token_accuracy": 0.17753477841615678, "num_tokens": 20947810.0, "step": 9390 }, { "entropy": 5.570503187179566, "epoch": 1.055146852361431, "grad_norm": 1.4296875, "learning_rate": 0.0004899797481782193, "loss": 5.4455, "mean_token_accuracy": 0.17481617033481597, "num_tokens": 20958307.0, "step": 9395 }, { "entropy": 5.539948797225952, "epoch": 1.0557084292693883, "grad_norm": 1.796875, "learning_rate": 0.0004899678967614623, "loss": 5.3425, "mean_token_accuracy": 0.18573132604360582, "num_tokens": 20969493.0, "step": 9400 }, { "entropy": 5.6041279315948485, "epoch": 1.056270006177346, "grad_norm": 1.5390625, "learning_rate": 0.0004899560385000439, "loss": 5.505, "mean_token_accuracy": 0.1813835933804512, "num_tokens": 20980224.0, "step": 9405 }, { "entropy": 5.611564826965332, "epoch": 1.0568315830853034, "grad_norm": 1.4765625, "learning_rate": 0.000489944173394342, "loss": 5.465, "mean_token_accuracy": 0.18255140036344528, "num_tokens": 20991282.0, "step": 9410 }, { "entropy": 5.660673666000366, "epoch": 1.0573931599932611, "grad_norm": 1.4375, "learning_rate": 0.0004899323014447342, "loss": 5.4889, "mean_token_accuracy": 0.17426551580429078, "num_tokens": 21002395.0, "step": 9415 }, { "entropy": 5.554814577102661, "epoch": 1.0579547369012186, "grad_norm": 1.75, "learning_rate": 0.0004899204226515985, "loss": 5.4145, "mean_token_accuracy": 0.17696548700332643, "num_tokens": 21014136.0, "step": 9420 }, { "entropy": 5.621621894836426, "epoch": 1.0585163138091762, "grad_norm": 1.734375, "learning_rate": 0.0004899085370153133, "loss": 5.5344, "mean_token_accuracy": 0.1757613092660904, "num_tokens": 21025637.0, "step": 9425 }, { "entropy": 5.781061601638794, "epoch": 1.0590778907171337, "grad_norm": 1.59375, "learning_rate": 0.0004898966445362569, "loss": 5.5789, "mean_token_accuracy": 0.1691136360168457, "num_tokens": 21036393.0, "step": 9430 }, { "entropy": 5.683920192718506, "epoch": 1.0596394676250913, "grad_norm": 1.5859375, "learning_rate": 0.0004898847452148079, "loss": 5.5224, "mean_token_accuracy": 0.1836437076330185, "num_tokens": 21047339.0, "step": 9435 }, { "entropy": 5.654892826080323, "epoch": 1.0602010445330488, "grad_norm": 1.75, "learning_rate": 0.0004898728390513454, "loss": 5.6236, "mean_token_accuracy": 0.17097096592187883, "num_tokens": 21059427.0, "step": 9440 }, { "entropy": 5.628730916976929, "epoch": 1.0607626214410064, "grad_norm": 1.4296875, "learning_rate": 0.0004898609260462483, "loss": 5.4506, "mean_token_accuracy": 0.17322685420513154, "num_tokens": 21068666.0, "step": 9445 }, { "entropy": 5.65942964553833, "epoch": 1.0613241983489639, "grad_norm": 1.4765625, "learning_rate": 0.0004898490061998961, "loss": 5.4612, "mean_token_accuracy": 0.17689654380083084, "num_tokens": 21080161.0, "step": 9450 }, { "entropy": 5.6597339630126955, "epoch": 1.0618857752569215, "grad_norm": 1.53125, "learning_rate": 0.0004898370795126681, "loss": 5.5456, "mean_token_accuracy": 0.17456338703632354, "num_tokens": 21092363.0, "step": 9455 }, { "entropy": 5.5144401550292965, "epoch": 1.062447352164879, "grad_norm": 1.265625, "learning_rate": 0.0004898251459849441, "loss": 5.4438, "mean_token_accuracy": 0.18251396864652633, "num_tokens": 21103683.0, "step": 9460 }, { "entropy": 5.56109733581543, "epoch": 1.0630089290728366, "grad_norm": 1.5546875, "learning_rate": 0.0004898132056171041, "loss": 5.3997, "mean_token_accuracy": 0.18426249623298646, "num_tokens": 21115110.0, "step": 9465 }, { "entropy": 5.616233873367309, "epoch": 1.063570505980794, "grad_norm": 1.4609375, "learning_rate": 0.0004898012584095285, "loss": 5.3795, "mean_token_accuracy": 0.1885729670524597, "num_tokens": 21124327.0, "step": 9470 }, { "entropy": 5.565642499923706, "epoch": 1.0641320828887517, "grad_norm": 1.5078125, "learning_rate": 0.0004897893043625975, "loss": 5.5125, "mean_token_accuracy": 0.17969844341278077, "num_tokens": 21135542.0, "step": 9475 }, { "entropy": 5.537214708328247, "epoch": 1.0646936597967092, "grad_norm": 1.546875, "learning_rate": 0.0004897773434766917, "loss": 5.4006, "mean_token_accuracy": 0.17806485891342164, "num_tokens": 21147621.0, "step": 9480 }, { "entropy": 5.565270471572876, "epoch": 1.0652552367046666, "grad_norm": 1.46875, "learning_rate": 0.000489765375752192, "loss": 5.4054, "mean_token_accuracy": 0.18055632710456848, "num_tokens": 21159725.0, "step": 9485 }, { "entropy": 5.556740951538086, "epoch": 1.0658168136126243, "grad_norm": 1.4375, "learning_rate": 0.0004897534011894793, "loss": 5.4692, "mean_token_accuracy": 0.1807580292224884, "num_tokens": 21171303.0, "step": 9490 }, { "entropy": 5.706756448745727, "epoch": 1.0663783905205817, "grad_norm": 1.3828125, "learning_rate": 0.0004897414197889352, "loss": 5.5675, "mean_token_accuracy": 0.17455703616142274, "num_tokens": 21183376.0, "step": 9495 }, { "entropy": 5.659519624710083, "epoch": 1.0669399674285394, "grad_norm": 1.4453125, "learning_rate": 0.000489729431550941, "loss": 5.4447, "mean_token_accuracy": 0.17345247715711593, "num_tokens": 21194365.0, "step": 9500 }, { "entropy": 5.444472789764404, "epoch": 1.0675015443364968, "grad_norm": 1.40625, "learning_rate": 0.0004897174364758783, "loss": 5.3153, "mean_token_accuracy": 0.18512341380119324, "num_tokens": 21206440.0, "step": 9505 }, { "entropy": 5.455184984207153, "epoch": 1.0680631212444545, "grad_norm": 1.2890625, "learning_rate": 0.0004897054345641291, "loss": 5.369, "mean_token_accuracy": 0.18379151225090026, "num_tokens": 21217188.0, "step": 9510 }, { "entropy": 5.570040655136109, "epoch": 1.068624698152412, "grad_norm": 1.359375, "learning_rate": 0.0004896934258160757, "loss": 5.4465, "mean_token_accuracy": 0.17723545730113982, "num_tokens": 21227716.0, "step": 9515 }, { "entropy": 5.643634176254272, "epoch": 1.0691862750603696, "grad_norm": 1.4609375, "learning_rate": 0.0004896814102321004, "loss": 5.5694, "mean_token_accuracy": 0.17157238572835923, "num_tokens": 21241258.0, "step": 9520 }, { "entropy": 5.599542284011841, "epoch": 1.069747851968327, "grad_norm": 1.265625, "learning_rate": 0.0004896693878125857, "loss": 5.3809, "mean_token_accuracy": 0.1786022424697876, "num_tokens": 21252543.0, "step": 9525 }, { "entropy": 5.616940689086914, "epoch": 1.0703094288762847, "grad_norm": 1.3671875, "learning_rate": 0.0004896573585579144, "loss": 5.4974, "mean_token_accuracy": 0.17120815068483353, "num_tokens": 21264829.0, "step": 9530 }, { "entropy": 5.66899471282959, "epoch": 1.070871005784242, "grad_norm": 1.8828125, "learning_rate": 0.0004896453224684695, "loss": 5.4994, "mean_token_accuracy": 0.179149766266346, "num_tokens": 21276240.0, "step": 9535 }, { "entropy": 5.620451879501343, "epoch": 1.0714325826921998, "grad_norm": 1.5546875, "learning_rate": 0.0004896332795446345, "loss": 5.5129, "mean_token_accuracy": 0.17478324174880983, "num_tokens": 21288877.0, "step": 9540 }, { "entropy": 5.644775009155273, "epoch": 1.0719941596001572, "grad_norm": 1.421875, "learning_rate": 0.0004896212297867924, "loss": 5.5498, "mean_token_accuracy": 0.17083704620599746, "num_tokens": 21300147.0, "step": 9545 }, { "entropy": 5.564145803451538, "epoch": 1.0725557365081149, "grad_norm": 1.328125, "learning_rate": 0.0004896091731953271, "loss": 5.3379, "mean_token_accuracy": 0.1834096446633339, "num_tokens": 21309731.0, "step": 9550 }, { "entropy": 5.54395546913147, "epoch": 1.0731173134160723, "grad_norm": 1.9453125, "learning_rate": 0.0004895971097706227, "loss": 5.413, "mean_token_accuracy": 0.17877567708492278, "num_tokens": 21320358.0, "step": 9555 }, { "entropy": 5.487132596969604, "epoch": 1.07367889032403, "grad_norm": 1.4765625, "learning_rate": 0.0004895850395130629, "loss": 5.3176, "mean_token_accuracy": 0.19092220366001128, "num_tokens": 21331077.0, "step": 9560 }, { "entropy": 5.564539003372192, "epoch": 1.0742404672319874, "grad_norm": 1.484375, "learning_rate": 0.0004895729624230323, "loss": 5.5168, "mean_token_accuracy": 0.18183142989873885, "num_tokens": 21341304.0, "step": 9565 }, { "entropy": 5.6389447212219235, "epoch": 1.074802044139945, "grad_norm": 1.3671875, "learning_rate": 0.0004895608785009153, "loss": 5.495, "mean_token_accuracy": 0.1784301996231079, "num_tokens": 21353663.0, "step": 9570 }, { "entropy": 5.57873568534851, "epoch": 1.0753636210479025, "grad_norm": 1.640625, "learning_rate": 0.0004895487877470969, "loss": 5.4624, "mean_token_accuracy": 0.17929406017065047, "num_tokens": 21364987.0, "step": 9575 }, { "entropy": 5.507581281661987, "epoch": 1.07592519795586, "grad_norm": 1.2265625, "learning_rate": 0.0004895366901619617, "loss": 5.4332, "mean_token_accuracy": 0.17917827069759368, "num_tokens": 21376169.0, "step": 9580 }, { "entropy": 5.57572569847107, "epoch": 1.0764867748638176, "grad_norm": 1.3828125, "learning_rate": 0.0004895245857458951, "loss": 5.409, "mean_token_accuracy": 0.17978260666131973, "num_tokens": 21387141.0, "step": 9585 }, { "entropy": 5.60054030418396, "epoch": 1.077048351771775, "grad_norm": 1.6015625, "learning_rate": 0.0004895124744992825, "loss": 5.392, "mean_token_accuracy": 0.18548154681921006, "num_tokens": 21396804.0, "step": 9590 }, { "entropy": 5.509835720062256, "epoch": 1.0776099286797327, "grad_norm": 1.6171875, "learning_rate": 0.0004895003564225095, "loss": 5.4276, "mean_token_accuracy": 0.18453317284584045, "num_tokens": 21406948.0, "step": 9595 }, { "entropy": 5.553013610839844, "epoch": 1.0781715055876901, "grad_norm": 1.4609375, "learning_rate": 0.0004894882315159621, "loss": 5.4084, "mean_token_accuracy": 0.18084955364465713, "num_tokens": 21417560.0, "step": 9600 }, { "entropy": 5.538203001022339, "epoch": 1.0787330824956478, "grad_norm": 1.71875, "learning_rate": 0.000489476099780026, "loss": 5.4176, "mean_token_accuracy": 0.18558336198329925, "num_tokens": 21428596.0, "step": 9605 }, { "entropy": 5.594052362442016, "epoch": 1.0792946594036052, "grad_norm": 1.3984375, "learning_rate": 0.0004894639612150879, "loss": 5.5009, "mean_token_accuracy": 0.1776292786002159, "num_tokens": 21440004.0, "step": 9610 }, { "entropy": 5.603554058074951, "epoch": 1.079856236311563, "grad_norm": 1.609375, "learning_rate": 0.0004894518158215339, "loss": 5.437, "mean_token_accuracy": 0.18182192593812943, "num_tokens": 21451423.0, "step": 9615 }, { "entropy": 5.6315145015716555, "epoch": 1.0804178132195204, "grad_norm": 1.3828125, "learning_rate": 0.000489439663599751, "loss": 5.502, "mean_token_accuracy": 0.17420097291469575, "num_tokens": 21462065.0, "step": 9620 }, { "entropy": 5.565780210494995, "epoch": 1.080979390127478, "grad_norm": 1.6015625, "learning_rate": 0.000489427504550126, "loss": 5.4329, "mean_token_accuracy": 0.17715296298265457, "num_tokens": 21473476.0, "step": 9625 }, { "entropy": 5.676029396057129, "epoch": 1.0815409670354355, "grad_norm": 1.4609375, "learning_rate": 0.0004894153386730462, "loss": 5.5517, "mean_token_accuracy": 0.1776492029428482, "num_tokens": 21485591.0, "step": 9630 }, { "entropy": 5.641856098175049, "epoch": 1.0821025439433931, "grad_norm": 1.4921875, "learning_rate": 0.0004894031659688988, "loss": 5.6286, "mean_token_accuracy": 0.17196228802204133, "num_tokens": 21497016.0, "step": 9635 }, { "entropy": 5.563565683364868, "epoch": 1.0826641208513506, "grad_norm": 1.484375, "learning_rate": 0.0004893909864380714, "loss": 5.4241, "mean_token_accuracy": 0.18089785128831865, "num_tokens": 21508179.0, "step": 9640 }, { "entropy": 5.661916208267212, "epoch": 1.0832256977593082, "grad_norm": 1.8046875, "learning_rate": 0.000489378800080952, "loss": 5.5514, "mean_token_accuracy": 0.16957199722528457, "num_tokens": 21520053.0, "step": 9645 }, { "entropy": 5.662601566314697, "epoch": 1.0837872746672657, "grad_norm": 1.4296875, "learning_rate": 0.0004893666068979283, "loss": 5.4513, "mean_token_accuracy": 0.18505332469940186, "num_tokens": 21530746.0, "step": 9650 }, { "entropy": 5.561122179031372, "epoch": 1.0843488515752233, "grad_norm": 1.421875, "learning_rate": 0.0004893544068893887, "loss": 5.4699, "mean_token_accuracy": 0.17847533524036407, "num_tokens": 21540829.0, "step": 9655 }, { "entropy": 5.55997633934021, "epoch": 1.0849104284831808, "grad_norm": 1.65625, "learning_rate": 0.0004893422000557217, "loss": 5.4025, "mean_token_accuracy": 0.1824072703719139, "num_tokens": 21552337.0, "step": 9660 }, { "entropy": 5.600814437866211, "epoch": 1.0854720053911384, "grad_norm": 1.46875, "learning_rate": 0.0004893299863973159, "loss": 5.4138, "mean_token_accuracy": 0.18376973569393157, "num_tokens": 21563752.0, "step": 9665 }, { "entropy": 5.642785453796387, "epoch": 1.0860335822990959, "grad_norm": 1.3125, "learning_rate": 0.0004893177659145601, "loss": 5.5625, "mean_token_accuracy": 0.17684261351823807, "num_tokens": 21574834.0, "step": 9670 }, { "entropy": 5.6293717384338375, "epoch": 1.0865951592070533, "grad_norm": 1.4921875, "learning_rate": 0.0004893055386078438, "loss": 5.4672, "mean_token_accuracy": 0.17502747774124144, "num_tokens": 21586674.0, "step": 9675 }, { "entropy": 5.620609474182129, "epoch": 1.087156736115011, "grad_norm": 1.421875, "learning_rate": 0.0004892933044775558, "loss": 5.403, "mean_token_accuracy": 0.1848546639084816, "num_tokens": 21595998.0, "step": 9680 }, { "entropy": 5.600088262557984, "epoch": 1.0877183130229684, "grad_norm": 1.5546875, "learning_rate": 0.0004892810635240859, "loss": 5.484, "mean_token_accuracy": 0.17975264489650727, "num_tokens": 21607122.0, "step": 9685 }, { "entropy": 5.5601122856140135, "epoch": 1.088279889930926, "grad_norm": 1.3671875, "learning_rate": 0.0004892688157478238, "loss": 5.3974, "mean_token_accuracy": 0.18241830170154572, "num_tokens": 21618780.0, "step": 9690 }, { "entropy": 5.5932230949401855, "epoch": 1.0888414668388835, "grad_norm": 1.3671875, "learning_rate": 0.0004892565611491597, "loss": 5.4617, "mean_token_accuracy": 0.1802744448184967, "num_tokens": 21628868.0, "step": 9695 }, { "entropy": 5.6138755798339846, "epoch": 1.0894030437468412, "grad_norm": 1.4765625, "learning_rate": 0.0004892442997284834, "loss": 5.3442, "mean_token_accuracy": 0.19054587185382843, "num_tokens": 21640189.0, "step": 9700 }, { "entropy": 5.5858148574829105, "epoch": 1.0899646206547986, "grad_norm": 1.25, "learning_rate": 0.0004892320314861855, "loss": 5.5968, "mean_token_accuracy": 0.17798891812562942, "num_tokens": 21651452.0, "step": 9705 }, { "entropy": 5.505543899536133, "epoch": 1.0905261975627563, "grad_norm": 1.3203125, "learning_rate": 0.0004892197564226568, "loss": 5.3238, "mean_token_accuracy": 0.18632598519325255, "num_tokens": 21662555.0, "step": 9710 }, { "entropy": 5.577691555023193, "epoch": 1.0910877744707137, "grad_norm": 1.671875, "learning_rate": 0.0004892074745382878, "loss": 5.3675, "mean_token_accuracy": 0.18600122332572938, "num_tokens": 21673087.0, "step": 9715 }, { "entropy": 5.559349918365479, "epoch": 1.0916493513786714, "grad_norm": 1.4921875, "learning_rate": 0.0004891951858334698, "loss": 5.4592, "mean_token_accuracy": 0.17866172939538955, "num_tokens": 21684084.0, "step": 9720 }, { "entropy": 5.5244140625, "epoch": 1.0922109282866288, "grad_norm": 1.390625, "learning_rate": 0.0004891828903085939, "loss": 5.4018, "mean_token_accuracy": 0.1834845647215843, "num_tokens": 21695765.0, "step": 9725 }, { "entropy": 5.6586473941802975, "epoch": 1.0927725051945865, "grad_norm": 1.6875, "learning_rate": 0.0004891705879640518, "loss": 5.4871, "mean_token_accuracy": 0.17867584228515626, "num_tokens": 21707396.0, "step": 9730 }, { "entropy": 5.589698791503906, "epoch": 1.093334082102544, "grad_norm": 1.5546875, "learning_rate": 0.0004891582788002351, "loss": 5.4206, "mean_token_accuracy": 0.1840369150042534, "num_tokens": 21718330.0, "step": 9735 }, { "entropy": 5.627910423278808, "epoch": 1.0938956590105016, "grad_norm": 1.3671875, "learning_rate": 0.0004891459628175358, "loss": 5.5333, "mean_token_accuracy": 0.17498715370893478, "num_tokens": 21729841.0, "step": 9740 }, { "entropy": 5.586634826660156, "epoch": 1.094457235918459, "grad_norm": 1.4453125, "learning_rate": 0.000489133640016346, "loss": 5.4779, "mean_token_accuracy": 0.18365336507558822, "num_tokens": 21740403.0, "step": 9745 }, { "entropy": 5.6356080055236815, "epoch": 1.0950188128264167, "grad_norm": 1.34375, "learning_rate": 0.0004891213103970579, "loss": 5.4621, "mean_token_accuracy": 0.18089024871587753, "num_tokens": 21750696.0, "step": 9750 }, { "entropy": 5.52034821510315, "epoch": 1.095580389734374, "grad_norm": 1.59375, "learning_rate": 0.0004891089739600643, "loss": 5.361, "mean_token_accuracy": 0.18476004898548126, "num_tokens": 21761324.0, "step": 9755 }, { "entropy": 5.6163732528686525, "epoch": 1.0961419666423318, "grad_norm": 1.515625, "learning_rate": 0.0004890966307057581, "loss": 5.4558, "mean_token_accuracy": 0.1767112657427788, "num_tokens": 21774046.0, "step": 9760 }, { "entropy": 5.5504951000213625, "epoch": 1.0967035435502892, "grad_norm": 1.96875, "learning_rate": 0.000489084280634532, "loss": 5.4554, "mean_token_accuracy": 0.1811685934662819, "num_tokens": 21784625.0, "step": 9765 }, { "entropy": 5.644229459762573, "epoch": 1.0972651204582466, "grad_norm": 1.765625, "learning_rate": 0.0004890719237467794, "loss": 5.556, "mean_token_accuracy": 0.17533084750175476, "num_tokens": 21795971.0, "step": 9770 }, { "entropy": 5.702903461456299, "epoch": 1.0978266973662043, "grad_norm": 1.515625, "learning_rate": 0.0004890595600428937, "loss": 5.517, "mean_token_accuracy": 0.17991171777248383, "num_tokens": 21806624.0, "step": 9775 }, { "entropy": 5.603931522369384, "epoch": 1.0983882742741617, "grad_norm": 1.609375, "learning_rate": 0.0004890471895232684, "loss": 5.4447, "mean_token_accuracy": 0.1773332729935646, "num_tokens": 21817830.0, "step": 9780 }, { "entropy": 5.577806615829468, "epoch": 1.0989498511821194, "grad_norm": 1.34375, "learning_rate": 0.0004890348121882978, "loss": 5.4297, "mean_token_accuracy": 0.18548934012651444, "num_tokens": 21829540.0, "step": 9785 }, { "entropy": 5.702232933044433, "epoch": 1.0995114280900768, "grad_norm": 1.7109375, "learning_rate": 0.0004890224280383758, "loss": 5.6124, "mean_token_accuracy": 0.17456040531396866, "num_tokens": 21840550.0, "step": 9790 }, { "entropy": 5.6826036930084225, "epoch": 1.1000730049980345, "grad_norm": 1.609375, "learning_rate": 0.0004890100370738966, "loss": 5.5526, "mean_token_accuracy": 0.17297013401985167, "num_tokens": 21853366.0, "step": 9795 }, { "entropy": 5.567359399795532, "epoch": 1.100634581905992, "grad_norm": 1.390625, "learning_rate": 0.0004889976392952548, "loss": 5.4677, "mean_token_accuracy": 0.1834318980574608, "num_tokens": 21863522.0, "step": 9800 }, { "entropy": 5.617341470718384, "epoch": 1.1011961588139496, "grad_norm": 1.4609375, "learning_rate": 0.0004889852347028452, "loss": 5.427, "mean_token_accuracy": 0.18069212436676024, "num_tokens": 21873988.0, "step": 9805 }, { "entropy": 5.5770001888275145, "epoch": 1.101757735721907, "grad_norm": 1.4375, "learning_rate": 0.0004889728232970626, "loss": 5.3645, "mean_token_accuracy": 0.18551873415708542, "num_tokens": 21884595.0, "step": 9810 }, { "entropy": 5.559672927856445, "epoch": 1.1023193126298647, "grad_norm": 1.3515625, "learning_rate": 0.0004889604050783025, "loss": 5.4049, "mean_token_accuracy": 0.18870704919099807, "num_tokens": 21894643.0, "step": 9815 }, { "entropy": 5.608105182647705, "epoch": 1.1028808895378222, "grad_norm": 2.140625, "learning_rate": 0.00048894798004696, "loss": 5.4151, "mean_token_accuracy": 0.18534329533576965, "num_tokens": 21906608.0, "step": 9820 }, { "entropy": 5.72157301902771, "epoch": 1.1034424664457798, "grad_norm": 1.6640625, "learning_rate": 0.0004889355482034309, "loss": 5.5454, "mean_token_accuracy": 0.17869509905576705, "num_tokens": 21919386.0, "step": 9825 }, { "entropy": 5.524839878082275, "epoch": 1.1040040433537373, "grad_norm": 1.640625, "learning_rate": 0.0004889231095481111, "loss": 5.4214, "mean_token_accuracy": 0.18391776829957962, "num_tokens": 21930554.0, "step": 9830 }, { "entropy": 5.654389429092407, "epoch": 1.104565620261695, "grad_norm": 1.4609375, "learning_rate": 0.0004889106640813964, "loss": 5.5247, "mean_token_accuracy": 0.17893804013729095, "num_tokens": 21941764.0, "step": 9835 }, { "entropy": 5.54154601097107, "epoch": 1.1051271971696524, "grad_norm": 1.28125, "learning_rate": 0.0004888982118036831, "loss": 5.351, "mean_token_accuracy": 0.18850825279951094, "num_tokens": 21951804.0, "step": 9840 }, { "entropy": 5.612653160095215, "epoch": 1.10568877407761, "grad_norm": 1.5078125, "learning_rate": 0.0004888857527153679, "loss": 5.5164, "mean_token_accuracy": 0.1715184286236763, "num_tokens": 21963356.0, "step": 9845 }, { "entropy": 5.585508584976196, "epoch": 1.1062503509855675, "grad_norm": 1.3828125, "learning_rate": 0.0004888732868168473, "loss": 5.4373, "mean_token_accuracy": 0.18316725194454192, "num_tokens": 21973785.0, "step": 9850 }, { "entropy": 5.632301330566406, "epoch": 1.1068119278935251, "grad_norm": 1.3359375, "learning_rate": 0.0004888608141085183, "loss": 5.4351, "mean_token_accuracy": 0.17661972790956498, "num_tokens": 21985057.0, "step": 9855 }, { "entropy": 5.623175954818725, "epoch": 1.1073735048014826, "grad_norm": 1.3984375, "learning_rate": 0.0004888483345907781, "loss": 5.5038, "mean_token_accuracy": 0.18079903870820999, "num_tokens": 21996554.0, "step": 9860 }, { "entropy": 5.564160585403442, "epoch": 1.10793508170944, "grad_norm": 1.390625, "learning_rate": 0.000488835848264024, "loss": 5.4428, "mean_token_accuracy": 0.17722105979919434, "num_tokens": 22008284.0, "step": 9865 }, { "entropy": 5.536996221542358, "epoch": 1.1084966586173977, "grad_norm": 1.6015625, "learning_rate": 0.0004888233551286534, "loss": 5.4887, "mean_token_accuracy": 0.1781219720840454, "num_tokens": 22019322.0, "step": 9870 }, { "entropy": 5.670701122283935, "epoch": 1.109058235525355, "grad_norm": 1.5234375, "learning_rate": 0.0004888108551850644, "loss": 5.5697, "mean_token_accuracy": 0.16928135007619857, "num_tokens": 22031444.0, "step": 9875 }, { "entropy": 5.598286533355713, "epoch": 1.1096198124333128, "grad_norm": 1.90625, "learning_rate": 0.0004887983484336548, "loss": 5.3813, "mean_token_accuracy": 0.18684137463569642, "num_tokens": 22042704.0, "step": 9880 }, { "entropy": 5.579814386367798, "epoch": 1.1101813893412702, "grad_norm": 1.5078125, "learning_rate": 0.0004887858348748229, "loss": 5.4732, "mean_token_accuracy": 0.18037536442279817, "num_tokens": 22052721.0, "step": 9885 }, { "entropy": 5.651267671585083, "epoch": 1.1107429662492279, "grad_norm": 1.5390625, "learning_rate": 0.000488773314508967, "loss": 5.4894, "mean_token_accuracy": 0.17873190343379974, "num_tokens": 22063857.0, "step": 9890 }, { "entropy": 5.5537378787994385, "epoch": 1.1113045431571853, "grad_norm": 1.6328125, "learning_rate": 0.0004887607873364859, "loss": 5.423, "mean_token_accuracy": 0.183661812543869, "num_tokens": 22074777.0, "step": 9895 }, { "entropy": 5.627150440216065, "epoch": 1.111866120065143, "grad_norm": 1.9375, "learning_rate": 0.0004887482533577786, "loss": 5.5092, "mean_token_accuracy": 0.17283634841442108, "num_tokens": 22085301.0, "step": 9900 }, { "entropy": 5.6233783721923825, "epoch": 1.1124276969731004, "grad_norm": 1.9765625, "learning_rate": 0.0004887357125732438, "loss": 5.4252, "mean_token_accuracy": 0.1815194621682167, "num_tokens": 22095635.0, "step": 9905 }, { "entropy": 5.591199684143066, "epoch": 1.112989273881058, "grad_norm": 1.984375, "learning_rate": 0.000488723164983281, "loss": 5.4432, "mean_token_accuracy": 0.17690271586179734, "num_tokens": 22105965.0, "step": 9910 }, { "entropy": 5.499814510345459, "epoch": 1.1135508507890155, "grad_norm": 1.8671875, "learning_rate": 0.0004887106105882898, "loss": 5.3705, "mean_token_accuracy": 0.1817806765437126, "num_tokens": 22117122.0, "step": 9915 }, { "entropy": 5.653459739685059, "epoch": 1.1141124276969732, "grad_norm": 1.5390625, "learning_rate": 0.0004886980493886699, "loss": 5.4242, "mean_token_accuracy": 0.18367586880922318, "num_tokens": 22128642.0, "step": 9920 }, { "entropy": 5.592040252685547, "epoch": 1.1146740046049306, "grad_norm": 1.4140625, "learning_rate": 0.0004886854813848212, "loss": 5.4187, "mean_token_accuracy": 0.1819361686706543, "num_tokens": 22140260.0, "step": 9925 }, { "entropy": 5.504345655441284, "epoch": 1.1152355815128883, "grad_norm": 1.5, "learning_rate": 0.0004886729065771439, "loss": 5.5463, "mean_token_accuracy": 0.17537332624197005, "num_tokens": 22152460.0, "step": 9930 }, { "entropy": 5.600211524963379, "epoch": 1.1157971584208457, "grad_norm": 1.59375, "learning_rate": 0.0004886603249660384, "loss": 5.3025, "mean_token_accuracy": 0.18542418330907823, "num_tokens": 22163134.0, "step": 9935 }, { "entropy": 5.666353702545166, "epoch": 1.1163587353288034, "grad_norm": 1.5234375, "learning_rate": 0.0004886477365519052, "loss": 5.4622, "mean_token_accuracy": 0.17874416559934617, "num_tokens": 22173956.0, "step": 9940 }, { "entropy": 5.529520034790039, "epoch": 1.1169203122367608, "grad_norm": 1.703125, "learning_rate": 0.0004886351413351453, "loss": 5.4463, "mean_token_accuracy": 0.17844821363687516, "num_tokens": 22185506.0, "step": 9945 }, { "entropy": 5.517136430740356, "epoch": 1.1174818891447185, "grad_norm": 1.6484375, "learning_rate": 0.0004886225393161596, "loss": 5.4379, "mean_token_accuracy": 0.1817207857966423, "num_tokens": 22196934.0, "step": 9950 }, { "entropy": 5.585705089569092, "epoch": 1.118043466052676, "grad_norm": 1.375, "learning_rate": 0.0004886099304953495, "loss": 5.4573, "mean_token_accuracy": 0.17639363408088685, "num_tokens": 22209013.0, "step": 9955 }, { "entropy": 5.688259077072144, "epoch": 1.1186050429606333, "grad_norm": 1.3984375, "learning_rate": 0.0004885973148731162, "loss": 5.5883, "mean_token_accuracy": 0.1751970171928406, "num_tokens": 22220890.0, "step": 9960 }, { "entropy": 5.6196691513061525, "epoch": 1.119166619868591, "grad_norm": 1.3828125, "learning_rate": 0.0004885846924498617, "loss": 5.4045, "mean_token_accuracy": 0.18046572655439377, "num_tokens": 22232899.0, "step": 9965 }, { "entropy": 5.553362655639648, "epoch": 1.1197281967765484, "grad_norm": 1.375, "learning_rate": 0.0004885720632259876, "loss": 5.4285, "mean_token_accuracy": 0.17943229377269745, "num_tokens": 22243839.0, "step": 9970 }, { "entropy": 5.6693480014801025, "epoch": 1.120289773684506, "grad_norm": 1.2421875, "learning_rate": 0.0004885594272018963, "loss": 5.4645, "mean_token_accuracy": 0.17993124127388, "num_tokens": 22253970.0, "step": 9975 }, { "entropy": 5.530833959579468, "epoch": 1.1208513505924635, "grad_norm": 1.359375, "learning_rate": 0.00048854678437799, "loss": 5.3467, "mean_token_accuracy": 0.18927840441465377, "num_tokens": 22263598.0, "step": 9980 }, { "entropy": 5.483437776565552, "epoch": 1.1214129275004212, "grad_norm": 1.4140625, "learning_rate": 0.0004885341347546713, "loss": 5.5413, "mean_token_accuracy": 0.17272351831197738, "num_tokens": 22274385.0, "step": 9985 }, { "entropy": 5.579334831237793, "epoch": 1.1219745044083786, "grad_norm": 2.0, "learning_rate": 0.0004885214783323428, "loss": 5.4064, "mean_token_accuracy": 0.1820865660905838, "num_tokens": 22285837.0, "step": 9990 }, { "entropy": 5.6654328346252445, "epoch": 1.1225360813163363, "grad_norm": 1.2734375, "learning_rate": 0.0004885088151114076, "loss": 5.5008, "mean_token_accuracy": 0.17633887529373168, "num_tokens": 22296882.0, "step": 9995 }, { "entropy": 5.509787464141846, "epoch": 1.1230976582242937, "grad_norm": 1.3203125, "learning_rate": 0.0004884961450922691, "loss": 5.3913, "mean_token_accuracy": 0.18201883286237716, "num_tokens": 22308110.0, "step": 10000 }, { "entropy": 5.510275602340698, "epoch": 1.1236592351322514, "grad_norm": 1.5546875, "learning_rate": 0.0004884834682753305, "loss": 5.4198, "mean_token_accuracy": 0.18542241752147676, "num_tokens": 22318541.0, "step": 10005 }, { "entropy": 5.536625671386719, "epoch": 1.1242208120402089, "grad_norm": 1.3203125, "learning_rate": 0.0004884707846609953, "loss": 5.4128, "mean_token_accuracy": 0.18137142658233643, "num_tokens": 22328713.0, "step": 10010 }, { "entropy": 5.661680412292481, "epoch": 1.1247823889481665, "grad_norm": 1.2265625, "learning_rate": 0.0004884580942496677, "loss": 5.4751, "mean_token_accuracy": 0.17806675732135774, "num_tokens": 22341050.0, "step": 10015 }, { "entropy": 5.58024754524231, "epoch": 1.125343965856124, "grad_norm": 1.3203125, "learning_rate": 0.0004884453970417515, "loss": 5.3569, "mean_token_accuracy": 0.18561971783638, "num_tokens": 22351184.0, "step": 10020 }, { "entropy": 5.555691528320312, "epoch": 1.1259055427640816, "grad_norm": 1.4921875, "learning_rate": 0.000488432693037651, "loss": 5.4249, "mean_token_accuracy": 0.18320182114839553, "num_tokens": 22361651.0, "step": 10025 }, { "entropy": 5.648286199569702, "epoch": 1.126467119672039, "grad_norm": 1.4921875, "learning_rate": 0.000488419982237771, "loss": 5.532, "mean_token_accuracy": 0.17271254062652588, "num_tokens": 22373672.0, "step": 10030 }, { "entropy": 5.636139965057373, "epoch": 1.1270286965799967, "grad_norm": 1.4921875, "learning_rate": 0.0004884072646425157, "loss": 5.5091, "mean_token_accuracy": 0.1779921069741249, "num_tokens": 22384924.0, "step": 10035 }, { "entropy": 5.6113080978393555, "epoch": 1.1275902734879542, "grad_norm": 1.421875, "learning_rate": 0.0004883945402522907, "loss": 5.4102, "mean_token_accuracy": 0.18566200882196426, "num_tokens": 22396091.0, "step": 10040 }, { "entropy": 5.697112512588501, "epoch": 1.1281518503959118, "grad_norm": 1.3984375, "learning_rate": 0.0004883818090675005, "loss": 5.5023, "mean_token_accuracy": 0.17411854714155198, "num_tokens": 22407925.0, "step": 10045 }, { "entropy": 5.580139541625977, "epoch": 1.1287134273038693, "grad_norm": 2.234375, "learning_rate": 0.0004883690710885507, "loss": 5.4206, "mean_token_accuracy": 0.18167119473218918, "num_tokens": 22417917.0, "step": 10050 }, { "entropy": 5.612313365936279, "epoch": 1.1292750042118267, "grad_norm": 1.453125, "learning_rate": 0.0004883563263158471, "loss": 5.5153, "mean_token_accuracy": 0.17684295028448105, "num_tokens": 22429836.0, "step": 10055 }, { "entropy": 5.661643743515015, "epoch": 1.1298365811197844, "grad_norm": 1.8515625, "learning_rate": 0.0004883435747497952, "loss": 5.585, "mean_token_accuracy": 0.17540506571531295, "num_tokens": 22440720.0, "step": 10060 }, { "entropy": 5.5146032810211185, "epoch": 1.130398158027742, "grad_norm": 1.3125, "learning_rate": 0.0004883308163908012, "loss": 5.3064, "mean_token_accuracy": 0.18266170024871825, "num_tokens": 22452587.0, "step": 10065 }, { "entropy": 5.582793140411377, "epoch": 1.1309597349356995, "grad_norm": 1.3359375, "learning_rate": 0.0004883180512392714, "loss": 5.4896, "mean_token_accuracy": 0.18124875873327256, "num_tokens": 22464063.0, "step": 10070 }, { "entropy": 5.57654972076416, "epoch": 1.131521311843657, "grad_norm": 1.390625, "learning_rate": 0.0004883052792956119, "loss": 5.4545, "mean_token_accuracy": 0.1777760937809944, "num_tokens": 22474956.0, "step": 10075 }, { "entropy": 5.572151613235474, "epoch": 1.1320828887516146, "grad_norm": 1.421875, "learning_rate": 0.0004882925005602296, "loss": 5.4247, "mean_token_accuracy": 0.17617421299219133, "num_tokens": 22486499.0, "step": 10080 }, { "entropy": 5.5781739234924315, "epoch": 1.132644465659572, "grad_norm": 1.5078125, "learning_rate": 0.0004882797150335314, "loss": 5.3386, "mean_token_accuracy": 0.18663488775491716, "num_tokens": 22497736.0, "step": 10085 }, { "entropy": 5.540691328048706, "epoch": 1.1332060425675297, "grad_norm": 1.390625, "learning_rate": 0.00048826692271592434, "loss": 5.4169, "mean_token_accuracy": 0.17964298129081727, "num_tokens": 22509997.0, "step": 10090 }, { "entropy": 5.574131822586059, "epoch": 1.133767619475487, "grad_norm": 1.5859375, "learning_rate": 0.0004882541236078158, "loss": 5.4949, "mean_token_accuracy": 0.18007486909627915, "num_tokens": 22519721.0, "step": 10095 }, { "entropy": 5.661850929260254, "epoch": 1.1343291963834448, "grad_norm": 1.3984375, "learning_rate": 0.00048824131770961316, "loss": 5.3899, "mean_token_accuracy": 0.1807657703757286, "num_tokens": 22530219.0, "step": 10100 }, { "entropy": 5.590708684921265, "epoch": 1.1348907732914022, "grad_norm": 1.5390625, "learning_rate": 0.00048822850502172437, "loss": 5.4249, "mean_token_accuracy": 0.17643967866897584, "num_tokens": 22541373.0, "step": 10105 }, { "entropy": 5.462498426437378, "epoch": 1.1354523501993599, "grad_norm": 1.625, "learning_rate": 0.0004882156855445571, "loss": 5.3623, "mean_token_accuracy": 0.17757754027843475, "num_tokens": 22552974.0, "step": 10110 }, { "entropy": 5.580391216278076, "epoch": 1.1360139271073173, "grad_norm": 1.3828125, "learning_rate": 0.0004882028592785199, "loss": 5.3721, "mean_token_accuracy": 0.18000393509864807, "num_tokens": 22563468.0, "step": 10115 }, { "entropy": 5.569001054763794, "epoch": 1.136575504015275, "grad_norm": 1.484375, "learning_rate": 0.00048819002622402095, "loss": 5.5069, "mean_token_accuracy": 0.17577992826700212, "num_tokens": 22574386.0, "step": 10120 }, { "entropy": 5.556534337997436, "epoch": 1.1371370809232324, "grad_norm": 1.3359375, "learning_rate": 0.0004881771863814688, "loss": 5.4123, "mean_token_accuracy": 0.18740794956684112, "num_tokens": 22585369.0, "step": 10125 }, { "entropy": 5.537963247299194, "epoch": 1.13769865783119, "grad_norm": 1.46875, "learning_rate": 0.00048816433975127244, "loss": 5.4334, "mean_token_accuracy": 0.18183194398880004, "num_tokens": 22595853.0, "step": 10130 }, { "entropy": 5.610812759399414, "epoch": 1.1382602347391475, "grad_norm": 1.71875, "learning_rate": 0.0004881514863338407, "loss": 5.5028, "mean_token_accuracy": 0.18175214976072313, "num_tokens": 22606596.0, "step": 10135 }, { "entropy": 5.613374710083008, "epoch": 1.1388218116471052, "grad_norm": 1.5234375, "learning_rate": 0.00048813862612958307, "loss": 5.3744, "mean_token_accuracy": 0.17816888988018037, "num_tokens": 22617196.0, "step": 10140 }, { "entropy": 5.451364135742187, "epoch": 1.1393833885550626, "grad_norm": 1.7265625, "learning_rate": 0.0004881257591389089, "loss": 5.3344, "mean_token_accuracy": 0.18494184762239457, "num_tokens": 22627817.0, "step": 10145 }, { "entropy": 5.496274614334107, "epoch": 1.13994496546302, "grad_norm": 1.453125, "learning_rate": 0.00048811288536222794, "loss": 5.4362, "mean_token_accuracy": 0.1737013503909111, "num_tokens": 22637877.0, "step": 10150 }, { "entropy": 5.640788221359253, "epoch": 1.1405065423709777, "grad_norm": 1.6171875, "learning_rate": 0.00048810000479995, "loss": 5.4677, "mean_token_accuracy": 0.17672027200460433, "num_tokens": 22648770.0, "step": 10155 }, { "entropy": 5.753425788879395, "epoch": 1.1410681192789354, "grad_norm": 1.5546875, "learning_rate": 0.00048808711745248524, "loss": 5.5346, "mean_token_accuracy": 0.17500863820314408, "num_tokens": 22659626.0, "step": 10160 }, { "entropy": 5.588730239868164, "epoch": 1.1416296961868928, "grad_norm": 1.3828125, "learning_rate": 0.00048807422332024404, "loss": 5.5057, "mean_token_accuracy": 0.17713336348533631, "num_tokens": 22669035.0, "step": 10165 }, { "entropy": 5.668708276748657, "epoch": 1.1421912730948502, "grad_norm": 1.40625, "learning_rate": 0.0004880613224036369, "loss": 5.4893, "mean_token_accuracy": 0.18129380345344542, "num_tokens": 22680536.0, "step": 10170 }, { "entropy": 5.655089092254639, "epoch": 1.142752850002808, "grad_norm": 1.296875, "learning_rate": 0.00048804841470307466, "loss": 5.4386, "mean_token_accuracy": 0.1854078873991966, "num_tokens": 22692732.0, "step": 10175 }, { "entropy": 5.620869159698486, "epoch": 1.1433144269107653, "grad_norm": 1.4609375, "learning_rate": 0.00048803550021896824, "loss": 5.563, "mean_token_accuracy": 0.17335400730371475, "num_tokens": 22703677.0, "step": 10180 }, { "entropy": 5.660672235488891, "epoch": 1.143876003818723, "grad_norm": 1.515625, "learning_rate": 0.0004880225789517289, "loss": 5.4861, "mean_token_accuracy": 0.17455905973911284, "num_tokens": 22714826.0, "step": 10185 }, { "entropy": 5.6227153778076175, "epoch": 1.1444375807266804, "grad_norm": 1.5546875, "learning_rate": 0.000488009650901768, "loss": 5.5619, "mean_token_accuracy": 0.17745715528726577, "num_tokens": 22726013.0, "step": 10190 }, { "entropy": 5.58302526473999, "epoch": 1.144999157634638, "grad_norm": 1.5859375, "learning_rate": 0.00048799671606949724, "loss": 5.3963, "mean_token_accuracy": 0.17846509218215942, "num_tokens": 22737494.0, "step": 10195 }, { "entropy": 5.5372984409332275, "epoch": 1.1455607345425955, "grad_norm": 1.3984375, "learning_rate": 0.00048798377445532837, "loss": 5.3188, "mean_token_accuracy": 0.18994600474834442, "num_tokens": 22746916.0, "step": 10200 }, { "entropy": 5.630187463760376, "epoch": 1.1461223114505532, "grad_norm": 1.9921875, "learning_rate": 0.0004879708260596736, "loss": 5.5628, "mean_token_accuracy": 0.16555242538452147, "num_tokens": 22759197.0, "step": 10205 }, { "entropy": 5.631412601470947, "epoch": 1.1466838883585107, "grad_norm": 1.4453125, "learning_rate": 0.0004879578708829451, "loss": 5.5195, "mean_token_accuracy": 0.17430828064680098, "num_tokens": 22770744.0, "step": 10210 }, { "entropy": 5.604301023483276, "epoch": 1.1472454652664683, "grad_norm": 1.3359375, "learning_rate": 0.0004879449089255553, "loss": 5.446, "mean_token_accuracy": 0.17849487960338592, "num_tokens": 22781989.0, "step": 10215 }, { "entropy": 5.541107559204102, "epoch": 1.1478070421744258, "grad_norm": 1.3359375, "learning_rate": 0.0004879319401879171, "loss": 5.3642, "mean_token_accuracy": 0.18781604170799254, "num_tokens": 22792972.0, "step": 10220 }, { "entropy": 5.562822389602661, "epoch": 1.1483686190823834, "grad_norm": 1.578125, "learning_rate": 0.00048791896467044335, "loss": 5.436, "mean_token_accuracy": 0.18912334442138673, "num_tokens": 22802623.0, "step": 10225 }, { "entropy": 5.459062576293945, "epoch": 1.1489301959903409, "grad_norm": 1.421875, "learning_rate": 0.00048790598237354716, "loss": 5.382, "mean_token_accuracy": 0.18711169362068175, "num_tokens": 22813564.0, "step": 10230 }, { "entropy": 5.596525096893311, "epoch": 1.1494917728982985, "grad_norm": 1.4453125, "learning_rate": 0.0004878929932976419, "loss": 5.5297, "mean_token_accuracy": 0.17973680347204207, "num_tokens": 22824681.0, "step": 10235 }, { "entropy": 5.55367226600647, "epoch": 1.150053349806256, "grad_norm": 1.640625, "learning_rate": 0.0004878799974431412, "loss": 5.3573, "mean_token_accuracy": 0.19110948592424393, "num_tokens": 22836030.0, "step": 10240 }, { "entropy": 5.58520393371582, "epoch": 1.1506149267142134, "grad_norm": 1.671875, "learning_rate": 0.0004878669948104588, "loss": 5.3781, "mean_token_accuracy": 0.1786734029650688, "num_tokens": 22847213.0, "step": 10245 }, { "entropy": 5.638460493087768, "epoch": 1.151176503622171, "grad_norm": 1.3671875, "learning_rate": 0.00048785398540000867, "loss": 5.3846, "mean_token_accuracy": 0.18784808963537217, "num_tokens": 22857904.0, "step": 10250 }, { "entropy": 5.559061765670776, "epoch": 1.1517380805301287, "grad_norm": 1.359375, "learning_rate": 0.00048784096921220514, "loss": 5.526, "mean_token_accuracy": 0.17414491176605223, "num_tokens": 22868975.0, "step": 10255 }, { "entropy": 5.657341861724854, "epoch": 1.1522996574380862, "grad_norm": 1.6171875, "learning_rate": 0.0004878279462474627, "loss": 5.4727, "mean_token_accuracy": 0.1808004006743431, "num_tokens": 22879463.0, "step": 10260 }, { "entropy": 5.637919902801514, "epoch": 1.1528612343460436, "grad_norm": 1.390625, "learning_rate": 0.00048781491650619574, "loss": 5.4019, "mean_token_accuracy": 0.18174820393323898, "num_tokens": 22890382.0, "step": 10265 }, { "entropy": 5.621941804885864, "epoch": 1.1534228112540013, "grad_norm": 1.7734375, "learning_rate": 0.00048780187998881944, "loss": 5.4951, "mean_token_accuracy": 0.1807561531662941, "num_tokens": 22901968.0, "step": 10270 }, { "entropy": 5.671910381317138, "epoch": 1.1539843881619587, "grad_norm": 1.609375, "learning_rate": 0.0004877888366957486, "loss": 5.5287, "mean_token_accuracy": 0.17953866124153137, "num_tokens": 22912147.0, "step": 10275 }, { "entropy": 5.588748836517334, "epoch": 1.1545459650699164, "grad_norm": 1.7109375, "learning_rate": 0.0004877757866273988, "loss": 5.4154, "mean_token_accuracy": 0.1782118409872055, "num_tokens": 22923744.0, "step": 10280 }, { "entropy": 5.587154865264893, "epoch": 1.1551075419778738, "grad_norm": 1.5703125, "learning_rate": 0.0004877627297841853, "loss": 5.385, "mean_token_accuracy": 0.1853589504957199, "num_tokens": 22935487.0, "step": 10285 }, { "entropy": 5.589299440383911, "epoch": 1.1556691188858315, "grad_norm": 1.8203125, "learning_rate": 0.0004877496661665241, "loss": 5.4237, "mean_token_accuracy": 0.18607935905456544, "num_tokens": 22946379.0, "step": 10290 }, { "entropy": 5.605984210968018, "epoch": 1.156230695793789, "grad_norm": 1.75, "learning_rate": 0.000487736595774831, "loss": 5.4308, "mean_token_accuracy": 0.17865341305732726, "num_tokens": 22957219.0, "step": 10295 }, { "entropy": 5.564409446716309, "epoch": 1.1567922727017466, "grad_norm": 1.6953125, "learning_rate": 0.00048772351860952215, "loss": 5.3854, "mean_token_accuracy": 0.18352195173501967, "num_tokens": 22967749.0, "step": 10300 }, { "entropy": 5.553499841690064, "epoch": 1.157353849609704, "grad_norm": 1.546875, "learning_rate": 0.0004877104346710139, "loss": 5.4037, "mean_token_accuracy": 0.18055881708860397, "num_tokens": 22978317.0, "step": 10305 }, { "entropy": 5.5471031665802, "epoch": 1.1579154265176617, "grad_norm": 1.6875, "learning_rate": 0.000487697343959723, "loss": 5.4296, "mean_token_accuracy": 0.17836801707744598, "num_tokens": 22988793.0, "step": 10310 }, { "entropy": 5.6121556758880615, "epoch": 1.158477003425619, "grad_norm": 1.7890625, "learning_rate": 0.0004876842464760661, "loss": 5.4918, "mean_token_accuracy": 0.17678036242723466, "num_tokens": 23000073.0, "step": 10315 }, { "entropy": 5.615738248825073, "epoch": 1.1590385803335768, "grad_norm": 1.4921875, "learning_rate": 0.00048767114222046036, "loss": 5.4653, "mean_token_accuracy": 0.17593652456998826, "num_tokens": 23011260.0, "step": 10320 }, { "entropy": 5.559394311904907, "epoch": 1.1596001572415342, "grad_norm": 1.640625, "learning_rate": 0.000487658031193323, "loss": 5.4388, "mean_token_accuracy": 0.1824623391032219, "num_tokens": 23022129.0, "step": 10325 }, { "entropy": 5.504612159729004, "epoch": 1.1601617341494919, "grad_norm": 1.59375, "learning_rate": 0.0004876449133950714, "loss": 5.3838, "mean_token_accuracy": 0.17638918459415437, "num_tokens": 23033666.0, "step": 10330 }, { "entropy": 5.549623918533325, "epoch": 1.1607233110574493, "grad_norm": 1.9765625, "learning_rate": 0.0004876317888261233, "loss": 5.4085, "mean_token_accuracy": 0.18171306997537612, "num_tokens": 23044133.0, "step": 10335 }, { "entropy": 5.570271778106689, "epoch": 1.1612848879654067, "grad_norm": 1.8359375, "learning_rate": 0.00048761865748689657, "loss": 5.4217, "mean_token_accuracy": 0.17687359154224397, "num_tokens": 23055877.0, "step": 10340 }, { "entropy": 5.649858665466309, "epoch": 1.1618464648733644, "grad_norm": 1.5546875, "learning_rate": 0.00048760551937780927, "loss": 5.5343, "mean_token_accuracy": 0.1781652018427849, "num_tokens": 23066811.0, "step": 10345 }, { "entropy": 5.694931364059448, "epoch": 1.162408041781322, "grad_norm": 1.734375, "learning_rate": 0.00048759237449927986, "loss": 5.4794, "mean_token_accuracy": 0.17494654953479766, "num_tokens": 23078928.0, "step": 10350 }, { "entropy": 5.621661186218262, "epoch": 1.1629696186892795, "grad_norm": 1.5078125, "learning_rate": 0.00048757922285172674, "loss": 5.4635, "mean_token_accuracy": 0.1786074697971344, "num_tokens": 23090685.0, "step": 10355 }, { "entropy": 5.539975881576538, "epoch": 1.163531195597237, "grad_norm": 1.4609375, "learning_rate": 0.00048756606443556874, "loss": 5.3683, "mean_token_accuracy": 0.1829329326748848, "num_tokens": 23101659.0, "step": 10360 }, { "entropy": 5.580107975006103, "epoch": 1.1640927725051946, "grad_norm": 1.4609375, "learning_rate": 0.00048755289925122474, "loss": 5.4497, "mean_token_accuracy": 0.18081278949975968, "num_tokens": 23112970.0, "step": 10365 }, { "entropy": 5.639863586425781, "epoch": 1.164654349413152, "grad_norm": 1.9921875, "learning_rate": 0.0004875397272991141, "loss": 5.4728, "mean_token_accuracy": 0.1762469530105591, "num_tokens": 23125391.0, "step": 10370 }, { "entropy": 5.6568304061889645, "epoch": 1.1652159263211097, "grad_norm": 1.4765625, "learning_rate": 0.000487526548579656, "loss": 5.5143, "mean_token_accuracy": 0.17894838154315948, "num_tokens": 23138195.0, "step": 10375 }, { "entropy": 5.670497846603394, "epoch": 1.1657775032290671, "grad_norm": 1.5234375, "learning_rate": 0.00048751336309327026, "loss": 5.5022, "mean_token_accuracy": 0.17685108482837678, "num_tokens": 23149378.0, "step": 10380 }, { "entropy": 5.484286737442017, "epoch": 1.1663390801370248, "grad_norm": 1.5, "learning_rate": 0.0004875001708403766, "loss": 5.3319, "mean_token_accuracy": 0.18941258490085602, "num_tokens": 23159394.0, "step": 10385 }, { "entropy": 5.664628553390503, "epoch": 1.1669006570449822, "grad_norm": 1.4375, "learning_rate": 0.00048748697182139503, "loss": 5.5844, "mean_token_accuracy": 0.17606203109025956, "num_tokens": 23171512.0, "step": 10390 }, { "entropy": 5.568928146362305, "epoch": 1.16746223395294, "grad_norm": 1.890625, "learning_rate": 0.0004874737660367459, "loss": 5.4147, "mean_token_accuracy": 0.18418188095092775, "num_tokens": 23181635.0, "step": 10395 }, { "entropy": 5.715925979614258, "epoch": 1.1680238108608973, "grad_norm": 2.140625, "learning_rate": 0.00048746055348684967, "loss": 5.6897, "mean_token_accuracy": 0.16924521178007126, "num_tokens": 23194510.0, "step": 10400 }, { "entropy": 5.7471662044525145, "epoch": 1.168585387768855, "grad_norm": 1.6875, "learning_rate": 0.000487447334172127, "loss": 5.5551, "mean_token_accuracy": 0.18067686855793, "num_tokens": 23205146.0, "step": 10405 }, { "entropy": 5.60310001373291, "epoch": 1.1691469646768125, "grad_norm": 1.5859375, "learning_rate": 0.00048743410809299877, "loss": 5.463, "mean_token_accuracy": 0.17559536695480346, "num_tokens": 23216621.0, "step": 10410 }, { "entropy": 5.574869012832641, "epoch": 1.1697085415847701, "grad_norm": 1.3515625, "learning_rate": 0.0004874208752498862, "loss": 5.4021, "mean_token_accuracy": 0.1809071496129036, "num_tokens": 23226401.0, "step": 10415 }, { "entropy": 5.549800872802734, "epoch": 1.1702701184927276, "grad_norm": 1.4609375, "learning_rate": 0.0004874076356432106, "loss": 5.4653, "mean_token_accuracy": 0.17664449661970139, "num_tokens": 23237921.0, "step": 10420 }, { "entropy": 5.608479022979736, "epoch": 1.1708316954006852, "grad_norm": 1.5, "learning_rate": 0.00048739438927339346, "loss": 5.4292, "mean_token_accuracy": 0.18261185586452483, "num_tokens": 23250015.0, "step": 10425 }, { "entropy": 5.578491735458374, "epoch": 1.1713932723086427, "grad_norm": 2.1875, "learning_rate": 0.00048738113614085656, "loss": 5.4575, "mean_token_accuracy": 0.17823632657527924, "num_tokens": 23261243.0, "step": 10430 }, { "entropy": 5.68017430305481, "epoch": 1.1719548492166, "grad_norm": 1.640625, "learning_rate": 0.000487367876246022, "loss": 5.6097, "mean_token_accuracy": 0.17084814310073854, "num_tokens": 23273264.0, "step": 10435 }, { "entropy": 5.8019805431365965, "epoch": 1.1725164261245578, "grad_norm": 1.8046875, "learning_rate": 0.0004873546095893118, "loss": 5.6237, "mean_token_accuracy": 0.17058354765176773, "num_tokens": 23285031.0, "step": 10440 }, { "entropy": 5.589553451538086, "epoch": 1.1730780030325154, "grad_norm": 1.5703125, "learning_rate": 0.0004873413361711485, "loss": 5.3735, "mean_token_accuracy": 0.18483428210020064, "num_tokens": 23296387.0, "step": 10445 }, { "entropy": 5.635595417022705, "epoch": 1.1736395799404729, "grad_norm": 1.8125, "learning_rate": 0.00048732805599195465, "loss": 5.493, "mean_token_accuracy": 0.18177550584077834, "num_tokens": 23307950.0, "step": 10450 }, { "entropy": 5.472813606262207, "epoch": 1.1742011568484303, "grad_norm": 1.3671875, "learning_rate": 0.00048731476905215326, "loss": 5.3059, "mean_token_accuracy": 0.18500818759202958, "num_tokens": 23318424.0, "step": 10455 }, { "entropy": 5.584354305267334, "epoch": 1.174762733756388, "grad_norm": 1.625, "learning_rate": 0.0004873014753521673, "loss": 5.5634, "mean_token_accuracy": 0.17263590097427367, "num_tokens": 23330186.0, "step": 10460 }, { "entropy": 5.649318361282349, "epoch": 1.1753243106643454, "grad_norm": 1.6015625, "learning_rate": 0.0004872881748924199, "loss": 5.3496, "mean_token_accuracy": 0.18661798983812333, "num_tokens": 23341878.0, "step": 10465 }, { "entropy": 5.615511178970337, "epoch": 1.175885887572303, "grad_norm": 1.6484375, "learning_rate": 0.0004872748676733347, "loss": 5.4777, "mean_token_accuracy": 0.17548347413539886, "num_tokens": 23352471.0, "step": 10470 }, { "entropy": 5.621794986724853, "epoch": 1.1764474644802605, "grad_norm": 1.6171875, "learning_rate": 0.00048726155369533547, "loss": 5.4891, "mean_token_accuracy": 0.18269820213317872, "num_tokens": 23363871.0, "step": 10475 }, { "entropy": 5.656167221069336, "epoch": 1.1770090413882182, "grad_norm": 1.7890625, "learning_rate": 0.000487248232958846, "loss": 5.5134, "mean_token_accuracy": 0.17936725318431854, "num_tokens": 23376072.0, "step": 10480 }, { "entropy": 5.487087917327881, "epoch": 1.1775706182961756, "grad_norm": 1.671875, "learning_rate": 0.0004872349054642904, "loss": 5.3773, "mean_token_accuracy": 0.18486556112766267, "num_tokens": 23386670.0, "step": 10485 }, { "entropy": 5.646738195419312, "epoch": 1.1781321952041333, "grad_norm": 1.8671875, "learning_rate": 0.0004872215712120932, "loss": 5.4282, "mean_token_accuracy": 0.1851399466395378, "num_tokens": 23396499.0, "step": 10490 }, { "entropy": 5.627827501296997, "epoch": 1.1786937721120907, "grad_norm": 1.7109375, "learning_rate": 0.0004872082302026788, "loss": 5.4626, "mean_token_accuracy": 0.1846533477306366, "num_tokens": 23407898.0, "step": 10495 }, { "entropy": 5.552610301971436, "epoch": 1.1792553490200484, "grad_norm": 1.5078125, "learning_rate": 0.0004871948824364721, "loss": 5.4426, "mean_token_accuracy": 0.1783500924706459, "num_tokens": 23418877.0, "step": 10500 }, { "entropy": 5.524981164932251, "epoch": 1.1798169259280058, "grad_norm": 1.4140625, "learning_rate": 0.000487181527913898, "loss": 5.4091, "mean_token_accuracy": 0.1811755284667015, "num_tokens": 23431378.0, "step": 10505 }, { "entropy": 5.616604232788086, "epoch": 1.1803785028359635, "grad_norm": 1.546875, "learning_rate": 0.00048716816663538177, "loss": 5.4221, "mean_token_accuracy": 0.18377246409654618, "num_tokens": 23442590.0, "step": 10510 }, { "entropy": 5.645650339126587, "epoch": 1.180940079743921, "grad_norm": 1.421875, "learning_rate": 0.0004871547986013488, "loss": 5.5129, "mean_token_accuracy": 0.176759235560894, "num_tokens": 23454139.0, "step": 10515 }, { "entropy": 5.634320497512817, "epoch": 1.1815016566518786, "grad_norm": 1.3828125, "learning_rate": 0.0004871414238122248, "loss": 5.4535, "mean_token_accuracy": 0.18437889814376832, "num_tokens": 23464908.0, "step": 10520 }, { "entropy": 5.548039531707763, "epoch": 1.182063233559836, "grad_norm": 1.6015625, "learning_rate": 0.0004871280422684355, "loss": 5.4039, "mean_token_accuracy": 0.18599554449319838, "num_tokens": 23475436.0, "step": 10525 }, { "entropy": 5.6510828018188475, "epoch": 1.1826248104677934, "grad_norm": 2.71875, "learning_rate": 0.00048711465397040726, "loss": 5.5688, "mean_token_accuracy": 0.17750822007656097, "num_tokens": 23487384.0, "step": 10530 }, { "entropy": 5.718241024017334, "epoch": 1.183186387375751, "grad_norm": 1.59375, "learning_rate": 0.00048710125891856604, "loss": 5.5207, "mean_token_accuracy": 0.17472441494464874, "num_tokens": 23498978.0, "step": 10535 }, { "entropy": 5.529882097244263, "epoch": 1.1837479642837088, "grad_norm": 1.2421875, "learning_rate": 0.00048708785711333845, "loss": 5.3981, "mean_token_accuracy": 0.18602953851222992, "num_tokens": 23510825.0, "step": 10540 }, { "entropy": 5.53178858757019, "epoch": 1.1843095411916662, "grad_norm": 1.34375, "learning_rate": 0.00048707444855515124, "loss": 5.3904, "mean_token_accuracy": 0.18575898855924605, "num_tokens": 23522383.0, "step": 10545 }, { "entropy": 5.6463545799255375, "epoch": 1.1848711180996236, "grad_norm": 1.6796875, "learning_rate": 0.0004870610332444314, "loss": 5.5725, "mean_token_accuracy": 0.17957879304885865, "num_tokens": 23534255.0, "step": 10550 }, { "entropy": 5.630608129501343, "epoch": 1.1854326950075813, "grad_norm": 1.2734375, "learning_rate": 0.0004870476111816059, "loss": 5.4772, "mean_token_accuracy": 0.17648603469133378, "num_tokens": 23545888.0, "step": 10555 }, { "entropy": 5.59116530418396, "epoch": 1.1859942719155387, "grad_norm": 1.5078125, "learning_rate": 0.00048703418236710234, "loss": 5.479, "mean_token_accuracy": 0.17763277441263198, "num_tokens": 23556776.0, "step": 10560 }, { "entropy": 5.703448057174683, "epoch": 1.1865558488234964, "grad_norm": 1.5859375, "learning_rate": 0.0004870207468013481, "loss": 5.4081, "mean_token_accuracy": 0.18237634003162384, "num_tokens": 23569971.0, "step": 10565 }, { "entropy": 5.602100801467896, "epoch": 1.1871174257314538, "grad_norm": 1.46875, "learning_rate": 0.0004870073044847711, "loss": 5.5371, "mean_token_accuracy": 0.1801938682794571, "num_tokens": 23580751.0, "step": 10570 }, { "entropy": 5.501537895202636, "epoch": 1.1876790026394115, "grad_norm": 1.6328125, "learning_rate": 0.0004869938554177993, "loss": 5.3992, "mean_token_accuracy": 0.18619302660226822, "num_tokens": 23591423.0, "step": 10575 }, { "entropy": 5.630936050415039, "epoch": 1.188240579547369, "grad_norm": 1.5234375, "learning_rate": 0.00048698039960086084, "loss": 5.3665, "mean_token_accuracy": 0.17726145088672637, "num_tokens": 23601552.0, "step": 10580 }, { "entropy": 5.55292820930481, "epoch": 1.1888021564553266, "grad_norm": 1.84375, "learning_rate": 0.0004869669370343843, "loss": 5.466, "mean_token_accuracy": 0.18769415318965912, "num_tokens": 23613080.0, "step": 10585 }, { "entropy": 5.550881624221802, "epoch": 1.189363733363284, "grad_norm": 1.7109375, "learning_rate": 0.0004869534677187983, "loss": 5.3534, "mean_token_accuracy": 0.18469875305891037, "num_tokens": 23623559.0, "step": 10590 }, { "entropy": 5.566106939315796, "epoch": 1.1899253102712417, "grad_norm": 1.7265625, "learning_rate": 0.0004869399916545317, "loss": 5.3683, "mean_token_accuracy": 0.18476739078760146, "num_tokens": 23634113.0, "step": 10595 }, { "entropy": 5.513452339172363, "epoch": 1.1904868871791991, "grad_norm": 1.5625, "learning_rate": 0.0004869265088420135, "loss": 5.2838, "mean_token_accuracy": 0.19047885537147521, "num_tokens": 23645203.0, "step": 10600 }, { "entropy": 5.523169946670532, "epoch": 1.1910484640871568, "grad_norm": 1.7890625, "learning_rate": 0.0004869130192816731, "loss": 5.4231, "mean_token_accuracy": 0.18399088382720946, "num_tokens": 23654880.0, "step": 10605 }, { "entropy": 5.537129068374634, "epoch": 1.1916100409951143, "grad_norm": 1.9296875, "learning_rate": 0.00048689952297394, "loss": 5.3309, "mean_token_accuracy": 0.1929388478398323, "num_tokens": 23664962.0, "step": 10610 }, { "entropy": 5.602372550964356, "epoch": 1.192171617903072, "grad_norm": 1.6015625, "learning_rate": 0.0004868860199192438, "loss": 5.3893, "mean_token_accuracy": 0.19017872512340545, "num_tokens": 23675288.0, "step": 10615 }, { "entropy": 5.52705454826355, "epoch": 1.1927331948110294, "grad_norm": 2.0, "learning_rate": 0.0004868725101180146, "loss": 5.3964, "mean_token_accuracy": 0.18070517629384994, "num_tokens": 23685948.0, "step": 10620 }, { "entropy": 5.641992568969727, "epoch": 1.1932947717189868, "grad_norm": 1.6484375, "learning_rate": 0.0004868589935706826, "loss": 5.4599, "mean_token_accuracy": 0.17490803301334382, "num_tokens": 23696980.0, "step": 10625 }, { "entropy": 5.663866281509399, "epoch": 1.1938563486269445, "grad_norm": 1.84375, "learning_rate": 0.00048684547027767793, "loss": 5.4986, "mean_token_accuracy": 0.17656034231185913, "num_tokens": 23708644.0, "step": 10630 }, { "entropy": 5.59591007232666, "epoch": 1.1944179255349021, "grad_norm": 1.3125, "learning_rate": 0.0004868319402394314, "loss": 5.4738, "mean_token_accuracy": 0.18437945246696472, "num_tokens": 23719652.0, "step": 10635 }, { "entropy": 5.6034361839294435, "epoch": 1.1949795024428596, "grad_norm": 1.7734375, "learning_rate": 0.00048681840345637375, "loss": 5.4253, "mean_token_accuracy": 0.18002281337976456, "num_tokens": 23731906.0, "step": 10640 }, { "entropy": 5.614962434768676, "epoch": 1.195541079350817, "grad_norm": 1.5546875, "learning_rate": 0.00048680485992893597, "loss": 5.475, "mean_token_accuracy": 0.18151820302009583, "num_tokens": 23744184.0, "step": 10645 }, { "entropy": 5.541026449203491, "epoch": 1.1961026562587747, "grad_norm": 1.890625, "learning_rate": 0.00048679130965754926, "loss": 5.298, "mean_token_accuracy": 0.1837436631321907, "num_tokens": 23754807.0, "step": 10650 }, { "entropy": 5.514839363098145, "epoch": 1.196664233166732, "grad_norm": 1.6484375, "learning_rate": 0.0004867777526426451, "loss": 5.3977, "mean_token_accuracy": 0.1806316688656807, "num_tokens": 23765907.0, "step": 10655 }, { "entropy": 5.6018781661987305, "epoch": 1.1972258100746898, "grad_norm": 1.59375, "learning_rate": 0.00048676418888465525, "loss": 5.4269, "mean_token_accuracy": 0.1833296984434128, "num_tokens": 23776217.0, "step": 10660 }, { "entropy": 5.576879549026489, "epoch": 1.1977873869826472, "grad_norm": 1.9296875, "learning_rate": 0.0004867506183840114, "loss": 5.3802, "mean_token_accuracy": 0.18599339574575424, "num_tokens": 23786170.0, "step": 10665 }, { "entropy": 5.650488471984863, "epoch": 1.1983489638906049, "grad_norm": 1.875, "learning_rate": 0.0004867370411411459, "loss": 5.5168, "mean_token_accuracy": 0.1732734113931656, "num_tokens": 23796491.0, "step": 10670 }, { "entropy": 5.564750051498413, "epoch": 1.1989105407985623, "grad_norm": 1.46875, "learning_rate": 0.00048672345715649066, "loss": 5.3899, "mean_token_accuracy": 0.1827486753463745, "num_tokens": 23807718.0, "step": 10675 }, { "entropy": 5.5354297161102295, "epoch": 1.19947211770652, "grad_norm": 1.6953125, "learning_rate": 0.0004867098664304785, "loss": 5.5055, "mean_token_accuracy": 0.1804208055138588, "num_tokens": 23818623.0, "step": 10680 }, { "entropy": 5.555293941497803, "epoch": 1.2000336946144774, "grad_norm": 1.6953125, "learning_rate": 0.0004866962689635422, "loss": 5.425, "mean_token_accuracy": 0.1853599354624748, "num_tokens": 23829173.0, "step": 10685 }, { "entropy": 5.594825649261475, "epoch": 1.200595271522435, "grad_norm": 2.046875, "learning_rate": 0.00048668266475611447, "loss": 5.3517, "mean_token_accuracy": 0.1820319652557373, "num_tokens": 23840689.0, "step": 10690 }, { "entropy": 5.675231122970581, "epoch": 1.2011568484303925, "grad_norm": 1.8203125, "learning_rate": 0.0004866690538086286, "loss": 5.5828, "mean_token_accuracy": 0.17370163053274154, "num_tokens": 23852858.0, "step": 10695 }, { "entropy": 5.607054805755615, "epoch": 1.2017184253383502, "grad_norm": 1.578125, "learning_rate": 0.00048665543612151803, "loss": 5.3814, "mean_token_accuracy": 0.1894412964582443, "num_tokens": 23864137.0, "step": 10700 }, { "entropy": 5.575736999511719, "epoch": 1.2022800022463076, "grad_norm": 1.5390625, "learning_rate": 0.00048664181169521625, "loss": 5.4326, "mean_token_accuracy": 0.18311810344457627, "num_tokens": 23875087.0, "step": 10705 }, { "entropy": 5.549623203277588, "epoch": 1.2028415791542653, "grad_norm": 1.9453125, "learning_rate": 0.0004866281805301571, "loss": 5.3219, "mean_token_accuracy": 0.1916783109307289, "num_tokens": 23886521.0, "step": 10710 }, { "entropy": 5.567817354202271, "epoch": 1.2034031560622227, "grad_norm": 1.7265625, "learning_rate": 0.0004866145426267746, "loss": 5.4351, "mean_token_accuracy": 0.17877652496099472, "num_tokens": 23897660.0, "step": 10715 }, { "entropy": 5.569176912307739, "epoch": 1.2039647329701804, "grad_norm": 1.6015625, "learning_rate": 0.000486600897985503, "loss": 5.4775, "mean_token_accuracy": 0.18148595541715623, "num_tokens": 23910543.0, "step": 10720 }, { "entropy": 5.651079368591309, "epoch": 1.2045263098781378, "grad_norm": 2.34375, "learning_rate": 0.00048658724660677674, "loss": 5.3545, "mean_token_accuracy": 0.18516494184732438, "num_tokens": 23921687.0, "step": 10725 }, { "entropy": 5.644492149353027, "epoch": 1.2050878867860955, "grad_norm": 1.890625, "learning_rate": 0.0004865735884910305, "loss": 5.4527, "mean_token_accuracy": 0.17805104255676268, "num_tokens": 23933717.0, "step": 10730 }, { "entropy": 5.565663385391235, "epoch": 1.205649463694053, "grad_norm": 1.3671875, "learning_rate": 0.0004865599236386991, "loss": 5.5131, "mean_token_accuracy": 0.17860305160284043, "num_tokens": 23947764.0, "step": 10735 }, { "entropy": 5.548420000076294, "epoch": 1.2062110406020103, "grad_norm": 2.078125, "learning_rate": 0.0004865462520502177, "loss": 5.3857, "mean_token_accuracy": 0.17887697070837022, "num_tokens": 23960096.0, "step": 10740 }, { "entropy": 5.641502857208252, "epoch": 1.206772617509968, "grad_norm": 1.390625, "learning_rate": 0.0004865325737260216, "loss": 5.4026, "mean_token_accuracy": 0.17797549962997436, "num_tokens": 23971573.0, "step": 10745 }, { "entropy": 5.594951152801514, "epoch": 1.2073341944179254, "grad_norm": 1.5234375, "learning_rate": 0.00048651888866654624, "loss": 5.3613, "mean_token_accuracy": 0.19261209070682525, "num_tokens": 23982710.0, "step": 10750 }, { "entropy": 5.460863971710205, "epoch": 1.207895771325883, "grad_norm": 1.4765625, "learning_rate": 0.0004865051968722275, "loss": 5.3161, "mean_token_accuracy": 0.1874060869216919, "num_tokens": 23993663.0, "step": 10755 }, { "entropy": 5.5636594772338865, "epoch": 1.2084573482338405, "grad_norm": 1.40625, "learning_rate": 0.00048649149834350126, "loss": 5.561, "mean_token_accuracy": 0.1814848840236664, "num_tokens": 24005112.0, "step": 10760 }, { "entropy": 5.523722505569458, "epoch": 1.2090189251417982, "grad_norm": 1.5390625, "learning_rate": 0.0004864777930808037, "loss": 5.3079, "mean_token_accuracy": 0.1889803558588028, "num_tokens": 24015855.0, "step": 10765 }, { "entropy": 5.533093738555908, "epoch": 1.2095805020497556, "grad_norm": 1.40625, "learning_rate": 0.0004864640810845711, "loss": 5.3611, "mean_token_accuracy": 0.18602087199687958, "num_tokens": 24027232.0, "step": 10770 }, { "entropy": 5.5402055263519285, "epoch": 1.2101420789577133, "grad_norm": 1.390625, "learning_rate": 0.0004864503623552402, "loss": 5.3606, "mean_token_accuracy": 0.1877458542585373, "num_tokens": 24039127.0, "step": 10775 }, { "entropy": 5.627122831344605, "epoch": 1.2107036558656707, "grad_norm": 1.640625, "learning_rate": 0.0004864366368932478, "loss": 5.4973, "mean_token_accuracy": 0.1808575674891472, "num_tokens": 24049821.0, "step": 10780 }, { "entropy": 5.597670602798462, "epoch": 1.2112652327736284, "grad_norm": 1.53125, "learning_rate": 0.00048642290469903083, "loss": 5.5212, "mean_token_accuracy": 0.17994545847177507, "num_tokens": 24060305.0, "step": 10785 }, { "entropy": 5.579167890548706, "epoch": 1.2118268096815858, "grad_norm": 1.8203125, "learning_rate": 0.00048640916577302664, "loss": 5.3939, "mean_token_accuracy": 0.18764331489801406, "num_tokens": 24071193.0, "step": 10790 }, { "entropy": 5.47999062538147, "epoch": 1.2123883865895435, "grad_norm": 1.7421875, "learning_rate": 0.00048639542011567243, "loss": 5.2623, "mean_token_accuracy": 0.2041529268026352, "num_tokens": 24082380.0, "step": 10795 }, { "entropy": 5.653561067581177, "epoch": 1.212949963497501, "grad_norm": 1.421875, "learning_rate": 0.0004863816677274062, "loss": 5.5384, "mean_token_accuracy": 0.179527847468853, "num_tokens": 24093168.0, "step": 10800 }, { "entropy": 5.539981079101563, "epoch": 1.2135115404054586, "grad_norm": 1.5234375, "learning_rate": 0.00048636790860866576, "loss": 5.3951, "mean_token_accuracy": 0.18281326144933702, "num_tokens": 24105355.0, "step": 10805 }, { "entropy": 5.488740491867065, "epoch": 1.214073117313416, "grad_norm": 1.6953125, "learning_rate": 0.0004863541427598889, "loss": 5.3561, "mean_token_accuracy": 0.18512464463710784, "num_tokens": 24117062.0, "step": 10810 }, { "entropy": 5.651952171325684, "epoch": 1.2146346942213737, "grad_norm": 1.578125, "learning_rate": 0.0004863403701815144, "loss": 5.5061, "mean_token_accuracy": 0.17755191177129745, "num_tokens": 24127770.0, "step": 10815 }, { "entropy": 5.588659286499023, "epoch": 1.2151962711293312, "grad_norm": 1.65625, "learning_rate": 0.0004863265908739805, "loss": 5.582, "mean_token_accuracy": 0.17055042684078217, "num_tokens": 24139894.0, "step": 10820 }, { "entropy": 5.603845548629761, "epoch": 1.2157578480372888, "grad_norm": 1.46875, "learning_rate": 0.0004863128048377259, "loss": 5.3819, "mean_token_accuracy": 0.19205069839954375, "num_tokens": 24150799.0, "step": 10825 }, { "entropy": 5.6096703052520756, "epoch": 1.2163194249452463, "grad_norm": 1.4375, "learning_rate": 0.0004862990120731896, "loss": 5.4246, "mean_token_accuracy": 0.18172770291566848, "num_tokens": 24161406.0, "step": 10830 }, { "entropy": 5.434682083129883, "epoch": 1.2168810018532037, "grad_norm": 2.15625, "learning_rate": 0.00048628521258081096, "loss": 5.3194, "mean_token_accuracy": 0.18648598492145538, "num_tokens": 24171884.0, "step": 10835 }, { "entropy": 5.543994188308716, "epoch": 1.2174425787611614, "grad_norm": 1.3046875, "learning_rate": 0.00048627140636102906, "loss": 5.3909, "mean_token_accuracy": 0.18740372359752655, "num_tokens": 24183873.0, "step": 10840 }, { "entropy": 5.662725353240967, "epoch": 1.2180041556691188, "grad_norm": 1.296875, "learning_rate": 0.0004862575934142837, "loss": 5.4401, "mean_token_accuracy": 0.18730383813381196, "num_tokens": 24194689.0, "step": 10845 }, { "entropy": 5.545740222930908, "epoch": 1.2185657325770765, "grad_norm": 1.5859375, "learning_rate": 0.0004862437737410147, "loss": 5.3497, "mean_token_accuracy": 0.18136660158634185, "num_tokens": 24206675.0, "step": 10850 }, { "entropy": 5.513843154907226, "epoch": 1.219127309485034, "grad_norm": 2.921875, "learning_rate": 0.0004862299473416619, "loss": 5.4377, "mean_token_accuracy": 0.17925103157758712, "num_tokens": 24218845.0, "step": 10855 }, { "entropy": 5.570048236846924, "epoch": 1.2196888863929916, "grad_norm": 1.84375, "learning_rate": 0.00048621611421666573, "loss": 5.4684, "mean_token_accuracy": 0.17514824569225312, "num_tokens": 24229889.0, "step": 10860 }, { "entropy": 5.662149095535279, "epoch": 1.220250463300949, "grad_norm": 1.7109375, "learning_rate": 0.0004862022743664665, "loss": 5.5148, "mean_token_accuracy": 0.1838795378804207, "num_tokens": 24240729.0, "step": 10865 }, { "entropy": 5.6571629524230955, "epoch": 1.2208120402089067, "grad_norm": 1.5390625, "learning_rate": 0.00048618842779150494, "loss": 5.5292, "mean_token_accuracy": 0.17597716152668, "num_tokens": 24251765.0, "step": 10870 }, { "entropy": 5.558348178863525, "epoch": 1.221373617116864, "grad_norm": 1.625, "learning_rate": 0.00048617457449222205, "loss": 5.4365, "mean_token_accuracy": 0.1781846523284912, "num_tokens": 24262273.0, "step": 10875 }, { "entropy": 5.612859439849854, "epoch": 1.2219351940248218, "grad_norm": 1.5859375, "learning_rate": 0.0004861607144690587, "loss": 5.4272, "mean_token_accuracy": 0.17829763144254684, "num_tokens": 24272313.0, "step": 10880 }, { "entropy": 5.64711561203003, "epoch": 1.2224967709327792, "grad_norm": 1.609375, "learning_rate": 0.0004861468477224563, "loss": 5.4948, "mean_token_accuracy": 0.1757294699549675, "num_tokens": 24283971.0, "step": 10885 }, { "entropy": 5.55884313583374, "epoch": 1.2230583478407369, "grad_norm": 1.5, "learning_rate": 0.00048613297425285635, "loss": 5.4284, "mean_token_accuracy": 0.18071170300245284, "num_tokens": 24294357.0, "step": 10890 }, { "entropy": 5.53272123336792, "epoch": 1.2236199247486943, "grad_norm": 1.7421875, "learning_rate": 0.0004861190940607007, "loss": 5.2968, "mean_token_accuracy": 0.1882367879152298, "num_tokens": 24305894.0, "step": 10895 }, { "entropy": 5.5826810836792, "epoch": 1.224181501656652, "grad_norm": 1.4765625, "learning_rate": 0.0004861052071464312, "loss": 5.4099, "mean_token_accuracy": 0.1851435512304306, "num_tokens": 24318506.0, "step": 10900 }, { "entropy": 5.564007949829102, "epoch": 1.2247430785646094, "grad_norm": 1.8828125, "learning_rate": 0.00048609131351048994, "loss": 5.4156, "mean_token_accuracy": 0.17732575088739394, "num_tokens": 24330169.0, "step": 10905 }, { "entropy": 5.518369913101196, "epoch": 1.225304655472567, "grad_norm": 1.3046875, "learning_rate": 0.0004860774131533195, "loss": 5.3681, "mean_token_accuracy": 0.1917150542140007, "num_tokens": 24340063.0, "step": 10910 }, { "entropy": 5.599963855743408, "epoch": 1.2258662323805245, "grad_norm": 1.796875, "learning_rate": 0.00048606350607536235, "loss": 5.4386, "mean_token_accuracy": 0.18412175327539443, "num_tokens": 24351506.0, "step": 10915 }, { "entropy": 5.537996482849121, "epoch": 1.2264278092884822, "grad_norm": 2.9375, "learning_rate": 0.0004860495922770612, "loss": 5.4124, "mean_token_accuracy": 0.17802354991436004, "num_tokens": 24362168.0, "step": 10920 }, { "entropy": 5.511146926879883, "epoch": 1.2269893861964396, "grad_norm": 1.796875, "learning_rate": 0.00048603567175885926, "loss": 5.3564, "mean_token_accuracy": 0.1828833281993866, "num_tokens": 24372269.0, "step": 10925 }, { "entropy": 5.5755280494689945, "epoch": 1.227550963104397, "grad_norm": 1.6484375, "learning_rate": 0.0004860217445211997, "loss": 5.4694, "mean_token_accuracy": 0.18339033424854279, "num_tokens": 24384368.0, "step": 10930 }, { "entropy": 5.639485788345337, "epoch": 1.2281125400123547, "grad_norm": 1.4921875, "learning_rate": 0.0004860078105645259, "loss": 5.3821, "mean_token_accuracy": 0.18572250306606292, "num_tokens": 24395395.0, "step": 10935 }, { "entropy": 5.521928453445435, "epoch": 1.2286741169203121, "grad_norm": 3.046875, "learning_rate": 0.0004859938698892816, "loss": 5.34, "mean_token_accuracy": 0.1804175704717636, "num_tokens": 24406709.0, "step": 10940 }, { "entropy": 5.538202095031738, "epoch": 1.2292356938282698, "grad_norm": 1.46875, "learning_rate": 0.00048597992249591065, "loss": 5.4913, "mean_token_accuracy": 0.18075333684682846, "num_tokens": 24418574.0, "step": 10945 }, { "entropy": 5.719617748260498, "epoch": 1.2297972707362272, "grad_norm": 1.484375, "learning_rate": 0.00048596596838485704, "loss": 5.4447, "mean_token_accuracy": 0.18116745054721833, "num_tokens": 24429418.0, "step": 10950 }, { "entropy": 5.615225076675415, "epoch": 1.230358847644185, "grad_norm": 2.671875, "learning_rate": 0.0004859520075565654, "loss": 5.5106, "mean_token_accuracy": 0.18256430327892303, "num_tokens": 24440301.0, "step": 10955 }, { "entropy": 5.574560832977295, "epoch": 1.2309204245521423, "grad_norm": 1.8671875, "learning_rate": 0.00048593804001147986, "loss": 5.5404, "mean_token_accuracy": 0.1761474683880806, "num_tokens": 24451987.0, "step": 10960 }, { "entropy": 5.59624605178833, "epoch": 1.2314820014601, "grad_norm": 1.4453125, "learning_rate": 0.0004859240657500453, "loss": 5.3956, "mean_token_accuracy": 0.18446308821439744, "num_tokens": 24461971.0, "step": 10965 }, { "entropy": 5.531461906433106, "epoch": 1.2320435783680574, "grad_norm": 1.359375, "learning_rate": 0.00048591008477270675, "loss": 5.3155, "mean_token_accuracy": 0.18719284236431122, "num_tokens": 24472193.0, "step": 10970 }, { "entropy": 5.4965959072113035, "epoch": 1.232605155276015, "grad_norm": 1.515625, "learning_rate": 0.00048589609707990925, "loss": 5.4151, "mean_token_accuracy": 0.1810591474175453, "num_tokens": 24483075.0, "step": 10975 }, { "entropy": 5.516279792785644, "epoch": 1.2331667321839725, "grad_norm": 1.796875, "learning_rate": 0.00048588210267209823, "loss": 5.3412, "mean_token_accuracy": 0.19502355754375458, "num_tokens": 24493070.0, "step": 10980 }, { "entropy": 5.492527437210083, "epoch": 1.2337283090919302, "grad_norm": 1.640625, "learning_rate": 0.00048586810154971935, "loss": 5.4668, "mean_token_accuracy": 0.17707120180130004, "num_tokens": 24502866.0, "step": 10985 }, { "entropy": 5.54741096496582, "epoch": 1.2342898859998876, "grad_norm": 1.6171875, "learning_rate": 0.00048585409371321826, "loss": 5.3397, "mean_token_accuracy": 0.19318298250436783, "num_tokens": 24514169.0, "step": 10990 }, { "entropy": 5.664519739151001, "epoch": 1.2348514629078453, "grad_norm": 2.609375, "learning_rate": 0.00048584007916304106, "loss": 5.5396, "mean_token_accuracy": 0.1791799932718277, "num_tokens": 24525552.0, "step": 10995 }, { "entropy": 5.563682317733765, "epoch": 1.2354130398158027, "grad_norm": 1.59375, "learning_rate": 0.00048582605789963395, "loss": 5.4504, "mean_token_accuracy": 0.18420275896787644, "num_tokens": 24536370.0, "step": 11000 }, { "entropy": 5.597484731674195, "epoch": 1.2359746167237604, "grad_norm": 2.515625, "learning_rate": 0.0004858120299234434, "loss": 5.4714, "mean_token_accuracy": 0.1837515950202942, "num_tokens": 24546868.0, "step": 11005 }, { "entropy": 5.65571551322937, "epoch": 1.2365361936317179, "grad_norm": 2.25, "learning_rate": 0.00048579799523491607, "loss": 5.4293, "mean_token_accuracy": 0.17340353578329087, "num_tokens": 24558279.0, "step": 11010 }, { "entropy": 5.577965450286865, "epoch": 1.2370977705396755, "grad_norm": 1.7578125, "learning_rate": 0.0004857839538344988, "loss": 5.3583, "mean_token_accuracy": 0.18387570977210999, "num_tokens": 24568321.0, "step": 11015 }, { "entropy": 5.52414608001709, "epoch": 1.237659347447633, "grad_norm": 1.5234375, "learning_rate": 0.00048576990572263875, "loss": 5.417, "mean_token_accuracy": 0.17986870557069778, "num_tokens": 24579137.0, "step": 11020 }, { "entropy": 5.611784029006958, "epoch": 1.2382209243555904, "grad_norm": 2.0, "learning_rate": 0.0004857558508997831, "loss": 5.4729, "mean_token_accuracy": 0.1754674106836319, "num_tokens": 24591523.0, "step": 11025 }, { "entropy": 5.613817977905273, "epoch": 1.238782501263548, "grad_norm": 1.4375, "learning_rate": 0.0004857417893663794, "loss": 5.3944, "mean_token_accuracy": 0.18179088830947876, "num_tokens": 24601998.0, "step": 11030 }, { "entropy": 5.542374229431152, "epoch": 1.2393440781715055, "grad_norm": 1.3671875, "learning_rate": 0.0004857277211228754, "loss": 5.3645, "mean_token_accuracy": 0.18529855608940124, "num_tokens": 24612371.0, "step": 11035 }, { "entropy": 5.59985466003418, "epoch": 1.2399056550794632, "grad_norm": 1.859375, "learning_rate": 0.0004857136461697191, "loss": 5.4681, "mean_token_accuracy": 0.18155949413776398, "num_tokens": 24623350.0, "step": 11040 }, { "entropy": 5.641364288330078, "epoch": 1.2404672319874206, "grad_norm": 1.3046875, "learning_rate": 0.00048569956450735853, "loss": 5.4495, "mean_token_accuracy": 0.18078392893075942, "num_tokens": 24634365.0, "step": 11045 }, { "entropy": 5.6573450565338135, "epoch": 1.2410288088953783, "grad_norm": 1.4921875, "learning_rate": 0.00048568547613624206, "loss": 5.541, "mean_token_accuracy": 0.18133490532636642, "num_tokens": 24645227.0, "step": 11050 }, { "entropy": 5.669416999816894, "epoch": 1.2415903858033357, "grad_norm": 1.4453125, "learning_rate": 0.00048567138105681833, "loss": 5.4892, "mean_token_accuracy": 0.1802353411912918, "num_tokens": 24656807.0, "step": 11055 }, { "entropy": 5.605979776382446, "epoch": 1.2421519627112934, "grad_norm": 2.015625, "learning_rate": 0.00048565727926953617, "loss": 5.4928, "mean_token_accuracy": 0.18245369344949722, "num_tokens": 24669021.0, "step": 11060 }, { "entropy": 5.581379795074463, "epoch": 1.2427135396192508, "grad_norm": 1.3984375, "learning_rate": 0.0004856431707748445, "loss": 5.393, "mean_token_accuracy": 0.18967633247375487, "num_tokens": 24678802.0, "step": 11065 }, { "entropy": 5.587186098098755, "epoch": 1.2432751165272085, "grad_norm": 1.359375, "learning_rate": 0.0004856290555731926, "loss": 5.3781, "mean_token_accuracy": 0.18544357568025588, "num_tokens": 24688449.0, "step": 11070 }, { "entropy": 5.535901975631714, "epoch": 1.243836693435166, "grad_norm": 1.359375, "learning_rate": 0.0004856149336650299, "loss": 5.4521, "mean_token_accuracy": 0.17772786617279052, "num_tokens": 24700272.0, "step": 11075 }, { "entropy": 5.649112796783447, "epoch": 1.2443982703431236, "grad_norm": 1.625, "learning_rate": 0.0004856008050508059, "loss": 5.5979, "mean_token_accuracy": 0.17577450573444367, "num_tokens": 24711949.0, "step": 11080 }, { "entropy": 5.661371088027954, "epoch": 1.244959847251081, "grad_norm": 1.4453125, "learning_rate": 0.0004855866697309707, "loss": 5.4132, "mean_token_accuracy": 0.1884407803416252, "num_tokens": 24723535.0, "step": 11085 }, { "entropy": 5.493203115463257, "epoch": 1.2455214241590387, "grad_norm": 1.375, "learning_rate": 0.0004855725277059742, "loss": 5.4221, "mean_token_accuracy": 0.17563299536705018, "num_tokens": 24734915.0, "step": 11090 }, { "entropy": 5.537456607818603, "epoch": 1.246083001066996, "grad_norm": 1.34375, "learning_rate": 0.0004855583789762668, "loss": 5.3471, "mean_token_accuracy": 0.19495553225278855, "num_tokens": 24745744.0, "step": 11095 }, { "entropy": 5.653546333312988, "epoch": 1.2466445779749538, "grad_norm": 1.46875, "learning_rate": 0.000485544223542299, "loss": 5.5627, "mean_token_accuracy": 0.18065301030874253, "num_tokens": 24758158.0, "step": 11100 }, { "entropy": 5.655344104766845, "epoch": 1.2472061548829112, "grad_norm": 1.640625, "learning_rate": 0.0004855300614045214, "loss": 5.426, "mean_token_accuracy": 0.184110064804554, "num_tokens": 24768607.0, "step": 11105 }, { "entropy": 5.563532066345215, "epoch": 1.2477677317908689, "grad_norm": 1.359375, "learning_rate": 0.00048551589256338497, "loss": 5.4019, "mean_token_accuracy": 0.18666046857833862, "num_tokens": 24779845.0, "step": 11110 }, { "entropy": 5.534594440460205, "epoch": 1.2483293086988263, "grad_norm": 2.6875, "learning_rate": 0.00048550171701934087, "loss": 5.3665, "mean_token_accuracy": 0.17801106125116348, "num_tokens": 24790049.0, "step": 11115 }, { "entropy": 5.672994184494018, "epoch": 1.2488908856067837, "grad_norm": 1.5078125, "learning_rate": 0.00048548753477284053, "loss": 5.4315, "mean_token_accuracy": 0.18115769624710082, "num_tokens": 24802112.0, "step": 11120 }, { "entropy": 5.597347974777222, "epoch": 1.2494524625147414, "grad_norm": 2.171875, "learning_rate": 0.0004854733458243354, "loss": 5.3822, "mean_token_accuracy": 0.1801334246993065, "num_tokens": 24812630.0, "step": 11125 }, { "entropy": 5.534896183013916, "epoch": 1.250014039422699, "grad_norm": 1.4140625, "learning_rate": 0.0004854591501742773, "loss": 5.3699, "mean_token_accuracy": 0.1891779601573944, "num_tokens": 24823346.0, "step": 11130 }, { "entropy": 5.553601455688477, "epoch": 1.2505756163306565, "grad_norm": 1.5546875, "learning_rate": 0.00048544494782311825, "loss": 5.4509, "mean_token_accuracy": 0.1782315269112587, "num_tokens": 24834374.0, "step": 11135 }, { "entropy": 5.551606559753418, "epoch": 1.251137193238614, "grad_norm": 1.34375, "learning_rate": 0.00048543073877131037, "loss": 5.2873, "mean_token_accuracy": 0.18320416659116745, "num_tokens": 24845474.0, "step": 11140 }, { "entropy": 5.59578857421875, "epoch": 1.2516987701465716, "grad_norm": 1.28125, "learning_rate": 0.00048541652301930627, "loss": 5.3773, "mean_token_accuracy": 0.1898516371846199, "num_tokens": 24857427.0, "step": 11145 }, { "entropy": 5.592479515075683, "epoch": 1.252260347054529, "grad_norm": 1.640625, "learning_rate": 0.0004854023005675585, "loss": 5.3868, "mean_token_accuracy": 0.18503573685884475, "num_tokens": 24868352.0, "step": 11150 }, { "entropy": 5.593089580535889, "epoch": 1.2528219239624867, "grad_norm": 1.5078125, "learning_rate": 0.0004853880714165197, "loss": 5.4574, "mean_token_accuracy": 0.17789413332939147, "num_tokens": 24878499.0, "step": 11155 }, { "entropy": 5.557291555404663, "epoch": 1.2533835008704441, "grad_norm": 1.5390625, "learning_rate": 0.00048537383556664315, "loss": 5.4106, "mean_token_accuracy": 0.18766220808029174, "num_tokens": 24888290.0, "step": 11160 }, { "entropy": 5.606050968170166, "epoch": 1.2539450777784018, "grad_norm": 1.5, "learning_rate": 0.0004853595930183822, "loss": 5.4775, "mean_token_accuracy": 0.1763698562979698, "num_tokens": 24900201.0, "step": 11165 }, { "entropy": 5.540960454940796, "epoch": 1.2545066546863592, "grad_norm": 1.46875, "learning_rate": 0.0004853453437721901, "loss": 5.3913, "mean_token_accuracy": 0.1846339926123619, "num_tokens": 24910895.0, "step": 11170 }, { "entropy": 5.543153429031372, "epoch": 1.255068231594317, "grad_norm": 1.34375, "learning_rate": 0.0004853310878285208, "loss": 5.3216, "mean_token_accuracy": 0.19082948118448256, "num_tokens": 24922079.0, "step": 11175 }, { "entropy": 5.720382261276245, "epoch": 1.2556298085022743, "grad_norm": 1.5703125, "learning_rate": 0.00048531682518782797, "loss": 5.6323, "mean_token_accuracy": 0.17555736601352692, "num_tokens": 24935093.0, "step": 11180 }, { "entropy": 5.695417308807373, "epoch": 1.256191385410232, "grad_norm": 1.4765625, "learning_rate": 0.00048530255585056594, "loss": 5.5707, "mean_token_accuracy": 0.17180080711841583, "num_tokens": 24947316.0, "step": 11185 }, { "entropy": 5.511158132553101, "epoch": 1.2567529623181894, "grad_norm": 1.453125, "learning_rate": 0.0004852882798171889, "loss": 5.2863, "mean_token_accuracy": 0.19156352430582047, "num_tokens": 24957255.0, "step": 11190 }, { "entropy": 5.510053825378418, "epoch": 1.2573145392261469, "grad_norm": 1.3203125, "learning_rate": 0.0004852739970881515, "loss": 5.4074, "mean_token_accuracy": 0.18630828112363815, "num_tokens": 24967646.0, "step": 11195 }, { "entropy": 5.659108686447143, "epoch": 1.2578761161341045, "grad_norm": 1.2109375, "learning_rate": 0.00048525970766390847, "loss": 5.5345, "mean_token_accuracy": 0.17736627161502838, "num_tokens": 24979748.0, "step": 11200 }, { "entropy": 5.711154413223267, "epoch": 1.2584376930420622, "grad_norm": 2.203125, "learning_rate": 0.0004852454115449148, "loss": 5.5567, "mean_token_accuracy": 0.1786679282784462, "num_tokens": 24990727.0, "step": 11205 }, { "entropy": 5.538746738433838, "epoch": 1.2589992699500197, "grad_norm": 1.4296875, "learning_rate": 0.0004852311087316257, "loss": 5.364, "mean_token_accuracy": 0.1842673733830452, "num_tokens": 25001912.0, "step": 11210 }, { "entropy": 5.581915807723999, "epoch": 1.259560846857977, "grad_norm": 1.3203125, "learning_rate": 0.0004852167992244966, "loss": 5.4349, "mean_token_accuracy": 0.1812129110097885, "num_tokens": 25012952.0, "step": 11215 }, { "entropy": 5.576125526428223, "epoch": 1.2601224237659348, "grad_norm": 1.3203125, "learning_rate": 0.000485202483023983, "loss": 5.3562, "mean_token_accuracy": 0.18378958404064177, "num_tokens": 25022851.0, "step": 11220 }, { "entropy": 5.520572996139526, "epoch": 1.2606840006738924, "grad_norm": 1.6796875, "learning_rate": 0.00048518816013054083, "loss": 5.3738, "mean_token_accuracy": 0.1824027717113495, "num_tokens": 25033177.0, "step": 11225 }, { "entropy": 5.541713047027588, "epoch": 1.2612455775818499, "grad_norm": 1.3984375, "learning_rate": 0.00048517383054462617, "loss": 5.3387, "mean_token_accuracy": 0.18704062849283218, "num_tokens": 25044140.0, "step": 11230 }, { "entropy": 5.530812120437622, "epoch": 1.2618071544898073, "grad_norm": 1.453125, "learning_rate": 0.0004851594942666952, "loss": 5.3636, "mean_token_accuracy": 0.18201253265142442, "num_tokens": 25054480.0, "step": 11235 }, { "entropy": 5.585394048690796, "epoch": 1.262368731397765, "grad_norm": 1.359375, "learning_rate": 0.00048514515129720445, "loss": 5.4568, "mean_token_accuracy": 0.17366419583559037, "num_tokens": 25065673.0, "step": 11240 }, { "entropy": 5.634736585617065, "epoch": 1.2629303083057224, "grad_norm": 1.5625, "learning_rate": 0.0004851308016366105, "loss": 5.4308, "mean_token_accuracy": 0.18477717638015748, "num_tokens": 25076691.0, "step": 11245 }, { "entropy": 5.619279193878174, "epoch": 1.26349188521368, "grad_norm": 1.5234375, "learning_rate": 0.00048511644528537043, "loss": 5.4084, "mean_token_accuracy": 0.18738510608673095, "num_tokens": 25087882.0, "step": 11250 }, { "entropy": 5.62109408378601, "epoch": 1.2640534621216375, "grad_norm": 1.609375, "learning_rate": 0.0004851020822439412, "loss": 5.5222, "mean_token_accuracy": 0.17479465305805206, "num_tokens": 25099325.0, "step": 11255 }, { "entropy": 5.484981060028076, "epoch": 1.2646150390295952, "grad_norm": 1.59375, "learning_rate": 0.00048508771251278015, "loss": 5.3035, "mean_token_accuracy": 0.1885041892528534, "num_tokens": 25110304.0, "step": 11260 }, { "entropy": 5.5678627490997314, "epoch": 1.2651766159375526, "grad_norm": 1.625, "learning_rate": 0.0004850733360923449, "loss": 5.4497, "mean_token_accuracy": 0.18248049467802047, "num_tokens": 25121597.0, "step": 11265 }, { "entropy": 5.579066419601441, "epoch": 1.2657381928455103, "grad_norm": 2.390625, "learning_rate": 0.0004850589529830931, "loss": 5.4294, "mean_token_accuracy": 0.17716689109802247, "num_tokens": 25132817.0, "step": 11270 }, { "entropy": 5.643011140823364, "epoch": 1.2662997697534677, "grad_norm": 1.2890625, "learning_rate": 0.00048504456318548285, "loss": 5.4824, "mean_token_accuracy": 0.18197162598371505, "num_tokens": 25143740.0, "step": 11275 }, { "entropy": 5.647823524475098, "epoch": 1.2668613466614254, "grad_norm": 1.3046875, "learning_rate": 0.0004850301666999722, "loss": 5.4238, "mean_token_accuracy": 0.18020653128623962, "num_tokens": 25155889.0, "step": 11280 }, { "entropy": 5.519939231872558, "epoch": 1.2674229235693828, "grad_norm": 1.3359375, "learning_rate": 0.0004850157635270196, "loss": 5.5169, "mean_token_accuracy": 0.1792319491505623, "num_tokens": 25166043.0, "step": 11285 }, { "entropy": 5.558336400985718, "epoch": 1.2679845004773402, "grad_norm": 1.5078125, "learning_rate": 0.0004850013536670836, "loss": 5.4013, "mean_token_accuracy": 0.18788154423236847, "num_tokens": 25176906.0, "step": 11290 }, { "entropy": 5.520482540130615, "epoch": 1.268546077385298, "grad_norm": 1.2890625, "learning_rate": 0.0004849869371206231, "loss": 5.3926, "mean_token_accuracy": 0.18359485119581223, "num_tokens": 25187803.0, "step": 11295 }, { "entropy": 5.554761219024658, "epoch": 1.2691076542932556, "grad_norm": 1.296875, "learning_rate": 0.00048497251388809697, "loss": 5.344, "mean_token_accuracy": 0.1825688436627388, "num_tokens": 25199067.0, "step": 11300 }, { "entropy": 5.5986857414245605, "epoch": 1.269669231201213, "grad_norm": 1.296875, "learning_rate": 0.0004849580839699647, "loss": 5.4171, "mean_token_accuracy": 0.1777142956852913, "num_tokens": 25210768.0, "step": 11305 }, { "entropy": 5.627563095092773, "epoch": 1.2702308081091704, "grad_norm": 1.2421875, "learning_rate": 0.00048494364736668554, "loss": 5.4782, "mean_token_accuracy": 0.1803862363100052, "num_tokens": 25221602.0, "step": 11310 }, { "entropy": 5.6025909900665285, "epoch": 1.270792385017128, "grad_norm": 1.5546875, "learning_rate": 0.0004849292040787192, "loss": 5.4338, "mean_token_accuracy": 0.18276409357786177, "num_tokens": 25232791.0, "step": 11315 }, { "entropy": 5.598787879943847, "epoch": 1.2713539619250858, "grad_norm": 1.40625, "learning_rate": 0.0004849147541065256, "loss": 5.3964, "mean_token_accuracy": 0.18757463693618776, "num_tokens": 25243962.0, "step": 11320 }, { "entropy": 5.591303873062134, "epoch": 1.2719155388330432, "grad_norm": 1.375, "learning_rate": 0.0004849002974505649, "loss": 5.3985, "mean_token_accuracy": 0.1832546666264534, "num_tokens": 25254636.0, "step": 11325 }, { "entropy": 5.515753889083863, "epoch": 1.2724771157410006, "grad_norm": 1.609375, "learning_rate": 0.00048488583411129723, "loss": 5.3738, "mean_token_accuracy": 0.1880288988351822, "num_tokens": 25265255.0, "step": 11330 }, { "entropy": 5.610970878601075, "epoch": 1.2730386926489583, "grad_norm": 2.109375, "learning_rate": 0.0004848713640891832, "loss": 5.5106, "mean_token_accuracy": 0.18308686316013337, "num_tokens": 25276721.0, "step": 11335 }, { "entropy": 5.599207973480224, "epoch": 1.2736002695569157, "grad_norm": 1.5234375, "learning_rate": 0.0004848568873846835, "loss": 5.3997, "mean_token_accuracy": 0.19108064770698546, "num_tokens": 25287451.0, "step": 11340 }, { "entropy": 5.557778167724609, "epoch": 1.2741618464648734, "grad_norm": 1.59375, "learning_rate": 0.00048484240399825925, "loss": 5.3552, "mean_token_accuracy": 0.18809493035078048, "num_tokens": 25298609.0, "step": 11345 }, { "entropy": 5.579873132705688, "epoch": 1.2747234233728308, "grad_norm": 1.296875, "learning_rate": 0.00048482791393037134, "loss": 5.4116, "mean_token_accuracy": 0.184177727997303, "num_tokens": 25310058.0, "step": 11350 }, { "entropy": 5.59803032875061, "epoch": 1.2752850002807885, "grad_norm": 1.3671875, "learning_rate": 0.00048481341718148137, "loss": 5.4147, "mean_token_accuracy": 0.18216343820095063, "num_tokens": 25321249.0, "step": 11355 }, { "entropy": 5.567466831207275, "epoch": 1.275846577188746, "grad_norm": 1.3359375, "learning_rate": 0.00048479891375205074, "loss": 5.3734, "mean_token_accuracy": 0.1836025670170784, "num_tokens": 25332603.0, "step": 11360 }, { "entropy": 5.538301849365235, "epoch": 1.2764081540967036, "grad_norm": 1.578125, "learning_rate": 0.00048478440364254136, "loss": 5.3926, "mean_token_accuracy": 0.19262938499450682, "num_tokens": 25344955.0, "step": 11365 }, { "entropy": 5.593557691574096, "epoch": 1.276969731004661, "grad_norm": 2.125, "learning_rate": 0.0004847698868534152, "loss": 5.522, "mean_token_accuracy": 0.17380810678005218, "num_tokens": 25356125.0, "step": 11370 }, { "entropy": 5.587371444702148, "epoch": 1.2775313079126187, "grad_norm": 1.6953125, "learning_rate": 0.0004847553633851345, "loss": 5.3496, "mean_token_accuracy": 0.1864945501089096, "num_tokens": 25366969.0, "step": 11375 }, { "entropy": 5.659316301345825, "epoch": 1.2780928848205761, "grad_norm": 1.4140625, "learning_rate": 0.0004847408332381616, "loss": 5.4353, "mean_token_accuracy": 0.1855549156665802, "num_tokens": 25378815.0, "step": 11380 }, { "entropy": 5.514390516281128, "epoch": 1.2786544617285336, "grad_norm": 1.6328125, "learning_rate": 0.00048472629641295933, "loss": 5.3468, "mean_token_accuracy": 0.18857791572809218, "num_tokens": 25389969.0, "step": 11385 }, { "entropy": 5.539934206008911, "epoch": 1.2792160386364912, "grad_norm": 1.4921875, "learning_rate": 0.0004847117529099904, "loss": 5.4205, "mean_token_accuracy": 0.17841923385858535, "num_tokens": 25401443.0, "step": 11390 }, { "entropy": 5.61718053817749, "epoch": 1.279777615544449, "grad_norm": 1.5625, "learning_rate": 0.00048469720272971797, "loss": 5.4406, "mean_token_accuracy": 0.18052399754524232, "num_tokens": 25412857.0, "step": 11395 }, { "entropy": 5.517834424972534, "epoch": 1.2803391924524063, "grad_norm": 1.578125, "learning_rate": 0.0004846826458726052, "loss": 5.3263, "mean_token_accuracy": 0.1841700106859207, "num_tokens": 25423804.0, "step": 11400 }, { "entropy": 5.569157838821411, "epoch": 1.2809007693603638, "grad_norm": 1.4375, "learning_rate": 0.00048466808233911567, "loss": 5.4815, "mean_token_accuracy": 0.17656506299972535, "num_tokens": 25435686.0, "step": 11405 }, { "entropy": 5.654522323608399, "epoch": 1.2814623462683215, "grad_norm": 1.3515625, "learning_rate": 0.00048465351212971313, "loss": 5.4205, "mean_token_accuracy": 0.1811635062098503, "num_tokens": 25446012.0, "step": 11410 }, { "entropy": 5.654188346862793, "epoch": 1.2820239231762791, "grad_norm": 1.6484375, "learning_rate": 0.0004846389352448614, "loss": 5.4819, "mean_token_accuracy": 0.18275005370378494, "num_tokens": 25457768.0, "step": 11415 }, { "entropy": 5.60784878730774, "epoch": 1.2825855000842366, "grad_norm": 1.7265625, "learning_rate": 0.0004846243516850247, "loss": 5.4008, "mean_token_accuracy": 0.1821306124329567, "num_tokens": 25468706.0, "step": 11420 }, { "entropy": 5.647635555267334, "epoch": 1.283147076992194, "grad_norm": 1.5078125, "learning_rate": 0.0004846097614506673, "loss": 5.4781, "mean_token_accuracy": 0.17850955724716186, "num_tokens": 25479446.0, "step": 11425 }, { "entropy": 5.589556455612183, "epoch": 1.2837086539001517, "grad_norm": 1.703125, "learning_rate": 0.00048459516454225384, "loss": 5.4035, "mean_token_accuracy": 0.18292578905820847, "num_tokens": 25491090.0, "step": 11430 }, { "entropy": 5.669900703430176, "epoch": 1.284270230808109, "grad_norm": 1.5703125, "learning_rate": 0.000484580560960249, "loss": 5.4949, "mean_token_accuracy": 0.18713346719741822, "num_tokens": 25502105.0, "step": 11435 }, { "entropy": 5.716572904586792, "epoch": 1.2848318077160668, "grad_norm": 1.6953125, "learning_rate": 0.0004845659507051178, "loss": 5.5657, "mean_token_accuracy": 0.17665825933218002, "num_tokens": 25513970.0, "step": 11440 }, { "entropy": 5.581077337265015, "epoch": 1.2853933846240242, "grad_norm": 2.65625, "learning_rate": 0.0004845513337773255, "loss": 5.3877, "mean_token_accuracy": 0.18205983340740203, "num_tokens": 25524508.0, "step": 11445 }, { "entropy": 5.575494241714478, "epoch": 1.2859549615319819, "grad_norm": 2.3125, "learning_rate": 0.00048453671017733755, "loss": 5.3989, "mean_token_accuracy": 0.17941714376211165, "num_tokens": 25536006.0, "step": 11450 }, { "entropy": 5.538037443161011, "epoch": 1.2865165384399393, "grad_norm": 1.8046875, "learning_rate": 0.0004845220799056194, "loss": 5.4167, "mean_token_accuracy": 0.17841051369905472, "num_tokens": 25545726.0, "step": 11455 }, { "entropy": 5.547820711135865, "epoch": 1.287078115347897, "grad_norm": 1.75, "learning_rate": 0.00048450744296263685, "loss": 5.3506, "mean_token_accuracy": 0.1820966675877571, "num_tokens": 25555914.0, "step": 11460 }, { "entropy": 5.636511039733887, "epoch": 1.2876396922558544, "grad_norm": 1.7265625, "learning_rate": 0.00048449279934885625, "loss": 5.5396, "mean_token_accuracy": 0.17541532963514328, "num_tokens": 25568021.0, "step": 11465 }, { "entropy": 5.657505226135254, "epoch": 1.288201269163812, "grad_norm": 1.5390625, "learning_rate": 0.0004844781490647435, "loss": 5.434, "mean_token_accuracy": 0.18049876689910888, "num_tokens": 25578788.0, "step": 11470 }, { "entropy": 5.582758998870849, "epoch": 1.2887628460717695, "grad_norm": 1.84375, "learning_rate": 0.0004844634921107654, "loss": 5.4571, "mean_token_accuracy": 0.18426980525255204, "num_tokens": 25590997.0, "step": 11475 }, { "entropy": 5.624828338623047, "epoch": 1.289324422979727, "grad_norm": 1.921875, "learning_rate": 0.00048444882848738835, "loss": 5.5133, "mean_token_accuracy": 0.17030210494995118, "num_tokens": 25602810.0, "step": 11480 }, { "entropy": 5.700673151016235, "epoch": 1.2898859998876846, "grad_norm": 1.3359375, "learning_rate": 0.00048443415819507944, "loss": 5.4931, "mean_token_accuracy": 0.18021892607212067, "num_tokens": 25614251.0, "step": 11485 }, { "entropy": 5.600652503967285, "epoch": 1.2904475767956423, "grad_norm": 2.015625, "learning_rate": 0.0004844194812343057, "loss": 5.4952, "mean_token_accuracy": 0.18398517966270447, "num_tokens": 25626162.0, "step": 11490 }, { "entropy": 5.621218585968018, "epoch": 1.2910091537035997, "grad_norm": 2.265625, "learning_rate": 0.0004844047976055344, "loss": 5.473, "mean_token_accuracy": 0.1821221113204956, "num_tokens": 25637598.0, "step": 11495 }, { "entropy": 5.6588897705078125, "epoch": 1.2915707306115571, "grad_norm": 1.75, "learning_rate": 0.00048439010730923313, "loss": 5.4176, "mean_token_accuracy": 0.18844881355762483, "num_tokens": 25648297.0, "step": 11500 }, { "entropy": 5.634639263153076, "epoch": 1.2921323075195148, "grad_norm": 1.734375, "learning_rate": 0.00048437541034586964, "loss": 5.4856, "mean_token_accuracy": 0.17767189294099808, "num_tokens": 25660139.0, "step": 11505 }, { "entropy": 5.563700008392334, "epoch": 1.2926938844274725, "grad_norm": 1.859375, "learning_rate": 0.00048436070671591195, "loss": 5.4008, "mean_token_accuracy": 0.18382530957460402, "num_tokens": 25671947.0, "step": 11510 }, { "entropy": 5.540437698364258, "epoch": 1.29325546133543, "grad_norm": 1.7578125, "learning_rate": 0.00048434599641982806, "loss": 5.3415, "mean_token_accuracy": 0.18799777030944825, "num_tokens": 25682059.0, "step": 11515 }, { "entropy": 5.595335960388184, "epoch": 1.2938170382433873, "grad_norm": 2.234375, "learning_rate": 0.00048433127945808645, "loss": 5.4388, "mean_token_accuracy": 0.1800031155347824, "num_tokens": 25692792.0, "step": 11520 }, { "entropy": 5.577079010009766, "epoch": 1.294378615151345, "grad_norm": 2.296875, "learning_rate": 0.0004843165558311558, "loss": 5.4565, "mean_token_accuracy": 0.17733431309461595, "num_tokens": 25703253.0, "step": 11525 }, { "entropy": 5.642816686630249, "epoch": 1.2949401920593024, "grad_norm": 1.484375, "learning_rate": 0.0004843018255395048, "loss": 5.3965, "mean_token_accuracy": 0.1866176277399063, "num_tokens": 25714169.0, "step": 11530 }, { "entropy": 5.609458255767822, "epoch": 1.29550176896726, "grad_norm": 2.140625, "learning_rate": 0.00048428708858360244, "loss": 5.4945, "mean_token_accuracy": 0.17917241752147675, "num_tokens": 25725827.0, "step": 11535 }, { "entropy": 5.56046314239502, "epoch": 1.2960633458752175, "grad_norm": 3.4375, "learning_rate": 0.00048427234496391816, "loss": 5.4327, "mean_token_accuracy": 0.18428800702095033, "num_tokens": 25737951.0, "step": 11540 }, { "entropy": 5.581019639968872, "epoch": 1.2966249227831752, "grad_norm": 2.5, "learning_rate": 0.00048425759468092113, "loss": 5.4824, "mean_token_accuracy": 0.17608369290828704, "num_tokens": 25749676.0, "step": 11545 }, { "entropy": 5.661048555374146, "epoch": 1.2971864996911326, "grad_norm": 2.359375, "learning_rate": 0.0004842428377350811, "loss": 5.4637, "mean_token_accuracy": 0.18972608149051667, "num_tokens": 25760005.0, "step": 11550 }, { "entropy": 5.671072864532471, "epoch": 1.2977480765990903, "grad_norm": 2.6875, "learning_rate": 0.00048422807412686796, "loss": 5.5169, "mean_token_accuracy": 0.17256719172000884, "num_tokens": 25770595.0, "step": 11555 }, { "entropy": 5.661506319046021, "epoch": 1.2983096535070477, "grad_norm": 1.7421875, "learning_rate": 0.0004842133038567519, "loss": 5.5335, "mean_token_accuracy": 0.18202261179685592, "num_tokens": 25782301.0, "step": 11560 }, { "entropy": 5.594887542724609, "epoch": 1.2988712304150054, "grad_norm": 2.765625, "learning_rate": 0.000484198526925203, "loss": 5.3719, "mean_token_accuracy": 0.18578586727380753, "num_tokens": 25792904.0, "step": 11565 }, { "entropy": 5.600375318527222, "epoch": 1.2994328073229628, "grad_norm": 1.453125, "learning_rate": 0.0004841837433326919, "loss": 5.4983, "mean_token_accuracy": 0.17811461091041564, "num_tokens": 25804594.0, "step": 11570 }, { "entropy": 5.605722141265869, "epoch": 1.2999943842309205, "grad_norm": 1.8984375, "learning_rate": 0.0004841689530796893, "loss": 5.3978, "mean_token_accuracy": 0.18363674581050873, "num_tokens": 25816496.0, "step": 11575 }, { "entropy": 5.576470279693604, "epoch": 1.300555961138878, "grad_norm": 3.25, "learning_rate": 0.0004841541561666661, "loss": 5.3506, "mean_token_accuracy": 0.18314846009016036, "num_tokens": 25827271.0, "step": 11580 }, { "entropy": 5.49079384803772, "epoch": 1.3011175380468356, "grad_norm": 1.7421875, "learning_rate": 0.00048413935259409343, "loss": 5.4112, "mean_token_accuracy": 0.17746203988790513, "num_tokens": 25837869.0, "step": 11585 }, { "entropy": 5.539881849288941, "epoch": 1.301679114954793, "grad_norm": 2.203125, "learning_rate": 0.00048412454236244267, "loss": 5.3612, "mean_token_accuracy": 0.1847861185669899, "num_tokens": 25850244.0, "step": 11590 }, { "entropy": 5.626516580581665, "epoch": 1.3022406918627505, "grad_norm": 1.8046875, "learning_rate": 0.00048410972547218545, "loss": 5.451, "mean_token_accuracy": 0.18317297101020813, "num_tokens": 25859981.0, "step": 11595 }, { "entropy": 5.539654350280761, "epoch": 1.3028022687707081, "grad_norm": 1.5625, "learning_rate": 0.00048409490192379337, "loss": 5.3361, "mean_token_accuracy": 0.19252536147832872, "num_tokens": 25870393.0, "step": 11600 }, { "entropy": 5.587570095062256, "epoch": 1.3033638456786658, "grad_norm": 1.671875, "learning_rate": 0.0004840800717177386, "loss": 5.4834, "mean_token_accuracy": 0.18229357302188873, "num_tokens": 25882517.0, "step": 11605 }, { "entropy": 5.586652374267578, "epoch": 1.3039254225866233, "grad_norm": 1.5234375, "learning_rate": 0.0004840652348544931, "loss": 5.4173, "mean_token_accuracy": 0.1851235270500183, "num_tokens": 25893628.0, "step": 11610 }, { "entropy": 5.658670234680176, "epoch": 1.3044869994945807, "grad_norm": 2.09375, "learning_rate": 0.0004840503913345296, "loss": 5.4557, "mean_token_accuracy": 0.17808904200792314, "num_tokens": 25904891.0, "step": 11615 }, { "entropy": 5.6350267887115475, "epoch": 1.3050485764025384, "grad_norm": 1.59375, "learning_rate": 0.0004840355411583205, "loss": 5.4281, "mean_token_accuracy": 0.17956867814064026, "num_tokens": 25914598.0, "step": 11620 }, { "entropy": 5.635906028747558, "epoch": 1.3056101533104958, "grad_norm": 2.484375, "learning_rate": 0.00048402068432633864, "loss": 5.4167, "mean_token_accuracy": 0.18526556342840195, "num_tokens": 25924412.0, "step": 11625 }, { "entropy": 5.537234210968018, "epoch": 1.3061717302184535, "grad_norm": 3.171875, "learning_rate": 0.0004840058208390572, "loss": 5.4194, "mean_token_accuracy": 0.17871478348970413, "num_tokens": 25935583.0, "step": 11630 }, { "entropy": 5.512251567840576, "epoch": 1.306733307126411, "grad_norm": 1.5234375, "learning_rate": 0.0004839909506969494, "loss": 5.338, "mean_token_accuracy": 0.18482319563627242, "num_tokens": 25946949.0, "step": 11635 }, { "entropy": 5.515132904052734, "epoch": 1.3072948840343686, "grad_norm": 2.109375, "learning_rate": 0.0004839760739004886, "loss": 5.3429, "mean_token_accuracy": 0.18653517663478852, "num_tokens": 25957070.0, "step": 11640 }, { "entropy": 5.604286241531372, "epoch": 1.307856460942326, "grad_norm": 2.03125, "learning_rate": 0.00048396119045014853, "loss": 5.4657, "mean_token_accuracy": 0.1766536921262741, "num_tokens": 25968375.0, "step": 11645 }, { "entropy": 5.687704467773438, "epoch": 1.3084180378502837, "grad_norm": 1.671875, "learning_rate": 0.0004839463003464032, "loss": 5.4541, "mean_token_accuracy": 0.18244671523571016, "num_tokens": 25979690.0, "step": 11650 }, { "entropy": 5.653723621368409, "epoch": 1.308979614758241, "grad_norm": 1.671875, "learning_rate": 0.0004839314035897265, "loss": 5.5593, "mean_token_accuracy": 0.1719047576189041, "num_tokens": 25990660.0, "step": 11655 }, { "entropy": 5.43707971572876, "epoch": 1.3095411916661988, "grad_norm": 1.828125, "learning_rate": 0.000483916500180593, "loss": 5.3169, "mean_token_accuracy": 0.18557359874248505, "num_tokens": 26002158.0, "step": 11660 }, { "entropy": 5.6041358470916744, "epoch": 1.3101027685741562, "grad_norm": 1.578125, "learning_rate": 0.00048390159011947706, "loss": 5.3403, "mean_token_accuracy": 0.18800112903118132, "num_tokens": 26011890.0, "step": 11665 }, { "entropy": 5.591357707977295, "epoch": 1.3106643454821139, "grad_norm": 1.7421875, "learning_rate": 0.0004838866734068535, "loss": 5.4562, "mean_token_accuracy": 0.17782177180051803, "num_tokens": 26023548.0, "step": 11670 }, { "entropy": 5.581407451629639, "epoch": 1.3112259223900713, "grad_norm": 1.8984375, "learning_rate": 0.00048387175004319723, "loss": 5.4621, "mean_token_accuracy": 0.18198118060827256, "num_tokens": 26034178.0, "step": 11675 }, { "entropy": 5.562361097335815, "epoch": 1.311787499298029, "grad_norm": 3.0, "learning_rate": 0.0004838568200289834, "loss": 5.3856, "mean_token_accuracy": 0.18595320582389832, "num_tokens": 26045068.0, "step": 11680 }, { "entropy": 5.599232959747314, "epoch": 1.3123490762059864, "grad_norm": 2.140625, "learning_rate": 0.0004838418833646875, "loss": 5.5081, "mean_token_accuracy": 0.17779320776462554, "num_tokens": 26057400.0, "step": 11685 }, { "entropy": 5.562916946411133, "epoch": 1.3129106531139438, "grad_norm": 1.921875, "learning_rate": 0.00048382694005078485, "loss": 5.4286, "mean_token_accuracy": 0.1821630820631981, "num_tokens": 26068981.0, "step": 11690 }, { "entropy": 5.64361310005188, "epoch": 1.3134722300219015, "grad_norm": 1.546875, "learning_rate": 0.00048381199008775165, "loss": 5.3865, "mean_token_accuracy": 0.18470406383275986, "num_tokens": 26078902.0, "step": 11695 }, { "entropy": 5.46088490486145, "epoch": 1.3140338069298592, "grad_norm": 1.921875, "learning_rate": 0.0004837970334760635, "loss": 5.2692, "mean_token_accuracy": 0.19096807092428209, "num_tokens": 26089891.0, "step": 11700 }, { "entropy": 5.485475730895996, "epoch": 1.3145953838378166, "grad_norm": 2.265625, "learning_rate": 0.000483782070216197, "loss": 5.3797, "mean_token_accuracy": 0.18987158834934234, "num_tokens": 26100701.0, "step": 11705 }, { "entropy": 5.52687087059021, "epoch": 1.315156960745774, "grad_norm": 1.5546875, "learning_rate": 0.0004837671003086283, "loss": 5.3908, "mean_token_accuracy": 0.18701540678739548, "num_tokens": 26110496.0, "step": 11710 }, { "entropy": 5.523316240310669, "epoch": 1.3157185376537317, "grad_norm": 2.0, "learning_rate": 0.0004837521237538342, "loss": 5.3529, "mean_token_accuracy": 0.18877830654382705, "num_tokens": 26120580.0, "step": 11715 }, { "entropy": 5.506276321411133, "epoch": 1.3162801145616891, "grad_norm": 1.765625, "learning_rate": 0.0004837371405522915, "loss": 5.4204, "mean_token_accuracy": 0.18576560616493226, "num_tokens": 26130936.0, "step": 11720 }, { "entropy": 5.65242748260498, "epoch": 1.3168416914696468, "grad_norm": 2.078125, "learning_rate": 0.00048372215070447734, "loss": 5.4132, "mean_token_accuracy": 0.18514294624328614, "num_tokens": 26143027.0, "step": 11725 }, { "entropy": 5.596934413909912, "epoch": 1.3174032683776042, "grad_norm": 1.6953125, "learning_rate": 0.00048370715421086884, "loss": 5.3053, "mean_token_accuracy": 0.18550607711076736, "num_tokens": 26152874.0, "step": 11730 }, { "entropy": 5.498037242889405, "epoch": 1.317964845285562, "grad_norm": 2.109375, "learning_rate": 0.0004836921510719438, "loss": 5.2872, "mean_token_accuracy": 0.18218962997198104, "num_tokens": 26162781.0, "step": 11735 }, { "entropy": 5.490464353561402, "epoch": 1.3185264221935193, "grad_norm": 1.578125, "learning_rate": 0.0004836771412881795, "loss": 5.3809, "mean_token_accuracy": 0.187151300907135, "num_tokens": 26173498.0, "step": 11740 }, { "entropy": 5.562977123260498, "epoch": 1.319087999101477, "grad_norm": 1.4609375, "learning_rate": 0.0004836621248600542, "loss": 5.3842, "mean_token_accuracy": 0.18796051293611526, "num_tokens": 26185090.0, "step": 11745 }, { "entropy": 5.658957481384277, "epoch": 1.3196495760094344, "grad_norm": 1.4921875, "learning_rate": 0.0004836471017880459, "loss": 5.6025, "mean_token_accuracy": 0.1729616180062294, "num_tokens": 26197048.0, "step": 11750 }, { "entropy": 5.568052053451538, "epoch": 1.320211152917392, "grad_norm": 1.859375, "learning_rate": 0.0004836320720726329, "loss": 5.4367, "mean_token_accuracy": 0.18527210354804993, "num_tokens": 26208037.0, "step": 11755 }, { "entropy": 5.6516584873199465, "epoch": 1.3207727298253495, "grad_norm": 2.1875, "learning_rate": 0.0004836170357142939, "loss": 5.4554, "mean_token_accuracy": 0.18128653913736342, "num_tokens": 26219345.0, "step": 11760 }, { "entropy": 5.66205587387085, "epoch": 1.3213343067333072, "grad_norm": 1.96875, "learning_rate": 0.0004836019927135076, "loss": 5.4583, "mean_token_accuracy": 0.1837382659316063, "num_tokens": 26230299.0, "step": 11765 }, { "entropy": 5.693551540374756, "epoch": 1.3218958836412646, "grad_norm": 1.4765625, "learning_rate": 0.0004835869430707529, "loss": 5.5218, "mean_token_accuracy": 0.17959502041339875, "num_tokens": 26241427.0, "step": 11770 }, { "entropy": 5.5806210994720455, "epoch": 1.3224574605492223, "grad_norm": 1.609375, "learning_rate": 0.00048357188678650905, "loss": 5.4826, "mean_token_accuracy": 0.18851787298917771, "num_tokens": 26252051.0, "step": 11775 }, { "entropy": 5.569334602355957, "epoch": 1.3230190374571797, "grad_norm": 4.59375, "learning_rate": 0.0004835568238612553, "loss": 5.4019, "mean_token_accuracy": 0.17965350449085235, "num_tokens": 26263640.0, "step": 11780 }, { "entropy": 5.71147723197937, "epoch": 1.3235806143651372, "grad_norm": 2.875, "learning_rate": 0.00048354175429547155, "loss": 5.5939, "mean_token_accuracy": 0.1769303485751152, "num_tokens": 26274996.0, "step": 11785 }, { "entropy": 5.760419845581055, "epoch": 1.3241421912730948, "grad_norm": 2.265625, "learning_rate": 0.0004835266780896374, "loss": 5.5576, "mean_token_accuracy": 0.17181482911109924, "num_tokens": 26287859.0, "step": 11790 }, { "entropy": 5.569895267486572, "epoch": 1.3247037681810525, "grad_norm": 1.8046875, "learning_rate": 0.0004835115952442329, "loss": 5.3491, "mean_token_accuracy": 0.18307339251041413, "num_tokens": 26298302.0, "step": 11795 }, { "entropy": 5.614945650100708, "epoch": 1.32526534508901, "grad_norm": 1.765625, "learning_rate": 0.00048349650575973843, "loss": 5.4486, "mean_token_accuracy": 0.1809273272752762, "num_tokens": 26310755.0, "step": 11800 }, { "entropy": 5.631687355041504, "epoch": 1.3258269219969674, "grad_norm": 1.609375, "learning_rate": 0.00048348140963663436, "loss": 5.542, "mean_token_accuracy": 0.17422901540994645, "num_tokens": 26322041.0, "step": 11805 }, { "entropy": 5.630207347869873, "epoch": 1.326388498904925, "grad_norm": 1.6796875, "learning_rate": 0.0004834663068754012, "loss": 5.4791, "mean_token_accuracy": 0.18391888439655305, "num_tokens": 26334028.0, "step": 11810 }, { "entropy": 5.544382095336914, "epoch": 1.3269500758128827, "grad_norm": 2.5, "learning_rate": 0.0004834511974765202, "loss": 5.3836, "mean_token_accuracy": 0.18592217117547988, "num_tokens": 26344834.0, "step": 11815 }, { "entropy": 5.559587526321411, "epoch": 1.3275116527208402, "grad_norm": 1.8203125, "learning_rate": 0.00048343608144047194, "loss": 5.394, "mean_token_accuracy": 0.18360603153705596, "num_tokens": 26354896.0, "step": 11820 }, { "entropy": 5.644568014144897, "epoch": 1.3280732296287976, "grad_norm": 1.6875, "learning_rate": 0.00048342095876773825, "loss": 5.4762, "mean_token_accuracy": 0.18239444643259048, "num_tokens": 26367487.0, "step": 11825 }, { "entropy": 5.630744314193725, "epoch": 1.3286348065367553, "grad_norm": 2.125, "learning_rate": 0.0004834058294588003, "loss": 5.479, "mean_token_accuracy": 0.17969143390655518, "num_tokens": 26379384.0, "step": 11830 }, { "entropy": 5.6427594184875485, "epoch": 1.3291963834447127, "grad_norm": 1.921875, "learning_rate": 0.00048339069351413993, "loss": 5.429, "mean_token_accuracy": 0.18330038636922835, "num_tokens": 26390268.0, "step": 11835 }, { "entropy": 5.535543394088745, "epoch": 1.3297579603526704, "grad_norm": 1.546875, "learning_rate": 0.000483375550934239, "loss": 5.5305, "mean_token_accuracy": 0.17828609347343444, "num_tokens": 26401348.0, "step": 11840 }, { "entropy": 5.5631701946258545, "epoch": 1.3303195372606278, "grad_norm": 1.7109375, "learning_rate": 0.0004833604017195798, "loss": 5.3935, "mean_token_accuracy": 0.1797025293111801, "num_tokens": 26411955.0, "step": 11845 }, { "entropy": 5.5863142013549805, "epoch": 1.3308811141685855, "grad_norm": 2.703125, "learning_rate": 0.0004833452458706445, "loss": 5.3328, "mean_token_accuracy": 0.1938882663846016, "num_tokens": 26422200.0, "step": 11850 }, { "entropy": 5.592746877670288, "epoch": 1.331442691076543, "grad_norm": 1.9140625, "learning_rate": 0.0004833300833879159, "loss": 5.3499, "mean_token_accuracy": 0.18699274361133575, "num_tokens": 26433292.0, "step": 11855 }, { "entropy": 5.554074811935425, "epoch": 1.3320042679845006, "grad_norm": 1.5703125, "learning_rate": 0.0004833149142718765, "loss": 5.3882, "mean_token_accuracy": 0.1879195973277092, "num_tokens": 26444003.0, "step": 11860 }, { "entropy": 5.555953025817871, "epoch": 1.332565844892458, "grad_norm": 1.5390625, "learning_rate": 0.0004832997385230096, "loss": 5.3987, "mean_token_accuracy": 0.18996921330690383, "num_tokens": 26455743.0, "step": 11865 }, { "entropy": 5.543155670166016, "epoch": 1.3331274218004157, "grad_norm": 1.84375, "learning_rate": 0.0004832845561417981, "loss": 5.3767, "mean_token_accuracy": 0.18165364116430283, "num_tokens": 26466032.0, "step": 11870 }, { "entropy": 5.601006317138672, "epoch": 1.333688998708373, "grad_norm": 1.46875, "learning_rate": 0.0004832693671287256, "loss": 5.401, "mean_token_accuracy": 0.1820191591978073, "num_tokens": 26477660.0, "step": 11875 }, { "entropy": 5.540877723693848, "epoch": 1.3342505756163305, "grad_norm": 1.5625, "learning_rate": 0.0004832541714842757, "loss": 5.3848, "mean_token_accuracy": 0.18291471302509307, "num_tokens": 26488778.0, "step": 11880 }, { "entropy": 5.655148315429687, "epoch": 1.3348121525242882, "grad_norm": 1.46875, "learning_rate": 0.0004832389692089321, "loss": 5.4454, "mean_token_accuracy": 0.1753410890698433, "num_tokens": 26500771.0, "step": 11885 }, { "entropy": 5.571166133880615, "epoch": 1.3353737294322459, "grad_norm": 1.59375, "learning_rate": 0.00048322376030317905, "loss": 5.3715, "mean_token_accuracy": 0.1887003391981125, "num_tokens": 26511786.0, "step": 11890 }, { "entropy": 5.556343078613281, "epoch": 1.3359353063402033, "grad_norm": 1.5234375, "learning_rate": 0.0004832085447675007, "loss": 5.4463, "mean_token_accuracy": 0.18483859449625015, "num_tokens": 26522273.0, "step": 11895 }, { "entropy": 5.75804123878479, "epoch": 1.3364968832481607, "grad_norm": 1.8125, "learning_rate": 0.00048319332260238153, "loss": 5.7205, "mean_token_accuracy": 0.16999229341745375, "num_tokens": 26536619.0, "step": 11900 }, { "entropy": 5.735089111328125, "epoch": 1.3370584601561184, "grad_norm": 1.6328125, "learning_rate": 0.00048317809380830624, "loss": 5.4625, "mean_token_accuracy": 0.17418597191572188, "num_tokens": 26547807.0, "step": 11905 }, { "entropy": 5.627963924407959, "epoch": 1.337620037064076, "grad_norm": 1.7421875, "learning_rate": 0.0004831628583857597, "loss": 5.4546, "mean_token_accuracy": 0.1782565787434578, "num_tokens": 26558924.0, "step": 11910 }, { "entropy": 5.571965122222901, "epoch": 1.3381816139720335, "grad_norm": 1.90625, "learning_rate": 0.00048314761633522696, "loss": 5.4068, "mean_token_accuracy": 0.18269326090812682, "num_tokens": 26570123.0, "step": 11915 }, { "entropy": 5.65542631149292, "epoch": 1.338743190879991, "grad_norm": 1.421875, "learning_rate": 0.0004831323676571934, "loss": 5.4918, "mean_token_accuracy": 0.18208651542663573, "num_tokens": 26582841.0, "step": 11920 }, { "entropy": 5.607376909255981, "epoch": 1.3393047677879486, "grad_norm": 3.15625, "learning_rate": 0.0004831171123521446, "loss": 5.3852, "mean_token_accuracy": 0.18670095056295394, "num_tokens": 26594397.0, "step": 11925 }, { "entropy": 5.5590019702911375, "epoch": 1.339866344695906, "grad_norm": 1.859375, "learning_rate": 0.0004831018504205662, "loss": 5.4673, "mean_token_accuracy": 0.17675997614860534, "num_tokens": 26605055.0, "step": 11930 }, { "entropy": 5.593759393692016, "epoch": 1.3404279216038637, "grad_norm": 1.40625, "learning_rate": 0.00048308658186294414, "loss": 5.514, "mean_token_accuracy": 0.1753700017929077, "num_tokens": 26616110.0, "step": 11935 }, { "entropy": 5.627068376541137, "epoch": 1.3409894985118211, "grad_norm": 2.390625, "learning_rate": 0.0004830713066797646, "loss": 5.4105, "mean_token_accuracy": 0.18769517093896865, "num_tokens": 26627196.0, "step": 11940 }, { "entropy": 5.584965181350708, "epoch": 1.3415510754197788, "grad_norm": 1.6875, "learning_rate": 0.00048305602487151396, "loss": 5.4821, "mean_token_accuracy": 0.18012309074401855, "num_tokens": 26637962.0, "step": 11945 }, { "entropy": 5.51606125831604, "epoch": 1.3421126523277362, "grad_norm": 1.84375, "learning_rate": 0.0004830407364386789, "loss": 5.3846, "mean_token_accuracy": 0.18352729231119155, "num_tokens": 26649366.0, "step": 11950 }, { "entropy": 5.768883609771729, "epoch": 1.342674229235694, "grad_norm": 1.8515625, "learning_rate": 0.000483025441381746, "loss": 5.6188, "mean_token_accuracy": 0.17198943495750427, "num_tokens": 26662455.0, "step": 11955 }, { "entropy": 5.583873987197876, "epoch": 1.3432358061436513, "grad_norm": 1.4140625, "learning_rate": 0.00048301013970120235, "loss": 5.4889, "mean_token_accuracy": 0.18145816326141356, "num_tokens": 26673467.0, "step": 11960 }, { "entropy": 5.538484048843384, "epoch": 1.343797383051609, "grad_norm": 1.765625, "learning_rate": 0.00048299483139753517, "loss": 5.3531, "mean_token_accuracy": 0.1864481821656227, "num_tokens": 26684803.0, "step": 11965 }, { "entropy": 5.667122411727905, "epoch": 1.3443589599595664, "grad_norm": 1.6328125, "learning_rate": 0.0004829795164712319, "loss": 5.4569, "mean_token_accuracy": 0.1781364396214485, "num_tokens": 26696886.0, "step": 11970 }, { "entropy": 5.429471158981324, "epoch": 1.3449205368675239, "grad_norm": 1.7265625, "learning_rate": 0.00048296419492278023, "loss": 5.2782, "mean_token_accuracy": 0.1929266095161438, "num_tokens": 26708489.0, "step": 11975 }, { "entropy": 5.556291913986206, "epoch": 1.3454821137754815, "grad_norm": 1.5546875, "learning_rate": 0.0004829488667526679, "loss": 5.4411, "mean_token_accuracy": 0.18234337568283082, "num_tokens": 26719599.0, "step": 11980 }, { "entropy": 5.543146467208862, "epoch": 1.3460436906834392, "grad_norm": 1.4921875, "learning_rate": 0.00048293353196138294, "loss": 5.3606, "mean_token_accuracy": 0.18849279433488847, "num_tokens": 26730359.0, "step": 11985 }, { "entropy": 5.640635585784912, "epoch": 1.3466052675913966, "grad_norm": 1.8515625, "learning_rate": 0.00048291819054941375, "loss": 5.5639, "mean_token_accuracy": 0.17377166748046874, "num_tokens": 26742363.0, "step": 11990 }, { "entropy": 5.627382469177246, "epoch": 1.347166844499354, "grad_norm": 1.2734375, "learning_rate": 0.0004829028425172487, "loss": 5.5331, "mean_token_accuracy": 0.17799247652292252, "num_tokens": 26754058.0, "step": 11995 }, { "entropy": 5.582808637619019, "epoch": 1.3477284214073117, "grad_norm": 2.0, "learning_rate": 0.00048288748786537656, "loss": 5.4443, "mean_token_accuracy": 0.17711522728204726, "num_tokens": 26765602.0, "step": 12000 }, { "epoch": 1.3477284214073117, "eval_entropy": 5.474635892901987, "eval_loss": 5.5089006423950195, "eval_mean_token_accuracy": 0.18679746414583032, "eval_num_tokens": 26765602.0, "eval_runtime": 23.9588, "eval_samples_per_second": 1294.432, "eval_steps_per_second": 161.82, "step": 12000 }, { "entropy": 5.619168281555176, "epoch": 1.3482899983152694, "grad_norm": 1.6875, "learning_rate": 0.0004828721265942861, "loss": 5.3781, "mean_token_accuracy": 0.18612894862890245, "num_tokens": 26776867.0, "step": 12005 }, { "entropy": 5.525385332107544, "epoch": 1.3488515752232269, "grad_norm": 1.7421875, "learning_rate": 0.00048285675870446653, "loss": 5.3686, "mean_token_accuracy": 0.18679242134094237, "num_tokens": 26786383.0, "step": 12010 }, { "entropy": 5.659783935546875, "epoch": 1.3494131521311843, "grad_norm": 1.4453125, "learning_rate": 0.00048284138419640724, "loss": 5.5115, "mean_token_accuracy": 0.1743268057703972, "num_tokens": 26797647.0, "step": 12015 }, { "entropy": 5.650413465499878, "epoch": 1.349974729039142, "grad_norm": 1.5, "learning_rate": 0.0004828260030705976, "loss": 5.364, "mean_token_accuracy": 0.1815338224172592, "num_tokens": 26808674.0, "step": 12020 }, { "entropy": 5.514647388458252, "epoch": 1.3505363059470994, "grad_norm": 1.3828125, "learning_rate": 0.00048281061532752734, "loss": 5.2714, "mean_token_accuracy": 0.1890656590461731, "num_tokens": 26820858.0, "step": 12025 }, { "entropy": 5.549510478973389, "epoch": 1.351097882855057, "grad_norm": 1.390625, "learning_rate": 0.0004827952209676866, "loss": 5.3452, "mean_token_accuracy": 0.18801091462373734, "num_tokens": 26831432.0, "step": 12030 }, { "entropy": 5.600547218322754, "epoch": 1.3516594597630145, "grad_norm": 1.4765625, "learning_rate": 0.00048277981999156534, "loss": 5.4652, "mean_token_accuracy": 0.18412834256887436, "num_tokens": 26843240.0, "step": 12035 }, { "entropy": 5.650083303451538, "epoch": 1.3522210366709722, "grad_norm": 1.4296875, "learning_rate": 0.00048276441239965414, "loss": 5.4694, "mean_token_accuracy": 0.18023325204849244, "num_tokens": 26853556.0, "step": 12040 }, { "entropy": 5.595720195770264, "epoch": 1.3527826135789296, "grad_norm": 1.453125, "learning_rate": 0.0004827489981924434, "loss": 5.4097, "mean_token_accuracy": 0.18325205147266388, "num_tokens": 26866040.0, "step": 12045 }, { "entropy": 5.494285726547242, "epoch": 1.3533441904868873, "grad_norm": 1.5859375, "learning_rate": 0.00048273357737042393, "loss": 5.263, "mean_token_accuracy": 0.18558333963155746, "num_tokens": 26876796.0, "step": 12050 }, { "entropy": 5.495880937576294, "epoch": 1.3539057673948447, "grad_norm": 1.34375, "learning_rate": 0.00048271814993408694, "loss": 5.4558, "mean_token_accuracy": 0.17964325249195098, "num_tokens": 26888081.0, "step": 12055 }, { "entropy": 5.584234189987183, "epoch": 1.3544673443028024, "grad_norm": 1.4765625, "learning_rate": 0.0004827027158839233, "loss": 5.422, "mean_token_accuracy": 0.17885801792144776, "num_tokens": 26898511.0, "step": 12060 }, { "entropy": 5.638433265686035, "epoch": 1.3550289212107598, "grad_norm": 1.34375, "learning_rate": 0.0004826872752204248, "loss": 5.4271, "mean_token_accuracy": 0.18308894336223602, "num_tokens": 26909525.0, "step": 12065 }, { "entropy": 5.599750947952271, "epoch": 1.3555904981187172, "grad_norm": 1.53125, "learning_rate": 0.00048267182794408276, "loss": 5.4611, "mean_token_accuracy": 0.18938700258731841, "num_tokens": 26920267.0, "step": 12070 }, { "entropy": 5.596344470977783, "epoch": 1.356152075026675, "grad_norm": 1.7578125, "learning_rate": 0.0004826563740553893, "loss": 5.4296, "mean_token_accuracy": 0.18646478950977324, "num_tokens": 26931351.0, "step": 12075 }, { "entropy": 5.497289943695068, "epoch": 1.3567136519346326, "grad_norm": 1.34375, "learning_rate": 0.0004826409135548363, "loss": 5.3661, "mean_token_accuracy": 0.17962656319141387, "num_tokens": 26942235.0, "step": 12080 }, { "entropy": 5.645137453079224, "epoch": 1.35727522884259, "grad_norm": 1.3125, "learning_rate": 0.0004826254464429161, "loss": 5.5326, "mean_token_accuracy": 0.1759307160973549, "num_tokens": 26953375.0, "step": 12085 }, { "entropy": 5.621385192871093, "epoch": 1.3578368057505474, "grad_norm": 1.546875, "learning_rate": 0.00048260997272012114, "loss": 5.4295, "mean_token_accuracy": 0.18265892565250397, "num_tokens": 26965081.0, "step": 12090 }, { "entropy": 5.610290002822876, "epoch": 1.358398382658505, "grad_norm": 1.5078125, "learning_rate": 0.0004825944923869441, "loss": 5.4589, "mean_token_accuracy": 0.1742696687579155, "num_tokens": 26975428.0, "step": 12095 }, { "entropy": 5.584657144546509, "epoch": 1.3589599595664628, "grad_norm": 1.671875, "learning_rate": 0.00048257900544387795, "loss": 5.3793, "mean_token_accuracy": 0.18407012820243834, "num_tokens": 26987040.0, "step": 12100 }, { "entropy": 5.59127950668335, "epoch": 1.3595215364744202, "grad_norm": 1.375, "learning_rate": 0.00048256351189141574, "loss": 5.4826, "mean_token_accuracy": 0.17611093670129777, "num_tokens": 26997931.0, "step": 12105 }, { "entropy": 5.63390531539917, "epoch": 1.3600831133823776, "grad_norm": 1.625, "learning_rate": 0.0004825480117300508, "loss": 5.3812, "mean_token_accuracy": 0.1833555981516838, "num_tokens": 27009528.0, "step": 12110 }, { "entropy": 5.441861200332641, "epoch": 1.3606446902903353, "grad_norm": 1.7265625, "learning_rate": 0.00048253250496027675, "loss": 5.2788, "mean_token_accuracy": 0.19329649358987808, "num_tokens": 27020161.0, "step": 12115 }, { "entropy": 5.574842214584351, "epoch": 1.3612062671982927, "grad_norm": 1.5546875, "learning_rate": 0.00048251699158258714, "loss": 5.4026, "mean_token_accuracy": 0.18437140434980392, "num_tokens": 27032246.0, "step": 12120 }, { "entropy": 5.6189673900604244, "epoch": 1.3617678441062504, "grad_norm": 1.3984375, "learning_rate": 0.0004825014715974761, "loss": 5.4676, "mean_token_accuracy": 0.18131349235773087, "num_tokens": 27042903.0, "step": 12125 }, { "entropy": 5.668713092803955, "epoch": 1.3623294210142078, "grad_norm": 1.4921875, "learning_rate": 0.00048248594500543767, "loss": 5.5788, "mean_token_accuracy": 0.17454876899719238, "num_tokens": 27054854.0, "step": 12130 }, { "entropy": 5.61062593460083, "epoch": 1.3628909979221655, "grad_norm": 1.359375, "learning_rate": 0.00048247041180696633, "loss": 5.401, "mean_token_accuracy": 0.19103506803512574, "num_tokens": 27065021.0, "step": 12135 }, { "entropy": 5.56108980178833, "epoch": 1.363452574830123, "grad_norm": 1.9921875, "learning_rate": 0.0004824548720025566, "loss": 5.4468, "mean_token_accuracy": 0.17915666699409485, "num_tokens": 27075717.0, "step": 12140 }, { "entropy": 5.608147001266479, "epoch": 1.3640141517380806, "grad_norm": 1.6484375, "learning_rate": 0.0004824393255927033, "loss": 5.5546, "mean_token_accuracy": 0.1782521888613701, "num_tokens": 27087310.0, "step": 12145 }, { "entropy": 5.69928469657898, "epoch": 1.364575728646038, "grad_norm": 1.3515625, "learning_rate": 0.00048242377257790145, "loss": 5.5615, "mean_token_accuracy": 0.1710447758436203, "num_tokens": 27100218.0, "step": 12150 }, { "entropy": 5.532822942733764, "epoch": 1.3651373055539957, "grad_norm": 1.4375, "learning_rate": 0.00048240821295864614, "loss": 5.3169, "mean_token_accuracy": 0.18881547152996064, "num_tokens": 27111548.0, "step": 12155 }, { "entropy": 5.564854431152344, "epoch": 1.3656988824619531, "grad_norm": 1.8828125, "learning_rate": 0.000482392646735433, "loss": 5.4586, "mean_token_accuracy": 0.18205681890249253, "num_tokens": 27123434.0, "step": 12160 }, { "entropy": 5.627358484268188, "epoch": 1.3662604593699106, "grad_norm": 1.3515625, "learning_rate": 0.0004823770739087574, "loss": 5.4814, "mean_token_accuracy": 0.18017132431268693, "num_tokens": 27135936.0, "step": 12165 }, { "entropy": 5.766518306732178, "epoch": 1.3668220362778682, "grad_norm": 1.53125, "learning_rate": 0.0004823614944791154, "loss": 5.6394, "mean_token_accuracy": 0.17236140221357346, "num_tokens": 27148240.0, "step": 12170 }, { "entropy": 5.628880310058594, "epoch": 1.367383613185826, "grad_norm": 1.625, "learning_rate": 0.0004823459084470031, "loss": 5.3949, "mean_token_accuracy": 0.18684293627738952, "num_tokens": 27159057.0, "step": 12175 }, { "entropy": 5.5123375415802, "epoch": 1.3679451900937833, "grad_norm": 1.5859375, "learning_rate": 0.0004823303158129165, "loss": 5.4063, "mean_token_accuracy": 0.18343780785799027, "num_tokens": 27169189.0, "step": 12180 }, { "entropy": 5.538809442520142, "epoch": 1.3685067670017408, "grad_norm": 1.5390625, "learning_rate": 0.0004823147165773523, "loss": 5.3756, "mean_token_accuracy": 0.18663349747657776, "num_tokens": 27180777.0, "step": 12185 }, { "entropy": 5.608754634857178, "epoch": 1.3690683439096984, "grad_norm": 1.484375, "learning_rate": 0.00048229911074080715, "loss": 5.4179, "mean_token_accuracy": 0.1894705057144165, "num_tokens": 27190991.0, "step": 12190 }, { "entropy": 5.571418428421021, "epoch": 1.369629920817656, "grad_norm": 1.859375, "learning_rate": 0.00048228349830377787, "loss": 5.4526, "mean_token_accuracy": 0.17986156195402145, "num_tokens": 27203776.0, "step": 12195 }, { "entropy": 5.492271375656128, "epoch": 1.3701914977256135, "grad_norm": 1.765625, "learning_rate": 0.00048226787926676165, "loss": 5.3669, "mean_token_accuracy": 0.18599619418382646, "num_tokens": 27213533.0, "step": 12200 }, { "entropy": 5.615678501129151, "epoch": 1.370753074633571, "grad_norm": 1.546875, "learning_rate": 0.00048225225363025576, "loss": 5.4857, "mean_token_accuracy": 0.17912229895591736, "num_tokens": 27224832.0, "step": 12205 }, { "entropy": 5.665140295028687, "epoch": 1.3713146515415287, "grad_norm": 1.6015625, "learning_rate": 0.00048223662139475773, "loss": 5.5298, "mean_token_accuracy": 0.17312545627355574, "num_tokens": 27237313.0, "step": 12210 }, { "entropy": 5.6187337875366214, "epoch": 1.371876228449486, "grad_norm": 1.5, "learning_rate": 0.00048222098256076523, "loss": 5.3418, "mean_token_accuracy": 0.18424533009529115, "num_tokens": 27248159.0, "step": 12215 }, { "entropy": 5.623969841003418, "epoch": 1.3724378053574438, "grad_norm": 2.109375, "learning_rate": 0.0004822053371287763, "loss": 5.4661, "mean_token_accuracy": 0.18050478100776673, "num_tokens": 27259723.0, "step": 12220 }, { "entropy": 5.574584579467773, "epoch": 1.3729993822654012, "grad_norm": 1.5390625, "learning_rate": 0.0004821896850992891, "loss": 5.4104, "mean_token_accuracy": 0.17844849526882173, "num_tokens": 27270207.0, "step": 12225 }, { "entropy": 5.568454647064209, "epoch": 1.3735609591733589, "grad_norm": 1.7265625, "learning_rate": 0.000482174026472802, "loss": 5.4621, "mean_token_accuracy": 0.188611501455307, "num_tokens": 27281243.0, "step": 12230 }, { "entropy": 5.4445079326629635, "epoch": 1.3741225360813163, "grad_norm": 1.3671875, "learning_rate": 0.0004821583612498135, "loss": 5.2634, "mean_token_accuracy": 0.18975935131311417, "num_tokens": 27292816.0, "step": 12235 }, { "entropy": 5.51634955406189, "epoch": 1.374684112989274, "grad_norm": 1.4765625, "learning_rate": 0.00048214268943082246, "loss": 5.4411, "mean_token_accuracy": 0.18239236921072005, "num_tokens": 27304254.0, "step": 12240 }, { "entropy": 5.529271507263184, "epoch": 1.3752456898972314, "grad_norm": 1.5859375, "learning_rate": 0.0004821270110163278, "loss": 5.3758, "mean_token_accuracy": 0.17939476817846298, "num_tokens": 27314974.0, "step": 12245 }, { "entropy": 5.587137651443482, "epoch": 1.375807266805189, "grad_norm": 2.15625, "learning_rate": 0.0004821113260068288, "loss": 5.4711, "mean_token_accuracy": 0.17995233684778214, "num_tokens": 27326051.0, "step": 12250 }, { "entropy": 5.519277620315552, "epoch": 1.3763688437131465, "grad_norm": 1.6875, "learning_rate": 0.0004820956344028249, "loss": 5.3203, "mean_token_accuracy": 0.18622014671564102, "num_tokens": 27337589.0, "step": 12255 }, { "entropy": 5.579274892807007, "epoch": 1.376930420621104, "grad_norm": 1.4140625, "learning_rate": 0.00048207993620481566, "loss": 5.4029, "mean_token_accuracy": 0.18406821340322493, "num_tokens": 27348581.0, "step": 12260 }, { "entropy": 5.6482140064239506, "epoch": 1.3774919975290616, "grad_norm": 1.8515625, "learning_rate": 0.0004820642314133009, "loss": 5.5, "mean_token_accuracy": 0.1824349656701088, "num_tokens": 27359963.0, "step": 12265 }, { "entropy": 5.583898305892944, "epoch": 1.3780535744370193, "grad_norm": 1.3203125, "learning_rate": 0.00048204852002878073, "loss": 5.3464, "mean_token_accuracy": 0.18646378070116043, "num_tokens": 27370149.0, "step": 12270 }, { "entropy": 5.462600898742676, "epoch": 1.3786151513449767, "grad_norm": 2.0, "learning_rate": 0.00048203280205175544, "loss": 5.3477, "mean_token_accuracy": 0.1911865547299385, "num_tokens": 27381657.0, "step": 12275 }, { "entropy": 5.587764310836792, "epoch": 1.3791767282529341, "grad_norm": 1.484375, "learning_rate": 0.0004820170774827253, "loss": 5.4043, "mean_token_accuracy": 0.17355224043130874, "num_tokens": 27392679.0, "step": 12280 }, { "entropy": 5.503405570983887, "epoch": 1.3797383051608918, "grad_norm": 1.59375, "learning_rate": 0.0004820013463221912, "loss": 5.3837, "mean_token_accuracy": 0.18209337592124938, "num_tokens": 27404003.0, "step": 12285 }, { "entropy": 5.5964930057525635, "epoch": 1.3802998820688495, "grad_norm": 1.75, "learning_rate": 0.000481985608570654, "loss": 5.4163, "mean_token_accuracy": 0.18666171431541442, "num_tokens": 27414593.0, "step": 12290 }, { "entropy": 5.658124732971191, "epoch": 1.380861458976807, "grad_norm": 1.453125, "learning_rate": 0.0004819698642286147, "loss": 5.5594, "mean_token_accuracy": 0.17700323164463044, "num_tokens": 27426549.0, "step": 12295 }, { "entropy": 5.61198239326477, "epoch": 1.3814230358847643, "grad_norm": 1.390625, "learning_rate": 0.00048195411329657464, "loss": 5.5078, "mean_token_accuracy": 0.1794409230351448, "num_tokens": 27439451.0, "step": 12300 }, { "entropy": 5.658680152893067, "epoch": 1.381984612792722, "grad_norm": 1.4375, "learning_rate": 0.0004819383557750353, "loss": 5.4367, "mean_token_accuracy": 0.18478858917951585, "num_tokens": 27451153.0, "step": 12305 }, { "entropy": 5.594944858551026, "epoch": 1.3825461897006794, "grad_norm": 1.3984375, "learning_rate": 0.00048192259166449845, "loss": 5.3848, "mean_token_accuracy": 0.18378443419933319, "num_tokens": 27462229.0, "step": 12310 }, { "entropy": 5.531543779373169, "epoch": 1.383107766608637, "grad_norm": 2.078125, "learning_rate": 0.00048190682096546606, "loss": 5.3906, "mean_token_accuracy": 0.18350973427295686, "num_tokens": 27473901.0, "step": 12315 }, { "entropy": 5.493347024917602, "epoch": 1.3836693435165945, "grad_norm": 1.71875, "learning_rate": 0.00048189104367844034, "loss": 5.3864, "mean_token_accuracy": 0.1844016879796982, "num_tokens": 27485981.0, "step": 12320 }, { "entropy": 5.548513746261596, "epoch": 1.3842309204245522, "grad_norm": 1.5390625, "learning_rate": 0.00048187525980392343, "loss": 5.3151, "mean_token_accuracy": 0.1873913511633873, "num_tokens": 27495764.0, "step": 12325 }, { "entropy": 5.561328363418579, "epoch": 1.3847924973325096, "grad_norm": 2.28125, "learning_rate": 0.000481859469342418, "loss": 5.4035, "mean_token_accuracy": 0.185747367143631, "num_tokens": 27506602.0, "step": 12330 }, { "entropy": 5.430418491363525, "epoch": 1.3853540742404673, "grad_norm": 1.3203125, "learning_rate": 0.0004818436722944269, "loss": 5.3569, "mean_token_accuracy": 0.184988309442997, "num_tokens": 27517482.0, "step": 12335 }, { "entropy": 5.559353876113891, "epoch": 1.3859156511484247, "grad_norm": 1.34375, "learning_rate": 0.0004818278686604531, "loss": 5.4023, "mean_token_accuracy": 0.18987395912408828, "num_tokens": 27528560.0, "step": 12340 }, { "entropy": 5.590506649017334, "epoch": 1.3864772280563824, "grad_norm": 1.59375, "learning_rate": 0.0004818120584409996, "loss": 5.4171, "mean_token_accuracy": 0.18152203857898713, "num_tokens": 27540019.0, "step": 12345 }, { "entropy": 5.635791635513305, "epoch": 1.3870388049643398, "grad_norm": 1.4140625, "learning_rate": 0.0004817962416365701, "loss": 5.4703, "mean_token_accuracy": 0.1841760665178299, "num_tokens": 27550553.0, "step": 12350 }, { "entropy": 5.652179098129272, "epoch": 1.3876003818722973, "grad_norm": 1.6640625, "learning_rate": 0.00048178041824766796, "loss": 5.3921, "mean_token_accuracy": 0.18463724851608276, "num_tokens": 27562169.0, "step": 12355 }, { "entropy": 5.573112106323242, "epoch": 1.388161958780255, "grad_norm": 1.609375, "learning_rate": 0.0004817645882747971, "loss": 5.3501, "mean_token_accuracy": 0.18608878701925277, "num_tokens": 27571732.0, "step": 12360 }, { "entropy": 5.548039531707763, "epoch": 1.3887235356882126, "grad_norm": 1.4296875, "learning_rate": 0.0004817487517184616, "loss": 5.3879, "mean_token_accuracy": 0.18541265428066253, "num_tokens": 27584394.0, "step": 12365 }, { "entropy": 5.508686971664429, "epoch": 1.38928511259617, "grad_norm": 1.515625, "learning_rate": 0.0004817329085791657, "loss": 5.3564, "mean_token_accuracy": 0.19151072800159455, "num_tokens": 27594813.0, "step": 12370 }, { "entropy": 5.497928047180176, "epoch": 1.3898466895041275, "grad_norm": 1.5234375, "learning_rate": 0.0004817170588574138, "loss": 5.3126, "mean_token_accuracy": 0.19099864661693572, "num_tokens": 27605375.0, "step": 12375 }, { "entropy": 5.497993659973145, "epoch": 1.3904082664120851, "grad_norm": 1.4296875, "learning_rate": 0.0004817012025537105, "loss": 5.3271, "mean_token_accuracy": 0.18947082310914992, "num_tokens": 27617066.0, "step": 12380 }, { "entropy": 5.597756481170654, "epoch": 1.3909698433200428, "grad_norm": 1.59375, "learning_rate": 0.0004816853396685608, "loss": 5.4817, "mean_token_accuracy": 0.18175812810659409, "num_tokens": 27628667.0, "step": 12385 }, { "entropy": 5.560773801803589, "epoch": 1.3915314202280002, "grad_norm": 1.53125, "learning_rate": 0.00048166947020246973, "loss": 5.4373, "mean_token_accuracy": 0.18439250141382219, "num_tokens": 27638858.0, "step": 12390 }, { "entropy": 5.639008903503418, "epoch": 1.3920929971359577, "grad_norm": 1.1796875, "learning_rate": 0.00048165359415594245, "loss": 5.5106, "mean_token_accuracy": 0.18048693388700485, "num_tokens": 27650518.0, "step": 12395 }, { "entropy": 5.587079381942749, "epoch": 1.3926545740439153, "grad_norm": 1.6640625, "learning_rate": 0.00048163771152948473, "loss": 5.4689, "mean_token_accuracy": 0.18535237908363342, "num_tokens": 27661781.0, "step": 12400 }, { "entropy": 5.548201274871826, "epoch": 1.3932161509518728, "grad_norm": 1.296875, "learning_rate": 0.000481621822323602, "loss": 5.4116, "mean_token_accuracy": 0.1857258066534996, "num_tokens": 27673040.0, "step": 12405 }, { "entropy": 5.57417516708374, "epoch": 1.3937777278598305, "grad_norm": 1.7109375, "learning_rate": 0.0004816059265388004, "loss": 5.4514, "mean_token_accuracy": 0.1865248292684555, "num_tokens": 27683541.0, "step": 12410 }, { "entropy": 5.655316543579102, "epoch": 1.394339304767788, "grad_norm": 1.3828125, "learning_rate": 0.00048159002417558596, "loss": 5.4949, "mean_token_accuracy": 0.1792720377445221, "num_tokens": 27693648.0, "step": 12415 }, { "entropy": 5.596675729751587, "epoch": 1.3949008816757456, "grad_norm": 1.4140625, "learning_rate": 0.0004815741152344651, "loss": 5.322, "mean_token_accuracy": 0.18869377970695494, "num_tokens": 27703920.0, "step": 12420 }, { "entropy": 5.652033138275146, "epoch": 1.395462458583703, "grad_norm": 1.5859375, "learning_rate": 0.0004815581997159442, "loss": 5.4572, "mean_token_accuracy": 0.17444158643484114, "num_tokens": 27715869.0, "step": 12425 }, { "entropy": 5.5294694900512695, "epoch": 1.3960240354916607, "grad_norm": 1.4375, "learning_rate": 0.00048154227762053003, "loss": 5.402, "mean_token_accuracy": 0.18923304080963135, "num_tokens": 27726727.0, "step": 12430 }, { "entropy": 5.565631341934204, "epoch": 1.396585612399618, "grad_norm": 1.4609375, "learning_rate": 0.0004815263489487298, "loss": 5.3971, "mean_token_accuracy": 0.18441684991121293, "num_tokens": 27738217.0, "step": 12435 }, { "entropy": 5.597028398513794, "epoch": 1.3971471893075758, "grad_norm": 1.578125, "learning_rate": 0.0004815104137010504, "loss": 5.4008, "mean_token_accuracy": 0.183449324965477, "num_tokens": 27749022.0, "step": 12440 }, { "entropy": 5.541413402557373, "epoch": 1.3977087662155332, "grad_norm": 1.671875, "learning_rate": 0.0004814944718779993, "loss": 5.3621, "mean_token_accuracy": 0.18739566802978516, "num_tokens": 27760589.0, "step": 12445 }, { "entropy": 5.665905904769898, "epoch": 1.3982703431234906, "grad_norm": 1.8984375, "learning_rate": 0.0004814785234800843, "loss": 5.4442, "mean_token_accuracy": 0.18137060031294822, "num_tokens": 27772460.0, "step": 12450 }, { "entropy": 5.499793148040771, "epoch": 1.3988319200314483, "grad_norm": 1.421875, "learning_rate": 0.00048146256850781287, "loss": 5.3198, "mean_token_accuracy": 0.1835328683257103, "num_tokens": 27783921.0, "step": 12455 }, { "entropy": 5.597337436676026, "epoch": 1.399393496939406, "grad_norm": 1.4765625, "learning_rate": 0.00048144660696169327, "loss": 5.4682, "mean_token_accuracy": 0.1830869808793068, "num_tokens": 27794843.0, "step": 12460 }, { "entropy": 5.643671464920044, "epoch": 1.3999550738473634, "grad_norm": 1.5234375, "learning_rate": 0.00048143063884223365, "loss": 5.364, "mean_token_accuracy": 0.1830323278903961, "num_tokens": 27805973.0, "step": 12465 }, { "entropy": 5.555152940750122, "epoch": 1.4005166507553208, "grad_norm": 1.5546875, "learning_rate": 0.0004814146641499424, "loss": 5.4186, "mean_token_accuracy": 0.18221746683120726, "num_tokens": 27816916.0, "step": 12470 }, { "entropy": 5.5165797710418705, "epoch": 1.4010782276632785, "grad_norm": 1.6953125, "learning_rate": 0.00048139868288532816, "loss": 5.4158, "mean_token_accuracy": 0.18309104293584824, "num_tokens": 27828077.0, "step": 12475 }, { "entropy": 5.526023244857788, "epoch": 1.4016398045712362, "grad_norm": 1.90625, "learning_rate": 0.0004813826950488998, "loss": 5.3147, "mean_token_accuracy": 0.18483598977327348, "num_tokens": 27838502.0, "step": 12480 }, { "entropy": 5.578309106826782, "epoch": 1.4022013814791936, "grad_norm": 1.8203125, "learning_rate": 0.00048136670064116645, "loss": 5.4476, "mean_token_accuracy": 0.17935547083616257, "num_tokens": 27850125.0, "step": 12485 }, { "entropy": 5.602385520935059, "epoch": 1.402762958387151, "grad_norm": 1.3515625, "learning_rate": 0.0004813506996626373, "loss": 5.3996, "mean_token_accuracy": 0.18731053471565245, "num_tokens": 27861099.0, "step": 12490 }, { "entropy": 5.608717012405395, "epoch": 1.4033245352951087, "grad_norm": 2.6875, "learning_rate": 0.0004813346921138218, "loss": 5.3996, "mean_token_accuracy": 0.18824754655361176, "num_tokens": 27872769.0, "step": 12495 }, { "entropy": 5.632760953903198, "epoch": 1.4038861122030661, "grad_norm": 2.046875, "learning_rate": 0.0004813186779952297, "loss": 5.4829, "mean_token_accuracy": 0.1809535726904869, "num_tokens": 27884448.0, "step": 12500 }, { "entropy": 5.465057134628296, "epoch": 1.4044476891110238, "grad_norm": 1.5, "learning_rate": 0.0004813026573073708, "loss": 5.3272, "mean_token_accuracy": 0.17773733884096146, "num_tokens": 27894074.0, "step": 12505 }, { "entropy": 5.678692483901978, "epoch": 1.4050092660189812, "grad_norm": 2.125, "learning_rate": 0.0004812866300507554, "loss": 5.5052, "mean_token_accuracy": 0.18612149655818938, "num_tokens": 27905150.0, "step": 12510 }, { "entropy": 5.655053567886353, "epoch": 1.405570842926939, "grad_norm": 1.4453125, "learning_rate": 0.0004812705962258936, "loss": 5.4147, "mean_token_accuracy": 0.1827722519636154, "num_tokens": 27916471.0, "step": 12515 }, { "entropy": 5.563557434082031, "epoch": 1.4061324198348963, "grad_norm": 2.015625, "learning_rate": 0.0004812545558332961, "loss": 5.3875, "mean_token_accuracy": 0.18819346278905869, "num_tokens": 27928276.0, "step": 12520 }, { "entropy": 5.621595621109009, "epoch": 1.406693996742854, "grad_norm": 1.6640625, "learning_rate": 0.00048123850887347346, "loss": 5.4148, "mean_token_accuracy": 0.17566152215003966, "num_tokens": 27940417.0, "step": 12525 }, { "entropy": 5.474638271331787, "epoch": 1.4072555736508114, "grad_norm": 1.46875, "learning_rate": 0.00048122245534693676, "loss": 5.2741, "mean_token_accuracy": 0.19022467583417893, "num_tokens": 27950490.0, "step": 12530 }, { "entropy": 5.6266542911529545, "epoch": 1.407817150558769, "grad_norm": 2.28125, "learning_rate": 0.0004812063952541971, "loss": 5.4814, "mean_token_accuracy": 0.17631009668111802, "num_tokens": 27962593.0, "step": 12535 }, { "entropy": 5.678593349456787, "epoch": 1.4083787274667265, "grad_norm": 1.4765625, "learning_rate": 0.00048119032859576577, "loss": 5.5351, "mean_token_accuracy": 0.1745996281504631, "num_tokens": 27973567.0, "step": 12540 }, { "entropy": 5.501290893554687, "epoch": 1.408940304374684, "grad_norm": 1.6484375, "learning_rate": 0.0004811742553721545, "loss": 5.3323, "mean_token_accuracy": 0.1903274819254875, "num_tokens": 27984383.0, "step": 12545 }, { "entropy": 5.646518278121948, "epoch": 1.4095018812826416, "grad_norm": 2.0, "learning_rate": 0.00048115817558387494, "loss": 5.4665, "mean_token_accuracy": 0.17970054000616073, "num_tokens": 27995735.0, "step": 12550 }, { "entropy": 5.6405247211456295, "epoch": 1.4100634581905993, "grad_norm": 1.453125, "learning_rate": 0.0004811420892314391, "loss": 5.5232, "mean_token_accuracy": 0.17082713842391967, "num_tokens": 28008261.0, "step": 12555 }, { "entropy": 5.518653488159179, "epoch": 1.4106250350985567, "grad_norm": 1.828125, "learning_rate": 0.0004811259963153592, "loss": 5.3617, "mean_token_accuracy": 0.18512748330831527, "num_tokens": 28019424.0, "step": 12560 }, { "entropy": 5.602254915237427, "epoch": 1.4111866120065142, "grad_norm": 1.6484375, "learning_rate": 0.0004811098968361476, "loss": 5.4736, "mean_token_accuracy": 0.18438162207603453, "num_tokens": 28030961.0, "step": 12565 }, { "entropy": 5.580341243743897, "epoch": 1.4117481889144718, "grad_norm": 1.8125, "learning_rate": 0.000481093790794317, "loss": 5.4445, "mean_token_accuracy": 0.17799729555845262, "num_tokens": 28042580.0, "step": 12570 }, { "entropy": 5.760495996475219, "epoch": 1.4123097658224295, "grad_norm": 1.4453125, "learning_rate": 0.0004810776781903801, "loss": 5.5708, "mean_token_accuracy": 0.1800316646695137, "num_tokens": 28053435.0, "step": 12575 }, { "entropy": 5.72199559211731, "epoch": 1.412871342730387, "grad_norm": 1.6953125, "learning_rate": 0.00048106155902485003, "loss": 5.543, "mean_token_accuracy": 0.17407634854316711, "num_tokens": 28065195.0, "step": 12580 }, { "entropy": 5.580473899841309, "epoch": 1.4134329196383444, "grad_norm": 1.4140625, "learning_rate": 0.0004810454332982401, "loss": 5.4714, "mean_token_accuracy": 0.18441999405622483, "num_tokens": 28077457.0, "step": 12585 }, { "entropy": 5.530069398880005, "epoch": 1.413994496546302, "grad_norm": 1.6640625, "learning_rate": 0.0004810293010110635, "loss": 5.374, "mean_token_accuracy": 0.18203333616256714, "num_tokens": 28087598.0, "step": 12590 }, { "entropy": 5.564488935470581, "epoch": 1.4145560734542595, "grad_norm": 1.6484375, "learning_rate": 0.0004810131621638342, "loss": 5.3185, "mean_token_accuracy": 0.18823318481445311, "num_tokens": 28097232.0, "step": 12595 }, { "entropy": 5.5692249774932865, "epoch": 1.4151176503622171, "grad_norm": 1.8828125, "learning_rate": 0.00048099701675706583, "loss": 5.4612, "mean_token_accuracy": 0.18515441864728927, "num_tokens": 28107333.0, "step": 12600 }, { "entropy": 5.607000064849854, "epoch": 1.4156792272701746, "grad_norm": 1.6484375, "learning_rate": 0.0004809808647912725, "loss": 5.4363, "mean_token_accuracy": 0.17578344345092772, "num_tokens": 28117886.0, "step": 12605 }, { "entropy": 5.625807571411133, "epoch": 1.4162408041781323, "grad_norm": 1.4453125, "learning_rate": 0.0004809647062669686, "loss": 5.4257, "mean_token_accuracy": 0.18431251794099807, "num_tokens": 28128884.0, "step": 12610 }, { "entropy": 5.611122894287109, "epoch": 1.4168023810860897, "grad_norm": 1.4921875, "learning_rate": 0.00048094854118466856, "loss": 5.5125, "mean_token_accuracy": 0.17216638326644898, "num_tokens": 28139859.0, "step": 12615 }, { "entropy": 5.722675848007202, "epoch": 1.4173639579940474, "grad_norm": 1.640625, "learning_rate": 0.00048093236954488715, "loss": 5.4578, "mean_token_accuracy": 0.18167351186275482, "num_tokens": 28150398.0, "step": 12620 }, { "entropy": 5.565816211700439, "epoch": 1.4179255349020048, "grad_norm": 2.03125, "learning_rate": 0.0004809161913481392, "loss": 5.3456, "mean_token_accuracy": 0.19193344712257385, "num_tokens": 28160766.0, "step": 12625 }, { "entropy": 5.537726974487304, "epoch": 1.4184871118099625, "grad_norm": 1.671875, "learning_rate": 0.00048090000659493985, "loss": 5.4534, "mean_token_accuracy": 0.1803365468978882, "num_tokens": 28171583.0, "step": 12630 }, { "entropy": 5.526329898834229, "epoch": 1.41904868871792, "grad_norm": 1.734375, "learning_rate": 0.00048088381528580445, "loss": 5.2915, "mean_token_accuracy": 0.1874199703335762, "num_tokens": 28183598.0, "step": 12635 }, { "entropy": 5.602271223068238, "epoch": 1.4196102656258773, "grad_norm": 1.96875, "learning_rate": 0.00048086761742124846, "loss": 5.4352, "mean_token_accuracy": 0.17657459378242493, "num_tokens": 28193377.0, "step": 12640 }, { "entropy": 5.519383335113526, "epoch": 1.420171842533835, "grad_norm": 1.40625, "learning_rate": 0.00048085141300178774, "loss": 5.3145, "mean_token_accuracy": 0.19562322795391082, "num_tokens": 28204536.0, "step": 12645 }, { "entropy": 5.523086929321289, "epoch": 1.4207334194417927, "grad_norm": 1.359375, "learning_rate": 0.00048083520202793815, "loss": 5.4666, "mean_token_accuracy": 0.18537127673625947, "num_tokens": 28215806.0, "step": 12650 }, { "entropy": 5.608553647994995, "epoch": 1.42129499634975, "grad_norm": 1.5, "learning_rate": 0.0004808189845002159, "loss": 5.4048, "mean_token_accuracy": 0.1814317598938942, "num_tokens": 28226765.0, "step": 12655 }, { "entropy": 5.74329023361206, "epoch": 1.4218565732577075, "grad_norm": 1.6796875, "learning_rate": 0.0004808027604191374, "loss": 5.5899, "mean_token_accuracy": 0.17849552035331726, "num_tokens": 28238077.0, "step": 12660 }, { "entropy": 5.542377138137818, "epoch": 1.4224181501656652, "grad_norm": 1.3046875, "learning_rate": 0.00048078652978521914, "loss": 5.4332, "mean_token_accuracy": 0.1853796973824501, "num_tokens": 28248992.0, "step": 12665 }, { "entropy": 5.575919246673584, "epoch": 1.4229797270736229, "grad_norm": 2.15625, "learning_rate": 0.00048077029259897797, "loss": 5.403, "mean_token_accuracy": 0.18549903780221938, "num_tokens": 28259818.0, "step": 12670 }, { "entropy": 5.549159860610962, "epoch": 1.4235413039815803, "grad_norm": 1.421875, "learning_rate": 0.00048075404886093094, "loss": 5.3757, "mean_token_accuracy": 0.1832862064242363, "num_tokens": 28271139.0, "step": 12675 }, { "entropy": 5.616514015197754, "epoch": 1.4241028808895377, "grad_norm": 1.5546875, "learning_rate": 0.00048073779857159504, "loss": 5.4163, "mean_token_accuracy": 0.18590553998947143, "num_tokens": 28282093.0, "step": 12680 }, { "entropy": 5.550446653366089, "epoch": 1.4246644577974954, "grad_norm": 1.53125, "learning_rate": 0.000480721541731488, "loss": 5.3172, "mean_token_accuracy": 0.19124546498060227, "num_tokens": 28292701.0, "step": 12685 }, { "entropy": 5.481839513778686, "epoch": 1.4252260347054528, "grad_norm": 1.4375, "learning_rate": 0.00048070527834112727, "loss": 5.365, "mean_token_accuracy": 0.18471651673316955, "num_tokens": 28303585.0, "step": 12690 }, { "entropy": 5.536582088470459, "epoch": 1.4257876116134105, "grad_norm": 1.734375, "learning_rate": 0.0004806890084010306, "loss": 5.3138, "mean_token_accuracy": 0.1883379191160202, "num_tokens": 28314583.0, "step": 12695 }, { "entropy": 5.511456155776978, "epoch": 1.426349188521368, "grad_norm": 1.4453125, "learning_rate": 0.00048067273191171615, "loss": 5.3755, "mean_token_accuracy": 0.1849355146288872, "num_tokens": 28325895.0, "step": 12700 }, { "entropy": 5.630955028533935, "epoch": 1.4269107654293256, "grad_norm": 1.859375, "learning_rate": 0.0004806564488737022, "loss": 5.4393, "mean_token_accuracy": 0.17738497406244277, "num_tokens": 28337011.0, "step": 12705 }, { "entropy": 5.73394136428833, "epoch": 1.427472342337283, "grad_norm": 1.65625, "learning_rate": 0.0004806401592875071, "loss": 5.4884, "mean_token_accuracy": 0.17780508249998092, "num_tokens": 28347468.0, "step": 12710 }, { "entropy": 5.582927083969116, "epoch": 1.4280339192452407, "grad_norm": 1.484375, "learning_rate": 0.00048062386315364964, "loss": 5.409, "mean_token_accuracy": 0.1885148122906685, "num_tokens": 28357287.0, "step": 12715 }, { "entropy": 5.632099342346192, "epoch": 1.4285954961531981, "grad_norm": 1.3046875, "learning_rate": 0.0004806075604726485, "loss": 5.4255, "mean_token_accuracy": 0.19006743729114534, "num_tokens": 28368508.0, "step": 12720 }, { "entropy": 5.629025793075561, "epoch": 1.4291570730611558, "grad_norm": 1.3203125, "learning_rate": 0.00048059125124502304, "loss": 5.3773, "mean_token_accuracy": 0.18756729513406753, "num_tokens": 28378211.0, "step": 12725 }, { "entropy": 5.47719259262085, "epoch": 1.4297186499691132, "grad_norm": 1.2734375, "learning_rate": 0.0004805749354712924, "loss": 5.3437, "mean_token_accuracy": 0.1933674082159996, "num_tokens": 28389083.0, "step": 12730 }, { "entropy": 5.546667385101318, "epoch": 1.4302802268770707, "grad_norm": 1.3359375, "learning_rate": 0.000480558613151976, "loss": 5.3948, "mean_token_accuracy": 0.18546858429908752, "num_tokens": 28399786.0, "step": 12735 }, { "entropy": 5.515288591384888, "epoch": 1.4308418037850283, "grad_norm": 1.3203125, "learning_rate": 0.0004805422842875936, "loss": 5.4403, "mean_token_accuracy": 0.17986469864845275, "num_tokens": 28410650.0, "step": 12740 }, { "entropy": 5.658247184753418, "epoch": 1.431403380692986, "grad_norm": 1.40625, "learning_rate": 0.00048052594887866524, "loss": 5.4536, "mean_token_accuracy": 0.18518347442150115, "num_tokens": 28421485.0, "step": 12745 }, { "entropy": 5.559001684188843, "epoch": 1.4319649576009434, "grad_norm": 1.578125, "learning_rate": 0.00048050960692571086, "loss": 5.4078, "mean_token_accuracy": 0.17889249175786973, "num_tokens": 28432469.0, "step": 12750 }, { "entropy": 5.473956680297851, "epoch": 1.4325265345089009, "grad_norm": 1.453125, "learning_rate": 0.000480493258429251, "loss": 5.3408, "mean_token_accuracy": 0.18645906299352646, "num_tokens": 28443628.0, "step": 12755 }, { "entropy": 5.631206893920899, "epoch": 1.4330881114168585, "grad_norm": 1.3828125, "learning_rate": 0.000480476903389806, "loss": 5.4609, "mean_token_accuracy": 0.17793752402067184, "num_tokens": 28455106.0, "step": 12760 }, { "entropy": 5.617642450332641, "epoch": 1.4336496883248162, "grad_norm": 1.625, "learning_rate": 0.0004804605418078968, "loss": 5.4179, "mean_token_accuracy": 0.18299987465143203, "num_tokens": 28466326.0, "step": 12765 }, { "entropy": 5.567136287689209, "epoch": 1.4342112652327736, "grad_norm": 1.7578125, "learning_rate": 0.00048044417368404426, "loss": 5.5462, "mean_token_accuracy": 0.18090612143278123, "num_tokens": 28477490.0, "step": 12770 }, { "entropy": 5.567657136917115, "epoch": 1.434772842140731, "grad_norm": 1.3515625, "learning_rate": 0.00048042779901876946, "loss": 5.3405, "mean_token_accuracy": 0.18477673530578614, "num_tokens": 28489780.0, "step": 12775 }, { "entropy": 5.6495922088623045, "epoch": 1.4353344190486887, "grad_norm": 1.46875, "learning_rate": 0.0004804114178125939, "loss": 5.4825, "mean_token_accuracy": 0.18110819458961486, "num_tokens": 28500335.0, "step": 12780 }, { "entropy": 5.478008508682251, "epoch": 1.4358959959566462, "grad_norm": 1.2734375, "learning_rate": 0.0004803950300660391, "loss": 5.2718, "mean_token_accuracy": 0.1903608411550522, "num_tokens": 28510680.0, "step": 12785 }, { "entropy": 5.486847877502441, "epoch": 1.4364575728646038, "grad_norm": 1.5, "learning_rate": 0.0004803786357796269, "loss": 5.3116, "mean_token_accuracy": 0.18844760060310364, "num_tokens": 28521719.0, "step": 12790 }, { "entropy": 5.55893497467041, "epoch": 1.4370191497725613, "grad_norm": 1.3359375, "learning_rate": 0.00048036223495387934, "loss": 5.4082, "mean_token_accuracy": 0.1853305444121361, "num_tokens": 28531935.0, "step": 12795 }, { "entropy": 5.608813142776489, "epoch": 1.437580726680519, "grad_norm": 1.375, "learning_rate": 0.0004803458275893185, "loss": 5.3988, "mean_token_accuracy": 0.18346945196390152, "num_tokens": 28542529.0, "step": 12800 }, { "entropy": 5.550368213653565, "epoch": 1.4381423035884764, "grad_norm": 1.8125, "learning_rate": 0.0004803294136864669, "loss": 5.4149, "mean_token_accuracy": 0.18546790927648543, "num_tokens": 28554724.0, "step": 12805 }, { "entropy": 5.576000595092774, "epoch": 1.438703880496434, "grad_norm": 2.203125, "learning_rate": 0.00048031299324584716, "loss": 5.3648, "mean_token_accuracy": 0.18881458044052124, "num_tokens": 28565781.0, "step": 12810 }, { "entropy": 5.5950792789459225, "epoch": 1.4392654574043915, "grad_norm": 1.4609375, "learning_rate": 0.000480296566267982, "loss": 5.3744, "mean_token_accuracy": 0.18683136254549026, "num_tokens": 28576186.0, "step": 12815 }, { "entropy": 5.525846147537232, "epoch": 1.4398270343123492, "grad_norm": 1.7109375, "learning_rate": 0.0004802801327533947, "loss": 5.3999, "mean_token_accuracy": 0.18060891479253768, "num_tokens": 28588240.0, "step": 12820 }, { "entropy": 5.628109312057495, "epoch": 1.4403886112203066, "grad_norm": 1.46875, "learning_rate": 0.00048026369270260814, "loss": 5.4325, "mean_token_accuracy": 0.18242243230342864, "num_tokens": 28598240.0, "step": 12825 }, { "entropy": 5.609430503845215, "epoch": 1.440950188128264, "grad_norm": 2.734375, "learning_rate": 0.0004802472461161462, "loss": 5.4613, "mean_token_accuracy": 0.18128970116376877, "num_tokens": 28610091.0, "step": 12830 }, { "entropy": 5.628044462203979, "epoch": 1.4415117650362217, "grad_norm": 1.4296875, "learning_rate": 0.0004802307929945322, "loss": 5.4469, "mean_token_accuracy": 0.18347975760698318, "num_tokens": 28621060.0, "step": 12835 }, { "entropy": 5.635926198959351, "epoch": 1.4420733419441794, "grad_norm": 1.3125, "learning_rate": 0.00048021433333829015, "loss": 5.4789, "mean_token_accuracy": 0.18282741606235503, "num_tokens": 28632027.0, "step": 12840 }, { "entropy": 5.671726369857788, "epoch": 1.4426349188521368, "grad_norm": 1.5703125, "learning_rate": 0.00048019786714794424, "loss": 5.5139, "mean_token_accuracy": 0.183630333840847, "num_tokens": 28643959.0, "step": 12845 }, { "entropy": 5.591601991653443, "epoch": 1.4431964957600942, "grad_norm": 2.015625, "learning_rate": 0.0004801813944240186, "loss": 5.4171, "mean_token_accuracy": 0.1879538491368294, "num_tokens": 28654166.0, "step": 12850 }, { "entropy": 5.6133091926574705, "epoch": 1.443758072668052, "grad_norm": 1.375, "learning_rate": 0.0004801649151670378, "loss": 5.4046, "mean_token_accuracy": 0.18230132460594178, "num_tokens": 28667975.0, "step": 12855 }, { "entropy": 5.492213249206543, "epoch": 1.4443196495760096, "grad_norm": 1.515625, "learning_rate": 0.0004801484293775265, "loss": 5.3787, "mean_token_accuracy": 0.18387535512447356, "num_tokens": 28679333.0, "step": 12860 }, { "entropy": 5.522174453735351, "epoch": 1.444881226483967, "grad_norm": 1.453125, "learning_rate": 0.0004801319370560097, "loss": 5.2824, "mean_token_accuracy": 0.18480635285377503, "num_tokens": 28689333.0, "step": 12865 }, { "entropy": 5.563249206542968, "epoch": 1.4454428033919244, "grad_norm": 1.3984375, "learning_rate": 0.0004801154382030124, "loss": 5.4743, "mean_token_accuracy": 0.16807381361722945, "num_tokens": 28700625.0, "step": 12870 }, { "entropy": 5.6666676044464115, "epoch": 1.446004380299882, "grad_norm": 1.5390625, "learning_rate": 0.00048009893281906004, "loss": 5.4905, "mean_token_accuracy": 0.1777285158634186, "num_tokens": 28711768.0, "step": 12875 }, { "entropy": 5.589005374908448, "epoch": 1.4465659572078395, "grad_norm": 1.390625, "learning_rate": 0.00048008242090467803, "loss": 5.4779, "mean_token_accuracy": 0.1786105677485466, "num_tokens": 28722521.0, "step": 12880 }, { "entropy": 5.579559087753296, "epoch": 1.4471275341157972, "grad_norm": 1.6640625, "learning_rate": 0.0004800659024603923, "loss": 5.422, "mean_token_accuracy": 0.18361022770404817, "num_tokens": 28733293.0, "step": 12885 }, { "entropy": 5.630140066146851, "epoch": 1.4476891110237546, "grad_norm": 1.453125, "learning_rate": 0.00048004937748672864, "loss": 5.4078, "mean_token_accuracy": 0.18235597312450408, "num_tokens": 28744351.0, "step": 12890 }, { "entropy": 5.592684125900268, "epoch": 1.4482506879317123, "grad_norm": 1.390625, "learning_rate": 0.00048003284598421327, "loss": 5.347, "mean_token_accuracy": 0.17893218547105788, "num_tokens": 28755140.0, "step": 12895 }, { "entropy": 5.5412681102752686, "epoch": 1.4488122648396697, "grad_norm": 1.8125, "learning_rate": 0.0004800163079533726, "loss": 5.4643, "mean_token_accuracy": 0.1798962414264679, "num_tokens": 28767161.0, "step": 12900 }, { "entropy": 5.583915328979492, "epoch": 1.4493738417476274, "grad_norm": 1.6015625, "learning_rate": 0.0004799997633947332, "loss": 5.4035, "mean_token_accuracy": 0.18006214052438735, "num_tokens": 28779501.0, "step": 12905 }, { "entropy": 5.656120872497558, "epoch": 1.4499354186555848, "grad_norm": 2.21875, "learning_rate": 0.00047998321230882174, "loss": 5.5706, "mean_token_accuracy": 0.17843035608530045, "num_tokens": 28792021.0, "step": 12910 }, { "entropy": 5.5608038902282715, "epoch": 1.4504969955635425, "grad_norm": 1.6015625, "learning_rate": 0.00047996665469616536, "loss": 5.3407, "mean_token_accuracy": 0.18791882395744325, "num_tokens": 28802445.0, "step": 12915 }, { "entropy": 5.532950925827026, "epoch": 1.4510585724715, "grad_norm": 1.6640625, "learning_rate": 0.00047995009055729114, "loss": 5.3515, "mean_token_accuracy": 0.17671438902616501, "num_tokens": 28813821.0, "step": 12920 }, { "entropy": 5.575395822525024, "epoch": 1.4516201493794574, "grad_norm": 1.546875, "learning_rate": 0.0004799335198927266, "loss": 5.4052, "mean_token_accuracy": 0.18110319525003432, "num_tokens": 28824764.0, "step": 12925 }, { "entropy": 5.645011758804321, "epoch": 1.452181726287415, "grad_norm": 1.3359375, "learning_rate": 0.0004799169427029993, "loss": 5.4385, "mean_token_accuracy": 0.18372306376695632, "num_tokens": 28836720.0, "step": 12930 }, { "entropy": 5.567357015609741, "epoch": 1.4527433031953727, "grad_norm": 1.484375, "learning_rate": 0.00047990035898863706, "loss": 5.3383, "mean_token_accuracy": 0.18835611790418624, "num_tokens": 28848846.0, "step": 12935 }, { "entropy": 5.512576341629028, "epoch": 1.4533048801033301, "grad_norm": 1.828125, "learning_rate": 0.0004798837687501679, "loss": 5.368, "mean_token_accuracy": 0.1866194039583206, "num_tokens": 28859453.0, "step": 12940 }, { "entropy": 5.541036367416382, "epoch": 1.4538664570112876, "grad_norm": 1.7421875, "learning_rate": 0.0004798671719881201, "loss": 5.4521, "mean_token_accuracy": 0.1791348472237587, "num_tokens": 28869447.0, "step": 12945 }, { "entropy": 5.652652931213379, "epoch": 1.4544280339192452, "grad_norm": 1.6953125, "learning_rate": 0.0004798505687030221, "loss": 5.4959, "mean_token_accuracy": 0.18058837205171585, "num_tokens": 28881660.0, "step": 12950 }, { "entropy": 5.6639848232269285, "epoch": 1.454989610827203, "grad_norm": 1.515625, "learning_rate": 0.0004798339588954025, "loss": 5.4952, "mean_token_accuracy": 0.1759917840361595, "num_tokens": 28893128.0, "step": 12955 }, { "entropy": 5.5727091312408445, "epoch": 1.4555511877351603, "grad_norm": 1.5703125, "learning_rate": 0.0004798173425657903, "loss": 5.4054, "mean_token_accuracy": 0.1861330583691597, "num_tokens": 28904323.0, "step": 12960 }, { "entropy": 5.6069197177886965, "epoch": 1.4561127646431178, "grad_norm": 1.8515625, "learning_rate": 0.0004798007197147144, "loss": 5.4407, "mean_token_accuracy": 0.18523162007331848, "num_tokens": 28915672.0, "step": 12965 }, { "entropy": 5.73742413520813, "epoch": 1.4566743415510754, "grad_norm": 1.953125, "learning_rate": 0.0004797840903427042, "loss": 5.5245, "mean_token_accuracy": 0.1795831501483917, "num_tokens": 28926657.0, "step": 12970 }, { "entropy": 5.563154983520508, "epoch": 1.4572359184590329, "grad_norm": 1.6953125, "learning_rate": 0.00047976745445028906, "loss": 5.3409, "mean_token_accuracy": 0.18444264233112334, "num_tokens": 28938787.0, "step": 12975 }, { "entropy": 5.519552993774414, "epoch": 1.4577974953669905, "grad_norm": 1.8359375, "learning_rate": 0.00047975081203799883, "loss": 5.4254, "mean_token_accuracy": 0.18172381669282914, "num_tokens": 28949836.0, "step": 12980 }, { "entropy": 5.532623434066773, "epoch": 1.458359072274948, "grad_norm": 1.421875, "learning_rate": 0.00047973416310636327, "loss": 5.3584, "mean_token_accuracy": 0.18170606344938278, "num_tokens": 28960053.0, "step": 12985 }, { "entropy": 5.6591089248657225, "epoch": 1.4589206491829056, "grad_norm": 2.15625, "learning_rate": 0.0004797175076559126, "loss": 5.5321, "mean_token_accuracy": 0.18378119617700578, "num_tokens": 28972698.0, "step": 12990 }, { "entropy": 5.645683240890503, "epoch": 1.459482226090863, "grad_norm": 1.859375, "learning_rate": 0.00047970084568717703, "loss": 5.5249, "mean_token_accuracy": 0.18232111632823944, "num_tokens": 28984756.0, "step": 12995 }, { "entropy": 5.6243682384490965, "epoch": 1.4600438029988208, "grad_norm": 1.4921875, "learning_rate": 0.0004796841772006872, "loss": 5.4459, "mean_token_accuracy": 0.17344191670417786, "num_tokens": 28996915.0, "step": 13000 }, { "entropy": 5.540755319595337, "epoch": 1.4606053799067782, "grad_norm": 1.9140625, "learning_rate": 0.00047966750219697376, "loss": 5.3666, "mean_token_accuracy": 0.18296120762825013, "num_tokens": 29007462.0, "step": 13005 }, { "entropy": 5.591592836380005, "epoch": 1.4611669568147359, "grad_norm": 1.4921875, "learning_rate": 0.0004796508206765677, "loss": 5.4545, "mean_token_accuracy": 0.18116957396268846, "num_tokens": 29017790.0, "step": 13010 }, { "entropy": 5.630393075942993, "epoch": 1.4617285337226933, "grad_norm": 1.4453125, "learning_rate": 0.00047963413264000005, "loss": 5.5117, "mean_token_accuracy": 0.18219025880098344, "num_tokens": 29029536.0, "step": 13015 }, { "entropy": 5.560514307022094, "epoch": 1.4622901106306507, "grad_norm": 1.6015625, "learning_rate": 0.0004796174380878023, "loss": 5.3121, "mean_token_accuracy": 0.18617115467786788, "num_tokens": 29039840.0, "step": 13020 }, { "entropy": 5.667528057098389, "epoch": 1.4628516875386084, "grad_norm": 1.5390625, "learning_rate": 0.000479600737020506, "loss": 5.4887, "mean_token_accuracy": 0.17511072009801865, "num_tokens": 29052769.0, "step": 13025 }, { "entropy": 5.5814313888549805, "epoch": 1.463413264446566, "grad_norm": 1.953125, "learning_rate": 0.0004795840294386429, "loss": 5.3535, "mean_token_accuracy": 0.1846114620566368, "num_tokens": 29063645.0, "step": 13030 }, { "entropy": 5.602754878997803, "epoch": 1.4639748413545235, "grad_norm": 1.765625, "learning_rate": 0.00047956731534274483, "loss": 5.4582, "mean_token_accuracy": 0.17893723547458648, "num_tokens": 29075241.0, "step": 13035 }, { "entropy": 5.6240301609039305, "epoch": 1.464536418262481, "grad_norm": 1.609375, "learning_rate": 0.00047955059473334425, "loss": 5.4224, "mean_token_accuracy": 0.1843517988920212, "num_tokens": 29087592.0, "step": 13040 }, { "entropy": 5.545098924636841, "epoch": 1.4650979951704386, "grad_norm": 1.421875, "learning_rate": 0.0004795338676109733, "loss": 5.391, "mean_token_accuracy": 0.18238293528556823, "num_tokens": 29099314.0, "step": 13045 }, { "entropy": 5.586019706726074, "epoch": 1.4656595720783963, "grad_norm": 1.6953125, "learning_rate": 0.0004795171339761647, "loss": 5.4493, "mean_token_accuracy": 0.1814487487077713, "num_tokens": 29111916.0, "step": 13050 }, { "entropy": 5.6290851593017575, "epoch": 1.4662211489863537, "grad_norm": 1.2421875, "learning_rate": 0.00047950039382945126, "loss": 5.4251, "mean_token_accuracy": 0.18521298468112946, "num_tokens": 29122871.0, "step": 13055 }, { "entropy": 5.560302591323852, "epoch": 1.4667827258943111, "grad_norm": 2.15625, "learning_rate": 0.00047948364717136587, "loss": 5.4137, "mean_token_accuracy": 0.18072257339954376, "num_tokens": 29133873.0, "step": 13060 }, { "entropy": 5.498769521713257, "epoch": 1.4673443028022688, "grad_norm": 1.4453125, "learning_rate": 0.00047946689400244196, "loss": 5.3212, "mean_token_accuracy": 0.18523789048194886, "num_tokens": 29144995.0, "step": 13065 }, { "entropy": 5.644399929046631, "epoch": 1.4679058797102262, "grad_norm": 1.859375, "learning_rate": 0.00047945013432321284, "loss": 5.4945, "mean_token_accuracy": 0.17930782586336136, "num_tokens": 29156801.0, "step": 13070 }, { "entropy": 5.604148054122925, "epoch": 1.468467456618184, "grad_norm": 1.59375, "learning_rate": 0.00047943336813421205, "loss": 5.5131, "mean_token_accuracy": 0.17270220518112184, "num_tokens": 29168072.0, "step": 13075 }, { "entropy": 5.550663137435913, "epoch": 1.4690290335261413, "grad_norm": 1.625, "learning_rate": 0.0004794165954359736, "loss": 5.3695, "mean_token_accuracy": 0.18234278857707978, "num_tokens": 29179314.0, "step": 13080 }, { "entropy": 5.630499362945557, "epoch": 1.469590610434099, "grad_norm": 1.5078125, "learning_rate": 0.0004793998162290315, "loss": 5.4712, "mean_token_accuracy": 0.17594666928052902, "num_tokens": 29190808.0, "step": 13085 }, { "entropy": 5.7291069507598875, "epoch": 1.4701521873420564, "grad_norm": 1.4609375, "learning_rate": 0.0004793830305139199, "loss": 5.5508, "mean_token_accuracy": 0.17875656634569168, "num_tokens": 29202557.0, "step": 13090 }, { "entropy": 5.5481040477752686, "epoch": 1.470713764250014, "grad_norm": 1.4375, "learning_rate": 0.0004793662382911734, "loss": 5.3192, "mean_token_accuracy": 0.19619740098714827, "num_tokens": 29213959.0, "step": 13095 }, { "entropy": 5.595314407348633, "epoch": 1.4712753411579715, "grad_norm": 1.484375, "learning_rate": 0.0004793494395613265, "loss": 5.4464, "mean_token_accuracy": 0.1871610775589943, "num_tokens": 29226069.0, "step": 13100 }, { "entropy": 5.649613761901856, "epoch": 1.4718369180659292, "grad_norm": 1.4296875, "learning_rate": 0.0004793326343249144, "loss": 5.4764, "mean_token_accuracy": 0.17758978456258773, "num_tokens": 29237882.0, "step": 13105 }, { "entropy": 5.53978533744812, "epoch": 1.4723984949738866, "grad_norm": 1.90625, "learning_rate": 0.0004793158225824718, "loss": 5.4077, "mean_token_accuracy": 0.19019132256507873, "num_tokens": 29248642.0, "step": 13110 }, { "entropy": 5.496613502502441, "epoch": 1.4729600718818443, "grad_norm": 1.53125, "learning_rate": 0.00047929900433453423, "loss": 5.3945, "mean_token_accuracy": 0.18171194493770598, "num_tokens": 29260632.0, "step": 13115 }, { "entropy": 5.694778394699097, "epoch": 1.4735216487898017, "grad_norm": 1.3046875, "learning_rate": 0.00047928217958163703, "loss": 5.5104, "mean_token_accuracy": 0.18265950977802276, "num_tokens": 29272563.0, "step": 13120 }, { "entropy": 5.673144721984864, "epoch": 1.4740832256977594, "grad_norm": 1.375, "learning_rate": 0.00047926534832431615, "loss": 5.477, "mean_token_accuracy": 0.18252675831317902, "num_tokens": 29284307.0, "step": 13125 }, { "entropy": 5.536691761016845, "epoch": 1.4746448026057168, "grad_norm": 1.46875, "learning_rate": 0.0004792485105631073, "loss": 5.3236, "mean_token_accuracy": 0.18838772028684617, "num_tokens": 29295413.0, "step": 13130 }, { "entropy": 5.6502501487731935, "epoch": 1.4752063795136743, "grad_norm": 1.890625, "learning_rate": 0.0004792316662985467, "loss": 5.4561, "mean_token_accuracy": 0.18947436511516572, "num_tokens": 29306612.0, "step": 13135 }, { "entropy": 5.562028217315674, "epoch": 1.475767956421632, "grad_norm": 1.5390625, "learning_rate": 0.00047921481553117053, "loss": 5.3896, "mean_token_accuracy": 0.18733631670475007, "num_tokens": 29316168.0, "step": 13140 }, { "entropy": 5.562285995483398, "epoch": 1.4763295333295896, "grad_norm": 1.4296875, "learning_rate": 0.00047919795826151544, "loss": 5.5198, "mean_token_accuracy": 0.1820887580513954, "num_tokens": 29326949.0, "step": 13145 }, { "entropy": 5.575417566299438, "epoch": 1.476891110237547, "grad_norm": 1.890625, "learning_rate": 0.0004791810944901183, "loss": 5.3574, "mean_token_accuracy": 0.17930267602205277, "num_tokens": 29336744.0, "step": 13150 }, { "entropy": 5.6073588848114015, "epoch": 1.4774526871455045, "grad_norm": 1.5703125, "learning_rate": 0.0004791642242175158, "loss": 5.384, "mean_token_accuracy": 0.18314199000597, "num_tokens": 29346964.0, "step": 13155 }, { "entropy": 5.590050077438354, "epoch": 1.4780142640534621, "grad_norm": 1.3671875, "learning_rate": 0.00047914734744424517, "loss": 5.4227, "mean_token_accuracy": 0.18171590864658355, "num_tokens": 29358689.0, "step": 13160 }, { "entropy": 5.576000499725342, "epoch": 1.4785758409614196, "grad_norm": 1.3515625, "learning_rate": 0.00047913046417084393, "loss": 5.4339, "mean_token_accuracy": 0.1828928828239441, "num_tokens": 29371243.0, "step": 13165 }, { "entropy": 5.574913835525512, "epoch": 1.4791374178693772, "grad_norm": 1.34375, "learning_rate": 0.00047911357439784947, "loss": 5.434, "mean_token_accuracy": 0.18351355493068694, "num_tokens": 29383185.0, "step": 13170 }, { "entropy": 5.481876945495605, "epoch": 1.4796989947773347, "grad_norm": 1.6484375, "learning_rate": 0.00047909667812579964, "loss": 5.2203, "mean_token_accuracy": 0.1933044970035553, "num_tokens": 29393986.0, "step": 13175 }, { "entropy": 5.500658226013184, "epoch": 1.4802605716852923, "grad_norm": 1.328125, "learning_rate": 0.00047907977535523253, "loss": 5.4469, "mean_token_accuracy": 0.18550995141267776, "num_tokens": 29405407.0, "step": 13180 }, { "entropy": 5.555845069885254, "epoch": 1.4808221485932498, "grad_norm": 1.6171875, "learning_rate": 0.0004790628660866861, "loss": 5.3541, "mean_token_accuracy": 0.18297166675329207, "num_tokens": 29416352.0, "step": 13185 }, { "entropy": 5.556106805801392, "epoch": 1.4813837255012074, "grad_norm": 1.5859375, "learning_rate": 0.0004790459503206989, "loss": 5.2981, "mean_token_accuracy": 0.18662861436605455, "num_tokens": 29428369.0, "step": 13190 }, { "entropy": 5.486964416503906, "epoch": 1.4819453024091649, "grad_norm": 1.671875, "learning_rate": 0.0004790290280578095, "loss": 5.3957, "mean_token_accuracy": 0.18780310004949569, "num_tokens": 29439276.0, "step": 13195 }, { "entropy": 5.645100069046021, "epoch": 1.4825068793171226, "grad_norm": 1.265625, "learning_rate": 0.00047901209929855675, "loss": 5.4164, "mean_token_accuracy": 0.18187098652124406, "num_tokens": 29451361.0, "step": 13200 }, { "entropy": 5.531702375411987, "epoch": 1.48306845622508, "grad_norm": 1.578125, "learning_rate": 0.0004789951640434796, "loss": 5.4417, "mean_token_accuracy": 0.18351416289806366, "num_tokens": 29462977.0, "step": 13205 }, { "entropy": 5.537817907333374, "epoch": 1.4836300331330377, "grad_norm": 1.3515625, "learning_rate": 0.0004789782222931173, "loss": 5.3729, "mean_token_accuracy": 0.1877996265888214, "num_tokens": 29474641.0, "step": 13210 }, { "entropy": 5.55263385772705, "epoch": 1.484191610040995, "grad_norm": 1.578125, "learning_rate": 0.00047896127404800935, "loss": 5.2718, "mean_token_accuracy": 0.1885400354862213, "num_tokens": 29485560.0, "step": 13215 }, { "entropy": 5.521211004257202, "epoch": 1.4847531869489528, "grad_norm": 1.4765625, "learning_rate": 0.0004789443193086953, "loss": 5.3831, "mean_token_accuracy": 0.18604848980903627, "num_tokens": 29495872.0, "step": 13220 }, { "entropy": 5.511582851409912, "epoch": 1.4853147638569102, "grad_norm": 1.453125, "learning_rate": 0.00047892735807571505, "loss": 5.3327, "mean_token_accuracy": 0.1902692899107933, "num_tokens": 29506704.0, "step": 13225 }, { "entropy": 5.564581727981567, "epoch": 1.4858763407648676, "grad_norm": 1.4921875, "learning_rate": 0.0004789103903496086, "loss": 5.3683, "mean_token_accuracy": 0.18327164202928542, "num_tokens": 29518226.0, "step": 13230 }, { "entropy": 5.5849768161773685, "epoch": 1.4864379176728253, "grad_norm": 1.4609375, "learning_rate": 0.0004788934161309161, "loss": 5.3296, "mean_token_accuracy": 0.19128019660711287, "num_tokens": 29529176.0, "step": 13235 }, { "entropy": 5.470476198196411, "epoch": 1.486999494580783, "grad_norm": 1.5625, "learning_rate": 0.00047887643542017836, "loss": 5.2218, "mean_token_accuracy": 0.18971727937459945, "num_tokens": 29539268.0, "step": 13240 }, { "entropy": 5.569934368133545, "epoch": 1.4875610714887404, "grad_norm": 1.328125, "learning_rate": 0.00047885944821793574, "loss": 5.5137, "mean_token_accuracy": 0.1754368558526039, "num_tokens": 29550491.0, "step": 13245 }, { "entropy": 5.50352201461792, "epoch": 1.4881226483966978, "grad_norm": 1.5546875, "learning_rate": 0.00047884245452472926, "loss": 5.3284, "mean_token_accuracy": 0.1866819903254509, "num_tokens": 29561520.0, "step": 13250 }, { "entropy": 5.517250204086304, "epoch": 1.4886842253046555, "grad_norm": 2.03125, "learning_rate": 0.0004788254543410999, "loss": 5.3886, "mean_token_accuracy": 0.18395980447530746, "num_tokens": 29573974.0, "step": 13255 }, { "entropy": 5.493844413757325, "epoch": 1.489245802212613, "grad_norm": 1.6875, "learning_rate": 0.00047880844766758914, "loss": 5.2992, "mean_token_accuracy": 0.19390214681625367, "num_tokens": 29584059.0, "step": 13260 }, { "entropy": 5.647783708572388, "epoch": 1.4898073791205706, "grad_norm": 1.5546875, "learning_rate": 0.00047879143450473824, "loss": 5.5231, "mean_token_accuracy": 0.1793433427810669, "num_tokens": 29595726.0, "step": 13265 }, { "entropy": 5.555963134765625, "epoch": 1.490368956028528, "grad_norm": 1.4921875, "learning_rate": 0.00047877441485308917, "loss": 5.4138, "mean_token_accuracy": 0.18182573169469834, "num_tokens": 29607354.0, "step": 13270 }, { "entropy": 5.549566316604614, "epoch": 1.4909305329364857, "grad_norm": 1.46875, "learning_rate": 0.00047875738871318356, "loss": 5.3485, "mean_token_accuracy": 0.18683600872755052, "num_tokens": 29618698.0, "step": 13275 }, { "entropy": 5.464523887634277, "epoch": 1.4914921098444431, "grad_norm": 1.3671875, "learning_rate": 0.0004787403560855637, "loss": 5.3188, "mean_token_accuracy": 0.18717088401317597, "num_tokens": 29629578.0, "step": 13280 }, { "entropy": 5.492139101028442, "epoch": 1.4920536867524008, "grad_norm": 1.515625, "learning_rate": 0.0004787233169707719, "loss": 5.1961, "mean_token_accuracy": 0.19385868310928345, "num_tokens": 29640277.0, "step": 13285 }, { "entropy": 5.497411632537842, "epoch": 1.4926152636603582, "grad_norm": 1.5078125, "learning_rate": 0.0004787062713693507, "loss": 5.4392, "mean_token_accuracy": 0.18391389548778533, "num_tokens": 29652029.0, "step": 13290 }, { "entropy": 5.581491851806641, "epoch": 1.493176840568316, "grad_norm": 1.5, "learning_rate": 0.00047868921928184276, "loss": 5.4319, "mean_token_accuracy": 0.18335914015769958, "num_tokens": 29663191.0, "step": 13295 }, { "entropy": 5.638195371627807, "epoch": 1.4937384174762733, "grad_norm": 1.9296875, "learning_rate": 0.0004786721607087911, "loss": 5.4582, "mean_token_accuracy": 0.17531873881816865, "num_tokens": 29674238.0, "step": 13300 }, { "entropy": 5.566009187698365, "epoch": 1.494299994384231, "grad_norm": 1.8984375, "learning_rate": 0.0004786550956507389, "loss": 5.3684, "mean_token_accuracy": 0.18569211661815643, "num_tokens": 29687255.0, "step": 13305 }, { "entropy": 5.474252653121948, "epoch": 1.4948615712921884, "grad_norm": 1.5, "learning_rate": 0.0004786380241082294, "loss": 5.3085, "mean_token_accuracy": 0.18408209681510926, "num_tokens": 29699769.0, "step": 13310 }, { "entropy": 5.601528692245483, "epoch": 1.495423148200146, "grad_norm": 1.3125, "learning_rate": 0.00047862094608180623, "loss": 5.4829, "mean_token_accuracy": 0.17950135916471482, "num_tokens": 29710281.0, "step": 13315 }, { "entropy": 5.551890897750854, "epoch": 1.4959847251081035, "grad_norm": 1.3203125, "learning_rate": 0.0004786038615720132, "loss": 5.2745, "mean_token_accuracy": 0.1837810605764389, "num_tokens": 29720647.0, "step": 13320 }, { "entropy": 5.549169540405273, "epoch": 1.496546302016061, "grad_norm": 1.34375, "learning_rate": 0.00047858677057939427, "loss": 5.4406, "mean_token_accuracy": 0.1845221921801567, "num_tokens": 29731565.0, "step": 13325 }, { "entropy": 5.552046060562134, "epoch": 1.4971078789240186, "grad_norm": 1.796875, "learning_rate": 0.00047856967310449356, "loss": 5.3408, "mean_token_accuracy": 0.18324533998966216, "num_tokens": 29743361.0, "step": 13330 }, { "entropy": 5.5653197288513185, "epoch": 1.4976694558319763, "grad_norm": 1.328125, "learning_rate": 0.00047855256914785556, "loss": 5.3985, "mean_token_accuracy": 0.18504771292209626, "num_tokens": 29754799.0, "step": 13335 }, { "entropy": 5.57679591178894, "epoch": 1.4982310327399337, "grad_norm": 1.5234375, "learning_rate": 0.00047853545871002476, "loss": 5.5172, "mean_token_accuracy": 0.18125257045030593, "num_tokens": 29766401.0, "step": 13340 }, { "entropy": 5.487023830413818, "epoch": 1.4987926096478912, "grad_norm": 1.4453125, "learning_rate": 0.00047851834179154595, "loss": 5.2762, "mean_token_accuracy": 0.19227621853351592, "num_tokens": 29778268.0, "step": 13345 }, { "entropy": 5.4932716369628904, "epoch": 1.4993541865558488, "grad_norm": 1.328125, "learning_rate": 0.0004785012183929643, "loss": 5.3409, "mean_token_accuracy": 0.1875157192349434, "num_tokens": 29788551.0, "step": 13350 }, { "entropy": 5.5828437328338625, "epoch": 1.4999157634638065, "grad_norm": 1.4140625, "learning_rate": 0.0004784840885148249, "loss": 5.3323, "mean_token_accuracy": 0.1854691818356514, "num_tokens": 29799726.0, "step": 13355 }, { "entropy": 5.564011764526367, "epoch": 1.500477340371764, "grad_norm": 1.34375, "learning_rate": 0.0004784669521576732, "loss": 5.4717, "mean_token_accuracy": 0.1789710581302643, "num_tokens": 29810615.0, "step": 13360 }, { "entropy": 5.5941304683685305, "epoch": 1.5010389172797214, "grad_norm": 1.5859375, "learning_rate": 0.0004784498093220549, "loss": 5.3797, "mean_token_accuracy": 0.18280550539493562, "num_tokens": 29821766.0, "step": 13365 }, { "entropy": 5.513896894454956, "epoch": 1.501600494187679, "grad_norm": 1.359375, "learning_rate": 0.0004784326600085157, "loss": 5.4186, "mean_token_accuracy": 0.18026091903448105, "num_tokens": 29833724.0, "step": 13370 }, { "entropy": 5.505526065826416, "epoch": 1.5021620710956367, "grad_norm": 1.875, "learning_rate": 0.00047841550421760164, "loss": 5.3227, "mean_token_accuracy": 0.18708880245685577, "num_tokens": 29845057.0, "step": 13375 }, { "entropy": 5.651104593276978, "epoch": 1.502723648003594, "grad_norm": 1.5078125, "learning_rate": 0.00047839834194985916, "loss": 5.4529, "mean_token_accuracy": 0.18251316100358964, "num_tokens": 29855649.0, "step": 13380 }, { "entropy": 5.469983243942261, "epoch": 1.5032852249115516, "grad_norm": 1.40625, "learning_rate": 0.0004783811732058345, "loss": 5.274, "mean_token_accuracy": 0.18951803594827651, "num_tokens": 29866873.0, "step": 13385 }, { "entropy": 5.519393491744995, "epoch": 1.5038468018195092, "grad_norm": 1.6171875, "learning_rate": 0.00047836399798607446, "loss": 5.331, "mean_token_accuracy": 0.18913227319717407, "num_tokens": 29877690.0, "step": 13390 }, { "entropy": 5.528921747207642, "epoch": 1.5044083787274667, "grad_norm": 1.40625, "learning_rate": 0.00047834681629112583, "loss": 5.3901, "mean_token_accuracy": 0.19536549896001815, "num_tokens": 29888461.0, "step": 13395 }, { "entropy": 5.482246589660645, "epoch": 1.5049699556354241, "grad_norm": 1.2421875, "learning_rate": 0.0004783296281215357, "loss": 5.3671, "mean_token_accuracy": 0.1873343139886856, "num_tokens": 29900559.0, "step": 13400 }, { "entropy": 5.457982730865479, "epoch": 1.5055315325433818, "grad_norm": 1.453125, "learning_rate": 0.0004783124334778513, "loss": 5.2906, "mean_token_accuracy": 0.19076751917600632, "num_tokens": 29910815.0, "step": 13405 }, { "entropy": 5.6054411888122555, "epoch": 1.5060931094513395, "grad_norm": 1.796875, "learning_rate": 0.0004782952323606202, "loss": 5.532, "mean_token_accuracy": 0.18430778980255128, "num_tokens": 29923262.0, "step": 13410 }, { "entropy": 5.541047430038452, "epoch": 1.506654686359297, "grad_norm": 1.5625, "learning_rate": 0.0004782780247703901, "loss": 5.3602, "mean_token_accuracy": 0.18784934133291245, "num_tokens": 29934744.0, "step": 13415 }, { "entropy": 5.644116735458374, "epoch": 1.5072162632672543, "grad_norm": 1.640625, "learning_rate": 0.0004782608107077088, "loss": 5.5336, "mean_token_accuracy": 0.17931553572416306, "num_tokens": 29945828.0, "step": 13420 }, { "entropy": 5.485628843307495, "epoch": 1.507777840175212, "grad_norm": 1.546875, "learning_rate": 0.00047824359017312445, "loss": 5.3171, "mean_token_accuracy": 0.1859288841485977, "num_tokens": 29956964.0, "step": 13425 }, { "entropy": 5.5612828731536865, "epoch": 1.5083394170831697, "grad_norm": 1.484375, "learning_rate": 0.0004782263631671854, "loss": 5.3824, "mean_token_accuracy": 0.1855710193514824, "num_tokens": 29968004.0, "step": 13430 }, { "entropy": 5.571560430526733, "epoch": 1.508900993991127, "grad_norm": 1.4765625, "learning_rate": 0.00047820912969044014, "loss": 5.3444, "mean_token_accuracy": 0.189272677898407, "num_tokens": 29978237.0, "step": 13435 }, { "entropy": 5.493322277069092, "epoch": 1.5094625708990845, "grad_norm": 1.4765625, "learning_rate": 0.00047819188974343734, "loss": 5.4205, "mean_token_accuracy": 0.17970777153968812, "num_tokens": 29988379.0, "step": 13440 }, { "entropy": 5.5735115051269535, "epoch": 1.5100241478070422, "grad_norm": 1.5390625, "learning_rate": 0.0004781746433267259, "loss": 5.4585, "mean_token_accuracy": 0.18298395723104477, "num_tokens": 29999024.0, "step": 13445 }, { "entropy": 5.618076181411743, "epoch": 1.5105857247149999, "grad_norm": 1.5078125, "learning_rate": 0.00047815739044085515, "loss": 5.3546, "mean_token_accuracy": 0.18803201615810394, "num_tokens": 30009411.0, "step": 13450 }, { "entropy": 5.50294942855835, "epoch": 1.5111473016229573, "grad_norm": 1.4140625, "learning_rate": 0.00047814013108637423, "loss": 5.3741, "mean_token_accuracy": 0.18963730782270433, "num_tokens": 30020746.0, "step": 13455 }, { "entropy": 5.566942977905273, "epoch": 1.5117088785309147, "grad_norm": 1.3515625, "learning_rate": 0.00047812286526383274, "loss": 5.3481, "mean_token_accuracy": 0.18417930454015732, "num_tokens": 30032568.0, "step": 13460 }, { "entropy": 5.58520917892456, "epoch": 1.5122704554388724, "grad_norm": 1.5390625, "learning_rate": 0.0004781055929737804, "loss": 5.4001, "mean_token_accuracy": 0.18209205716848373, "num_tokens": 30042772.0, "step": 13465 }, { "entropy": 5.557912015914917, "epoch": 1.51283203234683, "grad_norm": 1.4921875, "learning_rate": 0.00047808831421676724, "loss": 5.4403, "mean_token_accuracy": 0.1883595496416092, "num_tokens": 30053842.0, "step": 13470 }, { "entropy": 5.63917121887207, "epoch": 1.5133936092547875, "grad_norm": 1.3828125, "learning_rate": 0.0004780710289933435, "loss": 5.4059, "mean_token_accuracy": 0.1867174282670021, "num_tokens": 30064744.0, "step": 13475 }, { "entropy": 5.541257667541504, "epoch": 1.513955186162745, "grad_norm": 1.421875, "learning_rate": 0.0004780537373040593, "loss": 5.3928, "mean_token_accuracy": 0.1826452910900116, "num_tokens": 30075475.0, "step": 13480 }, { "entropy": 5.565896034240723, "epoch": 1.5145167630707026, "grad_norm": 1.46875, "learning_rate": 0.00047803643914946537, "loss": 5.3805, "mean_token_accuracy": 0.18455331176519393, "num_tokens": 30087189.0, "step": 13485 }, { "entropy": 5.576182174682617, "epoch": 1.51507833997866, "grad_norm": 1.5234375, "learning_rate": 0.0004780191345301125, "loss": 5.4967, "mean_token_accuracy": 0.17630792707204818, "num_tokens": 30099263.0, "step": 13490 }, { "entropy": 5.564552450180054, "epoch": 1.5156399168866175, "grad_norm": 1.3515625, "learning_rate": 0.00047800182344655165, "loss": 5.417, "mean_token_accuracy": 0.18011668920516968, "num_tokens": 30110925.0, "step": 13495 }, { "entropy": 5.598606777191162, "epoch": 1.5162014937945751, "grad_norm": 1.2109375, "learning_rate": 0.000477984505899334, "loss": 5.4129, "mean_token_accuracy": 0.17879739701747893, "num_tokens": 30122708.0, "step": 13500 }, { "entropy": 5.53363790512085, "epoch": 1.5167630707025328, "grad_norm": 1.40625, "learning_rate": 0.00047796718188901095, "loss": 5.2992, "mean_token_accuracy": 0.18720662593841553, "num_tokens": 30133624.0, "step": 13505 }, { "entropy": 5.4703856945037845, "epoch": 1.5173246476104902, "grad_norm": 1.515625, "learning_rate": 0.00047794985141613413, "loss": 5.3796, "mean_token_accuracy": 0.18744681477546693, "num_tokens": 30144501.0, "step": 13510 }, { "entropy": 5.5106078624725345, "epoch": 1.5178862245184477, "grad_norm": 1.484375, "learning_rate": 0.00047793251448125526, "loss": 5.3317, "mean_token_accuracy": 0.1898783937096596, "num_tokens": 30156351.0, "step": 13515 }, { "entropy": 5.570866870880127, "epoch": 1.5184478014264053, "grad_norm": 1.2890625, "learning_rate": 0.0004779151710849265, "loss": 5.4284, "mean_token_accuracy": 0.1814264938235283, "num_tokens": 30167445.0, "step": 13520 }, { "entropy": 5.620449876785278, "epoch": 1.519009378334363, "grad_norm": 1.7265625, "learning_rate": 0.0004778978212276999, "loss": 5.49, "mean_token_accuracy": 0.17341291755437852, "num_tokens": 30179054.0, "step": 13525 }, { "entropy": 5.637458610534668, "epoch": 1.5195709552423204, "grad_norm": 1.609375, "learning_rate": 0.0004778804649101281, "loss": 5.4138, "mean_token_accuracy": 0.18240256160497664, "num_tokens": 30189412.0, "step": 13530 }, { "entropy": 5.5557867050170895, "epoch": 1.5201325321502779, "grad_norm": 1.578125, "learning_rate": 0.0004778631021327636, "loss": 5.3996, "mean_token_accuracy": 0.18172027468681334, "num_tokens": 30200775.0, "step": 13535 }, { "entropy": 5.553967905044556, "epoch": 1.5206941090582355, "grad_norm": 1.265625, "learning_rate": 0.0004778457328961592, "loss": 5.3454, "mean_token_accuracy": 0.18539057523012162, "num_tokens": 30212121.0, "step": 13540 }, { "entropy": 5.494845914840698, "epoch": 1.5212556859661932, "grad_norm": 1.484375, "learning_rate": 0.00047782835720086797, "loss": 5.3007, "mean_token_accuracy": 0.18967946916818618, "num_tokens": 30222814.0, "step": 13545 }, { "entropy": 5.5532997131347654, "epoch": 1.5218172628741506, "grad_norm": 1.234375, "learning_rate": 0.0004778109750474432, "loss": 5.4067, "mean_token_accuracy": 0.18181711733341216, "num_tokens": 30232414.0, "step": 13550 }, { "entropy": 5.634558773040771, "epoch": 1.522378839782108, "grad_norm": 1.296875, "learning_rate": 0.0004777935864364383, "loss": 5.5068, "mean_token_accuracy": 0.1819259151816368, "num_tokens": 30243479.0, "step": 13555 }, { "entropy": 5.6132118701934814, "epoch": 1.5229404166900657, "grad_norm": 1.5, "learning_rate": 0.000477776191368407, "loss": 5.4383, "mean_token_accuracy": 0.1828339710831642, "num_tokens": 30254721.0, "step": 13560 }, { "entropy": 5.567163944244385, "epoch": 1.5235019935980234, "grad_norm": 1.390625, "learning_rate": 0.0004777587898439031, "loss": 5.3443, "mean_token_accuracy": 0.18657080829143524, "num_tokens": 30266962.0, "step": 13565 }, { "entropy": 5.559728813171387, "epoch": 1.5240635705059808, "grad_norm": 1.59375, "learning_rate": 0.00047774138186348073, "loss": 5.3792, "mean_token_accuracy": 0.18521272838115693, "num_tokens": 30278773.0, "step": 13570 }, { "entropy": 5.475287580490113, "epoch": 1.5246251474139383, "grad_norm": 1.53125, "learning_rate": 0.0004777239674276941, "loss": 5.3051, "mean_token_accuracy": 0.1914447709918022, "num_tokens": 30289631.0, "step": 13575 }, { "entropy": 5.525226402282715, "epoch": 1.525186724321896, "grad_norm": 1.53125, "learning_rate": 0.0004777065465370977, "loss": 5.4079, "mean_token_accuracy": 0.1838540181517601, "num_tokens": 30301433.0, "step": 13580 }, { "entropy": 5.593246507644653, "epoch": 1.5257483012298534, "grad_norm": 1.3828125, "learning_rate": 0.0004776891191922463, "loss": 5.3571, "mean_token_accuracy": 0.18819249272346497, "num_tokens": 30312695.0, "step": 13585 }, { "entropy": 5.51133131980896, "epoch": 1.5263098781378108, "grad_norm": 1.5, "learning_rate": 0.0004776716853936947, "loss": 5.4017, "mean_token_accuracy": 0.18176380246877671, "num_tokens": 30324254.0, "step": 13590 }, { "entropy": 5.558914995193481, "epoch": 1.5268714550457685, "grad_norm": 1.4921875, "learning_rate": 0.000477654245141998, "loss": 5.4717, "mean_token_accuracy": 0.18200935274362565, "num_tokens": 30335389.0, "step": 13595 }, { "entropy": 5.565616607666016, "epoch": 1.5274330319537262, "grad_norm": 1.3984375, "learning_rate": 0.0004776367984377116, "loss": 5.3476, "mean_token_accuracy": 0.19087966978549958, "num_tokens": 30346627.0, "step": 13600 }, { "entropy": 5.504670524597168, "epoch": 1.5279946088616836, "grad_norm": 1.296875, "learning_rate": 0.00047761934528139086, "loss": 5.4383, "mean_token_accuracy": 0.1850270837545395, "num_tokens": 30358215.0, "step": 13605 }, { "entropy": 5.568783950805664, "epoch": 1.528556185769641, "grad_norm": 1.3984375, "learning_rate": 0.0004776018856735916, "loss": 5.3368, "mean_token_accuracy": 0.1884455904364586, "num_tokens": 30369793.0, "step": 13610 }, { "entropy": 5.527515125274658, "epoch": 1.5291177626775987, "grad_norm": 1.375, "learning_rate": 0.0004775844196148698, "loss": 5.2814, "mean_token_accuracy": 0.1938552275300026, "num_tokens": 30380200.0, "step": 13615 }, { "entropy": 5.462940740585327, "epoch": 1.5296793395855564, "grad_norm": 1.53125, "learning_rate": 0.00047756694710578146, "loss": 5.4801, "mean_token_accuracy": 0.17716196030378342, "num_tokens": 30392282.0, "step": 13620 }, { "entropy": 5.697913360595703, "epoch": 1.5302409164935138, "grad_norm": 5.25, "learning_rate": 0.000477549468146883, "loss": 5.6244, "mean_token_accuracy": 0.17258382290601731, "num_tokens": 30405365.0, "step": 13625 }, { "entropy": 5.589715194702149, "epoch": 1.5308024934014712, "grad_norm": 1.4453125, "learning_rate": 0.0004775319827387309, "loss": 5.4209, "mean_token_accuracy": 0.1872163236141205, "num_tokens": 30416513.0, "step": 13630 }, { "entropy": 5.475887632369995, "epoch": 1.531364070309429, "grad_norm": 1.5, "learning_rate": 0.0004775144908818818, "loss": 5.2946, "mean_token_accuracy": 0.19170508086681365, "num_tokens": 30427245.0, "step": 13635 }, { "entropy": 5.621194076538086, "epoch": 1.5319256472173866, "grad_norm": 1.4375, "learning_rate": 0.00047749699257689296, "loss": 5.4364, "mean_token_accuracy": 0.18304508030414582, "num_tokens": 30438437.0, "step": 13640 }, { "entropy": 5.528850936889649, "epoch": 1.532487224125344, "grad_norm": 1.4296875, "learning_rate": 0.0004774794878243212, "loss": 5.3897, "mean_token_accuracy": 0.18640411049127578, "num_tokens": 30449726.0, "step": 13645 }, { "entropy": 5.555571460723877, "epoch": 1.5330488010333014, "grad_norm": 1.296875, "learning_rate": 0.000477461976624724, "loss": 5.4298, "mean_token_accuracy": 0.18499019593000413, "num_tokens": 30460024.0, "step": 13650 }, { "entropy": 5.652355289459228, "epoch": 1.533610377941259, "grad_norm": 1.390625, "learning_rate": 0.00047744445897865905, "loss": 5.5162, "mean_token_accuracy": 0.17776869386434554, "num_tokens": 30471981.0, "step": 13655 }, { "entropy": 5.560834503173828, "epoch": 1.5341719548492168, "grad_norm": 1.4296875, "learning_rate": 0.000477426934886684, "loss": 5.3272, "mean_token_accuracy": 0.19395865648984909, "num_tokens": 30483143.0, "step": 13660 }, { "entropy": 5.465796852111817, "epoch": 1.5347335317571742, "grad_norm": 1.2578125, "learning_rate": 0.00047740940434935677, "loss": 5.3583, "mean_token_accuracy": 0.18184324204921723, "num_tokens": 30495049.0, "step": 13665 }, { "entropy": 5.548905324935913, "epoch": 1.5352951086651316, "grad_norm": 1.46875, "learning_rate": 0.0004773918673672356, "loss": 5.4642, "mean_token_accuracy": 0.18481016606092454, "num_tokens": 30506736.0, "step": 13670 }, { "entropy": 5.741988182067871, "epoch": 1.5358566855730893, "grad_norm": 1.5078125, "learning_rate": 0.00047737432394087887, "loss": 5.5595, "mean_token_accuracy": 0.18076975047588348, "num_tokens": 30520130.0, "step": 13675 }, { "entropy": 5.625166940689087, "epoch": 1.5364182624810467, "grad_norm": 1.609375, "learning_rate": 0.00047735677407084525, "loss": 5.5307, "mean_token_accuracy": 0.17583049535751344, "num_tokens": 30531480.0, "step": 13680 }, { "entropy": 5.514678812026977, "epoch": 1.5369798393890042, "grad_norm": 1.3125, "learning_rate": 0.0004773392177576934, "loss": 5.3671, "mean_token_accuracy": 0.18170706778764725, "num_tokens": 30541760.0, "step": 13685 }, { "entropy": 5.593460512161255, "epoch": 1.5375414162969618, "grad_norm": 1.2109375, "learning_rate": 0.0004773216550019824, "loss": 5.382, "mean_token_accuracy": 0.18787881731987, "num_tokens": 30551162.0, "step": 13690 }, { "entropy": 5.531304979324341, "epoch": 1.5381029932049195, "grad_norm": 1.1953125, "learning_rate": 0.00047730408580427136, "loss": 5.3488, "mean_token_accuracy": 0.18768645823001862, "num_tokens": 30562601.0, "step": 13695 }, { "entropy": 5.5491913795471195, "epoch": 1.538664570112877, "grad_norm": 1.34375, "learning_rate": 0.00047728651016511994, "loss": 5.4301, "mean_token_accuracy": 0.18237154334783554, "num_tokens": 30573923.0, "step": 13700 }, { "entropy": 5.629022026062012, "epoch": 1.5392261470208344, "grad_norm": 1.359375, "learning_rate": 0.00047726892808508744, "loss": 5.4916, "mean_token_accuracy": 0.17828229665756226, "num_tokens": 30586400.0, "step": 13705 }, { "entropy": 5.633077812194824, "epoch": 1.539787723928792, "grad_norm": 1.421875, "learning_rate": 0.0004772513395647339, "loss": 5.4615, "mean_token_accuracy": 0.17952902764081954, "num_tokens": 30598317.0, "step": 13710 }, { "entropy": 5.614277791976929, "epoch": 1.5403493008367497, "grad_norm": 1.7265625, "learning_rate": 0.0004772337446046192, "loss": 5.4242, "mean_token_accuracy": 0.18551861345767975, "num_tokens": 30609413.0, "step": 13715 }, { "entropy": 5.6229565143585205, "epoch": 1.5409108777447071, "grad_norm": 1.3046875, "learning_rate": 0.00047721614320530366, "loss": 5.3359, "mean_token_accuracy": 0.18386495858430862, "num_tokens": 30619252.0, "step": 13720 }, { "entropy": 5.507887458801269, "epoch": 1.5414724546526646, "grad_norm": 1.3203125, "learning_rate": 0.00047719853536734764, "loss": 5.3582, "mean_token_accuracy": 0.19007731080055237, "num_tokens": 30630477.0, "step": 13725 }, { "entropy": 5.527295351028442, "epoch": 1.5420340315606222, "grad_norm": 1.421875, "learning_rate": 0.0004771809210913119, "loss": 5.4153, "mean_token_accuracy": 0.1849319592118263, "num_tokens": 30641977.0, "step": 13730 }, { "entropy": 5.61675181388855, "epoch": 1.54259560846858, "grad_norm": 1.9921875, "learning_rate": 0.00047716330037775724, "loss": 5.355, "mean_token_accuracy": 0.18888724744319915, "num_tokens": 30653547.0, "step": 13735 }, { "entropy": 5.5287590503692625, "epoch": 1.5431571853765373, "grad_norm": 1.7109375, "learning_rate": 0.0004771456732272446, "loss": 5.3886, "mean_token_accuracy": 0.18013912588357925, "num_tokens": 30664270.0, "step": 13740 }, { "entropy": 5.659532165527343, "epoch": 1.5437187622844948, "grad_norm": 1.296875, "learning_rate": 0.00047712803964033545, "loss": 5.5812, "mean_token_accuracy": 0.17014667391777039, "num_tokens": 30677172.0, "step": 13745 }, { "entropy": 5.616595029830933, "epoch": 1.5442803391924524, "grad_norm": 1.4921875, "learning_rate": 0.00047711039961759107, "loss": 5.448, "mean_token_accuracy": 0.18428623527288437, "num_tokens": 30688657.0, "step": 13750 }, { "entropy": 5.585419130325318, "epoch": 1.54484191610041, "grad_norm": 1.28125, "learning_rate": 0.0004770927531595731, "loss": 5.4416, "mean_token_accuracy": 0.18118552267551422, "num_tokens": 30699103.0, "step": 13755 }, { "entropy": 5.558484268188477, "epoch": 1.5454034930083675, "grad_norm": 1.125, "learning_rate": 0.00047707510026684353, "loss": 5.3876, "mean_token_accuracy": 0.18183284252882004, "num_tokens": 30711352.0, "step": 13760 }, { "entropy": 5.675160837173462, "epoch": 1.545965069916325, "grad_norm": 1.3828125, "learning_rate": 0.00047705744093996447, "loss": 5.4765, "mean_token_accuracy": 0.18024851083755494, "num_tokens": 30722224.0, "step": 13765 }, { "entropy": 5.607077360153198, "epoch": 1.5465266468242826, "grad_norm": 1.4140625, "learning_rate": 0.000477039775179498, "loss": 5.4422, "mean_token_accuracy": 0.17536765933036805, "num_tokens": 30733113.0, "step": 13770 }, { "entropy": 5.573582410812378, "epoch": 1.54708822373224, "grad_norm": 1.484375, "learning_rate": 0.00047702210298600684, "loss": 5.4511, "mean_token_accuracy": 0.1805928409099579, "num_tokens": 30744903.0, "step": 13775 }, { "entropy": 5.633671283721924, "epoch": 1.5476498006401975, "grad_norm": 1.1953125, "learning_rate": 0.00047700442436005356, "loss": 5.4317, "mean_token_accuracy": 0.18018018305301667, "num_tokens": 30756034.0, "step": 13780 }, { "entropy": 5.542671060562133, "epoch": 1.5482113775481552, "grad_norm": 1.2734375, "learning_rate": 0.000476986739302201, "loss": 5.3462, "mean_token_accuracy": 0.18649798780679702, "num_tokens": 30766139.0, "step": 13785 }, { "entropy": 5.567276573181152, "epoch": 1.5487729544561128, "grad_norm": 1.578125, "learning_rate": 0.00047696904781301233, "loss": 5.4416, "mean_token_accuracy": 0.18002934902906417, "num_tokens": 30777505.0, "step": 13790 }, { "entropy": 5.5490563869476315, "epoch": 1.5493345313640703, "grad_norm": 1.5390625, "learning_rate": 0.0004769513498930508, "loss": 5.3241, "mean_token_accuracy": 0.18992604166269303, "num_tokens": 30788520.0, "step": 13795 }, { "entropy": 5.523218870162964, "epoch": 1.5498961082720277, "grad_norm": 1.3046875, "learning_rate": 0.00047693364554288, "loss": 5.3192, "mean_token_accuracy": 0.1855691209435463, "num_tokens": 30799051.0, "step": 13800 }, { "entropy": 5.521050930023193, "epoch": 1.5504576851799854, "grad_norm": 1.5625, "learning_rate": 0.00047691593476306373, "loss": 5.336, "mean_token_accuracy": 0.19566950649023057, "num_tokens": 30809375.0, "step": 13805 }, { "entropy": 5.539036464691162, "epoch": 1.551019262087943, "grad_norm": 1.640625, "learning_rate": 0.0004768982175541656, "loss": 5.3418, "mean_token_accuracy": 0.18851928114891053, "num_tokens": 30821330.0, "step": 13810 }, { "entropy": 5.633591508865356, "epoch": 1.5515808389959005, "grad_norm": 1.3046875, "learning_rate": 0.00047688049391675006, "loss": 5.4827, "mean_token_accuracy": 0.17657239884138107, "num_tokens": 30832366.0, "step": 13815 }, { "entropy": 5.594413089752197, "epoch": 1.552142415903858, "grad_norm": 1.40625, "learning_rate": 0.0004768627638513813, "loss": 5.4264, "mean_token_accuracy": 0.17895372062921525, "num_tokens": 30843550.0, "step": 13820 }, { "entropy": 5.482576704025268, "epoch": 1.5527039928118156, "grad_norm": 1.34375, "learning_rate": 0.0004768450273586237, "loss": 5.258, "mean_token_accuracy": 0.1935638576745987, "num_tokens": 30854727.0, "step": 13825 }, { "entropy": 5.589857721328736, "epoch": 1.5532655697197733, "grad_norm": 1.3203125, "learning_rate": 0.00047682728443904223, "loss": 5.3835, "mean_token_accuracy": 0.18434152752161026, "num_tokens": 30865594.0, "step": 13830 }, { "entropy": 5.580872392654419, "epoch": 1.5538271466277307, "grad_norm": 1.3515625, "learning_rate": 0.00047680953509320176, "loss": 5.3871, "mean_token_accuracy": 0.18392160683870315, "num_tokens": 30877386.0, "step": 13835 }, { "entropy": 5.657144498825073, "epoch": 1.5543887235356881, "grad_norm": 1.7265625, "learning_rate": 0.0004767917793216674, "loss": 5.4923, "mean_token_accuracy": 0.1839445412158966, "num_tokens": 30889052.0, "step": 13840 }, { "entropy": 5.562966823577881, "epoch": 1.5549503004436458, "grad_norm": 1.3203125, "learning_rate": 0.00047677401712500455, "loss": 5.3473, "mean_token_accuracy": 0.18103903234004975, "num_tokens": 30900524.0, "step": 13845 }, { "entropy": 5.576873540878296, "epoch": 1.5555118773516035, "grad_norm": 1.2265625, "learning_rate": 0.0004767562485037787, "loss": 5.4734, "mean_token_accuracy": 0.17559579908847808, "num_tokens": 30911770.0, "step": 13850 }, { "entropy": 5.4913770198822025, "epoch": 1.556073454259561, "grad_norm": 1.1953125, "learning_rate": 0.00047673847345855566, "loss": 5.2639, "mean_token_accuracy": 0.19188567548990249, "num_tokens": 30921662.0, "step": 13855 }, { "entropy": 5.6478245735168455, "epoch": 1.5566350311675183, "grad_norm": 1.1875, "learning_rate": 0.0004767206919899014, "loss": 5.5509, "mean_token_accuracy": 0.18133361339569093, "num_tokens": 30934138.0, "step": 13860 }, { "entropy": 5.631950092315674, "epoch": 1.557196608075476, "grad_norm": 1.375, "learning_rate": 0.000476702904098382, "loss": 5.3804, "mean_token_accuracy": 0.1829290822148323, "num_tokens": 30945561.0, "step": 13865 }, { "entropy": 5.502339935302734, "epoch": 1.5577581849834334, "grad_norm": 1.25, "learning_rate": 0.000476685109784564, "loss": 5.2657, "mean_token_accuracy": 0.19422535449266434, "num_tokens": 30957210.0, "step": 13870 }, { "entropy": 5.546827745437622, "epoch": 1.5583197618913909, "grad_norm": 1.4296875, "learning_rate": 0.00047666730904901377, "loss": 5.3774, "mean_token_accuracy": 0.18659260720014573, "num_tokens": 30968782.0, "step": 13875 }, { "entropy": 5.553039169311523, "epoch": 1.5588813387993485, "grad_norm": 1.28125, "learning_rate": 0.00047664950189229833, "loss": 5.42, "mean_token_accuracy": 0.18063327074050903, "num_tokens": 30981239.0, "step": 13880 }, { "entropy": 5.620796632766724, "epoch": 1.5594429157073062, "grad_norm": 1.390625, "learning_rate": 0.0004766316883149845, "loss": 5.4496, "mean_token_accuracy": 0.18674004524946214, "num_tokens": 30991773.0, "step": 13885 }, { "entropy": 5.666515827178955, "epoch": 1.5600044926152636, "grad_norm": 1.3359375, "learning_rate": 0.00047661386831763955, "loss": 5.4382, "mean_token_accuracy": 0.1887378215789795, "num_tokens": 31002646.0, "step": 13890 }, { "entropy": 5.505196619033813, "epoch": 1.560566069523221, "grad_norm": 1.3828125, "learning_rate": 0.00047659604190083076, "loss": 5.4008, "mean_token_accuracy": 0.1821158915758133, "num_tokens": 31014405.0, "step": 13895 }, { "entropy": 5.5668925762176515, "epoch": 1.5611276464311787, "grad_norm": 1.21875, "learning_rate": 0.00047657820906512585, "loss": 5.3414, "mean_token_accuracy": 0.18443161994218826, "num_tokens": 31025529.0, "step": 13900 }, { "entropy": 5.684357118606568, "epoch": 1.5616892233391364, "grad_norm": 1.3984375, "learning_rate": 0.00047656036981109256, "loss": 5.487, "mean_token_accuracy": 0.17803749591112136, "num_tokens": 31037558.0, "step": 13905 }, { "entropy": 5.430062532424927, "epoch": 1.5622508002470938, "grad_norm": 1.484375, "learning_rate": 0.00047654252413929896, "loss": 5.2432, "mean_token_accuracy": 0.19305500388145447, "num_tokens": 31048918.0, "step": 13910 }, { "entropy": 5.454860258102417, "epoch": 1.5628123771550513, "grad_norm": 1.421875, "learning_rate": 0.00047652467205031317, "loss": 5.3506, "mean_token_accuracy": 0.1870207667350769, "num_tokens": 31060149.0, "step": 13915 }, { "entropy": 5.548892307281494, "epoch": 1.563373954063009, "grad_norm": 1.2734375, "learning_rate": 0.00047650681354470363, "loss": 5.3699, "mean_token_accuracy": 0.18815428167581558, "num_tokens": 31071197.0, "step": 13920 }, { "entropy": 5.613787508010864, "epoch": 1.5639355309709666, "grad_norm": 1.375, "learning_rate": 0.00047648894862303907, "loss": 5.4866, "mean_token_accuracy": 0.18950826525688172, "num_tokens": 31083385.0, "step": 13925 }, { "entropy": 5.54557957649231, "epoch": 1.564497107878924, "grad_norm": 1.3671875, "learning_rate": 0.00047647107728588826, "loss": 5.39, "mean_token_accuracy": 0.18100087195634842, "num_tokens": 31094807.0, "step": 13930 }, { "entropy": 5.502994585037231, "epoch": 1.5650586847868815, "grad_norm": 1.296875, "learning_rate": 0.00047645319953382024, "loss": 5.3025, "mean_token_accuracy": 0.19468299448490142, "num_tokens": 31105622.0, "step": 13935 }, { "entropy": 5.588700962066651, "epoch": 1.5656202616948391, "grad_norm": 1.5703125, "learning_rate": 0.00047643531536740405, "loss": 5.3365, "mean_token_accuracy": 0.18804485201835633, "num_tokens": 31115684.0, "step": 13940 }, { "entropy": 5.490893077850342, "epoch": 1.5661818386027968, "grad_norm": 1.421875, "learning_rate": 0.0004764174247872094, "loss": 5.3033, "mean_token_accuracy": 0.19590633511543273, "num_tokens": 31126449.0, "step": 13945 }, { "entropy": 5.538293886184692, "epoch": 1.5667434155107542, "grad_norm": 1.3359375, "learning_rate": 0.00047639952779380586, "loss": 5.3283, "mean_token_accuracy": 0.19549835920333863, "num_tokens": 31136894.0, "step": 13950 }, { "entropy": 5.574567747116089, "epoch": 1.5673049924187117, "grad_norm": 1.3359375, "learning_rate": 0.0004763816243877632, "loss": 5.4235, "mean_token_accuracy": 0.18958259820938111, "num_tokens": 31147131.0, "step": 13955 }, { "entropy": 5.464069890975952, "epoch": 1.5678665693266693, "grad_norm": 1.234375, "learning_rate": 0.0004763637145696515, "loss": 5.2629, "mean_token_accuracy": 0.19027214348316193, "num_tokens": 31157903.0, "step": 13960 }, { "entropy": 5.558705472946167, "epoch": 1.5684281462346268, "grad_norm": 1.9296875, "learning_rate": 0.000476345798340041, "loss": 5.4313, "mean_token_accuracy": 0.1850793793797493, "num_tokens": 31169087.0, "step": 13965 }, { "entropy": 5.64756031036377, "epoch": 1.5689897231425842, "grad_norm": 1.4375, "learning_rate": 0.0004763278756995022, "loss": 5.5032, "mean_token_accuracy": 0.17865439653396606, "num_tokens": 31180253.0, "step": 13970 }, { "entropy": 5.640758609771728, "epoch": 1.5695513000505419, "grad_norm": 1.640625, "learning_rate": 0.00047630994664860576, "loss": 5.4382, "mean_token_accuracy": 0.18289659172296524, "num_tokens": 31191857.0, "step": 13975 }, { "entropy": 5.55273962020874, "epoch": 1.5701128769584995, "grad_norm": 1.25, "learning_rate": 0.0004762920111879226, "loss": 5.4536, "mean_token_accuracy": 0.1757165178656578, "num_tokens": 31201868.0, "step": 13980 }, { "entropy": 5.563938236236572, "epoch": 1.570674453866457, "grad_norm": 1.2578125, "learning_rate": 0.0004762740693180237, "loss": 5.4015, "mean_token_accuracy": 0.18728701025247574, "num_tokens": 31212716.0, "step": 13985 }, { "entropy": 5.596206521987915, "epoch": 1.5712360307744144, "grad_norm": 1.4375, "learning_rate": 0.00047625612103948035, "loss": 5.474, "mean_token_accuracy": 0.17948551028966903, "num_tokens": 31224823.0, "step": 13990 }, { "entropy": 5.570262765884399, "epoch": 1.571797607682372, "grad_norm": 1.4296875, "learning_rate": 0.0004762381663528641, "loss": 5.3656, "mean_token_accuracy": 0.1848146378993988, "num_tokens": 31236798.0, "step": 13995 }, { "entropy": 5.609161281585694, "epoch": 1.5723591845903298, "grad_norm": 1.5078125, "learning_rate": 0.0004762202052587466, "loss": 5.3998, "mean_token_accuracy": 0.1816373810172081, "num_tokens": 31248687.0, "step": 14000 }, { "entropy": 5.572255611419678, "epoch": 1.5729207614982872, "grad_norm": 1.4296875, "learning_rate": 0.0004762022377576996, "loss": 5.4599, "mean_token_accuracy": 0.18094970881938935, "num_tokens": 31258385.0, "step": 14005 }, { "entropy": 5.676636552810669, "epoch": 1.5734823384062446, "grad_norm": 1.2109375, "learning_rate": 0.0004761842638502954, "loss": 5.4744, "mean_token_accuracy": 0.1854086771607399, "num_tokens": 31269308.0, "step": 14010 }, { "entropy": 5.608185768127441, "epoch": 1.5740439153142023, "grad_norm": 1.25, "learning_rate": 0.0004761662835371062, "loss": 5.3744, "mean_token_accuracy": 0.18948292285203933, "num_tokens": 31279900.0, "step": 14015 }, { "entropy": 5.543855428695679, "epoch": 1.57460549222216, "grad_norm": 1.4609375, "learning_rate": 0.0004761482968187045, "loss": 5.3849, "mean_token_accuracy": 0.1922425866127014, "num_tokens": 31290456.0, "step": 14020 }, { "entropy": 5.491939544677734, "epoch": 1.5751670691301174, "grad_norm": 1.5390625, "learning_rate": 0.0004761303036956631, "loss": 5.3621, "mean_token_accuracy": 0.18260688036680223, "num_tokens": 31301398.0, "step": 14025 }, { "entropy": 5.658075141906738, "epoch": 1.5757286460380748, "grad_norm": 1.3203125, "learning_rate": 0.0004761123041685547, "loss": 5.4558, "mean_token_accuracy": 0.1853075996041298, "num_tokens": 31311149.0, "step": 14030 }, { "entropy": 5.464800119400024, "epoch": 1.5762902229460325, "grad_norm": 1.28125, "learning_rate": 0.0004760942982379526, "loss": 5.2795, "mean_token_accuracy": 0.1985880345106125, "num_tokens": 31321099.0, "step": 14035 }, { "entropy": 5.521101665496826, "epoch": 1.5768517998539902, "grad_norm": 1.4765625, "learning_rate": 0.00047607628590443004, "loss": 5.413, "mean_token_accuracy": 0.1805889293551445, "num_tokens": 31331872.0, "step": 14040 }, { "entropy": 5.685874986648559, "epoch": 1.5774133767619476, "grad_norm": 1.3828125, "learning_rate": 0.00047605826716856056, "loss": 5.4529, "mean_token_accuracy": 0.1793512836098671, "num_tokens": 31342024.0, "step": 14045 }, { "entropy": 5.614808082580566, "epoch": 1.577974953669905, "grad_norm": 1.546875, "learning_rate": 0.0004760402420309178, "loss": 5.2957, "mean_token_accuracy": 0.1913559079170227, "num_tokens": 31351857.0, "step": 14050 }, { "entropy": 5.503947019577026, "epoch": 1.5785365305778627, "grad_norm": 1.6796875, "learning_rate": 0.0004760222104920759, "loss": 5.3928, "mean_token_accuracy": 0.18860056549310683, "num_tokens": 31362609.0, "step": 14055 }, { "entropy": 5.478338956832886, "epoch": 1.5790981074858201, "grad_norm": 1.296875, "learning_rate": 0.0004760041725526088, "loss": 5.3232, "mean_token_accuracy": 0.18444042205810546, "num_tokens": 31373129.0, "step": 14060 }, { "entropy": 5.550362205505371, "epoch": 1.5796596843937776, "grad_norm": 1.453125, "learning_rate": 0.00047598612821309077, "loss": 5.2925, "mean_token_accuracy": 0.1911611244082451, "num_tokens": 31383109.0, "step": 14065 }, { "entropy": 5.484701251983642, "epoch": 1.5802212613017352, "grad_norm": 1.609375, "learning_rate": 0.0004759680774740966, "loss": 5.2678, "mean_token_accuracy": 0.18637271523475646, "num_tokens": 31393603.0, "step": 14070 }, { "entropy": 5.60389404296875, "epoch": 1.580782838209693, "grad_norm": 1.6953125, "learning_rate": 0.0004759500203362008, "loss": 5.3491, "mean_token_accuracy": 0.18680666238069535, "num_tokens": 31404011.0, "step": 14075 }, { "entropy": 5.502894592285156, "epoch": 1.5813444151176503, "grad_norm": 1.3359375, "learning_rate": 0.0004759319567999785, "loss": 5.2939, "mean_token_accuracy": 0.18432048857212066, "num_tokens": 31414239.0, "step": 14080 }, { "entropy": 5.53234281539917, "epoch": 1.5819059920256078, "grad_norm": 1.6171875, "learning_rate": 0.0004759138868660048, "loss": 5.4073, "mean_token_accuracy": 0.18384866714477538, "num_tokens": 31425055.0, "step": 14085 }, { "entropy": 5.602566194534302, "epoch": 1.5824675689335654, "grad_norm": 1.390625, "learning_rate": 0.00047589581053485494, "loss": 5.3752, "mean_token_accuracy": 0.18901110738515853, "num_tokens": 31435537.0, "step": 14090 }, { "entropy": 5.62176251411438, "epoch": 1.583029145841523, "grad_norm": 1.6171875, "learning_rate": 0.00047587772780710455, "loss": 5.4438, "mean_token_accuracy": 0.18455122858285905, "num_tokens": 31446056.0, "step": 14095 }, { "entropy": 5.594608354568481, "epoch": 1.5835907227494805, "grad_norm": 1.59375, "learning_rate": 0.00047585963868332945, "loss": 5.4112, "mean_token_accuracy": 0.18492064177989959, "num_tokens": 31457452.0, "step": 14100 }, { "entropy": 5.514397048950196, "epoch": 1.584152299657438, "grad_norm": 1.2890625, "learning_rate": 0.0004758415431641055, "loss": 5.359, "mean_token_accuracy": 0.1876969188451767, "num_tokens": 31469038.0, "step": 14105 }, { "entropy": 5.5730689525604244, "epoch": 1.5847138765653956, "grad_norm": 1.4453125, "learning_rate": 0.0004758234412500089, "loss": 5.4638, "mean_token_accuracy": 0.1851399928331375, "num_tokens": 31481069.0, "step": 14110 }, { "entropy": 5.519595813751221, "epoch": 1.5852754534733533, "grad_norm": 1.5, "learning_rate": 0.00047580533294161616, "loss": 5.4108, "mean_token_accuracy": 0.18213094621896744, "num_tokens": 31491393.0, "step": 14115 }, { "entropy": 5.528887176513672, "epoch": 1.5858370303813107, "grad_norm": 1.5390625, "learning_rate": 0.0004757872182395036, "loss": 5.4077, "mean_token_accuracy": 0.18127547353506088, "num_tokens": 31502627.0, "step": 14120 }, { "entropy": 5.699723100662231, "epoch": 1.5863986072892682, "grad_norm": 1.3359375, "learning_rate": 0.00047576909714424823, "loss": 5.4438, "mean_token_accuracy": 0.17827050983905793, "num_tokens": 31513995.0, "step": 14125 }, { "entropy": 5.525648593902588, "epoch": 1.5869601841972258, "grad_norm": 1.53125, "learning_rate": 0.00047575096965642687, "loss": 5.3752, "mean_token_accuracy": 0.18316685557365417, "num_tokens": 31524625.0, "step": 14130 }, { "entropy": 5.481736183166504, "epoch": 1.5875217611051835, "grad_norm": 1.28125, "learning_rate": 0.00047573283577661684, "loss": 5.3392, "mean_token_accuracy": 0.18936698287725448, "num_tokens": 31535940.0, "step": 14135 }, { "entropy": 5.566658544540405, "epoch": 1.588083338013141, "grad_norm": 1.4921875, "learning_rate": 0.0004757146955053955, "loss": 5.3906, "mean_token_accuracy": 0.1862411007285118, "num_tokens": 31546557.0, "step": 14140 }, { "entropy": 5.578667545318604, "epoch": 1.5886449149210984, "grad_norm": 1.3359375, "learning_rate": 0.00047569654884334036, "loss": 5.4245, "mean_token_accuracy": 0.17833538800477983, "num_tokens": 31559335.0, "step": 14145 }, { "entropy": 5.6002030849456785, "epoch": 1.589206491829056, "grad_norm": 1.3125, "learning_rate": 0.0004756783957910292, "loss": 5.3658, "mean_token_accuracy": 0.18090360909700393, "num_tokens": 31570698.0, "step": 14150 }, { "entropy": 5.581079721450806, "epoch": 1.5897680687370135, "grad_norm": 1.265625, "learning_rate": 0.00047566023634904015, "loss": 5.4318, "mean_token_accuracy": 0.18585970848798752, "num_tokens": 31582524.0, "step": 14155 }, { "entropy": 5.575134134292602, "epoch": 1.590329645644971, "grad_norm": 1.34375, "learning_rate": 0.0004756420705179513, "loss": 5.3635, "mean_token_accuracy": 0.18733209520578384, "num_tokens": 31593399.0, "step": 14160 }, { "entropy": 5.506226110458374, "epoch": 1.5908912225529286, "grad_norm": 1.34375, "learning_rate": 0.0004756238982983412, "loss": 5.3904, "mean_token_accuracy": 0.17625253051519393, "num_tokens": 31604169.0, "step": 14165 }, { "entropy": 5.500355672836304, "epoch": 1.5914527994608862, "grad_norm": 1.2890625, "learning_rate": 0.0004756057196907883, "loss": 5.3312, "mean_token_accuracy": 0.19254590421915055, "num_tokens": 31614671.0, "step": 14170 }, { "entropy": 5.490681123733521, "epoch": 1.5920143763688437, "grad_norm": 1.1953125, "learning_rate": 0.00047558753469587154, "loss": 5.3185, "mean_token_accuracy": 0.19051374346017838, "num_tokens": 31625793.0, "step": 14175 }, { "entropy": 5.542859077453613, "epoch": 1.5925759532768011, "grad_norm": 1.2578125, "learning_rate": 0.00047556934331416986, "loss": 5.3358, "mean_token_accuracy": 0.19105246514081956, "num_tokens": 31637632.0, "step": 14180 }, { "entropy": 5.545540714263916, "epoch": 1.5931375301847588, "grad_norm": 1.328125, "learning_rate": 0.0004755511455462624, "loss": 5.3291, "mean_token_accuracy": 0.19029556959867477, "num_tokens": 31648314.0, "step": 14185 }, { "entropy": 5.577873563766479, "epoch": 1.5936991070927164, "grad_norm": 1.328125, "learning_rate": 0.0004755329413927287, "loss": 5.3908, "mean_token_accuracy": 0.18803092539310456, "num_tokens": 31659152.0, "step": 14190 }, { "entropy": 5.5810370445251465, "epoch": 1.5942606840006739, "grad_norm": 1.3046875, "learning_rate": 0.0004755147308541485, "loss": 5.3344, "mean_token_accuracy": 0.19057308733463288, "num_tokens": 31669837.0, "step": 14195 }, { "entropy": 5.511269760131836, "epoch": 1.5948222609086313, "grad_norm": 1.6171875, "learning_rate": 0.00047549651393110145, "loss": 5.3664, "mean_token_accuracy": 0.18276496827602387, "num_tokens": 31680663.0, "step": 14200 }, { "entropy": 5.553107500076294, "epoch": 1.595383837816589, "grad_norm": 1.8359375, "learning_rate": 0.00047547829062416757, "loss": 5.3588, "mean_token_accuracy": 0.18153503388166428, "num_tokens": 31691484.0, "step": 14205 }, { "entropy": 5.55496916770935, "epoch": 1.5959454147245467, "grad_norm": 1.25, "learning_rate": 0.00047546006093392726, "loss": 5.31, "mean_token_accuracy": 0.18103923350572587, "num_tokens": 31701642.0, "step": 14210 }, { "entropy": 5.492617607116699, "epoch": 1.596506991632504, "grad_norm": 1.3984375, "learning_rate": 0.0004754418248609608, "loss": 5.3719, "mean_token_accuracy": 0.1854472577571869, "num_tokens": 31714203.0, "step": 14215 }, { "entropy": 5.548641633987427, "epoch": 1.5970685685404615, "grad_norm": 1.53125, "learning_rate": 0.0004754235824058489, "loss": 5.3546, "mean_token_accuracy": 0.18786930292844772, "num_tokens": 31725890.0, "step": 14220 }, { "entropy": 5.523428344726563, "epoch": 1.5976301454484192, "grad_norm": 1.625, "learning_rate": 0.0004754053335691724, "loss": 5.3097, "mean_token_accuracy": 0.18873031437397003, "num_tokens": 31738058.0, "step": 14225 }, { "entropy": 5.5686602115631105, "epoch": 1.5981917223563769, "grad_norm": 1.1875, "learning_rate": 0.00047538707835151237, "loss": 5.3769, "mean_token_accuracy": 0.19276683628559113, "num_tokens": 31748983.0, "step": 14230 }, { "entropy": 5.562123250961304, "epoch": 1.5987532992643343, "grad_norm": 1.265625, "learning_rate": 0.00047536881675345, "loss": 5.3753, "mean_token_accuracy": 0.18837305456399916, "num_tokens": 31760083.0, "step": 14235 }, { "entropy": 5.50814642906189, "epoch": 1.5993148761722917, "grad_norm": 1.5, "learning_rate": 0.0004753505487755669, "loss": 5.3182, "mean_token_accuracy": 0.19211919456720353, "num_tokens": 31771627.0, "step": 14240 }, { "entropy": 5.563792991638183, "epoch": 1.5998764530802494, "grad_norm": 1.375, "learning_rate": 0.00047533227441844453, "loss": 5.4112, "mean_token_accuracy": 0.19014624506235123, "num_tokens": 31783476.0, "step": 14245 }, { "entropy": 5.61142635345459, "epoch": 1.6004380299882068, "grad_norm": 1.765625, "learning_rate": 0.00047531399368266485, "loss": 5.4226, "mean_token_accuracy": 0.18333071917295457, "num_tokens": 31794072.0, "step": 14250 }, { "entropy": 5.547273302078247, "epoch": 1.6009996068961643, "grad_norm": 1.2734375, "learning_rate": 0.0004752957065688099, "loss": 5.3179, "mean_token_accuracy": 0.19077218621969222, "num_tokens": 31803613.0, "step": 14255 }, { "entropy": 5.63131275177002, "epoch": 1.601561183804122, "grad_norm": 1.515625, "learning_rate": 0.000475277413077462, "loss": 5.4515, "mean_token_accuracy": 0.18376434296369554, "num_tokens": 31815018.0, "step": 14260 }, { "entropy": 5.41245551109314, "epoch": 1.6021227607120796, "grad_norm": 1.65625, "learning_rate": 0.00047525911320920363, "loss": 5.288, "mean_token_accuracy": 0.19167415499687196, "num_tokens": 31825603.0, "step": 14265 }, { "entropy": 5.483716344833374, "epoch": 1.602684337620037, "grad_norm": 1.34375, "learning_rate": 0.0004752408069646174, "loss": 5.3519, "mean_token_accuracy": 0.18703959584236146, "num_tokens": 31835988.0, "step": 14270 }, { "entropy": 5.582781457901001, "epoch": 1.6032459145279945, "grad_norm": 1.40625, "learning_rate": 0.00047522249434428623, "loss": 5.3838, "mean_token_accuracy": 0.1827508196234703, "num_tokens": 31846378.0, "step": 14275 }, { "entropy": 5.6581432819366455, "epoch": 1.6038074914359521, "grad_norm": 1.515625, "learning_rate": 0.0004752041753487931, "loss": 5.4543, "mean_token_accuracy": 0.17981308996677398, "num_tokens": 31858836.0, "step": 14280 }, { "entropy": 5.505344343185425, "epoch": 1.6043690683439098, "grad_norm": 2.609375, "learning_rate": 0.0004751858499787215, "loss": 5.3224, "mean_token_accuracy": 0.18830745071172714, "num_tokens": 31869315.0, "step": 14285 }, { "entropy": 5.605330228805542, "epoch": 1.6049306452518672, "grad_norm": 2.28125, "learning_rate": 0.0004751675182346547, "loss": 5.5195, "mean_token_accuracy": 0.17846543937921525, "num_tokens": 31880527.0, "step": 14290 }, { "entropy": 5.636462545394897, "epoch": 1.6054922221598247, "grad_norm": 1.765625, "learning_rate": 0.00047514918011717656, "loss": 5.3828, "mean_token_accuracy": 0.18812797218561172, "num_tokens": 31891890.0, "step": 14295 }, { "entropy": 5.603710079193116, "epoch": 1.6060537990677823, "grad_norm": 1.5859375, "learning_rate": 0.00047513083562687085, "loss": 5.3857, "mean_token_accuracy": 0.18741926103830336, "num_tokens": 31902735.0, "step": 14300 }, { "entropy": 5.541609287261963, "epoch": 1.60661537597574, "grad_norm": 1.578125, "learning_rate": 0.0004751124847643217, "loss": 5.437, "mean_token_accuracy": 0.1817302241921425, "num_tokens": 31914504.0, "step": 14305 }, { "entropy": 5.598568391799927, "epoch": 1.6071769528836974, "grad_norm": 1.46875, "learning_rate": 0.0004750941275301135, "loss": 5.3956, "mean_token_accuracy": 0.18769104033708572, "num_tokens": 31925287.0, "step": 14310 }, { "entropy": 5.546432113647461, "epoch": 1.6077385297916549, "grad_norm": 1.84375, "learning_rate": 0.0004750757639248306, "loss": 5.3295, "mean_token_accuracy": 0.19074969589710236, "num_tokens": 31935845.0, "step": 14315 }, { "entropy": 5.5763781547546385, "epoch": 1.6083001066996125, "grad_norm": 1.3125, "learning_rate": 0.00047505739394905776, "loss": 5.415, "mean_token_accuracy": 0.18895251154899598, "num_tokens": 31946771.0, "step": 14320 }, { "entropy": 5.539247798919678, "epoch": 1.6088616836075702, "grad_norm": 1.3828125, "learning_rate": 0.00047503901760338003, "loss": 5.3768, "mean_token_accuracy": 0.18517448455095292, "num_tokens": 31957733.0, "step": 14325 }, { "entropy": 5.55397400856018, "epoch": 1.6094232605155276, "grad_norm": 1.546875, "learning_rate": 0.00047502063488838225, "loss": 5.2744, "mean_token_accuracy": 0.19239411056041716, "num_tokens": 31967809.0, "step": 14330 }, { "entropy": 5.42648458480835, "epoch": 1.609984837423485, "grad_norm": 1.3984375, "learning_rate": 0.00047500224580464994, "loss": 5.2446, "mean_token_accuracy": 0.1935966953635216, "num_tokens": 31978673.0, "step": 14335 }, { "entropy": 5.491064739227295, "epoch": 1.6105464143314427, "grad_norm": 1.3046875, "learning_rate": 0.00047498385035276856, "loss": 5.3765, "mean_token_accuracy": 0.18715526312589645, "num_tokens": 31990535.0, "step": 14340 }, { "entropy": 5.580092477798462, "epoch": 1.6111079912394002, "grad_norm": 1.6640625, "learning_rate": 0.0004749654485333238, "loss": 5.4287, "mean_token_accuracy": 0.1823533996939659, "num_tokens": 32002164.0, "step": 14345 }, { "entropy": 5.6803051948547365, "epoch": 1.6116695681473576, "grad_norm": 2.109375, "learning_rate": 0.00047494704034690163, "loss": 5.4777, "mean_token_accuracy": 0.17761383950710297, "num_tokens": 32013651.0, "step": 14350 }, { "entropy": 5.604819202423096, "epoch": 1.6122311450553153, "grad_norm": 1.59375, "learning_rate": 0.00047492862579408816, "loss": 5.3738, "mean_token_accuracy": 0.18794151097536088, "num_tokens": 32025128.0, "step": 14355 }, { "entropy": 5.550415658950806, "epoch": 1.612792721963273, "grad_norm": 1.828125, "learning_rate": 0.00047491020487546966, "loss": 5.407, "mean_token_accuracy": 0.17649219334125518, "num_tokens": 32036359.0, "step": 14360 }, { "entropy": 5.558035135269165, "epoch": 1.6133542988712304, "grad_norm": 1.4765625, "learning_rate": 0.0004748917775916327, "loss": 5.3206, "mean_token_accuracy": 0.18939928710460663, "num_tokens": 32047803.0, "step": 14365 }, { "entropy": 5.541605043411255, "epoch": 1.6139158757791878, "grad_norm": 1.3828125, "learning_rate": 0.00047487334394316405, "loss": 5.4889, "mean_token_accuracy": 0.183787302672863, "num_tokens": 32060156.0, "step": 14370 }, { "entropy": 5.596155071258545, "epoch": 1.6144774526871455, "grad_norm": 1.6015625, "learning_rate": 0.0004748549039306506, "loss": 5.3777, "mean_token_accuracy": 0.18946214765310287, "num_tokens": 32071398.0, "step": 14375 }, { "entropy": 5.495157909393311, "epoch": 1.6150390295951031, "grad_norm": 1.4921875, "learning_rate": 0.0004748364575546795, "loss": 5.2052, "mean_token_accuracy": 0.1963065445423126, "num_tokens": 32082472.0, "step": 14380 }, { "entropy": 5.486556148529052, "epoch": 1.6156006065030606, "grad_norm": 1.21875, "learning_rate": 0.00047481800481583806, "loss": 5.3856, "mean_token_accuracy": 0.18367727398872374, "num_tokens": 32093103.0, "step": 14385 }, { "entropy": 5.569084644317627, "epoch": 1.616162183411018, "grad_norm": 1.28125, "learning_rate": 0.0004747995457147139, "loss": 5.3978, "mean_token_accuracy": 0.1878577098250389, "num_tokens": 32104526.0, "step": 14390 }, { "entropy": 5.643805456161499, "epoch": 1.6167237603189757, "grad_norm": 1.6015625, "learning_rate": 0.00047478108025189467, "loss": 5.4471, "mean_token_accuracy": 0.1791172981262207, "num_tokens": 32116018.0, "step": 14395 }, { "entropy": 5.530964612960815, "epoch": 1.6172853372269334, "grad_norm": 1.609375, "learning_rate": 0.00047476260842796837, "loss": 5.2966, "mean_token_accuracy": 0.19313062429428102, "num_tokens": 32127385.0, "step": 14400 }, { "entropy": 5.568222522735596, "epoch": 1.6178469141348908, "grad_norm": 1.4453125, "learning_rate": 0.0004747441302435231, "loss": 5.4237, "mean_token_accuracy": 0.18586568534374237, "num_tokens": 32137376.0, "step": 14405 }, { "entropy": 5.570278549194336, "epoch": 1.6184084910428482, "grad_norm": 1.3828125, "learning_rate": 0.00047472564569914726, "loss": 5.4094, "mean_token_accuracy": 0.18463828414678574, "num_tokens": 32148263.0, "step": 14410 }, { "entropy": 5.5898205757141115, "epoch": 1.618970067950806, "grad_norm": 1.40625, "learning_rate": 0.00047470715479542945, "loss": 5.3361, "mean_token_accuracy": 0.18114308267831802, "num_tokens": 32161323.0, "step": 14415 }, { "entropy": 5.596181488037109, "epoch": 1.6195316448587636, "grad_norm": 1.6484375, "learning_rate": 0.0004746886575329584, "loss": 5.398, "mean_token_accuracy": 0.17863700091838836, "num_tokens": 32172294.0, "step": 14420 }, { "entropy": 5.478462219238281, "epoch": 1.620093221766721, "grad_norm": 1.5859375, "learning_rate": 0.00047467015391232305, "loss": 5.3537, "mean_token_accuracy": 0.17806696742773057, "num_tokens": 32182619.0, "step": 14425 }, { "entropy": 5.515846109390258, "epoch": 1.6206547986746784, "grad_norm": 1.2890625, "learning_rate": 0.00047465164393411245, "loss": 5.3377, "mean_token_accuracy": 0.18611229509115218, "num_tokens": 32193078.0, "step": 14430 }, { "entropy": 5.565969944000244, "epoch": 1.621216375582636, "grad_norm": 1.7578125, "learning_rate": 0.00047463312759891615, "loss": 5.3396, "mean_token_accuracy": 0.18058524578809737, "num_tokens": 32204134.0, "step": 14435 }, { "entropy": 5.634787082672119, "epoch": 1.6217779524905935, "grad_norm": 1.3515625, "learning_rate": 0.0004746146049073236, "loss": 5.4189, "mean_token_accuracy": 0.1862504377961159, "num_tokens": 32215136.0, "step": 14440 }, { "entropy": 5.527179718017578, "epoch": 1.622339529398551, "grad_norm": 1.46875, "learning_rate": 0.00047459607585992466, "loss": 5.4068, "mean_token_accuracy": 0.18511534482240677, "num_tokens": 32225727.0, "step": 14445 }, { "entropy": 5.558506059646606, "epoch": 1.6229011063065086, "grad_norm": 1.625, "learning_rate": 0.00047457754045730923, "loss": 5.3752, "mean_token_accuracy": 0.1840720921754837, "num_tokens": 32236376.0, "step": 14450 }, { "entropy": 5.51150336265564, "epoch": 1.6234626832144663, "grad_norm": 1.4765625, "learning_rate": 0.00047455899870006745, "loss": 5.3122, "mean_token_accuracy": 0.1918402850627899, "num_tokens": 32247202.0, "step": 14455 }, { "entropy": 5.516626405715942, "epoch": 1.6240242601224237, "grad_norm": 1.390625, "learning_rate": 0.0004745404505887899, "loss": 5.4447, "mean_token_accuracy": 0.18239740282297134, "num_tokens": 32258625.0, "step": 14460 }, { "entropy": 5.598090410232544, "epoch": 1.6245858370303812, "grad_norm": 1.7734375, "learning_rate": 0.0004745218961240669, "loss": 5.3397, "mean_token_accuracy": 0.1882559359073639, "num_tokens": 32269288.0, "step": 14465 }, { "entropy": 5.580713844299316, "epoch": 1.6251474139383388, "grad_norm": 1.5, "learning_rate": 0.0004745033353064893, "loss": 5.3915, "mean_token_accuracy": 0.18425026386976243, "num_tokens": 32279888.0, "step": 14470 }, { "entropy": 5.590251159667969, "epoch": 1.6257089908462965, "grad_norm": 1.5625, "learning_rate": 0.0004744847681366482, "loss": 5.3984, "mean_token_accuracy": 0.19061071127653123, "num_tokens": 32291153.0, "step": 14475 }, { "entropy": 5.473784732818603, "epoch": 1.626270567754254, "grad_norm": 1.2890625, "learning_rate": 0.00047446619461513466, "loss": 5.2835, "mean_token_accuracy": 0.18975742161273956, "num_tokens": 32302291.0, "step": 14480 }, { "entropy": 5.510013628005981, "epoch": 1.6268321446622114, "grad_norm": 1.53125, "learning_rate": 0.0004744476147425402, "loss": 5.2811, "mean_token_accuracy": 0.19587058573961258, "num_tokens": 32312015.0, "step": 14485 }, { "entropy": 5.558365535736084, "epoch": 1.627393721570169, "grad_norm": 1.6171875, "learning_rate": 0.00047442902851945634, "loss": 5.4003, "mean_token_accuracy": 0.1832302913069725, "num_tokens": 32323967.0, "step": 14490 }, { "entropy": 5.5684449672698975, "epoch": 1.6279552984781267, "grad_norm": 1.4609375, "learning_rate": 0.00047441043594647486, "loss": 5.4173, "mean_token_accuracy": 0.17932213246822357, "num_tokens": 32336181.0, "step": 14495 }, { "entropy": 5.585696220397949, "epoch": 1.6285168753860841, "grad_norm": 1.328125, "learning_rate": 0.00047439183702418765, "loss": 5.3534, "mean_token_accuracy": 0.1898641675710678, "num_tokens": 32346843.0, "step": 14500 }, { "entropy": 5.596896839141846, "epoch": 1.6290784522940416, "grad_norm": 1.8359375, "learning_rate": 0.00047437323175318716, "loss": 5.4467, "mean_token_accuracy": 0.18356406092643737, "num_tokens": 32358511.0, "step": 14505 }, { "entropy": 5.567827415466309, "epoch": 1.6296400292019992, "grad_norm": 1.5390625, "learning_rate": 0.00047435462013406554, "loss": 5.3398, "mean_token_accuracy": 0.18778470605611802, "num_tokens": 32370319.0, "step": 14510 }, { "entropy": 5.555706453323364, "epoch": 1.630201606109957, "grad_norm": 1.3046875, "learning_rate": 0.0004743360021674155, "loss": 5.4285, "mean_token_accuracy": 0.18525870591402055, "num_tokens": 32381455.0, "step": 14515 }, { "entropy": 5.579962825775146, "epoch": 1.6307631830179143, "grad_norm": 1.3671875, "learning_rate": 0.00047431737785382996, "loss": 5.4032, "mean_token_accuracy": 0.18517621904611586, "num_tokens": 32392553.0, "step": 14520 }, { "entropy": 5.733662414550781, "epoch": 1.6313247599258718, "grad_norm": 1.5078125, "learning_rate": 0.00047429874719390165, "loss": 5.4754, "mean_token_accuracy": 0.18362810909748079, "num_tokens": 32404736.0, "step": 14525 }, { "entropy": 5.5754382610321045, "epoch": 1.6318863368338294, "grad_norm": 1.4921875, "learning_rate": 0.00047428011018822404, "loss": 5.3613, "mean_token_accuracy": 0.18830402046442032, "num_tokens": 32415089.0, "step": 14530 }, { "entropy": 5.501427221298218, "epoch": 1.6324479137417869, "grad_norm": 1.4296875, "learning_rate": 0.00047426146683739043, "loss": 5.3667, "mean_token_accuracy": 0.18111147731542587, "num_tokens": 32426814.0, "step": 14535 }, { "entropy": 5.560883188247681, "epoch": 1.6330094906497443, "grad_norm": 1.8828125, "learning_rate": 0.00047424281714199436, "loss": 5.4213, "mean_token_accuracy": 0.17635942846536637, "num_tokens": 32437173.0, "step": 14540 }, { "entropy": 5.584721612930298, "epoch": 1.633571067557702, "grad_norm": 1.4140625, "learning_rate": 0.00047422416110262975, "loss": 5.393, "mean_token_accuracy": 0.18085627853870392, "num_tokens": 32448597.0, "step": 14545 }, { "entropy": 5.672222852706909, "epoch": 1.6341326444656596, "grad_norm": 1.71875, "learning_rate": 0.00047420549871989053, "loss": 5.5749, "mean_token_accuracy": 0.17191092818975448, "num_tokens": 32460906.0, "step": 14550 }, { "entropy": 5.663802146911621, "epoch": 1.634694221373617, "grad_norm": 1.40625, "learning_rate": 0.000474186829994371, "loss": 5.3813, "mean_token_accuracy": 0.18450928777456282, "num_tokens": 32473756.0, "step": 14555 }, { "entropy": 5.5878105640411375, "epoch": 1.6352557982815745, "grad_norm": 1.6171875, "learning_rate": 0.00047416815492666564, "loss": 5.4435, "mean_token_accuracy": 0.1797104686498642, "num_tokens": 32483912.0, "step": 14560 }, { "entropy": 5.566701984405517, "epoch": 1.6358173751895322, "grad_norm": 1.46875, "learning_rate": 0.0004741494735173689, "loss": 5.3784, "mean_token_accuracy": 0.17997499853372573, "num_tokens": 32493899.0, "step": 14565 }, { "entropy": 5.574539089202881, "epoch": 1.6363789520974898, "grad_norm": 1.3671875, "learning_rate": 0.0004741307857670757, "loss": 5.401, "mean_token_accuracy": 0.18635640144348145, "num_tokens": 32505215.0, "step": 14570 }, { "entropy": 5.566939735412598, "epoch": 1.6369405290054473, "grad_norm": 1.4921875, "learning_rate": 0.00047411209167638106, "loss": 5.4666, "mean_token_accuracy": 0.1814038038253784, "num_tokens": 32517288.0, "step": 14575 }, { "entropy": 5.639643812179566, "epoch": 1.6375021059134047, "grad_norm": 1.609375, "learning_rate": 0.0004740933912458801, "loss": 5.4262, "mean_token_accuracy": 0.18364346027374268, "num_tokens": 32529705.0, "step": 14580 }, { "entropy": 5.718049049377441, "epoch": 1.6380636828213624, "grad_norm": 1.421875, "learning_rate": 0.00047407468447616845, "loss": 5.4315, "mean_token_accuracy": 0.18514339476823807, "num_tokens": 32540868.0, "step": 14585 }, { "entropy": 5.495394134521485, "epoch": 1.63862525972932, "grad_norm": 1.5234375, "learning_rate": 0.00047405597136784166, "loss": 5.3822, "mean_token_accuracy": 0.18800296634435654, "num_tokens": 32552129.0, "step": 14590 }, { "entropy": 5.505461692810059, "epoch": 1.6391868366372775, "grad_norm": 1.71875, "learning_rate": 0.0004740372519214955, "loss": 5.303, "mean_token_accuracy": 0.19333642572164536, "num_tokens": 32563059.0, "step": 14595 }, { "entropy": 5.553788805007935, "epoch": 1.639748413545235, "grad_norm": 1.390625, "learning_rate": 0.00047401852613772604, "loss": 5.4939, "mean_token_accuracy": 0.17190300822257995, "num_tokens": 32576628.0, "step": 14600 }, { "entropy": 5.697915983200073, "epoch": 1.6403099904531926, "grad_norm": 1.4765625, "learning_rate": 0.0004739997940171295, "loss": 5.442, "mean_token_accuracy": 0.18500046133995057, "num_tokens": 32589138.0, "step": 14605 }, { "entropy": 5.6585431575775145, "epoch": 1.6408715673611503, "grad_norm": 1.359375, "learning_rate": 0.00047398105556030234, "loss": 5.4269, "mean_token_accuracy": 0.18122628927230836, "num_tokens": 32601865.0, "step": 14610 }, { "entropy": 5.551347351074218, "epoch": 1.6414331442691077, "grad_norm": 1.3125, "learning_rate": 0.00047396231076784123, "loss": 5.389, "mean_token_accuracy": 0.18326832950115204, "num_tokens": 32612439.0, "step": 14615 }, { "entropy": 5.5520836353302006, "epoch": 1.6419947211770651, "grad_norm": 1.5078125, "learning_rate": 0.0004739435596403429, "loss": 5.3862, "mean_token_accuracy": 0.18279039412736892, "num_tokens": 32623002.0, "step": 14620 }, { "entropy": 5.542112588882446, "epoch": 1.6425562980850228, "grad_norm": 1.4296875, "learning_rate": 0.0004739248021784046, "loss": 5.3594, "mean_token_accuracy": 0.1901555374264717, "num_tokens": 32632529.0, "step": 14625 }, { "entropy": 5.594372749328613, "epoch": 1.6431178749929805, "grad_norm": 2.4375, "learning_rate": 0.0004739060383826234, "loss": 5.3717, "mean_token_accuracy": 0.18834180235862732, "num_tokens": 32643584.0, "step": 14630 }, { "entropy": 5.636145973205567, "epoch": 1.6436794519009377, "grad_norm": 1.453125, "learning_rate": 0.00047388726825359673, "loss": 5.4677, "mean_token_accuracy": 0.17899191230535508, "num_tokens": 32655899.0, "step": 14635 }, { "entropy": 5.59476408958435, "epoch": 1.6442410288088953, "grad_norm": 1.5, "learning_rate": 0.00047386849179192235, "loss": 5.4077, "mean_token_accuracy": 0.18391844779253005, "num_tokens": 32666747.0, "step": 14640 }, { "entropy": 5.5709222793579105, "epoch": 1.644802605716853, "grad_norm": 1.359375, "learning_rate": 0.00047384970899819813, "loss": 5.3547, "mean_token_accuracy": 0.18639909625053405, "num_tokens": 32678025.0, "step": 14645 }, { "entropy": 5.5783929347991945, "epoch": 1.6453641826248104, "grad_norm": 1.6796875, "learning_rate": 0.0004738309198730219, "loss": 5.3089, "mean_token_accuracy": 0.1884949326515198, "num_tokens": 32688894.0, "step": 14650 }, { "entropy": 5.545256853103638, "epoch": 1.6459257595327679, "grad_norm": 1.4765625, "learning_rate": 0.00047381212441699217, "loss": 5.4134, "mean_token_accuracy": 0.18252882212400437, "num_tokens": 32699530.0, "step": 14655 }, { "entropy": 5.611769962310791, "epoch": 1.6464873364407255, "grad_norm": 1.4921875, "learning_rate": 0.0004737933226307072, "loss": 5.4599, "mean_token_accuracy": 0.18351722806692122, "num_tokens": 32710969.0, "step": 14660 }, { "entropy": 5.597371339797974, "epoch": 1.6470489133486832, "grad_norm": 1.4296875, "learning_rate": 0.00047377451451476586, "loss": 5.3096, "mean_token_accuracy": 0.19139499962329865, "num_tokens": 32723715.0, "step": 14665 }, { "entropy": 5.516621255874634, "epoch": 1.6476104902566406, "grad_norm": 1.6953125, "learning_rate": 0.0004737557000697668, "loss": 5.3892, "mean_token_accuracy": 0.18492224663496018, "num_tokens": 32735406.0, "step": 14670 }, { "entropy": 5.529916048049927, "epoch": 1.648172067164598, "grad_norm": 1.765625, "learning_rate": 0.0004737368792963092, "loss": 5.3963, "mean_token_accuracy": 0.180710369348526, "num_tokens": 32746123.0, "step": 14675 }, { "entropy": 5.5279628276824955, "epoch": 1.6487336440725557, "grad_norm": 1.5625, "learning_rate": 0.00047371805219499223, "loss": 5.3562, "mean_token_accuracy": 0.18163390457630157, "num_tokens": 32757172.0, "step": 14680 }, { "entropy": 5.475903463363648, "epoch": 1.6492952209805134, "grad_norm": 1.4609375, "learning_rate": 0.00047369921876641547, "loss": 5.2677, "mean_token_accuracy": 0.18968770056962966, "num_tokens": 32767810.0, "step": 14685 }, { "entropy": 5.519390487670899, "epoch": 1.6498567978884708, "grad_norm": 1.53125, "learning_rate": 0.00047368037901117854, "loss": 5.3575, "mean_token_accuracy": 0.1805579200387001, "num_tokens": 32779723.0, "step": 14690 }, { "entropy": 5.715040779113769, "epoch": 1.6504183747964283, "grad_norm": 1.1796875, "learning_rate": 0.0004736615329298812, "loss": 5.6407, "mean_token_accuracy": 0.16966511011123658, "num_tokens": 32793378.0, "step": 14695 }, { "entropy": 5.625489521026611, "epoch": 1.650979951704386, "grad_norm": 1.421875, "learning_rate": 0.00047364268052312367, "loss": 5.3899, "mean_token_accuracy": 0.18817970603704454, "num_tokens": 32805643.0, "step": 14700 }, { "entropy": 5.6128757953643795, "epoch": 1.6515415286123436, "grad_norm": 1.5625, "learning_rate": 0.0004736238217915061, "loss": 5.3579, "mean_token_accuracy": 0.18191513121128083, "num_tokens": 32818275.0, "step": 14705 }, { "entropy": 5.448544979095459, "epoch": 1.652103105520301, "grad_norm": 1.453125, "learning_rate": 0.00047360495673562906, "loss": 5.2436, "mean_token_accuracy": 0.19300651252269746, "num_tokens": 32829548.0, "step": 14710 }, { "entropy": 5.503378009796142, "epoch": 1.6526646824282585, "grad_norm": 1.453125, "learning_rate": 0.0004735860853560931, "loss": 5.438, "mean_token_accuracy": 0.18519551455974578, "num_tokens": 32841472.0, "step": 14715 }, { "entropy": 5.618911838531494, "epoch": 1.6532262593362161, "grad_norm": 1.3125, "learning_rate": 0.00047356720765349926, "loss": 5.455, "mean_token_accuracy": 0.18254597783088683, "num_tokens": 32852589.0, "step": 14720 }, { "entropy": 5.575884246826172, "epoch": 1.6537878362441738, "grad_norm": 1.5859375, "learning_rate": 0.0004735483236284485, "loss": 5.3696, "mean_token_accuracy": 0.18488479107618333, "num_tokens": 32863100.0, "step": 14725 }, { "entropy": 5.642951726913452, "epoch": 1.654349413152131, "grad_norm": 1.453125, "learning_rate": 0.00047352943328154203, "loss": 5.3704, "mean_token_accuracy": 0.18474053591489792, "num_tokens": 32874912.0, "step": 14730 }, { "entropy": 5.496847915649414, "epoch": 1.6549109900600887, "grad_norm": 1.328125, "learning_rate": 0.00047351053661338145, "loss": 5.3078, "mean_token_accuracy": 0.18862911462783813, "num_tokens": 32886249.0, "step": 14735 }, { "entropy": 5.495778131484985, "epoch": 1.6554725669680463, "grad_norm": 1.40625, "learning_rate": 0.0004734916336245684, "loss": 5.3942, "mean_token_accuracy": 0.17536802887916564, "num_tokens": 32898010.0, "step": 14740 }, { "entropy": 5.533234310150147, "epoch": 1.6560341438760038, "grad_norm": 1.3125, "learning_rate": 0.0004734727243157047, "loss": 5.2644, "mean_token_accuracy": 0.18930499851703644, "num_tokens": 32909103.0, "step": 14745 }, { "entropy": 5.517409420013427, "epoch": 1.6565957207839612, "grad_norm": 1.4140625, "learning_rate": 0.00047345380868739253, "loss": 5.3499, "mean_token_accuracy": 0.18766181766986847, "num_tokens": 32919612.0, "step": 14750 }, { "entropy": 5.461494255065918, "epoch": 1.6571572976919189, "grad_norm": 1.609375, "learning_rate": 0.0004734348867402341, "loss": 5.3019, "mean_token_accuracy": 0.19135154634714127, "num_tokens": 32930072.0, "step": 14755 }, { "entropy": 5.66618070602417, "epoch": 1.6577188745998765, "grad_norm": 1.3515625, "learning_rate": 0.0004734159584748319, "loss": 5.5138, "mean_token_accuracy": 0.1844464957714081, "num_tokens": 32941984.0, "step": 14760 }, { "entropy": 5.592111968994141, "epoch": 1.658280451507834, "grad_norm": 1.4296875, "learning_rate": 0.00047339702389178874, "loss": 5.3599, "mean_token_accuracy": 0.19003164023160934, "num_tokens": 32952767.0, "step": 14765 }, { "entropy": 5.589803028106689, "epoch": 1.6588420284157914, "grad_norm": 1.515625, "learning_rate": 0.00047337808299170725, "loss": 5.3993, "mean_token_accuracy": 0.18156627118587493, "num_tokens": 32964553.0, "step": 14770 }, { "entropy": 5.563896179199219, "epoch": 1.659403605323749, "grad_norm": 1.8046875, "learning_rate": 0.00047335913577519075, "loss": 5.3401, "mean_token_accuracy": 0.1827165275812149, "num_tokens": 32975526.0, "step": 14775 }, { "entropy": 5.505002069473266, "epoch": 1.6599651822317067, "grad_norm": 1.2109375, "learning_rate": 0.00047334018224284244, "loss": 5.3922, "mean_token_accuracy": 0.18905986547470094, "num_tokens": 32987025.0, "step": 14780 }, { "entropy": 5.696928310394287, "epoch": 1.6605267591396642, "grad_norm": 1.21875, "learning_rate": 0.0004733212223952657, "loss": 5.393, "mean_token_accuracy": 0.18647790253162383, "num_tokens": 32997447.0, "step": 14785 }, { "entropy": 5.665005445480347, "epoch": 1.6610883360476216, "grad_norm": 1.9921875, "learning_rate": 0.00047330225623306443, "loss": 5.4116, "mean_token_accuracy": 0.18931203484535217, "num_tokens": 33007432.0, "step": 14790 }, { "entropy": 5.550873756408691, "epoch": 1.6616499129555793, "grad_norm": 1.6171875, "learning_rate": 0.00047328328375684237, "loss": 5.4022, "mean_token_accuracy": 0.18748948872089385, "num_tokens": 33018547.0, "step": 14795 }, { "entropy": 5.556125783920288, "epoch": 1.662211489863537, "grad_norm": 1.7109375, "learning_rate": 0.0004732643049672036, "loss": 5.3341, "mean_token_accuracy": 0.1916821777820587, "num_tokens": 33029092.0, "step": 14800 }, { "entropy": 5.5294407367706295, "epoch": 1.6627730667714944, "grad_norm": 1.359375, "learning_rate": 0.0004732453198647525, "loss": 5.3738, "mean_token_accuracy": 0.18623017370700837, "num_tokens": 33040498.0, "step": 14805 }, { "entropy": 5.674070644378662, "epoch": 1.6633346436794518, "grad_norm": 1.5390625, "learning_rate": 0.0004732263284500936, "loss": 5.4432, "mean_token_accuracy": 0.17861680388450624, "num_tokens": 33052203.0, "step": 14810 }, { "entropy": 5.612527561187744, "epoch": 1.6638962205874095, "grad_norm": 1.546875, "learning_rate": 0.0004732073307238314, "loss": 5.3706, "mean_token_accuracy": 0.18829278647899628, "num_tokens": 33063453.0, "step": 14815 }, { "entropy": 5.528048753738403, "epoch": 1.6644577974953672, "grad_norm": 1.7265625, "learning_rate": 0.000473188326686571, "loss": 5.4549, "mean_token_accuracy": 0.18797820508480073, "num_tokens": 33075511.0, "step": 14820 }, { "entropy": 5.544820976257324, "epoch": 1.6650193744033244, "grad_norm": 1.9921875, "learning_rate": 0.00047316931633891736, "loss": 5.4192, "mean_token_accuracy": 0.18570923805236816, "num_tokens": 33086094.0, "step": 14825 }, { "entropy": 5.723085737228393, "epoch": 1.665580951311282, "grad_norm": 1.453125, "learning_rate": 0.0004731502996814759, "loss": 5.4785, "mean_token_accuracy": 0.18691678792238237, "num_tokens": 33096430.0, "step": 14830 }, { "entropy": 5.544121360778808, "epoch": 1.6661425282192397, "grad_norm": 1.5, "learning_rate": 0.00047313127671485194, "loss": 5.3575, "mean_token_accuracy": 0.18353654593229293, "num_tokens": 33108040.0, "step": 14835 }, { "entropy": 5.521466827392578, "epoch": 1.6667041051271971, "grad_norm": 1.4453125, "learning_rate": 0.0004731122474396514, "loss": 5.3552, "mean_token_accuracy": 0.18125558495521546, "num_tokens": 33118282.0, "step": 14840 }, { "entropy": 5.588000249862671, "epoch": 1.6672656820351546, "grad_norm": 1.3125, "learning_rate": 0.00047309321185648, "loss": 5.4326, "mean_token_accuracy": 0.18425653874874115, "num_tokens": 33130308.0, "step": 14845 }, { "entropy": 5.67760157585144, "epoch": 1.6678272589431122, "grad_norm": 1.375, "learning_rate": 0.00047307416996594386, "loss": 5.4662, "mean_token_accuracy": 0.18178492337465285, "num_tokens": 33140260.0, "step": 14850 }, { "entropy": 5.555676698684692, "epoch": 1.66838883585107, "grad_norm": 1.359375, "learning_rate": 0.0004730551217686495, "loss": 5.3738, "mean_token_accuracy": 0.1839437499642372, "num_tokens": 33152064.0, "step": 14855 }, { "entropy": 5.609837865829467, "epoch": 1.6689504127590273, "grad_norm": 1.484375, "learning_rate": 0.0004730360672652031, "loss": 5.4331, "mean_token_accuracy": 0.18601180613040924, "num_tokens": 33164057.0, "step": 14860 }, { "entropy": 5.552616930007934, "epoch": 1.6695119896669848, "grad_norm": 1.234375, "learning_rate": 0.00047301700645621154, "loss": 5.3969, "mean_token_accuracy": 0.186902716755867, "num_tokens": 33175281.0, "step": 14865 }, { "entropy": 5.562746953964234, "epoch": 1.6700735665749424, "grad_norm": 1.4375, "learning_rate": 0.0004729979393422817, "loss": 5.3373, "mean_token_accuracy": 0.18874657303094863, "num_tokens": 33186615.0, "step": 14870 }, { "entropy": 5.572027587890625, "epoch": 1.6706351434829, "grad_norm": 1.640625, "learning_rate": 0.0004729788659240206, "loss": 5.4406, "mean_token_accuracy": 0.18436575084924697, "num_tokens": 33198693.0, "step": 14875 }, { "entropy": 5.623181486129761, "epoch": 1.6711967203908575, "grad_norm": 1.1796875, "learning_rate": 0.0004729597862020358, "loss": 5.4047, "mean_token_accuracy": 0.1872449114918709, "num_tokens": 33209743.0, "step": 14880 }, { "entropy": 5.558723306655883, "epoch": 1.671758297298815, "grad_norm": 1.28125, "learning_rate": 0.00047294070017693453, "loss": 5.3082, "mean_token_accuracy": 0.19150487333536148, "num_tokens": 33220907.0, "step": 14885 }, { "entropy": 5.617772722244263, "epoch": 1.6723198742067726, "grad_norm": 1.4921875, "learning_rate": 0.00047292160784932454, "loss": 5.4746, "mean_token_accuracy": 0.1800364747643471, "num_tokens": 33232278.0, "step": 14890 }, { "entropy": 5.626573467254639, "epoch": 1.6728814511147303, "grad_norm": 1.3828125, "learning_rate": 0.00047290250921981386, "loss": 5.3738, "mean_token_accuracy": 0.1844427466392517, "num_tokens": 33243920.0, "step": 14895 }, { "entropy": 5.598547506332397, "epoch": 1.6734430280226877, "grad_norm": 1.421875, "learning_rate": 0.00047288340428901053, "loss": 5.4237, "mean_token_accuracy": 0.18580759763717652, "num_tokens": 33254467.0, "step": 14900 }, { "entropy": 5.502971839904785, "epoch": 1.6740046049306452, "grad_norm": 1.5234375, "learning_rate": 0.00047286429305752283, "loss": 5.3679, "mean_token_accuracy": 0.18248131275177001, "num_tokens": 33265536.0, "step": 14905 }, { "entropy": 5.5815403938293455, "epoch": 1.6745661818386028, "grad_norm": 1.5546875, "learning_rate": 0.00047284517552595933, "loss": 5.412, "mean_token_accuracy": 0.18008261770009995, "num_tokens": 33277233.0, "step": 14910 }, { "entropy": 5.517041254043579, "epoch": 1.6751277587465605, "grad_norm": 1.4296875, "learning_rate": 0.0004728260516949287, "loss": 5.2767, "mean_token_accuracy": 0.19094849675893782, "num_tokens": 33287873.0, "step": 14915 }, { "entropy": 5.530544853210449, "epoch": 1.6756893356545177, "grad_norm": 1.5, "learning_rate": 0.0004728069215650399, "loss": 5.3918, "mean_token_accuracy": 0.18779995441436767, "num_tokens": 33298888.0, "step": 14920 }, { "entropy": 5.499293565750122, "epoch": 1.6762509125624754, "grad_norm": 1.875, "learning_rate": 0.0004727877851369019, "loss": 5.2611, "mean_token_accuracy": 0.19046627432107927, "num_tokens": 33309607.0, "step": 14925 }, { "entropy": 5.550456094741821, "epoch": 1.676812489470433, "grad_norm": 1.4609375, "learning_rate": 0.00047276864241112417, "loss": 5.3027, "mean_token_accuracy": 0.19379159212112426, "num_tokens": 33320582.0, "step": 14930 }, { "entropy": 5.508336687088013, "epoch": 1.6773740663783905, "grad_norm": 1.3046875, "learning_rate": 0.0004727494933883161, "loss": 5.3578, "mean_token_accuracy": 0.19197508096694946, "num_tokens": 33332145.0, "step": 14935 }, { "entropy": 5.694448089599609, "epoch": 1.677935643286348, "grad_norm": 1.40625, "learning_rate": 0.0004727303380690876, "loss": 5.6083, "mean_token_accuracy": 0.17880181670188905, "num_tokens": 33343963.0, "step": 14940 }, { "entropy": 5.568664169311523, "epoch": 1.6784972201943056, "grad_norm": 1.4296875, "learning_rate": 0.0004727111764540484, "loss": 5.4014, "mean_token_accuracy": 0.18977900594472885, "num_tokens": 33354931.0, "step": 14945 }, { "entropy": 5.5538811683654785, "epoch": 1.6790587971022632, "grad_norm": 1.359375, "learning_rate": 0.00047269200854380854, "loss": 5.3958, "mean_token_accuracy": 0.1820443630218506, "num_tokens": 33365686.0, "step": 14950 }, { "entropy": 5.643840694427491, "epoch": 1.6796203740102207, "grad_norm": 1.25, "learning_rate": 0.00047267283433897854, "loss": 5.3946, "mean_token_accuracy": 0.18865703791379929, "num_tokens": 33377099.0, "step": 14955 }, { "entropy": 5.581523275375366, "epoch": 1.6801819509181781, "grad_norm": 1.46875, "learning_rate": 0.00047265365384016887, "loss": 5.4437, "mean_token_accuracy": 0.1765981525182724, "num_tokens": 33389477.0, "step": 14960 }, { "entropy": 5.618612241744995, "epoch": 1.6807435278261358, "grad_norm": 1.2890625, "learning_rate": 0.00047263446704799017, "loss": 5.4663, "mean_token_accuracy": 0.18694839626550674, "num_tokens": 33401970.0, "step": 14965 }, { "entropy": 5.5506926536560055, "epoch": 1.6813051047340934, "grad_norm": 1.421875, "learning_rate": 0.00047261527396305343, "loss": 5.3398, "mean_token_accuracy": 0.182860167324543, "num_tokens": 33412986.0, "step": 14970 }, { "entropy": 5.588017368316651, "epoch": 1.6818666816420509, "grad_norm": 1.3828125, "learning_rate": 0.00047259607458596966, "loss": 5.4763, "mean_token_accuracy": 0.18464904576539992, "num_tokens": 33424717.0, "step": 14975 }, { "entropy": 5.476791286468506, "epoch": 1.6824282585500083, "grad_norm": 1.4765625, "learning_rate": 0.00047257686891735023, "loss": 5.287, "mean_token_accuracy": 0.18902431577444076, "num_tokens": 33436713.0, "step": 14980 }, { "entropy": 5.656904935836792, "epoch": 1.682989835457966, "grad_norm": 1.3203125, "learning_rate": 0.00047255765695780665, "loss": 5.4831, "mean_token_accuracy": 0.17948793321847917, "num_tokens": 33447532.0, "step": 14985 }, { "entropy": 5.4818048000335695, "epoch": 1.6835514123659236, "grad_norm": 1.4453125, "learning_rate": 0.0004725384387079507, "loss": 5.3035, "mean_token_accuracy": 0.18263816684484482, "num_tokens": 33458530.0, "step": 14990 }, { "entropy": 5.551608562469482, "epoch": 1.684112989273881, "grad_norm": 1.5, "learning_rate": 0.00047251921416839425, "loss": 5.4123, "mean_token_accuracy": 0.17943487763404847, "num_tokens": 33469617.0, "step": 14995 }, { "entropy": 5.626010417938232, "epoch": 1.6846745661818385, "grad_norm": 1.546875, "learning_rate": 0.0004724999833397494, "loss": 5.323, "mean_token_accuracy": 0.19285964518785476, "num_tokens": 33479622.0, "step": 15000 }, { "epoch": 1.6846745661818385, "eval_entropy": 5.383775010870264, "eval_loss": 5.4565653800964355, "eval_mean_token_accuracy": 0.1902181858315522, "eval_num_tokens": 33479622.0, "eval_runtime": 24.0402, "eval_samples_per_second": 1290.047, "eval_steps_per_second": 161.271, "step": 15000 }, { "entropy": 5.4471039295196535, "epoch": 1.6852361430897962, "grad_norm": 1.3515625, "learning_rate": 0.0004724807462226285, "loss": 5.2883, "mean_token_accuracy": 0.19635369181632994, "num_tokens": 33490907.0, "step": 15005 }, { "entropy": 5.551421070098877, "epoch": 1.6857977199977539, "grad_norm": 1.46875, "learning_rate": 0.000472461502817644, "loss": 5.4051, "mean_token_accuracy": 0.18559968769550322, "num_tokens": 33501884.0, "step": 15010 }, { "entropy": 5.557754468917847, "epoch": 1.6863592969057113, "grad_norm": 1.6484375, "learning_rate": 0.0004724422531254087, "loss": 5.2736, "mean_token_accuracy": 0.18997342735528946, "num_tokens": 33512106.0, "step": 15015 }, { "entropy": 5.582626485824585, "epoch": 1.6869208738136687, "grad_norm": 1.4296875, "learning_rate": 0.0004724229971465355, "loss": 5.3867, "mean_token_accuracy": 0.19005310386419297, "num_tokens": 33522889.0, "step": 15020 }, { "entropy": 5.546910095214844, "epoch": 1.6874824507216264, "grad_norm": 1.4140625, "learning_rate": 0.0004724037348816375, "loss": 5.3544, "mean_token_accuracy": 0.18871113210916518, "num_tokens": 33534601.0, "step": 15025 }, { "entropy": 5.513442134857177, "epoch": 1.6880440276295838, "grad_norm": 1.484375, "learning_rate": 0.000472384466331328, "loss": 5.4522, "mean_token_accuracy": 0.1847732901573181, "num_tokens": 33545300.0, "step": 15030 }, { "entropy": 5.687134075164795, "epoch": 1.6886056045375413, "grad_norm": 1.3515625, "learning_rate": 0.0004723651914962205, "loss": 5.4112, "mean_token_accuracy": 0.18240966796875, "num_tokens": 33555581.0, "step": 15035 }, { "entropy": 5.613533639907837, "epoch": 1.689167181445499, "grad_norm": 1.515625, "learning_rate": 0.00047234591037692884, "loss": 5.4, "mean_token_accuracy": 0.18385293036699296, "num_tokens": 33566902.0, "step": 15040 }, { "entropy": 5.57280707359314, "epoch": 1.6897287583534566, "grad_norm": 1.6484375, "learning_rate": 0.00047232662297406683, "loss": 5.4161, "mean_token_accuracy": 0.18380822986364365, "num_tokens": 33578316.0, "step": 15045 }, { "entropy": 5.603354120254517, "epoch": 1.690290335261414, "grad_norm": 1.4375, "learning_rate": 0.0004723073292882485, "loss": 5.4311, "mean_token_accuracy": 0.17819164395332338, "num_tokens": 33590242.0, "step": 15050 }, { "entropy": 5.548894309997559, "epoch": 1.6908519121693715, "grad_norm": 1.4296875, "learning_rate": 0.00047228802932008836, "loss": 5.3229, "mean_token_accuracy": 0.1852489396929741, "num_tokens": 33601277.0, "step": 15055 }, { "entropy": 5.528900814056397, "epoch": 1.6914134890773291, "grad_norm": 1.578125, "learning_rate": 0.0004722687230702009, "loss": 5.3619, "mean_token_accuracy": 0.1814175859093666, "num_tokens": 33612423.0, "step": 15060 }, { "entropy": 5.672621393203736, "epoch": 1.6919750659852868, "grad_norm": 1.4375, "learning_rate": 0.0004722494105392007, "loss": 5.4417, "mean_token_accuracy": 0.18055731058120728, "num_tokens": 33624250.0, "step": 15065 }, { "entropy": 5.6068737506866455, "epoch": 1.6925366428932442, "grad_norm": 1.4296875, "learning_rate": 0.0004722300917277029, "loss": 5.3778, "mean_token_accuracy": 0.18464804738759993, "num_tokens": 33636379.0, "step": 15070 }, { "entropy": 5.537733650207519, "epoch": 1.6930982198012017, "grad_norm": 1.40625, "learning_rate": 0.0004722107666363224, "loss": 5.3834, "mean_token_accuracy": 0.18061763942241668, "num_tokens": 33648296.0, "step": 15075 }, { "entropy": 5.479118394851684, "epoch": 1.6936597967091593, "grad_norm": 1.34375, "learning_rate": 0.0004721914352656746, "loss": 5.4005, "mean_token_accuracy": 0.18329438269138337, "num_tokens": 33659438.0, "step": 15080 }, { "entropy": 5.636709928512573, "epoch": 1.694221373617117, "grad_norm": 2.71875, "learning_rate": 0.000472172097616375, "loss": 5.4973, "mean_token_accuracy": 0.18170636296272277, "num_tokens": 33670893.0, "step": 15085 }, { "entropy": 5.621981287002564, "epoch": 1.6947829505250744, "grad_norm": 1.28125, "learning_rate": 0.0004721527536890394, "loss": 5.3633, "mean_token_accuracy": 0.1880887269973755, "num_tokens": 33681487.0, "step": 15090 }, { "entropy": 5.557020998001098, "epoch": 1.6953445274330319, "grad_norm": 1.3984375, "learning_rate": 0.0004721334034842836, "loss": 5.3835, "mean_token_accuracy": 0.19438282400369644, "num_tokens": 33692925.0, "step": 15095 }, { "entropy": 5.584948348999023, "epoch": 1.6959061043409895, "grad_norm": 1.4453125, "learning_rate": 0.0004721140470027238, "loss": 5.3541, "mean_token_accuracy": 0.18742522597312927, "num_tokens": 33703559.0, "step": 15100 }, { "entropy": 5.504276752471924, "epoch": 1.6964676812489472, "grad_norm": 1.8125, "learning_rate": 0.00047209468424497627, "loss": 5.3614, "mean_token_accuracy": 0.18574756234884263, "num_tokens": 33715041.0, "step": 15105 }, { "entropy": 5.49846305847168, "epoch": 1.6970292581569046, "grad_norm": 1.9453125, "learning_rate": 0.0004720753152116576, "loss": 5.3071, "mean_token_accuracy": 0.18679920136928557, "num_tokens": 33726334.0, "step": 15110 }, { "entropy": 5.611520433425904, "epoch": 1.697590835064862, "grad_norm": 1.4140625, "learning_rate": 0.00047205593990338443, "loss": 5.3407, "mean_token_accuracy": 0.18786376416683198, "num_tokens": 33738663.0, "step": 15115 }, { "entropy": 5.489375638961792, "epoch": 1.6981524119728197, "grad_norm": 1.3828125, "learning_rate": 0.0004720365583207737, "loss": 5.3027, "mean_token_accuracy": 0.19285307973623275, "num_tokens": 33749202.0, "step": 15120 }, { "entropy": 5.4849128246307375, "epoch": 1.6987139888807772, "grad_norm": 1.515625, "learning_rate": 0.0004720171704644425, "loss": 5.2708, "mean_token_accuracy": 0.19944576025009156, "num_tokens": 33759809.0, "step": 15125 }, { "entropy": 5.494880485534668, "epoch": 1.6992755657887346, "grad_norm": 1.640625, "learning_rate": 0.0004719977763350083, "loss": 5.3711, "mean_token_accuracy": 0.18570796847343446, "num_tokens": 33771374.0, "step": 15130 }, { "entropy": 5.537381267547607, "epoch": 1.6998371426966923, "grad_norm": 1.578125, "learning_rate": 0.00047197837593308833, "loss": 5.3648, "mean_token_accuracy": 0.18862795382738112, "num_tokens": 33781645.0, "step": 15135 }, { "entropy": 5.565759325027466, "epoch": 1.70039871960465, "grad_norm": 1.4765625, "learning_rate": 0.0004719589692593006, "loss": 5.3458, "mean_token_accuracy": 0.18986233025789262, "num_tokens": 33793032.0, "step": 15140 }, { "entropy": 5.6880542755126955, "epoch": 1.7009602965126074, "grad_norm": 1.3125, "learning_rate": 0.0004719395563142629, "loss": 5.5586, "mean_token_accuracy": 0.17638744413852692, "num_tokens": 33805116.0, "step": 15145 }, { "entropy": 5.646629333496094, "epoch": 1.7015218734205648, "grad_norm": 1.890625, "learning_rate": 0.0004719201370985933, "loss": 5.3964, "mean_token_accuracy": 0.18295258432626724, "num_tokens": 33817135.0, "step": 15150 }, { "entropy": 5.574564695358276, "epoch": 1.7020834503285225, "grad_norm": 1.4375, "learning_rate": 0.00047190071161291007, "loss": 5.3841, "mean_token_accuracy": 0.18291592746973037, "num_tokens": 33830187.0, "step": 15155 }, { "entropy": 5.458574628829956, "epoch": 1.7026450272364801, "grad_norm": 1.859375, "learning_rate": 0.00047188127985783195, "loss": 5.3872, "mean_token_accuracy": 0.17977226823568343, "num_tokens": 33841297.0, "step": 15160 }, { "entropy": 5.59752893447876, "epoch": 1.7032066041444376, "grad_norm": 1.3828125, "learning_rate": 0.00047186184183397754, "loss": 5.3761, "mean_token_accuracy": 0.18661357313394547, "num_tokens": 33852888.0, "step": 15165 }, { "entropy": 5.568714380264282, "epoch": 1.703768181052395, "grad_norm": 1.4296875, "learning_rate": 0.00047184239754196564, "loss": 5.4437, "mean_token_accuracy": 0.18394217193126677, "num_tokens": 33865165.0, "step": 15170 }, { "entropy": 5.533801794052124, "epoch": 1.7043297579603527, "grad_norm": 1.34375, "learning_rate": 0.0004718229469824155, "loss": 5.2487, "mean_token_accuracy": 0.19285314679145812, "num_tokens": 33875865.0, "step": 15175 }, { "entropy": 5.592979621887207, "epoch": 1.7048913348683103, "grad_norm": 2.265625, "learning_rate": 0.00047180349015594634, "loss": 5.482, "mean_token_accuracy": 0.17598691284656526, "num_tokens": 33887519.0, "step": 15180 }, { "entropy": 5.504102420806885, "epoch": 1.7054529117762678, "grad_norm": 1.2734375, "learning_rate": 0.0004717840270631778, "loss": 5.2914, "mean_token_accuracy": 0.19494041949510574, "num_tokens": 33898762.0, "step": 15185 }, { "entropy": 5.438482666015625, "epoch": 1.7060144886842252, "grad_norm": 1.609375, "learning_rate": 0.00047176455770472946, "loss": 5.2926, "mean_token_accuracy": 0.1906571790575981, "num_tokens": 33911109.0, "step": 15190 }, { "entropy": 5.634068346023559, "epoch": 1.706576065592183, "grad_norm": 1.5625, "learning_rate": 0.00047174508208122135, "loss": 5.5684, "mean_token_accuracy": 0.17408591955900193, "num_tokens": 33922741.0, "step": 15195 }, { "entropy": 5.581002140045166, "epoch": 1.7071376425001406, "grad_norm": 1.3515625, "learning_rate": 0.0004717256001932735, "loss": 5.3811, "mean_token_accuracy": 0.18276015520095826, "num_tokens": 33933234.0, "step": 15200 }, { "entropy": 5.526957702636719, "epoch": 1.707699219408098, "grad_norm": 1.3046875, "learning_rate": 0.00047170611204150624, "loss": 5.3139, "mean_token_accuracy": 0.18669446408748627, "num_tokens": 33943667.0, "step": 15205 }, { "entropy": 5.519064235687256, "epoch": 1.7082607963160554, "grad_norm": 1.6953125, "learning_rate": 0.0004716866176265401, "loss": 5.2847, "mean_token_accuracy": 0.19637755006551744, "num_tokens": 33954499.0, "step": 15210 }, { "entropy": 5.502477359771729, "epoch": 1.708822373224013, "grad_norm": 1.46875, "learning_rate": 0.00047166711694899573, "loss": 5.3491, "mean_token_accuracy": 0.19001880586147307, "num_tokens": 33964700.0, "step": 15215 }, { "entropy": 5.514243841171265, "epoch": 1.7093839501319705, "grad_norm": 1.3046875, "learning_rate": 0.00047164761000949404, "loss": 5.4042, "mean_token_accuracy": 0.18515589386224746, "num_tokens": 33977759.0, "step": 15220 }, { "entropy": 5.6283937931060795, "epoch": 1.709945527039928, "grad_norm": 1.6796875, "learning_rate": 0.0004716280968086563, "loss": 5.4639, "mean_token_accuracy": 0.1797819197177887, "num_tokens": 33990019.0, "step": 15225 }, { "entropy": 5.613171672821045, "epoch": 1.7105071039478856, "grad_norm": 1.4140625, "learning_rate": 0.0004716085773471036, "loss": 5.3503, "mean_token_accuracy": 0.18897001296281815, "num_tokens": 34000663.0, "step": 15230 }, { "entropy": 5.459926891326904, "epoch": 1.7110686808558433, "grad_norm": 1.546875, "learning_rate": 0.00047158905162545756, "loss": 5.2561, "mean_token_accuracy": 0.19417371451854706, "num_tokens": 34012768.0, "step": 15235 }, { "entropy": 5.470266914367675, "epoch": 1.7116302577638007, "grad_norm": 1.4921875, "learning_rate": 0.00047156951964433984, "loss": 5.2923, "mean_token_accuracy": 0.19037491083145142, "num_tokens": 34025801.0, "step": 15240 }, { "entropy": 5.491405773162842, "epoch": 1.7121918346717582, "grad_norm": 1.9453125, "learning_rate": 0.00047154998140437246, "loss": 5.2082, "mean_token_accuracy": 0.20296344310045242, "num_tokens": 34036553.0, "step": 15245 }, { "entropy": 5.527611255645752, "epoch": 1.7127534115797158, "grad_norm": 1.3984375, "learning_rate": 0.00047153043690617737, "loss": 5.3886, "mean_token_accuracy": 0.18829963505268096, "num_tokens": 34048352.0, "step": 15250 }, { "entropy": 5.576293706893921, "epoch": 1.7133149884876735, "grad_norm": 1.34375, "learning_rate": 0.000471510886150377, "loss": 5.3432, "mean_token_accuracy": 0.19270518571138381, "num_tokens": 34059617.0, "step": 15255 }, { "entropy": 5.562987804412842, "epoch": 1.713876565395631, "grad_norm": 1.7109375, "learning_rate": 0.0004714913291375938, "loss": 5.4001, "mean_token_accuracy": 0.18346952199935912, "num_tokens": 34071176.0, "step": 15260 }, { "entropy": 5.4848121166229244, "epoch": 1.7144381423035884, "grad_norm": 1.390625, "learning_rate": 0.00047147176586845036, "loss": 5.3518, "mean_token_accuracy": 0.18714902997016908, "num_tokens": 34081883.0, "step": 15265 }, { "entropy": 5.551849412918091, "epoch": 1.714999719211546, "grad_norm": 1.3046875, "learning_rate": 0.0004714521963435698, "loss": 5.3679, "mean_token_accuracy": 0.18345563858747482, "num_tokens": 34092938.0, "step": 15270 }, { "entropy": 5.604917812347412, "epoch": 1.7155612961195037, "grad_norm": 1.390625, "learning_rate": 0.00047143262056357506, "loss": 5.3316, "mean_token_accuracy": 0.19288102239370347, "num_tokens": 34104758.0, "step": 15275 }, { "entropy": 5.555082178115844, "epoch": 1.7161228730274611, "grad_norm": 1.421875, "learning_rate": 0.00047141303852908965, "loss": 5.2539, "mean_token_accuracy": 0.19242660254240035, "num_tokens": 34114752.0, "step": 15280 }, { "entropy": 5.581843376159668, "epoch": 1.7166844499354186, "grad_norm": 1.3203125, "learning_rate": 0.0004713934502407367, "loss": 5.4126, "mean_token_accuracy": 0.18007928133010864, "num_tokens": 34125547.0, "step": 15285 }, { "entropy": 5.675565767288208, "epoch": 1.7172460268433762, "grad_norm": 1.3828125, "learning_rate": 0.0004713738556991402, "loss": 5.4546, "mean_token_accuracy": 0.1848657414317131, "num_tokens": 34136085.0, "step": 15290 }, { "entropy": 5.5911674976348875, "epoch": 1.717807603751334, "grad_norm": 1.2734375, "learning_rate": 0.000471354254904924, "loss": 5.3871, "mean_token_accuracy": 0.19026076495647432, "num_tokens": 34147536.0, "step": 15295 }, { "entropy": 5.579338026046753, "epoch": 1.7183691806592913, "grad_norm": 1.359375, "learning_rate": 0.00047133464785871216, "loss": 5.5024, "mean_token_accuracy": 0.1849495455622673, "num_tokens": 34158238.0, "step": 15300 }, { "entropy": 5.500206089019775, "epoch": 1.7189307575672488, "grad_norm": 1.3671875, "learning_rate": 0.000471315034561129, "loss": 5.2063, "mean_token_accuracy": 0.1989926964044571, "num_tokens": 34169793.0, "step": 15305 }, { "entropy": 5.59913649559021, "epoch": 1.7194923344752064, "grad_norm": 1.3046875, "learning_rate": 0.00047129541501279897, "loss": 5.4041, "mean_token_accuracy": 0.19394327849149703, "num_tokens": 34179753.0, "step": 15310 }, { "entropy": 5.600598907470703, "epoch": 1.7200539113831639, "grad_norm": 1.328125, "learning_rate": 0.0004712757892143468, "loss": 5.4824, "mean_token_accuracy": 0.18532252162694932, "num_tokens": 34189947.0, "step": 15315 }, { "entropy": 5.636711502075196, "epoch": 1.7206154882911213, "grad_norm": 1.5390625, "learning_rate": 0.00047125615716639744, "loss": 5.4322, "mean_token_accuracy": 0.1880556896328926, "num_tokens": 34201197.0, "step": 15320 }, { "entropy": 5.590401458740234, "epoch": 1.721177065199079, "grad_norm": 1.421875, "learning_rate": 0.0004712365188695758, "loss": 5.4262, "mean_token_accuracy": 0.19257451444864274, "num_tokens": 34212762.0, "step": 15325 }, { "entropy": 5.569433212280273, "epoch": 1.7217386421070366, "grad_norm": 1.703125, "learning_rate": 0.0004712168743245074, "loss": 5.3809, "mean_token_accuracy": 0.18759627640247345, "num_tokens": 34223928.0, "step": 15330 }, { "entropy": 5.529983615875244, "epoch": 1.722300219014994, "grad_norm": 1.484375, "learning_rate": 0.00047119722353181754, "loss": 5.283, "mean_token_accuracy": 0.20313519090414048, "num_tokens": 34233888.0, "step": 15335 }, { "entropy": 5.627472019195556, "epoch": 1.7228617959229515, "grad_norm": 1.578125, "learning_rate": 0.00047117756649213204, "loss": 5.3958, "mean_token_accuracy": 0.18413452059030533, "num_tokens": 34245894.0, "step": 15340 }, { "entropy": 5.563360166549683, "epoch": 1.7234233728309092, "grad_norm": 1.40625, "learning_rate": 0.0004711579032060767, "loss": 5.2997, "mean_token_accuracy": 0.19482649117708206, "num_tokens": 34256288.0, "step": 15345 }, { "entropy": 5.566926193237305, "epoch": 1.7239849497388668, "grad_norm": 1.6015625, "learning_rate": 0.0004711382336742777, "loss": 5.351, "mean_token_accuracy": 0.1786728397011757, "num_tokens": 34266515.0, "step": 15350 }, { "entropy": 5.59462161064148, "epoch": 1.7245465266468243, "grad_norm": 1.34375, "learning_rate": 0.0004711185578973612, "loss": 5.4231, "mean_token_accuracy": 0.1808302104473114, "num_tokens": 34278681.0, "step": 15355 }, { "entropy": 5.609726810455323, "epoch": 1.7251081035547817, "grad_norm": 1.140625, "learning_rate": 0.0004710988758759538, "loss": 5.3395, "mean_token_accuracy": 0.19018030911684036, "num_tokens": 34289161.0, "step": 15360 }, { "entropy": 5.545761442184448, "epoch": 1.7256696804627394, "grad_norm": 1.5625, "learning_rate": 0.0004710791876106821, "loss": 5.319, "mean_token_accuracy": 0.18373594731092452, "num_tokens": 34300323.0, "step": 15365 }, { "entropy": 5.518750762939453, "epoch": 1.726231257370697, "grad_norm": 1.6015625, "learning_rate": 0.00047105949310217304, "loss": 5.2944, "mean_token_accuracy": 0.18588107079267502, "num_tokens": 34311558.0, "step": 15370 }, { "entropy": 5.4772566795349125, "epoch": 1.7267928342786545, "grad_norm": 2.140625, "learning_rate": 0.0004710397923510537, "loss": 5.4157, "mean_token_accuracy": 0.18117000311613082, "num_tokens": 34323573.0, "step": 15375 }, { "entropy": 5.546475267410278, "epoch": 1.727354411186612, "grad_norm": 1.546875, "learning_rate": 0.00047102008535795134, "loss": 5.3554, "mean_token_accuracy": 0.18172081112861632, "num_tokens": 34334698.0, "step": 15380 }, { "entropy": 5.602615737915039, "epoch": 1.7279159880945696, "grad_norm": 1.46875, "learning_rate": 0.0004710003721234934, "loss": 5.3293, "mean_token_accuracy": 0.1962783992290497, "num_tokens": 34345948.0, "step": 15385 }, { "entropy": 5.559959602355957, "epoch": 1.7284775650025272, "grad_norm": 1.5703125, "learning_rate": 0.00047098065264830754, "loss": 5.3905, "mean_token_accuracy": 0.18383126109838485, "num_tokens": 34359067.0, "step": 15390 }, { "entropy": 5.403591728210449, "epoch": 1.7290391419104847, "grad_norm": 1.46875, "learning_rate": 0.00047096092693302174, "loss": 5.2503, "mean_token_accuracy": 0.19293245822191238, "num_tokens": 34370895.0, "step": 15395 }, { "entropy": 5.506108713150025, "epoch": 1.7296007188184421, "grad_norm": 1.6953125, "learning_rate": 0.00047094119497826406, "loss": 5.3551, "mean_token_accuracy": 0.18479404747486114, "num_tokens": 34382039.0, "step": 15400 }, { "entropy": 5.632439422607422, "epoch": 1.7301622957263998, "grad_norm": 1.5546875, "learning_rate": 0.00047092145678466273, "loss": 5.4327, "mean_token_accuracy": 0.18405346870422362, "num_tokens": 34392939.0, "step": 15405 }, { "entropy": 5.674262189865113, "epoch": 1.7307238726343572, "grad_norm": 1.15625, "learning_rate": 0.0004709017123528462, "loss": 5.4423, "mean_token_accuracy": 0.18372531682252885, "num_tokens": 34404402.0, "step": 15410 }, { "entropy": 5.486842155456543, "epoch": 1.7312854495423147, "grad_norm": 1.6640625, "learning_rate": 0.00047088196168344315, "loss": 5.3434, "mean_token_accuracy": 0.19193651378154755, "num_tokens": 34415563.0, "step": 15415 }, { "entropy": 5.603653287887573, "epoch": 1.7318470264502723, "grad_norm": 1.7578125, "learning_rate": 0.00047086220477708256, "loss": 5.4514, "mean_token_accuracy": 0.17992481589317322, "num_tokens": 34426993.0, "step": 15420 }, { "entropy": 5.6662970066070555, "epoch": 1.73240860335823, "grad_norm": 1.53125, "learning_rate": 0.00047084244163439335, "loss": 5.3841, "mean_token_accuracy": 0.19330619722604753, "num_tokens": 34436697.0, "step": 15425 }, { "entropy": 5.587507629394532, "epoch": 1.7329701802661874, "grad_norm": 1.4921875, "learning_rate": 0.0004708226722560049, "loss": 5.3638, "mean_token_accuracy": 0.1874844491481781, "num_tokens": 34448076.0, "step": 15430 }, { "entropy": 5.508535099029541, "epoch": 1.7335317571741449, "grad_norm": 1.4765625, "learning_rate": 0.0004708028966425465, "loss": 5.4078, "mean_token_accuracy": 0.18446434140205384, "num_tokens": 34460369.0, "step": 15435 }, { "entropy": 5.63477840423584, "epoch": 1.7340933340821025, "grad_norm": 1.3828125, "learning_rate": 0.00047078311479464797, "loss": 5.4748, "mean_token_accuracy": 0.1780938521027565, "num_tokens": 34472693.0, "step": 15440 }, { "entropy": 5.7154499053955075, "epoch": 1.7346549109900602, "grad_norm": 2.484375, "learning_rate": 0.00047076332671293917, "loss": 5.4107, "mean_token_accuracy": 0.19212453812360764, "num_tokens": 34485258.0, "step": 15445 }, { "entropy": 5.629126977920532, "epoch": 1.7352164878980176, "grad_norm": 1.4765625, "learning_rate": 0.00047074353239805005, "loss": 5.387, "mean_token_accuracy": 0.18570349365472794, "num_tokens": 34496450.0, "step": 15450 }, { "entropy": 5.530909729003906, "epoch": 1.735778064805975, "grad_norm": 1.859375, "learning_rate": 0.0004707237318506111, "loss": 5.4207, "mean_token_accuracy": 0.18627371042966842, "num_tokens": 34508062.0, "step": 15455 }, { "entropy": 5.5551708221435545, "epoch": 1.7363396417139327, "grad_norm": 1.34375, "learning_rate": 0.00047070392507125245, "loss": 5.3716, "mean_token_accuracy": 0.19078274071216583, "num_tokens": 34519817.0, "step": 15460 }, { "entropy": 5.569928073883057, "epoch": 1.7369012186218904, "grad_norm": 1.5703125, "learning_rate": 0.000470684112060605, "loss": 5.3789, "mean_token_accuracy": 0.1850120022892952, "num_tokens": 34532628.0, "step": 15465 }, { "entropy": 5.620344400405884, "epoch": 1.7374627955298478, "grad_norm": 2.40625, "learning_rate": 0.00047066429281929944, "loss": 5.4333, "mean_token_accuracy": 0.1882002368569374, "num_tokens": 34543558.0, "step": 15470 }, { "entropy": 5.661240339279175, "epoch": 1.7380243724378053, "grad_norm": 1.328125, "learning_rate": 0.000470644467347967, "loss": 5.4705, "mean_token_accuracy": 0.18023901879787446, "num_tokens": 34553720.0, "step": 15475 }, { "entropy": 5.57817497253418, "epoch": 1.738585949345763, "grad_norm": 1.53125, "learning_rate": 0.00047062463564723884, "loss": 5.3512, "mean_token_accuracy": 0.1927105724811554, "num_tokens": 34564641.0, "step": 15480 }, { "entropy": 5.629330730438232, "epoch": 1.7391475262537206, "grad_norm": 1.390625, "learning_rate": 0.0004706047977177464, "loss": 5.4506, "mean_token_accuracy": 0.17920246571302414, "num_tokens": 34576470.0, "step": 15485 }, { "entropy": 5.660240888595581, "epoch": 1.739709103161678, "grad_norm": 1.359375, "learning_rate": 0.00047058495356012135, "loss": 5.4717, "mean_token_accuracy": 0.18309042900800704, "num_tokens": 34589158.0, "step": 15490 }, { "entropy": 5.585483837127685, "epoch": 1.7402706800696355, "grad_norm": 1.265625, "learning_rate": 0.00047056510317499545, "loss": 5.2674, "mean_token_accuracy": 0.19525233805179595, "num_tokens": 34599192.0, "step": 15495 }, { "entropy": 5.536190557479858, "epoch": 1.7408322569775931, "grad_norm": 1.7265625, "learning_rate": 0.00047054524656300087, "loss": 5.3848, "mean_token_accuracy": 0.18656711727380754, "num_tokens": 34611922.0, "step": 15500 }, { "entropy": 5.612058496475219, "epoch": 1.7413938338855506, "grad_norm": 1.375, "learning_rate": 0.00047052538372476985, "loss": 5.4424, "mean_token_accuracy": 0.18274508863687516, "num_tokens": 34623618.0, "step": 15505 }, { "entropy": 5.63532280921936, "epoch": 1.741955410793508, "grad_norm": 1.5390625, "learning_rate": 0.00047050551466093466, "loss": 5.448, "mean_token_accuracy": 0.18087286949157716, "num_tokens": 34635057.0, "step": 15510 }, { "entropy": 5.588735723495484, "epoch": 1.7425169877014657, "grad_norm": 1.2578125, "learning_rate": 0.0004704856393721281, "loss": 5.3885, "mean_token_accuracy": 0.18542587012052536, "num_tokens": 34647527.0, "step": 15515 }, { "entropy": 5.525556564331055, "epoch": 1.7430785646094233, "grad_norm": 2.0625, "learning_rate": 0.00047046575785898297, "loss": 5.3501, "mean_token_accuracy": 0.18491790890693666, "num_tokens": 34658615.0, "step": 15520 }, { "entropy": 5.6457047939300535, "epoch": 1.7436401415173808, "grad_norm": 1.4375, "learning_rate": 0.0004704458701221323, "loss": 5.3801, "mean_token_accuracy": 0.18849466741085052, "num_tokens": 34668485.0, "step": 15525 }, { "entropy": 5.581352806091308, "epoch": 1.7442017184253382, "grad_norm": 1.75, "learning_rate": 0.0004704259761622094, "loss": 5.3613, "mean_token_accuracy": 0.1857620045542717, "num_tokens": 34681181.0, "step": 15530 }, { "entropy": 5.473740434646606, "epoch": 1.7447632953332959, "grad_norm": 1.484375, "learning_rate": 0.00047040607597984745, "loss": 5.3262, "mean_token_accuracy": 0.1866876021027565, "num_tokens": 34692954.0, "step": 15535 }, { "entropy": 5.446321678161621, "epoch": 1.7453248722412535, "grad_norm": 1.453125, "learning_rate": 0.0004703861695756804, "loss": 5.2443, "mean_token_accuracy": 0.19230304658412933, "num_tokens": 34705120.0, "step": 15540 }, { "entropy": 5.566729164123535, "epoch": 1.745886449149211, "grad_norm": 1.3671875, "learning_rate": 0.0004703662569503419, "loss": 5.3736, "mean_token_accuracy": 0.1882579505443573, "num_tokens": 34716589.0, "step": 15545 }, { "entropy": 5.573837327957153, "epoch": 1.7464480260571684, "grad_norm": 1.421875, "learning_rate": 0.00047034633810446604, "loss": 5.3529, "mean_token_accuracy": 0.18860515356063842, "num_tokens": 34727551.0, "step": 15550 }, { "entropy": 5.502696371078491, "epoch": 1.747009602965126, "grad_norm": 1.484375, "learning_rate": 0.0004703264130386869, "loss": 5.3878, "mean_token_accuracy": 0.1905357763171196, "num_tokens": 34738887.0, "step": 15555 }, { "entropy": 5.505575323104859, "epoch": 1.7475711798730837, "grad_norm": 2.125, "learning_rate": 0.00047030648175363913, "loss": 5.324, "mean_token_accuracy": 0.1926727384328842, "num_tokens": 34750264.0, "step": 15560 }, { "entropy": 5.564579248428345, "epoch": 1.7481327567810412, "grad_norm": 1.59375, "learning_rate": 0.0004702865442499572, "loss": 5.401, "mean_token_accuracy": 0.18318630903959274, "num_tokens": 34761335.0, "step": 15565 }, { "entropy": 5.5248524188995365, "epoch": 1.7486943336889986, "grad_norm": 1.5390625, "learning_rate": 0.0004702666005282759, "loss": 5.3712, "mean_token_accuracy": 0.18553073108196258, "num_tokens": 34772237.0, "step": 15570 }, { "entropy": 5.5324851989746096, "epoch": 1.7492559105969563, "grad_norm": 1.671875, "learning_rate": 0.0004702466505892304, "loss": 5.2694, "mean_token_accuracy": 0.19213333427906037, "num_tokens": 34784648.0, "step": 15575 }, { "entropy": 5.604431247711181, "epoch": 1.749817487504914, "grad_norm": 1.3046875, "learning_rate": 0.00047022669443345575, "loss": 5.3849, "mean_token_accuracy": 0.1935294434428215, "num_tokens": 34794505.0, "step": 15580 }, { "entropy": 5.572837781906128, "epoch": 1.7503790644128714, "grad_norm": 1.484375, "learning_rate": 0.00047020673206158743, "loss": 5.3806, "mean_token_accuracy": 0.1911494642496109, "num_tokens": 34804887.0, "step": 15585 }, { "entropy": 5.637475967407227, "epoch": 1.7509406413208288, "grad_norm": 1.984375, "learning_rate": 0.000470186763474261, "loss": 5.3844, "mean_token_accuracy": 0.18640556037425995, "num_tokens": 34816814.0, "step": 15590 }, { "entropy": 5.561314725875855, "epoch": 1.7515022182287865, "grad_norm": 1.40625, "learning_rate": 0.0004701667886721125, "loss": 5.3015, "mean_token_accuracy": 0.19368523210287095, "num_tokens": 34827251.0, "step": 15595 }, { "entropy": 5.576226997375488, "epoch": 1.752063795136744, "grad_norm": 1.4609375, "learning_rate": 0.0004701468076557776, "loss": 5.4243, "mean_token_accuracy": 0.18055089116096495, "num_tokens": 34839010.0, "step": 15600 }, { "entropy": 5.589766645431519, "epoch": 1.7526253720447014, "grad_norm": 1.3515625, "learning_rate": 0.00047012682042589277, "loss": 5.4225, "mean_token_accuracy": 0.18299496173858643, "num_tokens": 34850435.0, "step": 15605 }, { "entropy": 5.545932340621948, "epoch": 1.753186948952659, "grad_norm": 1.4453125, "learning_rate": 0.00047010682698309423, "loss": 5.2576, "mean_token_accuracy": 0.19708157777786256, "num_tokens": 34861222.0, "step": 15610 }, { "entropy": 5.637009000778198, "epoch": 1.7537485258606167, "grad_norm": 1.296875, "learning_rate": 0.0004700868273280186, "loss": 5.4984, "mean_token_accuracy": 0.1692656770348549, "num_tokens": 34872650.0, "step": 15615 }, { "entropy": 5.627308702468872, "epoch": 1.7543101027685741, "grad_norm": 1.4921875, "learning_rate": 0.00047006682146130273, "loss": 5.3025, "mean_token_accuracy": 0.19773675948381425, "num_tokens": 34883201.0, "step": 15620 }, { "entropy": 5.656827211380005, "epoch": 1.7548716796765316, "grad_norm": 1.46875, "learning_rate": 0.0004700468093835837, "loss": 5.5374, "mean_token_accuracy": 0.17450018972158432, "num_tokens": 34895936.0, "step": 15625 }, { "entropy": 5.571184539794922, "epoch": 1.7554332565844892, "grad_norm": 1.375, "learning_rate": 0.00047002679109549864, "loss": 5.3689, "mean_token_accuracy": 0.19319046586751937, "num_tokens": 34906491.0, "step": 15630 }, { "entropy": 5.555408477783203, "epoch": 1.755994833492447, "grad_norm": 1.609375, "learning_rate": 0.00047000676659768477, "loss": 5.3749, "mean_token_accuracy": 0.18406349867582322, "num_tokens": 34918300.0, "step": 15635 }, { "entropy": 5.471654033660888, "epoch": 1.7565564104004043, "grad_norm": 1.3984375, "learning_rate": 0.0004699867358907799, "loss": 5.3172, "mean_token_accuracy": 0.1846435323357582, "num_tokens": 34928573.0, "step": 15640 }, { "entropy": 5.605314159393311, "epoch": 1.7571179873083618, "grad_norm": 1.796875, "learning_rate": 0.0004699666989754217, "loss": 5.3651, "mean_token_accuracy": 0.18511402755975723, "num_tokens": 34940378.0, "step": 15645 }, { "entropy": 5.564402055740357, "epoch": 1.7576795642163194, "grad_norm": 1.359375, "learning_rate": 0.0004699466558522482, "loss": 5.4219, "mean_token_accuracy": 0.18588894307613374, "num_tokens": 34951627.0, "step": 15650 }, { "entropy": 5.560405826568603, "epoch": 1.758241141124277, "grad_norm": 1.6328125, "learning_rate": 0.00046992660652189755, "loss": 5.3548, "mean_token_accuracy": 0.1835366114974022, "num_tokens": 34961428.0, "step": 15655 }, { "entropy": 5.6877467155456545, "epoch": 1.7588027180322345, "grad_norm": 1.6015625, "learning_rate": 0.00046990655098500824, "loss": 5.4902, "mean_token_accuracy": 0.18185962587594987, "num_tokens": 34973736.0, "step": 15660 }, { "entropy": 5.570611047744751, "epoch": 1.759364294940192, "grad_norm": 1.4296875, "learning_rate": 0.00046988648924221866, "loss": 5.3559, "mean_token_accuracy": 0.19374988228082657, "num_tokens": 34984510.0, "step": 15665 }, { "entropy": 5.577480983734131, "epoch": 1.7599258718481496, "grad_norm": 1.4765625, "learning_rate": 0.0004698664212941677, "loss": 5.3475, "mean_token_accuracy": 0.1899129033088684, "num_tokens": 34995218.0, "step": 15670 }, { "entropy": 5.426718807220459, "epoch": 1.7604874487561073, "grad_norm": 1.546875, "learning_rate": 0.00046984634714149437, "loss": 5.1614, "mean_token_accuracy": 0.19524444937705993, "num_tokens": 35006681.0, "step": 15675 }, { "entropy": 5.510039281845093, "epoch": 1.7610490256640647, "grad_norm": 1.953125, "learning_rate": 0.0004698262667848377, "loss": 5.4053, "mean_token_accuracy": 0.18200305998325347, "num_tokens": 35017341.0, "step": 15680 }, { "entropy": 5.5395721912384035, "epoch": 1.7616106025720222, "grad_norm": 1.203125, "learning_rate": 0.00046980618022483714, "loss": 5.2968, "mean_token_accuracy": 0.19315295964479445, "num_tokens": 35027718.0, "step": 15685 }, { "entropy": 5.602697229385376, "epoch": 1.7621721794799798, "grad_norm": 1.734375, "learning_rate": 0.00046978608746213224, "loss": 5.3811, "mean_token_accuracy": 0.19060612320899964, "num_tokens": 35038100.0, "step": 15690 }, { "entropy": 5.52765793800354, "epoch": 1.7627337563879373, "grad_norm": 1.7265625, "learning_rate": 0.0004697659884973628, "loss": 5.4062, "mean_token_accuracy": 0.18741343915462494, "num_tokens": 35049077.0, "step": 15695 }, { "entropy": 5.6450201034545895, "epoch": 1.7632953332958947, "grad_norm": 1.453125, "learning_rate": 0.0004697458833311687, "loss": 5.5438, "mean_token_accuracy": 0.1795817032456398, "num_tokens": 35060685.0, "step": 15700 }, { "entropy": 5.549354219436646, "epoch": 1.7638569102038524, "grad_norm": 1.4296875, "learning_rate": 0.0004697257719641902, "loss": 5.3062, "mean_token_accuracy": 0.19198077917099, "num_tokens": 35072122.0, "step": 15705 }, { "entropy": 5.583201789855957, "epoch": 1.76441848711181, "grad_norm": 1.375, "learning_rate": 0.0004697056543970676, "loss": 5.3449, "mean_token_accuracy": 0.19073683619499207, "num_tokens": 35082427.0, "step": 15710 }, { "entropy": 5.568373775482177, "epoch": 1.7649800640197675, "grad_norm": 1.296875, "learning_rate": 0.00046968553063044146, "loss": 5.3858, "mean_token_accuracy": 0.1903146043419838, "num_tokens": 35093061.0, "step": 15715 }, { "entropy": 5.621543550491333, "epoch": 1.765541640927725, "grad_norm": 1.3203125, "learning_rate": 0.00046966540066495247, "loss": 5.4004, "mean_token_accuracy": 0.18613336980342865, "num_tokens": 35103226.0, "step": 15720 }, { "entropy": 5.614335441589356, "epoch": 1.7661032178356826, "grad_norm": 1.7890625, "learning_rate": 0.00046964526450124164, "loss": 5.3784, "mean_token_accuracy": 0.18761180490255355, "num_tokens": 35113977.0, "step": 15725 }, { "entropy": 5.5389328956604, "epoch": 1.7666647947436402, "grad_norm": 1.953125, "learning_rate": 0.00046962512213995, "loss": 5.361, "mean_token_accuracy": 0.18948362320661544, "num_tokens": 35125132.0, "step": 15730 }, { "entropy": 5.5051295280456545, "epoch": 1.7672263716515977, "grad_norm": 1.359375, "learning_rate": 0.00046960497358171913, "loss": 5.3016, "mean_token_accuracy": 0.18765170276165008, "num_tokens": 35135266.0, "step": 15735 }, { "entropy": 5.596678066253662, "epoch": 1.7677879485595551, "grad_norm": 1.3828125, "learning_rate": 0.00046958481882719035, "loss": 5.3735, "mean_token_accuracy": 0.19410445392131806, "num_tokens": 35146268.0, "step": 15740 }, { "entropy": 5.561468648910522, "epoch": 1.7683495254675128, "grad_norm": 1.59375, "learning_rate": 0.00046956465787700554, "loss": 5.297, "mean_token_accuracy": 0.1890968218445778, "num_tokens": 35157046.0, "step": 15745 }, { "entropy": 5.57606053352356, "epoch": 1.7689111023754704, "grad_norm": 1.3359375, "learning_rate": 0.00046954449073180644, "loss": 5.4801, "mean_token_accuracy": 0.18432846516370774, "num_tokens": 35167624.0, "step": 15750 }, { "entropy": 5.592984199523926, "epoch": 1.7694726792834279, "grad_norm": 1.3125, "learning_rate": 0.0004695243173922354, "loss": 5.4458, "mean_token_accuracy": 0.18281312584877013, "num_tokens": 35178987.0, "step": 15755 }, { "entropy": 5.515202236175537, "epoch": 1.7700342561913853, "grad_norm": 1.40625, "learning_rate": 0.00046950413785893465, "loss": 5.3005, "mean_token_accuracy": 0.1893632858991623, "num_tokens": 35189804.0, "step": 15760 }, { "entropy": 5.620057249069214, "epoch": 1.770595833099343, "grad_norm": 1.390625, "learning_rate": 0.00046948395213254667, "loss": 5.363, "mean_token_accuracy": 0.18398898243904113, "num_tokens": 35200677.0, "step": 15765 }, { "entropy": 5.463645362854004, "epoch": 1.7711574100073006, "grad_norm": 1.6171875, "learning_rate": 0.0004694637602137143, "loss": 5.3334, "mean_token_accuracy": 0.190482397377491, "num_tokens": 35211570.0, "step": 15770 }, { "entropy": 5.477284479141235, "epoch": 1.771718986915258, "grad_norm": 1.21875, "learning_rate": 0.0004694435621030803, "loss": 5.3739, "mean_token_accuracy": 0.1894892379641533, "num_tokens": 35222451.0, "step": 15775 }, { "entropy": 5.678949451446533, "epoch": 1.7722805638232155, "grad_norm": 1.59375, "learning_rate": 0.00046942335780128785, "loss": 5.4806, "mean_token_accuracy": 0.18306827545166016, "num_tokens": 35233588.0, "step": 15780 }, { "entropy": 5.648662281036377, "epoch": 1.7728421407311732, "grad_norm": 1.40625, "learning_rate": 0.00046940314730898035, "loss": 5.4473, "mean_token_accuracy": 0.17744902074337005, "num_tokens": 35245766.0, "step": 15785 }, { "entropy": 5.507218599319458, "epoch": 1.7734037176391306, "grad_norm": 1.421875, "learning_rate": 0.0004693829306268012, "loss": 5.3599, "mean_token_accuracy": 0.19044422805309297, "num_tokens": 35255635.0, "step": 15790 }, { "entropy": 5.595747947692871, "epoch": 1.773965294547088, "grad_norm": 1.4375, "learning_rate": 0.0004693627077553942, "loss": 5.3711, "mean_token_accuracy": 0.1829087480902672, "num_tokens": 35269342.0, "step": 15795 }, { "entropy": 5.600680637359619, "epoch": 1.7745268714550457, "grad_norm": 1.4140625, "learning_rate": 0.0004693424786954031, "loss": 5.3806, "mean_token_accuracy": 0.18079588264226915, "num_tokens": 35280735.0, "step": 15800 }, { "entropy": 5.570738458633423, "epoch": 1.7750884483630034, "grad_norm": 1.3515625, "learning_rate": 0.00046932224344747224, "loss": 5.3907, "mean_token_accuracy": 0.1817556396126747, "num_tokens": 35290803.0, "step": 15805 }, { "entropy": 5.615657567977905, "epoch": 1.7756500252709608, "grad_norm": 1.4296875, "learning_rate": 0.00046930200201224573, "loss": 5.3779, "mean_token_accuracy": 0.1841071903705597, "num_tokens": 35301811.0, "step": 15810 }, { "entropy": 5.597724437713623, "epoch": 1.7762116021789183, "grad_norm": 1.2578125, "learning_rate": 0.0004692817543903681, "loss": 5.4635, "mean_token_accuracy": 0.17897940576076507, "num_tokens": 35313374.0, "step": 15815 }, { "entropy": 5.610829925537109, "epoch": 1.776773179086876, "grad_norm": 1.3203125, "learning_rate": 0.000469261500582484, "loss": 5.324, "mean_token_accuracy": 0.19385354369878768, "num_tokens": 35323272.0, "step": 15820 }, { "entropy": 5.6619956493377686, "epoch": 1.7773347559948336, "grad_norm": 1.4140625, "learning_rate": 0.00046924124058923843, "loss": 5.458, "mean_token_accuracy": 0.1730327844619751, "num_tokens": 35335720.0, "step": 15825 }, { "entropy": 5.5761558532714846, "epoch": 1.777896332902791, "grad_norm": 1.390625, "learning_rate": 0.0004692209744112765, "loss": 5.4976, "mean_token_accuracy": 0.1847943678498268, "num_tokens": 35347621.0, "step": 15830 }, { "entropy": 5.718498373031617, "epoch": 1.7784579098107485, "grad_norm": 1.3046875, "learning_rate": 0.0004692007020492433, "loss": 5.5732, "mean_token_accuracy": 0.17302506268024445, "num_tokens": 35360611.0, "step": 15835 }, { "entropy": 5.602990007400512, "epoch": 1.7790194867187061, "grad_norm": 1.28125, "learning_rate": 0.0004691804235037845, "loss": 5.4609, "mean_token_accuracy": 0.18267596065998076, "num_tokens": 35372242.0, "step": 15840 }, { "entropy": 5.611075305938721, "epoch": 1.7795810636266638, "grad_norm": 1.3046875, "learning_rate": 0.0004691601387755456, "loss": 5.3618, "mean_token_accuracy": 0.19045183807611465, "num_tokens": 35385718.0, "step": 15845 }, { "entropy": 5.603568363189697, "epoch": 1.7801426405346212, "grad_norm": 1.25, "learning_rate": 0.00046913984786517275, "loss": 5.4757, "mean_token_accuracy": 0.17845510244369506, "num_tokens": 35398298.0, "step": 15850 }, { "entropy": 5.565671443939209, "epoch": 1.7807042174425787, "grad_norm": 1.2890625, "learning_rate": 0.00046911955077331177, "loss": 5.2554, "mean_token_accuracy": 0.1875331446528435, "num_tokens": 35408765.0, "step": 15855 }, { "entropy": 5.49656195640564, "epoch": 1.7812657943505363, "grad_norm": 1.171875, "learning_rate": 0.00046909924750060893, "loss": 5.2602, "mean_token_accuracy": 0.19083157181739807, "num_tokens": 35418547.0, "step": 15860 }, { "entropy": 5.5733802795410154, "epoch": 1.781827371258494, "grad_norm": 1.5234375, "learning_rate": 0.0004690789380477109, "loss": 5.381, "mean_token_accuracy": 0.1814642384648323, "num_tokens": 35428743.0, "step": 15865 }, { "entropy": 5.482580661773682, "epoch": 1.7823889481664514, "grad_norm": 1.484375, "learning_rate": 0.0004690586224152641, "loss": 5.2973, "mean_token_accuracy": 0.1893284648656845, "num_tokens": 35439557.0, "step": 15870 }, { "entropy": 5.544387578964233, "epoch": 1.7829505250744089, "grad_norm": 1.359375, "learning_rate": 0.0004690383006039156, "loss": 5.4617, "mean_token_accuracy": 0.18211542963981628, "num_tokens": 35452041.0, "step": 15875 }, { "entropy": 5.624589967727661, "epoch": 1.7835121019823665, "grad_norm": 1.3671875, "learning_rate": 0.0004690179726143123, "loss": 5.3825, "mean_token_accuracy": 0.19349778741598128, "num_tokens": 35463283.0, "step": 15880 }, { "entropy": 5.676436138153076, "epoch": 1.784073678890324, "grad_norm": 1.4765625, "learning_rate": 0.0004689976384471014, "loss": 5.5068, "mean_token_accuracy": 0.1909259706735611, "num_tokens": 35475802.0, "step": 15885 }, { "entropy": 5.500989723205566, "epoch": 1.7846352557982814, "grad_norm": 1.3046875, "learning_rate": 0.0004689772981029306, "loss": 5.3019, "mean_token_accuracy": 0.1928515240550041, "num_tokens": 35486322.0, "step": 15890 }, { "entropy": 5.553930282592773, "epoch": 1.785196832706239, "grad_norm": 1.3125, "learning_rate": 0.0004689569515824473, "loss": 5.3452, "mean_token_accuracy": 0.19019032567739486, "num_tokens": 35497021.0, "step": 15895 }, { "entropy": 5.555098581314087, "epoch": 1.7857584096141967, "grad_norm": 1.3046875, "learning_rate": 0.0004689365988862995, "loss": 5.3244, "mean_token_accuracy": 0.1960470959544182, "num_tokens": 35507579.0, "step": 15900 }, { "entropy": 5.478539276123047, "epoch": 1.7863199865221542, "grad_norm": 1.296875, "learning_rate": 0.00046891624001513515, "loss": 5.2773, "mean_token_accuracy": 0.18713027983903885, "num_tokens": 35518131.0, "step": 15905 }, { "entropy": 5.560598850250244, "epoch": 1.7868815634301116, "grad_norm": 1.359375, "learning_rate": 0.00046889587496960257, "loss": 5.4211, "mean_token_accuracy": 0.18091222941875457, "num_tokens": 35529577.0, "step": 15910 }, { "entropy": 5.609899806976318, "epoch": 1.7874431403380693, "grad_norm": 1.34375, "learning_rate": 0.00046887550375034997, "loss": 5.3448, "mean_token_accuracy": 0.1910657912492752, "num_tokens": 35541555.0, "step": 15915 }, { "entropy": 5.5346800804138185, "epoch": 1.788004717246027, "grad_norm": 1.2890625, "learning_rate": 0.00046885512635802627, "loss": 5.2772, "mean_token_accuracy": 0.1943323016166687, "num_tokens": 35552596.0, "step": 15920 }, { "entropy": 5.407305765151977, "epoch": 1.7885662941539844, "grad_norm": 1.3359375, "learning_rate": 0.0004688347427932801, "loss": 5.3629, "mean_token_accuracy": 0.18243516087532044, "num_tokens": 35564962.0, "step": 15925 }, { "entropy": 5.618680953979492, "epoch": 1.7891278710619418, "grad_norm": 1.3359375, "learning_rate": 0.00046881435305676055, "loss": 5.4494, "mean_token_accuracy": 0.17935291826725006, "num_tokens": 35576436.0, "step": 15930 }, { "entropy": 5.633065271377563, "epoch": 1.7896894479698995, "grad_norm": 1.1328125, "learning_rate": 0.00046879395714911686, "loss": 5.3908, "mean_token_accuracy": 0.18873339146375656, "num_tokens": 35587467.0, "step": 15935 }, { "entropy": 5.633873844146729, "epoch": 1.7902510248778571, "grad_norm": 1.2734375, "learning_rate": 0.00046877355507099846, "loss": 5.4434, "mean_token_accuracy": 0.17776518166065217, "num_tokens": 35600302.0, "step": 15940 }, { "entropy": 5.563335609436035, "epoch": 1.7908126017858146, "grad_norm": 1.2109375, "learning_rate": 0.0004687531468230549, "loss": 5.3727, "mean_token_accuracy": 0.1925714984536171, "num_tokens": 35611757.0, "step": 15945 }, { "entropy": 5.531421899795532, "epoch": 1.791374178693772, "grad_norm": 1.421875, "learning_rate": 0.0004687327324059359, "loss": 5.4276, "mean_token_accuracy": 0.18253857344388963, "num_tokens": 35621991.0, "step": 15950 }, { "entropy": 5.577724266052246, "epoch": 1.7919357556017297, "grad_norm": 1.5546875, "learning_rate": 0.0004687123118202916, "loss": 5.3962, "mean_token_accuracy": 0.18589919358491896, "num_tokens": 35633744.0, "step": 15955 }, { "entropy": 5.53998908996582, "epoch": 1.7924973325096873, "grad_norm": 1.28125, "learning_rate": 0.0004686918850667722, "loss": 5.2911, "mean_token_accuracy": 0.1892552986741066, "num_tokens": 35645523.0, "step": 15960 }, { "entropy": 5.590689468383789, "epoch": 1.7930589094176448, "grad_norm": 1.3125, "learning_rate": 0.000468671452146028, "loss": 5.4468, "mean_token_accuracy": 0.1826014667749405, "num_tokens": 35657670.0, "step": 15965 }, { "entropy": 5.529779481887817, "epoch": 1.7936204863256022, "grad_norm": 1.3046875, "learning_rate": 0.00046865101305870965, "loss": 5.2516, "mean_token_accuracy": 0.1899636507034302, "num_tokens": 35668149.0, "step": 15970 }, { "entropy": 5.494525718688965, "epoch": 1.7941820632335599, "grad_norm": 1.7421875, "learning_rate": 0.000468630567805468, "loss": 5.34, "mean_token_accuracy": 0.18510247766971588, "num_tokens": 35680225.0, "step": 15975 }, { "entropy": 5.430608177185059, "epoch": 1.7947436401415173, "grad_norm": 1.65625, "learning_rate": 0.000468610116386954, "loss": 5.249, "mean_token_accuracy": 0.195359405875206, "num_tokens": 35691042.0, "step": 15980 }, { "entropy": 5.530224704742432, "epoch": 1.7953052170494748, "grad_norm": 1.6796875, "learning_rate": 0.0004685896588038187, "loss": 5.3675, "mean_token_accuracy": 0.1856921836733818, "num_tokens": 35702895.0, "step": 15985 }, { "entropy": 5.588540363311767, "epoch": 1.7958667939574324, "grad_norm": 1.5, "learning_rate": 0.0004685691950567136, "loss": 5.3112, "mean_token_accuracy": 0.18628643453121185, "num_tokens": 35714765.0, "step": 15990 }, { "entropy": 5.632132482528687, "epoch": 1.79642837086539, "grad_norm": 1.609375, "learning_rate": 0.00046854872514629035, "loss": 5.4812, "mean_token_accuracy": 0.1774725615978241, "num_tokens": 35725832.0, "step": 15995 }, { "entropy": 5.540455150604248, "epoch": 1.7969899477733475, "grad_norm": 1.3203125, "learning_rate": 0.0004685282490732005, "loss": 5.3074, "mean_token_accuracy": 0.19379405677318573, "num_tokens": 35736619.0, "step": 16000 }, { "entropy": 5.50766134262085, "epoch": 1.797551524681305, "grad_norm": 1.4453125, "learning_rate": 0.00046850776683809623, "loss": 5.262, "mean_token_accuracy": 0.18469182550907134, "num_tokens": 35748243.0, "step": 16005 }, { "entropy": 5.541708898544312, "epoch": 1.7981131015892626, "grad_norm": 1.25, "learning_rate": 0.0004684872784416295, "loss": 5.3748, "mean_token_accuracy": 0.18503991067409514, "num_tokens": 35759126.0, "step": 16010 }, { "entropy": 5.648258066177368, "epoch": 1.7986746784972203, "grad_norm": 1.3125, "learning_rate": 0.0004684667838844529, "loss": 5.3932, "mean_token_accuracy": 0.1819484680891037, "num_tokens": 35770998.0, "step": 16015 }, { "entropy": 5.525299501419068, "epoch": 1.7992362554051777, "grad_norm": 1.3046875, "learning_rate": 0.0004684462831672188, "loss": 5.329, "mean_token_accuracy": 0.1874153807759285, "num_tokens": 35782835.0, "step": 16020 }, { "entropy": 5.549390172958374, "epoch": 1.7997978323131352, "grad_norm": 1.375, "learning_rate": 0.00046842577629058006, "loss": 5.3128, "mean_token_accuracy": 0.1882465064525604, "num_tokens": 35792828.0, "step": 16025 }, { "entropy": 5.642633104324341, "epoch": 1.8003594092210928, "grad_norm": 1.5390625, "learning_rate": 0.0004684052632551896, "loss": 5.5487, "mean_token_accuracy": 0.1810038223862648, "num_tokens": 35804449.0, "step": 16030 }, { "entropy": 5.574741077423096, "epoch": 1.8009209861290505, "grad_norm": 1.3671875, "learning_rate": 0.00046838474406170046, "loss": 5.302, "mean_token_accuracy": 0.18773899972438812, "num_tokens": 35815903.0, "step": 16035 }, { "entropy": 5.491513681411743, "epoch": 1.801482563037008, "grad_norm": 1.4140625, "learning_rate": 0.00046836421871076616, "loss": 5.3141, "mean_token_accuracy": 0.19241884350776672, "num_tokens": 35827872.0, "step": 16040 }, { "entropy": 5.521188020706177, "epoch": 1.8020441399449654, "grad_norm": 1.28125, "learning_rate": 0.0004683436872030401, "loss": 5.3027, "mean_token_accuracy": 0.19239161610603334, "num_tokens": 35838864.0, "step": 16045 }, { "entropy": 5.490436601638794, "epoch": 1.802605716852923, "grad_norm": 1.265625, "learning_rate": 0.00046832314953917605, "loss": 5.2212, "mean_token_accuracy": 0.18229456543922423, "num_tokens": 35850178.0, "step": 16050 }, { "entropy": 5.544579124450683, "epoch": 1.8031672937608807, "grad_norm": 1.2578125, "learning_rate": 0.00046830260571982795, "loss": 5.3763, "mean_token_accuracy": 0.1876939445734024, "num_tokens": 35861904.0, "step": 16055 }, { "entropy": 5.4166254043579105, "epoch": 1.8037288706688381, "grad_norm": 1.6796875, "learning_rate": 0.0004682820557456499, "loss": 5.2574, "mean_token_accuracy": 0.19551395773887634, "num_tokens": 35872977.0, "step": 16060 }, { "entropy": 5.621083164215088, "epoch": 1.8042904475767956, "grad_norm": 1.125, "learning_rate": 0.00046826149961729625, "loss": 5.4566, "mean_token_accuracy": 0.18301086127758026, "num_tokens": 35886094.0, "step": 16065 }, { "entropy": 5.537100791931152, "epoch": 1.8048520244847532, "grad_norm": 1.3203125, "learning_rate": 0.00046824093733542144, "loss": 5.279, "mean_token_accuracy": 0.19515191167593002, "num_tokens": 35897557.0, "step": 16070 }, { "entropy": 5.579884958267212, "epoch": 1.8054136013927107, "grad_norm": 1.328125, "learning_rate": 0.00046822036890068033, "loss": 5.4973, "mean_token_accuracy": 0.17925168871879577, "num_tokens": 35910605.0, "step": 16075 }, { "entropy": 5.554397964477539, "epoch": 1.8059751783006681, "grad_norm": 1.25, "learning_rate": 0.00046819979431372773, "loss": 5.2688, "mean_token_accuracy": 0.1950139656662941, "num_tokens": 35921062.0, "step": 16080 }, { "entropy": 5.548288822174072, "epoch": 1.8065367552086258, "grad_norm": 1.4921875, "learning_rate": 0.00046817921357521865, "loss": 5.3555, "mean_token_accuracy": 0.1850862443447113, "num_tokens": 35932385.0, "step": 16085 }, { "entropy": 5.47045931816101, "epoch": 1.8070983321165834, "grad_norm": 1.2421875, "learning_rate": 0.00046815862668580854, "loss": 5.3434, "mean_token_accuracy": 0.19163644313812256, "num_tokens": 35943628.0, "step": 16090 }, { "entropy": 5.60513014793396, "epoch": 1.8076599090245409, "grad_norm": 1.3046875, "learning_rate": 0.0004681380336461528, "loss": 5.4026, "mean_token_accuracy": 0.1782854288816452, "num_tokens": 35955074.0, "step": 16095 }, { "entropy": 5.593359375, "epoch": 1.8082214859324983, "grad_norm": 1.34375, "learning_rate": 0.00046811743445690724, "loss": 5.3292, "mean_token_accuracy": 0.1858907625079155, "num_tokens": 35966200.0, "step": 16100 }, { "entropy": 5.467005634307862, "epoch": 1.808783062840456, "grad_norm": 1.3515625, "learning_rate": 0.0004680968291187276, "loss": 5.2271, "mean_token_accuracy": 0.19870145320892335, "num_tokens": 35975638.0, "step": 16105 }, { "entropy": 5.513053369522095, "epoch": 1.8093446397484136, "grad_norm": 1.328125, "learning_rate": 0.0004680762176322701, "loss": 5.3487, "mean_token_accuracy": 0.1926051288843155, "num_tokens": 35986486.0, "step": 16110 }, { "entropy": 5.490559530258179, "epoch": 1.809906216656371, "grad_norm": 1.4375, "learning_rate": 0.00046805559999819093, "loss": 5.2737, "mean_token_accuracy": 0.19124430269002915, "num_tokens": 35996612.0, "step": 16115 }, { "entropy": 5.415689134597779, "epoch": 1.8104677935643285, "grad_norm": 1.375, "learning_rate": 0.0004680349762171465, "loss": 5.3365, "mean_token_accuracy": 0.18895064294338226, "num_tokens": 36006936.0, "step": 16120 }, { "entropy": 5.6507463455200195, "epoch": 1.8110293704722862, "grad_norm": 1.3984375, "learning_rate": 0.0004680143462897936, "loss": 5.461, "mean_token_accuracy": 0.18231729716062545, "num_tokens": 36019562.0, "step": 16125 }, { "entropy": 5.540613079071045, "epoch": 1.8115909473802438, "grad_norm": 1.296875, "learning_rate": 0.0004679937102167891, "loss": 5.2565, "mean_token_accuracy": 0.19357980042696, "num_tokens": 36029585.0, "step": 16130 }, { "entropy": 5.472490930557251, "epoch": 1.8121525242882013, "grad_norm": 1.25, "learning_rate": 0.00046797306799879, "loss": 5.3391, "mean_token_accuracy": 0.19227437376976014, "num_tokens": 36041495.0, "step": 16135 }, { "entropy": 5.490143156051635, "epoch": 1.8127141011961587, "grad_norm": 1.2421875, "learning_rate": 0.00046795241963645356, "loss": 5.3793, "mean_token_accuracy": 0.18855390399694444, "num_tokens": 36052087.0, "step": 16140 }, { "entropy": 5.549077892303467, "epoch": 1.8132756781041164, "grad_norm": 1.390625, "learning_rate": 0.0004679317651304373, "loss": 5.3439, "mean_token_accuracy": 0.1903028041124344, "num_tokens": 36065011.0, "step": 16145 }, { "entropy": 5.59675784111023, "epoch": 1.813837255012074, "grad_norm": 1.625, "learning_rate": 0.0004679111044813987, "loss": 5.4232, "mean_token_accuracy": 0.18762087523937226, "num_tokens": 36075912.0, "step": 16150 }, { "entropy": 5.610179901123047, "epoch": 1.8143988319200315, "grad_norm": 1.21875, "learning_rate": 0.00046789043768999573, "loss": 5.3904, "mean_token_accuracy": 0.18435035198926925, "num_tokens": 36086757.0, "step": 16155 }, { "entropy": 5.515399742126465, "epoch": 1.814960408827989, "grad_norm": 1.9375, "learning_rate": 0.0004678697647568865, "loss": 5.2643, "mean_token_accuracy": 0.19338752776384355, "num_tokens": 36097319.0, "step": 16160 }, { "entropy": 5.522013235092163, "epoch": 1.8155219857359466, "grad_norm": 1.6640625, "learning_rate": 0.00046784908568272903, "loss": 5.4083, "mean_token_accuracy": 0.18334012925624849, "num_tokens": 36108416.0, "step": 16165 }, { "entropy": 5.463136053085327, "epoch": 1.8160835626439042, "grad_norm": 1.296875, "learning_rate": 0.000467828400468182, "loss": 5.3351, "mean_token_accuracy": 0.18444680869579316, "num_tokens": 36120833.0, "step": 16170 }, { "entropy": 5.610969066619873, "epoch": 1.8166451395518615, "grad_norm": 1.2890625, "learning_rate": 0.00046780770911390387, "loss": 5.4616, "mean_token_accuracy": 0.18258167505264283, "num_tokens": 36132348.0, "step": 16175 }, { "entropy": 5.541339874267578, "epoch": 1.8172067164598191, "grad_norm": 1.265625, "learning_rate": 0.0004677870116205534, "loss": 5.2378, "mean_token_accuracy": 0.19122178256511688, "num_tokens": 36142829.0, "step": 16180 }, { "entropy": 5.566759204864502, "epoch": 1.8177682933677768, "grad_norm": 1.3203125, "learning_rate": 0.00046776630798878985, "loss": 5.5088, "mean_token_accuracy": 0.18053208142518998, "num_tokens": 36155931.0, "step": 16185 }, { "entropy": 5.606925439834595, "epoch": 1.8183298702757342, "grad_norm": 1.4296875, "learning_rate": 0.0004677455982192723, "loss": 5.4102, "mean_token_accuracy": 0.17741843014955522, "num_tokens": 36167591.0, "step": 16190 }, { "entropy": 5.513416719436646, "epoch": 1.8188914471836917, "grad_norm": 1.296875, "learning_rate": 0.00046772488231266004, "loss": 5.2858, "mean_token_accuracy": 0.1894127681851387, "num_tokens": 36178867.0, "step": 16195 }, { "entropy": 5.39373745918274, "epoch": 1.8194530240916493, "grad_norm": 1.6171875, "learning_rate": 0.00046770416026961284, "loss": 5.2578, "mean_token_accuracy": 0.2004848062992096, "num_tokens": 36190691.0, "step": 16200 }, { "entropy": 5.625265455245971, "epoch": 1.820014600999607, "grad_norm": 1.421875, "learning_rate": 0.0004676834320907904, "loss": 5.4731, "mean_token_accuracy": 0.18121488094329835, "num_tokens": 36202222.0, "step": 16205 }, { "entropy": 5.610524082183838, "epoch": 1.8205761779075644, "grad_norm": 1.234375, "learning_rate": 0.0004676626977768528, "loss": 5.2545, "mean_token_accuracy": 0.19390959143638611, "num_tokens": 36214303.0, "step": 16210 }, { "entropy": 5.452145576477051, "epoch": 1.8211377548155219, "grad_norm": 1.234375, "learning_rate": 0.00046764195732846013, "loss": 5.2808, "mean_token_accuracy": 0.18949127495288848, "num_tokens": 36224440.0, "step": 16215 }, { "entropy": 5.421571397781372, "epoch": 1.8216993317234795, "grad_norm": 1.265625, "learning_rate": 0.00046762121074627285, "loss": 5.2891, "mean_token_accuracy": 0.1903606489300728, "num_tokens": 36235445.0, "step": 16220 }, { "entropy": 5.569859313964844, "epoch": 1.8222609086314372, "grad_norm": 1.3984375, "learning_rate": 0.00046760045803095153, "loss": 5.3156, "mean_token_accuracy": 0.19223127663135528, "num_tokens": 36247024.0, "step": 16225 }, { "entropy": 5.606548643112182, "epoch": 1.8228224855393946, "grad_norm": 1.3203125, "learning_rate": 0.0004675796991831569, "loss": 5.3367, "mean_token_accuracy": 0.18688896000385286, "num_tokens": 36257406.0, "step": 16230 }, { "entropy": 5.524360275268554, "epoch": 1.823384062447352, "grad_norm": 1.4765625, "learning_rate": 0.00046755893420355, "loss": 5.3498, "mean_token_accuracy": 0.18490929454565047, "num_tokens": 36270266.0, "step": 16235 }, { "entropy": 5.566007661819458, "epoch": 1.8239456393553097, "grad_norm": 1.390625, "learning_rate": 0.0004675381630927919, "loss": 5.4291, "mean_token_accuracy": 0.1858387365937233, "num_tokens": 36281470.0, "step": 16240 }, { "entropy": 5.534808826446533, "epoch": 1.8245072162632674, "grad_norm": 1.28125, "learning_rate": 0.00046751738585154405, "loss": 5.3248, "mean_token_accuracy": 0.18495461493730544, "num_tokens": 36293315.0, "step": 16245 }, { "entropy": 5.557805871963501, "epoch": 1.8250687931712248, "grad_norm": 1.5, "learning_rate": 0.00046749660248046794, "loss": 5.3685, "mean_token_accuracy": 0.19024549275636674, "num_tokens": 36304688.0, "step": 16250 }, { "entropy": 5.6081033706665036, "epoch": 1.8256303700791823, "grad_norm": 1.3359375, "learning_rate": 0.00046747581298022537, "loss": 5.434, "mean_token_accuracy": 0.18934669643640517, "num_tokens": 36315773.0, "step": 16255 }, { "entropy": 5.626693439483643, "epoch": 1.82619194698714, "grad_norm": 1.4765625, "learning_rate": 0.0004674550173514782, "loss": 5.3524, "mean_token_accuracy": 0.1872216284275055, "num_tokens": 36327914.0, "step": 16260 }, { "entropy": 5.603176641464233, "epoch": 1.8267535238950976, "grad_norm": 1.5625, "learning_rate": 0.00046743421559488875, "loss": 5.4365, "mean_token_accuracy": 0.17932053208351134, "num_tokens": 36339617.0, "step": 16265 }, { "entropy": 5.630232667922973, "epoch": 1.8273151008030548, "grad_norm": 1.21875, "learning_rate": 0.00046741340771111917, "loss": 5.4864, "mean_token_accuracy": 0.17964668124914168, "num_tokens": 36350768.0, "step": 16270 }, { "entropy": 5.530461740493775, "epoch": 1.8278766777110125, "grad_norm": 1.46875, "learning_rate": 0.00046739259370083205, "loss": 5.3582, "mean_token_accuracy": 0.18999661654233932, "num_tokens": 36361267.0, "step": 16275 }, { "entropy": 5.583748197555542, "epoch": 1.8284382546189701, "grad_norm": 1.2578125, "learning_rate": 0.0004673717735646902, "loss": 5.389, "mean_token_accuracy": 0.18332965970039367, "num_tokens": 36373259.0, "step": 16280 }, { "entropy": 5.590427303314209, "epoch": 1.8289998315269276, "grad_norm": 1.234375, "learning_rate": 0.0004673509473033564, "loss": 5.3283, "mean_token_accuracy": 0.18604336231946944, "num_tokens": 36384295.0, "step": 16285 }, { "entropy": 5.571167469024658, "epoch": 1.829561408434885, "grad_norm": 1.2421875, "learning_rate": 0.00046733011491749383, "loss": 5.3173, "mean_token_accuracy": 0.19359821528196336, "num_tokens": 36394928.0, "step": 16290 }, { "entropy": 5.515721654891967, "epoch": 1.8301229853428427, "grad_norm": 1.25, "learning_rate": 0.0004673092764077658, "loss": 5.3815, "mean_token_accuracy": 0.19220682084560395, "num_tokens": 36407038.0, "step": 16295 }, { "entropy": 5.661236715316773, "epoch": 1.8306845622508003, "grad_norm": 1.3515625, "learning_rate": 0.0004672884317748359, "loss": 5.3604, "mean_token_accuracy": 0.18396896719932557, "num_tokens": 36418221.0, "step": 16300 }, { "entropy": 5.525816154479981, "epoch": 1.8312461391587578, "grad_norm": 1.3359375, "learning_rate": 0.0004672675810193677, "loss": 5.3054, "mean_token_accuracy": 0.1906868487596512, "num_tokens": 36429036.0, "step": 16305 }, { "entropy": 5.512045383453369, "epoch": 1.8318077160667152, "grad_norm": 1.515625, "learning_rate": 0.00046724672414202514, "loss": 5.3631, "mean_token_accuracy": 0.18964605480432511, "num_tokens": 36439851.0, "step": 16310 }, { "entropy": 5.591065883636475, "epoch": 1.8323692929746729, "grad_norm": 1.3671875, "learning_rate": 0.0004672258611434724, "loss": 5.3747, "mean_token_accuracy": 0.18101801127195358, "num_tokens": 36451612.0, "step": 16315 }, { "entropy": 5.631992769241333, "epoch": 1.8329308698826305, "grad_norm": 1.3203125, "learning_rate": 0.00046720499202437354, "loss": 5.4328, "mean_token_accuracy": 0.1815750315785408, "num_tokens": 36462883.0, "step": 16320 }, { "entropy": 5.5189462184906, "epoch": 1.833492446790588, "grad_norm": 1.3515625, "learning_rate": 0.0004671841167853933, "loss": 5.324, "mean_token_accuracy": 0.19218890368938446, "num_tokens": 36473609.0, "step": 16325 }, { "entropy": 5.573424434661865, "epoch": 1.8340540236985454, "grad_norm": 1.234375, "learning_rate": 0.0004671632354271962, "loss": 5.3145, "mean_token_accuracy": 0.18836932480335236, "num_tokens": 36484058.0, "step": 16330 }, { "entropy": 5.640398120880127, "epoch": 1.834615600606503, "grad_norm": 1.3203125, "learning_rate": 0.00046714234795044724, "loss": 5.36, "mean_token_accuracy": 0.18595891892910005, "num_tokens": 36496445.0, "step": 16335 }, { "entropy": 5.503306198120117, "epoch": 1.8351771775144607, "grad_norm": 1.1953125, "learning_rate": 0.0004671214543558113, "loss": 5.2861, "mean_token_accuracy": 0.19019471257925033, "num_tokens": 36507553.0, "step": 16340 }, { "entropy": 5.503566837310791, "epoch": 1.8357387544224182, "grad_norm": 1.3046875, "learning_rate": 0.0004671005546439538, "loss": 5.3336, "mean_token_accuracy": 0.1920084074139595, "num_tokens": 36517887.0, "step": 16345 }, { "entropy": 5.527010250091553, "epoch": 1.8363003313303756, "grad_norm": 1.4453125, "learning_rate": 0.00046707964881554005, "loss": 5.2848, "mean_token_accuracy": 0.18495176434516908, "num_tokens": 36529185.0, "step": 16350 }, { "entropy": 5.528638744354248, "epoch": 1.8368619082383333, "grad_norm": 1.34375, "learning_rate": 0.00046705873687123586, "loss": 5.3722, "mean_token_accuracy": 0.19100251346826552, "num_tokens": 36539473.0, "step": 16355 }, { "entropy": 5.5641679763793945, "epoch": 1.837423485146291, "grad_norm": 1.34375, "learning_rate": 0.00046703781881170703, "loss": 5.3711, "mean_token_accuracy": 0.18921186923980712, "num_tokens": 36549603.0, "step": 16360 }, { "entropy": 5.534250068664551, "epoch": 1.8379850620542482, "grad_norm": 1.3359375, "learning_rate": 0.00046701689463761947, "loss": 5.3379, "mean_token_accuracy": 0.19235465973615645, "num_tokens": 36560394.0, "step": 16365 }, { "entropy": 5.61123833656311, "epoch": 1.8385466389622058, "grad_norm": 1.390625, "learning_rate": 0.00046699596434963953, "loss": 5.3686, "mean_token_accuracy": 0.18490458726882936, "num_tokens": 36570657.0, "step": 16370 }, { "entropy": 5.4530211925506595, "epoch": 1.8391082158701635, "grad_norm": 1.296875, "learning_rate": 0.0004669750279484337, "loss": 5.2226, "mean_token_accuracy": 0.19429712146520614, "num_tokens": 36580810.0, "step": 16375 }, { "entropy": 5.473446083068848, "epoch": 1.839669792778121, "grad_norm": 1.3828125, "learning_rate": 0.0004669540854346685, "loss": 5.2702, "mean_token_accuracy": 0.18894062936306, "num_tokens": 36592981.0, "step": 16380 }, { "entropy": 5.488171720504761, "epoch": 1.8402313696860784, "grad_norm": 1.421875, "learning_rate": 0.00046693313680901073, "loss": 5.2653, "mean_token_accuracy": 0.1925550326704979, "num_tokens": 36604130.0, "step": 16385 }, { "entropy": 5.470244550704956, "epoch": 1.840792946594036, "grad_norm": 1.3203125, "learning_rate": 0.00046691218207212744, "loss": 5.2851, "mean_token_accuracy": 0.1861992135643959, "num_tokens": 36614833.0, "step": 16390 }, { "entropy": 5.596527481079102, "epoch": 1.8413545235019937, "grad_norm": 1.3671875, "learning_rate": 0.0004668912212246859, "loss": 5.2951, "mean_token_accuracy": 0.19008202254772186, "num_tokens": 36625306.0, "step": 16395 }, { "entropy": 5.712037181854248, "epoch": 1.8419161004099511, "grad_norm": 1.34375, "learning_rate": 0.00046687025426735335, "loss": 5.5507, "mean_token_accuracy": 0.17697899043560028, "num_tokens": 36637396.0, "step": 16400 }, { "entropy": 5.578679132461548, "epoch": 1.8424776773179086, "grad_norm": 1.1953125, "learning_rate": 0.0004668492812007976, "loss": 5.339, "mean_token_accuracy": 0.18426618576049805, "num_tokens": 36648175.0, "step": 16405 }, { "entropy": 5.5641011714935305, "epoch": 1.8430392542258662, "grad_norm": 1.3984375, "learning_rate": 0.0004668283020256863, "loss": 5.3825, "mean_token_accuracy": 0.18374981880187988, "num_tokens": 36659876.0, "step": 16410 }, { "entropy": 5.546352672576904, "epoch": 1.843600831133824, "grad_norm": 1.328125, "learning_rate": 0.00046680731674268744, "loss": 5.388, "mean_token_accuracy": 0.1864971250295639, "num_tokens": 36671168.0, "step": 16415 }, { "entropy": 5.492926692962646, "epoch": 1.8441624080417813, "grad_norm": 1.25, "learning_rate": 0.0004667863253524692, "loss": 5.3088, "mean_token_accuracy": 0.19539319574832917, "num_tokens": 36680987.0, "step": 16420 }, { "entropy": 5.5537152767181395, "epoch": 1.8447239849497388, "grad_norm": 1.3203125, "learning_rate": 0.00046676532785569995, "loss": 5.376, "mean_token_accuracy": 0.185614974796772, "num_tokens": 36692396.0, "step": 16425 }, { "entropy": 5.494251823425293, "epoch": 1.8452855618576964, "grad_norm": 1.4140625, "learning_rate": 0.0004667443242530484, "loss": 5.2681, "mean_token_accuracy": 0.19782126992940902, "num_tokens": 36702696.0, "step": 16430 }, { "entropy": 5.4757472515106205, "epoch": 1.845847138765654, "grad_norm": 1.390625, "learning_rate": 0.00046672331454518314, "loss": 5.2973, "mean_token_accuracy": 0.19498538821935654, "num_tokens": 36713582.0, "step": 16435 }, { "entropy": 5.494393634796142, "epoch": 1.8464087156736115, "grad_norm": 1.4453125, "learning_rate": 0.0004667022987327732, "loss": 5.2826, "mean_token_accuracy": 0.1949489161372185, "num_tokens": 36724324.0, "step": 16440 }, { "entropy": 5.568372821807861, "epoch": 1.846970292581569, "grad_norm": 1.140625, "learning_rate": 0.0004666812768164877, "loss": 5.3701, "mean_token_accuracy": 0.19605543613433837, "num_tokens": 36736369.0, "step": 16445 }, { "entropy": 5.556389713287354, "epoch": 1.8475318694895266, "grad_norm": 1.2734375, "learning_rate": 0.00046666024879699606, "loss": 5.3992, "mean_token_accuracy": 0.19371566474437713, "num_tokens": 36748047.0, "step": 16450 }, { "entropy": 5.557503271102905, "epoch": 1.8480934463974843, "grad_norm": 1.46875, "learning_rate": 0.00046663921467496766, "loss": 5.3201, "mean_token_accuracy": 0.19459699243307113, "num_tokens": 36758943.0, "step": 16455 }, { "entropy": 5.612880420684815, "epoch": 1.8486550233054415, "grad_norm": 1.3203125, "learning_rate": 0.0004666181744510724, "loss": 5.3868, "mean_token_accuracy": 0.1820188581943512, "num_tokens": 36769807.0, "step": 16460 }, { "entropy": 5.468385457992554, "epoch": 1.8492166002133992, "grad_norm": 1.1640625, "learning_rate": 0.00046659712812598017, "loss": 5.2466, "mean_token_accuracy": 0.19445807486772537, "num_tokens": 36780370.0, "step": 16465 }, { "entropy": 5.431660175323486, "epoch": 1.8497781771213568, "grad_norm": 1.2734375, "learning_rate": 0.00046657607570036103, "loss": 5.2679, "mean_token_accuracy": 0.19591842740774154, "num_tokens": 36789757.0, "step": 16470 }, { "entropy": 5.495207262039185, "epoch": 1.8503397540293143, "grad_norm": 1.390625, "learning_rate": 0.00046655501717488533, "loss": 5.3225, "mean_token_accuracy": 0.1907737597823143, "num_tokens": 36800531.0, "step": 16475 }, { "entropy": 5.57843246459961, "epoch": 1.8509013309372717, "grad_norm": 1.171875, "learning_rate": 0.0004665339525502236, "loss": 5.4184, "mean_token_accuracy": 0.18473077565431595, "num_tokens": 36811666.0, "step": 16480 }, { "entropy": 5.522574234008789, "epoch": 1.8514629078452294, "grad_norm": 1.2734375, "learning_rate": 0.00046651288182704653, "loss": 5.2653, "mean_token_accuracy": 0.18938798904418946, "num_tokens": 36822443.0, "step": 16485 }, { "entropy": 5.5522459030151365, "epoch": 1.852024484753187, "grad_norm": 1.4375, "learning_rate": 0.0004664918050060251, "loss": 5.3293, "mean_token_accuracy": 0.1872788116335869, "num_tokens": 36835517.0, "step": 16490 }, { "entropy": 5.519955110549927, "epoch": 1.8525860616611445, "grad_norm": 1.4609375, "learning_rate": 0.0004664707220878302, "loss": 5.3371, "mean_token_accuracy": 0.19462635815143586, "num_tokens": 36845177.0, "step": 16495 }, { "entropy": 5.438331222534179, "epoch": 1.853147638569102, "grad_norm": 1.6171875, "learning_rate": 0.0004664496330731334, "loss": 5.2798, "mean_token_accuracy": 0.18872665315866471, "num_tokens": 36855821.0, "step": 16500 }, { "entropy": 5.556100273132325, "epoch": 1.8537092154770596, "grad_norm": 1.2578125, "learning_rate": 0.0004664285379626059, "loss": 5.389, "mean_token_accuracy": 0.1765715792775154, "num_tokens": 36866254.0, "step": 16505 }, { "entropy": 5.507565927505493, "epoch": 1.8542707923850172, "grad_norm": 1.1953125, "learning_rate": 0.00046640743675691954, "loss": 5.2211, "mean_token_accuracy": 0.19270853847265243, "num_tokens": 36876348.0, "step": 16510 }, { "entropy": 5.560690546035767, "epoch": 1.8548323692929747, "grad_norm": 1.484375, "learning_rate": 0.0004663863294567462, "loss": 5.3788, "mean_token_accuracy": 0.1828359082341194, "num_tokens": 36888088.0, "step": 16515 }, { "entropy": 5.677534580230713, "epoch": 1.8553939462009321, "grad_norm": 1.2890625, "learning_rate": 0.0004663652160627579, "loss": 5.4796, "mean_token_accuracy": 0.18595814406871797, "num_tokens": 36900203.0, "step": 16520 }, { "entropy": 5.587461280822754, "epoch": 1.8559555231088898, "grad_norm": 1.296875, "learning_rate": 0.00046634409657562683, "loss": 5.348, "mean_token_accuracy": 0.1860669359564781, "num_tokens": 36911321.0, "step": 16525 }, { "entropy": 5.57177586555481, "epoch": 1.8565171000168474, "grad_norm": 1.2421875, "learning_rate": 0.0004663229709960255, "loss": 5.4303, "mean_token_accuracy": 0.18599589318037033, "num_tokens": 36922562.0, "step": 16530 }, { "entropy": 5.52012825012207, "epoch": 1.8570786769248049, "grad_norm": 1.1796875, "learning_rate": 0.00046630183932462664, "loss": 5.2886, "mean_token_accuracy": 0.18841566741466523, "num_tokens": 36933923.0, "step": 16535 }, { "entropy": 5.484059810638428, "epoch": 1.8576402538327623, "grad_norm": 1.3515625, "learning_rate": 0.0004662807015621031, "loss": 5.3064, "mean_token_accuracy": 0.1898571565747261, "num_tokens": 36945203.0, "step": 16540 }, { "entropy": 5.523033905029297, "epoch": 1.85820183074072, "grad_norm": 1.234375, "learning_rate": 0.00046625955770912764, "loss": 5.2992, "mean_token_accuracy": 0.18876135647296904, "num_tokens": 36956094.0, "step": 16545 }, { "entropy": 5.586569976806641, "epoch": 1.8587634076486776, "grad_norm": 1.328125, "learning_rate": 0.00046623840776637384, "loss": 5.3545, "mean_token_accuracy": 0.19304639995098113, "num_tokens": 36967375.0, "step": 16550 }, { "entropy": 5.418436574935913, "epoch": 1.859324984556635, "grad_norm": 1.359375, "learning_rate": 0.0004662172517345149, "loss": 5.247, "mean_token_accuracy": 0.19597518146038057, "num_tokens": 36977674.0, "step": 16555 }, { "entropy": 5.527724647521973, "epoch": 1.8598865614645925, "grad_norm": 1.5, "learning_rate": 0.0004661960896142245, "loss": 5.4098, "mean_token_accuracy": 0.19291428476572037, "num_tokens": 36990241.0, "step": 16560 }, { "entropy": 5.545258331298828, "epoch": 1.8604481383725502, "grad_norm": 1.5625, "learning_rate": 0.00046617492140617654, "loss": 5.3528, "mean_token_accuracy": 0.1865066796541214, "num_tokens": 37002322.0, "step": 16565 }, { "entropy": 5.5665429592132565, "epoch": 1.8610097152805076, "grad_norm": 1.375, "learning_rate": 0.0004661537471110448, "loss": 5.3697, "mean_token_accuracy": 0.1901166707277298, "num_tokens": 37014524.0, "step": 16570 }, { "entropy": 5.5150861740112305, "epoch": 1.861571292188465, "grad_norm": 1.328125, "learning_rate": 0.0004661325667295037, "loss": 5.2295, "mean_token_accuracy": 0.19875368624925613, "num_tokens": 37025057.0, "step": 16575 }, { "entropy": 5.495872449874878, "epoch": 1.8621328690964227, "grad_norm": 1.21875, "learning_rate": 0.0004661113802622275, "loss": 5.382, "mean_token_accuracy": 0.1921732857823372, "num_tokens": 37035311.0, "step": 16580 }, { "entropy": 5.515810537338257, "epoch": 1.8626944460043804, "grad_norm": 1.3515625, "learning_rate": 0.0004660901877098908, "loss": 5.3676, "mean_token_accuracy": 0.19142916351556777, "num_tokens": 37046275.0, "step": 16585 }, { "entropy": 5.527347612380981, "epoch": 1.8632560229123378, "grad_norm": 1.2734375, "learning_rate": 0.0004660689890731685, "loss": 5.2279, "mean_token_accuracy": 0.19131554663181305, "num_tokens": 37057658.0, "step": 16590 }, { "entropy": 5.513562154769898, "epoch": 1.8638175998202953, "grad_norm": 1.4609375, "learning_rate": 0.00046604778435273546, "loss": 5.2489, "mean_token_accuracy": 0.19852979779243468, "num_tokens": 37067946.0, "step": 16595 }, { "entropy": 5.453700017929077, "epoch": 1.864379176728253, "grad_norm": 1.3046875, "learning_rate": 0.00046602657354926686, "loss": 5.2634, "mean_token_accuracy": 0.19169158935546876, "num_tokens": 37078881.0, "step": 16600 }, { "entropy": 5.513870763778686, "epoch": 1.8649407536362106, "grad_norm": 1.6953125, "learning_rate": 0.000466005356663438, "loss": 5.3893, "mean_token_accuracy": 0.18352641761302949, "num_tokens": 37090474.0, "step": 16605 }, { "entropy": 5.539599275588989, "epoch": 1.865502330544168, "grad_norm": 1.3125, "learning_rate": 0.00046598413369592463, "loss": 5.4367, "mean_token_accuracy": 0.19055111408233644, "num_tokens": 37101527.0, "step": 16610 }, { "entropy": 5.585215616226196, "epoch": 1.8660639074521255, "grad_norm": 1.265625, "learning_rate": 0.0004659629046474023, "loss": 5.355, "mean_token_accuracy": 0.18252760022878647, "num_tokens": 37112615.0, "step": 16615 }, { "entropy": 5.5295312881469725, "epoch": 1.8666254843600831, "grad_norm": 1.3359375, "learning_rate": 0.000465941669518547, "loss": 5.2566, "mean_token_accuracy": 0.19171176999807357, "num_tokens": 37122922.0, "step": 16620 }, { "entropy": 5.498215818405152, "epoch": 1.8671870612680408, "grad_norm": 1.3515625, "learning_rate": 0.0004659204283100349, "loss": 5.2786, "mean_token_accuracy": 0.19974020570516587, "num_tokens": 37133215.0, "step": 16625 }, { "entropy": 5.424301290512085, "epoch": 1.8677486381759982, "grad_norm": 1.421875, "learning_rate": 0.00046589918102254237, "loss": 5.1965, "mean_token_accuracy": 0.19507750272750854, "num_tokens": 37144292.0, "step": 16630 }, { "entropy": 5.477900838851928, "epoch": 1.8683102150839557, "grad_norm": 1.4296875, "learning_rate": 0.0004658779276567458, "loss": 5.3558, "mean_token_accuracy": 0.18585943430662155, "num_tokens": 37155623.0, "step": 16635 }, { "entropy": 5.630840015411377, "epoch": 1.8688717919919133, "grad_norm": 1.171875, "learning_rate": 0.00046585666821332203, "loss": 5.3456, "mean_token_accuracy": 0.190969055891037, "num_tokens": 37165406.0, "step": 16640 }, { "entropy": 5.563094186782837, "epoch": 1.869433368899871, "grad_norm": 1.3984375, "learning_rate": 0.00046583540269294794, "loss": 5.3656, "mean_token_accuracy": 0.19431325793266296, "num_tokens": 37175522.0, "step": 16645 }, { "entropy": 5.492715883255005, "epoch": 1.8699949458078284, "grad_norm": 1.4765625, "learning_rate": 0.0004658141310963006, "loss": 5.3912, "mean_token_accuracy": 0.19230775833129882, "num_tokens": 37186745.0, "step": 16650 }, { "entropy": 5.479142761230468, "epoch": 1.8705565227157859, "grad_norm": 1.21875, "learning_rate": 0.0004657928534240573, "loss": 5.2403, "mean_token_accuracy": 0.19582124352455138, "num_tokens": 37197357.0, "step": 16655 }, { "entropy": 5.554664564132691, "epoch": 1.8711180996237435, "grad_norm": 1.9140625, "learning_rate": 0.0004657715696768955, "loss": 5.3881, "mean_token_accuracy": 0.18799951076507568, "num_tokens": 37209839.0, "step": 16660 }, { "entropy": 5.596767520904541, "epoch": 1.871679676531701, "grad_norm": 1.15625, "learning_rate": 0.000465750279855493, "loss": 5.4143, "mean_token_accuracy": 0.1821955546736717, "num_tokens": 37221314.0, "step": 16665 }, { "entropy": 5.569704675674439, "epoch": 1.8722412534396584, "grad_norm": 1.2734375, "learning_rate": 0.0004657289839605276, "loss": 5.2706, "mean_token_accuracy": 0.1906728371977806, "num_tokens": 37233372.0, "step": 16670 }, { "entropy": 5.593374586105346, "epoch": 1.872802830347616, "grad_norm": 1.40625, "learning_rate": 0.0004657076819926774, "loss": 5.3701, "mean_token_accuracy": 0.18732914477586746, "num_tokens": 37244758.0, "step": 16675 }, { "entropy": 5.568263387680053, "epoch": 1.8733644072555737, "grad_norm": 1.515625, "learning_rate": 0.0004656863739526206, "loss": 5.3281, "mean_token_accuracy": 0.18720599859952927, "num_tokens": 37255848.0, "step": 16680 }, { "entropy": 5.488857936859131, "epoch": 1.8739259841635312, "grad_norm": 1.359375, "learning_rate": 0.00046566505984103575, "loss": 5.2712, "mean_token_accuracy": 0.1951414555311203, "num_tokens": 37266010.0, "step": 16685 }, { "entropy": 5.4241259574890135, "epoch": 1.8744875610714886, "grad_norm": 1.3359375, "learning_rate": 0.0004656437396586014, "loss": 5.2931, "mean_token_accuracy": 0.18768802732229234, "num_tokens": 37278445.0, "step": 16690 }, { "entropy": 5.642972850799561, "epoch": 1.8750491379794463, "grad_norm": 1.2734375, "learning_rate": 0.0004656224134059964, "loss": 5.4392, "mean_token_accuracy": 0.18230196088552475, "num_tokens": 37291181.0, "step": 16695 }, { "entropy": 5.6833336353302, "epoch": 1.875610714887404, "grad_norm": 1.25, "learning_rate": 0.00046560108108389985, "loss": 5.52, "mean_token_accuracy": 0.18521885722875595, "num_tokens": 37302333.0, "step": 16700 }, { "entropy": 5.516350030899048, "epoch": 1.8761722917953614, "grad_norm": 1.6328125, "learning_rate": 0.000465579742692991, "loss": 5.2709, "mean_token_accuracy": 0.1961539715528488, "num_tokens": 37312754.0, "step": 16705 }, { "entropy": 5.5581494808197025, "epoch": 1.8767338687033188, "grad_norm": 1.2265625, "learning_rate": 0.0004655583982339492, "loss": 5.3492, "mean_token_accuracy": 0.19225821644067764, "num_tokens": 37323335.0, "step": 16710 }, { "entropy": 5.565476655960083, "epoch": 1.8772954456112765, "grad_norm": 1.25, "learning_rate": 0.0004655370477074541, "loss": 5.3435, "mean_token_accuracy": 0.1916085883975029, "num_tokens": 37334332.0, "step": 16715 }, { "entropy": 5.5233629703521725, "epoch": 1.8778570225192341, "grad_norm": 1.2578125, "learning_rate": 0.0004655156911141855, "loss": 5.3511, "mean_token_accuracy": 0.18915074169635773, "num_tokens": 37344770.0, "step": 16720 }, { "entropy": 5.549921321868896, "epoch": 1.8784185994271916, "grad_norm": 1.375, "learning_rate": 0.0004654943284548234, "loss": 5.2933, "mean_token_accuracy": 0.1868213325738907, "num_tokens": 37356009.0, "step": 16725 }, { "entropy": 5.4536461353302, "epoch": 1.878980176335149, "grad_norm": 1.5625, "learning_rate": 0.00046547295973004807, "loss": 5.2729, "mean_token_accuracy": 0.19684419333934783, "num_tokens": 37367823.0, "step": 16730 }, { "entropy": 5.45973949432373, "epoch": 1.8795417532431067, "grad_norm": 1.1953125, "learning_rate": 0.00046545158494053966, "loss": 5.3001, "mean_token_accuracy": 0.18995605856180192, "num_tokens": 37378156.0, "step": 16735 }, { "entropy": 5.555756092071533, "epoch": 1.8801033301510643, "grad_norm": 1.328125, "learning_rate": 0.00046543020408697905, "loss": 5.339, "mean_token_accuracy": 0.1906617671251297, "num_tokens": 37388378.0, "step": 16740 }, { "entropy": 5.4716565132141115, "epoch": 1.8806649070590218, "grad_norm": 1.296875, "learning_rate": 0.00046540881717004685, "loss": 5.2365, "mean_token_accuracy": 0.18968347012996672, "num_tokens": 37398457.0, "step": 16745 }, { "entropy": 5.553845930099487, "epoch": 1.8812264839669792, "grad_norm": 1.3828125, "learning_rate": 0.0004653874241904241, "loss": 5.4273, "mean_token_accuracy": 0.1854670152068138, "num_tokens": 37409341.0, "step": 16750 }, { "entropy": 5.5429408073425295, "epoch": 1.8817880608749369, "grad_norm": 1.2109375, "learning_rate": 0.0004653660251487919, "loss": 5.2391, "mean_token_accuracy": 0.19419020563364028, "num_tokens": 37420081.0, "step": 16755 }, { "entropy": 5.446212291717529, "epoch": 1.8823496377828943, "grad_norm": 1.5390625, "learning_rate": 0.00046534462004583154, "loss": 5.2324, "mean_token_accuracy": 0.20230178385972977, "num_tokens": 37430707.0, "step": 16760 }, { "entropy": 5.4975244998931885, "epoch": 1.8829112146908518, "grad_norm": 1.4453125, "learning_rate": 0.0004653232088822248, "loss": 5.3504, "mean_token_accuracy": 0.18768247067928315, "num_tokens": 37441250.0, "step": 16765 }, { "entropy": 5.561507081985473, "epoch": 1.8834727915988094, "grad_norm": 1.390625, "learning_rate": 0.0004653017916586532, "loss": 5.4027, "mean_token_accuracy": 0.18384319096803664, "num_tokens": 37452909.0, "step": 16770 }, { "entropy": 5.5425133228302, "epoch": 1.884034368506767, "grad_norm": 1.1796875, "learning_rate": 0.0004652803683757987, "loss": 5.3365, "mean_token_accuracy": 0.1840794563293457, "num_tokens": 37463833.0, "step": 16775 }, { "entropy": 5.441729974746704, "epoch": 1.8845959454147245, "grad_norm": 1.3046875, "learning_rate": 0.0004652589390343436, "loss": 5.2705, "mean_token_accuracy": 0.19357890188694, "num_tokens": 37473967.0, "step": 16780 }, { "entropy": 5.564308452606201, "epoch": 1.885157522322682, "grad_norm": 1.2578125, "learning_rate": 0.00046523750363497, "loss": 5.3053, "mean_token_accuracy": 0.19836509376764297, "num_tokens": 37484748.0, "step": 16785 }, { "entropy": 5.549997997283936, "epoch": 1.8857190992306396, "grad_norm": 1.65625, "learning_rate": 0.0004652160621783605, "loss": 5.3301, "mean_token_accuracy": 0.1822197899222374, "num_tokens": 37495757.0, "step": 16790 }, { "entropy": 5.497464179992676, "epoch": 1.8862806761385973, "grad_norm": 1.3203125, "learning_rate": 0.00046519461466519785, "loss": 5.3374, "mean_token_accuracy": 0.1866649031639099, "num_tokens": 37506612.0, "step": 16795 }, { "entropy": 5.467371129989624, "epoch": 1.8868422530465547, "grad_norm": 1.5, "learning_rate": 0.0004651731610961649, "loss": 5.2538, "mean_token_accuracy": 0.19866592735052108, "num_tokens": 37518639.0, "step": 16800 }, { "entropy": 5.52176194190979, "epoch": 1.8874038299545122, "grad_norm": 1.6875, "learning_rate": 0.0004651517014719446, "loss": 5.3212, "mean_token_accuracy": 0.18694213777780533, "num_tokens": 37530020.0, "step": 16805 }, { "entropy": 5.483829069137573, "epoch": 1.8879654068624698, "grad_norm": 1.375, "learning_rate": 0.0004651302357932206, "loss": 5.2563, "mean_token_accuracy": 0.1908920630812645, "num_tokens": 37540737.0, "step": 16810 }, { "entropy": 5.427550506591797, "epoch": 1.8885269837704275, "grad_norm": 1.2421875, "learning_rate": 0.000465108764060676, "loss": 5.275, "mean_token_accuracy": 0.18921370804309845, "num_tokens": 37551091.0, "step": 16815 }, { "entropy": 5.542868661880493, "epoch": 1.889088560678385, "grad_norm": 1.21875, "learning_rate": 0.00046508728627499464, "loss": 5.3951, "mean_token_accuracy": 0.18349259197711945, "num_tokens": 37561904.0, "step": 16820 }, { "entropy": 5.62216272354126, "epoch": 1.8896501375863424, "grad_norm": 1.28125, "learning_rate": 0.0004650658024368604, "loss": 5.4204, "mean_token_accuracy": 0.1816960707306862, "num_tokens": 37573532.0, "step": 16825 }, { "entropy": 5.659744358062744, "epoch": 1.8902117144943, "grad_norm": 1.1875, "learning_rate": 0.0004650443125469573, "loss": 5.4083, "mean_token_accuracy": 0.19345381557941438, "num_tokens": 37584886.0, "step": 16830 }, { "entropy": 5.502018308639526, "epoch": 1.8907732914022577, "grad_norm": 1.265625, "learning_rate": 0.0004650228166059695, "loss": 5.3367, "mean_token_accuracy": 0.18997133523225784, "num_tokens": 37595190.0, "step": 16835 }, { "entropy": 5.446289587020874, "epoch": 1.8913348683102151, "grad_norm": 1.2734375, "learning_rate": 0.0004650013146145816, "loss": 5.2862, "mean_token_accuracy": 0.19220385253429412, "num_tokens": 37605776.0, "step": 16840 }, { "entropy": 5.606544780731201, "epoch": 1.8918964452181726, "grad_norm": 1.234375, "learning_rate": 0.0004649798065734781, "loss": 5.3897, "mean_token_accuracy": 0.18499674052000045, "num_tokens": 37616882.0, "step": 16845 }, { "entropy": 5.664537143707276, "epoch": 1.8924580221261302, "grad_norm": 1.2890625, "learning_rate": 0.00046495829248334393, "loss": 5.4515, "mean_token_accuracy": 0.18400414884090424, "num_tokens": 37628528.0, "step": 16850 }, { "entropy": 5.551404237747192, "epoch": 1.8930195990340877, "grad_norm": 1.328125, "learning_rate": 0.0004649367723448641, "loss": 5.3587, "mean_token_accuracy": 0.18622815757989883, "num_tokens": 37640502.0, "step": 16855 }, { "entropy": 5.4735455989837645, "epoch": 1.8935811759420451, "grad_norm": 1.421875, "learning_rate": 0.00046491524615872366, "loss": 5.3133, "mean_token_accuracy": 0.1845741242170334, "num_tokens": 37652845.0, "step": 16860 }, { "entropy": 5.5555400371551515, "epoch": 1.8941427528500028, "grad_norm": 1.3125, "learning_rate": 0.00046489371392560816, "loss": 5.451, "mean_token_accuracy": 0.1814900740981102, "num_tokens": 37665418.0, "step": 16865 }, { "entropy": 5.5555469512939455, "epoch": 1.8947043297579604, "grad_norm": 1.5625, "learning_rate": 0.00046487217564620317, "loss": 5.3789, "mean_token_accuracy": 0.1876147910952568, "num_tokens": 37676429.0, "step": 16870 }, { "entropy": 5.571235418319702, "epoch": 1.8952659066659179, "grad_norm": 1.375, "learning_rate": 0.0004648506313211945, "loss": 5.3486, "mean_token_accuracy": 0.19341038316488265, "num_tokens": 37686779.0, "step": 16875 }, { "entropy": 5.491058588027954, "epoch": 1.8958274835738753, "grad_norm": 1.34375, "learning_rate": 0.00046482908095126803, "loss": 5.3897, "mean_token_accuracy": 0.18769828379154205, "num_tokens": 37697665.0, "step": 16880 }, { "entropy": 5.5995521068573, "epoch": 1.896389060481833, "grad_norm": 1.3125, "learning_rate": 0.00046480752453711, "loss": 5.3992, "mean_token_accuracy": 0.18566225469112396, "num_tokens": 37708987.0, "step": 16885 }, { "entropy": 5.495259618759155, "epoch": 1.8969506373897906, "grad_norm": 1.3671875, "learning_rate": 0.0004647859620794068, "loss": 5.2325, "mean_token_accuracy": 0.1924973323941231, "num_tokens": 37720335.0, "step": 16890 }, { "entropy": 5.579281902313232, "epoch": 1.897512214297748, "grad_norm": 1.375, "learning_rate": 0.00046476439357884497, "loss": 5.4145, "mean_token_accuracy": 0.18679735511541368, "num_tokens": 37731586.0, "step": 16895 }, { "entropy": 5.562653350830078, "epoch": 1.8980737912057055, "grad_norm": 1.546875, "learning_rate": 0.00046474281903611126, "loss": 5.3104, "mean_token_accuracy": 0.19232197701931, "num_tokens": 37742907.0, "step": 16900 }, { "entropy": 5.62323112487793, "epoch": 1.8986353681136632, "grad_norm": 1.25, "learning_rate": 0.00046472123845189253, "loss": 5.3992, "mean_token_accuracy": 0.18631621599197387, "num_tokens": 37753787.0, "step": 16905 }, { "entropy": 5.490570402145385, "epoch": 1.8991969450216208, "grad_norm": 1.21875, "learning_rate": 0.000464699651826876, "loss": 5.3081, "mean_token_accuracy": 0.1899639844894409, "num_tokens": 37766047.0, "step": 16910 }, { "entropy": 5.505640983581543, "epoch": 1.8997585219295783, "grad_norm": 1.2734375, "learning_rate": 0.00046467805916174907, "loss": 5.2912, "mean_token_accuracy": 0.1874990016222, "num_tokens": 37777651.0, "step": 16915 }, { "entropy": 5.486234426498413, "epoch": 1.9003200988375357, "grad_norm": 1.609375, "learning_rate": 0.00046465646045719915, "loss": 5.3304, "mean_token_accuracy": 0.1921023830771446, "num_tokens": 37788527.0, "step": 16920 }, { "entropy": 5.444620609283447, "epoch": 1.9008816757454934, "grad_norm": 1.328125, "learning_rate": 0.0004646348557139139, "loss": 5.2755, "mean_token_accuracy": 0.18400513976812363, "num_tokens": 37800727.0, "step": 16925 }, { "entropy": 5.529443979263306, "epoch": 1.901443252653451, "grad_norm": 1.46875, "learning_rate": 0.00046461324493258133, "loss": 5.2671, "mean_token_accuracy": 0.1931947410106659, "num_tokens": 37812332.0, "step": 16930 }, { "entropy": 5.5595433712005615, "epoch": 1.9020048295614085, "grad_norm": 1.3203125, "learning_rate": 0.00046459162811388955, "loss": 5.3685, "mean_token_accuracy": 0.18835092037916185, "num_tokens": 37823665.0, "step": 16935 }, { "entropy": 5.451412010192871, "epoch": 1.902566406469366, "grad_norm": 1.4140625, "learning_rate": 0.0004645700052585267, "loss": 5.1889, "mean_token_accuracy": 0.20055983066558838, "num_tokens": 37833793.0, "step": 16940 }, { "entropy": 5.42030701637268, "epoch": 1.9031279833773236, "grad_norm": 1.328125, "learning_rate": 0.0004645483763671815, "loss": 5.222, "mean_token_accuracy": 0.1994650512933731, "num_tokens": 37844104.0, "step": 16945 }, { "entropy": 5.556173849105835, "epoch": 1.903689560285281, "grad_norm": 1.2734375, "learning_rate": 0.00046452674144054236, "loss": 5.3015, "mean_token_accuracy": 0.19548871517181396, "num_tokens": 37853920.0, "step": 16950 }, { "entropy": 5.505234622955323, "epoch": 1.9042511371932385, "grad_norm": 1.4453125, "learning_rate": 0.00046450510047929826, "loss": 5.3638, "mean_token_accuracy": 0.18661977350711823, "num_tokens": 37865749.0, "step": 16955 }, { "entropy": 5.4916908740997314, "epoch": 1.9048127141011961, "grad_norm": 1.265625, "learning_rate": 0.00046448345348413833, "loss": 5.3213, "mean_token_accuracy": 0.18939271867275237, "num_tokens": 37876259.0, "step": 16960 }, { "entropy": 5.591541385650634, "epoch": 1.9053742910091538, "grad_norm": 1.40625, "learning_rate": 0.0004644618004557517, "loss": 5.3973, "mean_token_accuracy": 0.18937608003616332, "num_tokens": 37887186.0, "step": 16965 }, { "entropy": 5.450802040100098, "epoch": 1.9059358679171112, "grad_norm": 1.3828125, "learning_rate": 0.0004644401413948279, "loss": 5.2058, "mean_token_accuracy": 0.19802374243736268, "num_tokens": 37898210.0, "step": 16970 }, { "entropy": 5.5113931655883786, "epoch": 1.9064974448250687, "grad_norm": 1.2109375, "learning_rate": 0.0004644184763020565, "loss": 5.3294, "mean_token_accuracy": 0.1850786715745926, "num_tokens": 37909332.0, "step": 16975 }, { "entropy": 5.499251031875611, "epoch": 1.9070590217330263, "grad_norm": 1.3828125, "learning_rate": 0.0004643968051781273, "loss": 5.2756, "mean_token_accuracy": 0.1952410012483597, "num_tokens": 37919796.0, "step": 16980 }, { "entropy": 5.546873712539673, "epoch": 1.907620598640984, "grad_norm": 1.3046875, "learning_rate": 0.0004643751280237305, "loss": 5.4289, "mean_token_accuracy": 0.18502222895622253, "num_tokens": 37931135.0, "step": 16985 }, { "entropy": 5.632438373565674, "epoch": 1.9081821755489414, "grad_norm": 1.2421875, "learning_rate": 0.0004643534448395561, "loss": 5.4213, "mean_token_accuracy": 0.18655699491500854, "num_tokens": 37942302.0, "step": 16990 }, { "entropy": 5.503334045410156, "epoch": 1.9087437524568989, "grad_norm": 1.234375, "learning_rate": 0.0004643317556262946, "loss": 5.3274, "mean_token_accuracy": 0.18913712799549104, "num_tokens": 37954188.0, "step": 16995 }, { "entropy": 5.523032188415527, "epoch": 1.9093053293648565, "grad_norm": 1.4375, "learning_rate": 0.00046431006038463653, "loss": 5.3595, "mean_token_accuracy": 0.18022434711456298, "num_tokens": 37964778.0, "step": 17000 }, { "entropy": 5.638865041732788, "epoch": 1.9098669062728142, "grad_norm": 1.171875, "learning_rate": 0.0004642883591152727, "loss": 5.3805, "mean_token_accuracy": 0.1816907823085785, "num_tokens": 37976384.0, "step": 17005 }, { "entropy": 5.5630089282989506, "epoch": 1.9104284831807716, "grad_norm": 1.3203125, "learning_rate": 0.0004642666518188942, "loss": 5.3749, "mean_token_accuracy": 0.18493264317512512, "num_tokens": 37986975.0, "step": 17010 }, { "entropy": 5.65526819229126, "epoch": 1.910990060088729, "grad_norm": 1.296875, "learning_rate": 0.00046424493849619205, "loss": 5.486, "mean_token_accuracy": 0.18746909946203233, "num_tokens": 37999255.0, "step": 17015 }, { "entropy": 5.624090242385864, "epoch": 1.9115516369966867, "grad_norm": 2.125, "learning_rate": 0.00046422321914785757, "loss": 5.4296, "mean_token_accuracy": 0.18602934181690217, "num_tokens": 38010436.0, "step": 17020 }, { "entropy": 5.434043741226196, "epoch": 1.9121132139046444, "grad_norm": 1.1875, "learning_rate": 0.00046420149377458255, "loss": 5.2446, "mean_token_accuracy": 0.19463708102703095, "num_tokens": 38021537.0, "step": 17025 }, { "entropy": 5.514421558380127, "epoch": 1.9126747908126018, "grad_norm": 1.453125, "learning_rate": 0.00046417976237705846, "loss": 5.3261, "mean_token_accuracy": 0.18595751821994783, "num_tokens": 38033396.0, "step": 17030 }, { "entropy": 5.533701801300049, "epoch": 1.9132363677205593, "grad_norm": 1.203125, "learning_rate": 0.00046415802495597744, "loss": 5.2384, "mean_token_accuracy": 0.20455720126628876, "num_tokens": 38044917.0, "step": 17035 }, { "entropy": 5.525361251831055, "epoch": 1.913797944628517, "grad_norm": 1.4609375, "learning_rate": 0.00046413628151203154, "loss": 5.4001, "mean_token_accuracy": 0.19001386910676957, "num_tokens": 38057002.0, "step": 17040 }, { "entropy": 5.448178672790528, "epoch": 1.9143595215364744, "grad_norm": 1.1875, "learning_rate": 0.00046411453204591303, "loss": 5.1667, "mean_token_accuracy": 0.20019909888505935, "num_tokens": 38068023.0, "step": 17045 }, { "entropy": 5.618009853363037, "epoch": 1.9149210984444318, "grad_norm": 1.5078125, "learning_rate": 0.00046409277655831455, "loss": 5.4787, "mean_token_accuracy": 0.17797086536884307, "num_tokens": 38080137.0, "step": 17050 }, { "entropy": 5.601627683639526, "epoch": 1.9154826753523895, "grad_norm": 1.4765625, "learning_rate": 0.0004640710150499287, "loss": 5.2752, "mean_token_accuracy": 0.19400590062141418, "num_tokens": 38090078.0, "step": 17055 }, { "entropy": 5.5804304599761965, "epoch": 1.9160442522603471, "grad_norm": 1.5859375, "learning_rate": 0.00046404924752144834, "loss": 5.3996, "mean_token_accuracy": 0.18672227412462233, "num_tokens": 38101410.0, "step": 17060 }, { "entropy": 5.512361478805542, "epoch": 1.9166058291683046, "grad_norm": 1.3828125, "learning_rate": 0.00046402747397356666, "loss": 5.2792, "mean_token_accuracy": 0.19851553738117217, "num_tokens": 38111610.0, "step": 17065 }, { "entropy": 5.558873319625855, "epoch": 1.917167406076262, "grad_norm": 1.1796875, "learning_rate": 0.0004640056944069768, "loss": 5.3149, "mean_token_accuracy": 0.19130940288305281, "num_tokens": 38122947.0, "step": 17070 }, { "entropy": 5.499215221405029, "epoch": 1.9177289829842197, "grad_norm": 1.25, "learning_rate": 0.0004639839088223725, "loss": 5.2677, "mean_token_accuracy": 0.20023803561925888, "num_tokens": 38133083.0, "step": 17075 }, { "entropy": 5.53978419303894, "epoch": 1.9182905598921773, "grad_norm": 1.2578125, "learning_rate": 0.00046396211722044716, "loss": 5.315, "mean_token_accuracy": 0.1979520857334137, "num_tokens": 38142941.0, "step": 17080 }, { "entropy": 5.56115345954895, "epoch": 1.9188521368001348, "grad_norm": 1.46875, "learning_rate": 0.00046394031960189473, "loss": 5.3485, "mean_token_accuracy": 0.18756425976753235, "num_tokens": 38154269.0, "step": 17085 }, { "entropy": 5.49371976852417, "epoch": 1.9194137137080922, "grad_norm": 1.3359375, "learning_rate": 0.0004639185159674093, "loss": 5.266, "mean_token_accuracy": 0.19421560764312745, "num_tokens": 38164153.0, "step": 17090 }, { "entropy": 5.554946804046631, "epoch": 1.9199752906160499, "grad_norm": 1.4765625, "learning_rate": 0.00046389670631768494, "loss": 5.3929, "mean_token_accuracy": 0.1864183157682419, "num_tokens": 38174704.0, "step": 17095 }, { "entropy": 5.675718641281128, "epoch": 1.9205368675240075, "grad_norm": 1.265625, "learning_rate": 0.0004638748906534162, "loss": 5.423, "mean_token_accuracy": 0.18479039371013642, "num_tokens": 38186292.0, "step": 17100 }, { "entropy": 5.5812060832977295, "epoch": 1.921098444431965, "grad_norm": 1.2890625, "learning_rate": 0.0004638530689752977, "loss": 5.3528, "mean_token_accuracy": 0.1936494678258896, "num_tokens": 38197419.0, "step": 17105 }, { "entropy": 5.524025583267212, "epoch": 1.9216600213399224, "grad_norm": 1.3203125, "learning_rate": 0.00046383124128402433, "loss": 5.359, "mean_token_accuracy": 0.18838028460741044, "num_tokens": 38208276.0, "step": 17110 }, { "entropy": 5.435537338256836, "epoch": 1.92222159824788, "grad_norm": 1.2421875, "learning_rate": 0.00046380940758029095, "loss": 5.2467, "mean_token_accuracy": 0.1975184515118599, "num_tokens": 38220276.0, "step": 17115 }, { "entropy": 5.510719680786133, "epoch": 1.9227831751558377, "grad_norm": 1.140625, "learning_rate": 0.00046378756786479274, "loss": 5.3592, "mean_token_accuracy": 0.1928332716226578, "num_tokens": 38230760.0, "step": 17120 }, { "entropy": 5.502442646026611, "epoch": 1.9233447520637952, "grad_norm": 1.3046875, "learning_rate": 0.0004637657221382252, "loss": 5.2511, "mean_token_accuracy": 0.19449742287397384, "num_tokens": 38241769.0, "step": 17125 }, { "entropy": 5.562748861312866, "epoch": 1.9239063289717526, "grad_norm": 1.3515625, "learning_rate": 0.00046374387040128384, "loss": 5.3496, "mean_token_accuracy": 0.18859248012304305, "num_tokens": 38252800.0, "step": 17130 }, { "entropy": 5.461896514892578, "epoch": 1.9244679058797103, "grad_norm": 1.5546875, "learning_rate": 0.00046372201265466444, "loss": 5.2612, "mean_token_accuracy": 0.1905917689204216, "num_tokens": 38264319.0, "step": 17135 }, { "entropy": 5.46633825302124, "epoch": 1.9250294827876677, "grad_norm": 1.3203125, "learning_rate": 0.000463700148899063, "loss": 5.3072, "mean_token_accuracy": 0.1901361256837845, "num_tokens": 38275118.0, "step": 17140 }, { "entropy": 5.656360721588134, "epoch": 1.9255910596956252, "grad_norm": 1.21875, "learning_rate": 0.0004636782791351756, "loss": 5.4582, "mean_token_accuracy": 0.18556168526411057, "num_tokens": 38286264.0, "step": 17145 }, { "entropy": 5.5240942478179935, "epoch": 1.9261526366035828, "grad_norm": 1.3359375, "learning_rate": 0.0004636564033636987, "loss": 5.2513, "mean_token_accuracy": 0.19560887068510055, "num_tokens": 38297603.0, "step": 17150 }, { "entropy": 5.538367128372192, "epoch": 1.9267142135115405, "grad_norm": 1.203125, "learning_rate": 0.00046363452158532857, "loss": 5.3964, "mean_token_accuracy": 0.1822678416967392, "num_tokens": 38308760.0, "step": 17155 }, { "entropy": 5.582892894744873, "epoch": 1.927275790419498, "grad_norm": 1.15625, "learning_rate": 0.0004636126338007622, "loss": 5.3517, "mean_token_accuracy": 0.18947700262069703, "num_tokens": 38320807.0, "step": 17160 }, { "entropy": 5.46394453048706, "epoch": 1.9278373673274554, "grad_norm": 1.375, "learning_rate": 0.0004635907400106965, "loss": 5.3272, "mean_token_accuracy": 0.18540936410427095, "num_tokens": 38331087.0, "step": 17165 }, { "entropy": 5.478472423553467, "epoch": 1.928398944235413, "grad_norm": 1.2890625, "learning_rate": 0.0004635688402158285, "loss": 5.2903, "mean_token_accuracy": 0.19315948486328124, "num_tokens": 38341659.0, "step": 17170 }, { "entropy": 5.470145225524902, "epoch": 1.9289605211433707, "grad_norm": 1.1875, "learning_rate": 0.00046354693441685537, "loss": 5.254, "mean_token_accuracy": 0.1987090140581131, "num_tokens": 38351371.0, "step": 17175 }, { "entropy": 5.468095541000366, "epoch": 1.9295220980513281, "grad_norm": 1.2421875, "learning_rate": 0.00046352502261447475, "loss": 5.262, "mean_token_accuracy": 0.1989993393421173, "num_tokens": 38362677.0, "step": 17180 }, { "entropy": 5.46759262084961, "epoch": 1.9300836749592856, "grad_norm": 1.296875, "learning_rate": 0.0004635031048093843, "loss": 5.3095, "mean_token_accuracy": 0.19176963865756988, "num_tokens": 38372882.0, "step": 17185 }, { "entropy": 5.596657609939575, "epoch": 1.9306452518672432, "grad_norm": 1.25, "learning_rate": 0.0004634811810022819, "loss": 5.4029, "mean_token_accuracy": 0.18605346381664276, "num_tokens": 38383401.0, "step": 17190 }, { "entropy": 5.599388122558594, "epoch": 1.931206828775201, "grad_norm": 1.2109375, "learning_rate": 0.00046345925119386556, "loss": 5.432, "mean_token_accuracy": 0.1843906819820404, "num_tokens": 38394733.0, "step": 17195 }, { "entropy": 5.609647226333618, "epoch": 1.9317684056831583, "grad_norm": 1.3046875, "learning_rate": 0.0004634373153848336, "loss": 5.3993, "mean_token_accuracy": 0.19139508306980133, "num_tokens": 38406482.0, "step": 17200 }, { "entropy": 5.578036069869995, "epoch": 1.9323299825911158, "grad_norm": 1.296875, "learning_rate": 0.0004634153735758845, "loss": 5.3039, "mean_token_accuracy": 0.19059739410877227, "num_tokens": 38417366.0, "step": 17205 }, { "entropy": 5.554816341400146, "epoch": 1.9328915594990734, "grad_norm": 1.3671875, "learning_rate": 0.0004633934257677167, "loss": 5.37, "mean_token_accuracy": 0.19673199206590652, "num_tokens": 38428440.0, "step": 17210 }, { "entropy": 5.5706367015838625, "epoch": 1.933453136407031, "grad_norm": 1.4765625, "learning_rate": 0.0004633714719610292, "loss": 5.3233, "mean_token_accuracy": 0.1908646509051323, "num_tokens": 38438471.0, "step": 17215 }, { "entropy": 5.588924694061279, "epoch": 1.9340147133149885, "grad_norm": 1.3984375, "learning_rate": 0.00046334951215652097, "loss": 5.3018, "mean_token_accuracy": 0.19423958659172058, "num_tokens": 38448990.0, "step": 17220 }, { "entropy": 5.582559108734131, "epoch": 1.934576290222946, "grad_norm": 1.4921875, "learning_rate": 0.00046332754635489126, "loss": 5.3657, "mean_token_accuracy": 0.18794859498739241, "num_tokens": 38460990.0, "step": 17225 }, { "entropy": 5.569936895370484, "epoch": 1.9351378671309036, "grad_norm": 1.359375, "learning_rate": 0.0004633055745568394, "loss": 5.4139, "mean_token_accuracy": 0.1809059590101242, "num_tokens": 38471672.0, "step": 17230 }, { "entropy": 5.4709044933319095, "epoch": 1.935699444038861, "grad_norm": 1.375, "learning_rate": 0.00046328359676306506, "loss": 5.2884, "mean_token_accuracy": 0.1941262200474739, "num_tokens": 38483248.0, "step": 17235 }, { "entropy": 5.566699647903443, "epoch": 1.9362610209468185, "grad_norm": 1.390625, "learning_rate": 0.000463261612974268, "loss": 5.3048, "mean_token_accuracy": 0.19185658544301987, "num_tokens": 38494795.0, "step": 17240 }, { "entropy": 5.485395050048828, "epoch": 1.9368225978547762, "grad_norm": 1.4765625, "learning_rate": 0.0004632396231911481, "loss": 5.3053, "mean_token_accuracy": 0.19147204756736755, "num_tokens": 38505276.0, "step": 17245 }, { "entropy": 5.625464916229248, "epoch": 1.9373841747627338, "grad_norm": 1.28125, "learning_rate": 0.0004632176274144056, "loss": 5.3527, "mean_token_accuracy": 0.18187369257211686, "num_tokens": 38515536.0, "step": 17250 }, { "entropy": 5.529721355438232, "epoch": 1.9379457516706913, "grad_norm": 1.640625, "learning_rate": 0.00046319562564474083, "loss": 5.3186, "mean_token_accuracy": 0.19153500944375992, "num_tokens": 38525579.0, "step": 17255 }, { "entropy": 5.624566459655762, "epoch": 1.9385073285786487, "grad_norm": 1.28125, "learning_rate": 0.00046317361788285436, "loss": 5.4925, "mean_token_accuracy": 0.185320383310318, "num_tokens": 38536963.0, "step": 17260 }, { "entropy": 5.534394025802612, "epoch": 1.9390689054866064, "grad_norm": 1.78125, "learning_rate": 0.0004631516041294469, "loss": 5.3881, "mean_token_accuracy": 0.18485718071460724, "num_tokens": 38547497.0, "step": 17265 }, { "entropy": 5.5887068748474125, "epoch": 1.939630482394564, "grad_norm": 1.3203125, "learning_rate": 0.0004631295843852194, "loss": 5.2752, "mean_token_accuracy": 0.1898737668991089, "num_tokens": 38558840.0, "step": 17270 }, { "entropy": 5.5194587230682375, "epoch": 1.9401920593025215, "grad_norm": 1.34375, "learning_rate": 0.000463107558650873, "loss": 5.2474, "mean_token_accuracy": 0.19837641566991807, "num_tokens": 38568670.0, "step": 17275 }, { "entropy": 5.5173698425292965, "epoch": 1.940753636210479, "grad_norm": 1.2265625, "learning_rate": 0.00046308552692710895, "loss": 5.3187, "mean_token_accuracy": 0.19002542942762374, "num_tokens": 38578565.0, "step": 17280 }, { "entropy": 5.474986362457275, "epoch": 1.9413152131184366, "grad_norm": 1.3359375, "learning_rate": 0.00046306348921462876, "loss": 5.288, "mean_token_accuracy": 0.1900528132915497, "num_tokens": 38589126.0, "step": 17285 }, { "entropy": 5.606071805953979, "epoch": 1.9418767900263942, "grad_norm": 1.2890625, "learning_rate": 0.0004630414455141342, "loss": 5.4005, "mean_token_accuracy": 0.18429171591997145, "num_tokens": 38601008.0, "step": 17290 }, { "entropy": 5.630123853683472, "epoch": 1.9424383669343517, "grad_norm": 1.4296875, "learning_rate": 0.000463019395826327, "loss": 5.3852, "mean_token_accuracy": 0.18718257397413254, "num_tokens": 38611756.0, "step": 17295 }, { "entropy": 5.587280988693237, "epoch": 1.9429999438423091, "grad_norm": 1.390625, "learning_rate": 0.00046299734015190934, "loss": 5.2927, "mean_token_accuracy": 0.18605223894119263, "num_tokens": 38623156.0, "step": 17300 }, { "entropy": 5.6102910995483395, "epoch": 1.9435615207502668, "grad_norm": 1.4765625, "learning_rate": 0.00046297527849158344, "loss": 5.3622, "mean_token_accuracy": 0.19393292516469957, "num_tokens": 38633920.0, "step": 17305 }, { "entropy": 5.530622434616089, "epoch": 1.9441230976582244, "grad_norm": 1.484375, "learning_rate": 0.0004629532108460519, "loss": 5.28, "mean_token_accuracy": 0.18657930195331573, "num_tokens": 38644744.0, "step": 17310 }, { "entropy": 5.489866828918457, "epoch": 1.9446846745661819, "grad_norm": 1.2890625, "learning_rate": 0.00046293113721601706, "loss": 5.2804, "mean_token_accuracy": 0.19437275379896163, "num_tokens": 38656524.0, "step": 17315 }, { "entropy": 5.491071319580078, "epoch": 1.9452462514741393, "grad_norm": 1.28125, "learning_rate": 0.00046290905760218193, "loss": 5.3309, "mean_token_accuracy": 0.19527771025896073, "num_tokens": 38668386.0, "step": 17320 }, { "entropy": 5.539380073547363, "epoch": 1.945807828382097, "grad_norm": 1.34375, "learning_rate": 0.00046288697200524964, "loss": 5.2443, "mean_token_accuracy": 0.18934347331523896, "num_tokens": 38678498.0, "step": 17325 }, { "entropy": 5.673765754699707, "epoch": 1.9463694052900544, "grad_norm": 1.28125, "learning_rate": 0.00046286488042592325, "loss": 5.4794, "mean_token_accuracy": 0.17748477309942245, "num_tokens": 38690084.0, "step": 17330 }, { "entropy": 5.50318169593811, "epoch": 1.9469309821980119, "grad_norm": 1.375, "learning_rate": 0.0004628427828649062, "loss": 5.3193, "mean_token_accuracy": 0.18965124636888503, "num_tokens": 38701282.0, "step": 17335 }, { "entropy": 5.447755956649781, "epoch": 1.9474925591059695, "grad_norm": 1.2734375, "learning_rate": 0.00046282067932290204, "loss": 5.2044, "mean_token_accuracy": 0.19539620876312255, "num_tokens": 38713012.0, "step": 17340 }, { "entropy": 5.437713670730591, "epoch": 1.9480541360139272, "grad_norm": 1.296875, "learning_rate": 0.0004627985698006146, "loss": 5.2604, "mean_token_accuracy": 0.19580089300870895, "num_tokens": 38723179.0, "step": 17345 }, { "entropy": 5.55149245262146, "epoch": 1.9486157129218846, "grad_norm": 1.46875, "learning_rate": 0.000462776454298748, "loss": 5.2899, "mean_token_accuracy": 0.1989804908633232, "num_tokens": 38733729.0, "step": 17350 }, { "entropy": 5.560542345046997, "epoch": 1.949177289829842, "grad_norm": 1.765625, "learning_rate": 0.00046275433281800613, "loss": 5.2477, "mean_token_accuracy": 0.19693769216537477, "num_tokens": 38743139.0, "step": 17355 }, { "entropy": 5.517525005340576, "epoch": 1.9497388667377997, "grad_norm": 1.3046875, "learning_rate": 0.0004627322053590935, "loss": 5.3276, "mean_token_accuracy": 0.18538037538528443, "num_tokens": 38754697.0, "step": 17360 }, { "entropy": 5.4607631206512455, "epoch": 1.9503004436457574, "grad_norm": 1.2265625, "learning_rate": 0.0004627100719227147, "loss": 5.3546, "mean_token_accuracy": 0.1893941804766655, "num_tokens": 38765999.0, "step": 17365 }, { "entropy": 5.526936388015747, "epoch": 1.9508620205537148, "grad_norm": 1.265625, "learning_rate": 0.00046268793250957437, "loss": 5.3623, "mean_token_accuracy": 0.18579252511262895, "num_tokens": 38776912.0, "step": 17370 }, { "entropy": 5.6296142578125, "epoch": 1.9514235974616723, "grad_norm": 1.390625, "learning_rate": 0.00046266578712037747, "loss": 5.3569, "mean_token_accuracy": 0.18661235719919206, "num_tokens": 38787296.0, "step": 17375 }, { "entropy": 5.546997785568237, "epoch": 1.95198517436963, "grad_norm": 1.4375, "learning_rate": 0.00046264363575582916, "loss": 5.3471, "mean_token_accuracy": 0.18177139461040498, "num_tokens": 38798013.0, "step": 17380 }, { "entropy": 5.458870315551758, "epoch": 1.9525467512775876, "grad_norm": 1.3125, "learning_rate": 0.0004626214784166347, "loss": 5.2857, "mean_token_accuracy": 0.1914055496454239, "num_tokens": 38808842.0, "step": 17385 }, { "entropy": 5.490812921524048, "epoch": 1.953108328185545, "grad_norm": 1.28125, "learning_rate": 0.0004625993151034995, "loss": 5.23, "mean_token_accuracy": 0.19331282377243042, "num_tokens": 38819094.0, "step": 17390 }, { "entropy": 5.512252330780029, "epoch": 1.9536699050935025, "grad_norm": 1.671875, "learning_rate": 0.0004625771458171294, "loss": 5.3282, "mean_token_accuracy": 0.1918247625231743, "num_tokens": 38830348.0, "step": 17395 }, { "entropy": 5.566256141662597, "epoch": 1.9542314820014601, "grad_norm": 1.5703125, "learning_rate": 0.00046255497055823025, "loss": 5.3399, "mean_token_accuracy": 0.1917381003499031, "num_tokens": 38841927.0, "step": 17400 }, { "entropy": 5.427985715866089, "epoch": 1.9547930589094178, "grad_norm": 1.578125, "learning_rate": 0.0004625327893275082, "loss": 5.1462, "mean_token_accuracy": 0.19760164022445678, "num_tokens": 38852817.0, "step": 17405 }, { "entropy": 5.3728128433227536, "epoch": 1.9553546358173752, "grad_norm": 1.5546875, "learning_rate": 0.00046251060212566927, "loss": 5.2575, "mean_token_accuracy": 0.1909310519695282, "num_tokens": 38864181.0, "step": 17410 }, { "entropy": 5.542944860458374, "epoch": 1.9559162127253327, "grad_norm": 1.65625, "learning_rate": 0.0004624884089534201, "loss": 5.3244, "mean_token_accuracy": 0.19081388413906097, "num_tokens": 38873827.0, "step": 17415 }, { "entropy": 5.567887163162231, "epoch": 1.9564777896332903, "grad_norm": 1.765625, "learning_rate": 0.0004624662098114672, "loss": 5.3318, "mean_token_accuracy": 0.18709559440612794, "num_tokens": 38884540.0, "step": 17420 }, { "entropy": 5.431196308135986, "epoch": 1.9570393665412478, "grad_norm": 1.4375, "learning_rate": 0.00046244400470051754, "loss": 5.1872, "mean_token_accuracy": 0.1930992603302002, "num_tokens": 38895600.0, "step": 17425 }, { "entropy": 5.472609519958496, "epoch": 1.9576009434492052, "grad_norm": 1.6640625, "learning_rate": 0.000462421793621278, "loss": 5.2644, "mean_token_accuracy": 0.1968981981277466, "num_tokens": 38906166.0, "step": 17430 }, { "entropy": 5.4246618270874025, "epoch": 1.9581625203571629, "grad_norm": 1.3984375, "learning_rate": 0.000462399576574456, "loss": 5.1718, "mean_token_accuracy": 0.19477488696575165, "num_tokens": 38916247.0, "step": 17435 }, { "entropy": 5.590512895584107, "epoch": 1.9587240972651205, "grad_norm": 1.5859375, "learning_rate": 0.0004623773535607587, "loss": 5.3942, "mean_token_accuracy": 0.18519411832094193, "num_tokens": 38928276.0, "step": 17440 }, { "entropy": 5.571941566467285, "epoch": 1.959285674173078, "grad_norm": 1.3671875, "learning_rate": 0.0004623551245808938, "loss": 5.2973, "mean_token_accuracy": 0.1899605467915535, "num_tokens": 38939460.0, "step": 17445 }, { "entropy": 5.4758216381073, "epoch": 1.9598472510810354, "grad_norm": 2.390625, "learning_rate": 0.0004623328896355691, "loss": 5.2473, "mean_token_accuracy": 0.19702684879302979, "num_tokens": 38950381.0, "step": 17450 }, { "entropy": 5.425159168243408, "epoch": 1.960408827988993, "grad_norm": 1.5234375, "learning_rate": 0.00046231064872549244, "loss": 5.2431, "mean_token_accuracy": 0.19221047610044478, "num_tokens": 38961312.0, "step": 17455 }, { "entropy": 5.555955028533935, "epoch": 1.9609704048969507, "grad_norm": 1.53125, "learning_rate": 0.00046228840185137215, "loss": 5.3428, "mean_token_accuracy": 0.18744023889303207, "num_tokens": 38974030.0, "step": 17460 }, { "entropy": 5.639015769958496, "epoch": 1.9615319818049082, "grad_norm": 1.9921875, "learning_rate": 0.0004622661490139165, "loss": 5.3969, "mean_token_accuracy": 0.18619923293590546, "num_tokens": 38984640.0, "step": 17465 }, { "entropy": 5.480964279174804, "epoch": 1.9620935587128656, "grad_norm": 1.28125, "learning_rate": 0.0004622438902138341, "loss": 5.2907, "mean_token_accuracy": 0.18884125500917434, "num_tokens": 38996206.0, "step": 17470 }, { "entropy": 5.4575084209442135, "epoch": 1.9626551356208233, "grad_norm": 1.3125, "learning_rate": 0.00046222162545183357, "loss": 5.2196, "mean_token_accuracy": 0.2025580108165741, "num_tokens": 39007765.0, "step": 17475 }, { "entropy": 5.498712062835693, "epoch": 1.963216712528781, "grad_norm": 1.3515625, "learning_rate": 0.00046219935472862386, "loss": 5.336, "mean_token_accuracy": 0.18791389167308808, "num_tokens": 39020691.0, "step": 17480 }, { "entropy": 5.477165222167969, "epoch": 1.9637782894367384, "grad_norm": 1.3046875, "learning_rate": 0.00046217707804491404, "loss": 5.2596, "mean_token_accuracy": 0.19700903445482254, "num_tokens": 39032003.0, "step": 17485 }, { "entropy": 5.587220335006714, "epoch": 1.9643398663446958, "grad_norm": 1.421875, "learning_rate": 0.0004621547954014135, "loss": 5.3542, "mean_token_accuracy": 0.1912691980600357, "num_tokens": 39042783.0, "step": 17490 }, { "entropy": 5.501882886886596, "epoch": 1.9649014432526535, "grad_norm": 1.359375, "learning_rate": 0.0004621325067988317, "loss": 5.2566, "mean_token_accuracy": 0.19201208055019378, "num_tokens": 39054395.0, "step": 17495 }, { "entropy": 5.465988636016846, "epoch": 1.9654630201606111, "grad_norm": 1.6171875, "learning_rate": 0.00046211021223787827, "loss": 5.2412, "mean_token_accuracy": 0.19983402639627457, "num_tokens": 39064619.0, "step": 17500 }, { "entropy": 5.610533666610718, "epoch": 1.9660245970685686, "grad_norm": 1.375, "learning_rate": 0.00046208791171926315, "loss": 5.3812, "mean_token_accuracy": 0.18333709388971328, "num_tokens": 39076112.0, "step": 17505 }, { "entropy": 5.487556791305542, "epoch": 1.966586173976526, "grad_norm": 1.3125, "learning_rate": 0.00046206560524369636, "loss": 5.277, "mean_token_accuracy": 0.19122491031885147, "num_tokens": 39087669.0, "step": 17510 }, { "entropy": 5.493722581863404, "epoch": 1.9671477508844837, "grad_norm": 1.5078125, "learning_rate": 0.00046204329281188816, "loss": 5.2796, "mean_token_accuracy": 0.19010273963212967, "num_tokens": 39098506.0, "step": 17515 }, { "entropy": 5.525453519821167, "epoch": 1.9677093277924411, "grad_norm": 1.3125, "learning_rate": 0.0004620209744245489, "loss": 5.3252, "mean_token_accuracy": 0.19333317130804062, "num_tokens": 39109441.0, "step": 17520 }, { "entropy": 5.5208498477935795, "epoch": 1.9682709047003986, "grad_norm": 1.3984375, "learning_rate": 0.00046199865008238937, "loss": 5.2342, "mean_token_accuracy": 0.19754558205604553, "num_tokens": 39119765.0, "step": 17525 }, { "entropy": 5.461196804046631, "epoch": 1.9688324816083562, "grad_norm": 1.3828125, "learning_rate": 0.0004619763197861203, "loss": 5.2053, "mean_token_accuracy": 0.1979791358113289, "num_tokens": 39129794.0, "step": 17530 }, { "entropy": 5.445248079299927, "epoch": 1.9693940585163139, "grad_norm": 1.375, "learning_rate": 0.00046195398353645256, "loss": 5.2251, "mean_token_accuracy": 0.1986946478486061, "num_tokens": 39140095.0, "step": 17535 }, { "entropy": 5.523592758178711, "epoch": 1.9699556354242713, "grad_norm": 1.3515625, "learning_rate": 0.0004619316413340976, "loss": 5.3281, "mean_token_accuracy": 0.19205934107303618, "num_tokens": 39150855.0, "step": 17540 }, { "entropy": 5.537033891677856, "epoch": 1.9705172123322288, "grad_norm": 1.25, "learning_rate": 0.00046190929317976664, "loss": 5.2485, "mean_token_accuracy": 0.19780316054821015, "num_tokens": 39161455.0, "step": 17545 }, { "entropy": 5.557616186141968, "epoch": 1.9710787892401864, "grad_norm": 1.40625, "learning_rate": 0.0004618869390741713, "loss": 5.452, "mean_token_accuracy": 0.1836066022515297, "num_tokens": 39173199.0, "step": 17550 }, { "entropy": 5.576978015899658, "epoch": 1.971640366148144, "grad_norm": 1.28125, "learning_rate": 0.0004618645790180233, "loss": 5.3265, "mean_token_accuracy": 0.1939622327685356, "num_tokens": 39183145.0, "step": 17555 }, { "entropy": 5.551261377334595, "epoch": 1.9722019430561015, "grad_norm": 1.7109375, "learning_rate": 0.0004618422130120347, "loss": 5.3381, "mean_token_accuracy": 0.1918054074048996, "num_tokens": 39194900.0, "step": 17560 }, { "entropy": 5.606948375701904, "epoch": 1.972763519964059, "grad_norm": 1.46875, "learning_rate": 0.0004618198410569175, "loss": 5.4062, "mean_token_accuracy": 0.1801542103290558, "num_tokens": 39206651.0, "step": 17565 }, { "entropy": 5.48220682144165, "epoch": 1.9733250968720166, "grad_norm": 1.5390625, "learning_rate": 0.00046179746315338414, "loss": 5.3049, "mean_token_accuracy": 0.19232531934976577, "num_tokens": 39217635.0, "step": 17570 }, { "entropy": 5.553248882293701, "epoch": 1.9738866737799743, "grad_norm": 1.6796875, "learning_rate": 0.00046177507930214714, "loss": 5.32, "mean_token_accuracy": 0.1951992079615593, "num_tokens": 39227937.0, "step": 17575 }, { "entropy": 5.525927400588989, "epoch": 1.9744482506879317, "grad_norm": 1.3046875, "learning_rate": 0.0004617526895039191, "loss": 5.3167, "mean_token_accuracy": 0.19994789361953735, "num_tokens": 39238776.0, "step": 17580 }, { "entropy": 5.517746210098267, "epoch": 1.9750098275958892, "grad_norm": 1.5859375, "learning_rate": 0.00046173029375941305, "loss": 5.3422, "mean_token_accuracy": 0.1904160737991333, "num_tokens": 39250043.0, "step": 17585 }, { "entropy": 5.452392292022705, "epoch": 1.9755714045038468, "grad_norm": 1.3515625, "learning_rate": 0.000461707892069342, "loss": 5.2713, "mean_token_accuracy": 0.19367802739143372, "num_tokens": 39261440.0, "step": 17590 }, { "entropy": 5.573949670791626, "epoch": 1.9761329814118045, "grad_norm": 2.046875, "learning_rate": 0.00046168548443441926, "loss": 5.4926, "mean_token_accuracy": 0.1838779166340828, "num_tokens": 39272151.0, "step": 17595 }, { "entropy": 5.716833066940308, "epoch": 1.976694558319762, "grad_norm": 1.453125, "learning_rate": 0.0004616630708553583, "loss": 5.4842, "mean_token_accuracy": 0.17978556901216508, "num_tokens": 39284794.0, "step": 17600 }, { "entropy": 5.511546230316162, "epoch": 1.9772561352277194, "grad_norm": 1.515625, "learning_rate": 0.00046164065133287276, "loss": 5.3741, "mean_token_accuracy": 0.18695790320634842, "num_tokens": 39296660.0, "step": 17605 }, { "entropy": 5.5483684062957765, "epoch": 1.977817712135677, "grad_norm": 1.3203125, "learning_rate": 0.0004616182258676765, "loss": 5.4013, "mean_token_accuracy": 0.18527230769395828, "num_tokens": 39308609.0, "step": 17610 }, { "entropy": 5.561050224304199, "epoch": 1.9783792890436345, "grad_norm": 1.25, "learning_rate": 0.0004615957944604835, "loss": 5.2039, "mean_token_accuracy": 0.1979954198002815, "num_tokens": 39319295.0, "step": 17615 }, { "entropy": 5.566237926483154, "epoch": 1.978940865951592, "grad_norm": 1.4453125, "learning_rate": 0.0004615733571120081, "loss": 5.3266, "mean_token_accuracy": 0.19095246493816376, "num_tokens": 39330874.0, "step": 17620 }, { "entropy": 5.475045394897461, "epoch": 1.9795024428595496, "grad_norm": 1.40625, "learning_rate": 0.0004615509138229646, "loss": 5.3228, "mean_token_accuracy": 0.18548815399408342, "num_tokens": 39343574.0, "step": 17625 }, { "entropy": 5.5390052318573, "epoch": 1.9800640197675072, "grad_norm": 1.1953125, "learning_rate": 0.00046152846459406765, "loss": 5.3286, "mean_token_accuracy": 0.18938498497009276, "num_tokens": 39355761.0, "step": 17630 }, { "entropy": 5.59404616355896, "epoch": 1.9806255966754647, "grad_norm": 1.484375, "learning_rate": 0.0004615060094260321, "loss": 5.46, "mean_token_accuracy": 0.17910851389169694, "num_tokens": 39368116.0, "step": 17635 }, { "entropy": 5.5500890731811525, "epoch": 1.9811871735834221, "grad_norm": 1.515625, "learning_rate": 0.00046148354831957285, "loss": 5.3128, "mean_token_accuracy": 0.2022144928574562, "num_tokens": 39378619.0, "step": 17640 }, { "entropy": 5.644384860992432, "epoch": 1.9817487504913798, "grad_norm": 1.3828125, "learning_rate": 0.00046146108127540506, "loss": 5.4388, "mean_token_accuracy": 0.1837463304400444, "num_tokens": 39391595.0, "step": 17645 }, { "entropy": 5.555820560455322, "epoch": 1.9823103273993374, "grad_norm": 1.5703125, "learning_rate": 0.0004614386082942442, "loss": 5.392, "mean_token_accuracy": 0.18424100875854493, "num_tokens": 39402494.0, "step": 17650 }, { "entropy": 5.5125528335571286, "epoch": 1.9828719043072949, "grad_norm": 1.359375, "learning_rate": 0.0004614161293768057, "loss": 5.3069, "mean_token_accuracy": 0.18762837648391723, "num_tokens": 39413371.0, "step": 17655 }, { "entropy": 5.4820473194122314, "epoch": 1.9834334812152523, "grad_norm": 1.421875, "learning_rate": 0.00046139364452380536, "loss": 5.3068, "mean_token_accuracy": 0.18936399519443511, "num_tokens": 39424170.0, "step": 17660 }, { "entropy": 5.6062427997589115, "epoch": 1.98399505812321, "grad_norm": 1.3046875, "learning_rate": 0.000461371153735959, "loss": 5.3933, "mean_token_accuracy": 0.18909017294645308, "num_tokens": 39434438.0, "step": 17665 }, { "entropy": 5.569085121154785, "epoch": 1.9845566350311676, "grad_norm": 1.3828125, "learning_rate": 0.00046134865701398287, "loss": 5.3152, "mean_token_accuracy": 0.1891639858484268, "num_tokens": 39445116.0, "step": 17670 }, { "entropy": 5.559984445571899, "epoch": 1.985118211939125, "grad_norm": 1.4140625, "learning_rate": 0.00046132615435859326, "loss": 5.3, "mean_token_accuracy": 0.1926518663764, "num_tokens": 39457296.0, "step": 17675 }, { "entropy": 5.575274229049683, "epoch": 1.9856797888470825, "grad_norm": 2.09375, "learning_rate": 0.00046130364577050655, "loss": 5.3801, "mean_token_accuracy": 0.19589262902736665, "num_tokens": 39468499.0, "step": 17680 }, { "entropy": 5.4970090866088865, "epoch": 1.9862413657550402, "grad_norm": 2.0, "learning_rate": 0.00046128113125043957, "loss": 5.2647, "mean_token_accuracy": 0.19170113205909728, "num_tokens": 39479594.0, "step": 17685 }, { "entropy": 5.50139741897583, "epoch": 1.9868029426629978, "grad_norm": 1.453125, "learning_rate": 0.00046125861079910913, "loss": 5.3264, "mean_token_accuracy": 0.19295964688062667, "num_tokens": 39490048.0, "step": 17690 }, { "entropy": 5.533599758148194, "epoch": 1.9873645195709553, "grad_norm": 1.3984375, "learning_rate": 0.0004612360844172322, "loss": 5.3194, "mean_token_accuracy": 0.18845418840646744, "num_tokens": 39501454.0, "step": 17695 }, { "entropy": 5.5037353515625, "epoch": 1.9879260964789127, "grad_norm": 1.4453125, "learning_rate": 0.00046121355210552626, "loss": 5.2705, "mean_token_accuracy": 0.20236016660928727, "num_tokens": 39512782.0, "step": 17700 }, { "entropy": 5.522071170806885, "epoch": 1.9884876733868704, "grad_norm": 1.3828125, "learning_rate": 0.0004611910138647085, "loss": 5.3381, "mean_token_accuracy": 0.19241473227739334, "num_tokens": 39524342.0, "step": 17705 }, { "entropy": 5.498077297210694, "epoch": 1.989049250294828, "grad_norm": 1.375, "learning_rate": 0.00046116846969549666, "loss": 5.2337, "mean_token_accuracy": 0.19326062351465226, "num_tokens": 39534744.0, "step": 17710 }, { "entropy": 5.5863272190094, "epoch": 1.9896108272027853, "grad_norm": 1.390625, "learning_rate": 0.0004611459195986085, "loss": 5.3922, "mean_token_accuracy": 0.1856262743473053, "num_tokens": 39547729.0, "step": 17715 }, { "entropy": 5.544296026229858, "epoch": 1.990172404110743, "grad_norm": 1.703125, "learning_rate": 0.00046112336357476217, "loss": 5.2421, "mean_token_accuracy": 0.1931598663330078, "num_tokens": 39558194.0, "step": 17720 }, { "entropy": 5.458015441894531, "epoch": 1.9907339810187006, "grad_norm": 1.328125, "learning_rate": 0.0004611008016246757, "loss": 5.1788, "mean_token_accuracy": 0.19584223181009291, "num_tokens": 39568265.0, "step": 17725 }, { "entropy": 5.533123588562011, "epoch": 1.991295557926658, "grad_norm": 1.46875, "learning_rate": 0.00046107823374906754, "loss": 5.4039, "mean_token_accuracy": 0.18655110001564026, "num_tokens": 39578936.0, "step": 17730 }, { "entropy": 5.576171779632569, "epoch": 1.9918571348346155, "grad_norm": 1.5234375, "learning_rate": 0.00046105565994865614, "loss": 5.3929, "mean_token_accuracy": 0.18787167370319366, "num_tokens": 39590180.0, "step": 17735 }, { "entropy": 5.543496084213257, "epoch": 1.9924187117425731, "grad_norm": 2.046875, "learning_rate": 0.0004610330802241605, "loss": 5.3289, "mean_token_accuracy": 0.1881959080696106, "num_tokens": 39601226.0, "step": 17740 }, { "entropy": 5.500477027893067, "epoch": 1.9929802886505308, "grad_norm": 1.3984375, "learning_rate": 0.0004610104945762994, "loss": 5.3614, "mean_token_accuracy": 0.19314012080430984, "num_tokens": 39613119.0, "step": 17745 }, { "entropy": 5.558902978897095, "epoch": 1.9935418655584882, "grad_norm": 2.53125, "learning_rate": 0.000460987903005792, "loss": 5.335, "mean_token_accuracy": 0.19106521159410478, "num_tokens": 39625269.0, "step": 17750 }, { "entropy": 5.540250253677368, "epoch": 1.9941034424664457, "grad_norm": 1.546875, "learning_rate": 0.0004609653055133576, "loss": 5.2332, "mean_token_accuracy": 0.1961716890335083, "num_tokens": 39635883.0, "step": 17755 }, { "entropy": 5.466345310211182, "epoch": 1.9946650193744033, "grad_norm": 1.34375, "learning_rate": 0.00046094270209971576, "loss": 5.2585, "mean_token_accuracy": 0.1985495701432228, "num_tokens": 39646425.0, "step": 17760 }, { "entropy": 5.542253732681274, "epoch": 1.995226596282361, "grad_norm": 1.3828125, "learning_rate": 0.0004609200927655862, "loss": 5.3831, "mean_token_accuracy": 0.1871304541826248, "num_tokens": 39658874.0, "step": 17765 }, { "entropy": 5.542967891693115, "epoch": 1.9957881731903184, "grad_norm": 1.5390625, "learning_rate": 0.0004608974775116888, "loss": 5.3358, "mean_token_accuracy": 0.1885174185037613, "num_tokens": 39670401.0, "step": 17770 }, { "entropy": 5.4775111198425295, "epoch": 1.9963497500982759, "grad_norm": 1.40625, "learning_rate": 0.0004608748563387436, "loss": 5.2638, "mean_token_accuracy": 0.19434180855751038, "num_tokens": 39681005.0, "step": 17775 }, { "entropy": 5.652531719207763, "epoch": 1.9969113270062335, "grad_norm": 1.53125, "learning_rate": 0.0004608522292474708, "loss": 5.4188, "mean_token_accuracy": 0.18446086794137956, "num_tokens": 39692311.0, "step": 17780 }, { "entropy": 5.564651441574097, "epoch": 1.9974729039141912, "grad_norm": 1.4296875, "learning_rate": 0.0004608295962385911, "loss": 5.2163, "mean_token_accuracy": 0.20410524904727936, "num_tokens": 39702782.0, "step": 17785 }, { "entropy": 5.481700038909912, "epoch": 1.9980344808221486, "grad_norm": 1.78125, "learning_rate": 0.00046080695731282484, "loss": 5.3719, "mean_token_accuracy": 0.18634167909622193, "num_tokens": 39713497.0, "step": 17790 }, { "entropy": 5.501364040374756, "epoch": 1.998596057730106, "grad_norm": 1.40625, "learning_rate": 0.000460784312470893, "loss": 5.2912, "mean_token_accuracy": 0.1885882779955864, "num_tokens": 39724355.0, "step": 17795 }, { "entropy": 5.64681191444397, "epoch": 1.9991576346380637, "grad_norm": 1.7578125, "learning_rate": 0.00046076166171351673, "loss": 5.3714, "mean_token_accuracy": 0.18769290298223495, "num_tokens": 39736523.0, "step": 17800 }, { "entropy": 5.553428077697754, "epoch": 1.9997192115460214, "grad_norm": 1.25, "learning_rate": 0.000460739005041417, "loss": 5.3153, "mean_token_accuracy": 0.18943432122468948, "num_tokens": 39746297.0, "step": 17805 }, { "entropy": 5.368327299753825, "epoch": 2.000224630763183, "grad_norm": 1.5, "learning_rate": 0.0004607163424553153, "loss": 5.1191, "mean_token_accuracy": 0.20146067440509796, "num_tokens": 39755163.0, "step": 17810 }, { "entropy": 5.5035772800445555, "epoch": 2.0007862076711405, "grad_norm": 1.5078125, "learning_rate": 0.00046069367395593325, "loss": 5.344, "mean_token_accuracy": 0.1846245363354683, "num_tokens": 39766444.0, "step": 17815 }, { "entropy": 5.594197034835815, "epoch": 2.001347784579098, "grad_norm": 1.2109375, "learning_rate": 0.0004606709995439926, "loss": 5.27, "mean_token_accuracy": 0.19674184620380403, "num_tokens": 39778051.0, "step": 17820 }, { "entropy": 5.56218900680542, "epoch": 2.001909361487056, "grad_norm": 1.3828125, "learning_rate": 0.00046064831922021534, "loss": 5.2984, "mean_token_accuracy": 0.18967250138521194, "num_tokens": 39787850.0, "step": 17825 }, { "entropy": 5.579576730728149, "epoch": 2.002470938395013, "grad_norm": 1.28125, "learning_rate": 0.0004606256329853235, "loss": 5.2277, "mean_token_accuracy": 0.1949354574084282, "num_tokens": 39799428.0, "step": 17830 }, { "entropy": 5.67228889465332, "epoch": 2.0030325153029707, "grad_norm": 1.453125, "learning_rate": 0.0004606029408400396, "loss": 5.4265, "mean_token_accuracy": 0.18604052811861038, "num_tokens": 39811688.0, "step": 17835 }, { "entropy": 5.519627952575684, "epoch": 2.0035940922109283, "grad_norm": 1.28125, "learning_rate": 0.0004605802427850861, "loss": 5.1929, "mean_token_accuracy": 0.19501004368066788, "num_tokens": 39822243.0, "step": 17840 }, { "entropy": 5.526254272460937, "epoch": 2.004155669118886, "grad_norm": 1.4140625, "learning_rate": 0.00046055753882118564, "loss": 5.2935, "mean_token_accuracy": 0.19255979508161544, "num_tokens": 39833699.0, "step": 17845 }, { "entropy": 5.647405385971069, "epoch": 2.004717246026843, "grad_norm": 1.21875, "learning_rate": 0.0004605348289490611, "loss": 5.4164, "mean_token_accuracy": 0.18332097232341765, "num_tokens": 39844177.0, "step": 17850 }, { "entropy": 5.5685715675354, "epoch": 2.005278822934801, "grad_norm": 1.7265625, "learning_rate": 0.0004605121131694358, "loss": 5.2962, "mean_token_accuracy": 0.18893337696790696, "num_tokens": 39856008.0, "step": 17855 }, { "entropy": 5.5060914039611815, "epoch": 2.0058403998427585, "grad_norm": 1.28125, "learning_rate": 0.0004604893914830328, "loss": 5.186, "mean_token_accuracy": 0.1934990867972374, "num_tokens": 39866209.0, "step": 17860 }, { "entropy": 5.571491956710815, "epoch": 2.006401976750716, "grad_norm": 1.5546875, "learning_rate": 0.00046046666389057563, "loss": 5.2418, "mean_token_accuracy": 0.19273425042629241, "num_tokens": 39876986.0, "step": 17865 }, { "entropy": 5.462259197235108, "epoch": 2.0069635536586734, "grad_norm": 1.3671875, "learning_rate": 0.000460443930392788, "loss": 5.2117, "mean_token_accuracy": 0.1915942072868347, "num_tokens": 39886994.0, "step": 17870 }, { "entropy": 5.534856605529785, "epoch": 2.007525130566631, "grad_norm": 1.3984375, "learning_rate": 0.00046042119099039367, "loss": 5.2735, "mean_token_accuracy": 0.19172825962305068, "num_tokens": 39897514.0, "step": 17875 }, { "entropy": 5.6715551853179935, "epoch": 2.0080867074745887, "grad_norm": 1.5234375, "learning_rate": 0.00046039844568411667, "loss": 5.4847, "mean_token_accuracy": 0.18386076986789704, "num_tokens": 39909102.0, "step": 17880 }, { "entropy": 5.58957953453064, "epoch": 2.0086482843825464, "grad_norm": 1.171875, "learning_rate": 0.0004603756944746813, "loss": 5.1636, "mean_token_accuracy": 0.20065847486257554, "num_tokens": 39919450.0, "step": 17885 }, { "entropy": 5.45687198638916, "epoch": 2.0092098612905036, "grad_norm": 1.3359375, "learning_rate": 0.00046035293736281185, "loss": 5.2136, "mean_token_accuracy": 0.1846734568476677, "num_tokens": 39930362.0, "step": 17890 }, { "entropy": 5.455288505554199, "epoch": 2.0097714381984613, "grad_norm": 1.3671875, "learning_rate": 0.0004603301743492331, "loss": 5.3014, "mean_token_accuracy": 0.19423362314701081, "num_tokens": 39942047.0, "step": 17895 }, { "entropy": 5.581796312332154, "epoch": 2.010333015106419, "grad_norm": 1.3828125, "learning_rate": 0.0004603074054346696, "loss": 5.2827, "mean_token_accuracy": 0.192690934240818, "num_tokens": 39954870.0, "step": 17900 }, { "entropy": 5.542372322082519, "epoch": 2.0108945920143766, "grad_norm": 1.4140625, "learning_rate": 0.0004602846306198465, "loss": 5.277, "mean_token_accuracy": 0.1974707990884781, "num_tokens": 39966345.0, "step": 17905 }, { "entropy": 5.446708822250367, "epoch": 2.011456168922334, "grad_norm": 1.4140625, "learning_rate": 0.0004602618499054889, "loss": 5.1439, "mean_token_accuracy": 0.20305910855531692, "num_tokens": 39976453.0, "step": 17910 }, { "entropy": 5.52267370223999, "epoch": 2.0120177458302915, "grad_norm": 1.375, "learning_rate": 0.0004602390632923221, "loss": 5.3192, "mean_token_accuracy": 0.1889155015349388, "num_tokens": 39988990.0, "step": 17915 }, { "entropy": 5.476548767089843, "epoch": 2.012579322738249, "grad_norm": 1.4296875, "learning_rate": 0.00046021627078107177, "loss": 5.2649, "mean_token_accuracy": 0.19363445937633514, "num_tokens": 39999131.0, "step": 17920 }, { "entropy": 5.587501525878906, "epoch": 2.0131408996462063, "grad_norm": 1.3125, "learning_rate": 0.00046019347237246343, "loss": 5.2734, "mean_token_accuracy": 0.1963441863656044, "num_tokens": 40010197.0, "step": 17925 }, { "entropy": 5.512665128707885, "epoch": 2.013702476554164, "grad_norm": 1.7265625, "learning_rate": 0.0004601706680672232, "loss": 5.1319, "mean_token_accuracy": 0.20290805995464326, "num_tokens": 40021388.0, "step": 17930 }, { "entropy": 5.488842630386353, "epoch": 2.0142640534621217, "grad_norm": 1.4140625, "learning_rate": 0.0004601478578660771, "loss": 5.249, "mean_token_accuracy": 0.19694442749023439, "num_tokens": 40032485.0, "step": 17935 }, { "entropy": 5.497480344772339, "epoch": 2.0148256303700793, "grad_norm": 1.53125, "learning_rate": 0.0004601250417697513, "loss": 5.3509, "mean_token_accuracy": 0.18763996362686158, "num_tokens": 40043465.0, "step": 17940 }, { "entropy": 5.541256999969482, "epoch": 2.0153872072780366, "grad_norm": 1.2109375, "learning_rate": 0.0004601022197789724, "loss": 5.2459, "mean_token_accuracy": 0.20102934986352922, "num_tokens": 40054934.0, "step": 17945 }, { "entropy": 5.561784648895264, "epoch": 2.015948784185994, "grad_norm": 1.390625, "learning_rate": 0.0004600793918944671, "loss": 5.3272, "mean_token_accuracy": 0.193603977560997, "num_tokens": 40066159.0, "step": 17950 }, { "entropy": 5.434869384765625, "epoch": 2.016510361093952, "grad_norm": 1.1953125, "learning_rate": 0.0004600565581169621, "loss": 5.1608, "mean_token_accuracy": 0.2008107379078865, "num_tokens": 40076169.0, "step": 17955 }, { "entropy": 5.544534301757812, "epoch": 2.0170719380019095, "grad_norm": 1.234375, "learning_rate": 0.00046003371844718455, "loss": 5.2355, "mean_token_accuracy": 0.19955367594957352, "num_tokens": 40086852.0, "step": 17960 }, { "entropy": 5.498943424224853, "epoch": 2.0176335149098668, "grad_norm": 1.3203125, "learning_rate": 0.00046001087288586164, "loss": 5.2003, "mean_token_accuracy": 0.19517784118652343, "num_tokens": 40097588.0, "step": 17965 }, { "entropy": 5.5377825736999515, "epoch": 2.0181950918178244, "grad_norm": 1.5625, "learning_rate": 0.0004599880214337208, "loss": 5.1569, "mean_token_accuracy": 0.1989293575286865, "num_tokens": 40108797.0, "step": 17970 }, { "entropy": 5.527046203613281, "epoch": 2.018756668725782, "grad_norm": 1.796875, "learning_rate": 0.0004599651640914896, "loss": 5.3207, "mean_token_accuracy": 0.18557970672845842, "num_tokens": 40119700.0, "step": 17975 }, { "entropy": 5.520626354217529, "epoch": 2.0193182456337397, "grad_norm": 1.3984375, "learning_rate": 0.0004599423008598957, "loss": 5.3341, "mean_token_accuracy": 0.18865351974964142, "num_tokens": 40131611.0, "step": 17980 }, { "entropy": 5.5383241176605225, "epoch": 2.019879822541697, "grad_norm": 1.40625, "learning_rate": 0.00045991943173966744, "loss": 5.2092, "mean_token_accuracy": 0.20510743260383607, "num_tokens": 40142186.0, "step": 17985 }, { "entropy": 5.493134546279907, "epoch": 2.0204413994496546, "grad_norm": 1.4296875, "learning_rate": 0.0004598965567315326, "loss": 5.2485, "mean_token_accuracy": 0.19158689975738524, "num_tokens": 40153856.0, "step": 17990 }, { "entropy": 5.443471145629883, "epoch": 2.0210029763576123, "grad_norm": 1.34375, "learning_rate": 0.0004598736758362198, "loss": 5.1661, "mean_token_accuracy": 0.20336588323116303, "num_tokens": 40164158.0, "step": 17995 }, { "entropy": 5.499774360656739, "epoch": 2.02156455326557, "grad_norm": 1.5390625, "learning_rate": 0.00045985078905445734, "loss": 5.317, "mean_token_accuracy": 0.19301238358020784, "num_tokens": 40176751.0, "step": 18000 }, { "epoch": 2.02156455326557, "eval_entropy": 5.307580244365906, "eval_loss": 5.397276878356934, "eval_mean_token_accuracy": 0.1952238485528416, "eval_num_tokens": 40176751.0, "eval_runtime": 23.8922, "eval_samples_per_second": 1298.038, "eval_steps_per_second": 162.27, "step": 18000 }, { "entropy": 5.572664880752564, "epoch": 2.022126130173527, "grad_norm": 1.3203125, "learning_rate": 0.00045982789638697414, "loss": 5.2942, "mean_token_accuracy": 0.19219646900892257, "num_tokens": 40188000.0, "step": 18005 }, { "entropy": 5.58684229850769, "epoch": 2.022687707081485, "grad_norm": 1.40625, "learning_rate": 0.00045980499783449897, "loss": 5.3019, "mean_token_accuracy": 0.19214947074651717, "num_tokens": 40199177.0, "step": 18010 }, { "entropy": 5.53514928817749, "epoch": 2.0232492839894425, "grad_norm": 1.5234375, "learning_rate": 0.00045978209339776104, "loss": 5.2818, "mean_token_accuracy": 0.19240461587905883, "num_tokens": 40210082.0, "step": 18015 }, { "entropy": 5.528062963485718, "epoch": 2.0238108608973997, "grad_norm": 1.3984375, "learning_rate": 0.00045975918307748965, "loss": 5.2939, "mean_token_accuracy": 0.18675119578838348, "num_tokens": 40222503.0, "step": 18020 }, { "entropy": 5.530700254440307, "epoch": 2.0243724378053574, "grad_norm": 1.3046875, "learning_rate": 0.0004597362668744141, "loss": 5.2483, "mean_token_accuracy": 0.194814969599247, "num_tokens": 40233690.0, "step": 18025 }, { "entropy": 5.608551025390625, "epoch": 2.024934014713315, "grad_norm": 1.2734375, "learning_rate": 0.0004597133447892642, "loss": 5.3615, "mean_token_accuracy": 0.18277624100446702, "num_tokens": 40246274.0, "step": 18030 }, { "entropy": 5.566758012771606, "epoch": 2.0254955916212727, "grad_norm": 1.4609375, "learning_rate": 0.0004596904168227698, "loss": 5.2937, "mean_token_accuracy": 0.1910557433962822, "num_tokens": 40257469.0, "step": 18035 }, { "entropy": 5.496110296249389, "epoch": 2.02605716852923, "grad_norm": 1.2578125, "learning_rate": 0.00045966748297566085, "loss": 5.2682, "mean_token_accuracy": 0.19804832339286804, "num_tokens": 40268982.0, "step": 18040 }, { "entropy": 5.5884966373443605, "epoch": 2.0266187454371876, "grad_norm": 1.3359375, "learning_rate": 0.00045964454324866767, "loss": 5.321, "mean_token_accuracy": 0.19124726802110673, "num_tokens": 40280301.0, "step": 18045 }, { "entropy": 5.555725860595703, "epoch": 2.0271803223451452, "grad_norm": 1.546875, "learning_rate": 0.00045962159764252055, "loss": 5.2283, "mean_token_accuracy": 0.20217628479003907, "num_tokens": 40292058.0, "step": 18050 }, { "entropy": 5.50323371887207, "epoch": 2.027741899253103, "grad_norm": 1.2890625, "learning_rate": 0.0004595986461579502, "loss": 5.278, "mean_token_accuracy": 0.1922963097691536, "num_tokens": 40301957.0, "step": 18055 }, { "entropy": 5.54264121055603, "epoch": 2.02830347616106, "grad_norm": 1.3671875, "learning_rate": 0.00045957568879568736, "loss": 5.2499, "mean_token_accuracy": 0.19339917600154877, "num_tokens": 40313645.0, "step": 18060 }, { "entropy": 5.562793493270874, "epoch": 2.0288650530690178, "grad_norm": 1.5, "learning_rate": 0.00045955272555646306, "loss": 5.324, "mean_token_accuracy": 0.18938728421926498, "num_tokens": 40324416.0, "step": 18065 }, { "entropy": 5.667379379272461, "epoch": 2.0294266299769754, "grad_norm": 1.234375, "learning_rate": 0.0004595297564410083, "loss": 5.4299, "mean_token_accuracy": 0.1929930791258812, "num_tokens": 40335596.0, "step": 18070 }, { "entropy": 5.568173885345459, "epoch": 2.029988206884933, "grad_norm": 1.8984375, "learning_rate": 0.00045950678145005456, "loss": 5.3745, "mean_token_accuracy": 0.18585854768753052, "num_tokens": 40346426.0, "step": 18075 }, { "entropy": 5.45464940071106, "epoch": 2.0305497837928903, "grad_norm": 1.453125, "learning_rate": 0.0004594838005843333, "loss": 5.1245, "mean_token_accuracy": 0.20244470238685608, "num_tokens": 40357435.0, "step": 18080 }, { "entropy": 5.481536197662353, "epoch": 2.031111360700848, "grad_norm": 1.5390625, "learning_rate": 0.00045946081384457633, "loss": 5.2141, "mean_token_accuracy": 0.19537506103515626, "num_tokens": 40367332.0, "step": 18085 }, { "entropy": 5.492844438552856, "epoch": 2.0316729376088056, "grad_norm": 1.5390625, "learning_rate": 0.00045943782123151556, "loss": 5.202, "mean_token_accuracy": 0.18720657825469972, "num_tokens": 40378571.0, "step": 18090 }, { "entropy": 5.509575033187867, "epoch": 2.0322345145167633, "grad_norm": 2.46875, "learning_rate": 0.0004594148227458829, "loss": 5.2389, "mean_token_accuracy": 0.19426094591617585, "num_tokens": 40389467.0, "step": 18095 }, { "entropy": 5.525057935714722, "epoch": 2.0327960914247205, "grad_norm": 1.3515625, "learning_rate": 0.0004593918183884108, "loss": 5.2614, "mean_token_accuracy": 0.19487734884023666, "num_tokens": 40399785.0, "step": 18100 }, { "entropy": 5.477648210525513, "epoch": 2.033357668332678, "grad_norm": 1.484375, "learning_rate": 0.0004593688081598318, "loss": 5.2425, "mean_token_accuracy": 0.19481801688671113, "num_tokens": 40409862.0, "step": 18105 }, { "entropy": 5.519769477844238, "epoch": 2.033919245240636, "grad_norm": 1.4609375, "learning_rate": 0.00045934579206087837, "loss": 5.3306, "mean_token_accuracy": 0.18670503050088882, "num_tokens": 40421627.0, "step": 18110 }, { "entropy": 5.57765679359436, "epoch": 2.034480822148593, "grad_norm": 1.34375, "learning_rate": 0.00045932277009228336, "loss": 5.3041, "mean_token_accuracy": 0.1881491169333458, "num_tokens": 40433327.0, "step": 18115 }, { "entropy": 5.469289350509643, "epoch": 2.0350423990565507, "grad_norm": 1.21875, "learning_rate": 0.00045929974225477986, "loss": 5.1752, "mean_token_accuracy": 0.19770171791315078, "num_tokens": 40444217.0, "step": 18120 }, { "entropy": 5.471521329879761, "epoch": 2.0356039759645084, "grad_norm": 1.2421875, "learning_rate": 0.00045927670854910117, "loss": 5.2566, "mean_token_accuracy": 0.196864578127861, "num_tokens": 40454760.0, "step": 18125 }, { "entropy": 5.540667867660522, "epoch": 2.036165552872466, "grad_norm": 1.390625, "learning_rate": 0.0004592536689759806, "loss": 5.2724, "mean_token_accuracy": 0.1880270317196846, "num_tokens": 40464638.0, "step": 18130 }, { "entropy": 5.55751748085022, "epoch": 2.0367271297804233, "grad_norm": 1.390625, "learning_rate": 0.00045923062353615167, "loss": 5.2412, "mean_token_accuracy": 0.1920843541622162, "num_tokens": 40474911.0, "step": 18135 }, { "entropy": 5.519346380233765, "epoch": 2.037288706688381, "grad_norm": 1.2421875, "learning_rate": 0.00045920757223034833, "loss": 5.2607, "mean_token_accuracy": 0.18908546715974808, "num_tokens": 40485369.0, "step": 18140 }, { "entropy": 5.544115161895752, "epoch": 2.0378502835963386, "grad_norm": 1.453125, "learning_rate": 0.0004591845150593044, "loss": 5.3029, "mean_token_accuracy": 0.18528816252946853, "num_tokens": 40495955.0, "step": 18145 }, { "entropy": 5.547362422943115, "epoch": 2.0384118605042962, "grad_norm": 1.4921875, "learning_rate": 0.00045916145202375407, "loss": 5.3241, "mean_token_accuracy": 0.19307520538568496, "num_tokens": 40506633.0, "step": 18150 }, { "entropy": 5.591632890701294, "epoch": 2.0389734374122535, "grad_norm": 1.78125, "learning_rate": 0.0004591383831244317, "loss": 5.2975, "mean_token_accuracy": 0.18528449535369873, "num_tokens": 40516868.0, "step": 18155 }, { "entropy": 5.4388343334198, "epoch": 2.039535014320211, "grad_norm": 1.8828125, "learning_rate": 0.00045911530836207173, "loss": 5.1988, "mean_token_accuracy": 0.1996513158082962, "num_tokens": 40528873.0, "step": 18160 }, { "entropy": 5.533275032043457, "epoch": 2.0400965912281688, "grad_norm": 1.5390625, "learning_rate": 0.00045909222773740904, "loss": 5.2567, "mean_token_accuracy": 0.18681711852550506, "num_tokens": 40539124.0, "step": 18165 }, { "entropy": 5.480309343338012, "epoch": 2.0406581681361264, "grad_norm": 1.5, "learning_rate": 0.00045906914125117833, "loss": 5.2506, "mean_token_accuracy": 0.1957709088921547, "num_tokens": 40550264.0, "step": 18170 }, { "entropy": 5.414032602310181, "epoch": 2.0412197450440837, "grad_norm": 1.421875, "learning_rate": 0.00045904604890411476, "loss": 5.1305, "mean_token_accuracy": 0.20195517539978028, "num_tokens": 40562319.0, "step": 18175 }, { "entropy": 5.468103647232056, "epoch": 2.0417813219520413, "grad_norm": 1.5234375, "learning_rate": 0.00045902295069695373, "loss": 5.3122, "mean_token_accuracy": 0.1947186753153801, "num_tokens": 40573962.0, "step": 18180 }, { "entropy": 5.465974998474121, "epoch": 2.042342898859999, "grad_norm": 1.3671875, "learning_rate": 0.0004589998466304305, "loss": 5.1894, "mean_token_accuracy": 0.19121768772602082, "num_tokens": 40584620.0, "step": 18185 }, { "entropy": 5.559465408325195, "epoch": 2.0429044757679566, "grad_norm": 1.453125, "learning_rate": 0.00045897673670528086, "loss": 5.3399, "mean_token_accuracy": 0.19162847250699996, "num_tokens": 40596670.0, "step": 18190 }, { "entropy": 5.552762269973755, "epoch": 2.043466052675914, "grad_norm": 2.0, "learning_rate": 0.0004589536209222404, "loss": 5.2521, "mean_token_accuracy": 0.19699085652828216, "num_tokens": 40607742.0, "step": 18195 }, { "entropy": 5.483900547027588, "epoch": 2.0440276295838715, "grad_norm": 1.4140625, "learning_rate": 0.0004589304992820454, "loss": 5.1679, "mean_token_accuracy": 0.20076052248477935, "num_tokens": 40618873.0, "step": 18200 }, { "entropy": 5.487114143371582, "epoch": 2.044589206491829, "grad_norm": 1.765625, "learning_rate": 0.000458907371785432, "loss": 5.2223, "mean_token_accuracy": 0.19629937112331391, "num_tokens": 40630327.0, "step": 18205 }, { "entropy": 5.441974925994873, "epoch": 2.0451507833997864, "grad_norm": 1.40625, "learning_rate": 0.0004588842384331366, "loss": 5.2029, "mean_token_accuracy": 0.19794509708881378, "num_tokens": 40641515.0, "step": 18210 }, { "entropy": 5.5347236633300785, "epoch": 2.045712360307744, "grad_norm": 1.359375, "learning_rate": 0.00045886109922589564, "loss": 5.2387, "mean_token_accuracy": 0.1935408443212509, "num_tokens": 40652123.0, "step": 18215 }, { "entropy": 5.496812772750855, "epoch": 2.0462739372157017, "grad_norm": 1.328125, "learning_rate": 0.00045883795416444594, "loss": 5.2093, "mean_token_accuracy": 0.19317083507776261, "num_tokens": 40662895.0, "step": 18220 }, { "entropy": 5.437646150588989, "epoch": 2.0468355141236594, "grad_norm": 1.2734375, "learning_rate": 0.00045881480324952455, "loss": 5.1526, "mean_token_accuracy": 0.20172156244516373, "num_tokens": 40673243.0, "step": 18225 }, { "entropy": 5.540271282196045, "epoch": 2.0473970910316166, "grad_norm": 1.1953125, "learning_rate": 0.00045879164648186853, "loss": 5.2218, "mean_token_accuracy": 0.20120328664779663, "num_tokens": 40683861.0, "step": 18230 }, { "entropy": 5.514056062698364, "epoch": 2.0479586679395743, "grad_norm": 1.1875, "learning_rate": 0.00045876848386221513, "loss": 5.1805, "mean_token_accuracy": 0.19275143146514892, "num_tokens": 40694995.0, "step": 18235 }, { "entropy": 5.487927627563477, "epoch": 2.048520244847532, "grad_norm": 1.3359375, "learning_rate": 0.00045874531539130204, "loss": 5.2497, "mean_token_accuracy": 0.19804618507623672, "num_tokens": 40705203.0, "step": 18240 }, { "entropy": 5.519061422348022, "epoch": 2.0490818217554896, "grad_norm": 1.484375, "learning_rate": 0.00045872214106986684, "loss": 5.256, "mean_token_accuracy": 0.19467736333608626, "num_tokens": 40716439.0, "step": 18245 }, { "entropy": 5.4585394859313965, "epoch": 2.049643398663447, "grad_norm": 1.515625, "learning_rate": 0.00045869896089864733, "loss": 5.214, "mean_token_accuracy": 0.1964782804250717, "num_tokens": 40727436.0, "step": 18250 }, { "entropy": 5.493454456329346, "epoch": 2.0502049755714045, "grad_norm": 1.375, "learning_rate": 0.0004586757748783817, "loss": 5.1926, "mean_token_accuracy": 0.20115760266780852, "num_tokens": 40738423.0, "step": 18255 }, { "entropy": 5.658260202407837, "epoch": 2.050766552479362, "grad_norm": 1.546875, "learning_rate": 0.00045865258300980817, "loss": 5.4002, "mean_token_accuracy": 0.1902313143014908, "num_tokens": 40749506.0, "step": 18260 }, { "entropy": 5.581439590454101, "epoch": 2.05132812938732, "grad_norm": 1.3125, "learning_rate": 0.00045862938529366514, "loss": 5.2558, "mean_token_accuracy": 0.2016041696071625, "num_tokens": 40762165.0, "step": 18265 }, { "entropy": 5.5209489345550535, "epoch": 2.051889706295277, "grad_norm": 1.3203125, "learning_rate": 0.0004586061817306913, "loss": 5.3314, "mean_token_accuracy": 0.18586129695177078, "num_tokens": 40774043.0, "step": 18270 }, { "entropy": 5.446827602386475, "epoch": 2.0524512832032347, "grad_norm": 1.4140625, "learning_rate": 0.00045858297232162536, "loss": 5.211, "mean_token_accuracy": 0.19647075086832047, "num_tokens": 40784758.0, "step": 18275 }, { "entropy": 5.5446666240692135, "epoch": 2.0530128601111923, "grad_norm": 1.328125, "learning_rate": 0.00045855975706720644, "loss": 5.2333, "mean_token_accuracy": 0.19913334995508195, "num_tokens": 40794735.0, "step": 18280 }, { "entropy": 5.438759994506836, "epoch": 2.05357443701915, "grad_norm": 1.765625, "learning_rate": 0.0004585365359681736, "loss": 5.1257, "mean_token_accuracy": 0.2007010981440544, "num_tokens": 40805491.0, "step": 18285 }, { "entropy": 5.546117210388184, "epoch": 2.054136013927107, "grad_norm": 1.4921875, "learning_rate": 0.00045851330902526633, "loss": 5.3535, "mean_token_accuracy": 0.19056230485439302, "num_tokens": 40816945.0, "step": 18290 }, { "entropy": 5.613444900512695, "epoch": 2.054697590835065, "grad_norm": 1.25, "learning_rate": 0.00045849007623922406, "loss": 5.3182, "mean_token_accuracy": 0.19508860260248184, "num_tokens": 40828199.0, "step": 18295 }, { "entropy": 5.528549337387085, "epoch": 2.0552591677430225, "grad_norm": 1.296875, "learning_rate": 0.0004584668376107867, "loss": 5.3363, "mean_token_accuracy": 0.19062856286764146, "num_tokens": 40839618.0, "step": 18300 }, { "entropy": 5.464557266235351, "epoch": 2.0558207446509797, "grad_norm": 1.2109375, "learning_rate": 0.000458443593140694, "loss": 5.2184, "mean_token_accuracy": 0.19472844153642654, "num_tokens": 40851078.0, "step": 18305 }, { "entropy": 5.544152736663818, "epoch": 2.0563823215589374, "grad_norm": 1.25, "learning_rate": 0.00045842034282968615, "loss": 5.2072, "mean_token_accuracy": 0.19696956127882004, "num_tokens": 40862397.0, "step": 18310 }, { "entropy": 5.4796758651733395, "epoch": 2.056943898466895, "grad_norm": 1.8671875, "learning_rate": 0.0004583970866785035, "loss": 5.215, "mean_token_accuracy": 0.19224913716316222, "num_tokens": 40872739.0, "step": 18315 }, { "entropy": 5.625690078735351, "epoch": 2.0575054753748527, "grad_norm": 1.3984375, "learning_rate": 0.00045837382468788643, "loss": 5.3098, "mean_token_accuracy": 0.19087839126586914, "num_tokens": 40884723.0, "step": 18320 }, { "entropy": 5.544408082962036, "epoch": 2.05806705228281, "grad_norm": 1.3828125, "learning_rate": 0.0004583505568585757, "loss": 5.2939, "mean_token_accuracy": 0.19208989590406417, "num_tokens": 40895927.0, "step": 18325 }, { "entropy": 5.457180213928223, "epoch": 2.0586286291907676, "grad_norm": 1.578125, "learning_rate": 0.00045832728319131205, "loss": 5.258, "mean_token_accuracy": 0.1920614942908287, "num_tokens": 40906504.0, "step": 18330 }, { "entropy": 5.464088249206543, "epoch": 2.0591902060987253, "grad_norm": 1.265625, "learning_rate": 0.0004583040036868367, "loss": 5.1613, "mean_token_accuracy": 0.19689573645591735, "num_tokens": 40918420.0, "step": 18335 }, { "entropy": 5.5200577735900875, "epoch": 2.059751783006683, "grad_norm": 1.2109375, "learning_rate": 0.0004582807183458907, "loss": 5.2778, "mean_token_accuracy": 0.19521691650152206, "num_tokens": 40929665.0, "step": 18340 }, { "entropy": 5.528092098236084, "epoch": 2.06031335991464, "grad_norm": 1.5546875, "learning_rate": 0.00045825742716921553, "loss": 5.2535, "mean_token_accuracy": 0.18861947506666182, "num_tokens": 40941134.0, "step": 18345 }, { "entropy": 5.539303970336914, "epoch": 2.060874936822598, "grad_norm": 1.265625, "learning_rate": 0.0004582341301575529, "loss": 5.2767, "mean_token_accuracy": 0.1965376242995262, "num_tokens": 40953230.0, "step": 18350 }, { "entropy": 5.47193751335144, "epoch": 2.0614365137305555, "grad_norm": 1.40625, "learning_rate": 0.00045821082731164445, "loss": 5.2186, "mean_token_accuracy": 0.1976081594824791, "num_tokens": 40964398.0, "step": 18355 }, { "entropy": 5.57206244468689, "epoch": 2.061998090638513, "grad_norm": 1.2109375, "learning_rate": 0.0004581875186322322, "loss": 5.2787, "mean_token_accuracy": 0.19481647461652757, "num_tokens": 40975561.0, "step": 18360 }, { "entropy": 5.4444647312164305, "epoch": 2.0625596675464704, "grad_norm": 1.375, "learning_rate": 0.00045816420412005826, "loss": 5.1623, "mean_token_accuracy": 0.2018464043736458, "num_tokens": 40986393.0, "step": 18365 }, { "entropy": 5.467040348052978, "epoch": 2.063121244454428, "grad_norm": 1.875, "learning_rate": 0.00045814088377586505, "loss": 5.2849, "mean_token_accuracy": 0.19812929183244704, "num_tokens": 40998143.0, "step": 18370 }, { "entropy": 5.554757833480835, "epoch": 2.0636828213623857, "grad_norm": 1.4140625, "learning_rate": 0.00045811755760039513, "loss": 5.295, "mean_token_accuracy": 0.1946550041437149, "num_tokens": 41009747.0, "step": 18375 }, { "entropy": 5.511597061157227, "epoch": 2.0642443982703433, "grad_norm": 1.265625, "learning_rate": 0.00045809422559439113, "loss": 5.2092, "mean_token_accuracy": 0.1940724790096283, "num_tokens": 41023146.0, "step": 18380 }, { "entropy": 5.526904296875, "epoch": 2.0648059751783006, "grad_norm": 1.171875, "learning_rate": 0.00045807088775859595, "loss": 5.3336, "mean_token_accuracy": 0.1882246345281601, "num_tokens": 41034138.0, "step": 18385 }, { "entropy": 5.50452070236206, "epoch": 2.065367552086258, "grad_norm": 1.4296875, "learning_rate": 0.0004580475440937527, "loss": 5.1359, "mean_token_accuracy": 0.1989658758044243, "num_tokens": 41045457.0, "step": 18390 }, { "entropy": 5.465430545806885, "epoch": 2.065929128994216, "grad_norm": 1.3671875, "learning_rate": 0.00045802419460060464, "loss": 5.2332, "mean_token_accuracy": 0.19728562235832214, "num_tokens": 41056264.0, "step": 18395 }, { "entropy": 5.546510696411133, "epoch": 2.066490705902173, "grad_norm": 1.4375, "learning_rate": 0.0004580008392798953, "loss": 5.3919, "mean_token_accuracy": 0.18524643480777742, "num_tokens": 41067206.0, "step": 18400 }, { "entropy": 5.422588682174682, "epoch": 2.0670522828101308, "grad_norm": 1.3046875, "learning_rate": 0.00045797747813236815, "loss": 5.1246, "mean_token_accuracy": 0.19666744470596315, "num_tokens": 41077897.0, "step": 18405 }, { "entropy": 5.471376037597656, "epoch": 2.0676138597180884, "grad_norm": 1.2109375, "learning_rate": 0.00045795411115876725, "loss": 5.2099, "mean_token_accuracy": 0.19427814334630966, "num_tokens": 41088964.0, "step": 18410 }, { "entropy": 5.49049596786499, "epoch": 2.068175436626046, "grad_norm": 1.296875, "learning_rate": 0.00045793073835983644, "loss": 5.1571, "mean_token_accuracy": 0.2011103078722954, "num_tokens": 41098818.0, "step": 18415 }, { "entropy": 5.587615966796875, "epoch": 2.0687370135340033, "grad_norm": 1.1640625, "learning_rate": 0.00045790735973631996, "loss": 5.364, "mean_token_accuracy": 0.18901024609804154, "num_tokens": 41111222.0, "step": 18420 }, { "entropy": 5.530643653869629, "epoch": 2.069298590441961, "grad_norm": 1.2890625, "learning_rate": 0.00045788397528896224, "loss": 5.2167, "mean_token_accuracy": 0.19260232746601105, "num_tokens": 41122875.0, "step": 18425 }, { "entropy": 5.506813621520996, "epoch": 2.0698601673499186, "grad_norm": 1.4453125, "learning_rate": 0.00045786058501850774, "loss": 5.2538, "mean_token_accuracy": 0.18410073071718216, "num_tokens": 41133869.0, "step": 18430 }, { "entropy": 5.508162975311279, "epoch": 2.0704217442578763, "grad_norm": 1.4296875, "learning_rate": 0.00045783718892570136, "loss": 5.1777, "mean_token_accuracy": 0.19572405219078065, "num_tokens": 41144482.0, "step": 18435 }, { "entropy": 5.415844249725342, "epoch": 2.0709833211658335, "grad_norm": 1.3984375, "learning_rate": 0.000457813787011288, "loss": 5.1835, "mean_token_accuracy": 0.19369978755712508, "num_tokens": 41154997.0, "step": 18440 }, { "entropy": 5.39900164604187, "epoch": 2.071544898073791, "grad_norm": 1.3671875, "learning_rate": 0.0004577903792760127, "loss": 5.2225, "mean_token_accuracy": 0.19413264840841293, "num_tokens": 41167852.0, "step": 18445 }, { "entropy": 5.523342895507812, "epoch": 2.072106474981749, "grad_norm": 1.2109375, "learning_rate": 0.0004577669657206209, "loss": 5.2132, "mean_token_accuracy": 0.19986539632081984, "num_tokens": 41178364.0, "step": 18450 }, { "entropy": 5.528639316558838, "epoch": 2.0726680518897065, "grad_norm": 1.3984375, "learning_rate": 0.0004577435463458579, "loss": 5.3268, "mean_token_accuracy": 0.18822480142116546, "num_tokens": 41190003.0, "step": 18455 }, { "entropy": 5.46252064704895, "epoch": 2.0732296287976637, "grad_norm": 1.3671875, "learning_rate": 0.0004577201211524696, "loss": 5.1594, "mean_token_accuracy": 0.19574379473924636, "num_tokens": 41201574.0, "step": 18460 }, { "entropy": 5.432068252563477, "epoch": 2.0737912057056214, "grad_norm": 1.171875, "learning_rate": 0.0004576966901412018, "loss": 5.1589, "mean_token_accuracy": 0.20136497765779496, "num_tokens": 41211913.0, "step": 18465 }, { "entropy": 5.419327163696289, "epoch": 2.074352782613579, "grad_norm": 1.2734375, "learning_rate": 0.00045767325331280044, "loss": 5.177, "mean_token_accuracy": 0.1994516834616661, "num_tokens": 41222626.0, "step": 18470 }, { "entropy": 5.540180206298828, "epoch": 2.0749143595215367, "grad_norm": 1.40625, "learning_rate": 0.0004576498106680119, "loss": 5.3444, "mean_token_accuracy": 0.1827343687415123, "num_tokens": 41234321.0, "step": 18475 }, { "entropy": 5.5479310035705565, "epoch": 2.075475936429494, "grad_norm": 1.7265625, "learning_rate": 0.0004576263622075826, "loss": 5.1779, "mean_token_accuracy": 0.20113203227519988, "num_tokens": 41244889.0, "step": 18480 }, { "entropy": 5.574405193328857, "epoch": 2.0760375133374516, "grad_norm": 1.5078125, "learning_rate": 0.000457602907932259, "loss": 5.3946, "mean_token_accuracy": 0.18477905839681624, "num_tokens": 41255710.0, "step": 18485 }, { "entropy": 5.56986894607544, "epoch": 2.0765990902454092, "grad_norm": 1.2890625, "learning_rate": 0.00045757944784278803, "loss": 5.2966, "mean_token_accuracy": 0.19818877577781677, "num_tokens": 41265786.0, "step": 18490 }, { "entropy": 5.501178836822509, "epoch": 2.0771606671533664, "grad_norm": 1.2578125, "learning_rate": 0.0004575559819399166, "loss": 5.2142, "mean_token_accuracy": 0.1905228704214096, "num_tokens": 41276755.0, "step": 18495 }, { "entropy": 5.527812051773071, "epoch": 2.077722244061324, "grad_norm": 1.359375, "learning_rate": 0.00045753251022439195, "loss": 5.1731, "mean_token_accuracy": 0.19660303592681885, "num_tokens": 41287219.0, "step": 18500 }, { "entropy": 5.547694540023803, "epoch": 2.0782838209692818, "grad_norm": 1.375, "learning_rate": 0.0004575090326969614, "loss": 5.2488, "mean_token_accuracy": 0.19359165132045747, "num_tokens": 41297356.0, "step": 18505 }, { "entropy": 5.397096443176269, "epoch": 2.0788453978772394, "grad_norm": 1.234375, "learning_rate": 0.0004574855493583723, "loss": 5.1614, "mean_token_accuracy": 0.2053090140223503, "num_tokens": 41307219.0, "step": 18510 }, { "entropy": 5.516602182388306, "epoch": 2.0794069747851966, "grad_norm": 1.2578125, "learning_rate": 0.00045746206020937276, "loss": 5.2944, "mean_token_accuracy": 0.19071929454803466, "num_tokens": 41318827.0, "step": 18515 }, { "entropy": 5.575522708892822, "epoch": 2.0799685516931543, "grad_norm": 1.46875, "learning_rate": 0.00045743856525071034, "loss": 5.3056, "mean_token_accuracy": 0.19240287989377974, "num_tokens": 41329497.0, "step": 18520 }, { "entropy": 5.531044864654541, "epoch": 2.080530128601112, "grad_norm": 1.25, "learning_rate": 0.00045741506448313327, "loss": 5.2407, "mean_token_accuracy": 0.1947307512164116, "num_tokens": 41340577.0, "step": 18525 }, { "entropy": 5.509425687789917, "epoch": 2.0810917055090696, "grad_norm": 1.734375, "learning_rate": 0.00045739155790738975, "loss": 5.2418, "mean_token_accuracy": 0.18887036442756652, "num_tokens": 41351685.0, "step": 18530 }, { "entropy": 5.650399875640869, "epoch": 2.081653282417027, "grad_norm": 1.484375, "learning_rate": 0.00045736804552422836, "loss": 5.3743, "mean_token_accuracy": 0.18694644272327424, "num_tokens": 41363053.0, "step": 18535 }, { "entropy": 5.678454971313476, "epoch": 2.0822148593249845, "grad_norm": 1.265625, "learning_rate": 0.0004573445273343976, "loss": 5.3827, "mean_token_accuracy": 0.18889155685901643, "num_tokens": 41374847.0, "step": 18540 }, { "entropy": 5.481970024108887, "epoch": 2.082776436232942, "grad_norm": 1.2578125, "learning_rate": 0.0004573210033386464, "loss": 5.3257, "mean_token_accuracy": 0.18636160343885422, "num_tokens": 41386114.0, "step": 18545 }, { "entropy": 5.462983226776123, "epoch": 2.0833380131409, "grad_norm": 1.1484375, "learning_rate": 0.0004572974735377238, "loss": 5.1213, "mean_token_accuracy": 0.19758780896663666, "num_tokens": 41397842.0, "step": 18550 }, { "entropy": 5.509663248062134, "epoch": 2.083899590048857, "grad_norm": 1.3125, "learning_rate": 0.0004572739379323788, "loss": 5.2399, "mean_token_accuracy": 0.19286703318357468, "num_tokens": 41409824.0, "step": 18555 }, { "entropy": 5.453081274032593, "epoch": 2.0844611669568147, "grad_norm": 1.3125, "learning_rate": 0.00045725039652336105, "loss": 5.2259, "mean_token_accuracy": 0.18826664984226227, "num_tokens": 41422260.0, "step": 18560 }, { "entropy": 5.517183828353882, "epoch": 2.0850227438647724, "grad_norm": 1.4140625, "learning_rate": 0.0004572268493114199, "loss": 5.2298, "mean_token_accuracy": 0.1965215101838112, "num_tokens": 41433068.0, "step": 18565 }, { "entropy": 5.508039379119873, "epoch": 2.08558432077273, "grad_norm": 1.5078125, "learning_rate": 0.0004572032962973052, "loss": 5.2056, "mean_token_accuracy": 0.19768486469984053, "num_tokens": 41443759.0, "step": 18570 }, { "entropy": 5.49811019897461, "epoch": 2.0861458976806873, "grad_norm": 1.296875, "learning_rate": 0.00045717973748176695, "loss": 5.2836, "mean_token_accuracy": 0.19462305605411528, "num_tokens": 41453876.0, "step": 18575 }, { "entropy": 5.466852378845215, "epoch": 2.086707474588645, "grad_norm": 1.5390625, "learning_rate": 0.00045715617286555516, "loss": 5.2182, "mean_token_accuracy": 0.19392173439264299, "num_tokens": 41464731.0, "step": 18580 }, { "entropy": 5.573261833190918, "epoch": 2.0872690514966026, "grad_norm": 1.5859375, "learning_rate": 0.00045713260244942017, "loss": 5.3091, "mean_token_accuracy": 0.18790953904390334, "num_tokens": 41476288.0, "step": 18585 }, { "entropy": 5.573249006271363, "epoch": 2.08783062840456, "grad_norm": 1.3828125, "learning_rate": 0.0004571090262341125, "loss": 5.2252, "mean_token_accuracy": 0.19779866933822632, "num_tokens": 41485968.0, "step": 18590 }, { "entropy": 5.522953653335572, "epoch": 2.0883922053125175, "grad_norm": 1.328125, "learning_rate": 0.00045708544422038284, "loss": 5.2661, "mean_token_accuracy": 0.19240011423826217, "num_tokens": 41496393.0, "step": 18595 }, { "entropy": 5.467296504974366, "epoch": 2.088953782220475, "grad_norm": 1.296875, "learning_rate": 0.0004570618564089819, "loss": 5.243, "mean_token_accuracy": 0.19548484683036804, "num_tokens": 41507539.0, "step": 18600 }, { "entropy": 5.596036577224732, "epoch": 2.089515359128433, "grad_norm": 1.28125, "learning_rate": 0.00045703826280066095, "loss": 5.3252, "mean_token_accuracy": 0.1854417070746422, "num_tokens": 41517845.0, "step": 18605 }, { "entropy": 5.524791860580445, "epoch": 2.09007693603639, "grad_norm": 1.78125, "learning_rate": 0.0004570146633961711, "loss": 5.2259, "mean_token_accuracy": 0.19945240616798401, "num_tokens": 41528204.0, "step": 18610 }, { "entropy": 5.528181171417236, "epoch": 2.0906385129443477, "grad_norm": 1.203125, "learning_rate": 0.00045699105819626374, "loss": 5.276, "mean_token_accuracy": 0.19378704726696014, "num_tokens": 41538425.0, "step": 18615 }, { "entropy": 5.5230772495269775, "epoch": 2.0912000898523053, "grad_norm": 1.265625, "learning_rate": 0.0004569674472016904, "loss": 5.3237, "mean_token_accuracy": 0.19206100851297378, "num_tokens": 41548762.0, "step": 18620 }, { "entropy": 5.452923059463501, "epoch": 2.091761666760263, "grad_norm": 1.375, "learning_rate": 0.0004569438304132031, "loss": 5.1839, "mean_token_accuracy": 0.199401193857193, "num_tokens": 41559003.0, "step": 18625 }, { "entropy": 5.472324323654175, "epoch": 2.09232324366822, "grad_norm": 1.4140625, "learning_rate": 0.00045692020783155376, "loss": 5.1982, "mean_token_accuracy": 0.1943460151553154, "num_tokens": 41569630.0, "step": 18630 }, { "entropy": 5.567695569992066, "epoch": 2.092884820576178, "grad_norm": 1.265625, "learning_rate": 0.0004568965794574943, "loss": 5.3137, "mean_token_accuracy": 0.19472360759973525, "num_tokens": 41580671.0, "step": 18635 }, { "entropy": 5.5831156253814695, "epoch": 2.0934463974841355, "grad_norm": 1.28125, "learning_rate": 0.0004568729452917772, "loss": 5.3094, "mean_token_accuracy": 0.18963203132152556, "num_tokens": 41592475.0, "step": 18640 }, { "entropy": 5.539744853973389, "epoch": 2.094007974392093, "grad_norm": 1.2734375, "learning_rate": 0.00045684930533515506, "loss": 5.2669, "mean_token_accuracy": 0.18983601927757263, "num_tokens": 41603675.0, "step": 18645 }, { "entropy": 5.532234525680542, "epoch": 2.0945695513000504, "grad_norm": 1.5078125, "learning_rate": 0.00045682565958838045, "loss": 5.2171, "mean_token_accuracy": 0.19250726699829102, "num_tokens": 41614684.0, "step": 18650 }, { "entropy": 5.4813155174255375, "epoch": 2.095131128208008, "grad_norm": 1.7578125, "learning_rate": 0.0004568020080522063, "loss": 5.3144, "mean_token_accuracy": 0.19253091961145402, "num_tokens": 41625368.0, "step": 18655 }, { "entropy": 5.555939674377441, "epoch": 2.0956927051159657, "grad_norm": 1.484375, "learning_rate": 0.0004567783507273858, "loss": 5.2503, "mean_token_accuracy": 0.19352529495954512, "num_tokens": 41636542.0, "step": 18660 }, { "entropy": 5.597741222381591, "epoch": 2.0962542820239234, "grad_norm": 1.3515625, "learning_rate": 0.00045675468761467204, "loss": 5.3119, "mean_token_accuracy": 0.19495112150907518, "num_tokens": 41646654.0, "step": 18665 }, { "entropy": 5.592956924438477, "epoch": 2.0968158589318806, "grad_norm": 1.203125, "learning_rate": 0.00045673101871481853, "loss": 5.4201, "mean_token_accuracy": 0.1823358029127121, "num_tokens": 41659160.0, "step": 18670 }, { "entropy": 5.543447494506836, "epoch": 2.0973774358398383, "grad_norm": 1.3984375, "learning_rate": 0.0004567073440285789, "loss": 5.2523, "mean_token_accuracy": 0.19714139848947526, "num_tokens": 41670864.0, "step": 18675 }, { "entropy": 5.494233083724976, "epoch": 2.097939012747796, "grad_norm": 1.4609375, "learning_rate": 0.00045668366355670697, "loss": 5.1755, "mean_token_accuracy": 0.19407217502593993, "num_tokens": 41681947.0, "step": 18680 }, { "entropy": 5.510460996627808, "epoch": 2.098500589655753, "grad_norm": 1.453125, "learning_rate": 0.0004566599772999567, "loss": 5.3112, "mean_token_accuracy": 0.18885926455259322, "num_tokens": 41692625.0, "step": 18685 }, { "entropy": 5.617909145355225, "epoch": 2.099062166563711, "grad_norm": 2.140625, "learning_rate": 0.00045663628525908237, "loss": 5.3429, "mean_token_accuracy": 0.18358024060726166, "num_tokens": 41703118.0, "step": 18690 }, { "entropy": 5.574043846130371, "epoch": 2.0996237434716685, "grad_norm": 1.40625, "learning_rate": 0.0004566125874348382, "loss": 5.2765, "mean_token_accuracy": 0.19572641253471373, "num_tokens": 41713910.0, "step": 18695 }, { "entropy": 5.522626638412476, "epoch": 2.100185320379626, "grad_norm": 1.2734375, "learning_rate": 0.00045658888382797886, "loss": 5.2512, "mean_token_accuracy": 0.19443645179271699, "num_tokens": 41725290.0, "step": 18700 }, { "entropy": 5.572107410430908, "epoch": 2.1007468972875833, "grad_norm": 1.4765625, "learning_rate": 0.00045656517443925897, "loss": 5.2982, "mean_token_accuracy": 0.19033897370100022, "num_tokens": 41736265.0, "step": 18705 }, { "entropy": 5.57664270401001, "epoch": 2.101308474195541, "grad_norm": 1.15625, "learning_rate": 0.0004565414592694336, "loss": 5.3173, "mean_token_accuracy": 0.1888023942708969, "num_tokens": 41746702.0, "step": 18710 }, { "entropy": 5.643450450897217, "epoch": 2.1018700511034987, "grad_norm": 1.6875, "learning_rate": 0.0004565177383192577, "loss": 5.4193, "mean_token_accuracy": 0.18916128873825072, "num_tokens": 41758570.0, "step": 18715 }, { "entropy": 5.602493619918823, "epoch": 2.1024316280114563, "grad_norm": 1.5625, "learning_rate": 0.00045649401158948664, "loss": 5.3028, "mean_token_accuracy": 0.20153228789567948, "num_tokens": 41769507.0, "step": 18720 }, { "entropy": 5.514243793487549, "epoch": 2.1029932049194136, "grad_norm": 1.6953125, "learning_rate": 0.0004564702790808758, "loss": 5.2622, "mean_token_accuracy": 0.20066044330596924, "num_tokens": 41780558.0, "step": 18725 }, { "entropy": 5.454886388778687, "epoch": 2.103554781827371, "grad_norm": 1.40625, "learning_rate": 0.0004564465407941809, "loss": 5.1833, "mean_token_accuracy": 0.1996917173266411, "num_tokens": 41790518.0, "step": 18730 }, { "entropy": 5.53684434890747, "epoch": 2.104116358735329, "grad_norm": 1.34375, "learning_rate": 0.00045642279673015787, "loss": 5.301, "mean_token_accuracy": 0.19263856112957, "num_tokens": 41800329.0, "step": 18735 }, { "entropy": 5.483575105667114, "epoch": 2.1046779356432865, "grad_norm": 1.421875, "learning_rate": 0.0004563990468895625, "loss": 5.1409, "mean_token_accuracy": 0.19947306662797928, "num_tokens": 41811231.0, "step": 18740 }, { "entropy": 5.435629844665527, "epoch": 2.1052395125512438, "grad_norm": 1.3671875, "learning_rate": 0.0004563752912731512, "loss": 5.1808, "mean_token_accuracy": 0.19311793446540831, "num_tokens": 41821544.0, "step": 18745 }, { "entropy": 5.447556829452514, "epoch": 2.1058010894592014, "grad_norm": 1.6328125, "learning_rate": 0.0004563515298816803, "loss": 5.2246, "mean_token_accuracy": 0.19453134685754775, "num_tokens": 41832371.0, "step": 18750 }, { "entropy": 5.540677452087403, "epoch": 2.106362666367159, "grad_norm": 1.3984375, "learning_rate": 0.00045632776271590624, "loss": 5.2118, "mean_token_accuracy": 0.19812269806861876, "num_tokens": 41842828.0, "step": 18755 }, { "entropy": 5.381276988983155, "epoch": 2.1069242432751167, "grad_norm": 1.5390625, "learning_rate": 0.0004563039897765859, "loss": 5.1851, "mean_token_accuracy": 0.19802186340093614, "num_tokens": 41855128.0, "step": 18760 }, { "entropy": 5.4975542545318605, "epoch": 2.107485820183074, "grad_norm": 1.5859375, "learning_rate": 0.0004562802110644764, "loss": 5.2678, "mean_token_accuracy": 0.19369828552007676, "num_tokens": 41866258.0, "step": 18765 }, { "entropy": 5.563699722290039, "epoch": 2.1080473970910316, "grad_norm": 1.5625, "learning_rate": 0.00045625642658033447, "loss": 5.2483, "mean_token_accuracy": 0.19284942299127578, "num_tokens": 41877713.0, "step": 18770 }, { "entropy": 5.580010843276978, "epoch": 2.1086089739989893, "grad_norm": 1.34375, "learning_rate": 0.00045623263632491766, "loss": 5.2598, "mean_token_accuracy": 0.19463108032941817, "num_tokens": 41888592.0, "step": 18775 }, { "entropy": 5.532656049728393, "epoch": 2.1091705509069465, "grad_norm": 1.625, "learning_rate": 0.00045620884029898344, "loss": 5.347, "mean_token_accuracy": 0.1923212856054306, "num_tokens": 41901024.0, "step": 18780 }, { "entropy": 5.5249697208404545, "epoch": 2.109732127814904, "grad_norm": 1.4140625, "learning_rate": 0.00045618503850328954, "loss": 5.2645, "mean_token_accuracy": 0.19209007024765015, "num_tokens": 41911184.0, "step": 18785 }, { "entropy": 5.554409790039062, "epoch": 2.110293704722862, "grad_norm": 1.421875, "learning_rate": 0.0004561612309385936, "loss": 5.2922, "mean_token_accuracy": 0.1893538936972618, "num_tokens": 41922799.0, "step": 18790 }, { "entropy": 5.554865884780884, "epoch": 2.1108552816308195, "grad_norm": 1.3359375, "learning_rate": 0.00045613741760565385, "loss": 5.2531, "mean_token_accuracy": 0.20113448053598404, "num_tokens": 41933223.0, "step": 18795 }, { "entropy": 5.484144639968872, "epoch": 2.1114168585387767, "grad_norm": 1.671875, "learning_rate": 0.0004561135985052285, "loss": 5.2725, "mean_token_accuracy": 0.1906439855694771, "num_tokens": 41944288.0, "step": 18800 }, { "entropy": 5.463064861297608, "epoch": 2.1119784354467344, "grad_norm": 1.71875, "learning_rate": 0.000456089773638076, "loss": 5.2092, "mean_token_accuracy": 0.19603820592164994, "num_tokens": 41954312.0, "step": 18805 }, { "entropy": 5.504269123077393, "epoch": 2.112540012354692, "grad_norm": 1.96875, "learning_rate": 0.0004560659430049548, "loss": 5.3058, "mean_token_accuracy": 0.1928422585129738, "num_tokens": 41966871.0, "step": 18810 }, { "entropy": 5.491275882720947, "epoch": 2.1131015892626497, "grad_norm": 1.3046875, "learning_rate": 0.0004560421066066237, "loss": 5.204, "mean_token_accuracy": 0.200209341943264, "num_tokens": 41979087.0, "step": 18815 }, { "entropy": 5.499590873718262, "epoch": 2.113663166170607, "grad_norm": 1.296875, "learning_rate": 0.00045601826444384175, "loss": 5.2582, "mean_token_accuracy": 0.18966676145792008, "num_tokens": 41989867.0, "step": 18820 }, { "entropy": 5.482534122467041, "epoch": 2.1142247430785646, "grad_norm": 1.2265625, "learning_rate": 0.00045599441651736805, "loss": 5.2403, "mean_token_accuracy": 0.20110277086496353, "num_tokens": 42001205.0, "step": 18825 }, { "entropy": 5.620621919631958, "epoch": 2.1147863199865222, "grad_norm": 1.453125, "learning_rate": 0.00045597056282796196, "loss": 5.3692, "mean_token_accuracy": 0.188943313062191, "num_tokens": 42012466.0, "step": 18830 }, { "entropy": 5.310191583633423, "epoch": 2.11534789689448, "grad_norm": 1.3046875, "learning_rate": 0.0004559467033763829, "loss": 5.0241, "mean_token_accuracy": 0.20320245176553725, "num_tokens": 42022517.0, "step": 18835 }, { "entropy": 5.48411374092102, "epoch": 2.115909473802437, "grad_norm": 1.4140625, "learning_rate": 0.0004559228381633907, "loss": 5.1775, "mean_token_accuracy": 0.20534804165363313, "num_tokens": 42032253.0, "step": 18840 }, { "entropy": 5.523025321960449, "epoch": 2.1164710507103948, "grad_norm": 1.328125, "learning_rate": 0.00045589896718974517, "loss": 5.1944, "mean_token_accuracy": 0.20150178372859956, "num_tokens": 42042943.0, "step": 18845 }, { "entropy": 5.4963047981262205, "epoch": 2.1170326276183524, "grad_norm": 1.375, "learning_rate": 0.0004558750904562063, "loss": 5.1569, "mean_token_accuracy": 0.20104045122861863, "num_tokens": 42054302.0, "step": 18850 }, { "entropy": 5.498264455795288, "epoch": 2.11759420452631, "grad_norm": 1.2734375, "learning_rate": 0.0004558512079635345, "loss": 5.2042, "mean_token_accuracy": 0.18445347845554352, "num_tokens": 42064810.0, "step": 18855 }, { "entropy": 5.427771425247192, "epoch": 2.1181557814342673, "grad_norm": 1.46875, "learning_rate": 0.0004558273197124899, "loss": 5.2823, "mean_token_accuracy": 0.1854138121008873, "num_tokens": 42076468.0, "step": 18860 }, { "entropy": 5.481720781326294, "epoch": 2.118717358342225, "grad_norm": 1.2734375, "learning_rate": 0.00045580342570383347, "loss": 5.194, "mean_token_accuracy": 0.1916309341788292, "num_tokens": 42087488.0, "step": 18865 }, { "entropy": 5.539413976669311, "epoch": 2.1192789352501826, "grad_norm": 1.46875, "learning_rate": 0.0004557795259383258, "loss": 5.3174, "mean_token_accuracy": 0.18633429408073426, "num_tokens": 42099992.0, "step": 18870 }, { "entropy": 5.5242226123809814, "epoch": 2.11984051215814, "grad_norm": 1.4375, "learning_rate": 0.00045575562041672794, "loss": 5.2672, "mean_token_accuracy": 0.1954810306429863, "num_tokens": 42111073.0, "step": 18875 }, { "entropy": 5.504447937011719, "epoch": 2.1204020890660975, "grad_norm": 1.390625, "learning_rate": 0.00045573170913980094, "loss": 5.2449, "mean_token_accuracy": 0.19019717127084732, "num_tokens": 42121413.0, "step": 18880 }, { "entropy": 5.624015855789184, "epoch": 2.120963665974055, "grad_norm": 2.09375, "learning_rate": 0.00045570779210830627, "loss": 5.3335, "mean_token_accuracy": 0.18814467787742614, "num_tokens": 42132239.0, "step": 18885 }, { "entropy": 5.500932502746582, "epoch": 2.121525242882013, "grad_norm": 1.328125, "learning_rate": 0.0004556838693230054, "loss": 5.2791, "mean_token_accuracy": 0.1989013895392418, "num_tokens": 42143124.0, "step": 18890 }, { "entropy": 5.544722843170166, "epoch": 2.12208681978997, "grad_norm": 1.5546875, "learning_rate": 0.00045565994078466005, "loss": 5.2792, "mean_token_accuracy": 0.18843552768230437, "num_tokens": 42152653.0, "step": 18895 }, { "entropy": 5.598435783386231, "epoch": 2.1226483966979277, "grad_norm": 1.9375, "learning_rate": 0.00045563600649403213, "loss": 5.2902, "mean_token_accuracy": 0.19514897912740709, "num_tokens": 42162734.0, "step": 18900 }, { "entropy": 5.5806882858276365, "epoch": 2.1232099736058854, "grad_norm": 1.4375, "learning_rate": 0.0004556120664518838, "loss": 5.3694, "mean_token_accuracy": 0.18368770629167558, "num_tokens": 42175312.0, "step": 18905 }, { "entropy": 5.542457532882691, "epoch": 2.123771550513843, "grad_norm": 1.359375, "learning_rate": 0.0004555881206589771, "loss": 5.2823, "mean_token_accuracy": 0.19374412000179292, "num_tokens": 42186512.0, "step": 18910 }, { "entropy": 5.506154775619507, "epoch": 2.1243331274218002, "grad_norm": 1.203125, "learning_rate": 0.0004555641691160746, "loss": 5.2942, "mean_token_accuracy": 0.19333634078502654, "num_tokens": 42197698.0, "step": 18915 }, { "entropy": 5.461877727508545, "epoch": 2.124894704329758, "grad_norm": 1.1484375, "learning_rate": 0.000455540211823939, "loss": 5.2573, "mean_token_accuracy": 0.19873272776603698, "num_tokens": 42208761.0, "step": 18920 }, { "entropy": 5.528551912307739, "epoch": 2.1254562812377156, "grad_norm": 1.515625, "learning_rate": 0.00045551624878333296, "loss": 5.2581, "mean_token_accuracy": 0.19103594720363617, "num_tokens": 42218920.0, "step": 18925 }, { "entropy": 5.556779098510742, "epoch": 2.1260178581456732, "grad_norm": 1.1875, "learning_rate": 0.00045549227999501957, "loss": 5.2387, "mean_token_accuracy": 0.19957176297903062, "num_tokens": 42229819.0, "step": 18930 }, { "entropy": 5.454245948791504, "epoch": 2.1265794350536305, "grad_norm": 1.3359375, "learning_rate": 0.00045546830545976203, "loss": 5.2067, "mean_token_accuracy": 0.1932344540953636, "num_tokens": 42241189.0, "step": 18935 }, { "entropy": 5.484561920166016, "epoch": 2.127141011961588, "grad_norm": 1.1953125, "learning_rate": 0.00045544432517832356, "loss": 5.1614, "mean_token_accuracy": 0.198034605383873, "num_tokens": 42252665.0, "step": 18940 }, { "entropy": 5.482719039916992, "epoch": 2.1277025888695458, "grad_norm": 1.375, "learning_rate": 0.00045542033915146787, "loss": 5.2222, "mean_token_accuracy": 0.1934773027896881, "num_tokens": 42264514.0, "step": 18945 }, { "entropy": 5.532171821594238, "epoch": 2.1282641657775034, "grad_norm": 1.515625, "learning_rate": 0.00045539634737995857, "loss": 5.263, "mean_token_accuracy": 0.19248943775892258, "num_tokens": 42275229.0, "step": 18950 }, { "entropy": 5.535907793045044, "epoch": 2.1288257426854607, "grad_norm": 1.296875, "learning_rate": 0.00045537234986455964, "loss": 5.2618, "mean_token_accuracy": 0.19488944113254547, "num_tokens": 42286819.0, "step": 18955 }, { "entropy": 5.54831371307373, "epoch": 2.1293873195934183, "grad_norm": 1.28125, "learning_rate": 0.0004553483466060351, "loss": 5.2815, "mean_token_accuracy": 0.19568655043840408, "num_tokens": 42298329.0, "step": 18960 }, { "entropy": 5.376667451858521, "epoch": 2.129948896501376, "grad_norm": 1.25, "learning_rate": 0.00045532433760514925, "loss": 5.1636, "mean_token_accuracy": 0.19899864345788956, "num_tokens": 42308813.0, "step": 18965 }, { "entropy": 5.546373701095581, "epoch": 2.130510473409333, "grad_norm": 1.3828125, "learning_rate": 0.0004553003228626665, "loss": 5.3032, "mean_token_accuracy": 0.19323157519102097, "num_tokens": 42321264.0, "step": 18970 }, { "entropy": 5.470273780822754, "epoch": 2.131072050317291, "grad_norm": 1.34375, "learning_rate": 0.0004552763023793517, "loss": 5.1835, "mean_token_accuracy": 0.19296262860298158, "num_tokens": 42332301.0, "step": 18975 }, { "entropy": 5.4789141654968265, "epoch": 2.1316336272252485, "grad_norm": 1.3125, "learning_rate": 0.0004552522761559694, "loss": 5.1546, "mean_token_accuracy": 0.19569229185581208, "num_tokens": 42343424.0, "step": 18980 }, { "entropy": 5.499362564086914, "epoch": 2.132195204133206, "grad_norm": 1.359375, "learning_rate": 0.00045522824419328475, "loss": 5.2499, "mean_token_accuracy": 0.19062476903200148, "num_tokens": 42354350.0, "step": 18985 }, { "entropy": 5.484207105636597, "epoch": 2.1327567810411634, "grad_norm": 1.4921875, "learning_rate": 0.00045520420649206283, "loss": 5.1596, "mean_token_accuracy": 0.19860177040100097, "num_tokens": 42365110.0, "step": 18990 }, { "entropy": 5.5182812213897705, "epoch": 2.133318357949121, "grad_norm": 1.3515625, "learning_rate": 0.0004551801630530692, "loss": 5.285, "mean_token_accuracy": 0.1936671495437622, "num_tokens": 42376345.0, "step": 18995 }, { "entropy": 5.475411128997803, "epoch": 2.1338799348570787, "grad_norm": 1.5078125, "learning_rate": 0.0004551561138770693, "loss": 5.1672, "mean_token_accuracy": 0.19906097054481506, "num_tokens": 42387161.0, "step": 19000 }, { "entropy": 5.461827754974365, "epoch": 2.1344415117650364, "grad_norm": 1.2578125, "learning_rate": 0.00045513205896482875, "loss": 5.205, "mean_token_accuracy": 0.19788686484098433, "num_tokens": 42397468.0, "step": 19005 }, { "entropy": 5.456885766983032, "epoch": 2.1350030886729936, "grad_norm": 1.265625, "learning_rate": 0.00045510799831711366, "loss": 5.2461, "mean_token_accuracy": 0.19609155505895615, "num_tokens": 42408547.0, "step": 19010 }, { "entropy": 5.428559732437134, "epoch": 2.1355646655809513, "grad_norm": 1.328125, "learning_rate": 0.00045508393193469, "loss": 5.1474, "mean_token_accuracy": 0.20036545246839524, "num_tokens": 42420383.0, "step": 19015 }, { "entropy": 5.536728191375732, "epoch": 2.136126242488909, "grad_norm": 1.2890625, "learning_rate": 0.0004550598598183241, "loss": 5.2935, "mean_token_accuracy": 0.19071185141801833, "num_tokens": 42431723.0, "step": 19020 }, { "entropy": 5.604503440856933, "epoch": 2.1366878193968666, "grad_norm": 1.359375, "learning_rate": 0.0004550357819687825, "loss": 5.2857, "mean_token_accuracy": 0.19198835790157318, "num_tokens": 42443740.0, "step": 19025 }, { "entropy": 5.447312259674073, "epoch": 2.137249396304824, "grad_norm": 1.3125, "learning_rate": 0.0004550116983868317, "loss": 5.2151, "mean_token_accuracy": 0.20047879517078399, "num_tokens": 42454288.0, "step": 19030 }, { "entropy": 5.507414150238037, "epoch": 2.1378109732127815, "grad_norm": 1.484375, "learning_rate": 0.0004549876090732386, "loss": 5.2465, "mean_token_accuracy": 0.19338610917329788, "num_tokens": 42467576.0, "step": 19035 }, { "entropy": 5.53527603149414, "epoch": 2.138372550120739, "grad_norm": 1.5234375, "learning_rate": 0.0004549635140287703, "loss": 5.2209, "mean_token_accuracy": 0.19276407808065416, "num_tokens": 42477839.0, "step": 19040 }, { "entropy": 5.437886476516724, "epoch": 2.138934127028697, "grad_norm": 1.421875, "learning_rate": 0.00045493941325419385, "loss": 5.1649, "mean_token_accuracy": 0.19419862031936647, "num_tokens": 42489875.0, "step": 19045 }, { "entropy": 5.536298608779907, "epoch": 2.139495703936654, "grad_norm": 1.203125, "learning_rate": 0.0004549153067502768, "loss": 5.3179, "mean_token_accuracy": 0.18805031925439836, "num_tokens": 42500946.0, "step": 19050 }, { "entropy": 5.467712688446045, "epoch": 2.1400572808446117, "grad_norm": 1.25, "learning_rate": 0.00045489119451778645, "loss": 5.1996, "mean_token_accuracy": 0.19779159426689147, "num_tokens": 42511503.0, "step": 19055 }, { "entropy": 5.585913610458374, "epoch": 2.1406188577525693, "grad_norm": 1.078125, "learning_rate": 0.0004548670765574908, "loss": 5.3816, "mean_token_accuracy": 0.18621216118335723, "num_tokens": 42523436.0, "step": 19060 }, { "entropy": 5.525981807708741, "epoch": 2.1411804346605265, "grad_norm": 1.5703125, "learning_rate": 0.00045484295287015757, "loss": 5.2927, "mean_token_accuracy": 0.1896200805902481, "num_tokens": 42534777.0, "step": 19065 }, { "entropy": 5.5501199722290036, "epoch": 2.141742011568484, "grad_norm": 1.515625, "learning_rate": 0.0004548188234565551, "loss": 5.2539, "mean_token_accuracy": 0.19365346133708955, "num_tokens": 42545803.0, "step": 19070 }, { "entropy": 5.571218347549438, "epoch": 2.142303588476442, "grad_norm": 1.265625, "learning_rate": 0.00045479468831745144, "loss": 5.2811, "mean_token_accuracy": 0.18831623047590257, "num_tokens": 42556803.0, "step": 19075 }, { "entropy": 5.602970314025879, "epoch": 2.1428651653843995, "grad_norm": 1.515625, "learning_rate": 0.0004547705474536152, "loss": 5.3413, "mean_token_accuracy": 0.18605442792177201, "num_tokens": 42568357.0, "step": 19080 }, { "entropy": 5.487061882019043, "epoch": 2.1434267422923567, "grad_norm": 1.3515625, "learning_rate": 0.00045474640086581506, "loss": 5.2097, "mean_token_accuracy": 0.19671832770109177, "num_tokens": 42578990.0, "step": 19085 }, { "entropy": 5.529238843917847, "epoch": 2.1439883192003144, "grad_norm": 1.296875, "learning_rate": 0.00045472224855481975, "loss": 5.2819, "mean_token_accuracy": 0.19358625262975693, "num_tokens": 42589823.0, "step": 19090 }, { "entropy": 5.5032336711883545, "epoch": 2.144549896108272, "grad_norm": 1.234375, "learning_rate": 0.00045469809052139844, "loss": 5.2068, "mean_token_accuracy": 0.1942850321531296, "num_tokens": 42600508.0, "step": 19095 }, { "entropy": 5.481950139999389, "epoch": 2.1451114730162297, "grad_norm": 1.4296875, "learning_rate": 0.00045467392676632016, "loss": 5.2492, "mean_token_accuracy": 0.19504590183496476, "num_tokens": 42611061.0, "step": 19100 }, { "entropy": 5.525798988342285, "epoch": 2.145673049924187, "grad_norm": 1.296875, "learning_rate": 0.0004546497572903543, "loss": 5.2237, "mean_token_accuracy": 0.19559953808784486, "num_tokens": 42621936.0, "step": 19105 }, { "entropy": 5.520177984237671, "epoch": 2.1462346268321446, "grad_norm": 1.2578125, "learning_rate": 0.0004546255820942706, "loss": 5.2898, "mean_token_accuracy": 0.19541528075933456, "num_tokens": 42632880.0, "step": 19110 }, { "entropy": 5.521885728836059, "epoch": 2.1467962037401023, "grad_norm": 1.2578125, "learning_rate": 0.0004546014011788386, "loss": 5.174, "mean_token_accuracy": 0.2015230044722557, "num_tokens": 42642819.0, "step": 19115 }, { "entropy": 5.482599973678589, "epoch": 2.14735778064806, "grad_norm": 1.1953125, "learning_rate": 0.0004545772145448284, "loss": 5.2632, "mean_token_accuracy": 0.19289801716804506, "num_tokens": 42654581.0, "step": 19120 }, { "entropy": 5.525862836837769, "epoch": 2.147919357556017, "grad_norm": 1.2578125, "learning_rate": 0.00045455302219301, "loss": 5.3143, "mean_token_accuracy": 0.19050929099321365, "num_tokens": 42665323.0, "step": 19125 }, { "entropy": 5.602271509170532, "epoch": 2.148480934463975, "grad_norm": 1.296875, "learning_rate": 0.0004545288241241538, "loss": 5.3037, "mean_token_accuracy": 0.19070056080818176, "num_tokens": 42676465.0, "step": 19130 }, { "entropy": 5.487083911895752, "epoch": 2.1490425113719325, "grad_norm": 1.1328125, "learning_rate": 0.0004545046203390302, "loss": 5.2911, "mean_token_accuracy": 0.19485869854688645, "num_tokens": 42688242.0, "step": 19135 }, { "entropy": 5.505398273468018, "epoch": 2.14960408827989, "grad_norm": 1.2890625, "learning_rate": 0.00045448041083840973, "loss": 5.2802, "mean_token_accuracy": 0.19949985444545745, "num_tokens": 42699498.0, "step": 19140 }, { "entropy": 5.571474504470825, "epoch": 2.1501656651878474, "grad_norm": 1.421875, "learning_rate": 0.00045445619562306354, "loss": 5.2712, "mean_token_accuracy": 0.19473840445280075, "num_tokens": 42710330.0, "step": 19145 }, { "entropy": 5.4964793682098385, "epoch": 2.150727242095805, "grad_norm": 1.2421875, "learning_rate": 0.00045443197469376243, "loss": 5.2784, "mean_token_accuracy": 0.19105039834976195, "num_tokens": 42721210.0, "step": 19150 }, { "entropy": 5.545171403884888, "epoch": 2.1512888190037627, "grad_norm": 1.4765625, "learning_rate": 0.0004544077480512776, "loss": 5.2683, "mean_token_accuracy": 0.1932425916194916, "num_tokens": 42732272.0, "step": 19155 }, { "entropy": 5.666682529449463, "epoch": 2.15185039591172, "grad_norm": 1.4140625, "learning_rate": 0.00045438351569638055, "loss": 5.3999, "mean_token_accuracy": 0.18227856308221818, "num_tokens": 42745737.0, "step": 19160 }, { "entropy": 5.538751029968262, "epoch": 2.1524119728196776, "grad_norm": 1.1328125, "learning_rate": 0.00045435927762984277, "loss": 5.2754, "mean_token_accuracy": 0.19352304339408874, "num_tokens": 42756405.0, "step": 19165 }, { "entropy": 5.544000720977783, "epoch": 2.152973549727635, "grad_norm": 1.25, "learning_rate": 0.000454335033852436, "loss": 5.2795, "mean_token_accuracy": 0.1869244635105133, "num_tokens": 42767991.0, "step": 19170 }, { "entropy": 5.5490223407745365, "epoch": 2.153535126635593, "grad_norm": 1.1953125, "learning_rate": 0.0004543107843649322, "loss": 5.3411, "mean_token_accuracy": 0.1835654318332672, "num_tokens": 42779177.0, "step": 19175 }, { "entropy": 5.48776159286499, "epoch": 2.15409670354355, "grad_norm": 1.484375, "learning_rate": 0.0004542865291681035, "loss": 5.2396, "mean_token_accuracy": 0.2039228767156601, "num_tokens": 42789748.0, "step": 19180 }, { "entropy": 5.585640907287598, "epoch": 2.1546582804515078, "grad_norm": 1.3984375, "learning_rate": 0.00045426226826272213, "loss": 5.3021, "mean_token_accuracy": 0.19389602839946746, "num_tokens": 42802741.0, "step": 19185 }, { "entropy": 5.556554841995239, "epoch": 2.1552198573594654, "grad_norm": 1.2109375, "learning_rate": 0.0004542380016495607, "loss": 5.2857, "mean_token_accuracy": 0.18895589113235473, "num_tokens": 42813091.0, "step": 19190 }, { "entropy": 5.544634866714477, "epoch": 2.155781434267423, "grad_norm": 1.3515625, "learning_rate": 0.00045421372932939177, "loss": 5.2909, "mean_token_accuracy": 0.1943572133779526, "num_tokens": 42823711.0, "step": 19195 }, { "entropy": 5.430270099639893, "epoch": 2.1563430111753803, "grad_norm": 1.2265625, "learning_rate": 0.0004541894513029881, "loss": 5.2306, "mean_token_accuracy": 0.17984076887369155, "num_tokens": 42835057.0, "step": 19200 }, { "entropy": 5.62523398399353, "epoch": 2.156904588083338, "grad_norm": 1.2734375, "learning_rate": 0.00045416516757112286, "loss": 5.3007, "mean_token_accuracy": 0.19330391734838487, "num_tokens": 42846784.0, "step": 19205 }, { "entropy": 5.54594054222107, "epoch": 2.1574661649912956, "grad_norm": 1.359375, "learning_rate": 0.00045414087813456925, "loss": 5.2205, "mean_token_accuracy": 0.19698640555143357, "num_tokens": 42857618.0, "step": 19210 }, { "entropy": 5.509330224990845, "epoch": 2.1580277418992533, "grad_norm": 1.296875, "learning_rate": 0.0004541165829941006, "loss": 5.2704, "mean_token_accuracy": 0.1926967903971672, "num_tokens": 42869076.0, "step": 19215 }, { "entropy": 5.469746065139771, "epoch": 2.1585893188072105, "grad_norm": 1.1796875, "learning_rate": 0.0004540922821504904, "loss": 5.2445, "mean_token_accuracy": 0.19599961191415788, "num_tokens": 42879714.0, "step": 19220 }, { "entropy": 5.562300205230713, "epoch": 2.159150895715168, "grad_norm": 1.1875, "learning_rate": 0.0004540679756045125, "loss": 5.2632, "mean_token_accuracy": 0.19898033887147903, "num_tokens": 42890187.0, "step": 19225 }, { "entropy": 5.476594686508179, "epoch": 2.159712472623126, "grad_norm": 1.2421875, "learning_rate": 0.0004540436633569407, "loss": 5.212, "mean_token_accuracy": 0.195633165538311, "num_tokens": 42900713.0, "step": 19230 }, { "entropy": 5.4860940933227536, "epoch": 2.1602740495310835, "grad_norm": 1.546875, "learning_rate": 0.00045401934540854937, "loss": 5.2614, "mean_token_accuracy": 0.19223775267601012, "num_tokens": 42911703.0, "step": 19235 }, { "entropy": 5.465535259246826, "epoch": 2.1608356264390407, "grad_norm": 1.8125, "learning_rate": 0.0004539950217601127, "loss": 5.2205, "mean_token_accuracy": 0.19699688851833344, "num_tokens": 42922684.0, "step": 19240 }, { "entropy": 5.531664657592773, "epoch": 2.1613972033469984, "grad_norm": 1.21875, "learning_rate": 0.00045397069241240497, "loss": 5.2297, "mean_token_accuracy": 0.19130341410636903, "num_tokens": 42933095.0, "step": 19245 }, { "entropy": 5.508335542678833, "epoch": 2.161958780254956, "grad_norm": 1.078125, "learning_rate": 0.000453946357366201, "loss": 5.3344, "mean_token_accuracy": 0.19552526026964187, "num_tokens": 42944508.0, "step": 19250 }, { "entropy": 5.432960367202758, "epoch": 2.1625203571629132, "grad_norm": 1.390625, "learning_rate": 0.00045392201662227565, "loss": 5.1937, "mean_token_accuracy": 0.20042930394411088, "num_tokens": 42954902.0, "step": 19255 }, { "entropy": 5.507016992568969, "epoch": 2.163081934070871, "grad_norm": 1.28125, "learning_rate": 0.00045389767018140395, "loss": 5.1887, "mean_token_accuracy": 0.19380445778369904, "num_tokens": 42965165.0, "step": 19260 }, { "entropy": 5.495782041549683, "epoch": 2.1636435109788286, "grad_norm": 1.5078125, "learning_rate": 0.00045387331804436096, "loss": 5.2073, "mean_token_accuracy": 0.1978279322385788, "num_tokens": 42975025.0, "step": 19265 }, { "entropy": 5.5999737739562985, "epoch": 2.1642050878867862, "grad_norm": 1.3203125, "learning_rate": 0.0004538489602119222, "loss": 5.3737, "mean_token_accuracy": 0.1898595005273819, "num_tokens": 42986666.0, "step": 19270 }, { "entropy": 5.559444284439087, "epoch": 2.1647666647947434, "grad_norm": 1.5703125, "learning_rate": 0.0004538245966848632, "loss": 5.3116, "mean_token_accuracy": 0.1925888329744339, "num_tokens": 42998607.0, "step": 19275 }, { "entropy": 5.489432144165039, "epoch": 2.165328241702701, "grad_norm": 1.3046875, "learning_rate": 0.00045380022746395953, "loss": 5.2562, "mean_token_accuracy": 0.1940259099006653, "num_tokens": 43009969.0, "step": 19280 }, { "entropy": 5.631491947174072, "epoch": 2.1658898186106588, "grad_norm": 1.1484375, "learning_rate": 0.00045377585254998743, "loss": 5.4061, "mean_token_accuracy": 0.18729043006896973, "num_tokens": 43023255.0, "step": 19285 }, { "entropy": 5.515974521636963, "epoch": 2.1664513955186164, "grad_norm": 1.265625, "learning_rate": 0.0004537514719437228, "loss": 5.2342, "mean_token_accuracy": 0.19376095682382583, "num_tokens": 43033995.0, "step": 19290 }, { "entropy": 5.524006271362305, "epoch": 2.1670129724265736, "grad_norm": 1.1328125, "learning_rate": 0.00045372708564594196, "loss": 5.3422, "mean_token_accuracy": 0.18745407909154893, "num_tokens": 43046239.0, "step": 19295 }, { "entropy": 5.482912874221801, "epoch": 2.1675745493345313, "grad_norm": 1.1796875, "learning_rate": 0.00045370269365742143, "loss": 5.2212, "mean_token_accuracy": 0.19853470623493194, "num_tokens": 43057262.0, "step": 19300 }, { "entropy": 5.552854442596436, "epoch": 2.168136126242489, "grad_norm": 1.515625, "learning_rate": 0.00045367829597893776, "loss": 5.3334, "mean_token_accuracy": 0.1878657042980194, "num_tokens": 43068495.0, "step": 19305 }, { "entropy": 5.47726035118103, "epoch": 2.1686977031504466, "grad_norm": 1.234375, "learning_rate": 0.00045365389261126793, "loss": 5.2281, "mean_token_accuracy": 0.19548221826553344, "num_tokens": 43080706.0, "step": 19310 }, { "entropy": 5.40993070602417, "epoch": 2.169259280058404, "grad_norm": 1.234375, "learning_rate": 0.00045362948355518883, "loss": 5.2152, "mean_token_accuracy": 0.2017691984772682, "num_tokens": 43091444.0, "step": 19315 }, { "entropy": 5.591124582290649, "epoch": 2.1698208569663615, "grad_norm": 1.3046875, "learning_rate": 0.0004536050688114777, "loss": 5.3168, "mean_token_accuracy": 0.18960983604192733, "num_tokens": 43103648.0, "step": 19320 }, { "entropy": 5.622720718383789, "epoch": 2.170382433874319, "grad_norm": 1.3203125, "learning_rate": 0.00045358064838091187, "loss": 5.3027, "mean_token_accuracy": 0.1937421292066574, "num_tokens": 43116183.0, "step": 19325 }, { "entropy": 5.513739442825317, "epoch": 2.170944010782277, "grad_norm": 1.25, "learning_rate": 0.00045355622226426903, "loss": 5.2599, "mean_token_accuracy": 0.19330281019210815, "num_tokens": 43126557.0, "step": 19330 }, { "entropy": 5.492511558532715, "epoch": 2.171505587690234, "grad_norm": 1.40625, "learning_rate": 0.00045353179046232674, "loss": 5.2923, "mean_token_accuracy": 0.18933189362287522, "num_tokens": 43137753.0, "step": 19335 }, { "entropy": 5.576199960708618, "epoch": 2.1720671645981917, "grad_norm": 1.34375, "learning_rate": 0.000453507352975863, "loss": 5.3037, "mean_token_accuracy": 0.19113630056381226, "num_tokens": 43148461.0, "step": 19340 }, { "entropy": 5.485734653472901, "epoch": 2.1726287415061494, "grad_norm": 1.296875, "learning_rate": 0.00045348290980565595, "loss": 5.2074, "mean_token_accuracy": 0.19547132551670074, "num_tokens": 43161174.0, "step": 19345 }, { "entropy": 5.534107446670532, "epoch": 2.1731903184141066, "grad_norm": 1.2578125, "learning_rate": 0.00045345846095248376, "loss": 5.3086, "mean_token_accuracy": 0.18765278458595275, "num_tokens": 43172844.0, "step": 19350 }, { "entropy": 5.435306215286255, "epoch": 2.1737518953220643, "grad_norm": 1.3828125, "learning_rate": 0.00045343400641712503, "loss": 5.1853, "mean_token_accuracy": 0.19814585745334626, "num_tokens": 43183476.0, "step": 19355 }, { "entropy": 5.5760307788848875, "epoch": 2.174313472230022, "grad_norm": 1.25, "learning_rate": 0.00045340954620035827, "loss": 5.2708, "mean_token_accuracy": 0.18906071782112122, "num_tokens": 43195563.0, "step": 19360 }, { "entropy": 5.560254907608032, "epoch": 2.1748750491379796, "grad_norm": 1.4765625, "learning_rate": 0.00045338508030296246, "loss": 5.3118, "mean_token_accuracy": 0.19427053928375243, "num_tokens": 43206067.0, "step": 19365 }, { "entropy": 5.569857263565064, "epoch": 2.175436626045937, "grad_norm": 1.21875, "learning_rate": 0.00045336060872571646, "loss": 5.2062, "mean_token_accuracy": 0.20014894902706146, "num_tokens": 43216912.0, "step": 19370 }, { "entropy": 5.59420075416565, "epoch": 2.1759982029538945, "grad_norm": 1.2578125, "learning_rate": 0.0004533361314693994, "loss": 5.262, "mean_token_accuracy": 0.19414740800857544, "num_tokens": 43228746.0, "step": 19375 }, { "entropy": 5.496267700195313, "epoch": 2.176559779861852, "grad_norm": 1.2734375, "learning_rate": 0.00045331164853479084, "loss": 5.2727, "mean_token_accuracy": 0.18966237902641297, "num_tokens": 43241228.0, "step": 19380 }, { "entropy": 5.47652006149292, "epoch": 2.17712135676981, "grad_norm": 1.1953125, "learning_rate": 0.00045328715992267024, "loss": 5.3169, "mean_token_accuracy": 0.19196716099977493, "num_tokens": 43252916.0, "step": 19385 }, { "entropy": 5.528986120223999, "epoch": 2.177682933677767, "grad_norm": 1.2890625, "learning_rate": 0.00045326266563381734, "loss": 5.1475, "mean_token_accuracy": 0.20205250829458238, "num_tokens": 43264357.0, "step": 19390 }, { "entropy": 5.483857774734497, "epoch": 2.1782445105857247, "grad_norm": 1.265625, "learning_rate": 0.00045323816566901205, "loss": 5.2905, "mean_token_accuracy": 0.19976740777492524, "num_tokens": 43274547.0, "step": 19395 }, { "entropy": 5.432673501968384, "epoch": 2.1788060874936823, "grad_norm": 1.265625, "learning_rate": 0.0004532136600290343, "loss": 5.1778, "mean_token_accuracy": 0.1993179976940155, "num_tokens": 43284225.0, "step": 19400 }, { "entropy": 5.515079498291016, "epoch": 2.17936766440164, "grad_norm": 1.4765625, "learning_rate": 0.0004531891487146646, "loss": 5.2657, "mean_token_accuracy": 0.19107242226600646, "num_tokens": 43295218.0, "step": 19405 }, { "entropy": 5.449270248413086, "epoch": 2.179929241309597, "grad_norm": 1.453125, "learning_rate": 0.0004531646317266833, "loss": 5.2055, "mean_token_accuracy": 0.19958023428916932, "num_tokens": 43305169.0, "step": 19410 }, { "entropy": 5.487324333190918, "epoch": 2.180490818217555, "grad_norm": 1.234375, "learning_rate": 0.00045314010906587096, "loss": 5.1992, "mean_token_accuracy": 0.19760687202215194, "num_tokens": 43317119.0, "step": 19415 }, { "entropy": 5.540035152435303, "epoch": 2.1810523951255125, "grad_norm": 1.1953125, "learning_rate": 0.00045311558073300853, "loss": 5.2468, "mean_token_accuracy": 0.19819342941045762, "num_tokens": 43327800.0, "step": 19420 }, { "entropy": 5.427812194824218, "epoch": 2.18161397203347, "grad_norm": 1.359375, "learning_rate": 0.0004530910467288769, "loss": 5.167, "mean_token_accuracy": 0.19073342978954316, "num_tokens": 43338607.0, "step": 19425 }, { "entropy": 5.5063619136810305, "epoch": 2.1821755489414274, "grad_norm": 1.7578125, "learning_rate": 0.00045306650705425727, "loss": 5.2748, "mean_token_accuracy": 0.2007783278822899, "num_tokens": 43350621.0, "step": 19430 }, { "entropy": 5.451795053482056, "epoch": 2.182737125849385, "grad_norm": 1.375, "learning_rate": 0.00045304196170993093, "loss": 5.2293, "mean_token_accuracy": 0.19908606112003327, "num_tokens": 43360327.0, "step": 19435 }, { "entropy": 5.433092975616455, "epoch": 2.1832987027573427, "grad_norm": 1.2734375, "learning_rate": 0.0004530174106966795, "loss": 5.2496, "mean_token_accuracy": 0.19363509863615036, "num_tokens": 43371538.0, "step": 19440 }, { "entropy": 5.579623603820801, "epoch": 2.1838602796653, "grad_norm": 2.09375, "learning_rate": 0.00045299285401528475, "loss": 5.2938, "mean_token_accuracy": 0.1886764571070671, "num_tokens": 43381818.0, "step": 19445 }, { "entropy": 5.508121538162231, "epoch": 2.1844218565732576, "grad_norm": 1.265625, "learning_rate": 0.0004529682916665285, "loss": 5.2413, "mean_token_accuracy": 0.18868270218372346, "num_tokens": 43391977.0, "step": 19450 }, { "entropy": 5.557366466522216, "epoch": 2.1849834334812153, "grad_norm": 1.21875, "learning_rate": 0.00045294372365119276, "loss": 5.2948, "mean_token_accuracy": 0.19008123278617858, "num_tokens": 43403657.0, "step": 19455 }, { "entropy": 5.4605669498443605, "epoch": 2.185545010389173, "grad_norm": 1.265625, "learning_rate": 0.0004529191499700598, "loss": 5.1872, "mean_token_accuracy": 0.1950461596250534, "num_tokens": 43414325.0, "step": 19460 }, { "entropy": 5.612634515762329, "epoch": 2.18610658729713, "grad_norm": 1.28125, "learning_rate": 0.0004528945706239122, "loss": 5.3737, "mean_token_accuracy": 0.1871746674180031, "num_tokens": 43425864.0, "step": 19465 }, { "entropy": 5.569682264328003, "epoch": 2.186668164205088, "grad_norm": 1.1953125, "learning_rate": 0.00045286998561353236, "loss": 5.2945, "mean_token_accuracy": 0.19014448523521424, "num_tokens": 43437135.0, "step": 19470 }, { "entropy": 5.616008567810058, "epoch": 2.1872297411130455, "grad_norm": 1.109375, "learning_rate": 0.0004528453949397033, "loss": 5.3293, "mean_token_accuracy": 0.19414877742528916, "num_tokens": 43448603.0, "step": 19475 }, { "entropy": 5.4768781661987305, "epoch": 2.187791318021003, "grad_norm": 1.2421875, "learning_rate": 0.00045282079860320786, "loss": 5.1723, "mean_token_accuracy": 0.20090740621089936, "num_tokens": 43460316.0, "step": 19480 }, { "entropy": 5.444617891311646, "epoch": 2.1883528949289603, "grad_norm": 1.203125, "learning_rate": 0.00045279619660482925, "loss": 5.24, "mean_token_accuracy": 0.19947486370801926, "num_tokens": 43471869.0, "step": 19485 }, { "entropy": 5.498412704467773, "epoch": 2.188914471836918, "grad_norm": 1.203125, "learning_rate": 0.00045277158894535075, "loss": 5.3088, "mean_token_accuracy": 0.19135208129882814, "num_tokens": 43484004.0, "step": 19490 }, { "entropy": 5.5440808773040775, "epoch": 2.1894760487448757, "grad_norm": 1.2578125, "learning_rate": 0.00045274697562555584, "loss": 5.2708, "mean_token_accuracy": 0.19465432912111283, "num_tokens": 43494401.0, "step": 19495 }, { "entropy": 5.435019683837891, "epoch": 2.1900376256528333, "grad_norm": 1.3046875, "learning_rate": 0.0004527223566462284, "loss": 5.2078, "mean_token_accuracy": 0.19536787867546082, "num_tokens": 43505437.0, "step": 19500 }, { "entropy": 5.445728874206543, "epoch": 2.1905992025607905, "grad_norm": 1.265625, "learning_rate": 0.0004526977320081522, "loss": 5.1652, "mean_token_accuracy": 0.2000671371817589, "num_tokens": 43516177.0, "step": 19505 }, { "entropy": 5.536247062683105, "epoch": 2.191160779468748, "grad_norm": 1.171875, "learning_rate": 0.0004526731017121111, "loss": 5.249, "mean_token_accuracy": 0.19590997099876403, "num_tokens": 43527070.0, "step": 19510 }, { "entropy": 5.512525987625122, "epoch": 2.191722356376706, "grad_norm": 1.1328125, "learning_rate": 0.00045264846575888973, "loss": 5.2887, "mean_token_accuracy": 0.19077699780464172, "num_tokens": 43538247.0, "step": 19515 }, { "entropy": 5.5083921432495115, "epoch": 2.1922839332846635, "grad_norm": 1.2421875, "learning_rate": 0.00045262382414927235, "loss": 5.2159, "mean_token_accuracy": 0.19949048310518264, "num_tokens": 43549994.0, "step": 19520 }, { "entropy": 5.587218761444092, "epoch": 2.1928455101926208, "grad_norm": 1.2265625, "learning_rate": 0.00045259917688404336, "loss": 5.3478, "mean_token_accuracy": 0.18835411220788956, "num_tokens": 43562171.0, "step": 19525 }, { "entropy": 5.538046073913574, "epoch": 2.1934070871005784, "grad_norm": 1.234375, "learning_rate": 0.0004525745239639877, "loss": 5.2338, "mean_token_accuracy": 0.1900772526860237, "num_tokens": 43572308.0, "step": 19530 }, { "entropy": 5.439638900756836, "epoch": 2.193968664008536, "grad_norm": 1.421875, "learning_rate": 0.00045254986538989045, "loss": 5.2285, "mean_token_accuracy": 0.1969294786453247, "num_tokens": 43583565.0, "step": 19535 }, { "entropy": 5.52717399597168, "epoch": 2.1945302409164933, "grad_norm": 1.4765625, "learning_rate": 0.0004525252011625366, "loss": 5.3539, "mean_token_accuracy": 0.19046106040477753, "num_tokens": 43595921.0, "step": 19540 }, { "entropy": 5.534983587265015, "epoch": 2.195091817824451, "grad_norm": 1.3203125, "learning_rate": 0.0004525005312827114, "loss": 5.2135, "mean_token_accuracy": 0.1939015194773674, "num_tokens": 43606957.0, "step": 19545 }, { "entropy": 5.460388612747193, "epoch": 2.1956533947324086, "grad_norm": 1.2109375, "learning_rate": 0.0004524758557512005, "loss": 5.1451, "mean_token_accuracy": 0.1989664301276207, "num_tokens": 43616983.0, "step": 19550 }, { "entropy": 5.371473550796509, "epoch": 2.1962149716403663, "grad_norm": 1.25, "learning_rate": 0.0004524511745687895, "loss": 5.0985, "mean_token_accuracy": 0.20401592552661896, "num_tokens": 43626951.0, "step": 19555 }, { "entropy": 5.467970275878907, "epoch": 2.1967765485483235, "grad_norm": 1.640625, "learning_rate": 0.0004524264877362643, "loss": 5.2212, "mean_token_accuracy": 0.19011069536209108, "num_tokens": 43638446.0, "step": 19560 }, { "entropy": 5.563729953765869, "epoch": 2.197338125456281, "grad_norm": 1.28125, "learning_rate": 0.00045240179525441094, "loss": 5.298, "mean_token_accuracy": 0.19505397528409957, "num_tokens": 43649646.0, "step": 19565 }, { "entropy": 5.522436189651489, "epoch": 2.197899702364239, "grad_norm": 1.4765625, "learning_rate": 0.0004523770971240156, "loss": 5.3053, "mean_token_accuracy": 0.1905547097325325, "num_tokens": 43661633.0, "step": 19570 }, { "entropy": 5.519252109527588, "epoch": 2.1984612792721965, "grad_norm": 1.25, "learning_rate": 0.0004523523933458647, "loss": 5.2681, "mean_token_accuracy": 0.19578531235456467, "num_tokens": 43672671.0, "step": 19575 }, { "entropy": 5.544933891296386, "epoch": 2.1990228561801537, "grad_norm": 1.203125, "learning_rate": 0.0004523276839207448, "loss": 5.2544, "mean_token_accuracy": 0.1938066765666008, "num_tokens": 43683426.0, "step": 19580 }, { "entropy": 5.501959133148193, "epoch": 2.1995844330881114, "grad_norm": 1.3515625, "learning_rate": 0.00045230296884944264, "loss": 5.3057, "mean_token_accuracy": 0.19192762821912765, "num_tokens": 43694460.0, "step": 19585 }, { "entropy": 5.433472204208374, "epoch": 2.200146009996069, "grad_norm": 1.2421875, "learning_rate": 0.00045227824813274517, "loss": 5.1042, "mean_token_accuracy": 0.19947481900453568, "num_tokens": 43706047.0, "step": 19590 }, { "entropy": 5.42898736000061, "epoch": 2.2007075869040267, "grad_norm": 1.1796875, "learning_rate": 0.0004522535217714396, "loss": 5.2102, "mean_token_accuracy": 0.19789150953292847, "num_tokens": 43715879.0, "step": 19595 }, { "entropy": 5.480247116088867, "epoch": 2.201269163811984, "grad_norm": 1.265625, "learning_rate": 0.0004522287897663131, "loss": 5.2518, "mean_token_accuracy": 0.1936460942029953, "num_tokens": 43726870.0, "step": 19600 }, { "entropy": 5.516616773605347, "epoch": 2.2018307407199416, "grad_norm": 1.4140625, "learning_rate": 0.00045220405211815327, "loss": 5.2939, "mean_token_accuracy": 0.18914685398340225, "num_tokens": 43739116.0, "step": 19605 }, { "entropy": 5.528266954421997, "epoch": 2.202392317627899, "grad_norm": 1.4765625, "learning_rate": 0.00045217930882774754, "loss": 5.2623, "mean_token_accuracy": 0.19535401314496995, "num_tokens": 43750239.0, "step": 19610 }, { "entropy": 5.587613439559936, "epoch": 2.202953894535857, "grad_norm": 1.296875, "learning_rate": 0.00045215455989588396, "loss": 5.3587, "mean_token_accuracy": 0.19037794768810273, "num_tokens": 43762391.0, "step": 19615 }, { "entropy": 5.461773538589478, "epoch": 2.203515471443814, "grad_norm": 1.3359375, "learning_rate": 0.00045212980532335055, "loss": 5.2609, "mean_token_accuracy": 0.19787550270557402, "num_tokens": 43773514.0, "step": 19620 }, { "entropy": 5.482375383377075, "epoch": 2.2040770483517718, "grad_norm": 1.40625, "learning_rate": 0.00045210504511093534, "loss": 5.2409, "mean_token_accuracy": 0.18991211652755738, "num_tokens": 43784617.0, "step": 19625 }, { "entropy": 5.592576026916504, "epoch": 2.2046386252597294, "grad_norm": 1.4375, "learning_rate": 0.0004520802792594269, "loss": 5.3333, "mean_token_accuracy": 0.19061177223920822, "num_tokens": 43795396.0, "step": 19630 }, { "entropy": 5.5489280223846436, "epoch": 2.2052002021676866, "grad_norm": 1.1953125, "learning_rate": 0.00045205550776961366, "loss": 5.2761, "mean_token_accuracy": 0.18839634358882903, "num_tokens": 43805512.0, "step": 19635 }, { "entropy": 5.564304447174072, "epoch": 2.2057617790756443, "grad_norm": 1.203125, "learning_rate": 0.0004520307306422844, "loss": 5.3972, "mean_token_accuracy": 0.1884940579533577, "num_tokens": 43815874.0, "step": 19640 }, { "entropy": 5.5941956520080565, "epoch": 2.206323355983602, "grad_norm": 1.328125, "learning_rate": 0.00045200594787822795, "loss": 5.3185, "mean_token_accuracy": 0.18378949761390687, "num_tokens": 43827948.0, "step": 19645 }, { "entropy": 5.535559368133545, "epoch": 2.2068849328915596, "grad_norm": 1.25, "learning_rate": 0.0004519811594782335, "loss": 5.1839, "mean_token_accuracy": 0.19542222768068312, "num_tokens": 43838306.0, "step": 19650 }, { "entropy": 5.485494756698609, "epoch": 2.207446509799517, "grad_norm": 1.3046875, "learning_rate": 0.00045195636544309033, "loss": 5.2243, "mean_token_accuracy": 0.19710462540388107, "num_tokens": 43848716.0, "step": 19655 }, { "entropy": 5.551632356643677, "epoch": 2.2080080867074745, "grad_norm": 1.296875, "learning_rate": 0.00045193156577358784, "loss": 5.3156, "mean_token_accuracy": 0.19411621540784835, "num_tokens": 43859707.0, "step": 19660 }, { "entropy": 5.48183274269104, "epoch": 2.208569663615432, "grad_norm": 1.1328125, "learning_rate": 0.0004519067604705157, "loss": 5.1787, "mean_token_accuracy": 0.20226583778858184, "num_tokens": 43870599.0, "step": 19665 }, { "entropy": 5.541427850723267, "epoch": 2.20913124052339, "grad_norm": 1.203125, "learning_rate": 0.00045188194953466363, "loss": 5.2715, "mean_token_accuracy": 0.19070045202970504, "num_tokens": 43881843.0, "step": 19670 }, { "entropy": 5.483605813980103, "epoch": 2.209692817431347, "grad_norm": 1.078125, "learning_rate": 0.00045185713296682175, "loss": 5.164, "mean_token_accuracy": 0.1961521476507187, "num_tokens": 43892206.0, "step": 19675 }, { "entropy": 5.513283586502075, "epoch": 2.2102543943393047, "grad_norm": 1.359375, "learning_rate": 0.00045183231076778005, "loss": 5.2411, "mean_token_accuracy": 0.19523411244153976, "num_tokens": 43905255.0, "step": 19680 }, { "entropy": 5.473288345336914, "epoch": 2.2108159712472624, "grad_norm": 1.4453125, "learning_rate": 0.00045180748293832906, "loss": 5.3078, "mean_token_accuracy": 0.18868002742528917, "num_tokens": 43917774.0, "step": 19685 }, { "entropy": 5.468965673446656, "epoch": 2.21137754815522, "grad_norm": 1.359375, "learning_rate": 0.00045178264947925924, "loss": 5.2187, "mean_token_accuracy": 0.20265576839447022, "num_tokens": 43929127.0, "step": 19690 }, { "entropy": 5.583199739456177, "epoch": 2.2119391250631772, "grad_norm": 1.1640625, "learning_rate": 0.00045175781039136133, "loss": 5.2709, "mean_token_accuracy": 0.18844543993473054, "num_tokens": 43942558.0, "step": 19695 }, { "entropy": 5.471088981628418, "epoch": 2.212500701971135, "grad_norm": 1.296875, "learning_rate": 0.0004517329656754261, "loss": 5.2716, "mean_token_accuracy": 0.1902107387781143, "num_tokens": 43952966.0, "step": 19700 }, { "entropy": 5.564641714096069, "epoch": 2.2130622788790926, "grad_norm": 1.453125, "learning_rate": 0.0004517081153322448, "loss": 5.2755, "mean_token_accuracy": 0.19167562574148178, "num_tokens": 43964725.0, "step": 19705 }, { "entropy": 5.51898226737976, "epoch": 2.2136238557870502, "grad_norm": 1.234375, "learning_rate": 0.0004516832593626085, "loss": 5.1585, "mean_token_accuracy": 0.2001033678650856, "num_tokens": 43976356.0, "step": 19710 }, { "entropy": 5.399066019058227, "epoch": 2.2141854326950074, "grad_norm": 1.2734375, "learning_rate": 0.0004516583977673087, "loss": 5.2039, "mean_token_accuracy": 0.1964070677757263, "num_tokens": 43987732.0, "step": 19715 }, { "entropy": 5.535548686981201, "epoch": 2.214747009602965, "grad_norm": 1.203125, "learning_rate": 0.00045163353054713704, "loss": 5.3434, "mean_token_accuracy": 0.18696456402540207, "num_tokens": 43998701.0, "step": 19720 }, { "entropy": 5.634602832794189, "epoch": 2.2153085865109228, "grad_norm": 1.203125, "learning_rate": 0.0004516086577028852, "loss": 5.2706, "mean_token_accuracy": 0.1942870184779167, "num_tokens": 44008978.0, "step": 19725 }, { "entropy": 5.499393081665039, "epoch": 2.21587016341888, "grad_norm": 1.453125, "learning_rate": 0.0004515837792353453, "loss": 5.2563, "mean_token_accuracy": 0.19361717849969864, "num_tokens": 44018928.0, "step": 19730 }, { "entropy": 5.452484560012818, "epoch": 2.2164317403268377, "grad_norm": 1.515625, "learning_rate": 0.0004515588951453093, "loss": 5.2428, "mean_token_accuracy": 0.1916105180978775, "num_tokens": 44030044.0, "step": 19735 }, { "entropy": 5.396527433395386, "epoch": 2.2169933172347953, "grad_norm": 1.2734375, "learning_rate": 0.0004515340054335696, "loss": 5.1809, "mean_token_accuracy": 0.19517827033996582, "num_tokens": 44041851.0, "step": 19740 }, { "entropy": 5.490589284896851, "epoch": 2.217554894142753, "grad_norm": 1.1640625, "learning_rate": 0.0004515091101009188, "loss": 5.1613, "mean_token_accuracy": 0.19913836121559142, "num_tokens": 44051871.0, "step": 19745 }, { "entropy": 5.524836778640747, "epoch": 2.21811647105071, "grad_norm": 1.2421875, "learning_rate": 0.0004514842091481493, "loss": 5.3633, "mean_token_accuracy": 0.18144014328718186, "num_tokens": 44063222.0, "step": 19750 }, { "entropy": 5.620134353637695, "epoch": 2.218678047958668, "grad_norm": 1.34375, "learning_rate": 0.0004514593025760543, "loss": 5.3185, "mean_token_accuracy": 0.19031717330217363, "num_tokens": 44075020.0, "step": 19755 }, { "entropy": 5.52335376739502, "epoch": 2.2192396248666255, "grad_norm": 1.15625, "learning_rate": 0.00045143439038542653, "loss": 5.2453, "mean_token_accuracy": 0.1905816301703453, "num_tokens": 44086696.0, "step": 19760 }, { "entropy": 5.5227399349212645, "epoch": 2.219801201774583, "grad_norm": 1.265625, "learning_rate": 0.0004514094725770594, "loss": 5.2048, "mean_token_accuracy": 0.1949351578950882, "num_tokens": 44096768.0, "step": 19765 }, { "entropy": 5.469168615341187, "epoch": 2.2203627786825404, "grad_norm": 1.1953125, "learning_rate": 0.00045138454915174625, "loss": 5.2209, "mean_token_accuracy": 0.2001909077167511, "num_tokens": 44108008.0, "step": 19770 }, { "entropy": 5.481593942642212, "epoch": 2.220924355590498, "grad_norm": 1.8125, "learning_rate": 0.00045135962011028064, "loss": 5.179, "mean_token_accuracy": 0.1917398080229759, "num_tokens": 44119231.0, "step": 19775 }, { "entropy": 5.4186042785644535, "epoch": 2.2214859324984557, "grad_norm": 1.234375, "learning_rate": 0.0004513346854534564, "loss": 5.1678, "mean_token_accuracy": 0.19441763311624527, "num_tokens": 44129264.0, "step": 19780 }, { "entropy": 5.50796217918396, "epoch": 2.2220475094064134, "grad_norm": 1.21875, "learning_rate": 0.0004513097451820673, "loss": 5.3098, "mean_token_accuracy": 0.19406169652938843, "num_tokens": 44141234.0, "step": 19785 }, { "entropy": 5.545570611953735, "epoch": 2.2226090863143706, "grad_norm": 1.734375, "learning_rate": 0.00045128479929690756, "loss": 5.1761, "mean_token_accuracy": 0.20019723176956178, "num_tokens": 44151751.0, "step": 19790 }, { "entropy": 5.376328468322754, "epoch": 2.2231706632223283, "grad_norm": 1.4609375, "learning_rate": 0.0004512598477987714, "loss": 5.1131, "mean_token_accuracy": 0.19938686341047288, "num_tokens": 44162687.0, "step": 19795 }, { "entropy": 5.472272872924805, "epoch": 2.223732240130286, "grad_norm": 1.2421875, "learning_rate": 0.00045123489068845334, "loss": 5.1861, "mean_token_accuracy": 0.19867129176855086, "num_tokens": 44173758.0, "step": 19800 }, { "entropy": 5.488106441497803, "epoch": 2.2242938170382436, "grad_norm": 1.21875, "learning_rate": 0.00045120992796674804, "loss": 5.2227, "mean_token_accuracy": 0.1970738038420677, "num_tokens": 44184176.0, "step": 19805 }, { "entropy": 5.5556807041168215, "epoch": 2.224855393946201, "grad_norm": 1.359375, "learning_rate": 0.0004511849596344503, "loss": 5.2982, "mean_token_accuracy": 0.1883039206266403, "num_tokens": 44195155.0, "step": 19810 }, { "entropy": 5.601989316940307, "epoch": 2.2254169708541585, "grad_norm": 1.21875, "learning_rate": 0.00045115998569235507, "loss": 5.3327, "mean_token_accuracy": 0.18982167840003966, "num_tokens": 44207139.0, "step": 19815 }, { "entropy": 5.55784125328064, "epoch": 2.225978547762116, "grad_norm": 1.234375, "learning_rate": 0.00045113500614125756, "loss": 5.2924, "mean_token_accuracy": 0.19552985280752183, "num_tokens": 44218317.0, "step": 19820 }, { "entropy": 5.513452816009521, "epoch": 2.2265401246700733, "grad_norm": 1.28125, "learning_rate": 0.0004511100209819532, "loss": 5.2196, "mean_token_accuracy": 0.20117057114839554, "num_tokens": 44228700.0, "step": 19825 }, { "entropy": 5.381744909286499, "epoch": 2.227101701578031, "grad_norm": 1.140625, "learning_rate": 0.00045108503021523737, "loss": 5.1642, "mean_token_accuracy": 0.2060288295149803, "num_tokens": 44239991.0, "step": 19830 }, { "entropy": 5.341881990432739, "epoch": 2.2276632784859887, "grad_norm": 1.28125, "learning_rate": 0.00045106003384190604, "loss": 5.0701, "mean_token_accuracy": 0.20321475267410277, "num_tokens": 44250224.0, "step": 19835 }, { "entropy": 5.462254285812378, "epoch": 2.2282248553939463, "grad_norm": 1.28125, "learning_rate": 0.00045103503186275486, "loss": 5.2653, "mean_token_accuracy": 0.1943323627114296, "num_tokens": 44261403.0, "step": 19840 }, { "entropy": 5.443727731704712, "epoch": 2.2287864323019035, "grad_norm": 1.2734375, "learning_rate": 0.00045101002427857997, "loss": 5.1813, "mean_token_accuracy": 0.19533726274967195, "num_tokens": 44272935.0, "step": 19845 }, { "entropy": 5.4540385723114015, "epoch": 2.229348009209861, "grad_norm": 1.2578125, "learning_rate": 0.00045098501109017765, "loss": 5.1805, "mean_token_accuracy": 0.20066781789064408, "num_tokens": 44283458.0, "step": 19850 }, { "entropy": 5.448845720291137, "epoch": 2.229909586117819, "grad_norm": 1.5078125, "learning_rate": 0.00045095999229834437, "loss": 5.194, "mean_token_accuracy": 0.19300126135349274, "num_tokens": 44294847.0, "step": 19855 }, { "entropy": 5.503479719161987, "epoch": 2.2304711630257765, "grad_norm": 1.2890625, "learning_rate": 0.0004509349679038767, "loss": 5.3141, "mean_token_accuracy": 0.1934979274868965, "num_tokens": 44306395.0, "step": 19860 }, { "entropy": 5.52719554901123, "epoch": 2.2310327399337337, "grad_norm": 1.2578125, "learning_rate": 0.00045090993790757137, "loss": 5.2291, "mean_token_accuracy": 0.19407544285058975, "num_tokens": 44317452.0, "step": 19865 }, { "entropy": 5.47685546875, "epoch": 2.2315943168416914, "grad_norm": 1.375, "learning_rate": 0.0004508849023102253, "loss": 5.2109, "mean_token_accuracy": 0.20183431953191758, "num_tokens": 44329862.0, "step": 19870 }, { "entropy": 5.507463693618774, "epoch": 2.232155893749649, "grad_norm": 1.2109375, "learning_rate": 0.0004508598611126359, "loss": 5.2912, "mean_token_accuracy": 0.19494223594665527, "num_tokens": 44340334.0, "step": 19875 }, { "entropy": 5.570824003219604, "epoch": 2.2327174706576067, "grad_norm": 1.28125, "learning_rate": 0.0004508348143156002, "loss": 5.3593, "mean_token_accuracy": 0.18573096096515657, "num_tokens": 44351810.0, "step": 19880 }, { "entropy": 5.6180867671966555, "epoch": 2.233279047565564, "grad_norm": 1.2890625, "learning_rate": 0.00045080976191991587, "loss": 5.4113, "mean_token_accuracy": 0.18101848810911178, "num_tokens": 44365143.0, "step": 19885 }, { "entropy": 5.504892826080322, "epoch": 2.2338406244735216, "grad_norm": 1.28125, "learning_rate": 0.0004507847039263805, "loss": 5.29, "mean_token_accuracy": 0.19741635918617248, "num_tokens": 44375895.0, "step": 19890 }, { "entropy": 5.499074125289917, "epoch": 2.2344022013814793, "grad_norm": 1.2421875, "learning_rate": 0.000450759640335792, "loss": 5.188, "mean_token_accuracy": 0.19528525769710542, "num_tokens": 44387378.0, "step": 19895 }, { "entropy": 5.442280435562134, "epoch": 2.234963778289437, "grad_norm": 1.2890625, "learning_rate": 0.0004507345711489484, "loss": 5.1585, "mean_token_accuracy": 0.20831980258226396, "num_tokens": 44398460.0, "step": 19900 }, { "entropy": 5.422170114517212, "epoch": 2.235525355197394, "grad_norm": 1.3515625, "learning_rate": 0.00045070949636664785, "loss": 5.1875, "mean_token_accuracy": 0.19626613408327104, "num_tokens": 44409885.0, "step": 19905 }, { "entropy": 5.440979242324829, "epoch": 2.236086932105352, "grad_norm": 1.328125, "learning_rate": 0.0004506844159896888, "loss": 5.1271, "mean_token_accuracy": 0.20281644463539122, "num_tokens": 44420897.0, "step": 19910 }, { "entropy": 5.553892469406128, "epoch": 2.2366485090133095, "grad_norm": 1.4296875, "learning_rate": 0.0004506593300188698, "loss": 5.3214, "mean_token_accuracy": 0.188603737950325, "num_tokens": 44432691.0, "step": 19915 }, { "entropy": 5.532892465591431, "epoch": 2.2372100859212667, "grad_norm": 1.25, "learning_rate": 0.0004506342384549897, "loss": 5.2373, "mean_token_accuracy": 0.19359887689352034, "num_tokens": 44444731.0, "step": 19920 }, { "entropy": 5.584154844284058, "epoch": 2.2377716628292244, "grad_norm": 1.2890625, "learning_rate": 0.0004506091412988472, "loss": 5.2339, "mean_token_accuracy": 0.20170113146305085, "num_tokens": 44456959.0, "step": 19925 }, { "entropy": 5.5804445266723635, "epoch": 2.238333239737182, "grad_norm": 1.3671875, "learning_rate": 0.00045058403855124165, "loss": 5.2942, "mean_token_accuracy": 0.19498781263828277, "num_tokens": 44468970.0, "step": 19930 }, { "entropy": 5.452075576782226, "epoch": 2.2388948166451397, "grad_norm": 1.28125, "learning_rate": 0.0004505589302129721, "loss": 5.1701, "mean_token_accuracy": 0.20246293842792512, "num_tokens": 44480485.0, "step": 19935 }, { "entropy": 5.51645679473877, "epoch": 2.239456393553097, "grad_norm": 1.2265625, "learning_rate": 0.0004505338162848382, "loss": 5.338, "mean_token_accuracy": 0.19500317871570588, "num_tokens": 44492890.0, "step": 19940 }, { "entropy": 5.5942668437957765, "epoch": 2.2400179704610546, "grad_norm": 1.25, "learning_rate": 0.0004505086967676395, "loss": 5.4195, "mean_token_accuracy": 0.18069773763418198, "num_tokens": 44504743.0, "step": 19945 }, { "entropy": 5.570518827438354, "epoch": 2.240579547369012, "grad_norm": 1.21875, "learning_rate": 0.0004504835716621757, "loss": 5.2083, "mean_token_accuracy": 0.19530122280120848, "num_tokens": 44514998.0, "step": 19950 }, { "entropy": 5.438938236236572, "epoch": 2.24114112427697, "grad_norm": 1.3125, "learning_rate": 0.0004504584409692471, "loss": 5.1848, "mean_token_accuracy": 0.20347164571285248, "num_tokens": 44527530.0, "step": 19955 }, { "entropy": 5.556153011322022, "epoch": 2.241702701184927, "grad_norm": 1.1171875, "learning_rate": 0.00045043330468965364, "loss": 5.3963, "mean_token_accuracy": 0.1878069669008255, "num_tokens": 44540939.0, "step": 19960 }, { "entropy": 5.589362144470215, "epoch": 2.2422642780928848, "grad_norm": 1.3046875, "learning_rate": 0.00045040816282419566, "loss": 5.2659, "mean_token_accuracy": 0.19184372276067735, "num_tokens": 44551557.0, "step": 19965 }, { "entropy": 5.439628791809082, "epoch": 2.2428258550008424, "grad_norm": 1.25, "learning_rate": 0.00045038301537367374, "loss": 5.1595, "mean_token_accuracy": 0.19913299679756163, "num_tokens": 44561969.0, "step": 19970 }, { "entropy": 5.372342681884765, "epoch": 2.2433874319088, "grad_norm": 1.2421875, "learning_rate": 0.00045035786233888864, "loss": 5.1541, "mean_token_accuracy": 0.19579712003469468, "num_tokens": 44573542.0, "step": 19975 }, { "entropy": 5.559537076950074, "epoch": 2.2439490088167573, "grad_norm": 1.3203125, "learning_rate": 0.00045033270372064123, "loss": 5.2257, "mean_token_accuracy": 0.204598106443882, "num_tokens": 44583720.0, "step": 19980 }, { "entropy": 5.485935354232788, "epoch": 2.244510585724715, "grad_norm": 1.28125, "learning_rate": 0.00045030753951973243, "loss": 5.3023, "mean_token_accuracy": 0.1947477087378502, "num_tokens": 44595314.0, "step": 19985 }, { "entropy": 5.6282354354858395, "epoch": 2.2450721626326726, "grad_norm": 1.234375, "learning_rate": 0.00045028236973696363, "loss": 5.4322, "mean_token_accuracy": 0.18839803487062454, "num_tokens": 44608569.0, "step": 19990 }, { "entropy": 5.493777847290039, "epoch": 2.2456337395406303, "grad_norm": 1.15625, "learning_rate": 0.0004502571943731362, "loss": 5.2371, "mean_token_accuracy": 0.1939469173550606, "num_tokens": 44619389.0, "step": 19995 }, { "entropy": 5.514086818695068, "epoch": 2.2461953164485875, "grad_norm": 1.2265625, "learning_rate": 0.0004502320134290517, "loss": 5.32, "mean_token_accuracy": 0.19063089042901993, "num_tokens": 44629945.0, "step": 20000 }, { "entropy": 5.556463289260864, "epoch": 2.246756893356545, "grad_norm": 1.1484375, "learning_rate": 0.00045020682690551203, "loss": 5.3412, "mean_token_accuracy": 0.18668145984411239, "num_tokens": 44640741.0, "step": 20005 }, { "entropy": 5.524778699874878, "epoch": 2.247318470264503, "grad_norm": 1.265625, "learning_rate": 0.00045018163480331887, "loss": 5.1792, "mean_token_accuracy": 0.2004580393433571, "num_tokens": 44651312.0, "step": 20010 }, { "entropy": 5.449014711380005, "epoch": 2.24788004717246, "grad_norm": 1.265625, "learning_rate": 0.00045015643712327465, "loss": 5.2182, "mean_token_accuracy": 0.19613993614912034, "num_tokens": 44663156.0, "step": 20015 }, { "entropy": 5.4309642791748045, "epoch": 2.2484416240804177, "grad_norm": 1.3125, "learning_rate": 0.0004501312338661815, "loss": 5.2239, "mean_token_accuracy": 0.20006002634763717, "num_tokens": 44673479.0, "step": 20020 }, { "entropy": 5.492065954208374, "epoch": 2.2490032009883754, "grad_norm": 1.2578125, "learning_rate": 0.0004501060250328419, "loss": 5.2484, "mean_token_accuracy": 0.19600303024053572, "num_tokens": 44684207.0, "step": 20025 }, { "entropy": 5.522979259490967, "epoch": 2.249564777896333, "grad_norm": 1.421875, "learning_rate": 0.0004500808106240586, "loss": 5.2219, "mean_token_accuracy": 0.19826527833938598, "num_tokens": 44695611.0, "step": 20030 }, { "entropy": 5.499130344390869, "epoch": 2.2501263548042907, "grad_norm": 1.3046875, "learning_rate": 0.0004500555906406343, "loss": 5.2581, "mean_token_accuracy": 0.19427683651447297, "num_tokens": 44707061.0, "step": 20035 }, { "entropy": 5.58782844543457, "epoch": 2.250687931712248, "grad_norm": 1.546875, "learning_rate": 0.0004500303650833722, "loss": 5.3577, "mean_token_accuracy": 0.1854730948805809, "num_tokens": 44719366.0, "step": 20040 }, { "entropy": 5.556455802917481, "epoch": 2.2512495086202056, "grad_norm": 1.203125, "learning_rate": 0.0004500051339530754, "loss": 5.2256, "mean_token_accuracy": 0.20091187506914138, "num_tokens": 44730578.0, "step": 20045 }, { "entropy": 5.457146549224854, "epoch": 2.2518110855281632, "grad_norm": 1.2109375, "learning_rate": 0.0004499798972505472, "loss": 5.1848, "mean_token_accuracy": 0.19817287474870682, "num_tokens": 44740620.0, "step": 20050 }, { "entropy": 5.484510374069214, "epoch": 2.2523726624361204, "grad_norm": 1.3828125, "learning_rate": 0.00044995465497659127, "loss": 5.2389, "mean_token_accuracy": 0.20124588906764984, "num_tokens": 44751518.0, "step": 20055 }, { "entropy": 5.510428333282471, "epoch": 2.252934239344078, "grad_norm": 1.34375, "learning_rate": 0.0004499294071320112, "loss": 5.2686, "mean_token_accuracy": 0.19703642874956132, "num_tokens": 44761563.0, "step": 20060 }, { "entropy": 5.5353888988494875, "epoch": 2.2534958162520358, "grad_norm": 1.1953125, "learning_rate": 0.000449904153717611, "loss": 5.2805, "mean_token_accuracy": 0.1933363363146782, "num_tokens": 44773330.0, "step": 20065 }, { "entropy": 5.53394832611084, "epoch": 2.2540573931599934, "grad_norm": 1.328125, "learning_rate": 0.0004498788947341947, "loss": 5.2463, "mean_token_accuracy": 0.19813215285539626, "num_tokens": 44786198.0, "step": 20070 }, { "entropy": 5.387781095504761, "epoch": 2.2546189700679506, "grad_norm": 1.125, "learning_rate": 0.0004498536301825665, "loss": 5.1404, "mean_token_accuracy": 0.2007957324385643, "num_tokens": 44797643.0, "step": 20075 }, { "entropy": 5.407376337051391, "epoch": 2.2551805469759083, "grad_norm": 1.171875, "learning_rate": 0.000449828360063531, "loss": 5.168, "mean_token_accuracy": 0.2013155400753021, "num_tokens": 44808283.0, "step": 20080 }, { "entropy": 5.447269535064697, "epoch": 2.255742123883866, "grad_norm": 1.2734375, "learning_rate": 0.00044980308437789267, "loss": 5.0732, "mean_token_accuracy": 0.20297736674547195, "num_tokens": 44817699.0, "step": 20085 }, { "entropy": 5.486398029327392, "epoch": 2.2563037007918236, "grad_norm": 1.2578125, "learning_rate": 0.0004497778031264564, "loss": 5.2906, "mean_token_accuracy": 0.19047022014856338, "num_tokens": 44828428.0, "step": 20090 }, { "entropy": 5.40444598197937, "epoch": 2.256865277699781, "grad_norm": 1.109375, "learning_rate": 0.00044975251631002694, "loss": 5.2049, "mean_token_accuracy": 0.19405728727579116, "num_tokens": 44839288.0, "step": 20095 }, { "entropy": 5.518749046325683, "epoch": 2.2574268546077385, "grad_norm": 1.2734375, "learning_rate": 0.0004497272239294097, "loss": 5.4182, "mean_token_accuracy": 0.1873346209526062, "num_tokens": 44850250.0, "step": 20100 }, { "entropy": 5.575524854660034, "epoch": 2.257988431515696, "grad_norm": 1.2578125, "learning_rate": 0.0004497019259854099, "loss": 5.255, "mean_token_accuracy": 0.1953403204679489, "num_tokens": 44862186.0, "step": 20105 }, { "entropy": 5.54745135307312, "epoch": 2.2585500084236534, "grad_norm": 1.15625, "learning_rate": 0.00044967662247883295, "loss": 5.3404, "mean_token_accuracy": 0.19116792529821397, "num_tokens": 44874266.0, "step": 20110 }, { "entropy": 5.553813028335571, "epoch": 2.259111585331611, "grad_norm": 1.3671875, "learning_rate": 0.00044965131341048454, "loss": 5.2877, "mean_token_accuracy": 0.19943919479846955, "num_tokens": 44885783.0, "step": 20115 }, { "entropy": 5.480351400375366, "epoch": 2.2596731622395687, "grad_norm": 1.1640625, "learning_rate": 0.0004496259987811707, "loss": 5.1375, "mean_token_accuracy": 0.2034609317779541, "num_tokens": 44896972.0, "step": 20120 }, { "entropy": 5.466098499298096, "epoch": 2.2602347391475264, "grad_norm": 1.171875, "learning_rate": 0.0004496006785916973, "loss": 5.246, "mean_token_accuracy": 0.19787174910306932, "num_tokens": 44907414.0, "step": 20125 }, { "entropy": 5.498031806945801, "epoch": 2.260796316055484, "grad_norm": 1.203125, "learning_rate": 0.00044957535284287055, "loss": 5.1722, "mean_token_accuracy": 0.19434682428836822, "num_tokens": 44917150.0, "step": 20130 }, { "entropy": 5.469934034347534, "epoch": 2.2613578929634413, "grad_norm": 1.4296875, "learning_rate": 0.00044955002153549686, "loss": 5.211, "mean_token_accuracy": 0.19735645353794098, "num_tokens": 44928927.0, "step": 20135 }, { "entropy": 5.467767143249512, "epoch": 2.261919469871399, "grad_norm": 1.234375, "learning_rate": 0.0004495246846703828, "loss": 5.2256, "mean_token_accuracy": 0.19621748328208924, "num_tokens": 44938987.0, "step": 20140 }, { "entropy": 5.498761415481567, "epoch": 2.2624810467793566, "grad_norm": 1.3125, "learning_rate": 0.00044949934224833505, "loss": 5.1625, "mean_token_accuracy": 0.1975456029176712, "num_tokens": 44950395.0, "step": 20145 }, { "entropy": 5.505730009078979, "epoch": 2.263042623687314, "grad_norm": 1.15625, "learning_rate": 0.0004494739942701606, "loss": 5.1744, "mean_token_accuracy": 0.20360083431005477, "num_tokens": 44961389.0, "step": 20150 }, { "entropy": 5.532986211776733, "epoch": 2.2636042005952715, "grad_norm": 1.1953125, "learning_rate": 0.00044944864073666655, "loss": 5.3595, "mean_token_accuracy": 0.19310897290706636, "num_tokens": 44973142.0, "step": 20155 }, { "entropy": 5.401855993270874, "epoch": 2.264165777503229, "grad_norm": 1.3125, "learning_rate": 0.00044942328164866, "loss": 5.1518, "mean_token_accuracy": 0.20104912370443345, "num_tokens": 44983831.0, "step": 20160 }, { "entropy": 5.500086736679077, "epoch": 2.2647273544111868, "grad_norm": 1.171875, "learning_rate": 0.0004493979170069486, "loss": 5.2509, "mean_token_accuracy": 0.2013973131775856, "num_tokens": 44996386.0, "step": 20165 }, { "entropy": 5.498330402374267, "epoch": 2.265288931319144, "grad_norm": 1.390625, "learning_rate": 0.00044937254681233984, "loss": 5.1929, "mean_token_accuracy": 0.19184104055166246, "num_tokens": 45007607.0, "step": 20170 }, { "entropy": 5.427362871170044, "epoch": 2.2658505082271017, "grad_norm": 1.09375, "learning_rate": 0.00044934717106564164, "loss": 5.2193, "mean_token_accuracy": 0.19729479551315307, "num_tokens": 45019637.0, "step": 20175 }, { "entropy": 5.422962856292725, "epoch": 2.2664120851350593, "grad_norm": 1.1953125, "learning_rate": 0.00044932178976766183, "loss": 5.2172, "mean_token_accuracy": 0.19794851690530776, "num_tokens": 45031329.0, "step": 20180 }, { "entropy": 5.463313817977905, "epoch": 2.266973662043017, "grad_norm": 1.171875, "learning_rate": 0.00044929640291920865, "loss": 5.2061, "mean_token_accuracy": 0.19512274116277695, "num_tokens": 45042539.0, "step": 20185 }, { "entropy": 5.391692638397217, "epoch": 2.267535238950974, "grad_norm": 1.234375, "learning_rate": 0.0004492710105210904, "loss": 5.098, "mean_token_accuracy": 0.20303086936473846, "num_tokens": 45054021.0, "step": 20190 }, { "entropy": 5.570929288864136, "epoch": 2.268096815858932, "grad_norm": 1.1875, "learning_rate": 0.00044924561257411554, "loss": 5.2995, "mean_token_accuracy": 0.19303088784217834, "num_tokens": 45065912.0, "step": 20195 }, { "entropy": 5.4894567966461185, "epoch": 2.2686583927668895, "grad_norm": 1.1484375, "learning_rate": 0.0004492202090790928, "loss": 5.1844, "mean_token_accuracy": 0.20377012491226196, "num_tokens": 45075965.0, "step": 20200 }, { "entropy": 5.381528711318969, "epoch": 2.2692199696748467, "grad_norm": 1.25, "learning_rate": 0.0004491948000368311, "loss": 5.1851, "mean_token_accuracy": 0.1979663237929344, "num_tokens": 45086676.0, "step": 20205 }, { "entropy": 5.445681858062744, "epoch": 2.2697815465828044, "grad_norm": 1.25, "learning_rate": 0.00044916938544813936, "loss": 5.2159, "mean_token_accuracy": 0.20002556443214417, "num_tokens": 45097747.0, "step": 20210 }, { "entropy": 5.54331488609314, "epoch": 2.270343123490762, "grad_norm": 1.3359375, "learning_rate": 0.00044914396531382686, "loss": 5.1724, "mean_token_accuracy": 0.20359463840723038, "num_tokens": 45107506.0, "step": 20215 }, { "entropy": 5.4871217727661135, "epoch": 2.2709047003987197, "grad_norm": 1.3125, "learning_rate": 0.00044911853963470295, "loss": 5.2335, "mean_token_accuracy": 0.20210439264774321, "num_tokens": 45119939.0, "step": 20220 }, { "entropy": 5.48626184463501, "epoch": 2.2714662773066774, "grad_norm": 1.140625, "learning_rate": 0.0004490931084115772, "loss": 5.3068, "mean_token_accuracy": 0.18659437596797943, "num_tokens": 45133749.0, "step": 20225 }, { "entropy": 5.516075468063354, "epoch": 2.2720278542146346, "grad_norm": 1.2265625, "learning_rate": 0.00044906767164525936, "loss": 5.2831, "mean_token_accuracy": 0.19292282611131667, "num_tokens": 45144696.0, "step": 20230 }, { "entropy": 5.484831094741821, "epoch": 2.2725894311225923, "grad_norm": 1.2578125, "learning_rate": 0.0004490422293365594, "loss": 5.1476, "mean_token_accuracy": 0.19563103020191192, "num_tokens": 45154921.0, "step": 20235 }, { "entropy": 5.409498834609986, "epoch": 2.27315100803055, "grad_norm": 1.2109375, "learning_rate": 0.0004490167814862872, "loss": 5.1423, "mean_token_accuracy": 0.20068973451852798, "num_tokens": 45164769.0, "step": 20240 }, { "entropy": 5.550851106643677, "epoch": 2.273712584938507, "grad_norm": 1.140625, "learning_rate": 0.0004489913280952533, "loss": 5.3287, "mean_token_accuracy": 0.19520364105701446, "num_tokens": 45176619.0, "step": 20245 }, { "entropy": 5.460875177383423, "epoch": 2.274274161846465, "grad_norm": 1.1640625, "learning_rate": 0.0004489658691642681, "loss": 5.2376, "mean_token_accuracy": 0.1926131084561348, "num_tokens": 45186508.0, "step": 20250 }, { "entropy": 5.578034257888794, "epoch": 2.2748357387544225, "grad_norm": 1.265625, "learning_rate": 0.00044894040469414207, "loss": 5.3442, "mean_token_accuracy": 0.1901059105992317, "num_tokens": 45198213.0, "step": 20255 }, { "entropy": 5.486166191101074, "epoch": 2.27539731566238, "grad_norm": 1.3828125, "learning_rate": 0.00044891493468568607, "loss": 5.2244, "mean_token_accuracy": 0.18832046240568162, "num_tokens": 45209328.0, "step": 20260 }, { "entropy": 5.503150701522827, "epoch": 2.2759588925703373, "grad_norm": 1.25, "learning_rate": 0.00044888945913971106, "loss": 5.2118, "mean_token_accuracy": 0.19665393978357315, "num_tokens": 45219722.0, "step": 20265 }, { "entropy": 5.591525936126709, "epoch": 2.276520469478295, "grad_norm": 1.359375, "learning_rate": 0.00044886397805702835, "loss": 5.2907, "mean_token_accuracy": 0.18618952333927155, "num_tokens": 45230377.0, "step": 20270 }, { "entropy": 5.579563331604004, "epoch": 2.2770820463862527, "grad_norm": 1.25, "learning_rate": 0.00044883849143844914, "loss": 5.2096, "mean_token_accuracy": 0.19831510931253432, "num_tokens": 45241598.0, "step": 20275 }, { "entropy": 5.5415668964385985, "epoch": 2.2776436232942103, "grad_norm": 1.3828125, "learning_rate": 0.0004488129992847848, "loss": 5.4183, "mean_token_accuracy": 0.18950254023075103, "num_tokens": 45253153.0, "step": 20280 }, { "entropy": 5.513988065719604, "epoch": 2.2782052002021675, "grad_norm": 1.4140625, "learning_rate": 0.0004487875015968473, "loss": 5.2859, "mean_token_accuracy": 0.1942953109741211, "num_tokens": 45264523.0, "step": 20285 }, { "entropy": 5.477509784698486, "epoch": 2.278766777110125, "grad_norm": 1.28125, "learning_rate": 0.0004487619983754483, "loss": 5.2018, "mean_token_accuracy": 0.1925478085875511, "num_tokens": 45275320.0, "step": 20290 }, { "entropy": 5.522681856155396, "epoch": 2.279328354018083, "grad_norm": 1.21875, "learning_rate": 0.00044873648962139983, "loss": 5.2232, "mean_token_accuracy": 0.19909849315881728, "num_tokens": 45286704.0, "step": 20295 }, { "entropy": 5.540631628036499, "epoch": 2.27988993092604, "grad_norm": 1.1171875, "learning_rate": 0.0004487109753355142, "loss": 5.259, "mean_token_accuracy": 0.19319239258766174, "num_tokens": 45299098.0, "step": 20300 }, { "entropy": 5.49213342666626, "epoch": 2.2804515078339977, "grad_norm": 1.28125, "learning_rate": 0.0004486854555186037, "loss": 5.1904, "mean_token_accuracy": 0.19423681497573853, "num_tokens": 45309995.0, "step": 20305 }, { "entropy": 5.580655097961426, "epoch": 2.2810130847419554, "grad_norm": 1.1328125, "learning_rate": 0.0004486599301714809, "loss": 5.377, "mean_token_accuracy": 0.19141939878463746, "num_tokens": 45321711.0, "step": 20310 }, { "entropy": 5.499113750457764, "epoch": 2.281574661649913, "grad_norm": 1.1328125, "learning_rate": 0.0004486343992949587, "loss": 5.2829, "mean_token_accuracy": 0.19541093707084656, "num_tokens": 45332401.0, "step": 20315 }, { "entropy": 5.573700761795044, "epoch": 2.2821362385578707, "grad_norm": 1.1640625, "learning_rate": 0.00044860886288984977, "loss": 5.3328, "mean_token_accuracy": 0.1919061630964279, "num_tokens": 45344138.0, "step": 20320 }, { "entropy": 5.442095041275024, "epoch": 2.282697815465828, "grad_norm": 1.296875, "learning_rate": 0.0004485833209569674, "loss": 5.2385, "mean_token_accuracy": 0.19264374673366547, "num_tokens": 45355913.0, "step": 20325 }, { "entropy": 5.498832941055298, "epoch": 2.2832593923737856, "grad_norm": 1.140625, "learning_rate": 0.0004485577734971247, "loss": 5.1837, "mean_token_accuracy": 0.1980019763112068, "num_tokens": 45367342.0, "step": 20330 }, { "entropy": 5.50741286277771, "epoch": 2.2838209692817433, "grad_norm": 1.328125, "learning_rate": 0.00044853222051113525, "loss": 5.2307, "mean_token_accuracy": 0.19548344910144805, "num_tokens": 45377866.0, "step": 20335 }, { "entropy": 5.472334480285644, "epoch": 2.2843825461897005, "grad_norm": 1.15625, "learning_rate": 0.00044850666199981244, "loss": 5.2634, "mean_token_accuracy": 0.19072347432374953, "num_tokens": 45389346.0, "step": 20340 }, { "entropy": 5.437552738189697, "epoch": 2.284944123097658, "grad_norm": 1.1171875, "learning_rate": 0.00044848109796397035, "loss": 5.1789, "mean_token_accuracy": 0.19399820417165756, "num_tokens": 45400112.0, "step": 20345 }, { "entropy": 5.4474702835083, "epoch": 2.285505700005616, "grad_norm": 1.3125, "learning_rate": 0.00044845552840442276, "loss": 5.1763, "mean_token_accuracy": 0.19980261623859405, "num_tokens": 45411666.0, "step": 20350 }, { "entropy": 5.428030920028687, "epoch": 2.2860672769135735, "grad_norm": 1.2109375, "learning_rate": 0.00044842995332198393, "loss": 5.1573, "mean_token_accuracy": 0.20993824154138566, "num_tokens": 45423631.0, "step": 20355 }, { "entropy": 5.345173454284668, "epoch": 2.2866288538215307, "grad_norm": 1.203125, "learning_rate": 0.00044840437271746807, "loss": 5.1262, "mean_token_accuracy": 0.198094242811203, "num_tokens": 45434697.0, "step": 20360 }, { "entropy": 5.534241247177124, "epoch": 2.2871904307294884, "grad_norm": 1.1875, "learning_rate": 0.0004483787865916898, "loss": 5.2774, "mean_token_accuracy": 0.18845348060131073, "num_tokens": 45446637.0, "step": 20365 }, { "entropy": 5.472633218765258, "epoch": 2.287752007637446, "grad_norm": 1.28125, "learning_rate": 0.00044835319494546366, "loss": 5.2002, "mean_token_accuracy": 0.19916970729827882, "num_tokens": 45456750.0, "step": 20370 }, { "entropy": 5.430306768417358, "epoch": 2.2883135845454037, "grad_norm": 1.6796875, "learning_rate": 0.00044832759777960456, "loss": 5.2257, "mean_token_accuracy": 0.19966684579849242, "num_tokens": 45469383.0, "step": 20375 }, { "entropy": 5.4830526351928714, "epoch": 2.288875161453361, "grad_norm": 1.2109375, "learning_rate": 0.0004483019950949276, "loss": 5.1962, "mean_token_accuracy": 0.2003369987010956, "num_tokens": 45479668.0, "step": 20380 }, { "entropy": 5.445210313796997, "epoch": 2.2894367383613186, "grad_norm": 1.34375, "learning_rate": 0.0004482763868922478, "loss": 5.2717, "mean_token_accuracy": 0.19506213515996934, "num_tokens": 45490888.0, "step": 20385 }, { "entropy": 5.512267637252807, "epoch": 2.289998315269276, "grad_norm": 1.2265625, "learning_rate": 0.0004482507731723807, "loss": 5.2628, "mean_token_accuracy": 0.19120286852121354, "num_tokens": 45501973.0, "step": 20390 }, { "entropy": 5.498227834701538, "epoch": 2.2905598921772334, "grad_norm": 1.2421875, "learning_rate": 0.0004482251539361418, "loss": 5.2486, "mean_token_accuracy": 0.19746894091367723, "num_tokens": 45513171.0, "step": 20395 }, { "entropy": 5.418797159194947, "epoch": 2.291121469085191, "grad_norm": 1.34375, "learning_rate": 0.0004481995291843467, "loss": 5.1761, "mean_token_accuracy": 0.19927647709846497, "num_tokens": 45523642.0, "step": 20400 }, { "entropy": 5.523365068435669, "epoch": 2.2916830459931488, "grad_norm": 1.3203125, "learning_rate": 0.0004481738989178115, "loss": 5.2533, "mean_token_accuracy": 0.19765454083681105, "num_tokens": 45534467.0, "step": 20405 }, { "entropy": 5.52879753112793, "epoch": 2.2922446229011064, "grad_norm": 1.1171875, "learning_rate": 0.0004481482631373522, "loss": 5.2405, "mean_token_accuracy": 0.18979344069957732, "num_tokens": 45545902.0, "step": 20410 }, { "entropy": 5.439551973342896, "epoch": 2.292806199809064, "grad_norm": 1.1875, "learning_rate": 0.00044812262184378503, "loss": 5.1216, "mean_token_accuracy": 0.20488597005605697, "num_tokens": 45556270.0, "step": 20415 }, { "entropy": 5.3579466342926025, "epoch": 2.2933677767170213, "grad_norm": 1.296875, "learning_rate": 0.00044809697503792647, "loss": 5.175, "mean_token_accuracy": 0.20420384109020234, "num_tokens": 45566773.0, "step": 20420 }, { "entropy": 5.464023017883301, "epoch": 2.293929353624979, "grad_norm": 1.2578125, "learning_rate": 0.00044807132272059306, "loss": 5.2818, "mean_token_accuracy": 0.1917489230632782, "num_tokens": 45578819.0, "step": 20425 }, { "entropy": 5.527934646606445, "epoch": 2.2944909305329366, "grad_norm": 1.25, "learning_rate": 0.0004480456648926016, "loss": 5.233, "mean_token_accuracy": 0.19213209748268129, "num_tokens": 45589128.0, "step": 20430 }, { "entropy": 5.528298330307007, "epoch": 2.295052507440894, "grad_norm": 1.2890625, "learning_rate": 0.0004480200015547691, "loss": 5.2864, "mean_token_accuracy": 0.1943219929933548, "num_tokens": 45600253.0, "step": 20435 }, { "entropy": 5.560419750213623, "epoch": 2.2956140843488515, "grad_norm": 1.0625, "learning_rate": 0.00044799433270791255, "loss": 5.2608, "mean_token_accuracy": 0.19483513832092286, "num_tokens": 45611258.0, "step": 20440 }, { "entropy": 5.508506965637207, "epoch": 2.296175661256809, "grad_norm": 1.0546875, "learning_rate": 0.0004479686583528494, "loss": 5.2134, "mean_token_accuracy": 0.20238776803016661, "num_tokens": 45622720.0, "step": 20445 }, { "entropy": 5.422779130935669, "epoch": 2.296737238164767, "grad_norm": 1.296875, "learning_rate": 0.0004479429784903971, "loss": 5.2001, "mean_token_accuracy": 0.19343502968549728, "num_tokens": 45634748.0, "step": 20450 }, { "entropy": 5.4938685417175295, "epoch": 2.297298815072724, "grad_norm": 1.046875, "learning_rate": 0.0004479172931213733, "loss": 5.1436, "mean_token_accuracy": 0.19243053793907167, "num_tokens": 45645735.0, "step": 20455 }, { "entropy": 5.469387865066528, "epoch": 2.2978603919806817, "grad_norm": 1.3515625, "learning_rate": 0.0004478916022465958, "loss": 5.1393, "mean_token_accuracy": 0.20273699313402177, "num_tokens": 45656309.0, "step": 20460 }, { "entropy": 5.423810958862305, "epoch": 2.2984219688886394, "grad_norm": 1.078125, "learning_rate": 0.0004478659058668827, "loss": 5.2987, "mean_token_accuracy": 0.19772691130638123, "num_tokens": 45667925.0, "step": 20465 }, { "entropy": 5.490616941452027, "epoch": 2.298983545796597, "grad_norm": 1.0390625, "learning_rate": 0.00044784020398305204, "loss": 5.2781, "mean_token_accuracy": 0.19499016106128692, "num_tokens": 45679352.0, "step": 20470 }, { "entropy": 5.454271745681763, "epoch": 2.2995451227045542, "grad_norm": 1.265625, "learning_rate": 0.0004478144965959222, "loss": 5.2407, "mean_token_accuracy": 0.19642347991466522, "num_tokens": 45689723.0, "step": 20475 }, { "entropy": 5.563471889495849, "epoch": 2.300106699612512, "grad_norm": 1.3671875, "learning_rate": 0.00044778878370631183, "loss": 5.3727, "mean_token_accuracy": 0.18927737176418305, "num_tokens": 45701270.0, "step": 20480 }, { "entropy": 5.473050928115844, "epoch": 2.3006682765204696, "grad_norm": 1.1953125, "learning_rate": 0.00044776306531503957, "loss": 5.1355, "mean_token_accuracy": 0.2100411131978035, "num_tokens": 45711409.0, "step": 20485 }, { "entropy": 5.419238758087158, "epoch": 2.301229853428427, "grad_norm": 1.1875, "learning_rate": 0.00044773734142292425, "loss": 5.2152, "mean_token_accuracy": 0.19952069371938705, "num_tokens": 45722032.0, "step": 20490 }, { "entropy": 5.48419713973999, "epoch": 2.3017914303363844, "grad_norm": 1.25, "learning_rate": 0.0004477116120307851, "loss": 5.212, "mean_token_accuracy": 0.20220494419336318, "num_tokens": 45733211.0, "step": 20495 }, { "entropy": 5.574658441543579, "epoch": 2.302353007244342, "grad_norm": 1.2734375, "learning_rate": 0.0004476858771394412, "loss": 5.3393, "mean_token_accuracy": 0.19307047575712205, "num_tokens": 45744585.0, "step": 20500 }, { "entropy": 5.520409202575683, "epoch": 2.3029145841522998, "grad_norm": 1.15625, "learning_rate": 0.0004476601367497119, "loss": 5.2771, "mean_token_accuracy": 0.19734428375959395, "num_tokens": 45756040.0, "step": 20505 }, { "entropy": 5.503814029693603, "epoch": 2.3034761610602574, "grad_norm": 1.1875, "learning_rate": 0.000447634390862417, "loss": 5.2667, "mean_token_accuracy": 0.19268766641616822, "num_tokens": 45767717.0, "step": 20510 }, { "entropy": 5.559252071380615, "epoch": 2.3040377379682146, "grad_norm": 1.1796875, "learning_rate": 0.00044760863947837607, "loss": 5.2832, "mean_token_accuracy": 0.1924678087234497, "num_tokens": 45778326.0, "step": 20515 }, { "entropy": 5.476704788208008, "epoch": 2.3045993148761723, "grad_norm": 1.265625, "learning_rate": 0.00044758288259840904, "loss": 5.1972, "mean_token_accuracy": 0.20741473585367204, "num_tokens": 45789780.0, "step": 20520 }, { "entropy": 5.437363147735596, "epoch": 2.30516089178413, "grad_norm": 1.2109375, "learning_rate": 0.0004475571202233363, "loss": 5.3431, "mean_token_accuracy": 0.18793452829122542, "num_tokens": 45801686.0, "step": 20525 }, { "entropy": 5.4736144065856935, "epoch": 2.305722468692087, "grad_norm": 1.1484375, "learning_rate": 0.0004475313523539778, "loss": 5.1862, "mean_token_accuracy": 0.1942782148718834, "num_tokens": 45812123.0, "step": 20530 }, { "entropy": 5.545000171661377, "epoch": 2.306284045600045, "grad_norm": 1.21875, "learning_rate": 0.00044750557899115407, "loss": 5.27, "mean_token_accuracy": 0.1891551986336708, "num_tokens": 45822863.0, "step": 20535 }, { "entropy": 5.529285907745361, "epoch": 2.3068456225080025, "grad_norm": 1.078125, "learning_rate": 0.0004474798001356859, "loss": 5.2805, "mean_token_accuracy": 0.1944286823272705, "num_tokens": 45833585.0, "step": 20540 }, { "entropy": 5.366938209533691, "epoch": 2.30740719941596, "grad_norm": 1.4375, "learning_rate": 0.000447454015788394, "loss": 5.0982, "mean_token_accuracy": 0.20143962204456328, "num_tokens": 45844745.0, "step": 20545 }, { "entropy": 5.422857475280762, "epoch": 2.3079687763239174, "grad_norm": 1.1875, "learning_rate": 0.0004474282259500992, "loss": 5.185, "mean_token_accuracy": 0.20190047919750215, "num_tokens": 45856018.0, "step": 20550 }, { "entropy": 5.541861200332642, "epoch": 2.308530353231875, "grad_norm": 1.2109375, "learning_rate": 0.000447402430621623, "loss": 5.2822, "mean_token_accuracy": 0.19415438324213027, "num_tokens": 45867182.0, "step": 20555 }, { "entropy": 5.525685834884643, "epoch": 2.3090919301398327, "grad_norm": 1.171875, "learning_rate": 0.0004473766298037865, "loss": 5.3643, "mean_token_accuracy": 0.18285060822963714, "num_tokens": 45880116.0, "step": 20560 }, { "entropy": 5.571984338760376, "epoch": 2.3096535070477904, "grad_norm": 1.40625, "learning_rate": 0.00044735082349741116, "loss": 5.3002, "mean_token_accuracy": 0.19150526374578475, "num_tokens": 45891143.0, "step": 20565 }, { "entropy": 5.514363384246826, "epoch": 2.3102150839557476, "grad_norm": 1.1484375, "learning_rate": 0.00044732501170331886, "loss": 5.1928, "mean_token_accuracy": 0.19794349521398544, "num_tokens": 45901443.0, "step": 20570 }, { "entropy": 5.568791723251342, "epoch": 2.3107766608637053, "grad_norm": 1.46875, "learning_rate": 0.0004472991944223313, "loss": 5.2944, "mean_token_accuracy": 0.18966622203588485, "num_tokens": 45913313.0, "step": 20575 }, { "entropy": 5.533223104476929, "epoch": 2.311338237771663, "grad_norm": 1.1640625, "learning_rate": 0.00044727337165527056, "loss": 5.3339, "mean_token_accuracy": 0.18738346099853515, "num_tokens": 45925248.0, "step": 20580 }, { "entropy": 5.617816352844239, "epoch": 2.31189981467962, "grad_norm": 1.3046875, "learning_rate": 0.00044724754340295887, "loss": 5.3318, "mean_token_accuracy": 0.19027050882577895, "num_tokens": 45936366.0, "step": 20585 }, { "entropy": 5.450673580169678, "epoch": 2.312461391587578, "grad_norm": 1.3125, "learning_rate": 0.0004472217096662186, "loss": 5.1696, "mean_token_accuracy": 0.20805188417434692, "num_tokens": 45947732.0, "step": 20590 }, { "entropy": 5.46936731338501, "epoch": 2.3130229684955355, "grad_norm": 1.234375, "learning_rate": 0.0004471958704458723, "loss": 5.2308, "mean_token_accuracy": 0.19785091131925583, "num_tokens": 45958655.0, "step": 20595 }, { "entropy": 5.523629999160766, "epoch": 2.313584545403493, "grad_norm": 1.2734375, "learning_rate": 0.00044717002574274267, "loss": 5.3072, "mean_token_accuracy": 0.19829923659563065, "num_tokens": 45970767.0, "step": 20600 }, { "entropy": 5.422164011001587, "epoch": 2.314146122311451, "grad_norm": 1.28125, "learning_rate": 0.0004471441755576527, "loss": 5.1213, "mean_token_accuracy": 0.20740276277065278, "num_tokens": 45981063.0, "step": 20605 }, { "entropy": 5.392886590957642, "epoch": 2.314707699219408, "grad_norm": 1.265625, "learning_rate": 0.00044711831989142534, "loss": 5.0888, "mean_token_accuracy": 0.20422577857971191, "num_tokens": 45991963.0, "step": 20610 }, { "entropy": 5.4641026020050045, "epoch": 2.3152692761273657, "grad_norm": 1.1796875, "learning_rate": 0.00044709245874488405, "loss": 5.3477, "mean_token_accuracy": 0.18637771755456925, "num_tokens": 46003460.0, "step": 20615 }, { "entropy": 5.521129322052002, "epoch": 2.3158308530353233, "grad_norm": 1.2421875, "learning_rate": 0.0004470665921188519, "loss": 5.2284, "mean_token_accuracy": 0.19587883800268174, "num_tokens": 46014338.0, "step": 20620 }, { "entropy": 5.4204026222229, "epoch": 2.3163924299432805, "grad_norm": 1.265625, "learning_rate": 0.00044704072001415285, "loss": 5.1001, "mean_token_accuracy": 0.20640003085136413, "num_tokens": 46025282.0, "step": 20625 }, { "entropy": 5.452847051620483, "epoch": 2.316954006851238, "grad_norm": 1.203125, "learning_rate": 0.00044701484243161055, "loss": 5.2719, "mean_token_accuracy": 0.1958751544356346, "num_tokens": 46035303.0, "step": 20630 }, { "entropy": 5.46298303604126, "epoch": 2.317515583759196, "grad_norm": 1.1484375, "learning_rate": 0.000446988959372049, "loss": 5.2433, "mean_token_accuracy": 0.2012130707502365, "num_tokens": 46046336.0, "step": 20635 }, { "entropy": 5.400800323486328, "epoch": 2.3180771606671535, "grad_norm": 1.234375, "learning_rate": 0.0004469630708362922, "loss": 5.1206, "mean_token_accuracy": 0.19708970487117766, "num_tokens": 46056862.0, "step": 20640 }, { "entropy": 5.591737842559814, "epoch": 2.3186387375751107, "grad_norm": 1.328125, "learning_rate": 0.0004469371768251646, "loss": 5.2662, "mean_token_accuracy": 0.19652716517448426, "num_tokens": 46067785.0, "step": 20645 }, { "entropy": 5.46607027053833, "epoch": 2.3192003144830684, "grad_norm": 1.1640625, "learning_rate": 0.0004469112773394906, "loss": 5.2525, "mean_token_accuracy": 0.18587084263563156, "num_tokens": 46080553.0, "step": 20650 }, { "entropy": 5.50519323348999, "epoch": 2.319761891391026, "grad_norm": 1.203125, "learning_rate": 0.0004468853723800948, "loss": 5.2042, "mean_token_accuracy": 0.19355346262454987, "num_tokens": 46090985.0, "step": 20655 }, { "entropy": 5.560759830474853, "epoch": 2.3203234682989837, "grad_norm": 1.1796875, "learning_rate": 0.0004468594619478021, "loss": 5.2913, "mean_token_accuracy": 0.1927972510457039, "num_tokens": 46101990.0, "step": 20660 }, { "entropy": 5.394636392593384, "epoch": 2.320885045206941, "grad_norm": 1.3984375, "learning_rate": 0.0004468335460434375, "loss": 5.1439, "mean_token_accuracy": 0.203435218334198, "num_tokens": 46112853.0, "step": 20665 }, { "entropy": 5.463116931915283, "epoch": 2.3214466221148986, "grad_norm": 1.296875, "learning_rate": 0.0004468076246678261, "loss": 5.2555, "mean_token_accuracy": 0.19200120866298676, "num_tokens": 46123508.0, "step": 20670 }, { "entropy": 5.627512788772583, "epoch": 2.3220081990228563, "grad_norm": 1.2265625, "learning_rate": 0.00044678169782179334, "loss": 5.3533, "mean_token_accuracy": 0.19093358218669892, "num_tokens": 46135394.0, "step": 20675 }, { "entropy": 5.581290245056152, "epoch": 2.3225697759308135, "grad_norm": 1.2421875, "learning_rate": 0.00044675576550616466, "loss": 5.3046, "mean_token_accuracy": 0.1954210266470909, "num_tokens": 46146838.0, "step": 20680 }, { "entropy": 5.542792224884034, "epoch": 2.323131352838771, "grad_norm": 1.171875, "learning_rate": 0.00044672982772176584, "loss": 5.1875, "mean_token_accuracy": 0.20086237639188767, "num_tokens": 46157116.0, "step": 20685 }, { "entropy": 5.413563823699951, "epoch": 2.323692929746729, "grad_norm": 1.171875, "learning_rate": 0.0004467038844694227, "loss": 5.1904, "mean_token_accuracy": 0.19913049936294555, "num_tokens": 46168405.0, "step": 20690 }, { "entropy": 5.4855122566223145, "epoch": 2.3242545066546865, "grad_norm": 1.0625, "learning_rate": 0.0004466779357499612, "loss": 5.2279, "mean_token_accuracy": 0.19788960069417955, "num_tokens": 46179907.0, "step": 20695 }, { "entropy": 5.473715448379517, "epoch": 2.324816083562644, "grad_norm": 1.171875, "learning_rate": 0.00044665198156420774, "loss": 5.1498, "mean_token_accuracy": 0.1955687463283539, "num_tokens": 46190750.0, "step": 20700 }, { "entropy": 5.458232975006103, "epoch": 2.3253776604706013, "grad_norm": 1.203125, "learning_rate": 0.00044662602191298856, "loss": 5.1499, "mean_token_accuracy": 0.20274998545646666, "num_tokens": 46201364.0, "step": 20705 }, { "entropy": 5.477144384384156, "epoch": 2.325939237378559, "grad_norm": 1.296875, "learning_rate": 0.00044660005679713027, "loss": 5.1724, "mean_token_accuracy": 0.19556164145469665, "num_tokens": 46212341.0, "step": 20710 }, { "entropy": 5.454949378967285, "epoch": 2.3265008142865167, "grad_norm": 1.2734375, "learning_rate": 0.00044657408621745964, "loss": 5.2605, "mean_token_accuracy": 0.19336785972118378, "num_tokens": 46223286.0, "step": 20715 }, { "entropy": 5.395768880844116, "epoch": 2.327062391194474, "grad_norm": 1.171875, "learning_rate": 0.0004465481101748036, "loss": 5.2775, "mean_token_accuracy": 0.19591585844755172, "num_tokens": 46234787.0, "step": 20720 }, { "entropy": 5.513534641265869, "epoch": 2.3276239681024316, "grad_norm": 1.2578125, "learning_rate": 0.00044652212866998914, "loss": 5.1267, "mean_token_accuracy": 0.20190000236034394, "num_tokens": 46244845.0, "step": 20725 }, { "entropy": 5.5209887504577635, "epoch": 2.328185545010389, "grad_norm": 1.3046875, "learning_rate": 0.00044649614170384354, "loss": 5.2636, "mean_token_accuracy": 0.1971845492720604, "num_tokens": 46256352.0, "step": 20730 }, { "entropy": 5.631619215011597, "epoch": 2.328747121918347, "grad_norm": 1.1953125, "learning_rate": 0.00044647014927719436, "loss": 5.4191, "mean_token_accuracy": 0.18905749171972275, "num_tokens": 46268535.0, "step": 20735 }, { "entropy": 5.476808261871338, "epoch": 2.329308698826304, "grad_norm": 1.3203125, "learning_rate": 0.00044644415139086913, "loss": 5.213, "mean_token_accuracy": 0.20166843831539155, "num_tokens": 46279164.0, "step": 20740 }, { "entropy": 5.431314468383789, "epoch": 2.3298702757342618, "grad_norm": 1.1015625, "learning_rate": 0.0004464181480456955, "loss": 5.0825, "mean_token_accuracy": 0.2080667272210121, "num_tokens": 46289379.0, "step": 20745 }, { "entropy": 5.424643087387085, "epoch": 2.3304318526422194, "grad_norm": 1.1640625, "learning_rate": 0.0004463921392425017, "loss": 5.1219, "mean_token_accuracy": 0.2021471932530403, "num_tokens": 46301023.0, "step": 20750 }, { "entropy": 5.475365257263183, "epoch": 2.330993429550177, "grad_norm": 1.1015625, "learning_rate": 0.00044636612498211566, "loss": 5.2373, "mean_token_accuracy": 0.2012315347790718, "num_tokens": 46312043.0, "step": 20755 }, { "entropy": 5.406970405578614, "epoch": 2.3315550064581343, "grad_norm": 1.1875, "learning_rate": 0.00044634010526536575, "loss": 5.1932, "mean_token_accuracy": 0.19140066504478453, "num_tokens": 46322808.0, "step": 20760 }, { "entropy": 5.508573865890503, "epoch": 2.332116583366092, "grad_norm": 1.140625, "learning_rate": 0.0004463140800930804, "loss": 5.2605, "mean_token_accuracy": 0.19064713418483734, "num_tokens": 46334260.0, "step": 20765 }, { "entropy": 5.501081562042236, "epoch": 2.3326781602740496, "grad_norm": 1.234375, "learning_rate": 0.0004462880494660883, "loss": 5.2287, "mean_token_accuracy": 0.1961723119020462, "num_tokens": 46344245.0, "step": 20770 }, { "entropy": 5.452253627777099, "epoch": 2.333239737182007, "grad_norm": 1.3203125, "learning_rate": 0.00044626201338521834, "loss": 5.1576, "mean_token_accuracy": 0.1990344777703285, "num_tokens": 46356105.0, "step": 20775 }, { "entropy": 5.375404214859008, "epoch": 2.3338013140899645, "grad_norm": 1.2109375, "learning_rate": 0.0004462359718512993, "loss": 5.1464, "mean_token_accuracy": 0.20020316839218139, "num_tokens": 46367591.0, "step": 20780 }, { "entropy": 5.444856309890747, "epoch": 2.334362890997922, "grad_norm": 1.1875, "learning_rate": 0.00044620992486516073, "loss": 5.1699, "mean_token_accuracy": 0.19651600420475007, "num_tokens": 46379022.0, "step": 20785 }, { "entropy": 5.448221921920776, "epoch": 2.33492446790588, "grad_norm": 1.4140625, "learning_rate": 0.0004461838724276316, "loss": 5.1906, "mean_token_accuracy": 0.20681209713220597, "num_tokens": 46390988.0, "step": 20790 }, { "entropy": 5.493107652664184, "epoch": 2.3354860448138375, "grad_norm": 1.2890625, "learning_rate": 0.00044615781453954164, "loss": 5.2515, "mean_token_accuracy": 0.1984211578965187, "num_tokens": 46401576.0, "step": 20795 }, { "entropy": 5.46716947555542, "epoch": 2.3360476217217947, "grad_norm": 1.265625, "learning_rate": 0.00044613175120172035, "loss": 5.1302, "mean_token_accuracy": 0.2037460535764694, "num_tokens": 46413114.0, "step": 20800 }, { "entropy": 5.38899416923523, "epoch": 2.3366091986297524, "grad_norm": 1.1796875, "learning_rate": 0.0004461056824149979, "loss": 5.1383, "mean_token_accuracy": 0.20543973594903947, "num_tokens": 46424000.0, "step": 20805 }, { "entropy": 5.492922019958496, "epoch": 2.33717077553771, "grad_norm": 1.453125, "learning_rate": 0.000446079608180204, "loss": 5.1985, "mean_token_accuracy": 0.19603900611400604, "num_tokens": 46435392.0, "step": 20810 }, { "entropy": 5.388095331192017, "epoch": 2.3377323524456672, "grad_norm": 1.1796875, "learning_rate": 0.0004460535284981692, "loss": 5.1047, "mean_token_accuracy": 0.19755102396011354, "num_tokens": 46445876.0, "step": 20815 }, { "entropy": 5.492770433425903, "epoch": 2.338293929353625, "grad_norm": 1.296875, "learning_rate": 0.0004460274433697235, "loss": 5.1972, "mean_token_accuracy": 0.19560093581676483, "num_tokens": 46457175.0, "step": 20820 }, { "entropy": 5.529646205902099, "epoch": 2.3388555062615826, "grad_norm": 1.296875, "learning_rate": 0.00044600135279569784, "loss": 5.3371, "mean_token_accuracy": 0.19093599766492844, "num_tokens": 46469100.0, "step": 20825 }, { "entropy": 5.451491498947144, "epoch": 2.3394170831695402, "grad_norm": 1.1328125, "learning_rate": 0.00044597525677692273, "loss": 5.1585, "mean_token_accuracy": 0.19938063323497773, "num_tokens": 46481221.0, "step": 20830 }, { "entropy": 5.414064264297485, "epoch": 2.3399786600774974, "grad_norm": 1.40625, "learning_rate": 0.0004459491553142291, "loss": 5.1088, "mean_token_accuracy": 0.2074011042714119, "num_tokens": 46492127.0, "step": 20835 }, { "entropy": 5.471398162841797, "epoch": 2.340540236985455, "grad_norm": 1.328125, "learning_rate": 0.00044592304840844813, "loss": 5.2045, "mean_token_accuracy": 0.19230275005102157, "num_tokens": 46502880.0, "step": 20840 }, { "entropy": 5.4528186321258545, "epoch": 2.3411018138934128, "grad_norm": 1.21875, "learning_rate": 0.000445896936060411, "loss": 5.1434, "mean_token_accuracy": 0.20249173939228057, "num_tokens": 46513483.0, "step": 20845 }, { "entropy": 5.447299814224243, "epoch": 2.3416633908013704, "grad_norm": 1.1328125, "learning_rate": 0.00044587081827094906, "loss": 5.2349, "mean_token_accuracy": 0.19579770565032958, "num_tokens": 46526110.0, "step": 20850 }, { "entropy": 5.451260757446289, "epoch": 2.3422249677093276, "grad_norm": 1.265625, "learning_rate": 0.00044584469504089407, "loss": 5.2106, "mean_token_accuracy": 0.19846130758523942, "num_tokens": 46537832.0, "step": 20855 }, { "entropy": 5.39276089668274, "epoch": 2.3427865446172853, "grad_norm": 1.5078125, "learning_rate": 0.0004458185663710777, "loss": 5.1322, "mean_token_accuracy": 0.19853869676589966, "num_tokens": 46548553.0, "step": 20860 }, { "entropy": 5.538682842254639, "epoch": 2.343348121525243, "grad_norm": 1.171875, "learning_rate": 0.0004457924322623319, "loss": 5.3082, "mean_token_accuracy": 0.19690529853105546, "num_tokens": 46561095.0, "step": 20865 }, { "entropy": 5.572622776031494, "epoch": 2.3439096984332, "grad_norm": 1.265625, "learning_rate": 0.00044576629271548884, "loss": 5.3001, "mean_token_accuracy": 0.19458558559417724, "num_tokens": 46572070.0, "step": 20870 }, { "entropy": 5.58575325012207, "epoch": 2.344471275341158, "grad_norm": 1.4453125, "learning_rate": 0.0004457401477313808, "loss": 5.324, "mean_token_accuracy": 0.19038349390029907, "num_tokens": 46583355.0, "step": 20875 }, { "entropy": 5.484343814849853, "epoch": 2.3450328522491155, "grad_norm": 1.140625, "learning_rate": 0.0004457139973108403, "loss": 5.2034, "mean_token_accuracy": 0.1940722569823265, "num_tokens": 46594909.0, "step": 20880 }, { "entropy": 5.560077762603759, "epoch": 2.345594429157073, "grad_norm": 1.125, "learning_rate": 0.0004456878414546998, "loss": 5.2618, "mean_token_accuracy": 0.19874756783246994, "num_tokens": 46606245.0, "step": 20885 }, { "entropy": 5.407064533233642, "epoch": 2.346156006065031, "grad_norm": 1.1796875, "learning_rate": 0.00044566168016379234, "loss": 5.1625, "mean_token_accuracy": 0.19909542053937912, "num_tokens": 46617761.0, "step": 20890 }, { "entropy": 5.4622338771820065, "epoch": 2.346717582972988, "grad_norm": 1.390625, "learning_rate": 0.0004456355134389507, "loss": 5.1911, "mean_token_accuracy": 0.19062627702951432, "num_tokens": 46628947.0, "step": 20895 }, { "entropy": 5.466204071044922, "epoch": 2.3472791598809457, "grad_norm": 1.203125, "learning_rate": 0.00044560934128100814, "loss": 5.2053, "mean_token_accuracy": 0.1994910404086113, "num_tokens": 46640243.0, "step": 20900 }, { "entropy": 5.38988094329834, "epoch": 2.3478407367889034, "grad_norm": 1.359375, "learning_rate": 0.00044558316369079805, "loss": 5.1334, "mean_token_accuracy": 0.19735938757658006, "num_tokens": 46650328.0, "step": 20905 }, { "entropy": 5.369638967514038, "epoch": 2.3484023136968606, "grad_norm": 1.1328125, "learning_rate": 0.00044555698066915385, "loss": 5.1271, "mean_token_accuracy": 0.19721096605062485, "num_tokens": 46661770.0, "step": 20910 }, { "entropy": 5.419118976593017, "epoch": 2.3489638906048182, "grad_norm": 1.09375, "learning_rate": 0.0004455307922169092, "loss": 5.0799, "mean_token_accuracy": 0.2022887259721756, "num_tokens": 46673075.0, "step": 20915 }, { "entropy": 5.484280824661255, "epoch": 2.349525467512776, "grad_norm": 1.34375, "learning_rate": 0.0004455045983348979, "loss": 5.2202, "mean_token_accuracy": 0.1938351273536682, "num_tokens": 46684040.0, "step": 20920 }, { "entropy": 5.423160791397095, "epoch": 2.3500870444207336, "grad_norm": 1.203125, "learning_rate": 0.0004454783990239542, "loss": 5.1123, "mean_token_accuracy": 0.2010540097951889, "num_tokens": 46696295.0, "step": 20925 }, { "entropy": 5.433575105667114, "epoch": 2.350648621328691, "grad_norm": 1.265625, "learning_rate": 0.00044545219428491215, "loss": 5.1991, "mean_token_accuracy": 0.200055393576622, "num_tokens": 46706399.0, "step": 20930 }, { "entropy": 5.505274534225464, "epoch": 2.3512101982366485, "grad_norm": 1.1875, "learning_rate": 0.00044542598411860605, "loss": 5.3113, "mean_token_accuracy": 0.1915813311934471, "num_tokens": 46717644.0, "step": 20935 }, { "entropy": 5.613769245147705, "epoch": 2.351771775144606, "grad_norm": 1.2421875, "learning_rate": 0.0004453997685258706, "loss": 5.2798, "mean_token_accuracy": 0.19733862429857255, "num_tokens": 46728556.0, "step": 20940 }, { "entropy": 5.487457799911499, "epoch": 2.3523333520525638, "grad_norm": 1.34375, "learning_rate": 0.00044537354750754033, "loss": 5.19, "mean_token_accuracy": 0.20072409212589265, "num_tokens": 46739730.0, "step": 20945 }, { "entropy": 5.520910835266113, "epoch": 2.352894928960521, "grad_norm": 1.15625, "learning_rate": 0.0004453473210644503, "loss": 5.286, "mean_token_accuracy": 0.19550357908010482, "num_tokens": 46752349.0, "step": 20950 }, { "entropy": 5.52295446395874, "epoch": 2.3534565058684787, "grad_norm": 1.109375, "learning_rate": 0.0004453210891974355, "loss": 5.2533, "mean_token_accuracy": 0.19241360276937486, "num_tokens": 46763771.0, "step": 20955 }, { "entropy": 5.5087450504302975, "epoch": 2.3540180827764363, "grad_norm": 1.1640625, "learning_rate": 0.00044529485190733113, "loss": 5.1847, "mean_token_accuracy": 0.19992031306028366, "num_tokens": 46773371.0, "step": 20960 }, { "entropy": 5.435989713668823, "epoch": 2.3545796596843935, "grad_norm": 1.125, "learning_rate": 0.0004452686091949727, "loss": 5.1631, "mean_token_accuracy": 0.20077840387821197, "num_tokens": 46784244.0, "step": 20965 }, { "entropy": 5.4940653324127195, "epoch": 2.355141236592351, "grad_norm": 1.234375, "learning_rate": 0.00044524236106119563, "loss": 5.2489, "mean_token_accuracy": 0.1923815131187439, "num_tokens": 46795373.0, "step": 20970 }, { "entropy": 5.559467124938965, "epoch": 2.355702813500309, "grad_norm": 1.1328125, "learning_rate": 0.00044521610750683586, "loss": 5.2519, "mean_token_accuracy": 0.1975223660469055, "num_tokens": 46806342.0, "step": 20975 }, { "entropy": 5.41952109336853, "epoch": 2.3562643904082665, "grad_norm": 1.203125, "learning_rate": 0.0004451898485327291, "loss": 5.1612, "mean_token_accuracy": 0.20110985189676284, "num_tokens": 46817576.0, "step": 20980 }, { "entropy": 5.420933961868286, "epoch": 2.356825967316224, "grad_norm": 1.2734375, "learning_rate": 0.0004451635841397116, "loss": 5.2282, "mean_token_accuracy": 0.19303133636713027, "num_tokens": 46829335.0, "step": 20985 }, { "entropy": 5.519724988937378, "epoch": 2.3573875442241814, "grad_norm": 1.2265625, "learning_rate": 0.0004451373143286195, "loss": 5.2745, "mean_token_accuracy": 0.19118888974189757, "num_tokens": 46841334.0, "step": 20990 }, { "entropy": 5.57857232093811, "epoch": 2.357949121132139, "grad_norm": 1.1875, "learning_rate": 0.00044511103910028945, "loss": 5.4278, "mean_token_accuracy": 0.19080803245306016, "num_tokens": 46852418.0, "step": 20995 }, { "entropy": 5.577915334701538, "epoch": 2.3585106980400967, "grad_norm": 1.1484375, "learning_rate": 0.0004450847584555579, "loss": 5.2815, "mean_token_accuracy": 0.19626296162605286, "num_tokens": 46863743.0, "step": 21000 }, { "epoch": 2.3585106980400967, "eval_entropy": 5.332942704118833, "eval_loss": 5.344221591949463, "eval_mean_token_accuracy": 0.19913381254139528, "eval_num_tokens": 46863743.0, "eval_runtime": 23.697, "eval_samples_per_second": 1308.728, "eval_steps_per_second": 163.607, "step": 21000 }, { "entropy": 5.425669097900391, "epoch": 2.359072274948054, "grad_norm": 1.2578125, "learning_rate": 0.0004450584723952617, "loss": 5.1023, "mean_token_accuracy": 0.19782320261001587, "num_tokens": 46873628.0, "step": 21005 }, { "entropy": 5.528709173202515, "epoch": 2.3596338518560116, "grad_norm": 1.34375, "learning_rate": 0.0004450321809202377, "loss": 5.2874, "mean_token_accuracy": 0.18882786184549333, "num_tokens": 46885288.0, "step": 21010 }, { "entropy": 5.531344079971314, "epoch": 2.3601954287639693, "grad_norm": 1.171875, "learning_rate": 0.0004450058840313232, "loss": 5.2575, "mean_token_accuracy": 0.19361186623573304, "num_tokens": 46897027.0, "step": 21015 }, { "entropy": 5.409613800048828, "epoch": 2.360757005671927, "grad_norm": 1.1171875, "learning_rate": 0.00044497958172935536, "loss": 5.1471, "mean_token_accuracy": 0.19863545894622803, "num_tokens": 46907947.0, "step": 21020 }, { "entropy": 5.421298170089722, "epoch": 2.361318582579884, "grad_norm": 1.2421875, "learning_rate": 0.0004449532740151717, "loss": 5.1952, "mean_token_accuracy": 0.20064647346735, "num_tokens": 46918334.0, "step": 21025 }, { "entropy": 5.468659114837647, "epoch": 2.361880159487842, "grad_norm": 1.2578125, "learning_rate": 0.00044492696088960985, "loss": 5.2638, "mean_token_accuracy": 0.20052294433116913, "num_tokens": 46929710.0, "step": 21030 }, { "entropy": 5.478493356704712, "epoch": 2.3624417363957995, "grad_norm": 1.28125, "learning_rate": 0.0004449006423535078, "loss": 5.2107, "mean_token_accuracy": 0.1907900795340538, "num_tokens": 46941436.0, "step": 21035 }, { "entropy": 5.561452436447143, "epoch": 2.363003313303757, "grad_norm": 1.1796875, "learning_rate": 0.00044487431840770325, "loss": 5.2492, "mean_token_accuracy": 0.19540422409772873, "num_tokens": 46953673.0, "step": 21040 }, { "entropy": 5.4241691589355465, "epoch": 2.3635648902117143, "grad_norm": 1.4296875, "learning_rate": 0.0004448479890530347, "loss": 5.1262, "mean_token_accuracy": 0.20031379014253617, "num_tokens": 46964412.0, "step": 21045 }, { "entropy": 5.394551086425781, "epoch": 2.364126467119672, "grad_norm": 1.296875, "learning_rate": 0.00044482165429034014, "loss": 5.1978, "mean_token_accuracy": 0.19813333153724672, "num_tokens": 46975159.0, "step": 21050 }, { "entropy": 5.475469446182251, "epoch": 2.3646880440276297, "grad_norm": 1.1796875, "learning_rate": 0.0004447953141204583, "loss": 5.1862, "mean_token_accuracy": 0.2049855351448059, "num_tokens": 46987165.0, "step": 21055 }, { "entropy": 5.560744094848633, "epoch": 2.365249620935587, "grad_norm": 1.171875, "learning_rate": 0.00044476896854422785, "loss": 5.2877, "mean_token_accuracy": 0.18687691390514374, "num_tokens": 46999085.0, "step": 21060 }, { "entropy": 5.496333026885987, "epoch": 2.3658111978435445, "grad_norm": 1.2109375, "learning_rate": 0.00044474261756248745, "loss": 5.2659, "mean_token_accuracy": 0.19189661294221877, "num_tokens": 47010970.0, "step": 21065 }, { "entropy": 5.507092428207398, "epoch": 2.366372774751502, "grad_norm": 1.296875, "learning_rate": 0.0004447162611760764, "loss": 5.1938, "mean_token_accuracy": 0.20141583383083345, "num_tokens": 47021396.0, "step": 21070 }, { "entropy": 5.526192331314087, "epoch": 2.36693435165946, "grad_norm": 1.140625, "learning_rate": 0.0004446898993858338, "loss": 5.2316, "mean_token_accuracy": 0.1941898286342621, "num_tokens": 47033394.0, "step": 21075 }, { "entropy": 5.485520839691162, "epoch": 2.3674959285674175, "grad_norm": 1.265625, "learning_rate": 0.00044466353219259884, "loss": 5.2322, "mean_token_accuracy": 0.19840211272239686, "num_tokens": 47044688.0, "step": 21080 }, { "entropy": 5.578689193725586, "epoch": 2.3680575054753747, "grad_norm": 1.2890625, "learning_rate": 0.0004446371595972114, "loss": 5.2939, "mean_token_accuracy": 0.19130343198776245, "num_tokens": 47057483.0, "step": 21085 }, { "entropy": 5.521618032455445, "epoch": 2.3686190823833324, "grad_norm": 1.1640625, "learning_rate": 0.0004446107816005109, "loss": 5.2024, "mean_token_accuracy": 0.1980918064713478, "num_tokens": 47069031.0, "step": 21090 }, { "entropy": 5.469498348236084, "epoch": 2.36918065929129, "grad_norm": 1.171875, "learning_rate": 0.0004445843982033373, "loss": 5.229, "mean_token_accuracy": 0.19595300406217575, "num_tokens": 47080998.0, "step": 21095 }, { "entropy": 5.411626386642456, "epoch": 2.3697422361992473, "grad_norm": 1.1640625, "learning_rate": 0.0004445580094065307, "loss": 5.2143, "mean_token_accuracy": 0.19779896587133408, "num_tokens": 47092065.0, "step": 21100 }, { "entropy": 5.495804166793823, "epoch": 2.370303813107205, "grad_norm": 1.1484375, "learning_rate": 0.0004445316152109313, "loss": 5.2135, "mean_token_accuracy": 0.1879710540175438, "num_tokens": 47102207.0, "step": 21105 }, { "entropy": 5.464909505844116, "epoch": 2.3708653900151626, "grad_norm": 1.234375, "learning_rate": 0.0004445052156173796, "loss": 5.1925, "mean_token_accuracy": 0.19657965153455734, "num_tokens": 47112675.0, "step": 21110 }, { "entropy": 5.494316959381104, "epoch": 2.3714269669231203, "grad_norm": 1.1640625, "learning_rate": 0.0004444788106267161, "loss": 5.2422, "mean_token_accuracy": 0.20091370046138762, "num_tokens": 47123728.0, "step": 21115 }, { "entropy": 5.499920082092285, "epoch": 2.3719885438310775, "grad_norm": 1.234375, "learning_rate": 0.0004444524002397815, "loss": 5.2291, "mean_token_accuracy": 0.1928659752011299, "num_tokens": 47136194.0, "step": 21120 }, { "entropy": 5.387128734588623, "epoch": 2.372550120739035, "grad_norm": 1.171875, "learning_rate": 0.0004444259844574167, "loss": 5.0844, "mean_token_accuracy": 0.19661763608455657, "num_tokens": 47146539.0, "step": 21125 }, { "entropy": 5.5167817115783695, "epoch": 2.373111697646993, "grad_norm": 1.359375, "learning_rate": 0.00044439956328046296, "loss": 5.2679, "mean_token_accuracy": 0.19259125292301177, "num_tokens": 47158449.0, "step": 21130 }, { "entropy": 5.467296409606933, "epoch": 2.3736732745549505, "grad_norm": 1.09375, "learning_rate": 0.0004443731367097613, "loss": 5.1154, "mean_token_accuracy": 0.20548777729272844, "num_tokens": 47169687.0, "step": 21135 }, { "entropy": 5.304896688461303, "epoch": 2.3742348514629077, "grad_norm": 1.140625, "learning_rate": 0.00044434670474615334, "loss": 5.0061, "mean_token_accuracy": 0.20976399332284928, "num_tokens": 47179731.0, "step": 21140 }, { "entropy": 5.37644329071045, "epoch": 2.3747964283708654, "grad_norm": 1.1640625, "learning_rate": 0.00044432026739048064, "loss": 5.1509, "mean_token_accuracy": 0.20831314772367476, "num_tokens": 47189925.0, "step": 21145 }, { "entropy": 5.468923187255859, "epoch": 2.375358005278823, "grad_norm": 1.171875, "learning_rate": 0.000444293824643585, "loss": 5.1981, "mean_token_accuracy": 0.20327981561422348, "num_tokens": 47200637.0, "step": 21150 }, { "entropy": 5.496252775192261, "epoch": 2.3759195821867802, "grad_norm": 1.234375, "learning_rate": 0.0004442673765063082, "loss": 5.1965, "mean_token_accuracy": 0.19572321623563765, "num_tokens": 47211969.0, "step": 21155 }, { "entropy": 5.51967978477478, "epoch": 2.376481159094738, "grad_norm": 1.1640625, "learning_rate": 0.0004442409229794925, "loss": 5.3411, "mean_token_accuracy": 0.19481445103883743, "num_tokens": 47223150.0, "step": 21160 }, { "entropy": 5.558747005462647, "epoch": 2.3770427360026956, "grad_norm": 1.1015625, "learning_rate": 0.0004442144640639803, "loss": 5.2928, "mean_token_accuracy": 0.1921680375933647, "num_tokens": 47234403.0, "step": 21165 }, { "entropy": 5.467461252212525, "epoch": 2.377604312910653, "grad_norm": 1.125, "learning_rate": 0.0004441879997606138, "loss": 5.1148, "mean_token_accuracy": 0.19939623326063155, "num_tokens": 47245800.0, "step": 21170 }, { "entropy": 5.438232564926148, "epoch": 2.378165889818611, "grad_norm": 1.3828125, "learning_rate": 0.0004441615300702358, "loss": 5.1934, "mean_token_accuracy": 0.1920433059334755, "num_tokens": 47256109.0, "step": 21175 }, { "entropy": 5.431833076477051, "epoch": 2.378727466726568, "grad_norm": 1.1328125, "learning_rate": 0.0004441350549936891, "loss": 5.1239, "mean_token_accuracy": 0.20218961238861083, "num_tokens": 47266502.0, "step": 21180 }, { "entropy": 5.517393159866333, "epoch": 2.3792890436345258, "grad_norm": 1.1953125, "learning_rate": 0.0004441085745318167, "loss": 5.2107, "mean_token_accuracy": 0.20080445408821107, "num_tokens": 47278866.0, "step": 21185 }, { "entropy": 5.371696949005127, "epoch": 2.3798506205424834, "grad_norm": 1.2109375, "learning_rate": 0.00044408208868546164, "loss": 5.1539, "mean_token_accuracy": 0.20703070163726806, "num_tokens": 47289449.0, "step": 21190 }, { "entropy": 5.440367364883423, "epoch": 2.3804121974504406, "grad_norm": 1.125, "learning_rate": 0.0004440555974554673, "loss": 5.2964, "mean_token_accuracy": 0.2001742973923683, "num_tokens": 47301026.0, "step": 21195 }, { "entropy": 5.483521270751953, "epoch": 2.3809737743583983, "grad_norm": 1.1171875, "learning_rate": 0.00044402910084267717, "loss": 5.1938, "mean_token_accuracy": 0.1970280796289444, "num_tokens": 47311579.0, "step": 21200 }, { "entropy": 5.457720613479614, "epoch": 2.381535351266356, "grad_norm": 1.1640625, "learning_rate": 0.0004440025988479349, "loss": 5.1977, "mean_token_accuracy": 0.2033959746360779, "num_tokens": 47322042.0, "step": 21205 }, { "entropy": 5.470384311676026, "epoch": 2.3820969281743136, "grad_norm": 1.125, "learning_rate": 0.00044397609147208436, "loss": 5.156, "mean_token_accuracy": 0.2049620494246483, "num_tokens": 47332821.0, "step": 21210 }, { "entropy": 5.454410362243652, "epoch": 2.382658505082271, "grad_norm": 1.21875, "learning_rate": 0.0004439495787159695, "loss": 5.2077, "mean_token_accuracy": 0.1985888212919235, "num_tokens": 47344221.0, "step": 21215 }, { "entropy": 5.586800050735474, "epoch": 2.3832200819902285, "grad_norm": 1.1484375, "learning_rate": 0.00044392306058043453, "loss": 5.3565, "mean_token_accuracy": 0.19308149218559265, "num_tokens": 47356424.0, "step": 21220 }, { "entropy": 5.4759235858917235, "epoch": 2.383781658898186, "grad_norm": 1.140625, "learning_rate": 0.0004438965370663238, "loss": 5.1769, "mean_token_accuracy": 0.20478518456220626, "num_tokens": 47367546.0, "step": 21225 }, { "entropy": 5.512812709808349, "epoch": 2.384343235806144, "grad_norm": 1.1796875, "learning_rate": 0.0004438700081744819, "loss": 5.2764, "mean_token_accuracy": 0.1924913927912712, "num_tokens": 47378281.0, "step": 21230 }, { "entropy": 5.460228967666626, "epoch": 2.384904812714101, "grad_norm": 1.1953125, "learning_rate": 0.00044384347390575337, "loss": 5.1493, "mean_token_accuracy": 0.20389873534440994, "num_tokens": 47389233.0, "step": 21235 }, { "entropy": 5.42513484954834, "epoch": 2.3854663896220587, "grad_norm": 1.0859375, "learning_rate": 0.0004438169342609831, "loss": 5.1965, "mean_token_accuracy": 0.19487940967082978, "num_tokens": 47400114.0, "step": 21240 }, { "entropy": 5.627143526077271, "epoch": 2.3860279665300164, "grad_norm": 1.3359375, "learning_rate": 0.00044379038924101627, "loss": 5.374, "mean_token_accuracy": 0.19131412953138352, "num_tokens": 47411926.0, "step": 21245 }, { "entropy": 5.578207778930664, "epoch": 2.3865895434379736, "grad_norm": 1.078125, "learning_rate": 0.0004437638388466979, "loss": 5.2383, "mean_token_accuracy": 0.1985018417239189, "num_tokens": 47424048.0, "step": 21250 }, { "entropy": 5.4164690494537355, "epoch": 2.3871511203459312, "grad_norm": 1.1484375, "learning_rate": 0.00044373728307887353, "loss": 5.148, "mean_token_accuracy": 0.19993937909603118, "num_tokens": 47435581.0, "step": 21255 }, { "entropy": 5.447855997085571, "epoch": 2.387712697253889, "grad_norm": 1.1015625, "learning_rate": 0.00044371072193838857, "loss": 5.1636, "mean_token_accuracy": 0.20491148233413697, "num_tokens": 47446831.0, "step": 21260 }, { "entropy": 5.3792437553405765, "epoch": 2.3882742741618466, "grad_norm": 1.09375, "learning_rate": 0.00044368415542608874, "loss": 5.1374, "mean_token_accuracy": 0.19673147648572922, "num_tokens": 47457885.0, "step": 21265 }, { "entropy": 5.497529602050781, "epoch": 2.3888358510698042, "grad_norm": 1.2265625, "learning_rate": 0.00044365758354282005, "loss": 5.2463, "mean_token_accuracy": 0.19050194919109345, "num_tokens": 47470195.0, "step": 21270 }, { "entropy": 5.492781734466552, "epoch": 2.3893974279777614, "grad_norm": 1.234375, "learning_rate": 0.0004436310062894285, "loss": 5.1939, "mean_token_accuracy": 0.20272512584924698, "num_tokens": 47481068.0, "step": 21275 }, { "entropy": 5.52130765914917, "epoch": 2.389959004885719, "grad_norm": 1.296875, "learning_rate": 0.0004436044236667603, "loss": 5.1542, "mean_token_accuracy": 0.2017817109823227, "num_tokens": 47491409.0, "step": 21280 }, { "entropy": 5.424414110183716, "epoch": 2.3905205817936768, "grad_norm": 1.21875, "learning_rate": 0.0004435778356756618, "loss": 5.2363, "mean_token_accuracy": 0.19426699727773666, "num_tokens": 47504440.0, "step": 21285 }, { "entropy": 5.434523010253907, "epoch": 2.391082158701634, "grad_norm": 1.2890625, "learning_rate": 0.00044355124231697967, "loss": 5.124, "mean_token_accuracy": 0.20635359287261962, "num_tokens": 47514370.0, "step": 21290 }, { "entropy": 5.462828874588013, "epoch": 2.3916437356095916, "grad_norm": 1.2109375, "learning_rate": 0.0004435246435915607, "loss": 5.1682, "mean_token_accuracy": 0.2015223890542984, "num_tokens": 47525415.0, "step": 21295 }, { "entropy": 5.521757555007935, "epoch": 2.3922053125175493, "grad_norm": 1.4453125, "learning_rate": 0.0004434980395002516, "loss": 5.2496, "mean_token_accuracy": 0.19774934351444245, "num_tokens": 47537029.0, "step": 21300 }, { "entropy": 5.470596027374268, "epoch": 2.392766889425507, "grad_norm": 1.15625, "learning_rate": 0.00044347143004389955, "loss": 5.1567, "mean_token_accuracy": 0.19732739329338073, "num_tokens": 47550434.0, "step": 21305 }, { "entropy": 5.438879728317261, "epoch": 2.393328466333464, "grad_norm": 1.1875, "learning_rate": 0.0004434448152233519, "loss": 5.1772, "mean_token_accuracy": 0.20404388010501862, "num_tokens": 47560985.0, "step": 21310 }, { "entropy": 5.51512770652771, "epoch": 2.393890043241422, "grad_norm": 1.3515625, "learning_rate": 0.00044341819503945594, "loss": 5.2735, "mean_token_accuracy": 0.19304731190204621, "num_tokens": 47573207.0, "step": 21315 }, { "entropy": 5.487081050872803, "epoch": 2.3944516201493795, "grad_norm": 1.1640625, "learning_rate": 0.0004433915694930594, "loss": 5.0995, "mean_token_accuracy": 0.21096139401197433, "num_tokens": 47584666.0, "step": 21320 }, { "entropy": 5.474404954910279, "epoch": 2.395013197057337, "grad_norm": 1.25, "learning_rate": 0.0004433649385850099, "loss": 5.1937, "mean_token_accuracy": 0.19833858609199523, "num_tokens": 47598017.0, "step": 21325 }, { "entropy": 5.507979106903076, "epoch": 2.3955747739652944, "grad_norm": 1.171875, "learning_rate": 0.0004433383023161555, "loss": 5.3571, "mean_token_accuracy": 0.18930508196353912, "num_tokens": 47610947.0, "step": 21330 }, { "entropy": 5.5602569580078125, "epoch": 2.396136350873252, "grad_norm": 1.1484375, "learning_rate": 0.0004433116606873443, "loss": 5.2842, "mean_token_accuracy": 0.1920780673623085, "num_tokens": 47621393.0, "step": 21335 }, { "entropy": 5.562190246582031, "epoch": 2.3966979277812097, "grad_norm": 1.390625, "learning_rate": 0.00044328501369942454, "loss": 5.246, "mean_token_accuracy": 0.19772695749998093, "num_tokens": 47631615.0, "step": 21340 }, { "entropy": 5.461170768737793, "epoch": 2.3972595046891674, "grad_norm": 1.265625, "learning_rate": 0.0004432583613532446, "loss": 5.215, "mean_token_accuracy": 0.19658462107181549, "num_tokens": 47642813.0, "step": 21345 }, { "entropy": 5.640759611129761, "epoch": 2.3978210815971246, "grad_norm": 1.3515625, "learning_rate": 0.0004432317036496533, "loss": 5.2835, "mean_token_accuracy": 0.19452656507492067, "num_tokens": 47654012.0, "step": 21350 }, { "entropy": 5.476614236831665, "epoch": 2.3983826585050823, "grad_norm": 1.203125, "learning_rate": 0.00044320504058949916, "loss": 5.1519, "mean_token_accuracy": 0.20887311398983002, "num_tokens": 47664575.0, "step": 21355 }, { "entropy": 5.422935676574707, "epoch": 2.39894423541304, "grad_norm": 1.1875, "learning_rate": 0.0004431783721736314, "loss": 5.2253, "mean_token_accuracy": 0.19494512677192688, "num_tokens": 47674763.0, "step": 21360 }, { "entropy": 5.421364879608154, "epoch": 2.3995058123209976, "grad_norm": 1.3046875, "learning_rate": 0.00044315169840289896, "loss": 5.1746, "mean_token_accuracy": 0.20039768964052201, "num_tokens": 47685435.0, "step": 21365 }, { "entropy": 5.609927320480347, "epoch": 2.400067389228955, "grad_norm": 1.34375, "learning_rate": 0.0004431250192781513, "loss": 5.3662, "mean_token_accuracy": 0.19823579341173173, "num_tokens": 47696634.0, "step": 21370 }, { "entropy": 5.501060819625854, "epoch": 2.4006289661369125, "grad_norm": 1.234375, "learning_rate": 0.0004430983348002378, "loss": 5.2362, "mean_token_accuracy": 0.19303722083568572, "num_tokens": 47707737.0, "step": 21375 }, { "entropy": 5.535626077651978, "epoch": 2.40119054304487, "grad_norm": 1.2109375, "learning_rate": 0.00044307164497000813, "loss": 5.2156, "mean_token_accuracy": 0.19697881042957305, "num_tokens": 47718131.0, "step": 21380 }, { "entropy": 5.419151163101196, "epoch": 2.4017521199528273, "grad_norm": 1.3984375, "learning_rate": 0.00044304494978831204, "loss": 5.1904, "mean_token_accuracy": 0.19738378822803498, "num_tokens": 47730154.0, "step": 21385 }, { "entropy": 5.4863170146942135, "epoch": 2.402313696860785, "grad_norm": 1.390625, "learning_rate": 0.0004430182492559997, "loss": 5.1709, "mean_token_accuracy": 0.19812498688697816, "num_tokens": 47741893.0, "step": 21390 }, { "entropy": 5.505048179626465, "epoch": 2.4028752737687427, "grad_norm": 1.203125, "learning_rate": 0.000442991543373921, "loss": 5.2499, "mean_token_accuracy": 0.19859177023172378, "num_tokens": 47753430.0, "step": 21395 }, { "entropy": 5.3799785614013675, "epoch": 2.4034368506767003, "grad_norm": 1.359375, "learning_rate": 0.0004429648321429264, "loss": 5.159, "mean_token_accuracy": 0.2043390080332756, "num_tokens": 47765181.0, "step": 21400 }, { "entropy": 5.588997793197632, "epoch": 2.4039984275846575, "grad_norm": 1.2890625, "learning_rate": 0.00044293811556386656, "loss": 5.3652, "mean_token_accuracy": 0.18540471643209458, "num_tokens": 47777211.0, "step": 21405 }, { "entropy": 5.46024489402771, "epoch": 2.404560004492615, "grad_norm": 1.2109375, "learning_rate": 0.0004429113936375918, "loss": 5.1676, "mean_token_accuracy": 0.2016657367348671, "num_tokens": 47788397.0, "step": 21410 }, { "entropy": 5.524742555618286, "epoch": 2.405121581400573, "grad_norm": 1.2578125, "learning_rate": 0.00044288466636495323, "loss": 5.2796, "mean_token_accuracy": 0.19366027265787125, "num_tokens": 47799870.0, "step": 21415 }, { "entropy": 5.476950454711914, "epoch": 2.4056831583085305, "grad_norm": 1.1640625, "learning_rate": 0.00044285793374680184, "loss": 5.2725, "mean_token_accuracy": 0.19704962372779847, "num_tokens": 47810696.0, "step": 21420 }, { "entropy": 5.512076807022095, "epoch": 2.4062447352164877, "grad_norm": 1.125, "learning_rate": 0.00044283119578398866, "loss": 5.2361, "mean_token_accuracy": 0.1989618495106697, "num_tokens": 47822579.0, "step": 21425 }, { "entropy": 5.459765291213989, "epoch": 2.4068063121244454, "grad_norm": 1.21875, "learning_rate": 0.0004428044524773651, "loss": 5.1445, "mean_token_accuracy": 0.19508033692836763, "num_tokens": 47832556.0, "step": 21430 }, { "entropy": 5.459570598602295, "epoch": 2.407367889032403, "grad_norm": 1.1953125, "learning_rate": 0.0004427777038277827, "loss": 5.2222, "mean_token_accuracy": 0.19387545585632324, "num_tokens": 47844409.0, "step": 21435 }, { "entropy": 5.482930707931518, "epoch": 2.4079294659403607, "grad_norm": 1.1953125, "learning_rate": 0.00044275094983609313, "loss": 5.1683, "mean_token_accuracy": 0.20039867460727692, "num_tokens": 47855666.0, "step": 21440 }, { "entropy": 5.3964927196502686, "epoch": 2.408491042848318, "grad_norm": 1.3046875, "learning_rate": 0.00044272419050314833, "loss": 5.0914, "mean_token_accuracy": 0.2102293461561203, "num_tokens": 47866261.0, "step": 21445 }, { "entropy": 5.434059476852417, "epoch": 2.4090526197562756, "grad_norm": 1.1171875, "learning_rate": 0.00044269742582980017, "loss": 5.3075, "mean_token_accuracy": 0.19146720468997955, "num_tokens": 47878807.0, "step": 21450 }, { "entropy": 5.467469930648804, "epoch": 2.4096141966642333, "grad_norm": 1.484375, "learning_rate": 0.000442670655816901, "loss": 5.1535, "mean_token_accuracy": 0.20308677107095718, "num_tokens": 47888935.0, "step": 21455 }, { "entropy": 5.539342975616455, "epoch": 2.410175773572191, "grad_norm": 1.3046875, "learning_rate": 0.00044264388046530304, "loss": 5.1845, "mean_token_accuracy": 0.20222682803869246, "num_tokens": 47900208.0, "step": 21460 }, { "entropy": 5.5797394752502445, "epoch": 2.410737350480148, "grad_norm": 1.15625, "learning_rate": 0.00044261709977585893, "loss": 5.3258, "mean_token_accuracy": 0.1934771865606308, "num_tokens": 47911131.0, "step": 21465 }, { "entropy": 5.493864965438843, "epoch": 2.411298927388106, "grad_norm": 1.3515625, "learning_rate": 0.0004425903137494214, "loss": 5.2858, "mean_token_accuracy": 0.19310020953416823, "num_tokens": 47922601.0, "step": 21470 }, { "entropy": 5.562084770202636, "epoch": 2.4118605042960635, "grad_norm": 1.2109375, "learning_rate": 0.0004425635223868433, "loss": 5.2483, "mean_token_accuracy": 0.19078425019979478, "num_tokens": 47933168.0, "step": 21475 }, { "entropy": 5.567868947982788, "epoch": 2.4124220812040207, "grad_norm": 1.4765625, "learning_rate": 0.00044253672568897754, "loss": 5.326, "mean_token_accuracy": 0.18399229794740676, "num_tokens": 47945433.0, "step": 21480 }, { "entropy": 5.510581064224243, "epoch": 2.4129836581119783, "grad_norm": 1.3515625, "learning_rate": 0.0004425099236566775, "loss": 5.253, "mean_token_accuracy": 0.19290145188570024, "num_tokens": 47957513.0, "step": 21485 }, { "entropy": 5.476819801330566, "epoch": 2.413545235019936, "grad_norm": 1.359375, "learning_rate": 0.00044248311629079657, "loss": 5.1942, "mean_token_accuracy": 0.19590148329734802, "num_tokens": 47968817.0, "step": 21490 }, { "entropy": 5.492171716690064, "epoch": 2.4141068119278937, "grad_norm": 1.265625, "learning_rate": 0.0004424563035921882, "loss": 5.1331, "mean_token_accuracy": 0.2000505194067955, "num_tokens": 47979034.0, "step": 21495 }, { "entropy": 5.542651653289795, "epoch": 2.414668388835851, "grad_norm": 1.15625, "learning_rate": 0.00044242948556170634, "loss": 5.2197, "mean_token_accuracy": 0.2020846948027611, "num_tokens": 47990459.0, "step": 21500 }, { "entropy": 5.4815925598144535, "epoch": 2.4152299657438085, "grad_norm": 1.5859375, "learning_rate": 0.00044240266220020455, "loss": 5.2593, "mean_token_accuracy": 0.19531419426202773, "num_tokens": 48000007.0, "step": 21505 }, { "entropy": 5.507301902770996, "epoch": 2.415791542651766, "grad_norm": 1.21875, "learning_rate": 0.0004423758335085371, "loss": 5.2188, "mean_token_accuracy": 0.19626193791627883, "num_tokens": 48012962.0, "step": 21510 }, { "entropy": 5.465673303604126, "epoch": 2.416353119559724, "grad_norm": 1.15625, "learning_rate": 0.00044234899948755827, "loss": 5.2093, "mean_token_accuracy": 0.1957627147436142, "num_tokens": 48025916.0, "step": 21515 }, { "entropy": 5.455223655700683, "epoch": 2.416914696467681, "grad_norm": 1.28125, "learning_rate": 0.00044232216013812226, "loss": 5.2095, "mean_token_accuracy": 0.20134610384702684, "num_tokens": 48036255.0, "step": 21520 }, { "entropy": 5.489645862579346, "epoch": 2.4174762733756388, "grad_norm": 1.2421875, "learning_rate": 0.0004422953154610838, "loss": 5.2089, "mean_token_accuracy": 0.20038269311189652, "num_tokens": 48045943.0, "step": 21525 }, { "entropy": 5.406678152084351, "epoch": 2.4180378502835964, "grad_norm": 1.140625, "learning_rate": 0.0004422684654572977, "loss": 5.1716, "mean_token_accuracy": 0.20007821619510652, "num_tokens": 48056562.0, "step": 21530 }, { "entropy": 5.414686012268066, "epoch": 2.418599427191554, "grad_norm": 1.2109375, "learning_rate": 0.00044224161012761874, "loss": 5.1455, "mean_token_accuracy": 0.19966147243976592, "num_tokens": 48066997.0, "step": 21535 }, { "entropy": 5.52472152709961, "epoch": 2.4191610040995113, "grad_norm": 1.3359375, "learning_rate": 0.00044221474947290205, "loss": 5.2624, "mean_token_accuracy": 0.19443010538816452, "num_tokens": 48077810.0, "step": 21540 }, { "entropy": 5.542490816116333, "epoch": 2.419722581007469, "grad_norm": 1.125, "learning_rate": 0.0004421878834940029, "loss": 5.3266, "mean_token_accuracy": 0.18872090429067612, "num_tokens": 48089422.0, "step": 21545 }, { "entropy": 5.4717436790466305, "epoch": 2.4202841579154266, "grad_norm": 1.3125, "learning_rate": 0.00044216101219177667, "loss": 5.18, "mean_token_accuracy": 0.19570807367563248, "num_tokens": 48101114.0, "step": 21550 }, { "entropy": 5.48274073600769, "epoch": 2.4208457348233843, "grad_norm": 1.125, "learning_rate": 0.00044213413556707905, "loss": 5.1681, "mean_token_accuracy": 0.2029666617512703, "num_tokens": 48110991.0, "step": 21555 }, { "entropy": 5.508170175552368, "epoch": 2.4214073117313415, "grad_norm": 1.21875, "learning_rate": 0.0004421072536207656, "loss": 5.2141, "mean_token_accuracy": 0.2002914935350418, "num_tokens": 48122889.0, "step": 21560 }, { "entropy": 5.533147811889648, "epoch": 2.421968888639299, "grad_norm": 1.28125, "learning_rate": 0.00044208036635369247, "loss": 5.2218, "mean_token_accuracy": 0.20043204873800277, "num_tokens": 48133586.0, "step": 21565 }, { "entropy": 5.443800926208496, "epoch": 2.422530465547257, "grad_norm": 1.1015625, "learning_rate": 0.0004420534737667157, "loss": 5.1527, "mean_token_accuracy": 0.20333350151777269, "num_tokens": 48144060.0, "step": 21570 }, { "entropy": 5.54448938369751, "epoch": 2.423092042455214, "grad_norm": 1.265625, "learning_rate": 0.00044202657586069153, "loss": 5.2599, "mean_token_accuracy": 0.2001522049307823, "num_tokens": 48155197.0, "step": 21575 }, { "entropy": 5.5493550300598145, "epoch": 2.4236536193631717, "grad_norm": 1.1875, "learning_rate": 0.00044199967263647635, "loss": 5.3169, "mean_token_accuracy": 0.19386566579341888, "num_tokens": 48166990.0, "step": 21580 }, { "entropy": 5.567315483093262, "epoch": 2.4242151962711294, "grad_norm": 1.1484375, "learning_rate": 0.0004419727640949268, "loss": 5.3224, "mean_token_accuracy": 0.18650861829519272, "num_tokens": 48179454.0, "step": 21585 }, { "entropy": 5.418863344192505, "epoch": 2.424776773179087, "grad_norm": 1.1796875, "learning_rate": 0.0004419458502368998, "loss": 5.1721, "mean_token_accuracy": 0.20034961998462678, "num_tokens": 48192009.0, "step": 21590 }, { "entropy": 5.5574883937835695, "epoch": 2.4253383500870442, "grad_norm": 1.1953125, "learning_rate": 0.00044191893106325207, "loss": 5.2552, "mean_token_accuracy": 0.197950841486454, "num_tokens": 48203111.0, "step": 21595 }, { "entropy": 5.595216894149781, "epoch": 2.425899926995002, "grad_norm": 1.15625, "learning_rate": 0.0004418920065748409, "loss": 5.4157, "mean_token_accuracy": 0.1881189227104187, "num_tokens": 48214766.0, "step": 21600 }, { "entropy": 5.544545269012451, "epoch": 2.4264615039029596, "grad_norm": 1.1796875, "learning_rate": 0.00044186507677252345, "loss": 5.3159, "mean_token_accuracy": 0.2030021384358406, "num_tokens": 48225061.0, "step": 21605 }, { "entropy": 5.469171810150146, "epoch": 2.427023080810917, "grad_norm": 1.140625, "learning_rate": 0.0004418381416571573, "loss": 5.2038, "mean_token_accuracy": 0.19727595150470734, "num_tokens": 48236101.0, "step": 21610 }, { "entropy": 5.4103844165802, "epoch": 2.4275846577188744, "grad_norm": 1.1796875, "learning_rate": 0.0004418112012296, "loss": 5.1742, "mean_token_accuracy": 0.1981567308306694, "num_tokens": 48248080.0, "step": 21615 }, { "entropy": 5.42638144493103, "epoch": 2.428146234626832, "grad_norm": 1.484375, "learning_rate": 0.00044178425549070934, "loss": 5.1343, "mean_token_accuracy": 0.20125969499349594, "num_tokens": 48259177.0, "step": 21620 }, { "entropy": 5.496696472167969, "epoch": 2.4287078115347898, "grad_norm": 1.203125, "learning_rate": 0.00044175730444134326, "loss": 5.1755, "mean_token_accuracy": 0.19469186514616013, "num_tokens": 48271345.0, "step": 21625 }, { "entropy": 5.517582368850708, "epoch": 2.4292693884427474, "grad_norm": 1.125, "learning_rate": 0.00044173034808236, "loss": 5.2608, "mean_token_accuracy": 0.19164094030857087, "num_tokens": 48284219.0, "step": 21630 }, { "entropy": 5.498813247680664, "epoch": 2.4298309653507046, "grad_norm": 1.2265625, "learning_rate": 0.0004417033864146177, "loss": 5.1755, "mean_token_accuracy": 0.19849569201469422, "num_tokens": 48294626.0, "step": 21635 }, { "entropy": 5.380316543579101, "epoch": 2.4303925422586623, "grad_norm": 1.171875, "learning_rate": 0.0004416764194389751, "loss": 5.1676, "mean_token_accuracy": 0.1984646886587143, "num_tokens": 48305459.0, "step": 21640 }, { "entropy": 5.464716053009033, "epoch": 2.43095411916662, "grad_norm": 1.140625, "learning_rate": 0.0004416494471562904, "loss": 5.1715, "mean_token_accuracy": 0.2041002705693245, "num_tokens": 48316232.0, "step": 21645 }, { "entropy": 5.470191144943238, "epoch": 2.4315156960745776, "grad_norm": 1.140625, "learning_rate": 0.0004416224695674229, "loss": 5.145, "mean_token_accuracy": 0.2063722714781761, "num_tokens": 48326711.0, "step": 21650 }, { "entropy": 5.318240833282471, "epoch": 2.432077272982535, "grad_norm": 1.4140625, "learning_rate": 0.00044159548667323126, "loss": 4.9612, "mean_token_accuracy": 0.22063706517219545, "num_tokens": 48336860.0, "step": 21655 }, { "entropy": 5.347515010833741, "epoch": 2.4326388498904925, "grad_norm": 1.3046875, "learning_rate": 0.0004415684984745747, "loss": 5.2694, "mean_token_accuracy": 0.19604750275611876, "num_tokens": 48348503.0, "step": 21660 }, { "entropy": 5.524180173873901, "epoch": 2.43320042679845, "grad_norm": 1.109375, "learning_rate": 0.0004415415049723126, "loss": 5.2929, "mean_token_accuracy": 0.19336607158184052, "num_tokens": 48359855.0, "step": 21665 }, { "entropy": 5.56565842628479, "epoch": 2.4337620037064074, "grad_norm": 1.265625, "learning_rate": 0.0004415145061673043, "loss": 5.2444, "mean_token_accuracy": 0.1919916331768036, "num_tokens": 48370188.0, "step": 21670 }, { "entropy": 5.478146171569824, "epoch": 2.434323580614365, "grad_norm": 1.2265625, "learning_rate": 0.0004414875020604096, "loss": 5.1624, "mean_token_accuracy": 0.20773671567440033, "num_tokens": 48381152.0, "step": 21675 }, { "entropy": 5.454023694992065, "epoch": 2.4348851575223227, "grad_norm": 1.171875, "learning_rate": 0.0004414604926524882, "loss": 5.2145, "mean_token_accuracy": 0.1982116147875786, "num_tokens": 48392721.0, "step": 21680 }, { "entropy": 5.455103158950806, "epoch": 2.4354467344302804, "grad_norm": 1.1015625, "learning_rate": 0.0004414334779444002, "loss": 5.1895, "mean_token_accuracy": 0.1979516863822937, "num_tokens": 48404071.0, "step": 21685 }, { "entropy": 5.473447799682617, "epoch": 2.4360083113382376, "grad_norm": 1.171875, "learning_rate": 0.00044140645793700573, "loss": 5.2013, "mean_token_accuracy": 0.19501965045928954, "num_tokens": 48416001.0, "step": 21690 }, { "entropy": 5.4764386177062985, "epoch": 2.4365698882461952, "grad_norm": 1.0625, "learning_rate": 0.00044137943263116515, "loss": 5.204, "mean_token_accuracy": 0.19583554565906525, "num_tokens": 48426880.0, "step": 21695 }, { "entropy": 5.583257532119751, "epoch": 2.437131465154153, "grad_norm": 1.2578125, "learning_rate": 0.0004413524020277388, "loss": 5.3075, "mean_token_accuracy": 0.19080916196107864, "num_tokens": 48437147.0, "step": 21700 }, { "entropy": 5.4255836486816404, "epoch": 2.4376930420621106, "grad_norm": 1.1953125, "learning_rate": 0.0004413253661275875, "loss": 5.0882, "mean_token_accuracy": 0.2037639334797859, "num_tokens": 48448706.0, "step": 21705 }, { "entropy": 5.435296058654785, "epoch": 2.438254618970068, "grad_norm": 1.3046875, "learning_rate": 0.00044129832493157195, "loss": 5.1096, "mean_token_accuracy": 0.20613910853862763, "num_tokens": 48458873.0, "step": 21710 }, { "entropy": 5.489786100387573, "epoch": 2.4388161958780255, "grad_norm": 1.234375, "learning_rate": 0.00044127127844055335, "loss": 5.2789, "mean_token_accuracy": 0.19208460450172424, "num_tokens": 48470726.0, "step": 21715 }, { "entropy": 5.503612422943116, "epoch": 2.439377772785983, "grad_norm": 1.09375, "learning_rate": 0.00044124422665539273, "loss": 5.103, "mean_token_accuracy": 0.20683069825172423, "num_tokens": 48481912.0, "step": 21720 }, { "entropy": 5.476216745376587, "epoch": 2.4399393496939408, "grad_norm": 1.203125, "learning_rate": 0.0004412171695769515, "loss": 5.228, "mean_token_accuracy": 0.20174122005701065, "num_tokens": 48492048.0, "step": 21725 }, { "entropy": 5.468652677536011, "epoch": 2.440500926601898, "grad_norm": 1.125, "learning_rate": 0.00044119010720609106, "loss": 5.2593, "mean_token_accuracy": 0.19893279373645784, "num_tokens": 48503190.0, "step": 21730 }, { "entropy": 5.560579586029053, "epoch": 2.4410625035098557, "grad_norm": 1.078125, "learning_rate": 0.00044116303954367314, "loss": 5.1611, "mean_token_accuracy": 0.19728001654148103, "num_tokens": 48514956.0, "step": 21735 }, { "entropy": 5.579486322402954, "epoch": 2.4416240804178133, "grad_norm": 1.171875, "learning_rate": 0.0004411359665905596, "loss": 5.3054, "mean_token_accuracy": 0.19709682762622832, "num_tokens": 48526372.0, "step": 21740 }, { "entropy": 5.377999258041382, "epoch": 2.442185657325771, "grad_norm": 1.2109375, "learning_rate": 0.0004411088883476125, "loss": 5.1493, "mean_token_accuracy": 0.20003522783517838, "num_tokens": 48536985.0, "step": 21745 }, { "entropy": 5.459693336486817, "epoch": 2.442747234233728, "grad_norm": 1.109375, "learning_rate": 0.00044108180481569387, "loss": 5.2078, "mean_token_accuracy": 0.20046344995498658, "num_tokens": 48547505.0, "step": 21750 }, { "entropy": 5.511417961120605, "epoch": 2.443308811141686, "grad_norm": 1.390625, "learning_rate": 0.00044105471599566626, "loss": 5.2378, "mean_token_accuracy": 0.19674644917249678, "num_tokens": 48560104.0, "step": 21755 }, { "entropy": 5.521594619750976, "epoch": 2.4438703880496435, "grad_norm": 1.109375, "learning_rate": 0.000441027621888392, "loss": 5.3197, "mean_token_accuracy": 0.19993076771497725, "num_tokens": 48571203.0, "step": 21760 }, { "entropy": 5.4625563621521, "epoch": 2.4444319649576007, "grad_norm": 1.1328125, "learning_rate": 0.00044100052249473393, "loss": 5.1109, "mean_token_accuracy": 0.19899989515542985, "num_tokens": 48581480.0, "step": 21765 }, { "entropy": 5.509932231903076, "epoch": 2.4449935418655584, "grad_norm": 1.5078125, "learning_rate": 0.0004409734178155548, "loss": 5.1919, "mean_token_accuracy": 0.20069716721773148, "num_tokens": 48592811.0, "step": 21770 }, { "entropy": 5.420577096939087, "epoch": 2.445555118773516, "grad_norm": 1.171875, "learning_rate": 0.0004409463078517178, "loss": 5.2034, "mean_token_accuracy": 0.203411503136158, "num_tokens": 48604245.0, "step": 21775 }, { "entropy": 5.5184472560882565, "epoch": 2.4461166956814737, "grad_norm": 1.296875, "learning_rate": 0.00044091919260408585, "loss": 5.1847, "mean_token_accuracy": 0.20057608783245087, "num_tokens": 48615138.0, "step": 21780 }, { "entropy": 5.48538908958435, "epoch": 2.446678272589431, "grad_norm": 1.140625, "learning_rate": 0.0004408920720735225, "loss": 5.2473, "mean_token_accuracy": 0.19808796793222427, "num_tokens": 48626084.0, "step": 21785 }, { "entropy": 5.453407573699951, "epoch": 2.4472398494973886, "grad_norm": 1.1328125, "learning_rate": 0.00044086494626089127, "loss": 5.1067, "mean_token_accuracy": 0.1999150887131691, "num_tokens": 48636425.0, "step": 21790 }, { "entropy": 5.417506361007691, "epoch": 2.4478014264053463, "grad_norm": 1.171875, "learning_rate": 0.0004408378151670558, "loss": 5.2456, "mean_token_accuracy": 0.1862782880663872, "num_tokens": 48646941.0, "step": 21795 }, { "entropy": 5.443913698196411, "epoch": 2.448363003313304, "grad_norm": 1.1875, "learning_rate": 0.00044081067879288, "loss": 5.1036, "mean_token_accuracy": 0.20425938665866852, "num_tokens": 48657481.0, "step": 21800 }, { "entropy": 5.540360164642334, "epoch": 2.448924580221261, "grad_norm": 1.21875, "learning_rate": 0.0004407835371392279, "loss": 5.2293, "mean_token_accuracy": 0.19924686402082442, "num_tokens": 48669306.0, "step": 21805 }, { "entropy": 5.438464879989624, "epoch": 2.449486157129219, "grad_norm": 1.2265625, "learning_rate": 0.0004407563902069636, "loss": 5.1822, "mean_token_accuracy": 0.20206608772277831, "num_tokens": 48680789.0, "step": 21810 }, { "entropy": 5.499397230148316, "epoch": 2.4500477340371765, "grad_norm": 1.3046875, "learning_rate": 0.0004407292379969515, "loss": 5.2781, "mean_token_accuracy": 0.19427161812782287, "num_tokens": 48691811.0, "step": 21815 }, { "entropy": 5.505946969985962, "epoch": 2.450609310945134, "grad_norm": 1.2109375, "learning_rate": 0.0004407020805100563, "loss": 5.268, "mean_token_accuracy": 0.19791758358478545, "num_tokens": 48704248.0, "step": 21820 }, { "entropy": 5.492702436447144, "epoch": 2.4511708878530913, "grad_norm": 1.1328125, "learning_rate": 0.0004406749177471425, "loss": 5.1747, "mean_token_accuracy": 0.20821383446455002, "num_tokens": 48714452.0, "step": 21825 }, { "entropy": 5.477393770217896, "epoch": 2.451732464761049, "grad_norm": 1.109375, "learning_rate": 0.00044064774970907516, "loss": 5.1556, "mean_token_accuracy": 0.20354018807411195, "num_tokens": 48725481.0, "step": 21830 }, { "entropy": 5.532561540603638, "epoch": 2.4522940416690067, "grad_norm": 1.2578125, "learning_rate": 0.0004406205763967193, "loss": 5.2707, "mean_token_accuracy": 0.1989121988415718, "num_tokens": 48737704.0, "step": 21835 }, { "entropy": 5.521845436096191, "epoch": 2.4528556185769643, "grad_norm": 1.3046875, "learning_rate": 0.0004405933978109398, "loss": 5.2581, "mean_token_accuracy": 0.1946515366435051, "num_tokens": 48749085.0, "step": 21840 }, { "entropy": 5.5241645812988285, "epoch": 2.4534171954849215, "grad_norm": 1.3046875, "learning_rate": 0.00044056621395260247, "loss": 5.2389, "mean_token_accuracy": 0.19579836428165437, "num_tokens": 48759432.0, "step": 21845 }, { "entropy": 5.38377537727356, "epoch": 2.453978772392879, "grad_norm": 1.2265625, "learning_rate": 0.00044053902482257265, "loss": 5.1048, "mean_token_accuracy": 0.1968403398990631, "num_tokens": 48769549.0, "step": 21850 }, { "entropy": 5.428978109359742, "epoch": 2.454540349300837, "grad_norm": 1.15625, "learning_rate": 0.000440511830421716, "loss": 5.1542, "mean_token_accuracy": 0.20203926116228105, "num_tokens": 48779630.0, "step": 21855 }, { "entropy": 5.5175073623657225, "epoch": 2.455101926208794, "grad_norm": 1.1953125, "learning_rate": 0.0004404846307508985, "loss": 5.2374, "mean_token_accuracy": 0.19475793093442917, "num_tokens": 48790489.0, "step": 21860 }, { "entropy": 5.581151103973388, "epoch": 2.4556635031167517, "grad_norm": 1.1171875, "learning_rate": 0.00044045742581098624, "loss": 5.2892, "mean_token_accuracy": 0.19683291167020797, "num_tokens": 48802310.0, "step": 21865 }, { "entropy": 5.43082184791565, "epoch": 2.4562250800247094, "grad_norm": 1.1875, "learning_rate": 0.0004404302156028453, "loss": 5.1457, "mean_token_accuracy": 0.20765147358179092, "num_tokens": 48812066.0, "step": 21870 }, { "entropy": 5.533325910568237, "epoch": 2.456786656932667, "grad_norm": 1.234375, "learning_rate": 0.00044040300012734217, "loss": 5.3751, "mean_token_accuracy": 0.18804677575826645, "num_tokens": 48824477.0, "step": 21875 }, { "entropy": 5.545376491546631, "epoch": 2.4573482338406243, "grad_norm": 1.109375, "learning_rate": 0.0004403757793853434, "loss": 5.2161, "mean_token_accuracy": 0.1918596476316452, "num_tokens": 48835147.0, "step": 21880 }, { "entropy": 5.436745023727417, "epoch": 2.457909810748582, "grad_norm": 1.2578125, "learning_rate": 0.0004403485533777157, "loss": 5.2452, "mean_token_accuracy": 0.19451164007186889, "num_tokens": 48846147.0, "step": 21885 }, { "entropy": 5.581682920455933, "epoch": 2.4584713876565396, "grad_norm": 1.3359375, "learning_rate": 0.0004403213221053258, "loss": 5.3094, "mean_token_accuracy": 0.19171257615089415, "num_tokens": 48857340.0, "step": 21890 }, { "entropy": 5.432861423492431, "epoch": 2.4590329645644973, "grad_norm": 1.1484375, "learning_rate": 0.00044029408556904093, "loss": 5.1574, "mean_token_accuracy": 0.2004673019051552, "num_tokens": 48868256.0, "step": 21895 }, { "entropy": 5.587519788742066, "epoch": 2.4595945414724545, "grad_norm": 1.078125, "learning_rate": 0.0004402668437697283, "loss": 5.2699, "mean_token_accuracy": 0.19470858573913574, "num_tokens": 48879346.0, "step": 21900 }, { "entropy": 5.5088897228240965, "epoch": 2.460156118380412, "grad_norm": 1.6640625, "learning_rate": 0.00044023959670825533, "loss": 5.3029, "mean_token_accuracy": 0.18948156833648683, "num_tokens": 48890939.0, "step": 21905 }, { "entropy": 5.495760679244995, "epoch": 2.46071769528837, "grad_norm": 1.359375, "learning_rate": 0.0004402123443854894, "loss": 5.2963, "mean_token_accuracy": 0.19572442770004272, "num_tokens": 48902239.0, "step": 21910 }, { "entropy": 5.535546922683716, "epoch": 2.4612792721963275, "grad_norm": 1.1796875, "learning_rate": 0.0004401850868022984, "loss": 5.2571, "mean_token_accuracy": 0.19931843429803847, "num_tokens": 48913810.0, "step": 21915 }, { "entropy": 5.428094720840454, "epoch": 2.4618408491042847, "grad_norm": 1.5703125, "learning_rate": 0.0004401578239595501, "loss": 5.1343, "mean_token_accuracy": 0.2021462619304657, "num_tokens": 48925180.0, "step": 21920 }, { "entropy": 5.452257299423218, "epoch": 2.4624024260122424, "grad_norm": 1.171875, "learning_rate": 0.00044013055585811274, "loss": 5.2308, "mean_token_accuracy": 0.1900040999054909, "num_tokens": 48937067.0, "step": 21925 }, { "entropy": 5.523362016677856, "epoch": 2.4629640029202, "grad_norm": 1.109375, "learning_rate": 0.00044010328249885434, "loss": 5.2799, "mean_token_accuracy": 0.19059958010911943, "num_tokens": 48949220.0, "step": 21930 }, { "entropy": 5.5175337314605715, "epoch": 2.4635255798281577, "grad_norm": 1.3359375, "learning_rate": 0.0004400760038826434, "loss": 5.222, "mean_token_accuracy": 0.1970979243516922, "num_tokens": 48960604.0, "step": 21935 }, { "entropy": 5.439581394195557, "epoch": 2.464087156736115, "grad_norm": 1.234375, "learning_rate": 0.00044004872001034856, "loss": 5.1474, "mean_token_accuracy": 0.20640051662921904, "num_tokens": 48970561.0, "step": 21940 }, { "entropy": 5.477488899230957, "epoch": 2.4646487336440726, "grad_norm": 1.2265625, "learning_rate": 0.0004400214308828384, "loss": 5.2323, "mean_token_accuracy": 0.19332142323255538, "num_tokens": 48981639.0, "step": 21945 }, { "entropy": 5.587163972854614, "epoch": 2.46521031055203, "grad_norm": 2.328125, "learning_rate": 0.00043999413650098193, "loss": 5.2597, "mean_token_accuracy": 0.19523866027593612, "num_tokens": 48992872.0, "step": 21950 }, { "entropy": 5.494712686538696, "epoch": 2.4657718874599874, "grad_norm": 1.1875, "learning_rate": 0.0004399668368656481, "loss": 5.2396, "mean_token_accuracy": 0.19345155358314514, "num_tokens": 49004942.0, "step": 21955 }, { "entropy": 5.554857301712036, "epoch": 2.466333464367945, "grad_norm": 1.125, "learning_rate": 0.0004399395319777062, "loss": 5.2049, "mean_token_accuracy": 0.19897417575120926, "num_tokens": 49016493.0, "step": 21960 }, { "entropy": 5.5130510330200195, "epoch": 2.4668950412759028, "grad_norm": 1.2421875, "learning_rate": 0.00043991222183802564, "loss": 5.2279, "mean_token_accuracy": 0.19936139434576033, "num_tokens": 49027780.0, "step": 21965 }, { "entropy": 5.462654781341553, "epoch": 2.4674566181838604, "grad_norm": 1.2265625, "learning_rate": 0.000439884906447476, "loss": 5.2214, "mean_token_accuracy": 0.2021893158555031, "num_tokens": 49039441.0, "step": 21970 }, { "entropy": 5.486788558959961, "epoch": 2.4680181950918176, "grad_norm": 1.21875, "learning_rate": 0.000439857585806927, "loss": 5.2275, "mean_token_accuracy": 0.20156155675649642, "num_tokens": 49050740.0, "step": 21975 }, { "entropy": 5.44096884727478, "epoch": 2.4685797719997753, "grad_norm": 1.1953125, "learning_rate": 0.00043983025991724847, "loss": 5.1937, "mean_token_accuracy": 0.20292574316263198, "num_tokens": 49062216.0, "step": 21980 }, { "entropy": 5.4507551193237305, "epoch": 2.469141348907733, "grad_norm": 1.1796875, "learning_rate": 0.0004398029287793106, "loss": 5.1409, "mean_token_accuracy": 0.2044414147734642, "num_tokens": 49072848.0, "step": 21985 }, { "entropy": 5.417329263687134, "epoch": 2.4697029258156906, "grad_norm": 1.15625, "learning_rate": 0.00043977559239398353, "loss": 5.113, "mean_token_accuracy": 0.20254876464605331, "num_tokens": 49083382.0, "step": 21990 }, { "entropy": 5.438059234619141, "epoch": 2.470264502723648, "grad_norm": 1.1484375, "learning_rate": 0.0004397482507621376, "loss": 5.157, "mean_token_accuracy": 0.20100490599870682, "num_tokens": 49095102.0, "step": 21995 }, { "entropy": 5.436920309066773, "epoch": 2.4708260796316055, "grad_norm": 1.2578125, "learning_rate": 0.0004397209038846436, "loss": 5.18, "mean_token_accuracy": 0.1987630844116211, "num_tokens": 49105964.0, "step": 22000 }, { "entropy": 5.499797201156616, "epoch": 2.471387656539563, "grad_norm": 1.2421875, "learning_rate": 0.00043969355176237207, "loss": 5.2966, "mean_token_accuracy": 0.18655095845460892, "num_tokens": 49117748.0, "step": 22005 }, { "entropy": 5.416675806045532, "epoch": 2.471949233447521, "grad_norm": 1.203125, "learning_rate": 0.0004396661943961941, "loss": 5.038, "mean_token_accuracy": 0.20946522504091264, "num_tokens": 49128217.0, "step": 22010 }, { "entropy": 5.483416557312012, "epoch": 2.472510810355478, "grad_norm": 1.171875, "learning_rate": 0.0004396388317869805, "loss": 5.3003, "mean_token_accuracy": 0.19545274823904038, "num_tokens": 49139272.0, "step": 22015 }, { "entropy": 5.467224025726319, "epoch": 2.4730723872634357, "grad_norm": 1.265625, "learning_rate": 0.0004396114639356027, "loss": 5.1912, "mean_token_accuracy": 0.19524904191493989, "num_tokens": 49149570.0, "step": 22020 }, { "entropy": 5.424163293838501, "epoch": 2.4736339641713934, "grad_norm": 1.4140625, "learning_rate": 0.000439584090842932, "loss": 5.1432, "mean_token_accuracy": 0.20249621123075484, "num_tokens": 49160892.0, "step": 22025 }, { "entropy": 5.456919622421265, "epoch": 2.474195541079351, "grad_norm": 1.3515625, "learning_rate": 0.00043955671250984005, "loss": 5.1554, "mean_token_accuracy": 0.19948485046625136, "num_tokens": 49172476.0, "step": 22030 }, { "entropy": 5.538638353347778, "epoch": 2.4747571179873082, "grad_norm": 1.2578125, "learning_rate": 0.00043952932893719847, "loss": 5.2515, "mean_token_accuracy": 0.20217922627925872, "num_tokens": 49184052.0, "step": 22035 }, { "entropy": 5.451108980178833, "epoch": 2.475318694895266, "grad_norm": 1.1484375, "learning_rate": 0.0004395019401258794, "loss": 5.2382, "mean_token_accuracy": 0.191593736410141, "num_tokens": 49195441.0, "step": 22040 }, { "entropy": 5.394437646865844, "epoch": 2.4758802718032236, "grad_norm": 1.109375, "learning_rate": 0.00043947454607675464, "loss": 5.1473, "mean_token_accuracy": 0.20122386366128922, "num_tokens": 49206395.0, "step": 22045 }, { "entropy": 5.50679383277893, "epoch": 2.476441848711181, "grad_norm": 1.2734375, "learning_rate": 0.0004394471467906966, "loss": 5.2255, "mean_token_accuracy": 0.19376638978719712, "num_tokens": 49217705.0, "step": 22050 }, { "entropy": 5.476305437088013, "epoch": 2.4770034256191384, "grad_norm": 1.140625, "learning_rate": 0.00043941974226857763, "loss": 5.0971, "mean_token_accuracy": 0.20508005619049072, "num_tokens": 49228348.0, "step": 22055 }, { "entropy": 5.401055812835693, "epoch": 2.477565002527096, "grad_norm": 1.1640625, "learning_rate": 0.0004393923325112702, "loss": 5.1686, "mean_token_accuracy": 0.19700507819652557, "num_tokens": 49239031.0, "step": 22060 }, { "entropy": 5.494280433654785, "epoch": 2.4781265794350538, "grad_norm": 1.375, "learning_rate": 0.0004393649175196472, "loss": 5.2852, "mean_token_accuracy": 0.19698485136032104, "num_tokens": 49250918.0, "step": 22065 }, { "entropy": 5.4980357646942135, "epoch": 2.478688156343011, "grad_norm": 1.09375, "learning_rate": 0.0004393374972945815, "loss": 5.2338, "mean_token_accuracy": 0.19626788049936295, "num_tokens": 49262305.0, "step": 22070 }, { "entropy": 5.432592868804932, "epoch": 2.4792497332509686, "grad_norm": 1.109375, "learning_rate": 0.00043931007183694616, "loss": 5.1535, "mean_token_accuracy": 0.19390892535448073, "num_tokens": 49273106.0, "step": 22075 }, { "entropy": 5.387322902679443, "epoch": 2.4798113101589263, "grad_norm": 1.03125, "learning_rate": 0.00043928264114761437, "loss": 5.1157, "mean_token_accuracy": 0.208780637383461, "num_tokens": 49284519.0, "step": 22080 }, { "entropy": 5.422154474258423, "epoch": 2.480372887066884, "grad_norm": 1.2578125, "learning_rate": 0.00043925520522745953, "loss": 5.1449, "mean_token_accuracy": 0.2027816042304039, "num_tokens": 49295753.0, "step": 22085 }, { "entropy": 5.475007152557373, "epoch": 2.480934463974841, "grad_norm": 1.34375, "learning_rate": 0.0004392277640773553, "loss": 5.239, "mean_token_accuracy": 0.20320538878440858, "num_tokens": 49307682.0, "step": 22090 }, { "entropy": 5.445680761337281, "epoch": 2.481496040882799, "grad_norm": 1.171875, "learning_rate": 0.00043920031769817543, "loss": 5.1785, "mean_token_accuracy": 0.19945676475763321, "num_tokens": 49318445.0, "step": 22095 }, { "entropy": 5.479609203338623, "epoch": 2.4820576177907565, "grad_norm": 1.1640625, "learning_rate": 0.00043917286609079364, "loss": 5.3012, "mean_token_accuracy": 0.19467789083719253, "num_tokens": 49328559.0, "step": 22100 }, { "entropy": 5.451708126068115, "epoch": 2.482619194698714, "grad_norm": 1.1640625, "learning_rate": 0.00043914540925608426, "loss": 5.1993, "mean_token_accuracy": 0.19196963608264922, "num_tokens": 49340177.0, "step": 22105 }, { "entropy": 5.479378271102905, "epoch": 2.4831807716066714, "grad_norm": 1.1875, "learning_rate": 0.0004391179471949213, "loss": 5.1648, "mean_token_accuracy": 0.20082276165485383, "num_tokens": 49351214.0, "step": 22110 }, { "entropy": 5.456046485900879, "epoch": 2.483742348514629, "grad_norm": 1.09375, "learning_rate": 0.00043909047990817917, "loss": 5.2031, "mean_token_accuracy": 0.20369723588228225, "num_tokens": 49362697.0, "step": 22115 }, { "entropy": 5.489879846572876, "epoch": 2.4843039254225867, "grad_norm": 1.0859375, "learning_rate": 0.00043906300739673265, "loss": 5.1976, "mean_token_accuracy": 0.19850983321666718, "num_tokens": 49374439.0, "step": 22120 }, { "entropy": 5.426640176773072, "epoch": 2.4848655023305444, "grad_norm": 1.1328125, "learning_rate": 0.00043903552966145624, "loss": 5.1042, "mean_token_accuracy": 0.19865205734968186, "num_tokens": 49385834.0, "step": 22125 }, { "entropy": 5.398649120330811, "epoch": 2.4854270792385016, "grad_norm": 1.140625, "learning_rate": 0.000439008046703225, "loss": 5.1314, "mean_token_accuracy": 0.20927066951990128, "num_tokens": 49396562.0, "step": 22130 }, { "entropy": 5.3768110275268555, "epoch": 2.4859886561464593, "grad_norm": 1.0859375, "learning_rate": 0.000438980558522914, "loss": 5.1646, "mean_token_accuracy": 0.19566589295864106, "num_tokens": 49407339.0, "step": 22135 }, { "entropy": 5.489607906341552, "epoch": 2.486550233054417, "grad_norm": 1.1484375, "learning_rate": 0.0004389530651213983, "loss": 5.1722, "mean_token_accuracy": 0.20103365033864976, "num_tokens": 49419190.0, "step": 22140 }, { "entropy": 5.600993347167969, "epoch": 2.487111809962374, "grad_norm": 1.109375, "learning_rate": 0.00043892556649955354, "loss": 5.3011, "mean_token_accuracy": 0.1875125840306282, "num_tokens": 49430559.0, "step": 22145 }, { "entropy": 5.476229190826416, "epoch": 2.487673386870332, "grad_norm": 1.453125, "learning_rate": 0.0004388980626582551, "loss": 5.242, "mean_token_accuracy": 0.2010987728834152, "num_tokens": 49441862.0, "step": 22150 }, { "entropy": 5.444450426101684, "epoch": 2.4882349637782895, "grad_norm": 1.09375, "learning_rate": 0.0004388705535983788, "loss": 5.175, "mean_token_accuracy": 0.19661868512630462, "num_tokens": 49452839.0, "step": 22155 }, { "entropy": 5.452764892578125, "epoch": 2.488796540686247, "grad_norm": 1.1875, "learning_rate": 0.0004388430393208005, "loss": 5.1788, "mean_token_accuracy": 0.20446619242429734, "num_tokens": 49463683.0, "step": 22160 }, { "entropy": 5.446353578567505, "epoch": 2.4893581175942043, "grad_norm": 1.140625, "learning_rate": 0.0004388155198263963, "loss": 5.1476, "mean_token_accuracy": 0.20625588297843933, "num_tokens": 49474338.0, "step": 22165 }, { "entropy": 5.427867126464844, "epoch": 2.489919694502162, "grad_norm": 1.078125, "learning_rate": 0.0004387879951160424, "loss": 5.2375, "mean_token_accuracy": 0.19345259219408034, "num_tokens": 49485888.0, "step": 22170 }, { "entropy": 5.536109256744385, "epoch": 2.4904812714101197, "grad_norm": 1.1015625, "learning_rate": 0.0004387604651906152, "loss": 5.2665, "mean_token_accuracy": 0.19629083275794984, "num_tokens": 49497270.0, "step": 22175 }, { "entropy": 5.575623607635498, "epoch": 2.4910428483180773, "grad_norm": 1.0859375, "learning_rate": 0.0004387329300509913, "loss": 5.2388, "mean_token_accuracy": 0.19408587366342545, "num_tokens": 49509099.0, "step": 22180 }, { "entropy": 5.409361982345581, "epoch": 2.4916044252260345, "grad_norm": 1.25, "learning_rate": 0.00043870538969804733, "loss": 5.1599, "mean_token_accuracy": 0.20205197781324385, "num_tokens": 49520110.0, "step": 22185 }, { "entropy": 5.396758556365967, "epoch": 2.492166002133992, "grad_norm": 1.0625, "learning_rate": 0.0004386778441326603, "loss": 5.137, "mean_token_accuracy": 0.20351825505495072, "num_tokens": 49531866.0, "step": 22190 }, { "entropy": 5.498166799545288, "epoch": 2.49272757904195, "grad_norm": 1.140625, "learning_rate": 0.00043865029335570725, "loss": 5.2137, "mean_token_accuracy": 0.19389698952436446, "num_tokens": 49541022.0, "step": 22195 }, { "entropy": 5.445477771759033, "epoch": 2.4932891559499075, "grad_norm": 1.171875, "learning_rate": 0.0004386227373680655, "loss": 5.212, "mean_token_accuracy": 0.1959021046757698, "num_tokens": 49551908.0, "step": 22200 }, { "entropy": 5.492675018310547, "epoch": 2.4938507328578647, "grad_norm": 1.1171875, "learning_rate": 0.0004385951761706122, "loss": 5.1593, "mean_token_accuracy": 0.1995590701699257, "num_tokens": 49562475.0, "step": 22205 }, { "entropy": 5.437918663024902, "epoch": 2.4944123097658224, "grad_norm": 1.2890625, "learning_rate": 0.00043856760976422506, "loss": 5.1178, "mean_token_accuracy": 0.203217613697052, "num_tokens": 49572916.0, "step": 22210 }, { "entropy": 5.459088373184204, "epoch": 2.49497388667378, "grad_norm": 1.25, "learning_rate": 0.00043854003814978174, "loss": 5.2094, "mean_token_accuracy": 0.19507265239953994, "num_tokens": 49584584.0, "step": 22215 }, { "entropy": 5.373010683059692, "epoch": 2.4955354635817377, "grad_norm": 1.1328125, "learning_rate": 0.00043851246132816025, "loss": 5.1991, "mean_token_accuracy": 0.19947243630886077, "num_tokens": 49595792.0, "step": 22220 }, { "entropy": 5.495765686035156, "epoch": 2.496097040489695, "grad_norm": 1.1640625, "learning_rate": 0.0004384848793002385, "loss": 5.2434, "mean_token_accuracy": 0.1998839020729065, "num_tokens": 49607596.0, "step": 22225 }, { "entropy": 5.537977695465088, "epoch": 2.4966586173976526, "grad_norm": 1.1484375, "learning_rate": 0.0004384572920668949, "loss": 5.1741, "mean_token_accuracy": 0.19015215188264847, "num_tokens": 49617990.0, "step": 22230 }, { "entropy": 5.540008544921875, "epoch": 2.4972201943056103, "grad_norm": 1.4375, "learning_rate": 0.0004384296996290076, "loss": 5.2626, "mean_token_accuracy": 0.19752211570739747, "num_tokens": 49629458.0, "step": 22235 }, { "entropy": 5.544511508941651, "epoch": 2.4977817712135675, "grad_norm": 1.21875, "learning_rate": 0.00043840210198745533, "loss": 5.2221, "mean_token_accuracy": 0.20264557451009751, "num_tokens": 49641227.0, "step": 22240 }, { "entropy": 5.440906286239624, "epoch": 2.498343348121525, "grad_norm": 1.125, "learning_rate": 0.00043837449914311676, "loss": 5.2815, "mean_token_accuracy": 0.19710609763860704, "num_tokens": 49652655.0, "step": 22245 }, { "entropy": 5.441756629943848, "epoch": 2.498904925029483, "grad_norm": 1.0703125, "learning_rate": 0.00043834689109687077, "loss": 5.2406, "mean_token_accuracy": 0.2054051637649536, "num_tokens": 49664308.0, "step": 22250 }, { "entropy": 5.509242963790894, "epoch": 2.4994665019374405, "grad_norm": 1.1171875, "learning_rate": 0.0004383192778495964, "loss": 5.1792, "mean_token_accuracy": 0.1972736269235611, "num_tokens": 49676656.0, "step": 22255 }, { "entropy": 5.466150522232056, "epoch": 2.500028078845398, "grad_norm": 1.1484375, "learning_rate": 0.000438291659402173, "loss": 5.1198, "mean_token_accuracy": 0.19730150699615479, "num_tokens": 49687706.0, "step": 22260 }, { "entropy": 5.483819627761841, "epoch": 2.5005896557533553, "grad_norm": 1.328125, "learning_rate": 0.00043826403575547974, "loss": 5.1724, "mean_token_accuracy": 0.2053607791662216, "num_tokens": 49699139.0, "step": 22265 }, { "entropy": 5.318334102630615, "epoch": 2.501151232661313, "grad_norm": 1.1640625, "learning_rate": 0.0004382364069103962, "loss": 5.1748, "mean_token_accuracy": 0.20242644846439362, "num_tokens": 49710690.0, "step": 22270 }, { "entropy": 5.437481832504273, "epoch": 2.5017128095692707, "grad_norm": 1.125, "learning_rate": 0.00043820877286780224, "loss": 5.2127, "mean_token_accuracy": 0.20191237777471543, "num_tokens": 49721920.0, "step": 22275 }, { "entropy": 5.555009126663208, "epoch": 2.502274386477228, "grad_norm": 1.1171875, "learning_rate": 0.0004381811336285776, "loss": 5.2056, "mean_token_accuracy": 0.19992334693670272, "num_tokens": 49732923.0, "step": 22280 }, { "entropy": 5.366896629333496, "epoch": 2.5028359633851855, "grad_norm": 1.109375, "learning_rate": 0.0004381534891936024, "loss": 5.089, "mean_token_accuracy": 0.20133124887943268, "num_tokens": 49744755.0, "step": 22285 }, { "entropy": 5.423555660247803, "epoch": 2.503397540293143, "grad_norm": 1.2734375, "learning_rate": 0.0004381258395637568, "loss": 5.1612, "mean_token_accuracy": 0.20267312824726105, "num_tokens": 49756126.0, "step": 22290 }, { "entropy": 5.458829307556153, "epoch": 2.5039591172011004, "grad_norm": 0.97265625, "learning_rate": 0.0004380981847399212, "loss": 5.1599, "mean_token_accuracy": 0.20250371396541594, "num_tokens": 49767137.0, "step": 22295 }, { "entropy": 5.454941463470459, "epoch": 2.504520694109058, "grad_norm": 1.1796875, "learning_rate": 0.00043807052472297626, "loss": 5.2492, "mean_token_accuracy": 0.1909842610359192, "num_tokens": 49778533.0, "step": 22300 }, { "entropy": 5.4665198802948, "epoch": 2.5050822710170157, "grad_norm": 1.0546875, "learning_rate": 0.0004380428595138024, "loss": 5.1992, "mean_token_accuracy": 0.20529264956712723, "num_tokens": 49789494.0, "step": 22305 }, { "entropy": 5.496833467483521, "epoch": 2.5056438479249734, "grad_norm": 1.1484375, "learning_rate": 0.00043801518911328074, "loss": 5.2049, "mean_token_accuracy": 0.19738632589578628, "num_tokens": 49799546.0, "step": 22310 }, { "entropy": 5.388626050949097, "epoch": 2.506205424832931, "grad_norm": 1.1171875, "learning_rate": 0.00043798751352229227, "loss": 5.099, "mean_token_accuracy": 0.20380640029907227, "num_tokens": 49810643.0, "step": 22315 }, { "entropy": 5.487656784057617, "epoch": 2.5067670017408883, "grad_norm": 0.98828125, "learning_rate": 0.00043795983274171806, "loss": 5.2221, "mean_token_accuracy": 0.1948302373290062, "num_tokens": 49821410.0, "step": 22320 }, { "entropy": 5.460285186767578, "epoch": 2.507328578648846, "grad_norm": 1.0859375, "learning_rate": 0.00043793214677243967, "loss": 5.2431, "mean_token_accuracy": 0.19352083653211594, "num_tokens": 49832911.0, "step": 22325 }, { "entropy": 5.508481025695801, "epoch": 2.5078901555568036, "grad_norm": 1.015625, "learning_rate": 0.0004379044556153384, "loss": 5.2308, "mean_token_accuracy": 0.19389263391494752, "num_tokens": 49845458.0, "step": 22330 }, { "entropy": 5.5135880470275875, "epoch": 2.508451732464761, "grad_norm": 1.1015625, "learning_rate": 0.00043787675927129625, "loss": 5.3314, "mean_token_accuracy": 0.18994753211736679, "num_tokens": 49857054.0, "step": 22335 }, { "entropy": 5.456147384643555, "epoch": 2.5090133093727185, "grad_norm": 1.2421875, "learning_rate": 0.00043784905774119483, "loss": 5.1243, "mean_token_accuracy": 0.2006603807210922, "num_tokens": 49867223.0, "step": 22340 }, { "entropy": 5.401931667327881, "epoch": 2.509574886280676, "grad_norm": 1.1640625, "learning_rate": 0.00043782135102591626, "loss": 5.1865, "mean_token_accuracy": 0.1990416169166565, "num_tokens": 49877801.0, "step": 22345 }, { "entropy": 5.417321872711182, "epoch": 2.510136463188634, "grad_norm": 1.125, "learning_rate": 0.0004377936391263427, "loss": 5.1859, "mean_token_accuracy": 0.19792087376117706, "num_tokens": 49888853.0, "step": 22350 }, { "entropy": 5.473415946960449, "epoch": 2.5106980400965915, "grad_norm": 1.2578125, "learning_rate": 0.00043776592204335655, "loss": 5.1834, "mean_token_accuracy": 0.20324978977441788, "num_tokens": 49899989.0, "step": 22355 }, { "entropy": 5.481160116195679, "epoch": 2.5112596170045487, "grad_norm": 1.1171875, "learning_rate": 0.0004377381997778403, "loss": 5.1571, "mean_token_accuracy": 0.20386865437030793, "num_tokens": 49910993.0, "step": 22360 }, { "entropy": 5.478058338165283, "epoch": 2.5118211939125064, "grad_norm": 1.140625, "learning_rate": 0.0004377104723306767, "loss": 5.2194, "mean_token_accuracy": 0.19816150814294814, "num_tokens": 49922169.0, "step": 22365 }, { "entropy": 5.466850137710571, "epoch": 2.512382770820464, "grad_norm": 1.21875, "learning_rate": 0.0004376827397027485, "loss": 5.2746, "mean_token_accuracy": 0.1932577133178711, "num_tokens": 49933700.0, "step": 22370 }, { "entropy": 5.500583648681641, "epoch": 2.5129443477284212, "grad_norm": 1.09375, "learning_rate": 0.0004376550018949388, "loss": 5.197, "mean_token_accuracy": 0.19715379923582077, "num_tokens": 49944689.0, "step": 22375 }, { "entropy": 5.479571199417114, "epoch": 2.513505924636379, "grad_norm": 1.0859375, "learning_rate": 0.00043762725890813083, "loss": 5.2258, "mean_token_accuracy": 0.19828970432281495, "num_tokens": 49955818.0, "step": 22380 }, { "entropy": 5.396988105773926, "epoch": 2.5140675015443366, "grad_norm": 1.140625, "learning_rate": 0.0004375995107432077, "loss": 5.1085, "mean_token_accuracy": 0.20480271130800248, "num_tokens": 49965799.0, "step": 22385 }, { "entropy": 5.441124486923218, "epoch": 2.5146290784522938, "grad_norm": 1.0625, "learning_rate": 0.00043757175740105316, "loss": 5.1998, "mean_token_accuracy": 0.19720589220523835, "num_tokens": 49977742.0, "step": 22390 }, { "entropy": 5.502358627319336, "epoch": 2.5151906553602514, "grad_norm": 1.1015625, "learning_rate": 0.0004375439988825508, "loss": 5.1811, "mean_token_accuracy": 0.1966991201043129, "num_tokens": 49988382.0, "step": 22395 }, { "entropy": 5.50432333946228, "epoch": 2.515752232268209, "grad_norm": 1.0546875, "learning_rate": 0.0004375162351885845, "loss": 5.3039, "mean_token_accuracy": 0.19249147176742554, "num_tokens": 50000190.0, "step": 22400 }, { "entropy": 5.528553104400634, "epoch": 2.5163138091761668, "grad_norm": 1.0859375, "learning_rate": 0.00043748846632003823, "loss": 5.2138, "mean_token_accuracy": 0.20334574729204177, "num_tokens": 50011297.0, "step": 22405 }, { "entropy": 5.4859010696411135, "epoch": 2.5168753860841244, "grad_norm": 1.1484375, "learning_rate": 0.00043746069227779615, "loss": 5.2268, "mean_token_accuracy": 0.1949320390820503, "num_tokens": 50023165.0, "step": 22410 }, { "entropy": 5.510264921188354, "epoch": 2.5174369629920816, "grad_norm": 1.171875, "learning_rate": 0.0004374329130627427, "loss": 5.234, "mean_token_accuracy": 0.19958595037460328, "num_tokens": 50035803.0, "step": 22415 }, { "entropy": 5.445142030715942, "epoch": 2.5179985399000393, "grad_norm": 1.125, "learning_rate": 0.00043740512867576224, "loss": 5.1186, "mean_token_accuracy": 0.20306495279073716, "num_tokens": 50046599.0, "step": 22420 }, { "entropy": 5.471498155593872, "epoch": 2.518560116807997, "grad_norm": 1.21875, "learning_rate": 0.0004373773391177395, "loss": 5.3363, "mean_token_accuracy": 0.18993393331766129, "num_tokens": 50058170.0, "step": 22425 }, { "entropy": 5.440329074859619, "epoch": 2.519121693715954, "grad_norm": 1.0703125, "learning_rate": 0.0004373495443895593, "loss": 5.1424, "mean_token_accuracy": 0.20907102674245834, "num_tokens": 50068818.0, "step": 22430 }, { "entropy": 5.506471872329712, "epoch": 2.519683270623912, "grad_norm": 1.140625, "learning_rate": 0.0004373217444921066, "loss": 5.2896, "mean_token_accuracy": 0.19338531494140626, "num_tokens": 50080533.0, "step": 22435 }, { "entropy": 5.434464168548584, "epoch": 2.5202448475318695, "grad_norm": 1.078125, "learning_rate": 0.00043729393942626665, "loss": 5.1146, "mean_token_accuracy": 0.20435652881860733, "num_tokens": 50090897.0, "step": 22440 }, { "entropy": 5.371607303619385, "epoch": 2.520806424439827, "grad_norm": 1.1640625, "learning_rate": 0.00043726612919292476, "loss": 5.0809, "mean_token_accuracy": 0.20662710517644883, "num_tokens": 50101594.0, "step": 22445 }, { "entropy": 5.419979047775269, "epoch": 2.521368001347785, "grad_norm": 1.171875, "learning_rate": 0.0004372383137929663, "loss": 5.1598, "mean_token_accuracy": 0.20202449411153794, "num_tokens": 50111923.0, "step": 22450 }, { "entropy": 5.500240087509155, "epoch": 2.521929578255742, "grad_norm": 1.140625, "learning_rate": 0.00043721049322727705, "loss": 5.2375, "mean_token_accuracy": 0.2016470327973366, "num_tokens": 50123295.0, "step": 22455 }, { "entropy": 5.538443660736084, "epoch": 2.5224911551636997, "grad_norm": 1.6171875, "learning_rate": 0.0004371826674967428, "loss": 5.2995, "mean_token_accuracy": 0.19865900725126268, "num_tokens": 50133245.0, "step": 22460 }, { "entropy": 5.416790199279785, "epoch": 2.5230527320716574, "grad_norm": 1.0859375, "learning_rate": 0.00043715483660224943, "loss": 5.1531, "mean_token_accuracy": 0.2004664197564125, "num_tokens": 50144827.0, "step": 22465 }, { "entropy": 5.56309289932251, "epoch": 2.5236143089796146, "grad_norm": 1.140625, "learning_rate": 0.0004371270005446833, "loss": 5.2798, "mean_token_accuracy": 0.19326076358556749, "num_tokens": 50156244.0, "step": 22470 }, { "entropy": 5.544798040390015, "epoch": 2.5241758858875722, "grad_norm": 0.984375, "learning_rate": 0.0004370991593249305, "loss": 5.2527, "mean_token_accuracy": 0.19526829123497008, "num_tokens": 50168363.0, "step": 22475 }, { "entropy": 5.50516448020935, "epoch": 2.52473746279553, "grad_norm": 1.21875, "learning_rate": 0.00043707131294387766, "loss": 5.1814, "mean_token_accuracy": 0.1983770489692688, "num_tokens": 50179370.0, "step": 22480 }, { "entropy": 5.5335962772369385, "epoch": 2.525299039703487, "grad_norm": 1.078125, "learning_rate": 0.0004370434614024113, "loss": 5.2165, "mean_token_accuracy": 0.2053406596183777, "num_tokens": 50191583.0, "step": 22485 }, { "entropy": 5.489752197265625, "epoch": 2.525860616611445, "grad_norm": 1.28125, "learning_rate": 0.00043701560470141824, "loss": 5.1718, "mean_token_accuracy": 0.1955375775694847, "num_tokens": 50202008.0, "step": 22490 }, { "entropy": 5.420732212066651, "epoch": 2.5264221935194024, "grad_norm": 1.2265625, "learning_rate": 0.0004369877428417856, "loss": 5.226, "mean_token_accuracy": 0.19432284235954284, "num_tokens": 50212632.0, "step": 22495 }, { "entropy": 5.474782037734985, "epoch": 2.52698377042736, "grad_norm": 1.3125, "learning_rate": 0.0004369598758244003, "loss": 5.2266, "mean_token_accuracy": 0.20370943248271942, "num_tokens": 50223485.0, "step": 22500 }, { "entropy": 5.567892932891846, "epoch": 2.5275453473353178, "grad_norm": 1.125, "learning_rate": 0.00043693200365014985, "loss": 5.2945, "mean_token_accuracy": 0.19657267183065413, "num_tokens": 50235516.0, "step": 22505 }, { "entropy": 5.475609064102173, "epoch": 2.528106924243275, "grad_norm": 1.265625, "learning_rate": 0.00043690412631992154, "loss": 5.1424, "mean_token_accuracy": 0.20403032153844833, "num_tokens": 50246846.0, "step": 22510 }, { "entropy": 5.420966577529907, "epoch": 2.5286685011512327, "grad_norm": 1.109375, "learning_rate": 0.00043687624383460306, "loss": 5.219, "mean_token_accuracy": 0.1896538943052292, "num_tokens": 50258433.0, "step": 22515 }, { "entropy": 5.553134536743164, "epoch": 2.5292300780591903, "grad_norm": 1.1953125, "learning_rate": 0.00043684835619508215, "loss": 5.3207, "mean_token_accuracy": 0.1976487845182419, "num_tokens": 50269111.0, "step": 22520 }, { "entropy": 5.492173671722412, "epoch": 2.5297916549671475, "grad_norm": 1.3359375, "learning_rate": 0.0004368204634022469, "loss": 5.3164, "mean_token_accuracy": 0.19301936626434327, "num_tokens": 50280137.0, "step": 22525 }, { "entropy": 5.49051604270935, "epoch": 2.530353231875105, "grad_norm": 1.1953125, "learning_rate": 0.0004367925654569852, "loss": 5.1619, "mean_token_accuracy": 0.20840794444084168, "num_tokens": 50291717.0, "step": 22530 }, { "entropy": 5.510760068893433, "epoch": 2.530914808783063, "grad_norm": 1.1796875, "learning_rate": 0.0004367646623601856, "loss": 5.246, "mean_token_accuracy": 0.19451362788677215, "num_tokens": 50303107.0, "step": 22535 }, { "entropy": 5.374897003173828, "epoch": 2.5314763856910205, "grad_norm": 1.0625, "learning_rate": 0.0004367367541127364, "loss": 5.16, "mean_token_accuracy": 0.20004209876060486, "num_tokens": 50313997.0, "step": 22540 }, { "entropy": 5.437381267547607, "epoch": 2.532037962598978, "grad_norm": 1.1796875, "learning_rate": 0.0004367088407155261, "loss": 5.1711, "mean_token_accuracy": 0.20653210282325746, "num_tokens": 50324327.0, "step": 22545 }, { "entropy": 5.412775897979737, "epoch": 2.5325995395069354, "grad_norm": 1.2421875, "learning_rate": 0.0004366809221694437, "loss": 5.1087, "mean_token_accuracy": 0.20845651477575303, "num_tokens": 50334787.0, "step": 22550 }, { "entropy": 5.393438243865967, "epoch": 2.533161116414893, "grad_norm": 1.2109375, "learning_rate": 0.00043665299847537805, "loss": 5.0917, "mean_token_accuracy": 0.20833459943532945, "num_tokens": 50345418.0, "step": 22555 }, { "entropy": 5.4462038516998295, "epoch": 2.5337226933228507, "grad_norm": 1.171875, "learning_rate": 0.00043662506963421815, "loss": 5.21, "mean_token_accuracy": 0.2001356914639473, "num_tokens": 50357047.0, "step": 22560 }, { "entropy": 5.437898397445679, "epoch": 2.534284270230808, "grad_norm": 1.1484375, "learning_rate": 0.0004365971356468534, "loss": 5.1666, "mean_token_accuracy": 0.2075835272669792, "num_tokens": 50368385.0, "step": 22565 }, { "entropy": 5.465651798248291, "epoch": 2.5348458471387656, "grad_norm": 1.1171875, "learning_rate": 0.00043656919651417314, "loss": 5.2319, "mean_token_accuracy": 0.2005552276968956, "num_tokens": 50379389.0, "step": 22570 }, { "entropy": 5.500934362411499, "epoch": 2.5354074240467233, "grad_norm": 1.15625, "learning_rate": 0.000436541252237067, "loss": 5.1982, "mean_token_accuracy": 0.20028745979070664, "num_tokens": 50390124.0, "step": 22575 }, { "entropy": 5.495947074890137, "epoch": 2.5359690009546805, "grad_norm": 1.390625, "learning_rate": 0.0004365133028164248, "loss": 5.212, "mean_token_accuracy": 0.20381075590848924, "num_tokens": 50401385.0, "step": 22580 }, { "entropy": 5.4653639793396, "epoch": 2.536530577862638, "grad_norm": 1.09375, "learning_rate": 0.0004364853482531363, "loss": 5.2541, "mean_token_accuracy": 0.19280862361192702, "num_tokens": 50412890.0, "step": 22585 }, { "entropy": 5.487146472930908, "epoch": 2.537092154770596, "grad_norm": 1.1328125, "learning_rate": 0.00043645738854809177, "loss": 5.2635, "mean_token_accuracy": 0.20081137865781784, "num_tokens": 50424403.0, "step": 22590 }, { "entropy": 5.578891134262085, "epoch": 2.5376537316785535, "grad_norm": 1.0546875, "learning_rate": 0.0004364294237021813, "loss": 5.2179, "mean_token_accuracy": 0.19921068251132965, "num_tokens": 50434598.0, "step": 22595 }, { "entropy": 5.575385189056396, "epoch": 2.538215308586511, "grad_norm": 1.1484375, "learning_rate": 0.00043640145371629544, "loss": 5.2863, "mean_token_accuracy": 0.19035972505807877, "num_tokens": 50446661.0, "step": 22600 }, { "entropy": 5.566793584823609, "epoch": 2.5387768854944683, "grad_norm": 1.1796875, "learning_rate": 0.0004363734785913246, "loss": 5.2841, "mean_token_accuracy": 0.19049828946590425, "num_tokens": 50458188.0, "step": 22605 }, { "entropy": 5.502074956893921, "epoch": 2.539338462402426, "grad_norm": 1.125, "learning_rate": 0.0004363454983281597, "loss": 5.2551, "mean_token_accuracy": 0.20060526132583617, "num_tokens": 50469305.0, "step": 22610 }, { "entropy": 5.516038227081299, "epoch": 2.5399000393103837, "grad_norm": 1.03125, "learning_rate": 0.0004363175129276915, "loss": 5.2024, "mean_token_accuracy": 0.20006683319807053, "num_tokens": 50480450.0, "step": 22615 }, { "entropy": 5.439752578735352, "epoch": 2.540461616218341, "grad_norm": 1.0625, "learning_rate": 0.00043628952239081113, "loss": 5.1684, "mean_token_accuracy": 0.19881519228219985, "num_tokens": 50490397.0, "step": 22620 }, { "entropy": 5.377489328384399, "epoch": 2.5410231931262985, "grad_norm": 1.203125, "learning_rate": 0.00043626152671840984, "loss": 5.1397, "mean_token_accuracy": 0.20063460767269134, "num_tokens": 50501068.0, "step": 22625 }, { "entropy": 5.532137823104859, "epoch": 2.541584770034256, "grad_norm": 1.0703125, "learning_rate": 0.000436233525911379, "loss": 5.4097, "mean_token_accuracy": 0.1885458707809448, "num_tokens": 50513268.0, "step": 22630 }, { "entropy": 5.467395544052124, "epoch": 2.542146346942214, "grad_norm": 1.1484375, "learning_rate": 0.0004362055199706101, "loss": 5.1054, "mean_token_accuracy": 0.20370217710733413, "num_tokens": 50523806.0, "step": 22635 }, { "entropy": 5.480954504013061, "epoch": 2.5427079238501715, "grad_norm": 1.1171875, "learning_rate": 0.00043617750889699496, "loss": 5.1612, "mean_token_accuracy": 0.1982889235019684, "num_tokens": 50535000.0, "step": 22640 }, { "entropy": 5.490712070465088, "epoch": 2.5432695007581287, "grad_norm": 1.109375, "learning_rate": 0.00043614949269142546, "loss": 5.2655, "mean_token_accuracy": 0.19457219839096068, "num_tokens": 50546042.0, "step": 22645 }, { "entropy": 5.574697399139405, "epoch": 2.5438310776660864, "grad_norm": 1.125, "learning_rate": 0.00043612147135479356, "loss": 5.2525, "mean_token_accuracy": 0.19598281979560853, "num_tokens": 50556645.0, "step": 22650 }, { "entropy": 5.558626699447632, "epoch": 2.544392654574044, "grad_norm": 1.109375, "learning_rate": 0.0004360934448879916, "loss": 5.2675, "mean_token_accuracy": 0.1959284171462059, "num_tokens": 50567904.0, "step": 22655 }, { "entropy": 5.389188003540039, "epoch": 2.5449542314820013, "grad_norm": 1.125, "learning_rate": 0.0004360654132919118, "loss": 5.0798, "mean_token_accuracy": 0.20017922520637513, "num_tokens": 50578280.0, "step": 22660 }, { "entropy": 5.408729982376099, "epoch": 2.545515808389959, "grad_norm": 1.703125, "learning_rate": 0.0004360373765674467, "loss": 5.1929, "mean_token_accuracy": 0.20137256681919097, "num_tokens": 50590232.0, "step": 22665 }, { "entropy": 5.453761339187622, "epoch": 2.5460773852979166, "grad_norm": 1.1875, "learning_rate": 0.00043600933471548927, "loss": 5.0839, "mean_token_accuracy": 0.20683782547712326, "num_tokens": 50601469.0, "step": 22670 }, { "entropy": 5.401768207550049, "epoch": 2.546638962205874, "grad_norm": 1.1796875, "learning_rate": 0.0004359812877369321, "loss": 5.0664, "mean_token_accuracy": 0.20404326915740967, "num_tokens": 50612090.0, "step": 22675 }, { "entropy": 5.395300674438476, "epoch": 2.5472005391138315, "grad_norm": 1.078125, "learning_rate": 0.00043595323563266815, "loss": 5.1831, "mean_token_accuracy": 0.19551308006048201, "num_tokens": 50623834.0, "step": 22680 }, { "entropy": 5.485017538070679, "epoch": 2.547762116021789, "grad_norm": 1.1015625, "learning_rate": 0.00043592517840359093, "loss": 5.2384, "mean_token_accuracy": 0.1948726862668991, "num_tokens": 50633966.0, "step": 22685 }, { "entropy": 5.438422155380249, "epoch": 2.548323692929747, "grad_norm": 1.1640625, "learning_rate": 0.0004358971160505936, "loss": 5.0889, "mean_token_accuracy": 0.20339812934398652, "num_tokens": 50644354.0, "step": 22690 }, { "entropy": 5.429444885253906, "epoch": 2.5488852698377045, "grad_norm": 1.21875, "learning_rate": 0.00043586904857456963, "loss": 5.0863, "mean_token_accuracy": 0.20113642066717147, "num_tokens": 50655525.0, "step": 22695 }, { "entropy": 5.491053676605224, "epoch": 2.5494468467456617, "grad_norm": 1.15625, "learning_rate": 0.00043584097597641275, "loss": 5.3234, "mean_token_accuracy": 0.19047256857156752, "num_tokens": 50667879.0, "step": 22700 }, { "entropy": 5.393489217758178, "epoch": 2.5500084236536193, "grad_norm": 1.0625, "learning_rate": 0.00043581289825701683, "loss": 5.0668, "mean_token_accuracy": 0.20350636243820192, "num_tokens": 50679568.0, "step": 22705 }, { "entropy": 5.448760032653809, "epoch": 2.550570000561577, "grad_norm": 1.171875, "learning_rate": 0.0004357848154172759, "loss": 5.2297, "mean_token_accuracy": 0.20112274587154388, "num_tokens": 50690172.0, "step": 22710 }, { "entropy": 5.433311319351196, "epoch": 2.5511315774695342, "grad_norm": 1.1015625, "learning_rate": 0.00043575672745808404, "loss": 5.1244, "mean_token_accuracy": 0.20036081075668336, "num_tokens": 50701150.0, "step": 22715 }, { "entropy": 5.471509742736816, "epoch": 2.551693154377492, "grad_norm": 1.234375, "learning_rate": 0.00043572863438033556, "loss": 5.2306, "mean_token_accuracy": 0.20599816590547562, "num_tokens": 50712407.0, "step": 22720 }, { "entropy": 5.449364757537841, "epoch": 2.5522547312854496, "grad_norm": 1.171875, "learning_rate": 0.0004357005361849251, "loss": 5.1526, "mean_token_accuracy": 0.19876994341611862, "num_tokens": 50723122.0, "step": 22725 }, { "entropy": 5.477801656723022, "epoch": 2.552816308193407, "grad_norm": 1.140625, "learning_rate": 0.00043567243287274726, "loss": 5.2063, "mean_token_accuracy": 0.19595978260040284, "num_tokens": 50734479.0, "step": 22730 }, { "entropy": 5.380903196334839, "epoch": 2.553377885101365, "grad_norm": 1.265625, "learning_rate": 0.00043564432444469686, "loss": 5.168, "mean_token_accuracy": 0.20650181621313096, "num_tokens": 50745098.0, "step": 22735 }, { "entropy": 5.489142274856567, "epoch": 2.553939462009322, "grad_norm": 1.171875, "learning_rate": 0.00043561621090166885, "loss": 5.2122, "mean_token_accuracy": 0.1987846463918686, "num_tokens": 50755793.0, "step": 22740 }, { "entropy": 5.4806722640991214, "epoch": 2.5545010389172798, "grad_norm": 1.1484375, "learning_rate": 0.0004355880922445584, "loss": 5.2219, "mean_token_accuracy": 0.19182201474905014, "num_tokens": 50767685.0, "step": 22745 }, { "entropy": 5.517179250717163, "epoch": 2.5550626158252374, "grad_norm": 1.6171875, "learning_rate": 0.00043555996847426077, "loss": 5.2962, "mean_token_accuracy": 0.19072840809822084, "num_tokens": 50778583.0, "step": 22750 }, { "entropy": 5.492299604415893, "epoch": 2.5556241927331946, "grad_norm": 1.0078125, "learning_rate": 0.00043553183959167154, "loss": 5.1876, "mean_token_accuracy": 0.2016289323568344, "num_tokens": 50789651.0, "step": 22755 }, { "entropy": 5.546571874618531, "epoch": 2.5561857696411523, "grad_norm": 1.28125, "learning_rate": 0.00043550370559768614, "loss": 5.3283, "mean_token_accuracy": 0.19424901008605958, "num_tokens": 50800846.0, "step": 22760 }, { "entropy": 5.488478755950927, "epoch": 2.55674734654911, "grad_norm": 1.1484375, "learning_rate": 0.0004354755664932006, "loss": 5.0754, "mean_token_accuracy": 0.2037645012140274, "num_tokens": 50812532.0, "step": 22765 }, { "entropy": 5.517052888870239, "epoch": 2.557308923457067, "grad_norm": 1.125, "learning_rate": 0.00043544742227911076, "loss": 5.235, "mean_token_accuracy": 0.19830751568078994, "num_tokens": 50823592.0, "step": 22770 }, { "entropy": 5.446296691894531, "epoch": 2.557870500365025, "grad_norm": 1.2109375, "learning_rate": 0.00043541927295631276, "loss": 5.1188, "mean_token_accuracy": 0.2011640876531601, "num_tokens": 50834392.0, "step": 22775 }, { "entropy": 5.541642093658448, "epoch": 2.5584320772729825, "grad_norm": 1.0625, "learning_rate": 0.00043539111852570296, "loss": 5.2677, "mean_token_accuracy": 0.19484104365110397, "num_tokens": 50845371.0, "step": 22780 }, { "entropy": 5.506129312515259, "epoch": 2.55899365418094, "grad_norm": 1.03125, "learning_rate": 0.00043536295898817767, "loss": 5.2706, "mean_token_accuracy": 0.1952488377690315, "num_tokens": 50857748.0, "step": 22785 }, { "entropy": 5.424519681930542, "epoch": 2.559555231088898, "grad_norm": 1.0625, "learning_rate": 0.0004353347943446336, "loss": 5.0747, "mean_token_accuracy": 0.2082340955734253, "num_tokens": 50868646.0, "step": 22790 }, { "entropy": 5.4368438720703125, "epoch": 2.560116807996855, "grad_norm": 1.0, "learning_rate": 0.00043530662459596744, "loss": 5.1143, "mean_token_accuracy": 0.204285891354084, "num_tokens": 50880566.0, "step": 22795 }, { "entropy": 5.462652015686035, "epoch": 2.5606783849048127, "grad_norm": 1.125, "learning_rate": 0.0004352784497430762, "loss": 5.2017, "mean_token_accuracy": 0.2011650323867798, "num_tokens": 50891487.0, "step": 22800 }, { "entropy": 5.471800041198731, "epoch": 2.5612399618127704, "grad_norm": 1.0859375, "learning_rate": 0.00043525026978685706, "loss": 5.245, "mean_token_accuracy": 0.19139301478862764, "num_tokens": 50902522.0, "step": 22805 }, { "entropy": 5.590824174880981, "epoch": 2.5618015387207276, "grad_norm": 1.140625, "learning_rate": 0.00043522208472820706, "loss": 5.2266, "mean_token_accuracy": 0.19290973246097565, "num_tokens": 50913363.0, "step": 22810 }, { "entropy": 5.479837369918823, "epoch": 2.5623631156286852, "grad_norm": 1.171875, "learning_rate": 0.0004351938945680238, "loss": 5.2048, "mean_token_accuracy": 0.20074327141046525, "num_tokens": 50923724.0, "step": 22815 }, { "entropy": 5.470147228240966, "epoch": 2.562924692536643, "grad_norm": 1.09375, "learning_rate": 0.0004351656993072048, "loss": 5.1929, "mean_token_accuracy": 0.20039606094360352, "num_tokens": 50933575.0, "step": 22820 }, { "entropy": 5.43289155960083, "epoch": 2.5634862694446006, "grad_norm": 1.1953125, "learning_rate": 0.0004351374989466477, "loss": 5.1707, "mean_token_accuracy": 0.2038708046078682, "num_tokens": 50944619.0, "step": 22825 }, { "entropy": 5.409995031356812, "epoch": 2.5640478463525582, "grad_norm": 1.1328125, "learning_rate": 0.00043510929348725065, "loss": 5.179, "mean_token_accuracy": 0.20432940125465393, "num_tokens": 50955701.0, "step": 22830 }, { "entropy": 5.415213918685913, "epoch": 2.5646094232605154, "grad_norm": 1.0703125, "learning_rate": 0.00043508108292991156, "loss": 5.043, "mean_token_accuracy": 0.20145202428102493, "num_tokens": 50966544.0, "step": 22835 }, { "entropy": 5.467957401275635, "epoch": 2.565171000168473, "grad_norm": 1.203125, "learning_rate": 0.0004350528672755287, "loss": 5.2507, "mean_token_accuracy": 0.20001019388437272, "num_tokens": 50976648.0, "step": 22840 }, { "entropy": 5.550426721572876, "epoch": 2.5657325770764308, "grad_norm": 1.0546875, "learning_rate": 0.0004350246465250005, "loss": 5.2135, "mean_token_accuracy": 0.19686073064804077, "num_tokens": 50988173.0, "step": 22845 }, { "entropy": 5.446621656417847, "epoch": 2.566294153984388, "grad_norm": 1.09375, "learning_rate": 0.00043499642067922544, "loss": 5.079, "mean_token_accuracy": 0.20425282418727875, "num_tokens": 50999274.0, "step": 22850 }, { "entropy": 5.344490814208984, "epoch": 2.5668557308923456, "grad_norm": 1.1796875, "learning_rate": 0.00043496818973910235, "loss": 5.1445, "mean_token_accuracy": 0.20603708922863007, "num_tokens": 51010213.0, "step": 22855 }, { "entropy": 5.440465784072876, "epoch": 2.5674173078003033, "grad_norm": 1.234375, "learning_rate": 0.00043493995370553, "loss": 5.2107, "mean_token_accuracy": 0.20147900581359862, "num_tokens": 51021460.0, "step": 22860 }, { "entropy": 5.586348199844361, "epoch": 2.5679788847082605, "grad_norm": 1.1171875, "learning_rate": 0.00043491171257940755, "loss": 5.2025, "mean_token_accuracy": 0.19831876158714296, "num_tokens": 51031713.0, "step": 22865 }, { "entropy": 5.510029125213623, "epoch": 2.568540461616218, "grad_norm": 1.1015625, "learning_rate": 0.00043488346636163405, "loss": 5.2917, "mean_token_accuracy": 0.19384196400642395, "num_tokens": 51043026.0, "step": 22870 }, { "entropy": 5.571712589263916, "epoch": 2.569102038524176, "grad_norm": 1.21875, "learning_rate": 0.0004348552150531091, "loss": 5.2381, "mean_token_accuracy": 0.19675661921501159, "num_tokens": 51054838.0, "step": 22875 }, { "entropy": 5.467933416366577, "epoch": 2.5696636154321335, "grad_norm": 1.140625, "learning_rate": 0.00043482695865473207, "loss": 5.0715, "mean_token_accuracy": 0.20232197344303132, "num_tokens": 51065574.0, "step": 22880 }, { "entropy": 5.409094667434692, "epoch": 2.570225192340091, "grad_norm": 1.203125, "learning_rate": 0.0004347986971674026, "loss": 5.1494, "mean_token_accuracy": 0.20092492699623107, "num_tokens": 51076814.0, "step": 22885 }, { "entropy": 5.415322494506836, "epoch": 2.5707867692480484, "grad_norm": 1.1328125, "learning_rate": 0.00043477043059202077, "loss": 5.2407, "mean_token_accuracy": 0.19303952008485795, "num_tokens": 51089075.0, "step": 22890 }, { "entropy": 5.505451917648315, "epoch": 2.571348346156006, "grad_norm": 1.140625, "learning_rate": 0.0004347421589294864, "loss": 5.2667, "mean_token_accuracy": 0.1963049903512001, "num_tokens": 51100148.0, "step": 22895 }, { "entropy": 5.574727296829224, "epoch": 2.5719099230639637, "grad_norm": 1.25, "learning_rate": 0.0004347138821806997, "loss": 5.3076, "mean_token_accuracy": 0.1986745685338974, "num_tokens": 51111148.0, "step": 22900 }, { "entropy": 5.625747489929199, "epoch": 2.572471499971921, "grad_norm": 1.140625, "learning_rate": 0.000434685600346561, "loss": 5.2892, "mean_token_accuracy": 0.19100103825330733, "num_tokens": 51122563.0, "step": 22905 }, { "entropy": 5.407369470596313, "epoch": 2.5730330768798786, "grad_norm": 1.1953125, "learning_rate": 0.000434657313427971, "loss": 5.1609, "mean_token_accuracy": 0.19958069324493408, "num_tokens": 51132676.0, "step": 22910 }, { "entropy": 5.435240173339844, "epoch": 2.5735946537878363, "grad_norm": 1.2890625, "learning_rate": 0.0004346290214258301, "loss": 5.1567, "mean_token_accuracy": 0.19375762194395066, "num_tokens": 51144317.0, "step": 22915 }, { "entropy": 5.6386651515960695, "epoch": 2.574156230695794, "grad_norm": 1.015625, "learning_rate": 0.00043460072434103934, "loss": 5.3721, "mean_token_accuracy": 0.18261118978261948, "num_tokens": 51156181.0, "step": 22920 }, { "entropy": 5.426962900161743, "epoch": 2.5747178076037516, "grad_norm": 1.2109375, "learning_rate": 0.0004345724221744996, "loss": 5.1135, "mean_token_accuracy": 0.20535062551498412, "num_tokens": 51166825.0, "step": 22925 }, { "entropy": 5.504230594635009, "epoch": 2.575279384511709, "grad_norm": 1.1328125, "learning_rate": 0.00043454411492711197, "loss": 5.3378, "mean_token_accuracy": 0.1932621866464615, "num_tokens": 51178839.0, "step": 22930 }, { "entropy": 5.446401357650757, "epoch": 2.5758409614196665, "grad_norm": 1.1796875, "learning_rate": 0.00043451580259977793, "loss": 5.2076, "mean_token_accuracy": 0.19552009999752046, "num_tokens": 51190811.0, "step": 22935 }, { "entropy": 5.473272323608398, "epoch": 2.576402538327624, "grad_norm": 1.1875, "learning_rate": 0.00043448748519339875, "loss": 5.1934, "mean_token_accuracy": 0.19591692537069322, "num_tokens": 51201991.0, "step": 22940 }, { "entropy": 5.526747941970825, "epoch": 2.5769641152355813, "grad_norm": 1.171875, "learning_rate": 0.00043445916270887626, "loss": 5.2256, "mean_token_accuracy": 0.20157719552516937, "num_tokens": 51213017.0, "step": 22945 }, { "entropy": 5.49044189453125, "epoch": 2.577525692143539, "grad_norm": 1.15625, "learning_rate": 0.0004344308351471123, "loss": 5.1731, "mean_token_accuracy": 0.1987592473626137, "num_tokens": 51224412.0, "step": 22950 }, { "entropy": 5.507965898513794, "epoch": 2.5780872690514967, "grad_norm": 1.125, "learning_rate": 0.00043440250250900854, "loss": 5.24, "mean_token_accuracy": 0.19685512632131577, "num_tokens": 51235043.0, "step": 22955 }, { "entropy": 5.484808254241943, "epoch": 2.578648845959454, "grad_norm": 1.0390625, "learning_rate": 0.0004343741647954673, "loss": 5.2642, "mean_token_accuracy": 0.1931155279278755, "num_tokens": 51246182.0, "step": 22960 }, { "entropy": 5.567646455764771, "epoch": 2.5792104228674115, "grad_norm": 1.234375, "learning_rate": 0.0004343458220073909, "loss": 5.327, "mean_token_accuracy": 0.19570422619581224, "num_tokens": 51259791.0, "step": 22965 }, { "entropy": 5.588500118255615, "epoch": 2.579771999775369, "grad_norm": 1.234375, "learning_rate": 0.0004343174741456817, "loss": 5.327, "mean_token_accuracy": 0.1901649221777916, "num_tokens": 51270530.0, "step": 22970 }, { "entropy": 5.408082675933838, "epoch": 2.580333576683327, "grad_norm": 1.1171875, "learning_rate": 0.0004342891212112423, "loss": 5.1613, "mean_token_accuracy": 0.19526751935482026, "num_tokens": 51281969.0, "step": 22975 }, { "entropy": 5.436216831207275, "epoch": 2.5808951535912845, "grad_norm": 1.3203125, "learning_rate": 0.00043426076320497557, "loss": 5.086, "mean_token_accuracy": 0.2031923860311508, "num_tokens": 51292790.0, "step": 22980 }, { "entropy": 5.453107118606567, "epoch": 2.5814567304992417, "grad_norm": 1.2109375, "learning_rate": 0.00043423240012778437, "loss": 5.1859, "mean_token_accuracy": 0.19469663947820665, "num_tokens": 51303949.0, "step": 22985 }, { "entropy": 5.448466014862061, "epoch": 2.5820183074071994, "grad_norm": 1.09375, "learning_rate": 0.0004342040319805717, "loss": 5.1273, "mean_token_accuracy": 0.20429383367300033, "num_tokens": 51314570.0, "step": 22990 }, { "entropy": 5.350348806381225, "epoch": 2.582579884315157, "grad_norm": 1.0078125, "learning_rate": 0.000434175658764241, "loss": 5.0804, "mean_token_accuracy": 0.20541241019964218, "num_tokens": 51325210.0, "step": 22995 }, { "entropy": 5.420697450637817, "epoch": 2.5831414612231143, "grad_norm": 1.1171875, "learning_rate": 0.00043414728047969553, "loss": 5.0501, "mean_token_accuracy": 0.2020192414522171, "num_tokens": 51335871.0, "step": 23000 }, { "entropy": 5.459543085098266, "epoch": 2.583703038131072, "grad_norm": 1.1796875, "learning_rate": 0.00043411889712783897, "loss": 5.2261, "mean_token_accuracy": 0.20133862346410752, "num_tokens": 51346821.0, "step": 23005 }, { "entropy": 5.494036054611206, "epoch": 2.5842646150390296, "grad_norm": 1.1640625, "learning_rate": 0.00043409050870957505, "loss": 5.2234, "mean_token_accuracy": 0.1899457350373268, "num_tokens": 51358746.0, "step": 23010 }, { "entropy": 5.5528693199157715, "epoch": 2.5848261919469873, "grad_norm": 1.2578125, "learning_rate": 0.0004340621152258075, "loss": 5.2553, "mean_token_accuracy": 0.19268431812524794, "num_tokens": 51369628.0, "step": 23015 }, { "entropy": 5.575812244415284, "epoch": 2.585387768854945, "grad_norm": 1.1484375, "learning_rate": 0.00043403371667744055, "loss": 5.2254, "mean_token_accuracy": 0.20492194443941117, "num_tokens": 51382160.0, "step": 23020 }, { "entropy": 5.488270616531372, "epoch": 2.585949345762902, "grad_norm": 1.2578125, "learning_rate": 0.0004340053130653785, "loss": 5.2482, "mean_token_accuracy": 0.1930004522204399, "num_tokens": 51394843.0, "step": 23025 }, { "entropy": 5.458188247680664, "epoch": 2.58651092267086, "grad_norm": 1.09375, "learning_rate": 0.0004339769043905255, "loss": 5.1908, "mean_token_accuracy": 0.2022606372833252, "num_tokens": 51405714.0, "step": 23030 }, { "entropy": 5.505884313583374, "epoch": 2.5870724995788175, "grad_norm": 1.171875, "learning_rate": 0.00043394849065378624, "loss": 5.1488, "mean_token_accuracy": 0.1990939497947693, "num_tokens": 51416292.0, "step": 23035 }, { "entropy": 5.4181712627410885, "epoch": 2.5876340764867747, "grad_norm": 1.1953125, "learning_rate": 0.00043392007185606533, "loss": 5.1202, "mean_token_accuracy": 0.2047677993774414, "num_tokens": 51426993.0, "step": 23040 }, { "entropy": 5.430881786346435, "epoch": 2.5881956533947323, "grad_norm": 1.0546875, "learning_rate": 0.0004338916479982678, "loss": 5.261, "mean_token_accuracy": 0.19708542823791503, "num_tokens": 51439493.0, "step": 23045 }, { "entropy": 5.531647872924805, "epoch": 2.58875723030269, "grad_norm": 1.0546875, "learning_rate": 0.00043386321908129856, "loss": 5.1841, "mean_token_accuracy": 0.20050522834062576, "num_tokens": 51451705.0, "step": 23050 }, { "entropy": 5.560615825653076, "epoch": 2.589318807210647, "grad_norm": 1.6328125, "learning_rate": 0.00043383478510606276, "loss": 5.155, "mean_token_accuracy": 0.20101606696844102, "num_tokens": 51463044.0, "step": 23055 }, { "entropy": 5.390435457229614, "epoch": 2.589880384118605, "grad_norm": 1.0625, "learning_rate": 0.0004338063460734658, "loss": 5.1888, "mean_token_accuracy": 0.2007523164153099, "num_tokens": 51475009.0, "step": 23060 }, { "entropy": 5.416891384124756, "epoch": 2.5904419610265625, "grad_norm": 1.125, "learning_rate": 0.0004337779019844132, "loss": 5.1968, "mean_token_accuracy": 0.1994771331548691, "num_tokens": 51486068.0, "step": 23065 }, { "entropy": 5.532764530181884, "epoch": 2.59100353793452, "grad_norm": 1.125, "learning_rate": 0.00043374945283981066, "loss": 5.2478, "mean_token_accuracy": 0.20258497595787048, "num_tokens": 51497642.0, "step": 23070 }, { "entropy": 5.575276184082031, "epoch": 2.591565114842478, "grad_norm": 1.0, "learning_rate": 0.0004337209986405639, "loss": 5.248, "mean_token_accuracy": 0.19231952279806136, "num_tokens": 51511013.0, "step": 23075 }, { "entropy": 5.547844696044922, "epoch": 2.592126691750435, "grad_norm": 1.09375, "learning_rate": 0.000433692539387579, "loss": 5.3667, "mean_token_accuracy": 0.1921800434589386, "num_tokens": 51521687.0, "step": 23080 }, { "entropy": 5.525119400024414, "epoch": 2.5926882686583927, "grad_norm": 1.046875, "learning_rate": 0.0004336640750817621, "loss": 5.2325, "mean_token_accuracy": 0.19389444291591645, "num_tokens": 51532288.0, "step": 23085 }, { "entropy": 5.534699010848999, "epoch": 2.5932498455663504, "grad_norm": 1.109375, "learning_rate": 0.00043363560572401953, "loss": 5.2335, "mean_token_accuracy": 0.19883880764245987, "num_tokens": 51543101.0, "step": 23090 }, { "entropy": 5.462389039993286, "epoch": 2.5938114224743076, "grad_norm": 1.125, "learning_rate": 0.00043360713131525774, "loss": 5.2866, "mean_token_accuracy": 0.19957807213068007, "num_tokens": 51554729.0, "step": 23095 }, { "entropy": 5.492091512680053, "epoch": 2.5943729993822653, "grad_norm": 1.1015625, "learning_rate": 0.0004335786518563834, "loss": 5.2021, "mean_token_accuracy": 0.19596800506114959, "num_tokens": 51567232.0, "step": 23100 }, { "entropy": 5.553070068359375, "epoch": 2.594934576290223, "grad_norm": 1.09375, "learning_rate": 0.0004335501673483033, "loss": 5.1923, "mean_token_accuracy": 0.1995108276605606, "num_tokens": 51577679.0, "step": 23105 }, { "entropy": 5.453506088256836, "epoch": 2.5954961531981806, "grad_norm": 1.0859375, "learning_rate": 0.00043352167779192423, "loss": 5.1237, "mean_token_accuracy": 0.196798375248909, "num_tokens": 51588656.0, "step": 23110 }, { "entropy": 5.468847608566284, "epoch": 2.5960577301061383, "grad_norm": 1.1328125, "learning_rate": 0.00043349318318815363, "loss": 5.2261, "mean_token_accuracy": 0.1949308842420578, "num_tokens": 51599016.0, "step": 23115 }, { "entropy": 5.317247819900513, "epoch": 2.5966193070140955, "grad_norm": 1.078125, "learning_rate": 0.00043346468353789853, "loss": 4.9954, "mean_token_accuracy": 0.21364231258630753, "num_tokens": 51610288.0, "step": 23120 }, { "entropy": 5.483580780029297, "epoch": 2.597180883922053, "grad_norm": 1.203125, "learning_rate": 0.0004334361788420664, "loss": 5.2992, "mean_token_accuracy": 0.19442235231399535, "num_tokens": 51622450.0, "step": 23125 }, { "entropy": 5.531235551834106, "epoch": 2.597742460830011, "grad_norm": 1.0390625, "learning_rate": 0.00043340766910156497, "loss": 5.1118, "mean_token_accuracy": 0.20397164821624755, "num_tokens": 51635111.0, "step": 23130 }, { "entropy": 5.473828744888306, "epoch": 2.598304037737968, "grad_norm": 1.1015625, "learning_rate": 0.00043337915431730195, "loss": 5.2457, "mean_token_accuracy": 0.1937500387430191, "num_tokens": 51646088.0, "step": 23135 }, { "entropy": 5.447720718383789, "epoch": 2.5988656146459257, "grad_norm": 1.0234375, "learning_rate": 0.00043335063449018515, "loss": 5.1647, "mean_token_accuracy": 0.19829271733760834, "num_tokens": 51659337.0, "step": 23140 }, { "entropy": 5.547460508346558, "epoch": 2.5994271915538834, "grad_norm": 1.1484375, "learning_rate": 0.0004333221096211227, "loss": 5.3022, "mean_token_accuracy": 0.1992781475186348, "num_tokens": 51670954.0, "step": 23145 }, { "entropy": 5.447976112365723, "epoch": 2.599988768461841, "grad_norm": 1.0859375, "learning_rate": 0.00043329357971102296, "loss": 5.1381, "mean_token_accuracy": 0.1973046228289604, "num_tokens": 51681104.0, "step": 23150 }, { "entropy": 5.321099185943604, "epoch": 2.6005503453697982, "grad_norm": 1.046875, "learning_rate": 0.00043326504476079425, "loss": 5.0318, "mean_token_accuracy": 0.2073124334216118, "num_tokens": 51691337.0, "step": 23155 }, { "entropy": 5.390917158126831, "epoch": 2.601111922277756, "grad_norm": 1.125, "learning_rate": 0.0004332365047713451, "loss": 5.1477, "mean_token_accuracy": 0.2008199766278267, "num_tokens": 51702488.0, "step": 23160 }, { "entropy": 5.53355302810669, "epoch": 2.6016734991857136, "grad_norm": 1.015625, "learning_rate": 0.0004332079597435842, "loss": 5.2438, "mean_token_accuracy": 0.19955824315547943, "num_tokens": 51714439.0, "step": 23165 }, { "entropy": 5.630756664276123, "epoch": 2.602235076093671, "grad_norm": 1.078125, "learning_rate": 0.0004331794096784206, "loss": 5.288, "mean_token_accuracy": 0.19511518627405167, "num_tokens": 51726423.0, "step": 23170 }, { "entropy": 5.529940795898438, "epoch": 2.6027966530016284, "grad_norm": 1.1171875, "learning_rate": 0.0004331508545767633, "loss": 5.2563, "mean_token_accuracy": 0.20738064795732497, "num_tokens": 51736198.0, "step": 23175 }, { "entropy": 5.395144462585449, "epoch": 2.603358229909586, "grad_norm": 1.1484375, "learning_rate": 0.0004331222944395213, "loss": 5.1376, "mean_token_accuracy": 0.20435541719198227, "num_tokens": 51746993.0, "step": 23180 }, { "entropy": 5.437501335144043, "epoch": 2.6039198068175438, "grad_norm": 1.09375, "learning_rate": 0.0004330937292676042, "loss": 5.1534, "mean_token_accuracy": 0.20632504522800446, "num_tokens": 51756981.0, "step": 23185 }, { "entropy": 5.400945997238159, "epoch": 2.604481383725501, "grad_norm": 1.0859375, "learning_rate": 0.0004330651590619214, "loss": 5.161, "mean_token_accuracy": 0.20466522127389908, "num_tokens": 51768192.0, "step": 23190 }, { "entropy": 5.4939188957214355, "epoch": 2.6050429606334586, "grad_norm": 1.1640625, "learning_rate": 0.0004330365838233827, "loss": 5.2165, "mean_token_accuracy": 0.19679141342639922, "num_tokens": 51778996.0, "step": 23195 }, { "entropy": 5.5277821063995365, "epoch": 2.6056045375414163, "grad_norm": 1.046875, "learning_rate": 0.00043300800355289786, "loss": 5.2444, "mean_token_accuracy": 0.1924500972032547, "num_tokens": 51790179.0, "step": 23200 }, { "entropy": 5.470696496963501, "epoch": 2.606166114449374, "grad_norm": 1.2265625, "learning_rate": 0.00043297941825137684, "loss": 5.2489, "mean_token_accuracy": 0.20165283530950545, "num_tokens": 51801312.0, "step": 23205 }, { "entropy": 5.46109676361084, "epoch": 2.6067276913573316, "grad_norm": 1.1328125, "learning_rate": 0.00043295082791972993, "loss": 5.1642, "mean_token_accuracy": 0.2015443429350853, "num_tokens": 51811960.0, "step": 23210 }, { "entropy": 5.454913663864136, "epoch": 2.607289268265289, "grad_norm": 1.1328125, "learning_rate": 0.00043292223255886737, "loss": 5.2618, "mean_token_accuracy": 0.19244524836540222, "num_tokens": 51823166.0, "step": 23215 }, { "entropy": 5.479498434066772, "epoch": 2.6078508451732465, "grad_norm": 1.0625, "learning_rate": 0.00043289363216969973, "loss": 5.1326, "mean_token_accuracy": 0.19873957484960555, "num_tokens": 51835517.0, "step": 23220 }, { "entropy": 5.452497148513794, "epoch": 2.608412422081204, "grad_norm": 1.0859375, "learning_rate": 0.00043286502675313757, "loss": 5.1666, "mean_token_accuracy": 0.2023353934288025, "num_tokens": 51846690.0, "step": 23225 }, { "entropy": 5.389071798324585, "epoch": 2.6089739989891614, "grad_norm": 1.1875, "learning_rate": 0.0004328364163100917, "loss": 5.159, "mean_token_accuracy": 0.20219334661960603, "num_tokens": 51857234.0, "step": 23230 }, { "entropy": 5.48324146270752, "epoch": 2.609535575897119, "grad_norm": 1.0234375, "learning_rate": 0.0004328078008414731, "loss": 5.243, "mean_token_accuracy": 0.20180547386407852, "num_tokens": 51867913.0, "step": 23235 }, { "entropy": 5.437986230850219, "epoch": 2.6100971528050767, "grad_norm": 1.1171875, "learning_rate": 0.000432779180348193, "loss": 5.1851, "mean_token_accuracy": 0.2051671788096428, "num_tokens": 51878252.0, "step": 23240 }, { "entropy": 5.383799028396607, "epoch": 2.6106587297130344, "grad_norm": 1.2734375, "learning_rate": 0.00043275055483116254, "loss": 5.1143, "mean_token_accuracy": 0.20199795216321945, "num_tokens": 51888407.0, "step": 23245 }, { "entropy": 5.508200931549072, "epoch": 2.6112203066209916, "grad_norm": 1.09375, "learning_rate": 0.0004327219242912933, "loss": 5.1982, "mean_token_accuracy": 0.19967449456453323, "num_tokens": 51900042.0, "step": 23250 }, { "entropy": 5.510458517074585, "epoch": 2.6117818835289492, "grad_norm": 1.0, "learning_rate": 0.0004326932887294967, "loss": 5.21, "mean_token_accuracy": 0.19857455641031266, "num_tokens": 51909691.0, "step": 23255 }, { "entropy": 5.560432863235474, "epoch": 2.612343460436907, "grad_norm": 1.171875, "learning_rate": 0.0004326646481466848, "loss": 5.2666, "mean_token_accuracy": 0.19549815654754638, "num_tokens": 51921691.0, "step": 23260 }, { "entropy": 5.457535886764527, "epoch": 2.6129050373448646, "grad_norm": 1.03125, "learning_rate": 0.0004326360025437692, "loss": 5.1382, "mean_token_accuracy": 0.20069834738969802, "num_tokens": 51934050.0, "step": 23265 }, { "entropy": 5.486303091049194, "epoch": 2.613466614252822, "grad_norm": 1.0390625, "learning_rate": 0.00043260735192166217, "loss": 5.1686, "mean_token_accuracy": 0.2039589539170265, "num_tokens": 51944566.0, "step": 23270 }, { "entropy": 5.459819507598877, "epoch": 2.6140281911607794, "grad_norm": 1.1484375, "learning_rate": 0.000432578696281276, "loss": 5.0944, "mean_token_accuracy": 0.20982656031847, "num_tokens": 51955485.0, "step": 23275 }, { "entropy": 5.425382089614868, "epoch": 2.614589768068737, "grad_norm": 1.234375, "learning_rate": 0.000432550035623523, "loss": 5.1682, "mean_token_accuracy": 0.20477787256240845, "num_tokens": 51965124.0, "step": 23280 }, { "entropy": 5.551755666732788, "epoch": 2.6151513449766943, "grad_norm": 1.078125, "learning_rate": 0.0004325213699493157, "loss": 5.2096, "mean_token_accuracy": 0.2066628560423851, "num_tokens": 51976362.0, "step": 23285 }, { "entropy": 5.376646900177002, "epoch": 2.615712921884652, "grad_norm": 1.046875, "learning_rate": 0.0004324926992595669, "loss": 5.0861, "mean_token_accuracy": 0.19803429394960403, "num_tokens": 51988068.0, "step": 23290 }, { "entropy": 5.44796347618103, "epoch": 2.6162744987926096, "grad_norm": 0.9921875, "learning_rate": 0.0004324640235551895, "loss": 5.1431, "mean_token_accuracy": 0.20669957399368286, "num_tokens": 51998392.0, "step": 23295 }, { "entropy": 5.409528064727783, "epoch": 2.6168360757005673, "grad_norm": 1.046875, "learning_rate": 0.0004324353428370965, "loss": 5.1153, "mean_token_accuracy": 0.19969575405120848, "num_tokens": 52009416.0, "step": 23300 }, { "entropy": 5.540070486068726, "epoch": 2.617397652608525, "grad_norm": 1.1484375, "learning_rate": 0.0004324066571062012, "loss": 5.1928, "mean_token_accuracy": 0.20413899719715117, "num_tokens": 52020554.0, "step": 23305 }, { "entropy": 5.405008935928345, "epoch": 2.617959229516482, "grad_norm": 1.1328125, "learning_rate": 0.0004323779663634168, "loss": 5.1964, "mean_token_accuracy": 0.19754453748464584, "num_tokens": 52031301.0, "step": 23310 }, { "entropy": 5.419484329223633, "epoch": 2.61852080642444, "grad_norm": 1.1015625, "learning_rate": 0.000432349270609657, "loss": 5.1435, "mean_token_accuracy": 0.2014838293194771, "num_tokens": 52041720.0, "step": 23315 }, { "entropy": 5.39289870262146, "epoch": 2.6190823833323975, "grad_norm": 1.078125, "learning_rate": 0.00043232056984583527, "loss": 5.0732, "mean_token_accuracy": 0.2068752959370613, "num_tokens": 52051911.0, "step": 23320 }, { "entropy": 5.439510345458984, "epoch": 2.6196439602403547, "grad_norm": 1.1484375, "learning_rate": 0.0004322918640728656, "loss": 5.1656, "mean_token_accuracy": 0.20078354924917222, "num_tokens": 52062842.0, "step": 23325 }, { "entropy": 5.469933795928955, "epoch": 2.6202055371483124, "grad_norm": 1.0703125, "learning_rate": 0.00043226315329166203, "loss": 5.305, "mean_token_accuracy": 0.19540444612503052, "num_tokens": 52075034.0, "step": 23330 }, { "entropy": 5.499102926254272, "epoch": 2.62076711405627, "grad_norm": 1.09375, "learning_rate": 0.00043223443750313873, "loss": 5.0946, "mean_token_accuracy": 0.21070630103349686, "num_tokens": 52084782.0, "step": 23335 }, { "entropy": 5.3721761226654055, "epoch": 2.6213286909642277, "grad_norm": 1.046875, "learning_rate": 0.0004322057167082099, "loss": 5.1122, "mean_token_accuracy": 0.19998955577611924, "num_tokens": 52095623.0, "step": 23340 }, { "entropy": 5.439248418807983, "epoch": 2.621890267872185, "grad_norm": 1.1171875, "learning_rate": 0.00043217699090779006, "loss": 5.1704, "mean_token_accuracy": 0.20737988203763963, "num_tokens": 52107240.0, "step": 23345 }, { "entropy": 5.4496763229370115, "epoch": 2.6224518447801426, "grad_norm": 1.1015625, "learning_rate": 0.00043214826010279383, "loss": 5.2667, "mean_token_accuracy": 0.19826025366783143, "num_tokens": 52118157.0, "step": 23350 }, { "entropy": 5.565532588958741, "epoch": 2.6230134216881003, "grad_norm": 1.375, "learning_rate": 0.0004321195242941361, "loss": 5.2864, "mean_token_accuracy": 0.18660368919372558, "num_tokens": 52130578.0, "step": 23355 }, { "entropy": 5.540079402923584, "epoch": 2.623574998596058, "grad_norm": 1.25, "learning_rate": 0.00043209078348273175, "loss": 5.1551, "mean_token_accuracy": 0.2040082111954689, "num_tokens": 52142057.0, "step": 23360 }, { "entropy": 5.5023033618927, "epoch": 2.624136575504015, "grad_norm": 1.1640625, "learning_rate": 0.0004320620376694959, "loss": 5.2609, "mean_token_accuracy": 0.19550875574350357, "num_tokens": 52152370.0, "step": 23365 }, { "entropy": 5.404144763946533, "epoch": 2.624698152411973, "grad_norm": 1.0703125, "learning_rate": 0.00043203328685534396, "loss": 5.1575, "mean_token_accuracy": 0.20197988003492356, "num_tokens": 52162139.0, "step": 23370 }, { "entropy": 5.493215322494507, "epoch": 2.6252597293199305, "grad_norm": 1.09375, "learning_rate": 0.0004320045310411912, "loss": 5.2252, "mean_token_accuracy": 0.20067870914936065, "num_tokens": 52172820.0, "step": 23375 }, { "entropy": 5.429520177841186, "epoch": 2.6258213062278877, "grad_norm": 1.0546875, "learning_rate": 0.00043197577022795327, "loss": 5.0699, "mean_token_accuracy": 0.20700942426919938, "num_tokens": 52183315.0, "step": 23380 }, { "entropy": 5.355142116546631, "epoch": 2.6263828831358453, "grad_norm": 1.0390625, "learning_rate": 0.0004319470044165459, "loss": 5.1411, "mean_token_accuracy": 0.20844318121671676, "num_tokens": 52194776.0, "step": 23385 }, { "entropy": 5.56971287727356, "epoch": 2.626944460043803, "grad_norm": 1.078125, "learning_rate": 0.0004319182336078852, "loss": 5.3254, "mean_token_accuracy": 0.19389017671346664, "num_tokens": 52207370.0, "step": 23390 }, { "entropy": 5.484973049163818, "epoch": 2.6275060369517607, "grad_norm": 1.0546875, "learning_rate": 0.000431889457802887, "loss": 5.1299, "mean_token_accuracy": 0.20800730139017104, "num_tokens": 52218287.0, "step": 23395 }, { "entropy": 5.44383020401001, "epoch": 2.6280676138597183, "grad_norm": 1.1328125, "learning_rate": 0.0004318606770024675, "loss": 5.255, "mean_token_accuracy": 0.19475822299718856, "num_tokens": 52229418.0, "step": 23400 }, { "entropy": 5.563400936126709, "epoch": 2.6286291907676755, "grad_norm": 1.28125, "learning_rate": 0.0004318318912075433, "loss": 5.2024, "mean_token_accuracy": 0.19832005500793456, "num_tokens": 52240382.0, "step": 23405 }, { "entropy": 5.518240451812744, "epoch": 2.629190767675633, "grad_norm": 1.0078125, "learning_rate": 0.0004318031004190308, "loss": 5.2272, "mean_token_accuracy": 0.19684348702430726, "num_tokens": 52252608.0, "step": 23410 }, { "entropy": 5.431765222549439, "epoch": 2.629752344583591, "grad_norm": 1.1796875, "learning_rate": 0.00043177430463784685, "loss": 5.133, "mean_token_accuracy": 0.2142768010497093, "num_tokens": 52262940.0, "step": 23415 }, { "entropy": 5.367644214630127, "epoch": 2.630313921491548, "grad_norm": 1.1640625, "learning_rate": 0.00043174550386490816, "loss": 5.0846, "mean_token_accuracy": 0.20578556060791015, "num_tokens": 52273270.0, "step": 23420 }, { "entropy": 5.427347135543823, "epoch": 2.6308754983995057, "grad_norm": 1.1328125, "learning_rate": 0.0004317166981011319, "loss": 5.1611, "mean_token_accuracy": 0.200395405292511, "num_tokens": 52284433.0, "step": 23425 }, { "entropy": 5.548338174819946, "epoch": 2.6314370753074634, "grad_norm": 1.015625, "learning_rate": 0.00043168788734743516, "loss": 5.1775, "mean_token_accuracy": 0.20473337322473525, "num_tokens": 52296088.0, "step": 23430 }, { "entropy": 5.497882080078125, "epoch": 2.631998652215421, "grad_norm": 1.125, "learning_rate": 0.00043165907160473525, "loss": 5.2498, "mean_token_accuracy": 0.19243747889995574, "num_tokens": 52307683.0, "step": 23435 }, { "entropy": 5.447935438156128, "epoch": 2.6325602291233783, "grad_norm": 1.0859375, "learning_rate": 0.0004316302508739499, "loss": 5.2304, "mean_token_accuracy": 0.19726531058549882, "num_tokens": 52319845.0, "step": 23440 }, { "entropy": 5.488337135314941, "epoch": 2.633121806031336, "grad_norm": 1.0546875, "learning_rate": 0.0004316014251559965, "loss": 5.1653, "mean_token_accuracy": 0.2008945792913437, "num_tokens": 52330196.0, "step": 23445 }, { "entropy": 5.593804883956909, "epoch": 2.6336833829392936, "grad_norm": 1.078125, "learning_rate": 0.00043157259445179304, "loss": 5.3748, "mean_token_accuracy": 0.19053859859704972, "num_tokens": 52341510.0, "step": 23450 }, { "entropy": 5.471933364868164, "epoch": 2.6342449598472513, "grad_norm": 1.3984375, "learning_rate": 0.0004315437587622574, "loss": 5.1341, "mean_token_accuracy": 0.2022364392876625, "num_tokens": 52351848.0, "step": 23455 }, { "entropy": 5.483906698226929, "epoch": 2.6348065367552085, "grad_norm": 1.1484375, "learning_rate": 0.00043151491808830777, "loss": 5.1955, "mean_token_accuracy": 0.1995692566037178, "num_tokens": 52363698.0, "step": 23460 }, { "entropy": 5.477593946456909, "epoch": 2.635368113663166, "grad_norm": 1.078125, "learning_rate": 0.00043148607243086255, "loss": 5.1555, "mean_token_accuracy": 0.1993621587753296, "num_tokens": 52374433.0, "step": 23465 }, { "entropy": 5.4144477367401125, "epoch": 2.635929690571124, "grad_norm": 1.078125, "learning_rate": 0.0004314572217908399, "loss": 5.2165, "mean_token_accuracy": 0.20255142897367479, "num_tokens": 52385762.0, "step": 23470 }, { "entropy": 5.481233692169189, "epoch": 2.636491267479081, "grad_norm": 1.1796875, "learning_rate": 0.0004314283661691587, "loss": 4.9868, "mean_token_accuracy": 0.21361292004585267, "num_tokens": 52397058.0, "step": 23475 }, { "entropy": 5.512315082550049, "epoch": 2.6370528443870387, "grad_norm": 1.046875, "learning_rate": 0.0004313995055667377, "loss": 5.2547, "mean_token_accuracy": 0.1977449432015419, "num_tokens": 52407671.0, "step": 23480 }, { "entropy": 5.477112340927124, "epoch": 2.6376144212949963, "grad_norm": 1.09375, "learning_rate": 0.0004313706399844958, "loss": 5.2396, "mean_token_accuracy": 0.1980699732899666, "num_tokens": 52419511.0, "step": 23485 }, { "entropy": 5.394292974472046, "epoch": 2.638175998202954, "grad_norm": 1.2109375, "learning_rate": 0.000431341769423352, "loss": 5.1114, "mean_token_accuracy": 0.1963311478495598, "num_tokens": 52431311.0, "step": 23490 }, { "entropy": 5.493609428405762, "epoch": 2.6387375751109117, "grad_norm": 1.21875, "learning_rate": 0.0004313128938842257, "loss": 5.152, "mean_token_accuracy": 0.19902120381593705, "num_tokens": 52442184.0, "step": 23495 }, { "entropy": 5.515880727767945, "epoch": 2.639299152018869, "grad_norm": 1.0703125, "learning_rate": 0.00043128401336803616, "loss": 5.223, "mean_token_accuracy": 0.19565608203411103, "num_tokens": 52454837.0, "step": 23500 }, { "entropy": 5.5168108463287355, "epoch": 2.6398607289268265, "grad_norm": 1.0625, "learning_rate": 0.00043125512787570305, "loss": 5.2155, "mean_token_accuracy": 0.199556864798069, "num_tokens": 52465378.0, "step": 23505 }, { "entropy": 5.483809185028076, "epoch": 2.640422305834784, "grad_norm": 1.015625, "learning_rate": 0.0004312262374081461, "loss": 5.2363, "mean_token_accuracy": 0.19988692104816436, "num_tokens": 52476025.0, "step": 23510 }, { "entropy": 5.536465692520141, "epoch": 2.6409838827427414, "grad_norm": 1.015625, "learning_rate": 0.00043119734196628507, "loss": 5.1809, "mean_token_accuracy": 0.1984606832265854, "num_tokens": 52487408.0, "step": 23515 }, { "entropy": 5.496368551254273, "epoch": 2.641545459650699, "grad_norm": 1.0859375, "learning_rate": 0.00043116844155104025, "loss": 5.1245, "mean_token_accuracy": 0.20686034560203553, "num_tokens": 52497801.0, "step": 23520 }, { "entropy": 5.411055946350098, "epoch": 2.6421070365586568, "grad_norm": 1.0625, "learning_rate": 0.0004311395361633316, "loss": 5.1853, "mean_token_accuracy": 0.19698130935430527, "num_tokens": 52508918.0, "step": 23525 }, { "entropy": 5.412768316268921, "epoch": 2.6426686134666144, "grad_norm": 1.09375, "learning_rate": 0.0004311106258040795, "loss": 5.1194, "mean_token_accuracy": 0.20621820837259291, "num_tokens": 52519951.0, "step": 23530 }, { "entropy": 5.340115308761597, "epoch": 2.643230190374572, "grad_norm": 1.1328125, "learning_rate": 0.00043108171047420463, "loss": 5.122, "mean_token_accuracy": 0.1990943282842636, "num_tokens": 52530710.0, "step": 23535 }, { "entropy": 5.361363506317138, "epoch": 2.6437917672825293, "grad_norm": 0.98046875, "learning_rate": 0.0004310527901746275, "loss": 5.086, "mean_token_accuracy": 0.20682694166898727, "num_tokens": 52542188.0, "step": 23540 }, { "entropy": 5.488569259643555, "epoch": 2.644353344190487, "grad_norm": 1.0390625, "learning_rate": 0.000431023864906269, "loss": 5.2185, "mean_token_accuracy": 0.20059878677129744, "num_tokens": 52553848.0, "step": 23545 }, { "entropy": 5.427157735824585, "epoch": 2.6449149210984446, "grad_norm": 1.1484375, "learning_rate": 0.00043099493467005015, "loss": 5.1484, "mean_token_accuracy": 0.2035217434167862, "num_tokens": 52563338.0, "step": 23550 }, { "entropy": 5.470952558517456, "epoch": 2.645476498006402, "grad_norm": 1.203125, "learning_rate": 0.000430965999466892, "loss": 5.2901, "mean_token_accuracy": 0.19292771965265273, "num_tokens": 52576369.0, "step": 23555 }, { "entropy": 5.481601095199585, "epoch": 2.6460380749143595, "grad_norm": 1.125, "learning_rate": 0.00043093705929771604, "loss": 5.199, "mean_token_accuracy": 0.20293420553207397, "num_tokens": 52587409.0, "step": 23560 }, { "entropy": 5.458005094528199, "epoch": 2.646599651822317, "grad_norm": 1.0546875, "learning_rate": 0.0004309081141634436, "loss": 5.138, "mean_token_accuracy": 0.19908208400011063, "num_tokens": 52599398.0, "step": 23565 }, { "entropy": 5.462128734588623, "epoch": 2.6471612287302744, "grad_norm": 1.1015625, "learning_rate": 0.00043087916406499635, "loss": 5.1289, "mean_token_accuracy": 0.2062810480594635, "num_tokens": 52609565.0, "step": 23570 }, { "entropy": 5.42417426109314, "epoch": 2.647722805638232, "grad_norm": 1.0546875, "learning_rate": 0.00043085020900329604, "loss": 5.1929, "mean_token_accuracy": 0.203407683968544, "num_tokens": 52621150.0, "step": 23575 }, { "entropy": 5.440845346450805, "epoch": 2.6482843825461897, "grad_norm": 1.265625, "learning_rate": 0.00043082124897926463, "loss": 5.1862, "mean_token_accuracy": 0.20108286887407303, "num_tokens": 52632030.0, "step": 23580 }, { "entropy": 5.509593296051025, "epoch": 2.6488459594541474, "grad_norm": 1.09375, "learning_rate": 0.0004307922839938242, "loss": 5.2972, "mean_token_accuracy": 0.195563405752182, "num_tokens": 52643447.0, "step": 23585 }, { "entropy": 5.509720754623413, "epoch": 2.649407536362105, "grad_norm": 1.078125, "learning_rate": 0.00043076331404789703, "loss": 5.1771, "mean_token_accuracy": 0.2076278507709503, "num_tokens": 52655017.0, "step": 23590 }, { "entropy": 5.5232213020324705, "epoch": 2.6499691132700622, "grad_norm": 1.046875, "learning_rate": 0.0004307343391424055, "loss": 5.2104, "mean_token_accuracy": 0.19614923596382142, "num_tokens": 52665674.0, "step": 23595 }, { "entropy": 5.39630389213562, "epoch": 2.65053069017802, "grad_norm": 1.125, "learning_rate": 0.0004307053592782723, "loss": 5.1602, "mean_token_accuracy": 0.20166541785001754, "num_tokens": 52678177.0, "step": 23600 }, { "entropy": 5.471887302398682, "epoch": 2.6510922670859776, "grad_norm": 1.1640625, "learning_rate": 0.00043067637445642004, "loss": 5.2367, "mean_token_accuracy": 0.199528306722641, "num_tokens": 52689326.0, "step": 23605 }, { "entropy": 5.503168153762817, "epoch": 2.651653843993935, "grad_norm": 1.109375, "learning_rate": 0.00043064738467777166, "loss": 5.2686, "mean_token_accuracy": 0.1897120252251625, "num_tokens": 52701686.0, "step": 23610 }, { "entropy": 5.455009794235229, "epoch": 2.6522154209018924, "grad_norm": 1.2578125, "learning_rate": 0.00043061838994325007, "loss": 5.1746, "mean_token_accuracy": 0.20472166687250137, "num_tokens": 52713422.0, "step": 23615 }, { "entropy": 5.4553224563598635, "epoch": 2.65277699780985, "grad_norm": 1.28125, "learning_rate": 0.00043058939025377867, "loss": 5.2259, "mean_token_accuracy": 0.19934384673833846, "num_tokens": 52724438.0, "step": 23620 }, { "entropy": 5.455756664276123, "epoch": 2.6533385747178078, "grad_norm": 1.0234375, "learning_rate": 0.0004305603856102808, "loss": 5.1782, "mean_token_accuracy": 0.20492662936449052, "num_tokens": 52734657.0, "step": 23625 }, { "entropy": 5.455070829391479, "epoch": 2.6539001516257654, "grad_norm": 1.078125, "learning_rate": 0.0004305313760136799, "loss": 5.1379, "mean_token_accuracy": 0.20828091055154802, "num_tokens": 52745832.0, "step": 23630 }, { "entropy": 5.506795835494995, "epoch": 2.6544617285337226, "grad_norm": 0.9296875, "learning_rate": 0.00043050236146489955, "loss": 5.3156, "mean_token_accuracy": 0.1952225759625435, "num_tokens": 52758795.0, "step": 23635 }, { "entropy": 5.488795757293701, "epoch": 2.6550233054416803, "grad_norm": 1.1171875, "learning_rate": 0.0004304733419648638, "loss": 5.2211, "mean_token_accuracy": 0.2016402930021286, "num_tokens": 52769154.0, "step": 23640 }, { "entropy": 5.472024202346802, "epoch": 2.655584882349638, "grad_norm": 1.2265625, "learning_rate": 0.00043044431751449656, "loss": 5.1591, "mean_token_accuracy": 0.20421334505081176, "num_tokens": 52779189.0, "step": 23645 }, { "entropy": 5.516177177429199, "epoch": 2.656146459257595, "grad_norm": 1.2421875, "learning_rate": 0.0004304152881147219, "loss": 5.2928, "mean_token_accuracy": 0.20140977799892426, "num_tokens": 52789545.0, "step": 23650 }, { "entropy": 5.587547445297242, "epoch": 2.656708036165553, "grad_norm": 1.1484375, "learning_rate": 0.0004303862537664642, "loss": 5.4089, "mean_token_accuracy": 0.18406397551298143, "num_tokens": 52802410.0, "step": 23655 }, { "entropy": 5.433873414993286, "epoch": 2.6572696130735105, "grad_norm": 0.99609375, "learning_rate": 0.000430357214470648, "loss": 5.1877, "mean_token_accuracy": 0.20008882135152817, "num_tokens": 52814223.0, "step": 23660 }, { "entropy": 5.400897598266601, "epoch": 2.6578311899814677, "grad_norm": 1.1796875, "learning_rate": 0.0004303281702281977, "loss": 5.1332, "mean_token_accuracy": 0.2064850002527237, "num_tokens": 52824554.0, "step": 23665 }, { "entropy": 5.553000831604004, "epoch": 2.6583927668894254, "grad_norm": 1.0859375, "learning_rate": 0.00043029912104003827, "loss": 5.3241, "mean_token_accuracy": 0.1995888665318489, "num_tokens": 52836058.0, "step": 23670 }, { "entropy": 5.467930746078491, "epoch": 2.658954343797383, "grad_norm": 1.0703125, "learning_rate": 0.00043027006690709457, "loss": 5.265, "mean_token_accuracy": 0.19593652337789536, "num_tokens": 52847220.0, "step": 23675 }, { "entropy": 5.468914222717285, "epoch": 2.6595159207053407, "grad_norm": 1.0390625, "learning_rate": 0.0004302410078302918, "loss": 5.1019, "mean_token_accuracy": 0.20464342683553696, "num_tokens": 52858242.0, "step": 23680 }, { "entropy": 5.384401178359985, "epoch": 2.6600774976132984, "grad_norm": 1.09375, "learning_rate": 0.00043021194381055505, "loss": 5.0472, "mean_token_accuracy": 0.20356269925832748, "num_tokens": 52869439.0, "step": 23685 }, { "entropy": 5.583893728256226, "epoch": 2.6606390745212556, "grad_norm": 1.046875, "learning_rate": 0.00043018287484880986, "loss": 5.3961, "mean_token_accuracy": 0.19009190201759338, "num_tokens": 52879893.0, "step": 23690 }, { "entropy": 5.540567922592163, "epoch": 2.6612006514292132, "grad_norm": 1.03125, "learning_rate": 0.0004301538009459817, "loss": 5.2299, "mean_token_accuracy": 0.1975465565919876, "num_tokens": 52891352.0, "step": 23695 }, { "entropy": 5.431209564208984, "epoch": 2.661762228337171, "grad_norm": 1.1015625, "learning_rate": 0.0004301247221029964, "loss": 5.2186, "mean_token_accuracy": 0.19581498354673385, "num_tokens": 52904202.0, "step": 23700 }, { "entropy": 5.466895246505738, "epoch": 2.662323805245128, "grad_norm": 1.1484375, "learning_rate": 0.00043009563832077977, "loss": 5.1392, "mean_token_accuracy": 0.2047729477286339, "num_tokens": 52914495.0, "step": 23705 }, { "entropy": 5.477147245407105, "epoch": 2.662885382153086, "grad_norm": 1.1328125, "learning_rate": 0.0004300665496002578, "loss": 5.213, "mean_token_accuracy": 0.19413714557886125, "num_tokens": 52925930.0, "step": 23710 }, { "entropy": 5.504684257507324, "epoch": 2.6634469590610435, "grad_norm": 1.109375, "learning_rate": 0.00043003745594235687, "loss": 5.1831, "mean_token_accuracy": 0.19708070307970046, "num_tokens": 52936310.0, "step": 23715 }, { "entropy": 5.488216876983643, "epoch": 2.664008535969001, "grad_norm": 1.375, "learning_rate": 0.0004300083573480031, "loss": 5.2992, "mean_token_accuracy": 0.19424211531877517, "num_tokens": 52948801.0, "step": 23720 }, { "entropy": 5.553876447677612, "epoch": 2.6645701128769588, "grad_norm": 1.03125, "learning_rate": 0.00042997925381812313, "loss": 5.3393, "mean_token_accuracy": 0.19497064799070357, "num_tokens": 52960541.0, "step": 23725 }, { "entropy": 5.481603574752808, "epoch": 2.665131689784916, "grad_norm": 0.99609375, "learning_rate": 0.00042995014535364363, "loss": 5.2075, "mean_token_accuracy": 0.1960158884525299, "num_tokens": 52971973.0, "step": 23730 }, { "entropy": 5.4324750900268555, "epoch": 2.6656932666928737, "grad_norm": 1.0390625, "learning_rate": 0.0004299210319554914, "loss": 5.1737, "mean_token_accuracy": 0.21714765429496766, "num_tokens": 52983124.0, "step": 23735 }, { "entropy": 5.479479217529297, "epoch": 2.6662548436008313, "grad_norm": 1.0390625, "learning_rate": 0.00042989191362459347, "loss": 5.1177, "mean_token_accuracy": 0.2090711385011673, "num_tokens": 52994402.0, "step": 23740 }, { "entropy": 5.466092920303344, "epoch": 2.6668164205087885, "grad_norm": 1.1953125, "learning_rate": 0.0004298627903618769, "loss": 5.2374, "mean_token_accuracy": 0.19495458900928497, "num_tokens": 53005253.0, "step": 23745 }, { "entropy": 5.487114906311035, "epoch": 2.667377997416746, "grad_norm": 1.1484375, "learning_rate": 0.00042983366216826907, "loss": 5.2558, "mean_token_accuracy": 0.20063638240098952, "num_tokens": 53016599.0, "step": 23750 }, { "entropy": 5.452792739868164, "epoch": 2.667939574324704, "grad_norm": 1.0546875, "learning_rate": 0.0004298045290446973, "loss": 5.1789, "mean_token_accuracy": 0.20471510142087937, "num_tokens": 53027412.0, "step": 23755 }, { "entropy": 5.491108417510986, "epoch": 2.668501151232661, "grad_norm": 1.203125, "learning_rate": 0.00042977539099208937, "loss": 5.2177, "mean_token_accuracy": 0.19474119395017625, "num_tokens": 53039490.0, "step": 23760 }, { "entropy": 5.478243064880371, "epoch": 2.6690627281406187, "grad_norm": 1.140625, "learning_rate": 0.00042974624801137283, "loss": 5.1946, "mean_token_accuracy": 0.2009686827659607, "num_tokens": 53049837.0, "step": 23765 }, { "entropy": 5.433179664611816, "epoch": 2.6696243050485764, "grad_norm": 1.09375, "learning_rate": 0.00042971710010347594, "loss": 5.1118, "mean_token_accuracy": 0.211330346763134, "num_tokens": 53060187.0, "step": 23770 }, { "entropy": 5.42611174583435, "epoch": 2.670185881956534, "grad_norm": 1.1171875, "learning_rate": 0.00042968794726932634, "loss": 5.1688, "mean_token_accuracy": 0.2024862825870514, "num_tokens": 53072050.0, "step": 23775 }, { "entropy": 5.451820421218872, "epoch": 2.6707474588644917, "grad_norm": 1.265625, "learning_rate": 0.0004296587895098527, "loss": 5.2358, "mean_token_accuracy": 0.19662144035100937, "num_tokens": 53083235.0, "step": 23780 }, { "entropy": 5.5170825004577635, "epoch": 2.671309035772449, "grad_norm": 1.015625, "learning_rate": 0.00042962962682598316, "loss": 5.2409, "mean_token_accuracy": 0.19715406000614166, "num_tokens": 53093615.0, "step": 23785 }, { "entropy": 5.5463752269744875, "epoch": 2.6718706126804066, "grad_norm": 1.015625, "learning_rate": 0.00042960045921864627, "loss": 5.2889, "mean_token_accuracy": 0.19199395626783372, "num_tokens": 53105611.0, "step": 23790 }, { "entropy": 5.471039342880249, "epoch": 2.6724321895883643, "grad_norm": 1.078125, "learning_rate": 0.0004295712866887709, "loss": 5.0522, "mean_token_accuracy": 0.2054540604352951, "num_tokens": 53116343.0, "step": 23795 }, { "entropy": 5.454292106628418, "epoch": 2.6729937664963215, "grad_norm": 1.15625, "learning_rate": 0.00042954210923728565, "loss": 5.2195, "mean_token_accuracy": 0.2033547967672348, "num_tokens": 53128754.0, "step": 23800 }, { "entropy": 5.388036823272705, "epoch": 2.673555343404279, "grad_norm": 1.1328125, "learning_rate": 0.0004295129268651198, "loss": 5.091, "mean_token_accuracy": 0.210646091401577, "num_tokens": 53139508.0, "step": 23805 }, { "entropy": 5.411625480651855, "epoch": 2.674116920312237, "grad_norm": 1.25, "learning_rate": 0.0004294837395732025, "loss": 5.0998, "mean_token_accuracy": 0.20751608312129974, "num_tokens": 53149925.0, "step": 23810 }, { "entropy": 5.435418653488159, "epoch": 2.6746784972201945, "grad_norm": 1.125, "learning_rate": 0.00042945454736246293, "loss": 5.1634, "mean_token_accuracy": 0.20198342949151993, "num_tokens": 53160053.0, "step": 23815 }, { "entropy": 5.495969581604004, "epoch": 2.675240074128152, "grad_norm": 1.0703125, "learning_rate": 0.00042942535023383075, "loss": 5.1703, "mean_token_accuracy": 0.20624391883611679, "num_tokens": 53170723.0, "step": 23820 }, { "entropy": 5.39514856338501, "epoch": 2.6758016510361093, "grad_norm": 1.0390625, "learning_rate": 0.00042939614818823547, "loss": 5.2044, "mean_token_accuracy": 0.19773222655057907, "num_tokens": 53182120.0, "step": 23825 }, { "entropy": 5.435149335861206, "epoch": 2.676363227944067, "grad_norm": 1.2265625, "learning_rate": 0.0004293669412266069, "loss": 5.1888, "mean_token_accuracy": 0.19621680080890655, "num_tokens": 53192481.0, "step": 23830 }, { "entropy": 5.4549168109893795, "epoch": 2.6769248048520247, "grad_norm": 1.1953125, "learning_rate": 0.0004293377293498751, "loss": 5.1761, "mean_token_accuracy": 0.1969471037387848, "num_tokens": 53203710.0, "step": 23835 }, { "entropy": 5.467357540130616, "epoch": 2.677486381759982, "grad_norm": 1.109375, "learning_rate": 0.00042930851255897014, "loss": 5.0953, "mean_token_accuracy": 0.20897049307823182, "num_tokens": 53214051.0, "step": 23840 }, { "entropy": 5.39466700553894, "epoch": 2.6780479586679395, "grad_norm": 1.1171875, "learning_rate": 0.0004292792908548223, "loss": 5.1258, "mean_token_accuracy": 0.20404789447784424, "num_tokens": 53224981.0, "step": 23845 }, { "entropy": 5.334466934204102, "epoch": 2.678609535575897, "grad_norm": 1.0546875, "learning_rate": 0.00042925006423836197, "loss": 4.9957, "mean_token_accuracy": 0.2121786430478096, "num_tokens": 53236336.0, "step": 23850 }, { "entropy": 5.428548002243042, "epoch": 2.6791711124838544, "grad_norm": 0.98046875, "learning_rate": 0.00042922083271051975, "loss": 5.2174, "mean_token_accuracy": 0.20053329914808274, "num_tokens": 53248212.0, "step": 23855 }, { "entropy": 5.479628276824951, "epoch": 2.679732689391812, "grad_norm": 1.1328125, "learning_rate": 0.0004291915962722265, "loss": 5.1958, "mean_token_accuracy": 0.20091208964586257, "num_tokens": 53258910.0, "step": 23860 }, { "entropy": 5.550708818435669, "epoch": 2.6802942662997697, "grad_norm": 1.09375, "learning_rate": 0.0004291623549244129, "loss": 5.2285, "mean_token_accuracy": 0.1984703153371811, "num_tokens": 53269445.0, "step": 23865 }, { "entropy": 5.455594396591186, "epoch": 2.6808558432077274, "grad_norm": 1.078125, "learning_rate": 0.00042913310866801024, "loss": 5.1566, "mean_token_accuracy": 0.20768319070339203, "num_tokens": 53280119.0, "step": 23870 }, { "entropy": 5.500387048721313, "epoch": 2.681417420115685, "grad_norm": 1.0390625, "learning_rate": 0.00042910385750394964, "loss": 5.1934, "mean_token_accuracy": 0.20669564604759216, "num_tokens": 53291496.0, "step": 23875 }, { "entropy": 5.46678991317749, "epoch": 2.6819789970236423, "grad_norm": 1.046875, "learning_rate": 0.0004290746014331623, "loss": 5.1631, "mean_token_accuracy": 0.19575610905885696, "num_tokens": 53303470.0, "step": 23880 }, { "entropy": 5.520257139205933, "epoch": 2.6825405739316, "grad_norm": 1.0703125, "learning_rate": 0.00042904534045658, "loss": 5.2588, "mean_token_accuracy": 0.20200514942407607, "num_tokens": 53313552.0, "step": 23885 }, { "entropy": 5.437272071838379, "epoch": 2.6831021508395576, "grad_norm": 1.03125, "learning_rate": 0.0004290160745751343, "loss": 5.2804, "mean_token_accuracy": 0.1971744939684868, "num_tokens": 53325280.0, "step": 23890 }, { "entropy": 5.3667339324951175, "epoch": 2.683663727747515, "grad_norm": 1.125, "learning_rate": 0.0004289868037897571, "loss": 5.044, "mean_token_accuracy": 0.2140959158539772, "num_tokens": 53334982.0, "step": 23895 }, { "entropy": 5.50390248298645, "epoch": 2.6842253046554725, "grad_norm": 1.1640625, "learning_rate": 0.0004289575281013802, "loss": 5.2249, "mean_token_accuracy": 0.19505434781312941, "num_tokens": 53346367.0, "step": 23900 }, { "entropy": 5.463916778564453, "epoch": 2.68478688156343, "grad_norm": 1.0625, "learning_rate": 0.000428928247510936, "loss": 5.1597, "mean_token_accuracy": 0.20073503702878953, "num_tokens": 53356907.0, "step": 23905 }, { "entropy": 5.451604270935059, "epoch": 2.685348458471388, "grad_norm": 1.046875, "learning_rate": 0.0004288989620193567, "loss": 5.1413, "mean_token_accuracy": 0.2048221156001091, "num_tokens": 53366619.0, "step": 23910 }, { "entropy": 5.489072227478028, "epoch": 2.6859100353793455, "grad_norm": 1.140625, "learning_rate": 0.00042886967162757475, "loss": 5.2027, "mean_token_accuracy": 0.20132599025964737, "num_tokens": 53377578.0, "step": 23915 }, { "entropy": 5.532238483428955, "epoch": 2.6864716122873027, "grad_norm": 0.96875, "learning_rate": 0.00042884037633652276, "loss": 5.1694, "mean_token_accuracy": 0.19484029412269593, "num_tokens": 53389416.0, "step": 23920 }, { "entropy": 5.399318790435791, "epoch": 2.6870331891952604, "grad_norm": 1.0703125, "learning_rate": 0.00042881107614713355, "loss": 5.0257, "mean_token_accuracy": 0.2138148456811905, "num_tokens": 53399453.0, "step": 23925 }, { "entropy": 5.337710618972778, "epoch": 2.687594766103218, "grad_norm": 1.03125, "learning_rate": 0.00042878177106034, "loss": 5.1795, "mean_token_accuracy": 0.19844985008239746, "num_tokens": 53409933.0, "step": 23930 }, { "entropy": 5.467342567443848, "epoch": 2.6881563430111752, "grad_norm": 1.1328125, "learning_rate": 0.0004287524610770752, "loss": 5.2255, "mean_token_accuracy": 0.20246859788894653, "num_tokens": 53420943.0, "step": 23935 }, { "entropy": 5.390620326995849, "epoch": 2.688717919919133, "grad_norm": 1.0703125, "learning_rate": 0.00042872314619827234, "loss": 5.0613, "mean_token_accuracy": 0.2050351619720459, "num_tokens": 53431450.0, "step": 23940 }, { "entropy": 5.334903001785278, "epoch": 2.6892794968270906, "grad_norm": 1.0625, "learning_rate": 0.000428693826424865, "loss": 5.0148, "mean_token_accuracy": 0.2082084074616432, "num_tokens": 53442198.0, "step": 23945 }, { "entropy": 5.386764860153198, "epoch": 2.6898410737350478, "grad_norm": 1.21875, "learning_rate": 0.0004286645017577866, "loss": 5.0642, "mean_token_accuracy": 0.20550597161054612, "num_tokens": 53452411.0, "step": 23950 }, { "entropy": 5.39258222579956, "epoch": 2.6904026506430054, "grad_norm": 1.1015625, "learning_rate": 0.00042863517219797085, "loss": 5.1279, "mean_token_accuracy": 0.20574878752231598, "num_tokens": 53462644.0, "step": 23955 }, { "entropy": 5.3428794860839846, "epoch": 2.690964227550963, "grad_norm": 1.265625, "learning_rate": 0.00042860583774635165, "loss": 5.1363, "mean_token_accuracy": 0.2001335307955742, "num_tokens": 53473258.0, "step": 23960 }, { "entropy": 5.435537242889405, "epoch": 2.6915258044589208, "grad_norm": 1.0390625, "learning_rate": 0.000428576498403863, "loss": 5.128, "mean_token_accuracy": 0.20437007397413254, "num_tokens": 53484011.0, "step": 23965 }, { "entropy": 5.470778512954712, "epoch": 2.6920873813668784, "grad_norm": 1.1875, "learning_rate": 0.000428547154171439, "loss": 5.168, "mean_token_accuracy": 0.20754805952310562, "num_tokens": 53495549.0, "step": 23970 }, { "entropy": 5.4761251449584964, "epoch": 2.6926489582748356, "grad_norm": 1.0234375, "learning_rate": 0.0004285178050500142, "loss": 5.2413, "mean_token_accuracy": 0.1998326763510704, "num_tokens": 53506721.0, "step": 23975 }, { "entropy": 5.546339750289917, "epoch": 2.6932105351827933, "grad_norm": 1.015625, "learning_rate": 0.0004284884510405228, "loss": 5.3391, "mean_token_accuracy": 0.19034197330474853, "num_tokens": 53518363.0, "step": 23980 }, { "entropy": 5.354467725753784, "epoch": 2.693772112090751, "grad_norm": 1.203125, "learning_rate": 0.0004284590921438997, "loss": 5.077, "mean_token_accuracy": 0.20418502986431122, "num_tokens": 53529140.0, "step": 23985 }, { "entropy": 5.362538194656372, "epoch": 2.694333688998708, "grad_norm": 1.109375, "learning_rate": 0.00042842972836107954, "loss": 5.1498, "mean_token_accuracy": 0.19923700243234635, "num_tokens": 53540707.0, "step": 23990 }, { "entropy": 5.478306627273559, "epoch": 2.694895265906666, "grad_norm": 1.2578125, "learning_rate": 0.0004284003596929973, "loss": 5.1625, "mean_token_accuracy": 0.2027212679386139, "num_tokens": 53551297.0, "step": 23995 }, { "entropy": 5.385969114303589, "epoch": 2.6954568428146235, "grad_norm": 1.09375, "learning_rate": 0.00042837098614058815, "loss": 5.0659, "mean_token_accuracy": 0.19970440119504929, "num_tokens": 53562207.0, "step": 24000 }, { "epoch": 2.6954568428146235, "eval_entropy": 5.194862051356967, "eval_loss": 5.287596225738525, "eval_mean_token_accuracy": 0.2040473656488166, "eval_num_tokens": 53562207.0, "eval_runtime": 23.7018, "eval_samples_per_second": 1308.465, "eval_steps_per_second": 163.574, "step": 24000 }, { "entropy": 5.4051800727844235, "epoch": 2.696018419722581, "grad_norm": 1.0390625, "learning_rate": 0.00042834160770478726, "loss": 5.2464, "mean_token_accuracy": 0.1972460463643074, "num_tokens": 53573823.0, "step": 24005 }, { "entropy": 5.408265018463135, "epoch": 2.696579996630539, "grad_norm": 1.2265625, "learning_rate": 0.00042831222438653016, "loss": 5.0789, "mean_token_accuracy": 0.214223475754261, "num_tokens": 53584724.0, "step": 24010 }, { "entropy": 5.518650007247925, "epoch": 2.697141573538496, "grad_norm": 1.09375, "learning_rate": 0.0004282828361867524, "loss": 5.225, "mean_token_accuracy": 0.19809203147888182, "num_tokens": 53596212.0, "step": 24015 }, { "entropy": 5.502169561386109, "epoch": 2.6977031504464537, "grad_norm": 1.1640625, "learning_rate": 0.00042825344310638966, "loss": 5.196, "mean_token_accuracy": 0.2016608238220215, "num_tokens": 53608341.0, "step": 24020 }, { "entropy": 5.422328186035156, "epoch": 2.6982647273544114, "grad_norm": 1.1640625, "learning_rate": 0.00042822404514637785, "loss": 5.1809, "mean_token_accuracy": 0.20706566274166108, "num_tokens": 53619598.0, "step": 24025 }, { "entropy": 5.4138418674469, "epoch": 2.6988263042623686, "grad_norm": 1.1171875, "learning_rate": 0.000428194642307653, "loss": 5.1209, "mean_token_accuracy": 0.20084422677755356, "num_tokens": 53630174.0, "step": 24030 }, { "entropy": 5.47109203338623, "epoch": 2.6993878811703262, "grad_norm": 1.1640625, "learning_rate": 0.0004281652345911513, "loss": 5.2088, "mean_token_accuracy": 0.19838862270116805, "num_tokens": 53641929.0, "step": 24035 }, { "entropy": 5.412718820571899, "epoch": 2.699949458078284, "grad_norm": 1.0703125, "learning_rate": 0.00042813582199780913, "loss": 5.0809, "mean_token_accuracy": 0.20229452252388, "num_tokens": 53652262.0, "step": 24040 }, { "entropy": 5.531603908538818, "epoch": 2.700511034986241, "grad_norm": 1.046875, "learning_rate": 0.0004281064045285631, "loss": 5.2366, "mean_token_accuracy": 0.2037740558385849, "num_tokens": 53663351.0, "step": 24045 }, { "entropy": 5.323830604553223, "epoch": 2.701072611894199, "grad_norm": 1.0546875, "learning_rate": 0.00042807698218434964, "loss": 5.1197, "mean_token_accuracy": 0.20090827345848083, "num_tokens": 53674632.0, "step": 24050 }, { "entropy": 5.365088939666748, "epoch": 2.7016341888021564, "grad_norm": 1.0078125, "learning_rate": 0.00042804755496610576, "loss": 5.2035, "mean_token_accuracy": 0.20120566040277482, "num_tokens": 53686346.0, "step": 24055 }, { "entropy": 5.538683080673218, "epoch": 2.702195765710114, "grad_norm": 1.078125, "learning_rate": 0.00042801812287476836, "loss": 5.2256, "mean_token_accuracy": 0.19962630569934844, "num_tokens": 53697519.0, "step": 24060 }, { "entropy": 5.462648534774781, "epoch": 2.7027573426180718, "grad_norm": 1.046875, "learning_rate": 0.0004279886859112746, "loss": 5.1441, "mean_token_accuracy": 0.2016030043363571, "num_tokens": 53707858.0, "step": 24065 }, { "entropy": 5.376752090454102, "epoch": 2.703318919526029, "grad_norm": 1.1640625, "learning_rate": 0.00042795924407656175, "loss": 5.1269, "mean_token_accuracy": 0.2048349052667618, "num_tokens": 53719168.0, "step": 24070 }, { "entropy": 5.458829498291015, "epoch": 2.7038804964339866, "grad_norm": 1.015625, "learning_rate": 0.00042792979737156717, "loss": 5.1322, "mean_token_accuracy": 0.20487259775400163, "num_tokens": 53730601.0, "step": 24075 }, { "entropy": 5.42026104927063, "epoch": 2.7044420733419443, "grad_norm": 1.078125, "learning_rate": 0.0004279003457972286, "loss": 5.1294, "mean_token_accuracy": 0.20773958414793015, "num_tokens": 53741410.0, "step": 24080 }, { "entropy": 5.347302055358886, "epoch": 2.7050036502499015, "grad_norm": 1.265625, "learning_rate": 0.0004278708893544837, "loss": 5.1303, "mean_token_accuracy": 0.20953479111194612, "num_tokens": 53752585.0, "step": 24085 }, { "entropy": 5.3899242877960205, "epoch": 2.705565227157859, "grad_norm": 1.078125, "learning_rate": 0.0004278414280442704, "loss": 5.1339, "mean_token_accuracy": 0.20496701449155807, "num_tokens": 53762604.0, "step": 24090 }, { "entropy": 5.398458766937256, "epoch": 2.706126804065817, "grad_norm": 1.109375, "learning_rate": 0.00042781196186752676, "loss": 5.1623, "mean_token_accuracy": 0.19578926563262938, "num_tokens": 53773938.0, "step": 24095 }, { "entropy": 5.542138624191284, "epoch": 2.7066883809737745, "grad_norm": 1.1328125, "learning_rate": 0.0004277824908251909, "loss": 5.2552, "mean_token_accuracy": 0.2030252441763878, "num_tokens": 53785142.0, "step": 24100 }, { "entropy": 5.551196956634522, "epoch": 2.707249957881732, "grad_norm": 0.984375, "learning_rate": 0.0004277530149182014, "loss": 5.2576, "mean_token_accuracy": 0.1965601846575737, "num_tokens": 53797352.0, "step": 24105 }, { "entropy": 5.47598819732666, "epoch": 2.7078115347896894, "grad_norm": 1.0390625, "learning_rate": 0.00042772353414749655, "loss": 5.1862, "mean_token_accuracy": 0.20036886334419252, "num_tokens": 53808027.0, "step": 24110 }, { "entropy": 5.284035110473633, "epoch": 2.708373111697647, "grad_norm": 1.1171875, "learning_rate": 0.00042769404851401524, "loss": 5.0664, "mean_token_accuracy": 0.2085837334394455, "num_tokens": 53818520.0, "step": 24115 }, { "entropy": 5.417389583587647, "epoch": 2.7089346886056047, "grad_norm": 1.0703125, "learning_rate": 0.0004276645580186961, "loss": 5.1264, "mean_token_accuracy": 0.20566834211349488, "num_tokens": 53829234.0, "step": 24120 }, { "entropy": 5.4402289390563965, "epoch": 2.709496265513562, "grad_norm": 1.1171875, "learning_rate": 0.00042763506266247834, "loss": 5.0737, "mean_token_accuracy": 0.20758898854255675, "num_tokens": 53839097.0, "step": 24125 }, { "entropy": 5.3463664054870605, "epoch": 2.7100578424215196, "grad_norm": 1.1171875, "learning_rate": 0.0004276055624463009, "loss": 5.133, "mean_token_accuracy": 0.2015272855758667, "num_tokens": 53850375.0, "step": 24130 }, { "entropy": 5.338164186477661, "epoch": 2.7106194193294773, "grad_norm": 1.09375, "learning_rate": 0.00042757605737110324, "loss": 5.1088, "mean_token_accuracy": 0.21365642845630645, "num_tokens": 53861711.0, "step": 24135 }, { "entropy": 5.428396940231323, "epoch": 2.7111809962374345, "grad_norm": 1.0625, "learning_rate": 0.0004275465474378246, "loss": 5.1527, "mean_token_accuracy": 0.20046297758817672, "num_tokens": 53872081.0, "step": 24140 }, { "entropy": 5.400820350646972, "epoch": 2.711742573145392, "grad_norm": 1.0703125, "learning_rate": 0.0004275170326474049, "loss": 5.1368, "mean_token_accuracy": 0.2025968015193939, "num_tokens": 53882591.0, "step": 24145 }, { "entropy": 5.466067361831665, "epoch": 2.71230415005335, "grad_norm": 1.046875, "learning_rate": 0.00042748751300078367, "loss": 5.1226, "mean_token_accuracy": 0.21349797546863555, "num_tokens": 53893246.0, "step": 24150 }, { "entropy": 5.357647228240967, "epoch": 2.7128657269613075, "grad_norm": 1.09375, "learning_rate": 0.0004274579884989008, "loss": 5.0641, "mean_token_accuracy": 0.2175005629658699, "num_tokens": 53904579.0, "step": 24155 }, { "entropy": 5.311406230926513, "epoch": 2.713427303869265, "grad_norm": 1.046875, "learning_rate": 0.00042742845914269645, "loss": 5.0808, "mean_token_accuracy": 0.20274033397436142, "num_tokens": 53916342.0, "step": 24160 }, { "entropy": 5.436368322372436, "epoch": 2.7139888807772223, "grad_norm": 1.109375, "learning_rate": 0.00042739892493311095, "loss": 5.1318, "mean_token_accuracy": 0.20680449157953262, "num_tokens": 53927414.0, "step": 24165 }, { "entropy": 5.429965305328369, "epoch": 2.71455045768518, "grad_norm": 1.0703125, "learning_rate": 0.00042736938587108447, "loss": 5.1647, "mean_token_accuracy": 0.2029428333044052, "num_tokens": 53938679.0, "step": 24170 }, { "entropy": 5.447264575958252, "epoch": 2.7151120345931377, "grad_norm": 1.03125, "learning_rate": 0.0004273398419575577, "loss": 5.2298, "mean_token_accuracy": 0.19512159377336502, "num_tokens": 53951364.0, "step": 24175 }, { "entropy": 5.542708539962769, "epoch": 2.715673611501095, "grad_norm": 1.0234375, "learning_rate": 0.0004273102931934713, "loss": 5.2864, "mean_token_accuracy": 0.19286893159151078, "num_tokens": 53963590.0, "step": 24180 }, { "entropy": 5.554969263076782, "epoch": 2.7162351884090525, "grad_norm": 1.0625, "learning_rate": 0.000427280739579766, "loss": 5.2353, "mean_token_accuracy": 0.20057183802127837, "num_tokens": 53974315.0, "step": 24185 }, { "entropy": 5.442768144607544, "epoch": 2.71679676531701, "grad_norm": 1.3671875, "learning_rate": 0.00042725118111738305, "loss": 5.2325, "mean_token_accuracy": 0.19446465373039246, "num_tokens": 53985058.0, "step": 24190 }, { "entropy": 5.405373668670654, "epoch": 2.717358342224968, "grad_norm": 0.98828125, "learning_rate": 0.0004272216178072633, "loss": 5.1143, "mean_token_accuracy": 0.2096636101603508, "num_tokens": 53994876.0, "step": 24195 }, { "entropy": 5.447998809814453, "epoch": 2.7179199191329255, "grad_norm": 1.0390625, "learning_rate": 0.0004271920496503483, "loss": 5.2055, "mean_token_accuracy": 0.19569581300020217, "num_tokens": 54005705.0, "step": 24200 }, { "entropy": 5.489930057525635, "epoch": 2.7184814960408827, "grad_norm": 1.109375, "learning_rate": 0.00042716247664757934, "loss": 5.1404, "mean_token_accuracy": 0.2035662278532982, "num_tokens": 54015787.0, "step": 24205 }, { "entropy": 5.493834733963013, "epoch": 2.7190430729488404, "grad_norm": 1.0625, "learning_rate": 0.00042713289879989816, "loss": 5.198, "mean_token_accuracy": 0.19779807776212693, "num_tokens": 54027545.0, "step": 24210 }, { "entropy": 5.485737562179565, "epoch": 2.719604649856798, "grad_norm": 1.125, "learning_rate": 0.0004271033161082464, "loss": 5.2127, "mean_token_accuracy": 0.20279552191495895, "num_tokens": 54038560.0, "step": 24215 }, { "entropy": 5.522479152679443, "epoch": 2.7201662267647553, "grad_norm": 1.0859375, "learning_rate": 0.00042707372857356615, "loss": 5.2497, "mean_token_accuracy": 0.19392069578170776, "num_tokens": 54049286.0, "step": 24220 }, { "entropy": 5.415632724761963, "epoch": 2.720727803672713, "grad_norm": 1.0703125, "learning_rate": 0.0004270441361967994, "loss": 5.0861, "mean_token_accuracy": 0.20544077455997467, "num_tokens": 54059894.0, "step": 24225 }, { "entropy": 5.477279424667358, "epoch": 2.7212893805806706, "grad_norm": 1.1171875, "learning_rate": 0.0004270145389788883, "loss": 5.2319, "mean_token_accuracy": 0.2013646736741066, "num_tokens": 54070084.0, "step": 24230 }, { "entropy": 5.3923492431640625, "epoch": 2.721850957488628, "grad_norm": 1.25, "learning_rate": 0.00042698493692077533, "loss": 5.1583, "mean_token_accuracy": 0.20531713366508483, "num_tokens": 54081607.0, "step": 24235 }, { "entropy": 5.47043924331665, "epoch": 2.7224125343965855, "grad_norm": 1.171875, "learning_rate": 0.0004269553300234031, "loss": 5.22, "mean_token_accuracy": 0.20225788801908492, "num_tokens": 54093364.0, "step": 24240 }, { "entropy": 5.4724555015563965, "epoch": 2.722974111304543, "grad_norm": 1.0234375, "learning_rate": 0.00042692571828771423, "loss": 5.0977, "mean_token_accuracy": 0.20471826791763306, "num_tokens": 54105199.0, "step": 24245 }, { "entropy": 5.394800424575806, "epoch": 2.723535688212501, "grad_norm": 1.0625, "learning_rate": 0.00042689610171465147, "loss": 5.0583, "mean_token_accuracy": 0.2145303651690483, "num_tokens": 54116013.0, "step": 24250 }, { "entropy": 5.4568017482757565, "epoch": 2.7240972651204585, "grad_norm": 1.0390625, "learning_rate": 0.000426866480305158, "loss": 5.2213, "mean_token_accuracy": 0.20276910215616226, "num_tokens": 54128457.0, "step": 24255 }, { "entropy": 5.385050821304321, "epoch": 2.7246588420284157, "grad_norm": 1.046875, "learning_rate": 0.0004268368540601769, "loss": 5.1453, "mean_token_accuracy": 0.20343485623598098, "num_tokens": 54139865.0, "step": 24260 }, { "entropy": 5.53568058013916, "epoch": 2.7252204189363733, "grad_norm": 1.359375, "learning_rate": 0.0004268072229806514, "loss": 5.3528, "mean_token_accuracy": 0.19820138067007065, "num_tokens": 54152264.0, "step": 24265 }, { "entropy": 5.527226305007934, "epoch": 2.725781995844331, "grad_norm": 1.09375, "learning_rate": 0.0004267775870675251, "loss": 5.1967, "mean_token_accuracy": 0.20990683883428574, "num_tokens": 54164339.0, "step": 24270 }, { "entropy": 5.315124130249023, "epoch": 2.7263435727522882, "grad_norm": 1.109375, "learning_rate": 0.0004267479463217415, "loss": 4.9932, "mean_token_accuracy": 0.21235856413841248, "num_tokens": 54174041.0, "step": 24275 }, { "entropy": 5.432281589508056, "epoch": 2.726905149660246, "grad_norm": 1.0078125, "learning_rate": 0.00042671830074424453, "loss": 5.1573, "mean_token_accuracy": 0.20573486536741256, "num_tokens": 54186457.0, "step": 24280 }, { "entropy": 5.431314182281494, "epoch": 2.7274667265682035, "grad_norm": 1.109375, "learning_rate": 0.000426688650335978, "loss": 5.1767, "mean_token_accuracy": 0.20273495614528655, "num_tokens": 54197217.0, "step": 24285 }, { "entropy": 5.458189344406128, "epoch": 2.728028303476161, "grad_norm": 0.99609375, "learning_rate": 0.00042665899509788593, "loss": 5.2006, "mean_token_accuracy": 0.19937868416309357, "num_tokens": 54209773.0, "step": 24290 }, { "entropy": 5.406728315353393, "epoch": 2.728589880384119, "grad_norm": 1.0546875, "learning_rate": 0.0004266293350309128, "loss": 5.1047, "mean_token_accuracy": 0.20669412463903428, "num_tokens": 54219772.0, "step": 24295 }, { "entropy": 5.371670961380005, "epoch": 2.729151457292076, "grad_norm": 1.03125, "learning_rate": 0.0004265996701360026, "loss": 5.1423, "mean_token_accuracy": 0.20119674801826476, "num_tokens": 54231222.0, "step": 24300 }, { "entropy": 5.515133714675903, "epoch": 2.7297130342000337, "grad_norm": 1.0625, "learning_rate": 0.00042657000041410026, "loss": 5.1561, "mean_token_accuracy": 0.20618900507688523, "num_tokens": 54242113.0, "step": 24305 }, { "entropy": 5.466952514648438, "epoch": 2.7302746111079914, "grad_norm": 1.0703125, "learning_rate": 0.0004265403258661503, "loss": 5.2014, "mean_token_accuracy": 0.2055875301361084, "num_tokens": 54252073.0, "step": 24310 }, { "entropy": 5.438057947158813, "epoch": 2.7308361880159486, "grad_norm": 1.03125, "learning_rate": 0.0004265106464930976, "loss": 5.2322, "mean_token_accuracy": 0.20073012113571168, "num_tokens": 54262920.0, "step": 24315 }, { "entropy": 5.430406808853149, "epoch": 2.7313977649239063, "grad_norm": 1.015625, "learning_rate": 0.00042648096229588715, "loss": 5.2074, "mean_token_accuracy": 0.20107340812683105, "num_tokens": 54274525.0, "step": 24320 }, { "entropy": 5.485376787185669, "epoch": 2.731959341831864, "grad_norm": 1.1015625, "learning_rate": 0.00042645127327546405, "loss": 5.0958, "mean_token_accuracy": 0.20889943838119507, "num_tokens": 54284312.0, "step": 24325 }, { "entropy": 5.398770761489868, "epoch": 2.732520918739821, "grad_norm": 1.046875, "learning_rate": 0.00042642157943277375, "loss": 5.1264, "mean_token_accuracy": 0.20519059002399445, "num_tokens": 54295735.0, "step": 24330 }, { "entropy": 5.35915174484253, "epoch": 2.733082495647779, "grad_norm": 1.0625, "learning_rate": 0.0004263918807687616, "loss": 5.0815, "mean_token_accuracy": 0.20631640553474426, "num_tokens": 54306435.0, "step": 24335 }, { "entropy": 5.379607629776001, "epoch": 2.7336440725557365, "grad_norm": 1.078125, "learning_rate": 0.0004263621772843733, "loss": 5.0613, "mean_token_accuracy": 0.211759290099144, "num_tokens": 54316454.0, "step": 24340 }, { "entropy": 5.453609561920166, "epoch": 2.734205649463694, "grad_norm": 1.2265625, "learning_rate": 0.0004263324689805545, "loss": 5.2128, "mean_token_accuracy": 0.20510256588459014, "num_tokens": 54327270.0, "step": 24345 }, { "entropy": 5.476011133193969, "epoch": 2.734767226371652, "grad_norm": 1.140625, "learning_rate": 0.0004263027558582512, "loss": 5.1809, "mean_token_accuracy": 0.2007264494895935, "num_tokens": 54338788.0, "step": 24350 }, { "entropy": 5.560351276397705, "epoch": 2.735328803279609, "grad_norm": 1.0625, "learning_rate": 0.0004262730379184095, "loss": 5.2729, "mean_token_accuracy": 0.196891950070858, "num_tokens": 54350568.0, "step": 24355 }, { "entropy": 5.3842747688293455, "epoch": 2.7358903801875667, "grad_norm": 1.1328125, "learning_rate": 0.00042624331516197554, "loss": 5.1169, "mean_token_accuracy": 0.20631497949361802, "num_tokens": 54361318.0, "step": 24360 }, { "entropy": 5.3753941535949705, "epoch": 2.7364519570955244, "grad_norm": 1.1171875, "learning_rate": 0.00042621358758989584, "loss": 5.0842, "mean_token_accuracy": 0.20430964827537537, "num_tokens": 54371548.0, "step": 24365 }, { "entropy": 5.460762023925781, "epoch": 2.7370135340034816, "grad_norm": 1.1171875, "learning_rate": 0.0004261838552031169, "loss": 5.3079, "mean_token_accuracy": 0.19245846420526505, "num_tokens": 54384485.0, "step": 24370 }, { "entropy": 5.541934776306152, "epoch": 2.7375751109114392, "grad_norm": 1.0625, "learning_rate": 0.00042615411800258523, "loss": 5.2357, "mean_token_accuracy": 0.1944488063454628, "num_tokens": 54396155.0, "step": 24375 }, { "entropy": 5.3857834815979, "epoch": 2.738136687819397, "grad_norm": 1.046875, "learning_rate": 0.00042612437598924793, "loss": 5.1721, "mean_token_accuracy": 0.20549881607294082, "num_tokens": 54406222.0, "step": 24380 }, { "entropy": 5.564047622680664, "epoch": 2.7386982647273546, "grad_norm": 1.1484375, "learning_rate": 0.0004260946291640519, "loss": 5.3023, "mean_token_accuracy": 0.19118553400039673, "num_tokens": 54419271.0, "step": 24385 }, { "entropy": 5.452545261383056, "epoch": 2.739259841635312, "grad_norm": 1.0234375, "learning_rate": 0.00042606487752794417, "loss": 5.2499, "mean_token_accuracy": 0.19906802326440812, "num_tokens": 54430517.0, "step": 24390 }, { "entropy": 5.474771785736084, "epoch": 2.7398214185432694, "grad_norm": 1.0546875, "learning_rate": 0.00042603512108187224, "loss": 5.2031, "mean_token_accuracy": 0.19740011990070344, "num_tokens": 54442273.0, "step": 24395 }, { "entropy": 5.38907675743103, "epoch": 2.740382995451227, "grad_norm": 1.1015625, "learning_rate": 0.00042600535982678347, "loss": 5.0506, "mean_token_accuracy": 0.20888710916042327, "num_tokens": 54452727.0, "step": 24400 }, { "entropy": 5.48522424697876, "epoch": 2.7409445723591848, "grad_norm": 1.0625, "learning_rate": 0.00042597559376362544, "loss": 5.2001, "mean_token_accuracy": 0.20540001839399338, "num_tokens": 54463133.0, "step": 24405 }, { "entropy": 5.480113124847412, "epoch": 2.741506149267142, "grad_norm": 1.046875, "learning_rate": 0.0004259458228933459, "loss": 5.2474, "mean_token_accuracy": 0.18812239170074463, "num_tokens": 54475525.0, "step": 24410 }, { "entropy": 5.477261924743653, "epoch": 2.7420677261750996, "grad_norm": 1.0390625, "learning_rate": 0.00042591604721689297, "loss": 5.1739, "mean_token_accuracy": 0.20273682177066804, "num_tokens": 54488012.0, "step": 24415 }, { "entropy": 5.409173631668091, "epoch": 2.7426293030830573, "grad_norm": 0.953125, "learning_rate": 0.0004258862667352145, "loss": 5.0831, "mean_token_accuracy": 0.21084702461957933, "num_tokens": 54499485.0, "step": 24420 }, { "entropy": 5.479358720779419, "epoch": 2.7431908799910145, "grad_norm": 1.1171875, "learning_rate": 0.0004258564814492587, "loss": 5.2455, "mean_token_accuracy": 0.20549583435058594, "num_tokens": 54509883.0, "step": 24425 }, { "entropy": 5.462230205535889, "epoch": 2.743752456898972, "grad_norm": 1.171875, "learning_rate": 0.000425826691359974, "loss": 5.2614, "mean_token_accuracy": 0.19527233242988587, "num_tokens": 54521320.0, "step": 24430 }, { "entropy": 5.530293273925781, "epoch": 2.74431403380693, "grad_norm": 0.9453125, "learning_rate": 0.0004257968964683091, "loss": 5.2261, "mean_token_accuracy": 0.19720340967178346, "num_tokens": 54532537.0, "step": 24435 }, { "entropy": 5.398940896987915, "epoch": 2.7448756107148875, "grad_norm": 1.0390625, "learning_rate": 0.0004257670967752125, "loss": 5.1112, "mean_token_accuracy": 0.19985959827899932, "num_tokens": 54542494.0, "step": 24440 }, { "entropy": 5.4648839950561525, "epoch": 2.745437187622845, "grad_norm": 1.015625, "learning_rate": 0.000425737292281633, "loss": 5.2677, "mean_token_accuracy": 0.19331849366426468, "num_tokens": 54553583.0, "step": 24445 }, { "entropy": 5.479203128814698, "epoch": 2.7459987645308024, "grad_norm": 1.0078125, "learning_rate": 0.0004257074829885196, "loss": 5.1579, "mean_token_accuracy": 0.20669061690568924, "num_tokens": 54565655.0, "step": 24450 }, { "entropy": 5.394396018981934, "epoch": 2.74656034143876, "grad_norm": 1.0, "learning_rate": 0.0004256776688968216, "loss": 5.1509, "mean_token_accuracy": 0.19818404763936998, "num_tokens": 54578615.0, "step": 24455 }, { "entropy": 5.513056707382202, "epoch": 2.7471219183467177, "grad_norm": 1.015625, "learning_rate": 0.00042564785000748814, "loss": 5.2153, "mean_token_accuracy": 0.2025950238108635, "num_tokens": 54590645.0, "step": 24460 }, { "entropy": 5.542813491821289, "epoch": 2.747683495254675, "grad_norm": 1.1484375, "learning_rate": 0.0004256180263214687, "loss": 5.3139, "mean_token_accuracy": 0.1915415719151497, "num_tokens": 54602326.0, "step": 24465 }, { "entropy": 5.5383281230926515, "epoch": 2.7482450721626326, "grad_norm": 1.015625, "learning_rate": 0.00042558819783971295, "loss": 5.3005, "mean_token_accuracy": 0.18920648097991943, "num_tokens": 54614008.0, "step": 24470 }, { "entropy": 5.455666208267212, "epoch": 2.7488066490705902, "grad_norm": 1.0546875, "learning_rate": 0.0004255583645631705, "loss": 5.1417, "mean_token_accuracy": 0.2042185351252556, "num_tokens": 54625482.0, "step": 24475 }, { "entropy": 5.589465379714966, "epoch": 2.749368225978548, "grad_norm": 1.0703125, "learning_rate": 0.0004255285264927913, "loss": 5.2311, "mean_token_accuracy": 0.19621275812387468, "num_tokens": 54636423.0, "step": 24480 }, { "entropy": 5.4568106174469, "epoch": 2.7499298028865056, "grad_norm": 1.0, "learning_rate": 0.00042549868362952556, "loss": 5.2039, "mean_token_accuracy": 0.1975671634078026, "num_tokens": 54648152.0, "step": 24485 }, { "entropy": 5.430043792724609, "epoch": 2.750491379794463, "grad_norm": 1.0703125, "learning_rate": 0.00042546883597432327, "loss": 5.2158, "mean_token_accuracy": 0.20439807176589966, "num_tokens": 54661141.0, "step": 24490 }, { "entropy": 5.511838674545288, "epoch": 2.7510529567024204, "grad_norm": 0.97265625, "learning_rate": 0.00042543898352813485, "loss": 5.1964, "mean_token_accuracy": 0.19709533900022508, "num_tokens": 54671180.0, "step": 24495 }, { "entropy": 5.349125671386719, "epoch": 2.751614533610378, "grad_norm": 1.15625, "learning_rate": 0.000425409126291911, "loss": 5.0621, "mean_token_accuracy": 0.21101489961147307, "num_tokens": 54681451.0, "step": 24500 }, { "entropy": 5.3607542514801025, "epoch": 2.7521761105183353, "grad_norm": 1.125, "learning_rate": 0.0004253792642666021, "loss": 5.0802, "mean_token_accuracy": 0.20588713139295578, "num_tokens": 54691760.0, "step": 24505 }, { "entropy": 5.473189449310302, "epoch": 2.752737687426293, "grad_norm": 1.03125, "learning_rate": 0.00042534939745315914, "loss": 5.1624, "mean_token_accuracy": 0.1964871421456337, "num_tokens": 54703761.0, "step": 24510 }, { "entropy": 5.482636880874634, "epoch": 2.7532992643342507, "grad_norm": 1.046875, "learning_rate": 0.000425319525852533, "loss": 5.22, "mean_token_accuracy": 0.2023416668176651, "num_tokens": 54715495.0, "step": 24515 }, { "entropy": 5.391024398803711, "epoch": 2.753860841242208, "grad_norm": 1.0390625, "learning_rate": 0.0004252896494656749, "loss": 5.102, "mean_token_accuracy": 0.2031466171145439, "num_tokens": 54727061.0, "step": 24520 }, { "entropy": 5.445971393585205, "epoch": 2.7544224181501655, "grad_norm": 1.078125, "learning_rate": 0.0004252597682935362, "loss": 5.0887, "mean_token_accuracy": 0.20333671867847442, "num_tokens": 54738368.0, "step": 24525 }, { "entropy": 5.421975088119507, "epoch": 2.754983995058123, "grad_norm": 1.03125, "learning_rate": 0.000425229882337068, "loss": 5.1961, "mean_token_accuracy": 0.19622305482625962, "num_tokens": 54749372.0, "step": 24530 }, { "entropy": 5.494048547744751, "epoch": 2.755545571966081, "grad_norm": 1.1171875, "learning_rate": 0.00042519999159722216, "loss": 5.2869, "mean_token_accuracy": 0.19349543750286102, "num_tokens": 54761309.0, "step": 24535 }, { "entropy": 5.461278772354126, "epoch": 2.7561071488740385, "grad_norm": 0.97265625, "learning_rate": 0.00042517009607495035, "loss": 5.2037, "mean_token_accuracy": 0.19828810840845107, "num_tokens": 54773072.0, "step": 24540 }, { "entropy": 5.431031656265259, "epoch": 2.7566687257819957, "grad_norm": 1.1171875, "learning_rate": 0.00042514019577120444, "loss": 5.1438, "mean_token_accuracy": 0.2016252487897873, "num_tokens": 54783603.0, "step": 24545 }, { "entropy": 5.4024372577667235, "epoch": 2.7572303026899534, "grad_norm": 1.015625, "learning_rate": 0.0004251102906869364, "loss": 5.1767, "mean_token_accuracy": 0.2045640081167221, "num_tokens": 54794706.0, "step": 24550 }, { "entropy": 5.5191004276275635, "epoch": 2.757791879597911, "grad_norm": 1.1171875, "learning_rate": 0.0004250803808230986, "loss": 5.2611, "mean_token_accuracy": 0.20214680433273316, "num_tokens": 54804023.0, "step": 24555 }, { "entropy": 5.40861029624939, "epoch": 2.7583534565058683, "grad_norm": 1.078125, "learning_rate": 0.00042505046618064314, "loss": 5.1336, "mean_token_accuracy": 0.20835502743721007, "num_tokens": 54813616.0, "step": 24560 }, { "entropy": 5.432675838470459, "epoch": 2.758915033413826, "grad_norm": 1.09375, "learning_rate": 0.00042502054676052273, "loss": 5.1367, "mean_token_accuracy": 0.20537097603082657, "num_tokens": 54825876.0, "step": 24565 }, { "entropy": 5.537777423858643, "epoch": 2.7594766103217836, "grad_norm": 0.96875, "learning_rate": 0.00042499062256368987, "loss": 5.2578, "mean_token_accuracy": 0.1987195372581482, "num_tokens": 54837207.0, "step": 24570 }, { "entropy": 5.469197559356689, "epoch": 2.7600381872297413, "grad_norm": 1.0703125, "learning_rate": 0.0004249606935910975, "loss": 5.1601, "mean_token_accuracy": 0.20586324781179427, "num_tokens": 54849155.0, "step": 24575 }, { "entropy": 5.402039575576782, "epoch": 2.760599764137699, "grad_norm": 0.97265625, "learning_rate": 0.0004249307598436984, "loss": 5.1396, "mean_token_accuracy": 0.20521221607923507, "num_tokens": 54860345.0, "step": 24580 }, { "entropy": 5.354141473770142, "epoch": 2.761161341045656, "grad_norm": 1.0703125, "learning_rate": 0.0004249008213224458, "loss": 5.14, "mean_token_accuracy": 0.20254168808460235, "num_tokens": 54871676.0, "step": 24585 }, { "entropy": 5.460025930404663, "epoch": 2.761722917953614, "grad_norm": 1.1171875, "learning_rate": 0.00042487087802829275, "loss": 5.1635, "mean_token_accuracy": 0.2018424779176712, "num_tokens": 54882352.0, "step": 24590 }, { "entropy": 5.544378995895386, "epoch": 2.7622844948615715, "grad_norm": 1.125, "learning_rate": 0.0004248409299621931, "loss": 5.1874, "mean_token_accuracy": 0.2013700008392334, "num_tokens": 54893862.0, "step": 24595 }, { "entropy": 5.3760504722595215, "epoch": 2.7628460717695287, "grad_norm": 1.0625, "learning_rate": 0.0004248109771251, "loss": 5.1472, "mean_token_accuracy": 0.2054835945367813, "num_tokens": 54904851.0, "step": 24600 }, { "entropy": 5.462527465820313, "epoch": 2.7634076486774863, "grad_norm": 1.0625, "learning_rate": 0.00042478101951796716, "loss": 5.2431, "mean_token_accuracy": 0.20127769112586974, "num_tokens": 54916472.0, "step": 24605 }, { "entropy": 5.467825508117675, "epoch": 2.763969225585444, "grad_norm": 1.0859375, "learning_rate": 0.0004247510571417487, "loss": 5.0711, "mean_token_accuracy": 0.20311488658189775, "num_tokens": 54927383.0, "step": 24610 }, { "entropy": 5.434236478805542, "epoch": 2.764530802493401, "grad_norm": 0.98828125, "learning_rate": 0.0004247210899973985, "loss": 5.1581, "mean_token_accuracy": 0.20460018813610076, "num_tokens": 54938157.0, "step": 24615 }, { "entropy": 5.448858165740967, "epoch": 2.765092379401359, "grad_norm": 1.0390625, "learning_rate": 0.0004246911180858707, "loss": 5.1867, "mean_token_accuracy": 0.2060574248433113, "num_tokens": 54949812.0, "step": 24620 }, { "entropy": 5.5344466209411625, "epoch": 2.7656539563093165, "grad_norm": 0.97265625, "learning_rate": 0.0004246611414081197, "loss": 5.2626, "mean_token_accuracy": 0.19349587261676787, "num_tokens": 54961201.0, "step": 24625 }, { "entropy": 5.4527263164520265, "epoch": 2.766215533217274, "grad_norm": 1.1484375, "learning_rate": 0.00042463115996509984, "loss": 5.1471, "mean_token_accuracy": 0.20951994955539704, "num_tokens": 54971071.0, "step": 24630 }, { "entropy": 5.421306180953979, "epoch": 2.766777110125232, "grad_norm": 1.046875, "learning_rate": 0.0004246011737577658, "loss": 5.2182, "mean_token_accuracy": 0.1998912960290909, "num_tokens": 54981294.0, "step": 24635 }, { "entropy": 5.47854471206665, "epoch": 2.767338687033189, "grad_norm": 1.078125, "learning_rate": 0.0004245711827870724, "loss": 5.2554, "mean_token_accuracy": 0.20032831579446791, "num_tokens": 54994071.0, "step": 24640 }, { "entropy": 5.498867225646973, "epoch": 2.7679002639411467, "grad_norm": 1.125, "learning_rate": 0.00042454118705397454, "loss": 5.2455, "mean_token_accuracy": 0.20654832273721696, "num_tokens": 55005087.0, "step": 24645 }, { "entropy": 5.435654926300049, "epoch": 2.7684618408491044, "grad_norm": 1.1015625, "learning_rate": 0.0004245111865594273, "loss": 5.091, "mean_token_accuracy": 0.20651579052209854, "num_tokens": 55016103.0, "step": 24650 }, { "entropy": 5.445204162597657, "epoch": 2.7690234177570616, "grad_norm": 1.0390625, "learning_rate": 0.00042448118130438583, "loss": 5.2424, "mean_token_accuracy": 0.1959297001361847, "num_tokens": 55028656.0, "step": 24655 }, { "entropy": 5.49377408027649, "epoch": 2.7695849946650193, "grad_norm": 1.09375, "learning_rate": 0.00042445117128980553, "loss": 5.2916, "mean_token_accuracy": 0.19811236411333083, "num_tokens": 55038957.0, "step": 24660 }, { "entropy": 5.47159218788147, "epoch": 2.770146571572977, "grad_norm": 1.0625, "learning_rate": 0.00042442115651664217, "loss": 5.1141, "mean_token_accuracy": 0.20781386643648148, "num_tokens": 55050407.0, "step": 24665 }, { "entropy": 5.427448463439942, "epoch": 2.7707081484809346, "grad_norm": 1.109375, "learning_rate": 0.00042439113698585103, "loss": 5.1858, "mean_token_accuracy": 0.19719309806823732, "num_tokens": 55060119.0, "step": 24670 }, { "entropy": 5.427186822891235, "epoch": 2.7712697253888923, "grad_norm": 1.0390625, "learning_rate": 0.0004243611126983882, "loss": 5.1951, "mean_token_accuracy": 0.20210651755332948, "num_tokens": 55072059.0, "step": 24675 }, { "entropy": 5.387882089614868, "epoch": 2.7718313022968495, "grad_norm": 1.03125, "learning_rate": 0.00042433108365520967, "loss": 5.1569, "mean_token_accuracy": 0.20163421630859374, "num_tokens": 55083640.0, "step": 24680 }, { "entropy": 5.457586240768433, "epoch": 2.772392879204807, "grad_norm": 1.0859375, "learning_rate": 0.00042430104985727155, "loss": 5.1166, "mean_token_accuracy": 0.2119431287050247, "num_tokens": 55093014.0, "step": 24685 }, { "entropy": 5.38799786567688, "epoch": 2.772954456112765, "grad_norm": 1.1640625, "learning_rate": 0.00042427101130553, "loss": 5.1569, "mean_token_accuracy": 0.20743077993392944, "num_tokens": 55102795.0, "step": 24690 }, { "entropy": 5.420719480514526, "epoch": 2.773516033020722, "grad_norm": 1.1484375, "learning_rate": 0.0004242409680009416, "loss": 5.2346, "mean_token_accuracy": 0.19611083716154099, "num_tokens": 55114389.0, "step": 24695 }, { "entropy": 5.556324434280396, "epoch": 2.7740776099286797, "grad_norm": 1.0625, "learning_rate": 0.0004242109199444629, "loss": 5.237, "mean_token_accuracy": 0.2050292655825615, "num_tokens": 55125078.0, "step": 24700 }, { "entropy": 5.4520574569702145, "epoch": 2.7746391868366374, "grad_norm": 1.140625, "learning_rate": 0.0004241808671370506, "loss": 5.1607, "mean_token_accuracy": 0.196464604139328, "num_tokens": 55135151.0, "step": 24705 }, { "entropy": 5.427392053604126, "epoch": 2.7752007637445946, "grad_norm": 1.1171875, "learning_rate": 0.00042415080957966176, "loss": 5.1868, "mean_token_accuracy": 0.20725896805524827, "num_tokens": 55146330.0, "step": 24710 }, { "entropy": 5.440537643432617, "epoch": 2.7757623406525522, "grad_norm": 1.1015625, "learning_rate": 0.0004241207472732531, "loss": 5.1428, "mean_token_accuracy": 0.2053358346223831, "num_tokens": 55156636.0, "step": 24715 }, { "entropy": 5.469632482528686, "epoch": 2.77632391756051, "grad_norm": 1.0625, "learning_rate": 0.0004240906802187821, "loss": 5.2356, "mean_token_accuracy": 0.19819016456604005, "num_tokens": 55168761.0, "step": 24720 }, { "entropy": 5.3847033977508545, "epoch": 2.7768854944684676, "grad_norm": 1.171875, "learning_rate": 0.0004240606084172061, "loss": 5.1208, "mean_token_accuracy": 0.20449323952198029, "num_tokens": 55180747.0, "step": 24725 }, { "entropy": 5.516995143890381, "epoch": 2.777447071376425, "grad_norm": 1.046875, "learning_rate": 0.00042403053186948237, "loss": 5.2532, "mean_token_accuracy": 0.19401783496141434, "num_tokens": 55191645.0, "step": 24730 }, { "entropy": 5.450952529907227, "epoch": 2.7780086482843824, "grad_norm": 0.98828125, "learning_rate": 0.0004240004505765688, "loss": 5.143, "mean_token_accuracy": 0.1957264080643654, "num_tokens": 55203623.0, "step": 24735 }, { "entropy": 5.467602729797363, "epoch": 2.77857022519234, "grad_norm": 1.0390625, "learning_rate": 0.0004239703645394231, "loss": 5.2687, "mean_token_accuracy": 0.1954276129603386, "num_tokens": 55214635.0, "step": 24740 }, { "entropy": 5.367819738388062, "epoch": 2.7791318021002978, "grad_norm": 0.984375, "learning_rate": 0.0004239402737590032, "loss": 5.1233, "mean_token_accuracy": 0.2016369730234146, "num_tokens": 55225524.0, "step": 24745 }, { "entropy": 5.42220139503479, "epoch": 2.779693379008255, "grad_norm": 1.03125, "learning_rate": 0.00042391017823626716, "loss": 5.1317, "mean_token_accuracy": 0.20959751754999162, "num_tokens": 55238360.0, "step": 24750 }, { "entropy": 5.53945689201355, "epoch": 2.7802549559162126, "grad_norm": 1.0546875, "learning_rate": 0.0004238800779721734, "loss": 5.2535, "mean_token_accuracy": 0.19526060670614243, "num_tokens": 55248524.0, "step": 24755 }, { "entropy": 5.515944337844848, "epoch": 2.7808165328241703, "grad_norm": 1.09375, "learning_rate": 0.00042384997296768007, "loss": 5.2762, "mean_token_accuracy": 0.20397339910268783, "num_tokens": 55260283.0, "step": 24760 }, { "entropy": 5.531018781661987, "epoch": 2.781378109732128, "grad_norm": 1.015625, "learning_rate": 0.000423819863223746, "loss": 5.1891, "mean_token_accuracy": 0.1965341955423355, "num_tokens": 55271928.0, "step": 24765 }, { "entropy": 5.462970781326294, "epoch": 2.7819396866400856, "grad_norm": 1.03125, "learning_rate": 0.00042378974874132967, "loss": 5.2081, "mean_token_accuracy": 0.20109081268310547, "num_tokens": 55283015.0, "step": 24770 }, { "entropy": 5.423681545257568, "epoch": 2.782501263548043, "grad_norm": 1.0703125, "learning_rate": 0.0004237596295213901, "loss": 5.0746, "mean_token_accuracy": 0.2074076786637306, "num_tokens": 55293918.0, "step": 24775 }, { "entropy": 5.341319894790649, "epoch": 2.7830628404560005, "grad_norm": 1.0859375, "learning_rate": 0.0004237295055648862, "loss": 5.1051, "mean_token_accuracy": 0.1980103299021721, "num_tokens": 55305808.0, "step": 24780 }, { "entropy": 5.3905096530914305, "epoch": 2.783624417363958, "grad_norm": 1.0546875, "learning_rate": 0.00042369937687277716, "loss": 5.213, "mean_token_accuracy": 0.19633498042821884, "num_tokens": 55318128.0, "step": 24785 }, { "entropy": 5.502759122848511, "epoch": 2.7841859942719154, "grad_norm": 1.0703125, "learning_rate": 0.0004236692434460223, "loss": 5.2413, "mean_token_accuracy": 0.20149529129266738, "num_tokens": 55329934.0, "step": 24790 }, { "entropy": 5.5992615699768065, "epoch": 2.784747571179873, "grad_norm": 1.0625, "learning_rate": 0.0004236391052855811, "loss": 5.3615, "mean_token_accuracy": 0.19547825306653976, "num_tokens": 55340971.0, "step": 24795 }, { "entropy": 5.490921115875244, "epoch": 2.7853091480878307, "grad_norm": 1.109375, "learning_rate": 0.00042360896239241306, "loss": 5.2128, "mean_token_accuracy": 0.19996569454669952, "num_tokens": 55352243.0, "step": 24800 }, { "entropy": 5.519829750061035, "epoch": 2.785870724995788, "grad_norm": 1.046875, "learning_rate": 0.00042357881476747807, "loss": 5.1208, "mean_token_accuracy": 0.20832205414772034, "num_tokens": 55363694.0, "step": 24805 }, { "entropy": 5.451301383972168, "epoch": 2.7864323019037456, "grad_norm": 1.0234375, "learning_rate": 0.000423548662411736, "loss": 5.3156, "mean_token_accuracy": 0.20221443474292755, "num_tokens": 55375720.0, "step": 24810 }, { "entropy": 5.496734142303467, "epoch": 2.7869938788117032, "grad_norm": 1.0234375, "learning_rate": 0.0004235185053261469, "loss": 5.1485, "mean_token_accuracy": 0.2062526300549507, "num_tokens": 55387493.0, "step": 24815 }, { "entropy": 5.519847202301025, "epoch": 2.787555455719661, "grad_norm": 1.0546875, "learning_rate": 0.000423488343511671, "loss": 5.3306, "mean_token_accuracy": 0.19310317188501358, "num_tokens": 55399468.0, "step": 24820 }, { "entropy": 5.447811031341553, "epoch": 2.7881170326276186, "grad_norm": 1.0234375, "learning_rate": 0.0004234581769692686, "loss": 5.1696, "mean_token_accuracy": 0.19211531728506087, "num_tokens": 55411526.0, "step": 24825 }, { "entropy": 5.483819770812988, "epoch": 2.788678609535576, "grad_norm": 1.1484375, "learning_rate": 0.0004234280056999003, "loss": 5.1236, "mean_token_accuracy": 0.20535043776035308, "num_tokens": 55422550.0, "step": 24830 }, { "entropy": 5.4230273246765135, "epoch": 2.7892401864435334, "grad_norm": 1.0546875, "learning_rate": 0.0004233978297045267, "loss": 5.1067, "mean_token_accuracy": 0.20954055935144425, "num_tokens": 55433433.0, "step": 24835 }, { "entropy": 5.3980916976928714, "epoch": 2.789801763351491, "grad_norm": 1.046875, "learning_rate": 0.0004233676489841087, "loss": 5.1269, "mean_token_accuracy": 0.21044438779354097, "num_tokens": 55444225.0, "step": 24840 }, { "entropy": 5.51431565284729, "epoch": 2.7903633402594483, "grad_norm": 1.015625, "learning_rate": 0.00042333746353960723, "loss": 5.2903, "mean_token_accuracy": 0.19892845451831817, "num_tokens": 55456117.0, "step": 24845 }, { "entropy": 5.438743543624878, "epoch": 2.790924917167406, "grad_norm": 1.1171875, "learning_rate": 0.0004233072733719833, "loss": 5.1241, "mean_token_accuracy": 0.20516521036624907, "num_tokens": 55467267.0, "step": 24850 }, { "entropy": 5.476968145370483, "epoch": 2.7914864940753636, "grad_norm": 1.015625, "learning_rate": 0.0004232770784821984, "loss": 5.1901, "mean_token_accuracy": 0.2051390990614891, "num_tokens": 55478520.0, "step": 24855 }, { "entropy": 5.473791837692261, "epoch": 2.7920480709833213, "grad_norm": 1.1875, "learning_rate": 0.00042324687887121366, "loss": 5.2644, "mean_token_accuracy": 0.1945769667625427, "num_tokens": 55489704.0, "step": 24860 }, { "entropy": 5.43437180519104, "epoch": 2.792609647891279, "grad_norm": 1.0546875, "learning_rate": 0.0004232166745399909, "loss": 5.1219, "mean_token_accuracy": 0.20721485018730162, "num_tokens": 55500942.0, "step": 24865 }, { "entropy": 5.503784704208374, "epoch": 2.793171224799236, "grad_norm": 1.1484375, "learning_rate": 0.00042318646548949177, "loss": 5.3195, "mean_token_accuracy": 0.18893152624368667, "num_tokens": 55512691.0, "step": 24870 }, { "entropy": 5.446723985671997, "epoch": 2.793732801707194, "grad_norm": 1.03125, "learning_rate": 0.00042315625172067794, "loss": 5.1081, "mean_token_accuracy": 0.20965508818626405, "num_tokens": 55523827.0, "step": 24875 }, { "entropy": 5.516996383666992, "epoch": 2.7942943786151515, "grad_norm": 1.078125, "learning_rate": 0.00042312603323451173, "loss": 5.2785, "mean_token_accuracy": 0.197563299536705, "num_tokens": 55534674.0, "step": 24880 }, { "entropy": 5.419544696807861, "epoch": 2.7948559555231087, "grad_norm": 1.1171875, "learning_rate": 0.0004230958100319551, "loss": 5.1143, "mean_token_accuracy": 0.20707162618637084, "num_tokens": 55545504.0, "step": 24885 }, { "entropy": 5.448154258728027, "epoch": 2.7954175324310664, "grad_norm": 1.0234375, "learning_rate": 0.0004230655821139705, "loss": 5.2915, "mean_token_accuracy": 0.19090787768363954, "num_tokens": 55557818.0, "step": 24890 }, { "entropy": 5.486776971817017, "epoch": 2.795979109339024, "grad_norm": 1.0390625, "learning_rate": 0.0004230353494815203, "loss": 5.1838, "mean_token_accuracy": 0.20325971841812135, "num_tokens": 55568143.0, "step": 24895 }, { "entropy": 5.546880197525025, "epoch": 2.7965406862469813, "grad_norm": 1.0390625, "learning_rate": 0.0004230051121355672, "loss": 5.2503, "mean_token_accuracy": 0.19601887911558152, "num_tokens": 55579358.0, "step": 24900 }, { "entropy": 5.50674877166748, "epoch": 2.797102263154939, "grad_norm": 1.0078125, "learning_rate": 0.00042297487007707387, "loss": 5.3473, "mean_token_accuracy": 0.19654758274555206, "num_tokens": 55590430.0, "step": 24905 }, { "entropy": 5.483537340164185, "epoch": 2.7976638400628966, "grad_norm": 0.96875, "learning_rate": 0.00042294462330700336, "loss": 5.2428, "mean_token_accuracy": 0.20912528932094573, "num_tokens": 55602377.0, "step": 24910 }, { "entropy": 5.468552923202514, "epoch": 2.7982254169708543, "grad_norm": 1.1953125, "learning_rate": 0.0004229143718263186, "loss": 5.1319, "mean_token_accuracy": 0.20369914919137955, "num_tokens": 55613261.0, "step": 24915 }, { "entropy": 5.327735805511475, "epoch": 2.798786993878812, "grad_norm": 1.0546875, "learning_rate": 0.0004228841156359829, "loss": 5.0938, "mean_token_accuracy": 0.2024439677596092, "num_tokens": 55624514.0, "step": 24920 }, { "entropy": 5.448320102691651, "epoch": 2.799348570786769, "grad_norm": 1.1328125, "learning_rate": 0.0004228538547369596, "loss": 5.1999, "mean_token_accuracy": 0.19834371358156205, "num_tokens": 55635899.0, "step": 24925 }, { "entropy": 5.513878583908081, "epoch": 2.799910147694727, "grad_norm": 1.015625, "learning_rate": 0.00042282358913021224, "loss": 5.1772, "mean_token_accuracy": 0.20321768671274185, "num_tokens": 55646807.0, "step": 24930 }, { "entropy": 5.523096418380737, "epoch": 2.8004717246026845, "grad_norm": 1.0390625, "learning_rate": 0.00042279331881670446, "loss": 5.1998, "mean_token_accuracy": 0.2060458019375801, "num_tokens": 55658937.0, "step": 24935 }, { "entropy": 5.356009674072266, "epoch": 2.8010333015106417, "grad_norm": 1.09375, "learning_rate": 0.0004227630437974, "loss": 5.133, "mean_token_accuracy": 0.20822166949510573, "num_tokens": 55670216.0, "step": 24940 }, { "entropy": 5.531375932693481, "epoch": 2.8015948784185993, "grad_norm": 1.0625, "learning_rate": 0.00042273276407326304, "loss": 5.2198, "mean_token_accuracy": 0.2031826853752136, "num_tokens": 55682743.0, "step": 24945 }, { "entropy": 5.441863584518432, "epoch": 2.802156455326557, "grad_norm": 1.09375, "learning_rate": 0.00042270247964525755, "loss": 5.1648, "mean_token_accuracy": 0.19785788506269456, "num_tokens": 55694338.0, "step": 24950 }, { "entropy": 5.470470380783081, "epoch": 2.8027180322345147, "grad_norm": 1.078125, "learning_rate": 0.0004226721905143477, "loss": 5.1742, "mean_token_accuracy": 0.19994216561317443, "num_tokens": 55704224.0, "step": 24955 }, { "entropy": 5.373088026046753, "epoch": 2.8032796091424723, "grad_norm": 1.046875, "learning_rate": 0.00042264189668149817, "loss": 5.1347, "mean_token_accuracy": 0.19948941916227342, "num_tokens": 55714901.0, "step": 24960 }, { "entropy": 5.505374574661255, "epoch": 2.8038411860504295, "grad_norm": 1.171875, "learning_rate": 0.0004226115981476733, "loss": 5.2881, "mean_token_accuracy": 0.1947023719549179, "num_tokens": 55725020.0, "step": 24965 }, { "entropy": 5.401102304458618, "epoch": 2.804402762958387, "grad_norm": 1.09375, "learning_rate": 0.000422581294913838, "loss": 5.0776, "mean_token_accuracy": 0.2135257124900818, "num_tokens": 55735643.0, "step": 24970 }, { "entropy": 5.4199991703033445, "epoch": 2.804964339866345, "grad_norm": 1.1796875, "learning_rate": 0.000422550986980957, "loss": 5.1087, "mean_token_accuracy": 0.20003241300582886, "num_tokens": 55745778.0, "step": 24975 }, { "entropy": 5.362207269668579, "epoch": 2.805525916774302, "grad_norm": 1.09375, "learning_rate": 0.00042252067434999524, "loss": 5.1466, "mean_token_accuracy": 0.20104152262210845, "num_tokens": 55757055.0, "step": 24980 }, { "entropy": 5.427798843383789, "epoch": 2.8060874936822597, "grad_norm": 1.109375, "learning_rate": 0.0004224903570219181, "loss": 5.2101, "mean_token_accuracy": 0.2012692242860794, "num_tokens": 55768193.0, "step": 24985 }, { "entropy": 5.417451953887939, "epoch": 2.8066490705902174, "grad_norm": 1.078125, "learning_rate": 0.00042246003499769077, "loss": 5.0941, "mean_token_accuracy": 0.20490931570529938, "num_tokens": 55779382.0, "step": 24990 }, { "entropy": 5.422210693359375, "epoch": 2.8072106474981746, "grad_norm": 1.0390625, "learning_rate": 0.00042242970827827874, "loss": 5.0795, "mean_token_accuracy": 0.2109823003411293, "num_tokens": 55790933.0, "step": 24995 }, { "entropy": 5.334620380401612, "epoch": 2.8077722244061323, "grad_norm": 1.0234375, "learning_rate": 0.0004223993768646476, "loss": 5.0594, "mean_token_accuracy": 0.2111021652817726, "num_tokens": 55803101.0, "step": 25000 }, { "entropy": 5.331802034378052, "epoch": 2.80833380131409, "grad_norm": 1.0390625, "learning_rate": 0.0004223690407577631, "loss": 5.0746, "mean_token_accuracy": 0.212496118247509, "num_tokens": 55814651.0, "step": 25005 }, { "entropy": 5.497640895843506, "epoch": 2.8088953782220476, "grad_norm": 1.1484375, "learning_rate": 0.00042233869995859127, "loss": 5.1834, "mean_token_accuracy": 0.20063014328479767, "num_tokens": 55825696.0, "step": 25010 }, { "entropy": 5.432696771621704, "epoch": 2.8094569551300053, "grad_norm": 1.0390625, "learning_rate": 0.00042230835446809803, "loss": 5.1707, "mean_token_accuracy": 0.200192953646183, "num_tokens": 55836679.0, "step": 25015 }, { "entropy": 5.407367849349976, "epoch": 2.8100185320379625, "grad_norm": 1.015625, "learning_rate": 0.0004222780042872496, "loss": 5.1994, "mean_token_accuracy": 0.1965168073773384, "num_tokens": 55848013.0, "step": 25020 }, { "entropy": 5.3583556652069095, "epoch": 2.81058010894592, "grad_norm": 0.98828125, "learning_rate": 0.0004222476494170125, "loss": 5.0313, "mean_token_accuracy": 0.20998100191354752, "num_tokens": 55859310.0, "step": 25025 }, { "entropy": 5.514933061599732, "epoch": 2.811141685853878, "grad_norm": 1.0546875, "learning_rate": 0.0004222172898583531, "loss": 5.2382, "mean_token_accuracy": 0.1895426630973816, "num_tokens": 55870484.0, "step": 25030 }, { "entropy": 5.513293933868408, "epoch": 2.811703262761835, "grad_norm": 1.078125, "learning_rate": 0.0004221869256122381, "loss": 5.2151, "mean_token_accuracy": 0.19783167093992232, "num_tokens": 55881279.0, "step": 25035 }, { "entropy": 5.3786280155181885, "epoch": 2.8122648396697927, "grad_norm": 1.109375, "learning_rate": 0.0004221565566796343, "loss": 5.0788, "mean_token_accuracy": 0.19985860735177993, "num_tokens": 55893029.0, "step": 25040 }, { "entropy": 5.315722179412842, "epoch": 2.8128264165777503, "grad_norm": 1.171875, "learning_rate": 0.0004221261830615086, "loss": 5.0447, "mean_token_accuracy": 0.20996863394975662, "num_tokens": 55904171.0, "step": 25045 }, { "entropy": 5.4315637111663815, "epoch": 2.813387993485708, "grad_norm": 1.09375, "learning_rate": 0.0004220958047588282, "loss": 5.1348, "mean_token_accuracy": 0.20762409120798112, "num_tokens": 55916121.0, "step": 25050 }, { "entropy": 5.4339852809906, "epoch": 2.8139495703936657, "grad_norm": 1.0546875, "learning_rate": 0.0004220654217725603, "loss": 5.1923, "mean_token_accuracy": 0.19616778194904327, "num_tokens": 55925982.0, "step": 25055 }, { "entropy": 5.462462663650513, "epoch": 2.814511147301623, "grad_norm": 1.0390625, "learning_rate": 0.00042203503410367244, "loss": 5.146, "mean_token_accuracy": 0.20573732405900955, "num_tokens": 55935768.0, "step": 25060 }, { "entropy": 5.497834157943726, "epoch": 2.8150727242095805, "grad_norm": 0.9921875, "learning_rate": 0.000422004641753132, "loss": 5.2097, "mean_token_accuracy": 0.20589301735162735, "num_tokens": 55946742.0, "step": 25065 }, { "entropy": 5.418813991546631, "epoch": 2.815634301117538, "grad_norm": 1.0703125, "learning_rate": 0.0004219742447219068, "loss": 5.1077, "mean_token_accuracy": 0.21268148571252823, "num_tokens": 55957133.0, "step": 25070 }, { "entropy": 5.433410930633545, "epoch": 2.8161958780254954, "grad_norm": 1.0390625, "learning_rate": 0.00042194384301096457, "loss": 5.1562, "mean_token_accuracy": 0.20142244249582292, "num_tokens": 55967179.0, "step": 25075 }, { "entropy": 5.360621500015259, "epoch": 2.816757454933453, "grad_norm": 1.109375, "learning_rate": 0.00042191343662127337, "loss": 5.0507, "mean_token_accuracy": 0.2105631411075592, "num_tokens": 55977713.0, "step": 25080 }, { "entropy": 5.489274215698242, "epoch": 2.8173190318414107, "grad_norm": 1.015625, "learning_rate": 0.00042188302555380144, "loss": 5.1948, "mean_token_accuracy": 0.20118847936391832, "num_tokens": 55988650.0, "step": 25085 }, { "entropy": 5.402718782424927, "epoch": 2.817880608749368, "grad_norm": 1.0390625, "learning_rate": 0.000421852609809517, "loss": 5.0596, "mean_token_accuracy": 0.20768651068210603, "num_tokens": 55999745.0, "step": 25090 }, { "entropy": 5.366912603378296, "epoch": 2.8184421856573256, "grad_norm": 1.015625, "learning_rate": 0.0004218221893893884, "loss": 5.099, "mean_token_accuracy": 0.2072529226541519, "num_tokens": 56011171.0, "step": 25095 }, { "entropy": 5.384856176376343, "epoch": 2.8190037625652833, "grad_norm": 1.0078125, "learning_rate": 0.00042179176429438454, "loss": 5.132, "mean_token_accuracy": 0.21273254007101058, "num_tokens": 56022121.0, "step": 25100 }, { "entropy": 5.404669284820557, "epoch": 2.819565339473241, "grad_norm": 1.125, "learning_rate": 0.0004217613345254739, "loss": 5.1446, "mean_token_accuracy": 0.21067192554473876, "num_tokens": 56033769.0, "step": 25105 }, { "entropy": 5.45750880241394, "epoch": 2.8201269163811986, "grad_norm": 1.0546875, "learning_rate": 0.00042173090008362535, "loss": 5.0999, "mean_token_accuracy": 0.20771268904209136, "num_tokens": 56044691.0, "step": 25110 }, { "entropy": 5.367463684082031, "epoch": 2.820688493289156, "grad_norm": 1.0390625, "learning_rate": 0.00042170046096980807, "loss": 5.0686, "mean_token_accuracy": 0.20814388394355773, "num_tokens": 56055639.0, "step": 25115 }, { "entropy": 5.4927280902862545, "epoch": 2.8212500701971135, "grad_norm": 1.0078125, "learning_rate": 0.00042167001718499124, "loss": 5.2024, "mean_token_accuracy": 0.2019195944070816, "num_tokens": 56066579.0, "step": 25120 }, { "entropy": 5.459292221069336, "epoch": 2.821811647105071, "grad_norm": 1.046875, "learning_rate": 0.0004216395687301442, "loss": 5.1769, "mean_token_accuracy": 0.19727346301078796, "num_tokens": 56076871.0, "step": 25125 }, { "entropy": 5.488662195205689, "epoch": 2.8223732240130284, "grad_norm": 1.015625, "learning_rate": 0.0004216091156062364, "loss": 5.2656, "mean_token_accuracy": 0.196015864610672, "num_tokens": 56090022.0, "step": 25130 }, { "entropy": 5.302827835083008, "epoch": 2.822934800920986, "grad_norm": 1.0390625, "learning_rate": 0.0004215786578142375, "loss": 4.9554, "mean_token_accuracy": 0.21522179394960403, "num_tokens": 56100545.0, "step": 25135 }, { "entropy": 5.415987920761109, "epoch": 2.8234963778289437, "grad_norm": 1.03125, "learning_rate": 0.00042154819535511733, "loss": 5.2572, "mean_token_accuracy": 0.19520153850317, "num_tokens": 56112059.0, "step": 25140 }, { "entropy": 5.5209368705749515, "epoch": 2.8240579547369014, "grad_norm": 1.09375, "learning_rate": 0.00042151772822984567, "loss": 5.2019, "mean_token_accuracy": 0.20613405853509903, "num_tokens": 56123162.0, "step": 25145 }, { "entropy": 5.592617082595825, "epoch": 2.824619531644859, "grad_norm": 0.94921875, "learning_rate": 0.0004214872564393928, "loss": 5.2881, "mean_token_accuracy": 0.2005797505378723, "num_tokens": 56136008.0, "step": 25150 }, { "entropy": 5.370129632949829, "epoch": 2.8251811085528162, "grad_norm": 1.0546875, "learning_rate": 0.0004214567799847289, "loss": 5.1449, "mean_token_accuracy": 0.20419301241636276, "num_tokens": 56147169.0, "step": 25155 }, { "entropy": 5.4306810855865475, "epoch": 2.825742685460774, "grad_norm": 1.15625, "learning_rate": 0.0004214262988668242, "loss": 5.1043, "mean_token_accuracy": 0.19814843237400054, "num_tokens": 56157644.0, "step": 25160 }, { "entropy": 5.543752861022949, "epoch": 2.8263042623687316, "grad_norm": 1.1796875, "learning_rate": 0.0004213958130866494, "loss": 5.2053, "mean_token_accuracy": 0.19652559608221054, "num_tokens": 56168248.0, "step": 25165 }, { "entropy": 5.474974918365478, "epoch": 2.8268658392766888, "grad_norm": 0.97265625, "learning_rate": 0.00042136532264517527, "loss": 5.2433, "mean_token_accuracy": 0.19865178614854812, "num_tokens": 56179140.0, "step": 25170 }, { "entropy": 5.4746476173400875, "epoch": 2.8274274161846464, "grad_norm": 1.046875, "learning_rate": 0.00042133482754337236, "loss": 5.1393, "mean_token_accuracy": 0.20108282566070557, "num_tokens": 56190184.0, "step": 25175 }, { "entropy": 5.524678134918213, "epoch": 2.827988993092604, "grad_norm": 1.1640625, "learning_rate": 0.00042130432778221186, "loss": 5.2202, "mean_token_accuracy": 0.2107068419456482, "num_tokens": 56201619.0, "step": 25180 }, { "entropy": 5.422843074798584, "epoch": 2.8285505700005613, "grad_norm": 1.046875, "learning_rate": 0.00042127382336266467, "loss": 5.1184, "mean_token_accuracy": 0.2005790427327156, "num_tokens": 56212339.0, "step": 25185 }, { "entropy": 5.48595814704895, "epoch": 2.829112146908519, "grad_norm": 1.03125, "learning_rate": 0.0004212433142857024, "loss": 5.1631, "mean_token_accuracy": 0.20588430762290955, "num_tokens": 56224734.0, "step": 25190 }, { "entropy": 5.470426607131958, "epoch": 2.8296737238164766, "grad_norm": 1.1484375, "learning_rate": 0.00042121280055229624, "loss": 5.1272, "mean_token_accuracy": 0.19953801333904267, "num_tokens": 56235594.0, "step": 25195 }, { "entropy": 5.384652137756348, "epoch": 2.8302353007244343, "grad_norm": 1.1171875, "learning_rate": 0.0004211822821634177, "loss": 5.0996, "mean_token_accuracy": 0.2068149372935295, "num_tokens": 56246932.0, "step": 25200 }, { "entropy": 5.361141967773437, "epoch": 2.830796877632392, "grad_norm": 1.1875, "learning_rate": 0.0004211517591200387, "loss": 5.2142, "mean_token_accuracy": 0.2064760610461235, "num_tokens": 56258217.0, "step": 25205 }, { "entropy": 5.519026756286621, "epoch": 2.831358454540349, "grad_norm": 1.078125, "learning_rate": 0.0004211212314231309, "loss": 5.1991, "mean_token_accuracy": 0.2025975003838539, "num_tokens": 56269226.0, "step": 25210 }, { "entropy": 5.473792028427124, "epoch": 2.831920031448307, "grad_norm": 1.0703125, "learning_rate": 0.00042109069907366646, "loss": 5.1494, "mean_token_accuracy": 0.20363848358392717, "num_tokens": 56280411.0, "step": 25215 }, { "entropy": 5.436033010482788, "epoch": 2.8324816083562645, "grad_norm": 1.1015625, "learning_rate": 0.00042106016207261754, "loss": 5.2681, "mean_token_accuracy": 0.19762004166841507, "num_tokens": 56292048.0, "step": 25220 }, { "entropy": 5.469280862808228, "epoch": 2.8330431852642217, "grad_norm": 1.046875, "learning_rate": 0.00042102962042095643, "loss": 5.153, "mean_token_accuracy": 0.20751273185014724, "num_tokens": 56302470.0, "step": 25225 }, { "entropy": 5.442574882507325, "epoch": 2.8336047621721794, "grad_norm": 1.109375, "learning_rate": 0.00042099907411965553, "loss": 5.1083, "mean_token_accuracy": 0.20420445054769515, "num_tokens": 56313871.0, "step": 25230 }, { "entropy": 5.322543144226074, "epoch": 2.834166339080137, "grad_norm": 1.09375, "learning_rate": 0.00042096852316968756, "loss": 5.1009, "mean_token_accuracy": 0.20744802802801132, "num_tokens": 56325455.0, "step": 25235 }, { "entropy": 5.499881172180176, "epoch": 2.8347279159880947, "grad_norm": 1.234375, "learning_rate": 0.00042093796757202513, "loss": 5.2495, "mean_token_accuracy": 0.20123881995677947, "num_tokens": 56336187.0, "step": 25240 }, { "entropy": 5.589601612091064, "epoch": 2.8352894928960524, "grad_norm": 1.0859375, "learning_rate": 0.0004209074073276412, "loss": 5.2604, "mean_token_accuracy": 0.19995932877063752, "num_tokens": 56348175.0, "step": 25245 }, { "entropy": 5.465473556518555, "epoch": 2.8358510698040096, "grad_norm": 0.953125, "learning_rate": 0.0004208768424375089, "loss": 5.1653, "mean_token_accuracy": 0.19941622763872147, "num_tokens": 56359668.0, "step": 25250 }, { "entropy": 5.425819015502929, "epoch": 2.8364126467119672, "grad_norm": 1.046875, "learning_rate": 0.00042084627290260124, "loss": 5.148, "mean_token_accuracy": 0.20999141037464142, "num_tokens": 56371160.0, "step": 25255 }, { "entropy": 5.393160200119018, "epoch": 2.836974223619925, "grad_norm": 1.015625, "learning_rate": 0.0004208156987238918, "loss": 5.0358, "mean_token_accuracy": 0.20854933708906173, "num_tokens": 56382873.0, "step": 25260 }, { "entropy": 5.435856771469116, "epoch": 2.837535800527882, "grad_norm": 1.046875, "learning_rate": 0.0004207851199023539, "loss": 5.1322, "mean_token_accuracy": 0.20391468554735184, "num_tokens": 56393562.0, "step": 25265 }, { "entropy": 5.489428091049194, "epoch": 2.83809737743584, "grad_norm": 1.0546875, "learning_rate": 0.00042075453643896125, "loss": 5.2649, "mean_token_accuracy": 0.19971169531345367, "num_tokens": 56405789.0, "step": 25270 }, { "entropy": 5.445730113983155, "epoch": 2.8386589543437974, "grad_norm": 1.0390625, "learning_rate": 0.00042072394833468765, "loss": 5.1121, "mean_token_accuracy": 0.20937375277280806, "num_tokens": 56417621.0, "step": 25275 }, { "entropy": 5.495589256286621, "epoch": 2.8392205312517547, "grad_norm": 1.0234375, "learning_rate": 0.000420693355590507, "loss": 5.216, "mean_token_accuracy": 0.19677433967590333, "num_tokens": 56430167.0, "step": 25280 }, { "entropy": 5.486621999740601, "epoch": 2.8397821081597123, "grad_norm": 1.0703125, "learning_rate": 0.00042066275820739333, "loss": 5.2214, "mean_token_accuracy": 0.19346835017204284, "num_tokens": 56441853.0, "step": 25285 }, { "entropy": 5.370355319976807, "epoch": 2.84034368506767, "grad_norm": 1.0546875, "learning_rate": 0.000420632156186321, "loss": 5.0917, "mean_token_accuracy": 0.20639448314905168, "num_tokens": 56454504.0, "step": 25290 }, { "entropy": 5.427287530899048, "epoch": 2.8409052619756276, "grad_norm": 1.171875, "learning_rate": 0.0004206015495282644, "loss": 5.17, "mean_token_accuracy": 0.20759275704622268, "num_tokens": 56465503.0, "step": 25295 }, { "entropy": 5.455255460739136, "epoch": 2.8414668388835853, "grad_norm": 1.046875, "learning_rate": 0.00042057093823419795, "loss": 5.2122, "mean_token_accuracy": 0.20222514122724533, "num_tokens": 56475310.0, "step": 25300 }, { "entropy": 5.464810132980347, "epoch": 2.8420284157915425, "grad_norm": 1.015625, "learning_rate": 0.00042054032230509636, "loss": 5.1241, "mean_token_accuracy": 0.20564891397953033, "num_tokens": 56486575.0, "step": 25305 }, { "entropy": 5.493469905853272, "epoch": 2.8425899926995, "grad_norm": 1.0859375, "learning_rate": 0.00042050970174193437, "loss": 5.2386, "mean_token_accuracy": 0.2009178340435028, "num_tokens": 56496542.0, "step": 25310 }, { "entropy": 5.530316495895386, "epoch": 2.843151569607458, "grad_norm": 1.0234375, "learning_rate": 0.00042047907654568724, "loss": 5.1863, "mean_token_accuracy": 0.20280291885137558, "num_tokens": 56507124.0, "step": 25315 }, { "entropy": 5.43949294090271, "epoch": 2.843713146515415, "grad_norm": 1.1015625, "learning_rate": 0.0004204484467173297, "loss": 5.0997, "mean_token_accuracy": 0.20389626026153565, "num_tokens": 56518635.0, "step": 25320 }, { "entropy": 5.374734210968017, "epoch": 2.8442747234233727, "grad_norm": 1.125, "learning_rate": 0.0004204178122578373, "loss": 5.1213, "mean_token_accuracy": 0.21008632928133011, "num_tokens": 56529499.0, "step": 25325 }, { "entropy": 5.472604751586914, "epoch": 2.8448363003313304, "grad_norm": 0.9921875, "learning_rate": 0.00042038717316818534, "loss": 5.1972, "mean_token_accuracy": 0.20285685062408448, "num_tokens": 56542432.0, "step": 25330 }, { "entropy": 5.445117568969726, "epoch": 2.845397877239288, "grad_norm": 1.0078125, "learning_rate": 0.0004203565294493494, "loss": 5.1778, "mean_token_accuracy": 0.20217007100582124, "num_tokens": 56552783.0, "step": 25335 }, { "entropy": 5.421955728530884, "epoch": 2.8459594541472457, "grad_norm": 1.09375, "learning_rate": 0.00042032588110230525, "loss": 5.1306, "mean_token_accuracy": 0.20524280071258544, "num_tokens": 56563654.0, "step": 25340 }, { "entropy": 5.480859231948853, "epoch": 2.846521031055203, "grad_norm": 1.0078125, "learning_rate": 0.0004202952281280286, "loss": 5.1876, "mean_token_accuracy": 0.2014092981815338, "num_tokens": 56575541.0, "step": 25345 }, { "entropy": 5.548755025863647, "epoch": 2.8470826079631606, "grad_norm": 0.98828125, "learning_rate": 0.0004202645705274956, "loss": 5.2943, "mean_token_accuracy": 0.19491764158010483, "num_tokens": 56588397.0, "step": 25350 }, { "entropy": 5.4689349174499515, "epoch": 2.8476441848711183, "grad_norm": 0.9765625, "learning_rate": 0.00042023390830168224, "loss": 5.1671, "mean_token_accuracy": 0.2003230944275856, "num_tokens": 56599858.0, "step": 25355 }, { "entropy": 5.501519966125488, "epoch": 2.8482057617790755, "grad_norm": 1.046875, "learning_rate": 0.000420203241451565, "loss": 5.1366, "mean_token_accuracy": 0.21355710923671722, "num_tokens": 56610972.0, "step": 25360 }, { "entropy": 5.398740339279175, "epoch": 2.848767338687033, "grad_norm": 1.0625, "learning_rate": 0.00042017256997812016, "loss": 5.0728, "mean_token_accuracy": 0.2101953685283661, "num_tokens": 56621619.0, "step": 25365 }, { "entropy": 5.3734790802001955, "epoch": 2.849328915594991, "grad_norm": 1.0078125, "learning_rate": 0.00042014189388232446, "loss": 5.1693, "mean_token_accuracy": 0.20445075184106826, "num_tokens": 56632955.0, "step": 25370 }, { "entropy": 5.49137396812439, "epoch": 2.849890492502948, "grad_norm": 0.984375, "learning_rate": 0.0004201112131651545, "loss": 5.2366, "mean_token_accuracy": 0.20115977227687837, "num_tokens": 56645896.0, "step": 25375 }, { "entropy": 5.3593559741973875, "epoch": 2.8504520694109057, "grad_norm": 1.0546875, "learning_rate": 0.0004200805278275873, "loss": 5.1046, "mean_token_accuracy": 0.2025277405977249, "num_tokens": 56656974.0, "step": 25380 }, { "entropy": 5.539211988449097, "epoch": 2.8510136463188633, "grad_norm": 1.046875, "learning_rate": 0.0004200498378705997, "loss": 5.3335, "mean_token_accuracy": 0.19924675077199935, "num_tokens": 56669251.0, "step": 25385 }, { "entropy": 5.512341785430908, "epoch": 2.851575223226821, "grad_norm": 1.0390625, "learning_rate": 0.0004200191432951692, "loss": 5.0779, "mean_token_accuracy": 0.21129606962203978, "num_tokens": 56679526.0, "step": 25390 }, { "entropy": 5.382119226455688, "epoch": 2.8521368001347787, "grad_norm": 1.4453125, "learning_rate": 0.0004199884441022728, "loss": 5.1089, "mean_token_accuracy": 0.20841437131166457, "num_tokens": 56690276.0, "step": 25395 }, { "entropy": 5.3592352867126465, "epoch": 2.852698377042736, "grad_norm": 0.93359375, "learning_rate": 0.00041995774029288807, "loss": 5.052, "mean_token_accuracy": 0.21437742412090302, "num_tokens": 56702509.0, "step": 25400 }, { "entropy": 5.458844184875488, "epoch": 2.8532599539506935, "grad_norm": 1.0546875, "learning_rate": 0.00041992703186799273, "loss": 5.1956, "mean_token_accuracy": 0.20444972813129425, "num_tokens": 56713562.0, "step": 25405 }, { "entropy": 5.400401973724366, "epoch": 2.853821530858651, "grad_norm": 1.046875, "learning_rate": 0.00041989631882856447, "loss": 5.1325, "mean_token_accuracy": 0.20724885612726213, "num_tokens": 56724793.0, "step": 25410 }, { "entropy": 5.463048362731934, "epoch": 2.8543831077666084, "grad_norm": 1.09375, "learning_rate": 0.0004198656011755812, "loss": 5.2352, "mean_token_accuracy": 0.1953496217727661, "num_tokens": 56736842.0, "step": 25415 }, { "entropy": 5.485711240768433, "epoch": 2.854944684674566, "grad_norm": 1.0625, "learning_rate": 0.0004198348789100211, "loss": 5.1274, "mean_token_accuracy": 0.19544288665056228, "num_tokens": 56748220.0, "step": 25420 }, { "entropy": 5.333998441696167, "epoch": 2.8555062615825237, "grad_norm": 1.1640625, "learning_rate": 0.00041980415203286223, "loss": 5.0426, "mean_token_accuracy": 0.2101687327027321, "num_tokens": 56758420.0, "step": 25425 }, { "entropy": 5.3409339427948, "epoch": 2.8560678384904814, "grad_norm": 1.1015625, "learning_rate": 0.000419773420545083, "loss": 5.0682, "mean_token_accuracy": 0.21174260824918748, "num_tokens": 56768801.0, "step": 25430 }, { "entropy": 5.532502126693726, "epoch": 2.856629415398439, "grad_norm": 1.1171875, "learning_rate": 0.00041974268444766187, "loss": 5.2483, "mean_token_accuracy": 0.19456196278333665, "num_tokens": 56780756.0, "step": 25435 }, { "entropy": 5.415250062942505, "epoch": 2.8571909923063963, "grad_norm": 1.0625, "learning_rate": 0.0004197119437415776, "loss": 5.0723, "mean_token_accuracy": 0.21114940345287322, "num_tokens": 56790679.0, "step": 25440 }, { "entropy": 5.429743528366089, "epoch": 2.857752569214354, "grad_norm": 1.1015625, "learning_rate": 0.0004196811984278089, "loss": 5.1603, "mean_token_accuracy": 0.20232051461935044, "num_tokens": 56802513.0, "step": 25445 }, { "entropy": 5.398722743988037, "epoch": 2.8583141461223116, "grad_norm": 1.03125, "learning_rate": 0.0004196504485073347, "loss": 5.1572, "mean_token_accuracy": 0.2079310104250908, "num_tokens": 56813213.0, "step": 25450 }, { "entropy": 5.461503267288208, "epoch": 2.858875723030269, "grad_norm": 1.0234375, "learning_rate": 0.00041961969398113404, "loss": 5.1697, "mean_token_accuracy": 0.20354634523391724, "num_tokens": 56825097.0, "step": 25455 }, { "entropy": 5.454945135116577, "epoch": 2.8594372999382265, "grad_norm": 0.921875, "learning_rate": 0.00041958893485018634, "loss": 5.2639, "mean_token_accuracy": 0.20158192962408067, "num_tokens": 56837185.0, "step": 25460 }, { "entropy": 5.4053099155426025, "epoch": 2.859998876846184, "grad_norm": 1.0390625, "learning_rate": 0.0004195581711154709, "loss": 5.1807, "mean_token_accuracy": 0.19830115437507628, "num_tokens": 56848696.0, "step": 25465 }, { "entropy": 5.45564341545105, "epoch": 2.8605604537541414, "grad_norm": 0.9140625, "learning_rate": 0.00041952740277796717, "loss": 5.2142, "mean_token_accuracy": 0.1975526213645935, "num_tokens": 56860955.0, "step": 25470 }, { "entropy": 5.499543714523315, "epoch": 2.861122030662099, "grad_norm": 1.109375, "learning_rate": 0.00041949662983865486, "loss": 5.2282, "mean_token_accuracy": 0.20718390494585037, "num_tokens": 56872375.0, "step": 25475 }, { "entropy": 5.468471097946167, "epoch": 2.8616836075700567, "grad_norm": 1.0859375, "learning_rate": 0.0004194658522985139, "loss": 5.2295, "mean_token_accuracy": 0.19644685685634614, "num_tokens": 56883644.0, "step": 25480 }, { "entropy": 5.4562958717346195, "epoch": 2.8622451844780143, "grad_norm": 0.9921875, "learning_rate": 0.0004194350701585241, "loss": 5.1938, "mean_token_accuracy": 0.19859348684549333, "num_tokens": 56894803.0, "step": 25485 }, { "entropy": 5.505408716201782, "epoch": 2.862806761385972, "grad_norm": 0.9296875, "learning_rate": 0.0004194042834196656, "loss": 5.1715, "mean_token_accuracy": 0.19894446283578873, "num_tokens": 56906475.0, "step": 25490 }, { "entropy": 5.503805828094483, "epoch": 2.8633683382939292, "grad_norm": 1.046875, "learning_rate": 0.0004193734920829188, "loss": 5.264, "mean_token_accuracy": 0.20091774463653564, "num_tokens": 56918086.0, "step": 25495 }, { "entropy": 5.4378049850463865, "epoch": 2.863929915201887, "grad_norm": 1.1484375, "learning_rate": 0.000419342696149264, "loss": 5.1402, "mean_token_accuracy": 0.2121339425444603, "num_tokens": 56929300.0, "step": 25500 }, { "entropy": 5.472341299057007, "epoch": 2.8644914921098446, "grad_norm": 1.09375, "learning_rate": 0.0004193118956196818, "loss": 5.1931, "mean_token_accuracy": 0.20615252256393432, "num_tokens": 56941858.0, "step": 25505 }, { "entropy": 5.4952513694763185, "epoch": 2.8650530690178018, "grad_norm": 1.015625, "learning_rate": 0.0004192810904951528, "loss": 5.2702, "mean_token_accuracy": 0.196147920191288, "num_tokens": 56953214.0, "step": 25510 }, { "entropy": 5.446628761291504, "epoch": 2.8656146459257594, "grad_norm": 0.98828125, "learning_rate": 0.000419250280776658, "loss": 5.116, "mean_token_accuracy": 0.20575880259275436, "num_tokens": 56963437.0, "step": 25515 }, { "entropy": 5.442995405197143, "epoch": 2.866176222833717, "grad_norm": 1.015625, "learning_rate": 0.0004192194664651783, "loss": 5.1585, "mean_token_accuracy": 0.20627513378858567, "num_tokens": 56975771.0, "step": 25520 }, { "entropy": 5.347312355041504, "epoch": 2.8667377997416748, "grad_norm": 1.0703125, "learning_rate": 0.0004191886475616947, "loss": 5.0379, "mean_token_accuracy": 0.2114684373140335, "num_tokens": 56986084.0, "step": 25525 }, { "entropy": 5.2878861904144285, "epoch": 2.8672993766496324, "grad_norm": 0.98828125, "learning_rate": 0.00041915782406718875, "loss": 4.9579, "mean_token_accuracy": 0.2166465699672699, "num_tokens": 56996616.0, "step": 25530 }, { "entropy": 5.3388489246368405, "epoch": 2.8678609535575896, "grad_norm": 1.140625, "learning_rate": 0.0004191269959826418, "loss": 5.087, "mean_token_accuracy": 0.20653516948223113, "num_tokens": 57008431.0, "step": 25535 }, { "entropy": 5.435050344467163, "epoch": 2.8684225304655473, "grad_norm": 1.0546875, "learning_rate": 0.00041909616330903544, "loss": 5.2024, "mean_token_accuracy": 0.20243060439825059, "num_tokens": 57019265.0, "step": 25540 }, { "entropy": 5.4536457538604735, "epoch": 2.868984107373505, "grad_norm": 1.015625, "learning_rate": 0.00041906532604735127, "loss": 5.1099, "mean_token_accuracy": 0.20648247748613358, "num_tokens": 57029869.0, "step": 25545 }, { "entropy": 5.406654262542725, "epoch": 2.869545684281462, "grad_norm": 0.98828125, "learning_rate": 0.0004190344841985713, "loss": 5.1151, "mean_token_accuracy": 0.2072426974773407, "num_tokens": 57041168.0, "step": 25550 }, { "entropy": 5.361726856231689, "epoch": 2.87010726118942, "grad_norm": 0.99609375, "learning_rate": 0.00041900363776367747, "loss": 5.0187, "mean_token_accuracy": 0.21476262509822847, "num_tokens": 57052190.0, "step": 25555 }, { "entropy": 5.46991605758667, "epoch": 2.8706688380973775, "grad_norm": 0.96875, "learning_rate": 0.0004189727867436519, "loss": 5.2222, "mean_token_accuracy": 0.19721689373254775, "num_tokens": 57063817.0, "step": 25560 }, { "entropy": 5.540862417221069, "epoch": 2.8712304150053347, "grad_norm": 1.09375, "learning_rate": 0.00041894193113947703, "loss": 5.2281, "mean_token_accuracy": 0.1990749180316925, "num_tokens": 57074998.0, "step": 25565 }, { "entropy": 5.352570867538452, "epoch": 2.8717919919132924, "grad_norm": 1.046875, "learning_rate": 0.00041891107095213523, "loss": 5.0648, "mean_token_accuracy": 0.21047315001487732, "num_tokens": 57085377.0, "step": 25570 }, { "entropy": 5.369658994674682, "epoch": 2.87235356882125, "grad_norm": 0.98046875, "learning_rate": 0.00041888020618260913, "loss": 5.1258, "mean_token_accuracy": 0.20440869629383088, "num_tokens": 57096698.0, "step": 25575 }, { "entropy": 5.3737434387207035, "epoch": 2.8729151457292077, "grad_norm": 1.0078125, "learning_rate": 0.0004188493368318814, "loss": 5.1007, "mean_token_accuracy": 0.22189324349164963, "num_tokens": 57107559.0, "step": 25580 }, { "entropy": 5.4496818542480465, "epoch": 2.8734767226371654, "grad_norm": 1.09375, "learning_rate": 0.000418818462900935, "loss": 5.1665, "mean_token_accuracy": 0.2067941188812256, "num_tokens": 57118252.0, "step": 25585 }, { "entropy": 5.524903583526611, "epoch": 2.8740382995451226, "grad_norm": 1.1796875, "learning_rate": 0.0004187875843907531, "loss": 5.2313, "mean_token_accuracy": 0.19565823078155517, "num_tokens": 57128635.0, "step": 25590 }, { "entropy": 5.435476493835449, "epoch": 2.8745998764530802, "grad_norm": 1.0546875, "learning_rate": 0.00041875670130231857, "loss": 5.1397, "mean_token_accuracy": 0.19768817275762557, "num_tokens": 57138139.0, "step": 25595 }, { "entropy": 5.4453143119812015, "epoch": 2.875161453361038, "grad_norm": 1.0859375, "learning_rate": 0.000418725813636615, "loss": 5.1959, "mean_token_accuracy": 0.20585262775421143, "num_tokens": 57149456.0, "step": 25600 }, { "entropy": 5.5206645965576175, "epoch": 2.875723030268995, "grad_norm": 1.1875, "learning_rate": 0.00041869492139462585, "loss": 5.2292, "mean_token_accuracy": 0.20438657253980635, "num_tokens": 57160710.0, "step": 25605 }, { "entropy": 5.4862769603729244, "epoch": 2.876284607176953, "grad_norm": 1.0859375, "learning_rate": 0.00041866402457733454, "loss": 5.1471, "mean_token_accuracy": 0.20441498160362243, "num_tokens": 57172006.0, "step": 25610 }, { "entropy": 5.411442232131958, "epoch": 2.8768461840849104, "grad_norm": 1.1171875, "learning_rate": 0.00041863312318572504, "loss": 5.137, "mean_token_accuracy": 0.20361126214265823, "num_tokens": 57183665.0, "step": 25615 }, { "entropy": 5.395540523529053, "epoch": 2.877407760992868, "grad_norm": 1.0390625, "learning_rate": 0.0004186022172207812, "loss": 5.1999, "mean_token_accuracy": 0.19711469411849974, "num_tokens": 57195711.0, "step": 25620 }, { "entropy": 5.479584455490112, "epoch": 2.8779693379008258, "grad_norm": 1.0546875, "learning_rate": 0.00041857130668348705, "loss": 5.1028, "mean_token_accuracy": 0.2091955617070198, "num_tokens": 57206664.0, "step": 25625 }, { "entropy": 5.403205871582031, "epoch": 2.878530914808783, "grad_norm": 1.015625, "learning_rate": 0.0004185403915748268, "loss": 5.1877, "mean_token_accuracy": 0.19911823719739913, "num_tokens": 57217407.0, "step": 25630 }, { "entropy": 5.380570125579834, "epoch": 2.8790924917167406, "grad_norm": 1.0078125, "learning_rate": 0.0004185094718957848, "loss": 5.111, "mean_token_accuracy": 0.20767218470573426, "num_tokens": 57228707.0, "step": 25635 }, { "entropy": 5.37411060333252, "epoch": 2.8796540686246983, "grad_norm": 0.96484375, "learning_rate": 0.00041847854764734556, "loss": 5.1145, "mean_token_accuracy": 0.20558747202157973, "num_tokens": 57240802.0, "step": 25640 }, { "entropy": 5.474435091018677, "epoch": 2.8802156455326555, "grad_norm": 1.109375, "learning_rate": 0.0004184476188304937, "loss": 5.1899, "mean_token_accuracy": 0.1983725607395172, "num_tokens": 57251999.0, "step": 25645 }, { "entropy": 5.614864635467529, "epoch": 2.880777222440613, "grad_norm": 0.96484375, "learning_rate": 0.00041841668544621396, "loss": 5.3692, "mean_token_accuracy": 0.19171447157859803, "num_tokens": 57264199.0, "step": 25650 }, { "entropy": 5.414680242538452, "epoch": 2.881338799348571, "grad_norm": 0.95703125, "learning_rate": 0.0004183857474954915, "loss": 5.0699, "mean_token_accuracy": 0.20323451161384581, "num_tokens": 57275234.0, "step": 25655 }, { "entropy": 5.461675691604614, "epoch": 2.881900376256528, "grad_norm": 1.0859375, "learning_rate": 0.00041835480497931114, "loss": 5.2163, "mean_token_accuracy": 0.19762876331806184, "num_tokens": 57286920.0, "step": 25660 }, { "entropy": 5.458273267745971, "epoch": 2.8824619531644857, "grad_norm": 1.1171875, "learning_rate": 0.0004183238578986582, "loss": 5.1493, "mean_token_accuracy": 0.20384480506181718, "num_tokens": 57298148.0, "step": 25665 }, { "entropy": 5.397859811782837, "epoch": 2.8830235300724434, "grad_norm": 1.0078125, "learning_rate": 0.00041829290625451806, "loss": 5.1529, "mean_token_accuracy": 0.2048327222466469, "num_tokens": 57308717.0, "step": 25670 }, { "entropy": 5.42693247795105, "epoch": 2.883585106980401, "grad_norm": 0.984375, "learning_rate": 0.00041826195004787616, "loss": 5.1249, "mean_token_accuracy": 0.1999645084142685, "num_tokens": 57319308.0, "step": 25675 }, { "entropy": 5.554058980941773, "epoch": 2.8841466838883587, "grad_norm": 0.984375, "learning_rate": 0.00041823098927971827, "loss": 5.2762, "mean_token_accuracy": 0.19124944657087325, "num_tokens": 57330911.0, "step": 25680 }, { "entropy": 5.470970678329468, "epoch": 2.884708260796316, "grad_norm": 1.0234375, "learning_rate": 0.0004182000239510301, "loss": 5.1898, "mean_token_accuracy": 0.19733578860759735, "num_tokens": 57341624.0, "step": 25685 }, { "entropy": 5.432051515579223, "epoch": 2.8852698377042736, "grad_norm": 1.0234375, "learning_rate": 0.00041816905406279756, "loss": 5.1384, "mean_token_accuracy": 0.21039615869522094, "num_tokens": 57353399.0, "step": 25690 }, { "entropy": 5.500779008865356, "epoch": 2.8858314146122312, "grad_norm": 1.0703125, "learning_rate": 0.00041813807961600685, "loss": 5.2478, "mean_token_accuracy": 0.1968797877430916, "num_tokens": 57364481.0, "step": 25695 }, { "entropy": 5.395797681808472, "epoch": 2.8863929915201885, "grad_norm": 1.046875, "learning_rate": 0.0004181071006116442, "loss": 5.0625, "mean_token_accuracy": 0.21052238941192628, "num_tokens": 57375588.0, "step": 25700 }, { "entropy": 5.311108922958374, "epoch": 2.886954568428146, "grad_norm": 1.1015625, "learning_rate": 0.00041807611705069593, "loss": 5.1149, "mean_token_accuracy": 0.2019706577062607, "num_tokens": 57387048.0, "step": 25705 }, { "entropy": 5.4022002696990965, "epoch": 2.887516145336104, "grad_norm": 1.0, "learning_rate": 0.00041804512893414865, "loss": 5.0648, "mean_token_accuracy": 0.2137673020362854, "num_tokens": 57397946.0, "step": 25710 }, { "entropy": 5.435164976119995, "epoch": 2.8880777222440615, "grad_norm": 0.921875, "learning_rate": 0.00041801413626298893, "loss": 5.2098, "mean_token_accuracy": 0.19829149842262267, "num_tokens": 57409505.0, "step": 25715 }, { "entropy": 5.367911720275879, "epoch": 2.888639299152019, "grad_norm": 1.0390625, "learning_rate": 0.0004179831390382037, "loss": 5.1481, "mean_token_accuracy": 0.20473384261131286, "num_tokens": 57420745.0, "step": 25720 }, { "entropy": 5.449914932250977, "epoch": 2.8892008760599763, "grad_norm": 1.1953125, "learning_rate": 0.0004179521372607798, "loss": 5.225, "mean_token_accuracy": 0.20241276770830155, "num_tokens": 57431557.0, "step": 25725 }, { "entropy": 5.398954296112061, "epoch": 2.889762452967934, "grad_norm": 1.0625, "learning_rate": 0.00041792113093170447, "loss": 5.0775, "mean_token_accuracy": 0.20207086354494094, "num_tokens": 57442029.0, "step": 25730 }, { "entropy": 5.512173891067505, "epoch": 2.8903240298758917, "grad_norm": 1.1875, "learning_rate": 0.0004178901200519649, "loss": 5.2107, "mean_token_accuracy": 0.19664837419986725, "num_tokens": 57452921.0, "step": 25735 }, { "entropy": 5.375182485580444, "epoch": 2.890885606783849, "grad_norm": 1.2109375, "learning_rate": 0.0004178591046225485, "loss": 5.0483, "mean_token_accuracy": 0.20179080814123154, "num_tokens": 57463068.0, "step": 25740 }, { "entropy": 5.482132387161255, "epoch": 2.8914471836918065, "grad_norm": 1.0546875, "learning_rate": 0.00041782808464444274, "loss": 5.1833, "mean_token_accuracy": 0.2064593493938446, "num_tokens": 57474064.0, "step": 25745 }, { "entropy": 5.37639970779419, "epoch": 2.892008760599764, "grad_norm": 1.0859375, "learning_rate": 0.00041779706011863546, "loss": 5.1387, "mean_token_accuracy": 0.2044037938117981, "num_tokens": 57485473.0, "step": 25750 }, { "entropy": 5.345814752578735, "epoch": 2.8925703375077214, "grad_norm": 1.0703125, "learning_rate": 0.00041776603104611427, "loss": 5.0173, "mean_token_accuracy": 0.21522606313228607, "num_tokens": 57495562.0, "step": 25755 }, { "entropy": 5.4127197265625, "epoch": 2.893131914415679, "grad_norm": 0.953125, "learning_rate": 0.00041773499742786736, "loss": 5.1452, "mean_token_accuracy": 0.20925923734903334, "num_tokens": 57506322.0, "step": 25760 }, { "entropy": 5.437736654281617, "epoch": 2.8936934913236367, "grad_norm": 1.0546875, "learning_rate": 0.00041770395926488276, "loss": 5.1589, "mean_token_accuracy": 0.2075704365968704, "num_tokens": 57517353.0, "step": 25765 }, { "entropy": 5.481371927261352, "epoch": 2.8942550682315944, "grad_norm": 1.046875, "learning_rate": 0.0004176729165581488, "loss": 5.1887, "mean_token_accuracy": 0.20795637965202332, "num_tokens": 57527273.0, "step": 25770 }, { "entropy": 5.3552697658538815, "epoch": 2.894816645139552, "grad_norm": 1.0859375, "learning_rate": 0.00041764186930865377, "loss": 5.0783, "mean_token_accuracy": 0.2094851016998291, "num_tokens": 57538486.0, "step": 25775 }, { "entropy": 5.431337165832519, "epoch": 2.8953782220475093, "grad_norm": 0.98046875, "learning_rate": 0.0004176108175173863, "loss": 5.1365, "mean_token_accuracy": 0.20532081574201583, "num_tokens": 57549682.0, "step": 25780 }, { "entropy": 5.461119890213013, "epoch": 2.895939798955467, "grad_norm": 1.0703125, "learning_rate": 0.0004175797611853351, "loss": 5.1165, "mean_token_accuracy": 0.203577484190464, "num_tokens": 57559397.0, "step": 25785 }, { "entropy": 5.4301341533660885, "epoch": 2.8965013758634246, "grad_norm": 1.1796875, "learning_rate": 0.000417548700313489, "loss": 5.1716, "mean_token_accuracy": 0.20445359498262405, "num_tokens": 57570568.0, "step": 25790 }, { "entropy": 5.402664470672607, "epoch": 2.897062952771382, "grad_norm": 1.0390625, "learning_rate": 0.000417517634902837, "loss": 5.0589, "mean_token_accuracy": 0.21207818388938904, "num_tokens": 57581152.0, "step": 25795 }, { "entropy": 5.455234336853027, "epoch": 2.8976245296793395, "grad_norm": 1.0546875, "learning_rate": 0.00041748656495436834, "loss": 5.2218, "mean_token_accuracy": 0.2009818211197853, "num_tokens": 57592227.0, "step": 25800 }, { "entropy": 5.428123474121094, "epoch": 2.898186106587297, "grad_norm": 1.2265625, "learning_rate": 0.00041745549046907205, "loss": 5.1591, "mean_token_accuracy": 0.19946266561746598, "num_tokens": 57604037.0, "step": 25805 }, { "entropy": 5.530929517745972, "epoch": 2.898747683495255, "grad_norm": 1.0078125, "learning_rate": 0.00041742441144793774, "loss": 5.1842, "mean_token_accuracy": 0.209214286506176, "num_tokens": 57613937.0, "step": 25810 }, { "entropy": 5.426222515106201, "epoch": 2.8993092604032125, "grad_norm": 1.0703125, "learning_rate": 0.0004173933278919549, "loss": 5.0755, "mean_token_accuracy": 0.20047360211610793, "num_tokens": 57624287.0, "step": 25815 }, { "entropy": 5.425559425354004, "epoch": 2.8998708373111697, "grad_norm": 1.078125, "learning_rate": 0.0004173622398021133, "loss": 5.2075, "mean_token_accuracy": 0.19660639762878418, "num_tokens": 57636677.0, "step": 25820 }, { "entropy": 5.30368185043335, "epoch": 2.9004324142191273, "grad_norm": 1.03125, "learning_rate": 0.00041733114717940273, "loss": 5.0677, "mean_token_accuracy": 0.21388312578201293, "num_tokens": 57647848.0, "step": 25825 }, { "entropy": 5.321092510223389, "epoch": 2.900993991127085, "grad_norm": 1.1953125, "learning_rate": 0.0004173000500248133, "loss": 4.9894, "mean_token_accuracy": 0.21329567581415176, "num_tokens": 57658946.0, "step": 25830 }, { "entropy": 5.370088529586792, "epoch": 2.901555568035042, "grad_norm": 1.0703125, "learning_rate": 0.0004172689483393351, "loss": 5.1798, "mean_token_accuracy": 0.20348377525806427, "num_tokens": 57670690.0, "step": 25835 }, { "entropy": 5.616034412384034, "epoch": 2.902117144943, "grad_norm": 1.15625, "learning_rate": 0.00041723784212395834, "loss": 5.2648, "mean_token_accuracy": 0.1973352164030075, "num_tokens": 57682309.0, "step": 25840 }, { "entropy": 5.48683443069458, "epoch": 2.9026787218509575, "grad_norm": 1.015625, "learning_rate": 0.00041720673137967356, "loss": 5.1953, "mean_token_accuracy": 0.20093556940555574, "num_tokens": 57692804.0, "step": 25845 }, { "entropy": 5.520909309387207, "epoch": 2.9032402987589148, "grad_norm": 1.0234375, "learning_rate": 0.00041717561610747124, "loss": 5.2552, "mean_token_accuracy": 0.19937456846237184, "num_tokens": 57705824.0, "step": 25850 }, { "entropy": 5.471019554138183, "epoch": 2.9038018756668724, "grad_norm": 1.2265625, "learning_rate": 0.00041714449630834223, "loss": 5.1476, "mean_token_accuracy": 0.20346733629703523, "num_tokens": 57718983.0, "step": 25855 }, { "entropy": 5.4206592559814455, "epoch": 2.90436345257483, "grad_norm": 1.078125, "learning_rate": 0.0004171133719832774, "loss": 5.111, "mean_token_accuracy": 0.2079310417175293, "num_tokens": 57730727.0, "step": 25860 }, { "entropy": 5.416716051101685, "epoch": 2.9049250294827877, "grad_norm": 1.1328125, "learning_rate": 0.00041708224313326747, "loss": 5.2258, "mean_token_accuracy": 0.19479139447212218, "num_tokens": 57742474.0, "step": 25865 }, { "entropy": 5.526018285751343, "epoch": 2.9054866063907454, "grad_norm": 0.96875, "learning_rate": 0.000417051109759304, "loss": 5.1942, "mean_token_accuracy": 0.20101891756057738, "num_tokens": 57755094.0, "step": 25870 }, { "entropy": 5.490170288085937, "epoch": 2.9060481832987026, "grad_norm": 1.109375, "learning_rate": 0.000417019971862378, "loss": 5.2067, "mean_token_accuracy": 0.19423471987247468, "num_tokens": 57765820.0, "step": 25875 }, { "entropy": 5.453639698028565, "epoch": 2.9066097602066603, "grad_norm": 1.1171875, "learning_rate": 0.00041698882944348105, "loss": 5.1327, "mean_token_accuracy": 0.1975415378808975, "num_tokens": 57776749.0, "step": 25880 }, { "entropy": 5.3526660919189455, "epoch": 2.907171337114618, "grad_norm": 1.0390625, "learning_rate": 0.00041695768250360466, "loss": 5.0502, "mean_token_accuracy": 0.20913441926240922, "num_tokens": 57787734.0, "step": 25885 }, { "entropy": 5.408602905273438, "epoch": 2.907732914022575, "grad_norm": 1.0078125, "learning_rate": 0.0004169265310437407, "loss": 5.1781, "mean_token_accuracy": 0.20336141139268876, "num_tokens": 57799799.0, "step": 25890 }, { "entropy": 5.324546241760254, "epoch": 2.908294490930533, "grad_norm": 0.9375, "learning_rate": 0.0004168953750648809, "loss": 5.0406, "mean_token_accuracy": 0.20447193533182145, "num_tokens": 57810446.0, "step": 25895 }, { "entropy": 5.439510488510132, "epoch": 2.9088560678384905, "grad_norm": 1.0234375, "learning_rate": 0.00041686421456801724, "loss": 5.2753, "mean_token_accuracy": 0.20082124024629594, "num_tokens": 57822931.0, "step": 25900 }, { "entropy": 5.472529315948487, "epoch": 2.909417644746448, "grad_norm": 1.09375, "learning_rate": 0.0004168330495541421, "loss": 5.2135, "mean_token_accuracy": 0.19524312913417816, "num_tokens": 57835250.0, "step": 25905 }, { "entropy": 5.4400389194488525, "epoch": 2.909979221654406, "grad_norm": 0.9921875, "learning_rate": 0.00041680188002424755, "loss": 5.2249, "mean_token_accuracy": 0.20385906249284744, "num_tokens": 57847726.0, "step": 25910 }, { "entropy": 5.462716865539551, "epoch": 2.910540798562363, "grad_norm": 1.1171875, "learning_rate": 0.0004167707059793262, "loss": 5.1794, "mean_token_accuracy": 0.20232041776180268, "num_tokens": 57858484.0, "step": 25915 }, { "entropy": 5.377426671981811, "epoch": 2.9111023754703207, "grad_norm": 1.03125, "learning_rate": 0.00041673952742037057, "loss": 5.1023, "mean_token_accuracy": 0.21010929644107817, "num_tokens": 57870469.0, "step": 25920 }, { "entropy": 5.41539740562439, "epoch": 2.9116639523782784, "grad_norm": 1.2890625, "learning_rate": 0.0004167083443483734, "loss": 5.1841, "mean_token_accuracy": 0.20243118405342103, "num_tokens": 57880088.0, "step": 25925 }, { "entropy": 5.440696668624878, "epoch": 2.9122255292862356, "grad_norm": 1.1171875, "learning_rate": 0.0004166771567643276, "loss": 5.1553, "mean_token_accuracy": 0.19611647129058837, "num_tokens": 57890521.0, "step": 25930 }, { "entropy": 5.53588285446167, "epoch": 2.9127871061941932, "grad_norm": 1.0234375, "learning_rate": 0.0004166459646692262, "loss": 5.2975, "mean_token_accuracy": 0.19729715436697007, "num_tokens": 57904111.0, "step": 25935 }, { "entropy": 5.5199450016021725, "epoch": 2.913348683102151, "grad_norm": 0.96484375, "learning_rate": 0.0004166147680640623, "loss": 5.2049, "mean_token_accuracy": 0.20056531429290772, "num_tokens": 57915854.0, "step": 25940 }, { "entropy": 5.381930351257324, "epoch": 2.913910260010108, "grad_norm": 1.1015625, "learning_rate": 0.00041658356694982936, "loss": 5.0646, "mean_token_accuracy": 0.20999300330877305, "num_tokens": 57926822.0, "step": 25945 }, { "entropy": 5.408369731903076, "epoch": 2.9144718369180658, "grad_norm": 1.0546875, "learning_rate": 0.0004165523613275207, "loss": 5.1875, "mean_token_accuracy": 0.20637202113866807, "num_tokens": 57939029.0, "step": 25950 }, { "entropy": 5.393961715698242, "epoch": 2.9150334138260234, "grad_norm": 1.078125, "learning_rate": 0.0004165211511981299, "loss": 5.1139, "mean_token_accuracy": 0.20553070604801177, "num_tokens": 57950053.0, "step": 25955 }, { "entropy": 5.408486270904541, "epoch": 2.915594990733981, "grad_norm": 1.0234375, "learning_rate": 0.0004164899365626507, "loss": 5.051, "mean_token_accuracy": 0.21321532428264617, "num_tokens": 57960925.0, "step": 25960 }, { "entropy": 5.350430059432983, "epoch": 2.9161565676419388, "grad_norm": 1.0234375, "learning_rate": 0.0004164587174220771, "loss": 5.0915, "mean_token_accuracy": 0.2021890789270401, "num_tokens": 57971948.0, "step": 25965 }, { "entropy": 5.39500846862793, "epoch": 2.916718144549896, "grad_norm": 1.0703125, "learning_rate": 0.00041642749377740316, "loss": 5.1929, "mean_token_accuracy": 0.1953263282775879, "num_tokens": 57984310.0, "step": 25970 }, { "entropy": 5.423575401306152, "epoch": 2.9172797214578536, "grad_norm": 1.015625, "learning_rate": 0.00041639626562962293, "loss": 5.0762, "mean_token_accuracy": 0.21097016632556914, "num_tokens": 57995194.0, "step": 25975 }, { "entropy": 5.461473560333252, "epoch": 2.9178412983658113, "grad_norm": 1.1484375, "learning_rate": 0.00041636503297973074, "loss": 5.2019, "mean_token_accuracy": 0.19940125793218613, "num_tokens": 58006370.0, "step": 25980 }, { "entropy": 5.435816669464112, "epoch": 2.9184028752737685, "grad_norm": 1.03125, "learning_rate": 0.000416333795828721, "loss": 5.148, "mean_token_accuracy": 0.20874685198068618, "num_tokens": 58017635.0, "step": 25985 }, { "entropy": 5.434745979309082, "epoch": 2.918964452181726, "grad_norm": 0.9921875, "learning_rate": 0.0004163025541775885, "loss": 5.1396, "mean_token_accuracy": 0.2090197592973709, "num_tokens": 58028110.0, "step": 25990 }, { "entropy": 5.433812522888184, "epoch": 2.919526029089684, "grad_norm": 1.0390625, "learning_rate": 0.0004162713080273278, "loss": 5.2306, "mean_token_accuracy": 0.19314567595720292, "num_tokens": 58039715.0, "step": 25995 }, { "entropy": 5.508810758590698, "epoch": 2.9200876059976415, "grad_norm": 1.0234375, "learning_rate": 0.00041624005737893387, "loss": 5.1691, "mean_token_accuracy": 0.20778415501117706, "num_tokens": 58051052.0, "step": 26000 }, { "entropy": 5.4035248279571535, "epoch": 2.920649182905599, "grad_norm": 1.1796875, "learning_rate": 0.0004162088022334018, "loss": 5.1755, "mean_token_accuracy": 0.20375409126281738, "num_tokens": 58062789.0, "step": 26005 }, { "entropy": 5.357011795043945, "epoch": 2.9212107598135564, "grad_norm": 0.96484375, "learning_rate": 0.00041617754259172665, "loss": 5.0842, "mean_token_accuracy": 0.2069661021232605, "num_tokens": 58073896.0, "step": 26010 }, { "entropy": 5.541758298873901, "epoch": 2.921772336721514, "grad_norm": 1.0546875, "learning_rate": 0.00041614627845490377, "loss": 5.3534, "mean_token_accuracy": 0.19384508579969406, "num_tokens": 58084529.0, "step": 26015 }, { "entropy": 5.4695415019989015, "epoch": 2.9223339136294717, "grad_norm": 1.03125, "learning_rate": 0.00041611500982392867, "loss": 5.2037, "mean_token_accuracy": 0.20239120423793794, "num_tokens": 58095989.0, "step": 26020 }, { "entropy": 5.3880956172943115, "epoch": 2.922895490537429, "grad_norm": 1.1015625, "learning_rate": 0.00041608373669979696, "loss": 5.0241, "mean_token_accuracy": 0.21667951643466948, "num_tokens": 58107001.0, "step": 26025 }, { "entropy": 5.394635486602783, "epoch": 2.9234570674453866, "grad_norm": 1.078125, "learning_rate": 0.0004160524590835042, "loss": 5.116, "mean_token_accuracy": 0.20562432557344437, "num_tokens": 58118224.0, "step": 26030 }, { "entropy": 5.410785293579101, "epoch": 2.9240186443533442, "grad_norm": 1.1171875, "learning_rate": 0.00041602117697604664, "loss": 5.0757, "mean_token_accuracy": 0.21118640452623366, "num_tokens": 58129675.0, "step": 26035 }, { "entropy": 5.442865467071533, "epoch": 2.9245802212613015, "grad_norm": 1.03125, "learning_rate": 0.00041598989037842, "loss": 5.1454, "mean_token_accuracy": 0.20115061104297638, "num_tokens": 58140409.0, "step": 26040 }, { "entropy": 5.408319568634033, "epoch": 2.925141798169259, "grad_norm": 1.03125, "learning_rate": 0.0004159585992916206, "loss": 5.0988, "mean_token_accuracy": 0.21264615952968596, "num_tokens": 58151139.0, "step": 26045 }, { "entropy": 5.492136859893799, "epoch": 2.925703375077217, "grad_norm": 1.078125, "learning_rate": 0.0004159273037166447, "loss": 5.2448, "mean_token_accuracy": 0.19388846009969712, "num_tokens": 58162953.0, "step": 26050 }, { "entropy": 5.43334469795227, "epoch": 2.9262649519851744, "grad_norm": 1.0546875, "learning_rate": 0.00041589600365448884, "loss": 5.0889, "mean_token_accuracy": 0.2060546264052391, "num_tokens": 58173480.0, "step": 26055 }, { "entropy": 5.479301881790161, "epoch": 2.926826528893132, "grad_norm": 1.0703125, "learning_rate": 0.0004158646991061495, "loss": 5.225, "mean_token_accuracy": 0.19901593029499054, "num_tokens": 58185392.0, "step": 26060 }, { "entropy": 5.419336223602295, "epoch": 2.9273881058010893, "grad_norm": 1.0078125, "learning_rate": 0.0004158333900726235, "loss": 5.0468, "mean_token_accuracy": 0.2121843382716179, "num_tokens": 58195984.0, "step": 26065 }, { "entropy": 5.44150071144104, "epoch": 2.927949682709047, "grad_norm": 1.0234375, "learning_rate": 0.00041580207655490776, "loss": 5.202, "mean_token_accuracy": 0.20273322016000747, "num_tokens": 58207529.0, "step": 26070 }, { "entropy": 5.421343040466309, "epoch": 2.9285112596170046, "grad_norm": 1.03125, "learning_rate": 0.0004157707585539994, "loss": 5.1461, "mean_token_accuracy": 0.2040032297372818, "num_tokens": 58217936.0, "step": 26075 }, { "entropy": 5.411030864715576, "epoch": 2.929072836524962, "grad_norm": 1.125, "learning_rate": 0.00041573943607089536, "loss": 5.1213, "mean_token_accuracy": 0.2078385517001152, "num_tokens": 58228144.0, "step": 26080 }, { "entropy": 5.369383192062378, "epoch": 2.9296344134329195, "grad_norm": 1.03125, "learning_rate": 0.0004157081091065932, "loss": 5.2021, "mean_token_accuracy": 0.20769353359937667, "num_tokens": 58239130.0, "step": 26085 }, { "entropy": 5.379394578933716, "epoch": 2.930195990340877, "grad_norm": 1.0703125, "learning_rate": 0.0004156767776620902, "loss": 5.1495, "mean_token_accuracy": 0.20469617694616318, "num_tokens": 58253119.0, "step": 26090 }, { "entropy": 5.493002796173096, "epoch": 2.930757567248835, "grad_norm": 1.0859375, "learning_rate": 0.000415645441738384, "loss": 5.1711, "mean_token_accuracy": 0.2003135547041893, "num_tokens": 58265549.0, "step": 26095 }, { "entropy": 5.4172422885894775, "epoch": 2.9313191441567925, "grad_norm": 1.046875, "learning_rate": 0.00041561410133647244, "loss": 5.0698, "mean_token_accuracy": 0.2199552074074745, "num_tokens": 58275021.0, "step": 26100 }, { "entropy": 5.38364610671997, "epoch": 2.9318807210647497, "grad_norm": 1.0625, "learning_rate": 0.00041558275645735336, "loss": 5.159, "mean_token_accuracy": 0.20382583290338516, "num_tokens": 58286191.0, "step": 26105 }, { "entropy": 5.322482013702393, "epoch": 2.9324422979727074, "grad_norm": 1.125, "learning_rate": 0.00041555140710202484, "loss": 5.032, "mean_token_accuracy": 0.21036772131919862, "num_tokens": 58297066.0, "step": 26110 }, { "entropy": 5.446857500076294, "epoch": 2.933003874880665, "grad_norm": 1.046875, "learning_rate": 0.00041552005327148494, "loss": 5.1088, "mean_token_accuracy": 0.2117781326174736, "num_tokens": 58308008.0, "step": 26115 }, { "entropy": 5.42616868019104, "epoch": 2.9335654517886223, "grad_norm": 1.015625, "learning_rate": 0.0004154886949667321, "loss": 5.2326, "mean_token_accuracy": 0.20192758589982987, "num_tokens": 58319584.0, "step": 26120 }, { "entropy": 5.454682397842407, "epoch": 2.93412702869658, "grad_norm": 1.0078125, "learning_rate": 0.00041545733218876466, "loss": 5.1062, "mean_token_accuracy": 0.20412180125713347, "num_tokens": 58328964.0, "step": 26125 }, { "entropy": 5.4964745998382565, "epoch": 2.9346886056045376, "grad_norm": 1.0390625, "learning_rate": 0.0004154259649385813, "loss": 5.1662, "mean_token_accuracy": 0.20751436352729796, "num_tokens": 58339673.0, "step": 26130 }, { "entropy": 5.46304759979248, "epoch": 2.935250182512495, "grad_norm": 1.1484375, "learning_rate": 0.00041539459321718076, "loss": 5.2175, "mean_token_accuracy": 0.20141832530498505, "num_tokens": 58351453.0, "step": 26135 }, { "entropy": 5.472506523132324, "epoch": 2.9358117594204525, "grad_norm": 1.2421875, "learning_rate": 0.0004153632170255619, "loss": 5.2308, "mean_token_accuracy": 0.19904376566410065, "num_tokens": 58362792.0, "step": 26140 }, { "entropy": 5.442188549041748, "epoch": 2.93637333632841, "grad_norm": 0.9765625, "learning_rate": 0.00041533183636472385, "loss": 5.1938, "mean_token_accuracy": 0.2084762841463089, "num_tokens": 58372628.0, "step": 26145 }, { "entropy": 5.351198005676269, "epoch": 2.936934913236368, "grad_norm": 1.1484375, "learning_rate": 0.0004153004512356656, "loss": 5.0557, "mean_token_accuracy": 0.20982459783554078, "num_tokens": 58383723.0, "step": 26150 }, { "entropy": 5.3353804588317875, "epoch": 2.9374964901443255, "grad_norm": 1.0703125, "learning_rate": 0.0004152690616393866, "loss": 5.1208, "mean_token_accuracy": 0.2098701700568199, "num_tokens": 58394547.0, "step": 26155 }, { "entropy": 5.424770212173462, "epoch": 2.9380580670522827, "grad_norm": 1.09375, "learning_rate": 0.00041523766757688634, "loss": 5.1298, "mean_token_accuracy": 0.2060968443751335, "num_tokens": 58405460.0, "step": 26160 }, { "entropy": 5.465103721618652, "epoch": 2.9386196439602403, "grad_norm": 1.1796875, "learning_rate": 0.0004152062690491643, "loss": 5.1623, "mean_token_accuracy": 0.20847226530313492, "num_tokens": 58416436.0, "step": 26165 }, { "entropy": 5.430757808685303, "epoch": 2.939181220868198, "grad_norm": 1.09375, "learning_rate": 0.0004151748660572203, "loss": 5.0862, "mean_token_accuracy": 0.20920496433973312, "num_tokens": 58426920.0, "step": 26170 }, { "entropy": 5.375385808944702, "epoch": 2.939742797776155, "grad_norm": 1.03125, "learning_rate": 0.0004151434586020541, "loss": 4.9965, "mean_token_accuracy": 0.2141570433974266, "num_tokens": 58437525.0, "step": 26175 }, { "entropy": 5.44410457611084, "epoch": 2.940304374684113, "grad_norm": 1.0390625, "learning_rate": 0.00041511204668466593, "loss": 5.2395, "mean_token_accuracy": 0.20362237989902496, "num_tokens": 58448955.0, "step": 26180 }, { "entropy": 5.319963788986206, "epoch": 2.9408659515920705, "grad_norm": 1.359375, "learning_rate": 0.00041508063030605585, "loss": 5.0262, "mean_token_accuracy": 0.21264876127243043, "num_tokens": 58459941.0, "step": 26185 }, { "entropy": 5.42093186378479, "epoch": 2.941427528500028, "grad_norm": 1.1328125, "learning_rate": 0.00041504920946722413, "loss": 5.0902, "mean_token_accuracy": 0.2079539641737938, "num_tokens": 58470499.0, "step": 26190 }, { "entropy": 5.412980556488037, "epoch": 2.941989105407986, "grad_norm": 0.95703125, "learning_rate": 0.0004150177841691713, "loss": 5.1397, "mean_token_accuracy": 0.2061356484889984, "num_tokens": 58482969.0, "step": 26195 }, { "entropy": 5.517292070388794, "epoch": 2.942550682315943, "grad_norm": 1.0234375, "learning_rate": 0.0004149863544128979, "loss": 5.1511, "mean_token_accuracy": 0.20663608610630035, "num_tokens": 58492929.0, "step": 26200 }, { "entropy": 5.406018924713135, "epoch": 2.9431122592239007, "grad_norm": 0.9765625, "learning_rate": 0.00041495492019940467, "loss": 5.1045, "mean_token_accuracy": 0.2094804584980011, "num_tokens": 58503932.0, "step": 26205 }, { "entropy": 5.310173034667969, "epoch": 2.9436738361318584, "grad_norm": 1.1796875, "learning_rate": 0.0004149234815296925, "loss": 5.0215, "mean_token_accuracy": 0.21466903686523436, "num_tokens": 58515282.0, "step": 26210 }, { "entropy": 5.451882934570312, "epoch": 2.9442354130398156, "grad_norm": 1.25, "learning_rate": 0.00041489203840476243, "loss": 5.2589, "mean_token_accuracy": 0.19951150715351104, "num_tokens": 58527218.0, "step": 26215 }, { "entropy": 5.4922027587890625, "epoch": 2.9447969899477733, "grad_norm": 1.09375, "learning_rate": 0.00041486059082561556, "loss": 5.1048, "mean_token_accuracy": 0.20603868812322618, "num_tokens": 58538622.0, "step": 26220 }, { "entropy": 5.434462642669677, "epoch": 2.945358566855731, "grad_norm": 1.046875, "learning_rate": 0.0004148291387932533, "loss": 5.1454, "mean_token_accuracy": 0.2069733738899231, "num_tokens": 58549747.0, "step": 26225 }, { "entropy": 5.383919382095337, "epoch": 2.9459201437636886, "grad_norm": 1.0390625, "learning_rate": 0.00041479768230867696, "loss": 5.1748, "mean_token_accuracy": 0.20045768320560456, "num_tokens": 58560771.0, "step": 26230 }, { "entropy": 5.417341041564941, "epoch": 2.946481720671646, "grad_norm": 1.0546875, "learning_rate": 0.00041476622137288823, "loss": 5.0512, "mean_token_accuracy": 0.20584377497434617, "num_tokens": 58571184.0, "step": 26235 }, { "entropy": 5.497204446792603, "epoch": 2.9470432975796035, "grad_norm": 1.0390625, "learning_rate": 0.00041473475598688886, "loss": 5.1922, "mean_token_accuracy": 0.2010476619005203, "num_tokens": 58583075.0, "step": 26240 }, { "entropy": 5.472446489334106, "epoch": 2.947604874487561, "grad_norm": 0.984375, "learning_rate": 0.0004147032861516805, "loss": 5.1181, "mean_token_accuracy": 0.20338730216026307, "num_tokens": 58593978.0, "step": 26245 }, { "entropy": 5.3990837097167965, "epoch": 2.948166451395519, "grad_norm": 1.140625, "learning_rate": 0.00041467181186826546, "loss": 5.1372, "mean_token_accuracy": 0.20300608724355698, "num_tokens": 58604525.0, "step": 26250 }, { "entropy": 5.332387256622314, "epoch": 2.948728028303476, "grad_norm": 1.0234375, "learning_rate": 0.00041464033313764575, "loss": 5.111, "mean_token_accuracy": 0.2076411470770836, "num_tokens": 58614965.0, "step": 26255 }, { "entropy": 5.417438220977783, "epoch": 2.9492896052114337, "grad_norm": 1.078125, "learning_rate": 0.00041460884996082363, "loss": 5.1307, "mean_token_accuracy": 0.20631330013275145, "num_tokens": 58626254.0, "step": 26260 }, { "entropy": 5.445356607437134, "epoch": 2.9498511821193913, "grad_norm": 1.109375, "learning_rate": 0.00041457736233880166, "loss": 5.1855, "mean_token_accuracy": 0.20529866516590117, "num_tokens": 58637474.0, "step": 26265 }, { "entropy": 5.471877861022949, "epoch": 2.9504127590273486, "grad_norm": 1.1015625, "learning_rate": 0.0004145458702725823, "loss": 5.165, "mean_token_accuracy": 0.20356644839048385, "num_tokens": 58649560.0, "step": 26270 }, { "entropy": 5.394941425323486, "epoch": 2.9509743359353062, "grad_norm": 0.98828125, "learning_rate": 0.00041451437376316825, "loss": 5.0839, "mean_token_accuracy": 0.20584533363580704, "num_tokens": 58659944.0, "step": 26275 }, { "entropy": 5.5028317928314205, "epoch": 2.951535912843264, "grad_norm": 0.95703125, "learning_rate": 0.0004144828728115624, "loss": 5.1385, "mean_token_accuracy": 0.20217933356761933, "num_tokens": 58670636.0, "step": 26280 }, { "entropy": 5.461650705337524, "epoch": 2.9520974897512215, "grad_norm": 1.0078125, "learning_rate": 0.0004144513674187679, "loss": 5.1811, "mean_token_accuracy": 0.20394921451807022, "num_tokens": 58682832.0, "step": 26285 }, { "entropy": 5.385468769073486, "epoch": 2.952659066659179, "grad_norm": 1.078125, "learning_rate": 0.0004144198575857878, "loss": 5.1594, "mean_token_accuracy": 0.20358292013406754, "num_tokens": 58694675.0, "step": 26290 }, { "entropy": 5.34437141418457, "epoch": 2.9532206435671364, "grad_norm": 1.046875, "learning_rate": 0.0004143883433136252, "loss": 5.1295, "mean_token_accuracy": 0.20645448714494705, "num_tokens": 58705613.0, "step": 26295 }, { "entropy": 5.51003851890564, "epoch": 2.953782220475094, "grad_norm": 1.0390625, "learning_rate": 0.0004143568246032838, "loss": 5.1937, "mean_token_accuracy": 0.20135696232318878, "num_tokens": 58716951.0, "step": 26300 }, { "entropy": 5.435044670104981, "epoch": 2.9543437973830518, "grad_norm": 1.203125, "learning_rate": 0.0004143253014557671, "loss": 5.2202, "mean_token_accuracy": 0.19886878728866578, "num_tokens": 58727730.0, "step": 26305 }, { "entropy": 5.368337345123291, "epoch": 2.954905374291009, "grad_norm": 0.96484375, "learning_rate": 0.00041429377387207865, "loss": 5.0964, "mean_token_accuracy": 0.20425185114145278, "num_tokens": 58739183.0, "step": 26310 }, { "entropy": 5.535157585144043, "epoch": 2.9554669511989666, "grad_norm": 1.0625, "learning_rate": 0.00041426224185322255, "loss": 5.1986, "mean_token_accuracy": 0.20431118905544282, "num_tokens": 58750031.0, "step": 26315 }, { "entropy": 5.491509246826172, "epoch": 2.9560285281069243, "grad_norm": 1.0625, "learning_rate": 0.0004142307054002025, "loss": 5.1745, "mean_token_accuracy": 0.20514926165342331, "num_tokens": 58760488.0, "step": 26320 }, { "entropy": 5.486062049865723, "epoch": 2.956590105014882, "grad_norm": 1.1875, "learning_rate": 0.0004141991645140228, "loss": 5.2246, "mean_token_accuracy": 0.1931058406829834, "num_tokens": 58771484.0, "step": 26325 }, { "entropy": 5.382993507385254, "epoch": 2.957151681922839, "grad_norm": 1.0703125, "learning_rate": 0.00041416761919568784, "loss": 5.0907, "mean_token_accuracy": 0.20423207879066468, "num_tokens": 58782208.0, "step": 26330 }, { "entropy": 5.452815246582031, "epoch": 2.957713258830797, "grad_norm": 1.0546875, "learning_rate": 0.00041413606944620183, "loss": 5.1613, "mean_token_accuracy": 0.20244159549474716, "num_tokens": 58792556.0, "step": 26335 }, { "entropy": 5.387005949020386, "epoch": 2.9582748357387545, "grad_norm": 1.171875, "learning_rate": 0.0004141045152665695, "loss": 5.1026, "mean_token_accuracy": 0.21215709447860717, "num_tokens": 58803531.0, "step": 26340 }, { "entropy": 5.476835680007935, "epoch": 2.958836412646712, "grad_norm": 1.078125, "learning_rate": 0.00041407295665779533, "loss": 5.149, "mean_token_accuracy": 0.20485242307186127, "num_tokens": 58813639.0, "step": 26345 }, { "entropy": 5.469878005981445, "epoch": 2.9593979895546694, "grad_norm": 0.984375, "learning_rate": 0.00041404139362088434, "loss": 5.1427, "mean_token_accuracy": 0.20671990215778352, "num_tokens": 58824830.0, "step": 26350 }, { "entropy": 5.418271684646607, "epoch": 2.959959566462627, "grad_norm": 0.95703125, "learning_rate": 0.0004140098261568414, "loss": 5.1659, "mean_token_accuracy": 0.20456338673830032, "num_tokens": 58835664.0, "step": 26355 }, { "entropy": 5.43869833946228, "epoch": 2.9605211433705847, "grad_norm": 1.0390625, "learning_rate": 0.00041397825426667175, "loss": 5.1353, "mean_token_accuracy": 0.19986433833837508, "num_tokens": 58845872.0, "step": 26360 }, { "entropy": 5.339887237548828, "epoch": 2.961082720278542, "grad_norm": 1.0859375, "learning_rate": 0.0004139466779513805, "loss": 4.9615, "mean_token_accuracy": 0.21431145071983337, "num_tokens": 58857090.0, "step": 26365 }, { "entropy": 5.445224571228027, "epoch": 2.9616442971864996, "grad_norm": 1.015625, "learning_rate": 0.0004139150972119732, "loss": 5.1529, "mean_token_accuracy": 0.20400341004133224, "num_tokens": 58868814.0, "step": 26370 }, { "entropy": 5.3369225025177, "epoch": 2.9622058740944572, "grad_norm": 1.109375, "learning_rate": 0.00041388351204945534, "loss": 5.0742, "mean_token_accuracy": 0.20559915155172348, "num_tokens": 58879270.0, "step": 26375 }, { "entropy": 5.490208530426026, "epoch": 2.962767451002415, "grad_norm": 0.98828125, "learning_rate": 0.00041385192246483257, "loss": 5.1964, "mean_token_accuracy": 0.20113086551427842, "num_tokens": 58891861.0, "step": 26380 }, { "entropy": 5.446350622177124, "epoch": 2.9633290279103726, "grad_norm": 1.046875, "learning_rate": 0.00041382032845911073, "loss": 5.1607, "mean_token_accuracy": 0.2029400497674942, "num_tokens": 58903779.0, "step": 26385 }, { "entropy": 5.517849922180176, "epoch": 2.9638906048183298, "grad_norm": 0.9921875, "learning_rate": 0.00041378873003329575, "loss": 5.2115, "mean_token_accuracy": 0.20550186783075333, "num_tokens": 58915773.0, "step": 26390 }, { "entropy": 5.40208888053894, "epoch": 2.9644521817262874, "grad_norm": 1.1328125, "learning_rate": 0.0004137571271883938, "loss": 5.1084, "mean_token_accuracy": 0.20732554495334626, "num_tokens": 58926701.0, "step": 26395 }, { "entropy": 5.335906648635865, "epoch": 2.965013758634245, "grad_norm": 1.1015625, "learning_rate": 0.0004137255199254112, "loss": 5.0467, "mean_token_accuracy": 0.2102498471736908, "num_tokens": 58937606.0, "step": 26400 }, { "entropy": 5.440891361236572, "epoch": 2.9655753355422023, "grad_norm": 1.046875, "learning_rate": 0.00041369390824535417, "loss": 5.1936, "mean_token_accuracy": 0.20925533026456833, "num_tokens": 58948982.0, "step": 26405 }, { "entropy": 5.4642637252807615, "epoch": 2.96613691245016, "grad_norm": 0.96875, "learning_rate": 0.00041366229214922926, "loss": 5.1154, "mean_token_accuracy": 0.21148009449243546, "num_tokens": 58961607.0, "step": 26410 }, { "entropy": 5.35354585647583, "epoch": 2.9666984893581176, "grad_norm": 0.953125, "learning_rate": 0.0004136306716380432, "loss": 5.0923, "mean_token_accuracy": 0.20871664881706237, "num_tokens": 58973072.0, "step": 26415 }, { "entropy": 5.366648721694946, "epoch": 2.9672600662660753, "grad_norm": 1.0546875, "learning_rate": 0.00041359904671280285, "loss": 5.0914, "mean_token_accuracy": 0.2050260439515114, "num_tokens": 58983330.0, "step": 26420 }, { "entropy": 5.536860227584839, "epoch": 2.9678216431740325, "grad_norm": 1.046875, "learning_rate": 0.0004135674173745151, "loss": 5.2932, "mean_token_accuracy": 0.19546388387680053, "num_tokens": 58995912.0, "step": 26425 }, { "entropy": 5.533572149276734, "epoch": 2.96838322008199, "grad_norm": 1.1484375, "learning_rate": 0.00041353578362418695, "loss": 5.2463, "mean_token_accuracy": 0.20119615495204926, "num_tokens": 59005964.0, "step": 26430 }, { "entropy": 5.530998563766479, "epoch": 2.968944796989948, "grad_norm": 1.0859375, "learning_rate": 0.0004135041454628258, "loss": 5.2656, "mean_token_accuracy": 0.1933860018849373, "num_tokens": 59017285.0, "step": 26435 }, { "entropy": 5.316849994659424, "epoch": 2.9695063738979055, "grad_norm": 0.9921875, "learning_rate": 0.0004134725028914389, "loss": 5.0379, "mean_token_accuracy": 0.21500612199306487, "num_tokens": 59027751.0, "step": 26440 }, { "entropy": 5.412247991561889, "epoch": 2.9700679508058627, "grad_norm": 1.0703125, "learning_rate": 0.00041344085591103383, "loss": 5.2041, "mean_token_accuracy": 0.20224321037530898, "num_tokens": 59039568.0, "step": 26445 }, { "entropy": 5.441375303268432, "epoch": 2.9706295277138204, "grad_norm": 1.03125, "learning_rate": 0.0004134092045226182, "loss": 5.1332, "mean_token_accuracy": 0.20378589183092116, "num_tokens": 59051162.0, "step": 26450 }, { "entropy": 5.371971559524536, "epoch": 2.971191104621778, "grad_norm": 1.09375, "learning_rate": 0.00041337754872719984, "loss": 5.0214, "mean_token_accuracy": 0.21234232932329178, "num_tokens": 59061381.0, "step": 26455 }, { "entropy": 5.348218727111816, "epoch": 2.9717526815297353, "grad_norm": 1.109375, "learning_rate": 0.0004133458885257866, "loss": 5.0227, "mean_token_accuracy": 0.208959698677063, "num_tokens": 59071026.0, "step": 26460 }, { "entropy": 5.346969127655029, "epoch": 2.972314258437693, "grad_norm": 1.1171875, "learning_rate": 0.00041331422391938663, "loss": 5.0858, "mean_token_accuracy": 0.20463314950466155, "num_tokens": 59082793.0, "step": 26465 }, { "entropy": 5.543031501770019, "epoch": 2.9728758353456506, "grad_norm": 1.015625, "learning_rate": 0.0004132825549090082, "loss": 5.3085, "mean_token_accuracy": 0.20023994892835617, "num_tokens": 59094247.0, "step": 26470 }, { "entropy": 5.355016994476318, "epoch": 2.9734374122536082, "grad_norm": 1.0078125, "learning_rate": 0.0004132508814956595, "loss": 5.0812, "mean_token_accuracy": 0.20555794090032578, "num_tokens": 59104936.0, "step": 26475 }, { "entropy": 5.44595365524292, "epoch": 2.973998989161566, "grad_norm": 1.0078125, "learning_rate": 0.0004132192036803491, "loss": 5.1167, "mean_token_accuracy": 0.20822259336709975, "num_tokens": 59116181.0, "step": 26480 }, { "entropy": 5.305372047424316, "epoch": 2.974560566069523, "grad_norm": 1.046875, "learning_rate": 0.00041318752146408575, "loss": 5.0505, "mean_token_accuracy": 0.20972964614629747, "num_tokens": 59126953.0, "step": 26485 }, { "entropy": 5.3992119312286375, "epoch": 2.975122142977481, "grad_norm": 1.0, "learning_rate": 0.0004131558348478781, "loss": 5.2425, "mean_token_accuracy": 0.20022059679031373, "num_tokens": 59138460.0, "step": 26490 }, { "entropy": 5.518276214599609, "epoch": 2.9756837198854384, "grad_norm": 1.1171875, "learning_rate": 0.00041312414383273507, "loss": 5.1373, "mean_token_accuracy": 0.20661238431930543, "num_tokens": 59149003.0, "step": 26495 }, { "entropy": 5.462990808486938, "epoch": 2.9762452967933957, "grad_norm": 0.9921875, "learning_rate": 0.00041309244841966565, "loss": 5.1416, "mean_token_accuracy": 0.20664554685354233, "num_tokens": 59160582.0, "step": 26500 }, { "entropy": 5.440999698638916, "epoch": 2.9768068737013533, "grad_norm": 0.96875, "learning_rate": 0.00041306074860967916, "loss": 5.2259, "mean_token_accuracy": 0.19604205191135407, "num_tokens": 59172115.0, "step": 26505 }, { "entropy": 5.388048839569092, "epoch": 2.977368450609311, "grad_norm": 1.109375, "learning_rate": 0.00041302904440378494, "loss": 5.0687, "mean_token_accuracy": 0.20857212990522384, "num_tokens": 59183044.0, "step": 26510 }, { "entropy": 5.497510719299316, "epoch": 2.9779300275172687, "grad_norm": 1.0859375, "learning_rate": 0.00041299733580299236, "loss": 5.2497, "mean_token_accuracy": 0.19283446818590164, "num_tokens": 59194791.0, "step": 26515 }, { "entropy": 5.354038190841675, "epoch": 2.978491604425226, "grad_norm": 1.0390625, "learning_rate": 0.00041296562280831106, "loss": 5.0899, "mean_token_accuracy": 0.20381662100553513, "num_tokens": 59206285.0, "step": 26520 }, { "entropy": 5.453002834320069, "epoch": 2.9790531813331835, "grad_norm": 1.078125, "learning_rate": 0.00041293390542075095, "loss": 5.2027, "mean_token_accuracy": 0.1985051915049553, "num_tokens": 59217906.0, "step": 26525 }, { "entropy": 5.442254495620728, "epoch": 2.979614758241141, "grad_norm": 1.046875, "learning_rate": 0.0004129021836413217, "loss": 5.1732, "mean_token_accuracy": 0.2017549991607666, "num_tokens": 59228163.0, "step": 26530 }, { "entropy": 5.3813752174377445, "epoch": 2.980176335149099, "grad_norm": 1.078125, "learning_rate": 0.0004128704574710334, "loss": 5.1395, "mean_token_accuracy": 0.20656674802303315, "num_tokens": 59238633.0, "step": 26535 }, { "entropy": 5.463999032974243, "epoch": 2.980737912057056, "grad_norm": 1.1171875, "learning_rate": 0.0004128387269108963, "loss": 5.1628, "mean_token_accuracy": 0.19960794299840928, "num_tokens": 59249523.0, "step": 26540 }, { "entropy": 5.48050217628479, "epoch": 2.9812994889650137, "grad_norm": 1.0, "learning_rate": 0.00041280699196192074, "loss": 5.2325, "mean_token_accuracy": 0.1989982932806015, "num_tokens": 59259636.0, "step": 26545 }, { "entropy": 5.420747709274292, "epoch": 2.9818610658729714, "grad_norm": 1.015625, "learning_rate": 0.00041277525262511705, "loss": 5.1549, "mean_token_accuracy": 0.20476855784654618, "num_tokens": 59270963.0, "step": 26550 }, { "entropy": 5.47378191947937, "epoch": 2.9824226427809286, "grad_norm": 1.0390625, "learning_rate": 0.00041274350890149584, "loss": 5.2243, "mean_token_accuracy": 0.2068357452750206, "num_tokens": 59282085.0, "step": 26555 }, { "entropy": 5.520145082473755, "epoch": 2.9829842196888863, "grad_norm": 1.0546875, "learning_rate": 0.000412711760792068, "loss": 5.1793, "mean_token_accuracy": 0.2068144276738167, "num_tokens": 59292210.0, "step": 26560 }, { "entropy": 5.418028020858765, "epoch": 2.983545796596844, "grad_norm": 1.140625, "learning_rate": 0.0004126800082978442, "loss": 5.1875, "mean_token_accuracy": 0.20605515092611312, "num_tokens": 59303727.0, "step": 26565 }, { "entropy": 5.402276563644409, "epoch": 2.9841073735048016, "grad_norm": 1.0625, "learning_rate": 0.00041264825141983547, "loss": 5.0929, "mean_token_accuracy": 0.20997599512338638, "num_tokens": 59313922.0, "step": 26570 }, { "entropy": 5.392837190628052, "epoch": 2.9846689504127593, "grad_norm": 1.0, "learning_rate": 0.00041261649015905314, "loss": 5.113, "mean_token_accuracy": 0.20775419175624849, "num_tokens": 59324974.0, "step": 26575 }, { "entropy": 5.473950481414795, "epoch": 2.9852305273207165, "grad_norm": 1.1171875, "learning_rate": 0.0004125847245165084, "loss": 5.1666, "mean_token_accuracy": 0.19924530237913132, "num_tokens": 59335538.0, "step": 26580 }, { "entropy": 5.475880193710327, "epoch": 2.985792104228674, "grad_norm": 0.9921875, "learning_rate": 0.0004125529544932126, "loss": 5.2309, "mean_token_accuracy": 0.2036566212773323, "num_tokens": 59347116.0, "step": 26585 }, { "entropy": 5.470913124084473, "epoch": 2.986353681136632, "grad_norm": 1.0625, "learning_rate": 0.0004125211800901774, "loss": 5.1472, "mean_token_accuracy": 0.20641808062791825, "num_tokens": 59358505.0, "step": 26590 }, { "entropy": 5.3709053039550785, "epoch": 2.986915258044589, "grad_norm": 0.9921875, "learning_rate": 0.0004124894013084145, "loss": 5.074, "mean_token_accuracy": 0.21068450957536697, "num_tokens": 59369897.0, "step": 26595 }, { "entropy": 5.3752206325531, "epoch": 2.9874768349525467, "grad_norm": 1.0, "learning_rate": 0.00041245761814893576, "loss": 5.1521, "mean_token_accuracy": 0.20931680500507355, "num_tokens": 59381372.0, "step": 26600 }, { "entropy": 5.406676340103149, "epoch": 2.9880384118605043, "grad_norm": 1.1171875, "learning_rate": 0.0004124258306127531, "loss": 5.1004, "mean_token_accuracy": 0.20757926553487777, "num_tokens": 59391543.0, "step": 26605 }, { "entropy": 5.504978847503662, "epoch": 2.988599988768462, "grad_norm": 1.0390625, "learning_rate": 0.0004123940387008787, "loss": 5.205, "mean_token_accuracy": 0.20452597588300706, "num_tokens": 59402474.0, "step": 26610 }, { "entropy": 5.399457311630249, "epoch": 2.9891615656764197, "grad_norm": 1.28125, "learning_rate": 0.0004123622424143248, "loss": 5.09, "mean_token_accuracy": 0.20751651376485825, "num_tokens": 59413970.0, "step": 26615 }, { "entropy": 5.348721599578857, "epoch": 2.989723142584377, "grad_norm": 1.03125, "learning_rate": 0.00041233044175410387, "loss": 5.0866, "mean_token_accuracy": 0.2083508014678955, "num_tokens": 59424958.0, "step": 26620 }, { "entropy": 5.465299272537232, "epoch": 2.9902847194923345, "grad_norm": 0.98828125, "learning_rate": 0.00041229863672122844, "loss": 5.1563, "mean_token_accuracy": 0.2053896278142929, "num_tokens": 59436226.0, "step": 26625 }, { "entropy": 5.5227179527282715, "epoch": 2.990846296400292, "grad_norm": 1.4765625, "learning_rate": 0.0004122668273167111, "loss": 5.2417, "mean_token_accuracy": 0.1991884171962738, "num_tokens": 59447607.0, "step": 26630 }, { "entropy": 5.340977048873901, "epoch": 2.9914078733082494, "grad_norm": 1.03125, "learning_rate": 0.0004122350135415648, "loss": 5.0125, "mean_token_accuracy": 0.21271868348121642, "num_tokens": 59458120.0, "step": 26635 }, { "entropy": 5.425700378417969, "epoch": 2.991969450216207, "grad_norm": 1.0859375, "learning_rate": 0.0004122031953968024, "loss": 5.1822, "mean_token_accuracy": 0.20534602850675582, "num_tokens": 59468646.0, "step": 26640 }, { "entropy": 5.4211506843566895, "epoch": 2.9925310271241647, "grad_norm": 1.0390625, "learning_rate": 0.00041217137288343704, "loss": 5.1524, "mean_token_accuracy": 0.20261449813842775, "num_tokens": 59478887.0, "step": 26645 }, { "entropy": 5.445552968978882, "epoch": 2.993092604032122, "grad_norm": 1.2109375, "learning_rate": 0.000412139546002482, "loss": 5.1825, "mean_token_accuracy": 0.2055753469467163, "num_tokens": 59490501.0, "step": 26650 }, { "entropy": 5.453135776519775, "epoch": 2.9936541809400796, "grad_norm": 1.109375, "learning_rate": 0.00041210771475495064, "loss": 5.2553, "mean_token_accuracy": 0.19832976311445236, "num_tokens": 59500873.0, "step": 26655 }, { "entropy": 5.377845764160156, "epoch": 2.9942157578480373, "grad_norm": 1.0078125, "learning_rate": 0.0004120758791418564, "loss": 5.0699, "mean_token_accuracy": 0.20698791295289992, "num_tokens": 59511793.0, "step": 26660 }, { "entropy": 5.450450420379639, "epoch": 2.994777334755995, "grad_norm": 1.1171875, "learning_rate": 0.0004120440391642131, "loss": 5.2154, "mean_token_accuracy": 0.19895641058683394, "num_tokens": 59523978.0, "step": 26665 }, { "entropy": 5.4931426525115965, "epoch": 2.9953389116639526, "grad_norm": 1.03125, "learning_rate": 0.0004120121948230343, "loss": 5.2236, "mean_token_accuracy": 0.20332878530025483, "num_tokens": 59534575.0, "step": 26670 }, { "entropy": 5.4301379203796385, "epoch": 2.99590048857191, "grad_norm": 1.0625, "learning_rate": 0.0004119803461193342, "loss": 5.1725, "mean_token_accuracy": 0.19445961713790894, "num_tokens": 59545542.0, "step": 26675 }, { "entropy": 5.407687568664551, "epoch": 2.9964620654798675, "grad_norm": 0.98828125, "learning_rate": 0.0004119484930541267, "loss": 5.125, "mean_token_accuracy": 0.21505854278802872, "num_tokens": 59556482.0, "step": 26680 }, { "entropy": 5.454925394058227, "epoch": 2.997023642387825, "grad_norm": 1.0, "learning_rate": 0.00041191663562842605, "loss": 5.1403, "mean_token_accuracy": 0.20555537194013596, "num_tokens": 59568941.0, "step": 26685 }, { "entropy": 5.425735378265381, "epoch": 2.9975852192957824, "grad_norm": 1.0703125, "learning_rate": 0.0004118847738432467, "loss": 5.2084, "mean_token_accuracy": 0.19801675975322724, "num_tokens": 59579690.0, "step": 26690 }, { "entropy": 5.448099660873413, "epoch": 2.99814679620374, "grad_norm": 0.99609375, "learning_rate": 0.0004118529076996029, "loss": 5.1752, "mean_token_accuracy": 0.20091814994812013, "num_tokens": 59589831.0, "step": 26695 }, { "entropy": 5.40655927658081, "epoch": 2.9987083731116977, "grad_norm": 1.1015625, "learning_rate": 0.00041182103719850967, "loss": 5.1333, "mean_token_accuracy": 0.20042402297258377, "num_tokens": 59600939.0, "step": 26700 }, { "entropy": 5.327128887176514, "epoch": 2.9992699500196554, "grad_norm": 0.953125, "learning_rate": 0.00041178916234098134, "loss": 5.0121, "mean_token_accuracy": 0.20884857028722764, "num_tokens": 59612084.0, "step": 26705 }, { "entropy": 5.431169271469116, "epoch": 2.999831526927613, "grad_norm": 0.9921875, "learning_rate": 0.0004117572831280332, "loss": 5.1714, "mean_token_accuracy": 0.1992751881480217, "num_tokens": 59624359.0, "step": 26710 }, { "entropy": 5.526124954223633, "epoch": 3.0003369461447744, "grad_norm": 1.078125, "learning_rate": 0.00041172539956068, "loss": 5.1564, "mean_token_accuracy": 0.20234054492579567, "num_tokens": 59633030.0, "step": 26715 }, { "entropy": 5.324075937271118, "epoch": 3.000898523052732, "grad_norm": 1.0, "learning_rate": 0.00041169351163993705, "loss": 5.0254, "mean_token_accuracy": 0.20862768590450287, "num_tokens": 59644107.0, "step": 26720 }, { "entropy": 5.323019647598267, "epoch": 3.0014600999606897, "grad_norm": 1.0546875, "learning_rate": 0.00041166161936681973, "loss": 4.9294, "mean_token_accuracy": 0.21860850602388382, "num_tokens": 59654166.0, "step": 26725 }, { "entropy": 5.3719439029693605, "epoch": 3.002021676868647, "grad_norm": 0.9921875, "learning_rate": 0.0004116297227423435, "loss": 5.0493, "mean_token_accuracy": 0.2064652293920517, "num_tokens": 59664785.0, "step": 26730 }, { "entropy": 5.283218574523926, "epoch": 3.0025832537766046, "grad_norm": 1.09375, "learning_rate": 0.00041159782176752375, "loss": 4.9716, "mean_token_accuracy": 0.22047033607959748, "num_tokens": 59675634.0, "step": 26735 }, { "entropy": 5.421010875701905, "epoch": 3.0031448306845623, "grad_norm": 0.953125, "learning_rate": 0.0004115659164433765, "loss": 5.1035, "mean_token_accuracy": 0.21313134729862213, "num_tokens": 59687636.0, "step": 26740 }, { "entropy": 5.452748203277588, "epoch": 3.00370640759252, "grad_norm": 0.97265625, "learning_rate": 0.00041153400677091745, "loss": 5.0731, "mean_token_accuracy": 0.20327839851379395, "num_tokens": 59700389.0, "step": 26745 }, { "entropy": 5.352976274490357, "epoch": 3.004267984500477, "grad_norm": 1.015625, "learning_rate": 0.00041150209275116266, "loss": 4.9969, "mean_token_accuracy": 0.21862302124500274, "num_tokens": 59710898.0, "step": 26750 }, { "entropy": 5.407136392593384, "epoch": 3.004829561408435, "grad_norm": 1.171875, "learning_rate": 0.00041147017438512834, "loss": 5.0815, "mean_token_accuracy": 0.20468493551015854, "num_tokens": 59722398.0, "step": 26755 }, { "entropy": 5.366084861755371, "epoch": 3.0053911383163925, "grad_norm": 1.0390625, "learning_rate": 0.00041143825167383073, "loss": 5.0675, "mean_token_accuracy": 0.20729355067014693, "num_tokens": 59732504.0, "step": 26760 }, { "entropy": 5.421009969711304, "epoch": 3.00595271522435, "grad_norm": 0.96875, "learning_rate": 0.0004114063246182863, "loss": 5.0787, "mean_token_accuracy": 0.21264821588993071, "num_tokens": 59742919.0, "step": 26765 }, { "entropy": 5.397217416763306, "epoch": 3.0065142921323074, "grad_norm": 1.0234375, "learning_rate": 0.00041137439321951147, "loss": 5.0899, "mean_token_accuracy": 0.20624478459358214, "num_tokens": 59754316.0, "step": 26770 }, { "entropy": 5.434725952148438, "epoch": 3.007075869040265, "grad_norm": 1.09375, "learning_rate": 0.00041134245747852314, "loss": 5.149, "mean_token_accuracy": 0.20038966089487076, "num_tokens": 59765031.0, "step": 26775 }, { "entropy": 5.414833688735962, "epoch": 3.0076374459482227, "grad_norm": 0.98828125, "learning_rate": 0.0004113105173963382, "loss": 5.0869, "mean_token_accuracy": 0.20650243759155273, "num_tokens": 59776338.0, "step": 26780 }, { "entropy": 5.422388648986816, "epoch": 3.0081990228561803, "grad_norm": 1.0703125, "learning_rate": 0.0004112785729739733, "loss": 5.0609, "mean_token_accuracy": 0.21055942475795747, "num_tokens": 59788544.0, "step": 26785 }, { "entropy": 5.373544216156006, "epoch": 3.0087605997641376, "grad_norm": 1.078125, "learning_rate": 0.00041124662421244593, "loss": 5.0287, "mean_token_accuracy": 0.20555375814437865, "num_tokens": 59800131.0, "step": 26790 }, { "entropy": 5.4171277523040775, "epoch": 3.0093221766720952, "grad_norm": 0.984375, "learning_rate": 0.0004112146711127732, "loss": 5.0819, "mean_token_accuracy": 0.21017909348011016, "num_tokens": 59811986.0, "step": 26795 }, { "entropy": 5.477831649780273, "epoch": 3.009883753580053, "grad_norm": 1.015625, "learning_rate": 0.0004111827136759725, "loss": 5.1226, "mean_token_accuracy": 0.20790442824363708, "num_tokens": 59824758.0, "step": 26800 }, { "entropy": 5.302941131591797, "epoch": 3.0104453304880106, "grad_norm": 1.0390625, "learning_rate": 0.0004111507519030613, "loss": 5.0368, "mean_token_accuracy": 0.20788172632455826, "num_tokens": 59836317.0, "step": 26805 }, { "entropy": 5.403493452072143, "epoch": 3.0110069073959678, "grad_norm": 1.0234375, "learning_rate": 0.0004111187857950574, "loss": 5.1235, "mean_token_accuracy": 0.20668591260910035, "num_tokens": 59847743.0, "step": 26810 }, { "entropy": 5.439643335342407, "epoch": 3.0115684843039254, "grad_norm": 0.99609375, "learning_rate": 0.0004110868153529786, "loss": 5.0758, "mean_token_accuracy": 0.21108705103397368, "num_tokens": 59859442.0, "step": 26815 }, { "entropy": 5.327371120452881, "epoch": 3.012130061211883, "grad_norm": 0.9921875, "learning_rate": 0.0004110548405778428, "loss": 4.9989, "mean_token_accuracy": 0.21206795573234558, "num_tokens": 59869949.0, "step": 26820 }, { "entropy": 5.331804513931274, "epoch": 3.0126916381198403, "grad_norm": 1.03125, "learning_rate": 0.0004110228614706681, "loss": 5.0324, "mean_token_accuracy": 0.21683990508317946, "num_tokens": 59881818.0, "step": 26825 }, { "entropy": 5.396168851852417, "epoch": 3.013253215027798, "grad_norm": 1.1015625, "learning_rate": 0.00041099087803247276, "loss": 4.9921, "mean_token_accuracy": 0.20632669180631638, "num_tokens": 59893152.0, "step": 26830 }, { "entropy": 5.450803136825561, "epoch": 3.0138147919357556, "grad_norm": 0.98828125, "learning_rate": 0.0004109588902642751, "loss": 5.1509, "mean_token_accuracy": 0.19558384418487548, "num_tokens": 59904082.0, "step": 26835 }, { "entropy": 5.380934238433838, "epoch": 3.0143763688437133, "grad_norm": 1.0078125, "learning_rate": 0.0004109268981670936, "loss": 5.0856, "mean_token_accuracy": 0.21097348332405091, "num_tokens": 59916116.0, "step": 26840 }, { "entropy": 5.271137762069702, "epoch": 3.0149379457516705, "grad_norm": 1.03125, "learning_rate": 0.000410894901741947, "loss": 4.9479, "mean_token_accuracy": 0.2152872383594513, "num_tokens": 59926399.0, "step": 26845 }, { "entropy": 5.357283020019532, "epoch": 3.015499522659628, "grad_norm": 1.046875, "learning_rate": 0.000410862900989854, "loss": 5.0476, "mean_token_accuracy": 0.21239547431468964, "num_tokens": 59936986.0, "step": 26850 }, { "entropy": 5.480962800979614, "epoch": 3.016061099567586, "grad_norm": 1.09375, "learning_rate": 0.0004108308959118336, "loss": 5.1264, "mean_token_accuracy": 0.1977434828877449, "num_tokens": 59948926.0, "step": 26855 }, { "entropy": 5.373425483703613, "epoch": 3.0166226764755435, "grad_norm": 1.046875, "learning_rate": 0.0004107988865089047, "loss": 4.9913, "mean_token_accuracy": 0.21494581550359726, "num_tokens": 59960468.0, "step": 26860 }, { "entropy": 5.400493049621582, "epoch": 3.0171842533835007, "grad_norm": 1.015625, "learning_rate": 0.00041076687278208664, "loss": 5.066, "mean_token_accuracy": 0.20581958442926407, "num_tokens": 59971151.0, "step": 26865 }, { "entropy": 5.367842340469361, "epoch": 3.0177458302914584, "grad_norm": 1.0234375, "learning_rate": 0.0004107348547323987, "loss": 4.9896, "mean_token_accuracy": 0.2123366117477417, "num_tokens": 59982205.0, "step": 26870 }, { "entropy": 5.36891736984253, "epoch": 3.018307407199416, "grad_norm": 0.96875, "learning_rate": 0.00041070283236086024, "loss": 5.0158, "mean_token_accuracy": 0.2128363236784935, "num_tokens": 59993612.0, "step": 26875 }, { "entropy": 5.477448320388794, "epoch": 3.0188689841073737, "grad_norm": 1.0390625, "learning_rate": 0.0004106708056684911, "loss": 5.1867, "mean_token_accuracy": 0.20023497492074965, "num_tokens": 60004284.0, "step": 26880 }, { "entropy": 5.4639973640441895, "epoch": 3.019430561015331, "grad_norm": 0.95703125, "learning_rate": 0.00041063877465631084, "loss": 5.1721, "mean_token_accuracy": 0.19982555359601975, "num_tokens": 60016276.0, "step": 26885 }, { "entropy": 5.36993260383606, "epoch": 3.0199921379232886, "grad_norm": 1.046875, "learning_rate": 0.0004106067393253394, "loss": 5.0942, "mean_token_accuracy": 0.2127436712384224, "num_tokens": 60029155.0, "step": 26890 }, { "entropy": 5.37736873626709, "epoch": 3.0205537148312462, "grad_norm": 1.0859375, "learning_rate": 0.0004105746996765968, "loss": 5.0632, "mean_token_accuracy": 0.20029204934835435, "num_tokens": 60041042.0, "step": 26895 }, { "entropy": 5.483259868621826, "epoch": 3.021115291739204, "grad_norm": 0.9921875, "learning_rate": 0.0004105426557111031, "loss": 5.1109, "mean_token_accuracy": 0.20519065111875534, "num_tokens": 60052025.0, "step": 26900 }, { "entropy": 5.388881635665894, "epoch": 3.021676868647161, "grad_norm": 0.9765625, "learning_rate": 0.0004105106074298787, "loss": 5.053, "mean_token_accuracy": 0.21102722287178038, "num_tokens": 60063260.0, "step": 26905 }, { "entropy": 5.3546959400177006, "epoch": 3.022238445555119, "grad_norm": 1.046875, "learning_rate": 0.000410478554833944, "loss": 5.0987, "mean_token_accuracy": 0.20078408122062683, "num_tokens": 60074721.0, "step": 26910 }, { "entropy": 5.369453048706054, "epoch": 3.0228000224630764, "grad_norm": 1.109375, "learning_rate": 0.00041044649792431963, "loss": 5.0223, "mean_token_accuracy": 0.21459574550390242, "num_tokens": 60085028.0, "step": 26915 }, { "entropy": 5.345967245101929, "epoch": 3.0233615993710337, "grad_norm": 1.078125, "learning_rate": 0.00041041443670202616, "loss": 4.9129, "mean_token_accuracy": 0.21686313599348067, "num_tokens": 60095587.0, "step": 26920 }, { "entropy": 5.328643560409546, "epoch": 3.0239231762789913, "grad_norm": 1.046875, "learning_rate": 0.0004103823711680846, "loss": 4.9378, "mean_token_accuracy": 0.215905624628067, "num_tokens": 60106574.0, "step": 26925 }, { "entropy": 5.300217485427856, "epoch": 3.024484753186949, "grad_norm": 1.0546875, "learning_rate": 0.00041035030132351575, "loss": 4.9694, "mean_token_accuracy": 0.21330203413963317, "num_tokens": 60116821.0, "step": 26930 }, { "entropy": 5.407117080688477, "epoch": 3.0250463300949066, "grad_norm": 1.03125, "learning_rate": 0.00041031822716934086, "loss": 5.1146, "mean_token_accuracy": 0.20793962031602858, "num_tokens": 60128229.0, "step": 26935 }, { "entropy": 5.395570611953735, "epoch": 3.025607907002864, "grad_norm": 1.0078125, "learning_rate": 0.00041028614870658106, "loss": 5.0235, "mean_token_accuracy": 0.20196650177240372, "num_tokens": 60139416.0, "step": 26940 }, { "entropy": 5.373397588729858, "epoch": 3.0261694839108215, "grad_norm": 1.109375, "learning_rate": 0.0004102540659362579, "loss": 5.013, "mean_token_accuracy": 0.21117731630802156, "num_tokens": 60150225.0, "step": 26945 }, { "entropy": 5.337496662139893, "epoch": 3.026731060818779, "grad_norm": 1.0, "learning_rate": 0.00041022197885939285, "loss": 4.9587, "mean_token_accuracy": 0.20414439141750335, "num_tokens": 60160065.0, "step": 26950 }, { "entropy": 5.389242172241211, "epoch": 3.027292637726737, "grad_norm": 1.0703125, "learning_rate": 0.00041018988747700745, "loss": 5.0466, "mean_token_accuracy": 0.2205623283982277, "num_tokens": 60170396.0, "step": 26955 }, { "entropy": 5.345180559158325, "epoch": 3.027854214634694, "grad_norm": 0.94921875, "learning_rate": 0.0004101577917901236, "loss": 5.0456, "mean_token_accuracy": 0.20904203057289122, "num_tokens": 60181938.0, "step": 26960 }, { "entropy": 5.380049037933349, "epoch": 3.0284157915426517, "grad_norm": 1.0703125, "learning_rate": 0.00041012569179976326, "loss": 5.0055, "mean_token_accuracy": 0.20925343930721282, "num_tokens": 60192388.0, "step": 26965 }, { "entropy": 5.447871303558349, "epoch": 3.0289773684506094, "grad_norm": 1.0390625, "learning_rate": 0.0004100935875069485, "loss": 5.0828, "mean_token_accuracy": 0.20731501430273055, "num_tokens": 60203195.0, "step": 26970 }, { "entropy": 5.365634632110596, "epoch": 3.029538945358567, "grad_norm": 1.0703125, "learning_rate": 0.0004100614789127015, "loss": 5.1047, "mean_token_accuracy": 0.20791214555501938, "num_tokens": 60213659.0, "step": 26975 }, { "entropy": 5.3228692531585695, "epoch": 3.0301005222665243, "grad_norm": 0.9375, "learning_rate": 0.0004100293660180447, "loss": 5.0621, "mean_token_accuracy": 0.20935701578855515, "num_tokens": 60224795.0, "step": 26980 }, { "entropy": 5.3245758533477785, "epoch": 3.030662099174482, "grad_norm": 1.1171875, "learning_rate": 0.00040999724882400046, "loss": 4.9377, "mean_token_accuracy": 0.21754882037639617, "num_tokens": 60236188.0, "step": 26985 }, { "entropy": 5.379591178894043, "epoch": 3.0312236760824396, "grad_norm": 1.03125, "learning_rate": 0.0004099651273315915, "loss": 5.0531, "mean_token_accuracy": 0.20981260091066362, "num_tokens": 60247003.0, "step": 26990 }, { "entropy": 5.356689357757569, "epoch": 3.0317852529903973, "grad_norm": 0.9765625, "learning_rate": 0.0004099330015418405, "loss": 5.0553, "mean_token_accuracy": 0.20446816384792327, "num_tokens": 60258317.0, "step": 26995 }, { "entropy": 5.456135177612305, "epoch": 3.0323468298983545, "grad_norm": 0.97265625, "learning_rate": 0.00040990087145577044, "loss": 5.0644, "mean_token_accuracy": 0.213719180226326, "num_tokens": 60269000.0, "step": 27000 }, { "epoch": 3.0323468298983545, "eval_entropy": 5.22835329423284, "eval_loss": 5.234411239624023, "eval_mean_token_accuracy": 0.20840384364550896, "eval_num_tokens": 60269000.0, "eval_runtime": 23.863, "eval_samples_per_second": 1299.627, "eval_steps_per_second": 162.469, "step": 27000 }, { "entropy": 5.31757116317749, "epoch": 3.032908406806312, "grad_norm": 1.3203125, "learning_rate": 0.0004098687370744042, "loss": 4.9534, "mean_token_accuracy": 0.21355899572372436, "num_tokens": 60280411.0, "step": 27005 }, { "entropy": 5.3899437427520756, "epoch": 3.03346998371427, "grad_norm": 1.0546875, "learning_rate": 0.0004098365983987652, "loss": 5.1123, "mean_token_accuracy": 0.19954788833856582, "num_tokens": 60290197.0, "step": 27010 }, { "entropy": 5.47722110748291, "epoch": 3.034031560622227, "grad_norm": 0.98828125, "learning_rate": 0.00040980445542987653, "loss": 4.995, "mean_token_accuracy": 0.21232680678367616, "num_tokens": 60300927.0, "step": 27015 }, { "entropy": 5.35021743774414, "epoch": 3.0345931375301847, "grad_norm": 0.94921875, "learning_rate": 0.00040977230816876176, "loss": 4.9868, "mean_token_accuracy": 0.21355928778648375, "num_tokens": 60312697.0, "step": 27020 }, { "entropy": 5.26846342086792, "epoch": 3.0351547144381423, "grad_norm": 1.15625, "learning_rate": 0.00040974015661644433, "loss": 4.9305, "mean_token_accuracy": 0.2186899110674858, "num_tokens": 60323779.0, "step": 27025 }, { "entropy": 5.371620082855225, "epoch": 3.0357162913461, "grad_norm": 1.0859375, "learning_rate": 0.0004097080007739481, "loss": 5.0667, "mean_token_accuracy": 0.20789124369621276, "num_tokens": 60335036.0, "step": 27030 }, { "entropy": 5.352286720275879, "epoch": 3.036277868254057, "grad_norm": 1.1796875, "learning_rate": 0.00040967584064229695, "loss": 5.0377, "mean_token_accuracy": 0.20215086340904237, "num_tokens": 60345600.0, "step": 27035 }, { "entropy": 5.467558145523071, "epoch": 3.036839445162015, "grad_norm": 0.94921875, "learning_rate": 0.00040964367622251473, "loss": 5.1063, "mean_token_accuracy": 0.20349147468805312, "num_tokens": 60357241.0, "step": 27040 }, { "entropy": 5.3810282230377195, "epoch": 3.0374010220699725, "grad_norm": 1.0078125, "learning_rate": 0.0004096115075156257, "loss": 5.0298, "mean_token_accuracy": 0.20575074553489686, "num_tokens": 60369036.0, "step": 27045 }, { "entropy": 5.4619745254516605, "epoch": 3.03796259897793, "grad_norm": 1.015625, "learning_rate": 0.0004095793345226541, "loss": 5.1619, "mean_token_accuracy": 0.20736043602228166, "num_tokens": 60380310.0, "step": 27050 }, { "entropy": 5.382735967636108, "epoch": 3.0385241758858874, "grad_norm": 0.92578125, "learning_rate": 0.0004095471572446242, "loss": 4.9534, "mean_token_accuracy": 0.21890883445739745, "num_tokens": 60390962.0, "step": 27055 }, { "entropy": 5.467870092391967, "epoch": 3.039085752793845, "grad_norm": 0.98828125, "learning_rate": 0.0004095149756825606, "loss": 5.0813, "mean_token_accuracy": 0.21038102656602858, "num_tokens": 60400342.0, "step": 27060 }, { "entropy": 5.3418288230896, "epoch": 3.0396473297018027, "grad_norm": 0.98828125, "learning_rate": 0.0004094827898374881, "loss": 5.006, "mean_token_accuracy": 0.2114434450864792, "num_tokens": 60411921.0, "step": 27065 }, { "entropy": 5.499903392791748, "epoch": 3.0402089066097604, "grad_norm": 1.015625, "learning_rate": 0.0004094505997104314, "loss": 5.1556, "mean_token_accuracy": 0.2031136706471443, "num_tokens": 60424185.0, "step": 27070 }, { "entropy": 5.234940910339356, "epoch": 3.0407704835177176, "grad_norm": 1.234375, "learning_rate": 0.00040941840530241537, "loss": 4.9505, "mean_token_accuracy": 0.212970469892025, "num_tokens": 60433729.0, "step": 27075 }, { "entropy": 5.4151482582092285, "epoch": 3.0413320604256753, "grad_norm": 1.328125, "learning_rate": 0.00040938620661446526, "loss": 5.1072, "mean_token_accuracy": 0.2074386328458786, "num_tokens": 60443846.0, "step": 27080 }, { "entropy": 5.437692594528198, "epoch": 3.041893637333633, "grad_norm": 1.0, "learning_rate": 0.0004093540036476062, "loss": 5.0961, "mean_token_accuracy": 0.20617983788251876, "num_tokens": 60455183.0, "step": 27085 }, { "entropy": 5.333357095718384, "epoch": 3.0424552142415906, "grad_norm": 1.0546875, "learning_rate": 0.00040932179640286356, "loss": 5.0328, "mean_token_accuracy": 0.20447436720132828, "num_tokens": 60465769.0, "step": 27090 }, { "entropy": 5.367208814620971, "epoch": 3.043016791149548, "grad_norm": 1.078125, "learning_rate": 0.0004092895848812628, "loss": 4.9248, "mean_token_accuracy": 0.21281246542930604, "num_tokens": 60476252.0, "step": 27095 }, { "entropy": 5.354694128036499, "epoch": 3.0435783680575055, "grad_norm": 1.0078125, "learning_rate": 0.00040925736908382953, "loss": 5.0392, "mean_token_accuracy": 0.21310027539730073, "num_tokens": 60485939.0, "step": 27100 }, { "entropy": 5.310129404067993, "epoch": 3.044139944965463, "grad_norm": 0.98046875, "learning_rate": 0.0004092251490115896, "loss": 5.0649, "mean_token_accuracy": 0.20587736070156099, "num_tokens": 60497994.0, "step": 27105 }, { "entropy": 5.578674697875977, "epoch": 3.0447015218734204, "grad_norm": 1.1015625, "learning_rate": 0.00040919292466556895, "loss": 5.2031, "mean_token_accuracy": 0.20687660723924636, "num_tokens": 60508944.0, "step": 27110 }, { "entropy": 5.471115207672119, "epoch": 3.045263098781378, "grad_norm": 0.98828125, "learning_rate": 0.0004091606960467934, "loss": 5.1173, "mean_token_accuracy": 0.21451826393604279, "num_tokens": 60519928.0, "step": 27115 }, { "entropy": 5.378223657608032, "epoch": 3.0458246756893357, "grad_norm": 1.1171875, "learning_rate": 0.00040912846315628934, "loss": 4.9984, "mean_token_accuracy": 0.21164528876543046, "num_tokens": 60530417.0, "step": 27120 }, { "entropy": 5.354965496063232, "epoch": 3.0463862525972933, "grad_norm": 1.0, "learning_rate": 0.000409096225995083, "loss": 5.1058, "mean_token_accuracy": 0.20679617077112197, "num_tokens": 60542140.0, "step": 27125 }, { "entropy": 5.358968734741211, "epoch": 3.0469478295052506, "grad_norm": 1.0078125, "learning_rate": 0.00040906398456420077, "loss": 4.9903, "mean_token_accuracy": 0.21610727161169052, "num_tokens": 60553032.0, "step": 27130 }, { "entropy": 5.406117153167725, "epoch": 3.047509406413208, "grad_norm": 1.0546875, "learning_rate": 0.00040903173886466934, "loss": 5.1095, "mean_token_accuracy": 0.21434491723775864, "num_tokens": 60563773.0, "step": 27135 }, { "entropy": 5.321988534927368, "epoch": 3.048070983321166, "grad_norm": 1.0703125, "learning_rate": 0.00040899948889751525, "loss": 4.9798, "mean_token_accuracy": 0.21136685609817504, "num_tokens": 60574354.0, "step": 27140 }, { "entropy": 5.416130876541137, "epoch": 3.0486325602291235, "grad_norm": 1.1875, "learning_rate": 0.00040896723466376557, "loss": 5.0284, "mean_token_accuracy": 0.21526232063770295, "num_tokens": 60584760.0, "step": 27145 }, { "entropy": 5.215230417251587, "epoch": 3.0491941371370808, "grad_norm": 1.0546875, "learning_rate": 0.00040893497616444714, "loss": 4.912, "mean_token_accuracy": 0.22041582465171813, "num_tokens": 60595322.0, "step": 27150 }, { "entropy": 5.486225605010986, "epoch": 3.0497557140450384, "grad_norm": 1.0078125, "learning_rate": 0.0004089027134005871, "loss": 5.2162, "mean_token_accuracy": 0.19851610958576202, "num_tokens": 60607897.0, "step": 27155 }, { "entropy": 5.333057832717896, "epoch": 3.050317290952996, "grad_norm": 0.99609375, "learning_rate": 0.0004088704463732127, "loss": 5.0182, "mean_token_accuracy": 0.2097821593284607, "num_tokens": 60618882.0, "step": 27160 }, { "entropy": 5.380187511444092, "epoch": 3.0508788678609537, "grad_norm": 1.1171875, "learning_rate": 0.0004088381750833514, "loss": 5.0777, "mean_token_accuracy": 0.20405630618333817, "num_tokens": 60630431.0, "step": 27165 }, { "entropy": 5.481782484054565, "epoch": 3.051440444768911, "grad_norm": 1.1953125, "learning_rate": 0.0004088058995320307, "loss": 5.109, "mean_token_accuracy": 0.20438822358846664, "num_tokens": 60642479.0, "step": 27170 }, { "entropy": 5.358634424209595, "epoch": 3.0520020216768686, "grad_norm": 1.0078125, "learning_rate": 0.0004087736197202784, "loss": 4.9692, "mean_token_accuracy": 0.2123665601015091, "num_tokens": 60652922.0, "step": 27175 }, { "entropy": 5.363733291625977, "epoch": 3.0525635985848263, "grad_norm": 1.0546875, "learning_rate": 0.00040874133564912195, "loss": 5.0342, "mean_token_accuracy": 0.21142424792051315, "num_tokens": 60665125.0, "step": 27180 }, { "entropy": 5.527137899398804, "epoch": 3.053125175492784, "grad_norm": 0.9921875, "learning_rate": 0.00040870904731958965, "loss": 5.1686, "mean_token_accuracy": 0.20281098634004593, "num_tokens": 60675807.0, "step": 27185 }, { "entropy": 5.3713212490081785, "epoch": 3.053686752400741, "grad_norm": 1.0078125, "learning_rate": 0.0004086767547327094, "loss": 4.9941, "mean_token_accuracy": 0.21260489970445634, "num_tokens": 60686841.0, "step": 27190 }, { "entropy": 5.365980863571167, "epoch": 3.054248329308699, "grad_norm": 0.99609375, "learning_rate": 0.00040864445788950935, "loss": 5.0778, "mean_token_accuracy": 0.2069576010107994, "num_tokens": 60698965.0, "step": 27195 }, { "entropy": 5.429429292678833, "epoch": 3.0548099062166565, "grad_norm": 1.015625, "learning_rate": 0.000408612156791018, "loss": 5.1614, "mean_token_accuracy": 0.21075122356414794, "num_tokens": 60709962.0, "step": 27200 }, { "entropy": 5.400036954879761, "epoch": 3.0553714831246137, "grad_norm": 1.015625, "learning_rate": 0.0004085798514382637, "loss": 4.9581, "mean_token_accuracy": 0.21083596497774124, "num_tokens": 60721267.0, "step": 27205 }, { "entropy": 5.349150705337524, "epoch": 3.0559330600325714, "grad_norm": 1.0234375, "learning_rate": 0.00040854754183227516, "loss": 5.0111, "mean_token_accuracy": 0.21718464642763138, "num_tokens": 60731892.0, "step": 27210 }, { "entropy": 5.36124095916748, "epoch": 3.056494636940529, "grad_norm": 1.1328125, "learning_rate": 0.0004085152279740811, "loss": 5.0676, "mean_token_accuracy": 0.20305193364620208, "num_tokens": 60742875.0, "step": 27215 }, { "entropy": 5.448908042907715, "epoch": 3.0570562138484867, "grad_norm": 1.125, "learning_rate": 0.00040848290986471037, "loss": 5.0523, "mean_token_accuracy": 0.20990779548883437, "num_tokens": 60752716.0, "step": 27220 }, { "entropy": 5.382467651367188, "epoch": 3.057617790756444, "grad_norm": 1.0859375, "learning_rate": 0.00040845058750519205, "loss": 5.1564, "mean_token_accuracy": 0.2002987876534462, "num_tokens": 60765466.0, "step": 27225 }, { "entropy": 5.415820932388305, "epoch": 3.0581793676644016, "grad_norm": 1.0625, "learning_rate": 0.00040841826089655525, "loss": 5.0999, "mean_token_accuracy": 0.1995697170495987, "num_tokens": 60776488.0, "step": 27230 }, { "entropy": 5.460047197341919, "epoch": 3.0587409445723592, "grad_norm": 0.984375, "learning_rate": 0.00040838593003982926, "loss": 5.0795, "mean_token_accuracy": 0.20870957374572754, "num_tokens": 60786510.0, "step": 27235 }, { "entropy": 5.343446826934814, "epoch": 3.059302521480317, "grad_norm": 0.96484375, "learning_rate": 0.0004083535949360436, "loss": 5.0169, "mean_token_accuracy": 0.21967872530221938, "num_tokens": 60798300.0, "step": 27240 }, { "entropy": 5.227676010131836, "epoch": 3.059864098388274, "grad_norm": 1.0625, "learning_rate": 0.0004083212555862277, "loss": 4.9545, "mean_token_accuracy": 0.21240556389093398, "num_tokens": 60809949.0, "step": 27245 }, { "entropy": 5.34961724281311, "epoch": 3.0604256752962318, "grad_norm": 1.0703125, "learning_rate": 0.0004082889119914113, "loss": 5.005, "mean_token_accuracy": 0.21123767346143724, "num_tokens": 60819960.0, "step": 27250 }, { "entropy": 5.458117437362671, "epoch": 3.0609872522041894, "grad_norm": 1.109375, "learning_rate": 0.0004082565641526242, "loss": 5.0493, "mean_token_accuracy": 0.21555231809616088, "num_tokens": 60830934.0, "step": 27255 }, { "entropy": 5.27258448600769, "epoch": 3.061548829112147, "grad_norm": 1.0859375, "learning_rate": 0.00040822421207089654, "loss": 5.025, "mean_token_accuracy": 0.20771117210388185, "num_tokens": 60842161.0, "step": 27260 }, { "entropy": 5.4284507751464846, "epoch": 3.0621104060201043, "grad_norm": 1.171875, "learning_rate": 0.0004081918557472582, "loss": 5.0978, "mean_token_accuracy": 0.2092292621731758, "num_tokens": 60854220.0, "step": 27265 }, { "entropy": 5.396103763580323, "epoch": 3.062671982928062, "grad_norm": 1.1484375, "learning_rate": 0.0004081594951827396, "loss": 5.0212, "mean_token_accuracy": 0.2209744930267334, "num_tokens": 60864769.0, "step": 27270 }, { "entropy": 5.324406290054322, "epoch": 3.0632335598360196, "grad_norm": 1.109375, "learning_rate": 0.00040812713037837096, "loss": 4.9821, "mean_token_accuracy": 0.21664815843105317, "num_tokens": 60874865.0, "step": 27275 }, { "entropy": 5.392212820053101, "epoch": 3.0637951367439773, "grad_norm": 1.0390625, "learning_rate": 0.00040809476133518284, "loss": 5.0602, "mean_token_accuracy": 0.20880553126335144, "num_tokens": 60885099.0, "step": 27280 }, { "entropy": 5.405401563644409, "epoch": 3.0643567136519345, "grad_norm": 1.03125, "learning_rate": 0.00040806238805420595, "loss": 5.1312, "mean_token_accuracy": 0.2052501082420349, "num_tokens": 60896071.0, "step": 27285 }, { "entropy": 5.43503360748291, "epoch": 3.064918290559892, "grad_norm": 0.94921875, "learning_rate": 0.000408030010536471, "loss": 5.1515, "mean_token_accuracy": 0.2068452075123787, "num_tokens": 60907255.0, "step": 27290 }, { "entropy": 5.3690601825714115, "epoch": 3.06547986746785, "grad_norm": 0.94140625, "learning_rate": 0.00040799762878300895, "loss": 4.9476, "mean_token_accuracy": 0.21929231137037278, "num_tokens": 60918740.0, "step": 27295 }, { "entropy": 5.323395109176635, "epoch": 3.066041444375807, "grad_norm": 0.93359375, "learning_rate": 0.00040796524279485084, "loss": 4.953, "mean_token_accuracy": 0.2155454784631729, "num_tokens": 60929327.0, "step": 27300 }, { "entropy": 5.3457330703735355, "epoch": 3.0666030212837647, "grad_norm": 1.4296875, "learning_rate": 0.00040793285257302776, "loss": 5.016, "mean_token_accuracy": 0.21312355101108552, "num_tokens": 60939987.0, "step": 27305 }, { "entropy": 5.485849761962891, "epoch": 3.0671645981917224, "grad_norm": 1.0625, "learning_rate": 0.000407900458118571, "loss": 5.1747, "mean_token_accuracy": 0.2073729529976845, "num_tokens": 60951924.0, "step": 27310 }, { "entropy": 5.4338137149810795, "epoch": 3.06772617509968, "grad_norm": 1.0, "learning_rate": 0.0004078680594325123, "loss": 5.087, "mean_token_accuracy": 0.208570396900177, "num_tokens": 60963706.0, "step": 27315 }, { "entropy": 5.40734167098999, "epoch": 3.0682877520076373, "grad_norm": 1.09375, "learning_rate": 0.000407835656515883, "loss": 5.0759, "mean_token_accuracy": 0.2131690964102745, "num_tokens": 60974842.0, "step": 27320 }, { "entropy": 5.348116683959961, "epoch": 3.068849328915595, "grad_norm": 1.0234375, "learning_rate": 0.00040780324936971486, "loss": 4.9883, "mean_token_accuracy": 0.2179832562804222, "num_tokens": 60984921.0, "step": 27325 }, { "entropy": 5.3936262130737305, "epoch": 3.0694109058235526, "grad_norm": 1.0390625, "learning_rate": 0.0004077708379950397, "loss": 5.0727, "mean_token_accuracy": 0.2088018536567688, "num_tokens": 60995648.0, "step": 27330 }, { "entropy": 5.322894954681397, "epoch": 3.0699724827315102, "grad_norm": 1.140625, "learning_rate": 0.0004077384223928896, "loss": 5.0567, "mean_token_accuracy": 0.20863904654979706, "num_tokens": 61008020.0, "step": 27335 }, { "entropy": 5.3846851825714115, "epoch": 3.0705340596394675, "grad_norm": 1.15625, "learning_rate": 0.0004077060025642967, "loss": 4.9875, "mean_token_accuracy": 0.21295994371175767, "num_tokens": 61017735.0, "step": 27340 }, { "entropy": 5.37728214263916, "epoch": 3.071095636547425, "grad_norm": 1.0234375, "learning_rate": 0.0004076735785102931, "loss": 5.1417, "mean_token_accuracy": 0.20318266600370408, "num_tokens": 61029111.0, "step": 27345 }, { "entropy": 5.3966254711151125, "epoch": 3.071657213455383, "grad_norm": 1.0703125, "learning_rate": 0.0004076411502319114, "loss": 5.0282, "mean_token_accuracy": 0.2106887772679329, "num_tokens": 61039392.0, "step": 27350 }, { "entropy": 5.344965171813965, "epoch": 3.0722187903633404, "grad_norm": 1.171875, "learning_rate": 0.00040760871773018405, "loss": 5.0334, "mean_token_accuracy": 0.21763253062963486, "num_tokens": 61049681.0, "step": 27355 }, { "entropy": 5.387428617477417, "epoch": 3.0727803672712977, "grad_norm": 1.109375, "learning_rate": 0.0004075762810061437, "loss": 5.0075, "mean_token_accuracy": 0.20756817162036895, "num_tokens": 61059910.0, "step": 27360 }, { "entropy": 5.436712980270386, "epoch": 3.0733419441792553, "grad_norm": 1.25, "learning_rate": 0.000407543840060823, "loss": 5.1231, "mean_token_accuracy": 0.21505847722291946, "num_tokens": 61071074.0, "step": 27365 }, { "entropy": 5.350608396530151, "epoch": 3.073903521087213, "grad_norm": 1.03125, "learning_rate": 0.0004075113948952551, "loss": 5.0189, "mean_token_accuracy": 0.2164027914404869, "num_tokens": 61082051.0, "step": 27370 }, { "entropy": 5.391592597961425, "epoch": 3.0744650979951706, "grad_norm": 0.98828125, "learning_rate": 0.0004074789455104731, "loss": 5.0711, "mean_token_accuracy": 0.21173403561115264, "num_tokens": 61093578.0, "step": 27375 }, { "entropy": 5.3749778270721436, "epoch": 3.075026674903128, "grad_norm": 1.1640625, "learning_rate": 0.00040744649190750995, "loss": 5.0352, "mean_token_accuracy": 0.20764901489019394, "num_tokens": 61105192.0, "step": 27380 }, { "entropy": 5.430095386505127, "epoch": 3.0755882518110855, "grad_norm": 1.046875, "learning_rate": 0.0004074140340873992, "loss": 5.1099, "mean_token_accuracy": 0.20671942383050917, "num_tokens": 61116659.0, "step": 27385 }, { "entropy": 5.4345602035522464, "epoch": 3.076149828719043, "grad_norm": 1.3203125, "learning_rate": 0.0004073815720511743, "loss": 5.0638, "mean_token_accuracy": 0.20779457241296767, "num_tokens": 61127761.0, "step": 27390 }, { "entropy": 5.4210714340209964, "epoch": 3.0767114056270004, "grad_norm": 1.0, "learning_rate": 0.00040734910579986875, "loss": 4.9816, "mean_token_accuracy": 0.2167563334107399, "num_tokens": 61139039.0, "step": 27395 }, { "entropy": 5.430883836746216, "epoch": 3.077272982534958, "grad_norm": 1.03125, "learning_rate": 0.00040731663533451624, "loss": 5.0578, "mean_token_accuracy": 0.2053838327527046, "num_tokens": 61149877.0, "step": 27400 }, { "entropy": 5.451173400878906, "epoch": 3.0778345594429157, "grad_norm": 1.0234375, "learning_rate": 0.00040728416065615087, "loss": 5.0674, "mean_token_accuracy": 0.20616116672754287, "num_tokens": 61160806.0, "step": 27405 }, { "entropy": 5.35833511352539, "epoch": 3.0783961363508734, "grad_norm": 1.1328125, "learning_rate": 0.0004072516817658065, "loss": 5.17, "mean_token_accuracy": 0.20267827361822127, "num_tokens": 61171471.0, "step": 27410 }, { "entropy": 5.406922292709351, "epoch": 3.0789577132588306, "grad_norm": 1.0390625, "learning_rate": 0.00040721919866451724, "loss": 5.0693, "mean_token_accuracy": 0.20906611979007722, "num_tokens": 61182140.0, "step": 27415 }, { "entropy": 5.406250095367431, "epoch": 3.0795192901667883, "grad_norm": 0.9921875, "learning_rate": 0.0004071867113533174, "loss": 4.9996, "mean_token_accuracy": 0.21201249212026596, "num_tokens": 61192532.0, "step": 27420 }, { "entropy": 5.400935220718384, "epoch": 3.080080867074746, "grad_norm": 0.94921875, "learning_rate": 0.00040715421983324147, "loss": 5.1283, "mean_token_accuracy": 0.2066509634256363, "num_tokens": 61205207.0, "step": 27425 }, { "entropy": 5.487467098236084, "epoch": 3.0806424439827036, "grad_norm": 1.046875, "learning_rate": 0.00040712172410532397, "loss": 5.164, "mean_token_accuracy": 0.20032101422548293, "num_tokens": 61218039.0, "step": 27430 }, { "entropy": 5.491283178329468, "epoch": 3.081204020890661, "grad_norm": 1.046875, "learning_rate": 0.0004070892241705994, "loss": 5.1171, "mean_token_accuracy": 0.2054124265909195, "num_tokens": 61230343.0, "step": 27435 }, { "entropy": 5.295750570297241, "epoch": 3.0817655977986185, "grad_norm": 1.046875, "learning_rate": 0.00040705672003010275, "loss": 4.9739, "mean_token_accuracy": 0.2111295446753502, "num_tokens": 61240781.0, "step": 27440 }, { "entropy": 5.332730102539062, "epoch": 3.082327174706576, "grad_norm": 1.0078125, "learning_rate": 0.000407024211684869, "loss": 5.0426, "mean_token_accuracy": 0.21263851821422577, "num_tokens": 61250638.0, "step": 27445 }, { "entropy": 5.44442892074585, "epoch": 3.082888751614534, "grad_norm": 1.140625, "learning_rate": 0.00040699169913593306, "loss": 5.067, "mean_token_accuracy": 0.20637549757957457, "num_tokens": 61261431.0, "step": 27450 }, { "entropy": 5.467871141433716, "epoch": 3.083450328522491, "grad_norm": 1.0546875, "learning_rate": 0.0004069591823843302, "loss": 5.1645, "mean_token_accuracy": 0.20015959441661835, "num_tokens": 61272726.0, "step": 27455 }, { "entropy": 5.450448656082154, "epoch": 3.0840119054304487, "grad_norm": 1.0078125, "learning_rate": 0.0004069266614310959, "loss": 5.0847, "mean_token_accuracy": 0.2108982339501381, "num_tokens": 61283779.0, "step": 27460 }, { "entropy": 5.419009828567505, "epoch": 3.0845734823384063, "grad_norm": 1.0078125, "learning_rate": 0.00040689413627726544, "loss": 5.1221, "mean_token_accuracy": 0.2117372676730156, "num_tokens": 61294477.0, "step": 27465 }, { "entropy": 5.444853353500366, "epoch": 3.085135059246364, "grad_norm": 1.1015625, "learning_rate": 0.00040686160692387455, "loss": 5.1907, "mean_token_accuracy": 0.20476775318384172, "num_tokens": 61305302.0, "step": 27470 }, { "entropy": 5.448298835754395, "epoch": 3.085696636154321, "grad_norm": 1.0625, "learning_rate": 0.00040682907337195894, "loss": 5.0288, "mean_token_accuracy": 0.212177774310112, "num_tokens": 61315499.0, "step": 27475 }, { "entropy": 5.444242238998413, "epoch": 3.086258213062279, "grad_norm": 1.125, "learning_rate": 0.0004067965356225545, "loss": 5.0723, "mean_token_accuracy": 0.19936156123876572, "num_tokens": 61326654.0, "step": 27480 }, { "entropy": 5.4075723648071286, "epoch": 3.0868197899702365, "grad_norm": 0.984375, "learning_rate": 0.00040676399367669733, "loss": 5.0962, "mean_token_accuracy": 0.20307598561048507, "num_tokens": 61338475.0, "step": 27485 }, { "entropy": 5.377256441116333, "epoch": 3.0873813668781938, "grad_norm": 1.09375, "learning_rate": 0.0004067314475354234, "loss": 5.1425, "mean_token_accuracy": 0.20647278428077698, "num_tokens": 61348748.0, "step": 27490 }, { "entropy": 5.350716543197632, "epoch": 3.0879429437861514, "grad_norm": 0.98828125, "learning_rate": 0.00040669889719976916, "loss": 5.0506, "mean_token_accuracy": 0.2181146949529648, "num_tokens": 61359466.0, "step": 27495 }, { "entropy": 5.38816556930542, "epoch": 3.088504520694109, "grad_norm": 0.99609375, "learning_rate": 0.0004066663426707709, "loss": 4.9793, "mean_token_accuracy": 0.21696633994579315, "num_tokens": 61370136.0, "step": 27500 }, { "entropy": 5.357815599441528, "epoch": 3.0890660976020667, "grad_norm": 1.0078125, "learning_rate": 0.00040663378394946534, "loss": 5.0297, "mean_token_accuracy": 0.20907026827335357, "num_tokens": 61381012.0, "step": 27505 }, { "entropy": 5.383496904373169, "epoch": 3.089627674510024, "grad_norm": 1.0390625, "learning_rate": 0.0004066012210368889, "loss": 5.0186, "mean_token_accuracy": 0.21088650226593017, "num_tokens": 61393530.0, "step": 27510 }, { "entropy": 5.429406452178955, "epoch": 3.0901892514179816, "grad_norm": 0.953125, "learning_rate": 0.0004065686539340786, "loss": 5.0695, "mean_token_accuracy": 0.21019048541784285, "num_tokens": 61405753.0, "step": 27515 }, { "entropy": 5.309476137161255, "epoch": 3.0907508283259393, "grad_norm": 1.09375, "learning_rate": 0.00040653608264207134, "loss": 4.9935, "mean_token_accuracy": 0.21437268406152726, "num_tokens": 61416688.0, "step": 27520 }, { "entropy": 5.444396257400513, "epoch": 3.091312405233897, "grad_norm": 1.0546875, "learning_rate": 0.00040650350716190417, "loss": 5.1165, "mean_token_accuracy": 0.20811243653297423, "num_tokens": 61427377.0, "step": 27525 }, { "entropy": 5.364966154098511, "epoch": 3.091873982141854, "grad_norm": 0.9765625, "learning_rate": 0.0004064709274946143, "loss": 5.0056, "mean_token_accuracy": 0.21048704236745835, "num_tokens": 61438457.0, "step": 27530 }, { "entropy": 5.270884943008423, "epoch": 3.092435559049812, "grad_norm": 1.1015625, "learning_rate": 0.0004064383436412392, "loss": 5.0302, "mean_token_accuracy": 0.21374015808105468, "num_tokens": 61449380.0, "step": 27535 }, { "entropy": 5.4113071918487545, "epoch": 3.0929971359577695, "grad_norm": 1.09375, "learning_rate": 0.0004064057556028162, "loss": 5.0902, "mean_token_accuracy": 0.2105550065636635, "num_tokens": 61460846.0, "step": 27540 }, { "entropy": 5.461072015762329, "epoch": 3.093558712865727, "grad_norm": 1.1796875, "learning_rate": 0.000406373163380383, "loss": 5.0566, "mean_token_accuracy": 0.20711333006620408, "num_tokens": 61471593.0, "step": 27545 }, { "entropy": 5.365269041061401, "epoch": 3.0941202897736844, "grad_norm": 1.0078125, "learning_rate": 0.00040634056697497726, "loss": 5.0875, "mean_token_accuracy": 0.20533518493175507, "num_tokens": 61483643.0, "step": 27550 }, { "entropy": 5.343554592132568, "epoch": 3.094681866681642, "grad_norm": 1.03125, "learning_rate": 0.000406307966387637, "loss": 5.0051, "mean_token_accuracy": 0.2083800569176674, "num_tokens": 61493220.0, "step": 27555 }, { "entropy": 5.408980512619019, "epoch": 3.0952434435895997, "grad_norm": 1.0703125, "learning_rate": 0.00040627536161940016, "loss": 5.0603, "mean_token_accuracy": 0.20979873985052108, "num_tokens": 61504372.0, "step": 27560 }, { "entropy": 5.311625242233276, "epoch": 3.0958050204975573, "grad_norm": 1.078125, "learning_rate": 0.0004062427526713049, "loss": 5.0425, "mean_token_accuracy": 0.20713423043489457, "num_tokens": 61515335.0, "step": 27565 }, { "entropy": 5.366089153289795, "epoch": 3.0963665974055146, "grad_norm": 0.97265625, "learning_rate": 0.0004062101395443894, "loss": 4.9964, "mean_token_accuracy": 0.2107372611761093, "num_tokens": 61526265.0, "step": 27570 }, { "entropy": 5.475622272491455, "epoch": 3.0969281743134722, "grad_norm": 0.94140625, "learning_rate": 0.0004061775222396922, "loss": 5.0785, "mean_token_accuracy": 0.20455131083726882, "num_tokens": 61538075.0, "step": 27575 }, { "entropy": 5.360054159164429, "epoch": 3.09748975122143, "grad_norm": 1.0703125, "learning_rate": 0.0004061449007582519, "loss": 5.0035, "mean_token_accuracy": 0.20688650906085967, "num_tokens": 61548612.0, "step": 27580 }, { "entropy": 5.308639144897461, "epoch": 3.098051328129387, "grad_norm": 1.0546875, "learning_rate": 0.000406112275101107, "loss": 5.034, "mean_token_accuracy": 0.2149777352809906, "num_tokens": 61559702.0, "step": 27585 }, { "entropy": 5.404494571685791, "epoch": 3.0986129050373448, "grad_norm": 1.046875, "learning_rate": 0.00040607964526929655, "loss": 5.0333, "mean_token_accuracy": 0.20723124593496323, "num_tokens": 61569815.0, "step": 27590 }, { "entropy": 5.404392862319947, "epoch": 3.0991744819453024, "grad_norm": 1.015625, "learning_rate": 0.00040604701126385924, "loss": 5.0957, "mean_token_accuracy": 0.21203310340642928, "num_tokens": 61580050.0, "step": 27595 }, { "entropy": 5.438221216201782, "epoch": 3.09973605885326, "grad_norm": 1.1171875, "learning_rate": 0.0004060143730858342, "loss": 5.1013, "mean_token_accuracy": 0.20926881432533265, "num_tokens": 61590885.0, "step": 27600 }, { "entropy": 5.394190406799316, "epoch": 3.1002976357612173, "grad_norm": 1.0078125, "learning_rate": 0.00040598173073626086, "loss": 5.0715, "mean_token_accuracy": 0.20808927416801454, "num_tokens": 61601633.0, "step": 27605 }, { "entropy": 5.466530799865723, "epoch": 3.100859212669175, "grad_norm": 1.046875, "learning_rate": 0.0004059490842161783, "loss": 5.1925, "mean_token_accuracy": 0.1990865021944046, "num_tokens": 61613244.0, "step": 27610 }, { "entropy": 5.408761310577392, "epoch": 3.1014207895771326, "grad_norm": 0.96484375, "learning_rate": 0.00040591643352662615, "loss": 5.049, "mean_token_accuracy": 0.21945154070854186, "num_tokens": 61624939.0, "step": 27615 }, { "entropy": 5.321692848205567, "epoch": 3.1019823664850903, "grad_norm": 1.0234375, "learning_rate": 0.000405883778668644, "loss": 4.906, "mean_token_accuracy": 0.21740760356187822, "num_tokens": 61635480.0, "step": 27620 }, { "entropy": 5.369289255142212, "epoch": 3.1025439433930475, "grad_norm": 1.015625, "learning_rate": 0.00040585111964327157, "loss": 5.0502, "mean_token_accuracy": 0.21377938538789748, "num_tokens": 61645500.0, "step": 27625 }, { "entropy": 5.286838579177856, "epoch": 3.103105520301005, "grad_norm": 1.0703125, "learning_rate": 0.00040581845645154877, "loss": 4.9883, "mean_token_accuracy": 0.21444351673126222, "num_tokens": 61656880.0, "step": 27630 }, { "entropy": 5.443379211425781, "epoch": 3.103667097208963, "grad_norm": 1.015625, "learning_rate": 0.0004057857890945155, "loss": 5.1129, "mean_token_accuracy": 0.210970900952816, "num_tokens": 61667451.0, "step": 27635 }, { "entropy": 5.5185082912445065, "epoch": 3.1042286741169205, "grad_norm": 1.015625, "learning_rate": 0.00040575311757321203, "loss": 5.2228, "mean_token_accuracy": 0.20185371339321137, "num_tokens": 61679356.0, "step": 27640 }, { "entropy": 5.395617294311523, "epoch": 3.1047902510248777, "grad_norm": 1.078125, "learning_rate": 0.00040572044188867863, "loss": 5.0453, "mean_token_accuracy": 0.20510266721248627, "num_tokens": 61690154.0, "step": 27645 }, { "entropy": 5.402671432495117, "epoch": 3.1053518279328354, "grad_norm": 0.9609375, "learning_rate": 0.0004056877620419556, "loss": 5.1504, "mean_token_accuracy": 0.2036595106124878, "num_tokens": 61702321.0, "step": 27650 }, { "entropy": 5.418680953979492, "epoch": 3.105913404840793, "grad_norm": 1.0234375, "learning_rate": 0.0004056550780340835, "loss": 5.0629, "mean_token_accuracy": 0.20417182594537736, "num_tokens": 61713498.0, "step": 27655 }, { "entropy": 5.540579795837402, "epoch": 3.1064749817487507, "grad_norm": 1.03125, "learning_rate": 0.0004056223898661031, "loss": 5.1966, "mean_token_accuracy": 0.20398214608430862, "num_tokens": 61725009.0, "step": 27660 }, { "entropy": 5.3587456226348875, "epoch": 3.107036558656708, "grad_norm": 0.98828125, "learning_rate": 0.00040558969753905514, "loss": 4.9748, "mean_token_accuracy": 0.22180883586406708, "num_tokens": 61735652.0, "step": 27665 }, { "entropy": 5.226569414138794, "epoch": 3.1075981355646656, "grad_norm": 1.03125, "learning_rate": 0.0004055570010539806, "loss": 4.9294, "mean_token_accuracy": 0.22017083466053008, "num_tokens": 61746435.0, "step": 27670 }, { "entropy": 5.317531442642212, "epoch": 3.1081597124726232, "grad_norm": 1.03125, "learning_rate": 0.0004055243004119204, "loss": 4.9616, "mean_token_accuracy": 0.21567502468824387, "num_tokens": 61757523.0, "step": 27675 }, { "entropy": 5.474256372451782, "epoch": 3.108721289380581, "grad_norm": 1.0625, "learning_rate": 0.00040549159561391595, "loss": 5.1086, "mean_token_accuracy": 0.20113369226455688, "num_tokens": 61769309.0, "step": 27680 }, { "entropy": 5.408780288696289, "epoch": 3.109282866288538, "grad_norm": 0.96875, "learning_rate": 0.0004054588866610085, "loss": 5.1154, "mean_token_accuracy": 0.20833078473806382, "num_tokens": 61781093.0, "step": 27685 }, { "entropy": 5.419935894012451, "epoch": 3.1098444431964958, "grad_norm": 0.9765625, "learning_rate": 0.00040542617355423947, "loss": 5.0232, "mean_token_accuracy": 0.21725351214408875, "num_tokens": 61792837.0, "step": 27690 }, { "entropy": 5.411913728713989, "epoch": 3.1104060201044534, "grad_norm": 1.0234375, "learning_rate": 0.00040539345629465043, "loss": 5.1003, "mean_token_accuracy": 0.20807561576366423, "num_tokens": 61804212.0, "step": 27695 }, { "entropy": 5.370340871810913, "epoch": 3.1109675970124107, "grad_norm": 1.0078125, "learning_rate": 0.00040536073488328325, "loss": 5.0821, "mean_token_accuracy": 0.20318736433982848, "num_tokens": 61815436.0, "step": 27700 }, { "entropy": 5.462411022186279, "epoch": 3.1115291739203683, "grad_norm": 0.9375, "learning_rate": 0.0004053280093211796, "loss": 5.1318, "mean_token_accuracy": 0.2065327674150467, "num_tokens": 61829292.0, "step": 27705 }, { "entropy": 5.47971544265747, "epoch": 3.112090750828326, "grad_norm": 0.95703125, "learning_rate": 0.0004052952796093817, "loss": 5.1509, "mean_token_accuracy": 0.21345512568950653, "num_tokens": 61841440.0, "step": 27710 }, { "entropy": 5.324461889266968, "epoch": 3.1126523277362836, "grad_norm": 1.171875, "learning_rate": 0.00040526254574893154, "loss": 5.0495, "mean_token_accuracy": 0.21012418568134308, "num_tokens": 61853864.0, "step": 27715 }, { "entropy": 5.417181539535522, "epoch": 3.113213904644241, "grad_norm": 1.0078125, "learning_rate": 0.00040522980774087143, "loss": 5.0703, "mean_token_accuracy": 0.20945813804864882, "num_tokens": 61864739.0, "step": 27720 }, { "entropy": 5.367512845993042, "epoch": 3.1137754815521985, "grad_norm": 1.0078125, "learning_rate": 0.0004051970655862437, "loss": 5.0859, "mean_token_accuracy": 0.2135436400771141, "num_tokens": 61875940.0, "step": 27725 }, { "entropy": 5.4020284652709964, "epoch": 3.114337058460156, "grad_norm": 1.234375, "learning_rate": 0.0004051643192860908, "loss": 5.034, "mean_token_accuracy": 0.2102968618273735, "num_tokens": 61887650.0, "step": 27730 }, { "entropy": 5.43201642036438, "epoch": 3.114898635368114, "grad_norm": 1.1015625, "learning_rate": 0.00040513156884145564, "loss": 5.1605, "mean_token_accuracy": 0.20244670212268828, "num_tokens": 61898624.0, "step": 27735 }, { "entropy": 5.410088109970093, "epoch": 3.115460212276071, "grad_norm": 1.0078125, "learning_rate": 0.0004050988142533808, "loss": 5.1283, "mean_token_accuracy": 0.20314429104328155, "num_tokens": 61911017.0, "step": 27740 }, { "entropy": 5.4241943359375, "epoch": 3.1160217891840287, "grad_norm": 0.96875, "learning_rate": 0.0004050660555229093, "loss": 5.1176, "mean_token_accuracy": 0.2031803771853447, "num_tokens": 61922381.0, "step": 27745 }, { "entropy": 5.539089870452881, "epoch": 3.1165833660919864, "grad_norm": 0.96875, "learning_rate": 0.0004050332926510841, "loss": 5.1592, "mean_token_accuracy": 0.2067386254668236, "num_tokens": 61932876.0, "step": 27750 }, { "entropy": 5.3301208972930905, "epoch": 3.117144942999944, "grad_norm": 1.046875, "learning_rate": 0.0004050005256389484, "loss": 4.9694, "mean_token_accuracy": 0.2183411478996277, "num_tokens": 61943121.0, "step": 27755 }, { "entropy": 5.2945556640625, "epoch": 3.1177065199079013, "grad_norm": 1.0390625, "learning_rate": 0.0004049677544875456, "loss": 4.938, "mean_token_accuracy": 0.2080162599682808, "num_tokens": 61953988.0, "step": 27760 }, { "entropy": 5.419624090194702, "epoch": 3.118268096815859, "grad_norm": 1.09375, "learning_rate": 0.00040493497919791906, "loss": 5.0938, "mean_token_accuracy": 0.21016569584608077, "num_tokens": 61965111.0, "step": 27765 }, { "entropy": 5.505664396286011, "epoch": 3.1188296737238166, "grad_norm": 1.0546875, "learning_rate": 0.00040490219977111237, "loss": 5.1422, "mean_token_accuracy": 0.21375453174114228, "num_tokens": 61976193.0, "step": 27770 }, { "entropy": 5.458707714080811, "epoch": 3.1193912506317742, "grad_norm": 0.96875, "learning_rate": 0.0004048694162081693, "loss": 5.1248, "mean_token_accuracy": 0.2114075243473053, "num_tokens": 61987554.0, "step": 27775 }, { "entropy": 5.517564392089843, "epoch": 3.1199528275397315, "grad_norm": 1.1328125, "learning_rate": 0.0004048366285101336, "loss": 5.1587, "mean_token_accuracy": 0.1945674881339073, "num_tokens": 61998472.0, "step": 27780 }, { "entropy": 5.395972824096679, "epoch": 3.120514404447689, "grad_norm": 1.1328125, "learning_rate": 0.0004048038366780494, "loss": 5.0391, "mean_token_accuracy": 0.20793312340974807, "num_tokens": 62009368.0, "step": 27785 }, { "entropy": 5.3373970031738285, "epoch": 3.121075981355647, "grad_norm": 1.03125, "learning_rate": 0.0004047710407129606, "loss": 5.0646, "mean_token_accuracy": 0.20725186467170714, "num_tokens": 62021510.0, "step": 27790 }, { "entropy": 5.451146030426026, "epoch": 3.121637558263604, "grad_norm": 1.078125, "learning_rate": 0.0004047382406159115, "loss": 5.1319, "mean_token_accuracy": 0.2058703362941742, "num_tokens": 62032057.0, "step": 27795 }, { "entropy": 5.3722936630249025, "epoch": 3.1221991351715617, "grad_norm": 0.9765625, "learning_rate": 0.0004047054363879466, "loss": 5.0255, "mean_token_accuracy": 0.22270579040050506, "num_tokens": 62043185.0, "step": 27800 }, { "entropy": 5.488694190979004, "epoch": 3.1227607120795193, "grad_norm": 1.03125, "learning_rate": 0.00040467262803011025, "loss": 5.1169, "mean_token_accuracy": 0.2046107530593872, "num_tokens": 62053483.0, "step": 27805 }, { "entropy": 5.424950695037841, "epoch": 3.123322288987477, "grad_norm": 1.0546875, "learning_rate": 0.00040463981554344716, "loss": 5.177, "mean_token_accuracy": 0.19927919507026673, "num_tokens": 62065721.0, "step": 27810 }, { "entropy": 5.369228649139404, "epoch": 3.123883865895434, "grad_norm": 1.046875, "learning_rate": 0.00040460699892900197, "loss": 5.0256, "mean_token_accuracy": 0.21313521713018418, "num_tokens": 62076251.0, "step": 27815 }, { "entropy": 5.394562673568726, "epoch": 3.124445442803392, "grad_norm": 1.015625, "learning_rate": 0.0004045741781878198, "loss": 5.0483, "mean_token_accuracy": 0.21053803712129593, "num_tokens": 62086791.0, "step": 27820 }, { "entropy": 5.357765150070191, "epoch": 3.1250070197113495, "grad_norm": 1.09375, "learning_rate": 0.00040454135332094543, "loss": 4.922, "mean_token_accuracy": 0.21566542685031892, "num_tokens": 62097054.0, "step": 27825 }, { "entropy": 5.3928991794586185, "epoch": 3.125568596619307, "grad_norm": 0.98046875, "learning_rate": 0.0004045085243294242, "loss": 5.0632, "mean_token_accuracy": 0.21483320742845535, "num_tokens": 62108304.0, "step": 27830 }, { "entropy": 5.408805894851684, "epoch": 3.1261301735272644, "grad_norm": 1.078125, "learning_rate": 0.0004044756912143013, "loss": 5.1303, "mean_token_accuracy": 0.2051289603114128, "num_tokens": 62119724.0, "step": 27835 }, { "entropy": 5.365106248855591, "epoch": 3.126691750435222, "grad_norm": 1.0078125, "learning_rate": 0.00040444285397662225, "loss": 4.9813, "mean_token_accuracy": 0.22066470384597778, "num_tokens": 62131021.0, "step": 27840 }, { "entropy": 5.439765405654907, "epoch": 3.1272533273431797, "grad_norm": 1.03125, "learning_rate": 0.0004044100126174324, "loss": 5.1239, "mean_token_accuracy": 0.20138310194015502, "num_tokens": 62141846.0, "step": 27845 }, { "entropy": 5.492084884643555, "epoch": 3.1278149042511374, "grad_norm": 1.359375, "learning_rate": 0.00040437716713777756, "loss": 5.2009, "mean_token_accuracy": 0.20362530946731566, "num_tokens": 62152922.0, "step": 27850 }, { "entropy": 5.454377269744873, "epoch": 3.1283764811590946, "grad_norm": 0.98046875, "learning_rate": 0.0004043443175387036, "loss": 5.1517, "mean_token_accuracy": 0.20615992248058318, "num_tokens": 62164645.0, "step": 27855 }, { "entropy": 5.372118663787842, "epoch": 3.1289380580670523, "grad_norm": 1.046875, "learning_rate": 0.00040431146382125644, "loss": 5.1391, "mean_token_accuracy": 0.2011812373995781, "num_tokens": 62175910.0, "step": 27860 }, { "entropy": 5.3320629596710205, "epoch": 3.12949963497501, "grad_norm": 0.984375, "learning_rate": 0.000404278605986482, "loss": 4.965, "mean_token_accuracy": 0.21617646962404252, "num_tokens": 62187411.0, "step": 27865 }, { "entropy": 5.319237852096558, "epoch": 3.1300612118829676, "grad_norm": 1.0, "learning_rate": 0.0004042457440354267, "loss": 4.999, "mean_token_accuracy": 0.21538869738578797, "num_tokens": 62199316.0, "step": 27870 }, { "entropy": 5.481736087799073, "epoch": 3.130622788790925, "grad_norm": 1.0234375, "learning_rate": 0.0004042128779691368, "loss": 5.1559, "mean_token_accuracy": 0.2084455206990242, "num_tokens": 62211864.0, "step": 27875 }, { "entropy": 5.397811937332153, "epoch": 3.1311843656988825, "grad_norm": 1.0078125, "learning_rate": 0.0004041800077886587, "loss": 4.9891, "mean_token_accuracy": 0.22080040276050567, "num_tokens": 62221715.0, "step": 27880 }, { "entropy": 5.4069263458251955, "epoch": 3.13174594260684, "grad_norm": 0.9375, "learning_rate": 0.00040414713349503907, "loss": 5.1343, "mean_token_accuracy": 0.20926571190357207, "num_tokens": 62233198.0, "step": 27885 }, { "entropy": 5.387363719940185, "epoch": 3.1323075195147974, "grad_norm": 1.15625, "learning_rate": 0.00040411425508932457, "loss": 5.04, "mean_token_accuracy": 0.20948956906795502, "num_tokens": 62244149.0, "step": 27890 }, { "entropy": 5.479681205749512, "epoch": 3.132869096422755, "grad_norm": 0.99609375, "learning_rate": 0.00040408137257256225, "loss": 5.1039, "mean_token_accuracy": 0.20748914033174515, "num_tokens": 62254994.0, "step": 27895 }, { "entropy": 5.434012794494629, "epoch": 3.1334306733307127, "grad_norm": 1.0546875, "learning_rate": 0.0004040484859457988, "loss": 5.1449, "mean_token_accuracy": 0.206869937479496, "num_tokens": 62265685.0, "step": 27900 }, { "entropy": 5.339555883407593, "epoch": 3.1339922502386703, "grad_norm": 1.0078125, "learning_rate": 0.00040401559521008155, "loss": 5.0354, "mean_token_accuracy": 0.2136625826358795, "num_tokens": 62275765.0, "step": 27905 }, { "entropy": 5.306742382049561, "epoch": 3.1345538271466276, "grad_norm": 1.0703125, "learning_rate": 0.00040398270036645775, "loss": 5.0393, "mean_token_accuracy": 0.20739591270685195, "num_tokens": 62286020.0, "step": 27910 }, { "entropy": 5.422234392166137, "epoch": 3.135115404054585, "grad_norm": 1.046875, "learning_rate": 0.0004039498014159748, "loss": 5.0446, "mean_token_accuracy": 0.21015482246875763, "num_tokens": 62296231.0, "step": 27915 }, { "entropy": 5.388809251785278, "epoch": 3.135676980962543, "grad_norm": 1.1015625, "learning_rate": 0.00040391689835968004, "loss": 5.0114, "mean_token_accuracy": 0.20927929878234863, "num_tokens": 62307243.0, "step": 27920 }, { "entropy": 5.392269325256348, "epoch": 3.1362385578705005, "grad_norm": 1.046875, "learning_rate": 0.0004038839911986213, "loss": 5.0688, "mean_token_accuracy": 0.2043734982609749, "num_tokens": 62319061.0, "step": 27925 }, { "entropy": 5.438141393661499, "epoch": 3.1368001347784578, "grad_norm": 0.9375, "learning_rate": 0.0004038510799338462, "loss": 5.124, "mean_token_accuracy": 0.21011329889297486, "num_tokens": 62329477.0, "step": 27930 }, { "entropy": 5.39131350517273, "epoch": 3.1373617116864154, "grad_norm": 1.078125, "learning_rate": 0.0004038181645664029, "loss": 5.0448, "mean_token_accuracy": 0.2149667575955391, "num_tokens": 62339170.0, "step": 27935 }, { "entropy": 5.467151641845703, "epoch": 3.137923288594373, "grad_norm": 0.984375, "learning_rate": 0.00040378524509733916, "loss": 5.1493, "mean_token_accuracy": 0.20648448914289474, "num_tokens": 62350548.0, "step": 27940 }, { "entropy": 5.374819374084472, "epoch": 3.1384848655023307, "grad_norm": 1.03125, "learning_rate": 0.0004037523215277033, "loss": 4.9895, "mean_token_accuracy": 0.2139353483915329, "num_tokens": 62361105.0, "step": 27945 }, { "entropy": 5.370611047744751, "epoch": 3.139046442410288, "grad_norm": 1.0234375, "learning_rate": 0.0004037193938585436, "loss": 5.0828, "mean_token_accuracy": 0.2113683730363846, "num_tokens": 62372048.0, "step": 27950 }, { "entropy": 5.378255701065063, "epoch": 3.1396080193182456, "grad_norm": 0.99609375, "learning_rate": 0.0004036864620909085, "loss": 5.0872, "mean_token_accuracy": 0.2041005551815033, "num_tokens": 62382936.0, "step": 27955 }, { "entropy": 5.3852311134338375, "epoch": 3.1401695962262033, "grad_norm": 0.9453125, "learning_rate": 0.0004036535262258465, "loss": 4.9798, "mean_token_accuracy": 0.2139171227812767, "num_tokens": 62393656.0, "step": 27960 }, { "entropy": 5.394815826416016, "epoch": 3.140731173134161, "grad_norm": 1.0390625, "learning_rate": 0.00040362058626440637, "loss": 5.1021, "mean_token_accuracy": 0.21242287904024124, "num_tokens": 62404234.0, "step": 27965 }, { "entropy": 5.4129030227661135, "epoch": 3.141292750042118, "grad_norm": 0.94921875, "learning_rate": 0.00040358764220763685, "loss": 5.0466, "mean_token_accuracy": 0.20921226292848588, "num_tokens": 62416694.0, "step": 27970 }, { "entropy": 5.381912326812744, "epoch": 3.141854326950076, "grad_norm": 0.89453125, "learning_rate": 0.00040355469405658687, "loss": 5.0664, "mean_token_accuracy": 0.20664192885160446, "num_tokens": 62429437.0, "step": 27975 }, { "entropy": 5.429514455795288, "epoch": 3.1424159038580335, "grad_norm": 1.0703125, "learning_rate": 0.0004035217418123056, "loss": 5.0304, "mean_token_accuracy": 0.21849615424871444, "num_tokens": 62440085.0, "step": 27980 }, { "entropy": 5.41820502281189, "epoch": 3.1429774807659907, "grad_norm": 1.0234375, "learning_rate": 0.00040348878547584227, "loss": 5.0802, "mean_token_accuracy": 0.20813782811164855, "num_tokens": 62451285.0, "step": 27985 }, { "entropy": 5.373146629333496, "epoch": 3.1435390576739484, "grad_norm": 1.046875, "learning_rate": 0.00040345582504824624, "loss": 5.0325, "mean_token_accuracy": 0.21408046633005143, "num_tokens": 62461777.0, "step": 27990 }, { "entropy": 5.404027652740479, "epoch": 3.144100634581906, "grad_norm": 1.0234375, "learning_rate": 0.0004034228605305668, "loss": 5.0939, "mean_token_accuracy": 0.21634501218795776, "num_tokens": 62472463.0, "step": 27995 }, { "entropy": 5.290450763702393, "epoch": 3.1446622114898637, "grad_norm": 1.0390625, "learning_rate": 0.00040338989192385377, "loss": 5.0221, "mean_token_accuracy": 0.21135189086198808, "num_tokens": 62484168.0, "step": 28000 }, { "entropy": 5.434889221191407, "epoch": 3.145223788397821, "grad_norm": 1.09375, "learning_rate": 0.0004033569192291567, "loss": 5.0949, "mean_token_accuracy": 0.21173793077468872, "num_tokens": 62495187.0, "step": 28005 }, { "entropy": 5.428685474395752, "epoch": 3.1457853653057786, "grad_norm": 1.1171875, "learning_rate": 0.0004033239424475256, "loss": 5.1353, "mean_token_accuracy": 0.20254740118980408, "num_tokens": 62505936.0, "step": 28010 }, { "entropy": 5.488847446441651, "epoch": 3.1463469422137362, "grad_norm": 1.03125, "learning_rate": 0.00040329096158001033, "loss": 5.1074, "mean_token_accuracy": 0.20842781960964202, "num_tokens": 62516486.0, "step": 28015 }, { "entropy": 5.361659193038941, "epoch": 3.146908519121694, "grad_norm": 0.9765625, "learning_rate": 0.0004032579766276612, "loss": 5.0124, "mean_token_accuracy": 0.215682153403759, "num_tokens": 62528349.0, "step": 28020 }, { "entropy": 5.266450023651123, "epoch": 3.147470096029651, "grad_norm": 1.0859375, "learning_rate": 0.00040322498759152824, "loss": 4.9984, "mean_token_accuracy": 0.21442334949970246, "num_tokens": 62538698.0, "step": 28025 }, { "entropy": 5.490656042098999, "epoch": 3.1480316729376088, "grad_norm": 1.0625, "learning_rate": 0.00040319199447266205, "loss": 5.1947, "mean_token_accuracy": 0.2042116791009903, "num_tokens": 62550891.0, "step": 28030 }, { "entropy": 5.453319644927978, "epoch": 3.1485932498455664, "grad_norm": 0.99609375, "learning_rate": 0.0004031589972721129, "loss": 5.0462, "mean_token_accuracy": 0.210380257666111, "num_tokens": 62560553.0, "step": 28035 }, { "entropy": 5.443738603591919, "epoch": 3.149154826753524, "grad_norm": 1.0234375, "learning_rate": 0.0004031259959909317, "loss": 5.0304, "mean_token_accuracy": 0.20956064611673356, "num_tokens": 62571281.0, "step": 28040 }, { "entropy": 5.2905693531036375, "epoch": 3.1497164036614813, "grad_norm": 0.92578125, "learning_rate": 0.000403092990630169, "loss": 5.0353, "mean_token_accuracy": 0.2130683869123459, "num_tokens": 62583489.0, "step": 28045 }, { "entropy": 5.324041366577148, "epoch": 3.150277980569439, "grad_norm": 0.984375, "learning_rate": 0.0004030599811908758, "loss": 4.9943, "mean_token_accuracy": 0.21763916462659835, "num_tokens": 62594155.0, "step": 28050 }, { "entropy": 5.358155584335327, "epoch": 3.1508395574773966, "grad_norm": 1.0078125, "learning_rate": 0.0004030269676741032, "loss": 5.0213, "mean_token_accuracy": 0.21360611021518708, "num_tokens": 62605464.0, "step": 28055 }, { "entropy": 5.400675344467163, "epoch": 3.1514011343853543, "grad_norm": 1.0234375, "learning_rate": 0.0004029939500809023, "loss": 5.071, "mean_token_accuracy": 0.21409667730331422, "num_tokens": 62617343.0, "step": 28060 }, { "entropy": 5.365217876434326, "epoch": 3.1519627112933115, "grad_norm": 1.0390625, "learning_rate": 0.0004029609284123243, "loss": 5.051, "mean_token_accuracy": 0.21621219515800477, "num_tokens": 62628461.0, "step": 28065 }, { "entropy": 5.379937028884887, "epoch": 3.152524288201269, "grad_norm": 0.9921875, "learning_rate": 0.00040292790266942074, "loss": 5.0255, "mean_token_accuracy": 0.21413537710905076, "num_tokens": 62638947.0, "step": 28070 }, { "entropy": 5.280916547775268, "epoch": 3.153085865109227, "grad_norm": 1.15625, "learning_rate": 0.00040289487285324324, "loss": 4.8767, "mean_token_accuracy": 0.21882817894220352, "num_tokens": 62648840.0, "step": 28075 }, { "entropy": 5.443727922439575, "epoch": 3.153647442017184, "grad_norm": 1.1171875, "learning_rate": 0.0004028618389648433, "loss": 5.1523, "mean_token_accuracy": 0.20561097413301468, "num_tokens": 62659491.0, "step": 28080 }, { "entropy": 5.457854461669922, "epoch": 3.1542090189251417, "grad_norm": 1.0703125, "learning_rate": 0.0004028288010052728, "loss": 5.12, "mean_token_accuracy": 0.20365190207958223, "num_tokens": 62669038.0, "step": 28085 }, { "entropy": 5.340935087203979, "epoch": 3.1547705958330994, "grad_norm": 1.03125, "learning_rate": 0.0004027957589755837, "loss": 5.0087, "mean_token_accuracy": 0.21984484195709228, "num_tokens": 62680280.0, "step": 28090 }, { "entropy": 5.411754894256592, "epoch": 3.155332172741057, "grad_norm": 1.0078125, "learning_rate": 0.00040276271287682813, "loss": 5.0733, "mean_token_accuracy": 0.2121509537100792, "num_tokens": 62691767.0, "step": 28095 }, { "entropy": 5.453503751754761, "epoch": 3.1558937496490143, "grad_norm": 1.015625, "learning_rate": 0.00040272966271005816, "loss": 5.0637, "mean_token_accuracy": 0.20902395993471146, "num_tokens": 62701721.0, "step": 28100 }, { "entropy": 5.419015121459961, "epoch": 3.156455326556972, "grad_norm": 1.0390625, "learning_rate": 0.00040269660847632626, "loss": 5.0974, "mean_token_accuracy": 0.2068915143609047, "num_tokens": 62713238.0, "step": 28105 }, { "entropy": 5.306504106521606, "epoch": 3.1570169034649296, "grad_norm": 0.90234375, "learning_rate": 0.00040266355017668475, "loss": 4.95, "mean_token_accuracy": 0.2190881311893463, "num_tokens": 62724457.0, "step": 28110 }, { "entropy": 5.386609315872192, "epoch": 3.1575784803728872, "grad_norm": 0.96875, "learning_rate": 0.0004026304878121864, "loss": 5.08, "mean_token_accuracy": 0.21441061347723006, "num_tokens": 62735178.0, "step": 28115 }, { "entropy": 5.4241656303405765, "epoch": 3.1581400572808445, "grad_norm": 0.94140625, "learning_rate": 0.00040259742138388366, "loss": 5.0596, "mean_token_accuracy": 0.2138619527220726, "num_tokens": 62746767.0, "step": 28120 }, { "entropy": 5.399972724914551, "epoch": 3.158701634188802, "grad_norm": 0.91796875, "learning_rate": 0.00040256435089282966, "loss": 5.0594, "mean_token_accuracy": 0.2143801122903824, "num_tokens": 62757963.0, "step": 28125 }, { "entropy": 5.424853086471558, "epoch": 3.15926321109676, "grad_norm": 0.98828125, "learning_rate": 0.0004025312763400772, "loss": 5.1676, "mean_token_accuracy": 0.20117214769124986, "num_tokens": 62769763.0, "step": 28130 }, { "entropy": 5.2908038139343265, "epoch": 3.1598247880047174, "grad_norm": 0.98828125, "learning_rate": 0.0004024981977266794, "loss": 4.9548, "mean_token_accuracy": 0.2196861118078232, "num_tokens": 62780947.0, "step": 28135 }, { "entropy": 5.411683225631714, "epoch": 3.1603863649126747, "grad_norm": 1.1015625, "learning_rate": 0.0004024651150536896, "loss": 5.159, "mean_token_accuracy": 0.19475050419569015, "num_tokens": 62793003.0, "step": 28140 }, { "entropy": 5.4262713432312015, "epoch": 3.1609479418206323, "grad_norm": 1.03125, "learning_rate": 0.0004024320283221611, "loss": 5.0579, "mean_token_accuracy": 0.20729157477617263, "num_tokens": 62804467.0, "step": 28145 }, { "entropy": 5.357975816726684, "epoch": 3.16150951872859, "grad_norm": 0.98046875, "learning_rate": 0.00040239893753314735, "loss": 5.0102, "mean_token_accuracy": 0.22001030445098876, "num_tokens": 62815834.0, "step": 28150 }, { "entropy": 5.364781665802002, "epoch": 3.1620710956365476, "grad_norm": 1.0078125, "learning_rate": 0.0004023658426877021, "loss": 5.0898, "mean_token_accuracy": 0.20624707341194154, "num_tokens": 62827277.0, "step": 28155 }, { "entropy": 5.433741331100464, "epoch": 3.162632672544505, "grad_norm": 1.0078125, "learning_rate": 0.00040233274378687897, "loss": 4.9778, "mean_token_accuracy": 0.22276339828968048, "num_tokens": 62838652.0, "step": 28160 }, { "entropy": 5.443546867370605, "epoch": 3.1631942494524625, "grad_norm": 0.98828125, "learning_rate": 0.00040229964083173187, "loss": 5.123, "mean_token_accuracy": 0.2052655965089798, "num_tokens": 62849448.0, "step": 28165 }, { "entropy": 5.406308317184449, "epoch": 3.16375582636042, "grad_norm": 0.98828125, "learning_rate": 0.00040226653382331484, "loss": 5.0619, "mean_token_accuracy": 0.21640822291374207, "num_tokens": 62860840.0, "step": 28170 }, { "entropy": 5.457951641082763, "epoch": 3.1643174032683774, "grad_norm": 1.09375, "learning_rate": 0.000402233422762682, "loss": 5.0737, "mean_token_accuracy": 0.21558486372232438, "num_tokens": 62871321.0, "step": 28175 }, { "entropy": 5.299130868911743, "epoch": 3.164878980176335, "grad_norm": 1.0546875, "learning_rate": 0.00040220030765088764, "loss": 4.9855, "mean_token_accuracy": 0.21723635494709015, "num_tokens": 62882865.0, "step": 28180 }, { "entropy": 5.341673564910889, "epoch": 3.1654405570842927, "grad_norm": 1.03125, "learning_rate": 0.0004021671884889862, "loss": 5.0515, "mean_token_accuracy": 0.2077361285686493, "num_tokens": 62894122.0, "step": 28185 }, { "entropy": 5.415648460388184, "epoch": 3.1660021339922504, "grad_norm": 1.03125, "learning_rate": 0.0004021340652780321, "loss": 5.1234, "mean_token_accuracy": 0.20084903985261918, "num_tokens": 62904797.0, "step": 28190 }, { "entropy": 5.427558708190918, "epoch": 3.1665637109002076, "grad_norm": 1.0, "learning_rate": 0.0004021009380190801, "loss": 5.0455, "mean_token_accuracy": 0.2106771722435951, "num_tokens": 62914739.0, "step": 28195 }, { "entropy": 5.356130456924438, "epoch": 3.1671252878081653, "grad_norm": 1.046875, "learning_rate": 0.00040206780671318495, "loss": 5.0561, "mean_token_accuracy": 0.2133734792470932, "num_tokens": 62925183.0, "step": 28200 }, { "entropy": 5.358009910583496, "epoch": 3.167686864716123, "grad_norm": 0.98046875, "learning_rate": 0.0004020346713614015, "loss": 5.0443, "mean_token_accuracy": 0.20596429258584975, "num_tokens": 62936197.0, "step": 28205 }, { "entropy": 5.395763111114502, "epoch": 3.1682484416240806, "grad_norm": 0.984375, "learning_rate": 0.00040200153196478486, "loss": 5.0925, "mean_token_accuracy": 0.2067570447921753, "num_tokens": 62947571.0, "step": 28210 }, { "entropy": 5.380672597885132, "epoch": 3.168810018532038, "grad_norm": 1.0078125, "learning_rate": 0.0004019683885243902, "loss": 5.0785, "mean_token_accuracy": 0.21214079856872559, "num_tokens": 62957614.0, "step": 28215 }, { "entropy": 5.353319311141968, "epoch": 3.1693715954399955, "grad_norm": 1.0078125, "learning_rate": 0.0004019352410412728, "loss": 4.9834, "mean_token_accuracy": 0.21977371722459793, "num_tokens": 62968840.0, "step": 28220 }, { "entropy": 5.387166929244995, "epoch": 3.169933172347953, "grad_norm": 1.0, "learning_rate": 0.00040190208951648807, "loss": 5.0854, "mean_token_accuracy": 0.20981072187423705, "num_tokens": 62979956.0, "step": 28225 }, { "entropy": 5.391596126556396, "epoch": 3.170494749255911, "grad_norm": 1.0625, "learning_rate": 0.0004018689339510916, "loss": 5.017, "mean_token_accuracy": 0.2134726330637932, "num_tokens": 62991352.0, "step": 28230 }, { "entropy": 5.539651823043823, "epoch": 3.171056326163868, "grad_norm": 1.0859375, "learning_rate": 0.00040183577434613904, "loss": 5.2219, "mean_token_accuracy": 0.201230089366436, "num_tokens": 63002738.0, "step": 28235 }, { "entropy": 5.46684718132019, "epoch": 3.1716179030718257, "grad_norm": 0.9453125, "learning_rate": 0.0004018026107026863, "loss": 5.143, "mean_token_accuracy": 0.20960735976696016, "num_tokens": 63013989.0, "step": 28240 }, { "entropy": 5.348393201828003, "epoch": 3.1721794799797833, "grad_norm": 1.0859375, "learning_rate": 0.0004017694430217892, "loss": 5.0042, "mean_token_accuracy": 0.20906526744365692, "num_tokens": 63026158.0, "step": 28245 }, { "entropy": 5.276983785629272, "epoch": 3.172741056887741, "grad_norm": 0.9453125, "learning_rate": 0.0004017362713045039, "loss": 4.9587, "mean_token_accuracy": 0.21678174138069153, "num_tokens": 63036432.0, "step": 28250 }, { "entropy": 5.438896131515503, "epoch": 3.173302633795698, "grad_norm": 0.96484375, "learning_rate": 0.00040170309555188655, "loss": 5.0741, "mean_token_accuracy": 0.20916943848133088, "num_tokens": 63047151.0, "step": 28255 }, { "entropy": 5.342494201660156, "epoch": 3.173864210703656, "grad_norm": 1.0625, "learning_rate": 0.0004016699157649936, "loss": 5.0614, "mean_token_accuracy": 0.2089928060770035, "num_tokens": 63059514.0, "step": 28260 }, { "entropy": 5.475094127655029, "epoch": 3.1744257876116135, "grad_norm": 0.96875, "learning_rate": 0.0004016367319448812, "loss": 5.2785, "mean_token_accuracy": 0.20070800930261612, "num_tokens": 63071037.0, "step": 28265 }, { "entropy": 5.445153617858887, "epoch": 3.1749873645195708, "grad_norm": 1.046875, "learning_rate": 0.00040160354409260625, "loss": 5.0622, "mean_token_accuracy": 0.20755532383918762, "num_tokens": 63083615.0, "step": 28270 }, { "entropy": 5.390350198745727, "epoch": 3.1755489414275284, "grad_norm": 1.0390625, "learning_rate": 0.0004015703522092254, "loss": 5.0918, "mean_token_accuracy": 0.21055447012186052, "num_tokens": 63094377.0, "step": 28275 }, { "entropy": 5.328070402145386, "epoch": 3.176110518335486, "grad_norm": 0.96875, "learning_rate": 0.0004015371562957954, "loss": 5.0404, "mean_token_accuracy": 0.21093183010816574, "num_tokens": 63105108.0, "step": 28280 }, { "entropy": 5.481532192230224, "epoch": 3.1766720952434437, "grad_norm": 0.94140625, "learning_rate": 0.0004015039563533732, "loss": 5.179, "mean_token_accuracy": 0.20188043117523194, "num_tokens": 63116576.0, "step": 28285 }, { "entropy": 5.467678260803223, "epoch": 3.177233672151401, "grad_norm": 1.0234375, "learning_rate": 0.0004014707523830161, "loss": 5.1376, "mean_token_accuracy": 0.20718589425086975, "num_tokens": 63128343.0, "step": 28290 }, { "entropy": 5.4789817333221436, "epoch": 3.1777952490593586, "grad_norm": 0.93359375, "learning_rate": 0.0004014375443857811, "loss": 5.2628, "mean_token_accuracy": 0.20177952349185943, "num_tokens": 63140309.0, "step": 28295 }, { "entropy": 5.461684131622315, "epoch": 3.1783568259673163, "grad_norm": 0.9296875, "learning_rate": 0.0004014043323627257, "loss": 5.1217, "mean_token_accuracy": 0.21024358868598939, "num_tokens": 63150825.0, "step": 28300 }, { "entropy": 5.427690601348877, "epoch": 3.178918402875274, "grad_norm": 1.0546875, "learning_rate": 0.0004013711163149072, "loss": 5.0152, "mean_token_accuracy": 0.21917017847299575, "num_tokens": 63161296.0, "step": 28305 }, { "entropy": 5.3100550174713135, "epoch": 3.179479979783231, "grad_norm": 1.046875, "learning_rate": 0.00040133789624338353, "loss": 5.0098, "mean_token_accuracy": 0.21330492645502092, "num_tokens": 63171447.0, "step": 28310 }, { "entropy": 5.332453060150146, "epoch": 3.180041556691189, "grad_norm": 1.046875, "learning_rate": 0.00040130467214921216, "loss": 5.095, "mean_token_accuracy": 0.19951386898756027, "num_tokens": 63182860.0, "step": 28315 }, { "entropy": 5.468055629730225, "epoch": 3.1806031335991465, "grad_norm": 1.09375, "learning_rate": 0.000401271444033451, "loss": 5.1018, "mean_token_accuracy": 0.20608717799186707, "num_tokens": 63192894.0, "step": 28320 }, { "entropy": 5.4533641815185545, "epoch": 3.181164710507104, "grad_norm": 1.046875, "learning_rate": 0.0004012382118971582, "loss": 5.1335, "mean_token_accuracy": 0.2035526528954506, "num_tokens": 63204013.0, "step": 28325 }, { "entropy": 5.358470106124878, "epoch": 3.1817262874150614, "grad_norm": 1.03125, "learning_rate": 0.0004012049757413917, "loss": 5.0244, "mean_token_accuracy": 0.2130138710141182, "num_tokens": 63215079.0, "step": 28330 }, { "entropy": 5.348422527313232, "epoch": 3.182287864323019, "grad_norm": 1.0703125, "learning_rate": 0.00040117173556720976, "loss": 5.062, "mean_token_accuracy": 0.20759831368923187, "num_tokens": 63225185.0, "step": 28335 }, { "entropy": 5.47285532951355, "epoch": 3.1828494412309767, "grad_norm": 1.1796875, "learning_rate": 0.00040113849137567094, "loss": 5.0698, "mean_token_accuracy": 0.20581945180892944, "num_tokens": 63237490.0, "step": 28340 }, { "entropy": 5.363579559326172, "epoch": 3.1834110181389343, "grad_norm": 0.9765625, "learning_rate": 0.0004011052431678336, "loss": 4.9905, "mean_token_accuracy": 0.21477397829294204, "num_tokens": 63247774.0, "step": 28345 }, { "entropy": 5.317459392547607, "epoch": 3.1839725950468916, "grad_norm": 1.03125, "learning_rate": 0.0004010719909447564, "loss": 5.0641, "mean_token_accuracy": 0.21031411737203598, "num_tokens": 63258953.0, "step": 28350 }, { "entropy": 5.38041672706604, "epoch": 3.1845341719548492, "grad_norm": 1.015625, "learning_rate": 0.0004010387347074981, "loss": 5.0524, "mean_token_accuracy": 0.20946240276098252, "num_tokens": 63269670.0, "step": 28355 }, { "entropy": 5.3769121170043945, "epoch": 3.185095748862807, "grad_norm": 1.1328125, "learning_rate": 0.00040100547445711765, "loss": 5.0615, "mean_token_accuracy": 0.21452366858720778, "num_tokens": 63280644.0, "step": 28360 }, { "entropy": 5.435745334625244, "epoch": 3.185657325770764, "grad_norm": 1.1328125, "learning_rate": 0.00040097221019467393, "loss": 5.0584, "mean_token_accuracy": 0.20811499357223512, "num_tokens": 63292328.0, "step": 28365 }, { "entropy": 5.291597557067871, "epoch": 3.1862189026787218, "grad_norm": 1.0546875, "learning_rate": 0.0004009389419212262, "loss": 4.9218, "mean_token_accuracy": 0.21554968655109405, "num_tokens": 63302849.0, "step": 28370 }, { "entropy": 5.310023069381714, "epoch": 3.1867804795866794, "grad_norm": 1.0078125, "learning_rate": 0.00040090566963783375, "loss": 5.0863, "mean_token_accuracy": 0.20935720950365067, "num_tokens": 63314460.0, "step": 28375 }, { "entropy": 5.418254280090332, "epoch": 3.187342056494637, "grad_norm": 1.109375, "learning_rate": 0.00040087239334555603, "loss": 5.0818, "mean_token_accuracy": 0.2132833182811737, "num_tokens": 63325713.0, "step": 28380 }, { "entropy": 5.384374618530273, "epoch": 3.1879036334025943, "grad_norm": 1.0, "learning_rate": 0.00040083911304545234, "loss": 5.0922, "mean_token_accuracy": 0.20856288820505142, "num_tokens": 63338287.0, "step": 28385 }, { "entropy": 5.4218504428863525, "epoch": 3.188465210310552, "grad_norm": 0.91015625, "learning_rate": 0.00040080582873858254, "loss": 5.0301, "mean_token_accuracy": 0.2171464294195175, "num_tokens": 63349592.0, "step": 28390 }, { "entropy": 5.412782287597656, "epoch": 3.1890267872185096, "grad_norm": 1.015625, "learning_rate": 0.0004007725404260064, "loss": 4.9779, "mean_token_accuracy": 0.21879738420248032, "num_tokens": 63359913.0, "step": 28395 }, { "entropy": 5.397561120986938, "epoch": 3.1895883641264673, "grad_norm": 1.0546875, "learning_rate": 0.0004007392481087837, "loss": 5.0962, "mean_token_accuracy": 0.20600663125514984, "num_tokens": 63370677.0, "step": 28400 }, { "entropy": 5.403140211105347, "epoch": 3.1901499410344245, "grad_norm": 1.03125, "learning_rate": 0.0004007059517879747, "loss": 5.0149, "mean_token_accuracy": 0.220577572286129, "num_tokens": 63381467.0, "step": 28405 }, { "entropy": 5.407635354995728, "epoch": 3.190711517942382, "grad_norm": 1.0078125, "learning_rate": 0.0004006726514646393, "loss": 5.1277, "mean_token_accuracy": 0.20360197573900224, "num_tokens": 63392808.0, "step": 28410 }, { "entropy": 5.351781177520752, "epoch": 3.19127309485034, "grad_norm": 1.1953125, "learning_rate": 0.00040063934713983803, "loss": 4.9886, "mean_token_accuracy": 0.2114964246749878, "num_tokens": 63405206.0, "step": 28415 }, { "entropy": 5.247720527648926, "epoch": 3.1918346717582975, "grad_norm": 0.93359375, "learning_rate": 0.00040060603881463127, "loss": 4.9779, "mean_token_accuracy": 0.22029895782470704, "num_tokens": 63416923.0, "step": 28420 }, { "entropy": 5.396749448776245, "epoch": 3.1923962486662547, "grad_norm": 1.0546875, "learning_rate": 0.00040057272649007944, "loss": 5.0375, "mean_token_accuracy": 0.21746097803115844, "num_tokens": 63426681.0, "step": 28425 }, { "entropy": 5.474124622344971, "epoch": 3.1929578255742124, "grad_norm": 1.375, "learning_rate": 0.00040053941016724326, "loss": 5.0209, "mean_token_accuracy": 0.2100441887974739, "num_tokens": 63437299.0, "step": 28430 }, { "entropy": 5.4104818344116214, "epoch": 3.19351940248217, "grad_norm": 1.0, "learning_rate": 0.00040050608984718364, "loss": 5.1265, "mean_token_accuracy": 0.21083631217479706, "num_tokens": 63449075.0, "step": 28435 }, { "entropy": 5.346947813034058, "epoch": 3.1940809793901277, "grad_norm": 1.078125, "learning_rate": 0.0004004727655309614, "loss": 5.0934, "mean_token_accuracy": 0.20612076967954635, "num_tokens": 63460592.0, "step": 28440 }, { "entropy": 5.4009459018707275, "epoch": 3.194642556298085, "grad_norm": 0.99609375, "learning_rate": 0.00040043943721963766, "loss": 5.0881, "mean_token_accuracy": 0.21108666509389878, "num_tokens": 63471043.0, "step": 28445 }, { "entropy": 5.424647569656372, "epoch": 3.1952041332060426, "grad_norm": 1.1640625, "learning_rate": 0.00040040610491427357, "loss": 5.1776, "mean_token_accuracy": 0.20492968410253526, "num_tokens": 63482556.0, "step": 28450 }, { "entropy": 5.546213579177857, "epoch": 3.1957657101140002, "grad_norm": 1.015625, "learning_rate": 0.0004003727686159305, "loss": 5.2191, "mean_token_accuracy": 0.19550352543592453, "num_tokens": 63493973.0, "step": 28455 }, { "entropy": 5.4872173309326175, "epoch": 3.1963272870219575, "grad_norm": 1.0234375, "learning_rate": 0.00040033942832566984, "loss": 5.1699, "mean_token_accuracy": 0.20103065967559813, "num_tokens": 63504489.0, "step": 28460 }, { "entropy": 5.45712947845459, "epoch": 3.196888863929915, "grad_norm": 1.171875, "learning_rate": 0.0004003060840445531, "loss": 5.0925, "mean_token_accuracy": 0.20569583475589753, "num_tokens": 63516688.0, "step": 28465 }, { "entropy": 5.497138929367066, "epoch": 3.1974504408378728, "grad_norm": 1.0859375, "learning_rate": 0.0004002727357736422, "loss": 5.186, "mean_token_accuracy": 0.19955952763557433, "num_tokens": 63528680.0, "step": 28470 }, { "entropy": 5.417816781997681, "epoch": 3.1980120177458304, "grad_norm": 1.0078125, "learning_rate": 0.00040023938351399865, "loss": 5.1244, "mean_token_accuracy": 0.20729057341814042, "num_tokens": 63540489.0, "step": 28475 }, { "entropy": 5.416037559509277, "epoch": 3.1985735946537877, "grad_norm": 1.0703125, "learning_rate": 0.0004002060272666846, "loss": 5.114, "mean_token_accuracy": 0.20621969401836396, "num_tokens": 63551974.0, "step": 28480 }, { "entropy": 5.472271680831909, "epoch": 3.1991351715617453, "grad_norm": 0.984375, "learning_rate": 0.0004001726670327621, "loss": 5.1608, "mean_token_accuracy": 0.20238917022943498, "num_tokens": 63564437.0, "step": 28485 }, { "entropy": 5.408360862731934, "epoch": 3.199696748469703, "grad_norm": 1.0625, "learning_rate": 0.0004001393028132933, "loss": 5.0231, "mean_token_accuracy": 0.2172163262963295, "num_tokens": 63575041.0, "step": 28490 }, { "entropy": 5.3929835796356205, "epoch": 3.2002583253776606, "grad_norm": 1.0, "learning_rate": 0.00040010593460934065, "loss": 5.0741, "mean_token_accuracy": 0.21043936312198638, "num_tokens": 63587381.0, "step": 28495 }, { "entropy": 5.441640377044678, "epoch": 3.200819902285618, "grad_norm": 0.984375, "learning_rate": 0.00040007256242196644, "loss": 5.141, "mean_token_accuracy": 0.2037556990981102, "num_tokens": 63599206.0, "step": 28500 }, { "entropy": 5.436296463012695, "epoch": 3.2013814791935755, "grad_norm": 1.09375, "learning_rate": 0.00040003918625223335, "loss": 5.0615, "mean_token_accuracy": 0.20868833661079406, "num_tokens": 63609557.0, "step": 28505 }, { "entropy": 5.4003137111663815, "epoch": 3.201943056101533, "grad_norm": 0.97265625, "learning_rate": 0.00040000580610120406, "loss": 5.0471, "mean_token_accuracy": 0.2103464812040329, "num_tokens": 63620423.0, "step": 28510 }, { "entropy": 5.5319455623626705, "epoch": 3.202504633009491, "grad_norm": 1.0546875, "learning_rate": 0.0003999724219699415, "loss": 5.1965, "mean_token_accuracy": 0.2069829598069191, "num_tokens": 63632222.0, "step": 28515 }, { "entropy": 5.367495536804199, "epoch": 3.203066209917448, "grad_norm": 0.96875, "learning_rate": 0.0003999390338595085, "loss": 5.0692, "mean_token_accuracy": 0.20581168979406356, "num_tokens": 63643077.0, "step": 28520 }, { "entropy": 5.340481472015381, "epoch": 3.2036277868254057, "grad_norm": 1.125, "learning_rate": 0.00039990564177096817, "loss": 4.9724, "mean_token_accuracy": 0.22106637954711914, "num_tokens": 63653642.0, "step": 28525 }, { "entropy": 5.392149591445923, "epoch": 3.2041893637333634, "grad_norm": 1.0078125, "learning_rate": 0.0003998722457053838, "loss": 5.1158, "mean_token_accuracy": 0.20577940344810486, "num_tokens": 63665646.0, "step": 28530 }, { "entropy": 5.516965532302857, "epoch": 3.204750940641321, "grad_norm": 1.015625, "learning_rate": 0.00039983884566381866, "loss": 5.1894, "mean_token_accuracy": 0.20132894068956375, "num_tokens": 63677928.0, "step": 28535 }, { "entropy": 5.411691045761108, "epoch": 3.2053125175492783, "grad_norm": 1.0859375, "learning_rate": 0.0003998054416473363, "loss": 5.0578, "mean_token_accuracy": 0.20992235988378524, "num_tokens": 63688670.0, "step": 28540 }, { "entropy": 5.469873523712158, "epoch": 3.205874094457236, "grad_norm": 1.0234375, "learning_rate": 0.00039977203365700026, "loss": 5.1626, "mean_token_accuracy": 0.20944867581129073, "num_tokens": 63699963.0, "step": 28545 }, { "entropy": 5.452686500549317, "epoch": 3.2064356713651936, "grad_norm": 1.015625, "learning_rate": 0.0003997386216938743, "loss": 5.1677, "mean_token_accuracy": 0.20281137228012086, "num_tokens": 63711333.0, "step": 28550 }, { "entropy": 5.389166355133057, "epoch": 3.206997248273151, "grad_norm": 1.0078125, "learning_rate": 0.00039970520575902216, "loss": 5.0216, "mean_token_accuracy": 0.2139328807592392, "num_tokens": 63721916.0, "step": 28555 }, { "entropy": 5.33886399269104, "epoch": 3.2075588251811085, "grad_norm": 1.0234375, "learning_rate": 0.000399671785853508, "loss": 5.0889, "mean_token_accuracy": 0.20826449394226074, "num_tokens": 63733313.0, "step": 28560 }, { "entropy": 5.450829124450683, "epoch": 3.208120402089066, "grad_norm": 1.1015625, "learning_rate": 0.00039963836197839584, "loss": 5.1025, "mean_token_accuracy": 0.20751923173666, "num_tokens": 63743249.0, "step": 28565 }, { "entropy": 5.421046733856201, "epoch": 3.208681978997024, "grad_norm": 0.99609375, "learning_rate": 0.00039960493413474977, "loss": 5.0859, "mean_token_accuracy": 0.2047840029001236, "num_tokens": 63754355.0, "step": 28570 }, { "entropy": 5.616373348236084, "epoch": 3.209243555904981, "grad_norm": 1.046875, "learning_rate": 0.00039957150232363433, "loss": 5.2407, "mean_token_accuracy": 0.2013968363404274, "num_tokens": 63766620.0, "step": 28575 }, { "entropy": 5.413175344467163, "epoch": 3.2098051328129387, "grad_norm": 0.9765625, "learning_rate": 0.000399538066546114, "loss": 5.0031, "mean_token_accuracy": 0.2153948575258255, "num_tokens": 63777195.0, "step": 28580 }, { "entropy": 5.251968717575073, "epoch": 3.2103667097208963, "grad_norm": 0.96484375, "learning_rate": 0.00039950462680325336, "loss": 5.0227, "mean_token_accuracy": 0.2120744451880455, "num_tokens": 63787653.0, "step": 28585 }, { "entropy": 5.384004306793213, "epoch": 3.210928286628854, "grad_norm": 0.92578125, "learning_rate": 0.000399471183096117, "loss": 5.0916, "mean_token_accuracy": 0.2100202724337578, "num_tokens": 63799371.0, "step": 28590 }, { "entropy": 5.3632035732269285, "epoch": 3.211489863536811, "grad_norm": 1.0234375, "learning_rate": 0.0003994377354257698, "loss": 4.9101, "mean_token_accuracy": 0.22429251968860625, "num_tokens": 63809791.0, "step": 28595 }, { "entropy": 5.405872392654419, "epoch": 3.212051440444769, "grad_norm": 1.0078125, "learning_rate": 0.00039940428379327703, "loss": 5.0271, "mean_token_accuracy": 0.20735361874103547, "num_tokens": 63819972.0, "step": 28600 }, { "entropy": 5.282958841323852, "epoch": 3.2126130173527265, "grad_norm": 1.046875, "learning_rate": 0.0003993708281997036, "loss": 5.0285, "mean_token_accuracy": 0.21166979223489762, "num_tokens": 63830144.0, "step": 28605 }, { "entropy": 5.4276477813720705, "epoch": 3.213174594260684, "grad_norm": 1.0390625, "learning_rate": 0.0003993373686461147, "loss": 5.1164, "mean_token_accuracy": 0.20310243368148803, "num_tokens": 63842393.0, "step": 28610 }, { "entropy": 5.4160240650177, "epoch": 3.2137361711686414, "grad_norm": 0.99609375, "learning_rate": 0.0003993039051335758, "loss": 5.0499, "mean_token_accuracy": 0.20646465420722962, "num_tokens": 63853392.0, "step": 28615 }, { "entropy": 5.408242559432983, "epoch": 3.214297748076599, "grad_norm": 1.6328125, "learning_rate": 0.0003992704376631523, "loss": 5.076, "mean_token_accuracy": 0.2094378799200058, "num_tokens": 63866037.0, "step": 28620 }, { "entropy": 5.4197062969207765, "epoch": 3.2148593249845567, "grad_norm": 1.0390625, "learning_rate": 0.0003992369662359099, "loss": 5.0411, "mean_token_accuracy": 0.21735747903585434, "num_tokens": 63876264.0, "step": 28625 }, { "entropy": 5.321604824066162, "epoch": 3.2154209018925144, "grad_norm": 1.0859375, "learning_rate": 0.0003992034908529143, "loss": 4.9593, "mean_token_accuracy": 0.2183077111840248, "num_tokens": 63887545.0, "step": 28630 }, { "entropy": 5.335014152526855, "epoch": 3.2159824788004716, "grad_norm": 1.09375, "learning_rate": 0.00039917001151523144, "loss": 5.0808, "mean_token_accuracy": 0.20897796005010605, "num_tokens": 63897689.0, "step": 28635 }, { "entropy": 5.446640157699585, "epoch": 3.2165440557084293, "grad_norm": 1.03125, "learning_rate": 0.0003991365282239272, "loss": 5.0091, "mean_token_accuracy": 0.20989546030759812, "num_tokens": 63908884.0, "step": 28640 }, { "entropy": 5.407545757293701, "epoch": 3.217105632616387, "grad_norm": 1.0234375, "learning_rate": 0.00039910304098006775, "loss": 5.0056, "mean_token_accuracy": 0.2112713560461998, "num_tokens": 63918515.0, "step": 28645 }, { "entropy": 5.298788070678711, "epoch": 3.217667209524344, "grad_norm": 0.9765625, "learning_rate": 0.0003990695497847193, "loss": 5.0203, "mean_token_accuracy": 0.21219899505376816, "num_tokens": 63928802.0, "step": 28650 }, { "entropy": 5.390778064727783, "epoch": 3.218228786432302, "grad_norm": 1.046875, "learning_rate": 0.0003990360546389484, "loss": 5.0433, "mean_token_accuracy": 0.21562667191028595, "num_tokens": 63940770.0, "step": 28655 }, { "entropy": 5.499038791656494, "epoch": 3.2187903633402595, "grad_norm": 0.9609375, "learning_rate": 0.00039900255554382126, "loss": 5.1033, "mean_token_accuracy": 0.21429233849048615, "num_tokens": 63951851.0, "step": 28660 }, { "entropy": 5.415889024734497, "epoch": 3.219351940248217, "grad_norm": 1.1328125, "learning_rate": 0.00039896905250040473, "loss": 5.087, "mean_token_accuracy": 0.21313603818416596, "num_tokens": 63962768.0, "step": 28665 }, { "entropy": 5.361529588699341, "epoch": 3.2199135171561744, "grad_norm": 1.0390625, "learning_rate": 0.00039893554550976545, "loss": 5.0885, "mean_token_accuracy": 0.20271364748477935, "num_tokens": 63973855.0, "step": 28670 }, { "entropy": 5.498661947250366, "epoch": 3.220475094064132, "grad_norm": 0.9140625, "learning_rate": 0.0003989020345729705, "loss": 5.2124, "mean_token_accuracy": 0.20209450721740724, "num_tokens": 63986342.0, "step": 28675 }, { "entropy": 5.412326860427856, "epoch": 3.2210366709720897, "grad_norm": 0.95703125, "learning_rate": 0.00039886851969108653, "loss": 5.0308, "mean_token_accuracy": 0.21272003501653672, "num_tokens": 63997080.0, "step": 28680 }, { "entropy": 5.3629402160644535, "epoch": 3.2215982478800473, "grad_norm": 1.0234375, "learning_rate": 0.00039883500086518086, "loss": 5.0369, "mean_token_accuracy": 0.21081904470920562, "num_tokens": 64007373.0, "step": 28685 }, { "entropy": 5.398982429504395, "epoch": 3.2221598247880046, "grad_norm": 0.9140625, "learning_rate": 0.00039880147809632084, "loss": 5.1452, "mean_token_accuracy": 0.2108266457915306, "num_tokens": 64018429.0, "step": 28690 }, { "entropy": 5.384691953659058, "epoch": 3.222721401695962, "grad_norm": 0.99609375, "learning_rate": 0.00039876795138557363, "loss": 5.0758, "mean_token_accuracy": 0.21195996701717376, "num_tokens": 64028633.0, "step": 28695 }, { "entropy": 5.4782429218292235, "epoch": 3.22328297860392, "grad_norm": 0.94921875, "learning_rate": 0.0003987344207340069, "loss": 5.1024, "mean_token_accuracy": 0.21205249130725862, "num_tokens": 64040860.0, "step": 28700 }, { "entropy": 5.461325025558471, "epoch": 3.2238445555118775, "grad_norm": 0.9296875, "learning_rate": 0.00039870088614268824, "loss": 5.1894, "mean_token_accuracy": 0.2059697315096855, "num_tokens": 64053141.0, "step": 28705 }, { "entropy": 5.312066745758057, "epoch": 3.2244061324198348, "grad_norm": 0.96484375, "learning_rate": 0.00039866734761268534, "loss": 4.973, "mean_token_accuracy": 0.21816044598817824, "num_tokens": 64064583.0, "step": 28710 }, { "entropy": 5.492320919036866, "epoch": 3.2249677093277924, "grad_norm": 1.0546875, "learning_rate": 0.00039863380514506614, "loss": 5.1656, "mean_token_accuracy": 0.2053701549768448, "num_tokens": 64075368.0, "step": 28715 }, { "entropy": 5.4458568572998045, "epoch": 3.22552928623575, "grad_norm": 0.95703125, "learning_rate": 0.00039860025874089865, "loss": 5.1268, "mean_token_accuracy": 0.21108191162347795, "num_tokens": 64085815.0, "step": 28720 }, { "entropy": 5.340099620819092, "epoch": 3.2260908631437077, "grad_norm": 0.94921875, "learning_rate": 0.000398566708401251, "loss": 5.0216, "mean_token_accuracy": 0.21570814549922943, "num_tokens": 64096825.0, "step": 28725 }, { "entropy": 5.38615345954895, "epoch": 3.226652440051665, "grad_norm": 1.0546875, "learning_rate": 0.00039853315412719144, "loss": 5.0676, "mean_token_accuracy": 0.21554668098688126, "num_tokens": 64108010.0, "step": 28730 }, { "entropy": 5.464564466476441, "epoch": 3.2272140169596226, "grad_norm": 1.1015625, "learning_rate": 0.0003984995959197883, "loss": 5.1035, "mean_token_accuracy": 0.20517665147781372, "num_tokens": 64119829.0, "step": 28735 }, { "entropy": 5.363821506500244, "epoch": 3.2277755938675803, "grad_norm": 1.0, "learning_rate": 0.0003984660337801101, "loss": 4.9901, "mean_token_accuracy": 0.21391381025314332, "num_tokens": 64130138.0, "step": 28740 }, { "entropy": 5.395666456222534, "epoch": 3.2283371707755375, "grad_norm": 0.9609375, "learning_rate": 0.00039843246770922557, "loss": 5.0553, "mean_token_accuracy": 0.20505425781011583, "num_tokens": 64141651.0, "step": 28745 }, { "entropy": 5.4843505859375, "epoch": 3.228898747683495, "grad_norm": 1.0078125, "learning_rate": 0.0003983988977082033, "loss": 5.1495, "mean_token_accuracy": 0.20380108654499055, "num_tokens": 64152718.0, "step": 28750 }, { "entropy": 5.403435707092285, "epoch": 3.229460324591453, "grad_norm": 0.953125, "learning_rate": 0.00039836532377811237, "loss": 5.1159, "mean_token_accuracy": 0.21283408850431443, "num_tokens": 64163977.0, "step": 28755 }, { "entropy": 5.350397682189941, "epoch": 3.2300219014994105, "grad_norm": 0.99609375, "learning_rate": 0.0003983317459200217, "loss": 5.0784, "mean_token_accuracy": 0.2126191660761833, "num_tokens": 64175298.0, "step": 28760 }, { "entropy": 5.429139471054077, "epoch": 3.2305834784073677, "grad_norm": 1.09375, "learning_rate": 0.00039829816413500035, "loss": 5.1069, "mean_token_accuracy": 0.2088781028985977, "num_tokens": 64186746.0, "step": 28765 }, { "entropy": 5.4399628162384035, "epoch": 3.2311450553153254, "grad_norm": 1.0546875, "learning_rate": 0.0003982645784241176, "loss": 5.1027, "mean_token_accuracy": 0.20521072596311568, "num_tokens": 64198682.0, "step": 28770 }, { "entropy": 5.435688638687134, "epoch": 3.231706632223283, "grad_norm": 0.99609375, "learning_rate": 0.0003982309887884429, "loss": 5.0707, "mean_token_accuracy": 0.21290123015642165, "num_tokens": 64210425.0, "step": 28775 }, { "entropy": 5.380758810043335, "epoch": 3.2322682091312407, "grad_norm": 0.95703125, "learning_rate": 0.00039819739522904576, "loss": 4.9791, "mean_token_accuracy": 0.21530184000730515, "num_tokens": 64222839.0, "step": 28780 }, { "entropy": 5.318582391738891, "epoch": 3.232829786039198, "grad_norm": 0.953125, "learning_rate": 0.00039816379774699573, "loss": 5.0559, "mean_token_accuracy": 0.21565458178520203, "num_tokens": 64234235.0, "step": 28785 }, { "entropy": 5.403061723709106, "epoch": 3.2333913629471556, "grad_norm": 1.0703125, "learning_rate": 0.00039813019634336264, "loss": 5.0522, "mean_token_accuracy": 0.20885741710662842, "num_tokens": 64244607.0, "step": 28790 }, { "entropy": 5.417196273803711, "epoch": 3.2339529398551132, "grad_norm": 1.015625, "learning_rate": 0.0003980965910192163, "loss": 5.072, "mean_token_accuracy": 0.20620408207178115, "num_tokens": 64254434.0, "step": 28795 }, { "entropy": 5.323205089569091, "epoch": 3.234514516763071, "grad_norm": 0.95703125, "learning_rate": 0.00039806298177562675, "loss": 5.0352, "mean_token_accuracy": 0.21107323914766313, "num_tokens": 64266693.0, "step": 28800 }, { "entropy": 5.386083793640137, "epoch": 3.235076093671028, "grad_norm": 0.9609375, "learning_rate": 0.00039802936861366416, "loss": 5.0476, "mean_token_accuracy": 0.21241853684186934, "num_tokens": 64277901.0, "step": 28805 }, { "entropy": 5.4404394149780275, "epoch": 3.2356376705789858, "grad_norm": 0.9921875, "learning_rate": 0.0003979957515343988, "loss": 5.0954, "mean_token_accuracy": 0.21260495036840438, "num_tokens": 64288583.0, "step": 28810 }, { "entropy": 5.4045570373535154, "epoch": 3.2361992474869434, "grad_norm": 1.0546875, "learning_rate": 0.000397962130538901, "loss": 5.0054, "mean_token_accuracy": 0.2141669884324074, "num_tokens": 64299688.0, "step": 28815 }, { "entropy": 5.311158037185669, "epoch": 3.236760824394901, "grad_norm": 1.09375, "learning_rate": 0.00039792850562824124, "loss": 5.0441, "mean_token_accuracy": 0.21075428575277327, "num_tokens": 64311150.0, "step": 28820 }, { "entropy": 5.344502210617065, "epoch": 3.2373224013028583, "grad_norm": 1.0703125, "learning_rate": 0.0003978948768034902, "loss": 5.0567, "mean_token_accuracy": 0.21306562423706055, "num_tokens": 64322658.0, "step": 28825 }, { "entropy": 5.393837738037109, "epoch": 3.237883978210816, "grad_norm": 1.0, "learning_rate": 0.00039786124406571854, "loss": 4.9983, "mean_token_accuracy": 0.21311597824096679, "num_tokens": 64333350.0, "step": 28830 }, { "entropy": 5.4702075004577635, "epoch": 3.2384455551187736, "grad_norm": 1.046875, "learning_rate": 0.00039782760741599734, "loss": 5.1338, "mean_token_accuracy": 0.20816671699285508, "num_tokens": 64344689.0, "step": 28835 }, { "entropy": 5.328089952468872, "epoch": 3.239007132026731, "grad_norm": 1.078125, "learning_rate": 0.0003977939668553973, "loss": 5.0897, "mean_token_accuracy": 0.21069820374250411, "num_tokens": 64356602.0, "step": 28840 }, { "entropy": 5.378416872024536, "epoch": 3.2395687089346885, "grad_norm": 1.09375, "learning_rate": 0.00039776032238498995, "loss": 5.0466, "mean_token_accuracy": 0.20884627401828765, "num_tokens": 64368496.0, "step": 28845 }, { "entropy": 5.466111707687378, "epoch": 3.240130285842646, "grad_norm": 1.03125, "learning_rate": 0.0003977266740058462, "loss": 5.0688, "mean_token_accuracy": 0.21359820663928986, "num_tokens": 64379374.0, "step": 28850 }, { "entropy": 5.44654483795166, "epoch": 3.240691862750604, "grad_norm": 1.0234375, "learning_rate": 0.0003976930217190376, "loss": 5.0505, "mean_token_accuracy": 0.21293716877698898, "num_tokens": 64391006.0, "step": 28855 }, { "entropy": 5.314650249481201, "epoch": 3.241253439658561, "grad_norm": 0.93359375, "learning_rate": 0.0003976593655256356, "loss": 5.0276, "mean_token_accuracy": 0.21335606873035431, "num_tokens": 64403100.0, "step": 28860 }, { "entropy": 5.32732048034668, "epoch": 3.2418150165665187, "grad_norm": 0.99609375, "learning_rate": 0.00039762570542671176, "loss": 4.9796, "mean_token_accuracy": 0.21560219228267669, "num_tokens": 64413763.0, "step": 28865 }, { "entropy": 5.329283952713013, "epoch": 3.2423765934744764, "grad_norm": 1.0234375, "learning_rate": 0.000397592041423338, "loss": 4.9352, "mean_token_accuracy": 0.21257373541593552, "num_tokens": 64425289.0, "step": 28870 }, { "entropy": 5.457923173904419, "epoch": 3.242938170382434, "grad_norm": 1.03125, "learning_rate": 0.00039755837351658605, "loss": 5.0291, "mean_token_accuracy": 0.21684283316135405, "num_tokens": 64436080.0, "step": 28875 }, { "entropy": 5.350285339355469, "epoch": 3.2434997472903913, "grad_norm": 1.015625, "learning_rate": 0.0003975247017075279, "loss": 5.0552, "mean_token_accuracy": 0.2123725101351738, "num_tokens": 64447036.0, "step": 28880 }, { "entropy": 5.468393278121948, "epoch": 3.244061324198349, "grad_norm": 1.046875, "learning_rate": 0.0003974910259972358, "loss": 5.2159, "mean_token_accuracy": 0.19737545251846314, "num_tokens": 64458173.0, "step": 28885 }, { "entropy": 5.464691877365112, "epoch": 3.2446229011063066, "grad_norm": 1.03125, "learning_rate": 0.0003974573463867819, "loss": 5.0788, "mean_token_accuracy": 0.2061795711517334, "num_tokens": 64468985.0, "step": 28890 }, { "entropy": 5.417109537124634, "epoch": 3.2451844780142642, "grad_norm": 0.96875, "learning_rate": 0.00039742366287723855, "loss": 5.0808, "mean_token_accuracy": 0.21201095283031463, "num_tokens": 64479802.0, "step": 28895 }, { "entropy": 5.34335880279541, "epoch": 3.2457460549222215, "grad_norm": 1.078125, "learning_rate": 0.00039738997546967834, "loss": 5.0748, "mean_token_accuracy": 0.1971924513578415, "num_tokens": 64490072.0, "step": 28900 }, { "entropy": 5.380109405517578, "epoch": 3.246307631830179, "grad_norm": 1.0703125, "learning_rate": 0.00039735628416517394, "loss": 5.0607, "mean_token_accuracy": 0.20982010215520858, "num_tokens": 64501096.0, "step": 28905 }, { "entropy": 5.418084621429443, "epoch": 3.246869208738137, "grad_norm": 0.9375, "learning_rate": 0.00039732258896479786, "loss": 5.0715, "mean_token_accuracy": 0.21033720821142196, "num_tokens": 64512562.0, "step": 28910 }, { "entropy": 5.2806243896484375, "epoch": 3.2474307856460944, "grad_norm": 1.0, "learning_rate": 0.0003972888898696231, "loss": 4.9224, "mean_token_accuracy": 0.21237394958734512, "num_tokens": 64522955.0, "step": 28915 }, { "entropy": 5.371495962142944, "epoch": 3.2479923625540517, "grad_norm": 1.0234375, "learning_rate": 0.00039725518688072276, "loss": 5.043, "mean_token_accuracy": 0.21253226995468139, "num_tokens": 64533805.0, "step": 28920 }, { "entropy": 5.365160512924194, "epoch": 3.2485539394620093, "grad_norm": 0.9140625, "learning_rate": 0.00039722147999916976, "loss": 5.1079, "mean_token_accuracy": 0.20092564225196838, "num_tokens": 64545543.0, "step": 28925 }, { "entropy": 5.408982133865356, "epoch": 3.249115516369967, "grad_norm": 1.0625, "learning_rate": 0.0003971877692260375, "loss": 5.0964, "mean_token_accuracy": 0.20363879203796387, "num_tokens": 64557109.0, "step": 28930 }, { "entropy": 5.433042240142822, "epoch": 3.249677093277924, "grad_norm": 0.9609375, "learning_rate": 0.00039715405456239924, "loss": 5.112, "mean_token_accuracy": 0.20656547099351882, "num_tokens": 64568880.0, "step": 28935 }, { "entropy": 5.420535469055176, "epoch": 3.250238670185882, "grad_norm": 1.125, "learning_rate": 0.0003971203360093286, "loss": 5.0918, "mean_token_accuracy": 0.2168443575501442, "num_tokens": 64579859.0, "step": 28940 }, { "entropy": 5.3467161655426025, "epoch": 3.2508002470938395, "grad_norm": 1.0546875, "learning_rate": 0.00039708661356789896, "loss": 4.9731, "mean_token_accuracy": 0.21650617867708205, "num_tokens": 64589133.0, "step": 28945 }, { "entropy": 5.3822461605072025, "epoch": 3.251361824001797, "grad_norm": 0.9765625, "learning_rate": 0.00039705288723918415, "loss": 5.0365, "mean_token_accuracy": 0.21326380372047424, "num_tokens": 64600040.0, "step": 28950 }, { "entropy": 5.293115758895874, "epoch": 3.2519234009097544, "grad_norm": 0.921875, "learning_rate": 0.0003970191570242582, "loss": 4.9734, "mean_token_accuracy": 0.2207468792796135, "num_tokens": 64611756.0, "step": 28955 }, { "entropy": 5.344913291931152, "epoch": 3.252484977817712, "grad_norm": 1.015625, "learning_rate": 0.000396985422924195, "loss": 5.126, "mean_token_accuracy": 0.2110512912273407, "num_tokens": 64622994.0, "step": 28960 }, { "entropy": 5.410715770721436, "epoch": 3.2530465547256697, "grad_norm": 1.0546875, "learning_rate": 0.00039695168494006857, "loss": 4.9516, "mean_token_accuracy": 0.21140797734260558, "num_tokens": 64633200.0, "step": 28965 }, { "entropy": 5.449553394317627, "epoch": 3.2536081316336274, "grad_norm": 0.91796875, "learning_rate": 0.0003969179430729531, "loss": 5.156, "mean_token_accuracy": 0.20386087745428086, "num_tokens": 64644412.0, "step": 28970 }, { "entropy": 5.322927188873291, "epoch": 3.2541697085415846, "grad_norm": 0.92578125, "learning_rate": 0.0003968841973239231, "loss": 4.9688, "mean_token_accuracy": 0.21006208956241607, "num_tokens": 64655986.0, "step": 28975 }, { "entropy": 5.206239700317383, "epoch": 3.2547312854495423, "grad_norm": 1.015625, "learning_rate": 0.000396850447694053, "loss": 4.9558, "mean_token_accuracy": 0.2132605254650116, "num_tokens": 64667770.0, "step": 28980 }, { "entropy": 5.496365308761597, "epoch": 3.2552928623575, "grad_norm": 0.98828125, "learning_rate": 0.0003968166941844174, "loss": 5.1611, "mean_token_accuracy": 0.2046256572008133, "num_tokens": 64679239.0, "step": 28985 }, { "entropy": 5.399898099899292, "epoch": 3.2558544392654576, "grad_norm": 1.0078125, "learning_rate": 0.000396782936796091, "loss": 4.9672, "mean_token_accuracy": 0.20844251811504363, "num_tokens": 64690192.0, "step": 28990 }, { "entropy": 5.345163583755493, "epoch": 3.256416016173415, "grad_norm": 1.046875, "learning_rate": 0.0003967491755301487, "loss": 5.028, "mean_token_accuracy": 0.21284105479717255, "num_tokens": 64700692.0, "step": 28995 }, { "entropy": 5.389095211029053, "epoch": 3.2569775930813725, "grad_norm": 0.94921875, "learning_rate": 0.0003967154103876654, "loss": 5.1159, "mean_token_accuracy": 0.20665353834629058, "num_tokens": 64711753.0, "step": 29000 }, { "entropy": 5.479111194610596, "epoch": 3.25753916998933, "grad_norm": 1.0078125, "learning_rate": 0.00039668164136971615, "loss": 5.1864, "mean_token_accuracy": 0.1997473120689392, "num_tokens": 64722145.0, "step": 29005 }, { "entropy": 5.3459985733032225, "epoch": 3.258100746897288, "grad_norm": 1.078125, "learning_rate": 0.0003966478684773763, "loss": 5.0052, "mean_token_accuracy": 0.21257347166538237, "num_tokens": 64732059.0, "step": 29010 }, { "entropy": 5.412413740158081, "epoch": 3.258662323805245, "grad_norm": 1.046875, "learning_rate": 0.00039661409171172117, "loss": 5.0682, "mean_token_accuracy": 0.20907711535692214, "num_tokens": 64742811.0, "step": 29015 }, { "entropy": 5.31259822845459, "epoch": 3.2592239007132027, "grad_norm": 0.96875, "learning_rate": 0.00039658031107382615, "loss": 4.9755, "mean_token_accuracy": 0.21967145502567292, "num_tokens": 64753287.0, "step": 29020 }, { "entropy": 5.490747308731079, "epoch": 3.2597854776211603, "grad_norm": 0.99609375, "learning_rate": 0.00039654652656476695, "loss": 5.2655, "mean_token_accuracy": 0.19987978488206865, "num_tokens": 64767739.0, "step": 29025 }, { "entropy": 5.408587312698364, "epoch": 3.2603470545291175, "grad_norm": 0.9375, "learning_rate": 0.0003965127381856191, "loss": 5.0568, "mean_token_accuracy": 0.20974887162446976, "num_tokens": 64779217.0, "step": 29030 }, { "entropy": 5.423760461807251, "epoch": 3.260908631437075, "grad_norm": 1.015625, "learning_rate": 0.00039647894593745865, "loss": 5.0271, "mean_token_accuracy": 0.2162157878279686, "num_tokens": 64790613.0, "step": 29035 }, { "entropy": 5.289842748641968, "epoch": 3.261470208345033, "grad_norm": 1.0, "learning_rate": 0.00039644514982136136, "loss": 4.9675, "mean_token_accuracy": 0.2161129593849182, "num_tokens": 64801256.0, "step": 29040 }, { "entropy": 5.306471633911133, "epoch": 3.2620317852529905, "grad_norm": 0.953125, "learning_rate": 0.00039641134983840336, "loss": 4.9581, "mean_token_accuracy": 0.21952452957630159, "num_tokens": 64812938.0, "step": 29045 }, { "entropy": 5.417296695709228, "epoch": 3.2625933621609478, "grad_norm": 1.0390625, "learning_rate": 0.000396377545989661, "loss": 5.0332, "mean_token_accuracy": 0.2108813688158989, "num_tokens": 64824041.0, "step": 29050 }, { "entropy": 5.301271629333496, "epoch": 3.2631549390689054, "grad_norm": 1.1171875, "learning_rate": 0.00039634373827621047, "loss": 4.9233, "mean_token_accuracy": 0.21997078657150268, "num_tokens": 64833837.0, "step": 29055 }, { "entropy": 5.279598379135132, "epoch": 3.263716515976863, "grad_norm": 1.03125, "learning_rate": 0.0003963099266991282, "loss": 4.9459, "mean_token_accuracy": 0.21428996473550796, "num_tokens": 64843937.0, "step": 29060 }, { "entropy": 5.370728302001953, "epoch": 3.2642780928848207, "grad_norm": 1.078125, "learning_rate": 0.00039627611125949086, "loss": 5.0217, "mean_token_accuracy": 0.20744584053754805, "num_tokens": 64855955.0, "step": 29065 }, { "entropy": 5.482735681533813, "epoch": 3.264839669792778, "grad_norm": 0.984375, "learning_rate": 0.00039624229195837506, "loss": 5.1823, "mean_token_accuracy": 0.2035892277956009, "num_tokens": 64867505.0, "step": 29070 }, { "entropy": 5.344501781463623, "epoch": 3.2654012467007356, "grad_norm": 1.09375, "learning_rate": 0.00039620846879685767, "loss": 4.9483, "mean_token_accuracy": 0.2207024335861206, "num_tokens": 64878746.0, "step": 29075 }, { "entropy": 5.3951225757598875, "epoch": 3.2659628236086933, "grad_norm": 1.078125, "learning_rate": 0.00039617464177601564, "loss": 5.1424, "mean_token_accuracy": 0.21294564008712769, "num_tokens": 64889520.0, "step": 29080 }, { "entropy": 5.42517352104187, "epoch": 3.266524400516651, "grad_norm": 1.0625, "learning_rate": 0.00039614081089692606, "loss": 5.1851, "mean_token_accuracy": 0.20519082844257355, "num_tokens": 64900380.0, "step": 29085 }, { "entropy": 5.424459171295166, "epoch": 3.267085977424608, "grad_norm": 1.046875, "learning_rate": 0.00039610697616066604, "loss": 5.0857, "mean_token_accuracy": 0.2088787466287613, "num_tokens": 64910480.0, "step": 29090 }, { "entropy": 5.335051345825195, "epoch": 3.267647554332566, "grad_norm": 0.96875, "learning_rate": 0.00039607313756831296, "loss": 5.0411, "mean_token_accuracy": 0.21465830355882645, "num_tokens": 64920911.0, "step": 29095 }, { "entropy": 5.342704391479492, "epoch": 3.2682091312405235, "grad_norm": 1.0703125, "learning_rate": 0.00039603929512094417, "loss": 4.9561, "mean_token_accuracy": 0.21397462338209153, "num_tokens": 64930687.0, "step": 29100 }, { "entropy": 5.276119613647461, "epoch": 3.268770708148481, "grad_norm": 0.953125, "learning_rate": 0.0003960054488196373, "loss": 4.9916, "mean_token_accuracy": 0.2167527124285698, "num_tokens": 64942143.0, "step": 29105 }, { "entropy": 5.359771251678467, "epoch": 3.2693322850564384, "grad_norm": 0.99609375, "learning_rate": 0.00039597159866546996, "loss": 5.0363, "mean_token_accuracy": 0.21299714893102645, "num_tokens": 64952440.0, "step": 29110 }, { "entropy": 5.395861577987671, "epoch": 3.269893861964396, "grad_norm": 0.9609375, "learning_rate": 0.0003959377446595201, "loss": 5.0208, "mean_token_accuracy": 0.21522184312343598, "num_tokens": 64962752.0, "step": 29115 }, { "entropy": 5.3250874996185305, "epoch": 3.2704554388723537, "grad_norm": 0.9921875, "learning_rate": 0.00039590388680286543, "loss": 5.0465, "mean_token_accuracy": 0.2112973153591156, "num_tokens": 64975413.0, "step": 29120 }, { "entropy": 5.382338237762451, "epoch": 3.271017015780311, "grad_norm": 1.1171875, "learning_rate": 0.0003958700250965842, "loss": 5.0318, "mean_token_accuracy": 0.2101977914571762, "num_tokens": 64987922.0, "step": 29125 }, { "entropy": 5.334604501724243, "epoch": 3.2715785926882686, "grad_norm": 0.9609375, "learning_rate": 0.0003958361595417544, "loss": 5.0269, "mean_token_accuracy": 0.21147289574146272, "num_tokens": 64999448.0, "step": 29130 }, { "entropy": 5.43314266204834, "epoch": 3.2721401695962262, "grad_norm": 0.98828125, "learning_rate": 0.0003958022901394545, "loss": 5.1741, "mean_token_accuracy": 0.2018943816423416, "num_tokens": 65010771.0, "step": 29135 }, { "entropy": 5.494566822052002, "epoch": 3.272701746504184, "grad_norm": 0.9765625, "learning_rate": 0.0003957684168907628, "loss": 5.1128, "mean_token_accuracy": 0.2082195147871971, "num_tokens": 65021368.0, "step": 29140 }, { "entropy": 5.3742814540863035, "epoch": 3.273263323412141, "grad_norm": 0.97265625, "learning_rate": 0.00039573453979675793, "loss": 4.9721, "mean_token_accuracy": 0.22569199353456498, "num_tokens": 65032622.0, "step": 29145 }, { "entropy": 5.244518423080445, "epoch": 3.2738249003200988, "grad_norm": 1.0078125, "learning_rate": 0.00039570065885851844, "loss": 4.9271, "mean_token_accuracy": 0.2165824219584465, "num_tokens": 65043655.0, "step": 29150 }, { "entropy": 5.403975534439087, "epoch": 3.2743864772280564, "grad_norm": 0.98046875, "learning_rate": 0.0003956667740771231, "loss": 5.1864, "mean_token_accuracy": 0.20303287506103515, "num_tokens": 65055846.0, "step": 29155 }, { "entropy": 5.52277717590332, "epoch": 3.274948054136014, "grad_norm": 0.96875, "learning_rate": 0.0003956328854536509, "loss": 5.1981, "mean_token_accuracy": 0.20417805761098862, "num_tokens": 65067617.0, "step": 29160 }, { "entropy": 5.5247166633605955, "epoch": 3.2755096310439713, "grad_norm": 0.953125, "learning_rate": 0.00039559899298918094, "loss": 5.132, "mean_token_accuracy": 0.21998744904994966, "num_tokens": 65080111.0, "step": 29165 }, { "entropy": 5.343008804321289, "epoch": 3.276071207951929, "grad_norm": 0.9921875, "learning_rate": 0.0003955650966847922, "loss": 4.9793, "mean_token_accuracy": 0.21785236299037933, "num_tokens": 65092284.0, "step": 29170 }, { "entropy": 5.398488855361938, "epoch": 3.2766327848598866, "grad_norm": 0.96875, "learning_rate": 0.000395531196541564, "loss": 5.0858, "mean_token_accuracy": 0.21134549975395203, "num_tokens": 65104133.0, "step": 29175 }, { "entropy": 5.313236665725708, "epoch": 3.2771943617678443, "grad_norm": 0.984375, "learning_rate": 0.00039549729256057583, "loss": 4.952, "mean_token_accuracy": 0.21240609735250474, "num_tokens": 65116065.0, "step": 29180 }, { "entropy": 5.307000541687012, "epoch": 3.2777559386758015, "grad_norm": 1.046875, "learning_rate": 0.000395463384742907, "loss": 4.9555, "mean_token_accuracy": 0.214469975233078, "num_tokens": 65127235.0, "step": 29185 }, { "entropy": 5.434169435501099, "epoch": 3.278317515583759, "grad_norm": 1.015625, "learning_rate": 0.00039542947308963733, "loss": 5.1168, "mean_token_accuracy": 0.20674622803926468, "num_tokens": 65138186.0, "step": 29190 }, { "entropy": 5.363085508346558, "epoch": 3.278879092491717, "grad_norm": 0.984375, "learning_rate": 0.0003953955576018466, "loss": 5.0271, "mean_token_accuracy": 0.21097055077552795, "num_tokens": 65149222.0, "step": 29195 }, { "entropy": 5.361354875564575, "epoch": 3.2794406693996745, "grad_norm": 1.0625, "learning_rate": 0.0003953616382806145, "loss": 5.029, "mean_token_accuracy": 0.2115889459848404, "num_tokens": 65160404.0, "step": 29200 }, { "entropy": 5.3984016418457035, "epoch": 3.2800022463076317, "grad_norm": 1.078125, "learning_rate": 0.00039532771512702124, "loss": 5.0335, "mean_token_accuracy": 0.20314836055040358, "num_tokens": 65171395.0, "step": 29205 }, { "entropy": 5.383121061325073, "epoch": 3.2805638232155894, "grad_norm": 0.87890625, "learning_rate": 0.0003952937881421468, "loss": 5.0759, "mean_token_accuracy": 0.20740336328744888, "num_tokens": 65183752.0, "step": 29210 }, { "entropy": 5.315774154663086, "epoch": 3.281125400123547, "grad_norm": 0.921875, "learning_rate": 0.0003952598573270716, "loss": 4.9384, "mean_token_accuracy": 0.2182427942752838, "num_tokens": 65193807.0, "step": 29215 }, { "entropy": 5.362392854690552, "epoch": 3.2816869770315042, "grad_norm": 1.0703125, "learning_rate": 0.0003952259226828759, "loss": 5.0865, "mean_token_accuracy": 0.20512927919626237, "num_tokens": 65203482.0, "step": 29220 }, { "entropy": 5.448481464385987, "epoch": 3.282248553939462, "grad_norm": 0.99609375, "learning_rate": 0.00039519198421064005, "loss": 5.0856, "mean_token_accuracy": 0.2069957360625267, "num_tokens": 65214965.0, "step": 29225 }, { "entropy": 5.358859729766846, "epoch": 3.2828101308474196, "grad_norm": 1.015625, "learning_rate": 0.00039515804191144496, "loss": 4.9628, "mean_token_accuracy": 0.2147458016872406, "num_tokens": 65227791.0, "step": 29230 }, { "entropy": 5.4664689064025875, "epoch": 3.2833717077553772, "grad_norm": 1.140625, "learning_rate": 0.00039512409578637114, "loss": 5.1267, "mean_token_accuracy": 0.20669544786214827, "num_tokens": 65238937.0, "step": 29235 }, { "entropy": 5.408141374588013, "epoch": 3.2839332846633345, "grad_norm": 0.98828125, "learning_rate": 0.00039509014583649947, "loss": 5.103, "mean_token_accuracy": 0.20498318821191788, "num_tokens": 65250912.0, "step": 29240 }, { "entropy": 5.367961788177491, "epoch": 3.284494861571292, "grad_norm": 0.99609375, "learning_rate": 0.00039505619206291106, "loss": 5.0626, "mean_token_accuracy": 0.21673996597528458, "num_tokens": 65262094.0, "step": 29245 }, { "entropy": 5.30397744178772, "epoch": 3.2850564384792498, "grad_norm": 1.0703125, "learning_rate": 0.00039502223446668687, "loss": 4.9088, "mean_token_accuracy": 0.21961585581302642, "num_tokens": 65271860.0, "step": 29250 }, { "entropy": 5.3818176746368405, "epoch": 3.2856180153872074, "grad_norm": 1.0, "learning_rate": 0.0003949882730489082, "loss": 5.1181, "mean_token_accuracy": 0.2029322698712349, "num_tokens": 65282341.0, "step": 29255 }, { "entropy": 5.424140453338623, "epoch": 3.2861795922951647, "grad_norm": 1.0234375, "learning_rate": 0.00039495430781065645, "loss": 5.1013, "mean_token_accuracy": 0.21312126219272615, "num_tokens": 65293570.0, "step": 29260 }, { "entropy": 5.351343393325806, "epoch": 3.2867411692031223, "grad_norm": 0.97265625, "learning_rate": 0.000394920338753013, "loss": 4.994, "mean_token_accuracy": 0.21503273993730546, "num_tokens": 65305226.0, "step": 29265 }, { "entropy": 5.298500680923462, "epoch": 3.28730274611108, "grad_norm": 0.984375, "learning_rate": 0.0003948863658770594, "loss": 4.9322, "mean_token_accuracy": 0.2155624359846115, "num_tokens": 65316309.0, "step": 29270 }, { "entropy": 5.355752992630005, "epoch": 3.2878643230190376, "grad_norm": 0.98828125, "learning_rate": 0.0003948523891838774, "loss": 4.9908, "mean_token_accuracy": 0.22021102607250215, "num_tokens": 65327491.0, "step": 29275 }, { "entropy": 5.259730052947998, "epoch": 3.288425899926995, "grad_norm": 1.03125, "learning_rate": 0.00039481840867454886, "loss": 4.8806, "mean_token_accuracy": 0.21837422102689744, "num_tokens": 65337908.0, "step": 29280 }, { "entropy": 5.233044910430908, "epoch": 3.2889874768349525, "grad_norm": 1.03125, "learning_rate": 0.0003947844243501558, "loss": 4.9174, "mean_token_accuracy": 0.22128734290599822, "num_tokens": 65348209.0, "step": 29285 }, { "entropy": 5.3591721534729, "epoch": 3.28954905374291, "grad_norm": 0.99609375, "learning_rate": 0.00039475043621178005, "loss": 5.0248, "mean_token_accuracy": 0.21404968798160554, "num_tokens": 65358648.0, "step": 29290 }, { "entropy": 5.30058856010437, "epoch": 3.290110630650868, "grad_norm": 1.0, "learning_rate": 0.0003947164442605041, "loss": 5.0228, "mean_token_accuracy": 0.21017475575208663, "num_tokens": 65369132.0, "step": 29295 }, { "entropy": 5.379864454269409, "epoch": 3.290672207558825, "grad_norm": 0.90234375, "learning_rate": 0.0003946824484974101, "loss": 5.0486, "mean_token_accuracy": 0.2145371124148369, "num_tokens": 65380334.0, "step": 29300 }, { "entropy": 5.544144964218139, "epoch": 3.2912337844667827, "grad_norm": 0.89453125, "learning_rate": 0.0003946484489235805, "loss": 5.1954, "mean_token_accuracy": 0.19793498069047927, "num_tokens": 65394680.0, "step": 29305 }, { "entropy": 5.455538415908814, "epoch": 3.2917953613747404, "grad_norm": 0.94140625, "learning_rate": 0.00039461444554009787, "loss": 5.0781, "mean_token_accuracy": 0.2094290778040886, "num_tokens": 65406029.0, "step": 29310 }, { "entropy": 5.338117504119873, "epoch": 3.2923569382826976, "grad_norm": 0.9921875, "learning_rate": 0.000394580438348045, "loss": 5.0048, "mean_token_accuracy": 0.2139800027012825, "num_tokens": 65416626.0, "step": 29315 }, { "entropy": 5.341868162155151, "epoch": 3.2929185151906553, "grad_norm": 0.98828125, "learning_rate": 0.00039454642734850447, "loss": 5.0424, "mean_token_accuracy": 0.21320027261972427, "num_tokens": 65427579.0, "step": 29320 }, { "entropy": 5.31810188293457, "epoch": 3.293480092098613, "grad_norm": 0.9765625, "learning_rate": 0.0003945124125425594, "loss": 5.0562, "mean_token_accuracy": 0.20637853890657426, "num_tokens": 65439893.0, "step": 29325 }, { "entropy": 5.51945915222168, "epoch": 3.2940416690065706, "grad_norm": 0.97265625, "learning_rate": 0.0003944783939312928, "loss": 5.1776, "mean_token_accuracy": 0.20611874014139175, "num_tokens": 65451861.0, "step": 29330 }, { "entropy": 5.3495063304901125, "epoch": 3.294603245914528, "grad_norm": 0.9375, "learning_rate": 0.0003944443715157877, "loss": 5.0052, "mean_token_accuracy": 0.21031406074762343, "num_tokens": 65463764.0, "step": 29335 }, { "entropy": 5.262649583816528, "epoch": 3.2951648228224855, "grad_norm": 1.0390625, "learning_rate": 0.0003944103452971275, "loss": 4.9832, "mean_token_accuracy": 0.2028496354818344, "num_tokens": 65474367.0, "step": 29340 }, { "entropy": 5.342995119094849, "epoch": 3.295726399730443, "grad_norm": 1.046875, "learning_rate": 0.00039437631527639553, "loss": 4.9679, "mean_token_accuracy": 0.22034140527248383, "num_tokens": 65485347.0, "step": 29345 }, { "entropy": 5.369885730743408, "epoch": 3.296287976638401, "grad_norm": 1.0390625, "learning_rate": 0.00039434228145467554, "loss": 5.08, "mean_token_accuracy": 0.2147718295454979, "num_tokens": 65495858.0, "step": 29350 }, { "entropy": 5.312769889831543, "epoch": 3.296849553546358, "grad_norm": 0.94140625, "learning_rate": 0.000394308243833051, "loss": 4.8785, "mean_token_accuracy": 0.21929091811180115, "num_tokens": 65505649.0, "step": 29355 }, { "entropy": 5.380861520767212, "epoch": 3.2974111304543157, "grad_norm": 0.8671875, "learning_rate": 0.00039427420241260557, "loss": 5.0317, "mean_token_accuracy": 0.21502070277929305, "num_tokens": 65516437.0, "step": 29360 }, { "entropy": 5.263468408584595, "epoch": 3.2979727073622733, "grad_norm": 0.9921875, "learning_rate": 0.00039424015719442335, "loss": 4.976, "mean_token_accuracy": 0.21599622070789337, "num_tokens": 65528854.0, "step": 29365 }, { "entropy": 5.414577627182007, "epoch": 3.298534284270231, "grad_norm": 0.96875, "learning_rate": 0.00039420610817958836, "loss": 5.0887, "mean_token_accuracy": 0.2108323946595192, "num_tokens": 65539459.0, "step": 29370 }, { "entropy": 5.422315311431885, "epoch": 3.299095861178188, "grad_norm": 1.1015625, "learning_rate": 0.0003941720553691846, "loss": 5.0693, "mean_token_accuracy": 0.2063926413655281, "num_tokens": 65550818.0, "step": 29375 }, { "entropy": 5.400266027450561, "epoch": 3.299657438086146, "grad_norm": 1.0078125, "learning_rate": 0.0003941379987642963, "loss": 5.0007, "mean_token_accuracy": 0.2134595111012459, "num_tokens": 65562572.0, "step": 29380 }, { "entropy": 5.342912673950195, "epoch": 3.3002190149941035, "grad_norm": 0.98828125, "learning_rate": 0.000394103938366008, "loss": 5.0678, "mean_token_accuracy": 0.20934785455465316, "num_tokens": 65573764.0, "step": 29385 }, { "entropy": 5.419212341308594, "epoch": 3.300780591902061, "grad_norm": 1.015625, "learning_rate": 0.0003940698741754041, "loss": 5.0737, "mean_token_accuracy": 0.21681116968393327, "num_tokens": 65585628.0, "step": 29390 }, { "entropy": 5.362552690505981, "epoch": 3.3013421688100184, "grad_norm": 1.046875, "learning_rate": 0.0003940358061935692, "loss": 5.029, "mean_token_accuracy": 0.2096794381737709, "num_tokens": 65596142.0, "step": 29395 }, { "entropy": 5.479443979263306, "epoch": 3.301903745717976, "grad_norm": 1.40625, "learning_rate": 0.0003940017344215881, "loss": 5.1904, "mean_token_accuracy": 0.19975974410772324, "num_tokens": 65607824.0, "step": 29400 }, { "entropy": 5.404713773727417, "epoch": 3.3024653226259337, "grad_norm": 0.9765625, "learning_rate": 0.00039396765886054555, "loss": 5.0402, "mean_token_accuracy": 0.2128315433859825, "num_tokens": 65617862.0, "step": 29405 }, { "entropy": 5.368212127685547, "epoch": 3.303026899533891, "grad_norm": 0.92578125, "learning_rate": 0.00039393357951152667, "loss": 5.0023, "mean_token_accuracy": 0.21723357439041138, "num_tokens": 65629224.0, "step": 29410 }, { "entropy": 5.2966619491577145, "epoch": 3.3035884764418486, "grad_norm": 0.9765625, "learning_rate": 0.00039389949637561646, "loss": 4.9449, "mean_token_accuracy": 0.2177306666970253, "num_tokens": 65640419.0, "step": 29415 }, { "entropy": 5.403443813323975, "epoch": 3.3041500533498063, "grad_norm": 0.9921875, "learning_rate": 0.00039386540945390017, "loss": 5.0492, "mean_token_accuracy": 0.20719340145587922, "num_tokens": 65651305.0, "step": 29420 }, { "entropy": 5.4070594787597654, "epoch": 3.304711630257764, "grad_norm": 1.0078125, "learning_rate": 0.0003938313187474631, "loss": 5.1145, "mean_token_accuracy": 0.2022452473640442, "num_tokens": 65662702.0, "step": 29425 }, { "entropy": 5.375760412216186, "epoch": 3.3052732071657216, "grad_norm": 0.96875, "learning_rate": 0.0003937972242573908, "loss": 5.0034, "mean_token_accuracy": 0.21411430537700654, "num_tokens": 65673981.0, "step": 29430 }, { "entropy": 5.382529067993164, "epoch": 3.305834784073679, "grad_norm": 1.0625, "learning_rate": 0.0003937631259847688, "loss": 5.0434, "mean_token_accuracy": 0.21629259437322618, "num_tokens": 65684633.0, "step": 29435 }, { "entropy": 5.354738521575928, "epoch": 3.3063963609816365, "grad_norm": 0.99609375, "learning_rate": 0.0003937290239306828, "loss": 5.1123, "mean_token_accuracy": 0.20403498858213426, "num_tokens": 65696890.0, "step": 29440 }, { "entropy": 5.350843095779419, "epoch": 3.306957937889594, "grad_norm": 1.0078125, "learning_rate": 0.00039369491809621867, "loss": 5.0077, "mean_token_accuracy": 0.21572987884283065, "num_tokens": 65708620.0, "step": 29445 }, { "entropy": 5.437977123260498, "epoch": 3.3075195147975514, "grad_norm": 1.0078125, "learning_rate": 0.0003936608084824623, "loss": 5.1058, "mean_token_accuracy": 0.21223676949739456, "num_tokens": 65720182.0, "step": 29450 }, { "entropy": 5.4377936840057375, "epoch": 3.308081091705509, "grad_norm": 0.93359375, "learning_rate": 0.00039362669509049975, "loss": 5.134, "mean_token_accuracy": 0.20627740621566773, "num_tokens": 65731376.0, "step": 29455 }, { "entropy": 5.432421445846558, "epoch": 3.3086426686134667, "grad_norm": 1.015625, "learning_rate": 0.00039359257792141717, "loss": 5.0492, "mean_token_accuracy": 0.2125987723469734, "num_tokens": 65743303.0, "step": 29460 }, { "entropy": 5.497948026657104, "epoch": 3.3092042455214243, "grad_norm": 0.953125, "learning_rate": 0.000393558456976301, "loss": 5.2016, "mean_token_accuracy": 0.19800219386816026, "num_tokens": 65755486.0, "step": 29465 }, { "entropy": 5.337993860244751, "epoch": 3.3097658224293816, "grad_norm": 0.9375, "learning_rate": 0.0003935243322562375, "loss": 5.009, "mean_token_accuracy": 0.20839072167873382, "num_tokens": 65766855.0, "step": 29470 }, { "entropy": 5.334459447860718, "epoch": 3.310327399337339, "grad_norm": 1.015625, "learning_rate": 0.0003934902037623133, "loss": 5.0133, "mean_token_accuracy": 0.21309670209884643, "num_tokens": 65778077.0, "step": 29475 }, { "entropy": 5.336214780807495, "epoch": 3.310888976245297, "grad_norm": 0.86328125, "learning_rate": 0.00039345607149561513, "loss": 5.0593, "mean_token_accuracy": 0.209893162548542, "num_tokens": 65791051.0, "step": 29480 }, { "entropy": 5.476957082748413, "epoch": 3.3114505531532545, "grad_norm": 0.96484375, "learning_rate": 0.00039342193545722966, "loss": 5.154, "mean_token_accuracy": 0.2069030299782753, "num_tokens": 65802769.0, "step": 29485 }, { "entropy": 5.410486555099487, "epoch": 3.3120121300612118, "grad_norm": 0.99609375, "learning_rate": 0.0003933877956482438, "loss": 5.0328, "mean_token_accuracy": 0.21095822751522064, "num_tokens": 65813602.0, "step": 29490 }, { "entropy": 5.38528790473938, "epoch": 3.3125737069691694, "grad_norm": 0.953125, "learning_rate": 0.00039335365206974465, "loss": 5.1227, "mean_token_accuracy": 0.20879632979631424, "num_tokens": 65826675.0, "step": 29495 }, { "entropy": 5.34553108215332, "epoch": 3.313135283877127, "grad_norm": 1.15625, "learning_rate": 0.0003933195047228193, "loss": 4.9816, "mean_token_accuracy": 0.21879787892103195, "num_tokens": 65837643.0, "step": 29500 }, { "entropy": 5.445144462585449, "epoch": 3.3136968607850843, "grad_norm": 1.0390625, "learning_rate": 0.00039328535360855503, "loss": 5.0611, "mean_token_accuracy": 0.21754615902900695, "num_tokens": 65850184.0, "step": 29505 }, { "entropy": 5.392917537689209, "epoch": 3.314258437693042, "grad_norm": 0.9921875, "learning_rate": 0.00039325119872803924, "loss": 5.0553, "mean_token_accuracy": 0.2146216571331024, "num_tokens": 65861178.0, "step": 29510 }, { "entropy": 5.317704820632935, "epoch": 3.3148200146009996, "grad_norm": 1.0703125, "learning_rate": 0.00039321704008235943, "loss": 4.962, "mean_token_accuracy": 0.22073178440332414, "num_tokens": 65872458.0, "step": 29515 }, { "entropy": 5.304272556304932, "epoch": 3.3153815915089573, "grad_norm": 1.0390625, "learning_rate": 0.00039318287767260316, "loss": 4.976, "mean_token_accuracy": 0.2166664183139801, "num_tokens": 65883152.0, "step": 29520 }, { "entropy": 5.337661695480347, "epoch": 3.315943168416915, "grad_norm": 1.015625, "learning_rate": 0.00039314871149985834, "loss": 4.9603, "mean_token_accuracy": 0.21779426336288452, "num_tokens": 65894220.0, "step": 29525 }, { "entropy": 5.359192514419556, "epoch": 3.316504745324872, "grad_norm": 1.171875, "learning_rate": 0.0003931145415652126, "loss": 5.0975, "mean_token_accuracy": 0.20933461785316468, "num_tokens": 65904159.0, "step": 29530 }, { "entropy": 5.480965900421142, "epoch": 3.31706632223283, "grad_norm": 0.9765625, "learning_rate": 0.00039308036786975416, "loss": 5.1313, "mean_token_accuracy": 0.20319838374853133, "num_tokens": 65915599.0, "step": 29535 }, { "entropy": 5.376408815383911, "epoch": 3.3176278991407875, "grad_norm": 1.0859375, "learning_rate": 0.0003930461904145709, "loss": 5.0533, "mean_token_accuracy": 0.21272777020931244, "num_tokens": 65926518.0, "step": 29540 }, { "entropy": 5.368619918823242, "epoch": 3.3181894760487447, "grad_norm": 1.015625, "learning_rate": 0.0003930120092007512, "loss": 5.0787, "mean_token_accuracy": 0.20876848846673965, "num_tokens": 65938901.0, "step": 29545 }, { "entropy": 5.3764056205749515, "epoch": 3.3187510529567024, "grad_norm": 1.015625, "learning_rate": 0.0003929778242293834, "loss": 5.0258, "mean_token_accuracy": 0.21177875399589538, "num_tokens": 65949798.0, "step": 29550 }, { "entropy": 5.356381464004516, "epoch": 3.31931262986466, "grad_norm": 0.94921875, "learning_rate": 0.0003929436355015558, "loss": 4.9705, "mean_token_accuracy": 0.21998427659273148, "num_tokens": 65961222.0, "step": 29555 }, { "entropy": 5.429873466491699, "epoch": 3.3198742067726177, "grad_norm": 0.984375, "learning_rate": 0.00039290944301835723, "loss": 5.1286, "mean_token_accuracy": 0.2014615163207054, "num_tokens": 65972373.0, "step": 29560 }, { "entropy": 5.339236211776734, "epoch": 3.320435783680575, "grad_norm": 1.0546875, "learning_rate": 0.00039287524678087617, "loss": 5.0156, "mean_token_accuracy": 0.21630117744207383, "num_tokens": 65983716.0, "step": 29565 }, { "entropy": 5.4719651222229, "epoch": 3.3209973605885326, "grad_norm": 0.93359375, "learning_rate": 0.00039284104679020154, "loss": 5.1383, "mean_token_accuracy": 0.21011116355657578, "num_tokens": 65994827.0, "step": 29570 }, { "entropy": 5.389466142654419, "epoch": 3.3215589374964902, "grad_norm": 0.92578125, "learning_rate": 0.0003928068430474224, "loss": 4.9211, "mean_token_accuracy": 0.21971674561500548, "num_tokens": 66006249.0, "step": 29575 }, { "entropy": 5.35979061126709, "epoch": 3.322120514404448, "grad_norm": 1.046875, "learning_rate": 0.0003927726355536275, "loss": 5.0348, "mean_token_accuracy": 0.2091402754187584, "num_tokens": 66017175.0, "step": 29580 }, { "entropy": 5.30323600769043, "epoch": 3.322682091312405, "grad_norm": 0.91015625, "learning_rate": 0.00039273842430990634, "loss": 4.9593, "mean_token_accuracy": 0.2178204596042633, "num_tokens": 66028518.0, "step": 29585 }, { "entropy": 5.383296775817871, "epoch": 3.3232436682203628, "grad_norm": 0.99609375, "learning_rate": 0.0003927042093173481, "loss": 5.0304, "mean_token_accuracy": 0.2076626256108284, "num_tokens": 66038927.0, "step": 29590 }, { "entropy": 5.431569337844849, "epoch": 3.3238052451283204, "grad_norm": 0.9921875, "learning_rate": 0.0003926699905770421, "loss": 5.0261, "mean_token_accuracy": 0.21320104449987412, "num_tokens": 66050649.0, "step": 29595 }, { "entropy": 5.394930124282837, "epoch": 3.3243668220362776, "grad_norm": 1.015625, "learning_rate": 0.000392635768090078, "loss": 5.0638, "mean_token_accuracy": 0.21024627536535262, "num_tokens": 66061585.0, "step": 29600 }, { "entropy": 5.349187803268433, "epoch": 3.3249283989442353, "grad_norm": 1.0, "learning_rate": 0.00039260154185754545, "loss": 5.0118, "mean_token_accuracy": 0.2145455449819565, "num_tokens": 66071312.0, "step": 29605 }, { "entropy": 5.3404584407806395, "epoch": 3.325489975852193, "grad_norm": 1.1328125, "learning_rate": 0.0003925673118805341, "loss": 5.0582, "mean_token_accuracy": 0.21381541341543198, "num_tokens": 66082643.0, "step": 29610 }, { "entropy": 5.325112581253052, "epoch": 3.3260515527601506, "grad_norm": 1.0390625, "learning_rate": 0.000392533078160134, "loss": 4.9426, "mean_token_accuracy": 0.21535566151142121, "num_tokens": 66094094.0, "step": 29615 }, { "entropy": 5.364333391189575, "epoch": 3.3266131296681083, "grad_norm": 0.94140625, "learning_rate": 0.00039249884069743514, "loss": 5.0278, "mean_token_accuracy": 0.21410958617925643, "num_tokens": 66105365.0, "step": 29620 }, { "entropy": 5.405356931686401, "epoch": 3.3271747065760655, "grad_norm": 1.015625, "learning_rate": 0.0003924645994935276, "loss": 5.0745, "mean_token_accuracy": 0.20570087432861328, "num_tokens": 66115440.0, "step": 29625 }, { "entropy": 5.368456506729126, "epoch": 3.327736283484023, "grad_norm": 1.0390625, "learning_rate": 0.0003924303545495017, "loss": 5.0341, "mean_token_accuracy": 0.20177303850650788, "num_tokens": 66127213.0, "step": 29630 }, { "entropy": 5.370482540130615, "epoch": 3.328297860391981, "grad_norm": 1.046875, "learning_rate": 0.00039239610586644765, "loss": 4.942, "mean_token_accuracy": 0.2156612604856491, "num_tokens": 66138016.0, "step": 29635 }, { "entropy": 5.267062330245972, "epoch": 3.328859437299938, "grad_norm": 0.98046875, "learning_rate": 0.0003923618534454561, "loss": 4.9516, "mean_token_accuracy": 0.2184280574321747, "num_tokens": 66149981.0, "step": 29640 }, { "entropy": 5.349187707901001, "epoch": 3.3294210142078957, "grad_norm": 1.0234375, "learning_rate": 0.0003923275972876176, "loss": 5.052, "mean_token_accuracy": 0.21020550578832625, "num_tokens": 66161609.0, "step": 29645 }, { "entropy": 5.301196956634522, "epoch": 3.3299825911158534, "grad_norm": 1.0546875, "learning_rate": 0.00039229333739402303, "loss": 4.946, "mean_token_accuracy": 0.21668857485055923, "num_tokens": 66171665.0, "step": 29650 }, { "entropy": 5.288922214508057, "epoch": 3.330544168023811, "grad_norm": 1.0, "learning_rate": 0.000392259073765763, "loss": 4.9519, "mean_token_accuracy": 0.21599392741918563, "num_tokens": 66181773.0, "step": 29655 }, { "entropy": 5.393890237808227, "epoch": 3.3311057449317683, "grad_norm": 1.0234375, "learning_rate": 0.00039222480640392854, "loss": 5.0798, "mean_token_accuracy": 0.2148784413933754, "num_tokens": 66193578.0, "step": 29660 }, { "entropy": 5.425887632369995, "epoch": 3.331667321839726, "grad_norm": 1.0234375, "learning_rate": 0.00039219053530961087, "loss": 5.0878, "mean_token_accuracy": 0.20491078943014146, "num_tokens": 66205185.0, "step": 29665 }, { "entropy": 5.278323173522949, "epoch": 3.3322288987476836, "grad_norm": 0.96875, "learning_rate": 0.00039215626048390105, "loss": 4.9796, "mean_token_accuracy": 0.21064774692058563, "num_tokens": 66217143.0, "step": 29670 }, { "entropy": 5.363730764389038, "epoch": 3.3327904756556412, "grad_norm": 0.94140625, "learning_rate": 0.0003921219819278905, "loss": 5.0252, "mean_token_accuracy": 0.22076896131038665, "num_tokens": 66229022.0, "step": 29675 }, { "entropy": 5.437602996826172, "epoch": 3.3333520525635985, "grad_norm": 0.92578125, "learning_rate": 0.0003920876996426706, "loss": 5.0982, "mean_token_accuracy": 0.20251217484474182, "num_tokens": 66240028.0, "step": 29680 }, { "entropy": 5.388151597976685, "epoch": 3.333913629471556, "grad_norm": 0.984375, "learning_rate": 0.00039205341362933294, "loss": 4.9759, "mean_token_accuracy": 0.2157108649611473, "num_tokens": 66251656.0, "step": 29685 }, { "entropy": 5.310275268554688, "epoch": 3.334475206379514, "grad_norm": 0.92578125, "learning_rate": 0.0003920191238889691, "loss": 4.9984, "mean_token_accuracy": 0.22030124217271804, "num_tokens": 66262644.0, "step": 29690 }, { "entropy": 5.254477262496948, "epoch": 3.335036783287471, "grad_norm": 0.9921875, "learning_rate": 0.0003919848304226711, "loss": 4.9836, "mean_token_accuracy": 0.21373129040002822, "num_tokens": 66273374.0, "step": 29695 }, { "entropy": 5.359227228164673, "epoch": 3.3355983601954287, "grad_norm": 0.9921875, "learning_rate": 0.0003919505332315307, "loss": 5.0334, "mean_token_accuracy": 0.21394117325544357, "num_tokens": 66284490.0, "step": 29700 }, { "entropy": 5.431166744232177, "epoch": 3.3361599371033863, "grad_norm": 1.0546875, "learning_rate": 0.00039191623231663985, "loss": 5.0211, "mean_token_accuracy": 0.2123098075389862, "num_tokens": 66295555.0, "step": 29705 }, { "entropy": 5.356332015991211, "epoch": 3.336721514011344, "grad_norm": 0.9609375, "learning_rate": 0.000391881927679091, "loss": 5.0039, "mean_token_accuracy": 0.2127162903547287, "num_tokens": 66307234.0, "step": 29710 }, { "entropy": 5.436452198028564, "epoch": 3.3372830909193016, "grad_norm": 0.9921875, "learning_rate": 0.00039184761931997607, "loss": 5.1458, "mean_token_accuracy": 0.20040260553359984, "num_tokens": 66319239.0, "step": 29715 }, { "entropy": 5.483844757080078, "epoch": 3.337844667827259, "grad_norm": 0.9375, "learning_rate": 0.0003918133072403878, "loss": 5.1017, "mean_token_accuracy": 0.2131364345550537, "num_tokens": 66332260.0, "step": 29720 }, { "entropy": 5.3978784561157225, "epoch": 3.3384062447352165, "grad_norm": 0.953125, "learning_rate": 0.00039177899144141835, "loss": 5.0841, "mean_token_accuracy": 0.20385850220918655, "num_tokens": 66343817.0, "step": 29725 }, { "entropy": 5.420223617553711, "epoch": 3.338967821643174, "grad_norm": 0.94921875, "learning_rate": 0.0003917446719241606, "loss": 5.0981, "mean_token_accuracy": 0.20456845611333846, "num_tokens": 66355724.0, "step": 29730 }, { "entropy": 5.356211853027344, "epoch": 3.3395293985511314, "grad_norm": 1.0703125, "learning_rate": 0.00039171034868970724, "loss": 4.974, "mean_token_accuracy": 0.2145402744412422, "num_tokens": 66365994.0, "step": 29735 }, { "entropy": 5.382691478729248, "epoch": 3.340090975459089, "grad_norm": 0.94921875, "learning_rate": 0.00039167602173915104, "loss": 5.1694, "mean_token_accuracy": 0.20327653586864472, "num_tokens": 66377929.0, "step": 29740 }, { "entropy": 5.348143863677978, "epoch": 3.3406525523670467, "grad_norm": 0.9609375, "learning_rate": 0.0003916416910735851, "loss": 4.9936, "mean_token_accuracy": 0.21764630526304246, "num_tokens": 66389292.0, "step": 29745 }, { "entropy": 5.369740390777588, "epoch": 3.3412141292750044, "grad_norm": 1.015625, "learning_rate": 0.00039160735669410246, "loss": 5.0252, "mean_token_accuracy": 0.21389829814434053, "num_tokens": 66399266.0, "step": 29750 }, { "entropy": 5.329080724716187, "epoch": 3.3417757061829616, "grad_norm": 0.9296875, "learning_rate": 0.0003915730186017964, "loss": 5.0575, "mean_token_accuracy": 0.2133892998099327, "num_tokens": 66410718.0, "step": 29755 }, { "entropy": 5.360497522354126, "epoch": 3.3423372830909193, "grad_norm": 0.94140625, "learning_rate": 0.00039153867679776023, "loss": 5.0791, "mean_token_accuracy": 0.21272919178009034, "num_tokens": 66420982.0, "step": 29760 }, { "entropy": 5.40855131149292, "epoch": 3.342898859998877, "grad_norm": 1.0, "learning_rate": 0.0003915043312830873, "loss": 5.0388, "mean_token_accuracy": 0.21751929670572281, "num_tokens": 66431378.0, "step": 29765 }, { "entropy": 5.395191240310669, "epoch": 3.3434604369068346, "grad_norm": 1.03125, "learning_rate": 0.0003914699820588714, "loss": 5.0363, "mean_token_accuracy": 0.21691346019506455, "num_tokens": 66442033.0, "step": 29770 }, { "entropy": 5.3135298728942875, "epoch": 3.344022013814792, "grad_norm": 1.0234375, "learning_rate": 0.00039143562912620603, "loss": 4.9747, "mean_token_accuracy": 0.2102789208292961, "num_tokens": 66453486.0, "step": 29775 }, { "entropy": 5.429760837554932, "epoch": 3.3445835907227495, "grad_norm": 1.046875, "learning_rate": 0.000391401272486185, "loss": 5.1359, "mean_token_accuracy": 0.20395235419273378, "num_tokens": 66464931.0, "step": 29780 }, { "entropy": 5.588534021377564, "epoch": 3.345145167630707, "grad_norm": 0.953125, "learning_rate": 0.0003913669121399024, "loss": 5.2292, "mean_token_accuracy": 0.202242611348629, "num_tokens": 66477187.0, "step": 29785 }, { "entropy": 5.388653993606567, "epoch": 3.3457067445386643, "grad_norm": 1.0, "learning_rate": 0.00039133254808845216, "loss": 5.0879, "mean_token_accuracy": 0.2126736968755722, "num_tokens": 66488777.0, "step": 29790 }, { "entropy": 5.340397834777832, "epoch": 3.346268321446622, "grad_norm": 0.8984375, "learning_rate": 0.00039129818033292843, "loss": 5.0376, "mean_token_accuracy": 0.2150785133242607, "num_tokens": 66499576.0, "step": 29795 }, { "entropy": 5.285248422622681, "epoch": 3.3468298983545797, "grad_norm": 1.0234375, "learning_rate": 0.0003912638088744256, "loss": 4.8554, "mean_token_accuracy": 0.23262681514024736, "num_tokens": 66510824.0, "step": 29800 }, { "entropy": 5.396010255813598, "epoch": 3.3473914752625373, "grad_norm": 0.9453125, "learning_rate": 0.000391229433714038, "loss": 5.0941, "mean_token_accuracy": 0.20793729424476623, "num_tokens": 66523151.0, "step": 29805 }, { "entropy": 5.309005928039551, "epoch": 3.347953052170495, "grad_norm": 0.9609375, "learning_rate": 0.0003911950548528601, "loss": 4.9606, "mean_token_accuracy": 0.2154133915901184, "num_tokens": 66533921.0, "step": 29810 }, { "entropy": 5.365468692779541, "epoch": 3.348514629078452, "grad_norm": 0.85546875, "learning_rate": 0.0003911606722919866, "loss": 4.9943, "mean_token_accuracy": 0.2160593017935753, "num_tokens": 66545867.0, "step": 29815 }, { "entropy": 5.344428300857544, "epoch": 3.34907620598641, "grad_norm": 1.0234375, "learning_rate": 0.0003911262860325123, "loss": 5.013, "mean_token_accuracy": 0.2179664358496666, "num_tokens": 66557522.0, "step": 29820 }, { "entropy": 5.318701076507568, "epoch": 3.3496377828943675, "grad_norm": 0.9765625, "learning_rate": 0.0003910918960755319, "loss": 5.0202, "mean_token_accuracy": 0.2201538309454918, "num_tokens": 66568792.0, "step": 29825 }, { "entropy": 5.409763526916504, "epoch": 3.3501993598023248, "grad_norm": 0.96875, "learning_rate": 0.0003910575024221406, "loss": 5.1162, "mean_token_accuracy": 0.21802058219909667, "num_tokens": 66580231.0, "step": 29830 }, { "entropy": 5.298758172988892, "epoch": 3.3507609367102824, "grad_norm": 1.015625, "learning_rate": 0.00039102310507343335, "loss": 4.9271, "mean_token_accuracy": 0.21818821728229523, "num_tokens": 66591171.0, "step": 29835 }, { "entropy": 5.358959007263183, "epoch": 3.35132251361824, "grad_norm": 1.09375, "learning_rate": 0.0003909887040305055, "loss": 5.069, "mean_token_accuracy": 0.2039777919650078, "num_tokens": 66602676.0, "step": 29840 }, { "entropy": 5.380969619750976, "epoch": 3.3518840905261977, "grad_norm": 0.9296875, "learning_rate": 0.0003909542992944523, "loss": 5.0084, "mean_token_accuracy": 0.21503109037876128, "num_tokens": 66613526.0, "step": 29845 }, { "entropy": 5.320434284210205, "epoch": 3.352445667434155, "grad_norm": 1.0234375, "learning_rate": 0.0003909198908663692, "loss": 4.9744, "mean_token_accuracy": 0.21434350311756134, "num_tokens": 66624279.0, "step": 29850 }, { "entropy": 5.393058919906617, "epoch": 3.3530072443421126, "grad_norm": 1.09375, "learning_rate": 0.00039088547874735187, "loss": 4.9823, "mean_token_accuracy": 0.21619857102632523, "num_tokens": 66636908.0, "step": 29855 }, { "entropy": 5.496581268310547, "epoch": 3.3535688212500703, "grad_norm": 0.9140625, "learning_rate": 0.00039085106293849594, "loss": 5.1794, "mean_token_accuracy": 0.2016322582960129, "num_tokens": 66648545.0, "step": 29860 }, { "entropy": 5.360687732696533, "epoch": 3.354130398158028, "grad_norm": 0.9921875, "learning_rate": 0.00039081664344089724, "loss": 5.0442, "mean_token_accuracy": 0.21058827489614487, "num_tokens": 66659245.0, "step": 29865 }, { "entropy": 5.267288637161255, "epoch": 3.354691975065985, "grad_norm": 0.98828125, "learning_rate": 0.0003907822202556516, "loss": 4.9562, "mean_token_accuracy": 0.21682801991701126, "num_tokens": 66670866.0, "step": 29870 }, { "entropy": 5.393119239807129, "epoch": 3.355253551973943, "grad_norm": 0.97265625, "learning_rate": 0.0003907477933838553, "loss": 5.0848, "mean_token_accuracy": 0.20990979224443435, "num_tokens": 66681970.0, "step": 29875 }, { "entropy": 5.51213264465332, "epoch": 3.3558151288819005, "grad_norm": 1.0390625, "learning_rate": 0.00039071336282660437, "loss": 5.1171, "mean_token_accuracy": 0.21335382014513016, "num_tokens": 66693252.0, "step": 29880 }, { "entropy": 5.309964609146118, "epoch": 3.3563767057898577, "grad_norm": 1.1796875, "learning_rate": 0.00039067892858499496, "loss": 5.0123, "mean_token_accuracy": 0.21142490804195405, "num_tokens": 66703821.0, "step": 29885 }, { "entropy": 5.274274635314941, "epoch": 3.3569382826978154, "grad_norm": 0.921875, "learning_rate": 0.0003906444906601237, "loss": 4.9702, "mean_token_accuracy": 0.21837663650512695, "num_tokens": 66715945.0, "step": 29890 }, { "entropy": 5.4097565650939945, "epoch": 3.357499859605773, "grad_norm": 0.90625, "learning_rate": 0.000390610049053087, "loss": 5.0672, "mean_token_accuracy": 0.2133797064423561, "num_tokens": 66727551.0, "step": 29895 }, { "entropy": 5.409413003921509, "epoch": 3.3580614365137307, "grad_norm": 1.0078125, "learning_rate": 0.00039057560376498147, "loss": 5.0402, "mean_token_accuracy": 0.21121651977300643, "num_tokens": 66738257.0, "step": 29900 }, { "entropy": 5.470018672943115, "epoch": 3.3586230134216883, "grad_norm": 0.96875, "learning_rate": 0.0003905411547969038, "loss": 5.1566, "mean_token_accuracy": 0.19749877005815505, "num_tokens": 66750305.0, "step": 29905 }, { "entropy": 5.420934534072876, "epoch": 3.3591845903296456, "grad_norm": 0.9609375, "learning_rate": 0.0003905067021499511, "loss": 5.0431, "mean_token_accuracy": 0.2064980983734131, "num_tokens": 66761659.0, "step": 29910 }, { "entropy": 5.350599098205566, "epoch": 3.359746167237603, "grad_norm": 1.03125, "learning_rate": 0.00039047224582522015, "loss": 4.9354, "mean_token_accuracy": 0.22108001857995987, "num_tokens": 66771981.0, "step": 29915 }, { "entropy": 5.375402212142944, "epoch": 3.360307744145561, "grad_norm": 0.9140625, "learning_rate": 0.0003904377858238081, "loss": 5.1508, "mean_token_accuracy": 0.203959684073925, "num_tokens": 66783915.0, "step": 29920 }, { "entropy": 5.365793514251709, "epoch": 3.360869321053518, "grad_norm": 1.015625, "learning_rate": 0.0003904033221468122, "loss": 5.0221, "mean_token_accuracy": 0.21170813590288162, "num_tokens": 66795691.0, "step": 29925 }, { "entropy": 5.390090227127075, "epoch": 3.3614308979614758, "grad_norm": 0.93359375, "learning_rate": 0.0003903688547953297, "loss": 5.0842, "mean_token_accuracy": 0.20903043448925018, "num_tokens": 66805792.0, "step": 29930 }, { "entropy": 5.339382314682007, "epoch": 3.3619924748694334, "grad_norm": 0.97265625, "learning_rate": 0.0003903343837704582, "loss": 4.9886, "mean_token_accuracy": 0.21827088743448259, "num_tokens": 66817657.0, "step": 29935 }, { "entropy": 5.319599246978759, "epoch": 3.362554051777391, "grad_norm": 0.96484375, "learning_rate": 0.0003902999090732951, "loss": 4.9062, "mean_token_accuracy": 0.22163426131010056, "num_tokens": 66828593.0, "step": 29940 }, { "entropy": 5.329289340972901, "epoch": 3.3631156286853483, "grad_norm": 0.96484375, "learning_rate": 0.00039026543070493823, "loss": 5.0278, "mean_token_accuracy": 0.21971505433320998, "num_tokens": 66839405.0, "step": 29945 }, { "entropy": 5.2940223693847654, "epoch": 3.363677205593306, "grad_norm": 0.9140625, "learning_rate": 0.0003902309486664854, "loss": 4.9472, "mean_token_accuracy": 0.2110673114657402, "num_tokens": 66849938.0, "step": 29950 }, { "entropy": 5.369170475006103, "epoch": 3.3642387825012636, "grad_norm": 1.0, "learning_rate": 0.0003901964629590344, "loss": 5.0167, "mean_token_accuracy": 0.21327344924211503, "num_tokens": 66861105.0, "step": 29955 }, { "entropy": 5.342259407043457, "epoch": 3.3648003594092213, "grad_norm": 0.9375, "learning_rate": 0.0003901619735836833, "loss": 4.9849, "mean_token_accuracy": 0.21162937879562377, "num_tokens": 66873065.0, "step": 29960 }, { "entropy": 5.504744815826416, "epoch": 3.3653619363171785, "grad_norm": 0.921875, "learning_rate": 0.00039012748054153044, "loss": 5.1999, "mean_token_accuracy": 0.20130303353071213, "num_tokens": 66885639.0, "step": 29965 }, { "entropy": 5.372947788238525, "epoch": 3.365923513225136, "grad_norm": 0.984375, "learning_rate": 0.0003900929838336738, "loss": 5.0862, "mean_token_accuracy": 0.20559097379446029, "num_tokens": 66896576.0, "step": 29970 }, { "entropy": 5.3655290603637695, "epoch": 3.366485090133094, "grad_norm": 1.0, "learning_rate": 0.0003900584834612119, "loss": 4.9785, "mean_token_accuracy": 0.21405138969421386, "num_tokens": 66907595.0, "step": 29975 }, { "entropy": 5.430545473098755, "epoch": 3.367046667041051, "grad_norm": 0.99609375, "learning_rate": 0.0003900239794252434, "loss": 5.0448, "mean_token_accuracy": 0.20915476530790328, "num_tokens": 66918231.0, "step": 29980 }, { "entropy": 5.434838676452637, "epoch": 3.3676082439490087, "grad_norm": 1.0390625, "learning_rate": 0.0003899894717268667, "loss": 5.2198, "mean_token_accuracy": 0.19938337355852126, "num_tokens": 66930929.0, "step": 29985 }, { "entropy": 5.395609903335571, "epoch": 3.3681698208569664, "grad_norm": 0.90234375, "learning_rate": 0.0003899549603671807, "loss": 5.0639, "mean_token_accuracy": 0.21238719224929808, "num_tokens": 66941714.0, "step": 29990 }, { "entropy": 5.415493154525757, "epoch": 3.368731397764924, "grad_norm": 1.015625, "learning_rate": 0.00038992044534728404, "loss": 5.0918, "mean_token_accuracy": 0.2100331738591194, "num_tokens": 66951732.0, "step": 29995 }, { "entropy": 5.395217990875244, "epoch": 3.3692929746728817, "grad_norm": 1.015625, "learning_rate": 0.00038988592666827594, "loss": 5.056, "mean_token_accuracy": 0.21412342935800552, "num_tokens": 66962941.0, "step": 30000 }, { "epoch": 3.3692929746728817, "eval_entropy": 5.177071620300624, "eval_loss": 5.1879377365112305, "eval_mean_token_accuracy": 0.21260422172622026, "eval_num_tokens": 66962941.0, "eval_runtime": 23.8708, "eval_samples_per_second": 1299.201, "eval_steps_per_second": 162.416, "step": 30000 }, { "entropy": 5.4534954071044925, "epoch": 3.369854551580839, "grad_norm": 0.93359375, "learning_rate": 0.0003898514043312553, "loss": 5.1638, "mean_token_accuracy": 0.20689600855112075, "num_tokens": 66975096.0, "step": 30005 }, { "entropy": 5.451320314407349, "epoch": 3.3704161284887966, "grad_norm": 1.1640625, "learning_rate": 0.00038981687833732146, "loss": 5.0678, "mean_token_accuracy": 0.21220825910568236, "num_tokens": 66987621.0, "step": 30010 }, { "entropy": 5.403622674942016, "epoch": 3.3709777053967542, "grad_norm": 1.0234375, "learning_rate": 0.0003897823486875737, "loss": 5.1251, "mean_token_accuracy": 0.20674302726984023, "num_tokens": 66998801.0, "step": 30015 }, { "entropy": 5.4244894027709964, "epoch": 3.3715392823047114, "grad_norm": 1.0078125, "learning_rate": 0.0003897478153831114, "loss": 5.1139, "mean_token_accuracy": 0.20223870128393173, "num_tokens": 67010698.0, "step": 30020 }, { "entropy": 5.380762338638306, "epoch": 3.372100859212669, "grad_norm": 0.96484375, "learning_rate": 0.00038971327842503414, "loss": 4.9818, "mean_token_accuracy": 0.21794713884592057, "num_tokens": 67022487.0, "step": 30025 }, { "entropy": 5.343285703659058, "epoch": 3.3726624361206268, "grad_norm": 1.0625, "learning_rate": 0.00038967873781444167, "loss": 5.0215, "mean_token_accuracy": 0.21425683200359344, "num_tokens": 67032517.0, "step": 30030 }, { "entropy": 5.345498132705688, "epoch": 3.3732240130285844, "grad_norm": 1.09375, "learning_rate": 0.00038964419355243365, "loss": 4.9697, "mean_token_accuracy": 0.2158302441239357, "num_tokens": 67042466.0, "step": 30035 }, { "entropy": 5.413795280456543, "epoch": 3.3737855899365417, "grad_norm": 1.078125, "learning_rate": 0.0003896096456401101, "loss": 5.09, "mean_token_accuracy": 0.21146479547023772, "num_tokens": 67053090.0, "step": 30040 }, { "entropy": 5.362494850158692, "epoch": 3.3743471668444993, "grad_norm": 1.0234375, "learning_rate": 0.00038957509407857097, "loss": 4.9402, "mean_token_accuracy": 0.21361034661531447, "num_tokens": 67064332.0, "step": 30045 }, { "entropy": 5.31009840965271, "epoch": 3.374908743752457, "grad_norm": 1.0234375, "learning_rate": 0.00038954053886891635, "loss": 4.9811, "mean_token_accuracy": 0.21242313981056213, "num_tokens": 67074788.0, "step": 30050 }, { "entropy": 5.320407247543335, "epoch": 3.3754703206604146, "grad_norm": 0.9296875, "learning_rate": 0.0003895059800122466, "loss": 5.0435, "mean_token_accuracy": 0.21271974295377732, "num_tokens": 67086510.0, "step": 30055 }, { "entropy": 5.385377216339111, "epoch": 3.376031897568372, "grad_norm": 0.9921875, "learning_rate": 0.000389471417509662, "loss": 5.0317, "mean_token_accuracy": 0.2123967170715332, "num_tokens": 67096561.0, "step": 30060 }, { "entropy": 5.332107591629028, "epoch": 3.3765934744763295, "grad_norm": 0.98046875, "learning_rate": 0.000389436851362263, "loss": 4.9908, "mean_token_accuracy": 0.21586178988218307, "num_tokens": 67107897.0, "step": 30065 }, { "entropy": 5.335859155654907, "epoch": 3.377155051384287, "grad_norm": 1.015625, "learning_rate": 0.00038940228157115036, "loss": 5.1193, "mean_token_accuracy": 0.20771542936563492, "num_tokens": 67119686.0, "step": 30070 }, { "entropy": 5.419267702102661, "epoch": 3.3777166282922444, "grad_norm": 0.9296875, "learning_rate": 0.00038936770813742473, "loss": 5.0235, "mean_token_accuracy": 0.21207644492387773, "num_tokens": 67131041.0, "step": 30075 }, { "entropy": 5.513225650787353, "epoch": 3.378278205200202, "grad_norm": 0.9375, "learning_rate": 0.00038933313106218694, "loss": 5.1416, "mean_token_accuracy": 0.21388377994298935, "num_tokens": 67143065.0, "step": 30080 }, { "entropy": 5.361063814163208, "epoch": 3.3788397821081597, "grad_norm": 1.0234375, "learning_rate": 0.00038929855034653776, "loss": 4.9715, "mean_token_accuracy": 0.21915498226881028, "num_tokens": 67154173.0, "step": 30085 }, { "entropy": 5.320414590835571, "epoch": 3.3794013590161174, "grad_norm": 1.0078125, "learning_rate": 0.00038926396599157855, "loss": 5.0297, "mean_token_accuracy": 0.2054807499051094, "num_tokens": 67165909.0, "step": 30090 }, { "entropy": 5.347616338729859, "epoch": 3.379962935924075, "grad_norm": 1.015625, "learning_rate": 0.0003892293779984103, "loss": 5.0157, "mean_token_accuracy": 0.21979046165943145, "num_tokens": 67177474.0, "step": 30095 }, { "entropy": 5.428892421722412, "epoch": 3.3805245128320323, "grad_norm": 0.99609375, "learning_rate": 0.0003891947863681344, "loss": 5.099, "mean_token_accuracy": 0.207650788128376, "num_tokens": 67187590.0, "step": 30100 }, { "entropy": 5.308780527114868, "epoch": 3.38108608973999, "grad_norm": 0.91796875, "learning_rate": 0.0003891601911018521, "loss": 4.9759, "mean_token_accuracy": 0.21467913538217545, "num_tokens": 67198579.0, "step": 30105 }, { "entropy": 5.350521564483643, "epoch": 3.3816476666479476, "grad_norm": 1.015625, "learning_rate": 0.0003891255922006652, "loss": 4.9994, "mean_token_accuracy": 0.22020458281040192, "num_tokens": 67208503.0, "step": 30110 }, { "entropy": 5.295143270492554, "epoch": 3.382209243555905, "grad_norm": 0.98046875, "learning_rate": 0.000389090989665675, "loss": 4.9705, "mean_token_accuracy": 0.21536457538604736, "num_tokens": 67219363.0, "step": 30115 }, { "entropy": 5.292697238922119, "epoch": 3.3827708204638625, "grad_norm": 0.96484375, "learning_rate": 0.0003890563834979835, "loss": 5.063, "mean_token_accuracy": 0.20983703434467316, "num_tokens": 67231030.0, "step": 30120 }, { "entropy": 5.444101715087891, "epoch": 3.38333239737182, "grad_norm": 1.015625, "learning_rate": 0.0003890217736986926, "loss": 5.0372, "mean_token_accuracy": 0.20746132582426072, "num_tokens": 67242962.0, "step": 30125 }, { "entropy": 5.420209312438965, "epoch": 3.383893974279778, "grad_norm": 0.9609375, "learning_rate": 0.00038898716026890414, "loss": 5.0462, "mean_token_accuracy": 0.20374323576688766, "num_tokens": 67253871.0, "step": 30130 }, { "entropy": 5.366298198699951, "epoch": 3.384455551187735, "grad_norm": 1.1875, "learning_rate": 0.0003889525432097203, "loss": 5.0211, "mean_token_accuracy": 0.21110064387321473, "num_tokens": 67265875.0, "step": 30135 }, { "entropy": 5.3291843891143795, "epoch": 3.3850171280956927, "grad_norm": 1.03125, "learning_rate": 0.0003889179225222432, "loss": 5.0173, "mean_token_accuracy": 0.21602510958909987, "num_tokens": 67274920.0, "step": 30140 }, { "entropy": 5.306484079360962, "epoch": 3.3855787050036503, "grad_norm": 0.9609375, "learning_rate": 0.00038888329820757536, "loss": 5.0261, "mean_token_accuracy": 0.2148293748497963, "num_tokens": 67286440.0, "step": 30145 }, { "entropy": 5.345148372650146, "epoch": 3.386140281911608, "grad_norm": 1.1171875, "learning_rate": 0.00038884867026681906, "loss": 4.972, "mean_token_accuracy": 0.21785303056240082, "num_tokens": 67297803.0, "step": 30150 }, { "entropy": 5.242723798751831, "epoch": 3.386701858819565, "grad_norm": 0.98046875, "learning_rate": 0.0003888140387010771, "loss": 4.8958, "mean_token_accuracy": 0.2230183884501457, "num_tokens": 67309153.0, "step": 30155 }, { "entropy": 5.235397720336914, "epoch": 3.387263435727523, "grad_norm": 1.0078125, "learning_rate": 0.00038877940351145186, "loss": 4.9864, "mean_token_accuracy": 0.21358411461114885, "num_tokens": 67319695.0, "step": 30160 }, { "entropy": 5.335029792785645, "epoch": 3.3878250126354805, "grad_norm": 0.9921875, "learning_rate": 0.00038874476469904633, "loss": 4.9917, "mean_token_accuracy": 0.2187188521027565, "num_tokens": 67331615.0, "step": 30165 }, { "entropy": 5.322209358215332, "epoch": 3.3883865895434377, "grad_norm": 0.9453125, "learning_rate": 0.0003887101222649634, "loss": 4.8907, "mean_token_accuracy": 0.22161663323640823, "num_tokens": 67341898.0, "step": 30170 }, { "entropy": 5.386251640319824, "epoch": 3.3889481664513954, "grad_norm": 1.015625, "learning_rate": 0.000388675476210306, "loss": 5.0832, "mean_token_accuracy": 0.21715029180049897, "num_tokens": 67352677.0, "step": 30175 }, { "entropy": 5.333758211135864, "epoch": 3.389509743359353, "grad_norm": 0.95703125, "learning_rate": 0.00038864082653617744, "loss": 5.0039, "mean_token_accuracy": 0.21207329779863357, "num_tokens": 67363215.0, "step": 30180 }, { "entropy": 5.319951772689819, "epoch": 3.3900713202673107, "grad_norm": 0.90625, "learning_rate": 0.00038860617324368085, "loss": 5.0187, "mean_token_accuracy": 0.21429772973060607, "num_tokens": 67374489.0, "step": 30185 }, { "entropy": 5.395950794219971, "epoch": 3.3906328971752684, "grad_norm": 1.015625, "learning_rate": 0.0003885715163339196, "loss": 5.0354, "mean_token_accuracy": 0.21528981775045394, "num_tokens": 67384890.0, "step": 30190 }, { "entropy": 5.3208846092224125, "epoch": 3.3911944740832256, "grad_norm": 0.93359375, "learning_rate": 0.00038853685580799726, "loss": 4.9923, "mean_token_accuracy": 0.21424264311790467, "num_tokens": 67395811.0, "step": 30195 }, { "entropy": 5.317122507095337, "epoch": 3.3917560509911833, "grad_norm": 0.93359375, "learning_rate": 0.0003885021916670174, "loss": 4.9671, "mean_token_accuracy": 0.22014525085687636, "num_tokens": 67407056.0, "step": 30200 }, { "entropy": 5.374187326431274, "epoch": 3.392317627899141, "grad_norm": 1.015625, "learning_rate": 0.0003884675239120838, "loss": 5.0392, "mean_token_accuracy": 0.21116345077753068, "num_tokens": 67418371.0, "step": 30205 }, { "entropy": 5.367884683609009, "epoch": 3.392879204807098, "grad_norm": 1.015625, "learning_rate": 0.00038843285254430005, "loss": 5.0301, "mean_token_accuracy": 0.21094926595687866, "num_tokens": 67429165.0, "step": 30210 }, { "entropy": 5.5298666000366214, "epoch": 3.393440781715056, "grad_norm": 1.015625, "learning_rate": 0.0003883981775647705, "loss": 5.2464, "mean_token_accuracy": 0.20436334908008574, "num_tokens": 67442317.0, "step": 30215 }, { "entropy": 5.509282922744751, "epoch": 3.3940023586230135, "grad_norm": 1.0, "learning_rate": 0.0003883634989745988, "loss": 5.1428, "mean_token_accuracy": 0.21388594359159468, "num_tokens": 67454086.0, "step": 30220 }, { "entropy": 5.419427347183228, "epoch": 3.394563935530971, "grad_norm": 1.0703125, "learning_rate": 0.00038832881677488944, "loss": 5.1027, "mean_token_accuracy": 0.202974334359169, "num_tokens": 67465066.0, "step": 30225 }, { "entropy": 5.291957569122315, "epoch": 3.3951255124389284, "grad_norm": 0.99609375, "learning_rate": 0.00038829413096674653, "loss": 4.954, "mean_token_accuracy": 0.21786050200462342, "num_tokens": 67475456.0, "step": 30230 }, { "entropy": 5.373084306716919, "epoch": 3.395687089346886, "grad_norm": 1.0234375, "learning_rate": 0.0003882594415512746, "loss": 4.9986, "mean_token_accuracy": 0.21428725570440293, "num_tokens": 67486315.0, "step": 30235 }, { "entropy": 5.318059396743775, "epoch": 3.3962486662548437, "grad_norm": 0.98828125, "learning_rate": 0.00038822474852957817, "loss": 4.9503, "mean_token_accuracy": 0.21651425808668137, "num_tokens": 67497431.0, "step": 30240 }, { "entropy": 5.329329109191894, "epoch": 3.3968102431628013, "grad_norm": 0.95703125, "learning_rate": 0.0003881900519027618, "loss": 5.0248, "mean_token_accuracy": 0.21906078308820726, "num_tokens": 67508054.0, "step": 30245 }, { "entropy": 5.414961338043213, "epoch": 3.3973718200707586, "grad_norm": 1.0, "learning_rate": 0.0003881553516719303, "loss": 5.0811, "mean_token_accuracy": 0.20679268538951873, "num_tokens": 67519083.0, "step": 30250 }, { "entropy": 5.40166482925415, "epoch": 3.397933396978716, "grad_norm": 1.0078125, "learning_rate": 0.00038812064783818847, "loss": 5.0616, "mean_token_accuracy": 0.21086174249649048, "num_tokens": 67528909.0, "step": 30255 }, { "entropy": 5.251445341110229, "epoch": 3.398494973886674, "grad_norm": 0.96484375, "learning_rate": 0.00038808594040264127, "loss": 4.8775, "mean_token_accuracy": 0.22917675822973252, "num_tokens": 67540069.0, "step": 30260 }, { "entropy": 5.292755794525147, "epoch": 3.399056550794631, "grad_norm": 0.94140625, "learning_rate": 0.000388051229366394, "loss": 5.0055, "mean_token_accuracy": 0.21921857297420502, "num_tokens": 67550733.0, "step": 30265 }, { "entropy": 5.461176204681396, "epoch": 3.3996181277025888, "grad_norm": 0.9921875, "learning_rate": 0.00038801651473055167, "loss": 5.1395, "mean_token_accuracy": 0.20966355353593827, "num_tokens": 67562118.0, "step": 30270 }, { "entropy": 5.345594835281372, "epoch": 3.4001797046105464, "grad_norm": 1.1484375, "learning_rate": 0.0003879817964962197, "loss": 4.9524, "mean_token_accuracy": 0.2192150041460991, "num_tokens": 67572408.0, "step": 30275 }, { "entropy": 5.408023834228516, "epoch": 3.400741281518504, "grad_norm": 1.0234375, "learning_rate": 0.0003879470746645035, "loss": 5.149, "mean_token_accuracy": 0.20989259332418442, "num_tokens": 67584125.0, "step": 30280 }, { "entropy": 5.376199388504029, "epoch": 3.4013028584264617, "grad_norm": 0.96875, "learning_rate": 0.00038791234923650866, "loss": 5.0042, "mean_token_accuracy": 0.21159509867429732, "num_tokens": 67595093.0, "step": 30285 }, { "entropy": 5.414803075790405, "epoch": 3.401864435334419, "grad_norm": 1.015625, "learning_rate": 0.00038787762021334077, "loss": 5.0885, "mean_token_accuracy": 0.20873144119977952, "num_tokens": 67606794.0, "step": 30290 }, { "entropy": 5.291760015487671, "epoch": 3.4024260122423766, "grad_norm": 1.015625, "learning_rate": 0.0003878428875961057, "loss": 4.8014, "mean_token_accuracy": 0.2295370355248451, "num_tokens": 67617207.0, "step": 30295 }, { "entropy": 5.212384223937988, "epoch": 3.4029875891503343, "grad_norm": 0.98046875, "learning_rate": 0.00038780815138590935, "loss": 4.9454, "mean_token_accuracy": 0.21602405607700348, "num_tokens": 67628301.0, "step": 30300 }, { "entropy": 5.365674209594727, "epoch": 3.4035491660582915, "grad_norm": 0.9765625, "learning_rate": 0.0003877734115838577, "loss": 5.0714, "mean_token_accuracy": 0.2103058859705925, "num_tokens": 67640363.0, "step": 30305 }, { "entropy": 5.384312009811401, "epoch": 3.404110742966249, "grad_norm": 0.97265625, "learning_rate": 0.00038773866819105684, "loss": 5.0575, "mean_token_accuracy": 0.20850632786750795, "num_tokens": 67651515.0, "step": 30310 }, { "entropy": 5.3321919441223145, "epoch": 3.404672319874207, "grad_norm": 1.046875, "learning_rate": 0.0003877039212086131, "loss": 5.0068, "mean_token_accuracy": 0.21417766958475112, "num_tokens": 67661669.0, "step": 30315 }, { "entropy": 5.336136722564698, "epoch": 3.4052338967821645, "grad_norm": 1.0234375, "learning_rate": 0.00038766917063763287, "loss": 4.943, "mean_token_accuracy": 0.21848686337471007, "num_tokens": 67671945.0, "step": 30320 }, { "entropy": 5.3223127841949465, "epoch": 3.4057954736901217, "grad_norm": 1.015625, "learning_rate": 0.00038763441647922246, "loss": 4.9896, "mean_token_accuracy": 0.20769304186105728, "num_tokens": 67683090.0, "step": 30325 }, { "entropy": 5.353286457061768, "epoch": 3.4063570505980794, "grad_norm": 0.88671875, "learning_rate": 0.0003875996587344885, "loss": 5.0283, "mean_token_accuracy": 0.218906469643116, "num_tokens": 67694036.0, "step": 30330 }, { "entropy": 5.429412937164306, "epoch": 3.406918627506037, "grad_norm": 1.0703125, "learning_rate": 0.00038756489740453785, "loss": 5.0101, "mean_token_accuracy": 0.21323282718658448, "num_tokens": 67704677.0, "step": 30335 }, { "entropy": 5.3625938415527346, "epoch": 3.4074802044139947, "grad_norm": 0.96484375, "learning_rate": 0.00038753013249047706, "loss": 5.0701, "mean_token_accuracy": 0.21416995972394942, "num_tokens": 67715165.0, "step": 30340 }, { "entropy": 5.326519298553467, "epoch": 3.408041781321952, "grad_norm": 1.0078125, "learning_rate": 0.0003874953639934134, "loss": 4.9852, "mean_token_accuracy": 0.2228758916258812, "num_tokens": 67726226.0, "step": 30345 }, { "entropy": 5.3486326217651365, "epoch": 3.4086033582299096, "grad_norm": 1.0, "learning_rate": 0.0003874605919144536, "loss": 4.9892, "mean_token_accuracy": 0.2193448141217232, "num_tokens": 67739564.0, "step": 30350 }, { "entropy": 5.3447465896606445, "epoch": 3.4091649351378672, "grad_norm": 0.953125, "learning_rate": 0.0003874258162547049, "loss": 5.115, "mean_token_accuracy": 0.2124485731124878, "num_tokens": 67751683.0, "step": 30355 }, { "entropy": 5.377430725097656, "epoch": 3.4097265120458244, "grad_norm": 0.9921875, "learning_rate": 0.0003873910370152747, "loss": 5.0535, "mean_token_accuracy": 0.2136751651763916, "num_tokens": 67762782.0, "step": 30360 }, { "entropy": 5.406807851791382, "epoch": 3.410288088953782, "grad_norm": 1.0078125, "learning_rate": 0.0003873562541972702, "loss": 5.023, "mean_token_accuracy": 0.21507148295640946, "num_tokens": 67773583.0, "step": 30365 }, { "entropy": 5.333729934692383, "epoch": 3.4108496658617398, "grad_norm": 1.0625, "learning_rate": 0.0003873214678017991, "loss": 5.0165, "mean_token_accuracy": 0.21802588552236557, "num_tokens": 67785428.0, "step": 30370 }, { "entropy": 5.439136505126953, "epoch": 3.4114112427696974, "grad_norm": 0.953125, "learning_rate": 0.0003872866778299688, "loss": 5.1234, "mean_token_accuracy": 0.2071713387966156, "num_tokens": 67797678.0, "step": 30375 }, { "entropy": 5.4954229354858395, "epoch": 3.411972819677655, "grad_norm": 0.9375, "learning_rate": 0.0003872518842828872, "loss": 5.0535, "mean_token_accuracy": 0.21821678578853607, "num_tokens": 67809314.0, "step": 30380 }, { "entropy": 5.319619178771973, "epoch": 3.4125343965856123, "grad_norm": 0.9453125, "learning_rate": 0.00038721708716166203, "loss": 5.0368, "mean_token_accuracy": 0.2156158372759819, "num_tokens": 67820591.0, "step": 30385 }, { "entropy": 5.278154897689819, "epoch": 3.41309597349357, "grad_norm": 0.984375, "learning_rate": 0.0003871822864674013, "loss": 4.9887, "mean_token_accuracy": 0.21803202629089355, "num_tokens": 67831436.0, "step": 30390 }, { "entropy": 5.3759815216064455, "epoch": 3.4136575504015276, "grad_norm": 1.046875, "learning_rate": 0.00038714748220121305, "loss": 5.0463, "mean_token_accuracy": 0.21730043441057206, "num_tokens": 67842813.0, "step": 30395 }, { "entropy": 5.417090892791748, "epoch": 3.414219127309485, "grad_norm": 1.015625, "learning_rate": 0.0003871126743642055, "loss": 5.0569, "mean_token_accuracy": 0.2078885480761528, "num_tokens": 67853899.0, "step": 30400 }, { "entropy": 5.396058845520019, "epoch": 3.4147807042174425, "grad_norm": 0.98828125, "learning_rate": 0.00038707786295748693, "loss": 4.9993, "mean_token_accuracy": 0.215189366042614, "num_tokens": 67864237.0, "step": 30405 }, { "entropy": 5.3132318496704105, "epoch": 3.4153422811254, "grad_norm": 0.90625, "learning_rate": 0.00038704304798216566, "loss": 4.98, "mean_token_accuracy": 0.20995001643896102, "num_tokens": 67876109.0, "step": 30410 }, { "entropy": 5.27262544631958, "epoch": 3.415903858033358, "grad_norm": 1.078125, "learning_rate": 0.0003870082294393503, "loss": 4.9354, "mean_token_accuracy": 0.2108785793185234, "num_tokens": 67888461.0, "step": 30415 }, { "entropy": 5.358737277984619, "epoch": 3.416465434941315, "grad_norm": 1.0703125, "learning_rate": 0.0003869734073301495, "loss": 5.0115, "mean_token_accuracy": 0.21752513498067855, "num_tokens": 67899543.0, "step": 30420 }, { "entropy": 5.4097377300262455, "epoch": 3.4170270118492727, "grad_norm": 1.0703125, "learning_rate": 0.00038693858165567195, "loss": 5.11, "mean_token_accuracy": 0.21224105805158616, "num_tokens": 67910606.0, "step": 30425 }, { "entropy": 5.358897256851196, "epoch": 3.4175885887572304, "grad_norm": 1.0390625, "learning_rate": 0.0003869037524170266, "loss": 4.9582, "mean_token_accuracy": 0.21804407835006714, "num_tokens": 67921240.0, "step": 30430 }, { "entropy": 5.433197975158691, "epoch": 3.418150165665188, "grad_norm": 0.97265625, "learning_rate": 0.00038686891961532227, "loss": 5.2408, "mean_token_accuracy": 0.20136552304029465, "num_tokens": 67935178.0, "step": 30435 }, { "entropy": 5.277958011627197, "epoch": 3.4187117425731453, "grad_norm": 0.96484375, "learning_rate": 0.0003868340832516683, "loss": 4.8948, "mean_token_accuracy": 0.22259962558746338, "num_tokens": 67947260.0, "step": 30440 }, { "entropy": 5.339145851135254, "epoch": 3.419273319481103, "grad_norm": 1.0078125, "learning_rate": 0.00038679924332717363, "loss": 4.9466, "mean_token_accuracy": 0.217559514939785, "num_tokens": 67956665.0, "step": 30445 }, { "entropy": 5.351485729217529, "epoch": 3.4198348963890606, "grad_norm": 0.9296875, "learning_rate": 0.00038676439984294776, "loss": 5.0305, "mean_token_accuracy": 0.21113453209400176, "num_tokens": 67967927.0, "step": 30450 }, { "entropy": 5.343424606323242, "epoch": 3.420396473297018, "grad_norm": 0.95703125, "learning_rate": 0.00038672955280009996, "loss": 5.0089, "mean_token_accuracy": 0.21755767315626146, "num_tokens": 67979574.0, "step": 30455 }, { "entropy": 5.347293281555176, "epoch": 3.4209580502049755, "grad_norm": 0.96484375, "learning_rate": 0.00038669470219973996, "loss": 5.0761, "mean_token_accuracy": 0.21034935116767883, "num_tokens": 67991671.0, "step": 30460 }, { "entropy": 5.449505567550659, "epoch": 3.421519627112933, "grad_norm": 0.9453125, "learning_rate": 0.00038665984804297734, "loss": 5.0768, "mean_token_accuracy": 0.20592614263296127, "num_tokens": 68002443.0, "step": 30465 }, { "entropy": 5.380095624923706, "epoch": 3.4220812040208908, "grad_norm": 0.92578125, "learning_rate": 0.0003866249903309218, "loss": 4.9997, "mean_token_accuracy": 0.20927030444145203, "num_tokens": 68013681.0, "step": 30470 }, { "entropy": 5.396969032287598, "epoch": 3.4226427809288484, "grad_norm": 1.046875, "learning_rate": 0.0003865901290646833, "loss": 5.0187, "mean_token_accuracy": 0.21917644441127776, "num_tokens": 68023757.0, "step": 30475 }, { "entropy": 5.278738975524902, "epoch": 3.4232043578368057, "grad_norm": 0.97265625, "learning_rate": 0.00038655526424537175, "loss": 5.0019, "mean_token_accuracy": 0.2140437752008438, "num_tokens": 68035491.0, "step": 30480 }, { "entropy": 5.286426401138305, "epoch": 3.4237659347447633, "grad_norm": 1.0, "learning_rate": 0.00038652039587409734, "loss": 5.0082, "mean_token_accuracy": 0.21297864317893983, "num_tokens": 68047581.0, "step": 30485 }, { "entropy": 5.390673398971558, "epoch": 3.424327511652721, "grad_norm": 0.93359375, "learning_rate": 0.0003864855239519703, "loss": 5.0536, "mean_token_accuracy": 0.21332051157951354, "num_tokens": 68058232.0, "step": 30490 }, { "entropy": 5.536237001419067, "epoch": 3.424889088560678, "grad_norm": 0.87109375, "learning_rate": 0.00038645064848010093, "loss": 5.211, "mean_token_accuracy": 0.2048870176076889, "num_tokens": 68071602.0, "step": 30495 }, { "entropy": 5.381994676589966, "epoch": 3.425450665468636, "grad_norm": 0.9453125, "learning_rate": 0.00038641576945959964, "loss": 5.0093, "mean_token_accuracy": 0.2121684581041336, "num_tokens": 68083169.0, "step": 30500 }, { "entropy": 5.379086303710937, "epoch": 3.4260122423765935, "grad_norm": 0.93359375, "learning_rate": 0.00038638088689157713, "loss": 5.0406, "mean_token_accuracy": 0.20722143352031708, "num_tokens": 68093951.0, "step": 30505 }, { "entropy": 5.437827205657959, "epoch": 3.426573819284551, "grad_norm": 0.9375, "learning_rate": 0.00038634600077714395, "loss": 5.1285, "mean_token_accuracy": 0.20868780761957167, "num_tokens": 68105398.0, "step": 30510 }, { "entropy": 5.380607986450196, "epoch": 3.4271353961925084, "grad_norm": 0.921875, "learning_rate": 0.0003863111111174109, "loss": 5.0102, "mean_token_accuracy": 0.21454898864030839, "num_tokens": 68116544.0, "step": 30515 }, { "entropy": 5.380779790878296, "epoch": 3.427696973100466, "grad_norm": 1.0078125, "learning_rate": 0.00038627621791348886, "loss": 4.9695, "mean_token_accuracy": 0.22695867866277694, "num_tokens": 68126977.0, "step": 30520 }, { "entropy": 5.451254510879517, "epoch": 3.4282585500084237, "grad_norm": 0.99609375, "learning_rate": 0.00038624132116648897, "loss": 5.1336, "mean_token_accuracy": 0.20618606954813004, "num_tokens": 68137884.0, "step": 30525 }, { "entropy": 5.423811721801758, "epoch": 3.4288201269163814, "grad_norm": 0.9296875, "learning_rate": 0.0003862064208775223, "loss": 5.1144, "mean_token_accuracy": 0.21106421649456025, "num_tokens": 68149026.0, "step": 30530 }, { "entropy": 5.360766315460205, "epoch": 3.4293817038243386, "grad_norm": 0.99609375, "learning_rate": 0.00038617151704769994, "loss": 5.0432, "mean_token_accuracy": 0.2135568991303444, "num_tokens": 68159962.0, "step": 30535 }, { "entropy": 5.39732985496521, "epoch": 3.4299432807322963, "grad_norm": 0.98828125, "learning_rate": 0.0003861366096781334, "loss": 5.0341, "mean_token_accuracy": 0.21574080139398574, "num_tokens": 68170849.0, "step": 30540 }, { "entropy": 5.326971769332886, "epoch": 3.430504857640254, "grad_norm": 0.953125, "learning_rate": 0.0003861016987699342, "loss": 4.9293, "mean_token_accuracy": 0.21906704306602479, "num_tokens": 68181623.0, "step": 30545 }, { "entropy": 5.2901129722595215, "epoch": 3.431066434548211, "grad_norm": 1.0078125, "learning_rate": 0.00038606678432421366, "loss": 4.9016, "mean_token_accuracy": 0.22573311179876326, "num_tokens": 68191943.0, "step": 30550 }, { "entropy": 5.297085523605347, "epoch": 3.431628011456169, "grad_norm": 0.91015625, "learning_rate": 0.0003860318663420837, "loss": 4.9755, "mean_token_accuracy": 0.21072250008583068, "num_tokens": 68203833.0, "step": 30555 }, { "entropy": 5.310635280609131, "epoch": 3.4321895883641265, "grad_norm": 1.0625, "learning_rate": 0.00038599694482465606, "loss": 5.0036, "mean_token_accuracy": 0.21280494332313538, "num_tokens": 68213992.0, "step": 30560 }, { "entropy": 5.35171365737915, "epoch": 3.432751165272084, "grad_norm": 0.93359375, "learning_rate": 0.00038596201977304263, "loss": 5.0004, "mean_token_accuracy": 0.21705715358257294, "num_tokens": 68224575.0, "step": 30565 }, { "entropy": 5.373250818252563, "epoch": 3.433312742180042, "grad_norm": 1.078125, "learning_rate": 0.00038592709118835547, "loss": 5.0483, "mean_token_accuracy": 0.2093303844332695, "num_tokens": 68235513.0, "step": 30570 }, { "entropy": 5.451681804656983, "epoch": 3.433874319087999, "grad_norm": 1.0, "learning_rate": 0.00038589215907170664, "loss": 5.0681, "mean_token_accuracy": 0.2130262777209282, "num_tokens": 68246560.0, "step": 30575 }, { "entropy": 5.268670272827149, "epoch": 3.4344358959959567, "grad_norm": 1.0390625, "learning_rate": 0.0003858572234242086, "loss": 4.8884, "mean_token_accuracy": 0.22357730567455292, "num_tokens": 68257760.0, "step": 30580 }, { "entropy": 5.2810564041137695, "epoch": 3.4349974729039143, "grad_norm": 0.9609375, "learning_rate": 0.00038582228424697347, "loss": 4.9204, "mean_token_accuracy": 0.23064145147800447, "num_tokens": 68269631.0, "step": 30585 }, { "entropy": 5.387024307250977, "epoch": 3.4355590498118715, "grad_norm": 0.99609375, "learning_rate": 0.0003857873415411138, "loss": 5.0393, "mean_token_accuracy": 0.21885640323162078, "num_tokens": 68280198.0, "step": 30590 }, { "entropy": 5.35499587059021, "epoch": 3.436120626719829, "grad_norm": 0.99609375, "learning_rate": 0.0003857523953077423, "loss": 5.0839, "mean_token_accuracy": 0.21083260029554368, "num_tokens": 68291812.0, "step": 30595 }, { "entropy": 5.390143966674804, "epoch": 3.436682203627787, "grad_norm": 0.99609375, "learning_rate": 0.00038571744554797156, "loss": 5.0812, "mean_token_accuracy": 0.21129658669233323, "num_tokens": 68303202.0, "step": 30600 }, { "entropy": 5.3266161441802975, "epoch": 3.4372437805357445, "grad_norm": 0.99609375, "learning_rate": 0.00038568249226291433, "loss": 4.9343, "mean_token_accuracy": 0.2145319402217865, "num_tokens": 68313768.0, "step": 30605 }, { "entropy": 5.368358755111695, "epoch": 3.4378053574437017, "grad_norm": 1.0, "learning_rate": 0.00038564753545368375, "loss": 5.0219, "mean_token_accuracy": 0.21536147892475127, "num_tokens": 68325325.0, "step": 30610 }, { "entropy": 5.40307469367981, "epoch": 3.4383669343516594, "grad_norm": 1.0, "learning_rate": 0.00038561257512139264, "loss": 5.1066, "mean_token_accuracy": 0.21310515850782394, "num_tokens": 68337166.0, "step": 30615 }, { "entropy": 5.388151359558106, "epoch": 3.438928511259617, "grad_norm": 0.984375, "learning_rate": 0.00038557761126715426, "loss": 5.0132, "mean_token_accuracy": 0.22017728090286254, "num_tokens": 68348898.0, "step": 30620 }, { "entropy": 5.381800746917724, "epoch": 3.4394900881675747, "grad_norm": 1.0625, "learning_rate": 0.0003855426438920818, "loss": 5.0779, "mean_token_accuracy": 0.21035739481449128, "num_tokens": 68360589.0, "step": 30625 }, { "entropy": 5.239636707305908, "epoch": 3.440051665075532, "grad_norm": 1.0390625, "learning_rate": 0.00038550767299728875, "loss": 4.8823, "mean_token_accuracy": 0.22481377720832824, "num_tokens": 68371813.0, "step": 30630 }, { "entropy": 5.369158220291138, "epoch": 3.4406132419834896, "grad_norm": 0.98046875, "learning_rate": 0.00038547269858388853, "loss": 5.0985, "mean_token_accuracy": 0.21178159415721892, "num_tokens": 68382060.0, "step": 30635 }, { "entropy": 5.422509670257568, "epoch": 3.4411748188914473, "grad_norm": 0.95703125, "learning_rate": 0.0003854377206529947, "loss": 5.0996, "mean_token_accuracy": 0.21597285717725753, "num_tokens": 68395603.0, "step": 30640 }, { "entropy": 5.356976175308228, "epoch": 3.4417363957994045, "grad_norm": 0.98046875, "learning_rate": 0.000385402739205721, "loss": 4.9689, "mean_token_accuracy": 0.2228722557425499, "num_tokens": 68406725.0, "step": 30645 }, { "entropy": 5.376346254348755, "epoch": 3.442297972707362, "grad_norm": 0.953125, "learning_rate": 0.0003853677542431813, "loss": 5.1309, "mean_token_accuracy": 0.20524288713932037, "num_tokens": 68418577.0, "step": 30650 }, { "entropy": 5.326123189926148, "epoch": 3.44285954961532, "grad_norm": 1.0, "learning_rate": 0.0003853327657664895, "loss": 4.9637, "mean_token_accuracy": 0.21629838645458221, "num_tokens": 68429708.0, "step": 30655 }, { "entropy": 5.38738784790039, "epoch": 3.4434211265232775, "grad_norm": 0.92578125, "learning_rate": 0.0003852977737767596, "loss": 5.1312, "mean_token_accuracy": 0.20819007903337478, "num_tokens": 68442115.0, "step": 30660 }, { "entropy": 5.361652088165283, "epoch": 3.443982703431235, "grad_norm": 0.9140625, "learning_rate": 0.0003852627782751059, "loss": 5.0136, "mean_token_accuracy": 0.2177476093173027, "num_tokens": 68453555.0, "step": 30665 }, { "entropy": 5.321253395080566, "epoch": 3.4445442803391924, "grad_norm": 0.94140625, "learning_rate": 0.0003852277792626425, "loss": 4.9131, "mean_token_accuracy": 0.22145827412605285, "num_tokens": 68466859.0, "step": 30670 }, { "entropy": 5.29543628692627, "epoch": 3.44510585724715, "grad_norm": 0.9765625, "learning_rate": 0.0003851927767404839, "loss": 5.0043, "mean_token_accuracy": 0.21579211056232453, "num_tokens": 68477628.0, "step": 30675 }, { "entropy": 5.3807878494262695, "epoch": 3.4456674341551077, "grad_norm": 0.921875, "learning_rate": 0.0003851577707097445, "loss": 5.1038, "mean_token_accuracy": 0.2164286732673645, "num_tokens": 68488764.0, "step": 30680 }, { "entropy": 5.460570240020752, "epoch": 3.446229011063065, "grad_norm": 0.99609375, "learning_rate": 0.000385122761171539, "loss": 5.1394, "mean_token_accuracy": 0.21168999075889589, "num_tokens": 68499433.0, "step": 30685 }, { "entropy": 5.391172170639038, "epoch": 3.4467905879710226, "grad_norm": 0.984375, "learning_rate": 0.00038508774812698207, "loss": 5.0024, "mean_token_accuracy": 0.21339063793420793, "num_tokens": 68510832.0, "step": 30690 }, { "entropy": 5.2627920627594, "epoch": 3.44735216487898, "grad_norm": 1.0625, "learning_rate": 0.0003850527315771885, "loss": 4.9068, "mean_token_accuracy": 0.21751293987035752, "num_tokens": 68520946.0, "step": 30695 }, { "entropy": 5.374011707305908, "epoch": 3.447913741786938, "grad_norm": 1.0390625, "learning_rate": 0.00038501771152327333, "loss": 5.0956, "mean_token_accuracy": 0.21109937727451325, "num_tokens": 68531769.0, "step": 30700 }, { "entropy": 5.445743131637573, "epoch": 3.448475318694895, "grad_norm": 1.046875, "learning_rate": 0.00038498268796635155, "loss": 5.112, "mean_token_accuracy": 0.2046330213546753, "num_tokens": 68543172.0, "step": 30705 }, { "entropy": 5.276662063598633, "epoch": 3.4490368956028528, "grad_norm": 0.98046875, "learning_rate": 0.00038494766090753824, "loss": 4.9571, "mean_token_accuracy": 0.21804124861955643, "num_tokens": 68554078.0, "step": 30710 }, { "entropy": 5.315173625946045, "epoch": 3.4495984725108104, "grad_norm": 1.0390625, "learning_rate": 0.00038491263034794886, "loss": 4.9352, "mean_token_accuracy": 0.21862834542989731, "num_tokens": 68564705.0, "step": 30715 }, { "entropy": 5.439404582977295, "epoch": 3.450160049418768, "grad_norm": 0.9765625, "learning_rate": 0.0003848775962886987, "loss": 5.2222, "mean_token_accuracy": 0.2029855564236641, "num_tokens": 68577010.0, "step": 30720 }, { "entropy": 5.423171758651733, "epoch": 3.4507216263267253, "grad_norm": 1.0390625, "learning_rate": 0.0003848425587309032, "loss": 5.0551, "mean_token_accuracy": 0.21266096830368042, "num_tokens": 68588465.0, "step": 30725 }, { "entropy": 5.385078620910645, "epoch": 3.451283203234683, "grad_norm": 1.0234375, "learning_rate": 0.00038480751767567807, "loss": 5.0429, "mean_token_accuracy": 0.21389450877904892, "num_tokens": 68599666.0, "step": 30730 }, { "entropy": 5.31045823097229, "epoch": 3.4518447801426406, "grad_norm": 0.921875, "learning_rate": 0.000384772473124139, "loss": 4.9971, "mean_token_accuracy": 0.21728697121143342, "num_tokens": 68610530.0, "step": 30735 }, { "entropy": 5.269164085388184, "epoch": 3.452406357050598, "grad_norm": 1.0234375, "learning_rate": 0.0003847374250774018, "loss": 4.9697, "mean_token_accuracy": 0.21999448239803315, "num_tokens": 68621360.0, "step": 30740 }, { "entropy": 5.44544677734375, "epoch": 3.4529679339585555, "grad_norm": 1.015625, "learning_rate": 0.00038470237353658237, "loss": 5.0525, "mean_token_accuracy": 0.21059583872556686, "num_tokens": 68632874.0, "step": 30745 }, { "entropy": 5.3436933040618895, "epoch": 3.453529510866513, "grad_norm": 0.921875, "learning_rate": 0.00038466731850279683, "loss": 5.0281, "mean_token_accuracy": 0.21019955426454545, "num_tokens": 68643715.0, "step": 30750 }, { "entropy": 5.301168394088745, "epoch": 3.454091087774471, "grad_norm": 0.94140625, "learning_rate": 0.00038463225997716137, "loss": 5.0031, "mean_token_accuracy": 0.20859742164611816, "num_tokens": 68655433.0, "step": 30755 }, { "entropy": 5.411481952667236, "epoch": 3.4546526646824285, "grad_norm": 1.078125, "learning_rate": 0.00038459719796079227, "loss": 5.0589, "mean_token_accuracy": 0.21599926054477692, "num_tokens": 68667321.0, "step": 30760 }, { "entropy": 5.408344554901123, "epoch": 3.4552142415903857, "grad_norm": 1.0390625, "learning_rate": 0.0003845621324548059, "loss": 4.9636, "mean_token_accuracy": 0.2113675743341446, "num_tokens": 68677314.0, "step": 30765 }, { "entropy": 5.360374975204468, "epoch": 3.4557758184983434, "grad_norm": 1.046875, "learning_rate": 0.0003845270634603186, "loss": 5.1087, "mean_token_accuracy": 0.212170971930027, "num_tokens": 68688871.0, "step": 30770 }, { "entropy": 5.364226484298706, "epoch": 3.456337395406301, "grad_norm": 0.9765625, "learning_rate": 0.00038449199097844724, "loss": 5.1064, "mean_token_accuracy": 0.21647169589996337, "num_tokens": 68699760.0, "step": 30775 }, { "entropy": 5.504874753952026, "epoch": 3.4568989723142582, "grad_norm": 1.0625, "learning_rate": 0.0003844569150103084, "loss": 5.1566, "mean_token_accuracy": 0.20138760954141616, "num_tokens": 68711113.0, "step": 30780 }, { "entropy": 5.428476285934448, "epoch": 3.457460549222216, "grad_norm": 0.9921875, "learning_rate": 0.0003844218355570189, "loss": 5.0119, "mean_token_accuracy": 0.21746293902397157, "num_tokens": 68722904.0, "step": 30785 }, { "entropy": 5.306151008605957, "epoch": 3.4580221261301736, "grad_norm": 0.99609375, "learning_rate": 0.0003843867526196957, "loss": 4.9522, "mean_token_accuracy": 0.2152404099702835, "num_tokens": 68733753.0, "step": 30790 }, { "entropy": 5.3150684356689455, "epoch": 3.4585837030381312, "grad_norm": 1.0078125, "learning_rate": 0.0003843516661994559, "loss": 5.0386, "mean_token_accuracy": 0.2081532746553421, "num_tokens": 68744477.0, "step": 30795 }, { "entropy": 5.448066377639771, "epoch": 3.4591452799460884, "grad_norm": 1.015625, "learning_rate": 0.0003843165762974167, "loss": 5.107, "mean_token_accuracy": 0.21200543642044067, "num_tokens": 68755607.0, "step": 30800 }, { "entropy": 5.4901978969573975, "epoch": 3.459706856854046, "grad_norm": 0.97265625, "learning_rate": 0.00038428148291469515, "loss": 5.077, "mean_token_accuracy": 0.21149835139513015, "num_tokens": 68766477.0, "step": 30805 }, { "entropy": 5.32675199508667, "epoch": 3.4602684337620038, "grad_norm": 0.94921875, "learning_rate": 0.000384246386052409, "loss": 4.9163, "mean_token_accuracy": 0.2280939221382141, "num_tokens": 68776806.0, "step": 30810 }, { "entropy": 5.270185565948486, "epoch": 3.4608300106699614, "grad_norm": 1.0, "learning_rate": 0.0003842112857116754, "loss": 5.0015, "mean_token_accuracy": 0.21584051996469497, "num_tokens": 68788011.0, "step": 30815 }, { "entropy": 5.319165182113648, "epoch": 3.4613915875779186, "grad_norm": 0.95703125, "learning_rate": 0.0003841761818936122, "loss": 5.0159, "mean_token_accuracy": 0.21433429569005966, "num_tokens": 68800370.0, "step": 30820 }, { "entropy": 5.4621867656707765, "epoch": 3.4619531644858763, "grad_norm": 1.0859375, "learning_rate": 0.000384141074599337, "loss": 5.1132, "mean_token_accuracy": 0.20136052817106248, "num_tokens": 68811644.0, "step": 30825 }, { "entropy": 5.357368898391724, "epoch": 3.462514741393834, "grad_norm": 0.90625, "learning_rate": 0.00038410596382996764, "loss": 4.973, "mean_token_accuracy": 0.20293720811605453, "num_tokens": 68823672.0, "step": 30830 }, { "entropy": 5.340794944763184, "epoch": 3.463076318301791, "grad_norm": 0.9453125, "learning_rate": 0.0003840708495866221, "loss": 5.0441, "mean_token_accuracy": 0.2077446848154068, "num_tokens": 68835340.0, "step": 30835 }, { "entropy": 5.365924119949341, "epoch": 3.463637895209749, "grad_norm": 1.015625, "learning_rate": 0.0003840357318704183, "loss": 4.9321, "mean_token_accuracy": 0.2202227607369423, "num_tokens": 68845903.0, "step": 30840 }, { "entropy": 5.326478052139282, "epoch": 3.4641994721177065, "grad_norm": 1.0, "learning_rate": 0.0003840006106824746, "loss": 5.0294, "mean_token_accuracy": 0.20978325009346008, "num_tokens": 68857287.0, "step": 30845 }, { "entropy": 5.386662912368775, "epoch": 3.464761049025664, "grad_norm": 1.125, "learning_rate": 0.0003839654860239091, "loss": 5.1201, "mean_token_accuracy": 0.20770289450883866, "num_tokens": 68868961.0, "step": 30850 }, { "entropy": 5.458471488952637, "epoch": 3.465322625933622, "grad_norm": 0.9375, "learning_rate": 0.0003839303578958404, "loss": 5.0196, "mean_token_accuracy": 0.21429990977048874, "num_tokens": 68880275.0, "step": 30855 }, { "entropy": 5.416710424423218, "epoch": 3.465884202841579, "grad_norm": 0.96484375, "learning_rate": 0.00038389522629938676, "loss": 4.9875, "mean_token_accuracy": 0.22419403195381166, "num_tokens": 68891445.0, "step": 30860 }, { "entropy": 5.293928384780884, "epoch": 3.4664457797495367, "grad_norm": 0.97265625, "learning_rate": 0.0003838600912356669, "loss": 4.9709, "mean_token_accuracy": 0.21458418816328048, "num_tokens": 68903591.0, "step": 30865 }, { "entropy": 5.3166327476501465, "epoch": 3.4670073566574944, "grad_norm": 1.0703125, "learning_rate": 0.0003838249527057995, "loss": 5.013, "mean_token_accuracy": 0.21558609157800673, "num_tokens": 68914094.0, "step": 30870 }, { "entropy": 5.420800638198853, "epoch": 3.4675689335654516, "grad_norm": 1.015625, "learning_rate": 0.00038378981071090346, "loss": 5.0751, "mean_token_accuracy": 0.21663724929094313, "num_tokens": 68925929.0, "step": 30875 }, { "entropy": 5.348216390609741, "epoch": 3.4681305104734093, "grad_norm": 1.0078125, "learning_rate": 0.00038375466525209764, "loss": 4.967, "mean_token_accuracy": 0.2129657134413719, "num_tokens": 68936087.0, "step": 30880 }, { "entropy": 5.289228773117065, "epoch": 3.468692087381367, "grad_norm": 0.98828125, "learning_rate": 0.00038371951633050106, "loss": 4.9984, "mean_token_accuracy": 0.22223833948373795, "num_tokens": 68946878.0, "step": 30885 }, { "entropy": 5.411066198348999, "epoch": 3.4692536642893246, "grad_norm": 0.98046875, "learning_rate": 0.00038368436394723294, "loss": 5.0329, "mean_token_accuracy": 0.20940038859844207, "num_tokens": 68957896.0, "step": 30890 }, { "entropy": 5.3887049674987795, "epoch": 3.469815241197282, "grad_norm": 1.0234375, "learning_rate": 0.00038364920810341255, "loss": 5.0318, "mean_token_accuracy": 0.21351155191659926, "num_tokens": 68969173.0, "step": 30895 }, { "entropy": 5.4095831394195555, "epoch": 3.4703768181052395, "grad_norm": 0.96875, "learning_rate": 0.0003836140488001592, "loss": 5.0905, "mean_token_accuracy": 0.21897031515836715, "num_tokens": 68980537.0, "step": 30900 }, { "entropy": 5.362191581726075, "epoch": 3.470938395013197, "grad_norm": 0.99609375, "learning_rate": 0.00038357888603859236, "loss": 4.9954, "mean_token_accuracy": 0.2169913485646248, "num_tokens": 68991736.0, "step": 30905 }, { "entropy": 5.349088573455811, "epoch": 3.471499971921155, "grad_norm": 1.015625, "learning_rate": 0.00038354371981983175, "loss": 4.9683, "mean_token_accuracy": 0.21907387673854828, "num_tokens": 69002316.0, "step": 30910 }, { "entropy": 5.26616415977478, "epoch": 3.472061548829112, "grad_norm": 1.078125, "learning_rate": 0.0003835085501449969, "loss": 5.0079, "mean_token_accuracy": 0.21120173782110213, "num_tokens": 69014204.0, "step": 30915 }, { "entropy": 5.363573169708252, "epoch": 3.4726231257370697, "grad_norm": 0.953125, "learning_rate": 0.00038347337701520785, "loss": 5.0541, "mean_token_accuracy": 0.20957633405923842, "num_tokens": 69026482.0, "step": 30920 }, { "entropy": 5.465552902221679, "epoch": 3.4731847026450273, "grad_norm": 1.078125, "learning_rate": 0.00038343820043158436, "loss": 5.0244, "mean_token_accuracy": 0.213612861931324, "num_tokens": 69036527.0, "step": 30925 }, { "entropy": 5.422449016571045, "epoch": 3.4737462795529845, "grad_norm": 0.9453125, "learning_rate": 0.0003834030203952465, "loss": 5.038, "mean_token_accuracy": 0.21499565839767457, "num_tokens": 69047684.0, "step": 30930 }, { "entropy": 5.341845321655273, "epoch": 3.474307856460942, "grad_norm": 0.9375, "learning_rate": 0.0003833678369073144, "loss": 5.0412, "mean_token_accuracy": 0.21146660894155503, "num_tokens": 69059236.0, "step": 30935 }, { "entropy": 5.282328987121582, "epoch": 3.4748694333689, "grad_norm": 1.015625, "learning_rate": 0.0003833326499689084, "loss": 4.9648, "mean_token_accuracy": 0.2204239174723625, "num_tokens": 69069713.0, "step": 30940 }, { "entropy": 5.339412117004395, "epoch": 3.4754310102768575, "grad_norm": 1.0859375, "learning_rate": 0.0003832974595811488, "loss": 5.0618, "mean_token_accuracy": 0.20588571578264236, "num_tokens": 69079046.0, "step": 30945 }, { "entropy": 5.43354229927063, "epoch": 3.475992587184815, "grad_norm": 1.0390625, "learning_rate": 0.000383262265745156, "loss": 5.0681, "mean_token_accuracy": 0.21365218609571457, "num_tokens": 69090080.0, "step": 30950 }, { "entropy": 5.443773317337036, "epoch": 3.4765541640927724, "grad_norm": 1.0625, "learning_rate": 0.00038322706846205073, "loss": 5.1112, "mean_token_accuracy": 0.2056988850235939, "num_tokens": 69102374.0, "step": 30955 }, { "entropy": 5.377245950698852, "epoch": 3.47711574100073, "grad_norm": 1.03125, "learning_rate": 0.00038319186773295364, "loss": 5.0459, "mean_token_accuracy": 0.21622643768787383, "num_tokens": 69112688.0, "step": 30960 }, { "entropy": 5.395568370819092, "epoch": 3.4776773179086877, "grad_norm": 0.98046875, "learning_rate": 0.0003831566635589856, "loss": 5.0399, "mean_token_accuracy": 0.2145000770688057, "num_tokens": 69124861.0, "step": 30965 }, { "entropy": 5.398483419418335, "epoch": 3.478238894816645, "grad_norm": 0.9453125, "learning_rate": 0.0003831214559412674, "loss": 5.0931, "mean_token_accuracy": 0.2097925901412964, "num_tokens": 69135898.0, "step": 30970 }, { "entropy": 5.461172676086425, "epoch": 3.4788004717246026, "grad_norm": 0.9375, "learning_rate": 0.00038308624488092005, "loss": 5.1255, "mean_token_accuracy": 0.20694369971752166, "num_tokens": 69146692.0, "step": 30975 }, { "entropy": 5.357588052749634, "epoch": 3.4793620486325603, "grad_norm": 0.9453125, "learning_rate": 0.0003830510303790647, "loss": 5.0044, "mean_token_accuracy": 0.21286374032497407, "num_tokens": 69157908.0, "step": 30980 }, { "entropy": 5.365853214263916, "epoch": 3.479923625540518, "grad_norm": 0.9453125, "learning_rate": 0.00038301581243682263, "loss": 5.0278, "mean_token_accuracy": 0.21555214375257492, "num_tokens": 69168596.0, "step": 30985 }, { "entropy": 5.283097982406616, "epoch": 3.480485202448475, "grad_norm": 0.984375, "learning_rate": 0.0003829805910553153, "loss": 4.9591, "mean_token_accuracy": 0.21930192559957504, "num_tokens": 69179261.0, "step": 30990 }, { "entropy": 5.3252404689788815, "epoch": 3.481046779356433, "grad_norm": 1.0859375, "learning_rate": 0.00038294536623566407, "loss": 4.9674, "mean_token_accuracy": 0.21390282213687897, "num_tokens": 69190410.0, "step": 30995 }, { "entropy": 5.393063974380493, "epoch": 3.4816083562643905, "grad_norm": 0.953125, "learning_rate": 0.0003829101379789905, "loss": 5.1218, "mean_token_accuracy": 0.21277871429920198, "num_tokens": 69201114.0, "step": 31000 }, { "entropy": 5.39140510559082, "epoch": 3.482169933172348, "grad_norm": 1.03125, "learning_rate": 0.0003828749062864162, "loss": 4.9837, "mean_token_accuracy": 0.21919576078653336, "num_tokens": 69212240.0, "step": 31005 }, { "entropy": 5.353231573104859, "epoch": 3.4827315100803053, "grad_norm": 0.9765625, "learning_rate": 0.0003828396711590631, "loss": 5.0702, "mean_token_accuracy": 0.2093835160136223, "num_tokens": 69223714.0, "step": 31010 }, { "entropy": 5.387914657592773, "epoch": 3.483293086988263, "grad_norm": 1.0, "learning_rate": 0.00038280443259805307, "loss": 5.0378, "mean_token_accuracy": 0.21373282223939896, "num_tokens": 69234364.0, "step": 31015 }, { "entropy": 5.307966423034668, "epoch": 3.4838546638962207, "grad_norm": 0.9296875, "learning_rate": 0.0003827691906045081, "loss": 4.9553, "mean_token_accuracy": 0.2189030811190605, "num_tokens": 69245584.0, "step": 31020 }, { "entropy": 5.355924367904663, "epoch": 3.484416240804178, "grad_norm": 1.015625, "learning_rate": 0.0003827339451795503, "loss": 4.9703, "mean_token_accuracy": 0.21119096279144287, "num_tokens": 69256891.0, "step": 31025 }, { "entropy": 5.413004207611084, "epoch": 3.4849778177121356, "grad_norm": 1.046875, "learning_rate": 0.0003826986963243018, "loss": 4.9664, "mean_token_accuracy": 0.21722579896450042, "num_tokens": 69266972.0, "step": 31030 }, { "entropy": 5.391071033477783, "epoch": 3.485539394620093, "grad_norm": 0.98828125, "learning_rate": 0.0003826634440398852, "loss": 5.0282, "mean_token_accuracy": 0.22355865836143493, "num_tokens": 69277993.0, "step": 31035 }, { "entropy": 5.2843985080719, "epoch": 3.486100971528051, "grad_norm": 0.94140625, "learning_rate": 0.00038262818832742276, "loss": 4.9808, "mean_token_accuracy": 0.21453755348920822, "num_tokens": 69289720.0, "step": 31040 }, { "entropy": 5.406031894683838, "epoch": 3.4866625484360085, "grad_norm": 0.89453125, "learning_rate": 0.00038259292918803696, "loss": 5.1205, "mean_token_accuracy": 0.20881295055150986, "num_tokens": 69301169.0, "step": 31045 }, { "entropy": 5.354175233840943, "epoch": 3.4872241253439658, "grad_norm": 1.09375, "learning_rate": 0.0003825576666228506, "loss": 5.0113, "mean_token_accuracy": 0.2143484726548195, "num_tokens": 69311443.0, "step": 31050 }, { "entropy": 5.401350593566894, "epoch": 3.4877857022519234, "grad_norm": 0.98046875, "learning_rate": 0.0003825224006329864, "loss": 5.0395, "mean_token_accuracy": 0.2131688892841339, "num_tokens": 69322035.0, "step": 31055 }, { "entropy": 5.290612077713012, "epoch": 3.488347279159881, "grad_norm": 1.0234375, "learning_rate": 0.0003824871312195673, "loss": 4.8983, "mean_token_accuracy": 0.2300107479095459, "num_tokens": 69331955.0, "step": 31060 }, { "entropy": 5.3263914585113525, "epoch": 3.4889088560678383, "grad_norm": 1.03125, "learning_rate": 0.0003824518583837163, "loss": 5.0346, "mean_token_accuracy": 0.21355758756399154, "num_tokens": 69343897.0, "step": 31065 }, { "entropy": 5.281171274185181, "epoch": 3.489470432975796, "grad_norm": 0.9765625, "learning_rate": 0.0003824165821265564, "loss": 4.9047, "mean_token_accuracy": 0.22356727123260497, "num_tokens": 69353886.0, "step": 31070 }, { "entropy": 5.245556783676148, "epoch": 3.4900320098837536, "grad_norm": 1.09375, "learning_rate": 0.0003823813024492108, "loss": 4.9654, "mean_token_accuracy": 0.22017951756715776, "num_tokens": 69365328.0, "step": 31075 }, { "entropy": 5.390545606613159, "epoch": 3.4905935867917113, "grad_norm": 0.95703125, "learning_rate": 0.000382346019352803, "loss": 5.1059, "mean_token_accuracy": 0.20603012293577194, "num_tokens": 69376007.0, "step": 31080 }, { "entropy": 5.469788026809693, "epoch": 3.4911551636996685, "grad_norm": 1.0234375, "learning_rate": 0.0003823107328384562, "loss": 5.0947, "mean_token_accuracy": 0.20948586463928223, "num_tokens": 69386668.0, "step": 31085 }, { "entropy": 5.3803362369537355, "epoch": 3.491716740607626, "grad_norm": 1.03125, "learning_rate": 0.0003822754429072942, "loss": 4.8778, "mean_token_accuracy": 0.2333522379398346, "num_tokens": 69397827.0, "step": 31090 }, { "entropy": 5.314143896102905, "epoch": 3.492278317515584, "grad_norm": 1.0234375, "learning_rate": 0.0003822401495604403, "loss": 5.0152, "mean_token_accuracy": 0.21945687830448152, "num_tokens": 69409268.0, "step": 31095 }, { "entropy": 5.335787773132324, "epoch": 3.4928398944235415, "grad_norm": 0.91015625, "learning_rate": 0.00038220485279901855, "loss": 5.0006, "mean_token_accuracy": 0.22070402055978774, "num_tokens": 69420995.0, "step": 31100 }, { "entropy": 5.400365257263184, "epoch": 3.4934014713314987, "grad_norm": 0.9140625, "learning_rate": 0.00038216955262415273, "loss": 4.9981, "mean_token_accuracy": 0.2161305159330368, "num_tokens": 69432919.0, "step": 31105 }, { "entropy": 5.367403268814087, "epoch": 3.4939630482394564, "grad_norm": 1.0703125, "learning_rate": 0.00038213424903696673, "loss": 5.0453, "mean_token_accuracy": 0.214018876850605, "num_tokens": 69443321.0, "step": 31110 }, { "entropy": 5.357817459106445, "epoch": 3.494524625147414, "grad_norm": 0.92578125, "learning_rate": 0.00038209894203858477, "loss": 4.9952, "mean_token_accuracy": 0.21759818643331527, "num_tokens": 69454695.0, "step": 31115 }, { "entropy": 5.381619882583618, "epoch": 3.4950862020553712, "grad_norm": 0.9375, "learning_rate": 0.00038206363163013093, "loss": 4.94, "mean_token_accuracy": 0.21969179511070253, "num_tokens": 69465617.0, "step": 31120 }, { "entropy": 5.286784315109253, "epoch": 3.495647778963329, "grad_norm": 0.9921875, "learning_rate": 0.00038202831781272944, "loss": 5.0114, "mean_token_accuracy": 0.21283484995365143, "num_tokens": 69476730.0, "step": 31125 }, { "entropy": 5.299883842468262, "epoch": 3.4962093558712866, "grad_norm": 0.9765625, "learning_rate": 0.00038199300058750494, "loss": 4.9772, "mean_token_accuracy": 0.21471781134605408, "num_tokens": 69488488.0, "step": 31130 }, { "entropy": 5.43042221069336, "epoch": 3.4967709327792442, "grad_norm": 1.0078125, "learning_rate": 0.00038195767995558174, "loss": 5.072, "mean_token_accuracy": 0.20745187401771545, "num_tokens": 69498718.0, "step": 31135 }, { "entropy": 5.365119218826294, "epoch": 3.497332509687202, "grad_norm": 1.0546875, "learning_rate": 0.0003819223559180845, "loss": 4.9825, "mean_token_accuracy": 0.21384021043777465, "num_tokens": 69509567.0, "step": 31140 }, { "entropy": 5.332442760467529, "epoch": 3.497894086595159, "grad_norm": 1.0234375, "learning_rate": 0.000381887028476138, "loss": 4.9911, "mean_token_accuracy": 0.214080348610878, "num_tokens": 69519392.0, "step": 31145 }, { "entropy": 5.458573579788208, "epoch": 3.4984556635031168, "grad_norm": 0.86328125, "learning_rate": 0.00038185169763086703, "loss": 5.1246, "mean_token_accuracy": 0.20100812315940858, "num_tokens": 69531228.0, "step": 31150 }, { "entropy": 5.468828392028809, "epoch": 3.4990172404110744, "grad_norm": 0.890625, "learning_rate": 0.0003818163633833966, "loss": 5.0381, "mean_token_accuracy": 0.21894100308418274, "num_tokens": 69542888.0, "step": 31155 }, { "entropy": 5.287666082382202, "epoch": 3.4995788173190316, "grad_norm": 0.9765625, "learning_rate": 0.00038178102573485173, "loss": 4.9869, "mean_token_accuracy": 0.21915661692619323, "num_tokens": 69553481.0, "step": 31160 }, { "entropy": 5.327647924423218, "epoch": 3.5001403942269893, "grad_norm": 0.97265625, "learning_rate": 0.0003817456846863575, "loss": 5.0158, "mean_token_accuracy": 0.21329982131719588, "num_tokens": 69565314.0, "step": 31165 }, { "entropy": 5.347225761413574, "epoch": 3.500701971134947, "grad_norm": 0.9765625, "learning_rate": 0.00038171034023903937, "loss": 4.9859, "mean_token_accuracy": 0.20576197206974028, "num_tokens": 69575807.0, "step": 31170 }, { "entropy": 5.406551647186279, "epoch": 3.5012635480429046, "grad_norm": 0.9921875, "learning_rate": 0.0003816749923940226, "loss": 5.1235, "mean_token_accuracy": 0.21208667755126953, "num_tokens": 69587873.0, "step": 31175 }, { "entropy": 5.397897100448608, "epoch": 3.5018251249508623, "grad_norm": 0.953125, "learning_rate": 0.00038163964115243276, "loss": 5.0683, "mean_token_accuracy": 0.2172987312078476, "num_tokens": 69598015.0, "step": 31180 }, { "entropy": 5.374255084991455, "epoch": 3.5023867018588195, "grad_norm": 1.0546875, "learning_rate": 0.00038160428651539535, "loss": 5.0238, "mean_token_accuracy": 0.21130315214395523, "num_tokens": 69609345.0, "step": 31185 }, { "entropy": 5.367508268356323, "epoch": 3.502948278766777, "grad_norm": 0.94140625, "learning_rate": 0.00038156892848403606, "loss": 5.018, "mean_token_accuracy": 0.20179952979087828, "num_tokens": 69620075.0, "step": 31190 }, { "entropy": 5.377548456192017, "epoch": 3.503509855674735, "grad_norm": 1.0234375, "learning_rate": 0.0003815335670594808, "loss": 5.0179, "mean_token_accuracy": 0.21915940791368485, "num_tokens": 69630825.0, "step": 31195 }, { "entropy": 5.455663013458252, "epoch": 3.504071432582692, "grad_norm": 0.93359375, "learning_rate": 0.00038149820224285546, "loss": 5.1111, "mean_token_accuracy": 0.21145035326480865, "num_tokens": 69642415.0, "step": 31200 }, { "entropy": 5.253020429611206, "epoch": 3.5046330094906497, "grad_norm": 0.98828125, "learning_rate": 0.000381462834035286, "loss": 4.9031, "mean_token_accuracy": 0.22187747657299042, "num_tokens": 69652735.0, "step": 31205 }, { "entropy": 5.280878353118896, "epoch": 3.5051945863986074, "grad_norm": 0.89453125, "learning_rate": 0.0003814274624378986, "loss": 4.9987, "mean_token_accuracy": 0.22689505964517592, "num_tokens": 69664312.0, "step": 31210 }, { "entropy": 5.328192043304443, "epoch": 3.5057561633065646, "grad_norm": 1.015625, "learning_rate": 0.0003813920874518196, "loss": 4.9702, "mean_token_accuracy": 0.21368768215179443, "num_tokens": 69674570.0, "step": 31215 }, { "entropy": 5.338263988494873, "epoch": 3.5063177402145222, "grad_norm": 0.953125, "learning_rate": 0.0003813567090781752, "loss": 5.0171, "mean_token_accuracy": 0.21209612339735032, "num_tokens": 69686591.0, "step": 31220 }, { "entropy": 5.41046986579895, "epoch": 3.50687931712248, "grad_norm": 1.046875, "learning_rate": 0.000381321327318092, "loss": 5.0454, "mean_token_accuracy": 0.2165257900953293, "num_tokens": 69697104.0, "step": 31225 }, { "entropy": 5.413427734375, "epoch": 3.5074408940304376, "grad_norm": 1.0390625, "learning_rate": 0.0003812859421726964, "loss": 4.9933, "mean_token_accuracy": 0.21876952648162842, "num_tokens": 69708827.0, "step": 31230 }, { "entropy": 5.336478424072266, "epoch": 3.5080024709383952, "grad_norm": 0.94140625, "learning_rate": 0.00038125055364311526, "loss": 5.0428, "mean_token_accuracy": 0.22015126943588256, "num_tokens": 69720426.0, "step": 31235 }, { "entropy": 5.490678405761718, "epoch": 3.5085640478463525, "grad_norm": 0.93359375, "learning_rate": 0.0003812151617304753, "loss": 5.238, "mean_token_accuracy": 0.20407590866088868, "num_tokens": 69733199.0, "step": 31240 }, { "entropy": 5.306839466094971, "epoch": 3.50912562475431, "grad_norm": 0.96875, "learning_rate": 0.0003811797664359033, "loss": 4.8677, "mean_token_accuracy": 0.22371850162744522, "num_tokens": 69744322.0, "step": 31245 }, { "entropy": 5.2996506690979, "epoch": 3.5096872016622678, "grad_norm": 0.94921875, "learning_rate": 0.00038114436776052644, "loss": 4.9652, "mean_token_accuracy": 0.21332952827215196, "num_tokens": 69755662.0, "step": 31250 }, { "entropy": 5.262163591384888, "epoch": 3.510248778570225, "grad_norm": 1.0, "learning_rate": 0.0003811089657054717, "loss": 4.8797, "mean_token_accuracy": 0.22302572429180145, "num_tokens": 69765663.0, "step": 31255 }, { "entropy": 5.371672630310059, "epoch": 3.5108103554781827, "grad_norm": 0.953125, "learning_rate": 0.0003810735602718664, "loss": 5.1795, "mean_token_accuracy": 0.20814565420150757, "num_tokens": 69777483.0, "step": 31260 }, { "entropy": 5.44297604560852, "epoch": 3.5113719323861403, "grad_norm": 1.015625, "learning_rate": 0.0003810381514608378, "loss": 5.0628, "mean_token_accuracy": 0.20481681525707246, "num_tokens": 69789034.0, "step": 31265 }, { "entropy": 5.413743019104004, "epoch": 3.511933509294098, "grad_norm": 0.921875, "learning_rate": 0.0003810027392735133, "loss": 5.0267, "mean_token_accuracy": 0.21109580099582673, "num_tokens": 69801288.0, "step": 31270 }, { "entropy": 5.316257953643799, "epoch": 3.5124950862020556, "grad_norm": 1.109375, "learning_rate": 0.0003809673237110204, "loss": 4.9653, "mean_token_accuracy": 0.21678188145160676, "num_tokens": 69811063.0, "step": 31275 }, { "entropy": 5.31076078414917, "epoch": 3.513056663110013, "grad_norm": 1.0, "learning_rate": 0.0003809319047744869, "loss": 4.9917, "mean_token_accuracy": 0.21564977169036864, "num_tokens": 69822572.0, "step": 31280 }, { "entropy": 5.259940481185913, "epoch": 3.5136182400179705, "grad_norm": 1.0546875, "learning_rate": 0.00038089648246504045, "loss": 4.9238, "mean_token_accuracy": 0.21923152059316636, "num_tokens": 69834082.0, "step": 31285 }, { "entropy": 5.354159259796143, "epoch": 3.514179816925928, "grad_norm": 1.03125, "learning_rate": 0.00038086105678380896, "loss": 5.006, "mean_token_accuracy": 0.21684324592351914, "num_tokens": 69844560.0, "step": 31290 }, { "entropy": 5.391580200195312, "epoch": 3.5147413938338854, "grad_norm": 1.0078125, "learning_rate": 0.00038082562773192026, "loss": 4.9917, "mean_token_accuracy": 0.21378025263547898, "num_tokens": 69854993.0, "step": 31295 }, { "entropy": 5.347278213500976, "epoch": 3.515302970741843, "grad_norm": 0.95703125, "learning_rate": 0.00038079019531050257, "loss": 4.9608, "mean_token_accuracy": 0.22233842611312865, "num_tokens": 69866074.0, "step": 31300 }, { "entropy": 5.367187547683716, "epoch": 3.5158645476498007, "grad_norm": 1.0234375, "learning_rate": 0.00038075475952068405, "loss": 5.0257, "mean_token_accuracy": 0.21382921934127808, "num_tokens": 69877101.0, "step": 31305 }, { "entropy": 5.298641586303711, "epoch": 3.516426124557758, "grad_norm": 1.015625, "learning_rate": 0.000380719320363593, "loss": 4.9191, "mean_token_accuracy": 0.2252766966819763, "num_tokens": 69887388.0, "step": 31310 }, { "entropy": 5.388827180862426, "epoch": 3.5169877014657156, "grad_norm": 1.0625, "learning_rate": 0.00038068387784035774, "loss": 5.0345, "mean_token_accuracy": 0.21979601979255675, "num_tokens": 69898242.0, "step": 31315 }, { "entropy": 5.3530683517456055, "epoch": 3.5175492783736733, "grad_norm": 0.87109375, "learning_rate": 0.0003806484319521069, "loss": 5.0355, "mean_token_accuracy": 0.2166160076856613, "num_tokens": 69909645.0, "step": 31320 }, { "entropy": 5.388315057754516, "epoch": 3.518110855281631, "grad_norm": 0.9765625, "learning_rate": 0.00038061298269996893, "loss": 5.0075, "mean_token_accuracy": 0.21466407626867295, "num_tokens": 69920862.0, "step": 31325 }, { "entropy": 5.364881181716919, "epoch": 3.5186724321895886, "grad_norm": 1.0390625, "learning_rate": 0.0003805775300850727, "loss": 4.9491, "mean_token_accuracy": 0.2209607869386673, "num_tokens": 69932219.0, "step": 31330 }, { "entropy": 5.39084644317627, "epoch": 3.519234009097546, "grad_norm": 1.0390625, "learning_rate": 0.0003805420741085469, "loss": 5.0262, "mean_token_accuracy": 0.2135359063744545, "num_tokens": 69942642.0, "step": 31335 }, { "entropy": 5.405378293991089, "epoch": 3.5197955860055035, "grad_norm": 0.953125, "learning_rate": 0.0003805066147715205, "loss": 5.1613, "mean_token_accuracy": 0.19321514368057252, "num_tokens": 69954336.0, "step": 31340 }, { "entropy": 5.3600507259368895, "epoch": 3.520357162913461, "grad_norm": 1.0625, "learning_rate": 0.0003804711520751226, "loss": 4.9916, "mean_token_accuracy": 0.21729453057050704, "num_tokens": 69965716.0, "step": 31345 }, { "entropy": 5.357483959197998, "epoch": 3.5209187398214183, "grad_norm": 0.98046875, "learning_rate": 0.00038043568602048227, "loss": 5.0208, "mean_token_accuracy": 0.21355781108140945, "num_tokens": 69976545.0, "step": 31350 }, { "entropy": 5.382663345336914, "epoch": 3.521480316729376, "grad_norm": 0.9765625, "learning_rate": 0.0003804002166087289, "loss": 5.0422, "mean_token_accuracy": 0.22126413136720657, "num_tokens": 69987846.0, "step": 31355 }, { "entropy": 5.333971261978149, "epoch": 3.5220418936373337, "grad_norm": 0.94921875, "learning_rate": 0.00038036474384099174, "loss": 4.9346, "mean_token_accuracy": 0.2196497306227684, "num_tokens": 69998089.0, "step": 31360 }, { "entropy": 5.3745533466339115, "epoch": 3.5226034705452913, "grad_norm": 1.0078125, "learning_rate": 0.0003803292677184002, "loss": 5.0873, "mean_token_accuracy": 0.21071239411830903, "num_tokens": 70008900.0, "step": 31365 }, { "entropy": 5.427185201644898, "epoch": 3.523165047453249, "grad_norm": 0.98046875, "learning_rate": 0.00038029378824208394, "loss": 5.0595, "mean_token_accuracy": 0.21183212101459503, "num_tokens": 70019675.0, "step": 31370 }, { "entropy": 5.459985446929932, "epoch": 3.523726624361206, "grad_norm": 1.03125, "learning_rate": 0.0003802583054131727, "loss": 5.1331, "mean_token_accuracy": 0.2070818990468979, "num_tokens": 70031077.0, "step": 31375 }, { "entropy": 5.411845541000366, "epoch": 3.524288201269164, "grad_norm": 0.953125, "learning_rate": 0.0003802228192327961, "loss": 5.138, "mean_token_accuracy": 0.1989188551902771, "num_tokens": 70044569.0, "step": 31380 }, { "entropy": 5.3514093399047855, "epoch": 3.5248497781771215, "grad_norm": 1.015625, "learning_rate": 0.00038018732970208414, "loss": 4.9954, "mean_token_accuracy": 0.2166432872414589, "num_tokens": 70056396.0, "step": 31385 }, { "entropy": 5.488380432128906, "epoch": 3.5254113550850787, "grad_norm": 1.0, "learning_rate": 0.0003801518368221668, "loss": 5.2045, "mean_token_accuracy": 0.2093486249446869, "num_tokens": 70068341.0, "step": 31390 }, { "entropy": 5.379701948165893, "epoch": 3.5259729319930364, "grad_norm": 1.015625, "learning_rate": 0.0003801163405941743, "loss": 4.9166, "mean_token_accuracy": 0.21751874983310698, "num_tokens": 70079069.0, "step": 31395 }, { "entropy": 5.396098852157593, "epoch": 3.526534508900994, "grad_norm": 1.015625, "learning_rate": 0.00038008084101923665, "loss": 5.0926, "mean_token_accuracy": 0.21362614035606384, "num_tokens": 70090274.0, "step": 31400 }, { "entropy": 5.311895418167114, "epoch": 3.5270960858089513, "grad_norm": 0.95703125, "learning_rate": 0.00038004533809848435, "loss": 4.9889, "mean_token_accuracy": 0.21332114189863205, "num_tokens": 70101144.0, "step": 31405 }, { "entropy": 5.371632194519043, "epoch": 3.527657662716909, "grad_norm": 0.9609375, "learning_rate": 0.00038000983183304765, "loss": 5.014, "mean_token_accuracy": 0.21538894027471542, "num_tokens": 70112210.0, "step": 31410 }, { "entropy": 5.445079135894775, "epoch": 3.5282192396248666, "grad_norm": 1.0234375, "learning_rate": 0.0003799743222240572, "loss": 5.1255, "mean_token_accuracy": 0.21043878197669982, "num_tokens": 70124302.0, "step": 31415 }, { "entropy": 5.451379823684692, "epoch": 3.5287808165328243, "grad_norm": 1.03125, "learning_rate": 0.0003799388092726436, "loss": 5.1045, "mean_token_accuracy": 0.21609489172697066, "num_tokens": 70136026.0, "step": 31420 }, { "entropy": 5.41684889793396, "epoch": 3.529342393440782, "grad_norm": 0.98046875, "learning_rate": 0.00037990329297993763, "loss": 5.0365, "mean_token_accuracy": 0.21301512718200682, "num_tokens": 70147439.0, "step": 31425 }, { "entropy": 5.282562732696533, "epoch": 3.529903970348739, "grad_norm": 1.0078125, "learning_rate": 0.0003798677733470701, "loss": 4.8784, "mean_token_accuracy": 0.22608915865421295, "num_tokens": 70158367.0, "step": 31430 }, { "entropy": 5.312399196624756, "epoch": 3.530465547256697, "grad_norm": 0.921875, "learning_rate": 0.00037983225037517207, "loss": 5.1046, "mean_token_accuracy": 0.2103608563542366, "num_tokens": 70169226.0, "step": 31435 }, { "entropy": 5.42043285369873, "epoch": 3.5310271241646545, "grad_norm": 0.984375, "learning_rate": 0.00037979672406537445, "loss": 4.9873, "mean_token_accuracy": 0.21405208855867386, "num_tokens": 70179440.0, "step": 31440 }, { "entropy": 5.431687736511231, "epoch": 3.5315887010726117, "grad_norm": 0.9140625, "learning_rate": 0.0003797611944188086, "loss": 5.0631, "mean_token_accuracy": 0.21415450870990754, "num_tokens": 70191160.0, "step": 31445 }, { "entropy": 5.383655405044555, "epoch": 3.5321502779805694, "grad_norm": 0.9375, "learning_rate": 0.00037972566143660566, "loss": 5.084, "mean_token_accuracy": 0.21398237198591233, "num_tokens": 70202143.0, "step": 31450 }, { "entropy": 5.378739500045777, "epoch": 3.532711854888527, "grad_norm": 0.89453125, "learning_rate": 0.0003796901251198969, "loss": 5.0055, "mean_token_accuracy": 0.21327701658010484, "num_tokens": 70213957.0, "step": 31455 }, { "entropy": 5.39954137802124, "epoch": 3.5332734317964847, "grad_norm": 0.98828125, "learning_rate": 0.000379654585469814, "loss": 5.012, "mean_token_accuracy": 0.21656121164560319, "num_tokens": 70224153.0, "step": 31460 }, { "entropy": 5.345164346694946, "epoch": 3.5338350087044423, "grad_norm": 0.96875, "learning_rate": 0.0003796190424874886, "loss": 5.0385, "mean_token_accuracy": 0.21122560948133468, "num_tokens": 70236093.0, "step": 31465 }, { "entropy": 5.340242719650268, "epoch": 3.5343965856123996, "grad_norm": 0.93359375, "learning_rate": 0.0003795834961740523, "loss": 5.0377, "mean_token_accuracy": 0.21832483261823654, "num_tokens": 70246865.0, "step": 31470 }, { "entropy": 5.391931009292603, "epoch": 3.534958162520357, "grad_norm": 0.97265625, "learning_rate": 0.00037954794653063695, "loss": 5.0874, "mean_token_accuracy": 0.20533659011125566, "num_tokens": 70258601.0, "step": 31475 }, { "entropy": 5.382684898376465, "epoch": 3.535519739428315, "grad_norm": 0.98828125, "learning_rate": 0.0003795123935583743, "loss": 5.0078, "mean_token_accuracy": 0.213176029920578, "num_tokens": 70269020.0, "step": 31480 }, { "entropy": 5.366488027572632, "epoch": 3.536081316336272, "grad_norm": 0.984375, "learning_rate": 0.0003794768372583966, "loss": 5.0475, "mean_token_accuracy": 0.2061367526650429, "num_tokens": 70280582.0, "step": 31485 }, { "entropy": 5.484293794631958, "epoch": 3.5366428932442298, "grad_norm": 0.98046875, "learning_rate": 0.00037944127763183587, "loss": 5.0508, "mean_token_accuracy": 0.21495116055011748, "num_tokens": 70292848.0, "step": 31490 }, { "entropy": 5.4457344055175785, "epoch": 3.5372044701521874, "grad_norm": 0.95703125, "learning_rate": 0.00037940571467982436, "loss": 5.0931, "mean_token_accuracy": 0.2139238476753235, "num_tokens": 70304892.0, "step": 31495 }, { "entropy": 5.281602478027343, "epoch": 3.5377660470601446, "grad_norm": 0.92578125, "learning_rate": 0.0003793701484034944, "loss": 4.9686, "mean_token_accuracy": 0.22130076885223388, "num_tokens": 70316244.0, "step": 31500 }, { "entropy": 5.390929555892944, "epoch": 3.5383276239681023, "grad_norm": 1.046875, "learning_rate": 0.00037933457880397843, "loss": 5.0354, "mean_token_accuracy": 0.2093072548508644, "num_tokens": 70327037.0, "step": 31505 }, { "entropy": 5.369195508956909, "epoch": 3.53888920087606, "grad_norm": 0.94921875, "learning_rate": 0.00037929900588240897, "loss": 4.924, "mean_token_accuracy": 0.22150439471006395, "num_tokens": 70338587.0, "step": 31510 }, { "entropy": 5.24082350730896, "epoch": 3.5394507777840176, "grad_norm": 1.015625, "learning_rate": 0.0003792634296399187, "loss": 5.0395, "mean_token_accuracy": 0.21533430814743043, "num_tokens": 70349930.0, "step": 31515 }, { "entropy": 5.245293283462525, "epoch": 3.5400123546919753, "grad_norm": 1.0, "learning_rate": 0.00037922785007764043, "loss": 4.8719, "mean_token_accuracy": 0.22105963975191117, "num_tokens": 70360880.0, "step": 31520 }, { "entropy": 5.480115270614624, "epoch": 3.5405739315999325, "grad_norm": 0.92578125, "learning_rate": 0.000379192267196707, "loss": 5.1454, "mean_token_accuracy": 0.20767911821603774, "num_tokens": 70372508.0, "step": 31525 }, { "entropy": 5.430534839630127, "epoch": 3.54113550850789, "grad_norm": 0.98046875, "learning_rate": 0.00037915668099825135, "loss": 5.0411, "mean_token_accuracy": 0.21408879905939102, "num_tokens": 70383960.0, "step": 31530 }, { "entropy": 5.370037269592285, "epoch": 3.541697085415848, "grad_norm": 1.328125, "learning_rate": 0.00037912109148340663, "loss": 5.0359, "mean_token_accuracy": 0.2127966210246086, "num_tokens": 70395881.0, "step": 31535 }, { "entropy": 5.343982410430908, "epoch": 3.542258662323805, "grad_norm": 0.94921875, "learning_rate": 0.00037908549865330596, "loss": 5.04, "mean_token_accuracy": 0.2134324550628662, "num_tokens": 70407590.0, "step": 31540 }, { "entropy": 5.37364935874939, "epoch": 3.5428202392317627, "grad_norm": 1.0390625, "learning_rate": 0.00037904990250908256, "loss": 4.9984, "mean_token_accuracy": 0.22460844218730927, "num_tokens": 70418078.0, "step": 31545 }, { "entropy": 5.354344701766967, "epoch": 3.5433818161397204, "grad_norm": 1.0, "learning_rate": 0.00037901430305187, "loss": 4.9957, "mean_token_accuracy": 0.21535616368055344, "num_tokens": 70428292.0, "step": 31550 }, { "entropy": 5.2816938877105715, "epoch": 3.543943393047678, "grad_norm": 0.98828125, "learning_rate": 0.00037897870028280167, "loss": 4.9145, "mean_token_accuracy": 0.21989400535821915, "num_tokens": 70438481.0, "step": 31555 }, { "entropy": 5.343485403060913, "epoch": 3.5445049699556357, "grad_norm": 0.88671875, "learning_rate": 0.0003789430942030112, "loss": 5.0762, "mean_token_accuracy": 0.2078214168548584, "num_tokens": 70449949.0, "step": 31560 }, { "entropy": 5.461041975021362, "epoch": 3.545066546863593, "grad_norm": 1.0703125, "learning_rate": 0.00037890748481363216, "loss": 5.1169, "mean_token_accuracy": 0.21154679358005524, "num_tokens": 70461159.0, "step": 31565 }, { "entropy": 5.359609174728393, "epoch": 3.5456281237715506, "grad_norm": 1.0390625, "learning_rate": 0.0003788718721157987, "loss": 5.0052, "mean_token_accuracy": 0.21476232558488845, "num_tokens": 70471212.0, "step": 31570 }, { "entropy": 5.342015075683594, "epoch": 3.5461897006795082, "grad_norm": 0.953125, "learning_rate": 0.0003788362561106445, "loss": 5.0157, "mean_token_accuracy": 0.2186439484357834, "num_tokens": 70481587.0, "step": 31575 }, { "entropy": 5.449720811843872, "epoch": 3.5467512775874654, "grad_norm": 0.95703125, "learning_rate": 0.00037880063679930355, "loss": 5.0867, "mean_token_accuracy": 0.21345228403806688, "num_tokens": 70491952.0, "step": 31580 }, { "entropy": 5.388182783126831, "epoch": 3.547312854495423, "grad_norm": 1.0390625, "learning_rate": 0.00037876501418291015, "loss": 4.9998, "mean_token_accuracy": 0.20984189808368683, "num_tokens": 70503279.0, "step": 31585 }, { "entropy": 5.328646326065064, "epoch": 3.5478744314033808, "grad_norm": 0.9765625, "learning_rate": 0.0003787293882625984, "loss": 5.0714, "mean_token_accuracy": 0.21108720749616622, "num_tokens": 70514779.0, "step": 31590 }, { "entropy": 5.319090270996094, "epoch": 3.548436008311338, "grad_norm": 0.94140625, "learning_rate": 0.0003786937590395027, "loss": 4.9927, "mean_token_accuracy": 0.2135763645172119, "num_tokens": 70526478.0, "step": 31595 }, { "entropy": 5.385490369796753, "epoch": 3.5489975852192956, "grad_norm": 1.0546875, "learning_rate": 0.0003786581265147575, "loss": 5.0774, "mean_token_accuracy": 0.2109088957309723, "num_tokens": 70537293.0, "step": 31600 }, { "entropy": 5.440050983428955, "epoch": 3.5495591621272533, "grad_norm": 0.98828125, "learning_rate": 0.0003786224906894974, "loss": 4.9832, "mean_token_accuracy": 0.21795266419649123, "num_tokens": 70547357.0, "step": 31605 }, { "entropy": 5.368253898620606, "epoch": 3.550120739035211, "grad_norm": 0.96875, "learning_rate": 0.000378586851564857, "loss": 5.0465, "mean_token_accuracy": 0.2081439256668091, "num_tokens": 70558102.0, "step": 31610 }, { "entropy": 5.408520889282227, "epoch": 3.5506823159431686, "grad_norm": 1.0703125, "learning_rate": 0.000378551209141971, "loss": 5.076, "mean_token_accuracy": 0.2183656558394432, "num_tokens": 70569454.0, "step": 31615 }, { "entropy": 5.394662284851075, "epoch": 3.551243892851126, "grad_norm": 0.9375, "learning_rate": 0.0003785155634219744, "loss": 4.9821, "mean_token_accuracy": 0.21212248802185057, "num_tokens": 70580590.0, "step": 31620 }, { "entropy": 5.317335700988769, "epoch": 3.5518054697590835, "grad_norm": 1.03125, "learning_rate": 0.0003784799144060021, "loss": 5.0083, "mean_token_accuracy": 0.2160568043589592, "num_tokens": 70591233.0, "step": 31625 }, { "entropy": 5.36469292640686, "epoch": 3.552367046667041, "grad_norm": 0.96484375, "learning_rate": 0.00037844426209518916, "loss": 5.0048, "mean_token_accuracy": 0.22044412642717362, "num_tokens": 70603029.0, "step": 31630 }, { "entropy": 5.48450984954834, "epoch": 3.5529286235749984, "grad_norm": 0.92578125, "learning_rate": 0.00037840860649067084, "loss": 5.1572, "mean_token_accuracy": 0.20457223206758499, "num_tokens": 70616021.0, "step": 31635 }, { "entropy": 5.3849289894104, "epoch": 3.553490200482956, "grad_norm": 1.015625, "learning_rate": 0.00037837294759358235, "loss": 5.0275, "mean_token_accuracy": 0.22033473700284958, "num_tokens": 70627044.0, "step": 31640 }, { "entropy": 5.30291109085083, "epoch": 3.5540517773909137, "grad_norm": 1.015625, "learning_rate": 0.00037833728540505914, "loss": 4.9421, "mean_token_accuracy": 0.21616286933422088, "num_tokens": 70637435.0, "step": 31645 }, { "entropy": 5.373443365097046, "epoch": 3.5546133542988714, "grad_norm": 0.95703125, "learning_rate": 0.0003783016199262367, "loss": 5.0091, "mean_token_accuracy": 0.21726883798837662, "num_tokens": 70648106.0, "step": 31650 }, { "entropy": 5.319651985168457, "epoch": 3.555174931206829, "grad_norm": 0.9453125, "learning_rate": 0.0003782659511582505, "loss": 5.009, "mean_token_accuracy": 0.21413856446743013, "num_tokens": 70661242.0, "step": 31655 }, { "entropy": 5.318558692932129, "epoch": 3.5557365081147863, "grad_norm": 1.0703125, "learning_rate": 0.0003782302791022365, "loss": 5.0428, "mean_token_accuracy": 0.2149222031235695, "num_tokens": 70672758.0, "step": 31660 }, { "entropy": 5.445973300933838, "epoch": 3.556298085022744, "grad_norm": 1.015625, "learning_rate": 0.00037819460375933034, "loss": 5.0466, "mean_token_accuracy": 0.20979889929294587, "num_tokens": 70683365.0, "step": 31665 }, { "entropy": 5.318071460723877, "epoch": 3.5568596619307016, "grad_norm": 1.15625, "learning_rate": 0.0003781589251306679, "loss": 4.9468, "mean_token_accuracy": 0.22454005777835845, "num_tokens": 70693984.0, "step": 31670 }, { "entropy": 5.36376724243164, "epoch": 3.557421238838659, "grad_norm": 1.0703125, "learning_rate": 0.0003781232432173853, "loss": 5.0044, "mean_token_accuracy": 0.2143866941332817, "num_tokens": 70704748.0, "step": 31675 }, { "entropy": 5.298790550231933, "epoch": 3.5579828157466165, "grad_norm": 1.046875, "learning_rate": 0.00037808755802061874, "loss": 4.9679, "mean_token_accuracy": 0.2203442022204399, "num_tokens": 70715415.0, "step": 31680 }, { "entropy": 5.323739862442016, "epoch": 3.558544392654574, "grad_norm": 0.9921875, "learning_rate": 0.0003780518695415043, "loss": 4.9995, "mean_token_accuracy": 0.21451320499181747, "num_tokens": 70726646.0, "step": 31685 }, { "entropy": 5.487664127349854, "epoch": 3.5591059695625313, "grad_norm": 0.97265625, "learning_rate": 0.00037801617778117835, "loss": 5.1887, "mean_token_accuracy": 0.1991393744945526, "num_tokens": 70737515.0, "step": 31690 }, { "entropy": 5.435110139846802, "epoch": 3.559667546470489, "grad_norm": 0.99609375, "learning_rate": 0.00037798048274077735, "loss": 5.0352, "mean_token_accuracy": 0.2153919294476509, "num_tokens": 70747751.0, "step": 31695 }, { "entropy": 5.388730573654175, "epoch": 3.5602291233784467, "grad_norm": 1.0859375, "learning_rate": 0.00037794478442143786, "loss": 4.9591, "mean_token_accuracy": 0.21912371814250947, "num_tokens": 70757951.0, "step": 31700 }, { "entropy": 5.400559806823731, "epoch": 3.5607907002864043, "grad_norm": 0.91015625, "learning_rate": 0.00037790908282429647, "loss": 5.123, "mean_token_accuracy": 0.2003370389342308, "num_tokens": 70769515.0, "step": 31705 }, { "entropy": 5.400623083114624, "epoch": 3.561352277194362, "grad_norm": 0.984375, "learning_rate": 0.00037787337795049, "loss": 5.041, "mean_token_accuracy": 0.21440519094467164, "num_tokens": 70780567.0, "step": 31710 }, { "entropy": 5.411202096939087, "epoch": 3.561913854102319, "grad_norm": 0.9609375, "learning_rate": 0.00037783766980115525, "loss": 5.129, "mean_token_accuracy": 0.2066635936498642, "num_tokens": 70793250.0, "step": 31715 }, { "entropy": 5.487799739837646, "epoch": 3.562475431010277, "grad_norm": 1.0546875, "learning_rate": 0.00037780195837742927, "loss": 5.0757, "mean_token_accuracy": 0.20818829536437988, "num_tokens": 70804579.0, "step": 31720 }, { "entropy": 5.377258586883545, "epoch": 3.5630370079182345, "grad_norm": 1.046875, "learning_rate": 0.00037776624368044895, "loss": 4.9515, "mean_token_accuracy": 0.21938524544239044, "num_tokens": 70815931.0, "step": 31725 }, { "entropy": 5.411744594573975, "epoch": 3.5635985848261917, "grad_norm": 1.4765625, "learning_rate": 0.00037773052571135157, "loss": 5.1086, "mean_token_accuracy": 0.20783221423625947, "num_tokens": 70828058.0, "step": 31730 }, { "entropy": 5.434455156326294, "epoch": 3.5641601617341494, "grad_norm": 1.0703125, "learning_rate": 0.0003776948044712745, "loss": 5.0485, "mean_token_accuracy": 0.2146427810192108, "num_tokens": 70838177.0, "step": 31735 }, { "entropy": 5.364833116531372, "epoch": 3.564721738642107, "grad_norm": 0.921875, "learning_rate": 0.000377659079961355, "loss": 5.0247, "mean_token_accuracy": 0.21907975822687148, "num_tokens": 70849888.0, "step": 31740 }, { "entropy": 5.353806734085083, "epoch": 3.5652833155500647, "grad_norm": 1.0234375, "learning_rate": 0.00037762335218273057, "loss": 5.0161, "mean_token_accuracy": 0.21832160502672196, "num_tokens": 70859754.0, "step": 31745 }, { "entropy": 5.456119108200073, "epoch": 3.5658448924580224, "grad_norm": 0.99609375, "learning_rate": 0.0003775876211365388, "loss": 5.1045, "mean_token_accuracy": 0.21108708828687667, "num_tokens": 70870166.0, "step": 31750 }, { "entropy": 5.412425804138183, "epoch": 3.5664064693659796, "grad_norm": 0.984375, "learning_rate": 0.0003775518868239174, "loss": 5.007, "mean_token_accuracy": 0.21662432253360747, "num_tokens": 70882204.0, "step": 31755 }, { "entropy": 5.271044063568115, "epoch": 3.5669680462739373, "grad_norm": 0.97265625, "learning_rate": 0.00037751614924600417, "loss": 5.0252, "mean_token_accuracy": 0.21672936528921127, "num_tokens": 70894317.0, "step": 31760 }, { "entropy": 5.400760221481323, "epoch": 3.567529623181895, "grad_norm": 0.99609375, "learning_rate": 0.000377480408403937, "loss": 5.0359, "mean_token_accuracy": 0.21448483914136887, "num_tokens": 70906224.0, "step": 31765 }, { "entropy": 5.489929676055908, "epoch": 3.568091200089852, "grad_norm": 1.0234375, "learning_rate": 0.0003774446642988538, "loss": 5.1315, "mean_token_accuracy": 0.20607823878526688, "num_tokens": 70918134.0, "step": 31770 }, { "entropy": 5.324291610717774, "epoch": 3.56865277699781, "grad_norm": 0.9375, "learning_rate": 0.00037740891693189286, "loss": 4.9876, "mean_token_accuracy": 0.21535690873861313, "num_tokens": 70929695.0, "step": 31775 }, { "entropy": 5.413259744644165, "epoch": 3.5692143539057675, "grad_norm": 0.9921875, "learning_rate": 0.0003773731663041922, "loss": 5.1038, "mean_token_accuracy": 0.2061096742749214, "num_tokens": 70941204.0, "step": 31780 }, { "entropy": 5.476252555847168, "epoch": 3.5697759308137247, "grad_norm": 1.0546875, "learning_rate": 0.00037733741241689024, "loss": 5.1031, "mean_token_accuracy": 0.21800947189331055, "num_tokens": 70953221.0, "step": 31785 }, { "entropy": 5.424005794525146, "epoch": 3.5703375077216823, "grad_norm": 0.92578125, "learning_rate": 0.0003773016552711254, "loss": 5.0881, "mean_token_accuracy": 0.21298297643661498, "num_tokens": 70967081.0, "step": 31790 }, { "entropy": 5.335922384262085, "epoch": 3.57089908462964, "grad_norm": 0.9765625, "learning_rate": 0.00037726589486803617, "loss": 4.9549, "mean_token_accuracy": 0.2177308440208435, "num_tokens": 70977911.0, "step": 31795 }, { "entropy": 5.402113437652588, "epoch": 3.5714606615375977, "grad_norm": 1.03125, "learning_rate": 0.00037723013120876113, "loss": 5.0116, "mean_token_accuracy": 0.2193724900484085, "num_tokens": 70989001.0, "step": 31800 }, { "entropy": 5.383483839035034, "epoch": 3.5720222384455553, "grad_norm": 1.0390625, "learning_rate": 0.00037719436429443915, "loss": 5.1161, "mean_token_accuracy": 0.20519346594810486, "num_tokens": 70999698.0, "step": 31805 }, { "entropy": 5.287365484237671, "epoch": 3.5725838153535125, "grad_norm": 0.8671875, "learning_rate": 0.00037715859412620895, "loss": 4.8789, "mean_token_accuracy": 0.21750407814979553, "num_tokens": 71010490.0, "step": 31810 }, { "entropy": 5.395344305038452, "epoch": 3.57314539226147, "grad_norm": 0.95703125, "learning_rate": 0.0003771228207052095, "loss": 5.0513, "mean_token_accuracy": 0.2190518468618393, "num_tokens": 71021581.0, "step": 31815 }, { "entropy": 5.408976125717163, "epoch": 3.573706969169428, "grad_norm": 0.96875, "learning_rate": 0.00037708704403257974, "loss": 5.0451, "mean_token_accuracy": 0.21244900971651076, "num_tokens": 71033215.0, "step": 31820 }, { "entropy": 5.339655113220215, "epoch": 3.574268546077385, "grad_norm": 0.98828125, "learning_rate": 0.000377051264109459, "loss": 4.8809, "mean_token_accuracy": 0.2267154186964035, "num_tokens": 71043484.0, "step": 31825 }, { "entropy": 5.339943504333496, "epoch": 3.5748301229853428, "grad_norm": 1.03125, "learning_rate": 0.0003770154809369864, "loss": 4.9909, "mean_token_accuracy": 0.2158287450671196, "num_tokens": 71054101.0, "step": 31830 }, { "entropy": 5.3316810607910154, "epoch": 3.5753916998933004, "grad_norm": 1.015625, "learning_rate": 0.00037697969451630135, "loss": 5.0715, "mean_token_accuracy": 0.20758387595415115, "num_tokens": 71065543.0, "step": 31835 }, { "entropy": 5.3025710105896, "epoch": 3.575953276801258, "grad_norm": 1.0078125, "learning_rate": 0.00037694390484854323, "loss": 4.9207, "mean_token_accuracy": 0.21647845953702927, "num_tokens": 71076450.0, "step": 31840 }, { "entropy": 5.2632972240448, "epoch": 3.5765148537092157, "grad_norm": 0.97265625, "learning_rate": 0.0003769081119348517, "loss": 4.8407, "mean_token_accuracy": 0.22231144607067108, "num_tokens": 71087625.0, "step": 31845 }, { "entropy": 5.348230361938477, "epoch": 3.577076430617173, "grad_norm": 0.9609375, "learning_rate": 0.00037687231577636626, "loss": 5.0347, "mean_token_accuracy": 0.21219077706336975, "num_tokens": 71098205.0, "step": 31850 }, { "entropy": 5.397412395477295, "epoch": 3.5776380075251306, "grad_norm": 1.03125, "learning_rate": 0.0003768365163742269, "loss": 5.1032, "mean_token_accuracy": 0.21260980069637297, "num_tokens": 71109207.0, "step": 31855 }, { "entropy": 5.414638376235962, "epoch": 3.5781995844330883, "grad_norm": 0.984375, "learning_rate": 0.00037680071372957327, "loss": 5.0553, "mean_token_accuracy": 0.2132648453116417, "num_tokens": 71120911.0, "step": 31860 }, { "entropy": 5.46744818687439, "epoch": 3.5787611613410455, "grad_norm": 1.0, "learning_rate": 0.00037676490784354543, "loss": 5.1103, "mean_token_accuracy": 0.21269345730543138, "num_tokens": 71131398.0, "step": 31865 }, { "entropy": 5.396149587631226, "epoch": 3.579322738249003, "grad_norm": 0.91015625, "learning_rate": 0.0003767290987172835, "loss": 5.0532, "mean_token_accuracy": 0.2156805843114853, "num_tokens": 71142574.0, "step": 31870 }, { "entropy": 5.455266237258911, "epoch": 3.579884315156961, "grad_norm": 1.0234375, "learning_rate": 0.00037669328635192757, "loss": 5.0678, "mean_token_accuracy": 0.20854142755270005, "num_tokens": 71154624.0, "step": 31875 }, { "entropy": 5.321757888793945, "epoch": 3.580445892064918, "grad_norm": 0.97265625, "learning_rate": 0.000376657470748618, "loss": 4.9136, "mean_token_accuracy": 0.21632030457258225, "num_tokens": 71165375.0, "step": 31880 }, { "entropy": 5.331001853942871, "epoch": 3.5810074689728757, "grad_norm": 1.0546875, "learning_rate": 0.0003766216519084952, "loss": 4.9489, "mean_token_accuracy": 0.22347745001316072, "num_tokens": 71175835.0, "step": 31885 }, { "entropy": 5.389562797546387, "epoch": 3.5815690458808334, "grad_norm": 1.015625, "learning_rate": 0.0003765858298326994, "loss": 5.0026, "mean_token_accuracy": 0.21424651741981507, "num_tokens": 71187173.0, "step": 31890 }, { "entropy": 5.386519098281861, "epoch": 3.582130622788791, "grad_norm": 1.015625, "learning_rate": 0.00037655000452237154, "loss": 5.0535, "mean_token_accuracy": 0.21431889683008193, "num_tokens": 71198424.0, "step": 31895 }, { "entropy": 5.39782133102417, "epoch": 3.5826921996967487, "grad_norm": 0.95703125, "learning_rate": 0.0003765141759786521, "loss": 5.0628, "mean_token_accuracy": 0.20817395746707917, "num_tokens": 71210198.0, "step": 31900 }, { "entropy": 5.452140140533447, "epoch": 3.583253776604706, "grad_norm": 0.89453125, "learning_rate": 0.00037647834420268195, "loss": 5.1068, "mean_token_accuracy": 0.20744257420301437, "num_tokens": 71221367.0, "step": 31905 }, { "entropy": 5.3906584739685055, "epoch": 3.5838153535126636, "grad_norm": 0.98828125, "learning_rate": 0.0003764425091956019, "loss": 4.9557, "mean_token_accuracy": 0.21769795268774034, "num_tokens": 71232413.0, "step": 31910 }, { "entropy": 5.3784496784210205, "epoch": 3.584376930420621, "grad_norm": 1.0078125, "learning_rate": 0.00037640667095855307, "loss": 5.0631, "mean_token_accuracy": 0.21246958523988724, "num_tokens": 71244219.0, "step": 31915 }, { "entropy": 5.301324319839478, "epoch": 3.5849385073285784, "grad_norm": 0.953125, "learning_rate": 0.00037637082949267654, "loss": 4.9278, "mean_token_accuracy": 0.21962211579084395, "num_tokens": 71254452.0, "step": 31920 }, { "entropy": 5.406702661514283, "epoch": 3.585500084236536, "grad_norm": 0.96875, "learning_rate": 0.0003763349847991134, "loss": 5.0446, "mean_token_accuracy": 0.21405214369297026, "num_tokens": 71265267.0, "step": 31925 }, { "entropy": 5.420621585845947, "epoch": 3.5860616611444938, "grad_norm": 1.0078125, "learning_rate": 0.000376299136879005, "loss": 5.0996, "mean_token_accuracy": 0.20791285783052443, "num_tokens": 71277334.0, "step": 31930 }, { "entropy": 5.363897228240967, "epoch": 3.5866232380524514, "grad_norm": 0.98046875, "learning_rate": 0.00037626328573349296, "loss": 5.0161, "mean_token_accuracy": 0.2176870211958885, "num_tokens": 71289159.0, "step": 31935 }, { "entropy": 5.348265790939331, "epoch": 3.587184814960409, "grad_norm": 1.0234375, "learning_rate": 0.0003762274313637185, "loss": 4.9792, "mean_token_accuracy": 0.2126743108034134, "num_tokens": 71300715.0, "step": 31940 }, { "entropy": 5.404525232315064, "epoch": 3.5877463918683663, "grad_norm": 1.0078125, "learning_rate": 0.0003761915737708234, "loss": 5.012, "mean_token_accuracy": 0.21684534698724747, "num_tokens": 71310948.0, "step": 31945 }, { "entropy": 5.370616340637207, "epoch": 3.588307968776324, "grad_norm": 0.96484375, "learning_rate": 0.00037615571295594936, "loss": 5.0927, "mean_token_accuracy": 0.2076032429933548, "num_tokens": 71321958.0, "step": 31950 }, { "entropy": 5.404864406585693, "epoch": 3.5888695456842816, "grad_norm": 0.99609375, "learning_rate": 0.0003761198489202382, "loss": 5.0388, "mean_token_accuracy": 0.21507318764925004, "num_tokens": 71332522.0, "step": 31955 }, { "entropy": 5.433495569229126, "epoch": 3.589431122592239, "grad_norm": 0.984375, "learning_rate": 0.0003760839816648317, "loss": 5.0476, "mean_token_accuracy": 0.21686243414878845, "num_tokens": 71344198.0, "step": 31960 }, { "entropy": 5.368850946426392, "epoch": 3.5899926995001965, "grad_norm": 1.0234375, "learning_rate": 0.00037604811119087213, "loss": 5.0327, "mean_token_accuracy": 0.22034877240657808, "num_tokens": 71355094.0, "step": 31965 }, { "entropy": 5.413002634048462, "epoch": 3.590554276408154, "grad_norm": 0.91015625, "learning_rate": 0.0003760122374995015, "loss": 5.1047, "mean_token_accuracy": 0.20936728566884993, "num_tokens": 71366596.0, "step": 31970 }, { "entropy": 5.3648255348205565, "epoch": 3.5911158533161114, "grad_norm": 0.98828125, "learning_rate": 0.0003759763605918621, "loss": 4.9383, "mean_token_accuracy": 0.2165632963180542, "num_tokens": 71377607.0, "step": 31975 }, { "entropy": 5.309058332443238, "epoch": 3.591677430224069, "grad_norm": 1.0390625, "learning_rate": 0.00037594048046909616, "loss": 4.9909, "mean_token_accuracy": 0.21648721545934677, "num_tokens": 71388815.0, "step": 31980 }, { "entropy": 5.301339054107666, "epoch": 3.5922390071320267, "grad_norm": 0.984375, "learning_rate": 0.0003759045971323462, "loss": 5.0365, "mean_token_accuracy": 0.2136469841003418, "num_tokens": 71399600.0, "step": 31985 }, { "entropy": 5.416711950302124, "epoch": 3.5928005840399844, "grad_norm": 0.90625, "learning_rate": 0.00037586871058275476, "loss": 4.9961, "mean_token_accuracy": 0.21850170493125914, "num_tokens": 71410652.0, "step": 31990 }, { "entropy": 5.389948606491089, "epoch": 3.593362160947942, "grad_norm": 0.953125, "learning_rate": 0.00037583282082146434, "loss": 5.0914, "mean_token_accuracy": 0.21341708898544312, "num_tokens": 71422656.0, "step": 31995 }, { "entropy": 5.316637468338013, "epoch": 3.5939237378558992, "grad_norm": 1.0078125, "learning_rate": 0.00037579692784961785, "loss": 4.9396, "mean_token_accuracy": 0.2134132817387581, "num_tokens": 71433677.0, "step": 32000 }, { "entropy": 5.325966882705688, "epoch": 3.594485314763857, "grad_norm": 1.0234375, "learning_rate": 0.0003757610316683581, "loss": 5.0387, "mean_token_accuracy": 0.21023479998111724, "num_tokens": 71445922.0, "step": 32005 }, { "entropy": 5.353648614883423, "epoch": 3.5950468916718146, "grad_norm": 0.95703125, "learning_rate": 0.00037572513227882807, "loss": 4.9654, "mean_token_accuracy": 0.21842485219240187, "num_tokens": 71457317.0, "step": 32010 }, { "entropy": 5.281710958480835, "epoch": 3.595608468579772, "grad_norm": 0.99609375, "learning_rate": 0.00037568922968217065, "loss": 4.9193, "mean_token_accuracy": 0.21936111450195311, "num_tokens": 71468622.0, "step": 32015 }, { "entropy": 5.356270408630371, "epoch": 3.5961700454877294, "grad_norm": 0.96875, "learning_rate": 0.00037565332387952914, "loss": 5.0757, "mean_token_accuracy": 0.21983907967805863, "num_tokens": 71479254.0, "step": 32020 }, { "entropy": 5.3508298873901365, "epoch": 3.596731622395687, "grad_norm": 0.9921875, "learning_rate": 0.00037561741487204684, "loss": 4.9927, "mean_token_accuracy": 0.2191203013062477, "num_tokens": 71489694.0, "step": 32025 }, { "entropy": 5.466102600097656, "epoch": 3.5972931993036448, "grad_norm": 0.9921875, "learning_rate": 0.0003755815026608669, "loss": 5.085, "mean_token_accuracy": 0.21422487497329712, "num_tokens": 71499983.0, "step": 32030 }, { "entropy": 5.350766706466675, "epoch": 3.5978547762116024, "grad_norm": 0.99609375, "learning_rate": 0.00037554558724713305, "loss": 4.9674, "mean_token_accuracy": 0.22262002825736998, "num_tokens": 71511628.0, "step": 32035 }, { "entropy": 5.500546979904175, "epoch": 3.5984163531195597, "grad_norm": 0.875, "learning_rate": 0.0003755096686319886, "loss": 5.1541, "mean_token_accuracy": 0.20351076126098633, "num_tokens": 71524432.0, "step": 32040 }, { "entropy": 5.385019063949585, "epoch": 3.5989779300275173, "grad_norm": 0.9375, "learning_rate": 0.00037547374681657736, "loss": 4.9972, "mean_token_accuracy": 0.22204924374818802, "num_tokens": 71534858.0, "step": 32045 }, { "entropy": 5.357357501983643, "epoch": 3.599539506935475, "grad_norm": 1.0, "learning_rate": 0.00037543782180204303, "loss": 5.0828, "mean_token_accuracy": 0.21655477881431578, "num_tokens": 71547028.0, "step": 32050 }, { "entropy": 5.439584064483642, "epoch": 3.600101083843432, "grad_norm": 0.9609375, "learning_rate": 0.00037540189358952955, "loss": 5.0229, "mean_token_accuracy": 0.21138044446706772, "num_tokens": 71557477.0, "step": 32055 }, { "entropy": 5.367985677719116, "epoch": 3.60066266075139, "grad_norm": 0.88671875, "learning_rate": 0.0003753659621801808, "loss": 5.0263, "mean_token_accuracy": 0.21776287108659745, "num_tokens": 71568568.0, "step": 32060 }, { "entropy": 5.364889335632324, "epoch": 3.6012242376593475, "grad_norm": 0.97265625, "learning_rate": 0.00037533002757514095, "loss": 4.9479, "mean_token_accuracy": 0.21991496682167053, "num_tokens": 71579143.0, "step": 32065 }, { "entropy": 5.337669849395752, "epoch": 3.6017858145673047, "grad_norm": 1.0859375, "learning_rate": 0.000375294089775554, "loss": 5.0023, "mean_token_accuracy": 0.22397076785564424, "num_tokens": 71590674.0, "step": 32070 }, { "entropy": 5.326374769210815, "epoch": 3.6023473914752624, "grad_norm": 0.91796875, "learning_rate": 0.0003752581487825644, "loss": 5.0182, "mean_token_accuracy": 0.22071768194437028, "num_tokens": 71602133.0, "step": 32075 }, { "entropy": 5.335265398025513, "epoch": 3.60290896838322, "grad_norm": 0.9609375, "learning_rate": 0.00037522220459731644, "loss": 4.9775, "mean_token_accuracy": 0.2181639403104782, "num_tokens": 71613735.0, "step": 32080 }, { "entropy": 5.403387641906738, "epoch": 3.6034705452911777, "grad_norm": 0.92578125, "learning_rate": 0.0003751862572209546, "loss": 4.996, "mean_token_accuracy": 0.2175822600722313, "num_tokens": 71625553.0, "step": 32085 }, { "entropy": 5.218759298324585, "epoch": 3.6040321221991354, "grad_norm": 0.87890625, "learning_rate": 0.00037515030665462345, "loss": 4.8527, "mean_token_accuracy": 0.22533819824457169, "num_tokens": 71636677.0, "step": 32090 }, { "entropy": 5.356887865066528, "epoch": 3.6045936991070926, "grad_norm": 0.94921875, "learning_rate": 0.00037511435289946775, "loss": 5.0501, "mean_token_accuracy": 0.21088921576738356, "num_tokens": 71648040.0, "step": 32095 }, { "entropy": 5.3907393455505375, "epoch": 3.6051552760150503, "grad_norm": 0.9609375, "learning_rate": 0.0003750783959566322, "loss": 5.002, "mean_token_accuracy": 0.214664027094841, "num_tokens": 71659189.0, "step": 32100 }, { "entropy": 5.315635824203492, "epoch": 3.605716852923008, "grad_norm": 1.015625, "learning_rate": 0.0003750424358272617, "loss": 4.8744, "mean_token_accuracy": 0.22381283938884736, "num_tokens": 71670262.0, "step": 32105 }, { "entropy": 5.2546977519989015, "epoch": 3.606278429830965, "grad_norm": 1.046875, "learning_rate": 0.0003750064725125013, "loss": 4.9863, "mean_token_accuracy": 0.21378156393766404, "num_tokens": 71680271.0, "step": 32110 }, { "entropy": 5.365630722045898, "epoch": 3.606840006738923, "grad_norm": 0.9921875, "learning_rate": 0.00037497050601349605, "loss": 5.0385, "mean_token_accuracy": 0.21399200111627578, "num_tokens": 71691299.0, "step": 32115 }, { "entropy": 5.353423070907593, "epoch": 3.6074015836468805, "grad_norm": 0.90625, "learning_rate": 0.00037493453633139103, "loss": 4.9807, "mean_token_accuracy": 0.21679147183895112, "num_tokens": 71702517.0, "step": 32120 }, { "entropy": 5.29959774017334, "epoch": 3.607963160554838, "grad_norm": 0.9296875, "learning_rate": 0.00037489856346733163, "loss": 4.9967, "mean_token_accuracy": 0.21737123429775237, "num_tokens": 71713386.0, "step": 32125 }, { "entropy": 5.375289106369019, "epoch": 3.608524737462796, "grad_norm": 0.99609375, "learning_rate": 0.0003748625874224632, "loss": 5.0064, "mean_token_accuracy": 0.21758001297712326, "num_tokens": 71724361.0, "step": 32130 }, { "entropy": 5.421258163452149, "epoch": 3.609086314370753, "grad_norm": 0.9375, "learning_rate": 0.00037482660819793134, "loss": 5.1219, "mean_token_accuracy": 0.20568763762712478, "num_tokens": 71735558.0, "step": 32135 }, { "entropy": 5.424272537231445, "epoch": 3.6096478912787107, "grad_norm": 0.98828125, "learning_rate": 0.0003747906257948814, "loss": 5.0831, "mean_token_accuracy": 0.214164038002491, "num_tokens": 71747253.0, "step": 32140 }, { "entropy": 5.450344896316528, "epoch": 3.6102094681866683, "grad_norm": 0.94921875, "learning_rate": 0.0003747546402144594, "loss": 5.0888, "mean_token_accuracy": 0.21168033480644227, "num_tokens": 71760223.0, "step": 32145 }, { "entropy": 5.390631008148193, "epoch": 3.6107710450946255, "grad_norm": 0.96875, "learning_rate": 0.00037471865145781094, "loss": 4.9477, "mean_token_accuracy": 0.20871066749095918, "num_tokens": 71771976.0, "step": 32150 }, { "entropy": 5.2973274230957035, "epoch": 3.611332622002583, "grad_norm": 1.0234375, "learning_rate": 0.00037468265952608196, "loss": 5.0355, "mean_token_accuracy": 0.21283090859651566, "num_tokens": 71784364.0, "step": 32155 }, { "entropy": 5.399561500549316, "epoch": 3.611894198910541, "grad_norm": 0.984375, "learning_rate": 0.0003746466644204183, "loss": 5.0981, "mean_token_accuracy": 0.21213567852973939, "num_tokens": 71795495.0, "step": 32160 }, { "entropy": 5.421964550018311, "epoch": 3.612455775818498, "grad_norm": 0.92578125, "learning_rate": 0.0003746106661419663, "loss": 5.0506, "mean_token_accuracy": 0.21864643841981887, "num_tokens": 71806475.0, "step": 32165 }, { "entropy": 5.389732694625854, "epoch": 3.6130173527264557, "grad_norm": 0.99609375, "learning_rate": 0.000374574664691872, "loss": 5.0326, "mean_token_accuracy": 0.21502620428800584, "num_tokens": 71816701.0, "step": 32170 }, { "entropy": 5.322675895690918, "epoch": 3.6135789296344134, "grad_norm": 1.0234375, "learning_rate": 0.00037453866007128176, "loss": 4.9668, "mean_token_accuracy": 0.21448271125555038, "num_tokens": 71827860.0, "step": 32175 }, { "entropy": 5.337767648696899, "epoch": 3.614140506542371, "grad_norm": 1.015625, "learning_rate": 0.00037450265228134203, "loss": 5.0009, "mean_token_accuracy": 0.22033149898052215, "num_tokens": 71839631.0, "step": 32180 }, { "entropy": 5.373101043701172, "epoch": 3.6147020834503287, "grad_norm": 1.046875, "learning_rate": 0.00037446664132319925, "loss": 4.9986, "mean_token_accuracy": 0.2173807606101036, "num_tokens": 71849926.0, "step": 32185 }, { "entropy": 5.299531364440918, "epoch": 3.615263660358286, "grad_norm": 0.9765625, "learning_rate": 0.000374430627198, "loss": 4.967, "mean_token_accuracy": 0.21949126273393632, "num_tokens": 71860815.0, "step": 32190 }, { "entropy": 5.381127500534058, "epoch": 3.6158252372662436, "grad_norm": 1.0625, "learning_rate": 0.00037439460990689106, "loss": 4.9654, "mean_token_accuracy": 0.22284289449453354, "num_tokens": 71871814.0, "step": 32195 }, { "entropy": 5.376840877532959, "epoch": 3.6163868141742013, "grad_norm": 0.99609375, "learning_rate": 0.0003743585894510192, "loss": 5.004, "mean_token_accuracy": 0.21376866698265076, "num_tokens": 71881606.0, "step": 32200 }, { "entropy": 5.319563579559326, "epoch": 3.6169483910821585, "grad_norm": 0.953125, "learning_rate": 0.00037432256583153127, "loss": 5.0208, "mean_token_accuracy": 0.2139994904398918, "num_tokens": 71893371.0, "step": 32205 }, { "entropy": 5.360753917694092, "epoch": 3.617509967990116, "grad_norm": 0.90625, "learning_rate": 0.00037428653904957433, "loss": 5.0533, "mean_token_accuracy": 0.21744778007268906, "num_tokens": 71906068.0, "step": 32210 }, { "entropy": 5.365038251876831, "epoch": 3.618071544898074, "grad_norm": 1.0, "learning_rate": 0.0003742505091062955, "loss": 5.0713, "mean_token_accuracy": 0.20726863741874696, "num_tokens": 71917450.0, "step": 32215 }, { "entropy": 5.41720724105835, "epoch": 3.6186331218060315, "grad_norm": 0.99609375, "learning_rate": 0.0003742144760028419, "loss": 4.9985, "mean_token_accuracy": 0.20926965177059173, "num_tokens": 71928333.0, "step": 32220 }, { "entropy": 5.336137485504151, "epoch": 3.619194698713989, "grad_norm": 1.03125, "learning_rate": 0.000374178439740361, "loss": 5.0274, "mean_token_accuracy": 0.21682146340608596, "num_tokens": 71939836.0, "step": 32225 }, { "entropy": 5.433050870895386, "epoch": 3.6197562756219464, "grad_norm": 0.95703125, "learning_rate": 0.0003741424003200001, "loss": 5.0905, "mean_token_accuracy": 0.21390762329101562, "num_tokens": 71951120.0, "step": 32230 }, { "entropy": 5.421815299987793, "epoch": 3.620317852529904, "grad_norm": 0.96875, "learning_rate": 0.00037410635774290667, "loss": 5.0156, "mean_token_accuracy": 0.2207029178738594, "num_tokens": 71961547.0, "step": 32235 }, { "entropy": 5.365297508239746, "epoch": 3.6208794294378617, "grad_norm": 0.9765625, "learning_rate": 0.0003740703120102284, "loss": 4.9824, "mean_token_accuracy": 0.2178094670176506, "num_tokens": 71973287.0, "step": 32240 }, { "entropy": 5.369452047348022, "epoch": 3.621441006345819, "grad_norm": 0.94140625, "learning_rate": 0.000374034263123113, "loss": 5.0005, "mean_token_accuracy": 0.22316586822271348, "num_tokens": 71984205.0, "step": 32245 }, { "entropy": 5.270245838165283, "epoch": 3.6220025832537766, "grad_norm": 0.9375, "learning_rate": 0.00037399821108270823, "loss": 4.9998, "mean_token_accuracy": 0.2136416882276535, "num_tokens": 71995090.0, "step": 32250 }, { "entropy": 5.453562068939209, "epoch": 3.622564160161734, "grad_norm": 0.953125, "learning_rate": 0.000373962155890162, "loss": 5.1508, "mean_token_accuracy": 0.21236258745193481, "num_tokens": 72005504.0, "step": 32255 }, { "entropy": 5.3908017635345455, "epoch": 3.6231257370696914, "grad_norm": 0.96484375, "learning_rate": 0.0003739260975466223, "loss": 5.0124, "mean_token_accuracy": 0.21978026628494263, "num_tokens": 72017250.0, "step": 32260 }, { "entropy": 5.384848499298096, "epoch": 3.623687313977649, "grad_norm": 0.921875, "learning_rate": 0.00037389003605323737, "loss": 4.9542, "mean_token_accuracy": 0.2180093452334404, "num_tokens": 72028089.0, "step": 32265 }, { "entropy": 5.350279808044434, "epoch": 3.6242488908856068, "grad_norm": 0.92578125, "learning_rate": 0.00037385397141115535, "loss": 4.9959, "mean_token_accuracy": 0.2145090490579605, "num_tokens": 72039140.0, "step": 32270 }, { "entropy": 5.321670246124268, "epoch": 3.6248104677935644, "grad_norm": 0.9921875, "learning_rate": 0.00037381790362152453, "loss": 5.0244, "mean_token_accuracy": 0.2118471547961235, "num_tokens": 72049944.0, "step": 32275 }, { "entropy": 5.28717074394226, "epoch": 3.625372044701522, "grad_norm": 1.265625, "learning_rate": 0.00037378183268549326, "loss": 4.9638, "mean_token_accuracy": 0.2167445972561836, "num_tokens": 72061799.0, "step": 32280 }, { "entropy": 5.367202663421631, "epoch": 3.6259336216094793, "grad_norm": 0.90234375, "learning_rate": 0.0003737457586042102, "loss": 4.9803, "mean_token_accuracy": 0.22183501422405244, "num_tokens": 72073539.0, "step": 32285 }, { "entropy": 5.340781021118164, "epoch": 3.626495198517437, "grad_norm": 0.95703125, "learning_rate": 0.0003737096813788238, "loss": 5.0046, "mean_token_accuracy": 0.21146558225154877, "num_tokens": 72085268.0, "step": 32290 }, { "entropy": 5.4372461318969725, "epoch": 3.6270567754253946, "grad_norm": 1.015625, "learning_rate": 0.0003736736010104829, "loss": 5.1977, "mean_token_accuracy": 0.20042970925569534, "num_tokens": 72096269.0, "step": 32295 }, { "entropy": 5.347432708740234, "epoch": 3.627618352333352, "grad_norm": 0.90625, "learning_rate": 0.0003736375175003363, "loss": 4.9874, "mean_token_accuracy": 0.22317456156015397, "num_tokens": 72108934.0, "step": 32300 }, { "entropy": 5.339038515090943, "epoch": 3.6281799292413095, "grad_norm": 1.0234375, "learning_rate": 0.00037360143084953285, "loss": 4.9902, "mean_token_accuracy": 0.2159942716360092, "num_tokens": 72118371.0, "step": 32305 }, { "entropy": 5.277317857742309, "epoch": 3.628741506149267, "grad_norm": 0.96484375, "learning_rate": 0.0003735653410592217, "loss": 4.9035, "mean_token_accuracy": 0.22319502234458924, "num_tokens": 72129187.0, "step": 32310 }, { "entropy": 5.34218316078186, "epoch": 3.629303083057225, "grad_norm": 1.015625, "learning_rate": 0.00037352924813055185, "loss": 4.9792, "mean_token_accuracy": 0.22550194710493088, "num_tokens": 72141317.0, "step": 32315 }, { "entropy": 5.358471441268921, "epoch": 3.6298646599651825, "grad_norm": 0.95703125, "learning_rate": 0.0003734931520646724, "loss": 4.9919, "mean_token_accuracy": 0.22387682646512985, "num_tokens": 72152754.0, "step": 32320 }, { "entropy": 5.257072401046753, "epoch": 3.6304262368731397, "grad_norm": 0.99609375, "learning_rate": 0.00037345705286273285, "loss": 4.8639, "mean_token_accuracy": 0.23085146099328996, "num_tokens": 72162115.0, "step": 32325 }, { "entropy": 5.284404659271241, "epoch": 3.6309878137810974, "grad_norm": 0.93359375, "learning_rate": 0.0003734209505258825, "loss": 4.941, "mean_token_accuracy": 0.22192294299602508, "num_tokens": 72173633.0, "step": 32330 }, { "entropy": 5.379550123214722, "epoch": 3.631549390689055, "grad_norm": 0.9921875, "learning_rate": 0.00037338484505527103, "loss": 5.0276, "mean_token_accuracy": 0.20829136222600936, "num_tokens": 72185274.0, "step": 32335 }, { "entropy": 5.43889012336731, "epoch": 3.6321109675970122, "grad_norm": 0.9921875, "learning_rate": 0.00037334873645204785, "loss": 5.0815, "mean_token_accuracy": 0.21240959763526918, "num_tokens": 72195991.0, "step": 32340 }, { "entropy": 5.315511989593506, "epoch": 3.63267254450497, "grad_norm": 0.93359375, "learning_rate": 0.00037331262471736285, "loss": 5.0095, "mean_token_accuracy": 0.21945120841264726, "num_tokens": 72207390.0, "step": 32345 }, { "entropy": 5.311455297470093, "epoch": 3.6332341214129276, "grad_norm": 0.9140625, "learning_rate": 0.00037327650985236564, "loss": 5.036, "mean_token_accuracy": 0.21587470173835754, "num_tokens": 72218747.0, "step": 32350 }, { "entropy": 5.373234987258911, "epoch": 3.633795698320885, "grad_norm": 1.046875, "learning_rate": 0.0003732403918582063, "loss": 5.0196, "mean_token_accuracy": 0.21758537590503693, "num_tokens": 72230623.0, "step": 32355 }, { "entropy": 5.365130376815796, "epoch": 3.6343572752288424, "grad_norm": 0.90234375, "learning_rate": 0.00037320427073603475, "loss": 4.9652, "mean_token_accuracy": 0.21783121973276137, "num_tokens": 72242510.0, "step": 32360 }, { "entropy": 5.292915153503418, "epoch": 3.6349188521368, "grad_norm": 0.9921875, "learning_rate": 0.00037316814648700113, "loss": 4.9498, "mean_token_accuracy": 0.22010420262813568, "num_tokens": 72253498.0, "step": 32365 }, { "entropy": 5.334832334518433, "epoch": 3.6354804290447578, "grad_norm": 0.95703125, "learning_rate": 0.0003731320191122557, "loss": 5.0701, "mean_token_accuracy": 0.21585175693035125, "num_tokens": 72265698.0, "step": 32370 }, { "entropy": 5.325212478637695, "epoch": 3.6360420059527154, "grad_norm": 0.96875, "learning_rate": 0.0003730958886129486, "loss": 4.9015, "mean_token_accuracy": 0.23041606545448304, "num_tokens": 72276563.0, "step": 32375 }, { "entropy": 5.331287288665772, "epoch": 3.6366035828606726, "grad_norm": 0.95703125, "learning_rate": 0.00037305975499023046, "loss": 4.9719, "mean_token_accuracy": 0.21958916932344436, "num_tokens": 72286826.0, "step": 32380 }, { "entropy": 5.429649877548218, "epoch": 3.6371651597686303, "grad_norm": 1.015625, "learning_rate": 0.0003730236182452517, "loss": 5.129, "mean_token_accuracy": 0.21019827872514724, "num_tokens": 72299446.0, "step": 32385 }, { "entropy": 5.417607831954956, "epoch": 3.637726736676588, "grad_norm": 0.921875, "learning_rate": 0.0003729874783791629, "loss": 5.1436, "mean_token_accuracy": 0.2115332841873169, "num_tokens": 72310894.0, "step": 32390 }, { "entropy": 5.374290847778321, "epoch": 3.638288313584545, "grad_norm": 0.9453125, "learning_rate": 0.0003729513353931148, "loss": 5.03, "mean_token_accuracy": 0.21918028146028518, "num_tokens": 72322810.0, "step": 32395 }, { "entropy": 5.39676308631897, "epoch": 3.638849890492503, "grad_norm": 0.95703125, "learning_rate": 0.0003729151892882581, "loss": 5.0368, "mean_token_accuracy": 0.21922408938407897, "num_tokens": 72334509.0, "step": 32400 }, { "entropy": 5.299383687973022, "epoch": 3.6394114674004605, "grad_norm": 1.046875, "learning_rate": 0.0003728790400657439, "loss": 5.0067, "mean_token_accuracy": 0.21406272649765015, "num_tokens": 72345036.0, "step": 32405 }, { "entropy": 5.375289344787598, "epoch": 3.639973044308418, "grad_norm": 0.96875, "learning_rate": 0.00037284288772672315, "loss": 4.9665, "mean_token_accuracy": 0.21222671270370483, "num_tokens": 72356029.0, "step": 32410 }, { "entropy": 5.400136184692383, "epoch": 3.640534621216376, "grad_norm": 1.046875, "learning_rate": 0.00037280673227234687, "loss": 5.0671, "mean_token_accuracy": 0.21620844751596452, "num_tokens": 72366548.0, "step": 32415 }, { "entropy": 5.273833751678467, "epoch": 3.641096198124333, "grad_norm": 1.0078125, "learning_rate": 0.0003727705737037662, "loss": 4.9778, "mean_token_accuracy": 0.21671319603919983, "num_tokens": 72377271.0, "step": 32420 }, { "entropy": 5.358374738693238, "epoch": 3.6416577750322907, "grad_norm": 0.94140625, "learning_rate": 0.0003727344120221326, "loss": 5.0235, "mean_token_accuracy": 0.21629077792167664, "num_tokens": 72388651.0, "step": 32425 }, { "entropy": 5.313619184494018, "epoch": 3.6422193519402484, "grad_norm": 0.9609375, "learning_rate": 0.00037269824722859743, "loss": 5.081, "mean_token_accuracy": 0.21059762686491013, "num_tokens": 72400955.0, "step": 32430 }, { "entropy": 5.399298524856567, "epoch": 3.6427809288482056, "grad_norm": 1.015625, "learning_rate": 0.0003726620793243121, "loss": 5.0259, "mean_token_accuracy": 0.21027046740055083, "num_tokens": 72412372.0, "step": 32435 }, { "entropy": 5.380302047729492, "epoch": 3.6433425057561633, "grad_norm": 1.0078125, "learning_rate": 0.0003726259083104284, "loss": 4.9824, "mean_token_accuracy": 0.21565556824207305, "num_tokens": 72422664.0, "step": 32440 }, { "entropy": 5.332033586502075, "epoch": 3.643904082664121, "grad_norm": 0.890625, "learning_rate": 0.00037258973418809784, "loss": 5.0536, "mean_token_accuracy": 0.21102367490530013, "num_tokens": 72434829.0, "step": 32445 }, { "entropy": 5.295136976242065, "epoch": 3.644465659572078, "grad_norm": 1.0, "learning_rate": 0.0003725535569584723, "loss": 4.9312, "mean_token_accuracy": 0.21832533031702042, "num_tokens": 72445140.0, "step": 32450 }, { "entropy": 5.313194704055786, "epoch": 3.645027236480036, "grad_norm": 1.0, "learning_rate": 0.00037251737662270367, "loss": 4.9368, "mean_token_accuracy": 0.22916316539049147, "num_tokens": 72455281.0, "step": 32455 }, { "entropy": 5.33523416519165, "epoch": 3.6455888133879935, "grad_norm": 0.9296875, "learning_rate": 0.000372481193181944, "loss": 5.0207, "mean_token_accuracy": 0.21002114713191986, "num_tokens": 72466296.0, "step": 32460 }, { "entropy": 5.3231658935546875, "epoch": 3.646150390295951, "grad_norm": 0.98828125, "learning_rate": 0.00037244500663734524, "loss": 4.9901, "mean_token_accuracy": 0.2133605495095253, "num_tokens": 72477390.0, "step": 32465 }, { "entropy": 5.331514549255371, "epoch": 3.6467119672039088, "grad_norm": 1.0078125, "learning_rate": 0.0003724088169900597, "loss": 4.9272, "mean_token_accuracy": 0.2232219770550728, "num_tokens": 72488241.0, "step": 32470 }, { "entropy": 5.385822057723999, "epoch": 3.647273544111866, "grad_norm": 0.98046875, "learning_rate": 0.00037237262424123975, "loss": 5.0096, "mean_token_accuracy": 0.21734921336174012, "num_tokens": 72498823.0, "step": 32475 }, { "entropy": 5.376839828491211, "epoch": 3.6478351210198237, "grad_norm": 0.98046875, "learning_rate": 0.00037233642839203763, "loss": 5.0586, "mean_token_accuracy": 0.20787446647882463, "num_tokens": 72509399.0, "step": 32480 }, { "entropy": 5.435761737823486, "epoch": 3.6483966979277813, "grad_norm": 1.078125, "learning_rate": 0.0003723002294436059, "loss": 5.0855, "mean_token_accuracy": 0.20962174832820893, "num_tokens": 72519182.0, "step": 32485 }, { "entropy": 5.266895818710327, "epoch": 3.6489582748357385, "grad_norm": 1.0859375, "learning_rate": 0.00037226402739709704, "loss": 4.92, "mean_token_accuracy": 0.21698999851942063, "num_tokens": 72528852.0, "step": 32490 }, { "entropy": 5.316558122634888, "epoch": 3.649519851743696, "grad_norm": 0.921875, "learning_rate": 0.0003722278222536639, "loss": 5.0262, "mean_token_accuracy": 0.2137270078063011, "num_tokens": 72540477.0, "step": 32495 }, { "entropy": 5.414946746826172, "epoch": 3.650081428651654, "grad_norm": 1.0078125, "learning_rate": 0.00037219161401445914, "loss": 5.0332, "mean_token_accuracy": 0.2119777351617813, "num_tokens": 72553404.0, "step": 32500 }, { "entropy": 5.387693166732788, "epoch": 3.6506430055596115, "grad_norm": 0.98828125, "learning_rate": 0.00037215540268063573, "loss": 5.0427, "mean_token_accuracy": 0.2132757470011711, "num_tokens": 72564516.0, "step": 32505 }, { "entropy": 5.297772312164307, "epoch": 3.651204582467569, "grad_norm": 0.89453125, "learning_rate": 0.0003721191882533466, "loss": 4.9389, "mean_token_accuracy": 0.2175482451915741, "num_tokens": 72575888.0, "step": 32510 }, { "entropy": 5.353543901443482, "epoch": 3.6517661593755264, "grad_norm": 1.03125, "learning_rate": 0.0003720829707337449, "loss": 4.992, "mean_token_accuracy": 0.21309920400381088, "num_tokens": 72586629.0, "step": 32515 }, { "entropy": 5.372041845321656, "epoch": 3.652327736283484, "grad_norm": 0.984375, "learning_rate": 0.0003720467501229836, "loss": 5.0026, "mean_token_accuracy": 0.21766812056303025, "num_tokens": 72597264.0, "step": 32520 }, { "entropy": 5.369106960296631, "epoch": 3.6528893131914417, "grad_norm": 0.98046875, "learning_rate": 0.0003720105264222163, "loss": 4.9995, "mean_token_accuracy": 0.2159409776329994, "num_tokens": 72608450.0, "step": 32525 }, { "entropy": 5.305699157714844, "epoch": 3.653450890099399, "grad_norm": 0.8984375, "learning_rate": 0.00037197429963259615, "loss": 5.0445, "mean_token_accuracy": 0.20834420323371888, "num_tokens": 72620538.0, "step": 32530 }, { "entropy": 5.405397033691406, "epoch": 3.6540124670073566, "grad_norm": 0.89453125, "learning_rate": 0.0003719380697552767, "loss": 5.0862, "mean_token_accuracy": 0.21224789023399354, "num_tokens": 72632589.0, "step": 32535 }, { "entropy": 5.4171364307403564, "epoch": 3.6545740439153143, "grad_norm": 0.94921875, "learning_rate": 0.0003719018367914115, "loss": 5.0096, "mean_token_accuracy": 0.21378622055053711, "num_tokens": 72643749.0, "step": 32540 }, { "entropy": 5.395247602462769, "epoch": 3.6551356208232715, "grad_norm": 0.96484375, "learning_rate": 0.0003718656007421542, "loss": 5.0529, "mean_token_accuracy": 0.21652597486972808, "num_tokens": 72655485.0, "step": 32545 }, { "entropy": 5.408996677398681, "epoch": 3.655697197731229, "grad_norm": 0.90625, "learning_rate": 0.00037182936160865866, "loss": 5.0553, "mean_token_accuracy": 0.21566933542490005, "num_tokens": 72666175.0, "step": 32550 }, { "entropy": 5.343943977355957, "epoch": 3.656258774639187, "grad_norm": 1.0859375, "learning_rate": 0.0003717931193920788, "loss": 4.9594, "mean_token_accuracy": 0.2137770876288414, "num_tokens": 72675858.0, "step": 32555 }, { "entropy": 5.282408571243286, "epoch": 3.6568203515471445, "grad_norm": 1.0546875, "learning_rate": 0.0003717568740935683, "loss": 4.8978, "mean_token_accuracy": 0.2177508443593979, "num_tokens": 72686623.0, "step": 32560 }, { "entropy": 5.3714423179626465, "epoch": 3.657381928455102, "grad_norm": 0.94921875, "learning_rate": 0.0003717206257142815, "loss": 4.9847, "mean_token_accuracy": 0.22171366810798646, "num_tokens": 72698002.0, "step": 32565 }, { "entropy": 5.34528079032898, "epoch": 3.6579435053630593, "grad_norm": 1.046875, "learning_rate": 0.0003716843742553724, "loss": 5.0094, "mean_token_accuracy": 0.21767104268074036, "num_tokens": 72708981.0, "step": 32570 }, { "entropy": 5.256150579452514, "epoch": 3.658505082271017, "grad_norm": 0.984375, "learning_rate": 0.0003716481197179953, "loss": 5.0025, "mean_token_accuracy": 0.21651729047298432, "num_tokens": 72719764.0, "step": 32575 }, { "entropy": 5.511712551116943, "epoch": 3.6590666591789747, "grad_norm": 0.98828125, "learning_rate": 0.00037161186210330464, "loss": 5.2167, "mean_token_accuracy": 0.20582916289567948, "num_tokens": 72730915.0, "step": 32580 }, { "entropy": 5.4349205493927, "epoch": 3.659628236086932, "grad_norm": 0.9765625, "learning_rate": 0.00037157560141245485, "loss": 5.0709, "mean_token_accuracy": 0.21230919808149337, "num_tokens": 72741869.0, "step": 32585 }, { "entropy": 5.3999162197113035, "epoch": 3.6601898129948895, "grad_norm": 0.94921875, "learning_rate": 0.00037153933764660034, "loss": 5.0238, "mean_token_accuracy": 0.2150506779551506, "num_tokens": 72753638.0, "step": 32590 }, { "entropy": 5.4058009624481205, "epoch": 3.660751389902847, "grad_norm": 1.0703125, "learning_rate": 0.000371503070806896, "loss": 5.0448, "mean_token_accuracy": 0.21725285202264785, "num_tokens": 72765505.0, "step": 32595 }, { "entropy": 5.334006929397583, "epoch": 3.661312966810805, "grad_norm": 1.0546875, "learning_rate": 0.00037146680089449643, "loss": 4.8891, "mean_token_accuracy": 0.22112863063812255, "num_tokens": 72776348.0, "step": 32600 }, { "entropy": 5.37630558013916, "epoch": 3.6618745437187625, "grad_norm": 0.984375, "learning_rate": 0.00037143052791055654, "loss": 5.0897, "mean_token_accuracy": 0.21058931350708007, "num_tokens": 72787720.0, "step": 32605 }, { "entropy": 5.334755086898804, "epoch": 3.6624361206267197, "grad_norm": 0.9375, "learning_rate": 0.0003713942518562311, "loss": 4.9826, "mean_token_accuracy": 0.21372233033180238, "num_tokens": 72798947.0, "step": 32610 }, { "entropy": 5.412807369232178, "epoch": 3.6629976975346774, "grad_norm": 1.0078125, "learning_rate": 0.0003713579727326754, "loss": 5.1168, "mean_token_accuracy": 0.2093987613916397, "num_tokens": 72810859.0, "step": 32615 }, { "entropy": 5.317181921005249, "epoch": 3.663559274442635, "grad_norm": 0.9765625, "learning_rate": 0.00037132169054104446, "loss": 4.9371, "mean_token_accuracy": 0.22443264126777648, "num_tokens": 72821089.0, "step": 32620 }, { "entropy": 5.270217370986939, "epoch": 3.6641208513505923, "grad_norm": 0.96484375, "learning_rate": 0.00037128540528249355, "loss": 4.9047, "mean_token_accuracy": 0.2201240509748459, "num_tokens": 72832226.0, "step": 32625 }, { "entropy": 5.359174013137817, "epoch": 3.66468242825855, "grad_norm": 1.0078125, "learning_rate": 0.000371249116958178, "loss": 5.0068, "mean_token_accuracy": 0.2202112063765526, "num_tokens": 72843939.0, "step": 32630 }, { "entropy": 5.29600567817688, "epoch": 3.6652440051665076, "grad_norm": 0.93359375, "learning_rate": 0.00037121282556925326, "loss": 4.8645, "mean_token_accuracy": 0.2257383406162262, "num_tokens": 72854332.0, "step": 32635 }, { "entropy": 5.392191171646118, "epoch": 3.665805582074465, "grad_norm": 0.96484375, "learning_rate": 0.0003711765311168748, "loss": 5.1572, "mean_token_accuracy": 0.20914976745843888, "num_tokens": 72865530.0, "step": 32640 }, { "entropy": 5.389699172973633, "epoch": 3.6663671589824225, "grad_norm": 0.99609375, "learning_rate": 0.00037114023360219824, "loss": 5.0908, "mean_token_accuracy": 0.21136886328458787, "num_tokens": 72877683.0, "step": 32645 }, { "entropy": 5.377852964401245, "epoch": 3.66692873589038, "grad_norm": 0.94921875, "learning_rate": 0.00037110393302637937, "loss": 5.0246, "mean_token_accuracy": 0.22078874260187148, "num_tokens": 72888926.0, "step": 32650 }, { "entropy": 5.381099510192871, "epoch": 3.667490312798338, "grad_norm": 0.9296875, "learning_rate": 0.00037106762939057404, "loss": 5.0582, "mean_token_accuracy": 0.21053049862384796, "num_tokens": 72901318.0, "step": 32655 }, { "entropy": 5.466742849349975, "epoch": 3.6680518897062955, "grad_norm": 0.93359375, "learning_rate": 0.0003710313226959381, "loss": 5.0914, "mean_token_accuracy": 0.21864370852708817, "num_tokens": 72913177.0, "step": 32660 }, { "entropy": 5.442661952972412, "epoch": 3.6686134666142527, "grad_norm": 0.98046875, "learning_rate": 0.0003709950129436276, "loss": 5.1295, "mean_token_accuracy": 0.20580410659313203, "num_tokens": 72924322.0, "step": 32665 }, { "entropy": 5.339646244049073, "epoch": 3.6691750435222104, "grad_norm": 0.9296875, "learning_rate": 0.0003709587001347987, "loss": 4.995, "mean_token_accuracy": 0.22136670649051665, "num_tokens": 72936287.0, "step": 32670 }, { "entropy": 5.427655029296875, "epoch": 3.669736620430168, "grad_norm": 0.94921875, "learning_rate": 0.00037092238427060756, "loss": 5.0763, "mean_token_accuracy": 0.2081774428486824, "num_tokens": 72949262.0, "step": 32675 }, { "entropy": 5.427682590484619, "epoch": 3.6702981973381252, "grad_norm": 0.9921875, "learning_rate": 0.0003708860653522104, "loss": 5.0894, "mean_token_accuracy": 0.21382759660482406, "num_tokens": 72959283.0, "step": 32680 }, { "entropy": 5.32410078048706, "epoch": 3.670859774246083, "grad_norm": 0.96484375, "learning_rate": 0.0003708497433807639, "loss": 4.934, "mean_token_accuracy": 0.2243756502866745, "num_tokens": 72971063.0, "step": 32685 }, { "entropy": 5.304924535751343, "epoch": 3.6714213511540406, "grad_norm": 1.1171875, "learning_rate": 0.00037081341835742433, "loss": 4.9242, "mean_token_accuracy": 0.22128563225269318, "num_tokens": 72980775.0, "step": 32690 }, { "entropy": 5.302289247512817, "epoch": 3.671982928061998, "grad_norm": 0.9921875, "learning_rate": 0.0003707770902833483, "loss": 4.969, "mean_token_accuracy": 0.22104980945587158, "num_tokens": 72992166.0, "step": 32695 }, { "entropy": 5.276807546615601, "epoch": 3.672544504969956, "grad_norm": 0.9140625, "learning_rate": 0.0003707407591596926, "loss": 4.916, "mean_token_accuracy": 0.21515513807535172, "num_tokens": 73003194.0, "step": 32700 }, { "entropy": 5.324234533309936, "epoch": 3.673106081877913, "grad_norm": 0.97265625, "learning_rate": 0.000370704424987614, "loss": 5.0199, "mean_token_accuracy": 0.21842456459999085, "num_tokens": 73013375.0, "step": 32705 }, { "entropy": 5.393124961853028, "epoch": 3.6736676587858708, "grad_norm": 1.0234375, "learning_rate": 0.0003706680877682694, "loss": 5.036, "mean_token_accuracy": 0.21864428967237473, "num_tokens": 73024532.0, "step": 32710 }, { "entropy": 5.339003324508667, "epoch": 3.6742292356938284, "grad_norm": 1.03125, "learning_rate": 0.00037063174750281573, "loss": 4.9642, "mean_token_accuracy": 0.2214416339993477, "num_tokens": 73034721.0, "step": 32715 }, { "entropy": 5.316589498519898, "epoch": 3.6747908126017856, "grad_norm": 0.95703125, "learning_rate": 0.0003705954041924102, "loss": 4.9386, "mean_token_accuracy": 0.22162773460149765, "num_tokens": 73045894.0, "step": 32720 }, { "entropy": 5.180207109451294, "epoch": 3.6753523895097433, "grad_norm": 0.96875, "learning_rate": 0.00037055905783821, "loss": 4.8217, "mean_token_accuracy": 0.23719478398561478, "num_tokens": 73057370.0, "step": 32725 }, { "entropy": 5.410839462280274, "epoch": 3.675913966417701, "grad_norm": 0.9765625, "learning_rate": 0.00037052270844137216, "loss": 5.0912, "mean_token_accuracy": 0.2135603666305542, "num_tokens": 73067700.0, "step": 32730 }, { "entropy": 5.312532377243042, "epoch": 3.676475543325658, "grad_norm": 0.9375, "learning_rate": 0.0003704863560030543, "loss": 4.9293, "mean_token_accuracy": 0.21994376480579375, "num_tokens": 73079612.0, "step": 32735 }, { "entropy": 5.368846035003662, "epoch": 3.677037120233616, "grad_norm": 1.0, "learning_rate": 0.0003704500005244139, "loss": 5.0326, "mean_token_accuracy": 0.21279377043247222, "num_tokens": 73091060.0, "step": 32740 }, { "entropy": 5.407676458358765, "epoch": 3.6775986971415735, "grad_norm": 0.9609375, "learning_rate": 0.00037041364200660835, "loss": 5.0533, "mean_token_accuracy": 0.21740828156471254, "num_tokens": 73102218.0, "step": 32745 }, { "entropy": 5.457616138458252, "epoch": 3.678160274049531, "grad_norm": 1.0, "learning_rate": 0.00037037728045079553, "loss": 5.0831, "mean_token_accuracy": 0.20908118337392806, "num_tokens": 73113669.0, "step": 32750 }, { "entropy": 5.381910610198974, "epoch": 3.678721850957489, "grad_norm": 0.99609375, "learning_rate": 0.000370340915858133, "loss": 4.9386, "mean_token_accuracy": 0.21981036365032197, "num_tokens": 73124765.0, "step": 32755 }, { "entropy": 5.36355996131897, "epoch": 3.679283427865446, "grad_norm": 1.046875, "learning_rate": 0.0003703045482297788, "loss": 5.076, "mean_token_accuracy": 0.21208474785089493, "num_tokens": 73135278.0, "step": 32760 }, { "entropy": 5.243255615234375, "epoch": 3.6798450047734037, "grad_norm": 1.0234375, "learning_rate": 0.0003702681775668908, "loss": 4.833, "mean_token_accuracy": 0.22018363326787949, "num_tokens": 73145176.0, "step": 32765 }, { "entropy": 5.447045755386353, "epoch": 3.6804065816813614, "grad_norm": 1.03125, "learning_rate": 0.0003702318038706272, "loss": 5.1274, "mean_token_accuracy": 0.20888967216014862, "num_tokens": 73156001.0, "step": 32770 }, { "entropy": 5.2924768924713135, "epoch": 3.6809681585893186, "grad_norm": 1.0390625, "learning_rate": 0.0003701954271421459, "loss": 4.9467, "mean_token_accuracy": 0.21709701865911485, "num_tokens": 73167116.0, "step": 32775 }, { "entropy": 5.4066637516021725, "epoch": 3.6815297354972762, "grad_norm": 1.0390625, "learning_rate": 0.00037015904738260533, "loss": 5.0621, "mean_token_accuracy": 0.22130534648895264, "num_tokens": 73178750.0, "step": 32780 }, { "entropy": 5.326592254638672, "epoch": 3.682091312405234, "grad_norm": 0.94921875, "learning_rate": 0.0003701226645931637, "loss": 4.9627, "mean_token_accuracy": 0.22635652422904967, "num_tokens": 73189781.0, "step": 32785 }, { "entropy": 5.295560884475708, "epoch": 3.6826528893131916, "grad_norm": 0.9921875, "learning_rate": 0.0003700862787749796, "loss": 4.931, "mean_token_accuracy": 0.22036688178777694, "num_tokens": 73200374.0, "step": 32790 }, { "entropy": 5.429730653762817, "epoch": 3.6832144662211492, "grad_norm": 0.97265625, "learning_rate": 0.0003700498899292115, "loss": 5.0844, "mean_token_accuracy": 0.2071483165025711, "num_tokens": 73211613.0, "step": 32795 }, { "entropy": 5.337763118743896, "epoch": 3.6837760431291064, "grad_norm": 1.0078125, "learning_rate": 0.0003700134980570181, "loss": 4.9748, "mean_token_accuracy": 0.23014363199472426, "num_tokens": 73222309.0, "step": 32800 }, { "entropy": 5.468933582305908, "epoch": 3.684337620037064, "grad_norm": 1.0078125, "learning_rate": 0.0003699771031595579, "loss": 5.2464, "mean_token_accuracy": 0.20184991806745528, "num_tokens": 73233956.0, "step": 32805 }, { "entropy": 5.4456202507019045, "epoch": 3.6848991969450218, "grad_norm": 0.98046875, "learning_rate": 0.00036994070523799005, "loss": 5.1035, "mean_token_accuracy": 0.2092838004231453, "num_tokens": 73245218.0, "step": 32810 }, { "entropy": 5.348458337783813, "epoch": 3.685460773852979, "grad_norm": 0.98046875, "learning_rate": 0.00036990430429347334, "loss": 4.9723, "mean_token_accuracy": 0.22643471360206605, "num_tokens": 73255830.0, "step": 32815 }, { "entropy": 5.303211307525634, "epoch": 3.6860223507609367, "grad_norm": 0.94921875, "learning_rate": 0.00036986790032716673, "loss": 4.8953, "mean_token_accuracy": 0.21931997835636138, "num_tokens": 73266384.0, "step": 32820 }, { "entropy": 5.345702362060547, "epoch": 3.6865839276688943, "grad_norm": 0.98046875, "learning_rate": 0.0003698314933402292, "loss": 4.9922, "mean_token_accuracy": 0.21320143342018127, "num_tokens": 73276839.0, "step": 32825 }, { "entropy": 5.398399066925049, "epoch": 3.6871455045768515, "grad_norm": 0.9453125, "learning_rate": 0.0003697950833338204, "loss": 5.0736, "mean_token_accuracy": 0.2170320615172386, "num_tokens": 73287398.0, "step": 32830 }, { "entropy": 5.338272905349731, "epoch": 3.687707081484809, "grad_norm": 1.015625, "learning_rate": 0.00036975867030909933, "loss": 4.9633, "mean_token_accuracy": 0.21587843149900438, "num_tokens": 73297432.0, "step": 32835 }, { "entropy": 5.315424203872681, "epoch": 3.688268658392767, "grad_norm": 0.98828125, "learning_rate": 0.00036972225426722545, "loss": 4.8575, "mean_token_accuracy": 0.22218521535396576, "num_tokens": 73308539.0, "step": 32840 }, { "entropy": 5.3108954429626465, "epoch": 3.6888302353007245, "grad_norm": 0.984375, "learning_rate": 0.0003696858352093582, "loss": 4.9841, "mean_token_accuracy": 0.221356201171875, "num_tokens": 73319698.0, "step": 32845 }, { "entropy": 5.3234601497650145, "epoch": 3.689391812208682, "grad_norm": 1.046875, "learning_rate": 0.00036964941313665715, "loss": 5.0337, "mean_token_accuracy": 0.21379416882991792, "num_tokens": 73329747.0, "step": 32850 }, { "entropy": 5.401691341400147, "epoch": 3.6899533891166394, "grad_norm": 1.0078125, "learning_rate": 0.0003696129880502823, "loss": 5.0184, "mean_token_accuracy": 0.2223362520337105, "num_tokens": 73340523.0, "step": 32855 }, { "entropy": 5.571006202697754, "epoch": 3.690514966024597, "grad_norm": 1.046875, "learning_rate": 0.000369576559951393, "loss": 5.1014, "mean_token_accuracy": 0.20630527436733245, "num_tokens": 73352219.0, "step": 32860 }, { "entropy": 5.3385804176330565, "epoch": 3.6910765429325547, "grad_norm": 0.94921875, "learning_rate": 0.00036954012884114946, "loss": 5.0278, "mean_token_accuracy": 0.21635428965091705, "num_tokens": 73363157.0, "step": 32865 }, { "entropy": 5.337261772155761, "epoch": 3.691638119840512, "grad_norm": 0.9453125, "learning_rate": 0.0003695036947207115, "loss": 5.0763, "mean_token_accuracy": 0.21711685061454772, "num_tokens": 73375387.0, "step": 32870 }, { "entropy": 5.4419028759002686, "epoch": 3.6921996967484696, "grad_norm": 0.9296875, "learning_rate": 0.00036946725759123936, "loss": 5.1502, "mean_token_accuracy": 0.20825972259044648, "num_tokens": 73388056.0, "step": 32875 }, { "entropy": 5.448140096664429, "epoch": 3.6927612736564273, "grad_norm": 0.96875, "learning_rate": 0.0003694308174538929, "loss": 5.0987, "mean_token_accuracy": 0.21698795408010482, "num_tokens": 73398510.0, "step": 32880 }, { "entropy": 5.370825147628784, "epoch": 3.693322850564385, "grad_norm": 1.015625, "learning_rate": 0.00036939437430983274, "loss": 5.0014, "mean_token_accuracy": 0.2208140268921852, "num_tokens": 73409382.0, "step": 32885 }, { "entropy": 5.299609756469726, "epoch": 3.6938844274723426, "grad_norm": 1.0, "learning_rate": 0.00036935792816021905, "loss": 4.9929, "mean_token_accuracy": 0.21493352353572845, "num_tokens": 73419958.0, "step": 32890 }, { "entropy": 5.391295289993286, "epoch": 3.6944460043803, "grad_norm": 0.95703125, "learning_rate": 0.00036932147900621234, "loss": 4.9679, "mean_token_accuracy": 0.21798883974552155, "num_tokens": 73430982.0, "step": 32895 }, { "entropy": 5.3664226055145265, "epoch": 3.6950075812882575, "grad_norm": 0.98828125, "learning_rate": 0.00036928502684897314, "loss": 4.9895, "mean_token_accuracy": 0.22239900529384612, "num_tokens": 73442375.0, "step": 32900 }, { "entropy": 5.29531888961792, "epoch": 3.695569158196215, "grad_norm": 0.90234375, "learning_rate": 0.00036924857168966216, "loss": 4.8478, "mean_token_accuracy": 0.22790358066558838, "num_tokens": 73452212.0, "step": 32905 }, { "entropy": 5.280654573440552, "epoch": 3.6961307351041723, "grad_norm": 0.94921875, "learning_rate": 0.0003692121135294401, "loss": 5.0163, "mean_token_accuracy": 0.21572890430688857, "num_tokens": 73462998.0, "step": 32910 }, { "entropy": 5.252621698379516, "epoch": 3.69669231201213, "grad_norm": 0.94921875, "learning_rate": 0.00036917565236946776, "loss": 4.9381, "mean_token_accuracy": 0.21879514306783676, "num_tokens": 73474387.0, "step": 32915 }, { "entropy": 5.350155162811279, "epoch": 3.6972538889200877, "grad_norm": 0.984375, "learning_rate": 0.00036913918821090616, "loss": 4.9386, "mean_token_accuracy": 0.22192672342061998, "num_tokens": 73484524.0, "step": 32920 }, { "entropy": 5.337688732147217, "epoch": 3.697815465828045, "grad_norm": 0.97265625, "learning_rate": 0.00036910272105491625, "loss": 4.96, "mean_token_accuracy": 0.22790093272924422, "num_tokens": 73495286.0, "step": 32925 }, { "entropy": 5.299866819381714, "epoch": 3.6983770427360025, "grad_norm": 0.88671875, "learning_rate": 0.00036906625090265925, "loss": 5.0034, "mean_token_accuracy": 0.2138687402009964, "num_tokens": 73507366.0, "step": 32930 }, { "entropy": 5.321167755126953, "epoch": 3.69893861964396, "grad_norm": 1.015625, "learning_rate": 0.00036902977775529636, "loss": 4.9327, "mean_token_accuracy": 0.2273053452372551, "num_tokens": 73517823.0, "step": 32935 }, { "entropy": 5.294930076599121, "epoch": 3.699500196551918, "grad_norm": 0.953125, "learning_rate": 0.0003689933016139888, "loss": 5.0156, "mean_token_accuracy": 0.21567903310060502, "num_tokens": 73529199.0, "step": 32940 }, { "entropy": 5.315556240081787, "epoch": 3.7000617734598755, "grad_norm": 0.9921875, "learning_rate": 0.0003689568224798981, "loss": 4.8993, "mean_token_accuracy": 0.21435010880231858, "num_tokens": 73539845.0, "step": 32945 }, { "entropy": 5.418497037887573, "epoch": 3.7006233503678327, "grad_norm": 0.984375, "learning_rate": 0.0003689203403541857, "loss": 5.0286, "mean_token_accuracy": 0.2127314105629921, "num_tokens": 73551331.0, "step": 32950 }, { "entropy": 5.373791933059692, "epoch": 3.7011849272757904, "grad_norm": 0.9375, "learning_rate": 0.00036888385523801325, "loss": 5.0308, "mean_token_accuracy": 0.2199239820241928, "num_tokens": 73562155.0, "step": 32955 }, { "entropy": 5.284725332260132, "epoch": 3.701746504183748, "grad_norm": 0.91796875, "learning_rate": 0.00036884736713254247, "loss": 4.998, "mean_token_accuracy": 0.22226016968488693, "num_tokens": 73573014.0, "step": 32960 }, { "entropy": 5.320525312423706, "epoch": 3.7023080810917053, "grad_norm": 1.0859375, "learning_rate": 0.00036881087603893515, "loss": 5.014, "mean_token_accuracy": 0.2107241317629814, "num_tokens": 73584919.0, "step": 32965 }, { "entropy": 5.326927137374878, "epoch": 3.702869657999663, "grad_norm": 0.96484375, "learning_rate": 0.00036877438195835307, "loss": 4.9662, "mean_token_accuracy": 0.2161330223083496, "num_tokens": 73596015.0, "step": 32970 }, { "entropy": 5.337098264694214, "epoch": 3.7034312349076206, "grad_norm": 1.03125, "learning_rate": 0.0003687378848919584, "loss": 4.9389, "mean_token_accuracy": 0.22096004635095595, "num_tokens": 73606312.0, "step": 32975 }, { "entropy": 5.4395421028137205, "epoch": 3.7039928118155783, "grad_norm": 1.046875, "learning_rate": 0.00036870138484091297, "loss": 5.1935, "mean_token_accuracy": 0.20167872458696365, "num_tokens": 73617411.0, "step": 32980 }, { "entropy": 5.4689970970153805, "epoch": 3.704554388723536, "grad_norm": 0.89453125, "learning_rate": 0.00036866488180637926, "loss": 4.9562, "mean_token_accuracy": 0.21120749413967133, "num_tokens": 73627725.0, "step": 32985 }, { "entropy": 5.3699620246887205, "epoch": 3.705115965631493, "grad_norm": 0.9375, "learning_rate": 0.0003686283757895193, "loss": 4.8939, "mean_token_accuracy": 0.22116359025239946, "num_tokens": 73639130.0, "step": 32990 }, { "entropy": 5.218710565567017, "epoch": 3.705677542539451, "grad_norm": 0.90625, "learning_rate": 0.00036859186679149555, "loss": 4.9323, "mean_token_accuracy": 0.2211493268609047, "num_tokens": 73650107.0, "step": 32995 }, { "entropy": 5.28927001953125, "epoch": 3.7062391194474085, "grad_norm": 0.94921875, "learning_rate": 0.0003685553548134705, "loss": 4.9327, "mean_token_accuracy": 0.2219952866435051, "num_tokens": 73659735.0, "step": 33000 }, { "epoch": 3.7062391194474085, "eval_entropy": 5.134980522728409, "eval_loss": 5.134953498840332, "eval_mean_token_accuracy": 0.21828114114719044, "eval_num_tokens": 73659735.0, "eval_runtime": 23.8803, "eval_samples_per_second": 1298.688, "eval_steps_per_second": 162.352, "step": 33000 }, { "entropy": 5.297929191589356, "epoch": 3.7068006963553657, "grad_norm": 0.96875, "learning_rate": 0.0003685188398566066, "loss": 4.9639, "mean_token_accuracy": 0.21889008283615113, "num_tokens": 73670969.0, "step": 33005 }, { "entropy": 5.370891475677491, "epoch": 3.7073622732633233, "grad_norm": 1.0546875, "learning_rate": 0.0003684823219220666, "loss": 5.0211, "mean_token_accuracy": 0.2257177338004112, "num_tokens": 73681513.0, "step": 33010 }, { "entropy": 5.431780290603638, "epoch": 3.707923850171281, "grad_norm": 0.9609375, "learning_rate": 0.0003684458010110133, "loss": 5.1014, "mean_token_accuracy": 0.2089888036251068, "num_tokens": 73692485.0, "step": 33015 }, { "entropy": 5.407169198989868, "epoch": 3.7084854270792382, "grad_norm": 1.125, "learning_rate": 0.0003684092771246094, "loss": 5.0034, "mean_token_accuracy": 0.21806580722332, "num_tokens": 73702582.0, "step": 33020 }, { "entropy": 5.305132532119751, "epoch": 3.709047003987196, "grad_norm": 0.8984375, "learning_rate": 0.0003683727502640178, "loss": 4.9964, "mean_token_accuracy": 0.22003330290317535, "num_tokens": 73713337.0, "step": 33025 }, { "entropy": 5.431763648986816, "epoch": 3.7096085808951536, "grad_norm": 0.9375, "learning_rate": 0.0003683362204304017, "loss": 5.1473, "mean_token_accuracy": 0.2071835622191429, "num_tokens": 73724500.0, "step": 33030 }, { "entropy": 5.298002529144287, "epoch": 3.710170157803111, "grad_norm": 0.98046875, "learning_rate": 0.0003682996876249241, "loss": 4.8703, "mean_token_accuracy": 0.22342725694179535, "num_tokens": 73734690.0, "step": 33035 }, { "entropy": 5.253892278671264, "epoch": 3.710731734711069, "grad_norm": 1.0859375, "learning_rate": 0.0003682631518487483, "loss": 4.841, "mean_token_accuracy": 0.22152213007211685, "num_tokens": 73744887.0, "step": 33040 }, { "entropy": 5.3777649879455565, "epoch": 3.711293311619026, "grad_norm": 0.8984375, "learning_rate": 0.0003682266131030375, "loss": 5.0856, "mean_token_accuracy": 0.21076125651597977, "num_tokens": 73757141.0, "step": 33045 }, { "entropy": 5.344167852401734, "epoch": 3.7118548885269838, "grad_norm": 0.91015625, "learning_rate": 0.00036819007138895525, "loss": 5.0093, "mean_token_accuracy": 0.22449839413166045, "num_tokens": 73767802.0, "step": 33050 }, { "entropy": 5.3354206562042235, "epoch": 3.7124164654349414, "grad_norm": 0.9609375, "learning_rate": 0.000368153526707665, "loss": 5.0194, "mean_token_accuracy": 0.21402618885040284, "num_tokens": 73778278.0, "step": 33055 }, { "entropy": 5.313831090927124, "epoch": 3.7129780423428986, "grad_norm": 0.9453125, "learning_rate": 0.0003681169790603303, "loss": 4.9358, "mean_token_accuracy": 0.21787697076797485, "num_tokens": 73790065.0, "step": 33060 }, { "entropy": 5.3701554298400875, "epoch": 3.7135396192508563, "grad_norm": 0.98046875, "learning_rate": 0.00036808042844811484, "loss": 5.0013, "mean_token_accuracy": 0.22381238043308258, "num_tokens": 73800868.0, "step": 33065 }, { "entropy": 5.368294668197632, "epoch": 3.714101196158814, "grad_norm": 0.9765625, "learning_rate": 0.00036804387487218254, "loss": 4.9222, "mean_token_accuracy": 0.22539226710796356, "num_tokens": 73811478.0, "step": 33070 }, { "entropy": 5.274724769592285, "epoch": 3.7146627730667716, "grad_norm": 0.84375, "learning_rate": 0.000368007318333697, "loss": 5.018, "mean_token_accuracy": 0.22523723393678666, "num_tokens": 73823618.0, "step": 33075 }, { "entropy": 5.331714391708374, "epoch": 3.7152243499747293, "grad_norm": 1.015625, "learning_rate": 0.0003679707588338225, "loss": 4.9915, "mean_token_accuracy": 0.21232471764087676, "num_tokens": 73835268.0, "step": 33080 }, { "entropy": 5.368676614761353, "epoch": 3.7157859268826865, "grad_norm": 0.96484375, "learning_rate": 0.000367934196373723, "loss": 4.9391, "mean_token_accuracy": 0.22048537135124208, "num_tokens": 73845877.0, "step": 33085 }, { "entropy": 5.429248905181884, "epoch": 3.716347503790644, "grad_norm": 0.94140625, "learning_rate": 0.00036789763095456264, "loss": 5.0195, "mean_token_accuracy": 0.21320505887269975, "num_tokens": 73857038.0, "step": 33090 }, { "entropy": 5.330946063995361, "epoch": 3.716909080698602, "grad_norm": 0.99609375, "learning_rate": 0.0003678610625775056, "loss": 5.0136, "mean_token_accuracy": 0.21711913049221038, "num_tokens": 73868439.0, "step": 33095 }, { "entropy": 5.348852825164795, "epoch": 3.717470657606559, "grad_norm": 1.0078125, "learning_rate": 0.00036782449124371643, "loss": 5.0088, "mean_token_accuracy": 0.21376062631607057, "num_tokens": 73879427.0, "step": 33100 }, { "entropy": 5.352679491043091, "epoch": 3.7180322345145167, "grad_norm": 1.0859375, "learning_rate": 0.00036778791695435935, "loss": 4.9877, "mean_token_accuracy": 0.21826017498970032, "num_tokens": 73890369.0, "step": 33105 }, { "entropy": 5.373785972595215, "epoch": 3.7185938114224744, "grad_norm": 0.98828125, "learning_rate": 0.00036775133971059904, "loss": 5.0597, "mean_token_accuracy": 0.21338299214839934, "num_tokens": 73902524.0, "step": 33110 }, { "entropy": 5.252890586853027, "epoch": 3.7191553883304316, "grad_norm": 0.984375, "learning_rate": 0.0003677147595136001, "loss": 4.8981, "mean_token_accuracy": 0.22793618589639664, "num_tokens": 73912163.0, "step": 33115 }, { "entropy": 5.332184553146362, "epoch": 3.7197169652383892, "grad_norm": 1.0, "learning_rate": 0.00036767817636452723, "loss": 4.92, "mean_token_accuracy": 0.2240413546562195, "num_tokens": 73923238.0, "step": 33120 }, { "entropy": 5.359105348587036, "epoch": 3.720278542146347, "grad_norm": 0.9453125, "learning_rate": 0.00036764159026454534, "loss": 5.0133, "mean_token_accuracy": 0.22455979734659196, "num_tokens": 73933833.0, "step": 33125 }, { "entropy": 5.380781126022339, "epoch": 3.7208401190543046, "grad_norm": 0.9375, "learning_rate": 0.0003676050012148193, "loss": 5.0358, "mean_token_accuracy": 0.21501425206661223, "num_tokens": 73944850.0, "step": 33130 }, { "entropy": 5.404418849945069, "epoch": 3.7214016959622622, "grad_norm": 0.98828125, "learning_rate": 0.000367568409216514, "loss": 5.0488, "mean_token_accuracy": 0.21749613881111146, "num_tokens": 73954490.0, "step": 33135 }, { "entropy": 5.382616853713989, "epoch": 3.7219632728702194, "grad_norm": 1.078125, "learning_rate": 0.0003675318142707947, "loss": 5.0378, "mean_token_accuracy": 0.21134851276874542, "num_tokens": 73966250.0, "step": 33140 }, { "entropy": 5.375850248336792, "epoch": 3.722524849778177, "grad_norm": 0.9921875, "learning_rate": 0.0003674952163788266, "loss": 4.9172, "mean_token_accuracy": 0.22044012397527696, "num_tokens": 73976931.0, "step": 33145 }, { "entropy": 5.35321159362793, "epoch": 3.7230864266861348, "grad_norm": 0.91796875, "learning_rate": 0.00036745861554177486, "loss": 5.0624, "mean_token_accuracy": 0.21140566915273667, "num_tokens": 73989813.0, "step": 33150 }, { "entropy": 5.2578624248504635, "epoch": 3.723648003594092, "grad_norm": 0.984375, "learning_rate": 0.00036742201176080496, "loss": 4.8687, "mean_token_accuracy": 0.22542916983366013, "num_tokens": 74000961.0, "step": 33155 }, { "entropy": 5.335231018066406, "epoch": 3.7242095805020496, "grad_norm": 1.0234375, "learning_rate": 0.0003673854050370824, "loss": 4.9627, "mean_token_accuracy": 0.2200678989291191, "num_tokens": 74011717.0, "step": 33160 }, { "entropy": 5.269906330108642, "epoch": 3.7247711574100073, "grad_norm": 1.0078125, "learning_rate": 0.00036734879537177276, "loss": 4.938, "mean_token_accuracy": 0.2181604191660881, "num_tokens": 74022931.0, "step": 33165 }, { "entropy": 5.253876495361328, "epoch": 3.725332734317965, "grad_norm": 1.0234375, "learning_rate": 0.0003673121827660415, "loss": 4.8585, "mean_token_accuracy": 0.2228327661752701, "num_tokens": 74033110.0, "step": 33170 }, { "entropy": 5.28944993019104, "epoch": 3.7258943112259226, "grad_norm": 0.9765625, "learning_rate": 0.00036727556722105465, "loss": 4.9097, "mean_token_accuracy": 0.21708866059780121, "num_tokens": 74043694.0, "step": 33175 }, { "entropy": 5.341071939468383, "epoch": 3.72645588813388, "grad_norm": 0.9921875, "learning_rate": 0.00036723894873797786, "loss": 4.9218, "mean_token_accuracy": 0.2255815491080284, "num_tokens": 74053997.0, "step": 33180 }, { "entropy": 5.352702856063843, "epoch": 3.7270174650418375, "grad_norm": 1.0546875, "learning_rate": 0.00036720232731797726, "loss": 5.0736, "mean_token_accuracy": 0.2094803422689438, "num_tokens": 74065562.0, "step": 33185 }, { "entropy": 5.455473184585571, "epoch": 3.727579041949795, "grad_norm": 0.94921875, "learning_rate": 0.00036716570296221873, "loss": 5.0896, "mean_token_accuracy": 0.215694397687912, "num_tokens": 74075988.0, "step": 33190 }, { "entropy": 5.346100187301635, "epoch": 3.7281406188577524, "grad_norm": 0.9375, "learning_rate": 0.00036712907567186857, "loss": 4.9829, "mean_token_accuracy": 0.21989684998989106, "num_tokens": 74087644.0, "step": 33195 }, { "entropy": 5.381581354141235, "epoch": 3.72870219576571, "grad_norm": 1.015625, "learning_rate": 0.0003670924454480928, "loss": 5.0271, "mean_token_accuracy": 0.21901889592409135, "num_tokens": 74097841.0, "step": 33200 }, { "entropy": 5.3245875358581545, "epoch": 3.7292637726736677, "grad_norm": 0.89453125, "learning_rate": 0.0003670558122920579, "loss": 4.9895, "mean_token_accuracy": 0.21664955466985703, "num_tokens": 74108164.0, "step": 33205 }, { "entropy": 5.341843700408935, "epoch": 3.729825349581625, "grad_norm": 0.9296875, "learning_rate": 0.00036701917620493026, "loss": 5.0012, "mean_token_accuracy": 0.21712402999401093, "num_tokens": 74120456.0, "step": 33210 }, { "entropy": 5.372651624679565, "epoch": 3.7303869264895826, "grad_norm": 0.94921875, "learning_rate": 0.0003669825371878764, "loss": 5.0909, "mean_token_accuracy": 0.2175146982073784, "num_tokens": 74131023.0, "step": 33215 }, { "entropy": 5.364157199859619, "epoch": 3.7309485033975403, "grad_norm": 1.1015625, "learning_rate": 0.00036694589524206275, "loss": 5.0757, "mean_token_accuracy": 0.2126437708735466, "num_tokens": 74141654.0, "step": 33220 }, { "entropy": 5.32896876335144, "epoch": 3.731510080305498, "grad_norm": 1.03125, "learning_rate": 0.0003669092503686562, "loss": 4.9735, "mean_token_accuracy": 0.2169465020298958, "num_tokens": 74152972.0, "step": 33225 }, { "entropy": 5.38514347076416, "epoch": 3.7320716572134556, "grad_norm": 1.0546875, "learning_rate": 0.00036687260256882347, "loss": 4.9929, "mean_token_accuracy": 0.212835593521595, "num_tokens": 74164725.0, "step": 33230 }, { "entropy": 5.251781749725342, "epoch": 3.732633234121413, "grad_norm": 0.94921875, "learning_rate": 0.00036683595184373147, "loss": 4.8927, "mean_token_accuracy": 0.2249404937028885, "num_tokens": 74175356.0, "step": 33235 }, { "entropy": 5.232719564437867, "epoch": 3.7331948110293705, "grad_norm": 0.92578125, "learning_rate": 0.0003667992981945471, "loss": 4.897, "mean_token_accuracy": 0.22304559201002122, "num_tokens": 74186418.0, "step": 33240 }, { "entropy": 5.261322641372681, "epoch": 3.733756387937328, "grad_norm": 0.94921875, "learning_rate": 0.00036676264162243744, "loss": 4.9411, "mean_token_accuracy": 0.21695178598165513, "num_tokens": 74199236.0, "step": 33245 }, { "entropy": 5.332357549667359, "epoch": 3.7343179648452853, "grad_norm": 0.99609375, "learning_rate": 0.0003667259821285698, "loss": 4.9399, "mean_token_accuracy": 0.2279285177588463, "num_tokens": 74211475.0, "step": 33250 }, { "entropy": 5.2971068859100345, "epoch": 3.734879541753243, "grad_norm": 0.9296875, "learning_rate": 0.0003666893197141112, "loss": 4.9, "mean_token_accuracy": 0.22825241684913636, "num_tokens": 74223909.0, "step": 33255 }, { "entropy": 5.385779333114624, "epoch": 3.7354411186612007, "grad_norm": 0.93359375, "learning_rate": 0.0003666526543802291, "loss": 5.0816, "mean_token_accuracy": 0.2069343939423561, "num_tokens": 74235060.0, "step": 33260 }, { "entropy": 5.326198148727417, "epoch": 3.7360026955691583, "grad_norm": 0.9609375, "learning_rate": 0.000366615986128091, "loss": 4.937, "mean_token_accuracy": 0.21986895501613618, "num_tokens": 74245930.0, "step": 33265 }, { "entropy": 5.330064201354981, "epoch": 3.736564272477116, "grad_norm": 1.1015625, "learning_rate": 0.0003665793149588644, "loss": 5.0227, "mean_token_accuracy": 0.20789432376623154, "num_tokens": 74257337.0, "step": 33270 }, { "entropy": 5.274132490158081, "epoch": 3.737125849385073, "grad_norm": 0.9609375, "learning_rate": 0.00036654264087371686, "loss": 4.9112, "mean_token_accuracy": 0.22381270080804824, "num_tokens": 74268217.0, "step": 33275 }, { "entropy": 5.296833133697509, "epoch": 3.737687426293031, "grad_norm": 0.90234375, "learning_rate": 0.00036650596387381615, "loss": 5.008, "mean_token_accuracy": 0.2140057548880577, "num_tokens": 74279842.0, "step": 33280 }, { "entropy": 5.343124914169311, "epoch": 3.7382490032009885, "grad_norm": 1.0078125, "learning_rate": 0.00036646928396033, "loss": 5.0266, "mean_token_accuracy": 0.21006491035223007, "num_tokens": 74292328.0, "step": 33285 }, { "entropy": 5.418448543548584, "epoch": 3.7388105801089457, "grad_norm": 0.94140625, "learning_rate": 0.00036643260113442634, "loss": 5.0189, "mean_token_accuracy": 0.21710605919361115, "num_tokens": 74302706.0, "step": 33290 }, { "entropy": 5.463385725021363, "epoch": 3.7393721570169034, "grad_norm": 0.9921875, "learning_rate": 0.0003663959153972732, "loss": 5.0878, "mean_token_accuracy": 0.20936229974031448, "num_tokens": 74314320.0, "step": 33295 }, { "entropy": 5.280169582366943, "epoch": 3.739933733924861, "grad_norm": 0.96875, "learning_rate": 0.0003663592267500388, "loss": 4.8488, "mean_token_accuracy": 0.22713393419981004, "num_tokens": 74325324.0, "step": 33300 }, { "entropy": 5.324476194381714, "epoch": 3.7404953108328187, "grad_norm": 0.9921875, "learning_rate": 0.0003663225351938911, "loss": 5.0578, "mean_token_accuracy": 0.21340576112270354, "num_tokens": 74337623.0, "step": 33305 }, { "entropy": 5.2844452381134035, "epoch": 3.741056887740776, "grad_norm": 1.140625, "learning_rate": 0.0003662858407299984, "loss": 4.8968, "mean_token_accuracy": 0.2189347431063652, "num_tokens": 74348971.0, "step": 33310 }, { "entropy": 5.332478046417236, "epoch": 3.7416184646487336, "grad_norm": 0.92578125, "learning_rate": 0.00036624914335952924, "loss": 5.0307, "mean_token_accuracy": 0.2137461468577385, "num_tokens": 74360162.0, "step": 33315 }, { "entropy": 5.4756755352020265, "epoch": 3.7421800415566913, "grad_norm": 1.0078125, "learning_rate": 0.00036621244308365195, "loss": 5.111, "mean_token_accuracy": 0.2141265019774437, "num_tokens": 74371180.0, "step": 33320 }, { "entropy": 5.328403806686401, "epoch": 3.742741618464649, "grad_norm": 0.98828125, "learning_rate": 0.00036617573990353503, "loss": 4.9736, "mean_token_accuracy": 0.21520985662937164, "num_tokens": 74382854.0, "step": 33325 }, { "entropy": 5.348351240158081, "epoch": 3.743303195372606, "grad_norm": 0.91796875, "learning_rate": 0.0003661390338203472, "loss": 5.1179, "mean_token_accuracy": 0.20596520602703094, "num_tokens": 74394266.0, "step": 33330 }, { "entropy": 5.41334228515625, "epoch": 3.743864772280564, "grad_norm": 0.8515625, "learning_rate": 0.0003661023248352572, "loss": 5.1181, "mean_token_accuracy": 0.20705696940422058, "num_tokens": 74406275.0, "step": 33335 }, { "entropy": 5.340884399414063, "epoch": 3.7444263491885215, "grad_norm": 1.015625, "learning_rate": 0.0003660656129494339, "loss": 4.9422, "mean_token_accuracy": 0.21584748178720475, "num_tokens": 74417150.0, "step": 33340 }, { "entropy": 5.318228340148925, "epoch": 3.7449879260964787, "grad_norm": 1.03125, "learning_rate": 0.00036602889816404613, "loss": 4.9312, "mean_token_accuracy": 0.2254180908203125, "num_tokens": 74427997.0, "step": 33345 }, { "entropy": 5.397578144073487, "epoch": 3.7455495030044363, "grad_norm": 0.9921875, "learning_rate": 0.00036599218048026294, "loss": 5.0845, "mean_token_accuracy": 0.20841658264398574, "num_tokens": 74439278.0, "step": 33350 }, { "entropy": 5.363477182388306, "epoch": 3.746111079912394, "grad_norm": 1.0078125, "learning_rate": 0.00036595545989925345, "loss": 5.0211, "mean_token_accuracy": 0.21666987538337706, "num_tokens": 74450372.0, "step": 33355 }, { "entropy": 5.350135421752929, "epoch": 3.7466726568203517, "grad_norm": 1.0, "learning_rate": 0.00036591873642218676, "loss": 4.9544, "mean_token_accuracy": 0.22061900645494462, "num_tokens": 74460040.0, "step": 33360 }, { "entropy": 5.364750528335572, "epoch": 3.7472342337283093, "grad_norm": 1.015625, "learning_rate": 0.00036588201005023223, "loss": 5.0255, "mean_token_accuracy": 0.22008373141288756, "num_tokens": 74472291.0, "step": 33365 }, { "entropy": 5.375980424880981, "epoch": 3.7477958106362665, "grad_norm": 1.015625, "learning_rate": 0.0003658452807845593, "loss": 5.0109, "mean_token_accuracy": 0.21814474761486052, "num_tokens": 74482373.0, "step": 33370 }, { "entropy": 5.3062193393707275, "epoch": 3.748357387544224, "grad_norm": 1.0, "learning_rate": 0.00036580854862633747, "loss": 4.9884, "mean_token_accuracy": 0.2239741101861, "num_tokens": 74494240.0, "step": 33375 }, { "entropy": 5.390754461288452, "epoch": 3.748918964452182, "grad_norm": 0.9296875, "learning_rate": 0.0003657718135767362, "loss": 5.0297, "mean_token_accuracy": 0.22130923569202424, "num_tokens": 74504505.0, "step": 33380 }, { "entropy": 5.35042142868042, "epoch": 3.749480541360139, "grad_norm": 1.1171875, "learning_rate": 0.0003657350756369251, "loss": 4.9403, "mean_token_accuracy": 0.22672809958457946, "num_tokens": 74515467.0, "step": 33385 }, { "entropy": 5.297260427474976, "epoch": 3.7500421182680967, "grad_norm": 0.984375, "learning_rate": 0.00036569833480807403, "loss": 4.9639, "mean_token_accuracy": 0.21923446357250215, "num_tokens": 74527502.0, "step": 33390 }, { "entropy": 5.366000127792359, "epoch": 3.7506036951760544, "grad_norm": 1.1015625, "learning_rate": 0.0003656615910913528, "loss": 5.0301, "mean_token_accuracy": 0.2117556244134903, "num_tokens": 74539491.0, "step": 33395 }, { "entropy": 5.376784420013427, "epoch": 3.751165272084012, "grad_norm": 0.9296875, "learning_rate": 0.00036562484448793135, "loss": 5.0122, "mean_token_accuracy": 0.2131249025464058, "num_tokens": 74550847.0, "step": 33400 }, { "entropy": 5.390685033798218, "epoch": 3.7517268489919693, "grad_norm": 0.9296875, "learning_rate": 0.0003655880949989798, "loss": 4.9941, "mean_token_accuracy": 0.21781370788812637, "num_tokens": 74561180.0, "step": 33405 }, { "entropy": 5.380361890792846, "epoch": 3.752288425899927, "grad_norm": 1.0859375, "learning_rate": 0.00036555134262566806, "loss": 5.0522, "mean_token_accuracy": 0.21683878004550933, "num_tokens": 74571557.0, "step": 33410 }, { "entropy": 5.346853828430175, "epoch": 3.7528500028078846, "grad_norm": 0.953125, "learning_rate": 0.0003655145873691665, "loss": 5.0338, "mean_token_accuracy": 0.21237218081951142, "num_tokens": 74582614.0, "step": 33415 }, { "entropy": 5.294654321670532, "epoch": 3.7534115797158423, "grad_norm": 1.0234375, "learning_rate": 0.00036547782923064537, "loss": 4.9956, "mean_token_accuracy": 0.21536062210798262, "num_tokens": 74593176.0, "step": 33420 }, { "entropy": 5.338423156738282, "epoch": 3.7539731566237995, "grad_norm": 0.890625, "learning_rate": 0.00036544106821127505, "loss": 4.8869, "mean_token_accuracy": 0.22635134011507035, "num_tokens": 74604601.0, "step": 33425 }, { "entropy": 5.401857376098633, "epoch": 3.754534733531757, "grad_norm": 0.92578125, "learning_rate": 0.000365404304312226, "loss": 5.0879, "mean_token_accuracy": 0.20920022577047348, "num_tokens": 74615591.0, "step": 33430 }, { "entropy": 5.330974483489991, "epoch": 3.755096310439715, "grad_norm": 1.0, "learning_rate": 0.00036536753753466897, "loss": 4.9226, "mean_token_accuracy": 0.21911484152078628, "num_tokens": 74626905.0, "step": 33435 }, { "entropy": 5.379442501068115, "epoch": 3.755657887347672, "grad_norm": 0.97265625, "learning_rate": 0.0003653307678797744, "loss": 5.0224, "mean_token_accuracy": 0.21501513868570327, "num_tokens": 74638201.0, "step": 33440 }, { "entropy": 5.348442697525025, "epoch": 3.7562194642556297, "grad_norm": 1.015625, "learning_rate": 0.0003652939953487131, "loss": 5.0602, "mean_token_accuracy": 0.21413756012916565, "num_tokens": 74649121.0, "step": 33445 }, { "entropy": 5.295163631439209, "epoch": 3.7567810411635874, "grad_norm": 1.0546875, "learning_rate": 0.00036525721994265606, "loss": 4.8914, "mean_token_accuracy": 0.2232422947883606, "num_tokens": 74659482.0, "step": 33450 }, { "entropy": 5.243085956573486, "epoch": 3.757342618071545, "grad_norm": 1.0546875, "learning_rate": 0.0003652204416627741, "loss": 4.8931, "mean_token_accuracy": 0.2254742830991745, "num_tokens": 74671587.0, "step": 33455 }, { "entropy": 5.362754487991333, "epoch": 3.7579041949795027, "grad_norm": 1.0234375, "learning_rate": 0.00036518366051023824, "loss": 4.9895, "mean_token_accuracy": 0.21980946958065034, "num_tokens": 74682753.0, "step": 33460 }, { "entropy": 5.311546516418457, "epoch": 3.75846577188746, "grad_norm": 0.984375, "learning_rate": 0.0003651468764862197, "loss": 4.9477, "mean_token_accuracy": 0.21651186048984528, "num_tokens": 74692670.0, "step": 33465 }, { "entropy": 5.282718372344971, "epoch": 3.7590273487954176, "grad_norm": 0.9921875, "learning_rate": 0.00036511008959188966, "loss": 5.0411, "mean_token_accuracy": 0.2124329388141632, "num_tokens": 74703832.0, "step": 33470 }, { "entropy": 5.329083013534546, "epoch": 3.759588925703375, "grad_norm": 0.9921875, "learning_rate": 0.00036507329982841935, "loss": 4.9308, "mean_token_accuracy": 0.2222157284617424, "num_tokens": 74716577.0, "step": 33475 }, { "entropy": 5.399462413787842, "epoch": 3.7601505026113324, "grad_norm": 0.94140625, "learning_rate": 0.0003650365071969803, "loss": 5.0387, "mean_token_accuracy": 0.21427347958087922, "num_tokens": 74727458.0, "step": 33480 }, { "entropy": 5.269257640838623, "epoch": 3.76071207951929, "grad_norm": 0.9609375, "learning_rate": 0.0003649997116987439, "loss": 4.8786, "mean_token_accuracy": 0.22561454325914382, "num_tokens": 74739049.0, "step": 33485 }, { "entropy": 5.314712762832642, "epoch": 3.7612736564272478, "grad_norm": 1.0625, "learning_rate": 0.0003649629133348818, "loss": 5.0358, "mean_token_accuracy": 0.22253775149583815, "num_tokens": 74749509.0, "step": 33490 }, { "entropy": 5.360621356964112, "epoch": 3.7618352333352054, "grad_norm": 0.8828125, "learning_rate": 0.00036492611210656574, "loss": 4.9868, "mean_token_accuracy": 0.22151993960142136, "num_tokens": 74762067.0, "step": 33495 }, { "entropy": 5.351818323135376, "epoch": 3.7623968102431626, "grad_norm": 0.96484375, "learning_rate": 0.0003648893080149673, "loss": 4.9972, "mean_token_accuracy": 0.2268408939242363, "num_tokens": 74773106.0, "step": 33500 }, { "entropy": 5.371072101593017, "epoch": 3.7629583871511203, "grad_norm": 0.8984375, "learning_rate": 0.00036485250106125844, "loss": 5.0792, "mean_token_accuracy": 0.21341005861759185, "num_tokens": 74785464.0, "step": 33505 }, { "entropy": 5.363032436370849, "epoch": 3.763519964059078, "grad_norm": 1.0234375, "learning_rate": 0.000364815691246611, "loss": 4.9631, "mean_token_accuracy": 0.21929049491882324, "num_tokens": 74795939.0, "step": 33510 }, { "entropy": 5.315131044387817, "epoch": 3.7640815409670356, "grad_norm": 0.97265625, "learning_rate": 0.00036477887857219726, "loss": 4.9831, "mean_token_accuracy": 0.22232548594474794, "num_tokens": 74807036.0, "step": 33515 }, { "entropy": 5.3474085330963135, "epoch": 3.764643117874993, "grad_norm": 1.015625, "learning_rate": 0.00036474206303918914, "loss": 5.0033, "mean_token_accuracy": 0.21888236999511718, "num_tokens": 74818402.0, "step": 33520 }, { "entropy": 5.324261093139649, "epoch": 3.7652046947829505, "grad_norm": 0.96875, "learning_rate": 0.000364705244648759, "loss": 4.9814, "mean_token_accuracy": 0.21829487085342408, "num_tokens": 74830246.0, "step": 33525 }, { "entropy": 5.29680290222168, "epoch": 3.765766271690908, "grad_norm": 0.953125, "learning_rate": 0.0003646684234020789, "loss": 4.9269, "mean_token_accuracy": 0.2230500802397728, "num_tokens": 74840690.0, "step": 33530 }, { "entropy": 5.39497480392456, "epoch": 3.7663278485988654, "grad_norm": 1.0, "learning_rate": 0.00036463159930032163, "loss": 4.9449, "mean_token_accuracy": 0.23221812695264815, "num_tokens": 74851807.0, "step": 33535 }, { "entropy": 5.326076364517212, "epoch": 3.766889425506823, "grad_norm": 0.9609375, "learning_rate": 0.00036459477234465935, "loss": 4.9689, "mean_token_accuracy": 0.22159538716077803, "num_tokens": 74863028.0, "step": 33540 }, { "entropy": 5.3141998767852785, "epoch": 3.7674510024147807, "grad_norm": 0.87109375, "learning_rate": 0.00036455794253626486, "loss": 4.9517, "mean_token_accuracy": 0.22445466071367265, "num_tokens": 74874674.0, "step": 33545 }, { "entropy": 5.386721134185791, "epoch": 3.7680125793227384, "grad_norm": 0.99609375, "learning_rate": 0.00036452110987631066, "loss": 5.0369, "mean_token_accuracy": 0.20978295356035231, "num_tokens": 74885791.0, "step": 33550 }, { "entropy": 5.347938585281372, "epoch": 3.768574156230696, "grad_norm": 1.03125, "learning_rate": 0.00036448427436596966, "loss": 4.9916, "mean_token_accuracy": 0.21809386909008027, "num_tokens": 74897422.0, "step": 33555 }, { "entropy": 5.37655611038208, "epoch": 3.7691357331386532, "grad_norm": 0.9453125, "learning_rate": 0.0003644474360064146, "loss": 4.9799, "mean_token_accuracy": 0.21207889914512634, "num_tokens": 74908680.0, "step": 33560 }, { "entropy": 5.339879322052002, "epoch": 3.769697310046611, "grad_norm": 1.0625, "learning_rate": 0.0003644105947988185, "loss": 4.9864, "mean_token_accuracy": 0.22338478714227678, "num_tokens": 74919573.0, "step": 33565 }, { "entropy": 5.300648260116577, "epoch": 3.7702588869545686, "grad_norm": 0.9609375, "learning_rate": 0.00036437375074435446, "loss": 4.9355, "mean_token_accuracy": 0.2191333070397377, "num_tokens": 74930507.0, "step": 33570 }, { "entropy": 5.329343461990357, "epoch": 3.770820463862526, "grad_norm": 1.03125, "learning_rate": 0.0003643369038441955, "loss": 4.9225, "mean_token_accuracy": 0.21918968707323075, "num_tokens": 74942436.0, "step": 33575 }, { "entropy": 5.215061664581299, "epoch": 3.7713820407704834, "grad_norm": 1.0078125, "learning_rate": 0.00036430005409951476, "loss": 4.873, "mean_token_accuracy": 0.22794498652219772, "num_tokens": 74953717.0, "step": 33580 }, { "entropy": 5.327362394332885, "epoch": 3.771943617678441, "grad_norm": 1.0, "learning_rate": 0.00036426320151148575, "loss": 5.0179, "mean_token_accuracy": 0.2222522810101509, "num_tokens": 74963878.0, "step": 33585 }, { "entropy": 5.360372018814087, "epoch": 3.7725051945863988, "grad_norm": 0.921875, "learning_rate": 0.00036422634608128184, "loss": 4.9314, "mean_token_accuracy": 0.2316638022661209, "num_tokens": 74976239.0, "step": 33590 }, { "entropy": 5.3766467571258545, "epoch": 3.773066771494356, "grad_norm": 1.0625, "learning_rate": 0.00036418948781007636, "loss": 5.0333, "mean_token_accuracy": 0.21437846422195433, "num_tokens": 74987694.0, "step": 33595 }, { "entropy": 5.379682302474976, "epoch": 3.7736283484023136, "grad_norm": 0.96484375, "learning_rate": 0.00036415262669904305, "loss": 4.9507, "mean_token_accuracy": 0.21898936480283737, "num_tokens": 74998514.0, "step": 33600 }, { "entropy": 5.386404418945313, "epoch": 3.7741899253102713, "grad_norm": 0.9765625, "learning_rate": 0.00036411576274935546, "loss": 4.9899, "mean_token_accuracy": 0.21745138317346574, "num_tokens": 75010438.0, "step": 33605 }, { "entropy": 5.287320327758789, "epoch": 3.774751502218229, "grad_norm": 0.96484375, "learning_rate": 0.00036407889596218757, "loss": 4.8976, "mean_token_accuracy": 0.2214828610420227, "num_tokens": 75021280.0, "step": 33610 }, { "entropy": 5.262604761123657, "epoch": 3.775313079126186, "grad_norm": 0.98828125, "learning_rate": 0.000364042026338713, "loss": 4.9107, "mean_token_accuracy": 0.22415657192468644, "num_tokens": 75032746.0, "step": 33615 }, { "entropy": 5.374963903427124, "epoch": 3.775874656034144, "grad_norm": 0.8828125, "learning_rate": 0.00036400515388010574, "loss": 5.0946, "mean_token_accuracy": 0.21346224546432496, "num_tokens": 75044227.0, "step": 33620 }, { "entropy": 5.435530281066894, "epoch": 3.7764362329421015, "grad_norm": 1.015625, "learning_rate": 0.0003639682785875399, "loss": 5.0884, "mean_token_accuracy": 0.21298457235097884, "num_tokens": 75053974.0, "step": 33625 }, { "entropy": 5.30731086730957, "epoch": 3.7769978098500587, "grad_norm": 0.93359375, "learning_rate": 0.00036393140046218957, "loss": 4.9273, "mean_token_accuracy": 0.2232253447175026, "num_tokens": 75064539.0, "step": 33630 }, { "entropy": 5.341500663757325, "epoch": 3.7775593867580164, "grad_norm": 0.8671875, "learning_rate": 0.00036389451950522895, "loss": 4.943, "mean_token_accuracy": 0.2232791781425476, "num_tokens": 75075229.0, "step": 33635 }, { "entropy": 5.416627311706543, "epoch": 3.778120963665974, "grad_norm": 1.0390625, "learning_rate": 0.00036385763571783236, "loss": 5.0335, "mean_token_accuracy": 0.21555475443601607, "num_tokens": 75085347.0, "step": 33640 }, { "entropy": 5.388874626159668, "epoch": 3.7786825405739317, "grad_norm": 1.046875, "learning_rate": 0.0003638207491011742, "loss": 4.9859, "mean_token_accuracy": 0.221958926320076, "num_tokens": 75096141.0, "step": 33645 }, { "entropy": 5.337704038619995, "epoch": 3.7792441174818894, "grad_norm": 0.96875, "learning_rate": 0.0003637838596564289, "loss": 4.9482, "mean_token_accuracy": 0.2268048956990242, "num_tokens": 75107749.0, "step": 33650 }, { "entropy": 5.326472902297974, "epoch": 3.7798056943898466, "grad_norm": 0.98046875, "learning_rate": 0.00036374696738477105, "loss": 5.0031, "mean_token_accuracy": 0.21911714673042298, "num_tokens": 75118644.0, "step": 33655 }, { "entropy": 5.297040224075317, "epoch": 3.7803672712978043, "grad_norm": 0.953125, "learning_rate": 0.0003637100722873754, "loss": 5.0331, "mean_token_accuracy": 0.2139420837163925, "num_tokens": 75130534.0, "step": 33660 }, { "entropy": 5.410743761062622, "epoch": 3.780928848205762, "grad_norm": 0.921875, "learning_rate": 0.0003636731743654166, "loss": 4.9438, "mean_token_accuracy": 0.22056004106998445, "num_tokens": 75142159.0, "step": 33665 }, { "entropy": 5.380608797073364, "epoch": 3.781490425113719, "grad_norm": 1.0, "learning_rate": 0.00036363627362006955, "loss": 4.9388, "mean_token_accuracy": 0.2237120106816292, "num_tokens": 75153603.0, "step": 33670 }, { "entropy": 5.260287094116211, "epoch": 3.782052002021677, "grad_norm": 1.015625, "learning_rate": 0.0003635993700525092, "loss": 4.9279, "mean_token_accuracy": 0.22387394607067107, "num_tokens": 75164538.0, "step": 33675 }, { "entropy": 5.337713527679443, "epoch": 3.7826135789296345, "grad_norm": 0.94140625, "learning_rate": 0.00036356246366391054, "loss": 5.0384, "mean_token_accuracy": 0.21903070360422133, "num_tokens": 75175030.0, "step": 33680 }, { "entropy": 5.457322597503662, "epoch": 3.783175155837592, "grad_norm": 1.0, "learning_rate": 0.00036352555445544864, "loss": 5.0442, "mean_token_accuracy": 0.22232666462659836, "num_tokens": 75187116.0, "step": 33685 }, { "entropy": 5.386841106414795, "epoch": 3.78373673274555, "grad_norm": 1.0078125, "learning_rate": 0.00036348864242829874, "loss": 4.954, "mean_token_accuracy": 0.22358518987894058, "num_tokens": 75197247.0, "step": 33690 }, { "entropy": 5.269994306564331, "epoch": 3.784298309653507, "grad_norm": 0.984375, "learning_rate": 0.00036345172758363623, "loss": 4.9959, "mean_token_accuracy": 0.2207615166902542, "num_tokens": 75208531.0, "step": 33695 }, { "entropy": 5.326676845550537, "epoch": 3.7848598865614647, "grad_norm": 0.9921875, "learning_rate": 0.0003634148099226364, "loss": 5.06, "mean_token_accuracy": 0.2155129238963127, "num_tokens": 75221061.0, "step": 33700 }, { "entropy": 5.359136629104614, "epoch": 3.7854214634694223, "grad_norm": 0.94921875, "learning_rate": 0.00036337788944647466, "loss": 4.9551, "mean_token_accuracy": 0.22132600098848343, "num_tokens": 75232897.0, "step": 33705 }, { "entropy": 5.4366497039794925, "epoch": 3.7859830403773795, "grad_norm": 0.88671875, "learning_rate": 0.0003633409661563267, "loss": 5.0316, "mean_token_accuracy": 0.21436087638139725, "num_tokens": 75245228.0, "step": 33710 }, { "entropy": 5.357966375350952, "epoch": 3.786544617285337, "grad_norm": 0.97265625, "learning_rate": 0.00036330404005336807, "loss": 4.9356, "mean_token_accuracy": 0.2196967974305153, "num_tokens": 75256486.0, "step": 33715 }, { "entropy": 5.302194404602051, "epoch": 3.787106194193295, "grad_norm": 0.98046875, "learning_rate": 0.0003632671111387746, "loss": 4.9502, "mean_token_accuracy": 0.22759285420179368, "num_tokens": 75266439.0, "step": 33720 }, { "entropy": 5.346197843551636, "epoch": 3.787667771101252, "grad_norm": 1.03125, "learning_rate": 0.00036323017941372203, "loss": 4.9862, "mean_token_accuracy": 0.22110812813043595, "num_tokens": 75276550.0, "step": 33725 }, { "entropy": 5.291669654846191, "epoch": 3.7882293480092097, "grad_norm": 1.0234375, "learning_rate": 0.0003631932448793864, "loss": 4.989, "mean_token_accuracy": 0.21875206679105758, "num_tokens": 75287061.0, "step": 33730 }, { "entropy": 5.375171518325805, "epoch": 3.7887909249171674, "grad_norm": 1.0078125, "learning_rate": 0.0003631563075369436, "loss": 4.9997, "mean_token_accuracy": 0.21434696912765502, "num_tokens": 75298393.0, "step": 33735 }, { "entropy": 5.341448211669922, "epoch": 3.789352501825125, "grad_norm": 1.046875, "learning_rate": 0.00036311936738756977, "loss": 4.9261, "mean_token_accuracy": 0.21580106168985366, "num_tokens": 75308153.0, "step": 33740 }, { "entropy": 5.279288053512573, "epoch": 3.7899140787330827, "grad_norm": 0.8984375, "learning_rate": 0.0003630824244324411, "loss": 4.8831, "mean_token_accuracy": 0.22393419742584228, "num_tokens": 75319383.0, "step": 33745 }, { "entropy": 5.357103252410889, "epoch": 3.79047565564104, "grad_norm": 0.953125, "learning_rate": 0.0003630454786727339, "loss": 4.9824, "mean_token_accuracy": 0.21319998502731324, "num_tokens": 75329736.0, "step": 33750 }, { "entropy": 5.450018119812012, "epoch": 3.7910372325489976, "grad_norm": 0.96484375, "learning_rate": 0.0003630085301096245, "loss": 5.1023, "mean_token_accuracy": 0.20908478200435637, "num_tokens": 75341451.0, "step": 33755 }, { "entropy": 5.242102336883545, "epoch": 3.7915988094569553, "grad_norm": 0.9140625, "learning_rate": 0.00036297157874428933, "loss": 4.8568, "mean_token_accuracy": 0.2239123538136482, "num_tokens": 75352664.0, "step": 33760 }, { "entropy": 5.339789152145386, "epoch": 3.7921603863649125, "grad_norm": 0.90625, "learning_rate": 0.00036293462457790505, "loss": 5.0448, "mean_token_accuracy": 0.20972893089056016, "num_tokens": 75362847.0, "step": 33765 }, { "entropy": 5.329607057571411, "epoch": 3.79272196327287, "grad_norm": 0.9375, "learning_rate": 0.00036289766761164814, "loss": 5.0253, "mean_token_accuracy": 0.21408329755067826, "num_tokens": 75373344.0, "step": 33770 }, { "entropy": 5.312130117416382, "epoch": 3.793283540180828, "grad_norm": 0.9921875, "learning_rate": 0.00036286070784669543, "loss": 4.975, "mean_token_accuracy": 0.21716601103544236, "num_tokens": 75384262.0, "step": 33775 }, { "entropy": 5.409479331970215, "epoch": 3.7938451170887855, "grad_norm": 0.99609375, "learning_rate": 0.00036282374528422373, "loss": 5.026, "mean_token_accuracy": 0.22436884939670562, "num_tokens": 75395817.0, "step": 33780 }, { "entropy": 5.294265556335449, "epoch": 3.794406693996743, "grad_norm": 1.0234375, "learning_rate": 0.00036278677992540993, "loss": 4.9037, "mean_token_accuracy": 0.22832961678504943, "num_tokens": 75406452.0, "step": 33785 }, { "entropy": 5.3391355037689205, "epoch": 3.7949682709047003, "grad_norm": 0.984375, "learning_rate": 0.000362749811771431, "loss": 4.9948, "mean_token_accuracy": 0.21619293093681335, "num_tokens": 75418638.0, "step": 33790 }, { "entropy": 5.393720388412476, "epoch": 3.795529847812658, "grad_norm": 0.8984375, "learning_rate": 0.0003627128408234641, "loss": 4.9979, "mean_token_accuracy": 0.2214144378900528, "num_tokens": 75430024.0, "step": 33795 }, { "entropy": 5.419979238510132, "epoch": 3.7960914247206157, "grad_norm": 0.8984375, "learning_rate": 0.0003626758670826861, "loss": 5.141, "mean_token_accuracy": 0.2130550280213356, "num_tokens": 75442641.0, "step": 33800 }, { "entropy": 5.394854545593262, "epoch": 3.796653001628573, "grad_norm": 0.97265625, "learning_rate": 0.0003626388905502747, "loss": 5.0808, "mean_token_accuracy": 0.2144799068570137, "num_tokens": 75453245.0, "step": 33805 }, { "entropy": 5.345727586746216, "epoch": 3.7972145785365305, "grad_norm": 1.0078125, "learning_rate": 0.000362601911227407, "loss": 4.9548, "mean_token_accuracy": 0.217292220890522, "num_tokens": 75464243.0, "step": 33810 }, { "entropy": 5.343364572525024, "epoch": 3.797776155444488, "grad_norm": 1.0078125, "learning_rate": 0.0003625649291152604, "loss": 4.9869, "mean_token_accuracy": 0.2220085382461548, "num_tokens": 75474348.0, "step": 33815 }, { "entropy": 5.351348447799682, "epoch": 3.7983377323524454, "grad_norm": 1.0546875, "learning_rate": 0.00036252794421501257, "loss": 5.0602, "mean_token_accuracy": 0.22099349796772003, "num_tokens": 75486903.0, "step": 33820 }, { "entropy": 5.3609991550445555, "epoch": 3.798899309260403, "grad_norm": 0.9375, "learning_rate": 0.00036249095652784096, "loss": 4.9891, "mean_token_accuracy": 0.21950208842754365, "num_tokens": 75498198.0, "step": 33825 }, { "entropy": 5.33484115600586, "epoch": 3.7994608861683608, "grad_norm": 0.92578125, "learning_rate": 0.00036245396605492344, "loss": 5.026, "mean_token_accuracy": 0.2140579864382744, "num_tokens": 75509787.0, "step": 33830 }, { "entropy": 5.285181951522827, "epoch": 3.8000224630763184, "grad_norm": 0.97265625, "learning_rate": 0.0003624169727974376, "loss": 4.8861, "mean_token_accuracy": 0.22876724004745483, "num_tokens": 75521706.0, "step": 33835 }, { "entropy": 5.3039140701293945, "epoch": 3.800584039984276, "grad_norm": 0.98046875, "learning_rate": 0.00036237997675656167, "loss": 5.0125, "mean_token_accuracy": 0.22284515649080278, "num_tokens": 75532432.0, "step": 33840 }, { "entropy": 5.460378694534302, "epoch": 3.8011456168922333, "grad_norm": 1.015625, "learning_rate": 0.0003623429779334732, "loss": 5.097, "mean_token_accuracy": 0.20875541865825653, "num_tokens": 75543473.0, "step": 33845 }, { "entropy": 5.3762613296508786, "epoch": 3.801707193800191, "grad_norm": 0.921875, "learning_rate": 0.00036230597632935053, "loss": 4.9547, "mean_token_accuracy": 0.2239344298839569, "num_tokens": 75554065.0, "step": 33850 }, { "entropy": 5.2829936981201175, "epoch": 3.8022687707081486, "grad_norm": 1.046875, "learning_rate": 0.0003622689719453717, "loss": 4.8595, "mean_token_accuracy": 0.2276305839419365, "num_tokens": 75564823.0, "step": 33855 }, { "entropy": 5.299142551422119, "epoch": 3.802830347616106, "grad_norm": 0.88671875, "learning_rate": 0.00036223196478271495, "loss": 5.0544, "mean_token_accuracy": 0.21453292965888976, "num_tokens": 75576062.0, "step": 33860 }, { "entropy": 5.383856105804443, "epoch": 3.8033919245240635, "grad_norm": 0.921875, "learning_rate": 0.0003621949548425585, "loss": 4.9317, "mean_token_accuracy": 0.21656244844198227, "num_tokens": 75587038.0, "step": 33865 }, { "entropy": 5.360256195068359, "epoch": 3.803953501432021, "grad_norm": 0.9921875, "learning_rate": 0.000362157942126081, "loss": 4.9808, "mean_token_accuracy": 0.21545762121677398, "num_tokens": 75598306.0, "step": 33870 }, { "entropy": 5.334410667419434, "epoch": 3.804515078339979, "grad_norm": 0.90625, "learning_rate": 0.0003621209266344608, "loss": 4.9945, "mean_token_accuracy": 0.22085247933864594, "num_tokens": 75609432.0, "step": 33875 }, { "entropy": 5.2666271209716795, "epoch": 3.8050766552479365, "grad_norm": 0.984375, "learning_rate": 0.0003620839083688765, "loss": 4.8998, "mean_token_accuracy": 0.22624107599258422, "num_tokens": 75619936.0, "step": 33880 }, { "entropy": 5.372866582870484, "epoch": 3.8056382321558937, "grad_norm": 1.0078125, "learning_rate": 0.0003620468873305068, "loss": 4.9368, "mean_token_accuracy": 0.22565543949604033, "num_tokens": 75630271.0, "step": 33885 }, { "entropy": 5.330533075332641, "epoch": 3.8061998090638514, "grad_norm": 1.0390625, "learning_rate": 0.00036200986352053036, "loss": 4.9211, "mean_token_accuracy": 0.2226680338382721, "num_tokens": 75639859.0, "step": 33890 }, { "entropy": 5.326581954956055, "epoch": 3.806761385971809, "grad_norm": 0.95703125, "learning_rate": 0.00036197283694012615, "loss": 4.9595, "mean_token_accuracy": 0.22294404208660126, "num_tokens": 75650610.0, "step": 33895 }, { "entropy": 5.378152704238891, "epoch": 3.8073229628797662, "grad_norm": 1.1015625, "learning_rate": 0.0003619358075904732, "loss": 4.9711, "mean_token_accuracy": 0.21770093590021133, "num_tokens": 75661604.0, "step": 33900 }, { "entropy": 5.383124351501465, "epoch": 3.807884539787724, "grad_norm": 0.8671875, "learning_rate": 0.00036189877547275023, "loss": 5.0265, "mean_token_accuracy": 0.2166071876883507, "num_tokens": 75674173.0, "step": 33905 }, { "entropy": 5.383337736129761, "epoch": 3.8084461166956816, "grad_norm": 1.09375, "learning_rate": 0.00036186174058813666, "loss": 4.9557, "mean_token_accuracy": 0.21839091777801514, "num_tokens": 75684579.0, "step": 33910 }, { "entropy": 5.3164268970489506, "epoch": 3.8090076936036388, "grad_norm": 0.94921875, "learning_rate": 0.00036182470293781154, "loss": 4.9735, "mean_token_accuracy": 0.22771539986133577, "num_tokens": 75696022.0, "step": 33915 }, { "entropy": 5.374322319030762, "epoch": 3.8095692705115964, "grad_norm": 0.984375, "learning_rate": 0.0003617876625229543, "loss": 5.0325, "mean_token_accuracy": 0.2172514721751213, "num_tokens": 75708255.0, "step": 33920 }, { "entropy": 5.298708057403564, "epoch": 3.810130847419554, "grad_norm": 0.984375, "learning_rate": 0.0003617506193447442, "loss": 4.9033, "mean_token_accuracy": 0.2253175362944603, "num_tokens": 75719069.0, "step": 33925 }, { "entropy": 5.26147608757019, "epoch": 3.8106924243275118, "grad_norm": 0.99609375, "learning_rate": 0.0003617135734043606, "loss": 4.9129, "mean_token_accuracy": 0.22868882566690446, "num_tokens": 75730078.0, "step": 33930 }, { "entropy": 5.28793420791626, "epoch": 3.8112540012354694, "grad_norm": 1.0078125, "learning_rate": 0.0003616765247029833, "loss": 4.9334, "mean_token_accuracy": 0.21778174340724946, "num_tokens": 75741910.0, "step": 33935 }, { "entropy": 5.313697671890258, "epoch": 3.8118155781434266, "grad_norm": 0.921875, "learning_rate": 0.00036163947324179186, "loss": 5.0092, "mean_token_accuracy": 0.21482069343328475, "num_tokens": 75752261.0, "step": 33940 }, { "entropy": 5.3549542903900145, "epoch": 3.8123771550513843, "grad_norm": 1.0234375, "learning_rate": 0.00036160241902196587, "loss": 4.9699, "mean_token_accuracy": 0.21821476072072982, "num_tokens": 75762442.0, "step": 33945 }, { "entropy": 5.296267986297607, "epoch": 3.812938731959342, "grad_norm": 0.9921875, "learning_rate": 0.00036156536204468535, "loss": 4.9094, "mean_token_accuracy": 0.2197491019964218, "num_tokens": 75773550.0, "step": 33950 }, { "entropy": 5.41727499961853, "epoch": 3.813500308867299, "grad_norm": 1.2421875, "learning_rate": 0.00036152830231113013, "loss": 5.082, "mean_token_accuracy": 0.21125413626432418, "num_tokens": 75785730.0, "step": 33955 }, { "entropy": 5.2589795112609865, "epoch": 3.814061885775257, "grad_norm": 1.0390625, "learning_rate": 0.0003614912398224802, "loss": 4.7953, "mean_token_accuracy": 0.22894089818000793, "num_tokens": 75795868.0, "step": 33960 }, { "entropy": 5.313398742675782, "epoch": 3.8146234626832145, "grad_norm": 0.91796875, "learning_rate": 0.0003614541745799156, "loss": 5.0866, "mean_token_accuracy": 0.21187548488378524, "num_tokens": 75808318.0, "step": 33965 }, { "entropy": 5.367811870574951, "epoch": 3.815185039591172, "grad_norm": 0.9609375, "learning_rate": 0.0003614171065846166, "loss": 5.017, "mean_token_accuracy": 0.21753253042697906, "num_tokens": 75819930.0, "step": 33970 }, { "entropy": 5.465809392929077, "epoch": 3.81574661649913, "grad_norm": 0.953125, "learning_rate": 0.0003613800358377635, "loss": 5.0502, "mean_token_accuracy": 0.21721564531326293, "num_tokens": 75831814.0, "step": 33975 }, { "entropy": 5.335186004638672, "epoch": 3.816308193407087, "grad_norm": 1.015625, "learning_rate": 0.0003613429623405364, "loss": 4.9768, "mean_token_accuracy": 0.21474671959877015, "num_tokens": 75842610.0, "step": 33980 }, { "entropy": 5.281474924087524, "epoch": 3.8168697703150447, "grad_norm": 0.9765625, "learning_rate": 0.00036130588609411597, "loss": 5.0553, "mean_token_accuracy": 0.21472473293542862, "num_tokens": 75854582.0, "step": 33985 }, { "entropy": 5.345591831207275, "epoch": 3.8174313472230024, "grad_norm": 0.984375, "learning_rate": 0.00036126880709968264, "loss": 4.931, "mean_token_accuracy": 0.22597001641988754, "num_tokens": 75865715.0, "step": 33990 }, { "entropy": 5.388801717758179, "epoch": 3.8179929241309596, "grad_norm": 0.99609375, "learning_rate": 0.00036123172535841705, "loss": 4.9555, "mean_token_accuracy": 0.22396664023399354, "num_tokens": 75876348.0, "step": 33995 }, { "entropy": 5.386597299575806, "epoch": 3.8185545010389172, "grad_norm": 1.0234375, "learning_rate": 0.0003611946408714998, "loss": 5.0493, "mean_token_accuracy": 0.21565669924020767, "num_tokens": 75888316.0, "step": 34000 }, { "entropy": 5.333922910690307, "epoch": 3.819116077946875, "grad_norm": 1.0703125, "learning_rate": 0.00036115755364011186, "loss": 4.9829, "mean_token_accuracy": 0.22253286987543106, "num_tokens": 75898872.0, "step": 34005 }, { "entropy": 5.397887706756592, "epoch": 3.819677654854832, "grad_norm": 0.96484375, "learning_rate": 0.000361120463665434, "loss": 5.0423, "mean_token_accuracy": 0.21444333344697952, "num_tokens": 75909768.0, "step": 34010 }, { "entropy": 5.40838394165039, "epoch": 3.82023923176279, "grad_norm": 0.85546875, "learning_rate": 0.0003610833709486471, "loss": 5.0409, "mean_token_accuracy": 0.2120228201150894, "num_tokens": 75921488.0, "step": 34015 }, { "entropy": 5.349220180511475, "epoch": 3.8208008086707475, "grad_norm": 0.97265625, "learning_rate": 0.0003610462754909323, "loss": 4.9794, "mean_token_accuracy": 0.21451006978750228, "num_tokens": 75933619.0, "step": 34020 }, { "entropy": 5.320299434661865, "epoch": 3.821362385578705, "grad_norm": 1.0625, "learning_rate": 0.00036100917729347073, "loss": 4.9, "mean_token_accuracy": 0.2216912806034088, "num_tokens": 75943369.0, "step": 34025 }, { "entropy": 5.387540817260742, "epoch": 3.8219239624866628, "grad_norm": 1.046875, "learning_rate": 0.00036097207635744363, "loss": 5.0826, "mean_token_accuracy": 0.21220593303442, "num_tokens": 75954793.0, "step": 34030 }, { "entropy": 5.305421924591064, "epoch": 3.82248553939462, "grad_norm": 1.0078125, "learning_rate": 0.00036093497268403215, "loss": 4.9327, "mean_token_accuracy": 0.22392136007547378, "num_tokens": 75965765.0, "step": 34035 }, { "entropy": 5.309311819076538, "epoch": 3.8230471163025777, "grad_norm": 1.1015625, "learning_rate": 0.000360897866274418, "loss": 4.9656, "mean_token_accuracy": 0.22120587825775145, "num_tokens": 75976435.0, "step": 34040 }, { "entropy": 5.360985279083252, "epoch": 3.8236086932105353, "grad_norm": 1.09375, "learning_rate": 0.00036086075712978233, "loss": 4.9607, "mean_token_accuracy": 0.21701428294181824, "num_tokens": 75987379.0, "step": 34045 }, { "entropy": 5.423221635818481, "epoch": 3.8241702701184925, "grad_norm": 0.91796875, "learning_rate": 0.00036082364525130684, "loss": 5.1176, "mean_token_accuracy": 0.20473133027553558, "num_tokens": 75999073.0, "step": 34050 }, { "entropy": 5.355525302886963, "epoch": 3.82473184702645, "grad_norm": 0.953125, "learning_rate": 0.0003607865306401732, "loss": 4.9639, "mean_token_accuracy": 0.21527751088142394, "num_tokens": 76009490.0, "step": 34055 }, { "entropy": 5.3245758533477785, "epoch": 3.825293423934408, "grad_norm": 0.9140625, "learning_rate": 0.00036074941329756327, "loss": 5.0052, "mean_token_accuracy": 0.22115110158920287, "num_tokens": 76021616.0, "step": 34060 }, { "entropy": 5.332374572753906, "epoch": 3.8258550008423655, "grad_norm": 1.0703125, "learning_rate": 0.0003607122932246587, "loss": 4.997, "mean_token_accuracy": 0.22266539484262465, "num_tokens": 76031031.0, "step": 34065 }, { "entropy": 5.254789066314697, "epoch": 3.826416577750323, "grad_norm": 0.8515625, "learning_rate": 0.00036067517042264147, "loss": 4.8282, "mean_token_accuracy": 0.2270468607544899, "num_tokens": 76041433.0, "step": 34070 }, { "entropy": 5.341865825653076, "epoch": 3.8269781546582804, "grad_norm": 0.94140625, "learning_rate": 0.0003606380448926936, "loss": 4.998, "mean_token_accuracy": 0.21849806159734725, "num_tokens": 76052359.0, "step": 34075 }, { "entropy": 5.352876996994018, "epoch": 3.827539731566238, "grad_norm": 1.0234375, "learning_rate": 0.0003606009166359972, "loss": 4.9423, "mean_token_accuracy": 0.22541649937629699, "num_tokens": 76062857.0, "step": 34080 }, { "entropy": 5.472993659973144, "epoch": 3.8281013084741957, "grad_norm": 0.98828125, "learning_rate": 0.00036056378565373434, "loss": 5.1585, "mean_token_accuracy": 0.20510734766721725, "num_tokens": 76074937.0, "step": 34085 }, { "entropy": 5.2900432586669925, "epoch": 3.828662885382153, "grad_norm": 0.98828125, "learning_rate": 0.0003605266519470874, "loss": 4.915, "mean_token_accuracy": 0.2211875006556511, "num_tokens": 76087434.0, "step": 34090 }, { "entropy": 5.31575837135315, "epoch": 3.8292244622901106, "grad_norm": 0.9375, "learning_rate": 0.0003604895155172386, "loss": 4.9557, "mean_token_accuracy": 0.22189746648073197, "num_tokens": 76098244.0, "step": 34095 }, { "entropy": 5.297691345214844, "epoch": 3.8297860391980683, "grad_norm": 0.953125, "learning_rate": 0.0003604523763653706, "loss": 4.9188, "mean_token_accuracy": 0.22503688633441926, "num_tokens": 76108798.0, "step": 34100 }, { "entropy": 5.372882270812989, "epoch": 3.8303476161060255, "grad_norm": 0.96484375, "learning_rate": 0.00036041523449266573, "loss": 4.9773, "mean_token_accuracy": 0.22199310213327408, "num_tokens": 76120776.0, "step": 34105 }, { "entropy": 5.355411338806152, "epoch": 3.830909193013983, "grad_norm": 1.015625, "learning_rate": 0.00036037808990030667, "loss": 5.0469, "mean_token_accuracy": 0.22123882323503494, "num_tokens": 76133562.0, "step": 34110 }, { "entropy": 5.263192129135132, "epoch": 3.831470769921941, "grad_norm": 1.0625, "learning_rate": 0.0003603409425894761, "loss": 4.9903, "mean_token_accuracy": 0.2226415604352951, "num_tokens": 76146071.0, "step": 34115 }, { "entropy": 5.353691291809082, "epoch": 3.8320323468298985, "grad_norm": 0.93359375, "learning_rate": 0.0003603037925613568, "loss": 4.9239, "mean_token_accuracy": 0.22817468494176865, "num_tokens": 76157568.0, "step": 34120 }, { "entropy": 5.33496732711792, "epoch": 3.832593923737856, "grad_norm": 0.96484375, "learning_rate": 0.0003602666398171317, "loss": 4.9073, "mean_token_accuracy": 0.22977200001478196, "num_tokens": 76168853.0, "step": 34125 }, { "entropy": 5.211858892440796, "epoch": 3.8331555006458133, "grad_norm": 1.0234375, "learning_rate": 0.00036022948435798373, "loss": 4.8569, "mean_token_accuracy": 0.22130682468414306, "num_tokens": 76178480.0, "step": 34130 }, { "entropy": 5.244050645828247, "epoch": 3.833717077553771, "grad_norm": 1.0234375, "learning_rate": 0.000360192326185096, "loss": 4.8715, "mean_token_accuracy": 0.22588102966547013, "num_tokens": 76189031.0, "step": 34135 }, { "entropy": 5.20930061340332, "epoch": 3.8342786544617287, "grad_norm": 0.9453125, "learning_rate": 0.0003601551652996514, "loss": 4.8527, "mean_token_accuracy": 0.2241537094116211, "num_tokens": 76199345.0, "step": 34140 }, { "entropy": 5.3511070728302, "epoch": 3.834840231369686, "grad_norm": 0.9921875, "learning_rate": 0.0003601180017028334, "loss": 5.0694, "mean_token_accuracy": 0.21012949347496032, "num_tokens": 76211023.0, "step": 34145 }, { "entropy": 5.43844165802002, "epoch": 3.8354018082776435, "grad_norm": 0.93359375, "learning_rate": 0.0003600808353958252, "loss": 5.0411, "mean_token_accuracy": 0.21390115469694138, "num_tokens": 76221562.0, "step": 34150 }, { "entropy": 5.377560472488403, "epoch": 3.835963385185601, "grad_norm": 0.94921875, "learning_rate": 0.0003600436663798102, "loss": 5.0947, "mean_token_accuracy": 0.2088586449623108, "num_tokens": 76235113.0, "step": 34155 }, { "entropy": 5.373347043991089, "epoch": 3.836524962093559, "grad_norm": 0.98828125, "learning_rate": 0.00036000649465597185, "loss": 4.9767, "mean_token_accuracy": 0.22686143666505815, "num_tokens": 76245804.0, "step": 34160 }, { "entropy": 5.340077018737793, "epoch": 3.8370865390015165, "grad_norm": 0.91796875, "learning_rate": 0.00035996932022549377, "loss": 4.9573, "mean_token_accuracy": 0.226337006688118, "num_tokens": 76257275.0, "step": 34165 }, { "entropy": 5.308880233764649, "epoch": 3.8376481159094737, "grad_norm": 0.89453125, "learning_rate": 0.00035993214308955955, "loss": 4.9667, "mean_token_accuracy": 0.21919851154088973, "num_tokens": 76268401.0, "step": 34170 }, { "entropy": 5.2743120193481445, "epoch": 3.8382096928174314, "grad_norm": 0.99609375, "learning_rate": 0.000359894963249353, "loss": 4.9009, "mean_token_accuracy": 0.21955974996089936, "num_tokens": 76278943.0, "step": 34175 }, { "entropy": 5.332439708709717, "epoch": 3.838771269725389, "grad_norm": 1.1015625, "learning_rate": 0.00035985778070605785, "loss": 4.9804, "mean_token_accuracy": 0.22518874257802962, "num_tokens": 76289899.0, "step": 34180 }, { "entropy": 5.397191286087036, "epoch": 3.8393328466333463, "grad_norm": 1.0078125, "learning_rate": 0.0003598205954608581, "loss": 5.0668, "mean_token_accuracy": 0.21639354079961776, "num_tokens": 76300574.0, "step": 34185 }, { "entropy": 5.307239723205567, "epoch": 3.839894423541304, "grad_norm": 0.8984375, "learning_rate": 0.00035978340751493767, "loss": 5.025, "mean_token_accuracy": 0.21680848002433778, "num_tokens": 76312789.0, "step": 34190 }, { "entropy": 5.282459115982055, "epoch": 3.8404560004492616, "grad_norm": 0.94140625, "learning_rate": 0.00035974621686948063, "loss": 4.8967, "mean_token_accuracy": 0.22004208713769913, "num_tokens": 76322911.0, "step": 34195 }, { "entropy": 5.338252353668213, "epoch": 3.841017577357219, "grad_norm": 1.0234375, "learning_rate": 0.0003597090235256712, "loss": 5.0265, "mean_token_accuracy": 0.21764661371707916, "num_tokens": 76333699.0, "step": 34200 }, { "entropy": 5.21779236793518, "epoch": 3.8415791542651765, "grad_norm": 0.94921875, "learning_rate": 0.0003596718274846936, "loss": 4.902, "mean_token_accuracy": 0.2212449923157692, "num_tokens": 76344405.0, "step": 34205 }, { "entropy": 5.2961455345153805, "epoch": 3.842140731173134, "grad_norm": 1.6484375, "learning_rate": 0.0003596346287477322, "loss": 4.9983, "mean_token_accuracy": 0.21882383972406388, "num_tokens": 76356403.0, "step": 34210 }, { "entropy": 5.347577857971191, "epoch": 3.842702308081092, "grad_norm": 0.9375, "learning_rate": 0.0003595974273159714, "loss": 4.9391, "mean_token_accuracy": 0.2180602341890335, "num_tokens": 76368216.0, "step": 34215 }, { "entropy": 5.4728484630584715, "epoch": 3.8432638849890495, "grad_norm": 0.984375, "learning_rate": 0.0003595602231905957, "loss": 5.1732, "mean_token_accuracy": 0.21075690686702728, "num_tokens": 76379996.0, "step": 34220 }, { "entropy": 5.2909965991973875, "epoch": 3.8438254618970067, "grad_norm": 0.92578125, "learning_rate": 0.00035952301637278973, "loss": 4.9577, "mean_token_accuracy": 0.22745050936937333, "num_tokens": 76391409.0, "step": 34225 }, { "entropy": 5.3159387588500975, "epoch": 3.8443870388049644, "grad_norm": 1.0234375, "learning_rate": 0.00035948580686373803, "loss": 5.0165, "mean_token_accuracy": 0.21929509192705154, "num_tokens": 76402111.0, "step": 34230 }, { "entropy": 5.29626579284668, "epoch": 3.844948615712922, "grad_norm": 1.03125, "learning_rate": 0.00035944859466462554, "loss": 4.8828, "mean_token_accuracy": 0.22586579173803328, "num_tokens": 76413225.0, "step": 34235 }, { "entropy": 5.34407868385315, "epoch": 3.8455101926208792, "grad_norm": 0.984375, "learning_rate": 0.000359411379776637, "loss": 4.9884, "mean_token_accuracy": 0.218968565762043, "num_tokens": 76423236.0, "step": 34240 }, { "entropy": 5.3959883689880375, "epoch": 3.846071769528837, "grad_norm": 0.94140625, "learning_rate": 0.00035937416220095745, "loss": 5.0245, "mean_token_accuracy": 0.22425228655338286, "num_tokens": 76435599.0, "step": 34245 }, { "entropy": 5.2845948219299315, "epoch": 3.8466333464367946, "grad_norm": 0.890625, "learning_rate": 0.0003593369419387718, "loss": 4.9794, "mean_token_accuracy": 0.2224591627717018, "num_tokens": 76446182.0, "step": 34250 }, { "entropy": 5.297406482696533, "epoch": 3.847194923344752, "grad_norm": 0.84375, "learning_rate": 0.0003592997189912652, "loss": 4.9323, "mean_token_accuracy": 0.22103478163480758, "num_tokens": 76459151.0, "step": 34255 }, { "entropy": 5.385849475860596, "epoch": 3.84775650025271, "grad_norm": 1.0859375, "learning_rate": 0.00035926249335962296, "loss": 5.0557, "mean_token_accuracy": 0.2154635891318321, "num_tokens": 76471235.0, "step": 34260 }, { "entropy": 5.290727853775024, "epoch": 3.848318077160667, "grad_norm": 1.0078125, "learning_rate": 0.00035922526504503016, "loss": 4.9387, "mean_token_accuracy": 0.2178479790687561, "num_tokens": 76481699.0, "step": 34265 }, { "entropy": 5.366047716140747, "epoch": 3.8488796540686248, "grad_norm": 1.015625, "learning_rate": 0.0003591880340486723, "loss": 5.0577, "mean_token_accuracy": 0.21498210579156876, "num_tokens": 76493038.0, "step": 34270 }, { "entropy": 5.294825172424316, "epoch": 3.8494412309765824, "grad_norm": 0.9765625, "learning_rate": 0.0003591508003717347, "loss": 4.9409, "mean_token_accuracy": 0.223392952978611, "num_tokens": 76503601.0, "step": 34275 }, { "entropy": 5.318000268936157, "epoch": 3.8500028078845396, "grad_norm": 0.94921875, "learning_rate": 0.00035911356401540306, "loss": 4.9147, "mean_token_accuracy": 0.22591498345136643, "num_tokens": 76513914.0, "step": 34280 }, { "entropy": 5.318132781982422, "epoch": 3.8505643847924973, "grad_norm": 1.0078125, "learning_rate": 0.0003590763249808629, "loss": 4.9385, "mean_token_accuracy": 0.2282802939414978, "num_tokens": 76524924.0, "step": 34285 }, { "entropy": 5.252163743972778, "epoch": 3.851125961700455, "grad_norm": 1.0546875, "learning_rate": 0.00035903908326929995, "loss": 4.9068, "mean_token_accuracy": 0.2254076898097992, "num_tokens": 76536468.0, "step": 34290 }, { "entropy": 5.374836683273315, "epoch": 3.851687538608412, "grad_norm": 0.9609375, "learning_rate": 0.00035900183888190005, "loss": 5.0282, "mean_token_accuracy": 0.22161675989627838, "num_tokens": 76548320.0, "step": 34295 }, { "entropy": 5.336897230148315, "epoch": 3.85224911551637, "grad_norm": 0.90625, "learning_rate": 0.0003589645918198489, "loss": 4.9689, "mean_token_accuracy": 0.22136852741241456, "num_tokens": 76560482.0, "step": 34300 }, { "entropy": 5.351146554946899, "epoch": 3.8528106924243275, "grad_norm": 0.9296875, "learning_rate": 0.00035892734208433264, "loss": 5.0478, "mean_token_accuracy": 0.21467004865407943, "num_tokens": 76571743.0, "step": 34305 }, { "entropy": 5.276084518432617, "epoch": 3.853372269332285, "grad_norm": 0.94921875, "learning_rate": 0.00035889008967653725, "loss": 5.0088, "mean_token_accuracy": 0.2131062477827072, "num_tokens": 76582545.0, "step": 34310 }, { "entropy": 5.3727256774902346, "epoch": 3.853933846240243, "grad_norm": 0.9609375, "learning_rate": 0.0003588528345976489, "loss": 5.0526, "mean_token_accuracy": 0.21507383584976197, "num_tokens": 76594104.0, "step": 34315 }, { "entropy": 5.372976875305175, "epoch": 3.8544954231482, "grad_norm": 1.046875, "learning_rate": 0.0003588155768488537, "loss": 5.0163, "mean_token_accuracy": 0.21563293635845185, "num_tokens": 76603414.0, "step": 34320 }, { "entropy": 5.374476051330566, "epoch": 3.8550570000561577, "grad_norm": 1.0234375, "learning_rate": 0.00035877831643133803, "loss": 5.0229, "mean_token_accuracy": 0.21743345856666565, "num_tokens": 76614098.0, "step": 34325 }, { "entropy": 5.466065311431885, "epoch": 3.8556185769641154, "grad_norm": 1.0234375, "learning_rate": 0.0003587410533462883, "loss": 5.1374, "mean_token_accuracy": 0.2166756808757782, "num_tokens": 76625179.0, "step": 34330 }, { "entropy": 5.291461515426636, "epoch": 3.8561801538720726, "grad_norm": 0.984375, "learning_rate": 0.00035870378759489104, "loss": 4.8606, "mean_token_accuracy": 0.2264542043209076, "num_tokens": 76636710.0, "step": 34335 }, { "entropy": 5.290535306930542, "epoch": 3.8567417307800302, "grad_norm": 1.0625, "learning_rate": 0.0003586665191783326, "loss": 4.9998, "mean_token_accuracy": 0.21129338592290878, "num_tokens": 76647585.0, "step": 34340 }, { "entropy": 5.347399425506592, "epoch": 3.857303307687988, "grad_norm": 1.03125, "learning_rate": 0.0003586292480977998, "loss": 5.0045, "mean_token_accuracy": 0.2124169498682022, "num_tokens": 76658376.0, "step": 34345 }, { "entropy": 5.384722423553467, "epoch": 3.8578648845959456, "grad_norm": 0.9921875, "learning_rate": 0.00035859197435447927, "loss": 4.9671, "mean_token_accuracy": 0.22697136998176576, "num_tokens": 76669237.0, "step": 34350 }, { "entropy": 5.367992210388183, "epoch": 3.8584264615039032, "grad_norm": 0.953125, "learning_rate": 0.00035855469794955787, "loss": 5.0957, "mean_token_accuracy": 0.20734002590179443, "num_tokens": 76681067.0, "step": 34355 }, { "entropy": 5.408801794052124, "epoch": 3.8589880384118604, "grad_norm": 1.0078125, "learning_rate": 0.00035851741888422254, "loss": 4.9837, "mean_token_accuracy": 0.2224266082048416, "num_tokens": 76690858.0, "step": 34360 }, { "entropy": 5.387903690338135, "epoch": 3.859549615319818, "grad_norm": 0.9296875, "learning_rate": 0.0003584801371596601, "loss": 5.0553, "mean_token_accuracy": 0.2148429811000824, "num_tokens": 76701571.0, "step": 34365 }, { "entropy": 5.3273707866668705, "epoch": 3.8601111922277758, "grad_norm": 0.953125, "learning_rate": 0.0003584428527770578, "loss": 4.9829, "mean_token_accuracy": 0.21457699835300445, "num_tokens": 76712565.0, "step": 34370 }, { "entropy": 5.359912014007568, "epoch": 3.860672769135733, "grad_norm": 0.97265625, "learning_rate": 0.00035840556573760266, "loss": 5.0204, "mean_token_accuracy": 0.21210582703351974, "num_tokens": 76724484.0, "step": 34375 }, { "entropy": 5.312947797775268, "epoch": 3.8612343460436906, "grad_norm": 0.90234375, "learning_rate": 0.0003583682760424819, "loss": 4.8897, "mean_token_accuracy": 0.22590861916542054, "num_tokens": 76735596.0, "step": 34380 }, { "entropy": 5.413711071014404, "epoch": 3.8617959229516483, "grad_norm": 1.1171875, "learning_rate": 0.00035833098369288303, "loss": 5.0667, "mean_token_accuracy": 0.21579882502555847, "num_tokens": 76747160.0, "step": 34385 }, { "entropy": 5.327003860473633, "epoch": 3.8623574998596055, "grad_norm": 1.0078125, "learning_rate": 0.00035829368868999325, "loss": 4.9375, "mean_token_accuracy": 0.21669704467058182, "num_tokens": 76758136.0, "step": 34390 }, { "entropy": 5.296048927307129, "epoch": 3.862919076767563, "grad_norm": 0.953125, "learning_rate": 0.00035825639103500005, "loss": 4.9796, "mean_token_accuracy": 0.21815905421972276, "num_tokens": 76768167.0, "step": 34395 }, { "entropy": 5.438165712356567, "epoch": 3.863480653675521, "grad_norm": 0.9453125, "learning_rate": 0.00035821909072909113, "loss": 5.1214, "mean_token_accuracy": 0.21192978620529174, "num_tokens": 76779717.0, "step": 34400 }, { "entropy": 5.243574905395508, "epoch": 3.8640422305834785, "grad_norm": 0.98828125, "learning_rate": 0.00035818178777345417, "loss": 4.9617, "mean_token_accuracy": 0.21840597838163375, "num_tokens": 76790837.0, "step": 34405 }, { "entropy": 5.356860113143921, "epoch": 3.864603807491436, "grad_norm": 1.0, "learning_rate": 0.0003581444821692767, "loss": 4.9678, "mean_token_accuracy": 0.22023036032915116, "num_tokens": 76801159.0, "step": 34410 }, { "entropy": 5.366121625900268, "epoch": 3.8651653843993934, "grad_norm": 1.0625, "learning_rate": 0.0003581071739177467, "loss": 4.9984, "mean_token_accuracy": 0.21985567659139632, "num_tokens": 76812409.0, "step": 34415 }, { "entropy": 5.4340386390686035, "epoch": 3.865726961307351, "grad_norm": 1.0078125, "learning_rate": 0.00035806986302005205, "loss": 5.0775, "mean_token_accuracy": 0.2129431650042534, "num_tokens": 76824360.0, "step": 34420 }, { "entropy": 5.394805574417115, "epoch": 3.8662885382153087, "grad_norm": 1.0234375, "learning_rate": 0.0003580325494773808, "loss": 4.9733, "mean_token_accuracy": 0.22332290410995484, "num_tokens": 76834725.0, "step": 34425 }, { "entropy": 5.275696659088135, "epoch": 3.866850115123266, "grad_norm": 1.0078125, "learning_rate": 0.00035799523329092093, "loss": 4.9783, "mean_token_accuracy": 0.22392223477363588, "num_tokens": 76846099.0, "step": 34430 }, { "entropy": 5.3988707065582275, "epoch": 3.8674116920312236, "grad_norm": 0.921875, "learning_rate": 0.00035795791446186073, "loss": 5.0347, "mean_token_accuracy": 0.21507358253002168, "num_tokens": 76857229.0, "step": 34435 }, { "entropy": 5.438662815093994, "epoch": 3.8679732689391813, "grad_norm": 0.98046875, "learning_rate": 0.0003579205929913882, "loss": 4.9931, "mean_token_accuracy": 0.22638604044914246, "num_tokens": 76868609.0, "step": 34440 }, { "entropy": 5.401218700408935, "epoch": 3.868534845847139, "grad_norm": 1.03125, "learning_rate": 0.0003578832688806919, "loss": 4.9948, "mean_token_accuracy": 0.22060953676700593, "num_tokens": 76879539.0, "step": 34445 }, { "entropy": 5.365166854858399, "epoch": 3.8690964227550966, "grad_norm": 1.0546875, "learning_rate": 0.0003578459421309602, "loss": 5.0251, "mean_token_accuracy": 0.21152975410223007, "num_tokens": 76889333.0, "step": 34450 }, { "entropy": 5.33002815246582, "epoch": 3.869657999663054, "grad_norm": 0.92578125, "learning_rate": 0.0003578086127433816, "loss": 5.0751, "mean_token_accuracy": 0.2153173044323921, "num_tokens": 76901334.0, "step": 34455 }, { "entropy": 5.425039768218994, "epoch": 3.8702195765710115, "grad_norm": 1.0390625, "learning_rate": 0.00035777128071914454, "loss": 4.9598, "mean_token_accuracy": 0.2244469329714775, "num_tokens": 76913758.0, "step": 34460 }, { "entropy": 5.398364734649658, "epoch": 3.870781153478969, "grad_norm": 1.0078125, "learning_rate": 0.0003577339460594378, "loss": 5.0256, "mean_token_accuracy": 0.21481548100709916, "num_tokens": 76925317.0, "step": 34465 }, { "entropy": 5.365930414199829, "epoch": 3.8713427303869263, "grad_norm": 0.95703125, "learning_rate": 0.0003576966087654502, "loss": 5.0827, "mean_token_accuracy": 0.21622089594602584, "num_tokens": 76937169.0, "step": 34470 }, { "entropy": 5.322516298294067, "epoch": 3.871904307294884, "grad_norm": 0.94140625, "learning_rate": 0.00035765926883837054, "loss": 4.9577, "mean_token_accuracy": 0.21853512674570083, "num_tokens": 76948958.0, "step": 34475 }, { "entropy": 5.405957984924316, "epoch": 3.8724658842028417, "grad_norm": 1.0390625, "learning_rate": 0.0003576219262793877, "loss": 5.0723, "mean_token_accuracy": 0.2142027050256729, "num_tokens": 76960686.0, "step": 34480 }, { "entropy": 5.340802955627441, "epoch": 3.873027461110799, "grad_norm": 0.99609375, "learning_rate": 0.00035758458108969056, "loss": 4.9937, "mean_token_accuracy": 0.22139831334352494, "num_tokens": 76971127.0, "step": 34485 }, { "entropy": 5.293386363983155, "epoch": 3.8735890380187565, "grad_norm": 1.046875, "learning_rate": 0.0003575472332704684, "loss": 4.8313, "mean_token_accuracy": 0.2363441213965416, "num_tokens": 76982647.0, "step": 34490 }, { "entropy": 5.372289705276489, "epoch": 3.874150614926714, "grad_norm": 1.0546875, "learning_rate": 0.00035750988282291037, "loss": 5.0559, "mean_token_accuracy": 0.22276147603988647, "num_tokens": 76994274.0, "step": 34495 }, { "entropy": 5.304782962799072, "epoch": 3.874712191834672, "grad_norm": 0.984375, "learning_rate": 0.00035747252974820565, "loss": 4.9329, "mean_token_accuracy": 0.22307076156139374, "num_tokens": 77005435.0, "step": 34500 }, { "entropy": 5.319442844390869, "epoch": 3.8752737687426295, "grad_norm": 0.9453125, "learning_rate": 0.00035743517404754354, "loss": 4.9397, "mean_token_accuracy": 0.21738810688257218, "num_tokens": 77016913.0, "step": 34505 }, { "entropy": 5.327348089218139, "epoch": 3.8758353456505867, "grad_norm": 0.98046875, "learning_rate": 0.0003573978157221136, "loss": 5.0159, "mean_token_accuracy": 0.21784308850765227, "num_tokens": 77027340.0, "step": 34510 }, { "entropy": 5.325407791137695, "epoch": 3.8763969225585444, "grad_norm": 1.0703125, "learning_rate": 0.00035736045477310517, "loss": 4.9752, "mean_token_accuracy": 0.21725043505430222, "num_tokens": 77039465.0, "step": 34515 }, { "entropy": 5.371528577804566, "epoch": 3.876958499466502, "grad_norm": 0.9921875, "learning_rate": 0.00035732309120170786, "loss": 5.0376, "mean_token_accuracy": 0.21463114470243455, "num_tokens": 77050503.0, "step": 34520 }, { "entropy": 5.473624658584595, "epoch": 3.8775200763744593, "grad_norm": 1.0390625, "learning_rate": 0.00035728572500911155, "loss": 4.9595, "mean_token_accuracy": 0.22070858925580977, "num_tokens": 77060212.0, "step": 34525 }, { "entropy": 5.411468935012818, "epoch": 3.878081653282417, "grad_norm": 0.96875, "learning_rate": 0.00035724835619650573, "loss": 5.0723, "mean_token_accuracy": 0.21515158712863922, "num_tokens": 77071134.0, "step": 34530 }, { "entropy": 5.392029094696045, "epoch": 3.8786432301903746, "grad_norm": 0.97265625, "learning_rate": 0.0003572109847650804, "loss": 5.0266, "mean_token_accuracy": 0.22550059705972672, "num_tokens": 77081844.0, "step": 34535 }, { "entropy": 5.363567638397217, "epoch": 3.8792048070983323, "grad_norm": 0.95703125, "learning_rate": 0.00035717361071602546, "loss": 4.9842, "mean_token_accuracy": 0.22274601757526397, "num_tokens": 77092891.0, "step": 34540 }, { "entropy": 5.294776678085327, "epoch": 3.87976638400629, "grad_norm": 0.98046875, "learning_rate": 0.00035713623405053083, "loss": 4.9465, "mean_token_accuracy": 0.22207600772380828, "num_tokens": 77104620.0, "step": 34545 }, { "entropy": 5.327441596984864, "epoch": 3.880327960914247, "grad_norm": 0.98828125, "learning_rate": 0.00035709885476978666, "loss": 5.0206, "mean_token_accuracy": 0.21455124020576477, "num_tokens": 77115249.0, "step": 34550 }, { "entropy": 5.365397214889526, "epoch": 3.880889537822205, "grad_norm": 0.90625, "learning_rate": 0.00035706147287498303, "loss": 5.0034, "mean_token_accuracy": 0.21623631566762924, "num_tokens": 77127287.0, "step": 34555 }, { "entropy": 5.460450983047485, "epoch": 3.8814511147301625, "grad_norm": 0.93359375, "learning_rate": 0.00035702408836731043, "loss": 4.9835, "mean_token_accuracy": 0.22453559786081315, "num_tokens": 77139022.0, "step": 34560 }, { "entropy": 5.3107527732849125, "epoch": 3.8820126916381197, "grad_norm": 1.0078125, "learning_rate": 0.000356986701247959, "loss": 4.9637, "mean_token_accuracy": 0.21536468267440795, "num_tokens": 77148594.0, "step": 34565 }, { "entropy": 5.293627166748047, "epoch": 3.8825742685460773, "grad_norm": 1.0546875, "learning_rate": 0.0003569493115181192, "loss": 4.9559, "mean_token_accuracy": 0.2237549230456352, "num_tokens": 77158882.0, "step": 34570 }, { "entropy": 5.332336807250977, "epoch": 3.883135845454035, "grad_norm": 0.96875, "learning_rate": 0.0003569119191789815, "loss": 4.999, "mean_token_accuracy": 0.21486303061246873, "num_tokens": 77169721.0, "step": 34575 }, { "entropy": 5.369428110122681, "epoch": 3.8836974223619922, "grad_norm": 1.046875, "learning_rate": 0.00035687452423173655, "loss": 5.0192, "mean_token_accuracy": 0.21325239092111586, "num_tokens": 77181223.0, "step": 34580 }, { "entropy": 5.327916860580444, "epoch": 3.88425899926995, "grad_norm": 0.9453125, "learning_rate": 0.000356837126677575, "loss": 4.9699, "mean_token_accuracy": 0.21363091617822647, "num_tokens": 77193000.0, "step": 34585 }, { "entropy": 5.339040756225586, "epoch": 3.8848205761779075, "grad_norm": 0.98046875, "learning_rate": 0.0003567997265176876, "loss": 4.949, "mean_token_accuracy": 0.21859423369169234, "num_tokens": 77203721.0, "step": 34590 }, { "entropy": 5.289082479476929, "epoch": 3.885382153085865, "grad_norm": 0.9765625, "learning_rate": 0.00035676232375326513, "loss": 4.819, "mean_token_accuracy": 0.2308942675590515, "num_tokens": 77214601.0, "step": 34595 }, { "entropy": 5.381571483612061, "epoch": 3.885943729993823, "grad_norm": 1.0234375, "learning_rate": 0.00035672491838549867, "loss": 4.9867, "mean_token_accuracy": 0.21910925805568696, "num_tokens": 77225478.0, "step": 34600 }, { "entropy": 5.385287427902222, "epoch": 3.88650530690178, "grad_norm": 1.015625, "learning_rate": 0.000356687510415579, "loss": 5.063, "mean_token_accuracy": 0.21933630257844924, "num_tokens": 77237601.0, "step": 34605 }, { "entropy": 5.378786420822143, "epoch": 3.8870668838097377, "grad_norm": 0.95703125, "learning_rate": 0.0003566500998446973, "loss": 5.0697, "mean_token_accuracy": 0.21607993096113204, "num_tokens": 77248137.0, "step": 34610 }, { "entropy": 5.425086498260498, "epoch": 3.8876284607176954, "grad_norm": 1.0078125, "learning_rate": 0.00035661268667404485, "loss": 5.0687, "mean_token_accuracy": 0.21746052652597428, "num_tokens": 77260366.0, "step": 34615 }, { "entropy": 5.436946296691895, "epoch": 3.8881900376256526, "grad_norm": 1.0546875, "learning_rate": 0.0003565752709048127, "loss": 5.0287, "mean_token_accuracy": 0.21868159174919127, "num_tokens": 77270301.0, "step": 34620 }, { "entropy": 5.378354883193969, "epoch": 3.8887516145336103, "grad_norm": 0.92578125, "learning_rate": 0.0003565378525381924, "loss": 5.0531, "mean_token_accuracy": 0.21499278247356415, "num_tokens": 77282824.0, "step": 34625 }, { "entropy": 5.3479057312011715, "epoch": 3.889313191441568, "grad_norm": 0.9765625, "learning_rate": 0.0003565004315753752, "loss": 4.99, "mean_token_accuracy": 0.22019737511873244, "num_tokens": 77293532.0, "step": 34630 }, { "entropy": 5.403587341308594, "epoch": 3.8898747683495256, "grad_norm": 1.15625, "learning_rate": 0.00035646300801755266, "loss": 4.9817, "mean_token_accuracy": 0.2219406023621559, "num_tokens": 77304713.0, "step": 34635 }, { "entropy": 5.3187775135040285, "epoch": 3.8904363452574833, "grad_norm": 0.91796875, "learning_rate": 0.00035642558186591635, "loss": 4.9778, "mean_token_accuracy": 0.21719868779182433, "num_tokens": 77317666.0, "step": 34640 }, { "entropy": 5.280806398391723, "epoch": 3.8909979221654405, "grad_norm": 0.94140625, "learning_rate": 0.0003563881531216579, "loss": 4.9714, "mean_token_accuracy": 0.22085976153612136, "num_tokens": 77328217.0, "step": 34645 }, { "entropy": 5.385529947280884, "epoch": 3.891559499073398, "grad_norm": 0.96484375, "learning_rate": 0.0003563507217859691, "loss": 4.9873, "mean_token_accuracy": 0.22658690214157104, "num_tokens": 77339607.0, "step": 34650 }, { "entropy": 5.440567922592163, "epoch": 3.892121075981356, "grad_norm": 0.9921875, "learning_rate": 0.0003563132878600419, "loss": 5.0705, "mean_token_accuracy": 0.21355245411396026, "num_tokens": 77351651.0, "step": 34655 }, { "entropy": 5.478644800186157, "epoch": 3.892682652889313, "grad_norm": 0.95703125, "learning_rate": 0.0003562758513450678, "loss": 5.111, "mean_token_accuracy": 0.21229639947414397, "num_tokens": 77364431.0, "step": 34660 }, { "entropy": 5.309645080566407, "epoch": 3.8932442297972707, "grad_norm": 0.98046875, "learning_rate": 0.0003562384122422393, "loss": 4.9945, "mean_token_accuracy": 0.22049230039119722, "num_tokens": 77375426.0, "step": 34665 }, { "entropy": 5.310685491561889, "epoch": 3.8938058067052284, "grad_norm": 0.9453125, "learning_rate": 0.0003562009705527481, "loss": 4.984, "mean_token_accuracy": 0.222299924492836, "num_tokens": 77386794.0, "step": 34670 }, { "entropy": 5.382521152496338, "epoch": 3.8943673836131856, "grad_norm": 0.984375, "learning_rate": 0.00035616352627778665, "loss": 4.9249, "mean_token_accuracy": 0.2231205940246582, "num_tokens": 77398155.0, "step": 34675 }, { "entropy": 5.438284254074096, "epoch": 3.8949289605211432, "grad_norm": 0.984375, "learning_rate": 0.00035612607941854695, "loss": 5.1391, "mean_token_accuracy": 0.20671844184398652, "num_tokens": 77408922.0, "step": 34680 }, { "entropy": 5.312597370147705, "epoch": 3.895490537429101, "grad_norm": 0.96484375, "learning_rate": 0.0003560886299762214, "loss": 4.9538, "mean_token_accuracy": 0.22600263655185698, "num_tokens": 77419084.0, "step": 34685 }, { "entropy": 5.2731733322143555, "epoch": 3.8960521143370586, "grad_norm": 0.99609375, "learning_rate": 0.0003560511779520025, "loss": 4.8938, "mean_token_accuracy": 0.2297250047326088, "num_tokens": 77430141.0, "step": 34690 }, { "entropy": 5.372419691085815, "epoch": 3.896613691245016, "grad_norm": 1.0078125, "learning_rate": 0.0003560137233470826, "loss": 5.0977, "mean_token_accuracy": 0.22026560008525847, "num_tokens": 77440754.0, "step": 34695 }, { "entropy": 5.326091480255127, "epoch": 3.8971752681529734, "grad_norm": 1.0625, "learning_rate": 0.00035597626616265434, "loss": 4.9533, "mean_token_accuracy": 0.21802209615707396, "num_tokens": 77453532.0, "step": 34700 }, { "entropy": 5.354774045944214, "epoch": 3.897736845060931, "grad_norm": 0.9609375, "learning_rate": 0.00035593880639991037, "loss": 4.9532, "mean_token_accuracy": 0.22288752496242523, "num_tokens": 77464987.0, "step": 34705 }, { "entropy": 5.355606126785278, "epoch": 3.8982984219688888, "grad_norm": 1.1640625, "learning_rate": 0.00035590134406004336, "loss": 4.9931, "mean_token_accuracy": 0.21443939357995986, "num_tokens": 77477559.0, "step": 34710 }, { "entropy": 5.31189227104187, "epoch": 3.898859998876846, "grad_norm": 0.9765625, "learning_rate": 0.0003558638791442463, "loss": 4.9503, "mean_token_accuracy": 0.2153637230396271, "num_tokens": 77489863.0, "step": 34715 }, { "entropy": 5.282545948028565, "epoch": 3.8994215757848036, "grad_norm": 1.0, "learning_rate": 0.0003558264116537119, "loss": 4.9221, "mean_token_accuracy": 0.2196336567401886, "num_tokens": 77501119.0, "step": 34720 }, { "entropy": 5.3356256008148195, "epoch": 3.8999831526927613, "grad_norm": 0.98046875, "learning_rate": 0.0003557889415896332, "loss": 4.9997, "mean_token_accuracy": 0.22867706865072251, "num_tokens": 77512530.0, "step": 34725 }, { "entropy": 5.370674514770508, "epoch": 3.900544729600719, "grad_norm": 0.98046875, "learning_rate": 0.00035575146895320327, "loss": 5.0034, "mean_token_accuracy": 0.21908026933670044, "num_tokens": 77524624.0, "step": 34730 }, { "entropy": 5.386878776550293, "epoch": 3.9011063065086766, "grad_norm": 0.9765625, "learning_rate": 0.0003557139937456152, "loss": 5.006, "mean_token_accuracy": 0.21558476239442825, "num_tokens": 77536567.0, "step": 34735 }, { "entropy": 5.322687816619873, "epoch": 3.901667883416634, "grad_norm": 0.984375, "learning_rate": 0.00035567651596806236, "loss": 4.9601, "mean_token_accuracy": 0.22049544602632523, "num_tokens": 77547061.0, "step": 34740 }, { "entropy": 5.345395183563232, "epoch": 3.9022294603245915, "grad_norm": 0.90234375, "learning_rate": 0.00035563903562173786, "loss": 5.0078, "mean_token_accuracy": 0.22194723635911942, "num_tokens": 77558783.0, "step": 34745 }, { "entropy": 5.288995456695557, "epoch": 3.902791037232549, "grad_norm": 0.88671875, "learning_rate": 0.00035560155270783527, "loss": 4.9497, "mean_token_accuracy": 0.22381065040826797, "num_tokens": 77570382.0, "step": 34750 }, { "entropy": 5.355011415481568, "epoch": 3.9033526141405064, "grad_norm": 0.96484375, "learning_rate": 0.0003555640672275479, "loss": 4.9833, "mean_token_accuracy": 0.21910130530595778, "num_tokens": 77581750.0, "step": 34755 }, { "entropy": 5.352764129638672, "epoch": 3.903914191048464, "grad_norm": 0.9375, "learning_rate": 0.0003555265791820695, "loss": 4.9955, "mean_token_accuracy": 0.2259882226586342, "num_tokens": 77593784.0, "step": 34760 }, { "entropy": 5.237539052963257, "epoch": 3.9044757679564217, "grad_norm": 0.94140625, "learning_rate": 0.0003554890885725935, "loss": 4.8812, "mean_token_accuracy": 0.22495695650577546, "num_tokens": 77604993.0, "step": 34765 }, { "entropy": 5.30055799484253, "epoch": 3.905037344864379, "grad_norm": 1.0078125, "learning_rate": 0.0003554515954003137, "loss": 4.9653, "mean_token_accuracy": 0.22281993329524993, "num_tokens": 77615977.0, "step": 34770 }, { "entropy": 5.300332641601562, "epoch": 3.9055989217723366, "grad_norm": 0.9765625, "learning_rate": 0.0003554140996664239, "loss": 4.9408, "mean_token_accuracy": 0.22245702147483826, "num_tokens": 77625724.0, "step": 34775 }, { "entropy": 5.29795470237732, "epoch": 3.9061604986802942, "grad_norm": 1.046875, "learning_rate": 0.000355376601372118, "loss": 4.9665, "mean_token_accuracy": 0.22179109156131743, "num_tokens": 77635924.0, "step": 34780 }, { "entropy": 5.369157838821411, "epoch": 3.906722075588252, "grad_norm": 1.0390625, "learning_rate": 0.0003553391005185899, "loss": 5.0387, "mean_token_accuracy": 0.21407967656850815, "num_tokens": 77646142.0, "step": 34785 }, { "entropy": 5.343344354629517, "epoch": 3.9072836524962096, "grad_norm": 1.0390625, "learning_rate": 0.0003553015971070338, "loss": 4.964, "mean_token_accuracy": 0.22329080998897552, "num_tokens": 77657500.0, "step": 34790 }, { "entropy": 5.416098308563233, "epoch": 3.907845229404167, "grad_norm": 0.953125, "learning_rate": 0.0003552640911386436, "loss": 5.0348, "mean_token_accuracy": 0.21359740644693376, "num_tokens": 77668916.0, "step": 34795 }, { "entropy": 5.3855578899383545, "epoch": 3.9084068063121244, "grad_norm": 0.9609375, "learning_rate": 0.00035522658261461366, "loss": 5.0269, "mean_token_accuracy": 0.20899223834276198, "num_tokens": 77680395.0, "step": 34800 }, { "entropy": 5.295803594589233, "epoch": 3.908968383220082, "grad_norm": 0.96484375, "learning_rate": 0.0003551890715361382, "loss": 4.8648, "mean_token_accuracy": 0.22267122715711593, "num_tokens": 77691309.0, "step": 34805 }, { "entropy": 5.353998613357544, "epoch": 3.9095299601280393, "grad_norm": 0.91015625, "learning_rate": 0.0003551515579044116, "loss": 4.948, "mean_token_accuracy": 0.22546534538269042, "num_tokens": 77702922.0, "step": 34810 }, { "entropy": 5.372947931289673, "epoch": 3.910091537035997, "grad_norm": 0.88671875, "learning_rate": 0.00035511404172062827, "loss": 4.9736, "mean_token_accuracy": 0.2166505813598633, "num_tokens": 77714252.0, "step": 34815 }, { "entropy": 5.285768699645996, "epoch": 3.9106531139439547, "grad_norm": 1.015625, "learning_rate": 0.0003550765229859828, "loss": 4.882, "mean_token_accuracy": 0.22304289042949677, "num_tokens": 77724473.0, "step": 34820 }, { "entropy": 5.2749042987823485, "epoch": 3.9112146908519123, "grad_norm": 0.97265625, "learning_rate": 0.0003550390017016698, "loss": 4.9573, "mean_token_accuracy": 0.21660188287496568, "num_tokens": 77735103.0, "step": 34825 }, { "entropy": 5.4561093807220455, "epoch": 3.91177626775987, "grad_norm": 0.9140625, "learning_rate": 0.00035500147786888387, "loss": 5.0966, "mean_token_accuracy": 0.21477610170841216, "num_tokens": 77747370.0, "step": 34830 }, { "entropy": 5.337905979156494, "epoch": 3.912337844667827, "grad_norm": 1.0390625, "learning_rate": 0.00035496395148881994, "loss": 4.9873, "mean_token_accuracy": 0.21486195921897888, "num_tokens": 77759183.0, "step": 34835 }, { "entropy": 5.381987571716309, "epoch": 3.912899421575785, "grad_norm": 1.09375, "learning_rate": 0.00035492642256267277, "loss": 4.966, "mean_token_accuracy": 0.22381928265094758, "num_tokens": 77770130.0, "step": 34840 }, { "entropy": 5.27836332321167, "epoch": 3.9134609984837425, "grad_norm": 0.9453125, "learning_rate": 0.00035488889109163725, "loss": 4.8474, "mean_token_accuracy": 0.23484774827957153, "num_tokens": 77780830.0, "step": 34845 }, { "entropy": 5.31723051071167, "epoch": 3.9140225753916997, "grad_norm": 1.015625, "learning_rate": 0.0003548513570769085, "loss": 4.9485, "mean_token_accuracy": 0.21503322422504426, "num_tokens": 77791265.0, "step": 34850 }, { "entropy": 5.22876763343811, "epoch": 3.9145841522996574, "grad_norm": 0.91015625, "learning_rate": 0.0003548138205196816, "loss": 4.9042, "mean_token_accuracy": 0.2245846137404442, "num_tokens": 77802899.0, "step": 34855 }, { "entropy": 5.232019329071045, "epoch": 3.915145729207615, "grad_norm": 0.92578125, "learning_rate": 0.0003547762814211517, "loss": 4.9329, "mean_token_accuracy": 0.22694508880376815, "num_tokens": 77815034.0, "step": 34860 }, { "entropy": 5.371186542510986, "epoch": 3.9157073061155723, "grad_norm": 0.95703125, "learning_rate": 0.000354738739782514, "loss": 5.0139, "mean_token_accuracy": 0.2130333214998245, "num_tokens": 77826305.0, "step": 34865 }, { "entropy": 5.372768449783325, "epoch": 3.91626888302353, "grad_norm": 1.0703125, "learning_rate": 0.000354701195604964, "loss": 4.9962, "mean_token_accuracy": 0.2186853975057602, "num_tokens": 77837698.0, "step": 34870 }, { "entropy": 5.332578039169311, "epoch": 3.9168304599314876, "grad_norm": 0.98046875, "learning_rate": 0.0003546636488896969, "loss": 4.9671, "mean_token_accuracy": 0.22395929247140883, "num_tokens": 77848630.0, "step": 34875 }, { "entropy": 5.367195653915405, "epoch": 3.9173920368394453, "grad_norm": 1.0546875, "learning_rate": 0.0003546260996379083, "loss": 5.0564, "mean_token_accuracy": 0.21050926446914672, "num_tokens": 77859832.0, "step": 34880 }, { "entropy": 5.39934287071228, "epoch": 3.917953613747403, "grad_norm": 0.97265625, "learning_rate": 0.000354588547850794, "loss": 5.0944, "mean_token_accuracy": 0.21282154321670532, "num_tokens": 77871071.0, "step": 34885 }, { "entropy": 5.3235045909881595, "epoch": 3.91851519065536, "grad_norm": 1.0234375, "learning_rate": 0.0003545509935295493, "loss": 4.9861, "mean_token_accuracy": 0.21860711127519608, "num_tokens": 77881323.0, "step": 34890 }, { "entropy": 5.374647760391236, "epoch": 3.919076767563318, "grad_norm": 0.9296875, "learning_rate": 0.0003545134366753701, "loss": 5.0242, "mean_token_accuracy": 0.21758922934532166, "num_tokens": 77893754.0, "step": 34895 }, { "entropy": 5.351257276535034, "epoch": 3.9196383444712755, "grad_norm": 0.96875, "learning_rate": 0.0003544758772894523, "loss": 4.9249, "mean_token_accuracy": 0.2209628328680992, "num_tokens": 77905408.0, "step": 34900 }, { "entropy": 5.241050291061401, "epoch": 3.9201999213792327, "grad_norm": 0.9296875, "learning_rate": 0.00035443831537299177, "loss": 4.8341, "mean_token_accuracy": 0.23224117755889892, "num_tokens": 77915839.0, "step": 34905 }, { "entropy": 5.315095138549805, "epoch": 3.9207614982871903, "grad_norm": 1.0234375, "learning_rate": 0.0003544007509271844, "loss": 4.931, "mean_token_accuracy": 0.22335672825574876, "num_tokens": 77926626.0, "step": 34910 }, { "entropy": 5.381797409057617, "epoch": 3.921323075195148, "grad_norm": 0.92578125, "learning_rate": 0.00035436318395322636, "loss": 5.1326, "mean_token_accuracy": 0.2024238958954811, "num_tokens": 77938781.0, "step": 34915 }, { "entropy": 5.418303394317627, "epoch": 3.9218846521031057, "grad_norm": 1.0234375, "learning_rate": 0.0003543256144523137, "loss": 5.0186, "mean_token_accuracy": 0.2163691148161888, "num_tokens": 77949370.0, "step": 34920 }, { "entropy": 5.329764461517334, "epoch": 3.9224462290110633, "grad_norm": 0.98046875, "learning_rate": 0.0003542880424256428, "loss": 4.9509, "mean_token_accuracy": 0.21960351318120958, "num_tokens": 77961396.0, "step": 34925 }, { "entropy": 5.405273675918579, "epoch": 3.9230078059190205, "grad_norm": 0.93359375, "learning_rate": 0.0003542504678744099, "loss": 5.0571, "mean_token_accuracy": 0.21164146363735198, "num_tokens": 77972811.0, "step": 34930 }, { "entropy": 5.314858770370483, "epoch": 3.923569382826978, "grad_norm": 0.91796875, "learning_rate": 0.0003542128907998113, "loss": 4.9363, "mean_token_accuracy": 0.22843219637870787, "num_tokens": 77984452.0, "step": 34935 }, { "entropy": 5.291006326675415, "epoch": 3.924130959734936, "grad_norm": 0.98046875, "learning_rate": 0.0003541753112030435, "loss": 4.9316, "mean_token_accuracy": 0.22351561933755876, "num_tokens": 77995963.0, "step": 34940 }, { "entropy": 5.273133039474487, "epoch": 3.924692536642893, "grad_norm": 0.9765625, "learning_rate": 0.00035413772908530317, "loss": 4.861, "mean_token_accuracy": 0.2281592458486557, "num_tokens": 78006638.0, "step": 34945 }, { "entropy": 5.22492151260376, "epoch": 3.9252541135508507, "grad_norm": 0.90625, "learning_rate": 0.0003541001444477869, "loss": 4.8735, "mean_token_accuracy": 0.2345397874712944, "num_tokens": 78017982.0, "step": 34950 }, { "entropy": 5.263615846633911, "epoch": 3.9258156904588084, "grad_norm": 0.9765625, "learning_rate": 0.00035406255729169124, "loss": 4.9215, "mean_token_accuracy": 0.22397965639829637, "num_tokens": 78028827.0, "step": 34955 }, { "entropy": 5.3835996150970455, "epoch": 3.9263772673667656, "grad_norm": 0.95703125, "learning_rate": 0.0003540249676182131, "loss": 5.0162, "mean_token_accuracy": 0.22074820846319199, "num_tokens": 78040021.0, "step": 34960 }, { "entropy": 5.405057191848755, "epoch": 3.9269388442747233, "grad_norm": 1.0078125, "learning_rate": 0.00035398737542854936, "loss": 5.0534, "mean_token_accuracy": 0.20998377948999405, "num_tokens": 78050827.0, "step": 34965 }, { "entropy": 5.348815298080444, "epoch": 3.927500421182681, "grad_norm": 0.9921875, "learning_rate": 0.0003539497807238969, "loss": 4.9992, "mean_token_accuracy": 0.2160017505288124, "num_tokens": 78062241.0, "step": 34970 }, { "entropy": 5.42320876121521, "epoch": 3.9280619980906386, "grad_norm": 1.0078125, "learning_rate": 0.00035391218350545287, "loss": 5.0611, "mean_token_accuracy": 0.21313002854585647, "num_tokens": 78073611.0, "step": 34975 }, { "entropy": 5.328111171722412, "epoch": 3.9286235749985963, "grad_norm": 0.9609375, "learning_rate": 0.00035387458377441434, "loss": 4.8997, "mean_token_accuracy": 0.225292606651783, "num_tokens": 78084212.0, "step": 34980 }, { "entropy": 5.305535364151001, "epoch": 3.9291851519065535, "grad_norm": 0.94921875, "learning_rate": 0.0003538369815319784, "loss": 4.9271, "mean_token_accuracy": 0.21925136297941208, "num_tokens": 78094696.0, "step": 34985 }, { "entropy": 5.281348609924317, "epoch": 3.929746728814511, "grad_norm": 1.09375, "learning_rate": 0.00035379937677934245, "loss": 4.9012, "mean_token_accuracy": 0.22395480722188948, "num_tokens": 78106204.0, "step": 34990 }, { "entropy": 5.415148496627808, "epoch": 3.930308305722469, "grad_norm": 0.94921875, "learning_rate": 0.0003537617695177037, "loss": 5.1229, "mean_token_accuracy": 0.21057090759277344, "num_tokens": 78118660.0, "step": 34995 }, { "entropy": 5.316461753845215, "epoch": 3.930869882630426, "grad_norm": 1.03125, "learning_rate": 0.00035372415974825974, "loss": 4.883, "mean_token_accuracy": 0.22155152559280394, "num_tokens": 78129507.0, "step": 35000 }, { "entropy": 5.397950029373169, "epoch": 3.9314314595383837, "grad_norm": 1.0234375, "learning_rate": 0.00035368654747220795, "loss": 4.9842, "mean_token_accuracy": 0.21713715344667434, "num_tokens": 78140137.0, "step": 35005 }, { "entropy": 5.375945711135865, "epoch": 3.9319930364463413, "grad_norm": 0.98828125, "learning_rate": 0.00035364893269074606, "loss": 5.0487, "mean_token_accuracy": 0.2095806673169136, "num_tokens": 78152484.0, "step": 35010 }, { "entropy": 5.423652982711792, "epoch": 3.932554613354299, "grad_norm": 0.9453125, "learning_rate": 0.00035361131540507157, "loss": 5.0626, "mean_token_accuracy": 0.21409189701080322, "num_tokens": 78164559.0, "step": 35015 }, { "entropy": 5.338519191741943, "epoch": 3.9331161902622567, "grad_norm": 0.96484375, "learning_rate": 0.0003535736956163823, "loss": 4.9446, "mean_token_accuracy": 0.21765755414962767, "num_tokens": 78175236.0, "step": 35020 }, { "entropy": 5.38746657371521, "epoch": 3.933677767170214, "grad_norm": 1.03125, "learning_rate": 0.00035353607332587613, "loss": 5.0533, "mean_token_accuracy": 0.21620997041463852, "num_tokens": 78186753.0, "step": 35025 }, { "entropy": 5.460506629943848, "epoch": 3.9342393440781716, "grad_norm": 1.03125, "learning_rate": 0.0003534984485347509, "loss": 5.1641, "mean_token_accuracy": 0.20795054882764816, "num_tokens": 78199207.0, "step": 35030 }, { "entropy": 5.536807584762573, "epoch": 3.934800920986129, "grad_norm": 0.921875, "learning_rate": 0.0003534608212442046, "loss": 5.189, "mean_token_accuracy": 0.20577844530344008, "num_tokens": 78212177.0, "step": 35035 }, { "entropy": 5.404459142684937, "epoch": 3.9353624978940864, "grad_norm": 1.0859375, "learning_rate": 0.00035342319145543533, "loss": 4.9738, "mean_token_accuracy": 0.21205434650182725, "num_tokens": 78223925.0, "step": 35040 }, { "entropy": 5.354441928863525, "epoch": 3.935924074802044, "grad_norm": 1.0078125, "learning_rate": 0.00035338555916964126, "loss": 4.9782, "mean_token_accuracy": 0.21574638336896895, "num_tokens": 78234593.0, "step": 35045 }, { "entropy": 5.337656450271607, "epoch": 3.9364856517100018, "grad_norm": 0.97265625, "learning_rate": 0.00035334792438802056, "loss": 5.0451, "mean_token_accuracy": 0.21589228212833406, "num_tokens": 78245457.0, "step": 35050 }, { "entropy": 5.357191896438598, "epoch": 3.937047228617959, "grad_norm": 0.91015625, "learning_rate": 0.0003533102871117716, "loss": 4.972, "mean_token_accuracy": 0.2216845765709877, "num_tokens": 78256394.0, "step": 35055 }, { "entropy": 5.431589555740357, "epoch": 3.9376088055259166, "grad_norm": 1.0234375, "learning_rate": 0.0003532726473420927, "loss": 5.0335, "mean_token_accuracy": 0.21491375267505647, "num_tokens": 78268889.0, "step": 35060 }, { "entropy": 5.307046604156494, "epoch": 3.9381703824338743, "grad_norm": 1.125, "learning_rate": 0.0003532350050801823, "loss": 4.931, "mean_token_accuracy": 0.21831417679786683, "num_tokens": 78280441.0, "step": 35065 }, { "entropy": 5.354033422470093, "epoch": 3.938731959341832, "grad_norm": 1.0703125, "learning_rate": 0.00035319736032723905, "loss": 5.0365, "mean_token_accuracy": 0.21797335594892503, "num_tokens": 78291366.0, "step": 35070 }, { "entropy": 5.423819255828858, "epoch": 3.9392935362497896, "grad_norm": 1.015625, "learning_rate": 0.0003531597130844616, "loss": 5.0396, "mean_token_accuracy": 0.21057135611772537, "num_tokens": 78301541.0, "step": 35075 }, { "entropy": 5.419572639465332, "epoch": 3.939855113157747, "grad_norm": 1.1015625, "learning_rate": 0.00035312206335304843, "loss": 5.0247, "mean_token_accuracy": 0.2156011864542961, "num_tokens": 78311782.0, "step": 35080 }, { "entropy": 5.313531827926636, "epoch": 3.9404166900657045, "grad_norm": 1.109375, "learning_rate": 0.00035308441113419855, "loss": 4.973, "mean_token_accuracy": 0.21382860839366913, "num_tokens": 78321636.0, "step": 35085 }, { "entropy": 5.462100219726563, "epoch": 3.940978266973662, "grad_norm": 0.9375, "learning_rate": 0.00035304675642911074, "loss": 5.065, "mean_token_accuracy": 0.21820736229419707, "num_tokens": 78332882.0, "step": 35090 }, { "entropy": 5.4580240726470945, "epoch": 3.9415398438816194, "grad_norm": 1.0625, "learning_rate": 0.0003530090992389838, "loss": 5.1077, "mean_token_accuracy": 0.21289365589618683, "num_tokens": 78345122.0, "step": 35095 }, { "entropy": 5.424880123138427, "epoch": 3.942101420789577, "grad_norm": 1.0703125, "learning_rate": 0.000352971439565017, "loss": 5.0437, "mean_token_accuracy": 0.21755089312791825, "num_tokens": 78355730.0, "step": 35100 }, { "entropy": 5.33050765991211, "epoch": 3.9426629976975347, "grad_norm": 0.94140625, "learning_rate": 0.00035293377740840934, "loss": 4.9541, "mean_token_accuracy": 0.22511381953954696, "num_tokens": 78366651.0, "step": 35105 }, { "entropy": 5.31247501373291, "epoch": 3.9432245746054924, "grad_norm": 0.96484375, "learning_rate": 0.00035289611277036, "loss": 4.9087, "mean_token_accuracy": 0.22682802230119706, "num_tokens": 78377633.0, "step": 35110 }, { "entropy": 5.351218271255493, "epoch": 3.94378615151345, "grad_norm": 0.9375, "learning_rate": 0.0003528584456520681, "loss": 4.9839, "mean_token_accuracy": 0.2156555250287056, "num_tokens": 78389038.0, "step": 35115 }, { "entropy": 5.311679220199585, "epoch": 3.9443477284214072, "grad_norm": 0.9140625, "learning_rate": 0.00035282077605473317, "loss": 5.0356, "mean_token_accuracy": 0.2086957722902298, "num_tokens": 78401045.0, "step": 35120 }, { "entropy": 5.354515314102173, "epoch": 3.944909305329365, "grad_norm": 0.9609375, "learning_rate": 0.0003527831039795545, "loss": 5.0508, "mean_token_accuracy": 0.20779362320899963, "num_tokens": 78413013.0, "step": 35125 }, { "entropy": 5.284785604476928, "epoch": 3.9454708822373226, "grad_norm": 1.0, "learning_rate": 0.0003527454294277316, "loss": 4.9346, "mean_token_accuracy": 0.22698598206043244, "num_tokens": 78423794.0, "step": 35130 }, { "entropy": 5.332569646835327, "epoch": 3.94603245914528, "grad_norm": 1.046875, "learning_rate": 0.0003527077524004642, "loss": 4.9551, "mean_token_accuracy": 0.22336965054273605, "num_tokens": 78434902.0, "step": 35135 }, { "entropy": 5.347472286224365, "epoch": 3.9465940360532374, "grad_norm": 1.0078125, "learning_rate": 0.00035267007289895176, "loss": 4.9563, "mean_token_accuracy": 0.2202248677611351, "num_tokens": 78446114.0, "step": 35140 }, { "entropy": 5.342621183395385, "epoch": 3.947155612961195, "grad_norm": 0.95703125, "learning_rate": 0.00035263239092439417, "loss": 4.9139, "mean_token_accuracy": 0.228553931415081, "num_tokens": 78456882.0, "step": 35145 }, { "entropy": 5.3503124713897705, "epoch": 3.9477171898691523, "grad_norm": 1.0546875, "learning_rate": 0.00035259470647799104, "loss": 4.9094, "mean_token_accuracy": 0.22682185471057892, "num_tokens": 78467416.0, "step": 35150 }, { "entropy": 5.274475383758545, "epoch": 3.94827876677711, "grad_norm": 1.1171875, "learning_rate": 0.00035255701956094236, "loss": 4.9135, "mean_token_accuracy": 0.22802285104990005, "num_tokens": 78477364.0, "step": 35155 }, { "entropy": 5.311997556686402, "epoch": 3.9488403436850676, "grad_norm": 1.0078125, "learning_rate": 0.00035251933017444814, "loss": 4.9698, "mean_token_accuracy": 0.21983757764101028, "num_tokens": 78488396.0, "step": 35160 }, { "entropy": 5.349977922439575, "epoch": 3.9494019205930253, "grad_norm": 0.98828125, "learning_rate": 0.00035248163831970837, "loss": 4.9506, "mean_token_accuracy": 0.21643757224082946, "num_tokens": 78498586.0, "step": 35165 }, { "entropy": 5.398192310333252, "epoch": 3.949963497500983, "grad_norm": 0.9765625, "learning_rate": 0.00035244394399792304, "loss": 4.9437, "mean_token_accuracy": 0.2248475506901741, "num_tokens": 78509664.0, "step": 35170 }, { "entropy": 5.479954433441162, "epoch": 3.95052507440894, "grad_norm": 0.98828125, "learning_rate": 0.0003524062472102927, "loss": 5.1665, "mean_token_accuracy": 0.21790126264095305, "num_tokens": 78521950.0, "step": 35175 }, { "entropy": 5.369222974777221, "epoch": 3.951086651316898, "grad_norm": 0.98828125, "learning_rate": 0.0003523685479580174, "loss": 5.0618, "mean_token_accuracy": 0.2112535610795021, "num_tokens": 78532943.0, "step": 35180 }, { "entropy": 5.277353143692016, "epoch": 3.9516482282248555, "grad_norm": 0.9609375, "learning_rate": 0.0003523308462422974, "loss": 4.8606, "mean_token_accuracy": 0.2257692039012909, "num_tokens": 78544042.0, "step": 35185 }, { "entropy": 5.304129314422608, "epoch": 3.9522098051328127, "grad_norm": 0.9296875, "learning_rate": 0.0003522931420643334, "loss": 4.9018, "mean_token_accuracy": 0.22221378833055497, "num_tokens": 78554812.0, "step": 35190 }, { "entropy": 5.262289428710938, "epoch": 3.9527713820407704, "grad_norm": 1.09375, "learning_rate": 0.0003522554354253257, "loss": 4.9024, "mean_token_accuracy": 0.2225796490907669, "num_tokens": 78565036.0, "step": 35195 }, { "entropy": 5.206549501419067, "epoch": 3.953332958948728, "grad_norm": 0.9453125, "learning_rate": 0.00035221772632647503, "loss": 4.8542, "mean_token_accuracy": 0.22893341034650802, "num_tokens": 78575420.0, "step": 35200 }, { "entropy": 5.386279201507568, "epoch": 3.9538945358566857, "grad_norm": 1.015625, "learning_rate": 0.00035218001476898194, "loss": 5.0296, "mean_token_accuracy": 0.22270840257406235, "num_tokens": 78586670.0, "step": 35205 }, { "entropy": 5.27560567855835, "epoch": 3.9544561127646434, "grad_norm": 0.91796875, "learning_rate": 0.0003521423007540472, "loss": 4.9112, "mean_token_accuracy": 0.22069099098443984, "num_tokens": 78598048.0, "step": 35210 }, { "entropy": 5.314364004135132, "epoch": 3.9550176896726006, "grad_norm": 0.8671875, "learning_rate": 0.0003521045842828718, "loss": 5.0255, "mean_token_accuracy": 0.21850430220365524, "num_tokens": 78610364.0, "step": 35215 }, { "entropy": 5.360458278656006, "epoch": 3.9555792665805583, "grad_norm": 0.94140625, "learning_rate": 0.0003520668653566565, "loss": 4.9897, "mean_token_accuracy": 0.2133463904261589, "num_tokens": 78622117.0, "step": 35220 }, { "entropy": 5.343085861206054, "epoch": 3.956140843488516, "grad_norm": 0.99609375, "learning_rate": 0.0003520291439766024, "loss": 4.9243, "mean_token_accuracy": 0.2217706948518753, "num_tokens": 78632894.0, "step": 35225 }, { "entropy": 5.331859397888183, "epoch": 3.956702420396473, "grad_norm": 0.96484375, "learning_rate": 0.00035199142014391034, "loss": 4.953, "mean_token_accuracy": 0.22255935817956923, "num_tokens": 78643851.0, "step": 35230 }, { "entropy": 5.340222120285034, "epoch": 3.957263997304431, "grad_norm": 1.03125, "learning_rate": 0.00035195369385978165, "loss": 5.0032, "mean_token_accuracy": 0.21705972254276276, "num_tokens": 78655097.0, "step": 35235 }, { "entropy": 5.2687132358551025, "epoch": 3.9578255742123885, "grad_norm": 0.8984375, "learning_rate": 0.00035191596512541747, "loss": 4.9021, "mean_token_accuracy": 0.22267247289419173, "num_tokens": 78667572.0, "step": 35240 }, { "entropy": 5.4215349674224855, "epoch": 3.9583871511203457, "grad_norm": 0.99609375, "learning_rate": 0.0003518782339420192, "loss": 5.0161, "mean_token_accuracy": 0.21417624205350877, "num_tokens": 78678858.0, "step": 35245 }, { "entropy": 5.318108177185058, "epoch": 3.9589487280283033, "grad_norm": 0.99609375, "learning_rate": 0.00035184050031078815, "loss": 4.8339, "mean_token_accuracy": 0.2234713226556778, "num_tokens": 78688074.0, "step": 35250 }, { "entropy": 5.228628015518188, "epoch": 3.959510304936261, "grad_norm": 1.0234375, "learning_rate": 0.00035180276423292566, "loss": 4.9223, "mean_token_accuracy": 0.21468404233455657, "num_tokens": 78698805.0, "step": 35255 }, { "entropy": 5.181595230102539, "epoch": 3.9600718818442187, "grad_norm": 1.0, "learning_rate": 0.0003517650257096334, "loss": 4.8796, "mean_token_accuracy": 0.22290850430727005, "num_tokens": 78710636.0, "step": 35260 }, { "entropy": 5.292023038864135, "epoch": 3.9606334587521763, "grad_norm": 1.1328125, "learning_rate": 0.00035172728474211306, "loss": 4.9624, "mean_token_accuracy": 0.2233498752117157, "num_tokens": 78721464.0, "step": 35265 }, { "entropy": 5.395468616485596, "epoch": 3.9611950356601335, "grad_norm": 1.0078125, "learning_rate": 0.00035168954133156613, "loss": 4.9553, "mean_token_accuracy": 0.21887556612491607, "num_tokens": 78733306.0, "step": 35270 }, { "entropy": 5.42512617111206, "epoch": 3.961756612568091, "grad_norm": 0.984375, "learning_rate": 0.0003516517954791944, "loss": 5.0836, "mean_token_accuracy": 0.21382859945297242, "num_tokens": 78745254.0, "step": 35275 }, { "entropy": 5.309650039672851, "epoch": 3.962318189476049, "grad_norm": 0.9921875, "learning_rate": 0.00035161404718619986, "loss": 4.911, "mean_token_accuracy": 0.22636700570583343, "num_tokens": 78755796.0, "step": 35280 }, { "entropy": 5.290368461608887, "epoch": 3.962879766384006, "grad_norm": 0.921875, "learning_rate": 0.0003515762964537844, "loss": 4.9801, "mean_token_accuracy": 0.21700799614191055, "num_tokens": 78767394.0, "step": 35285 }, { "entropy": 5.367566013336182, "epoch": 3.9634413432919637, "grad_norm": 0.93359375, "learning_rate": 0.0003515385432831499, "loss": 5.0192, "mean_token_accuracy": 0.22364734560251237, "num_tokens": 78779017.0, "step": 35290 }, { "entropy": 5.415853214263916, "epoch": 3.9640029201999214, "grad_norm": 0.96484375, "learning_rate": 0.0003515007876754984, "loss": 4.9956, "mean_token_accuracy": 0.21351849138736725, "num_tokens": 78789964.0, "step": 35295 }, { "entropy": 5.33529953956604, "epoch": 3.964564497107879, "grad_norm": 1.0546875, "learning_rate": 0.0003514630296320323, "loss": 4.996, "mean_token_accuracy": 0.21875876635313035, "num_tokens": 78801657.0, "step": 35300 }, { "entropy": 5.393939352035522, "epoch": 3.9651260740158367, "grad_norm": 0.984375, "learning_rate": 0.0003514252691539536, "loss": 5.1088, "mean_token_accuracy": 0.22044118344783784, "num_tokens": 78812396.0, "step": 35305 }, { "entropy": 5.310418605804443, "epoch": 3.965687650923794, "grad_norm": 1.0, "learning_rate": 0.00035138750624246466, "loss": 4.9838, "mean_token_accuracy": 0.2133146271109581, "num_tokens": 78823711.0, "step": 35310 }, { "entropy": 5.36651463508606, "epoch": 3.9662492278317516, "grad_norm": 0.93359375, "learning_rate": 0.000351349740898768, "loss": 5.0159, "mean_token_accuracy": 0.21718451678752898, "num_tokens": 78835394.0, "step": 35315 }, { "entropy": 5.32029619216919, "epoch": 3.9668108047397093, "grad_norm": 0.984375, "learning_rate": 0.0003513119731240659, "loss": 4.9729, "mean_token_accuracy": 0.22351225167512895, "num_tokens": 78846180.0, "step": 35320 }, { "entropy": 5.290055847167968, "epoch": 3.9673723816476665, "grad_norm": 0.9140625, "learning_rate": 0.00035127420291956104, "loss": 4.9539, "mean_token_accuracy": 0.22187353521585465, "num_tokens": 78856537.0, "step": 35325 }, { "entropy": 5.328797817230225, "epoch": 3.967933958555624, "grad_norm": 1.0078125, "learning_rate": 0.0003512364302864559, "loss": 4.9727, "mean_token_accuracy": 0.21677847057580948, "num_tokens": 78867416.0, "step": 35330 }, { "entropy": 5.349091911315918, "epoch": 3.968495535463582, "grad_norm": 0.9921875, "learning_rate": 0.0003511986552259533, "loss": 4.9693, "mean_token_accuracy": 0.2165856510400772, "num_tokens": 78878725.0, "step": 35335 }, { "entropy": 5.339759635925293, "epoch": 3.969057112371539, "grad_norm": 1.0859375, "learning_rate": 0.00035116087773925594, "loss": 4.9941, "mean_token_accuracy": 0.21742845922708512, "num_tokens": 78889659.0, "step": 35340 }, { "entropy": 5.249183988571167, "epoch": 3.9696186892794967, "grad_norm": 1.0703125, "learning_rate": 0.0003511230978275667, "loss": 4.8644, "mean_token_accuracy": 0.22357446253299712, "num_tokens": 78900056.0, "step": 35345 }, { "entropy": 5.301784372329712, "epoch": 3.9701802661874543, "grad_norm": 0.984375, "learning_rate": 0.00035108531549208846, "loss": 4.959, "mean_token_accuracy": 0.22608496397733688, "num_tokens": 78911343.0, "step": 35350 }, { "entropy": 5.336179876327515, "epoch": 3.970741843095412, "grad_norm": 1.078125, "learning_rate": 0.00035104753073402433, "loss": 4.9484, "mean_token_accuracy": 0.21938952505588533, "num_tokens": 78921580.0, "step": 35355 }, { "entropy": 5.366355085372925, "epoch": 3.9713034200033697, "grad_norm": 0.94921875, "learning_rate": 0.0003510097435545774, "loss": 4.9676, "mean_token_accuracy": 0.22171651273965837, "num_tokens": 78932810.0, "step": 35360 }, { "entropy": 5.332621240615845, "epoch": 3.971864996911327, "grad_norm": 0.9765625, "learning_rate": 0.00035097195395495057, "loss": 4.9512, "mean_token_accuracy": 0.21959864795207978, "num_tokens": 78945100.0, "step": 35365 }, { "entropy": 5.388849210739136, "epoch": 3.9724265738192845, "grad_norm": 0.98046875, "learning_rate": 0.0003509341619363474, "loss": 4.9939, "mean_token_accuracy": 0.21557445973157882, "num_tokens": 78957284.0, "step": 35370 }, { "entropy": 5.391395616531372, "epoch": 3.972988150727242, "grad_norm": 0.92578125, "learning_rate": 0.00035089636749997095, "loss": 4.9802, "mean_token_accuracy": 0.2293539524078369, "num_tokens": 78968639.0, "step": 35375 }, { "entropy": 5.25002121925354, "epoch": 3.9735497276351994, "grad_norm": 1.046875, "learning_rate": 0.00035085857064702487, "loss": 4.9014, "mean_token_accuracy": 0.22301720231771469, "num_tokens": 78978323.0, "step": 35380 }, { "entropy": 5.337507677078247, "epoch": 3.974111304543157, "grad_norm": 0.953125, "learning_rate": 0.0003508207713787123, "loss": 5.0145, "mean_token_accuracy": 0.2187003791332245, "num_tokens": 78989193.0, "step": 35385 }, { "entropy": 5.295000648498535, "epoch": 3.9746728814511147, "grad_norm": 0.9453125, "learning_rate": 0.00035078296969623716, "loss": 4.8337, "mean_token_accuracy": 0.23241523057222366, "num_tokens": 78999640.0, "step": 35390 }, { "entropy": 5.25071005821228, "epoch": 3.9752344583590724, "grad_norm": 0.98046875, "learning_rate": 0.00035074516560080273, "loss": 4.8861, "mean_token_accuracy": 0.22764895260334014, "num_tokens": 79010468.0, "step": 35395 }, { "entropy": 5.272427272796631, "epoch": 3.97579603526703, "grad_norm": 1.0, "learning_rate": 0.0003507073590936129, "loss": 4.9824, "mean_token_accuracy": 0.21107348948717117, "num_tokens": 79021399.0, "step": 35400 }, { "entropy": 5.299168586730957, "epoch": 3.9763576121749873, "grad_norm": 0.9609375, "learning_rate": 0.00035066955017587135, "loss": 4.9146, "mean_token_accuracy": 0.2204820141196251, "num_tokens": 79031643.0, "step": 35405 }, { "entropy": 5.475370264053344, "epoch": 3.976919189082945, "grad_norm": 1.0234375, "learning_rate": 0.000350631738848782, "loss": 5.1365, "mean_token_accuracy": 0.21205174028873444, "num_tokens": 79041911.0, "step": 35410 }, { "entropy": 5.413081312179566, "epoch": 3.9774807659909026, "grad_norm": 0.92578125, "learning_rate": 0.0003505939251135488, "loss": 5.0805, "mean_token_accuracy": 0.2110368400812149, "num_tokens": 79054698.0, "step": 35415 }, { "entropy": 5.486343288421631, "epoch": 3.97804234289886, "grad_norm": 1.0078125, "learning_rate": 0.0003505561089713756, "loss": 5.1043, "mean_token_accuracy": 0.2069486603140831, "num_tokens": 79065855.0, "step": 35420 }, { "entropy": 5.476979207992554, "epoch": 3.9786039198068175, "grad_norm": 1.015625, "learning_rate": 0.0003505182904234667, "loss": 5.0669, "mean_token_accuracy": 0.2124079167842865, "num_tokens": 79077332.0, "step": 35425 }, { "entropy": 5.352615690231323, "epoch": 3.979165496714775, "grad_norm": 0.9453125, "learning_rate": 0.0003504804694710261, "loss": 5.0089, "mean_token_accuracy": 0.21859672665596008, "num_tokens": 79088996.0, "step": 35430 }, { "entropy": 5.342862224578857, "epoch": 3.9797270736227324, "grad_norm": 0.97265625, "learning_rate": 0.0003504426461152581, "loss": 5.0122, "mean_token_accuracy": 0.2223045065999031, "num_tokens": 79100828.0, "step": 35435 }, { "entropy": 5.312425899505615, "epoch": 3.98028865053069, "grad_norm": 1.03125, "learning_rate": 0.0003504048203573669, "loss": 4.9387, "mean_token_accuracy": 0.222202305495739, "num_tokens": 79112297.0, "step": 35440 }, { "entropy": 5.350941801071167, "epoch": 3.9808502274386477, "grad_norm": 1.109375, "learning_rate": 0.0003503669921985571, "loss": 4.9675, "mean_token_accuracy": 0.21543802618980407, "num_tokens": 79122795.0, "step": 35445 }, { "entropy": 5.310916948318481, "epoch": 3.9814118043466054, "grad_norm": 0.96484375, "learning_rate": 0.000350329161640033, "loss": 4.961, "mean_token_accuracy": 0.21896079927682877, "num_tokens": 79133652.0, "step": 35450 }, { "entropy": 5.328591394424438, "epoch": 3.981973381254563, "grad_norm": 0.9375, "learning_rate": 0.00035029132868299914, "loss": 4.9378, "mean_token_accuracy": 0.224832683801651, "num_tokens": 79144107.0, "step": 35455 }, { "entropy": 5.35670166015625, "epoch": 3.9825349581625202, "grad_norm": 0.91015625, "learning_rate": 0.00035025349332866017, "loss": 4.9689, "mean_token_accuracy": 0.21856579929590225, "num_tokens": 79155900.0, "step": 35460 }, { "entropy": 5.356700229644775, "epoch": 3.983096535070478, "grad_norm": 0.87890625, "learning_rate": 0.00035021565557822085, "loss": 5.0113, "mean_token_accuracy": 0.2162473350763321, "num_tokens": 79167425.0, "step": 35465 }, { "entropy": 5.363798427581787, "epoch": 3.9836581119784356, "grad_norm": 0.9921875, "learning_rate": 0.0003501778154328858, "loss": 5.0609, "mean_token_accuracy": 0.2220173954963684, "num_tokens": 79178880.0, "step": 35470 }, { "entropy": 5.3401697158813475, "epoch": 3.9842196888863928, "grad_norm": 0.875, "learning_rate": 0.0003501399728938599, "loss": 4.9102, "mean_token_accuracy": 0.22661043405532838, "num_tokens": 79190210.0, "step": 35475 }, { "entropy": 5.31838903427124, "epoch": 3.9847812657943504, "grad_norm": 0.96484375, "learning_rate": 0.00035010212796234827, "loss": 4.9423, "mean_token_accuracy": 0.2223057195544243, "num_tokens": 79200497.0, "step": 35480 }, { "entropy": 5.280216360092163, "epoch": 3.985342842702308, "grad_norm": 1.140625, "learning_rate": 0.0003500642806395557, "loss": 4.9589, "mean_token_accuracy": 0.22691920548677444, "num_tokens": 79212305.0, "step": 35485 }, { "entropy": 5.426902008056641, "epoch": 3.9859044196102658, "grad_norm": 0.98828125, "learning_rate": 0.0003500264309266873, "loss": 4.9723, "mean_token_accuracy": 0.22065745741128923, "num_tokens": 79222968.0, "step": 35490 }, { "entropy": 5.423346042633057, "epoch": 3.9864659965182234, "grad_norm": 0.984375, "learning_rate": 0.00034998857882494823, "loss": 5.0106, "mean_token_accuracy": 0.2183726578950882, "num_tokens": 79235064.0, "step": 35495 }, { "entropy": 5.365753841400147, "epoch": 3.9870275734261806, "grad_norm": 1.0234375, "learning_rate": 0.00034995072433554377, "loss": 4.962, "mean_token_accuracy": 0.21878813505172728, "num_tokens": 79245761.0, "step": 35500 }, { "entropy": 5.320128011703491, "epoch": 3.9875891503341383, "grad_norm": 1.03125, "learning_rate": 0.0003499128674596792, "loss": 4.9062, "mean_token_accuracy": 0.2271315947175026, "num_tokens": 79256070.0, "step": 35505 }, { "entropy": 5.333623838424683, "epoch": 3.988150727242096, "grad_norm": 1.0703125, "learning_rate": 0.00034987500819855976, "loss": 5.0065, "mean_token_accuracy": 0.21460554599761963, "num_tokens": 79266322.0, "step": 35510 }, { "entropy": 5.4118382930755615, "epoch": 3.988712304150053, "grad_norm": 1.015625, "learning_rate": 0.00034983714655339115, "loss": 5.0461, "mean_token_accuracy": 0.21961329281330108, "num_tokens": 79277272.0, "step": 35515 }, { "entropy": 5.40453143119812, "epoch": 3.989273881058011, "grad_norm": 1.109375, "learning_rate": 0.0003497992825253787, "loss": 5.0157, "mean_token_accuracy": 0.21363062411546707, "num_tokens": 79288463.0, "step": 35520 }, { "entropy": 5.393286418914795, "epoch": 3.9898354579659685, "grad_norm": 1.015625, "learning_rate": 0.00034976141611572817, "loss": 4.9618, "mean_token_accuracy": 0.22115608006715776, "num_tokens": 79298655.0, "step": 35525 }, { "entropy": 5.316653680801392, "epoch": 3.9903970348739257, "grad_norm": 0.91796875, "learning_rate": 0.00034972354732564506, "loss": 4.9363, "mean_token_accuracy": 0.22825133800506592, "num_tokens": 79309731.0, "step": 35530 }, { "entropy": 5.332367372512818, "epoch": 3.9909586117818834, "grad_norm": 0.8984375, "learning_rate": 0.00034968567615633516, "loss": 5.0021, "mean_token_accuracy": 0.22008467018604277, "num_tokens": 79321712.0, "step": 35535 }, { "entropy": 5.264921188354492, "epoch": 3.991520188689841, "grad_norm": 0.9375, "learning_rate": 0.00034964780260900445, "loss": 4.9419, "mean_token_accuracy": 0.22396388798952102, "num_tokens": 79333159.0, "step": 35540 }, { "entropy": 5.399532175064087, "epoch": 3.9920817655977987, "grad_norm": 0.9921875, "learning_rate": 0.00034960992668485875, "loss": 4.9752, "mean_token_accuracy": 0.2214301973581314, "num_tokens": 79344012.0, "step": 35545 }, { "entropy": 5.347935199737549, "epoch": 3.9926433425057564, "grad_norm": 1.0546875, "learning_rate": 0.00034957204838510406, "loss": 5.0309, "mean_token_accuracy": 0.21926185190677644, "num_tokens": 79355162.0, "step": 35550 }, { "entropy": 5.324479007720948, "epoch": 3.9932049194137136, "grad_norm": 1.0, "learning_rate": 0.00034953416771094645, "loss": 4.9017, "mean_token_accuracy": 0.2238995462656021, "num_tokens": 79365605.0, "step": 35555 }, { "entropy": 5.312754917144775, "epoch": 3.9937664963216712, "grad_norm": 0.97265625, "learning_rate": 0.000349496284663592, "loss": 4.9698, "mean_token_accuracy": 0.21817588061094284, "num_tokens": 79376548.0, "step": 35560 }, { "entropy": 5.343481397628784, "epoch": 3.994328073229629, "grad_norm": 1.1171875, "learning_rate": 0.00034945839924424696, "loss": 4.897, "mean_token_accuracy": 0.22986447364091872, "num_tokens": 79388352.0, "step": 35565 }, { "entropy": 5.330991125106811, "epoch": 3.994889650137586, "grad_norm": 0.8984375, "learning_rate": 0.0003494205114541176, "loss": 4.959, "mean_token_accuracy": 0.22196414321660995, "num_tokens": 79399110.0, "step": 35570 }, { "entropy": 5.34568305015564, "epoch": 3.995451227045544, "grad_norm": 1.0390625, "learning_rate": 0.00034938262129441026, "loss": 5.0485, "mean_token_accuracy": 0.21151814758777618, "num_tokens": 79410350.0, "step": 35575 }, { "entropy": 5.352759599685669, "epoch": 3.9960128039535014, "grad_norm": 0.95703125, "learning_rate": 0.0003493447287663315, "loss": 4.8923, "mean_token_accuracy": 0.22151091396808625, "num_tokens": 79421015.0, "step": 35580 }, { "entropy": 5.363454055786133, "epoch": 3.996574380861459, "grad_norm": 1.0859375, "learning_rate": 0.0003493068338710877, "loss": 5.029, "mean_token_accuracy": 0.2223750188946724, "num_tokens": 79432200.0, "step": 35585 }, { "entropy": 5.39575834274292, "epoch": 3.9971359577694168, "grad_norm": 0.92578125, "learning_rate": 0.0003492689366098855, "loss": 5.0842, "mean_token_accuracy": 0.21461691707372665, "num_tokens": 79445121.0, "step": 35590 }, { "entropy": 5.309022617340088, "epoch": 3.997697534677374, "grad_norm": 0.94140625, "learning_rate": 0.00034923103698393147, "loss": 4.8825, "mean_token_accuracy": 0.22232760787010192, "num_tokens": 79456533.0, "step": 35595 }, { "entropy": 5.300660610198975, "epoch": 3.9982591115853316, "grad_norm": 0.96484375, "learning_rate": 0.0003491931349944325, "loss": 4.9138, "mean_token_accuracy": 0.22674213945865632, "num_tokens": 79466365.0, "step": 35600 }, { "entropy": 5.408140659332275, "epoch": 3.9988206884932893, "grad_norm": 0.94921875, "learning_rate": 0.00034915523064259533, "loss": 5.0609, "mean_token_accuracy": 0.21128993332386017, "num_tokens": 79477203.0, "step": 35605 }, { "entropy": 5.256291198730469, "epoch": 3.9993822654012465, "grad_norm": 1.015625, "learning_rate": 0.0003491173239296268, "loss": 4.9374, "mean_token_accuracy": 0.21757977604866027, "num_tokens": 79490062.0, "step": 35610 }, { "entropy": 5.402770853042602, "epoch": 3.999943842309204, "grad_norm": 1.0234375, "learning_rate": 0.000349079414856734, "loss": 5.025, "mean_token_accuracy": 0.21764834374189376, "num_tokens": 79501727.0, "step": 35615 }, { "entropy": 5.350081973605686, "epoch": 4.000449261526366, "grad_norm": 1.0078125, "learning_rate": 0.0003490415034251239, "loss": 4.8058, "mean_token_accuracy": 0.23239662746588388, "num_tokens": 79510304.0, "step": 35620 }, { "entropy": 5.362659168243408, "epoch": 4.001010838434324, "grad_norm": 1.0390625, "learning_rate": 0.0003490035896360036, "loss": 4.9398, "mean_token_accuracy": 0.21907162368297578, "num_tokens": 79521811.0, "step": 35625 }, { "entropy": 5.310119724273681, "epoch": 4.001572415342281, "grad_norm": 0.94921875, "learning_rate": 0.00034896567349058027, "loss": 4.8311, "mean_token_accuracy": 0.23497136533260346, "num_tokens": 79532756.0, "step": 35630 }, { "entropy": 5.3906646251678465, "epoch": 4.002133992250239, "grad_norm": 0.9609375, "learning_rate": 0.00034892775499006126, "loss": 4.9339, "mean_token_accuracy": 0.21891241222620011, "num_tokens": 79544945.0, "step": 35635 }, { "entropy": 5.36221752166748, "epoch": 4.002695569158196, "grad_norm": 1.015625, "learning_rate": 0.0003488898341356538, "loss": 5.0011, "mean_token_accuracy": 0.22100998610258102, "num_tokens": 79555374.0, "step": 35640 }, { "entropy": 5.3484093189239506, "epoch": 4.0032571460661535, "grad_norm": 0.89453125, "learning_rate": 0.00034885191092856545, "loss": 4.8984, "mean_token_accuracy": 0.22541451156139375, "num_tokens": 79566598.0, "step": 35645 }, { "entropy": 5.390035963058471, "epoch": 4.003818722974112, "grad_norm": 1.0625, "learning_rate": 0.0003488139853700036, "loss": 4.901, "mean_token_accuracy": 0.23107196539640426, "num_tokens": 79577859.0, "step": 35650 }, { "entropy": 5.313963317871094, "epoch": 4.004380299882069, "grad_norm": 1.0234375, "learning_rate": 0.00034877605746117576, "loss": 4.8815, "mean_token_accuracy": 0.2243813991546631, "num_tokens": 79588704.0, "step": 35655 }, { "entropy": 5.187617635726928, "epoch": 4.004941876790026, "grad_norm": 1.0234375, "learning_rate": 0.0003487381272032897, "loss": 4.7392, "mean_token_accuracy": 0.2395566537976265, "num_tokens": 79599493.0, "step": 35660 }, { "entropy": 5.34735255241394, "epoch": 4.005503453697984, "grad_norm": 0.9296875, "learning_rate": 0.000348700194597553, "loss": 4.8921, "mean_token_accuracy": 0.23031046837568284, "num_tokens": 79610305.0, "step": 35665 }, { "entropy": 5.415438222885132, "epoch": 4.006065030605941, "grad_norm": 0.85546875, "learning_rate": 0.00034866225964517354, "loss": 4.9923, "mean_token_accuracy": 0.22049729526042938, "num_tokens": 79622077.0, "step": 35670 }, { "entropy": 5.4395647048950195, "epoch": 4.006626607513899, "grad_norm": 0.9296875, "learning_rate": 0.0003486243223473592, "loss": 5.0318, "mean_token_accuracy": 0.22212042659521103, "num_tokens": 79634999.0, "step": 35675 }, { "entropy": 5.324721097946167, "epoch": 4.007188184421857, "grad_norm": 1.046875, "learning_rate": 0.00034858638270531786, "loss": 4.8146, "mean_token_accuracy": 0.23227564990520477, "num_tokens": 79646152.0, "step": 35680 }, { "entropy": 5.337189197540283, "epoch": 4.007749761329814, "grad_norm": 0.96484375, "learning_rate": 0.00034854844072025755, "loss": 4.9469, "mean_token_accuracy": 0.22656266689300536, "num_tokens": 79657941.0, "step": 35685 }, { "entropy": 5.30948281288147, "epoch": 4.008311338237772, "grad_norm": 1.0625, "learning_rate": 0.00034851049639338637, "loss": 4.8159, "mean_token_accuracy": 0.23552124500274657, "num_tokens": 79667713.0, "step": 35690 }, { "entropy": 5.3425657749176025, "epoch": 4.008872915145729, "grad_norm": 0.96875, "learning_rate": 0.0003484725497259125, "loss": 4.878, "mean_token_accuracy": 0.2266979619860649, "num_tokens": 79679351.0, "step": 35695 }, { "entropy": 5.384876346588134, "epoch": 4.009434492053686, "grad_norm": 0.98828125, "learning_rate": 0.00034843460071904407, "loss": 5.0146, "mean_token_accuracy": 0.21544950753450393, "num_tokens": 79689406.0, "step": 35700 }, { "entropy": 5.3059299945831295, "epoch": 4.0099960689616445, "grad_norm": 1.046875, "learning_rate": 0.00034839664937398964, "loss": 4.8135, "mean_token_accuracy": 0.2257569268345833, "num_tokens": 79700231.0, "step": 35705 }, { "entropy": 5.323565912246704, "epoch": 4.010557645869602, "grad_norm": 0.98046875, "learning_rate": 0.0003483586956919572, "loss": 4.901, "mean_token_accuracy": 0.22826377004384996, "num_tokens": 79711721.0, "step": 35710 }, { "entropy": 5.214164304733276, "epoch": 4.011119222777559, "grad_norm": 1.0, "learning_rate": 0.0003483207396741556, "loss": 4.7843, "mean_token_accuracy": 0.2241688370704651, "num_tokens": 79721795.0, "step": 35715 }, { "entropy": 5.414013767242432, "epoch": 4.011680799685517, "grad_norm": 0.91796875, "learning_rate": 0.0003482827813217932, "loss": 5.0157, "mean_token_accuracy": 0.21992823779582976, "num_tokens": 79734356.0, "step": 35720 }, { "entropy": 5.2959051609039305, "epoch": 4.012242376593474, "grad_norm": 0.9609375, "learning_rate": 0.00034824482063607856, "loss": 4.8725, "mean_token_accuracy": 0.22849412262439728, "num_tokens": 79745847.0, "step": 35725 }, { "entropy": 5.2945802211761475, "epoch": 4.012803953501432, "grad_norm": 0.9140625, "learning_rate": 0.0003482068576182204, "loss": 4.9175, "mean_token_accuracy": 0.2229880303144455, "num_tokens": 79756580.0, "step": 35730 }, { "entropy": 5.378960514068604, "epoch": 4.01336553040939, "grad_norm": 1.015625, "learning_rate": 0.00034816889226942755, "loss": 4.9662, "mean_token_accuracy": 0.22178370058536528, "num_tokens": 79767912.0, "step": 35735 }, { "entropy": 5.407948589324951, "epoch": 4.013927107317347, "grad_norm": 1.0625, "learning_rate": 0.0003481309245909088, "loss": 4.9987, "mean_token_accuracy": 0.22079693377017975, "num_tokens": 79778572.0, "step": 35740 }, { "entropy": 5.326175737380981, "epoch": 4.014488684225305, "grad_norm": 0.96484375, "learning_rate": 0.0003480929545838731, "loss": 4.8567, "mean_token_accuracy": 0.23198736310005189, "num_tokens": 79789237.0, "step": 35745 }, { "entropy": 5.4087996006011965, "epoch": 4.015050261133262, "grad_norm": 0.93359375, "learning_rate": 0.0003480549822495293, "loss": 5.074, "mean_token_accuracy": 0.21715234220027924, "num_tokens": 79800271.0, "step": 35750 }, { "entropy": 5.38117036819458, "epoch": 4.015611838041219, "grad_norm": 0.84765625, "learning_rate": 0.00034801700758908653, "loss": 4.9219, "mean_token_accuracy": 0.22003119587898254, "num_tokens": 79811378.0, "step": 35755 }, { "entropy": 5.366988706588745, "epoch": 4.0161734149491775, "grad_norm": 0.9765625, "learning_rate": 0.00034797903060375396, "loss": 4.9734, "mean_token_accuracy": 0.22263508141040803, "num_tokens": 79822795.0, "step": 35760 }, { "entropy": 5.3617630958557125, "epoch": 4.016734991857135, "grad_norm": 1.0625, "learning_rate": 0.0003479410512947407, "loss": 4.9852, "mean_token_accuracy": 0.21751251369714736, "num_tokens": 79833331.0, "step": 35765 }, { "entropy": 5.285930347442627, "epoch": 4.017296568765093, "grad_norm": 0.96484375, "learning_rate": 0.00034790306966325606, "loss": 4.8733, "mean_token_accuracy": 0.22795773595571517, "num_tokens": 79844079.0, "step": 35770 }, { "entropy": 5.363169574737549, "epoch": 4.01785814567305, "grad_norm": 0.9765625, "learning_rate": 0.0003478650857105095, "loss": 4.9121, "mean_token_accuracy": 0.2281282901763916, "num_tokens": 79855275.0, "step": 35775 }, { "entropy": 5.361121749877929, "epoch": 4.018419722581007, "grad_norm": 0.9375, "learning_rate": 0.0003478270994377102, "loss": 4.9071, "mean_token_accuracy": 0.22439662218093873, "num_tokens": 79866147.0, "step": 35780 }, { "entropy": 5.347488737106323, "epoch": 4.018981299488965, "grad_norm": 1.03125, "learning_rate": 0.00034778911084606793, "loss": 4.8816, "mean_token_accuracy": 0.2261527433991432, "num_tokens": 79876791.0, "step": 35785 }, { "entropy": 5.34072642326355, "epoch": 4.0195428763969225, "grad_norm": 1.03125, "learning_rate": 0.0003477511199367922, "loss": 4.8918, "mean_token_accuracy": 0.22676541805267333, "num_tokens": 79887817.0, "step": 35790 }, { "entropy": 5.2713642597198485, "epoch": 4.02010445330488, "grad_norm": 0.8671875, "learning_rate": 0.00034771312671109256, "loss": 4.8752, "mean_token_accuracy": 0.2210535943508148, "num_tokens": 79899055.0, "step": 35795 }, { "entropy": 5.3012939453125, "epoch": 4.020666030212838, "grad_norm": 0.94921875, "learning_rate": 0.0003476751311701787, "loss": 4.8928, "mean_token_accuracy": 0.22702090442180634, "num_tokens": 79912066.0, "step": 35800 }, { "entropy": 5.398511219024658, "epoch": 4.021227607120795, "grad_norm": 1.0, "learning_rate": 0.0003476371333152605, "loss": 4.9914, "mean_token_accuracy": 0.21970458328723907, "num_tokens": 79922845.0, "step": 35805 }, { "entropy": 5.354999589920044, "epoch": 4.021789184028753, "grad_norm": 0.953125, "learning_rate": 0.00034759913314754776, "loss": 4.9484, "mean_token_accuracy": 0.2208826094865799, "num_tokens": 79934732.0, "step": 35810 }, { "entropy": 5.391208219528198, "epoch": 4.02235076093671, "grad_norm": 0.98046875, "learning_rate": 0.00034756113066825045, "loss": 4.9681, "mean_token_accuracy": 0.2246980145573616, "num_tokens": 79945182.0, "step": 35815 }, { "entropy": 5.373191881179809, "epoch": 4.022912337844668, "grad_norm": 0.94140625, "learning_rate": 0.0003475231258785787, "loss": 4.973, "mean_token_accuracy": 0.22054938673973085, "num_tokens": 79956929.0, "step": 35820 }, { "entropy": 5.332314825057983, "epoch": 4.023473914752626, "grad_norm": 0.99609375, "learning_rate": 0.0003474851187797424, "loss": 4.9206, "mean_token_accuracy": 0.21810028851032257, "num_tokens": 79968361.0, "step": 35825 }, { "entropy": 5.337249803543091, "epoch": 4.024035491660583, "grad_norm": 0.9609375, "learning_rate": 0.00034744710937295185, "loss": 4.954, "mean_token_accuracy": 0.22067830264568328, "num_tokens": 79978833.0, "step": 35830 }, { "entropy": 5.302785110473633, "epoch": 4.02459706856854, "grad_norm": 0.99609375, "learning_rate": 0.00034740909765941725, "loss": 4.9175, "mean_token_accuracy": 0.22347631752490998, "num_tokens": 79989997.0, "step": 35835 }, { "entropy": 5.283454322814942, "epoch": 4.025158645476498, "grad_norm": 1.015625, "learning_rate": 0.0003473710836403489, "loss": 4.8935, "mean_token_accuracy": 0.22082237303256988, "num_tokens": 80001218.0, "step": 35840 }, { "entropy": 5.464446067810059, "epoch": 4.0257202223844555, "grad_norm": 0.9140625, "learning_rate": 0.0003473330673169572, "loss": 5.0486, "mean_token_accuracy": 0.2181730479001999, "num_tokens": 80013906.0, "step": 35845 }, { "entropy": 5.347693634033203, "epoch": 4.026281799292413, "grad_norm": 0.91015625, "learning_rate": 0.0003472950486904525, "loss": 4.9297, "mean_token_accuracy": 0.21553568989038469, "num_tokens": 80026384.0, "step": 35850 }, { "entropy": 5.34577054977417, "epoch": 4.026843376200371, "grad_norm": 0.96484375, "learning_rate": 0.0003472570277620455, "loss": 4.8617, "mean_token_accuracy": 0.23103515803813934, "num_tokens": 80037718.0, "step": 35855 }, { "entropy": 5.346845245361328, "epoch": 4.027404953108328, "grad_norm": 1.078125, "learning_rate": 0.0003472190045329466, "loss": 4.9625, "mean_token_accuracy": 0.22339367419481276, "num_tokens": 80049081.0, "step": 35860 }, { "entropy": 5.254318475723267, "epoch": 4.027966530016286, "grad_norm": 1.046875, "learning_rate": 0.0003471809790043667, "loss": 4.8749, "mean_token_accuracy": 0.225941401720047, "num_tokens": 80060435.0, "step": 35865 }, { "entropy": 5.36871976852417, "epoch": 4.028528106924243, "grad_norm": 1.140625, "learning_rate": 0.00034714295117751635, "loss": 4.9036, "mean_token_accuracy": 0.22826303094625472, "num_tokens": 80070657.0, "step": 35870 }, { "entropy": 5.294485282897949, "epoch": 4.029089683832201, "grad_norm": 0.96875, "learning_rate": 0.00034710492105360653, "loss": 4.8304, "mean_token_accuracy": 0.23098201900720597, "num_tokens": 80080265.0, "step": 35875 }, { "entropy": 5.312833547592163, "epoch": 4.029651260740159, "grad_norm": 0.90234375, "learning_rate": 0.0003470668886338481, "loss": 4.9154, "mean_token_accuracy": 0.22407266497612, "num_tokens": 80091917.0, "step": 35880 }, { "entropy": 5.296406841278076, "epoch": 4.030212837648116, "grad_norm": 0.96875, "learning_rate": 0.00034702885391945184, "loss": 4.918, "mean_token_accuracy": 0.21938593089580535, "num_tokens": 80103919.0, "step": 35885 }, { "entropy": 5.452708148956299, "epoch": 4.030774414556073, "grad_norm": 0.91796875, "learning_rate": 0.000346990816911629, "loss": 4.9384, "mean_token_accuracy": 0.2213690012693405, "num_tokens": 80115926.0, "step": 35890 }, { "entropy": 5.31996603012085, "epoch": 4.031335991464031, "grad_norm": 0.984375, "learning_rate": 0.0003469527776115906, "loss": 4.8645, "mean_token_accuracy": 0.22716038823127746, "num_tokens": 80127007.0, "step": 35895 }, { "entropy": 5.253648042678833, "epoch": 4.031897568371988, "grad_norm": 1.015625, "learning_rate": 0.00034691473602054793, "loss": 4.9033, "mean_token_accuracy": 0.22362604290246962, "num_tokens": 80138442.0, "step": 35900 }, { "entropy": 5.3670188903808596, "epoch": 4.032459145279946, "grad_norm": 0.9609375, "learning_rate": 0.0003468766921397121, "loss": 4.9274, "mean_token_accuracy": 0.223621965944767, "num_tokens": 80148395.0, "step": 35905 }, { "entropy": 5.363602256774902, "epoch": 4.033020722187904, "grad_norm": 1.0234375, "learning_rate": 0.0003468386459702946, "loss": 4.9278, "mean_token_accuracy": 0.22143317461013795, "num_tokens": 80159348.0, "step": 35910 }, { "entropy": 5.358467292785645, "epoch": 4.033582299095861, "grad_norm": 1.0, "learning_rate": 0.00034680059751350664, "loss": 4.9034, "mean_token_accuracy": 0.2279469832777977, "num_tokens": 80169772.0, "step": 35915 }, { "entropy": 5.322882413864136, "epoch": 4.034143876003819, "grad_norm": 0.9609375, "learning_rate": 0.00034676254677055984, "loss": 4.8959, "mean_token_accuracy": 0.22922544181346893, "num_tokens": 80180538.0, "step": 35920 }, { "entropy": 5.4054646492004395, "epoch": 4.034705452911776, "grad_norm": 0.9765625, "learning_rate": 0.00034672449374266575, "loss": 5.0806, "mean_token_accuracy": 0.21007412075996398, "num_tokens": 80191693.0, "step": 35925 }, { "entropy": 5.339513206481934, "epoch": 4.0352670298197335, "grad_norm": 1.0, "learning_rate": 0.0003466864384310359, "loss": 4.8567, "mean_token_accuracy": 0.23149998039007186, "num_tokens": 80201923.0, "step": 35930 }, { "entropy": 5.374654388427734, "epoch": 4.035828606727692, "grad_norm": 0.95703125, "learning_rate": 0.00034664838083688223, "loss": 4.8564, "mean_token_accuracy": 0.22639152109622956, "num_tokens": 80213588.0, "step": 35935 }, { "entropy": 5.301891326904297, "epoch": 4.036390183635649, "grad_norm": 1.0703125, "learning_rate": 0.00034661032096141615, "loss": 4.883, "mean_token_accuracy": 0.22512781769037246, "num_tokens": 80224780.0, "step": 35940 }, { "entropy": 5.420991992950439, "epoch": 4.036951760543606, "grad_norm": 0.9921875, "learning_rate": 0.0003465722588058497, "loss": 5.0228, "mean_token_accuracy": 0.21716538518667222, "num_tokens": 80235399.0, "step": 35945 }, { "entropy": 5.323662376403808, "epoch": 4.037513337451564, "grad_norm": 1.0390625, "learning_rate": 0.00034653419437139475, "loss": 4.8772, "mean_token_accuracy": 0.2288653701543808, "num_tokens": 80245019.0, "step": 35950 }, { "entropy": 5.366043996810913, "epoch": 4.038074914359521, "grad_norm": 0.953125, "learning_rate": 0.0003464961276592634, "loss": 4.9885, "mean_token_accuracy": 0.22577728927135468, "num_tokens": 80256650.0, "step": 35955 }, { "entropy": 5.305973386764526, "epoch": 4.0386364912674795, "grad_norm": 0.875, "learning_rate": 0.00034645805867066756, "loss": 4.8736, "mean_token_accuracy": 0.2206096976995468, "num_tokens": 80267463.0, "step": 35960 }, { "entropy": 5.355551528930664, "epoch": 4.039198068175437, "grad_norm": 0.9375, "learning_rate": 0.00034641998740681933, "loss": 4.9515, "mean_token_accuracy": 0.22348917573690413, "num_tokens": 80279751.0, "step": 35965 }, { "entropy": 5.328068590164184, "epoch": 4.039759645083394, "grad_norm": 0.9921875, "learning_rate": 0.00034638191386893115, "loss": 4.8893, "mean_token_accuracy": 0.23066311180591584, "num_tokens": 80291249.0, "step": 35970 }, { "entropy": 5.332080268859864, "epoch": 4.040321221991352, "grad_norm": 1.015625, "learning_rate": 0.00034634383805821504, "loss": 4.8588, "mean_token_accuracy": 0.23518844097852706, "num_tokens": 80302082.0, "step": 35975 }, { "entropy": 5.231941890716553, "epoch": 4.040882798899309, "grad_norm": 1.0234375, "learning_rate": 0.00034630575997588353, "loss": 4.8007, "mean_token_accuracy": 0.23936370760202408, "num_tokens": 80312470.0, "step": 35980 }, { "entropy": 5.297620820999145, "epoch": 4.0414443758072665, "grad_norm": 1.0390625, "learning_rate": 0.000346267679623149, "loss": 4.8456, "mean_token_accuracy": 0.23594695776700975, "num_tokens": 80322562.0, "step": 35985 }, { "entropy": 5.24401273727417, "epoch": 4.042005952715225, "grad_norm": 0.9453125, "learning_rate": 0.00034622959700122383, "loss": 4.9138, "mean_token_accuracy": 0.22688017934560775, "num_tokens": 80333434.0, "step": 35990 }, { "entropy": 5.226737689971924, "epoch": 4.042567529623182, "grad_norm": 0.96484375, "learning_rate": 0.0003461915121113206, "loss": 4.8267, "mean_token_accuracy": 0.23215852975845336, "num_tokens": 80345028.0, "step": 35995 }, { "entropy": 5.263515949249268, "epoch": 4.04312910653114, "grad_norm": 1.0390625, "learning_rate": 0.0003461534249546521, "loss": 4.8303, "mean_token_accuracy": 0.2303904786705971, "num_tokens": 80356536.0, "step": 36000 }, { "epoch": 4.04312910653114, "eval_entropy": 5.10593157550063, "eval_loss": 5.10050106048584, "eval_mean_token_accuracy": 0.22143534857079267, "eval_num_tokens": 80356536.0, "eval_runtime": 23.9558, "eval_samples_per_second": 1294.59, "eval_steps_per_second": 161.839, "step": 36000 }, { "entropy": 5.359178161621093, "epoch": 4.043690683439097, "grad_norm": 0.9609375, "learning_rate": 0.000346115335532431, "loss": 4.9782, "mean_token_accuracy": 0.22344818264245986, "num_tokens": 80366874.0, "step": 36005 }, { "entropy": 5.41416745185852, "epoch": 4.044252260347054, "grad_norm": 0.9921875, "learning_rate": 0.00034607724384587006, "loss": 4.8933, "mean_token_accuracy": 0.21368961185216903, "num_tokens": 80378015.0, "step": 36010 }, { "entropy": 5.2436353206634525, "epoch": 4.044813837255012, "grad_norm": 0.98828125, "learning_rate": 0.00034603914989618197, "loss": 4.8519, "mean_token_accuracy": 0.22186829894781113, "num_tokens": 80388423.0, "step": 36015 }, { "entropy": 5.303881978988647, "epoch": 4.04537541416297, "grad_norm": 0.94140625, "learning_rate": 0.0003460010536845799, "loss": 4.9123, "mean_token_accuracy": 0.22972507774829865, "num_tokens": 80399985.0, "step": 36020 }, { "entropy": 5.314314985275269, "epoch": 4.045936991070927, "grad_norm": 0.95703125, "learning_rate": 0.0003459629552122767, "loss": 4.9082, "mean_token_accuracy": 0.2273220419883728, "num_tokens": 80410653.0, "step": 36025 }, { "entropy": 5.313387155532837, "epoch": 4.046498567978885, "grad_norm": 0.97265625, "learning_rate": 0.0003459248544804855, "loss": 4.912, "mean_token_accuracy": 0.2211352825164795, "num_tokens": 80421944.0, "step": 36030 }, { "entropy": 5.4333281993865965, "epoch": 4.047060144886842, "grad_norm": 0.96484375, "learning_rate": 0.0003458867514904194, "loss": 5.0003, "mean_token_accuracy": 0.2197570249438286, "num_tokens": 80433509.0, "step": 36035 }, { "entropy": 5.410898447036743, "epoch": 4.047621721794799, "grad_norm": 1.15625, "learning_rate": 0.0003458486462432916, "loss": 4.9873, "mean_token_accuracy": 0.2215388908982277, "num_tokens": 80444148.0, "step": 36040 }, { "entropy": 5.351002216339111, "epoch": 4.0481832987027575, "grad_norm": 0.99609375, "learning_rate": 0.00034581053874031554, "loss": 4.952, "mean_token_accuracy": 0.22047373354434968, "num_tokens": 80455495.0, "step": 36045 }, { "entropy": 5.318565368652344, "epoch": 4.048744875610715, "grad_norm": 1.0078125, "learning_rate": 0.0003457724289827044, "loss": 4.9814, "mean_token_accuracy": 0.2189271256327629, "num_tokens": 80465846.0, "step": 36050 }, { "entropy": 5.398042488098144, "epoch": 4.049306452518673, "grad_norm": 0.98046875, "learning_rate": 0.0003457343169716716, "loss": 5.0047, "mean_token_accuracy": 0.21851759701967238, "num_tokens": 80477172.0, "step": 36055 }, { "entropy": 5.335282278060913, "epoch": 4.04986802942663, "grad_norm": 0.953125, "learning_rate": 0.00034569620270843087, "loss": 4.8432, "mean_token_accuracy": 0.2303847700357437, "num_tokens": 80487174.0, "step": 36060 }, { "entropy": 5.3667747497558596, "epoch": 4.050429606334587, "grad_norm": 1.0, "learning_rate": 0.00034565808619419554, "loss": 4.9198, "mean_token_accuracy": 0.22330591678619385, "num_tokens": 80497748.0, "step": 36065 }, { "entropy": 5.260837459564209, "epoch": 4.050991183242545, "grad_norm": 0.9765625, "learning_rate": 0.0003456199674301793, "loss": 4.8508, "mean_token_accuracy": 0.22931792140007018, "num_tokens": 80508713.0, "step": 36070 }, { "entropy": 5.3427032947540285, "epoch": 4.051552760150503, "grad_norm": 1.046875, "learning_rate": 0.000345581846417596, "loss": 4.9, "mean_token_accuracy": 0.22784536927938462, "num_tokens": 80518813.0, "step": 36075 }, { "entropy": 5.246268224716187, "epoch": 4.05211433705846, "grad_norm": 1.046875, "learning_rate": 0.00034554372315765927, "loss": 4.8835, "mean_token_accuracy": 0.22304878383874893, "num_tokens": 80529541.0, "step": 36080 }, { "entropy": 5.346269178390503, "epoch": 4.052675913966418, "grad_norm": 1.0078125, "learning_rate": 0.0003455055976515831, "loss": 4.9486, "mean_token_accuracy": 0.22363602370023727, "num_tokens": 80541942.0, "step": 36085 }, { "entropy": 5.414978122711181, "epoch": 4.053237490874375, "grad_norm": 0.984375, "learning_rate": 0.00034546746990058125, "loss": 4.9659, "mean_token_accuracy": 0.2186441108584404, "num_tokens": 80552477.0, "step": 36090 }, { "entropy": 5.337516212463379, "epoch": 4.053799067782332, "grad_norm": 0.98046875, "learning_rate": 0.00034542933990586795, "loss": 4.974, "mean_token_accuracy": 0.21640294343233107, "num_tokens": 80563976.0, "step": 36095 }, { "entropy": 5.344397830963135, "epoch": 4.0543606446902904, "grad_norm": 0.94140625, "learning_rate": 0.00034539120766865713, "loss": 4.9214, "mean_token_accuracy": 0.21911509037017823, "num_tokens": 80575397.0, "step": 36100 }, { "entropy": 5.297573137283325, "epoch": 4.054922221598248, "grad_norm": 1.03125, "learning_rate": 0.0003453530731901628, "loss": 4.9168, "mean_token_accuracy": 0.2219690814614296, "num_tokens": 80587500.0, "step": 36105 }, { "entropy": 5.3101075172424315, "epoch": 4.055483798506206, "grad_norm": 1.078125, "learning_rate": 0.0003453149364715995, "loss": 4.8325, "mean_token_accuracy": 0.22964439988136293, "num_tokens": 80598216.0, "step": 36110 }, { "entropy": 5.299663543701172, "epoch": 4.056045375414163, "grad_norm": 0.98828125, "learning_rate": 0.00034527679751418126, "loss": 4.8865, "mean_token_accuracy": 0.223801825940609, "num_tokens": 80609759.0, "step": 36115 }, { "entropy": 5.376327848434448, "epoch": 4.05660695232212, "grad_norm": 1.0078125, "learning_rate": 0.0003452386563191226, "loss": 4.8982, "mean_token_accuracy": 0.22585987001657487, "num_tokens": 80620587.0, "step": 36120 }, { "entropy": 5.341989755630493, "epoch": 4.057168529230078, "grad_norm": 1.03125, "learning_rate": 0.00034520051288763784, "loss": 5.017, "mean_token_accuracy": 0.21274927407503127, "num_tokens": 80631882.0, "step": 36125 }, { "entropy": 5.368930006027222, "epoch": 4.0577301061380355, "grad_norm": 1.015625, "learning_rate": 0.0003451623672209415, "loss": 4.976, "mean_token_accuracy": 0.22589125186204911, "num_tokens": 80644878.0, "step": 36130 }, { "entropy": 5.246311521530151, "epoch": 4.058291683045993, "grad_norm": 1.0234375, "learning_rate": 0.00034512421932024825, "loss": 4.7666, "mean_token_accuracy": 0.233259217441082, "num_tokens": 80655641.0, "step": 36135 }, { "entropy": 5.312887191772461, "epoch": 4.058853259953951, "grad_norm": 0.93359375, "learning_rate": 0.0003450860691867726, "loss": 4.964, "mean_token_accuracy": 0.21721645891666413, "num_tokens": 80666883.0, "step": 36140 }, { "entropy": 5.331695795059204, "epoch": 4.059414836861908, "grad_norm": 0.94140625, "learning_rate": 0.00034504791682172934, "loss": 4.9007, "mean_token_accuracy": 0.22148784548044204, "num_tokens": 80678082.0, "step": 36145 }, { "entropy": 5.343256092071533, "epoch": 4.059976413769866, "grad_norm": 0.92578125, "learning_rate": 0.0003450097622263333, "loss": 4.9693, "mean_token_accuracy": 0.21765907108783722, "num_tokens": 80691553.0, "step": 36150 }, { "entropy": 5.250389528274536, "epoch": 4.060537990677823, "grad_norm": 0.94140625, "learning_rate": 0.00034497160540179924, "loss": 4.7988, "mean_token_accuracy": 0.2354423075914383, "num_tokens": 80702353.0, "step": 36155 }, { "entropy": 5.247003793716431, "epoch": 4.061099567585781, "grad_norm": 1.03125, "learning_rate": 0.00034493344634934205, "loss": 4.8906, "mean_token_accuracy": 0.22810729295015336, "num_tokens": 80712091.0, "step": 36160 }, { "entropy": 5.383491659164429, "epoch": 4.061661144493739, "grad_norm": 1.0078125, "learning_rate": 0.0003448952850701769, "loss": 5.0248, "mean_token_accuracy": 0.22045061737298965, "num_tokens": 80723283.0, "step": 36165 }, { "entropy": 5.40281400680542, "epoch": 4.062222721401696, "grad_norm": 0.99609375, "learning_rate": 0.00034485712156551873, "loss": 4.8616, "mean_token_accuracy": 0.23471304029226303, "num_tokens": 80733434.0, "step": 36170 }, { "entropy": 5.351315307617187, "epoch": 4.062784298309653, "grad_norm": 1.03125, "learning_rate": 0.00034481895583658267, "loss": 5.0156, "mean_token_accuracy": 0.2111069977283478, "num_tokens": 80743236.0, "step": 36175 }, { "entropy": 5.356589078903198, "epoch": 4.063345875217611, "grad_norm": 0.9296875, "learning_rate": 0.00034478078788458406, "loss": 4.9414, "mean_token_accuracy": 0.22012976109981536, "num_tokens": 80754821.0, "step": 36180 }, { "entropy": 5.26940279006958, "epoch": 4.0639074521255685, "grad_norm": 0.96875, "learning_rate": 0.000344742617710738, "loss": 4.8789, "mean_token_accuracy": 0.22598658949136735, "num_tokens": 80765755.0, "step": 36185 }, { "entropy": 5.4358312606811525, "epoch": 4.064469029033527, "grad_norm": 1.0234375, "learning_rate": 0.00034470444531626003, "loss": 5.0342, "mean_token_accuracy": 0.2127585232257843, "num_tokens": 80776062.0, "step": 36190 }, { "entropy": 5.392159938812256, "epoch": 4.065030605941484, "grad_norm": 0.99609375, "learning_rate": 0.00034466627070236545, "loss": 4.9136, "mean_token_accuracy": 0.21950702965259553, "num_tokens": 80787005.0, "step": 36195 }, { "entropy": 5.302799129486084, "epoch": 4.065592182849441, "grad_norm": 1.046875, "learning_rate": 0.0003446280938702698, "loss": 4.8617, "mean_token_accuracy": 0.22878555804491044, "num_tokens": 80798949.0, "step": 36200 }, { "entropy": 5.352507209777832, "epoch": 4.066153759757399, "grad_norm": 0.9453125, "learning_rate": 0.00034458991482118865, "loss": 4.883, "mean_token_accuracy": 0.22353299260139464, "num_tokens": 80809087.0, "step": 36205 }, { "entropy": 5.284424209594727, "epoch": 4.066715336665356, "grad_norm": 1.0390625, "learning_rate": 0.0003445517335563376, "loss": 4.887, "mean_token_accuracy": 0.2294287234544754, "num_tokens": 80819764.0, "step": 36210 }, { "entropy": 5.273963499069214, "epoch": 4.067276913573314, "grad_norm": 0.96875, "learning_rate": 0.00034451355007693237, "loss": 4.8802, "mean_token_accuracy": 0.222270230948925, "num_tokens": 80830123.0, "step": 36215 }, { "entropy": 5.310305118560791, "epoch": 4.067838490481272, "grad_norm": 1.0546875, "learning_rate": 0.0003444753643841888, "loss": 4.8014, "mean_token_accuracy": 0.228645958006382, "num_tokens": 80841222.0, "step": 36220 }, { "entropy": 5.3834411144256595, "epoch": 4.068400067389229, "grad_norm": 0.98828125, "learning_rate": 0.00034443717647932265, "loss": 5.0033, "mean_token_accuracy": 0.2211059510707855, "num_tokens": 80854432.0, "step": 36225 }, { "entropy": 5.35668978691101, "epoch": 4.068961644297186, "grad_norm": 1.0390625, "learning_rate": 0.0003443989863635498, "loss": 4.9392, "mean_token_accuracy": 0.21854736655950546, "num_tokens": 80864915.0, "step": 36230 }, { "entropy": 5.2936736106872555, "epoch": 4.069523221205144, "grad_norm": 0.95703125, "learning_rate": 0.00034436079403808647, "loss": 4.9587, "mean_token_accuracy": 0.2189372643828392, "num_tokens": 80877239.0, "step": 36235 }, { "entropy": 5.488775062561035, "epoch": 4.070084798113101, "grad_norm": 0.87109375, "learning_rate": 0.00034432259950414846, "loss": 5.0232, "mean_token_accuracy": 0.20623173266649247, "num_tokens": 80890618.0, "step": 36240 }, { "entropy": 5.439596223831177, "epoch": 4.0706463750210595, "grad_norm": 0.98046875, "learning_rate": 0.000344284402762952, "loss": 4.943, "mean_token_accuracy": 0.22089067697525025, "num_tokens": 80902445.0, "step": 36245 }, { "entropy": 5.348625040054321, "epoch": 4.071207951929017, "grad_norm": 1.0234375, "learning_rate": 0.0003442462038157132, "loss": 4.95, "mean_token_accuracy": 0.21522913873195648, "num_tokens": 80913519.0, "step": 36250 }, { "entropy": 5.31230936050415, "epoch": 4.071769528836974, "grad_norm": 0.95703125, "learning_rate": 0.0003442080026636485, "loss": 4.9238, "mean_token_accuracy": 0.215563540160656, "num_tokens": 80924800.0, "step": 36255 }, { "entropy": 5.352876663208008, "epoch": 4.072331105744932, "grad_norm": 0.97265625, "learning_rate": 0.0003441697993079742, "loss": 4.9329, "mean_token_accuracy": 0.22767739742994308, "num_tokens": 80935812.0, "step": 36260 }, { "entropy": 5.3814905166625975, "epoch": 4.072892682652889, "grad_norm": 1.0703125, "learning_rate": 0.0003441315937499066, "loss": 4.9078, "mean_token_accuracy": 0.22601717561483384, "num_tokens": 80946456.0, "step": 36265 }, { "entropy": 5.346848106384277, "epoch": 4.0734542595608465, "grad_norm": 0.984375, "learning_rate": 0.00034409338599066224, "loss": 4.9443, "mean_token_accuracy": 0.22367979139089583, "num_tokens": 80957983.0, "step": 36270 }, { "entropy": 5.368098402023316, "epoch": 4.074015836468805, "grad_norm": 0.953125, "learning_rate": 0.0003440551760314577, "loss": 5.0334, "mean_token_accuracy": 0.21383372694253922, "num_tokens": 80969093.0, "step": 36275 }, { "entropy": 5.35685019493103, "epoch": 4.074577413376762, "grad_norm": 0.953125, "learning_rate": 0.00034401696387350954, "loss": 4.898, "mean_token_accuracy": 0.23036142587661743, "num_tokens": 80980511.0, "step": 36280 }, { "entropy": 5.28838963508606, "epoch": 4.075138990284719, "grad_norm": 1.03125, "learning_rate": 0.0003439787495180345, "loss": 4.8539, "mean_token_accuracy": 0.22649962604045867, "num_tokens": 80992437.0, "step": 36285 }, { "entropy": 5.3275219917297365, "epoch": 4.075700567192677, "grad_norm": 0.9609375, "learning_rate": 0.00034394053296624936, "loss": 4.8837, "mean_token_accuracy": 0.22668827027082444, "num_tokens": 81003105.0, "step": 36290 }, { "entropy": 5.314283943176269, "epoch": 4.076262144100634, "grad_norm": 0.98046875, "learning_rate": 0.0003439023142193709, "loss": 4.9114, "mean_token_accuracy": 0.22405313849449157, "num_tokens": 81015141.0, "step": 36295 }, { "entropy": 5.253846645355225, "epoch": 4.0768237210085925, "grad_norm": 1.109375, "learning_rate": 0.000343864093278616, "loss": 4.893, "mean_token_accuracy": 0.22387565225362777, "num_tokens": 81025875.0, "step": 36300 }, { "entropy": 5.333708953857422, "epoch": 4.07738529791655, "grad_norm": 1.0078125, "learning_rate": 0.0003438258701452017, "loss": 4.9157, "mean_token_accuracy": 0.22685809582471847, "num_tokens": 81036963.0, "step": 36305 }, { "entropy": 5.312244701385498, "epoch": 4.077946874824507, "grad_norm": 0.98046875, "learning_rate": 0.0003437876448203449, "loss": 4.8574, "mean_token_accuracy": 0.22804497927427292, "num_tokens": 81048660.0, "step": 36310 }, { "entropy": 5.258388948440552, "epoch": 4.078508451732465, "grad_norm": 0.97265625, "learning_rate": 0.0003437494173052629, "loss": 4.9057, "mean_token_accuracy": 0.21852595061063768, "num_tokens": 81060071.0, "step": 36315 }, { "entropy": 5.312449836730957, "epoch": 4.079070028640422, "grad_norm": 0.9921875, "learning_rate": 0.0003437111876011728, "loss": 4.8976, "mean_token_accuracy": 0.22572489976882934, "num_tokens": 81071126.0, "step": 36320 }, { "entropy": 5.26862325668335, "epoch": 4.0796316055483794, "grad_norm": 1.0390625, "learning_rate": 0.00034367295570929176, "loss": 4.8719, "mean_token_accuracy": 0.22447004169225693, "num_tokens": 81081349.0, "step": 36325 }, { "entropy": 5.246787881851196, "epoch": 4.0801931824563376, "grad_norm": 1.046875, "learning_rate": 0.0003436347216308373, "loss": 4.7825, "mean_token_accuracy": 0.22882500737905503, "num_tokens": 81092804.0, "step": 36330 }, { "entropy": 5.263952541351318, "epoch": 4.080754759364295, "grad_norm": 1.078125, "learning_rate": 0.0003435964853670265, "loss": 4.867, "mean_token_accuracy": 0.23249226361513137, "num_tokens": 81103539.0, "step": 36335 }, { "entropy": 5.3492615699768065, "epoch": 4.081316336272253, "grad_norm": 0.9140625, "learning_rate": 0.00034355824691907714, "loss": 4.9724, "mean_token_accuracy": 0.22277533113956452, "num_tokens": 81115586.0, "step": 36340 }, { "entropy": 5.294626474380493, "epoch": 4.08187791318021, "grad_norm": 1.0390625, "learning_rate": 0.00034352000628820655, "loss": 4.8584, "mean_token_accuracy": 0.22429246753454207, "num_tokens": 81125354.0, "step": 36345 }, { "entropy": 5.3012491226196286, "epoch": 4.082439490088167, "grad_norm": 1.046875, "learning_rate": 0.0003434817634756324, "loss": 4.8326, "mean_token_accuracy": 0.23545102030038834, "num_tokens": 81136890.0, "step": 36350 }, { "entropy": 5.30880765914917, "epoch": 4.083001066996125, "grad_norm": 0.90234375, "learning_rate": 0.0003434435184825724, "loss": 4.9276, "mean_token_accuracy": 0.22578466087579727, "num_tokens": 81147539.0, "step": 36355 }, { "entropy": 5.296538972854615, "epoch": 4.083562643904083, "grad_norm": 0.9453125, "learning_rate": 0.00034340527131024415, "loss": 4.9438, "mean_token_accuracy": 0.22424944937229158, "num_tokens": 81160529.0, "step": 36360 }, { "entropy": 5.399967908859253, "epoch": 4.08412422081204, "grad_norm": 1.0234375, "learning_rate": 0.0003433670219598656, "loss": 4.9524, "mean_token_accuracy": 0.22058828622102739, "num_tokens": 81171067.0, "step": 36365 }, { "entropy": 5.343110656738281, "epoch": 4.084685797719998, "grad_norm": 1.078125, "learning_rate": 0.0003433287704326545, "loss": 4.8751, "mean_token_accuracy": 0.22623569816350936, "num_tokens": 81182383.0, "step": 36370 }, { "entropy": 5.2593122005462645, "epoch": 4.085247374627955, "grad_norm": 1.0625, "learning_rate": 0.0003432905167298288, "loss": 4.8548, "mean_token_accuracy": 0.22965872436761856, "num_tokens": 81192939.0, "step": 36375 }, { "entropy": 5.302305889129639, "epoch": 4.085808951535913, "grad_norm": 0.98046875, "learning_rate": 0.00034325226085260666, "loss": 4.879, "mean_token_accuracy": 0.22699808180332184, "num_tokens": 81204110.0, "step": 36380 }, { "entropy": 5.300213766098023, "epoch": 4.0863705284438705, "grad_norm": 1.0078125, "learning_rate": 0.000343214002802206, "loss": 4.8791, "mean_token_accuracy": 0.22306997776031495, "num_tokens": 81214519.0, "step": 36385 }, { "entropy": 5.226606464385986, "epoch": 4.086932105351828, "grad_norm": 1.0, "learning_rate": 0.00034317574257984514, "loss": 4.778, "mean_token_accuracy": 0.23381907045841216, "num_tokens": 81225427.0, "step": 36390 }, { "entropy": 5.328241586685181, "epoch": 4.087493682259786, "grad_norm": 1.0390625, "learning_rate": 0.000343137480186742, "loss": 4.9381, "mean_token_accuracy": 0.21319423019886016, "num_tokens": 81236450.0, "step": 36395 }, { "entropy": 5.364252376556396, "epoch": 4.088055259167743, "grad_norm": 0.9296875, "learning_rate": 0.00034309921562411527, "loss": 4.9049, "mean_token_accuracy": 0.22523159384727479, "num_tokens": 81248302.0, "step": 36400 }, { "entropy": 5.2345983505249025, "epoch": 4.0886168360757, "grad_norm": 0.97265625, "learning_rate": 0.00034306094889318295, "loss": 4.8334, "mean_token_accuracy": 0.23168878853321076, "num_tokens": 81258332.0, "step": 36405 }, { "entropy": 5.2078385829925535, "epoch": 4.089178412983658, "grad_norm": 0.91015625, "learning_rate": 0.0003430226799951637, "loss": 4.865, "mean_token_accuracy": 0.22297257483005523, "num_tokens": 81270009.0, "step": 36410 }, { "entropy": 5.343054533004761, "epoch": 4.089739989891616, "grad_norm": 1.0234375, "learning_rate": 0.00034298440893127584, "loss": 4.9598, "mean_token_accuracy": 0.22669940292835236, "num_tokens": 81281025.0, "step": 36415 }, { "entropy": 5.319711780548095, "epoch": 4.090301566799573, "grad_norm": 0.9921875, "learning_rate": 0.00034294613570273817, "loss": 4.9278, "mean_token_accuracy": 0.23163323998451232, "num_tokens": 81292932.0, "step": 36420 }, { "entropy": 5.2806463718414305, "epoch": 4.090863143707531, "grad_norm": 1.09375, "learning_rate": 0.00034290786031076917, "loss": 4.8409, "mean_token_accuracy": 0.22883131504058837, "num_tokens": 81303007.0, "step": 36425 }, { "entropy": 5.314305305480957, "epoch": 4.091424720615488, "grad_norm": 0.94140625, "learning_rate": 0.0003428695827565875, "loss": 4.902, "mean_token_accuracy": 0.22662333399057388, "num_tokens": 81315758.0, "step": 36430 }, { "entropy": 5.287782907485962, "epoch": 4.091986297523446, "grad_norm": 0.98828125, "learning_rate": 0.00034283130304141204, "loss": 4.8684, "mean_token_accuracy": 0.22456922829151155, "num_tokens": 81327148.0, "step": 36435 }, { "entropy": 5.415901756286621, "epoch": 4.092547874431403, "grad_norm": 1.0234375, "learning_rate": 0.0003427930211664615, "loss": 5.0426, "mean_token_accuracy": 0.2215466320514679, "num_tokens": 81338560.0, "step": 36440 }, { "entropy": 5.314035558700562, "epoch": 4.093109451339361, "grad_norm": 1.046875, "learning_rate": 0.000342754737132955, "loss": 4.8824, "mean_token_accuracy": 0.2291946679353714, "num_tokens": 81349998.0, "step": 36445 }, { "entropy": 5.288207197189331, "epoch": 4.093671028247319, "grad_norm": 0.9921875, "learning_rate": 0.00034271645094211125, "loss": 4.8705, "mean_token_accuracy": 0.22445319443941117, "num_tokens": 81360041.0, "step": 36450 }, { "entropy": 5.260379123687744, "epoch": 4.094232605155276, "grad_norm": 0.9765625, "learning_rate": 0.0003426781625951495, "loss": 4.8664, "mean_token_accuracy": 0.2275041773915291, "num_tokens": 81370256.0, "step": 36455 }, { "entropy": 5.2805126190185545, "epoch": 4.094794182063233, "grad_norm": 1.046875, "learning_rate": 0.00034263987209328886, "loss": 4.8917, "mean_token_accuracy": 0.22611627727746964, "num_tokens": 81382365.0, "step": 36460 }, { "entropy": 5.293807554244995, "epoch": 4.095355758971191, "grad_norm": 1.015625, "learning_rate": 0.0003426015794377483, "loss": 4.8653, "mean_token_accuracy": 0.22936853766441345, "num_tokens": 81393147.0, "step": 36465 }, { "entropy": 5.306332111358643, "epoch": 4.0959173358791485, "grad_norm": 1.03125, "learning_rate": 0.0003425632846297474, "loss": 4.7954, "mean_token_accuracy": 0.22976450324058534, "num_tokens": 81404464.0, "step": 36470 }, { "entropy": 5.3131749629974365, "epoch": 4.096478912787107, "grad_norm": 0.984375, "learning_rate": 0.00034252498767050525, "loss": 4.8645, "mean_token_accuracy": 0.22589686065912246, "num_tokens": 81415191.0, "step": 36475 }, { "entropy": 5.310141372680664, "epoch": 4.097040489695064, "grad_norm": 0.9921875, "learning_rate": 0.0003424866885612413, "loss": 4.917, "mean_token_accuracy": 0.22786842286586761, "num_tokens": 81426258.0, "step": 36480 }, { "entropy": 5.37461838722229, "epoch": 4.097602066603021, "grad_norm": 1.0234375, "learning_rate": 0.000342448387303175, "loss": 4.9081, "mean_token_accuracy": 0.2314464792609215, "num_tokens": 81437763.0, "step": 36485 }, { "entropy": 5.32384614944458, "epoch": 4.098163643510979, "grad_norm": 0.96875, "learning_rate": 0.00034241008389752594, "loss": 5.0039, "mean_token_accuracy": 0.21918401420116423, "num_tokens": 81451012.0, "step": 36490 }, { "entropy": 5.353970670700074, "epoch": 4.098725220418936, "grad_norm": 0.9765625, "learning_rate": 0.0003423717783455136, "loss": 4.9663, "mean_token_accuracy": 0.2188495010137558, "num_tokens": 81462310.0, "step": 36495 }, { "entropy": 5.293469953536987, "epoch": 4.099286797326894, "grad_norm": 1.03125, "learning_rate": 0.00034233347064835775, "loss": 4.892, "mean_token_accuracy": 0.22690458595752716, "num_tokens": 81473423.0, "step": 36500 }, { "entropy": 5.332803726196289, "epoch": 4.099848374234852, "grad_norm": 0.99609375, "learning_rate": 0.0003422951608072781, "loss": 4.902, "mean_token_accuracy": 0.22693066895008088, "num_tokens": 81485019.0, "step": 36505 }, { "entropy": 5.327925777435302, "epoch": 4.100409951142809, "grad_norm": 0.99609375, "learning_rate": 0.0003422568488234944, "loss": 4.8844, "mean_token_accuracy": 0.22172844558954238, "num_tokens": 81495724.0, "step": 36510 }, { "entropy": 5.245721769332886, "epoch": 4.100971528050766, "grad_norm": 1.0390625, "learning_rate": 0.00034221853469822654, "loss": 4.8315, "mean_token_accuracy": 0.22440870106220245, "num_tokens": 81506192.0, "step": 36515 }, { "entropy": 5.303523683547974, "epoch": 4.101533104958724, "grad_norm": 1.0, "learning_rate": 0.00034218021843269444, "loss": 4.9323, "mean_token_accuracy": 0.22184186428785324, "num_tokens": 81518783.0, "step": 36520 }, { "entropy": 5.303485345840454, "epoch": 4.1020946818666815, "grad_norm": 0.94921875, "learning_rate": 0.0003421419000281182, "loss": 4.8446, "mean_token_accuracy": 0.22213964760303498, "num_tokens": 81530426.0, "step": 36525 }, { "entropy": 5.3957287788391115, "epoch": 4.10265625877464, "grad_norm": 0.984375, "learning_rate": 0.0003421035794857178, "loss": 4.9928, "mean_token_accuracy": 0.21618830561637878, "num_tokens": 81540479.0, "step": 36530 }, { "entropy": 5.314896869659424, "epoch": 4.103217835682597, "grad_norm": 0.96484375, "learning_rate": 0.0003420652568067134, "loss": 4.8697, "mean_token_accuracy": 0.22870832830667495, "num_tokens": 81550618.0, "step": 36535 }, { "entropy": 5.347701454162598, "epoch": 4.103779412590554, "grad_norm": 1.0546875, "learning_rate": 0.00034202693199232516, "loss": 4.9582, "mean_token_accuracy": 0.2286326467990875, "num_tokens": 81561529.0, "step": 36540 }, { "entropy": 5.3070902824401855, "epoch": 4.104340989498512, "grad_norm": 0.9453125, "learning_rate": 0.00034198860504377343, "loss": 4.8103, "mean_token_accuracy": 0.22830644696950914, "num_tokens": 81571660.0, "step": 36545 }, { "entropy": 5.363492345809936, "epoch": 4.104902566406469, "grad_norm": 1.0625, "learning_rate": 0.00034195027596227857, "loss": 4.9483, "mean_token_accuracy": 0.2184915229678154, "num_tokens": 81581738.0, "step": 36550 }, { "entropy": 5.324359941482544, "epoch": 4.1054641433144266, "grad_norm": 0.95703125, "learning_rate": 0.0003419119447490609, "loss": 4.959, "mean_token_accuracy": 0.22085279524326323, "num_tokens": 81593028.0, "step": 36555 }, { "entropy": 5.328190422058105, "epoch": 4.106025720222385, "grad_norm": 0.9609375, "learning_rate": 0.000341873611405341, "loss": 4.8346, "mean_token_accuracy": 0.22565679699182511, "num_tokens": 81605353.0, "step": 36560 }, { "entropy": 5.29201226234436, "epoch": 4.106587297130342, "grad_norm": 0.96484375, "learning_rate": 0.0003418352759323394, "loss": 4.8565, "mean_token_accuracy": 0.2286763459444046, "num_tokens": 81616601.0, "step": 36565 }, { "entropy": 5.324309349060059, "epoch": 4.1071488740383, "grad_norm": 1.015625, "learning_rate": 0.00034179693833127667, "loss": 4.9433, "mean_token_accuracy": 0.22289418578147888, "num_tokens": 81628064.0, "step": 36570 }, { "entropy": 5.3169636726379395, "epoch": 4.107710450946257, "grad_norm": 0.98828125, "learning_rate": 0.00034175859860337347, "loss": 4.8935, "mean_token_accuracy": 0.2169930726289749, "num_tokens": 81639844.0, "step": 36575 }, { "entropy": 5.3732442378997805, "epoch": 4.108272027854214, "grad_norm": 0.98046875, "learning_rate": 0.00034172025674985076, "loss": 4.9408, "mean_token_accuracy": 0.22566508799791335, "num_tokens": 81650978.0, "step": 36580 }, { "entropy": 5.239879512786866, "epoch": 4.1088336047621725, "grad_norm": 0.97265625, "learning_rate": 0.00034168191277192904, "loss": 4.8133, "mean_token_accuracy": 0.23155894130468369, "num_tokens": 81661862.0, "step": 36585 }, { "entropy": 5.299708509445191, "epoch": 4.10939518167013, "grad_norm": 1.0078125, "learning_rate": 0.00034164356667082933, "loss": 4.8622, "mean_token_accuracy": 0.23202944546937943, "num_tokens": 81673955.0, "step": 36590 }, { "entropy": 5.234638833999634, "epoch": 4.109956758578087, "grad_norm": 1.0625, "learning_rate": 0.0003416052184477727, "loss": 4.7441, "mean_token_accuracy": 0.23370224237442017, "num_tokens": 81683610.0, "step": 36595 }, { "entropy": 5.334441041946411, "epoch": 4.110518335486045, "grad_norm": 0.94140625, "learning_rate": 0.0003415668681039801, "loss": 4.9032, "mean_token_accuracy": 0.22174402177333832, "num_tokens": 81694295.0, "step": 36600 }, { "entropy": 5.327102899551392, "epoch": 4.111079912394002, "grad_norm": 0.9921875, "learning_rate": 0.00034152851564067254, "loss": 4.9347, "mean_token_accuracy": 0.223934568464756, "num_tokens": 81705090.0, "step": 36605 }, { "entropy": 5.28317699432373, "epoch": 4.1116414893019595, "grad_norm": 1.0078125, "learning_rate": 0.0003414901610590712, "loss": 4.8618, "mean_token_accuracy": 0.23082437813282014, "num_tokens": 81716891.0, "step": 36610 }, { "entropy": 5.360436916351318, "epoch": 4.112203066209918, "grad_norm": 0.93359375, "learning_rate": 0.0003414518043603974, "loss": 4.9908, "mean_token_accuracy": 0.2186895191669464, "num_tokens": 81728781.0, "step": 36615 }, { "entropy": 5.427006626129151, "epoch": 4.112764643117875, "grad_norm": 1.046875, "learning_rate": 0.00034141344554587243, "loss": 4.9534, "mean_token_accuracy": 0.2224336251616478, "num_tokens": 81738933.0, "step": 36620 }, { "entropy": 5.314230442047119, "epoch": 4.113326220025833, "grad_norm": 0.96484375, "learning_rate": 0.0003413750846167175, "loss": 4.9138, "mean_token_accuracy": 0.224728325009346, "num_tokens": 81750241.0, "step": 36625 }, { "entropy": 5.261791753768921, "epoch": 4.11388779693379, "grad_norm": 1.03125, "learning_rate": 0.0003413367215741542, "loss": 4.8705, "mean_token_accuracy": 0.22759616672992705, "num_tokens": 81762100.0, "step": 36630 }, { "entropy": 5.326925325393677, "epoch": 4.114449373841747, "grad_norm": 0.984375, "learning_rate": 0.00034129835641940394, "loss": 4.9613, "mean_token_accuracy": 0.22471993863582612, "num_tokens": 81774628.0, "step": 36635 }, { "entropy": 5.426640510559082, "epoch": 4.1150109507497055, "grad_norm": 0.92578125, "learning_rate": 0.00034125998915368827, "loss": 4.9595, "mean_token_accuracy": 0.2216418504714966, "num_tokens": 81787154.0, "step": 36640 }, { "entropy": 5.265170383453369, "epoch": 4.115572527657663, "grad_norm": 0.9453125, "learning_rate": 0.00034122161977822885, "loss": 4.885, "mean_token_accuracy": 0.22436075806617736, "num_tokens": 81797815.0, "step": 36645 }, { "entropy": 5.254416608810425, "epoch": 4.11613410456562, "grad_norm": 1.015625, "learning_rate": 0.0003411832482942474, "loss": 4.8959, "mean_token_accuracy": 0.2255213662981987, "num_tokens": 81809939.0, "step": 36650 }, { "entropy": 5.262873697280884, "epoch": 4.116695681473578, "grad_norm": 0.98828125, "learning_rate": 0.00034114487470296575, "loss": 4.8174, "mean_token_accuracy": 0.22544188648462296, "num_tokens": 81820775.0, "step": 36655 }, { "entropy": 5.334648370742798, "epoch": 4.117257258381535, "grad_norm": 1.0078125, "learning_rate": 0.00034110649900560554, "loss": 4.8954, "mean_token_accuracy": 0.21859526336193086, "num_tokens": 81831501.0, "step": 36660 }, { "entropy": 5.322180509567261, "epoch": 4.117818835289493, "grad_norm": 1.015625, "learning_rate": 0.0003410681212033887, "loss": 4.9531, "mean_token_accuracy": 0.22675986886024474, "num_tokens": 81842052.0, "step": 36665 }, { "entropy": 5.376874828338623, "epoch": 4.1183804121974505, "grad_norm": 0.98046875, "learning_rate": 0.00034102974129753726, "loss": 4.9092, "mean_token_accuracy": 0.22156075686216353, "num_tokens": 81852730.0, "step": 36670 }, { "entropy": 5.248844575881958, "epoch": 4.118941989105408, "grad_norm": 0.96875, "learning_rate": 0.0003409913592892733, "loss": 4.8908, "mean_token_accuracy": 0.21988571882247926, "num_tokens": 81864436.0, "step": 36675 }, { "entropy": 5.234925365447998, "epoch": 4.119503566013366, "grad_norm": 1.03125, "learning_rate": 0.0003409529751798189, "loss": 4.7745, "mean_token_accuracy": 0.24416860193014145, "num_tokens": 81875284.0, "step": 36680 }, { "entropy": 5.2616828918457035, "epoch": 4.120065142921323, "grad_norm": 1.078125, "learning_rate": 0.0003409145889703961, "loss": 4.8229, "mean_token_accuracy": 0.2349325954914093, "num_tokens": 81885571.0, "step": 36685 }, { "entropy": 5.247549057006836, "epoch": 4.12062671982928, "grad_norm": 1.0703125, "learning_rate": 0.00034087620066222733, "loss": 4.8491, "mean_token_accuracy": 0.22914725691080093, "num_tokens": 81897190.0, "step": 36690 }, { "entropy": 5.421279191970825, "epoch": 4.121188296737238, "grad_norm": 1.0859375, "learning_rate": 0.0003408378102565347, "loss": 5.0376, "mean_token_accuracy": 0.21510691791772843, "num_tokens": 81909811.0, "step": 36695 }, { "entropy": 5.314928579330444, "epoch": 4.121749873645196, "grad_norm": 1.0234375, "learning_rate": 0.0003407994177545407, "loss": 4.8585, "mean_token_accuracy": 0.22289398312568665, "num_tokens": 81920528.0, "step": 36700 }, { "entropy": 5.272383546829223, "epoch": 4.122311450553153, "grad_norm": 0.94921875, "learning_rate": 0.0003407610231574677, "loss": 4.8623, "mean_token_accuracy": 0.2313857287168503, "num_tokens": 81931994.0, "step": 36705 }, { "entropy": 5.366690683364868, "epoch": 4.122873027461111, "grad_norm": 0.95703125, "learning_rate": 0.0003407226264665382, "loss": 5.0005, "mean_token_accuracy": 0.2197750225663185, "num_tokens": 81943641.0, "step": 36710 }, { "entropy": 5.290005731582641, "epoch": 4.123434604369068, "grad_norm": 0.94921875, "learning_rate": 0.00034068422768297486, "loss": 4.8706, "mean_token_accuracy": 0.23333559483289718, "num_tokens": 81955516.0, "step": 36715 }, { "entropy": 5.387358856201172, "epoch": 4.123996181277026, "grad_norm": 0.95703125, "learning_rate": 0.0003406458268080001, "loss": 4.9425, "mean_token_accuracy": 0.22269238531589508, "num_tokens": 81966019.0, "step": 36720 }, { "entropy": 5.3177131652832035, "epoch": 4.1245577581849835, "grad_norm": 1.0078125, "learning_rate": 0.00034060742384283695, "loss": 4.9224, "mean_token_accuracy": 0.2163916662335396, "num_tokens": 81976664.0, "step": 36725 }, { "entropy": 5.294422817230225, "epoch": 4.125119335092941, "grad_norm": 0.97265625, "learning_rate": 0.0003405690187887078, "loss": 4.8525, "mean_token_accuracy": 0.2313166603446007, "num_tokens": 81987572.0, "step": 36730 }, { "entropy": 5.380994510650635, "epoch": 4.125680912000899, "grad_norm": 1.0859375, "learning_rate": 0.00034053061164683574, "loss": 5.0079, "mean_token_accuracy": 0.22195477783679962, "num_tokens": 81998943.0, "step": 36735 }, { "entropy": 5.32921199798584, "epoch": 4.126242488908856, "grad_norm": 0.9375, "learning_rate": 0.00034049220241844357, "loss": 4.9019, "mean_token_accuracy": 0.2204698458313942, "num_tokens": 82010723.0, "step": 36740 }, { "entropy": 5.277633714675903, "epoch": 4.126804065816813, "grad_norm": 0.94140625, "learning_rate": 0.0003404537911047543, "loss": 4.9183, "mean_token_accuracy": 0.2217444211244583, "num_tokens": 82020888.0, "step": 36745 }, { "entropy": 5.330263090133667, "epoch": 4.127365642724771, "grad_norm": 0.9765625, "learning_rate": 0.00034041537770699095, "loss": 4.9156, "mean_token_accuracy": 0.22030480653047563, "num_tokens": 82031985.0, "step": 36750 }, { "entropy": 5.370676183700562, "epoch": 4.127927219632729, "grad_norm": 1.0, "learning_rate": 0.0003403769622263765, "loss": 4.9359, "mean_token_accuracy": 0.22822305113077163, "num_tokens": 82042161.0, "step": 36755 }, { "entropy": 5.472585773468017, "epoch": 4.128488796540687, "grad_norm": 1.015625, "learning_rate": 0.00034033854466413425, "loss": 5.0559, "mean_token_accuracy": 0.2143716648221016, "num_tokens": 82054587.0, "step": 36760 }, { "entropy": 5.332214736938477, "epoch": 4.129050373448644, "grad_norm": 1.0, "learning_rate": 0.0003403001250214875, "loss": 4.9451, "mean_token_accuracy": 0.21777959167957306, "num_tokens": 82064850.0, "step": 36765 }, { "entropy": 5.323500251770019, "epoch": 4.129611950356601, "grad_norm": 1.0859375, "learning_rate": 0.0003402617032996593, "loss": 4.8453, "mean_token_accuracy": 0.22687113136053086, "num_tokens": 82074963.0, "step": 36770 }, { "entropy": 5.357334280014038, "epoch": 4.130173527264559, "grad_norm": 1.0, "learning_rate": 0.0003402232794998733, "loss": 4.9431, "mean_token_accuracy": 0.21432416141033173, "num_tokens": 82086878.0, "step": 36775 }, { "entropy": 5.262367153167725, "epoch": 4.130735104172516, "grad_norm": 0.98828125, "learning_rate": 0.00034018485362335266, "loss": 4.8234, "mean_token_accuracy": 0.23222053050994873, "num_tokens": 82096621.0, "step": 36780 }, { "entropy": 5.2688805103302006, "epoch": 4.131296681080474, "grad_norm": 0.9453125, "learning_rate": 0.0003401464256713211, "loss": 4.8572, "mean_token_accuracy": 0.2253253623843193, "num_tokens": 82108565.0, "step": 36785 }, { "entropy": 5.279314708709717, "epoch": 4.131858257988432, "grad_norm": 0.9453125, "learning_rate": 0.00034010799564500197, "loss": 4.7429, "mean_token_accuracy": 0.23947744816541672, "num_tokens": 82119434.0, "step": 36790 }, { "entropy": 5.36896505355835, "epoch": 4.132419834896389, "grad_norm": 1.078125, "learning_rate": 0.0003400695635456191, "loss": 4.978, "mean_token_accuracy": 0.2161254271864891, "num_tokens": 82130301.0, "step": 36795 }, { "entropy": 5.175950241088867, "epoch": 4.132981411804346, "grad_norm": 0.9375, "learning_rate": 0.0003400311293743961, "loss": 4.7666, "mean_token_accuracy": 0.23172130584716796, "num_tokens": 82141596.0, "step": 36800 }, { "entropy": 5.35084867477417, "epoch": 4.133542988712304, "grad_norm": 0.99609375, "learning_rate": 0.0003399926931325567, "loss": 4.9601, "mean_token_accuracy": 0.21897535324096679, "num_tokens": 82152779.0, "step": 36805 }, { "entropy": 5.28402943611145, "epoch": 4.1341045656202615, "grad_norm": 0.94140625, "learning_rate": 0.00033995425482132464, "loss": 4.8349, "mean_token_accuracy": 0.22855866104364395, "num_tokens": 82164339.0, "step": 36810 }, { "entropy": 5.400484037399292, "epoch": 4.13466614252822, "grad_norm": 0.953125, "learning_rate": 0.00033991581444192405, "loss": 5.0034, "mean_token_accuracy": 0.21687304377555847, "num_tokens": 82176160.0, "step": 36815 }, { "entropy": 5.371975994110107, "epoch": 4.135227719436177, "grad_norm": 0.95703125, "learning_rate": 0.0003398773719955787, "loss": 4.9448, "mean_token_accuracy": 0.2232508987188339, "num_tokens": 82188130.0, "step": 36820 }, { "entropy": 5.299878406524658, "epoch": 4.135789296344134, "grad_norm": 1.0, "learning_rate": 0.0003398389274835126, "loss": 4.9415, "mean_token_accuracy": 0.22035093903541564, "num_tokens": 82199585.0, "step": 36825 }, { "entropy": 5.37008318901062, "epoch": 4.136350873252092, "grad_norm": 1.171875, "learning_rate": 0.00033980048090694997, "loss": 4.9222, "mean_token_accuracy": 0.22746842205524445, "num_tokens": 82210319.0, "step": 36830 }, { "entropy": 5.333677816390991, "epoch": 4.136912450160049, "grad_norm": 0.9296875, "learning_rate": 0.0003397620322671149, "loss": 4.8791, "mean_token_accuracy": 0.22761449813842774, "num_tokens": 82222597.0, "step": 36835 }, { "entropy": 5.294386625289917, "epoch": 4.137474027068007, "grad_norm": 1.1328125, "learning_rate": 0.00033972358156523163, "loss": 4.8497, "mean_token_accuracy": 0.23704640567302704, "num_tokens": 82233651.0, "step": 36840 }, { "entropy": 5.205439567565918, "epoch": 4.138035603975965, "grad_norm": 0.8671875, "learning_rate": 0.0003396851288025243, "loss": 4.82, "mean_token_accuracy": 0.23503964990377427, "num_tokens": 82244012.0, "step": 36845 }, { "entropy": 5.338610982894897, "epoch": 4.138597180883922, "grad_norm": 0.97265625, "learning_rate": 0.0003396466739802175, "loss": 4.896, "mean_token_accuracy": 0.2273570030927658, "num_tokens": 82255290.0, "step": 36850 }, { "entropy": 5.428255319595337, "epoch": 4.13915875779188, "grad_norm": 1.0390625, "learning_rate": 0.0003396082170995355, "loss": 4.9095, "mean_token_accuracy": 0.2239511176943779, "num_tokens": 82266242.0, "step": 36855 }, { "entropy": 5.279091930389404, "epoch": 4.139720334699837, "grad_norm": 1.0078125, "learning_rate": 0.0003395697581617028, "loss": 4.8544, "mean_token_accuracy": 0.23276604562997819, "num_tokens": 82276937.0, "step": 36860 }, { "entropy": 5.310982275009155, "epoch": 4.1402819116077945, "grad_norm": 1.1953125, "learning_rate": 0.00033953129716794396, "loss": 4.9278, "mean_token_accuracy": 0.2271154284477234, "num_tokens": 82287566.0, "step": 36865 }, { "entropy": 5.322726774215698, "epoch": 4.140843488515753, "grad_norm": 1.0, "learning_rate": 0.0003394928341194836, "loss": 4.8821, "mean_token_accuracy": 0.22682537585496904, "num_tokens": 82299464.0, "step": 36870 }, { "entropy": 5.278091478347778, "epoch": 4.14140506542371, "grad_norm": 1.0234375, "learning_rate": 0.0003394543690175464, "loss": 4.8328, "mean_token_accuracy": 0.23418940603733063, "num_tokens": 82310205.0, "step": 36875 }, { "entropy": 5.4160013675689695, "epoch": 4.141966642331667, "grad_norm": 1.1484375, "learning_rate": 0.00033941590186335703, "loss": 4.971, "mean_token_accuracy": 0.2292799785733223, "num_tokens": 82321591.0, "step": 36880 }, { "entropy": 5.196966028213501, "epoch": 4.142528219239625, "grad_norm": 1.03125, "learning_rate": 0.0003393774326581404, "loss": 4.8277, "mean_token_accuracy": 0.22784799933433533, "num_tokens": 82333263.0, "step": 36885 }, { "entropy": 5.293696689605713, "epoch": 4.143089796147582, "grad_norm": 1.046875, "learning_rate": 0.00033933896140312135, "loss": 4.9413, "mean_token_accuracy": 0.22517202645540238, "num_tokens": 82344627.0, "step": 36890 }, { "entropy": 5.366280269622803, "epoch": 4.1436513730555395, "grad_norm": 1.0546875, "learning_rate": 0.00033930048809952484, "loss": 4.9446, "mean_token_accuracy": 0.21766890287399293, "num_tokens": 82355404.0, "step": 36895 }, { "entropy": 5.348947429656983, "epoch": 4.144212949963498, "grad_norm": 1.0625, "learning_rate": 0.00033926201274857575, "loss": 4.899, "mean_token_accuracy": 0.22629986107349395, "num_tokens": 82365383.0, "step": 36900 }, { "entropy": 5.376533889770508, "epoch": 4.144774526871455, "grad_norm": 0.95703125, "learning_rate": 0.00033922353535149934, "loss": 4.9911, "mean_token_accuracy": 0.2205028638243675, "num_tokens": 82376535.0, "step": 36905 }, { "entropy": 5.317846155166626, "epoch": 4.145336103779413, "grad_norm": 1.03125, "learning_rate": 0.0003391850559095207, "loss": 4.9021, "mean_token_accuracy": 0.2183859810233116, "num_tokens": 82387732.0, "step": 36910 }, { "entropy": 5.32937331199646, "epoch": 4.14589768068737, "grad_norm": 0.9609375, "learning_rate": 0.0003391465744238649, "loss": 4.8561, "mean_token_accuracy": 0.2312206283211708, "num_tokens": 82399486.0, "step": 36915 }, { "entropy": 5.283699893951416, "epoch": 4.146459257595327, "grad_norm": 0.9453125, "learning_rate": 0.0003391080908957573, "loss": 4.8228, "mean_token_accuracy": 0.2293547883629799, "num_tokens": 82411254.0, "step": 36920 }, { "entropy": 5.2774817943573, "epoch": 4.1470208345032855, "grad_norm": 1.140625, "learning_rate": 0.00033906960532642327, "loss": 4.8736, "mean_token_accuracy": 0.21957930326461791, "num_tokens": 82421467.0, "step": 36925 }, { "entropy": 5.34038143157959, "epoch": 4.147582411411243, "grad_norm": 0.95703125, "learning_rate": 0.0003390311177170881, "loss": 4.9601, "mean_token_accuracy": 0.2229652374982834, "num_tokens": 82432492.0, "step": 36930 }, { "entropy": 5.302399921417236, "epoch": 4.1481439883192, "grad_norm": 1.140625, "learning_rate": 0.0003389926280689773, "loss": 4.8442, "mean_token_accuracy": 0.22877465188503265, "num_tokens": 82441495.0, "step": 36935 }, { "entropy": 5.293322896957397, "epoch": 4.148705565227158, "grad_norm": 1.0078125, "learning_rate": 0.00033895413638331646, "loss": 4.9182, "mean_token_accuracy": 0.22011443823575974, "num_tokens": 82452811.0, "step": 36940 }, { "entropy": 5.336159658432007, "epoch": 4.149267142135115, "grad_norm": 1.0, "learning_rate": 0.0003389156426613311, "loss": 4.9439, "mean_token_accuracy": 0.2258983537554741, "num_tokens": 82463628.0, "step": 36945 }, { "entropy": 5.339464282989502, "epoch": 4.149828719043073, "grad_norm": 1.0078125, "learning_rate": 0.00033887714690424687, "loss": 4.9992, "mean_token_accuracy": 0.21806738525629044, "num_tokens": 82473884.0, "step": 36950 }, { "entropy": 5.403109788894653, "epoch": 4.150390295951031, "grad_norm": 0.98828125, "learning_rate": 0.00033883864911328954, "loss": 4.9718, "mean_token_accuracy": 0.22280558794736863, "num_tokens": 82485714.0, "step": 36955 }, { "entropy": 5.294149589538574, "epoch": 4.150951872858988, "grad_norm": 1.015625, "learning_rate": 0.00033880014928968483, "loss": 4.8799, "mean_token_accuracy": 0.22357550412416458, "num_tokens": 82497014.0, "step": 36960 }, { "entropy": 5.346518611907959, "epoch": 4.151513449766946, "grad_norm": 0.9453125, "learning_rate": 0.00033876164743465865, "loss": 4.9596, "mean_token_accuracy": 0.22611394971609117, "num_tokens": 82508751.0, "step": 36965 }, { "entropy": 5.334374332427979, "epoch": 4.152075026674903, "grad_norm": 0.9296875, "learning_rate": 0.0003387231435494368, "loss": 4.9238, "mean_token_accuracy": 0.22325711250305175, "num_tokens": 82519981.0, "step": 36970 }, { "entropy": 5.365139198303223, "epoch": 4.15263660358286, "grad_norm": 1.0078125, "learning_rate": 0.00033868463763524545, "loss": 4.9971, "mean_token_accuracy": 0.2160232409834862, "num_tokens": 82531650.0, "step": 36975 }, { "entropy": 5.3403853416442875, "epoch": 4.1531981804908185, "grad_norm": 0.93359375, "learning_rate": 0.00033864612969331046, "loss": 4.8307, "mean_token_accuracy": 0.22411110997200012, "num_tokens": 82542099.0, "step": 36980 }, { "entropy": 5.33960747718811, "epoch": 4.153759757398776, "grad_norm": 0.9921875, "learning_rate": 0.0003386076197248581, "loss": 4.8209, "mean_token_accuracy": 0.24569548517465592, "num_tokens": 82552918.0, "step": 36985 }, { "entropy": 5.315575313568115, "epoch": 4.154321334306733, "grad_norm": 0.99609375, "learning_rate": 0.0003385691077311144, "loss": 4.9725, "mean_token_accuracy": 0.219047711789608, "num_tokens": 82564432.0, "step": 36990 }, { "entropy": 5.284668445587158, "epoch": 4.154882911214691, "grad_norm": 1.015625, "learning_rate": 0.00033853059371330565, "loss": 4.9323, "mean_token_accuracy": 0.2173216834664345, "num_tokens": 82576100.0, "step": 36995 }, { "entropy": 5.3536614894866945, "epoch": 4.155444488122648, "grad_norm": 0.9609375, "learning_rate": 0.0003384920776726582, "loss": 4.9779, "mean_token_accuracy": 0.21772318482398986, "num_tokens": 82588152.0, "step": 37000 }, { "entropy": 5.3722950458526615, "epoch": 4.156006065030606, "grad_norm": 0.9375, "learning_rate": 0.00033845355961039823, "loss": 4.8594, "mean_token_accuracy": 0.22976850271224974, "num_tokens": 82599078.0, "step": 37005 }, { "entropy": 5.293517971038819, "epoch": 4.1565676419385635, "grad_norm": 1.03125, "learning_rate": 0.00033841503952775255, "loss": 4.9378, "mean_token_accuracy": 0.22267286479473114, "num_tokens": 82609262.0, "step": 37010 }, { "entropy": 5.346908044815064, "epoch": 4.157129218846521, "grad_norm": 0.9609375, "learning_rate": 0.00033837651742594734, "loss": 4.9202, "mean_token_accuracy": 0.2225680783390999, "num_tokens": 82620886.0, "step": 37015 }, { "entropy": 5.347197723388672, "epoch": 4.157690795754479, "grad_norm": 1.0078125, "learning_rate": 0.00033833799330620917, "loss": 4.9585, "mean_token_accuracy": 0.21742407530546187, "num_tokens": 82632270.0, "step": 37020 }, { "entropy": 5.322649192810059, "epoch": 4.158252372662436, "grad_norm": 1.015625, "learning_rate": 0.0003382994671697647, "loss": 4.8935, "mean_token_accuracy": 0.2322307914495468, "num_tokens": 82643099.0, "step": 37025 }, { "entropy": 5.374436330795288, "epoch": 4.158813949570393, "grad_norm": 0.9921875, "learning_rate": 0.00033826093901784065, "loss": 4.9565, "mean_token_accuracy": 0.22089722156524658, "num_tokens": 82653500.0, "step": 37030 }, { "entropy": 5.343902730941773, "epoch": 4.159375526478351, "grad_norm": 1.0234375, "learning_rate": 0.00033822240885166384, "loss": 4.8787, "mean_token_accuracy": 0.22447762191295623, "num_tokens": 82664074.0, "step": 37035 }, { "entropy": 5.337005376815796, "epoch": 4.159937103386309, "grad_norm": 1.03125, "learning_rate": 0.00033818387667246095, "loss": 4.9314, "mean_token_accuracy": 0.2288151815533638, "num_tokens": 82674915.0, "step": 37040 }, { "entropy": 5.293570947647095, "epoch": 4.160498680294267, "grad_norm": 0.9375, "learning_rate": 0.000338145342481459, "loss": 4.8868, "mean_token_accuracy": 0.22743179500102997, "num_tokens": 82686452.0, "step": 37045 }, { "entropy": 5.275090169906616, "epoch": 4.161060257202224, "grad_norm": 0.98828125, "learning_rate": 0.0003381068062798848, "loss": 4.8462, "mean_token_accuracy": 0.2292952373623848, "num_tokens": 82696448.0, "step": 37050 }, { "entropy": 5.349415302276611, "epoch": 4.161621834110181, "grad_norm": 1.0546875, "learning_rate": 0.0003380682680689654, "loss": 4.9248, "mean_token_accuracy": 0.22297014594078063, "num_tokens": 82706637.0, "step": 37055 }, { "entropy": 5.379631090164184, "epoch": 4.162183411018139, "grad_norm": 0.95703125, "learning_rate": 0.00033802972784992784, "loss": 5.0316, "mean_token_accuracy": 0.21922099888324736, "num_tokens": 82718454.0, "step": 37060 }, { "entropy": 5.340259981155396, "epoch": 4.1627449879260965, "grad_norm": 0.9375, "learning_rate": 0.0003379911856239994, "loss": 4.802, "mean_token_accuracy": 0.23701030462980271, "num_tokens": 82729405.0, "step": 37065 }, { "entropy": 5.286810350418091, "epoch": 4.163306564834054, "grad_norm": 1.046875, "learning_rate": 0.0003379526413924071, "loss": 4.8895, "mean_token_accuracy": 0.22214857190847398, "num_tokens": 82739342.0, "step": 37070 }, { "entropy": 5.310593366622925, "epoch": 4.163868141742012, "grad_norm": 0.96484375, "learning_rate": 0.0003379140951563784, "loss": 4.8208, "mean_token_accuracy": 0.2256656989455223, "num_tokens": 82749460.0, "step": 37075 }, { "entropy": 5.407567310333252, "epoch": 4.164429718649969, "grad_norm": 1.0, "learning_rate": 0.00033787554691714033, "loss": 4.9628, "mean_token_accuracy": 0.2196066990494728, "num_tokens": 82760672.0, "step": 37080 }, { "entropy": 5.354074096679687, "epoch": 4.164991295557926, "grad_norm": 0.96484375, "learning_rate": 0.00033783699667592066, "loss": 4.9345, "mean_token_accuracy": 0.22541877627372742, "num_tokens": 82772116.0, "step": 37085 }, { "entropy": 5.295128870010376, "epoch": 4.165552872465884, "grad_norm": 0.953125, "learning_rate": 0.00033779844443394656, "loss": 4.9166, "mean_token_accuracy": 0.22108893245458602, "num_tokens": 82782376.0, "step": 37090 }, { "entropy": 5.264483118057251, "epoch": 4.166114449373842, "grad_norm": 0.95703125, "learning_rate": 0.00033775989019244556, "loss": 4.8487, "mean_token_accuracy": 0.22765025794506072, "num_tokens": 82794918.0, "step": 37095 }, { "entropy": 5.393333005905151, "epoch": 4.1666760262818, "grad_norm": 1.03125, "learning_rate": 0.00033772133395264535, "loss": 4.9939, "mean_token_accuracy": 0.2272569566965103, "num_tokens": 82805355.0, "step": 37100 }, { "entropy": 5.249981832504273, "epoch": 4.167237603189757, "grad_norm": 1.015625, "learning_rate": 0.00033768277571577364, "loss": 4.8644, "mean_token_accuracy": 0.23298754096031188, "num_tokens": 82815618.0, "step": 37105 }, { "entropy": 5.263239812850952, "epoch": 4.167799180097714, "grad_norm": 0.96875, "learning_rate": 0.00033764421548305795, "loss": 4.8641, "mean_token_accuracy": 0.2280909925699234, "num_tokens": 82826648.0, "step": 37110 }, { "entropy": 5.411647605895996, "epoch": 4.168360757005672, "grad_norm": 0.9375, "learning_rate": 0.00033760565325572614, "loss": 4.9575, "mean_token_accuracy": 0.22387369871139526, "num_tokens": 82838297.0, "step": 37115 }, { "entropy": 5.423958778381348, "epoch": 4.168922333913629, "grad_norm": 0.96484375, "learning_rate": 0.0003375670890350061, "loss": 4.9637, "mean_token_accuracy": 0.21965640038251877, "num_tokens": 82849824.0, "step": 37120 }, { "entropy": 5.342590570449829, "epoch": 4.169483910821587, "grad_norm": 0.9765625, "learning_rate": 0.00033752852282212557, "loss": 4.8798, "mean_token_accuracy": 0.23361082524061202, "num_tokens": 82861366.0, "step": 37125 }, { "entropy": 5.232738828659057, "epoch": 4.170045487729545, "grad_norm": 0.89453125, "learning_rate": 0.0003374899546183128, "loss": 4.9067, "mean_token_accuracy": 0.22057712078094482, "num_tokens": 82874142.0, "step": 37130 }, { "entropy": 5.248940086364746, "epoch": 4.170607064637502, "grad_norm": 0.9765625, "learning_rate": 0.00033745138442479544, "loss": 4.8748, "mean_token_accuracy": 0.228265218436718, "num_tokens": 82885786.0, "step": 37135 }, { "entropy": 5.288591480255127, "epoch": 4.17116864154546, "grad_norm": 0.96484375, "learning_rate": 0.0003374128122428019, "loss": 4.8865, "mean_token_accuracy": 0.22655483186244965, "num_tokens": 82896876.0, "step": 37140 }, { "entropy": 5.351944398880005, "epoch": 4.171730218453417, "grad_norm": 1.0625, "learning_rate": 0.0003373742380735602, "loss": 4.8331, "mean_token_accuracy": 0.233024862408638, "num_tokens": 82908016.0, "step": 37145 }, { "entropy": 5.339782571792602, "epoch": 4.1722917953613745, "grad_norm": 1.03125, "learning_rate": 0.0003373356619182985, "loss": 4.9523, "mean_token_accuracy": 0.23154925107955932, "num_tokens": 82919969.0, "step": 37150 }, { "entropy": 5.267319631576538, "epoch": 4.172853372269333, "grad_norm": 1.078125, "learning_rate": 0.0003372970837782453, "loss": 4.8129, "mean_token_accuracy": 0.23327140659093856, "num_tokens": 82929729.0, "step": 37155 }, { "entropy": 5.30239052772522, "epoch": 4.17341494917729, "grad_norm": 0.95703125, "learning_rate": 0.0003372585036546287, "loss": 4.8823, "mean_token_accuracy": 0.22484804391860963, "num_tokens": 82940888.0, "step": 37160 }, { "entropy": 5.3329582691192625, "epoch": 4.173976526085247, "grad_norm": 0.9765625, "learning_rate": 0.0003372199215486772, "loss": 4.9323, "mean_token_accuracy": 0.22505563050508498, "num_tokens": 82953206.0, "step": 37165 }, { "entropy": 5.408367156982422, "epoch": 4.174538102993205, "grad_norm": 1.078125, "learning_rate": 0.0003371813374616192, "loss": 4.9639, "mean_token_accuracy": 0.22025763243436813, "num_tokens": 82963979.0, "step": 37170 }, { "entropy": 5.38442177772522, "epoch": 4.175099679901162, "grad_norm": 1.0390625, "learning_rate": 0.00033714275139468336, "loss": 4.964, "mean_token_accuracy": 0.22308753281831742, "num_tokens": 82973673.0, "step": 37175 }, { "entropy": 5.2816386222839355, "epoch": 4.17566125680912, "grad_norm": 1.0703125, "learning_rate": 0.0003371041633490982, "loss": 4.908, "mean_token_accuracy": 0.2241467997431755, "num_tokens": 82983653.0, "step": 37180 }, { "entropy": 5.280409145355224, "epoch": 4.176222833717078, "grad_norm": 1.0703125, "learning_rate": 0.0003370655733260924, "loss": 4.8327, "mean_token_accuracy": 0.22640879154205323, "num_tokens": 82993631.0, "step": 37185 }, { "entropy": 5.242314338684082, "epoch": 4.176784410625035, "grad_norm": 0.98828125, "learning_rate": 0.00033702698132689467, "loss": 4.8032, "mean_token_accuracy": 0.23242261856794358, "num_tokens": 83003872.0, "step": 37190 }, { "entropy": 5.319524049758911, "epoch": 4.177345987532993, "grad_norm": 0.9453125, "learning_rate": 0.0003369883873527338, "loss": 4.8912, "mean_token_accuracy": 0.22850140929222107, "num_tokens": 83016779.0, "step": 37195 }, { "entropy": 5.309934186935425, "epoch": 4.17790756444095, "grad_norm": 0.953125, "learning_rate": 0.00033694979140483865, "loss": 4.9025, "mean_token_accuracy": 0.2268262967467308, "num_tokens": 83028544.0, "step": 37200 }, { "entropy": 5.265503454208374, "epoch": 4.1784691413489075, "grad_norm": 0.95703125, "learning_rate": 0.0003369111934844381, "loss": 4.7939, "mean_token_accuracy": 0.23089101165533066, "num_tokens": 83039040.0, "step": 37205 }, { "entropy": 5.263065814971924, "epoch": 4.179030718256866, "grad_norm": 0.99609375, "learning_rate": 0.00033687259359276115, "loss": 4.8743, "mean_token_accuracy": 0.22701384425163268, "num_tokens": 83050436.0, "step": 37210 }, { "entropy": 5.337719440460205, "epoch": 4.179592295164823, "grad_norm": 1.015625, "learning_rate": 0.0003368339917310368, "loss": 4.9252, "mean_token_accuracy": 0.22338382452726363, "num_tokens": 83062478.0, "step": 37215 }, { "entropy": 5.39286789894104, "epoch": 4.18015387207278, "grad_norm": 1.015625, "learning_rate": 0.0003367953879004942, "loss": 4.9563, "mean_token_accuracy": 0.22021283358335494, "num_tokens": 83073337.0, "step": 37220 }, { "entropy": 5.421606636047363, "epoch": 4.180715448980738, "grad_norm": 0.92578125, "learning_rate": 0.0003367567821023625, "loss": 4.9921, "mean_token_accuracy": 0.21748885810375213, "num_tokens": 83087454.0, "step": 37225 }, { "entropy": 5.377406644821167, "epoch": 4.181277025888695, "grad_norm": 1.0625, "learning_rate": 0.0003367181743378708, "loss": 4.9023, "mean_token_accuracy": 0.23181816935539246, "num_tokens": 83099037.0, "step": 37230 }, { "entropy": 5.284109306335449, "epoch": 4.181838602796653, "grad_norm": 1.0390625, "learning_rate": 0.00033667956460824866, "loss": 4.9168, "mean_token_accuracy": 0.22904450744390487, "num_tokens": 83109765.0, "step": 37235 }, { "entropy": 5.309484577178955, "epoch": 4.182400179704611, "grad_norm": 0.97265625, "learning_rate": 0.0003366409529147251, "loss": 4.8893, "mean_token_accuracy": 0.2197311669588089, "num_tokens": 83120348.0, "step": 37240 }, { "entropy": 5.324617576599121, "epoch": 4.182961756612568, "grad_norm": 1.0859375, "learning_rate": 0.00033660233925852977, "loss": 4.9087, "mean_token_accuracy": 0.2208218827843666, "num_tokens": 83130744.0, "step": 37245 }, { "entropy": 5.2930906295776365, "epoch": 4.183523333520526, "grad_norm": 1.0078125, "learning_rate": 0.00033656372364089206, "loss": 4.8382, "mean_token_accuracy": 0.2355899214744568, "num_tokens": 83140897.0, "step": 37250 }, { "entropy": 5.360458946228027, "epoch": 4.184084910428483, "grad_norm": 0.9140625, "learning_rate": 0.00033652510606304155, "loss": 4.9532, "mean_token_accuracy": 0.21869450509548188, "num_tokens": 83153364.0, "step": 37255 }, { "entropy": 5.210064268112182, "epoch": 4.18464648733644, "grad_norm": 0.99609375, "learning_rate": 0.00033648648652620766, "loss": 4.8445, "mean_token_accuracy": 0.22814815491437912, "num_tokens": 83164276.0, "step": 37260 }, { "entropy": 5.33187165260315, "epoch": 4.1852080642443985, "grad_norm": 1.046875, "learning_rate": 0.00033644786503162036, "loss": 4.9041, "mean_token_accuracy": 0.2224784255027771, "num_tokens": 83175585.0, "step": 37265 }, { "entropy": 5.350651645660401, "epoch": 4.185769641152356, "grad_norm": 0.9296875, "learning_rate": 0.0003364092415805091, "loss": 4.8334, "mean_token_accuracy": 0.23852764666080475, "num_tokens": 83185893.0, "step": 37270 }, { "entropy": 5.233529758453369, "epoch": 4.186331218060313, "grad_norm": 0.984375, "learning_rate": 0.00033637061617410377, "loss": 4.8709, "mean_token_accuracy": 0.22415133118629454, "num_tokens": 83195990.0, "step": 37275 }, { "entropy": 5.421274328231812, "epoch": 4.186892794968271, "grad_norm": 1.0625, "learning_rate": 0.0003363319888136343, "loss": 5.0288, "mean_token_accuracy": 0.21949052363634108, "num_tokens": 83206154.0, "step": 37280 }, { "entropy": 5.337035369873047, "epoch": 4.187454371876228, "grad_norm": 0.9453125, "learning_rate": 0.0003362933595003305, "loss": 4.8657, "mean_token_accuracy": 0.22797987461090088, "num_tokens": 83217984.0, "step": 37285 }, { "entropy": 5.327794551849365, "epoch": 4.188015948784186, "grad_norm": 0.9765625, "learning_rate": 0.0003362547282354223, "loss": 4.9098, "mean_token_accuracy": 0.21761895716190338, "num_tokens": 83229693.0, "step": 37290 }, { "entropy": 5.301523733139038, "epoch": 4.188577525692144, "grad_norm": 1.0, "learning_rate": 0.0003362160950201398, "loss": 4.8687, "mean_token_accuracy": 0.22668897956609727, "num_tokens": 83240771.0, "step": 37295 }, { "entropy": 5.256708097457886, "epoch": 4.189139102600101, "grad_norm": 0.99609375, "learning_rate": 0.0003361774598557132, "loss": 4.8072, "mean_token_accuracy": 0.23785578161478044, "num_tokens": 83252203.0, "step": 37300 }, { "entropy": 5.439500904083252, "epoch": 4.189700679508059, "grad_norm": 0.96484375, "learning_rate": 0.00033613882274337244, "loss": 5.0247, "mean_token_accuracy": 0.22049438804388047, "num_tokens": 83264103.0, "step": 37305 }, { "entropy": 5.377615118026734, "epoch": 4.190262256416016, "grad_norm": 1.015625, "learning_rate": 0.0003361001836843479, "loss": 4.958, "mean_token_accuracy": 0.2198164865374565, "num_tokens": 83275484.0, "step": 37310 }, { "entropy": 5.245244789123535, "epoch": 4.190823833323973, "grad_norm": 1.0, "learning_rate": 0.0003360615426798697, "loss": 4.8558, "mean_token_accuracy": 0.23056099861860274, "num_tokens": 83286150.0, "step": 37315 }, { "entropy": 5.284641170501709, "epoch": 4.1913854102319315, "grad_norm": 0.9609375, "learning_rate": 0.0003360228997311685, "loss": 4.8604, "mean_token_accuracy": 0.22492969483137132, "num_tokens": 83297574.0, "step": 37320 }, { "entropy": 5.387963485717774, "epoch": 4.191946987139889, "grad_norm": 0.99609375, "learning_rate": 0.0003359842548394744, "loss": 4.9451, "mean_token_accuracy": 0.22299590557813645, "num_tokens": 83309423.0, "step": 37325 }, { "entropy": 5.330846977233887, "epoch": 4.192508564047847, "grad_norm": 1.0, "learning_rate": 0.0003359456080060179, "loss": 4.9736, "mean_token_accuracy": 0.21651584208011626, "num_tokens": 83321003.0, "step": 37330 }, { "entropy": 5.407022094726562, "epoch": 4.193070140955804, "grad_norm": 0.890625, "learning_rate": 0.0003359069592320297, "loss": 4.9823, "mean_token_accuracy": 0.2208404064178467, "num_tokens": 83332513.0, "step": 37335 }, { "entropy": 5.4071447372436525, "epoch": 4.193631717863761, "grad_norm": 0.8984375, "learning_rate": 0.0003358683085187403, "loss": 4.9545, "mean_token_accuracy": 0.22954854369163513, "num_tokens": 83344250.0, "step": 37340 }, { "entropy": 5.374446249008178, "epoch": 4.194193294771719, "grad_norm": 0.9921875, "learning_rate": 0.00033582965586738037, "loss": 5.014, "mean_token_accuracy": 0.21904454976320267, "num_tokens": 83357359.0, "step": 37345 }, { "entropy": 5.415427875518799, "epoch": 4.1947548716796765, "grad_norm": 1.015625, "learning_rate": 0.0003357910012791804, "loss": 5.0709, "mean_token_accuracy": 0.2096161127090454, "num_tokens": 83369175.0, "step": 37350 }, { "entropy": 5.517972040176391, "epoch": 4.195316448587634, "grad_norm": 1.0078125, "learning_rate": 0.0003357523447553716, "loss": 5.1374, "mean_token_accuracy": 0.21501512974500656, "num_tokens": 83380977.0, "step": 37355 }, { "entropy": 5.449036455154419, "epoch": 4.195878025495592, "grad_norm": 0.94140625, "learning_rate": 0.00033571368629718457, "loss": 4.9887, "mean_token_accuracy": 0.2270175576210022, "num_tokens": 83393915.0, "step": 37360 }, { "entropy": 5.370309352874756, "epoch": 4.196439602403549, "grad_norm": 1.03125, "learning_rate": 0.00033567502590585007, "loss": 4.9493, "mean_token_accuracy": 0.22436715066432952, "num_tokens": 83405608.0, "step": 37365 }, { "entropy": 5.365134811401367, "epoch": 4.197001179311506, "grad_norm": 0.984375, "learning_rate": 0.0003356363635825994, "loss": 4.8871, "mean_token_accuracy": 0.2294543504714966, "num_tokens": 83417185.0, "step": 37370 }, { "entropy": 5.261742305755615, "epoch": 4.197562756219464, "grad_norm": 1.015625, "learning_rate": 0.0003355976993286633, "loss": 4.8666, "mean_token_accuracy": 0.2297522872686386, "num_tokens": 83428648.0, "step": 37375 }, { "entropy": 5.333370876312256, "epoch": 4.198124333127422, "grad_norm": 0.93359375, "learning_rate": 0.0003355590331452729, "loss": 4.9486, "mean_token_accuracy": 0.22148634791374205, "num_tokens": 83439860.0, "step": 37380 }, { "entropy": 5.366733503341675, "epoch": 4.19868591003538, "grad_norm": 1.0859375, "learning_rate": 0.00033552036503365945, "loss": 4.9397, "mean_token_accuracy": 0.21968822181224823, "num_tokens": 83451163.0, "step": 37385 }, { "entropy": 5.303592538833618, "epoch": 4.199247486943337, "grad_norm": 1.0390625, "learning_rate": 0.0003354816949950541, "loss": 4.8215, "mean_token_accuracy": 0.22591274082660676, "num_tokens": 83461584.0, "step": 37390 }, { "entropy": 5.350347709655762, "epoch": 4.199809063851294, "grad_norm": 0.96875, "learning_rate": 0.00033544302303068814, "loss": 4.8953, "mean_token_accuracy": 0.229937182366848, "num_tokens": 83473243.0, "step": 37395 }, { "entropy": 5.311123991012574, "epoch": 4.200370640759252, "grad_norm": 0.9921875, "learning_rate": 0.0003354043491417929, "loss": 4.9303, "mean_token_accuracy": 0.22909935414791108, "num_tokens": 83486143.0, "step": 37400 }, { "entropy": 5.366778707504272, "epoch": 4.2009322176672095, "grad_norm": 1.0234375, "learning_rate": 0.00033536567332959966, "loss": 4.9185, "mean_token_accuracy": 0.2172014057636261, "num_tokens": 83497809.0, "step": 37405 }, { "entropy": 5.32752571105957, "epoch": 4.201493794575167, "grad_norm": 0.83203125, "learning_rate": 0.00033532699559534, "loss": 4.9029, "mean_token_accuracy": 0.22884568572044373, "num_tokens": 83510558.0, "step": 37410 }, { "entropy": 5.285845756530762, "epoch": 4.202055371483125, "grad_norm": 0.9921875, "learning_rate": 0.00033528831594024553, "loss": 4.8572, "mean_token_accuracy": 0.22786543220281602, "num_tokens": 83522272.0, "step": 37415 }, { "entropy": 5.388953304290771, "epoch": 4.202616948391082, "grad_norm": 0.9609375, "learning_rate": 0.00033524963436554753, "loss": 5.0421, "mean_token_accuracy": 0.21877072751522064, "num_tokens": 83535588.0, "step": 37420 }, { "entropy": 5.47525053024292, "epoch": 4.20317852529904, "grad_norm": 1.015625, "learning_rate": 0.00033521095087247794, "loss": 5.0249, "mean_token_accuracy": 0.21915501952171326, "num_tokens": 83548120.0, "step": 37425 }, { "entropy": 5.390908718109131, "epoch": 4.203740102206997, "grad_norm": 0.98046875, "learning_rate": 0.0003351722654622683, "loss": 4.9003, "mean_token_accuracy": 0.2333230808377266, "num_tokens": 83559619.0, "step": 37430 }, { "entropy": 5.33630142211914, "epoch": 4.204301679114955, "grad_norm": 0.9765625, "learning_rate": 0.0003351335781361503, "loss": 4.9523, "mean_token_accuracy": 0.2218332827091217, "num_tokens": 83571975.0, "step": 37435 }, { "entropy": 5.313950300216675, "epoch": 4.204863256022913, "grad_norm": 1.078125, "learning_rate": 0.00033509488889535595, "loss": 4.9835, "mean_token_accuracy": 0.21896237134933472, "num_tokens": 83583012.0, "step": 37440 }, { "entropy": 5.334907579421997, "epoch": 4.20542483293087, "grad_norm": 1.0234375, "learning_rate": 0.00033505619774111696, "loss": 4.8657, "mean_token_accuracy": 0.23230547308921815, "num_tokens": 83592998.0, "step": 37445 }, { "entropy": 5.403669977188111, "epoch": 4.205986409838827, "grad_norm": 1.0546875, "learning_rate": 0.00033501750467466535, "loss": 4.95, "mean_token_accuracy": 0.21858363151550292, "num_tokens": 83603669.0, "step": 37450 }, { "entropy": 5.2863945960998535, "epoch": 4.206547986746785, "grad_norm": 1.0, "learning_rate": 0.0003349788096972331, "loss": 4.8539, "mean_token_accuracy": 0.22917922735214233, "num_tokens": 83613243.0, "step": 37455 }, { "entropy": 5.363780117034912, "epoch": 4.207109563654742, "grad_norm": 1.0078125, "learning_rate": 0.0003349401128100523, "loss": 4.9584, "mean_token_accuracy": 0.22426746785640717, "num_tokens": 83625131.0, "step": 37460 }, { "entropy": 5.367554378509522, "epoch": 4.2076711405627, "grad_norm": 1.0078125, "learning_rate": 0.00033490141401435516, "loss": 4.9184, "mean_token_accuracy": 0.2277054861187935, "num_tokens": 83635282.0, "step": 37465 }, { "entropy": 5.291355323791504, "epoch": 4.208232717470658, "grad_norm": 0.9921875, "learning_rate": 0.0003348627133113736, "loss": 4.8337, "mean_token_accuracy": 0.2311304733157158, "num_tokens": 83647398.0, "step": 37470 }, { "entropy": 5.318142700195312, "epoch": 4.208794294378615, "grad_norm": 1.046875, "learning_rate": 0.00033482401070234006, "loss": 4.8763, "mean_token_accuracy": 0.2322290852665901, "num_tokens": 83657938.0, "step": 37475 }, { "entropy": 5.276027345657349, "epoch": 4.209355871286573, "grad_norm": 0.9375, "learning_rate": 0.000334785306188487, "loss": 4.811, "mean_token_accuracy": 0.229682357609272, "num_tokens": 83668240.0, "step": 37480 }, { "entropy": 5.221360063552856, "epoch": 4.20991744819453, "grad_norm": 0.984375, "learning_rate": 0.0003347465997710464, "loss": 4.8394, "mean_token_accuracy": 0.2247369721531868, "num_tokens": 83682071.0, "step": 37485 }, { "entropy": 5.256880044937134, "epoch": 4.2104790251024875, "grad_norm": 0.9921875, "learning_rate": 0.000334707891451251, "loss": 4.8383, "mean_token_accuracy": 0.2289162680506706, "num_tokens": 83692895.0, "step": 37490 }, { "entropy": 5.273895406723023, "epoch": 4.211040602010446, "grad_norm": 0.97265625, "learning_rate": 0.0003346691812303331, "loss": 4.9395, "mean_token_accuracy": 0.22451485097408294, "num_tokens": 83705577.0, "step": 37495 }, { "entropy": 5.379204034805298, "epoch": 4.211602178918403, "grad_norm": 0.97265625, "learning_rate": 0.0003346304691095254, "loss": 4.9222, "mean_token_accuracy": 0.22185145914554597, "num_tokens": 83716694.0, "step": 37500 }, { "entropy": 5.343792867660523, "epoch": 4.21216375582636, "grad_norm": 0.99609375, "learning_rate": 0.0003345917550900604, "loss": 4.9197, "mean_token_accuracy": 0.2169765442609787, "num_tokens": 83728744.0, "step": 37505 }, { "entropy": 5.341556406021118, "epoch": 4.212725332734318, "grad_norm": 1.015625, "learning_rate": 0.00033455303917317075, "loss": 4.9104, "mean_token_accuracy": 0.22701396495103837, "num_tokens": 83740731.0, "step": 37510 }, { "entropy": 5.289283227920532, "epoch": 4.213286909642275, "grad_norm": 0.90625, "learning_rate": 0.00033451432136008937, "loss": 4.9111, "mean_token_accuracy": 0.21846056878566741, "num_tokens": 83751742.0, "step": 37515 }, { "entropy": 5.384820413589478, "epoch": 4.2138484865502335, "grad_norm": 1.0546875, "learning_rate": 0.0003344756016520488, "loss": 4.9142, "mean_token_accuracy": 0.22772423326969146, "num_tokens": 83761771.0, "step": 37520 }, { "entropy": 5.254843616485596, "epoch": 4.214410063458191, "grad_norm": 0.89453125, "learning_rate": 0.00033443688005028213, "loss": 4.7988, "mean_token_accuracy": 0.22964072078466416, "num_tokens": 83772394.0, "step": 37525 }, { "entropy": 5.3295127868652346, "epoch": 4.214971640366148, "grad_norm": 0.98828125, "learning_rate": 0.000334398156556022, "loss": 5.0181, "mean_token_accuracy": 0.21431985795497893, "num_tokens": 83784828.0, "step": 37530 }, { "entropy": 5.316731929779053, "epoch": 4.215533217274106, "grad_norm": 1.0625, "learning_rate": 0.0003343594311705016, "loss": 4.9179, "mean_token_accuracy": 0.2225389912724495, "num_tokens": 83794840.0, "step": 37535 }, { "entropy": 5.382118844985962, "epoch": 4.216094794182063, "grad_norm": 0.96875, "learning_rate": 0.00033432070389495386, "loss": 4.9493, "mean_token_accuracy": 0.22602129876613616, "num_tokens": 83807135.0, "step": 37540 }, { "entropy": 5.444579601287842, "epoch": 4.2166563710900204, "grad_norm": 1.0625, "learning_rate": 0.0003342819747306119, "loss": 5.0333, "mean_token_accuracy": 0.21936125457286834, "num_tokens": 83818979.0, "step": 37545 }, { "entropy": 5.37984037399292, "epoch": 4.2172179479979786, "grad_norm": 1.015625, "learning_rate": 0.00033424324367870896, "loss": 4.895, "mean_token_accuracy": 0.2246434897184372, "num_tokens": 83829568.0, "step": 37550 }, { "entropy": 5.447844648361206, "epoch": 4.217779524905936, "grad_norm": 1.1015625, "learning_rate": 0.00033420451074047807, "loss": 5.0742, "mean_token_accuracy": 0.2126983657479286, "num_tokens": 83841311.0, "step": 37555 }, { "entropy": 5.35557746887207, "epoch": 4.218341101813893, "grad_norm": 1.046875, "learning_rate": 0.0003341657759171526, "loss": 4.9129, "mean_token_accuracy": 0.2299878939986229, "num_tokens": 83853648.0, "step": 37560 }, { "entropy": 5.264745807647705, "epoch": 4.218902678721851, "grad_norm": 1.0390625, "learning_rate": 0.0003341270392099659, "loss": 4.8571, "mean_token_accuracy": 0.23345450013875962, "num_tokens": 83863848.0, "step": 37565 }, { "entropy": 5.30736198425293, "epoch": 4.219464255629808, "grad_norm": 0.96484375, "learning_rate": 0.00033408830062015135, "loss": 4.8443, "mean_token_accuracy": 0.23347631543874742, "num_tokens": 83874446.0, "step": 37570 }, { "entropy": 5.336557197570801, "epoch": 4.220025832537766, "grad_norm": 1.0390625, "learning_rate": 0.00033404956014894237, "loss": 4.8434, "mean_token_accuracy": 0.2346685752272606, "num_tokens": 83884681.0, "step": 37575 }, { "entropy": 5.298976564407349, "epoch": 4.220587409445724, "grad_norm": 1.0234375, "learning_rate": 0.00033401081779757254, "loss": 4.9158, "mean_token_accuracy": 0.22727809548377992, "num_tokens": 83895026.0, "step": 37580 }, { "entropy": 5.384079027175903, "epoch": 4.221148986353681, "grad_norm": 0.9921875, "learning_rate": 0.0003339720735672753, "loss": 4.9909, "mean_token_accuracy": 0.22236306816339493, "num_tokens": 83905855.0, "step": 37585 }, { "entropy": 5.281061410903931, "epoch": 4.221710563261639, "grad_norm": 0.94921875, "learning_rate": 0.00033393332745928453, "loss": 4.8161, "mean_token_accuracy": 0.22906559705734253, "num_tokens": 83918447.0, "step": 37590 }, { "entropy": 5.290679216384888, "epoch": 4.222272140169596, "grad_norm": 1.0390625, "learning_rate": 0.00033389457947483357, "loss": 4.8805, "mean_token_accuracy": 0.23264921605587005, "num_tokens": 83929068.0, "step": 37595 }, { "entropy": 5.331558513641357, "epoch": 4.222833717077553, "grad_norm": 0.9921875, "learning_rate": 0.00033385582961515645, "loss": 4.8951, "mean_token_accuracy": 0.2269457682967186, "num_tokens": 83939636.0, "step": 37600 }, { "entropy": 5.3921161651611325, "epoch": 4.2233952939855115, "grad_norm": 1.0, "learning_rate": 0.00033381707788148683, "loss": 4.9474, "mean_token_accuracy": 0.22059089690446854, "num_tokens": 83950743.0, "step": 37605 }, { "entropy": 5.476277875900268, "epoch": 4.223956870893469, "grad_norm": 1.0703125, "learning_rate": 0.00033377832427505864, "loss": 5.0345, "mean_token_accuracy": 0.21240339130163194, "num_tokens": 83963383.0, "step": 37610 }, { "entropy": 5.352823877334595, "epoch": 4.224518447801427, "grad_norm": 1.109375, "learning_rate": 0.00033373956879710593, "loss": 4.8496, "mean_token_accuracy": 0.2345030978322029, "num_tokens": 83973768.0, "step": 37615 }, { "entropy": 5.293409633636474, "epoch": 4.225080024709384, "grad_norm": 1.0703125, "learning_rate": 0.00033370081144886246, "loss": 4.9152, "mean_token_accuracy": 0.22400543540716172, "num_tokens": 83984769.0, "step": 37620 }, { "entropy": 5.270657205581665, "epoch": 4.225641601617341, "grad_norm": 0.90234375, "learning_rate": 0.00033366205223156237, "loss": 4.8486, "mean_token_accuracy": 0.22660569250583648, "num_tokens": 83996894.0, "step": 37625 }, { "entropy": 5.308344030380249, "epoch": 4.226203178525299, "grad_norm": 0.98828125, "learning_rate": 0.00033362329114643987, "loss": 4.8936, "mean_token_accuracy": 0.2207052767276764, "num_tokens": 84008536.0, "step": 37630 }, { "entropy": 5.28873839378357, "epoch": 4.226764755433257, "grad_norm": 0.921875, "learning_rate": 0.00033358452819472895, "loss": 4.8205, "mean_token_accuracy": 0.22345851808786393, "num_tokens": 84020239.0, "step": 37635 }, { "entropy": 5.399445819854736, "epoch": 4.227326332341214, "grad_norm": 0.96484375, "learning_rate": 0.00033354576337766396, "loss": 4.9522, "mean_token_accuracy": 0.22376303225755692, "num_tokens": 84031580.0, "step": 37640 }, { "entropy": 5.277694892883301, "epoch": 4.227887909249172, "grad_norm": 1.0390625, "learning_rate": 0.0003335069966964792, "loss": 4.8815, "mean_token_accuracy": 0.22409235835075378, "num_tokens": 84042111.0, "step": 37645 }, { "entropy": 5.39100079536438, "epoch": 4.228449486157129, "grad_norm": 0.9609375, "learning_rate": 0.000333468228152409, "loss": 4.9361, "mean_token_accuracy": 0.2189219132065773, "num_tokens": 84052048.0, "step": 37650 }, { "entropy": 5.379430818557739, "epoch": 4.229011063065086, "grad_norm": 1.0, "learning_rate": 0.00033342945774668766, "loss": 5.0245, "mean_token_accuracy": 0.21678949594497682, "num_tokens": 84063766.0, "step": 37655 }, { "entropy": 5.319349670410157, "epoch": 4.2295726399730444, "grad_norm": 1.0078125, "learning_rate": 0.00033339068548054974, "loss": 4.9607, "mean_token_accuracy": 0.2186967611312866, "num_tokens": 84073992.0, "step": 37660 }, { "entropy": 5.284269046783447, "epoch": 4.230134216881002, "grad_norm": 0.9765625, "learning_rate": 0.00033335191135522974, "loss": 4.7848, "mean_token_accuracy": 0.2305704727768898, "num_tokens": 84084298.0, "step": 37665 }, { "entropy": 5.269844341278076, "epoch": 4.23069579378896, "grad_norm": 1.03125, "learning_rate": 0.00033331313537196235, "loss": 4.8542, "mean_token_accuracy": 0.22324786633253096, "num_tokens": 84093638.0, "step": 37670 }, { "entropy": 5.271061038970947, "epoch": 4.231257370696917, "grad_norm": 1.046875, "learning_rate": 0.000333274357531982, "loss": 4.827, "mean_token_accuracy": 0.22800702899694442, "num_tokens": 84104627.0, "step": 37675 }, { "entropy": 5.298124837875366, "epoch": 4.231818947604874, "grad_norm": 0.98046875, "learning_rate": 0.0003332355778365235, "loss": 4.7991, "mean_token_accuracy": 0.22745700180530548, "num_tokens": 84115474.0, "step": 37680 }, { "entropy": 5.337525272369385, "epoch": 4.232380524512832, "grad_norm": 0.94140625, "learning_rate": 0.0003331967962868217, "loss": 5.0128, "mean_token_accuracy": 0.21558054387569428, "num_tokens": 84126101.0, "step": 37685 }, { "entropy": 5.3839293956756595, "epoch": 4.2329421014207895, "grad_norm": 1.046875, "learning_rate": 0.0003331580128841112, "loss": 4.9376, "mean_token_accuracy": 0.22063490152359008, "num_tokens": 84136497.0, "step": 37690 }, { "entropy": 5.347946977615356, "epoch": 4.233503678328747, "grad_norm": 0.96484375, "learning_rate": 0.00033311922762962716, "loss": 4.899, "mean_token_accuracy": 0.23074334859848022, "num_tokens": 84149001.0, "step": 37695 }, { "entropy": 5.276639986038208, "epoch": 4.234065255236705, "grad_norm": 0.9765625, "learning_rate": 0.0003330804405246043, "loss": 4.7743, "mean_token_accuracy": 0.2362628310918808, "num_tokens": 84159951.0, "step": 37700 }, { "entropy": 5.304737138748169, "epoch": 4.234626832144662, "grad_norm": 0.95703125, "learning_rate": 0.0003330416515702777, "loss": 4.8345, "mean_token_accuracy": 0.23683350682258605, "num_tokens": 84170387.0, "step": 37705 }, { "entropy": 5.391392087936401, "epoch": 4.23518840905262, "grad_norm": 1.0703125, "learning_rate": 0.00033300286076788237, "loss": 5.0153, "mean_token_accuracy": 0.22048023492097854, "num_tokens": 84182412.0, "step": 37710 }, { "entropy": 5.328062629699707, "epoch": 4.235749985960577, "grad_norm": 0.98828125, "learning_rate": 0.0003329640681186535, "loss": 4.8891, "mean_token_accuracy": 0.23798673897981643, "num_tokens": 84193581.0, "step": 37715 }, { "entropy": 5.332671499252319, "epoch": 4.236311562868535, "grad_norm": 0.9609375, "learning_rate": 0.00033292527362382626, "loss": 4.8932, "mean_token_accuracy": 0.22251082062721253, "num_tokens": 84204433.0, "step": 37720 }, { "entropy": 5.293264150619507, "epoch": 4.236873139776493, "grad_norm": 0.97265625, "learning_rate": 0.00033288647728463576, "loss": 4.8638, "mean_token_accuracy": 0.22849951535463334, "num_tokens": 84216034.0, "step": 37725 }, { "entropy": 5.313537359237671, "epoch": 4.23743471668445, "grad_norm": 1.046875, "learning_rate": 0.00033284767910231745, "loss": 4.8692, "mean_token_accuracy": 0.23325546085834503, "num_tokens": 84226385.0, "step": 37730 }, { "entropy": 5.3663228988647464, "epoch": 4.237996293592407, "grad_norm": 1.015625, "learning_rate": 0.0003328088790781065, "loss": 4.9195, "mean_token_accuracy": 0.22583019286394118, "num_tokens": 84236742.0, "step": 37735 }, { "entropy": 5.374253606796264, "epoch": 4.238557870500365, "grad_norm": 1.0, "learning_rate": 0.00033277007721323854, "loss": 4.9546, "mean_token_accuracy": 0.22547658979892732, "num_tokens": 84247969.0, "step": 37740 }, { "entropy": 5.3105169296264645, "epoch": 4.2391194474083225, "grad_norm": 0.953125, "learning_rate": 0.00033273127350894884, "loss": 4.8667, "mean_token_accuracy": 0.2296567901968956, "num_tokens": 84260939.0, "step": 37745 }, { "entropy": 5.292934703826904, "epoch": 4.23968102431628, "grad_norm": 0.95703125, "learning_rate": 0.00033269246796647296, "loss": 4.9083, "mean_token_accuracy": 0.22671340852975846, "num_tokens": 84272972.0, "step": 37750 }, { "entropy": 5.36196494102478, "epoch": 4.240242601224238, "grad_norm": 1.0078125, "learning_rate": 0.0003326536605870466, "loss": 4.9239, "mean_token_accuracy": 0.22532738298177718, "num_tokens": 84283920.0, "step": 37755 }, { "entropy": 5.354731130599975, "epoch": 4.240804178132195, "grad_norm": 0.921875, "learning_rate": 0.00033261485137190533, "loss": 4.96, "mean_token_accuracy": 0.22362091839313508, "num_tokens": 84296163.0, "step": 37760 }, { "entropy": 5.2861656665802, "epoch": 4.241365755040153, "grad_norm": 0.9453125, "learning_rate": 0.00033257604032228485, "loss": 4.8448, "mean_token_accuracy": 0.231043803691864, "num_tokens": 84306647.0, "step": 37765 }, { "entropy": 5.222252416610718, "epoch": 4.24192733194811, "grad_norm": 0.90234375, "learning_rate": 0.00033253722743942086, "loss": 4.7992, "mean_token_accuracy": 0.23367975801229476, "num_tokens": 84318678.0, "step": 37770 }, { "entropy": 5.2198834896087645, "epoch": 4.2424889088560676, "grad_norm": 1.015625, "learning_rate": 0.0003324984127245492, "loss": 4.8268, "mean_token_accuracy": 0.2334268197417259, "num_tokens": 84329954.0, "step": 37775 }, { "entropy": 5.300224351882934, "epoch": 4.243050485764026, "grad_norm": 0.92578125, "learning_rate": 0.0003324595961789058, "loss": 4.8688, "mean_token_accuracy": 0.22382071912288665, "num_tokens": 84341157.0, "step": 37780 }, { "entropy": 5.362799835205078, "epoch": 4.243612062671983, "grad_norm": 0.99609375, "learning_rate": 0.00033242077780372664, "loss": 4.9204, "mean_token_accuracy": 0.22149030715227128, "num_tokens": 84352893.0, "step": 37785 }, { "entropy": 5.328584861755371, "epoch": 4.24417363957994, "grad_norm": 1.1875, "learning_rate": 0.00033238195760024766, "loss": 4.8773, "mean_token_accuracy": 0.22386250346899034, "num_tokens": 84365019.0, "step": 37790 }, { "entropy": 5.300116682052613, "epoch": 4.244735216487898, "grad_norm": 0.8984375, "learning_rate": 0.00033234313556970485, "loss": 4.8891, "mean_token_accuracy": 0.22758695781230925, "num_tokens": 84376397.0, "step": 37795 }, { "entropy": 5.301068735122681, "epoch": 4.245296793395855, "grad_norm": 1.0625, "learning_rate": 0.00033230431171333435, "loss": 4.8953, "mean_token_accuracy": 0.22814767807722092, "num_tokens": 84387649.0, "step": 37800 }, { "entropy": 5.415524435043335, "epoch": 4.2458583703038135, "grad_norm": 0.94140625, "learning_rate": 0.0003322654860323723, "loss": 5.0068, "mean_token_accuracy": 0.2105608880519867, "num_tokens": 84399471.0, "step": 37805 }, { "entropy": 5.413452529907227, "epoch": 4.246419947211771, "grad_norm": 0.94921875, "learning_rate": 0.00033222665852805514, "loss": 4.8826, "mean_token_accuracy": 0.22914549261331557, "num_tokens": 84409975.0, "step": 37810 }, { "entropy": 5.333680486679077, "epoch": 4.246981524119728, "grad_norm": 1.0625, "learning_rate": 0.00033218782920161884, "loss": 4.913, "mean_token_accuracy": 0.22853086441755294, "num_tokens": 84421851.0, "step": 37815 }, { "entropy": 5.237923431396484, "epoch": 4.247543101027686, "grad_norm": 1.015625, "learning_rate": 0.00033214899805429984, "loss": 4.822, "mean_token_accuracy": 0.23349526524543762, "num_tokens": 84433021.0, "step": 37820 }, { "entropy": 5.302494812011719, "epoch": 4.248104677935643, "grad_norm": 0.94921875, "learning_rate": 0.00033211016508733463, "loss": 4.9262, "mean_token_accuracy": 0.22031232267618178, "num_tokens": 84443635.0, "step": 37825 }, { "entropy": 5.368982267379761, "epoch": 4.2486662548436005, "grad_norm": 1.015625, "learning_rate": 0.00033207133030195964, "loss": 4.9663, "mean_token_accuracy": 0.21550064533948898, "num_tokens": 84455259.0, "step": 37830 }, { "entropy": 5.360562562942505, "epoch": 4.249227831751559, "grad_norm": 1.0546875, "learning_rate": 0.0003320324936994113, "loss": 4.8601, "mean_token_accuracy": 0.22678565979003906, "num_tokens": 84465080.0, "step": 37835 }, { "entropy": 5.343709135055542, "epoch": 4.249789408659516, "grad_norm": 1.0, "learning_rate": 0.00033199365528092625, "loss": 4.933, "mean_token_accuracy": 0.2243219718337059, "num_tokens": 84476070.0, "step": 37840 }, { "entropy": 5.2715473651885985, "epoch": 4.250350985567474, "grad_norm": 1.0546875, "learning_rate": 0.00033195481504774113, "loss": 4.8297, "mean_token_accuracy": 0.22602640390396117, "num_tokens": 84486496.0, "step": 37845 }, { "entropy": 5.425025558471679, "epoch": 4.250912562475431, "grad_norm": 1.046875, "learning_rate": 0.00033191597300109263, "loss": 4.931, "mean_token_accuracy": 0.2235083594918251, "num_tokens": 84497086.0, "step": 37850 }, { "entropy": 5.370567989349365, "epoch": 4.251474139383388, "grad_norm": 0.99609375, "learning_rate": 0.00033187712914221744, "loss": 4.931, "mean_token_accuracy": 0.22409696131944656, "num_tokens": 84508498.0, "step": 37855 }, { "entropy": 5.36091799736023, "epoch": 4.2520357162913465, "grad_norm": 1.0546875, "learning_rate": 0.0003318382834723524, "loss": 4.9523, "mean_token_accuracy": 0.22141028195619583, "num_tokens": 84519117.0, "step": 37860 }, { "entropy": 5.395045328140259, "epoch": 4.252597293199304, "grad_norm": 1.0625, "learning_rate": 0.00033179943599273445, "loss": 4.9431, "mean_token_accuracy": 0.22491591721773146, "num_tokens": 84530752.0, "step": 37865 }, { "entropy": 5.3676458358764645, "epoch": 4.253158870107261, "grad_norm": 0.953125, "learning_rate": 0.0003317605867046003, "loss": 4.9304, "mean_token_accuracy": 0.21917640268802643, "num_tokens": 84542989.0, "step": 37870 }, { "entropy": 5.335285329818726, "epoch": 4.253720447015219, "grad_norm": 1.0703125, "learning_rate": 0.00033172173560918716, "loss": 4.8829, "mean_token_accuracy": 0.22704195231199265, "num_tokens": 84554426.0, "step": 37875 }, { "entropy": 5.264306688308716, "epoch": 4.254282023923176, "grad_norm": 0.95703125, "learning_rate": 0.00033168288270773197, "loss": 4.781, "mean_token_accuracy": 0.23185194730758668, "num_tokens": 84565669.0, "step": 37880 }, { "entropy": 5.330320501327515, "epoch": 4.254843600831133, "grad_norm": 1.015625, "learning_rate": 0.00033164402800147177, "loss": 4.9164, "mean_token_accuracy": 0.23119474500417708, "num_tokens": 84576967.0, "step": 37885 }, { "entropy": 5.321692609786988, "epoch": 4.2554051777390915, "grad_norm": 1.0625, "learning_rate": 0.0003316051714916436, "loss": 4.8938, "mean_token_accuracy": 0.22319069355726243, "num_tokens": 84586828.0, "step": 37890 }, { "entropy": 5.387816572189331, "epoch": 4.255966754647049, "grad_norm": 1.0625, "learning_rate": 0.00033156631317948505, "loss": 4.9746, "mean_token_accuracy": 0.22780648320913316, "num_tokens": 84597266.0, "step": 37895 }, { "entropy": 5.4791759014129635, "epoch": 4.256528331555007, "grad_norm": 1.046875, "learning_rate": 0.000331527453066233, "loss": 5.0183, "mean_token_accuracy": 0.2259109601378441, "num_tokens": 84609170.0, "step": 37900 }, { "entropy": 5.354374408721924, "epoch": 4.257089908462964, "grad_norm": 1.0859375, "learning_rate": 0.000331488591153125, "loss": 4.9142, "mean_token_accuracy": 0.22424134165048598, "num_tokens": 84620415.0, "step": 37905 }, { "entropy": 5.346922731399536, "epoch": 4.257651485370921, "grad_norm": 0.91796875, "learning_rate": 0.0003314497274413983, "loss": 4.9549, "mean_token_accuracy": 0.22715600579977036, "num_tokens": 84631417.0, "step": 37910 }, { "entropy": 5.440149354934692, "epoch": 4.258213062278879, "grad_norm": 0.9375, "learning_rate": 0.00033141086193229043, "loss": 4.9852, "mean_token_accuracy": 0.21696187406778336, "num_tokens": 84642528.0, "step": 37915 }, { "entropy": 5.337555551528931, "epoch": 4.258774639186837, "grad_norm": 0.9296875, "learning_rate": 0.0003313719946270388, "loss": 4.8958, "mean_token_accuracy": 0.23117099404335023, "num_tokens": 84653785.0, "step": 37920 }, { "entropy": 5.271041202545166, "epoch": 4.259336216094794, "grad_norm": 1.0703125, "learning_rate": 0.00033133312552688094, "loss": 4.9175, "mean_token_accuracy": 0.21926555633544922, "num_tokens": 84664533.0, "step": 37925 }, { "entropy": 5.2576697826385494, "epoch": 4.259897793002752, "grad_norm": 0.953125, "learning_rate": 0.00033129425463305465, "loss": 4.8443, "mean_token_accuracy": 0.23394346088171006, "num_tokens": 84674874.0, "step": 37930 }, { "entropy": 5.337809324264526, "epoch": 4.260459369910709, "grad_norm": 1.0390625, "learning_rate": 0.0003312553819467974, "loss": 4.8644, "mean_token_accuracy": 0.22733468562364578, "num_tokens": 84685619.0, "step": 37935 }, { "entropy": 5.370522689819336, "epoch": 4.261020946818666, "grad_norm": 1.03125, "learning_rate": 0.00033121650746934693, "loss": 4.9493, "mean_token_accuracy": 0.22852530777454377, "num_tokens": 84696062.0, "step": 37940 }, { "entropy": 5.393057537078858, "epoch": 4.2615825237266245, "grad_norm": 1.046875, "learning_rate": 0.0003311776312019412, "loss": 4.9885, "mean_token_accuracy": 0.2198973700404167, "num_tokens": 84706686.0, "step": 37945 }, { "entropy": 5.329270553588867, "epoch": 4.262144100634582, "grad_norm": 0.93359375, "learning_rate": 0.0003311387531458177, "loss": 4.89, "mean_token_accuracy": 0.22428309470415114, "num_tokens": 84717193.0, "step": 37950 }, { "entropy": 5.308779287338257, "epoch": 4.26270567754254, "grad_norm": 1.0, "learning_rate": 0.0003310998733022146, "loss": 4.8346, "mean_token_accuracy": 0.2235088363289833, "num_tokens": 84728906.0, "step": 37955 }, { "entropy": 5.446051692962646, "epoch": 4.263267254450497, "grad_norm": 1.015625, "learning_rate": 0.0003310609916723698, "loss": 4.9886, "mean_token_accuracy": 0.22709652930498123, "num_tokens": 84741417.0, "step": 37960 }, { "entropy": 5.2874627113342285, "epoch": 4.263828831358454, "grad_norm": 1.0859375, "learning_rate": 0.0003310221082575213, "loss": 4.8187, "mean_token_accuracy": 0.23205751776695252, "num_tokens": 84752488.0, "step": 37965 }, { "entropy": 5.385778188705444, "epoch": 4.264390408266412, "grad_norm": 1.0, "learning_rate": 0.00033098322305890715, "loss": 4.9753, "mean_token_accuracy": 0.2266583561897278, "num_tokens": 84763573.0, "step": 37970 }, { "entropy": 5.400099658966065, "epoch": 4.26495198517437, "grad_norm": 1.015625, "learning_rate": 0.00033094433607776545, "loss": 5.0136, "mean_token_accuracy": 0.21979268193244933, "num_tokens": 84774803.0, "step": 37975 }, { "entropy": 5.369838762283325, "epoch": 4.265513562082327, "grad_norm": 0.9921875, "learning_rate": 0.00033090544731533434, "loss": 4.8345, "mean_token_accuracy": 0.22289749681949617, "num_tokens": 84786261.0, "step": 37980 }, { "entropy": 5.269379758834839, "epoch": 4.266075138990285, "grad_norm": 0.89453125, "learning_rate": 0.0003308665567728522, "loss": 4.8426, "mean_token_accuracy": 0.229385207593441, "num_tokens": 84797575.0, "step": 37985 }, { "entropy": 5.311602401733398, "epoch": 4.266636715898242, "grad_norm": 0.91796875, "learning_rate": 0.00033082766445155715, "loss": 5.0001, "mean_token_accuracy": 0.22648786753416061, "num_tokens": 84811127.0, "step": 37990 }, { "entropy": 5.2997321605682375, "epoch": 4.2671982928062, "grad_norm": 0.92578125, "learning_rate": 0.00033078877035268766, "loss": 4.8606, "mean_token_accuracy": 0.22603930979967118, "num_tokens": 84823169.0, "step": 37995 }, { "entropy": 5.33558931350708, "epoch": 4.267759869714157, "grad_norm": 1.0390625, "learning_rate": 0.00033074987447748205, "loss": 4.9431, "mean_token_accuracy": 0.2223045989871025, "num_tokens": 84834917.0, "step": 38000 }, { "entropy": 5.382665920257568, "epoch": 4.268321446622115, "grad_norm": 1.171875, "learning_rate": 0.00033071097682717883, "loss": 4.9027, "mean_token_accuracy": 0.2227035790681839, "num_tokens": 84845319.0, "step": 38005 }, { "entropy": 5.350390100479126, "epoch": 4.268883023530073, "grad_norm": 1.0703125, "learning_rate": 0.0003306720774030165, "loss": 4.9268, "mean_token_accuracy": 0.23035207092761995, "num_tokens": 84855438.0, "step": 38010 }, { "entropy": 5.2158020496368405, "epoch": 4.26944460043803, "grad_norm": 0.97265625, "learning_rate": 0.0003306331762062336, "loss": 4.8445, "mean_token_accuracy": 0.22204643189907075, "num_tokens": 84867177.0, "step": 38015 }, { "entropy": 5.2672257900238035, "epoch": 4.270006177345987, "grad_norm": 1.0234375, "learning_rate": 0.0003305942732380689, "loss": 4.8679, "mean_token_accuracy": 0.23475642800331115, "num_tokens": 84878382.0, "step": 38020 }, { "entropy": 5.311164855957031, "epoch": 4.270567754253945, "grad_norm": 0.95703125, "learning_rate": 0.0003305553684997609, "loss": 4.8271, "mean_token_accuracy": 0.22563968896865844, "num_tokens": 84889754.0, "step": 38025 }, { "entropy": 5.3620765686035154, "epoch": 4.2711293311619025, "grad_norm": 0.984375, "learning_rate": 0.00033051646199254843, "loss": 4.9512, "mean_token_accuracy": 0.22493126690387727, "num_tokens": 84901638.0, "step": 38030 }, { "entropy": 5.26508412361145, "epoch": 4.271690908069861, "grad_norm": 0.9609375, "learning_rate": 0.0003304775537176702, "loss": 4.7822, "mean_token_accuracy": 0.23419013172388076, "num_tokens": 84912552.0, "step": 38035 }, { "entropy": 5.275631332397461, "epoch": 4.272252484977818, "grad_norm": 1.03125, "learning_rate": 0.0003304386436763652, "loss": 4.8448, "mean_token_accuracy": 0.22976761311292648, "num_tokens": 84924920.0, "step": 38040 }, { "entropy": 5.337018918991089, "epoch": 4.272814061885775, "grad_norm": 1.046875, "learning_rate": 0.0003303997318698723, "loss": 4.912, "mean_token_accuracy": 0.22318752855062485, "num_tokens": 84936835.0, "step": 38045 }, { "entropy": 5.367349576950073, "epoch": 4.273375638793733, "grad_norm": 0.9296875, "learning_rate": 0.0003303608182994304, "loss": 4.9569, "mean_token_accuracy": 0.22937808483839034, "num_tokens": 84948307.0, "step": 38050 }, { "entropy": 5.406091833114624, "epoch": 4.27393721570169, "grad_norm": 0.9765625, "learning_rate": 0.0003303219029662787, "loss": 5.0263, "mean_token_accuracy": 0.21734505295753478, "num_tokens": 84960034.0, "step": 38055 }, { "entropy": 5.333178186416626, "epoch": 4.274498792609648, "grad_norm": 0.96484375, "learning_rate": 0.00033028298587165606, "loss": 4.8875, "mean_token_accuracy": 0.22558943480253218, "num_tokens": 84971195.0, "step": 38060 }, { "entropy": 5.367589330673217, "epoch": 4.275060369517606, "grad_norm": 0.94921875, "learning_rate": 0.0003302440670168017, "loss": 4.9087, "mean_token_accuracy": 0.23038232773542405, "num_tokens": 84983689.0, "step": 38065 }, { "entropy": 5.357565546035767, "epoch": 4.275621946425563, "grad_norm": 1.0703125, "learning_rate": 0.0003302051464029548, "loss": 4.9889, "mean_token_accuracy": 0.22004874050617218, "num_tokens": 84996469.0, "step": 38070 }, { "entropy": 5.262121772766113, "epoch": 4.27618352333352, "grad_norm": 1.2890625, "learning_rate": 0.00033016622403135473, "loss": 4.7432, "mean_token_accuracy": 0.23716548085212708, "num_tokens": 85007427.0, "step": 38075 }, { "entropy": 5.228739786148071, "epoch": 4.276745100241478, "grad_norm": 0.98046875, "learning_rate": 0.00033012729990324063, "loss": 4.8293, "mean_token_accuracy": 0.22919696867465972, "num_tokens": 85019089.0, "step": 38080 }, { "entropy": 5.3447465896606445, "epoch": 4.2773066771494355, "grad_norm": 1.0234375, "learning_rate": 0.0003300883740198519, "loss": 4.9389, "mean_token_accuracy": 0.22521232515573503, "num_tokens": 85031032.0, "step": 38085 }, { "entropy": 5.3164464950561525, "epoch": 4.277868254057394, "grad_norm": 0.9375, "learning_rate": 0.00033004944638242805, "loss": 4.853, "mean_token_accuracy": 0.23376017659902573, "num_tokens": 85042002.0, "step": 38090 }, { "entropy": 5.301219749450683, "epoch": 4.278429830965351, "grad_norm": 0.98046875, "learning_rate": 0.0003300105169922084, "loss": 4.7907, "mean_token_accuracy": 0.2315518543124199, "num_tokens": 85052844.0, "step": 38095 }, { "entropy": 5.314469671249389, "epoch": 4.278991407873308, "grad_norm": 1.09375, "learning_rate": 0.0003299715858504326, "loss": 4.9545, "mean_token_accuracy": 0.223158960044384, "num_tokens": 85064094.0, "step": 38100 }, { "entropy": 5.396696662902832, "epoch": 4.279552984781266, "grad_norm": 0.9609375, "learning_rate": 0.00032993265295834013, "loss": 4.9554, "mean_token_accuracy": 0.2207372933626175, "num_tokens": 85076695.0, "step": 38105 }, { "entropy": 5.326773691177368, "epoch": 4.280114561689223, "grad_norm": 0.95703125, "learning_rate": 0.0003298937183171707, "loss": 4.8915, "mean_token_accuracy": 0.2300471231341362, "num_tokens": 85088258.0, "step": 38110 }, { "entropy": 5.322440910339355, "epoch": 4.2806761385971805, "grad_norm": 1.0, "learning_rate": 0.000329854781928164, "loss": 4.8362, "mean_token_accuracy": 0.22805664390325547, "num_tokens": 85098277.0, "step": 38115 }, { "entropy": 5.357497787475586, "epoch": 4.281237715505139, "grad_norm": 1.0546875, "learning_rate": 0.0003298158437925598, "loss": 4.9413, "mean_token_accuracy": 0.22389708757400512, "num_tokens": 85108242.0, "step": 38120 }, { "entropy": 5.2517787456512455, "epoch": 4.281799292413096, "grad_norm": 0.89453125, "learning_rate": 0.0003297769039115978, "loss": 4.783, "mean_token_accuracy": 0.232975834608078, "num_tokens": 85119607.0, "step": 38125 }, { "entropy": 5.356944417953491, "epoch": 4.282360869321053, "grad_norm": 0.9453125, "learning_rate": 0.00032973796228651797, "loss": 4.9218, "mean_token_accuracy": 0.22540232241153718, "num_tokens": 85131517.0, "step": 38130 }, { "entropy": 5.422297143936158, "epoch": 4.282922446229011, "grad_norm": 1.078125, "learning_rate": 0.00032969901891856027, "loss": 4.9855, "mean_token_accuracy": 0.22238709032535553, "num_tokens": 85143739.0, "step": 38135 }, { "entropy": 5.444101619720459, "epoch": 4.283484023136968, "grad_norm": 0.9765625, "learning_rate": 0.00032966007380896443, "loss": 4.9319, "mean_token_accuracy": 0.22575369626283645, "num_tokens": 85155881.0, "step": 38140 }, { "entropy": 5.297903919219971, "epoch": 4.2840456000449265, "grad_norm": 0.96484375, "learning_rate": 0.0003296211269589708, "loss": 4.8936, "mean_token_accuracy": 0.22601666748523713, "num_tokens": 85168709.0, "step": 38145 }, { "entropy": 5.251294994354248, "epoch": 4.284607176952884, "grad_norm": 0.9765625, "learning_rate": 0.0003295821783698192, "loss": 4.8275, "mean_token_accuracy": 0.22873933613300323, "num_tokens": 85179877.0, "step": 38150 }, { "entropy": 5.258625221252442, "epoch": 4.285168753860841, "grad_norm": 1.0546875, "learning_rate": 0.00032954322804274995, "loss": 4.7865, "mean_token_accuracy": 0.23179203569889067, "num_tokens": 85190425.0, "step": 38155 }, { "entropy": 5.355438947677612, "epoch": 4.285730330768799, "grad_norm": 1.0, "learning_rate": 0.00032950427597900315, "loss": 4.9428, "mean_token_accuracy": 0.22153533846139908, "num_tokens": 85201576.0, "step": 38160 }, { "entropy": 5.293887948989868, "epoch": 4.286291907676756, "grad_norm": 0.890625, "learning_rate": 0.000329465322179819, "loss": 4.8474, "mean_token_accuracy": 0.22807974815368653, "num_tokens": 85212774.0, "step": 38165 }, { "entropy": 5.375597858428955, "epoch": 4.2868534845847135, "grad_norm": 0.98828125, "learning_rate": 0.00032942636664643794, "loss": 4.8647, "mean_token_accuracy": 0.22572794556617737, "num_tokens": 85224173.0, "step": 38170 }, { "entropy": 5.36904091835022, "epoch": 4.287415061492672, "grad_norm": 0.9921875, "learning_rate": 0.00032938740938010024, "loss": 4.9676, "mean_token_accuracy": 0.2203699216246605, "num_tokens": 85234932.0, "step": 38175 }, { "entropy": 5.3150303840637205, "epoch": 4.287976638400629, "grad_norm": 0.9765625, "learning_rate": 0.0003293484503820463, "loss": 4.929, "mean_token_accuracy": 0.22609545290470123, "num_tokens": 85245108.0, "step": 38180 }, { "entropy": 5.379029655456543, "epoch": 4.288538215308587, "grad_norm": 1.0234375, "learning_rate": 0.00032930948965351664, "loss": 4.9607, "mean_token_accuracy": 0.22703996747732164, "num_tokens": 85255782.0, "step": 38185 }, { "entropy": 5.31162166595459, "epoch": 4.289099792216544, "grad_norm": 1.0, "learning_rate": 0.0003292705271957518, "loss": 4.823, "mean_token_accuracy": 0.22953373640775682, "num_tokens": 85266938.0, "step": 38190 }, { "entropy": 5.243238162994385, "epoch": 4.289661369124501, "grad_norm": 0.953125, "learning_rate": 0.00032923156300999223, "loss": 4.8131, "mean_token_accuracy": 0.22831854224205017, "num_tokens": 85278754.0, "step": 38195 }, { "entropy": 5.344998168945312, "epoch": 4.2902229460324595, "grad_norm": 0.98828125, "learning_rate": 0.00032919259709747874, "loss": 4.9305, "mean_token_accuracy": 0.23119351267814636, "num_tokens": 85290255.0, "step": 38200 }, { "entropy": 5.314303541183472, "epoch": 4.290784522940417, "grad_norm": 0.93359375, "learning_rate": 0.00032915362945945195, "loss": 4.9089, "mean_token_accuracy": 0.2188740476965904, "num_tokens": 85301390.0, "step": 38205 }, { "entropy": 5.329101467132569, "epoch": 4.291346099848374, "grad_norm": 1.0, "learning_rate": 0.00032911466009715254, "loss": 4.9243, "mean_token_accuracy": 0.2261006638407707, "num_tokens": 85311215.0, "step": 38210 }, { "entropy": 5.38068699836731, "epoch": 4.291907676756332, "grad_norm": 0.9609375, "learning_rate": 0.00032907568901182136, "loss": 4.9008, "mean_token_accuracy": 0.22413080781698227, "num_tokens": 85321212.0, "step": 38215 }, { "entropy": 5.426188373565674, "epoch": 4.292469253664289, "grad_norm": 1.109375, "learning_rate": 0.0003290367162046993, "loss": 5.01, "mean_token_accuracy": 0.2195660650730133, "num_tokens": 85331550.0, "step": 38220 }, { "entropy": 5.356154298782348, "epoch": 4.293030830572247, "grad_norm": 1.0234375, "learning_rate": 0.00032899774167702723, "loss": 4.8743, "mean_token_accuracy": 0.23053240925073623, "num_tokens": 85342659.0, "step": 38225 }, { "entropy": 5.262993383407593, "epoch": 4.2935924074802045, "grad_norm": 0.9453125, "learning_rate": 0.0003289587654300461, "loss": 4.8188, "mean_token_accuracy": 0.2320706367492676, "num_tokens": 85353298.0, "step": 38230 }, { "entropy": 5.295417833328247, "epoch": 4.294153984388162, "grad_norm": 0.890625, "learning_rate": 0.000328919787464997, "loss": 4.9543, "mean_token_accuracy": 0.22089200913906099, "num_tokens": 85365274.0, "step": 38235 }, { "entropy": 5.456685018539429, "epoch": 4.29471556129612, "grad_norm": 0.94140625, "learning_rate": 0.000328880807783121, "loss": 5.0368, "mean_token_accuracy": 0.22182445079088212, "num_tokens": 85376572.0, "step": 38240 }, { "entropy": 5.357493925094604, "epoch": 4.295277138204077, "grad_norm": 0.95703125, "learning_rate": 0.00032884182638565914, "loss": 4.9859, "mean_token_accuracy": 0.2247361034154892, "num_tokens": 85387940.0, "step": 38245 }, { "entropy": 5.313954496383667, "epoch": 4.295838715112034, "grad_norm": 1.0234375, "learning_rate": 0.00032880284327385255, "loss": 4.8387, "mean_token_accuracy": 0.22735899984836577, "num_tokens": 85398048.0, "step": 38250 }, { "entropy": 5.31037278175354, "epoch": 4.296400292019992, "grad_norm": 0.9921875, "learning_rate": 0.0003287638584489426, "loss": 4.8663, "mean_token_accuracy": 0.2277154356241226, "num_tokens": 85409535.0, "step": 38255 }, { "entropy": 5.201943397521973, "epoch": 4.29696186892795, "grad_norm": 0.9296875, "learning_rate": 0.0003287248719121706, "loss": 4.8284, "mean_token_accuracy": 0.22540998607873916, "num_tokens": 85420720.0, "step": 38260 }, { "entropy": 5.368556022644043, "epoch": 4.297523445835907, "grad_norm": 1.1484375, "learning_rate": 0.00032868588366477785, "loss": 4.9514, "mean_token_accuracy": 0.22406894117593765, "num_tokens": 85429943.0, "step": 38265 }, { "entropy": 5.365045738220215, "epoch": 4.298085022743865, "grad_norm": 1.0234375, "learning_rate": 0.00032864689370800564, "loss": 4.9272, "mean_token_accuracy": 0.22918977290391923, "num_tokens": 85441168.0, "step": 38270 }, { "entropy": 5.392923784255982, "epoch": 4.298646599651822, "grad_norm": 1.03125, "learning_rate": 0.0003286079020430957, "loss": 4.9035, "mean_token_accuracy": 0.22708001881837844, "num_tokens": 85452532.0, "step": 38275 }, { "entropy": 5.371421146392822, "epoch": 4.29920817655978, "grad_norm": 0.96875, "learning_rate": 0.00032856890867128926, "loss": 5.0379, "mean_token_accuracy": 0.223794025182724, "num_tokens": 85466187.0, "step": 38280 }, { "entropy": 5.297076034545898, "epoch": 4.2997697534677375, "grad_norm": 0.91015625, "learning_rate": 0.0003285299135938279, "loss": 4.8967, "mean_token_accuracy": 0.22821110486984253, "num_tokens": 85476950.0, "step": 38285 }, { "entropy": 5.339099884033203, "epoch": 4.300331330375695, "grad_norm": 1.03125, "learning_rate": 0.00032849091681195347, "loss": 4.9615, "mean_token_accuracy": 0.21935181468725204, "num_tokens": 85488184.0, "step": 38290 }, { "entropy": 5.340803527832032, "epoch": 4.300892907283653, "grad_norm": 1.0078125, "learning_rate": 0.00032845191832690747, "loss": 4.8938, "mean_token_accuracy": 0.2251333475112915, "num_tokens": 85498662.0, "step": 38295 }, { "entropy": 5.342109251022339, "epoch": 4.30145448419161, "grad_norm": 0.98828125, "learning_rate": 0.0003284129181399317, "loss": 4.9009, "mean_token_accuracy": 0.22376884818077086, "num_tokens": 85509454.0, "step": 38300 }, { "entropy": 5.405104446411133, "epoch": 4.302016061099567, "grad_norm": 1.0859375, "learning_rate": 0.0003283739162522678, "loss": 4.979, "mean_token_accuracy": 0.22526478618383408, "num_tokens": 85520087.0, "step": 38305 }, { "entropy": 5.285982704162597, "epoch": 4.302577638007525, "grad_norm": 1.0703125, "learning_rate": 0.0003283349126651578, "loss": 4.8777, "mean_token_accuracy": 0.23185890316963195, "num_tokens": 85532765.0, "step": 38310 }, { "entropy": 5.458770895004273, "epoch": 4.303139214915483, "grad_norm": 0.984375, "learning_rate": 0.00032829590737984345, "loss": 4.9551, "mean_token_accuracy": 0.21847278624773026, "num_tokens": 85543863.0, "step": 38315 }, { "entropy": 5.362820100784302, "epoch": 4.30370079182344, "grad_norm": 1.0, "learning_rate": 0.00032825690039756675, "loss": 4.913, "mean_token_accuracy": 0.22915297746658325, "num_tokens": 85554602.0, "step": 38320 }, { "entropy": 5.337579298019409, "epoch": 4.304262368731398, "grad_norm": 0.96484375, "learning_rate": 0.00032821789171956966, "loss": 4.8923, "mean_token_accuracy": 0.22213827073574066, "num_tokens": 85566267.0, "step": 38325 }, { "entropy": 5.378640842437744, "epoch": 4.304823945639355, "grad_norm": 0.87109375, "learning_rate": 0.0003281788813470943, "loss": 4.987, "mean_token_accuracy": 0.2185271292924881, "num_tokens": 85579042.0, "step": 38330 }, { "entropy": 5.349207019805908, "epoch": 4.305385522547313, "grad_norm": 0.9765625, "learning_rate": 0.0003281398692813827, "loss": 4.9391, "mean_token_accuracy": 0.226966056227684, "num_tokens": 85590006.0, "step": 38335 }, { "entropy": 5.373880529403687, "epoch": 4.30594709945527, "grad_norm": 1.0078125, "learning_rate": 0.000328100855523677, "loss": 4.9322, "mean_token_accuracy": 0.2280791461467743, "num_tokens": 85600488.0, "step": 38340 }, { "entropy": 5.287370300292968, "epoch": 4.306508676363228, "grad_norm": 1.0546875, "learning_rate": 0.00032806184007521955, "loss": 4.8451, "mean_token_accuracy": 0.2275533676147461, "num_tokens": 85613593.0, "step": 38345 }, { "entropy": 5.285519361495972, "epoch": 4.307070253271186, "grad_norm": 0.96484375, "learning_rate": 0.0003280228229372525, "loss": 4.8372, "mean_token_accuracy": 0.23303708881139756, "num_tokens": 85623762.0, "step": 38350 }, { "entropy": 5.319044160842895, "epoch": 4.307631830179143, "grad_norm": 0.9296875, "learning_rate": 0.0003279838041110182, "loss": 4.9245, "mean_token_accuracy": 0.225668865442276, "num_tokens": 85634747.0, "step": 38355 }, { "entropy": 5.325010538101196, "epoch": 4.3081934070871, "grad_norm": 0.9921875, "learning_rate": 0.00032794478359775904, "loss": 4.8402, "mean_token_accuracy": 0.2271244764328003, "num_tokens": 85645268.0, "step": 38360 }, { "entropy": 5.338386821746826, "epoch": 4.308754983995058, "grad_norm": 0.99609375, "learning_rate": 0.00032790576139871743, "loss": 4.9521, "mean_token_accuracy": 0.21890937387943268, "num_tokens": 85656839.0, "step": 38365 }, { "entropy": 5.292079257965088, "epoch": 4.3093165609030155, "grad_norm": 0.9609375, "learning_rate": 0.0003278667375151359, "loss": 4.8487, "mean_token_accuracy": 0.23182503283023834, "num_tokens": 85667123.0, "step": 38370 }, { "entropy": 5.35593843460083, "epoch": 4.309878137810974, "grad_norm": 1.0625, "learning_rate": 0.00032782771194825685, "loss": 4.9693, "mean_token_accuracy": 0.21988319009542465, "num_tokens": 85679312.0, "step": 38375 }, { "entropy": 5.261866188049316, "epoch": 4.310439714718931, "grad_norm": 0.97265625, "learning_rate": 0.00032778868469932304, "loss": 4.8432, "mean_token_accuracy": 0.22844273298978807, "num_tokens": 85689756.0, "step": 38380 }, { "entropy": 5.446440505981445, "epoch": 4.311001291626888, "grad_norm": 1.0078125, "learning_rate": 0.00032774965576957705, "loss": 5.0655, "mean_token_accuracy": 0.21857472360134125, "num_tokens": 85701541.0, "step": 38385 }, { "entropy": 5.348806381225586, "epoch": 4.311562868534846, "grad_norm": 1.015625, "learning_rate": 0.0003277106251602615, "loss": 5.0046, "mean_token_accuracy": 0.22378917634487153, "num_tokens": 85712902.0, "step": 38390 }, { "entropy": 5.351965475082397, "epoch": 4.312124445442803, "grad_norm": 0.97265625, "learning_rate": 0.00032767159287261914, "loss": 4.8883, "mean_token_accuracy": 0.22622557878494262, "num_tokens": 85724226.0, "step": 38395 }, { "entropy": 5.299744081497193, "epoch": 4.312686022350761, "grad_norm": 0.984375, "learning_rate": 0.000327632558907893, "loss": 4.9084, "mean_token_accuracy": 0.22080124616622926, "num_tokens": 85734810.0, "step": 38400 }, { "entropy": 5.313776111602783, "epoch": 4.313247599258719, "grad_norm": 1.0, "learning_rate": 0.00032759352326732573, "loss": 4.9234, "mean_token_accuracy": 0.22348308712244033, "num_tokens": 85745548.0, "step": 38405 }, { "entropy": 5.394666290283203, "epoch": 4.313809176166676, "grad_norm": 0.97265625, "learning_rate": 0.00032755448595216027, "loss": 4.9758, "mean_token_accuracy": 0.22308102548122405, "num_tokens": 85757803.0, "step": 38410 }, { "entropy": 5.35051908493042, "epoch": 4.314370753074634, "grad_norm": 0.83984375, "learning_rate": 0.00032751544696363945, "loss": 4.914, "mean_token_accuracy": 0.2257615104317665, "num_tokens": 85770252.0, "step": 38415 }, { "entropy": 5.396606349945069, "epoch": 4.314932329982591, "grad_norm": 0.953125, "learning_rate": 0.00032747640630300664, "loss": 4.9436, "mean_token_accuracy": 0.21962882578372955, "num_tokens": 85782605.0, "step": 38420 }, { "entropy": 5.310629987716675, "epoch": 4.3154939068905485, "grad_norm": 1.0, "learning_rate": 0.00032743736397150455, "loss": 4.9005, "mean_token_accuracy": 0.2299838036298752, "num_tokens": 85792921.0, "step": 38425 }, { "entropy": 5.344047737121582, "epoch": 4.316055483798507, "grad_norm": 1.0703125, "learning_rate": 0.0003273983199703765, "loss": 4.8505, "mean_token_accuracy": 0.22579520493745803, "num_tokens": 85804364.0, "step": 38430 }, { "entropy": 5.364271926879883, "epoch": 4.316617060706464, "grad_norm": 1.0546875, "learning_rate": 0.0003273592743008656, "loss": 5.0011, "mean_token_accuracy": 0.22640925794839858, "num_tokens": 85815299.0, "step": 38435 }, { "entropy": 5.34661602973938, "epoch": 4.317178637614421, "grad_norm": 0.9609375, "learning_rate": 0.00032732022696421514, "loss": 4.9555, "mean_token_accuracy": 0.22503656446933745, "num_tokens": 85828273.0, "step": 38440 }, { "entropy": 5.315956878662109, "epoch": 4.317740214522379, "grad_norm": 1.0390625, "learning_rate": 0.0003272811779616684, "loss": 4.8816, "mean_token_accuracy": 0.22146780639886857, "num_tokens": 85837813.0, "step": 38445 }, { "entropy": 5.298606586456299, "epoch": 4.318301791430336, "grad_norm": 1.0, "learning_rate": 0.00032724212729446864, "loss": 4.8819, "mean_token_accuracy": 0.22222209423780442, "num_tokens": 85849585.0, "step": 38450 }, { "entropy": 5.249256896972656, "epoch": 4.3188633683382935, "grad_norm": 1.078125, "learning_rate": 0.0003272030749638593, "loss": 4.7754, "mean_token_accuracy": 0.23343920558691025, "num_tokens": 85861519.0, "step": 38455 }, { "entropy": 5.3257821559906, "epoch": 4.319424945246252, "grad_norm": 0.92578125, "learning_rate": 0.0003271640209710837, "loss": 4.8601, "mean_token_accuracy": 0.23442934155464173, "num_tokens": 85871936.0, "step": 38460 }, { "entropy": 5.329644632339478, "epoch": 4.319986522154209, "grad_norm": 1.0703125, "learning_rate": 0.0003271249653173855, "loss": 4.8983, "mean_token_accuracy": 0.22641059756278992, "num_tokens": 85883433.0, "step": 38465 }, { "entropy": 5.324489879608154, "epoch": 4.320548099062167, "grad_norm": 0.953125, "learning_rate": 0.00032708590800400826, "loss": 4.8768, "mean_token_accuracy": 0.22415879219770432, "num_tokens": 85894852.0, "step": 38470 }, { "entropy": 5.356907320022583, "epoch": 4.321109675970124, "grad_norm": 0.98828125, "learning_rate": 0.0003270468490321955, "loss": 4.8912, "mean_token_accuracy": 0.23001666069030763, "num_tokens": 85905619.0, "step": 38475 }, { "entropy": 5.365391063690185, "epoch": 4.321671252878081, "grad_norm": 0.98828125, "learning_rate": 0.00032700778840319086, "loss": 4.9107, "mean_token_accuracy": 0.2249777540564537, "num_tokens": 85916064.0, "step": 38480 }, { "entropy": 5.343345308303833, "epoch": 4.3222328297860395, "grad_norm": 0.96484375, "learning_rate": 0.000326968726118238, "loss": 4.9215, "mean_token_accuracy": 0.22919786870479583, "num_tokens": 85927557.0, "step": 38485 }, { "entropy": 5.362963438034058, "epoch": 4.322794406693997, "grad_norm": 1.0390625, "learning_rate": 0.00032692966217858074, "loss": 4.88, "mean_token_accuracy": 0.23261410295963286, "num_tokens": 85937628.0, "step": 38490 }, { "entropy": 5.235645294189453, "epoch": 4.323355983601954, "grad_norm": 1.0078125, "learning_rate": 0.0003268905965854629, "loss": 4.8157, "mean_token_accuracy": 0.23260591626167298, "num_tokens": 85949221.0, "step": 38495 }, { "entropy": 5.356785869598388, "epoch": 4.323917560509912, "grad_norm": 0.9375, "learning_rate": 0.00032685152934012844, "loss": 4.923, "mean_token_accuracy": 0.22142242640256882, "num_tokens": 85960121.0, "step": 38500 }, { "entropy": 5.382949495315552, "epoch": 4.324479137417869, "grad_norm": 1.0234375, "learning_rate": 0.0003268124604438211, "loss": 4.9679, "mean_token_accuracy": 0.21975530087947845, "num_tokens": 85971184.0, "step": 38505 }, { "entropy": 5.319850873947144, "epoch": 4.3250407143258265, "grad_norm": 0.97265625, "learning_rate": 0.00032677338989778494, "loss": 4.8172, "mean_token_accuracy": 0.23732099384069444, "num_tokens": 85981324.0, "step": 38510 }, { "entropy": 5.278362464904785, "epoch": 4.325602291233785, "grad_norm": 0.9375, "learning_rate": 0.000326734317703264, "loss": 4.817, "mean_token_accuracy": 0.23807937502861024, "num_tokens": 85993723.0, "step": 38515 }, { "entropy": 5.271831226348877, "epoch": 4.326163868141742, "grad_norm": 1.0, "learning_rate": 0.0003266952438615023, "loss": 4.8248, "mean_token_accuracy": 0.22694857865571977, "num_tokens": 86004031.0, "step": 38520 }, { "entropy": 5.388541412353516, "epoch": 4.3267254450497, "grad_norm": 1.0234375, "learning_rate": 0.00032665616837374397, "loss": 5.0351, "mean_token_accuracy": 0.21934666037559508, "num_tokens": 86017161.0, "step": 38525 }, { "entropy": 5.316774177551269, "epoch": 4.327287021957657, "grad_norm": 1.0859375, "learning_rate": 0.0003266170912412332, "loss": 4.8416, "mean_token_accuracy": 0.2249375343322754, "num_tokens": 86028369.0, "step": 38530 }, { "entropy": 5.3042213916778564, "epoch": 4.327848598865614, "grad_norm": 0.9921875, "learning_rate": 0.0003265780124652143, "loss": 4.8529, "mean_token_accuracy": 0.23284194767475128, "num_tokens": 86039709.0, "step": 38535 }, { "entropy": 5.249087762832642, "epoch": 4.3284101757735725, "grad_norm": 1.015625, "learning_rate": 0.00032653893204693136, "loss": 4.8095, "mean_token_accuracy": 0.24151951670646668, "num_tokens": 86050513.0, "step": 38540 }, { "entropy": 5.35543155670166, "epoch": 4.32897175268153, "grad_norm": 1.1015625, "learning_rate": 0.0003264998499876289, "loss": 4.9456, "mean_token_accuracy": 0.22561756521463394, "num_tokens": 86062519.0, "step": 38545 }, { "entropy": 5.450119304656982, "epoch": 4.329533329589487, "grad_norm": 0.97265625, "learning_rate": 0.0003264607662885512, "loss": 5.0526, "mean_token_accuracy": 0.2150881379842758, "num_tokens": 86073894.0, "step": 38550 }, { "entropy": 5.380965662002564, "epoch": 4.330094906497445, "grad_norm": 0.9453125, "learning_rate": 0.00032642168095094274, "loss": 4.9571, "mean_token_accuracy": 0.21729159653186797, "num_tokens": 86084887.0, "step": 38555 }, { "entropy": 5.381901454925537, "epoch": 4.330656483405402, "grad_norm": 0.98828125, "learning_rate": 0.0003263825939760481, "loss": 4.9641, "mean_token_accuracy": 0.22444397509098052, "num_tokens": 86094637.0, "step": 38560 }, { "entropy": 5.293575143814087, "epoch": 4.33121806031336, "grad_norm": 1.0, "learning_rate": 0.00032634350536511167, "loss": 4.8045, "mean_token_accuracy": 0.2303754836320877, "num_tokens": 86105044.0, "step": 38565 }, { "entropy": 5.354091835021973, "epoch": 4.3317796372213175, "grad_norm": 1.1328125, "learning_rate": 0.00032630441511937813, "loss": 4.9444, "mean_token_accuracy": 0.22287405729293824, "num_tokens": 86116481.0, "step": 38570 }, { "entropy": 5.245355463027954, "epoch": 4.332341214129275, "grad_norm": 0.9921875, "learning_rate": 0.00032626532324009204, "loss": 4.7903, "mean_token_accuracy": 0.2403682827949524, "num_tokens": 86126906.0, "step": 38575 }, { "entropy": 5.3704053401947025, "epoch": 4.332902791037233, "grad_norm": 1.0546875, "learning_rate": 0.0003262262297284983, "loss": 5.0319, "mean_token_accuracy": 0.21583458930253982, "num_tokens": 86137899.0, "step": 38580 }, { "entropy": 5.449641227722168, "epoch": 4.33346436794519, "grad_norm": 0.9140625, "learning_rate": 0.00032618713458584147, "loss": 4.97, "mean_token_accuracy": 0.22467987686395646, "num_tokens": 86149283.0, "step": 38585 }, { "entropy": 5.285018587112427, "epoch": 4.334025944853147, "grad_norm": 0.9453125, "learning_rate": 0.0003261480378133665, "loss": 4.7993, "mean_token_accuracy": 0.24144284278154374, "num_tokens": 86160239.0, "step": 38590 }, { "entropy": 5.301095247268677, "epoch": 4.334587521761105, "grad_norm": 0.984375, "learning_rate": 0.0003261089394123181, "loss": 4.9776, "mean_token_accuracy": 0.22062250971794128, "num_tokens": 86171924.0, "step": 38595 }, { "entropy": 5.373297262191772, "epoch": 4.335149098669063, "grad_norm": 1.0859375, "learning_rate": 0.0003260698393839413, "loss": 4.873, "mean_token_accuracy": 0.22364883422851561, "num_tokens": 86182556.0, "step": 38600 }, { "entropy": 5.352274608612061, "epoch": 4.335710675577021, "grad_norm": 0.92578125, "learning_rate": 0.00032603073772948096, "loss": 4.9045, "mean_token_accuracy": 0.22735241204500198, "num_tokens": 86193500.0, "step": 38605 }, { "entropy": 5.234258651733398, "epoch": 4.336272252484978, "grad_norm": 1.0234375, "learning_rate": 0.00032599163445018204, "loss": 4.8238, "mean_token_accuracy": 0.226099456846714, "num_tokens": 86205530.0, "step": 38610 }, { "entropy": 5.373866033554077, "epoch": 4.336833829392935, "grad_norm": 0.9453125, "learning_rate": 0.0003259525295472899, "loss": 4.9424, "mean_token_accuracy": 0.21896052211523057, "num_tokens": 86215538.0, "step": 38615 }, { "entropy": 5.313181447982788, "epoch": 4.337395406300893, "grad_norm": 0.94921875, "learning_rate": 0.00032591342302204935, "loss": 4.796, "mean_token_accuracy": 0.22869570702314376, "num_tokens": 86226681.0, "step": 38620 }, { "entropy": 5.334412908554077, "epoch": 4.3379569832088505, "grad_norm": 0.9921875, "learning_rate": 0.0003258743148757057, "loss": 4.8621, "mean_token_accuracy": 0.2180955156683922, "num_tokens": 86237629.0, "step": 38625 }, { "entropy": 5.36294903755188, "epoch": 4.338518560116808, "grad_norm": 0.97265625, "learning_rate": 0.00032583520510950405, "loss": 4.9879, "mean_token_accuracy": 0.21798202395439148, "num_tokens": 86248466.0, "step": 38630 }, { "entropy": 5.329041624069214, "epoch": 4.339080137024766, "grad_norm": 0.9375, "learning_rate": 0.00032579609372468984, "loss": 4.9528, "mean_token_accuracy": 0.21855527460575103, "num_tokens": 86259845.0, "step": 38635 }, { "entropy": 5.436394119262696, "epoch": 4.339641713932723, "grad_norm": 1.03125, "learning_rate": 0.00032575698072250827, "loss": 4.9686, "mean_token_accuracy": 0.22842836380004883, "num_tokens": 86269807.0, "step": 38640 }, { "entropy": 5.3634124279022215, "epoch": 4.34020329084068, "grad_norm": 0.9765625, "learning_rate": 0.0003257178661042047, "loss": 4.8706, "mean_token_accuracy": 0.22558883130550383, "num_tokens": 86280095.0, "step": 38645 }, { "entropy": 5.27594780921936, "epoch": 4.340764867748638, "grad_norm": 0.97265625, "learning_rate": 0.00032567874987102463, "loss": 4.8501, "mean_token_accuracy": 0.23466363400220872, "num_tokens": 86291842.0, "step": 38650 }, { "entropy": 5.446324586868286, "epoch": 4.341326444656596, "grad_norm": 0.99609375, "learning_rate": 0.0003256396320242136, "loss": 5.0286, "mean_token_accuracy": 0.21563541144132614, "num_tokens": 86303080.0, "step": 38655 }, { "entropy": 5.3795067310333256, "epoch": 4.341888021564554, "grad_norm": 0.890625, "learning_rate": 0.000325600512565017, "loss": 4.8889, "mean_token_accuracy": 0.22431754171848298, "num_tokens": 86315378.0, "step": 38660 }, { "entropy": 5.384488582611084, "epoch": 4.342449598472511, "grad_norm": 0.92578125, "learning_rate": 0.00032556139149468046, "loss": 4.9567, "mean_token_accuracy": 0.2233425959944725, "num_tokens": 86327823.0, "step": 38665 }, { "entropy": 5.325388097763062, "epoch": 4.343011175380468, "grad_norm": 0.9921875, "learning_rate": 0.00032552226881444956, "loss": 4.9154, "mean_token_accuracy": 0.22577030211687088, "num_tokens": 86338312.0, "step": 38670 }, { "entropy": 5.270217323303223, "epoch": 4.343572752288426, "grad_norm": 0.95703125, "learning_rate": 0.00032548314452557006, "loss": 4.7724, "mean_token_accuracy": 0.23336310982704161, "num_tokens": 86348157.0, "step": 38675 }, { "entropy": 5.217327451705932, "epoch": 4.344134329196383, "grad_norm": 0.9453125, "learning_rate": 0.00032544401862928766, "loss": 4.815, "mean_token_accuracy": 0.2329142302274704, "num_tokens": 86359131.0, "step": 38680 }, { "entropy": 5.314981603622437, "epoch": 4.344695906104341, "grad_norm": 0.97265625, "learning_rate": 0.00032540489112684804, "loss": 4.8607, "mean_token_accuracy": 0.22776159197092055, "num_tokens": 86370953.0, "step": 38685 }, { "entropy": 5.307064533233643, "epoch": 4.345257483012299, "grad_norm": 0.953125, "learning_rate": 0.00032536576201949724, "loss": 4.8274, "mean_token_accuracy": 0.23355590105056762, "num_tokens": 86382445.0, "step": 38690 }, { "entropy": 5.311904764175415, "epoch": 4.345819059920256, "grad_norm": 1.078125, "learning_rate": 0.0003253266313084811, "loss": 4.9277, "mean_token_accuracy": 0.22423868626356125, "num_tokens": 86393177.0, "step": 38695 }, { "entropy": 5.2942300796508786, "epoch": 4.346380636828213, "grad_norm": 1.1484375, "learning_rate": 0.0003252874989950454, "loss": 4.8718, "mean_token_accuracy": 0.23282826095819473, "num_tokens": 86405535.0, "step": 38700 }, { "entropy": 5.246093606948852, "epoch": 4.346942213736171, "grad_norm": 1.015625, "learning_rate": 0.00032524836508043625, "loss": 4.8021, "mean_token_accuracy": 0.23416534662246705, "num_tokens": 86415980.0, "step": 38705 }, { "entropy": 5.332367563247681, "epoch": 4.3475037906441285, "grad_norm": 1.046875, "learning_rate": 0.00032520922956589973, "loss": 4.9469, "mean_token_accuracy": 0.23253892362117767, "num_tokens": 86427590.0, "step": 38710 }, { "entropy": 5.364048814773559, "epoch": 4.348065367552087, "grad_norm": 0.984375, "learning_rate": 0.00032517009245268175, "loss": 4.9327, "mean_token_accuracy": 0.2234596401453018, "num_tokens": 86438358.0, "step": 38715 }, { "entropy": 5.268425416946411, "epoch": 4.348626944460044, "grad_norm": 0.99609375, "learning_rate": 0.00032513095374202863, "loss": 4.7884, "mean_token_accuracy": 0.23703001588582992, "num_tokens": 86448894.0, "step": 38720 }, { "entropy": 5.283785200119018, "epoch": 4.349188521368001, "grad_norm": 1.0, "learning_rate": 0.00032509181343518646, "loss": 4.9069, "mean_token_accuracy": 0.23675814867019654, "num_tokens": 86461617.0, "step": 38725 }, { "entropy": 5.362652397155761, "epoch": 4.349750098275959, "grad_norm": 0.94921875, "learning_rate": 0.00032505267153340163, "loss": 4.9612, "mean_token_accuracy": 0.22062282115221024, "num_tokens": 86473534.0, "step": 38730 }, { "entropy": 5.397263050079346, "epoch": 4.350311675183916, "grad_norm": 0.98046875, "learning_rate": 0.0003250135280379202, "loss": 5.0018, "mean_token_accuracy": 0.22024556398391723, "num_tokens": 86486561.0, "step": 38735 }, { "entropy": 5.285743856430054, "epoch": 4.350873252091874, "grad_norm": 1.0234375, "learning_rate": 0.0003249743829499888, "loss": 4.8559, "mean_token_accuracy": 0.2369164079427719, "num_tokens": 86499368.0, "step": 38740 }, { "entropy": 5.239845895767212, "epoch": 4.351434828999832, "grad_norm": 1.0234375, "learning_rate": 0.0003249352362708535, "loss": 4.8599, "mean_token_accuracy": 0.2328908398747444, "num_tokens": 86509798.0, "step": 38745 }, { "entropy": 5.374415063858033, "epoch": 4.351996405907789, "grad_norm": 0.94921875, "learning_rate": 0.000324896088001761, "loss": 4.9053, "mean_token_accuracy": 0.22346590906381608, "num_tokens": 86521372.0, "step": 38750 }, { "entropy": 5.385874605178833, "epoch": 4.352557982815747, "grad_norm": 1.1484375, "learning_rate": 0.0003248569381439577, "loss": 4.9718, "mean_token_accuracy": 0.2161380797624588, "num_tokens": 86531889.0, "step": 38755 }, { "entropy": 5.2649860858917235, "epoch": 4.353119559723704, "grad_norm": 0.94921875, "learning_rate": 0.0003248177866986901, "loss": 4.8059, "mean_token_accuracy": 0.22731684595346452, "num_tokens": 86543456.0, "step": 38760 }, { "entropy": 5.2793745517730715, "epoch": 4.3536811366316615, "grad_norm": 0.984375, "learning_rate": 0.0003247786336672049, "loss": 4.845, "mean_token_accuracy": 0.2290216490626335, "num_tokens": 86554681.0, "step": 38765 }, { "entropy": 5.364985656738281, "epoch": 4.35424271353962, "grad_norm": 0.93359375, "learning_rate": 0.00032473947905074866, "loss": 4.9519, "mean_token_accuracy": 0.22968198210000992, "num_tokens": 86567050.0, "step": 38770 }, { "entropy": 5.333202981948853, "epoch": 4.354804290447577, "grad_norm": 0.84765625, "learning_rate": 0.00032470032285056814, "loss": 4.852, "mean_token_accuracy": 0.23345038443803787, "num_tokens": 86580172.0, "step": 38775 }, { "entropy": 5.363266468048096, "epoch": 4.355365867355534, "grad_norm": 1.015625, "learning_rate": 0.00032466116506791004, "loss": 4.9378, "mean_token_accuracy": 0.22590737789869308, "num_tokens": 86592389.0, "step": 38780 }, { "entropy": 5.281791830062867, "epoch": 4.355927444263492, "grad_norm": 0.90234375, "learning_rate": 0.00032462200570402124, "loss": 4.8655, "mean_token_accuracy": 0.2263782188296318, "num_tokens": 86603668.0, "step": 38785 }, { "entropy": 5.308871221542359, "epoch": 4.356489021171449, "grad_norm": 0.9921875, "learning_rate": 0.0003245828447601484, "loss": 4.8761, "mean_token_accuracy": 0.22213534116744996, "num_tokens": 86614032.0, "step": 38790 }, { "entropy": 5.35528793334961, "epoch": 4.357050598079407, "grad_norm": 1.0625, "learning_rate": 0.0003245436822375387, "loss": 4.906, "mean_token_accuracy": 0.23005196452140808, "num_tokens": 86624559.0, "step": 38795 }, { "entropy": 5.293209838867187, "epoch": 4.357612174987365, "grad_norm": 1.0078125, "learning_rate": 0.0003245045181374389, "loss": 4.8239, "mean_token_accuracy": 0.22908556014299392, "num_tokens": 86635557.0, "step": 38800 }, { "entropy": 5.340503120422364, "epoch": 4.358173751895322, "grad_norm": 0.92578125, "learning_rate": 0.000324465352461096, "loss": 4.9361, "mean_token_accuracy": 0.22909242063760757, "num_tokens": 86647055.0, "step": 38805 }, { "entropy": 5.3156288146972654, "epoch": 4.35873532880328, "grad_norm": 1.0390625, "learning_rate": 0.0003244261852097572, "loss": 4.8687, "mean_token_accuracy": 0.2345954433083534, "num_tokens": 86659079.0, "step": 38810 }, { "entropy": 5.323622417449951, "epoch": 4.359296905711237, "grad_norm": 0.96484375, "learning_rate": 0.00032438701638466943, "loss": 4.8844, "mean_token_accuracy": 0.2242441564798355, "num_tokens": 86670671.0, "step": 38815 }, { "entropy": 5.346674585342408, "epoch": 4.359858482619194, "grad_norm": 0.88671875, "learning_rate": 0.00032434784598707987, "loss": 4.9916, "mean_token_accuracy": 0.22346266210079194, "num_tokens": 86682299.0, "step": 38820 }, { "entropy": 5.353532695770264, "epoch": 4.3604200595271525, "grad_norm": 0.9921875, "learning_rate": 0.0003243086740182358, "loss": 4.8922, "mean_token_accuracy": 0.22214752584695815, "num_tokens": 86692319.0, "step": 38825 }, { "entropy": 5.28872447013855, "epoch": 4.36098163643511, "grad_norm": 1.0234375, "learning_rate": 0.00032426950047938436, "loss": 4.9114, "mean_token_accuracy": 0.22552026510238649, "num_tokens": 86702683.0, "step": 38830 }, { "entropy": 5.31775426864624, "epoch": 4.361543213343067, "grad_norm": 1.015625, "learning_rate": 0.000324230325371773, "loss": 4.8666, "mean_token_accuracy": 0.22883417457342148, "num_tokens": 86714135.0, "step": 38835 }, { "entropy": 5.259040594100952, "epoch": 4.362104790251025, "grad_norm": 0.96875, "learning_rate": 0.0003241911486966489, "loss": 4.803, "mean_token_accuracy": 0.2250555783510208, "num_tokens": 86725993.0, "step": 38840 }, { "entropy": 5.3532572269439695, "epoch": 4.362666367158982, "grad_norm": 1.15625, "learning_rate": 0.0003241519704552596, "loss": 4.9206, "mean_token_accuracy": 0.22259171009063722, "num_tokens": 86737049.0, "step": 38845 }, { "entropy": 5.31566162109375, "epoch": 4.36322794406694, "grad_norm": 1.015625, "learning_rate": 0.00032411279064885253, "loss": 4.8682, "mean_token_accuracy": 0.22582069039344788, "num_tokens": 86746550.0, "step": 38850 }, { "entropy": 5.208047389984131, "epoch": 4.363789520974898, "grad_norm": 0.9921875, "learning_rate": 0.00032407360927867506, "loss": 4.7872, "mean_token_accuracy": 0.22906892895698547, "num_tokens": 86756701.0, "step": 38855 }, { "entropy": 5.32708854675293, "epoch": 4.364351097882855, "grad_norm": 0.99609375, "learning_rate": 0.0003240344263459749, "loss": 4.8536, "mean_token_accuracy": 0.23313011825084687, "num_tokens": 86768667.0, "step": 38860 }, { "entropy": 5.3356125831604, "epoch": 4.364912674790813, "grad_norm": 1.125, "learning_rate": 0.00032399524185199957, "loss": 4.9185, "mean_token_accuracy": 0.2278653249144554, "num_tokens": 86779330.0, "step": 38865 }, { "entropy": 5.37472677230835, "epoch": 4.36547425169877, "grad_norm": 1.046875, "learning_rate": 0.00032395605579799673, "loss": 4.9438, "mean_token_accuracy": 0.22947632819414138, "num_tokens": 86790749.0, "step": 38870 }, { "entropy": 5.32660551071167, "epoch": 4.366035828606727, "grad_norm": 0.9765625, "learning_rate": 0.00032391686818521414, "loss": 4.8223, "mean_token_accuracy": 0.2295699506998062, "num_tokens": 86802275.0, "step": 38875 }, { "entropy": 5.306037425994873, "epoch": 4.3665974055146854, "grad_norm": 1.0390625, "learning_rate": 0.00032387767901489946, "loss": 4.9279, "mean_token_accuracy": 0.21835035532712938, "num_tokens": 86812965.0, "step": 38880 }, { "entropy": 5.351228904724121, "epoch": 4.367158982422643, "grad_norm": 0.9765625, "learning_rate": 0.00032383848828830054, "loss": 4.9546, "mean_token_accuracy": 0.23019843250513078, "num_tokens": 86823787.0, "step": 38885 }, { "entropy": 5.335306692123413, "epoch": 4.3677205593306, "grad_norm": 0.9765625, "learning_rate": 0.00032379929600666525, "loss": 4.944, "mean_token_accuracy": 0.22074999213218688, "num_tokens": 86835173.0, "step": 38890 }, { "entropy": 5.346673011779785, "epoch": 4.368282136238558, "grad_norm": 1.0546875, "learning_rate": 0.00032376010217124133, "loss": 4.8683, "mean_token_accuracy": 0.22981329560279845, "num_tokens": 86845080.0, "step": 38895 }, { "entropy": 5.379323053359985, "epoch": 4.368843713146515, "grad_norm": 1.0390625, "learning_rate": 0.00032372090678327694, "loss": 4.9328, "mean_token_accuracy": 0.22010405510663986, "num_tokens": 86857074.0, "step": 38900 }, { "entropy": 5.369425249099732, "epoch": 4.369405290054473, "grad_norm": 0.96484375, "learning_rate": 0.00032368170984401997, "loss": 4.9681, "mean_token_accuracy": 0.22165321558713913, "num_tokens": 86868050.0, "step": 38905 }, { "entropy": 5.278889417648315, "epoch": 4.3699668669624305, "grad_norm": 1.0078125, "learning_rate": 0.00032364251135471846, "loss": 4.8498, "mean_token_accuracy": 0.2303059458732605, "num_tokens": 86879259.0, "step": 38910 }, { "entropy": 5.301499557495117, "epoch": 4.370528443870388, "grad_norm": 0.953125, "learning_rate": 0.0003236033113166205, "loss": 4.9587, "mean_token_accuracy": 0.22018381357192993, "num_tokens": 86891659.0, "step": 38915 }, { "entropy": 5.320328855514527, "epoch": 4.371090020778346, "grad_norm": 0.91796875, "learning_rate": 0.00032356410973097423, "loss": 4.805, "mean_token_accuracy": 0.23199607580900192, "num_tokens": 86903633.0, "step": 38920 }, { "entropy": 5.297225475311279, "epoch": 4.371651597686303, "grad_norm": 1.0078125, "learning_rate": 0.00032352490659902795, "loss": 4.7927, "mean_token_accuracy": 0.2333680808544159, "num_tokens": 86915157.0, "step": 38925 }, { "entropy": 5.302822780609131, "epoch": 4.37221317459426, "grad_norm": 1.0390625, "learning_rate": 0.0003234857019220298, "loss": 4.8476, "mean_token_accuracy": 0.22782742977142334, "num_tokens": 86925970.0, "step": 38930 }, { "entropy": 5.281886625289917, "epoch": 4.372774751502218, "grad_norm": 1.0703125, "learning_rate": 0.000323446495701228, "loss": 4.8522, "mean_token_accuracy": 0.22982731014490126, "num_tokens": 86938440.0, "step": 38935 }, { "entropy": 5.407351446151734, "epoch": 4.373336328410176, "grad_norm": 1.015625, "learning_rate": 0.0003234072879378711, "loss": 4.9427, "mean_token_accuracy": 0.2316542774438858, "num_tokens": 86949864.0, "step": 38940 }, { "entropy": 5.262256717681884, "epoch": 4.373897905318134, "grad_norm": 0.98828125, "learning_rate": 0.0003233680786332074, "loss": 4.8309, "mean_token_accuracy": 0.22920748740434646, "num_tokens": 86961372.0, "step": 38945 }, { "entropy": 5.227307653427124, "epoch": 4.374459482226091, "grad_norm": 1.0078125, "learning_rate": 0.0003233288677884853, "loss": 4.781, "mean_token_accuracy": 0.23027345091104506, "num_tokens": 86970797.0, "step": 38950 }, { "entropy": 5.2705381393432615, "epoch": 4.375021059134048, "grad_norm": 0.91015625, "learning_rate": 0.0003232896554049533, "loss": 4.8003, "mean_token_accuracy": 0.23287141025066377, "num_tokens": 86983022.0, "step": 38955 }, { "entropy": 5.297507047653198, "epoch": 4.375582636042006, "grad_norm": 0.953125, "learning_rate": 0.00032325044148385986, "loss": 4.9118, "mean_token_accuracy": 0.22562686502933502, "num_tokens": 86993340.0, "step": 38960 }, { "entropy": 5.503663539886475, "epoch": 4.3761442129499635, "grad_norm": 1.0390625, "learning_rate": 0.00032321122602645374, "loss": 5.1175, "mean_token_accuracy": 0.21916889399290085, "num_tokens": 87004421.0, "step": 38965 }, { "entropy": 5.438340950012207, "epoch": 4.376705789857921, "grad_norm": 1.1171875, "learning_rate": 0.0003231720090339834, "loss": 4.9608, "mean_token_accuracy": 0.22032207250595093, "num_tokens": 87014775.0, "step": 38970 }, { "entropy": 5.3542396068573, "epoch": 4.377267366765879, "grad_norm": 0.96484375, "learning_rate": 0.00032313279050769767, "loss": 4.949, "mean_token_accuracy": 0.22529728561639786, "num_tokens": 87026107.0, "step": 38975 }, { "entropy": 5.333130741119385, "epoch": 4.377828943673836, "grad_norm": 1.0390625, "learning_rate": 0.0003230935704488452, "loss": 4.9344, "mean_token_accuracy": 0.21735664904117585, "num_tokens": 87036386.0, "step": 38980 }, { "entropy": 5.366417694091797, "epoch": 4.378390520581794, "grad_norm": 1.0859375, "learning_rate": 0.00032305434885867483, "loss": 4.8742, "mean_token_accuracy": 0.23247405588626863, "num_tokens": 87048134.0, "step": 38985 }, { "entropy": 5.347395038604736, "epoch": 4.378952097489751, "grad_norm": 0.984375, "learning_rate": 0.00032301512573843535, "loss": 4.997, "mean_token_accuracy": 0.22362251281738282, "num_tokens": 87059721.0, "step": 38990 }, { "entropy": 5.335381650924683, "epoch": 4.3795136743977086, "grad_norm": 0.9609375, "learning_rate": 0.0003229759010893756, "loss": 4.9198, "mean_token_accuracy": 0.22603311985731125, "num_tokens": 87071017.0, "step": 38995 }, { "entropy": 5.353639554977417, "epoch": 4.380075251305667, "grad_norm": 1.0234375, "learning_rate": 0.0003229366749127446, "loss": 4.8988, "mean_token_accuracy": 0.22565826177597045, "num_tokens": 87081537.0, "step": 39000 }, { "epoch": 4.380075251305667, "eval_entropy": 5.155762018479728, "eval_loss": 5.069939613342285, "eval_mean_token_accuracy": 0.22495746962881777, "eval_num_tokens": 87081537.0, "eval_runtime": 24.0751, "eval_samples_per_second": 1288.176, "eval_steps_per_second": 161.038, "step": 39000 }, { "entropy": 5.361503219604492, "epoch": 4.380636828213624, "grad_norm": 1.0546875, "learning_rate": 0.0003228974472097913, "loss": 4.8929, "mean_token_accuracy": 0.22871919870376586, "num_tokens": 87093056.0, "step": 39005 }, { "entropy": 5.347721767425537, "epoch": 4.381198405121581, "grad_norm": 1.03125, "learning_rate": 0.00032285821798176456, "loss": 4.9753, "mean_token_accuracy": 0.21977908313274383, "num_tokens": 87104582.0, "step": 39010 }, { "entropy": 5.3754418849945065, "epoch": 4.381759982029539, "grad_norm": 0.953125, "learning_rate": 0.00032281898722991376, "loss": 5.0244, "mean_token_accuracy": 0.21976435631513597, "num_tokens": 87116488.0, "step": 39015 }, { "entropy": 5.376815557479858, "epoch": 4.382321558937496, "grad_norm": 0.9921875, "learning_rate": 0.00032277975495548775, "loss": 4.9344, "mean_token_accuracy": 0.22003254890441895, "num_tokens": 87126760.0, "step": 39020 }, { "entropy": 5.426122760772705, "epoch": 4.382883135845454, "grad_norm": 0.98046875, "learning_rate": 0.0003227405211597359, "loss": 4.9669, "mean_token_accuracy": 0.22737135142087936, "num_tokens": 87139946.0, "step": 39025 }, { "entropy": 5.377615451812744, "epoch": 4.383444712753412, "grad_norm": 0.890625, "learning_rate": 0.00032270128584390735, "loss": 4.8835, "mean_token_accuracy": 0.2280343383550644, "num_tokens": 87150768.0, "step": 39030 }, { "entropy": 5.183257150650024, "epoch": 4.384006289661369, "grad_norm": 0.9296875, "learning_rate": 0.0003226620490092513, "loss": 4.7821, "mean_token_accuracy": 0.22679193764925004, "num_tokens": 87163110.0, "step": 39035 }, { "entropy": 5.255275774002075, "epoch": 4.384567866569327, "grad_norm": 0.9609375, "learning_rate": 0.00032262281065701716, "loss": 4.8469, "mean_token_accuracy": 0.22784461975097656, "num_tokens": 87174041.0, "step": 39040 }, { "entropy": 5.328845500946045, "epoch": 4.385129443477284, "grad_norm": 0.9921875, "learning_rate": 0.0003225835707884542, "loss": 4.8928, "mean_token_accuracy": 0.22944344729185104, "num_tokens": 87185560.0, "step": 39045 }, { "entropy": 5.352369117736816, "epoch": 4.3856910203852415, "grad_norm": 1.0390625, "learning_rate": 0.0003225443294048119, "loss": 4.9731, "mean_token_accuracy": 0.2203712895512581, "num_tokens": 87196222.0, "step": 39050 }, { "entropy": 5.323004722595215, "epoch": 4.3862525972932, "grad_norm": 0.94140625, "learning_rate": 0.00032250508650733976, "loss": 4.8236, "mean_token_accuracy": 0.2306432083249092, "num_tokens": 87206716.0, "step": 39055 }, { "entropy": 5.284487581253051, "epoch": 4.386814174201157, "grad_norm": 1.1015625, "learning_rate": 0.0003224658420972871, "loss": 4.8088, "mean_token_accuracy": 0.2402772292494774, "num_tokens": 87217291.0, "step": 39060 }, { "entropy": 5.252010250091553, "epoch": 4.387375751109114, "grad_norm": 1.0078125, "learning_rate": 0.0003224265961759038, "loss": 4.924, "mean_token_accuracy": 0.22360581457614898, "num_tokens": 87227058.0, "step": 39065 }, { "entropy": 5.339927816390992, "epoch": 4.387937328017072, "grad_norm": 1.03125, "learning_rate": 0.0003223873487444392, "loss": 4.9446, "mean_token_accuracy": 0.21583888530731202, "num_tokens": 87238426.0, "step": 39070 }, { "entropy": 5.348440027236938, "epoch": 4.388498904925029, "grad_norm": 1.03125, "learning_rate": 0.0003223480998041431, "loss": 4.8647, "mean_token_accuracy": 0.2268187001347542, "num_tokens": 87248801.0, "step": 39075 }, { "entropy": 5.298681354522705, "epoch": 4.389060481832987, "grad_norm": 1.015625, "learning_rate": 0.00032230884935626505, "loss": 4.8853, "mean_token_accuracy": 0.22873377054929733, "num_tokens": 87259391.0, "step": 39080 }, { "entropy": 5.378477716445923, "epoch": 4.389622058740945, "grad_norm": 1.0234375, "learning_rate": 0.000322269597402055, "loss": 4.8994, "mean_token_accuracy": 0.23123930096626283, "num_tokens": 87270405.0, "step": 39085 }, { "entropy": 5.380262088775635, "epoch": 4.390183635648902, "grad_norm": 1.0234375, "learning_rate": 0.0003222303439427625, "loss": 4.9576, "mean_token_accuracy": 0.22137229442596434, "num_tokens": 87281436.0, "step": 39090 }, { "entropy": 5.2122584819793705, "epoch": 4.39074521255686, "grad_norm": 1.0, "learning_rate": 0.00032219108897963767, "loss": 4.7607, "mean_token_accuracy": 0.22828382551670073, "num_tokens": 87292188.0, "step": 39095 }, { "entropy": 5.284840488433838, "epoch": 4.391306789464817, "grad_norm": 1.0, "learning_rate": 0.0003221518325139302, "loss": 4.8798, "mean_token_accuracy": 0.22439608573913575, "num_tokens": 87303059.0, "step": 39100 }, { "entropy": 5.349942445755005, "epoch": 4.3918683663727744, "grad_norm": 1.03125, "learning_rate": 0.0003221125745468901, "loss": 4.8594, "mean_token_accuracy": 0.23266898095607758, "num_tokens": 87314656.0, "step": 39105 }, { "entropy": 5.374396848678589, "epoch": 4.3924299432807326, "grad_norm": 0.92578125, "learning_rate": 0.0003220733150797673, "loss": 5.0281, "mean_token_accuracy": 0.215499247610569, "num_tokens": 87326929.0, "step": 39110 }, { "entropy": 5.392226982116699, "epoch": 4.39299152018869, "grad_norm": 0.9375, "learning_rate": 0.0003220340541138119, "loss": 4.9397, "mean_token_accuracy": 0.22224564701318741, "num_tokens": 87338687.0, "step": 39115 }, { "entropy": 5.3941137313842775, "epoch": 4.393553097096647, "grad_norm": 1.09375, "learning_rate": 0.00032199479165027407, "loss": 4.9569, "mean_token_accuracy": 0.22936271131038666, "num_tokens": 87350374.0, "step": 39120 }, { "entropy": 5.335529756546021, "epoch": 4.394114674004605, "grad_norm": 0.98828125, "learning_rate": 0.00032195552769040376, "loss": 5.0095, "mean_token_accuracy": 0.2218741998076439, "num_tokens": 87362473.0, "step": 39125 }, { "entropy": 5.208827924728394, "epoch": 4.394676250912562, "grad_norm": 0.9609375, "learning_rate": 0.0003219162622354513, "loss": 4.7948, "mean_token_accuracy": 0.23498421162366867, "num_tokens": 87372959.0, "step": 39130 }, { "entropy": 5.349884748458862, "epoch": 4.39523782782052, "grad_norm": 1.0390625, "learning_rate": 0.00032187699528666674, "loss": 4.8581, "mean_token_accuracy": 0.22999487072229385, "num_tokens": 87383902.0, "step": 39135 }, { "entropy": 5.350708675384522, "epoch": 4.395799404728478, "grad_norm": 1.0078125, "learning_rate": 0.0003218377268453006, "loss": 4.9463, "mean_token_accuracy": 0.22047436386346816, "num_tokens": 87395390.0, "step": 39140 }, { "entropy": 5.339994096755982, "epoch": 4.396360981636435, "grad_norm": 1.0234375, "learning_rate": 0.000321798456912603, "loss": 4.9104, "mean_token_accuracy": 0.22830140292644502, "num_tokens": 87406643.0, "step": 39145 }, { "entropy": 5.497971487045288, "epoch": 4.396922558544393, "grad_norm": 1.1015625, "learning_rate": 0.00032175918548982437, "loss": 5.0468, "mean_token_accuracy": 0.21557883620262147, "num_tokens": 87417575.0, "step": 39150 }, { "entropy": 5.356855678558349, "epoch": 4.39748413545235, "grad_norm": 1.046875, "learning_rate": 0.00032171991257821513, "loss": 4.9102, "mean_token_accuracy": 0.22669327557086943, "num_tokens": 87428566.0, "step": 39155 }, { "entropy": 5.280314683914185, "epoch": 4.398045712360307, "grad_norm": 0.96875, "learning_rate": 0.0003216806381790258, "loss": 4.9105, "mean_token_accuracy": 0.23277091681957246, "num_tokens": 87440234.0, "step": 39160 }, { "entropy": 5.3343640804290775, "epoch": 4.3986072892682655, "grad_norm": 0.98046875, "learning_rate": 0.0003216413622935069, "loss": 4.9707, "mean_token_accuracy": 0.22954027354717255, "num_tokens": 87451546.0, "step": 39165 }, { "entropy": 5.369922828674317, "epoch": 4.399168866176223, "grad_norm": 0.94921875, "learning_rate": 0.00032160208492290886, "loss": 4.9153, "mean_token_accuracy": 0.22718994617462157, "num_tokens": 87462385.0, "step": 39170 }, { "entropy": 5.3728584289550785, "epoch": 4.399730443084181, "grad_norm": 0.87890625, "learning_rate": 0.00032156280606848237, "loss": 4.8914, "mean_token_accuracy": 0.2203691229224205, "num_tokens": 87474378.0, "step": 39175 }, { "entropy": 5.291336917877198, "epoch": 4.400292019992138, "grad_norm": 1.109375, "learning_rate": 0.0003215235257314781, "loss": 4.9115, "mean_token_accuracy": 0.22477633506059647, "num_tokens": 87485363.0, "step": 39180 }, { "entropy": 5.266971397399902, "epoch": 4.400853596900095, "grad_norm": 1.09375, "learning_rate": 0.00032148424391314665, "loss": 4.8667, "mean_token_accuracy": 0.22167600244283675, "num_tokens": 87496026.0, "step": 39185 }, { "entropy": 5.455640506744385, "epoch": 4.401415173808053, "grad_norm": 1.0625, "learning_rate": 0.00032144496061473895, "loss": 5.0537, "mean_token_accuracy": 0.21666980981826783, "num_tokens": 87508017.0, "step": 39190 }, { "entropy": 5.33986759185791, "epoch": 4.401976750716011, "grad_norm": 1.0234375, "learning_rate": 0.0003214056758375056, "loss": 4.8514, "mean_token_accuracy": 0.22708531171083451, "num_tokens": 87519195.0, "step": 39195 }, { "entropy": 5.280864000320435, "epoch": 4.402538327623968, "grad_norm": 0.98828125, "learning_rate": 0.0003213663895826976, "loss": 4.8569, "mean_token_accuracy": 0.23063672184944153, "num_tokens": 87528662.0, "step": 39200 }, { "entropy": 5.328040552139282, "epoch": 4.403099904531926, "grad_norm": 1.0546875, "learning_rate": 0.0003213271018515657, "loss": 4.9696, "mean_token_accuracy": 0.2281997412443161, "num_tokens": 87539581.0, "step": 39205 }, { "entropy": 5.4320916652679445, "epoch": 4.403661481439883, "grad_norm": 1.078125, "learning_rate": 0.000321287812645361, "loss": 4.9928, "mean_token_accuracy": 0.22422082126140594, "num_tokens": 87550956.0, "step": 39210 }, { "entropy": 5.307030582427979, "epoch": 4.40422305834784, "grad_norm": 1.0625, "learning_rate": 0.00032124852196533434, "loss": 4.8254, "mean_token_accuracy": 0.23582567721605302, "num_tokens": 87561814.0, "step": 39215 }, { "entropy": 5.313479948043823, "epoch": 4.404784635255798, "grad_norm": 1.0234375, "learning_rate": 0.0003212092298127368, "loss": 4.8435, "mean_token_accuracy": 0.22785967886447905, "num_tokens": 87571806.0, "step": 39220 }, { "entropy": 5.292556715011597, "epoch": 4.405346212163756, "grad_norm": 0.96484375, "learning_rate": 0.00032116993618881945, "loss": 4.9277, "mean_token_accuracy": 0.22914689630270005, "num_tokens": 87584182.0, "step": 39225 }, { "entropy": 5.35007381439209, "epoch": 4.405907789071714, "grad_norm": 0.9453125, "learning_rate": 0.00032113064109483345, "loss": 4.9487, "mean_token_accuracy": 0.2196941003203392, "num_tokens": 87595296.0, "step": 39230 }, { "entropy": 5.323171615600586, "epoch": 4.406469365979671, "grad_norm": 1.15625, "learning_rate": 0.00032109134453202993, "loss": 4.8582, "mean_token_accuracy": 0.2298856258392334, "num_tokens": 87606173.0, "step": 39235 }, { "entropy": 5.389149522781372, "epoch": 4.407030942887628, "grad_norm": 1.0234375, "learning_rate": 0.00032105204650166016, "loss": 4.9743, "mean_token_accuracy": 0.22090557366609573, "num_tokens": 87615973.0, "step": 39240 }, { "entropy": 5.341455793380737, "epoch": 4.407592519795586, "grad_norm": 1.09375, "learning_rate": 0.00032101274700497537, "loss": 4.9621, "mean_token_accuracy": 0.22391989827156067, "num_tokens": 87626850.0, "step": 39245 }, { "entropy": 5.284790182113648, "epoch": 4.4081540967035435, "grad_norm": 0.9453125, "learning_rate": 0.0003209734460432269, "loss": 4.8774, "mean_token_accuracy": 0.22587104439735411, "num_tokens": 87639665.0, "step": 39250 }, { "entropy": 5.4052355766296385, "epoch": 4.408715673611501, "grad_norm": 1.0, "learning_rate": 0.000320934143617666, "loss": 4.9512, "mean_token_accuracy": 0.2241820365190506, "num_tokens": 87650822.0, "step": 39255 }, { "entropy": 5.302371215820313, "epoch": 4.409277250519459, "grad_norm": 0.97265625, "learning_rate": 0.0003208948397295441, "loss": 4.7561, "mean_token_accuracy": 0.24074116498231887, "num_tokens": 87661132.0, "step": 39260 }, { "entropy": 5.259728670120239, "epoch": 4.409838827427416, "grad_norm": 1.015625, "learning_rate": 0.00032085553438011285, "loss": 4.8461, "mean_token_accuracy": 0.2278350129723549, "num_tokens": 87672596.0, "step": 39265 }, { "entropy": 5.282335233688355, "epoch": 4.410400404335373, "grad_norm": 1.03125, "learning_rate": 0.0003208162275706235, "loss": 4.8137, "mean_token_accuracy": 0.22991986721754074, "num_tokens": 87683394.0, "step": 39270 }, { "entropy": 5.320605087280273, "epoch": 4.410961981243331, "grad_norm": 1.0078125, "learning_rate": 0.0003207769193023277, "loss": 4.8552, "mean_token_accuracy": 0.2324218764901161, "num_tokens": 87694984.0, "step": 39275 }, { "entropy": 5.330983591079712, "epoch": 4.411523558151289, "grad_norm": 1.0390625, "learning_rate": 0.00032073760957647705, "loss": 4.9519, "mean_token_accuracy": 0.22490293234586717, "num_tokens": 87705990.0, "step": 39280 }, { "entropy": 5.309467077255249, "epoch": 4.412085135059247, "grad_norm": 0.94140625, "learning_rate": 0.0003206982983943232, "loss": 4.8405, "mean_token_accuracy": 0.22557423114776612, "num_tokens": 87717329.0, "step": 39285 }, { "entropy": 5.207985591888428, "epoch": 4.412646711967204, "grad_norm": 0.9609375, "learning_rate": 0.0003206589857571178, "loss": 4.8509, "mean_token_accuracy": 0.22804830223321915, "num_tokens": 87728436.0, "step": 39290 }, { "entropy": 5.285052871704101, "epoch": 4.413208288875161, "grad_norm": 1.046875, "learning_rate": 0.00032061967166611255, "loss": 4.8785, "mean_token_accuracy": 0.22850220948457717, "num_tokens": 87738803.0, "step": 39295 }, { "entropy": 5.38346037864685, "epoch": 4.413769865783119, "grad_norm": 1.015625, "learning_rate": 0.00032058035612255934, "loss": 4.9932, "mean_token_accuracy": 0.2256330132484436, "num_tokens": 87749981.0, "step": 39300 }, { "entropy": 5.312190055847168, "epoch": 4.4143314426910765, "grad_norm": 1.0703125, "learning_rate": 0.0003205410391277098, "loss": 4.8092, "mean_token_accuracy": 0.2245026260614395, "num_tokens": 87760193.0, "step": 39305 }, { "entropy": 5.421607494354248, "epoch": 4.414893019599034, "grad_norm": 1.1484375, "learning_rate": 0.00032050172068281594, "loss": 4.9759, "mean_token_accuracy": 0.21956278681755065, "num_tokens": 87770625.0, "step": 39310 }, { "entropy": 5.308591032028199, "epoch": 4.415454596506992, "grad_norm": 1.0546875, "learning_rate": 0.0003204624007891297, "loss": 4.8893, "mean_token_accuracy": 0.22604877948760987, "num_tokens": 87782294.0, "step": 39315 }, { "entropy": 5.315152883529663, "epoch": 4.416016173414949, "grad_norm": 0.9453125, "learning_rate": 0.000320423079447903, "loss": 4.9547, "mean_token_accuracy": 0.22575534284114837, "num_tokens": 87795320.0, "step": 39320 }, { "entropy": 5.166918039321899, "epoch": 4.416577750322907, "grad_norm": 0.90234375, "learning_rate": 0.00032038375666038776, "loss": 4.7245, "mean_token_accuracy": 0.23472943902015686, "num_tokens": 87806749.0, "step": 39325 }, { "entropy": 5.319843816757202, "epoch": 4.417139327230864, "grad_norm": 1.046875, "learning_rate": 0.0003203444324278361, "loss": 4.8969, "mean_token_accuracy": 0.23146649301052094, "num_tokens": 87817023.0, "step": 39330 }, { "entropy": 5.349138402938843, "epoch": 4.4177009041388215, "grad_norm": 0.984375, "learning_rate": 0.0003203051067515002, "loss": 4.9189, "mean_token_accuracy": 0.22715823948383332, "num_tokens": 87829510.0, "step": 39335 }, { "entropy": 5.3002828598022464, "epoch": 4.41826248104678, "grad_norm": 1.046875, "learning_rate": 0.0003202657796326321, "loss": 4.826, "mean_token_accuracy": 0.23399077355861664, "num_tokens": 87839328.0, "step": 39340 }, { "entropy": 5.408784961700439, "epoch": 4.418824057954737, "grad_norm": 1.0546875, "learning_rate": 0.000320226451072484, "loss": 4.9938, "mean_token_accuracy": 0.23135862052440642, "num_tokens": 87851370.0, "step": 39345 }, { "entropy": 5.337325668334961, "epoch": 4.419385634862694, "grad_norm": 1.1796875, "learning_rate": 0.00032018712107230815, "loss": 4.9479, "mean_token_accuracy": 0.24026576578617095, "num_tokens": 87863336.0, "step": 39350 }, { "entropy": 5.318598461151123, "epoch": 4.419947211770652, "grad_norm": 1.078125, "learning_rate": 0.0003201477896333568, "loss": 4.8709, "mean_token_accuracy": 0.2276093989610672, "num_tokens": 87873835.0, "step": 39355 }, { "entropy": 5.281771945953369, "epoch": 4.420508788678609, "grad_norm": 1.0234375, "learning_rate": 0.0003201084567568824, "loss": 4.8545, "mean_token_accuracy": 0.2339743882417679, "num_tokens": 87884711.0, "step": 39360 }, { "entropy": 5.330022287368775, "epoch": 4.4210703655865675, "grad_norm": 1.015625, "learning_rate": 0.00032006912244413727, "loss": 4.9096, "mean_token_accuracy": 0.21990752071142197, "num_tokens": 87895951.0, "step": 39365 }, { "entropy": 5.376646614074707, "epoch": 4.421631942494525, "grad_norm": 0.95703125, "learning_rate": 0.0003200297866963737, "loss": 4.9885, "mean_token_accuracy": 0.2248436138033867, "num_tokens": 87908347.0, "step": 39370 }, { "entropy": 5.312908077239991, "epoch": 4.422193519402482, "grad_norm": 0.96875, "learning_rate": 0.0003199904495148443, "loss": 4.8022, "mean_token_accuracy": 0.23637448400259017, "num_tokens": 87919020.0, "step": 39375 }, { "entropy": 5.270682239532471, "epoch": 4.42275509631044, "grad_norm": 0.99609375, "learning_rate": 0.0003199511109008016, "loss": 4.8922, "mean_token_accuracy": 0.22455971986055373, "num_tokens": 87930519.0, "step": 39380 }, { "entropy": 5.3403243064880375, "epoch": 4.423316673218397, "grad_norm": 0.96875, "learning_rate": 0.00031991177085549807, "loss": 4.9551, "mean_token_accuracy": 0.22673356682062148, "num_tokens": 87941800.0, "step": 39385 }, { "entropy": 5.360905599594116, "epoch": 4.4238782501263545, "grad_norm": 0.94921875, "learning_rate": 0.00031987242938018626, "loss": 4.9916, "mean_token_accuracy": 0.23521870523691177, "num_tokens": 87954273.0, "step": 39390 }, { "entropy": 5.4632072925567625, "epoch": 4.424439827034313, "grad_norm": 0.9921875, "learning_rate": 0.00031983308647611896, "loss": 4.9933, "mean_token_accuracy": 0.21870106011629104, "num_tokens": 87966089.0, "step": 39395 }, { "entropy": 5.308672952651977, "epoch": 4.42500140394227, "grad_norm": 1.1015625, "learning_rate": 0.0003197937421445488, "loss": 4.9025, "mean_token_accuracy": 0.22545765191316605, "num_tokens": 87976944.0, "step": 39400 }, { "entropy": 5.348008394241333, "epoch": 4.425562980850227, "grad_norm": 0.9765625, "learning_rate": 0.0003197543963867285, "loss": 4.9223, "mean_token_accuracy": 0.2268843874335289, "num_tokens": 87989715.0, "step": 39405 }, { "entropy": 5.348619031906128, "epoch": 4.426124557758185, "grad_norm": 1.015625, "learning_rate": 0.0003197150492039108, "loss": 4.891, "mean_token_accuracy": 0.22776401042938232, "num_tokens": 88000781.0, "step": 39410 }, { "entropy": 5.363515567779541, "epoch": 4.426686134666142, "grad_norm": 0.94140625, "learning_rate": 0.0003196757005973487, "loss": 4.9784, "mean_token_accuracy": 0.21951886713504792, "num_tokens": 88013017.0, "step": 39415 }, { "entropy": 5.35766568183899, "epoch": 4.4272477115741005, "grad_norm": 0.9375, "learning_rate": 0.00031963635056829487, "loss": 4.8973, "mean_token_accuracy": 0.22210378646850587, "num_tokens": 88023762.0, "step": 39420 }, { "entropy": 5.336866426467895, "epoch": 4.427809288482058, "grad_norm": 1.0078125, "learning_rate": 0.00031959699911800237, "loss": 4.9903, "mean_token_accuracy": 0.22735532522201538, "num_tokens": 88035632.0, "step": 39425 }, { "entropy": 5.317085552215576, "epoch": 4.428370865390015, "grad_norm": 1.015625, "learning_rate": 0.0003195576462477241, "loss": 4.9092, "mean_token_accuracy": 0.22382467240095139, "num_tokens": 88046108.0, "step": 39430 }, { "entropy": 5.417238378524781, "epoch": 4.428932442297973, "grad_norm": 1.1171875, "learning_rate": 0.00031951829195871315, "loss": 4.9654, "mean_token_accuracy": 0.22706470489501954, "num_tokens": 88057594.0, "step": 39435 }, { "entropy": 5.2410565376281735, "epoch": 4.42949401920593, "grad_norm": 0.9296875, "learning_rate": 0.00031947893625222244, "loss": 4.8468, "mean_token_accuracy": 0.2294571116566658, "num_tokens": 88069596.0, "step": 39440 }, { "entropy": 5.34272198677063, "epoch": 4.430055596113887, "grad_norm": 0.96484375, "learning_rate": 0.00031943957912950523, "loss": 4.9396, "mean_token_accuracy": 0.2264425814151764, "num_tokens": 88080802.0, "step": 39445 }, { "entropy": 5.436150026321411, "epoch": 4.4306171730218455, "grad_norm": 0.91015625, "learning_rate": 0.0003194002205918145, "loss": 5.0063, "mean_token_accuracy": 0.22558885663747788, "num_tokens": 88092750.0, "step": 39450 }, { "entropy": 5.425251245498657, "epoch": 4.431178749929803, "grad_norm": 1.0078125, "learning_rate": 0.0003193608606404036, "loss": 4.9831, "mean_token_accuracy": 0.2209223672747612, "num_tokens": 88103643.0, "step": 39455 }, { "entropy": 5.449653291702271, "epoch": 4.43174032683776, "grad_norm": 1.0234375, "learning_rate": 0.0003193214992765257, "loss": 4.954, "mean_token_accuracy": 0.22534777373075485, "num_tokens": 88114874.0, "step": 39460 }, { "entropy": 5.229110765457153, "epoch": 4.432301903745718, "grad_norm": 1.0390625, "learning_rate": 0.00031928213650143407, "loss": 4.7951, "mean_token_accuracy": 0.2311714246869087, "num_tokens": 88126222.0, "step": 39465 }, { "entropy": 5.231367683410644, "epoch": 4.432863480653675, "grad_norm": 0.97265625, "learning_rate": 0.000319242772316382, "loss": 4.8857, "mean_token_accuracy": 0.2204155907034874, "num_tokens": 88137562.0, "step": 39470 }, { "entropy": 5.352523374557495, "epoch": 4.433425057561633, "grad_norm": 1.0625, "learning_rate": 0.0003192034067226228, "loss": 4.9104, "mean_token_accuracy": 0.22418105602264404, "num_tokens": 88148129.0, "step": 39475 }, { "entropy": 5.348887729644775, "epoch": 4.433986634469591, "grad_norm": 1.1015625, "learning_rate": 0.00031916403972141017, "loss": 4.8247, "mean_token_accuracy": 0.23311634212732316, "num_tokens": 88159958.0, "step": 39480 }, { "entropy": 5.395280838012695, "epoch": 4.434548211377548, "grad_norm": 0.953125, "learning_rate": 0.0003191246713139973, "loss": 4.9298, "mean_token_accuracy": 0.22215466499328612, "num_tokens": 88171952.0, "step": 39485 }, { "entropy": 5.325673818588257, "epoch": 4.435109788285506, "grad_norm": 1.046875, "learning_rate": 0.00031908530150163777, "loss": 4.8999, "mean_token_accuracy": 0.22849203199148177, "num_tokens": 88183124.0, "step": 39490 }, { "entropy": 5.274728012084961, "epoch": 4.435671365193463, "grad_norm": 1.0, "learning_rate": 0.00031904593028558517, "loss": 4.8038, "mean_token_accuracy": 0.2319674924015999, "num_tokens": 88194262.0, "step": 39495 }, { "entropy": 5.369441366195678, "epoch": 4.43623294210142, "grad_norm": 1.015625, "learning_rate": 0.00031900655766709305, "loss": 4.9651, "mean_token_accuracy": 0.214591121673584, "num_tokens": 88206423.0, "step": 39500 }, { "entropy": 5.343212604522705, "epoch": 4.4367945190093785, "grad_norm": 0.9375, "learning_rate": 0.0003189671836474151, "loss": 4.9207, "mean_token_accuracy": 0.22116810977458953, "num_tokens": 88217299.0, "step": 39505 }, { "entropy": 5.239911937713623, "epoch": 4.437356095917336, "grad_norm": 0.95703125, "learning_rate": 0.0003189278082278049, "loss": 4.7532, "mean_token_accuracy": 0.23532282412052155, "num_tokens": 88228042.0, "step": 39510 }, { "entropy": 5.228815317153931, "epoch": 4.437917672825294, "grad_norm": 1.0234375, "learning_rate": 0.00031888843140951627, "loss": 4.779, "mean_token_accuracy": 0.24185292571783065, "num_tokens": 88239079.0, "step": 39515 }, { "entropy": 5.316821765899658, "epoch": 4.438479249733251, "grad_norm": 0.9296875, "learning_rate": 0.0003188490531938031, "loss": 4.9138, "mean_token_accuracy": 0.2181081622838974, "num_tokens": 88250788.0, "step": 39520 }, { "entropy": 5.447083044052124, "epoch": 4.439040826641208, "grad_norm": 1.0, "learning_rate": 0.00031880967358191884, "loss": 4.9095, "mean_token_accuracy": 0.23072440028190613, "num_tokens": 88261763.0, "step": 39525 }, { "entropy": 5.2974930763244625, "epoch": 4.439602403549166, "grad_norm": 0.9296875, "learning_rate": 0.00031877029257511774, "loss": 4.8251, "mean_token_accuracy": 0.23587096780538558, "num_tokens": 88273015.0, "step": 39530 }, { "entropy": 5.345725393295288, "epoch": 4.440163980457124, "grad_norm": 1.078125, "learning_rate": 0.00031873091017465356, "loss": 4.891, "mean_token_accuracy": 0.22882061451673508, "num_tokens": 88283404.0, "step": 39535 }, { "entropy": 5.2896373748779295, "epoch": 4.440725557365081, "grad_norm": 1.078125, "learning_rate": 0.0003186915263817802, "loss": 4.863, "mean_token_accuracy": 0.22908073365688325, "num_tokens": 88294643.0, "step": 39540 }, { "entropy": 5.342891836166382, "epoch": 4.441287134273039, "grad_norm": 1.0390625, "learning_rate": 0.00031865214119775173, "loss": 4.9786, "mean_token_accuracy": 0.22388364970684052, "num_tokens": 88305421.0, "step": 39545 }, { "entropy": 5.366492748260498, "epoch": 4.441848711180996, "grad_norm": 1.0078125, "learning_rate": 0.000318612754623822, "loss": 4.9057, "mean_token_accuracy": 0.2236397534608841, "num_tokens": 88316154.0, "step": 39550 }, { "entropy": 5.369657564163208, "epoch": 4.442410288088954, "grad_norm": 1.0, "learning_rate": 0.00031857336666124537, "loss": 4.8992, "mean_token_accuracy": 0.23015168756246568, "num_tokens": 88327240.0, "step": 39555 }, { "entropy": 5.344067001342774, "epoch": 4.442971864996911, "grad_norm": 1.171875, "learning_rate": 0.0003185339773112758, "loss": 4.8943, "mean_token_accuracy": 0.23100090771913528, "num_tokens": 88338080.0, "step": 39560 }, { "entropy": 5.328589916229248, "epoch": 4.443533441904869, "grad_norm": 0.89453125, "learning_rate": 0.0003184945865751675, "loss": 4.9371, "mean_token_accuracy": 0.22405379712581636, "num_tokens": 88349609.0, "step": 39565 }, { "entropy": 5.294997930526733, "epoch": 4.444095018812827, "grad_norm": 1.0078125, "learning_rate": 0.00031845519445417475, "loss": 4.8279, "mean_token_accuracy": 0.22710233628749849, "num_tokens": 88360573.0, "step": 39570 }, { "entropy": 5.387909650802612, "epoch": 4.444656595720784, "grad_norm": 1.015625, "learning_rate": 0.0003184158009495518, "loss": 4.9311, "mean_token_accuracy": 0.23076122552156447, "num_tokens": 88371461.0, "step": 39575 }, { "entropy": 5.307783460617065, "epoch": 4.445218172628741, "grad_norm": 0.97265625, "learning_rate": 0.0003183764060625528, "loss": 4.89, "mean_token_accuracy": 0.22906928211450578, "num_tokens": 88382372.0, "step": 39580 }, { "entropy": 5.352380466461182, "epoch": 4.445779749536699, "grad_norm": 1.0234375, "learning_rate": 0.00031833700979443227, "loss": 4.8796, "mean_token_accuracy": 0.22698671370744705, "num_tokens": 88393166.0, "step": 39585 }, { "entropy": 5.346959066390991, "epoch": 4.4463413264446565, "grad_norm": 1.046875, "learning_rate": 0.00031829761214644453, "loss": 4.8869, "mean_token_accuracy": 0.22933561652898787, "num_tokens": 88403746.0, "step": 39590 }, { "entropy": 5.239298295974732, "epoch": 4.446902903352614, "grad_norm": 1.0703125, "learning_rate": 0.000318258213119844, "loss": 4.8128, "mean_token_accuracy": 0.2387865886092186, "num_tokens": 88414770.0, "step": 39595 }, { "entropy": 5.332181787490844, "epoch": 4.447464480260572, "grad_norm": 1.0078125, "learning_rate": 0.0003182188127158852, "loss": 4.9149, "mean_token_accuracy": 0.2241550490260124, "num_tokens": 88426545.0, "step": 39600 }, { "entropy": 5.382669258117676, "epoch": 4.448026057168529, "grad_norm": 0.92578125, "learning_rate": 0.0003181794109358227, "loss": 4.8882, "mean_token_accuracy": 0.23456624895334244, "num_tokens": 88437147.0, "step": 39605 }, { "entropy": 5.312020874023437, "epoch": 4.448587634076487, "grad_norm": 0.94140625, "learning_rate": 0.0003181400077809109, "loss": 4.8257, "mean_token_accuracy": 0.23696399927139283, "num_tokens": 88449965.0, "step": 39610 }, { "entropy": 5.3283110618591305, "epoch": 4.449149210984444, "grad_norm": 1.0234375, "learning_rate": 0.00031810060325240466, "loss": 4.9677, "mean_token_accuracy": 0.22498459964990616, "num_tokens": 88460713.0, "step": 39615 }, { "entropy": 5.357755470275879, "epoch": 4.449710787892402, "grad_norm": 1.0, "learning_rate": 0.0003180611973515583, "loss": 4.9152, "mean_token_accuracy": 0.21391791999340057, "num_tokens": 88472760.0, "step": 39620 }, { "entropy": 5.368761682510376, "epoch": 4.45027236480036, "grad_norm": 0.9453125, "learning_rate": 0.00031802179007962687, "loss": 4.967, "mean_token_accuracy": 0.22407209426164626, "num_tokens": 88482985.0, "step": 39625 }, { "entropy": 5.359822607040405, "epoch": 4.450833941708317, "grad_norm": 1.0078125, "learning_rate": 0.0003179823814378649, "loss": 4.8769, "mean_token_accuracy": 0.2296901524066925, "num_tokens": 88493081.0, "step": 39630 }, { "entropy": 5.297291564941406, "epoch": 4.451395518616274, "grad_norm": 1.03125, "learning_rate": 0.00031794297142752727, "loss": 4.9052, "mean_token_accuracy": 0.2284200146794319, "num_tokens": 88503497.0, "step": 39635 }, { "entropy": 5.328436279296875, "epoch": 4.451957095524232, "grad_norm": 0.98046875, "learning_rate": 0.0003179035600498687, "loss": 4.8986, "mean_token_accuracy": 0.23156222701072693, "num_tokens": 88514293.0, "step": 39640 }, { "entropy": 5.4137890338897705, "epoch": 4.4525186724321895, "grad_norm": 0.98046875, "learning_rate": 0.00031786414730614423, "loss": 4.903, "mean_token_accuracy": 0.2216462731361389, "num_tokens": 88526137.0, "step": 39645 }, { "entropy": 5.305985164642334, "epoch": 4.453080249340147, "grad_norm": 1.0859375, "learning_rate": 0.0003178247331976086, "loss": 4.8776, "mean_token_accuracy": 0.23039168864488602, "num_tokens": 88536492.0, "step": 39650 }, { "entropy": 5.355554056167603, "epoch": 4.453641826248105, "grad_norm": 0.984375, "learning_rate": 0.00031778531772551696, "loss": 4.9823, "mean_token_accuracy": 0.2234683632850647, "num_tokens": 88548401.0, "step": 39655 }, { "entropy": 5.35480523109436, "epoch": 4.454203403156062, "grad_norm": 0.95703125, "learning_rate": 0.0003177459008911241, "loss": 4.9107, "mean_token_accuracy": 0.23102037608623505, "num_tokens": 88560873.0, "step": 39660 }, { "entropy": 5.365744972229004, "epoch": 4.45476498006402, "grad_norm": 1.015625, "learning_rate": 0.00031770648269568524, "loss": 4.8357, "mean_token_accuracy": 0.23653408885002136, "num_tokens": 88572539.0, "step": 39665 }, { "entropy": 5.263909816741943, "epoch": 4.455326556971977, "grad_norm": 0.94140625, "learning_rate": 0.0003176670631404554, "loss": 4.9155, "mean_token_accuracy": 0.22255334705114366, "num_tokens": 88585359.0, "step": 39670 }, { "entropy": 5.282906484603882, "epoch": 4.4558881338799345, "grad_norm": 1.0390625, "learning_rate": 0.00031762764222668976, "loss": 4.8531, "mean_token_accuracy": 0.2328341096639633, "num_tokens": 88596553.0, "step": 39675 }, { "entropy": 5.479402637481689, "epoch": 4.456449710787893, "grad_norm": 0.93359375, "learning_rate": 0.00031758821995564343, "loss": 5.0155, "mean_token_accuracy": 0.2182830661535263, "num_tokens": 88608955.0, "step": 39680 }, { "entropy": 5.464870738983154, "epoch": 4.45701128769585, "grad_norm": 0.94921875, "learning_rate": 0.0003175487963285716, "loss": 4.9957, "mean_token_accuracy": 0.22368018180131913, "num_tokens": 88619505.0, "step": 39685 }, { "entropy": 5.355525112152099, "epoch": 4.457572864603807, "grad_norm": 0.9140625, "learning_rate": 0.0003175093713467297, "loss": 4.8449, "mean_token_accuracy": 0.23348209857940674, "num_tokens": 88632168.0, "step": 39690 }, { "entropy": 5.184128999710083, "epoch": 4.458134441511765, "grad_norm": 0.91796875, "learning_rate": 0.00031746994501137283, "loss": 4.8001, "mean_token_accuracy": 0.2265692487359047, "num_tokens": 88643463.0, "step": 39695 }, { "entropy": 5.3032533645629885, "epoch": 4.458696018419722, "grad_norm": 1.03125, "learning_rate": 0.0003174305173237565, "loss": 4.9241, "mean_token_accuracy": 0.21786656826734543, "num_tokens": 88653894.0, "step": 39700 }, { "entropy": 5.32895975112915, "epoch": 4.4592575953276805, "grad_norm": 1.0078125, "learning_rate": 0.000317391088285136, "loss": 4.8103, "mean_token_accuracy": 0.2300771951675415, "num_tokens": 88664610.0, "step": 39705 }, { "entropy": 5.3396327018737795, "epoch": 4.459819172235638, "grad_norm": 1.0234375, "learning_rate": 0.0003173516578967668, "loss": 4.8931, "mean_token_accuracy": 0.23128711730241774, "num_tokens": 88675040.0, "step": 39710 }, { "entropy": 5.4021257877349855, "epoch": 4.460380749143595, "grad_norm": 1.046875, "learning_rate": 0.00031731222615990443, "loss": 4.9651, "mean_token_accuracy": 0.22582394927740096, "num_tokens": 88686344.0, "step": 39715 }, { "entropy": 5.343878126144409, "epoch": 4.460942326051553, "grad_norm": 1.0, "learning_rate": 0.00031727279307580436, "loss": 4.8015, "mean_token_accuracy": 0.23153689354658127, "num_tokens": 88697538.0, "step": 39720 }, { "entropy": 5.343119955062866, "epoch": 4.46150390295951, "grad_norm": 0.953125, "learning_rate": 0.00031723335864572216, "loss": 4.9121, "mean_token_accuracy": 0.227900193631649, "num_tokens": 88709663.0, "step": 39725 }, { "entropy": 5.366219186782837, "epoch": 4.4620654798674675, "grad_norm": 0.98828125, "learning_rate": 0.00031719392287091343, "loss": 4.9689, "mean_token_accuracy": 0.22820674628019333, "num_tokens": 88720822.0, "step": 39730 }, { "entropy": 5.3275978565216064, "epoch": 4.462627056775426, "grad_norm": 1.0703125, "learning_rate": 0.0003171544857526338, "loss": 4.862, "mean_token_accuracy": 0.23116662055253984, "num_tokens": 88731453.0, "step": 39735 }, { "entropy": 5.34813551902771, "epoch": 4.463188633683383, "grad_norm": 1.0859375, "learning_rate": 0.0003171150472921391, "loss": 4.9517, "mean_token_accuracy": 0.22085969746112824, "num_tokens": 88742325.0, "step": 39740 }, { "entropy": 5.372896909713745, "epoch": 4.463750210591341, "grad_norm": 1.0, "learning_rate": 0.00031707560749068487, "loss": 4.9064, "mean_token_accuracy": 0.22508497387170792, "num_tokens": 88754165.0, "step": 39745 }, { "entropy": 5.328558301925659, "epoch": 4.464311787499298, "grad_norm": 0.95703125, "learning_rate": 0.000317036166349527, "loss": 4.9212, "mean_token_accuracy": 0.23438612669706343, "num_tokens": 88765469.0, "step": 39750 }, { "entropy": 5.2627912044525145, "epoch": 4.464873364407255, "grad_norm": 0.99609375, "learning_rate": 0.0003169967238699213, "loss": 4.8735, "mean_token_accuracy": 0.22380549609661102, "num_tokens": 88775849.0, "step": 39755 }, { "entropy": 5.299552297592163, "epoch": 4.4654349413152135, "grad_norm": 0.9921875, "learning_rate": 0.00031695728005312363, "loss": 4.8809, "mean_token_accuracy": 0.23068566173315047, "num_tokens": 88787385.0, "step": 39760 }, { "entropy": 5.2912548065185545, "epoch": 4.465996518223171, "grad_norm": 0.9296875, "learning_rate": 0.0003169178349003898, "loss": 4.8167, "mean_token_accuracy": 0.23500480651855468, "num_tokens": 88798264.0, "step": 39765 }, { "entropy": 5.315749025344848, "epoch": 4.466558095131128, "grad_norm": 1.1171875, "learning_rate": 0.000316878388412976, "loss": 4.9151, "mean_token_accuracy": 0.22320104837417604, "num_tokens": 88808833.0, "step": 39770 }, { "entropy": 5.338047361373901, "epoch": 4.467119672039086, "grad_norm": 0.98828125, "learning_rate": 0.000316838940592138, "loss": 4.9277, "mean_token_accuracy": 0.22150078415870667, "num_tokens": 88819757.0, "step": 39775 }, { "entropy": 5.317291116714477, "epoch": 4.467681248947043, "grad_norm": 1.015625, "learning_rate": 0.00031679949143913183, "loss": 4.9009, "mean_token_accuracy": 0.233622944355011, "num_tokens": 88831120.0, "step": 39780 }, { "entropy": 5.366607761383056, "epoch": 4.468242825855, "grad_norm": 0.96484375, "learning_rate": 0.0003167600409552137, "loss": 4.8902, "mean_token_accuracy": 0.225513756275177, "num_tokens": 88841674.0, "step": 39785 }, { "entropy": 5.263133525848389, "epoch": 4.4688044027629585, "grad_norm": 1.0859375, "learning_rate": 0.0003167205891416397, "loss": 4.8196, "mean_token_accuracy": 0.22906122654676436, "num_tokens": 88851844.0, "step": 39790 }, { "entropy": 5.341765832901001, "epoch": 4.469365979670916, "grad_norm": 1.1640625, "learning_rate": 0.000316681135999666, "loss": 4.9585, "mean_token_accuracy": 0.22438384741544723, "num_tokens": 88862638.0, "step": 39795 }, { "entropy": 5.305462741851807, "epoch": 4.469927556578874, "grad_norm": 0.95703125, "learning_rate": 0.0003166416815305486, "loss": 4.8327, "mean_token_accuracy": 0.23317761868238449, "num_tokens": 88873427.0, "step": 39800 }, { "entropy": 5.304219388961792, "epoch": 4.470489133486831, "grad_norm": 1.046875, "learning_rate": 0.00031660222573554406, "loss": 4.895, "mean_token_accuracy": 0.22628800719976425, "num_tokens": 88885461.0, "step": 39805 }, { "entropy": 5.352918529510498, "epoch": 4.471050710394788, "grad_norm": 0.97265625, "learning_rate": 0.0003165627686159085, "loss": 4.9406, "mean_token_accuracy": 0.2205628737807274, "num_tokens": 88896501.0, "step": 39810 }, { "entropy": 5.385996866226196, "epoch": 4.471612287302746, "grad_norm": 1.0234375, "learning_rate": 0.0003165233101728982, "loss": 4.9247, "mean_token_accuracy": 0.22716703414916992, "num_tokens": 88906653.0, "step": 39815 }, { "entropy": 5.257912826538086, "epoch": 4.472173864210704, "grad_norm": 0.9609375, "learning_rate": 0.00031648385040776965, "loss": 4.834, "mean_token_accuracy": 0.23311492800712585, "num_tokens": 88917022.0, "step": 39820 }, { "entropy": 5.277245998382568, "epoch": 4.472735441118661, "grad_norm": 0.9921875, "learning_rate": 0.0003164443893217793, "loss": 4.7878, "mean_token_accuracy": 0.2265198677778244, "num_tokens": 88927632.0, "step": 39825 }, { "entropy": 5.290548372268677, "epoch": 4.473297018026619, "grad_norm": 0.984375, "learning_rate": 0.0003164049269161834, "loss": 4.8502, "mean_token_accuracy": 0.23173531144857407, "num_tokens": 88938178.0, "step": 39830 }, { "entropy": 5.27850456237793, "epoch": 4.473858594934576, "grad_norm": 0.98046875, "learning_rate": 0.00031636546319223845, "loss": 4.8147, "mean_token_accuracy": 0.23721863180398942, "num_tokens": 88948549.0, "step": 39835 }, { "entropy": 5.247592830657959, "epoch": 4.474420171842533, "grad_norm": 0.96875, "learning_rate": 0.0003163259981512013, "loss": 4.8371, "mean_token_accuracy": 0.22553878128528596, "num_tokens": 88959828.0, "step": 39840 }, { "entropy": 5.38188099861145, "epoch": 4.4749817487504915, "grad_norm": 0.8515625, "learning_rate": 0.0003162865317943283, "loss": 4.8955, "mean_token_accuracy": 0.23285338282585144, "num_tokens": 88971705.0, "step": 39845 }, { "entropy": 5.291318035125732, "epoch": 4.475543325658449, "grad_norm": 1.0, "learning_rate": 0.00031624706412287614, "loss": 4.8994, "mean_token_accuracy": 0.22545673102140426, "num_tokens": 88982853.0, "step": 39850 }, { "entropy": 5.2658953189849855, "epoch": 4.476104902566407, "grad_norm": 1.015625, "learning_rate": 0.0003162075951381014, "loss": 4.8089, "mean_token_accuracy": 0.23663706332445145, "num_tokens": 88993028.0, "step": 39855 }, { "entropy": 5.369491195678711, "epoch": 4.476666479474364, "grad_norm": 1.0078125, "learning_rate": 0.00031616812484126084, "loss": 4.9743, "mean_token_accuracy": 0.2211526960134506, "num_tokens": 89004164.0, "step": 39860 }, { "entropy": 5.375478267669678, "epoch": 4.477228056382321, "grad_norm": 1.0703125, "learning_rate": 0.0003161286532336113, "loss": 4.9093, "mean_token_accuracy": 0.23506587743759155, "num_tokens": 89015868.0, "step": 39865 }, { "entropy": 5.292371511459351, "epoch": 4.477789633290279, "grad_norm": 1.1328125, "learning_rate": 0.00031608918031640946, "loss": 4.8307, "mean_token_accuracy": 0.2288281112909317, "num_tokens": 89026302.0, "step": 39870 }, { "entropy": 5.259103202819825, "epoch": 4.478351210198237, "grad_norm": 1.0703125, "learning_rate": 0.0003160497060909121, "loss": 4.8863, "mean_token_accuracy": 0.22497027218341828, "num_tokens": 89036480.0, "step": 39875 }, { "entropy": 5.397715711593628, "epoch": 4.478912787106194, "grad_norm": 1.078125, "learning_rate": 0.00031601023055837624, "loss": 4.967, "mean_token_accuracy": 0.22505880743265153, "num_tokens": 89047850.0, "step": 39880 }, { "entropy": 5.3587171077728275, "epoch": 4.479474364014152, "grad_norm": 1.0546875, "learning_rate": 0.00031597075372005875, "loss": 4.8492, "mean_token_accuracy": 0.22981864511966704, "num_tokens": 89059298.0, "step": 39885 }, { "entropy": 5.347992467880249, "epoch": 4.480035940922109, "grad_norm": 0.99609375, "learning_rate": 0.00031593127557721657, "loss": 4.9113, "mean_token_accuracy": 0.2297041267156601, "num_tokens": 89069966.0, "step": 39890 }, { "entropy": 5.348856639862061, "epoch": 4.480597517830067, "grad_norm": 1.015625, "learning_rate": 0.0003158917961311067, "loss": 4.9501, "mean_token_accuracy": 0.22232261449098586, "num_tokens": 89081277.0, "step": 39895 }, { "entropy": 5.430898237228393, "epoch": 4.481159094738024, "grad_norm": 1.0625, "learning_rate": 0.0003158523153829862, "loss": 4.9676, "mean_token_accuracy": 0.22373025864362717, "num_tokens": 89092221.0, "step": 39900 }, { "entropy": 5.344412469863892, "epoch": 4.481720671645982, "grad_norm": 0.95703125, "learning_rate": 0.0003158128333341121, "loss": 4.924, "mean_token_accuracy": 0.2226986214518547, "num_tokens": 89103232.0, "step": 39905 }, { "entropy": 5.240042591094971, "epoch": 4.48228224855394, "grad_norm": 1.078125, "learning_rate": 0.00031577334998574155, "loss": 4.876, "mean_token_accuracy": 0.22506940364837646, "num_tokens": 89113222.0, "step": 39910 }, { "entropy": 5.376622438430786, "epoch": 4.482843825461897, "grad_norm": 0.9765625, "learning_rate": 0.0003157338653391317, "loss": 4.9936, "mean_token_accuracy": 0.216456601023674, "num_tokens": 89125396.0, "step": 39915 }, { "entropy": 5.473752212524414, "epoch": 4.483405402369854, "grad_norm": 0.99609375, "learning_rate": 0.0003156943793955398, "loss": 4.9609, "mean_token_accuracy": 0.22036432921886445, "num_tokens": 89136199.0, "step": 39920 }, { "entropy": 5.4411139488220215, "epoch": 4.483966979277812, "grad_norm": 1.078125, "learning_rate": 0.00031565489215622304, "loss": 5.0008, "mean_token_accuracy": 0.21621793806552886, "num_tokens": 89146761.0, "step": 39925 }, { "entropy": 5.366348648071289, "epoch": 4.4845285561857695, "grad_norm": 1.0625, "learning_rate": 0.0003156154036224388, "loss": 4.9777, "mean_token_accuracy": 0.22512317895889283, "num_tokens": 89157783.0, "step": 39930 }, { "entropy": 5.237155151367188, "epoch": 4.485090133093728, "grad_norm": 0.9921875, "learning_rate": 0.0003155759137954444, "loss": 4.8027, "mean_token_accuracy": 0.23095589131116867, "num_tokens": 89168376.0, "step": 39935 }, { "entropy": 5.276667785644531, "epoch": 4.485651710001685, "grad_norm": 0.97265625, "learning_rate": 0.00031553642267649715, "loss": 4.8079, "mean_token_accuracy": 0.23364906907081603, "num_tokens": 89179113.0, "step": 39940 }, { "entropy": 5.332836627960205, "epoch": 4.486213286909642, "grad_norm": 0.9921875, "learning_rate": 0.0003154969302668544, "loss": 4.9015, "mean_token_accuracy": 0.2293717458844185, "num_tokens": 89190233.0, "step": 39945 }, { "entropy": 5.345413541793823, "epoch": 4.4867748638176, "grad_norm": 1.03125, "learning_rate": 0.0003154574365677737, "loss": 4.8936, "mean_token_accuracy": 0.23045855462551118, "num_tokens": 89200800.0, "step": 39950 }, { "entropy": 5.478984594345093, "epoch": 4.487336440725557, "grad_norm": 1.0, "learning_rate": 0.0003154179415805126, "loss": 5.0068, "mean_token_accuracy": 0.2176470100879669, "num_tokens": 89211865.0, "step": 39955 }, { "entropy": 5.436945390701294, "epoch": 4.487898017633515, "grad_norm": 0.96484375, "learning_rate": 0.0003153784453063285, "loss": 4.9708, "mean_token_accuracy": 0.2204291731119156, "num_tokens": 89224151.0, "step": 39960 }, { "entropy": 5.30970401763916, "epoch": 4.488459594541473, "grad_norm": 1.03125, "learning_rate": 0.0003153389477464791, "loss": 4.8481, "mean_token_accuracy": 0.22851054668426513, "num_tokens": 89235095.0, "step": 39965 }, { "entropy": 5.393049240112305, "epoch": 4.48902117144943, "grad_norm": 1.0390625, "learning_rate": 0.0003152994489022219, "loss": 5.0259, "mean_token_accuracy": 0.21566759496927262, "num_tokens": 89247891.0, "step": 39970 }, { "entropy": 5.354640150070191, "epoch": 4.489582748357387, "grad_norm": 1.015625, "learning_rate": 0.00031525994877481465, "loss": 4.9214, "mean_token_accuracy": 0.22765126526355745, "num_tokens": 89259395.0, "step": 39975 }, { "entropy": 5.31620225906372, "epoch": 4.490144325265345, "grad_norm": 1.015625, "learning_rate": 0.000315220447365515, "loss": 4.8802, "mean_token_accuracy": 0.2293820172548294, "num_tokens": 89269715.0, "step": 39980 }, { "entropy": 5.285018110275269, "epoch": 4.4907059021733025, "grad_norm": 1.015625, "learning_rate": 0.00031518094467558074, "loss": 4.8624, "mean_token_accuracy": 0.23455798029899597, "num_tokens": 89280260.0, "step": 39985 }, { "entropy": 5.2565676212310795, "epoch": 4.491267479081261, "grad_norm": 1.0, "learning_rate": 0.00031514144070626956, "loss": 4.8943, "mean_token_accuracy": 0.23055990636348725, "num_tokens": 89289678.0, "step": 39990 }, { "entropy": 5.301475524902344, "epoch": 4.491829055989218, "grad_norm": 0.94921875, "learning_rate": 0.00031510193545883944, "loss": 4.8588, "mean_token_accuracy": 0.22982937544584275, "num_tokens": 89300534.0, "step": 39995 }, { "entropy": 5.402946615219117, "epoch": 4.492390632897175, "grad_norm": 1.09375, "learning_rate": 0.000315062428934548, "loss": 4.9044, "mean_token_accuracy": 0.22246890068054198, "num_tokens": 89311873.0, "step": 40000 }, { "entropy": 5.230341196060181, "epoch": 4.492952209805133, "grad_norm": 1.0234375, "learning_rate": 0.00031502292113465334, "loss": 4.7958, "mean_token_accuracy": 0.23731550872325896, "num_tokens": 89322941.0, "step": 40005 }, { "entropy": 5.307804727554322, "epoch": 4.49351378671309, "grad_norm": 0.96875, "learning_rate": 0.00031498341206041337, "loss": 4.8717, "mean_token_accuracy": 0.22978683263063432, "num_tokens": 89335028.0, "step": 40010 }, { "entropy": 5.417961645126343, "epoch": 4.4940753636210475, "grad_norm": 0.953125, "learning_rate": 0.000314943901713086, "loss": 4.9136, "mean_token_accuracy": 0.224075049161911, "num_tokens": 89345929.0, "step": 40015 }, { "entropy": 5.356483221054077, "epoch": 4.494636940529006, "grad_norm": 0.984375, "learning_rate": 0.0003149043900939294, "loss": 4.937, "mean_token_accuracy": 0.22688587754964828, "num_tokens": 89357496.0, "step": 40020 }, { "entropy": 5.335915374755859, "epoch": 4.495198517436963, "grad_norm": 0.921875, "learning_rate": 0.00031486487720420146, "loss": 4.9664, "mean_token_accuracy": 0.21988402158021927, "num_tokens": 89370304.0, "step": 40025 }, { "entropy": 5.401082754135132, "epoch": 4.49576009434492, "grad_norm": 1.015625, "learning_rate": 0.00031482536304516047, "loss": 4.9114, "mean_token_accuracy": 0.22952803373336791, "num_tokens": 89382642.0, "step": 40030 }, { "entropy": 5.3780372619628904, "epoch": 4.496321671252878, "grad_norm": 0.9921875, "learning_rate": 0.0003147858476180644, "loss": 4.9582, "mean_token_accuracy": 0.2272280350327492, "num_tokens": 89393730.0, "step": 40035 }, { "entropy": 5.395279169082642, "epoch": 4.496883248160835, "grad_norm": 1.0078125, "learning_rate": 0.00031474633092417155, "loss": 4.9395, "mean_token_accuracy": 0.2251102715730667, "num_tokens": 89404210.0, "step": 40040 }, { "entropy": 5.392739868164062, "epoch": 4.4974448250687935, "grad_norm": 1.015625, "learning_rate": 0.00031470681296474006, "loss": 4.9261, "mean_token_accuracy": 0.2275625631213188, "num_tokens": 89414204.0, "step": 40045 }, { "entropy": 5.326411724090576, "epoch": 4.498006401976751, "grad_norm": 1.0703125, "learning_rate": 0.0003146672937410283, "loss": 4.9071, "mean_token_accuracy": 0.22785369902849198, "num_tokens": 89424933.0, "step": 40050 }, { "entropy": 5.34465594291687, "epoch": 4.498567978884708, "grad_norm": 0.94921875, "learning_rate": 0.00031462777325429447, "loss": 4.9644, "mean_token_accuracy": 0.22366296797990798, "num_tokens": 89437086.0, "step": 40055 }, { "entropy": 5.325714015960694, "epoch": 4.499129555792666, "grad_norm": 0.9609375, "learning_rate": 0.000314588251505797, "loss": 4.8695, "mean_token_accuracy": 0.2348804384469986, "num_tokens": 89449122.0, "step": 40060 }, { "entropy": 5.347835111618042, "epoch": 4.499691132700623, "grad_norm": 1.046875, "learning_rate": 0.00031454872849679425, "loss": 4.9366, "mean_token_accuracy": 0.22788103371858598, "num_tokens": 89459195.0, "step": 40065 }, { "entropy": 5.268680095672607, "epoch": 4.500252709608581, "grad_norm": 1.0390625, "learning_rate": 0.0003145092042285446, "loss": 4.789, "mean_token_accuracy": 0.23398573249578475, "num_tokens": 89469967.0, "step": 40070 }, { "entropy": 5.341243076324463, "epoch": 4.500814286516539, "grad_norm": 0.91015625, "learning_rate": 0.0003144696787023066, "loss": 4.8431, "mean_token_accuracy": 0.23212233036756516, "num_tokens": 89481950.0, "step": 40075 }, { "entropy": 5.272696590423584, "epoch": 4.501375863424496, "grad_norm": 0.96484375, "learning_rate": 0.00031443015191933864, "loss": 4.8255, "mean_token_accuracy": 0.23381924778223037, "num_tokens": 89492915.0, "step": 40080 }, { "entropy": 5.277812194824219, "epoch": 4.501937440332454, "grad_norm": 1.140625, "learning_rate": 0.00031439062388089953, "loss": 4.8869, "mean_token_accuracy": 0.22860498130321502, "num_tokens": 89504384.0, "step": 40085 }, { "entropy": 5.404775810241699, "epoch": 4.502499017240411, "grad_norm": 0.97265625, "learning_rate": 0.0003143510945882475, "loss": 4.9358, "mean_token_accuracy": 0.22490473091602325, "num_tokens": 89515518.0, "step": 40090 }, { "entropy": 5.439474821090698, "epoch": 4.503060594148368, "grad_norm": 1.0078125, "learning_rate": 0.00031431156404264143, "loss": 4.9587, "mean_token_accuracy": 0.22579970210790634, "num_tokens": 89526538.0, "step": 40095 }, { "entropy": 5.3390813827514645, "epoch": 4.5036221710563265, "grad_norm": 1.0390625, "learning_rate": 0.00031427203224533996, "loss": 4.9226, "mean_token_accuracy": 0.22903421223163606, "num_tokens": 89537390.0, "step": 40100 }, { "entropy": 5.334399318695068, "epoch": 4.504183747964284, "grad_norm": 1.0234375, "learning_rate": 0.00031423249919760167, "loss": 4.8866, "mean_token_accuracy": 0.22707616537809372, "num_tokens": 89548691.0, "step": 40105 }, { "entropy": 5.329623985290527, "epoch": 4.504745324872241, "grad_norm": 0.98828125, "learning_rate": 0.0003141929649006854, "loss": 4.8949, "mean_token_accuracy": 0.22497119009494781, "num_tokens": 89559450.0, "step": 40110 }, { "entropy": 5.332333326339722, "epoch": 4.505306901780199, "grad_norm": 1.0859375, "learning_rate": 0.00031415342935585, "loss": 4.8419, "mean_token_accuracy": 0.23746279776096343, "num_tokens": 89570589.0, "step": 40115 }, { "entropy": 5.323142576217651, "epoch": 4.505868478688156, "grad_norm": 0.984375, "learning_rate": 0.0003141138925643542, "loss": 4.8848, "mean_token_accuracy": 0.2259846583008766, "num_tokens": 89581469.0, "step": 40120 }, { "entropy": 5.357850885391235, "epoch": 4.506430055596114, "grad_norm": 0.9765625, "learning_rate": 0.0003140743545274569, "loss": 4.9622, "mean_token_accuracy": 0.22668316960334778, "num_tokens": 89592023.0, "step": 40125 }, { "entropy": 5.26533203125, "epoch": 4.5069916325040715, "grad_norm": 0.98828125, "learning_rate": 0.00031403481524641696, "loss": 4.8291, "mean_token_accuracy": 0.235243821144104, "num_tokens": 89603270.0, "step": 40130 }, { "entropy": 5.344384098052979, "epoch": 4.507553209412029, "grad_norm": 0.9765625, "learning_rate": 0.00031399527472249336, "loss": 4.9773, "mean_token_accuracy": 0.22415419965982436, "num_tokens": 89614185.0, "step": 40135 }, { "entropy": 5.341907024383545, "epoch": 4.508114786319987, "grad_norm": 0.9453125, "learning_rate": 0.00031395573295694507, "loss": 4.9336, "mean_token_accuracy": 0.22465303242206575, "num_tokens": 89627245.0, "step": 40140 }, { "entropy": 5.321564149856568, "epoch": 4.508676363227944, "grad_norm": 1.0859375, "learning_rate": 0.00031391618995103116, "loss": 4.8264, "mean_token_accuracy": 0.2315902516245842, "num_tokens": 89638710.0, "step": 40145 }, { "entropy": 5.388982772827148, "epoch": 4.509237940135901, "grad_norm": 1.0, "learning_rate": 0.0003138766457060107, "loss": 4.9808, "mean_token_accuracy": 0.21901729702949524, "num_tokens": 89649658.0, "step": 40150 }, { "entropy": 5.292972230911255, "epoch": 4.509799517043859, "grad_norm": 0.95703125, "learning_rate": 0.0003138371002231427, "loss": 4.8668, "mean_token_accuracy": 0.23209239393472672, "num_tokens": 89659933.0, "step": 40155 }, { "entropy": 5.354555082321167, "epoch": 4.510361093951817, "grad_norm": 0.94140625, "learning_rate": 0.0003137975535036864, "loss": 4.9673, "mean_token_accuracy": 0.22156819105148315, "num_tokens": 89670790.0, "step": 40160 }, { "entropy": 5.4060704708099365, "epoch": 4.510922670859774, "grad_norm": 1.015625, "learning_rate": 0.00031375800554890094, "loss": 4.9362, "mean_token_accuracy": 0.2200278088450432, "num_tokens": 89682000.0, "step": 40165 }, { "entropy": 5.229625988006592, "epoch": 4.511484247767732, "grad_norm": 1.0, "learning_rate": 0.00031371845636004556, "loss": 4.7859, "mean_token_accuracy": 0.2404778555035591, "num_tokens": 89694058.0, "step": 40170 }, { "entropy": 5.298375177383423, "epoch": 4.512045824675689, "grad_norm": 0.9765625, "learning_rate": 0.0003136789059383795, "loss": 4.859, "mean_token_accuracy": 0.22841891944408416, "num_tokens": 89706074.0, "step": 40175 }, { "entropy": 5.395780611038208, "epoch": 4.512607401583647, "grad_norm": 0.95703125, "learning_rate": 0.0003136393542851622, "loss": 4.9415, "mean_token_accuracy": 0.22701324820518493, "num_tokens": 89716273.0, "step": 40180 }, { "entropy": 5.381328535079956, "epoch": 4.5131689784916045, "grad_norm": 1.015625, "learning_rate": 0.00031359980140165274, "loss": 4.9193, "mean_token_accuracy": 0.22792749106884003, "num_tokens": 89726354.0, "step": 40185 }, { "entropy": 5.387559843063355, "epoch": 4.513730555399562, "grad_norm": 0.953125, "learning_rate": 0.0003135602472891106, "loss": 4.9437, "mean_token_accuracy": 0.22242569476366042, "num_tokens": 89739554.0, "step": 40190 }, { "entropy": 5.351039552688599, "epoch": 4.51429213230752, "grad_norm": 1.0078125, "learning_rate": 0.00031352069194879527, "loss": 4.8613, "mean_token_accuracy": 0.2265229970216751, "num_tokens": 89750717.0, "step": 40195 }, { "entropy": 5.370640087127685, "epoch": 4.514853709215477, "grad_norm": 1.046875, "learning_rate": 0.0003134811353819662, "loss": 4.9433, "mean_token_accuracy": 0.22477404177188873, "num_tokens": 89762649.0, "step": 40200 }, { "entropy": 5.305569839477539, "epoch": 4.515415286123434, "grad_norm": 1.0, "learning_rate": 0.0003134415775898828, "loss": 4.9122, "mean_token_accuracy": 0.22367028445005416, "num_tokens": 89774364.0, "step": 40205 }, { "entropy": 5.421600103378296, "epoch": 4.515976863031392, "grad_norm": 1.046875, "learning_rate": 0.0003134020185738047, "loss": 5.0295, "mean_token_accuracy": 0.22122501730918884, "num_tokens": 89785526.0, "step": 40210 }, { "entropy": 5.31279239654541, "epoch": 4.51653843993935, "grad_norm": 1.0, "learning_rate": 0.00031336245833499146, "loss": 4.8332, "mean_token_accuracy": 0.23174857050180436, "num_tokens": 89797119.0, "step": 40215 }, { "entropy": 5.379166173934936, "epoch": 4.517100016847307, "grad_norm": 1.0078125, "learning_rate": 0.0003133228968747026, "loss": 5.037, "mean_token_accuracy": 0.21919465214014053, "num_tokens": 89810802.0, "step": 40220 }, { "entropy": 5.41801700592041, "epoch": 4.517661593755265, "grad_norm": 0.96484375, "learning_rate": 0.0003132833341941979, "loss": 4.9811, "mean_token_accuracy": 0.21967955976724624, "num_tokens": 89821879.0, "step": 40225 }, { "entropy": 5.403740119934082, "epoch": 4.518223170663222, "grad_norm": 1.015625, "learning_rate": 0.000313243770294737, "loss": 4.9014, "mean_token_accuracy": 0.23228334486484528, "num_tokens": 89832487.0, "step": 40230 }, { "entropy": 5.399937677383423, "epoch": 4.51878474757118, "grad_norm": 1.140625, "learning_rate": 0.00031320420517757955, "loss": 4.9822, "mean_token_accuracy": 0.2162322372198105, "num_tokens": 89844210.0, "step": 40235 }, { "entropy": 5.367661857604981, "epoch": 4.519346324479137, "grad_norm": 0.96875, "learning_rate": 0.0003131646388439854, "loss": 4.8947, "mean_token_accuracy": 0.2262765035033226, "num_tokens": 89856336.0, "step": 40240 }, { "entropy": 5.382241535186767, "epoch": 4.519907901387095, "grad_norm": 1.015625, "learning_rate": 0.0003131250712952144, "loss": 4.9765, "mean_token_accuracy": 0.22186087369918822, "num_tokens": 89868159.0, "step": 40245 }, { "entropy": 5.284571838378906, "epoch": 4.520469478295053, "grad_norm": 0.921875, "learning_rate": 0.00031308550253252634, "loss": 4.7611, "mean_token_accuracy": 0.23979784101247786, "num_tokens": 89879204.0, "step": 40250 }, { "entropy": 5.290581607818604, "epoch": 4.52103105520301, "grad_norm": 1.0625, "learning_rate": 0.00031304593255718113, "loss": 4.8251, "mean_token_accuracy": 0.23474963009357452, "num_tokens": 89889230.0, "step": 40255 }, { "entropy": 5.262454986572266, "epoch": 4.521592632110968, "grad_norm": 0.96875, "learning_rate": 0.00031300636137043857, "loss": 4.8696, "mean_token_accuracy": 0.2279553771018982, "num_tokens": 89900318.0, "step": 40260 }, { "entropy": 5.2942774295806885, "epoch": 4.522154209018925, "grad_norm": 0.95703125, "learning_rate": 0.00031296678897355877, "loss": 4.8483, "mean_token_accuracy": 0.22452975660562516, "num_tokens": 89911754.0, "step": 40265 }, { "entropy": 5.366271686553955, "epoch": 4.5227157859268825, "grad_norm": 1.0234375, "learning_rate": 0.0003129272153678017, "loss": 4.8512, "mean_token_accuracy": 0.2315245598554611, "num_tokens": 89922423.0, "step": 40270 }, { "entropy": 5.348597192764283, "epoch": 4.523277362834841, "grad_norm": 0.90234375, "learning_rate": 0.0003128876405544274, "loss": 4.8548, "mean_token_accuracy": 0.23298238664865495, "num_tokens": 89934275.0, "step": 40275 }, { "entropy": 5.313104200363159, "epoch": 4.523838939742798, "grad_norm": 1.09375, "learning_rate": 0.00031284806453469596, "loss": 4.8506, "mean_token_accuracy": 0.22207435518503188, "num_tokens": 89944636.0, "step": 40280 }, { "entropy": 5.4078912258148195, "epoch": 4.524400516650755, "grad_norm": 1.015625, "learning_rate": 0.00031280848730986735, "loss": 4.9168, "mean_token_accuracy": 0.23145437985658646, "num_tokens": 89955659.0, "step": 40285 }, { "entropy": 5.289071416854858, "epoch": 4.524962093558713, "grad_norm": 1.03125, "learning_rate": 0.0003127689088812019, "loss": 4.8783, "mean_token_accuracy": 0.2295724034309387, "num_tokens": 89967454.0, "step": 40290 }, { "entropy": 5.412450933456421, "epoch": 4.52552367046667, "grad_norm": 1.0390625, "learning_rate": 0.0003127293292499598, "loss": 4.9732, "mean_token_accuracy": 0.21798314154148102, "num_tokens": 89979080.0, "step": 40295 }, { "entropy": 5.312991809844971, "epoch": 4.526085247374628, "grad_norm": 0.9921875, "learning_rate": 0.0003126897484174012, "loss": 4.8492, "mean_token_accuracy": 0.22314361482858658, "num_tokens": 89989849.0, "step": 40300 }, { "entropy": 5.37908296585083, "epoch": 4.526646824282586, "grad_norm": 0.9609375, "learning_rate": 0.0003126501663847863, "loss": 4.9508, "mean_token_accuracy": 0.22751522660255433, "num_tokens": 90000352.0, "step": 40305 }, { "entropy": 5.462992000579834, "epoch": 4.527208401190543, "grad_norm": 0.9765625, "learning_rate": 0.0003126105831533756, "loss": 5.0095, "mean_token_accuracy": 0.2169117733836174, "num_tokens": 90011958.0, "step": 40310 }, { "entropy": 5.391449737548828, "epoch": 4.527769978098501, "grad_norm": 0.9609375, "learning_rate": 0.0003125709987244293, "loss": 4.8727, "mean_token_accuracy": 0.2298033729195595, "num_tokens": 90022951.0, "step": 40315 }, { "entropy": 5.321111059188842, "epoch": 4.528331555006458, "grad_norm": 0.97265625, "learning_rate": 0.00031253141309920784, "loss": 4.8817, "mean_token_accuracy": 0.22936664521694183, "num_tokens": 90034295.0, "step": 40320 }, { "entropy": 5.3699744701385494, "epoch": 4.5288931319144154, "grad_norm": 0.98046875, "learning_rate": 0.00031249182627897165, "loss": 4.9816, "mean_token_accuracy": 0.2253014475107193, "num_tokens": 90046552.0, "step": 40325 }, { "entropy": 5.3779387950897215, "epoch": 4.5294547088223736, "grad_norm": 0.93359375, "learning_rate": 0.00031245223826498116, "loss": 4.9502, "mean_token_accuracy": 0.21852296590805054, "num_tokens": 90057791.0, "step": 40330 }, { "entropy": 5.264748430252075, "epoch": 4.530016285730331, "grad_norm": 1.0078125, "learning_rate": 0.00031241264905849687, "loss": 4.818, "mean_token_accuracy": 0.2281045436859131, "num_tokens": 90069569.0, "step": 40335 }, { "entropy": 5.265216398239136, "epoch": 4.530577862638288, "grad_norm": 0.953125, "learning_rate": 0.00031237305866077926, "loss": 4.8169, "mean_token_accuracy": 0.2273932456970215, "num_tokens": 90080641.0, "step": 40340 }, { "entropy": 5.382593011856079, "epoch": 4.531139439546246, "grad_norm": 1.0859375, "learning_rate": 0.00031233346707308906, "loss": 4.91, "mean_token_accuracy": 0.224020154774189, "num_tokens": 90091755.0, "step": 40345 }, { "entropy": 5.403290939331055, "epoch": 4.531701016454203, "grad_norm": 1.046875, "learning_rate": 0.00031229387429668675, "loss": 4.9792, "mean_token_accuracy": 0.22800492495298386, "num_tokens": 90102731.0, "step": 40350 }, { "entropy": 5.21077151298523, "epoch": 4.5322625933621605, "grad_norm": 0.9921875, "learning_rate": 0.00031225428033283305, "loss": 4.8059, "mean_token_accuracy": 0.23273332715034484, "num_tokens": 90113660.0, "step": 40355 }, { "entropy": 5.346395969390869, "epoch": 4.532824170270119, "grad_norm": 1.0390625, "learning_rate": 0.0003122146851827886, "loss": 4.8593, "mean_token_accuracy": 0.2289905548095703, "num_tokens": 90124634.0, "step": 40360 }, { "entropy": 5.429896450042724, "epoch": 4.533385747178076, "grad_norm": 1.03125, "learning_rate": 0.00031217508884781413, "loss": 4.9815, "mean_token_accuracy": 0.21123291701078414, "num_tokens": 90135550.0, "step": 40365 }, { "entropy": 5.284555578231812, "epoch": 4.533947324086034, "grad_norm": 0.94140625, "learning_rate": 0.0003121354913291704, "loss": 4.7934, "mean_token_accuracy": 0.23622881323099137, "num_tokens": 90146151.0, "step": 40370 }, { "entropy": 5.22879467010498, "epoch": 4.534508900993991, "grad_norm": 1.0546875, "learning_rate": 0.0003120958926281182, "loss": 4.817, "mean_token_accuracy": 0.22975816428661347, "num_tokens": 90157680.0, "step": 40375 }, { "entropy": 5.280187702178955, "epoch": 4.535070477901948, "grad_norm": 0.98046875, "learning_rate": 0.00031205629274591844, "loss": 4.7982, "mean_token_accuracy": 0.23245138972997664, "num_tokens": 90168051.0, "step": 40380 }, { "entropy": 5.277214527130127, "epoch": 4.5356320548099065, "grad_norm": 0.9921875, "learning_rate": 0.00031201669168383193, "loss": 4.787, "mean_token_accuracy": 0.23422672748565673, "num_tokens": 90179995.0, "step": 40385 }, { "entropy": 5.305891227722168, "epoch": 4.536193631717864, "grad_norm": 0.94921875, "learning_rate": 0.00031197708944311964, "loss": 4.8998, "mean_token_accuracy": 0.2319309875369072, "num_tokens": 90189714.0, "step": 40390 }, { "entropy": 5.38742036819458, "epoch": 4.536755208625821, "grad_norm": 1.125, "learning_rate": 0.0003119374860250425, "loss": 4.9339, "mean_token_accuracy": 0.22491195648908616, "num_tokens": 90200830.0, "step": 40395 }, { "entropy": 5.324993896484375, "epoch": 4.537316785533779, "grad_norm": 0.91015625, "learning_rate": 0.0003118978814308614, "loss": 4.9422, "mean_token_accuracy": 0.2188737392425537, "num_tokens": 90213032.0, "step": 40400 }, { "entropy": 5.340184926986694, "epoch": 4.537878362441736, "grad_norm": 1.0390625, "learning_rate": 0.0003118582756618375, "loss": 4.8767, "mean_token_accuracy": 0.2289588302373886, "num_tokens": 90224788.0, "step": 40405 }, { "entropy": 5.287873840332031, "epoch": 4.5384399393496935, "grad_norm": 0.9296875, "learning_rate": 0.0003118186687192318, "loss": 4.9559, "mean_token_accuracy": 0.22336844801902772, "num_tokens": 90237142.0, "step": 40410 }, { "entropy": 5.35399899482727, "epoch": 4.539001516257652, "grad_norm": 1.0078125, "learning_rate": 0.00031177906060430536, "loss": 4.8413, "mean_token_accuracy": 0.23093292117118835, "num_tokens": 90247327.0, "step": 40415 }, { "entropy": 5.234691047668457, "epoch": 4.539563093165609, "grad_norm": 0.9921875, "learning_rate": 0.00031173945131831936, "loss": 4.7822, "mean_token_accuracy": 0.2365085706114769, "num_tokens": 90258416.0, "step": 40420 }, { "entropy": 5.303056335449218, "epoch": 4.540124670073567, "grad_norm": 1.1015625, "learning_rate": 0.000311699840862535, "loss": 4.9064, "mean_token_accuracy": 0.22568028569221496, "num_tokens": 90269700.0, "step": 40425 }, { "entropy": 5.319293546676636, "epoch": 4.540686246981524, "grad_norm": 1.21875, "learning_rate": 0.0003116602292382135, "loss": 4.8414, "mean_token_accuracy": 0.23040542602539063, "num_tokens": 90280181.0, "step": 40430 }, { "entropy": 5.417269039154053, "epoch": 4.541247823889481, "grad_norm": 1.0, "learning_rate": 0.00031162061644661606, "loss": 4.9532, "mean_token_accuracy": 0.22350662350654601, "num_tokens": 90291317.0, "step": 40435 }, { "entropy": 5.3964598178863525, "epoch": 4.5418094007974394, "grad_norm": 1.0078125, "learning_rate": 0.000311581002489004, "loss": 4.9388, "mean_token_accuracy": 0.2275594025850296, "num_tokens": 90302462.0, "step": 40440 }, { "entropy": 5.313172626495361, "epoch": 4.542370977705397, "grad_norm": 1.0625, "learning_rate": 0.0003115413873666387, "loss": 4.8323, "mean_token_accuracy": 0.22701680660247803, "num_tokens": 90312432.0, "step": 40445 }, { "entropy": 5.261250972747803, "epoch": 4.542932554613355, "grad_norm": 0.953125, "learning_rate": 0.0003115017710807813, "loss": 4.9177, "mean_token_accuracy": 0.22395511567592621, "num_tokens": 90323445.0, "step": 40450 }, { "entropy": 5.370176076889038, "epoch": 4.543494131521312, "grad_norm": 1.0546875, "learning_rate": 0.0003114621536326934, "loss": 4.9225, "mean_token_accuracy": 0.22511665225028993, "num_tokens": 90334445.0, "step": 40455 }, { "entropy": 5.425312042236328, "epoch": 4.544055708429269, "grad_norm": 0.90625, "learning_rate": 0.0003114225350236365, "loss": 4.9495, "mean_token_accuracy": 0.22874351292848588, "num_tokens": 90346679.0, "step": 40460 }, { "entropy": 5.310408639907837, "epoch": 4.544617285337227, "grad_norm": 0.92578125, "learning_rate": 0.0003113829152548719, "loss": 4.8225, "mean_token_accuracy": 0.23328294605016708, "num_tokens": 90358643.0, "step": 40465 }, { "entropy": 5.292751359939575, "epoch": 4.5451788622451845, "grad_norm": 0.96875, "learning_rate": 0.0003113432943276611, "loss": 4.9076, "mean_token_accuracy": 0.22950988560914992, "num_tokens": 90369401.0, "step": 40470 }, { "entropy": 5.318414306640625, "epoch": 4.545740439153142, "grad_norm": 0.92578125, "learning_rate": 0.00031130367224326585, "loss": 4.8328, "mean_token_accuracy": 0.23486417829990386, "num_tokens": 90380671.0, "step": 40475 }, { "entropy": 5.328016233444214, "epoch": 4.5463020160611, "grad_norm": 1.015625, "learning_rate": 0.0003112640490029475, "loss": 4.9005, "mean_token_accuracy": 0.23132936507463456, "num_tokens": 90392123.0, "step": 40480 }, { "entropy": 5.32335352897644, "epoch": 4.546863592969057, "grad_norm": 0.93359375, "learning_rate": 0.00031122442460796774, "loss": 4.862, "mean_token_accuracy": 0.22665992081165315, "num_tokens": 90404441.0, "step": 40485 }, { "entropy": 5.398189926147461, "epoch": 4.547425169877014, "grad_norm": 1.09375, "learning_rate": 0.0003111847990595883, "loss": 5.0414, "mean_token_accuracy": 0.22558159083127977, "num_tokens": 90415281.0, "step": 40490 }, { "entropy": 5.295166778564453, "epoch": 4.547986746784972, "grad_norm": 0.9921875, "learning_rate": 0.0003111451723590708, "loss": 4.8067, "mean_token_accuracy": 0.23319427520036698, "num_tokens": 90424719.0, "step": 40495 }, { "entropy": 5.39511079788208, "epoch": 4.54854832369293, "grad_norm": 1.0, "learning_rate": 0.000311105544507677, "loss": 4.9834, "mean_token_accuracy": 0.22110475897789, "num_tokens": 90436335.0, "step": 40500 }, { "entropy": 5.329921913146973, "epoch": 4.549109900600888, "grad_norm": 0.9609375, "learning_rate": 0.00031106591550666865, "loss": 4.8887, "mean_token_accuracy": 0.22687437683343886, "num_tokens": 90449268.0, "step": 40505 }, { "entropy": 5.451831960678101, "epoch": 4.549671477508845, "grad_norm": 1.046875, "learning_rate": 0.0003110262853573076, "loss": 5.0151, "mean_token_accuracy": 0.22151652723550797, "num_tokens": 90460974.0, "step": 40510 }, { "entropy": 5.400880479812622, "epoch": 4.550233054416802, "grad_norm": 1.0078125, "learning_rate": 0.0003109866540608556, "loss": 4.987, "mean_token_accuracy": 0.2195681020617485, "num_tokens": 90472988.0, "step": 40515 }, { "entropy": 5.422921991348266, "epoch": 4.55079463132476, "grad_norm": 1.0078125, "learning_rate": 0.00031094702161857455, "loss": 5.0262, "mean_token_accuracy": 0.22243448048830033, "num_tokens": 90484737.0, "step": 40520 }, { "entropy": 5.2891241073608395, "epoch": 4.5513562082327175, "grad_norm": 1.0390625, "learning_rate": 0.00031090738803172646, "loss": 4.7905, "mean_token_accuracy": 0.23159411400556565, "num_tokens": 90496015.0, "step": 40525 }, { "entropy": 5.314245319366455, "epoch": 4.551917785140675, "grad_norm": 0.96875, "learning_rate": 0.00031086775330157324, "loss": 4.8422, "mean_token_accuracy": 0.23718664795160294, "num_tokens": 90507709.0, "step": 40530 }, { "entropy": 5.309314727783203, "epoch": 4.552479362048633, "grad_norm": 0.9375, "learning_rate": 0.0003108281174293768, "loss": 4.8623, "mean_token_accuracy": 0.2331332355737686, "num_tokens": 90520167.0, "step": 40535 }, { "entropy": 5.279068565368652, "epoch": 4.55304093895659, "grad_norm": 1.015625, "learning_rate": 0.00031078848041639926, "loss": 4.8861, "mean_token_accuracy": 0.23162511140108108, "num_tokens": 90531797.0, "step": 40540 }, { "entropy": 5.392660665512085, "epoch": 4.553602515864547, "grad_norm": 1.09375, "learning_rate": 0.00031074884226390246, "loss": 4.9164, "mean_token_accuracy": 0.22987184375524522, "num_tokens": 90542201.0, "step": 40545 }, { "entropy": 5.359649515151977, "epoch": 4.554164092772505, "grad_norm": 0.94140625, "learning_rate": 0.0003107092029731488, "loss": 4.8886, "mean_token_accuracy": 0.23862247914075851, "num_tokens": 90553906.0, "step": 40550 }, { "entropy": 5.227881956100464, "epoch": 4.5547256696804626, "grad_norm": 1.0390625, "learning_rate": 0.00031066956254540025, "loss": 4.7347, "mean_token_accuracy": 0.23676453828811644, "num_tokens": 90564839.0, "step": 40555 }, { "entropy": 5.382263612747193, "epoch": 4.555287246588421, "grad_norm": 1.0625, "learning_rate": 0.00031062992098191897, "loss": 4.9635, "mean_token_accuracy": 0.2199525222182274, "num_tokens": 90575252.0, "step": 40560 }, { "entropy": 5.2524830341339115, "epoch": 4.555848823496378, "grad_norm": 1.0234375, "learning_rate": 0.0003105902782839672, "loss": 4.802, "mean_token_accuracy": 0.23877596259117126, "num_tokens": 90585676.0, "step": 40565 }, { "entropy": 5.338509941101075, "epoch": 4.556410400404335, "grad_norm": 0.95703125, "learning_rate": 0.0003105506344528071, "loss": 4.9928, "mean_token_accuracy": 0.2235603451728821, "num_tokens": 90597453.0, "step": 40570 }, { "entropy": 5.314253330230713, "epoch": 4.556971977312293, "grad_norm": 1.0546875, "learning_rate": 0.000310510989489701, "loss": 4.8579, "mean_token_accuracy": 0.23660089522600175, "num_tokens": 90608318.0, "step": 40575 }, { "entropy": 5.2612395763397215, "epoch": 4.55753355422025, "grad_norm": 0.984375, "learning_rate": 0.00031047134339591136, "loss": 4.8328, "mean_token_accuracy": 0.23319352567195892, "num_tokens": 90618627.0, "step": 40580 }, { "entropy": 5.291187429428101, "epoch": 4.558095131128208, "grad_norm": 1.0, "learning_rate": 0.00031043169617270033, "loss": 4.8885, "mean_token_accuracy": 0.22365162074565886, "num_tokens": 90630150.0, "step": 40585 }, { "entropy": 5.297217941284179, "epoch": 4.558656708036166, "grad_norm": 1.0703125, "learning_rate": 0.00031039204782133033, "loss": 4.8092, "mean_token_accuracy": 0.23420062363147737, "num_tokens": 90640882.0, "step": 40590 }, { "entropy": 5.3987876892089846, "epoch": 4.559218284944123, "grad_norm": 0.953125, "learning_rate": 0.0003103523983430638, "loss": 4.974, "mean_token_accuracy": 0.22469801008701323, "num_tokens": 90652473.0, "step": 40595 }, { "entropy": 5.304210233688354, "epoch": 4.55977986185208, "grad_norm": 1.0234375, "learning_rate": 0.00031031274773916326, "loss": 4.902, "mean_token_accuracy": 0.231027489900589, "num_tokens": 90663547.0, "step": 40600 }, { "entropy": 5.325047206878662, "epoch": 4.560341438760038, "grad_norm": 1.0078125, "learning_rate": 0.00031027309601089104, "loss": 4.8957, "mean_token_accuracy": 0.2282556712627411, "num_tokens": 90675093.0, "step": 40605 }, { "entropy": 5.340421915054321, "epoch": 4.5609030156679955, "grad_norm": 0.9765625, "learning_rate": 0.0003102334431595098, "loss": 4.8321, "mean_token_accuracy": 0.22638730257749556, "num_tokens": 90687648.0, "step": 40610 }, { "entropy": 5.365055513381958, "epoch": 4.561464592575954, "grad_norm": 1.0234375, "learning_rate": 0.00031019378918628203, "loss": 4.8961, "mean_token_accuracy": 0.2288220167160034, "num_tokens": 90698075.0, "step": 40615 }, { "entropy": 5.262012147903443, "epoch": 4.562026169483911, "grad_norm": 0.9921875, "learning_rate": 0.00031015413409247046, "loss": 4.8771, "mean_token_accuracy": 0.22785797715187073, "num_tokens": 90708864.0, "step": 40620 }, { "entropy": 5.378125715255737, "epoch": 4.562587746391868, "grad_norm": 1.03125, "learning_rate": 0.00031011447787933756, "loss": 4.9882, "mean_token_accuracy": 0.2218271091580391, "num_tokens": 90719789.0, "step": 40625 }, { "entropy": 5.350632429122925, "epoch": 4.563149323299826, "grad_norm": 1.1171875, "learning_rate": 0.0003100748205481461, "loss": 4.9655, "mean_token_accuracy": 0.21992011666297911, "num_tokens": 90732643.0, "step": 40630 }, { "entropy": 5.300983238220215, "epoch": 4.563710900207783, "grad_norm": 1.1015625, "learning_rate": 0.0003100351621001587, "loss": 4.7888, "mean_token_accuracy": 0.24004290103912354, "num_tokens": 90742412.0, "step": 40635 }, { "entropy": 5.336408042907715, "epoch": 4.5642724771157415, "grad_norm": 1.015625, "learning_rate": 0.0003099955025366382, "loss": 4.8898, "mean_token_accuracy": 0.22885123044252395, "num_tokens": 90753372.0, "step": 40640 }, { "entropy": 5.24726414680481, "epoch": 4.564834054023699, "grad_norm": 0.98828125, "learning_rate": 0.00030995584185884733, "loss": 4.7906, "mean_token_accuracy": 0.23425825387239457, "num_tokens": 90763517.0, "step": 40645 }, { "entropy": 5.294766807556153, "epoch": 4.565395630931656, "grad_norm": 1.1171875, "learning_rate": 0.0003099161800680488, "loss": 4.8977, "mean_token_accuracy": 0.22073613107204437, "num_tokens": 90773870.0, "step": 40650 }, { "entropy": 5.253192043304443, "epoch": 4.565957207839614, "grad_norm": 0.9375, "learning_rate": 0.0003098765171655056, "loss": 4.7924, "mean_token_accuracy": 0.2357379451394081, "num_tokens": 90784423.0, "step": 40655 }, { "entropy": 5.358261966705323, "epoch": 4.566518784747571, "grad_norm": 1.015625, "learning_rate": 0.0003098368531524806, "loss": 4.9438, "mean_token_accuracy": 0.22183917313814164, "num_tokens": 90795332.0, "step": 40660 }, { "entropy": 5.292052745819092, "epoch": 4.567080361655528, "grad_norm": 0.99609375, "learning_rate": 0.0003097971880302367, "loss": 4.8101, "mean_token_accuracy": 0.2326342284679413, "num_tokens": 90805995.0, "step": 40665 }, { "entropy": 5.220079612731934, "epoch": 4.5676419385634865, "grad_norm": 0.89453125, "learning_rate": 0.00030975752180003674, "loss": 4.8226, "mean_token_accuracy": 0.23068981617689133, "num_tokens": 90817925.0, "step": 40670 }, { "entropy": 5.2120285987854, "epoch": 4.568203515471444, "grad_norm": 1.0390625, "learning_rate": 0.000309717854463144, "loss": 4.8221, "mean_token_accuracy": 0.23476998507976532, "num_tokens": 90829042.0, "step": 40675 }, { "entropy": 5.400878286361694, "epoch": 4.568765092379401, "grad_norm": 0.96484375, "learning_rate": 0.0003096781860208211, "loss": 4.8642, "mean_token_accuracy": 0.23612628728151322, "num_tokens": 90840559.0, "step": 40680 }, { "entropy": 5.379316902160644, "epoch": 4.569326669287359, "grad_norm": 0.9921875, "learning_rate": 0.0003096385164743314, "loss": 4.8379, "mean_token_accuracy": 0.24086399227380753, "num_tokens": 90851009.0, "step": 40685 }, { "entropy": 5.3228983879089355, "epoch": 4.569888246195316, "grad_norm": 1.015625, "learning_rate": 0.00030959884582493793, "loss": 4.8992, "mean_token_accuracy": 0.23333416134119034, "num_tokens": 90861698.0, "step": 40690 }, { "entropy": 5.184554624557495, "epoch": 4.570449823103274, "grad_norm": 1.0078125, "learning_rate": 0.0003095591740739038, "loss": 4.8339, "mean_token_accuracy": 0.23177196383476256, "num_tokens": 90871745.0, "step": 40695 }, { "entropy": 5.343463516235351, "epoch": 4.571011400011232, "grad_norm": 0.99609375, "learning_rate": 0.0003095195012224921, "loss": 4.9103, "mean_token_accuracy": 0.2241009756922722, "num_tokens": 90882401.0, "step": 40700 }, { "entropy": 5.326072359085083, "epoch": 4.571572976919189, "grad_norm": 1.296875, "learning_rate": 0.0003094798272719661, "loss": 4.7055, "mean_token_accuracy": 0.258037306368351, "num_tokens": 90895024.0, "step": 40705 }, { "entropy": 5.185869550704956, "epoch": 4.572134553827147, "grad_norm": 1.0078125, "learning_rate": 0.00030944015222358906, "loss": 4.7491, "mean_token_accuracy": 0.2403952047228813, "num_tokens": 90906414.0, "step": 40710 }, { "entropy": 5.260491752624512, "epoch": 4.572696130735104, "grad_norm": 0.98046875, "learning_rate": 0.00030940047607862415, "loss": 4.8642, "mean_token_accuracy": 0.23044947683811187, "num_tokens": 90916950.0, "step": 40715 }, { "entropy": 5.361950874328613, "epoch": 4.573257707643061, "grad_norm": 0.984375, "learning_rate": 0.0003093607988383348, "loss": 4.9124, "mean_token_accuracy": 0.22891452312469482, "num_tokens": 90928721.0, "step": 40720 }, { "entropy": 5.387753868103028, "epoch": 4.5738192845510195, "grad_norm": 1.0546875, "learning_rate": 0.0003093211205039842, "loss": 4.9655, "mean_token_accuracy": 0.2205940991640091, "num_tokens": 90940768.0, "step": 40725 }, { "entropy": 5.366475200653076, "epoch": 4.574380861458977, "grad_norm": 0.9140625, "learning_rate": 0.0003092814410768359, "loss": 4.8285, "mean_token_accuracy": 0.23287745714187622, "num_tokens": 90952822.0, "step": 40730 }, { "entropy": 5.391913270950317, "epoch": 4.574942438366934, "grad_norm": 1.0546875, "learning_rate": 0.00030924176055815327, "loss": 4.9342, "mean_token_accuracy": 0.23330748975276946, "num_tokens": 90964380.0, "step": 40735 }, { "entropy": 5.3014203071594235, "epoch": 4.575504015274892, "grad_norm": 1.0390625, "learning_rate": 0.00030920207894919957, "loss": 4.8333, "mean_token_accuracy": 0.22261991053819657, "num_tokens": 90975597.0, "step": 40740 }, { "entropy": 5.262994909286499, "epoch": 4.576065592182849, "grad_norm": 0.94140625, "learning_rate": 0.0003091623962512385, "loss": 4.9322, "mean_token_accuracy": 0.22532882690429687, "num_tokens": 90989451.0, "step": 40745 }, { "entropy": 5.304627418518066, "epoch": 4.576627169090807, "grad_norm": 0.93359375, "learning_rate": 0.00030912271246553346, "loss": 4.8262, "mean_token_accuracy": 0.23263555616140366, "num_tokens": 91001367.0, "step": 40750 }, { "entropy": 5.285611629486084, "epoch": 4.577188745998765, "grad_norm": 1.0546875, "learning_rate": 0.000309083027593348, "loss": 4.8536, "mean_token_accuracy": 0.22785632610321044, "num_tokens": 91012951.0, "step": 40755 }, { "entropy": 5.312336874008179, "epoch": 4.577750322906722, "grad_norm": 0.9921875, "learning_rate": 0.00030904334163594577, "loss": 4.8695, "mean_token_accuracy": 0.2307036966085434, "num_tokens": 91024400.0, "step": 40760 }, { "entropy": 5.408748435974121, "epoch": 4.57831189981468, "grad_norm": 0.9921875, "learning_rate": 0.0003090036545945904, "loss": 4.9505, "mean_token_accuracy": 0.22507032752037048, "num_tokens": 91035802.0, "step": 40765 }, { "entropy": 5.324979972839356, "epoch": 4.578873476722637, "grad_norm": 1.0546875, "learning_rate": 0.00030896396647054535, "loss": 4.8842, "mean_token_accuracy": 0.23229270577430725, "num_tokens": 91046546.0, "step": 40770 }, { "entropy": 5.271066331863404, "epoch": 4.579435053630594, "grad_norm": 1.0078125, "learning_rate": 0.0003089242772650744, "loss": 4.8923, "mean_token_accuracy": 0.22811909168958663, "num_tokens": 91057000.0, "step": 40775 }, { "entropy": 5.441847038269043, "epoch": 4.579996630538552, "grad_norm": 0.96484375, "learning_rate": 0.00030888458697944144, "loss": 4.9626, "mean_token_accuracy": 0.21965378671884536, "num_tokens": 91067910.0, "step": 40780 }, { "entropy": 5.487842416763305, "epoch": 4.58055820744651, "grad_norm": 1.03125, "learning_rate": 0.00030884489561491005, "loss": 4.9852, "mean_token_accuracy": 0.22289651334285737, "num_tokens": 91078914.0, "step": 40785 }, { "entropy": 5.313452100753784, "epoch": 4.581119784354467, "grad_norm": 1.0390625, "learning_rate": 0.000308805203172744, "loss": 4.8844, "mean_token_accuracy": 0.23024605661630632, "num_tokens": 91089448.0, "step": 40790 }, { "entropy": 5.273844957351685, "epoch": 4.581681361262425, "grad_norm": 1.09375, "learning_rate": 0.00030876550965420725, "loss": 4.8724, "mean_token_accuracy": 0.22996511906385422, "num_tokens": 91099533.0, "step": 40795 }, { "entropy": 5.386033630371093, "epoch": 4.582242938170382, "grad_norm": 0.94140625, "learning_rate": 0.0003087258150605635, "loss": 4.913, "mean_token_accuracy": 0.22366792261600493, "num_tokens": 91111926.0, "step": 40800 }, { "entropy": 5.405502557754517, "epoch": 4.58280451507834, "grad_norm": 1.0546875, "learning_rate": 0.0003086861193930767, "loss": 4.8721, "mean_token_accuracy": 0.22700327336788179, "num_tokens": 91122782.0, "step": 40805 }, { "entropy": 5.332604122161865, "epoch": 4.5833660919862975, "grad_norm": 0.98828125, "learning_rate": 0.0003086464226530109, "loss": 4.8946, "mean_token_accuracy": 0.22845852822065355, "num_tokens": 91133626.0, "step": 40810 }, { "entropy": 5.2289458274841305, "epoch": 4.583927668894255, "grad_norm": 1.0625, "learning_rate": 0.00030860672484162987, "loss": 4.77, "mean_token_accuracy": 0.23419603556394578, "num_tokens": 91143362.0, "step": 40815 }, { "entropy": 5.272774934768677, "epoch": 4.584489245802213, "grad_norm": 0.96484375, "learning_rate": 0.0003085670259601977, "loss": 4.79, "mean_token_accuracy": 0.23499622493982314, "num_tokens": 91154603.0, "step": 40820 }, { "entropy": 5.385566091537475, "epoch": 4.58505082271017, "grad_norm": 0.953125, "learning_rate": 0.00030852732600997846, "loss": 4.9767, "mean_token_accuracy": 0.2247173622250557, "num_tokens": 91166750.0, "step": 40825 }, { "entropy": 5.35115795135498, "epoch": 4.585612399618128, "grad_norm": 1.0546875, "learning_rate": 0.00030848762499223616, "loss": 4.8027, "mean_token_accuracy": 0.2329890936613083, "num_tokens": 91176042.0, "step": 40830 }, { "entropy": 5.321157169342041, "epoch": 4.586173976526085, "grad_norm": 0.92578125, "learning_rate": 0.0003084479229082348, "loss": 4.8771, "mean_token_accuracy": 0.22412883788347243, "num_tokens": 91187895.0, "step": 40835 }, { "entropy": 5.291553211212158, "epoch": 4.586735553434043, "grad_norm": 0.99609375, "learning_rate": 0.0003084082197592387, "loss": 4.9277, "mean_token_accuracy": 0.22413255870342255, "num_tokens": 91198740.0, "step": 40840 }, { "entropy": 5.277764701843262, "epoch": 4.587297130342001, "grad_norm": 1.046875, "learning_rate": 0.00030836851554651184, "loss": 4.844, "mean_token_accuracy": 0.22957988530397416, "num_tokens": 91209663.0, "step": 40845 }, { "entropy": 5.363742065429688, "epoch": 4.587858707249958, "grad_norm": 1.0, "learning_rate": 0.00030832881027131854, "loss": 4.8936, "mean_token_accuracy": 0.23161114752292633, "num_tokens": 91221277.0, "step": 40850 }, { "entropy": 5.306375646591187, "epoch": 4.588420284157915, "grad_norm": 1.0, "learning_rate": 0.00030828910393492306, "loss": 4.8602, "mean_token_accuracy": 0.2298295110464096, "num_tokens": 91232265.0, "step": 40855 }, { "entropy": 5.290942907333374, "epoch": 4.588981861065873, "grad_norm": 0.96484375, "learning_rate": 0.00030824939653858953, "loss": 4.9229, "mean_token_accuracy": 0.22888291776180267, "num_tokens": 91243935.0, "step": 40860 }, { "entropy": 5.398237037658691, "epoch": 4.5895434379738305, "grad_norm": 1.1015625, "learning_rate": 0.00030820968808358223, "loss": 4.9557, "mean_token_accuracy": 0.2222931370139122, "num_tokens": 91253760.0, "step": 40865 }, { "entropy": 5.336049747467041, "epoch": 4.590105014881788, "grad_norm": 0.984375, "learning_rate": 0.00030816997857116573, "loss": 4.8601, "mean_token_accuracy": 0.2296506568789482, "num_tokens": 91265777.0, "step": 40870 }, { "entropy": 5.354352760314941, "epoch": 4.590666591789746, "grad_norm": 1.15625, "learning_rate": 0.0003081302680026042, "loss": 4.9149, "mean_token_accuracy": 0.2320181354880333, "num_tokens": 91276439.0, "step": 40875 }, { "entropy": 5.376702070236206, "epoch": 4.591228168697703, "grad_norm": 1.0546875, "learning_rate": 0.000308090556379162, "loss": 4.9478, "mean_token_accuracy": 0.22121851593255998, "num_tokens": 91286330.0, "step": 40880 }, { "entropy": 5.290316724777222, "epoch": 4.591789745605661, "grad_norm": 1.0, "learning_rate": 0.00030805084370210377, "loss": 4.7859, "mean_token_accuracy": 0.22543356269598008, "num_tokens": 91296547.0, "step": 40885 }, { "entropy": 5.279999113082885, "epoch": 4.592351322513618, "grad_norm": 0.8515625, "learning_rate": 0.00030801112997269386, "loss": 4.9268, "mean_token_accuracy": 0.22081861793994903, "num_tokens": 91309412.0, "step": 40890 }, { "entropy": 5.2870221614837645, "epoch": 4.5929128994215755, "grad_norm": 0.9921875, "learning_rate": 0.0003079714151921967, "loss": 4.789, "mean_token_accuracy": 0.23933058828115464, "num_tokens": 91319939.0, "step": 40895 }, { "entropy": 5.351127576828003, "epoch": 4.593474476329534, "grad_norm": 0.92578125, "learning_rate": 0.00030793169936187695, "loss": 4.953, "mean_token_accuracy": 0.2269701838493347, "num_tokens": 91331579.0, "step": 40900 }, { "entropy": 5.338293409347534, "epoch": 4.594036053237491, "grad_norm": 0.984375, "learning_rate": 0.00030789198248299906, "loss": 4.9199, "mean_token_accuracy": 0.22708901464939119, "num_tokens": 91344365.0, "step": 40905 }, { "entropy": 5.330491781234741, "epoch": 4.594597630145448, "grad_norm": 0.9921875, "learning_rate": 0.00030785226455682773, "loss": 4.8527, "mean_token_accuracy": 0.2328613057732582, "num_tokens": 91354701.0, "step": 40910 }, { "entropy": 5.266106414794922, "epoch": 4.595159207053406, "grad_norm": 1.0859375, "learning_rate": 0.0003078125455846276, "loss": 4.7734, "mean_token_accuracy": 0.23115283697843553, "num_tokens": 91365052.0, "step": 40915 }, { "entropy": 5.287390232086182, "epoch": 4.595720783961363, "grad_norm": 1.0703125, "learning_rate": 0.00030777282556766316, "loss": 4.8945, "mean_token_accuracy": 0.22954680472612382, "num_tokens": 91376399.0, "step": 40920 }, { "entropy": 5.284762620925903, "epoch": 4.596282360869321, "grad_norm": 0.95703125, "learning_rate": 0.00030773310450719937, "loss": 4.7835, "mean_token_accuracy": 0.2330758184194565, "num_tokens": 91388042.0, "step": 40925 }, { "entropy": 5.305308866500854, "epoch": 4.596843937777279, "grad_norm": 1.0625, "learning_rate": 0.0003076933824045008, "loss": 4.8654, "mean_token_accuracy": 0.23301891535520552, "num_tokens": 91400167.0, "step": 40930 }, { "entropy": 5.3915486335754395, "epoch": 4.597405514685236, "grad_norm": 1.1796875, "learning_rate": 0.00030765365926083214, "loss": 5.0179, "mean_token_accuracy": 0.22003554701805114, "num_tokens": 91412335.0, "step": 40935 }, { "entropy": 5.307770299911499, "epoch": 4.597967091593194, "grad_norm": 0.96875, "learning_rate": 0.0003076139350774584, "loss": 4.8756, "mean_token_accuracy": 0.22711893320083618, "num_tokens": 91423879.0, "step": 40940 }, { "entropy": 5.330508375167847, "epoch": 4.598528668501151, "grad_norm": 1.046875, "learning_rate": 0.0003075742098556444, "loss": 4.878, "mean_token_accuracy": 0.23118707090616225, "num_tokens": 91434104.0, "step": 40945 }, { "entropy": 5.348813819885254, "epoch": 4.5990902454091085, "grad_norm": 0.9609375, "learning_rate": 0.0003075344835966548, "loss": 4.9018, "mean_token_accuracy": 0.2258077308535576, "num_tokens": 91445019.0, "step": 40950 }, { "entropy": 5.38912992477417, "epoch": 4.599651822317067, "grad_norm": 0.9375, "learning_rate": 0.0003074947563017547, "loss": 4.916, "mean_token_accuracy": 0.23124136477708818, "num_tokens": 91457100.0, "step": 40955 }, { "entropy": 5.333905029296875, "epoch": 4.600213399225024, "grad_norm": 0.90625, "learning_rate": 0.0003074550279722089, "loss": 4.9075, "mean_token_accuracy": 0.22788846641778945, "num_tokens": 91468354.0, "step": 40960 }, { "entropy": 5.368706130981446, "epoch": 4.600774976132981, "grad_norm": 0.91015625, "learning_rate": 0.0003074152986092825, "loss": 4.904, "mean_token_accuracy": 0.2223096787929535, "num_tokens": 91480017.0, "step": 40965 }, { "entropy": 5.396568965911865, "epoch": 4.601336553040939, "grad_norm": 1.1328125, "learning_rate": 0.0003073755682142404, "loss": 4.9691, "mean_token_accuracy": 0.22397394478321075, "num_tokens": 91492387.0, "step": 40970 }, { "entropy": 5.2795093059539795, "epoch": 4.601898129948896, "grad_norm": 0.96484375, "learning_rate": 0.00030733583678834765, "loss": 4.9197, "mean_token_accuracy": 0.22602591514587403, "num_tokens": 91504095.0, "step": 40975 }, { "entropy": 5.353981018066406, "epoch": 4.602459706856854, "grad_norm": 1.0625, "learning_rate": 0.00030729610433286926, "loss": 4.9288, "mean_token_accuracy": 0.22745669931173323, "num_tokens": 91515298.0, "step": 40980 }, { "entropy": 5.3391400337219235, "epoch": 4.603021283764812, "grad_norm": 1.0390625, "learning_rate": 0.00030725637084907037, "loss": 4.8146, "mean_token_accuracy": 0.2257561355829239, "num_tokens": 91525337.0, "step": 40985 }, { "entropy": 5.336915397644043, "epoch": 4.603582860672769, "grad_norm": 0.98828125, "learning_rate": 0.0003072166363382162, "loss": 4.9205, "mean_token_accuracy": 0.23640895783901214, "num_tokens": 91536555.0, "step": 40990 }, { "entropy": 5.362166452407837, "epoch": 4.604144437580727, "grad_norm": 0.96875, "learning_rate": 0.0003071769008015717, "loss": 4.974, "mean_token_accuracy": 0.221169313788414, "num_tokens": 91546726.0, "step": 40995 }, { "entropy": 5.352299976348877, "epoch": 4.604706014488684, "grad_norm": 1.0390625, "learning_rate": 0.0003071371642404024, "loss": 4.8943, "mean_token_accuracy": 0.22462376058101655, "num_tokens": 91556509.0, "step": 41000 }, { "entropy": 5.353421449661255, "epoch": 4.605267591396641, "grad_norm": 0.97265625, "learning_rate": 0.0003070974266559732, "loss": 4.9346, "mean_token_accuracy": 0.2244385302066803, "num_tokens": 91567144.0, "step": 41005 }, { "entropy": 5.325935792922974, "epoch": 4.6058291683045995, "grad_norm": 1.0390625, "learning_rate": 0.0003070576880495495, "loss": 4.8477, "mean_token_accuracy": 0.2386883243918419, "num_tokens": 91577901.0, "step": 41010 }, { "entropy": 5.374489164352417, "epoch": 4.606390745212557, "grad_norm": 1.0625, "learning_rate": 0.0003070179484223966, "loss": 4.9508, "mean_token_accuracy": 0.22217340767383575, "num_tokens": 91588071.0, "step": 41015 }, { "entropy": 5.343785095214844, "epoch": 4.606952322120515, "grad_norm": 0.9765625, "learning_rate": 0.0003069782077757797, "loss": 4.9874, "mean_token_accuracy": 0.22150601893663407, "num_tokens": 91599378.0, "step": 41020 }, { "entropy": 5.336264562606812, "epoch": 4.607513899028472, "grad_norm": 1.0, "learning_rate": 0.00030693846611096437, "loss": 4.8386, "mean_token_accuracy": 0.23400854468345642, "num_tokens": 91609551.0, "step": 41025 }, { "entropy": 5.399582624435425, "epoch": 4.608075475936429, "grad_norm": 1.0234375, "learning_rate": 0.00030689872342921595, "loss": 4.8935, "mean_token_accuracy": 0.22892725467681885, "num_tokens": 91619440.0, "step": 41030 }, { "entropy": 5.301528549194336, "epoch": 4.608637052844387, "grad_norm": 1.1171875, "learning_rate": 0.00030685897973179967, "loss": 4.8723, "mean_token_accuracy": 0.23370989859104158, "num_tokens": 91629992.0, "step": 41035 }, { "entropy": 5.365511465072632, "epoch": 4.609198629752345, "grad_norm": 1.0625, "learning_rate": 0.00030681923501998124, "loss": 4.9344, "mean_token_accuracy": 0.23325403183698654, "num_tokens": 91640874.0, "step": 41040 }, { "entropy": 5.3338416576385494, "epoch": 4.609760206660302, "grad_norm": 1.0, "learning_rate": 0.00030677948929502596, "loss": 4.8342, "mean_token_accuracy": 0.24024593383073806, "num_tokens": 91651427.0, "step": 41045 }, { "entropy": 5.2986249923706055, "epoch": 4.61032178356826, "grad_norm": 0.93359375, "learning_rate": 0.00030673974255819944, "loss": 4.8458, "mean_token_accuracy": 0.22677867710590363, "num_tokens": 91662799.0, "step": 41050 }, { "entropy": 5.414012241363525, "epoch": 4.610883360476217, "grad_norm": 1.0, "learning_rate": 0.0003066999948107672, "loss": 5.0032, "mean_token_accuracy": 0.22121190577745437, "num_tokens": 91673334.0, "step": 41055 }, { "entropy": 5.288450908660889, "epoch": 4.611444937384174, "grad_norm": 0.921875, "learning_rate": 0.0003066602460539948, "loss": 4.8713, "mean_token_accuracy": 0.22822053134441375, "num_tokens": 91684098.0, "step": 41060 }, { "entropy": 5.289797401428222, "epoch": 4.6120065142921325, "grad_norm": 0.96875, "learning_rate": 0.00030662049628914787, "loss": 4.8682, "mean_token_accuracy": 0.22806766927242278, "num_tokens": 91696100.0, "step": 41065 }, { "entropy": 5.267695426940918, "epoch": 4.61256809120009, "grad_norm": 0.9375, "learning_rate": 0.0003065807455174921, "loss": 4.8, "mean_token_accuracy": 0.22593198716640472, "num_tokens": 91707890.0, "step": 41070 }, { "entropy": 5.356400966644287, "epoch": 4.613129668108048, "grad_norm": 1.0, "learning_rate": 0.0003065409937402932, "loss": 4.9534, "mean_token_accuracy": 0.22129171192646027, "num_tokens": 91718311.0, "step": 41075 }, { "entropy": 5.304121732711792, "epoch": 4.613691245016005, "grad_norm": 0.9765625, "learning_rate": 0.00030650124095881674, "loss": 4.8808, "mean_token_accuracy": 0.231160768866539, "num_tokens": 91729859.0, "step": 41080 }, { "entropy": 5.322818565368652, "epoch": 4.614252821923962, "grad_norm": 1.0390625, "learning_rate": 0.00030646148717432855, "loss": 4.8719, "mean_token_accuracy": 0.23038736283779143, "num_tokens": 91741174.0, "step": 41085 }, { "entropy": 5.367798900604248, "epoch": 4.61481439883192, "grad_norm": 0.96875, "learning_rate": 0.00030642173238809453, "loss": 4.9948, "mean_token_accuracy": 0.22266789078712462, "num_tokens": 91752858.0, "step": 41090 }, { "entropy": 5.321347570419311, "epoch": 4.615375975739878, "grad_norm": 1.0234375, "learning_rate": 0.0003063819766013802, "loss": 4.8427, "mean_token_accuracy": 0.2348729968070984, "num_tokens": 91762819.0, "step": 41095 }, { "entropy": 5.334008502960205, "epoch": 4.615937552647835, "grad_norm": 1.0703125, "learning_rate": 0.0003063422198154516, "loss": 4.8768, "mean_token_accuracy": 0.23042566925287247, "num_tokens": 91773838.0, "step": 41100 }, { "entropy": 5.277377796173096, "epoch": 4.616499129555793, "grad_norm": 0.953125, "learning_rate": 0.0003063024620315746, "loss": 4.8235, "mean_token_accuracy": 0.23049089908599854, "num_tokens": 91784660.0, "step": 41105 }, { "entropy": 5.341361331939697, "epoch": 4.61706070646375, "grad_norm": 0.96484375, "learning_rate": 0.0003062627032510151, "loss": 4.9454, "mean_token_accuracy": 0.21505187600851058, "num_tokens": 91795368.0, "step": 41110 }, { "entropy": 5.417652225494384, "epoch": 4.617622283371707, "grad_norm": 0.8984375, "learning_rate": 0.000306222943475039, "loss": 4.9624, "mean_token_accuracy": 0.23059315234422684, "num_tokens": 91805280.0, "step": 41115 }, { "entropy": 5.399887037277222, "epoch": 4.618183860279665, "grad_norm": 0.9296875, "learning_rate": 0.0003061831827049123, "loss": 5.0135, "mean_token_accuracy": 0.22373663187026976, "num_tokens": 91816130.0, "step": 41120 }, { "entropy": 5.4240926742553714, "epoch": 4.618745437187623, "grad_norm": 1.0078125, "learning_rate": 0.00030614342094190095, "loss": 4.9613, "mean_token_accuracy": 0.2261948063969612, "num_tokens": 91827513.0, "step": 41125 }, { "entropy": 5.3655694961547855, "epoch": 4.619307014095581, "grad_norm": 0.98046875, "learning_rate": 0.00030610365818727097, "loss": 4.9345, "mean_token_accuracy": 0.22804270088672637, "num_tokens": 91838284.0, "step": 41130 }, { "entropy": 5.316544675827027, "epoch": 4.619868591003538, "grad_norm": 1.0703125, "learning_rate": 0.0003060638944422884, "loss": 4.8584, "mean_token_accuracy": 0.22981217205524446, "num_tokens": 91848801.0, "step": 41135 }, { "entropy": 5.292419815063477, "epoch": 4.620430167911495, "grad_norm": 0.94921875, "learning_rate": 0.00030602412970821944, "loss": 4.9014, "mean_token_accuracy": 0.2280547708272934, "num_tokens": 91860740.0, "step": 41140 }, { "entropy": 5.375370216369629, "epoch": 4.620991744819453, "grad_norm": 0.96484375, "learning_rate": 0.0003059843639863301, "loss": 4.9566, "mean_token_accuracy": 0.222332464158535, "num_tokens": 91872020.0, "step": 41145 }, { "entropy": 5.3890430450439455, "epoch": 4.6215533217274105, "grad_norm": 1.015625, "learning_rate": 0.00030594459727788665, "loss": 4.901, "mean_token_accuracy": 0.22961317747831345, "num_tokens": 91882100.0, "step": 41150 }, { "entropy": 5.363692569732666, "epoch": 4.622114898635368, "grad_norm": 0.90625, "learning_rate": 0.00030590482958415524, "loss": 4.9012, "mean_token_accuracy": 0.22560274600982666, "num_tokens": 91894014.0, "step": 41155 }, { "entropy": 5.34701623916626, "epoch": 4.622676475543326, "grad_norm": 0.98046875, "learning_rate": 0.00030586506090640205, "loss": 4.8628, "mean_token_accuracy": 0.2359864130616188, "num_tokens": 91905759.0, "step": 41160 }, { "entropy": 5.411273765563965, "epoch": 4.623238052451283, "grad_norm": 1.140625, "learning_rate": 0.0003058252912458933, "loss": 4.9149, "mean_token_accuracy": 0.2238863155245781, "num_tokens": 91916833.0, "step": 41165 }, { "entropy": 5.285590600967407, "epoch": 4.62379962935924, "grad_norm": 0.97265625, "learning_rate": 0.0003057855206038954, "loss": 4.7766, "mean_token_accuracy": 0.2355724960565567, "num_tokens": 91927672.0, "step": 41170 }, { "entropy": 5.1173614978790285, "epoch": 4.624361206267198, "grad_norm": 0.9921875, "learning_rate": 0.0003057457489816745, "loss": 4.7266, "mean_token_accuracy": 0.2390070453286171, "num_tokens": 91938283.0, "step": 41175 }, { "entropy": 5.258405876159668, "epoch": 4.624922783175156, "grad_norm": 1.046875, "learning_rate": 0.0003057059763804971, "loss": 4.8582, "mean_token_accuracy": 0.2263607934117317, "num_tokens": 91948764.0, "step": 41180 }, { "entropy": 5.344851398468018, "epoch": 4.625484360083114, "grad_norm": 0.9375, "learning_rate": 0.0003056662028016295, "loss": 4.9874, "mean_token_accuracy": 0.22238798588514327, "num_tokens": 91960110.0, "step": 41185 }, { "entropy": 5.2690558433532715, "epoch": 4.626045936991071, "grad_norm": 0.97265625, "learning_rate": 0.00030562642824633805, "loss": 4.7058, "mean_token_accuracy": 0.2409820333123207, "num_tokens": 91971084.0, "step": 41190 }, { "entropy": 5.332602167129517, "epoch": 4.626607513899028, "grad_norm": 0.9921875, "learning_rate": 0.0003055866527158893, "loss": 4.8789, "mean_token_accuracy": 0.23012007772922516, "num_tokens": 91983373.0, "step": 41195 }, { "entropy": 5.2721282005310055, "epoch": 4.627169090806986, "grad_norm": 0.96484375, "learning_rate": 0.0003055468762115497, "loss": 4.8905, "mean_token_accuracy": 0.23763176649808884, "num_tokens": 91995000.0, "step": 41200 }, { "entropy": 5.26688323020935, "epoch": 4.6277306677149435, "grad_norm": 0.97265625, "learning_rate": 0.00030550709873458567, "loss": 4.8143, "mean_token_accuracy": 0.23237926810979842, "num_tokens": 92007486.0, "step": 41205 }, { "entropy": 5.425273418426514, "epoch": 4.628292244622902, "grad_norm": 1.0078125, "learning_rate": 0.00030546732028626373, "loss": 4.9415, "mean_token_accuracy": 0.22674815207719803, "num_tokens": 92018415.0, "step": 41210 }, { "entropy": 5.357337379455567, "epoch": 4.628853821530859, "grad_norm": 0.96484375, "learning_rate": 0.00030542754086785055, "loss": 4.9024, "mean_token_accuracy": 0.2338629424571991, "num_tokens": 92030463.0, "step": 41215 }, { "entropy": 5.3753925323486325, "epoch": 4.629415398438816, "grad_norm": 0.97265625, "learning_rate": 0.0003053877604806127, "loss": 4.9898, "mean_token_accuracy": 0.21690915077924727, "num_tokens": 92042284.0, "step": 41220 }, { "entropy": 5.4021471500396725, "epoch": 4.629976975346774, "grad_norm": 1.046875, "learning_rate": 0.00030534797912581664, "loss": 4.9351, "mean_token_accuracy": 0.23072191178798676, "num_tokens": 92052719.0, "step": 41225 }, { "entropy": 5.251800012588501, "epoch": 4.630538552254731, "grad_norm": 1.0546875, "learning_rate": 0.00030530819680472926, "loss": 4.8161, "mean_token_accuracy": 0.22958330512046815, "num_tokens": 92062986.0, "step": 41230 }, { "entropy": 5.373140621185303, "epoch": 4.6311001291626885, "grad_norm": 1.15625, "learning_rate": 0.00030526841351861717, "loss": 4.8384, "mean_token_accuracy": 0.2295661225914955, "num_tokens": 92073192.0, "step": 41235 }, { "entropy": 5.326973962783813, "epoch": 4.631661706070647, "grad_norm": 0.9921875, "learning_rate": 0.00030522862926874697, "loss": 4.8963, "mean_token_accuracy": 0.23133132606744766, "num_tokens": 92084304.0, "step": 41240 }, { "entropy": 5.375598669052124, "epoch": 4.632223282978604, "grad_norm": 0.98046875, "learning_rate": 0.0003051888440563855, "loss": 4.9113, "mean_token_accuracy": 0.22796494513750076, "num_tokens": 92095660.0, "step": 41245 }, { "entropy": 5.3735638618469235, "epoch": 4.632784859886561, "grad_norm": 0.890625, "learning_rate": 0.0003051490578827996, "loss": 4.9798, "mean_token_accuracy": 0.2177684262394905, "num_tokens": 92107822.0, "step": 41250 }, { "entropy": 5.436110973358154, "epoch": 4.633346436794519, "grad_norm": 0.94921875, "learning_rate": 0.00030510927074925594, "loss": 5.0038, "mean_token_accuracy": 0.21619817912578582, "num_tokens": 92119054.0, "step": 41255 }, { "entropy": 5.2532689571380615, "epoch": 4.633908013702476, "grad_norm": 1.0390625, "learning_rate": 0.00030506948265702144, "loss": 4.7733, "mean_token_accuracy": 0.23836730122566224, "num_tokens": 92130007.0, "step": 41260 }, { "entropy": 5.285567045211792, "epoch": 4.6344695906104345, "grad_norm": 1.015625, "learning_rate": 0.000305029693607363, "loss": 4.871, "mean_token_accuracy": 0.2373387858271599, "num_tokens": 92140059.0, "step": 41265 }, { "entropy": 5.27090744972229, "epoch": 4.635031167518392, "grad_norm": 1.0390625, "learning_rate": 0.00030498990360154746, "loss": 4.8625, "mean_token_accuracy": 0.2302174985408783, "num_tokens": 92151024.0, "step": 41270 }, { "entropy": 5.303188896179199, "epoch": 4.635592744426349, "grad_norm": 0.953125, "learning_rate": 0.00030495011264084165, "loss": 4.8778, "mean_token_accuracy": 0.233488130569458, "num_tokens": 92162799.0, "step": 41275 }, { "entropy": 5.2864104270935055, "epoch": 4.636154321334307, "grad_norm": 0.9921875, "learning_rate": 0.00030491032072651266, "loss": 4.8333, "mean_token_accuracy": 0.2376761704683304, "num_tokens": 92173772.0, "step": 41280 }, { "entropy": 5.328063106536865, "epoch": 4.636715898242264, "grad_norm": 1.015625, "learning_rate": 0.00030487052785982757, "loss": 4.8348, "mean_token_accuracy": 0.23393264561891555, "num_tokens": 92184365.0, "step": 41285 }, { "entropy": 5.360870695114135, "epoch": 4.6372774751502215, "grad_norm": 1.0390625, "learning_rate": 0.0003048307340420532, "loss": 4.9841, "mean_token_accuracy": 0.2175539642572403, "num_tokens": 92196457.0, "step": 41290 }, { "entropy": 5.282446622848511, "epoch": 4.63783905205818, "grad_norm": 1.0234375, "learning_rate": 0.0003047909392744566, "loss": 4.8165, "mean_token_accuracy": 0.23035632818937302, "num_tokens": 92206885.0, "step": 41295 }, { "entropy": 5.367913389205933, "epoch": 4.638400628966137, "grad_norm": 1.0546875, "learning_rate": 0.00030475114355830513, "loss": 4.8733, "mean_token_accuracy": 0.2326648160815239, "num_tokens": 92218488.0, "step": 41300 }, { "entropy": 5.279191637039185, "epoch": 4.638962205874094, "grad_norm": 0.96484375, "learning_rate": 0.00030471134689486563, "loss": 4.7892, "mean_token_accuracy": 0.23354291319847106, "num_tokens": 92230439.0, "step": 41305 }, { "entropy": 5.32328987121582, "epoch": 4.639523782782052, "grad_norm": 1.015625, "learning_rate": 0.0003046715492854053, "loss": 4.8769, "mean_token_accuracy": 0.2314096674323082, "num_tokens": 92240299.0, "step": 41310 }, { "entropy": 5.338251447677612, "epoch": 4.640085359690009, "grad_norm": 1.0703125, "learning_rate": 0.00030463175073119133, "loss": 4.9715, "mean_token_accuracy": 0.22575788348913192, "num_tokens": 92252867.0, "step": 41315 }, { "entropy": 5.311400127410889, "epoch": 4.6406469365979675, "grad_norm": 1.046875, "learning_rate": 0.00030459195123349095, "loss": 4.8708, "mean_token_accuracy": 0.22691351622343064, "num_tokens": 92263960.0, "step": 41320 }, { "entropy": 5.281176424026489, "epoch": 4.641208513505925, "grad_norm": 0.9609375, "learning_rate": 0.0003045521507935714, "loss": 4.845, "mean_token_accuracy": 0.23200464397668838, "num_tokens": 92276179.0, "step": 41325 }, { "entropy": 5.3044219493865965, "epoch": 4.641770090413882, "grad_norm": 0.89453125, "learning_rate": 0.0003045123494126999, "loss": 4.798, "mean_token_accuracy": 0.23357588797807693, "num_tokens": 92286474.0, "step": 41330 }, { "entropy": 5.295082378387451, "epoch": 4.64233166732184, "grad_norm": 0.99609375, "learning_rate": 0.0003044725470921437, "loss": 4.9303, "mean_token_accuracy": 0.22580238580703735, "num_tokens": 92297611.0, "step": 41335 }, { "entropy": 5.293924999237061, "epoch": 4.642893244229797, "grad_norm": 1.0625, "learning_rate": 0.0003044327438331702, "loss": 4.8159, "mean_token_accuracy": 0.2321597844362259, "num_tokens": 92308882.0, "step": 41340 }, { "entropy": 5.290621137619018, "epoch": 4.643454821137754, "grad_norm": 0.95703125, "learning_rate": 0.0003043929396370467, "loss": 4.8014, "mean_token_accuracy": 0.23470281511545182, "num_tokens": 92320439.0, "step": 41345 }, { "entropy": 5.3831390857696535, "epoch": 4.6440163980457125, "grad_norm": 0.98828125, "learning_rate": 0.00030435313450504056, "loss": 4.8743, "mean_token_accuracy": 0.22893356680870056, "num_tokens": 92330550.0, "step": 41350 }, { "entropy": 5.265456962585449, "epoch": 4.64457797495367, "grad_norm": 1.0546875, "learning_rate": 0.0003043133284384193, "loss": 4.8254, "mean_token_accuracy": 0.23077475279569626, "num_tokens": 92341079.0, "step": 41355 }, { "entropy": 5.331912612915039, "epoch": 4.645139551861627, "grad_norm": 1.0234375, "learning_rate": 0.0003042735214384503, "loss": 4.9176, "mean_token_accuracy": 0.2233578383922577, "num_tokens": 92351995.0, "step": 41360 }, { "entropy": 5.284488344192505, "epoch": 4.645701128769585, "grad_norm": 1.0546875, "learning_rate": 0.000304233713506401, "loss": 4.855, "mean_token_accuracy": 0.2372998610138893, "num_tokens": 92362329.0, "step": 41365 }, { "entropy": 5.267970371246338, "epoch": 4.646262705677542, "grad_norm": 1.0703125, "learning_rate": 0.0003041939046435389, "loss": 4.8076, "mean_token_accuracy": 0.2321912929415703, "num_tokens": 92372662.0, "step": 41370 }, { "entropy": 5.414710283279419, "epoch": 4.6468242825855, "grad_norm": 1.09375, "learning_rate": 0.00030415409485113156, "loss": 5.0801, "mean_token_accuracy": 0.21449503302574158, "num_tokens": 92382727.0, "step": 41375 }, { "entropy": 5.406077146530151, "epoch": 4.647385859493458, "grad_norm": 1.0390625, "learning_rate": 0.00030411428413044657, "loss": 4.88, "mean_token_accuracy": 0.22908592075109482, "num_tokens": 92394034.0, "step": 41380 }, { "entropy": 5.31969633102417, "epoch": 4.647947436401415, "grad_norm": 0.9609375, "learning_rate": 0.00030407447248275137, "loss": 4.8812, "mean_token_accuracy": 0.2302614524960518, "num_tokens": 92404652.0, "step": 41385 }, { "entropy": 5.266722106933594, "epoch": 4.648509013309373, "grad_norm": 1.0546875, "learning_rate": 0.0003040346599093138, "loss": 4.8002, "mean_token_accuracy": 0.23170799911022186, "num_tokens": 92415220.0, "step": 41390 }, { "entropy": 5.1992593765258786, "epoch": 4.64907059021733, "grad_norm": 0.9765625, "learning_rate": 0.0003039948464114014, "loss": 4.7576, "mean_token_accuracy": 0.23910584747791291, "num_tokens": 92425584.0, "step": 41395 }, { "entropy": 5.372399234771729, "epoch": 4.649632167125288, "grad_norm": 0.99609375, "learning_rate": 0.00030395503199028186, "loss": 4.918, "mean_token_accuracy": 0.23162589073181153, "num_tokens": 92436298.0, "step": 41400 }, { "entropy": 5.2505110740661625, "epoch": 4.6501937440332455, "grad_norm": 1.0390625, "learning_rate": 0.0003039152166472228, "loss": 4.8666, "mean_token_accuracy": 0.22725290507078172, "num_tokens": 92446778.0, "step": 41405 }, { "entropy": 5.314688396453858, "epoch": 4.650755320941203, "grad_norm": 0.95703125, "learning_rate": 0.0003038754003834921, "loss": 4.8789, "mean_token_accuracy": 0.22880032062530517, "num_tokens": 92457922.0, "step": 41410 }, { "entropy": 5.348233461380005, "epoch": 4.651316897849161, "grad_norm": 0.984375, "learning_rate": 0.00030383558320035744, "loss": 4.9461, "mean_token_accuracy": 0.22798738330602647, "num_tokens": 92470155.0, "step": 41415 }, { "entropy": 5.369081640243531, "epoch": 4.651878474757118, "grad_norm": 0.93359375, "learning_rate": 0.00030379576509908656, "loss": 4.9218, "mean_token_accuracy": 0.22573762238025666, "num_tokens": 92480862.0, "step": 41420 }, { "entropy": 5.342126369476318, "epoch": 4.652440051665075, "grad_norm": 1.015625, "learning_rate": 0.00030375594608094737, "loss": 4.9307, "mean_token_accuracy": 0.22417790740728377, "num_tokens": 92491867.0, "step": 41425 }, { "entropy": 5.328060436248779, "epoch": 4.653001628573033, "grad_norm": 0.9453125, "learning_rate": 0.0003037161261472078, "loss": 4.9169, "mean_token_accuracy": 0.23198655545711516, "num_tokens": 92503104.0, "step": 41430 }, { "entropy": 5.243779850006104, "epoch": 4.653563205480991, "grad_norm": 0.9140625, "learning_rate": 0.00030367630529913554, "loss": 4.834, "mean_token_accuracy": 0.22172652333974838, "num_tokens": 92514825.0, "step": 41435 }, { "entropy": 5.329059886932373, "epoch": 4.654124782388948, "grad_norm": 1.0078125, "learning_rate": 0.00030363648353799857, "loss": 4.9291, "mean_token_accuracy": 0.22627724558115006, "num_tokens": 92525764.0, "step": 41440 }, { "entropy": 5.382903814315796, "epoch": 4.654686359296906, "grad_norm": 1.0390625, "learning_rate": 0.00030359666086506493, "loss": 4.9274, "mean_token_accuracy": 0.2252148285508156, "num_tokens": 92536025.0, "step": 41445 }, { "entropy": 5.473212862014771, "epoch": 4.655247936204863, "grad_norm": 0.9375, "learning_rate": 0.00030355683728160247, "loss": 5.0373, "mean_token_accuracy": 0.21357335448265075, "num_tokens": 92547917.0, "step": 41450 }, { "entropy": 5.347277116775513, "epoch": 4.655809513112821, "grad_norm": 1.0078125, "learning_rate": 0.0003035170127888793, "loss": 4.8632, "mean_token_accuracy": 0.23422294110059738, "num_tokens": 92558637.0, "step": 41455 }, { "entropy": 5.366068506240845, "epoch": 4.656371090020778, "grad_norm": 1.0703125, "learning_rate": 0.00030347718738816333, "loss": 4.887, "mean_token_accuracy": 0.2264869973063469, "num_tokens": 92570110.0, "step": 41460 }, { "entropy": 5.3393982410430905, "epoch": 4.656932666928736, "grad_norm": 1.0390625, "learning_rate": 0.00030343736108072266, "loss": 4.9377, "mean_token_accuracy": 0.229929219186306, "num_tokens": 92579974.0, "step": 41465 }, { "entropy": 5.312402963638306, "epoch": 4.657494243836694, "grad_norm": 1.0078125, "learning_rate": 0.0003033975338678254, "loss": 4.9021, "mean_token_accuracy": 0.2270752504467964, "num_tokens": 92590202.0, "step": 41470 }, { "entropy": 5.315021419525147, "epoch": 4.658055820744651, "grad_norm": 0.9375, "learning_rate": 0.00030335770575073967, "loss": 4.8415, "mean_token_accuracy": 0.23187289983034134, "num_tokens": 92601525.0, "step": 41475 }, { "entropy": 5.3786262512207035, "epoch": 4.658617397652608, "grad_norm": 1.0390625, "learning_rate": 0.0003033178767307336, "loss": 4.8503, "mean_token_accuracy": 0.22999364733695984, "num_tokens": 92611055.0, "step": 41480 }, { "entropy": 5.343531465530395, "epoch": 4.659178974560566, "grad_norm": 1.0390625, "learning_rate": 0.0003032780468090753, "loss": 4.8961, "mean_token_accuracy": 0.22033920139074326, "num_tokens": 92621337.0, "step": 41485 }, { "entropy": 5.230831623077393, "epoch": 4.6597405514685235, "grad_norm": 1.0078125, "learning_rate": 0.0003032382159870331, "loss": 4.7953, "mean_token_accuracy": 0.23890607208013534, "num_tokens": 92632174.0, "step": 41490 }, { "entropy": 5.323486042022705, "epoch": 4.660302128376481, "grad_norm": 0.94921875, "learning_rate": 0.00030319838426587505, "loss": 4.877, "mean_token_accuracy": 0.22932358533143998, "num_tokens": 92643667.0, "step": 41495 }, { "entropy": 5.353532075881958, "epoch": 4.660863705284439, "grad_norm": 1.015625, "learning_rate": 0.00030315855164686956, "loss": 4.8935, "mean_token_accuracy": 0.23287750035524368, "num_tokens": 92654945.0, "step": 41500 }, { "entropy": 5.32953462600708, "epoch": 4.661425282192396, "grad_norm": 0.96484375, "learning_rate": 0.0003031187181312848, "loss": 4.9649, "mean_token_accuracy": 0.2186361402273178, "num_tokens": 92666136.0, "step": 41505 }, { "entropy": 5.372505855560303, "epoch": 4.661986859100354, "grad_norm": 1.1328125, "learning_rate": 0.00030307888372038927, "loss": 4.8085, "mean_token_accuracy": 0.23596761822700502, "num_tokens": 92676683.0, "step": 41510 }, { "entropy": 5.360294771194458, "epoch": 4.662548436008311, "grad_norm": 1.046875, "learning_rate": 0.00030303904841545113, "loss": 4.9098, "mean_token_accuracy": 0.22208456844091415, "num_tokens": 92687313.0, "step": 41515 }, { "entropy": 5.292513227462768, "epoch": 4.663110012916269, "grad_norm": 0.953125, "learning_rate": 0.0003029992122177388, "loss": 4.8253, "mean_token_accuracy": 0.2298249512910843, "num_tokens": 92699760.0, "step": 41520 }, { "entropy": 5.360175466537475, "epoch": 4.663671589824227, "grad_norm": 1.0, "learning_rate": 0.00030295937512852075, "loss": 4.9438, "mean_token_accuracy": 0.22484273314476014, "num_tokens": 92710893.0, "step": 41525 }, { "entropy": 5.280935907363892, "epoch": 4.664233166732184, "grad_norm": 0.9921875, "learning_rate": 0.0003029195371490652, "loss": 4.8445, "mean_token_accuracy": 0.23224566578865052, "num_tokens": 92722992.0, "step": 41530 }, { "entropy": 5.26893048286438, "epoch": 4.664794743640142, "grad_norm": 0.9140625, "learning_rate": 0.00030287969828064087, "loss": 4.8641, "mean_token_accuracy": 0.2277648627758026, "num_tokens": 92734084.0, "step": 41535 }, { "entropy": 5.309473371505737, "epoch": 4.665356320548099, "grad_norm": 0.94921875, "learning_rate": 0.00030283985852451624, "loss": 4.851, "mean_token_accuracy": 0.23623912632465363, "num_tokens": 92745666.0, "step": 41540 }, { "entropy": 5.324749994277954, "epoch": 4.6659178974560565, "grad_norm": 0.94140625, "learning_rate": 0.0003028000178819596, "loss": 4.8436, "mean_token_accuracy": 0.23884017765522003, "num_tokens": 92756403.0, "step": 41545 }, { "entropy": 5.295525646209716, "epoch": 4.666479474364014, "grad_norm": 1.0234375, "learning_rate": 0.00030276017635423965, "loss": 4.9446, "mean_token_accuracy": 0.22796893417835234, "num_tokens": 92767838.0, "step": 41550 }, { "entropy": 5.3345067501068115, "epoch": 4.667041051271972, "grad_norm": 1.03125, "learning_rate": 0.00030272033394262483, "loss": 4.834, "mean_token_accuracy": 0.23367543667554855, "num_tokens": 92779515.0, "step": 41555 }, { "entropy": 5.286647129058838, "epoch": 4.667602628179929, "grad_norm": 0.96875, "learning_rate": 0.00030268049064838395, "loss": 4.8136, "mean_token_accuracy": 0.23452157378196717, "num_tokens": 92790965.0, "step": 41560 }, { "entropy": 5.340078210830688, "epoch": 4.668164205087887, "grad_norm": 0.9921875, "learning_rate": 0.00030264064647278537, "loss": 4.9618, "mean_token_accuracy": 0.22167731523513795, "num_tokens": 92802059.0, "step": 41565 }, { "entropy": 5.350535154342651, "epoch": 4.668725781995844, "grad_norm": 1.03125, "learning_rate": 0.000302600801417098, "loss": 4.9167, "mean_token_accuracy": 0.226625494658947, "num_tokens": 92814190.0, "step": 41570 }, { "entropy": 5.338301801681519, "epoch": 4.6692873589038015, "grad_norm": 0.92578125, "learning_rate": 0.00030256095548259035, "loss": 4.8448, "mean_token_accuracy": 0.2266266882419586, "num_tokens": 92825247.0, "step": 41575 }, { "entropy": 5.411154270172119, "epoch": 4.66984893581176, "grad_norm": 1.125, "learning_rate": 0.0003025211086705312, "loss": 4.9026, "mean_token_accuracy": 0.22971309274435042, "num_tokens": 92835155.0, "step": 41580 }, { "entropy": 5.3078932762146, "epoch": 4.670410512719717, "grad_norm": 0.9609375, "learning_rate": 0.0003024812609821893, "loss": 4.8819, "mean_token_accuracy": 0.22828188836574553, "num_tokens": 92846357.0, "step": 41585 }, { "entropy": 5.304434871673584, "epoch": 4.670972089627675, "grad_norm": 0.9921875, "learning_rate": 0.0003024414124188333, "loss": 4.8542, "mean_token_accuracy": 0.23285400122404099, "num_tokens": 92856438.0, "step": 41590 }, { "entropy": 5.409440422058106, "epoch": 4.671533666535632, "grad_norm": 0.99609375, "learning_rate": 0.0003024015629817322, "loss": 4.9675, "mean_token_accuracy": 0.2270009458065033, "num_tokens": 92867748.0, "step": 41595 }, { "entropy": 5.276484870910645, "epoch": 4.672095243443589, "grad_norm": 1.0703125, "learning_rate": 0.0003023617126721547, "loss": 4.7571, "mean_token_accuracy": 0.23525290340185165, "num_tokens": 92879566.0, "step": 41600 }, { "entropy": 5.331803178787231, "epoch": 4.6726568203515475, "grad_norm": 0.95703125, "learning_rate": 0.0003023218614913696, "loss": 4.8793, "mean_token_accuracy": 0.23209280520677567, "num_tokens": 92891659.0, "step": 41605 }, { "entropy": 5.319676065444947, "epoch": 4.673218397259505, "grad_norm": 0.94921875, "learning_rate": 0.0003022820094406458, "loss": 4.8791, "mean_token_accuracy": 0.23009195327758789, "num_tokens": 92903076.0, "step": 41610 }, { "entropy": 5.264736366271973, "epoch": 4.673779974167462, "grad_norm": 1.0625, "learning_rate": 0.0003022421565212524, "loss": 4.8133, "mean_token_accuracy": 0.2326295256614685, "num_tokens": 92913087.0, "step": 41615 }, { "entropy": 5.306989049911499, "epoch": 4.67434155107542, "grad_norm": 0.95703125, "learning_rate": 0.00030220230273445806, "loss": 4.8349, "mean_token_accuracy": 0.23474291414022447, "num_tokens": 92924063.0, "step": 41620 }, { "entropy": 5.400181293487549, "epoch": 4.674903127983377, "grad_norm": 0.984375, "learning_rate": 0.00030216244808153186, "loss": 5.063, "mean_token_accuracy": 0.21812464892864228, "num_tokens": 92934795.0, "step": 41625 }, { "entropy": 5.317264747619629, "epoch": 4.6754647048913345, "grad_norm": 0.984375, "learning_rate": 0.0003021225925637428, "loss": 4.8503, "mean_token_accuracy": 0.2366244837641716, "num_tokens": 92946171.0, "step": 41630 }, { "entropy": 5.398207187652588, "epoch": 4.676026281799293, "grad_norm": 0.98828125, "learning_rate": 0.0003020827361823598, "loss": 4.955, "mean_token_accuracy": 0.22650111168622972, "num_tokens": 92957131.0, "step": 41635 }, { "entropy": 5.35333743095398, "epoch": 4.67658785870725, "grad_norm": 1.0703125, "learning_rate": 0.00030204287893865204, "loss": 4.9666, "mean_token_accuracy": 0.2263099581003189, "num_tokens": 92968982.0, "step": 41640 }, { "entropy": 5.325126266479492, "epoch": 4.677149435615208, "grad_norm": 0.98046875, "learning_rate": 0.00030200302083388856, "loss": 4.9133, "mean_token_accuracy": 0.22723960727453232, "num_tokens": 92980378.0, "step": 41645 }, { "entropy": 5.380585956573486, "epoch": 4.677711012523165, "grad_norm": 0.94921875, "learning_rate": 0.00030196316186933834, "loss": 4.9015, "mean_token_accuracy": 0.22924090921878815, "num_tokens": 92991820.0, "step": 41650 }, { "entropy": 5.4138611316680905, "epoch": 4.678272589431122, "grad_norm": 1.0546875, "learning_rate": 0.00030192330204627054, "loss": 4.9441, "mean_token_accuracy": 0.22421641647815704, "num_tokens": 93003832.0, "step": 41655 }, { "entropy": 5.354798793792725, "epoch": 4.6788341663390804, "grad_norm": 0.9375, "learning_rate": 0.0003018834413659545, "loss": 4.9468, "mean_token_accuracy": 0.22609520256519317, "num_tokens": 93015750.0, "step": 41660 }, { "entropy": 5.351752996444702, "epoch": 4.679395743247038, "grad_norm": 1.1171875, "learning_rate": 0.0003018435798296592, "loss": 4.9624, "mean_token_accuracy": 0.2255645677447319, "num_tokens": 93025355.0, "step": 41665 }, { "entropy": 5.325830698013306, "epoch": 4.679957320154995, "grad_norm": 0.953125, "learning_rate": 0.0003018037174386539, "loss": 4.9776, "mean_token_accuracy": 0.22123912125825881, "num_tokens": 93037138.0, "step": 41670 }, { "entropy": 5.327441263198852, "epoch": 4.680518897062953, "grad_norm": 1.0078125, "learning_rate": 0.0003017638541942078, "loss": 4.8878, "mean_token_accuracy": 0.23112013936042786, "num_tokens": 93048766.0, "step": 41675 }, { "entropy": 5.28716082572937, "epoch": 4.68108047397091, "grad_norm": 1.0390625, "learning_rate": 0.00030172399009759034, "loss": 4.8252, "mean_token_accuracy": 0.22574735432863235, "num_tokens": 93059439.0, "step": 41680 }, { "entropy": 5.304604578018188, "epoch": 4.681642050878867, "grad_norm": 0.9921875, "learning_rate": 0.0003016841251500705, "loss": 4.8387, "mean_token_accuracy": 0.2357617884874344, "num_tokens": 93070039.0, "step": 41685 }, { "entropy": 5.285853242874145, "epoch": 4.6822036277868255, "grad_norm": 1.0, "learning_rate": 0.00030164425935291794, "loss": 4.9417, "mean_token_accuracy": 0.22601652294397354, "num_tokens": 93082001.0, "step": 41690 }, { "entropy": 5.42135181427002, "epoch": 4.682765204694783, "grad_norm": 1.140625, "learning_rate": 0.0003016043927074018, "loss": 4.9895, "mean_token_accuracy": 0.225245001912117, "num_tokens": 93093360.0, "step": 41695 }, { "entropy": 5.35796046257019, "epoch": 4.683326781602741, "grad_norm": 1.0, "learning_rate": 0.0003015645252147914, "loss": 4.7945, "mean_token_accuracy": 0.2374746784567833, "num_tokens": 93103377.0, "step": 41700 }, { "entropy": 5.295522546768188, "epoch": 4.683888358510698, "grad_norm": 0.94140625, "learning_rate": 0.0003015246568763562, "loss": 4.8961, "mean_token_accuracy": 0.23456366807222367, "num_tokens": 93114289.0, "step": 41705 }, { "entropy": 5.3129456520080565, "epoch": 4.684449935418655, "grad_norm": 1.03125, "learning_rate": 0.00030148478769336564, "loss": 4.8506, "mean_token_accuracy": 0.23312475979328157, "num_tokens": 93125846.0, "step": 41710 }, { "entropy": 5.270769691467285, "epoch": 4.685011512326613, "grad_norm": 1.078125, "learning_rate": 0.0003014449176670892, "loss": 4.8852, "mean_token_accuracy": 0.22353301644325257, "num_tokens": 93135552.0, "step": 41715 }, { "entropy": 5.454571676254273, "epoch": 4.685573089234571, "grad_norm": 1.046875, "learning_rate": 0.00030140504679879637, "loss": 5.0051, "mean_token_accuracy": 0.2142038345336914, "num_tokens": 93146797.0, "step": 41720 }, { "entropy": 5.237526512145996, "epoch": 4.686134666142529, "grad_norm": 0.97265625, "learning_rate": 0.0003013651750897566, "loss": 4.7761, "mean_token_accuracy": 0.23331716507673264, "num_tokens": 93159153.0, "step": 41725 }, { "entropy": 5.312166452407837, "epoch": 4.686696243050486, "grad_norm": 0.9921875, "learning_rate": 0.0003013253025412393, "loss": 4.833, "mean_token_accuracy": 0.23308446556329726, "num_tokens": 93170015.0, "step": 41730 }, { "entropy": 5.340100860595703, "epoch": 4.687257819958443, "grad_norm": 1.015625, "learning_rate": 0.00030128542915451427, "loss": 4.913, "mean_token_accuracy": 0.23216505944728852, "num_tokens": 93181869.0, "step": 41735 }, { "entropy": 5.3710884094238285, "epoch": 4.6878193968664, "grad_norm": 0.99609375, "learning_rate": 0.00030124555493085095, "loss": 4.9542, "mean_token_accuracy": 0.22505066990852357, "num_tokens": 93193771.0, "step": 41740 }, { "entropy": 5.432128667831421, "epoch": 4.6883809737743585, "grad_norm": 0.98046875, "learning_rate": 0.0003012056798715189, "loss": 4.9677, "mean_token_accuracy": 0.21850201189517976, "num_tokens": 93205554.0, "step": 41745 }, { "entropy": 5.346857976913452, "epoch": 4.688942550682316, "grad_norm": 1.015625, "learning_rate": 0.000301165803977788, "loss": 4.9146, "mean_token_accuracy": 0.2319184809923172, "num_tokens": 93217168.0, "step": 41750 }, { "entropy": 5.374003505706787, "epoch": 4.689504127590274, "grad_norm": 1.015625, "learning_rate": 0.0003011259272509277, "loss": 4.9202, "mean_token_accuracy": 0.229892098903656, "num_tokens": 93227668.0, "step": 41755 }, { "entropy": 5.3652167320251465, "epoch": 4.690065704498231, "grad_norm": 1.015625, "learning_rate": 0.0003010860496922077, "loss": 4.8713, "mean_token_accuracy": 0.22822520285844802, "num_tokens": 93239310.0, "step": 41760 }, { "entropy": 5.323997545242309, "epoch": 4.690627281406188, "grad_norm": 1.015625, "learning_rate": 0.00030104617130289783, "loss": 4.858, "mean_token_accuracy": 0.22342328876256942, "num_tokens": 93249887.0, "step": 41765 }, { "entropy": 5.2810447216033936, "epoch": 4.691188858314146, "grad_norm": 1.0390625, "learning_rate": 0.0003010062920842677, "loss": 4.9197, "mean_token_accuracy": 0.2253631681203842, "num_tokens": 93260129.0, "step": 41770 }, { "entropy": 5.352622127532959, "epoch": 4.6917504352221036, "grad_norm": 1.0234375, "learning_rate": 0.00030096641203758716, "loss": 4.9143, "mean_token_accuracy": 0.23084412813186644, "num_tokens": 93271171.0, "step": 41775 }, { "entropy": 5.283004665374756, "epoch": 4.692312012130062, "grad_norm": 0.8984375, "learning_rate": 0.00030092653116412605, "loss": 4.8017, "mean_token_accuracy": 0.23713499754667283, "num_tokens": 93282535.0, "step": 41780 }, { "entropy": 5.302482604980469, "epoch": 4.692873589038019, "grad_norm": 1.109375, "learning_rate": 0.000300886649465154, "loss": 4.8497, "mean_token_accuracy": 0.2360524892807007, "num_tokens": 93293317.0, "step": 41785 }, { "entropy": 5.34490704536438, "epoch": 4.693435165945976, "grad_norm": 1.015625, "learning_rate": 0.0003008467669419411, "loss": 4.9253, "mean_token_accuracy": 0.2291066452860832, "num_tokens": 93304180.0, "step": 41790 }, { "entropy": 5.327944326400757, "epoch": 4.693996742853934, "grad_norm": 0.9453125, "learning_rate": 0.0003008068835957571, "loss": 4.8709, "mean_token_accuracy": 0.2264651983976364, "num_tokens": 93315146.0, "step": 41795 }, { "entropy": 5.425363397598266, "epoch": 4.694558319761891, "grad_norm": 1.046875, "learning_rate": 0.0003007669994278719, "loss": 4.9461, "mean_token_accuracy": 0.22421457320451738, "num_tokens": 93325756.0, "step": 41800 }, { "entropy": 5.316203022003174, "epoch": 4.695119896669849, "grad_norm": 0.93359375, "learning_rate": 0.0003007271144395554, "loss": 4.8807, "mean_token_accuracy": 0.22993295639753342, "num_tokens": 93337653.0, "step": 41805 }, { "entropy": 5.353049802780151, "epoch": 4.695681473577807, "grad_norm": 0.96875, "learning_rate": 0.0003006872286320777, "loss": 4.9492, "mean_token_accuracy": 0.23363907784223556, "num_tokens": 93348751.0, "step": 41810 }, { "entropy": 5.25953254699707, "epoch": 4.696243050485764, "grad_norm": 0.98046875, "learning_rate": 0.0003006473420067086, "loss": 4.8881, "mean_token_accuracy": 0.22484659999608994, "num_tokens": 93359704.0, "step": 41815 }, { "entropy": 5.316268968582153, "epoch": 4.696804627393721, "grad_norm": 1.046875, "learning_rate": 0.0003006074545647182, "loss": 4.8255, "mean_token_accuracy": 0.23668383806943893, "num_tokens": 93369252.0, "step": 41820 }, { "entropy": 5.3241295337677, "epoch": 4.697366204301679, "grad_norm": 1.046875, "learning_rate": 0.00030056756630737655, "loss": 4.9107, "mean_token_accuracy": 0.2251626282930374, "num_tokens": 93380384.0, "step": 41825 }, { "entropy": 5.3698451042175295, "epoch": 4.6979277812096365, "grad_norm": 0.95703125, "learning_rate": 0.00030052767723595365, "loss": 4.887, "mean_token_accuracy": 0.2305729791522026, "num_tokens": 93390994.0, "step": 41830 }, { "entropy": 5.342101049423218, "epoch": 4.698489358117595, "grad_norm": 0.94921875, "learning_rate": 0.0003004877873517196, "loss": 4.8499, "mean_token_accuracy": 0.23364374041557312, "num_tokens": 93401828.0, "step": 41835 }, { "entropy": 5.402885866165161, "epoch": 4.699050935025552, "grad_norm": 1.0078125, "learning_rate": 0.00030044789665594444, "loss": 5.0001, "mean_token_accuracy": 0.22452054619789125, "num_tokens": 93414653.0, "step": 41840 }, { "entropy": 5.2787576675415036, "epoch": 4.699612511933509, "grad_norm": 0.91796875, "learning_rate": 0.0003004080051498985, "loss": 4.8345, "mean_token_accuracy": 0.23452488481998443, "num_tokens": 93426020.0, "step": 41845 }, { "entropy": 5.299846601486206, "epoch": 4.700174088841467, "grad_norm": 1.09375, "learning_rate": 0.00030036811283485184, "loss": 4.8601, "mean_token_accuracy": 0.2297765865921974, "num_tokens": 93436992.0, "step": 41850 }, { "entropy": 5.317082262039184, "epoch": 4.700735665749424, "grad_norm": 0.87890625, "learning_rate": 0.00030032821971207453, "loss": 4.9565, "mean_token_accuracy": 0.21899321526288987, "num_tokens": 93448747.0, "step": 41855 }, { "entropy": 5.381482839584351, "epoch": 4.701297242657382, "grad_norm": 0.96484375, "learning_rate": 0.0003002883257828369, "loss": 4.9389, "mean_token_accuracy": 0.23237981051206588, "num_tokens": 93460349.0, "step": 41860 }, { "entropy": 5.407089948654175, "epoch": 4.70185881956534, "grad_norm": 1.0625, "learning_rate": 0.00030024843104840924, "loss": 4.989, "mean_token_accuracy": 0.22065868228673935, "num_tokens": 93470465.0, "step": 41865 }, { "entropy": 5.394988584518432, "epoch": 4.702420396473297, "grad_norm": 1.015625, "learning_rate": 0.00030020853551006164, "loss": 4.9026, "mean_token_accuracy": 0.23135693967342377, "num_tokens": 93482409.0, "step": 41870 }, { "entropy": 5.284492874145508, "epoch": 4.702981973381254, "grad_norm": 1.03125, "learning_rate": 0.0003001686391690645, "loss": 4.818, "mean_token_accuracy": 0.24273510426282882, "num_tokens": 93492212.0, "step": 41875 }, { "entropy": 5.298301553726196, "epoch": 4.703543550289212, "grad_norm": 1.0, "learning_rate": 0.00030012874202668823, "loss": 4.8962, "mean_token_accuracy": 0.23534810096025466, "num_tokens": 93503343.0, "step": 41880 }, { "entropy": 5.3711999416351315, "epoch": 4.7041051271971694, "grad_norm": 1.0, "learning_rate": 0.00030008884408420293, "loss": 4.9583, "mean_token_accuracy": 0.22147030681371688, "num_tokens": 93514401.0, "step": 41885 }, { "entropy": 5.452882242202759, "epoch": 4.7046667041051276, "grad_norm": 1.03125, "learning_rate": 0.0003000489453428792, "loss": 4.9597, "mean_token_accuracy": 0.23541709631681443, "num_tokens": 93527096.0, "step": 41890 }, { "entropy": 5.371601676940918, "epoch": 4.705228281013085, "grad_norm": 1.015625, "learning_rate": 0.0003000090458039873, "loss": 4.8317, "mean_token_accuracy": 0.23409150242805482, "num_tokens": 93538349.0, "step": 41895 }, { "entropy": 5.183589696884155, "epoch": 4.705789857921042, "grad_norm": 1.03125, "learning_rate": 0.00029996914546879773, "loss": 4.768, "mean_token_accuracy": 0.23753306418657302, "num_tokens": 93548883.0, "step": 41900 }, { "entropy": 5.258791399002075, "epoch": 4.706351434829, "grad_norm": 1.0078125, "learning_rate": 0.0002999292443385809, "loss": 4.852, "mean_token_accuracy": 0.22709605544805528, "num_tokens": 93559796.0, "step": 41905 }, { "entropy": 5.397894620895386, "epoch": 4.706913011736957, "grad_norm": 0.9765625, "learning_rate": 0.0002998893424146072, "loss": 4.8575, "mean_token_accuracy": 0.23156777918338775, "num_tokens": 93571083.0, "step": 41910 }, { "entropy": 5.28754997253418, "epoch": 4.707474588644915, "grad_norm": 0.96484375, "learning_rate": 0.0002998494396981472, "loss": 4.8461, "mean_token_accuracy": 0.22676147371530533, "num_tokens": 93583559.0, "step": 41915 }, { "entropy": 5.32647819519043, "epoch": 4.708036165552873, "grad_norm": 1.078125, "learning_rate": 0.0002998095361904714, "loss": 4.8658, "mean_token_accuracy": 0.2334922432899475, "num_tokens": 93594419.0, "step": 41920 }, { "entropy": 5.334461879730225, "epoch": 4.70859774246083, "grad_norm": 1.046875, "learning_rate": 0.0002997696318928503, "loss": 4.8738, "mean_token_accuracy": 0.2304815411567688, "num_tokens": 93605140.0, "step": 41925 }, { "entropy": 5.318619060516357, "epoch": 4.709159319368787, "grad_norm": 0.92578125, "learning_rate": 0.0002997297268065546, "loss": 4.877, "mean_token_accuracy": 0.23193345516920089, "num_tokens": 93617572.0, "step": 41930 }, { "entropy": 5.303957176208496, "epoch": 4.709720896276745, "grad_norm": 0.96875, "learning_rate": 0.00029968982093285475, "loss": 4.8966, "mean_token_accuracy": 0.22686406522989272, "num_tokens": 93627511.0, "step": 41935 }, { "entropy": 5.286347246170044, "epoch": 4.710282473184702, "grad_norm": 0.98046875, "learning_rate": 0.00029964991427302147, "loss": 4.8851, "mean_token_accuracy": 0.23438214063644408, "num_tokens": 93637651.0, "step": 41940 }, { "entropy": 5.295897436141968, "epoch": 4.7108440500926605, "grad_norm": 0.96875, "learning_rate": 0.0002996100068283253, "loss": 4.8505, "mean_token_accuracy": 0.23737146556377411, "num_tokens": 93648832.0, "step": 41945 }, { "entropy": 5.262290954589844, "epoch": 4.711405627000618, "grad_norm": 0.9453125, "learning_rate": 0.00029957009860003697, "loss": 4.8141, "mean_token_accuracy": 0.2357766166329384, "num_tokens": 93660639.0, "step": 41950 }, { "entropy": 5.35911283493042, "epoch": 4.711967203908575, "grad_norm": 1.15625, "learning_rate": 0.00029953018958942717, "loss": 4.8847, "mean_token_accuracy": 0.22842550575733184, "num_tokens": 93671296.0, "step": 41955 }, { "entropy": 5.291916036605835, "epoch": 4.712528780816533, "grad_norm": 0.90234375, "learning_rate": 0.0002994902797977667, "loss": 4.8187, "mean_token_accuracy": 0.23807838559150696, "num_tokens": 93682428.0, "step": 41960 }, { "entropy": 5.259958410263062, "epoch": 4.71309035772449, "grad_norm": 1.0625, "learning_rate": 0.00029945036922632615, "loss": 4.842, "mean_token_accuracy": 0.232601660490036, "num_tokens": 93693543.0, "step": 41965 }, { "entropy": 5.3224828243255615, "epoch": 4.713651934632448, "grad_norm": 1.015625, "learning_rate": 0.00029941045787637636, "loss": 4.8239, "mean_token_accuracy": 0.23139526844024658, "num_tokens": 93704834.0, "step": 41970 }, { "entropy": 5.442697763442993, "epoch": 4.714213511540406, "grad_norm": 0.953125, "learning_rate": 0.0002993705457491882, "loss": 5.0471, "mean_token_accuracy": 0.2174109324812889, "num_tokens": 93717291.0, "step": 41975 }, { "entropy": 5.415569543838501, "epoch": 4.714775088448363, "grad_norm": 0.96484375, "learning_rate": 0.00029933063284603235, "loss": 4.9436, "mean_token_accuracy": 0.2260613813996315, "num_tokens": 93729412.0, "step": 41980 }, { "entropy": 5.366035318374633, "epoch": 4.715336665356321, "grad_norm": 0.9765625, "learning_rate": 0.0002992907191681797, "loss": 4.8344, "mean_token_accuracy": 0.23486850261688233, "num_tokens": 93740197.0, "step": 41985 }, { "entropy": 5.301580572128296, "epoch": 4.715898242264278, "grad_norm": 0.953125, "learning_rate": 0.00029925080471690117, "loss": 4.902, "mean_token_accuracy": 0.22497205734252929, "num_tokens": 93751915.0, "step": 41990 }, { "entropy": 5.38932614326477, "epoch": 4.716459819172235, "grad_norm": 1.0859375, "learning_rate": 0.00029921088949346765, "loss": 4.9796, "mean_token_accuracy": 0.22377128154039383, "num_tokens": 93763392.0, "step": 41995 }, { "entropy": 5.340775060653686, "epoch": 4.717021396080193, "grad_norm": 1.015625, "learning_rate": 0.0002991709734991499, "loss": 4.7913, "mean_token_accuracy": 0.23970773369073867, "num_tokens": 93774207.0, "step": 42000 }, { "epoch": 4.717021396080193, "eval_entropy": 5.141952825324388, "eval_loss": 5.041710376739502, "eval_mean_token_accuracy": 0.22828397447873183, "eval_num_tokens": 93774207.0, "eval_runtime": 23.8024, "eval_samples_per_second": 1302.938, "eval_steps_per_second": 162.883, "step": 42000 }, { "entropy": 5.39470477104187, "epoch": 4.717582972988151, "grad_norm": 1.0625, "learning_rate": 0.00029913105673521907, "loss": 4.9703, "mean_token_accuracy": 0.22448041290044785, "num_tokens": 93785599.0, "step": 42005 }, { "entropy": 5.2145013332366945, "epoch": 4.718144549896108, "grad_norm": 0.94921875, "learning_rate": 0.000299091139202946, "loss": 4.7363, "mean_token_accuracy": 0.24043385088443756, "num_tokens": 93796942.0, "step": 42010 }, { "entropy": 5.3697656154632565, "epoch": 4.718706126804066, "grad_norm": 0.98046875, "learning_rate": 0.00029905122090360167, "loss": 4.9687, "mean_token_accuracy": 0.2190815970301628, "num_tokens": 93808858.0, "step": 42015 }, { "entropy": 5.314112758636474, "epoch": 4.719267703712023, "grad_norm": 0.9765625, "learning_rate": 0.0002990113018384572, "loss": 4.8986, "mean_token_accuracy": 0.2302725210785866, "num_tokens": 93820817.0, "step": 42020 }, { "entropy": 5.281701755523682, "epoch": 4.719829280619981, "grad_norm": 1.0, "learning_rate": 0.0002989713820087836, "loss": 4.7886, "mean_token_accuracy": 0.23238065242767333, "num_tokens": 93831615.0, "step": 42025 }, { "entropy": 5.341869258880616, "epoch": 4.7203908575279385, "grad_norm": 1.015625, "learning_rate": 0.00029893146141585187, "loss": 4.8675, "mean_token_accuracy": 0.22723120152950288, "num_tokens": 93842622.0, "step": 42030 }, { "entropy": 5.262009954452514, "epoch": 4.720952434435896, "grad_norm": 1.078125, "learning_rate": 0.00029889154006093306, "loss": 4.8536, "mean_token_accuracy": 0.2291353315114975, "num_tokens": 93852409.0, "step": 42035 }, { "entropy": 5.301942205429077, "epoch": 4.721514011343854, "grad_norm": 1.0390625, "learning_rate": 0.0002988516179452984, "loss": 4.9363, "mean_token_accuracy": 0.23218819499015808, "num_tokens": 93863428.0, "step": 42040 }, { "entropy": 5.314897441864014, "epoch": 4.722075588251811, "grad_norm": 1.0234375, "learning_rate": 0.00029881169507021895, "loss": 4.9018, "mean_token_accuracy": 0.23433074057102204, "num_tokens": 93874561.0, "step": 42045 }, { "entropy": 5.251282453536987, "epoch": 4.722637165159768, "grad_norm": 0.8671875, "learning_rate": 0.000298771771436966, "loss": 4.802, "mean_token_accuracy": 0.23917344361543655, "num_tokens": 93885923.0, "step": 42050 }, { "entropy": 5.181094694137573, "epoch": 4.723198742067726, "grad_norm": 1.046875, "learning_rate": 0.0002987318470468105, "loss": 4.6631, "mean_token_accuracy": 0.2396415427327156, "num_tokens": 93897329.0, "step": 42055 }, { "entropy": 5.202418422698974, "epoch": 4.723760318975684, "grad_norm": 0.96484375, "learning_rate": 0.00029869192190102385, "loss": 4.7645, "mean_token_accuracy": 0.23552075326442717, "num_tokens": 93908198.0, "step": 42060 }, { "entropy": 5.319151878356934, "epoch": 4.724321895883641, "grad_norm": 0.9921875, "learning_rate": 0.00029865199600087724, "loss": 4.9879, "mean_token_accuracy": 0.2210560604929924, "num_tokens": 93919368.0, "step": 42065 }, { "entropy": 5.34576416015625, "epoch": 4.724883472791599, "grad_norm": 1.125, "learning_rate": 0.0002986120693476418, "loss": 4.9211, "mean_token_accuracy": 0.22232408970594406, "num_tokens": 93930585.0, "step": 42070 }, { "entropy": 5.345205307006836, "epoch": 4.725445049699556, "grad_norm": 1.0, "learning_rate": 0.00029857214194258896, "loss": 4.8795, "mean_token_accuracy": 0.22531274408102037, "num_tokens": 93941990.0, "step": 42075 }, { "entropy": 5.329469394683838, "epoch": 4.726006626607514, "grad_norm": 1.0625, "learning_rate": 0.00029853221378699, "loss": 4.9047, "mean_token_accuracy": 0.22552771866321564, "num_tokens": 93953219.0, "step": 42080 }, { "entropy": 5.274214076995849, "epoch": 4.7265682035154715, "grad_norm": 0.98828125, "learning_rate": 0.0002984922848821162, "loss": 4.823, "mean_token_accuracy": 0.2345086842775345, "num_tokens": 93964858.0, "step": 42085 }, { "entropy": 5.187658500671387, "epoch": 4.727129780423429, "grad_norm": 1.046875, "learning_rate": 0.00029845235522923903, "loss": 4.7565, "mean_token_accuracy": 0.23073508143424987, "num_tokens": 93975120.0, "step": 42090 }, { "entropy": 5.237909746170044, "epoch": 4.727691357331387, "grad_norm": 0.9765625, "learning_rate": 0.00029841242482962966, "loss": 4.8265, "mean_token_accuracy": 0.23450278341770173, "num_tokens": 93985546.0, "step": 42095 }, { "entropy": 5.323454189300537, "epoch": 4.728252934239344, "grad_norm": 0.97265625, "learning_rate": 0.00029837249368455963, "loss": 4.8678, "mean_token_accuracy": 0.23242430239915848, "num_tokens": 93996116.0, "step": 42100 }, { "entropy": 5.320510053634644, "epoch": 4.728814511147302, "grad_norm": 1.0078125, "learning_rate": 0.0002983325617953004, "loss": 4.8626, "mean_token_accuracy": 0.23077965825796126, "num_tokens": 94006531.0, "step": 42105 }, { "entropy": 5.259982442855835, "epoch": 4.729376088055259, "grad_norm": 0.9765625, "learning_rate": 0.00029829262916312326, "loss": 4.8003, "mean_token_accuracy": 0.24292090088129042, "num_tokens": 94017924.0, "step": 42110 }, { "entropy": 5.321058988571167, "epoch": 4.7299376649632165, "grad_norm": 0.88671875, "learning_rate": 0.00029825269578929986, "loss": 4.87, "mean_token_accuracy": 0.23641814291477203, "num_tokens": 94029115.0, "step": 42115 }, { "entropy": 5.3869048118591305, "epoch": 4.730499241871174, "grad_norm": 0.99609375, "learning_rate": 0.00029821276167510153, "loss": 4.9635, "mean_token_accuracy": 0.22516782879829406, "num_tokens": 94041223.0, "step": 42120 }, { "entropy": 5.414372730255127, "epoch": 4.731060818779132, "grad_norm": 0.9609375, "learning_rate": 0.0002981728268217999, "loss": 4.9759, "mean_token_accuracy": 0.21641747206449508, "num_tokens": 94054091.0, "step": 42125 }, { "entropy": 5.326960849761963, "epoch": 4.731622395687089, "grad_norm": 1.046875, "learning_rate": 0.0002981328912306665, "loss": 4.879, "mean_token_accuracy": 0.23538580685853958, "num_tokens": 94064988.0, "step": 42130 }, { "entropy": 5.325798892974854, "epoch": 4.732183972595047, "grad_norm": 1.0390625, "learning_rate": 0.00029809295490297285, "loss": 4.9067, "mean_token_accuracy": 0.22631106227636338, "num_tokens": 94075553.0, "step": 42135 }, { "entropy": 5.282143783569336, "epoch": 4.732745549503004, "grad_norm": 1.03125, "learning_rate": 0.0002980530178399906, "loss": 4.8269, "mean_token_accuracy": 0.23100461214780807, "num_tokens": 94086245.0, "step": 42140 }, { "entropy": 5.406793260574341, "epoch": 4.733307126410962, "grad_norm": 1.046875, "learning_rate": 0.0002980130800429912, "loss": 4.9645, "mean_token_accuracy": 0.22933005839586257, "num_tokens": 94097146.0, "step": 42145 }, { "entropy": 5.287923526763916, "epoch": 4.73386870331892, "grad_norm": 0.9765625, "learning_rate": 0.00029797314151324653, "loss": 4.8178, "mean_token_accuracy": 0.22874056547880173, "num_tokens": 94108046.0, "step": 42150 }, { "entropy": 5.317944669723511, "epoch": 4.734430280226877, "grad_norm": 0.94140625, "learning_rate": 0.00029793320225202807, "loss": 4.8556, "mean_token_accuracy": 0.2271113336086273, "num_tokens": 94118859.0, "step": 42155 }, { "entropy": 5.321755456924438, "epoch": 4.734991857134835, "grad_norm": 0.94921875, "learning_rate": 0.0002978932622606075, "loss": 4.9684, "mean_token_accuracy": 0.2293991133570671, "num_tokens": 94130593.0, "step": 42160 }, { "entropy": 5.346603870391846, "epoch": 4.735553434042792, "grad_norm": 0.85546875, "learning_rate": 0.00029785332154025676, "loss": 4.9375, "mean_token_accuracy": 0.2274392992258072, "num_tokens": 94142684.0, "step": 42165 }, { "entropy": 5.306607866287232, "epoch": 4.7361150109507495, "grad_norm": 1.171875, "learning_rate": 0.0002978133800922473, "loss": 4.8722, "mean_token_accuracy": 0.22872566282749177, "num_tokens": 94152520.0, "step": 42170 }, { "entropy": 5.314824199676513, "epoch": 4.736676587858708, "grad_norm": 0.84765625, "learning_rate": 0.0002977734379178509, "loss": 4.8809, "mean_token_accuracy": 0.23492157012224196, "num_tokens": 94164608.0, "step": 42175 }, { "entropy": 5.282477951049804, "epoch": 4.737238164766665, "grad_norm": 1.0078125, "learning_rate": 0.0002977334950183394, "loss": 4.8133, "mean_token_accuracy": 0.23734786063432695, "num_tokens": 94175343.0, "step": 42180 }, { "entropy": 5.281869173049927, "epoch": 4.737799741674622, "grad_norm": 0.9375, "learning_rate": 0.00029769355139498465, "loss": 4.8799, "mean_token_accuracy": 0.22460848689079285, "num_tokens": 94186832.0, "step": 42185 }, { "entropy": 5.253571319580078, "epoch": 4.73836131858258, "grad_norm": 1.015625, "learning_rate": 0.0002976536070490585, "loss": 4.859, "mean_token_accuracy": 0.22547847032546997, "num_tokens": 94198268.0, "step": 42190 }, { "entropy": 5.315924978256225, "epoch": 4.738922895490537, "grad_norm": 1.03125, "learning_rate": 0.00029761366198183264, "loss": 4.8707, "mean_token_accuracy": 0.231480173766613, "num_tokens": 94209286.0, "step": 42195 }, { "entropy": 5.439875268936158, "epoch": 4.739484472398495, "grad_norm": 0.98046875, "learning_rate": 0.00029757371619457904, "loss": 4.9599, "mean_token_accuracy": 0.2321220964193344, "num_tokens": 94220831.0, "step": 42200 }, { "entropy": 5.29284439086914, "epoch": 4.740046049306453, "grad_norm": 0.96484375, "learning_rate": 0.00029753376968856955, "loss": 4.786, "mean_token_accuracy": 0.23891403675079345, "num_tokens": 94232055.0, "step": 42205 }, { "entropy": 5.234249019622803, "epoch": 4.74060762621441, "grad_norm": 0.9765625, "learning_rate": 0.00029749382246507604, "loss": 4.8258, "mean_token_accuracy": 0.2223077416419983, "num_tokens": 94242261.0, "step": 42210 }, { "entropy": 5.355115795135498, "epoch": 4.741169203122368, "grad_norm": 0.98828125, "learning_rate": 0.00029745387452537056, "loss": 4.9688, "mean_token_accuracy": 0.22774934470653535, "num_tokens": 94253756.0, "step": 42215 }, { "entropy": 5.2920389652252195, "epoch": 4.741730780030325, "grad_norm": 0.9765625, "learning_rate": 0.00029741392587072504, "loss": 4.7742, "mean_token_accuracy": 0.23443887382745743, "num_tokens": 94265713.0, "step": 42220 }, { "entropy": 5.412127590179443, "epoch": 4.742292356938282, "grad_norm": 0.95703125, "learning_rate": 0.00029737397650241135, "loss": 5.0415, "mean_token_accuracy": 0.21866599023342131, "num_tokens": 94276913.0, "step": 42225 }, { "entropy": 5.346949911117553, "epoch": 4.7428539338462405, "grad_norm": 1.046875, "learning_rate": 0.0002973340264217016, "loss": 4.9666, "mean_token_accuracy": 0.22231330424547197, "num_tokens": 94288869.0, "step": 42230 }, { "entropy": 5.335604476928711, "epoch": 4.743415510754198, "grad_norm": 1.015625, "learning_rate": 0.00029729407562986774, "loss": 4.9073, "mean_token_accuracy": 0.23433059006929396, "num_tokens": 94300262.0, "step": 42235 }, { "entropy": 5.440021753311157, "epoch": 4.743977087662155, "grad_norm": 1.03125, "learning_rate": 0.00029725412412818196, "loss": 4.9835, "mean_token_accuracy": 0.22318292856216432, "num_tokens": 94312045.0, "step": 42240 }, { "entropy": 5.34285798072815, "epoch": 4.744538664570113, "grad_norm": 0.9453125, "learning_rate": 0.00029721417191791617, "loss": 4.8631, "mean_token_accuracy": 0.2324235886335373, "num_tokens": 94322750.0, "step": 42245 }, { "entropy": 5.257214546203613, "epoch": 4.74510024147807, "grad_norm": 0.90234375, "learning_rate": 0.00029717421900034253, "loss": 4.7196, "mean_token_accuracy": 0.24010470807552337, "num_tokens": 94333945.0, "step": 42250 }, { "entropy": 5.245966100692749, "epoch": 4.7456618183860275, "grad_norm": 1.0546875, "learning_rate": 0.0002971342653767332, "loss": 4.8193, "mean_token_accuracy": 0.22996306419372559, "num_tokens": 94344021.0, "step": 42255 }, { "entropy": 5.3238081455230715, "epoch": 4.746223395293986, "grad_norm": 1.03125, "learning_rate": 0.00029709431104836027, "loss": 4.9265, "mean_token_accuracy": 0.22468641102313996, "num_tokens": 94354863.0, "step": 42260 }, { "entropy": 5.308480167388916, "epoch": 4.746784972201943, "grad_norm": 1.0546875, "learning_rate": 0.00029705435601649584, "loss": 4.8403, "mean_token_accuracy": 0.23219407945871354, "num_tokens": 94365729.0, "step": 42265 }, { "entropy": 5.4176257133483885, "epoch": 4.747346549109901, "grad_norm": 1.09375, "learning_rate": 0.0002970144002824122, "loss": 4.9005, "mean_token_accuracy": 0.22682932764291763, "num_tokens": 94377467.0, "step": 42270 }, { "entropy": 5.352931261062622, "epoch": 4.747908126017858, "grad_norm": 0.921875, "learning_rate": 0.0002969744438473815, "loss": 4.9311, "mean_token_accuracy": 0.23567714542150497, "num_tokens": 94389154.0, "step": 42275 }, { "entropy": 5.40204381942749, "epoch": 4.748469702925815, "grad_norm": 0.93359375, "learning_rate": 0.0002969344867126761, "loss": 4.9744, "mean_token_accuracy": 0.22720986008644103, "num_tokens": 94401292.0, "step": 42280 }, { "entropy": 5.351775121688843, "epoch": 4.7490312798337735, "grad_norm": 1.125, "learning_rate": 0.00029689452887956804, "loss": 4.9147, "mean_token_accuracy": 0.2251904234290123, "num_tokens": 94412707.0, "step": 42285 }, { "entropy": 5.337867879867554, "epoch": 4.749592856741731, "grad_norm": 1.0234375, "learning_rate": 0.00029685457034932966, "loss": 4.8798, "mean_token_accuracy": 0.2245976909995079, "num_tokens": 94423887.0, "step": 42290 }, { "entropy": 5.377493143081665, "epoch": 4.750154433649689, "grad_norm": 1.015625, "learning_rate": 0.0002968146111232333, "loss": 4.8989, "mean_token_accuracy": 0.2251439571380615, "num_tokens": 94435046.0, "step": 42295 }, { "entropy": 5.336307144165039, "epoch": 4.750716010557646, "grad_norm": 0.99609375, "learning_rate": 0.00029677465120255133, "loss": 4.8501, "mean_token_accuracy": 0.23388715386390685, "num_tokens": 94446160.0, "step": 42300 }, { "entropy": 5.3447037696838375, "epoch": 4.751277587465603, "grad_norm": 1.046875, "learning_rate": 0.0002967346905885559, "loss": 4.8934, "mean_token_accuracy": 0.23582927733659745, "num_tokens": 94456101.0, "step": 42305 }, { "entropy": 5.294980859756469, "epoch": 4.7518391643735605, "grad_norm": 0.98828125, "learning_rate": 0.00029669472928251954, "loss": 4.8395, "mean_token_accuracy": 0.23958063423633574, "num_tokens": 94466820.0, "step": 42310 }, { "entropy": 5.319519090652466, "epoch": 4.752400741281519, "grad_norm": 1.015625, "learning_rate": 0.00029665476728571466, "loss": 4.8592, "mean_token_accuracy": 0.23113391548395157, "num_tokens": 94478236.0, "step": 42315 }, { "entropy": 5.3873358249664305, "epoch": 4.752962318189476, "grad_norm": 1.0, "learning_rate": 0.0002966148045994135, "loss": 4.9761, "mean_token_accuracy": 0.22463198155164718, "num_tokens": 94490136.0, "step": 42320 }, { "entropy": 5.368136739730835, "epoch": 4.753523895097434, "grad_norm": 0.984375, "learning_rate": 0.0002965748412248886, "loss": 4.9257, "mean_token_accuracy": 0.22944828867912292, "num_tokens": 94501694.0, "step": 42325 }, { "entropy": 5.244281339645386, "epoch": 4.754085472005391, "grad_norm": 0.94921875, "learning_rate": 0.0002965348771634124, "loss": 4.8802, "mean_token_accuracy": 0.22721097469329835, "num_tokens": 94512724.0, "step": 42330 }, { "entropy": 5.414455699920654, "epoch": 4.754647048913348, "grad_norm": 0.94921875, "learning_rate": 0.00029649491241625736, "loss": 4.9075, "mean_token_accuracy": 0.22722697108983994, "num_tokens": 94523055.0, "step": 42335 }, { "entropy": 5.2879150390625, "epoch": 4.755208625821306, "grad_norm": 0.96484375, "learning_rate": 0.00029645494698469604, "loss": 4.8224, "mean_token_accuracy": 0.23019666820764542, "num_tokens": 94533656.0, "step": 42340 }, { "entropy": 5.352685976028442, "epoch": 4.755770202729264, "grad_norm": 0.93359375, "learning_rate": 0.00029641498087000083, "loss": 4.9169, "mean_token_accuracy": 0.22331905215978623, "num_tokens": 94544772.0, "step": 42345 }, { "entropy": 5.28442645072937, "epoch": 4.756331779637222, "grad_norm": 0.9921875, "learning_rate": 0.0002963750140734443, "loss": 4.8168, "mean_token_accuracy": 0.2409016013145447, "num_tokens": 94554386.0, "step": 42350 }, { "entropy": 5.274297046661377, "epoch": 4.756893356545179, "grad_norm": 0.9609375, "learning_rate": 0.0002963350465962991, "loss": 4.9294, "mean_token_accuracy": 0.2230806455016136, "num_tokens": 94566314.0, "step": 42355 }, { "entropy": 5.397469997406006, "epoch": 4.757454933453136, "grad_norm": 1.0546875, "learning_rate": 0.0002962950784398376, "loss": 4.9305, "mean_token_accuracy": 0.23076384216547013, "num_tokens": 94577420.0, "step": 42360 }, { "entropy": 5.33483510017395, "epoch": 4.758016510361094, "grad_norm": 1.0, "learning_rate": 0.0002962551096053327, "loss": 4.8532, "mean_token_accuracy": 0.22766718417406082, "num_tokens": 94588956.0, "step": 42365 }, { "entropy": 5.416394567489624, "epoch": 4.7585780872690515, "grad_norm": 0.99609375, "learning_rate": 0.00029621514009405675, "loss": 5.0064, "mean_token_accuracy": 0.22231080383062363, "num_tokens": 94601446.0, "step": 42370 }, { "entropy": 5.2310144901275635, "epoch": 4.759139664177009, "grad_norm": 1.078125, "learning_rate": 0.0002961751699072826, "loss": 4.7867, "mean_token_accuracy": 0.24080368429422377, "num_tokens": 94612489.0, "step": 42375 }, { "entropy": 5.352566146850586, "epoch": 4.759701241084967, "grad_norm": 1.125, "learning_rate": 0.0002961351990462827, "loss": 4.9043, "mean_token_accuracy": 0.2280285358428955, "num_tokens": 94622576.0, "step": 42380 }, { "entropy": 5.275673246383667, "epoch": 4.760262817992924, "grad_norm": 1.0078125, "learning_rate": 0.00029609522751232996, "loss": 4.7784, "mean_token_accuracy": 0.23069059401750563, "num_tokens": 94633649.0, "step": 42385 }, { "entropy": 5.3353746891021725, "epoch": 4.760824394900881, "grad_norm": 1.078125, "learning_rate": 0.00029605525530669705, "loss": 4.9227, "mean_token_accuracy": 0.2224062204360962, "num_tokens": 94645229.0, "step": 42390 }, { "entropy": 5.294969463348389, "epoch": 4.761385971808839, "grad_norm": 1.0546875, "learning_rate": 0.00029601528243065656, "loss": 4.8588, "mean_token_accuracy": 0.23314192444086074, "num_tokens": 94656374.0, "step": 42395 }, { "entropy": 5.328191947937012, "epoch": 4.761947548716797, "grad_norm": 1.015625, "learning_rate": 0.00029597530888548135, "loss": 4.8819, "mean_token_accuracy": 0.23007851094007492, "num_tokens": 94667634.0, "step": 42400 }, { "entropy": 5.397167110443116, "epoch": 4.762509125624755, "grad_norm": 1.0, "learning_rate": 0.00029593533467244415, "loss": 4.9795, "mean_token_accuracy": 0.2219239890575409, "num_tokens": 94679418.0, "step": 42405 }, { "entropy": 5.428636789321899, "epoch": 4.763070702532712, "grad_norm": 1.03125, "learning_rate": 0.0002958953597928178, "loss": 5.0003, "mean_token_accuracy": 0.227021224796772, "num_tokens": 94690872.0, "step": 42410 }, { "entropy": 5.374027109146118, "epoch": 4.763632279440669, "grad_norm": 1.0390625, "learning_rate": 0.0002958553842478751, "loss": 4.9318, "mean_token_accuracy": 0.2255226954817772, "num_tokens": 94701630.0, "step": 42415 }, { "entropy": 5.315361499786377, "epoch": 4.764193856348627, "grad_norm": 1.015625, "learning_rate": 0.00029581540803888886, "loss": 4.8413, "mean_token_accuracy": 0.23393039405345917, "num_tokens": 94713192.0, "step": 42420 }, { "entropy": 5.190341949462891, "epoch": 4.7647554332565845, "grad_norm": 1.0390625, "learning_rate": 0.00029577543116713197, "loss": 4.7336, "mean_token_accuracy": 0.2386300668120384, "num_tokens": 94723681.0, "step": 42425 }, { "entropy": 5.358533477783203, "epoch": 4.765317010164542, "grad_norm": 1.109375, "learning_rate": 0.00029573545363387725, "loss": 4.9222, "mean_token_accuracy": 0.22395992279052734, "num_tokens": 94735575.0, "step": 42430 }, { "entropy": 5.418138933181763, "epoch": 4.7658785870725, "grad_norm": 0.97265625, "learning_rate": 0.0002956954754403977, "loss": 4.8983, "mean_token_accuracy": 0.22810962945222854, "num_tokens": 94745913.0, "step": 42435 }, { "entropy": 5.4595075130462645, "epoch": 4.766440163980457, "grad_norm": 0.9921875, "learning_rate": 0.0002956554965879662, "loss": 4.9802, "mean_token_accuracy": 0.2266670897603035, "num_tokens": 94757429.0, "step": 42440 }, { "entropy": 5.281836366653442, "epoch": 4.767001740888414, "grad_norm": 1.0078125, "learning_rate": 0.0002956155170778556, "loss": 4.7427, "mean_token_accuracy": 0.2357871413230896, "num_tokens": 94767552.0, "step": 42445 }, { "entropy": 5.38918719291687, "epoch": 4.767563317796372, "grad_norm": 0.96484375, "learning_rate": 0.0002955755369113389, "loss": 4.9992, "mean_token_accuracy": 0.22958276569843292, "num_tokens": 94780016.0, "step": 42450 }, { "entropy": 5.167181062698364, "epoch": 4.7681248947043295, "grad_norm": 0.984375, "learning_rate": 0.00029553555608968925, "loss": 4.8129, "mean_token_accuracy": 0.2442493438720703, "num_tokens": 94791529.0, "step": 42455 }, { "entropy": 5.267548847198486, "epoch": 4.768686471612288, "grad_norm": 1.09375, "learning_rate": 0.0002954955746141795, "loss": 4.8843, "mean_token_accuracy": 0.22789565473794937, "num_tokens": 94801580.0, "step": 42460 }, { "entropy": 5.347129583358765, "epoch": 4.769248048520245, "grad_norm": 1.0703125, "learning_rate": 0.0002954555924860827, "loss": 4.8571, "mean_token_accuracy": 0.23230217397212982, "num_tokens": 94812143.0, "step": 42465 }, { "entropy": 5.290542650222778, "epoch": 4.769809625428202, "grad_norm": 0.9765625, "learning_rate": 0.0002954156097066718, "loss": 4.8435, "mean_token_accuracy": 0.22464328557252883, "num_tokens": 94822541.0, "step": 42470 }, { "entropy": 5.38091025352478, "epoch": 4.77037120233616, "grad_norm": 0.9375, "learning_rate": 0.0002953756262772201, "loss": 4.9411, "mean_token_accuracy": 0.23001226931810378, "num_tokens": 94834298.0, "step": 42475 }, { "entropy": 5.408822298049927, "epoch": 4.770932779244117, "grad_norm": 1.0, "learning_rate": 0.0002953356421990005, "loss": 4.9092, "mean_token_accuracy": 0.22896819561719894, "num_tokens": 94844753.0, "step": 42480 }, { "entropy": 5.3620133876800535, "epoch": 4.7714943561520755, "grad_norm": 0.96875, "learning_rate": 0.0002952956574732862, "loss": 4.9021, "mean_token_accuracy": 0.22314756959676743, "num_tokens": 94856082.0, "step": 42485 }, { "entropy": 5.295596885681152, "epoch": 4.772055933060033, "grad_norm": 0.9453125, "learning_rate": 0.0002952556721013503, "loss": 4.8156, "mean_token_accuracy": 0.23112361878156662, "num_tokens": 94868342.0, "step": 42490 }, { "entropy": 5.392345285415649, "epoch": 4.77261750996799, "grad_norm": 0.94921875, "learning_rate": 0.0002952156860844659, "loss": 4.9288, "mean_token_accuracy": 0.227860327064991, "num_tokens": 94879799.0, "step": 42495 }, { "entropy": 5.407217025756836, "epoch": 4.773179086875947, "grad_norm": 0.98046875, "learning_rate": 0.0002951756994239063, "loss": 4.9459, "mean_token_accuracy": 0.22482404559850694, "num_tokens": 94891309.0, "step": 42500 }, { "entropy": 5.272177886962891, "epoch": 4.773740663783905, "grad_norm": 0.94140625, "learning_rate": 0.00029513571212094443, "loss": 4.8656, "mean_token_accuracy": 0.23112059086561204, "num_tokens": 94902755.0, "step": 42505 }, { "entropy": 5.288668823242188, "epoch": 4.7743022406918625, "grad_norm": 0.9921875, "learning_rate": 0.0002950957241768539, "loss": 4.7764, "mean_token_accuracy": 0.24598341733217238, "num_tokens": 94912981.0, "step": 42510 }, { "entropy": 5.234358787536621, "epoch": 4.774863817599821, "grad_norm": 0.94140625, "learning_rate": 0.00029505573559290756, "loss": 4.8498, "mean_token_accuracy": 0.23153398483991622, "num_tokens": 94924843.0, "step": 42515 }, { "entropy": 5.376433086395264, "epoch": 4.775425394507778, "grad_norm": 1.015625, "learning_rate": 0.00029501574637037884, "loss": 4.9229, "mean_token_accuracy": 0.2277486056089401, "num_tokens": 94935575.0, "step": 42520 }, { "entropy": 5.268910264968872, "epoch": 4.775986971415735, "grad_norm": 1.015625, "learning_rate": 0.000294975756510541, "loss": 4.781, "mean_token_accuracy": 0.24068457931280135, "num_tokens": 94946459.0, "step": 42525 }, { "entropy": 5.383422994613648, "epoch": 4.776548548323693, "grad_norm": 1.015625, "learning_rate": 0.0002949357660146673, "loss": 4.897, "mean_token_accuracy": 0.22915136963129043, "num_tokens": 94957454.0, "step": 42530 }, { "entropy": 5.301697492599487, "epoch": 4.77711012523165, "grad_norm": 0.9921875, "learning_rate": 0.0002948957748840311, "loss": 4.9147, "mean_token_accuracy": 0.22467681616544724, "num_tokens": 94968394.0, "step": 42535 }, { "entropy": 5.285888719558716, "epoch": 4.7776717021396085, "grad_norm": 1.015625, "learning_rate": 0.00029485578311990574, "loss": 4.8565, "mean_token_accuracy": 0.23844217956066133, "num_tokens": 94980048.0, "step": 42540 }, { "entropy": 5.26178388595581, "epoch": 4.778233279047566, "grad_norm": 0.9453125, "learning_rate": 0.00029481579072356456, "loss": 4.8214, "mean_token_accuracy": 0.23710710257291795, "num_tokens": 94991070.0, "step": 42545 }, { "entropy": 5.28102068901062, "epoch": 4.778794855955523, "grad_norm": 1.046875, "learning_rate": 0.0002947757976962809, "loss": 4.8057, "mean_token_accuracy": 0.23239758610725403, "num_tokens": 95001881.0, "step": 42550 }, { "entropy": 5.363073301315308, "epoch": 4.779356432863481, "grad_norm": 1.0703125, "learning_rate": 0.00029473580403932814, "loss": 4.9099, "mean_token_accuracy": 0.22532707303762436, "num_tokens": 95011871.0, "step": 42555 }, { "entropy": 5.293043565750122, "epoch": 4.779918009771438, "grad_norm": 1.0234375, "learning_rate": 0.0002946958097539798, "loss": 4.8164, "mean_token_accuracy": 0.22973926067352296, "num_tokens": 95022744.0, "step": 42560 }, { "entropy": 5.26733078956604, "epoch": 4.780479586679395, "grad_norm": 1.03125, "learning_rate": 0.0002946558148415092, "loss": 4.8292, "mean_token_accuracy": 0.23056551814079285, "num_tokens": 95032905.0, "step": 42565 }, { "entropy": 5.375695514678955, "epoch": 4.7810411635873535, "grad_norm": 1.0, "learning_rate": 0.0002946158193031898, "loss": 4.9736, "mean_token_accuracy": 0.22271549701690674, "num_tokens": 95044051.0, "step": 42570 }, { "entropy": 5.355753803253174, "epoch": 4.781602740495311, "grad_norm": 1.0234375, "learning_rate": 0.00029457582314029507, "loss": 4.864, "mean_token_accuracy": 0.23478852957487106, "num_tokens": 95054482.0, "step": 42575 }, { "entropy": 5.382435750961304, "epoch": 4.782164317403268, "grad_norm": 1.0390625, "learning_rate": 0.00029453582635409866, "loss": 4.9026, "mean_token_accuracy": 0.22424572408199311, "num_tokens": 95064319.0, "step": 42580 }, { "entropy": 5.2300678253173825, "epoch": 4.782725894311226, "grad_norm": 1.0, "learning_rate": 0.0002944958289458739, "loss": 4.8004, "mean_token_accuracy": 0.22758205682039262, "num_tokens": 95075129.0, "step": 42585 }, { "entropy": 5.365240383148193, "epoch": 4.783287471219183, "grad_norm": 1.0625, "learning_rate": 0.00029445583091689437, "loss": 4.9031, "mean_token_accuracy": 0.2243991121649742, "num_tokens": 95086383.0, "step": 42590 }, { "entropy": 5.373481941223145, "epoch": 4.783849048127141, "grad_norm": 0.98046875, "learning_rate": 0.0002944158322684336, "loss": 4.817, "mean_token_accuracy": 0.23565888851881028, "num_tokens": 95098804.0, "step": 42595 }, { "entropy": 5.291520786285401, "epoch": 4.784410625035099, "grad_norm": 1.015625, "learning_rate": 0.00029437583300176526, "loss": 4.844, "mean_token_accuracy": 0.23695716708898545, "num_tokens": 95110465.0, "step": 42600 }, { "entropy": 5.237540578842163, "epoch": 4.784972201943056, "grad_norm": 0.9296875, "learning_rate": 0.00029433583311816284, "loss": 4.9149, "mean_token_accuracy": 0.2278318554162979, "num_tokens": 95121999.0, "step": 42605 }, { "entropy": 5.304619216918946, "epoch": 4.785533778851014, "grad_norm": 1.078125, "learning_rate": 0.0002942958326189, "loss": 4.8195, "mean_token_accuracy": 0.24257900416851044, "num_tokens": 95132920.0, "step": 42610 }, { "entropy": 5.353788280487061, "epoch": 4.786095355758971, "grad_norm": 1.0234375, "learning_rate": 0.00029425583150525044, "loss": 4.9196, "mean_token_accuracy": 0.23226158618927, "num_tokens": 95143361.0, "step": 42615 }, { "entropy": 5.359145450592041, "epoch": 4.786656932666928, "grad_norm": 1.0546875, "learning_rate": 0.00029421582977848763, "loss": 4.9332, "mean_token_accuracy": 0.22206931114196776, "num_tokens": 95153509.0, "step": 42620 }, { "entropy": 5.312826204299927, "epoch": 4.7872185095748865, "grad_norm": 0.93359375, "learning_rate": 0.00029417582743988547, "loss": 4.8599, "mean_token_accuracy": 0.23063335418701172, "num_tokens": 95165762.0, "step": 42625 }, { "entropy": 5.284657716751099, "epoch": 4.787780086482844, "grad_norm": 0.9296875, "learning_rate": 0.00029413582449071745, "loss": 4.9124, "mean_token_accuracy": 0.22656734734773637, "num_tokens": 95177038.0, "step": 42630 }, { "entropy": 5.422993803024292, "epoch": 4.788341663390801, "grad_norm": 0.94921875, "learning_rate": 0.0002940958209322574, "loss": 4.941, "mean_token_accuracy": 0.2293344557285309, "num_tokens": 95188641.0, "step": 42635 }, { "entropy": 5.41595048904419, "epoch": 4.788903240298759, "grad_norm": 0.89453125, "learning_rate": 0.00029405581676577897, "loss": 4.9716, "mean_token_accuracy": 0.21891319006681442, "num_tokens": 95200792.0, "step": 42640 }, { "entropy": 5.452337121963501, "epoch": 4.789464817206716, "grad_norm": 0.97265625, "learning_rate": 0.000294015811992556, "loss": 4.9848, "mean_token_accuracy": 0.22601761519908906, "num_tokens": 95212578.0, "step": 42645 }, { "entropy": 5.304792785644532, "epoch": 4.790026394114674, "grad_norm": 0.94140625, "learning_rate": 0.0002939758066138621, "loss": 4.8474, "mean_token_accuracy": 0.23232062458992003, "num_tokens": 95223744.0, "step": 42650 }, { "entropy": 5.2585015296936035, "epoch": 4.790587971022632, "grad_norm": 1.0234375, "learning_rate": 0.0002939358006309712, "loss": 4.8154, "mean_token_accuracy": 0.2406544417142868, "num_tokens": 95234836.0, "step": 42655 }, { "entropy": 5.352051210403443, "epoch": 4.791149547930589, "grad_norm": 1.0859375, "learning_rate": 0.0002938957940451571, "loss": 4.8854, "mean_token_accuracy": 0.23248167484998702, "num_tokens": 95246293.0, "step": 42660 }, { "entropy": 5.439797115325928, "epoch": 4.791711124838547, "grad_norm": 0.91015625, "learning_rate": 0.00029385578685769346, "loss": 4.9969, "mean_token_accuracy": 0.22030054926872253, "num_tokens": 95257240.0, "step": 42665 }, { "entropy": 5.367308807373047, "epoch": 4.792272701746504, "grad_norm": 1.0859375, "learning_rate": 0.0002938157790698544, "loss": 4.8723, "mean_token_accuracy": 0.23114923536777496, "num_tokens": 95267270.0, "step": 42670 }, { "entropy": 5.29309310913086, "epoch": 4.792834278654462, "grad_norm": 1.0234375, "learning_rate": 0.0002937757706829136, "loss": 4.8516, "mean_token_accuracy": 0.22460008710622786, "num_tokens": 95278451.0, "step": 42675 }, { "entropy": 5.284264183044433, "epoch": 4.793395855562419, "grad_norm": 0.99609375, "learning_rate": 0.000293735761698145, "loss": 4.9194, "mean_token_accuracy": 0.23590585887432097, "num_tokens": 95290367.0, "step": 42680 }, { "entropy": 5.3096435546875, "epoch": 4.793957432470377, "grad_norm": 0.97265625, "learning_rate": 0.0002936957521168224, "loss": 4.7692, "mean_token_accuracy": 0.23875954747200012, "num_tokens": 95300875.0, "step": 42685 }, { "entropy": 5.2712689399719235, "epoch": 4.794519009378335, "grad_norm": 1.0, "learning_rate": 0.0002936557419402198, "loss": 4.7997, "mean_token_accuracy": 0.2310612455010414, "num_tokens": 95311299.0, "step": 42690 }, { "entropy": 5.329549932479859, "epoch": 4.795080586286292, "grad_norm": 1.046875, "learning_rate": 0.0002936157311696112, "loss": 4.8938, "mean_token_accuracy": 0.232401442527771, "num_tokens": 95322298.0, "step": 42695 }, { "entropy": 5.366584825515747, "epoch": 4.795642163194249, "grad_norm": 0.98828125, "learning_rate": 0.0002935757198062705, "loss": 4.9742, "mean_token_accuracy": 0.21869388073682786, "num_tokens": 95333190.0, "step": 42700 }, { "entropy": 5.341529178619385, "epoch": 4.796203740102207, "grad_norm": 0.8984375, "learning_rate": 0.0002935357078514717, "loss": 4.8582, "mean_token_accuracy": 0.23462610691785812, "num_tokens": 95344008.0, "step": 42705 }, { "entropy": 5.312467002868653, "epoch": 4.7967653170101645, "grad_norm": 1.0078125, "learning_rate": 0.00029349569530648877, "loss": 4.8256, "mean_token_accuracy": 0.23169538825750352, "num_tokens": 95354746.0, "step": 42710 }, { "entropy": 5.180278205871582, "epoch": 4.797326893918122, "grad_norm": 1.015625, "learning_rate": 0.0002934556821725957, "loss": 4.744, "mean_token_accuracy": 0.2360079139471054, "num_tokens": 95365963.0, "step": 42715 }, { "entropy": 5.314266920089722, "epoch": 4.79788847082608, "grad_norm": 0.97265625, "learning_rate": 0.00029341566845106647, "loss": 4.8907, "mean_token_accuracy": 0.22951397448778152, "num_tokens": 95376807.0, "step": 42720 }, { "entropy": 5.350525283813477, "epoch": 4.798450047734037, "grad_norm": 0.9921875, "learning_rate": 0.0002933756541431753, "loss": 4.9266, "mean_token_accuracy": 0.22568430751562119, "num_tokens": 95387467.0, "step": 42725 }, { "entropy": 5.343288135528565, "epoch": 4.799011624641995, "grad_norm": 1.0859375, "learning_rate": 0.00029333563925019616, "loss": 4.8647, "mean_token_accuracy": 0.23177625238895416, "num_tokens": 95398275.0, "step": 42730 }, { "entropy": 5.299396657943726, "epoch": 4.799573201549952, "grad_norm": 1.015625, "learning_rate": 0.00029329562377340327, "loss": 4.8787, "mean_token_accuracy": 0.22968343496322632, "num_tokens": 95410231.0, "step": 42735 }, { "entropy": 5.251077318191529, "epoch": 4.80013477845791, "grad_norm": 1.109375, "learning_rate": 0.0002932556077140704, "loss": 4.7813, "mean_token_accuracy": 0.2487647458910942, "num_tokens": 95421008.0, "step": 42740 }, { "entropy": 5.299357843399048, "epoch": 4.800696355365868, "grad_norm": 0.9921875, "learning_rate": 0.00029321559107347206, "loss": 4.9028, "mean_token_accuracy": 0.22979382276535035, "num_tokens": 95430972.0, "step": 42745 }, { "entropy": 5.359325122833252, "epoch": 4.801257932273825, "grad_norm": 0.93359375, "learning_rate": 0.00029317557385288216, "loss": 4.887, "mean_token_accuracy": 0.2319648891687393, "num_tokens": 95442486.0, "step": 42750 }, { "entropy": 5.307155895233154, "epoch": 4.801819509181782, "grad_norm": 0.95703125, "learning_rate": 0.000293135556053575, "loss": 4.8676, "mean_token_accuracy": 0.23343969732522965, "num_tokens": 95453994.0, "step": 42755 }, { "entropy": 5.315494632720947, "epoch": 4.80238108608974, "grad_norm": 1.1171875, "learning_rate": 0.00029309553767682467, "loss": 4.8318, "mean_token_accuracy": 0.23557461351156234, "num_tokens": 95463541.0, "step": 42760 }, { "entropy": 5.335611009597779, "epoch": 4.8029426629976975, "grad_norm": 1.03125, "learning_rate": 0.0002930555187239054, "loss": 4.9404, "mean_token_accuracy": 0.22833583503961563, "num_tokens": 95474919.0, "step": 42765 }, { "entropy": 5.294150733947754, "epoch": 4.803504239905655, "grad_norm": 1.0234375, "learning_rate": 0.00029301549919609146, "loss": 4.7749, "mean_token_accuracy": 0.24282611310482025, "num_tokens": 95485110.0, "step": 42770 }, { "entropy": 5.2900879859924315, "epoch": 4.804065816813613, "grad_norm": 1.0, "learning_rate": 0.00029297547909465697, "loss": 4.9169, "mean_token_accuracy": 0.22216370701789856, "num_tokens": 95497210.0, "step": 42775 }, { "entropy": 5.415588665008545, "epoch": 4.80462739372157, "grad_norm": 0.94921875, "learning_rate": 0.0002929354584208763, "loss": 5.0285, "mean_token_accuracy": 0.22394767999649048, "num_tokens": 95510110.0, "step": 42780 }, { "entropy": 5.318846368789673, "epoch": 4.805188970629528, "grad_norm": 1.109375, "learning_rate": 0.0002928954371760237, "loss": 4.9129, "mean_token_accuracy": 0.2279029294848442, "num_tokens": 95520841.0, "step": 42785 }, { "entropy": 5.325888538360596, "epoch": 4.805750547537485, "grad_norm": 1.0234375, "learning_rate": 0.0002928554153613734, "loss": 4.8897, "mean_token_accuracy": 0.23398559540510178, "num_tokens": 95531860.0, "step": 42790 }, { "entropy": 5.345814275741577, "epoch": 4.8063121244454425, "grad_norm": 1.015625, "learning_rate": 0.0002928153929781997, "loss": 4.8738, "mean_token_accuracy": 0.22905177175998687, "num_tokens": 95543533.0, "step": 42795 }, { "entropy": 5.341566181182861, "epoch": 4.806873701353401, "grad_norm": 1.078125, "learning_rate": 0.00029277537002777703, "loss": 4.8085, "mean_token_accuracy": 0.235746431350708, "num_tokens": 95554890.0, "step": 42800 }, { "entropy": 5.337465763092041, "epoch": 4.807435278261358, "grad_norm": 0.9921875, "learning_rate": 0.00029273534651137967, "loss": 4.8698, "mean_token_accuracy": 0.23406989872455597, "num_tokens": 95567849.0, "step": 42805 }, { "entropy": 5.286644458770752, "epoch": 4.807996855169315, "grad_norm": 1.046875, "learning_rate": 0.00029269532243028195, "loss": 4.7586, "mean_token_accuracy": 0.24070949852466583, "num_tokens": 95580047.0, "step": 42810 }, { "entropy": 5.321757650375366, "epoch": 4.808558432077273, "grad_norm": 0.99609375, "learning_rate": 0.0002926552977857584, "loss": 4.8539, "mean_token_accuracy": 0.22867271155118943, "num_tokens": 95590690.0, "step": 42815 }, { "entropy": 5.287789392471313, "epoch": 4.80912000898523, "grad_norm": 1.0, "learning_rate": 0.00029261527257908325, "loss": 4.8859, "mean_token_accuracy": 0.22744768857955933, "num_tokens": 95601439.0, "step": 42820 }, { "entropy": 5.33438925743103, "epoch": 4.809681585893188, "grad_norm": 1.0234375, "learning_rate": 0.00029257524681153106, "loss": 4.8532, "mean_token_accuracy": 0.23291106671094894, "num_tokens": 95611970.0, "step": 42825 }, { "entropy": 5.356077003479004, "epoch": 4.810243162801146, "grad_norm": 0.95703125, "learning_rate": 0.0002925352204843761, "loss": 4.8413, "mean_token_accuracy": 0.23313669264316558, "num_tokens": 95622695.0, "step": 42830 }, { "entropy": 5.315057277679443, "epoch": 4.810804739709103, "grad_norm": 1.0234375, "learning_rate": 0.000292495193598893, "loss": 4.8406, "mean_token_accuracy": 0.2332966849207878, "num_tokens": 95633774.0, "step": 42835 }, { "entropy": 5.246612119674682, "epoch": 4.811366316617061, "grad_norm": 0.984375, "learning_rate": 0.00029245516615635615, "loss": 4.8091, "mean_token_accuracy": 0.23598286062479018, "num_tokens": 95645287.0, "step": 42840 }, { "entropy": 5.364112281799317, "epoch": 4.811927893525018, "grad_norm": 1.3203125, "learning_rate": 0.00029241513815804, "loss": 4.8701, "mean_token_accuracy": 0.2278810277581215, "num_tokens": 95656073.0, "step": 42845 }, { "entropy": 5.361810922622681, "epoch": 4.8124894704329755, "grad_norm": 0.98046875, "learning_rate": 0.00029237510960521904, "loss": 4.9238, "mean_token_accuracy": 0.22782557904720308, "num_tokens": 95668049.0, "step": 42850 }, { "entropy": 5.233780431747436, "epoch": 4.813051047340934, "grad_norm": 1.0625, "learning_rate": 0.000292335080499168, "loss": 4.7445, "mean_token_accuracy": 0.24447658956050872, "num_tokens": 95679539.0, "step": 42855 }, { "entropy": 5.2559043884277346, "epoch": 4.813612624248891, "grad_norm": 1.0, "learning_rate": 0.00029229505084116123, "loss": 4.8266, "mean_token_accuracy": 0.23099856376647948, "num_tokens": 95690759.0, "step": 42860 }, { "entropy": 5.3213907241821286, "epoch": 4.814174201156849, "grad_norm": 1.0390625, "learning_rate": 0.0002922550206324732, "loss": 4.8619, "mean_token_accuracy": 0.2291916251182556, "num_tokens": 95701590.0, "step": 42865 }, { "entropy": 5.4052464962005615, "epoch": 4.814735778064806, "grad_norm": 0.98828125, "learning_rate": 0.0002922149898743787, "loss": 4.9198, "mean_token_accuracy": 0.23098693490028382, "num_tokens": 95711934.0, "step": 42870 }, { "entropy": 5.357414197921753, "epoch": 4.815297354972763, "grad_norm": 0.98828125, "learning_rate": 0.0002921749585681523, "loss": 4.8995, "mean_token_accuracy": 0.22864381223917007, "num_tokens": 95722569.0, "step": 42875 }, { "entropy": 5.3060918807983395, "epoch": 4.8158589318807214, "grad_norm": 1.03125, "learning_rate": 0.00029213492671506855, "loss": 4.9059, "mean_token_accuracy": 0.2228565275669098, "num_tokens": 95733043.0, "step": 42880 }, { "entropy": 5.291569089889526, "epoch": 4.816420508788679, "grad_norm": 0.95703125, "learning_rate": 0.00029209489431640203, "loss": 4.8017, "mean_token_accuracy": 0.23368646800518036, "num_tokens": 95743262.0, "step": 42885 }, { "entropy": 5.375045824050903, "epoch": 4.816982085696636, "grad_norm": 0.85546875, "learning_rate": 0.0002920548613734275, "loss": 4.9345, "mean_token_accuracy": 0.23007966578006744, "num_tokens": 95754708.0, "step": 42890 }, { "entropy": 5.3585028648376465, "epoch": 4.817543662604594, "grad_norm": 0.984375, "learning_rate": 0.00029201482788741953, "loss": 4.9283, "mean_token_accuracy": 0.22821191251277922, "num_tokens": 95765255.0, "step": 42895 }, { "entropy": 5.399783515930176, "epoch": 4.818105239512551, "grad_norm": 1.0234375, "learning_rate": 0.0002919747938596528, "loss": 4.8971, "mean_token_accuracy": 0.2254250705242157, "num_tokens": 95775367.0, "step": 42900 }, { "entropy": 5.3890105247497555, "epoch": 4.818666816420508, "grad_norm": 0.9921875, "learning_rate": 0.0002919347592914021, "loss": 4.927, "mean_token_accuracy": 0.23353558778762817, "num_tokens": 95785952.0, "step": 42905 }, { "entropy": 5.414256238937378, "epoch": 4.8192283933284665, "grad_norm": 1.125, "learning_rate": 0.00029189472418394215, "loss": 5.0412, "mean_token_accuracy": 0.22387515008449554, "num_tokens": 95796407.0, "step": 42910 }, { "entropy": 5.319532585144043, "epoch": 4.819789970236424, "grad_norm": 1.03125, "learning_rate": 0.00029185468853854755, "loss": 4.8497, "mean_token_accuracy": 0.23301519304513932, "num_tokens": 95806698.0, "step": 42915 }, { "entropy": 5.2897931098937985, "epoch": 4.820351547144382, "grad_norm": 1.0, "learning_rate": 0.0002918146523564932, "loss": 4.8162, "mean_token_accuracy": 0.23302064538002015, "num_tokens": 95817975.0, "step": 42920 }, { "entropy": 5.342338037490845, "epoch": 4.820913124052339, "grad_norm": 0.9609375, "learning_rate": 0.00029177461563905375, "loss": 4.8661, "mean_token_accuracy": 0.2357890248298645, "num_tokens": 95828831.0, "step": 42925 }, { "entropy": 5.348430967330932, "epoch": 4.821474700960296, "grad_norm": 1.1640625, "learning_rate": 0.00029173457838750405, "loss": 4.8822, "mean_token_accuracy": 0.230085888504982, "num_tokens": 95840375.0, "step": 42930 }, { "entropy": 5.281631851196289, "epoch": 4.822036277868254, "grad_norm": 1.0859375, "learning_rate": 0.00029169454060311886, "loss": 4.8949, "mean_token_accuracy": 0.23167502284049987, "num_tokens": 95852629.0, "step": 42935 }, { "entropy": 5.345697021484375, "epoch": 4.822597854776212, "grad_norm": 1.046875, "learning_rate": 0.000291654502287173, "loss": 4.9229, "mean_token_accuracy": 0.23165742456912994, "num_tokens": 95862844.0, "step": 42940 }, { "entropy": 5.342270994186402, "epoch": 4.823159431684169, "grad_norm": 1.03125, "learning_rate": 0.0002916144634409414, "loss": 4.8389, "mean_token_accuracy": 0.23228463977575303, "num_tokens": 95873165.0, "step": 42945 }, { "entropy": 5.254854536056518, "epoch": 4.823721008592127, "grad_norm": 0.98046875, "learning_rate": 0.00029157442406569885, "loss": 4.8418, "mean_token_accuracy": 0.22796654403209687, "num_tokens": 95884349.0, "step": 42950 }, { "entropy": 5.2913782596588135, "epoch": 4.824282585500084, "grad_norm": 1.0546875, "learning_rate": 0.0002915343841627201, "loss": 4.8444, "mean_token_accuracy": 0.2326574519276619, "num_tokens": 95894614.0, "step": 42955 }, { "entropy": 5.324865531921387, "epoch": 4.824844162408041, "grad_norm": 1.078125, "learning_rate": 0.0002914943437332802, "loss": 4.886, "mean_token_accuracy": 0.23467847257852553, "num_tokens": 95905644.0, "step": 42960 }, { "entropy": 5.268607950210571, "epoch": 4.8254057393159995, "grad_norm": 0.984375, "learning_rate": 0.00029145430277865406, "loss": 4.8385, "mean_token_accuracy": 0.2309998616576195, "num_tokens": 95915318.0, "step": 42965 }, { "entropy": 5.272212266921997, "epoch": 4.825967316223957, "grad_norm": 1.0234375, "learning_rate": 0.0002914142613001165, "loss": 4.8087, "mean_token_accuracy": 0.2320857286453247, "num_tokens": 95926144.0, "step": 42970 }, { "entropy": 5.259996223449707, "epoch": 4.826528893131915, "grad_norm": 1.0625, "learning_rate": 0.00029137421929894235, "loss": 4.8256, "mean_token_accuracy": 0.2258915677666664, "num_tokens": 95936384.0, "step": 42975 }, { "entropy": 5.353667974472046, "epoch": 4.827090470039872, "grad_norm": 0.9765625, "learning_rate": 0.0002913341767764069, "loss": 4.9262, "mean_token_accuracy": 0.2254423752427101, "num_tokens": 95946597.0, "step": 42980 }, { "entropy": 5.323237800598145, "epoch": 4.827652046947829, "grad_norm": 0.9609375, "learning_rate": 0.00029129413373378484, "loss": 4.8917, "mean_token_accuracy": 0.23017434328794478, "num_tokens": 95958054.0, "step": 42985 }, { "entropy": 5.320249128341675, "epoch": 4.828213623855787, "grad_norm": 0.97265625, "learning_rate": 0.00029125409017235126, "loss": 4.907, "mean_token_accuracy": 0.23131458908319474, "num_tokens": 95969167.0, "step": 42990 }, { "entropy": 5.35586109161377, "epoch": 4.828775200763745, "grad_norm": 1.015625, "learning_rate": 0.0002912140460933812, "loss": 4.8763, "mean_token_accuracy": 0.2334311917424202, "num_tokens": 95980685.0, "step": 42995 }, { "entropy": 5.350427770614624, "epoch": 4.829336777671702, "grad_norm": 1.1015625, "learning_rate": 0.00029117400149814953, "loss": 4.966, "mean_token_accuracy": 0.22223259508609772, "num_tokens": 95991588.0, "step": 43000 }, { "entropy": 5.368867063522339, "epoch": 4.82989835457966, "grad_norm": 1.125, "learning_rate": 0.0002911339563879315, "loss": 4.9265, "mean_token_accuracy": 0.22808744609355927, "num_tokens": 96003035.0, "step": 43005 }, { "entropy": 5.379842138290405, "epoch": 4.830459931487617, "grad_norm": 0.9609375, "learning_rate": 0.0002910939107640019, "loss": 4.9108, "mean_token_accuracy": 0.22827474623918534, "num_tokens": 96013365.0, "step": 43010 }, { "entropy": 5.341946125030518, "epoch": 4.831021508395574, "grad_norm": 1.078125, "learning_rate": 0.000291053864627636, "loss": 4.8171, "mean_token_accuracy": 0.23325565606355667, "num_tokens": 96024140.0, "step": 43015 }, { "entropy": 5.294568872451782, "epoch": 4.831583085303532, "grad_norm": 1.0, "learning_rate": 0.00029101381798010885, "loss": 4.9, "mean_token_accuracy": 0.2232532262802124, "num_tokens": 96035647.0, "step": 43020 }, { "entropy": 5.344024658203125, "epoch": 4.83214466221149, "grad_norm": 1.0625, "learning_rate": 0.0002909737708226954, "loss": 4.8177, "mean_token_accuracy": 0.23930782526731492, "num_tokens": 96046190.0, "step": 43025 }, { "entropy": 5.345743560791016, "epoch": 4.832706239119448, "grad_norm": 0.9765625, "learning_rate": 0.00029093372315667105, "loss": 4.8486, "mean_token_accuracy": 0.23587086498737336, "num_tokens": 96056939.0, "step": 43030 }, { "entropy": 5.257515478134155, "epoch": 4.833267816027405, "grad_norm": 1.015625, "learning_rate": 0.00029089367498331075, "loss": 4.7719, "mean_token_accuracy": 0.23428597897291184, "num_tokens": 96068111.0, "step": 43035 }, { "entropy": 5.25619330406189, "epoch": 4.833829392935362, "grad_norm": 1.140625, "learning_rate": 0.00029085362630388965, "loss": 4.8198, "mean_token_accuracy": 0.23603614270687104, "num_tokens": 96078303.0, "step": 43040 }, { "entropy": 5.310703706741333, "epoch": 4.83439096984332, "grad_norm": 0.96484375, "learning_rate": 0.0002908135771196829, "loss": 4.8038, "mean_token_accuracy": 0.23762328922748566, "num_tokens": 96088492.0, "step": 43045 }, { "entropy": 5.278870582580566, "epoch": 4.8349525467512775, "grad_norm": 0.99609375, "learning_rate": 0.0002907735274319657, "loss": 4.8412, "mean_token_accuracy": 0.23347576409578324, "num_tokens": 96100401.0, "step": 43050 }, { "entropy": 5.323126983642578, "epoch": 4.835514123659236, "grad_norm": 1.0078125, "learning_rate": 0.0002907334772420134, "loss": 4.8841, "mean_token_accuracy": 0.23284367024898528, "num_tokens": 96111848.0, "step": 43055 }, { "entropy": 5.339754486083985, "epoch": 4.836075700567193, "grad_norm": 0.9296875, "learning_rate": 0.000290693426551101, "loss": 4.8794, "mean_token_accuracy": 0.23273054510354996, "num_tokens": 96123544.0, "step": 43060 }, { "entropy": 5.251462173461914, "epoch": 4.83663727747515, "grad_norm": 0.95703125, "learning_rate": 0.00029065337536050384, "loss": 4.8536, "mean_token_accuracy": 0.2332400679588318, "num_tokens": 96134649.0, "step": 43065 }, { "entropy": 5.355578804016114, "epoch": 4.837198854383108, "grad_norm": 0.96875, "learning_rate": 0.00029061332367149705, "loss": 4.9362, "mean_token_accuracy": 0.22919019609689711, "num_tokens": 96147597.0, "step": 43070 }, { "entropy": 5.435472440719605, "epoch": 4.837760431291065, "grad_norm": 1.03125, "learning_rate": 0.00029057327148535614, "loss": 4.9676, "mean_token_accuracy": 0.2293771982192993, "num_tokens": 96157285.0, "step": 43075 }, { "entropy": 5.427551364898681, "epoch": 4.838322008199023, "grad_norm": 0.9921875, "learning_rate": 0.000290533218803356, "loss": 5.0473, "mean_token_accuracy": 0.21637782752513884, "num_tokens": 96169632.0, "step": 43080 }, { "entropy": 5.400629043579102, "epoch": 4.838883585106981, "grad_norm": 1.0703125, "learning_rate": 0.00029049316562677235, "loss": 4.9307, "mean_token_accuracy": 0.23053263127803802, "num_tokens": 96181311.0, "step": 43085 }, { "entropy": 5.383113813400269, "epoch": 4.839445162014938, "grad_norm": 0.90625, "learning_rate": 0.00029045311195688016, "loss": 4.9219, "mean_token_accuracy": 0.23532415181398392, "num_tokens": 96193836.0, "step": 43090 }, { "entropy": 5.358198404312134, "epoch": 4.840006738922895, "grad_norm": 1.046875, "learning_rate": 0.000290413057794955, "loss": 4.8688, "mean_token_accuracy": 0.23525242656469345, "num_tokens": 96204530.0, "step": 43095 }, { "entropy": 5.348000001907349, "epoch": 4.840568315830853, "grad_norm": 1.03125, "learning_rate": 0.00029037300314227205, "loss": 4.8997, "mean_token_accuracy": 0.23065423518419265, "num_tokens": 96215402.0, "step": 43100 }, { "entropy": 5.298193645477295, "epoch": 4.8411298927388104, "grad_norm": 1.046875, "learning_rate": 0.00029033294800010666, "loss": 4.8187, "mean_token_accuracy": 0.23463291972875594, "num_tokens": 96225799.0, "step": 43105 }, { "entropy": 5.316161680221557, "epoch": 4.8416914696467686, "grad_norm": 1.0546875, "learning_rate": 0.00029029289236973436, "loss": 4.9351, "mean_token_accuracy": 0.2238069951534271, "num_tokens": 96236306.0, "step": 43110 }, { "entropy": 5.337806367874146, "epoch": 4.842253046554726, "grad_norm": 0.921875, "learning_rate": 0.00029025283625243043, "loss": 4.8873, "mean_token_accuracy": 0.23056380301713944, "num_tokens": 96247307.0, "step": 43115 }, { "entropy": 5.393820428848267, "epoch": 4.842814623462683, "grad_norm": 0.91015625, "learning_rate": 0.00029021277964947023, "loss": 4.8998, "mean_token_accuracy": 0.2313714176416397, "num_tokens": 96259883.0, "step": 43120 }, { "entropy": 5.286264228820801, "epoch": 4.843376200370641, "grad_norm": 0.99609375, "learning_rate": 0.00029017272256212927, "loss": 4.8545, "mean_token_accuracy": 0.23162703961133957, "num_tokens": 96270219.0, "step": 43125 }, { "entropy": 5.318028831481934, "epoch": 4.843937777278598, "grad_norm": 0.99609375, "learning_rate": 0.0002901326649916829, "loss": 4.9646, "mean_token_accuracy": 0.21764818280935289, "num_tokens": 96281318.0, "step": 43130 }, { "entropy": 5.324691390991211, "epoch": 4.8444993541865555, "grad_norm": 0.9375, "learning_rate": 0.00029009260693940665, "loss": 4.8742, "mean_token_accuracy": 0.23142812848091127, "num_tokens": 96292597.0, "step": 43135 }, { "entropy": 5.281784629821777, "epoch": 4.845060931094514, "grad_norm": 0.921875, "learning_rate": 0.0002900525484065759, "loss": 4.8007, "mean_token_accuracy": 0.23197828829288483, "num_tokens": 96302578.0, "step": 43140 }, { "entropy": 5.331191158294677, "epoch": 4.845622508002471, "grad_norm": 0.97265625, "learning_rate": 0.00029001248939446617, "loss": 4.8444, "mean_token_accuracy": 0.23380081355571747, "num_tokens": 96313268.0, "step": 43145 }, { "entropy": 5.265436506271362, "epoch": 4.846184084910428, "grad_norm": 0.96875, "learning_rate": 0.000289972429904353, "loss": 4.8735, "mean_token_accuracy": 0.23431734293699263, "num_tokens": 96323595.0, "step": 43150 }, { "entropy": 5.340033864974975, "epoch": 4.846745661818386, "grad_norm": 1.0078125, "learning_rate": 0.00028993236993751174, "loss": 4.8788, "mean_token_accuracy": 0.23143659979104997, "num_tokens": 96334698.0, "step": 43155 }, { "entropy": 5.358072710037232, "epoch": 4.847307238726343, "grad_norm": 1.046875, "learning_rate": 0.00028989230949521817, "loss": 4.9799, "mean_token_accuracy": 0.21996584236621858, "num_tokens": 96346107.0, "step": 43160 }, { "entropy": 5.2907391548156735, "epoch": 4.8478688156343015, "grad_norm": 1.0390625, "learning_rate": 0.00028985224857874765, "loss": 4.7969, "mean_token_accuracy": 0.23691593408584594, "num_tokens": 96356301.0, "step": 43165 }, { "entropy": 5.2664165019989015, "epoch": 4.848430392542259, "grad_norm": 0.9921875, "learning_rate": 0.00028981218718937573, "loss": 4.8424, "mean_token_accuracy": 0.23671514093875884, "num_tokens": 96368048.0, "step": 43170 }, { "entropy": 5.329429721832275, "epoch": 4.848991969450216, "grad_norm": 1.0, "learning_rate": 0.00028977212532837804, "loss": 4.8765, "mean_token_accuracy": 0.23309760987758638, "num_tokens": 96379074.0, "step": 43175 }, { "entropy": 5.276646566390991, "epoch": 4.849553546358174, "grad_norm": 0.9765625, "learning_rate": 0.0002897320629970302, "loss": 4.8285, "mean_token_accuracy": 0.2424048513174057, "num_tokens": 96390881.0, "step": 43180 }, { "entropy": 5.345463657379151, "epoch": 4.850115123266131, "grad_norm": 0.9609375, "learning_rate": 0.00028969200019660774, "loss": 4.8789, "mean_token_accuracy": 0.22648611068725585, "num_tokens": 96402211.0, "step": 43185 }, { "entropy": 5.318372392654419, "epoch": 4.8506767001740885, "grad_norm": 1.1015625, "learning_rate": 0.0002896519369283862, "loss": 4.8985, "mean_token_accuracy": 0.2298620581626892, "num_tokens": 96412712.0, "step": 43190 }, { "entropy": 5.3349690437316895, "epoch": 4.851238277082047, "grad_norm": 1.0625, "learning_rate": 0.0002896118731936414, "loss": 4.9146, "mean_token_accuracy": 0.2331255003809929, "num_tokens": 96423516.0, "step": 43195 }, { "entropy": 5.406678628921509, "epoch": 4.851799853990004, "grad_norm": 0.99609375, "learning_rate": 0.0002895718089936489, "loss": 4.9225, "mean_token_accuracy": 0.22649643272161485, "num_tokens": 96434632.0, "step": 43200 }, { "entropy": 5.412808656692505, "epoch": 4.852361430897961, "grad_norm": 0.96484375, "learning_rate": 0.0002895317443296843, "loss": 4.9487, "mean_token_accuracy": 0.2262161836028099, "num_tokens": 96445644.0, "step": 43205 }, { "entropy": 5.339436292648315, "epoch": 4.852923007805919, "grad_norm": 1.0703125, "learning_rate": 0.00028949167920302337, "loss": 4.8608, "mean_token_accuracy": 0.22936105877161025, "num_tokens": 96455921.0, "step": 43210 }, { "entropy": 5.357323265075683, "epoch": 4.853484584713876, "grad_norm": 0.96484375, "learning_rate": 0.00028945161361494177, "loss": 4.8815, "mean_token_accuracy": 0.23438649326562883, "num_tokens": 96466359.0, "step": 43215 }, { "entropy": 5.295104122161865, "epoch": 4.854046161621834, "grad_norm": 1.03125, "learning_rate": 0.0002894115475667151, "loss": 4.9036, "mean_token_accuracy": 0.22728336751461028, "num_tokens": 96478314.0, "step": 43220 }, { "entropy": 5.316946935653687, "epoch": 4.854607738529792, "grad_norm": 1.0546875, "learning_rate": 0.00028937148105961924, "loss": 4.9051, "mean_token_accuracy": 0.23063861429691315, "num_tokens": 96488849.0, "step": 43225 }, { "entropy": 5.305208969116211, "epoch": 4.855169315437749, "grad_norm": 0.86328125, "learning_rate": 0.0002893314140949298, "loss": 4.8519, "mean_token_accuracy": 0.22772152423858644, "num_tokens": 96500102.0, "step": 43230 }, { "entropy": 5.31298975944519, "epoch": 4.855730892345707, "grad_norm": 0.953125, "learning_rate": 0.00028929134667392265, "loss": 4.8463, "mean_token_accuracy": 0.23254792541265487, "num_tokens": 96511416.0, "step": 43235 }, { "entropy": 5.297690582275391, "epoch": 4.856292469253664, "grad_norm": 1.09375, "learning_rate": 0.00028925127879787343, "loss": 4.8698, "mean_token_accuracy": 0.2265419602394104, "num_tokens": 96522486.0, "step": 43240 }, { "entropy": 5.326198768615723, "epoch": 4.856854046161622, "grad_norm": 0.9140625, "learning_rate": 0.0002892112104680579, "loss": 4.8849, "mean_token_accuracy": 0.23170798867940903, "num_tokens": 96533259.0, "step": 43245 }, { "entropy": 5.222328138351441, "epoch": 4.8574156230695795, "grad_norm": 1.0078125, "learning_rate": 0.00028917114168575196, "loss": 4.8329, "mean_token_accuracy": 0.23302036970853807, "num_tokens": 96545409.0, "step": 43250 }, { "entropy": 5.2777549743652346, "epoch": 4.857977199977537, "grad_norm": 0.9765625, "learning_rate": 0.0002891310724522314, "loss": 4.8151, "mean_token_accuracy": 0.22367736846208572, "num_tokens": 96556656.0, "step": 43255 }, { "entropy": 5.299331903457642, "epoch": 4.858538776885495, "grad_norm": 0.92578125, "learning_rate": 0.00028909100276877203, "loss": 4.8218, "mean_token_accuracy": 0.23524726927280426, "num_tokens": 96567542.0, "step": 43260 }, { "entropy": 5.26268367767334, "epoch": 4.859100353793452, "grad_norm": 0.9921875, "learning_rate": 0.00028905093263664966, "loss": 4.7531, "mean_token_accuracy": 0.2323642283678055, "num_tokens": 96579737.0, "step": 43265 }, { "entropy": 5.345893859863281, "epoch": 4.859661930701409, "grad_norm": 0.9921875, "learning_rate": 0.00028901086205714016, "loss": 4.9179, "mean_token_accuracy": 0.22595739960670472, "num_tokens": 96589669.0, "step": 43270 }, { "entropy": 5.344051218032837, "epoch": 4.860223507609367, "grad_norm": 0.93359375, "learning_rate": 0.00028897079103151936, "loss": 4.9461, "mean_token_accuracy": 0.22652770429849625, "num_tokens": 96601852.0, "step": 43275 }, { "entropy": 5.391782522201538, "epoch": 4.860785084517325, "grad_norm": 1.0, "learning_rate": 0.00028893071956106315, "loss": 4.9395, "mean_token_accuracy": 0.2315346747636795, "num_tokens": 96613883.0, "step": 43280 }, { "entropy": 5.259414291381836, "epoch": 4.861346661425282, "grad_norm": 1.109375, "learning_rate": 0.00028889064764704735, "loss": 4.7821, "mean_token_accuracy": 0.2381630226969719, "num_tokens": 96625157.0, "step": 43285 }, { "entropy": 5.325397920608521, "epoch": 4.86190823833324, "grad_norm": 1.046875, "learning_rate": 0.00028885057529074804, "loss": 4.8898, "mean_token_accuracy": 0.2302596315741539, "num_tokens": 96636249.0, "step": 43290 }, { "entropy": 5.405759525299072, "epoch": 4.862469815241197, "grad_norm": 0.9921875, "learning_rate": 0.00028881050249344103, "loss": 4.9746, "mean_token_accuracy": 0.21969633400440217, "num_tokens": 96647315.0, "step": 43295 }, { "entropy": 5.355242347717285, "epoch": 4.863031392149155, "grad_norm": 0.95703125, "learning_rate": 0.0002887704292564022, "loss": 4.8798, "mean_token_accuracy": 0.2295886605978012, "num_tokens": 96658590.0, "step": 43300 }, { "entropy": 5.430629873275757, "epoch": 4.8635929690571125, "grad_norm": 1.046875, "learning_rate": 0.00028873035558090766, "loss": 4.9423, "mean_token_accuracy": 0.22395009100437163, "num_tokens": 96668705.0, "step": 43305 }, { "entropy": 5.315474510192871, "epoch": 4.86415454596507, "grad_norm": 1.0390625, "learning_rate": 0.0002886902814682332, "loss": 4.9102, "mean_token_accuracy": 0.23082761466503143, "num_tokens": 96679588.0, "step": 43310 }, { "entropy": 5.353763771057129, "epoch": 4.864716122873028, "grad_norm": 0.9296875, "learning_rate": 0.00028865020691965485, "loss": 4.9419, "mean_token_accuracy": 0.23244519680738449, "num_tokens": 96691645.0, "step": 43315 }, { "entropy": 5.3849201679229735, "epoch": 4.865277699780985, "grad_norm": 1.0703125, "learning_rate": 0.00028861013193644865, "loss": 4.9406, "mean_token_accuracy": 0.23095204681158066, "num_tokens": 96702530.0, "step": 43320 }, { "entropy": 5.259098911285401, "epoch": 4.865839276688942, "grad_norm": 0.95703125, "learning_rate": 0.0002885700565198906, "loss": 4.8635, "mean_token_accuracy": 0.22545968145132064, "num_tokens": 96714753.0, "step": 43325 }, { "entropy": 5.315648984909058, "epoch": 4.8664008535969, "grad_norm": 1.046875, "learning_rate": 0.00028852998067125675, "loss": 4.8933, "mean_token_accuracy": 0.23347335010766984, "num_tokens": 96726482.0, "step": 43330 }, { "entropy": 5.349673318862915, "epoch": 4.8669624305048576, "grad_norm": 1.046875, "learning_rate": 0.0002884899043918229, "loss": 4.8393, "mean_token_accuracy": 0.23442807346582412, "num_tokens": 96736926.0, "step": 43335 }, { "entropy": 5.34988317489624, "epoch": 4.867524007412815, "grad_norm": 0.98046875, "learning_rate": 0.0002884498276828653, "loss": 4.9623, "mean_token_accuracy": 0.22408774197101594, "num_tokens": 96749429.0, "step": 43340 }, { "entropy": 5.355040884017944, "epoch": 4.868085584320773, "grad_norm": 1.0546875, "learning_rate": 0.00028840975054566007, "loss": 4.9554, "mean_token_accuracy": 0.22587487548589708, "num_tokens": 96761451.0, "step": 43345 }, { "entropy": 5.3646934032440186, "epoch": 4.86864716122873, "grad_norm": 1.0703125, "learning_rate": 0.00028836967298148317, "loss": 4.9168, "mean_token_accuracy": 0.22248540222644805, "num_tokens": 96772717.0, "step": 43350 }, { "entropy": 5.295404291152954, "epoch": 4.869208738136688, "grad_norm": 1.0078125, "learning_rate": 0.00028832959499161065, "loss": 4.8636, "mean_token_accuracy": 0.22597357779741287, "num_tokens": 96784152.0, "step": 43355 }, { "entropy": 5.361203241348266, "epoch": 4.869770315044645, "grad_norm": 1.3125, "learning_rate": 0.0002882895165773187, "loss": 4.8195, "mean_token_accuracy": 0.23361522257328032, "num_tokens": 96794312.0, "step": 43360 }, { "entropy": 5.264232873916626, "epoch": 4.870331891952603, "grad_norm": 0.97265625, "learning_rate": 0.0002882494377398833, "loss": 4.8558, "mean_token_accuracy": 0.23449060916900635, "num_tokens": 96806327.0, "step": 43365 }, { "entropy": 5.305569696426391, "epoch": 4.870893468860561, "grad_norm": 0.89453125, "learning_rate": 0.00028820935848058066, "loss": 4.897, "mean_token_accuracy": 0.22720257937908173, "num_tokens": 96818264.0, "step": 43370 }, { "entropy": 5.3297031879425045, "epoch": 4.871455045768518, "grad_norm": 1.015625, "learning_rate": 0.000288169278800687, "loss": 4.8295, "mean_token_accuracy": 0.23555526435375213, "num_tokens": 96828082.0, "step": 43375 }, { "entropy": 5.397797775268555, "epoch": 4.872016622676475, "grad_norm": 1.0234375, "learning_rate": 0.00028812919870147837, "loss": 4.9364, "mean_token_accuracy": 0.23351891040802003, "num_tokens": 96838269.0, "step": 43380 }, { "entropy": 5.255085754394531, "epoch": 4.872578199584433, "grad_norm": 1.0625, "learning_rate": 0.00028808911818423096, "loss": 4.7832, "mean_token_accuracy": 0.23676198720932007, "num_tokens": 96847931.0, "step": 43385 }, { "entropy": 5.329758787155152, "epoch": 4.8731397764923905, "grad_norm": 1.0078125, "learning_rate": 0.00028804903725022094, "loss": 4.8874, "mean_token_accuracy": 0.22854242622852325, "num_tokens": 96858721.0, "step": 43390 }, { "entropy": 5.296429824829102, "epoch": 4.873701353400348, "grad_norm": 0.96875, "learning_rate": 0.0002880089559007245, "loss": 4.8685, "mean_token_accuracy": 0.23064084798097612, "num_tokens": 96869928.0, "step": 43395 }, { "entropy": 5.285370397567749, "epoch": 4.874262930308306, "grad_norm": 1.1171875, "learning_rate": 0.0002879688741370179, "loss": 4.8081, "mean_token_accuracy": 0.23379067778587342, "num_tokens": 96880343.0, "step": 43400 }, { "entropy": 5.3252222537994385, "epoch": 4.874824507216263, "grad_norm": 0.95703125, "learning_rate": 0.0002879287919603773, "loss": 4.8926, "mean_token_accuracy": 0.22885009944438933, "num_tokens": 96892175.0, "step": 43405 }, { "entropy": 5.312579107284546, "epoch": 4.875386084124221, "grad_norm": 1.1640625, "learning_rate": 0.00028788870937207896, "loss": 4.8908, "mean_token_accuracy": 0.22775400280952454, "num_tokens": 96903312.0, "step": 43410 }, { "entropy": 5.2522852420806885, "epoch": 4.875947661032178, "grad_norm": 1.046875, "learning_rate": 0.0002878486263733991, "loss": 4.7285, "mean_token_accuracy": 0.23988295942544938, "num_tokens": 96914383.0, "step": 43415 }, { "entropy": 5.25719690322876, "epoch": 4.876509237940136, "grad_norm": 0.96875, "learning_rate": 0.000287808542965614, "loss": 4.7243, "mean_token_accuracy": 0.2466825872659683, "num_tokens": 96925340.0, "step": 43420 }, { "entropy": 5.266987085342407, "epoch": 4.877070814848094, "grad_norm": 1.0234375, "learning_rate": 0.00028776845914999996, "loss": 4.8718, "mean_token_accuracy": 0.22936150431632996, "num_tokens": 96937138.0, "step": 43425 }, { "entropy": 5.3050812721252445, "epoch": 4.877632391756051, "grad_norm": 1.0, "learning_rate": 0.0002877283749278332, "loss": 4.8281, "mean_token_accuracy": 0.22736894935369492, "num_tokens": 96948645.0, "step": 43430 }, { "entropy": 5.267594242095948, "epoch": 4.878193968664009, "grad_norm": 1.0234375, "learning_rate": 0.00028768829030039, "loss": 4.8196, "mean_token_accuracy": 0.23601215481758117, "num_tokens": 96959090.0, "step": 43435 }, { "entropy": 5.329309797286987, "epoch": 4.878755545571966, "grad_norm": 1.046875, "learning_rate": 0.00028764820526894675, "loss": 4.9405, "mean_token_accuracy": 0.22125795781612395, "num_tokens": 96968679.0, "step": 43440 }, { "entropy": 5.357925081253052, "epoch": 4.879317122479923, "grad_norm": 1.0078125, "learning_rate": 0.00028760811983477976, "loss": 4.926, "mean_token_accuracy": 0.23245888203382492, "num_tokens": 96980180.0, "step": 43445 }, { "entropy": 5.33661150932312, "epoch": 4.8798786993878815, "grad_norm": 1.0546875, "learning_rate": 0.00028756803399916534, "loss": 4.9136, "mean_token_accuracy": 0.22769194096326828, "num_tokens": 96991418.0, "step": 43450 }, { "entropy": 5.321838760375977, "epoch": 4.880440276295839, "grad_norm": 1.0390625, "learning_rate": 0.0002875279477633798, "loss": 4.8555, "mean_token_accuracy": 0.23519182354211807, "num_tokens": 97002052.0, "step": 43455 }, { "entropy": 5.252468824386597, "epoch": 4.881001853203796, "grad_norm": 0.96875, "learning_rate": 0.0002874878611286995, "loss": 4.8535, "mean_token_accuracy": 0.229627887904644, "num_tokens": 97014303.0, "step": 43460 }, { "entropy": 5.239798498153687, "epoch": 4.881563430111754, "grad_norm": 0.9609375, "learning_rate": 0.000287447774096401, "loss": 4.734, "mean_token_accuracy": 0.24361055642366408, "num_tokens": 97025716.0, "step": 43465 }, { "entropy": 5.245723295211792, "epoch": 4.882125007019711, "grad_norm": 0.96484375, "learning_rate": 0.00028740768666776046, "loss": 4.8457, "mean_token_accuracy": 0.22692623287439345, "num_tokens": 97037285.0, "step": 43470 }, { "entropy": 5.258013916015625, "epoch": 4.8826865839276685, "grad_norm": 0.98828125, "learning_rate": 0.00028736759884405433, "loss": 4.9138, "mean_token_accuracy": 0.22613944709300995, "num_tokens": 97048601.0, "step": 43475 }, { "entropy": 5.309021377563477, "epoch": 4.883248160835627, "grad_norm": 1.0859375, "learning_rate": 0.0002873275106265591, "loss": 4.7743, "mean_token_accuracy": 0.23627099841833116, "num_tokens": 97059763.0, "step": 43480 }, { "entropy": 5.363088893890381, "epoch": 4.883809737743584, "grad_norm": 1.078125, "learning_rate": 0.00028728742201655116, "loss": 4.9056, "mean_token_accuracy": 0.22974938601255418, "num_tokens": 97070210.0, "step": 43485 }, { "entropy": 5.421697282791138, "epoch": 4.884371314651542, "grad_norm": 0.9609375, "learning_rate": 0.000287247333015307, "loss": 4.999, "mean_token_accuracy": 0.2225547879934311, "num_tokens": 97081625.0, "step": 43490 }, { "entropy": 5.3555773258209225, "epoch": 4.884932891559499, "grad_norm": 1.0078125, "learning_rate": 0.0002872072436241029, "loss": 4.9047, "mean_token_accuracy": 0.22872087508440017, "num_tokens": 97092414.0, "step": 43495 }, { "entropy": 5.292194557189942, "epoch": 4.885494468467456, "grad_norm": 1.0390625, "learning_rate": 0.0002871671538442155, "loss": 4.8677, "mean_token_accuracy": 0.23707842826843262, "num_tokens": 97103360.0, "step": 43500 }, { "entropy": 5.24903244972229, "epoch": 4.8860560453754145, "grad_norm": 1.03125, "learning_rate": 0.0002871270636769212, "loss": 4.7843, "mean_token_accuracy": 0.23223959803581237, "num_tokens": 97115128.0, "step": 43505 }, { "entropy": 5.268277978897094, "epoch": 4.886617622283372, "grad_norm": 1.03125, "learning_rate": 0.0002870869731234965, "loss": 4.8032, "mean_token_accuracy": 0.24308907985687256, "num_tokens": 97126696.0, "step": 43510 }, { "entropy": 5.360691404342651, "epoch": 4.887179199191329, "grad_norm": 1.09375, "learning_rate": 0.0002870468821852178, "loss": 4.8967, "mean_token_accuracy": 0.2323077902197838, "num_tokens": 97139072.0, "step": 43515 }, { "entropy": 5.317084074020386, "epoch": 4.887740776099287, "grad_norm": 1.0546875, "learning_rate": 0.00028700679086336175, "loss": 4.8581, "mean_token_accuracy": 0.23282939791679383, "num_tokens": 97150525.0, "step": 43520 }, { "entropy": 5.260127973556519, "epoch": 4.888302353007244, "grad_norm": 1.0078125, "learning_rate": 0.0002869666991592048, "loss": 4.8186, "mean_token_accuracy": 0.2285119354724884, "num_tokens": 97161862.0, "step": 43525 }, { "entropy": 5.317036294937134, "epoch": 4.8888639299152015, "grad_norm": 1.078125, "learning_rate": 0.0002869266070740235, "loss": 4.8305, "mean_token_accuracy": 0.23852730095386504, "num_tokens": 97171875.0, "step": 43530 }, { "entropy": 5.34832911491394, "epoch": 4.88942550682316, "grad_norm": 1.0, "learning_rate": 0.0002868865146090944, "loss": 4.8804, "mean_token_accuracy": 0.23183713555336, "num_tokens": 97182683.0, "step": 43535 }, { "entropy": 5.406647396087647, "epoch": 4.889987083731117, "grad_norm": 1.1015625, "learning_rate": 0.00028684642176569414, "loss": 4.8672, "mean_token_accuracy": 0.22994759529829026, "num_tokens": 97192983.0, "step": 43540 }, { "entropy": 5.290046072006225, "epoch": 4.890548660639075, "grad_norm": 1.046875, "learning_rate": 0.0002868063285450992, "loss": 4.8771, "mean_token_accuracy": 0.2355479910969734, "num_tokens": 97203000.0, "step": 43545 }, { "entropy": 5.289004611968994, "epoch": 4.891110237547032, "grad_norm": 0.984375, "learning_rate": 0.0002867662349485861, "loss": 4.8066, "mean_token_accuracy": 0.23648800551891327, "num_tokens": 97213103.0, "step": 43550 }, { "entropy": 5.378039264678955, "epoch": 4.891671814454989, "grad_norm": 1.09375, "learning_rate": 0.00028672614097743156, "loss": 4.9129, "mean_token_accuracy": 0.2248881533741951, "num_tokens": 97224123.0, "step": 43555 }, { "entropy": 5.249356365203857, "epoch": 4.892233391362947, "grad_norm": 0.96875, "learning_rate": 0.00028668604663291213, "loss": 4.8289, "mean_token_accuracy": 0.22726954221725465, "num_tokens": 97235849.0, "step": 43560 }, { "entropy": 5.371703052520752, "epoch": 4.892794968270905, "grad_norm": 1.0625, "learning_rate": 0.00028664595191630455, "loss": 4.9645, "mean_token_accuracy": 0.22203558087348937, "num_tokens": 97247382.0, "step": 43565 }, { "entropy": 5.372456455230713, "epoch": 4.893356545178862, "grad_norm": 1.046875, "learning_rate": 0.00028660585682888524, "loss": 4.9114, "mean_token_accuracy": 0.22958250045776368, "num_tokens": 97258704.0, "step": 43570 }, { "entropy": 5.3771453380584715, "epoch": 4.89391812208682, "grad_norm": 0.97265625, "learning_rate": 0.00028656576137193096, "loss": 4.9599, "mean_token_accuracy": 0.22788091748952866, "num_tokens": 97270080.0, "step": 43575 }, { "entropy": 5.342940998077393, "epoch": 4.894479698994777, "grad_norm": 0.953125, "learning_rate": 0.0002865256655467184, "loss": 4.827, "mean_token_accuracy": 0.23564284145832062, "num_tokens": 97281560.0, "step": 43580 }, { "entropy": 5.2959856510162355, "epoch": 4.895041275902734, "grad_norm": 0.98828125, "learning_rate": 0.0002864855693545241, "loss": 4.841, "mean_token_accuracy": 0.22396003305912018, "num_tokens": 97292970.0, "step": 43585 }, { "entropy": 5.227031898498535, "epoch": 4.8956028528106925, "grad_norm": 1.078125, "learning_rate": 0.00028644547279662485, "loss": 4.7918, "mean_token_accuracy": 0.24001364260911942, "num_tokens": 97302481.0, "step": 43590 }, { "entropy": 5.447815990447998, "epoch": 4.89616442971865, "grad_norm": 1.3046875, "learning_rate": 0.00028640537587429734, "loss": 5.0401, "mean_token_accuracy": 0.2186543047428131, "num_tokens": 97315382.0, "step": 43595 }, { "entropy": 5.335455369949341, "epoch": 4.896726006626608, "grad_norm": 1.0234375, "learning_rate": 0.0002863652785888182, "loss": 4.7676, "mean_token_accuracy": 0.24200854748487471, "num_tokens": 97325657.0, "step": 43600 }, { "entropy": 5.29167628288269, "epoch": 4.897287583534565, "grad_norm": 0.98046875, "learning_rate": 0.0002863251809414642, "loss": 4.8577, "mean_token_accuracy": 0.23164136707782745, "num_tokens": 97336792.0, "step": 43605 }, { "entropy": 5.270018148422241, "epoch": 4.897849160442522, "grad_norm": 0.99609375, "learning_rate": 0.000286285082933512, "loss": 4.8939, "mean_token_accuracy": 0.23587997257709503, "num_tokens": 97348439.0, "step": 43610 }, { "entropy": 5.348113107681274, "epoch": 4.89841073735048, "grad_norm": 1.0703125, "learning_rate": 0.0002862449845662385, "loss": 4.9021, "mean_token_accuracy": 0.22562716752290726, "num_tokens": 97360429.0, "step": 43615 }, { "entropy": 5.386110639572143, "epoch": 4.898972314258438, "grad_norm": 1.0859375, "learning_rate": 0.0002862048858409201, "loss": 4.9264, "mean_token_accuracy": 0.23741941303014755, "num_tokens": 97371105.0, "step": 43620 }, { "entropy": 5.269165706634522, "epoch": 4.899533891166396, "grad_norm": 1.015625, "learning_rate": 0.000286164786758834, "loss": 4.8166, "mean_token_accuracy": 0.2354582816362381, "num_tokens": 97381789.0, "step": 43625 }, { "entropy": 5.261893081665039, "epoch": 4.900095468074353, "grad_norm": 1.046875, "learning_rate": 0.00028612468732125667, "loss": 4.9326, "mean_token_accuracy": 0.2203940525650978, "num_tokens": 97393653.0, "step": 43630 }, { "entropy": 5.306213855743408, "epoch": 4.90065704498231, "grad_norm": 1.0625, "learning_rate": 0.0002860845875294651, "loss": 4.8415, "mean_token_accuracy": 0.231693859398365, "num_tokens": 97403475.0, "step": 43635 }, { "entropy": 5.371659851074218, "epoch": 4.901218621890268, "grad_norm": 1.0625, "learning_rate": 0.0002860444873847358, "loss": 4.9388, "mean_token_accuracy": 0.22735889703035356, "num_tokens": 97415124.0, "step": 43640 }, { "entropy": 5.346455335617065, "epoch": 4.9017801987982255, "grad_norm": 1.0078125, "learning_rate": 0.00028600438688834587, "loss": 4.9051, "mean_token_accuracy": 0.23143184036016465, "num_tokens": 97426019.0, "step": 43645 }, { "entropy": 5.300188875198364, "epoch": 4.902341775706183, "grad_norm": 0.9921875, "learning_rate": 0.000285964286041572, "loss": 4.9329, "mean_token_accuracy": 0.22373491674661636, "num_tokens": 97437678.0, "step": 43650 }, { "entropy": 5.30559287071228, "epoch": 4.902903352614141, "grad_norm": 0.97265625, "learning_rate": 0.00028592418484569095, "loss": 4.817, "mean_token_accuracy": 0.23448545783758162, "num_tokens": 97448884.0, "step": 43655 }, { "entropy": 5.318466138839722, "epoch": 4.903464929522098, "grad_norm": 1.0, "learning_rate": 0.0002858840833019795, "loss": 4.8364, "mean_token_accuracy": 0.23811340630054473, "num_tokens": 97459875.0, "step": 43660 }, { "entropy": 5.299627876281738, "epoch": 4.904026506430055, "grad_norm": 1.015625, "learning_rate": 0.0002858439814117148, "loss": 4.7693, "mean_token_accuracy": 0.24229296892881394, "num_tokens": 97470238.0, "step": 43665 }, { "entropy": 5.3799244403839115, "epoch": 4.904588083338013, "grad_norm": 0.984375, "learning_rate": 0.00028580387917617343, "loss": 4.8829, "mean_token_accuracy": 0.23038016110658646, "num_tokens": 97481561.0, "step": 43670 }, { "entropy": 5.373349237442016, "epoch": 4.9051496602459705, "grad_norm": 0.953125, "learning_rate": 0.0002857637765966324, "loss": 4.9768, "mean_token_accuracy": 0.22437910735607147, "num_tokens": 97493959.0, "step": 43675 }, { "entropy": 5.264508390426636, "epoch": 4.905711237153929, "grad_norm": 1.015625, "learning_rate": 0.0002857236736743685, "loss": 4.8345, "mean_token_accuracy": 0.236747707426548, "num_tokens": 97505613.0, "step": 43680 }, { "entropy": 5.349529647827149, "epoch": 4.906272814061886, "grad_norm": 0.98046875, "learning_rate": 0.0002856835704106587, "loss": 4.9046, "mean_token_accuracy": 0.22886948734521867, "num_tokens": 97517730.0, "step": 43685 }, { "entropy": 5.274074554443359, "epoch": 4.906834390969843, "grad_norm": 0.984375, "learning_rate": 0.00028564346680677995, "loss": 4.7701, "mean_token_accuracy": 0.2371492028236389, "num_tokens": 97528194.0, "step": 43690 }, { "entropy": 5.287001609802246, "epoch": 4.907395967877801, "grad_norm": 0.95703125, "learning_rate": 0.0002856033628640089, "loss": 4.8541, "mean_token_accuracy": 0.22040757536888123, "num_tokens": 97538980.0, "step": 43695 }, { "entropy": 5.326306962966919, "epoch": 4.907957544785758, "grad_norm": 0.953125, "learning_rate": 0.0002855632585836228, "loss": 4.896, "mean_token_accuracy": 0.22839174419641495, "num_tokens": 97550250.0, "step": 43700 }, { "entropy": 5.363025236129761, "epoch": 4.908519121693716, "grad_norm": 0.97265625, "learning_rate": 0.00028552315396689846, "loss": 4.929, "mean_token_accuracy": 0.2265319123864174, "num_tokens": 97561687.0, "step": 43705 }, { "entropy": 5.389482307434082, "epoch": 4.909080698601674, "grad_norm": 1.0, "learning_rate": 0.0002854830490151128, "loss": 4.9241, "mean_token_accuracy": 0.22430268079042434, "num_tokens": 97572820.0, "step": 43710 }, { "entropy": 5.263682889938354, "epoch": 4.909642275509631, "grad_norm": 1.03125, "learning_rate": 0.00028544294372954276, "loss": 4.8469, "mean_token_accuracy": 0.23596428632736205, "num_tokens": 97583556.0, "step": 43715 }, { "entropy": 5.36049747467041, "epoch": 4.910203852417588, "grad_norm": 1.0859375, "learning_rate": 0.0002854028381114654, "loss": 4.9034, "mean_token_accuracy": 0.22820814549922944, "num_tokens": 97594503.0, "step": 43720 }, { "entropy": 5.275243806838989, "epoch": 4.910765429325546, "grad_norm": 1.0, "learning_rate": 0.00028536273216215756, "loss": 4.7679, "mean_token_accuracy": 0.23475221246480943, "num_tokens": 97603811.0, "step": 43725 }, { "entropy": 5.405625104904175, "epoch": 4.9113270062335035, "grad_norm": 1.0625, "learning_rate": 0.00028532262588289636, "loss": 4.9555, "mean_token_accuracy": 0.22812681049108505, "num_tokens": 97614573.0, "step": 43730 }, { "entropy": 5.3233311653137205, "epoch": 4.911888583141462, "grad_norm": 0.96484375, "learning_rate": 0.00028528251927495874, "loss": 4.8184, "mean_token_accuracy": 0.23509712964296342, "num_tokens": 97625928.0, "step": 43735 }, { "entropy": 5.285038328170776, "epoch": 4.912450160049419, "grad_norm": 0.98828125, "learning_rate": 0.00028524241233962176, "loss": 4.8217, "mean_token_accuracy": 0.2273826077580452, "num_tokens": 97635763.0, "step": 43740 }, { "entropy": 5.3496777534484865, "epoch": 4.913011736957376, "grad_norm": 1.0078125, "learning_rate": 0.00028520230507816236, "loss": 4.9645, "mean_token_accuracy": 0.22293906062841415, "num_tokens": 97648460.0, "step": 43745 }, { "entropy": 5.312964248657226, "epoch": 4.913573313865334, "grad_norm": 1.0546875, "learning_rate": 0.00028516219749185755, "loss": 4.8902, "mean_token_accuracy": 0.23015811890363694, "num_tokens": 97659997.0, "step": 43750 }, { "entropy": 5.3918619632720945, "epoch": 4.914134890773291, "grad_norm": 0.93359375, "learning_rate": 0.0002851220895819845, "loss": 4.9134, "mean_token_accuracy": 0.2331821545958519, "num_tokens": 97671709.0, "step": 43755 }, { "entropy": 5.3747790336608885, "epoch": 4.914696467681249, "grad_norm": 0.953125, "learning_rate": 0.00028508198134982016, "loss": 4.9275, "mean_token_accuracy": 0.22697795629501344, "num_tokens": 97683237.0, "step": 43760 }, { "entropy": 5.375089073181153, "epoch": 4.915258044589207, "grad_norm": 1.015625, "learning_rate": 0.00028504187279664164, "loss": 4.899, "mean_token_accuracy": 0.2325640082359314, "num_tokens": 97694979.0, "step": 43765 }, { "entropy": 5.313180875778198, "epoch": 4.915819621497164, "grad_norm": 0.984375, "learning_rate": 0.000285001763923726, "loss": 4.8439, "mean_token_accuracy": 0.23218737095594405, "num_tokens": 97705525.0, "step": 43770 }, { "entropy": 5.316745567321777, "epoch": 4.916381198405121, "grad_norm": 0.96484375, "learning_rate": 0.0002849616547323503, "loss": 4.9281, "mean_token_accuracy": 0.2307622402906418, "num_tokens": 97715679.0, "step": 43775 }, { "entropy": 5.36646466255188, "epoch": 4.916942775313079, "grad_norm": 0.97265625, "learning_rate": 0.00028492154522379167, "loss": 4.9058, "mean_token_accuracy": 0.22269349843263625, "num_tokens": 97727567.0, "step": 43780 }, { "entropy": 5.3884687423706055, "epoch": 4.917504352221036, "grad_norm": 1.015625, "learning_rate": 0.0002848814353993273, "loss": 4.8699, "mean_token_accuracy": 0.23473931699991227, "num_tokens": 97738066.0, "step": 43785 }, { "entropy": 5.293538379669189, "epoch": 4.9180659291289945, "grad_norm": 1.0234375, "learning_rate": 0.00028484132526023404, "loss": 4.8623, "mean_token_accuracy": 0.2364138826727867, "num_tokens": 97748839.0, "step": 43790 }, { "entropy": 5.361705541610718, "epoch": 4.918627506036952, "grad_norm": 1.0078125, "learning_rate": 0.0002848012148077892, "loss": 4.908, "mean_token_accuracy": 0.2308024361729622, "num_tokens": 97759762.0, "step": 43795 }, { "entropy": 5.359376668930054, "epoch": 4.919189082944909, "grad_norm": 1.0078125, "learning_rate": 0.00028476110404326984, "loss": 4.9252, "mean_token_accuracy": 0.22927218526601792, "num_tokens": 97770546.0, "step": 43800 }, { "entropy": 5.287531423568725, "epoch": 4.919750659852867, "grad_norm": 0.91015625, "learning_rate": 0.0002847209929679532, "loss": 4.8303, "mean_token_accuracy": 0.2370566263794899, "num_tokens": 97781768.0, "step": 43805 }, { "entropy": 5.304828691482544, "epoch": 4.920312236760824, "grad_norm": 1.015625, "learning_rate": 0.0002846808815831164, "loss": 4.8419, "mean_token_accuracy": 0.23243265450000763, "num_tokens": 97793132.0, "step": 43810 }, { "entropy": 5.310479593276978, "epoch": 4.920873813668782, "grad_norm": 0.98828125, "learning_rate": 0.0002846407698900365, "loss": 4.9424, "mean_token_accuracy": 0.2304024338722229, "num_tokens": 97804136.0, "step": 43815 }, { "entropy": 5.399616813659668, "epoch": 4.92143539057674, "grad_norm": 1.125, "learning_rate": 0.00028460065788999073, "loss": 4.9547, "mean_token_accuracy": 0.23554362952709199, "num_tokens": 97814722.0, "step": 43820 }, { "entropy": 5.410502290725708, "epoch": 4.921996967484697, "grad_norm": 1.0390625, "learning_rate": 0.0002845605455842564, "loss": 4.8925, "mean_token_accuracy": 0.2298137679696083, "num_tokens": 97826131.0, "step": 43825 }, { "entropy": 5.374788808822632, "epoch": 4.922558544392655, "grad_norm": 0.953125, "learning_rate": 0.0002845204329741106, "loss": 4.966, "mean_token_accuracy": 0.22769310027360917, "num_tokens": 97837401.0, "step": 43830 }, { "entropy": 5.364683341979981, "epoch": 4.923120121300612, "grad_norm": 1.03125, "learning_rate": 0.0002844803200608304, "loss": 4.9016, "mean_token_accuracy": 0.23265491873025895, "num_tokens": 97848559.0, "step": 43835 }, { "entropy": 5.367771244049072, "epoch": 4.923681698208569, "grad_norm": 0.96484375, "learning_rate": 0.0002844402068456931, "loss": 4.8362, "mean_token_accuracy": 0.22819226682186128, "num_tokens": 97860384.0, "step": 43840 }, { "entropy": 5.285113143920898, "epoch": 4.9242432751165275, "grad_norm": 0.9453125, "learning_rate": 0.0002844000933299761, "loss": 4.8448, "mean_token_accuracy": 0.2321562111377716, "num_tokens": 97871060.0, "step": 43845 }, { "entropy": 5.247565126419067, "epoch": 4.924804852024485, "grad_norm": 0.99609375, "learning_rate": 0.00028435997951495643, "loss": 4.8099, "mean_token_accuracy": 0.2360501617193222, "num_tokens": 97881449.0, "step": 43850 }, { "entropy": 5.257348823547363, "epoch": 4.925366428932442, "grad_norm": 0.90625, "learning_rate": 0.0002843198654019114, "loss": 4.7791, "mean_token_accuracy": 0.2396544799208641, "num_tokens": 97894204.0, "step": 43855 }, { "entropy": 5.364230680465698, "epoch": 4.9259280058404, "grad_norm": 0.9765625, "learning_rate": 0.0002842797509921182, "loss": 4.9421, "mean_token_accuracy": 0.22929206639528274, "num_tokens": 97906690.0, "step": 43860 }, { "entropy": 5.317640924453736, "epoch": 4.926489582748357, "grad_norm": 1.0546875, "learning_rate": 0.00028423963628685414, "loss": 4.8534, "mean_token_accuracy": 0.22905247956514357, "num_tokens": 97918006.0, "step": 43865 }, { "entropy": 5.314087724685669, "epoch": 4.927051159656315, "grad_norm": 1.0078125, "learning_rate": 0.0002841995212873965, "loss": 4.8337, "mean_token_accuracy": 0.23329581916332245, "num_tokens": 97928904.0, "step": 43870 }, { "entropy": 5.394802188873291, "epoch": 4.927612736564273, "grad_norm": 1.1015625, "learning_rate": 0.0002841594059950225, "loss": 5.0332, "mean_token_accuracy": 0.21941060125827788, "num_tokens": 97942379.0, "step": 43875 }, { "entropy": 5.3418519496917725, "epoch": 4.92817431347223, "grad_norm": 1.078125, "learning_rate": 0.00028411929041100947, "loss": 4.8208, "mean_token_accuracy": 0.23636738657951356, "num_tokens": 97952462.0, "step": 43880 }, { "entropy": 5.343882894515991, "epoch": 4.928735890380188, "grad_norm": 1.109375, "learning_rate": 0.0002840791745366347, "loss": 4.8899, "mean_token_accuracy": 0.22578718811273574, "num_tokens": 97964798.0, "step": 43885 }, { "entropy": 5.294370412826538, "epoch": 4.929297467288145, "grad_norm": 1.015625, "learning_rate": 0.00028403905837317547, "loss": 4.9477, "mean_token_accuracy": 0.22700662910938263, "num_tokens": 97975617.0, "step": 43890 }, { "entropy": 5.2771800518035885, "epoch": 4.929859044196102, "grad_norm": 1.0859375, "learning_rate": 0.00028399894192190916, "loss": 4.8346, "mean_token_accuracy": 0.23581611216068268, "num_tokens": 97986404.0, "step": 43895 }, { "entropy": 5.3818747997283936, "epoch": 4.93042062110406, "grad_norm": 0.9296875, "learning_rate": 0.00028395882518411305, "loss": 4.9197, "mean_token_accuracy": 0.22851255983114244, "num_tokens": 97999256.0, "step": 43900 }, { "entropy": 5.391334676742554, "epoch": 4.930982198012018, "grad_norm": 0.95703125, "learning_rate": 0.0002839187081610645, "loss": 4.8776, "mean_token_accuracy": 0.22823070883750915, "num_tokens": 98010018.0, "step": 43905 }, { "entropy": 5.358220148086548, "epoch": 4.931543774919975, "grad_norm": 0.98828125, "learning_rate": 0.0002838785908540407, "loss": 4.9041, "mean_token_accuracy": 0.22924142330884933, "num_tokens": 98020485.0, "step": 43910 }, { "entropy": 5.271506643295288, "epoch": 4.932105351827933, "grad_norm": 1.0546875, "learning_rate": 0.00028383847326431924, "loss": 4.854, "mean_token_accuracy": 0.23586402982473373, "num_tokens": 98030495.0, "step": 43915 }, { "entropy": 5.283480834960938, "epoch": 4.93266692873589, "grad_norm": 0.94140625, "learning_rate": 0.00028379835539317727, "loss": 4.8869, "mean_token_accuracy": 0.2284668579697609, "num_tokens": 98041623.0, "step": 43920 }, { "entropy": 5.322345876693726, "epoch": 4.933228505643848, "grad_norm": 1.0703125, "learning_rate": 0.0002837582372418923, "loss": 4.7975, "mean_token_accuracy": 0.24158926606178283, "num_tokens": 98052045.0, "step": 43925 }, { "entropy": 5.406316757202148, "epoch": 4.9337900825518055, "grad_norm": 1.09375, "learning_rate": 0.0002837181188117417, "loss": 4.9347, "mean_token_accuracy": 0.2243686005473137, "num_tokens": 98064358.0, "step": 43930 }, { "entropy": 5.282062959671021, "epoch": 4.934351659459763, "grad_norm": 0.99609375, "learning_rate": 0.0002836780001040028, "loss": 4.8181, "mean_token_accuracy": 0.23010243028402327, "num_tokens": 98075328.0, "step": 43935 }, { "entropy": 5.309149932861328, "epoch": 4.934913236367721, "grad_norm": 1.0546875, "learning_rate": 0.000283637881119953, "loss": 4.9097, "mean_token_accuracy": 0.2245876297354698, "num_tokens": 98085588.0, "step": 43940 }, { "entropy": 5.288299322128296, "epoch": 4.935474813275678, "grad_norm": 1.015625, "learning_rate": 0.00028359776186086965, "loss": 4.8728, "mean_token_accuracy": 0.22747464925050737, "num_tokens": 98096249.0, "step": 43945 }, { "entropy": 5.39266939163208, "epoch": 4.936036390183635, "grad_norm": 1.0546875, "learning_rate": 0.0002835576423280303, "loss": 4.8984, "mean_token_accuracy": 0.22641366273164748, "num_tokens": 98107498.0, "step": 43950 }, { "entropy": 5.388674068450928, "epoch": 4.936597967091593, "grad_norm": 0.9453125, "learning_rate": 0.0002835175225227123, "loss": 4.9344, "mean_token_accuracy": 0.23377058804035186, "num_tokens": 98119918.0, "step": 43955 }, { "entropy": 5.293115234375, "epoch": 4.937159543999551, "grad_norm": 0.984375, "learning_rate": 0.0002834774024461931, "loss": 4.8412, "mean_token_accuracy": 0.22545841485261917, "num_tokens": 98130923.0, "step": 43960 }, { "entropy": 5.265460586547851, "epoch": 4.937721120907508, "grad_norm": 1.0078125, "learning_rate": 0.00028343728209975, "loss": 4.7945, "mean_token_accuracy": 0.238722762465477, "num_tokens": 98142192.0, "step": 43965 }, { "entropy": 5.290746641159058, "epoch": 4.938282697815466, "grad_norm": 1.0234375, "learning_rate": 0.00028339716148466067, "loss": 4.849, "mean_token_accuracy": 0.2260967805981636, "num_tokens": 98152479.0, "step": 43970 }, { "entropy": 5.318809652328492, "epoch": 4.938844274723423, "grad_norm": 1.0078125, "learning_rate": 0.00028335704060220246, "loss": 4.8829, "mean_token_accuracy": 0.23584267795085906, "num_tokens": 98162479.0, "step": 43975 }, { "entropy": 5.34360637664795, "epoch": 4.939405851631381, "grad_norm": 1.1015625, "learning_rate": 0.00028331691945365274, "loss": 4.9165, "mean_token_accuracy": 0.22377211600542068, "num_tokens": 98173310.0, "step": 43980 }, { "entropy": 5.44387264251709, "epoch": 4.9399674285393385, "grad_norm": 1.0859375, "learning_rate": 0.0002832767980402892, "loss": 5.0435, "mean_token_accuracy": 0.22565365731716155, "num_tokens": 98185444.0, "step": 43985 }, { "entropy": 5.322139263153076, "epoch": 4.940529005447296, "grad_norm": 1.0390625, "learning_rate": 0.0002832366763633892, "loss": 4.8656, "mean_token_accuracy": 0.23601166009902955, "num_tokens": 98195898.0, "step": 43990 }, { "entropy": 5.329060792922974, "epoch": 4.941090582355254, "grad_norm": 1.0625, "learning_rate": 0.00028319655442423015, "loss": 4.8746, "mean_token_accuracy": 0.22898177057504654, "num_tokens": 98205957.0, "step": 43995 }, { "entropy": 5.301036691665649, "epoch": 4.941652159263211, "grad_norm": 0.984375, "learning_rate": 0.00028315643222408965, "loss": 4.875, "mean_token_accuracy": 0.22958087176084518, "num_tokens": 98216502.0, "step": 44000 }, { "entropy": 5.3527936935424805, "epoch": 4.942213736171169, "grad_norm": 1.046875, "learning_rate": 0.00028311630976424526, "loss": 4.8756, "mean_token_accuracy": 0.23058597445487977, "num_tokens": 98226798.0, "step": 44005 }, { "entropy": 5.416969442367554, "epoch": 4.942775313079126, "grad_norm": 1.0390625, "learning_rate": 0.0002830761870459743, "loss": 4.9766, "mean_token_accuracy": 0.22520416975021362, "num_tokens": 98238100.0, "step": 44010 }, { "entropy": 5.406939172744751, "epoch": 4.9433368899870835, "grad_norm": 0.984375, "learning_rate": 0.0002830360640705545, "loss": 4.9184, "mean_token_accuracy": 0.2317142218351364, "num_tokens": 98248800.0, "step": 44015 }, { "entropy": 5.36112060546875, "epoch": 4.943898466895042, "grad_norm": 1.0859375, "learning_rate": 0.00028299594083926324, "loss": 4.8513, "mean_token_accuracy": 0.2330041527748108, "num_tokens": 98258326.0, "step": 44020 }, { "entropy": 5.298646402359009, "epoch": 4.944460043802999, "grad_norm": 1.0625, "learning_rate": 0.00028295581735337817, "loss": 4.8698, "mean_token_accuracy": 0.23104314804077147, "num_tokens": 98269055.0, "step": 44025 }, { "entropy": 5.307069110870361, "epoch": 4.945021620710956, "grad_norm": 0.95703125, "learning_rate": 0.00028291569361417674, "loss": 4.8413, "mean_token_accuracy": 0.2314005896449089, "num_tokens": 98280683.0, "step": 44030 }, { "entropy": 5.451658058166504, "epoch": 4.945583197618914, "grad_norm": 1.0234375, "learning_rate": 0.0002828755696229366, "loss": 5.0606, "mean_token_accuracy": 0.2241984024643898, "num_tokens": 98292427.0, "step": 44035 }, { "entropy": 5.338675022125244, "epoch": 4.946144774526871, "grad_norm": 1.015625, "learning_rate": 0.0002828354453809352, "loss": 4.8961, "mean_token_accuracy": 0.22993558794260024, "num_tokens": 98302760.0, "step": 44040 }, { "entropy": 5.343034172058106, "epoch": 4.946706351434829, "grad_norm": 0.94140625, "learning_rate": 0.0002827953208894503, "loss": 4.853, "mean_token_accuracy": 0.22973467260599137, "num_tokens": 98313643.0, "step": 44045 }, { "entropy": 5.409980964660645, "epoch": 4.947267928342787, "grad_norm": 1.0625, "learning_rate": 0.0002827551961497593, "loss": 4.9646, "mean_token_accuracy": 0.23023361414670945, "num_tokens": 98323866.0, "step": 44050 }, { "entropy": 5.3541711330413815, "epoch": 4.947829505250744, "grad_norm": 0.953125, "learning_rate": 0.0002827150711631398, "loss": 4.9181, "mean_token_accuracy": 0.22667600810527802, "num_tokens": 98335683.0, "step": 44055 }, { "entropy": 5.38443660736084, "epoch": 4.948391082158702, "grad_norm": 0.9453125, "learning_rate": 0.00028267494593086945, "loss": 4.9362, "mean_token_accuracy": 0.23792639076709748, "num_tokens": 98347553.0, "step": 44060 }, { "entropy": 5.342494201660156, "epoch": 4.948952659066659, "grad_norm": 0.9453125, "learning_rate": 0.00028263482045422597, "loss": 4.8744, "mean_token_accuracy": 0.2372132882475853, "num_tokens": 98359729.0, "step": 44065 }, { "entropy": 5.406559991836548, "epoch": 4.9495142359746165, "grad_norm": 1.015625, "learning_rate": 0.0002825946947344867, "loss": 4.9567, "mean_token_accuracy": 0.23028545528650285, "num_tokens": 98371029.0, "step": 44070 }, { "entropy": 5.334176921844483, "epoch": 4.950075812882575, "grad_norm": 1.0703125, "learning_rate": 0.0002825545687729295, "loss": 4.8806, "mean_token_accuracy": 0.22301337718963624, "num_tokens": 98380911.0, "step": 44075 }, { "entropy": 5.327294731140137, "epoch": 4.950637389790532, "grad_norm": 1.15625, "learning_rate": 0.00028251444257083186, "loss": 4.7744, "mean_token_accuracy": 0.241789810359478, "num_tokens": 98390341.0, "step": 44080 }, { "entropy": 5.356728029251099, "epoch": 4.951198966698489, "grad_norm": 1.0234375, "learning_rate": 0.00028247431612947146, "loss": 4.9695, "mean_token_accuracy": 0.22658490091562272, "num_tokens": 98401707.0, "step": 44085 }, { "entropy": 5.379615306854248, "epoch": 4.951760543606447, "grad_norm": 1.0, "learning_rate": 0.0002824341894501259, "loss": 4.9471, "mean_token_accuracy": 0.22883762419223785, "num_tokens": 98413226.0, "step": 44090 }, { "entropy": 5.35163836479187, "epoch": 4.952322120514404, "grad_norm": 1.0546875, "learning_rate": 0.00028239406253407286, "loss": 4.895, "mean_token_accuracy": 0.23150481134653092, "num_tokens": 98424805.0, "step": 44095 }, { "entropy": 5.34906234741211, "epoch": 4.952883697422362, "grad_norm": 1.0625, "learning_rate": 0.00028235393538259007, "loss": 4.907, "mean_token_accuracy": 0.22492167502641677, "num_tokens": 98435725.0, "step": 44100 }, { "entropy": 5.356379795074463, "epoch": 4.95344527433032, "grad_norm": 0.984375, "learning_rate": 0.0002823138079969551, "loss": 4.8522, "mean_token_accuracy": 0.23155504912137986, "num_tokens": 98447014.0, "step": 44105 }, { "entropy": 5.3878199577331545, "epoch": 4.954006851238277, "grad_norm": 1.1328125, "learning_rate": 0.00028227368037844557, "loss": 4.9376, "mean_token_accuracy": 0.22939899563789368, "num_tokens": 98458902.0, "step": 44110 }, { "entropy": 5.298256063461304, "epoch": 4.954568428146235, "grad_norm": 0.99609375, "learning_rate": 0.00028223355252833933, "loss": 4.815, "mean_token_accuracy": 0.24126108437776567, "num_tokens": 98471173.0, "step": 44115 }, { "entropy": 5.2723030090332035, "epoch": 4.955130005054192, "grad_norm": 1.0078125, "learning_rate": 0.00028219342444791396, "loss": 4.8057, "mean_token_accuracy": 0.23419490456581116, "num_tokens": 98481882.0, "step": 44120 }, { "entropy": 5.323552131652832, "epoch": 4.955691581962149, "grad_norm": 1.0625, "learning_rate": 0.00028215329613844715, "loss": 4.8283, "mean_token_accuracy": 0.23322323113679885, "num_tokens": 98492938.0, "step": 44125 }, { "entropy": 5.398375034332275, "epoch": 4.9562531588701075, "grad_norm": 0.90625, "learning_rate": 0.00028211316760121656, "loss": 5.0263, "mean_token_accuracy": 0.2238294944167137, "num_tokens": 98505980.0, "step": 44130 }, { "entropy": 5.391941785812378, "epoch": 4.956814735778065, "grad_norm": 1.0078125, "learning_rate": 0.0002820730388375001, "loss": 4.9273, "mean_token_accuracy": 0.2223310276865959, "num_tokens": 98517868.0, "step": 44135 }, { "entropy": 5.344036293029785, "epoch": 4.957376312686022, "grad_norm": 1.0390625, "learning_rate": 0.0002820329098485752, "loss": 4.7313, "mean_token_accuracy": 0.24245921522378922, "num_tokens": 98527557.0, "step": 44140 }, { "entropy": 5.290171718597412, "epoch": 4.95793788959398, "grad_norm": 1.0078125, "learning_rate": 0.00028199278063571976, "loss": 4.8946, "mean_token_accuracy": 0.22890387177467347, "num_tokens": 98540502.0, "step": 44145 }, { "entropy": 5.310486125946045, "epoch": 4.958499466501937, "grad_norm": 1.0, "learning_rate": 0.00028195265120021157, "loss": 4.9051, "mean_token_accuracy": 0.23402635902166366, "num_tokens": 98551875.0, "step": 44150 }, { "entropy": 5.254725933074951, "epoch": 4.9590610434098945, "grad_norm": 1.1171875, "learning_rate": 0.00028191252154332816, "loss": 4.8557, "mean_token_accuracy": 0.22986187189817428, "num_tokens": 98561702.0, "step": 44155 }, { "entropy": 5.359773063659668, "epoch": 4.959622620317853, "grad_norm": 1.0234375, "learning_rate": 0.00028187239166634737, "loss": 4.9115, "mean_token_accuracy": 0.23624062836170195, "num_tokens": 98571112.0, "step": 44160 }, { "entropy": 5.33473014831543, "epoch": 4.96018419722581, "grad_norm": 0.9609375, "learning_rate": 0.00028183226157054705, "loss": 4.8991, "mean_token_accuracy": 0.22513955384492873, "num_tokens": 98581943.0, "step": 44165 }, { "entropy": 5.371310663223267, "epoch": 4.960745774133768, "grad_norm": 0.9921875, "learning_rate": 0.0002817921312572048, "loss": 4.8575, "mean_token_accuracy": 0.22784174978733063, "num_tokens": 98592452.0, "step": 44170 }, { "entropy": 5.347080135345459, "epoch": 4.961307351041725, "grad_norm": 1.0859375, "learning_rate": 0.0002817520007275985, "loss": 4.8865, "mean_token_accuracy": 0.2303934246301651, "num_tokens": 98603527.0, "step": 44175 }, { "entropy": 5.37602744102478, "epoch": 4.961868927949682, "grad_norm": 0.98828125, "learning_rate": 0.0002817118699830058, "loss": 4.9541, "mean_token_accuracy": 0.22198678106069564, "num_tokens": 98614359.0, "step": 44180 }, { "entropy": 5.2531122207641605, "epoch": 4.9624305048576405, "grad_norm": 0.99609375, "learning_rate": 0.0002816717390247046, "loss": 4.7933, "mean_token_accuracy": 0.23269341588020326, "num_tokens": 98625452.0, "step": 44185 }, { "entropy": 5.290101766586304, "epoch": 4.962992081765598, "grad_norm": 0.99609375, "learning_rate": 0.0002816316078539727, "loss": 4.8491, "mean_token_accuracy": 0.23625773042440415, "num_tokens": 98636918.0, "step": 44190 }, { "entropy": 5.338339710235596, "epoch": 4.963553658673556, "grad_norm": 1.0078125, "learning_rate": 0.00028159147647208784, "loss": 4.9336, "mean_token_accuracy": 0.23187313079833985, "num_tokens": 98647744.0, "step": 44195 }, { "entropy": 5.273560047149658, "epoch": 4.964115235581513, "grad_norm": 0.97265625, "learning_rate": 0.0002815513448803277, "loss": 4.7975, "mean_token_accuracy": 0.2349267154932022, "num_tokens": 98658655.0, "step": 44200 }, { "entropy": 5.331953525543213, "epoch": 4.96467681248947, "grad_norm": 1.03125, "learning_rate": 0.0002815112130799703, "loss": 4.9406, "mean_token_accuracy": 0.22487879246473313, "num_tokens": 98670858.0, "step": 44205 }, { "entropy": 5.2744081020355225, "epoch": 4.965238389397428, "grad_norm": 0.96484375, "learning_rate": 0.00028147108107229324, "loss": 4.7845, "mean_token_accuracy": 0.23304370939731597, "num_tokens": 98683044.0, "step": 44210 }, { "entropy": 5.3803290843963625, "epoch": 4.965799966305386, "grad_norm": 1.0703125, "learning_rate": 0.00028143094885857455, "loss": 4.884, "mean_token_accuracy": 0.22484272420406343, "num_tokens": 98694124.0, "step": 44215 }, { "entropy": 5.320252799987793, "epoch": 4.966361543213343, "grad_norm": 1.0234375, "learning_rate": 0.000281390816440092, "loss": 4.8668, "mean_token_accuracy": 0.2363376334309578, "num_tokens": 98704102.0, "step": 44220 }, { "entropy": 5.403891754150391, "epoch": 4.966923120121301, "grad_norm": 1.0703125, "learning_rate": 0.0002813506838181233, "loss": 4.9496, "mean_token_accuracy": 0.22905370146036147, "num_tokens": 98715594.0, "step": 44225 }, { "entropy": 5.322282838821411, "epoch": 4.967484697029258, "grad_norm": 0.98828125, "learning_rate": 0.0002813105509939464, "loss": 4.8572, "mean_token_accuracy": 0.23039425164461136, "num_tokens": 98727388.0, "step": 44230 }, { "entropy": 5.366693782806396, "epoch": 4.968046273937215, "grad_norm": 1.0234375, "learning_rate": 0.000281270417968839, "loss": 4.9185, "mean_token_accuracy": 0.22971024364233017, "num_tokens": 98739471.0, "step": 44235 }, { "entropy": 5.340255546569824, "epoch": 4.968607850845173, "grad_norm": 0.98046875, "learning_rate": 0.0002812302847440791, "loss": 4.9131, "mean_token_accuracy": 0.22576503753662108, "num_tokens": 98750490.0, "step": 44240 }, { "entropy": 5.272222995758057, "epoch": 4.969169427753131, "grad_norm": 1.0390625, "learning_rate": 0.00028119015132094455, "loss": 4.7976, "mean_token_accuracy": 0.2317809358239174, "num_tokens": 98761170.0, "step": 44245 }, { "entropy": 5.264775657653809, "epoch": 4.969731004661089, "grad_norm": 1.0, "learning_rate": 0.0002811500177007132, "loss": 4.8038, "mean_token_accuracy": 0.23310671001672745, "num_tokens": 98772473.0, "step": 44250 }, { "entropy": 5.355880451202393, "epoch": 4.970292581569046, "grad_norm": 1.0859375, "learning_rate": 0.00028110988388466287, "loss": 4.9135, "mean_token_accuracy": 0.2276088833808899, "num_tokens": 98783304.0, "step": 44255 }, { "entropy": 5.314635944366455, "epoch": 4.970854158477003, "grad_norm": 1.1171875, "learning_rate": 0.0002810697498740715, "loss": 4.8782, "mean_token_accuracy": 0.22704823315143585, "num_tokens": 98794201.0, "step": 44260 }, { "entropy": 5.300666761398316, "epoch": 4.971415735384961, "grad_norm": 1.0, "learning_rate": 0.0002810296156702169, "loss": 4.7749, "mean_token_accuracy": 0.2405395984649658, "num_tokens": 98804781.0, "step": 44265 }, { "entropy": 5.364297485351562, "epoch": 4.9719773122929185, "grad_norm": 1.0078125, "learning_rate": 0.00028098948127437695, "loss": 4.9014, "mean_token_accuracy": 0.22813138067722322, "num_tokens": 98815213.0, "step": 44270 }, { "entropy": 5.294503784179687, "epoch": 4.972538889200876, "grad_norm": 0.95703125, "learning_rate": 0.0002809493466878297, "loss": 4.8586, "mean_token_accuracy": 0.23013588190078735, "num_tokens": 98826352.0, "step": 44275 }, { "entropy": 5.284305143356323, "epoch": 4.973100466108834, "grad_norm": 1.0859375, "learning_rate": 0.00028090921191185295, "loss": 4.7878, "mean_token_accuracy": 0.2349633514881134, "num_tokens": 98837509.0, "step": 44280 }, { "entropy": 5.349946928024292, "epoch": 4.973662043016791, "grad_norm": 0.98828125, "learning_rate": 0.0002808690769477245, "loss": 4.916, "mean_token_accuracy": 0.2275216683745384, "num_tokens": 98848256.0, "step": 44285 }, { "entropy": 5.370415163040161, "epoch": 4.974223619924748, "grad_norm": 1.046875, "learning_rate": 0.0002808289417967225, "loss": 4.9361, "mean_token_accuracy": 0.2315392017364502, "num_tokens": 98859894.0, "step": 44290 }, { "entropy": 5.339399433135986, "epoch": 4.974785196832706, "grad_norm": 0.96484375, "learning_rate": 0.00028078880646012467, "loss": 4.8563, "mean_token_accuracy": 0.2334185242652893, "num_tokens": 98871848.0, "step": 44295 }, { "entropy": 5.258039808273315, "epoch": 4.975346773740664, "grad_norm": 0.9921875, "learning_rate": 0.00028074867093920897, "loss": 4.7564, "mean_token_accuracy": 0.24237384051084518, "num_tokens": 98882640.0, "step": 44300 }, { "entropy": 5.268483972549438, "epoch": 4.975908350648622, "grad_norm": 1.0078125, "learning_rate": 0.00028070853523525337, "loss": 4.8387, "mean_token_accuracy": 0.23144348263740538, "num_tokens": 98893478.0, "step": 44305 }, { "entropy": 5.289311027526855, "epoch": 4.976469927556579, "grad_norm": 1.046875, "learning_rate": 0.00028066839934953573, "loss": 4.8099, "mean_token_accuracy": 0.23863814175128936, "num_tokens": 98903713.0, "step": 44310 }, { "entropy": 5.388206672668457, "epoch": 4.977031504464536, "grad_norm": 0.890625, "learning_rate": 0.00028062826328333415, "loss": 4.9317, "mean_token_accuracy": 0.2344930127263069, "num_tokens": 98915622.0, "step": 44315 }, { "entropy": 5.282104730606079, "epoch": 4.977593081372494, "grad_norm": 1.125, "learning_rate": 0.0002805881270379265, "loss": 4.7976, "mean_token_accuracy": 0.23761697560548783, "num_tokens": 98926676.0, "step": 44320 }, { "entropy": 5.3667596817016605, "epoch": 4.9781546582804515, "grad_norm": 1.03125, "learning_rate": 0.0002805479906145906, "loss": 4.9829, "mean_token_accuracy": 0.2209734782576561, "num_tokens": 98937562.0, "step": 44325 }, { "entropy": 5.289053440093994, "epoch": 4.978716235188409, "grad_norm": 0.94921875, "learning_rate": 0.0002805078540146046, "loss": 4.8313, "mean_token_accuracy": 0.23370797485113143, "num_tokens": 98948968.0, "step": 44330 }, { "entropy": 5.384174489974976, "epoch": 4.979277812096367, "grad_norm": 1.0703125, "learning_rate": 0.0002804677172392464, "loss": 4.8948, "mean_token_accuracy": 0.22409718185663224, "num_tokens": 98960222.0, "step": 44335 }, { "entropy": 5.489224863052368, "epoch": 4.979839389004324, "grad_norm": 0.9921875, "learning_rate": 0.000280427580289794, "loss": 4.9482, "mean_token_accuracy": 0.22779795229434968, "num_tokens": 98973613.0, "step": 44340 }, { "entropy": 5.32267804145813, "epoch": 4.980400965912281, "grad_norm": 1.140625, "learning_rate": 0.00028038744316752524, "loss": 4.9047, "mean_token_accuracy": 0.22170582711696624, "num_tokens": 98984431.0, "step": 44345 }, { "entropy": 5.243948364257813, "epoch": 4.980962542820239, "grad_norm": 1.0, "learning_rate": 0.00028034730587371824, "loss": 4.8301, "mean_token_accuracy": 0.23071282356977463, "num_tokens": 98995860.0, "step": 44350 }, { "entropy": 5.315756511688233, "epoch": 4.9815241197281965, "grad_norm": 0.98046875, "learning_rate": 0.00028030716840965096, "loss": 4.7933, "mean_token_accuracy": 0.23636251240968703, "num_tokens": 99006892.0, "step": 44355 }, { "entropy": 5.38933629989624, "epoch": 4.982085696636155, "grad_norm": 1.09375, "learning_rate": 0.00028026703077660143, "loss": 4.8342, "mean_token_accuracy": 0.2365269511938095, "num_tokens": 99018072.0, "step": 44360 }, { "entropy": 5.320294761657715, "epoch": 4.982647273544112, "grad_norm": 1.0, "learning_rate": 0.0002802268929758475, "loss": 4.9299, "mean_token_accuracy": 0.2276756688952446, "num_tokens": 99030295.0, "step": 44365 }, { "entropy": 5.360086059570312, "epoch": 4.983208850452069, "grad_norm": 1.078125, "learning_rate": 0.0002801867550086674, "loss": 4.9259, "mean_token_accuracy": 0.2243215411901474, "num_tokens": 99042456.0, "step": 44370 }, { "entropy": 5.33536581993103, "epoch": 4.983770427360027, "grad_norm": 0.9921875, "learning_rate": 0.0002801466168763389, "loss": 4.9283, "mean_token_accuracy": 0.2301416203379631, "num_tokens": 99053639.0, "step": 44375 }, { "entropy": 5.400546598434448, "epoch": 4.984332004267984, "grad_norm": 1.015625, "learning_rate": 0.0002801064785801401, "loss": 4.8409, "mean_token_accuracy": 0.2357956662774086, "num_tokens": 99065350.0, "step": 44380 }, { "entropy": 5.402433681488037, "epoch": 4.9848935811759425, "grad_norm": 1.2421875, "learning_rate": 0.00028006634012134915, "loss": 4.94, "mean_token_accuracy": 0.2324439376592636, "num_tokens": 99075675.0, "step": 44385 }, { "entropy": 5.313912677764892, "epoch": 4.9854551580839, "grad_norm": 0.953125, "learning_rate": 0.00028002620150124386, "loss": 4.876, "mean_token_accuracy": 0.2301669090986252, "num_tokens": 99086431.0, "step": 44390 }, { "entropy": 5.293459939956665, "epoch": 4.986016734991857, "grad_norm": 0.91796875, "learning_rate": 0.00027998606272110237, "loss": 4.8, "mean_token_accuracy": 0.2427807107567787, "num_tokens": 99097417.0, "step": 44395 }, { "entropy": 5.2105019092559814, "epoch": 4.986578311899815, "grad_norm": 0.953125, "learning_rate": 0.0002799459237822028, "loss": 4.7429, "mean_token_accuracy": 0.23698496222496032, "num_tokens": 99107762.0, "step": 44400 }, { "entropy": 5.342716836929322, "epoch": 4.987139888807772, "grad_norm": 1.078125, "learning_rate": 0.00027990578468582304, "loss": 4.9628, "mean_token_accuracy": 0.22431514859199525, "num_tokens": 99118566.0, "step": 44405 }, { "entropy": 5.350826692581177, "epoch": 4.9877014657157295, "grad_norm": 1.0234375, "learning_rate": 0.0002798656454332412, "loss": 4.859, "mean_token_accuracy": 0.23182294368743897, "num_tokens": 99129327.0, "step": 44410 }, { "entropy": 5.4494575500488285, "epoch": 4.988263042623688, "grad_norm": 1.015625, "learning_rate": 0.00027982550602573524, "loss": 4.9703, "mean_token_accuracy": 0.22818288803100586, "num_tokens": 99140811.0, "step": 44415 }, { "entropy": 5.337866306304932, "epoch": 4.988824619531645, "grad_norm": 0.94140625, "learning_rate": 0.0002797853664645834, "loss": 4.8725, "mean_token_accuracy": 0.23053045868873595, "num_tokens": 99151860.0, "step": 44420 }, { "entropy": 5.326477575302124, "epoch": 4.989386196439602, "grad_norm": 0.96875, "learning_rate": 0.0002797452267510637, "loss": 4.8413, "mean_token_accuracy": 0.2286055341362953, "num_tokens": 99163235.0, "step": 44425 }, { "entropy": 5.316936683654785, "epoch": 4.98994777334756, "grad_norm": 1.0859375, "learning_rate": 0.000279705086886454, "loss": 4.8397, "mean_token_accuracy": 0.23527706414461136, "num_tokens": 99176239.0, "step": 44430 }, { "entropy": 5.2372802734375, "epoch": 4.990509350255517, "grad_norm": 0.9921875, "learning_rate": 0.0002796649468720326, "loss": 4.7824, "mean_token_accuracy": 0.23237699866294861, "num_tokens": 99187221.0, "step": 44435 }, { "entropy": 5.299254608154297, "epoch": 4.9910709271634754, "grad_norm": 1.0859375, "learning_rate": 0.00027962480670907743, "loss": 4.8679, "mean_token_accuracy": 0.23690046817064286, "num_tokens": 99198803.0, "step": 44440 }, { "entropy": 5.348174715042115, "epoch": 4.991632504071433, "grad_norm": 0.953125, "learning_rate": 0.00027958466639886663, "loss": 4.891, "mean_token_accuracy": 0.227015221118927, "num_tokens": 99210179.0, "step": 44445 }, { "entropy": 5.455660724639893, "epoch": 4.99219408097939, "grad_norm": 0.98828125, "learning_rate": 0.00027954452594267825, "loss": 4.9633, "mean_token_accuracy": 0.21731373220682143, "num_tokens": 99221633.0, "step": 44450 }, { "entropy": 5.316402816772461, "epoch": 4.992755657887348, "grad_norm": 1.0234375, "learning_rate": 0.00027950438534179046, "loss": 4.8297, "mean_token_accuracy": 0.2369336426258087, "num_tokens": 99232292.0, "step": 44455 }, { "entropy": 5.253886413574219, "epoch": 4.993317234795305, "grad_norm": 0.96484375, "learning_rate": 0.00027946424459748126, "loss": 4.8423, "mean_token_accuracy": 0.23046937584877014, "num_tokens": 99244577.0, "step": 44460 }, { "entropy": 5.407855701446533, "epoch": 4.993878811703262, "grad_norm": 1.0625, "learning_rate": 0.00027942410371102877, "loss": 4.9669, "mean_token_accuracy": 0.22711817175149918, "num_tokens": 99254698.0, "step": 44465 }, { "entropy": 5.362670612335205, "epoch": 4.9944403886112205, "grad_norm": 0.93359375, "learning_rate": 0.0002793839626837111, "loss": 4.944, "mean_token_accuracy": 0.23160551637411117, "num_tokens": 99266289.0, "step": 44470 }, { "entropy": 5.358116388320923, "epoch": 4.995001965519178, "grad_norm": 1.0546875, "learning_rate": 0.00027934382151680644, "loss": 4.885, "mean_token_accuracy": 0.23612411171197892, "num_tokens": 99278493.0, "step": 44475 }, { "entropy": 5.265798139572143, "epoch": 4.995563542427135, "grad_norm": 1.046875, "learning_rate": 0.00027930368021159273, "loss": 4.8235, "mean_token_accuracy": 0.23651092797517775, "num_tokens": 99289095.0, "step": 44480 }, { "entropy": 5.337602138519287, "epoch": 4.996125119335093, "grad_norm": 0.98046875, "learning_rate": 0.0002792635387693481, "loss": 4.8831, "mean_token_accuracy": 0.23498842418193816, "num_tokens": 99300314.0, "step": 44485 }, { "entropy": 5.3936927318573, "epoch": 4.99668669624305, "grad_norm": 1.0703125, "learning_rate": 0.00027922339719135093, "loss": 4.9374, "mean_token_accuracy": 0.22946917563676833, "num_tokens": 99311460.0, "step": 44490 }, { "entropy": 5.363899755477905, "epoch": 4.997248273151008, "grad_norm": 0.9140625, "learning_rate": 0.000279183255478879, "loss": 4.9486, "mean_token_accuracy": 0.22423994541168213, "num_tokens": 99323755.0, "step": 44495 }, { "entropy": 5.392146587371826, "epoch": 4.997809850058966, "grad_norm": 0.94140625, "learning_rate": 0.00027914311363321073, "loss": 4.9697, "mean_token_accuracy": 0.221455679833889, "num_tokens": 99335079.0, "step": 44500 }, { "entropy": 5.376827335357666, "epoch": 4.998371426966923, "grad_norm": 0.96875, "learning_rate": 0.00027910297165562406, "loss": 4.9296, "mean_token_accuracy": 0.2300969272851944, "num_tokens": 99347051.0, "step": 44505 }, { "entropy": 5.305168724060058, "epoch": 4.998933003874881, "grad_norm": 1.0859375, "learning_rate": 0.00027906282954739714, "loss": 4.8362, "mean_token_accuracy": 0.23675844669342042, "num_tokens": 99357038.0, "step": 44510 }, { "entropy": 5.330075120925903, "epoch": 4.999494580782838, "grad_norm": 0.98046875, "learning_rate": 0.00027902268730980816, "loss": 4.8395, "mean_token_accuracy": 0.23686676174402238, "num_tokens": 99368909.0, "step": 44515 }, { "entropy": 5.3331469429863825, "epoch": 5.0, "grad_norm": 3.390625, "learning_rate": 0.0002789825449441353, "loss": 4.8789, "mean_token_accuracy": 0.2276321682665083, "num_tokens": 99377525.0, "step": 44520 }, { "entropy": 5.303949975967408, "epoch": 5.000561576907957, "grad_norm": 1.0234375, "learning_rate": 0.0002789424024516566, "loss": 4.7182, "mean_token_accuracy": 0.24421388506889344, "num_tokens": 99388238.0, "step": 44525 }, { "entropy": 5.287517738342285, "epoch": 5.001123153815915, "grad_norm": 1.015625, "learning_rate": 0.00027890225983365034, "loss": 4.8203, "mean_token_accuracy": 0.23427336513996125, "num_tokens": 99399823.0, "step": 44530 }, { "entropy": 5.252340030670166, "epoch": 5.0016847307238725, "grad_norm": 1.015625, "learning_rate": 0.0002788621170913946, "loss": 4.7802, "mean_token_accuracy": 0.23298331648111342, "num_tokens": 99411593.0, "step": 44535 }, { "entropy": 5.406036996841431, "epoch": 5.00224630763183, "grad_norm": 1.015625, "learning_rate": 0.00027882197422616746, "loss": 4.878, "mean_token_accuracy": 0.23435810953378677, "num_tokens": 99423185.0, "step": 44540 }, { "entropy": 5.35374174118042, "epoch": 5.002807884539788, "grad_norm": 0.96484375, "learning_rate": 0.0002787818312392473, "loss": 4.825, "mean_token_accuracy": 0.23475240170955658, "num_tokens": 99434306.0, "step": 44545 }, { "entropy": 5.303316450119018, "epoch": 5.003369461447745, "grad_norm": 1.0078125, "learning_rate": 0.00027874168813191207, "loss": 4.8354, "mean_token_accuracy": 0.23187606483697892, "num_tokens": 99445328.0, "step": 44550 }, { "entropy": 5.356036424636841, "epoch": 5.003931038355703, "grad_norm": 1.0078125, "learning_rate": 0.0002787015449054401, "loss": 4.8957, "mean_token_accuracy": 0.23820963948965074, "num_tokens": 99457101.0, "step": 44555 }, { "entropy": 5.3451367855072025, "epoch": 5.00449261526366, "grad_norm": 1.0703125, "learning_rate": 0.0002786614015611095, "loss": 4.7731, "mean_token_accuracy": 0.2389104649424553, "num_tokens": 99466862.0, "step": 44560 }, { "entropy": 5.287978935241699, "epoch": 5.005054192171618, "grad_norm": 0.98828125, "learning_rate": 0.00027862125810019844, "loss": 4.7714, "mean_token_accuracy": 0.23365640491247178, "num_tokens": 99477113.0, "step": 44565 }, { "entropy": 5.17185001373291, "epoch": 5.005615769079576, "grad_norm": 1.0625, "learning_rate": 0.00027858111452398515, "loss": 4.6495, "mean_token_accuracy": 0.24367730617523192, "num_tokens": 99488308.0, "step": 44570 }, { "entropy": 5.345585441589355, "epoch": 5.006177345987533, "grad_norm": 1.0, "learning_rate": 0.00027854097083374773, "loss": 4.8666, "mean_token_accuracy": 0.23174157440662385, "num_tokens": 99499082.0, "step": 44575 }, { "entropy": 5.333270645141601, "epoch": 5.00673892289549, "grad_norm": 1.1015625, "learning_rate": 0.0002785008270307645, "loss": 4.7902, "mean_token_accuracy": 0.2316268801689148, "num_tokens": 99509703.0, "step": 44580 }, { "entropy": 5.256840753555298, "epoch": 5.007300499803448, "grad_norm": 1.0390625, "learning_rate": 0.0002784606831163136, "loss": 4.7068, "mean_token_accuracy": 0.24941868036985398, "num_tokens": 99519893.0, "step": 44585 }, { "entropy": 5.306329822540283, "epoch": 5.0078620767114055, "grad_norm": 1.046875, "learning_rate": 0.00027842053909167314, "loss": 4.8003, "mean_token_accuracy": 0.23638997972011566, "num_tokens": 99530795.0, "step": 44590 }, { "entropy": 5.303034067153931, "epoch": 5.008423653619364, "grad_norm": 1.03125, "learning_rate": 0.00027838039495812133, "loss": 4.7357, "mean_token_accuracy": 0.24044784009456635, "num_tokens": 99540733.0, "step": 44595 }, { "entropy": 5.315994691848755, "epoch": 5.008985230527321, "grad_norm": 1.109375, "learning_rate": 0.00027834025071693655, "loss": 4.7891, "mean_token_accuracy": 0.23771920204162597, "num_tokens": 99551671.0, "step": 44600 }, { "entropy": 5.291541910171508, "epoch": 5.009546807435278, "grad_norm": 1.046875, "learning_rate": 0.00027830010636939684, "loss": 4.7813, "mean_token_accuracy": 0.2412249580025673, "num_tokens": 99561894.0, "step": 44605 }, { "entropy": 5.231776475906372, "epoch": 5.010108384343236, "grad_norm": 1.046875, "learning_rate": 0.00027825996191678043, "loss": 4.6943, "mean_token_accuracy": 0.2490280330181122, "num_tokens": 99573309.0, "step": 44610 }, { "entropy": 5.292166233062744, "epoch": 5.010669961251193, "grad_norm": 1.0625, "learning_rate": 0.00027821981736036555, "loss": 4.7933, "mean_token_accuracy": 0.23290181457996367, "num_tokens": 99584517.0, "step": 44615 }, { "entropy": 5.401762437820435, "epoch": 5.011231538159151, "grad_norm": 1.046875, "learning_rate": 0.0002781796727014305, "loss": 4.8722, "mean_token_accuracy": 0.2303318977355957, "num_tokens": 99596034.0, "step": 44620 }, { "entropy": 5.398155689239502, "epoch": 5.011793115067109, "grad_norm": 1.1171875, "learning_rate": 0.0002781395279412535, "loss": 4.8791, "mean_token_accuracy": 0.22965058237314223, "num_tokens": 99608399.0, "step": 44625 }, { "entropy": 5.327514028549194, "epoch": 5.012354691975066, "grad_norm": 0.96484375, "learning_rate": 0.00027809938308111254, "loss": 4.7469, "mean_token_accuracy": 0.23899840265512468, "num_tokens": 99620328.0, "step": 44630 }, { "entropy": 5.299961280822754, "epoch": 5.012916268883023, "grad_norm": 1.015625, "learning_rate": 0.00027805923812228615, "loss": 4.8127, "mean_token_accuracy": 0.23348730355501174, "num_tokens": 99630527.0, "step": 44635 }, { "entropy": 5.349582624435425, "epoch": 5.013477845790981, "grad_norm": 1.0390625, "learning_rate": 0.00027801909306605243, "loss": 4.8645, "mean_token_accuracy": 0.23481377512216567, "num_tokens": 99641192.0, "step": 44640 }, { "entropy": 5.28320837020874, "epoch": 5.014039422698938, "grad_norm": 1.015625, "learning_rate": 0.0002779789479136896, "loss": 4.7569, "mean_token_accuracy": 0.23828925788402558, "num_tokens": 99653335.0, "step": 44645 }, { "entropy": 5.331968498229981, "epoch": 5.0146009996068965, "grad_norm": 1.125, "learning_rate": 0.0002779388026664759, "loss": 4.7688, "mean_token_accuracy": 0.2405068963766098, "num_tokens": 99663627.0, "step": 44650 }, { "entropy": 5.31217622756958, "epoch": 5.015162576514854, "grad_norm": 1.0859375, "learning_rate": 0.0002778986573256896, "loss": 4.8086, "mean_token_accuracy": 0.23821263015270233, "num_tokens": 99673988.0, "step": 44655 }, { "entropy": 5.309736108779907, "epoch": 5.015724153422811, "grad_norm": 1.1015625, "learning_rate": 0.0002778585118926089, "loss": 4.8139, "mean_token_accuracy": 0.22898896187543868, "num_tokens": 99684150.0, "step": 44660 }, { "entropy": 5.3033661365509035, "epoch": 5.016285730330769, "grad_norm": 0.953125, "learning_rate": 0.00027781836636851207, "loss": 4.7693, "mean_token_accuracy": 0.24040007144212722, "num_tokens": 99696144.0, "step": 44665 }, { "entropy": 5.349575757980347, "epoch": 5.016847307238726, "grad_norm": 1.0390625, "learning_rate": 0.00027777822075467735, "loss": 4.7768, "mean_token_accuracy": 0.23750172406435013, "num_tokens": 99707405.0, "step": 44670 }, { "entropy": 5.283712482452392, "epoch": 5.0174088841466835, "grad_norm": 0.96484375, "learning_rate": 0.000277738075052383, "loss": 4.6969, "mean_token_accuracy": 0.25905880331993103, "num_tokens": 99720316.0, "step": 44675 }, { "entropy": 5.235405826568604, "epoch": 5.017970461054642, "grad_norm": 1.0546875, "learning_rate": 0.0002776979292629074, "loss": 4.6917, "mean_token_accuracy": 0.2434634044766426, "num_tokens": 99732184.0, "step": 44680 }, { "entropy": 5.248032140731811, "epoch": 5.018532037962599, "grad_norm": 1.0703125, "learning_rate": 0.0002776577833875285, "loss": 4.7723, "mean_token_accuracy": 0.23761207461357117, "num_tokens": 99743349.0, "step": 44685 }, { "entropy": 5.330416345596314, "epoch": 5.019093614870557, "grad_norm": 1.046875, "learning_rate": 0.00027761763742752485, "loss": 4.8311, "mean_token_accuracy": 0.23845785707235337, "num_tokens": 99754569.0, "step": 44690 }, { "entropy": 5.406059694290161, "epoch": 5.019655191778514, "grad_norm": 0.9765625, "learning_rate": 0.0002775774913841746, "loss": 4.9213, "mean_token_accuracy": 0.21944546699523926, "num_tokens": 99766643.0, "step": 44695 }, { "entropy": 5.247896718978882, "epoch": 5.020216768686471, "grad_norm": 1.0546875, "learning_rate": 0.000277537345258756, "loss": 4.6613, "mean_token_accuracy": 0.24383610635995864, "num_tokens": 99777829.0, "step": 44700 }, { "entropy": 5.284526586532593, "epoch": 5.0207783455944295, "grad_norm": 1.0234375, "learning_rate": 0.00027749719905254737, "loss": 4.7613, "mean_token_accuracy": 0.2390891820192337, "num_tokens": 99788815.0, "step": 44705 }, { "entropy": 5.2233256816864015, "epoch": 5.021339922502387, "grad_norm": 1.1640625, "learning_rate": 0.000277457052766827, "loss": 4.7915, "mean_token_accuracy": 0.24463313072919846, "num_tokens": 99799343.0, "step": 44710 }, { "entropy": 5.4329140186309814, "epoch": 5.021901499410344, "grad_norm": 1.046875, "learning_rate": 0.00027741690640287306, "loss": 4.9657, "mean_token_accuracy": 0.21930896639823913, "num_tokens": 99810926.0, "step": 44715 }, { "entropy": 5.336809492111206, "epoch": 5.022463076318302, "grad_norm": 1.0625, "learning_rate": 0.0002773767599619639, "loss": 4.8134, "mean_token_accuracy": 0.24083648920059203, "num_tokens": 99824506.0, "step": 44720 }, { "entropy": 5.40251054763794, "epoch": 5.023024653226259, "grad_norm": 1.0390625, "learning_rate": 0.00027733661344537776, "loss": 4.8925, "mean_token_accuracy": 0.2357860177755356, "num_tokens": 99835751.0, "step": 44725 }, { "entropy": 5.276918649673462, "epoch": 5.0235862301342165, "grad_norm": 1.09375, "learning_rate": 0.000277296466854393, "loss": 4.6888, "mean_token_accuracy": 0.2441596731543541, "num_tokens": 99846793.0, "step": 44730 }, { "entropy": 5.2190086364746096, "epoch": 5.024147807042175, "grad_norm": 1.0, "learning_rate": 0.0002772563201902877, "loss": 4.6778, "mean_token_accuracy": 0.24783345311880112, "num_tokens": 99858881.0, "step": 44735 }, { "entropy": 5.316756534576416, "epoch": 5.024709383950132, "grad_norm": 1.078125, "learning_rate": 0.00027721617345434035, "loss": 4.8346, "mean_token_accuracy": 0.23651431500911713, "num_tokens": 99869902.0, "step": 44740 }, { "entropy": 5.274245309829712, "epoch": 5.02527096085809, "grad_norm": 0.98046875, "learning_rate": 0.00027717602664782925, "loss": 4.7535, "mean_token_accuracy": 0.24220282286405564, "num_tokens": 99879899.0, "step": 44745 }, { "entropy": 5.217467880249023, "epoch": 5.025832537766047, "grad_norm": 1.015625, "learning_rate": 0.0002771358797720326, "loss": 4.6689, "mean_token_accuracy": 0.24848663359880446, "num_tokens": 99891751.0, "step": 44750 }, { "entropy": 5.306231546401977, "epoch": 5.026394114674004, "grad_norm": 1.1015625, "learning_rate": 0.00027709573282822864, "loss": 4.7705, "mean_token_accuracy": 0.24466101080179214, "num_tokens": 99901660.0, "step": 44755 }, { "entropy": 5.328562498092651, "epoch": 5.026955691581962, "grad_norm": 0.9921875, "learning_rate": 0.0002770555858176958, "loss": 4.883, "mean_token_accuracy": 0.22767579257488252, "num_tokens": 99912319.0, "step": 44760 }, { "entropy": 5.298930549621582, "epoch": 5.02751726848992, "grad_norm": 1.109375, "learning_rate": 0.0002770154387417123, "loss": 4.7799, "mean_token_accuracy": 0.24284012317657472, "num_tokens": 99922425.0, "step": 44765 }, { "entropy": 5.305669355392456, "epoch": 5.028078845397877, "grad_norm": 1.0859375, "learning_rate": 0.0002769752916015565, "loss": 4.7462, "mean_token_accuracy": 0.23931794613599777, "num_tokens": 99934210.0, "step": 44770 }, { "entropy": 5.305175018310547, "epoch": 5.028640422305835, "grad_norm": 0.96875, "learning_rate": 0.00027693514439850646, "loss": 4.778, "mean_token_accuracy": 0.23506115823984147, "num_tokens": 99947094.0, "step": 44775 }, { "entropy": 5.265874767303467, "epoch": 5.029201999213792, "grad_norm": 1.125, "learning_rate": 0.00027689499713384085, "loss": 4.8028, "mean_token_accuracy": 0.23250661343336104, "num_tokens": 99957876.0, "step": 44780 }, { "entropy": 5.245990514755249, "epoch": 5.02976357612175, "grad_norm": 0.9453125, "learning_rate": 0.0002768548498088378, "loss": 4.8071, "mean_token_accuracy": 0.23538009822368622, "num_tokens": 99970033.0, "step": 44785 }, { "entropy": 5.311634159088134, "epoch": 5.0303251530297075, "grad_norm": 1.1171875, "learning_rate": 0.0002768147024247756, "loss": 4.8364, "mean_token_accuracy": 0.23247957676649095, "num_tokens": 99980708.0, "step": 44790 }, { "entropy": 5.328367805480957, "epoch": 5.030886729937665, "grad_norm": 1.0078125, "learning_rate": 0.0002767745549829325, "loss": 4.7763, "mean_token_accuracy": 0.23279207795858384, "num_tokens": 99991504.0, "step": 44795 }, { "entropy": 5.359219264984131, "epoch": 5.031448306845623, "grad_norm": 0.96875, "learning_rate": 0.00027673440748458687, "loss": 4.8698, "mean_token_accuracy": 0.2294816792011261, "num_tokens": 100002722.0, "step": 44800 }, { "entropy": 5.313094615936279, "epoch": 5.03200988375358, "grad_norm": 1.0546875, "learning_rate": 0.00027669425993101716, "loss": 4.8193, "mean_token_accuracy": 0.23241813331842423, "num_tokens": 100014337.0, "step": 44805 }, { "entropy": 5.269993638992309, "epoch": 5.032571460661537, "grad_norm": 1.015625, "learning_rate": 0.0002766541123235014, "loss": 4.7312, "mean_token_accuracy": 0.23760635107755662, "num_tokens": 100025717.0, "step": 44810 }, { "entropy": 5.3128660202026365, "epoch": 5.033133037569495, "grad_norm": 0.97265625, "learning_rate": 0.0002766139646633182, "loss": 4.7666, "mean_token_accuracy": 0.23344726413488387, "num_tokens": 100036882.0, "step": 44815 }, { "entropy": 5.255267572402954, "epoch": 5.033694614477453, "grad_norm": 1.0078125, "learning_rate": 0.00027657381695174563, "loss": 4.7346, "mean_token_accuracy": 0.2389051392674446, "num_tokens": 100047744.0, "step": 44820 }, { "entropy": 5.397951078414917, "epoch": 5.03425619138541, "grad_norm": 1.0078125, "learning_rate": 0.00027653366919006217, "loss": 4.9018, "mean_token_accuracy": 0.23275411128997803, "num_tokens": 100059877.0, "step": 44825 }, { "entropy": 5.279456710815429, "epoch": 5.034817768293368, "grad_norm": 0.953125, "learning_rate": 0.0002764935213795461, "loss": 4.7415, "mean_token_accuracy": 0.2421242907643318, "num_tokens": 100072294.0, "step": 44830 }, { "entropy": 5.293368148803711, "epoch": 5.035379345201325, "grad_norm": 0.98046875, "learning_rate": 0.0002764533735214757, "loss": 4.7823, "mean_token_accuracy": 0.2416826829314232, "num_tokens": 100084302.0, "step": 44835 }, { "entropy": 5.3939775943756105, "epoch": 5.035940922109283, "grad_norm": 1.015625, "learning_rate": 0.00027641322561712935, "loss": 4.9066, "mean_token_accuracy": 0.2360362932085991, "num_tokens": 100094694.0, "step": 44840 }, { "entropy": 5.278969097137451, "epoch": 5.0365024990172405, "grad_norm": 1.0234375, "learning_rate": 0.00027637307766778524, "loss": 4.7604, "mean_token_accuracy": 0.2422454759478569, "num_tokens": 100105824.0, "step": 44845 }, { "entropy": 5.324724388122559, "epoch": 5.037064075925198, "grad_norm": 1.109375, "learning_rate": 0.000276332929674722, "loss": 4.8436, "mean_token_accuracy": 0.23639057129621505, "num_tokens": 100117040.0, "step": 44850 }, { "entropy": 5.316409301757813, "epoch": 5.037625652833156, "grad_norm": 1.0390625, "learning_rate": 0.00027629278163921763, "loss": 4.8301, "mean_token_accuracy": 0.23150028735399247, "num_tokens": 100128747.0, "step": 44855 }, { "entropy": 5.293092107772827, "epoch": 5.038187229741113, "grad_norm": 1.03125, "learning_rate": 0.00027625263356255067, "loss": 4.8037, "mean_token_accuracy": 0.23068335354328157, "num_tokens": 100138839.0, "step": 44860 }, { "entropy": 5.181653308868408, "epoch": 5.03874880664907, "grad_norm": 1.0703125, "learning_rate": 0.0002762124854459992, "loss": 4.6746, "mean_token_accuracy": 0.24150864481925965, "num_tokens": 100148898.0, "step": 44865 }, { "entropy": 5.2901581764221195, "epoch": 5.039310383557028, "grad_norm": 1.015625, "learning_rate": 0.00027617233729084194, "loss": 4.8236, "mean_token_accuracy": 0.23563172072172164, "num_tokens": 100160160.0, "step": 44870 }, { "entropy": 5.263094234466553, "epoch": 5.0398719604649855, "grad_norm": 1.015625, "learning_rate": 0.00027613218909835693, "loss": 4.7399, "mean_token_accuracy": 0.2462816432118416, "num_tokens": 100170556.0, "step": 44875 }, { "entropy": 5.337083625793457, "epoch": 5.040433537372944, "grad_norm": 0.9609375, "learning_rate": 0.0002760920408698225, "loss": 4.7939, "mean_token_accuracy": 0.2324121907353401, "num_tokens": 100181534.0, "step": 44880 }, { "entropy": 5.27929105758667, "epoch": 5.040995114280901, "grad_norm": 0.9453125, "learning_rate": 0.00027605189260651716, "loss": 4.8598, "mean_token_accuracy": 0.23064640313386917, "num_tokens": 100193086.0, "step": 44885 }, { "entropy": 5.389669275283813, "epoch": 5.041556691188858, "grad_norm": 1.0546875, "learning_rate": 0.0002760117443097191, "loss": 4.8585, "mean_token_accuracy": 0.23510549515485762, "num_tokens": 100204222.0, "step": 44890 }, { "entropy": 5.269767236709595, "epoch": 5.042118268096816, "grad_norm": 1.0625, "learning_rate": 0.00027597159598070675, "loss": 4.7544, "mean_token_accuracy": 0.24486927837133407, "num_tokens": 100215260.0, "step": 44895 }, { "entropy": 5.2542260646820065, "epoch": 5.042679845004773, "grad_norm": 1.0859375, "learning_rate": 0.00027593144762075837, "loss": 4.7413, "mean_token_accuracy": 0.2402457669377327, "num_tokens": 100225803.0, "step": 44900 }, { "entropy": 5.31165714263916, "epoch": 5.043241421912731, "grad_norm": 1.0078125, "learning_rate": 0.00027589129923115234, "loss": 4.8732, "mean_token_accuracy": 0.2288212835788727, "num_tokens": 100237351.0, "step": 44905 }, { "entropy": 5.292793464660645, "epoch": 5.043802998820689, "grad_norm": 1.0546875, "learning_rate": 0.000275851150813167, "loss": 4.7729, "mean_token_accuracy": 0.2498647913336754, "num_tokens": 100247484.0, "step": 44910 }, { "entropy": 5.327408313751221, "epoch": 5.044364575728646, "grad_norm": 0.96875, "learning_rate": 0.0002758110023680807, "loss": 4.8181, "mean_token_accuracy": 0.23849890530109405, "num_tokens": 100259159.0, "step": 44915 }, { "entropy": 5.371684217453003, "epoch": 5.044926152636603, "grad_norm": 1.1328125, "learning_rate": 0.0002757708538971717, "loss": 4.9348, "mean_token_accuracy": 0.22241273075342177, "num_tokens": 100270673.0, "step": 44920 }, { "entropy": 5.304699563980103, "epoch": 5.045487729544561, "grad_norm": 1.0, "learning_rate": 0.0002757307054017185, "loss": 4.8079, "mean_token_accuracy": 0.22975546568632127, "num_tokens": 100281825.0, "step": 44925 }, { "entropy": 5.3554059028625485, "epoch": 5.0460493064525185, "grad_norm": 1.1484375, "learning_rate": 0.0002756905568829994, "loss": 4.7304, "mean_token_accuracy": 0.23920682817697525, "num_tokens": 100292610.0, "step": 44930 }, { "entropy": 5.337239980697632, "epoch": 5.046610883360477, "grad_norm": 1.0, "learning_rate": 0.00027565040834229266, "loss": 4.8027, "mean_token_accuracy": 0.23677806705236434, "num_tokens": 100303589.0, "step": 44935 }, { "entropy": 5.252290534973144, "epoch": 5.047172460268434, "grad_norm": 1.0234375, "learning_rate": 0.00027561025978087663, "loss": 4.7515, "mean_token_accuracy": 0.24129058569669723, "num_tokens": 100314843.0, "step": 44940 }, { "entropy": 5.289244747161865, "epoch": 5.047734037176391, "grad_norm": 1.078125, "learning_rate": 0.00027557011120002975, "loss": 4.7892, "mean_token_accuracy": 0.23798831850290297, "num_tokens": 100325250.0, "step": 44945 }, { "entropy": 5.34537706375122, "epoch": 5.048295614084349, "grad_norm": 1.0703125, "learning_rate": 0.0002755299626010302, "loss": 4.8331, "mean_token_accuracy": 0.23407106399536132, "num_tokens": 100336280.0, "step": 44950 }, { "entropy": 5.2791344165802006, "epoch": 5.048857190992306, "grad_norm": 0.9921875, "learning_rate": 0.0002754898139851565, "loss": 4.8329, "mean_token_accuracy": 0.2336358904838562, "num_tokens": 100349040.0, "step": 44955 }, { "entropy": 5.37589168548584, "epoch": 5.049418767900264, "grad_norm": 1.0390625, "learning_rate": 0.00027544966535368695, "loss": 4.8912, "mean_token_accuracy": 0.23421404510736465, "num_tokens": 100360602.0, "step": 44960 }, { "entropy": 5.382865285873413, "epoch": 5.049980344808222, "grad_norm": 1.078125, "learning_rate": 0.0002754095167078999, "loss": 4.9194, "mean_token_accuracy": 0.22897761613130568, "num_tokens": 100371627.0, "step": 44965 }, { "entropy": 5.357540035247803, "epoch": 5.050541921716179, "grad_norm": 1.0859375, "learning_rate": 0.0002753693680490736, "loss": 4.8615, "mean_token_accuracy": 0.2335910454392433, "num_tokens": 100382897.0, "step": 44970 }, { "entropy": 5.2880110263824465, "epoch": 5.051103498624137, "grad_norm": 1.03125, "learning_rate": 0.0002753292193784865, "loss": 4.7454, "mean_token_accuracy": 0.24296204298734664, "num_tokens": 100394764.0, "step": 44975 }, { "entropy": 5.34711012840271, "epoch": 5.051665075532094, "grad_norm": 1.0625, "learning_rate": 0.00027528907069741696, "loss": 4.8901, "mean_token_accuracy": 0.22749956250190734, "num_tokens": 100406603.0, "step": 44980 }, { "entropy": 5.166896104812622, "epoch": 5.052226652440051, "grad_norm": 1.09375, "learning_rate": 0.0002752489220071433, "loss": 4.5887, "mean_token_accuracy": 0.25253511369228365, "num_tokens": 100417050.0, "step": 44985 }, { "entropy": 5.335669803619385, "epoch": 5.0527882293480095, "grad_norm": 0.9765625, "learning_rate": 0.0002752087733089438, "loss": 4.8025, "mean_token_accuracy": 0.23743102997541427, "num_tokens": 100428344.0, "step": 44990 }, { "entropy": 5.29627799987793, "epoch": 5.053349806255967, "grad_norm": 1.015625, "learning_rate": 0.0002751686246040969, "loss": 4.7213, "mean_token_accuracy": 0.24333713203668594, "num_tokens": 100439887.0, "step": 44995 }, { "entropy": 5.316780090332031, "epoch": 5.053911383163924, "grad_norm": 1.09375, "learning_rate": 0.000275128475893881, "loss": 4.8223, "mean_token_accuracy": 0.2441769376397133, "num_tokens": 100450297.0, "step": 45000 }, { "epoch": 5.053911383163924, "eval_entropy": 5.091480728889329, "eval_loss": 5.0214948654174805, "eval_mean_token_accuracy": 0.23153242991546827, "eval_num_tokens": 100450297.0, "eval_runtime": 23.9715, "eval_samples_per_second": 1293.744, "eval_steps_per_second": 161.734, "step": 45000 }, { "entropy": 5.425415658950806, "epoch": 5.054472960071882, "grad_norm": 1.0, "learning_rate": 0.00027508832717957433, "loss": 5.0265, "mean_token_accuracy": 0.22369078546762466, "num_tokens": 100463165.0, "step": 45005 }, { "entropy": 5.381993341445923, "epoch": 5.055034536979839, "grad_norm": 1.0234375, "learning_rate": 0.0002750481784624553, "loss": 4.8213, "mean_token_accuracy": 0.245214082300663, "num_tokens": 100474737.0, "step": 45010 }, { "entropy": 5.351296234130859, "epoch": 5.0555961138877965, "grad_norm": 1.0078125, "learning_rate": 0.00027500802974380224, "loss": 4.8423, "mean_token_accuracy": 0.22939803898334504, "num_tokens": 100487235.0, "step": 45015 }, { "entropy": 5.360181474685669, "epoch": 5.056157690795755, "grad_norm": 1.0, "learning_rate": 0.0002749678810248935, "loss": 4.8867, "mean_token_accuracy": 0.2375738024711609, "num_tokens": 100498886.0, "step": 45020 }, { "entropy": 5.314907264709473, "epoch": 5.056719267703712, "grad_norm": 1.0390625, "learning_rate": 0.0002749277323070075, "loss": 4.7459, "mean_token_accuracy": 0.2407187655568123, "num_tokens": 100509748.0, "step": 45025 }, { "entropy": 5.40738320350647, "epoch": 5.05728084461167, "grad_norm": 1.03125, "learning_rate": 0.00027488758359142245, "loss": 4.8677, "mean_token_accuracy": 0.23281890153884888, "num_tokens": 100522189.0, "step": 45030 }, { "entropy": 5.227555274963379, "epoch": 5.057842421519627, "grad_norm": 1.0234375, "learning_rate": 0.0002748474348794167, "loss": 4.7297, "mean_token_accuracy": 0.2392197370529175, "num_tokens": 100533437.0, "step": 45035 }, { "entropy": 5.451576375961304, "epoch": 5.058403998427584, "grad_norm": 1.015625, "learning_rate": 0.00027480728617226884, "loss": 4.9314, "mean_token_accuracy": 0.2280246540904045, "num_tokens": 100545268.0, "step": 45040 }, { "entropy": 5.31919264793396, "epoch": 5.0589655753355425, "grad_norm": 1.15625, "learning_rate": 0.000274767137471257, "loss": 4.8211, "mean_token_accuracy": 0.23375478088855745, "num_tokens": 100555650.0, "step": 45045 }, { "entropy": 5.294924592971801, "epoch": 5.0595271522435, "grad_norm": 1.0625, "learning_rate": 0.00027472698877765967, "loss": 4.8222, "mean_token_accuracy": 0.23947843611240388, "num_tokens": 100567173.0, "step": 45050 }, { "entropy": 5.408014917373658, "epoch": 5.060088729151457, "grad_norm": 1.0234375, "learning_rate": 0.0002746868400927551, "loss": 4.8527, "mean_token_accuracy": 0.2306646853685379, "num_tokens": 100577091.0, "step": 45055 }, { "entropy": 5.40376467704773, "epoch": 5.060650306059415, "grad_norm": 1.0703125, "learning_rate": 0.0002746466914178216, "loss": 4.8374, "mean_token_accuracy": 0.2394551992416382, "num_tokens": 100587917.0, "step": 45060 }, { "entropy": 5.210582208633423, "epoch": 5.061211882967372, "grad_norm": 0.9609375, "learning_rate": 0.0002746065427541376, "loss": 4.747, "mean_token_accuracy": 0.2391575112938881, "num_tokens": 100598861.0, "step": 45065 }, { "entropy": 5.275238084793091, "epoch": 5.06177345987533, "grad_norm": 1.1328125, "learning_rate": 0.00027456639410298144, "loss": 4.7445, "mean_token_accuracy": 0.24094553142786027, "num_tokens": 100609293.0, "step": 45070 }, { "entropy": 5.369404888153076, "epoch": 5.062335036783288, "grad_norm": 1.0078125, "learning_rate": 0.0002745262454656314, "loss": 4.8905, "mean_token_accuracy": 0.225148943066597, "num_tokens": 100620062.0, "step": 45075 }, { "entropy": 5.452035331726075, "epoch": 5.062896613691245, "grad_norm": 1.125, "learning_rate": 0.000274486096843366, "loss": 4.9365, "mean_token_accuracy": 0.2333208590745926, "num_tokens": 100630099.0, "step": 45080 }, { "entropy": 5.352411556243896, "epoch": 5.063458190599203, "grad_norm": 1.0703125, "learning_rate": 0.00027444594823746344, "loss": 4.7913, "mean_token_accuracy": 0.23640179336071016, "num_tokens": 100641710.0, "step": 45085 }, { "entropy": 5.249108123779297, "epoch": 5.06401976750716, "grad_norm": 0.96484375, "learning_rate": 0.0002744057996492021, "loss": 4.7095, "mean_token_accuracy": 0.24001881927251817, "num_tokens": 100652189.0, "step": 45090 }, { "entropy": 5.311280059814453, "epoch": 5.064581344415117, "grad_norm": 1.0625, "learning_rate": 0.0002743656510798603, "loss": 4.8105, "mean_token_accuracy": 0.23841976076364518, "num_tokens": 100663982.0, "step": 45095 }, { "entropy": 5.342454147338867, "epoch": 5.065142921323075, "grad_norm": 1.0390625, "learning_rate": 0.0002743255025307165, "loss": 4.8284, "mean_token_accuracy": 0.23870106190443038, "num_tokens": 100675070.0, "step": 45100 }, { "entropy": 5.439078283309937, "epoch": 5.065704498231033, "grad_norm": 1.0625, "learning_rate": 0.00027428535400304886, "loss": 4.9501, "mean_token_accuracy": 0.2298881307244301, "num_tokens": 100686852.0, "step": 45105 }, { "entropy": 5.305760908126831, "epoch": 5.06626607513899, "grad_norm": 1.0, "learning_rate": 0.0002742452054981358, "loss": 4.7961, "mean_token_accuracy": 0.23273055553436278, "num_tokens": 100697397.0, "step": 45110 }, { "entropy": 5.276540327072143, "epoch": 5.066827652046948, "grad_norm": 1.03125, "learning_rate": 0.0002742050570172558, "loss": 4.7884, "mean_token_accuracy": 0.23807377219200135, "num_tokens": 100709543.0, "step": 45115 }, { "entropy": 5.322295188903809, "epoch": 5.067389228954905, "grad_norm": 1.0625, "learning_rate": 0.000274164908561687, "loss": 4.8779, "mean_token_accuracy": 0.2331213504076004, "num_tokens": 100721742.0, "step": 45120 }, { "entropy": 5.401753330230713, "epoch": 5.067950805862863, "grad_norm": 0.9921875, "learning_rate": 0.00027412476013270786, "loss": 4.9792, "mean_token_accuracy": 0.22605310380458832, "num_tokens": 100733954.0, "step": 45125 }, { "entropy": 5.42852463722229, "epoch": 5.0685123827708205, "grad_norm": 1.09375, "learning_rate": 0.00027408461173159676, "loss": 4.8855, "mean_token_accuracy": 0.22979721873998643, "num_tokens": 100745855.0, "step": 45130 }, { "entropy": 5.240601062774658, "epoch": 5.069073959678778, "grad_norm": 1.1171875, "learning_rate": 0.00027404446335963195, "loss": 4.6975, "mean_token_accuracy": 0.23887763917446136, "num_tokens": 100756673.0, "step": 45135 }, { "entropy": 5.227750205993653, "epoch": 5.069635536586736, "grad_norm": 1.078125, "learning_rate": 0.0002740043150180918, "loss": 4.7575, "mean_token_accuracy": 0.2381819099187851, "num_tokens": 100768088.0, "step": 45140 }, { "entropy": 5.233298015594483, "epoch": 5.070197113494693, "grad_norm": 1.03125, "learning_rate": 0.0002739641667082546, "loss": 4.7746, "mean_token_accuracy": 0.240044566988945, "num_tokens": 100779275.0, "step": 45145 }, { "entropy": 5.379465484619141, "epoch": 5.07075869040265, "grad_norm": 1.140625, "learning_rate": 0.00027392401843139876, "loss": 4.8124, "mean_token_accuracy": 0.2395699918270111, "num_tokens": 100789614.0, "step": 45150 }, { "entropy": 5.2215508937835695, "epoch": 5.071320267310608, "grad_norm": 1.0078125, "learning_rate": 0.0002738838701888026, "loss": 4.6521, "mean_token_accuracy": 0.24645081907510757, "num_tokens": 100800784.0, "step": 45155 }, { "entropy": 5.2364600658416744, "epoch": 5.071881844218566, "grad_norm": 1.0625, "learning_rate": 0.0002738437219817444, "loss": 4.7617, "mean_token_accuracy": 0.2370292827486992, "num_tokens": 100811280.0, "step": 45160 }, { "entropy": 5.322388648986816, "epoch": 5.072443421126524, "grad_norm": 1.0859375, "learning_rate": 0.00027380357381150263, "loss": 4.8687, "mean_token_accuracy": 0.22986701279878616, "num_tokens": 100821214.0, "step": 45165 }, { "entropy": 5.3450428485870365, "epoch": 5.073004998034481, "grad_norm": 1.0078125, "learning_rate": 0.0002737634256793555, "loss": 4.8121, "mean_token_accuracy": 0.23324092626571655, "num_tokens": 100834363.0, "step": 45170 }, { "entropy": 5.3375711917877195, "epoch": 5.073566574942438, "grad_norm": 1.0625, "learning_rate": 0.00027372327758658135, "loss": 4.7909, "mean_token_accuracy": 0.2373301699757576, "num_tokens": 100845515.0, "step": 45175 }, { "entropy": 5.2282956600189205, "epoch": 5.074128151850396, "grad_norm": 1.0078125, "learning_rate": 0.00027368312953445845, "loss": 4.7763, "mean_token_accuracy": 0.23462757617235183, "num_tokens": 100856714.0, "step": 45180 }, { "entropy": 5.248512697219849, "epoch": 5.0746897287583534, "grad_norm": 1.03125, "learning_rate": 0.0002736429815242653, "loss": 4.7445, "mean_token_accuracy": 0.24191382825374602, "num_tokens": 100867828.0, "step": 45185 }, { "entropy": 5.363536930084228, "epoch": 5.075251305666311, "grad_norm": 1.0390625, "learning_rate": 0.0002736028335572802, "loss": 4.863, "mean_token_accuracy": 0.2341613292694092, "num_tokens": 100879589.0, "step": 45190 }, { "entropy": 5.3106166362762455, "epoch": 5.075812882574269, "grad_norm": 0.98046875, "learning_rate": 0.00027356268563478135, "loss": 4.7612, "mean_token_accuracy": 0.23888947069644928, "num_tokens": 100889218.0, "step": 45195 }, { "entropy": 5.297762489318847, "epoch": 5.076374459482226, "grad_norm": 1.0703125, "learning_rate": 0.0002735225377580472, "loss": 4.758, "mean_token_accuracy": 0.2479991853237152, "num_tokens": 100899482.0, "step": 45200 }, { "entropy": 5.266585016250611, "epoch": 5.076936036390183, "grad_norm": 1.015625, "learning_rate": 0.000273482389928356, "loss": 4.7287, "mean_token_accuracy": 0.23895819932222367, "num_tokens": 100910752.0, "step": 45205 }, { "entropy": 5.315157270431518, "epoch": 5.077497613298141, "grad_norm": 0.94140625, "learning_rate": 0.0002734422421469861, "loss": 4.8179, "mean_token_accuracy": 0.2356388345360756, "num_tokens": 100922491.0, "step": 45210 }, { "entropy": 5.284455251693726, "epoch": 5.0780591902060985, "grad_norm": 0.98046875, "learning_rate": 0.0002734020944152157, "loss": 4.7623, "mean_token_accuracy": 0.24758197069168092, "num_tokens": 100933558.0, "step": 45215 }, { "entropy": 5.211187505722046, "epoch": 5.078620767114057, "grad_norm": 0.9140625, "learning_rate": 0.0002733619467343234, "loss": 4.6727, "mean_token_accuracy": 0.24591450542211532, "num_tokens": 100944973.0, "step": 45220 }, { "entropy": 5.362029361724853, "epoch": 5.079182344022014, "grad_norm": 1.1328125, "learning_rate": 0.0002733217991055873, "loss": 4.8812, "mean_token_accuracy": 0.23375518023967742, "num_tokens": 100954673.0, "step": 45225 }, { "entropy": 5.317120742797852, "epoch": 5.079743920929971, "grad_norm": 1.1171875, "learning_rate": 0.0002732816515302858, "loss": 4.7394, "mean_token_accuracy": 0.24129631072282792, "num_tokens": 100965797.0, "step": 45230 }, { "entropy": 5.332632207870484, "epoch": 5.080305497837929, "grad_norm": 1.015625, "learning_rate": 0.0002732415040096971, "loss": 4.8157, "mean_token_accuracy": 0.23491228222846985, "num_tokens": 100977277.0, "step": 45235 }, { "entropy": 5.3242823600769045, "epoch": 5.080867074745886, "grad_norm": 0.98828125, "learning_rate": 0.00027320135654509964, "loss": 4.7455, "mean_token_accuracy": 0.24510975778102875, "num_tokens": 100989147.0, "step": 45240 }, { "entropy": 5.359854364395142, "epoch": 5.081428651653844, "grad_norm": 1.109375, "learning_rate": 0.0002731612091377717, "loss": 4.8723, "mean_token_accuracy": 0.23540589958429337, "num_tokens": 100998317.0, "step": 45245 }, { "entropy": 5.270200300216675, "epoch": 5.081990228561802, "grad_norm": 1.0, "learning_rate": 0.00027312106178899154, "loss": 4.7865, "mean_token_accuracy": 0.2325945407152176, "num_tokens": 101010268.0, "step": 45250 }, { "entropy": 5.3294202327728275, "epoch": 5.082551805469759, "grad_norm": 1.0546875, "learning_rate": 0.0002730809145000374, "loss": 4.8263, "mean_token_accuracy": 0.23664241135120392, "num_tokens": 101020344.0, "step": 45255 }, { "entropy": 5.244296646118164, "epoch": 5.083113382377717, "grad_norm": 1.0234375, "learning_rate": 0.0002730407672721878, "loss": 4.6912, "mean_token_accuracy": 0.24902569204568864, "num_tokens": 101031559.0, "step": 45260 }, { "entropy": 5.283180141448975, "epoch": 5.083674959285674, "grad_norm": 0.98046875, "learning_rate": 0.000273000620106721, "loss": 4.7446, "mean_token_accuracy": 0.23678601533174515, "num_tokens": 101043585.0, "step": 45265 }, { "entropy": 5.329788541793823, "epoch": 5.0842365361936315, "grad_norm": 0.984375, "learning_rate": 0.0002729604730049151, "loss": 4.7251, "mean_token_accuracy": 0.24079617857933044, "num_tokens": 101053506.0, "step": 45270 }, { "entropy": 5.359857273101807, "epoch": 5.08479811310159, "grad_norm": 1.203125, "learning_rate": 0.0002729203259680486, "loss": 4.9468, "mean_token_accuracy": 0.2261781007051468, "num_tokens": 101065179.0, "step": 45275 }, { "entropy": 5.326670074462891, "epoch": 5.085359690009547, "grad_norm": 1.0859375, "learning_rate": 0.0002728801789973998, "loss": 4.7783, "mean_token_accuracy": 0.23147362768650054, "num_tokens": 101075843.0, "step": 45280 }, { "entropy": 5.403021144866943, "epoch": 5.085921266917504, "grad_norm": 1.03125, "learning_rate": 0.0002728400320942468, "loss": 4.9524, "mean_token_accuracy": 0.22077289074659348, "num_tokens": 101087305.0, "step": 45285 }, { "entropy": 5.325952243804932, "epoch": 5.086482843825462, "grad_norm": 1.0703125, "learning_rate": 0.000272799885259868, "loss": 4.8106, "mean_token_accuracy": 0.2429259479045868, "num_tokens": 101098738.0, "step": 45290 }, { "entropy": 5.3207625389099125, "epoch": 5.087044420733419, "grad_norm": 1.0859375, "learning_rate": 0.0002727597384955418, "loss": 4.7399, "mean_token_accuracy": 0.24181464910507203, "num_tokens": 101108476.0, "step": 45295 }, { "entropy": 5.228541851043701, "epoch": 5.0876059976413766, "grad_norm": 1.140625, "learning_rate": 0.00027271959180254636, "loss": 4.7479, "mean_token_accuracy": 0.23916487395763397, "num_tokens": 101119547.0, "step": 45300 }, { "entropy": 5.29707407951355, "epoch": 5.088167574549335, "grad_norm": 1.09375, "learning_rate": 0.00027267944518215997, "loss": 4.8339, "mean_token_accuracy": 0.24210966378450394, "num_tokens": 101130820.0, "step": 45305 }, { "entropy": 5.342971897125244, "epoch": 5.088729151457292, "grad_norm": 1.140625, "learning_rate": 0.00027263929863566104, "loss": 4.8496, "mean_token_accuracy": 0.23438386470079423, "num_tokens": 101142565.0, "step": 45310 }, { "entropy": 5.379041337966919, "epoch": 5.08929072836525, "grad_norm": 1.015625, "learning_rate": 0.0002725991521643277, "loss": 4.8549, "mean_token_accuracy": 0.2321729615330696, "num_tokens": 101152963.0, "step": 45315 }, { "entropy": 5.355437326431274, "epoch": 5.089852305273207, "grad_norm": 0.98828125, "learning_rate": 0.0002725590057694383, "loss": 4.8138, "mean_token_accuracy": 0.2283369317650795, "num_tokens": 101163932.0, "step": 45320 }, { "entropy": 5.22455677986145, "epoch": 5.090413882181164, "grad_norm": 0.984375, "learning_rate": 0.00027251885945227093, "loss": 4.7837, "mean_token_accuracy": 0.2390478640794754, "num_tokens": 101176333.0, "step": 45325 }, { "entropy": 5.294744396209717, "epoch": 5.0909754590891225, "grad_norm": 0.95703125, "learning_rate": 0.00027247871321410425, "loss": 4.7887, "mean_token_accuracy": 0.235759137570858, "num_tokens": 101186443.0, "step": 45330 }, { "entropy": 5.294404792785644, "epoch": 5.09153703599708, "grad_norm": 1.0, "learning_rate": 0.00027243856705621623, "loss": 4.7801, "mean_token_accuracy": 0.24022141844034195, "num_tokens": 101197550.0, "step": 45335 }, { "entropy": 5.335787439346314, "epoch": 5.092098612905037, "grad_norm": 1.0625, "learning_rate": 0.00027239842097988526, "loss": 4.8093, "mean_token_accuracy": 0.23716435879468917, "num_tokens": 101208609.0, "step": 45340 }, { "entropy": 5.297311878204345, "epoch": 5.092660189812995, "grad_norm": 0.953125, "learning_rate": 0.0002723582749863896, "loss": 4.8344, "mean_token_accuracy": 0.23254527747631074, "num_tokens": 101219990.0, "step": 45345 }, { "entropy": 5.267515850067139, "epoch": 5.093221766720952, "grad_norm": 1.09375, "learning_rate": 0.00027231812907700746, "loss": 4.7151, "mean_token_accuracy": 0.2401001051068306, "num_tokens": 101230700.0, "step": 45350 }, { "entropy": 5.252775001525879, "epoch": 5.09378334362891, "grad_norm": 1.0234375, "learning_rate": 0.0002722779832530171, "loss": 4.6843, "mean_token_accuracy": 0.24343296587467195, "num_tokens": 101242029.0, "step": 45355 }, { "entropy": 5.179193496704102, "epoch": 5.094344920536868, "grad_norm": 1.0390625, "learning_rate": 0.00027223783751569687, "loss": 4.6507, "mean_token_accuracy": 0.2411127954721451, "num_tokens": 101252649.0, "step": 45360 }, { "entropy": 5.389099788665772, "epoch": 5.094906497444825, "grad_norm": 0.98046875, "learning_rate": 0.00027219769186632493, "loss": 5.0311, "mean_token_accuracy": 0.21986891329288483, "num_tokens": 101263744.0, "step": 45365 }, { "entropy": 5.392523527145386, "epoch": 5.095468074352783, "grad_norm": 1.0, "learning_rate": 0.0002721575463061796, "loss": 4.8545, "mean_token_accuracy": 0.23605295419692993, "num_tokens": 101276497.0, "step": 45370 }, { "entropy": 5.396787309646607, "epoch": 5.09602965126074, "grad_norm": 1.0, "learning_rate": 0.00027211740083653903, "loss": 4.8899, "mean_token_accuracy": 0.2293536588549614, "num_tokens": 101287759.0, "step": 45375 }, { "entropy": 5.404470157623291, "epoch": 5.096591228168697, "grad_norm": 1.046875, "learning_rate": 0.0002720772554586816, "loss": 4.9114, "mean_token_accuracy": 0.23735624104738234, "num_tokens": 101299037.0, "step": 45380 }, { "entropy": 5.33274245262146, "epoch": 5.0971528050766555, "grad_norm": 1.0078125, "learning_rate": 0.0002720371101738855, "loss": 4.8678, "mean_token_accuracy": 0.23403965681791306, "num_tokens": 101309921.0, "step": 45385 }, { "entropy": 5.249806070327759, "epoch": 5.097714381984613, "grad_norm": 1.078125, "learning_rate": 0.00027199696498342893, "loss": 4.7363, "mean_token_accuracy": 0.2505019798874855, "num_tokens": 101322265.0, "step": 45390 }, { "entropy": 5.273978662490845, "epoch": 5.09827595889257, "grad_norm": 1.015625, "learning_rate": 0.0002719568198885901, "loss": 4.7363, "mean_token_accuracy": 0.24427465349435806, "num_tokens": 101334795.0, "step": 45395 }, { "entropy": 5.311184597015381, "epoch": 5.098837535800528, "grad_norm": 1.03125, "learning_rate": 0.0002719166748906473, "loss": 4.8524, "mean_token_accuracy": 0.23572950661182404, "num_tokens": 101346216.0, "step": 45400 }, { "entropy": 5.349716901779175, "epoch": 5.099399112708485, "grad_norm": 0.9765625, "learning_rate": 0.00027187652999087887, "loss": 4.8773, "mean_token_accuracy": 0.2299988627433777, "num_tokens": 101357705.0, "step": 45405 }, { "entropy": 5.3707081317901615, "epoch": 5.099960689616443, "grad_norm": 1.03125, "learning_rate": 0.00027183638519056284, "loss": 4.8985, "mean_token_accuracy": 0.23500577956438065, "num_tokens": 101370598.0, "step": 45410 }, { "entropy": 5.335847663879394, "epoch": 5.1005222665244005, "grad_norm": 1.0390625, "learning_rate": 0.0002717962404909776, "loss": 4.8221, "mean_token_accuracy": 0.23786651343107224, "num_tokens": 101381942.0, "step": 45415 }, { "entropy": 5.277440309524536, "epoch": 5.101083843432358, "grad_norm": 1.046875, "learning_rate": 0.00027175609589340135, "loss": 4.7292, "mean_token_accuracy": 0.23367058485746384, "num_tokens": 101392861.0, "step": 45420 }, { "entropy": 5.295115900039673, "epoch": 5.101645420340316, "grad_norm": 1.0078125, "learning_rate": 0.0002717159513991122, "loss": 4.8391, "mean_token_accuracy": 0.23846681863069535, "num_tokens": 101403626.0, "step": 45425 }, { "entropy": 5.37615270614624, "epoch": 5.102206997248273, "grad_norm": 1.0078125, "learning_rate": 0.00027167580700938844, "loss": 4.8674, "mean_token_accuracy": 0.2312498301267624, "num_tokens": 101415235.0, "step": 45430 }, { "entropy": 5.322395992279053, "epoch": 5.10276857415623, "grad_norm": 0.96484375, "learning_rate": 0.00027163566272550826, "loss": 4.8872, "mean_token_accuracy": 0.2284943863749504, "num_tokens": 101426873.0, "step": 45435 }, { "entropy": 5.380699396133423, "epoch": 5.103330151064188, "grad_norm": 1.0234375, "learning_rate": 0.00027159551854874986, "loss": 4.838, "mean_token_accuracy": 0.23669617176055907, "num_tokens": 101437943.0, "step": 45440 }, { "entropy": 5.3982501983642575, "epoch": 5.103891727972146, "grad_norm": 1.0234375, "learning_rate": 0.0002715553744803915, "loss": 4.9049, "mean_token_accuracy": 0.23057395815849305, "num_tokens": 101451141.0, "step": 45445 }, { "entropy": 5.495499563217163, "epoch": 5.104453304880104, "grad_norm": 1.03125, "learning_rate": 0.0002715152305217114, "loss": 5.0169, "mean_token_accuracy": 0.22851019203662873, "num_tokens": 101463652.0, "step": 45450 }, { "entropy": 5.366817426681519, "epoch": 5.105014881788061, "grad_norm": 1.0703125, "learning_rate": 0.0002714750866739877, "loss": 4.8898, "mean_token_accuracy": 0.22865240275859833, "num_tokens": 101475172.0, "step": 45455 }, { "entropy": 5.2803913116455075, "epoch": 5.105576458696018, "grad_norm": 1.140625, "learning_rate": 0.0002714349429384986, "loss": 4.7283, "mean_token_accuracy": 0.2495747059583664, "num_tokens": 101486386.0, "step": 45460 }, { "entropy": 5.233789920806885, "epoch": 5.106138035603976, "grad_norm": 1.0390625, "learning_rate": 0.00027139479931652226, "loss": 4.6834, "mean_token_accuracy": 0.24208881258964537, "num_tokens": 101497267.0, "step": 45465 }, { "entropy": 5.376898336410522, "epoch": 5.1066996125119335, "grad_norm": 1.109375, "learning_rate": 0.0002713546558093368, "loss": 4.9482, "mean_token_accuracy": 0.2249480217695236, "num_tokens": 101508089.0, "step": 45470 }, { "entropy": 5.256248807907104, "epoch": 5.107261189419891, "grad_norm": 1.0546875, "learning_rate": 0.0002713145124182207, "loss": 4.6955, "mean_token_accuracy": 0.24082479774951934, "num_tokens": 101519841.0, "step": 45475 }, { "entropy": 5.291567993164063, "epoch": 5.107822766327849, "grad_norm": 1.0, "learning_rate": 0.00027127436914445194, "loss": 4.7863, "mean_token_accuracy": 0.23747073262929916, "num_tokens": 101531396.0, "step": 45480 }, { "entropy": 5.2341633319854735, "epoch": 5.108384343235806, "grad_norm": 1.09375, "learning_rate": 0.0002712342259893086, "loss": 4.6901, "mean_token_accuracy": 0.2474234566092491, "num_tokens": 101541648.0, "step": 45485 }, { "entropy": 5.385581541061401, "epoch": 5.108945920143763, "grad_norm": 1.1328125, "learning_rate": 0.00027119408295406906, "loss": 4.9275, "mean_token_accuracy": 0.23242573738098143, "num_tokens": 101552975.0, "step": 45490 }, { "entropy": 5.276618003845215, "epoch": 5.109507497051721, "grad_norm": 1.1171875, "learning_rate": 0.0002711539400400114, "loss": 4.8046, "mean_token_accuracy": 0.23313484191894532, "num_tokens": 101564563.0, "step": 45495 }, { "entropy": 5.246607160568237, "epoch": 5.110069073959679, "grad_norm": 1.0234375, "learning_rate": 0.00027111379724841373, "loss": 4.7205, "mean_token_accuracy": 0.23748010098934175, "num_tokens": 101575333.0, "step": 45500 }, { "entropy": 5.332402896881104, "epoch": 5.110630650867637, "grad_norm": 1.046875, "learning_rate": 0.00027107365458055424, "loss": 4.8884, "mean_token_accuracy": 0.23066612780094148, "num_tokens": 101587764.0, "step": 45505 }, { "entropy": 5.268567514419556, "epoch": 5.111192227775594, "grad_norm": 0.953125, "learning_rate": 0.0002710335120377112, "loss": 4.6926, "mean_token_accuracy": 0.2454391285777092, "num_tokens": 101598611.0, "step": 45510 }, { "entropy": 5.338338565826416, "epoch": 5.111753804683551, "grad_norm": 1.1171875, "learning_rate": 0.00027099336962116253, "loss": 4.8228, "mean_token_accuracy": 0.23702238649129867, "num_tokens": 101609407.0, "step": 45515 }, { "entropy": 5.303874206542969, "epoch": 5.112315381591509, "grad_norm": 0.9921875, "learning_rate": 0.00027095322733218665, "loss": 4.765, "mean_token_accuracy": 0.24403916150331498, "num_tokens": 101620248.0, "step": 45520 }, { "entropy": 5.275510025024414, "epoch": 5.112876958499466, "grad_norm": 1.015625, "learning_rate": 0.0002709130851720616, "loss": 4.7379, "mean_token_accuracy": 0.23651669621467591, "num_tokens": 101630474.0, "step": 45525 }, { "entropy": 5.247062063217163, "epoch": 5.113438535407424, "grad_norm": 1.15625, "learning_rate": 0.00027087294314206544, "loss": 4.6871, "mean_token_accuracy": 0.24628996700048447, "num_tokens": 101640986.0, "step": 45530 }, { "entropy": 5.3085578918457035, "epoch": 5.114000112315382, "grad_norm": 0.96875, "learning_rate": 0.0002708328012434764, "loss": 4.7901, "mean_token_accuracy": 0.24007055163383484, "num_tokens": 101652808.0, "step": 45535 }, { "entropy": 5.334859418869018, "epoch": 5.114561689223339, "grad_norm": 1.1484375, "learning_rate": 0.0002707926594775725, "loss": 4.8346, "mean_token_accuracy": 0.2303402081131935, "num_tokens": 101663260.0, "step": 45540 }, { "entropy": 5.321711874008178, "epoch": 5.115123266131297, "grad_norm": 1.0703125, "learning_rate": 0.00027075251784563196, "loss": 4.7586, "mean_token_accuracy": 0.23698304146528243, "num_tokens": 101674350.0, "step": 45545 }, { "entropy": 5.296667242050171, "epoch": 5.115684843039254, "grad_norm": 1.0078125, "learning_rate": 0.000270712376348933, "loss": 4.8094, "mean_token_accuracy": 0.23043066412210464, "num_tokens": 101685138.0, "step": 45550 }, { "entropy": 5.277134752273559, "epoch": 5.1162464199472115, "grad_norm": 1.0625, "learning_rate": 0.0002706722349887536, "loss": 4.7558, "mean_token_accuracy": 0.2398645430803299, "num_tokens": 101696049.0, "step": 45555 }, { "entropy": 5.341930961608886, "epoch": 5.11680799685517, "grad_norm": 1.0234375, "learning_rate": 0.0002706320937663719, "loss": 4.8475, "mean_token_accuracy": 0.23165763318538665, "num_tokens": 101706416.0, "step": 45560 }, { "entropy": 5.287344169616699, "epoch": 5.117369573763127, "grad_norm": 0.98046875, "learning_rate": 0.0002705919526830661, "loss": 4.7504, "mean_token_accuracy": 0.2532858371734619, "num_tokens": 101716682.0, "step": 45565 }, { "entropy": 5.280338859558105, "epoch": 5.117931150671084, "grad_norm": 1.046875, "learning_rate": 0.00027055181174011415, "loss": 4.7668, "mean_token_accuracy": 0.24526961892843246, "num_tokens": 101727957.0, "step": 45570 }, { "entropy": 5.278573751449585, "epoch": 5.118492727579042, "grad_norm": 1.0078125, "learning_rate": 0.00027051167093879424, "loss": 4.8016, "mean_token_accuracy": 0.24180636554956436, "num_tokens": 101738543.0, "step": 45575 }, { "entropy": 5.285947847366333, "epoch": 5.119054304486999, "grad_norm": 1.078125, "learning_rate": 0.0002704715302803846, "loss": 4.7897, "mean_token_accuracy": 0.23612888306379318, "num_tokens": 101748295.0, "step": 45580 }, { "entropy": 5.30083532333374, "epoch": 5.119615881394957, "grad_norm": 1.0078125, "learning_rate": 0.00027043138976616304, "loss": 4.7755, "mean_token_accuracy": 0.23314967304468154, "num_tokens": 101759442.0, "step": 45585 }, { "entropy": 5.29158501625061, "epoch": 5.120177458302915, "grad_norm": 1.0703125, "learning_rate": 0.00027039124939740787, "loss": 4.773, "mean_token_accuracy": 0.2389997959136963, "num_tokens": 101770638.0, "step": 45590 }, { "entropy": 5.372732496261596, "epoch": 5.120739035210872, "grad_norm": 0.984375, "learning_rate": 0.00027035110917539713, "loss": 4.7939, "mean_token_accuracy": 0.23876810520887376, "num_tokens": 101782260.0, "step": 45595 }, { "entropy": 5.336882162094116, "epoch": 5.12130061211883, "grad_norm": 1.015625, "learning_rate": 0.00027031096910140877, "loss": 4.8466, "mean_token_accuracy": 0.23518606126308442, "num_tokens": 101792682.0, "step": 45600 }, { "entropy": 5.293027257919311, "epoch": 5.121862189026787, "grad_norm": 1.0390625, "learning_rate": 0.00027027082917672107, "loss": 4.8305, "mean_token_accuracy": 0.2372559502720833, "num_tokens": 101804285.0, "step": 45605 }, { "entropy": 5.283727502822876, "epoch": 5.1224237659347445, "grad_norm": 0.9921875, "learning_rate": 0.00027023068940261203, "loss": 4.7381, "mean_token_accuracy": 0.24679071009159087, "num_tokens": 101815672.0, "step": 45610 }, { "entropy": 5.281565999984741, "epoch": 5.122985342842703, "grad_norm": 1.03125, "learning_rate": 0.0002701905497803595, "loss": 4.7606, "mean_token_accuracy": 0.24343560636043549, "num_tokens": 101825528.0, "step": 45615 }, { "entropy": 5.225766563415528, "epoch": 5.12354691975066, "grad_norm": 1.0546875, "learning_rate": 0.0002701504103112419, "loss": 4.7798, "mean_token_accuracy": 0.23707717806100845, "num_tokens": 101837003.0, "step": 45620 }, { "entropy": 5.342323207855225, "epoch": 5.124108496658617, "grad_norm": 1.0078125, "learning_rate": 0.00027011027099653706, "loss": 4.7843, "mean_token_accuracy": 0.23723017573356628, "num_tokens": 101848348.0, "step": 45625 }, { "entropy": 5.372262001037598, "epoch": 5.124670073566575, "grad_norm": 1.0625, "learning_rate": 0.0002700701318375232, "loss": 4.8319, "mean_token_accuracy": 0.24270790219306945, "num_tokens": 101858444.0, "step": 45630 }, { "entropy": 5.324036169052124, "epoch": 5.125231650474532, "grad_norm": 0.99609375, "learning_rate": 0.0002700299928354781, "loss": 4.7848, "mean_token_accuracy": 0.23736221790313722, "num_tokens": 101868906.0, "step": 45635 }, { "entropy": 5.334273481369019, "epoch": 5.12579322738249, "grad_norm": 0.96484375, "learning_rate": 0.00026998985399168005, "loss": 4.8432, "mean_token_accuracy": 0.23627472072839736, "num_tokens": 101879463.0, "step": 45640 }, { "entropy": 5.309261608123779, "epoch": 5.126354804290448, "grad_norm": 1.140625, "learning_rate": 0.00026994971530740696, "loss": 4.8295, "mean_token_accuracy": 0.23788015991449357, "num_tokens": 101889433.0, "step": 45645 }, { "entropy": 5.413313961029052, "epoch": 5.126916381198405, "grad_norm": 1.015625, "learning_rate": 0.00026990957678393684, "loss": 4.9029, "mean_token_accuracy": 0.2246471181511879, "num_tokens": 101900554.0, "step": 45650 }, { "entropy": 5.327274560928345, "epoch": 5.127477958106363, "grad_norm": 0.94921875, "learning_rate": 0.00026986943842254783, "loss": 4.7611, "mean_token_accuracy": 0.24421665966510772, "num_tokens": 101911205.0, "step": 45655 }, { "entropy": 5.189579820632934, "epoch": 5.12803953501432, "grad_norm": 0.99609375, "learning_rate": 0.0002698293002245179, "loss": 4.6868, "mean_token_accuracy": 0.24794643223285676, "num_tokens": 101924145.0, "step": 45660 }, { "entropy": 5.372443294525146, "epoch": 5.128601111922277, "grad_norm": 1.1171875, "learning_rate": 0.00026978916219112505, "loss": 4.8223, "mean_token_accuracy": 0.23775478154420854, "num_tokens": 101935433.0, "step": 45665 }, { "entropy": 5.272507572174073, "epoch": 5.1291626888302355, "grad_norm": 1.0234375, "learning_rate": 0.00026974902432364727, "loss": 4.7255, "mean_token_accuracy": 0.23705395609140395, "num_tokens": 101945570.0, "step": 45670 }, { "entropy": 5.343429183959961, "epoch": 5.129724265738193, "grad_norm": 1.109375, "learning_rate": 0.00026970888662336263, "loss": 4.9034, "mean_token_accuracy": 0.23015503138303756, "num_tokens": 101956410.0, "step": 45675 }, { "entropy": 5.284977722167969, "epoch": 5.130285842646151, "grad_norm": 0.9921875, "learning_rate": 0.0002696687490915491, "loss": 4.7231, "mean_token_accuracy": 0.24318659901618958, "num_tokens": 101966841.0, "step": 45680 }, { "entropy": 5.298451280593872, "epoch": 5.130847419554108, "grad_norm": 0.9765625, "learning_rate": 0.00026962861172948456, "loss": 4.7934, "mean_token_accuracy": 0.23785817474126816, "num_tokens": 101978169.0, "step": 45685 }, { "entropy": 5.285321950912476, "epoch": 5.131408996462065, "grad_norm": 1.1484375, "learning_rate": 0.00026958847453844713, "loss": 4.7584, "mean_token_accuracy": 0.24467013627290726, "num_tokens": 101987703.0, "step": 45690 }, { "entropy": 5.2324730396270756, "epoch": 5.131970573370023, "grad_norm": 0.99609375, "learning_rate": 0.00026954833751971486, "loss": 4.7491, "mean_token_accuracy": 0.23927617222070693, "num_tokens": 101999192.0, "step": 45695 }, { "entropy": 5.263344192504883, "epoch": 5.132532150277981, "grad_norm": 1.015625, "learning_rate": 0.0002695082006745656, "loss": 4.7585, "mean_token_accuracy": 0.23799145072698594, "num_tokens": 102010610.0, "step": 45700 }, { "entropy": 5.345568561553955, "epoch": 5.133093727185938, "grad_norm": 1.0625, "learning_rate": 0.0002694680640042774, "loss": 4.7188, "mean_token_accuracy": 0.2420754015445709, "num_tokens": 102020441.0, "step": 45705 }, { "entropy": 5.3496051788330075, "epoch": 5.133655304093896, "grad_norm": 1.0546875, "learning_rate": 0.00026942792751012814, "loss": 4.8334, "mean_token_accuracy": 0.23721442520618438, "num_tokens": 102030965.0, "step": 45710 }, { "entropy": 5.231669950485229, "epoch": 5.134216881001853, "grad_norm": 1.078125, "learning_rate": 0.00026938779119339585, "loss": 4.7561, "mean_token_accuracy": 0.2363509029150009, "num_tokens": 102041845.0, "step": 45715 }, { "entropy": 5.35624737739563, "epoch": 5.13477845790981, "grad_norm": 0.9765625, "learning_rate": 0.0002693476550553584, "loss": 4.9536, "mean_token_accuracy": 0.22683112174272538, "num_tokens": 102053578.0, "step": 45720 }, { "entropy": 5.386167764663696, "epoch": 5.1353400348177685, "grad_norm": 0.99609375, "learning_rate": 0.00026930751909729384, "loss": 4.8559, "mean_token_accuracy": 0.24191514402627945, "num_tokens": 102064235.0, "step": 45725 }, { "entropy": 5.25008487701416, "epoch": 5.135901611725726, "grad_norm": 0.98828125, "learning_rate": 0.00026926738332048013, "loss": 4.682, "mean_token_accuracy": 0.24812377542257308, "num_tokens": 102075213.0, "step": 45730 }, { "entropy": 5.350066804885865, "epoch": 5.136463188633684, "grad_norm": 1.09375, "learning_rate": 0.00026922724772619516, "loss": 4.9005, "mean_token_accuracy": 0.22801416963338852, "num_tokens": 102086651.0, "step": 45735 }, { "entropy": 5.332602405548096, "epoch": 5.137024765541641, "grad_norm": 1.078125, "learning_rate": 0.0002691871123157168, "loss": 4.8458, "mean_token_accuracy": 0.23010269105434417, "num_tokens": 102097396.0, "step": 45740 }, { "entropy": 5.287755727767944, "epoch": 5.137586342449598, "grad_norm": 1.03125, "learning_rate": 0.0002691469770903231, "loss": 4.7763, "mean_token_accuracy": 0.23839548528194426, "num_tokens": 102108009.0, "step": 45745 }, { "entropy": 5.255586576461792, "epoch": 5.138147919357556, "grad_norm": 0.984375, "learning_rate": 0.0002691068420512919, "loss": 4.6838, "mean_token_accuracy": 0.24887241274118424, "num_tokens": 102118158.0, "step": 45750 }, { "entropy": 5.324717855453491, "epoch": 5.1387094962655135, "grad_norm": 1.0703125, "learning_rate": 0.000269066707199901, "loss": 4.8695, "mean_token_accuracy": 0.23962584286928176, "num_tokens": 102130232.0, "step": 45755 }, { "entropy": 5.344628047943115, "epoch": 5.139271073173471, "grad_norm": 1.03125, "learning_rate": 0.00026902657253742855, "loss": 4.8649, "mean_token_accuracy": 0.23794818669557571, "num_tokens": 102142698.0, "step": 45760 }, { "entropy": 5.310995483398438, "epoch": 5.139832650081429, "grad_norm": 0.96875, "learning_rate": 0.0002689864380651524, "loss": 4.769, "mean_token_accuracy": 0.23484190702438354, "num_tokens": 102156270.0, "step": 45765 }, { "entropy": 5.299819660186768, "epoch": 5.140394226989386, "grad_norm": 0.921875, "learning_rate": 0.0002689463037843504, "loss": 4.7619, "mean_token_accuracy": 0.2388528913259506, "num_tokens": 102168369.0, "step": 45770 }, { "entropy": 5.298230504989624, "epoch": 5.140955803897343, "grad_norm": 1.125, "learning_rate": 0.0002689061696963004, "loss": 4.8193, "mean_token_accuracy": 0.23165415823459626, "num_tokens": 102180191.0, "step": 45775 }, { "entropy": 5.272256374359131, "epoch": 5.141517380805301, "grad_norm": 1.09375, "learning_rate": 0.0002688660358022803, "loss": 4.8061, "mean_token_accuracy": 0.23398303091526032, "num_tokens": 102191589.0, "step": 45780 }, { "entropy": 5.265850830078125, "epoch": 5.142078957713259, "grad_norm": 1.1015625, "learning_rate": 0.000268825902103568, "loss": 4.7508, "mean_token_accuracy": 0.2422882705926895, "num_tokens": 102202847.0, "step": 45785 }, { "entropy": 5.32477388381958, "epoch": 5.142640534621217, "grad_norm": 0.97265625, "learning_rate": 0.0002687857686014414, "loss": 4.8217, "mean_token_accuracy": 0.24039259403944016, "num_tokens": 102214353.0, "step": 45790 }, { "entropy": 5.390439891815186, "epoch": 5.143202111529174, "grad_norm": 1.0390625, "learning_rate": 0.0002687456352971783, "loss": 4.856, "mean_token_accuracy": 0.2356734022498131, "num_tokens": 102225149.0, "step": 45795 }, { "entropy": 5.345282745361328, "epoch": 5.143763688437131, "grad_norm": 1.015625, "learning_rate": 0.0002687055021920566, "loss": 4.8128, "mean_token_accuracy": 0.23692155182361602, "num_tokens": 102236364.0, "step": 45800 }, { "entropy": 5.3132226943969725, "epoch": 5.144325265345089, "grad_norm": 1.015625, "learning_rate": 0.0002686653692873542, "loss": 4.8207, "mean_token_accuracy": 0.23870041221380234, "num_tokens": 102247250.0, "step": 45805 }, { "entropy": 5.283676099777222, "epoch": 5.1448868422530465, "grad_norm": 0.94140625, "learning_rate": 0.00026862523658434883, "loss": 4.7715, "mean_token_accuracy": 0.24163332283496858, "num_tokens": 102257502.0, "step": 45810 }, { "entropy": 5.355433368682862, "epoch": 5.145448419161004, "grad_norm": 0.99609375, "learning_rate": 0.0002685851040843185, "loss": 4.8529, "mean_token_accuracy": 0.23724713176488876, "num_tokens": 102268818.0, "step": 45815 }, { "entropy": 5.213472127914429, "epoch": 5.146009996068962, "grad_norm": 1.09375, "learning_rate": 0.00026854497178854087, "loss": 4.7452, "mean_token_accuracy": 0.244953915476799, "num_tokens": 102278406.0, "step": 45820 }, { "entropy": 5.331564950942993, "epoch": 5.146571572976919, "grad_norm": 1.109375, "learning_rate": 0.0002685048396982939, "loss": 4.8669, "mean_token_accuracy": 0.22809667736291886, "num_tokens": 102290053.0, "step": 45825 }, { "entropy": 5.358632946014405, "epoch": 5.147133149884877, "grad_norm": 1.03125, "learning_rate": 0.00026846470781485517, "loss": 4.8636, "mean_token_accuracy": 0.23477908223867416, "num_tokens": 102300803.0, "step": 45830 }, { "entropy": 5.376092910766602, "epoch": 5.147694726792834, "grad_norm": 1.09375, "learning_rate": 0.0002684245761395028, "loss": 4.8306, "mean_token_accuracy": 0.23488317131996156, "num_tokens": 102311605.0, "step": 45835 }, { "entropy": 5.456468296051026, "epoch": 5.148256303700792, "grad_norm": 1.09375, "learning_rate": 0.00026838444467351447, "loss": 4.9717, "mean_token_accuracy": 0.2214631989598274, "num_tokens": 102322888.0, "step": 45840 }, { "entropy": 5.410055255889892, "epoch": 5.14881788060875, "grad_norm": 1.109375, "learning_rate": 0.00026834431341816805, "loss": 4.9001, "mean_token_accuracy": 0.23285947144031524, "num_tokens": 102333724.0, "step": 45845 }, { "entropy": 5.3645124435424805, "epoch": 5.149379457516707, "grad_norm": 1.0859375, "learning_rate": 0.00026830418237474126, "loss": 4.8648, "mean_token_accuracy": 0.22932861596345902, "num_tokens": 102345971.0, "step": 45850 }, { "entropy": 5.328705978393555, "epoch": 5.149941034424664, "grad_norm": 1.015625, "learning_rate": 0.0002682640515445118, "loss": 4.8102, "mean_token_accuracy": 0.23854778259992598, "num_tokens": 102357274.0, "step": 45855 }, { "entropy": 5.304092359542847, "epoch": 5.150502611332622, "grad_norm": 1.046875, "learning_rate": 0.0002682239209287577, "loss": 4.8295, "mean_token_accuracy": 0.23925930708646775, "num_tokens": 102368497.0, "step": 45860 }, { "entropy": 5.24492883682251, "epoch": 5.151064188240579, "grad_norm": 1.0859375, "learning_rate": 0.00026818379052875646, "loss": 4.7508, "mean_token_accuracy": 0.2431942567229271, "num_tokens": 102378812.0, "step": 45865 }, { "entropy": 5.219981670379639, "epoch": 5.1516257651485375, "grad_norm": 1.078125, "learning_rate": 0.000268143660345786, "loss": 4.7561, "mean_token_accuracy": 0.2441585659980774, "num_tokens": 102389282.0, "step": 45870 }, { "entropy": 5.380130243301392, "epoch": 5.152187342056495, "grad_norm": 1.109375, "learning_rate": 0.0002681035303811241, "loss": 4.9532, "mean_token_accuracy": 0.2310943990945816, "num_tokens": 102400694.0, "step": 45875 }, { "entropy": 5.414079475402832, "epoch": 5.152748918964452, "grad_norm": 1.0078125, "learning_rate": 0.00026806340063604845, "loss": 4.8098, "mean_token_accuracy": 0.2337352767586708, "num_tokens": 102411947.0, "step": 45880 }, { "entropy": 5.306844711303711, "epoch": 5.15331049587241, "grad_norm": 1.1015625, "learning_rate": 0.00026802327111183686, "loss": 4.7339, "mean_token_accuracy": 0.24261675477027894, "num_tokens": 102422146.0, "step": 45885 }, { "entropy": 5.234015226364136, "epoch": 5.153872072780367, "grad_norm": 0.984375, "learning_rate": 0.00026798314180976696, "loss": 4.7592, "mean_token_accuracy": 0.2390228033065796, "num_tokens": 102434077.0, "step": 45890 }, { "entropy": 5.3289988994598385, "epoch": 5.1544336496883245, "grad_norm": 0.953125, "learning_rate": 0.00026794301273111654, "loss": 4.8138, "mean_token_accuracy": 0.233797287940979, "num_tokens": 102446812.0, "step": 45895 }, { "entropy": 5.3180272579193115, "epoch": 5.154995226596283, "grad_norm": 0.9921875, "learning_rate": 0.0002679028838771633, "loss": 4.83, "mean_token_accuracy": 0.23212722390890123, "num_tokens": 102459198.0, "step": 45900 }, { "entropy": 5.369432353973389, "epoch": 5.15555680350424, "grad_norm": 0.96875, "learning_rate": 0.00026786275524918503, "loss": 4.8539, "mean_token_accuracy": 0.238254676759243, "num_tokens": 102470932.0, "step": 45905 }, { "entropy": 5.3772646427154545, "epoch": 5.156118380412197, "grad_norm": 0.984375, "learning_rate": 0.0002678226268484594, "loss": 4.8702, "mean_token_accuracy": 0.23620584309101106, "num_tokens": 102482349.0, "step": 45910 }, { "entropy": 5.353902292251587, "epoch": 5.156679957320155, "grad_norm": 1.015625, "learning_rate": 0.0002677824986762641, "loss": 4.8171, "mean_token_accuracy": 0.23579344302415847, "num_tokens": 102493782.0, "step": 45915 }, { "entropy": 5.259968900680542, "epoch": 5.157241534228112, "grad_norm": 1.03125, "learning_rate": 0.0002677423707338769, "loss": 4.7794, "mean_token_accuracy": 0.23308838456869124, "num_tokens": 102506106.0, "step": 45920 }, { "entropy": 5.282429456710815, "epoch": 5.1578031111360705, "grad_norm": 1.109375, "learning_rate": 0.0002677022430225754, "loss": 4.7258, "mean_token_accuracy": 0.2401619479060173, "num_tokens": 102516482.0, "step": 45925 }, { "entropy": 5.3451117992401125, "epoch": 5.158364688044028, "grad_norm": 1.0546875, "learning_rate": 0.00026766211554363727, "loss": 4.8514, "mean_token_accuracy": 0.23331603556871414, "num_tokens": 102526477.0, "step": 45930 }, { "entropy": 5.367437791824341, "epoch": 5.158926264951985, "grad_norm": 1.046875, "learning_rate": 0.0002676219882983403, "loss": 4.8349, "mean_token_accuracy": 0.23348188847303392, "num_tokens": 102538381.0, "step": 45935 }, { "entropy": 5.238291168212891, "epoch": 5.159487841859943, "grad_norm": 1.203125, "learning_rate": 0.00026758186128796204, "loss": 4.7097, "mean_token_accuracy": 0.24515151530504226, "num_tokens": 102548595.0, "step": 45940 }, { "entropy": 5.308560848236084, "epoch": 5.1600494187679, "grad_norm": 1.0, "learning_rate": 0.00026754173451378014, "loss": 4.7992, "mean_token_accuracy": 0.23282752484083175, "num_tokens": 102560560.0, "step": 45945 }, { "entropy": 5.321582508087158, "epoch": 5.1606109956758575, "grad_norm": 1.1015625, "learning_rate": 0.00026750160797707245, "loss": 4.7632, "mean_token_accuracy": 0.24069393575191497, "num_tokens": 102570623.0, "step": 45950 }, { "entropy": 5.301931571960449, "epoch": 5.161172572583816, "grad_norm": 1.0234375, "learning_rate": 0.0002674614816791164, "loss": 4.8556, "mean_token_accuracy": 0.23833516538143157, "num_tokens": 102581662.0, "step": 45955 }, { "entropy": 5.253459644317627, "epoch": 5.161734149491773, "grad_norm": 0.9609375, "learning_rate": 0.00026742135562118967, "loss": 4.7917, "mean_token_accuracy": 0.2396291509270668, "num_tokens": 102593875.0, "step": 45960 }, { "entropy": 5.342164802551269, "epoch": 5.16229572639973, "grad_norm": 1.1328125, "learning_rate": 0.0002673812298045699, "loss": 4.8635, "mean_token_accuracy": 0.23699143081903457, "num_tokens": 102604639.0, "step": 45965 }, { "entropy": 5.347805213928223, "epoch": 5.162857303307688, "grad_norm": 1.0234375, "learning_rate": 0.00026734110423053483, "loss": 4.8084, "mean_token_accuracy": 0.23384298682212828, "num_tokens": 102614297.0, "step": 45970 }, { "entropy": 5.384401178359985, "epoch": 5.163418880215645, "grad_norm": 1.0546875, "learning_rate": 0.00026730097890036175, "loss": 4.8669, "mean_token_accuracy": 0.23492816239595413, "num_tokens": 102625480.0, "step": 45975 }, { "entropy": 5.332390546798706, "epoch": 5.163980457123603, "grad_norm": 1.0703125, "learning_rate": 0.00026726085381532867, "loss": 4.8217, "mean_token_accuracy": 0.24194729328155518, "num_tokens": 102637342.0, "step": 45980 }, { "entropy": 5.4014825344085695, "epoch": 5.164542034031561, "grad_norm": 1.0859375, "learning_rate": 0.000267220728976713, "loss": 4.8661, "mean_token_accuracy": 0.23513562381267547, "num_tokens": 102646886.0, "step": 45985 }, { "entropy": 5.369273138046265, "epoch": 5.165103610939518, "grad_norm": 1.0859375, "learning_rate": 0.0002671806043857923, "loss": 4.8445, "mean_token_accuracy": 0.23992279618978501, "num_tokens": 102658929.0, "step": 45990 }, { "entropy": 5.436691474914551, "epoch": 5.165665187847476, "grad_norm": 1.015625, "learning_rate": 0.0002671404800438442, "loss": 4.9829, "mean_token_accuracy": 0.22102392315864564, "num_tokens": 102670308.0, "step": 45995 }, { "entropy": 5.326947641372681, "epoch": 5.166226764755433, "grad_norm": 1.078125, "learning_rate": 0.0002671003559521463, "loss": 4.7571, "mean_token_accuracy": 0.238910211622715, "num_tokens": 102680714.0, "step": 46000 }, { "entropy": 5.350050640106201, "epoch": 5.16678834166339, "grad_norm": 0.94140625, "learning_rate": 0.00026706023211197613, "loss": 4.8495, "mean_token_accuracy": 0.2287491038441658, "num_tokens": 102692016.0, "step": 46005 }, { "entropy": 5.289581298828125, "epoch": 5.1673499185713485, "grad_norm": 1.2734375, "learning_rate": 0.0002670201085246111, "loss": 4.7417, "mean_token_accuracy": 0.24180605709552766, "num_tokens": 102702901.0, "step": 46010 }, { "entropy": 5.318958377838134, "epoch": 5.167911495479306, "grad_norm": 1.2890625, "learning_rate": 0.00026697998519132905, "loss": 4.7595, "mean_token_accuracy": 0.241864213347435, "num_tokens": 102714830.0, "step": 46015 }, { "entropy": 5.376074552536011, "epoch": 5.168473072387264, "grad_norm": 1.03125, "learning_rate": 0.00026693986211340736, "loss": 4.8871, "mean_token_accuracy": 0.23174970149993895, "num_tokens": 102726417.0, "step": 46020 }, { "entropy": 5.283934783935547, "epoch": 5.169034649295221, "grad_norm": 1.09375, "learning_rate": 0.00026689973929212363, "loss": 4.7028, "mean_token_accuracy": 0.24186822175979614, "num_tokens": 102737399.0, "step": 46025 }, { "entropy": 5.396965551376343, "epoch": 5.169596226203178, "grad_norm": 1.1171875, "learning_rate": 0.00026685961672875524, "loss": 4.9483, "mean_token_accuracy": 0.23507405519485475, "num_tokens": 102748412.0, "step": 46030 }, { "entropy": 5.325987863540649, "epoch": 5.170157803111136, "grad_norm": 0.953125, "learning_rate": 0.0002668194944245799, "loss": 4.7969, "mean_token_accuracy": 0.2398018717765808, "num_tokens": 102759538.0, "step": 46035 }, { "entropy": 5.326444673538208, "epoch": 5.170719380019094, "grad_norm": 1.046875, "learning_rate": 0.000266779372380875, "loss": 4.9227, "mean_token_accuracy": 0.22305290251970292, "num_tokens": 102771660.0, "step": 46040 }, { "entropy": 5.352777290344238, "epoch": 5.171280956927051, "grad_norm": 1.1015625, "learning_rate": 0.000266739250598918, "loss": 4.8322, "mean_token_accuracy": 0.23046321123838426, "num_tokens": 102781968.0, "step": 46045 }, { "entropy": 5.321163463592529, "epoch": 5.171842533835009, "grad_norm": 1.09375, "learning_rate": 0.00026669912907998657, "loss": 4.8591, "mean_token_accuracy": 0.22982878535985946, "num_tokens": 102792734.0, "step": 46050 }, { "entropy": 5.271653890609741, "epoch": 5.172404110742966, "grad_norm": 1.03125, "learning_rate": 0.000266659007825358, "loss": 4.7592, "mean_token_accuracy": 0.24279282838106156, "num_tokens": 102804423.0, "step": 46055 }, { "entropy": 5.315888404846191, "epoch": 5.172965687650924, "grad_norm": 1.0234375, "learning_rate": 0.00026661888683631, "loss": 4.7744, "mean_token_accuracy": 0.2453315868973732, "num_tokens": 102815615.0, "step": 46060 }, { "entropy": 5.364956665039062, "epoch": 5.1735272645588815, "grad_norm": 1.046875, "learning_rate": 0.00026657876611411974, "loss": 4.851, "mean_token_accuracy": 0.23277200609445572, "num_tokens": 102827389.0, "step": 46065 }, { "entropy": 5.257541656494141, "epoch": 5.174088841466839, "grad_norm": 1.0, "learning_rate": 0.00026653864566006494, "loss": 4.759, "mean_token_accuracy": 0.23918040841817856, "num_tokens": 102838570.0, "step": 46070 }, { "entropy": 5.271478176116943, "epoch": 5.174650418374797, "grad_norm": 0.9296875, "learning_rate": 0.0002664985254754229, "loss": 4.7991, "mean_token_accuracy": 0.23386719673871995, "num_tokens": 102850465.0, "step": 46075 }, { "entropy": 5.257231998443603, "epoch": 5.175211995282754, "grad_norm": 1.015625, "learning_rate": 0.00026645840556147103, "loss": 4.7565, "mean_token_accuracy": 0.25054467767477034, "num_tokens": 102861281.0, "step": 46080 }, { "entropy": 5.345813798904419, "epoch": 5.175773572190711, "grad_norm": 0.94921875, "learning_rate": 0.0002664182859194869, "loss": 4.8366, "mean_token_accuracy": 0.23155570328235625, "num_tokens": 102873336.0, "step": 46085 }, { "entropy": 5.302256536483765, "epoch": 5.176335149098669, "grad_norm": 1.046875, "learning_rate": 0.0002663781665507479, "loss": 4.8176, "mean_token_accuracy": 0.23749894946813582, "num_tokens": 102884468.0, "step": 46090 }, { "entropy": 5.336627769470215, "epoch": 5.1768967260066265, "grad_norm": 1.0078125, "learning_rate": 0.00026633804745653146, "loss": 4.8521, "mean_token_accuracy": 0.23346900343894958, "num_tokens": 102896967.0, "step": 46095 }, { "entropy": 5.339280891418457, "epoch": 5.177458302914584, "grad_norm": 0.99609375, "learning_rate": 0.00026629792863811484, "loss": 4.8466, "mean_token_accuracy": 0.23347465693950653, "num_tokens": 102908365.0, "step": 46100 }, { "entropy": 5.343844985961914, "epoch": 5.178019879822542, "grad_norm": 1.125, "learning_rate": 0.0002662578100967756, "loss": 4.8101, "mean_token_accuracy": 0.23865189999341965, "num_tokens": 102918256.0, "step": 46105 }, { "entropy": 5.275404691696167, "epoch": 5.178581456730499, "grad_norm": 1.0703125, "learning_rate": 0.0002662176918337911, "loss": 4.7595, "mean_token_accuracy": 0.24222324937582015, "num_tokens": 102928547.0, "step": 46110 }, { "entropy": 5.3406671524047855, "epoch": 5.179143033638457, "grad_norm": 1.0546875, "learning_rate": 0.0002661775738504387, "loss": 4.9098, "mean_token_accuracy": 0.2355419546365738, "num_tokens": 102939345.0, "step": 46115 }, { "entropy": 5.409253025054932, "epoch": 5.179704610546414, "grad_norm": 1.0, "learning_rate": 0.00026613745614799574, "loss": 4.8956, "mean_token_accuracy": 0.23028626292943954, "num_tokens": 102949962.0, "step": 46120 }, { "entropy": 5.371373844146729, "epoch": 5.180266187454372, "grad_norm": 0.98828125, "learning_rate": 0.0002660973387277396, "loss": 4.8223, "mean_token_accuracy": 0.22753997892141342, "num_tokens": 102960951.0, "step": 46125 }, { "entropy": 5.312120008468628, "epoch": 5.18082776436233, "grad_norm": 0.92578125, "learning_rate": 0.0002660572215909477, "loss": 4.7693, "mean_token_accuracy": 0.23935734778642653, "num_tokens": 102972350.0, "step": 46130 }, { "entropy": 5.3044655323028564, "epoch": 5.181389341270287, "grad_norm": 1.0390625, "learning_rate": 0.0002660171047388973, "loss": 4.8434, "mean_token_accuracy": 0.2335546538233757, "num_tokens": 102984177.0, "step": 46135 }, { "entropy": 5.295929670333862, "epoch": 5.181950918178244, "grad_norm": 0.92578125, "learning_rate": 0.00026597698817286576, "loss": 4.8277, "mean_token_accuracy": 0.23754352033138276, "num_tokens": 102995609.0, "step": 46140 }, { "entropy": 5.384040403366089, "epoch": 5.182512495086202, "grad_norm": 1.1171875, "learning_rate": 0.00026593687189413044, "loss": 4.8546, "mean_token_accuracy": 0.24154627621173858, "num_tokens": 103006091.0, "step": 46145 }, { "entropy": 5.323021745681762, "epoch": 5.1830740719941595, "grad_norm": 1.0234375, "learning_rate": 0.00026589675590396865, "loss": 4.7877, "mean_token_accuracy": 0.23794285506010054, "num_tokens": 103016861.0, "step": 46150 }, { "entropy": 5.304147672653198, "epoch": 5.183635648902117, "grad_norm": 1.046875, "learning_rate": 0.0002658566402036576, "loss": 4.7806, "mean_token_accuracy": 0.23482141494750977, "num_tokens": 103027849.0, "step": 46155 }, { "entropy": 5.315965080261231, "epoch": 5.184197225810075, "grad_norm": 1.0859375, "learning_rate": 0.0002658165247944747, "loss": 4.7907, "mean_token_accuracy": 0.2403961032629013, "num_tokens": 103040235.0, "step": 46160 }, { "entropy": 5.330029392242432, "epoch": 5.184758802718032, "grad_norm": 1.0390625, "learning_rate": 0.00026577640967769727, "loss": 4.8503, "mean_token_accuracy": 0.23993521183729172, "num_tokens": 103049823.0, "step": 46165 }, { "entropy": 5.37466139793396, "epoch": 5.18532037962599, "grad_norm": 1.078125, "learning_rate": 0.00026573629485460257, "loss": 4.8217, "mean_token_accuracy": 0.2323736995458603, "num_tokens": 103060957.0, "step": 46170 }, { "entropy": 5.329695749282837, "epoch": 5.185881956533947, "grad_norm": 1.078125, "learning_rate": 0.00026569618032646773, "loss": 4.8558, "mean_token_accuracy": 0.23460995852947236, "num_tokens": 103071092.0, "step": 46175 }, { "entropy": 5.332767820358276, "epoch": 5.186443533441905, "grad_norm": 0.9375, "learning_rate": 0.00026565606609457016, "loss": 4.8512, "mean_token_accuracy": 0.23423193991184235, "num_tokens": 103083021.0, "step": 46180 }, { "entropy": 5.251117944717407, "epoch": 5.187005110349863, "grad_norm": 0.95703125, "learning_rate": 0.0002656159521601871, "loss": 4.8097, "mean_token_accuracy": 0.23787901252508165, "num_tokens": 103093569.0, "step": 46185 }, { "entropy": 5.283539295196533, "epoch": 5.18756668725782, "grad_norm": 1.0390625, "learning_rate": 0.0002655758385245956, "loss": 4.7848, "mean_token_accuracy": 0.23613962829113005, "num_tokens": 103104745.0, "step": 46190 }, { "entropy": 5.3724761486053465, "epoch": 5.188128264165777, "grad_norm": 0.97265625, "learning_rate": 0.0002655357251890732, "loss": 4.8218, "mean_token_accuracy": 0.23936327844858168, "num_tokens": 103117090.0, "step": 46195 }, { "entropy": 5.435968542098999, "epoch": 5.188689841073735, "grad_norm": 1.1015625, "learning_rate": 0.00026549561215489695, "loss": 4.8794, "mean_token_accuracy": 0.230899615585804, "num_tokens": 103128491.0, "step": 46200 }, { "entropy": 5.3306722164154055, "epoch": 5.189251417981692, "grad_norm": 1.078125, "learning_rate": 0.0002654554994233442, "loss": 4.804, "mean_token_accuracy": 0.23342931568622588, "num_tokens": 103140028.0, "step": 46205 }, { "entropy": 5.297089910507202, "epoch": 5.1898129948896505, "grad_norm": 1.0234375, "learning_rate": 0.0002654153869956919, "loss": 4.8116, "mean_token_accuracy": 0.23440655767917634, "num_tokens": 103150514.0, "step": 46210 }, { "entropy": 5.288339042663575, "epoch": 5.190374571797608, "grad_norm": 1.0703125, "learning_rate": 0.0002653752748732175, "loss": 4.7664, "mean_token_accuracy": 0.24235253036022186, "num_tokens": 103161409.0, "step": 46215 }, { "entropy": 5.382736015319824, "epoch": 5.190936148705565, "grad_norm": 1.0625, "learning_rate": 0.000265335163057198, "loss": 4.8271, "mean_token_accuracy": 0.24588370323181152, "num_tokens": 103172394.0, "step": 46220 }, { "entropy": 5.291476774215698, "epoch": 5.191497725613523, "grad_norm": 1.0703125, "learning_rate": 0.0002652950515489107, "loss": 4.7872, "mean_token_accuracy": 0.23129139989614486, "num_tokens": 103183461.0, "step": 46225 }, { "entropy": 5.323620891571045, "epoch": 5.19205930252148, "grad_norm": 0.99609375, "learning_rate": 0.0002652549403496327, "loss": 4.8644, "mean_token_accuracy": 0.23399290889501573, "num_tokens": 103194495.0, "step": 46230 }, { "entropy": 5.430592727661133, "epoch": 5.1926208794294375, "grad_norm": 1.125, "learning_rate": 0.00026521482946064123, "loss": 4.9013, "mean_token_accuracy": 0.23201505839824677, "num_tokens": 103205287.0, "step": 46235 }, { "entropy": 5.285521602630615, "epoch": 5.193182456337396, "grad_norm": 1.1171875, "learning_rate": 0.0002651747188832134, "loss": 4.8834, "mean_token_accuracy": 0.23339492082595825, "num_tokens": 103216447.0, "step": 46240 }, { "entropy": 5.303513288497925, "epoch": 5.193744033245353, "grad_norm": 0.9609375, "learning_rate": 0.0002651346086186262, "loss": 4.8215, "mean_token_accuracy": 0.23778688609600068, "num_tokens": 103228663.0, "step": 46245 }, { "entropy": 5.329627799987793, "epoch": 5.194305610153311, "grad_norm": 1.125, "learning_rate": 0.000265094498668157, "loss": 4.8242, "mean_token_accuracy": 0.23827047944068908, "num_tokens": 103239698.0, "step": 46250 }, { "entropy": 5.372756385803223, "epoch": 5.194867187061268, "grad_norm": 1.0546875, "learning_rate": 0.00026505438903308285, "loss": 4.8148, "mean_token_accuracy": 0.23956566154956818, "num_tokens": 103250498.0, "step": 46255 }, { "entropy": 5.326104021072387, "epoch": 5.195428763969225, "grad_norm": 0.93359375, "learning_rate": 0.00026501427971468056, "loss": 4.8534, "mean_token_accuracy": 0.22856909930706024, "num_tokens": 103262776.0, "step": 46260 }, { "entropy": 5.258111667633057, "epoch": 5.1959903408771835, "grad_norm": 1.046875, "learning_rate": 0.0002649741707142277, "loss": 4.7831, "mean_token_accuracy": 0.23821176290512086, "num_tokens": 103274057.0, "step": 46265 }, { "entropy": 5.362839078903198, "epoch": 5.196551917785141, "grad_norm": 1.0546875, "learning_rate": 0.00026493406203300106, "loss": 4.7716, "mean_token_accuracy": 0.23728837072849274, "num_tokens": 103285038.0, "step": 46270 }, { "entropy": 5.3757997989654545, "epoch": 5.197113494693098, "grad_norm": 1.1171875, "learning_rate": 0.00026489395367227785, "loss": 4.8462, "mean_token_accuracy": 0.24165143370628356, "num_tokens": 103297135.0, "step": 46275 }, { "entropy": 5.2999162673950195, "epoch": 5.197675071601056, "grad_norm": 1.03125, "learning_rate": 0.000264853845633335, "loss": 4.7935, "mean_token_accuracy": 0.23148528933525087, "num_tokens": 103307597.0, "step": 46280 }, { "entropy": 5.342015886306763, "epoch": 5.198236648509013, "grad_norm": 1.0546875, "learning_rate": 0.0002648137379174497, "loss": 4.8398, "mean_token_accuracy": 0.23172418177127838, "num_tokens": 103318070.0, "step": 46285 }, { "entropy": 5.243734836578369, "epoch": 5.1987982254169705, "grad_norm": 1.0078125, "learning_rate": 0.0002647736305258989, "loss": 4.767, "mean_token_accuracy": 0.24164282083511351, "num_tokens": 103329277.0, "step": 46290 }, { "entropy": 5.302700042724609, "epoch": 5.199359802324929, "grad_norm": 1.0859375, "learning_rate": 0.0002647335234599597, "loss": 4.7647, "mean_token_accuracy": 0.23718852251768113, "num_tokens": 103340349.0, "step": 46295 }, { "entropy": 5.291387605667114, "epoch": 5.199921379232886, "grad_norm": 1.0546875, "learning_rate": 0.00026469341672090906, "loss": 4.8575, "mean_token_accuracy": 0.2299127146601677, "num_tokens": 103351818.0, "step": 46300 }, { "entropy": 5.281939697265625, "epoch": 5.200482956140844, "grad_norm": 1.0859375, "learning_rate": 0.00026465331031002404, "loss": 4.8037, "mean_token_accuracy": 0.23634101897478105, "num_tokens": 103362092.0, "step": 46305 }, { "entropy": 5.368774032592773, "epoch": 5.201044533048801, "grad_norm": 1.1015625, "learning_rate": 0.00026461320422858166, "loss": 4.866, "mean_token_accuracy": 0.23111395686864852, "num_tokens": 103372237.0, "step": 46310 }, { "entropy": 5.334552335739136, "epoch": 5.201606109956758, "grad_norm": 1.0625, "learning_rate": 0.0002645730984778589, "loss": 4.7697, "mean_token_accuracy": 0.24120177775621415, "num_tokens": 103382191.0, "step": 46315 }, { "entropy": 5.359958505630493, "epoch": 5.202167686864716, "grad_norm": 1.1484375, "learning_rate": 0.0002645329930591327, "loss": 4.884, "mean_token_accuracy": 0.23547806739807128, "num_tokens": 103392299.0, "step": 46320 }, { "entropy": 5.2710168838500975, "epoch": 5.202729263772674, "grad_norm": 0.9609375, "learning_rate": 0.00026449288797368006, "loss": 4.7839, "mean_token_accuracy": 0.2354392796754837, "num_tokens": 103403846.0, "step": 46325 }, { "entropy": 5.299375247955322, "epoch": 5.203290840680631, "grad_norm": 0.94921875, "learning_rate": 0.00026445278322277796, "loss": 4.726, "mean_token_accuracy": 0.23402297347784043, "num_tokens": 103414773.0, "step": 46330 }, { "entropy": 5.3416444778442385, "epoch": 5.203852417588589, "grad_norm": 0.98046875, "learning_rate": 0.0002644126788077032, "loss": 4.8592, "mean_token_accuracy": 0.23241541385650635, "num_tokens": 103427991.0, "step": 46335 }, { "entropy": 5.274004220962524, "epoch": 5.204413994496546, "grad_norm": 0.94921875, "learning_rate": 0.00026437257472973296, "loss": 4.8468, "mean_token_accuracy": 0.238724485039711, "num_tokens": 103439605.0, "step": 46340 }, { "entropy": 5.2903495788574215, "epoch": 5.204975571404503, "grad_norm": 1.015625, "learning_rate": 0.00026433247099014406, "loss": 4.776, "mean_token_accuracy": 0.23571933209896087, "num_tokens": 103450327.0, "step": 46345 }, { "entropy": 5.305609321594238, "epoch": 5.2055371483124615, "grad_norm": 1.03125, "learning_rate": 0.0002642923675902135, "loss": 4.8351, "mean_token_accuracy": 0.2338385209441185, "num_tokens": 103461238.0, "step": 46350 }, { "entropy": 5.292350482940674, "epoch": 5.206098725220419, "grad_norm": 1.0625, "learning_rate": 0.000264252264531218, "loss": 4.7694, "mean_token_accuracy": 0.24021084010601043, "num_tokens": 103471625.0, "step": 46355 }, { "entropy": 5.290216302871704, "epoch": 5.206660302128377, "grad_norm": 1.0234375, "learning_rate": 0.00026421216181443457, "loss": 4.7811, "mean_token_accuracy": 0.23807192146778106, "num_tokens": 103483758.0, "step": 46360 }, { "entropy": 5.356973886489868, "epoch": 5.207221879036334, "grad_norm": 1.0390625, "learning_rate": 0.0002641720594411401, "loss": 4.8833, "mean_token_accuracy": 0.2327433481812477, "num_tokens": 103495733.0, "step": 46365 }, { "entropy": 5.284691333770752, "epoch": 5.207783455944291, "grad_norm": 1.0859375, "learning_rate": 0.00026413195741261145, "loss": 4.7996, "mean_token_accuracy": 0.23395009934902192, "num_tokens": 103506689.0, "step": 46370 }, { "entropy": 5.3217857837677, "epoch": 5.208345032852249, "grad_norm": 1.0078125, "learning_rate": 0.0002640918557301256, "loss": 4.8949, "mean_token_accuracy": 0.23327019810676575, "num_tokens": 103519707.0, "step": 46375 }, { "entropy": 5.416431283950805, "epoch": 5.208906609760207, "grad_norm": 1.0546875, "learning_rate": 0.0002640517543949592, "loss": 4.867, "mean_token_accuracy": 0.22863890677690507, "num_tokens": 103530888.0, "step": 46380 }, { "entropy": 5.35195484161377, "epoch": 5.209468186668164, "grad_norm": 0.99609375, "learning_rate": 0.0002640116534083892, "loss": 4.8266, "mean_token_accuracy": 0.23562142997980118, "num_tokens": 103541537.0, "step": 46385 }, { "entropy": 5.294554710388184, "epoch": 5.210029763576122, "grad_norm": 1.0390625, "learning_rate": 0.00026397155277169246, "loss": 4.7894, "mean_token_accuracy": 0.2398407682776451, "num_tokens": 103552388.0, "step": 46390 }, { "entropy": 5.338511800765991, "epoch": 5.210591340484079, "grad_norm": 1.0, "learning_rate": 0.0002639314524861457, "loss": 4.8899, "mean_token_accuracy": 0.23471634089946747, "num_tokens": 103564029.0, "step": 46395 }, { "entropy": 5.3889354228973385, "epoch": 5.211152917392037, "grad_norm": 1.0625, "learning_rate": 0.0002638913525530258, "loss": 4.8804, "mean_token_accuracy": 0.23692228496074677, "num_tokens": 103574756.0, "step": 46400 }, { "entropy": 5.396828031539917, "epoch": 5.2117144942999944, "grad_norm": 1.015625, "learning_rate": 0.00026385125297360946, "loss": 4.848, "mean_token_accuracy": 0.23954593986272812, "num_tokens": 103585810.0, "step": 46405 }, { "entropy": 5.312682151794434, "epoch": 5.212276071207952, "grad_norm": 1.109375, "learning_rate": 0.00026381115374917363, "loss": 4.8426, "mean_token_accuracy": 0.24144833385944367, "num_tokens": 103597799.0, "step": 46410 }, { "entropy": 5.329310655593872, "epoch": 5.21283764811591, "grad_norm": 0.9921875, "learning_rate": 0.00026377105488099503, "loss": 4.8214, "mean_token_accuracy": 0.23575979918241502, "num_tokens": 103608570.0, "step": 46415 }, { "entropy": 5.323026275634765, "epoch": 5.213399225023867, "grad_norm": 1.03125, "learning_rate": 0.00026373095637035037, "loss": 4.8147, "mean_token_accuracy": 0.23358115255832673, "num_tokens": 103620339.0, "step": 46420 }, { "entropy": 5.23717885017395, "epoch": 5.213960801931824, "grad_norm": 0.98046875, "learning_rate": 0.00026369085821851645, "loss": 4.7058, "mean_token_accuracy": 0.23941144496202468, "num_tokens": 103631471.0, "step": 46425 }, { "entropy": 5.292329883575439, "epoch": 5.214522378839782, "grad_norm": 0.99609375, "learning_rate": 0.00026365076042677, "loss": 4.7473, "mean_token_accuracy": 0.23796988427639007, "num_tokens": 103642223.0, "step": 46430 }, { "entropy": 5.304733848571777, "epoch": 5.2150839557477395, "grad_norm": 1.03125, "learning_rate": 0.0002636106629963877, "loss": 4.7541, "mean_token_accuracy": 0.24536751508712767, "num_tokens": 103653848.0, "step": 46435 }, { "entropy": 5.323637437820435, "epoch": 5.215645532655698, "grad_norm": 1.1015625, "learning_rate": 0.0002635705659286463, "loss": 4.8399, "mean_token_accuracy": 0.23941079080104827, "num_tokens": 103665765.0, "step": 46440 }, { "entropy": 5.397332382202149, "epoch": 5.216207109563655, "grad_norm": 1.0, "learning_rate": 0.00026353046922482256, "loss": 4.8786, "mean_token_accuracy": 0.2284968227148056, "num_tokens": 103678164.0, "step": 46445 }, { "entropy": 5.4142258644104, "epoch": 5.216768686471612, "grad_norm": 1.2734375, "learning_rate": 0.0002634903728861931, "loss": 4.8839, "mean_token_accuracy": 0.2282840356230736, "num_tokens": 103689274.0, "step": 46450 }, { "entropy": 5.455453681945801, "epoch": 5.21733026337957, "grad_norm": 0.9453125, "learning_rate": 0.0002634502769140346, "loss": 4.9366, "mean_token_accuracy": 0.22781803458929062, "num_tokens": 103701272.0, "step": 46455 }, { "entropy": 5.356705188751221, "epoch": 5.217891840287527, "grad_norm": 1.046875, "learning_rate": 0.00026341018130962384, "loss": 4.8762, "mean_token_accuracy": 0.22982213348150254, "num_tokens": 103711349.0, "step": 46460 }, { "entropy": 5.286958885192871, "epoch": 5.218453417195485, "grad_norm": 0.984375, "learning_rate": 0.00026337008607423733, "loss": 4.7892, "mean_token_accuracy": 0.23468744158744811, "num_tokens": 103722518.0, "step": 46465 }, { "entropy": 5.309659576416015, "epoch": 5.219014994103443, "grad_norm": 1.09375, "learning_rate": 0.00026332999120915184, "loss": 4.8219, "mean_token_accuracy": 0.23683672547340393, "num_tokens": 103732485.0, "step": 46470 }, { "entropy": 5.36706953048706, "epoch": 5.2195765710114, "grad_norm": 1.1015625, "learning_rate": 0.00026328989671564395, "loss": 4.9023, "mean_token_accuracy": 0.22470946609973907, "num_tokens": 103742856.0, "step": 46475 }, { "entropy": 5.384916496276856, "epoch": 5.220138147919357, "grad_norm": 1.0078125, "learning_rate": 0.0002632498025949902, "loss": 4.8734, "mean_token_accuracy": 0.23125288337469102, "num_tokens": 103755021.0, "step": 46480 }, { "entropy": 5.36115083694458, "epoch": 5.220699724827315, "grad_norm": 1.015625, "learning_rate": 0.0002632097088484674, "loss": 4.8064, "mean_token_accuracy": 0.2420017257332802, "num_tokens": 103765856.0, "step": 46485 }, { "entropy": 5.359007692337036, "epoch": 5.2212613017352725, "grad_norm": 1.03125, "learning_rate": 0.00026316961547735203, "loss": 4.7885, "mean_token_accuracy": 0.23553959429264068, "num_tokens": 103777771.0, "step": 46490 }, { "entropy": 5.2952796459198, "epoch": 5.221822878643231, "grad_norm": 1.0546875, "learning_rate": 0.00026312952248292067, "loss": 4.8112, "mean_token_accuracy": 0.23279588520526887, "num_tokens": 103789668.0, "step": 46495 }, { "entropy": 5.331391763687134, "epoch": 5.222384455551188, "grad_norm": 1.03125, "learning_rate": 0.0002630894298664499, "loss": 4.9025, "mean_token_accuracy": 0.2360980376601219, "num_tokens": 103799946.0, "step": 46500 }, { "entropy": 5.323740386962891, "epoch": 5.222946032459145, "grad_norm": 0.98046875, "learning_rate": 0.00026304933762921637, "loss": 4.7082, "mean_token_accuracy": 0.24122352600097657, "num_tokens": 103810311.0, "step": 46505 }, { "entropy": 5.321113109588623, "epoch": 5.223507609367103, "grad_norm": 1.015625, "learning_rate": 0.0002630092457724965, "loss": 4.8101, "mean_token_accuracy": 0.23278290033340454, "num_tokens": 103821210.0, "step": 46510 }, { "entropy": 5.296548366546631, "epoch": 5.22406918627506, "grad_norm": 1.078125, "learning_rate": 0.0002629691542975669, "loss": 4.7533, "mean_token_accuracy": 0.2430556982755661, "num_tokens": 103831684.0, "step": 46515 }, { "entropy": 5.259181356430053, "epoch": 5.224630763183018, "grad_norm": 1.03125, "learning_rate": 0.0002629290632057041, "loss": 4.7021, "mean_token_accuracy": 0.2528118208050728, "num_tokens": 103842293.0, "step": 46520 }, { "entropy": 5.238279342651367, "epoch": 5.225192340090976, "grad_norm": 1.0078125, "learning_rate": 0.0002628889724981846, "loss": 4.8109, "mean_token_accuracy": 0.23790747076272964, "num_tokens": 103854218.0, "step": 46525 }, { "entropy": 5.3169762134552006, "epoch": 5.225753916998933, "grad_norm": 1.0234375, "learning_rate": 0.0002628488821762849, "loss": 4.9117, "mean_token_accuracy": 0.23030306547880172, "num_tokens": 103865162.0, "step": 46530 }, { "entropy": 5.34351487159729, "epoch": 5.22631549390689, "grad_norm": 1.0703125, "learning_rate": 0.00026280879224128165, "loss": 4.8713, "mean_token_accuracy": 0.24010601192712783, "num_tokens": 103876694.0, "step": 46535 }, { "entropy": 5.315881156921387, "epoch": 5.226877070814848, "grad_norm": 1.078125, "learning_rate": 0.000262768702694451, "loss": 4.7563, "mean_token_accuracy": 0.24081839621067047, "num_tokens": 103887665.0, "step": 46540 }, { "entropy": 5.288255214691162, "epoch": 5.227438647722805, "grad_norm": 1.078125, "learning_rate": 0.0002627286135370697, "loss": 4.7921, "mean_token_accuracy": 0.23431711345911027, "num_tokens": 103899396.0, "step": 46545 }, { "entropy": 5.341542530059814, "epoch": 5.2280002246307635, "grad_norm": 1.0390625, "learning_rate": 0.000262688524770414, "loss": 4.8045, "mean_token_accuracy": 0.2354320302605629, "num_tokens": 103910592.0, "step": 46550 }, { "entropy": 5.371560525894165, "epoch": 5.228561801538721, "grad_norm": 1.03125, "learning_rate": 0.00026264843639576055, "loss": 4.8883, "mean_token_accuracy": 0.23524882942438125, "num_tokens": 103922657.0, "step": 46555 }, { "entropy": 5.275856637954712, "epoch": 5.229123378446678, "grad_norm": 0.9921875, "learning_rate": 0.0002626083484143856, "loss": 4.7816, "mean_token_accuracy": 0.23905359953641891, "num_tokens": 103933129.0, "step": 46560 }, { "entropy": 5.384342288970947, "epoch": 5.229684955354636, "grad_norm": 0.90234375, "learning_rate": 0.0002625682608275657, "loss": 4.8901, "mean_token_accuracy": 0.23655917644500732, "num_tokens": 103945485.0, "step": 46565 }, { "entropy": 5.247740650177002, "epoch": 5.230246532262593, "grad_norm": 0.921875, "learning_rate": 0.0002625281736365772, "loss": 4.7703, "mean_token_accuracy": 0.2390676721930504, "num_tokens": 103957465.0, "step": 46570 }, { "entropy": 5.293262672424317, "epoch": 5.2308081091705505, "grad_norm": 0.984375, "learning_rate": 0.00026248808684269646, "loss": 4.8032, "mean_token_accuracy": 0.2360462635755539, "num_tokens": 103968410.0, "step": 46575 }, { "entropy": 5.363087368011475, "epoch": 5.231369686078509, "grad_norm": 1.03125, "learning_rate": 0.0002624480004472, "loss": 4.8548, "mean_token_accuracy": 0.23272415101528168, "num_tokens": 103978923.0, "step": 46580 }, { "entropy": 5.300690031051635, "epoch": 5.231931262986466, "grad_norm": 1.0546875, "learning_rate": 0.00026240791445136384, "loss": 4.7161, "mean_token_accuracy": 0.23674419522285461, "num_tokens": 103989176.0, "step": 46585 }, { "entropy": 5.363605546951294, "epoch": 5.232492839894424, "grad_norm": 0.99609375, "learning_rate": 0.0002623678288564647, "loss": 4.8513, "mean_token_accuracy": 0.23388962000608443, "num_tokens": 104000172.0, "step": 46590 }, { "entropy": 5.253322124481201, "epoch": 5.233054416802381, "grad_norm": 1.09375, "learning_rate": 0.0002623277436637788, "loss": 4.7761, "mean_token_accuracy": 0.2382298856973648, "num_tokens": 104011883.0, "step": 46595 }, { "entropy": 5.323957872390747, "epoch": 5.233615993710338, "grad_norm": 1.015625, "learning_rate": 0.0002622876588745825, "loss": 4.8067, "mean_token_accuracy": 0.23712734133005142, "num_tokens": 104023607.0, "step": 46600 }, { "entropy": 5.371814918518067, "epoch": 5.2341775706182965, "grad_norm": 0.91796875, "learning_rate": 0.000262247574490152, "loss": 4.8897, "mean_token_accuracy": 0.23181650936603546, "num_tokens": 104036424.0, "step": 46605 }, { "entropy": 5.370618057250977, "epoch": 5.234739147526254, "grad_norm": 1.0546875, "learning_rate": 0.0002622074905117637, "loss": 4.933, "mean_token_accuracy": 0.22846785187721252, "num_tokens": 104048076.0, "step": 46610 }, { "entropy": 5.396787166595459, "epoch": 5.235300724434211, "grad_norm": 1.03125, "learning_rate": 0.00026216740694069387, "loss": 4.9298, "mean_token_accuracy": 0.22326239496469497, "num_tokens": 104058662.0, "step": 46615 }, { "entropy": 5.3344708442687985, "epoch": 5.235862301342169, "grad_norm": 1.0859375, "learning_rate": 0.0002621273237782188, "loss": 4.7263, "mean_token_accuracy": 0.24438222646713256, "num_tokens": 104069525.0, "step": 46620 }, { "entropy": 5.274775886535645, "epoch": 5.236423878250126, "grad_norm": 0.9921875, "learning_rate": 0.0002620872410256146, "loss": 4.732, "mean_token_accuracy": 0.24117178171873094, "num_tokens": 104080491.0, "step": 46625 }, { "entropy": 5.3018981456756595, "epoch": 5.236985455158084, "grad_norm": 1.0234375, "learning_rate": 0.0002620471586841577, "loss": 4.794, "mean_token_accuracy": 0.24336625188589095, "num_tokens": 104091723.0, "step": 46630 }, { "entropy": 5.289374828338623, "epoch": 5.2375470320660416, "grad_norm": 0.98828125, "learning_rate": 0.0002620070767551244, "loss": 4.7447, "mean_token_accuracy": 0.24563791304826738, "num_tokens": 104103554.0, "step": 46635 }, { "entropy": 5.384687519073486, "epoch": 5.238108608973999, "grad_norm": 0.96875, "learning_rate": 0.0002619669952397908, "loss": 4.8332, "mean_token_accuracy": 0.23145875036716462, "num_tokens": 104115228.0, "step": 46640 }, { "entropy": 5.355109691619873, "epoch": 5.238670185881957, "grad_norm": 0.8984375, "learning_rate": 0.0002619269141394331, "loss": 4.8766, "mean_token_accuracy": 0.23172284066677093, "num_tokens": 104127550.0, "step": 46645 }, { "entropy": 5.28333592414856, "epoch": 5.239231762789914, "grad_norm": 1.0546875, "learning_rate": 0.0002618868334553275, "loss": 4.8091, "mean_token_accuracy": 0.23967068493366242, "num_tokens": 104138567.0, "step": 46650 }, { "entropy": 5.294527196884156, "epoch": 5.239793339697871, "grad_norm": 1.140625, "learning_rate": 0.00026184675318875023, "loss": 4.8604, "mean_token_accuracy": 0.2364148750901222, "num_tokens": 104150237.0, "step": 46655 }, { "entropy": 5.367743825912475, "epoch": 5.240354916605829, "grad_norm": 1.0390625, "learning_rate": 0.00026180667334097733, "loss": 4.8518, "mean_token_accuracy": 0.23355712890625, "num_tokens": 104161461.0, "step": 46660 }, { "entropy": 5.34079942703247, "epoch": 5.240916493513787, "grad_norm": 1.0625, "learning_rate": 0.0002617665939132852, "loss": 4.7593, "mean_token_accuracy": 0.23976379185914992, "num_tokens": 104172225.0, "step": 46665 }, { "entropy": 5.278589344024658, "epoch": 5.241478070421744, "grad_norm": 1.015625, "learning_rate": 0.0002617265149069498, "loss": 4.7467, "mean_token_accuracy": 0.24236240088939667, "num_tokens": 104182926.0, "step": 46670 }, { "entropy": 5.3144152641296385, "epoch": 5.242039647329702, "grad_norm": 0.98828125, "learning_rate": 0.0002616864363232474, "loss": 4.83, "mean_token_accuracy": 0.2432252749800682, "num_tokens": 104194044.0, "step": 46675 }, { "entropy": 5.315785551071167, "epoch": 5.242601224237659, "grad_norm": 1.03125, "learning_rate": 0.00026164635816345395, "loss": 4.8261, "mean_token_accuracy": 0.24319904446601867, "num_tokens": 104205383.0, "step": 46680 }, { "entropy": 5.280603456497192, "epoch": 5.243162801145617, "grad_norm": 1.140625, "learning_rate": 0.0002616062804288457, "loss": 4.7885, "mean_token_accuracy": 0.23710711896419526, "num_tokens": 104217423.0, "step": 46685 }, { "entropy": 5.311478185653686, "epoch": 5.2437243780535745, "grad_norm": 1.0, "learning_rate": 0.0002615662031206986, "loss": 4.7963, "mean_token_accuracy": 0.23360835611820222, "num_tokens": 104228551.0, "step": 46690 }, { "entropy": 5.371574020385742, "epoch": 5.244285954961532, "grad_norm": 1.03125, "learning_rate": 0.0002615261262402887, "loss": 4.9223, "mean_token_accuracy": 0.23019634336233138, "num_tokens": 104239778.0, "step": 46695 }, { "entropy": 5.345068740844726, "epoch": 5.24484753186949, "grad_norm": 1.03125, "learning_rate": 0.00026148604978889237, "loss": 4.8633, "mean_token_accuracy": 0.23160379976034165, "num_tokens": 104250863.0, "step": 46700 }, { "entropy": 5.30193018913269, "epoch": 5.245409108777447, "grad_norm": 1.0078125, "learning_rate": 0.00026144597376778533, "loss": 4.7456, "mean_token_accuracy": 0.24856564551591873, "num_tokens": 104261458.0, "step": 46705 }, { "entropy": 5.2212282657623295, "epoch": 5.245970685685404, "grad_norm": 0.99609375, "learning_rate": 0.0002614058981782438, "loss": 4.7191, "mean_token_accuracy": 0.245540651679039, "num_tokens": 104272426.0, "step": 46710 }, { "entropy": 5.270497131347656, "epoch": 5.246532262593362, "grad_norm": 1.0703125, "learning_rate": 0.00026136582302154377, "loss": 4.758, "mean_token_accuracy": 0.23975466787815095, "num_tokens": 104283616.0, "step": 46715 }, { "entropy": 5.3058741092681885, "epoch": 5.24709383950132, "grad_norm": 1.0078125, "learning_rate": 0.00026132574829896123, "loss": 4.8654, "mean_token_accuracy": 0.2355233609676361, "num_tokens": 104294016.0, "step": 46720 }, { "entropy": 5.401514768600464, "epoch": 5.247655416409277, "grad_norm": 1.0703125, "learning_rate": 0.0002612856740117721, "loss": 4.8544, "mean_token_accuracy": 0.23238602876663209, "num_tokens": 104305004.0, "step": 46725 }, { "entropy": 5.393391752243042, "epoch": 5.248216993317235, "grad_norm": 0.96875, "learning_rate": 0.00026124560016125236, "loss": 4.8697, "mean_token_accuracy": 0.23866243660449982, "num_tokens": 104316789.0, "step": 46730 }, { "entropy": 5.2945366382598875, "epoch": 5.248778570225192, "grad_norm": 1.0625, "learning_rate": 0.0002612055267486782, "loss": 4.7316, "mean_token_accuracy": 0.23730792552232743, "num_tokens": 104327701.0, "step": 46735 }, { "entropy": 5.298704385757446, "epoch": 5.24934014713315, "grad_norm": 0.95703125, "learning_rate": 0.00026116545377532536, "loss": 4.7621, "mean_token_accuracy": 0.23683555871248246, "num_tokens": 104339242.0, "step": 46740 }, { "entropy": 5.380912590026855, "epoch": 5.249901724041107, "grad_norm": 1.046875, "learning_rate": 0.0002611253812424698, "loss": 4.9913, "mean_token_accuracy": 0.2234647735953331, "num_tokens": 104349090.0, "step": 46745 }, { "entropy": 5.274644947052002, "epoch": 5.250463300949065, "grad_norm": 1.0390625, "learning_rate": 0.0002610853091513876, "loss": 4.7368, "mean_token_accuracy": 0.2385093942284584, "num_tokens": 104360850.0, "step": 46750 }, { "entropy": 5.30753378868103, "epoch": 5.251024877857023, "grad_norm": 1.03125, "learning_rate": 0.00026104523750335445, "loss": 4.808, "mean_token_accuracy": 0.2369964137673378, "num_tokens": 104371829.0, "step": 46755 }, { "entropy": 5.385022735595703, "epoch": 5.25158645476498, "grad_norm": 0.953125, "learning_rate": 0.0002610051662996464, "loss": 4.8822, "mean_token_accuracy": 0.23535809963941573, "num_tokens": 104383209.0, "step": 46760 }, { "entropy": 5.283401870727539, "epoch": 5.252148031672937, "grad_norm": 1.0234375, "learning_rate": 0.00026096509554153914, "loss": 4.761, "mean_token_accuracy": 0.2404167488217354, "num_tokens": 104394069.0, "step": 46765 }, { "entropy": 5.38891863822937, "epoch": 5.252709608580895, "grad_norm": 1.0, "learning_rate": 0.0002609250252303088, "loss": 4.9017, "mean_token_accuracy": 0.22257187962532043, "num_tokens": 104406056.0, "step": 46770 }, { "entropy": 5.29359245300293, "epoch": 5.2532711854888525, "grad_norm": 1.125, "learning_rate": 0.0002608849553672311, "loss": 4.8693, "mean_token_accuracy": 0.23242984861135482, "num_tokens": 104416600.0, "step": 46775 }, { "entropy": 5.3562380313873295, "epoch": 5.253832762396811, "grad_norm": 0.9765625, "learning_rate": 0.00026084488595358197, "loss": 4.8969, "mean_token_accuracy": 0.23494188636541366, "num_tokens": 104428307.0, "step": 46780 }, { "entropy": 5.308892059326172, "epoch": 5.254394339304768, "grad_norm": 1.0234375, "learning_rate": 0.0002608048169906371, "loss": 4.7882, "mean_token_accuracy": 0.23528470396995543, "num_tokens": 104439691.0, "step": 46785 }, { "entropy": 5.377576780319214, "epoch": 5.254955916212725, "grad_norm": 1.0078125, "learning_rate": 0.00026076474847967236, "loss": 4.924, "mean_token_accuracy": 0.23308319896459578, "num_tokens": 104450456.0, "step": 46790 }, { "entropy": 5.351230955123901, "epoch": 5.255517493120683, "grad_norm": 0.99609375, "learning_rate": 0.00026072468042196356, "loss": 4.9211, "mean_token_accuracy": 0.2264087527990341, "num_tokens": 104462057.0, "step": 46795 }, { "entropy": 5.428287172317505, "epoch": 5.25607907002864, "grad_norm": 1.0, "learning_rate": 0.00026068461281878645, "loss": 4.8797, "mean_token_accuracy": 0.22710398435592652, "num_tokens": 104473998.0, "step": 46800 }, { "entropy": 5.3246265888214115, "epoch": 5.256640646936598, "grad_norm": 0.96484375, "learning_rate": 0.00026064454567141683, "loss": 4.7367, "mean_token_accuracy": 0.23714830428361894, "num_tokens": 104485487.0, "step": 46805 }, { "entropy": 5.374052286148071, "epoch": 5.257202223844556, "grad_norm": 0.94921875, "learning_rate": 0.0002606044789811304, "loss": 4.8794, "mean_token_accuracy": 0.2339703157544136, "num_tokens": 104496968.0, "step": 46810 }, { "entropy": 5.359351968765258, "epoch": 5.257763800752513, "grad_norm": 1.0078125, "learning_rate": 0.000260564412749203, "loss": 4.8765, "mean_token_accuracy": 0.23233067840337754, "num_tokens": 104508448.0, "step": 46815 }, { "entropy": 5.307772827148438, "epoch": 5.258325377660471, "grad_norm": 1.046875, "learning_rate": 0.00026052434697691035, "loss": 4.7878, "mean_token_accuracy": 0.23097856044769288, "num_tokens": 104519706.0, "step": 46820 }, { "entropy": 5.198577785491944, "epoch": 5.258886954568428, "grad_norm": 1.0703125, "learning_rate": 0.000260484281665528, "loss": 4.6783, "mean_token_accuracy": 0.24580665230751036, "num_tokens": 104530277.0, "step": 46825 }, { "entropy": 5.387057733535767, "epoch": 5.2594485314763855, "grad_norm": 0.99609375, "learning_rate": 0.0002604442168163318, "loss": 4.855, "mean_token_accuracy": 0.2332157760858536, "num_tokens": 104541577.0, "step": 46830 }, { "entropy": 5.316790962219239, "epoch": 5.260010108384344, "grad_norm": 1.078125, "learning_rate": 0.0002604041524305974, "loss": 4.8464, "mean_token_accuracy": 0.23067595809698105, "num_tokens": 104553185.0, "step": 46835 }, { "entropy": 5.348239898681641, "epoch": 5.260571685292301, "grad_norm": 1.0078125, "learning_rate": 0.0002603640885096004, "loss": 4.8185, "mean_token_accuracy": 0.24327073693275453, "num_tokens": 104565221.0, "step": 46840 }, { "entropy": 5.233686351776123, "epoch": 5.261133262200258, "grad_norm": 1.015625, "learning_rate": 0.0002603240250546165, "loss": 4.6677, "mean_token_accuracy": 0.24404096603393555, "num_tokens": 104577293.0, "step": 46845 }, { "entropy": 5.2941466808319095, "epoch": 5.261694839108216, "grad_norm": 1.0078125, "learning_rate": 0.00026028396206692134, "loss": 4.7668, "mean_token_accuracy": 0.238493849337101, "num_tokens": 104587894.0, "step": 46850 }, { "entropy": 5.30857629776001, "epoch": 5.262256416016173, "grad_norm": 1.0234375, "learning_rate": 0.00026024389954779054, "loss": 4.824, "mean_token_accuracy": 0.23412288427352906, "num_tokens": 104598396.0, "step": 46855 }, { "entropy": 5.344823169708252, "epoch": 5.2628179929241306, "grad_norm": 1.1171875, "learning_rate": 0.0002602038374984997, "loss": 4.9095, "mean_token_accuracy": 0.23141019493341447, "num_tokens": 104608554.0, "step": 46860 }, { "entropy": 5.309149360656738, "epoch": 5.263379569832089, "grad_norm": 1.0859375, "learning_rate": 0.00026016377592032446, "loss": 4.8105, "mean_token_accuracy": 0.23867145776748658, "num_tokens": 104619562.0, "step": 46865 }, { "entropy": 5.28914852142334, "epoch": 5.263941146740046, "grad_norm": 0.921875, "learning_rate": 0.0002601237148145403, "loss": 4.8132, "mean_token_accuracy": 0.23377913981676102, "num_tokens": 104629641.0, "step": 46870 }, { "entropy": 5.298944711685181, "epoch": 5.264502723648004, "grad_norm": 1.078125, "learning_rate": 0.00026008365418242284, "loss": 4.7848, "mean_token_accuracy": 0.23894418478012086, "num_tokens": 104640303.0, "step": 46875 }, { "entropy": 5.307670927047729, "epoch": 5.265064300555961, "grad_norm": 1.109375, "learning_rate": 0.0002600435940252476, "loss": 4.7557, "mean_token_accuracy": 0.23939779549837112, "num_tokens": 104650761.0, "step": 46880 }, { "entropy": 5.236644697189331, "epoch": 5.265625877463918, "grad_norm": 1.046875, "learning_rate": 0.0002600035343442902, "loss": 4.6671, "mean_token_accuracy": 0.2504496738314629, "num_tokens": 104662159.0, "step": 46885 }, { "entropy": 5.297658109664917, "epoch": 5.2661874543718765, "grad_norm": 1.0078125, "learning_rate": 0.00025996347514082603, "loss": 4.7971, "mean_token_accuracy": 0.23789357095956803, "num_tokens": 104674209.0, "step": 46890 }, { "entropy": 5.300919008255005, "epoch": 5.266749031279834, "grad_norm": 0.9765625, "learning_rate": 0.00025992341641613065, "loss": 4.7925, "mean_token_accuracy": 0.24119152426719664, "num_tokens": 104685315.0, "step": 46895 }, { "entropy": 5.378247880935669, "epoch": 5.267310608187791, "grad_norm": 0.96484375, "learning_rate": 0.0002598833581714795, "loss": 4.8454, "mean_token_accuracy": 0.2383030742406845, "num_tokens": 104697220.0, "step": 46900 }, { "entropy": 5.388354539871216, "epoch": 5.267872185095749, "grad_norm": 1.1015625, "learning_rate": 0.00025984330040814817, "loss": 4.8702, "mean_token_accuracy": 0.23798543512821196, "num_tokens": 104709156.0, "step": 46905 }, { "entropy": 5.33437876701355, "epoch": 5.268433762003706, "grad_norm": 0.99609375, "learning_rate": 0.0002598032431274119, "loss": 4.805, "mean_token_accuracy": 0.23972556740045547, "num_tokens": 104721160.0, "step": 46910 }, { "entropy": 5.289506530761718, "epoch": 5.2689953389116635, "grad_norm": 1.046875, "learning_rate": 0.00025976318633054636, "loss": 4.7914, "mean_token_accuracy": 0.2364952802658081, "num_tokens": 104732263.0, "step": 46915 }, { "entropy": 5.39394736289978, "epoch": 5.269556915819622, "grad_norm": 0.96875, "learning_rate": 0.0002597231300188269, "loss": 4.8597, "mean_token_accuracy": 0.22910289019346236, "num_tokens": 104743756.0, "step": 46920 }, { "entropy": 5.3395710468292235, "epoch": 5.270118492727579, "grad_norm": 0.98046875, "learning_rate": 0.00025968307419352884, "loss": 4.8609, "mean_token_accuracy": 0.2330589085817337, "num_tokens": 104754272.0, "step": 46925 }, { "entropy": 5.382916641235352, "epoch": 5.270680069635537, "grad_norm": 1.03125, "learning_rate": 0.00025964301885592766, "loss": 4.9498, "mean_token_accuracy": 0.2290986582636833, "num_tokens": 104766366.0, "step": 46930 }, { "entropy": 5.37900743484497, "epoch": 5.271241646543494, "grad_norm": 1.0390625, "learning_rate": 0.0002596029640072988, "loss": 4.9428, "mean_token_accuracy": 0.22935412228107452, "num_tokens": 104778158.0, "step": 46935 }, { "entropy": 5.350668239593506, "epoch": 5.271803223451451, "grad_norm": 1.0078125, "learning_rate": 0.0002595629096489174, "loss": 4.8384, "mean_token_accuracy": 0.2398675262928009, "num_tokens": 104789759.0, "step": 46940 }, { "entropy": 5.3045759201049805, "epoch": 5.2723648003594095, "grad_norm": 1.0703125, "learning_rate": 0.000259522855782059, "loss": 4.6971, "mean_token_accuracy": 0.25003596395254135, "num_tokens": 104800597.0, "step": 46945 }, { "entropy": 5.2118244647979735, "epoch": 5.272926377267367, "grad_norm": 1.0, "learning_rate": 0.0002594828024079989, "loss": 4.7441, "mean_token_accuracy": 0.24213664680719377, "num_tokens": 104810833.0, "step": 46950 }, { "entropy": 5.299561166763306, "epoch": 5.273487954175324, "grad_norm": 1.078125, "learning_rate": 0.00025944274952801233, "loss": 4.7886, "mean_token_accuracy": 0.2428634449839592, "num_tokens": 104822015.0, "step": 46955 }, { "entropy": 5.388574838638306, "epoch": 5.274049531083282, "grad_norm": 1.1328125, "learning_rate": 0.0002594026971433747, "loss": 4.8582, "mean_token_accuracy": 0.22842651158571242, "num_tokens": 104832462.0, "step": 46960 }, { "entropy": 5.404599046707153, "epoch": 5.274611107991239, "grad_norm": 0.9765625, "learning_rate": 0.00025936264525536126, "loss": 4.8337, "mean_token_accuracy": 0.22951748073101044, "num_tokens": 104844386.0, "step": 46965 }, { "entropy": 5.374642276763916, "epoch": 5.275172684899197, "grad_norm": 0.98046875, "learning_rate": 0.0002593225938652472, "loss": 4.8546, "mean_token_accuracy": 0.228460593521595, "num_tokens": 104855569.0, "step": 46970 }, { "entropy": 5.3350084781646725, "epoch": 5.2757342618071545, "grad_norm": 1.046875, "learning_rate": 0.0002592825429743079, "loss": 4.8374, "mean_token_accuracy": 0.23182704746723176, "num_tokens": 104866721.0, "step": 46975 }, { "entropy": 5.251456308364868, "epoch": 5.276295838715112, "grad_norm": 1.1171875, "learning_rate": 0.0002592424925838185, "loss": 4.7504, "mean_token_accuracy": 0.237536258995533, "num_tokens": 104877449.0, "step": 46980 }, { "entropy": 5.292297840118408, "epoch": 5.27685741562307, "grad_norm": 0.9375, "learning_rate": 0.0002592024426950541, "loss": 4.7773, "mean_token_accuracy": 0.23880802392959594, "num_tokens": 104889050.0, "step": 46985 }, { "entropy": 5.340652132034302, "epoch": 5.277418992531027, "grad_norm": 0.98828125, "learning_rate": 0.00025916239330929026, "loss": 4.8431, "mean_token_accuracy": 0.23764988780021667, "num_tokens": 104900231.0, "step": 46990 }, { "entropy": 5.434039735794068, "epoch": 5.277980569438984, "grad_norm": 0.95703125, "learning_rate": 0.00025912234442780185, "loss": 4.9635, "mean_token_accuracy": 0.2242128074169159, "num_tokens": 104912886.0, "step": 46995 }, { "entropy": 5.418157291412354, "epoch": 5.278542146346942, "grad_norm": 1.0078125, "learning_rate": 0.00025908229605186423, "loss": 4.8738, "mean_token_accuracy": 0.23258846551179885, "num_tokens": 104924177.0, "step": 47000 }, { "entropy": 5.4069623947143555, "epoch": 5.2791037232549, "grad_norm": 1.0625, "learning_rate": 0.00025904224818275247, "loss": 4.8791, "mean_token_accuracy": 0.23878918588161469, "num_tokens": 104934503.0, "step": 47005 }, { "entropy": 5.3969005107879635, "epoch": 5.279665300162858, "grad_norm": 1.0234375, "learning_rate": 0.00025900220082174165, "loss": 4.87, "mean_token_accuracy": 0.2260451063513756, "num_tokens": 104945643.0, "step": 47010 }, { "entropy": 5.315466213226318, "epoch": 5.280226877070815, "grad_norm": 0.9609375, "learning_rate": 0.00025896215397010696, "loss": 4.802, "mean_token_accuracy": 0.22714556455612184, "num_tokens": 104957289.0, "step": 47015 }, { "entropy": 5.345183324813843, "epoch": 5.280788453978772, "grad_norm": 1.0625, "learning_rate": 0.0002589221076291236, "loss": 4.8468, "mean_token_accuracy": 0.2266632243990898, "num_tokens": 104967848.0, "step": 47020 }, { "entropy": 5.293126964569092, "epoch": 5.28135003088673, "grad_norm": 1.0078125, "learning_rate": 0.00025888206180006647, "loss": 4.7529, "mean_token_accuracy": 0.23837372213602065, "num_tokens": 104979036.0, "step": 47025 }, { "entropy": 5.330266904830933, "epoch": 5.2819116077946875, "grad_norm": 1.0, "learning_rate": 0.0002588420164842108, "loss": 4.7822, "mean_token_accuracy": 0.23795006722211837, "num_tokens": 104990399.0, "step": 47030 }, { "entropy": 5.344455337524414, "epoch": 5.282473184702645, "grad_norm": 1.1328125, "learning_rate": 0.0002588019716828316, "loss": 4.8346, "mean_token_accuracy": 0.24932210445404052, "num_tokens": 105001515.0, "step": 47035 }, { "entropy": 5.352672863006592, "epoch": 5.283034761610603, "grad_norm": 1.1015625, "learning_rate": 0.00025876192739720383, "loss": 4.8579, "mean_token_accuracy": 0.2314743235707283, "num_tokens": 105012609.0, "step": 47040 }, { "entropy": 5.413086318969727, "epoch": 5.28359633851856, "grad_norm": 0.99609375, "learning_rate": 0.00025872188362860264, "loss": 4.8329, "mean_token_accuracy": 0.23158431351184844, "num_tokens": 105022120.0, "step": 47045 }, { "entropy": 5.343380641937256, "epoch": 5.284157915426517, "grad_norm": 1.03125, "learning_rate": 0.00025868184037830305, "loss": 4.8282, "mean_token_accuracy": 0.23083868473768235, "num_tokens": 105033121.0, "step": 47050 }, { "entropy": 5.420180368423462, "epoch": 5.284719492334475, "grad_norm": 1.109375, "learning_rate": 0.0002586417976475798, "loss": 4.7946, "mean_token_accuracy": 0.24607355296611785, "num_tokens": 105043279.0, "step": 47055 }, { "entropy": 5.254603338241577, "epoch": 5.285281069242433, "grad_norm": 1.1015625, "learning_rate": 0.00025860175543770817, "loss": 4.7479, "mean_token_accuracy": 0.24171694815158845, "num_tokens": 105055252.0, "step": 47060 }, { "entropy": 5.347330522537232, "epoch": 5.285842646150391, "grad_norm": 0.921875, "learning_rate": 0.0002585617137499631, "loss": 4.8763, "mean_token_accuracy": 0.22596484571695327, "num_tokens": 105067292.0, "step": 47065 }, { "entropy": 5.4201775074005125, "epoch": 5.286404223058348, "grad_norm": 0.98828125, "learning_rate": 0.0002585216725856193, "loss": 4.8712, "mean_token_accuracy": 0.24164705127477645, "num_tokens": 105078125.0, "step": 47070 }, { "entropy": 5.374434614181519, "epoch": 5.286965799966305, "grad_norm": 1.03125, "learning_rate": 0.0002584816319459519, "loss": 4.8611, "mean_token_accuracy": 0.23317748457193374, "num_tokens": 105090398.0, "step": 47075 }, { "entropy": 5.348397541046142, "epoch": 5.287527376874263, "grad_norm": 0.9609375, "learning_rate": 0.0002584415918322358, "loss": 4.8413, "mean_token_accuracy": 0.23167410641908645, "num_tokens": 105102182.0, "step": 47080 }, { "entropy": 5.2998247146606445, "epoch": 5.28808895378222, "grad_norm": 1.1015625, "learning_rate": 0.0002584015522457458, "loss": 4.7106, "mean_token_accuracy": 0.2445102870464325, "num_tokens": 105112361.0, "step": 47085 }, { "entropy": 5.188279914855957, "epoch": 5.288650530690178, "grad_norm": 0.9921875, "learning_rate": 0.00025836151318775675, "loss": 4.6867, "mean_token_accuracy": 0.24998184591531752, "num_tokens": 105124479.0, "step": 47090 }, { "entropy": 5.293795251846314, "epoch": 5.289212107598136, "grad_norm": 1.171875, "learning_rate": 0.00025832147465954365, "loss": 4.8175, "mean_token_accuracy": 0.24056858718395233, "num_tokens": 105136387.0, "step": 47095 }, { "entropy": 5.3327188968658445, "epoch": 5.289773684506093, "grad_norm": 1.0, "learning_rate": 0.00025828143666238124, "loss": 4.8186, "mean_token_accuracy": 0.23633965402841567, "num_tokens": 105148768.0, "step": 47100 }, { "entropy": 5.329674196243286, "epoch": 5.29033526141405, "grad_norm": 0.9609375, "learning_rate": 0.00025824139919754436, "loss": 4.8328, "mean_token_accuracy": 0.23990897238254547, "num_tokens": 105161500.0, "step": 47105 }, { "entropy": 5.373843383789063, "epoch": 5.290896838322008, "grad_norm": 1.1171875, "learning_rate": 0.0002582013622663079, "loss": 4.8829, "mean_token_accuracy": 0.23526697903871535, "num_tokens": 105173258.0, "step": 47110 }, { "entropy": 5.405191564559937, "epoch": 5.2914584152299655, "grad_norm": 1.078125, "learning_rate": 0.0002581613258699465, "loss": 4.9056, "mean_token_accuracy": 0.23541885018348693, "num_tokens": 105184710.0, "step": 47115 }, { "entropy": 5.301182794570923, "epoch": 5.292019992137924, "grad_norm": 1.0703125, "learning_rate": 0.000258121290009735, "loss": 4.7752, "mean_token_accuracy": 0.23481546640396117, "num_tokens": 105194804.0, "step": 47120 }, { "entropy": 5.3456045627594, "epoch": 5.292581569045881, "grad_norm": 0.953125, "learning_rate": 0.0002580812546869481, "loss": 4.911, "mean_token_accuracy": 0.22760363221168517, "num_tokens": 105207074.0, "step": 47125 }, { "entropy": 5.380125284194946, "epoch": 5.293143145953838, "grad_norm": 0.953125, "learning_rate": 0.0002580412199028607, "loss": 4.8342, "mean_token_accuracy": 0.23449423611164094, "num_tokens": 105218007.0, "step": 47130 }, { "entropy": 5.277137994766235, "epoch": 5.293704722861796, "grad_norm": 1.0390625, "learning_rate": 0.00025800118565874754, "loss": 4.7542, "mean_token_accuracy": 0.2402175024151802, "num_tokens": 105229299.0, "step": 47135 }, { "entropy": 5.322787237167359, "epoch": 5.294266299769753, "grad_norm": 0.97265625, "learning_rate": 0.0002579611519558831, "loss": 4.8456, "mean_token_accuracy": 0.23408448249101638, "num_tokens": 105239482.0, "step": 47140 }, { "entropy": 5.373965549468994, "epoch": 5.294827876677711, "grad_norm": 0.98046875, "learning_rate": 0.00025792111879554224, "loss": 4.891, "mean_token_accuracy": 0.22844665944576265, "num_tokens": 105250185.0, "step": 47145 }, { "entropy": 5.272731828689575, "epoch": 5.295389453585669, "grad_norm": 0.94140625, "learning_rate": 0.0002578810861789996, "loss": 4.6777, "mean_token_accuracy": 0.2420856773853302, "num_tokens": 105262992.0, "step": 47150 }, { "entropy": 5.377058315277099, "epoch": 5.295951030493626, "grad_norm": 1.0546875, "learning_rate": 0.0002578410541075298, "loss": 4.9181, "mean_token_accuracy": 0.23352336287498474, "num_tokens": 105274265.0, "step": 47155 }, { "entropy": 5.252666473388672, "epoch": 5.296512607401584, "grad_norm": 0.9921875, "learning_rate": 0.00025780102258240745, "loss": 4.8366, "mean_token_accuracy": 0.23724357336759566, "num_tokens": 105285517.0, "step": 47160 }, { "entropy": 5.42457799911499, "epoch": 5.297074184309541, "grad_norm": 1.1015625, "learning_rate": 0.0002577609916049072, "loss": 4.8442, "mean_token_accuracy": 0.22679315656423568, "num_tokens": 105296052.0, "step": 47165 }, { "entropy": 5.413437175750732, "epoch": 5.2976357612174985, "grad_norm": 1.0234375, "learning_rate": 0.0002577209611763037, "loss": 4.8708, "mean_token_accuracy": 0.23428469002246857, "num_tokens": 105307728.0, "step": 47170 }, { "entropy": 5.381452226638794, "epoch": 5.298197338125457, "grad_norm": 1.109375, "learning_rate": 0.0002576809312978715, "loss": 4.8732, "mean_token_accuracy": 0.22874194532632827, "num_tokens": 105319750.0, "step": 47175 }, { "entropy": 5.368034982681275, "epoch": 5.298758915033414, "grad_norm": 1.0703125, "learning_rate": 0.0002576409019708852, "loss": 4.8127, "mean_token_accuracy": 0.23716093003749847, "num_tokens": 105330457.0, "step": 47180 }, { "entropy": 5.290163850784301, "epoch": 5.299320491941371, "grad_norm": 1.0625, "learning_rate": 0.0002576008731966193, "loss": 4.7443, "mean_token_accuracy": 0.2459518164396286, "num_tokens": 105341265.0, "step": 47185 }, { "entropy": 5.372845792770386, "epoch": 5.299882068849329, "grad_norm": 1.0234375, "learning_rate": 0.00025756084497634827, "loss": 4.9863, "mean_token_accuracy": 0.23329026401042938, "num_tokens": 105352353.0, "step": 47190 }, { "entropy": 5.360569477081299, "epoch": 5.300443645757286, "grad_norm": 1.0390625, "learning_rate": 0.0002575208173113468, "loss": 4.814, "mean_token_accuracy": 0.2354424849152565, "num_tokens": 105363785.0, "step": 47195 }, { "entropy": 5.325840950012207, "epoch": 5.301005222665244, "grad_norm": 1.0546875, "learning_rate": 0.0002574807902028891, "loss": 4.7756, "mean_token_accuracy": 0.23452985882759095, "num_tokens": 105374185.0, "step": 47200 }, { "entropy": 5.281309938430786, "epoch": 5.301566799573202, "grad_norm": 0.984375, "learning_rate": 0.00025744076365225, "loss": 4.7842, "mean_token_accuracy": 0.24457790851593017, "num_tokens": 105385698.0, "step": 47205 }, { "entropy": 5.220132160186767, "epoch": 5.302128376481159, "grad_norm": 0.953125, "learning_rate": 0.00025740073766070376, "loss": 4.7635, "mean_token_accuracy": 0.23649675846099855, "num_tokens": 105396630.0, "step": 47210 }, { "entropy": 5.29799861907959, "epoch": 5.302689953389117, "grad_norm": 0.95703125, "learning_rate": 0.0002573607122295249, "loss": 4.7485, "mean_token_accuracy": 0.24004548639059067, "num_tokens": 105408728.0, "step": 47215 }, { "entropy": 5.315957021713257, "epoch": 5.303251530297074, "grad_norm": 1.15625, "learning_rate": 0.0002573206873599878, "loss": 4.7802, "mean_token_accuracy": 0.24149588495492935, "num_tokens": 105418545.0, "step": 47220 }, { "entropy": 5.348516035079956, "epoch": 5.303813107205031, "grad_norm": 1.0078125, "learning_rate": 0.00025728066305336685, "loss": 4.8706, "mean_token_accuracy": 0.229243466258049, "num_tokens": 105429748.0, "step": 47225 }, { "entropy": 5.275116491317749, "epoch": 5.3043746841129895, "grad_norm": 1.0390625, "learning_rate": 0.0002572406393109364, "loss": 4.7572, "mean_token_accuracy": 0.23763249218463897, "num_tokens": 105441298.0, "step": 47230 }, { "entropy": 5.377463293075562, "epoch": 5.304936261020947, "grad_norm": 0.98828125, "learning_rate": 0.0002572006161339709, "loss": 4.8277, "mean_token_accuracy": 0.2384906753897667, "num_tokens": 105452511.0, "step": 47235 }, { "entropy": 5.328317594528198, "epoch": 5.305497837928904, "grad_norm": 1.015625, "learning_rate": 0.0002571605935237448, "loss": 4.7579, "mean_token_accuracy": 0.24559869319200517, "num_tokens": 105464476.0, "step": 47240 }, { "entropy": 5.324857759475708, "epoch": 5.306059414836862, "grad_norm": 0.97265625, "learning_rate": 0.0002571205714815322, "loss": 4.8834, "mean_token_accuracy": 0.23934174031019212, "num_tokens": 105475761.0, "step": 47245 }, { "entropy": 5.325757312774658, "epoch": 5.306620991744819, "grad_norm": 0.953125, "learning_rate": 0.0002570805500086076, "loss": 4.8275, "mean_token_accuracy": 0.22887710481882095, "num_tokens": 105488162.0, "step": 47250 }, { "entropy": 5.318894481658935, "epoch": 5.307182568652777, "grad_norm": 1.03125, "learning_rate": 0.0002570405291062452, "loss": 4.7664, "mean_token_accuracy": 0.23660466820001602, "num_tokens": 105498879.0, "step": 47255 }, { "entropy": 5.388209629058838, "epoch": 5.307744145560735, "grad_norm": 1.0390625, "learning_rate": 0.0002570005087757193, "loss": 4.83, "mean_token_accuracy": 0.23380740135908126, "num_tokens": 105509052.0, "step": 47260 }, { "entropy": 5.359475755691529, "epoch": 5.308305722468692, "grad_norm": 1.078125, "learning_rate": 0.0002569604890183043, "loss": 4.8615, "mean_token_accuracy": 0.23172544836997985, "num_tokens": 105520970.0, "step": 47265 }, { "entropy": 5.308510208129883, "epoch": 5.30886729937665, "grad_norm": 1.0078125, "learning_rate": 0.0002569204698352741, "loss": 4.7786, "mean_token_accuracy": 0.24239733070135117, "num_tokens": 105532172.0, "step": 47270 }, { "entropy": 5.278017997741699, "epoch": 5.309428876284607, "grad_norm": 0.99609375, "learning_rate": 0.0002568804512279033, "loss": 4.7659, "mean_token_accuracy": 0.24613500237464905, "num_tokens": 105542849.0, "step": 47275 }, { "entropy": 5.316369724273682, "epoch": 5.309990453192564, "grad_norm": 0.99609375, "learning_rate": 0.00025684043319746595, "loss": 4.8001, "mean_token_accuracy": 0.23683156669139863, "num_tokens": 105553488.0, "step": 47280 }, { "entropy": 5.259151983261108, "epoch": 5.3105520301005225, "grad_norm": 1.0625, "learning_rate": 0.00025680041574523626, "loss": 4.7436, "mean_token_accuracy": 0.2340954691171646, "num_tokens": 105563900.0, "step": 47285 }, { "entropy": 5.270215034484863, "epoch": 5.31111360700848, "grad_norm": 0.98828125, "learning_rate": 0.0002567603988724884, "loss": 4.7269, "mean_token_accuracy": 0.24443728774785994, "num_tokens": 105575192.0, "step": 47290 }, { "entropy": 5.332947731018066, "epoch": 5.311675183916437, "grad_norm": 0.93359375, "learning_rate": 0.0002567203825804966, "loss": 4.8048, "mean_token_accuracy": 0.2414331093430519, "num_tokens": 105586614.0, "step": 47295 }, { "entropy": 5.360145473480225, "epoch": 5.312236760824395, "grad_norm": 1.078125, "learning_rate": 0.0002566803668705347, "loss": 4.8065, "mean_token_accuracy": 0.23989985287189483, "num_tokens": 105597728.0, "step": 47300 }, { "entropy": 5.345130252838135, "epoch": 5.312798337732352, "grad_norm": 1.0859375, "learning_rate": 0.0002566403517438772, "loss": 4.9107, "mean_token_accuracy": 0.229011732339859, "num_tokens": 105608694.0, "step": 47305 }, { "entropy": 5.316271114349365, "epoch": 5.31335991464031, "grad_norm": 1.03125, "learning_rate": 0.00025660033720179795, "loss": 4.7674, "mean_token_accuracy": 0.24549946039915085, "num_tokens": 105620337.0, "step": 47310 }, { "entropy": 5.307069492340088, "epoch": 5.3139214915482675, "grad_norm": 1.0234375, "learning_rate": 0.00025656032324557107, "loss": 4.7472, "mean_token_accuracy": 0.24895475953817367, "num_tokens": 105630463.0, "step": 47315 }, { "entropy": 5.368904685974121, "epoch": 5.314483068456225, "grad_norm": 1.1171875, "learning_rate": 0.00025652030987647066, "loss": 4.9375, "mean_token_accuracy": 0.23399686217308044, "num_tokens": 105642236.0, "step": 47320 }, { "entropy": 5.337502098083496, "epoch": 5.315044645364183, "grad_norm": 1.09375, "learning_rate": 0.0002564802970957708, "loss": 4.8205, "mean_token_accuracy": 0.23608140498399735, "num_tokens": 105652513.0, "step": 47325 }, { "entropy": 5.326572465896606, "epoch": 5.31560622227214, "grad_norm": 1.0703125, "learning_rate": 0.00025644028490474544, "loss": 4.7884, "mean_token_accuracy": 0.24545741230249404, "num_tokens": 105665532.0, "step": 47330 }, { "entropy": 5.348112392425537, "epoch": 5.316167799180098, "grad_norm": 1.0234375, "learning_rate": 0.00025640027330466866, "loss": 4.8205, "mean_token_accuracy": 0.23306269496679305, "num_tokens": 105677826.0, "step": 47335 }, { "entropy": 5.282850027084351, "epoch": 5.316729376088055, "grad_norm": 0.984375, "learning_rate": 0.00025636026229681433, "loss": 4.7935, "mean_token_accuracy": 0.2322593629360199, "num_tokens": 105689428.0, "step": 47340 }, { "entropy": 5.323724174499512, "epoch": 5.317290952996013, "grad_norm": 0.9296875, "learning_rate": 0.0002563202518824564, "loss": 4.7607, "mean_token_accuracy": 0.24096730798482896, "num_tokens": 105701423.0, "step": 47345 }, { "entropy": 5.250507354736328, "epoch": 5.317852529903971, "grad_norm": 0.99609375, "learning_rate": 0.000256280242062869, "loss": 4.7599, "mean_token_accuracy": 0.2316095232963562, "num_tokens": 105712985.0, "step": 47350 }, { "entropy": 5.331543493270874, "epoch": 5.318414106811928, "grad_norm": 0.984375, "learning_rate": 0.0002562402328393259, "loss": 4.8675, "mean_token_accuracy": 0.22923032194375992, "num_tokens": 105724283.0, "step": 47355 }, { "entropy": 5.3581830024719235, "epoch": 5.318975683719885, "grad_norm": 0.9609375, "learning_rate": 0.00025620022421310115, "loss": 4.9511, "mean_token_accuracy": 0.2237453803420067, "num_tokens": 105735250.0, "step": 47360 }, { "entropy": 5.396858167648316, "epoch": 5.319537260627843, "grad_norm": 1.1015625, "learning_rate": 0.00025616021618546847, "loss": 4.8303, "mean_token_accuracy": 0.23583883196115493, "num_tokens": 105747093.0, "step": 47365 }, { "entropy": 5.375815296173096, "epoch": 5.3200988375358005, "grad_norm": 1.015625, "learning_rate": 0.00025612020875770186, "loss": 4.856, "mean_token_accuracy": 0.23857094943523408, "num_tokens": 105757906.0, "step": 47370 }, { "entropy": 5.307946443557739, "epoch": 5.320660414443758, "grad_norm": 1.078125, "learning_rate": 0.0002560802019310751, "loss": 4.7593, "mean_token_accuracy": 0.24705451875925064, "num_tokens": 105768618.0, "step": 47375 }, { "entropy": 5.263268661499024, "epoch": 5.321221991351716, "grad_norm": 1.125, "learning_rate": 0.00025604019570686203, "loss": 4.759, "mean_token_accuracy": 0.24161226600408553, "num_tokens": 105779201.0, "step": 47380 }, { "entropy": 5.355069160461426, "epoch": 5.321783568259673, "grad_norm": 1.0703125, "learning_rate": 0.0002560001900863365, "loss": 4.7995, "mean_token_accuracy": 0.24010185450315474, "num_tokens": 105789796.0, "step": 47385 }, { "entropy": 5.36286883354187, "epoch": 5.322345145167631, "grad_norm": 0.99609375, "learning_rate": 0.0002559601850707723, "loss": 4.8569, "mean_token_accuracy": 0.2379504844546318, "num_tokens": 105801576.0, "step": 47390 }, { "entropy": 5.320552635192871, "epoch": 5.322906722075588, "grad_norm": 0.9609375, "learning_rate": 0.0002559201806614432, "loss": 4.7908, "mean_token_accuracy": 0.23955017179250718, "num_tokens": 105812836.0, "step": 47395 }, { "entropy": 5.491349220275879, "epoch": 5.323468298983546, "grad_norm": 1.1171875, "learning_rate": 0.00025588017685962297, "loss": 4.9896, "mean_token_accuracy": 0.23090129792690278, "num_tokens": 105824408.0, "step": 47400 }, { "entropy": 5.2657098293304445, "epoch": 5.324029875891504, "grad_norm": 1.0390625, "learning_rate": 0.00025584017366658525, "loss": 4.7211, "mean_token_accuracy": 0.24716109037399292, "num_tokens": 105834640.0, "step": 47405 }, { "entropy": 5.292738628387451, "epoch": 5.324591452799461, "grad_norm": 1.0625, "learning_rate": 0.00025580017108360386, "loss": 4.7759, "mean_token_accuracy": 0.2348622277379036, "num_tokens": 105845941.0, "step": 47410 }, { "entropy": 5.321476125717163, "epoch": 5.325153029707418, "grad_norm": 1.0703125, "learning_rate": 0.0002557601691119524, "loss": 4.8751, "mean_token_accuracy": 0.22688245475292207, "num_tokens": 105857025.0, "step": 47415 }, { "entropy": 5.338246488571167, "epoch": 5.325714606615376, "grad_norm": 0.99609375, "learning_rate": 0.00025572016775290475, "loss": 4.8577, "mean_token_accuracy": 0.23243886083364487, "num_tokens": 105867501.0, "step": 47420 }, { "entropy": 5.2853399276733395, "epoch": 5.326276183523333, "grad_norm": 1.03125, "learning_rate": 0.00025568016700773435, "loss": 4.7602, "mean_token_accuracy": 0.23947880566120147, "num_tokens": 105878153.0, "step": 47425 }, { "entropy": 5.30452790260315, "epoch": 5.326837760431291, "grad_norm": 1.046875, "learning_rate": 0.00025564016687771495, "loss": 4.7131, "mean_token_accuracy": 0.24361384212970733, "num_tokens": 105888770.0, "step": 47430 }, { "entropy": 5.265668106079102, "epoch": 5.327399337339249, "grad_norm": 0.99609375, "learning_rate": 0.00025560016736412015, "loss": 4.7354, "mean_token_accuracy": 0.24482796490192413, "num_tokens": 105899773.0, "step": 47435 }, { "entropy": 5.296401309967041, "epoch": 5.327960914247206, "grad_norm": 1.0390625, "learning_rate": 0.00025556016846822353, "loss": 4.8334, "mean_token_accuracy": 0.2437345027923584, "num_tokens": 105912608.0, "step": 47440 }, { "entropy": 5.328469848632812, "epoch": 5.328522491155164, "grad_norm": 1.078125, "learning_rate": 0.00025552017019129874, "loss": 4.7935, "mean_token_accuracy": 0.2379808619618416, "num_tokens": 105922781.0, "step": 47445 }, { "entropy": 5.321211910247802, "epoch": 5.329084068063121, "grad_norm": 1.0625, "learning_rate": 0.00025548017253461923, "loss": 4.7794, "mean_token_accuracy": 0.23879847675561905, "num_tokens": 105934641.0, "step": 47450 }, { "entropy": 5.35409631729126, "epoch": 5.3296456449710785, "grad_norm": 0.96484375, "learning_rate": 0.0002554401754994586, "loss": 4.8761, "mean_token_accuracy": 0.23282630443573, "num_tokens": 105946722.0, "step": 47455 }, { "entropy": 5.311547946929932, "epoch": 5.330207221879037, "grad_norm": 1.078125, "learning_rate": 0.0002554001790870904, "loss": 4.7977, "mean_token_accuracy": 0.23901815563440323, "num_tokens": 105957361.0, "step": 47460 }, { "entropy": 5.306861352920532, "epoch": 5.330768798786994, "grad_norm": 1.1171875, "learning_rate": 0.00025536018329878814, "loss": 4.7695, "mean_token_accuracy": 0.23651579320430755, "num_tokens": 105968314.0, "step": 47465 }, { "entropy": 5.32871527671814, "epoch": 5.331330375694951, "grad_norm": 1.109375, "learning_rate": 0.0002553201881358252, "loss": 4.838, "mean_token_accuracy": 0.23680963963270188, "num_tokens": 105979324.0, "step": 47470 }, { "entropy": 5.335201454162598, "epoch": 5.331891952602909, "grad_norm": 1.0390625, "learning_rate": 0.00025528019359947514, "loss": 4.7926, "mean_token_accuracy": 0.23940346240997315, "num_tokens": 105989998.0, "step": 47475 }, { "entropy": 5.327815246582031, "epoch": 5.332453529510866, "grad_norm": 1.03125, "learning_rate": 0.0002552401996910113, "loss": 4.8271, "mean_token_accuracy": 0.2347569152712822, "num_tokens": 106000389.0, "step": 47480 }, { "entropy": 5.368082475662232, "epoch": 5.333015106418824, "grad_norm": 1.0859375, "learning_rate": 0.0002552002064117072, "loss": 4.8703, "mean_token_accuracy": 0.2318431705236435, "num_tokens": 106010425.0, "step": 47485 }, { "entropy": 5.365311861038208, "epoch": 5.333576683326782, "grad_norm": 1.109375, "learning_rate": 0.0002551602137628361, "loss": 4.8459, "mean_token_accuracy": 0.2352878451347351, "num_tokens": 106022354.0, "step": 47490 }, { "entropy": 5.365330839157105, "epoch": 5.334138260234739, "grad_norm": 1.0390625, "learning_rate": 0.00025512022174567164, "loss": 4.8204, "mean_token_accuracy": 0.23885389119386674, "num_tokens": 106033651.0, "step": 47495 }, { "entropy": 5.261027050018311, "epoch": 5.334699837142697, "grad_norm": 0.90234375, "learning_rate": 0.00025508023036148697, "loss": 4.7774, "mean_token_accuracy": 0.23703691661357879, "num_tokens": 106046049.0, "step": 47500 }, { "entropy": 5.277173376083374, "epoch": 5.335261414050654, "grad_norm": 1.0625, "learning_rate": 0.00025504023961155553, "loss": 4.7857, "mean_token_accuracy": 0.23693223744630815, "num_tokens": 106058196.0, "step": 47505 }, { "entropy": 5.312263774871826, "epoch": 5.3358229909586115, "grad_norm": 1.0859375, "learning_rate": 0.00025500024949715055, "loss": 4.7877, "mean_token_accuracy": 0.23667695224285126, "num_tokens": 106069553.0, "step": 47510 }, { "entropy": 5.358439588546753, "epoch": 5.33638456786657, "grad_norm": 1.0703125, "learning_rate": 0.00025496026001954543, "loss": 4.8013, "mean_token_accuracy": 0.2366901382803917, "num_tokens": 106080875.0, "step": 47515 }, { "entropy": 5.35123643875122, "epoch": 5.336946144774527, "grad_norm": 1.1875, "learning_rate": 0.00025492027118001345, "loss": 4.8664, "mean_token_accuracy": 0.23522239774465561, "num_tokens": 106093019.0, "step": 47520 }, { "entropy": 5.321600008010864, "epoch": 5.337507721682485, "grad_norm": 1.09375, "learning_rate": 0.0002548802829798277, "loss": 4.8008, "mean_token_accuracy": 0.2392100304365158, "num_tokens": 106103572.0, "step": 47525 }, { "entropy": 5.2121936798095705, "epoch": 5.338069298590442, "grad_norm": 1.015625, "learning_rate": 0.0002548402954202616, "loss": 4.6773, "mean_token_accuracy": 0.2440485268831253, "num_tokens": 106114633.0, "step": 47530 }, { "entropy": 5.288544416427612, "epoch": 5.338630875498399, "grad_norm": 1.0546875, "learning_rate": 0.0002548003085025883, "loss": 4.8374, "mean_token_accuracy": 0.23799049705266953, "num_tokens": 106126706.0, "step": 47535 }, { "entropy": 5.305491304397583, "epoch": 5.339192452406357, "grad_norm": 1.0859375, "learning_rate": 0.00025476032222808106, "loss": 4.8026, "mean_token_accuracy": 0.23320225030183792, "num_tokens": 106137180.0, "step": 47540 }, { "entropy": 5.274767160415649, "epoch": 5.339754029314315, "grad_norm": 0.984375, "learning_rate": 0.00025472033659801297, "loss": 4.7545, "mean_token_accuracy": 0.24392879903316497, "num_tokens": 106148453.0, "step": 47545 }, { "entropy": 5.351220273971558, "epoch": 5.340315606222272, "grad_norm": 1.0703125, "learning_rate": 0.0002546803516136572, "loss": 4.9404, "mean_token_accuracy": 0.22069526016712188, "num_tokens": 106160262.0, "step": 47550 }, { "entropy": 5.320271778106689, "epoch": 5.34087718313023, "grad_norm": 1.03125, "learning_rate": 0.00025464036727628695, "loss": 4.7679, "mean_token_accuracy": 0.23819841593503951, "num_tokens": 106170699.0, "step": 47555 }, { "entropy": 5.431132221221924, "epoch": 5.341438760038187, "grad_norm": 1.0703125, "learning_rate": 0.00025460038358717527, "loss": 4.8729, "mean_token_accuracy": 0.23044902384281157, "num_tokens": 106181311.0, "step": 47560 }, { "entropy": 5.308819389343261, "epoch": 5.342000336946144, "grad_norm": 0.96875, "learning_rate": 0.0002545604005475953, "loss": 4.8012, "mean_token_accuracy": 0.24007968306541444, "num_tokens": 106192651.0, "step": 47565 }, { "entropy": 5.319751310348511, "epoch": 5.3425619138541025, "grad_norm": 1.09375, "learning_rate": 0.0002545204181588201, "loss": 4.825, "mean_token_accuracy": 0.24208389222621918, "num_tokens": 106203223.0, "step": 47570 }, { "entropy": 5.361058616638184, "epoch": 5.34312349076206, "grad_norm": 0.9765625, "learning_rate": 0.00025448043642212274, "loss": 4.8619, "mean_token_accuracy": 0.23403851091861724, "num_tokens": 106215403.0, "step": 47575 }, { "entropy": 5.366579294204712, "epoch": 5.343685067670018, "grad_norm": 1.1875, "learning_rate": 0.0002544404553387763, "loss": 4.8605, "mean_token_accuracy": 0.22996347397565842, "num_tokens": 106226728.0, "step": 47580 }, { "entropy": 5.4105757713317875, "epoch": 5.344246644577975, "grad_norm": 1.078125, "learning_rate": 0.00025440047491005367, "loss": 4.8307, "mean_token_accuracy": 0.2357742816209793, "num_tokens": 106238331.0, "step": 47585 }, { "entropy": 5.2663733959198, "epoch": 5.344808221485932, "grad_norm": 1.0546875, "learning_rate": 0.00025436049513722795, "loss": 4.7073, "mean_token_accuracy": 0.24326658993959427, "num_tokens": 106250095.0, "step": 47590 }, { "entropy": 5.271083879470825, "epoch": 5.34536979839389, "grad_norm": 1.03125, "learning_rate": 0.00025432051602157203, "loss": 4.7289, "mean_token_accuracy": 0.24909279495477676, "num_tokens": 106260318.0, "step": 47595 }, { "entropy": 5.255571365356445, "epoch": 5.345931375301848, "grad_norm": 1.0703125, "learning_rate": 0.0002542805375643589, "loss": 4.7854, "mean_token_accuracy": 0.23965156078338623, "num_tokens": 106271110.0, "step": 47600 }, { "entropy": 5.448188447952271, "epoch": 5.346492952209805, "grad_norm": 1.0625, "learning_rate": 0.0002542405597668615, "loss": 4.8917, "mean_token_accuracy": 0.23102816045284272, "num_tokens": 106283052.0, "step": 47605 }, { "entropy": 5.3275505065917965, "epoch": 5.347054529117763, "grad_norm": 1.0625, "learning_rate": 0.00025420058263035276, "loss": 4.8081, "mean_token_accuracy": 0.23917210400104522, "num_tokens": 106293641.0, "step": 47610 }, { "entropy": 5.255698013305664, "epoch": 5.34761610602572, "grad_norm": 0.984375, "learning_rate": 0.0002541606061561055, "loss": 4.8047, "mean_token_accuracy": 0.23552166521549225, "num_tokens": 106305230.0, "step": 47615 }, { "entropy": 5.347999048233032, "epoch": 5.348177682933677, "grad_norm": 1.0703125, "learning_rate": 0.0002541206303453927, "loss": 4.8982, "mean_token_accuracy": 0.23400607109069824, "num_tokens": 106316700.0, "step": 47620 }, { "entropy": 5.3459385395050045, "epoch": 5.3487392598416355, "grad_norm": 1.0234375, "learning_rate": 0.000254080655199487, "loss": 4.8339, "mean_token_accuracy": 0.23970895260572433, "num_tokens": 106327318.0, "step": 47625 }, { "entropy": 5.407559156417847, "epoch": 5.349300836749593, "grad_norm": 1.015625, "learning_rate": 0.00025404068071966133, "loss": 4.8287, "mean_token_accuracy": 0.24170265793800355, "num_tokens": 106338134.0, "step": 47630 }, { "entropy": 5.323448562622071, "epoch": 5.349862413657551, "grad_norm": 1.046875, "learning_rate": 0.00025400070690718865, "loss": 4.8542, "mean_token_accuracy": 0.2305162012577057, "num_tokens": 106348903.0, "step": 47635 }, { "entropy": 5.38914532661438, "epoch": 5.350423990565508, "grad_norm": 0.984375, "learning_rate": 0.00025396073376334155, "loss": 4.8705, "mean_token_accuracy": 0.23939420580863952, "num_tokens": 106360124.0, "step": 47640 }, { "entropy": 5.356241893768311, "epoch": 5.350985567473465, "grad_norm": 1.1171875, "learning_rate": 0.00025392076128939283, "loss": 4.7838, "mean_token_accuracy": 0.23941846340894699, "num_tokens": 106371663.0, "step": 47645 }, { "entropy": 5.318000984191895, "epoch": 5.351547144381423, "grad_norm": 0.96875, "learning_rate": 0.0002538807894866153, "loss": 4.8636, "mean_token_accuracy": 0.23861986696720122, "num_tokens": 106384337.0, "step": 47650 }, { "entropy": 5.3211921691894535, "epoch": 5.3521087212893805, "grad_norm": 1.046875, "learning_rate": 0.00025384081835628163, "loss": 4.8457, "mean_token_accuracy": 0.2401798963546753, "num_tokens": 106395393.0, "step": 47655 }, { "entropy": 5.297837543487549, "epoch": 5.352670298197338, "grad_norm": 1.03125, "learning_rate": 0.0002538008478996645, "loss": 4.7571, "mean_token_accuracy": 0.23714976757764816, "num_tokens": 106405585.0, "step": 47660 }, { "entropy": 5.3356608867645265, "epoch": 5.353231875105296, "grad_norm": 1.1328125, "learning_rate": 0.0002537608781180366, "loss": 4.7889, "mean_token_accuracy": 0.24064831137657167, "num_tokens": 106415906.0, "step": 47665 }, { "entropy": 5.2751891136169435, "epoch": 5.353793452013253, "grad_norm": 0.9921875, "learning_rate": 0.0002537209090126704, "loss": 4.7114, "mean_token_accuracy": 0.24205243587493896, "num_tokens": 106426530.0, "step": 47670 }, { "entropy": 5.393040657043457, "epoch": 5.35435502892121, "grad_norm": 1.015625, "learning_rate": 0.00025368094058483885, "loss": 4.8827, "mean_token_accuracy": 0.23715000003576278, "num_tokens": 106438138.0, "step": 47675 }, { "entropy": 5.1934346675872805, "epoch": 5.354916605829168, "grad_norm": 1.0234375, "learning_rate": 0.0002536409728358145, "loss": 4.6702, "mean_token_accuracy": 0.24412281662225724, "num_tokens": 106449072.0, "step": 47680 }, { "entropy": 5.26467490196228, "epoch": 5.355478182737126, "grad_norm": 1.0390625, "learning_rate": 0.0002536010057668698, "loss": 4.7247, "mean_token_accuracy": 0.24329632818698882, "num_tokens": 106458528.0, "step": 47685 }, { "entropy": 5.304969930648804, "epoch": 5.356039759645084, "grad_norm": 0.96875, "learning_rate": 0.0002535610393792773, "loss": 4.7785, "mean_token_accuracy": 0.2432912230491638, "num_tokens": 106470375.0, "step": 47690 }, { "entropy": 5.327494764328003, "epoch": 5.356601336553041, "grad_norm": 0.92578125, "learning_rate": 0.00025352107367430975, "loss": 4.8065, "mean_token_accuracy": 0.23267156928777694, "num_tokens": 106481994.0, "step": 47695 }, { "entropy": 5.408557271957397, "epoch": 5.357162913460998, "grad_norm": 1.109375, "learning_rate": 0.00025348110865323946, "loss": 4.8528, "mean_token_accuracy": 0.23862131386995317, "num_tokens": 106492491.0, "step": 47700 }, { "entropy": 5.26609435081482, "epoch": 5.357724490368956, "grad_norm": 0.96875, "learning_rate": 0.0002534411443173389, "loss": 4.8335, "mean_token_accuracy": 0.23392152339220046, "num_tokens": 106504487.0, "step": 47705 }, { "entropy": 5.258625745773315, "epoch": 5.3582860672769135, "grad_norm": 0.98828125, "learning_rate": 0.0002534011806678809, "loss": 4.8111, "mean_token_accuracy": 0.2357006251811981, "num_tokens": 106517049.0, "step": 47710 }, { "entropy": 5.4435821056365965, "epoch": 5.358847644184872, "grad_norm": 1.1171875, "learning_rate": 0.0002533612177061376, "loss": 5.0069, "mean_token_accuracy": 0.22527101933956145, "num_tokens": 106528533.0, "step": 47715 }, { "entropy": 5.3340071678161625, "epoch": 5.359409221092829, "grad_norm": 1.0625, "learning_rate": 0.00025332125543338146, "loss": 4.7758, "mean_token_accuracy": 0.24207032471895218, "num_tokens": 106539462.0, "step": 47720 }, { "entropy": 5.3368260860443115, "epoch": 5.359970798000786, "grad_norm": 0.98828125, "learning_rate": 0.000253281293850885, "loss": 4.7481, "mean_token_accuracy": 0.24541267305612563, "num_tokens": 106549864.0, "step": 47725 }, { "entropy": 5.270118284225464, "epoch": 5.360532374908744, "grad_norm": 0.99609375, "learning_rate": 0.00025324133295992056, "loss": 4.7825, "mean_token_accuracy": 0.24192671924829484, "num_tokens": 106561990.0, "step": 47730 }, { "entropy": 5.271847152709961, "epoch": 5.361093951816701, "grad_norm": 1.03125, "learning_rate": 0.0002532013727617605, "loss": 4.7114, "mean_token_accuracy": 0.24620699733495713, "num_tokens": 106572995.0, "step": 47735 }, { "entropy": 5.3785804271697994, "epoch": 5.361655528724659, "grad_norm": 1.0703125, "learning_rate": 0.0002531614132576772, "loss": 4.8613, "mean_token_accuracy": 0.23692122399806975, "num_tokens": 106583368.0, "step": 47740 }, { "entropy": 5.226902151107788, "epoch": 5.362217105632617, "grad_norm": 0.9609375, "learning_rate": 0.000253121454448943, "loss": 4.7677, "mean_token_accuracy": 0.24133924543857574, "num_tokens": 106595515.0, "step": 47745 }, { "entropy": 5.328099155426026, "epoch": 5.362778682540574, "grad_norm": 1.0546875, "learning_rate": 0.00025308149633683014, "loss": 4.777, "mean_token_accuracy": 0.23965131491422653, "num_tokens": 106606662.0, "step": 47750 }, { "entropy": 5.333357286453247, "epoch": 5.363340259448531, "grad_norm": 1.125, "learning_rate": 0.000253041538922611, "loss": 4.8114, "mean_token_accuracy": 0.23325524032115935, "num_tokens": 106616750.0, "step": 47755 }, { "entropy": 5.35966944694519, "epoch": 5.363901836356489, "grad_norm": 1.0078125, "learning_rate": 0.00025300158220755776, "loss": 4.8158, "mean_token_accuracy": 0.2495961844921112, "num_tokens": 106630952.0, "step": 47760 }, { "entropy": 5.346912956237793, "epoch": 5.364463413264446, "grad_norm": 1.1328125, "learning_rate": 0.00025296162619294267, "loss": 4.8541, "mean_token_accuracy": 0.23015479296445845, "num_tokens": 106641158.0, "step": 47765 }, { "entropy": 5.278714179992676, "epoch": 5.3650249901724045, "grad_norm": 1.1015625, "learning_rate": 0.0002529216708800379, "loss": 4.7093, "mean_token_accuracy": 0.24825299680233, "num_tokens": 106651463.0, "step": 47770 }, { "entropy": 5.389921712875366, "epoch": 5.365586567080362, "grad_norm": 1.078125, "learning_rate": 0.00025288171627011564, "loss": 4.9659, "mean_token_accuracy": 0.23136436939239502, "num_tokens": 106663896.0, "step": 47775 }, { "entropy": 5.268519067764283, "epoch": 5.366148143988319, "grad_norm": 0.94140625, "learning_rate": 0.00025284176236444817, "loss": 4.6752, "mean_token_accuracy": 0.24296614676713943, "num_tokens": 106675805.0, "step": 47780 }, { "entropy": 5.315757989883423, "epoch": 5.366709720896277, "grad_norm": 1.0546875, "learning_rate": 0.00025280180916430764, "loss": 4.8465, "mean_token_accuracy": 0.2337662771344185, "num_tokens": 106686392.0, "step": 47785 }, { "entropy": 5.348355436325074, "epoch": 5.367271297804234, "grad_norm": 0.99609375, "learning_rate": 0.00025276185667096605, "loss": 4.8404, "mean_token_accuracy": 0.23706826716661453, "num_tokens": 106698724.0, "step": 47790 }, { "entropy": 5.281580829620362, "epoch": 5.3678328747121915, "grad_norm": 1.03125, "learning_rate": 0.00025272190488569564, "loss": 4.698, "mean_token_accuracy": 0.24780855178833008, "num_tokens": 106710632.0, "step": 47795 }, { "entropy": 5.285517692565918, "epoch": 5.36839445162015, "grad_norm": 1.03125, "learning_rate": 0.00025268195380976835, "loss": 4.7756, "mean_token_accuracy": 0.23960219025611879, "num_tokens": 106722476.0, "step": 47800 }, { "entropy": 5.246679306030273, "epoch": 5.368956028528107, "grad_norm": 1.1171875, "learning_rate": 0.0002526420034444564, "loss": 4.7544, "mean_token_accuracy": 0.24378267973661422, "num_tokens": 106734399.0, "step": 47805 }, { "entropy": 5.360498142242432, "epoch": 5.369517605436064, "grad_norm": 1.0390625, "learning_rate": 0.00025260205379103157, "loss": 4.8486, "mean_token_accuracy": 0.23830356001853942, "num_tokens": 106747873.0, "step": 47810 }, { "entropy": 5.34823169708252, "epoch": 5.370079182344022, "grad_norm": 1.078125, "learning_rate": 0.00025256210485076616, "loss": 4.801, "mean_token_accuracy": 0.24208822697401047, "num_tokens": 106758382.0, "step": 47815 }, { "entropy": 5.330787229537964, "epoch": 5.370640759251979, "grad_norm": 1.078125, "learning_rate": 0.000252522156624932, "loss": 4.7863, "mean_token_accuracy": 0.23996385484933852, "num_tokens": 106768699.0, "step": 47820 }, { "entropy": 5.428933620452881, "epoch": 5.3712023361599375, "grad_norm": 1.0390625, "learning_rate": 0.00025248220911480105, "loss": 4.8969, "mean_token_accuracy": 0.22548712491989137, "num_tokens": 106779926.0, "step": 47825 }, { "entropy": 5.360793972015381, "epoch": 5.371763913067895, "grad_norm": 1.0546875, "learning_rate": 0.00025244226232164533, "loss": 4.8384, "mean_token_accuracy": 0.23186196982860566, "num_tokens": 106791421.0, "step": 47830 }, { "entropy": 5.264261722564697, "epoch": 5.372325489975852, "grad_norm": 1.0703125, "learning_rate": 0.00025240231624673674, "loss": 4.7719, "mean_token_accuracy": 0.2383972227573395, "num_tokens": 106802074.0, "step": 47835 }, { "entropy": 5.291747665405273, "epoch": 5.37288706688381, "grad_norm": 1.1171875, "learning_rate": 0.0002523623708913472, "loss": 4.8243, "mean_token_accuracy": 0.2307315096259117, "num_tokens": 106812525.0, "step": 47840 }, { "entropy": 5.395515012741089, "epoch": 5.373448643791767, "grad_norm": 1.0546875, "learning_rate": 0.0002523224262567485, "loss": 4.9109, "mean_token_accuracy": 0.2326488196849823, "num_tokens": 106824248.0, "step": 47845 }, { "entropy": 5.431639051437378, "epoch": 5.3740102206997244, "grad_norm": 0.984375, "learning_rate": 0.00025228248234421247, "loss": 4.8506, "mean_token_accuracy": 0.23430620431900023, "num_tokens": 106834998.0, "step": 47850 }, { "entropy": 5.468851804733276, "epoch": 5.3745717976076826, "grad_norm": 1.03125, "learning_rate": 0.0002522425391550111, "loss": 5.009, "mean_token_accuracy": 0.2272447884082794, "num_tokens": 106847251.0, "step": 47855 }, { "entropy": 5.324404239654541, "epoch": 5.37513337451564, "grad_norm": 1.09375, "learning_rate": 0.00025220259669041613, "loss": 4.8098, "mean_token_accuracy": 0.23712380230426788, "num_tokens": 106858761.0, "step": 47860 }, { "entropy": 5.229291152954102, "epoch": 5.375694951423597, "grad_norm": 1.0078125, "learning_rate": 0.0002521626549516993, "loss": 4.7507, "mean_token_accuracy": 0.24566058367490767, "num_tokens": 106868874.0, "step": 47865 }, { "entropy": 5.41117148399353, "epoch": 5.376256528331555, "grad_norm": 1.1171875, "learning_rate": 0.0002521227139401324, "loss": 4.9631, "mean_token_accuracy": 0.2330926090478897, "num_tokens": 106881446.0, "step": 47870 }, { "entropy": 5.285684823989868, "epoch": 5.376818105239512, "grad_norm": 0.9453125, "learning_rate": 0.00025208277365698715, "loss": 4.7593, "mean_token_accuracy": 0.24519579261541366, "num_tokens": 106893492.0, "step": 47875 }, { "entropy": 5.4346246242523195, "epoch": 5.37737968214747, "grad_norm": 1.015625, "learning_rate": 0.0002520428341035353, "loss": 4.9647, "mean_token_accuracy": 0.22349176406860352, "num_tokens": 106905295.0, "step": 47880 }, { "entropy": 5.341614723205566, "epoch": 5.377941259055428, "grad_norm": 1.21875, "learning_rate": 0.0002520028952810485, "loss": 4.798, "mean_token_accuracy": 0.23807974457740783, "num_tokens": 106915330.0, "step": 47885 }, { "entropy": 5.252960252761841, "epoch": 5.378502835963385, "grad_norm": 0.97265625, "learning_rate": 0.00025196295719079835, "loss": 4.7262, "mean_token_accuracy": 0.2461970940232277, "num_tokens": 106926703.0, "step": 47890 }, { "entropy": 5.329194450378418, "epoch": 5.379064412871343, "grad_norm": 1.078125, "learning_rate": 0.0002519230198340567, "loss": 4.839, "mean_token_accuracy": 0.2304550975561142, "num_tokens": 106938132.0, "step": 47895 }, { "entropy": 5.324065923690796, "epoch": 5.3796259897793, "grad_norm": 1.1171875, "learning_rate": 0.00025188308321209504, "loss": 4.7887, "mean_token_accuracy": 0.23526858240365983, "num_tokens": 106948546.0, "step": 47900 }, { "entropy": 5.31822190284729, "epoch": 5.380187566687258, "grad_norm": 1.0625, "learning_rate": 0.00025184314732618496, "loss": 4.8071, "mean_token_accuracy": 0.2350893050432205, "num_tokens": 106958208.0, "step": 47905 }, { "entropy": 5.279502296447754, "epoch": 5.3807491435952155, "grad_norm": 1.0390625, "learning_rate": 0.000251803212177598, "loss": 4.7529, "mean_token_accuracy": 0.2486165001988411, "num_tokens": 106969057.0, "step": 47910 }, { "entropy": 5.291154575347901, "epoch": 5.381310720503173, "grad_norm": 0.99609375, "learning_rate": 0.0002517632777676058, "loss": 4.8357, "mean_token_accuracy": 0.2393472373485565, "num_tokens": 106980503.0, "step": 47915 }, { "entropy": 5.365461254119873, "epoch": 5.381872297411131, "grad_norm": 1.0234375, "learning_rate": 0.00025172334409747976, "loss": 4.8454, "mean_token_accuracy": 0.23828313052654265, "num_tokens": 106992027.0, "step": 47920 }, { "entropy": 5.383753156661987, "epoch": 5.382433874319088, "grad_norm": 1.046875, "learning_rate": 0.0002516834111684915, "loss": 4.8576, "mean_token_accuracy": 0.22911339104175568, "num_tokens": 107002873.0, "step": 47925 }, { "entropy": 5.262319421768188, "epoch": 5.382995451227045, "grad_norm": 1.046875, "learning_rate": 0.0002516434789819126, "loss": 4.7519, "mean_token_accuracy": 0.2351854681968689, "num_tokens": 107014940.0, "step": 47930 }, { "entropy": 5.269494295120239, "epoch": 5.383557028135003, "grad_norm": 1.0078125, "learning_rate": 0.0002516035475390143, "loss": 4.7511, "mean_token_accuracy": 0.24307684749364852, "num_tokens": 107025750.0, "step": 47935 }, { "entropy": 5.273420000076294, "epoch": 5.384118605042961, "grad_norm": 1.015625, "learning_rate": 0.00025156361684106814, "loss": 4.8044, "mean_token_accuracy": 0.2389841392636299, "num_tokens": 107035931.0, "step": 47940 }, { "entropy": 5.29899525642395, "epoch": 5.384680181950918, "grad_norm": 1.09375, "learning_rate": 0.0002515236868893455, "loss": 4.8062, "mean_token_accuracy": 0.24495109915733337, "num_tokens": 107047799.0, "step": 47945 }, { "entropy": 5.3670509338378904, "epoch": 5.385241758858876, "grad_norm": 0.98828125, "learning_rate": 0.00025148375768511776, "loss": 4.8542, "mean_token_accuracy": 0.23430469036102294, "num_tokens": 107058434.0, "step": 47950 }, { "entropy": 5.416207981109619, "epoch": 5.385803335766833, "grad_norm": 0.98046875, "learning_rate": 0.0002514438292296563, "loss": 4.9891, "mean_token_accuracy": 0.23083456009626388, "num_tokens": 107070912.0, "step": 47955 }, { "entropy": 5.330361938476562, "epoch": 5.386364912674791, "grad_norm": 1.03125, "learning_rate": 0.00025140390152423247, "loss": 4.8422, "mean_token_accuracy": 0.23689731508493422, "num_tokens": 107081885.0, "step": 47960 }, { "entropy": 5.456743574142456, "epoch": 5.3869264895827484, "grad_norm": 1.0625, "learning_rate": 0.0002513639745701176, "loss": 4.8528, "mean_token_accuracy": 0.23894565999507905, "num_tokens": 107093859.0, "step": 47965 }, { "entropy": 5.248056125640869, "epoch": 5.387488066490706, "grad_norm": 1.0234375, "learning_rate": 0.00025132404836858294, "loss": 4.7651, "mean_token_accuracy": 0.23859720379114152, "num_tokens": 107104966.0, "step": 47970 }, { "entropy": 5.302087736129761, "epoch": 5.388049643398664, "grad_norm": 1.0625, "learning_rate": 0.0002512841229208997, "loss": 4.8244, "mean_token_accuracy": 0.23724612444639206, "num_tokens": 107116274.0, "step": 47975 }, { "entropy": 5.308991003036499, "epoch": 5.388611220306621, "grad_norm": 1.0546875, "learning_rate": 0.0002512441982283392, "loss": 4.7269, "mean_token_accuracy": 0.24343357384204864, "num_tokens": 107126366.0, "step": 47980 }, { "entropy": 5.40924186706543, "epoch": 5.389172797214578, "grad_norm": 1.109375, "learning_rate": 0.0002512042742921727, "loss": 4.9541, "mean_token_accuracy": 0.22660405784845353, "num_tokens": 107137557.0, "step": 47985 }, { "entropy": 5.438967990875244, "epoch": 5.389734374122536, "grad_norm": 0.99609375, "learning_rate": 0.0002511643511136712, "loss": 4.9559, "mean_token_accuracy": 0.22508950978517533, "num_tokens": 107149034.0, "step": 47990 }, { "entropy": 5.386489343643189, "epoch": 5.3902959510304935, "grad_norm": 0.953125, "learning_rate": 0.00025112442869410607, "loss": 4.8378, "mean_token_accuracy": 0.23104346692562103, "num_tokens": 107161151.0, "step": 47995 }, { "entropy": 5.356549263000488, "epoch": 5.390857527938451, "grad_norm": 1.0859375, "learning_rate": 0.00025108450703474844, "loss": 4.7927, "mean_token_accuracy": 0.2407902255654335, "num_tokens": 107172423.0, "step": 48000 }, { "epoch": 5.390857527938451, "eval_entropy": 5.140413817591909, "eval_loss": 5.010140895843506, "eval_mean_token_accuracy": 0.23330395977952784, "eval_num_tokens": 107172423.0, "eval_runtime": 23.8979, "eval_samples_per_second": 1297.73, "eval_steps_per_second": 162.232, "step": 48000 }, { "entropy": 5.335368633270264, "epoch": 5.391419104846409, "grad_norm": 1.03125, "learning_rate": 0.00025104458613686936, "loss": 4.7737, "mean_token_accuracy": 0.23998275846242906, "num_tokens": 107183609.0, "step": 48005 }, { "entropy": 5.340459680557251, "epoch": 5.391980681754366, "grad_norm": 1.0859375, "learning_rate": 0.00025100466600174, "loss": 4.8819, "mean_token_accuracy": 0.2314401775598526, "num_tokens": 107195225.0, "step": 48010 }, { "entropy": 5.35895562171936, "epoch": 5.392542258662324, "grad_norm": 1.125, "learning_rate": 0.0002509647466306313, "loss": 4.8782, "mean_token_accuracy": 0.23695301115512848, "num_tokens": 107206399.0, "step": 48015 }, { "entropy": 5.304448080062866, "epoch": 5.393103835570281, "grad_norm": 1.109375, "learning_rate": 0.00025092482802481443, "loss": 4.7861, "mean_token_accuracy": 0.23737318813800812, "num_tokens": 107217099.0, "step": 48020 }, { "entropy": 5.346317338943481, "epoch": 5.393665412478239, "grad_norm": 1.0625, "learning_rate": 0.0002508849101855604, "loss": 4.8937, "mean_token_accuracy": 0.22852680087089539, "num_tokens": 107228463.0, "step": 48025 }, { "entropy": 5.3188355445861815, "epoch": 5.394226989386197, "grad_norm": 1.0859375, "learning_rate": 0.0002508449931141401, "loss": 4.7544, "mean_token_accuracy": 0.24686156511306762, "num_tokens": 107238118.0, "step": 48030 }, { "entropy": 5.342896747589111, "epoch": 5.394788566294154, "grad_norm": 1.078125, "learning_rate": 0.00025080507681182464, "loss": 4.8091, "mean_token_accuracy": 0.23939220160245894, "num_tokens": 107249537.0, "step": 48035 }, { "entropy": 5.375359201431275, "epoch": 5.395350143202111, "grad_norm": 1.03125, "learning_rate": 0.0002507651612798849, "loss": 4.873, "mean_token_accuracy": 0.23002255260944365, "num_tokens": 107261005.0, "step": 48040 }, { "entropy": 5.278658246994018, "epoch": 5.395911720110069, "grad_norm": 0.96875, "learning_rate": 0.00025072524651959183, "loss": 4.7331, "mean_token_accuracy": 0.24016711711883545, "num_tokens": 107272099.0, "step": 48045 }, { "entropy": 5.277265167236328, "epoch": 5.3964732970180265, "grad_norm": 1.0546875, "learning_rate": 0.0002506853325322164, "loss": 4.7085, "mean_token_accuracy": 0.2416931137442589, "num_tokens": 107283290.0, "step": 48050 }, { "entropy": 5.267444229125976, "epoch": 5.397034873925985, "grad_norm": 0.9609375, "learning_rate": 0.0002506454193190293, "loss": 4.8482, "mean_token_accuracy": 0.23336421847343444, "num_tokens": 107295028.0, "step": 48055 }, { "entropy": 5.321864175796509, "epoch": 5.397596450833942, "grad_norm": 1.0546875, "learning_rate": 0.00025060550688130157, "loss": 4.7909, "mean_token_accuracy": 0.2426442950963974, "num_tokens": 107306374.0, "step": 48060 }, { "entropy": 5.350157594680786, "epoch": 5.398158027741899, "grad_norm": 1.0, "learning_rate": 0.00025056559522030383, "loss": 4.8652, "mean_token_accuracy": 0.23519549369812012, "num_tokens": 107318241.0, "step": 48065 }, { "entropy": 5.378100967407226, "epoch": 5.398719604649857, "grad_norm": 0.9765625, "learning_rate": 0.0002505256843373071, "loss": 4.8405, "mean_token_accuracy": 0.23076984286308289, "num_tokens": 107330252.0, "step": 48070 }, { "entropy": 5.366825437545776, "epoch": 5.399281181557814, "grad_norm": 1.0390625, "learning_rate": 0.0002504857742335821, "loss": 4.8999, "mean_token_accuracy": 0.23679858893156053, "num_tokens": 107341771.0, "step": 48075 }, { "entropy": 5.262651777267456, "epoch": 5.3998427584657716, "grad_norm": 1.03125, "learning_rate": 0.00025044586491039956, "loss": 4.7623, "mean_token_accuracy": 0.23433341979980468, "num_tokens": 107352963.0, "step": 48080 }, { "entropy": 5.261600923538208, "epoch": 5.40040433537373, "grad_norm": 0.96875, "learning_rate": 0.0002504059563690302, "loss": 4.7498, "mean_token_accuracy": 0.24079796969890593, "num_tokens": 107363901.0, "step": 48085 }, { "entropy": 5.288555765151978, "epoch": 5.400965912281687, "grad_norm": 0.9609375, "learning_rate": 0.0002503660486107447, "loss": 4.7823, "mean_token_accuracy": 0.24232788681983947, "num_tokens": 107376033.0, "step": 48090 }, { "entropy": 5.320987606048584, "epoch": 5.401527489189645, "grad_norm": 1.046875, "learning_rate": 0.0002503261416368138, "loss": 4.786, "mean_token_accuracy": 0.24333046972751618, "num_tokens": 107387134.0, "step": 48095 }, { "entropy": 5.292643117904663, "epoch": 5.402089066097602, "grad_norm": 1.03125, "learning_rate": 0.0002502862354485081, "loss": 4.7383, "mean_token_accuracy": 0.24711241126060485, "num_tokens": 107397186.0, "step": 48100 }, { "entropy": 5.276294851303101, "epoch": 5.402650643005559, "grad_norm": 1.0390625, "learning_rate": 0.00025024633004709824, "loss": 4.7672, "mean_token_accuracy": 0.24313766360282899, "num_tokens": 107407841.0, "step": 48105 }, { "entropy": 5.285129117965698, "epoch": 5.4032122199135175, "grad_norm": 1.0859375, "learning_rate": 0.00025020642543385486, "loss": 4.6922, "mean_token_accuracy": 0.2507660076022148, "num_tokens": 107418530.0, "step": 48110 }, { "entropy": 5.342335319519043, "epoch": 5.403773796821475, "grad_norm": 1.109375, "learning_rate": 0.00025016652161004847, "loss": 4.8826, "mean_token_accuracy": 0.22995602637529372, "num_tokens": 107429424.0, "step": 48115 }, { "entropy": 5.329483413696289, "epoch": 5.404335373729432, "grad_norm": 0.92578125, "learning_rate": 0.0002501266185769497, "loss": 4.7877, "mean_token_accuracy": 0.23626340180635452, "num_tokens": 107440323.0, "step": 48120 }, { "entropy": 5.360688543319702, "epoch": 5.40489695063739, "grad_norm": 1.0234375, "learning_rate": 0.00025008671633582904, "loss": 4.8002, "mean_token_accuracy": 0.24705660492181777, "num_tokens": 107451449.0, "step": 48125 }, { "entropy": 5.4204802989959715, "epoch": 5.405458527545347, "grad_norm": 1.0625, "learning_rate": 0.000250046814887957, "loss": 5.0, "mean_token_accuracy": 0.22388266772031784, "num_tokens": 107463605.0, "step": 48130 }, { "entropy": 5.34502911567688, "epoch": 5.4060201044533045, "grad_norm": 1.15625, "learning_rate": 0.0002500069142346039, "loss": 4.8651, "mean_token_accuracy": 0.23374599665403367, "num_tokens": 107475767.0, "step": 48135 }, { "entropy": 5.293302297592163, "epoch": 5.406581681361263, "grad_norm": 1.0546875, "learning_rate": 0.0002499670143770405, "loss": 4.7461, "mean_token_accuracy": 0.24396583586931228, "num_tokens": 107486039.0, "step": 48140 }, { "entropy": 5.302363634109497, "epoch": 5.40714325826922, "grad_norm": 0.98828125, "learning_rate": 0.0002499271153165371, "loss": 4.801, "mean_token_accuracy": 0.23384447991847992, "num_tokens": 107497029.0, "step": 48145 }, { "entropy": 5.3703282356262205, "epoch": 5.407704835177178, "grad_norm": 1.125, "learning_rate": 0.000249887217054364, "loss": 4.8842, "mean_token_accuracy": 0.22903691977262497, "num_tokens": 107508605.0, "step": 48150 }, { "entropy": 5.312437582015991, "epoch": 5.408266412085135, "grad_norm": 1.0859375, "learning_rate": 0.0002498473195917917, "loss": 4.7911, "mean_token_accuracy": 0.23885067999362947, "num_tokens": 107519688.0, "step": 48155 }, { "entropy": 5.236100530624389, "epoch": 5.408827988993092, "grad_norm": 0.9453125, "learning_rate": 0.0002498074229300905, "loss": 4.7003, "mean_token_accuracy": 0.24818704426288604, "num_tokens": 107531291.0, "step": 48160 }, { "entropy": 5.1776265621185305, "epoch": 5.4093895659010505, "grad_norm": 0.9921875, "learning_rate": 0.0002497675270705307, "loss": 4.6571, "mean_token_accuracy": 0.24140879213809968, "num_tokens": 107541581.0, "step": 48165 }, { "entropy": 5.3026731491088865, "epoch": 5.409951142809008, "grad_norm": 0.99609375, "learning_rate": 0.0002497276320143826, "loss": 4.8555, "mean_token_accuracy": 0.2361392304301262, "num_tokens": 107552038.0, "step": 48170 }, { "entropy": 5.418278598785401, "epoch": 5.410512719716965, "grad_norm": 1.0078125, "learning_rate": 0.00024968773776291647, "loss": 4.8262, "mean_token_accuracy": 0.23506632596254348, "num_tokens": 107563669.0, "step": 48175 }, { "entropy": 5.216590070724488, "epoch": 5.411074296624923, "grad_norm": 0.953125, "learning_rate": 0.0002496478443174026, "loss": 4.7262, "mean_token_accuracy": 0.2494857758283615, "num_tokens": 107576509.0, "step": 48180 }, { "entropy": 5.341580486297607, "epoch": 5.41163587353288, "grad_norm": 1.0625, "learning_rate": 0.0002496079516791113, "loss": 4.8979, "mean_token_accuracy": 0.23061861395835875, "num_tokens": 107586601.0, "step": 48185 }, { "entropy": 5.378854894638062, "epoch": 5.412197450440837, "grad_norm": 1.125, "learning_rate": 0.0002495680598493126, "loss": 4.8331, "mean_token_accuracy": 0.23445071280002594, "num_tokens": 107597357.0, "step": 48190 }, { "entropy": 5.353949356079101, "epoch": 5.4127590273487955, "grad_norm": 1.1015625, "learning_rate": 0.0002495281688292768, "loss": 4.7629, "mean_token_accuracy": 0.23308364748954774, "num_tokens": 107607727.0, "step": 48195 }, { "entropy": 5.404633903503418, "epoch": 5.413320604256753, "grad_norm": 1.078125, "learning_rate": 0.00024948827862027385, "loss": 4.8694, "mean_token_accuracy": 0.2384641319513321, "num_tokens": 107617973.0, "step": 48200 }, { "entropy": 5.360018110275268, "epoch": 5.413882181164711, "grad_norm": 1.0234375, "learning_rate": 0.0002494483892235741, "loss": 4.9055, "mean_token_accuracy": 0.22808065116405488, "num_tokens": 107628845.0, "step": 48205 }, { "entropy": 5.31061201095581, "epoch": 5.414443758072668, "grad_norm": 1.0, "learning_rate": 0.0002494085006404474, "loss": 4.7339, "mean_token_accuracy": 0.2434367686510086, "num_tokens": 107639702.0, "step": 48210 }, { "entropy": 5.365789127349854, "epoch": 5.415005334980625, "grad_norm": 0.95703125, "learning_rate": 0.0002493686128721641, "loss": 4.8397, "mean_token_accuracy": 0.24060240983963013, "num_tokens": 107651754.0, "step": 48215 }, { "entropy": 5.429797601699829, "epoch": 5.415566911888583, "grad_norm": 0.9453125, "learning_rate": 0.00024932872591999414, "loss": 4.9975, "mean_token_accuracy": 0.22708537429571152, "num_tokens": 107664271.0, "step": 48220 }, { "entropy": 5.334953641891479, "epoch": 5.416128488796541, "grad_norm": 0.9375, "learning_rate": 0.00024928883978520743, "loss": 4.7835, "mean_token_accuracy": 0.242853944003582, "num_tokens": 107675316.0, "step": 48225 }, { "entropy": 5.345213747024536, "epoch": 5.416690065704498, "grad_norm": 1.0546875, "learning_rate": 0.00024924895446907407, "loss": 4.8549, "mean_token_accuracy": 0.23540873378515242, "num_tokens": 107686806.0, "step": 48230 }, { "entropy": 5.357829761505127, "epoch": 5.417251642612456, "grad_norm": 1.1328125, "learning_rate": 0.000249209069972864, "loss": 4.7755, "mean_token_accuracy": 0.2364482581615448, "num_tokens": 107697097.0, "step": 48235 }, { "entropy": 5.303747844696045, "epoch": 5.417813219520413, "grad_norm": 1.0390625, "learning_rate": 0.00024916918629784714, "loss": 4.7804, "mean_token_accuracy": 0.23974881917238236, "num_tokens": 107708117.0, "step": 48240 }, { "entropy": 5.410014247894287, "epoch": 5.418374796428371, "grad_norm": 1.078125, "learning_rate": 0.0002491293034452933, "loss": 4.8768, "mean_token_accuracy": 0.228361177444458, "num_tokens": 107718927.0, "step": 48245 }, { "entropy": 5.316575956344605, "epoch": 5.4189363733363285, "grad_norm": 1.03125, "learning_rate": 0.0002490894214164726, "loss": 4.7944, "mean_token_accuracy": 0.23911189436912536, "num_tokens": 107730362.0, "step": 48250 }, { "entropy": 5.283337783813477, "epoch": 5.419497950244286, "grad_norm": 1.140625, "learning_rate": 0.0002490495402126548, "loss": 4.8372, "mean_token_accuracy": 0.23491731584072112, "num_tokens": 107741148.0, "step": 48255 }, { "entropy": 5.28989052772522, "epoch": 5.420059527152244, "grad_norm": 1.0390625, "learning_rate": 0.0002490096598351096, "loss": 4.7491, "mean_token_accuracy": 0.2360307678580284, "num_tokens": 107752023.0, "step": 48260 }, { "entropy": 5.299873685836792, "epoch": 5.420621104060201, "grad_norm": 0.984375, "learning_rate": 0.00024896978028510696, "loss": 4.7397, "mean_token_accuracy": 0.24120659232139588, "num_tokens": 107763136.0, "step": 48265 }, { "entropy": 5.339196681976318, "epoch": 5.421182680968158, "grad_norm": 1.046875, "learning_rate": 0.0002489299015639167, "loss": 4.8632, "mean_token_accuracy": 0.24057164639234543, "num_tokens": 107774372.0, "step": 48270 }, { "entropy": 5.290726089477539, "epoch": 5.421744257876116, "grad_norm": 1.1328125, "learning_rate": 0.0002488900236728083, "loss": 4.7779, "mean_token_accuracy": 0.23183539807796477, "num_tokens": 107785042.0, "step": 48275 }, { "entropy": 5.361528444290161, "epoch": 5.422305834784074, "grad_norm": 1.0625, "learning_rate": 0.0002488501466130517, "loss": 4.7918, "mean_token_accuracy": 0.24187275618314744, "num_tokens": 107795476.0, "step": 48280 }, { "entropy": 5.28851580619812, "epoch": 5.422867411692032, "grad_norm": 1.0234375, "learning_rate": 0.00024881027038591664, "loss": 4.7843, "mean_token_accuracy": 0.2346884489059448, "num_tokens": 107806016.0, "step": 48285 }, { "entropy": 5.309561109542846, "epoch": 5.423428988599989, "grad_norm": 0.9765625, "learning_rate": 0.00024877039499267273, "loss": 4.7925, "mean_token_accuracy": 0.23707161992788314, "num_tokens": 107815988.0, "step": 48290 }, { "entropy": 5.281680679321289, "epoch": 5.423990565507946, "grad_norm": 1.0390625, "learning_rate": 0.0002487305204345896, "loss": 4.7564, "mean_token_accuracy": 0.24033102095127107, "num_tokens": 107826321.0, "step": 48295 }, { "entropy": 5.349907541275025, "epoch": 5.424552142415904, "grad_norm": 1.0625, "learning_rate": 0.00024869064671293687, "loss": 4.7948, "mean_token_accuracy": 0.24109698235988616, "num_tokens": 107837031.0, "step": 48300 }, { "entropy": 5.40595269203186, "epoch": 5.425113719323861, "grad_norm": 1.125, "learning_rate": 0.00024865077382898423, "loss": 4.9073, "mean_token_accuracy": 0.23471041023731232, "num_tokens": 107846739.0, "step": 48305 }, { "entropy": 5.372014427185059, "epoch": 5.425675296231819, "grad_norm": 1.0390625, "learning_rate": 0.00024861090178400106, "loss": 4.8312, "mean_token_accuracy": 0.23821086883544923, "num_tokens": 107858640.0, "step": 48310 }, { "entropy": 5.3566468238830565, "epoch": 5.426236873139777, "grad_norm": 1.0234375, "learning_rate": 0.00024857103057925707, "loss": 4.8504, "mean_token_accuracy": 0.23501634746789932, "num_tokens": 107871586.0, "step": 48315 }, { "entropy": 5.3845624923706055, "epoch": 5.426798450047734, "grad_norm": 1.0234375, "learning_rate": 0.00024853116021602173, "loss": 4.8358, "mean_token_accuracy": 0.23712316751480103, "num_tokens": 107881979.0, "step": 48320 }, { "entropy": 5.3541182518005375, "epoch": 5.427360026955691, "grad_norm": 1.2265625, "learning_rate": 0.0002484912906955645, "loss": 4.9169, "mean_token_accuracy": 0.23002346009016036, "num_tokens": 107893899.0, "step": 48325 }, { "entropy": 5.360014629364014, "epoch": 5.427921603863649, "grad_norm": 1.0859375, "learning_rate": 0.0002484514220191549, "loss": 4.8031, "mean_token_accuracy": 0.23989544808864594, "num_tokens": 107904432.0, "step": 48330 }, { "entropy": 5.369151592254639, "epoch": 5.4284831807716065, "grad_norm": 1.0234375, "learning_rate": 0.0002484115541880623, "loss": 4.8935, "mean_token_accuracy": 0.23638660013675689, "num_tokens": 107915792.0, "step": 48335 }, { "entropy": 5.272096347808838, "epoch": 5.429044757679565, "grad_norm": 1.0234375, "learning_rate": 0.00024837168720355605, "loss": 4.6869, "mean_token_accuracy": 0.25365591496229173, "num_tokens": 107927546.0, "step": 48340 }, { "entropy": 5.273371458053589, "epoch": 5.429606334587522, "grad_norm": 1.0859375, "learning_rate": 0.0002483318210669057, "loss": 4.7468, "mean_token_accuracy": 0.24341964423656465, "num_tokens": 107937965.0, "step": 48345 }, { "entropy": 5.411024856567383, "epoch": 5.430167911495479, "grad_norm": 0.98046875, "learning_rate": 0.0002482919557793805, "loss": 4.9714, "mean_token_accuracy": 0.2345738723874092, "num_tokens": 107949581.0, "step": 48350 }, { "entropy": 5.362826871871948, "epoch": 5.430729488403437, "grad_norm": 0.99609375, "learning_rate": 0.00024825209134224965, "loss": 4.8227, "mean_token_accuracy": 0.2354622572660446, "num_tokens": 107961636.0, "step": 48355 }, { "entropy": 5.395572233200073, "epoch": 5.431291065311394, "grad_norm": 1.0703125, "learning_rate": 0.0002482122277567827, "loss": 4.8663, "mean_token_accuracy": 0.24542443901300431, "num_tokens": 107972488.0, "step": 48360 }, { "entropy": 5.336085081100464, "epoch": 5.431852642219352, "grad_norm": 1.046875, "learning_rate": 0.00024817236502424885, "loss": 4.8361, "mean_token_accuracy": 0.235746169090271, "num_tokens": 107984071.0, "step": 48365 }, { "entropy": 5.278129243850708, "epoch": 5.43241421912731, "grad_norm": 1.0859375, "learning_rate": 0.0002481325031459172, "loss": 4.7799, "mean_token_accuracy": 0.23761677592992783, "num_tokens": 107994816.0, "step": 48370 }, { "entropy": 5.291623973846436, "epoch": 5.432975796035267, "grad_norm": 1.1328125, "learning_rate": 0.00024809264212305714, "loss": 4.747, "mean_token_accuracy": 0.24205498546361923, "num_tokens": 108005737.0, "step": 48375 }, { "entropy": 5.314851236343384, "epoch": 5.433537372943224, "grad_norm": 0.9453125, "learning_rate": 0.0002480527819569378, "loss": 4.7747, "mean_token_accuracy": 0.24083291441202165, "num_tokens": 108017519.0, "step": 48380 }, { "entropy": 5.391932964324951, "epoch": 5.434098949851182, "grad_norm": 1.0078125, "learning_rate": 0.0002480129226488283, "loss": 4.8669, "mean_token_accuracy": 0.23004532605409622, "num_tokens": 108029318.0, "step": 48385 }, { "entropy": 5.264876890182495, "epoch": 5.4346605267591395, "grad_norm": 1.078125, "learning_rate": 0.00024797306419999777, "loss": 4.7788, "mean_token_accuracy": 0.23958482295274736, "num_tokens": 108040844.0, "step": 48390 }, { "entropy": 5.287418413162231, "epoch": 5.435222103667098, "grad_norm": 1.0625, "learning_rate": 0.0002479332066117154, "loss": 4.818, "mean_token_accuracy": 0.23970102816820144, "num_tokens": 108052558.0, "step": 48395 }, { "entropy": 5.392337083816528, "epoch": 5.435783680575055, "grad_norm": 1.03125, "learning_rate": 0.0002478933498852503, "loss": 4.8853, "mean_token_accuracy": 0.2348636880517006, "num_tokens": 108063619.0, "step": 48400 }, { "entropy": 5.322489976882935, "epoch": 5.436345257483012, "grad_norm": 1.0, "learning_rate": 0.0002478534940218714, "loss": 4.7795, "mean_token_accuracy": 0.24001667648553848, "num_tokens": 108074942.0, "step": 48405 }, { "entropy": 5.34663143157959, "epoch": 5.43690683439097, "grad_norm": 1.0546875, "learning_rate": 0.00024781363902284776, "loss": 4.848, "mean_token_accuracy": 0.2299207016825676, "num_tokens": 108086245.0, "step": 48410 }, { "entropy": 5.231891775131226, "epoch": 5.437468411298927, "grad_norm": 1.03125, "learning_rate": 0.0002477737848894484, "loss": 4.7249, "mean_token_accuracy": 0.24126538038253784, "num_tokens": 108096251.0, "step": 48415 }, { "entropy": 5.385582017898559, "epoch": 5.4380299882068845, "grad_norm": 1.0078125, "learning_rate": 0.0002477339316229423, "loss": 4.8525, "mean_token_accuracy": 0.24366098046302795, "num_tokens": 108107494.0, "step": 48420 }, { "entropy": 5.3206957340240475, "epoch": 5.438591565114843, "grad_norm": 0.984375, "learning_rate": 0.0002476940792245983, "loss": 4.815, "mean_token_accuracy": 0.23797137141227723, "num_tokens": 108119260.0, "step": 48425 }, { "entropy": 5.22964334487915, "epoch": 5.4391531420228, "grad_norm": 0.9921875, "learning_rate": 0.00024765422769568553, "loss": 4.7092, "mean_token_accuracy": 0.24271993190050126, "num_tokens": 108130125.0, "step": 48430 }, { "entropy": 5.380172538757324, "epoch": 5.439714718930758, "grad_norm": 1.09375, "learning_rate": 0.0002476143770374727, "loss": 4.9516, "mean_token_accuracy": 0.22424257695674896, "num_tokens": 108141707.0, "step": 48435 }, { "entropy": 5.422353315353393, "epoch": 5.440276295838715, "grad_norm": 1.0625, "learning_rate": 0.00024757452725122876, "loss": 4.8456, "mean_token_accuracy": 0.23495023101568221, "num_tokens": 108154038.0, "step": 48440 }, { "entropy": 5.376693534851074, "epoch": 5.440837872746672, "grad_norm": 1.0546875, "learning_rate": 0.0002475346783382225, "loss": 4.8533, "mean_token_accuracy": 0.23733012676239013, "num_tokens": 108165111.0, "step": 48445 }, { "entropy": 5.351035022735596, "epoch": 5.4413994496546305, "grad_norm": 1.0078125, "learning_rate": 0.00024749483029972276, "loss": 4.8625, "mean_token_accuracy": 0.22563242465257644, "num_tokens": 108176139.0, "step": 48450 }, { "entropy": 5.430060291290284, "epoch": 5.441961026562588, "grad_norm": 1.03125, "learning_rate": 0.0002474549831369983, "loss": 4.9643, "mean_token_accuracy": 0.23415762484073638, "num_tokens": 108187818.0, "step": 48455 }, { "entropy": 5.358787202835083, "epoch": 5.442522603470545, "grad_norm": 1.078125, "learning_rate": 0.00024741513685131773, "loss": 4.8356, "mean_token_accuracy": 0.23578021973371505, "num_tokens": 108198153.0, "step": 48460 }, { "entropy": 5.30645170211792, "epoch": 5.443084180378503, "grad_norm": 1.0, "learning_rate": 0.00024737529144395, "loss": 4.7559, "mean_token_accuracy": 0.23851645290851592, "num_tokens": 108210334.0, "step": 48465 }, { "entropy": 5.283547973632812, "epoch": 5.44364575728646, "grad_norm": 0.98046875, "learning_rate": 0.0002473354469161637, "loss": 4.7968, "mean_token_accuracy": 0.2413155496120453, "num_tokens": 108222912.0, "step": 48470 }, { "entropy": 5.182802724838257, "epoch": 5.444207334194418, "grad_norm": 0.9921875, "learning_rate": 0.0002472956032692275, "loss": 4.6767, "mean_token_accuracy": 0.24550610333681105, "num_tokens": 108232911.0, "step": 48475 }, { "entropy": 5.315421628952026, "epoch": 5.444768911102376, "grad_norm": 1.078125, "learning_rate": 0.0002472557605044101, "loss": 4.8381, "mean_token_accuracy": 0.23393265157938004, "num_tokens": 108244464.0, "step": 48480 }, { "entropy": 5.350901031494141, "epoch": 5.445330488010333, "grad_norm": 1.1015625, "learning_rate": 0.00024721591862297994, "loss": 4.7992, "mean_token_accuracy": 0.24357731342315675, "num_tokens": 108255609.0, "step": 48485 }, { "entropy": 5.373753929138184, "epoch": 5.445892064918291, "grad_norm": 1.0546875, "learning_rate": 0.00024717607762620575, "loss": 4.8351, "mean_token_accuracy": 0.23422912806272506, "num_tokens": 108266076.0, "step": 48490 }, { "entropy": 5.209778642654419, "epoch": 5.446453641826248, "grad_norm": 1.015625, "learning_rate": 0.0002471362375153559, "loss": 4.6251, "mean_token_accuracy": 0.25387144535779954, "num_tokens": 108277091.0, "step": 48495 }, { "entropy": 5.243908643722534, "epoch": 5.447015218734205, "grad_norm": 1.0703125, "learning_rate": 0.00024709639829169924, "loss": 4.7543, "mean_token_accuracy": 0.2396395042538643, "num_tokens": 108288224.0, "step": 48500 }, { "entropy": 5.339846658706665, "epoch": 5.4475767956421635, "grad_norm": 1.0234375, "learning_rate": 0.00024705655995650407, "loss": 4.8495, "mean_token_accuracy": 0.23457620441913604, "num_tokens": 108298841.0, "step": 48505 }, { "entropy": 5.28974609375, "epoch": 5.448138372550121, "grad_norm": 1.0390625, "learning_rate": 0.0002470167225110388, "loss": 4.7265, "mean_token_accuracy": 0.24643294662237167, "num_tokens": 108309864.0, "step": 48510 }, { "entropy": 5.294095373153686, "epoch": 5.448699949458078, "grad_norm": 1.046875, "learning_rate": 0.000246976885956572, "loss": 4.7584, "mean_token_accuracy": 0.23491716384887695, "num_tokens": 108320097.0, "step": 48515 }, { "entropy": 5.292574834823609, "epoch": 5.449261526366036, "grad_norm": 1.03125, "learning_rate": 0.000246937050294372, "loss": 4.7734, "mean_token_accuracy": 0.23955602049827576, "num_tokens": 108330904.0, "step": 48520 }, { "entropy": 5.289916276931763, "epoch": 5.449823103273993, "grad_norm": 1.0390625, "learning_rate": 0.00024689721552570714, "loss": 4.7926, "mean_token_accuracy": 0.24310359805822374, "num_tokens": 108340549.0, "step": 48525 }, { "entropy": 5.259102630615234, "epoch": 5.450384680181951, "grad_norm": 1.0859375, "learning_rate": 0.0002468573816518459, "loss": 4.7676, "mean_token_accuracy": 0.24304784089326859, "num_tokens": 108352427.0, "step": 48530 }, { "entropy": 5.344539022445678, "epoch": 5.4509462570899085, "grad_norm": 1.0078125, "learning_rate": 0.0002468175486740565, "loss": 4.8608, "mean_token_accuracy": 0.23490267544984816, "num_tokens": 108365228.0, "step": 48535 }, { "entropy": 5.329259538650513, "epoch": 5.451507833997866, "grad_norm": 1.0390625, "learning_rate": 0.0002467777165936073, "loss": 4.7744, "mean_token_accuracy": 0.23860872834920882, "num_tokens": 108375584.0, "step": 48540 }, { "entropy": 5.391112852096557, "epoch": 5.452069410905824, "grad_norm": 1.015625, "learning_rate": 0.0002467378854117666, "loss": 4.8307, "mean_token_accuracy": 0.23607154041528702, "num_tokens": 108386634.0, "step": 48545 }, { "entropy": 5.33463716506958, "epoch": 5.452630987813781, "grad_norm": 1.09375, "learning_rate": 0.0002466980551298026, "loss": 4.8274, "mean_token_accuracy": 0.2392538905143738, "num_tokens": 108397895.0, "step": 48550 }, { "entropy": 5.338215780258179, "epoch": 5.453192564721738, "grad_norm": 1.125, "learning_rate": 0.00024665822574898344, "loss": 4.8483, "mean_token_accuracy": 0.2361769884824753, "num_tokens": 108407576.0, "step": 48555 }, { "entropy": 5.353451251983643, "epoch": 5.453754141629696, "grad_norm": 1.1953125, "learning_rate": 0.00024661839727057737, "loss": 4.8739, "mean_token_accuracy": 0.23070045709609985, "num_tokens": 108418751.0, "step": 48560 }, { "entropy": 5.409369325637817, "epoch": 5.454315718537654, "grad_norm": 1.0078125, "learning_rate": 0.00024657856969585257, "loss": 4.8886, "mean_token_accuracy": 0.23030151724815368, "num_tokens": 108429997.0, "step": 48565 }, { "entropy": 5.410181474685669, "epoch": 5.454877295445611, "grad_norm": 1.0625, "learning_rate": 0.000246538743026077, "loss": 4.8849, "mean_token_accuracy": 0.22826776802539825, "num_tokens": 108441380.0, "step": 48570 }, { "entropy": 5.324895906448364, "epoch": 5.455438872353569, "grad_norm": 1.03125, "learning_rate": 0.000246498917262519, "loss": 4.7739, "mean_token_accuracy": 0.24235834628343583, "num_tokens": 108452985.0, "step": 48575 }, { "entropy": 5.473445987701416, "epoch": 5.456000449261526, "grad_norm": 1.0625, "learning_rate": 0.0002464590924064465, "loss": 5.0096, "mean_token_accuracy": 0.22290758043527603, "num_tokens": 108463624.0, "step": 48580 }, { "entropy": 5.359873962402344, "epoch": 5.456562026169484, "grad_norm": 1.078125, "learning_rate": 0.00024641926845912765, "loss": 4.8107, "mean_token_accuracy": 0.23640419840812682, "num_tokens": 108475736.0, "step": 48585 }, { "entropy": 5.310965538024902, "epoch": 5.4571236030774415, "grad_norm": 0.96875, "learning_rate": 0.00024637944542183035, "loss": 4.7884, "mean_token_accuracy": 0.24931090772151948, "num_tokens": 108486238.0, "step": 48590 }, { "entropy": 5.248914051055908, "epoch": 5.457685179985399, "grad_norm": 1.0546875, "learning_rate": 0.00024633962329582255, "loss": 4.7505, "mean_token_accuracy": 0.24895514994859697, "num_tokens": 108498929.0, "step": 48595 }, { "entropy": 5.366007375717163, "epoch": 5.458246756893357, "grad_norm": 1.015625, "learning_rate": 0.0002462998020823723, "loss": 4.87, "mean_token_accuracy": 0.24027867168188094, "num_tokens": 108511727.0, "step": 48600 }, { "entropy": 5.287298393249512, "epoch": 5.458808333801314, "grad_norm": 1.09375, "learning_rate": 0.00024625998178274747, "loss": 4.7403, "mean_token_accuracy": 0.2482757031917572, "num_tokens": 108522794.0, "step": 48605 }, { "entropy": 5.403678131103516, "epoch": 5.459369910709271, "grad_norm": 0.9765625, "learning_rate": 0.0002462201623982159, "loss": 4.92, "mean_token_accuracy": 0.2319077342748642, "num_tokens": 108534021.0, "step": 48610 }, { "entropy": 5.372740125656128, "epoch": 5.459931487617229, "grad_norm": 1.1015625, "learning_rate": 0.0002461803439300456, "loss": 4.816, "mean_token_accuracy": 0.24020825326442719, "num_tokens": 108544509.0, "step": 48615 }, { "entropy": 5.301140069961548, "epoch": 5.460493064525187, "grad_norm": 1.0078125, "learning_rate": 0.0002461405263795044, "loss": 4.8511, "mean_token_accuracy": 0.23806069642305375, "num_tokens": 108554718.0, "step": 48620 }, { "entropy": 5.305284452438355, "epoch": 5.461054641433145, "grad_norm": 1.078125, "learning_rate": 0.0002461007097478599, "loss": 4.7618, "mean_token_accuracy": 0.2414195343852043, "num_tokens": 108566660.0, "step": 48625 }, { "entropy": 5.350522089004516, "epoch": 5.461616218341102, "grad_norm": 1.0, "learning_rate": 0.0002460608940363801, "loss": 4.8783, "mean_token_accuracy": 0.2351525530219078, "num_tokens": 108578187.0, "step": 48630 }, { "entropy": 5.295495796203613, "epoch": 5.462177795249059, "grad_norm": 1.0859375, "learning_rate": 0.00024602107924633266, "loss": 4.7807, "mean_token_accuracy": 0.2373659700155258, "num_tokens": 108590181.0, "step": 48635 }, { "entropy": 5.285640573501587, "epoch": 5.462739372157017, "grad_norm": 1.0546875, "learning_rate": 0.0002459812653789851, "loss": 4.7542, "mean_token_accuracy": 0.24283964633941652, "num_tokens": 108600437.0, "step": 48640 }, { "entropy": 5.326772260665893, "epoch": 5.463300949064974, "grad_norm": 0.98828125, "learning_rate": 0.0002459414524356055, "loss": 4.8202, "mean_token_accuracy": 0.2341189667582512, "num_tokens": 108611302.0, "step": 48645 }, { "entropy": 5.371254014968872, "epoch": 5.463862525972932, "grad_norm": 0.96484375, "learning_rate": 0.0002459016404174613, "loss": 4.9295, "mean_token_accuracy": 0.23713070303201675, "num_tokens": 108622837.0, "step": 48650 }, { "entropy": 5.286772632598877, "epoch": 5.46442410288089, "grad_norm": 0.94921875, "learning_rate": 0.00024586182932582014, "loss": 4.7873, "mean_token_accuracy": 0.23838101029396058, "num_tokens": 108635025.0, "step": 48655 }, { "entropy": 5.352306461334228, "epoch": 5.464985679788847, "grad_norm": 0.8828125, "learning_rate": 0.0002458220191619496, "loss": 4.9161, "mean_token_accuracy": 0.23157168477773665, "num_tokens": 108647248.0, "step": 48660 }, { "entropy": 5.3630143165588375, "epoch": 5.465547256696805, "grad_norm": 1.1171875, "learning_rate": 0.00024578220992711736, "loss": 4.8611, "mean_token_accuracy": 0.23149846792221068, "num_tokens": 108657677.0, "step": 48665 }, { "entropy": 5.327671051025391, "epoch": 5.466108833604762, "grad_norm": 0.9921875, "learning_rate": 0.0002457424016225909, "loss": 4.7306, "mean_token_accuracy": 0.23815231323242186, "num_tokens": 108668421.0, "step": 48670 }, { "entropy": 5.368958473205566, "epoch": 5.4666704105127195, "grad_norm": 0.95703125, "learning_rate": 0.0002457025942496376, "loss": 4.8378, "mean_token_accuracy": 0.23574099093675613, "num_tokens": 108680296.0, "step": 48675 }, { "entropy": 5.370146608352661, "epoch": 5.467231987420678, "grad_norm": 1.046875, "learning_rate": 0.00024566278780952514, "loss": 4.8846, "mean_token_accuracy": 0.2271747663617134, "num_tokens": 108691746.0, "step": 48680 }, { "entropy": 5.237767744064331, "epoch": 5.467793564328635, "grad_norm": 1.0234375, "learning_rate": 0.0002456229823035209, "loss": 4.7239, "mean_token_accuracy": 0.2435236319899559, "num_tokens": 108703420.0, "step": 48685 }, { "entropy": 5.335828733444214, "epoch": 5.468355141236592, "grad_norm": 1.0625, "learning_rate": 0.00024558317773289227, "loss": 4.8176, "mean_token_accuracy": 0.2426401510834694, "num_tokens": 108714480.0, "step": 48690 }, { "entropy": 5.381621074676514, "epoch": 5.46891671814455, "grad_norm": 1.03125, "learning_rate": 0.0002455433740989067, "loss": 4.8548, "mean_token_accuracy": 0.24158288687467575, "num_tokens": 108725004.0, "step": 48695 }, { "entropy": 5.3588653087615965, "epoch": 5.469478295052507, "grad_norm": 1.015625, "learning_rate": 0.0002455035714028315, "loss": 4.8258, "mean_token_accuracy": 0.24195917546749116, "num_tokens": 108735526.0, "step": 48700 }, { "entropy": 5.3427516460418705, "epoch": 5.470039871960465, "grad_norm": 1.0625, "learning_rate": 0.0002454637696459341, "loss": 4.8685, "mean_token_accuracy": 0.22958477437496186, "num_tokens": 108746463.0, "step": 48705 }, { "entropy": 5.275126886367798, "epoch": 5.470601448868423, "grad_norm": 1.0546875, "learning_rate": 0.00024542396882948163, "loss": 4.7863, "mean_token_accuracy": 0.2359275460243225, "num_tokens": 108757485.0, "step": 48710 }, { "entropy": 5.308712530136108, "epoch": 5.47116302577638, "grad_norm": 1.0625, "learning_rate": 0.00024538416895474144, "loss": 4.8337, "mean_token_accuracy": 0.23082361221313477, "num_tokens": 108768549.0, "step": 48715 }, { "entropy": 5.393625926971436, "epoch": 5.471724602684338, "grad_norm": 1.0859375, "learning_rate": 0.00024534437002298083, "loss": 4.9271, "mean_token_accuracy": 0.2368304431438446, "num_tokens": 108778614.0, "step": 48720 }, { "entropy": 5.264206743240356, "epoch": 5.472286179592295, "grad_norm": 1.140625, "learning_rate": 0.000245304572035467, "loss": 4.7127, "mean_token_accuracy": 0.24635663032531738, "num_tokens": 108789719.0, "step": 48725 }, { "entropy": 5.282946825027466, "epoch": 5.4728477565002525, "grad_norm": 1.0234375, "learning_rate": 0.0002452647749934671, "loss": 4.8123, "mean_token_accuracy": 0.24256884902715684, "num_tokens": 108801202.0, "step": 48730 }, { "entropy": 5.299004602432251, "epoch": 5.473409333408211, "grad_norm": 1.046875, "learning_rate": 0.00024522497889824837, "loss": 4.8646, "mean_token_accuracy": 0.23303425908088685, "num_tokens": 108812171.0, "step": 48735 }, { "entropy": 5.311777925491333, "epoch": 5.473970910316168, "grad_norm": 1.0703125, "learning_rate": 0.0002451851837510778, "loss": 4.7637, "mean_token_accuracy": 0.24300806522369384, "num_tokens": 108823213.0, "step": 48740 }, { "entropy": 5.33276743888855, "epoch": 5.474532487224125, "grad_norm": 1.0390625, "learning_rate": 0.0002451453895532226, "loss": 4.8068, "mean_token_accuracy": 0.23879633098840714, "num_tokens": 108833817.0, "step": 48745 }, { "entropy": 5.411648178100586, "epoch": 5.475094064132083, "grad_norm": 1.1015625, "learning_rate": 0.0002451055963059496, "loss": 4.9233, "mean_token_accuracy": 0.2294970706105232, "num_tokens": 108845028.0, "step": 48750 }, { "entropy": 5.390277099609375, "epoch": 5.47565564104004, "grad_norm": 1.03125, "learning_rate": 0.00024506580401052616, "loss": 4.8427, "mean_token_accuracy": 0.23343038707971572, "num_tokens": 108857483.0, "step": 48755 }, { "entropy": 5.278283548355103, "epoch": 5.4762172179479975, "grad_norm": 1.0, "learning_rate": 0.0002450260126682191, "loss": 4.7886, "mean_token_accuracy": 0.23112231194972993, "num_tokens": 108868264.0, "step": 48760 }, { "entropy": 5.343395090103149, "epoch": 5.476778794855956, "grad_norm": 1.1015625, "learning_rate": 0.00024498622228029545, "loss": 4.8443, "mean_token_accuracy": 0.2352883443236351, "num_tokens": 108879053.0, "step": 48765 }, { "entropy": 5.380060768127441, "epoch": 5.477340371763913, "grad_norm": 0.96484375, "learning_rate": 0.0002449464328480221, "loss": 4.8304, "mean_token_accuracy": 0.24751342386007308, "num_tokens": 108889015.0, "step": 48770 }, { "entropy": 5.319025087356567, "epoch": 5.477901948671871, "grad_norm": 1.0234375, "learning_rate": 0.000244906644372666, "loss": 4.8212, "mean_token_accuracy": 0.23443738073110582, "num_tokens": 108901171.0, "step": 48775 }, { "entropy": 5.314834690093994, "epoch": 5.478463525579828, "grad_norm": 1.1015625, "learning_rate": 0.000244866856855494, "loss": 4.8106, "mean_token_accuracy": 0.24007904082536696, "num_tokens": 108912052.0, "step": 48780 }, { "entropy": 5.303533124923706, "epoch": 5.479025102487785, "grad_norm": 1.0703125, "learning_rate": 0.00024482707029777284, "loss": 4.7929, "mean_token_accuracy": 0.2346143364906311, "num_tokens": 108922348.0, "step": 48785 }, { "entropy": 5.3548253059387205, "epoch": 5.4795866793957435, "grad_norm": 0.984375, "learning_rate": 0.00024478728470076963, "loss": 4.8666, "mean_token_accuracy": 0.2306789994239807, "num_tokens": 108933479.0, "step": 48790 }, { "entropy": 5.2497961044311525, "epoch": 5.480148256303701, "grad_norm": 1.03125, "learning_rate": 0.0002447475000657509, "loss": 4.6809, "mean_token_accuracy": 0.24221818149089813, "num_tokens": 108944040.0, "step": 48795 }, { "entropy": 5.364357948303223, "epoch": 5.480709833211658, "grad_norm": 1.0703125, "learning_rate": 0.0002447077163939836, "loss": 4.8855, "mean_token_accuracy": 0.23175972700119019, "num_tokens": 108955379.0, "step": 48800 }, { "entropy": 5.374868392944336, "epoch": 5.481271410119616, "grad_norm": 1.125, "learning_rate": 0.00024466793368673427, "loss": 4.8768, "mean_token_accuracy": 0.23078415542840958, "num_tokens": 108966082.0, "step": 48805 }, { "entropy": 5.402729797363281, "epoch": 5.481832987027573, "grad_norm": 1.03125, "learning_rate": 0.0002446281519452698, "loss": 4.857, "mean_token_accuracy": 0.24385218769311906, "num_tokens": 108976523.0, "step": 48810 }, { "entropy": 5.28530535697937, "epoch": 5.482394563935531, "grad_norm": 1.1328125, "learning_rate": 0.0002445883711708567, "loss": 4.8023, "mean_token_accuracy": 0.2395727425813675, "num_tokens": 108988149.0, "step": 48815 }, { "entropy": 5.332957649230957, "epoch": 5.482956140843489, "grad_norm": 1.0078125, "learning_rate": 0.00024454859136476155, "loss": 4.7979, "mean_token_accuracy": 0.24033304452896118, "num_tokens": 109000506.0, "step": 48820 }, { "entropy": 5.319605159759521, "epoch": 5.483517717751446, "grad_norm": 0.98828125, "learning_rate": 0.00024450881252825117, "loss": 4.748, "mean_token_accuracy": 0.24625588655471803, "num_tokens": 109011005.0, "step": 48825 }, { "entropy": 5.33412733078003, "epoch": 5.484079294659404, "grad_norm": 1.1171875, "learning_rate": 0.000244469034662592, "loss": 4.7862, "mean_token_accuracy": 0.23482610285282135, "num_tokens": 109021005.0, "step": 48830 }, { "entropy": 5.339501810073853, "epoch": 5.484640871567361, "grad_norm": 1.0546875, "learning_rate": 0.0002444292577690506, "loss": 4.8181, "mean_token_accuracy": 0.2366468518972397, "num_tokens": 109032002.0, "step": 48835 }, { "entropy": 5.243677949905395, "epoch": 5.485202448475318, "grad_norm": 0.953125, "learning_rate": 0.00024438948184889354, "loss": 4.7384, "mean_token_accuracy": 0.24229494333267212, "num_tokens": 109043607.0, "step": 48840 }, { "entropy": 5.3579261779785154, "epoch": 5.4857640253832765, "grad_norm": 1.0859375, "learning_rate": 0.0002443497069033872, "loss": 4.9471, "mean_token_accuracy": 0.22986946403980255, "num_tokens": 109055480.0, "step": 48845 }, { "entropy": 5.387786483764648, "epoch": 5.486325602291234, "grad_norm": 1.1796875, "learning_rate": 0.0002443099329337981, "loss": 4.9046, "mean_token_accuracy": 0.23804231286048888, "num_tokens": 109066684.0, "step": 48850 }, { "entropy": 5.339282703399658, "epoch": 5.486887179199192, "grad_norm": 1.0703125, "learning_rate": 0.0002442701599413927, "loss": 4.7469, "mean_token_accuracy": 0.24777586460113527, "num_tokens": 109075973.0, "step": 48855 }, { "entropy": 5.3363128185272215, "epoch": 5.487448756107149, "grad_norm": 1.0234375, "learning_rate": 0.00024423038792743715, "loss": 4.8165, "mean_token_accuracy": 0.23986100852489473, "num_tokens": 109087652.0, "step": 48860 }, { "entropy": 5.2809813022613525, "epoch": 5.488010333015106, "grad_norm": 0.91015625, "learning_rate": 0.0002441906168931981, "loss": 4.7519, "mean_token_accuracy": 0.2430313929915428, "num_tokens": 109100315.0, "step": 48865 }, { "entropy": 5.301583290100098, "epoch": 5.488571909923064, "grad_norm": 1.0546875, "learning_rate": 0.0002441508468399417, "loss": 4.8406, "mean_token_accuracy": 0.2409450814127922, "num_tokens": 109112005.0, "step": 48870 }, { "entropy": 5.328284502029419, "epoch": 5.4891334868310215, "grad_norm": 1.0703125, "learning_rate": 0.00024411107776893437, "loss": 4.8752, "mean_token_accuracy": 0.22999443411827086, "num_tokens": 109122216.0, "step": 48875 }, { "entropy": 5.3141122341156, "epoch": 5.489695063738979, "grad_norm": 0.984375, "learning_rate": 0.0002440713096814423, "loss": 4.764, "mean_token_accuracy": 0.2359127327799797, "num_tokens": 109133073.0, "step": 48880 }, { "entropy": 5.3149340629577635, "epoch": 5.490256640646937, "grad_norm": 1.0546875, "learning_rate": 0.00024403154257873172, "loss": 4.7629, "mean_token_accuracy": 0.2432608962059021, "num_tokens": 109144097.0, "step": 48885 }, { "entropy": 5.345896434783936, "epoch": 5.490818217554894, "grad_norm": 1.078125, "learning_rate": 0.00024399177646206884, "loss": 4.8463, "mean_token_accuracy": 0.23025868982076644, "num_tokens": 109155246.0, "step": 48890 }, { "entropy": 5.34710578918457, "epoch": 5.491379794462851, "grad_norm": 0.96484375, "learning_rate": 0.00024395201133271978, "loss": 4.7801, "mean_token_accuracy": 0.24016969054937362, "num_tokens": 109165955.0, "step": 48895 }, { "entropy": 5.353817129135132, "epoch": 5.491941371370809, "grad_norm": 1.0546875, "learning_rate": 0.00024391224719195077, "loss": 4.8209, "mean_token_accuracy": 0.23630001842975618, "num_tokens": 109176471.0, "step": 48900 }, { "entropy": 5.341941976547242, "epoch": 5.492502948278767, "grad_norm": 1.09375, "learning_rate": 0.00024387248404102779, "loss": 4.754, "mean_token_accuracy": 0.24674094021320342, "num_tokens": 109188613.0, "step": 48905 }, { "entropy": 5.427220344543457, "epoch": 5.493064525186725, "grad_norm": 1.0546875, "learning_rate": 0.00024383272188121708, "loss": 4.8726, "mean_token_accuracy": 0.23631695806980133, "num_tokens": 109200652.0, "step": 48910 }, { "entropy": 5.322189569473267, "epoch": 5.493626102094682, "grad_norm": 1.1015625, "learning_rate": 0.0002437929607137846, "loss": 4.806, "mean_token_accuracy": 0.2339221403002739, "num_tokens": 109210858.0, "step": 48915 }, { "entropy": 5.32694263458252, "epoch": 5.494187679002639, "grad_norm": 1.1328125, "learning_rate": 0.00024375320053999627, "loss": 4.8035, "mean_token_accuracy": 0.236537866294384, "num_tokens": 109222058.0, "step": 48920 }, { "entropy": 5.315470266342163, "epoch": 5.494749255910597, "grad_norm": 1.09375, "learning_rate": 0.00024371344136111823, "loss": 4.7743, "mean_token_accuracy": 0.23928722143173217, "num_tokens": 109232831.0, "step": 48925 }, { "entropy": 5.354319095611572, "epoch": 5.4953108328185545, "grad_norm": 0.9765625, "learning_rate": 0.0002436736831784162, "loss": 4.8782, "mean_token_accuracy": 0.22688726037740709, "num_tokens": 109245203.0, "step": 48930 }, { "entropy": 5.282226467132569, "epoch": 5.495872409726512, "grad_norm": 0.97265625, "learning_rate": 0.00024363392599315636, "loss": 4.7441, "mean_token_accuracy": 0.23904580175876616, "num_tokens": 109255738.0, "step": 48935 }, { "entropy": 5.390476989746094, "epoch": 5.49643398663447, "grad_norm": 1.03125, "learning_rate": 0.00024359416980660454, "loss": 4.842, "mean_token_accuracy": 0.2378416731953621, "num_tokens": 109266567.0, "step": 48940 }, { "entropy": 5.332048940658569, "epoch": 5.496995563542427, "grad_norm": 1.109375, "learning_rate": 0.00024355441462002648, "loss": 4.8547, "mean_token_accuracy": 0.2303945690393448, "num_tokens": 109277302.0, "step": 48945 }, { "entropy": 5.351855897903443, "epoch": 5.497557140450384, "grad_norm": 1.0625, "learning_rate": 0.00024351466043468807, "loss": 4.8689, "mean_token_accuracy": 0.23205618113279342, "num_tokens": 109288336.0, "step": 48950 }, { "entropy": 5.313169527053833, "epoch": 5.498118717358342, "grad_norm": 1.03125, "learning_rate": 0.00024347490725185506, "loss": 4.7477, "mean_token_accuracy": 0.23876751512289046, "num_tokens": 109298968.0, "step": 48955 }, { "entropy": 5.281483316421509, "epoch": 5.4986802942663, "grad_norm": 1.1796875, "learning_rate": 0.00024343515507279325, "loss": 4.7333, "mean_token_accuracy": 0.24335992634296416, "num_tokens": 109308837.0, "step": 48960 }, { "entropy": 5.331518173217773, "epoch": 5.499241871174258, "grad_norm": 0.9921875, "learning_rate": 0.0002433954038987683, "loss": 4.8017, "mean_token_accuracy": 0.24409158080816268, "num_tokens": 109319464.0, "step": 48965 }, { "entropy": 5.321038389205933, "epoch": 5.499803448082215, "grad_norm": 1.0234375, "learning_rate": 0.00024335565373104594, "loss": 4.7883, "mean_token_accuracy": 0.2379003331065178, "num_tokens": 109331126.0, "step": 48970 }, { "entropy": 5.274481010437012, "epoch": 5.500365024990172, "grad_norm": 1.109375, "learning_rate": 0.00024331590457089193, "loss": 4.791, "mean_token_accuracy": 0.23924760520458221, "num_tokens": 109341298.0, "step": 48975 }, { "entropy": 5.341129112243652, "epoch": 5.50092660189813, "grad_norm": 0.9609375, "learning_rate": 0.00024327615641957175, "loss": 4.8045, "mean_token_accuracy": 0.25015909522771834, "num_tokens": 109352817.0, "step": 48980 }, { "entropy": 5.311898136138916, "epoch": 5.501488178806087, "grad_norm": 1.0546875, "learning_rate": 0.00024323640927835106, "loss": 4.7414, "mean_token_accuracy": 0.24486693292856215, "num_tokens": 109364004.0, "step": 48985 }, { "entropy": 5.281471490859985, "epoch": 5.5020497557140455, "grad_norm": 0.88671875, "learning_rate": 0.00024319666314849542, "loss": 4.7342, "mean_token_accuracy": 0.2504726752638817, "num_tokens": 109375790.0, "step": 48990 }, { "entropy": 5.2982776165008545, "epoch": 5.502611332622003, "grad_norm": 1.0234375, "learning_rate": 0.00024315691803127037, "loss": 4.8064, "mean_token_accuracy": 0.2361719638109207, "num_tokens": 109386521.0, "step": 48995 }, { "entropy": 5.346166133880615, "epoch": 5.50317290952996, "grad_norm": 1.109375, "learning_rate": 0.0002431171739279413, "loss": 4.8478, "mean_token_accuracy": 0.23551374524831772, "num_tokens": 109397348.0, "step": 49000 }, { "entropy": 5.301602745056153, "epoch": 5.503734486437917, "grad_norm": 1.015625, "learning_rate": 0.00024307743083977384, "loss": 4.7687, "mean_token_accuracy": 0.24105747789144516, "num_tokens": 109407636.0, "step": 49005 }, { "entropy": 5.3048927783966064, "epoch": 5.504296063345875, "grad_norm": 1.0625, "learning_rate": 0.00024303768876803345, "loss": 4.8061, "mean_token_accuracy": 0.23726456761360168, "num_tokens": 109417822.0, "step": 49010 }, { "entropy": 5.3173072814941404, "epoch": 5.5048576402538325, "grad_norm": 1.0234375, "learning_rate": 0.00024299794771398536, "loss": 4.7792, "mean_token_accuracy": 0.24135462939739227, "num_tokens": 109428602.0, "step": 49015 }, { "entropy": 5.330592250823974, "epoch": 5.505419217161791, "grad_norm": 0.97265625, "learning_rate": 0.00024295820767889504, "loss": 4.7505, "mean_token_accuracy": 0.24390156716108322, "num_tokens": 109439042.0, "step": 49020 }, { "entropy": 5.4125463485717775, "epoch": 5.505980794069748, "grad_norm": 0.9375, "learning_rate": 0.00024291846866402784, "loss": 4.8294, "mean_token_accuracy": 0.23565893322229386, "num_tokens": 109450286.0, "step": 49025 }, { "entropy": 5.405391216278076, "epoch": 5.506542370977705, "grad_norm": 1.0078125, "learning_rate": 0.00024287873067064904, "loss": 4.9021, "mean_token_accuracy": 0.2328319013118744, "num_tokens": 109461852.0, "step": 49030 }, { "entropy": 5.320379161834717, "epoch": 5.507103947885663, "grad_norm": 0.94140625, "learning_rate": 0.00024283899370002393, "loss": 4.836, "mean_token_accuracy": 0.23690219968557358, "num_tokens": 109474340.0, "step": 49035 }, { "entropy": 5.335454416275025, "epoch": 5.50766552479362, "grad_norm": 1.0859375, "learning_rate": 0.00024279925775341765, "loss": 4.7873, "mean_token_accuracy": 0.23608896881341934, "num_tokens": 109485448.0, "step": 49040 }, { "entropy": 5.32970404624939, "epoch": 5.5082271017015785, "grad_norm": 1.1875, "learning_rate": 0.00024275952283209557, "loss": 4.728, "mean_token_accuracy": 0.24419861137866974, "num_tokens": 109494750.0, "step": 49045 }, { "entropy": 5.347968816757202, "epoch": 5.508788678609536, "grad_norm": 1.078125, "learning_rate": 0.00024271978893732277, "loss": 4.7578, "mean_token_accuracy": 0.24270141869783401, "num_tokens": 109505372.0, "step": 49050 }, { "entropy": 5.34378080368042, "epoch": 5.509350255517493, "grad_norm": 1.1796875, "learning_rate": 0.00024268005607036442, "loss": 4.8527, "mean_token_accuracy": 0.23286802023649217, "num_tokens": 109516881.0, "step": 49055 }, { "entropy": 5.283629655838013, "epoch": 5.509911832425451, "grad_norm": 1.078125, "learning_rate": 0.00024264032423248555, "loss": 4.7117, "mean_token_accuracy": 0.24494908452033998, "num_tokens": 109527285.0, "step": 49060 }, { "entropy": 5.309141206741333, "epoch": 5.510473409333408, "grad_norm": 1.0625, "learning_rate": 0.0002426005934249514, "loss": 4.795, "mean_token_accuracy": 0.24027348011732103, "num_tokens": 109537635.0, "step": 49065 }, { "entropy": 5.268564987182617, "epoch": 5.5110349862413655, "grad_norm": 1.078125, "learning_rate": 0.0002425608636490269, "loss": 4.7638, "mean_token_accuracy": 0.23503388166427613, "num_tokens": 109547932.0, "step": 49070 }, { "entropy": 5.2955889225006105, "epoch": 5.511596563149324, "grad_norm": 1.0, "learning_rate": 0.00024252113490597692, "loss": 4.7863, "mean_token_accuracy": 0.24987515956163406, "num_tokens": 109559087.0, "step": 49075 }, { "entropy": 5.364214706420898, "epoch": 5.512158140057281, "grad_norm": 1.0546875, "learning_rate": 0.0002424814071970668, "loss": 4.9089, "mean_token_accuracy": 0.2345846876502037, "num_tokens": 109570926.0, "step": 49080 }, { "entropy": 5.25468430519104, "epoch": 5.512719716965238, "grad_norm": 1.0546875, "learning_rate": 0.00024244168052356125, "loss": 4.6861, "mean_token_accuracy": 0.24319399744272233, "num_tokens": 109580988.0, "step": 49085 }, { "entropy": 5.404922389984131, "epoch": 5.513281293873196, "grad_norm": 1.015625, "learning_rate": 0.00024240195488672516, "loss": 4.8885, "mean_token_accuracy": 0.23046984672546386, "num_tokens": 109592763.0, "step": 49090 }, { "entropy": 5.359957218170166, "epoch": 5.513842870781153, "grad_norm": 0.9921875, "learning_rate": 0.00024236223028782357, "loss": 4.8855, "mean_token_accuracy": 0.23193428218364714, "num_tokens": 109603786.0, "step": 49095 }, { "entropy": 5.32365312576294, "epoch": 5.514404447689111, "grad_norm": 1.125, "learning_rate": 0.00024232250672812116, "loss": 4.8002, "mean_token_accuracy": 0.25086279809474943, "num_tokens": 109615321.0, "step": 49100 }, { "entropy": 5.393411111831665, "epoch": 5.514966024597069, "grad_norm": 0.9765625, "learning_rate": 0.00024228278420888283, "loss": 4.8767, "mean_token_accuracy": 0.2372048020362854, "num_tokens": 109625758.0, "step": 49105 }, { "entropy": 5.308790588378907, "epoch": 5.515527601505026, "grad_norm": 1.0859375, "learning_rate": 0.0002422430627313733, "loss": 4.7448, "mean_token_accuracy": 0.23948934674263, "num_tokens": 109636725.0, "step": 49110 }, { "entropy": 5.309588289260864, "epoch": 5.516089178412984, "grad_norm": 1.2109375, "learning_rate": 0.00024220334229685736, "loss": 4.7654, "mean_token_accuracy": 0.24142092764377593, "num_tokens": 109647179.0, "step": 49115 }, { "entropy": 5.309453010559082, "epoch": 5.516650755320941, "grad_norm": 1.0546875, "learning_rate": 0.00024216362290659977, "loss": 4.7953, "mean_token_accuracy": 0.2340933695435524, "num_tokens": 109658093.0, "step": 49120 }, { "entropy": 5.343444538116455, "epoch": 5.517212332228898, "grad_norm": 1.171875, "learning_rate": 0.00024212390456186512, "loss": 4.8111, "mean_token_accuracy": 0.24369694143533707, "num_tokens": 109668574.0, "step": 49125 }, { "entropy": 5.362764739990235, "epoch": 5.5177739091368565, "grad_norm": 1.0625, "learning_rate": 0.00024208418726391813, "loss": 4.83, "mean_token_accuracy": 0.2351192504167557, "num_tokens": 109678640.0, "step": 49130 }, { "entropy": 5.343158102035522, "epoch": 5.518335486044814, "grad_norm": 1.1328125, "learning_rate": 0.00024204447101402337, "loss": 4.8146, "mean_token_accuracy": 0.23371340185403824, "num_tokens": 109690183.0, "step": 49135 }, { "entropy": 5.282980442047119, "epoch": 5.518897062952771, "grad_norm": 1.0546875, "learning_rate": 0.00024200475581344545, "loss": 4.7573, "mean_token_accuracy": 0.24055927246809006, "num_tokens": 109700882.0, "step": 49140 }, { "entropy": 5.2862756729125975, "epoch": 5.519458639860729, "grad_norm": 1.0078125, "learning_rate": 0.0002419650416634488, "loss": 4.7809, "mean_token_accuracy": 0.23804033547639847, "num_tokens": 109712459.0, "step": 49145 }, { "entropy": 5.252402305603027, "epoch": 5.520020216768686, "grad_norm": 1.015625, "learning_rate": 0.00024192532856529814, "loss": 4.7578, "mean_token_accuracy": 0.2422614425420761, "num_tokens": 109724116.0, "step": 49150 }, { "entropy": 5.2878961086273195, "epoch": 5.520581793676644, "grad_norm": 1.0390625, "learning_rate": 0.00024188561652025787, "loss": 4.7933, "mean_token_accuracy": 0.23394181877374648, "num_tokens": 109735517.0, "step": 49155 }, { "entropy": 5.319989109039307, "epoch": 5.521143370584602, "grad_norm": 1.0, "learning_rate": 0.00024184590552959234, "loss": 4.8185, "mean_token_accuracy": 0.23697317242622376, "num_tokens": 109746762.0, "step": 49160 }, { "entropy": 5.280418539047242, "epoch": 5.521704947492559, "grad_norm": 1.0, "learning_rate": 0.00024180619559456608, "loss": 4.7453, "mean_token_accuracy": 0.23652812093496323, "num_tokens": 109758153.0, "step": 49165 }, { "entropy": 5.402957820892334, "epoch": 5.522266524400517, "grad_norm": 1.109375, "learning_rate": 0.0002417664867164434, "loss": 4.9415, "mean_token_accuracy": 0.22653261870145797, "num_tokens": 109770521.0, "step": 49170 }, { "entropy": 5.355305337905884, "epoch": 5.522828101308474, "grad_norm": 1.0546875, "learning_rate": 0.0002417267788964887, "loss": 4.8231, "mean_token_accuracy": 0.237220162153244, "num_tokens": 109781816.0, "step": 49175 }, { "entropy": 5.391757822036743, "epoch": 5.523389678216432, "grad_norm": 1.0859375, "learning_rate": 0.00024168707213596626, "loss": 4.8225, "mean_token_accuracy": 0.2336422771215439, "num_tokens": 109792558.0, "step": 49180 }, { "entropy": 5.277734327316284, "epoch": 5.5239512551243894, "grad_norm": 0.96484375, "learning_rate": 0.00024164736643614033, "loss": 4.7098, "mean_token_accuracy": 0.23852664828300477, "num_tokens": 109803021.0, "step": 49185 }, { "entropy": 5.155351543426514, "epoch": 5.524512832032347, "grad_norm": 1.015625, "learning_rate": 0.0002416076617982752, "loss": 4.727, "mean_token_accuracy": 0.2421427324414253, "num_tokens": 109813526.0, "step": 49190 }, { "entropy": 5.287590074539184, "epoch": 5.525074408940304, "grad_norm": 1.1875, "learning_rate": 0.00024156795822363508, "loss": 4.729, "mean_token_accuracy": 0.23774438947439194, "num_tokens": 109824411.0, "step": 49195 }, { "entropy": 5.340789031982422, "epoch": 5.525635985848262, "grad_norm": 0.98046875, "learning_rate": 0.00024152825571348418, "loss": 4.7774, "mean_token_accuracy": 0.2443556934595108, "num_tokens": 109834908.0, "step": 49200 }, { "entropy": 5.220906019210815, "epoch": 5.526197562756219, "grad_norm": 0.9921875, "learning_rate": 0.00024148855426908656, "loss": 4.7511, "mean_token_accuracy": 0.240874020755291, "num_tokens": 109846332.0, "step": 49205 }, { "entropy": 5.333557939529419, "epoch": 5.526759139664177, "grad_norm": 1.078125, "learning_rate": 0.0002414488538917064, "loss": 4.9087, "mean_token_accuracy": 0.23265471011400224, "num_tokens": 109857507.0, "step": 49210 }, { "entropy": 5.308560037612915, "epoch": 5.5273207165721345, "grad_norm": 1.0234375, "learning_rate": 0.0002414091545826077, "loss": 4.7702, "mean_token_accuracy": 0.2392491042613983, "num_tokens": 109869196.0, "step": 49215 }, { "entropy": 5.377552604675293, "epoch": 5.527882293480092, "grad_norm": 1.046875, "learning_rate": 0.00024136945634305445, "loss": 4.8583, "mean_token_accuracy": 0.2277148887515068, "num_tokens": 109879894.0, "step": 49220 }, { "entropy": 5.199643945693969, "epoch": 5.52844387038805, "grad_norm": 0.9921875, "learning_rate": 0.00024132975917431088, "loss": 4.7061, "mean_token_accuracy": 0.24454743415117264, "num_tokens": 109890673.0, "step": 49225 }, { "entropy": 5.326724624633789, "epoch": 5.529005447296007, "grad_norm": 1.09375, "learning_rate": 0.00024129006307764084, "loss": 4.8665, "mean_token_accuracy": 0.22981595546007155, "num_tokens": 109900931.0, "step": 49230 }, { "entropy": 5.346473312377929, "epoch": 5.529567024203965, "grad_norm": 1.015625, "learning_rate": 0.00024125036805430829, "loss": 4.8238, "mean_token_accuracy": 0.24523911625146866, "num_tokens": 109913172.0, "step": 49235 }, { "entropy": 5.354193019866943, "epoch": 5.530128601111922, "grad_norm": 0.98046875, "learning_rate": 0.000241210674105577, "loss": 4.8275, "mean_token_accuracy": 0.24880130290985109, "num_tokens": 109925116.0, "step": 49240 }, { "entropy": 5.255893516540527, "epoch": 5.53069017801988, "grad_norm": 1.0703125, "learning_rate": 0.00024117098123271107, "loss": 4.6912, "mean_token_accuracy": 0.2533883646130562, "num_tokens": 109935201.0, "step": 49245 }, { "entropy": 5.3175910949707035, "epoch": 5.531251754927838, "grad_norm": 1.0, "learning_rate": 0.00024113128943697415, "loss": 4.8103, "mean_token_accuracy": 0.24125425666570663, "num_tokens": 109945679.0, "step": 49250 }, { "entropy": 5.334803581237793, "epoch": 5.531813331835795, "grad_norm": 0.96484375, "learning_rate": 0.0002410915987196301, "loss": 4.7978, "mean_token_accuracy": 0.23614946454763414, "num_tokens": 109956659.0, "step": 49255 }, { "entropy": 5.3123414516448975, "epoch": 5.532374908743752, "grad_norm": 1.0234375, "learning_rate": 0.00024105190908194275, "loss": 4.8352, "mean_token_accuracy": 0.23542602658271788, "num_tokens": 109966371.0, "step": 49260 }, { "entropy": 5.311874532699585, "epoch": 5.53293648565171, "grad_norm": 0.9609375, "learning_rate": 0.00024101222052517573, "loss": 4.8339, "mean_token_accuracy": 0.23439778834581376, "num_tokens": 109977630.0, "step": 49265 }, { "entropy": 5.252944850921631, "epoch": 5.5334980625596675, "grad_norm": 0.96875, "learning_rate": 0.00024097253305059287, "loss": 4.7459, "mean_token_accuracy": 0.23519934713840485, "num_tokens": 109988757.0, "step": 49270 }, { "entropy": 5.344314861297607, "epoch": 5.534059639467625, "grad_norm": 1.0859375, "learning_rate": 0.0002409328466594577, "loss": 4.8116, "mean_token_accuracy": 0.23522135019302368, "num_tokens": 109998992.0, "step": 49275 }, { "entropy": 5.278532981872559, "epoch": 5.534621216375583, "grad_norm": 1.046875, "learning_rate": 0.0002408931613530339, "loss": 4.7095, "mean_token_accuracy": 0.2486620545387268, "num_tokens": 110009961.0, "step": 49280 }, { "entropy": 5.283925151824951, "epoch": 5.53518279328354, "grad_norm": 1.0390625, "learning_rate": 0.0002408534771325851, "loss": 4.7719, "mean_token_accuracy": 0.24627807438373567, "num_tokens": 110020653.0, "step": 49285 }, { "entropy": 5.3315126419067385, "epoch": 5.535744370191498, "grad_norm": 1.03125, "learning_rate": 0.0002408137939993747, "loss": 4.8163, "mean_token_accuracy": 0.23727014064788818, "num_tokens": 110030113.0, "step": 49290 }, { "entropy": 5.282347393035889, "epoch": 5.536305947099455, "grad_norm": 1.0703125, "learning_rate": 0.00024077411195466648, "loss": 4.8096, "mean_token_accuracy": 0.23876769840717316, "num_tokens": 110040952.0, "step": 49295 }, { "entropy": 5.253788757324219, "epoch": 5.5368675240074126, "grad_norm": 0.953125, "learning_rate": 0.0002407344309997238, "loss": 4.7457, "mean_token_accuracy": 0.24085484445095062, "num_tokens": 110052861.0, "step": 49300 }, { "entropy": 5.305135011672974, "epoch": 5.537429100915371, "grad_norm": 1.1171875, "learning_rate": 0.00024069475113581014, "loss": 4.8111, "mean_token_accuracy": 0.23482576310634612, "num_tokens": 110064974.0, "step": 49305 }, { "entropy": 5.304819822311401, "epoch": 5.537990677823328, "grad_norm": 1.0078125, "learning_rate": 0.00024065507236418888, "loss": 4.7897, "mean_token_accuracy": 0.24035324454307555, "num_tokens": 110076587.0, "step": 49310 }, { "entropy": 5.440578126907349, "epoch": 5.538552254731285, "grad_norm": 0.97265625, "learning_rate": 0.00024061539468612348, "loss": 4.9047, "mean_token_accuracy": 0.23179208636283874, "num_tokens": 110089036.0, "step": 49315 }, { "entropy": 5.457334041595459, "epoch": 5.539113831639243, "grad_norm": 1.0625, "learning_rate": 0.00024057571810287722, "loss": 4.9738, "mean_token_accuracy": 0.23648951053619385, "num_tokens": 110100253.0, "step": 49320 }, { "entropy": 5.351904249191284, "epoch": 5.5396754085472, "grad_norm": 1.015625, "learning_rate": 0.00024053604261571338, "loss": 4.9246, "mean_token_accuracy": 0.22847194969654083, "num_tokens": 110112567.0, "step": 49325 }, { "entropy": 5.373964023590088, "epoch": 5.540236985455158, "grad_norm": 0.984375, "learning_rate": 0.00024049636822589537, "loss": 4.8452, "mean_token_accuracy": 0.2392500653862953, "num_tokens": 110123623.0, "step": 49330 }, { "entropy": 5.41777720451355, "epoch": 5.540798562363116, "grad_norm": 1.0703125, "learning_rate": 0.0002404566949346864, "loss": 4.9118, "mean_token_accuracy": 0.23097027093172073, "num_tokens": 110134367.0, "step": 49335 }, { "entropy": 5.315137720108032, "epoch": 5.541360139271073, "grad_norm": 1.0703125, "learning_rate": 0.0002404170227433497, "loss": 4.7895, "mean_token_accuracy": 0.23755075335502623, "num_tokens": 110144305.0, "step": 49340 }, { "entropy": 5.420220565795899, "epoch": 5.541921716179031, "grad_norm": 0.98046875, "learning_rate": 0.00024037735165314834, "loss": 4.9449, "mean_token_accuracy": 0.22901684939861297, "num_tokens": 110155682.0, "step": 49345 }, { "entropy": 5.348816633224487, "epoch": 5.542483293086988, "grad_norm": 1.078125, "learning_rate": 0.00024033768166534553, "loss": 4.8961, "mean_token_accuracy": 0.23065080493688583, "num_tokens": 110166175.0, "step": 49350 }, { "entropy": 5.297728729248047, "epoch": 5.5430448699949455, "grad_norm": 1.125, "learning_rate": 0.00024029801278120438, "loss": 4.8349, "mean_token_accuracy": 0.2380100294947624, "num_tokens": 110175930.0, "step": 49355 }, { "entropy": 5.213327693939209, "epoch": 5.543606446902904, "grad_norm": 0.9765625, "learning_rate": 0.0002402583450019879, "loss": 4.6717, "mean_token_accuracy": 0.24822961837053298, "num_tokens": 110187093.0, "step": 49360 }, { "entropy": 5.330848264694214, "epoch": 5.544168023810861, "grad_norm": 1.03125, "learning_rate": 0.00024021867832895927, "loss": 4.8685, "mean_token_accuracy": 0.2269832357764244, "num_tokens": 110197339.0, "step": 49365 }, { "entropy": 5.3579676151275635, "epoch": 5.544729600718819, "grad_norm": 1.1015625, "learning_rate": 0.0002401790127633814, "loss": 4.8456, "mean_token_accuracy": 0.22706105411052704, "num_tokens": 110207179.0, "step": 49370 }, { "entropy": 5.35638108253479, "epoch": 5.545291177626776, "grad_norm": 0.953125, "learning_rate": 0.00024013934830651728, "loss": 4.787, "mean_token_accuracy": 0.2369152694940567, "num_tokens": 110218150.0, "step": 49375 }, { "entropy": 5.454430007934571, "epoch": 5.545852754534733, "grad_norm": 1.0234375, "learning_rate": 0.00024009968495962986, "loss": 4.9254, "mean_token_accuracy": 0.23092624098062514, "num_tokens": 110230454.0, "step": 49380 }, { "entropy": 5.290852832794189, "epoch": 5.546414331442691, "grad_norm": 1.109375, "learning_rate": 0.00024006002272398199, "loss": 4.7643, "mean_token_accuracy": 0.2394581601023674, "num_tokens": 110241587.0, "step": 49385 }, { "entropy": 5.34937744140625, "epoch": 5.546975908350649, "grad_norm": 1.09375, "learning_rate": 0.0002400203616008365, "loss": 4.8877, "mean_token_accuracy": 0.2328889861702919, "num_tokens": 110253858.0, "step": 49390 }, { "entropy": 5.266680002212524, "epoch": 5.547537485258606, "grad_norm": 1.03125, "learning_rate": 0.0002399807015914563, "loss": 4.6992, "mean_token_accuracy": 0.24325504004955292, "num_tokens": 110265764.0, "step": 49395 }, { "entropy": 5.3679900646209715, "epoch": 5.548099062166564, "grad_norm": 1.03125, "learning_rate": 0.0002399410426971041, "loss": 4.8452, "mean_token_accuracy": 0.23989685326814653, "num_tokens": 110277279.0, "step": 49400 }, { "entropy": 5.283869886398316, "epoch": 5.548660639074521, "grad_norm": 1.078125, "learning_rate": 0.00023990138491904273, "loss": 4.7592, "mean_token_accuracy": 0.24054586589336396, "num_tokens": 110288509.0, "step": 49405 }, { "entropy": 5.360441446304321, "epoch": 5.5492222159824784, "grad_norm": 1.0078125, "learning_rate": 0.00023986172825853492, "loss": 4.8718, "mean_token_accuracy": 0.23751518577337266, "num_tokens": 110300678.0, "step": 49410 }, { "entropy": 5.323452806472778, "epoch": 5.5497837928904366, "grad_norm": 0.90625, "learning_rate": 0.00023982207271684326, "loss": 4.8255, "mean_token_accuracy": 0.23554371744394303, "num_tokens": 110312785.0, "step": 49415 }, { "entropy": 5.316436672210694, "epoch": 5.550345369798394, "grad_norm": 1.0546875, "learning_rate": 0.0002397824182952305, "loss": 4.8204, "mean_token_accuracy": 0.24469601809978486, "num_tokens": 110324706.0, "step": 49420 }, { "entropy": 5.34657883644104, "epoch": 5.550906946706352, "grad_norm": 1.0703125, "learning_rate": 0.00023974276499495918, "loss": 4.824, "mean_token_accuracy": 0.2339731991291046, "num_tokens": 110335650.0, "step": 49425 }, { "entropy": 5.376606273651123, "epoch": 5.551468523614309, "grad_norm": 1.140625, "learning_rate": 0.00023970311281729185, "loss": 4.8698, "mean_token_accuracy": 0.23344421833753587, "num_tokens": 110346416.0, "step": 49430 }, { "entropy": 5.226602697372437, "epoch": 5.552030100522266, "grad_norm": 1.0390625, "learning_rate": 0.000239663461763491, "loss": 4.6335, "mean_token_accuracy": 0.2556192547082901, "num_tokens": 110356681.0, "step": 49435 }, { "entropy": 5.278290033340454, "epoch": 5.552591677430224, "grad_norm": 1.0078125, "learning_rate": 0.0002396238118348194, "loss": 4.7066, "mean_token_accuracy": 0.2411363571882248, "num_tokens": 110368865.0, "step": 49440 }, { "entropy": 5.273737192153931, "epoch": 5.553153254338182, "grad_norm": 0.9765625, "learning_rate": 0.00023958416303253933, "loss": 4.7184, "mean_token_accuracy": 0.23952889293432236, "num_tokens": 110378960.0, "step": 49445 }, { "entropy": 5.366466760635376, "epoch": 5.553714831246139, "grad_norm": 0.94140625, "learning_rate": 0.00023954451535791323, "loss": 4.8604, "mean_token_accuracy": 0.23172518014907836, "num_tokens": 110390006.0, "step": 49450 }, { "entropy": 5.256264543533325, "epoch": 5.554276408154097, "grad_norm": 0.97265625, "learning_rate": 0.00023950486881220353, "loss": 4.7491, "mean_token_accuracy": 0.23354048728942872, "num_tokens": 110401789.0, "step": 49455 }, { "entropy": 5.2916006565094, "epoch": 5.554837985062054, "grad_norm": 1.0234375, "learning_rate": 0.00023946522339667254, "loss": 4.7232, "mean_token_accuracy": 0.24264327436685562, "num_tokens": 110412469.0, "step": 49460 }, { "entropy": 5.331110191345215, "epoch": 5.555399561970011, "grad_norm": 1.03125, "learning_rate": 0.0002394255791125826, "loss": 4.8544, "mean_token_accuracy": 0.2410809651017189, "num_tokens": 110423791.0, "step": 49465 }, { "entropy": 5.30524697303772, "epoch": 5.5559611388779695, "grad_norm": 0.984375, "learning_rate": 0.000239385935961196, "loss": 4.8075, "mean_token_accuracy": 0.23374055325984955, "num_tokens": 110434393.0, "step": 49470 }, { "entropy": 5.380861711502075, "epoch": 5.556522715785927, "grad_norm": 1.0078125, "learning_rate": 0.00023934629394377512, "loss": 4.8993, "mean_token_accuracy": 0.23241067230701445, "num_tokens": 110445207.0, "step": 49475 }, { "entropy": 5.431865501403808, "epoch": 5.557084292693885, "grad_norm": 1.0, "learning_rate": 0.000239306653061582, "loss": 4.789, "mean_token_accuracy": 0.24713585674762725, "num_tokens": 110457090.0, "step": 49480 }, { "entropy": 5.361879587173462, "epoch": 5.557645869601842, "grad_norm": 1.0859375, "learning_rate": 0.00023926701331587885, "loss": 4.8535, "mean_token_accuracy": 0.23658012002706527, "num_tokens": 110468527.0, "step": 49485 }, { "entropy": 5.314646768569946, "epoch": 5.558207446509799, "grad_norm": 1.1328125, "learning_rate": 0.00023922737470792794, "loss": 4.7816, "mean_token_accuracy": 0.24477563798427582, "num_tokens": 110478449.0, "step": 49490 }, { "entropy": 5.346352291107178, "epoch": 5.558769023417757, "grad_norm": 1.0859375, "learning_rate": 0.0002391877372389913, "loss": 4.8714, "mean_token_accuracy": 0.24028194099664688, "num_tokens": 110488126.0, "step": 49495 }, { "entropy": 5.2712665557861325, "epoch": 5.559330600325715, "grad_norm": 1.078125, "learning_rate": 0.00023914810091033096, "loss": 4.7503, "mean_token_accuracy": 0.2486584559082985, "num_tokens": 110499593.0, "step": 49500 }, { "entropy": 5.310043478012085, "epoch": 5.559892177233672, "grad_norm": 1.0, "learning_rate": 0.0002391084657232089, "loss": 4.8094, "mean_token_accuracy": 0.23556599617004395, "num_tokens": 110511612.0, "step": 49505 }, { "entropy": 5.393037557601929, "epoch": 5.56045375414163, "grad_norm": 1.0546875, "learning_rate": 0.00023906883167888727, "loss": 4.8702, "mean_token_accuracy": 0.2298495277762413, "num_tokens": 110524040.0, "step": 49510 }, { "entropy": 5.364755535125733, "epoch": 5.561015331049587, "grad_norm": 0.98828125, "learning_rate": 0.000239029198778628, "loss": 4.9023, "mean_token_accuracy": 0.22401278614997863, "num_tokens": 110535475.0, "step": 49515 }, { "entropy": 5.34985842704773, "epoch": 5.561576907957544, "grad_norm": 0.984375, "learning_rate": 0.000238989567023693, "loss": 4.838, "mean_token_accuracy": 0.23736632019281387, "num_tokens": 110547149.0, "step": 49520 }, { "entropy": 5.38202748298645, "epoch": 5.562138484865502, "grad_norm": 1.046875, "learning_rate": 0.00023894993641534418, "loss": 4.8423, "mean_token_accuracy": 0.23934174478054046, "num_tokens": 110559378.0, "step": 49525 }, { "entropy": 5.310741567611695, "epoch": 5.56270006177346, "grad_norm": 1.125, "learning_rate": 0.00023891030695484333, "loss": 4.7991, "mean_token_accuracy": 0.243086838722229, "num_tokens": 110570537.0, "step": 49530 }, { "entropy": 5.311999225616455, "epoch": 5.563261638681418, "grad_norm": 0.98828125, "learning_rate": 0.0002388706786434523, "loss": 4.7882, "mean_token_accuracy": 0.23863174617290497, "num_tokens": 110583073.0, "step": 49535 }, { "entropy": 5.26105809211731, "epoch": 5.563823215589375, "grad_norm": 1.015625, "learning_rate": 0.0002388310514824329, "loss": 4.74, "mean_token_accuracy": 0.24237012416124343, "num_tokens": 110594711.0, "step": 49540 }, { "entropy": 5.316193056106568, "epoch": 5.564384792497332, "grad_norm": 0.98828125, "learning_rate": 0.00023879142547304677, "loss": 4.8258, "mean_token_accuracy": 0.23756435215473176, "num_tokens": 110605187.0, "step": 49545 }, { "entropy": 5.310779666900634, "epoch": 5.56494636940529, "grad_norm": 1.0546875, "learning_rate": 0.00023875180061655576, "loss": 4.8215, "mean_token_accuracy": 0.22946882396936416, "num_tokens": 110615623.0, "step": 49550 }, { "entropy": 5.249540567398071, "epoch": 5.5655079463132475, "grad_norm": 1.0703125, "learning_rate": 0.00023871217691422147, "loss": 4.7478, "mean_token_accuracy": 0.24620334506034852, "num_tokens": 110627476.0, "step": 49555 }, { "entropy": 5.286901426315308, "epoch": 5.566069523221206, "grad_norm": 1.0546875, "learning_rate": 0.00023867255436730555, "loss": 4.8115, "mean_token_accuracy": 0.23468062281608582, "num_tokens": 110640016.0, "step": 49560 }, { "entropy": 5.350117015838623, "epoch": 5.566631100129163, "grad_norm": 1.1015625, "learning_rate": 0.0002386329329770696, "loss": 4.7647, "mean_token_accuracy": 0.24277010709047317, "num_tokens": 110650577.0, "step": 49565 }, { "entropy": 5.399088191986084, "epoch": 5.56719267703712, "grad_norm": 1.3828125, "learning_rate": 0.00023859331274477514, "loss": 4.8533, "mean_token_accuracy": 0.2401089683175087, "num_tokens": 110661657.0, "step": 49570 }, { "entropy": 5.301662015914917, "epoch": 5.567754253945077, "grad_norm": 0.97265625, "learning_rate": 0.00023855369367168378, "loss": 4.7828, "mean_token_accuracy": 0.24306727796792985, "num_tokens": 110673116.0, "step": 49575 }, { "entropy": 5.355267763137817, "epoch": 5.568315830853035, "grad_norm": 1.0703125, "learning_rate": 0.00023851407575905682, "loss": 4.8789, "mean_token_accuracy": 0.23933662921190263, "num_tokens": 110683422.0, "step": 49580 }, { "entropy": 5.278424024581909, "epoch": 5.568877407760993, "grad_norm": 1.125, "learning_rate": 0.0002384744590081559, "loss": 4.7628, "mean_token_accuracy": 0.24453894793987274, "num_tokens": 110693407.0, "step": 49585 }, { "entropy": 5.343217849731445, "epoch": 5.569438984668951, "grad_norm": 1.0625, "learning_rate": 0.0002384348434202424, "loss": 4.8395, "mean_token_accuracy": 0.2288582593202591, "num_tokens": 110704105.0, "step": 49590 }, { "entropy": 5.304334306716919, "epoch": 5.570000561576908, "grad_norm": 1.078125, "learning_rate": 0.00023839522899657767, "loss": 4.8129, "mean_token_accuracy": 0.2395038440823555, "num_tokens": 110714745.0, "step": 49595 }, { "entropy": 5.246079683303833, "epoch": 5.570562138484865, "grad_norm": 1.1015625, "learning_rate": 0.00023835561573842302, "loss": 4.6813, "mean_token_accuracy": 0.2532370090484619, "num_tokens": 110725955.0, "step": 49600 }, { "entropy": 5.346138668060303, "epoch": 5.571123715392823, "grad_norm": 1.0703125, "learning_rate": 0.0002383160036470398, "loss": 4.9154, "mean_token_accuracy": 0.232114277780056, "num_tokens": 110737023.0, "step": 49605 }, { "entropy": 5.343060302734375, "epoch": 5.5716852923007805, "grad_norm": 1.03125, "learning_rate": 0.00023827639272368923, "loss": 4.7834, "mean_token_accuracy": 0.2304174691438675, "num_tokens": 110747558.0, "step": 49610 }, { "entropy": 5.318275213241577, "epoch": 5.572246869208739, "grad_norm": 1.0546875, "learning_rate": 0.00023823678296963253, "loss": 4.6949, "mean_token_accuracy": 0.2500362530350685, "num_tokens": 110757529.0, "step": 49615 }, { "entropy": 5.292996025085449, "epoch": 5.572808446116696, "grad_norm": 0.99609375, "learning_rate": 0.00023819717438613097, "loss": 4.926, "mean_token_accuracy": 0.23145831823349, "num_tokens": 110770180.0, "step": 49620 }, { "entropy": 5.3808411121368405, "epoch": 5.573370023024653, "grad_norm": 0.97265625, "learning_rate": 0.00023815756697444568, "loss": 4.9052, "mean_token_accuracy": 0.2330790191888809, "num_tokens": 110781845.0, "step": 49625 }, { "entropy": 5.35908522605896, "epoch": 5.573931599932611, "grad_norm": 1.046875, "learning_rate": 0.00023811796073583774, "loss": 4.7825, "mean_token_accuracy": 0.2351295009255409, "num_tokens": 110792862.0, "step": 49630 }, { "entropy": 5.299463701248169, "epoch": 5.574493176840568, "grad_norm": 1.0234375, "learning_rate": 0.00023807835567156815, "loss": 4.7666, "mean_token_accuracy": 0.24024985283613204, "num_tokens": 110803423.0, "step": 49635 }, { "entropy": 5.328565692901611, "epoch": 5.5750547537485255, "grad_norm": 0.9921875, "learning_rate": 0.00023803875178289813, "loss": 4.8092, "mean_token_accuracy": 0.2388436421751976, "num_tokens": 110814785.0, "step": 49640 }, { "entropy": 5.2144591331481935, "epoch": 5.575616330656484, "grad_norm": 0.99609375, "learning_rate": 0.00023799914907108856, "loss": 4.6967, "mean_token_accuracy": 0.24436908960342407, "num_tokens": 110827384.0, "step": 49645 }, { "entropy": 5.288430023193359, "epoch": 5.576177907564441, "grad_norm": 0.99609375, "learning_rate": 0.00023795954753740034, "loss": 4.7523, "mean_token_accuracy": 0.23878295123577117, "num_tokens": 110837819.0, "step": 49650 }, { "entropy": 5.2407067775726315, "epoch": 5.576739484472398, "grad_norm": 1.0234375, "learning_rate": 0.00023791994718309455, "loss": 4.7346, "mean_token_accuracy": 0.24089981317520143, "num_tokens": 110849302.0, "step": 49655 }, { "entropy": 5.265918159484864, "epoch": 5.577301061380356, "grad_norm": 1.0625, "learning_rate": 0.00023788034800943203, "loss": 4.7016, "mean_token_accuracy": 0.24372402131557463, "num_tokens": 110860009.0, "step": 49660 }, { "entropy": 5.255563497543335, "epoch": 5.577862638288313, "grad_norm": 1.0703125, "learning_rate": 0.00023784075001767369, "loss": 4.7296, "mean_token_accuracy": 0.24097576290369033, "num_tokens": 110870232.0, "step": 49665 }, { "entropy": 5.332714653015136, "epoch": 5.5784242151962715, "grad_norm": 0.91796875, "learning_rate": 0.00023780115320908024, "loss": 4.825, "mean_token_accuracy": 0.23312304466962813, "num_tokens": 110882339.0, "step": 49670 }, { "entropy": 5.206681442260742, "epoch": 5.578985792104229, "grad_norm": 1.015625, "learning_rate": 0.00023776155758491253, "loss": 4.6094, "mean_token_accuracy": 0.26004977375268934, "num_tokens": 110893190.0, "step": 49675 }, { "entropy": 5.310211515426635, "epoch": 5.579547369012186, "grad_norm": 1.0390625, "learning_rate": 0.0002377219631464312, "loss": 4.861, "mean_token_accuracy": 0.2340739443898201, "num_tokens": 110903353.0, "step": 49680 }, { "entropy": 5.318776607513428, "epoch": 5.580108945920144, "grad_norm": 1.078125, "learning_rate": 0.000237682369894897, "loss": 4.6762, "mean_token_accuracy": 0.2555518507957458, "num_tokens": 110913434.0, "step": 49685 }, { "entropy": 5.406667041778564, "epoch": 5.580670522828101, "grad_norm": 1.1015625, "learning_rate": 0.00023764277783157068, "loss": 4.862, "mean_token_accuracy": 0.23687906414270402, "num_tokens": 110924313.0, "step": 49690 }, { "entropy": 5.299753332138062, "epoch": 5.5812320997360585, "grad_norm": 1.03125, "learning_rate": 0.00023760318695771282, "loss": 4.7646, "mean_token_accuracy": 0.23626088947057725, "num_tokens": 110935080.0, "step": 49695 }, { "entropy": 5.346971273422241, "epoch": 5.581793676644017, "grad_norm": 1.1015625, "learning_rate": 0.00023756359727458397, "loss": 4.8287, "mean_token_accuracy": 0.23872870355844497, "num_tokens": 110945759.0, "step": 49700 }, { "entropy": 5.359305000305175, "epoch": 5.582355253551974, "grad_norm": 1.03125, "learning_rate": 0.0002375240087834447, "loss": 4.8975, "mean_token_accuracy": 0.2349878132343292, "num_tokens": 110957366.0, "step": 49705 }, { "entropy": 5.3496050357818605, "epoch": 5.582916830459931, "grad_norm": 1.1015625, "learning_rate": 0.00023748442148555554, "loss": 4.7661, "mean_token_accuracy": 0.24256251603364945, "num_tokens": 110968802.0, "step": 49710 }, { "entropy": 5.3203315258026125, "epoch": 5.583478407367889, "grad_norm": 1.1328125, "learning_rate": 0.00023744483538217694, "loss": 4.7713, "mean_token_accuracy": 0.24997451901435852, "num_tokens": 110979149.0, "step": 49715 }, { "entropy": 5.279441499710083, "epoch": 5.584039984275846, "grad_norm": 0.99609375, "learning_rate": 0.00023740525047456936, "loss": 4.8108, "mean_token_accuracy": 0.23515270352363588, "num_tokens": 110989763.0, "step": 49720 }, { "entropy": 5.269330215454102, "epoch": 5.5846015611838045, "grad_norm": 1.1328125, "learning_rate": 0.00023736566676399307, "loss": 4.7508, "mean_token_accuracy": 0.24597535878419877, "num_tokens": 111002725.0, "step": 49725 }, { "entropy": 5.372385931015015, "epoch": 5.585163138091762, "grad_norm": 1.1328125, "learning_rate": 0.0002373260842517086, "loss": 4.8744, "mean_token_accuracy": 0.23326727598905564, "num_tokens": 111012594.0, "step": 49730 }, { "entropy": 5.329184198379517, "epoch": 5.585724714999719, "grad_norm": 1.046875, "learning_rate": 0.0002372865029389763, "loss": 4.7381, "mean_token_accuracy": 0.23379893004894256, "num_tokens": 111023715.0, "step": 49735 }, { "entropy": 5.3332297801971436, "epoch": 5.586286291907677, "grad_norm": 1.0859375, "learning_rate": 0.00023724692282705635, "loss": 4.8656, "mean_token_accuracy": 0.23298469483852385, "num_tokens": 111033483.0, "step": 49740 }, { "entropy": 5.289475727081299, "epoch": 5.586847868815634, "grad_norm": 1.140625, "learning_rate": 0.000237207343917209, "loss": 4.8432, "mean_token_accuracy": 0.2330700382590294, "num_tokens": 111043947.0, "step": 49745 }, { "entropy": 5.348280191421509, "epoch": 5.587409445723592, "grad_norm": 0.9921875, "learning_rate": 0.00023716776621069446, "loss": 4.7921, "mean_token_accuracy": 0.24430675506591798, "num_tokens": 111054846.0, "step": 49750 }, { "entropy": 5.351887893676758, "epoch": 5.5879710226315495, "grad_norm": 1.0703125, "learning_rate": 0.0002371281897087729, "loss": 4.7697, "mean_token_accuracy": 0.24037100970745087, "num_tokens": 111065629.0, "step": 49755 }, { "entropy": 5.3933525562286375, "epoch": 5.588532599539507, "grad_norm": 1.0625, "learning_rate": 0.00023708861441270452, "loss": 4.8979, "mean_token_accuracy": 0.2298197105526924, "num_tokens": 111075948.0, "step": 49760 }, { "entropy": 5.3321852684021, "epoch": 5.589094176447465, "grad_norm": 1.0234375, "learning_rate": 0.00023704904032374936, "loss": 4.7974, "mean_token_accuracy": 0.23858806639909744, "num_tokens": 111087202.0, "step": 49765 }, { "entropy": 5.3726685523986815, "epoch": 5.589655753355422, "grad_norm": 1.0234375, "learning_rate": 0.00023700946744316747, "loss": 4.7974, "mean_token_accuracy": 0.23890706151723862, "num_tokens": 111098362.0, "step": 49770 }, { "entropy": 5.29086651802063, "epoch": 5.590217330263379, "grad_norm": 1.03125, "learning_rate": 0.0002369698957722189, "loss": 4.75, "mean_token_accuracy": 0.24195538461208344, "num_tokens": 111110285.0, "step": 49775 }, { "entropy": 5.353623580932617, "epoch": 5.590778907171337, "grad_norm": 1.0703125, "learning_rate": 0.00023693032531216352, "loss": 4.8571, "mean_token_accuracy": 0.2439577117562294, "num_tokens": 111120778.0, "step": 49780 }, { "entropy": 5.283048677444458, "epoch": 5.591340484079295, "grad_norm": 1.0, "learning_rate": 0.00023689075606426143, "loss": 4.7259, "mean_token_accuracy": 0.24740778058767318, "num_tokens": 111133448.0, "step": 49785 }, { "entropy": 5.41764087677002, "epoch": 5.591902060987252, "grad_norm": 1.03125, "learning_rate": 0.0002368511880297724, "loss": 4.9157, "mean_token_accuracy": 0.2281196415424347, "num_tokens": 111144707.0, "step": 49790 }, { "entropy": 5.267609071731568, "epoch": 5.59246363789521, "grad_norm": 1.1015625, "learning_rate": 0.00023681162120995624, "loss": 4.7772, "mean_token_accuracy": 0.23908395916223527, "num_tokens": 111155314.0, "step": 49795 }, { "entropy": 5.264981842041015, "epoch": 5.593025214803167, "grad_norm": 1.0078125, "learning_rate": 0.00023677205560607294, "loss": 4.8087, "mean_token_accuracy": 0.23505190312862395, "num_tokens": 111166642.0, "step": 49800 }, { "entropy": 5.286869096755981, "epoch": 5.593586791711125, "grad_norm": 1.0625, "learning_rate": 0.00023673249121938228, "loss": 4.7395, "mean_token_accuracy": 0.23502422273159027, "num_tokens": 111176970.0, "step": 49805 }, { "entropy": 5.279078102111816, "epoch": 5.5941483686190825, "grad_norm": 0.96875, "learning_rate": 0.00023669292805114395, "loss": 4.76, "mean_token_accuracy": 0.24023348242044448, "num_tokens": 111189126.0, "step": 49810 }, { "entropy": 5.221080636978149, "epoch": 5.59470994552704, "grad_norm": 1.0546875, "learning_rate": 0.00023665336610261762, "loss": 4.6639, "mean_token_accuracy": 0.24819029718637467, "num_tokens": 111199767.0, "step": 49815 }, { "entropy": 5.35191068649292, "epoch": 5.595271522434998, "grad_norm": 1.046875, "learning_rate": 0.000236613805375063, "loss": 4.9072, "mean_token_accuracy": 0.23030041754245759, "num_tokens": 111212117.0, "step": 49820 }, { "entropy": 5.299631404876709, "epoch": 5.595833099342955, "grad_norm": 0.98828125, "learning_rate": 0.0002365742458697397, "loss": 4.7538, "mean_token_accuracy": 0.23554390370845796, "num_tokens": 111223035.0, "step": 49825 }, { "entropy": 5.290033054351807, "epoch": 5.596394676250912, "grad_norm": 1.0078125, "learning_rate": 0.00023653468758790726, "loss": 4.7483, "mean_token_accuracy": 0.24961043149232864, "num_tokens": 111234858.0, "step": 49830 }, { "entropy": 5.261278820037842, "epoch": 5.59695625315887, "grad_norm": 1.0390625, "learning_rate": 0.00023649513053082528, "loss": 4.7414, "mean_token_accuracy": 0.2457188531756401, "num_tokens": 111246429.0, "step": 49835 }, { "entropy": 5.363491201400757, "epoch": 5.597517830066828, "grad_norm": 1.1171875, "learning_rate": 0.0002364555746997533, "loss": 4.846, "mean_token_accuracy": 0.2318970575928688, "num_tokens": 111257575.0, "step": 49840 }, { "entropy": 5.366553401947021, "epoch": 5.598079406974785, "grad_norm": 1.0625, "learning_rate": 0.00023641602009595087, "loss": 4.8198, "mean_token_accuracy": 0.23420167863368987, "num_tokens": 111267542.0, "step": 49845 }, { "entropy": 5.2887451171875, "epoch": 5.598640983882743, "grad_norm": 1.046875, "learning_rate": 0.0002363764667206772, "loss": 4.7621, "mean_token_accuracy": 0.24240659326314926, "num_tokens": 111277791.0, "step": 49850 }, { "entropy": 5.342336416244507, "epoch": 5.5992025607907, "grad_norm": 1.0703125, "learning_rate": 0.00023633691457519191, "loss": 4.8489, "mean_token_accuracy": 0.24252943992614745, "num_tokens": 111288997.0, "step": 49855 }, { "entropy": 5.384472608566284, "epoch": 5.599764137698658, "grad_norm": 1.046875, "learning_rate": 0.00023629736366075416, "loss": 4.8497, "mean_token_accuracy": 0.23190672993659972, "num_tokens": 111299350.0, "step": 49860 }, { "entropy": 5.316676950454712, "epoch": 5.600325714606615, "grad_norm": 1.0390625, "learning_rate": 0.00023625781397862333, "loss": 4.7756, "mean_token_accuracy": 0.2417615070939064, "num_tokens": 111310355.0, "step": 49865 }, { "entropy": 5.345535469055176, "epoch": 5.600887291514573, "grad_norm": 1.0390625, "learning_rate": 0.00023621826553005883, "loss": 4.7853, "mean_token_accuracy": 0.2321890264749527, "num_tokens": 111321822.0, "step": 49870 }, { "entropy": 5.209042978286743, "epoch": 5.601448868422531, "grad_norm": 1.1015625, "learning_rate": 0.00023617871831631976, "loss": 4.6765, "mean_token_accuracy": 0.25015122443437576, "num_tokens": 111333753.0, "step": 49875 }, { "entropy": 5.262098598480224, "epoch": 5.602010445330488, "grad_norm": 1.0859375, "learning_rate": 0.00023613917233866538, "loss": 4.8069, "mean_token_accuracy": 0.23463741689920425, "num_tokens": 111343933.0, "step": 49880 }, { "entropy": 5.243875789642334, "epoch": 5.602572022238445, "grad_norm": 1.078125, "learning_rate": 0.0002360996275983548, "loss": 4.7002, "mean_token_accuracy": 0.24533117711544036, "num_tokens": 111353829.0, "step": 49885 }, { "entropy": 5.332877588272095, "epoch": 5.603133599146403, "grad_norm": 1.1328125, "learning_rate": 0.0002360600840966472, "loss": 4.881, "mean_token_accuracy": 0.2287111446261406, "num_tokens": 111365973.0, "step": 49890 }, { "entropy": 5.333840417861938, "epoch": 5.6036951760543605, "grad_norm": 0.99609375, "learning_rate": 0.0002360205418348016, "loss": 4.8127, "mean_token_accuracy": 0.24085693061351776, "num_tokens": 111377753.0, "step": 49895 }, { "entropy": 5.383044958114624, "epoch": 5.604256752962318, "grad_norm": 0.9765625, "learning_rate": 0.00023598100081407704, "loss": 4.9222, "mean_token_accuracy": 0.2252856269478798, "num_tokens": 111389156.0, "step": 49900 }, { "entropy": 5.32713475227356, "epoch": 5.604818329870276, "grad_norm": 1.0390625, "learning_rate": 0.00023594146103573255, "loss": 4.7892, "mean_token_accuracy": 0.23620528131723403, "num_tokens": 111400387.0, "step": 49905 }, { "entropy": 5.241427898406982, "epoch": 5.605379906778233, "grad_norm": 1.03125, "learning_rate": 0.0002359019225010271, "loss": 4.7162, "mean_token_accuracy": 0.24929002225399016, "num_tokens": 111410879.0, "step": 49910 }, { "entropy": 5.328026485443115, "epoch": 5.605941483686191, "grad_norm": 1.0390625, "learning_rate": 0.0002358623852112196, "loss": 4.8232, "mean_token_accuracy": 0.24401530176401137, "num_tokens": 111421463.0, "step": 49915 }, { "entropy": 5.314103507995606, "epoch": 5.606503060594148, "grad_norm": 0.9921875, "learning_rate": 0.00023582284916756898, "loss": 4.7758, "mean_token_accuracy": 0.24582781940698623, "num_tokens": 111432434.0, "step": 49920 }, { "entropy": 5.300924253463745, "epoch": 5.607064637502106, "grad_norm": 1.0703125, "learning_rate": 0.000235783314371334, "loss": 4.823, "mean_token_accuracy": 0.23440522700548172, "num_tokens": 111443957.0, "step": 49925 }, { "entropy": 5.250681591033936, "epoch": 5.607626214410064, "grad_norm": 0.8828125, "learning_rate": 0.00023574378082377351, "loss": 4.7167, "mean_token_accuracy": 0.24513275921344757, "num_tokens": 111456359.0, "step": 49930 }, { "entropy": 5.331561470031739, "epoch": 5.608187791318021, "grad_norm": 1.0, "learning_rate": 0.0002357042485261463, "loss": 4.807, "mean_token_accuracy": 0.24165308624505996, "num_tokens": 111467546.0, "step": 49935 }, { "entropy": 5.306063461303711, "epoch": 5.608749368225979, "grad_norm": 1.0546875, "learning_rate": 0.0002356647174797109, "loss": 4.8456, "mean_token_accuracy": 0.2352576047182083, "num_tokens": 111478151.0, "step": 49940 }, { "entropy": 5.302238845825196, "epoch": 5.609310945133936, "grad_norm": 1.0390625, "learning_rate": 0.00023562518768572628, "loss": 4.8086, "mean_token_accuracy": 0.2396385118365288, "num_tokens": 111488553.0, "step": 49945 }, { "entropy": 5.334729242324829, "epoch": 5.6098725220418935, "grad_norm": 1.1171875, "learning_rate": 0.00023558565914545094, "loss": 4.8297, "mean_token_accuracy": 0.23153970241546631, "num_tokens": 111500406.0, "step": 49950 }, { "entropy": 5.305220651626587, "epoch": 5.610434098949852, "grad_norm": 1.0546875, "learning_rate": 0.00023554613186014352, "loss": 4.7773, "mean_token_accuracy": 0.241000697016716, "num_tokens": 111512512.0, "step": 49955 }, { "entropy": 5.351428747177124, "epoch": 5.610995675857809, "grad_norm": 1.0859375, "learning_rate": 0.00023550660583106253, "loss": 4.8405, "mean_token_accuracy": 0.23227994441986083, "num_tokens": 111523732.0, "step": 49960 }, { "entropy": 5.228313302993774, "epoch": 5.611557252765766, "grad_norm": 1.1171875, "learning_rate": 0.00023546708105946657, "loss": 4.7466, "mean_token_accuracy": 0.24349550753831864, "num_tokens": 111534531.0, "step": 49965 }, { "entropy": 5.369480228424072, "epoch": 5.612118829673724, "grad_norm": 1.0703125, "learning_rate": 0.00023542755754661404, "loss": 4.8637, "mean_token_accuracy": 0.22384159564971923, "num_tokens": 111545912.0, "step": 49970 }, { "entropy": 5.304588508605957, "epoch": 5.612680406581681, "grad_norm": 0.984375, "learning_rate": 0.0002353880352937634, "loss": 4.7526, "mean_token_accuracy": 0.24084495455026628, "num_tokens": 111557720.0, "step": 49975 }, { "entropy": 5.258032751083374, "epoch": 5.6132419834896385, "grad_norm": 1.171875, "learning_rate": 0.00023534851430217314, "loss": 4.7152, "mean_token_accuracy": 0.24197059869766235, "num_tokens": 111568495.0, "step": 49980 }, { "entropy": 5.23774733543396, "epoch": 5.613803560397597, "grad_norm": 1.0703125, "learning_rate": 0.00023530899457310157, "loss": 4.6964, "mean_token_accuracy": 0.24533956497907639, "num_tokens": 111578681.0, "step": 49985 }, { "entropy": 5.272009181976318, "epoch": 5.614365137305554, "grad_norm": 1.0, "learning_rate": 0.00023526947610780696, "loss": 4.8061, "mean_token_accuracy": 0.24793111830949782, "num_tokens": 111591130.0, "step": 49990 }, { "entropy": 5.218097591400147, "epoch": 5.614926714213512, "grad_norm": 1.0390625, "learning_rate": 0.00023522995890754768, "loss": 4.6691, "mean_token_accuracy": 0.2594942539930344, "num_tokens": 111602233.0, "step": 49995 }, { "entropy": 5.264907693862915, "epoch": 5.615488291121469, "grad_norm": 0.9375, "learning_rate": 0.0002351904429735819, "loss": 4.6755, "mean_token_accuracy": 0.2515743374824524, "num_tokens": 111613849.0, "step": 50000 }, { "entropy": 5.4169165134429935, "epoch": 5.616049868029426, "grad_norm": 1.046875, "learning_rate": 0.0002351509283071679, "loss": 4.926, "mean_token_accuracy": 0.23416833579540253, "num_tokens": 111625070.0, "step": 50005 }, { "entropy": 5.3235053539276125, "epoch": 5.6166114449373845, "grad_norm": 1.078125, "learning_rate": 0.0002351114149095636, "loss": 4.8233, "mean_token_accuracy": 0.2411249175667763, "num_tokens": 111635490.0, "step": 50010 }, { "entropy": 5.387363481521606, "epoch": 5.617173021845342, "grad_norm": 0.953125, "learning_rate": 0.00023507190278202755, "loss": 4.9299, "mean_token_accuracy": 0.234357587993145, "num_tokens": 111646985.0, "step": 50015 }, { "entropy": 5.332396793365478, "epoch": 5.617734598753299, "grad_norm": 1.046875, "learning_rate": 0.00023503239192581755, "loss": 4.7885, "mean_token_accuracy": 0.23604532927274705, "num_tokens": 111658013.0, "step": 50020 }, { "entropy": 5.394826650619507, "epoch": 5.618296175661257, "grad_norm": 0.94921875, "learning_rate": 0.0002349928823421917, "loss": 4.8511, "mean_token_accuracy": 0.22885941714048386, "num_tokens": 111668774.0, "step": 50025 }, { "entropy": 5.2444798946380615, "epoch": 5.618857752569214, "grad_norm": 1.0, "learning_rate": 0.00023495337403240795, "loss": 4.6475, "mean_token_accuracy": 0.2504767805337906, "num_tokens": 111679529.0, "step": 50030 }, { "entropy": 5.3151788234710695, "epoch": 5.6194193294771715, "grad_norm": 1.046875, "learning_rate": 0.00023491386699772432, "loss": 4.8302, "mean_token_accuracy": 0.23455745726823807, "num_tokens": 111689528.0, "step": 50035 }, { "entropy": 5.258044099807739, "epoch": 5.61998090638513, "grad_norm": 1.1875, "learning_rate": 0.0002348743612393987, "loss": 4.7468, "mean_token_accuracy": 0.23780842870473862, "num_tokens": 111700127.0, "step": 50040 }, { "entropy": 5.2800469398498535, "epoch": 5.620542483293087, "grad_norm": 0.99609375, "learning_rate": 0.00023483485675868899, "loss": 4.8104, "mean_token_accuracy": 0.23599256128072738, "num_tokens": 111711235.0, "step": 50045 }, { "entropy": 5.420039939880371, "epoch": 5.621104060201045, "grad_norm": 1.0, "learning_rate": 0.00023479535355685306, "loss": 4.8897, "mean_token_accuracy": 0.23612986803054808, "num_tokens": 111722815.0, "step": 50050 }, { "entropy": 5.369415426254273, "epoch": 5.621665637109002, "grad_norm": 1.0625, "learning_rate": 0.00023475585163514862, "loss": 4.8068, "mean_token_accuracy": 0.24198617190122604, "num_tokens": 111733690.0, "step": 50055 }, { "entropy": 5.258489894866943, "epoch": 5.622227214016959, "grad_norm": 1.1015625, "learning_rate": 0.0002347163509948335, "loss": 4.7559, "mean_token_accuracy": 0.24393816590309142, "num_tokens": 111744300.0, "step": 50060 }, { "entropy": 5.3482362747192385, "epoch": 5.6227887909249175, "grad_norm": 1.0078125, "learning_rate": 0.00023467685163716534, "loss": 4.8872, "mean_token_accuracy": 0.2332092985510826, "num_tokens": 111757526.0, "step": 50065 }, { "entropy": 5.428538131713867, "epoch": 5.623350367832875, "grad_norm": 1.0234375, "learning_rate": 0.00023463735356340194, "loss": 4.9478, "mean_token_accuracy": 0.22608986347913743, "num_tokens": 111769211.0, "step": 50070 }, { "entropy": 5.336868143081665, "epoch": 5.623911944740832, "grad_norm": 0.984375, "learning_rate": 0.00023459785677480078, "loss": 4.8098, "mean_token_accuracy": 0.23970758467912673, "num_tokens": 111780652.0, "step": 50075 }, { "entropy": 5.376889038085937, "epoch": 5.62447352164879, "grad_norm": 1.109375, "learning_rate": 0.0002345583612726196, "loss": 4.8831, "mean_token_accuracy": 0.23729144185781478, "num_tokens": 111791749.0, "step": 50080 }, { "entropy": 5.305047035217285, "epoch": 5.625035098556747, "grad_norm": 0.9921875, "learning_rate": 0.00023451886705811576, "loss": 4.8125, "mean_token_accuracy": 0.233553746342659, "num_tokens": 111802879.0, "step": 50085 }, { "entropy": 5.21832308769226, "epoch": 5.625596675464704, "grad_norm": 0.9765625, "learning_rate": 0.000234479374132547, "loss": 4.7827, "mean_token_accuracy": 0.23702092319726945, "num_tokens": 111813768.0, "step": 50090 }, { "entropy": 5.2972578525543215, "epoch": 5.6261582523726625, "grad_norm": 1.015625, "learning_rate": 0.00023443988249717063, "loss": 4.7897, "mean_token_accuracy": 0.23812369108200074, "num_tokens": 111824667.0, "step": 50095 }, { "entropy": 5.296841621398926, "epoch": 5.62671982928062, "grad_norm": 0.96484375, "learning_rate": 0.00023440039215324415, "loss": 4.7448, "mean_token_accuracy": 0.246409872174263, "num_tokens": 111835969.0, "step": 50100 }, { "entropy": 5.296240425109863, "epoch": 5.627281406188578, "grad_norm": 1.234375, "learning_rate": 0.00023436090310202497, "loss": 4.8965, "mean_token_accuracy": 0.22913775593042374, "num_tokens": 111846991.0, "step": 50105 }, { "entropy": 5.321786165237427, "epoch": 5.627842983096535, "grad_norm": 1.0234375, "learning_rate": 0.00023432141534477036, "loss": 4.8244, "mean_token_accuracy": 0.2395289123058319, "num_tokens": 111858160.0, "step": 50110 }, { "entropy": 5.289545297622681, "epoch": 5.628404560004492, "grad_norm": 0.9453125, "learning_rate": 0.00023428192888273768, "loss": 4.7378, "mean_token_accuracy": 0.2444293588399887, "num_tokens": 111869382.0, "step": 50115 }, { "entropy": 5.3944765567779545, "epoch": 5.62896613691245, "grad_norm": 1.0703125, "learning_rate": 0.00023424244371718418, "loss": 4.8416, "mean_token_accuracy": 0.2415391817688942, "num_tokens": 111879538.0, "step": 50120 }, { "entropy": 5.300840568542481, "epoch": 5.629527713820408, "grad_norm": 1.1171875, "learning_rate": 0.00023420295984936707, "loss": 4.825, "mean_token_accuracy": 0.23382407873868943, "num_tokens": 111890342.0, "step": 50125 }, { "entropy": 5.354081296920777, "epoch": 5.630089290728366, "grad_norm": 1.0703125, "learning_rate": 0.00023416347728054355, "loss": 4.8239, "mean_token_accuracy": 0.23479485362768174, "num_tokens": 111902009.0, "step": 50130 }, { "entropy": 5.472142887115479, "epoch": 5.630650867636323, "grad_norm": 1.09375, "learning_rate": 0.00023412399601197072, "loss": 4.9691, "mean_token_accuracy": 0.23491252064704896, "num_tokens": 111915409.0, "step": 50135 }, { "entropy": 5.367962121963501, "epoch": 5.63121244454428, "grad_norm": 1.0078125, "learning_rate": 0.00023408451604490577, "loss": 4.7931, "mean_token_accuracy": 0.23825278580188752, "num_tokens": 111926355.0, "step": 50140 }, { "entropy": 5.306478357315063, "epoch": 5.631774021452238, "grad_norm": 1.1015625, "learning_rate": 0.00023404503738060566, "loss": 4.7732, "mean_token_accuracy": 0.24004885107278823, "num_tokens": 111936733.0, "step": 50145 }, { "entropy": 5.323543834686279, "epoch": 5.6323355983601955, "grad_norm": 1.109375, "learning_rate": 0.00023400556002032747, "loss": 4.8526, "mean_token_accuracy": 0.2386070594191551, "num_tokens": 111947707.0, "step": 50150 }, { "entropy": 5.288376665115356, "epoch": 5.632897175268153, "grad_norm": 1.015625, "learning_rate": 0.000233966083965328, "loss": 4.7954, "mean_token_accuracy": 0.24198931753635405, "num_tokens": 111958666.0, "step": 50155 }, { "entropy": 5.3213966369628904, "epoch": 5.633458752176111, "grad_norm": 1.0, "learning_rate": 0.00023392660921686448, "loss": 4.8058, "mean_token_accuracy": 0.23493824601173402, "num_tokens": 111970476.0, "step": 50160 }, { "entropy": 5.394649076461792, "epoch": 5.634020329084068, "grad_norm": 1.03125, "learning_rate": 0.00023388713577619357, "loss": 4.9138, "mean_token_accuracy": 0.23239467442035674, "num_tokens": 111981617.0, "step": 50165 }, { "entropy": 5.272856903076172, "epoch": 5.634581905992025, "grad_norm": 1.0234375, "learning_rate": 0.00023384766364457227, "loss": 4.7438, "mean_token_accuracy": 0.24254267960786818, "num_tokens": 111993370.0, "step": 50170 }, { "entropy": 5.315666961669922, "epoch": 5.635143482899983, "grad_norm": 1.0234375, "learning_rate": 0.00023380819282325732, "loss": 4.8122, "mean_token_accuracy": 0.23991773426532745, "num_tokens": 112004832.0, "step": 50175 }, { "entropy": 5.341872692108154, "epoch": 5.635705059807941, "grad_norm": 1.109375, "learning_rate": 0.00023376872331350553, "loss": 4.8057, "mean_token_accuracy": 0.24645335078239441, "num_tokens": 112017388.0, "step": 50180 }, { "entropy": 5.2631066799163815, "epoch": 5.636266636715899, "grad_norm": 0.99609375, "learning_rate": 0.0002337292551165735, "loss": 4.7233, "mean_token_accuracy": 0.2391225203871727, "num_tokens": 112027960.0, "step": 50185 }, { "entropy": 5.2514289855957035, "epoch": 5.636828213623856, "grad_norm": 1.046875, "learning_rate": 0.000233689788233718, "loss": 4.8044, "mean_token_accuracy": 0.23843126893043518, "num_tokens": 112039209.0, "step": 50190 }, { "entropy": 5.288823413848877, "epoch": 5.637389790531813, "grad_norm": 0.97265625, "learning_rate": 0.00023365032266619567, "loss": 4.8243, "mean_token_accuracy": 0.2317632958292961, "num_tokens": 112050857.0, "step": 50195 }, { "entropy": 5.329683542251587, "epoch": 5.637951367439771, "grad_norm": 1.078125, "learning_rate": 0.00023361085841526314, "loss": 4.7527, "mean_token_accuracy": 0.249263134598732, "num_tokens": 112062071.0, "step": 50200 }, { "entropy": 5.427093505859375, "epoch": 5.638512944347728, "grad_norm": 1.0703125, "learning_rate": 0.00023357139548217692, "loss": 4.9567, "mean_token_accuracy": 0.2312479868531227, "num_tokens": 112074548.0, "step": 50205 }, { "entropy": 5.383727359771728, "epoch": 5.639074521255686, "grad_norm": 1.1171875, "learning_rate": 0.00023353193386819353, "loss": 4.8496, "mean_token_accuracy": 0.2308310478925705, "num_tokens": 112084494.0, "step": 50210 }, { "entropy": 5.316034317016602, "epoch": 5.639636098163644, "grad_norm": 1.015625, "learning_rate": 0.00023349247357456942, "loss": 4.8305, "mean_token_accuracy": 0.2345963254570961, "num_tokens": 112095551.0, "step": 50215 }, { "entropy": 5.412002897262573, "epoch": 5.640197675071601, "grad_norm": 1.1640625, "learning_rate": 0.00023345301460256113, "loss": 4.9083, "mean_token_accuracy": 0.23743947893381118, "num_tokens": 112107571.0, "step": 50220 }, { "entropy": 5.393449687957764, "epoch": 5.640759251979558, "grad_norm": 1.1328125, "learning_rate": 0.0002334135569534248, "loss": 4.8704, "mean_token_accuracy": 0.23376665264368057, "num_tokens": 112118136.0, "step": 50225 }, { "entropy": 5.323233222961425, "epoch": 5.641320828887516, "grad_norm": 1.0234375, "learning_rate": 0.00023337410062841706, "loss": 4.788, "mean_token_accuracy": 0.23755892366170883, "num_tokens": 112129611.0, "step": 50230 }, { "entropy": 5.395784664154053, "epoch": 5.6418824057954735, "grad_norm": 1.0703125, "learning_rate": 0.00023333464562879408, "loss": 4.8804, "mean_token_accuracy": 0.23660051375627517, "num_tokens": 112140097.0, "step": 50235 }, { "entropy": 5.405519342422485, "epoch": 5.642443982703432, "grad_norm": 1.1484375, "learning_rate": 0.00023329519195581218, "loss": 4.9059, "mean_token_accuracy": 0.2319188177585602, "num_tokens": 112151117.0, "step": 50240 }, { "entropy": 5.310891246795654, "epoch": 5.643005559611389, "grad_norm": 0.984375, "learning_rate": 0.00023325573961072754, "loss": 4.7807, "mean_token_accuracy": 0.24309643656015395, "num_tokens": 112162126.0, "step": 50245 }, { "entropy": 5.3603898048400875, "epoch": 5.643567136519346, "grad_norm": 1.0703125, "learning_rate": 0.00023321628859479632, "loss": 4.8563, "mean_token_accuracy": 0.23365887254476547, "num_tokens": 112172473.0, "step": 50250 }, { "entropy": 5.254723978042603, "epoch": 5.644128713427304, "grad_norm": 1.09375, "learning_rate": 0.0002331768389092747, "loss": 4.6912, "mean_token_accuracy": 0.23849423080682755, "num_tokens": 112182718.0, "step": 50255 }, { "entropy": 5.284247732162475, "epoch": 5.644690290335261, "grad_norm": 1.0546875, "learning_rate": 0.00023313739055541878, "loss": 4.7218, "mean_token_accuracy": 0.24317964911460876, "num_tokens": 112193349.0, "step": 50260 }, { "entropy": 5.281680727005005, "epoch": 5.645251867243219, "grad_norm": 1.1640625, "learning_rate": 0.0002330979435344845, "loss": 4.8106, "mean_token_accuracy": 0.2382815510034561, "num_tokens": 112203674.0, "step": 50265 }, { "entropy": 5.34605975151062, "epoch": 5.645813444151177, "grad_norm": 1.0546875, "learning_rate": 0.00023305849784772799, "loss": 4.8266, "mean_token_accuracy": 0.23596908897161484, "num_tokens": 112216601.0, "step": 50270 }, { "entropy": 5.34045000076294, "epoch": 5.646375021059134, "grad_norm": 1.03125, "learning_rate": 0.0002330190534964051, "loss": 4.7471, "mean_token_accuracy": 0.2421631395816803, "num_tokens": 112227594.0, "step": 50275 }, { "entropy": 5.408769035339356, "epoch": 5.646936597967091, "grad_norm": 1.1328125, "learning_rate": 0.00023297961048177195, "loss": 4.8304, "mean_token_accuracy": 0.2398897036910057, "num_tokens": 112238706.0, "step": 50280 }, { "entropy": 5.273558282852173, "epoch": 5.647498174875049, "grad_norm": 1.015625, "learning_rate": 0.00023294016880508428, "loss": 4.7706, "mean_token_accuracy": 0.242348313331604, "num_tokens": 112249248.0, "step": 50285 }, { "entropy": 5.304581642150879, "epoch": 5.6480597517830065, "grad_norm": 1.09375, "learning_rate": 0.00023290072846759784, "loss": 4.8352, "mean_token_accuracy": 0.2401745155453682, "num_tokens": 112259188.0, "step": 50290 }, { "entropy": 5.277836179733276, "epoch": 5.648621328690965, "grad_norm": 1.03125, "learning_rate": 0.00023286128947056867, "loss": 4.7349, "mean_token_accuracy": 0.2413178116083145, "num_tokens": 112270275.0, "step": 50295 }, { "entropy": 5.3264806270599365, "epoch": 5.649182905598922, "grad_norm": 1.0234375, "learning_rate": 0.00023282185181525223, "loss": 4.8209, "mean_token_accuracy": 0.2327048659324646, "num_tokens": 112282133.0, "step": 50300 }, { "entropy": 5.293250703811646, "epoch": 5.649744482506879, "grad_norm": 0.9609375, "learning_rate": 0.00023278241550290453, "loss": 4.7406, "mean_token_accuracy": 0.2394850581884384, "num_tokens": 112293448.0, "step": 50305 }, { "entropy": 5.313910055160522, "epoch": 5.650306059414837, "grad_norm": 1.125, "learning_rate": 0.00023274298053478106, "loss": 4.7743, "mean_token_accuracy": 0.24056325554847718, "num_tokens": 112304979.0, "step": 50310 }, { "entropy": 5.341831016540527, "epoch": 5.650867636322794, "grad_norm": 1.1484375, "learning_rate": 0.00023270354691213742, "loss": 4.7513, "mean_token_accuracy": 0.238727305829525, "num_tokens": 112314690.0, "step": 50315 }, { "entropy": 5.23231315612793, "epoch": 5.651429213230752, "grad_norm": 1.015625, "learning_rate": 0.00023266411463622927, "loss": 4.6899, "mean_token_accuracy": 0.24260217249393462, "num_tokens": 112325153.0, "step": 50320 }, { "entropy": 5.236805200576782, "epoch": 5.65199079013871, "grad_norm": 0.9609375, "learning_rate": 0.0002326246837083122, "loss": 4.7468, "mean_token_accuracy": 0.23671069741249084, "num_tokens": 112336848.0, "step": 50325 }, { "entropy": 5.338944005966186, "epoch": 5.652552367046667, "grad_norm": 1.015625, "learning_rate": 0.0002325852541296416, "loss": 4.8991, "mean_token_accuracy": 0.23050131648778915, "num_tokens": 112348849.0, "step": 50330 }, { "entropy": 5.303166103363037, "epoch": 5.653113943954625, "grad_norm": 0.96875, "learning_rate": 0.00023254582590147288, "loss": 4.7625, "mean_token_accuracy": 0.23731044232845305, "num_tokens": 112360408.0, "step": 50335 }, { "entropy": 5.329484462738037, "epoch": 5.653675520862582, "grad_norm": 0.9765625, "learning_rate": 0.0002325063990250616, "loss": 4.8354, "mean_token_accuracy": 0.23300303518772125, "num_tokens": 112372633.0, "step": 50340 }, { "entropy": 5.412740325927734, "epoch": 5.654237097770539, "grad_norm": 1.0546875, "learning_rate": 0.00023246697350166306, "loss": 4.8402, "mean_token_accuracy": 0.23597698360681535, "num_tokens": 112383269.0, "step": 50345 }, { "entropy": 5.350608873367309, "epoch": 5.6547986746784975, "grad_norm": 1.0859375, "learning_rate": 0.00023242754933253256, "loss": 4.856, "mean_token_accuracy": 0.2412739172577858, "num_tokens": 112395079.0, "step": 50350 }, { "entropy": 5.295021486282349, "epoch": 5.655360251586455, "grad_norm": 1.015625, "learning_rate": 0.0002323881265189255, "loss": 4.7286, "mean_token_accuracy": 0.24483977854251862, "num_tokens": 112406674.0, "step": 50355 }, { "entropy": 5.277003335952759, "epoch": 5.655921828494412, "grad_norm": 1.03125, "learning_rate": 0.00023234870506209693, "loss": 4.7111, "mean_token_accuracy": 0.24847178012132645, "num_tokens": 112417684.0, "step": 50360 }, { "entropy": 5.278333854675293, "epoch": 5.65648340540237, "grad_norm": 1.09375, "learning_rate": 0.0002323092849633021, "loss": 4.751, "mean_token_accuracy": 0.2426846817135811, "num_tokens": 112427986.0, "step": 50365 }, { "entropy": 5.262766313552857, "epoch": 5.657044982310327, "grad_norm": 1.09375, "learning_rate": 0.00023226986622379615, "loss": 4.7334, "mean_token_accuracy": 0.246213661134243, "num_tokens": 112438527.0, "step": 50370 }, { "entropy": 5.253688764572144, "epoch": 5.657606559218285, "grad_norm": 1.015625, "learning_rate": 0.00023223044884483436, "loss": 4.7373, "mean_token_accuracy": 0.2424413874745369, "num_tokens": 112448432.0, "step": 50375 }, { "entropy": 5.301943826675415, "epoch": 5.658168136126243, "grad_norm": 1.0390625, "learning_rate": 0.00023219103282767157, "loss": 4.7742, "mean_token_accuracy": 0.23988452404737473, "num_tokens": 112459793.0, "step": 50380 }, { "entropy": 5.271808385848999, "epoch": 5.6587297130342, "grad_norm": 0.9609375, "learning_rate": 0.000232151618173563, "loss": 4.6948, "mean_token_accuracy": 0.25057790279388426, "num_tokens": 112470868.0, "step": 50385 }, { "entropy": 5.308812952041626, "epoch": 5.659291289942158, "grad_norm": 1.1015625, "learning_rate": 0.0002321122048837635, "loss": 4.8018, "mean_token_accuracy": 0.2371307447552681, "num_tokens": 112481362.0, "step": 50390 }, { "entropy": 5.438502168655395, "epoch": 5.659852866850115, "grad_norm": 0.984375, "learning_rate": 0.00023207279295952798, "loss": 4.9371, "mean_token_accuracy": 0.22647445797920226, "num_tokens": 112492421.0, "step": 50395 }, { "entropy": 5.33788423538208, "epoch": 5.660414443758072, "grad_norm": 1.03125, "learning_rate": 0.00023203338240211142, "loss": 4.8179, "mean_token_accuracy": 0.24389825910329818, "num_tokens": 112503327.0, "step": 50400 }, { "entropy": 5.329284143447876, "epoch": 5.6609760206660305, "grad_norm": 1.109375, "learning_rate": 0.0002319939732127686, "loss": 4.7823, "mean_token_accuracy": 0.24604029804468155, "num_tokens": 112514424.0, "step": 50405 }, { "entropy": 5.313203525543213, "epoch": 5.661537597573988, "grad_norm": 0.9609375, "learning_rate": 0.00023195456539275433, "loss": 4.7819, "mean_token_accuracy": 0.24753837287425995, "num_tokens": 112526366.0, "step": 50410 }, { "entropy": 5.2862719058990475, "epoch": 5.662099174481945, "grad_norm": 0.953125, "learning_rate": 0.00023191515894332345, "loss": 4.8419, "mean_token_accuracy": 0.23780821710824968, "num_tokens": 112538712.0, "step": 50415 }, { "entropy": 5.3067668914794925, "epoch": 5.662660751389903, "grad_norm": 0.96875, "learning_rate": 0.00023187575386573057, "loss": 4.824, "mean_token_accuracy": 0.23691004663705825, "num_tokens": 112549696.0, "step": 50420 }, { "entropy": 5.308401298522949, "epoch": 5.66322232829786, "grad_norm": 0.984375, "learning_rate": 0.00023183635016123044, "loss": 4.7248, "mean_token_accuracy": 0.2467487037181854, "num_tokens": 112561056.0, "step": 50425 }, { "entropy": 5.302348470687866, "epoch": 5.663783905205818, "grad_norm": 1.0703125, "learning_rate": 0.0002317969478310777, "loss": 4.7988, "mean_token_accuracy": 0.2349467843770981, "num_tokens": 112572537.0, "step": 50430 }, { "entropy": 5.328875970840454, "epoch": 5.6643454821137755, "grad_norm": 1.1640625, "learning_rate": 0.00023175754687652684, "loss": 4.7835, "mean_token_accuracy": 0.2431969165802002, "num_tokens": 112582795.0, "step": 50435 }, { "entropy": 5.349136924743652, "epoch": 5.664907059021733, "grad_norm": 1.046875, "learning_rate": 0.0002317181472988325, "loss": 4.8653, "mean_token_accuracy": 0.2317551776766777, "num_tokens": 112595187.0, "step": 50440 }, { "entropy": 5.3060108661651615, "epoch": 5.665468635929691, "grad_norm": 1.0703125, "learning_rate": 0.00023167874909924902, "loss": 4.7832, "mean_token_accuracy": 0.24428419321775435, "num_tokens": 112605739.0, "step": 50445 }, { "entropy": 5.344893884658814, "epoch": 5.666030212837648, "grad_norm": 1.0078125, "learning_rate": 0.0002316393522790311, "loss": 4.8415, "mean_token_accuracy": 0.23465729951858522, "num_tokens": 112616542.0, "step": 50450 }, { "entropy": 5.360758590698242, "epoch": 5.666591789745605, "grad_norm": 1.0078125, "learning_rate": 0.00023159995683943297, "loss": 4.8523, "mean_token_accuracy": 0.23193674236536027, "num_tokens": 112627438.0, "step": 50455 }, { "entropy": 5.324874496459961, "epoch": 5.667153366653563, "grad_norm": 1.03125, "learning_rate": 0.00023156056278170905, "loss": 4.7934, "mean_token_accuracy": 0.2431514784693718, "num_tokens": 112639535.0, "step": 50460 }, { "entropy": 5.34074296951294, "epoch": 5.667714943561521, "grad_norm": 1.140625, "learning_rate": 0.00023152117010711372, "loss": 4.8403, "mean_token_accuracy": 0.23114818781614305, "num_tokens": 112650084.0, "step": 50465 }, { "entropy": 5.3014488697052, "epoch": 5.668276520469478, "grad_norm": 1.0859375, "learning_rate": 0.00023148177881690112, "loss": 4.8416, "mean_token_accuracy": 0.2440393254160881, "num_tokens": 112661199.0, "step": 50470 }, { "entropy": 5.309929513931275, "epoch": 5.668838097377436, "grad_norm": 1.1640625, "learning_rate": 0.0002314423889123256, "loss": 4.7635, "mean_token_accuracy": 0.24268273115158082, "num_tokens": 112672494.0, "step": 50475 }, { "entropy": 5.316413307189942, "epoch": 5.669399674285393, "grad_norm": 0.9921875, "learning_rate": 0.00023140300039464125, "loss": 4.8269, "mean_token_accuracy": 0.23067785501480104, "num_tokens": 112683148.0, "step": 50480 }, { "entropy": 5.256842756271363, "epoch": 5.669961251193351, "grad_norm": 1.0703125, "learning_rate": 0.00023136361326510236, "loss": 4.777, "mean_token_accuracy": 0.23688191920518875, "num_tokens": 112692927.0, "step": 50485 }, { "entropy": 5.272323083877564, "epoch": 5.6705228281013085, "grad_norm": 1.1171875, "learning_rate": 0.0002313242275249629, "loss": 4.7815, "mean_token_accuracy": 0.23903842270374298, "num_tokens": 112704481.0, "step": 50490 }, { "entropy": 5.318587112426758, "epoch": 5.671084405009266, "grad_norm": 1.0234375, "learning_rate": 0.00023128484317547698, "loss": 4.823, "mean_token_accuracy": 0.23526267558336258, "num_tokens": 112716167.0, "step": 50495 }, { "entropy": 5.3239830493927, "epoch": 5.671645981917224, "grad_norm": 0.97265625, "learning_rate": 0.00023124546021789866, "loss": 4.7615, "mean_token_accuracy": 0.24323577284812928, "num_tokens": 112726639.0, "step": 50500 }, { "entropy": 5.321477746963501, "epoch": 5.672207558825181, "grad_norm": 1.15625, "learning_rate": 0.0002312060786534818, "loss": 4.8332, "mean_token_accuracy": 0.23055649548768997, "num_tokens": 112737151.0, "step": 50505 }, { "entropy": 5.363887357711792, "epoch": 5.672769135733139, "grad_norm": 0.97265625, "learning_rate": 0.00023116669848348043, "loss": 4.8517, "mean_token_accuracy": 0.23334273397922517, "num_tokens": 112748507.0, "step": 50510 }, { "entropy": 5.367174482345581, "epoch": 5.673330712641096, "grad_norm": 1.0390625, "learning_rate": 0.00023112731970914823, "loss": 4.8852, "mean_token_accuracy": 0.22842475175857543, "num_tokens": 112760042.0, "step": 50515 }, { "entropy": 5.429375886917114, "epoch": 5.673892289549054, "grad_norm": 0.984375, "learning_rate": 0.0002310879423317393, "loss": 4.9246, "mean_token_accuracy": 0.22588659673929215, "num_tokens": 112771734.0, "step": 50520 }, { "entropy": 5.352873849868774, "epoch": 5.674453866457012, "grad_norm": 1.0625, "learning_rate": 0.00023104856635250732, "loss": 4.8078, "mean_token_accuracy": 0.2395622417330742, "num_tokens": 112784551.0, "step": 50525 }, { "entropy": 5.372788524627685, "epoch": 5.675015443364969, "grad_norm": 1.0625, "learning_rate": 0.00023100919177270607, "loss": 4.8816, "mean_token_accuracy": 0.2405443698167801, "num_tokens": 112795622.0, "step": 50530 }, { "entropy": 5.335906171798706, "epoch": 5.675577020272926, "grad_norm": 1.03125, "learning_rate": 0.00023096981859358918, "loss": 4.8277, "mean_token_accuracy": 0.2366152063012123, "num_tokens": 112806765.0, "step": 50535 }, { "entropy": 5.312664127349853, "epoch": 5.676138597180884, "grad_norm": 1.140625, "learning_rate": 0.00023093044681641035, "loss": 4.8049, "mean_token_accuracy": 0.24394844025373458, "num_tokens": 112816672.0, "step": 50540 }, { "entropy": 5.338701295852661, "epoch": 5.676700174088841, "grad_norm": 1.125, "learning_rate": 0.0002308910764424232, "loss": 4.8863, "mean_token_accuracy": 0.23739567548036575, "num_tokens": 112827384.0, "step": 50545 }, { "entropy": 5.356695699691772, "epoch": 5.677261750996799, "grad_norm": 1.0078125, "learning_rate": 0.0002308517074728812, "loss": 4.8337, "mean_token_accuracy": 0.23628831058740615, "num_tokens": 112839666.0, "step": 50550 }, { "entropy": 5.386043691635132, "epoch": 5.677823327904757, "grad_norm": 1.1171875, "learning_rate": 0.00023081233990903798, "loss": 4.845, "mean_token_accuracy": 0.2386646255850792, "num_tokens": 112851644.0, "step": 50555 }, { "entropy": 5.351182270050049, "epoch": 5.678384904812714, "grad_norm": 1.0078125, "learning_rate": 0.00023077297375214708, "loss": 4.7942, "mean_token_accuracy": 0.2430309996008873, "num_tokens": 112862931.0, "step": 50560 }, { "entropy": 5.347780656814575, "epoch": 5.678946481720672, "grad_norm": 1.0390625, "learning_rate": 0.0002307336090034618, "loss": 4.8504, "mean_token_accuracy": 0.23886551409959794, "num_tokens": 112874363.0, "step": 50565 }, { "entropy": 5.406192779541016, "epoch": 5.679508058628629, "grad_norm": 1.0859375, "learning_rate": 0.00023069424566423557, "loss": 4.9072, "mean_token_accuracy": 0.23655912280082703, "num_tokens": 112885099.0, "step": 50570 }, { "entropy": 5.373861646652221, "epoch": 5.6800696355365865, "grad_norm": 1.0546875, "learning_rate": 0.00023065488373572173, "loss": 4.8775, "mean_token_accuracy": 0.23291868418455125, "num_tokens": 112898018.0, "step": 50575 }, { "entropy": 5.46699013710022, "epoch": 5.680631212444545, "grad_norm": 0.953125, "learning_rate": 0.00023061552321917368, "loss": 4.945, "mean_token_accuracy": 0.2327926516532898, "num_tokens": 112910235.0, "step": 50580 }, { "entropy": 5.33443055152893, "epoch": 5.681192789352502, "grad_norm": 1.046875, "learning_rate": 0.00023057616411584453, "loss": 4.7732, "mean_token_accuracy": 0.24201924949884415, "num_tokens": 112921278.0, "step": 50585 }, { "entropy": 5.285068798065185, "epoch": 5.681754366260459, "grad_norm": 0.96484375, "learning_rate": 0.00023053680642698743, "loss": 4.7511, "mean_token_accuracy": 0.24415156990289688, "num_tokens": 112931898.0, "step": 50590 }, { "entropy": 5.3394897937774655, "epoch": 5.682315943168417, "grad_norm": 1.015625, "learning_rate": 0.00023049745015385576, "loss": 4.8607, "mean_token_accuracy": 0.23727932423353196, "num_tokens": 112942916.0, "step": 50595 }, { "entropy": 5.345683526992798, "epoch": 5.682877520076374, "grad_norm": 1.140625, "learning_rate": 0.00023045809529770252, "loss": 4.7718, "mean_token_accuracy": 0.23371665328741073, "num_tokens": 112953687.0, "step": 50600 }, { "entropy": 5.4508086204528805, "epoch": 5.683439096984332, "grad_norm": 1.0625, "learning_rate": 0.00023041874185978086, "loss": 4.9516, "mean_token_accuracy": 0.22772231549024582, "num_tokens": 112965358.0, "step": 50605 }, { "entropy": 5.340061283111572, "epoch": 5.68400067389229, "grad_norm": 1.0546875, "learning_rate": 0.0002303793898413437, "loss": 4.7974, "mean_token_accuracy": 0.23974230736494065, "num_tokens": 112977503.0, "step": 50610 }, { "entropy": 5.381912660598755, "epoch": 5.684562250800247, "grad_norm": 1.1953125, "learning_rate": 0.0002303400392436441, "loss": 4.8648, "mean_token_accuracy": 0.23822314143180848, "num_tokens": 112988920.0, "step": 50615 }, { "entropy": 5.3739248752594, "epoch": 5.685123827708205, "grad_norm": 1.0859375, "learning_rate": 0.0002303006900679349, "loss": 4.841, "mean_token_accuracy": 0.23464004695415497, "num_tokens": 113000204.0, "step": 50620 }, { "entropy": 5.254441261291504, "epoch": 5.685685404616162, "grad_norm": 0.98828125, "learning_rate": 0.00023026134231546907, "loss": 4.7469, "mean_token_accuracy": 0.24086756110191346, "num_tokens": 113013002.0, "step": 50625 }, { "entropy": 5.2904867172241214, "epoch": 5.6862469815241194, "grad_norm": 1.09375, "learning_rate": 0.00023022199598749955, "loss": 4.735, "mean_token_accuracy": 0.24280466735363007, "num_tokens": 113025155.0, "step": 50630 }, { "entropy": 5.280267381668091, "epoch": 5.6868085584320776, "grad_norm": 0.98046875, "learning_rate": 0.00023018265108527903, "loss": 4.7782, "mean_token_accuracy": 0.24775807112455367, "num_tokens": 113035512.0, "step": 50635 }, { "entropy": 5.378650236129761, "epoch": 5.687370135340035, "grad_norm": 1.03125, "learning_rate": 0.00023014330761006018, "loss": 4.8514, "mean_token_accuracy": 0.2352456718683243, "num_tokens": 113046842.0, "step": 50640 }, { "entropy": 5.415841579437256, "epoch": 5.687931712247992, "grad_norm": 1.171875, "learning_rate": 0.00023010396556309592, "loss": 4.8159, "mean_token_accuracy": 0.24644220620393753, "num_tokens": 113057608.0, "step": 50645 }, { "entropy": 5.304312086105346, "epoch": 5.68849328915595, "grad_norm": 1.0234375, "learning_rate": 0.0002300646249456388, "loss": 4.733, "mean_token_accuracy": 0.2428860992193222, "num_tokens": 113068540.0, "step": 50650 }, { "entropy": 5.333523082733154, "epoch": 5.689054866063907, "grad_norm": 1.0, "learning_rate": 0.00023002528575894138, "loss": 4.8274, "mean_token_accuracy": 0.23288071304559707, "num_tokens": 113080085.0, "step": 50655 }, { "entropy": 5.3003747940063475, "epoch": 5.6896164429718645, "grad_norm": 1.0625, "learning_rate": 0.00022998594800425627, "loss": 4.7469, "mean_token_accuracy": 0.2462264746427536, "num_tokens": 113091539.0, "step": 50660 }, { "entropy": 5.346331071853638, "epoch": 5.690178019879823, "grad_norm": 1.078125, "learning_rate": 0.00022994661168283608, "loss": 4.8101, "mean_token_accuracy": 0.23819625973701478, "num_tokens": 113101017.0, "step": 50665 }, { "entropy": 5.259552764892578, "epoch": 5.69073959678778, "grad_norm": 0.9375, "learning_rate": 0.00022990727679593332, "loss": 4.7769, "mean_token_accuracy": 0.23396315425634384, "num_tokens": 113112583.0, "step": 50670 }, { "entropy": 5.330195617675781, "epoch": 5.691301173695738, "grad_norm": 1.015625, "learning_rate": 0.00022986794334480033, "loss": 4.8158, "mean_token_accuracy": 0.23189981281757355, "num_tokens": 113123689.0, "step": 50675 }, { "entropy": 5.41085467338562, "epoch": 5.691862750603695, "grad_norm": 1.0078125, "learning_rate": 0.0002298286113306895, "loss": 4.8978, "mean_token_accuracy": 0.22999204695224762, "num_tokens": 113135466.0, "step": 50680 }, { "entropy": 5.3285387516021725, "epoch": 5.692424327511652, "grad_norm": 1.0859375, "learning_rate": 0.00022978928075485322, "loss": 4.7576, "mean_token_accuracy": 0.2352118268609047, "num_tokens": 113146892.0, "step": 50685 }, { "entropy": 5.34357647895813, "epoch": 5.6929859044196105, "grad_norm": 0.98828125, "learning_rate": 0.0002297499516185438, "loss": 4.8055, "mean_token_accuracy": 0.23437814116477967, "num_tokens": 113157448.0, "step": 50690 }, { "entropy": 5.3635648727417, "epoch": 5.693547481327568, "grad_norm": 0.98046875, "learning_rate": 0.00022971062392301335, "loss": 4.8635, "mean_token_accuracy": 0.23511876463890075, "num_tokens": 113168455.0, "step": 50695 }, { "entropy": 5.377234172821045, "epoch": 5.694109058235526, "grad_norm": 1.0859375, "learning_rate": 0.00022967129766951429, "loss": 4.8112, "mean_token_accuracy": 0.23832148611545562, "num_tokens": 113178612.0, "step": 50700 }, { "entropy": 5.327203941345215, "epoch": 5.694670635143483, "grad_norm": 1.0625, "learning_rate": 0.0002296319728592987, "loss": 4.8554, "mean_token_accuracy": 0.23466818183660507, "num_tokens": 113190444.0, "step": 50705 }, { "entropy": 5.346721124649048, "epoch": 5.69523221205144, "grad_norm": 1.0703125, "learning_rate": 0.0002295926494936187, "loss": 4.8283, "mean_token_accuracy": 0.23772380650043487, "num_tokens": 113200994.0, "step": 50710 }, { "entropy": 5.40915961265564, "epoch": 5.695793788959398, "grad_norm": 1.03125, "learning_rate": 0.00022955332757372633, "loss": 4.8704, "mean_token_accuracy": 0.23765342235565184, "num_tokens": 113212238.0, "step": 50715 }, { "entropy": 5.397620725631714, "epoch": 5.696355365867356, "grad_norm": 1.0625, "learning_rate": 0.00022951400710087368, "loss": 4.8776, "mean_token_accuracy": 0.23589127361774445, "num_tokens": 113222693.0, "step": 50720 }, { "entropy": 5.340759038925171, "epoch": 5.696916942775313, "grad_norm": 1.078125, "learning_rate": 0.0002294746880763126, "loss": 4.8347, "mean_token_accuracy": 0.23840138912200928, "num_tokens": 113233238.0, "step": 50725 }, { "entropy": 5.283716297149658, "epoch": 5.697478519683271, "grad_norm": 1.015625, "learning_rate": 0.00022943537050129504, "loss": 4.665, "mean_token_accuracy": 0.24747377634048462, "num_tokens": 113244224.0, "step": 50730 }, { "entropy": 5.331808853149414, "epoch": 5.698040096591228, "grad_norm": 1.0, "learning_rate": 0.0002293960543770731, "loss": 4.8594, "mean_token_accuracy": 0.24174703508615494, "num_tokens": 113255892.0, "step": 50735 }, { "entropy": 5.268104219436646, "epoch": 5.698601673499185, "grad_norm": 1.046875, "learning_rate": 0.00022935673970489847, "loss": 4.8095, "mean_token_accuracy": 0.23891334384679794, "num_tokens": 113268301.0, "step": 50740 }, { "entropy": 5.333758115768433, "epoch": 5.699163250407143, "grad_norm": 0.9765625, "learning_rate": 0.00022931742648602294, "loss": 4.8301, "mean_token_accuracy": 0.2351090803742409, "num_tokens": 113280521.0, "step": 50745 }, { "entropy": 5.3543061256408695, "epoch": 5.699724827315101, "grad_norm": 1.0859375, "learning_rate": 0.00022927811472169823, "loss": 4.7795, "mean_token_accuracy": 0.24883992969989777, "num_tokens": 113291004.0, "step": 50750 }, { "entropy": 5.459448337554932, "epoch": 5.700286404223059, "grad_norm": 0.9921875, "learning_rate": 0.00022923880441317606, "loss": 4.9598, "mean_token_accuracy": 0.22426485717296601, "num_tokens": 113301718.0, "step": 50755 }, { "entropy": 5.3613087177276615, "epoch": 5.700847981131016, "grad_norm": 1.140625, "learning_rate": 0.0002291994955617082, "loss": 4.8515, "mean_token_accuracy": 0.2291525721549988, "num_tokens": 113312848.0, "step": 50760 }, { "entropy": 5.3625829219818115, "epoch": 5.701409558038973, "grad_norm": 1.0234375, "learning_rate": 0.0002291601881685461, "loss": 4.8745, "mean_token_accuracy": 0.24060789197683335, "num_tokens": 113323380.0, "step": 50765 }, { "entropy": 5.299519109725952, "epoch": 5.701971134946931, "grad_norm": 1.109375, "learning_rate": 0.00022912088223494138, "loss": 4.7493, "mean_token_accuracy": 0.24485370069742202, "num_tokens": 113334406.0, "step": 50770 }, { "entropy": 5.274255180358887, "epoch": 5.7025327118548885, "grad_norm": 1.125, "learning_rate": 0.00022908157776214556, "loss": 4.7913, "mean_token_accuracy": 0.22991242557764052, "num_tokens": 113344902.0, "step": 50775 }, { "entropy": 5.350745010375976, "epoch": 5.703094288762846, "grad_norm": 1.0, "learning_rate": 0.00022904227475141015, "loss": 4.8557, "mean_token_accuracy": 0.2279915079474449, "num_tokens": 113355408.0, "step": 50780 }, { "entropy": 5.321910381317139, "epoch": 5.703655865670804, "grad_norm": 1.15625, "learning_rate": 0.00022900297320398654, "loss": 4.7164, "mean_token_accuracy": 0.25021869093179705, "num_tokens": 113365704.0, "step": 50785 }, { "entropy": 5.397921180725097, "epoch": 5.704217442578761, "grad_norm": 1.03125, "learning_rate": 0.00022896367312112608, "loss": 4.8253, "mean_token_accuracy": 0.23364744633436202, "num_tokens": 113376918.0, "step": 50790 }, { "entropy": 5.198722457885742, "epoch": 5.704779019486718, "grad_norm": 0.9375, "learning_rate": 0.00022892437450408015, "loss": 4.696, "mean_token_accuracy": 0.24758501648902892, "num_tokens": 113388567.0, "step": 50795 }, { "entropy": 5.232199096679688, "epoch": 5.705340596394676, "grad_norm": 1.109375, "learning_rate": 0.00022888507735409997, "loss": 4.6875, "mean_token_accuracy": 0.24776776880025864, "num_tokens": 113399408.0, "step": 50800 }, { "entropy": 5.50755672454834, "epoch": 5.705902173302634, "grad_norm": 1.1171875, "learning_rate": 0.00022884578167243675, "loss": 5.0289, "mean_token_accuracy": 0.22923431694507598, "num_tokens": 113410605.0, "step": 50805 }, { "entropy": 5.288316011428833, "epoch": 5.706463750210592, "grad_norm": 1.09375, "learning_rate": 0.00022880648746034183, "loss": 4.8132, "mean_token_accuracy": 0.23807477056980134, "num_tokens": 113422552.0, "step": 50810 }, { "entropy": 5.384940719604492, "epoch": 5.707025327118549, "grad_norm": 0.99609375, "learning_rate": 0.00022876719471906626, "loss": 4.8437, "mean_token_accuracy": 0.24064173698425292, "num_tokens": 113434423.0, "step": 50815 }, { "entropy": 5.277596664428711, "epoch": 5.707586904026506, "grad_norm": 0.99609375, "learning_rate": 0.00022872790344986117, "loss": 4.8484, "mean_token_accuracy": 0.23502280712127685, "num_tokens": 113446743.0, "step": 50820 }, { "entropy": 5.397785377502442, "epoch": 5.708148480934464, "grad_norm": 1.015625, "learning_rate": 0.00022868861365397752, "loss": 4.8936, "mean_token_accuracy": 0.2255231872200966, "num_tokens": 113457630.0, "step": 50825 }, { "entropy": 5.348792648315429, "epoch": 5.7087100578424215, "grad_norm": 0.99609375, "learning_rate": 0.00022864932533266642, "loss": 4.7772, "mean_token_accuracy": 0.23757467567920684, "num_tokens": 113469637.0, "step": 50830 }, { "entropy": 5.3823925971984865, "epoch": 5.709271634750379, "grad_norm": 1.0546875, "learning_rate": 0.00022861003848717877, "loss": 4.8536, "mean_token_accuracy": 0.23722977191209793, "num_tokens": 113480686.0, "step": 50835 }, { "entropy": 5.251714897155762, "epoch": 5.709833211658337, "grad_norm": 1.046875, "learning_rate": 0.00022857075311876542, "loss": 4.7037, "mean_token_accuracy": 0.2446419969201088, "num_tokens": 113491952.0, "step": 50840 }, { "entropy": 5.18622407913208, "epoch": 5.710394788566294, "grad_norm": 1.0546875, "learning_rate": 0.00022853146922867734, "loss": 4.6865, "mean_token_accuracy": 0.24995354562997818, "num_tokens": 113502393.0, "step": 50845 }, { "entropy": 5.326667356491089, "epoch": 5.710956365474251, "grad_norm": 1.109375, "learning_rate": 0.0002284921868181653, "loss": 4.8814, "mean_token_accuracy": 0.23814730644226073, "num_tokens": 113514012.0, "step": 50850 }, { "entropy": 5.294448280334473, "epoch": 5.711517942382209, "grad_norm": 1.015625, "learning_rate": 0.00022845290588848012, "loss": 4.7909, "mean_token_accuracy": 0.2405279889702797, "num_tokens": 113525387.0, "step": 50855 }, { "entropy": 5.32027645111084, "epoch": 5.7120795192901666, "grad_norm": 1.078125, "learning_rate": 0.00022841362644087244, "loss": 4.7888, "mean_token_accuracy": 0.23910442888736724, "num_tokens": 113536478.0, "step": 50860 }, { "entropy": 5.340518283843994, "epoch": 5.712641096198125, "grad_norm": 1.09375, "learning_rate": 0.00022837434847659295, "loss": 4.7435, "mean_token_accuracy": 0.24288913160562514, "num_tokens": 113547737.0, "step": 50865 }, { "entropy": 5.446155214309693, "epoch": 5.713202673106082, "grad_norm": 0.98828125, "learning_rate": 0.0002283350719968923, "loss": 4.9657, "mean_token_accuracy": 0.23434963822364807, "num_tokens": 113559326.0, "step": 50870 }, { "entropy": 5.301633548736572, "epoch": 5.713764250014039, "grad_norm": 1.0703125, "learning_rate": 0.000228295797003021, "loss": 4.7344, "mean_token_accuracy": 0.2411084070801735, "num_tokens": 113569737.0, "step": 50875 }, { "entropy": 5.309129428863526, "epoch": 5.714325826921997, "grad_norm": 1.0, "learning_rate": 0.00022825652349622966, "loss": 4.7675, "mean_token_accuracy": 0.24523212164640426, "num_tokens": 113581154.0, "step": 50880 }, { "entropy": 5.325250911712646, "epoch": 5.714887403829954, "grad_norm": 1.078125, "learning_rate": 0.00022821725147776877, "loss": 4.7756, "mean_token_accuracy": 0.2419283866882324, "num_tokens": 113592125.0, "step": 50885 }, { "entropy": 5.243553256988525, "epoch": 5.7154489807379125, "grad_norm": 1.03125, "learning_rate": 0.00022817798094888875, "loss": 4.6568, "mean_token_accuracy": 0.24634029120206832, "num_tokens": 113602384.0, "step": 50890 }, { "entropy": 5.228353834152221, "epoch": 5.71601055764587, "grad_norm": 1.046875, "learning_rate": 0.00022813871191083995, "loss": 4.7014, "mean_token_accuracy": 0.23961537778377534, "num_tokens": 113613191.0, "step": 50895 }, { "entropy": 5.247710943222046, "epoch": 5.716572134553827, "grad_norm": 1.0703125, "learning_rate": 0.00022809944436487278, "loss": 4.7715, "mean_token_accuracy": 0.2362819045782089, "num_tokens": 113624615.0, "step": 50900 }, { "entropy": 5.315955972671508, "epoch": 5.717133711461785, "grad_norm": 1.015625, "learning_rate": 0.00022806017831223746, "loss": 4.8473, "mean_token_accuracy": 0.2377579018473625, "num_tokens": 113636461.0, "step": 50905 }, { "entropy": 5.372476291656494, "epoch": 5.717695288369742, "grad_norm": 1.0703125, "learning_rate": 0.00022802091375418422, "loss": 4.8525, "mean_token_accuracy": 0.2356565311551094, "num_tokens": 113647452.0, "step": 50910 }, { "entropy": 5.425834131240845, "epoch": 5.7182568652776995, "grad_norm": 1.2578125, "learning_rate": 0.00022798165069196335, "loss": 4.8675, "mean_token_accuracy": 0.23659952580928803, "num_tokens": 113658358.0, "step": 50915 }, { "entropy": 5.378121757507325, "epoch": 5.718818442185658, "grad_norm": 1.046875, "learning_rate": 0.00022794238912682497, "loss": 4.8503, "mean_token_accuracy": 0.23739357441663742, "num_tokens": 113668649.0, "step": 50920 }, { "entropy": 5.315393877029419, "epoch": 5.719380019093615, "grad_norm": 1.03125, "learning_rate": 0.00022790312906001919, "loss": 4.7648, "mean_token_accuracy": 0.2309473931789398, "num_tokens": 113679802.0, "step": 50925 }, { "entropy": 5.319543075561524, "epoch": 5.719941596001572, "grad_norm": 0.9375, "learning_rate": 0.00022786387049279606, "loss": 4.8402, "mean_token_accuracy": 0.23391697257757188, "num_tokens": 113691879.0, "step": 50930 }, { "entropy": 5.493599081039429, "epoch": 5.72050317290953, "grad_norm": 1.1015625, "learning_rate": 0.00022782461342640554, "loss": 4.9158, "mean_token_accuracy": 0.23335328102111816, "num_tokens": 113701854.0, "step": 50935 }, { "entropy": 5.33527626991272, "epoch": 5.721064749817487, "grad_norm": 1.0703125, "learning_rate": 0.00022778535786209758, "loss": 4.7823, "mean_token_accuracy": 0.24058614820241928, "num_tokens": 113712771.0, "step": 50940 }, { "entropy": 5.27732286453247, "epoch": 5.7216263267254455, "grad_norm": 0.984375, "learning_rate": 0.0002277461038011222, "loss": 4.7097, "mean_token_accuracy": 0.24012369513511658, "num_tokens": 113723590.0, "step": 50945 }, { "entropy": 5.398259115219116, "epoch": 5.722187903633403, "grad_norm": 1.0703125, "learning_rate": 0.00022770685124472907, "loss": 4.9032, "mean_token_accuracy": 0.2377983510494232, "num_tokens": 113735451.0, "step": 50950 }, { "entropy": 5.247649717330932, "epoch": 5.72274948054136, "grad_norm": 1.0390625, "learning_rate": 0.00022766760019416826, "loss": 4.7362, "mean_token_accuracy": 0.23561370223760605, "num_tokens": 113746455.0, "step": 50955 }, { "entropy": 5.270652151107788, "epoch": 5.723311057449318, "grad_norm": 1.0625, "learning_rate": 0.00022762835065068943, "loss": 4.7167, "mean_token_accuracy": 0.25138472616672514, "num_tokens": 113757616.0, "step": 50960 }, { "entropy": 5.269488382339477, "epoch": 5.723872634357275, "grad_norm": 1.0859375, "learning_rate": 0.00022758910261554228, "loss": 4.8001, "mean_token_accuracy": 0.23454590886831284, "num_tokens": 113769187.0, "step": 50965 }, { "entropy": 5.270131540298462, "epoch": 5.724434211265232, "grad_norm": 1.0625, "learning_rate": 0.00022754985608997648, "loss": 4.7602, "mean_token_accuracy": 0.24329565167427064, "num_tokens": 113779690.0, "step": 50970 }, { "entropy": 5.3525238037109375, "epoch": 5.7249957881731905, "grad_norm": 1.109375, "learning_rate": 0.00022751061107524167, "loss": 4.8581, "mean_token_accuracy": 0.23489189893007278, "num_tokens": 113789888.0, "step": 50975 }, { "entropy": 5.362554597854614, "epoch": 5.725557365081148, "grad_norm": 1.0, "learning_rate": 0.00022747136757258742, "loss": 4.8469, "mean_token_accuracy": 0.23648446649312974, "num_tokens": 113800577.0, "step": 50980 }, { "entropy": 5.217343330383301, "epoch": 5.726118941989105, "grad_norm": 0.98828125, "learning_rate": 0.0002274321255832632, "loss": 4.6712, "mean_token_accuracy": 0.25313189178705214, "num_tokens": 113812262.0, "step": 50985 }, { "entropy": 5.295279884338379, "epoch": 5.726680518897063, "grad_norm": 0.90625, "learning_rate": 0.00022739288510851863, "loss": 4.7536, "mean_token_accuracy": 0.2437872990965843, "num_tokens": 113824468.0, "step": 50990 }, { "entropy": 5.322895479202271, "epoch": 5.72724209580502, "grad_norm": 1.09375, "learning_rate": 0.00022735364614960302, "loss": 4.8082, "mean_token_accuracy": 0.2425532028079033, "num_tokens": 113835238.0, "step": 50995 }, { "entropy": 5.2680665969848635, "epoch": 5.727803672712978, "grad_norm": 1.0546875, "learning_rate": 0.00022731440870776582, "loss": 4.7891, "mean_token_accuracy": 0.23824004530906678, "num_tokens": 113846275.0, "step": 51000 }, { "epoch": 5.727803672712978, "eval_entropy": 5.115499059348983, "eval_loss": 4.9925947189331055, "eval_mean_token_accuracy": 0.23540482873773033, "eval_num_tokens": 113846275.0, "eval_runtime": 23.8902, "eval_samples_per_second": 1298.146, "eval_steps_per_second": 162.284, "step": 51000 }, { "entropy": 5.323248672485351, "epoch": 5.728365249620936, "grad_norm": 1.078125, "learning_rate": 0.00022727517278425637, "loss": 4.7195, "mean_token_accuracy": 0.2379387781023979, "num_tokens": 113857666.0, "step": 51005 }, { "entropy": 5.355527067184449, "epoch": 5.728926826528893, "grad_norm": 1.1484375, "learning_rate": 0.00022723593838032391, "loss": 4.8232, "mean_token_accuracy": 0.2316133886575699, "num_tokens": 113868279.0, "step": 51010 }, { "entropy": 5.35429105758667, "epoch": 5.729488403436851, "grad_norm": 1.1015625, "learning_rate": 0.00022719670549721765, "loss": 4.8636, "mean_token_accuracy": 0.23542719036340715, "num_tokens": 113879401.0, "step": 51015 }, { "entropy": 5.291626262664795, "epoch": 5.730049980344808, "grad_norm": 0.95703125, "learning_rate": 0.00022715747413618677, "loss": 4.7996, "mean_token_accuracy": 0.23818872570991517, "num_tokens": 113890435.0, "step": 51020 }, { "entropy": 5.240498065948486, "epoch": 5.730611557252765, "grad_norm": 1.0546875, "learning_rate": 0.00022711824429848054, "loss": 4.6834, "mean_token_accuracy": 0.2471496045589447, "num_tokens": 113902169.0, "step": 51025 }, { "entropy": 5.399691581726074, "epoch": 5.7311731341607235, "grad_norm": 1.0234375, "learning_rate": 0.000227079015985348, "loss": 4.9192, "mean_token_accuracy": 0.2308892324566841, "num_tokens": 113914077.0, "step": 51030 }, { "entropy": 5.259225368499756, "epoch": 5.731734711068681, "grad_norm": 1.015625, "learning_rate": 0.0002270397891980382, "loss": 4.6661, "mean_token_accuracy": 0.25196210443973543, "num_tokens": 113925889.0, "step": 51035 }, { "entropy": 5.423564195632935, "epoch": 5.732296287976638, "grad_norm": 1.078125, "learning_rate": 0.00022700056393780012, "loss": 4.8761, "mean_token_accuracy": 0.23512988537549973, "num_tokens": 113936636.0, "step": 51040 }, { "entropy": 5.28269476890564, "epoch": 5.732857864884596, "grad_norm": 1.0078125, "learning_rate": 0.00022696134020588267, "loss": 4.7462, "mean_token_accuracy": 0.2454352483153343, "num_tokens": 113948078.0, "step": 51045 }, { "entropy": 5.317790889739991, "epoch": 5.733419441792553, "grad_norm": 1.1484375, "learning_rate": 0.0002269221180035348, "loss": 4.7818, "mean_token_accuracy": 0.24009400308132173, "num_tokens": 113959532.0, "step": 51050 }, { "entropy": 5.335780668258667, "epoch": 5.733981018700511, "grad_norm": 1.0546875, "learning_rate": 0.00022688289733200522, "loss": 4.8068, "mean_token_accuracy": 0.23624992221593857, "num_tokens": 113971443.0, "step": 51055 }, { "entropy": 5.333909225463867, "epoch": 5.734542595608469, "grad_norm": 1.0390625, "learning_rate": 0.000226843678192543, "loss": 4.7668, "mean_token_accuracy": 0.24689988791942596, "num_tokens": 113981435.0, "step": 51060 }, { "entropy": 5.24518723487854, "epoch": 5.735104172516426, "grad_norm": 0.98828125, "learning_rate": 0.0002268044605863967, "loss": 4.7422, "mean_token_accuracy": 0.24779165983200074, "num_tokens": 113991755.0, "step": 51065 }, { "entropy": 5.338075637817383, "epoch": 5.735665749424384, "grad_norm": 1.125, "learning_rate": 0.00022676524451481505, "loss": 4.8466, "mean_token_accuracy": 0.24133355617523194, "num_tokens": 114002506.0, "step": 51070 }, { "entropy": 5.252970933914185, "epoch": 5.736227326332341, "grad_norm": 0.98828125, "learning_rate": 0.00022672602997904674, "loss": 4.7299, "mean_token_accuracy": 0.24329013973474503, "num_tokens": 114014743.0, "step": 51075 }, { "entropy": 5.203706073760986, "epoch": 5.736788903240299, "grad_norm": 0.9765625, "learning_rate": 0.00022668681698034032, "loss": 4.7325, "mean_token_accuracy": 0.24161656945943832, "num_tokens": 114025355.0, "step": 51080 }, { "entropy": 5.333952474594116, "epoch": 5.737350480148256, "grad_norm": 1.078125, "learning_rate": 0.00022664760551994445, "loss": 4.8472, "mean_token_accuracy": 0.23403352200984956, "num_tokens": 114036600.0, "step": 51085 }, { "entropy": 5.35011920928955, "epoch": 5.737912057056214, "grad_norm": 1.2109375, "learning_rate": 0.00022660839559910756, "loss": 4.792, "mean_token_accuracy": 0.24633708000183105, "num_tokens": 114047828.0, "step": 51090 }, { "entropy": 5.3461692333221436, "epoch": 5.738473633964172, "grad_norm": 1.03125, "learning_rate": 0.000226569187219078, "loss": 4.7527, "mean_token_accuracy": 0.2517297640442848, "num_tokens": 114058101.0, "step": 51095 }, { "entropy": 5.364392709732056, "epoch": 5.739035210872129, "grad_norm": 0.98046875, "learning_rate": 0.0002265299803811044, "loss": 4.8233, "mean_token_accuracy": 0.23378075361251832, "num_tokens": 114069255.0, "step": 51100 }, { "entropy": 5.310218715667725, "epoch": 5.739596787780086, "grad_norm": 1.03125, "learning_rate": 0.00022649077508643507, "loss": 4.8658, "mean_token_accuracy": 0.2405985802412033, "num_tokens": 114081363.0, "step": 51105 }, { "entropy": 5.40250186920166, "epoch": 5.740158364688044, "grad_norm": 1.03125, "learning_rate": 0.00022645157133631823, "loss": 4.8996, "mean_token_accuracy": 0.23601340800523757, "num_tokens": 114093276.0, "step": 51110 }, { "entropy": 5.394738483428955, "epoch": 5.7407199415960015, "grad_norm": 1.0546875, "learning_rate": 0.00022641236913200215, "loss": 4.8678, "mean_token_accuracy": 0.2316654533147812, "num_tokens": 114104178.0, "step": 51115 }, { "entropy": 5.305172252655029, "epoch": 5.741281518503959, "grad_norm": 1.0859375, "learning_rate": 0.00022637316847473515, "loss": 4.8295, "mean_token_accuracy": 0.23546912968158723, "num_tokens": 114115366.0, "step": 51120 }, { "entropy": 5.252777433395385, "epoch": 5.741843095411917, "grad_norm": 1.078125, "learning_rate": 0.00022633396936576534, "loss": 4.719, "mean_token_accuracy": 0.2453773632645607, "num_tokens": 114126417.0, "step": 51125 }, { "entropy": 5.236069583892823, "epoch": 5.742404672319874, "grad_norm": 1.0234375, "learning_rate": 0.00022629477180634072, "loss": 4.7421, "mean_token_accuracy": 0.23877759277820587, "num_tokens": 114136943.0, "step": 51130 }, { "entropy": 5.33218412399292, "epoch": 5.742966249227832, "grad_norm": 1.171875, "learning_rate": 0.0002262555757977095, "loss": 4.7727, "mean_token_accuracy": 0.23420901596546173, "num_tokens": 114147347.0, "step": 51135 }, { "entropy": 5.263463115692138, "epoch": 5.743527826135789, "grad_norm": 1.078125, "learning_rate": 0.00022621638134111966, "loss": 4.7426, "mean_token_accuracy": 0.2413904294371605, "num_tokens": 114158419.0, "step": 51140 }, { "entropy": 5.268434524536133, "epoch": 5.744089403043747, "grad_norm": 0.97265625, "learning_rate": 0.0002261771884378192, "loss": 4.7621, "mean_token_accuracy": 0.24676626771688462, "num_tokens": 114168731.0, "step": 51145 }, { "entropy": 5.274119138717651, "epoch": 5.744650979951705, "grad_norm": 1.0546875, "learning_rate": 0.0002261379970890559, "loss": 4.7334, "mean_token_accuracy": 0.24730513840913773, "num_tokens": 114180062.0, "step": 51150 }, { "entropy": 5.398240852355957, "epoch": 5.745212556859662, "grad_norm": 1.0859375, "learning_rate": 0.00022609880729607785, "loss": 4.8684, "mean_token_accuracy": 0.23451490253210067, "num_tokens": 114191340.0, "step": 51155 }, { "entropy": 5.293097352981567, "epoch": 5.745774133767619, "grad_norm": 1.125, "learning_rate": 0.00022605961906013266, "loss": 4.7608, "mean_token_accuracy": 0.24814313948154448, "num_tokens": 114201934.0, "step": 51160 }, { "entropy": 5.38550877571106, "epoch": 5.746335710675577, "grad_norm": 1.03125, "learning_rate": 0.0002260204323824681, "loss": 4.7961, "mean_token_accuracy": 0.23988536596298218, "num_tokens": 114212562.0, "step": 51165 }, { "entropy": 5.232830667495728, "epoch": 5.7468972875835345, "grad_norm": 1.0625, "learning_rate": 0.00022598124726433205, "loss": 4.6778, "mean_token_accuracy": 0.24768627285957337, "num_tokens": 114223668.0, "step": 51170 }, { "entropy": 5.154384660720825, "epoch": 5.747458864491492, "grad_norm": 1.0625, "learning_rate": 0.00022594206370697212, "loss": 4.6664, "mean_token_accuracy": 0.2570901349186897, "num_tokens": 114235391.0, "step": 51175 }, { "entropy": 5.253238248825073, "epoch": 5.74802044139945, "grad_norm": 1.21875, "learning_rate": 0.00022590288171163593, "loss": 4.7538, "mean_token_accuracy": 0.2393921732902527, "num_tokens": 114246267.0, "step": 51180 }, { "entropy": 5.311155557632446, "epoch": 5.748582018307407, "grad_norm": 1.0078125, "learning_rate": 0.000225863701279571, "loss": 4.7166, "mean_token_accuracy": 0.2527556478977203, "num_tokens": 114257394.0, "step": 51185 }, { "entropy": 5.322428512573242, "epoch": 5.749143595215365, "grad_norm": 1.0234375, "learning_rate": 0.0002258245224120249, "loss": 4.8205, "mean_token_accuracy": 0.23979092240333558, "num_tokens": 114268614.0, "step": 51190 }, { "entropy": 5.359666585922241, "epoch": 5.749705172123322, "grad_norm": 1.109375, "learning_rate": 0.00022578534511024506, "loss": 4.8303, "mean_token_accuracy": 0.23358473032712937, "num_tokens": 114279654.0, "step": 51195 }, { "entropy": 5.3894116401672365, "epoch": 5.7502667490312795, "grad_norm": 1.15625, "learning_rate": 0.00022574616937547887, "loss": 4.9331, "mean_token_accuracy": 0.235675410926342, "num_tokens": 114291181.0, "step": 51200 }, { "entropy": 5.397780084609986, "epoch": 5.750828325939238, "grad_norm": 1.1015625, "learning_rate": 0.00022570699520897382, "loss": 4.9816, "mean_token_accuracy": 0.2292216420173645, "num_tokens": 114302729.0, "step": 51205 }, { "entropy": 5.286508178710937, "epoch": 5.751389902847195, "grad_norm": 0.99609375, "learning_rate": 0.0002256678226119771, "loss": 4.7516, "mean_token_accuracy": 0.24058356285095214, "num_tokens": 114314220.0, "step": 51210 }, { "entropy": 5.379350996017456, "epoch": 5.751951479755152, "grad_norm": 1.1015625, "learning_rate": 0.00022562865158573615, "loss": 4.7666, "mean_token_accuracy": 0.2405677855014801, "num_tokens": 114324950.0, "step": 51215 }, { "entropy": 5.318822145462036, "epoch": 5.75251305666311, "grad_norm": 0.921875, "learning_rate": 0.000225589482131498, "loss": 4.7855, "mean_token_accuracy": 0.24441753476858138, "num_tokens": 114338092.0, "step": 51220 }, { "entropy": 5.283265161514282, "epoch": 5.753074633571067, "grad_norm": 1.09375, "learning_rate": 0.00022555031425050993, "loss": 4.7134, "mean_token_accuracy": 0.2425044521689415, "num_tokens": 114348184.0, "step": 51225 }, { "entropy": 5.2763965129852295, "epoch": 5.753636210479025, "grad_norm": 1.1328125, "learning_rate": 0.000225511147944019, "loss": 4.7992, "mean_token_accuracy": 0.23975655883550645, "num_tokens": 114358156.0, "step": 51230 }, { "entropy": 5.269646167755127, "epoch": 5.754197787386983, "grad_norm": 0.99609375, "learning_rate": 0.00022547198321327223, "loss": 4.7634, "mean_token_accuracy": 0.2446499839425087, "num_tokens": 114369330.0, "step": 51235 }, { "entropy": 5.405162239074707, "epoch": 5.75475936429494, "grad_norm": 1.0625, "learning_rate": 0.0002254328200595168, "loss": 4.8888, "mean_token_accuracy": 0.23165274411439896, "num_tokens": 114380923.0, "step": 51240 }, { "entropy": 5.35341215133667, "epoch": 5.755320941202898, "grad_norm": 1.015625, "learning_rate": 0.00022539365848399967, "loss": 4.8783, "mean_token_accuracy": 0.23412137478590012, "num_tokens": 114392281.0, "step": 51245 }, { "entropy": 5.406776285171508, "epoch": 5.755882518110855, "grad_norm": 1.0078125, "learning_rate": 0.00022535449848796763, "loss": 4.8038, "mean_token_accuracy": 0.24122519046068192, "num_tokens": 114403295.0, "step": 51250 }, { "entropy": 5.39395923614502, "epoch": 5.7564440950188125, "grad_norm": 1.046875, "learning_rate": 0.00022531534007266764, "loss": 4.8857, "mean_token_accuracy": 0.2369815558195114, "num_tokens": 114413507.0, "step": 51255 }, { "entropy": 5.296884489059448, "epoch": 5.757005671926771, "grad_norm": 0.98828125, "learning_rate": 0.00022527618323934652, "loss": 4.8014, "mean_token_accuracy": 0.24328305423259736, "num_tokens": 114426394.0, "step": 51260 }, { "entropy": 5.380506992340088, "epoch": 5.757567248834728, "grad_norm": 1.046875, "learning_rate": 0.00022523702798925093, "loss": 4.8945, "mean_token_accuracy": 0.23547255247831345, "num_tokens": 114438704.0, "step": 51265 }, { "entropy": 5.219447660446167, "epoch": 5.758128825742686, "grad_norm": 1.09375, "learning_rate": 0.00022519787432362777, "loss": 4.7289, "mean_token_accuracy": 0.24249451607465744, "num_tokens": 114449881.0, "step": 51270 }, { "entropy": 5.31497802734375, "epoch": 5.758690402650643, "grad_norm": 1.0, "learning_rate": 0.00022515872224372353, "loss": 4.807, "mean_token_accuracy": 0.2391219586133957, "num_tokens": 114461504.0, "step": 51275 }, { "entropy": 5.345953798294067, "epoch": 5.7592519795586, "grad_norm": 1.0859375, "learning_rate": 0.0002251195717507849, "loss": 4.859, "mean_token_accuracy": 0.22882412523031234, "num_tokens": 114471901.0, "step": 51280 }, { "entropy": 5.275282716751098, "epoch": 5.7598135564665585, "grad_norm": 1.0859375, "learning_rate": 0.00022508042284605852, "loss": 4.7709, "mean_token_accuracy": 0.24114848375320436, "num_tokens": 114483346.0, "step": 51285 }, { "entropy": 5.357812452316284, "epoch": 5.760375133374516, "grad_norm": 1.0546875, "learning_rate": 0.0002250412755307908, "loss": 4.8566, "mean_token_accuracy": 0.24404732286930084, "num_tokens": 114494802.0, "step": 51290 }, { "entropy": 5.32595386505127, "epoch": 5.760936710282473, "grad_norm": 1.0546875, "learning_rate": 0.00022500212980622818, "loss": 4.7208, "mean_token_accuracy": 0.24138077795505525, "num_tokens": 114505856.0, "step": 51295 }, { "entropy": 5.405333566665649, "epoch": 5.761498287190431, "grad_norm": 1.15625, "learning_rate": 0.00022496298567361724, "loss": 4.876, "mean_token_accuracy": 0.24198714792728424, "num_tokens": 114515944.0, "step": 51300 }, { "entropy": 5.377615594863892, "epoch": 5.762059864098388, "grad_norm": 1.0078125, "learning_rate": 0.00022492384313420416, "loss": 4.9439, "mean_token_accuracy": 0.22941087037324906, "num_tokens": 114527401.0, "step": 51305 }, { "entropy": 5.28571138381958, "epoch": 5.762621441006345, "grad_norm": 1.0703125, "learning_rate": 0.00022488470218923534, "loss": 4.716, "mean_token_accuracy": 0.2456533804535866, "num_tokens": 114538335.0, "step": 51310 }, { "entropy": 5.303635120391846, "epoch": 5.7631830179143035, "grad_norm": 0.98828125, "learning_rate": 0.00022484556283995706, "loss": 4.76, "mean_token_accuracy": 0.24764000922441481, "num_tokens": 114550060.0, "step": 51315 }, { "entropy": 5.3178668975830075, "epoch": 5.763744594822261, "grad_norm": 1.0234375, "learning_rate": 0.0002248064250876155, "loss": 4.8541, "mean_token_accuracy": 0.23919204920530318, "num_tokens": 114561912.0, "step": 51320 }, { "entropy": 5.294459009170533, "epoch": 5.764306171730219, "grad_norm": 1.0546875, "learning_rate": 0.00022476728893345687, "loss": 4.8089, "mean_token_accuracy": 0.24784767180681228, "num_tokens": 114572910.0, "step": 51325 }, { "entropy": 5.316967725753784, "epoch": 5.764867748638176, "grad_norm": 1.0546875, "learning_rate": 0.00022472815437872724, "loss": 4.7931, "mean_token_accuracy": 0.23867156952619553, "num_tokens": 114584875.0, "step": 51330 }, { "entropy": 5.3189873695373535, "epoch": 5.765429325546133, "grad_norm": 1.0078125, "learning_rate": 0.00022468902142467267, "loss": 4.7757, "mean_token_accuracy": 0.23896090388298036, "num_tokens": 114595123.0, "step": 51335 }, { "entropy": 5.367301273345947, "epoch": 5.765990902454091, "grad_norm": 1.0546875, "learning_rate": 0.00022464989007253922, "loss": 4.9026, "mean_token_accuracy": 0.22482929974794388, "num_tokens": 114606848.0, "step": 51340 }, { "entropy": 5.350270938873291, "epoch": 5.766552479362049, "grad_norm": 0.98828125, "learning_rate": 0.0002246107603235727, "loss": 4.805, "mean_token_accuracy": 0.23897681385278702, "num_tokens": 114618278.0, "step": 51345 }, { "entropy": 5.312136030197143, "epoch": 5.767114056270006, "grad_norm": 1.1015625, "learning_rate": 0.00022457163217901916, "loss": 4.7463, "mean_token_accuracy": 0.24646656066179276, "num_tokens": 114628158.0, "step": 51350 }, { "entropy": 5.372099304199219, "epoch": 5.767675633177964, "grad_norm": 1.0703125, "learning_rate": 0.0002245325056401244, "loss": 4.8071, "mean_token_accuracy": 0.2432974711060524, "num_tokens": 114639446.0, "step": 51355 }, { "entropy": 5.388066387176513, "epoch": 5.768237210085921, "grad_norm": 0.98046875, "learning_rate": 0.00022449338070813424, "loss": 4.9457, "mean_token_accuracy": 0.22843966633081436, "num_tokens": 114650995.0, "step": 51360 }, { "entropy": 5.228050470352173, "epoch": 5.768798786993878, "grad_norm": 1.1015625, "learning_rate": 0.00022445425738429442, "loss": 4.6706, "mean_token_accuracy": 0.2513738974928856, "num_tokens": 114663484.0, "step": 51365 }, { "entropy": 5.330328178405762, "epoch": 5.7693603639018365, "grad_norm": 0.99609375, "learning_rate": 0.00022441513566985068, "loss": 4.837, "mean_token_accuracy": 0.23621643632650374, "num_tokens": 114675186.0, "step": 51370 }, { "entropy": 5.342471027374268, "epoch": 5.769921940809794, "grad_norm": 1.0234375, "learning_rate": 0.00022437601556604865, "loss": 4.7719, "mean_token_accuracy": 0.24322451651096344, "num_tokens": 114687539.0, "step": 51375 }, { "entropy": 5.363106822967529, "epoch": 5.770483517717752, "grad_norm": 1.03125, "learning_rate": 0.00022433689707413373, "loss": 4.8552, "mean_token_accuracy": 0.24017221331596375, "num_tokens": 114698804.0, "step": 51380 }, { "entropy": 5.376868867874146, "epoch": 5.771045094625709, "grad_norm": 1.046875, "learning_rate": 0.00022429778019535186, "loss": 4.8243, "mean_token_accuracy": 0.23726645559072496, "num_tokens": 114708927.0, "step": 51385 }, { "entropy": 5.323652362823486, "epoch": 5.771606671533666, "grad_norm": 1.0390625, "learning_rate": 0.00022425866493094827, "loss": 4.8613, "mean_token_accuracy": 0.24192046970129014, "num_tokens": 114719835.0, "step": 51390 }, { "entropy": 5.323780965805054, "epoch": 5.772168248441624, "grad_norm": 1.0625, "learning_rate": 0.00022421955128216854, "loss": 4.7868, "mean_token_accuracy": 0.2414919063448906, "num_tokens": 114730420.0, "step": 51395 }, { "entropy": 5.3395918846130375, "epoch": 5.772729825349582, "grad_norm": 1.078125, "learning_rate": 0.0002241804392502579, "loss": 4.7397, "mean_token_accuracy": 0.2436084732413292, "num_tokens": 114740467.0, "step": 51400 }, { "entropy": 5.246948719024658, "epoch": 5.773291402257539, "grad_norm": 1.03125, "learning_rate": 0.00022414132883646183, "loss": 4.7462, "mean_token_accuracy": 0.24216579049825668, "num_tokens": 114751981.0, "step": 51405 }, { "entropy": 5.321401882171631, "epoch": 5.773852979165497, "grad_norm": 1.1328125, "learning_rate": 0.00022410222004202557, "loss": 4.8496, "mean_token_accuracy": 0.24375711530447006, "num_tokens": 114763054.0, "step": 51410 }, { "entropy": 5.4112447738647464, "epoch": 5.774414556073454, "grad_norm": 1.046875, "learning_rate": 0.0002240631128681943, "loss": 4.9416, "mean_token_accuracy": 0.22880327552556992, "num_tokens": 114774540.0, "step": 51415 }, { "entropy": 5.367655515670776, "epoch": 5.774976132981411, "grad_norm": 0.98828125, "learning_rate": 0.00022402400731621336, "loss": 4.7839, "mean_token_accuracy": 0.23801037222146987, "num_tokens": 114785964.0, "step": 51420 }, { "entropy": 5.389012145996094, "epoch": 5.775537709889369, "grad_norm": 1.015625, "learning_rate": 0.0002239849033873278, "loss": 4.8143, "mean_token_accuracy": 0.23612545877695085, "num_tokens": 114797985.0, "step": 51425 }, { "entropy": 5.343607711791992, "epoch": 5.776099286797327, "grad_norm": 0.9140625, "learning_rate": 0.00022394580108278263, "loss": 4.804, "mean_token_accuracy": 0.2486430287361145, "num_tokens": 114809082.0, "step": 51430 }, { "entropy": 5.335655975341797, "epoch": 5.776660863705285, "grad_norm": 1.0390625, "learning_rate": 0.000223906700403823, "loss": 4.8515, "mean_token_accuracy": 0.23501545190811157, "num_tokens": 114820234.0, "step": 51435 }, { "entropy": 5.230275583267212, "epoch": 5.777222440613242, "grad_norm": 1.046875, "learning_rate": 0.00022386760135169388, "loss": 4.6969, "mean_token_accuracy": 0.24931626468896867, "num_tokens": 114829901.0, "step": 51440 }, { "entropy": 5.284165477752685, "epoch": 5.777784017521199, "grad_norm": 1.015625, "learning_rate": 0.00022382850392764015, "loss": 4.7852, "mean_token_accuracy": 0.2374560832977295, "num_tokens": 114839959.0, "step": 51445 }, { "entropy": 5.3351202487945555, "epoch": 5.778345594429157, "grad_norm": 1.0546875, "learning_rate": 0.00022378940813290666, "loss": 4.8606, "mean_token_accuracy": 0.23566230982542039, "num_tokens": 114851385.0, "step": 51450 }, { "entropy": 5.3154796123504635, "epoch": 5.7789071713371145, "grad_norm": 1.046875, "learning_rate": 0.00022375031396873818, "loss": 4.7641, "mean_token_accuracy": 0.24268782287836074, "num_tokens": 114861971.0, "step": 51455 }, { "entropy": 5.265054559707641, "epoch": 5.779468748245073, "grad_norm": 1.09375, "learning_rate": 0.00022371122143637973, "loss": 4.6892, "mean_token_accuracy": 0.24518761932849883, "num_tokens": 114873511.0, "step": 51460 }, { "entropy": 5.3151203155517575, "epoch": 5.78003032515303, "grad_norm": 1.0546875, "learning_rate": 0.00022367213053707587, "loss": 4.8242, "mean_token_accuracy": 0.2332860827445984, "num_tokens": 114885166.0, "step": 51465 }, { "entropy": 5.344426774978638, "epoch": 5.780591902060987, "grad_norm": 1.140625, "learning_rate": 0.00022363304127207123, "loss": 4.8078, "mean_token_accuracy": 0.23814645558595657, "num_tokens": 114896015.0, "step": 51470 }, { "entropy": 5.320563697814942, "epoch": 5.781153478968945, "grad_norm": 1.015625, "learning_rate": 0.00022359395364261048, "loss": 4.7564, "mean_token_accuracy": 0.244650399684906, "num_tokens": 114906369.0, "step": 51475 }, { "entropy": 5.2923667430877686, "epoch": 5.781715055876902, "grad_norm": 1.03125, "learning_rate": 0.00022355486764993822, "loss": 4.7404, "mean_token_accuracy": 0.2464059665799141, "num_tokens": 114917991.0, "step": 51480 }, { "entropy": 5.270185279846191, "epoch": 5.78227663278486, "grad_norm": 1.03125, "learning_rate": 0.00022351578329529893, "loss": 4.7696, "mean_token_accuracy": 0.24113014787435533, "num_tokens": 114928506.0, "step": 51485 }, { "entropy": 5.269151830673218, "epoch": 5.782838209692818, "grad_norm": 1.0625, "learning_rate": 0.000223476700579937, "loss": 4.731, "mean_token_accuracy": 0.24178647994995117, "num_tokens": 114939702.0, "step": 51490 }, { "entropy": 5.3656494140625, "epoch": 5.783399786600775, "grad_norm": 1.03125, "learning_rate": 0.000223437619505097, "loss": 4.8433, "mean_token_accuracy": 0.2451056182384491, "num_tokens": 114952062.0, "step": 51495 }, { "entropy": 5.305613088607788, "epoch": 5.783961363508732, "grad_norm": 1.0703125, "learning_rate": 0.00022339854007202316, "loss": 4.7226, "mean_token_accuracy": 0.24643427431583403, "num_tokens": 114962166.0, "step": 51500 }, { "entropy": 5.281415271759033, "epoch": 5.78452294041669, "grad_norm": 1.0390625, "learning_rate": 0.0002233594622819598, "loss": 4.799, "mean_token_accuracy": 0.23726112842559816, "num_tokens": 114972795.0, "step": 51505 }, { "entropy": 5.4138189315795895, "epoch": 5.7850845173246475, "grad_norm": 0.95703125, "learning_rate": 0.00022332038613615118, "loss": 4.9373, "mean_token_accuracy": 0.2319990172982216, "num_tokens": 114983761.0, "step": 51510 }, { "entropy": 5.3415721416473385, "epoch": 5.785646094232606, "grad_norm": 1.0234375, "learning_rate": 0.00022328131163584154, "loss": 4.8347, "mean_token_accuracy": 0.23886471688747407, "num_tokens": 114995071.0, "step": 51515 }, { "entropy": 5.372035837173462, "epoch": 5.786207671140563, "grad_norm": 1.0390625, "learning_rate": 0.000223242238782275, "loss": 4.8678, "mean_token_accuracy": 0.2369135022163391, "num_tokens": 115007063.0, "step": 51520 }, { "entropy": 5.324918222427368, "epoch": 5.78676924804852, "grad_norm": 0.9921875, "learning_rate": 0.00022320316757669557, "loss": 4.8147, "mean_token_accuracy": 0.23629413843154906, "num_tokens": 115017839.0, "step": 51525 }, { "entropy": 5.287717485427857, "epoch": 5.787330824956478, "grad_norm": 1.0, "learning_rate": 0.00022316409802034743, "loss": 4.771, "mean_token_accuracy": 0.24148973673582078, "num_tokens": 115029154.0, "step": 51530 }, { "entropy": 5.2532322883605955, "epoch": 5.787892401864435, "grad_norm": 1.046875, "learning_rate": 0.0002231250301144745, "loss": 4.6991, "mean_token_accuracy": 0.24504282772541047, "num_tokens": 115039818.0, "step": 51535 }, { "entropy": 5.306731748580932, "epoch": 5.7884539787723925, "grad_norm": 1.0078125, "learning_rate": 0.0002230859638603208, "loss": 4.7823, "mean_token_accuracy": 0.2314349427819252, "num_tokens": 115050531.0, "step": 51540 }, { "entropy": 5.331207895278931, "epoch": 5.789015555680351, "grad_norm": 1.0625, "learning_rate": 0.00022304689925913007, "loss": 4.81, "mean_token_accuracy": 0.24350003600120546, "num_tokens": 115060906.0, "step": 51545 }, { "entropy": 5.423318338394165, "epoch": 5.789577132588308, "grad_norm": 1.046875, "learning_rate": 0.00022300783631214627, "loss": 4.9401, "mean_token_accuracy": 0.22641288489103317, "num_tokens": 115072231.0, "step": 51550 }, { "entropy": 5.295700311660767, "epoch": 5.790138709496265, "grad_norm": 0.9765625, "learning_rate": 0.00022296877502061307, "loss": 4.8388, "mean_token_accuracy": 0.23854895681142807, "num_tokens": 115083931.0, "step": 51555 }, { "entropy": 5.315231084823608, "epoch": 5.790700286404223, "grad_norm": 1.0234375, "learning_rate": 0.00022292971538577427, "loss": 4.8233, "mean_token_accuracy": 0.24155119955539703, "num_tokens": 115095471.0, "step": 51560 }, { "entropy": 5.293683624267578, "epoch": 5.79126186331218, "grad_norm": 0.984375, "learning_rate": 0.00022289065740887354, "loss": 4.7644, "mean_token_accuracy": 0.24360760152339936, "num_tokens": 115107174.0, "step": 51565 }, { "entropy": 5.361393308639526, "epoch": 5.7918234402201385, "grad_norm": 1.0390625, "learning_rate": 0.00022285160109115448, "loss": 4.8449, "mean_token_accuracy": 0.24522320926189423, "num_tokens": 115117328.0, "step": 51570 }, { "entropy": 5.377897119522094, "epoch": 5.792385017128096, "grad_norm": 1.140625, "learning_rate": 0.00022281254643386072, "loss": 4.911, "mean_token_accuracy": 0.23208729773759842, "num_tokens": 115128299.0, "step": 51575 }, { "entropy": 5.353327655792237, "epoch": 5.792946594036053, "grad_norm": 1.078125, "learning_rate": 0.00022277349343823567, "loss": 4.8446, "mean_token_accuracy": 0.23603860288858414, "num_tokens": 115139521.0, "step": 51580 }, { "entropy": 5.380072593688965, "epoch": 5.793508170944011, "grad_norm": 1.1171875, "learning_rate": 0.00022273444210552286, "loss": 4.7917, "mean_token_accuracy": 0.23643328845500947, "num_tokens": 115149869.0, "step": 51585 }, { "entropy": 5.271111726760864, "epoch": 5.794069747851968, "grad_norm": 1.078125, "learning_rate": 0.00022269539243696568, "loss": 4.6942, "mean_token_accuracy": 0.24440861493349075, "num_tokens": 115160390.0, "step": 51590 }, { "entropy": 5.220657014846802, "epoch": 5.7946313247599255, "grad_norm": 0.97265625, "learning_rate": 0.00022265634443380743, "loss": 4.7364, "mean_token_accuracy": 0.24712844491004943, "num_tokens": 115171686.0, "step": 51595 }, { "entropy": 5.369271564483642, "epoch": 5.795192901667884, "grad_norm": 1.0234375, "learning_rate": 0.00022261729809729152, "loss": 4.9346, "mean_token_accuracy": 0.23092354089021683, "num_tokens": 115184285.0, "step": 51600 }, { "entropy": 5.3955573558807375, "epoch": 5.795754478575841, "grad_norm": 1.1328125, "learning_rate": 0.00022257825342866116, "loss": 4.8218, "mean_token_accuracy": 0.2459690362215042, "num_tokens": 115195258.0, "step": 51605 }, { "entropy": 5.388172435760498, "epoch": 5.796316055483798, "grad_norm": 1.0625, "learning_rate": 0.0002225392104291596, "loss": 4.8543, "mean_token_accuracy": 0.2352003797888756, "num_tokens": 115206155.0, "step": 51610 }, { "entropy": 5.248282527923584, "epoch": 5.796877632391756, "grad_norm": 1.1328125, "learning_rate": 0.0002225001691000299, "loss": 4.6949, "mean_token_accuracy": 0.25024876147508623, "num_tokens": 115215545.0, "step": 51615 }, { "entropy": 5.306143712997437, "epoch": 5.797439209299713, "grad_norm": 1.078125, "learning_rate": 0.0002224611294425151, "loss": 4.8467, "mean_token_accuracy": 0.2379753917455673, "num_tokens": 115226586.0, "step": 51620 }, { "entropy": 5.423135709762573, "epoch": 5.7980007862076715, "grad_norm": 1.03125, "learning_rate": 0.0002224220914578584, "loss": 4.8695, "mean_token_accuracy": 0.23780225664377214, "num_tokens": 115237338.0, "step": 51625 }, { "entropy": 5.358355283737183, "epoch": 5.798562363115629, "grad_norm": 1.0625, "learning_rate": 0.00022238305514730267, "loss": 4.8153, "mean_token_accuracy": 0.24581610709428786, "num_tokens": 115247727.0, "step": 51630 }, { "entropy": 5.332873296737671, "epoch": 5.799123940023586, "grad_norm": 1.0234375, "learning_rate": 0.00022234402051209086, "loss": 4.7845, "mean_token_accuracy": 0.2404308408498764, "num_tokens": 115258410.0, "step": 51635 }, { "entropy": 5.384312629699707, "epoch": 5.799685516931544, "grad_norm": 0.97265625, "learning_rate": 0.00022230498755346583, "loss": 4.9032, "mean_token_accuracy": 0.23063233494758606, "num_tokens": 115270474.0, "step": 51640 }, { "entropy": 5.383729124069214, "epoch": 5.800247093839501, "grad_norm": 1.1171875, "learning_rate": 0.00022226595627267048, "loss": 4.8913, "mean_token_accuracy": 0.23396565169095992, "num_tokens": 115280603.0, "step": 51645 }, { "entropy": 5.282470846176148, "epoch": 5.800808670747459, "grad_norm": 1.078125, "learning_rate": 0.00022222692667094756, "loss": 4.7175, "mean_token_accuracy": 0.24562754482030869, "num_tokens": 115291413.0, "step": 51650 }, { "entropy": 5.272460842132569, "epoch": 5.8013702476554165, "grad_norm": 0.98828125, "learning_rate": 0.00022218789874953976, "loss": 4.7366, "mean_token_accuracy": 0.24315459579229354, "num_tokens": 115302480.0, "step": 51655 }, { "entropy": 5.367280578613281, "epoch": 5.801931824563374, "grad_norm": 0.98828125, "learning_rate": 0.00022214887250968974, "loss": 4.8197, "mean_token_accuracy": 0.24274391531944275, "num_tokens": 115313159.0, "step": 51660 }, { "entropy": 5.248348999023437, "epoch": 5.802493401471332, "grad_norm": 1.1484375, "learning_rate": 0.0002221098479526401, "loss": 4.7483, "mean_token_accuracy": 0.2378095030784607, "num_tokens": 115323188.0, "step": 51665 }, { "entropy": 5.310281276702881, "epoch": 5.803054978379289, "grad_norm": 0.9765625, "learning_rate": 0.00022207082507963327, "loss": 4.7632, "mean_token_accuracy": 0.23651974499225617, "num_tokens": 115335865.0, "step": 51670 }, { "entropy": 5.278801345825196, "epoch": 5.803616555287246, "grad_norm": 0.9765625, "learning_rate": 0.00022203180389191208, "loss": 4.7185, "mean_token_accuracy": 0.24759314358234405, "num_tokens": 115347334.0, "step": 51675 }, { "entropy": 5.375073099136353, "epoch": 5.804178132195204, "grad_norm": 0.94921875, "learning_rate": 0.00022199278439071873, "loss": 4.8594, "mean_token_accuracy": 0.23553008139133452, "num_tokens": 115358658.0, "step": 51680 }, { "entropy": 5.223998165130615, "epoch": 5.804739709103162, "grad_norm": 1.1171875, "learning_rate": 0.00022195376657729578, "loss": 4.6414, "mean_token_accuracy": 0.25045770555734637, "num_tokens": 115368299.0, "step": 51685 }, { "entropy": 5.238648414611816, "epoch": 5.805301286011119, "grad_norm": 1.1796875, "learning_rate": 0.00022191475045288533, "loss": 4.7184, "mean_token_accuracy": 0.24589795619249344, "num_tokens": 115379258.0, "step": 51690 }, { "entropy": 5.3334434032440186, "epoch": 5.805862862919077, "grad_norm": 0.98046875, "learning_rate": 0.00022187573601872994, "loss": 4.8873, "mean_token_accuracy": 0.23369628190994263, "num_tokens": 115391103.0, "step": 51695 }, { "entropy": 5.341215324401856, "epoch": 5.806424439827034, "grad_norm": 1.1328125, "learning_rate": 0.00022183672327607168, "loss": 4.7833, "mean_token_accuracy": 0.24056948572397233, "num_tokens": 115401502.0, "step": 51700 }, { "entropy": 5.316876697540283, "epoch": 5.806986016734992, "grad_norm": 0.953125, "learning_rate": 0.00022179771222615268, "loss": 4.8492, "mean_token_accuracy": 0.23198105692863463, "num_tokens": 115412918.0, "step": 51705 }, { "entropy": 5.367710447311401, "epoch": 5.8075475936429495, "grad_norm": 1.0703125, "learning_rate": 0.00022175870287021528, "loss": 4.8416, "mean_token_accuracy": 0.24036489576101303, "num_tokens": 115425497.0, "step": 51710 }, { "entropy": 5.254408740997315, "epoch": 5.808109170550907, "grad_norm": 0.93359375, "learning_rate": 0.00022171969520950143, "loss": 4.7579, "mean_token_accuracy": 0.24395632445812226, "num_tokens": 115436426.0, "step": 51715 }, { "entropy": 5.3099676132202145, "epoch": 5.808670747458865, "grad_norm": 1.0625, "learning_rate": 0.00022168068924525308, "loss": 4.7174, "mean_token_accuracy": 0.2398879274725914, "num_tokens": 115446876.0, "step": 51720 }, { "entropy": 5.311697006225586, "epoch": 5.809232324366822, "grad_norm": 1.1328125, "learning_rate": 0.00022164168497871227, "loss": 4.7647, "mean_token_accuracy": 0.24503686726093293, "num_tokens": 115457319.0, "step": 51725 }, { "entropy": 5.26786241531372, "epoch": 5.809793901274779, "grad_norm": 1.078125, "learning_rate": 0.00022160268241112096, "loss": 4.7269, "mean_token_accuracy": 0.24327296763658524, "num_tokens": 115469605.0, "step": 51730 }, { "entropy": 5.236423921585083, "epoch": 5.810355478182737, "grad_norm": 1.1640625, "learning_rate": 0.0002215636815437209, "loss": 4.6793, "mean_token_accuracy": 0.24247221350669862, "num_tokens": 115480182.0, "step": 51735 }, { "entropy": 5.272430849075318, "epoch": 5.810917055090695, "grad_norm": 1.078125, "learning_rate": 0.00022152468237775387, "loss": 4.7413, "mean_token_accuracy": 0.24355512261390685, "num_tokens": 115490746.0, "step": 51740 }, { "entropy": 5.300336837768555, "epoch": 5.811478631998652, "grad_norm": 0.98046875, "learning_rate": 0.00022148568491446181, "loss": 4.7732, "mean_token_accuracy": 0.2334764838218689, "num_tokens": 115501798.0, "step": 51745 }, { "entropy": 5.31250376701355, "epoch": 5.81204020890661, "grad_norm": 0.94921875, "learning_rate": 0.00022144668915508625, "loss": 4.8129, "mean_token_accuracy": 0.2364277720451355, "num_tokens": 115512855.0, "step": 51750 }, { "entropy": 5.377389907836914, "epoch": 5.812601785814567, "grad_norm": 1.0078125, "learning_rate": 0.00022140769510086894, "loss": 4.8303, "mean_token_accuracy": 0.2327611967921257, "num_tokens": 115523983.0, "step": 51755 }, { "entropy": 5.329485845565796, "epoch": 5.813163362722525, "grad_norm": 1.0390625, "learning_rate": 0.0002213687027530514, "loss": 4.8144, "mean_token_accuracy": 0.2399829849600792, "num_tokens": 115534947.0, "step": 51760 }, { "entropy": 5.236224269866943, "epoch": 5.813724939630482, "grad_norm": 1.0234375, "learning_rate": 0.0002213297121128751, "loss": 4.726, "mean_token_accuracy": 0.23789919018745423, "num_tokens": 115546687.0, "step": 51765 }, { "entropy": 5.3435369491577145, "epoch": 5.81428651653844, "grad_norm": 1.0234375, "learning_rate": 0.0002212907231815816, "loss": 4.8846, "mean_token_accuracy": 0.2403624624013901, "num_tokens": 115558462.0, "step": 51770 }, { "entropy": 5.355800294876099, "epoch": 5.814848093446398, "grad_norm": 1.1328125, "learning_rate": 0.00022125173596041232, "loss": 4.8945, "mean_token_accuracy": 0.2339407354593277, "num_tokens": 115568445.0, "step": 51775 }, { "entropy": 5.393836832046508, "epoch": 5.815409670354355, "grad_norm": 1.2109375, "learning_rate": 0.00022121275045060857, "loss": 4.789, "mean_token_accuracy": 0.2412220522761345, "num_tokens": 115578435.0, "step": 51780 }, { "entropy": 5.3118504047393795, "epoch": 5.815971247262313, "grad_norm": 1.078125, "learning_rate": 0.00022117376665341178, "loss": 4.7741, "mean_token_accuracy": 0.2413351207971573, "num_tokens": 115589393.0, "step": 51785 }, { "entropy": 5.38281021118164, "epoch": 5.81653282417027, "grad_norm": 1.0234375, "learning_rate": 0.00022113478457006308, "loss": 4.9036, "mean_token_accuracy": 0.23469117432832717, "num_tokens": 115601458.0, "step": 51790 }, { "entropy": 5.217300224304199, "epoch": 5.8170944010782275, "grad_norm": 1.078125, "learning_rate": 0.00022109580420180374, "loss": 4.6144, "mean_token_accuracy": 0.2551250696182251, "num_tokens": 115611784.0, "step": 51795 }, { "entropy": 5.225303792953492, "epoch": 5.817655977986185, "grad_norm": 0.98828125, "learning_rate": 0.00022105682554987493, "loss": 4.7148, "mean_token_accuracy": 0.2429789885878563, "num_tokens": 115623717.0, "step": 51800 }, { "entropy": 5.330233764648438, "epoch": 5.818217554894143, "grad_norm": 1.0703125, "learning_rate": 0.0002210178486155177, "loss": 4.8045, "mean_token_accuracy": 0.23886442184448242, "num_tokens": 115634834.0, "step": 51805 }, { "entropy": 5.330279016494751, "epoch": 5.8187791318021, "grad_norm": 1.0234375, "learning_rate": 0.00022097887339997312, "loss": 4.7724, "mean_token_accuracy": 0.24004240781068803, "num_tokens": 115646175.0, "step": 51810 }, { "entropy": 5.3096692085266115, "epoch": 5.819340708710058, "grad_norm": 1.0546875, "learning_rate": 0.00022093989990448203, "loss": 4.7201, "mean_token_accuracy": 0.2427333563566208, "num_tokens": 115657398.0, "step": 51815 }, { "entropy": 5.334406566619873, "epoch": 5.819902285618015, "grad_norm": 0.921875, "learning_rate": 0.00022090092813028563, "loss": 4.7862, "mean_token_accuracy": 0.23620370626449586, "num_tokens": 115670273.0, "step": 51820 }, { "entropy": 5.300399112701416, "epoch": 5.820463862525973, "grad_norm": 1.0703125, "learning_rate": 0.00022086195807862464, "loss": 4.7827, "mean_token_accuracy": 0.24166414141654968, "num_tokens": 115681771.0, "step": 51825 }, { "entropy": 5.261226463317871, "epoch": 5.821025439433931, "grad_norm": 1.0234375, "learning_rate": 0.00022082298975073988, "loss": 4.7234, "mean_token_accuracy": 0.243558931350708, "num_tokens": 115693405.0, "step": 51830 }, { "entropy": 5.33147087097168, "epoch": 5.821587016341888, "grad_norm": 1.1796875, "learning_rate": 0.0002207840231478722, "loss": 4.8365, "mean_token_accuracy": 0.23550816327333451, "num_tokens": 115703683.0, "step": 51835 }, { "entropy": 5.290785312652588, "epoch": 5.822148593249846, "grad_norm": 1.203125, "learning_rate": 0.00022074505827126222, "loss": 4.6972, "mean_token_accuracy": 0.24416192024946212, "num_tokens": 115714815.0, "step": 51840 }, { "entropy": 5.304741716384887, "epoch": 5.822710170157803, "grad_norm": 1.2109375, "learning_rate": 0.00022070609512215062, "loss": 4.8412, "mean_token_accuracy": 0.23058947026729584, "num_tokens": 115725068.0, "step": 51845 }, { "entropy": 5.303268241882324, "epoch": 5.8232717470657605, "grad_norm": 1.0546875, "learning_rate": 0.000220667133701778, "loss": 4.8021, "mean_token_accuracy": 0.2359074205160141, "num_tokens": 115736090.0, "step": 51850 }, { "entropy": 5.335567951202393, "epoch": 5.823833323973719, "grad_norm": 0.99609375, "learning_rate": 0.00022062817401138492, "loss": 4.7866, "mean_token_accuracy": 0.24162097424268722, "num_tokens": 115747727.0, "step": 51855 }, { "entropy": 5.22287769317627, "epoch": 5.824394900881676, "grad_norm": 0.97265625, "learning_rate": 0.00022058921605221189, "loss": 4.7005, "mean_token_accuracy": 0.2438298225402832, "num_tokens": 115758970.0, "step": 51860 }, { "entropy": 5.290819072723389, "epoch": 5.824956477789633, "grad_norm": 0.9921875, "learning_rate": 0.00022055025982549924, "loss": 4.8181, "mean_token_accuracy": 0.23729415088891984, "num_tokens": 115771503.0, "step": 51865 }, { "entropy": 5.28175950050354, "epoch": 5.825518054697591, "grad_norm": 1.109375, "learning_rate": 0.00022051130533248754, "loss": 4.8594, "mean_token_accuracy": 0.23354617655277252, "num_tokens": 115782161.0, "step": 51870 }, { "entropy": 5.300750398635865, "epoch": 5.826079631605548, "grad_norm": 0.99609375, "learning_rate": 0.000220472352574417, "loss": 4.7362, "mean_token_accuracy": 0.2411913365125656, "num_tokens": 115793368.0, "step": 51875 }, { "entropy": 5.329979801177979, "epoch": 5.8266412085135055, "grad_norm": 0.96484375, "learning_rate": 0.00022043340155252788, "loss": 4.7873, "mean_token_accuracy": 0.24106606245040893, "num_tokens": 115804784.0, "step": 51880 }, { "entropy": 5.281415939331055, "epoch": 5.827202785421464, "grad_norm": 0.9921875, "learning_rate": 0.00022039445226806033, "loss": 4.7314, "mean_token_accuracy": 0.24624460488557814, "num_tokens": 115814993.0, "step": 51885 }, { "entropy": 5.345640182495117, "epoch": 5.827764362329421, "grad_norm": 1.0390625, "learning_rate": 0.00022035550472225467, "loss": 4.868, "mean_token_accuracy": 0.23753280192613602, "num_tokens": 115826819.0, "step": 51890 }, { "entropy": 5.387383985519409, "epoch": 5.828325939237379, "grad_norm": 1.0234375, "learning_rate": 0.00022031655891635094, "loss": 4.8842, "mean_token_accuracy": 0.23434273451566695, "num_tokens": 115837948.0, "step": 51895 }, { "entropy": 5.455547571182251, "epoch": 5.828887516145336, "grad_norm": 1.078125, "learning_rate": 0.0002202776148515892, "loss": 5.0104, "mean_token_accuracy": 0.2226386159658432, "num_tokens": 115849404.0, "step": 51900 }, { "entropy": 5.363751935958862, "epoch": 5.829449093053293, "grad_norm": 1.078125, "learning_rate": 0.00022023867252920942, "loss": 4.7737, "mean_token_accuracy": 0.24247547835111619, "num_tokens": 115860885.0, "step": 51905 }, { "entropy": 5.318176174163819, "epoch": 5.8300106699612515, "grad_norm": 0.99609375, "learning_rate": 0.00022019973195045155, "loss": 4.7859, "mean_token_accuracy": 0.24244073778390884, "num_tokens": 115872858.0, "step": 51910 }, { "entropy": 5.354626798629761, "epoch": 5.830572246869209, "grad_norm": 1.046875, "learning_rate": 0.00022016079311655546, "loss": 4.8442, "mean_token_accuracy": 0.24042485505342484, "num_tokens": 115884945.0, "step": 51915 }, { "entropy": 5.281793785095215, "epoch": 5.831133823777166, "grad_norm": 1.078125, "learning_rate": 0.00022012185602876094, "loss": 4.7502, "mean_token_accuracy": 0.23937497437000274, "num_tokens": 115896271.0, "step": 51920 }, { "entropy": 5.272312307357788, "epoch": 5.831695400685124, "grad_norm": 1.078125, "learning_rate": 0.00022008292068830787, "loss": 4.7912, "mean_token_accuracy": 0.23827672898769378, "num_tokens": 115907355.0, "step": 51925 }, { "entropy": 5.3403085231781, "epoch": 5.832256977593081, "grad_norm": 1.09375, "learning_rate": 0.00022004398709643587, "loss": 4.8619, "mean_token_accuracy": 0.23658114820718765, "num_tokens": 115918700.0, "step": 51930 }, { "entropy": 5.280960559844971, "epoch": 5.8328185545010385, "grad_norm": 1.0390625, "learning_rate": 0.00022000505525438462, "loss": 4.7054, "mean_token_accuracy": 0.24480810016393661, "num_tokens": 115930216.0, "step": 51935 }, { "entropy": 5.263738822937012, "epoch": 5.833380131408997, "grad_norm": 1.1171875, "learning_rate": 0.00021996612516339382, "loss": 4.7527, "mean_token_accuracy": 0.23691657930612564, "num_tokens": 115941740.0, "step": 51940 }, { "entropy": 5.26071982383728, "epoch": 5.833941708316954, "grad_norm": 1.046875, "learning_rate": 0.0002199271968247029, "loss": 4.8061, "mean_token_accuracy": 0.24480031430721283, "num_tokens": 115952462.0, "step": 51945 }, { "entropy": 5.304532289505005, "epoch": 5.834503285224912, "grad_norm": 1.046875, "learning_rate": 0.00021988827023955145, "loss": 4.7821, "mean_token_accuracy": 0.24809825867414476, "num_tokens": 115964133.0, "step": 51950 }, { "entropy": 5.282430410385132, "epoch": 5.835064862132869, "grad_norm": 1.015625, "learning_rate": 0.00021984934540917873, "loss": 4.7722, "mean_token_accuracy": 0.23781523257493972, "num_tokens": 115975614.0, "step": 51955 }, { "entropy": 5.324610710144043, "epoch": 5.835626439040826, "grad_norm": 0.90625, "learning_rate": 0.00021981042233482423, "loss": 4.8506, "mean_token_accuracy": 0.23029084950685502, "num_tokens": 115987653.0, "step": 51960 }, { "entropy": 5.246792459487915, "epoch": 5.8361880159487844, "grad_norm": 1.234375, "learning_rate": 0.00021977150101772737, "loss": 4.6558, "mean_token_accuracy": 0.2535387337207794, "num_tokens": 115999401.0, "step": 51965 }, { "entropy": 5.313159990310669, "epoch": 5.836749592856742, "grad_norm": 1.1171875, "learning_rate": 0.00021973258145912728, "loss": 4.8207, "mean_token_accuracy": 0.24127539545297622, "num_tokens": 116011187.0, "step": 51970 }, { "entropy": 5.355815315246582, "epoch": 5.8373111697647, "grad_norm": 1.171875, "learning_rate": 0.00021969366366026327, "loss": 4.8499, "mean_token_accuracy": 0.22961999326944352, "num_tokens": 116022387.0, "step": 51975 }, { "entropy": 5.3730579853057865, "epoch": 5.837872746672657, "grad_norm": 1.046875, "learning_rate": 0.00021965474762237447, "loss": 4.8724, "mean_token_accuracy": 0.24265945106744766, "num_tokens": 116034002.0, "step": 51980 }, { "entropy": 5.350648546218872, "epoch": 5.838434323580614, "grad_norm": 1.0, "learning_rate": 0.0002196158333467, "loss": 4.8844, "mean_token_accuracy": 0.23468669950962068, "num_tokens": 116046380.0, "step": 51985 }, { "entropy": 5.213736057281494, "epoch": 5.838995900488571, "grad_norm": 1.046875, "learning_rate": 0.00021957692083447884, "loss": 4.6987, "mean_token_accuracy": 0.24591419100761414, "num_tokens": 116057898.0, "step": 51990 }, { "entropy": 5.319465494155883, "epoch": 5.8395574773965295, "grad_norm": 1.0390625, "learning_rate": 0.00021953801008694996, "loss": 4.7524, "mean_token_accuracy": 0.23952192813158035, "num_tokens": 116069553.0, "step": 51995 }, { "entropy": 5.2992555618286135, "epoch": 5.840119054304487, "grad_norm": 1.1015625, "learning_rate": 0.00021949910110535242, "loss": 4.713, "mean_token_accuracy": 0.2466202825307846, "num_tokens": 116079782.0, "step": 52000 }, { "entropy": 5.27800931930542, "epoch": 5.840680631212445, "grad_norm": 0.9453125, "learning_rate": 0.00021946019389092503, "loss": 4.7745, "mean_token_accuracy": 0.2390301540493965, "num_tokens": 116091608.0, "step": 52005 }, { "entropy": 5.316182613372803, "epoch": 5.841242208120402, "grad_norm": 1.0234375, "learning_rate": 0.0002194212884449066, "loss": 4.8066, "mean_token_accuracy": 0.23927389979362487, "num_tokens": 116102118.0, "step": 52010 }, { "entropy": 5.347042798995972, "epoch": 5.841803785028359, "grad_norm": 1.1171875, "learning_rate": 0.0002193823847685359, "loss": 4.8634, "mean_token_accuracy": 0.23595324009656907, "num_tokens": 116113490.0, "step": 52015 }, { "entropy": 5.282469320297241, "epoch": 5.842365361936317, "grad_norm": 1.0625, "learning_rate": 0.00021934348286305167, "loss": 4.7906, "mean_token_accuracy": 0.24581867307424546, "num_tokens": 116125082.0, "step": 52020 }, { "entropy": 5.278296756744385, "epoch": 5.842926938844275, "grad_norm": 1.1015625, "learning_rate": 0.00021930458272969243, "loss": 4.7757, "mean_token_accuracy": 0.23865014165639878, "num_tokens": 116135217.0, "step": 52025 }, { "entropy": 5.293130588531494, "epoch": 5.843488515752233, "grad_norm": 1.078125, "learning_rate": 0.00021926568436969685, "loss": 4.7384, "mean_token_accuracy": 0.23734684884548188, "num_tokens": 116146565.0, "step": 52030 }, { "entropy": 5.438349866867066, "epoch": 5.84405009266019, "grad_norm": 1.078125, "learning_rate": 0.0002192267877843036, "loss": 4.9475, "mean_token_accuracy": 0.2344321444630623, "num_tokens": 116157805.0, "step": 52035 }, { "entropy": 5.413228321075439, "epoch": 5.844611669568147, "grad_norm": 1.03125, "learning_rate": 0.00021918789297475106, "loss": 4.8828, "mean_token_accuracy": 0.23845165967941284, "num_tokens": 116170073.0, "step": 52040 }, { "entropy": 5.31778359413147, "epoch": 5.845173246476105, "grad_norm": 1.15625, "learning_rate": 0.00021914899994227767, "loss": 4.723, "mean_token_accuracy": 0.2449008882045746, "num_tokens": 116180102.0, "step": 52045 }, { "entropy": 5.324584054946899, "epoch": 5.8457348233840625, "grad_norm": 1.0703125, "learning_rate": 0.00021911010868812174, "loss": 4.804, "mean_token_accuracy": 0.23759617358446122, "num_tokens": 116190160.0, "step": 52050 }, { "entropy": 5.205485677719116, "epoch": 5.84629640029202, "grad_norm": 1.0, "learning_rate": 0.00021907121921352162, "loss": 4.667, "mean_token_accuracy": 0.24842192083597184, "num_tokens": 116201496.0, "step": 52055 }, { "entropy": 5.363065195083618, "epoch": 5.846857977199978, "grad_norm": 1.0546875, "learning_rate": 0.00021903233151971562, "loss": 4.8339, "mean_token_accuracy": 0.23541479110717772, "num_tokens": 116213265.0, "step": 52060 }, { "entropy": 5.279172420501709, "epoch": 5.847419554107935, "grad_norm": 0.97265625, "learning_rate": 0.00021899344560794183, "loss": 4.7612, "mean_token_accuracy": 0.24774031341075897, "num_tokens": 116225034.0, "step": 52065 }, { "entropy": 5.314350938796997, "epoch": 5.847981131015892, "grad_norm": 1.1328125, "learning_rate": 0.00021895456147943848, "loss": 4.7636, "mean_token_accuracy": 0.24711343348026277, "num_tokens": 116236358.0, "step": 52070 }, { "entropy": 5.294891357421875, "epoch": 5.84854270792385, "grad_norm": 1.03125, "learning_rate": 0.00021891567913544363, "loss": 4.8259, "mean_token_accuracy": 0.23810407370328904, "num_tokens": 116248433.0, "step": 52075 }, { "entropy": 5.350520086288452, "epoch": 5.8491042848318076, "grad_norm": 0.99609375, "learning_rate": 0.00021887679857719535, "loss": 4.7881, "mean_token_accuracy": 0.2427320033311844, "num_tokens": 116260324.0, "step": 52080 }, { "entropy": 5.350294780731201, "epoch": 5.849665861739766, "grad_norm": 0.94140625, "learning_rate": 0.00021883791980593153, "loss": 4.8086, "mean_token_accuracy": 0.2520646572113037, "num_tokens": 116271712.0, "step": 52085 }, { "entropy": 5.354401159286499, "epoch": 5.850227438647723, "grad_norm": 1.09375, "learning_rate": 0.00021879904282289008, "loss": 4.8432, "mean_token_accuracy": 0.23567491471767427, "num_tokens": 116282923.0, "step": 52090 }, { "entropy": 5.213904142379761, "epoch": 5.85078901555568, "grad_norm": 1.03125, "learning_rate": 0.000218760167629309, "loss": 4.7121, "mean_token_accuracy": 0.24323923885822296, "num_tokens": 116294064.0, "step": 52095 }, { "entropy": 5.254127311706543, "epoch": 5.851350592463638, "grad_norm": 1.125, "learning_rate": 0.0002187212942264259, "loss": 4.7065, "mean_token_accuracy": 0.24513959735631943, "num_tokens": 116305861.0, "step": 52100 }, { "entropy": 5.268340396881103, "epoch": 5.851912169371595, "grad_norm": 1.0625, "learning_rate": 0.0002186824226154786, "loss": 4.8285, "mean_token_accuracy": 0.23865508735179902, "num_tokens": 116317255.0, "step": 52105 }, { "entropy": 5.3726695537567135, "epoch": 5.852473746279553, "grad_norm": 1.1640625, "learning_rate": 0.00021864355279770494, "loss": 4.8984, "mean_token_accuracy": 0.23277236223220826, "num_tokens": 116328506.0, "step": 52110 }, { "entropy": 5.278265047073364, "epoch": 5.853035323187511, "grad_norm": 0.9921875, "learning_rate": 0.0002186046847743423, "loss": 4.7242, "mean_token_accuracy": 0.24662187844514846, "num_tokens": 116339456.0, "step": 52115 }, { "entropy": 5.238146543502808, "epoch": 5.853596900095468, "grad_norm": 1.03125, "learning_rate": 0.00021856581854662845, "loss": 4.7687, "mean_token_accuracy": 0.2484685882925987, "num_tokens": 116349915.0, "step": 52120 }, { "entropy": 5.305943298339844, "epoch": 5.854158477003425, "grad_norm": 0.9296875, "learning_rate": 0.00021852695411580083, "loss": 4.8327, "mean_token_accuracy": 0.23384024053812028, "num_tokens": 116362362.0, "step": 52125 }, { "entropy": 5.255475950241089, "epoch": 5.854720053911383, "grad_norm": 1.046875, "learning_rate": 0.00021848809148309684, "loss": 4.6974, "mean_token_accuracy": 0.24392309188842773, "num_tokens": 116373955.0, "step": 52130 }, { "entropy": 5.339780998229981, "epoch": 5.8552816308193405, "grad_norm": 0.98828125, "learning_rate": 0.00021844923064975397, "loss": 4.7505, "mean_token_accuracy": 0.24256467670202256, "num_tokens": 116384528.0, "step": 52135 }, { "entropy": 5.313487434387207, "epoch": 5.855843207727299, "grad_norm": 0.99609375, "learning_rate": 0.00021841037161700943, "loss": 4.7688, "mean_token_accuracy": 0.24961293041706084, "num_tokens": 116395600.0, "step": 52140 }, { "entropy": 5.319756507873535, "epoch": 5.856404784635256, "grad_norm": 1.0390625, "learning_rate": 0.00021837151438610074, "loss": 4.7059, "mean_token_accuracy": 0.24923174530267717, "num_tokens": 116406427.0, "step": 52145 }, { "entropy": 5.315813732147217, "epoch": 5.856966361543213, "grad_norm": 1.1015625, "learning_rate": 0.00021833265895826492, "loss": 4.7855, "mean_token_accuracy": 0.24354251325130463, "num_tokens": 116417707.0, "step": 52150 }, { "entropy": 5.327625799179077, "epoch": 5.857527938451171, "grad_norm": 1.015625, "learning_rate": 0.00021829380533473924, "loss": 4.756, "mean_token_accuracy": 0.2469869777560234, "num_tokens": 116428311.0, "step": 52155 }, { "entropy": 5.288520002365113, "epoch": 5.858089515359128, "grad_norm": 1.046875, "learning_rate": 0.00021825495351676083, "loss": 4.782, "mean_token_accuracy": 0.24147259145975114, "num_tokens": 116438579.0, "step": 52160 }, { "entropy": 5.25305871963501, "epoch": 5.8586510922670865, "grad_norm": 1.0625, "learning_rate": 0.00021821610350556664, "loss": 4.7322, "mean_token_accuracy": 0.2450373038649559, "num_tokens": 116449360.0, "step": 52165 }, { "entropy": 5.351304626464843, "epoch": 5.859212669175044, "grad_norm": 1.046875, "learning_rate": 0.0002181772553023938, "loss": 4.9107, "mean_token_accuracy": 0.22663556337356566, "num_tokens": 116459583.0, "step": 52170 }, { "entropy": 5.308622932434082, "epoch": 5.859774246083001, "grad_norm": 1.078125, "learning_rate": 0.00021813840890847904, "loss": 4.7782, "mean_token_accuracy": 0.2513938143849373, "num_tokens": 116470771.0, "step": 52175 }, { "entropy": 5.263450574874878, "epoch": 5.860335822990958, "grad_norm": 1.0078125, "learning_rate": 0.0002180995643250595, "loss": 4.7352, "mean_token_accuracy": 0.24555165320634842, "num_tokens": 116482900.0, "step": 52180 }, { "entropy": 5.340573453903199, "epoch": 5.860897399898916, "grad_norm": 1.0859375, "learning_rate": 0.0002180607215533719, "loss": 4.8098, "mean_token_accuracy": 0.24643135219812393, "num_tokens": 116493499.0, "step": 52185 }, { "entropy": 5.319741725921631, "epoch": 5.8614589768068734, "grad_norm": 1.015625, "learning_rate": 0.00021802188059465304, "loss": 4.7964, "mean_token_accuracy": 0.24311316907405853, "num_tokens": 116504437.0, "step": 52190 }, { "entropy": 5.264760208129883, "epoch": 5.8620205537148315, "grad_norm": 1.1171875, "learning_rate": 0.0002179830414501396, "loss": 4.6867, "mean_token_accuracy": 0.24633391350507736, "num_tokens": 116514142.0, "step": 52195 }, { "entropy": 5.3389074325561525, "epoch": 5.862582130622789, "grad_norm": 1.015625, "learning_rate": 0.00021794420412106825, "loss": 4.8756, "mean_token_accuracy": 0.2331741690635681, "num_tokens": 116525408.0, "step": 52200 }, { "entropy": 5.371243286132812, "epoch": 5.863143707530746, "grad_norm": 0.95703125, "learning_rate": 0.00021790536860867555, "loss": 4.8399, "mean_token_accuracy": 0.24093413203954697, "num_tokens": 116536920.0, "step": 52205 }, { "entropy": 5.302493715286255, "epoch": 5.863705284438704, "grad_norm": 1.078125, "learning_rate": 0.000217866534914198, "loss": 4.7923, "mean_token_accuracy": 0.2368660166859627, "num_tokens": 116547437.0, "step": 52210 }, { "entropy": 5.2621105194091795, "epoch": 5.864266861346661, "grad_norm": 0.9765625, "learning_rate": 0.00021782770303887218, "loss": 4.726, "mean_token_accuracy": 0.24794248938560487, "num_tokens": 116557718.0, "step": 52215 }, { "entropy": 5.260115718841552, "epoch": 5.864828438254619, "grad_norm": 1.0859375, "learning_rate": 0.00021778887298393447, "loss": 4.7781, "mean_token_accuracy": 0.23761823773384094, "num_tokens": 116569486.0, "step": 52220 }, { "entropy": 5.36255407333374, "epoch": 5.865390015162577, "grad_norm": 1.046875, "learning_rate": 0.0002177500447506212, "loss": 4.9232, "mean_token_accuracy": 0.23078247755765915, "num_tokens": 116580617.0, "step": 52225 }, { "entropy": 5.391385078430176, "epoch": 5.865951592070534, "grad_norm": 1.09375, "learning_rate": 0.00021771121834016877, "loss": 4.9655, "mean_token_accuracy": 0.23164264261722564, "num_tokens": 116590815.0, "step": 52230 }, { "entropy": 5.36133131980896, "epoch": 5.866513168978492, "grad_norm": 1.0234375, "learning_rate": 0.00021767239375381338, "loss": 4.8356, "mean_token_accuracy": 0.2349330872297287, "num_tokens": 116601755.0, "step": 52235 }, { "entropy": 5.3380897521972654, "epoch": 5.867074745886449, "grad_norm": 1.140625, "learning_rate": 0.00021763357099279114, "loss": 4.7835, "mean_token_accuracy": 0.2450447142124176, "num_tokens": 116611895.0, "step": 52240 }, { "entropy": 5.312600564956665, "epoch": 5.867636322794406, "grad_norm": 1.109375, "learning_rate": 0.00021759475005833818, "loss": 4.8027, "mean_token_accuracy": 0.23749465495347977, "num_tokens": 116623054.0, "step": 52245 }, { "entropy": 5.41942024230957, "epoch": 5.8681978997023645, "grad_norm": 1.078125, "learning_rate": 0.00021755593095169074, "loss": 4.8852, "mean_token_accuracy": 0.23144979923963546, "num_tokens": 116634700.0, "step": 52250 }, { "entropy": 5.393616104125977, "epoch": 5.868759476610322, "grad_norm": 1.046875, "learning_rate": 0.0002175171136740847, "loss": 4.8609, "mean_token_accuracy": 0.236311237514019, "num_tokens": 116645907.0, "step": 52255 }, { "entropy": 5.353059196472168, "epoch": 5.869321053518279, "grad_norm": 1.078125, "learning_rate": 0.00021747829822675612, "loss": 4.7994, "mean_token_accuracy": 0.24315326362848283, "num_tokens": 116656584.0, "step": 52260 }, { "entropy": 5.364986085891724, "epoch": 5.869882630426237, "grad_norm": 1.015625, "learning_rate": 0.00021743948461094083, "loss": 4.8435, "mean_token_accuracy": 0.23231004625558854, "num_tokens": 116667934.0, "step": 52265 }, { "entropy": 5.334745597839356, "epoch": 5.870444207334194, "grad_norm": 1.125, "learning_rate": 0.00021740067282787463, "loss": 4.8038, "mean_token_accuracy": 0.242742058634758, "num_tokens": 116678773.0, "step": 52270 }, { "entropy": 5.361050701141357, "epoch": 5.871005784242152, "grad_norm": 0.97265625, "learning_rate": 0.00021736186287879338, "loss": 4.8652, "mean_token_accuracy": 0.23464329093694686, "num_tokens": 116690376.0, "step": 52275 }, { "entropy": 5.381990718841553, "epoch": 5.87156736115011, "grad_norm": 1.0546875, "learning_rate": 0.0002173230547649327, "loss": 4.8324, "mean_token_accuracy": 0.24207522720098495, "num_tokens": 116700831.0, "step": 52280 }, { "entropy": 5.384974098205566, "epoch": 5.872128938058067, "grad_norm": 1.1015625, "learning_rate": 0.00021728424848752842, "loss": 4.871, "mean_token_accuracy": 0.24117059260606766, "num_tokens": 116712675.0, "step": 52285 }, { "entropy": 5.304960775375366, "epoch": 5.872690514966025, "grad_norm": 1.0390625, "learning_rate": 0.00021724544404781598, "loss": 4.8344, "mean_token_accuracy": 0.23482557535171508, "num_tokens": 116724821.0, "step": 52290 }, { "entropy": 5.293739318847656, "epoch": 5.873252091873982, "grad_norm": 1.03125, "learning_rate": 0.00021720664144703105, "loss": 4.7962, "mean_token_accuracy": 0.23864217847585678, "num_tokens": 116736216.0, "step": 52295 }, { "entropy": 5.3224530696868895, "epoch": 5.873813668781939, "grad_norm": 1.140625, "learning_rate": 0.00021716784068640904, "loss": 4.8128, "mean_token_accuracy": 0.24054273962974548, "num_tokens": 116747827.0, "step": 52300 }, { "entropy": 5.323281192779541, "epoch": 5.874375245689897, "grad_norm": 1.015625, "learning_rate": 0.00021712904176718545, "loss": 4.7971, "mean_token_accuracy": 0.2366036906838417, "num_tokens": 116757849.0, "step": 52305 }, { "entropy": 5.3227475643157955, "epoch": 5.874936822597855, "grad_norm": 1.1171875, "learning_rate": 0.00021709024469059564, "loss": 4.7709, "mean_token_accuracy": 0.23898344188928605, "num_tokens": 116769341.0, "step": 52310 }, { "entropy": 5.3447352886199955, "epoch": 5.875498399505812, "grad_norm": 1.0078125, "learning_rate": 0.00021705144945787487, "loss": 4.8414, "mean_token_accuracy": 0.23225641697645188, "num_tokens": 116780655.0, "step": 52315 }, { "entropy": 5.288556528091431, "epoch": 5.87605997641377, "grad_norm": 1.0, "learning_rate": 0.00021701265607025828, "loss": 4.76, "mean_token_accuracy": 0.24420306384563445, "num_tokens": 116792130.0, "step": 52320 }, { "entropy": 5.278102397918701, "epoch": 5.876621553321727, "grad_norm": 0.93359375, "learning_rate": 0.00021697386452898133, "loss": 4.8275, "mean_token_accuracy": 0.2405288577079773, "num_tokens": 116803902.0, "step": 52325 }, { "entropy": 5.2946936130523685, "epoch": 5.877183130229685, "grad_norm": 0.94921875, "learning_rate": 0.00021693507483527908, "loss": 4.7879, "mean_token_accuracy": 0.23899690806865692, "num_tokens": 116815657.0, "step": 52330 }, { "entropy": 5.336142873764038, "epoch": 5.8777447071376425, "grad_norm": 1.0859375, "learning_rate": 0.00021689628699038648, "loss": 4.8804, "mean_token_accuracy": 0.2349557563662529, "num_tokens": 116826969.0, "step": 52335 }, { "entropy": 5.314441108703614, "epoch": 5.8783062840456, "grad_norm": 1.1171875, "learning_rate": 0.00021685750099553874, "loss": 4.7059, "mean_token_accuracy": 0.24036201238632202, "num_tokens": 116837532.0, "step": 52340 }, { "entropy": 5.251613807678223, "epoch": 5.878867860953558, "grad_norm": 1.0078125, "learning_rate": 0.00021681871685197068, "loss": 4.6691, "mean_token_accuracy": 0.2471660017967224, "num_tokens": 116848248.0, "step": 52345 }, { "entropy": 5.319881296157837, "epoch": 5.879429437861515, "grad_norm": 1.125, "learning_rate": 0.00021677993456091727, "loss": 4.801, "mean_token_accuracy": 0.23996011465787886, "num_tokens": 116858352.0, "step": 52350 }, { "entropy": 5.290220880508423, "epoch": 5.879991014769473, "grad_norm": 1.0234375, "learning_rate": 0.00021674115412361324, "loss": 4.7978, "mean_token_accuracy": 0.24188912957906722, "num_tokens": 116869323.0, "step": 52355 }, { "entropy": 5.3869682312011715, "epoch": 5.88055259167743, "grad_norm": 1.09375, "learning_rate": 0.00021670237554129347, "loss": 4.9371, "mean_token_accuracy": 0.236181902885437, "num_tokens": 116881254.0, "step": 52360 }, { "entropy": 5.46140341758728, "epoch": 5.881114168585388, "grad_norm": 1.015625, "learning_rate": 0.0002166635988151927, "loss": 4.9588, "mean_token_accuracy": 0.22845247983932496, "num_tokens": 116893614.0, "step": 52365 }, { "entropy": 5.376405715942383, "epoch": 5.881675745493345, "grad_norm": 1.046875, "learning_rate": 0.0002166248239465456, "loss": 4.8556, "mean_token_accuracy": 0.23973244726657866, "num_tokens": 116904404.0, "step": 52370 }, { "entropy": 5.414957189559937, "epoch": 5.882237322401303, "grad_norm": 1.0546875, "learning_rate": 0.00021658605093658674, "loss": 4.8912, "mean_token_accuracy": 0.2324964538216591, "num_tokens": 116916349.0, "step": 52375 }, { "entropy": 5.327965879440308, "epoch": 5.88279889930926, "grad_norm": 1.0546875, "learning_rate": 0.00021654727978655066, "loss": 4.7467, "mean_token_accuracy": 0.24598519653081893, "num_tokens": 116926414.0, "step": 52380 }, { "entropy": 5.307403135299682, "epoch": 5.883360476217218, "grad_norm": 1.0546875, "learning_rate": 0.00021650851049767185, "loss": 4.8121, "mean_token_accuracy": 0.2532970324158669, "num_tokens": 116937821.0, "step": 52385 }, { "entropy": 5.273918962478637, "epoch": 5.8839220531251755, "grad_norm": 1.0078125, "learning_rate": 0.00021646974307118467, "loss": 4.812, "mean_token_accuracy": 0.23287705183029175, "num_tokens": 116949125.0, "step": 52390 }, { "entropy": 5.320056772232055, "epoch": 5.884483630033133, "grad_norm": 1.0390625, "learning_rate": 0.00021643097750832365, "loss": 4.708, "mean_token_accuracy": 0.24672023206949234, "num_tokens": 116959994.0, "step": 52395 }, { "entropy": 5.37435245513916, "epoch": 5.885045206941091, "grad_norm": 0.984375, "learning_rate": 0.00021639221381032303, "loss": 4.7798, "mean_token_accuracy": 0.24144816100597383, "num_tokens": 116971248.0, "step": 52400 }, { "entropy": 5.300677299499512, "epoch": 5.885606783849048, "grad_norm": 0.953125, "learning_rate": 0.00021635345197841712, "loss": 4.7509, "mean_token_accuracy": 0.2427266389131546, "num_tokens": 116982013.0, "step": 52405 }, { "entropy": 5.3028887748718265, "epoch": 5.886168360757006, "grad_norm": 1.046875, "learning_rate": 0.0002163146920138399, "loss": 4.8486, "mean_token_accuracy": 0.23087591975927352, "num_tokens": 116993469.0, "step": 52410 }, { "entropy": 5.3081221103668215, "epoch": 5.886729937664963, "grad_norm": 1.0546875, "learning_rate": 0.00021627593391782574, "loss": 4.7649, "mean_token_accuracy": 0.23843368142843246, "num_tokens": 117004171.0, "step": 52415 }, { "entropy": 5.293523454666138, "epoch": 5.8872915145729205, "grad_norm": 1.09375, "learning_rate": 0.00021623717769160862, "loss": 4.7426, "mean_token_accuracy": 0.2504502832889557, "num_tokens": 117014894.0, "step": 52420 }, { "entropy": 5.3123941898345945, "epoch": 5.887853091480879, "grad_norm": 1.0078125, "learning_rate": 0.00021619842333642252, "loss": 4.79, "mean_token_accuracy": 0.2436143770813942, "num_tokens": 117026450.0, "step": 52425 }, { "entropy": 5.296234464645385, "epoch": 5.888414668388836, "grad_norm": 0.92578125, "learning_rate": 0.00021615967085350147, "loss": 4.8238, "mean_token_accuracy": 0.23865356892347336, "num_tokens": 117039158.0, "step": 52430 }, { "entropy": 5.332911109924316, "epoch": 5.888976245296793, "grad_norm": 1.109375, "learning_rate": 0.00021612092024407925, "loss": 4.8293, "mean_token_accuracy": 0.24340758025646209, "num_tokens": 117048996.0, "step": 52435 }, { "entropy": 5.362594938278198, "epoch": 5.889537822204751, "grad_norm": 1.0703125, "learning_rate": 0.00021608217150938987, "loss": 4.7997, "mean_token_accuracy": 0.2314944490790367, "num_tokens": 117060139.0, "step": 52440 }, { "entropy": 5.34909987449646, "epoch": 5.890099399112708, "grad_norm": 1.015625, "learning_rate": 0.0002160434246506669, "loss": 4.7941, "mean_token_accuracy": 0.23605460524559022, "num_tokens": 117071766.0, "step": 52445 }, { "entropy": 5.346598100662232, "epoch": 5.890660976020666, "grad_norm": 1.0390625, "learning_rate": 0.0002160046796691442, "loss": 4.8723, "mean_token_accuracy": 0.22950120866298676, "num_tokens": 117083459.0, "step": 52450 }, { "entropy": 5.2549303531646725, "epoch": 5.891222552928624, "grad_norm": 1.0078125, "learning_rate": 0.0002159659365660554, "loss": 4.7509, "mean_token_accuracy": 0.2412627026438713, "num_tokens": 117096538.0, "step": 52455 }, { "entropy": 5.284158992767334, "epoch": 5.891784129836581, "grad_norm": 0.98046875, "learning_rate": 0.000215927195342634, "loss": 4.6897, "mean_token_accuracy": 0.24352446049451829, "num_tokens": 117107787.0, "step": 52460 }, { "entropy": 5.403974819183349, "epoch": 5.892345706744539, "grad_norm": 1.140625, "learning_rate": 0.00021588845600011364, "loss": 4.8266, "mean_token_accuracy": 0.23382043838500977, "num_tokens": 117117734.0, "step": 52465 }, { "entropy": 5.313464975357055, "epoch": 5.892907283652496, "grad_norm": 1.015625, "learning_rate": 0.0002158497185397278, "loss": 4.7779, "mean_token_accuracy": 0.2442946583032608, "num_tokens": 117129571.0, "step": 52470 }, { "entropy": 5.3234447002410885, "epoch": 5.8934688605604535, "grad_norm": 1.046875, "learning_rate": 0.00021581098296270985, "loss": 4.7341, "mean_token_accuracy": 0.2465335786342621, "num_tokens": 117140696.0, "step": 52475 }, { "entropy": 5.318042325973511, "epoch": 5.894030437468412, "grad_norm": 1.109375, "learning_rate": 0.00021577224927029322, "loss": 4.7893, "mean_token_accuracy": 0.23674688190221788, "num_tokens": 117151491.0, "step": 52480 }, { "entropy": 5.355563735961914, "epoch": 5.894592014376369, "grad_norm": 0.9609375, "learning_rate": 0.00021573351746371106, "loss": 4.8632, "mean_token_accuracy": 0.23320467621088029, "num_tokens": 117163515.0, "step": 52485 }, { "entropy": 5.402954483032227, "epoch": 5.895153591284326, "grad_norm": 1.1171875, "learning_rate": 0.00021569478754419674, "loss": 4.8805, "mean_token_accuracy": 0.22959672957658767, "num_tokens": 117174936.0, "step": 52490 }, { "entropy": 5.39686861038208, "epoch": 5.895715168192284, "grad_norm": 1.09375, "learning_rate": 0.00021565605951298335, "loss": 4.8799, "mean_token_accuracy": 0.23701776564121246, "num_tokens": 117185888.0, "step": 52495 }, { "entropy": 5.297519111633301, "epoch": 5.896276745100241, "grad_norm": 1.09375, "learning_rate": 0.000215617333371304, "loss": 4.6682, "mean_token_accuracy": 0.24988609701395034, "num_tokens": 117195762.0, "step": 52500 }, { "entropy": 5.375298023223877, "epoch": 5.896838322008199, "grad_norm": 1.1015625, "learning_rate": 0.00021557860912039184, "loss": 4.8987, "mean_token_accuracy": 0.23327751010656356, "num_tokens": 117206431.0, "step": 52505 }, { "entropy": 5.3422607421875, "epoch": 5.897399898916157, "grad_norm": 0.9921875, "learning_rate": 0.00021553988676147984, "loss": 4.8126, "mean_token_accuracy": 0.2339986115694046, "num_tokens": 117217712.0, "step": 52510 }, { "entropy": 5.241910648345947, "epoch": 5.897961475824114, "grad_norm": 1.0703125, "learning_rate": 0.0002155011662958009, "loss": 4.6784, "mean_token_accuracy": 0.24025077521800994, "num_tokens": 117228103.0, "step": 52515 }, { "entropy": 5.222621440887451, "epoch": 5.898523052732072, "grad_norm": 1.0703125, "learning_rate": 0.00021546244772458785, "loss": 4.66, "mean_token_accuracy": 0.2508206024765968, "num_tokens": 117238851.0, "step": 52520 }, { "entropy": 5.376227617263794, "epoch": 5.899084629640029, "grad_norm": 1.078125, "learning_rate": 0.00021542373104907364, "loss": 4.8945, "mean_token_accuracy": 0.23815090954303741, "num_tokens": 117250138.0, "step": 52525 }, { "entropy": 5.425632762908935, "epoch": 5.899646206547986, "grad_norm": 0.99609375, "learning_rate": 0.00021538501627049085, "loss": 4.9811, "mean_token_accuracy": 0.22889527082443237, "num_tokens": 117263572.0, "step": 52530 }, { "entropy": 5.336065006256104, "epoch": 5.9002077834559445, "grad_norm": 1.1171875, "learning_rate": 0.00021534630339007223, "loss": 4.8559, "mean_token_accuracy": 0.23768599778413774, "num_tokens": 117273824.0, "step": 52535 }, { "entropy": 5.398649072647094, "epoch": 5.900769360363902, "grad_norm": 1.03125, "learning_rate": 0.0002153075924090505, "loss": 4.8896, "mean_token_accuracy": 0.23595982044935226, "num_tokens": 117285099.0, "step": 52540 }, { "entropy": 5.38257622718811, "epoch": 5.90133093727186, "grad_norm": 0.953125, "learning_rate": 0.00021526888332865817, "loss": 4.8162, "mean_token_accuracy": 0.23543430119752884, "num_tokens": 117297007.0, "step": 52545 }, { "entropy": 5.355287551879883, "epoch": 5.901892514179817, "grad_norm": 1.1171875, "learning_rate": 0.00021523017615012786, "loss": 4.8612, "mean_token_accuracy": 0.2337565615773201, "num_tokens": 117308429.0, "step": 52550 }, { "entropy": 5.247079992294312, "epoch": 5.902454091087774, "grad_norm": 1.125, "learning_rate": 0.00021519147087469182, "loss": 4.6534, "mean_token_accuracy": 0.25455627888441085, "num_tokens": 117318643.0, "step": 52555 }, { "entropy": 5.322048091888428, "epoch": 5.9030156679957315, "grad_norm": 1.015625, "learning_rate": 0.00021515276750358258, "loss": 4.881, "mean_token_accuracy": 0.23063185662031174, "num_tokens": 117331810.0, "step": 52560 }, { "entropy": 5.383693647384644, "epoch": 5.90357724490369, "grad_norm": 1.0546875, "learning_rate": 0.00021511406603803247, "loss": 4.808, "mean_token_accuracy": 0.23875497430562972, "num_tokens": 117342963.0, "step": 52565 }, { "entropy": 5.318366146087646, "epoch": 5.904138821811647, "grad_norm": 0.9765625, "learning_rate": 0.00021507536647927361, "loss": 4.7631, "mean_token_accuracy": 0.24394513219594954, "num_tokens": 117352421.0, "step": 52570 }, { "entropy": 5.333449363708496, "epoch": 5.904700398719605, "grad_norm": 1.21875, "learning_rate": 0.0002150366688285384, "loss": 4.8259, "mean_token_accuracy": 0.23856592625379563, "num_tokens": 117362947.0, "step": 52575 }, { "entropy": 5.362803411483765, "epoch": 5.905261975627562, "grad_norm": 1.0, "learning_rate": 0.00021499797308705893, "loss": 4.8913, "mean_token_accuracy": 0.23900776505470275, "num_tokens": 117375102.0, "step": 52580 }, { "entropy": 5.297739887237549, "epoch": 5.905823552535519, "grad_norm": 1.1015625, "learning_rate": 0.00021495927925606722, "loss": 4.6975, "mean_token_accuracy": 0.24490772187709808, "num_tokens": 117385356.0, "step": 52585 }, { "entropy": 5.4017750263214115, "epoch": 5.9063851294434775, "grad_norm": 1.0390625, "learning_rate": 0.00021492058733679542, "loss": 4.8577, "mean_token_accuracy": 0.23617078810930253, "num_tokens": 117396106.0, "step": 52590 }, { "entropy": 5.373436164855957, "epoch": 5.906946706351435, "grad_norm": 0.9609375, "learning_rate": 0.00021488189733047535, "loss": 4.8712, "mean_token_accuracy": 0.22724589109420776, "num_tokens": 117407176.0, "step": 52595 }, { "entropy": 5.363849067687989, "epoch": 5.907508283259393, "grad_norm": 1.0625, "learning_rate": 0.000214843209238339, "loss": 4.8167, "mean_token_accuracy": 0.23439643830060958, "num_tokens": 117418407.0, "step": 52600 }, { "entropy": 5.279997968673706, "epoch": 5.90806986016735, "grad_norm": 0.95703125, "learning_rate": 0.00021480452306161813, "loss": 4.7818, "mean_token_accuracy": 0.24056798219680786, "num_tokens": 117431178.0, "step": 52605 }, { "entropy": 5.298519945144653, "epoch": 5.908631437075307, "grad_norm": 1.078125, "learning_rate": 0.00021476583880154464, "loss": 4.7752, "mean_token_accuracy": 0.24063548892736436, "num_tokens": 117442806.0, "step": 52610 }, { "entropy": 5.382386302947998, "epoch": 5.909193013983265, "grad_norm": 1.0546875, "learning_rate": 0.00021472715645935026, "loss": 4.9497, "mean_token_accuracy": 0.2243045151233673, "num_tokens": 117454949.0, "step": 52615 }, { "entropy": 5.351309967041016, "epoch": 5.909754590891223, "grad_norm": 0.96484375, "learning_rate": 0.00021468847603626657, "loss": 4.787, "mean_token_accuracy": 0.24099792093038558, "num_tokens": 117467330.0, "step": 52620 }, { "entropy": 5.293655967712402, "epoch": 5.91031616779918, "grad_norm": 1.109375, "learning_rate": 0.0002146497975335252, "loss": 4.7312, "mean_token_accuracy": 0.23782020956277847, "num_tokens": 117477555.0, "step": 52625 }, { "entropy": 5.350171041488648, "epoch": 5.910877744707138, "grad_norm": 1.1171875, "learning_rate": 0.00021461112095235764, "loss": 4.8889, "mean_token_accuracy": 0.23674318343400955, "num_tokens": 117487847.0, "step": 52630 }, { "entropy": 5.244684648513794, "epoch": 5.911439321615095, "grad_norm": 1.078125, "learning_rate": 0.00021457244629399547, "loss": 4.8195, "mean_token_accuracy": 0.23943972438573838, "num_tokens": 117499347.0, "step": 52635 }, { "entropy": 5.331181478500366, "epoch": 5.912000898523052, "grad_norm": 0.93359375, "learning_rate": 0.00021453377355967003, "loss": 4.7839, "mean_token_accuracy": 0.24056043177843095, "num_tokens": 117511201.0, "step": 52640 }, { "entropy": 5.369244050979614, "epoch": 5.91256247543101, "grad_norm": 1.078125, "learning_rate": 0.00021449510275061264, "loss": 4.8104, "mean_token_accuracy": 0.24250543415546416, "num_tokens": 117522742.0, "step": 52645 }, { "entropy": 5.320102119445801, "epoch": 5.913124052338968, "grad_norm": 1.1171875, "learning_rate": 0.00021445643386805468, "loss": 4.7973, "mean_token_accuracy": 0.23455713540315629, "num_tokens": 117533609.0, "step": 52650 }, { "entropy": 5.3027314186096195, "epoch": 5.913685629246926, "grad_norm": 1.1640625, "learning_rate": 0.0002144177669132274, "loss": 4.7897, "mean_token_accuracy": 0.24138564467430115, "num_tokens": 117544265.0, "step": 52655 }, { "entropy": 5.269420480728149, "epoch": 5.914247206154883, "grad_norm": 1.03125, "learning_rate": 0.00021437910188736188, "loss": 4.8251, "mean_token_accuracy": 0.2385624796152115, "num_tokens": 117556088.0, "step": 52660 }, { "entropy": 5.380385637283325, "epoch": 5.91480878306284, "grad_norm": 1.1484375, "learning_rate": 0.00021434043879168925, "loss": 4.8334, "mean_token_accuracy": 0.23730861395597458, "num_tokens": 117566891.0, "step": 52665 }, { "entropy": 5.272003602981568, "epoch": 5.915370359970798, "grad_norm": 1.0, "learning_rate": 0.00021430177762744057, "loss": 4.722, "mean_token_accuracy": 0.24348686784505844, "num_tokens": 117577552.0, "step": 52670 }, { "entropy": 5.358322477340698, "epoch": 5.9159319368787555, "grad_norm": 0.99609375, "learning_rate": 0.00021426311839584688, "loss": 4.8494, "mean_token_accuracy": 0.23722697347402572, "num_tokens": 117589436.0, "step": 52675 }, { "entropy": 5.326896333694458, "epoch": 5.916493513786713, "grad_norm": 1.0390625, "learning_rate": 0.00021422446109813892, "loss": 4.8228, "mean_token_accuracy": 0.24012438356876373, "num_tokens": 117599728.0, "step": 52680 }, { "entropy": 5.276667499542237, "epoch": 5.917055090694671, "grad_norm": 1.1171875, "learning_rate": 0.0002141858057355478, "loss": 4.7109, "mean_token_accuracy": 0.24763632118701934, "num_tokens": 117610961.0, "step": 52685 }, { "entropy": 5.344430780410766, "epoch": 5.917616667602628, "grad_norm": 1.15625, "learning_rate": 0.0002141471523093042, "loss": 4.837, "mean_token_accuracy": 0.2464147001504898, "num_tokens": 117622857.0, "step": 52690 }, { "entropy": 5.358357858657837, "epoch": 5.918178244510585, "grad_norm": 1.0390625, "learning_rate": 0.00021410850082063888, "loss": 4.8505, "mean_token_accuracy": 0.23661022186279296, "num_tokens": 117634533.0, "step": 52695 }, { "entropy": 5.319080257415772, "epoch": 5.918739821418543, "grad_norm": 1.125, "learning_rate": 0.0002140698512707825, "loss": 4.7794, "mean_token_accuracy": 0.23772307187318803, "num_tokens": 117646136.0, "step": 52700 }, { "entropy": 5.238615465164185, "epoch": 5.919301398326501, "grad_norm": 1.03125, "learning_rate": 0.00021403120366096572, "loss": 4.722, "mean_token_accuracy": 0.24417992681264877, "num_tokens": 117656900.0, "step": 52705 }, { "entropy": 5.2939342021942135, "epoch": 5.919862975234459, "grad_norm": 1.0, "learning_rate": 0.00021399255799241901, "loss": 4.8477, "mean_token_accuracy": 0.24088621884584427, "num_tokens": 117668689.0, "step": 52710 }, { "entropy": 5.3165863990783695, "epoch": 5.920424552142416, "grad_norm": 1.078125, "learning_rate": 0.00021395391426637288, "loss": 4.7855, "mean_token_accuracy": 0.24513758420944215, "num_tokens": 117679926.0, "step": 52715 }, { "entropy": 5.282705640792846, "epoch": 5.920986129050373, "grad_norm": 0.94140625, "learning_rate": 0.0002139152724840579, "loss": 4.7558, "mean_token_accuracy": 0.24554292261600494, "num_tokens": 117691027.0, "step": 52720 }, { "entropy": 5.3088014125823975, "epoch": 5.921547705958331, "grad_norm": 0.98046875, "learning_rate": 0.00021387663264670425, "loss": 4.7382, "mean_token_accuracy": 0.2531947508454323, "num_tokens": 117702098.0, "step": 52725 }, { "entropy": 5.30010404586792, "epoch": 5.9221092828662885, "grad_norm": 0.984375, "learning_rate": 0.00021383799475554238, "loss": 4.7951, "mean_token_accuracy": 0.23933669924736023, "num_tokens": 117712865.0, "step": 52730 }, { "entropy": 5.3108593940734865, "epoch": 5.922670859774247, "grad_norm": 1.1484375, "learning_rate": 0.0002137993588118025, "loss": 4.8597, "mean_token_accuracy": 0.2429556280374527, "num_tokens": 117723750.0, "step": 52735 }, { "entropy": 5.2819146633148195, "epoch": 5.923232436682204, "grad_norm": 1.0625, "learning_rate": 0.00021376072481671477, "loss": 4.7054, "mean_token_accuracy": 0.24451127499341965, "num_tokens": 117734587.0, "step": 52740 }, { "entropy": 5.289522266387939, "epoch": 5.923794013590161, "grad_norm": 0.8828125, "learning_rate": 0.0002137220927715093, "loss": 4.8047, "mean_token_accuracy": 0.23737290501594543, "num_tokens": 117747557.0, "step": 52745 }, { "entropy": 5.3407814502716064, "epoch": 5.924355590498118, "grad_norm": 1.0859375, "learning_rate": 0.000213683462677416, "loss": 4.8207, "mean_token_accuracy": 0.23531724363565446, "num_tokens": 117758256.0, "step": 52750 }, { "entropy": 5.299745225906372, "epoch": 5.924917167406076, "grad_norm": 1.078125, "learning_rate": 0.00021364483453566519, "loss": 4.7034, "mean_token_accuracy": 0.24976298063993455, "num_tokens": 117769976.0, "step": 52755 }, { "entropy": 5.349279880523682, "epoch": 5.9254787443140335, "grad_norm": 1.09375, "learning_rate": 0.00021360620834748662, "loss": 4.8787, "mean_token_accuracy": 0.23477881401777267, "num_tokens": 117782284.0, "step": 52760 }, { "entropy": 5.311539220809936, "epoch": 5.926040321221992, "grad_norm": 1.0625, "learning_rate": 0.0002135675841141102, "loss": 4.8379, "mean_token_accuracy": 0.23427960723638536, "num_tokens": 117794131.0, "step": 52765 }, { "entropy": 5.3468310832977295, "epoch": 5.926601898129949, "grad_norm": 1.03125, "learning_rate": 0.00021352896183676574, "loss": 4.8929, "mean_token_accuracy": 0.23108877688646318, "num_tokens": 117804785.0, "step": 52770 }, { "entropy": 5.239675712585449, "epoch": 5.927163475037906, "grad_norm": 1.015625, "learning_rate": 0.00021349034151668295, "loss": 4.6393, "mean_token_accuracy": 0.24674164354801179, "num_tokens": 117815691.0, "step": 52775 }, { "entropy": 5.432074499130249, "epoch": 5.927725051945864, "grad_norm": 1.109375, "learning_rate": 0.00021345172315509153, "loss": 4.9151, "mean_token_accuracy": 0.23812775015830995, "num_tokens": 117827044.0, "step": 52780 }, { "entropy": 5.353216552734375, "epoch": 5.928286628853821, "grad_norm": 0.97265625, "learning_rate": 0.00021341310675322112, "loss": 4.7864, "mean_token_accuracy": 0.23355242013931274, "num_tokens": 117837702.0, "step": 52785 }, { "entropy": 5.334795665740967, "epoch": 5.9288482057617795, "grad_norm": 1.2109375, "learning_rate": 0.00021337449231230128, "loss": 4.8628, "mean_token_accuracy": 0.23625075668096543, "num_tokens": 117848204.0, "step": 52790 }, { "entropy": 5.266196584701538, "epoch": 5.929409782669737, "grad_norm": 1.0, "learning_rate": 0.00021333587983356157, "loss": 4.7294, "mean_token_accuracy": 0.24152374118566514, "num_tokens": 117858517.0, "step": 52795 }, { "entropy": 5.34162015914917, "epoch": 5.929971359577694, "grad_norm": 1.109375, "learning_rate": 0.00021329726931823128, "loss": 4.8333, "mean_token_accuracy": 0.2348298668861389, "num_tokens": 117868874.0, "step": 52800 }, { "entropy": 5.334166860580444, "epoch": 5.930532936485652, "grad_norm": 1.15625, "learning_rate": 0.0002132586607675399, "loss": 4.8209, "mean_token_accuracy": 0.24213824570178985, "num_tokens": 117879450.0, "step": 52805 }, { "entropy": 5.297774696350098, "epoch": 5.931094513393609, "grad_norm": 1.0625, "learning_rate": 0.00021322005418271674, "loss": 4.7599, "mean_token_accuracy": 0.24300872385501862, "num_tokens": 117890111.0, "step": 52810 }, { "entropy": 5.348769235610962, "epoch": 5.9316560903015665, "grad_norm": 1.0390625, "learning_rate": 0.00021318144956499098, "loss": 4.8322, "mean_token_accuracy": 0.23776338696479798, "num_tokens": 117901836.0, "step": 52815 }, { "entropy": 5.2751970291137695, "epoch": 5.932217667209525, "grad_norm": 1.1171875, "learning_rate": 0.00021314284691559182, "loss": 4.676, "mean_token_accuracy": 0.24950366616249084, "num_tokens": 117911854.0, "step": 52820 }, { "entropy": 5.265320301055908, "epoch": 5.932779244117482, "grad_norm": 1.0078125, "learning_rate": 0.0002131042462357483, "loss": 4.744, "mean_token_accuracy": 0.24879120886325837, "num_tokens": 117922967.0, "step": 52825 }, { "entropy": 5.31804141998291, "epoch": 5.933340821025439, "grad_norm": 1.109375, "learning_rate": 0.00021306564752668979, "loss": 4.8161, "mean_token_accuracy": 0.2378914475440979, "num_tokens": 117933991.0, "step": 52830 }, { "entropy": 5.353575944900513, "epoch": 5.933902397933397, "grad_norm": 1.0703125, "learning_rate": 0.00021302705078964497, "loss": 4.8476, "mean_token_accuracy": 0.23956012427806855, "num_tokens": 117945991.0, "step": 52835 }, { "entropy": 5.385207462310791, "epoch": 5.934463974841354, "grad_norm": 1.0390625, "learning_rate": 0.00021298845602584293, "loss": 4.7949, "mean_token_accuracy": 0.24706200361251832, "num_tokens": 117956588.0, "step": 52840 }, { "entropy": 5.367385482788086, "epoch": 5.9350255517493125, "grad_norm": 1.0703125, "learning_rate": 0.0002129498632365125, "loss": 4.8256, "mean_token_accuracy": 0.2423715576529503, "num_tokens": 117966425.0, "step": 52845 }, { "entropy": 5.402268600463867, "epoch": 5.93558712865727, "grad_norm": 0.96484375, "learning_rate": 0.0002129112724228825, "loss": 4.8023, "mean_token_accuracy": 0.2361139491200447, "num_tokens": 117976794.0, "step": 52850 }, { "entropy": 5.333890628814697, "epoch": 5.936148705565227, "grad_norm": 1.140625, "learning_rate": 0.00021287268358618168, "loss": 4.7871, "mean_token_accuracy": 0.24049043655395508, "num_tokens": 117988236.0, "step": 52855 }, { "entropy": 5.228446960449219, "epoch": 5.936710282473185, "grad_norm": 1.03125, "learning_rate": 0.00021283409672763864, "loss": 4.6823, "mean_token_accuracy": 0.2531230911612511, "num_tokens": 117999699.0, "step": 52860 }, { "entropy": 5.287493324279785, "epoch": 5.937271859381142, "grad_norm": 1.1640625, "learning_rate": 0.0002127955118484821, "loss": 4.7659, "mean_token_accuracy": 0.24034328758716583, "num_tokens": 118008788.0, "step": 52865 }, { "entropy": 5.305104970932007, "epoch": 5.937833436289099, "grad_norm": 0.96875, "learning_rate": 0.00021275692894994058, "loss": 4.8218, "mean_token_accuracy": 0.23868513852357864, "num_tokens": 118019925.0, "step": 52870 }, { "entropy": 5.302529907226562, "epoch": 5.9383950131970575, "grad_norm": 1.0703125, "learning_rate": 0.00021271834803324264, "loss": 4.6648, "mean_token_accuracy": 0.2500045567750931, "num_tokens": 118031403.0, "step": 52875 }, { "entropy": 5.2565765380859375, "epoch": 5.938956590105015, "grad_norm": 0.96484375, "learning_rate": 0.0002126797690996166, "loss": 4.7024, "mean_token_accuracy": 0.246938119828701, "num_tokens": 118044565.0, "step": 52880 }, { "entropy": 5.364192008972168, "epoch": 5.939518167012972, "grad_norm": 1.1953125, "learning_rate": 0.00021264119215029092, "loss": 4.8273, "mean_token_accuracy": 0.23944331854581832, "num_tokens": 118055684.0, "step": 52885 }, { "entropy": 5.23955078125, "epoch": 5.94007974392093, "grad_norm": 1.03125, "learning_rate": 0.00021260261718649388, "loss": 4.7102, "mean_token_accuracy": 0.24631700962781905, "num_tokens": 118066667.0, "step": 52890 }, { "entropy": 5.288236284255982, "epoch": 5.940641320828887, "grad_norm": 1.09375, "learning_rate": 0.00021256404420945358, "loss": 4.8414, "mean_token_accuracy": 0.23086397498846054, "num_tokens": 118077699.0, "step": 52895 }, { "entropy": 5.2241761684417725, "epoch": 5.941202897736845, "grad_norm": 1.046875, "learning_rate": 0.0002125254732203984, "loss": 4.6662, "mean_token_accuracy": 0.2462477818131447, "num_tokens": 118088732.0, "step": 52900 }, { "entropy": 5.403057956695557, "epoch": 5.941764474644803, "grad_norm": 1.0390625, "learning_rate": 0.00021248690422055643, "loss": 4.8975, "mean_token_accuracy": 0.23873988837003707, "num_tokens": 118100838.0, "step": 52905 }, { "entropy": 5.357292795181275, "epoch": 5.94232605155276, "grad_norm": 0.9375, "learning_rate": 0.00021244833721115563, "loss": 4.8199, "mean_token_accuracy": 0.24359432756900787, "num_tokens": 118112448.0, "step": 52910 }, { "entropy": 5.4224019050598145, "epoch": 5.942887628460718, "grad_norm": 1.0546875, "learning_rate": 0.0002124097721934241, "loss": 4.8978, "mean_token_accuracy": 0.23739907443523406, "num_tokens": 118124236.0, "step": 52915 }, { "entropy": 5.367053604125976, "epoch": 5.943449205368675, "grad_norm": 1.1796875, "learning_rate": 0.00021237120916858967, "loss": 4.812, "mean_token_accuracy": 0.23633493930101396, "num_tokens": 118133871.0, "step": 52920 }, { "entropy": 5.274646186828614, "epoch": 5.944010782276633, "grad_norm": 0.99609375, "learning_rate": 0.00021233264813788022, "loss": 4.7589, "mean_token_accuracy": 0.24510617107152938, "num_tokens": 118144543.0, "step": 52925 }, { "entropy": 5.313476037979126, "epoch": 5.9445723591845905, "grad_norm": 1.0546875, "learning_rate": 0.0002122940891025235, "loss": 4.8217, "mean_token_accuracy": 0.24542275220155715, "num_tokens": 118155933.0, "step": 52930 }, { "entropy": 5.397573041915893, "epoch": 5.945133936092548, "grad_norm": 1.1796875, "learning_rate": 0.00021225553206374737, "loss": 4.8673, "mean_token_accuracy": 0.24101074486970903, "num_tokens": 118166726.0, "step": 52935 }, { "entropy": 5.296338605880737, "epoch": 5.945695513000506, "grad_norm": 1.1015625, "learning_rate": 0.00021221697702277943, "loss": 4.7701, "mean_token_accuracy": 0.24418648481369018, "num_tokens": 118177412.0, "step": 52940 }, { "entropy": 5.306379127502441, "epoch": 5.946257089908463, "grad_norm": 1.0390625, "learning_rate": 0.0002121784239808473, "loss": 4.7765, "mean_token_accuracy": 0.24094390869140625, "num_tokens": 118188445.0, "step": 52945 }, { "entropy": 5.319080448150634, "epoch": 5.94681866681642, "grad_norm": 0.99609375, "learning_rate": 0.00021213987293917846, "loss": 4.8404, "mean_token_accuracy": 0.23668431341648102, "num_tokens": 118198897.0, "step": 52950 }, { "entropy": 5.322534608840942, "epoch": 5.947380243724378, "grad_norm": 0.9921875, "learning_rate": 0.00021210132389900055, "loss": 4.8405, "mean_token_accuracy": 0.24147406667470933, "num_tokens": 118209815.0, "step": 52955 }, { "entropy": 5.380500173568725, "epoch": 5.947941820632336, "grad_norm": 1.1484375, "learning_rate": 0.00021206277686154078, "loss": 4.8619, "mean_token_accuracy": 0.23685044497251512, "num_tokens": 118221336.0, "step": 52960 }, { "entropy": 5.2973381042480465, "epoch": 5.948503397540293, "grad_norm": 1.078125, "learning_rate": 0.00021202423182802656, "loss": 4.7638, "mean_token_accuracy": 0.23716307431459427, "num_tokens": 118231585.0, "step": 52965 }, { "entropy": 5.373033332824707, "epoch": 5.949064974448251, "grad_norm": 1.078125, "learning_rate": 0.00021198568879968527, "loss": 4.935, "mean_token_accuracy": 0.2354410097002983, "num_tokens": 118241643.0, "step": 52970 }, { "entropy": 5.366337680816651, "epoch": 5.949626551356208, "grad_norm": 1.0859375, "learning_rate": 0.00021194714777774415, "loss": 4.787, "mean_token_accuracy": 0.2425659030675888, "num_tokens": 118252344.0, "step": 52975 }, { "entropy": 5.324969148635864, "epoch": 5.950188128264166, "grad_norm": 1.125, "learning_rate": 0.0002119086087634303, "loss": 4.8118, "mean_token_accuracy": 0.24386746436357498, "num_tokens": 118263187.0, "step": 52980 }, { "entropy": 5.302988195419312, "epoch": 5.950749705172123, "grad_norm": 1.1171875, "learning_rate": 0.00021187007175797078, "loss": 4.7874, "mean_token_accuracy": 0.24221671968698502, "num_tokens": 118274602.0, "step": 52985 }, { "entropy": 5.352237033843994, "epoch": 5.951311282080081, "grad_norm": 1.03125, "learning_rate": 0.0002118315367625927, "loss": 4.8259, "mean_token_accuracy": 0.2456492230296135, "num_tokens": 118286173.0, "step": 52990 }, { "entropy": 5.368943166732788, "epoch": 5.951872858988039, "grad_norm": 1.1328125, "learning_rate": 0.00021179300377852296, "loss": 4.8679, "mean_token_accuracy": 0.23175786286592484, "num_tokens": 118295785.0, "step": 52995 }, { "entropy": 5.446654272079468, "epoch": 5.952434435895996, "grad_norm": 0.98828125, "learning_rate": 0.0002117544728069885, "loss": 5.006, "mean_token_accuracy": 0.2269887074828148, "num_tokens": 118308026.0, "step": 53000 }, { "entropy": 5.445450639724731, "epoch": 5.952996012803953, "grad_norm": 1.078125, "learning_rate": 0.0002117159438492161, "loss": 4.9271, "mean_token_accuracy": 0.236155666410923, "num_tokens": 118319283.0, "step": 53005 }, { "entropy": 5.297165822982788, "epoch": 5.953557589711911, "grad_norm": 0.98828125, "learning_rate": 0.00021167741690643268, "loss": 4.6876, "mean_token_accuracy": 0.2489714056253433, "num_tokens": 118330094.0, "step": 53010 }, { "entropy": 5.244270133972168, "epoch": 5.9541191666198685, "grad_norm": 1.03125, "learning_rate": 0.0002116388919798648, "loss": 4.6736, "mean_token_accuracy": 0.25826686769723894, "num_tokens": 118341271.0, "step": 53015 }, { "entropy": 5.3319660186767575, "epoch": 5.954680743527826, "grad_norm": 1.109375, "learning_rate": 0.00021160036907073921, "loss": 4.7682, "mean_token_accuracy": 0.2347572922706604, "num_tokens": 118351451.0, "step": 53020 }, { "entropy": 5.285858821868897, "epoch": 5.955242320435784, "grad_norm": 1.0546875, "learning_rate": 0.00021156184818028247, "loss": 4.7487, "mean_token_accuracy": 0.24658646136522294, "num_tokens": 118362375.0, "step": 53025 }, { "entropy": 5.215389680862427, "epoch": 5.955803897343741, "grad_norm": 1.1171875, "learning_rate": 0.00021152332930972107, "loss": 4.6837, "mean_token_accuracy": 0.24302284121513368, "num_tokens": 118372020.0, "step": 53030 }, { "entropy": 5.27696213722229, "epoch": 5.956365474251699, "grad_norm": 1.078125, "learning_rate": 0.00021148481246028146, "loss": 4.752, "mean_token_accuracy": 0.24155394434928895, "num_tokens": 118381750.0, "step": 53035 }, { "entropy": 5.265909719467163, "epoch": 5.956927051159656, "grad_norm": 0.92578125, "learning_rate": 0.00021144629763318997, "loss": 4.6896, "mean_token_accuracy": 0.2454355239868164, "num_tokens": 118392648.0, "step": 53040 }, { "entropy": 5.3780759334564205, "epoch": 5.957488628067614, "grad_norm": 1.0078125, "learning_rate": 0.0002114077848296731, "loss": 4.8953, "mean_token_accuracy": 0.23652449399232864, "num_tokens": 118403441.0, "step": 53045 }, { "entropy": 5.398523998260498, "epoch": 5.958050204975572, "grad_norm": 1.015625, "learning_rate": 0.00021136927405095707, "loss": 4.8767, "mean_token_accuracy": 0.2348824828863144, "num_tokens": 118414520.0, "step": 53050 }, { "entropy": 5.354370164871216, "epoch": 5.958611781883529, "grad_norm": 1.1484375, "learning_rate": 0.000211330765298268, "loss": 4.8468, "mean_token_accuracy": 0.2407940909266472, "num_tokens": 118425048.0, "step": 53055 }, { "entropy": 5.317968893051147, "epoch": 5.959173358791486, "grad_norm": 1.109375, "learning_rate": 0.0002112922585728321, "loss": 4.7129, "mean_token_accuracy": 0.24368281811475753, "num_tokens": 118435780.0, "step": 53060 }, { "entropy": 5.264994192123413, "epoch": 5.959734935699444, "grad_norm": 1.046875, "learning_rate": 0.0002112537538758753, "loss": 4.7451, "mean_token_accuracy": 0.2422763079404831, "num_tokens": 118446733.0, "step": 53065 }, { "entropy": 5.30240912437439, "epoch": 5.9602965126074015, "grad_norm": 1.015625, "learning_rate": 0.00021121525120862384, "loss": 4.8271, "mean_token_accuracy": 0.23815187960863113, "num_tokens": 118456943.0, "step": 53070 }, { "entropy": 5.2836628437042235, "epoch": 5.960858089515359, "grad_norm": 1.03125, "learning_rate": 0.00021117675057230335, "loss": 4.791, "mean_token_accuracy": 0.25062100738286974, "num_tokens": 118467085.0, "step": 53075 }, { "entropy": 5.3532023429870605, "epoch": 5.961419666423317, "grad_norm": 0.9765625, "learning_rate": 0.00021113825196813997, "loss": 4.8963, "mean_token_accuracy": 0.23332354575395584, "num_tokens": 118478050.0, "step": 53080 }, { "entropy": 5.306705617904663, "epoch": 5.961981243331274, "grad_norm": 1.0078125, "learning_rate": 0.00021109975539735943, "loss": 4.7708, "mean_token_accuracy": 0.24110810160636903, "num_tokens": 118488982.0, "step": 53085 }, { "entropy": 5.389169216156006, "epoch": 5.962542820239232, "grad_norm": 0.953125, "learning_rate": 0.00021106126086118743, "loss": 4.9238, "mean_token_accuracy": 0.23730454444885254, "num_tokens": 118501760.0, "step": 53090 }, { "entropy": 5.382950973510742, "epoch": 5.963104397147189, "grad_norm": 1.1171875, "learning_rate": 0.00021102276836084972, "loss": 4.8065, "mean_token_accuracy": 0.2388884648680687, "num_tokens": 118513960.0, "step": 53095 }, { "entropy": 5.366236972808838, "epoch": 5.9636659740551465, "grad_norm": 1.0546875, "learning_rate": 0.00021098427789757184, "loss": 4.7728, "mean_token_accuracy": 0.23083711564540862, "num_tokens": 118524810.0, "step": 53100 }, { "entropy": 5.331679391860962, "epoch": 5.964227550963105, "grad_norm": 1.03125, "learning_rate": 0.0002109457894725794, "loss": 4.7613, "mean_token_accuracy": 0.2375050291419029, "num_tokens": 118537327.0, "step": 53105 }, { "entropy": 5.303065204620362, "epoch": 5.964789127871062, "grad_norm": 1.0859375, "learning_rate": 0.00021090730308709777, "loss": 4.7467, "mean_token_accuracy": 0.24354559779167176, "num_tokens": 118549578.0, "step": 53110 }, { "entropy": 5.299870300292969, "epoch": 5.96535070477902, "grad_norm": 1.140625, "learning_rate": 0.00021086881874235252, "loss": 4.807, "mean_token_accuracy": 0.24000062495470048, "num_tokens": 118559872.0, "step": 53115 }, { "entropy": 5.354321575164795, "epoch": 5.965912281686977, "grad_norm": 1.0546875, "learning_rate": 0.00021083033643956906, "loss": 4.8448, "mean_token_accuracy": 0.2383415549993515, "num_tokens": 118570721.0, "step": 53120 }, { "entropy": 5.300224542617798, "epoch": 5.966473858594934, "grad_norm": 1.015625, "learning_rate": 0.00021079185617997248, "loss": 4.7229, "mean_token_accuracy": 0.24282481372356415, "num_tokens": 118581694.0, "step": 53125 }, { "entropy": 5.313095426559448, "epoch": 5.9670354355028925, "grad_norm": 1.0546875, "learning_rate": 0.00021075337796478815, "loss": 4.7662, "mean_token_accuracy": 0.2511210322380066, "num_tokens": 118594026.0, "step": 53130 }, { "entropy": 5.376242160797119, "epoch": 5.96759701241085, "grad_norm": 0.98046875, "learning_rate": 0.00021071490179524116, "loss": 4.8446, "mean_token_accuracy": 0.24164272844791412, "num_tokens": 118607795.0, "step": 53135 }, { "entropy": 5.3043395519256595, "epoch": 5.968158589318807, "grad_norm": 1.0390625, "learning_rate": 0.00021067642767255663, "loss": 4.8281, "mean_token_accuracy": 0.24110422432422637, "num_tokens": 118618639.0, "step": 53140 }, { "entropy": 5.3816815376281735, "epoch": 5.968720166226765, "grad_norm": 1.0625, "learning_rate": 0.0002106379555979595, "loss": 4.81, "mean_token_accuracy": 0.23706227093935012, "num_tokens": 118628324.0, "step": 53145 }, { "entropy": 5.218087148666382, "epoch": 5.969281743134722, "grad_norm": 1.015625, "learning_rate": 0.00021059948557267493, "loss": 4.687, "mean_token_accuracy": 0.2440139725804329, "num_tokens": 118640005.0, "step": 53150 }, { "entropy": 5.362035751342773, "epoch": 5.9698433200426795, "grad_norm": 1.171875, "learning_rate": 0.00021056101759792773, "loss": 4.8956, "mean_token_accuracy": 0.23357243835926056, "num_tokens": 118651179.0, "step": 53155 }, { "entropy": 5.261061573028565, "epoch": 5.970404896950638, "grad_norm": 1.03125, "learning_rate": 0.00021052255167494272, "loss": 4.8129, "mean_token_accuracy": 0.23382124900817872, "num_tokens": 118661506.0, "step": 53160 }, { "entropy": 5.343864393234253, "epoch": 5.970966473858595, "grad_norm": 1.109375, "learning_rate": 0.00021048408780494467, "loss": 4.8332, "mean_token_accuracy": 0.23804474025964736, "num_tokens": 118672252.0, "step": 53165 }, { "entropy": 5.387560415267944, "epoch": 5.971528050766553, "grad_norm": 1.0234375, "learning_rate": 0.00021044562598915824, "loss": 4.8684, "mean_token_accuracy": 0.23996058106422424, "num_tokens": 118684407.0, "step": 53170 }, { "entropy": 5.396267986297607, "epoch": 5.97208962767451, "grad_norm": 1.015625, "learning_rate": 0.0002104071662288081, "loss": 4.8862, "mean_token_accuracy": 0.2367575541138649, "num_tokens": 118695808.0, "step": 53175 }, { "entropy": 5.3975057125091555, "epoch": 5.972651204582467, "grad_norm": 0.9765625, "learning_rate": 0.00021036870852511892, "loss": 4.8129, "mean_token_accuracy": 0.23958427906036378, "num_tokens": 118708701.0, "step": 53180 }, { "entropy": 5.388815546035767, "epoch": 5.9732127814904254, "grad_norm": 1.0, "learning_rate": 0.000210330252879315, "loss": 4.8477, "mean_token_accuracy": 0.2427206814289093, "num_tokens": 118720618.0, "step": 53185 }, { "entropy": 5.26605257987976, "epoch": 5.973774358398383, "grad_norm": 1.0078125, "learning_rate": 0.00021029179929262098, "loss": 4.7498, "mean_token_accuracy": 0.24906917959451674, "num_tokens": 118732536.0, "step": 53190 }, { "entropy": 5.258680295944214, "epoch": 5.97433593530634, "grad_norm": 1.15625, "learning_rate": 0.00021025334776626122, "loss": 4.7547, "mean_token_accuracy": 0.24200102537870408, "num_tokens": 118742052.0, "step": 53195 }, { "entropy": 5.227660465240478, "epoch": 5.974897512214298, "grad_norm": 1.03125, "learning_rate": 0.00021021489830145995, "loss": 4.7056, "mean_token_accuracy": 0.2503634437918663, "num_tokens": 118752760.0, "step": 53200 }, { "entropy": 5.306587028503418, "epoch": 5.975459089122255, "grad_norm": 1.046875, "learning_rate": 0.00021017645089944142, "loss": 4.7608, "mean_token_accuracy": 0.24137572050094605, "num_tokens": 118763512.0, "step": 53205 }, { "entropy": 5.311144495010376, "epoch": 5.976020666030212, "grad_norm": 1.0546875, "learning_rate": 0.00021013800556142986, "loss": 4.8473, "mean_token_accuracy": 0.2340591236948967, "num_tokens": 118774838.0, "step": 53210 }, { "entropy": 5.32604603767395, "epoch": 5.9765822429381705, "grad_norm": 1.0625, "learning_rate": 0.00021009956228864934, "loss": 4.7354, "mean_token_accuracy": 0.2497787967324257, "num_tokens": 118785548.0, "step": 53215 }, { "entropy": 5.286301183700561, "epoch": 5.977143819846128, "grad_norm": 0.99609375, "learning_rate": 0.0002100611210823239, "loss": 4.7189, "mean_token_accuracy": 0.24076679348945618, "num_tokens": 118796804.0, "step": 53220 }, { "entropy": 5.267124986648559, "epoch": 5.977705396754086, "grad_norm": 1.1484375, "learning_rate": 0.00021002268194367764, "loss": 4.7775, "mean_token_accuracy": 0.2398952916264534, "num_tokens": 118808232.0, "step": 53225 }, { "entropy": 5.334344100952149, "epoch": 5.978266973662043, "grad_norm": 0.9921875, "learning_rate": 0.0002099842448739343, "loss": 4.7911, "mean_token_accuracy": 0.24159238636493682, "num_tokens": 118820331.0, "step": 53230 }, { "entropy": 5.350548028945923, "epoch": 5.97882855057, "grad_norm": 1.109375, "learning_rate": 0.00020994580987431787, "loss": 4.8438, "mean_token_accuracy": 0.2356039047241211, "num_tokens": 118830484.0, "step": 53235 }, { "entropy": 5.322480058670044, "epoch": 5.979390127477958, "grad_norm": 1.0234375, "learning_rate": 0.00020990737694605204, "loss": 4.833, "mean_token_accuracy": 0.2343960091471672, "num_tokens": 118842130.0, "step": 53240 }, { "entropy": 5.3551851272583, "epoch": 5.979951704385916, "grad_norm": 1.0859375, "learning_rate": 0.0002098689460903606, "loss": 4.8013, "mean_token_accuracy": 0.24249498397111893, "num_tokens": 118853449.0, "step": 53245 }, { "entropy": 5.32408766746521, "epoch": 5.980513281293873, "grad_norm": 0.984375, "learning_rate": 0.00020983051730846724, "loss": 4.8087, "mean_token_accuracy": 0.2341926321387291, "num_tokens": 118864694.0, "step": 53250 }, { "entropy": 5.34204134941101, "epoch": 5.981074858201831, "grad_norm": 1.09375, "learning_rate": 0.00020979209060159533, "loss": 4.8122, "mean_token_accuracy": 0.23728945553302766, "num_tokens": 118875628.0, "step": 53255 }, { "entropy": 5.35408124923706, "epoch": 5.981636435109788, "grad_norm": 1.015625, "learning_rate": 0.00020975366597096863, "loss": 4.8018, "mean_token_accuracy": 0.2440395623445511, "num_tokens": 118887241.0, "step": 53260 }, { "entropy": 5.325093936920166, "epoch": 5.982198012017745, "grad_norm": 1.0546875, "learning_rate": 0.0002097152434178105, "loss": 4.8199, "mean_token_accuracy": 0.23288943171501159, "num_tokens": 118898642.0, "step": 53265 }, { "entropy": 5.280015325546264, "epoch": 5.9827595889257035, "grad_norm": 1.140625, "learning_rate": 0.00020967682294334439, "loss": 4.7994, "mean_token_accuracy": 0.23759506940841674, "num_tokens": 118908313.0, "step": 53270 }, { "entropy": 5.231676769256592, "epoch": 5.983321165833661, "grad_norm": 1.0859375, "learning_rate": 0.00020963840454879358, "loss": 4.7091, "mean_token_accuracy": 0.24996860921382905, "num_tokens": 118919021.0, "step": 53275 }, { "entropy": 5.302547645568848, "epoch": 5.983882742741619, "grad_norm": 0.9921875, "learning_rate": 0.0002095999882353813, "loss": 4.7608, "mean_token_accuracy": 0.24193157702684404, "num_tokens": 118931178.0, "step": 53280 }, { "entropy": 5.262881803512573, "epoch": 5.984444319649576, "grad_norm": 1.0703125, "learning_rate": 0.00020956157400433073, "loss": 4.7452, "mean_token_accuracy": 0.24571855068206788, "num_tokens": 118942652.0, "step": 53285 }, { "entropy": 5.311073446273804, "epoch": 5.985005896557533, "grad_norm": 1.078125, "learning_rate": 0.000209523161856865, "loss": 4.7816, "mean_token_accuracy": 0.23954159170389175, "num_tokens": 118952539.0, "step": 53290 }, { "entropy": 5.360652685165405, "epoch": 5.985567473465491, "grad_norm": 0.984375, "learning_rate": 0.00020948475179420723, "loss": 4.8605, "mean_token_accuracy": 0.2444551780819893, "num_tokens": 118965389.0, "step": 53295 }, { "entropy": 5.39256477355957, "epoch": 5.986129050373449, "grad_norm": 0.93359375, "learning_rate": 0.00020944634381758038, "loss": 4.8633, "mean_token_accuracy": 0.24350703060626983, "num_tokens": 118978009.0, "step": 53300 }, { "entropy": 5.340012693405152, "epoch": 5.986690627281407, "grad_norm": 0.9453125, "learning_rate": 0.00020940793792820735, "loss": 4.8567, "mean_token_accuracy": 0.23352669179439545, "num_tokens": 118988729.0, "step": 53305 }, { "entropy": 5.416486978530884, "epoch": 5.987252204189364, "grad_norm": 0.97265625, "learning_rate": 0.00020936953412731103, "loss": 4.8593, "mean_token_accuracy": 0.23563915193080903, "num_tokens": 119001533.0, "step": 53310 }, { "entropy": 5.344382286071777, "epoch": 5.987813781097321, "grad_norm": 1.1484375, "learning_rate": 0.00020933113241611423, "loss": 4.787, "mean_token_accuracy": 0.240438774228096, "num_tokens": 119012104.0, "step": 53315 }, { "entropy": 5.357608366012573, "epoch": 5.988375358005279, "grad_norm": 1.15625, "learning_rate": 0.0002092927327958396, "loss": 4.8747, "mean_token_accuracy": 0.23360259234905242, "num_tokens": 119022684.0, "step": 53320 }, { "entropy": 5.304161500930786, "epoch": 5.988936934913236, "grad_norm": 1.0546875, "learning_rate": 0.00020925433526770986, "loss": 4.8122, "mean_token_accuracy": 0.23920630663633347, "num_tokens": 119033430.0, "step": 53325 }, { "entropy": 5.346327590942383, "epoch": 5.989498511821194, "grad_norm": 0.98046875, "learning_rate": 0.00020921593983294745, "loss": 4.7947, "mean_token_accuracy": 0.2369563415646553, "num_tokens": 119043783.0, "step": 53330 }, { "entropy": 5.353311538696289, "epoch": 5.990060088729152, "grad_norm": 1.1171875, "learning_rate": 0.0002091775464927752, "loss": 4.8132, "mean_token_accuracy": 0.2379778727889061, "num_tokens": 119053555.0, "step": 53335 }, { "entropy": 5.341504144668579, "epoch": 5.990621665637109, "grad_norm": 1.1015625, "learning_rate": 0.00020913915524841536, "loss": 4.7652, "mean_token_accuracy": 0.2414470434188843, "num_tokens": 119064780.0, "step": 53340 }, { "entropy": 5.294338893890381, "epoch": 5.991183242545066, "grad_norm": 1.0234375, "learning_rate": 0.00020910076610109035, "loss": 4.7751, "mean_token_accuracy": 0.2391240805387497, "num_tokens": 119075991.0, "step": 53345 }, { "entropy": 5.332740449905396, "epoch": 5.991744819453024, "grad_norm": 1.0390625, "learning_rate": 0.00020906237905202253, "loss": 4.8129, "mean_token_accuracy": 0.2357625275850296, "num_tokens": 119088076.0, "step": 53350 }, { "entropy": 5.293495845794678, "epoch": 5.9923063963609815, "grad_norm": 1.0703125, "learning_rate": 0.00020902399410243405, "loss": 4.8134, "mean_token_accuracy": 0.23866510689258574, "num_tokens": 119098775.0, "step": 53355 }, { "entropy": 5.429359769821167, "epoch": 5.99286797326894, "grad_norm": 1.0234375, "learning_rate": 0.0002089856112535473, "loss": 4.9259, "mean_token_accuracy": 0.23437703102827073, "num_tokens": 119110129.0, "step": 53360 }, { "entropy": 5.344730186462402, "epoch": 5.993429550176897, "grad_norm": 1.1171875, "learning_rate": 0.00020894723050658421, "loss": 4.7686, "mean_token_accuracy": 0.24627690464258195, "num_tokens": 119122117.0, "step": 53365 }, { "entropy": 5.378541707992554, "epoch": 5.993991127084854, "grad_norm": 0.9921875, "learning_rate": 0.00020890885186276693, "loss": 4.9008, "mean_token_accuracy": 0.2370368078351021, "num_tokens": 119135426.0, "step": 53370 }, { "entropy": 5.308378028869629, "epoch": 5.994552703992812, "grad_norm": 1.1328125, "learning_rate": 0.0002088704753233175, "loss": 4.7972, "mean_token_accuracy": 0.23776538521051407, "num_tokens": 119146365.0, "step": 53375 }, { "entropy": 5.391438007354736, "epoch": 5.995114280900769, "grad_norm": 1.015625, "learning_rate": 0.0002088321008894577, "loss": 4.8619, "mean_token_accuracy": 0.23801590204238893, "num_tokens": 119157580.0, "step": 53380 }, { "entropy": 5.278424882888794, "epoch": 5.995675857808727, "grad_norm": 1.015625, "learning_rate": 0.00020879372856240952, "loss": 4.7287, "mean_token_accuracy": 0.24455349147319794, "num_tokens": 119168866.0, "step": 53385 }, { "entropy": 5.356719446182251, "epoch": 5.996237434716685, "grad_norm": 1.0546875, "learning_rate": 0.0002087553583433947, "loss": 4.8196, "mean_token_accuracy": 0.2372434049844742, "num_tokens": 119180548.0, "step": 53390 }, { "entropy": 5.3705016613006595, "epoch": 5.996799011624642, "grad_norm": 1.078125, "learning_rate": 0.00020871699023363493, "loss": 4.8662, "mean_token_accuracy": 0.23941477090120317, "num_tokens": 119192089.0, "step": 53395 }, { "entropy": 5.297486782073975, "epoch": 5.997360588532599, "grad_norm": 1.0234375, "learning_rate": 0.0002086786242343519, "loss": 4.7333, "mean_token_accuracy": 0.2439983755350113, "num_tokens": 119202869.0, "step": 53400 }, { "entropy": 5.311602640151977, "epoch": 5.997922165440557, "grad_norm": 1.0078125, "learning_rate": 0.00020864026034676718, "loss": 4.7879, "mean_token_accuracy": 0.2419580340385437, "num_tokens": 119214107.0, "step": 53405 }, { "entropy": 5.3338478088378904, "epoch": 5.9984837423485144, "grad_norm": 1.078125, "learning_rate": 0.00020860189857210238, "loss": 4.8499, "mean_token_accuracy": 0.23969611674547195, "num_tokens": 119224557.0, "step": 53410 }, { "entropy": 5.25014100074768, "epoch": 5.9990453192564726, "grad_norm": 1.078125, "learning_rate": 0.00020856353891157882, "loss": 4.7614, "mean_token_accuracy": 0.2412363976240158, "num_tokens": 119234792.0, "step": 53415 }, { "entropy": 5.3125158786773685, "epoch": 5.99960689616443, "grad_norm": 1.0625, "learning_rate": 0.00020852518136641802, "loss": 4.758, "mean_token_accuracy": 0.23795027583837508, "num_tokens": 119246228.0, "step": 53420 }, { "entropy": 5.393482526143392, "epoch": 6.000112315381592, "grad_norm": 1.09375, "learning_rate": 0.00020848682593784117, "loss": 4.8777, "mean_token_accuracy": 0.2334193785985311, "num_tokens": 119255127.0, "step": 53425 }, { "entropy": 5.3250633716583256, "epoch": 6.000673892289549, "grad_norm": 1.03125, "learning_rate": 0.0002084484726270696, "loss": 4.7653, "mean_token_accuracy": 0.23627821654081343, "num_tokens": 119265817.0, "step": 53430 }, { "entropy": 5.291588640213012, "epoch": 6.001235469197507, "grad_norm": 0.9765625, "learning_rate": 0.00020841012143532446, "loss": 4.6871, "mean_token_accuracy": 0.25043177604675293, "num_tokens": 119278105.0, "step": 53435 }, { "entropy": 5.33927435874939, "epoch": 6.001797046105464, "grad_norm": 1.046875, "learning_rate": 0.00020837177236382687, "loss": 4.8381, "mean_token_accuracy": 0.23494777232408523, "num_tokens": 119289704.0, "step": 53440 }, { "entropy": 5.286820936203003, "epoch": 6.002358623013421, "grad_norm": 1.0625, "learning_rate": 0.0002083334254137979, "loss": 4.6601, "mean_token_accuracy": 0.24776484370231627, "num_tokens": 119300992.0, "step": 53445 }, { "entropy": 5.334121751785278, "epoch": 6.0029201999213795, "grad_norm": 1.0625, "learning_rate": 0.0002082950805864585, "loss": 4.7602, "mean_token_accuracy": 0.24448883831501006, "num_tokens": 119312428.0, "step": 53450 }, { "entropy": 5.313629293441773, "epoch": 6.003481776829337, "grad_norm": 1.09375, "learning_rate": 0.00020825673788302967, "loss": 4.7503, "mean_token_accuracy": 0.24739554077386855, "num_tokens": 119323696.0, "step": 53455 }, { "entropy": 5.327935266494751, "epoch": 6.004043353737294, "grad_norm": 1.078125, "learning_rate": 0.0002082183973047322, "loss": 4.711, "mean_token_accuracy": 0.24840424358844757, "num_tokens": 119335419.0, "step": 53460 }, { "entropy": 5.295620727539062, "epoch": 6.004604930645252, "grad_norm": 1.03125, "learning_rate": 0.0002081800588527868, "loss": 4.7, "mean_token_accuracy": 0.2451683133840561, "num_tokens": 119346922.0, "step": 53465 }, { "entropy": 5.362142276763916, "epoch": 6.005166507553209, "grad_norm": 1.28125, "learning_rate": 0.00020814172252841417, "loss": 4.8049, "mean_token_accuracy": 0.2466015785932541, "num_tokens": 119359137.0, "step": 53470 }, { "entropy": 5.232109117507934, "epoch": 6.005728084461167, "grad_norm": 1.21875, "learning_rate": 0.0002081033883328351, "loss": 4.717, "mean_token_accuracy": 0.24987836182117462, "num_tokens": 119369021.0, "step": 53475 }, { "entropy": 5.247609329223633, "epoch": 6.006289661369125, "grad_norm": 1.0703125, "learning_rate": 0.00020806505626727012, "loss": 4.7171, "mean_token_accuracy": 0.2446214810013771, "num_tokens": 119379210.0, "step": 53480 }, { "entropy": 5.3424656867980955, "epoch": 6.006851238277082, "grad_norm": 1.1875, "learning_rate": 0.00020802672633293967, "loss": 4.7633, "mean_token_accuracy": 0.24457223415374757, "num_tokens": 119389869.0, "step": 53485 }, { "entropy": 5.332297706604004, "epoch": 6.00741281518504, "grad_norm": 1.0390625, "learning_rate": 0.00020798839853106434, "loss": 4.754, "mean_token_accuracy": 0.23884520232677459, "num_tokens": 119401158.0, "step": 53490 }, { "entropy": 5.307502937316895, "epoch": 6.007974392092997, "grad_norm": 1.0390625, "learning_rate": 0.00020795007286286427, "loss": 4.6743, "mean_token_accuracy": 0.2553784683346748, "num_tokens": 119412873.0, "step": 53495 }, { "entropy": 5.2159504890441895, "epoch": 6.008535969000954, "grad_norm": 1.0546875, "learning_rate": 0.00020791174932955993, "loss": 4.6233, "mean_token_accuracy": 0.2597205027937889, "num_tokens": 119422796.0, "step": 53500 }, { "entropy": 5.274893712997437, "epoch": 6.009097545908912, "grad_norm": 1.0078125, "learning_rate": 0.00020787342793237147, "loss": 4.7125, "mean_token_accuracy": 0.24182466715574263, "num_tokens": 119433131.0, "step": 53505 }, { "entropy": 5.276225662231445, "epoch": 6.00965912281687, "grad_norm": 1.0625, "learning_rate": 0.00020783510867251908, "loss": 4.7692, "mean_token_accuracy": 0.2395051121711731, "num_tokens": 119444257.0, "step": 53510 }, { "entropy": 5.334344148635864, "epoch": 6.010220699724828, "grad_norm": 1.078125, "learning_rate": 0.00020779679155122295, "loss": 4.759, "mean_token_accuracy": 0.24111316800117494, "num_tokens": 119454824.0, "step": 53515 }, { "entropy": 5.248088455200195, "epoch": 6.010782276632785, "grad_norm": 1.0546875, "learning_rate": 0.00020775847656970302, "loss": 4.7286, "mean_token_accuracy": 0.24759822636842727, "num_tokens": 119465550.0, "step": 53520 }, { "entropy": 5.280000162124634, "epoch": 6.011343853540742, "grad_norm": 1.015625, "learning_rate": 0.0002077201637291793, "loss": 4.6869, "mean_token_accuracy": 0.25074815154075625, "num_tokens": 119476513.0, "step": 53525 }, { "entropy": 5.399546384811401, "epoch": 6.0119054304487, "grad_norm": 1.09375, "learning_rate": 0.0002076818530308716, "loss": 4.7975, "mean_token_accuracy": 0.24101306796073912, "num_tokens": 119488431.0, "step": 53530 }, { "entropy": 5.361117219924926, "epoch": 6.0124670073566575, "grad_norm": 1.1015625, "learning_rate": 0.00020764354447599988, "loss": 4.7463, "mean_token_accuracy": 0.24519618451595307, "num_tokens": 119499953.0, "step": 53535 }, { "entropy": 5.271987533569336, "epoch": 6.013028584264615, "grad_norm": 1.1875, "learning_rate": 0.0002076052380657838, "loss": 4.63, "mean_token_accuracy": 0.2565925642848015, "num_tokens": 119510179.0, "step": 53540 }, { "entropy": 5.357620191574097, "epoch": 6.013590161172573, "grad_norm": 1.0546875, "learning_rate": 0.00020756693380144297, "loss": 4.8219, "mean_token_accuracy": 0.240038725733757, "num_tokens": 119521428.0, "step": 53545 }, { "entropy": 5.225446367263794, "epoch": 6.01415173808053, "grad_norm": 1.109375, "learning_rate": 0.00020752863168419723, "loss": 4.6073, "mean_token_accuracy": 0.2577981397509575, "num_tokens": 119531369.0, "step": 53550 }, { "entropy": 5.146821594238281, "epoch": 6.014713314988487, "grad_norm": 1.140625, "learning_rate": 0.000207490331715266, "loss": 4.5259, "mean_token_accuracy": 0.2683349967002869, "num_tokens": 119542324.0, "step": 53555 }, { "entropy": 5.1985608577728275, "epoch": 6.015274891896445, "grad_norm": 1.0703125, "learning_rate": 0.00020745203389586886, "loss": 4.6902, "mean_token_accuracy": 0.24531855136156083, "num_tokens": 119552691.0, "step": 53560 }, { "entropy": 5.170269536972046, "epoch": 6.015836468804403, "grad_norm": 1.078125, "learning_rate": 0.00020741373822722508, "loss": 4.5884, "mean_token_accuracy": 0.2524944469332695, "num_tokens": 119563966.0, "step": 53565 }, { "entropy": 5.3174481868743895, "epoch": 6.016398045712361, "grad_norm": 1.0390625, "learning_rate": 0.00020737544471055415, "loss": 4.7654, "mean_token_accuracy": 0.2415078103542328, "num_tokens": 119575862.0, "step": 53570 }, { "entropy": 5.292827939987182, "epoch": 6.016959622620318, "grad_norm": 1.0546875, "learning_rate": 0.0002073371533470752, "loss": 4.6996, "mean_token_accuracy": 0.2440560281276703, "num_tokens": 119586285.0, "step": 53575 }, { "entropy": 5.298908329010009, "epoch": 6.017521199528275, "grad_norm": 1.015625, "learning_rate": 0.0002072988641380076, "loss": 4.7161, "mean_token_accuracy": 0.24395707249641418, "num_tokens": 119598201.0, "step": 53580 }, { "entropy": 5.345401334762573, "epoch": 6.018082776436233, "grad_norm": 1.1484375, "learning_rate": 0.00020726057708457036, "loss": 4.8161, "mean_token_accuracy": 0.24366234689950944, "num_tokens": 119608841.0, "step": 53585 }, { "entropy": 5.363494205474853, "epoch": 6.0186443533441905, "grad_norm": 1.0, "learning_rate": 0.00020722229218798267, "loss": 4.8763, "mean_token_accuracy": 0.23985317945480347, "num_tokens": 119622388.0, "step": 53590 }, { "entropy": 5.34201021194458, "epoch": 6.019205930252148, "grad_norm": 1.03125, "learning_rate": 0.00020718400944946347, "loss": 4.7252, "mean_token_accuracy": 0.24286043792963027, "num_tokens": 119634749.0, "step": 53595 }, { "entropy": 5.293387413024902, "epoch": 6.019767507160106, "grad_norm": 1.125, "learning_rate": 0.00020714572887023174, "loss": 4.6722, "mean_token_accuracy": 0.2493817463517189, "num_tokens": 119645962.0, "step": 53600 }, { "entropy": 5.324564838409424, "epoch": 6.020329084068063, "grad_norm": 1.0703125, "learning_rate": 0.0002071074504515063, "loss": 4.7564, "mean_token_accuracy": 0.24140122532844543, "num_tokens": 119656444.0, "step": 53605 }, { "entropy": 5.355208826065064, "epoch": 6.020890660976021, "grad_norm": 1.125, "learning_rate": 0.000207069174194506, "loss": 4.8092, "mean_token_accuracy": 0.23851526528596878, "num_tokens": 119668752.0, "step": 53610 }, { "entropy": 5.316359424591065, "epoch": 6.021452237883978, "grad_norm": 1.09375, "learning_rate": 0.0002070309001004494, "loss": 4.7715, "mean_token_accuracy": 0.2448462039232254, "num_tokens": 119680305.0, "step": 53615 }, { "entropy": 5.2875635623931885, "epoch": 6.0220138147919355, "grad_norm": 1.03125, "learning_rate": 0.00020699262817055542, "loss": 4.641, "mean_token_accuracy": 0.25850672125816343, "num_tokens": 119690788.0, "step": 53620 }, { "entropy": 5.243199348449707, "epoch": 6.022575391699894, "grad_norm": 1.125, "learning_rate": 0.00020695435840604255, "loss": 4.6526, "mean_token_accuracy": 0.24040796160697936, "num_tokens": 119702514.0, "step": 53625 }, { "entropy": 5.406851720809937, "epoch": 6.023136968607851, "grad_norm": 1.171875, "learning_rate": 0.0002069160908081293, "loss": 4.8272, "mean_token_accuracy": 0.2372339442372322, "num_tokens": 119713321.0, "step": 53630 }, { "entropy": 5.250484037399292, "epoch": 6.023698545515808, "grad_norm": 1.046875, "learning_rate": 0.00020687782537803407, "loss": 4.6712, "mean_token_accuracy": 0.24900168031454087, "num_tokens": 119723163.0, "step": 53635 }, { "entropy": 5.1846764087677, "epoch": 6.024260122423766, "grad_norm": 1.078125, "learning_rate": 0.00020683956211697537, "loss": 4.6594, "mean_token_accuracy": 0.25145803540945055, "num_tokens": 119733807.0, "step": 53640 }, { "entropy": 5.304272031784057, "epoch": 6.024821699331723, "grad_norm": 0.98828125, "learning_rate": 0.00020680130102617138, "loss": 4.7556, "mean_token_accuracy": 0.24679191112518312, "num_tokens": 119746112.0, "step": 53645 }, { "entropy": 5.249809980392456, "epoch": 6.025383276239681, "grad_norm": 0.9921875, "learning_rate": 0.00020676304210684045, "loss": 4.6638, "mean_token_accuracy": 0.24794524908065796, "num_tokens": 119758086.0, "step": 53650 }, { "entropy": 5.271464824676514, "epoch": 6.025944853147639, "grad_norm": 1.171875, "learning_rate": 0.00020672478536020068, "loss": 4.6768, "mean_token_accuracy": 0.2579238101840019, "num_tokens": 119767814.0, "step": 53655 }, { "entropy": 5.284898281097412, "epoch": 6.026506430055596, "grad_norm": 1.0625, "learning_rate": 0.0002066865307874703, "loss": 4.724, "mean_token_accuracy": 0.24601031392812728, "num_tokens": 119778549.0, "step": 53660 }, { "entropy": 5.375846338272095, "epoch": 6.027068006963554, "grad_norm": 1.0390625, "learning_rate": 0.0002066482783898672, "loss": 4.8412, "mean_token_accuracy": 0.24369590878486633, "num_tokens": 119791037.0, "step": 53665 }, { "entropy": 5.301203680038452, "epoch": 6.027629583871511, "grad_norm": 1.125, "learning_rate": 0.0002066100281686095, "loss": 4.6932, "mean_token_accuracy": 0.2427634298801422, "num_tokens": 119801455.0, "step": 53670 }, { "entropy": 5.39236626625061, "epoch": 6.0281911607794685, "grad_norm": 1.03125, "learning_rate": 0.000206571780124915, "loss": 4.8401, "mean_token_accuracy": 0.24015963673591614, "num_tokens": 119813312.0, "step": 53675 }, { "entropy": 5.388398456573486, "epoch": 6.028752737687427, "grad_norm": 1.125, "learning_rate": 0.00020653353426000154, "loss": 4.7919, "mean_token_accuracy": 0.24793309420347215, "num_tokens": 119824006.0, "step": 53680 }, { "entropy": 5.306180667877197, "epoch": 6.029314314595384, "grad_norm": 1.171875, "learning_rate": 0.00020649529057508698, "loss": 4.7228, "mean_token_accuracy": 0.24863775670528412, "num_tokens": 119834420.0, "step": 53685 }, { "entropy": 5.348553419113159, "epoch": 6.029875891503341, "grad_norm": 1.0703125, "learning_rate": 0.00020645704907138875, "loss": 4.7762, "mean_token_accuracy": 0.24985164552927017, "num_tokens": 119845733.0, "step": 53690 }, { "entropy": 5.332263660430908, "epoch": 6.030437468411299, "grad_norm": 1.1484375, "learning_rate": 0.00020641880975012477, "loss": 4.7942, "mean_token_accuracy": 0.24499650597572326, "num_tokens": 119855990.0, "step": 53695 }, { "entropy": 5.359835910797119, "epoch": 6.030999045319256, "grad_norm": 1.0859375, "learning_rate": 0.00020638057261251254, "loss": 4.7886, "mean_token_accuracy": 0.23799397349357604, "num_tokens": 119866211.0, "step": 53700 }, { "entropy": 5.395473051071167, "epoch": 6.0315606222272145, "grad_norm": 1.1328125, "learning_rate": 0.00020634233765976946, "loss": 4.7826, "mean_token_accuracy": 0.24104208648204803, "num_tokens": 119878149.0, "step": 53705 }, { "entropy": 5.322150230407715, "epoch": 6.032122199135172, "grad_norm": 1.125, "learning_rate": 0.00020630410489311298, "loss": 4.7436, "mean_token_accuracy": 0.2502454072237015, "num_tokens": 119888745.0, "step": 53710 }, { "entropy": 5.335811805725098, "epoch": 6.032683776043129, "grad_norm": 1.0546875, "learning_rate": 0.00020626587431376043, "loss": 4.7784, "mean_token_accuracy": 0.23833724558353425, "num_tokens": 119900904.0, "step": 53715 }, { "entropy": 5.317043924331665, "epoch": 6.033245352951087, "grad_norm": 1.015625, "learning_rate": 0.0002062276459229291, "loss": 4.7623, "mean_token_accuracy": 0.23794427514076233, "num_tokens": 119911624.0, "step": 53720 }, { "entropy": 5.336026000976562, "epoch": 6.033806929859044, "grad_norm": 1.0703125, "learning_rate": 0.00020618941972183613, "loss": 4.7934, "mean_token_accuracy": 0.23747270405292512, "num_tokens": 119922914.0, "step": 53725 }, { "entropy": 5.31144871711731, "epoch": 6.034368506767001, "grad_norm": 1.1015625, "learning_rate": 0.0002061511957116988, "loss": 4.7246, "mean_token_accuracy": 0.24084382653236389, "num_tokens": 119934337.0, "step": 53730 }, { "entropy": 5.321654272079468, "epoch": 6.0349300836749595, "grad_norm": 1.1640625, "learning_rate": 0.00020611297389373413, "loss": 4.6864, "mean_token_accuracy": 0.2605693906545639, "num_tokens": 119944993.0, "step": 53735 }, { "entropy": 5.3523674488067625, "epoch": 6.035491660582917, "grad_norm": 1.1796875, "learning_rate": 0.00020607475426915906, "loss": 4.7684, "mean_token_accuracy": 0.2466003566980362, "num_tokens": 119956044.0, "step": 53740 }, { "entropy": 5.248297691345215, "epoch": 6.036053237490874, "grad_norm": 1.140625, "learning_rate": 0.00020603653683919055, "loss": 4.6862, "mean_token_accuracy": 0.24862728267908096, "num_tokens": 119967375.0, "step": 53745 }, { "entropy": 5.178760671615601, "epoch": 6.036614814398832, "grad_norm": 1.125, "learning_rate": 0.00020599832160504545, "loss": 4.633, "mean_token_accuracy": 0.25857930034399035, "num_tokens": 119977901.0, "step": 53750 }, { "entropy": 5.341062021255493, "epoch": 6.037176391306789, "grad_norm": 1.0703125, "learning_rate": 0.00020596010856794057, "loss": 4.7655, "mean_token_accuracy": 0.24295441508293153, "num_tokens": 119989345.0, "step": 53755 }, { "entropy": 5.310883331298828, "epoch": 6.037737968214747, "grad_norm": 0.96875, "learning_rate": 0.00020592189772909248, "loss": 4.7703, "mean_token_accuracy": 0.24296208918094636, "num_tokens": 120002148.0, "step": 53760 }, { "entropy": 5.355102491378784, "epoch": 6.038299545122705, "grad_norm": 1.03125, "learning_rate": 0.00020588368908971806, "loss": 4.7585, "mean_token_accuracy": 0.2512926608324051, "num_tokens": 120015928.0, "step": 53765 }, { "entropy": 5.381805086135865, "epoch": 6.038861122030662, "grad_norm": 1.078125, "learning_rate": 0.00020584548265103382, "loss": 4.8443, "mean_token_accuracy": 0.2414686769247055, "num_tokens": 120028008.0, "step": 53770 }, { "entropy": 5.234278917312622, "epoch": 6.03942269893862, "grad_norm": 1.0703125, "learning_rate": 0.00020580727841425624, "loss": 4.6737, "mean_token_accuracy": 0.24798963218927383, "num_tokens": 120039214.0, "step": 53775 }, { "entropy": 5.194100999832154, "epoch": 6.039984275846577, "grad_norm": 1.109375, "learning_rate": 0.00020576907638060167, "loss": 4.6084, "mean_token_accuracy": 0.2558003902435303, "num_tokens": 120050189.0, "step": 53780 }, { "entropy": 5.223897886276245, "epoch": 6.040545852754534, "grad_norm": 1.0546875, "learning_rate": 0.00020573087655128658, "loss": 4.6103, "mean_token_accuracy": 0.25135239213705063, "num_tokens": 120061036.0, "step": 53785 }, { "entropy": 5.282159662246704, "epoch": 6.0411074296624925, "grad_norm": 1.1484375, "learning_rate": 0.0002056926789275273, "loss": 4.7222, "mean_token_accuracy": 0.24673686176538467, "num_tokens": 120071208.0, "step": 53790 }, { "entropy": 5.30632905960083, "epoch": 6.04166900657045, "grad_norm": 1.0390625, "learning_rate": 0.00020565448351053995, "loss": 4.7952, "mean_token_accuracy": 0.2409922733902931, "num_tokens": 120083134.0, "step": 53795 }, { "entropy": 5.264612627029419, "epoch": 6.042230583478408, "grad_norm": 1.046875, "learning_rate": 0.00020561629030154077, "loss": 4.643, "mean_token_accuracy": 0.2554131865501404, "num_tokens": 120094564.0, "step": 53800 }, { "entropy": 5.33672022819519, "epoch": 6.042792160386365, "grad_norm": 1.078125, "learning_rate": 0.00020557809930174582, "loss": 4.8354, "mean_token_accuracy": 0.23911887258291245, "num_tokens": 120106027.0, "step": 53805 }, { "entropy": 5.457008361816406, "epoch": 6.043353737294322, "grad_norm": 1.0625, "learning_rate": 0.0002055399105123711, "loss": 4.8213, "mean_token_accuracy": 0.22789683192968369, "num_tokens": 120117435.0, "step": 53810 }, { "entropy": 5.27997088432312, "epoch": 6.04391531420228, "grad_norm": 1.0625, "learning_rate": 0.00020550172393463256, "loss": 4.6986, "mean_token_accuracy": 0.24592396169900893, "num_tokens": 120127502.0, "step": 53815 }, { "entropy": 5.25882740020752, "epoch": 6.044476891110238, "grad_norm": 1.140625, "learning_rate": 0.0002054635395697461, "loss": 4.7242, "mean_token_accuracy": 0.24966303259134293, "num_tokens": 120138080.0, "step": 53820 }, { "entropy": 5.342452144622802, "epoch": 6.045038468018195, "grad_norm": 1.1171875, "learning_rate": 0.00020542535741892754, "loss": 4.779, "mean_token_accuracy": 0.24048155546188354, "num_tokens": 120148468.0, "step": 53825 }, { "entropy": 5.328269290924072, "epoch": 6.045600044926153, "grad_norm": 1.109375, "learning_rate": 0.00020538717748339248, "loss": 4.7626, "mean_token_accuracy": 0.24611260145902633, "num_tokens": 120159563.0, "step": 53830 }, { "entropy": 5.326879692077637, "epoch": 6.04616162183411, "grad_norm": 1.1484375, "learning_rate": 0.00020534899976435672, "loss": 4.7688, "mean_token_accuracy": 0.2462201312184334, "num_tokens": 120169186.0, "step": 53835 }, { "entropy": 5.416034460067749, "epoch": 6.046723198742067, "grad_norm": 1.1171875, "learning_rate": 0.0002053108242630359, "loss": 4.9115, "mean_token_accuracy": 0.23397413343191148, "num_tokens": 120181046.0, "step": 53840 }, { "entropy": 5.249190187454223, "epoch": 6.047284775650025, "grad_norm": 1.0859375, "learning_rate": 0.00020527265098064547, "loss": 4.701, "mean_token_accuracy": 0.243500055372715, "num_tokens": 120190808.0, "step": 53845 }, { "entropy": 5.278196096420288, "epoch": 6.047846352557983, "grad_norm": 0.984375, "learning_rate": 0.00020523447991840078, "loss": 4.7173, "mean_token_accuracy": 0.24394591748714448, "num_tokens": 120202946.0, "step": 53850 }, { "entropy": 5.334074211120606, "epoch": 6.048407929465941, "grad_norm": 0.98828125, "learning_rate": 0.00020519631107751736, "loss": 4.7339, "mean_token_accuracy": 0.25441970080137255, "num_tokens": 120214571.0, "step": 53855 }, { "entropy": 5.324241590499878, "epoch": 6.048969506373898, "grad_norm": 1.0625, "learning_rate": 0.0002051581444592105, "loss": 4.7508, "mean_token_accuracy": 0.24376674890518188, "num_tokens": 120224772.0, "step": 53860 }, { "entropy": 5.338378858566284, "epoch": 6.049531083281855, "grad_norm": 1.0625, "learning_rate": 0.00020511998006469533, "loss": 4.7367, "mean_token_accuracy": 0.24418913424015046, "num_tokens": 120236216.0, "step": 53865 }, { "entropy": 5.319238615036011, "epoch": 6.050092660189813, "grad_norm": 1.1484375, "learning_rate": 0.0002050818178951871, "loss": 4.7376, "mean_token_accuracy": 0.24092504978179932, "num_tokens": 120247230.0, "step": 53870 }, { "entropy": 5.228237628936768, "epoch": 6.0506542370977705, "grad_norm": 1.078125, "learning_rate": 0.000205043657951901, "loss": 4.675, "mean_token_accuracy": 0.24884769916534424, "num_tokens": 120258036.0, "step": 53875 }, { "entropy": 5.297597885131836, "epoch": 6.051215814005728, "grad_norm": 1.078125, "learning_rate": 0.0002050055002360519, "loss": 4.735, "mean_token_accuracy": 0.2469738930463791, "num_tokens": 120269483.0, "step": 53880 }, { "entropy": 5.2449524879455565, "epoch": 6.051777390913686, "grad_norm": 1.0703125, "learning_rate": 0.0002049673447488548, "loss": 4.6667, "mean_token_accuracy": 0.24441668540239334, "num_tokens": 120280345.0, "step": 53885 }, { "entropy": 5.3247767925262455, "epoch": 6.052338967821643, "grad_norm": 1.1015625, "learning_rate": 0.00020492919149152467, "loss": 4.7168, "mean_token_accuracy": 0.247561976313591, "num_tokens": 120291245.0, "step": 53890 }, { "entropy": 5.273043584823609, "epoch": 6.052900544729601, "grad_norm": 1.0625, "learning_rate": 0.00020489104046527624, "loss": 4.7002, "mean_token_accuracy": 0.24393037855625152, "num_tokens": 120302606.0, "step": 53895 }, { "entropy": 5.283026123046875, "epoch": 6.053462121637558, "grad_norm": 1.0625, "learning_rate": 0.00020485289167132426, "loss": 4.7185, "mean_token_accuracy": 0.24804951399564742, "num_tokens": 120314036.0, "step": 53900 }, { "entropy": 5.29703540802002, "epoch": 6.054023698545516, "grad_norm": 1.03125, "learning_rate": 0.00020481474511088333, "loss": 4.7665, "mean_token_accuracy": 0.23769553750753403, "num_tokens": 120326010.0, "step": 53905 }, { "entropy": 5.378128576278686, "epoch": 6.054585275453474, "grad_norm": 1.0, "learning_rate": 0.0002047766007851682, "loss": 4.8163, "mean_token_accuracy": 0.23940632492303848, "num_tokens": 120337530.0, "step": 53910 }, { "entropy": 5.366470098495483, "epoch": 6.055146852361431, "grad_norm": 1.1015625, "learning_rate": 0.00020473845869539337, "loss": 4.7176, "mean_token_accuracy": 0.24492294192314149, "num_tokens": 120348141.0, "step": 53915 }, { "entropy": 5.301345539093018, "epoch": 6.055708429269388, "grad_norm": 1.0234375, "learning_rate": 0.0002047003188427733, "loss": 4.758, "mean_token_accuracy": 0.2506889134645462, "num_tokens": 120359675.0, "step": 53920 }, { "entropy": 5.2994472026824955, "epoch": 6.056270006177346, "grad_norm": 1.1171875, "learning_rate": 0.00020466218122852225, "loss": 4.7447, "mean_token_accuracy": 0.24748701006174087, "num_tokens": 120370821.0, "step": 53925 }, { "entropy": 5.32097864151001, "epoch": 6.0568315830853034, "grad_norm": 1.15625, "learning_rate": 0.0002046240458538547, "loss": 4.7664, "mean_token_accuracy": 0.251889505982399, "num_tokens": 120383198.0, "step": 53930 }, { "entropy": 5.349177122116089, "epoch": 6.057393159993261, "grad_norm": 1.0859375, "learning_rate": 0.0002045859127199848, "loss": 4.7982, "mean_token_accuracy": 0.24302783310413362, "num_tokens": 120395801.0, "step": 53935 }, { "entropy": 5.214062070846557, "epoch": 6.057954736901219, "grad_norm": 1.0625, "learning_rate": 0.00020454778182812673, "loss": 4.5584, "mean_token_accuracy": 0.2583622708916664, "num_tokens": 120406138.0, "step": 53940 }, { "entropy": 5.3003710269927975, "epoch": 6.058516313809176, "grad_norm": 1.0390625, "learning_rate": 0.0002045096531794946, "loss": 4.7899, "mean_token_accuracy": 0.2449087083339691, "num_tokens": 120417835.0, "step": 53945 }, { "entropy": 5.277628183364868, "epoch": 6.059077890717134, "grad_norm": 1.0, "learning_rate": 0.0002044715267753025, "loss": 4.7417, "mean_token_accuracy": 0.24306504279375077, "num_tokens": 120428831.0, "step": 53950 }, { "entropy": 5.294975519180298, "epoch": 6.059639467625091, "grad_norm": 1.15625, "learning_rate": 0.0002044334026167643, "loss": 4.7121, "mean_token_accuracy": 0.24762635082006454, "num_tokens": 120438599.0, "step": 53955 }, { "entropy": 5.246413469314575, "epoch": 6.0602010445330485, "grad_norm": 1.0078125, "learning_rate": 0.000204395280705094, "loss": 4.6979, "mean_token_accuracy": 0.24047832638025285, "num_tokens": 120450113.0, "step": 53960 }, { "entropy": 5.2937822341918945, "epoch": 6.060762621441007, "grad_norm": 1.0625, "learning_rate": 0.00020435716104150525, "loss": 4.6836, "mean_token_accuracy": 0.25834870934486387, "num_tokens": 120461869.0, "step": 53965 }, { "entropy": 5.27721095085144, "epoch": 6.061324198348964, "grad_norm": 1.0625, "learning_rate": 0.00020431904362721198, "loss": 4.7271, "mean_token_accuracy": 0.24767681062221528, "num_tokens": 120472819.0, "step": 53970 }, { "entropy": 5.270786619186401, "epoch": 6.061885775256921, "grad_norm": 1.1484375, "learning_rate": 0.00020428092846342766, "loss": 4.6856, "mean_token_accuracy": 0.2511787161231041, "num_tokens": 120483861.0, "step": 53975 }, { "entropy": 5.3022692680358885, "epoch": 6.062447352164879, "grad_norm": 1.109375, "learning_rate": 0.0002042428155513661, "loss": 4.7024, "mean_token_accuracy": 0.25228515118360517, "num_tokens": 120495268.0, "step": 53980 }, { "entropy": 5.2378637313842775, "epoch": 6.063008929072836, "grad_norm": 0.97265625, "learning_rate": 0.00020420470489224075, "loss": 4.6727, "mean_token_accuracy": 0.2400696113705635, "num_tokens": 120508032.0, "step": 53985 }, { "entropy": 5.282812690734863, "epoch": 6.0635705059807945, "grad_norm": 1.1953125, "learning_rate": 0.000204166596487265, "loss": 4.7182, "mean_token_accuracy": 0.2561252564191818, "num_tokens": 120518791.0, "step": 53990 }, { "entropy": 5.314331531524658, "epoch": 6.064132082888752, "grad_norm": 1.1015625, "learning_rate": 0.0002041284903376523, "loss": 4.7806, "mean_token_accuracy": 0.24260967671871186, "num_tokens": 120530694.0, "step": 53995 }, { "entropy": 5.313423347473145, "epoch": 6.064693659796709, "grad_norm": 1.0703125, "learning_rate": 0.00020409038644461598, "loss": 4.7897, "mean_token_accuracy": 0.24708643406629563, "num_tokens": 120542375.0, "step": 54000 }, { "epoch": 6.064693659796709, "eval_entropy": 5.093094628958595, "eval_loss": 4.980837821960449, "eval_mean_token_accuracy": 0.2373161247292683, "eval_num_tokens": 120542375.0, "eval_runtime": 23.9604, "eval_samples_per_second": 1294.342, "eval_steps_per_second": 161.808, "step": 54000 } ], "logging_steps": 5, "max_steps": 89030, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.889107709184e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }