{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3369461447745269, "eval_steps": 3000, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691954421997071, "epoch": 0.0005615769079575448, "grad_norm": 13.75, "learning_rate": 2e-06, "loss": 10.8494, "mean_token_accuracy": 0.0, "num_tokens": 10897.0, "step": 5 }, { "entropy": 10.692028713226318, "epoch": 0.0011231538159150896, "grad_norm": 13.375, "learning_rate": 4.5e-06, "loss": 10.783, "mean_token_accuracy": 7.102272938936949e-05, "num_tokens": 23084.0, "step": 10 }, { "entropy": 10.69119052886963, "epoch": 0.0016847307238726343, "grad_norm": 10.5, "learning_rate": 7e-06, "loss": 10.5147, "mean_token_accuracy": 0.01880119484849274, "num_tokens": 35810.0, "step": 15 }, { "entropy": 10.683763885498047, "epoch": 0.0022463076318301792, "grad_norm": 6.15625, "learning_rate": 9.5e-06, "loss": 10.1375, "mean_token_accuracy": 0.03672755789011717, "num_tokens": 46019.0, "step": 20 }, { "entropy": 10.640995311737061, "epoch": 0.002807884539787724, "grad_norm": 4.375, "learning_rate": 1.2e-05, "loss": 9.8065, "mean_token_accuracy": 0.0391056377440691, "num_tokens": 57272.0, "step": 25 }, { "entropy": 10.578758907318115, "epoch": 0.0033694614477452686, "grad_norm": 3.28125, "learning_rate": 1.4500000000000002e-05, "loss": 9.6789, "mean_token_accuracy": 0.036402178928256035, "num_tokens": 68686.0, "step": 30 }, { "entropy": 10.573095703125, "epoch": 0.003931038355702813, "grad_norm": 2.90625, "learning_rate": 1.7000000000000003e-05, "loss": 9.5714, "mean_token_accuracy": 0.04141928404569626, "num_tokens": 79187.0, "step": 35 }, { "entropy": 10.575594806671143, "epoch": 0.0044926152636603585, "grad_norm": 2.75, "learning_rate": 1.95e-05, "loss": 9.5576, "mean_token_accuracy": 0.044133822247385976, "num_tokens": 90293.0, "step": 40 }, { "entropy": 10.556080150604249, "epoch": 0.005054192171617903, "grad_norm": 2.578125, "learning_rate": 2.2e-05, "loss": 9.4673, "mean_token_accuracy": 0.04080899097025394, "num_tokens": 100420.0, "step": 45 }, { "entropy": 10.538790798187256, "epoch": 0.005615769079575448, "grad_norm": 2.515625, "learning_rate": 2.4500000000000003e-05, "loss": 9.4858, "mean_token_accuracy": 0.03646625243127346, "num_tokens": 111198.0, "step": 50 }, { "entropy": 10.547248840332031, "epoch": 0.006177345987532993, "grad_norm": 2.34375, "learning_rate": 2.7e-05, "loss": 9.3988, "mean_token_accuracy": 0.05780095718801022, "num_tokens": 124723.0, "step": 55 }, { "entropy": 10.461988258361817, "epoch": 0.006738922895490537, "grad_norm": 2.46875, "learning_rate": 2.95e-05, "loss": 9.2587, "mean_token_accuracy": 0.061974577233195306, "num_tokens": 136366.0, "step": 60 }, { "entropy": 10.363299369812012, "epoch": 0.007300499803448083, "grad_norm": 2.4375, "learning_rate": 3.2e-05, "loss": 9.1817, "mean_token_accuracy": 0.06283607967197895, "num_tokens": 146536.0, "step": 65 }, { "entropy": 10.396018791198731, "epoch": 0.007862076711405626, "grad_norm": 2.21875, "learning_rate": 3.4500000000000005e-05, "loss": 9.097, "mean_token_accuracy": 0.0707736562937498, "num_tokens": 157005.0, "step": 70 }, { "entropy": 10.386055850982666, "epoch": 0.008423653619363172, "grad_norm": 2.328125, "learning_rate": 3.7e-05, "loss": 9.017, "mean_token_accuracy": 0.07136933580040931, "num_tokens": 167864.0, "step": 75 }, { "entropy": 10.352816581726074, "epoch": 0.008985230527320717, "grad_norm": 2.5625, "learning_rate": 3.95e-05, "loss": 8.9484, "mean_token_accuracy": 0.06433885768055916, "num_tokens": 179635.0, "step": 80 }, { "entropy": 10.24338674545288, "epoch": 0.00954680743527826, "grad_norm": 2.671875, "learning_rate": 4.2000000000000004e-05, "loss": 8.8572, "mean_token_accuracy": 0.07211834266781807, "num_tokens": 190614.0, "step": 85 }, { "entropy": 10.245021152496339, "epoch": 0.010108384343235806, "grad_norm": 2.21875, "learning_rate": 4.45e-05, "loss": 8.7198, "mean_token_accuracy": 0.07616456523537636, "num_tokens": 201496.0, "step": 90 }, { "entropy": 10.094779968261719, "epoch": 0.010669961251193351, "grad_norm": 2.46875, "learning_rate": 4.7000000000000004e-05, "loss": 8.6055, "mean_token_accuracy": 0.0780682846903801, "num_tokens": 211606.0, "step": 95 }, { "entropy": 10.115865230560303, "epoch": 0.011231538159150897, "grad_norm": 2.625, "learning_rate": 4.9500000000000004e-05, "loss": 8.4856, "mean_token_accuracy": 0.07667104676365852, "num_tokens": 223503.0, "step": 100 }, { "entropy": 10.032721042633057, "epoch": 0.01179311506710844, "grad_norm": 2.421875, "learning_rate": 5.2e-05, "loss": 8.4196, "mean_token_accuracy": 0.0808894768357277, "num_tokens": 234744.0, "step": 105 }, { "entropy": 9.90083703994751, "epoch": 0.012354691975065986, "grad_norm": 1.7890625, "learning_rate": 5.45e-05, "loss": 8.3419, "mean_token_accuracy": 0.08203728273510932, "num_tokens": 247663.0, "step": 110 }, { "entropy": 9.945332717895507, "epoch": 0.012916268883023531, "grad_norm": 1.96875, "learning_rate": 5.7e-05, "loss": 8.2013, "mean_token_accuracy": 0.08452324643731117, "num_tokens": 260326.0, "step": 115 }, { "entropy": 9.736694145202637, "epoch": 0.013477845790981074, "grad_norm": 2.1875, "learning_rate": 5.9499999999999996e-05, "loss": 8.0563, "mean_token_accuracy": 0.0793469488620758, "num_tokens": 271568.0, "step": 120 }, { "entropy": 9.62724199295044, "epoch": 0.01403942269893862, "grad_norm": 2.359375, "learning_rate": 6.2e-05, "loss": 7.8825, "mean_token_accuracy": 0.08820232152938842, "num_tokens": 282651.0, "step": 125 }, { "entropy": 9.494030666351318, "epoch": 0.014600999606896165, "grad_norm": 1.96875, "learning_rate": 6.450000000000001e-05, "loss": 7.719, "mean_token_accuracy": 0.08837165534496308, "num_tokens": 292753.0, "step": 130 }, { "entropy": 9.272327136993407, "epoch": 0.015162576514853709, "grad_norm": 1.609375, "learning_rate": 6.7e-05, "loss": 7.7167, "mean_token_accuracy": 0.0898565836250782, "num_tokens": 302981.0, "step": 135 }, { "entropy": 9.16934871673584, "epoch": 0.015724153422811252, "grad_norm": 1.5, "learning_rate": 6.950000000000001e-05, "loss": 7.6775, "mean_token_accuracy": 0.08807501792907715, "num_tokens": 314461.0, "step": 140 }, { "entropy": 8.914916038513184, "epoch": 0.0162857303307688, "grad_norm": 1.6796875, "learning_rate": 7.2e-05, "loss": 7.6052, "mean_token_accuracy": 0.09032118767499923, "num_tokens": 326877.0, "step": 145 }, { "entropy": 8.733859825134278, "epoch": 0.016847307238726343, "grad_norm": 1.5546875, "learning_rate": 7.45e-05, "loss": 7.3998, "mean_token_accuracy": 0.09276190958917141, "num_tokens": 337831.0, "step": 150 }, { "entropy": 8.528983402252198, "epoch": 0.017408884146683887, "grad_norm": 1.5703125, "learning_rate": 7.7e-05, "loss": 7.337, "mean_token_accuracy": 0.09177347123622895, "num_tokens": 348233.0, "step": 155 }, { "entropy": 8.35361089706421, "epoch": 0.017970461054641434, "grad_norm": 1.4609375, "learning_rate": 7.950000000000001e-05, "loss": 7.2213, "mean_token_accuracy": 0.09552499204874039, "num_tokens": 359113.0, "step": 160 }, { "entropy": 8.23711051940918, "epoch": 0.018532037962598977, "grad_norm": 2.703125, "learning_rate": 8.2e-05, "loss": 7.336, "mean_token_accuracy": 0.10098176226019859, "num_tokens": 370284.0, "step": 165 }, { "entropy": 8.123040294647216, "epoch": 0.01909361487055652, "grad_norm": 1.7734375, "learning_rate": 8.450000000000001e-05, "loss": 7.3538, "mean_token_accuracy": 0.08904306292533874, "num_tokens": 381415.0, "step": 170 }, { "entropy": 7.9991672992706295, "epoch": 0.019655191778514068, "grad_norm": 1.34375, "learning_rate": 8.7e-05, "loss": 7.2764, "mean_token_accuracy": 0.09914608523249627, "num_tokens": 392080.0, "step": 175 }, { "entropy": 7.944419240951538, "epoch": 0.020216768686471612, "grad_norm": 1.3359375, "learning_rate": 8.95e-05, "loss": 7.2597, "mean_token_accuracy": 0.09534113705158234, "num_tokens": 402551.0, "step": 180 }, { "entropy": 7.984531497955322, "epoch": 0.020778345594429155, "grad_norm": 1.296875, "learning_rate": 9.2e-05, "loss": 7.2418, "mean_token_accuracy": 0.09288135915994644, "num_tokens": 414670.0, "step": 185 }, { "entropy": 7.863457107543946, "epoch": 0.021339922502386702, "grad_norm": 1.1484375, "learning_rate": 9.45e-05, "loss": 7.2269, "mean_token_accuracy": 0.09570453688502312, "num_tokens": 427162.0, "step": 190 }, { "entropy": 7.844120883941651, "epoch": 0.021901499410344246, "grad_norm": 1.4296875, "learning_rate": 9.7e-05, "loss": 7.125, "mean_token_accuracy": 0.09662900492548943, "num_tokens": 438628.0, "step": 195 }, { "entropy": 7.827740716934204, "epoch": 0.022463076318301793, "grad_norm": 1.3984375, "learning_rate": 9.95e-05, "loss": 7.0534, "mean_token_accuracy": 0.10476038753986358, "num_tokens": 449248.0, "step": 200 }, { "entropy": 7.613120603561401, "epoch": 0.023024653226259337, "grad_norm": 1.2265625, "learning_rate": 0.000102, "loss": 7.0291, "mean_token_accuracy": 0.10421562120318413, "num_tokens": 460815.0, "step": 205 }, { "entropy": 7.653258895874023, "epoch": 0.02358623013421688, "grad_norm": 1.3671875, "learning_rate": 0.00010449999999999999, "loss": 7.1939, "mean_token_accuracy": 0.09638625457882881, "num_tokens": 471972.0, "step": 210 }, { "entropy": 7.694521474838257, "epoch": 0.024147807042174427, "grad_norm": 1.265625, "learning_rate": 0.000107, "loss": 7.1589, "mean_token_accuracy": 0.1014483891427517, "num_tokens": 482775.0, "step": 215 }, { "entropy": 7.650409984588623, "epoch": 0.02470938395013197, "grad_norm": 1.2421875, "learning_rate": 0.0001095, "loss": 7.087, "mean_token_accuracy": 0.10187960937619209, "num_tokens": 495151.0, "step": 220 }, { "entropy": 7.605823087692261, "epoch": 0.025270960858089515, "grad_norm": 1.328125, "learning_rate": 0.000112, "loss": 7.0608, "mean_token_accuracy": 0.10176030248403549, "num_tokens": 506947.0, "step": 225 }, { "entropy": 7.604726552963257, "epoch": 0.025832537766047062, "grad_norm": 1.421875, "learning_rate": 0.0001145, "loss": 7.0892, "mean_token_accuracy": 0.10170613378286361, "num_tokens": 519153.0, "step": 230 }, { "entropy": 7.570750951766968, "epoch": 0.026394114674004605, "grad_norm": 1.21875, "learning_rate": 0.00011700000000000001, "loss": 7.07, "mean_token_accuracy": 0.10081414431333542, "num_tokens": 531050.0, "step": 235 }, { "entropy": 7.4688334465026855, "epoch": 0.02695569158196215, "grad_norm": 1.3046875, "learning_rate": 0.00011949999999999999, "loss": 7.006, "mean_token_accuracy": 0.10289591774344445, "num_tokens": 542744.0, "step": 240 }, { "entropy": 7.563732862472534, "epoch": 0.027517268489919696, "grad_norm": 1.453125, "learning_rate": 0.000122, "loss": 7.0923, "mean_token_accuracy": 0.0983924463391304, "num_tokens": 554748.0, "step": 245 }, { "entropy": 7.534366416931152, "epoch": 0.02807884539787724, "grad_norm": 1.4765625, "learning_rate": 0.0001245, "loss": 7.0106, "mean_token_accuracy": 0.10552474185824394, "num_tokens": 564868.0, "step": 250 }, { "entropy": 7.530099248886108, "epoch": 0.028640422305834783, "grad_norm": 1.375, "learning_rate": 0.000127, "loss": 7.0091, "mean_token_accuracy": 0.11061361208558082, "num_tokens": 575668.0, "step": 255 }, { "entropy": 7.455753898620605, "epoch": 0.02920199921379233, "grad_norm": 1.1015625, "learning_rate": 0.0001295, "loss": 7.1352, "mean_token_accuracy": 0.10184136554598808, "num_tokens": 587956.0, "step": 260 }, { "entropy": 7.4932270526885985, "epoch": 0.029763576121749874, "grad_norm": 1.3984375, "learning_rate": 0.000132, "loss": 6.9785, "mean_token_accuracy": 0.10903615280985832, "num_tokens": 598246.0, "step": 265 }, { "entropy": 7.416919708251953, "epoch": 0.030325153029707418, "grad_norm": 1.2578125, "learning_rate": 0.00013450000000000002, "loss": 7.1108, "mean_token_accuracy": 0.10414381325244904, "num_tokens": 610628.0, "step": 270 }, { "entropy": 7.3690831661224365, "epoch": 0.030886729937664965, "grad_norm": 1.453125, "learning_rate": 0.00013700000000000002, "loss": 6.8616, "mean_token_accuracy": 0.1097691647708416, "num_tokens": 621214.0, "step": 275 }, { "entropy": 7.360501384735107, "epoch": 0.031448306845622505, "grad_norm": 1.3046875, "learning_rate": 0.0001395, "loss": 6.957, "mean_token_accuracy": 0.1151120163500309, "num_tokens": 631123.0, "step": 280 }, { "entropy": 7.397417736053467, "epoch": 0.032009883753580055, "grad_norm": 1.296875, "learning_rate": 0.00014199999999999998, "loss": 6.9474, "mean_token_accuracy": 0.10703005790710449, "num_tokens": 643434.0, "step": 285 }, { "entropy": 7.342480707168579, "epoch": 0.0325714606615376, "grad_norm": 1.1796875, "learning_rate": 0.0001445, "loss": 6.9321, "mean_token_accuracy": 0.11211270317435265, "num_tokens": 655336.0, "step": 290 }, { "entropy": 7.372163486480713, "epoch": 0.03313303756949514, "grad_norm": 1.5, "learning_rate": 0.000147, "loss": 6.9245, "mean_token_accuracy": 0.10963715985417366, "num_tokens": 666591.0, "step": 295 }, { "entropy": 7.286645698547363, "epoch": 0.033694614477452686, "grad_norm": 1.328125, "learning_rate": 0.0001495, "loss": 6.9458, "mean_token_accuracy": 0.10590762570500374, "num_tokens": 678288.0, "step": 300 }, { "entropy": 7.292938613891602, "epoch": 0.03425619138541023, "grad_norm": 1.21875, "learning_rate": 0.000152, "loss": 6.8788, "mean_token_accuracy": 0.11080723032355308, "num_tokens": 688526.0, "step": 305 }, { "entropy": 7.20158314704895, "epoch": 0.03481776829336777, "grad_norm": 1.1015625, "learning_rate": 0.00015450000000000001, "loss": 6.7955, "mean_token_accuracy": 0.12063507586717606, "num_tokens": 698727.0, "step": 310 }, { "entropy": 7.281469917297363, "epoch": 0.035379345201325324, "grad_norm": 1.359375, "learning_rate": 0.000157, "loss": 6.8411, "mean_token_accuracy": 0.1111941859126091, "num_tokens": 710042.0, "step": 315 }, { "entropy": 7.2135881900787355, "epoch": 0.03594092210928287, "grad_norm": 1.3125, "learning_rate": 0.0001595, "loss": 6.7838, "mean_token_accuracy": 0.11598038524389268, "num_tokens": 721390.0, "step": 320 }, { "entropy": 7.166607904434204, "epoch": 0.03650249901724041, "grad_norm": 1.3828125, "learning_rate": 0.000162, "loss": 6.9676, "mean_token_accuracy": 0.11324010118842125, "num_tokens": 732949.0, "step": 325 }, { "entropy": 7.382533311843872, "epoch": 0.037064075925197955, "grad_norm": 1.2578125, "learning_rate": 0.00016450000000000001, "loss": 6.983, "mean_token_accuracy": 0.11112697571516036, "num_tokens": 744943.0, "step": 330 }, { "entropy": 7.1175624370574955, "epoch": 0.0376256528331555, "grad_norm": 1.265625, "learning_rate": 0.00016700000000000002, "loss": 6.7549, "mean_token_accuracy": 0.11743907704949379, "num_tokens": 756579.0, "step": 335 }, { "entropy": 7.059293413162232, "epoch": 0.03818722974111304, "grad_norm": 1.3515625, "learning_rate": 0.00016950000000000003, "loss": 6.7064, "mean_token_accuracy": 0.11693573296070099, "num_tokens": 767260.0, "step": 340 }, { "entropy": 7.129382991790772, "epoch": 0.03874880664907059, "grad_norm": 1.1640625, "learning_rate": 0.00017199999999999998, "loss": 6.8055, "mean_token_accuracy": 0.11503136828541756, "num_tokens": 778163.0, "step": 345 }, { "entropy": 7.21411828994751, "epoch": 0.039310383557028136, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 6.841, "mean_token_accuracy": 0.11127241551876069, "num_tokens": 788912.0, "step": 350 }, { "entropy": 7.170050191879272, "epoch": 0.03987196046498568, "grad_norm": 1.2578125, "learning_rate": 0.000177, "loss": 6.9508, "mean_token_accuracy": 0.1135722354054451, "num_tokens": 801405.0, "step": 355 }, { "entropy": 7.058458709716797, "epoch": 0.040433537372943223, "grad_norm": 1.2890625, "learning_rate": 0.0001795, "loss": 6.7437, "mean_token_accuracy": 0.11591695919632912, "num_tokens": 813023.0, "step": 360 }, { "entropy": 7.132532978057862, "epoch": 0.04099511428090077, "grad_norm": 1.15625, "learning_rate": 0.000182, "loss": 6.7692, "mean_token_accuracy": 0.1168873094022274, "num_tokens": 823993.0, "step": 365 }, { "entropy": 7.123906469345092, "epoch": 0.04155669118885831, "grad_norm": 1.5078125, "learning_rate": 0.0001845, "loss": 6.8202, "mean_token_accuracy": 0.1134017400443554, "num_tokens": 836642.0, "step": 370 }, { "entropy": 7.020151281356812, "epoch": 0.04211826809681586, "grad_norm": 1.2421875, "learning_rate": 0.000187, "loss": 6.6249, "mean_token_accuracy": 0.12558069303631783, "num_tokens": 847475.0, "step": 375 }, { "entropy": 7.032984447479248, "epoch": 0.042679845004773405, "grad_norm": 1.15625, "learning_rate": 0.0001895, "loss": 6.6947, "mean_token_accuracy": 0.12115299850702285, "num_tokens": 857949.0, "step": 380 }, { "entropy": 7.027848196029663, "epoch": 0.04324142191273095, "grad_norm": 1.1796875, "learning_rate": 0.000192, "loss": 6.7528, "mean_token_accuracy": 0.11466690823435784, "num_tokens": 868661.0, "step": 385 }, { "entropy": 7.095096111297607, "epoch": 0.04380299882068849, "grad_norm": 1.1640625, "learning_rate": 0.0001945, "loss": 6.7906, "mean_token_accuracy": 0.11758541241288185, "num_tokens": 879651.0, "step": 390 }, { "entropy": 7.0685296058654785, "epoch": 0.044364575728646036, "grad_norm": 1.046875, "learning_rate": 0.00019700000000000002, "loss": 6.7722, "mean_token_accuracy": 0.10885974839329719, "num_tokens": 891189.0, "step": 395 }, { "entropy": 6.994202566146851, "epoch": 0.044926152636603586, "grad_norm": 1.125, "learning_rate": 0.00019950000000000002, "loss": 6.6748, "mean_token_accuracy": 0.119440957903862, "num_tokens": 902915.0, "step": 400 }, { "entropy": 7.045473241806031, "epoch": 0.04548772954456113, "grad_norm": 1.453125, "learning_rate": 0.000202, "loss": 6.7649, "mean_token_accuracy": 0.11777753084897995, "num_tokens": 914108.0, "step": 405 }, { "entropy": 7.049249458312988, "epoch": 0.046049306452518673, "grad_norm": 1.1484375, "learning_rate": 0.00020449999999999998, "loss": 6.7918, "mean_token_accuracy": 0.11295270174741745, "num_tokens": 925729.0, "step": 410 }, { "entropy": 7.0732354640960695, "epoch": 0.04661088336047622, "grad_norm": 1.3359375, "learning_rate": 0.000207, "loss": 6.7993, "mean_token_accuracy": 0.11720411777496338, "num_tokens": 936912.0, "step": 415 }, { "entropy": 6.98739104270935, "epoch": 0.04717246026843376, "grad_norm": 1.1796875, "learning_rate": 0.0002095, "loss": 6.7739, "mean_token_accuracy": 0.11668220460414887, "num_tokens": 948576.0, "step": 420 }, { "entropy": 6.989003896713257, "epoch": 0.047734037176391304, "grad_norm": 1.15625, "learning_rate": 0.000212, "loss": 6.6228, "mean_token_accuracy": 0.12309176921844482, "num_tokens": 959346.0, "step": 425 }, { "entropy": 6.867386531829834, "epoch": 0.048295614084348855, "grad_norm": 1.3125, "learning_rate": 0.0002145, "loss": 6.6393, "mean_token_accuracy": 0.12302001640200615, "num_tokens": 970124.0, "step": 430 }, { "entropy": 7.04110198020935, "epoch": 0.0488571909923064, "grad_norm": 1.3046875, "learning_rate": 0.00021700000000000002, "loss": 6.7167, "mean_token_accuracy": 0.12065900415182114, "num_tokens": 981628.0, "step": 435 }, { "entropy": 6.839612150192261, "epoch": 0.04941876790026394, "grad_norm": 1.1015625, "learning_rate": 0.0002195, "loss": 6.6603, "mean_token_accuracy": 0.12483339831233024, "num_tokens": 992423.0, "step": 440 }, { "entropy": 7.010668039321899, "epoch": 0.049980344808221486, "grad_norm": 1.1796875, "learning_rate": 0.000222, "loss": 6.6703, "mean_token_accuracy": 0.11580908223986626, "num_tokens": 1002954.0, "step": 445 }, { "entropy": 6.892636823654175, "epoch": 0.05054192171617903, "grad_norm": 1.15625, "learning_rate": 0.0002245, "loss": 6.5524, "mean_token_accuracy": 0.12802066281437874, "num_tokens": 1013351.0, "step": 450 }, { "entropy": 6.97490382194519, "epoch": 0.05110349862413657, "grad_norm": 1.1953125, "learning_rate": 0.00022700000000000002, "loss": 6.6699, "mean_token_accuracy": 0.11892755851149558, "num_tokens": 1023781.0, "step": 455 }, { "entropy": 7.029914331436157, "epoch": 0.051665075532094124, "grad_norm": 1.2109375, "learning_rate": 0.00022950000000000002, "loss": 6.7291, "mean_token_accuracy": 0.12224347591400146, "num_tokens": 1034565.0, "step": 460 }, { "entropy": 6.768797492980957, "epoch": 0.05222665244005167, "grad_norm": 1.4375, "learning_rate": 0.00023200000000000003, "loss": 6.5403, "mean_token_accuracy": 0.12486013248562813, "num_tokens": 1045595.0, "step": 465 }, { "entropy": 6.811560869216919, "epoch": 0.05278822934800921, "grad_norm": 1.25, "learning_rate": 0.00023449999999999998, "loss": 6.5365, "mean_token_accuracy": 0.12281112596392632, "num_tokens": 1056084.0, "step": 470 }, { "entropy": 6.891090345382691, "epoch": 0.053349806255966754, "grad_norm": 1.125, "learning_rate": 0.000237, "loss": 6.5832, "mean_token_accuracy": 0.12444683387875558, "num_tokens": 1067014.0, "step": 475 }, { "entropy": 6.7909644603729244, "epoch": 0.0539113831639243, "grad_norm": 1.2109375, "learning_rate": 0.0002395, "loss": 6.549, "mean_token_accuracy": 0.1283904306590557, "num_tokens": 1078557.0, "step": 480 }, { "entropy": 6.747442579269409, "epoch": 0.05447296007188184, "grad_norm": 1.1328125, "learning_rate": 0.000242, "loss": 6.6193, "mean_token_accuracy": 0.1250327579677105, "num_tokens": 1090541.0, "step": 485 }, { "entropy": 6.929131269454956, "epoch": 0.05503453697983939, "grad_norm": 1.2421875, "learning_rate": 0.0002445, "loss": 6.6901, "mean_token_accuracy": 0.12543862983584403, "num_tokens": 1101851.0, "step": 490 }, { "entropy": 6.778433561325073, "epoch": 0.055596113887796936, "grad_norm": 1.421875, "learning_rate": 0.000247, "loss": 6.5898, "mean_token_accuracy": 0.12135263979434967, "num_tokens": 1112728.0, "step": 495 }, { "entropy": 6.916776704788208, "epoch": 0.05615769079575448, "grad_norm": 1.359375, "learning_rate": 0.0002495, "loss": 6.7185, "mean_token_accuracy": 0.12112508118152618, "num_tokens": 1124537.0, "step": 500 }, { "entropy": 6.7057990550994875, "epoch": 0.05671926770371202, "grad_norm": 1.3125, "learning_rate": 0.000252, "loss": 6.6177, "mean_token_accuracy": 0.11861735060811043, "num_tokens": 1135749.0, "step": 505 }, { "entropy": 6.887033128738404, "epoch": 0.05728084461166957, "grad_norm": 1.1640625, "learning_rate": 0.0002545, "loss": 6.523, "mean_token_accuracy": 0.12177179381251335, "num_tokens": 1147597.0, "step": 510 }, { "entropy": 6.736017560958862, "epoch": 0.05784242151962711, "grad_norm": 1.125, "learning_rate": 0.000257, "loss": 6.483, "mean_token_accuracy": 0.13104297444224358, "num_tokens": 1158975.0, "step": 515 }, { "entropy": 6.74561619758606, "epoch": 0.05840399842758466, "grad_norm": 1.078125, "learning_rate": 0.0002595, "loss": 6.6127, "mean_token_accuracy": 0.12473157271742821, "num_tokens": 1170556.0, "step": 520 }, { "entropy": 6.734094333648682, "epoch": 0.058965575335542204, "grad_norm": 1.25, "learning_rate": 0.000262, "loss": 6.4825, "mean_token_accuracy": 0.12628087177872657, "num_tokens": 1180757.0, "step": 525 }, { "entropy": 6.786943149566651, "epoch": 0.05952715224349975, "grad_norm": 1.25, "learning_rate": 0.00026450000000000003, "loss": 6.5112, "mean_token_accuracy": 0.12826752737164498, "num_tokens": 1192428.0, "step": 530 }, { "entropy": 6.773551893234253, "epoch": 0.06008872915145729, "grad_norm": 1.171875, "learning_rate": 0.00026700000000000004, "loss": 6.5812, "mean_token_accuracy": 0.1194170169532299, "num_tokens": 1203867.0, "step": 535 }, { "entropy": 6.7591596126556395, "epoch": 0.060650306059414835, "grad_norm": 1.1875, "learning_rate": 0.00026950000000000005, "loss": 6.5734, "mean_token_accuracy": 0.1305850028991699, "num_tokens": 1214059.0, "step": 540 }, { "entropy": 6.792087364196777, "epoch": 0.06121188296737238, "grad_norm": 1.375, "learning_rate": 0.00027200000000000005, "loss": 6.6338, "mean_token_accuracy": 0.13109224960207938, "num_tokens": 1224750.0, "step": 545 }, { "entropy": 6.816738271713257, "epoch": 0.06177345987532993, "grad_norm": 1.2421875, "learning_rate": 0.0002745, "loss": 6.7109, "mean_token_accuracy": 0.11931365355849266, "num_tokens": 1235936.0, "step": 550 }, { "entropy": 6.697342395782471, "epoch": 0.06233503678328747, "grad_norm": 1.0625, "learning_rate": 0.000277, "loss": 6.5229, "mean_token_accuracy": 0.12435328289866447, "num_tokens": 1247619.0, "step": 555 }, { "entropy": 6.797955465316773, "epoch": 0.06289661369124501, "grad_norm": 1.1484375, "learning_rate": 0.0002795, "loss": 6.5973, "mean_token_accuracy": 0.12734515964984894, "num_tokens": 1258089.0, "step": 560 }, { "entropy": 6.7907819747924805, "epoch": 0.06345819059920256, "grad_norm": 0.984375, "learning_rate": 0.00028199999999999997, "loss": 6.6714, "mean_token_accuracy": 0.12250098884105683, "num_tokens": 1270727.0, "step": 565 }, { "entropy": 6.718038558959961, "epoch": 0.06401976750716011, "grad_norm": 1.171875, "learning_rate": 0.0002845, "loss": 6.5278, "mean_token_accuracy": 0.12575457990169525, "num_tokens": 1280886.0, "step": 570 }, { "entropy": 6.816065120697021, "epoch": 0.06458134441511765, "grad_norm": 1.2265625, "learning_rate": 0.000287, "loss": 6.5532, "mean_token_accuracy": 0.13024218007922173, "num_tokens": 1292205.0, "step": 575 }, { "entropy": 6.724169111251831, "epoch": 0.0651429213230752, "grad_norm": 1.0625, "learning_rate": 0.0002895, "loss": 6.5387, "mean_token_accuracy": 0.12204434722661972, "num_tokens": 1304621.0, "step": 580 }, { "entropy": 6.828542423248291, "epoch": 0.06570449823103273, "grad_norm": 1.2109375, "learning_rate": 0.000292, "loss": 6.6198, "mean_token_accuracy": 0.12465316653251649, "num_tokens": 1315481.0, "step": 585 }, { "entropy": 6.641292333602905, "epoch": 0.06626607513899029, "grad_norm": 1.0078125, "learning_rate": 0.0002945, "loss": 6.6021, "mean_token_accuracy": 0.12428974732756615, "num_tokens": 1328726.0, "step": 590 }, { "entropy": 6.790183639526367, "epoch": 0.06682765204694784, "grad_norm": 1.1171875, "learning_rate": 0.000297, "loss": 6.6603, "mean_token_accuracy": 0.12199008911848068, "num_tokens": 1340151.0, "step": 595 }, { "entropy": 6.6274354457855225, "epoch": 0.06738922895490537, "grad_norm": 1.1484375, "learning_rate": 0.0002995, "loss": 6.4411, "mean_token_accuracy": 0.12323693186044693, "num_tokens": 1350833.0, "step": 600 }, { "entropy": 6.738854312896729, "epoch": 0.06795080586286292, "grad_norm": 1.234375, "learning_rate": 0.000302, "loss": 6.6111, "mean_token_accuracy": 0.12676038667559625, "num_tokens": 1362332.0, "step": 605 }, { "entropy": 6.6895301818847654, "epoch": 0.06851238277082046, "grad_norm": 1.0625, "learning_rate": 0.0003045, "loss": 6.5002, "mean_token_accuracy": 0.13042355701327324, "num_tokens": 1373696.0, "step": 610 }, { "entropy": 6.526501417160034, "epoch": 0.06907395967877801, "grad_norm": 1.2109375, "learning_rate": 0.000307, "loss": 6.4218, "mean_token_accuracy": 0.1356612041592598, "num_tokens": 1383553.0, "step": 615 }, { "entropy": 6.660169887542724, "epoch": 0.06963553658673555, "grad_norm": 1.2578125, "learning_rate": 0.0003095, "loss": 6.5499, "mean_token_accuracy": 0.1267920345067978, "num_tokens": 1394487.0, "step": 620 }, { "entropy": 6.846566820144654, "epoch": 0.0701971134946931, "grad_norm": 1.015625, "learning_rate": 0.000312, "loss": 6.5606, "mean_token_accuracy": 0.13110520616173743, "num_tokens": 1404928.0, "step": 625 }, { "entropy": 6.503131103515625, "epoch": 0.07075869040265065, "grad_norm": 1.25, "learning_rate": 0.0003145, "loss": 6.4294, "mean_token_accuracy": 0.1311935856938362, "num_tokens": 1415854.0, "step": 630 }, { "entropy": 6.592182874679565, "epoch": 0.07132026731060818, "grad_norm": 1.171875, "learning_rate": 0.000317, "loss": 6.4816, "mean_token_accuracy": 0.1329976461827755, "num_tokens": 1427153.0, "step": 635 }, { "entropy": 6.661157464981079, "epoch": 0.07188184421856574, "grad_norm": 1.1875, "learning_rate": 0.0003195, "loss": 6.5885, "mean_token_accuracy": 0.12770819365978242, "num_tokens": 1438907.0, "step": 640 }, { "entropy": 6.7143834114074705, "epoch": 0.07244342112652327, "grad_norm": 1.046875, "learning_rate": 0.000322, "loss": 6.4669, "mean_token_accuracy": 0.12574334740638732, "num_tokens": 1449975.0, "step": 645 }, { "entropy": 6.589789390563965, "epoch": 0.07300499803448082, "grad_norm": 1.0390625, "learning_rate": 0.00032450000000000003, "loss": 6.4557, "mean_token_accuracy": 0.12991306632757188, "num_tokens": 1460815.0, "step": 650 }, { "entropy": 6.6092170715332035, "epoch": 0.07356657494243837, "grad_norm": 1.0625, "learning_rate": 0.00032700000000000003, "loss": 6.5044, "mean_token_accuracy": 0.1279452659189701, "num_tokens": 1472403.0, "step": 655 }, { "entropy": 6.639557504653931, "epoch": 0.07412815185039591, "grad_norm": 1.09375, "learning_rate": 0.00032950000000000004, "loss": 6.5141, "mean_token_accuracy": 0.12161320745944977, "num_tokens": 1484015.0, "step": 660 }, { "entropy": 6.653767776489258, "epoch": 0.07468972875835346, "grad_norm": 1.203125, "learning_rate": 0.00033200000000000005, "loss": 6.5425, "mean_token_accuracy": 0.12279097139835357, "num_tokens": 1495383.0, "step": 665 }, { "entropy": 6.608673715591431, "epoch": 0.075251305666311, "grad_norm": 1.0859375, "learning_rate": 0.00033450000000000005, "loss": 6.468, "mean_token_accuracy": 0.1286981873214245, "num_tokens": 1505893.0, "step": 670 }, { "entropy": 6.724495363235474, "epoch": 0.07581288257426855, "grad_norm": 1.15625, "learning_rate": 0.000337, "loss": 6.6061, "mean_token_accuracy": 0.12201442718505859, "num_tokens": 1518933.0, "step": 675 }, { "entropy": 6.7100588321685795, "epoch": 0.07637445948222608, "grad_norm": 1.0625, "learning_rate": 0.0003395, "loss": 6.6149, "mean_token_accuracy": 0.1266277812421322, "num_tokens": 1530603.0, "step": 680 }, { "entropy": 6.643559837341309, "epoch": 0.07693603639018363, "grad_norm": 1.1171875, "learning_rate": 0.000342, "loss": 6.4551, "mean_token_accuracy": 0.131996688246727, "num_tokens": 1540977.0, "step": 685 }, { "entropy": 6.6613860607147215, "epoch": 0.07749761329814119, "grad_norm": 1.0625, "learning_rate": 0.00034449999999999997, "loss": 6.5621, "mean_token_accuracy": 0.12197319865226745, "num_tokens": 1553004.0, "step": 690 }, { "entropy": 6.604646968841553, "epoch": 0.07805919020609872, "grad_norm": 1.140625, "learning_rate": 0.000347, "loss": 6.4726, "mean_token_accuracy": 0.12990233227610587, "num_tokens": 1563446.0, "step": 695 }, { "entropy": 6.59793119430542, "epoch": 0.07862076711405627, "grad_norm": 1.140625, "learning_rate": 0.0003495, "loss": 6.5153, "mean_token_accuracy": 0.1260698601603508, "num_tokens": 1573884.0, "step": 700 }, { "entropy": 6.554755544662475, "epoch": 0.07918234402201381, "grad_norm": 1.1328125, "learning_rate": 0.000352, "loss": 6.3739, "mean_token_accuracy": 0.13849396333098413, "num_tokens": 1585396.0, "step": 705 }, { "entropy": 6.4631202697753904, "epoch": 0.07974392092997136, "grad_norm": 1.1953125, "learning_rate": 0.0003545, "loss": 6.3757, "mean_token_accuracy": 0.1374616429209709, "num_tokens": 1596934.0, "step": 710 }, { "entropy": 6.508552122116089, "epoch": 0.08030549783792891, "grad_norm": 1.0625, "learning_rate": 0.000357, "loss": 6.4243, "mean_token_accuracy": 0.13476341739296913, "num_tokens": 1608069.0, "step": 715 }, { "entropy": 6.504626750946045, "epoch": 0.08086707474588645, "grad_norm": 1.234375, "learning_rate": 0.0003595, "loss": 6.345, "mean_token_accuracy": 0.1367340750992298, "num_tokens": 1619532.0, "step": 720 }, { "entropy": 6.577574253082275, "epoch": 0.081428651653844, "grad_norm": 1.15625, "learning_rate": 0.000362, "loss": 6.5057, "mean_token_accuracy": 0.12562305480241776, "num_tokens": 1630697.0, "step": 725 }, { "entropy": 6.569473791122436, "epoch": 0.08199022856180153, "grad_norm": 1.1640625, "learning_rate": 0.0003645, "loss": 6.483, "mean_token_accuracy": 0.12953646928071977, "num_tokens": 1641854.0, "step": 730 }, { "entropy": 6.676255798339843, "epoch": 0.08255180546975908, "grad_norm": 1.078125, "learning_rate": 0.000367, "loss": 6.6127, "mean_token_accuracy": 0.1251482017338276, "num_tokens": 1653036.0, "step": 735 }, { "entropy": 6.500600099563599, "epoch": 0.08311338237771662, "grad_norm": 1.1015625, "learning_rate": 0.0003695, "loss": 6.3686, "mean_token_accuracy": 0.12898936495184898, "num_tokens": 1664096.0, "step": 740 }, { "entropy": 6.575688219070434, "epoch": 0.08367495928567417, "grad_norm": 0.96875, "learning_rate": 0.000372, "loss": 6.5405, "mean_token_accuracy": 0.12776357308030128, "num_tokens": 1677890.0, "step": 745 }, { "entropy": 6.513050270080567, "epoch": 0.08423653619363172, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 6.4039, "mean_token_accuracy": 0.13092774003744126, "num_tokens": 1687627.0, "step": 750 }, { "entropy": 6.6496001243591305, "epoch": 0.08479811310158926, "grad_norm": 1.1015625, "learning_rate": 0.000377, "loss": 6.6299, "mean_token_accuracy": 0.12669486477971076, "num_tokens": 1700843.0, "step": 755 }, { "entropy": 6.54553918838501, "epoch": 0.08535969000954681, "grad_norm": 1.0703125, "learning_rate": 0.0003795, "loss": 6.4485, "mean_token_accuracy": 0.12898636609315872, "num_tokens": 1712356.0, "step": 760 }, { "entropy": 6.5033485889434814, "epoch": 0.08592126691750435, "grad_norm": 1.1484375, "learning_rate": 0.000382, "loss": 6.44, "mean_token_accuracy": 0.1329922027885914, "num_tokens": 1722041.0, "step": 765 }, { "entropy": 6.540292739868164, "epoch": 0.0864828438254619, "grad_norm": 1.1171875, "learning_rate": 0.0003845, "loss": 6.5334, "mean_token_accuracy": 0.12715438082814218, "num_tokens": 1733628.0, "step": 770 }, { "entropy": 6.52957124710083, "epoch": 0.08704442073341945, "grad_norm": 1.0546875, "learning_rate": 0.00038700000000000003, "loss": 6.3951, "mean_token_accuracy": 0.13516492396593094, "num_tokens": 1745174.0, "step": 775 }, { "entropy": 6.472682189941406, "epoch": 0.08760599764137698, "grad_norm": 1.0390625, "learning_rate": 0.00038950000000000003, "loss": 6.3261, "mean_token_accuracy": 0.13572794049978257, "num_tokens": 1757117.0, "step": 780 }, { "entropy": 6.4541521072387695, "epoch": 0.08816757454933453, "grad_norm": 1.0078125, "learning_rate": 0.00039200000000000004, "loss": 6.3477, "mean_token_accuracy": 0.13643818646669387, "num_tokens": 1767343.0, "step": 785 }, { "entropy": 6.52891354560852, "epoch": 0.08872915145729207, "grad_norm": 1.0859375, "learning_rate": 0.00039450000000000005, "loss": 6.4341, "mean_token_accuracy": 0.1295755423605442, "num_tokens": 1778500.0, "step": 790 }, { "entropy": 6.495887565612793, "epoch": 0.08929072836524962, "grad_norm": 1.1015625, "learning_rate": 0.00039700000000000005, "loss": 6.4257, "mean_token_accuracy": 0.13391977846622466, "num_tokens": 1788474.0, "step": 795 }, { "entropy": 6.669151258468628, "epoch": 0.08985230527320717, "grad_norm": 1.1171875, "learning_rate": 0.0003995, "loss": 6.6066, "mean_token_accuracy": 0.12243209406733513, "num_tokens": 1800756.0, "step": 800 }, { "entropy": 6.264161491394043, "epoch": 0.09041388218116471, "grad_norm": 1.0703125, "learning_rate": 0.000402, "loss": 6.3051, "mean_token_accuracy": 0.13255022764205932, "num_tokens": 1812172.0, "step": 805 }, { "entropy": 6.581796360015869, "epoch": 0.09097545908912226, "grad_norm": 1.1640625, "learning_rate": 0.0004045, "loss": 6.4369, "mean_token_accuracy": 0.13564810305833816, "num_tokens": 1822057.0, "step": 810 }, { "entropy": 6.388931703567505, "epoch": 0.0915370359970798, "grad_norm": 0.97265625, "learning_rate": 0.00040699999999999997, "loss": 6.3692, "mean_token_accuracy": 0.13979063034057618, "num_tokens": 1833074.0, "step": 815 }, { "entropy": 6.4439905166625975, "epoch": 0.09209861290503735, "grad_norm": 1.1015625, "learning_rate": 0.0004095, "loss": 6.3689, "mean_token_accuracy": 0.1369178406894207, "num_tokens": 1844932.0, "step": 820 }, { "entropy": 6.451093339920044, "epoch": 0.09266018981299488, "grad_norm": 1.09375, "learning_rate": 0.000412, "loss": 6.3812, "mean_token_accuracy": 0.13171854838728905, "num_tokens": 1855591.0, "step": 825 }, { "entropy": 6.412005949020386, "epoch": 0.09322176672095243, "grad_norm": 0.98828125, "learning_rate": 0.0004145, "loss": 6.3368, "mean_token_accuracy": 0.13641790226101874, "num_tokens": 1866726.0, "step": 830 }, { "entropy": 6.4959104537963865, "epoch": 0.09378334362890998, "grad_norm": 1.140625, "learning_rate": 0.000417, "loss": 6.3763, "mean_token_accuracy": 0.13648990392684937, "num_tokens": 1877385.0, "step": 835 }, { "entropy": 6.375614738464355, "epoch": 0.09434492053686752, "grad_norm": 1.125, "learning_rate": 0.0004195, "loss": 6.2828, "mean_token_accuracy": 0.1361901879310608, "num_tokens": 1887905.0, "step": 840 }, { "entropy": 6.32490758895874, "epoch": 0.09490649744482507, "grad_norm": 1.09375, "learning_rate": 0.000422, "loss": 6.3418, "mean_token_accuracy": 0.13226142525672913, "num_tokens": 1898649.0, "step": 845 }, { "entropy": 6.440097618103027, "epoch": 0.09546807435278261, "grad_norm": 1.25, "learning_rate": 0.0004245, "loss": 6.3581, "mean_token_accuracy": 0.12981755211949347, "num_tokens": 1908808.0, "step": 850 }, { "entropy": 6.449653148651123, "epoch": 0.09602965126074016, "grad_norm": 1.0859375, "learning_rate": 0.000427, "loss": 6.4636, "mean_token_accuracy": 0.13088747188448907, "num_tokens": 1920360.0, "step": 855 }, { "entropy": 6.425679159164429, "epoch": 0.09659122816869771, "grad_norm": 1.171875, "learning_rate": 0.0004295, "loss": 6.3601, "mean_token_accuracy": 0.13659372106194495, "num_tokens": 1931082.0, "step": 860 }, { "entropy": 6.450051259994507, "epoch": 0.09715280507665525, "grad_norm": 1.0859375, "learning_rate": 0.000432, "loss": 6.5104, "mean_token_accuracy": 0.13292263224720954, "num_tokens": 1942712.0, "step": 865 }, { "entropy": 6.353779935836792, "epoch": 0.0977143819846128, "grad_norm": 1.234375, "learning_rate": 0.0004345, "loss": 6.2649, "mean_token_accuracy": 0.13690216466784477, "num_tokens": 1953316.0, "step": 870 }, { "entropy": 6.438309907913208, "epoch": 0.09827595889257033, "grad_norm": 1.2265625, "learning_rate": 0.000437, "loss": 6.3389, "mean_token_accuracy": 0.13307465687394143, "num_tokens": 1963936.0, "step": 875 }, { "entropy": 6.4518403053283695, "epoch": 0.09883753580052788, "grad_norm": 1.1484375, "learning_rate": 0.0004395, "loss": 6.3619, "mean_token_accuracy": 0.1389799363911152, "num_tokens": 1974502.0, "step": 880 }, { "entropy": 6.3525231838226315, "epoch": 0.09939911270848542, "grad_norm": 0.90625, "learning_rate": 0.000442, "loss": 6.2961, "mean_token_accuracy": 0.14234573692083358, "num_tokens": 1985746.0, "step": 885 }, { "entropy": 6.370750093460083, "epoch": 0.09996068961644297, "grad_norm": 1.109375, "learning_rate": 0.0004445, "loss": 6.3998, "mean_token_accuracy": 0.1339979127049446, "num_tokens": 1997696.0, "step": 890 }, { "entropy": 6.476981210708618, "epoch": 0.10052226652440052, "grad_norm": 1.078125, "learning_rate": 0.000447, "loss": 6.3688, "mean_token_accuracy": 0.13148148730397224, "num_tokens": 2009462.0, "step": 895 }, { "entropy": 6.306058502197265, "epoch": 0.10108384343235806, "grad_norm": 1.1015625, "learning_rate": 0.00044950000000000003, "loss": 6.3004, "mean_token_accuracy": 0.13532110527157784, "num_tokens": 2019547.0, "step": 900 }, { "entropy": 6.276200008392334, "epoch": 0.10164542034031561, "grad_norm": 1.1015625, "learning_rate": 0.00045200000000000004, "loss": 6.3087, "mean_token_accuracy": 0.1303063564002514, "num_tokens": 2030990.0, "step": 905 }, { "entropy": 6.328003215789795, "epoch": 0.10220699724827315, "grad_norm": 0.8984375, "learning_rate": 0.00045450000000000004, "loss": 6.379, "mean_token_accuracy": 0.13275872617959977, "num_tokens": 2042488.0, "step": 910 }, { "entropy": 6.5090795993804935, "epoch": 0.1027685741562307, "grad_norm": 1.125, "learning_rate": 0.00045700000000000005, "loss": 6.4124, "mean_token_accuracy": 0.13137131109833716, "num_tokens": 2052822.0, "step": 915 }, { "entropy": 6.463271427154541, "epoch": 0.10333015106418825, "grad_norm": 1.015625, "learning_rate": 0.00045950000000000006, "loss": 6.3703, "mean_token_accuracy": 0.1341596059501171, "num_tokens": 2063274.0, "step": 920 }, { "entropy": 6.4825742721557615, "epoch": 0.10389172797214578, "grad_norm": 1.0703125, "learning_rate": 0.000462, "loss": 6.4069, "mean_token_accuracy": 0.13037585765123366, "num_tokens": 2074424.0, "step": 925 }, { "entropy": 6.314002275466919, "epoch": 0.10445330488010333, "grad_norm": 1.0546875, "learning_rate": 0.0004645, "loss": 6.4013, "mean_token_accuracy": 0.13306034207344056, "num_tokens": 2085776.0, "step": 930 }, { "entropy": 6.591546201705933, "epoch": 0.10501488178806087, "grad_norm": 0.96484375, "learning_rate": 0.000467, "loss": 6.4721, "mean_token_accuracy": 0.13484944850206376, "num_tokens": 2096789.0, "step": 935 }, { "entropy": 6.330018711090088, "epoch": 0.10557645869601842, "grad_norm": 1.0546875, "learning_rate": 0.0004695, "loss": 6.3848, "mean_token_accuracy": 0.13674520328640938, "num_tokens": 2108335.0, "step": 940 }, { "entropy": 6.46536111831665, "epoch": 0.10613803560397596, "grad_norm": 1.0859375, "learning_rate": 0.000472, "loss": 6.4749, "mean_token_accuracy": 0.13200692012906073, "num_tokens": 2121063.0, "step": 945 }, { "entropy": 6.343993902206421, "epoch": 0.10669961251193351, "grad_norm": 1.0625, "learning_rate": 0.0004745, "loss": 6.3351, "mean_token_accuracy": 0.1397795021533966, "num_tokens": 2132442.0, "step": 950 }, { "entropy": 6.362326002120971, "epoch": 0.10726118941989106, "grad_norm": 1.0625, "learning_rate": 0.000477, "loss": 6.2455, "mean_token_accuracy": 0.1406833589076996, "num_tokens": 2142155.0, "step": 955 }, { "entropy": 6.290420150756836, "epoch": 0.1078227663278486, "grad_norm": 1.1171875, "learning_rate": 0.0004795, "loss": 6.3118, "mean_token_accuracy": 0.13632866069674493, "num_tokens": 2152923.0, "step": 960 }, { "entropy": 6.347664928436279, "epoch": 0.10838434323580615, "grad_norm": 1.0390625, "learning_rate": 0.000482, "loss": 6.3058, "mean_token_accuracy": 0.13932796120643615, "num_tokens": 2164640.0, "step": 965 }, { "entropy": 6.229414701461792, "epoch": 0.10894592014376368, "grad_norm": 1.0703125, "learning_rate": 0.0004845, "loss": 6.2222, "mean_token_accuracy": 0.13819631040096284, "num_tokens": 2175403.0, "step": 970 }, { "entropy": 6.34880313873291, "epoch": 0.10950749705172123, "grad_norm": 1.0625, "learning_rate": 0.000487, "loss": 6.3313, "mean_token_accuracy": 0.1353020928800106, "num_tokens": 2186031.0, "step": 975 }, { "entropy": 6.380644750595093, "epoch": 0.11006907395967878, "grad_norm": 1.21875, "learning_rate": 0.0004895, "loss": 6.3329, "mean_token_accuracy": 0.13262429535388948, "num_tokens": 2198152.0, "step": 980 }, { "entropy": 6.278173971176147, "epoch": 0.11063065086763632, "grad_norm": 1.0859375, "learning_rate": 0.000492, "loss": 6.338, "mean_token_accuracy": 0.13674701675772666, "num_tokens": 2209435.0, "step": 985 }, { "entropy": 6.350253009796143, "epoch": 0.11119222777559387, "grad_norm": 1.1015625, "learning_rate": 0.0004945, "loss": 6.2994, "mean_token_accuracy": 0.14112076461315154, "num_tokens": 2219476.0, "step": 990 }, { "entropy": 6.3657073974609375, "epoch": 0.11175380468355141, "grad_norm": 1.0546875, "learning_rate": 0.000497, "loss": 6.3837, "mean_token_accuracy": 0.13610237762331961, "num_tokens": 2231131.0, "step": 995 }, { "entropy": 6.300810956954956, "epoch": 0.11231538159150896, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.2892, "mean_token_accuracy": 0.1371823087334633, "num_tokens": 2242309.0, "step": 1000 }, { "entropy": 6.2305169105529785, "epoch": 0.1128769584994665, "grad_norm": 1.0078125, "learning_rate": 0.000499999997707492, "loss": 6.1273, "mean_token_accuracy": 0.1387334682047367, "num_tokens": 2252236.0, "step": 1005 }, { "entropy": 6.3840419292449955, "epoch": 0.11343853540742405, "grad_norm": 1.1640625, "learning_rate": 0.0004999999883941787, "loss": 6.4504, "mean_token_accuracy": 0.1293959580361843, "num_tokens": 2263529.0, "step": 1010 }, { "entropy": 6.223633098602295, "epoch": 0.1140001123153816, "grad_norm": 1.0859375, "learning_rate": 0.0004999999719167785, "loss": 6.2809, "mean_token_accuracy": 0.13737061843276024, "num_tokens": 2275318.0, "step": 1015 }, { "entropy": 6.3728053092956545, "epoch": 0.11456168922333913, "grad_norm": 1.125, "learning_rate": 0.0004999999482752917, "loss": 6.3265, "mean_token_accuracy": 0.13787831887602806, "num_tokens": 2287434.0, "step": 1020 }, { "entropy": 6.254129695892334, "epoch": 0.11512326613129668, "grad_norm": 1.0859375, "learning_rate": 0.0004999999174697195, "loss": 6.2315, "mean_token_accuracy": 0.13839245587587357, "num_tokens": 2299145.0, "step": 1025 }, { "entropy": 6.261599349975586, "epoch": 0.11568484303925422, "grad_norm": 1.03125, "learning_rate": 0.0004999998795000627, "loss": 6.3257, "mean_token_accuracy": 0.13926222771406174, "num_tokens": 2309841.0, "step": 1030 }, { "entropy": 6.315525674819947, "epoch": 0.11624641994721177, "grad_norm": 0.9375, "learning_rate": 0.0004999998343663223, "loss": 6.3193, "mean_token_accuracy": 0.1403449870646, "num_tokens": 2322143.0, "step": 1035 }, { "entropy": 6.261302518844604, "epoch": 0.11680799685516932, "grad_norm": 1.0234375, "learning_rate": 0.0004999997820685, "loss": 6.2402, "mean_token_accuracy": 0.13240669071674346, "num_tokens": 2333207.0, "step": 1040 }, { "entropy": 6.1786919116973875, "epoch": 0.11736957376312686, "grad_norm": 0.9140625, "learning_rate": 0.0004999997226065974, "loss": 6.3105, "mean_token_accuracy": 0.13664863780140876, "num_tokens": 2345542.0, "step": 1045 }, { "entropy": 6.371749353408814, "epoch": 0.11793115067108441, "grad_norm": 1.03125, "learning_rate": 0.0004999996559806163, "loss": 6.3079, "mean_token_accuracy": 0.14061758145689965, "num_tokens": 2356612.0, "step": 1050 }, { "entropy": 6.225208377838134, "epoch": 0.11849272757904195, "grad_norm": 0.99609375, "learning_rate": 0.0004999995821905589, "loss": 6.2306, "mean_token_accuracy": 0.13814162313938141, "num_tokens": 2368204.0, "step": 1055 }, { "entropy": 6.262781095504761, "epoch": 0.1190543044869995, "grad_norm": 1.1640625, "learning_rate": 0.0004999995012364276, "loss": 6.264, "mean_token_accuracy": 0.14789239913225175, "num_tokens": 2379114.0, "step": 1060 }, { "entropy": 6.258517122268676, "epoch": 0.11961588139495703, "grad_norm": 0.91015625, "learning_rate": 0.0004999994131182248, "loss": 6.3024, "mean_token_accuracy": 0.1361288011074066, "num_tokens": 2390562.0, "step": 1065 }, { "entropy": 6.30267333984375, "epoch": 0.12017745830291458, "grad_norm": 1.046875, "learning_rate": 0.0004999993178359535, "loss": 6.3561, "mean_token_accuracy": 0.13576339259743692, "num_tokens": 2402352.0, "step": 1070 }, { "entropy": 6.422991371154785, "epoch": 0.12073903521087213, "grad_norm": 1.046875, "learning_rate": 0.0004999992153896166, "loss": 6.3906, "mean_token_accuracy": 0.1379263438284397, "num_tokens": 2415140.0, "step": 1075 }, { "entropy": 6.226438283920288, "epoch": 0.12130061211882967, "grad_norm": 1.0703125, "learning_rate": 0.0004999991057792175, "loss": 6.2828, "mean_token_accuracy": 0.13986248895525932, "num_tokens": 2426679.0, "step": 1080 }, { "entropy": 6.307008361816406, "epoch": 0.12186218902678722, "grad_norm": 1.0625, "learning_rate": 0.0004999989890047596, "loss": 6.3213, "mean_token_accuracy": 0.14080586433410644, "num_tokens": 2437735.0, "step": 1085 }, { "entropy": 6.244773292541504, "epoch": 0.12242376593474476, "grad_norm": 1.0703125, "learning_rate": 0.0004999988650662467, "loss": 6.2433, "mean_token_accuracy": 0.13999149277806283, "num_tokens": 2448611.0, "step": 1090 }, { "entropy": 6.176812791824341, "epoch": 0.12298534284270231, "grad_norm": 0.96875, "learning_rate": 0.0004999987339636825, "loss": 6.1729, "mean_token_accuracy": 0.14464567825198174, "num_tokens": 2461101.0, "step": 1095 }, { "entropy": 6.265973329544067, "epoch": 0.12354691975065986, "grad_norm": 1.046875, "learning_rate": 0.0004999985956970713, "loss": 6.3176, "mean_token_accuracy": 0.13885853216052055, "num_tokens": 2473569.0, "step": 1100 }, { "entropy": 6.171710395812989, "epoch": 0.1241084966586174, "grad_norm": 1.1328125, "learning_rate": 0.0004999984502664178, "loss": 6.2382, "mean_token_accuracy": 0.13876865357160567, "num_tokens": 2483970.0, "step": 1105 }, { "entropy": 6.363559436798096, "epoch": 0.12467007356657495, "grad_norm": 0.9296875, "learning_rate": 0.0004999982976717261, "loss": 6.2895, "mean_token_accuracy": 0.14146780967712402, "num_tokens": 2494184.0, "step": 1110 }, { "entropy": 6.217218828201294, "epoch": 0.1252316504745325, "grad_norm": 0.93359375, "learning_rate": 0.0004999981379130016, "loss": 6.3041, "mean_token_accuracy": 0.14307402372360228, "num_tokens": 2505715.0, "step": 1115 }, { "entropy": 6.386610078811645, "epoch": 0.12579322738249002, "grad_norm": 1.0546875, "learning_rate": 0.000499997970990249, "loss": 6.3412, "mean_token_accuracy": 0.14221135526895523, "num_tokens": 2517168.0, "step": 1120 }, { "entropy": 6.303906965255737, "epoch": 0.12635480429044757, "grad_norm": 0.9375, "learning_rate": 0.0004999977969034737, "loss": 6.3674, "mean_token_accuracy": 0.1398570343852043, "num_tokens": 2528296.0, "step": 1125 }, { "entropy": 6.249405193328857, "epoch": 0.12691638119840512, "grad_norm": 1.1171875, "learning_rate": 0.0004999976156526814, "loss": 6.3056, "mean_token_accuracy": 0.14569928944110871, "num_tokens": 2540648.0, "step": 1130 }, { "entropy": 6.177938985824585, "epoch": 0.12747795810636267, "grad_norm": 1.078125, "learning_rate": 0.0004999974272378776, "loss": 6.1885, "mean_token_accuracy": 0.14313262403011323, "num_tokens": 2551840.0, "step": 1135 }, { "entropy": 6.324184131622315, "epoch": 0.12803953501432022, "grad_norm": 1.0703125, "learning_rate": 0.0004999972316590685, "loss": 6.2524, "mean_token_accuracy": 0.1379991091787815, "num_tokens": 2561362.0, "step": 1140 }, { "entropy": 6.31357970237732, "epoch": 0.12860111192227774, "grad_norm": 0.9765625, "learning_rate": 0.0004999970289162604, "loss": 6.298, "mean_token_accuracy": 0.14433052241802216, "num_tokens": 2573584.0, "step": 1145 }, { "entropy": 6.446721315383911, "epoch": 0.1291626888302353, "grad_norm": 1.109375, "learning_rate": 0.0004999968190094595, "loss": 6.4204, "mean_token_accuracy": 0.1336354859173298, "num_tokens": 2585255.0, "step": 1150 }, { "entropy": 6.054596328735352, "epoch": 0.12972426573819285, "grad_norm": 1.0078125, "learning_rate": 0.0004999966019386727, "loss": 6.226, "mean_token_accuracy": 0.14078792110085486, "num_tokens": 2596849.0, "step": 1155 }, { "entropy": 6.258234024047852, "epoch": 0.1302858426461504, "grad_norm": 1.0546875, "learning_rate": 0.0004999963777039067, "loss": 6.2622, "mean_token_accuracy": 0.13961924761533737, "num_tokens": 2606918.0, "step": 1160 }, { "entropy": 6.1849829196929935, "epoch": 0.13084741955410795, "grad_norm": 0.984375, "learning_rate": 0.000499996146305169, "loss": 6.1952, "mean_token_accuracy": 0.14556236416101456, "num_tokens": 2617779.0, "step": 1165 }, { "entropy": 6.273143911361695, "epoch": 0.13140899646206547, "grad_norm": 0.9921875, "learning_rate": 0.0004999959077424665, "loss": 6.2513, "mean_token_accuracy": 0.13997638300061227, "num_tokens": 2630294.0, "step": 1170 }, { "entropy": 6.12783145904541, "epoch": 0.13197057337002302, "grad_norm": 0.9609375, "learning_rate": 0.0004999956620158072, "loss": 6.1548, "mean_token_accuracy": 0.14402848556637765, "num_tokens": 2641002.0, "step": 1175 }, { "entropy": 6.1911145687103275, "epoch": 0.13253215027798057, "grad_norm": 0.9375, "learning_rate": 0.0004999954091251987, "loss": 6.1448, "mean_token_accuracy": 0.14548660516738893, "num_tokens": 2652188.0, "step": 1180 }, { "entropy": 6.125283575057983, "epoch": 0.13309372718593812, "grad_norm": 1.1484375, "learning_rate": 0.0004999951490706491, "loss": 6.1865, "mean_token_accuracy": 0.14291539043188095, "num_tokens": 2662542.0, "step": 1185 }, { "entropy": 6.296076965332031, "epoch": 0.13365530409389567, "grad_norm": 0.92578125, "learning_rate": 0.0004999948818521667, "loss": 6.2038, "mean_token_accuracy": 0.1425152152776718, "num_tokens": 2673292.0, "step": 1190 }, { "entropy": 6.177773904800415, "epoch": 0.1342168810018532, "grad_norm": 0.99609375, "learning_rate": 0.00049999460746976, "loss": 6.2022, "mean_token_accuracy": 0.1450867235660553, "num_tokens": 2684042.0, "step": 1195 }, { "entropy": 6.199269771575928, "epoch": 0.13477845790981074, "grad_norm": 1.0625, "learning_rate": 0.0004999943259234377, "loss": 6.1304, "mean_token_accuracy": 0.1481417030096054, "num_tokens": 2694716.0, "step": 1200 }, { "entropy": 6.261506462097168, "epoch": 0.1353400348177683, "grad_norm": 0.98046875, "learning_rate": 0.0004999940372132089, "loss": 6.2723, "mean_token_accuracy": 0.1427570842206478, "num_tokens": 2706200.0, "step": 1205 }, { "entropy": 6.097541093826294, "epoch": 0.13590161172572585, "grad_norm": 0.9375, "learning_rate": 0.0004999937413390826, "loss": 6.0978, "mean_token_accuracy": 0.14956343919038773, "num_tokens": 2716814.0, "step": 1210 }, { "entropy": 6.26879563331604, "epoch": 0.1364631886336834, "grad_norm": 1.0546875, "learning_rate": 0.0004999934383010683, "loss": 6.2646, "mean_token_accuracy": 0.13633433505892753, "num_tokens": 2728042.0, "step": 1215 }, { "entropy": 6.117309093475342, "epoch": 0.13702476554164092, "grad_norm": 1.1171875, "learning_rate": 0.0004999931280991757, "loss": 6.2276, "mean_token_accuracy": 0.13767654895782472, "num_tokens": 2739093.0, "step": 1220 }, { "entropy": 6.323478746414184, "epoch": 0.13758634244959847, "grad_norm": 0.984375, "learning_rate": 0.0004999928107334146, "loss": 6.2653, "mean_token_accuracy": 0.14359876736998559, "num_tokens": 2750307.0, "step": 1225 }, { "entropy": 6.146844863891602, "epoch": 0.13814791935755602, "grad_norm": 1.0234375, "learning_rate": 0.0004999924862037952, "loss": 6.1785, "mean_token_accuracy": 0.142026449739933, "num_tokens": 2760534.0, "step": 1230 }, { "entropy": 6.146856021881104, "epoch": 0.13870949626551357, "grad_norm": 0.9296875, "learning_rate": 0.0004999921545103278, "loss": 6.2017, "mean_token_accuracy": 0.1402510516345501, "num_tokens": 2772459.0, "step": 1235 }, { "entropy": 6.118765497207642, "epoch": 0.1392710731734711, "grad_norm": 0.97265625, "learning_rate": 0.0004999918156530229, "loss": 6.1162, "mean_token_accuracy": 0.15379080772399903, "num_tokens": 2784038.0, "step": 1240 }, { "entropy": 6.237395238876343, "epoch": 0.13983265008142864, "grad_norm": 0.88671875, "learning_rate": 0.0004999914696318913, "loss": 6.24, "mean_token_accuracy": 0.14800693467259407, "num_tokens": 2795756.0, "step": 1245 }, { "entropy": 6.129542446136474, "epoch": 0.1403942269893862, "grad_norm": 1.0078125, "learning_rate": 0.0004999911164469441, "loss": 6.1721, "mean_token_accuracy": 0.14674090445041657, "num_tokens": 2806242.0, "step": 1250 }, { "entropy": 6.290287971496582, "epoch": 0.14095580389734375, "grad_norm": 0.9609375, "learning_rate": 0.0004999907560981925, "loss": 6.2556, "mean_token_accuracy": 0.14589913040399552, "num_tokens": 2817017.0, "step": 1255 }, { "entropy": 6.189040660858154, "epoch": 0.1415173808053013, "grad_norm": 0.93359375, "learning_rate": 0.0004999903885856479, "loss": 6.1629, "mean_token_accuracy": 0.15110919922590255, "num_tokens": 2827415.0, "step": 1260 }, { "entropy": 6.141000080108642, "epoch": 0.14207895771325882, "grad_norm": 1.0859375, "learning_rate": 0.000499990013909322, "loss": 6.1726, "mean_token_accuracy": 0.14932918325066566, "num_tokens": 2837595.0, "step": 1265 }, { "entropy": 6.088430595397949, "epoch": 0.14264053462121637, "grad_norm": 1.03125, "learning_rate": 0.000499989632069227, "loss": 6.1339, "mean_token_accuracy": 0.14398894980549812, "num_tokens": 2847906.0, "step": 1270 }, { "entropy": 6.23743634223938, "epoch": 0.14320211152917392, "grad_norm": 1.03125, "learning_rate": 0.0004999892430653747, "loss": 6.2346, "mean_token_accuracy": 0.13501434922218322, "num_tokens": 2859145.0, "step": 1275 }, { "entropy": 6.056405162811279, "epoch": 0.14376368843713147, "grad_norm": 0.90234375, "learning_rate": 0.0004999888468977776, "loss": 6.1648, "mean_token_accuracy": 0.14927329123020172, "num_tokens": 2870704.0, "step": 1280 }, { "entropy": 6.249700832366943, "epoch": 0.14432526534508902, "grad_norm": 0.90625, "learning_rate": 0.0004999884435664485, "loss": 6.2647, "mean_token_accuracy": 0.14412776455283166, "num_tokens": 2881861.0, "step": 1285 }, { "entropy": 6.240557241439819, "epoch": 0.14488684225304654, "grad_norm": 1.53125, "learning_rate": 0.0004999880330714, "loss": 6.1861, "mean_token_accuracy": 0.14692625999450684, "num_tokens": 2893247.0, "step": 1290 }, { "entropy": 6.075284337997436, "epoch": 0.1454484191610041, "grad_norm": 0.9375, "learning_rate": 0.0004999876154126453, "loss": 6.0185, "mean_token_accuracy": 0.1487583711743355, "num_tokens": 2905351.0, "step": 1295 }, { "entropy": 6.0624950408935545, "epoch": 0.14600999606896164, "grad_norm": 1.125, "learning_rate": 0.0004999871905901977, "loss": 6.1821, "mean_token_accuracy": 0.14871341213583947, "num_tokens": 2915153.0, "step": 1300 }, { "entropy": 6.169287776947021, "epoch": 0.1465715729769192, "grad_norm": 1.0078125, "learning_rate": 0.0004999867586040706, "loss": 6.1416, "mean_token_accuracy": 0.13760501518845558, "num_tokens": 2926234.0, "step": 1305 }, { "entropy": 6.069522142410278, "epoch": 0.14713314988487675, "grad_norm": 0.88671875, "learning_rate": 0.0004999863194542779, "loss": 6.0943, "mean_token_accuracy": 0.14693765938282013, "num_tokens": 2937033.0, "step": 1310 }, { "entropy": 6.068335819244385, "epoch": 0.14769472679283427, "grad_norm": 0.984375, "learning_rate": 0.0004999858731408336, "loss": 6.0518, "mean_token_accuracy": 0.14859263896942138, "num_tokens": 2945904.0, "step": 1315 }, { "entropy": 6.208248567581177, "epoch": 0.14825630370079182, "grad_norm": 1.1015625, "learning_rate": 0.0004999854196637518, "loss": 6.253, "mean_token_accuracy": 0.14146910086274148, "num_tokens": 2956298.0, "step": 1320 }, { "entropy": 6.151482725143433, "epoch": 0.14881788060874937, "grad_norm": 0.98828125, "learning_rate": 0.0004999849590230469, "loss": 6.1522, "mean_token_accuracy": 0.14781234338879584, "num_tokens": 2967660.0, "step": 1325 }, { "entropy": 6.198898839950561, "epoch": 0.14937945751670692, "grad_norm": 1.0390625, "learning_rate": 0.0004999844912187336, "loss": 6.2205, "mean_token_accuracy": 0.1416272446513176, "num_tokens": 2978616.0, "step": 1330 }, { "entropy": 6.0869788646698, "epoch": 0.14994103442466447, "grad_norm": 1.0234375, "learning_rate": 0.000499984016250827, "loss": 6.0738, "mean_token_accuracy": 0.15207655876874923, "num_tokens": 2989731.0, "step": 1335 }, { "entropy": 6.171562576293946, "epoch": 0.150502611332622, "grad_norm": 0.9453125, "learning_rate": 0.000499983534119342, "loss": 6.177, "mean_token_accuracy": 0.14310620874166488, "num_tokens": 3002110.0, "step": 1340 }, { "entropy": 5.928503322601318, "epoch": 0.15106418824057954, "grad_norm": 0.984375, "learning_rate": 0.0004999830448242941, "loss": 6.0135, "mean_token_accuracy": 0.15312863737344742, "num_tokens": 3012709.0, "step": 1345 }, { "entropy": 6.257901430130005, "epoch": 0.1516257651485371, "grad_norm": 0.93359375, "learning_rate": 0.0004999825483656986, "loss": 6.3139, "mean_token_accuracy": 0.13134505301713945, "num_tokens": 3025738.0, "step": 1350 }, { "entropy": 6.151828098297119, "epoch": 0.15218734205649465, "grad_norm": 0.953125, "learning_rate": 0.0004999820447435716, "loss": 6.1416, "mean_token_accuracy": 0.14338411912322044, "num_tokens": 3037711.0, "step": 1355 }, { "entropy": 6.239610385894776, "epoch": 0.15274891896445217, "grad_norm": 1.15625, "learning_rate": 0.0004999815339579291, "loss": 6.3286, "mean_token_accuracy": 0.13714671283960342, "num_tokens": 3048929.0, "step": 1360 }, { "entropy": 6.117274618148803, "epoch": 0.15331049587240972, "grad_norm": 1.171875, "learning_rate": 0.0004999810160087872, "loss": 6.0739, "mean_token_accuracy": 0.15920419096946717, "num_tokens": 3059717.0, "step": 1365 }, { "entropy": 6.133962488174438, "epoch": 0.15387207278036727, "grad_norm": 1.0703125, "learning_rate": 0.0004999804908961626, "loss": 6.0778, "mean_token_accuracy": 0.15217963755130767, "num_tokens": 3069530.0, "step": 1370 }, { "entropy": 6.133673429489136, "epoch": 0.15443364968832482, "grad_norm": 0.96875, "learning_rate": 0.0004999799586200719, "loss": 6.2715, "mean_token_accuracy": 0.14009033963084222, "num_tokens": 3080705.0, "step": 1375 }, { "entropy": 6.1995704650878904, "epoch": 0.15499522659628237, "grad_norm": 1.0, "learning_rate": 0.000499979419180532, "loss": 6.1198, "mean_token_accuracy": 0.1425781100988388, "num_tokens": 3092553.0, "step": 1380 }, { "entropy": 6.193589210510254, "epoch": 0.1555568035042399, "grad_norm": 1.15625, "learning_rate": 0.0004999788725775601, "loss": 6.2416, "mean_token_accuracy": 0.1423923633992672, "num_tokens": 3102947.0, "step": 1385 }, { "entropy": 6.08302493095398, "epoch": 0.15611838041219744, "grad_norm": 0.99609375, "learning_rate": 0.0004999783188111737, "loss": 6.0833, "mean_token_accuracy": 0.15142102390527726, "num_tokens": 3114157.0, "step": 1390 }, { "entropy": 6.019034147262573, "epoch": 0.156679957320155, "grad_norm": 1.015625, "learning_rate": 0.0004999777578813904, "loss": 5.9512, "mean_token_accuracy": 0.14669259935617446, "num_tokens": 3125739.0, "step": 1395 }, { "entropy": 6.063040637969971, "epoch": 0.15724153422811254, "grad_norm": 0.953125, "learning_rate": 0.000499977189788228, "loss": 6.1128, "mean_token_accuracy": 0.15026577562093735, "num_tokens": 3136970.0, "step": 1400 }, { "entropy": 6.108362627029419, "epoch": 0.1578031111360701, "grad_norm": 0.8828125, "learning_rate": 0.0004999766145317046, "loss": 6.0792, "mean_token_accuracy": 0.14896431863307952, "num_tokens": 3148512.0, "step": 1405 }, { "entropy": 6.111115980148315, "epoch": 0.15836468804402762, "grad_norm": 0.92578125, "learning_rate": 0.0004999760321118385, "loss": 6.1135, "mean_token_accuracy": 0.15590201914310456, "num_tokens": 3159477.0, "step": 1410 }, { "entropy": 6.05187873840332, "epoch": 0.15892626495198517, "grad_norm": 0.9921875, "learning_rate": 0.0004999754425286483, "loss": 6.128, "mean_token_accuracy": 0.15035361796617508, "num_tokens": 3171361.0, "step": 1415 }, { "entropy": 6.220038843154907, "epoch": 0.15948784185994272, "grad_norm": 0.92578125, "learning_rate": 0.0004999748457821529, "loss": 6.2881, "mean_token_accuracy": 0.13868645653128625, "num_tokens": 3184652.0, "step": 1420 }, { "entropy": 6.1836763381958, "epoch": 0.16004941876790027, "grad_norm": 0.98046875, "learning_rate": 0.000499974241872371, "loss": 6.1675, "mean_token_accuracy": 0.14523480385541915, "num_tokens": 3195557.0, "step": 1425 }, { "entropy": 6.168182754516602, "epoch": 0.16061099567585782, "grad_norm": 1.0546875, "learning_rate": 0.0004999736307993221, "loss": 6.1987, "mean_token_accuracy": 0.1331624984741211, "num_tokens": 3207139.0, "step": 1430 }, { "entropy": 6.287556171417236, "epoch": 0.16117257258381534, "grad_norm": 0.93359375, "learning_rate": 0.0004999730125630255, "loss": 6.2968, "mean_token_accuracy": 0.13671731874346732, "num_tokens": 3218967.0, "step": 1435 }, { "entropy": 6.173974084854126, "epoch": 0.1617341494917729, "grad_norm": 0.9765625, "learning_rate": 0.0004999723871635008, "loss": 6.1019, "mean_token_accuracy": 0.1492471754550934, "num_tokens": 3230168.0, "step": 1440 }, { "entropy": 6.022477769851685, "epoch": 0.16229572639973044, "grad_norm": 1.0390625, "learning_rate": 0.0004999717546007681, "loss": 6.1451, "mean_token_accuracy": 0.1437738373875618, "num_tokens": 3241829.0, "step": 1445 }, { "entropy": 6.239676189422608, "epoch": 0.162857303307688, "grad_norm": 1.0, "learning_rate": 0.0004999711148748476, "loss": 6.1597, "mean_token_accuracy": 0.14430854842066765, "num_tokens": 3253195.0, "step": 1450 }, { "entropy": 6.084852933883667, "epoch": 0.16341888021564555, "grad_norm": 0.9609375, "learning_rate": 0.0004999704679857594, "loss": 6.2113, "mean_token_accuracy": 0.14120337069034578, "num_tokens": 3264951.0, "step": 1455 }, { "entropy": 6.022989225387573, "epoch": 0.16398045712360307, "grad_norm": 0.953125, "learning_rate": 0.0004999698139335243, "loss": 6.0438, "mean_token_accuracy": 0.14825797379016875, "num_tokens": 3276054.0, "step": 1460 }, { "entropy": 6.0944970607757565, "epoch": 0.16454203403156062, "grad_norm": 1.0546875, "learning_rate": 0.0004999691527181632, "loss": 6.0089, "mean_token_accuracy": 0.1612110674381256, "num_tokens": 3285540.0, "step": 1465 }, { "entropy": 6.161299562454223, "epoch": 0.16510361093951817, "grad_norm": 0.9765625, "learning_rate": 0.0004999684843396968, "loss": 6.1427, "mean_token_accuracy": 0.14661948680877684, "num_tokens": 3296869.0, "step": 1470 }, { "entropy": 6.089122295379639, "epoch": 0.16566518784747572, "grad_norm": 0.98828125, "learning_rate": 0.0004999678087981467, "loss": 6.0813, "mean_token_accuracy": 0.1550757810473442, "num_tokens": 3307554.0, "step": 1475 }, { "entropy": 5.974129676818848, "epoch": 0.16622676475543324, "grad_norm": 0.95703125, "learning_rate": 0.0004999671260935343, "loss": 6.0369, "mean_token_accuracy": 0.14905909150838853, "num_tokens": 3319685.0, "step": 1480 }, { "entropy": 6.121063327789306, "epoch": 0.1667883416633908, "grad_norm": 0.98828125, "learning_rate": 0.0004999664362258814, "loss": 6.1516, "mean_token_accuracy": 0.14900618344545363, "num_tokens": 3330742.0, "step": 1485 }, { "entropy": 6.037702798843384, "epoch": 0.16734991857134834, "grad_norm": 0.8828125, "learning_rate": 0.0004999657391952099, "loss": 6.1774, "mean_token_accuracy": 0.14220552295446395, "num_tokens": 3343613.0, "step": 1490 }, { "entropy": 6.289458322525024, "epoch": 0.1679114954793059, "grad_norm": 0.875, "learning_rate": 0.000499965035001542, "loss": 6.2146, "mean_token_accuracy": 0.1457619272172451, "num_tokens": 3355162.0, "step": 1495 }, { "entropy": 6.107675218582154, "epoch": 0.16847307238726345, "grad_norm": 0.90625, "learning_rate": 0.0004999643236449001, "loss": 6.1513, "mean_token_accuracy": 0.15243639126420022, "num_tokens": 3366324.0, "step": 1500 }, { "entropy": 6.264118766784668, "epoch": 0.16903464929522097, "grad_norm": 0.9921875, "learning_rate": 0.0004999636051253069, "loss": 6.292, "mean_token_accuracy": 0.13710838407278061, "num_tokens": 3378571.0, "step": 1505 }, { "entropy": 6.134381484985352, "epoch": 0.16959622620317852, "grad_norm": 1.078125, "learning_rate": 0.0004999628794427854, "loss": 6.1696, "mean_token_accuracy": 0.13963365852832793, "num_tokens": 3390605.0, "step": 1510 }, { "entropy": 6.0607460021972654, "epoch": 0.17015780311113607, "grad_norm": 0.9609375, "learning_rate": 0.0004999621465973583, "loss": 6.0866, "mean_token_accuracy": 0.14871912077069283, "num_tokens": 3402735.0, "step": 1515 }, { "entropy": 6.100008773803711, "epoch": 0.17071938001909362, "grad_norm": 1.03125, "learning_rate": 0.0004999614065890495, "loss": 6.0991, "mean_token_accuracy": 0.15326170325279237, "num_tokens": 3413079.0, "step": 1520 }, { "entropy": 6.077723407745362, "epoch": 0.17128095692705117, "grad_norm": 1.0, "learning_rate": 0.0004999606594178821, "loss": 6.0422, "mean_token_accuracy": 0.14912576824426652, "num_tokens": 3423098.0, "step": 1525 }, { "entropy": 6.100780582427978, "epoch": 0.1718425338350087, "grad_norm": 0.90234375, "learning_rate": 0.00049995990508388, "loss": 6.0769, "mean_token_accuracy": 0.14803334027528764, "num_tokens": 3435794.0, "step": 1530 }, { "entropy": 6.115665483474731, "epoch": 0.17240411074296624, "grad_norm": 0.95703125, "learning_rate": 0.0004999591435870674, "loss": 6.2069, "mean_token_accuracy": 0.13976619020104408, "num_tokens": 3448125.0, "step": 1535 }, { "entropy": 6.065301561355591, "epoch": 0.1729656876509238, "grad_norm": 1.0234375, "learning_rate": 0.0004999583749274684, "loss": 6.0397, "mean_token_accuracy": 0.14901299476623536, "num_tokens": 3458217.0, "step": 1540 }, { "entropy": 6.002480125427246, "epoch": 0.17352726455888134, "grad_norm": 0.94921875, "learning_rate": 0.0004999575991051074, "loss": 6.0901, "mean_token_accuracy": 0.1483938679099083, "num_tokens": 3469553.0, "step": 1545 }, { "entropy": 6.146899223327637, "epoch": 0.1740888414668389, "grad_norm": 0.9375, "learning_rate": 0.0004999568161200093, "loss": 6.0427, "mean_token_accuracy": 0.15437329113483428, "num_tokens": 3480928.0, "step": 1550 }, { "entropy": 6.065676021575928, "epoch": 0.17465041837479642, "grad_norm": 1.03125, "learning_rate": 0.0004999560259721989, "loss": 6.1347, "mean_token_accuracy": 0.1498277299106121, "num_tokens": 3492074.0, "step": 1555 }, { "entropy": 6.13408784866333, "epoch": 0.17521199528275397, "grad_norm": 0.984375, "learning_rate": 0.0004999552286617014, "loss": 6.1425, "mean_token_accuracy": 0.14677510857582093, "num_tokens": 3503320.0, "step": 1560 }, { "entropy": 6.015400695800781, "epoch": 0.17577357219071152, "grad_norm": 1.375, "learning_rate": 0.0004999544241885421, "loss": 6.136, "mean_token_accuracy": 0.15524707436561586, "num_tokens": 3515466.0, "step": 1565 }, { "entropy": 6.1630960464477536, "epoch": 0.17633514909866907, "grad_norm": 0.9921875, "learning_rate": 0.0004999536125527467, "loss": 6.0079, "mean_token_accuracy": 0.15108589679002762, "num_tokens": 3525584.0, "step": 1570 }, { "entropy": 5.98162202835083, "epoch": 0.17689672600662662, "grad_norm": 0.9375, "learning_rate": 0.000499952793754341, "loss": 6.0963, "mean_token_accuracy": 0.1469439223408699, "num_tokens": 3536973.0, "step": 1575 }, { "entropy": 6.10207724571228, "epoch": 0.17745830291458414, "grad_norm": 0.9609375, "learning_rate": 0.0004999519677933512, "loss": 6.1286, "mean_token_accuracy": 0.14693209826946257, "num_tokens": 3547799.0, "step": 1580 }, { "entropy": 6.159058141708374, "epoch": 0.1780198798225417, "grad_norm": 0.95703125, "learning_rate": 0.0004999511346698035, "loss": 6.1786, "mean_token_accuracy": 0.15070472061634063, "num_tokens": 3558436.0, "step": 1585 }, { "entropy": 6.149427270889282, "epoch": 0.17858145673049924, "grad_norm": 1.078125, "learning_rate": 0.0004999502943837244, "loss": 6.1659, "mean_token_accuracy": 0.15004989951848985, "num_tokens": 3569851.0, "step": 1590 }, { "entropy": 6.135163640975952, "epoch": 0.1791430336384568, "grad_norm": 0.953125, "learning_rate": 0.0004999494469351406, "loss": 6.0449, "mean_token_accuracy": 0.14947315603494643, "num_tokens": 3580797.0, "step": 1595 }, { "entropy": 6.05308346748352, "epoch": 0.17970461054641435, "grad_norm": 0.89453125, "learning_rate": 0.0004999485923240793, "loss": 6.0467, "mean_token_accuracy": 0.1534357637166977, "num_tokens": 3592552.0, "step": 1600 }, { "entropy": 5.9738929748535154, "epoch": 0.18026618745437187, "grad_norm": 1.015625, "learning_rate": 0.0004999477305505675, "loss": 6.0287, "mean_token_accuracy": 0.15556652545928956, "num_tokens": 3603932.0, "step": 1605 }, { "entropy": 6.095688581466675, "epoch": 0.18082776436232942, "grad_norm": 1.015625, "learning_rate": 0.0004999468616146328, "loss": 6.052, "mean_token_accuracy": 0.1578151524066925, "num_tokens": 3614865.0, "step": 1610 }, { "entropy": 5.861964559555053, "epoch": 0.18138934127028697, "grad_norm": 0.93359375, "learning_rate": 0.0004999459855163026, "loss": 5.9784, "mean_token_accuracy": 0.1593295931816101, "num_tokens": 3626275.0, "step": 1615 }, { "entropy": 6.140000581741333, "epoch": 0.18195091817824452, "grad_norm": 1.0234375, "learning_rate": 0.000499945102255605, "loss": 6.1078, "mean_token_accuracy": 0.1455901011824608, "num_tokens": 3638416.0, "step": 1620 }, { "entropy": 5.946600866317749, "epoch": 0.18251249508620204, "grad_norm": 0.9453125, "learning_rate": 0.0004999442118325682, "loss": 5.9553, "mean_token_accuracy": 0.1524277485907078, "num_tokens": 3649651.0, "step": 1625 }, { "entropy": 6.132726192474365, "epoch": 0.1830740719941596, "grad_norm": 1.0234375, "learning_rate": 0.0004999433142472205, "loss": 6.192, "mean_token_accuracy": 0.15279360264539718, "num_tokens": 3661172.0, "step": 1630 }, { "entropy": 6.108269739151001, "epoch": 0.18363564890211714, "grad_norm": 1.1015625, "learning_rate": 0.0004999424094995902, "loss": 6.0268, "mean_token_accuracy": 0.15440748035907745, "num_tokens": 3672086.0, "step": 1635 }, { "entropy": 6.029655122756958, "epoch": 0.1841972258100747, "grad_norm": 0.921875, "learning_rate": 0.0004999414975897066, "loss": 6.0021, "mean_token_accuracy": 0.14995888769626617, "num_tokens": 3682579.0, "step": 1640 }, { "entropy": 6.10533299446106, "epoch": 0.18475880271803224, "grad_norm": 0.9453125, "learning_rate": 0.0004999405785175983, "loss": 6.1253, "mean_token_accuracy": 0.14912039935588836, "num_tokens": 3694616.0, "step": 1645 }, { "entropy": 5.989877414703369, "epoch": 0.18532037962598977, "grad_norm": 0.87109375, "learning_rate": 0.0004999396522832949, "loss": 5.909, "mean_token_accuracy": 0.1535977005958557, "num_tokens": 3706821.0, "step": 1650 }, { "entropy": 5.970361423492432, "epoch": 0.18588195653394732, "grad_norm": 1.0078125, "learning_rate": 0.0004999387188868256, "loss": 5.9652, "mean_token_accuracy": 0.1572886511683464, "num_tokens": 3717552.0, "step": 1655 }, { "entropy": 5.978477573394775, "epoch": 0.18644353344190487, "grad_norm": 0.953125, "learning_rate": 0.0004999377783282203, "loss": 6.043, "mean_token_accuracy": 0.15294748544692993, "num_tokens": 3728300.0, "step": 1660 }, { "entropy": 6.069652843475342, "epoch": 0.18700511034986242, "grad_norm": 0.9921875, "learning_rate": 0.0004999368306075089, "loss": 6.0383, "mean_token_accuracy": 0.15796971321105957, "num_tokens": 3738545.0, "step": 1665 }, { "entropy": 6.053223991394043, "epoch": 0.18756668725781997, "grad_norm": 1.1015625, "learning_rate": 0.0004999358757247215, "loss": 6.031, "mean_token_accuracy": 0.14949157685041428, "num_tokens": 3749190.0, "step": 1670 }, { "entropy": 5.973500061035156, "epoch": 0.1881282641657775, "grad_norm": 1.0859375, "learning_rate": 0.0004999349136798886, "loss": 6.0387, "mean_token_accuracy": 0.15051646381616593, "num_tokens": 3760978.0, "step": 1675 }, { "entropy": 5.94163761138916, "epoch": 0.18868984107373504, "grad_norm": 1.0546875, "learning_rate": 0.0004999339444730409, "loss": 5.9304, "mean_token_accuracy": 0.1564078763127327, "num_tokens": 3771339.0, "step": 1680 }, { "entropy": 6.000215005874634, "epoch": 0.1892514179816926, "grad_norm": 1.0078125, "learning_rate": 0.0004999329681042092, "loss": 5.9158, "mean_token_accuracy": 0.15469563752412796, "num_tokens": 3781550.0, "step": 1685 }, { "entropy": 5.960664081573486, "epoch": 0.18981299488965014, "grad_norm": 0.9140625, "learning_rate": 0.0004999319845734243, "loss": 6.1339, "mean_token_accuracy": 0.14286689832806587, "num_tokens": 3793700.0, "step": 1690 }, { "entropy": 6.237479496002197, "epoch": 0.1903745717976077, "grad_norm": 0.94140625, "learning_rate": 0.0004999309938807181, "loss": 6.1323, "mean_token_accuracy": 0.14619217813014984, "num_tokens": 3806114.0, "step": 1695 }, { "entropy": 5.988754749298096, "epoch": 0.19093614870556522, "grad_norm": 0.9921875, "learning_rate": 0.0004999299960261216, "loss": 6.0421, "mean_token_accuracy": 0.15423230230808258, "num_tokens": 3817251.0, "step": 1700 }, { "entropy": 6.091027498245239, "epoch": 0.19149772561352277, "grad_norm": 0.9296875, "learning_rate": 0.0004999289910096669, "loss": 6.0464, "mean_token_accuracy": 0.15106936246156694, "num_tokens": 3828544.0, "step": 1705 }, { "entropy": 5.994654273986816, "epoch": 0.19205930252148032, "grad_norm": 1.0078125, "learning_rate": 0.0004999279788313858, "loss": 6.1189, "mean_token_accuracy": 0.14720231145620347, "num_tokens": 3840423.0, "step": 1710 }, { "entropy": 6.1074625015258786, "epoch": 0.19262087942943787, "grad_norm": 0.90625, "learning_rate": 0.0004999269594913107, "loss": 6.0199, "mean_token_accuracy": 0.15324137806892396, "num_tokens": 3852751.0, "step": 1715 }, { "entropy": 5.966987991333008, "epoch": 0.19318245633739542, "grad_norm": 0.9453125, "learning_rate": 0.0004999259329894739, "loss": 6.0043, "mean_token_accuracy": 0.15583723783493042, "num_tokens": 3863382.0, "step": 1720 }, { "entropy": 5.978365659713745, "epoch": 0.19374403324535294, "grad_norm": 1.078125, "learning_rate": 0.0004999248993259081, "loss": 6.0004, "mean_token_accuracy": 0.1522401787340641, "num_tokens": 3874294.0, "step": 1725 }, { "entropy": 6.057207489013672, "epoch": 0.1943056101533105, "grad_norm": 1.0234375, "learning_rate": 0.0004999238585006463, "loss": 6.0364, "mean_token_accuracy": 0.14614153355360032, "num_tokens": 3886693.0, "step": 1730 }, { "entropy": 5.985201740264893, "epoch": 0.19486718706126804, "grad_norm": 0.98828125, "learning_rate": 0.0004999228105137218, "loss": 5.9488, "mean_token_accuracy": 0.1587449014186859, "num_tokens": 3897755.0, "step": 1735 }, { "entropy": 5.956290817260742, "epoch": 0.1954287639692256, "grad_norm": 1.0703125, "learning_rate": 0.0004999217553651676, "loss": 5.9546, "mean_token_accuracy": 0.15806302726268767, "num_tokens": 3909418.0, "step": 1740 }, { "entropy": 6.051894617080689, "epoch": 0.19599034087718312, "grad_norm": 1.15625, "learning_rate": 0.0004999206930550175, "loss": 6.1081, "mean_token_accuracy": 0.14818969666957854, "num_tokens": 3919992.0, "step": 1745 }, { "entropy": 6.063493871688843, "epoch": 0.19655191778514067, "grad_norm": 0.95703125, "learning_rate": 0.0004999196235833054, "loss": 5.9663, "mean_token_accuracy": 0.16147716641426085, "num_tokens": 3930648.0, "step": 1750 }, { "entropy": 5.885579061508179, "epoch": 0.19711349469309822, "grad_norm": 0.95703125, "learning_rate": 0.0004999185469500651, "loss": 5.9529, "mean_token_accuracy": 0.15516203343868257, "num_tokens": 3941883.0, "step": 1755 }, { "entropy": 6.019442367553711, "epoch": 0.19767507160105577, "grad_norm": 1.0625, "learning_rate": 0.000499917463155331, "loss": 5.9987, "mean_token_accuracy": 0.15911805033683776, "num_tokens": 3952005.0, "step": 1760 }, { "entropy": 5.935513496398926, "epoch": 0.19823664850901332, "grad_norm": 1.078125, "learning_rate": 0.0004999163721991378, "loss": 5.9213, "mean_token_accuracy": 0.15570384711027146, "num_tokens": 3963720.0, "step": 1765 }, { "entropy": 5.93169755935669, "epoch": 0.19879822541697084, "grad_norm": 1.0078125, "learning_rate": 0.00049991527408152, "loss": 6.0081, "mean_token_accuracy": 0.15529269427061082, "num_tokens": 3974998.0, "step": 1770 }, { "entropy": 6.000465297698975, "epoch": 0.1993598023249284, "grad_norm": 0.9296875, "learning_rate": 0.0004999141688025127, "loss": 6.048, "mean_token_accuracy": 0.14723881632089614, "num_tokens": 3986469.0, "step": 1775 }, { "entropy": 6.037735271453857, "epoch": 0.19992137923288594, "grad_norm": 0.8984375, "learning_rate": 0.000499913056362151, "loss": 5.8733, "mean_token_accuracy": 0.1559750333428383, "num_tokens": 3997553.0, "step": 1780 }, { "entropy": 5.848225831985474, "epoch": 0.2004829561408435, "grad_norm": 0.90234375, "learning_rate": 0.0004999119367604703, "loss": 5.958, "mean_token_accuracy": 0.15345809012651443, "num_tokens": 4008613.0, "step": 1785 }, { "entropy": 6.148313570022583, "epoch": 0.20104453304880104, "grad_norm": 1.046875, "learning_rate": 0.0004999108099975064, "loss": 6.1178, "mean_token_accuracy": 0.1494819074869156, "num_tokens": 4019860.0, "step": 1790 }, { "entropy": 5.971745538711548, "epoch": 0.20160610995675857, "grad_norm": 1.0859375, "learning_rate": 0.000499909676073295, "loss": 6.0125, "mean_token_accuracy": 0.15912038534879686, "num_tokens": 4030602.0, "step": 1795 }, { "entropy": 5.967540597915649, "epoch": 0.20216768686471612, "grad_norm": 1.046875, "learning_rate": 0.0004999085349878723, "loss": 5.8881, "mean_token_accuracy": 0.1551676794886589, "num_tokens": 4041878.0, "step": 1800 }, { "entropy": 5.902796602249145, "epoch": 0.20272926377267367, "grad_norm": 1.03125, "learning_rate": 0.0004999073867412746, "loss": 5.985, "mean_token_accuracy": 0.15298098027706147, "num_tokens": 4052799.0, "step": 1805 }, { "entropy": 6.052335357666015, "epoch": 0.20329084068063122, "grad_norm": 0.98046875, "learning_rate": 0.0004999062313335385, "loss": 5.977, "mean_token_accuracy": 0.1513774089515209, "num_tokens": 4064339.0, "step": 1810 }, { "entropy": 5.881051683425904, "epoch": 0.20385241758858877, "grad_norm": 1.0234375, "learning_rate": 0.0004999050687647008, "loss": 5.9321, "mean_token_accuracy": 0.15355904400348663, "num_tokens": 4076246.0, "step": 1815 }, { "entropy": 5.9952904224395756, "epoch": 0.2044139944965463, "grad_norm": 0.9375, "learning_rate": 0.0004999038990347984, "loss": 6.0102, "mean_token_accuracy": 0.15132154226303102, "num_tokens": 4088006.0, "step": 1820 }, { "entropy": 5.986813735961914, "epoch": 0.20497557140450384, "grad_norm": 1.078125, "learning_rate": 0.0004999027221438688, "loss": 6.0135, "mean_token_accuracy": 0.1533118411898613, "num_tokens": 4098122.0, "step": 1825 }, { "entropy": 6.179859924316406, "epoch": 0.2055371483124614, "grad_norm": 1.0703125, "learning_rate": 0.000499901538091949, "loss": 6.2072, "mean_token_accuracy": 0.14116512686014177, "num_tokens": 4109958.0, "step": 1830 }, { "entropy": 6.044462394714356, "epoch": 0.20609872522041894, "grad_norm": 1.0078125, "learning_rate": 0.0004999003468790773, "loss": 6.0967, "mean_token_accuracy": 0.14568886607885362, "num_tokens": 4121262.0, "step": 1835 }, { "entropy": 6.016641092300415, "epoch": 0.2066603021283765, "grad_norm": 1.015625, "learning_rate": 0.0004998991485052911, "loss": 5.87, "mean_token_accuracy": 0.16044027954339982, "num_tokens": 4130958.0, "step": 1840 }, { "entropy": 5.966278457641602, "epoch": 0.20722187903633402, "grad_norm": 0.97265625, "learning_rate": 0.000499897942970629, "loss": 6.0778, "mean_token_accuracy": 0.1423511266708374, "num_tokens": 4143779.0, "step": 1845 }, { "entropy": 6.1042670726776125, "epoch": 0.20778345594429157, "grad_norm": 0.94921875, "learning_rate": 0.000499896730275129, "loss": 6.1007, "mean_token_accuracy": 0.14468785226345063, "num_tokens": 4155367.0, "step": 1850 }, { "entropy": 5.985637760162353, "epoch": 0.20834503285224912, "grad_norm": 1.015625, "learning_rate": 0.00049989551041883, "loss": 5.9152, "mean_token_accuracy": 0.15388040691614152, "num_tokens": 4166657.0, "step": 1855 }, { "entropy": 5.961990070343018, "epoch": 0.20890660976020667, "grad_norm": 1.0390625, "learning_rate": 0.0004998942834017707, "loss": 6.0298, "mean_token_accuracy": 0.15152619555592536, "num_tokens": 4177517.0, "step": 1860 }, { "entropy": 5.9690758228302006, "epoch": 0.2094681866681642, "grad_norm": 1.0234375, "learning_rate": 0.0004998930492239901, "loss": 5.8913, "mean_token_accuracy": 0.15565723478794097, "num_tokens": 4188182.0, "step": 1865 }, { "entropy": 6.060051155090332, "epoch": 0.21002976357612174, "grad_norm": 1.03125, "learning_rate": 0.0004998918078855277, "loss": 6.0221, "mean_token_accuracy": 0.1551324889063835, "num_tokens": 4199415.0, "step": 1870 }, { "entropy": 5.884836721420288, "epoch": 0.2105913404840793, "grad_norm": 1.0078125, "learning_rate": 0.0004998905593864227, "loss": 5.967, "mean_token_accuracy": 0.15338498651981353, "num_tokens": 4210025.0, "step": 1875 }, { "entropy": 5.985698986053467, "epoch": 0.21115291739203684, "grad_norm": 1.015625, "learning_rate": 0.0004998893037267153, "loss": 5.8966, "mean_token_accuracy": 0.15888059735298157, "num_tokens": 4219920.0, "step": 1880 }, { "entropy": 5.979580545425415, "epoch": 0.2117144942999944, "grad_norm": 0.9921875, "learning_rate": 0.0004998880409064452, "loss": 6.0678, "mean_token_accuracy": 0.1490791544318199, "num_tokens": 4232647.0, "step": 1885 }, { "entropy": 6.082404136657715, "epoch": 0.21227607120795192, "grad_norm": 1.0859375, "learning_rate": 0.0004998867709256527, "loss": 5.9527, "mean_token_accuracy": 0.15514377057552337, "num_tokens": 4242637.0, "step": 1890 }, { "entropy": 5.876793336868286, "epoch": 0.21283764811590947, "grad_norm": 1.015625, "learning_rate": 0.000499885493784378, "loss": 5.9242, "mean_token_accuracy": 0.15735216736793517, "num_tokens": 4253633.0, "step": 1895 }, { "entropy": 5.9101646900177, "epoch": 0.21339922502386702, "grad_norm": 0.9296875, "learning_rate": 0.0004998842094826621, "loss": 5.8893, "mean_token_accuracy": 0.15901758521795273, "num_tokens": 4264472.0, "step": 1900 }, { "entropy": 6.013765573501587, "epoch": 0.21396080193182457, "grad_norm": 0.953125, "learning_rate": 0.0004998829180205458, "loss": 6.0058, "mean_token_accuracy": 0.15594724267721177, "num_tokens": 4275233.0, "step": 1905 }, { "entropy": 6.0052587509155275, "epoch": 0.21452237883978212, "grad_norm": 1.03125, "learning_rate": 0.0004998816193980701, "loss": 5.9606, "mean_token_accuracy": 0.15338825732469558, "num_tokens": 4287063.0, "step": 1910 }, { "entropy": 6.001710557937622, "epoch": 0.21508395574773964, "grad_norm": 1.0234375, "learning_rate": 0.0004998803136152764, "loss": 5.9866, "mean_token_accuracy": 0.15025851130485535, "num_tokens": 4298761.0, "step": 1915 }, { "entropy": 5.735988998413086, "epoch": 0.2156455326556972, "grad_norm": 0.99609375, "learning_rate": 0.0004998790006722063, "loss": 5.8469, "mean_token_accuracy": 0.16698734015226363, "num_tokens": 4309650.0, "step": 1920 }, { "entropy": 6.018524694442749, "epoch": 0.21620710956365474, "grad_norm": 1.0, "learning_rate": 0.0004998776805689016, "loss": 5.9063, "mean_token_accuracy": 0.16533491015434265, "num_tokens": 4320403.0, "step": 1925 }, { "entropy": 5.84126296043396, "epoch": 0.2167686864716123, "grad_norm": 0.95703125, "learning_rate": 0.0004998763533054045, "loss": 5.932, "mean_token_accuracy": 0.1564387321472168, "num_tokens": 4332049.0, "step": 1930 }, { "entropy": 5.947682619094849, "epoch": 0.21733026337956984, "grad_norm": 0.98046875, "learning_rate": 0.0004998750188817568, "loss": 5.8358, "mean_token_accuracy": 0.16291145533323287, "num_tokens": 4342551.0, "step": 1935 }, { "entropy": 5.899789810180664, "epoch": 0.21789184028752737, "grad_norm": 0.87890625, "learning_rate": 0.0004998736772980015, "loss": 5.9692, "mean_token_accuracy": 0.1594847857952118, "num_tokens": 4355156.0, "step": 1940 }, { "entropy": 5.908867359161377, "epoch": 0.21845341719548492, "grad_norm": 1.0, "learning_rate": 0.000499872328554181, "loss": 6.0218, "mean_token_accuracy": 0.15519974678754805, "num_tokens": 4367402.0, "step": 1945 }, { "entropy": 6.017113590240479, "epoch": 0.21901499410344247, "grad_norm": 0.890625, "learning_rate": 0.0004998709726503383, "loss": 5.8973, "mean_token_accuracy": 0.16066040098667145, "num_tokens": 4378687.0, "step": 1950 }, { "entropy": 5.973746299743652, "epoch": 0.21957657101140002, "grad_norm": 1.0390625, "learning_rate": 0.0004998696095865168, "loss": 6.0371, "mean_token_accuracy": 0.1629161447286606, "num_tokens": 4388871.0, "step": 1955 }, { "entropy": 5.922299194335937, "epoch": 0.22013814791935757, "grad_norm": 0.984375, "learning_rate": 0.0004998682393627595, "loss": 5.8576, "mean_token_accuracy": 0.16151300221681594, "num_tokens": 4399440.0, "step": 1960 }, { "entropy": 5.825509119033813, "epoch": 0.2206997248273151, "grad_norm": 1.0546875, "learning_rate": 0.0004998668619791104, "loss": 5.8555, "mean_token_accuracy": 0.16079302430152892, "num_tokens": 4409989.0, "step": 1965 }, { "entropy": 6.02225980758667, "epoch": 0.22126130173527264, "grad_norm": 1.0234375, "learning_rate": 0.0004998654774356131, "loss": 6.0152, "mean_token_accuracy": 0.15131131708621978, "num_tokens": 4422149.0, "step": 1970 }, { "entropy": 6.051222705841065, "epoch": 0.2218228786432302, "grad_norm": 1.109375, "learning_rate": 0.0004998640857323118, "loss": 6.0486, "mean_token_accuracy": 0.15000825822353364, "num_tokens": 4433157.0, "step": 1975 }, { "entropy": 6.00563907623291, "epoch": 0.22238445555118774, "grad_norm": 0.89453125, "learning_rate": 0.0004998626868692509, "loss": 5.973, "mean_token_accuracy": 0.15266723185777664, "num_tokens": 4444595.0, "step": 1980 }, { "entropy": 6.015877962112427, "epoch": 0.2229460324591453, "grad_norm": 0.94140625, "learning_rate": 0.0004998612808464748, "loss": 6.1061, "mean_token_accuracy": 0.14999096170067788, "num_tokens": 4456592.0, "step": 1985 }, { "entropy": 6.005351543426514, "epoch": 0.22350760936710282, "grad_norm": 0.96484375, "learning_rate": 0.0004998598676640283, "loss": 5.8623, "mean_token_accuracy": 0.16657372564077377, "num_tokens": 4467624.0, "step": 1990 }, { "entropy": 5.870333099365235, "epoch": 0.22406918627506037, "grad_norm": 0.94140625, "learning_rate": 0.0004998584473219563, "loss": 6.0578, "mean_token_accuracy": 0.1522249922156334, "num_tokens": 4479766.0, "step": 1995 }, { "entropy": 6.041551637649536, "epoch": 0.22463076318301792, "grad_norm": 1.0078125, "learning_rate": 0.0004998570198203043, "loss": 5.927, "mean_token_accuracy": 0.1541971117258072, "num_tokens": 4490023.0, "step": 2000 }, { "entropy": 5.939703559875488, "epoch": 0.22519234009097547, "grad_norm": 0.9921875, "learning_rate": 0.0004998555851591175, "loss": 5.9578, "mean_token_accuracy": 0.15466774851083756, "num_tokens": 4500651.0, "step": 2005 }, { "entropy": 6.019627428054809, "epoch": 0.225753916998933, "grad_norm": 0.9453125, "learning_rate": 0.0004998541433384416, "loss": 6.0605, "mean_token_accuracy": 0.1519089847803116, "num_tokens": 4512934.0, "step": 2010 }, { "entropy": 5.9258240222930905, "epoch": 0.22631549390689054, "grad_norm": 0.92578125, "learning_rate": 0.0004998526943583226, "loss": 5.9379, "mean_token_accuracy": 0.16064678132534027, "num_tokens": 4524251.0, "step": 2015 }, { "entropy": 5.996880960464478, "epoch": 0.2268770708148481, "grad_norm": 1.0, "learning_rate": 0.0004998512382188066, "loss": 6.022, "mean_token_accuracy": 0.14892027527093887, "num_tokens": 4536025.0, "step": 2020 }, { "entropy": 6.004436492919922, "epoch": 0.22743864772280564, "grad_norm": 0.99609375, "learning_rate": 0.0004998497749199401, "loss": 5.9701, "mean_token_accuracy": 0.158987794816494, "num_tokens": 4546717.0, "step": 2025 }, { "entropy": 5.910756921768188, "epoch": 0.2280002246307632, "grad_norm": 0.97265625, "learning_rate": 0.0004998483044617694, "loss": 5.8651, "mean_token_accuracy": 0.1554678872227669, "num_tokens": 4557206.0, "step": 2030 }, { "entropy": 5.822503995895386, "epoch": 0.22856180153872072, "grad_norm": 0.98046875, "learning_rate": 0.0004998468268443416, "loss": 5.8574, "mean_token_accuracy": 0.16205435246229172, "num_tokens": 4568123.0, "step": 2035 }, { "entropy": 5.961733341217041, "epoch": 0.22912337844667827, "grad_norm": 1.0, "learning_rate": 0.0004998453420677034, "loss": 5.9819, "mean_token_accuracy": 0.15619362890720367, "num_tokens": 4579385.0, "step": 2040 }, { "entropy": 5.9808855056762695, "epoch": 0.22968495535463582, "grad_norm": 0.9140625, "learning_rate": 0.0004998438501319025, "loss": 6.0248, "mean_token_accuracy": 0.15128423795104026, "num_tokens": 4590514.0, "step": 2045 }, { "entropy": 6.025481367111206, "epoch": 0.23024653226259337, "grad_norm": 0.8984375, "learning_rate": 0.0004998423510369862, "loss": 5.9706, "mean_token_accuracy": 0.15017401427030563, "num_tokens": 4601624.0, "step": 2050 }, { "entropy": 5.990740871429443, "epoch": 0.23080810917055092, "grad_norm": 1.0625, "learning_rate": 0.0004998408447830022, "loss": 5.9518, "mean_token_accuracy": 0.16115492284297944, "num_tokens": 4612822.0, "step": 2055 }, { "entropy": 5.939420604705811, "epoch": 0.23136968607850844, "grad_norm": 1.0234375, "learning_rate": 0.0004998393313699985, "loss": 5.9466, "mean_token_accuracy": 0.16056140810251235, "num_tokens": 4623443.0, "step": 2060 }, { "entropy": 5.930271577835083, "epoch": 0.231931262986466, "grad_norm": 1.0, "learning_rate": 0.0004998378107980233, "loss": 5.8579, "mean_token_accuracy": 0.16032032370567323, "num_tokens": 4633600.0, "step": 2065 }, { "entropy": 5.932555675506592, "epoch": 0.23249283989442354, "grad_norm": 1.1015625, "learning_rate": 0.0004998362830671249, "loss": 6.0102, "mean_token_accuracy": 0.15435325503349304, "num_tokens": 4644217.0, "step": 2070 }, { "entropy": 5.97379846572876, "epoch": 0.2330544168023811, "grad_norm": 1.078125, "learning_rate": 0.0004998347481773522, "loss": 6.0249, "mean_token_accuracy": 0.1527538165450096, "num_tokens": 4654671.0, "step": 2075 }, { "entropy": 5.9626545906066895, "epoch": 0.23361599371033864, "grad_norm": 1.0546875, "learning_rate": 0.0004998332061287538, "loss": 6.0209, "mean_token_accuracy": 0.1507769837975502, "num_tokens": 4665920.0, "step": 2080 }, { "entropy": 5.939901208877563, "epoch": 0.23417757061829617, "grad_norm": 1.1796875, "learning_rate": 0.000499831656921379, "loss": 5.8997, "mean_token_accuracy": 0.1583072543144226, "num_tokens": 4675406.0, "step": 2085 }, { "entropy": 6.018610954284668, "epoch": 0.23473914752625372, "grad_norm": 0.9921875, "learning_rate": 0.000499830100555277, "loss": 5.9357, "mean_token_accuracy": 0.15790688395500183, "num_tokens": 4686870.0, "step": 2090 }, { "entropy": 5.953982305526734, "epoch": 0.23530072443421127, "grad_norm": 0.98046875, "learning_rate": 0.0004998285370304974, "loss": 6.0124, "mean_token_accuracy": 0.15949206352233886, "num_tokens": 4698926.0, "step": 2095 }, { "entropy": 6.0622725009918215, "epoch": 0.23586230134216882, "grad_norm": 0.9921875, "learning_rate": 0.00049982696634709, "loss": 6.0882, "mean_token_accuracy": 0.14462199285626412, "num_tokens": 4709318.0, "step": 2100 }, { "entropy": 5.849839591979981, "epoch": 0.23642387825012637, "grad_norm": 0.99609375, "learning_rate": 0.0004998253885051048, "loss": 5.7796, "mean_token_accuracy": 0.16810209602117537, "num_tokens": 4718819.0, "step": 2105 }, { "entropy": 5.884680938720703, "epoch": 0.2369854551580839, "grad_norm": 1.0, "learning_rate": 0.000499823803504592, "loss": 5.8314, "mean_token_accuracy": 0.16093335300683975, "num_tokens": 4729513.0, "step": 2110 }, { "entropy": 5.859940433502198, "epoch": 0.23754703206604144, "grad_norm": 1.0546875, "learning_rate": 0.0004998222113456022, "loss": 5.9287, "mean_token_accuracy": 0.15834257006645203, "num_tokens": 4739875.0, "step": 2115 }, { "entropy": 6.060333490371704, "epoch": 0.238108608973999, "grad_norm": 0.96875, "learning_rate": 0.0004998206120281858, "loss": 6.0609, "mean_token_accuracy": 0.14767249599099158, "num_tokens": 4752933.0, "step": 2120 }, { "entropy": 5.938970279693604, "epoch": 0.23867018588195654, "grad_norm": 1.1015625, "learning_rate": 0.000499819005552394, "loss": 5.8526, "mean_token_accuracy": 0.16048028618097304, "num_tokens": 4762969.0, "step": 2125 }, { "entropy": 5.958646631240844, "epoch": 0.23923176278991407, "grad_norm": 1.0, "learning_rate": 0.0004998173919182779, "loss": 5.9439, "mean_token_accuracy": 0.15564859807491302, "num_tokens": 4773495.0, "step": 2130 }, { "entropy": 5.948372316360474, "epoch": 0.23979333969787162, "grad_norm": 0.9765625, "learning_rate": 0.000499815771125889, "loss": 5.9773, "mean_token_accuracy": 0.16150738894939423, "num_tokens": 4785335.0, "step": 2135 }, { "entropy": 6.081469774246216, "epoch": 0.24035491660582917, "grad_norm": 0.90234375, "learning_rate": 0.0004998141431752785, "loss": 6.1175, "mean_token_accuracy": 0.14878264293074608, "num_tokens": 4798068.0, "step": 2140 }, { "entropy": 5.92440824508667, "epoch": 0.24091649351378672, "grad_norm": 0.9765625, "learning_rate": 0.0004998125080664987, "loss": 5.9373, "mean_token_accuracy": 0.1596187397837639, "num_tokens": 4809338.0, "step": 2145 }, { "entropy": 5.900418853759765, "epoch": 0.24147807042174427, "grad_norm": 1.078125, "learning_rate": 0.0004998108657996012, "loss": 5.9278, "mean_token_accuracy": 0.1604372188448906, "num_tokens": 4819636.0, "step": 2150 }, { "entropy": 5.9336934089660645, "epoch": 0.2420396473297018, "grad_norm": 0.87890625, "learning_rate": 0.0004998092163746387, "loss": 5.9066, "mean_token_accuracy": 0.16119810789823533, "num_tokens": 4830975.0, "step": 2155 }, { "entropy": 5.893611574172974, "epoch": 0.24260122423765934, "grad_norm": 0.9375, "learning_rate": 0.0004998075597916636, "loss": 5.9428, "mean_token_accuracy": 0.15798580050468444, "num_tokens": 4841951.0, "step": 2160 }, { "entropy": 6.011291074752807, "epoch": 0.2431628011456169, "grad_norm": 1.015625, "learning_rate": 0.0004998058960507286, "loss": 5.9185, "mean_token_accuracy": 0.15732098147273063, "num_tokens": 4852919.0, "step": 2165 }, { "entropy": 5.955287456512451, "epoch": 0.24372437805357444, "grad_norm": 1.046875, "learning_rate": 0.0004998042251518866, "loss": 5.9264, "mean_token_accuracy": 0.1588020294904709, "num_tokens": 4863433.0, "step": 2170 }, { "entropy": 6.019167184829712, "epoch": 0.244285954961532, "grad_norm": 0.9296875, "learning_rate": 0.0004998025470951908, "loss": 6.0132, "mean_token_accuracy": 0.15414848923683167, "num_tokens": 4875685.0, "step": 2175 }, { "entropy": 5.848620128631592, "epoch": 0.24484753186948952, "grad_norm": 0.96875, "learning_rate": 0.0004998008618806949, "loss": 5.9081, "mean_token_accuracy": 0.15716440230607986, "num_tokens": 4886347.0, "step": 2180 }, { "entropy": 5.924430418014526, "epoch": 0.24540910877744707, "grad_norm": 0.953125, "learning_rate": 0.0004997991695084523, "loss": 5.8998, "mean_token_accuracy": 0.16334613561630248, "num_tokens": 4896898.0, "step": 2185 }, { "entropy": 5.999474620819091, "epoch": 0.24597068568540462, "grad_norm": 0.93359375, "learning_rate": 0.0004997974699785169, "loss": 6.0128, "mean_token_accuracy": 0.15362882167100905, "num_tokens": 4908892.0, "step": 2190 }, { "entropy": 5.907583093643188, "epoch": 0.24653226259336217, "grad_norm": 0.9140625, "learning_rate": 0.0004997957632909429, "loss": 5.9471, "mean_token_accuracy": 0.15109152495861053, "num_tokens": 4920855.0, "step": 2195 }, { "entropy": 6.013603639602661, "epoch": 0.24709383950131972, "grad_norm": 1.078125, "learning_rate": 0.0004997940494457846, "loss": 5.9325, "mean_token_accuracy": 0.16000126004219056, "num_tokens": 4932857.0, "step": 2200 }, { "entropy": 5.8864202976226805, "epoch": 0.24765541640927724, "grad_norm": 0.98828125, "learning_rate": 0.0004997923284430967, "loss": 5.9747, "mean_token_accuracy": 0.15626695305109023, "num_tokens": 4944063.0, "step": 2205 }, { "entropy": 5.871590852737427, "epoch": 0.2482169933172348, "grad_norm": 0.97265625, "learning_rate": 0.0004997906002829338, "loss": 5.8432, "mean_token_accuracy": 0.16545321345329284, "num_tokens": 4955126.0, "step": 2210 }, { "entropy": 6.042226839065552, "epoch": 0.24877857022519234, "grad_norm": 1.0078125, "learning_rate": 0.000499788864965351, "loss": 6.0353, "mean_token_accuracy": 0.15824319273233414, "num_tokens": 4965738.0, "step": 2215 }, { "entropy": 6.032025718688965, "epoch": 0.2493401471331499, "grad_norm": 1.109375, "learning_rate": 0.0004997871224904036, "loss": 6.0553, "mean_token_accuracy": 0.15088909566402436, "num_tokens": 4976963.0, "step": 2220 }, { "entropy": 5.968750953674316, "epoch": 0.24990172404110744, "grad_norm": 1.03125, "learning_rate": 0.0004997853728581468, "loss": 5.9356, "mean_token_accuracy": 0.15454284846782684, "num_tokens": 4987577.0, "step": 2225 }, { "entropy": 5.988882637023925, "epoch": 0.250463300949065, "grad_norm": 0.9453125, "learning_rate": 0.0004997836160686368, "loss": 6.0657, "mean_token_accuracy": 0.15284020453691483, "num_tokens": 5000234.0, "step": 2230 }, { "entropy": 5.972144842147827, "epoch": 0.25102487785702254, "grad_norm": 1.0234375, "learning_rate": 0.0004997818521219291, "loss": 5.8895, "mean_token_accuracy": 0.15354024320840837, "num_tokens": 5011652.0, "step": 2235 }, { "entropy": 5.973802328109741, "epoch": 0.25158645476498004, "grad_norm": 0.98828125, "learning_rate": 0.0004997800810180803, "loss": 5.9329, "mean_token_accuracy": 0.1593118280172348, "num_tokens": 5023603.0, "step": 2240 }, { "entropy": 5.892467927932739, "epoch": 0.2521480316729376, "grad_norm": 1.0, "learning_rate": 0.0004997783027571464, "loss": 5.9091, "mean_token_accuracy": 0.15956079661846162, "num_tokens": 5034427.0, "step": 2245 }, { "entropy": 5.859362268447876, "epoch": 0.25270960858089514, "grad_norm": 1.0546875, "learning_rate": 0.0004997765173391841, "loss": 5.8988, "mean_token_accuracy": 0.15956594049930573, "num_tokens": 5045738.0, "step": 2250 }, { "entropy": 5.869083404541016, "epoch": 0.2532711854888527, "grad_norm": 1.0546875, "learning_rate": 0.0004997747247642505, "loss": 5.8353, "mean_token_accuracy": 0.15759642720222472, "num_tokens": 5057021.0, "step": 2255 }, { "entropy": 5.92234172821045, "epoch": 0.25383276239681024, "grad_norm": 0.9765625, "learning_rate": 0.0004997729250324023, "loss": 5.9244, "mean_token_accuracy": 0.15921089351177214, "num_tokens": 5067676.0, "step": 2260 }, { "entropy": 5.886710166931152, "epoch": 0.2543943393047678, "grad_norm": 0.97265625, "learning_rate": 0.0004997711181436971, "loss": 5.8615, "mean_token_accuracy": 0.15837088972330093, "num_tokens": 5079422.0, "step": 2265 }, { "entropy": 5.822842216491699, "epoch": 0.25495591621272534, "grad_norm": 0.96484375, "learning_rate": 0.0004997693040981922, "loss": 5.8851, "mean_token_accuracy": 0.16085467636585235, "num_tokens": 5091242.0, "step": 2270 }, { "entropy": 6.006762552261352, "epoch": 0.2555174931206829, "grad_norm": 0.98046875, "learning_rate": 0.0004997674828959456, "loss": 5.8909, "mean_token_accuracy": 0.15583527684211732, "num_tokens": 5102251.0, "step": 2275 }, { "entropy": 5.857793092727661, "epoch": 0.25607907002864044, "grad_norm": 1.5, "learning_rate": 0.0004997656545370151, "loss": 5.9104, "mean_token_accuracy": 0.1610156461596489, "num_tokens": 5113276.0, "step": 2280 }, { "entropy": 5.934245014190674, "epoch": 0.256640646936598, "grad_norm": 1.0625, "learning_rate": 0.000499763819021459, "loss": 5.9191, "mean_token_accuracy": 0.15731906294822692, "num_tokens": 5124472.0, "step": 2285 }, { "entropy": 5.863279104232788, "epoch": 0.2572022238445555, "grad_norm": 0.95703125, "learning_rate": 0.0004997619763493357, "loss": 5.8698, "mean_token_accuracy": 0.1613835647702217, "num_tokens": 5134896.0, "step": 2290 }, { "entropy": 5.962464809417725, "epoch": 0.25776380075251304, "grad_norm": 1.0625, "learning_rate": 0.000499760126520704, "loss": 5.95, "mean_token_accuracy": 0.1634097322821617, "num_tokens": 5145115.0, "step": 2295 }, { "entropy": 5.927261829376221, "epoch": 0.2583253776604706, "grad_norm": 1.015625, "learning_rate": 0.0004997582695356225, "loss": 5.9289, "mean_token_accuracy": 0.15928202718496323, "num_tokens": 5155620.0, "step": 2300 }, { "entropy": 6.070884418487549, "epoch": 0.25888695456842814, "grad_norm": 1.015625, "learning_rate": 0.0004997564053941507, "loss": 6.0126, "mean_token_accuracy": 0.15451653599739074, "num_tokens": 5166260.0, "step": 2305 }, { "entropy": 5.954886245727539, "epoch": 0.2594485314763857, "grad_norm": 0.9921875, "learning_rate": 0.0004997545340963478, "loss": 5.8733, "mean_token_accuracy": 0.15934662520885468, "num_tokens": 5177143.0, "step": 2310 }, { "entropy": 5.921825218200683, "epoch": 0.26001010838434324, "grad_norm": 0.98828125, "learning_rate": 0.0004997526556422733, "loss": 6.0233, "mean_token_accuracy": 0.15293444991111754, "num_tokens": 5187795.0, "step": 2315 }, { "entropy": 5.922110557556152, "epoch": 0.2605716852923008, "grad_norm": 0.92578125, "learning_rate": 0.0004997507700319872, "loss": 5.8811, "mean_token_accuracy": 0.16001545637845993, "num_tokens": 5199365.0, "step": 2320 }, { "entropy": 5.971580982208252, "epoch": 0.26113326220025834, "grad_norm": 1.2890625, "learning_rate": 0.0004997488772655492, "loss": 6.0976, "mean_token_accuracy": 0.15617025047540664, "num_tokens": 5212264.0, "step": 2325 }, { "entropy": 6.042904090881348, "epoch": 0.2616948391082159, "grad_norm": 1.0546875, "learning_rate": 0.0004997469773430199, "loss": 5.9253, "mean_token_accuracy": 0.15450814068317414, "num_tokens": 5223544.0, "step": 2330 }, { "entropy": 5.868034029006958, "epoch": 0.2622564160161734, "grad_norm": 0.94140625, "learning_rate": 0.0004997450702644596, "loss": 5.875, "mean_token_accuracy": 0.1604365214705467, "num_tokens": 5234713.0, "step": 2335 }, { "entropy": 5.9823534965515135, "epoch": 0.26281799292413094, "grad_norm": 1.0078125, "learning_rate": 0.0004997431560299292, "loss": 5.9591, "mean_token_accuracy": 0.15298095047473909, "num_tokens": 5246103.0, "step": 2340 }, { "entropy": 5.814671277999878, "epoch": 0.2633795698320885, "grad_norm": 1.0859375, "learning_rate": 0.0004997412346394894, "loss": 5.7917, "mean_token_accuracy": 0.16624176353216172, "num_tokens": 5257372.0, "step": 2345 }, { "entropy": 5.792899942398071, "epoch": 0.26394114674004604, "grad_norm": 0.9921875, "learning_rate": 0.0004997393060932017, "loss": 5.8609, "mean_token_accuracy": 0.16722605973482133, "num_tokens": 5268677.0, "step": 2350 }, { "entropy": 5.997194576263428, "epoch": 0.2645027236480036, "grad_norm": 1.0234375, "learning_rate": 0.0004997373703911273, "loss": 5.9247, "mean_token_accuracy": 0.16152105778455733, "num_tokens": 5279056.0, "step": 2355 }, { "entropy": 5.786316013336181, "epoch": 0.26506430055596114, "grad_norm": 1.0234375, "learning_rate": 0.0004997354275333277, "loss": 5.8069, "mean_token_accuracy": 0.16789699494838714, "num_tokens": 5289310.0, "step": 2360 }, { "entropy": 5.953582143783569, "epoch": 0.2656258774639187, "grad_norm": 0.91015625, "learning_rate": 0.000499733477519865, "loss": 5.8956, "mean_token_accuracy": 0.16771894991397857, "num_tokens": 5300619.0, "step": 2365 }, { "entropy": 6.053738594055176, "epoch": 0.26618745437187624, "grad_norm": 1.078125, "learning_rate": 0.0004997315203508013, "loss": 6.0608, "mean_token_accuracy": 0.1562006339430809, "num_tokens": 5311554.0, "step": 2370 }, { "entropy": 5.966435718536377, "epoch": 0.2667490312798338, "grad_norm": 1.0, "learning_rate": 0.0004997295560261988, "loss": 5.883, "mean_token_accuracy": 0.1612299293279648, "num_tokens": 5323592.0, "step": 2375 }, { "entropy": 5.942288255691528, "epoch": 0.26731060818779134, "grad_norm": 1.0625, "learning_rate": 0.00049972758454612, "loss": 5.9767, "mean_token_accuracy": 0.15383181422948838, "num_tokens": 5334978.0, "step": 2380 }, { "entropy": 5.898320913314819, "epoch": 0.26787218509574884, "grad_norm": 0.98828125, "learning_rate": 0.0004997256059106279, "loss": 5.8667, "mean_token_accuracy": 0.15778945684432982, "num_tokens": 5345724.0, "step": 2385 }, { "entropy": 5.94132432937622, "epoch": 0.2684337620037064, "grad_norm": 1.125, "learning_rate": 0.0004997236201197853, "loss": 5.9989, "mean_token_accuracy": 0.15381949245929719, "num_tokens": 5357141.0, "step": 2390 }, { "entropy": 5.9436756610870365, "epoch": 0.26899533891166394, "grad_norm": 0.97265625, "learning_rate": 0.0004997216271736554, "loss": 5.995, "mean_token_accuracy": 0.15819256901741027, "num_tokens": 5367889.0, "step": 2395 }, { "entropy": 5.786690282821655, "epoch": 0.2695569158196215, "grad_norm": 0.94921875, "learning_rate": 0.0004997196270723018, "loss": 5.7261, "mean_token_accuracy": 0.16399870365858077, "num_tokens": 5379329.0, "step": 2400 }, { "entropy": 5.895531129837036, "epoch": 0.27011849272757904, "grad_norm": 0.9375, "learning_rate": 0.0004997176198157881, "loss": 5.8852, "mean_token_accuracy": 0.1617034539580345, "num_tokens": 5389525.0, "step": 2405 }, { "entropy": 5.895331811904907, "epoch": 0.2706800696355366, "grad_norm": 0.93359375, "learning_rate": 0.0004997156054041781, "loss": 5.7958, "mean_token_accuracy": 0.16883354038000106, "num_tokens": 5401061.0, "step": 2410 }, { "entropy": 5.873462343215943, "epoch": 0.27124164654349414, "grad_norm": 1.0078125, "learning_rate": 0.0004997135838375362, "loss": 5.8949, "mean_token_accuracy": 0.1616640195250511, "num_tokens": 5411791.0, "step": 2415 }, { "entropy": 5.908325338363648, "epoch": 0.2718032234514517, "grad_norm": 1.0546875, "learning_rate": 0.0004997115551159267, "loss": 5.8467, "mean_token_accuracy": 0.16689947098493577, "num_tokens": 5422790.0, "step": 2420 }, { "entropy": 5.738713026046753, "epoch": 0.27236480035940924, "grad_norm": 0.9765625, "learning_rate": 0.000499709519239414, "loss": 5.7951, "mean_token_accuracy": 0.1616228774189949, "num_tokens": 5434170.0, "step": 2425 }, { "entropy": 5.972346496582031, "epoch": 0.2729263772673668, "grad_norm": 1.9453125, "learning_rate": 0.0004997074762080632, "loss": 5.922, "mean_token_accuracy": 0.15746588557958602, "num_tokens": 5445948.0, "step": 2430 }, { "entropy": 5.907391738891602, "epoch": 0.2734879541753243, "grad_norm": 0.9609375, "learning_rate": 0.000499705426021939, "loss": 5.8828, "mean_token_accuracy": 0.15904785543680192, "num_tokens": 5457786.0, "step": 2435 }, { "entropy": 5.784610605239868, "epoch": 0.27404953108328184, "grad_norm": 1.0625, "learning_rate": 0.000499703368681107, "loss": 5.8589, "mean_token_accuracy": 0.16070218682289122, "num_tokens": 5469434.0, "step": 2440 }, { "entropy": 5.8818888664245605, "epoch": 0.2746111079912394, "grad_norm": 1.046875, "learning_rate": 0.0004997013041856326, "loss": 5.8549, "mean_token_accuracy": 0.1531570464372635, "num_tokens": 5480393.0, "step": 2445 }, { "entropy": 5.844133996963501, "epoch": 0.27517268489919694, "grad_norm": 1.0703125, "learning_rate": 0.0004996992325355815, "loss": 5.8264, "mean_token_accuracy": 0.16376967430114747, "num_tokens": 5490452.0, "step": 2450 }, { "entropy": 5.843231868743897, "epoch": 0.2757342618071545, "grad_norm": 1.0546875, "learning_rate": 0.0004996971537310198, "loss": 5.7996, "mean_token_accuracy": 0.16604796648025513, "num_tokens": 5501404.0, "step": 2455 }, { "entropy": 5.97615795135498, "epoch": 0.27629583871511204, "grad_norm": 0.96484375, "learning_rate": 0.0004996950677720133, "loss": 5.9411, "mean_token_accuracy": 0.15309768170118332, "num_tokens": 5512938.0, "step": 2460 }, { "entropy": 5.879659843444824, "epoch": 0.2768574156230696, "grad_norm": 1.0078125, "learning_rate": 0.000499692974658629, "loss": 5.8641, "mean_token_accuracy": 0.15448336452245712, "num_tokens": 5524009.0, "step": 2465 }, { "entropy": 5.961763477325439, "epoch": 0.27741899253102714, "grad_norm": 1.1015625, "learning_rate": 0.0004996908743909331, "loss": 5.9491, "mean_token_accuracy": 0.15658549070358277, "num_tokens": 5535930.0, "step": 2470 }, { "entropy": 5.943891477584839, "epoch": 0.2779805694389847, "grad_norm": 1.109375, "learning_rate": 0.0004996887669689926, "loss": 5.9378, "mean_token_accuracy": 0.1560988336801529, "num_tokens": 5547295.0, "step": 2475 }, { "entropy": 5.934115314483643, "epoch": 0.2785421463469422, "grad_norm": 0.9921875, "learning_rate": 0.0004996866523928747, "loss": 5.8393, "mean_token_accuracy": 0.1640307277441025, "num_tokens": 5558447.0, "step": 2480 }, { "entropy": 5.91972165107727, "epoch": 0.27910372325489974, "grad_norm": 1.015625, "learning_rate": 0.0004996845306626467, "loss": 5.9369, "mean_token_accuracy": 0.16300042271614074, "num_tokens": 5569822.0, "step": 2485 }, { "entropy": 5.9508904933929445, "epoch": 0.2796653001628573, "grad_norm": 1.0078125, "learning_rate": 0.0004996824017783759, "loss": 5.9902, "mean_token_accuracy": 0.15508754998445512, "num_tokens": 5582284.0, "step": 2490 }, { "entropy": 5.9683637619018555, "epoch": 0.28022687707081484, "grad_norm": 1.0234375, "learning_rate": 0.0004996802657401304, "loss": 5.879, "mean_token_accuracy": 0.1611318975687027, "num_tokens": 5593765.0, "step": 2495 }, { "entropy": 5.801318073272705, "epoch": 0.2807884539787724, "grad_norm": 1.0, "learning_rate": 0.0004996781225479781, "loss": 5.8487, "mean_token_accuracy": 0.15998225808143615, "num_tokens": 5605080.0, "step": 2500 }, { "entropy": 6.015531349182129, "epoch": 0.28135003088672994, "grad_norm": 0.98046875, "learning_rate": 0.0004996759722019872, "loss": 6.011, "mean_token_accuracy": 0.15439892411231995, "num_tokens": 5616739.0, "step": 2505 }, { "entropy": 5.904989242553711, "epoch": 0.2819116077946875, "grad_norm": 1.03125, "learning_rate": 0.0004996738147022262, "loss": 5.8735, "mean_token_accuracy": 0.1576665908098221, "num_tokens": 5628779.0, "step": 2510 }, { "entropy": 5.889083909988403, "epoch": 0.28247318470264504, "grad_norm": 1.125, "learning_rate": 0.0004996716500487638, "loss": 5.909, "mean_token_accuracy": 0.15748686641454696, "num_tokens": 5639168.0, "step": 2515 }, { "entropy": 5.893275928497315, "epoch": 0.2830347616106026, "grad_norm": 1.03125, "learning_rate": 0.000499669478241669, "loss": 5.885, "mean_token_accuracy": 0.15599167197942734, "num_tokens": 5650739.0, "step": 2520 }, { "entropy": 5.933381366729736, "epoch": 0.28359633851856014, "grad_norm": 1.1171875, "learning_rate": 0.0004996672992810108, "loss": 5.9054, "mean_token_accuracy": 0.15816623866558074, "num_tokens": 5662630.0, "step": 2525 }, { "entropy": 5.921469497680664, "epoch": 0.28415791542651764, "grad_norm": 1.0078125, "learning_rate": 0.0004996651131668587, "loss": 5.9083, "mean_token_accuracy": 0.1671989306807518, "num_tokens": 5673473.0, "step": 2530 }, { "entropy": 5.915191793441773, "epoch": 0.2847194923344752, "grad_norm": 1.0234375, "learning_rate": 0.0004996629198992823, "loss": 6.0544, "mean_token_accuracy": 0.15136269852519035, "num_tokens": 5686577.0, "step": 2535 }, { "entropy": 5.963024854660034, "epoch": 0.28528106924243274, "grad_norm": 1.0390625, "learning_rate": 0.0004996607194783513, "loss": 5.8035, "mean_token_accuracy": 0.15977411419153215, "num_tokens": 5697570.0, "step": 2540 }, { "entropy": 5.849263906478882, "epoch": 0.2858426461503903, "grad_norm": 1.03125, "learning_rate": 0.0004996585119041359, "loss": 5.8717, "mean_token_accuracy": 0.15102790147066117, "num_tokens": 5708601.0, "step": 2545 }, { "entropy": 5.817156410217285, "epoch": 0.28640422305834784, "grad_norm": 0.9765625, "learning_rate": 0.0004996562971767063, "loss": 5.8333, "mean_token_accuracy": 0.1580057695508003, "num_tokens": 5719619.0, "step": 2550 }, { "entropy": 5.881134510040283, "epoch": 0.2869657999663054, "grad_norm": 1.1171875, "learning_rate": 0.000499654075296133, "loss": 5.854, "mean_token_accuracy": 0.16304896473884584, "num_tokens": 5730061.0, "step": 2555 }, { "entropy": 5.887245082855225, "epoch": 0.28752737687426294, "grad_norm": 1.0078125, "learning_rate": 0.000499651846262487, "loss": 5.8781, "mean_token_accuracy": 0.16307636797428132, "num_tokens": 5741579.0, "step": 2560 }, { "entropy": 5.929854440689087, "epoch": 0.2880889537822205, "grad_norm": 0.984375, "learning_rate": 0.0004996496100758389, "loss": 5.8899, "mean_token_accuracy": 0.16015600562095642, "num_tokens": 5754001.0, "step": 2565 }, { "entropy": 5.956954383850098, "epoch": 0.28865053069017804, "grad_norm": 1.0859375, "learning_rate": 0.0004996473667362604, "loss": 5.9762, "mean_token_accuracy": 0.15367593243718147, "num_tokens": 5766224.0, "step": 2570 }, { "entropy": 5.9173064708709715, "epoch": 0.28921210759813554, "grad_norm": 0.99609375, "learning_rate": 0.0004996451162438224, "loss": 5.9514, "mean_token_accuracy": 0.1529170662164688, "num_tokens": 5777475.0, "step": 2575 }, { "entropy": 5.9922263622283936, "epoch": 0.2897736845060931, "grad_norm": 1.109375, "learning_rate": 0.0004996428585985967, "loss": 5.9243, "mean_token_accuracy": 0.15300409942865373, "num_tokens": 5788359.0, "step": 2580 }, { "entropy": 5.833764743804932, "epoch": 0.29033526141405064, "grad_norm": 1.0390625, "learning_rate": 0.0004996405938006553, "loss": 5.88, "mean_token_accuracy": 0.1589822694659233, "num_tokens": 5799116.0, "step": 2585 }, { "entropy": 5.849058294296265, "epoch": 0.2908968383220082, "grad_norm": 0.99609375, "learning_rate": 0.0004996383218500703, "loss": 5.8163, "mean_token_accuracy": 0.16485902518033982, "num_tokens": 5811221.0, "step": 2590 }, { "entropy": 5.903125619888305, "epoch": 0.29145841522996574, "grad_norm": 1.046875, "learning_rate": 0.000499636042746914, "loss": 5.8986, "mean_token_accuracy": 0.1597510278224945, "num_tokens": 5822099.0, "step": 2595 }, { "entropy": 5.908592653274536, "epoch": 0.2920199921379233, "grad_norm": 1.0546875, "learning_rate": 0.000499633756491259, "loss": 5.8603, "mean_token_accuracy": 0.154727041721344, "num_tokens": 5832836.0, "step": 2600 }, { "entropy": 5.813444709777832, "epoch": 0.29258156904588084, "grad_norm": 1.109375, "learning_rate": 0.0004996314630831781, "loss": 5.8066, "mean_token_accuracy": 0.15686748921871185, "num_tokens": 5842892.0, "step": 2605 }, { "entropy": 5.8215662956237795, "epoch": 0.2931431459538384, "grad_norm": 1.09375, "learning_rate": 0.0004996291625227443, "loss": 5.7707, "mean_token_accuracy": 0.17027000188827515, "num_tokens": 5852909.0, "step": 2610 }, { "entropy": 5.975628280639649, "epoch": 0.29370472286179594, "grad_norm": 1.1015625, "learning_rate": 0.0004996268548100307, "loss": 5.9509, "mean_token_accuracy": 0.15499749705195426, "num_tokens": 5864676.0, "step": 2615 }, { "entropy": 5.67653169631958, "epoch": 0.2942662997697535, "grad_norm": 1.0625, "learning_rate": 0.000499624539945111, "loss": 5.6832, "mean_token_accuracy": 0.17367247641086578, "num_tokens": 5875258.0, "step": 2620 }, { "entropy": 5.918656921386718, "epoch": 0.294827876677711, "grad_norm": 1.0078125, "learning_rate": 0.0004996222179280589, "loss": 5.8505, "mean_token_accuracy": 0.16116076856851577, "num_tokens": 5885611.0, "step": 2625 }, { "entropy": 5.846941518783569, "epoch": 0.29538945358566854, "grad_norm": 1.0859375, "learning_rate": 0.0004996198887589481, "loss": 5.8257, "mean_token_accuracy": 0.15930989608168603, "num_tokens": 5896726.0, "step": 2630 }, { "entropy": 5.917367076873779, "epoch": 0.2959510304936261, "grad_norm": 1.0625, "learning_rate": 0.0004996175524378531, "loss": 5.851, "mean_token_accuracy": 0.1528210312128067, "num_tokens": 5907860.0, "step": 2635 }, { "entropy": 5.806666278839112, "epoch": 0.29651260740158364, "grad_norm": 1.09375, "learning_rate": 0.000499615208964848, "loss": 5.798, "mean_token_accuracy": 0.1638117402791977, "num_tokens": 5918676.0, "step": 2640 }, { "entropy": 5.9251220703125, "epoch": 0.2970741843095412, "grad_norm": 1.0859375, "learning_rate": 0.0004996128583400077, "loss": 5.8618, "mean_token_accuracy": 0.16403974294662477, "num_tokens": 5928646.0, "step": 2645 }, { "entropy": 5.816641330718994, "epoch": 0.29763576121749874, "grad_norm": 1.1640625, "learning_rate": 0.0004996105005634066, "loss": 5.8735, "mean_token_accuracy": 0.1569816768169403, "num_tokens": 5938990.0, "step": 2650 }, { "entropy": 5.8617603302001955, "epoch": 0.2981973381254563, "grad_norm": 1.1015625, "learning_rate": 0.0004996081356351202, "loss": 5.8194, "mean_token_accuracy": 0.16183129400014878, "num_tokens": 5948811.0, "step": 2655 }, { "entropy": 5.812265920639038, "epoch": 0.29875891503341384, "grad_norm": 1.046875, "learning_rate": 0.0004996057635552237, "loss": 5.8406, "mean_token_accuracy": 0.16514092236757277, "num_tokens": 5959227.0, "step": 2660 }, { "entropy": 5.8553258895874025, "epoch": 0.2993204919413714, "grad_norm": 1.1015625, "learning_rate": 0.0004996033843237925, "loss": 5.7535, "mean_token_accuracy": 0.16563905775547028, "num_tokens": 5970546.0, "step": 2665 }, { "entropy": 5.982068204879761, "epoch": 0.29988206884932894, "grad_norm": 1.5625, "learning_rate": 0.0004996009979409025, "loss": 6.0502, "mean_token_accuracy": 0.147099506855011, "num_tokens": 5983936.0, "step": 2670 }, { "entropy": 5.802636957168579, "epoch": 0.30044364575728644, "grad_norm": 1.1484375, "learning_rate": 0.0004995986044066295, "loss": 5.8494, "mean_token_accuracy": 0.15568828135728835, "num_tokens": 5994963.0, "step": 2675 }, { "entropy": 5.762459421157837, "epoch": 0.301005222665244, "grad_norm": 1.0390625, "learning_rate": 0.00049959620372105, "loss": 5.8079, "mean_token_accuracy": 0.16270437240600585, "num_tokens": 6005836.0, "step": 2680 }, { "entropy": 5.895258378982544, "epoch": 0.30156679957320154, "grad_norm": 1.0859375, "learning_rate": 0.0004995937958842401, "loss": 5.8057, "mean_token_accuracy": 0.16682981103658676, "num_tokens": 6017408.0, "step": 2685 }, { "entropy": 5.811723136901856, "epoch": 0.3021283764811591, "grad_norm": 1.109375, "learning_rate": 0.0004995913808962767, "loss": 5.8192, "mean_token_accuracy": 0.15878787338733674, "num_tokens": 6029281.0, "step": 2690 }, { "entropy": 5.850067806243897, "epoch": 0.30268995338911664, "grad_norm": 1.0703125, "learning_rate": 0.0004995889587572366, "loss": 5.8088, "mean_token_accuracy": 0.16636761128902436, "num_tokens": 6039354.0, "step": 2695 }, { "entropy": 5.8515503883361815, "epoch": 0.3032515302970742, "grad_norm": 1.09375, "learning_rate": 0.000499586529467197, "loss": 5.785, "mean_token_accuracy": 0.15962323993444444, "num_tokens": 6050053.0, "step": 2700 }, { "entropy": 5.90614161491394, "epoch": 0.30381310720503174, "grad_norm": 1.09375, "learning_rate": 0.0004995840930262351, "loss": 5.8451, "mean_token_accuracy": 0.15831548869609832, "num_tokens": 6060221.0, "step": 2705 }, { "entropy": 5.824668931961059, "epoch": 0.3043746841129893, "grad_norm": 1.03125, "learning_rate": 0.0004995816494344287, "loss": 5.859, "mean_token_accuracy": 0.1601285994052887, "num_tokens": 6070963.0, "step": 2710 }, { "entropy": 5.989436864852905, "epoch": 0.30493626102094684, "grad_norm": 1.0390625, "learning_rate": 0.0004995791986918554, "loss": 5.9386, "mean_token_accuracy": 0.15705745071172714, "num_tokens": 6082028.0, "step": 2715 }, { "entropy": 5.949339580535889, "epoch": 0.30549783792890434, "grad_norm": 1.0703125, "learning_rate": 0.0004995767407985933, "loss": 5.8736, "mean_token_accuracy": 0.16265355795621872, "num_tokens": 6092778.0, "step": 2720 }, { "entropy": 5.677318954467774, "epoch": 0.3060594148368619, "grad_norm": 1.09375, "learning_rate": 0.0004995742757547207, "loss": 5.6421, "mean_token_accuracy": 0.16859253942966462, "num_tokens": 6103093.0, "step": 2725 }, { "entropy": 5.772259378433228, "epoch": 0.30662099174481944, "grad_norm": 1.09375, "learning_rate": 0.000499571803560316, "loss": 5.7347, "mean_token_accuracy": 0.16355275958776475, "num_tokens": 6113516.0, "step": 2730 }, { "entropy": 5.810375738143921, "epoch": 0.307182568652777, "grad_norm": 1.0703125, "learning_rate": 0.0004995693242154581, "loss": 5.8036, "mean_token_accuracy": 0.15890752524137497, "num_tokens": 6125723.0, "step": 2735 }, { "entropy": 5.847309589385986, "epoch": 0.30774414556073454, "grad_norm": 1.21875, "learning_rate": 0.0004995668377202258, "loss": 5.8136, "mean_token_accuracy": 0.16112632900476456, "num_tokens": 6137091.0, "step": 2740 }, { "entropy": 5.77405891418457, "epoch": 0.3083057224686921, "grad_norm": 1.0703125, "learning_rate": 0.0004995643440746982, "loss": 5.7528, "mean_token_accuracy": 0.16945552676916123, "num_tokens": 6147941.0, "step": 2745 }, { "entropy": 5.732852792739868, "epoch": 0.30886729937664964, "grad_norm": 1.109375, "learning_rate": 0.0004995618432789548, "loss": 5.7549, "mean_token_accuracy": 0.16648126393556595, "num_tokens": 6158493.0, "step": 2750 }, { "entropy": 5.8287242412567135, "epoch": 0.3094288762846072, "grad_norm": 1.03125, "learning_rate": 0.0004995593353330753, "loss": 5.8915, "mean_token_accuracy": 0.15722588896751405, "num_tokens": 6170759.0, "step": 2755 }, { "entropy": 5.898643875122071, "epoch": 0.30999045319256474, "grad_norm": 1.109375, "learning_rate": 0.0004995568202371393, "loss": 5.724, "mean_token_accuracy": 0.16514806002378463, "num_tokens": 6182488.0, "step": 2760 }, { "entropy": 5.841040992736817, "epoch": 0.3105520301005223, "grad_norm": 1.09375, "learning_rate": 0.0004995542979912272, "loss": 5.9165, "mean_token_accuracy": 0.15282527059316636, "num_tokens": 6193849.0, "step": 2765 }, { "entropy": 5.800279855728149, "epoch": 0.3111136070084798, "grad_norm": 1.1015625, "learning_rate": 0.0004995517685954192, "loss": 5.7598, "mean_token_accuracy": 0.16608615219593048, "num_tokens": 6204132.0, "step": 2770 }, { "entropy": 5.946976375579834, "epoch": 0.31167518391643734, "grad_norm": 0.99609375, "learning_rate": 0.0004995492320497958, "loss": 5.9018, "mean_token_accuracy": 0.1554347574710846, "num_tokens": 6215547.0, "step": 2775 }, { "entropy": 5.905535459518433, "epoch": 0.3122367608243949, "grad_norm": 1.015625, "learning_rate": 0.0004995466883544376, "loss": 5.9293, "mean_token_accuracy": 0.15042147785425186, "num_tokens": 6227150.0, "step": 2780 }, { "entropy": 5.8855243682861325, "epoch": 0.31279833773235244, "grad_norm": 1.09375, "learning_rate": 0.0004995441375094258, "loss": 5.9248, "mean_token_accuracy": 0.15840522199869156, "num_tokens": 6237387.0, "step": 2785 }, { "entropy": 5.872175312042236, "epoch": 0.31335991464031, "grad_norm": 1.09375, "learning_rate": 0.0004995415795148417, "loss": 5.812, "mean_token_accuracy": 0.16368252038955688, "num_tokens": 6248623.0, "step": 2790 }, { "entropy": 5.76340684890747, "epoch": 0.31392149154826754, "grad_norm": 1.109375, "learning_rate": 0.0004995390143707665, "loss": 5.7152, "mean_token_accuracy": 0.17597836554050444, "num_tokens": 6258596.0, "step": 2795 }, { "entropy": 5.822847366333008, "epoch": 0.3144830684562251, "grad_norm": 1.0234375, "learning_rate": 0.0004995364420772821, "loss": 5.9642, "mean_token_accuracy": 0.15163593217730523, "num_tokens": 6270529.0, "step": 2800 }, { "entropy": 6.0933667659759525, "epoch": 0.31504464536418264, "grad_norm": 1.0703125, "learning_rate": 0.0004995338626344702, "loss": 5.8579, "mean_token_accuracy": 0.16046109050512314, "num_tokens": 6280891.0, "step": 2805 }, { "entropy": 5.7229210376739506, "epoch": 0.3156062222721402, "grad_norm": 1.0078125, "learning_rate": 0.000499531276042413, "loss": 5.7988, "mean_token_accuracy": 0.15810492336750032, "num_tokens": 6292247.0, "step": 2810 }, { "entropy": 5.79867639541626, "epoch": 0.31616779918009774, "grad_norm": 1.140625, "learning_rate": 0.0004995286823011929, "loss": 5.7847, "mean_token_accuracy": 0.16373041421175002, "num_tokens": 6302403.0, "step": 2815 }, { "entropy": 5.7128393173217775, "epoch": 0.31672937608805524, "grad_norm": 1.1484375, "learning_rate": 0.0004995260814108926, "loss": 5.6696, "mean_token_accuracy": 0.1683839187026024, "num_tokens": 6313901.0, "step": 2820 }, { "entropy": 5.921040821075439, "epoch": 0.3172909529960128, "grad_norm": 1.0625, "learning_rate": 0.0004995234733715947, "loss": 5.8928, "mean_token_accuracy": 0.15783516615629195, "num_tokens": 6323711.0, "step": 2825 }, { "entropy": 5.817658710479736, "epoch": 0.31785252990397034, "grad_norm": 1.0, "learning_rate": 0.0004995208581833824, "loss": 5.7877, "mean_token_accuracy": 0.1626381605863571, "num_tokens": 6334937.0, "step": 2830 }, { "entropy": 5.928051614761353, "epoch": 0.3184141068119279, "grad_norm": 1.109375, "learning_rate": 0.0004995182358463388, "loss": 5.8838, "mean_token_accuracy": 0.15879348814487457, "num_tokens": 6345723.0, "step": 2835 }, { "entropy": 5.844352579116821, "epoch": 0.31897568371988544, "grad_norm": 1.03125, "learning_rate": 0.0004995156063605475, "loss": 5.8219, "mean_token_accuracy": 0.15776338502764703, "num_tokens": 6357573.0, "step": 2840 }, { "entropy": 5.8675610542297365, "epoch": 0.319537260627843, "grad_norm": 1.15625, "learning_rate": 0.0004995129697260922, "loss": 5.8322, "mean_token_accuracy": 0.16539549678564072, "num_tokens": 6367417.0, "step": 2845 }, { "entropy": 5.872849082946777, "epoch": 0.32009883753580054, "grad_norm": 1.0546875, "learning_rate": 0.0004995103259430569, "loss": 5.841, "mean_token_accuracy": 0.16827336698770523, "num_tokens": 6377753.0, "step": 2850 }, { "entropy": 5.839739036560059, "epoch": 0.3206604144437581, "grad_norm": 1.078125, "learning_rate": 0.0004995076750115258, "loss": 5.8514, "mean_token_accuracy": 0.15937740802764894, "num_tokens": 6388613.0, "step": 2855 }, { "entropy": 5.815576601028442, "epoch": 0.32122199135171564, "grad_norm": 1.078125, "learning_rate": 0.0004995050169315832, "loss": 5.796, "mean_token_accuracy": 0.1593346953392029, "num_tokens": 6399415.0, "step": 2860 }, { "entropy": 5.867472791671753, "epoch": 0.32178356825967314, "grad_norm": 1.0234375, "learning_rate": 0.0004995023517033138, "loss": 5.8285, "mean_token_accuracy": 0.15754698514938353, "num_tokens": 6411435.0, "step": 2865 }, { "entropy": 5.926137781143188, "epoch": 0.3223451451676307, "grad_norm": 1.0703125, "learning_rate": 0.0004994996793268024, "loss": 5.976, "mean_token_accuracy": 0.15850219279527664, "num_tokens": 6423030.0, "step": 2870 }, { "entropy": 5.888271427154541, "epoch": 0.32290672207558824, "grad_norm": 1.0390625, "learning_rate": 0.0004994969998021342, "loss": 5.7765, "mean_token_accuracy": 0.16209373772144317, "num_tokens": 6434330.0, "step": 2875 }, { "entropy": 5.859491014480591, "epoch": 0.3234682989835458, "grad_norm": 1.03125, "learning_rate": 0.0004994943131293944, "loss": 5.8646, "mean_token_accuracy": 0.16070864647626876, "num_tokens": 6446452.0, "step": 2880 }, { "entropy": 5.8355710983276365, "epoch": 0.32402987589150334, "grad_norm": 1.0703125, "learning_rate": 0.0004994916193086687, "loss": 5.8139, "mean_token_accuracy": 0.1690973237156868, "num_tokens": 6456723.0, "step": 2885 }, { "entropy": 5.899684286117553, "epoch": 0.3245914527994609, "grad_norm": 1.1328125, "learning_rate": 0.0004994889183400428, "loss": 5.9365, "mean_token_accuracy": 0.15811522603034972, "num_tokens": 6468117.0, "step": 2890 }, { "entropy": 5.826454973220825, "epoch": 0.32515302970741844, "grad_norm": 1.125, "learning_rate": 0.0004994862102236025, "loss": 5.7204, "mean_token_accuracy": 0.16832807213068007, "num_tokens": 6479465.0, "step": 2895 }, { "entropy": 5.89757194519043, "epoch": 0.325714606615376, "grad_norm": 1.1796875, "learning_rate": 0.0004994834949594342, "loss": 5.9526, "mean_token_accuracy": 0.1629941999912262, "num_tokens": 6490868.0, "step": 2900 }, { "entropy": 5.972553682327271, "epoch": 0.32627618352333354, "grad_norm": 1.0703125, "learning_rate": 0.0004994807725476246, "loss": 5.8245, "mean_token_accuracy": 0.16008032113313675, "num_tokens": 6502126.0, "step": 2905 }, { "entropy": 5.72076644897461, "epoch": 0.3268377604312911, "grad_norm": 1.0, "learning_rate": 0.0004994780429882599, "loss": 5.9091, "mean_token_accuracy": 0.15670095086097718, "num_tokens": 6514382.0, "step": 2910 }, { "entropy": 5.882012605667114, "epoch": 0.3273993373392486, "grad_norm": 0.9765625, "learning_rate": 0.0004994753062814274, "loss": 5.7914, "mean_token_accuracy": 0.15964423269033431, "num_tokens": 6526272.0, "step": 2915 }, { "entropy": 5.866258335113526, "epoch": 0.32796091424720614, "grad_norm": 1.0, "learning_rate": 0.0004994725624272139, "loss": 5.8134, "mean_token_accuracy": 0.16369341611862182, "num_tokens": 6537511.0, "step": 2920 }, { "entropy": 5.805434799194336, "epoch": 0.3285224911551637, "grad_norm": 1.0703125, "learning_rate": 0.0004994698114257071, "loss": 5.7523, "mean_token_accuracy": 0.16356185525655748, "num_tokens": 6549737.0, "step": 2925 }, { "entropy": 5.735032749176026, "epoch": 0.32908406806312124, "grad_norm": 1.2109375, "learning_rate": 0.0004994670532769944, "loss": 5.842, "mean_token_accuracy": 0.16296304613351822, "num_tokens": 6560318.0, "step": 2930 }, { "entropy": 5.818574094772339, "epoch": 0.3296456449710788, "grad_norm": 1.125, "learning_rate": 0.0004994642879811637, "loss": 5.7497, "mean_token_accuracy": 0.16560823023319243, "num_tokens": 6570575.0, "step": 2935 }, { "entropy": 5.807329988479614, "epoch": 0.33020722187903634, "grad_norm": 1.0703125, "learning_rate": 0.000499461515538303, "loss": 5.8172, "mean_token_accuracy": 0.1601566642522812, "num_tokens": 6582083.0, "step": 2940 }, { "entropy": 6.00074577331543, "epoch": 0.3307687987869939, "grad_norm": 1.109375, "learning_rate": 0.0004994587359485006, "loss": 5.9414, "mean_token_accuracy": 0.16097475886344909, "num_tokens": 6592240.0, "step": 2945 }, { "entropy": 5.806456136703491, "epoch": 0.33133037569495144, "grad_norm": 1.046875, "learning_rate": 0.000499455949211845, "loss": 5.7185, "mean_token_accuracy": 0.1677255555987358, "num_tokens": 6602680.0, "step": 2950 }, { "entropy": 5.796722078323365, "epoch": 0.331891952602909, "grad_norm": 1.078125, "learning_rate": 0.0004994531553284248, "loss": 5.8381, "mean_token_accuracy": 0.16280671954154968, "num_tokens": 6613399.0, "step": 2955 }, { "entropy": 5.918023681640625, "epoch": 0.3324535295108665, "grad_norm": 1.046875, "learning_rate": 0.0004994503542983293, "loss": 5.91, "mean_token_accuracy": 0.15692875981330873, "num_tokens": 6624410.0, "step": 2960 }, { "entropy": 5.893260526657104, "epoch": 0.33301510641882404, "grad_norm": 1.15625, "learning_rate": 0.0004994475461216472, "loss": 5.7623, "mean_token_accuracy": 0.1689491778612137, "num_tokens": 6635523.0, "step": 2965 }, { "entropy": 5.8270707607269285, "epoch": 0.3335766833267816, "grad_norm": 1.2109375, "learning_rate": 0.0004994447307984684, "loss": 5.9249, "mean_token_accuracy": 0.1531895712018013, "num_tokens": 6648416.0, "step": 2970 }, { "entropy": 5.764549970626831, "epoch": 0.33413826023473914, "grad_norm": 1.0390625, "learning_rate": 0.0004994419083288823, "loss": 5.7112, "mean_token_accuracy": 0.16065409630537034, "num_tokens": 6658907.0, "step": 2975 }, { "entropy": 5.840141725540161, "epoch": 0.3346998371426967, "grad_norm": 1.125, "learning_rate": 0.0004994390787129787, "loss": 5.8754, "mean_token_accuracy": 0.1610553666949272, "num_tokens": 6669682.0, "step": 2980 }, { "entropy": 5.9260087490081785, "epoch": 0.33526141405065424, "grad_norm": 1.109375, "learning_rate": 0.0004994362419508478, "loss": 5.9334, "mean_token_accuracy": 0.1567075252532959, "num_tokens": 6681919.0, "step": 2985 }, { "entropy": 5.9462815284729, "epoch": 0.3358229909586118, "grad_norm": 0.9921875, "learning_rate": 0.00049943339804258, "loss": 5.8707, "mean_token_accuracy": 0.1613776594400406, "num_tokens": 6693988.0, "step": 2990 }, { "entropy": 5.7616931915283205, "epoch": 0.33638456786656934, "grad_norm": 1.2578125, "learning_rate": 0.0004994305469882657, "loss": 5.8059, "mean_token_accuracy": 0.15830975472927095, "num_tokens": 6705413.0, "step": 2995 }, { "entropy": 5.859702157974243, "epoch": 0.3369461447745269, "grad_norm": 1.0546875, "learning_rate": 0.0004994276887879957, "loss": 5.763, "mean_token_accuracy": 0.16223098933696747, "num_tokens": 6716217.0, "step": 3000 }, { "epoch": 0.3369461447745269, "eval_entropy": 5.720634406333059, "eval_loss": 5.844816207885742, "eval_mean_token_accuracy": 0.1682441681402459, "eval_num_tokens": 6716217.0, "eval_runtime": 23.7412, "eval_samples_per_second": 1306.296, "eval_steps_per_second": 163.303, "step": 3000 } ], "logging_steps": 5, "max_steps": 89030, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.0538862999552e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }