{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.27213352685050796, "eval_steps": 3000, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.69149408340454, "epoch": 0.00045355587808418, "grad_norm": 13.0625, "learning_rate": 2e-06, "loss": 10.7699, "mean_token_accuracy": 0.0, "num_tokens": 9661.0, "step": 5 }, { "entropy": 10.691533756256103, "epoch": 0.00090711175616836, "grad_norm": 12.8125, "learning_rate": 4.5e-06, "loss": 10.7409, "mean_token_accuracy": 0.00011574074160307646, "num_tokens": 21028.0, "step": 10 }, { "entropy": 10.691256523132324, "epoch": 0.00136066763425254, "grad_norm": 9.6875, "learning_rate": 7e-06, "loss": 10.4719, "mean_token_accuracy": 0.019357142923399805, "num_tokens": 31794.0, "step": 15 }, { "entropy": 10.684057140350342, "epoch": 0.00181422351233672, "grad_norm": 5.8125, "learning_rate": 9.5e-06, "loss": 10.1776, "mean_token_accuracy": 0.04135416336357593, "num_tokens": 42892.0, "step": 20 }, { "entropy": 10.636651706695556, "epoch": 0.0022677793904208998, "grad_norm": 4.125, "learning_rate": 1.2e-05, "loss": 9.8988, "mean_token_accuracy": 0.04433486089110374, "num_tokens": 53015.0, "step": 25 }, { "entropy": 10.585999393463135, "epoch": 0.00272133526850508, "grad_norm": 3.15625, "learning_rate": 1.4500000000000002e-05, "loss": 9.7643, "mean_token_accuracy": 0.04109931848943234, "num_tokens": 63334.0, "step": 30 }, { "entropy": 10.606278038024902, "epoch": 0.00317489114658926, "grad_norm": 2.8125, "learning_rate": 1.7000000000000003e-05, "loss": 9.6589, "mean_token_accuracy": 0.04485522694885731, "num_tokens": 74256.0, "step": 35 }, { "entropy": 10.576828956604004, "epoch": 0.00362844702467344, "grad_norm": 2.734375, "learning_rate": 1.95e-05, "loss": 9.6182, "mean_token_accuracy": 0.046111271157860755, "num_tokens": 84699.0, "step": 40 }, { "entropy": 10.563911628723144, "epoch": 0.00408200290275762, "grad_norm": 2.46875, "learning_rate": 2.2e-05, "loss": 9.581, "mean_token_accuracy": 0.04264976643025875, "num_tokens": 95178.0, "step": 45 }, { "entropy": 10.59095401763916, "epoch": 0.0045355587808417995, "grad_norm": 2.3125, "learning_rate": 2.4500000000000003e-05, "loss": 9.5471, "mean_token_accuracy": 0.04867156893014908, "num_tokens": 105438.0, "step": 50 }, { "entropy": 10.587072944641113, "epoch": 0.00498911465892598, "grad_norm": 2.46875, "learning_rate": 2.7e-05, "loss": 9.4759, "mean_token_accuracy": 0.0453902505338192, "num_tokens": 115518.0, "step": 55 }, { "entropy": 10.536315631866454, "epoch": 0.00544267053701016, "grad_norm": 2.4375, "learning_rate": 2.95e-05, "loss": 9.377, "mean_token_accuracy": 0.053391102328896524, "num_tokens": 125636.0, "step": 60 }, { "entropy": 10.496469593048095, "epoch": 0.00589622641509434, "grad_norm": 2.515625, "learning_rate": 3.2e-05, "loss": 9.3108, "mean_token_accuracy": 0.06191379800438881, "num_tokens": 135990.0, "step": 65 }, { "entropy": 10.413052368164063, "epoch": 0.00634978229317852, "grad_norm": 2.328125, "learning_rate": 3.4500000000000005e-05, "loss": 9.2425, "mean_token_accuracy": 0.0613830640912056, "num_tokens": 146069.0, "step": 70 }, { "entropy": 10.440055561065673, "epoch": 0.006803338171262699, "grad_norm": 2.265625, "learning_rate": 3.7e-05, "loss": 9.1547, "mean_token_accuracy": 0.07091366611421109, "num_tokens": 156335.0, "step": 75 }, { "entropy": 10.438591575622558, "epoch": 0.00725689404934688, "grad_norm": 2.4375, "learning_rate": 3.95e-05, "loss": 9.0463, "mean_token_accuracy": 0.06796186193823814, "num_tokens": 166214.0, "step": 80 }, { "entropy": 10.390478229522705, "epoch": 0.007710449927431059, "grad_norm": 3.015625, "learning_rate": 4.2000000000000004e-05, "loss": 8.9608, "mean_token_accuracy": 0.06832841411232948, "num_tokens": 177010.0, "step": 85 }, { "entropy": 10.332666969299316, "epoch": 0.00816400580551524, "grad_norm": 2.671875, "learning_rate": 4.45e-05, "loss": 8.7359, "mean_token_accuracy": 0.07582402378320693, "num_tokens": 187829.0, "step": 90 }, { "entropy": 10.192521572113037, "epoch": 0.00861756168359942, "grad_norm": 2.609375, "learning_rate": 4.7000000000000004e-05, "loss": 8.6972, "mean_token_accuracy": 0.0755643829703331, "num_tokens": 198107.0, "step": 95 }, { "entropy": 10.20487937927246, "epoch": 0.009071117561683599, "grad_norm": 2.15625, "learning_rate": 4.9500000000000004e-05, "loss": 8.5722, "mean_token_accuracy": 0.07500871792435646, "num_tokens": 208607.0, "step": 100 }, { "entropy": 10.160844707489014, "epoch": 0.009524673439767779, "grad_norm": 2.296875, "learning_rate": 5.2e-05, "loss": 8.5622, "mean_token_accuracy": 0.07453125491738319, "num_tokens": 219899.0, "step": 105 }, { "entropy": 10.124257946014405, "epoch": 0.00997822931785196, "grad_norm": 1.890625, "learning_rate": 5.45e-05, "loss": 8.4797, "mean_token_accuracy": 0.07378747165203095, "num_tokens": 230625.0, "step": 110 }, { "entropy": 10.023534488677978, "epoch": 0.01043178519593614, "grad_norm": 2.03125, "learning_rate": 5.7e-05, "loss": 8.332, "mean_token_accuracy": 0.08365851938724518, "num_tokens": 241156.0, "step": 115 }, { "entropy": 9.936892032623291, "epoch": 0.01088534107402032, "grad_norm": 1.8828125, "learning_rate": 5.9499999999999996e-05, "loss": 8.1824, "mean_token_accuracy": 0.08069921731948852, "num_tokens": 252297.0, "step": 120 }, { "entropy": 9.793073558807373, "epoch": 0.011338896952104499, "grad_norm": 1.5390625, "learning_rate": 6.2e-05, "loss": 8.1575, "mean_token_accuracy": 0.07586940303444863, "num_tokens": 263188.0, "step": 125 }, { "entropy": 9.714948558807373, "epoch": 0.01179245283018868, "grad_norm": 1.6171875, "learning_rate": 6.450000000000001e-05, "loss": 7.9988, "mean_token_accuracy": 0.07976540848612786, "num_tokens": 274064.0, "step": 130 }, { "entropy": 9.50658073425293, "epoch": 0.01224600870827286, "grad_norm": 1.90625, "learning_rate": 6.7e-05, "loss": 7.8083, "mean_token_accuracy": 0.08558063134551049, "num_tokens": 283736.0, "step": 135 }, { "entropy": 9.259089279174805, "epoch": 0.01269956458635704, "grad_norm": 1.640625, "learning_rate": 6.950000000000001e-05, "loss": 7.7077, "mean_token_accuracy": 0.08600766956806183, "num_tokens": 294473.0, "step": 140 }, { "entropy": 9.041689109802245, "epoch": 0.013153120464441219, "grad_norm": 1.390625, "learning_rate": 7.2e-05, "loss": 7.6574, "mean_token_accuracy": 0.08418083190917969, "num_tokens": 303849.0, "step": 145 }, { "entropy": 8.879548072814941, "epoch": 0.013606676342525399, "grad_norm": 1.6015625, "learning_rate": 7.45e-05, "loss": 7.5414, "mean_token_accuracy": 0.08226052820682525, "num_tokens": 314521.0, "step": 150 }, { "entropy": 8.658054065704345, "epoch": 0.01406023222060958, "grad_norm": 1.46875, "learning_rate": 7.7e-05, "loss": 7.4964, "mean_token_accuracy": 0.08540133312344551, "num_tokens": 325210.0, "step": 155 }, { "entropy": 8.465118217468262, "epoch": 0.01451378809869376, "grad_norm": 1.4140625, "learning_rate": 7.950000000000001e-05, "loss": 7.4289, "mean_token_accuracy": 0.0857605628669262, "num_tokens": 335035.0, "step": 160 }, { "entropy": 8.27260684967041, "epoch": 0.014967343976777939, "grad_norm": 1.3515625, "learning_rate": 8.2e-05, "loss": 7.4279, "mean_token_accuracy": 0.08624853491783142, "num_tokens": 345402.0, "step": 165 }, { "entropy": 8.192702579498292, "epoch": 0.015420899854862119, "grad_norm": 1.3125, "learning_rate": 8.450000000000001e-05, "loss": 7.3865, "mean_token_accuracy": 0.0875001959502697, "num_tokens": 356161.0, "step": 170 }, { "entropy": 8.096983528137207, "epoch": 0.0158744557329463, "grad_norm": 1.5078125, "learning_rate": 8.7e-05, "loss": 7.3087, "mean_token_accuracy": 0.08894997537136078, "num_tokens": 366695.0, "step": 175 }, { "entropy": 8.000302648544311, "epoch": 0.01632801161103048, "grad_norm": 1.3515625, "learning_rate": 8.95e-05, "loss": 7.2459, "mean_token_accuracy": 0.08826502189040183, "num_tokens": 376354.0, "step": 180 }, { "entropy": 7.892614269256592, "epoch": 0.01678156748911466, "grad_norm": 1.28125, "learning_rate": 9.2e-05, "loss": 7.2853, "mean_token_accuracy": 0.08936820179224014, "num_tokens": 387468.0, "step": 185 }, { "entropy": 7.8675158500671385, "epoch": 0.01723512336719884, "grad_norm": 1.1875, "learning_rate": 9.45e-05, "loss": 7.2366, "mean_token_accuracy": 0.08572344705462456, "num_tokens": 397658.0, "step": 190 }, { "entropy": 7.800578165054321, "epoch": 0.01768867924528302, "grad_norm": 1.2109375, "learning_rate": 9.7e-05, "loss": 7.2295, "mean_token_accuracy": 0.08996806442737579, "num_tokens": 408009.0, "step": 195 }, { "entropy": 7.81451735496521, "epoch": 0.018142235123367198, "grad_norm": 1.8515625, "learning_rate": 9.95e-05, "loss": 7.1252, "mean_token_accuracy": 0.09177512675523758, "num_tokens": 417781.0, "step": 200 }, { "entropy": 7.679977512359619, "epoch": 0.018595791001451378, "grad_norm": 1.7421875, "learning_rate": 0.000102, "loss": 7.3176, "mean_token_accuracy": 0.08960338979959488, "num_tokens": 428009.0, "step": 205 }, { "entropy": 7.7656045913696286, "epoch": 0.019049346879535557, "grad_norm": 1.3046875, "learning_rate": 0.00010449999999999999, "loss": 7.1482, "mean_token_accuracy": 0.0907668188214302, "num_tokens": 438369.0, "step": 210 }, { "entropy": 7.7085036277771, "epoch": 0.01950290275761974, "grad_norm": 1.421875, "learning_rate": 0.000107, "loss": 7.1341, "mean_token_accuracy": 0.09216333702206611, "num_tokens": 449047.0, "step": 215 }, { "entropy": 7.61162919998169, "epoch": 0.01995645863570392, "grad_norm": 1.1796875, "learning_rate": 0.0001095, "loss": 7.1272, "mean_token_accuracy": 0.093924118578434, "num_tokens": 459992.0, "step": 220 }, { "entropy": 7.708517932891846, "epoch": 0.0204100145137881, "grad_norm": 1.3359375, "learning_rate": 0.000112, "loss": 7.207, "mean_token_accuracy": 0.09182708933949471, "num_tokens": 470542.0, "step": 225 }, { "entropy": 7.576424551010132, "epoch": 0.02086357039187228, "grad_norm": 1.2265625, "learning_rate": 0.0001145, "loss": 7.1577, "mean_token_accuracy": 0.09969761073589326, "num_tokens": 479983.0, "step": 230 }, { "entropy": 7.695700073242188, "epoch": 0.02131712626995646, "grad_norm": 1.2578125, "learning_rate": 0.00011700000000000001, "loss": 7.1299, "mean_token_accuracy": 0.09077642261981964, "num_tokens": 489827.0, "step": 235 }, { "entropy": 7.514981985092163, "epoch": 0.02177068214804064, "grad_norm": 1.1484375, "learning_rate": 0.00011949999999999999, "loss": 7.1267, "mean_token_accuracy": 0.08924711495637894, "num_tokens": 500257.0, "step": 240 }, { "entropy": 7.638169956207276, "epoch": 0.022224238026124818, "grad_norm": 1.2890625, "learning_rate": 0.000122, "loss": 7.1507, "mean_token_accuracy": 0.08717882186174393, "num_tokens": 510227.0, "step": 245 }, { "entropy": 7.506703805923462, "epoch": 0.022677793904208998, "grad_norm": 1.140625, "learning_rate": 0.0001245, "loss": 7.0492, "mean_token_accuracy": 0.0963970109820366, "num_tokens": 520442.0, "step": 250 }, { "entropy": 7.448557662963867, "epoch": 0.023131349782293177, "grad_norm": 1.2890625, "learning_rate": 0.000127, "loss": 7.0689, "mean_token_accuracy": 0.0880157247185707, "num_tokens": 531075.0, "step": 255 }, { "entropy": 7.53116626739502, "epoch": 0.02358490566037736, "grad_norm": 1.171875, "learning_rate": 0.0001295, "loss": 7.1308, "mean_token_accuracy": 0.08964502289891244, "num_tokens": 542576.0, "step": 260 }, { "entropy": 7.471751165390015, "epoch": 0.02403846153846154, "grad_norm": 1.171875, "learning_rate": 0.000132, "loss": 7.0485, "mean_token_accuracy": 0.09242086634039878, "num_tokens": 552380.0, "step": 265 }, { "entropy": 7.469887447357178, "epoch": 0.02449201741654572, "grad_norm": 1.28125, "learning_rate": 0.00013450000000000002, "loss": 7.0608, "mean_token_accuracy": 0.08920432329177856, "num_tokens": 563310.0, "step": 270 }, { "entropy": 7.405267572402954, "epoch": 0.0249455732946299, "grad_norm": 1.1796875, "learning_rate": 0.00013700000000000002, "loss": 6.9664, "mean_token_accuracy": 0.09448141977190971, "num_tokens": 574113.0, "step": 275 }, { "entropy": 7.440743923187256, "epoch": 0.02539912917271408, "grad_norm": 1.2265625, "learning_rate": 0.0001395, "loss": 6.9802, "mean_token_accuracy": 0.09543166309595108, "num_tokens": 585198.0, "step": 280 }, { "entropy": 7.435253047943116, "epoch": 0.025852685050798258, "grad_norm": 1.3125, "learning_rate": 0.00014199999999999998, "loss": 6.9734, "mean_token_accuracy": 0.0946137085556984, "num_tokens": 594837.0, "step": 285 }, { "entropy": 7.340703868865967, "epoch": 0.026306240928882438, "grad_norm": 1.2578125, "learning_rate": 0.0001445, "loss": 7.0063, "mean_token_accuracy": 0.09453380405902863, "num_tokens": 604000.0, "step": 290 }, { "entropy": 7.364510869979858, "epoch": 0.026759796806966617, "grad_norm": 1.203125, "learning_rate": 0.000147, "loss": 7.0165, "mean_token_accuracy": 0.09476850554347038, "num_tokens": 614831.0, "step": 295 }, { "entropy": 7.43275899887085, "epoch": 0.027213352685050797, "grad_norm": 1.3046875, "learning_rate": 0.0001495, "loss": 7.0328, "mean_token_accuracy": 0.09851854294538498, "num_tokens": 625584.0, "step": 300 }, { "entropy": 7.33774585723877, "epoch": 0.027666908563134977, "grad_norm": 1.328125, "learning_rate": 0.000152, "loss": 6.9117, "mean_token_accuracy": 0.09698478281497955, "num_tokens": 636282.0, "step": 305 }, { "entropy": 7.42357873916626, "epoch": 0.02812046444121916, "grad_norm": 1.4140625, "learning_rate": 0.00015450000000000001, "loss": 7.0307, "mean_token_accuracy": 0.09482022523880004, "num_tokens": 646556.0, "step": 310 }, { "entropy": 7.372399139404297, "epoch": 0.02857402031930334, "grad_norm": 1.328125, "learning_rate": 0.000157, "loss": 6.9899, "mean_token_accuracy": 0.09617659002542496, "num_tokens": 656983.0, "step": 315 }, { "entropy": 7.231950092315674, "epoch": 0.02902757619738752, "grad_norm": 1.1328125, "learning_rate": 0.0001595, "loss": 6.9155, "mean_token_accuracy": 0.1019688904285431, "num_tokens": 668148.0, "step": 320 }, { "entropy": 7.4007758617401125, "epoch": 0.0294811320754717, "grad_norm": 1.2578125, "learning_rate": 0.000162, "loss": 7.0107, "mean_token_accuracy": 0.09772700667381287, "num_tokens": 677400.0, "step": 325 }, { "entropy": 7.2482020378112795, "epoch": 0.029934687953555878, "grad_norm": 1.1328125, "learning_rate": 0.00016450000000000001, "loss": 6.896, "mean_token_accuracy": 0.09065234810113906, "num_tokens": 687519.0, "step": 330 }, { "entropy": 7.264542865753174, "epoch": 0.030388243831640058, "grad_norm": 1.2265625, "learning_rate": 0.00016700000000000002, "loss": 6.8005, "mean_token_accuracy": 0.10230840593576432, "num_tokens": 698402.0, "step": 335 }, { "entropy": 7.134629440307617, "epoch": 0.030841799709724237, "grad_norm": 1.078125, "learning_rate": 0.00016950000000000003, "loss": 6.8627, "mean_token_accuracy": 0.10249442160129547, "num_tokens": 710628.0, "step": 340 }, { "entropy": 7.336190032958984, "epoch": 0.03129535558780842, "grad_norm": 1.359375, "learning_rate": 0.00017199999999999998, "loss": 6.9194, "mean_token_accuracy": 0.09371023699641227, "num_tokens": 720511.0, "step": 345 }, { "entropy": 7.196484518051148, "epoch": 0.0317489114658926, "grad_norm": 1.28125, "learning_rate": 0.00017449999999999999, "loss": 6.9486, "mean_token_accuracy": 0.10238764733076096, "num_tokens": 731357.0, "step": 350 }, { "entropy": 7.2075560092926025, "epoch": 0.032202467343976776, "grad_norm": 1.5625, "learning_rate": 0.000177, "loss": 6.8483, "mean_token_accuracy": 0.1011496514081955, "num_tokens": 741569.0, "step": 355 }, { "entropy": 7.342852926254272, "epoch": 0.03265602322206096, "grad_norm": 1.3203125, "learning_rate": 0.0001795, "loss": 6.8818, "mean_token_accuracy": 0.09690657183527947, "num_tokens": 751194.0, "step": 360 }, { "entropy": 7.139012861251831, "epoch": 0.033109579100145135, "grad_norm": 1.2109375, "learning_rate": 0.000182, "loss": 6.8674, "mean_token_accuracy": 0.0964200034737587, "num_tokens": 762554.0, "step": 365 }, { "entropy": 7.168058109283447, "epoch": 0.03356313497822932, "grad_norm": 1.203125, "learning_rate": 0.0001845, "loss": 6.7947, "mean_token_accuracy": 0.1081994466483593, "num_tokens": 772819.0, "step": 370 }, { "entropy": 7.116481113433838, "epoch": 0.034016690856313495, "grad_norm": 1.3203125, "learning_rate": 0.000187, "loss": 6.8457, "mean_token_accuracy": 0.09905849322676659, "num_tokens": 782717.0, "step": 375 }, { "entropy": 7.275808191299438, "epoch": 0.03447024673439768, "grad_norm": 1.296875, "learning_rate": 0.0001895, "loss": 6.9231, "mean_token_accuracy": 0.10113033130764962, "num_tokens": 792523.0, "step": 380 }, { "entropy": 7.136093997955323, "epoch": 0.03492380261248186, "grad_norm": 1.2421875, "learning_rate": 0.000192, "loss": 6.852, "mean_token_accuracy": 0.10536141693592072, "num_tokens": 802696.0, "step": 385 }, { "entropy": 7.199086666107178, "epoch": 0.03537735849056604, "grad_norm": 1.1484375, "learning_rate": 0.0001945, "loss": 6.8945, "mean_token_accuracy": 0.09893356338143348, "num_tokens": 813041.0, "step": 390 }, { "entropy": 7.261086368560791, "epoch": 0.03583091436865022, "grad_norm": 1.171875, "learning_rate": 0.00019700000000000002, "loss": 6.8549, "mean_token_accuracy": 0.09995201453566552, "num_tokens": 823366.0, "step": 395 }, { "entropy": 7.149146509170532, "epoch": 0.036284470246734396, "grad_norm": 1.1015625, "learning_rate": 0.00019950000000000002, "loss": 6.8201, "mean_token_accuracy": 0.100285005569458, "num_tokens": 835455.0, "step": 400 }, { "entropy": 7.098216772079468, "epoch": 0.03673802612481858, "grad_norm": 1.2578125, "learning_rate": 0.000202, "loss": 6.8581, "mean_token_accuracy": 0.10088052004575729, "num_tokens": 846190.0, "step": 405 }, { "entropy": 7.215963459014892, "epoch": 0.037191582002902755, "grad_norm": 1.4453125, "learning_rate": 0.00020449999999999998, "loss": 6.8161, "mean_token_accuracy": 0.10391620472073555, "num_tokens": 856303.0, "step": 410 }, { "entropy": 7.0431232929229735, "epoch": 0.03764513788098694, "grad_norm": 1.203125, "learning_rate": 0.000207, "loss": 6.7939, "mean_token_accuracy": 0.09926707297563553, "num_tokens": 866240.0, "step": 415 }, { "entropy": 7.138209819793701, "epoch": 0.038098693759071114, "grad_norm": 1.0078125, "learning_rate": 0.0002095, "loss": 6.9358, "mean_token_accuracy": 0.09860606789588929, "num_tokens": 877035.0, "step": 420 }, { "entropy": 7.092493534088135, "epoch": 0.0385522496371553, "grad_norm": 1.4296875, "learning_rate": 0.000212, "loss": 6.8158, "mean_token_accuracy": 0.09759353399276734, "num_tokens": 887344.0, "step": 425 }, { "entropy": 7.141839790344238, "epoch": 0.03900580551523948, "grad_norm": 1.140625, "learning_rate": 0.0002145, "loss": 6.8314, "mean_token_accuracy": 0.10464526489377021, "num_tokens": 897271.0, "step": 430 }, { "entropy": 7.065910148620605, "epoch": 0.03945936139332366, "grad_norm": 1.1171875, "learning_rate": 0.00021700000000000002, "loss": 6.7285, "mean_token_accuracy": 0.1087069682776928, "num_tokens": 908700.0, "step": 435 }, { "entropy": 6.984343385696411, "epoch": 0.03991291727140784, "grad_norm": 1.0703125, "learning_rate": 0.0002195, "loss": 6.7459, "mean_token_accuracy": 0.10460741296410561, "num_tokens": 918980.0, "step": 440 }, { "entropy": 7.071007776260376, "epoch": 0.040366473149492016, "grad_norm": 1.25, "learning_rate": 0.000222, "loss": 6.7444, "mean_token_accuracy": 0.10659246519207954, "num_tokens": 928616.0, "step": 445 }, { "entropy": 7.033933305740357, "epoch": 0.0408200290275762, "grad_norm": 1.0859375, "learning_rate": 0.0002245, "loss": 6.897, "mean_token_accuracy": 0.10052595734596252, "num_tokens": 939066.0, "step": 450 }, { "entropy": 7.086242055892944, "epoch": 0.041273584905660375, "grad_norm": 1.765625, "learning_rate": 0.00022700000000000002, "loss": 6.7852, "mean_token_accuracy": 0.1003576584160328, "num_tokens": 949160.0, "step": 455 }, { "entropy": 7.0361896514892575, "epoch": 0.04172714078374456, "grad_norm": 1.2265625, "learning_rate": 0.00022950000000000002, "loss": 6.8063, "mean_token_accuracy": 0.10417447835206986, "num_tokens": 959959.0, "step": 460 }, { "entropy": 7.061341714859009, "epoch": 0.042180696661828734, "grad_norm": 1.2578125, "learning_rate": 0.00023200000000000003, "loss": 6.8092, "mean_token_accuracy": 0.10948210060596467, "num_tokens": 969752.0, "step": 465 }, { "entropy": 6.854967498779297, "epoch": 0.04263425253991292, "grad_norm": 1.25, "learning_rate": 0.00023449999999999998, "loss": 6.8149, "mean_token_accuracy": 0.10138045027852058, "num_tokens": 979917.0, "step": 470 }, { "entropy": 7.039763593673706, "epoch": 0.0430878084179971, "grad_norm": 1.234375, "learning_rate": 0.000237, "loss": 6.8134, "mean_token_accuracy": 0.09902644529938698, "num_tokens": 990613.0, "step": 475 }, { "entropy": 7.048016119003296, "epoch": 0.04354136429608128, "grad_norm": 1.53125, "learning_rate": 0.0002395, "loss": 6.8134, "mean_token_accuracy": 0.10063022077083587, "num_tokens": 1000753.0, "step": 480 }, { "entropy": 6.978139591217041, "epoch": 0.04399492017416546, "grad_norm": 1.0703125, "learning_rate": 0.000242, "loss": 6.7445, "mean_token_accuracy": 0.10282852351665497, "num_tokens": 1012141.0, "step": 485 }, { "entropy": 7.031801795959472, "epoch": 0.044448476052249636, "grad_norm": 1.015625, "learning_rate": 0.0002445, "loss": 6.7459, "mean_token_accuracy": 0.10179351791739463, "num_tokens": 1023322.0, "step": 490 }, { "entropy": 6.850466966629028, "epoch": 0.04490203193033382, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 6.6463, "mean_token_accuracy": 0.09672334268689156, "num_tokens": 1033949.0, "step": 495 }, { "entropy": 6.988512468338013, "epoch": 0.045355587808417995, "grad_norm": 1.171875, "learning_rate": 0.0002495, "loss": 6.7366, "mean_token_accuracy": 0.10716779977083206, "num_tokens": 1043580.0, "step": 500 }, { "entropy": 6.902674722671509, "epoch": 0.04580914368650218, "grad_norm": 1.296875, "learning_rate": 0.000252, "loss": 6.656, "mean_token_accuracy": 0.11081461235880852, "num_tokens": 1052106.0, "step": 505 }, { "entropy": 6.90415506362915, "epoch": 0.046262699564586354, "grad_norm": 1.4453125, "learning_rate": 0.0002545, "loss": 6.6971, "mean_token_accuracy": 0.1064011238515377, "num_tokens": 1061764.0, "step": 510 }, { "entropy": 6.838364171981811, "epoch": 0.04671625544267054, "grad_norm": 1.2890625, "learning_rate": 0.000257, "loss": 6.5697, "mean_token_accuracy": 0.10854723304510117, "num_tokens": 1071164.0, "step": 515 }, { "entropy": 6.968482303619385, "epoch": 0.04716981132075472, "grad_norm": 1.140625, "learning_rate": 0.0002595, "loss": 6.8149, "mean_token_accuracy": 0.10352605357766151, "num_tokens": 1082602.0, "step": 520 }, { "entropy": 6.9721253395080565, "epoch": 0.047623367198838897, "grad_norm": 1.3515625, "learning_rate": 0.000262, "loss": 6.7378, "mean_token_accuracy": 0.1052236057817936, "num_tokens": 1091871.0, "step": 525 }, { "entropy": 6.919319772720337, "epoch": 0.04807692307692308, "grad_norm": 1.203125, "learning_rate": 0.00026450000000000003, "loss": 6.7272, "mean_token_accuracy": 0.10676647424697876, "num_tokens": 1102568.0, "step": 530 }, { "entropy": 6.941032934188843, "epoch": 0.048530478955007256, "grad_norm": 1.0859375, "learning_rate": 0.00026700000000000004, "loss": 6.6203, "mean_token_accuracy": 0.10674264281988144, "num_tokens": 1112777.0, "step": 535 }, { "entropy": 6.716324281692505, "epoch": 0.04898403483309144, "grad_norm": 1.21875, "learning_rate": 0.00026950000000000005, "loss": 6.6119, "mean_token_accuracy": 0.10510820895433426, "num_tokens": 1123809.0, "step": 540 }, { "entropy": 6.8692456722259525, "epoch": 0.049437590711175615, "grad_norm": 1.1171875, "learning_rate": 0.00027200000000000005, "loss": 6.6644, "mean_token_accuracy": 0.10762705281376839, "num_tokens": 1133793.0, "step": 545 }, { "entropy": 6.804552936553955, "epoch": 0.0498911465892598, "grad_norm": 1.0625, "learning_rate": 0.0002745, "loss": 6.5543, "mean_token_accuracy": 0.10652651414275169, "num_tokens": 1144478.0, "step": 550 }, { "entropy": 6.81122727394104, "epoch": 0.050344702467343974, "grad_norm": 1.0078125, "learning_rate": 0.000277, "loss": 6.595, "mean_token_accuracy": 0.10836011320352554, "num_tokens": 1155518.0, "step": 555 }, { "entropy": 6.848041963577271, "epoch": 0.05079825834542816, "grad_norm": 1.125, "learning_rate": 0.0002795, "loss": 6.6803, "mean_token_accuracy": 0.10240246802568435, "num_tokens": 1166494.0, "step": 560 }, { "entropy": 6.864998054504395, "epoch": 0.05125181422351233, "grad_norm": 1.015625, "learning_rate": 0.00028199999999999997, "loss": 6.6603, "mean_token_accuracy": 0.10499662458896637, "num_tokens": 1177052.0, "step": 565 }, { "entropy": 6.7566328048706055, "epoch": 0.051705370101596516, "grad_norm": 1.0, "learning_rate": 0.0002845, "loss": 6.588, "mean_token_accuracy": 0.1072057232260704, "num_tokens": 1187382.0, "step": 570 }, { "entropy": 6.84862585067749, "epoch": 0.0521589259796807, "grad_norm": 1.078125, "learning_rate": 0.000287, "loss": 6.6371, "mean_token_accuracy": 0.10280174314975739, "num_tokens": 1197535.0, "step": 575 }, { "entropy": 6.854958152770996, "epoch": 0.052612481857764876, "grad_norm": 1.0859375, "learning_rate": 0.0002895, "loss": 6.6932, "mean_token_accuracy": 0.11012415438890458, "num_tokens": 1207626.0, "step": 580 }, { "entropy": 6.8038904666900635, "epoch": 0.05306603773584906, "grad_norm": 1.15625, "learning_rate": 0.000292, "loss": 6.5812, "mean_token_accuracy": 0.10877829939126968, "num_tokens": 1218433.0, "step": 585 }, { "entropy": 6.773093318939209, "epoch": 0.053519593613933235, "grad_norm": 1.171875, "learning_rate": 0.0002945, "loss": 6.5272, "mean_token_accuracy": 0.10834594070911407, "num_tokens": 1228698.0, "step": 590 }, { "entropy": 6.839606189727784, "epoch": 0.05397314949201742, "grad_norm": 1.078125, "learning_rate": 0.000297, "loss": 6.6608, "mean_token_accuracy": 0.11245888248085975, "num_tokens": 1239278.0, "step": 595 }, { "entropy": 6.663392496109009, "epoch": 0.054426705370101594, "grad_norm": 1.2734375, "learning_rate": 0.0002995, "loss": 6.6276, "mean_token_accuracy": 0.11012510806322098, "num_tokens": 1248976.0, "step": 600 }, { "entropy": 6.770804977416992, "epoch": 0.05488026124818578, "grad_norm": 1.0703125, "learning_rate": 0.000302, "loss": 6.5805, "mean_token_accuracy": 0.11286153569817543, "num_tokens": 1259545.0, "step": 605 }, { "entropy": 6.810527324676514, "epoch": 0.05533381712626995, "grad_norm": 1.3046875, "learning_rate": 0.0003045, "loss": 6.6029, "mean_token_accuracy": 0.10805755332112313, "num_tokens": 1269444.0, "step": 610 }, { "entropy": 6.8169921875, "epoch": 0.055787373004354136, "grad_norm": 1.1796875, "learning_rate": 0.000307, "loss": 6.6931, "mean_token_accuracy": 0.10932271853089333, "num_tokens": 1279821.0, "step": 615 }, { "entropy": 6.654322671890259, "epoch": 0.05624092888243832, "grad_norm": 1.0546875, "learning_rate": 0.0003095, "loss": 6.5238, "mean_token_accuracy": 0.10867622718214989, "num_tokens": 1290398.0, "step": 620 }, { "entropy": 6.814783906936645, "epoch": 0.056694484760522496, "grad_norm": 1.2109375, "learning_rate": 0.000312, "loss": 6.6259, "mean_token_accuracy": 0.10474204868078232, "num_tokens": 1300920.0, "step": 625 }, { "entropy": 6.690603113174438, "epoch": 0.05714804063860668, "grad_norm": 1.0625, "learning_rate": 0.0003145, "loss": 6.6062, "mean_token_accuracy": 0.10462497025728226, "num_tokens": 1311928.0, "step": 630 }, { "entropy": 6.83460955619812, "epoch": 0.057601596516690855, "grad_norm": 1.21875, "learning_rate": 0.000317, "loss": 6.6113, "mean_token_accuracy": 0.10693813562393188, "num_tokens": 1322554.0, "step": 635 }, { "entropy": 6.699485635757446, "epoch": 0.05805515239477504, "grad_norm": 0.9921875, "learning_rate": 0.0003195, "loss": 6.5474, "mean_token_accuracy": 0.11296007037162781, "num_tokens": 1333195.0, "step": 640 }, { "entropy": 6.70126633644104, "epoch": 0.058508708272859214, "grad_norm": 1.046875, "learning_rate": 0.000322, "loss": 6.6557, "mean_token_accuracy": 0.10681698620319366, "num_tokens": 1343655.0, "step": 645 }, { "entropy": 6.784696960449219, "epoch": 0.0589622641509434, "grad_norm": 1.203125, "learning_rate": 0.00032450000000000003, "loss": 6.5197, "mean_token_accuracy": 0.11125476583838463, "num_tokens": 1352528.0, "step": 650 }, { "entropy": 6.562724494934082, "epoch": 0.05941582002902757, "grad_norm": 1.015625, "learning_rate": 0.00032700000000000003, "loss": 6.5629, "mean_token_accuracy": 0.11251123249530792, "num_tokens": 1363143.0, "step": 655 }, { "entropy": 6.857563257217407, "epoch": 0.059869375907111756, "grad_norm": 1.3046875, "learning_rate": 0.00032950000000000004, "loss": 6.578, "mean_token_accuracy": 0.1062569722533226, "num_tokens": 1373049.0, "step": 660 }, { "entropy": 6.634031963348389, "epoch": 0.06032293178519594, "grad_norm": 1.109375, "learning_rate": 0.00033200000000000005, "loss": 6.5634, "mean_token_accuracy": 0.11504042670130729, "num_tokens": 1384040.0, "step": 665 }, { "entropy": 6.730848979949951, "epoch": 0.060776487663280115, "grad_norm": 1.1015625, "learning_rate": 0.00033450000000000005, "loss": 6.6586, "mean_token_accuracy": 0.11258623376488686, "num_tokens": 1394511.0, "step": 670 }, { "entropy": 6.641570663452148, "epoch": 0.0612300435413643, "grad_norm": 1.1328125, "learning_rate": 0.000337, "loss": 6.4682, "mean_token_accuracy": 0.11615501791238785, "num_tokens": 1405381.0, "step": 675 }, { "entropy": 6.756093549728393, "epoch": 0.061683599419448475, "grad_norm": 1.0390625, "learning_rate": 0.0003395, "loss": 6.6404, "mean_token_accuracy": 0.11007921248674393, "num_tokens": 1415840.0, "step": 680 }, { "entropy": 6.7638633251190186, "epoch": 0.06213715529753266, "grad_norm": 1.1015625, "learning_rate": 0.000342, "loss": 6.6825, "mean_token_accuracy": 0.10886021852493286, "num_tokens": 1426634.0, "step": 685 }, { "entropy": 6.609492397308349, "epoch": 0.06259071117561683, "grad_norm": 1.125, "learning_rate": 0.00034449999999999997, "loss": 6.5622, "mean_token_accuracy": 0.11168285235762596, "num_tokens": 1436794.0, "step": 690 }, { "entropy": 6.853395700454712, "epoch": 0.06304426705370102, "grad_norm": 1.5234375, "learning_rate": 0.000347, "loss": 6.6395, "mean_token_accuracy": 0.11344821155071258, "num_tokens": 1447114.0, "step": 695 }, { "entropy": 6.582093334197998, "epoch": 0.0634978229317852, "grad_norm": 1.25, "learning_rate": 0.0003495, "loss": 6.4899, "mean_token_accuracy": 0.11673147901892662, "num_tokens": 1456494.0, "step": 700 }, { "entropy": 6.599524879455567, "epoch": 0.06395137880986937, "grad_norm": 1.171875, "learning_rate": 0.000352, "loss": 6.4935, "mean_token_accuracy": 0.11297031342983246, "num_tokens": 1466580.0, "step": 705 }, { "entropy": 6.699067687988281, "epoch": 0.06440493468795355, "grad_norm": 1.234375, "learning_rate": 0.0003545, "loss": 6.5999, "mean_token_accuracy": 0.10977515503764153, "num_tokens": 1476854.0, "step": 710 }, { "entropy": 6.683993911743164, "epoch": 0.06485849056603774, "grad_norm": 1.078125, "learning_rate": 0.000357, "loss": 6.5426, "mean_token_accuracy": 0.10898664593696594, "num_tokens": 1487133.0, "step": 715 }, { "entropy": 6.6332762241363525, "epoch": 0.06531204644412192, "grad_norm": 1.140625, "learning_rate": 0.0003595, "loss": 6.563, "mean_token_accuracy": 0.11930395513772965, "num_tokens": 1496974.0, "step": 720 }, { "entropy": 6.615490865707398, "epoch": 0.0657656023222061, "grad_norm": 1.0, "learning_rate": 0.000362, "loss": 6.5058, "mean_token_accuracy": 0.11035025268793106, "num_tokens": 1507665.0, "step": 725 }, { "entropy": 6.698334789276123, "epoch": 0.06621915820029027, "grad_norm": 1.09375, "learning_rate": 0.0003645, "loss": 6.4698, "mean_token_accuracy": 0.11344846114516258, "num_tokens": 1518625.0, "step": 730 }, { "entropy": 6.690861082077026, "epoch": 0.06667271407837445, "grad_norm": 1.0546875, "learning_rate": 0.000367, "loss": 6.608, "mean_token_accuracy": 0.10640608072280884, "num_tokens": 1529184.0, "step": 735 }, { "entropy": 6.481381893157959, "epoch": 0.06712626995645864, "grad_norm": 1.0390625, "learning_rate": 0.0003695, "loss": 6.526, "mean_token_accuracy": 0.10988623276352882, "num_tokens": 1540130.0, "step": 740 }, { "entropy": 6.694868326187134, "epoch": 0.06757982583454282, "grad_norm": 1.1328125, "learning_rate": 0.000372, "loss": 6.5181, "mean_token_accuracy": 0.11159003973007202, "num_tokens": 1550161.0, "step": 745 }, { "entropy": 6.574037361145019, "epoch": 0.06803338171262699, "grad_norm": 1.0546875, "learning_rate": 0.0003745, "loss": 6.4826, "mean_token_accuracy": 0.11772774383425713, "num_tokens": 1560076.0, "step": 750 }, { "entropy": 6.67036771774292, "epoch": 0.06848693759071117, "grad_norm": 1.140625, "learning_rate": 0.000377, "loss": 6.4693, "mean_token_accuracy": 0.11172557696700096, "num_tokens": 1570882.0, "step": 755 }, { "entropy": 6.481294822692871, "epoch": 0.06894049346879536, "grad_norm": 1.0859375, "learning_rate": 0.0003795, "loss": 6.4696, "mean_token_accuracy": 0.11403056010603904, "num_tokens": 1582227.0, "step": 760 }, { "entropy": 6.62347674369812, "epoch": 0.06939404934687954, "grad_norm": 0.99609375, "learning_rate": 0.000382, "loss": 6.5213, "mean_token_accuracy": 0.11278930827975273, "num_tokens": 1592691.0, "step": 765 }, { "entropy": 6.617785978317261, "epoch": 0.06984760522496372, "grad_norm": 1.203125, "learning_rate": 0.0003845, "loss": 6.4965, "mean_token_accuracy": 0.11648303642868996, "num_tokens": 1602258.0, "step": 770 }, { "entropy": 6.573126649856567, "epoch": 0.07030116110304789, "grad_norm": 1.2890625, "learning_rate": 0.00038700000000000003, "loss": 6.5672, "mean_token_accuracy": 0.11526603251695633, "num_tokens": 1611953.0, "step": 775 }, { "entropy": 6.6316383361816404, "epoch": 0.07075471698113207, "grad_norm": 1.1875, "learning_rate": 0.00038950000000000003, "loss": 6.5492, "mean_token_accuracy": 0.11260883659124374, "num_tokens": 1621944.0, "step": 780 }, { "entropy": 6.496122121810913, "epoch": 0.07120827285921626, "grad_norm": 1.21875, "learning_rate": 0.00039200000000000004, "loss": 6.4659, "mean_token_accuracy": 0.11800124645233154, "num_tokens": 1632702.0, "step": 785 }, { "entropy": 6.6150144100189205, "epoch": 0.07166182873730044, "grad_norm": 0.98046875, "learning_rate": 0.00039450000000000005, "loss": 6.5214, "mean_token_accuracy": 0.11103227436542511, "num_tokens": 1642622.0, "step": 790 }, { "entropy": 6.574394226074219, "epoch": 0.07211538461538461, "grad_norm": 1.1328125, "learning_rate": 0.00039700000000000005, "loss": 6.4592, "mean_token_accuracy": 0.11586317420005798, "num_tokens": 1652442.0, "step": 795 }, { "entropy": 6.473141813278199, "epoch": 0.07256894049346879, "grad_norm": 1.1171875, "learning_rate": 0.0003995, "loss": 6.4886, "mean_token_accuracy": 0.11505223363637924, "num_tokens": 1663022.0, "step": 800 }, { "entropy": 6.656652927398682, "epoch": 0.07302249637155298, "grad_norm": 1.1171875, "learning_rate": 0.000402, "loss": 6.5181, "mean_token_accuracy": 0.11541026830673218, "num_tokens": 1673825.0, "step": 805 }, { "entropy": 6.590756893157959, "epoch": 0.07347605224963716, "grad_norm": 1.25, "learning_rate": 0.0004045, "loss": 6.4718, "mean_token_accuracy": 0.11257318034768105, "num_tokens": 1683783.0, "step": 810 }, { "entropy": 6.504452848434449, "epoch": 0.07392960812772134, "grad_norm": 1.09375, "learning_rate": 0.00040699999999999997, "loss": 6.5008, "mean_token_accuracy": 0.1076662614941597, "num_tokens": 1694456.0, "step": 815 }, { "entropy": 6.454553031921387, "epoch": 0.07438316400580551, "grad_norm": 1.109375, "learning_rate": 0.0004095, "loss": 6.5053, "mean_token_accuracy": 0.11051234900951386, "num_tokens": 1706108.0, "step": 820 }, { "entropy": 6.532086324691773, "epoch": 0.0748367198838897, "grad_norm": 1.0625, "learning_rate": 0.000412, "loss": 6.3786, "mean_token_accuracy": 0.1280963383615017, "num_tokens": 1716273.0, "step": 825 }, { "entropy": 6.5029052734375, "epoch": 0.07529027576197388, "grad_norm": 0.953125, "learning_rate": 0.0004145, "loss": 6.4237, "mean_token_accuracy": 0.11734267845749854, "num_tokens": 1727271.0, "step": 830 }, { "entropy": 6.529041481018067, "epoch": 0.07574383164005806, "grad_norm": 1.0859375, "learning_rate": 0.000417, "loss": 6.4755, "mean_token_accuracy": 0.1184304565191269, "num_tokens": 1737198.0, "step": 835 }, { "entropy": 6.576714324951172, "epoch": 0.07619738751814223, "grad_norm": 1.3359375, "learning_rate": 0.0004195, "loss": 6.5197, "mean_token_accuracy": 0.11203703507781029, "num_tokens": 1747077.0, "step": 840 }, { "entropy": 6.594869232177734, "epoch": 0.07665094339622641, "grad_norm": 1.0859375, "learning_rate": 0.000422, "loss": 6.5119, "mean_token_accuracy": 0.1193366564810276, "num_tokens": 1757626.0, "step": 845 }, { "entropy": 6.527251434326172, "epoch": 0.0771044992743106, "grad_norm": 1.1484375, "learning_rate": 0.0004245, "loss": 6.5454, "mean_token_accuracy": 0.11205081716179847, "num_tokens": 1768431.0, "step": 850 }, { "entropy": 6.592037868499756, "epoch": 0.07755805515239478, "grad_norm": 1.0546875, "learning_rate": 0.000427, "loss": 6.4819, "mean_token_accuracy": 0.11357785761356354, "num_tokens": 1779071.0, "step": 855 }, { "entropy": 6.481006050109864, "epoch": 0.07801161103047896, "grad_norm": 1.1640625, "learning_rate": 0.0004295, "loss": 6.504, "mean_token_accuracy": 0.11291966959834099, "num_tokens": 1788905.0, "step": 860 }, { "entropy": 6.435082483291626, "epoch": 0.07846516690856313, "grad_norm": 1.0234375, "learning_rate": 0.000432, "loss": 6.3973, "mean_token_accuracy": 0.12037285566329955, "num_tokens": 1799003.0, "step": 865 }, { "entropy": 6.53296480178833, "epoch": 0.07891872278664731, "grad_norm": 1.0703125, "learning_rate": 0.0004345, "loss": 6.436, "mean_token_accuracy": 0.11971265748143196, "num_tokens": 1809262.0, "step": 870 }, { "entropy": 6.4183008670806885, "epoch": 0.0793722786647315, "grad_norm": 0.90625, "learning_rate": 0.000437, "loss": 6.4654, "mean_token_accuracy": 0.11073716729879379, "num_tokens": 1821059.0, "step": 875 }, { "entropy": 6.492483615875244, "epoch": 0.07982583454281568, "grad_norm": 1.3359375, "learning_rate": 0.0004395, "loss": 6.3791, "mean_token_accuracy": 0.11755654066801072, "num_tokens": 1830246.0, "step": 880 }, { "entropy": 6.335828971862793, "epoch": 0.08027939042089985, "grad_norm": 1.328125, "learning_rate": 0.000442, "loss": 6.408, "mean_token_accuracy": 0.12151500731706619, "num_tokens": 1839950.0, "step": 885 }, { "entropy": 6.464663171768189, "epoch": 0.08073294629898403, "grad_norm": 1.1171875, "learning_rate": 0.0004445, "loss": 6.3876, "mean_token_accuracy": 0.11592675521969795, "num_tokens": 1852026.0, "step": 890 }, { "entropy": 6.560555934906006, "epoch": 0.08118650217706821, "grad_norm": 1.1171875, "learning_rate": 0.000447, "loss": 6.4635, "mean_token_accuracy": 0.11812743693590164, "num_tokens": 1861672.0, "step": 895 }, { "entropy": 6.551700782775879, "epoch": 0.0816400580551524, "grad_norm": 1.109375, "learning_rate": 0.00044950000000000003, "loss": 6.4836, "mean_token_accuracy": 0.11402211338281631, "num_tokens": 1872294.0, "step": 900 }, { "entropy": 6.45425329208374, "epoch": 0.08209361393323658, "grad_norm": 1.0390625, "learning_rate": 0.00045200000000000004, "loss": 6.4414, "mean_token_accuracy": 0.11440050825476647, "num_tokens": 1883049.0, "step": 905 }, { "entropy": 6.345271444320678, "epoch": 0.08254716981132075, "grad_norm": 1.1796875, "learning_rate": 0.00045450000000000004, "loss": 6.3992, "mean_token_accuracy": 0.12349174469709397, "num_tokens": 1893026.0, "step": 910 }, { "entropy": 6.415435361862182, "epoch": 0.08300072568940493, "grad_norm": 1.109375, "learning_rate": 0.00045700000000000005, "loss": 6.4304, "mean_token_accuracy": 0.11467023715376853, "num_tokens": 1903987.0, "step": 915 }, { "entropy": 6.59291787147522, "epoch": 0.08345428156748912, "grad_norm": 1.2578125, "learning_rate": 0.00045950000000000006, "loss": 6.4365, "mean_token_accuracy": 0.11061537489295006, "num_tokens": 1914285.0, "step": 920 }, { "entropy": 6.461905241012573, "epoch": 0.0839078374455733, "grad_norm": 1.21875, "learning_rate": 0.000462, "loss": 6.4536, "mean_token_accuracy": 0.1159026212990284, "num_tokens": 1924841.0, "step": 925 }, { "entropy": 6.357869672775268, "epoch": 0.08436139332365747, "grad_norm": 0.96484375, "learning_rate": 0.0004645, "loss": 6.3829, "mean_token_accuracy": 0.11473607048392295, "num_tokens": 1935536.0, "step": 930 }, { "entropy": 6.538698625564575, "epoch": 0.08481494920174165, "grad_norm": 1.2109375, "learning_rate": 0.000467, "loss": 6.4852, "mean_token_accuracy": 0.11677240207791328, "num_tokens": 1946179.0, "step": 935 }, { "entropy": 6.407983589172363, "epoch": 0.08526850507982583, "grad_norm": 1.09375, "learning_rate": 0.0004695, "loss": 6.383, "mean_token_accuracy": 0.11190493553876876, "num_tokens": 1956139.0, "step": 940 }, { "entropy": 6.46036171913147, "epoch": 0.08572206095791002, "grad_norm": 1.1328125, "learning_rate": 0.000472, "loss": 6.4659, "mean_token_accuracy": 0.11674941927194596, "num_tokens": 1966944.0, "step": 945 }, { "entropy": 6.424592447280884, "epoch": 0.0861756168359942, "grad_norm": 1.0390625, "learning_rate": 0.0004745, "loss": 6.4265, "mean_token_accuracy": 0.1166701041162014, "num_tokens": 1976910.0, "step": 950 }, { "entropy": 6.57973198890686, "epoch": 0.08662917271407837, "grad_norm": 1.171875, "learning_rate": 0.000477, "loss": 6.4712, "mean_token_accuracy": 0.11671740487217903, "num_tokens": 1987111.0, "step": 955 }, { "entropy": 6.31265082359314, "epoch": 0.08708272859216255, "grad_norm": 1.1015625, "learning_rate": 0.0004795, "loss": 6.3582, "mean_token_accuracy": 0.12392476126551628, "num_tokens": 1996962.0, "step": 960 }, { "entropy": 6.368039894104004, "epoch": 0.08753628447024674, "grad_norm": 1.0859375, "learning_rate": 0.000482, "loss": 6.2983, "mean_token_accuracy": 0.11986770704388619, "num_tokens": 2006775.0, "step": 965 }, { "entropy": 6.482371377944946, "epoch": 0.08798984034833092, "grad_norm": 1.1015625, "learning_rate": 0.0004845, "loss": 6.4064, "mean_token_accuracy": 0.12042228356003762, "num_tokens": 2016453.0, "step": 970 }, { "entropy": 6.435760164260865, "epoch": 0.08844339622641509, "grad_norm": 0.95703125, "learning_rate": 0.000487, "loss": 6.4685, "mean_token_accuracy": 0.11267957463860512, "num_tokens": 2029100.0, "step": 975 }, { "entropy": 6.409471607208252, "epoch": 0.08889695210449927, "grad_norm": 1.015625, "learning_rate": 0.0004895, "loss": 6.4124, "mean_token_accuracy": 0.11172624826431274, "num_tokens": 2040041.0, "step": 980 }, { "entropy": 6.419856071472168, "epoch": 0.08935050798258345, "grad_norm": 1.0625, "learning_rate": 0.000492, "loss": 6.3962, "mean_token_accuracy": 0.11573249772191048, "num_tokens": 2050377.0, "step": 985 }, { "entropy": 6.359882593154907, "epoch": 0.08980406386066764, "grad_norm": 1.0625, "learning_rate": 0.0004945, "loss": 6.3743, "mean_token_accuracy": 0.1218277484178543, "num_tokens": 2060081.0, "step": 990 }, { "entropy": 6.496881818771362, "epoch": 0.09025761973875182, "grad_norm": 1.0625, "learning_rate": 0.000497, "loss": 6.5431, "mean_token_accuracy": 0.1156518079340458, "num_tokens": 2070335.0, "step": 995 }, { "entropy": 6.389731550216675, "epoch": 0.09071117561683599, "grad_norm": 1.2109375, "learning_rate": 0.0004995, "loss": 6.3597, "mean_token_accuracy": 0.1212635301053524, "num_tokens": 2079259.0, "step": 1000 }, { "entropy": 6.374619245529175, "epoch": 0.09116473149492017, "grad_norm": 1.078125, "learning_rate": 0.0004999999985110217, "loss": 6.4764, "mean_token_accuracy": 0.11514603495597839, "num_tokens": 2089256.0, "step": 1005 }, { "entropy": 6.3883942604064945, "epoch": 0.09161828737300436, "grad_norm": 1.1015625, "learning_rate": 0.0004999999924620471, "loss": 6.4064, "mean_token_accuracy": 0.11673571988940239, "num_tokens": 2099141.0, "step": 1010 }, { "entropy": 6.387277984619141, "epoch": 0.09207184325108854, "grad_norm": 1.109375, "learning_rate": 0.0004999999817600155, "loss": 6.3246, "mean_token_accuracy": 0.12680575177073478, "num_tokens": 2108934.0, "step": 1015 }, { "entropy": 6.33391375541687, "epoch": 0.09252539912917271, "grad_norm": 1.109375, "learning_rate": 0.0004999999664049268, "loss": 6.4441, "mean_token_accuracy": 0.1187924824655056, "num_tokens": 2120302.0, "step": 1020 }, { "entropy": 6.453229522705078, "epoch": 0.09297895500725689, "grad_norm": 1.140625, "learning_rate": 0.0004999999463967816, "loss": 6.4247, "mean_token_accuracy": 0.1195537157356739, "num_tokens": 2131096.0, "step": 1025 }, { "entropy": 6.416885185241699, "epoch": 0.09343251088534107, "grad_norm": 1.1640625, "learning_rate": 0.00049999992173558, "loss": 6.4041, "mean_token_accuracy": 0.12701962441205977, "num_tokens": 2140603.0, "step": 1030 }, { "entropy": 6.377317237854004, "epoch": 0.09388606676342526, "grad_norm": 1.0703125, "learning_rate": 0.0004999998924213228, "loss": 6.4604, "mean_token_accuracy": 0.11771498769521713, "num_tokens": 2151150.0, "step": 1035 }, { "entropy": 6.381362867355347, "epoch": 0.09433962264150944, "grad_norm": 1.109375, "learning_rate": 0.0004999998584540105, "loss": 6.3849, "mean_token_accuracy": 0.11927906274795533, "num_tokens": 2161237.0, "step": 1040 }, { "entropy": 6.435468864440918, "epoch": 0.09479317851959361, "grad_norm": 1.09375, "learning_rate": 0.0004999998198336437, "loss": 6.39, "mean_token_accuracy": 0.11034503877162934, "num_tokens": 2171861.0, "step": 1045 }, { "entropy": 6.281571960449218, "epoch": 0.09524673439767779, "grad_norm": 1.1640625, "learning_rate": 0.0004999997765602233, "loss": 6.3031, "mean_token_accuracy": 0.12425279021263122, "num_tokens": 2181415.0, "step": 1050 }, { "entropy": 6.323150634765625, "epoch": 0.09570029027576198, "grad_norm": 1.046875, "learning_rate": 0.0004999997286337502, "loss": 6.3244, "mean_token_accuracy": 0.1208683580160141, "num_tokens": 2192036.0, "step": 1055 }, { "entropy": 6.358468723297119, "epoch": 0.09615384615384616, "grad_norm": 1.0546875, "learning_rate": 0.0004999996760542254, "loss": 6.4465, "mean_token_accuracy": 0.1163475088775158, "num_tokens": 2203001.0, "step": 1060 }, { "entropy": 6.384481906890869, "epoch": 0.09660740203193033, "grad_norm": 1.1796875, "learning_rate": 0.00049999961882165, "loss": 6.2868, "mean_token_accuracy": 0.1244203880429268, "num_tokens": 2213310.0, "step": 1065 }, { "entropy": 6.250124216079712, "epoch": 0.09706095791001451, "grad_norm": 0.95703125, "learning_rate": 0.0004999995569360251, "loss": 6.2546, "mean_token_accuracy": 0.12180497273802757, "num_tokens": 2223909.0, "step": 1070 }, { "entropy": 6.361983823776245, "epoch": 0.0975145137880987, "grad_norm": 1.0078125, "learning_rate": 0.000499999490397352, "loss": 6.3172, "mean_token_accuracy": 0.11828529611229896, "num_tokens": 2234547.0, "step": 1075 }, { "entropy": 6.273873519897461, "epoch": 0.09796806966618288, "grad_norm": 1.125, "learning_rate": 0.0004999994192056321, "loss": 6.3341, "mean_token_accuracy": 0.12068448886275292, "num_tokens": 2244493.0, "step": 1080 }, { "entropy": 6.257021093368531, "epoch": 0.09842162554426705, "grad_norm": 1.0, "learning_rate": 0.0004999993433608669, "loss": 6.236, "mean_token_accuracy": 0.1235893614590168, "num_tokens": 2254881.0, "step": 1085 }, { "entropy": 6.276112365722656, "epoch": 0.09887518142235123, "grad_norm": 1.1484375, "learning_rate": 0.0004999992628630579, "loss": 6.3323, "mean_token_accuracy": 0.11811816319823265, "num_tokens": 2264964.0, "step": 1090 }, { "entropy": 6.486545896530151, "epoch": 0.09932873730043541, "grad_norm": 1.0703125, "learning_rate": 0.0004999991777122069, "loss": 6.4318, "mean_token_accuracy": 0.11846130490303039, "num_tokens": 2275507.0, "step": 1095 }, { "entropy": 6.27265567779541, "epoch": 0.0997822931785196, "grad_norm": 1.1015625, "learning_rate": 0.0004999990879083156, "loss": 6.2819, "mean_token_accuracy": 0.12145883291959762, "num_tokens": 2284405.0, "step": 1100 }, { "entropy": 6.259899759292603, "epoch": 0.10023584905660378, "grad_norm": 1.046875, "learning_rate": 0.0004999989934513857, "loss": 6.324, "mean_token_accuracy": 0.1184744507074356, "num_tokens": 2294082.0, "step": 1105 }, { "entropy": 6.317243003845215, "epoch": 0.10068940493468795, "grad_norm": 1.046875, "learning_rate": 0.0004999988943414193, "loss": 6.3617, "mean_token_accuracy": 0.11865237578749657, "num_tokens": 2303805.0, "step": 1110 }, { "entropy": 6.3640618324279785, "epoch": 0.10114296081277213, "grad_norm": 1.03125, "learning_rate": 0.0004999987905784184, "loss": 6.2915, "mean_token_accuracy": 0.11877703964710236, "num_tokens": 2314974.0, "step": 1115 }, { "entropy": 6.386012029647827, "epoch": 0.10159651669085631, "grad_norm": 1.0390625, "learning_rate": 0.0004999986821623853, "loss": 6.4138, "mean_token_accuracy": 0.1207954816520214, "num_tokens": 2326719.0, "step": 1120 }, { "entropy": 6.265592050552368, "epoch": 0.1020500725689405, "grad_norm": 0.97265625, "learning_rate": 0.0004999985690933219, "loss": 6.3131, "mean_token_accuracy": 0.11659505292773246, "num_tokens": 2337379.0, "step": 1125 }, { "entropy": 6.320196676254272, "epoch": 0.10250362844702467, "grad_norm": 1.0234375, "learning_rate": 0.0004999984513712311, "loss": 6.2983, "mean_token_accuracy": 0.12314697355031967, "num_tokens": 2347509.0, "step": 1130 }, { "entropy": 6.3434178829193115, "epoch": 0.10295718432510885, "grad_norm": 1.0625, "learning_rate": 0.0004999983289961146, "loss": 6.2882, "mean_token_accuracy": 0.11846850141882896, "num_tokens": 2357835.0, "step": 1135 }, { "entropy": 6.269227457046509, "epoch": 0.10341074020319303, "grad_norm": 0.94921875, "learning_rate": 0.0004999982019679755, "loss": 6.3579, "mean_token_accuracy": 0.12629576474428178, "num_tokens": 2368373.0, "step": 1140 }, { "entropy": 6.270691156387329, "epoch": 0.10386429608127722, "grad_norm": 1.1640625, "learning_rate": 0.0004999980702868164, "loss": 6.3287, "mean_token_accuracy": 0.12598486691713334, "num_tokens": 2379170.0, "step": 1145 }, { "entropy": 6.256811571121216, "epoch": 0.1043178519593614, "grad_norm": 0.9765625, "learning_rate": 0.0004999979339526396, "loss": 6.2471, "mean_token_accuracy": 0.12656034380197526, "num_tokens": 2389711.0, "step": 1150 }, { "entropy": 6.2689375400543215, "epoch": 0.10477140783744557, "grad_norm": 1.03125, "learning_rate": 0.0004999977929654484, "loss": 6.2285, "mean_token_accuracy": 0.13038562908768653, "num_tokens": 2399710.0, "step": 1155 }, { "entropy": 6.235695457458496, "epoch": 0.10522496371552975, "grad_norm": 0.9375, "learning_rate": 0.0004999976473252453, "loss": 6.3514, "mean_token_accuracy": 0.11452672109007836, "num_tokens": 2410567.0, "step": 1160 }, { "entropy": 6.344023704528809, "epoch": 0.10567851959361393, "grad_norm": 1.0390625, "learning_rate": 0.0004999974970320338, "loss": 6.307, "mean_token_accuracy": 0.12359435632824897, "num_tokens": 2420010.0, "step": 1165 }, { "entropy": 6.309238719940185, "epoch": 0.10613207547169812, "grad_norm": 1.0703125, "learning_rate": 0.0004999973420858165, "loss": 6.2661, "mean_token_accuracy": 0.1272447846829891, "num_tokens": 2429706.0, "step": 1170 }, { "entropy": 6.296723413467407, "epoch": 0.10658563134978229, "grad_norm": 1.203125, "learning_rate": 0.0004999971824865968, "loss": 6.4111, "mean_token_accuracy": 0.11686691716313362, "num_tokens": 2441482.0, "step": 1175 }, { "entropy": 6.422159862518311, "epoch": 0.10703918722786647, "grad_norm": 1.0234375, "learning_rate": 0.0004999970182343782, "loss": 6.3682, "mean_token_accuracy": 0.11550676226615905, "num_tokens": 2452094.0, "step": 1180 }, { "entropy": 6.148933982849121, "epoch": 0.10749274310595065, "grad_norm": 1.09375, "learning_rate": 0.0004999968493291638, "loss": 6.1916, "mean_token_accuracy": 0.12536179572343825, "num_tokens": 2462174.0, "step": 1185 }, { "entropy": 6.300602436065674, "epoch": 0.10794629898403484, "grad_norm": 1.0703125, "learning_rate": 0.0004999966757709573, "loss": 6.2581, "mean_token_accuracy": 0.1321061834692955, "num_tokens": 2473294.0, "step": 1190 }, { "entropy": 6.228463363647461, "epoch": 0.10839985486211902, "grad_norm": 0.984375, "learning_rate": 0.0004999964975597622, "loss": 6.3172, "mean_token_accuracy": 0.1278726689517498, "num_tokens": 2482954.0, "step": 1195 }, { "entropy": 6.31824312210083, "epoch": 0.10885341074020319, "grad_norm": 1.0390625, "learning_rate": 0.0004999963146955821, "loss": 6.3121, "mean_token_accuracy": 0.12523070126771926, "num_tokens": 2493894.0, "step": 1200 }, { "entropy": 6.202036809921265, "epoch": 0.10930696661828737, "grad_norm": 1.0078125, "learning_rate": 0.000499996127178421, "loss": 6.2219, "mean_token_accuracy": 0.12660781443119049, "num_tokens": 2503983.0, "step": 1205 }, { "entropy": 6.2187714099884035, "epoch": 0.10976052249637155, "grad_norm": 0.9453125, "learning_rate": 0.0004999959350082825, "loss": 6.1808, "mean_token_accuracy": 0.12330685779452324, "num_tokens": 2513721.0, "step": 1210 }, { "entropy": 6.269692087173462, "epoch": 0.11021407837445574, "grad_norm": 1.0625, "learning_rate": 0.0004999957381851709, "loss": 6.2502, "mean_token_accuracy": 0.12575069963932037, "num_tokens": 2523312.0, "step": 1215 }, { "entropy": 6.2597119331359865, "epoch": 0.1106676342525399, "grad_norm": 1.0078125, "learning_rate": 0.0004999955367090901, "loss": 6.1965, "mean_token_accuracy": 0.12818494513630868, "num_tokens": 2532685.0, "step": 1220 }, { "entropy": 6.278915119171143, "epoch": 0.11112119013062409, "grad_norm": 1.1171875, "learning_rate": 0.0004999953305800441, "loss": 6.3135, "mean_token_accuracy": 0.12152358293533325, "num_tokens": 2543324.0, "step": 1225 }, { "entropy": 6.2923393726348875, "epoch": 0.11157474600870827, "grad_norm": 1.03125, "learning_rate": 0.0004999951197980374, "loss": 6.2963, "mean_token_accuracy": 0.12113744467496872, "num_tokens": 2554242.0, "step": 1230 }, { "entropy": 6.273481845855713, "epoch": 0.11202830188679246, "grad_norm": 1.0078125, "learning_rate": 0.0004999949043630744, "loss": 6.2467, "mean_token_accuracy": 0.1278710223734379, "num_tokens": 2563372.0, "step": 1235 }, { "entropy": 6.234022188186645, "epoch": 0.11248185776487664, "grad_norm": 1.03125, "learning_rate": 0.0004999946842751593, "loss": 6.3483, "mean_token_accuracy": 0.12514663413167, "num_tokens": 2574029.0, "step": 1240 }, { "entropy": 6.359460401535034, "epoch": 0.11293541364296081, "grad_norm": 1.1015625, "learning_rate": 0.0004999944595342968, "loss": 6.3691, "mean_token_accuracy": 0.1290361575782299, "num_tokens": 2583308.0, "step": 1245 }, { "entropy": 6.420801258087158, "epoch": 0.11338896952104499, "grad_norm": 0.9453125, "learning_rate": 0.0004999942301404916, "loss": 6.3833, "mean_token_accuracy": 0.11551335826516151, "num_tokens": 2595105.0, "step": 1250 }, { "entropy": 6.13080940246582, "epoch": 0.11384252539912917, "grad_norm": 1.1015625, "learning_rate": 0.0004999939960937484, "loss": 6.1801, "mean_token_accuracy": 0.13008004054427147, "num_tokens": 2604937.0, "step": 1255 }, { "entropy": 6.238644075393677, "epoch": 0.11429608127721336, "grad_norm": 1.109375, "learning_rate": 0.0004999937573940721, "loss": 6.259, "mean_token_accuracy": 0.12672679945826532, "num_tokens": 2615218.0, "step": 1260 }, { "entropy": 6.200268936157227, "epoch": 0.11474963715529753, "grad_norm": 1.0703125, "learning_rate": 0.0004999935140414674, "loss": 6.1979, "mean_token_accuracy": 0.12415119707584381, "num_tokens": 2625668.0, "step": 1265 }, { "entropy": 6.2111094951629635, "epoch": 0.11520319303338171, "grad_norm": 0.96484375, "learning_rate": 0.0004999932660359395, "loss": 6.2862, "mean_token_accuracy": 0.12427769452333451, "num_tokens": 2636233.0, "step": 1270 }, { "entropy": 6.263781785964966, "epoch": 0.11565674891146589, "grad_norm": 1.015625, "learning_rate": 0.0004999930133774936, "loss": 6.2352, "mean_token_accuracy": 0.12104817926883697, "num_tokens": 2647725.0, "step": 1275 }, { "entropy": 6.226747751235962, "epoch": 0.11611030478955008, "grad_norm": 1.015625, "learning_rate": 0.0004999927560661348, "loss": 6.2223, "mean_token_accuracy": 0.13130831718444824, "num_tokens": 2658670.0, "step": 1280 }, { "entropy": 6.139042472839355, "epoch": 0.11656386066763426, "grad_norm": 1.0859375, "learning_rate": 0.0004999924941018685, "loss": 6.2077, "mean_token_accuracy": 0.13245302811264992, "num_tokens": 2668782.0, "step": 1285 }, { "entropy": 6.23336877822876, "epoch": 0.11701741654571843, "grad_norm": 1.078125, "learning_rate": 0.0004999922274847, "loss": 6.2498, "mean_token_accuracy": 0.12909818440675735, "num_tokens": 2677973.0, "step": 1290 }, { "entropy": 6.244420528411865, "epoch": 0.11747097242380261, "grad_norm": 0.98046875, "learning_rate": 0.000499991956214635, "loss": 6.1934, "mean_token_accuracy": 0.12651574686169625, "num_tokens": 2687813.0, "step": 1295 }, { "entropy": 6.160448169708252, "epoch": 0.1179245283018868, "grad_norm": 1.0078125, "learning_rate": 0.000499991680291679, "loss": 6.2207, "mean_token_accuracy": 0.1258676081895828, "num_tokens": 2698664.0, "step": 1300 }, { "entropy": 6.191532325744629, "epoch": 0.11837808417997098, "grad_norm": 1.015625, "learning_rate": 0.0004999913997158378, "loss": 6.1572, "mean_token_accuracy": 0.13130440413951874, "num_tokens": 2708936.0, "step": 1305 }, { "entropy": 6.242334794998169, "epoch": 0.11883164005805515, "grad_norm": 1.109375, "learning_rate": 0.0004999911144871169, "loss": 6.2468, "mean_token_accuracy": 0.1300816871225834, "num_tokens": 2718711.0, "step": 1310 }, { "entropy": 6.0896015644073485, "epoch": 0.11928519593613933, "grad_norm": 1.015625, "learning_rate": 0.0004999908246055226, "loss": 6.1894, "mean_token_accuracy": 0.13144304975867271, "num_tokens": 2729956.0, "step": 1315 }, { "entropy": 6.332587003707886, "epoch": 0.11973875181422351, "grad_norm": 0.93359375, "learning_rate": 0.0004999905300710607, "loss": 6.3051, "mean_token_accuracy": 0.12343701347708702, "num_tokens": 2740932.0, "step": 1320 }, { "entropy": 6.29391508102417, "epoch": 0.1201923076923077, "grad_norm": 0.96875, "learning_rate": 0.0004999902308837373, "loss": 6.3452, "mean_token_accuracy": 0.12498589381575584, "num_tokens": 2750781.0, "step": 1325 }, { "entropy": 6.286653852462768, "epoch": 0.12064586357039188, "grad_norm": 0.953125, "learning_rate": 0.0004999899270435584, "loss": 6.2415, "mean_token_accuracy": 0.12924491837620736, "num_tokens": 2761542.0, "step": 1330 }, { "entropy": 6.169296550750732, "epoch": 0.12109941944847605, "grad_norm": 1.0, "learning_rate": 0.0004999896185505307, "loss": 6.1863, "mean_token_accuracy": 0.12321913093328477, "num_tokens": 2772507.0, "step": 1335 }, { "entropy": 6.211149549484253, "epoch": 0.12155297532656023, "grad_norm": 1.0859375, "learning_rate": 0.0004999893054046603, "loss": 6.2009, "mean_token_accuracy": 0.12625789046287536, "num_tokens": 2782806.0, "step": 1340 }, { "entropy": 6.175951194763184, "epoch": 0.12200653120464441, "grad_norm": 0.91796875, "learning_rate": 0.0004999889876059537, "loss": 6.1991, "mean_token_accuracy": 0.12693845182657243, "num_tokens": 2793484.0, "step": 1345 }, { "entropy": 6.184288167953492, "epoch": 0.1224600870827286, "grad_norm": 1.0234375, "learning_rate": 0.0004999886651544176, "loss": 6.2731, "mean_token_accuracy": 0.1297612629830837, "num_tokens": 2804443.0, "step": 1350 }, { "entropy": 6.163767099380493, "epoch": 0.12291364296081277, "grad_norm": 1.03125, "learning_rate": 0.0004999883380500584, "loss": 6.1485, "mean_token_accuracy": 0.1262630842626095, "num_tokens": 2814840.0, "step": 1355 }, { "entropy": 6.2059821605682375, "epoch": 0.12336719883889695, "grad_norm": 1.03125, "learning_rate": 0.0004999880062928831, "loss": 6.2207, "mean_token_accuracy": 0.1247759722173214, "num_tokens": 2824789.0, "step": 1360 }, { "entropy": 6.2396345138549805, "epoch": 0.12382075471698113, "grad_norm": 1.0234375, "learning_rate": 0.0004999876698828985, "loss": 6.1775, "mean_token_accuracy": 0.13116121515631676, "num_tokens": 2834501.0, "step": 1365 }, { "entropy": 6.202531719207764, "epoch": 0.12427431059506532, "grad_norm": 0.98828125, "learning_rate": 0.0004999873288201116, "loss": 6.1893, "mean_token_accuracy": 0.12950848862528802, "num_tokens": 2845399.0, "step": 1370 }, { "entropy": 6.032520198822022, "epoch": 0.1247278664731495, "grad_norm": 1.0390625, "learning_rate": 0.0004999869831045294, "loss": 6.0872, "mean_token_accuracy": 0.14028632938861846, "num_tokens": 2855146.0, "step": 1375 }, { "entropy": 6.3156661033630375, "epoch": 0.12518142235123367, "grad_norm": 1.0, "learning_rate": 0.0004999866327361589, "loss": 6.2597, "mean_token_accuracy": 0.12432174906134605, "num_tokens": 2866438.0, "step": 1380 }, { "entropy": 6.019028043746948, "epoch": 0.12563497822931785, "grad_norm": 1.03125, "learning_rate": 0.0004999862777150077, "loss": 6.1301, "mean_token_accuracy": 0.12995802015066146, "num_tokens": 2876802.0, "step": 1385 }, { "entropy": 6.315221118927002, "epoch": 0.12608853410740203, "grad_norm": 1.03125, "learning_rate": 0.0004999859180410829, "loss": 6.3285, "mean_token_accuracy": 0.128648017346859, "num_tokens": 2888657.0, "step": 1390 }, { "entropy": 6.177397584915161, "epoch": 0.12654208998548622, "grad_norm": 0.984375, "learning_rate": 0.0004999855537143919, "loss": 6.1832, "mean_token_accuracy": 0.1301404818892479, "num_tokens": 2899605.0, "step": 1395 }, { "entropy": 6.116765117645263, "epoch": 0.1269956458635704, "grad_norm": 0.984375, "learning_rate": 0.0004999851847349425, "loss": 6.1427, "mean_token_accuracy": 0.1246509574353695, "num_tokens": 2910332.0, "step": 1400 }, { "entropy": 6.126271677017212, "epoch": 0.12744920174165458, "grad_norm": 0.9765625, "learning_rate": 0.0004999848111027419, "loss": 6.1231, "mean_token_accuracy": 0.1296907387673855, "num_tokens": 2921226.0, "step": 1405 }, { "entropy": 6.1753684997558596, "epoch": 0.12790275761973874, "grad_norm": 1.015625, "learning_rate": 0.0004999844328177983, "loss": 6.165, "mean_token_accuracy": 0.129497080296278, "num_tokens": 2930941.0, "step": 1410 }, { "entropy": 6.1793512344360355, "epoch": 0.12835631349782292, "grad_norm": 0.98828125, "learning_rate": 0.0004999840498801191, "loss": 6.1917, "mean_token_accuracy": 0.13117415681481362, "num_tokens": 2941383.0, "step": 1415 }, { "entropy": 6.207342672348022, "epoch": 0.1288098693759071, "grad_norm": 1.140625, "learning_rate": 0.0004999836622897126, "loss": 6.1587, "mean_token_accuracy": 0.12762442380189895, "num_tokens": 2951634.0, "step": 1420 }, { "entropy": 6.203984594345092, "epoch": 0.1292634252539913, "grad_norm": 1.0234375, "learning_rate": 0.0004999832700465865, "loss": 6.2219, "mean_token_accuracy": 0.12739467918872832, "num_tokens": 2962240.0, "step": 1425 }, { "entropy": 6.187308359146118, "epoch": 0.12971698113207547, "grad_norm": 0.921875, "learning_rate": 0.0004999828731507491, "loss": 6.1977, "mean_token_accuracy": 0.12866248711943626, "num_tokens": 2973466.0, "step": 1430 }, { "entropy": 6.248796129226685, "epoch": 0.13017053701015965, "grad_norm": 1.0390625, "learning_rate": 0.0004999824716022085, "loss": 6.1989, "mean_token_accuracy": 0.13207736387848854, "num_tokens": 2982986.0, "step": 1435 }, { "entropy": 6.168663787841797, "epoch": 0.13062409288824384, "grad_norm": 0.94921875, "learning_rate": 0.0004999820654009731, "loss": 6.2264, "mean_token_accuracy": 0.1301150493323803, "num_tokens": 2994151.0, "step": 1440 }, { "entropy": 6.106994342803955, "epoch": 0.13107764876632802, "grad_norm": 1.0625, "learning_rate": 0.0004999816545470513, "loss": 6.0382, "mean_token_accuracy": 0.1328746996819973, "num_tokens": 3003481.0, "step": 1445 }, { "entropy": 6.062295961380005, "epoch": 0.1315312046444122, "grad_norm": 0.921875, "learning_rate": 0.0004999812390404514, "loss": 6.1274, "mean_token_accuracy": 0.1257198430597782, "num_tokens": 3013835.0, "step": 1450 }, { "entropy": 6.146769189834595, "epoch": 0.13198476052249636, "grad_norm": 1.125, "learning_rate": 0.0004999808188811823, "loss": 6.1207, "mean_token_accuracy": 0.14100732132792473, "num_tokens": 3024292.0, "step": 1455 }, { "entropy": 6.171922969818115, "epoch": 0.13243831640058054, "grad_norm": 0.94921875, "learning_rate": 0.0004999803940692524, "loss": 6.2384, "mean_token_accuracy": 0.12596325874328612, "num_tokens": 3035114.0, "step": 1460 }, { "entropy": 6.1891436100006105, "epoch": 0.13289187227866472, "grad_norm": 1.1015625, "learning_rate": 0.0004999799646046707, "loss": 6.1387, "mean_token_accuracy": 0.13315948471426964, "num_tokens": 3045151.0, "step": 1465 }, { "entropy": 6.107039928436279, "epoch": 0.1333454281567489, "grad_norm": 1.0078125, "learning_rate": 0.0004999795304874461, "loss": 6.1193, "mean_token_accuracy": 0.13525033965706826, "num_tokens": 3054552.0, "step": 1470 }, { "entropy": 6.211303329467773, "epoch": 0.1337989840348331, "grad_norm": 0.984375, "learning_rate": 0.0004999790917175873, "loss": 6.2495, "mean_token_accuracy": 0.12571337893605233, "num_tokens": 3065386.0, "step": 1475 }, { "entropy": 6.1838174819946286, "epoch": 0.13425253991291727, "grad_norm": 0.94140625, "learning_rate": 0.0004999786482951036, "loss": 6.0979, "mean_token_accuracy": 0.13161127269268036, "num_tokens": 3075934.0, "step": 1480 }, { "entropy": 6.044588327407837, "epoch": 0.13470609579100146, "grad_norm": 0.96484375, "learning_rate": 0.0004999782002200041, "loss": 6.0649, "mean_token_accuracy": 0.13151389360427856, "num_tokens": 3086578.0, "step": 1485 }, { "entropy": 6.235484266281128, "epoch": 0.13515965166908564, "grad_norm": 0.9375, "learning_rate": 0.0004999777474922982, "loss": 6.2253, "mean_token_accuracy": 0.12512897700071335, "num_tokens": 3098183.0, "step": 1490 }, { "entropy": 6.0513090133667, "epoch": 0.13561320754716982, "grad_norm": 1.0078125, "learning_rate": 0.0004999772901119951, "loss": 6.0581, "mean_token_accuracy": 0.1343822069466114, "num_tokens": 3107649.0, "step": 1495 }, { "entropy": 6.221631050109863, "epoch": 0.13606676342525398, "grad_norm": 1.0546875, "learning_rate": 0.0004999768280791043, "loss": 6.1646, "mean_token_accuracy": 0.13448878824710847, "num_tokens": 3117652.0, "step": 1500 }, { "entropy": 6.061485052108765, "epoch": 0.13652031930333816, "grad_norm": 1.0, "learning_rate": 0.0004999763613936352, "loss": 6.1065, "mean_token_accuracy": 0.13679977506399155, "num_tokens": 3127785.0, "step": 1505 }, { "entropy": 6.083025693893433, "epoch": 0.13697387518142234, "grad_norm": 1.015625, "learning_rate": 0.0004999758900555979, "loss": 6.0635, "mean_token_accuracy": 0.13337264955043793, "num_tokens": 3138657.0, "step": 1510 }, { "entropy": 6.140411472320556, "epoch": 0.13742743105950653, "grad_norm": 0.9375, "learning_rate": 0.0004999754140650017, "loss": 6.1911, "mean_token_accuracy": 0.12004235461354255, "num_tokens": 3150692.0, "step": 1515 }, { "entropy": 6.23555703163147, "epoch": 0.1378809869375907, "grad_norm": 1.0859375, "learning_rate": 0.0004999749334218567, "loss": 6.2595, "mean_token_accuracy": 0.12430977448821068, "num_tokens": 3161807.0, "step": 1520 }, { "entropy": 6.107507514953613, "epoch": 0.1383345428156749, "grad_norm": 1.0078125, "learning_rate": 0.0004999744481261726, "loss": 6.0703, "mean_token_accuracy": 0.1393376462161541, "num_tokens": 3172446.0, "step": 1525 }, { "entropy": 6.145687675476074, "epoch": 0.13878809869375908, "grad_norm": 1.046875, "learning_rate": 0.0004999739581779597, "loss": 6.2071, "mean_token_accuracy": 0.1238051250576973, "num_tokens": 3183476.0, "step": 1530 }, { "entropy": 6.0691694736480715, "epoch": 0.13924165457184326, "grad_norm": 1.046875, "learning_rate": 0.000499973463577228, "loss": 6.0885, "mean_token_accuracy": 0.13867690786719322, "num_tokens": 3193586.0, "step": 1535 }, { "entropy": 6.1251280307769775, "epoch": 0.13969521044992744, "grad_norm": 1.0546875, "learning_rate": 0.0004999729643239877, "loss": 6.1195, "mean_token_accuracy": 0.13339588195085525, "num_tokens": 3203341.0, "step": 1540 }, { "entropy": 6.136832141876221, "epoch": 0.1401487663280116, "grad_norm": 1.0234375, "learning_rate": 0.0004999724604182492, "loss": 6.1088, "mean_token_accuracy": 0.12823742404580116, "num_tokens": 3214177.0, "step": 1545 }, { "entropy": 6.141563987731933, "epoch": 0.14060232220609578, "grad_norm": 1.09375, "learning_rate": 0.0004999719518600229, "loss": 6.182, "mean_token_accuracy": 0.1269642286002636, "num_tokens": 3224516.0, "step": 1550 }, { "entropy": 6.098951148986816, "epoch": 0.14105587808417996, "grad_norm": 1.078125, "learning_rate": 0.0004999714386493192, "loss": 6.0717, "mean_token_accuracy": 0.14152515679597855, "num_tokens": 3234001.0, "step": 1555 }, { "entropy": 6.196884202957153, "epoch": 0.14150943396226415, "grad_norm": 0.93359375, "learning_rate": 0.0004999709207861489, "loss": 6.1286, "mean_token_accuracy": 0.13318521454930304, "num_tokens": 3246095.0, "step": 1560 }, { "entropy": 6.135161066055298, "epoch": 0.14196298984034833, "grad_norm": 1.0546875, "learning_rate": 0.0004999703982705227, "loss": 6.177, "mean_token_accuracy": 0.12648626491427423, "num_tokens": 3255828.0, "step": 1565 }, { "entropy": 6.101465272903442, "epoch": 0.1424165457184325, "grad_norm": 1.0234375, "learning_rate": 0.0004999698711024513, "loss": 6.1378, "mean_token_accuracy": 0.13857534304261207, "num_tokens": 3265127.0, "step": 1570 }, { "entropy": 6.23589973449707, "epoch": 0.1428701015965167, "grad_norm": 1.0546875, "learning_rate": 0.0004999693392819456, "loss": 6.2083, "mean_token_accuracy": 0.12722571119666098, "num_tokens": 3277205.0, "step": 1575 }, { "entropy": 6.039449787139892, "epoch": 0.14332365747460088, "grad_norm": 1.078125, "learning_rate": 0.0004999688028090166, "loss": 6.1109, "mean_token_accuracy": 0.13461936116218567, "num_tokens": 3287119.0, "step": 1580 }, { "entropy": 6.237564992904663, "epoch": 0.14377721335268506, "grad_norm": 1.0625, "learning_rate": 0.0004999682616836755, "loss": 6.2073, "mean_token_accuracy": 0.12796173691749574, "num_tokens": 3297324.0, "step": 1585 }, { "entropy": 6.166965675354004, "epoch": 0.14423076923076922, "grad_norm": 1.125, "learning_rate": 0.0004999677159059334, "loss": 6.1568, "mean_token_accuracy": 0.12957976162433624, "num_tokens": 3308162.0, "step": 1590 }, { "entropy": 6.156198501586914, "epoch": 0.1446843251088534, "grad_norm": 0.97265625, "learning_rate": 0.0004999671654758016, "loss": 6.1587, "mean_token_accuracy": 0.12751780077815056, "num_tokens": 3319422.0, "step": 1595 }, { "entropy": 6.074300146102905, "epoch": 0.14513788098693758, "grad_norm": 1.1015625, "learning_rate": 0.0004999666103932915, "loss": 6.1303, "mean_token_accuracy": 0.13079726696014404, "num_tokens": 3328668.0, "step": 1600 }, { "entropy": 6.196269941329956, "epoch": 0.14559143686502177, "grad_norm": 1.09375, "learning_rate": 0.0004999660506584145, "loss": 6.1789, "mean_token_accuracy": 0.12973756417632104, "num_tokens": 3338563.0, "step": 1605 }, { "entropy": 6.123033428192139, "epoch": 0.14604499274310595, "grad_norm": 1.09375, "learning_rate": 0.0004999654862711823, "loss": 6.1866, "mean_token_accuracy": 0.13245568349957465, "num_tokens": 3348025.0, "step": 1610 }, { "entropy": 6.125161266326904, "epoch": 0.14649854862119013, "grad_norm": 0.9921875, "learning_rate": 0.0004999649172316065, "loss": 6.0621, "mean_token_accuracy": 0.14053588956594468, "num_tokens": 3359094.0, "step": 1615 }, { "entropy": 6.113393926620484, "epoch": 0.14695210449927432, "grad_norm": 1.0625, "learning_rate": 0.000499964343539699, "loss": 6.1022, "mean_token_accuracy": 0.13681961521506308, "num_tokens": 3368965.0, "step": 1620 }, { "entropy": 6.058830976486206, "epoch": 0.1474056603773585, "grad_norm": 1.1015625, "learning_rate": 0.0004999637651954714, "loss": 6.1126, "mean_token_accuracy": 0.13101110011339187, "num_tokens": 3378612.0, "step": 1625 }, { "entropy": 6.140189456939697, "epoch": 0.14785921625544268, "grad_norm": 0.953125, "learning_rate": 0.0004999631821989358, "loss": 6.0731, "mean_token_accuracy": 0.13366867899894713, "num_tokens": 3389634.0, "step": 1630 }, { "entropy": 6.045487594604492, "epoch": 0.14831277213352684, "grad_norm": 0.9765625, "learning_rate": 0.0004999625945501043, "loss": 6.1454, "mean_token_accuracy": 0.13442882299423217, "num_tokens": 3399604.0, "step": 1635 }, { "entropy": 6.223248147964478, "epoch": 0.14876632801161102, "grad_norm": 1.0625, "learning_rate": 0.000499962002248989, "loss": 6.0949, "mean_token_accuracy": 0.13319409787654876, "num_tokens": 3410314.0, "step": 1640 }, { "entropy": 6.071327877044678, "epoch": 0.1492198838896952, "grad_norm": 1.109375, "learning_rate": 0.0004999614052956024, "loss": 6.1164, "mean_token_accuracy": 0.13651233538985252, "num_tokens": 3420773.0, "step": 1645 }, { "entropy": 6.234537887573242, "epoch": 0.1496734397677794, "grad_norm": 1.046875, "learning_rate": 0.0004999608036899563, "loss": 6.2406, "mean_token_accuracy": 0.1285805732011795, "num_tokens": 3431702.0, "step": 1650 }, { "entropy": 6.026836967468261, "epoch": 0.15012699564586357, "grad_norm": 1.03125, "learning_rate": 0.0004999601974320636, "loss": 6.1376, "mean_token_accuracy": 0.133916974067688, "num_tokens": 3441925.0, "step": 1655 }, { "entropy": 6.225948667526245, "epoch": 0.15058055152394775, "grad_norm": 1.0, "learning_rate": 0.0004999595865219367, "loss": 6.1489, "mean_token_accuracy": 0.13318530544638635, "num_tokens": 3452391.0, "step": 1660 }, { "entropy": 6.018878602981568, "epoch": 0.15103410740203194, "grad_norm": 1.0, "learning_rate": 0.0004999589709595881, "loss": 6.0672, "mean_token_accuracy": 0.12874112129211426, "num_tokens": 3463028.0, "step": 1665 }, { "entropy": 6.063703966140747, "epoch": 0.15148766328011612, "grad_norm": 1.0390625, "learning_rate": 0.0004999583507450308, "loss": 6.0641, "mean_token_accuracy": 0.13683240562677385, "num_tokens": 3473470.0, "step": 1670 }, { "entropy": 6.126550817489624, "epoch": 0.1519412191582003, "grad_norm": 1.0859375, "learning_rate": 0.0004999577258782774, "loss": 6.1066, "mean_token_accuracy": 0.13182729333639145, "num_tokens": 3484486.0, "step": 1675 }, { "entropy": 6.084259557723999, "epoch": 0.15239477503628446, "grad_norm": 1.0078125, "learning_rate": 0.000499957096359341, "loss": 6.0679, "mean_token_accuracy": 0.13736046478152275, "num_tokens": 3494885.0, "step": 1680 }, { "entropy": 6.07341947555542, "epoch": 0.15284833091436864, "grad_norm": 1.15625, "learning_rate": 0.0004999564621882343, "loss": 6.079, "mean_token_accuracy": 0.13572860211133958, "num_tokens": 3506088.0, "step": 1685 }, { "entropy": 6.015376949310303, "epoch": 0.15330188679245282, "grad_norm": 1.0546875, "learning_rate": 0.0004999558233649708, "loss": 6.0114, "mean_token_accuracy": 0.13501859828829765, "num_tokens": 3516380.0, "step": 1690 }, { "entropy": 6.094719457626343, "epoch": 0.153755442670537, "grad_norm": 1.03125, "learning_rate": 0.0004999551798895636, "loss": 6.0229, "mean_token_accuracy": 0.14153220504522324, "num_tokens": 3525965.0, "step": 1695 }, { "entropy": 6.060795879364013, "epoch": 0.1542089985486212, "grad_norm": 1.0546875, "learning_rate": 0.0004999545317620258, "loss": 6.04, "mean_token_accuracy": 0.13283166736364366, "num_tokens": 3536592.0, "step": 1700 }, { "entropy": 6.117245006561279, "epoch": 0.15466255442670537, "grad_norm": 1.0703125, "learning_rate": 0.0004999538789823711, "loss": 6.1651, "mean_token_accuracy": 0.13683197945356368, "num_tokens": 3546001.0, "step": 1705 }, { "entropy": 6.123035430908203, "epoch": 0.15511611030478956, "grad_norm": 1.015625, "learning_rate": 0.0004999532215506127, "loss": 6.0487, "mean_token_accuracy": 0.12888889610767365, "num_tokens": 3555575.0, "step": 1710 }, { "entropy": 6.06559419631958, "epoch": 0.15556966618287374, "grad_norm": 0.96484375, "learning_rate": 0.0004999525594667645, "loss": 6.0429, "mean_token_accuracy": 0.14311017096042633, "num_tokens": 3565685.0, "step": 1715 }, { "entropy": 6.119355535507202, "epoch": 0.15602322206095792, "grad_norm": 1.1171875, "learning_rate": 0.00049995189273084, "loss": 6.0872, "mean_token_accuracy": 0.14001662507653237, "num_tokens": 3575119.0, "step": 1720 }, { "entropy": 6.048756504058838, "epoch": 0.15647677793904208, "grad_norm": 1.125, "learning_rate": 0.000499951221342853, "loss": 6.0393, "mean_token_accuracy": 0.13779830187559128, "num_tokens": 3584620.0, "step": 1725 }, { "entropy": 6.0873788356781, "epoch": 0.15693033381712626, "grad_norm": 1.1796875, "learning_rate": 0.0004999505453028174, "loss": 6.0783, "mean_token_accuracy": 0.13565813079476358, "num_tokens": 3595403.0, "step": 1730 }, { "entropy": 6.042232465744019, "epoch": 0.15738388969521044, "grad_norm": 1.015625, "learning_rate": 0.0004999498646107472, "loss": 6.0665, "mean_token_accuracy": 0.135944102704525, "num_tokens": 3606355.0, "step": 1735 }, { "entropy": 6.039039087295532, "epoch": 0.15783744557329463, "grad_norm": 1.0859375, "learning_rate": 0.0004999491792666566, "loss": 6.0526, "mean_token_accuracy": 0.1334886446595192, "num_tokens": 3616222.0, "step": 1740 }, { "entropy": 6.117766857147217, "epoch": 0.1582910014513788, "grad_norm": 1.109375, "learning_rate": 0.0004999484892705597, "loss": 6.0978, "mean_token_accuracy": 0.1427782490849495, "num_tokens": 3625179.0, "step": 1745 }, { "entropy": 6.066883754730225, "epoch": 0.158744557329463, "grad_norm": 0.921875, "learning_rate": 0.0004999477946224705, "loss": 6.057, "mean_token_accuracy": 0.13318037912249564, "num_tokens": 3636256.0, "step": 1750 }, { "entropy": 5.9570455074310305, "epoch": 0.15919811320754718, "grad_norm": 1.0859375, "learning_rate": 0.0004999470953224037, "loss": 5.9024, "mean_token_accuracy": 0.14086213558912278, "num_tokens": 3645919.0, "step": 1755 }, { "entropy": 6.067557430267334, "epoch": 0.15965166908563136, "grad_norm": 1.0390625, "learning_rate": 0.0004999463913703735, "loss": 6.1052, "mean_token_accuracy": 0.13390027210116387, "num_tokens": 3657008.0, "step": 1760 }, { "entropy": 6.014396524429321, "epoch": 0.16010522496371554, "grad_norm": 1.1640625, "learning_rate": 0.0004999456827663948, "loss": 5.9915, "mean_token_accuracy": 0.13444581776857376, "num_tokens": 3667686.0, "step": 1765 }, { "entropy": 6.022483873367309, "epoch": 0.1605587808417997, "grad_norm": 1.0546875, "learning_rate": 0.000499944969510482, "loss": 5.9907, "mean_token_accuracy": 0.13489970788359643, "num_tokens": 3678972.0, "step": 1770 }, { "entropy": 6.032540559768677, "epoch": 0.16101233671988388, "grad_norm": 1.0, "learning_rate": 0.0004999442516026498, "loss": 5.9973, "mean_token_accuracy": 0.13953388929367067, "num_tokens": 3688903.0, "step": 1775 }, { "entropy": 6.049791049957276, "epoch": 0.16146589259796806, "grad_norm": 1.078125, "learning_rate": 0.0004999435290429133, "loss": 6.0542, "mean_token_accuracy": 0.13899827301502227, "num_tokens": 3697880.0, "step": 1780 }, { "entropy": 6.113507795333862, "epoch": 0.16191944847605225, "grad_norm": 1.015625, "learning_rate": 0.0004999428018312872, "loss": 6.1146, "mean_token_accuracy": 0.13196710646152496, "num_tokens": 3708500.0, "step": 1785 }, { "entropy": 5.967461633682251, "epoch": 0.16237300435413643, "grad_norm": 1.046875, "learning_rate": 0.0004999420699677867, "loss": 5.9456, "mean_token_accuracy": 0.14808355420827865, "num_tokens": 3718711.0, "step": 1790 }, { "entropy": 6.003653526306152, "epoch": 0.1628265602322206, "grad_norm": 0.98046875, "learning_rate": 0.0004999413334524269, "loss": 6.0784, "mean_token_accuracy": 0.13483019024133683, "num_tokens": 3729431.0, "step": 1795 }, { "entropy": 6.118337678909302, "epoch": 0.1632801161103048, "grad_norm": 1.0078125, "learning_rate": 0.0004999405922852229, "loss": 6.0157, "mean_token_accuracy": 0.13496499881148338, "num_tokens": 3741061.0, "step": 1800 }, { "entropy": 5.951924753189087, "epoch": 0.16373367198838898, "grad_norm": 1.078125, "learning_rate": 0.0004999398464661901, "loss": 6.0049, "mean_token_accuracy": 0.14013575315475463, "num_tokens": 3751878.0, "step": 1805 }, { "entropy": 6.038108873367309, "epoch": 0.16418722786647316, "grad_norm": 1.015625, "learning_rate": 0.0004999390959953441, "loss": 6.0101, "mean_token_accuracy": 0.13939072266221048, "num_tokens": 3762039.0, "step": 1810 }, { "entropy": 5.974385404586792, "epoch": 0.16464078374455732, "grad_norm": 1.140625, "learning_rate": 0.0004999383408727002, "loss": 5.9441, "mean_token_accuracy": 0.1419306755065918, "num_tokens": 3770755.0, "step": 1815 }, { "entropy": 6.02751522064209, "epoch": 0.1650943396226415, "grad_norm": 1.2265625, "learning_rate": 0.0004999375810982741, "loss": 6.1083, "mean_token_accuracy": 0.13299722522497176, "num_tokens": 3781698.0, "step": 1820 }, { "entropy": 6.067613887786865, "epoch": 0.16554789550072568, "grad_norm": 0.99609375, "learning_rate": 0.0004999368166720815, "loss": 6.1488, "mean_token_accuracy": 0.13327884972095488, "num_tokens": 3792508.0, "step": 1825 }, { "entropy": 6.086944532394409, "epoch": 0.16600145137880987, "grad_norm": 1.125, "learning_rate": 0.0004999360475941382, "loss": 6.0028, "mean_token_accuracy": 0.14385750517249107, "num_tokens": 3803065.0, "step": 1830 }, { "entropy": 6.022203254699707, "epoch": 0.16645500725689405, "grad_norm": 1.0625, "learning_rate": 0.00049993527386446, "loss": 6.0675, "mean_token_accuracy": 0.1315029554069042, "num_tokens": 3813696.0, "step": 1835 }, { "entropy": 6.0408408641815186, "epoch": 0.16690856313497823, "grad_norm": 0.9921875, "learning_rate": 0.0004999344954830633, "loss": 6.022, "mean_token_accuracy": 0.14210820943117142, "num_tokens": 3823786.0, "step": 1840 }, { "entropy": 6.0095936298370365, "epoch": 0.16736211901306242, "grad_norm": 1.078125, "learning_rate": 0.0004999337124499638, "loss": 5.9917, "mean_token_accuracy": 0.13492688685655593, "num_tokens": 3835011.0, "step": 1845 }, { "entropy": 6.074155664443969, "epoch": 0.1678156748911466, "grad_norm": 0.95703125, "learning_rate": 0.0004999329247651777, "loss": 6.0408, "mean_token_accuracy": 0.13303120210766792, "num_tokens": 3846161.0, "step": 1850 }, { "entropy": 5.95374641418457, "epoch": 0.16826923076923078, "grad_norm": 1.0546875, "learning_rate": 0.0004999321324287213, "loss": 5.972, "mean_token_accuracy": 0.14118631407618523, "num_tokens": 3856013.0, "step": 1855 }, { "entropy": 6.1738697528839115, "epoch": 0.16872278664731494, "grad_norm": 1.15625, "learning_rate": 0.0004999313354406114, "loss": 6.1002, "mean_token_accuracy": 0.1409381054341793, "num_tokens": 3865521.0, "step": 1860 }, { "entropy": 5.912585163116455, "epoch": 0.16917634252539912, "grad_norm": 1.0078125, "learning_rate": 0.000499930533800864, "loss": 5.9034, "mean_token_accuracy": 0.14283333346247673, "num_tokens": 3876290.0, "step": 1865 }, { "entropy": 5.980841970443725, "epoch": 0.1696298984034833, "grad_norm": 1.0859375, "learning_rate": 0.0004999297275094958, "loss": 6.1048, "mean_token_accuracy": 0.13230404928326606, "num_tokens": 3886437.0, "step": 1870 }, { "entropy": 6.112230062484741, "epoch": 0.1700834542815675, "grad_norm": 1.09375, "learning_rate": 0.0004999289165665235, "loss": 6.1435, "mean_token_accuracy": 0.13440538123250007, "num_tokens": 3896501.0, "step": 1875 }, { "entropy": 6.15153021812439, "epoch": 0.17053701015965167, "grad_norm": 1.1796875, "learning_rate": 0.0004999281009719639, "loss": 6.0671, "mean_token_accuracy": 0.13559964820742607, "num_tokens": 3906725.0, "step": 1880 }, { "entropy": 6.02051043510437, "epoch": 0.17099056603773585, "grad_norm": 0.984375, "learning_rate": 0.0004999272807258339, "loss": 5.9351, "mean_token_accuracy": 0.1449750393629074, "num_tokens": 3917428.0, "step": 1885 }, { "entropy": 5.859882068634033, "epoch": 0.17144412191582004, "grad_norm": 1.1015625, "learning_rate": 0.0004999264558281504, "loss": 6.0304, "mean_token_accuracy": 0.1393364980816841, "num_tokens": 3927298.0, "step": 1890 }, { "entropy": 6.047381448745727, "epoch": 0.17189767779390422, "grad_norm": 1.0703125, "learning_rate": 0.0004999256262789305, "loss": 5.9394, "mean_token_accuracy": 0.1372090183198452, "num_tokens": 3936727.0, "step": 1895 }, { "entropy": 6.062630701065063, "epoch": 0.1723512336719884, "grad_norm": 1.1484375, "learning_rate": 0.0004999247920781913, "loss": 6.0596, "mean_token_accuracy": 0.13730003088712692, "num_tokens": 3947246.0, "step": 1900 }, { "entropy": 5.838617277145386, "epoch": 0.17280478955007256, "grad_norm": 1.015625, "learning_rate": 0.0004999239532259502, "loss": 5.9592, "mean_token_accuracy": 0.14350975602865218, "num_tokens": 3958535.0, "step": 1905 }, { "entropy": 6.161811971664429, "epoch": 0.17325834542815674, "grad_norm": 1.03125, "learning_rate": 0.0004999231097222244, "loss": 6.0521, "mean_token_accuracy": 0.1353868529200554, "num_tokens": 3969635.0, "step": 1910 }, { "entropy": 6.025433874130249, "epoch": 0.17371190130624092, "grad_norm": 1.0234375, "learning_rate": 0.0004999222615670312, "loss": 6.024, "mean_token_accuracy": 0.1359100967645645, "num_tokens": 3980227.0, "step": 1915 }, { "entropy": 6.06690092086792, "epoch": 0.1741654571843251, "grad_norm": 1.0, "learning_rate": 0.0004999214087603885, "loss": 6.0263, "mean_token_accuracy": 0.14165394008159637, "num_tokens": 3990915.0, "step": 1920 }, { "entropy": 5.958260536193848, "epoch": 0.1746190130624093, "grad_norm": 1.03125, "learning_rate": 0.0004999205513023135, "loss": 5.9216, "mean_token_accuracy": 0.13917687460780143, "num_tokens": 4001273.0, "step": 1925 }, { "entropy": 6.072769498825073, "epoch": 0.17507256894049347, "grad_norm": 1.0546875, "learning_rate": 0.0004999196891928245, "loss": 5.994, "mean_token_accuracy": 0.141386017203331, "num_tokens": 4011596.0, "step": 1930 }, { "entropy": 5.960225534439087, "epoch": 0.17552612481857766, "grad_norm": 1.1015625, "learning_rate": 0.0004999188224319388, "loss": 6.0366, "mean_token_accuracy": 0.13730789497494697, "num_tokens": 4022638.0, "step": 1935 }, { "entropy": 6.080376815795899, "epoch": 0.17597968069666184, "grad_norm": 1.109375, "learning_rate": 0.0004999179510196746, "loss": 6.0156, "mean_token_accuracy": 0.13227792233228683, "num_tokens": 4032398.0, "step": 1940 }, { "entropy": 5.898893404006958, "epoch": 0.17643323657474602, "grad_norm": 1.0390625, "learning_rate": 0.0004999170749560498, "loss": 5.9724, "mean_token_accuracy": 0.1371435798704624, "num_tokens": 4042852.0, "step": 1945 }, { "entropy": 6.040456962585449, "epoch": 0.17688679245283018, "grad_norm": 1.140625, "learning_rate": 0.0004999161942410827, "loss": 6.0056, "mean_token_accuracy": 0.1349559858441353, "num_tokens": 4053110.0, "step": 1950 }, { "entropy": 6.002525901794433, "epoch": 0.17734034833091436, "grad_norm": 1.0625, "learning_rate": 0.0004999153088747913, "loss": 6.0212, "mean_token_accuracy": 0.1401715062558651, "num_tokens": 4064571.0, "step": 1955 }, { "entropy": 5.953612756729126, "epoch": 0.17779390420899854, "grad_norm": 1.0390625, "learning_rate": 0.000499914418857194, "loss": 5.9906, "mean_token_accuracy": 0.13749739825725554, "num_tokens": 4075400.0, "step": 1960 }, { "entropy": 6.028836965560913, "epoch": 0.17824746008708273, "grad_norm": 1.0390625, "learning_rate": 0.0004999135241883092, "loss": 5.9439, "mean_token_accuracy": 0.14185010865330697, "num_tokens": 4085763.0, "step": 1965 }, { "entropy": 5.986079740524292, "epoch": 0.1787010159651669, "grad_norm": 1.03125, "learning_rate": 0.0004999126248681555, "loss": 6.0109, "mean_token_accuracy": 0.13681597337126733, "num_tokens": 4095993.0, "step": 1970 }, { "entropy": 5.986701774597168, "epoch": 0.1791545718432511, "grad_norm": 1.171875, "learning_rate": 0.0004999117208967513, "loss": 5.9225, "mean_token_accuracy": 0.1380699433386326, "num_tokens": 4105012.0, "step": 1975 }, { "entropy": 5.942403030395508, "epoch": 0.17960812772133528, "grad_norm": 1.0390625, "learning_rate": 0.0004999108122741154, "loss": 5.9692, "mean_token_accuracy": 0.1353602610528469, "num_tokens": 4115142.0, "step": 1980 }, { "entropy": 6.031651258468628, "epoch": 0.18006168359941946, "grad_norm": 1.0859375, "learning_rate": 0.0004999098990002666, "loss": 5.957, "mean_token_accuracy": 0.13746799603104592, "num_tokens": 4125297.0, "step": 1985 }, { "entropy": 5.977378511428833, "epoch": 0.18051523947750364, "grad_norm": 1.125, "learning_rate": 0.0004999089810752237, "loss": 6.0917, "mean_token_accuracy": 0.132157414406538, "num_tokens": 4136404.0, "step": 1990 }, { "entropy": 6.080759954452515, "epoch": 0.1809687953555878, "grad_norm": 1.0234375, "learning_rate": 0.000499908058499006, "loss": 5.9681, "mean_token_accuracy": 0.14288827329874038, "num_tokens": 4146228.0, "step": 1995 }, { "entropy": 5.95260910987854, "epoch": 0.18142235123367198, "grad_norm": 1.015625, "learning_rate": 0.0004999071312716321, "loss": 5.8708, "mean_token_accuracy": 0.1427669905126095, "num_tokens": 4156435.0, "step": 2000 }, { "entropy": 5.975965404510498, "epoch": 0.18187590711175616, "grad_norm": 1.0078125, "learning_rate": 0.0004999061993931215, "loss": 6.0042, "mean_token_accuracy": 0.1480802610516548, "num_tokens": 4166525.0, "step": 2005 }, { "entropy": 6.0720906257629395, "epoch": 0.18232946298984035, "grad_norm": 1.2734375, "learning_rate": 0.0004999052628634934, "loss": 6.0833, "mean_token_accuracy": 0.13352881222963334, "num_tokens": 4176831.0, "step": 2010 }, { "entropy": 6.019681024551391, "epoch": 0.18278301886792453, "grad_norm": 1.1484375, "learning_rate": 0.0004999043216827671, "loss": 6.06, "mean_token_accuracy": 0.13369136229157447, "num_tokens": 4187830.0, "step": 2015 }, { "entropy": 6.006418657302857, "epoch": 0.1832365747460087, "grad_norm": 0.98828125, "learning_rate": 0.0004999033758509621, "loss": 5.8688, "mean_token_accuracy": 0.1393364667892456, "num_tokens": 4198898.0, "step": 2020 }, { "entropy": 5.97959532737732, "epoch": 0.1836901306240929, "grad_norm": 1.0625, "learning_rate": 0.000499902425368098, "loss": 5.9709, "mean_token_accuracy": 0.1392282821238041, "num_tokens": 4210297.0, "step": 2025 }, { "entropy": 6.037605619430542, "epoch": 0.18414368650217708, "grad_norm": 2.5625, "learning_rate": 0.0004999014702341944, "loss": 6.1283, "mean_token_accuracy": 0.13221636712551116, "num_tokens": 4221469.0, "step": 2030 }, { "entropy": 5.987315082550049, "epoch": 0.18459724238026126, "grad_norm": 1.015625, "learning_rate": 0.0004999005104492712, "loss": 5.9446, "mean_token_accuracy": 0.14053445905447007, "num_tokens": 4233046.0, "step": 2035 }, { "entropy": 6.048150110244751, "epoch": 0.18505079825834542, "grad_norm": 1.125, "learning_rate": 0.0004998995460133481, "loss": 5.9829, "mean_token_accuracy": 0.13854565769433974, "num_tokens": 4243233.0, "step": 2040 }, { "entropy": 6.046663284301758, "epoch": 0.1855043541364296, "grad_norm": 1.0546875, "learning_rate": 0.0004998985769264451, "loss": 6.0973, "mean_token_accuracy": 0.13540371656417846, "num_tokens": 4254020.0, "step": 2045 }, { "entropy": 5.959017562866211, "epoch": 0.18595791001451378, "grad_norm": 1.1171875, "learning_rate": 0.0004998976031885821, "loss": 5.8928, "mean_token_accuracy": 0.14246483519673347, "num_tokens": 4263901.0, "step": 2050 }, { "entropy": 5.890605878829956, "epoch": 0.18641146589259797, "grad_norm": 1.109375, "learning_rate": 0.0004998966247997794, "loss": 5.9255, "mean_token_accuracy": 0.13970548510551453, "num_tokens": 4274814.0, "step": 2055 }, { "entropy": 6.063959264755249, "epoch": 0.18686502177068215, "grad_norm": 1.0859375, "learning_rate": 0.0004998956417600572, "loss": 6.0704, "mean_token_accuracy": 0.1417410969734192, "num_tokens": 4284846.0, "step": 2060 }, { "entropy": 6.033328819274902, "epoch": 0.18731857764876633, "grad_norm": 1.109375, "learning_rate": 0.0004998946540694358, "loss": 5.9731, "mean_token_accuracy": 0.14464445784687996, "num_tokens": 4294862.0, "step": 2065 }, { "entropy": 6.068034410476685, "epoch": 0.18777213352685052, "grad_norm": 1.0234375, "learning_rate": 0.0004998936617279357, "loss": 6.0175, "mean_token_accuracy": 0.1416530877351761, "num_tokens": 4305708.0, "step": 2070 }, { "entropy": 5.995953607559204, "epoch": 0.1882256894049347, "grad_norm": 1.1015625, "learning_rate": 0.0004998926647355773, "loss": 5.9943, "mean_token_accuracy": 0.13258325606584548, "num_tokens": 4315853.0, "step": 2075 }, { "entropy": 5.9227760314941404, "epoch": 0.18867924528301888, "grad_norm": 1.0625, "learning_rate": 0.0004998916630923813, "loss": 5.9565, "mean_token_accuracy": 0.13823306187987328, "num_tokens": 4326607.0, "step": 2080 }, { "entropy": 5.959938955307007, "epoch": 0.18913280116110304, "grad_norm": 1.125, "learning_rate": 0.0004998906567983685, "loss": 5.991, "mean_token_accuracy": 0.13902745693922042, "num_tokens": 4336050.0, "step": 2085 }, { "entropy": 6.056903553009033, "epoch": 0.18958635703918722, "grad_norm": 1.0546875, "learning_rate": 0.0004998896458535595, "loss": 5.9604, "mean_token_accuracy": 0.14332208260893822, "num_tokens": 4345453.0, "step": 2090 }, { "entropy": 5.951250743865967, "epoch": 0.1900399129172714, "grad_norm": 1.0625, "learning_rate": 0.0004998886302579752, "loss": 5.9444, "mean_token_accuracy": 0.1378558337688446, "num_tokens": 4356372.0, "step": 2095 }, { "entropy": 5.958211088180542, "epoch": 0.19049346879535559, "grad_norm": 1.1953125, "learning_rate": 0.000499887610011637, "loss": 6.0014, "mean_token_accuracy": 0.14464358389377593, "num_tokens": 4365500.0, "step": 2100 }, { "entropy": 6.067464399337768, "epoch": 0.19094702467343977, "grad_norm": 1.09375, "learning_rate": 0.0004998865851145656, "loss": 5.9311, "mean_token_accuracy": 0.14481838345527648, "num_tokens": 4375031.0, "step": 2105 }, { "entropy": 5.901741409301758, "epoch": 0.19140058055152395, "grad_norm": 1.0, "learning_rate": 0.0004998855555667822, "loss": 5.972, "mean_token_accuracy": 0.1389401637017727, "num_tokens": 4386409.0, "step": 2110 }, { "entropy": 6.059998941421509, "epoch": 0.19185413642960814, "grad_norm": 1.1171875, "learning_rate": 0.0004998845213683084, "loss": 5.9942, "mean_token_accuracy": 0.13713788390159606, "num_tokens": 4397040.0, "step": 2115 }, { "entropy": 5.938760089874267, "epoch": 0.19230769230769232, "grad_norm": 1.1328125, "learning_rate": 0.0004998834825191652, "loss": 5.9508, "mean_token_accuracy": 0.14106623604893684, "num_tokens": 4406723.0, "step": 2120 }, { "entropy": 6.02097454071045, "epoch": 0.1927612481857765, "grad_norm": 1.171875, "learning_rate": 0.0004998824390193743, "loss": 5.9982, "mean_token_accuracy": 0.14898034185171127, "num_tokens": 4416013.0, "step": 2125 }, { "entropy": 5.96734733581543, "epoch": 0.19321480406386066, "grad_norm": 1.1328125, "learning_rate": 0.0004998813908689573, "loss": 5.9793, "mean_token_accuracy": 0.14236808717250823, "num_tokens": 4426441.0, "step": 2130 }, { "entropy": 6.063247156143189, "epoch": 0.19366835994194484, "grad_norm": 1.2578125, "learning_rate": 0.0004998803380679359, "loss": 6.0948, "mean_token_accuracy": 0.1332187458872795, "num_tokens": 4437328.0, "step": 2135 }, { "entropy": 6.089685106277466, "epoch": 0.19412191582002902, "grad_norm": 1.046875, "learning_rate": 0.0004998792806163317, "loss": 5.9181, "mean_token_accuracy": 0.14083896055817605, "num_tokens": 4447546.0, "step": 2140 }, { "entropy": 5.88359489440918, "epoch": 0.1945754716981132, "grad_norm": 1.0546875, "learning_rate": 0.0004998782185141667, "loss": 5.9561, "mean_token_accuracy": 0.14243533834815025, "num_tokens": 4457319.0, "step": 2145 }, { "entropy": 6.066173934936524, "epoch": 0.1950290275761974, "grad_norm": 1.1171875, "learning_rate": 0.0004998771517614629, "loss": 6.0624, "mean_token_accuracy": 0.13416438773274422, "num_tokens": 4468348.0, "step": 2150 }, { "entropy": 6.009496736526489, "epoch": 0.19548258345428157, "grad_norm": 1.203125, "learning_rate": 0.0004998760803582422, "loss": 5.9612, "mean_token_accuracy": 0.14601074978709222, "num_tokens": 4478263.0, "step": 2155 }, { "entropy": 5.905720138549805, "epoch": 0.19593613933236576, "grad_norm": 1.296875, "learning_rate": 0.0004998750043045269, "loss": 5.8817, "mean_token_accuracy": 0.14295333474874497, "num_tokens": 4488772.0, "step": 2160 }, { "entropy": 6.011665964126587, "epoch": 0.19638969521044994, "grad_norm": 1.078125, "learning_rate": 0.0004998739236003392, "loss": 5.9905, "mean_token_accuracy": 0.13327775821089743, "num_tokens": 4499443.0, "step": 2165 }, { "entropy": 5.983055496215821, "epoch": 0.1968432510885341, "grad_norm": 1.0859375, "learning_rate": 0.0004998728382457014, "loss": 5.9876, "mean_token_accuracy": 0.13847402930259706, "num_tokens": 4509969.0, "step": 2170 }, { "entropy": 6.022305631637574, "epoch": 0.19729680696661828, "grad_norm": 1.125, "learning_rate": 0.0004998717482406362, "loss": 5.979, "mean_token_accuracy": 0.14845634549856185, "num_tokens": 4519668.0, "step": 2175 }, { "entropy": 5.9130627632141115, "epoch": 0.19775036284470246, "grad_norm": 1.078125, "learning_rate": 0.0004998706535851657, "loss": 5.9578, "mean_token_accuracy": 0.14601308181881906, "num_tokens": 4530303.0, "step": 2180 }, { "entropy": 5.992128801345825, "epoch": 0.19820391872278664, "grad_norm": 1.046875, "learning_rate": 0.0004998695542793129, "loss": 6.0187, "mean_token_accuracy": 0.14158663749694825, "num_tokens": 4541801.0, "step": 2185 }, { "entropy": 5.938469648361206, "epoch": 0.19865747460087083, "grad_norm": 1.1328125, "learning_rate": 0.0004998684503231003, "loss": 5.8341, "mean_token_accuracy": 0.1426684334874153, "num_tokens": 4551346.0, "step": 2190 }, { "entropy": 5.922765111923217, "epoch": 0.199111030478955, "grad_norm": 1.1953125, "learning_rate": 0.000499867341716551, "loss": 5.915, "mean_token_accuracy": 0.14817361980676652, "num_tokens": 4561835.0, "step": 2195 }, { "entropy": 5.904284858703614, "epoch": 0.1995645863570392, "grad_norm": 0.98828125, "learning_rate": 0.0004998662284596878, "loss": 5.8667, "mean_token_accuracy": 0.145841383934021, "num_tokens": 4572760.0, "step": 2200 }, { "entropy": 5.936977243423462, "epoch": 0.20001814223512338, "grad_norm": 1.1328125, "learning_rate": 0.0004998651105525335, "loss": 5.9473, "mean_token_accuracy": 0.14006382599473, "num_tokens": 4582884.0, "step": 2205 }, { "entropy": 5.961916112899781, "epoch": 0.20047169811320756, "grad_norm": 1.09375, "learning_rate": 0.0004998639879951115, "loss": 5.9315, "mean_token_accuracy": 0.14331716150045395, "num_tokens": 4594297.0, "step": 2210 }, { "entropy": 5.988901615142822, "epoch": 0.2009252539912917, "grad_norm": 1.0390625, "learning_rate": 0.000499862860787445, "loss": 5.9907, "mean_token_accuracy": 0.13747334852814674, "num_tokens": 4605072.0, "step": 2215 }, { "entropy": 5.911744117736816, "epoch": 0.2013788098693759, "grad_norm": 1.203125, "learning_rate": 0.0004998617289295571, "loss": 5.8751, "mean_token_accuracy": 0.15403711050748825, "num_tokens": 4615207.0, "step": 2220 }, { "entropy": 5.916146278381348, "epoch": 0.20183236574746008, "grad_norm": 1.0859375, "learning_rate": 0.0004998605924214714, "loss": 5.9039, "mean_token_accuracy": 0.14326297491788864, "num_tokens": 4625552.0, "step": 2225 }, { "entropy": 6.068982744216919, "epoch": 0.20228592162554426, "grad_norm": 1.1015625, "learning_rate": 0.0004998594512632114, "loss": 6.0052, "mean_token_accuracy": 0.13947765678167343, "num_tokens": 4635864.0, "step": 2230 }, { "entropy": 5.9241475582122805, "epoch": 0.20273947750362845, "grad_norm": 1.171875, "learning_rate": 0.0004998583054548006, "loss": 5.9602, "mean_token_accuracy": 0.13143666759133338, "num_tokens": 4646978.0, "step": 2235 }, { "entropy": 5.949285650253296, "epoch": 0.20319303338171263, "grad_norm": 1.125, "learning_rate": 0.0004998571549962628, "loss": 5.8858, "mean_token_accuracy": 0.14171508550643921, "num_tokens": 4656737.0, "step": 2240 }, { "entropy": 5.886570167541504, "epoch": 0.2036465892597968, "grad_norm": 1.0703125, "learning_rate": 0.0004998559998876216, "loss": 6.0072, "mean_token_accuracy": 0.14202161729335785, "num_tokens": 4667663.0, "step": 2245 }, { "entropy": 5.985239171981812, "epoch": 0.204100145137881, "grad_norm": 1.078125, "learning_rate": 0.0004998548401289012, "loss": 5.9673, "mean_token_accuracy": 0.13756298944354056, "num_tokens": 4678814.0, "step": 2250 }, { "entropy": 6.042722129821778, "epoch": 0.20455370101596518, "grad_norm": 1.140625, "learning_rate": 0.0004998536757201253, "loss": 5.9821, "mean_token_accuracy": 0.13774357065558435, "num_tokens": 4689446.0, "step": 2255 }, { "entropy": 5.971980857849121, "epoch": 0.20500725689404933, "grad_norm": 1.125, "learning_rate": 0.0004998525066613181, "loss": 5.993, "mean_token_accuracy": 0.13813588321208953, "num_tokens": 4700207.0, "step": 2260 }, { "entropy": 6.003995275497436, "epoch": 0.20546081277213352, "grad_norm": 1.0703125, "learning_rate": 0.0004998513329525038, "loss": 5.9595, "mean_token_accuracy": 0.1428474046289921, "num_tokens": 4710743.0, "step": 2265 }, { "entropy": 5.981139850616455, "epoch": 0.2059143686502177, "grad_norm": 1.1015625, "learning_rate": 0.0004998501545937066, "loss": 5.9624, "mean_token_accuracy": 0.14789393842220305, "num_tokens": 4720964.0, "step": 2270 }, { "entropy": 5.965071296691894, "epoch": 0.20636792452830188, "grad_norm": 1.1171875, "learning_rate": 0.000499848971584951, "loss": 6.001, "mean_token_accuracy": 0.13834339007735252, "num_tokens": 4732022.0, "step": 2275 }, { "entropy": 5.995220470428467, "epoch": 0.20682148040638607, "grad_norm": 0.9765625, "learning_rate": 0.0004998477839262611, "loss": 5.9789, "mean_token_accuracy": 0.13753922730684282, "num_tokens": 4743428.0, "step": 2280 }, { "entropy": 5.996651983261108, "epoch": 0.20727503628447025, "grad_norm": 1.078125, "learning_rate": 0.000499846591617662, "loss": 5.9059, "mean_token_accuracy": 0.14165481328964233, "num_tokens": 4754530.0, "step": 2285 }, { "entropy": 5.848381853103637, "epoch": 0.20772859216255443, "grad_norm": 1.140625, "learning_rate": 0.0004998453946591779, "loss": 5.8387, "mean_token_accuracy": 0.14721979647874833, "num_tokens": 4764453.0, "step": 2290 }, { "entropy": 6.030099821090698, "epoch": 0.20818214804063861, "grad_norm": 1.109375, "learning_rate": 0.0004998441930508339, "loss": 6.0122, "mean_token_accuracy": 0.14176427572965622, "num_tokens": 4774788.0, "step": 2295 }, { "entropy": 5.991954565048218, "epoch": 0.2086357039187228, "grad_norm": 1.203125, "learning_rate": 0.0004998429867926547, "loss": 5.9593, "mean_token_accuracy": 0.1358835816383362, "num_tokens": 4785827.0, "step": 2300 }, { "entropy": 5.9251960754394535, "epoch": 0.20908925979680695, "grad_norm": 1.1484375, "learning_rate": 0.0004998417758846651, "loss": 5.836, "mean_token_accuracy": 0.15004699677228928, "num_tokens": 4795683.0, "step": 2305 }, { "entropy": 5.960970211029053, "epoch": 0.20954281567489114, "grad_norm": 1.203125, "learning_rate": 0.0004998405603268903, "loss": 5.9322, "mean_token_accuracy": 0.14288516640663146, "num_tokens": 4805929.0, "step": 2310 }, { "entropy": 5.915129613876343, "epoch": 0.20999637155297532, "grad_norm": 1.0390625, "learning_rate": 0.0004998393401193554, "loss": 5.9297, "mean_token_accuracy": 0.14064979255199433, "num_tokens": 4816067.0, "step": 2315 }, { "entropy": 5.940646457672119, "epoch": 0.2104499274310595, "grad_norm": 1.171875, "learning_rate": 0.0004998381152620857, "loss": 5.9153, "mean_token_accuracy": 0.1419698029756546, "num_tokens": 4826757.0, "step": 2320 }, { "entropy": 5.9893388748168945, "epoch": 0.21090348330914369, "grad_norm": 1.15625, "learning_rate": 0.0004998368857551067, "loss": 5.9248, "mean_token_accuracy": 0.14424414560198784, "num_tokens": 4836548.0, "step": 2325 }, { "entropy": 6.0586730480194095, "epoch": 0.21135703918722787, "grad_norm": 1.1328125, "learning_rate": 0.0004998356515984433, "loss": 5.9785, "mean_token_accuracy": 0.13741380125284194, "num_tokens": 4847274.0, "step": 2330 }, { "entropy": 5.959125995635986, "epoch": 0.21181059506531205, "grad_norm": 1.140625, "learning_rate": 0.0004998344127921213, "loss": 5.9483, "mean_token_accuracy": 0.1400488071143627, "num_tokens": 4857506.0, "step": 2335 }, { "entropy": 5.960813760757446, "epoch": 0.21226415094339623, "grad_norm": 1.140625, "learning_rate": 0.0004998331693361666, "loss": 5.9773, "mean_token_accuracy": 0.1386716030538082, "num_tokens": 4868069.0, "step": 2340 }, { "entropy": 5.946921539306641, "epoch": 0.21271770682148042, "grad_norm": 1.125, "learning_rate": 0.0004998319212306046, "loss": 5.8775, "mean_token_accuracy": 0.14960167706012725, "num_tokens": 4877731.0, "step": 2345 }, { "entropy": 5.923819208145142, "epoch": 0.21317126269956457, "grad_norm": 1.0625, "learning_rate": 0.000499830668475461, "loss": 5.9369, "mean_token_accuracy": 0.13987276405096055, "num_tokens": 4887780.0, "step": 2350 }, { "entropy": 5.958174419403076, "epoch": 0.21362481857764876, "grad_norm": 1.0078125, "learning_rate": 0.000499829411070762, "loss": 5.9577, "mean_token_accuracy": 0.14128173291683196, "num_tokens": 4897578.0, "step": 2355 }, { "entropy": 5.871128082275391, "epoch": 0.21407837445573294, "grad_norm": 1.109375, "learning_rate": 0.0004998281490165335, "loss": 5.9053, "mean_token_accuracy": 0.13984225764870645, "num_tokens": 4908187.0, "step": 2360 }, { "entropy": 6.030574989318848, "epoch": 0.21453193033381712, "grad_norm": 1.171875, "learning_rate": 0.0004998268823128016, "loss": 5.9289, "mean_token_accuracy": 0.14696599096059798, "num_tokens": 4918352.0, "step": 2365 }, { "entropy": 5.877168655395508, "epoch": 0.2149854862119013, "grad_norm": 1.109375, "learning_rate": 0.0004998256109595923, "loss": 5.8947, "mean_token_accuracy": 0.14657547250390052, "num_tokens": 4928065.0, "step": 2370 }, { "entropy": 5.952869129180908, "epoch": 0.2154390420899855, "grad_norm": 1.046875, "learning_rate": 0.0004998243349569323, "loss": 5.9084, "mean_token_accuracy": 0.14537300616502763, "num_tokens": 4939492.0, "step": 2375 }, { "entropy": 5.872677612304687, "epoch": 0.21589259796806967, "grad_norm": 1.2109375, "learning_rate": 0.0004998230543048477, "loss": 5.8546, "mean_token_accuracy": 0.14155039489269255, "num_tokens": 4949304.0, "step": 2380 }, { "entropy": 5.894457006454468, "epoch": 0.21634615384615385, "grad_norm": 1.09375, "learning_rate": 0.000499821769003365, "loss": 5.8853, "mean_token_accuracy": 0.1352695107460022, "num_tokens": 4959649.0, "step": 2385 }, { "entropy": 5.9166566848754885, "epoch": 0.21679970972423804, "grad_norm": 1.1640625, "learning_rate": 0.0004998204790525109, "loss": 5.9306, "mean_token_accuracy": 0.13895038962364198, "num_tokens": 4970029.0, "step": 2390 }, { "entropy": 5.966705751419068, "epoch": 0.2172532656023222, "grad_norm": 1.15625, "learning_rate": 0.0004998191844523119, "loss": 5.8501, "mean_token_accuracy": 0.14436866864562034, "num_tokens": 4980431.0, "step": 2395 }, { "entropy": 5.862818002700806, "epoch": 0.21770682148040638, "grad_norm": 1.09375, "learning_rate": 0.000499817885202795, "loss": 5.9549, "mean_token_accuracy": 0.14049403220415116, "num_tokens": 4991448.0, "step": 2400 }, { "entropy": 5.938876914978027, "epoch": 0.21816037735849056, "grad_norm": 1.1640625, "learning_rate": 0.0004998165813039869, "loss": 5.8976, "mean_token_accuracy": 0.1356552518904209, "num_tokens": 5001225.0, "step": 2405 }, { "entropy": 5.924232530593872, "epoch": 0.21861393323657474, "grad_norm": 1.0703125, "learning_rate": 0.0004998152727559145, "loss": 5.8808, "mean_token_accuracy": 0.14155457615852357, "num_tokens": 5012096.0, "step": 2410 }, { "entropy": 5.954684495925903, "epoch": 0.21906748911465893, "grad_norm": 1.2578125, "learning_rate": 0.000499813959558605, "loss": 5.9579, "mean_token_accuracy": 0.13705262392759324, "num_tokens": 5021675.0, "step": 2415 }, { "entropy": 5.930799150466919, "epoch": 0.2195210449927431, "grad_norm": 1.1484375, "learning_rate": 0.0004998126417120856, "loss": 5.9114, "mean_token_accuracy": 0.1381124421954155, "num_tokens": 5032250.0, "step": 2420 }, { "entropy": 5.906846952438355, "epoch": 0.2199746008708273, "grad_norm": 1.0703125, "learning_rate": 0.0004998113192163835, "loss": 5.9758, "mean_token_accuracy": 0.13671192824840545, "num_tokens": 5042508.0, "step": 2425 }, { "entropy": 6.031311511993408, "epoch": 0.22042815674891147, "grad_norm": 1.28125, "learning_rate": 0.000499809992071526, "loss": 5.8645, "mean_token_accuracy": 0.14089929684996605, "num_tokens": 5052765.0, "step": 2430 }, { "entropy": 5.894246578216553, "epoch": 0.22088171262699566, "grad_norm": 1.2109375, "learning_rate": 0.0004998086602775406, "loss": 5.8884, "mean_token_accuracy": 0.14432070553302764, "num_tokens": 5062379.0, "step": 2435 }, { "entropy": 5.954690265655517, "epoch": 0.2213352685050798, "grad_norm": 1.3359375, "learning_rate": 0.0004998073238344547, "loss": 5.9271, "mean_token_accuracy": 0.14122223407030104, "num_tokens": 5072267.0, "step": 2440 }, { "entropy": 5.857289552688599, "epoch": 0.221788824383164, "grad_norm": 1.15625, "learning_rate": 0.0004998059827422962, "loss": 5.8285, "mean_token_accuracy": 0.1439412847161293, "num_tokens": 5082214.0, "step": 2445 }, { "entropy": 5.875279474258423, "epoch": 0.22224238026124818, "grad_norm": 1.2421875, "learning_rate": 0.0004998046370010926, "loss": 5.8849, "mean_token_accuracy": 0.14643458500504494, "num_tokens": 5092129.0, "step": 2450 }, { "entropy": 5.914616823196411, "epoch": 0.22269593613933236, "grad_norm": 1.09375, "learning_rate": 0.0004998032866108718, "loss": 5.903, "mean_token_accuracy": 0.13629107251763345, "num_tokens": 5102924.0, "step": 2455 }, { "entropy": 5.9880273818969725, "epoch": 0.22314949201741655, "grad_norm": 1.140625, "learning_rate": 0.0004998019315716618, "loss": 5.8787, "mean_token_accuracy": 0.1420026421546936, "num_tokens": 5113216.0, "step": 2460 }, { "entropy": 5.792202377319336, "epoch": 0.22360304789550073, "grad_norm": 1.2890625, "learning_rate": 0.0004998005718834905, "loss": 5.8578, "mean_token_accuracy": 0.1403028056025505, "num_tokens": 5122978.0, "step": 2465 }, { "entropy": 5.964217710494995, "epoch": 0.2240566037735849, "grad_norm": 1.140625, "learning_rate": 0.0004997992075463862, "loss": 5.9519, "mean_token_accuracy": 0.14088138267397882, "num_tokens": 5133167.0, "step": 2470 }, { "entropy": 5.898852062225342, "epoch": 0.2245101596516691, "grad_norm": 1.234375, "learning_rate": 0.0004997978385603769, "loss": 5.8241, "mean_token_accuracy": 0.14743937328457832, "num_tokens": 5143848.0, "step": 2475 }, { "entropy": 5.9200560569763185, "epoch": 0.22496371552975328, "grad_norm": 1.25, "learning_rate": 0.0004997964649254911, "loss": 5.8611, "mean_token_accuracy": 0.15123707801103592, "num_tokens": 5154172.0, "step": 2480 }, { "entropy": 5.81275691986084, "epoch": 0.22541727140783743, "grad_norm": 1.21875, "learning_rate": 0.0004997950866417572, "loss": 5.8186, "mean_token_accuracy": 0.1486186221241951, "num_tokens": 5164459.0, "step": 2485 }, { "entropy": 5.979988098144531, "epoch": 0.22587082728592162, "grad_norm": 1.109375, "learning_rate": 0.0004997937037092034, "loss": 5.9206, "mean_token_accuracy": 0.13727832362055778, "num_tokens": 5175751.0, "step": 2490 }, { "entropy": 5.904782056808472, "epoch": 0.2263243831640058, "grad_norm": 1.0859375, "learning_rate": 0.0004997923161278587, "loss": 5.836, "mean_token_accuracy": 0.1466525003314018, "num_tokens": 5186004.0, "step": 2495 }, { "entropy": 5.8142805099487305, "epoch": 0.22677793904208998, "grad_norm": 1.1953125, "learning_rate": 0.0004997909238977514, "loss": 5.7535, "mean_token_accuracy": 0.1469535768032074, "num_tokens": 5195610.0, "step": 2500 }, { "entropy": 5.915460872650146, "epoch": 0.22723149492017417, "grad_norm": 1.2734375, "learning_rate": 0.0004997895270189108, "loss": 5.9106, "mean_token_accuracy": 0.1398490011692047, "num_tokens": 5205607.0, "step": 2505 }, { "entropy": 5.935828447341919, "epoch": 0.22768505079825835, "grad_norm": 1.1640625, "learning_rate": 0.0004997881254913653, "loss": 5.8928, "mean_token_accuracy": 0.1415001295506954, "num_tokens": 5217372.0, "step": 2510 }, { "entropy": 5.895864343643188, "epoch": 0.22813860667634253, "grad_norm": 1.21875, "learning_rate": 0.0004997867193151441, "loss": 5.8553, "mean_token_accuracy": 0.14375398457050323, "num_tokens": 5226782.0, "step": 2515 }, { "entropy": 5.875649499893188, "epoch": 0.22859216255442671, "grad_norm": 1.171875, "learning_rate": 0.0004997853084902763, "loss": 5.7915, "mean_token_accuracy": 0.1496797136962414, "num_tokens": 5236209.0, "step": 2520 }, { "entropy": 5.870350313186646, "epoch": 0.2290457184325109, "grad_norm": 1.2109375, "learning_rate": 0.0004997838930167911, "loss": 5.8964, "mean_token_accuracy": 0.14222536683082582, "num_tokens": 5246041.0, "step": 2525 }, { "entropy": 5.970703125, "epoch": 0.22949927431059505, "grad_norm": 1.0703125, "learning_rate": 0.0004997824728947176, "loss": 5.8557, "mean_token_accuracy": 0.14660589545965194, "num_tokens": 5256902.0, "step": 2530 }, { "entropy": 5.928110027313233, "epoch": 0.22995283018867924, "grad_norm": 1.1875, "learning_rate": 0.0004997810481240853, "loss": 5.8547, "mean_token_accuracy": 0.14946367517113684, "num_tokens": 5266180.0, "step": 2535 }, { "entropy": 5.936565351486206, "epoch": 0.23040638606676342, "grad_norm": 1.1875, "learning_rate": 0.0004997796187049238, "loss": 6.0483, "mean_token_accuracy": 0.13646556437015533, "num_tokens": 5277475.0, "step": 2540 }, { "entropy": 6.029916381835937, "epoch": 0.2308599419448476, "grad_norm": 1.09375, "learning_rate": 0.0004997781846372623, "loss": 5.8693, "mean_token_accuracy": 0.14439473375678064, "num_tokens": 5287108.0, "step": 2545 }, { "entropy": 5.854767751693726, "epoch": 0.23131349782293179, "grad_norm": 1.25, "learning_rate": 0.0004997767459211307, "loss": 5.9654, "mean_token_accuracy": 0.13685449138283728, "num_tokens": 5297598.0, "step": 2550 }, { "entropy": 6.062006139755249, "epoch": 0.23176705370101597, "grad_norm": 1.1796875, "learning_rate": 0.0004997753025565587, "loss": 5.9442, "mean_token_accuracy": 0.1358692966401577, "num_tokens": 5306953.0, "step": 2555 }, { "entropy": 5.887425899505615, "epoch": 0.23222060957910015, "grad_norm": 1.0859375, "learning_rate": 0.0004997738545435763, "loss": 5.9399, "mean_token_accuracy": 0.15026361793279647, "num_tokens": 5317608.0, "step": 2560 }, { "entropy": 5.862730932235718, "epoch": 0.23267416545718433, "grad_norm": 1.1015625, "learning_rate": 0.0004997724018822133, "loss": 5.8058, "mean_token_accuracy": 0.13242100477218627, "num_tokens": 5328503.0, "step": 2565 }, { "entropy": 5.914726114273071, "epoch": 0.23312772133526852, "grad_norm": 1.203125, "learning_rate": 0.0004997709445724996, "loss": 5.883, "mean_token_accuracy": 0.14427884221076964, "num_tokens": 5338108.0, "step": 2570 }, { "entropy": 5.95159878730774, "epoch": 0.23358127721335267, "grad_norm": 1.1484375, "learning_rate": 0.0004997694826144656, "loss": 6.04, "mean_token_accuracy": 0.13466350510716438, "num_tokens": 5349890.0, "step": 2575 }, { "entropy": 6.051620054244995, "epoch": 0.23403483309143686, "grad_norm": 1.1953125, "learning_rate": 0.0004997680160081414, "loss": 6.0118, "mean_token_accuracy": 0.1407109409570694, "num_tokens": 5361319.0, "step": 2580 }, { "entropy": 5.919955205917359, "epoch": 0.23448838896952104, "grad_norm": 1.1953125, "learning_rate": 0.0004997665447535573, "loss": 5.9219, "mean_token_accuracy": 0.14855802059173584, "num_tokens": 5370932.0, "step": 2585 }, { "entropy": 5.9046718120574955, "epoch": 0.23494194484760522, "grad_norm": 1.234375, "learning_rate": 0.0004997650688507438, "loss": 5.843, "mean_token_accuracy": 0.14306004494428634, "num_tokens": 5381661.0, "step": 2590 }, { "entropy": 5.818372058868408, "epoch": 0.2353955007256894, "grad_norm": 1.1484375, "learning_rate": 0.0004997635882997314, "loss": 5.8143, "mean_token_accuracy": 0.14963757395744323, "num_tokens": 5390999.0, "step": 2595 }, { "entropy": 5.943971872329712, "epoch": 0.2358490566037736, "grad_norm": 1.1953125, "learning_rate": 0.0004997621031005507, "loss": 5.9085, "mean_token_accuracy": 0.14275056049227713, "num_tokens": 5401175.0, "step": 2600 }, { "entropy": 5.954121685028076, "epoch": 0.23630261248185777, "grad_norm": 1.140625, "learning_rate": 0.0004997606132532325, "loss": 5.8747, "mean_token_accuracy": 0.14469726160168647, "num_tokens": 5411644.0, "step": 2605 }, { "entropy": 5.812447595596313, "epoch": 0.23675616835994195, "grad_norm": 1.1171875, "learning_rate": 0.0004997591187578075, "loss": 5.8496, "mean_token_accuracy": 0.14814821630716324, "num_tokens": 5420923.0, "step": 2610 }, { "entropy": 5.941586923599243, "epoch": 0.23720972423802614, "grad_norm": 1.0546875, "learning_rate": 0.0004997576196143067, "loss": 5.8974, "mean_token_accuracy": 0.14263342320919037, "num_tokens": 5431475.0, "step": 2615 }, { "entropy": 5.9011571407318115, "epoch": 0.2376632801161103, "grad_norm": 1.15625, "learning_rate": 0.000499756115822761, "loss": 5.8093, "mean_token_accuracy": 0.14849388152360915, "num_tokens": 5441822.0, "step": 2620 }, { "entropy": 5.8005060195922855, "epoch": 0.23811683599419448, "grad_norm": 0.96484375, "learning_rate": 0.0004997546073832015, "loss": 5.8219, "mean_token_accuracy": 0.13821850046515466, "num_tokens": 5453266.0, "step": 2625 }, { "entropy": 5.917859411239624, "epoch": 0.23857039187227866, "grad_norm": 1.1640625, "learning_rate": 0.0004997530942956595, "loss": 5.8634, "mean_token_accuracy": 0.14885092675685882, "num_tokens": 5463023.0, "step": 2630 }, { "entropy": 5.934016132354737, "epoch": 0.23902394775036284, "grad_norm": 1.109375, "learning_rate": 0.0004997515765601662, "loss": 5.8566, "mean_token_accuracy": 0.14655044227838515, "num_tokens": 5472345.0, "step": 2635 }, { "entropy": 5.923844289779663, "epoch": 0.23947750362844702, "grad_norm": 1.1875, "learning_rate": 0.0004997500541767531, "loss": 5.9059, "mean_token_accuracy": 0.1498401679098606, "num_tokens": 5481468.0, "step": 2640 }, { "entropy": 5.773250436782837, "epoch": 0.2399310595065312, "grad_norm": 1.0859375, "learning_rate": 0.0004997485271454516, "loss": 5.8461, "mean_token_accuracy": 0.14630547761917115, "num_tokens": 5492107.0, "step": 2645 }, { "entropy": 5.871908712387085, "epoch": 0.2403846153846154, "grad_norm": 1.3203125, "learning_rate": 0.0004997469954662933, "loss": 5.8771, "mean_token_accuracy": 0.1383388437330723, "num_tokens": 5502196.0, "step": 2650 }, { "entropy": 5.904657554626465, "epoch": 0.24083817126269957, "grad_norm": 1.1328125, "learning_rate": 0.0004997454591393097, "loss": 5.8693, "mean_token_accuracy": 0.1385428823530674, "num_tokens": 5512859.0, "step": 2655 }, { "entropy": 5.975746059417725, "epoch": 0.24129172714078376, "grad_norm": 1.2109375, "learning_rate": 0.0004997439181645329, "loss": 5.8498, "mean_token_accuracy": 0.14605885297060012, "num_tokens": 5523041.0, "step": 2660 }, { "entropy": 5.764354801177978, "epoch": 0.2417452830188679, "grad_norm": 1.125, "learning_rate": 0.0004997423725419945, "loss": 5.761, "mean_token_accuracy": 0.15253512784838677, "num_tokens": 5533967.0, "step": 2665 }, { "entropy": 5.947396564483642, "epoch": 0.2421988388969521, "grad_norm": 1.2421875, "learning_rate": 0.0004997408222717267, "loss": 5.8664, "mean_token_accuracy": 0.14548483043909072, "num_tokens": 5543460.0, "step": 2670 }, { "entropy": 5.93350305557251, "epoch": 0.24265239477503628, "grad_norm": 1.265625, "learning_rate": 0.0004997392673537612, "loss": 5.8592, "mean_token_accuracy": 0.1520221307873726, "num_tokens": 5553139.0, "step": 2675 }, { "entropy": 5.793046188354492, "epoch": 0.24310595065312046, "grad_norm": 1.15625, "learning_rate": 0.0004997377077881306, "loss": 5.8541, "mean_token_accuracy": 0.1441502094268799, "num_tokens": 5564550.0, "step": 2680 }, { "entropy": 5.9918012619018555, "epoch": 0.24355950653120464, "grad_norm": 1.1640625, "learning_rate": 0.0004997361435748668, "loss": 5.9546, "mean_token_accuracy": 0.1459794595837593, "num_tokens": 5574393.0, "step": 2685 }, { "entropy": 5.940083932876587, "epoch": 0.24401306240928883, "grad_norm": 1.140625, "learning_rate": 0.0004997345747140024, "loss": 5.8813, "mean_token_accuracy": 0.14294293597340585, "num_tokens": 5584206.0, "step": 2690 }, { "entropy": 5.877155923843384, "epoch": 0.244466618287373, "grad_norm": 1.1171875, "learning_rate": 0.0004997330012055695, "loss": 5.8873, "mean_token_accuracy": 0.1417349547147751, "num_tokens": 5594946.0, "step": 2695 }, { "entropy": 5.921493816375732, "epoch": 0.2449201741654572, "grad_norm": 1.2109375, "learning_rate": 0.0004997314230496011, "loss": 5.7744, "mean_token_accuracy": 0.14902272820472717, "num_tokens": 5605984.0, "step": 2700 }, { "entropy": 5.776959466934204, "epoch": 0.24537373004354138, "grad_norm": 1.0859375, "learning_rate": 0.0004997298402461296, "loss": 5.8131, "mean_token_accuracy": 0.1488720089197159, "num_tokens": 5616227.0, "step": 2705 }, { "entropy": 5.935484266281128, "epoch": 0.24582728592162553, "grad_norm": 1.109375, "learning_rate": 0.0004997282527951876, "loss": 5.9032, "mean_token_accuracy": 0.14310448318719865, "num_tokens": 5626592.0, "step": 2710 }, { "entropy": 6.0017767429351805, "epoch": 0.24628084179970972, "grad_norm": 1.4296875, "learning_rate": 0.0004997266606968081, "loss": 5.8379, "mean_token_accuracy": 0.14523325935006143, "num_tokens": 5636486.0, "step": 2715 }, { "entropy": 5.846785545349121, "epoch": 0.2467343976777939, "grad_norm": 1.2109375, "learning_rate": 0.0004997250639510241, "loss": 5.9128, "mean_token_accuracy": 0.14552611336112023, "num_tokens": 5646025.0, "step": 2720 }, { "entropy": 5.828639936447144, "epoch": 0.24718795355587808, "grad_norm": 1.2578125, "learning_rate": 0.0004997234625578684, "loss": 5.7968, "mean_token_accuracy": 0.1471302717924118, "num_tokens": 5656523.0, "step": 2725 }, { "entropy": 5.8145918369293215, "epoch": 0.24764150943396226, "grad_norm": 1.125, "learning_rate": 0.0004997218565173742, "loss": 5.8303, "mean_token_accuracy": 0.14437200129032135, "num_tokens": 5667598.0, "step": 2730 }, { "entropy": 5.928363561630249, "epoch": 0.24809506531204645, "grad_norm": 1.125, "learning_rate": 0.0004997202458295748, "loss": 5.8606, "mean_token_accuracy": 0.14459095299243926, "num_tokens": 5677721.0, "step": 2735 }, { "entropy": 5.847347164154053, "epoch": 0.24854862119013063, "grad_norm": 1.1328125, "learning_rate": 0.0004997186304945034, "loss": 5.8416, "mean_token_accuracy": 0.1417038306593895, "num_tokens": 5688450.0, "step": 2740 }, { "entropy": 5.865340757369995, "epoch": 0.24900217706821481, "grad_norm": 1.2265625, "learning_rate": 0.0004997170105121935, "loss": 5.8208, "mean_token_accuracy": 0.1495169907808304, "num_tokens": 5698142.0, "step": 2745 }, { "entropy": 5.833406114578247, "epoch": 0.249455732946299, "grad_norm": 1.2421875, "learning_rate": 0.0004997153858826786, "loss": 5.8201, "mean_token_accuracy": 0.1465844228863716, "num_tokens": 5708122.0, "step": 2750 }, { "entropy": 5.837479496002198, "epoch": 0.24990928882438315, "grad_norm": 1.2265625, "learning_rate": 0.0004997137566059922, "loss": 5.8107, "mean_token_accuracy": 0.14600400999188423, "num_tokens": 5718671.0, "step": 2755 }, { "entropy": 5.8692303657531735, "epoch": 0.25036284470246734, "grad_norm": 1.2265625, "learning_rate": 0.0004997121226821681, "loss": 5.8171, "mean_token_accuracy": 0.14405162036418914, "num_tokens": 5729463.0, "step": 2760 }, { "entropy": 5.922516870498657, "epoch": 0.25081640058055155, "grad_norm": 1.1484375, "learning_rate": 0.00049971048411124, "loss": 5.8874, "mean_token_accuracy": 0.14321258664131165, "num_tokens": 5739212.0, "step": 2765 }, { "entropy": 5.901452112197876, "epoch": 0.2512699564586357, "grad_norm": 1.2890625, "learning_rate": 0.0004997088408932418, "loss": 5.8029, "mean_token_accuracy": 0.14497288316488266, "num_tokens": 5749159.0, "step": 2770 }, { "entropy": 5.932657766342163, "epoch": 0.25172351233671986, "grad_norm": 0.97265625, "learning_rate": 0.0004997071930282076, "loss": 5.993, "mean_token_accuracy": 0.13827754259109498, "num_tokens": 5759711.0, "step": 2775 }, { "entropy": 6.124020576477051, "epoch": 0.25217706821480407, "grad_norm": 1.1796875, "learning_rate": 0.0004997055405161712, "loss": 6.0043, "mean_token_accuracy": 0.1372769333422184, "num_tokens": 5771210.0, "step": 2780 }, { "entropy": 5.816952276229858, "epoch": 0.2526306240928882, "grad_norm": 1.1640625, "learning_rate": 0.0004997038833571671, "loss": 5.8426, "mean_token_accuracy": 0.14726067781448365, "num_tokens": 5780960.0, "step": 2785 }, { "entropy": 5.935285472869873, "epoch": 0.25308417997097243, "grad_norm": 1.1171875, "learning_rate": 0.0004997022215512295, "loss": 5.885, "mean_token_accuracy": 0.14095496237277985, "num_tokens": 5790891.0, "step": 2790 }, { "entropy": 5.894222116470337, "epoch": 0.2535377358490566, "grad_norm": 1.1328125, "learning_rate": 0.0004997005550983925, "loss": 5.8396, "mean_token_accuracy": 0.14395667985081673, "num_tokens": 5801078.0, "step": 2795 }, { "entropy": 5.885415887832641, "epoch": 0.2539912917271408, "grad_norm": 1.3515625, "learning_rate": 0.000499698883998691, "loss": 5.9003, "mean_token_accuracy": 0.1393453024327755, "num_tokens": 5811025.0, "step": 2800 }, { "entropy": 5.909905290603637, "epoch": 0.25444484760522496, "grad_norm": 1.1484375, "learning_rate": 0.0004996972082521591, "loss": 5.8086, "mean_token_accuracy": 0.1448357567191124, "num_tokens": 5821242.0, "step": 2805 }, { "entropy": 5.845452737808228, "epoch": 0.25489840348330917, "grad_norm": 1.1015625, "learning_rate": 0.0004996955278588319, "loss": 5.8592, "mean_token_accuracy": 0.14133516177535058, "num_tokens": 5832039.0, "step": 2810 }, { "entropy": 5.914500284194946, "epoch": 0.2553519593613933, "grad_norm": 1.203125, "learning_rate": 0.0004996938428187437, "loss": 5.8397, "mean_token_accuracy": 0.1460021823644638, "num_tokens": 5841723.0, "step": 2815 }, { "entropy": 5.9476793766021725, "epoch": 0.2558055152394775, "grad_norm": 1.2265625, "learning_rate": 0.0004996921531319297, "loss": 5.8873, "mean_token_accuracy": 0.14610021114349364, "num_tokens": 5852814.0, "step": 2820 }, { "entropy": 5.826781702041626, "epoch": 0.2562590711175617, "grad_norm": 1.2734375, "learning_rate": 0.0004996904587984246, "loss": 5.8323, "mean_token_accuracy": 0.14333641827106475, "num_tokens": 5863174.0, "step": 2825 }, { "entropy": 5.853058385848999, "epoch": 0.25671262699564584, "grad_norm": 1.234375, "learning_rate": 0.0004996887598182636, "loss": 5.7837, "mean_token_accuracy": 0.14737775102257727, "num_tokens": 5873698.0, "step": 2830 }, { "entropy": 5.760656118392944, "epoch": 0.25716618287373005, "grad_norm": 1.296875, "learning_rate": 0.0004996870561914819, "loss": 5.8211, "mean_token_accuracy": 0.1456883355975151, "num_tokens": 5883982.0, "step": 2835 }, { "entropy": 5.894684791564941, "epoch": 0.2576197387518142, "grad_norm": 1.265625, "learning_rate": 0.0004996853479181145, "loss": 5.7891, "mean_token_accuracy": 0.14917163103818892, "num_tokens": 5894454.0, "step": 2840 }, { "entropy": 5.844020223617553, "epoch": 0.2580732946298984, "grad_norm": 1.296875, "learning_rate": 0.0004996836349981969, "loss": 5.8806, "mean_token_accuracy": 0.1445062406361103, "num_tokens": 5904739.0, "step": 2845 }, { "entropy": 5.931279706954956, "epoch": 0.2585268505079826, "grad_norm": 1.2421875, "learning_rate": 0.0004996819174317645, "loss": 5.8601, "mean_token_accuracy": 0.14103500097990035, "num_tokens": 5914578.0, "step": 2850 }, { "entropy": 5.924049043655396, "epoch": 0.2589804063860668, "grad_norm": 1.28125, "learning_rate": 0.0004996801952188528, "loss": 5.8417, "mean_token_accuracy": 0.1458780586719513, "num_tokens": 5923918.0, "step": 2855 }, { "entropy": 5.938410520553589, "epoch": 0.25943396226415094, "grad_norm": 1.2578125, "learning_rate": 0.0004996784683594973, "loss": 5.8868, "mean_token_accuracy": 0.14107644706964492, "num_tokens": 5934096.0, "step": 2860 }, { "entropy": 5.885492944717408, "epoch": 0.2598875181422351, "grad_norm": 1.140625, "learning_rate": 0.0004996767368537338, "loss": 5.9094, "mean_token_accuracy": 0.1389304779469967, "num_tokens": 5945416.0, "step": 2865 }, { "entropy": 5.875432109832763, "epoch": 0.2603410740203193, "grad_norm": 3.046875, "learning_rate": 0.0004996750007015983, "loss": 5.8406, "mean_token_accuracy": 0.14503862857818603, "num_tokens": 5956296.0, "step": 2870 }, { "entropy": 5.864486980438232, "epoch": 0.26079462989840346, "grad_norm": 1.265625, "learning_rate": 0.0004996732599031264, "loss": 5.733, "mean_token_accuracy": 0.15628641992807388, "num_tokens": 5966147.0, "step": 2875 }, { "entropy": 5.841119432449341, "epoch": 0.2612481857764877, "grad_norm": 1.3515625, "learning_rate": 0.0004996715144583543, "loss": 5.8385, "mean_token_accuracy": 0.15209657400846482, "num_tokens": 5976650.0, "step": 2880 }, { "entropy": 5.918705177307129, "epoch": 0.26170174165457183, "grad_norm": 1.203125, "learning_rate": 0.000499669764367318, "loss": 5.9027, "mean_token_accuracy": 0.14683974608778955, "num_tokens": 5986643.0, "step": 2885 }, { "entropy": 5.891564416885376, "epoch": 0.26215529753265604, "grad_norm": 1.1875, "learning_rate": 0.0004996680096300537, "loss": 5.8697, "mean_token_accuracy": 0.14015998244285582, "num_tokens": 5997991.0, "step": 2890 }, { "entropy": 5.783881521224975, "epoch": 0.2626088534107402, "grad_norm": 1.265625, "learning_rate": 0.0004996662502465978, "loss": 5.6945, "mean_token_accuracy": 0.15556951612234116, "num_tokens": 6007179.0, "step": 2895 }, { "entropy": 5.919160652160644, "epoch": 0.2630624092888244, "grad_norm": 1.2578125, "learning_rate": 0.0004996644862169864, "loss": 5.8789, "mean_token_accuracy": 0.14572433680295943, "num_tokens": 6017786.0, "step": 2900 }, { "entropy": 5.915647411346436, "epoch": 0.26351596516690856, "grad_norm": 1.390625, "learning_rate": 0.0004996627175412563, "loss": 5.9004, "mean_token_accuracy": 0.14329932779073715, "num_tokens": 6027751.0, "step": 2905 }, { "entropy": 5.8271812915802, "epoch": 0.2639695210449927, "grad_norm": 1.390625, "learning_rate": 0.000499660944219444, "loss": 5.7774, "mean_token_accuracy": 0.14923276603221894, "num_tokens": 6037136.0, "step": 2910 }, { "entropy": 5.790592765808105, "epoch": 0.2644230769230769, "grad_norm": 1.3046875, "learning_rate": 0.0004996591662515861, "loss": 5.7695, "mean_token_accuracy": 0.14568121135234832, "num_tokens": 6047341.0, "step": 2915 }, { "entropy": 5.903992128372193, "epoch": 0.2648766328011611, "grad_norm": 1.1640625, "learning_rate": 0.0004996573836377193, "loss": 5.9207, "mean_token_accuracy": 0.14674188792705536, "num_tokens": 6058337.0, "step": 2920 }, { "entropy": 5.892431545257568, "epoch": 0.2653301886792453, "grad_norm": 1.234375, "learning_rate": 0.0004996555963778806, "loss": 5.8044, "mean_token_accuracy": 0.14313996583223343, "num_tokens": 6068566.0, "step": 2925 }, { "entropy": 5.918859958648682, "epoch": 0.26578374455732945, "grad_norm": 1.2265625, "learning_rate": 0.000499653804472107, "loss": 5.8215, "mean_token_accuracy": 0.15070558488368987, "num_tokens": 6078813.0, "step": 2930 }, { "entropy": 5.816320133209229, "epoch": 0.26623730043541366, "grad_norm": 1.109375, "learning_rate": 0.0004996520079204353, "loss": 5.8376, "mean_token_accuracy": 0.15071689635515212, "num_tokens": 6090007.0, "step": 2935 }, { "entropy": 5.924297523498535, "epoch": 0.2666908563134978, "grad_norm": 1.09375, "learning_rate": 0.000499650206722903, "loss": 5.9844, "mean_token_accuracy": 0.1373060829937458, "num_tokens": 6100917.0, "step": 2940 }, { "entropy": 6.015955924987793, "epoch": 0.267144412191582, "grad_norm": 1.140625, "learning_rate": 0.0004996484008795471, "loss": 5.93, "mean_token_accuracy": 0.147200308740139, "num_tokens": 6110958.0, "step": 2945 }, { "entropy": 5.904809999465942, "epoch": 0.2675979680696662, "grad_norm": 1.21875, "learning_rate": 0.000499646590390405, "loss": 5.8316, "mean_token_accuracy": 0.14588915333151817, "num_tokens": 6120819.0, "step": 2950 }, { "entropy": 5.836217546463013, "epoch": 0.26805152394775034, "grad_norm": 1.3359375, "learning_rate": 0.0004996447752555142, "loss": 5.8205, "mean_token_accuracy": 0.14316449761390687, "num_tokens": 6131253.0, "step": 2955 }, { "entropy": 5.898743295669556, "epoch": 0.26850507982583455, "grad_norm": 1.140625, "learning_rate": 0.0004996429554749122, "loss": 5.8484, "mean_token_accuracy": 0.148350540548563, "num_tokens": 6141338.0, "step": 2960 }, { "entropy": 5.846032381057739, "epoch": 0.2689586357039187, "grad_norm": 1.1640625, "learning_rate": 0.0004996411310486367, "loss": 5.8693, "mean_token_accuracy": 0.14200861528515815, "num_tokens": 6151081.0, "step": 2965 }, { "entropy": 5.9468964576721195, "epoch": 0.2694121915820029, "grad_norm": 1.3359375, "learning_rate": 0.0004996393019767253, "loss": 5.8606, "mean_token_accuracy": 0.13914820924401283, "num_tokens": 6160997.0, "step": 2970 }, { "entropy": 5.878990554809571, "epoch": 0.26986574746008707, "grad_norm": 1.3125, "learning_rate": 0.0004996374682592158, "loss": 5.7723, "mean_token_accuracy": 0.14771230965852739, "num_tokens": 6171131.0, "step": 2975 }, { "entropy": 5.830885028839111, "epoch": 0.2703193033381713, "grad_norm": 1.2578125, "learning_rate": 0.0004996356298961463, "loss": 5.8911, "mean_token_accuracy": 0.14644451886415483, "num_tokens": 6181307.0, "step": 2980 }, { "entropy": 5.935413074493408, "epoch": 0.27077285921625543, "grad_norm": 1.3203125, "learning_rate": 0.0004996337868875549, "loss": 5.7345, "mean_token_accuracy": 0.15274717211723327, "num_tokens": 6191689.0, "step": 2985 }, { "entropy": 5.780738258361817, "epoch": 0.27122641509433965, "grad_norm": 1.203125, "learning_rate": 0.0004996319392334792, "loss": 5.8039, "mean_token_accuracy": 0.14987841248512268, "num_tokens": 6201183.0, "step": 2990 }, { "entropy": 5.876131439208985, "epoch": 0.2716799709724238, "grad_norm": 1.453125, "learning_rate": 0.000499630086933958, "loss": 5.897, "mean_token_accuracy": 0.14560322165489198, "num_tokens": 6211507.0, "step": 2995 }, { "entropy": 5.882185268402099, "epoch": 0.27213352685050796, "grad_norm": 1.25, "learning_rate": 0.0004996282299890292, "loss": 5.758, "mean_token_accuracy": 0.15807864367961882, "num_tokens": 6220899.0, "step": 3000 }, { "epoch": 0.27213352685050796, "eval_entropy": 5.707925649789663, "eval_loss": 5.863901615142822, "eval_mean_token_accuracy": 0.15150013840356968, "eval_num_tokens": 6220899.0, "eval_runtime": 26.8067, "eval_samples_per_second": 1319.074, "eval_steps_per_second": 164.884, "step": 3000 } ], "logging_steps": 5, "max_steps": 110230, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9148397451264000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }