{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.885747259088286, "eval_steps": 3000, "global_step": 51000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691951370239257, "epoch": 0.0005770340450086555, "grad_norm": 12.5, "learning_rate": 2e-06, "loss": 10.8557, "mean_token_accuracy": 0.0, "num_tokens": 11955.0, "step": 5 }, { "entropy": 10.691877937316894, "epoch": 0.001154068090017311, "grad_norm": 12.8125, "learning_rate": 4.5e-06, "loss": 10.7945, "mean_token_accuracy": 0.00010020040208473802, "num_tokens": 24473.0, "step": 10 }, { "entropy": 10.690855121612548, "epoch": 0.0017311021350259665, "grad_norm": 10.5625, "learning_rate": 7e-06, "loss": 10.5617, "mean_token_accuracy": 0.02503108715172857, "num_tokens": 36716.0, "step": 15 }, { "entropy": 10.675894641876221, "epoch": 0.002308136180034622, "grad_norm": 6.40625, "learning_rate": 9.5e-06, "loss": 10.2237, "mean_token_accuracy": 0.045600682869553565, "num_tokens": 49747.0, "step": 20 }, { "entropy": 10.583820247650147, "epoch": 0.0028851702250432777, "grad_norm": 4.53125, "learning_rate": 1.2e-05, "loss": 9.9687, "mean_token_accuracy": 0.04857061766088009, "num_tokens": 61991.0, "step": 25 }, { "entropy": 10.477548027038575, "epoch": 0.003462204270051933, "grad_norm": 2.734375, "learning_rate": 1.4500000000000002e-05, "loss": 9.8415, "mean_token_accuracy": 0.05598664358258247, "num_tokens": 74918.0, "step": 30 }, { "entropy": 10.462637138366699, "epoch": 0.004039238315060588, "grad_norm": 2.8125, "learning_rate": 1.7000000000000003e-05, "loss": 9.8059, "mean_token_accuracy": 0.054788753390312195, "num_tokens": 87833.0, "step": 35 }, { "entropy": 10.446255970001221, "epoch": 0.004616272360069244, "grad_norm": 2.546875, "learning_rate": 1.95e-05, "loss": 9.7253, "mean_token_accuracy": 0.05731462575495243, "num_tokens": 101031.0, "step": 40 }, { "entropy": 10.412657737731934, "epoch": 0.0051933064050779, "grad_norm": 2.6875, "learning_rate": 2.2e-05, "loss": 9.6744, "mean_token_accuracy": 0.06321047246456146, "num_tokens": 114085.0, "step": 45 }, { "entropy": 10.344977378845215, "epoch": 0.005770340450086555, "grad_norm": 2.296875, "learning_rate": 2.4500000000000003e-05, "loss": 9.682, "mean_token_accuracy": 0.05514660738408565, "num_tokens": 126190.0, "step": 50 }, { "entropy": 10.360903549194337, "epoch": 0.006347374495095211, "grad_norm": 2.546875, "learning_rate": 2.7e-05, "loss": 9.5899, "mean_token_accuracy": 0.07075095213949681, "num_tokens": 138933.0, "step": 55 }, { "entropy": 10.256150436401366, "epoch": 0.006924408540103866, "grad_norm": 2.109375, "learning_rate": 2.95e-05, "loss": 9.4931, "mean_token_accuracy": 0.07884349599480629, "num_tokens": 150542.0, "step": 60 }, { "entropy": 10.159530735015869, "epoch": 0.0075014425851125215, "grad_norm": 2.234375, "learning_rate": 3.2e-05, "loss": 9.4791, "mean_token_accuracy": 0.07697005346417427, "num_tokens": 163507.0, "step": 65 }, { "entropy": 10.226024723052978, "epoch": 0.008078476630121177, "grad_norm": 2.640625, "learning_rate": 3.4500000000000005e-05, "loss": 9.4185, "mean_token_accuracy": 0.08218079656362534, "num_tokens": 176668.0, "step": 70 }, { "entropy": 10.084021472930909, "epoch": 0.008655510675129832, "grad_norm": 2.078125, "learning_rate": 3.7e-05, "loss": 9.3547, "mean_token_accuracy": 0.08463524356484413, "num_tokens": 191413.0, "step": 75 }, { "entropy": 10.201306247711182, "epoch": 0.009232544720138488, "grad_norm": 2.328125, "learning_rate": 3.95e-05, "loss": 9.2867, "mean_token_accuracy": 0.08322363793849945, "num_tokens": 204176.0, "step": 80 }, { "entropy": 10.13297176361084, "epoch": 0.009809578765147143, "grad_norm": 1.8359375, "learning_rate": 4.2000000000000004e-05, "loss": 9.2251, "mean_token_accuracy": 0.08606483414769173, "num_tokens": 216851.0, "step": 85 }, { "entropy": 10.010610389709473, "epoch": 0.0103866128101558, "grad_norm": 2.265625, "learning_rate": 4.45e-05, "loss": 9.1974, "mean_token_accuracy": 0.08009482100605965, "num_tokens": 229621.0, "step": 90 }, { "entropy": 10.165260124206544, "epoch": 0.010963646855164455, "grad_norm": 2.6875, "learning_rate": 4.7000000000000004e-05, "loss": 9.151, "mean_token_accuracy": 0.08369554057717324, "num_tokens": 242074.0, "step": 95 }, { "entropy": 9.886237907409669, "epoch": 0.01154068090017311, "grad_norm": 1.6328125, "learning_rate": 4.9500000000000004e-05, "loss": 9.0049, "mean_token_accuracy": 0.08854745402932167, "num_tokens": 254094.0, "step": 100 }, { "entropy": 9.991595554351807, "epoch": 0.012117714945181766, "grad_norm": 1.921875, "learning_rate": 5.2e-05, "loss": 9.0197, "mean_token_accuracy": 0.08869979456067086, "num_tokens": 267560.0, "step": 105 }, { "entropy": 9.877109718322753, "epoch": 0.012694748990190421, "grad_norm": 2.09375, "learning_rate": 5.45e-05, "loss": 9.0088, "mean_token_accuracy": 0.08046346381306649, "num_tokens": 280717.0, "step": 110 }, { "entropy": 9.986603260040283, "epoch": 0.013271783035199077, "grad_norm": 1.84375, "learning_rate": 5.7e-05, "loss": 8.956, "mean_token_accuracy": 0.08400088958442212, "num_tokens": 293856.0, "step": 115 }, { "entropy": 9.746489906311036, "epoch": 0.013848817080207732, "grad_norm": 1.609375, "learning_rate": 5.9499999999999996e-05, "loss": 8.7825, "mean_token_accuracy": 0.0846656046807766, "num_tokens": 305191.0, "step": 120 }, { "entropy": 9.743055725097657, "epoch": 0.014425851125216388, "grad_norm": 1.484375, "learning_rate": 6.2e-05, "loss": 8.8098, "mean_token_accuracy": 0.08250505477190018, "num_tokens": 318544.0, "step": 125 }, { "entropy": 9.622491931915283, "epoch": 0.015002885170225043, "grad_norm": 1.5859375, "learning_rate": 6.450000000000001e-05, "loss": 8.631, "mean_token_accuracy": 0.09809689894318581, "num_tokens": 331445.0, "step": 130 }, { "entropy": 9.531793117523193, "epoch": 0.015579919215233698, "grad_norm": 1.53125, "learning_rate": 6.7e-05, "loss": 8.69, "mean_token_accuracy": 0.08484943211078644, "num_tokens": 344775.0, "step": 135 }, { "entropy": 9.43226900100708, "epoch": 0.016156953260242354, "grad_norm": 1.2421875, "learning_rate": 6.950000000000001e-05, "loss": 8.5877, "mean_token_accuracy": 0.08672104477882385, "num_tokens": 357804.0, "step": 140 }, { "entropy": 9.345358848571777, "epoch": 0.01673398730525101, "grad_norm": 1.3828125, "learning_rate": 7.2e-05, "loss": 8.5103, "mean_token_accuracy": 0.08910816386342049, "num_tokens": 369826.0, "step": 145 }, { "entropy": 9.061049365997315, "epoch": 0.017311021350259664, "grad_norm": 1.734375, "learning_rate": 7.45e-05, "loss": 8.4734, "mean_token_accuracy": 0.0947182148694992, "num_tokens": 382768.0, "step": 150 }, { "entropy": 9.184530448913574, "epoch": 0.01788805539526832, "grad_norm": 1.4921875, "learning_rate": 7.7e-05, "loss": 8.477, "mean_token_accuracy": 0.09176877290010452, "num_tokens": 395910.0, "step": 155 }, { "entropy": 9.0551118850708, "epoch": 0.018465089440276975, "grad_norm": 1.15625, "learning_rate": 7.950000000000001e-05, "loss": 8.4796, "mean_token_accuracy": 0.08274488113820552, "num_tokens": 408140.0, "step": 160 }, { "entropy": 8.977632331848145, "epoch": 0.019042123485285632, "grad_norm": 1.515625, "learning_rate": 8.2e-05, "loss": 8.3492, "mean_token_accuracy": 0.09365171417593957, "num_tokens": 420486.0, "step": 165 }, { "entropy": 8.88683271408081, "epoch": 0.019619157530294286, "grad_norm": 1.2265625, "learning_rate": 8.450000000000001e-05, "loss": 8.3127, "mean_token_accuracy": 0.10231351554393768, "num_tokens": 433207.0, "step": 170 }, { "entropy": 8.718389701843261, "epoch": 0.020196191575302943, "grad_norm": 1.1015625, "learning_rate": 8.7e-05, "loss": 8.2991, "mean_token_accuracy": 0.09770049974322319, "num_tokens": 444880.0, "step": 175 }, { "entropy": 8.861179733276368, "epoch": 0.0207732256203116, "grad_norm": 1.59375, "learning_rate": 8.95e-05, "loss": 8.3278, "mean_token_accuracy": 0.09125575348734856, "num_tokens": 456650.0, "step": 180 }, { "entropy": 8.653267669677735, "epoch": 0.021350259665320254, "grad_norm": 1.2109375, "learning_rate": 9.2e-05, "loss": 8.3105, "mean_token_accuracy": 0.09449072554707527, "num_tokens": 469667.0, "step": 185 }, { "entropy": 8.639202690124511, "epoch": 0.02192729371032891, "grad_norm": 1.109375, "learning_rate": 9.45e-05, "loss": 8.2226, "mean_token_accuracy": 0.10481953471899033, "num_tokens": 481952.0, "step": 190 }, { "entropy": 8.621485424041747, "epoch": 0.022504327755337564, "grad_norm": 1.296875, "learning_rate": 9.7e-05, "loss": 8.2791, "mean_token_accuracy": 0.10009086430072785, "num_tokens": 494352.0, "step": 195 }, { "entropy": 8.494072914123535, "epoch": 0.02308136180034622, "grad_norm": 1.203125, "learning_rate": 9.95e-05, "loss": 8.19, "mean_token_accuracy": 0.10785712376236915, "num_tokens": 506937.0, "step": 200 }, { "entropy": 8.508214092254638, "epoch": 0.023658395845354875, "grad_norm": 1.203125, "learning_rate": 0.000102, "loss": 8.1846, "mean_token_accuracy": 0.10090541988611221, "num_tokens": 519552.0, "step": 205 }, { "entropy": 8.504057216644288, "epoch": 0.024235429890363532, "grad_norm": 1.0234375, "learning_rate": 0.00010449999999999999, "loss": 8.2334, "mean_token_accuracy": 0.09878813922405243, "num_tokens": 531359.0, "step": 210 }, { "entropy": 8.462166213989258, "epoch": 0.024812463935372186, "grad_norm": 1.4375, "learning_rate": 0.000107, "loss": 8.2473, "mean_token_accuracy": 0.1007633239030838, "num_tokens": 544197.0, "step": 215 }, { "entropy": 8.630421257019043, "epoch": 0.025389497980380843, "grad_norm": 1.3515625, "learning_rate": 0.0001095, "loss": 8.2016, "mean_token_accuracy": 0.09566057249903678, "num_tokens": 556818.0, "step": 220 }, { "entropy": 8.372712326049804, "epoch": 0.025966532025389497, "grad_norm": 1.0546875, "learning_rate": 0.000112, "loss": 8.2354, "mean_token_accuracy": 0.10132482126355172, "num_tokens": 569363.0, "step": 225 }, { "entropy": 8.531051921844483, "epoch": 0.026543566070398154, "grad_norm": 1.21875, "learning_rate": 0.0001145, "loss": 8.2111, "mean_token_accuracy": 0.1007345326244831, "num_tokens": 581645.0, "step": 230 }, { "entropy": 8.464646530151366, "epoch": 0.027120600115406807, "grad_norm": 1.2578125, "learning_rate": 0.00011700000000000001, "loss": 8.1687, "mean_token_accuracy": 0.09699883535504342, "num_tokens": 593501.0, "step": 235 }, { "entropy": 8.380043411254883, "epoch": 0.027697634160415464, "grad_norm": 1.1015625, "learning_rate": 0.00011949999999999999, "loss": 8.1632, "mean_token_accuracy": 0.10044692009687424, "num_tokens": 606328.0, "step": 240 }, { "entropy": 8.322643375396728, "epoch": 0.02827466820542412, "grad_norm": 1.3203125, "learning_rate": 0.000122, "loss": 8.0529, "mean_token_accuracy": 0.11430942863225937, "num_tokens": 619003.0, "step": 245 }, { "entropy": 8.437573051452636, "epoch": 0.028851702250432775, "grad_norm": 1.484375, "learning_rate": 0.0001245, "loss": 8.1974, "mean_token_accuracy": 0.09745758473873138, "num_tokens": 632910.0, "step": 250 }, { "entropy": 8.345236682891846, "epoch": 0.029428736295441432, "grad_norm": 1.28125, "learning_rate": 0.000127, "loss": 8.1263, "mean_token_accuracy": 0.1067387342453003, "num_tokens": 645959.0, "step": 255 }, { "entropy": 8.347197151184082, "epoch": 0.030005770340450086, "grad_norm": 1.0625, "learning_rate": 0.0001295, "loss": 8.1006, "mean_token_accuracy": 0.10821648016571998, "num_tokens": 658620.0, "step": 260 }, { "entropy": 8.356802654266357, "epoch": 0.030582804385458743, "grad_norm": 1.0859375, "learning_rate": 0.000132, "loss": 8.1138, "mean_token_accuracy": 0.1112379103899002, "num_tokens": 670804.0, "step": 265 }, { "entropy": 8.397929668426514, "epoch": 0.031159838430467397, "grad_norm": 1.25, "learning_rate": 0.00013450000000000002, "loss": 8.1186, "mean_token_accuracy": 0.1025885134935379, "num_tokens": 683656.0, "step": 270 }, { "entropy": 8.3319091796875, "epoch": 0.031736872475476054, "grad_norm": 1.2734375, "learning_rate": 0.00013700000000000002, "loss": 8.093, "mean_token_accuracy": 0.10706457123160362, "num_tokens": 696629.0, "step": 275 }, { "entropy": 8.304152488708496, "epoch": 0.03231390652048471, "grad_norm": 1.171875, "learning_rate": 0.0001395, "loss": 8.113, "mean_token_accuracy": 0.10793379172682763, "num_tokens": 709053.0, "step": 280 }, { "entropy": 8.2885817527771, "epoch": 0.03289094056549336, "grad_norm": 0.87890625, "learning_rate": 0.00014199999999999998, "loss": 8.0615, "mean_token_accuracy": 0.10749010294675827, "num_tokens": 721947.0, "step": 285 }, { "entropy": 8.336502933502198, "epoch": 0.03346797461050202, "grad_norm": 1.3515625, "learning_rate": 0.0001445, "loss": 8.0686, "mean_token_accuracy": 0.10405683368444443, "num_tokens": 734495.0, "step": 290 }, { "entropy": 8.229808235168457, "epoch": 0.034045008655510675, "grad_norm": 1.1171875, "learning_rate": 0.000147, "loss": 8.0824, "mean_token_accuracy": 0.1042616605758667, "num_tokens": 746965.0, "step": 295 }, { "entropy": 8.36244821548462, "epoch": 0.03462204270051933, "grad_norm": 1.2890625, "learning_rate": 0.0001495, "loss": 8.0907, "mean_token_accuracy": 0.10315949246287345, "num_tokens": 760105.0, "step": 300 }, { "entropy": 8.327516651153564, "epoch": 0.03519907674552799, "grad_norm": 1.1484375, "learning_rate": 0.000152, "loss": 7.9907, "mean_token_accuracy": 0.11302562728524208, "num_tokens": 771765.0, "step": 305 }, { "entropy": 8.284095668792725, "epoch": 0.03577611079053664, "grad_norm": 1.4140625, "learning_rate": 0.00015450000000000001, "loss": 8.0752, "mean_token_accuracy": 0.10686711072921753, "num_tokens": 784895.0, "step": 310 }, { "entropy": 8.20336627960205, "epoch": 0.0363531448355453, "grad_norm": 1.25, "learning_rate": 0.000157, "loss": 8.0143, "mean_token_accuracy": 0.11653341501951217, "num_tokens": 797139.0, "step": 315 }, { "entropy": 8.277932500839233, "epoch": 0.03693017888055395, "grad_norm": 1.15625, "learning_rate": 0.0001595, "loss": 7.9691, "mean_token_accuracy": 0.11882287114858628, "num_tokens": 809169.0, "step": 320 }, { "entropy": 8.219804096221925, "epoch": 0.03750721292556261, "grad_norm": 1.078125, "learning_rate": 0.000162, "loss": 8.017, "mean_token_accuracy": 0.11045632883906364, "num_tokens": 821737.0, "step": 325 }, { "entropy": 8.202571201324464, "epoch": 0.038084246970571264, "grad_norm": 1.0390625, "learning_rate": 0.00016450000000000001, "loss": 7.9302, "mean_token_accuracy": 0.1168684981763363, "num_tokens": 834365.0, "step": 330 }, { "entropy": 8.243558883666992, "epoch": 0.03866128101557992, "grad_norm": 1.1796875, "learning_rate": 0.00016700000000000002, "loss": 7.9747, "mean_token_accuracy": 0.11678506284952164, "num_tokens": 846445.0, "step": 335 }, { "entropy": 8.234999084472657, "epoch": 0.03923831506058857, "grad_norm": 1.1875, "learning_rate": 0.00016950000000000003, "loss": 8.023, "mean_token_accuracy": 0.11369575336575508, "num_tokens": 858558.0, "step": 340 }, { "entropy": 8.161874151229858, "epoch": 0.03981534910559723, "grad_norm": 1.1015625, "learning_rate": 0.00017199999999999998, "loss": 8.0332, "mean_token_accuracy": 0.10968955010175704, "num_tokens": 871209.0, "step": 345 }, { "entropy": 8.284571075439453, "epoch": 0.040392383150605886, "grad_norm": 1.15625, "learning_rate": 0.00017449999999999999, "loss": 7.9815, "mean_token_accuracy": 0.11281129494309425, "num_tokens": 883270.0, "step": 350 }, { "entropy": 8.099399852752686, "epoch": 0.04096941719561454, "grad_norm": 1.1875, "learning_rate": 0.000177, "loss": 7.9788, "mean_token_accuracy": 0.11309987381100654, "num_tokens": 895468.0, "step": 355 }, { "entropy": 8.298340988159179, "epoch": 0.0415464512406232, "grad_norm": 1.1796875, "learning_rate": 0.0001795, "loss": 7.9521, "mean_token_accuracy": 0.11634099185466766, "num_tokens": 907900.0, "step": 360 }, { "entropy": 8.028721857070924, "epoch": 0.042123485285631854, "grad_norm": 1.4609375, "learning_rate": 0.000182, "loss": 7.9507, "mean_token_accuracy": 0.11578193232417107, "num_tokens": 920036.0, "step": 365 }, { "entropy": 8.210243511199952, "epoch": 0.04270051933064051, "grad_norm": 1.171875, "learning_rate": 0.0001845, "loss": 7.9225, "mean_token_accuracy": 0.12110625132918358, "num_tokens": 932525.0, "step": 370 }, { "entropy": 8.095637941360474, "epoch": 0.04327755337564916, "grad_norm": 1.21875, "learning_rate": 0.000187, "loss": 7.8898, "mean_token_accuracy": 0.12433087080717087, "num_tokens": 943581.0, "step": 375 }, { "entropy": 8.17782621383667, "epoch": 0.04385458742065782, "grad_norm": 1.046875, "learning_rate": 0.0001895, "loss": 7.9898, "mean_token_accuracy": 0.11301371231675147, "num_tokens": 956270.0, "step": 380 }, { "entropy": 8.173714351654052, "epoch": 0.044431621465666475, "grad_norm": 1.0859375, "learning_rate": 0.000192, "loss": 7.9475, "mean_token_accuracy": 0.11783768609166145, "num_tokens": 967631.0, "step": 385 }, { "entropy": 8.170480346679687, "epoch": 0.04500865551067513, "grad_norm": 1.28125, "learning_rate": 0.0001945, "loss": 7.9699, "mean_token_accuracy": 0.11223287805914879, "num_tokens": 980999.0, "step": 390 }, { "entropy": 8.166180324554443, "epoch": 0.04558568955568378, "grad_norm": 1.1796875, "learning_rate": 0.00019700000000000002, "loss": 7.8761, "mean_token_accuracy": 0.11871615797281265, "num_tokens": 993404.0, "step": 395 }, { "entropy": 7.9651154518127445, "epoch": 0.04616272360069244, "grad_norm": 1.2578125, "learning_rate": 0.00019950000000000002, "loss": 7.8892, "mean_token_accuracy": 0.11921441331505775, "num_tokens": 1006009.0, "step": 400 }, { "entropy": 8.124106407165527, "epoch": 0.0467397576457011, "grad_norm": 1.015625, "learning_rate": 0.000202, "loss": 7.9879, "mean_token_accuracy": 0.11321467459201813, "num_tokens": 1019644.0, "step": 405 }, { "entropy": 8.151873683929443, "epoch": 0.04731679169070975, "grad_norm": 0.9453125, "learning_rate": 0.00020449999999999998, "loss": 7.8907, "mean_token_accuracy": 0.12443416640162468, "num_tokens": 1032196.0, "step": 410 }, { "entropy": 7.957633638381958, "epoch": 0.04789382573571841, "grad_norm": 1.28125, "learning_rate": 0.000207, "loss": 7.8459, "mean_token_accuracy": 0.12779026255011558, "num_tokens": 1044211.0, "step": 415 }, { "entropy": 8.143306255340576, "epoch": 0.048470859780727064, "grad_norm": 1.03125, "learning_rate": 0.0002095, "loss": 7.8905, "mean_token_accuracy": 0.12050737589597701, "num_tokens": 1055743.0, "step": 420 }, { "entropy": 8.111260080337525, "epoch": 0.04904789382573572, "grad_norm": 1.203125, "learning_rate": 0.000212, "loss": 7.8987, "mean_token_accuracy": 0.11890480741858482, "num_tokens": 1068550.0, "step": 425 }, { "entropy": 8.020257091522216, "epoch": 0.04962492787074437, "grad_norm": 1.140625, "learning_rate": 0.0002145, "loss": 7.8119, "mean_token_accuracy": 0.12798867896199226, "num_tokens": 1079878.0, "step": 430 }, { "entropy": 8.137621879577637, "epoch": 0.05020196191575303, "grad_norm": 1.328125, "learning_rate": 0.00021700000000000002, "loss": 7.8687, "mean_token_accuracy": 0.11096916049718857, "num_tokens": 1093331.0, "step": 435 }, { "entropy": 8.066670083999634, "epoch": 0.050778995960761686, "grad_norm": 1.1015625, "learning_rate": 0.0002195, "loss": 7.8257, "mean_token_accuracy": 0.12115365341305732, "num_tokens": 1105830.0, "step": 440 }, { "entropy": 7.986959838867188, "epoch": 0.05135603000577034, "grad_norm": 1.0234375, "learning_rate": 0.000222, "loss": 7.8313, "mean_token_accuracy": 0.1250676207244396, "num_tokens": 1118071.0, "step": 445 }, { "entropy": 8.007787656784057, "epoch": 0.05193306405077899, "grad_norm": 1.0703125, "learning_rate": 0.0002245, "loss": 7.8457, "mean_token_accuracy": 0.12186303734779358, "num_tokens": 1129781.0, "step": 450 }, { "entropy": 8.014291572570801, "epoch": 0.052510098095787654, "grad_norm": 1.046875, "learning_rate": 0.00022700000000000002, "loss": 7.8951, "mean_token_accuracy": 0.11840380728244781, "num_tokens": 1142750.0, "step": 455 }, { "entropy": 7.9940962314605715, "epoch": 0.05308713214079631, "grad_norm": 1.1875, "learning_rate": 0.00022950000000000002, "loss": 7.8294, "mean_token_accuracy": 0.12203348949551582, "num_tokens": 1154314.0, "step": 460 }, { "entropy": 8.042590236663818, "epoch": 0.05366416618580496, "grad_norm": 1.046875, "learning_rate": 0.00023200000000000003, "loss": 7.8571, "mean_token_accuracy": 0.12293424680829049, "num_tokens": 1167199.0, "step": 465 }, { "entropy": 8.021096801757812, "epoch": 0.054241200230813615, "grad_norm": 1.453125, "learning_rate": 0.00023449999999999998, "loss": 7.8511, "mean_token_accuracy": 0.12046421691775322, "num_tokens": 1179654.0, "step": 470 }, { "entropy": 7.927558755874633, "epoch": 0.054818234275822275, "grad_norm": 1.21875, "learning_rate": 0.000237, "loss": 7.8023, "mean_token_accuracy": 0.1239857017993927, "num_tokens": 1190713.0, "step": 475 }, { "entropy": 8.043779516220093, "epoch": 0.05539526832083093, "grad_norm": 0.99609375, "learning_rate": 0.0002395, "loss": 7.8039, "mean_token_accuracy": 0.12089489996433259, "num_tokens": 1203881.0, "step": 480 }, { "entropy": 8.005364274978637, "epoch": 0.05597230236583958, "grad_norm": 1.1796875, "learning_rate": 0.000242, "loss": 7.8446, "mean_token_accuracy": 0.1142806276679039, "num_tokens": 1215795.0, "step": 485 }, { "entropy": 7.864235591888428, "epoch": 0.05654933641084824, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 7.7685, "mean_token_accuracy": 0.12962937504053115, "num_tokens": 1227773.0, "step": 490 }, { "entropy": 8.027290201187133, "epoch": 0.0571263704558569, "grad_norm": 1.109375, "learning_rate": 0.000247, "loss": 7.7609, "mean_token_accuracy": 0.1293689340353012, "num_tokens": 1240217.0, "step": 495 }, { "entropy": 8.006452465057373, "epoch": 0.05770340450086555, "grad_norm": 1.3359375, "learning_rate": 0.0002495, "loss": 7.8361, "mean_token_accuracy": 0.1246810033917427, "num_tokens": 1253324.0, "step": 500 }, { "entropy": 7.870799207687378, "epoch": 0.058280438545874204, "grad_norm": 1.234375, "learning_rate": 0.000252, "loss": 7.7464, "mean_token_accuracy": 0.11857289001345635, "num_tokens": 1266007.0, "step": 505 }, { "entropy": 7.910182189941406, "epoch": 0.058857472590882864, "grad_norm": 1.0859375, "learning_rate": 0.0002545, "loss": 7.7933, "mean_token_accuracy": 0.12473395615816116, "num_tokens": 1278403.0, "step": 510 }, { "entropy": 7.910435581207276, "epoch": 0.05943450663589152, "grad_norm": 0.98828125, "learning_rate": 0.000257, "loss": 7.8167, "mean_token_accuracy": 0.1220628336071968, "num_tokens": 1290352.0, "step": 515 }, { "entropy": 7.96209020614624, "epoch": 0.06001154068090017, "grad_norm": 1.171875, "learning_rate": 0.0002595, "loss": 7.8138, "mean_token_accuracy": 0.11629830971360207, "num_tokens": 1302304.0, "step": 520 }, { "entropy": 7.892691946029663, "epoch": 0.060588574725908825, "grad_norm": 1.1796875, "learning_rate": 0.000262, "loss": 7.7773, "mean_token_accuracy": 0.12471387833356858, "num_tokens": 1314014.0, "step": 525 }, { "entropy": 8.03321852684021, "epoch": 0.061165608770917486, "grad_norm": 1.0859375, "learning_rate": 0.00026450000000000003, "loss": 7.8184, "mean_token_accuracy": 0.12079318463802338, "num_tokens": 1326751.0, "step": 530 }, { "entropy": 7.839642143249511, "epoch": 0.06174264281592614, "grad_norm": 1.34375, "learning_rate": 0.00026700000000000004, "loss": 7.6974, "mean_token_accuracy": 0.12328156679868699, "num_tokens": 1339070.0, "step": 535 }, { "entropy": 7.8171533107757565, "epoch": 0.06231967686093479, "grad_norm": 1.1796875, "learning_rate": 0.00026950000000000005, "loss": 7.7089, "mean_token_accuracy": 0.12542344257235527, "num_tokens": 1351345.0, "step": 540 }, { "entropy": 7.918297529220581, "epoch": 0.06289671090594345, "grad_norm": 1.0703125, "learning_rate": 0.00027200000000000005, "loss": 7.7941, "mean_token_accuracy": 0.12069407552480697, "num_tokens": 1364331.0, "step": 545 }, { "entropy": 7.783697843551636, "epoch": 0.06347374495095211, "grad_norm": 1.0703125, "learning_rate": 0.0002745, "loss": 7.6797, "mean_token_accuracy": 0.13021565973758698, "num_tokens": 1377426.0, "step": 550 }, { "entropy": 7.897759199142456, "epoch": 0.06405077899596076, "grad_norm": 1.09375, "learning_rate": 0.000277, "loss": 7.7903, "mean_token_accuracy": 0.11785958632826805, "num_tokens": 1391553.0, "step": 555 }, { "entropy": 7.917001342773437, "epoch": 0.06462781304096941, "grad_norm": 1.53125, "learning_rate": 0.0002795, "loss": 7.7446, "mean_token_accuracy": 0.12249603047966957, "num_tokens": 1405526.0, "step": 560 }, { "entropy": 7.944843435287476, "epoch": 0.06520484708597807, "grad_norm": 1.0078125, "learning_rate": 0.00028199999999999997, "loss": 7.7697, "mean_token_accuracy": 0.12450801730155944, "num_tokens": 1417868.0, "step": 565 }, { "entropy": 7.7399509906768795, "epoch": 0.06578188113098672, "grad_norm": 1.265625, "learning_rate": 0.0002845, "loss": 7.6914, "mean_token_accuracy": 0.12707902863621712, "num_tokens": 1429907.0, "step": 570 }, { "entropy": 7.985376596450806, "epoch": 0.06635891517599539, "grad_norm": 1.15625, "learning_rate": 0.000287, "loss": 7.7166, "mean_token_accuracy": 0.12132233530282974, "num_tokens": 1442552.0, "step": 575 }, { "entropy": 7.768247318267822, "epoch": 0.06693594922100404, "grad_norm": 1.015625, "learning_rate": 0.0002895, "loss": 7.7624, "mean_token_accuracy": 0.12234465405344963, "num_tokens": 1455717.0, "step": 580 }, { "entropy": 7.9525719165802, "epoch": 0.0675129832660127, "grad_norm": 1.109375, "learning_rate": 0.000292, "loss": 7.7642, "mean_token_accuracy": 0.1182574063539505, "num_tokens": 1468263.0, "step": 585 }, { "entropy": 7.756762266159058, "epoch": 0.06809001731102135, "grad_norm": 1.09375, "learning_rate": 0.0002945, "loss": 7.6998, "mean_token_accuracy": 0.12650698721408843, "num_tokens": 1481632.0, "step": 590 }, { "entropy": 7.854887342453003, "epoch": 0.06866705135603, "grad_norm": 1.109375, "learning_rate": 0.000297, "loss": 7.648, "mean_token_accuracy": 0.1267064943909645, "num_tokens": 1495121.0, "step": 595 }, { "entropy": 7.762281274795532, "epoch": 0.06924408540103866, "grad_norm": 1.0703125, "learning_rate": 0.0002995, "loss": 7.7071, "mean_token_accuracy": 0.12668090239167212, "num_tokens": 1507669.0, "step": 600 }, { "entropy": 7.738871908187866, "epoch": 0.06982111944604731, "grad_norm": 1.0546875, "learning_rate": 0.000302, "loss": 7.7326, "mean_token_accuracy": 0.11923622786998749, "num_tokens": 1520707.0, "step": 605 }, { "entropy": 7.851386690139771, "epoch": 0.07039815349105598, "grad_norm": 0.94140625, "learning_rate": 0.0003045, "loss": 7.6367, "mean_token_accuracy": 0.12671747878193856, "num_tokens": 1532974.0, "step": 610 }, { "entropy": 7.776523685455322, "epoch": 0.07097518753606463, "grad_norm": 1.0546875, "learning_rate": 0.000307, "loss": 7.6379, "mean_token_accuracy": 0.12370964214205742, "num_tokens": 1544085.0, "step": 615 }, { "entropy": 7.664855432510376, "epoch": 0.07155222158107329, "grad_norm": 1.078125, "learning_rate": 0.0003095, "loss": 7.6676, "mean_token_accuracy": 0.13088590577244757, "num_tokens": 1556945.0, "step": 620 }, { "entropy": 7.785807657241821, "epoch": 0.07212925562608194, "grad_norm": 1.1796875, "learning_rate": 0.000312, "loss": 7.6149, "mean_token_accuracy": 0.13267466947436332, "num_tokens": 1569570.0, "step": 625 }, { "entropy": 7.674111986160279, "epoch": 0.0727062896710906, "grad_norm": 1.234375, "learning_rate": 0.0003145, "loss": 7.7054, "mean_token_accuracy": 0.12257150337100028, "num_tokens": 1582529.0, "step": 630 }, { "entropy": 7.782325267791748, "epoch": 0.07328332371609925, "grad_norm": 1.0390625, "learning_rate": 0.000317, "loss": 7.6195, "mean_token_accuracy": 0.13299935758113862, "num_tokens": 1595976.0, "step": 635 }, { "entropy": 7.767532587051392, "epoch": 0.0738603577611079, "grad_norm": 1.0625, "learning_rate": 0.0003195, "loss": 7.6424, "mean_token_accuracy": 0.12903562188148499, "num_tokens": 1609093.0, "step": 640 }, { "entropy": 7.731075191497803, "epoch": 0.07443739180611655, "grad_norm": 1.03125, "learning_rate": 0.000322, "loss": 7.622, "mean_token_accuracy": 0.12647998183965684, "num_tokens": 1622233.0, "step": 645 }, { "entropy": 7.757028245925904, "epoch": 0.07501442585112522, "grad_norm": 0.94921875, "learning_rate": 0.00032450000000000003, "loss": 7.6987, "mean_token_accuracy": 0.12671734392642975, "num_tokens": 1635354.0, "step": 650 }, { "entropy": 7.748657846450806, "epoch": 0.07559145989613388, "grad_norm": 1.2890625, "learning_rate": 0.00032700000000000003, "loss": 7.659, "mean_token_accuracy": 0.12423627153038978, "num_tokens": 1648223.0, "step": 655 }, { "entropy": 7.7475920677185055, "epoch": 0.07616849394114253, "grad_norm": 1.359375, "learning_rate": 0.00032950000000000004, "loss": 7.6653, "mean_token_accuracy": 0.12359859570860862, "num_tokens": 1661652.0, "step": 660 }, { "entropy": 7.648698377609253, "epoch": 0.07674552798615118, "grad_norm": 1.1640625, "learning_rate": 0.00033200000000000005, "loss": 7.5636, "mean_token_accuracy": 0.13243083134293557, "num_tokens": 1674778.0, "step": 665 }, { "entropy": 7.787905645370484, "epoch": 0.07732256203115984, "grad_norm": 1.203125, "learning_rate": 0.00033450000000000005, "loss": 7.6459, "mean_token_accuracy": 0.12540043219923974, "num_tokens": 1686966.0, "step": 670 }, { "entropy": 7.660491418838501, "epoch": 0.07789959607616849, "grad_norm": 1.1171875, "learning_rate": 0.000337, "loss": 7.623, "mean_token_accuracy": 0.13194708675146102, "num_tokens": 1699979.0, "step": 675 }, { "entropy": 7.710208940505981, "epoch": 0.07847663012117714, "grad_norm": 0.9765625, "learning_rate": 0.0003395, "loss": 7.5421, "mean_token_accuracy": 0.1282073549926281, "num_tokens": 1712306.0, "step": 680 }, { "entropy": 7.66764645576477, "epoch": 0.07905366416618581, "grad_norm": 1.1640625, "learning_rate": 0.000342, "loss": 7.6151, "mean_token_accuracy": 0.12962080165743828, "num_tokens": 1724670.0, "step": 685 }, { "entropy": 7.820890140533447, "epoch": 0.07963069821119446, "grad_norm": 1.109375, "learning_rate": 0.00034449999999999997, "loss": 7.6844, "mean_token_accuracy": 0.12687815874814987, "num_tokens": 1736987.0, "step": 690 }, { "entropy": 7.658799171447754, "epoch": 0.08020773225620312, "grad_norm": 1.125, "learning_rate": 0.000347, "loss": 7.6473, "mean_token_accuracy": 0.12734541893005372, "num_tokens": 1750587.0, "step": 695 }, { "entropy": 7.620698738098144, "epoch": 0.08078476630121177, "grad_norm": 1.609375, "learning_rate": 0.0003495, "loss": 7.6201, "mean_token_accuracy": 0.12172205820679664, "num_tokens": 1763432.0, "step": 700 }, { "entropy": 7.6917338371276855, "epoch": 0.08136180034622043, "grad_norm": 0.96484375, "learning_rate": 0.000352, "loss": 7.5204, "mean_token_accuracy": 0.13158636018633843, "num_tokens": 1777705.0, "step": 705 }, { "entropy": 7.608352470397949, "epoch": 0.08193883439122908, "grad_norm": 1.0390625, "learning_rate": 0.0003545, "loss": 7.5904, "mean_token_accuracy": 0.13091936558485032, "num_tokens": 1790673.0, "step": 710 }, { "entropy": 7.676751232147216, "epoch": 0.08251586843623773, "grad_norm": 1.078125, "learning_rate": 0.000357, "loss": 7.6165, "mean_token_accuracy": 0.12561856135725974, "num_tokens": 1803258.0, "step": 715 }, { "entropy": 7.677963590621948, "epoch": 0.0830929024812464, "grad_norm": 0.984375, "learning_rate": 0.0003595, "loss": 7.5943, "mean_token_accuracy": 0.1276804856956005, "num_tokens": 1816534.0, "step": 720 }, { "entropy": 7.624732446670532, "epoch": 0.08366993652625505, "grad_norm": 1.1640625, "learning_rate": 0.000362, "loss": 7.5413, "mean_token_accuracy": 0.12490850538015366, "num_tokens": 1828335.0, "step": 725 }, { "entropy": 7.605259799957276, "epoch": 0.08424697057126371, "grad_norm": 1.1171875, "learning_rate": 0.0003645, "loss": 7.5646, "mean_token_accuracy": 0.13269523456692695, "num_tokens": 1839327.0, "step": 730 }, { "entropy": 7.720489597320556, "epoch": 0.08482400461627236, "grad_norm": 1.1640625, "learning_rate": 0.000367, "loss": 7.6267, "mean_token_accuracy": 0.11925766617059708, "num_tokens": 1851168.0, "step": 735 }, { "entropy": 7.6475683689117435, "epoch": 0.08540103866128101, "grad_norm": 1.109375, "learning_rate": 0.0003695, "loss": 7.6049, "mean_token_accuracy": 0.124794951826334, "num_tokens": 1863875.0, "step": 740 }, { "entropy": 7.579368352890015, "epoch": 0.08597807270628967, "grad_norm": 1.125, "learning_rate": 0.000372, "loss": 7.5178, "mean_token_accuracy": 0.12288314551115036, "num_tokens": 1876613.0, "step": 745 }, { "entropy": 7.694609594345093, "epoch": 0.08655510675129832, "grad_norm": 1.0859375, "learning_rate": 0.0003745, "loss": 7.6241, "mean_token_accuracy": 0.12489113733172416, "num_tokens": 1890311.0, "step": 750 }, { "entropy": 7.602844142913819, "epoch": 0.08713214079630698, "grad_norm": 1.09375, "learning_rate": 0.000377, "loss": 7.5948, "mean_token_accuracy": 0.12589145004749297, "num_tokens": 1902925.0, "step": 755 }, { "entropy": 7.596966028213501, "epoch": 0.08770917484131564, "grad_norm": 1.1015625, "learning_rate": 0.0003795, "loss": 7.5689, "mean_token_accuracy": 0.123939748108387, "num_tokens": 1915186.0, "step": 760 }, { "entropy": 7.636845922470092, "epoch": 0.0882862088863243, "grad_norm": 1.125, "learning_rate": 0.000382, "loss": 7.571, "mean_token_accuracy": 0.13280307427048682, "num_tokens": 1927184.0, "step": 765 }, { "entropy": 7.59859070777893, "epoch": 0.08886324293133295, "grad_norm": 1.03125, "learning_rate": 0.0003845, "loss": 7.5462, "mean_token_accuracy": 0.134385896474123, "num_tokens": 1940275.0, "step": 770 }, { "entropy": 7.626807355880738, "epoch": 0.0894402769763416, "grad_norm": 1.09375, "learning_rate": 0.00038700000000000003, "loss": 7.5775, "mean_token_accuracy": 0.12614732086658478, "num_tokens": 1952583.0, "step": 775 }, { "entropy": 7.596640682220459, "epoch": 0.09001731102135026, "grad_norm": 1.015625, "learning_rate": 0.00038950000000000003, "loss": 7.4969, "mean_token_accuracy": 0.12433894649147988, "num_tokens": 1965219.0, "step": 780 }, { "entropy": 7.571691226959229, "epoch": 0.09059434506635891, "grad_norm": 0.99609375, "learning_rate": 0.00039200000000000004, "loss": 7.5153, "mean_token_accuracy": 0.13145391047000884, "num_tokens": 1977193.0, "step": 785 }, { "entropy": 7.635157775878906, "epoch": 0.09117137911136756, "grad_norm": 1.078125, "learning_rate": 0.00039450000000000005, "loss": 7.4312, "mean_token_accuracy": 0.1304060213267803, "num_tokens": 1988955.0, "step": 790 }, { "entropy": 7.514168548583984, "epoch": 0.09174841315637623, "grad_norm": 1.0390625, "learning_rate": 0.00039700000000000005, "loss": 7.5695, "mean_token_accuracy": 0.12537927627563478, "num_tokens": 2001647.0, "step": 795 }, { "entropy": 7.537772274017334, "epoch": 0.09232544720138489, "grad_norm": 0.96875, "learning_rate": 0.0003995, "loss": 7.4927, "mean_token_accuracy": 0.13620842844247819, "num_tokens": 2015185.0, "step": 800 }, { "entropy": 7.663471412658692, "epoch": 0.09290248124639354, "grad_norm": 1.0, "learning_rate": 0.000402, "loss": 7.5901, "mean_token_accuracy": 0.1272108480334282, "num_tokens": 2027257.0, "step": 805 }, { "entropy": 7.390483283996582, "epoch": 0.0934795152914022, "grad_norm": 1.1328125, "learning_rate": 0.0004045, "loss": 7.4161, "mean_token_accuracy": 0.13912721797823907, "num_tokens": 2040716.0, "step": 810 }, { "entropy": 7.560983800888062, "epoch": 0.09405654933641085, "grad_norm": 1.234375, "learning_rate": 0.00040699999999999997, "loss": 7.55, "mean_token_accuracy": 0.12221533954143524, "num_tokens": 2053240.0, "step": 815 }, { "entropy": 7.622315168380737, "epoch": 0.0946335833814195, "grad_norm": 1.1640625, "learning_rate": 0.0004095, "loss": 7.5139, "mean_token_accuracy": 0.12666195258498192, "num_tokens": 2065693.0, "step": 820 }, { "entropy": 7.4823235988616945, "epoch": 0.09521061742642815, "grad_norm": 1.1796875, "learning_rate": 0.000412, "loss": 7.4591, "mean_token_accuracy": 0.14022310078144073, "num_tokens": 2077649.0, "step": 825 }, { "entropy": 7.467005395889283, "epoch": 0.09578765147143682, "grad_norm": 1.1171875, "learning_rate": 0.0004145, "loss": 7.5063, "mean_token_accuracy": 0.12628407776355743, "num_tokens": 2090780.0, "step": 830 }, { "entropy": 7.546123218536377, "epoch": 0.09636468551644548, "grad_norm": 0.96484375, "learning_rate": 0.000417, "loss": 7.513, "mean_token_accuracy": 0.13211931437253951, "num_tokens": 2104096.0, "step": 835 }, { "entropy": 7.543429565429688, "epoch": 0.09694171956145413, "grad_norm": 1.1015625, "learning_rate": 0.0004195, "loss": 7.5109, "mean_token_accuracy": 0.12248567417263985, "num_tokens": 2117157.0, "step": 840 }, { "entropy": 7.5339704036712645, "epoch": 0.09751875360646278, "grad_norm": 1.0390625, "learning_rate": 0.000422, "loss": 7.4826, "mean_token_accuracy": 0.12713147699832916, "num_tokens": 2129309.0, "step": 845 }, { "entropy": 7.466995716094971, "epoch": 0.09809578765147144, "grad_norm": 0.98046875, "learning_rate": 0.0004245, "loss": 7.5207, "mean_token_accuracy": 0.12562475129961967, "num_tokens": 2142344.0, "step": 850 }, { "entropy": 7.547919607162475, "epoch": 0.09867282169648009, "grad_norm": 1.171875, "learning_rate": 0.000427, "loss": 7.5488, "mean_token_accuracy": 0.12197135463356971, "num_tokens": 2155059.0, "step": 855 }, { "entropy": 7.569330024719238, "epoch": 0.09924985574148874, "grad_norm": 0.97265625, "learning_rate": 0.0004295, "loss": 7.5369, "mean_token_accuracy": 0.1284255087375641, "num_tokens": 2168901.0, "step": 860 }, { "entropy": 7.4198370456695555, "epoch": 0.0998268897864974, "grad_norm": 1.0234375, "learning_rate": 0.000432, "loss": 7.3584, "mean_token_accuracy": 0.13862554877996444, "num_tokens": 2180953.0, "step": 865 }, { "entropy": 7.476253461837769, "epoch": 0.10040392383150606, "grad_norm": 1.203125, "learning_rate": 0.0004345, "loss": 7.4631, "mean_token_accuracy": 0.13572433739900588, "num_tokens": 2194097.0, "step": 870 }, { "entropy": 7.479328727722168, "epoch": 0.10098095787651472, "grad_norm": 1.0234375, "learning_rate": 0.000437, "loss": 7.4058, "mean_token_accuracy": 0.13234824016690255, "num_tokens": 2206475.0, "step": 875 }, { "entropy": 7.484198713302613, "epoch": 0.10155799192152337, "grad_norm": 0.9921875, "learning_rate": 0.0004395, "loss": 7.436, "mean_token_accuracy": 0.12529727593064308, "num_tokens": 2220006.0, "step": 880 }, { "entropy": 7.488145637512207, "epoch": 0.10213502596653203, "grad_norm": 0.89453125, "learning_rate": 0.000442, "loss": 7.4962, "mean_token_accuracy": 0.12320048362016678, "num_tokens": 2234082.0, "step": 885 }, { "entropy": 7.484939479827881, "epoch": 0.10271206001154068, "grad_norm": 0.9921875, "learning_rate": 0.0004445, "loss": 7.4908, "mean_token_accuracy": 0.12574098110198975, "num_tokens": 2246871.0, "step": 890 }, { "entropy": 7.439050626754761, "epoch": 0.10328909405654933, "grad_norm": 0.96484375, "learning_rate": 0.000447, "loss": 7.4344, "mean_token_accuracy": 0.13258244097232819, "num_tokens": 2260172.0, "step": 895 }, { "entropy": 7.573509597778321, "epoch": 0.10386612810155799, "grad_norm": 1.1171875, "learning_rate": 0.00044950000000000003, "loss": 7.4693, "mean_token_accuracy": 0.12150668054819107, "num_tokens": 2272848.0, "step": 900 }, { "entropy": 7.414100122451782, "epoch": 0.10444316214656665, "grad_norm": 1.0625, "learning_rate": 0.00045200000000000004, "loss": 7.4238, "mean_token_accuracy": 0.128422711789608, "num_tokens": 2285673.0, "step": 905 }, { "entropy": 7.493473386764526, "epoch": 0.10502019619157531, "grad_norm": 0.921875, "learning_rate": 0.00045450000000000004, "loss": 7.47, "mean_token_accuracy": 0.12711283564567566, "num_tokens": 2298459.0, "step": 910 }, { "entropy": 7.421923589706421, "epoch": 0.10559723023658396, "grad_norm": 0.97265625, "learning_rate": 0.00045700000000000005, "loss": 7.4389, "mean_token_accuracy": 0.1314757324755192, "num_tokens": 2311226.0, "step": 915 }, { "entropy": 7.34346604347229, "epoch": 0.10617426428159261, "grad_norm": 1.0234375, "learning_rate": 0.00045950000000000006, "loss": 7.3694, "mean_token_accuracy": 0.1267826184630394, "num_tokens": 2323481.0, "step": 920 }, { "entropy": 7.37224383354187, "epoch": 0.10675129832660127, "grad_norm": 1.0390625, "learning_rate": 0.000462, "loss": 7.4024, "mean_token_accuracy": 0.13083600699901582, "num_tokens": 2336181.0, "step": 925 }, { "entropy": 7.499636030197143, "epoch": 0.10732833237160992, "grad_norm": 0.9609375, "learning_rate": 0.0004645, "loss": 7.3534, "mean_token_accuracy": 0.13574053421616555, "num_tokens": 2348941.0, "step": 930 }, { "entropy": 7.3138683319091795, "epoch": 0.10790536641661858, "grad_norm": 0.97265625, "learning_rate": 0.000467, "loss": 7.2945, "mean_token_accuracy": 0.1320072427392006, "num_tokens": 2361618.0, "step": 935 }, { "entropy": 7.307975149154663, "epoch": 0.10848240046162723, "grad_norm": 1.15625, "learning_rate": 0.0004695, "loss": 7.259, "mean_token_accuracy": 0.1410675063729286, "num_tokens": 2376108.0, "step": 940 }, { "entropy": 7.366646480560303, "epoch": 0.1090594345066359, "grad_norm": 1.0, "learning_rate": 0.000472, "loss": 7.3883, "mean_token_accuracy": 0.13348079323768616, "num_tokens": 2387774.0, "step": 945 }, { "entropy": 7.387966251373291, "epoch": 0.10963646855164455, "grad_norm": 1.125, "learning_rate": 0.0004745, "loss": 7.3984, "mean_token_accuracy": 0.13679807931184768, "num_tokens": 2400816.0, "step": 950 }, { "entropy": 7.225770616531372, "epoch": 0.1102135025966532, "grad_norm": 0.97265625, "learning_rate": 0.000477, "loss": 7.3332, "mean_token_accuracy": 0.12989477887749673, "num_tokens": 2412970.0, "step": 955 }, { "entropy": 7.398374080657959, "epoch": 0.11079053664166186, "grad_norm": 1.09375, "learning_rate": 0.0004795, "loss": 7.3348, "mean_token_accuracy": 0.13138538971543312, "num_tokens": 2424622.0, "step": 960 }, { "entropy": 7.423074054718017, "epoch": 0.11136757068667051, "grad_norm": 0.921875, "learning_rate": 0.000482, "loss": 7.4257, "mean_token_accuracy": 0.13353453874588012, "num_tokens": 2437293.0, "step": 965 }, { "entropy": 7.288896751403809, "epoch": 0.11194460473167916, "grad_norm": 1.453125, "learning_rate": 0.0004845, "loss": 7.3092, "mean_token_accuracy": 0.12915137261152268, "num_tokens": 2449934.0, "step": 970 }, { "entropy": 7.371738529205322, "epoch": 0.11252163877668782, "grad_norm": 0.921875, "learning_rate": 0.000487, "loss": 7.3638, "mean_token_accuracy": 0.1267050661146641, "num_tokens": 2463139.0, "step": 975 }, { "entropy": 7.306709432601929, "epoch": 0.11309867282169649, "grad_norm": 1.046875, "learning_rate": 0.0004895, "loss": 7.4078, "mean_token_accuracy": 0.12786821126937867, "num_tokens": 2474273.0, "step": 980 }, { "entropy": 7.4030670642852785, "epoch": 0.11367570686670514, "grad_norm": 0.97265625, "learning_rate": 0.000492, "loss": 7.3521, "mean_token_accuracy": 0.13926174938678743, "num_tokens": 2486643.0, "step": 985 }, { "entropy": 7.327881813049316, "epoch": 0.1142527409117138, "grad_norm": 0.96875, "learning_rate": 0.0004945, "loss": 7.3334, "mean_token_accuracy": 0.12991991862654687, "num_tokens": 2499018.0, "step": 990 }, { "entropy": 7.229681015014648, "epoch": 0.11482977495672245, "grad_norm": 1.0703125, "learning_rate": 0.000497, "loss": 7.3209, "mean_token_accuracy": 0.13620815202593803, "num_tokens": 2510463.0, "step": 995 }, { "entropy": 7.333762550354004, "epoch": 0.1154068090017311, "grad_norm": 1.0, "learning_rate": 0.0004995, "loss": 7.3648, "mean_token_accuracy": 0.13373479768633842, "num_tokens": 2522671.0, "step": 1000 }, { "entropy": 7.2945623874664305, "epoch": 0.11598384304673975, "grad_norm": 0.91796875, "learning_rate": 0.0004999999975783157, "loss": 7.3465, "mean_token_accuracy": 0.13163619264960288, "num_tokens": 2534508.0, "step": 1005 }, { "entropy": 7.360085344314575, "epoch": 0.11656087709174841, "grad_norm": 0.9296875, "learning_rate": 0.0004999999877402236, "loss": 7.322, "mean_token_accuracy": 0.13855402842164039, "num_tokens": 2546804.0, "step": 1010 }, { "entropy": 7.284858369827271, "epoch": 0.11713791113675708, "grad_norm": 0.9765625, "learning_rate": 0.0004999999703343686, "loss": 7.3227, "mean_token_accuracy": 0.12957534343004226, "num_tokens": 2558786.0, "step": 1015 }, { "entropy": 7.372665882110596, "epoch": 0.11771494518176573, "grad_norm": 0.984375, "learning_rate": 0.0004999999453607515, "loss": 7.2956, "mean_token_accuracy": 0.13060993254184722, "num_tokens": 2570834.0, "step": 1020 }, { "entropy": 7.1804040431976315, "epoch": 0.11829197922677438, "grad_norm": 1.0625, "learning_rate": 0.0004999999128193729, "loss": 7.2577, "mean_token_accuracy": 0.13870095685124398, "num_tokens": 2583342.0, "step": 1025 }, { "entropy": 7.312113237380982, "epoch": 0.11886901327178304, "grad_norm": 1.09375, "learning_rate": 0.000499999872710234, "loss": 7.3031, "mean_token_accuracy": 0.13401906490325927, "num_tokens": 2594878.0, "step": 1030 }, { "entropy": 7.149050855636597, "epoch": 0.11944604731679169, "grad_norm": 1.0, "learning_rate": 0.0004999998250333361, "loss": 7.2657, "mean_token_accuracy": 0.13629036098718644, "num_tokens": 2607070.0, "step": 1035 }, { "entropy": 7.316418886184692, "epoch": 0.12002308136180034, "grad_norm": 0.8203125, "learning_rate": 0.000499999769788681, "loss": 7.3088, "mean_token_accuracy": 0.13769753351807595, "num_tokens": 2620761.0, "step": 1040 }, { "entropy": 7.278573226928711, "epoch": 0.120600115406809, "grad_norm": 0.859375, "learning_rate": 0.0004999997069762703, "loss": 7.3204, "mean_token_accuracy": 0.1292047843337059, "num_tokens": 2634161.0, "step": 1045 }, { "entropy": 7.217658758163452, "epoch": 0.12117714945181765, "grad_norm": 0.94140625, "learning_rate": 0.0004999996365961062, "loss": 7.2649, "mean_token_accuracy": 0.13989781066775323, "num_tokens": 2647459.0, "step": 1050 }, { "entropy": 7.200538969039917, "epoch": 0.12175418349682632, "grad_norm": 0.99609375, "learning_rate": 0.0004999995586481912, "loss": 7.2675, "mean_token_accuracy": 0.13167453035712243, "num_tokens": 2660840.0, "step": 1055 }, { "entropy": 7.280622291564941, "epoch": 0.12233121754183497, "grad_norm": 0.953125, "learning_rate": 0.0004999994731325276, "loss": 7.2731, "mean_token_accuracy": 0.13342294991016387, "num_tokens": 2672673.0, "step": 1060 }, { "entropy": 7.171860647201538, "epoch": 0.12290825158684363, "grad_norm": 0.90625, "learning_rate": 0.0004999993800491187, "loss": 7.289, "mean_token_accuracy": 0.13255034536123275, "num_tokens": 2685744.0, "step": 1065 }, { "entropy": 7.219749069213867, "epoch": 0.12348528563185228, "grad_norm": 1.015625, "learning_rate": 0.0004999992793979672, "loss": 7.199, "mean_token_accuracy": 0.14802319854497908, "num_tokens": 2697068.0, "step": 1070 }, { "entropy": 7.331407928466797, "epoch": 0.12406231967686093, "grad_norm": 1.140625, "learning_rate": 0.0004999991711790769, "loss": 7.3567, "mean_token_accuracy": 0.12301772236824035, "num_tokens": 2710418.0, "step": 1075 }, { "entropy": 7.252064895629883, "epoch": 0.12463935372186959, "grad_norm": 0.96484375, "learning_rate": 0.0004999990553924511, "loss": 7.3035, "mean_token_accuracy": 0.12562899366021157, "num_tokens": 2722440.0, "step": 1080 }, { "entropy": 7.257036256790161, "epoch": 0.12521638776687824, "grad_norm": 0.8671875, "learning_rate": 0.0004999989320380939, "loss": 7.2928, "mean_token_accuracy": 0.12703390195965766, "num_tokens": 2735486.0, "step": 1085 }, { "entropy": 7.245379257202148, "epoch": 0.1257934218118869, "grad_norm": 0.90625, "learning_rate": 0.0004999988011160094, "loss": 7.2958, "mean_token_accuracy": 0.12891678139567375, "num_tokens": 2747620.0, "step": 1090 }, { "entropy": 7.229975891113281, "epoch": 0.12637045585689555, "grad_norm": 0.95703125, "learning_rate": 0.000499998662626202, "loss": 7.2443, "mean_token_accuracy": 0.13310989141464233, "num_tokens": 2760987.0, "step": 1095 }, { "entropy": 7.242767477035523, "epoch": 0.12694748990190421, "grad_norm": 1.0078125, "learning_rate": 0.0004999985165686764, "loss": 7.2233, "mean_token_accuracy": 0.13173784613609313, "num_tokens": 2773161.0, "step": 1100 }, { "entropy": 7.143377590179443, "epoch": 0.12752452394691285, "grad_norm": 0.89453125, "learning_rate": 0.0004999983629434373, "loss": 7.1702, "mean_token_accuracy": 0.1464059606194496, "num_tokens": 2786179.0, "step": 1105 }, { "entropy": 7.255331087112427, "epoch": 0.12810155799192152, "grad_norm": 0.94140625, "learning_rate": 0.0004999982017504901, "loss": 7.1856, "mean_token_accuracy": 0.14088639095425606, "num_tokens": 2798859.0, "step": 1110 }, { "entropy": 7.152024507522583, "epoch": 0.1286785920369302, "grad_norm": 0.91015625, "learning_rate": 0.0004999980329898401, "loss": 7.2883, "mean_token_accuracy": 0.13371546044945717, "num_tokens": 2813048.0, "step": 1115 }, { "entropy": 7.280220174789429, "epoch": 0.12925562608193883, "grad_norm": 1.0234375, "learning_rate": 0.000499997856661493, "loss": 7.2463, "mean_token_accuracy": 0.13465555906295776, "num_tokens": 2826032.0, "step": 1120 }, { "entropy": 7.17284836769104, "epoch": 0.1298326601269475, "grad_norm": 1.03125, "learning_rate": 0.000499997672765455, "loss": 7.2976, "mean_token_accuracy": 0.133281010389328, "num_tokens": 2839253.0, "step": 1125 }, { "entropy": 7.185248899459839, "epoch": 0.13040969417195614, "grad_norm": 1.3125, "learning_rate": 0.0004999974813017318, "loss": 7.2206, "mean_token_accuracy": 0.1415400303900242, "num_tokens": 2852542.0, "step": 1130 }, { "entropy": 7.138202762603759, "epoch": 0.1309867282169648, "grad_norm": 0.95703125, "learning_rate": 0.0004999972822703301, "loss": 7.2218, "mean_token_accuracy": 0.13877267017960548, "num_tokens": 2863967.0, "step": 1135 }, { "entropy": 7.290763425827026, "epoch": 0.13156376226197344, "grad_norm": 0.92578125, "learning_rate": 0.0004999970756712567, "loss": 7.3254, "mean_token_accuracy": 0.12893034666776657, "num_tokens": 2876141.0, "step": 1140 }, { "entropy": 7.014846658706665, "epoch": 0.1321407963069821, "grad_norm": 0.921875, "learning_rate": 0.0004999968615045183, "loss": 7.1565, "mean_token_accuracy": 0.13931377455592156, "num_tokens": 2888395.0, "step": 1145 }, { "entropy": 7.292420244216919, "epoch": 0.13271783035199078, "grad_norm": 1.0234375, "learning_rate": 0.0004999966397701222, "loss": 7.3365, "mean_token_accuracy": 0.1309019148349762, "num_tokens": 2902399.0, "step": 1150 }, { "entropy": 7.157604312896728, "epoch": 0.13329486439699942, "grad_norm": 0.98046875, "learning_rate": 0.0004999964104680759, "loss": 7.0878, "mean_token_accuracy": 0.13564511761069298, "num_tokens": 2914999.0, "step": 1155 }, { "entropy": 7.144139671325684, "epoch": 0.13387189844200809, "grad_norm": 1.1484375, "learning_rate": 0.0004999961735983871, "loss": 7.0883, "mean_token_accuracy": 0.14829797372221948, "num_tokens": 2928091.0, "step": 1160 }, { "entropy": 7.185041427612305, "epoch": 0.13444893248701673, "grad_norm": 0.91015625, "learning_rate": 0.0004999959291610639, "loss": 7.207, "mean_token_accuracy": 0.13267041072249414, "num_tokens": 2940840.0, "step": 1165 }, { "entropy": 7.118538331985474, "epoch": 0.1350259665320254, "grad_norm": 1.0234375, "learning_rate": 0.0004999956771561143, "loss": 7.1349, "mean_token_accuracy": 0.13792715817689896, "num_tokens": 2952980.0, "step": 1170 }, { "entropy": 7.110788869857788, "epoch": 0.13560300057703403, "grad_norm": 0.90234375, "learning_rate": 0.0004999954175835469, "loss": 7.1856, "mean_token_accuracy": 0.13442225083708764, "num_tokens": 2965437.0, "step": 1175 }, { "entropy": 7.1716221332550045, "epoch": 0.1361800346220427, "grad_norm": 1.0078125, "learning_rate": 0.0004999951504433703, "loss": 7.2135, "mean_token_accuracy": 0.13230456560850143, "num_tokens": 2978077.0, "step": 1180 }, { "entropy": 7.156641292572021, "epoch": 0.13675706866705137, "grad_norm": 0.97265625, "learning_rate": 0.0004999948757355935, "loss": 7.2831, "mean_token_accuracy": 0.13261316642165183, "num_tokens": 2990498.0, "step": 1185 }, { "entropy": 7.198510980606079, "epoch": 0.13733410271206, "grad_norm": 0.8828125, "learning_rate": 0.000499994593460226, "loss": 7.2269, "mean_token_accuracy": 0.13312480375170707, "num_tokens": 3002784.0, "step": 1190 }, { "entropy": 7.238051557540894, "epoch": 0.13791113675706868, "grad_norm": 0.953125, "learning_rate": 0.0004999943036172771, "loss": 7.1808, "mean_token_accuracy": 0.13066396713256836, "num_tokens": 3015689.0, "step": 1195 }, { "entropy": 7.092861557006836, "epoch": 0.13848817080207732, "grad_norm": 1.0546875, "learning_rate": 0.0004999940062067565, "loss": 7.1113, "mean_token_accuracy": 0.14541881829500197, "num_tokens": 3026623.0, "step": 1200 }, { "entropy": 7.083968591690064, "epoch": 0.13906520484708598, "grad_norm": 1.015625, "learning_rate": 0.0004999937012286742, "loss": 7.1675, "mean_token_accuracy": 0.14061277359724045, "num_tokens": 3039769.0, "step": 1205 }, { "entropy": 7.057619905471801, "epoch": 0.13964223889209462, "grad_norm": 0.99609375, "learning_rate": 0.0004999933886830405, "loss": 7.1518, "mean_token_accuracy": 0.1339143082499504, "num_tokens": 3052044.0, "step": 1210 }, { "entropy": 7.185735702514648, "epoch": 0.1402192729371033, "grad_norm": 0.9609375, "learning_rate": 0.000499993068569866, "loss": 7.1173, "mean_token_accuracy": 0.13880359381437302, "num_tokens": 3063937.0, "step": 1215 }, { "entropy": 7.0055492401123045, "epoch": 0.14079630698211196, "grad_norm": 1.1875, "learning_rate": 0.0004999927408891614, "loss": 7.0929, "mean_token_accuracy": 0.14283955842256546, "num_tokens": 3076645.0, "step": 1220 }, { "entropy": 7.1528167724609375, "epoch": 0.1413733410271206, "grad_norm": 0.9609375, "learning_rate": 0.0004999924056409378, "loss": 7.1459, "mean_token_accuracy": 0.1395370438694954, "num_tokens": 3088985.0, "step": 1225 }, { "entropy": 7.103240489959717, "epoch": 0.14195037507212926, "grad_norm": 1.0, "learning_rate": 0.0004999920628252063, "loss": 7.1467, "mean_token_accuracy": 0.13826994374394416, "num_tokens": 3101270.0, "step": 1230 }, { "entropy": 7.075673818588257, "epoch": 0.1425274091171379, "grad_norm": 0.92578125, "learning_rate": 0.0004999917124419785, "loss": 7.1521, "mean_token_accuracy": 0.13071254119277, "num_tokens": 3115420.0, "step": 1235 }, { "entropy": 7.155364894866944, "epoch": 0.14310444316214657, "grad_norm": 0.93359375, "learning_rate": 0.0004999913544912664, "loss": 7.101, "mean_token_accuracy": 0.13510319143533706, "num_tokens": 3126176.0, "step": 1240 }, { "entropy": 7.037791395187378, "epoch": 0.1436814772071552, "grad_norm": 0.84765625, "learning_rate": 0.0004999909889730817, "loss": 7.134, "mean_token_accuracy": 0.14009907394647597, "num_tokens": 3139136.0, "step": 1245 }, { "entropy": 7.121502780914307, "epoch": 0.14425851125216388, "grad_norm": 0.94140625, "learning_rate": 0.0004999906158874368, "loss": 7.0984, "mean_token_accuracy": 0.13803695887327194, "num_tokens": 3152036.0, "step": 1250 }, { "entropy": 7.089022874832153, "epoch": 0.14483554529717255, "grad_norm": 0.94921875, "learning_rate": 0.0004999902352343444, "loss": 7.124, "mean_token_accuracy": 0.1390008471906185, "num_tokens": 3164060.0, "step": 1255 }, { "entropy": 7.158830451965332, "epoch": 0.1454125793421812, "grad_norm": 0.9375, "learning_rate": 0.0004999898470138171, "loss": 7.2071, "mean_token_accuracy": 0.12887537702918053, "num_tokens": 3176410.0, "step": 1260 }, { "entropy": 7.16694221496582, "epoch": 0.14598961338718985, "grad_norm": 0.87890625, "learning_rate": 0.0004999894512258681, "loss": 7.2054, "mean_token_accuracy": 0.13165885508060454, "num_tokens": 3189784.0, "step": 1265 }, { "entropy": 7.0905242443084715, "epoch": 0.1465666474321985, "grad_norm": 0.91015625, "learning_rate": 0.0004999890478705107, "loss": 7.126, "mean_token_accuracy": 0.1364673689007759, "num_tokens": 3202274.0, "step": 1270 }, { "entropy": 7.164013195037842, "epoch": 0.14714368147720716, "grad_norm": 0.98046875, "learning_rate": 0.0004999886369477585, "loss": 7.1967, "mean_token_accuracy": 0.1339113764464855, "num_tokens": 3215593.0, "step": 1275 }, { "entropy": 7.090557193756103, "epoch": 0.1477207155222158, "grad_norm": 0.90625, "learning_rate": 0.0004999882184576251, "loss": 7.0904, "mean_token_accuracy": 0.13543560802936555, "num_tokens": 3228307.0, "step": 1280 }, { "entropy": 7.0394628047943115, "epoch": 0.14829774956722447, "grad_norm": 0.85546875, "learning_rate": 0.0004999877924001248, "loss": 7.063, "mean_token_accuracy": 0.137285415828228, "num_tokens": 3241676.0, "step": 1285 }, { "entropy": 7.106666898727417, "epoch": 0.1488747836122331, "grad_norm": 1.0078125, "learning_rate": 0.0004999873587752718, "loss": 7.1441, "mean_token_accuracy": 0.13408377543091773, "num_tokens": 3255190.0, "step": 1290 }, { "entropy": 7.084112691879272, "epoch": 0.14945181765724178, "grad_norm": 0.94921875, "learning_rate": 0.0004999869175830808, "loss": 7.171, "mean_token_accuracy": 0.13335621058940889, "num_tokens": 3268236.0, "step": 1295 }, { "entropy": 7.132741975784302, "epoch": 0.15002885170225044, "grad_norm": 0.97265625, "learning_rate": 0.0004999864688235666, "loss": 7.1832, "mean_token_accuracy": 0.13459478169679642, "num_tokens": 3281316.0, "step": 1300 }, { "entropy": 7.08173189163208, "epoch": 0.15060588574725908, "grad_norm": 0.88671875, "learning_rate": 0.0004999860124967442, "loss": 7.0801, "mean_token_accuracy": 0.1370793603360653, "num_tokens": 3293517.0, "step": 1305 }, { "entropy": 7.009785556793213, "epoch": 0.15118291979226775, "grad_norm": 0.859375, "learning_rate": 0.0004999855486026291, "loss": 7.0642, "mean_token_accuracy": 0.14415186047554016, "num_tokens": 3306814.0, "step": 1310 }, { "entropy": 7.143966817855835, "epoch": 0.1517599538372764, "grad_norm": 1.140625, "learning_rate": 0.0004999850771412369, "loss": 7.1255, "mean_token_accuracy": 0.1338451124727726, "num_tokens": 3318722.0, "step": 1315 }, { "entropy": 6.947969913482666, "epoch": 0.15233698788228506, "grad_norm": 1.6875, "learning_rate": 0.0004999845981125832, "loss": 7.0902, "mean_token_accuracy": 0.13792371451854707, "num_tokens": 3331212.0, "step": 1320 }, { "entropy": 7.112496328353882, "epoch": 0.1529140219272937, "grad_norm": 0.890625, "learning_rate": 0.0004999841115166844, "loss": 7.065, "mean_token_accuracy": 0.14001230895519257, "num_tokens": 3343999.0, "step": 1325 }, { "entropy": 6.955641222000122, "epoch": 0.15349105597230236, "grad_norm": 0.9765625, "learning_rate": 0.0004999836173535568, "loss": 7.0087, "mean_token_accuracy": 0.14088786989450455, "num_tokens": 3356281.0, "step": 1330 }, { "entropy": 7.026442623138427, "epoch": 0.15406809001731103, "grad_norm": 0.96484375, "learning_rate": 0.0004999831156232169, "loss": 7.0683, "mean_token_accuracy": 0.1388309493660927, "num_tokens": 3369370.0, "step": 1335 }, { "entropy": 7.115357398986816, "epoch": 0.15464512406231967, "grad_norm": 0.94921875, "learning_rate": 0.0004999826063256818, "loss": 7.2104, "mean_token_accuracy": 0.13239274099469184, "num_tokens": 3382400.0, "step": 1340 }, { "entropy": 7.049170970916748, "epoch": 0.15522215810732834, "grad_norm": 0.93359375, "learning_rate": 0.0004999820894609683, "loss": 7.0738, "mean_token_accuracy": 0.13679501563310623, "num_tokens": 3393666.0, "step": 1345 }, { "entropy": 7.102601671218872, "epoch": 0.15579919215233698, "grad_norm": 0.8515625, "learning_rate": 0.0004999815650290941, "loss": 7.0784, "mean_token_accuracy": 0.13827622160315514, "num_tokens": 3405920.0, "step": 1350 }, { "entropy": 6.988848543167114, "epoch": 0.15637622619734565, "grad_norm": 0.9375, "learning_rate": 0.0004999810330300766, "loss": 6.9811, "mean_token_accuracy": 0.14476096332073213, "num_tokens": 3417886.0, "step": 1355 }, { "entropy": 7.066180992126465, "epoch": 0.1569532602423543, "grad_norm": 0.88671875, "learning_rate": 0.000499980493463934, "loss": 7.0976, "mean_token_accuracy": 0.13426982685923577, "num_tokens": 3430626.0, "step": 1360 }, { "entropy": 7.005979776382446, "epoch": 0.15753029428736295, "grad_norm": 0.9453125, "learning_rate": 0.0004999799463306841, "loss": 6.9849, "mean_token_accuracy": 0.13666047602891923, "num_tokens": 3443248.0, "step": 1365 }, { "entropy": 7.070165061950684, "epoch": 0.15810732833237162, "grad_norm": 0.984375, "learning_rate": 0.0004999793916303455, "loss": 7.032, "mean_token_accuracy": 0.13812974020838736, "num_tokens": 3456163.0, "step": 1370 }, { "entropy": 6.949036455154419, "epoch": 0.15868436237738026, "grad_norm": 1.1171875, "learning_rate": 0.0004999788293629368, "loss": 7.0586, "mean_token_accuracy": 0.1321362428367138, "num_tokens": 3468862.0, "step": 1375 }, { "entropy": 7.017643308639526, "epoch": 0.15926139642238893, "grad_norm": 0.984375, "learning_rate": 0.000499978259528477, "loss": 7.0618, "mean_token_accuracy": 0.14320022165775298, "num_tokens": 3481516.0, "step": 1380 }, { "entropy": 7.152157735824585, "epoch": 0.15983843046739757, "grad_norm": 0.921875, "learning_rate": 0.0004999776821269852, "loss": 7.1397, "mean_token_accuracy": 0.12845932096242904, "num_tokens": 3493063.0, "step": 1385 }, { "entropy": 6.983753442764282, "epoch": 0.16041546451240624, "grad_norm": 0.90234375, "learning_rate": 0.0004999770971584807, "loss": 6.9992, "mean_token_accuracy": 0.13282350823283195, "num_tokens": 3505460.0, "step": 1390 }, { "entropy": 7.0605611324310305, "epoch": 0.16099249855741488, "grad_norm": 0.875, "learning_rate": 0.0004999765046229834, "loss": 7.1184, "mean_token_accuracy": 0.13035993799567222, "num_tokens": 3519232.0, "step": 1395 }, { "entropy": 6.989923524856567, "epoch": 0.16156953260242354, "grad_norm": 0.890625, "learning_rate": 0.000499975904520513, "loss": 7.0311, "mean_token_accuracy": 0.14471797570586203, "num_tokens": 3531759.0, "step": 1400 }, { "entropy": 7.006714677810669, "epoch": 0.1621465666474322, "grad_norm": 0.921875, "learning_rate": 0.00049997529685109, "loss": 6.9624, "mean_token_accuracy": 0.14889438897371293, "num_tokens": 3543457.0, "step": 1405 }, { "entropy": 6.985404443740845, "epoch": 0.16272360069244085, "grad_norm": 0.921875, "learning_rate": 0.0004999746816147344, "loss": 7.1171, "mean_token_accuracy": 0.13007233440876007, "num_tokens": 3557036.0, "step": 1410 }, { "entropy": 7.086899042129517, "epoch": 0.16330063473744952, "grad_norm": 0.87890625, "learning_rate": 0.0004999740588114673, "loss": 7.0671, "mean_token_accuracy": 0.1431369036436081, "num_tokens": 3569415.0, "step": 1415 }, { "entropy": 6.992696142196655, "epoch": 0.16387766878245816, "grad_norm": 1.1015625, "learning_rate": 0.0004999734284413095, "loss": 7.0656, "mean_token_accuracy": 0.13436094596982, "num_tokens": 3581452.0, "step": 1420 }, { "entropy": 7.03533968925476, "epoch": 0.16445470282746683, "grad_norm": 0.94921875, "learning_rate": 0.000499972790504282, "loss": 7.1012, "mean_token_accuracy": 0.1372412621974945, "num_tokens": 3593482.0, "step": 1425 }, { "entropy": 7.005078983306885, "epoch": 0.16503173687247547, "grad_norm": 0.99609375, "learning_rate": 0.0004999721450004067, "loss": 7.0916, "mean_token_accuracy": 0.13415241464972497, "num_tokens": 3606062.0, "step": 1430 }, { "entropy": 7.060822534561157, "epoch": 0.16560877091748413, "grad_norm": 0.94140625, "learning_rate": 0.0004999714919297049, "loss": 7.0473, "mean_token_accuracy": 0.1380315750837326, "num_tokens": 3619210.0, "step": 1435 }, { "entropy": 7.01508846282959, "epoch": 0.1661858049624928, "grad_norm": 0.875, "learning_rate": 0.0004999708312921987, "loss": 7.0976, "mean_token_accuracy": 0.13783507272601128, "num_tokens": 3631952.0, "step": 1440 }, { "entropy": 7.05513277053833, "epoch": 0.16676283900750144, "grad_norm": 0.94140625, "learning_rate": 0.0004999701630879103, "loss": 6.9784, "mean_token_accuracy": 0.1367719940841198, "num_tokens": 3644864.0, "step": 1445 }, { "entropy": 6.986611795425415, "epoch": 0.1673398730525101, "grad_norm": 0.94921875, "learning_rate": 0.0004999694873168623, "loss": 7.046, "mean_token_accuracy": 0.13879042416810988, "num_tokens": 3657504.0, "step": 1450 }, { "entropy": 7.017226314544677, "epoch": 0.16791690709751875, "grad_norm": 0.96875, "learning_rate": 0.0004999688039790773, "loss": 6.9585, "mean_token_accuracy": 0.14265901520848273, "num_tokens": 3670304.0, "step": 1455 }, { "entropy": 6.9451819896698, "epoch": 0.16849394114252741, "grad_norm": 1.0390625, "learning_rate": 0.0004999681130745784, "loss": 6.9718, "mean_token_accuracy": 0.13715282902121545, "num_tokens": 3681503.0, "step": 1460 }, { "entropy": 6.938751745223999, "epoch": 0.16907097518753605, "grad_norm": 0.984375, "learning_rate": 0.0004999674146033888, "loss": 7.0007, "mean_token_accuracy": 0.13866478949785233, "num_tokens": 3693248.0, "step": 1465 }, { "entropy": 7.016212892532349, "epoch": 0.16964800923254472, "grad_norm": 0.9375, "learning_rate": 0.0004999667085655318, "loss": 7.035, "mean_token_accuracy": 0.1379549205303192, "num_tokens": 3705285.0, "step": 1470 }, { "entropy": 6.883904600143433, "epoch": 0.1702250432775534, "grad_norm": 0.9921875, "learning_rate": 0.0004999659949610313, "loss": 7.0562, "mean_token_accuracy": 0.12795180603861808, "num_tokens": 3719025.0, "step": 1475 }, { "entropy": 7.103451251983643, "epoch": 0.17080207732256203, "grad_norm": 0.9453125, "learning_rate": 0.0004999652737899114, "loss": 7.0306, "mean_token_accuracy": 0.13902753069996834, "num_tokens": 3732054.0, "step": 1480 }, { "entropy": 6.955500936508178, "epoch": 0.1713791113675707, "grad_norm": 1.046875, "learning_rate": 0.0004999645450521963, "loss": 7.0133, "mean_token_accuracy": 0.13680559545755386, "num_tokens": 3744080.0, "step": 1485 }, { "entropy": 6.9854591369628904, "epoch": 0.17195614541257934, "grad_norm": 0.890625, "learning_rate": 0.0004999638087479104, "loss": 7.047, "mean_token_accuracy": 0.13523856773972512, "num_tokens": 3756371.0, "step": 1490 }, { "entropy": 7.104809236526489, "epoch": 0.172533179457588, "grad_norm": 0.96875, "learning_rate": 0.0004999630648770786, "loss": 6.9673, "mean_token_accuracy": 0.1353852815926075, "num_tokens": 3769307.0, "step": 1495 }, { "entropy": 6.814951086044312, "epoch": 0.17311021350259664, "grad_norm": 1.03125, "learning_rate": 0.0004999623134397257, "loss": 6.9706, "mean_token_accuracy": 0.14363576769828795, "num_tokens": 3782826.0, "step": 1500 }, { "entropy": 7.0104962348937985, "epoch": 0.1736872475476053, "grad_norm": 0.94140625, "learning_rate": 0.0004999615544358774, "loss": 6.9846, "mean_token_accuracy": 0.1368210159242153, "num_tokens": 3794566.0, "step": 1505 }, { "entropy": 6.955519914627075, "epoch": 0.17426428159261395, "grad_norm": 0.953125, "learning_rate": 0.0004999607878655587, "loss": 7.0675, "mean_token_accuracy": 0.1298111744225025, "num_tokens": 3807058.0, "step": 1510 }, { "entropy": 7.028119516372681, "epoch": 0.17484131563762262, "grad_norm": 0.890625, "learning_rate": 0.0004999600137287958, "loss": 7.0107, "mean_token_accuracy": 0.14360469132661818, "num_tokens": 3819836.0, "step": 1515 }, { "entropy": 6.98626184463501, "epoch": 0.17541834968263129, "grad_norm": 0.91015625, "learning_rate": 0.0004999592320256146, "loss": 7.0598, "mean_token_accuracy": 0.1317824549973011, "num_tokens": 3832081.0, "step": 1520 }, { "entropy": 7.0153602123260494, "epoch": 0.17599538372763993, "grad_norm": 0.921875, "learning_rate": 0.0004999584427560412, "loss": 6.9811, "mean_token_accuracy": 0.13875427916646005, "num_tokens": 3843279.0, "step": 1525 }, { "entropy": 6.946571159362793, "epoch": 0.1765724177726486, "grad_norm": 0.98828125, "learning_rate": 0.0004999576459201024, "loss": 7.0461, "mean_token_accuracy": 0.14072771817445756, "num_tokens": 3855479.0, "step": 1530 }, { "entropy": 7.037504243850708, "epoch": 0.17714945181765723, "grad_norm": 0.9453125, "learning_rate": 0.000499956841517825, "loss": 7.0258, "mean_token_accuracy": 0.1374424070119858, "num_tokens": 3868111.0, "step": 1535 }, { "entropy": 6.900399398803711, "epoch": 0.1777264858626659, "grad_norm": 0.95703125, "learning_rate": 0.000499956029549236, "loss": 6.9516, "mean_token_accuracy": 0.14264189973473548, "num_tokens": 3880062.0, "step": 1540 }, { "entropy": 7.105960988998413, "epoch": 0.17830351990767454, "grad_norm": 0.90234375, "learning_rate": 0.0004999552100143625, "loss": 7.0352, "mean_token_accuracy": 0.13576769903302194, "num_tokens": 3892293.0, "step": 1545 }, { "entropy": 6.912646913528443, "epoch": 0.1788805539526832, "grad_norm": 0.9296875, "learning_rate": 0.0004999543829132324, "loss": 6.8992, "mean_token_accuracy": 0.1437755271792412, "num_tokens": 3904549.0, "step": 1550 }, { "entropy": 6.929834699630737, "epoch": 0.17945758799769188, "grad_norm": 1.015625, "learning_rate": 0.0004999535482458734, "loss": 6.953, "mean_token_accuracy": 0.14296042323112487, "num_tokens": 3916693.0, "step": 1555 }, { "entropy": 6.884093236923218, "epoch": 0.18003462204270052, "grad_norm": 1.0, "learning_rate": 0.0004999527060123135, "loss": 6.9797, "mean_token_accuracy": 0.13235038220882417, "num_tokens": 3930488.0, "step": 1560 }, { "entropy": 6.985349941253662, "epoch": 0.18061165608770918, "grad_norm": 0.93359375, "learning_rate": 0.0004999518562125811, "loss": 6.961, "mean_token_accuracy": 0.14040945768356322, "num_tokens": 3942353.0, "step": 1565 }, { "entropy": 6.977359771728516, "epoch": 0.18118869013271782, "grad_norm": 1.015625, "learning_rate": 0.0004999509988467047, "loss": 7.0072, "mean_token_accuracy": 0.13477388694882392, "num_tokens": 3953868.0, "step": 1570 }, { "entropy": 6.984608507156372, "epoch": 0.1817657241777265, "grad_norm": 0.9453125, "learning_rate": 0.0004999501339147132, "loss": 7.0248, "mean_token_accuracy": 0.13513074964284896, "num_tokens": 3965148.0, "step": 1575 }, { "entropy": 6.968512153625488, "epoch": 0.18234275822273513, "grad_norm": 0.92578125, "learning_rate": 0.0004999492614166357, "loss": 6.9684, "mean_token_accuracy": 0.14738112092018127, "num_tokens": 3977323.0, "step": 1580 }, { "entropy": 6.937796115875244, "epoch": 0.1829197922677438, "grad_norm": 0.91015625, "learning_rate": 0.0004999483813525014, "loss": 6.9445, "mean_token_accuracy": 0.1459215387701988, "num_tokens": 3990076.0, "step": 1585 }, { "entropy": 6.896608018875122, "epoch": 0.18349682631275246, "grad_norm": 0.96875, "learning_rate": 0.0004999474937223403, "loss": 6.959, "mean_token_accuracy": 0.1377126969397068, "num_tokens": 4001996.0, "step": 1590 }, { "entropy": 6.98504409790039, "epoch": 0.1840738603577611, "grad_norm": 0.9140625, "learning_rate": 0.0004999465985261818, "loss": 7.0041, "mean_token_accuracy": 0.13642505407333375, "num_tokens": 4015095.0, "step": 1595 }, { "entropy": 6.90059175491333, "epoch": 0.18465089440276977, "grad_norm": 0.9140625, "learning_rate": 0.0004999456957640562, "loss": 6.8935, "mean_token_accuracy": 0.1471956580877304, "num_tokens": 4028633.0, "step": 1600 }, { "entropy": 6.932298421859741, "epoch": 0.1852279284477784, "grad_norm": 0.890625, "learning_rate": 0.0004999447854359939, "loss": 6.9938, "mean_token_accuracy": 0.1394735284149647, "num_tokens": 4042265.0, "step": 1605 }, { "entropy": 6.876345634460449, "epoch": 0.18580496249278708, "grad_norm": 0.9453125, "learning_rate": 0.0004999438675420255, "loss": 6.954, "mean_token_accuracy": 0.1372726485133171, "num_tokens": 4054467.0, "step": 1610 }, { "entropy": 6.95422887802124, "epoch": 0.18638199653779572, "grad_norm": 1.0625, "learning_rate": 0.0004999429420821818, "loss": 6.951, "mean_token_accuracy": 0.1380107432603836, "num_tokens": 4068053.0, "step": 1615 }, { "entropy": 6.854258346557617, "epoch": 0.1869590305828044, "grad_norm": 1.15625, "learning_rate": 0.000499942009056494, "loss": 6.9318, "mean_token_accuracy": 0.1387524574995041, "num_tokens": 4080867.0, "step": 1620 }, { "entropy": 6.933802938461303, "epoch": 0.18753606462781305, "grad_norm": 1.0234375, "learning_rate": 0.0004999410684649935, "loss": 6.9481, "mean_token_accuracy": 0.14056655392050743, "num_tokens": 4093228.0, "step": 1625 }, { "entropy": 7.00413064956665, "epoch": 0.1881130986728217, "grad_norm": 0.921875, "learning_rate": 0.0004999401203077119, "loss": 6.9716, "mean_token_accuracy": 0.14066905975341798, "num_tokens": 4104929.0, "step": 1630 }, { "entropy": 6.8644571781158445, "epoch": 0.18869013271783036, "grad_norm": 0.9296875, "learning_rate": 0.000499939164584681, "loss": 6.9945, "mean_token_accuracy": 0.14416123032569886, "num_tokens": 4119445.0, "step": 1635 }, { "entropy": 7.075875329971313, "epoch": 0.189267166762839, "grad_norm": 1.09375, "learning_rate": 0.0004999382012959331, "loss": 6.8961, "mean_token_accuracy": 0.14873119294643403, "num_tokens": 4131558.0, "step": 1640 }, { "entropy": 6.876895570755005, "epoch": 0.18984420080784767, "grad_norm": 0.97265625, "learning_rate": 0.0004999372304415005, "loss": 7.0549, "mean_token_accuracy": 0.12923122197389603, "num_tokens": 4144566.0, "step": 1645 }, { "entropy": 6.990751695632935, "epoch": 0.1904212348528563, "grad_norm": 1.125, "learning_rate": 0.0004999362520214159, "loss": 6.9381, "mean_token_accuracy": 0.14834065288305281, "num_tokens": 4157295.0, "step": 1650 }, { "entropy": 6.910133790969849, "epoch": 0.19099826889786498, "grad_norm": 0.87109375, "learning_rate": 0.0004999352660357122, "loss": 6.9455, "mean_token_accuracy": 0.13908031955361366, "num_tokens": 4170229.0, "step": 1655 }, { "entropy": 6.951679515838623, "epoch": 0.19157530294287364, "grad_norm": 0.87109375, "learning_rate": 0.0004999342724844226, "loss": 6.9645, "mean_token_accuracy": 0.13757809549570083, "num_tokens": 4182906.0, "step": 1660 }, { "entropy": 6.961617517471313, "epoch": 0.19215233698788228, "grad_norm": 0.9453125, "learning_rate": 0.0004999332713675804, "loss": 6.9304, "mean_token_accuracy": 0.14034477695822717, "num_tokens": 4195556.0, "step": 1665 }, { "entropy": 6.911066627502441, "epoch": 0.19272937103289095, "grad_norm": 0.92578125, "learning_rate": 0.0004999322626852193, "loss": 6.8961, "mean_token_accuracy": 0.1394181601703167, "num_tokens": 4207616.0, "step": 1670 }, { "entropy": 6.845373630523682, "epoch": 0.1933064050778996, "grad_norm": 0.8828125, "learning_rate": 0.0004999312464373734, "loss": 6.8568, "mean_token_accuracy": 0.14717165976762772, "num_tokens": 4219299.0, "step": 1675 }, { "entropy": 6.886244630813598, "epoch": 0.19388343912290826, "grad_norm": 0.95703125, "learning_rate": 0.0004999302226240767, "loss": 7.0009, "mean_token_accuracy": 0.13946698978543282, "num_tokens": 4232098.0, "step": 1680 }, { "entropy": 6.927741765975952, "epoch": 0.1944604731679169, "grad_norm": 0.9609375, "learning_rate": 0.0004999291912453637, "loss": 6.8926, "mean_token_accuracy": 0.14187719076871871, "num_tokens": 4243879.0, "step": 1685 }, { "entropy": 6.919966363906861, "epoch": 0.19503750721292556, "grad_norm": 1.015625, "learning_rate": 0.0004999281523012691, "loss": 6.9798, "mean_token_accuracy": 0.13289057463407516, "num_tokens": 4256507.0, "step": 1690 }, { "entropy": 7.115394401550293, "epoch": 0.1956145412579342, "grad_norm": 0.91796875, "learning_rate": 0.0004999271057918278, "loss": 7.0498, "mean_token_accuracy": 0.13213248774409295, "num_tokens": 4270763.0, "step": 1695 }, { "entropy": 6.83512053489685, "epoch": 0.19619157530294287, "grad_norm": 0.91015625, "learning_rate": 0.0004999260517170751, "loss": 6.9311, "mean_token_accuracy": 0.13900210931897164, "num_tokens": 4284380.0, "step": 1700 }, { "entropy": 6.999711275100708, "epoch": 0.19676860934795154, "grad_norm": 0.89453125, "learning_rate": 0.0004999249900770463, "loss": 7.0283, "mean_token_accuracy": 0.13723405376076697, "num_tokens": 4297812.0, "step": 1705 }, { "entropy": 6.927718687057495, "epoch": 0.19734564339296018, "grad_norm": 1.1328125, "learning_rate": 0.0004999239208717772, "loss": 7.0, "mean_token_accuracy": 0.14325511828064919, "num_tokens": 4310374.0, "step": 1710 }, { "entropy": 6.975845861434936, "epoch": 0.19792267743796885, "grad_norm": 1.03125, "learning_rate": 0.0004999228441013037, "loss": 6.966, "mean_token_accuracy": 0.1380312144756317, "num_tokens": 4322330.0, "step": 1715 }, { "entropy": 6.951593542098999, "epoch": 0.1984997114829775, "grad_norm": 0.91796875, "learning_rate": 0.000499921759765662, "loss": 6.9519, "mean_token_accuracy": 0.1390042595565319, "num_tokens": 4335204.0, "step": 1720 }, { "entropy": 6.7771580696105955, "epoch": 0.19907674552798615, "grad_norm": 0.95703125, "learning_rate": 0.0004999206678648888, "loss": 6.8396, "mean_token_accuracy": 0.14716555774211884, "num_tokens": 4347339.0, "step": 1725 }, { "entropy": 6.960784196853638, "epoch": 0.1996537795729948, "grad_norm": 1.921875, "learning_rate": 0.0004999195683990206, "loss": 6.8991, "mean_token_accuracy": 0.14737813025712967, "num_tokens": 4360273.0, "step": 1730 }, { "entropy": 6.812373208999634, "epoch": 0.20023081361800346, "grad_norm": 0.91015625, "learning_rate": 0.0004999184613680945, "loss": 6.9116, "mean_token_accuracy": 0.14005344808101655, "num_tokens": 4373424.0, "step": 1735 }, { "entropy": 6.970333909988403, "epoch": 0.20080784766301213, "grad_norm": 0.93359375, "learning_rate": 0.0004999173467721476, "loss": 6.8623, "mean_token_accuracy": 0.14696093946695327, "num_tokens": 4386125.0, "step": 1740 }, { "entropy": 6.900853633880615, "epoch": 0.20138488170802077, "grad_norm": 0.94140625, "learning_rate": 0.0004999162246112175, "loss": 6.9299, "mean_token_accuracy": 0.1397725947201252, "num_tokens": 4399214.0, "step": 1745 }, { "entropy": 6.842698955535889, "epoch": 0.20196191575302944, "grad_norm": 0.94921875, "learning_rate": 0.0004999150948853419, "loss": 6.8108, "mean_token_accuracy": 0.14288675636053086, "num_tokens": 4411282.0, "step": 1750 }, { "entropy": 6.895815658569336, "epoch": 0.20253894979803808, "grad_norm": 1.046875, "learning_rate": 0.0004999139575945587, "loss": 6.904, "mean_token_accuracy": 0.14115357473492623, "num_tokens": 4423448.0, "step": 1755 }, { "entropy": 6.8710291385650635, "epoch": 0.20311598384304674, "grad_norm": 0.94140625, "learning_rate": 0.0004999128127389065, "loss": 6.8318, "mean_token_accuracy": 0.14915311187505723, "num_tokens": 4436498.0, "step": 1760 }, { "entropy": 6.864768648147583, "epoch": 0.20369301788805538, "grad_norm": 0.9609375, "learning_rate": 0.0004999116603184233, "loss": 6.8424, "mean_token_accuracy": 0.14298070967197418, "num_tokens": 4448641.0, "step": 1765 }, { "entropy": 6.82587513923645, "epoch": 0.20427005193306405, "grad_norm": 0.921875, "learning_rate": 0.0004999105003331482, "loss": 6.8389, "mean_token_accuracy": 0.14010173305869103, "num_tokens": 4460539.0, "step": 1770 }, { "entropy": 6.890678787231446, "epoch": 0.20484708597807272, "grad_norm": 0.92578125, "learning_rate": 0.0004999093327831202, "loss": 6.9094, "mean_token_accuracy": 0.1397670365869999, "num_tokens": 4472487.0, "step": 1775 }, { "entropy": 6.8611537456512455, "epoch": 0.20542412002308136, "grad_norm": 0.92578125, "learning_rate": 0.0004999081576683784, "loss": 6.8784, "mean_token_accuracy": 0.14253682196140288, "num_tokens": 4485164.0, "step": 1780 }, { "entropy": 6.964418983459472, "epoch": 0.20600115406809003, "grad_norm": 0.859375, "learning_rate": 0.0004999069749889626, "loss": 6.9038, "mean_token_accuracy": 0.14524734169244766, "num_tokens": 4497708.0, "step": 1785 }, { "entropy": 6.834679794311524, "epoch": 0.20657818811309867, "grad_norm": 0.9453125, "learning_rate": 0.0004999057847449123, "loss": 6.9527, "mean_token_accuracy": 0.13614820539951325, "num_tokens": 4510648.0, "step": 1790 }, { "entropy": 6.901812505722046, "epoch": 0.20715522215810733, "grad_norm": 0.921875, "learning_rate": 0.0004999045869362678, "loss": 6.8605, "mean_token_accuracy": 0.14650894105434417, "num_tokens": 4522699.0, "step": 1795 }, { "entropy": 6.82709813117981, "epoch": 0.20773225620311597, "grad_norm": 0.9609375, "learning_rate": 0.000499903381563069, "loss": 6.921, "mean_token_accuracy": 0.14181671142578126, "num_tokens": 4536060.0, "step": 1800 }, { "entropy": 6.863535785675049, "epoch": 0.20830929024812464, "grad_norm": 0.875, "learning_rate": 0.0004999021686253568, "loss": 6.8218, "mean_token_accuracy": 0.14091982021927835, "num_tokens": 4549876.0, "step": 1805 }, { "entropy": 6.900723028182983, "epoch": 0.2088863242931333, "grad_norm": 0.8828125, "learning_rate": 0.0004999009481231719, "loss": 6.872, "mean_token_accuracy": 0.1442640721797943, "num_tokens": 4563638.0, "step": 1810 }, { "entropy": 6.806870174407959, "epoch": 0.20946335833814195, "grad_norm": 0.95703125, "learning_rate": 0.0004998997200565553, "loss": 6.8087, "mean_token_accuracy": 0.14233467727899551, "num_tokens": 4575396.0, "step": 1815 }, { "entropy": 6.781218814849853, "epoch": 0.21004039238315061, "grad_norm": 0.9609375, "learning_rate": 0.0004998984844255483, "loss": 6.8239, "mean_token_accuracy": 0.14259946793317796, "num_tokens": 4587261.0, "step": 1820 }, { "entropy": 6.937310457229614, "epoch": 0.21061742642815925, "grad_norm": 0.83203125, "learning_rate": 0.0004998972412301925, "loss": 6.9373, "mean_token_accuracy": 0.1397809252142906, "num_tokens": 4600086.0, "step": 1825 }, { "entropy": 6.912576341629029, "epoch": 0.21119446047316792, "grad_norm": 0.8984375, "learning_rate": 0.0004998959904705297, "loss": 6.9093, "mean_token_accuracy": 0.1342283457517624, "num_tokens": 4612320.0, "step": 1830 }, { "entropy": 6.850874280929565, "epoch": 0.21177149451817656, "grad_norm": 1.015625, "learning_rate": 0.0004998947321466021, "loss": 6.8522, "mean_token_accuracy": 0.14495468139648438, "num_tokens": 4623545.0, "step": 1835 }, { "entropy": 6.87814154624939, "epoch": 0.21234852856318523, "grad_norm": 1.03125, "learning_rate": 0.0004998934662584518, "loss": 6.7709, "mean_token_accuracy": 0.15582974776625633, "num_tokens": 4637223.0, "step": 1840 }, { "entropy": 6.624226713180542, "epoch": 0.2129255626081939, "grad_norm": 0.99609375, "learning_rate": 0.0004998921928061214, "loss": 6.8385, "mean_token_accuracy": 0.14391470998525618, "num_tokens": 4649748.0, "step": 1845 }, { "entropy": 6.985252904891968, "epoch": 0.21350259665320254, "grad_norm": 0.8359375, "learning_rate": 0.0004998909117896539, "loss": 6.8723, "mean_token_accuracy": 0.14348524510860444, "num_tokens": 4662441.0, "step": 1850 }, { "entropy": 6.706543636322022, "epoch": 0.2140796306982112, "grad_norm": 1.078125, "learning_rate": 0.0004998896232090922, "loss": 6.8359, "mean_token_accuracy": 0.15377265065908433, "num_tokens": 4675546.0, "step": 1855 }, { "entropy": 7.046459770202636, "epoch": 0.21465666474321984, "grad_norm": 0.9375, "learning_rate": 0.0004998883270644798, "loss": 6.9101, "mean_token_accuracy": 0.1373351812362671, "num_tokens": 4687601.0, "step": 1860 }, { "entropy": 6.7164732933044435, "epoch": 0.2152336987882285, "grad_norm": 0.8984375, "learning_rate": 0.0004998870233558602, "loss": 6.7657, "mean_token_accuracy": 0.15242065340280533, "num_tokens": 4699336.0, "step": 1865 }, { "entropy": 6.901521301269531, "epoch": 0.21581073283323715, "grad_norm": 0.85546875, "learning_rate": 0.0004998857120832774, "loss": 6.9738, "mean_token_accuracy": 0.1383403241634369, "num_tokens": 4714312.0, "step": 1870 }, { "entropy": 6.770059871673584, "epoch": 0.21638776687824582, "grad_norm": 0.9609375, "learning_rate": 0.0004998843932467751, "loss": 6.6833, "mean_token_accuracy": 0.15454858019948006, "num_tokens": 4726436.0, "step": 1875 }, { "entropy": 6.858100318908692, "epoch": 0.21696480092325446, "grad_norm": 1.0703125, "learning_rate": 0.0004998830668463982, "loss": 6.9327, "mean_token_accuracy": 0.13296440094709397, "num_tokens": 4739821.0, "step": 1880 }, { "entropy": 6.93988528251648, "epoch": 0.21754183496826313, "grad_norm": 0.93359375, "learning_rate": 0.0004998817328821909, "loss": 6.9047, "mean_token_accuracy": 0.1361124962568283, "num_tokens": 4752701.0, "step": 1885 }, { "entropy": 6.844181823730469, "epoch": 0.2181188690132718, "grad_norm": 0.89453125, "learning_rate": 0.0004998803913541983, "loss": 6.9331, "mean_token_accuracy": 0.1368408054113388, "num_tokens": 4766755.0, "step": 1890 }, { "entropy": 6.866988563537598, "epoch": 0.21869590305828043, "grad_norm": 0.95703125, "learning_rate": 0.0004998790422624654, "loss": 6.8454, "mean_token_accuracy": 0.14372632652521133, "num_tokens": 4780201.0, "step": 1895 }, { "entropy": 6.863262557983399, "epoch": 0.2192729371032891, "grad_norm": 0.9609375, "learning_rate": 0.0004998776856070376, "loss": 6.8284, "mean_token_accuracy": 0.14132185727357865, "num_tokens": 4792488.0, "step": 1900 }, { "entropy": 6.798328876495361, "epoch": 0.21984997114829774, "grad_norm": 0.92578125, "learning_rate": 0.0004998763213879606, "loss": 6.7934, "mean_token_accuracy": 0.14561547935009003, "num_tokens": 4805154.0, "step": 1905 }, { "entropy": 6.830894565582275, "epoch": 0.2204270051933064, "grad_norm": 0.9140625, "learning_rate": 0.0004998749496052803, "loss": 6.852, "mean_token_accuracy": 0.14222206994891168, "num_tokens": 4817947.0, "step": 1910 }, { "entropy": 6.834425973892212, "epoch": 0.22100403923831505, "grad_norm": 0.9921875, "learning_rate": 0.0004998735702590426, "loss": 6.8408, "mean_token_accuracy": 0.14236815497279168, "num_tokens": 4830296.0, "step": 1915 }, { "entropy": 6.832809066772461, "epoch": 0.22158107328332372, "grad_norm": 1.015625, "learning_rate": 0.0004998721833492942, "loss": 6.8318, "mean_token_accuracy": 0.13888390138745307, "num_tokens": 4841210.0, "step": 1920 }, { "entropy": 6.879108953475952, "epoch": 0.22215810732833238, "grad_norm": 1.125, "learning_rate": 0.0004998707888760816, "loss": 6.9203, "mean_token_accuracy": 0.13413121029734612, "num_tokens": 4854406.0, "step": 1925 }, { "entropy": 6.848855876922608, "epoch": 0.22273514137334102, "grad_norm": 0.98046875, "learning_rate": 0.0004998693868394516, "loss": 6.8873, "mean_token_accuracy": 0.1403192825615406, "num_tokens": 4868156.0, "step": 1930 }, { "entropy": 6.837898826599121, "epoch": 0.2233121754183497, "grad_norm": 0.97265625, "learning_rate": 0.0004998679772394516, "loss": 6.814, "mean_token_accuracy": 0.14790826439857482, "num_tokens": 4880314.0, "step": 1935 }, { "entropy": 6.8341789722442625, "epoch": 0.22388920946335833, "grad_norm": 1.0234375, "learning_rate": 0.0004998665600761289, "loss": 6.8263, "mean_token_accuracy": 0.14194524735212327, "num_tokens": 4892652.0, "step": 1940 }, { "entropy": 6.928193855285644, "epoch": 0.224466243508367, "grad_norm": 0.89453125, "learning_rate": 0.000499865135349531, "loss": 6.9246, "mean_token_accuracy": 0.13543495833873748, "num_tokens": 4905791.0, "step": 1945 }, { "entropy": 6.824593591690063, "epoch": 0.22504327755337564, "grad_norm": 0.921875, "learning_rate": 0.0004998637030597061, "loss": 6.8886, "mean_token_accuracy": 0.13973383381962776, "num_tokens": 4917359.0, "step": 1950 }, { "entropy": 6.9390894889831545, "epoch": 0.2256203115983843, "grad_norm": 0.91796875, "learning_rate": 0.0004998622632067022, "loss": 6.8356, "mean_token_accuracy": 0.14431015402078629, "num_tokens": 4928762.0, "step": 1955 }, { "entropy": 6.8002971649169925, "epoch": 0.22619734564339297, "grad_norm": 0.95703125, "learning_rate": 0.0004998608157905678, "loss": 6.8618, "mean_token_accuracy": 0.1413520596921444, "num_tokens": 4940879.0, "step": 1960 }, { "entropy": 6.9403890609741214, "epoch": 0.2267743796884016, "grad_norm": 0.91796875, "learning_rate": 0.0004998593608113515, "loss": 6.8601, "mean_token_accuracy": 0.14300046414136885, "num_tokens": 4952979.0, "step": 1965 }, { "entropy": 6.7911515712738035, "epoch": 0.22735141373341028, "grad_norm": 0.92578125, "learning_rate": 0.0004998578982691024, "loss": 6.7712, "mean_token_accuracy": 0.15122427493333818, "num_tokens": 4965465.0, "step": 1970 }, { "entropy": 6.746047019958496, "epoch": 0.22792844777841892, "grad_norm": 0.93359375, "learning_rate": 0.0004998564281638694, "loss": 6.848, "mean_token_accuracy": 0.14356525242328644, "num_tokens": 4977960.0, "step": 1975 }, { "entropy": 6.9141035079956055, "epoch": 0.2285054818234276, "grad_norm": 0.84375, "learning_rate": 0.0004998549504957023, "loss": 6.8461, "mean_token_accuracy": 0.14194221496582032, "num_tokens": 4990732.0, "step": 1980 }, { "entropy": 6.763252067565918, "epoch": 0.22908251586843623, "grad_norm": 0.95703125, "learning_rate": 0.0004998534652646506, "loss": 6.7825, "mean_token_accuracy": 0.14249248653650284, "num_tokens": 5002482.0, "step": 1985 }, { "entropy": 6.819217205047607, "epoch": 0.2296595499134449, "grad_norm": 0.98046875, "learning_rate": 0.0004998519724707642, "loss": 6.7532, "mean_token_accuracy": 0.14924108535051345, "num_tokens": 5014932.0, "step": 1990 }, { "entropy": 6.760645580291748, "epoch": 0.23023658395845356, "grad_norm": 0.8515625, "learning_rate": 0.0004998504721140934, "loss": 6.8991, "mean_token_accuracy": 0.13749758303165435, "num_tokens": 5027661.0, "step": 1995 }, { "entropy": 6.762338304519654, "epoch": 0.2308136180034622, "grad_norm": 1.0234375, "learning_rate": 0.0004998489641946887, "loss": 6.6503, "mean_token_accuracy": 0.1527012199163437, "num_tokens": 5040657.0, "step": 2000 }, { "entropy": 6.837014961242676, "epoch": 0.23139065204847087, "grad_norm": 0.91015625, "learning_rate": 0.0004998474487126009, "loss": 6.932, "mean_token_accuracy": 0.1339501306414604, "num_tokens": 5054408.0, "step": 2005 }, { "entropy": 6.857686519622803, "epoch": 0.2319676860934795, "grad_norm": 0.984375, "learning_rate": 0.0004998459256678806, "loss": 6.817, "mean_token_accuracy": 0.14147326201200486, "num_tokens": 5065499.0, "step": 2010 }, { "entropy": 6.737187385559082, "epoch": 0.23254472013848818, "grad_norm": 0.92578125, "learning_rate": 0.0004998443950605796, "loss": 6.7662, "mean_token_accuracy": 0.15133574232459068, "num_tokens": 5077009.0, "step": 2015 }, { "entropy": 6.883497905731201, "epoch": 0.23312175418349682, "grad_norm": 0.91796875, "learning_rate": 0.0004998428568907488, "loss": 6.9356, "mean_token_accuracy": 0.1379622347652912, "num_tokens": 5089462.0, "step": 2020 }, { "entropy": 6.845494270324707, "epoch": 0.23369878822850548, "grad_norm": 0.96484375, "learning_rate": 0.0004998413111584403, "loss": 6.849, "mean_token_accuracy": 0.14125331565737725, "num_tokens": 5101816.0, "step": 2025 }, { "entropy": 6.83185510635376, "epoch": 0.23427582227351415, "grad_norm": 0.92578125, "learning_rate": 0.0004998397578637059, "loss": 6.8147, "mean_token_accuracy": 0.13760584592819214, "num_tokens": 5115085.0, "step": 2030 }, { "entropy": 6.816512393951416, "epoch": 0.2348528563185228, "grad_norm": 0.89453125, "learning_rate": 0.000499838197006598, "loss": 6.8383, "mean_token_accuracy": 0.13956220373511313, "num_tokens": 5127705.0, "step": 2035 }, { "entropy": 6.756067323684692, "epoch": 0.23542989036353146, "grad_norm": 0.8515625, "learning_rate": 0.000499836628587169, "loss": 6.8004, "mean_token_accuracy": 0.14978178068995476, "num_tokens": 5140509.0, "step": 2040 }, { "entropy": 6.873353624343872, "epoch": 0.2360069244085401, "grad_norm": 0.9609375, "learning_rate": 0.0004998350526054716, "loss": 6.8414, "mean_token_accuracy": 0.13831417188048362, "num_tokens": 5153538.0, "step": 2045 }, { "entropy": 6.819164085388183, "epoch": 0.23658395845354876, "grad_norm": 1.0546875, "learning_rate": 0.0004998334690615591, "loss": 6.7717, "mean_token_accuracy": 0.14658078253269197, "num_tokens": 5166181.0, "step": 2050 }, { "entropy": 6.798212099075317, "epoch": 0.2371609924985574, "grad_norm": 0.953125, "learning_rate": 0.0004998318779554844, "loss": 6.799, "mean_token_accuracy": 0.14503582268953324, "num_tokens": 5177209.0, "step": 2055 }, { "entropy": 6.752374887466431, "epoch": 0.23773802654356607, "grad_norm": 1.09375, "learning_rate": 0.0004998302792873012, "loss": 6.8182, "mean_token_accuracy": 0.13951095193624496, "num_tokens": 5189786.0, "step": 2060 }, { "entropy": 6.845754146575928, "epoch": 0.23831506058857474, "grad_norm": 0.87890625, "learning_rate": 0.0004998286730570631, "loss": 6.7955, "mean_token_accuracy": 0.14597882628440856, "num_tokens": 5202629.0, "step": 2065 }, { "entropy": 6.795567512512207, "epoch": 0.23889209463358338, "grad_norm": 0.9140625, "learning_rate": 0.0004998270592648245, "loss": 6.8691, "mean_token_accuracy": 0.13765914365649223, "num_tokens": 5215339.0, "step": 2070 }, { "entropy": 6.792061185836792, "epoch": 0.23946912867859205, "grad_norm": 0.8671875, "learning_rate": 0.0004998254379106394, "loss": 6.7339, "mean_token_accuracy": 0.14747889786958696, "num_tokens": 5227666.0, "step": 2075 }, { "entropy": 6.6639073371887205, "epoch": 0.2400461627236007, "grad_norm": 0.9375, "learning_rate": 0.0004998238089945622, "loss": 6.7198, "mean_token_accuracy": 0.14811492711305618, "num_tokens": 5238200.0, "step": 2080 }, { "entropy": 6.769328355789185, "epoch": 0.24062319676860935, "grad_norm": 0.9375, "learning_rate": 0.0004998221725166479, "loss": 6.6725, "mean_token_accuracy": 0.14989647567272185, "num_tokens": 5250023.0, "step": 2085 }, { "entropy": 6.771991300582886, "epoch": 0.241200230813618, "grad_norm": 0.95703125, "learning_rate": 0.0004998205284769516, "loss": 6.8616, "mean_token_accuracy": 0.13556723967194556, "num_tokens": 5262634.0, "step": 2090 }, { "entropy": 6.898429107666016, "epoch": 0.24177726485862666, "grad_norm": 0.93359375, "learning_rate": 0.0004998188768755285, "loss": 6.8602, "mean_token_accuracy": 0.13672183454036713, "num_tokens": 5275739.0, "step": 2095 }, { "entropy": 6.76414852142334, "epoch": 0.2423542989036353, "grad_norm": 0.88671875, "learning_rate": 0.0004998172177124341, "loss": 6.8172, "mean_token_accuracy": 0.14185626655817032, "num_tokens": 5289223.0, "step": 2100 }, { "entropy": 6.843665933609008, "epoch": 0.24293133294864397, "grad_norm": 0.921875, "learning_rate": 0.0004998155509877242, "loss": 6.81, "mean_token_accuracy": 0.1396335631608963, "num_tokens": 5301869.0, "step": 2105 }, { "entropy": 6.808076477050781, "epoch": 0.24350836699365264, "grad_norm": 0.88671875, "learning_rate": 0.000499813876701455, "loss": 6.8278, "mean_token_accuracy": 0.13811877146363258, "num_tokens": 5314999.0, "step": 2110 }, { "entropy": 6.79498610496521, "epoch": 0.24408540103866128, "grad_norm": 0.86328125, "learning_rate": 0.0004998121948536828, "loss": 6.845, "mean_token_accuracy": 0.14215158969163894, "num_tokens": 5328247.0, "step": 2115 }, { "entropy": 6.880921792984009, "epoch": 0.24466243508366994, "grad_norm": 0.92578125, "learning_rate": 0.0004998105054444639, "loss": 6.8275, "mean_token_accuracy": 0.13474374860525132, "num_tokens": 5341054.0, "step": 2120 }, { "entropy": 6.741239166259765, "epoch": 0.24523946912867858, "grad_norm": 0.921875, "learning_rate": 0.0004998088084738555, "loss": 6.8547, "mean_token_accuracy": 0.14400363937020302, "num_tokens": 5353857.0, "step": 2125 }, { "entropy": 6.843392419815063, "epoch": 0.24581650317368725, "grad_norm": 0.98828125, "learning_rate": 0.0004998071039419144, "loss": 6.7824, "mean_token_accuracy": 0.13821006268262864, "num_tokens": 5366072.0, "step": 2130 }, { "entropy": 6.719191312789917, "epoch": 0.2463935372186959, "grad_norm": 0.92578125, "learning_rate": 0.000499805391848698, "loss": 6.7717, "mean_token_accuracy": 0.14614173099398614, "num_tokens": 5379613.0, "step": 2135 }, { "entropy": 6.86360387802124, "epoch": 0.24697057126370456, "grad_norm": 0.90625, "learning_rate": 0.000499803672194264, "loss": 6.811, "mean_token_accuracy": 0.14077582731842994, "num_tokens": 5392394.0, "step": 2140 }, { "entropy": 6.659087896347046, "epoch": 0.24754760530871323, "grad_norm": 0.953125, "learning_rate": 0.0004998019449786701, "loss": 6.7942, "mean_token_accuracy": 0.14860865324735642, "num_tokens": 5404127.0, "step": 2145 }, { "entropy": 6.989247369766235, "epoch": 0.24812463935372187, "grad_norm": 0.875, "learning_rate": 0.0004998002102019744, "loss": 6.8993, "mean_token_accuracy": 0.13390290439128877, "num_tokens": 5417317.0, "step": 2150 }, { "entropy": 6.728624773025513, "epoch": 0.24870167339873053, "grad_norm": 0.91015625, "learning_rate": 0.0004997984678642354, "loss": 6.7489, "mean_token_accuracy": 0.14663361757993698, "num_tokens": 5429991.0, "step": 2155 }, { "entropy": 6.749109506607056, "epoch": 0.24927870744373917, "grad_norm": 0.91015625, "learning_rate": 0.0004997967179655115, "loss": 6.786, "mean_token_accuracy": 0.1380963869392872, "num_tokens": 5442661.0, "step": 2160 }, { "entropy": 6.798228549957275, "epoch": 0.24985574148874784, "grad_norm": 1.0703125, "learning_rate": 0.0004997949605058617, "loss": 6.8134, "mean_token_accuracy": 0.14670575857162477, "num_tokens": 5455876.0, "step": 2165 }, { "entropy": 6.707323455810547, "epoch": 0.2504327755337565, "grad_norm": 0.9140625, "learning_rate": 0.0004997931954853451, "loss": 6.7693, "mean_token_accuracy": 0.14578518271446228, "num_tokens": 5468151.0, "step": 2170 }, { "entropy": 6.745931768417359, "epoch": 0.2510098095787651, "grad_norm": 0.96484375, "learning_rate": 0.000499791422904021, "loss": 6.8043, "mean_token_accuracy": 0.15150473788380622, "num_tokens": 5481327.0, "step": 2175 }, { "entropy": 6.735119152069092, "epoch": 0.2515868436237738, "grad_norm": 0.9140625, "learning_rate": 0.0004997896427619491, "loss": 6.7461, "mean_token_accuracy": 0.1452285200357437, "num_tokens": 5493794.0, "step": 2180 }, { "entropy": 6.7988443851470945, "epoch": 0.25216387766878245, "grad_norm": 0.92578125, "learning_rate": 0.0004997878550591892, "loss": 6.7754, "mean_token_accuracy": 0.1396859109401703, "num_tokens": 5506831.0, "step": 2185 }, { "entropy": 6.80522894859314, "epoch": 0.2527409117137911, "grad_norm": 1.578125, "learning_rate": 0.0004997860597958013, "loss": 6.6666, "mean_token_accuracy": 0.1507306069135666, "num_tokens": 5518988.0, "step": 2190 }, { "entropy": 6.527280187606811, "epoch": 0.2533179457587998, "grad_norm": 1.4375, "learning_rate": 0.0004997842569718461, "loss": 6.6262, "mean_token_accuracy": 0.14936918169260024, "num_tokens": 5530757.0, "step": 2195 }, { "entropy": 6.788536119461059, "epoch": 0.25389497980380843, "grad_norm": 0.95703125, "learning_rate": 0.000499782446587384, "loss": 6.7494, "mean_token_accuracy": 0.14626611173152923, "num_tokens": 5542819.0, "step": 2200 }, { "entropy": 6.713362503051758, "epoch": 0.25447201384881707, "grad_norm": 1.203125, "learning_rate": 0.000499780628642476, "loss": 6.7897, "mean_token_accuracy": 0.14051934331655502, "num_tokens": 5555797.0, "step": 2205 }, { "entropy": 6.766080236434936, "epoch": 0.2550490478938257, "grad_norm": 1.0234375, "learning_rate": 0.0004997788031371834, "loss": 6.8895, "mean_token_accuracy": 0.13041166514158248, "num_tokens": 5570086.0, "step": 2210 }, { "entropy": 6.788276147842407, "epoch": 0.2556260819388344, "grad_norm": 0.96875, "learning_rate": 0.0004997769700715672, "loss": 6.6845, "mean_token_accuracy": 0.1493205651640892, "num_tokens": 5582182.0, "step": 2215 }, { "entropy": 6.735091209411621, "epoch": 0.25620311598384304, "grad_norm": 0.921875, "learning_rate": 0.0004997751294456892, "loss": 6.7832, "mean_token_accuracy": 0.14482725113630296, "num_tokens": 5595395.0, "step": 2220 }, { "entropy": 6.795186614990234, "epoch": 0.2567801500288517, "grad_norm": 0.83984375, "learning_rate": 0.0004997732812596114, "loss": 6.7803, "mean_token_accuracy": 0.14214650616049768, "num_tokens": 5608555.0, "step": 2225 }, { "entropy": 6.733956241607666, "epoch": 0.2573571840738604, "grad_norm": 0.9375, "learning_rate": 0.0004997714255133961, "loss": 6.753, "mean_token_accuracy": 0.1399676337838173, "num_tokens": 5620933.0, "step": 2230 }, { "entropy": 6.807656335830688, "epoch": 0.257934218118869, "grad_norm": 0.9375, "learning_rate": 0.0004997695622071054, "loss": 6.7964, "mean_token_accuracy": 0.14257583171129226, "num_tokens": 5634061.0, "step": 2235 }, { "entropy": 6.763797903060913, "epoch": 0.25851125216387766, "grad_norm": 0.97265625, "learning_rate": 0.0004997676913408021, "loss": 6.7431, "mean_token_accuracy": 0.14566465988755226, "num_tokens": 5646617.0, "step": 2240 }, { "entropy": 6.783767938613892, "epoch": 0.2590882862088863, "grad_norm": 0.9296875, "learning_rate": 0.0004997658129145493, "loss": 6.8348, "mean_token_accuracy": 0.13886496499180795, "num_tokens": 5659361.0, "step": 2245 }, { "entropy": 6.7600174903869625, "epoch": 0.259665320253895, "grad_norm": 1.078125, "learning_rate": 0.0004997639269284099, "loss": 6.6769, "mean_token_accuracy": 0.1541120558977127, "num_tokens": 5670591.0, "step": 2250 }, { "entropy": 6.7302642345428465, "epoch": 0.26024235429890363, "grad_norm": 1.03125, "learning_rate": 0.0004997620333824476, "loss": 6.7974, "mean_token_accuracy": 0.1425503261387348, "num_tokens": 5683211.0, "step": 2255 }, { "entropy": 6.790132999420166, "epoch": 0.2608193883439123, "grad_norm": 0.9609375, "learning_rate": 0.0004997601322767258, "loss": 6.7847, "mean_token_accuracy": 0.14356143027544022, "num_tokens": 5695654.0, "step": 2260 }, { "entropy": 6.707987117767334, "epoch": 0.26139642238892097, "grad_norm": 0.984375, "learning_rate": 0.0004997582236113087, "loss": 6.6929, "mean_token_accuracy": 0.14759473353624344, "num_tokens": 5707776.0, "step": 2265 }, { "entropy": 6.729296684265137, "epoch": 0.2619734564339296, "grad_norm": 0.90234375, "learning_rate": 0.0004997563073862603, "loss": 6.7372, "mean_token_accuracy": 0.1442895159125328, "num_tokens": 5719895.0, "step": 2270 }, { "entropy": 6.8028727054595945, "epoch": 0.26255049047893825, "grad_norm": 0.99609375, "learning_rate": 0.0004997543836016453, "loss": 6.7501, "mean_token_accuracy": 0.15161172673106194, "num_tokens": 5733280.0, "step": 2275 }, { "entropy": 6.734392881393433, "epoch": 0.2631275245239469, "grad_norm": 0.97265625, "learning_rate": 0.0004997524522575281, "loss": 6.7993, "mean_token_accuracy": 0.14286206290125847, "num_tokens": 5746563.0, "step": 2280 }, { "entropy": 6.888967847824096, "epoch": 0.2637045585689556, "grad_norm": 1.0234375, "learning_rate": 0.0004997505133539738, "loss": 6.8586, "mean_token_accuracy": 0.13801560774445534, "num_tokens": 5760735.0, "step": 2285 }, { "entropy": 6.7270537376403805, "epoch": 0.2642815926139642, "grad_norm": 0.90234375, "learning_rate": 0.0004997485668910476, "loss": 6.7564, "mean_token_accuracy": 0.13578541129827498, "num_tokens": 5774304.0, "step": 2290 }, { "entropy": 6.6204423904418945, "epoch": 0.26485862665897286, "grad_norm": 0.9140625, "learning_rate": 0.0004997466128688151, "loss": 6.6497, "mean_token_accuracy": 0.15090691298246384, "num_tokens": 5786045.0, "step": 2295 }, { "entropy": 6.754159736633301, "epoch": 0.26543566070398156, "grad_norm": 0.984375, "learning_rate": 0.000499744651287342, "loss": 6.7144, "mean_token_accuracy": 0.1462336763739586, "num_tokens": 5798126.0, "step": 2300 }, { "entropy": 6.746666812896729, "epoch": 0.2660126947489902, "grad_norm": 0.890625, "learning_rate": 0.000499742682146694, "loss": 6.7266, "mean_token_accuracy": 0.15180645808577536, "num_tokens": 5809778.0, "step": 2305 }, { "entropy": 6.795130205154419, "epoch": 0.26658972879399884, "grad_norm": 0.87109375, "learning_rate": 0.0004997407054469377, "loss": 6.8156, "mean_token_accuracy": 0.14033974930644036, "num_tokens": 5821902.0, "step": 2310 }, { "entropy": 6.782390499114991, "epoch": 0.2671667628390075, "grad_norm": 0.88671875, "learning_rate": 0.0004997387211881392, "loss": 6.7574, "mean_token_accuracy": 0.1411186173558235, "num_tokens": 5835162.0, "step": 2315 }, { "entropy": 6.764913749694824, "epoch": 0.26774379688401617, "grad_norm": 1.28125, "learning_rate": 0.0004997367293703656, "loss": 6.7446, "mean_token_accuracy": 0.1470859795808792, "num_tokens": 5847708.0, "step": 2320 }, { "entropy": 6.743312931060791, "epoch": 0.2683208309290248, "grad_norm": 0.9296875, "learning_rate": 0.0004997347299936837, "loss": 6.7407, "mean_token_accuracy": 0.14818446189165116, "num_tokens": 5860983.0, "step": 2325 }, { "entropy": 6.69023756980896, "epoch": 0.26889786497403345, "grad_norm": 1.03125, "learning_rate": 0.0004997327230581608, "loss": 6.7176, "mean_token_accuracy": 0.1412323720753193, "num_tokens": 5873878.0, "step": 2330 }, { "entropy": 6.642313623428345, "epoch": 0.26947489901904215, "grad_norm": 0.8984375, "learning_rate": 0.0004997307085638644, "loss": 6.7315, "mean_token_accuracy": 0.14647015184164047, "num_tokens": 5886577.0, "step": 2335 }, { "entropy": 6.8489755153656, "epoch": 0.2700519330640508, "grad_norm": 1.2109375, "learning_rate": 0.0004997286865108621, "loss": 6.7482, "mean_token_accuracy": 0.13658007383346557, "num_tokens": 5900373.0, "step": 2340 }, { "entropy": 6.667910242080689, "epoch": 0.2706289671090594, "grad_norm": 1.015625, "learning_rate": 0.0004997266568992222, "loss": 6.7465, "mean_token_accuracy": 0.14726608991622925, "num_tokens": 5913038.0, "step": 2345 }, { "entropy": 6.69633846282959, "epoch": 0.27120600115406807, "grad_norm": 1.0859375, "learning_rate": 0.0004997246197290128, "loss": 6.6931, "mean_token_accuracy": 0.14734635949134828, "num_tokens": 5926096.0, "step": 2350 }, { "entropy": 6.720061302185059, "epoch": 0.27178303519907676, "grad_norm": 0.9140625, "learning_rate": 0.0004997225750003024, "loss": 6.7071, "mean_token_accuracy": 0.1467483162879944, "num_tokens": 5937992.0, "step": 2355 }, { "entropy": 6.702146768569946, "epoch": 0.2723600692440854, "grad_norm": 0.98828125, "learning_rate": 0.0004997205227131599, "loss": 6.7227, "mean_token_accuracy": 0.15519675761461257, "num_tokens": 5949685.0, "step": 2360 }, { "entropy": 6.744102334976196, "epoch": 0.27293710328909404, "grad_norm": 1.0, "learning_rate": 0.0004997184628676542, "loss": 6.7951, "mean_token_accuracy": 0.14176806733012198, "num_tokens": 5962751.0, "step": 2365 }, { "entropy": 6.628593158721924, "epoch": 0.27351413733410274, "grad_norm": 1.453125, "learning_rate": 0.0004997163954638546, "loss": 6.5808, "mean_token_accuracy": 0.15153488963842393, "num_tokens": 5976043.0, "step": 2370 }, { "entropy": 6.740905237197876, "epoch": 0.2740911713791114, "grad_norm": 1.0078125, "learning_rate": 0.0004997143205018306, "loss": 6.7368, "mean_token_accuracy": 0.1438068449497223, "num_tokens": 5988146.0, "step": 2375 }, { "entropy": 6.690333318710327, "epoch": 0.27466820542412, "grad_norm": 0.98828125, "learning_rate": 0.0004997122379816523, "loss": 6.6951, "mean_token_accuracy": 0.14996936321258544, "num_tokens": 6000542.0, "step": 2380 }, { "entropy": 6.7154529094696045, "epoch": 0.27524523946912866, "grad_norm": 0.88671875, "learning_rate": 0.0004997101479033893, "loss": 6.7366, "mean_token_accuracy": 0.1433037906885147, "num_tokens": 6013574.0, "step": 2385 }, { "entropy": 6.607508945465088, "epoch": 0.27582227351413735, "grad_norm": 0.93359375, "learning_rate": 0.0004997080502671122, "loss": 6.6318, "mean_token_accuracy": 0.14444206804037094, "num_tokens": 6025391.0, "step": 2390 }, { "entropy": 6.780825185775757, "epoch": 0.276399307559146, "grad_norm": 0.9375, "learning_rate": 0.0004997059450728913, "loss": 6.7493, "mean_token_accuracy": 0.1451184406876564, "num_tokens": 6036595.0, "step": 2395 }, { "entropy": 6.7437080383300785, "epoch": 0.27697634160415463, "grad_norm": 0.94921875, "learning_rate": 0.0004997038323207977, "loss": 6.8453, "mean_token_accuracy": 0.13703761547803878, "num_tokens": 6048852.0, "step": 2400 }, { "entropy": 6.73164849281311, "epoch": 0.2775533756491633, "grad_norm": 0.921875, "learning_rate": 0.0004997017120109022, "loss": 6.698, "mean_token_accuracy": 0.15447451919317245, "num_tokens": 6061694.0, "step": 2405 }, { "entropy": 6.718098258972168, "epoch": 0.27813040969417197, "grad_norm": 0.921875, "learning_rate": 0.0004996995841432762, "loss": 6.7536, "mean_token_accuracy": 0.14859242737293243, "num_tokens": 6074244.0, "step": 2410 }, { "entropy": 6.787304067611695, "epoch": 0.2787074437391806, "grad_norm": 0.9375, "learning_rate": 0.0004996974487179915, "loss": 6.7248, "mean_token_accuracy": 0.14635652750730516, "num_tokens": 6085550.0, "step": 2415 }, { "entropy": 6.705214929580689, "epoch": 0.27928447778418924, "grad_norm": 0.9765625, "learning_rate": 0.0004996953057351195, "loss": 6.774, "mean_token_accuracy": 0.14355605840682983, "num_tokens": 6096749.0, "step": 2420 }, { "entropy": 6.769416809082031, "epoch": 0.27986151182919794, "grad_norm": 0.9375, "learning_rate": 0.0004996931551947327, "loss": 6.6649, "mean_token_accuracy": 0.1461700275540352, "num_tokens": 6109490.0, "step": 2425 }, { "entropy": 6.711434459686279, "epoch": 0.2804385458742066, "grad_norm": 1.1953125, "learning_rate": 0.0004996909970969031, "loss": 6.8486, "mean_token_accuracy": 0.13653022199869155, "num_tokens": 6122656.0, "step": 2430 }, { "entropy": 6.859713554382324, "epoch": 0.2810155799192152, "grad_norm": 0.99609375, "learning_rate": 0.0004996888314417034, "loss": 6.724, "mean_token_accuracy": 0.1444801300764084, "num_tokens": 6135461.0, "step": 2435 }, { "entropy": 6.648364114761352, "epoch": 0.2815926139642239, "grad_norm": 0.9765625, "learning_rate": 0.0004996866582292067, "loss": 6.7647, "mean_token_accuracy": 0.14585992693901062, "num_tokens": 6147698.0, "step": 2440 }, { "entropy": 6.834606456756592, "epoch": 0.28216964800923255, "grad_norm": 0.93359375, "learning_rate": 0.0004996844774594856, "loss": 6.7349, "mean_token_accuracy": 0.1469629168510437, "num_tokens": 6160456.0, "step": 2445 }, { "entropy": 6.665376234054565, "epoch": 0.2827466820542412, "grad_norm": 0.9765625, "learning_rate": 0.0004996822891326138, "loss": 6.7258, "mean_token_accuracy": 0.14537576138973235, "num_tokens": 6173606.0, "step": 2450 }, { "entropy": 6.720003461837768, "epoch": 0.28332371609924983, "grad_norm": 0.90234375, "learning_rate": 0.0004996800932486648, "loss": 6.7506, "mean_token_accuracy": 0.14402114003896713, "num_tokens": 6185355.0, "step": 2455 }, { "entropy": 6.787649822235108, "epoch": 0.28390075014425853, "grad_norm": 0.875, "learning_rate": 0.0004996778898077126, "loss": 6.7692, "mean_token_accuracy": 0.14147617369890214, "num_tokens": 6198154.0, "step": 2460 }, { "entropy": 6.731502485275269, "epoch": 0.28447778418926717, "grad_norm": 1.0703125, "learning_rate": 0.0004996756788098309, "loss": 6.6544, "mean_token_accuracy": 0.1494407206773758, "num_tokens": 6209901.0, "step": 2465 }, { "entropy": 6.673964262008667, "epoch": 0.2850548182342758, "grad_norm": 0.93359375, "learning_rate": 0.0004996734602550945, "loss": 6.7203, "mean_token_accuracy": 0.14480748698115348, "num_tokens": 6222052.0, "step": 2470 }, { "entropy": 6.75030665397644, "epoch": 0.2856318522792845, "grad_norm": 0.90234375, "learning_rate": 0.0004996712341435779, "loss": 6.7232, "mean_token_accuracy": 0.15031242072582246, "num_tokens": 6235112.0, "step": 2475 }, { "entropy": 6.732296323776245, "epoch": 0.28620888632429314, "grad_norm": 1.03125, "learning_rate": 0.0004996690004753559, "loss": 6.7491, "mean_token_accuracy": 0.14172388911247252, "num_tokens": 6248225.0, "step": 2480 }, { "entropy": 6.760669803619384, "epoch": 0.2867859203693018, "grad_norm": 1.046875, "learning_rate": 0.0004996667592505037, "loss": 6.7068, "mean_token_accuracy": 0.14936083406209946, "num_tokens": 6259518.0, "step": 2485 }, { "entropy": 6.649824762344361, "epoch": 0.2873629544143104, "grad_norm": 0.91796875, "learning_rate": 0.0004996645104690967, "loss": 6.7054, "mean_token_accuracy": 0.13711516559123993, "num_tokens": 6271832.0, "step": 2490 }, { "entropy": 6.7701342582702635, "epoch": 0.2879399884593191, "grad_norm": 1.0234375, "learning_rate": 0.0004996622541312103, "loss": 6.7534, "mean_token_accuracy": 0.14304690212011337, "num_tokens": 6284328.0, "step": 2495 }, { "entropy": 6.720312309265137, "epoch": 0.28851702250432776, "grad_norm": 1.0, "learning_rate": 0.0004996599902369207, "loss": 6.6935, "mean_token_accuracy": 0.14403096809983254, "num_tokens": 6296100.0, "step": 2500 }, { "entropy": 6.617523860931397, "epoch": 0.2890940565493364, "grad_norm": 0.90234375, "learning_rate": 0.0004996577187863039, "loss": 6.6476, "mean_token_accuracy": 0.15421121418476105, "num_tokens": 6308262.0, "step": 2505 }, { "entropy": 6.748142957687378, "epoch": 0.2896710905943451, "grad_norm": 0.84765625, "learning_rate": 0.0004996554397794364, "loss": 6.7182, "mean_token_accuracy": 0.13827703297138214, "num_tokens": 6319953.0, "step": 2510 }, { "entropy": 6.702780914306641, "epoch": 0.29024812463935373, "grad_norm": 0.9140625, "learning_rate": 0.0004996531532163947, "loss": 6.6568, "mean_token_accuracy": 0.14931394010782242, "num_tokens": 6332953.0, "step": 2515 }, { "entropy": 6.671044635772705, "epoch": 0.2908251586843624, "grad_norm": 0.890625, "learning_rate": 0.0004996508590972558, "loss": 6.7213, "mean_token_accuracy": 0.1474708914756775, "num_tokens": 6345692.0, "step": 2520 }, { "entropy": 6.7257524013519285, "epoch": 0.291402192729371, "grad_norm": 1.1171875, "learning_rate": 0.0004996485574220969, "loss": 6.696, "mean_token_accuracy": 0.1451795779168606, "num_tokens": 6358058.0, "step": 2525 }, { "entropy": 6.783554315567017, "epoch": 0.2919792267743797, "grad_norm": 0.9921875, "learning_rate": 0.0004996462481909953, "loss": 6.7313, "mean_token_accuracy": 0.14846932888031006, "num_tokens": 6370469.0, "step": 2530 }, { "entropy": 6.787226629257202, "epoch": 0.29255626081938835, "grad_norm": 1.015625, "learning_rate": 0.0004996439314040287, "loss": 6.7985, "mean_token_accuracy": 0.1353658489882946, "num_tokens": 6384333.0, "step": 2535 }, { "entropy": 6.7711738586425785, "epoch": 0.293133294864397, "grad_norm": 0.89453125, "learning_rate": 0.000499641607061275, "loss": 6.7377, "mean_token_accuracy": 0.14200848788022996, "num_tokens": 6397688.0, "step": 2540 }, { "entropy": 6.706867218017578, "epoch": 0.2937103289094057, "grad_norm": 0.875, "learning_rate": 0.0004996392751628126, "loss": 6.699, "mean_token_accuracy": 0.14663641303777694, "num_tokens": 6410188.0, "step": 2545 }, { "entropy": 6.719365406036377, "epoch": 0.2942873629544143, "grad_norm": 0.97265625, "learning_rate": 0.0004996369357087196, "loss": 6.7169, "mean_token_accuracy": 0.14374764263629913, "num_tokens": 6423313.0, "step": 2550 }, { "entropy": 6.764793729782104, "epoch": 0.29486439699942296, "grad_norm": 0.90234375, "learning_rate": 0.000499634588699075, "loss": 6.7386, "mean_token_accuracy": 0.1467905879020691, "num_tokens": 6435853.0, "step": 2555 }, { "entropy": 6.598630714416504, "epoch": 0.2954414310444316, "grad_norm": 0.92578125, "learning_rate": 0.0004996322341339575, "loss": 6.6725, "mean_token_accuracy": 0.14465839564800262, "num_tokens": 6448659.0, "step": 2560 }, { "entropy": 6.732291269302368, "epoch": 0.2960184650894403, "grad_norm": 1.0, "learning_rate": 0.0004996298720134465, "loss": 6.7292, "mean_token_accuracy": 0.14818664789199829, "num_tokens": 6460534.0, "step": 2565 }, { "entropy": 6.716020393371582, "epoch": 0.29659549913444894, "grad_norm": 0.96484375, "learning_rate": 0.0004996275023376213, "loss": 6.6971, "mean_token_accuracy": 0.14435341879725455, "num_tokens": 6472368.0, "step": 2570 }, { "entropy": 6.693843650817871, "epoch": 0.2971725331794576, "grad_norm": 1.078125, "learning_rate": 0.0004996251251065615, "loss": 6.7075, "mean_token_accuracy": 0.14448096752166747, "num_tokens": 6485430.0, "step": 2575 }, { "entropy": 6.710673141479492, "epoch": 0.2977495672244662, "grad_norm": 0.93359375, "learning_rate": 0.0004996227403203473, "loss": 6.6891, "mean_token_accuracy": 0.1485920026898384, "num_tokens": 6497303.0, "step": 2580 }, { "entropy": 6.699700403213501, "epoch": 0.2983266012694749, "grad_norm": 0.9921875, "learning_rate": 0.0004996203479790589, "loss": 6.7567, "mean_token_accuracy": 0.15133860260248183, "num_tokens": 6510154.0, "step": 2585 }, { "entropy": 6.790226650238037, "epoch": 0.29890363531448355, "grad_norm": 0.86328125, "learning_rate": 0.0004996179480827764, "loss": 6.7413, "mean_token_accuracy": 0.143829607963562, "num_tokens": 6523091.0, "step": 2590 }, { "entropy": 6.75448055267334, "epoch": 0.2994806693594922, "grad_norm": 1.28125, "learning_rate": 0.000499615540631581, "loss": 6.6531, "mean_token_accuracy": 0.14935905635356903, "num_tokens": 6536043.0, "step": 2595 }, { "entropy": 6.624383497238159, "epoch": 0.3000577034045009, "grad_norm": 0.99609375, "learning_rate": 0.0004996131256255534, "loss": 6.6653, "mean_token_accuracy": 0.14822530150413513, "num_tokens": 6548227.0, "step": 2600 }, { "entropy": 6.759153127670288, "epoch": 0.3006347374495095, "grad_norm": 0.98828125, "learning_rate": 0.0004996107030647749, "loss": 6.7117, "mean_token_accuracy": 0.14047631323337556, "num_tokens": 6560204.0, "step": 2605 }, { "entropy": 6.684758043289184, "epoch": 0.30121177149451817, "grad_norm": 1.4765625, "learning_rate": 0.0004996082729493269, "loss": 6.726, "mean_token_accuracy": 0.150347737967968, "num_tokens": 6573235.0, "step": 2610 }, { "entropy": 6.650673818588257, "epoch": 0.3017888055395268, "grad_norm": 0.94140625, "learning_rate": 0.0004996058352792913, "loss": 6.7416, "mean_token_accuracy": 0.14433368742465974, "num_tokens": 6585118.0, "step": 2615 }, { "entropy": 6.750360155105591, "epoch": 0.3023658395845355, "grad_norm": 1.0390625, "learning_rate": 0.00049960339005475, "loss": 6.6339, "mean_token_accuracy": 0.14643110930919648, "num_tokens": 6596690.0, "step": 2620 }, { "entropy": 6.660681819915771, "epoch": 0.30294287362954414, "grad_norm": 1.0234375, "learning_rate": 0.0004996009372757852, "loss": 6.6344, "mean_token_accuracy": 0.15728502422571183, "num_tokens": 6609076.0, "step": 2625 }, { "entropy": 6.662906169891357, "epoch": 0.3035199076745528, "grad_norm": 0.9375, "learning_rate": 0.0004995984769424795, "loss": 6.7326, "mean_token_accuracy": 0.14466301277279853, "num_tokens": 6621352.0, "step": 2630 }, { "entropy": 6.752713441848755, "epoch": 0.3040969417195615, "grad_norm": 1.5859375, "learning_rate": 0.0004995960090549155, "loss": 6.6363, "mean_token_accuracy": 0.1454766198992729, "num_tokens": 6633924.0, "step": 2635 }, { "entropy": 6.702887296676636, "epoch": 0.3046739757645701, "grad_norm": 0.96484375, "learning_rate": 0.0004995935336131764, "loss": 6.7607, "mean_token_accuracy": 0.14415173679590226, "num_tokens": 6646490.0, "step": 2640 }, { "entropy": 6.83890929222107, "epoch": 0.30525100980957875, "grad_norm": 0.99609375, "learning_rate": 0.0004995910506173452, "loss": 6.7272, "mean_token_accuracy": 0.14090896472334863, "num_tokens": 6660171.0, "step": 2645 }, { "entropy": 6.609751653671265, "epoch": 0.3058280438545874, "grad_norm": 0.9609375, "learning_rate": 0.0004995885600675059, "loss": 6.7572, "mean_token_accuracy": 0.14278358295559884, "num_tokens": 6673505.0, "step": 2650 }, { "entropy": 6.783524751663208, "epoch": 0.3064050778995961, "grad_norm": 0.88671875, "learning_rate": 0.0004995860619637415, "loss": 6.7358, "mean_token_accuracy": 0.14450631141662598, "num_tokens": 6685798.0, "step": 2655 }, { "entropy": 6.639528703689575, "epoch": 0.30698211194460473, "grad_norm": 1.2578125, "learning_rate": 0.0004995835563061367, "loss": 6.5888, "mean_token_accuracy": 0.14924851357936858, "num_tokens": 6699254.0, "step": 2660 }, { "entropy": 6.685869789123535, "epoch": 0.30755914598961337, "grad_norm": 0.95703125, "learning_rate": 0.0004995810430947756, "loss": 6.6506, "mean_token_accuracy": 0.14859471917152406, "num_tokens": 6711088.0, "step": 2665 }, { "entropy": 6.700608539581299, "epoch": 0.30813618003462206, "grad_norm": 0.93359375, "learning_rate": 0.0004995785223297426, "loss": 6.7159, "mean_token_accuracy": 0.14112428277730943, "num_tokens": 6723373.0, "step": 2670 }, { "entropy": 6.637734365463257, "epoch": 0.3087132140796307, "grad_norm": 0.84765625, "learning_rate": 0.0004995759940111225, "loss": 6.7234, "mean_token_accuracy": 0.14265928864479066, "num_tokens": 6737984.0, "step": 2675 }, { "entropy": 6.751663398742676, "epoch": 0.30929024812463934, "grad_norm": 0.91796875, "learning_rate": 0.0004995734581390005, "loss": 6.6699, "mean_token_accuracy": 0.14623800665140152, "num_tokens": 6751283.0, "step": 2680 }, { "entropy": 6.637785387039185, "epoch": 0.309867282169648, "grad_norm": 0.91796875, "learning_rate": 0.0004995709147134617, "loss": 6.6511, "mean_token_accuracy": 0.1425285041332245, "num_tokens": 6765012.0, "step": 2685 }, { "entropy": 6.657239103317261, "epoch": 0.3104443162146567, "grad_norm": 0.9765625, "learning_rate": 0.0004995683637345919, "loss": 6.6944, "mean_token_accuracy": 0.14595674276351928, "num_tokens": 6777708.0, "step": 2690 }, { "entropy": 6.682321071624756, "epoch": 0.3110213502596653, "grad_norm": 0.9375, "learning_rate": 0.0004995658052024765, "loss": 6.6153, "mean_token_accuracy": 0.15794552862644196, "num_tokens": 6791325.0, "step": 2695 }, { "entropy": 6.583492231369019, "epoch": 0.31159838430467396, "grad_norm": 0.9140625, "learning_rate": 0.0004995632391172019, "loss": 6.7509, "mean_token_accuracy": 0.1372663803398609, "num_tokens": 6805659.0, "step": 2700 }, { "entropy": 6.76855502128601, "epoch": 0.31217541834968265, "grad_norm": 0.97265625, "learning_rate": 0.0004995606654788543, "loss": 6.6591, "mean_token_accuracy": 0.1441938564181328, "num_tokens": 6818110.0, "step": 2705 }, { "entropy": 6.640047025680542, "epoch": 0.3127524523946913, "grad_norm": 0.921875, "learning_rate": 0.0004995580842875202, "loss": 6.6691, "mean_token_accuracy": 0.14442232996225357, "num_tokens": 6830959.0, "step": 2710 }, { "entropy": 6.750000095367431, "epoch": 0.31332948643969993, "grad_norm": 0.95703125, "learning_rate": 0.0004995554955432866, "loss": 6.7234, "mean_token_accuracy": 0.14586163461208343, "num_tokens": 6843318.0, "step": 2715 }, { "entropy": 6.675041437149048, "epoch": 0.3139065204847086, "grad_norm": 1.0234375, "learning_rate": 0.0004995528992462404, "loss": 6.634, "mean_token_accuracy": 0.14719301089644432, "num_tokens": 6855154.0, "step": 2720 }, { "entropy": 6.5928421974182125, "epoch": 0.31448355452971727, "grad_norm": 0.92578125, "learning_rate": 0.000499550295396469, "loss": 6.685, "mean_token_accuracy": 0.14665439277887343, "num_tokens": 6867428.0, "step": 2725 }, { "entropy": 6.754723072052002, "epoch": 0.3150605885747259, "grad_norm": 0.87890625, "learning_rate": 0.0004995476839940598, "loss": 6.671, "mean_token_accuracy": 0.15316719859838485, "num_tokens": 6879989.0, "step": 2730 }, { "entropy": 6.6928040981292725, "epoch": 0.31563762261973455, "grad_norm": 0.9453125, "learning_rate": 0.000499545065039101, "loss": 6.6906, "mean_token_accuracy": 0.14096458703279496, "num_tokens": 6893179.0, "step": 2735 }, { "entropy": 6.727335596084595, "epoch": 0.31621465666474324, "grad_norm": 0.984375, "learning_rate": 0.0004995424385316803, "loss": 6.6782, "mean_token_accuracy": 0.14420599341392518, "num_tokens": 6905647.0, "step": 2740 }, { "entropy": 6.610552978515625, "epoch": 0.3167916907097519, "grad_norm": 0.93359375, "learning_rate": 0.0004995398044718863, "loss": 6.6364, "mean_token_accuracy": 0.15449649840593338, "num_tokens": 6917361.0, "step": 2745 }, { "entropy": 6.71636061668396, "epoch": 0.3173687247547605, "grad_norm": 1.03125, "learning_rate": 0.0004995371628598074, "loss": 6.6653, "mean_token_accuracy": 0.1424078017473221, "num_tokens": 6929515.0, "step": 2750 }, { "entropy": 6.707604217529297, "epoch": 0.31794575879976916, "grad_norm": 0.88671875, "learning_rate": 0.0004995345136955328, "loss": 6.6391, "mean_token_accuracy": 0.14832933098077775, "num_tokens": 6942265.0, "step": 2755 }, { "entropy": 6.584933423995972, "epoch": 0.31852279284477786, "grad_norm": 0.9375, "learning_rate": 0.0004995318569791512, "loss": 6.687, "mean_token_accuracy": 0.14602783024311067, "num_tokens": 6955151.0, "step": 2760 }, { "entropy": 6.765100526809692, "epoch": 0.3190998268897865, "grad_norm": 1.03125, "learning_rate": 0.0004995291927107522, "loss": 6.6589, "mean_token_accuracy": 0.14955082535743713, "num_tokens": 6968378.0, "step": 2765 }, { "entropy": 6.605684900283814, "epoch": 0.31967686093479514, "grad_norm": 1.1484375, "learning_rate": 0.0004995265208904252, "loss": 6.6685, "mean_token_accuracy": 0.1471999056637287, "num_tokens": 6980083.0, "step": 2770 }, { "entropy": 6.687409925460815, "epoch": 0.32025389497980383, "grad_norm": 0.98046875, "learning_rate": 0.0004995238415182603, "loss": 6.6717, "mean_token_accuracy": 0.14363027215003968, "num_tokens": 6992981.0, "step": 2775 }, { "entropy": 6.824726104736328, "epoch": 0.3208309290248125, "grad_norm": 0.953125, "learning_rate": 0.0004995211545943476, "loss": 6.6822, "mean_token_accuracy": 0.14623156040906907, "num_tokens": 7006115.0, "step": 2780 }, { "entropy": 6.589347887039184, "epoch": 0.3214079630698211, "grad_norm": 0.98046875, "learning_rate": 0.0004995184601187772, "loss": 6.6416, "mean_token_accuracy": 0.15562028288841248, "num_tokens": 7019176.0, "step": 2785 }, { "entropy": 6.55873851776123, "epoch": 0.32198499711482975, "grad_norm": 0.98046875, "learning_rate": 0.00049951575809164, "loss": 6.5673, "mean_token_accuracy": 0.15908343940973282, "num_tokens": 7031214.0, "step": 2790 }, { "entropy": 6.615464973449707, "epoch": 0.32256203115983845, "grad_norm": 0.98828125, "learning_rate": 0.0004995130485130269, "loss": 6.6403, "mean_token_accuracy": 0.14976823478937148, "num_tokens": 7044702.0, "step": 2795 }, { "entropy": 6.705451583862304, "epoch": 0.3231390652048471, "grad_norm": 0.8828125, "learning_rate": 0.0004995103313830289, "loss": 6.6522, "mean_token_accuracy": 0.14741754829883574, "num_tokens": 7056489.0, "step": 2800 }, { "entropy": 6.621556758880615, "epoch": 0.3237160992498557, "grad_norm": 1.140625, "learning_rate": 0.0004995076067017373, "loss": 6.6752, "mean_token_accuracy": 0.14415591955184937, "num_tokens": 7068972.0, "step": 2805 }, { "entropy": 6.72447772026062, "epoch": 0.3242931332948644, "grad_norm": 1.125, "learning_rate": 0.0004995048744692439, "loss": 6.6197, "mean_token_accuracy": 0.14744585007429123, "num_tokens": 7080894.0, "step": 2810 }, { "entropy": 6.598182201385498, "epoch": 0.32487016733987306, "grad_norm": 0.9140625, "learning_rate": 0.0004995021346856405, "loss": 6.6696, "mean_token_accuracy": 0.14264965504407884, "num_tokens": 7094427.0, "step": 2815 }, { "entropy": 6.590505361557007, "epoch": 0.3254472013848817, "grad_norm": 0.89453125, "learning_rate": 0.0004994993873510196, "loss": 6.6003, "mean_token_accuracy": 0.15626100897789003, "num_tokens": 7105710.0, "step": 2820 }, { "entropy": 6.777636337280273, "epoch": 0.32602423542989034, "grad_norm": 0.97265625, "learning_rate": 0.0004994966324654731, "loss": 6.6376, "mean_token_accuracy": 0.1449590690433979, "num_tokens": 7119042.0, "step": 2825 }, { "entropy": 6.564963388442993, "epoch": 0.32660126947489904, "grad_norm": 0.94140625, "learning_rate": 0.000499493870029094, "loss": 6.6343, "mean_token_accuracy": 0.14468320608139038, "num_tokens": 7132146.0, "step": 2830 }, { "entropy": 6.669665241241455, "epoch": 0.3271783035199077, "grad_norm": 0.94921875, "learning_rate": 0.0004994911000419749, "loss": 6.6033, "mean_token_accuracy": 0.14561504125595093, "num_tokens": 7144805.0, "step": 2835 }, { "entropy": 6.571587038040161, "epoch": 0.3277553375649163, "grad_norm": 0.9296875, "learning_rate": 0.0004994883225042093, "loss": 6.5762, "mean_token_accuracy": 0.15571997463703155, "num_tokens": 7156906.0, "step": 2840 }, { "entropy": 6.654489612579345, "epoch": 0.328332371609925, "grad_norm": 1.078125, "learning_rate": 0.0004994855374158905, "loss": 6.567, "mean_token_accuracy": 0.14885426163673401, "num_tokens": 7169451.0, "step": 2845 }, { "entropy": 6.650216817855835, "epoch": 0.32890940565493365, "grad_norm": 0.8828125, "learning_rate": 0.000499482744777112, "loss": 6.7134, "mean_token_accuracy": 0.14018807634711267, "num_tokens": 7183211.0, "step": 2850 }, { "entropy": 6.727432727813721, "epoch": 0.3294864396999423, "grad_norm": 0.99609375, "learning_rate": 0.000499479944587968, "loss": 6.6583, "mean_token_accuracy": 0.14724580198526382, "num_tokens": 7196062.0, "step": 2855 }, { "entropy": 6.719376134872436, "epoch": 0.33006347374495093, "grad_norm": 0.98046875, "learning_rate": 0.0004994771368485526, "loss": 6.7601, "mean_token_accuracy": 0.14483619555830957, "num_tokens": 7208079.0, "step": 2860 }, { "entropy": 6.697180366516113, "epoch": 0.3306405077899596, "grad_norm": 1.0078125, "learning_rate": 0.0004994743215589602, "loss": 6.6972, "mean_token_accuracy": 0.14615591317415239, "num_tokens": 7221537.0, "step": 2865 }, { "entropy": 6.6564757347106935, "epoch": 0.33121754183496827, "grad_norm": 0.91015625, "learning_rate": 0.0004994714987192854, "loss": 6.6652, "mean_token_accuracy": 0.14372813254594802, "num_tokens": 7234472.0, "step": 2870 }, { "entropy": 6.643028306961059, "epoch": 0.3317945758799769, "grad_norm": 0.94921875, "learning_rate": 0.0004994686683296234, "loss": 6.6194, "mean_token_accuracy": 0.15096134543418885, "num_tokens": 7247818.0, "step": 2875 }, { "entropy": 6.6859259605407715, "epoch": 0.3323716099249856, "grad_norm": 0.84765625, "learning_rate": 0.0004994658303900691, "loss": 6.7006, "mean_token_accuracy": 0.14851104468107224, "num_tokens": 7261351.0, "step": 2880 }, { "entropy": 6.607791996002197, "epoch": 0.33294864396999424, "grad_norm": 0.98046875, "learning_rate": 0.0004994629849007182, "loss": 6.568, "mean_token_accuracy": 0.1521388918161392, "num_tokens": 7274310.0, "step": 2885 }, { "entropy": 6.573197507858277, "epoch": 0.3335256780150029, "grad_norm": 0.96484375, "learning_rate": 0.0004994601318616663, "loss": 6.6096, "mean_token_accuracy": 0.1469192236661911, "num_tokens": 7286560.0, "step": 2890 }, { "entropy": 6.756811904907226, "epoch": 0.3341027120600115, "grad_norm": 0.91015625, "learning_rate": 0.0004994572712730092, "loss": 6.6835, "mean_token_accuracy": 0.14362717866897584, "num_tokens": 7300337.0, "step": 2895 }, { "entropy": 6.617220211029053, "epoch": 0.3346797461050202, "grad_norm": 0.93359375, "learning_rate": 0.0004994544031348434, "loss": 6.6485, "mean_token_accuracy": 0.1463576778769493, "num_tokens": 7313436.0, "step": 2900 }, { "entropy": 6.632095098495483, "epoch": 0.33525678015002885, "grad_norm": 0.95703125, "learning_rate": 0.0004994515274472653, "loss": 6.5149, "mean_token_accuracy": 0.16170531660318374, "num_tokens": 7325766.0, "step": 2905 }, { "entropy": 6.578122663497925, "epoch": 0.3358338141950375, "grad_norm": 1.140625, "learning_rate": 0.0004994486442103715, "loss": 6.614, "mean_token_accuracy": 0.1468640923500061, "num_tokens": 7337904.0, "step": 2910 }, { "entropy": 6.575803184509278, "epoch": 0.3364108482400462, "grad_norm": 1.109375, "learning_rate": 0.000499445753424259, "loss": 6.5992, "mean_token_accuracy": 0.14721653759479522, "num_tokens": 7350448.0, "step": 2915 }, { "entropy": 6.711412048339843, "epoch": 0.33698788228505483, "grad_norm": 0.8828125, "learning_rate": 0.0004994428550890251, "loss": 6.6398, "mean_token_accuracy": 0.14552380070090293, "num_tokens": 7363859.0, "step": 2920 }, { "entropy": 6.663523769378662, "epoch": 0.33756491633006347, "grad_norm": 0.93359375, "learning_rate": 0.0004994399492047672, "loss": 6.6548, "mean_token_accuracy": 0.14727362394332885, "num_tokens": 7376963.0, "step": 2925 }, { "entropy": 6.665795135498047, "epoch": 0.3381419503750721, "grad_norm": 0.953125, "learning_rate": 0.0004994370357715832, "loss": 6.6806, "mean_token_accuracy": 0.14258197993040084, "num_tokens": 7390370.0, "step": 2930 }, { "entropy": 6.65341739654541, "epoch": 0.3387189844200808, "grad_norm": 0.92578125, "learning_rate": 0.000499434114789571, "loss": 6.6101, "mean_token_accuracy": 0.14991432875394822, "num_tokens": 7402851.0, "step": 2935 }, { "entropy": 6.5872947692871096, "epoch": 0.33929601846508944, "grad_norm": 0.9453125, "learning_rate": 0.0004994311862588286, "loss": 6.6406, "mean_token_accuracy": 0.14421918392181396, "num_tokens": 7415428.0, "step": 2940 }, { "entropy": 6.719788837432861, "epoch": 0.3398730525100981, "grad_norm": 0.87890625, "learning_rate": 0.0004994282501794551, "loss": 6.6325, "mean_token_accuracy": 0.1465821772813797, "num_tokens": 7428420.0, "step": 2945 }, { "entropy": 6.657585000991821, "epoch": 0.3404500865551068, "grad_norm": 1.0390625, "learning_rate": 0.0004994253065515486, "loss": 6.689, "mean_token_accuracy": 0.14700795263051986, "num_tokens": 7439626.0, "step": 2950 }, { "entropy": 6.661691093444825, "epoch": 0.3410271206001154, "grad_norm": 1.0859375, "learning_rate": 0.0004994223553752084, "loss": 6.6467, "mean_token_accuracy": 0.14639809280633925, "num_tokens": 7452797.0, "step": 2955 }, { "entropy": 6.65012903213501, "epoch": 0.34160415464512406, "grad_norm": 0.93359375, "learning_rate": 0.0004994193966505339, "loss": 6.6162, "mean_token_accuracy": 0.15301314145326614, "num_tokens": 7464311.0, "step": 2960 }, { "entropy": 6.575049352645874, "epoch": 0.3421811886901327, "grad_norm": 1.0078125, "learning_rate": 0.0004994164303776244, "loss": 6.6131, "mean_token_accuracy": 0.14517637491226196, "num_tokens": 7475706.0, "step": 2965 }, { "entropy": 6.673529767990113, "epoch": 0.3427582227351414, "grad_norm": 0.96484375, "learning_rate": 0.0004994134565565797, "loss": 6.7028, "mean_token_accuracy": 0.1451819732785225, "num_tokens": 7489077.0, "step": 2970 }, { "entropy": 6.704615211486816, "epoch": 0.34333525678015003, "grad_norm": 0.93359375, "learning_rate": 0.0004994104751875, "loss": 6.651, "mean_token_accuracy": 0.1511762797832489, "num_tokens": 7501598.0, "step": 2975 }, { "entropy": 6.562963962554932, "epoch": 0.3439122908251587, "grad_norm": 1.3359375, "learning_rate": 0.0004994074862704854, "loss": 6.46, "mean_token_accuracy": 0.1568878024816513, "num_tokens": 7514776.0, "step": 2980 }, { "entropy": 6.517637109756469, "epoch": 0.3444893248701673, "grad_norm": 0.96484375, "learning_rate": 0.0004994044898056363, "loss": 6.6212, "mean_token_accuracy": 0.14930416494607926, "num_tokens": 7527795.0, "step": 2985 }, { "entropy": 6.645235443115235, "epoch": 0.345066358915176, "grad_norm": 1.046875, "learning_rate": 0.0004994014857930538, "loss": 6.5076, "mean_token_accuracy": 0.15968223363161088, "num_tokens": 7541392.0, "step": 2990 }, { "entropy": 6.542176866531372, "epoch": 0.34564339296018465, "grad_norm": 0.9453125, "learning_rate": 0.0004993984742328387, "loss": 6.6275, "mean_token_accuracy": 0.14863153249025346, "num_tokens": 7554369.0, "step": 2995 }, { "entropy": 6.647294902801514, "epoch": 0.3462204270051933, "grad_norm": 1.046875, "learning_rate": 0.0004993954551250925, "loss": 6.6432, "mean_token_accuracy": 0.1486467257142067, "num_tokens": 7567528.0, "step": 3000 }, { "epoch": 0.3462204270051933, "eval_entropy": 6.603502982646388, "eval_loss": 6.686180591583252, "eval_mean_token_accuracy": 0.14944647604010136, "eval_num_tokens": 7567528.0, "eval_runtime": 22.9724, "eval_samples_per_second": 1224.776, "eval_steps_per_second": 153.097, "step": 3000 }, { "entropy": 6.667821407318115, "epoch": 0.346797461050202, "grad_norm": 0.98046875, "learning_rate": 0.0004993924284699165, "loss": 6.5825, "mean_token_accuracy": 0.15041287392377853, "num_tokens": 7579146.0, "step": 3005 }, { "entropy": 6.5950047969818115, "epoch": 0.3473744950952106, "grad_norm": 0.97265625, "learning_rate": 0.0004993893942674127, "loss": 6.6828, "mean_token_accuracy": 0.14685314893722534, "num_tokens": 7591902.0, "step": 3010 }, { "entropy": 6.754814577102661, "epoch": 0.34795152914021926, "grad_norm": 1.0390625, "learning_rate": 0.000499386352517683, "loss": 6.6803, "mean_token_accuracy": 0.15172169506549835, "num_tokens": 7605565.0, "step": 3015 }, { "entropy": 6.726373863220215, "epoch": 0.3485285631852279, "grad_norm": 0.890625, "learning_rate": 0.00049938330322083, "loss": 6.6271, "mean_token_accuracy": 0.15227940529584885, "num_tokens": 7618380.0, "step": 3020 }, { "entropy": 6.556258058547973, "epoch": 0.3491055972302366, "grad_norm": 0.90234375, "learning_rate": 0.0004993802463769558, "loss": 6.6459, "mean_token_accuracy": 0.14672804325819017, "num_tokens": 7632092.0, "step": 3025 }, { "entropy": 6.67885012626648, "epoch": 0.34968263127524524, "grad_norm": 1.0234375, "learning_rate": 0.0004993771819861636, "loss": 6.6585, "mean_token_accuracy": 0.14378119856119156, "num_tokens": 7644185.0, "step": 3030 }, { "entropy": 6.649367904663086, "epoch": 0.3502596653202539, "grad_norm": 0.94921875, "learning_rate": 0.0004993741100485564, "loss": 6.5704, "mean_token_accuracy": 0.14890087842941285, "num_tokens": 7656635.0, "step": 3035 }, { "entropy": 6.630291414260864, "epoch": 0.35083669936526257, "grad_norm": 0.92578125, "learning_rate": 0.0004993710305642374, "loss": 6.6006, "mean_token_accuracy": 0.14622372686862944, "num_tokens": 7669643.0, "step": 3040 }, { "entropy": 6.656918716430664, "epoch": 0.3514137334102712, "grad_norm": 1.0, "learning_rate": 0.0004993679435333102, "loss": 6.6382, "mean_token_accuracy": 0.13970368951559067, "num_tokens": 7682489.0, "step": 3045 }, { "entropy": 6.555567073822021, "epoch": 0.35199076745527985, "grad_norm": 1.25, "learning_rate": 0.0004993648489558788, "loss": 6.5845, "mean_token_accuracy": 0.1465017504990101, "num_tokens": 7696670.0, "step": 3050 }, { "entropy": 6.7070152282714846, "epoch": 0.3525678015002885, "grad_norm": 0.984375, "learning_rate": 0.0004993617468320471, "loss": 6.6109, "mean_token_accuracy": 0.15563664734363555, "num_tokens": 7709054.0, "step": 3055 }, { "entropy": 6.525317859649658, "epoch": 0.3531448355452972, "grad_norm": 1.0234375, "learning_rate": 0.0004993586371619193, "loss": 6.6004, "mean_token_accuracy": 0.14743918776512147, "num_tokens": 7721710.0, "step": 3060 }, { "entropy": 6.660245132446289, "epoch": 0.3537218695903058, "grad_norm": 0.91015625, "learning_rate": 0.0004993555199456004, "loss": 6.6536, "mean_token_accuracy": 0.14922718554735184, "num_tokens": 7733689.0, "step": 3065 }, { "entropy": 6.594697332382202, "epoch": 0.35429890363531447, "grad_norm": 1.0078125, "learning_rate": 0.0004993523951831949, "loss": 6.6406, "mean_token_accuracy": 0.15407218933105468, "num_tokens": 7745735.0, "step": 3070 }, { "entropy": 6.747467994689941, "epoch": 0.35487593768032316, "grad_norm": 0.99609375, "learning_rate": 0.0004993492628748081, "loss": 6.6545, "mean_token_accuracy": 0.14074160531163216, "num_tokens": 7757352.0, "step": 3075 }, { "entropy": 6.607062578201294, "epoch": 0.3554529717253318, "grad_norm": 1.0, "learning_rate": 0.0004993461230205453, "loss": 6.5873, "mean_token_accuracy": 0.1461851865053177, "num_tokens": 7768363.0, "step": 3080 }, { "entropy": 6.6232137203216555, "epoch": 0.35603000577034044, "grad_norm": 0.95703125, "learning_rate": 0.0004993429756205121, "loss": 6.7003, "mean_token_accuracy": 0.14090533256530763, "num_tokens": 7781133.0, "step": 3085 }, { "entropy": 6.777905750274658, "epoch": 0.3566070398153491, "grad_norm": 0.9921875, "learning_rate": 0.0004993398206748142, "loss": 6.6873, "mean_token_accuracy": 0.14060682207345962, "num_tokens": 7794445.0, "step": 3090 }, { "entropy": 6.557980489730835, "epoch": 0.3571840738603578, "grad_norm": 0.98828125, "learning_rate": 0.0004993366581835581, "loss": 6.5819, "mean_token_accuracy": 0.15084142833948136, "num_tokens": 7807601.0, "step": 3095 }, { "entropy": 6.540106964111328, "epoch": 0.3577611079053664, "grad_norm": 0.94140625, "learning_rate": 0.0004993334881468498, "loss": 6.5576, "mean_token_accuracy": 0.15417141318321229, "num_tokens": 7819821.0, "step": 3100 }, { "entropy": 6.614301109313965, "epoch": 0.35833814195037506, "grad_norm": 1.1171875, "learning_rate": 0.0004993303105647961, "loss": 6.5747, "mean_token_accuracy": 0.14614431858062743, "num_tokens": 7832214.0, "step": 3105 }, { "entropy": 6.612269878387451, "epoch": 0.35891517599538375, "grad_norm": 1.1328125, "learning_rate": 0.0004993271254375038, "loss": 6.6275, "mean_token_accuracy": 0.15465223789215088, "num_tokens": 7844566.0, "step": 3110 }, { "entropy": 6.661264038085937, "epoch": 0.3594922100403924, "grad_norm": 0.88671875, "learning_rate": 0.00049932393276508, "loss": 6.6016, "mean_token_accuracy": 0.15167122855782508, "num_tokens": 7857965.0, "step": 3115 }, { "entropy": 6.588106966018676, "epoch": 0.36006924408540103, "grad_norm": 1.15625, "learning_rate": 0.0004993207325476323, "loss": 6.6154, "mean_token_accuracy": 0.1525164559483528, "num_tokens": 7870902.0, "step": 3120 }, { "entropy": 6.747092199325562, "epoch": 0.36064627813040967, "grad_norm": 0.97265625, "learning_rate": 0.0004993175247852681, "loss": 6.6855, "mean_token_accuracy": 0.13674851804971694, "num_tokens": 7883694.0, "step": 3125 }, { "entropy": 6.653594636917115, "epoch": 0.36122331217541837, "grad_norm": 0.984375, "learning_rate": 0.0004993143094780954, "loss": 6.5716, "mean_token_accuracy": 0.15035519748926163, "num_tokens": 7896693.0, "step": 3130 }, { "entropy": 6.549767684936524, "epoch": 0.361800346220427, "grad_norm": 0.87890625, "learning_rate": 0.0004993110866262224, "loss": 6.5811, "mean_token_accuracy": 0.14896219372749328, "num_tokens": 7910010.0, "step": 3135 }, { "entropy": 6.704126453399658, "epoch": 0.36237738026543564, "grad_norm": 0.96484375, "learning_rate": 0.0004993078562297573, "loss": 6.6702, "mean_token_accuracy": 0.136037989705801, "num_tokens": 7922026.0, "step": 3140 }, { "entropy": 6.580215311050415, "epoch": 0.36295441431044434, "grad_norm": 1.015625, "learning_rate": 0.0004993046182888089, "loss": 6.6542, "mean_token_accuracy": 0.1394454210996628, "num_tokens": 7934633.0, "step": 3145 }, { "entropy": 6.594920349121094, "epoch": 0.363531448355453, "grad_norm": 1.1953125, "learning_rate": 0.0004993013728034861, "loss": 6.5489, "mean_token_accuracy": 0.15306085348129272, "num_tokens": 7947189.0, "step": 3150 }, { "entropy": 6.6680103778839115, "epoch": 0.3641084824004616, "grad_norm": 1.4765625, "learning_rate": 0.000499298119773898, "loss": 6.6236, "mean_token_accuracy": 0.14880157262086868, "num_tokens": 7961283.0, "step": 3155 }, { "entropy": 6.523037147521973, "epoch": 0.36468551644547026, "grad_norm": 1.046875, "learning_rate": 0.0004992948592001541, "loss": 6.6176, "mean_token_accuracy": 0.15099794641137124, "num_tokens": 7974589.0, "step": 3160 }, { "entropy": 6.691275119781494, "epoch": 0.36526255049047895, "grad_norm": 1.0625, "learning_rate": 0.000499291591082364, "loss": 6.6758, "mean_token_accuracy": 0.14682248681783677, "num_tokens": 7987148.0, "step": 3165 }, { "entropy": 6.697682428359985, "epoch": 0.3658395845354876, "grad_norm": 0.98828125, "learning_rate": 0.0004992883154206377, "loss": 6.6664, "mean_token_accuracy": 0.1428602494299412, "num_tokens": 8000679.0, "step": 3170 }, { "entropy": 6.5670891284942625, "epoch": 0.36641661858049623, "grad_norm": 0.98046875, "learning_rate": 0.0004992850322150853, "loss": 6.5606, "mean_token_accuracy": 0.15191134065389633, "num_tokens": 8014011.0, "step": 3175 }, { "entropy": 6.69585018157959, "epoch": 0.36699365262550493, "grad_norm": 0.9296875, "learning_rate": 0.0004992817414658172, "loss": 6.5802, "mean_token_accuracy": 0.14718159288167953, "num_tokens": 8026022.0, "step": 3180 }, { "entropy": 6.63649697303772, "epoch": 0.36757068667051357, "grad_norm": 1.046875, "learning_rate": 0.0004992784431729442, "loss": 6.6461, "mean_token_accuracy": 0.14684277549386024, "num_tokens": 8040123.0, "step": 3185 }, { "entropy": 6.675275611877441, "epoch": 0.3681477207155222, "grad_norm": 0.9921875, "learning_rate": 0.0004992751373365771, "loss": 6.6392, "mean_token_accuracy": 0.15477651953697205, "num_tokens": 8053320.0, "step": 3190 }, { "entropy": 6.5776519775390625, "epoch": 0.36872475476053085, "grad_norm": 0.97265625, "learning_rate": 0.0004992718239568273, "loss": 6.5876, "mean_token_accuracy": 0.1540097713470459, "num_tokens": 8066682.0, "step": 3195 }, { "entropy": 6.631053400039673, "epoch": 0.36930178880553954, "grad_norm": 0.97265625, "learning_rate": 0.000499268503033806, "loss": 6.5963, "mean_token_accuracy": 0.15034545511007308, "num_tokens": 8078887.0, "step": 3200 }, { "entropy": 6.641768169403076, "epoch": 0.3698788228505482, "grad_norm": 1.0, "learning_rate": 0.0004992651745676249, "loss": 6.587, "mean_token_accuracy": 0.14526487439870833, "num_tokens": 8090801.0, "step": 3205 }, { "entropy": 6.607954406738282, "epoch": 0.3704558568955568, "grad_norm": 0.98828125, "learning_rate": 0.0004992618385583962, "loss": 6.6613, "mean_token_accuracy": 0.14384082555770875, "num_tokens": 8103387.0, "step": 3210 }, { "entropy": 6.5886212348937985, "epoch": 0.3710328909405655, "grad_norm": 0.95703125, "learning_rate": 0.0004992584950062319, "loss": 6.5145, "mean_token_accuracy": 0.1546319343149662, "num_tokens": 8115356.0, "step": 3215 }, { "entropy": 6.674334526062012, "epoch": 0.37160992498557416, "grad_norm": 0.9609375, "learning_rate": 0.0004992551439112446, "loss": 6.6369, "mean_token_accuracy": 0.14844774454832077, "num_tokens": 8129141.0, "step": 3220 }, { "entropy": 6.7329993724823, "epoch": 0.3721869590305828, "grad_norm": 0.98046875, "learning_rate": 0.0004992517852735469, "loss": 6.659, "mean_token_accuracy": 0.15107582956552507, "num_tokens": 8142453.0, "step": 3225 }, { "entropy": 6.574329853057861, "epoch": 0.37276399307559144, "grad_norm": 0.98828125, "learning_rate": 0.0004992484190932517, "loss": 6.6139, "mean_token_accuracy": 0.14692633971571922, "num_tokens": 8154361.0, "step": 3230 }, { "entropy": 6.7408263206481935, "epoch": 0.37334102712060013, "grad_norm": 1.0703125, "learning_rate": 0.0004992450453704723, "loss": 6.6697, "mean_token_accuracy": 0.14180598258972169, "num_tokens": 8168354.0, "step": 3235 }, { "entropy": 6.6767510890960695, "epoch": 0.3739180611656088, "grad_norm": 0.94921875, "learning_rate": 0.0004992416641053223, "loss": 6.6188, "mean_token_accuracy": 0.15147449523210527, "num_tokens": 8180700.0, "step": 3240 }, { "entropy": 6.61651201248169, "epoch": 0.3744950952106174, "grad_norm": 0.87890625, "learning_rate": 0.0004992382752979153, "loss": 6.613, "mean_token_accuracy": 0.14319541156291962, "num_tokens": 8193987.0, "step": 3245 }, { "entropy": 6.638578748703003, "epoch": 0.3750721292556261, "grad_norm": 0.92578125, "learning_rate": 0.0004992348789483651, "loss": 6.7071, "mean_token_accuracy": 0.14582299664616585, "num_tokens": 8207150.0, "step": 3250 }, { "entropy": 6.710038661956787, "epoch": 0.37564916330063475, "grad_norm": 0.93359375, "learning_rate": 0.0004992314750567864, "loss": 6.6528, "mean_token_accuracy": 0.14282948076725005, "num_tokens": 8221050.0, "step": 3255 }, { "entropy": 6.617986631393433, "epoch": 0.3762261973456434, "grad_norm": 0.97265625, "learning_rate": 0.0004992280636232933, "loss": 6.5845, "mean_token_accuracy": 0.14726462215185165, "num_tokens": 8233641.0, "step": 3260 }, { "entropy": 6.666138219833374, "epoch": 0.376803231390652, "grad_norm": 1.0234375, "learning_rate": 0.0004992246446480007, "loss": 6.5981, "mean_token_accuracy": 0.15233627408742906, "num_tokens": 8246717.0, "step": 3265 }, { "entropy": 6.5698161125183105, "epoch": 0.3773802654356607, "grad_norm": 0.9921875, "learning_rate": 0.0004992212181310235, "loss": 6.6332, "mean_token_accuracy": 0.14525358229875565, "num_tokens": 8258549.0, "step": 3270 }, { "entropy": 6.676126480102539, "epoch": 0.37795729948066936, "grad_norm": 1.203125, "learning_rate": 0.000499217784072477, "loss": 6.6169, "mean_token_accuracy": 0.15047752410173415, "num_tokens": 8271580.0, "step": 3275 }, { "entropy": 6.677121210098266, "epoch": 0.378534333525678, "grad_norm": 1.109375, "learning_rate": 0.0004992143424724768, "loss": 6.5612, "mean_token_accuracy": 0.15735053569078444, "num_tokens": 8283866.0, "step": 3280 }, { "entropy": 6.517127513885498, "epoch": 0.3791113675706867, "grad_norm": 1.1171875, "learning_rate": 0.0004992108933311385, "loss": 6.5855, "mean_token_accuracy": 0.1442652702331543, "num_tokens": 8296141.0, "step": 3285 }, { "entropy": 6.704352283477784, "epoch": 0.37968840161569534, "grad_norm": 1.0078125, "learning_rate": 0.0004992074366485782, "loss": 6.5679, "mean_token_accuracy": 0.14811346232891082, "num_tokens": 8309028.0, "step": 3290 }, { "entropy": 6.6836034774780275, "epoch": 0.380265435660704, "grad_norm": 1.1015625, "learning_rate": 0.000499203972424912, "loss": 6.557, "mean_token_accuracy": 0.14885664880275726, "num_tokens": 8321268.0, "step": 3295 }, { "entropy": 6.48089861869812, "epoch": 0.3808424697057126, "grad_norm": 1.0390625, "learning_rate": 0.0004992005006602567, "loss": 6.5689, "mean_token_accuracy": 0.15438662618398666, "num_tokens": 8333518.0, "step": 3300 }, { "entropy": 6.604173278808593, "epoch": 0.3814195037507213, "grad_norm": 1.0390625, "learning_rate": 0.0004991970213547289, "loss": 6.5919, "mean_token_accuracy": 0.15506176948547362, "num_tokens": 8345639.0, "step": 3305 }, { "entropy": 6.470817232131958, "epoch": 0.38199653779572995, "grad_norm": 1.234375, "learning_rate": 0.0004991935345084457, "loss": 6.4928, "mean_token_accuracy": 0.15436709225177764, "num_tokens": 8358136.0, "step": 3310 }, { "entropy": 6.663488578796387, "epoch": 0.3825735718407386, "grad_norm": 1.0390625, "learning_rate": 0.0004991900401215243, "loss": 6.6646, "mean_token_accuracy": 0.13878891617059708, "num_tokens": 8370480.0, "step": 3315 }, { "entropy": 6.650869083404541, "epoch": 0.3831506058857473, "grad_norm": 1.140625, "learning_rate": 0.0004991865381940822, "loss": 6.565, "mean_token_accuracy": 0.1526940122246742, "num_tokens": 8382894.0, "step": 3320 }, { "entropy": 6.598002243041992, "epoch": 0.3837276399307559, "grad_norm": 1.1328125, "learning_rate": 0.0004991830287262374, "loss": 6.6647, "mean_token_accuracy": 0.14782873764634133, "num_tokens": 8395864.0, "step": 3325 }, { "entropy": 6.727650737762451, "epoch": 0.38430467397576457, "grad_norm": 0.99609375, "learning_rate": 0.0004991795117181077, "loss": 6.6743, "mean_token_accuracy": 0.14051376208662986, "num_tokens": 8408242.0, "step": 3330 }, { "entropy": 6.642122983932495, "epoch": 0.3848817080207732, "grad_norm": 0.9765625, "learning_rate": 0.0004991759871698113, "loss": 6.557, "mean_token_accuracy": 0.1540223702788353, "num_tokens": 8420677.0, "step": 3335 }, { "entropy": 6.50219759941101, "epoch": 0.3854587420657819, "grad_norm": 1.0234375, "learning_rate": 0.0004991724550814671, "loss": 6.5798, "mean_token_accuracy": 0.15331998690962792, "num_tokens": 8434505.0, "step": 3340 }, { "entropy": 6.6981383800506595, "epoch": 0.38603577611079054, "grad_norm": 1.0, "learning_rate": 0.0004991689154531937, "loss": 6.6211, "mean_token_accuracy": 0.1466370016336441, "num_tokens": 8447393.0, "step": 3345 }, { "entropy": 6.633738088607788, "epoch": 0.3866128101557992, "grad_norm": 1.0546875, "learning_rate": 0.0004991653682851102, "loss": 6.515, "mean_token_accuracy": 0.1519007369875908, "num_tokens": 8459659.0, "step": 3350 }, { "entropy": 6.551579332351684, "epoch": 0.3871898442008078, "grad_norm": 1.015625, "learning_rate": 0.000499161813577336, "loss": 6.6471, "mean_token_accuracy": 0.1430330380797386, "num_tokens": 8473783.0, "step": 3355 }, { "entropy": 6.563436841964721, "epoch": 0.3877668782458165, "grad_norm": 1.03125, "learning_rate": 0.0004991582513299903, "loss": 6.4393, "mean_token_accuracy": 0.14940204918384553, "num_tokens": 8486532.0, "step": 3360 }, { "entropy": 6.553758382797241, "epoch": 0.38834391229082516, "grad_norm": 1.3671875, "learning_rate": 0.0004991546815431932, "loss": 6.6361, "mean_token_accuracy": 0.14532858952879907, "num_tokens": 8499133.0, "step": 3365 }, { "entropy": 6.683175468444825, "epoch": 0.3889209463358338, "grad_norm": 0.9609375, "learning_rate": 0.000499151104217065, "loss": 6.6616, "mean_token_accuracy": 0.1406083531677723, "num_tokens": 8513391.0, "step": 3370 }, { "entropy": 6.639142322540283, "epoch": 0.3894979803808425, "grad_norm": 0.9609375, "learning_rate": 0.0004991475193517254, "loss": 6.59, "mean_token_accuracy": 0.14977881610393523, "num_tokens": 8527191.0, "step": 3375 }, { "entropy": 6.645763540267945, "epoch": 0.39007501442585113, "grad_norm": 0.9921875, "learning_rate": 0.0004991439269472956, "loss": 6.646, "mean_token_accuracy": 0.1420146033167839, "num_tokens": 8541328.0, "step": 3380 }, { "entropy": 6.622199296951294, "epoch": 0.39065204847085977, "grad_norm": 1.0625, "learning_rate": 0.0004991403270038961, "loss": 6.5389, "mean_token_accuracy": 0.14269101321697236, "num_tokens": 8553381.0, "step": 3385 }, { "entropy": 6.570790338516235, "epoch": 0.3912290825158684, "grad_norm": 1.0625, "learning_rate": 0.000499136719521648, "loss": 6.578, "mean_token_accuracy": 0.1472961574792862, "num_tokens": 8565149.0, "step": 3390 }, { "entropy": 6.591652965545654, "epoch": 0.3918061165608771, "grad_norm": 1.8203125, "learning_rate": 0.0004991331045006726, "loss": 6.5872, "mean_token_accuracy": 0.1539955124258995, "num_tokens": 8576767.0, "step": 3395 }, { "entropy": 6.676447868347168, "epoch": 0.39238315060588574, "grad_norm": 1.0390625, "learning_rate": 0.0004991294819410916, "loss": 6.6427, "mean_token_accuracy": 0.14463468939065932, "num_tokens": 8589948.0, "step": 3400 }, { "entropy": 6.538165950775147, "epoch": 0.3929601846508944, "grad_norm": 0.92578125, "learning_rate": 0.0004991258518430268, "loss": 6.4792, "mean_token_accuracy": 0.15250100940465927, "num_tokens": 8602233.0, "step": 3405 }, { "entropy": 6.595015525817871, "epoch": 0.3935372186959031, "grad_norm": 1.4375, "learning_rate": 0.0004991222142066003, "loss": 6.5569, "mean_token_accuracy": 0.14572182223200797, "num_tokens": 8614938.0, "step": 3410 }, { "entropy": 6.681994009017944, "epoch": 0.3941142527409117, "grad_norm": 1.0703125, "learning_rate": 0.0004991185690319345, "loss": 6.6082, "mean_token_accuracy": 0.1508318766951561, "num_tokens": 8628203.0, "step": 3415 }, { "entropy": 6.562502431869507, "epoch": 0.39469128678592036, "grad_norm": 0.94921875, "learning_rate": 0.000499114916319152, "loss": 6.5623, "mean_token_accuracy": 0.15397722721099855, "num_tokens": 8640959.0, "step": 3420 }, { "entropy": 6.612614393234253, "epoch": 0.395268320830929, "grad_norm": 0.96875, "learning_rate": 0.0004991112560683755, "loss": 6.5933, "mean_token_accuracy": 0.1472369372844696, "num_tokens": 8656995.0, "step": 3425 }, { "entropy": 6.612496614456177, "epoch": 0.3958453548759377, "grad_norm": 0.91796875, "learning_rate": 0.0004991075882797283, "loss": 6.5999, "mean_token_accuracy": 0.14946889877319336, "num_tokens": 8671476.0, "step": 3430 }, { "entropy": 6.614114093780517, "epoch": 0.39642238892094633, "grad_norm": 1.109375, "learning_rate": 0.0004991039129533337, "loss": 6.6212, "mean_token_accuracy": 0.1447447918355465, "num_tokens": 8683667.0, "step": 3435 }, { "entropy": 6.663765811920166, "epoch": 0.396999422965955, "grad_norm": 1.015625, "learning_rate": 0.0004991002300893152, "loss": 6.6206, "mean_token_accuracy": 0.1453992933034897, "num_tokens": 8696564.0, "step": 3440 }, { "entropy": 6.656809711456299, "epoch": 0.39757645701096367, "grad_norm": 0.96875, "learning_rate": 0.0004990965396877969, "loss": 6.5592, "mean_token_accuracy": 0.145858995616436, "num_tokens": 8708512.0, "step": 3445 }, { "entropy": 6.593225526809692, "epoch": 0.3981534910559723, "grad_norm": 1.0234375, "learning_rate": 0.0004990928417489027, "loss": 6.4353, "mean_token_accuracy": 0.16177331209182738, "num_tokens": 8721015.0, "step": 3450 }, { "entropy": 6.55296311378479, "epoch": 0.39873052510098095, "grad_norm": 1.203125, "learning_rate": 0.0004990891362727572, "loss": 6.5552, "mean_token_accuracy": 0.1485207624733448, "num_tokens": 8732538.0, "step": 3455 }, { "entropy": 6.595230627059936, "epoch": 0.3993075591459896, "grad_norm": 0.96484375, "learning_rate": 0.0004990854232594848, "loss": 6.6106, "mean_token_accuracy": 0.141809394210577, "num_tokens": 8745093.0, "step": 3460 }, { "entropy": 6.650364685058594, "epoch": 0.3998845931909983, "grad_norm": 0.921875, "learning_rate": 0.0004990817027092106, "loss": 6.566, "mean_token_accuracy": 0.1506790906190872, "num_tokens": 8757441.0, "step": 3465 }, { "entropy": 6.536897468566894, "epoch": 0.4004616272360069, "grad_norm": 0.99609375, "learning_rate": 0.0004990779746220595, "loss": 6.5875, "mean_token_accuracy": 0.15096076875925063, "num_tokens": 8770307.0, "step": 3470 }, { "entropy": 6.628611469268799, "epoch": 0.40103866128101556, "grad_norm": 1.015625, "learning_rate": 0.0004990742389981572, "loss": 6.5985, "mean_token_accuracy": 0.15109818130731584, "num_tokens": 8782575.0, "step": 3475 }, { "entropy": 6.702537965774536, "epoch": 0.40161569532602426, "grad_norm": 0.9609375, "learning_rate": 0.000499070495837629, "loss": 6.645, "mean_token_accuracy": 0.14216657131910324, "num_tokens": 8794962.0, "step": 3480 }, { "entropy": 6.64976396560669, "epoch": 0.4021927293710329, "grad_norm": 1.015625, "learning_rate": 0.0004990667451406012, "loss": 6.6286, "mean_token_accuracy": 0.1465877667069435, "num_tokens": 8807434.0, "step": 3485 }, { "entropy": 6.664065790176392, "epoch": 0.40276976341604154, "grad_norm": 1.0859375, "learning_rate": 0.0004990629869071995, "loss": 6.6134, "mean_token_accuracy": 0.14227251559495926, "num_tokens": 8820748.0, "step": 3490 }, { "entropy": 6.563335418701172, "epoch": 0.4033467974610502, "grad_norm": 1.03125, "learning_rate": 0.0004990592211375506, "loss": 6.5368, "mean_token_accuracy": 0.15409625843167304, "num_tokens": 8833428.0, "step": 3495 }, { "entropy": 6.604947519302368, "epoch": 0.4039238315060589, "grad_norm": 0.9765625, "learning_rate": 0.0004990554478317811, "loss": 6.5739, "mean_token_accuracy": 0.14540679156780242, "num_tokens": 8845892.0, "step": 3500 }, { "entropy": 6.532162523269653, "epoch": 0.4045008655510675, "grad_norm": 1.15625, "learning_rate": 0.0004990516669900179, "loss": 6.5188, "mean_token_accuracy": 0.15271870493888856, "num_tokens": 8857508.0, "step": 3505 }, { "entropy": 6.578783464431763, "epoch": 0.40507789959607615, "grad_norm": 0.98046875, "learning_rate": 0.0004990478786123882, "loss": 6.5523, "mean_token_accuracy": 0.14996312260627748, "num_tokens": 8868730.0, "step": 3510 }, { "entropy": 6.572446632385254, "epoch": 0.40565493364108485, "grad_norm": 0.96484375, "learning_rate": 0.0004990440826990193, "loss": 6.5346, "mean_token_accuracy": 0.1447156012058258, "num_tokens": 8882687.0, "step": 3515 }, { "entropy": 6.566001081466675, "epoch": 0.4062319676860935, "grad_norm": 0.98046875, "learning_rate": 0.0004990402792500392, "loss": 6.5601, "mean_token_accuracy": 0.15300334095954896, "num_tokens": 8894723.0, "step": 3520 }, { "entropy": 6.5859610080719, "epoch": 0.4068090017311021, "grad_norm": 1.0546875, "learning_rate": 0.0004990364682655754, "loss": 6.5359, "mean_token_accuracy": 0.15275930017232894, "num_tokens": 8906373.0, "step": 3525 }, { "entropy": 6.613490200042724, "epoch": 0.40738603577611077, "grad_norm": 1.0078125, "learning_rate": 0.0004990326497457564, "loss": 6.5407, "mean_token_accuracy": 0.1478450857102871, "num_tokens": 8918681.0, "step": 3530 }, { "entropy": 6.597956323623658, "epoch": 0.40796306982111946, "grad_norm": 1.0546875, "learning_rate": 0.0004990288236907104, "loss": 6.5754, "mean_token_accuracy": 0.1443031385540962, "num_tokens": 8930232.0, "step": 3535 }, { "entropy": 6.596869373321534, "epoch": 0.4085401038661281, "grad_norm": 1.1171875, "learning_rate": 0.0004990249901005661, "loss": 6.4973, "mean_token_accuracy": 0.1485630303621292, "num_tokens": 8942264.0, "step": 3540 }, { "entropy": 6.6454973220825195, "epoch": 0.40911713791113674, "grad_norm": 1.3671875, "learning_rate": 0.0004990211489754527, "loss": 6.6616, "mean_token_accuracy": 0.1454596146941185, "num_tokens": 8955679.0, "step": 3545 }, { "entropy": 6.612455701828003, "epoch": 0.40969417195614544, "grad_norm": 0.93359375, "learning_rate": 0.0004990173003154993, "loss": 6.4888, "mean_token_accuracy": 0.15279372185468673, "num_tokens": 8968421.0, "step": 3550 }, { "entropy": 6.504389810562134, "epoch": 0.4102712060011541, "grad_norm": 1.1015625, "learning_rate": 0.0004990134441208351, "loss": 6.5535, "mean_token_accuracy": 0.1467677101492882, "num_tokens": 8981063.0, "step": 3555 }, { "entropy": 6.6303013324737545, "epoch": 0.4108482400461627, "grad_norm": 1.03125, "learning_rate": 0.0004990095803915901, "loss": 6.5088, "mean_token_accuracy": 0.1581997647881508, "num_tokens": 8993740.0, "step": 3560 }, { "entropy": 6.543606472015381, "epoch": 0.41142527409117136, "grad_norm": 1.046875, "learning_rate": 0.0004990057091278942, "loss": 6.541, "mean_token_accuracy": 0.14845392405986785, "num_tokens": 9007135.0, "step": 3565 }, { "entropy": 6.554729413986206, "epoch": 0.41200230813618005, "grad_norm": 1.0703125, "learning_rate": 0.0004990018303298773, "loss": 6.5508, "mean_token_accuracy": 0.15105100274085997, "num_tokens": 9021596.0, "step": 3570 }, { "entropy": 6.514636564254761, "epoch": 0.4125793421811887, "grad_norm": 1.1875, "learning_rate": 0.0004989979439976703, "loss": 6.4981, "mean_token_accuracy": 0.1580370619893074, "num_tokens": 9033523.0, "step": 3575 }, { "entropy": 6.483329582214355, "epoch": 0.41315637622619733, "grad_norm": 1.0859375, "learning_rate": 0.0004989940501314037, "loss": 6.4665, "mean_token_accuracy": 0.15388141348958015, "num_tokens": 9045690.0, "step": 3580 }, { "entropy": 6.582033348083496, "epoch": 0.413733410271206, "grad_norm": 1.0703125, "learning_rate": 0.0004989901487312084, "loss": 6.5432, "mean_token_accuracy": 0.15002324283123017, "num_tokens": 9057672.0, "step": 3585 }, { "entropy": 6.550716686248779, "epoch": 0.41431044431621467, "grad_norm": 0.9765625, "learning_rate": 0.0004989862397972157, "loss": 6.5991, "mean_token_accuracy": 0.14664729684591293, "num_tokens": 9070004.0, "step": 3590 }, { "entropy": 6.661472129821777, "epoch": 0.4148874783612233, "grad_norm": 1.1640625, "learning_rate": 0.0004989823233295572, "loss": 6.5681, "mean_token_accuracy": 0.15296779274940492, "num_tokens": 9082453.0, "step": 3595 }, { "entropy": 6.531029796600341, "epoch": 0.41546451240623195, "grad_norm": 1.078125, "learning_rate": 0.0004989783993283644, "loss": 6.5736, "mean_token_accuracy": 0.14416550397872924, "num_tokens": 9095839.0, "step": 3600 }, { "entropy": 6.591415214538574, "epoch": 0.41604154645124064, "grad_norm": 1.109375, "learning_rate": 0.0004989744677937694, "loss": 6.5494, "mean_token_accuracy": 0.1541710987687111, "num_tokens": 9109476.0, "step": 3605 }, { "entropy": 6.541845417022705, "epoch": 0.4166185804962493, "grad_norm": 1.0078125, "learning_rate": 0.0004989705287259046, "loss": 6.4685, "mean_token_accuracy": 0.15512136816978456, "num_tokens": 9122354.0, "step": 3610 }, { "entropy": 6.513101053237915, "epoch": 0.4171956145412579, "grad_norm": 0.98828125, "learning_rate": 0.0004989665821249021, "loss": 6.4933, "mean_token_accuracy": 0.15538508147001268, "num_tokens": 9135502.0, "step": 3615 }, { "entropy": 6.614999198913575, "epoch": 0.4177726485862666, "grad_norm": 0.92578125, "learning_rate": 0.000498962627990895, "loss": 6.6489, "mean_token_accuracy": 0.14729145020246506, "num_tokens": 9147654.0, "step": 3620 }, { "entropy": 6.556717014312744, "epoch": 0.41834968263127525, "grad_norm": 1.078125, "learning_rate": 0.0004989586663240161, "loss": 6.5439, "mean_token_accuracy": 0.14543596506118775, "num_tokens": 9161907.0, "step": 3625 }, { "entropy": 6.6760279655456545, "epoch": 0.4189267166762839, "grad_norm": 1.0390625, "learning_rate": 0.0004989546971243988, "loss": 6.5879, "mean_token_accuracy": 0.14227512627840042, "num_tokens": 9175395.0, "step": 3630 }, { "entropy": 6.621808767318726, "epoch": 0.41950375072129253, "grad_norm": 0.92578125, "learning_rate": 0.0004989507203921763, "loss": 6.4972, "mean_token_accuracy": 0.15439630895853043, "num_tokens": 9187688.0, "step": 3635 }, { "entropy": 6.500979614257813, "epoch": 0.42008078476630123, "grad_norm": 1.0546875, "learning_rate": 0.0004989467361274828, "loss": 6.5274, "mean_token_accuracy": 0.15244155377149582, "num_tokens": 9199773.0, "step": 3640 }, { "entropy": 6.555854415893554, "epoch": 0.42065781881130987, "grad_norm": 0.9453125, "learning_rate": 0.0004989427443304519, "loss": 6.5157, "mean_token_accuracy": 0.15048773884773253, "num_tokens": 9213997.0, "step": 3645 }, { "entropy": 6.564808464050293, "epoch": 0.4212348528563185, "grad_norm": 1.1015625, "learning_rate": 0.000498938745001218, "loss": 6.5537, "mean_token_accuracy": 0.14768253713846208, "num_tokens": 9227187.0, "step": 3650 }, { "entropy": 6.5995463848114015, "epoch": 0.4218118869013272, "grad_norm": 1.0078125, "learning_rate": 0.0004989347381399158, "loss": 6.6187, "mean_token_accuracy": 0.1467508353292942, "num_tokens": 9240860.0, "step": 3655 }, { "entropy": 6.555819511413574, "epoch": 0.42238892094633584, "grad_norm": 0.96875, "learning_rate": 0.0004989307237466799, "loss": 6.5009, "mean_token_accuracy": 0.15100916624069213, "num_tokens": 9253771.0, "step": 3660 }, { "entropy": 6.555511999130249, "epoch": 0.4229659549913445, "grad_norm": 0.90234375, "learning_rate": 0.0004989267018216453, "loss": 6.5451, "mean_token_accuracy": 0.1484347626566887, "num_tokens": 9268380.0, "step": 3665 }, { "entropy": 6.649966144561768, "epoch": 0.4235429890363531, "grad_norm": 1.1484375, "learning_rate": 0.0004989226723649473, "loss": 6.5224, "mean_token_accuracy": 0.1520727753639221, "num_tokens": 9279911.0, "step": 3670 }, { "entropy": 6.573756361007691, "epoch": 0.4241200230813618, "grad_norm": 1.0625, "learning_rate": 0.0004989186353767214, "loss": 6.5251, "mean_token_accuracy": 0.15676866322755814, "num_tokens": 9292105.0, "step": 3675 }, { "entropy": 6.587281703948975, "epoch": 0.42469705712637046, "grad_norm": 1.1640625, "learning_rate": 0.0004989145908571035, "loss": 6.6282, "mean_token_accuracy": 0.1454088181257248, "num_tokens": 9305503.0, "step": 3680 }, { "entropy": 6.598947048187256, "epoch": 0.4252740911713791, "grad_norm": 1.0625, "learning_rate": 0.0004989105388062295, "loss": 6.5304, "mean_token_accuracy": 0.14965798407793046, "num_tokens": 9317978.0, "step": 3685 }, { "entropy": 6.61584882736206, "epoch": 0.4258511252163878, "grad_norm": 0.9609375, "learning_rate": 0.0004989064792242358, "loss": 6.6039, "mean_token_accuracy": 0.14742101579904557, "num_tokens": 9332676.0, "step": 3690 }, { "entropy": 6.577369356155396, "epoch": 0.42642815926139643, "grad_norm": 1.140625, "learning_rate": 0.0004989024121112589, "loss": 6.5021, "mean_token_accuracy": 0.150289623439312, "num_tokens": 9345594.0, "step": 3695 }, { "entropy": 6.637693548202515, "epoch": 0.4270051933064051, "grad_norm": 1.140625, "learning_rate": 0.0004988983374674356, "loss": 6.5817, "mean_token_accuracy": 0.14303911998867988, "num_tokens": 9358303.0, "step": 3700 }, { "entropy": 6.525368690490723, "epoch": 0.4275822273514137, "grad_norm": 1.0078125, "learning_rate": 0.0004988942552929029, "loss": 6.4649, "mean_token_accuracy": 0.15538589656352997, "num_tokens": 9370953.0, "step": 3705 }, { "entropy": 6.450020742416382, "epoch": 0.4281592613964224, "grad_norm": 1.1328125, "learning_rate": 0.0004988901655877981, "loss": 6.5505, "mean_token_accuracy": 0.14808087795972824, "num_tokens": 9384563.0, "step": 3710 }, { "entropy": 6.571639585494995, "epoch": 0.42873629544143105, "grad_norm": 1.1953125, "learning_rate": 0.0004988860683522589, "loss": 6.4914, "mean_token_accuracy": 0.15418324396014213, "num_tokens": 9396401.0, "step": 3715 }, { "entropy": 6.549563884735107, "epoch": 0.4293133294864397, "grad_norm": 1.0703125, "learning_rate": 0.000498881963586423, "loss": 6.5066, "mean_token_accuracy": 0.15194836109876633, "num_tokens": 9408520.0, "step": 3720 }, { "entropy": 6.4020223140716555, "epoch": 0.4298903635314484, "grad_norm": 1.0703125, "learning_rate": 0.0004988778512904282, "loss": 6.4085, "mean_token_accuracy": 0.1552750959992409, "num_tokens": 9421431.0, "step": 3725 }, { "entropy": 6.5411797046661375, "epoch": 0.430467397576457, "grad_norm": 1.1015625, "learning_rate": 0.0004988737314644134, "loss": 6.5322, "mean_token_accuracy": 0.15222309082746505, "num_tokens": 9432566.0, "step": 3730 }, { "entropy": 6.651175785064697, "epoch": 0.43104443162146566, "grad_norm": 1.03125, "learning_rate": 0.0004988696041085168, "loss": 6.6239, "mean_token_accuracy": 0.14554398953914643, "num_tokens": 9444885.0, "step": 3735 }, { "entropy": 6.622100782394409, "epoch": 0.4316214656664743, "grad_norm": 1.3046875, "learning_rate": 0.0004988654692228772, "loss": 6.6173, "mean_token_accuracy": 0.14461512714624405, "num_tokens": 9457823.0, "step": 3740 }, { "entropy": 6.5988099575042725, "epoch": 0.432198499711483, "grad_norm": 1.484375, "learning_rate": 0.0004988613268076335, "loss": 6.467, "mean_token_accuracy": 0.1583518996834755, "num_tokens": 9470799.0, "step": 3745 }, { "entropy": 6.589520645141602, "epoch": 0.43277553375649164, "grad_norm": 1.34375, "learning_rate": 0.0004988571768629257, "loss": 6.5479, "mean_token_accuracy": 0.15336680859327317, "num_tokens": 9484175.0, "step": 3750 }, { "entropy": 6.627070426940918, "epoch": 0.4333525678015003, "grad_norm": 1.1328125, "learning_rate": 0.0004988530193888927, "loss": 6.5747, "mean_token_accuracy": 0.14501228407025338, "num_tokens": 9497809.0, "step": 3755 }, { "entropy": 6.5905872821807865, "epoch": 0.4339296018465089, "grad_norm": 1.1015625, "learning_rate": 0.0004988488543856747, "loss": 6.5109, "mean_token_accuracy": 0.14952886253595352, "num_tokens": 9509755.0, "step": 3760 }, { "entropy": 6.532172775268554, "epoch": 0.4345066358915176, "grad_norm": 1.0390625, "learning_rate": 0.0004988446818534115, "loss": 6.5331, "mean_token_accuracy": 0.14465863406658172, "num_tokens": 9523801.0, "step": 3765 }, { "entropy": 6.547245168685913, "epoch": 0.43508366993652625, "grad_norm": 1.5625, "learning_rate": 0.0004988405017922438, "loss": 6.5018, "mean_token_accuracy": 0.1546433985233307, "num_tokens": 9535846.0, "step": 3770 }, { "entropy": 6.636412525177002, "epoch": 0.4356607039815349, "grad_norm": 1.0546875, "learning_rate": 0.000498836314202312, "loss": 6.5842, "mean_token_accuracy": 0.14722789376974105, "num_tokens": 9548194.0, "step": 3775 }, { "entropy": 6.50278000831604, "epoch": 0.4362377380265436, "grad_norm": 0.99609375, "learning_rate": 0.0004988321190837568, "loss": 6.499, "mean_token_accuracy": 0.1481459118425846, "num_tokens": 9561069.0, "step": 3780 }, { "entropy": 6.522726202011109, "epoch": 0.4368147720715522, "grad_norm": 1.0234375, "learning_rate": 0.0004988279164367196, "loss": 6.4527, "mean_token_accuracy": 0.15349378883838655, "num_tokens": 9573778.0, "step": 3785 }, { "entropy": 6.55922565460205, "epoch": 0.43739180611656087, "grad_norm": 1.1640625, "learning_rate": 0.0004988237062613415, "loss": 6.4631, "mean_token_accuracy": 0.1588495686650276, "num_tokens": 9586616.0, "step": 3790 }, { "entropy": 6.531683540344238, "epoch": 0.4379688401615695, "grad_norm": 1.1484375, "learning_rate": 0.0004988194885577644, "loss": 6.5371, "mean_token_accuracy": 0.15208741575479506, "num_tokens": 9597943.0, "step": 3795 }, { "entropy": 6.567034959793091, "epoch": 0.4385458742065782, "grad_norm": 1.046875, "learning_rate": 0.0004988152633261299, "loss": 6.4738, "mean_token_accuracy": 0.15672459453344345, "num_tokens": 9609861.0, "step": 3800 }, { "entropy": 6.538378524780273, "epoch": 0.43912290825158684, "grad_norm": 1.03125, "learning_rate": 0.00049881103056658, "loss": 6.5315, "mean_token_accuracy": 0.1557203412055969, "num_tokens": 9623307.0, "step": 3805 }, { "entropy": 6.5774413585662845, "epoch": 0.4396999422965955, "grad_norm": 1.078125, "learning_rate": 0.0004988067902792575, "loss": 6.548, "mean_token_accuracy": 0.14982074946165086, "num_tokens": 9635827.0, "step": 3810 }, { "entropy": 6.617994737625122, "epoch": 0.4402769763416042, "grad_norm": 1.0078125, "learning_rate": 0.0004988025424643047, "loss": 6.5941, "mean_token_accuracy": 0.1468472957611084, "num_tokens": 9649422.0, "step": 3815 }, { "entropy": 6.6371983051300045, "epoch": 0.4408540103866128, "grad_norm": 1.0546875, "learning_rate": 0.0004987982871218645, "loss": 6.5795, "mean_token_accuracy": 0.15525637120008468, "num_tokens": 9661542.0, "step": 3820 }, { "entropy": 6.573576974868774, "epoch": 0.44143104443162146, "grad_norm": 1.046875, "learning_rate": 0.0004987940242520802, "loss": 6.563, "mean_token_accuracy": 0.14920065850019454, "num_tokens": 9674684.0, "step": 3825 }, { "entropy": 6.644643783569336, "epoch": 0.4420080784766301, "grad_norm": 0.95703125, "learning_rate": 0.000498789753855095, "loss": 6.5816, "mean_token_accuracy": 0.14375625625252725, "num_tokens": 9687522.0, "step": 3830 }, { "entropy": 6.556054496765137, "epoch": 0.4425851125216388, "grad_norm": 1.109375, "learning_rate": 0.0004987854759310526, "loss": 6.5199, "mean_token_accuracy": 0.15176642686128616, "num_tokens": 9699518.0, "step": 3835 }, { "entropy": 6.550537872314453, "epoch": 0.44316214656664743, "grad_norm": 1.1015625, "learning_rate": 0.0004987811904800968, "loss": 6.5914, "mean_token_accuracy": 0.15061496943235397, "num_tokens": 9711918.0, "step": 3840 }, { "entropy": 6.618970155715942, "epoch": 0.44373918061165607, "grad_norm": 0.98828125, "learning_rate": 0.0004987768975023719, "loss": 6.4637, "mean_token_accuracy": 0.1534193515777588, "num_tokens": 9725643.0, "step": 3845 }, { "entropy": 6.508399486541748, "epoch": 0.44431621465666477, "grad_norm": 1.296875, "learning_rate": 0.0004987725969980222, "loss": 6.4791, "mean_token_accuracy": 0.15461074262857438, "num_tokens": 9738871.0, "step": 3850 }, { "entropy": 6.529386281967163, "epoch": 0.4448932487016734, "grad_norm": 1.1015625, "learning_rate": 0.0004987682889671923, "loss": 6.4722, "mean_token_accuracy": 0.15544941425323486, "num_tokens": 9751166.0, "step": 3855 }, { "entropy": 6.528097200393677, "epoch": 0.44547028274668204, "grad_norm": 1.1328125, "learning_rate": 0.0004987639734100272, "loss": 6.4395, "mean_token_accuracy": 0.1568680375814438, "num_tokens": 9765165.0, "step": 3860 }, { "entropy": 6.498267030715942, "epoch": 0.4460473167916907, "grad_norm": 1.109375, "learning_rate": 0.0004987596503266721, "loss": 6.485, "mean_token_accuracy": 0.1533951610326767, "num_tokens": 9776625.0, "step": 3865 }, { "entropy": 6.5177834033966064, "epoch": 0.4466243508366994, "grad_norm": 1.0859375, "learning_rate": 0.0004987553197172722, "loss": 6.4855, "mean_token_accuracy": 0.1559309795498848, "num_tokens": 9789689.0, "step": 3870 }, { "entropy": 6.627424955368042, "epoch": 0.447201384881708, "grad_norm": 1.1484375, "learning_rate": 0.0004987509815819732, "loss": 6.6022, "mean_token_accuracy": 0.14655733555555345, "num_tokens": 9801124.0, "step": 3875 }, { "entropy": 6.550175523757934, "epoch": 0.44777841892671666, "grad_norm": 1.0546875, "learning_rate": 0.0004987466359209213, "loss": 6.5342, "mean_token_accuracy": 0.15006100833415986, "num_tokens": 9814264.0, "step": 3880 }, { "entropy": 6.550042581558228, "epoch": 0.44835545297172535, "grad_norm": 1.375, "learning_rate": 0.0004987422827342622, "loss": 6.4655, "mean_token_accuracy": 0.15616977363824844, "num_tokens": 9826149.0, "step": 3885 }, { "entropy": 6.557639408111572, "epoch": 0.448932487016734, "grad_norm": 1.140625, "learning_rate": 0.0004987379220221426, "loss": 6.5503, "mean_token_accuracy": 0.14510683268308638, "num_tokens": 9838485.0, "step": 3890 }, { "entropy": 6.5344490051269535, "epoch": 0.44950952106174263, "grad_norm": 1.078125, "learning_rate": 0.0004987335537847092, "loss": 6.485, "mean_token_accuracy": 0.15009704530239104, "num_tokens": 9851371.0, "step": 3895 }, { "entropy": 6.512049579620362, "epoch": 0.4500865551067513, "grad_norm": 0.97265625, "learning_rate": 0.0004987291780221088, "loss": 6.5257, "mean_token_accuracy": 0.14940400570631027, "num_tokens": 9864371.0, "step": 3900 }, { "entropy": 6.560714340209961, "epoch": 0.45066358915175997, "grad_norm": 1.046875, "learning_rate": 0.0004987247947344887, "loss": 6.5233, "mean_token_accuracy": 0.1517380103468895, "num_tokens": 9876086.0, "step": 3905 }, { "entropy": 6.528545999526978, "epoch": 0.4512406231967686, "grad_norm": 1.0703125, "learning_rate": 0.0004987204039219962, "loss": 6.5254, "mean_token_accuracy": 0.1479131981730461, "num_tokens": 9888850.0, "step": 3910 }, { "entropy": 6.582427883148194, "epoch": 0.45181765724177725, "grad_norm": 1.1015625, "learning_rate": 0.0004987160055847791, "loss": 6.5666, "mean_token_accuracy": 0.15192154794931412, "num_tokens": 9901467.0, "step": 3915 }, { "entropy": 6.58316740989685, "epoch": 0.45239469128678594, "grad_norm": 0.9921875, "learning_rate": 0.0004987115997229852, "loss": 6.5235, "mean_token_accuracy": 0.1524689018726349, "num_tokens": 9914431.0, "step": 3920 }, { "entropy": 6.614464235305786, "epoch": 0.4529717253317946, "grad_norm": 1.0, "learning_rate": 0.0004987071863367629, "loss": 6.5604, "mean_token_accuracy": 0.15112543925642968, "num_tokens": 9926863.0, "step": 3925 }, { "entropy": 6.565920209884643, "epoch": 0.4535487593768032, "grad_norm": 1.0625, "learning_rate": 0.0004987027654262604, "loss": 6.5035, "mean_token_accuracy": 0.15478066951036454, "num_tokens": 9939064.0, "step": 3930 }, { "entropy": 6.430483436584472, "epoch": 0.45412579342181186, "grad_norm": 1.125, "learning_rate": 0.0004986983369916264, "loss": 6.4946, "mean_token_accuracy": 0.15007816404104232, "num_tokens": 9950897.0, "step": 3935 }, { "entropy": 6.655666780471802, "epoch": 0.45470282746682056, "grad_norm": 1.2265625, "learning_rate": 0.0004986939010330102, "loss": 6.5449, "mean_token_accuracy": 0.1454168014228344, "num_tokens": 9964388.0, "step": 3940 }, { "entropy": 6.409772491455078, "epoch": 0.4552798615118292, "grad_norm": 1.09375, "learning_rate": 0.0004986894575505606, "loss": 6.382, "mean_token_accuracy": 0.16272770017385482, "num_tokens": 9977363.0, "step": 3945 }, { "entropy": 6.591909456253052, "epoch": 0.45585689555683784, "grad_norm": 1.03125, "learning_rate": 0.0004986850065444272, "loss": 6.4427, "mean_token_accuracy": 0.15807752758264543, "num_tokens": 9989691.0, "step": 3950 }, { "entropy": 6.590207910537719, "epoch": 0.45643392960184653, "grad_norm": 1.03125, "learning_rate": 0.0004986805480147598, "loss": 6.4787, "mean_token_accuracy": 0.14620172828435898, "num_tokens": 10002177.0, "step": 3955 }, { "entropy": 6.495525979995728, "epoch": 0.4570109636468552, "grad_norm": 1.203125, "learning_rate": 0.0004986760819617082, "loss": 6.5341, "mean_token_accuracy": 0.14582275450229645, "num_tokens": 10014844.0, "step": 3960 }, { "entropy": 6.659038019180298, "epoch": 0.4575879976918638, "grad_norm": 1.0234375, "learning_rate": 0.0004986716083854228, "loss": 6.5687, "mean_token_accuracy": 0.1485973134636879, "num_tokens": 10028351.0, "step": 3965 }, { "entropy": 6.487327241897583, "epoch": 0.45816503173687245, "grad_norm": 1.046875, "learning_rate": 0.0004986671272860538, "loss": 6.4832, "mean_token_accuracy": 0.14729729741811753, "num_tokens": 10041318.0, "step": 3970 }, { "entropy": 6.540215110778808, "epoch": 0.45874206578188115, "grad_norm": 1.1875, "learning_rate": 0.0004986626386637521, "loss": 6.4811, "mean_token_accuracy": 0.14569370001554488, "num_tokens": 10054985.0, "step": 3975 }, { "entropy": 6.571915769577027, "epoch": 0.4593190998268898, "grad_norm": 1.21875, "learning_rate": 0.0004986581425186688, "loss": 6.5598, "mean_token_accuracy": 0.1512555092573166, "num_tokens": 10067528.0, "step": 3980 }, { "entropy": 6.542682886123657, "epoch": 0.4598961338718984, "grad_norm": 1.015625, "learning_rate": 0.0004986536388509548, "loss": 6.4675, "mean_token_accuracy": 0.15116373002529143, "num_tokens": 10080210.0, "step": 3985 }, { "entropy": 6.51995530128479, "epoch": 0.4604731679169071, "grad_norm": 0.96484375, "learning_rate": 0.0004986491276607618, "loss": 6.5335, "mean_token_accuracy": 0.15148406326770783, "num_tokens": 10092040.0, "step": 3990 }, { "entropy": 6.583942508697509, "epoch": 0.46105020196191576, "grad_norm": 1.421875, "learning_rate": 0.0004986446089482416, "loss": 6.4508, "mean_token_accuracy": 0.15163778215646745, "num_tokens": 10104923.0, "step": 3995 }, { "entropy": 6.4749840259552, "epoch": 0.4616272360069244, "grad_norm": 1.0390625, "learning_rate": 0.0004986400827135459, "loss": 6.4746, "mean_token_accuracy": 0.15648574531078338, "num_tokens": 10118963.0, "step": 4000 }, { "entropy": 6.527820158004761, "epoch": 0.46220427005193304, "grad_norm": 1.1640625, "learning_rate": 0.0004986355489568272, "loss": 6.4285, "mean_token_accuracy": 0.15958915799856185, "num_tokens": 10131457.0, "step": 4005 }, { "entropy": 6.568796968460083, "epoch": 0.46278130409694174, "grad_norm": 1.0234375, "learning_rate": 0.0004986310076782379, "loss": 6.4985, "mean_token_accuracy": 0.1522387072443962, "num_tokens": 10143796.0, "step": 4010 }, { "entropy": 6.494457387924195, "epoch": 0.4633583381419504, "grad_norm": 0.99609375, "learning_rate": 0.0004986264588779307, "loss": 6.5045, "mean_token_accuracy": 0.15380825847387314, "num_tokens": 10156723.0, "step": 4015 }, { "entropy": 6.5013172149658205, "epoch": 0.463935372186959, "grad_norm": 1.0703125, "learning_rate": 0.0004986219025560586, "loss": 6.5023, "mean_token_accuracy": 0.14863586351275443, "num_tokens": 10168701.0, "step": 4020 }, { "entropy": 6.557641696929932, "epoch": 0.4645124062319677, "grad_norm": 0.9609375, "learning_rate": 0.000498617338712775, "loss": 6.4602, "mean_token_accuracy": 0.1560764953494072, "num_tokens": 10182308.0, "step": 4025 }, { "entropy": 6.510044240951538, "epoch": 0.46508944027697635, "grad_norm": 1.09375, "learning_rate": 0.0004986127673482332, "loss": 6.4539, "mean_token_accuracy": 0.15890756398439407, "num_tokens": 10194237.0, "step": 4030 }, { "entropy": 6.52144136428833, "epoch": 0.465666474321985, "grad_norm": 1.0703125, "learning_rate": 0.0004986081884625871, "loss": 6.5215, "mean_token_accuracy": 0.14942877292633056, "num_tokens": 10208570.0, "step": 4035 }, { "entropy": 6.601692390441895, "epoch": 0.46624350836699363, "grad_norm": 1.0, "learning_rate": 0.0004986036020559906, "loss": 6.4814, "mean_token_accuracy": 0.15481637567281722, "num_tokens": 10221079.0, "step": 4040 }, { "entropy": 6.356483602523804, "epoch": 0.4668205424120023, "grad_norm": 1.1015625, "learning_rate": 0.000498599008128598, "loss": 6.4155, "mean_token_accuracy": 0.15378812998533248, "num_tokens": 10233473.0, "step": 4045 }, { "entropy": 6.593820810317993, "epoch": 0.46739757645701097, "grad_norm": 1.0390625, "learning_rate": 0.0004985944066805639, "loss": 6.5525, "mean_token_accuracy": 0.14852241575717925, "num_tokens": 10247840.0, "step": 4050 }, { "entropy": 6.525872278213501, "epoch": 0.4679746105020196, "grad_norm": 1.2109375, "learning_rate": 0.000498589797712043, "loss": 6.473, "mean_token_accuracy": 0.16045304834842683, "num_tokens": 10261471.0, "step": 4055 }, { "entropy": 6.504099178314209, "epoch": 0.4685516445470283, "grad_norm": 1.1328125, "learning_rate": 0.0004985851812231903, "loss": 6.4736, "mean_token_accuracy": 0.15337898284196855, "num_tokens": 10274386.0, "step": 4060 }, { "entropy": 6.592873764038086, "epoch": 0.46912867859203694, "grad_norm": 1.0546875, "learning_rate": 0.0004985805572141611, "loss": 6.5064, "mean_token_accuracy": 0.15148324966430665, "num_tokens": 10286405.0, "step": 4065 }, { "entropy": 6.614938163757325, "epoch": 0.4697057126370456, "grad_norm": 1.015625, "learning_rate": 0.0004985759256851108, "loss": 6.5546, "mean_token_accuracy": 0.14901065975427627, "num_tokens": 10300084.0, "step": 4070 }, { "entropy": 6.57010850906372, "epoch": 0.4702827466820542, "grad_norm": 1.2265625, "learning_rate": 0.0004985712866361954, "loss": 6.5524, "mean_token_accuracy": 0.15720511972904205, "num_tokens": 10312558.0, "step": 4075 }, { "entropy": 6.493395519256592, "epoch": 0.4708597807270629, "grad_norm": 1.2578125, "learning_rate": 0.0004985666400675709, "loss": 6.4604, "mean_token_accuracy": 0.1560864806175232, "num_tokens": 10324185.0, "step": 4080 }, { "entropy": 6.488433313369751, "epoch": 0.47143681477207156, "grad_norm": 0.9921875, "learning_rate": 0.0004985619859793934, "loss": 6.4833, "mean_token_accuracy": 0.1477129116654396, "num_tokens": 10338634.0, "step": 4085 }, { "entropy": 6.7163480758667, "epoch": 0.4720138488170802, "grad_norm": 1.0859375, "learning_rate": 0.0004985573243718195, "loss": 6.5503, "mean_token_accuracy": 0.14475530236959458, "num_tokens": 10351272.0, "step": 4090 }, { "entropy": 6.561359500885009, "epoch": 0.4725908828620889, "grad_norm": 1.109375, "learning_rate": 0.0004985526552450061, "loss": 6.5081, "mean_token_accuracy": 0.1437559977173805, "num_tokens": 10362894.0, "step": 4095 }, { "entropy": 6.548456525802612, "epoch": 0.47316791690709753, "grad_norm": 1.046875, "learning_rate": 0.0004985479785991103, "loss": 6.5842, "mean_token_accuracy": 0.14605074226856232, "num_tokens": 10376120.0, "step": 4100 }, { "entropy": 6.55332236289978, "epoch": 0.47374495095210617, "grad_norm": 1.2265625, "learning_rate": 0.0004985432944342892, "loss": 6.5026, "mean_token_accuracy": 0.153361913561821, "num_tokens": 10387986.0, "step": 4105 }, { "entropy": 6.548603773117065, "epoch": 0.4743219849971148, "grad_norm": 1.21875, "learning_rate": 0.0004985386027507003, "loss": 6.5225, "mean_token_accuracy": 0.1517445206642151, "num_tokens": 10400920.0, "step": 4110 }, { "entropy": 6.661869049072266, "epoch": 0.4748990190421235, "grad_norm": 1.0859375, "learning_rate": 0.0004985339035485018, "loss": 6.525, "mean_token_accuracy": 0.14937230050563813, "num_tokens": 10413835.0, "step": 4115 }, { "entropy": 6.533235025405884, "epoch": 0.47547605308713214, "grad_norm": 0.97265625, "learning_rate": 0.0004985291968278513, "loss": 6.5224, "mean_token_accuracy": 0.14905970692634582, "num_tokens": 10426959.0, "step": 4120 }, { "entropy": 6.536430978775025, "epoch": 0.4760530871321408, "grad_norm": 1.0703125, "learning_rate": 0.0004985244825889074, "loss": 6.5637, "mean_token_accuracy": 0.15390570759773253, "num_tokens": 10440319.0, "step": 4125 }, { "entropy": 6.541896820068359, "epoch": 0.4766301211771495, "grad_norm": 1.1875, "learning_rate": 0.0004985197608318284, "loss": 6.5325, "mean_token_accuracy": 0.15225679874420167, "num_tokens": 10453715.0, "step": 4130 }, { "entropy": 6.594496631622315, "epoch": 0.4772071552221581, "grad_norm": 1.125, "learning_rate": 0.0004985150315567735, "loss": 6.5164, "mean_token_accuracy": 0.14864421635866165, "num_tokens": 10465574.0, "step": 4135 }, { "entropy": 6.506676197052002, "epoch": 0.47778418926716676, "grad_norm": 1.4921875, "learning_rate": 0.0004985102947639013, "loss": 6.5007, "mean_token_accuracy": 0.15153668075799942, "num_tokens": 10478105.0, "step": 4140 }, { "entropy": 6.552076911926269, "epoch": 0.4783612233121754, "grad_norm": 1.421875, "learning_rate": 0.0004985055504533715, "loss": 6.5134, "mean_token_accuracy": 0.15088197439908982, "num_tokens": 10490723.0, "step": 4145 }, { "entropy": 6.602122354507446, "epoch": 0.4789382573571841, "grad_norm": 1.09375, "learning_rate": 0.0004985007986253435, "loss": 6.5254, "mean_token_accuracy": 0.14911809265613557, "num_tokens": 10503155.0, "step": 4150 }, { "entropy": 6.554518699645996, "epoch": 0.47951529140219273, "grad_norm": 1.2265625, "learning_rate": 0.0004984960392799772, "loss": 6.5106, "mean_token_accuracy": 0.1461018964648247, "num_tokens": 10515077.0, "step": 4155 }, { "entropy": 6.592270565032959, "epoch": 0.4800923254472014, "grad_norm": 1.171875, "learning_rate": 0.0004984912724174326, "loss": 6.4926, "mean_token_accuracy": 0.1490560546517372, "num_tokens": 10528445.0, "step": 4160 }, { "entropy": 6.542512369155884, "epoch": 0.48066935949221, "grad_norm": 1.0703125, "learning_rate": 0.0004984864980378701, "loss": 6.518, "mean_token_accuracy": 0.15329633057117462, "num_tokens": 10541877.0, "step": 4165 }, { "entropy": 6.511092805862427, "epoch": 0.4812463935372187, "grad_norm": 1.0546875, "learning_rate": 0.0004984817161414502, "loss": 6.4941, "mean_token_accuracy": 0.15064932703971862, "num_tokens": 10553527.0, "step": 4170 }, { "entropy": 6.550889539718628, "epoch": 0.48182342758222735, "grad_norm": 1.125, "learning_rate": 0.0004984769267283338, "loss": 6.5247, "mean_token_accuracy": 0.14874509274959563, "num_tokens": 10566492.0, "step": 4175 }, { "entropy": 6.496022319793701, "epoch": 0.482400461627236, "grad_norm": 1.265625, "learning_rate": 0.0004984721297986819, "loss": 6.458, "mean_token_accuracy": 0.15352972596883774, "num_tokens": 10578962.0, "step": 4180 }, { "entropy": 6.561640214920044, "epoch": 0.4829774956722447, "grad_norm": 1.1328125, "learning_rate": 0.0004984673253526561, "loss": 6.4676, "mean_token_accuracy": 0.15236313343048097, "num_tokens": 10591254.0, "step": 4185 }, { "entropy": 6.533859395980835, "epoch": 0.4835545297172533, "grad_norm": 1.6796875, "learning_rate": 0.0004984625133904176, "loss": 6.5014, "mean_token_accuracy": 0.15217659398913383, "num_tokens": 10604961.0, "step": 4190 }, { "entropy": 6.529065370559692, "epoch": 0.48413156376226196, "grad_norm": 1.0546875, "learning_rate": 0.0004984576939121286, "loss": 6.4615, "mean_token_accuracy": 0.15530140995979308, "num_tokens": 10617419.0, "step": 4195 }, { "entropy": 6.506486940383911, "epoch": 0.4847085978072706, "grad_norm": 1.421875, "learning_rate": 0.0004984528669179511, "loss": 6.531, "mean_token_accuracy": 0.14775909036397933, "num_tokens": 10629721.0, "step": 4200 }, { "entropy": 6.585139322280884, "epoch": 0.4852856318522793, "grad_norm": 1.0859375, "learning_rate": 0.0004984480324080472, "loss": 6.5338, "mean_token_accuracy": 0.14746304452419282, "num_tokens": 10643869.0, "step": 4205 }, { "entropy": 6.593662929534912, "epoch": 0.48586266589728794, "grad_norm": 1.1796875, "learning_rate": 0.00049844319038258, "loss": 6.5939, "mean_token_accuracy": 0.14522895812988282, "num_tokens": 10658418.0, "step": 4210 }, { "entropy": 6.564258623123169, "epoch": 0.4864396999422966, "grad_norm": 1.2578125, "learning_rate": 0.0004984383408417119, "loss": 6.4647, "mean_token_accuracy": 0.15308941155672073, "num_tokens": 10671105.0, "step": 4215 }, { "entropy": 6.582191467285156, "epoch": 0.4870167339873053, "grad_norm": 1.078125, "learning_rate": 0.0004984334837856064, "loss": 6.5699, "mean_token_accuracy": 0.1451310083270073, "num_tokens": 10683862.0, "step": 4220 }, { "entropy": 6.55675687789917, "epoch": 0.4875937680323139, "grad_norm": 1.140625, "learning_rate": 0.0004984286192144263, "loss": 6.4655, "mean_token_accuracy": 0.15599070638418197, "num_tokens": 10696559.0, "step": 4225 }, { "entropy": 6.599395895004273, "epoch": 0.48817080207732255, "grad_norm": 1.046875, "learning_rate": 0.0004984237471283359, "loss": 6.5383, "mean_token_accuracy": 0.15275808423757553, "num_tokens": 10710227.0, "step": 4230 }, { "entropy": 6.507157993316651, "epoch": 0.4887478361223312, "grad_norm": 1.09375, "learning_rate": 0.0004984188675274986, "loss": 6.5131, "mean_token_accuracy": 0.14976295828819275, "num_tokens": 10722761.0, "step": 4235 }, { "entropy": 6.592884159088134, "epoch": 0.4893248701673399, "grad_norm": 1.03125, "learning_rate": 0.0004984139804120787, "loss": 6.4778, "mean_token_accuracy": 0.1465604603290558, "num_tokens": 10734126.0, "step": 4240 }, { "entropy": 6.563351154327393, "epoch": 0.4899019042123485, "grad_norm": 1.15625, "learning_rate": 0.0004984090857822406, "loss": 6.5365, "mean_token_accuracy": 0.14797307029366494, "num_tokens": 10747570.0, "step": 4245 }, { "entropy": 6.63136625289917, "epoch": 0.49047893825735717, "grad_norm": 0.9453125, "learning_rate": 0.0004984041836381488, "loss": 6.6419, "mean_token_accuracy": 0.14504213631153107, "num_tokens": 10762975.0, "step": 4250 }, { "entropy": 6.632890224456787, "epoch": 0.49105597230236586, "grad_norm": 1.0859375, "learning_rate": 0.0004983992739799682, "loss": 6.4833, "mean_token_accuracy": 0.15367807745933532, "num_tokens": 10774520.0, "step": 4255 }, { "entropy": 6.475261068344116, "epoch": 0.4916330063473745, "grad_norm": 1.125, "learning_rate": 0.0004983943568078642, "loss": 6.4071, "mean_token_accuracy": 0.15381105840206147, "num_tokens": 10786250.0, "step": 4260 }, { "entropy": 6.515493011474609, "epoch": 0.49221004039238314, "grad_norm": 1.1328125, "learning_rate": 0.0004983894321220017, "loss": 6.5271, "mean_token_accuracy": 0.14624571949243545, "num_tokens": 10799831.0, "step": 4265 }, { "entropy": 6.583249425888061, "epoch": 0.4927870744373918, "grad_norm": 1.1171875, "learning_rate": 0.0004983844999225468, "loss": 6.4694, "mean_token_accuracy": 0.15290576964616776, "num_tokens": 10812803.0, "step": 4270 }, { "entropy": 6.512081813812256, "epoch": 0.4933641084824005, "grad_norm": 1.0703125, "learning_rate": 0.0004983795602096651, "loss": 6.4783, "mean_token_accuracy": 0.15587753057479858, "num_tokens": 10825150.0, "step": 4275 }, { "entropy": 6.589651012420655, "epoch": 0.4939411425274091, "grad_norm": 1.0078125, "learning_rate": 0.000498374612983523, "loss": 6.5828, "mean_token_accuracy": 0.14737853184342384, "num_tokens": 10838337.0, "step": 4280 }, { "entropy": 6.635598182678223, "epoch": 0.49451817657241776, "grad_norm": 1.046875, "learning_rate": 0.0004983696582442866, "loss": 6.4461, "mean_token_accuracy": 0.16733498871326447, "num_tokens": 10852288.0, "step": 4285 }, { "entropy": 6.519201326370239, "epoch": 0.49509521061742645, "grad_norm": 1.1328125, "learning_rate": 0.0004983646959921227, "loss": 6.5311, "mean_token_accuracy": 0.14743692576885223, "num_tokens": 10864189.0, "step": 4290 }, { "entropy": 6.6310670375823975, "epoch": 0.4956722446624351, "grad_norm": 1.0546875, "learning_rate": 0.0004983597262271984, "loss": 6.5307, "mean_token_accuracy": 0.14658827036619188, "num_tokens": 10877410.0, "step": 4295 }, { "entropy": 6.480897855758667, "epoch": 0.49624927870744373, "grad_norm": 1.390625, "learning_rate": 0.0004983547489496804, "loss": 6.5108, "mean_token_accuracy": 0.14898531660437583, "num_tokens": 10889757.0, "step": 4300 }, { "entropy": 6.511052417755127, "epoch": 0.49682631275245237, "grad_norm": 1.2265625, "learning_rate": 0.0004983497641597365, "loss": 6.399, "mean_token_accuracy": 0.1597002699971199, "num_tokens": 10901636.0, "step": 4305 }, { "entropy": 6.496632814407349, "epoch": 0.49740334679746107, "grad_norm": 1.140625, "learning_rate": 0.0004983447718575342, "loss": 6.4418, "mean_token_accuracy": 0.15892936736345292, "num_tokens": 10914063.0, "step": 4310 }, { "entropy": 6.581086921691894, "epoch": 0.4979803808424697, "grad_norm": 1.078125, "learning_rate": 0.0004983397720432414, "loss": 6.4744, "mean_token_accuracy": 0.15386273562908173, "num_tokens": 10927730.0, "step": 4315 }, { "entropy": 6.537801122665405, "epoch": 0.49855741488747835, "grad_norm": 1.359375, "learning_rate": 0.0004983347647170264, "loss": 6.6001, "mean_token_accuracy": 0.14655838459730147, "num_tokens": 10942440.0, "step": 4320 }, { "entropy": 6.567225456237793, "epoch": 0.49913444893248704, "grad_norm": 1.1796875, "learning_rate": 0.0004983297498790574, "loss": 6.4809, "mean_token_accuracy": 0.14959282279014588, "num_tokens": 10955801.0, "step": 4325 }, { "entropy": 6.585222673416138, "epoch": 0.4997114829774957, "grad_norm": 1.1171875, "learning_rate": 0.0004983247275295034, "loss": 6.4775, "mean_token_accuracy": 0.15232663005590438, "num_tokens": 10967918.0, "step": 4330 }, { "entropy": 6.481248474121093, "epoch": 0.5002885170225043, "grad_norm": 1.0625, "learning_rate": 0.0004983196976685329, "loss": 6.4152, "mean_token_accuracy": 0.15650064051151275, "num_tokens": 10979652.0, "step": 4335 }, { "entropy": 6.49305682182312, "epoch": 0.500865551067513, "grad_norm": 2.359375, "learning_rate": 0.0004983146602963155, "loss": 6.3465, "mean_token_accuracy": 0.16713591665029526, "num_tokens": 10991433.0, "step": 4340 }, { "entropy": 6.41333909034729, "epoch": 0.5014425851125216, "grad_norm": 1.6484375, "learning_rate": 0.0004983096154130203, "loss": 6.5509, "mean_token_accuracy": 0.15196776390075684, "num_tokens": 11003976.0, "step": 4345 }, { "entropy": 6.585015773773193, "epoch": 0.5020196191575302, "grad_norm": 0.99609375, "learning_rate": 0.0004983045630188171, "loss": 6.524, "mean_token_accuracy": 0.1477636769413948, "num_tokens": 11018848.0, "step": 4350 }, { "entropy": 6.6534788608551025, "epoch": 0.502596653202539, "grad_norm": 1.0, "learning_rate": 0.0004982995031138759, "loss": 6.5037, "mean_token_accuracy": 0.1479504019021988, "num_tokens": 11030803.0, "step": 4355 }, { "entropy": 6.515288352966309, "epoch": 0.5031736872475476, "grad_norm": 1.296875, "learning_rate": 0.0004982944356983666, "loss": 6.5648, "mean_token_accuracy": 0.14597940295934678, "num_tokens": 11044688.0, "step": 4360 }, { "entropy": 6.573613023757934, "epoch": 0.5037507212925563, "grad_norm": 1.09375, "learning_rate": 0.0004982893607724602, "loss": 6.5372, "mean_token_accuracy": 0.1448674187064171, "num_tokens": 11057026.0, "step": 4365 }, { "entropy": 6.661010122299194, "epoch": 0.5043277553375649, "grad_norm": 1.703125, "learning_rate": 0.000498284278336327, "loss": 6.5456, "mean_token_accuracy": 0.14358318001031875, "num_tokens": 11070407.0, "step": 4370 }, { "entropy": 6.476870441436768, "epoch": 0.5049047893825735, "grad_norm": 1.25, "learning_rate": 0.0004982791883901379, "loss": 6.4595, "mean_token_accuracy": 0.15498376861214638, "num_tokens": 11082655.0, "step": 4375 }, { "entropy": 6.414759540557862, "epoch": 0.5054818234275822, "grad_norm": 1.0546875, "learning_rate": 0.0004982740909340643, "loss": 6.4234, "mean_token_accuracy": 0.16286834478378295, "num_tokens": 11095948.0, "step": 4380 }, { "entropy": 6.6195331573486325, "epoch": 0.5060588574725908, "grad_norm": 1.109375, "learning_rate": 0.0004982689859682775, "loss": 6.467, "mean_token_accuracy": 0.14826145470142366, "num_tokens": 11108105.0, "step": 4385 }, { "entropy": 6.554189395904541, "epoch": 0.5066358915175996, "grad_norm": 1.28125, "learning_rate": 0.0004982638734929492, "loss": 6.5182, "mean_token_accuracy": 0.14397745132446288, "num_tokens": 11120322.0, "step": 4390 }, { "entropy": 6.4076619148254395, "epoch": 0.5072129255626082, "grad_norm": 1.296875, "learning_rate": 0.0004982587535082515, "loss": 6.3114, "mean_token_accuracy": 0.16224624663591386, "num_tokens": 11133903.0, "step": 4395 }, { "entropy": 6.466379690170288, "epoch": 0.5077899596076169, "grad_norm": 1.140625, "learning_rate": 0.0004982536260143565, "loss": 6.3768, "mean_token_accuracy": 0.16100105494260789, "num_tokens": 11145607.0, "step": 4400 }, { "entropy": 6.51287145614624, "epoch": 0.5083669936526255, "grad_norm": 1.34375, "learning_rate": 0.0004982484910114367, "loss": 6.4834, "mean_token_accuracy": 0.15186810493469238, "num_tokens": 11157332.0, "step": 4405 }, { "entropy": 6.590687894821167, "epoch": 0.5089440276976341, "grad_norm": 1.0625, "learning_rate": 0.0004982433484996648, "loss": 6.5847, "mean_token_accuracy": 0.15006298422813416, "num_tokens": 11169404.0, "step": 4410 }, { "entropy": 6.554287099838257, "epoch": 0.5095210617426428, "grad_norm": 1.171875, "learning_rate": 0.0004982381984792138, "loss": 6.4567, "mean_token_accuracy": 0.15406338274478912, "num_tokens": 11182506.0, "step": 4415 }, { "entropy": 6.521548748016357, "epoch": 0.5100980957876514, "grad_norm": 1.296875, "learning_rate": 0.0004982330409502568, "loss": 6.4238, "mean_token_accuracy": 0.15082940310239792, "num_tokens": 11195507.0, "step": 4420 }, { "entropy": 6.535209894180298, "epoch": 0.5106751298326602, "grad_norm": 1.09375, "learning_rate": 0.0004982278759129674, "loss": 6.4329, "mean_token_accuracy": 0.15719768702983855, "num_tokens": 11207219.0, "step": 4425 }, { "entropy": 6.438648223876953, "epoch": 0.5112521638776688, "grad_norm": 1.296875, "learning_rate": 0.0004982227033675194, "loss": 6.4106, "mean_token_accuracy": 0.15815673768520355, "num_tokens": 11219301.0, "step": 4430 }, { "entropy": 6.460758399963379, "epoch": 0.5118291979226774, "grad_norm": 1.1328125, "learning_rate": 0.0004982175233140865, "loss": 6.422, "mean_token_accuracy": 0.15656259655952454, "num_tokens": 11230957.0, "step": 4435 }, { "entropy": 6.560869407653809, "epoch": 0.5124062319676861, "grad_norm": 1.046875, "learning_rate": 0.0004982123357528431, "loss": 6.4481, "mean_token_accuracy": 0.1526852384209633, "num_tokens": 11242813.0, "step": 4440 }, { "entropy": 6.507971668243409, "epoch": 0.5129832660126947, "grad_norm": 1.671875, "learning_rate": 0.0004982071406839636, "loss": 6.463, "mean_token_accuracy": 0.15058354064822196, "num_tokens": 11255193.0, "step": 4445 }, { "entropy": 6.388872909545898, "epoch": 0.5135603000577034, "grad_norm": 1.109375, "learning_rate": 0.0004982019381076229, "loss": 6.4273, "mean_token_accuracy": 0.15397539511322975, "num_tokens": 11267988.0, "step": 4450 }, { "entropy": 6.536984300613403, "epoch": 0.514137334102712, "grad_norm": 1.0625, "learning_rate": 0.0004981967280239958, "loss": 6.5089, "mean_token_accuracy": 0.14631436094641687, "num_tokens": 11280456.0, "step": 4455 }, { "entropy": 6.541901874542236, "epoch": 0.5147143681477208, "grad_norm": 1.1640625, "learning_rate": 0.0004981915104332578, "loss": 6.5337, "mean_token_accuracy": 0.14940202683210374, "num_tokens": 11293304.0, "step": 4460 }, { "entropy": 6.4461493492126465, "epoch": 0.5152914021927294, "grad_norm": 1.0390625, "learning_rate": 0.000498186285335584, "loss": 6.4935, "mean_token_accuracy": 0.14736132621765136, "num_tokens": 11305936.0, "step": 4465 }, { "entropy": 6.674417877197266, "epoch": 0.515868436237738, "grad_norm": 1.203125, "learning_rate": 0.0004981810527311505, "loss": 6.546, "mean_token_accuracy": 0.14426559805870057, "num_tokens": 11319991.0, "step": 4470 }, { "entropy": 6.577980184555054, "epoch": 0.5164454702827467, "grad_norm": 1.25, "learning_rate": 0.000498175812620133, "loss": 6.4438, "mean_token_accuracy": 0.15654727965593337, "num_tokens": 11332572.0, "step": 4475 }, { "entropy": 6.419868278503418, "epoch": 0.5170225043277553, "grad_norm": 1.171875, "learning_rate": 0.0004981705650027081, "loss": 6.4572, "mean_token_accuracy": 0.15874334275722504, "num_tokens": 11344435.0, "step": 4480 }, { "entropy": 6.5055430889129635, "epoch": 0.517599538372764, "grad_norm": 1.1953125, "learning_rate": 0.000498165309879052, "loss": 6.3757, "mean_token_accuracy": 0.15824664235115052, "num_tokens": 11356078.0, "step": 4485 }, { "entropy": 6.469321823120117, "epoch": 0.5181765724177726, "grad_norm": 1.125, "learning_rate": 0.0004981600472493415, "loss": 6.4263, "mean_token_accuracy": 0.1546856477856636, "num_tokens": 11368933.0, "step": 4490 }, { "entropy": 6.574912452697754, "epoch": 0.5187536064627813, "grad_norm": 1.09375, "learning_rate": 0.0004981547771137537, "loss": 6.5351, "mean_token_accuracy": 0.1477719157934189, "num_tokens": 11380810.0, "step": 4495 }, { "entropy": 6.48729829788208, "epoch": 0.51933064050779, "grad_norm": 1.234375, "learning_rate": 0.0004981494994724658, "loss": 6.4445, "mean_token_accuracy": 0.1526978924870491, "num_tokens": 11392447.0, "step": 4500 }, { "entropy": 6.454307603836059, "epoch": 0.5199076745527986, "grad_norm": 1.109375, "learning_rate": 0.0004981442143256554, "loss": 6.4863, "mean_token_accuracy": 0.15106553584337234, "num_tokens": 11405237.0, "step": 4505 }, { "entropy": 6.603475046157837, "epoch": 0.5204847085978073, "grad_norm": 1.0234375, "learning_rate": 0.0004981389216735001, "loss": 6.6036, "mean_token_accuracy": 0.14028041437268257, "num_tokens": 11418951.0, "step": 4510 }, { "entropy": 6.578861427307129, "epoch": 0.5210617426428159, "grad_norm": 0.9765625, "learning_rate": 0.000498133621516178, "loss": 6.492, "mean_token_accuracy": 0.15183505415916443, "num_tokens": 11432587.0, "step": 4515 }, { "entropy": 6.549359607696533, "epoch": 0.5216387766878245, "grad_norm": 1.15625, "learning_rate": 0.0004981283138538675, "loss": 6.5326, "mean_token_accuracy": 0.14482680857181549, "num_tokens": 11445572.0, "step": 4520 }, { "entropy": 6.562268686294556, "epoch": 0.5222158107328332, "grad_norm": 1.078125, "learning_rate": 0.000498122998686747, "loss": 6.4821, "mean_token_accuracy": 0.14933309257030486, "num_tokens": 11457469.0, "step": 4525 }, { "entropy": 6.4967255115509035, "epoch": 0.5227928447778419, "grad_norm": 1.0234375, "learning_rate": 0.0004981176760149951, "loss": 6.5183, "mean_token_accuracy": 0.15408243611454964, "num_tokens": 11470306.0, "step": 4530 }, { "entropy": 6.562189292907715, "epoch": 0.5233698788228506, "grad_norm": 1.1328125, "learning_rate": 0.0004981123458387911, "loss": 6.5062, "mean_token_accuracy": 0.1558932587504387, "num_tokens": 11483839.0, "step": 4535 }, { "entropy": 6.578125905990601, "epoch": 0.5239469128678592, "grad_norm": 1.2109375, "learning_rate": 0.0004981070081583142, "loss": 6.5025, "mean_token_accuracy": 0.14841696321964265, "num_tokens": 11495703.0, "step": 4540 }, { "entropy": 6.603797674179077, "epoch": 0.5245239469128679, "grad_norm": 1.1328125, "learning_rate": 0.000498101662973744, "loss": 6.5831, "mean_token_accuracy": 0.14712464138865472, "num_tokens": 11508061.0, "step": 4545 }, { "entropy": 6.508516645431518, "epoch": 0.5251009809578765, "grad_norm": 1.0390625, "learning_rate": 0.00049809631028526, "loss": 6.4236, "mean_token_accuracy": 0.15662758201360702, "num_tokens": 11520135.0, "step": 4550 }, { "entropy": 6.499169921875, "epoch": 0.5256780150028851, "grad_norm": 1.03125, "learning_rate": 0.0004980909500930424, "loss": 6.4971, "mean_token_accuracy": 0.14866289794445037, "num_tokens": 11532255.0, "step": 4555 }, { "entropy": 6.516340065002441, "epoch": 0.5262550490478938, "grad_norm": 1.109375, "learning_rate": 0.0004980855823972717, "loss": 6.4104, "mean_token_accuracy": 0.15316666960716246, "num_tokens": 11544596.0, "step": 4560 }, { "entropy": 6.5355082035064695, "epoch": 0.5268320830929025, "grad_norm": 1.1171875, "learning_rate": 0.000498080207198128, "loss": 6.5571, "mean_token_accuracy": 0.1471469670534134, "num_tokens": 11556758.0, "step": 4565 }, { "entropy": 6.5845283508300785, "epoch": 0.5274091171379112, "grad_norm": 1.1484375, "learning_rate": 0.0004980748244957925, "loss": 6.5381, "mean_token_accuracy": 0.14486694410443307, "num_tokens": 11570070.0, "step": 4570 }, { "entropy": 6.519506359100342, "epoch": 0.5279861511829198, "grad_norm": 1.1875, "learning_rate": 0.0004980694342904461, "loss": 6.427, "mean_token_accuracy": 0.15766648799180985, "num_tokens": 11582566.0, "step": 4575 }, { "entropy": 6.420183849334717, "epoch": 0.5285631852279284, "grad_norm": 1.0390625, "learning_rate": 0.0004980640365822701, "loss": 6.3809, "mean_token_accuracy": 0.1610960304737091, "num_tokens": 11595238.0, "step": 4580 }, { "entropy": 6.540434312820435, "epoch": 0.5291402192729371, "grad_norm": 1.09375, "learning_rate": 0.000498058631371446, "loss": 6.5134, "mean_token_accuracy": 0.15686920285224915, "num_tokens": 11608646.0, "step": 4585 }, { "entropy": 6.461825847625732, "epoch": 0.5297172533179457, "grad_norm": 1.0234375, "learning_rate": 0.0004980532186581555, "loss": 6.4396, "mean_token_accuracy": 0.15351363271474838, "num_tokens": 11619610.0, "step": 4590 }, { "entropy": 6.42177448272705, "epoch": 0.5302942873629544, "grad_norm": 1.0390625, "learning_rate": 0.000498047798442581, "loss": 6.3527, "mean_token_accuracy": 0.16407090574502944, "num_tokens": 11631691.0, "step": 4595 }, { "entropy": 6.516407203674317, "epoch": 0.5308713214079631, "grad_norm": 1.1015625, "learning_rate": 0.0004980423707249044, "loss": 6.3881, "mean_token_accuracy": 0.1592670902609825, "num_tokens": 11644330.0, "step": 4600 }, { "entropy": 6.531644344329834, "epoch": 0.5314483554529718, "grad_norm": 1.03125, "learning_rate": 0.0004980369355053086, "loss": 6.5237, "mean_token_accuracy": 0.14757917076349258, "num_tokens": 11656826.0, "step": 4605 }, { "entropy": 6.451550531387329, "epoch": 0.5320253894979804, "grad_norm": 1.25, "learning_rate": 0.0004980314927839763, "loss": 6.4796, "mean_token_accuracy": 0.1471990704536438, "num_tokens": 11668669.0, "step": 4610 }, { "entropy": 6.606909942626953, "epoch": 0.532602423542989, "grad_norm": 1.1953125, "learning_rate": 0.0004980260425610903, "loss": 6.4498, "mean_token_accuracy": 0.14908241629600524, "num_tokens": 11681237.0, "step": 4615 }, { "entropy": 6.498003244400024, "epoch": 0.5331794575879977, "grad_norm": 1.0390625, "learning_rate": 0.0004980205848368343, "loss": 6.4956, "mean_token_accuracy": 0.15172789618372917, "num_tokens": 11693953.0, "step": 4620 }, { "entropy": 6.501087999343872, "epoch": 0.5337564916330063, "grad_norm": 1.21875, "learning_rate": 0.0004980151196113917, "loss": 6.4413, "mean_token_accuracy": 0.1522899702191353, "num_tokens": 11705364.0, "step": 4625 }, { "entropy": 6.514171934127807, "epoch": 0.534333525678015, "grad_norm": 1.109375, "learning_rate": 0.0004980096468849464, "loss": 6.455, "mean_token_accuracy": 0.15325311124324797, "num_tokens": 11717664.0, "step": 4630 }, { "entropy": 6.466876649856568, "epoch": 0.5349105597230237, "grad_norm": 1.15625, "learning_rate": 0.0004980041666576823, "loss": 6.456, "mean_token_accuracy": 0.14555764496326445, "num_tokens": 11731143.0, "step": 4635 }, { "entropy": 6.550040197372437, "epoch": 0.5354875937680323, "grad_norm": 1.359375, "learning_rate": 0.0004979986789297837, "loss": 6.4115, "mean_token_accuracy": 0.15628498494625093, "num_tokens": 11743904.0, "step": 4640 }, { "entropy": 6.330129718780517, "epoch": 0.536064627813041, "grad_norm": 1.3671875, "learning_rate": 0.0004979931837014355, "loss": 6.2898, "mean_token_accuracy": 0.15889219790697098, "num_tokens": 11756731.0, "step": 4645 }, { "entropy": 6.439878225326538, "epoch": 0.5366416618580496, "grad_norm": 1.203125, "learning_rate": 0.0004979876809728223, "loss": 6.4106, "mean_token_accuracy": 0.1573275938630104, "num_tokens": 11768597.0, "step": 4650 }, { "entropy": 6.4509971141815186, "epoch": 0.5372186959030583, "grad_norm": 1.3125, "learning_rate": 0.0004979821707441292, "loss": 6.3422, "mean_token_accuracy": 0.16196626275777817, "num_tokens": 11781464.0, "step": 4655 }, { "entropy": 6.384463500976563, "epoch": 0.5377957299480669, "grad_norm": 1.109375, "learning_rate": 0.0004979766530155416, "loss": 6.3178, "mean_token_accuracy": 0.16592992544174195, "num_tokens": 11794215.0, "step": 4660 }, { "entropy": 6.5064746856689455, "epoch": 0.5383727639930755, "grad_norm": 1.609375, "learning_rate": 0.0004979711277872449, "loss": 6.5442, "mean_token_accuracy": 0.14707691445946694, "num_tokens": 11807456.0, "step": 4665 }, { "entropy": 6.544828224182129, "epoch": 0.5389497980380843, "grad_norm": 1.0546875, "learning_rate": 0.0004979655950594252, "loss": 6.4476, "mean_token_accuracy": 0.15236640498042106, "num_tokens": 11819730.0, "step": 4670 }, { "entropy": 6.453517055511474, "epoch": 0.5395268320830929, "grad_norm": 1.0390625, "learning_rate": 0.0004979600548322684, "loss": 6.432, "mean_token_accuracy": 0.16160822808742523, "num_tokens": 11831892.0, "step": 4675 }, { "entropy": 6.519505739212036, "epoch": 0.5401038661281016, "grad_norm": 1.1953125, "learning_rate": 0.000497954507105961, "loss": 6.4578, "mean_token_accuracy": 0.15195320397615433, "num_tokens": 11844114.0, "step": 4680 }, { "entropy": 6.573498392105103, "epoch": 0.5406809001731102, "grad_norm": 1.1875, "learning_rate": 0.0004979489518806893, "loss": 6.4187, "mean_token_accuracy": 0.1524272158741951, "num_tokens": 11855832.0, "step": 4685 }, { "entropy": 6.521721220016479, "epoch": 0.5412579342181189, "grad_norm": 1.0625, "learning_rate": 0.0004979433891566405, "loss": 6.5266, "mean_token_accuracy": 0.15105092376470566, "num_tokens": 11868837.0, "step": 4690 }, { "entropy": 6.530892992019654, "epoch": 0.5418349682631275, "grad_norm": 1.1328125, "learning_rate": 0.0004979378189340015, "loss": 6.4183, "mean_token_accuracy": 0.16228097975254058, "num_tokens": 11880608.0, "step": 4695 }, { "entropy": 6.527881860733032, "epoch": 0.5424120023081361, "grad_norm": 1.125, "learning_rate": 0.0004979322412129597, "loss": 6.4508, "mean_token_accuracy": 0.15379999428987504, "num_tokens": 11892652.0, "step": 4700 }, { "entropy": 6.513641881942749, "epoch": 0.5429890363531449, "grad_norm": 0.9921875, "learning_rate": 0.0004979266559937028, "loss": 6.3945, "mean_token_accuracy": 0.15369104892015456, "num_tokens": 11904572.0, "step": 4705 }, { "entropy": 6.591770267486572, "epoch": 0.5435660703981535, "grad_norm": 1.0859375, "learning_rate": 0.0004979210632764185, "loss": 6.5345, "mean_token_accuracy": 0.14894211888313294, "num_tokens": 11917794.0, "step": 4710 }, { "entropy": 6.52169017791748, "epoch": 0.5441431044431622, "grad_norm": 1.3046875, "learning_rate": 0.0004979154630612949, "loss": 6.4262, "mean_token_accuracy": 0.15118273198604584, "num_tokens": 11930403.0, "step": 4715 }, { "entropy": 6.5592405796051025, "epoch": 0.5447201384881708, "grad_norm": 1.1875, "learning_rate": 0.0004979098553485205, "loss": 6.5375, "mean_token_accuracy": 0.1481676384806633, "num_tokens": 11943974.0, "step": 4720 }, { "entropy": 6.52493953704834, "epoch": 0.5452971725331794, "grad_norm": 1.2265625, "learning_rate": 0.0004979042401382838, "loss": 6.5349, "mean_token_accuracy": 0.14051474183797835, "num_tokens": 11956887.0, "step": 4725 }, { "entropy": 6.567168235778809, "epoch": 0.5458742065781881, "grad_norm": 1.03125, "learning_rate": 0.0004978986174307737, "loss": 6.3789, "mean_token_accuracy": 0.16181773245334624, "num_tokens": 11969504.0, "step": 4730 }, { "entropy": 6.418928146362305, "epoch": 0.5464512406231967, "grad_norm": 1.0546875, "learning_rate": 0.0004978929872261794, "loss": 6.4336, "mean_token_accuracy": 0.15474231988191606, "num_tokens": 11983432.0, "step": 4735 }, { "entropy": 6.59085521697998, "epoch": 0.5470282746682055, "grad_norm": 1.4375, "learning_rate": 0.0004978873495246901, "loss": 6.4298, "mean_token_accuracy": 0.16287856549024582, "num_tokens": 11995915.0, "step": 4740 }, { "entropy": 6.460890197753907, "epoch": 0.5476053087132141, "grad_norm": 1.109375, "learning_rate": 0.0004978817043264955, "loss": 6.4353, "mean_token_accuracy": 0.15744587630033494, "num_tokens": 12008395.0, "step": 4745 }, { "entropy": 6.377586364746094, "epoch": 0.5481823427582228, "grad_norm": 1.4453125, "learning_rate": 0.0004978760516317856, "loss": 6.3956, "mean_token_accuracy": 0.1520675890147686, "num_tokens": 12021179.0, "step": 4750 }, { "entropy": 6.540531587600708, "epoch": 0.5487593768032314, "grad_norm": 1.1640625, "learning_rate": 0.0004978703914407503, "loss": 6.489, "mean_token_accuracy": 0.14723778814077376, "num_tokens": 12033798.0, "step": 4755 }, { "entropy": 6.561176300048828, "epoch": 0.54933641084824, "grad_norm": 1.109375, "learning_rate": 0.0004978647237535802, "loss": 6.4887, "mean_token_accuracy": 0.1505315586924553, "num_tokens": 12045720.0, "step": 4760 }, { "entropy": 6.543166399002075, "epoch": 0.5499134448932487, "grad_norm": 1.40625, "learning_rate": 0.0004978590485704657, "loss": 6.4096, "mean_token_accuracy": 0.15576629489660263, "num_tokens": 12058616.0, "step": 4765 }, { "entropy": 6.486966133117676, "epoch": 0.5504904789382573, "grad_norm": 0.98046875, "learning_rate": 0.0004978533658915979, "loss": 6.5079, "mean_token_accuracy": 0.15112854689359664, "num_tokens": 12070173.0, "step": 4770 }, { "entropy": 6.481332635879516, "epoch": 0.5510675129832661, "grad_norm": 1.2265625, "learning_rate": 0.0004978476757171678, "loss": 6.4059, "mean_token_accuracy": 0.16395777463912964, "num_tokens": 12083499.0, "step": 4775 }, { "entropy": 6.472747802734375, "epoch": 0.5516445470282747, "grad_norm": 1.1484375, "learning_rate": 0.0004978419780473668, "loss": 6.4507, "mean_token_accuracy": 0.1544622302055359, "num_tokens": 12095773.0, "step": 4780 }, { "entropy": 6.4680047035217285, "epoch": 0.5522215810732833, "grad_norm": 1.71875, "learning_rate": 0.0004978362728823865, "loss": 6.4666, "mean_token_accuracy": 0.15453778207302094, "num_tokens": 12107640.0, "step": 4785 }, { "entropy": 6.480125045776367, "epoch": 0.552798615118292, "grad_norm": 1.1953125, "learning_rate": 0.0004978305602224189, "loss": 6.4045, "mean_token_accuracy": 0.1534944549202919, "num_tokens": 12120433.0, "step": 4790 }, { "entropy": 6.440623235702515, "epoch": 0.5533756491633006, "grad_norm": 1.25, "learning_rate": 0.0004978248400676562, "loss": 6.3806, "mean_token_accuracy": 0.15867497473955156, "num_tokens": 12133326.0, "step": 4795 }, { "entropy": 6.586127471923828, "epoch": 0.5539526832083093, "grad_norm": 1.0078125, "learning_rate": 0.0004978191124182905, "loss": 6.4862, "mean_token_accuracy": 0.149084635078907, "num_tokens": 12145119.0, "step": 4800 }, { "entropy": 6.5216453075408936, "epoch": 0.5545297172533179, "grad_norm": 1.0703125, "learning_rate": 0.0004978133772745149, "loss": 6.4498, "mean_token_accuracy": 0.14746844321489333, "num_tokens": 12157414.0, "step": 4805 }, { "entropy": 6.436687326431274, "epoch": 0.5551067512983267, "grad_norm": 0.984375, "learning_rate": 0.0004978076346365218, "loss": 6.316, "mean_token_accuracy": 0.15791162550449372, "num_tokens": 12170226.0, "step": 4810 }, { "entropy": 6.456769037246704, "epoch": 0.5556837853433353, "grad_norm": 1.1796875, "learning_rate": 0.0004978018845045047, "loss": 6.38, "mean_token_accuracy": 0.1574267938733101, "num_tokens": 12182804.0, "step": 4815 }, { "entropy": 6.512805700302124, "epoch": 0.5562608193883439, "grad_norm": 1.2265625, "learning_rate": 0.0004977961268786568, "loss": 6.4683, "mean_token_accuracy": 0.15100056529045106, "num_tokens": 12194795.0, "step": 4820 }, { "entropy": 6.4469624042510985, "epoch": 0.5568378534333526, "grad_norm": 1.0546875, "learning_rate": 0.0004977903617591719, "loss": 6.4403, "mean_token_accuracy": 0.1635904222726822, "num_tokens": 12207880.0, "step": 4825 }, { "entropy": 6.49699854850769, "epoch": 0.5574148874783612, "grad_norm": 1.09375, "learning_rate": 0.0004977845891462439, "loss": 6.5177, "mean_token_accuracy": 0.1520783096551895, "num_tokens": 12219434.0, "step": 4830 }, { "entropy": 6.497847318649292, "epoch": 0.5579919215233698, "grad_norm": 1.0546875, "learning_rate": 0.0004977788090400668, "loss": 6.4267, "mean_token_accuracy": 0.16363779753446578, "num_tokens": 12232775.0, "step": 4835 }, { "entropy": 6.469997453689575, "epoch": 0.5585689555683785, "grad_norm": 1.1015625, "learning_rate": 0.0004977730214408352, "loss": 6.4055, "mean_token_accuracy": 0.15352552086114885, "num_tokens": 12245306.0, "step": 4840 }, { "entropy": 6.411099481582641, "epoch": 0.5591459896133872, "grad_norm": 1.234375, "learning_rate": 0.0004977672263487435, "loss": 6.3635, "mean_token_accuracy": 0.1560710147023201, "num_tokens": 12257553.0, "step": 4845 }, { "entropy": 6.45292592048645, "epoch": 0.5597230236583959, "grad_norm": 1.1953125, "learning_rate": 0.000497761423763987, "loss": 6.4251, "mean_token_accuracy": 0.15596397668123246, "num_tokens": 12269626.0, "step": 4850 }, { "entropy": 6.528067350387573, "epoch": 0.5603000577034045, "grad_norm": 1.1640625, "learning_rate": 0.0004977556136867606, "loss": 6.4507, "mean_token_accuracy": 0.15139178037643433, "num_tokens": 12282180.0, "step": 4855 }, { "entropy": 6.565957403182983, "epoch": 0.5608770917484132, "grad_norm": 1.1484375, "learning_rate": 0.0004977497961172598, "loss": 6.4972, "mean_token_accuracy": 0.15649604499340058, "num_tokens": 12296315.0, "step": 4860 }, { "entropy": 6.459849786758423, "epoch": 0.5614541257934218, "grad_norm": 1.140625, "learning_rate": 0.0004977439710556802, "loss": 6.4183, "mean_token_accuracy": 0.14864314943552018, "num_tokens": 12308800.0, "step": 4865 }, { "entropy": 6.478931283950805, "epoch": 0.5620311598384304, "grad_norm": 1.0546875, "learning_rate": 0.0004977381385022179, "loss": 6.4801, "mean_token_accuracy": 0.1533154159784317, "num_tokens": 12321717.0, "step": 4870 }, { "entropy": 6.566097736358643, "epoch": 0.5626081938834391, "grad_norm": 0.99609375, "learning_rate": 0.0004977322984570688, "loss": 6.5094, "mean_token_accuracy": 0.1451910525560379, "num_tokens": 12335446.0, "step": 4875 }, { "entropy": 6.505554676055908, "epoch": 0.5631852279284478, "grad_norm": 1.15625, "learning_rate": 0.0004977264509204296, "loss": 6.4127, "mean_token_accuracy": 0.15165958628058435, "num_tokens": 12348677.0, "step": 4880 }, { "entropy": 6.485540676116943, "epoch": 0.5637622619734565, "grad_norm": 1.078125, "learning_rate": 0.0004977205958924967, "loss": 6.4415, "mean_token_accuracy": 0.1551760196685791, "num_tokens": 12360934.0, "step": 4885 }, { "entropy": 6.537460088729858, "epoch": 0.5643392960184651, "grad_norm": 1.25, "learning_rate": 0.0004977147333734673, "loss": 6.5441, "mean_token_accuracy": 0.14865117520093918, "num_tokens": 12373538.0, "step": 4890 }, { "entropy": 6.429516363143921, "epoch": 0.5649163300634737, "grad_norm": 1.0546875, "learning_rate": 0.0004977088633635385, "loss": 6.4281, "mean_token_accuracy": 0.1513530433177948, "num_tokens": 12385291.0, "step": 4895 }, { "entropy": 6.613570261001587, "epoch": 0.5654933641084824, "grad_norm": 1.234375, "learning_rate": 0.0004977029858629076, "loss": 6.485, "mean_token_accuracy": 0.14706155732274057, "num_tokens": 12398324.0, "step": 4900 }, { "entropy": 6.503150606155396, "epoch": 0.566070398153491, "grad_norm": 1.03125, "learning_rate": 0.0004976971008717726, "loss": 6.4339, "mean_token_accuracy": 0.1525312729179859, "num_tokens": 12409807.0, "step": 4905 }, { "entropy": 6.515785837173462, "epoch": 0.5666474321984997, "grad_norm": 1.125, "learning_rate": 0.0004976912083903309, "loss": 6.5215, "mean_token_accuracy": 0.14461371153593064, "num_tokens": 12422658.0, "step": 4910 }, { "entropy": 6.550714159011841, "epoch": 0.5672244662435084, "grad_norm": 1.09375, "learning_rate": 0.0004976853084187814, "loss": 6.4638, "mean_token_accuracy": 0.14637623578310013, "num_tokens": 12435912.0, "step": 4915 }, { "entropy": 6.453034782409668, "epoch": 0.5678015002885171, "grad_norm": 1.0859375, "learning_rate": 0.0004976794009573219, "loss": 6.4488, "mean_token_accuracy": 0.15766249001026153, "num_tokens": 12448382.0, "step": 4920 }, { "entropy": 6.508889102935791, "epoch": 0.5683785343335257, "grad_norm": 1.390625, "learning_rate": 0.0004976734860061515, "loss": 6.5688, "mean_token_accuracy": 0.15048769414424895, "num_tokens": 12461355.0, "step": 4925 }, { "entropy": 6.566471338272095, "epoch": 0.5689555683785343, "grad_norm": 1.234375, "learning_rate": 0.0004976675635654688, "loss": 6.4012, "mean_token_accuracy": 0.15381542593240738, "num_tokens": 12473931.0, "step": 4930 }, { "entropy": 6.4354527473449705, "epoch": 0.569532602423543, "grad_norm": 1.0546875, "learning_rate": 0.0004976616336354733, "loss": 6.4381, "mean_token_accuracy": 0.15482519343495368, "num_tokens": 12486130.0, "step": 4935 }, { "entropy": 6.471525001525879, "epoch": 0.5701096364685516, "grad_norm": 1.046875, "learning_rate": 0.0004976556962163645, "loss": 6.3731, "mean_token_accuracy": 0.156865394115448, "num_tokens": 12499336.0, "step": 4940 }, { "entropy": 6.539810228347778, "epoch": 0.5706866705135603, "grad_norm": 1.1953125, "learning_rate": 0.0004976497513083419, "loss": 6.3757, "mean_token_accuracy": 0.15898544192314149, "num_tokens": 12512875.0, "step": 4945 }, { "entropy": 6.477344799041748, "epoch": 0.571263704558569, "grad_norm": 1.328125, "learning_rate": 0.0004976437989116055, "loss": 6.487, "mean_token_accuracy": 0.15137718468904496, "num_tokens": 12524985.0, "step": 4950 }, { "entropy": 6.505421304702759, "epoch": 0.5718407386035776, "grad_norm": 1.3125, "learning_rate": 0.0004976378390263554, "loss": 6.4346, "mean_token_accuracy": 0.15926533192396164, "num_tokens": 12538244.0, "step": 4955 }, { "entropy": 6.559779691696167, "epoch": 0.5724177726485863, "grad_norm": 1.140625, "learning_rate": 0.0004976318716527924, "loss": 6.4404, "mean_token_accuracy": 0.15664353370666503, "num_tokens": 12550769.0, "step": 4960 }, { "entropy": 6.451388883590698, "epoch": 0.5729948066935949, "grad_norm": 1.046875, "learning_rate": 0.0004976258967911168, "loss": 6.465, "mean_token_accuracy": 0.1511801674962044, "num_tokens": 12563294.0, "step": 4965 }, { "entropy": 6.450545358657837, "epoch": 0.5735718407386036, "grad_norm": 1.0859375, "learning_rate": 0.0004976199144415298, "loss": 6.4484, "mean_token_accuracy": 0.14877015054225923, "num_tokens": 12575857.0, "step": 4970 }, { "entropy": 6.539900922775269, "epoch": 0.5741488747836122, "grad_norm": 1.96875, "learning_rate": 0.0004976139246042325, "loss": 6.4198, "mean_token_accuracy": 0.15611875653266907, "num_tokens": 12589881.0, "step": 4975 }, { "entropy": 6.510217142105103, "epoch": 0.5747259088286208, "grad_norm": 1.5546875, "learning_rate": 0.0004976079272794265, "loss": 6.4881, "mean_token_accuracy": 0.14711457639932632, "num_tokens": 12604100.0, "step": 4980 }, { "entropy": 6.591409635543823, "epoch": 0.5753029428736296, "grad_norm": 1.1875, "learning_rate": 0.0004976019224673134, "loss": 6.5016, "mean_token_accuracy": 0.1494516521692276, "num_tokens": 12616643.0, "step": 4985 }, { "entropy": 6.485559701919556, "epoch": 0.5758799769186382, "grad_norm": 1.3671875, "learning_rate": 0.0004975959101680953, "loss": 6.4145, "mean_token_accuracy": 0.15998050570487976, "num_tokens": 12627676.0, "step": 4990 }, { "entropy": 6.3982460498809814, "epoch": 0.5764570109636469, "grad_norm": 1.421875, "learning_rate": 0.0004975898903819742, "loss": 6.3992, "mean_token_accuracy": 0.16120668202638627, "num_tokens": 12639352.0, "step": 4995 }, { "entropy": 6.444949531555176, "epoch": 0.5770340450086555, "grad_norm": 1.09375, "learning_rate": 0.0004975838631091527, "loss": 6.3632, "mean_token_accuracy": 0.15658557564020156, "num_tokens": 12652102.0, "step": 5000 }, { "entropy": 6.556867361068726, "epoch": 0.5776110790536642, "grad_norm": 1.375, "learning_rate": 0.0004975778283498336, "loss": 6.4777, "mean_token_accuracy": 0.1522747591137886, "num_tokens": 12665084.0, "step": 5005 }, { "entropy": 6.399194192886353, "epoch": 0.5781881130986728, "grad_norm": 1.1796875, "learning_rate": 0.0004975717861042198, "loss": 6.3905, "mean_token_accuracy": 0.1488622397184372, "num_tokens": 12677512.0, "step": 5010 }, { "entropy": 6.519528579711914, "epoch": 0.5787651471436814, "grad_norm": 2.0625, "learning_rate": 0.0004975657363725146, "loss": 6.4929, "mean_token_accuracy": 0.14468461647629738, "num_tokens": 12690488.0, "step": 5015 }, { "entropy": 6.569351863861084, "epoch": 0.5793421811886902, "grad_norm": 1.171875, "learning_rate": 0.0004975596791549213, "loss": 6.4386, "mean_token_accuracy": 0.15072959661483765, "num_tokens": 12703830.0, "step": 5020 }, { "entropy": 6.528122615814209, "epoch": 0.5799192152336988, "grad_norm": 1.203125, "learning_rate": 0.0004975536144516437, "loss": 6.4533, "mean_token_accuracy": 0.15344501584768294, "num_tokens": 12716020.0, "step": 5025 }, { "entropy": 6.51330943107605, "epoch": 0.5804962492787075, "grad_norm": 1.265625, "learning_rate": 0.000497547542262886, "loss": 6.518, "mean_token_accuracy": 0.14512748420238494, "num_tokens": 12728989.0, "step": 5030 }, { "entropy": 6.550060606002807, "epoch": 0.5810732833237161, "grad_norm": 2.28125, "learning_rate": 0.0004975414625888521, "loss": 6.3809, "mean_token_accuracy": 0.15464969575405121, "num_tokens": 12741090.0, "step": 5035 }, { "entropy": 6.5245343208312985, "epoch": 0.5816503173687247, "grad_norm": 1.4921875, "learning_rate": 0.0004975353754297468, "loss": 6.422, "mean_token_accuracy": 0.15102563947439193, "num_tokens": 12754176.0, "step": 5040 }, { "entropy": 6.372476387023926, "epoch": 0.5822273514137334, "grad_norm": 1.4140625, "learning_rate": 0.0004975292807857745, "loss": 6.406, "mean_token_accuracy": 0.1529885560274124, "num_tokens": 12766149.0, "step": 5045 }, { "entropy": 6.4757085800170895, "epoch": 0.582804385458742, "grad_norm": 1.21875, "learning_rate": 0.0004975231786571406, "loss": 6.4473, "mean_token_accuracy": 0.15353928953409196, "num_tokens": 12778337.0, "step": 5050 }, { "entropy": 6.508154201507568, "epoch": 0.5833814195037508, "grad_norm": 1.125, "learning_rate": 0.0004975170690440499, "loss": 6.3845, "mean_token_accuracy": 0.15635424107313156, "num_tokens": 12790146.0, "step": 5055 }, { "entropy": 6.451329183578491, "epoch": 0.5839584535487594, "grad_norm": 1.234375, "learning_rate": 0.0004975109519467083, "loss": 6.3748, "mean_token_accuracy": 0.1544017016887665, "num_tokens": 12802821.0, "step": 5060 }, { "entropy": 6.4523937702178955, "epoch": 0.584535487593768, "grad_norm": 1.2890625, "learning_rate": 0.0004975048273653212, "loss": 6.5114, "mean_token_accuracy": 0.15367977023124696, "num_tokens": 12814409.0, "step": 5065 }, { "entropy": 6.532897138595581, "epoch": 0.5851125216387767, "grad_norm": 1.21875, "learning_rate": 0.0004974986953000948, "loss": 6.4037, "mean_token_accuracy": 0.14837779253721237, "num_tokens": 12827398.0, "step": 5070 }, { "entropy": 6.420920324325562, "epoch": 0.5856895556837853, "grad_norm": 1.2421875, "learning_rate": 0.0004974925557512354, "loss": 6.3946, "mean_token_accuracy": 0.15595378279685973, "num_tokens": 12840378.0, "step": 5075 }, { "entropy": 6.459633493423462, "epoch": 0.586266589728794, "grad_norm": 1.2890625, "learning_rate": 0.0004974864087189493, "loss": 6.4854, "mean_token_accuracy": 0.15719999819993974, "num_tokens": 12853493.0, "step": 5080 }, { "entropy": 6.489672040939331, "epoch": 0.5868436237738026, "grad_norm": 1.6953125, "learning_rate": 0.0004974802542034434, "loss": 6.3489, "mean_token_accuracy": 0.16045349091291428, "num_tokens": 12865052.0, "step": 5085 }, { "entropy": 6.51693902015686, "epoch": 0.5874206578188114, "grad_norm": 1.1953125, "learning_rate": 0.0004974740922049246, "loss": 6.4822, "mean_token_accuracy": 0.14741032123565673, "num_tokens": 12878095.0, "step": 5090 }, { "entropy": 6.476896572113037, "epoch": 0.58799769186382, "grad_norm": 1.125, "learning_rate": 0.0004974679227236004, "loss": 6.3246, "mean_token_accuracy": 0.162299744784832, "num_tokens": 12890855.0, "step": 5095 }, { "entropy": 6.500436401367187, "epoch": 0.5885747259088286, "grad_norm": 1.3828125, "learning_rate": 0.0004974617457596779, "loss": 6.4031, "mean_token_accuracy": 0.1562817022204399, "num_tokens": 12903833.0, "step": 5100 }, { "entropy": 6.537255668640137, "epoch": 0.5891517599538373, "grad_norm": 1.25, "learning_rate": 0.0004974555613133652, "loss": 6.5106, "mean_token_accuracy": 0.1479603409767151, "num_tokens": 12917579.0, "step": 5105 }, { "entropy": 6.4827710628509525, "epoch": 0.5897287939988459, "grad_norm": 1.3203125, "learning_rate": 0.0004974493693848702, "loss": 6.479, "mean_token_accuracy": 0.15590202063322067, "num_tokens": 12929718.0, "step": 5110 }, { "entropy": 6.338919973373413, "epoch": 0.5903058280438546, "grad_norm": 1.046875, "learning_rate": 0.0004974431699744011, "loss": 6.3377, "mean_token_accuracy": 0.16054340749979018, "num_tokens": 12943031.0, "step": 5115 }, { "entropy": 6.465764427185059, "epoch": 0.5908828620888632, "grad_norm": 1.1875, "learning_rate": 0.0004974369630821665, "loss": 6.4345, "mean_token_accuracy": 0.16000231057405473, "num_tokens": 12954843.0, "step": 5120 }, { "entropy": 6.479459381103515, "epoch": 0.5914598961338718, "grad_norm": 1.1328125, "learning_rate": 0.0004974307487083752, "loss": 6.4406, "mean_token_accuracy": 0.15593716353178025, "num_tokens": 12966915.0, "step": 5125 }, { "entropy": 6.507039642333984, "epoch": 0.5920369301788806, "grad_norm": 1.046875, "learning_rate": 0.0004974245268532361, "loss": 6.4844, "mean_token_accuracy": 0.14569110572338104, "num_tokens": 12979941.0, "step": 5130 }, { "entropy": 6.544470405578613, "epoch": 0.5926139642238892, "grad_norm": 1.328125, "learning_rate": 0.0004974182975169585, "loss": 6.3857, "mean_token_accuracy": 0.15324565023183823, "num_tokens": 12992836.0, "step": 5135 }, { "entropy": 6.545553588867188, "epoch": 0.5931909982688979, "grad_norm": 1.296875, "learning_rate": 0.000497412060699752, "loss": 6.4179, "mean_token_accuracy": 0.1531425304710865, "num_tokens": 13005246.0, "step": 5140 }, { "entropy": 6.393571567535401, "epoch": 0.5937680323139065, "grad_norm": 1.203125, "learning_rate": 0.0004974058164018263, "loss": 6.3902, "mean_token_accuracy": 0.15206687152385712, "num_tokens": 13016842.0, "step": 5145 }, { "entropy": 6.4142437934875485, "epoch": 0.5943450663589152, "grad_norm": 1.265625, "learning_rate": 0.0004973995646233914, "loss": 6.3766, "mean_token_accuracy": 0.15784988552331924, "num_tokens": 13028388.0, "step": 5150 }, { "entropy": 6.508879947662353, "epoch": 0.5949221004039238, "grad_norm": 1.125, "learning_rate": 0.0004973933053646576, "loss": 6.4231, "mean_token_accuracy": 0.1518938884139061, "num_tokens": 13041895.0, "step": 5155 }, { "entropy": 6.523378658294678, "epoch": 0.5954991344489324, "grad_norm": 1.2421875, "learning_rate": 0.0004973870386258355, "loss": 6.4875, "mean_token_accuracy": 0.1547953560948372, "num_tokens": 13055984.0, "step": 5160 }, { "entropy": 6.517923307418823, "epoch": 0.5960761684939412, "grad_norm": 1.6484375, "learning_rate": 0.0004973807644071357, "loss": 6.4272, "mean_token_accuracy": 0.15377702489495276, "num_tokens": 13068735.0, "step": 5165 }, { "entropy": 6.57601752281189, "epoch": 0.5966532025389498, "grad_norm": 1.125, "learning_rate": 0.0004973744827087695, "loss": 6.5136, "mean_token_accuracy": 0.1491558223962784, "num_tokens": 13081564.0, "step": 5170 }, { "entropy": 6.510840225219726, "epoch": 0.5972302365839585, "grad_norm": 1.40625, "learning_rate": 0.000497368193530948, "loss": 6.43, "mean_token_accuracy": 0.1526069462299347, "num_tokens": 13094146.0, "step": 5175 }, { "entropy": 6.429110145568847, "epoch": 0.5978072706289671, "grad_norm": 1.3046875, "learning_rate": 0.0004973618968738828, "loss": 6.3644, "mean_token_accuracy": 0.15681997686624527, "num_tokens": 13106753.0, "step": 5180 }, { "entropy": 6.384876012802124, "epoch": 0.5983843046739757, "grad_norm": 1.1640625, "learning_rate": 0.0004973555927377856, "loss": 6.3462, "mean_token_accuracy": 0.16190443187952042, "num_tokens": 13118645.0, "step": 5185 }, { "entropy": 6.50286865234375, "epoch": 0.5989613387189844, "grad_norm": 1.1953125, "learning_rate": 0.0004973492811228685, "loss": 6.4626, "mean_token_accuracy": 0.14891703352332114, "num_tokens": 13132250.0, "step": 5190 }, { "entropy": 6.502938985824585, "epoch": 0.599538372763993, "grad_norm": 1.2890625, "learning_rate": 0.0004973429620293438, "loss": 6.4612, "mean_token_accuracy": 0.14949870407581328, "num_tokens": 13145069.0, "step": 5195 }, { "entropy": 6.515492725372314, "epoch": 0.6001154068090018, "grad_norm": 1.0546875, "learning_rate": 0.0004973366354574239, "loss": 6.4103, "mean_token_accuracy": 0.15858462899923326, "num_tokens": 13158244.0, "step": 5200 }, { "entropy": 6.51719102859497, "epoch": 0.6006924408540104, "grad_norm": 1.140625, "learning_rate": 0.0004973303014073219, "loss": 6.4766, "mean_token_accuracy": 0.14795382171869279, "num_tokens": 13171810.0, "step": 5205 }, { "entropy": 6.426719427108765, "epoch": 0.601269474899019, "grad_norm": 1.328125, "learning_rate": 0.0004973239598792504, "loss": 6.3122, "mean_token_accuracy": 0.15710260570049286, "num_tokens": 13184448.0, "step": 5210 }, { "entropy": 6.503760433197021, "epoch": 0.6018465089440277, "grad_norm": 1.1953125, "learning_rate": 0.0004973176108734232, "loss": 6.4881, "mean_token_accuracy": 0.1439894437789917, "num_tokens": 13198350.0, "step": 5215 }, { "entropy": 6.521775341033935, "epoch": 0.6024235429890363, "grad_norm": 1.1171875, "learning_rate": 0.0004973112543900535, "loss": 6.4138, "mean_token_accuracy": 0.15527199506759642, "num_tokens": 13210660.0, "step": 5220 }, { "entropy": 6.409607553482056, "epoch": 0.603000577034045, "grad_norm": 1.3671875, "learning_rate": 0.0004973048904293551, "loss": 6.3827, "mean_token_accuracy": 0.16117679625749587, "num_tokens": 13222991.0, "step": 5225 }, { "entropy": 6.459820032119751, "epoch": 0.6035776110790536, "grad_norm": 1.3359375, "learning_rate": 0.0004972985189915422, "loss": 6.4393, "mean_token_accuracy": 0.14954399913549424, "num_tokens": 13237693.0, "step": 5230 }, { "entropy": 6.474009656906128, "epoch": 0.6041546451240624, "grad_norm": 1.65625, "learning_rate": 0.000497292140076829, "loss": 6.4548, "mean_token_accuracy": 0.15322939604520797, "num_tokens": 13249843.0, "step": 5235 }, { "entropy": 6.510292482376099, "epoch": 0.604731679169071, "grad_norm": 1.1015625, "learning_rate": 0.0004972857536854301, "loss": 6.4215, "mean_token_accuracy": 0.15622295439243317, "num_tokens": 13262185.0, "step": 5240 }, { "entropy": 6.454311656951904, "epoch": 0.6053087132140796, "grad_norm": 1.1796875, "learning_rate": 0.0004972793598175603, "loss": 6.4642, "mean_token_accuracy": 0.1478947676718235, "num_tokens": 13275344.0, "step": 5245 }, { "entropy": 6.513757181167603, "epoch": 0.6058857472590883, "grad_norm": 1.21875, "learning_rate": 0.0004972729584734347, "loss": 6.3843, "mean_token_accuracy": 0.1522686466574669, "num_tokens": 13287741.0, "step": 5250 }, { "entropy": 6.494974374771118, "epoch": 0.6064627813040969, "grad_norm": 1.1171875, "learning_rate": 0.0004972665496532685, "loss": 6.3797, "mean_token_accuracy": 0.15595458894968034, "num_tokens": 13299918.0, "step": 5255 }, { "entropy": 6.378756904602051, "epoch": 0.6070398153491056, "grad_norm": 1.3828125, "learning_rate": 0.0004972601333572774, "loss": 6.3684, "mean_token_accuracy": 0.15408076345920563, "num_tokens": 13312765.0, "step": 5260 }, { "entropy": 6.469124364852905, "epoch": 0.6076168493941142, "grad_norm": 1.265625, "learning_rate": 0.0004972537095856769, "loss": 6.3743, "mean_token_accuracy": 0.1507202297449112, "num_tokens": 13325324.0, "step": 5265 }, { "entropy": 6.516126489639282, "epoch": 0.608193883439123, "grad_norm": 1.3828125, "learning_rate": 0.0004972472783386834, "loss": 6.4594, "mean_token_accuracy": 0.14877294152975082, "num_tokens": 13337578.0, "step": 5270 }, { "entropy": 6.530485391616821, "epoch": 0.6087709174841316, "grad_norm": 1.15625, "learning_rate": 0.0004972408396165132, "loss": 6.423, "mean_token_accuracy": 0.15622132271528244, "num_tokens": 13349218.0, "step": 5275 }, { "entropy": 6.458002948760987, "epoch": 0.6093479515291402, "grad_norm": 1.1875, "learning_rate": 0.0004972343934193826, "loss": 6.3933, "mean_token_accuracy": 0.1541997194290161, "num_tokens": 13362221.0, "step": 5280 }, { "entropy": 6.478120613098144, "epoch": 0.6099249855741489, "grad_norm": 1.328125, "learning_rate": 0.0004972279397475086, "loss": 6.384, "mean_token_accuracy": 0.15952515602111816, "num_tokens": 13374147.0, "step": 5285 }, { "entropy": 6.396870422363281, "epoch": 0.6105020196191575, "grad_norm": 1.1171875, "learning_rate": 0.0004972214786011083, "loss": 6.3315, "mean_token_accuracy": 0.15817706137895585, "num_tokens": 13386077.0, "step": 5290 }, { "entropy": 6.551906967163086, "epoch": 0.6110790536641661, "grad_norm": 1.296875, "learning_rate": 0.000497215009980399, "loss": 6.4253, "mean_token_accuracy": 0.15904004573822023, "num_tokens": 13398442.0, "step": 5295 }, { "entropy": 6.448291397094726, "epoch": 0.6116560877091748, "grad_norm": 1.28125, "learning_rate": 0.000497208533885598, "loss": 6.4321, "mean_token_accuracy": 0.1560212790966034, "num_tokens": 13411249.0, "step": 5300 }, { "entropy": 6.414372968673706, "epoch": 0.6122331217541835, "grad_norm": 1.203125, "learning_rate": 0.0004972020503169235, "loss": 6.4052, "mean_token_accuracy": 0.16007892787456512, "num_tokens": 13424518.0, "step": 5305 }, { "entropy": 6.490907001495361, "epoch": 0.6128101557991922, "grad_norm": 1.1328125, "learning_rate": 0.0004971955592745934, "loss": 6.418, "mean_token_accuracy": 0.14899912327528, "num_tokens": 13438530.0, "step": 5310 }, { "entropy": 6.42531452178955, "epoch": 0.6133871898442008, "grad_norm": 1.0703125, "learning_rate": 0.000497189060758826, "loss": 6.3676, "mean_token_accuracy": 0.16263744086027146, "num_tokens": 13451154.0, "step": 5315 }, { "entropy": 6.432960033416748, "epoch": 0.6139642238892095, "grad_norm": 1.2421875, "learning_rate": 0.00049718255476984, "loss": 6.3967, "mean_token_accuracy": 0.161380535364151, "num_tokens": 13461938.0, "step": 5320 }, { "entropy": 6.436057424545288, "epoch": 0.6145412579342181, "grad_norm": 1.0859375, "learning_rate": 0.0004971760413078539, "loss": 6.3713, "mean_token_accuracy": 0.15706276893615723, "num_tokens": 13474423.0, "step": 5325 }, { "entropy": 6.489777135848999, "epoch": 0.6151182919792267, "grad_norm": 1.1875, "learning_rate": 0.0004971695203730872, "loss": 6.3786, "mean_token_accuracy": 0.16456449776887894, "num_tokens": 13486882.0, "step": 5330 }, { "entropy": 6.458373928070069, "epoch": 0.6156953260242354, "grad_norm": 1.203125, "learning_rate": 0.000497162991965759, "loss": 6.3343, "mean_token_accuracy": 0.15441225916147233, "num_tokens": 13499692.0, "step": 5335 }, { "entropy": 6.4966339588165285, "epoch": 0.6162723600692441, "grad_norm": 1.1171875, "learning_rate": 0.0004971564560860889, "loss": 6.4064, "mean_token_accuracy": 0.15078266859054565, "num_tokens": 13512995.0, "step": 5340 }, { "entropy": 6.369403266906739, "epoch": 0.6168493941142528, "grad_norm": 1.1796875, "learning_rate": 0.0004971499127342968, "loss": 6.3278, "mean_token_accuracy": 0.16098241358995438, "num_tokens": 13525804.0, "step": 5345 }, { "entropy": 6.437539720535279, "epoch": 0.6174264281592614, "grad_norm": 1.28125, "learning_rate": 0.0004971433619106027, "loss": 6.4364, "mean_token_accuracy": 0.1512218251824379, "num_tokens": 13537807.0, "step": 5350 }, { "entropy": 6.584434080123901, "epoch": 0.61800346220427, "grad_norm": 1.3828125, "learning_rate": 0.000497136803615227, "loss": 6.4724, "mean_token_accuracy": 0.14654513746500014, "num_tokens": 13550765.0, "step": 5355 }, { "entropy": 6.452790403366089, "epoch": 0.6185804962492787, "grad_norm": 1.546875, "learning_rate": 0.0004971302378483902, "loss": 6.4246, "mean_token_accuracy": 0.1566222384572029, "num_tokens": 13565084.0, "step": 5360 }, { "entropy": 6.529478931427002, "epoch": 0.6191575302942873, "grad_norm": 1.203125, "learning_rate": 0.0004971236646103132, "loss": 6.4197, "mean_token_accuracy": 0.15318245440721512, "num_tokens": 13578851.0, "step": 5365 }, { "entropy": 6.477718639373779, "epoch": 0.619734564339296, "grad_norm": 1.1953125, "learning_rate": 0.0004971170839012171, "loss": 6.3086, "mean_token_accuracy": 0.16245864033699037, "num_tokens": 13589984.0, "step": 5370 }, { "entropy": 6.382431983947754, "epoch": 0.6203115983843047, "grad_norm": 1.15625, "learning_rate": 0.0004971104957213233, "loss": 6.3887, "mean_token_accuracy": 0.15082724690437316, "num_tokens": 13602899.0, "step": 5375 }, { "entropy": 6.47854175567627, "epoch": 0.6208886324293134, "grad_norm": 1.5390625, "learning_rate": 0.0004971039000708531, "loss": 6.5548, "mean_token_accuracy": 0.1424169920384884, "num_tokens": 13617672.0, "step": 5380 }, { "entropy": 6.5490500926971436, "epoch": 0.621465666474322, "grad_norm": 1.15625, "learning_rate": 0.0004970972969500286, "loss": 6.4049, "mean_token_accuracy": 0.15098279267549514, "num_tokens": 13630029.0, "step": 5385 }, { "entropy": 6.42647614479065, "epoch": 0.6220427005193306, "grad_norm": 1.2421875, "learning_rate": 0.000497090686359072, "loss": 6.3839, "mean_token_accuracy": 0.15539321005344392, "num_tokens": 13643091.0, "step": 5390 }, { "entropy": 6.385086917877198, "epoch": 0.6226197345643393, "grad_norm": 1.7578125, "learning_rate": 0.0004970840682982054, "loss": 6.2634, "mean_token_accuracy": 0.16022852510213853, "num_tokens": 13654790.0, "step": 5395 }, { "entropy": 6.455251741409302, "epoch": 0.6231967686093479, "grad_norm": 1.3125, "learning_rate": 0.0004970774427676514, "loss": 6.3606, "mean_token_accuracy": 0.1599068224430084, "num_tokens": 13667425.0, "step": 5400 }, { "entropy": 6.516546249389648, "epoch": 0.6237738026543566, "grad_norm": 1.3828125, "learning_rate": 0.000497070809767633, "loss": 6.4386, "mean_token_accuracy": 0.15648358017206193, "num_tokens": 13680199.0, "step": 5405 }, { "entropy": 6.4648191928863525, "epoch": 0.6243508366993653, "grad_norm": 1.0625, "learning_rate": 0.0004970641692983731, "loss": 6.438, "mean_token_accuracy": 0.15207870900630951, "num_tokens": 13693613.0, "step": 5410 }, { "entropy": 6.374730634689331, "epoch": 0.624927870744374, "grad_norm": 1.1328125, "learning_rate": 0.0004970575213600954, "loss": 6.4049, "mean_token_accuracy": 0.15325464606285094, "num_tokens": 13706809.0, "step": 5415 }, { "entropy": 6.499360609054565, "epoch": 0.6255049047893826, "grad_norm": 1.265625, "learning_rate": 0.0004970508659530231, "loss": 6.3474, "mean_token_accuracy": 0.15512218326330185, "num_tokens": 13718976.0, "step": 5420 }, { "entropy": 6.463284254074097, "epoch": 0.6260819388343912, "grad_norm": 1.09375, "learning_rate": 0.0004970442030773802, "loss": 6.354, "mean_token_accuracy": 0.15274603366851808, "num_tokens": 13731037.0, "step": 5425 }, { "entropy": 6.401796483993531, "epoch": 0.6266589728793999, "grad_norm": 1.2265625, "learning_rate": 0.0004970375327333909, "loss": 6.412, "mean_token_accuracy": 0.1536305785179138, "num_tokens": 13743816.0, "step": 5430 }, { "entropy": 6.407013082504273, "epoch": 0.6272360069244085, "grad_norm": 1.0546875, "learning_rate": 0.0004970308549212796, "loss": 6.3983, "mean_token_accuracy": 0.15897883772850036, "num_tokens": 13757165.0, "step": 5435 }, { "entropy": 6.470421314239502, "epoch": 0.6278130409694171, "grad_norm": 1.1171875, "learning_rate": 0.0004970241696412705, "loss": 6.3747, "mean_token_accuracy": 0.15822548270225525, "num_tokens": 13769982.0, "step": 5440 }, { "entropy": 6.47586350440979, "epoch": 0.6283900750144259, "grad_norm": 1.2421875, "learning_rate": 0.000497017476893589, "loss": 6.3833, "mean_token_accuracy": 0.16209243834018708, "num_tokens": 13782922.0, "step": 5445 }, { "entropy": 6.44397201538086, "epoch": 0.6289671090594345, "grad_norm": 1.328125, "learning_rate": 0.0004970107766784598, "loss": 6.3988, "mean_token_accuracy": 0.15553117990493776, "num_tokens": 13795683.0, "step": 5450 }, { "entropy": 6.577775239944458, "epoch": 0.6295441431044432, "grad_norm": 1.5078125, "learning_rate": 0.0004970040689961084, "loss": 6.4834, "mean_token_accuracy": 0.15517319813370706, "num_tokens": 13808332.0, "step": 5455 }, { "entropy": 6.529779148101807, "epoch": 0.6301211771494518, "grad_norm": 1.4765625, "learning_rate": 0.0004969973538467605, "loss": 6.4313, "mean_token_accuracy": 0.1575072228908539, "num_tokens": 13820949.0, "step": 5460 }, { "entropy": 6.391829109191894, "epoch": 0.6306982111944605, "grad_norm": 1.5, "learning_rate": 0.0004969906312306419, "loss": 6.4199, "mean_token_accuracy": 0.15567118525505066, "num_tokens": 13833623.0, "step": 5465 }, { "entropy": 6.449386215209961, "epoch": 0.6312752452394691, "grad_norm": 1.3046875, "learning_rate": 0.0004969839011479786, "loss": 6.3437, "mean_token_accuracy": 0.16317939907312393, "num_tokens": 13844368.0, "step": 5470 }, { "entropy": 6.489554214477539, "epoch": 0.6318522792844777, "grad_norm": 2.828125, "learning_rate": 0.000496977163598997, "loss": 6.4002, "mean_token_accuracy": 0.16044973731040954, "num_tokens": 13857261.0, "step": 5475 }, { "entropy": 6.304276037216186, "epoch": 0.6324293133294865, "grad_norm": 1.1171875, "learning_rate": 0.0004969704185839239, "loss": 6.2707, "mean_token_accuracy": 0.15524207204580306, "num_tokens": 13869438.0, "step": 5480 }, { "entropy": 6.527767086029053, "epoch": 0.6330063473744951, "grad_norm": 1.359375, "learning_rate": 0.0004969636661029859, "loss": 6.4693, "mean_token_accuracy": 0.14667147621512414, "num_tokens": 13883353.0, "step": 5485 }, { "entropy": 6.453281211853027, "epoch": 0.6335833814195038, "grad_norm": 1.2421875, "learning_rate": 0.0004969569061564103, "loss": 6.4342, "mean_token_accuracy": 0.16208689510822297, "num_tokens": 13896950.0, "step": 5490 }, { "entropy": 6.5273314952850345, "epoch": 0.6341604154645124, "grad_norm": 1.2890625, "learning_rate": 0.0004969501387444245, "loss": 6.409, "mean_token_accuracy": 0.15331158488988877, "num_tokens": 13910447.0, "step": 5495 }, { "entropy": 6.448615264892578, "epoch": 0.634737449509521, "grad_norm": 1.125, "learning_rate": 0.0004969433638672559, "loss": 6.4131, "mean_token_accuracy": 0.1641377866268158, "num_tokens": 13922894.0, "step": 5500 }, { "entropy": 6.470922517776489, "epoch": 0.6353144835545297, "grad_norm": 1.2109375, "learning_rate": 0.0004969365815251325, "loss": 6.4349, "mean_token_accuracy": 0.15074554085731506, "num_tokens": 13936558.0, "step": 5505 }, { "entropy": 6.49364275932312, "epoch": 0.6358915175995383, "grad_norm": 1.265625, "learning_rate": 0.0004969297917182825, "loss": 6.3486, "mean_token_accuracy": 0.15768291652202607, "num_tokens": 13949005.0, "step": 5510 }, { "entropy": 6.509783792495727, "epoch": 0.6364685516445471, "grad_norm": 1.1171875, "learning_rate": 0.0004969229944469342, "loss": 6.4245, "mean_token_accuracy": 0.14853326678276063, "num_tokens": 13962285.0, "step": 5515 }, { "entropy": 6.48953537940979, "epoch": 0.6370455856895557, "grad_norm": 1.1875, "learning_rate": 0.0004969161897113162, "loss": 6.4058, "mean_token_accuracy": 0.15401887595653535, "num_tokens": 13976037.0, "step": 5520 }, { "entropy": 6.460662126541138, "epoch": 0.6376226197345644, "grad_norm": 1.0625, "learning_rate": 0.0004969093775116574, "loss": 6.3599, "mean_token_accuracy": 0.15469125062227249, "num_tokens": 13989028.0, "step": 5525 }, { "entropy": 6.354991722106933, "epoch": 0.638199653779573, "grad_norm": 1.3125, "learning_rate": 0.0004969025578481869, "loss": 6.3485, "mean_token_accuracy": 0.15838611572980882, "num_tokens": 14001814.0, "step": 5530 }, { "entropy": 6.5595146179199215, "epoch": 0.6387766878245816, "grad_norm": 1.1015625, "learning_rate": 0.000496895730721134, "loss": 6.4544, "mean_token_accuracy": 0.14454537704586984, "num_tokens": 14014305.0, "step": 5535 }, { "entropy": 6.438262844085694, "epoch": 0.6393537218695903, "grad_norm": 1.2421875, "learning_rate": 0.0004968888961307286, "loss": 6.3267, "mean_token_accuracy": 0.16070610731840135, "num_tokens": 14027475.0, "step": 5540 }, { "entropy": 6.447474813461303, "epoch": 0.6399307559145989, "grad_norm": 1.3359375, "learning_rate": 0.0004968820540772003, "loss": 6.3943, "mean_token_accuracy": 0.15843632072210312, "num_tokens": 14041031.0, "step": 5545 }, { "entropy": 6.407632684707641, "epoch": 0.6405077899596077, "grad_norm": 1.2109375, "learning_rate": 0.0004968752045607794, "loss": 6.345, "mean_token_accuracy": 0.15532173216342926, "num_tokens": 14054138.0, "step": 5550 }, { "entropy": 6.498112392425537, "epoch": 0.6410848240046163, "grad_norm": 1.2421875, "learning_rate": 0.0004968683475816961, "loss": 6.3824, "mean_token_accuracy": 0.15433506965637206, "num_tokens": 14066708.0, "step": 5555 }, { "entropy": 6.413477897644043, "epoch": 0.641661858049625, "grad_norm": 1.28125, "learning_rate": 0.0004968614831401811, "loss": 6.4372, "mean_token_accuracy": 0.14834733828902244, "num_tokens": 14080251.0, "step": 5560 }, { "entropy": 6.533289051055908, "epoch": 0.6422388920946336, "grad_norm": 1.25, "learning_rate": 0.0004968546112364654, "loss": 6.4059, "mean_token_accuracy": 0.15228572264313697, "num_tokens": 14092622.0, "step": 5565 }, { "entropy": 6.488448190689087, "epoch": 0.6428159261396422, "grad_norm": 1.09375, "learning_rate": 0.00049684773187078, "loss": 6.4901, "mean_token_accuracy": 0.14898357838392257, "num_tokens": 14107033.0, "step": 5570 }, { "entropy": 6.364928388595581, "epoch": 0.6433929601846509, "grad_norm": 1.1953125, "learning_rate": 0.0004968408450433565, "loss": 6.2017, "mean_token_accuracy": 0.15701743066310883, "num_tokens": 14119264.0, "step": 5575 }, { "entropy": 6.429807901382446, "epoch": 0.6439699942296595, "grad_norm": 1.375, "learning_rate": 0.0004968339507544263, "loss": 6.3988, "mean_token_accuracy": 0.1542530760169029, "num_tokens": 14131360.0, "step": 5580 }, { "entropy": 6.443619251251221, "epoch": 0.6445470282746683, "grad_norm": 1.1796875, "learning_rate": 0.0004968270490042212, "loss": 6.3842, "mean_token_accuracy": 0.1619213879108429, "num_tokens": 14143236.0, "step": 5585 }, { "entropy": 6.433837938308716, "epoch": 0.6451240623196769, "grad_norm": 1.140625, "learning_rate": 0.0004968201397929737, "loss": 6.4, "mean_token_accuracy": 0.1572832927107811, "num_tokens": 14156470.0, "step": 5590 }, { "entropy": 6.525268507003784, "epoch": 0.6457010963646855, "grad_norm": 1.2890625, "learning_rate": 0.0004968132231209158, "loss": 6.4646, "mean_token_accuracy": 0.1507378861308098, "num_tokens": 14169359.0, "step": 5595 }, { "entropy": 6.43701810836792, "epoch": 0.6462781304096942, "grad_norm": 1.125, "learning_rate": 0.0004968062989882803, "loss": 6.4709, "mean_token_accuracy": 0.15128603354096412, "num_tokens": 14181980.0, "step": 5600 }, { "entropy": 6.559728527069092, "epoch": 0.6468551644547028, "grad_norm": 1.125, "learning_rate": 0.0004967993673953003, "loss": 6.433, "mean_token_accuracy": 0.15603036880493165, "num_tokens": 14195456.0, "step": 5605 }, { "entropy": 6.483079195022583, "epoch": 0.6474321984997115, "grad_norm": 1.25, "learning_rate": 0.0004967924283422087, "loss": 6.3258, "mean_token_accuracy": 0.16091519445180893, "num_tokens": 14208269.0, "step": 5610 }, { "entropy": 6.397562265396118, "epoch": 0.6480092325447201, "grad_norm": 1.1640625, "learning_rate": 0.000496785481829239, "loss": 6.4322, "mean_token_accuracy": 0.15433711111545562, "num_tokens": 14221474.0, "step": 5615 }, { "entropy": 6.533019590377807, "epoch": 0.6485862665897288, "grad_norm": 1.2265625, "learning_rate": 0.0004967785278566245, "loss": 6.4061, "mean_token_accuracy": 0.1547924056649208, "num_tokens": 14234185.0, "step": 5620 }, { "entropy": 6.418440961837769, "epoch": 0.6491633006347375, "grad_norm": 1.2578125, "learning_rate": 0.0004967715664245997, "loss": 6.3589, "mean_token_accuracy": 0.1545765370130539, "num_tokens": 14246853.0, "step": 5625 }, { "entropy": 6.416825199127198, "epoch": 0.6497403346797461, "grad_norm": 1.265625, "learning_rate": 0.0004967645975333983, "loss": 6.4719, "mean_token_accuracy": 0.15569017976522445, "num_tokens": 14260047.0, "step": 5630 }, { "entropy": 6.428913116455078, "epoch": 0.6503173687247548, "grad_norm": 1.4375, "learning_rate": 0.0004967576211832548, "loss": 6.335, "mean_token_accuracy": 0.16324738264083863, "num_tokens": 14273478.0, "step": 5635 }, { "entropy": 6.456370687484741, "epoch": 0.6508944027697634, "grad_norm": 1.0546875, "learning_rate": 0.0004967506373744039, "loss": 6.401, "mean_token_accuracy": 0.15274422019720077, "num_tokens": 14286085.0, "step": 5640 }, { "entropy": 6.430538129806519, "epoch": 0.651471436814772, "grad_norm": 1.4296875, "learning_rate": 0.0004967436461070805, "loss": 6.3692, "mean_token_accuracy": 0.1592407152056694, "num_tokens": 14299472.0, "step": 5645 }, { "entropy": 6.490675067901611, "epoch": 0.6520484708597807, "grad_norm": 1.09375, "learning_rate": 0.0004967366473815196, "loss": 6.336, "mean_token_accuracy": 0.15632698833942413, "num_tokens": 14312624.0, "step": 5650 }, { "entropy": 6.445674705505371, "epoch": 0.6526255049047894, "grad_norm": 1.1328125, "learning_rate": 0.0004967296411979568, "loss": 6.3308, "mean_token_accuracy": 0.16287260502576828, "num_tokens": 14325418.0, "step": 5655 }, { "entropy": 6.4445984840393065, "epoch": 0.6532025389497981, "grad_norm": 1.5, "learning_rate": 0.0004967226275566275, "loss": 6.3672, "mean_token_accuracy": 0.1629082068800926, "num_tokens": 14337360.0, "step": 5660 }, { "entropy": 6.445386791229248, "epoch": 0.6537795729948067, "grad_norm": 1.1015625, "learning_rate": 0.000496715606457768, "loss": 6.3572, "mean_token_accuracy": 0.15481363832950593, "num_tokens": 14349119.0, "step": 5665 }, { "entropy": 6.4672932624816895, "epoch": 0.6543566070398154, "grad_norm": 1.203125, "learning_rate": 0.0004967085779016142, "loss": 6.3848, "mean_token_accuracy": 0.16024565547704697, "num_tokens": 14361760.0, "step": 5670 }, { "entropy": 6.423304557800293, "epoch": 0.654933641084824, "grad_norm": 1.1640625, "learning_rate": 0.0004967015418884022, "loss": 6.3657, "mean_token_accuracy": 0.15302406400442123, "num_tokens": 14374725.0, "step": 5675 }, { "entropy": 6.4012918949127195, "epoch": 0.6555106751298326, "grad_norm": 1.2734375, "learning_rate": 0.0004966944984183692, "loss": 6.3318, "mean_token_accuracy": 0.155929097533226, "num_tokens": 14387267.0, "step": 5680 }, { "entropy": 6.516444730758667, "epoch": 0.6560877091748413, "grad_norm": 1.1015625, "learning_rate": 0.0004966874474917518, "loss": 6.3887, "mean_token_accuracy": 0.156803160905838, "num_tokens": 14400531.0, "step": 5685 }, { "entropy": 6.489614677429199, "epoch": 0.65666474321985, "grad_norm": 1.53125, "learning_rate": 0.0004966803891087873, "loss": 6.4069, "mean_token_accuracy": 0.1479627177119255, "num_tokens": 14412507.0, "step": 5690 }, { "entropy": 6.422414636611938, "epoch": 0.6572417772648587, "grad_norm": 1.1484375, "learning_rate": 0.000496673323269713, "loss": 6.3767, "mean_token_accuracy": 0.1557417944073677, "num_tokens": 14424934.0, "step": 5695 }, { "entropy": 6.513529872894287, "epoch": 0.6578188113098673, "grad_norm": 1.1796875, "learning_rate": 0.0004966662499747666, "loss": 6.4852, "mean_token_accuracy": 0.14428578540682793, "num_tokens": 14438875.0, "step": 5700 }, { "entropy": 6.384660053253174, "epoch": 0.6583958453548759, "grad_norm": 1.09375, "learning_rate": 0.0004966591692241859, "loss": 6.3007, "mean_token_accuracy": 0.1601344585418701, "num_tokens": 14451089.0, "step": 5705 }, { "entropy": 6.498195934295654, "epoch": 0.6589728793998846, "grad_norm": 1.109375, "learning_rate": 0.0004966520810182092, "loss": 6.4322, "mean_token_accuracy": 0.15660066306591033, "num_tokens": 14463557.0, "step": 5710 }, { "entropy": 6.441149425506592, "epoch": 0.6595499134448932, "grad_norm": 1.1640625, "learning_rate": 0.0004966449853570749, "loss": 6.3287, "mean_token_accuracy": 0.15349343568086624, "num_tokens": 14475865.0, "step": 5715 }, { "entropy": 6.5019457817077635, "epoch": 0.6601269474899019, "grad_norm": 1.0234375, "learning_rate": 0.0004966378822410215, "loss": 6.4257, "mean_token_accuracy": 0.1521094784140587, "num_tokens": 14487534.0, "step": 5720 }, { "entropy": 6.501988220214844, "epoch": 0.6607039815349106, "grad_norm": 1.296875, "learning_rate": 0.0004966307716702881, "loss": 6.3778, "mean_token_accuracy": 0.15803005397319794, "num_tokens": 14500006.0, "step": 5725 }, { "entropy": 6.485233545303345, "epoch": 0.6612810155799193, "grad_norm": 1.1796875, "learning_rate": 0.0004966236536451138, "loss": 6.5159, "mean_token_accuracy": 0.1492684841156006, "num_tokens": 14512844.0, "step": 5730 }, { "entropy": 6.489582204818726, "epoch": 0.6618580496249279, "grad_norm": 1.1875, "learning_rate": 0.000496616528165738, "loss": 6.4387, "mean_token_accuracy": 0.14985530823469162, "num_tokens": 14525555.0, "step": 5735 }, { "entropy": 6.457883834838867, "epoch": 0.6624350836699365, "grad_norm": 1.171875, "learning_rate": 0.0004966093952324003, "loss": 6.4158, "mean_token_accuracy": 0.14997079819440842, "num_tokens": 14537861.0, "step": 5740 }, { "entropy": 6.472036552429199, "epoch": 0.6630121177149452, "grad_norm": 1.1328125, "learning_rate": 0.0004966022548453406, "loss": 6.3897, "mean_token_accuracy": 0.1547412559390068, "num_tokens": 14550116.0, "step": 5745 }, { "entropy": 6.530148077011108, "epoch": 0.6635891517599538, "grad_norm": 1.265625, "learning_rate": 0.0004965951070047993, "loss": 6.3645, "mean_token_accuracy": 0.1600572571158409, "num_tokens": 14561841.0, "step": 5750 }, { "entropy": 6.504292011260986, "epoch": 0.6641661858049625, "grad_norm": 1.359375, "learning_rate": 0.0004965879517110166, "loss": 6.4188, "mean_token_accuracy": 0.15461863577365875, "num_tokens": 14574889.0, "step": 5755 }, { "entropy": 6.3978352546691895, "epoch": 0.6647432198499712, "grad_norm": 1.4453125, "learning_rate": 0.0004965807889642333, "loss": 6.4055, "mean_token_accuracy": 0.16118682324886321, "num_tokens": 14587032.0, "step": 5760 }, { "entropy": 6.445254135131836, "epoch": 0.6653202538949798, "grad_norm": 1.2890625, "learning_rate": 0.00049657361876469, "loss": 6.3496, "mean_token_accuracy": 0.15695588439702987, "num_tokens": 14599654.0, "step": 5765 }, { "entropy": 6.441715860366822, "epoch": 0.6658972879399885, "grad_norm": 1.2265625, "learning_rate": 0.0004965664411126282, "loss": 6.2881, "mean_token_accuracy": 0.1609531193971634, "num_tokens": 14611740.0, "step": 5770 }, { "entropy": 6.444937467575073, "epoch": 0.6664743219849971, "grad_norm": 1.8046875, "learning_rate": 0.0004965592560082894, "loss": 6.3812, "mean_token_accuracy": 0.15895504653453826, "num_tokens": 14625038.0, "step": 5775 }, { "entropy": 6.482732677459717, "epoch": 0.6670513560300058, "grad_norm": 1.5625, "learning_rate": 0.0004965520634519149, "loss": 6.4483, "mean_token_accuracy": 0.1515585035085678, "num_tokens": 14638318.0, "step": 5780 }, { "entropy": 6.4918629169464115, "epoch": 0.6676283900750144, "grad_norm": 1.1015625, "learning_rate": 0.0004965448634437468, "loss": 6.4173, "mean_token_accuracy": 0.15017091631889343, "num_tokens": 14651519.0, "step": 5785 }, { "entropy": 6.548173141479492, "epoch": 0.668205424120023, "grad_norm": 1.2421875, "learning_rate": 0.0004965376559840272, "loss": 6.3733, "mean_token_accuracy": 0.15527796149253845, "num_tokens": 14662994.0, "step": 5790 }, { "entropy": 6.433021783828735, "epoch": 0.6687824581650318, "grad_norm": 1.1171875, "learning_rate": 0.0004965304410729986, "loss": 6.354, "mean_token_accuracy": 0.15886851251125336, "num_tokens": 14675488.0, "step": 5795 }, { "entropy": 6.427807283401489, "epoch": 0.6693594922100404, "grad_norm": 1.234375, "learning_rate": 0.0004965232187109037, "loss": 6.2822, "mean_token_accuracy": 0.1672770693898201, "num_tokens": 14688512.0, "step": 5800 }, { "entropy": 6.499064922332764, "epoch": 0.6699365262550491, "grad_norm": 1.3828125, "learning_rate": 0.0004965159888979854, "loss": 6.3532, "mean_token_accuracy": 0.15719753950834275, "num_tokens": 14700740.0, "step": 5805 }, { "entropy": 6.412437057495117, "epoch": 0.6705135603000577, "grad_norm": 1.5390625, "learning_rate": 0.0004965087516344869, "loss": 6.3985, "mean_token_accuracy": 0.1540493041276932, "num_tokens": 14713769.0, "step": 5810 }, { "entropy": 6.440626096725464, "epoch": 0.6710905943450663, "grad_norm": 1.2734375, "learning_rate": 0.0004965015069206515, "loss": 6.2844, "mean_token_accuracy": 0.16277436017990113, "num_tokens": 14725710.0, "step": 5815 }, { "entropy": 6.488617420196533, "epoch": 0.671667628390075, "grad_norm": 1.234375, "learning_rate": 0.000496494254756723, "loss": 6.2693, "mean_token_accuracy": 0.16651962399482728, "num_tokens": 14738504.0, "step": 5820 }, { "entropy": 6.411191701889038, "epoch": 0.6722446624350836, "grad_norm": 1.2265625, "learning_rate": 0.0004964869951429451, "loss": 6.3907, "mean_token_accuracy": 0.1528874784708023, "num_tokens": 14750344.0, "step": 5825 }, { "entropy": 6.4745879650115965, "epoch": 0.6728216964800924, "grad_norm": 1.046875, "learning_rate": 0.0004964797280795622, "loss": 6.4371, "mean_token_accuracy": 0.15475648939609526, "num_tokens": 14764316.0, "step": 5830 }, { "entropy": 6.491079187393188, "epoch": 0.673398730525101, "grad_norm": 1.140625, "learning_rate": 0.0004964724535668188, "loss": 6.3532, "mean_token_accuracy": 0.154931178689003, "num_tokens": 14776404.0, "step": 5835 }, { "entropy": 6.527394390106201, "epoch": 0.6739757645701097, "grad_norm": 1.1640625, "learning_rate": 0.0004964651716049593, "loss": 6.4032, "mean_token_accuracy": 0.15441878139972687, "num_tokens": 14788843.0, "step": 5840 }, { "entropy": 6.389228677749633, "epoch": 0.6745527986151183, "grad_norm": 1.3359375, "learning_rate": 0.0004964578821942288, "loss": 6.3468, "mean_token_accuracy": 0.15969842821359634, "num_tokens": 14802662.0, "step": 5845 }, { "entropy": 6.394847726821899, "epoch": 0.6751298326601269, "grad_norm": 1.09375, "learning_rate": 0.0004964505853348724, "loss": 6.397, "mean_token_accuracy": 0.14911102056503295, "num_tokens": 14814354.0, "step": 5850 }, { "entropy": 6.425918245315552, "epoch": 0.6757068667051356, "grad_norm": 1.359375, "learning_rate": 0.0004964432810271356, "loss": 6.2954, "mean_token_accuracy": 0.16615222096443177, "num_tokens": 14826404.0, "step": 5855 }, { "entropy": 6.446470594406128, "epoch": 0.6762839007501442, "grad_norm": 1.0546875, "learning_rate": 0.0004964359692712641, "loss": 6.366, "mean_token_accuracy": 0.15671302229166031, "num_tokens": 14840046.0, "step": 5860 }, { "entropy": 6.457760667800903, "epoch": 0.676860934795153, "grad_norm": 1.03125, "learning_rate": 0.0004964286500675037, "loss": 6.3953, "mean_token_accuracy": 0.1482774406671524, "num_tokens": 14853566.0, "step": 5865 }, { "entropy": 6.436824560165405, "epoch": 0.6774379688401616, "grad_norm": 1.2421875, "learning_rate": 0.0004964213234161007, "loss": 6.3278, "mean_token_accuracy": 0.15916989594697953, "num_tokens": 14866538.0, "step": 5870 }, { "entropy": 6.392537069320679, "epoch": 0.6780150028851702, "grad_norm": 1.2421875, "learning_rate": 0.0004964139893173014, "loss": 6.2944, "mean_token_accuracy": 0.16514576077461243, "num_tokens": 14879237.0, "step": 5875 }, { "entropy": 6.483046245574951, "epoch": 0.6785920369301789, "grad_norm": 1.2578125, "learning_rate": 0.0004964066477713525, "loss": 6.4018, "mean_token_accuracy": 0.15573488026857377, "num_tokens": 14891295.0, "step": 5880 }, { "entropy": 6.415683555603027, "epoch": 0.6791690709751875, "grad_norm": 1.203125, "learning_rate": 0.0004963992987785011, "loss": 6.3904, "mean_token_accuracy": 0.1575924351811409, "num_tokens": 14902927.0, "step": 5885 }, { "entropy": 6.421587514877319, "epoch": 0.6797461050201962, "grad_norm": 1.2109375, "learning_rate": 0.0004963919423389942, "loss": 6.375, "mean_token_accuracy": 0.15122182816267013, "num_tokens": 14915203.0, "step": 5890 }, { "entropy": 6.392851495742798, "epoch": 0.6803231390652048, "grad_norm": 1.125, "learning_rate": 0.0004963845784530794, "loss": 6.2337, "mean_token_accuracy": 0.16648308783769608, "num_tokens": 14927428.0, "step": 5895 }, { "entropy": 6.382313442230225, "epoch": 0.6809001731102136, "grad_norm": 1.1796875, "learning_rate": 0.000496377207121004, "loss": 6.3774, "mean_token_accuracy": 0.1617804765701294, "num_tokens": 14939979.0, "step": 5900 }, { "entropy": 6.505252695083618, "epoch": 0.6814772071552222, "grad_norm": 1.3828125, "learning_rate": 0.0004963698283430164, "loss": 6.3816, "mean_token_accuracy": 0.15156475305557252, "num_tokens": 14952292.0, "step": 5905 }, { "entropy": 6.482873964309692, "epoch": 0.6820542412002308, "grad_norm": 1.15625, "learning_rate": 0.0004963624421193646, "loss": 6.386, "mean_token_accuracy": 0.1532788097858429, "num_tokens": 14964942.0, "step": 5910 }, { "entropy": 6.450105810165406, "epoch": 0.6826312752452395, "grad_norm": 1.2734375, "learning_rate": 0.000496355048450297, "loss": 6.4974, "mean_token_accuracy": 0.14616498947143555, "num_tokens": 14979196.0, "step": 5915 }, { "entropy": 6.507519197463989, "epoch": 0.6832083092902481, "grad_norm": 1.1875, "learning_rate": 0.0004963476473360623, "loss": 6.3601, "mean_token_accuracy": 0.1571754828095436, "num_tokens": 14991162.0, "step": 5920 }, { "entropy": 6.466042995452881, "epoch": 0.6837853433352568, "grad_norm": 1.2109375, "learning_rate": 0.0004963402387769094, "loss": 6.3804, "mean_token_accuracy": 0.1588766470551491, "num_tokens": 15003207.0, "step": 5925 }, { "entropy": 6.41431040763855, "epoch": 0.6843623773802654, "grad_norm": 1.421875, "learning_rate": 0.0004963328227730876, "loss": 6.4254, "mean_token_accuracy": 0.14741162210702896, "num_tokens": 15016633.0, "step": 5930 }, { "entropy": 6.442387247085572, "epoch": 0.684939411425274, "grad_norm": 1.21875, "learning_rate": 0.0004963253993248461, "loss": 6.343, "mean_token_accuracy": 0.1599098488688469, "num_tokens": 15029256.0, "step": 5935 }, { "entropy": 6.425724887847901, "epoch": 0.6855164454702828, "grad_norm": 1.1328125, "learning_rate": 0.0004963179684324349, "loss": 6.3, "mean_token_accuracy": 0.15923123359680175, "num_tokens": 15041162.0, "step": 5940 }, { "entropy": 6.402348136901855, "epoch": 0.6860934795152914, "grad_norm": 1.15625, "learning_rate": 0.0004963105300961036, "loss": 6.3577, "mean_token_accuracy": 0.16127298772335052, "num_tokens": 15054122.0, "step": 5945 }, { "entropy": 6.403144645690918, "epoch": 0.6866705135603001, "grad_norm": 1.2109375, "learning_rate": 0.0004963030843161026, "loss": 6.3328, "mean_token_accuracy": 0.15635056793689728, "num_tokens": 15066123.0, "step": 5950 }, { "entropy": 6.3505641460418705, "epoch": 0.6872475476053087, "grad_norm": 1.2109375, "learning_rate": 0.0004962956310926823, "loss": 6.2803, "mean_token_accuracy": 0.16309783309698106, "num_tokens": 15078192.0, "step": 5955 }, { "entropy": 6.487194633483886, "epoch": 0.6878245816503173, "grad_norm": 1.265625, "learning_rate": 0.0004962881704260934, "loss": 6.3194, "mean_token_accuracy": 0.16090887039899826, "num_tokens": 15090227.0, "step": 5960 }, { "entropy": 6.460311222076416, "epoch": 0.688401615695326, "grad_norm": 1.2265625, "learning_rate": 0.0004962807023165868, "loss": 6.4389, "mean_token_accuracy": 0.159395045787096, "num_tokens": 15104093.0, "step": 5965 }, { "entropy": 6.396960067749023, "epoch": 0.6889786497403346, "grad_norm": 1.078125, "learning_rate": 0.0004962732267644138, "loss": 6.329, "mean_token_accuracy": 0.15944764763116837, "num_tokens": 15118064.0, "step": 5970 }, { "entropy": 6.463270425796509, "epoch": 0.6895556837853434, "grad_norm": 1.765625, "learning_rate": 0.0004962657437698254, "loss": 6.2442, "mean_token_accuracy": 0.1626880243420601, "num_tokens": 15131686.0, "step": 5975 }, { "entropy": 6.419650077819824, "epoch": 0.690132717830352, "grad_norm": 1.2421875, "learning_rate": 0.0004962582533330739, "loss": 6.4456, "mean_token_accuracy": 0.1501251846551895, "num_tokens": 15143920.0, "step": 5980 }, { "entropy": 6.49657621383667, "epoch": 0.6907097518753607, "grad_norm": 1.046875, "learning_rate": 0.0004962507554544109, "loss": 6.3803, "mean_token_accuracy": 0.15870121121406555, "num_tokens": 15156989.0, "step": 5985 }, { "entropy": 6.5632383823394775, "epoch": 0.6912867859203693, "grad_norm": 1.3828125, "learning_rate": 0.0004962432501340886, "loss": 6.4622, "mean_token_accuracy": 0.14517625272274018, "num_tokens": 15169068.0, "step": 5990 }, { "entropy": 6.417279434204102, "epoch": 0.6918638199653779, "grad_norm": 1.203125, "learning_rate": 0.0004962357373723596, "loss": 6.4305, "mean_token_accuracy": 0.1551764652132988, "num_tokens": 15182081.0, "step": 5995 }, { "entropy": 6.562622547149658, "epoch": 0.6924408540103866, "grad_norm": 1.4375, "learning_rate": 0.0004962282171694763, "loss": 6.4065, "mean_token_accuracy": 0.1580890581011772, "num_tokens": 15194474.0, "step": 6000 }, { "epoch": 0.6924408540103866, "eval_entropy": 6.400503651743963, "eval_loss": 6.432427883148193, "eval_mean_token_accuracy": 0.15697687899999432, "eval_num_tokens": 15194474.0, "eval_runtime": 22.6959, "eval_samples_per_second": 1239.697, "eval_steps_per_second": 154.962, "step": 6000 }, { "entropy": 6.498694944381714, "epoch": 0.6930178880553952, "grad_norm": 1.3125, "learning_rate": 0.0004962206895256919, "loss": 6.368, "mean_token_accuracy": 0.15929650962352754, "num_tokens": 15206371.0, "step": 6005 }, { "entropy": 6.367174577713013, "epoch": 0.693594922100404, "grad_norm": 1.09375, "learning_rate": 0.0004962131544412595, "loss": 6.3868, "mean_token_accuracy": 0.15386435389518738, "num_tokens": 15218913.0, "step": 6010 }, { "entropy": 6.497800350189209, "epoch": 0.6941719561454126, "grad_norm": 1.0859375, "learning_rate": 0.0004962056119164325, "loss": 6.3709, "mean_token_accuracy": 0.16197654753923416, "num_tokens": 15231647.0, "step": 6015 }, { "entropy": 6.4635841846466064, "epoch": 0.6947489901904212, "grad_norm": 1.09375, "learning_rate": 0.0004961980619514646, "loss": 6.3708, "mean_token_accuracy": 0.15795217901468278, "num_tokens": 15243764.0, "step": 6020 }, { "entropy": 6.443425607681275, "epoch": 0.6953260242354299, "grad_norm": 1.5, "learning_rate": 0.0004961905045466098, "loss": 6.4417, "mean_token_accuracy": 0.14838726967573165, "num_tokens": 15256165.0, "step": 6025 }, { "entropy": 6.429970169067383, "epoch": 0.6959030582804385, "grad_norm": 1.453125, "learning_rate": 0.0004961829397021222, "loss": 6.29, "mean_token_accuracy": 0.16175810992717743, "num_tokens": 15269169.0, "step": 6030 }, { "entropy": 6.467025279998779, "epoch": 0.6964800923254472, "grad_norm": 1.234375, "learning_rate": 0.0004961753674182564, "loss": 6.349, "mean_token_accuracy": 0.1544795885682106, "num_tokens": 15281530.0, "step": 6035 }, { "entropy": 6.419221019744873, "epoch": 0.6970571263704558, "grad_norm": 1.5546875, "learning_rate": 0.0004961677876952669, "loss": 6.3357, "mean_token_accuracy": 0.15590357780456543, "num_tokens": 15295578.0, "step": 6040 }, { "entropy": 6.406968784332276, "epoch": 0.6976341604154646, "grad_norm": 1.2109375, "learning_rate": 0.0004961602005334087, "loss": 6.397, "mean_token_accuracy": 0.15791086107492447, "num_tokens": 15308258.0, "step": 6045 }, { "entropy": 6.478301000595093, "epoch": 0.6982111944604732, "grad_norm": 1.15625, "learning_rate": 0.000496152605932937, "loss": 6.4014, "mean_token_accuracy": 0.15565335899591445, "num_tokens": 15320370.0, "step": 6050 }, { "entropy": 6.512187814712524, "epoch": 0.6987882285054818, "grad_norm": 1.2421875, "learning_rate": 0.0004961450038941074, "loss": 6.4014, "mean_token_accuracy": 0.1576465040445328, "num_tokens": 15332350.0, "step": 6055 }, { "entropy": 6.39268012046814, "epoch": 0.6993652625504905, "grad_norm": 1.75, "learning_rate": 0.0004961373944171754, "loss": 6.3002, "mean_token_accuracy": 0.16454465687274933, "num_tokens": 15343424.0, "step": 6060 }, { "entropy": 6.427528715133667, "epoch": 0.6999422965954991, "grad_norm": 1.234375, "learning_rate": 0.0004961297775023968, "loss": 6.3385, "mean_token_accuracy": 0.1592035174369812, "num_tokens": 15356126.0, "step": 6065 }, { "entropy": 6.345870637893677, "epoch": 0.7005193306405078, "grad_norm": 1.2109375, "learning_rate": 0.000496122153150028, "loss": 6.2546, "mean_token_accuracy": 0.16224194318056107, "num_tokens": 15369253.0, "step": 6070 }, { "entropy": 6.557456541061401, "epoch": 0.7010963646855164, "grad_norm": 1.1640625, "learning_rate": 0.0004961145213603255, "loss": 6.4026, "mean_token_accuracy": 0.152187579870224, "num_tokens": 15382679.0, "step": 6075 }, { "entropy": 6.414884233474732, "epoch": 0.7016733987305251, "grad_norm": 1.484375, "learning_rate": 0.000496106882133546, "loss": 6.3941, "mean_token_accuracy": 0.15569975972175598, "num_tokens": 15396052.0, "step": 6080 }, { "entropy": 6.4202300071716305, "epoch": 0.7022504327755338, "grad_norm": 1.140625, "learning_rate": 0.0004960992354699463, "loss": 6.444, "mean_token_accuracy": 0.15025331526994706, "num_tokens": 15409249.0, "step": 6085 }, { "entropy": 6.48999605178833, "epoch": 0.7028274668205424, "grad_norm": 1.1015625, "learning_rate": 0.0004960915813697836, "loss": 6.3182, "mean_token_accuracy": 0.15329759567975998, "num_tokens": 15421060.0, "step": 6090 }, { "entropy": 6.440291547775269, "epoch": 0.7034045008655511, "grad_norm": 1.03125, "learning_rate": 0.0004960839198333154, "loss": 6.3987, "mean_token_accuracy": 0.15348696261644362, "num_tokens": 15433083.0, "step": 6095 }, { "entropy": 6.496385335922241, "epoch": 0.7039815349105597, "grad_norm": 1.3984375, "learning_rate": 0.0004960762508607994, "loss": 6.2319, "mean_token_accuracy": 0.16515322625637055, "num_tokens": 15446664.0, "step": 6100 }, { "entropy": 6.437723684310913, "epoch": 0.7045585689555683, "grad_norm": 1.2109375, "learning_rate": 0.0004960685744524934, "loss": 6.3833, "mean_token_accuracy": 0.15098819732666016, "num_tokens": 15458609.0, "step": 6105 }, { "entropy": 6.418120431900024, "epoch": 0.705135603000577, "grad_norm": 1.0859375, "learning_rate": 0.0004960608906086558, "loss": 6.2931, "mean_token_accuracy": 0.15668573081493378, "num_tokens": 15470091.0, "step": 6110 }, { "entropy": 6.441114664077759, "epoch": 0.7057126370455857, "grad_norm": 1.234375, "learning_rate": 0.000496053199329545, "loss": 6.3913, "mean_token_accuracy": 0.15550165474414826, "num_tokens": 15483557.0, "step": 6115 }, { "entropy": 6.462738084793091, "epoch": 0.7062896710905944, "grad_norm": 1.1015625, "learning_rate": 0.0004960455006154196, "loss": 6.3639, "mean_token_accuracy": 0.15281105488538743, "num_tokens": 15497437.0, "step": 6120 }, { "entropy": 6.461950254440308, "epoch": 0.706866705135603, "grad_norm": 1.296875, "learning_rate": 0.0004960377944665386, "loss": 6.3832, "mean_token_accuracy": 0.15458154678344727, "num_tokens": 15509942.0, "step": 6125 }, { "entropy": 6.415175914764404, "epoch": 0.7074437391806117, "grad_norm": 1.53125, "learning_rate": 0.0004960300808831611, "loss": 6.3258, "mean_token_accuracy": 0.1606331631541252, "num_tokens": 15522866.0, "step": 6130 }, { "entropy": 6.437211227416992, "epoch": 0.7080207732256203, "grad_norm": 1.4140625, "learning_rate": 0.0004960223598655467, "loss": 6.3391, "mean_token_accuracy": 0.15498406440019608, "num_tokens": 15534731.0, "step": 6135 }, { "entropy": 6.390599346160888, "epoch": 0.7085978072706289, "grad_norm": 1.2734375, "learning_rate": 0.000496014631413955, "loss": 6.3549, "mean_token_accuracy": 0.15641144812107086, "num_tokens": 15546401.0, "step": 6140 }, { "entropy": 6.464565753936768, "epoch": 0.7091748413156376, "grad_norm": 1.1328125, "learning_rate": 0.0004960068955286459, "loss": 6.3453, "mean_token_accuracy": 0.1545490711927414, "num_tokens": 15559532.0, "step": 6145 }, { "entropy": 6.450887155532837, "epoch": 0.7097518753606463, "grad_norm": 1.125, "learning_rate": 0.0004959991522098797, "loss": 6.3283, "mean_token_accuracy": 0.1544230192899704, "num_tokens": 15572426.0, "step": 6150 }, { "entropy": 6.5202630996704105, "epoch": 0.710328909405655, "grad_norm": 1.3046875, "learning_rate": 0.0004959914014579168, "loss": 6.3851, "mean_token_accuracy": 0.15095667839050292, "num_tokens": 15584422.0, "step": 6155 }, { "entropy": 6.4888464450836185, "epoch": 0.7109059434506636, "grad_norm": 1.34375, "learning_rate": 0.0004959836432730178, "loss": 6.3886, "mean_token_accuracy": 0.1545424059033394, "num_tokens": 15595538.0, "step": 6160 }, { "entropy": 6.371583795547485, "epoch": 0.7114829774956722, "grad_norm": 1.21875, "learning_rate": 0.0004959758776554438, "loss": 6.3184, "mean_token_accuracy": 0.15887101888656616, "num_tokens": 15608315.0, "step": 6165 }, { "entropy": 6.514468574523926, "epoch": 0.7120600115406809, "grad_norm": 1.421875, "learning_rate": 0.000495968104605456, "loss": 6.4199, "mean_token_accuracy": 0.15411719381809236, "num_tokens": 15620181.0, "step": 6170 }, { "entropy": 6.394854784011841, "epoch": 0.7126370455856895, "grad_norm": 1.359375, "learning_rate": 0.0004959603241233157, "loss": 6.2669, "mean_token_accuracy": 0.16061466783285142, "num_tokens": 15632100.0, "step": 6175 }, { "entropy": 6.404596328735352, "epoch": 0.7132140796306982, "grad_norm": 1.0625, "learning_rate": 0.0004959525362092846, "loss": 6.2783, "mean_token_accuracy": 0.1624158054590225, "num_tokens": 15644185.0, "step": 6180 }, { "entropy": 6.3875651359558105, "epoch": 0.7137911136757069, "grad_norm": 1.3828125, "learning_rate": 0.0004959447408636247, "loss": 6.3236, "mean_token_accuracy": 0.16416954696178437, "num_tokens": 15657761.0, "step": 6185 }, { "entropy": 6.419309377670288, "epoch": 0.7143681477207156, "grad_norm": 1.1015625, "learning_rate": 0.0004959369380865983, "loss": 6.3595, "mean_token_accuracy": 0.15183151364326478, "num_tokens": 15671135.0, "step": 6190 }, { "entropy": 6.441372919082641, "epoch": 0.7149451817657242, "grad_norm": 1.5625, "learning_rate": 0.0004959291278784676, "loss": 6.3455, "mean_token_accuracy": 0.15111906975507736, "num_tokens": 15683286.0, "step": 6195 }, { "entropy": 6.3563837051391605, "epoch": 0.7155222158107328, "grad_norm": 1.1875, "learning_rate": 0.0004959213102394954, "loss": 6.2707, "mean_token_accuracy": 0.167560413479805, "num_tokens": 15697535.0, "step": 6200 }, { "entropy": 6.3913243293762205, "epoch": 0.7160992498557415, "grad_norm": 1.328125, "learning_rate": 0.0004959134851699449, "loss": 6.3598, "mean_token_accuracy": 0.15648961514234544, "num_tokens": 15708748.0, "step": 6205 }, { "entropy": 6.477129936218262, "epoch": 0.7166762839007501, "grad_norm": 1.265625, "learning_rate": 0.0004959056526700788, "loss": 6.3456, "mean_token_accuracy": 0.15493126660585405, "num_tokens": 15721720.0, "step": 6210 }, { "entropy": 6.409880685806274, "epoch": 0.7172533179457588, "grad_norm": 1.4921875, "learning_rate": 0.0004958978127401609, "loss": 6.2937, "mean_token_accuracy": 0.15915343463420867, "num_tokens": 15734854.0, "step": 6215 }, { "entropy": 6.413718938827515, "epoch": 0.7178303519907675, "grad_norm": 1.4453125, "learning_rate": 0.0004958899653804548, "loss": 6.3539, "mean_token_accuracy": 0.1601460188627243, "num_tokens": 15747575.0, "step": 6220 }, { "entropy": 6.381495141983033, "epoch": 0.7184073860357761, "grad_norm": 1.6796875, "learning_rate": 0.0004958821105912246, "loss": 6.3453, "mean_token_accuracy": 0.16180343478918074, "num_tokens": 15760917.0, "step": 6225 }, { "entropy": 6.55801100730896, "epoch": 0.7189844200807848, "grad_norm": 1.2265625, "learning_rate": 0.000495874248372734, "loss": 6.4266, "mean_token_accuracy": 0.14924235120415688, "num_tokens": 15774045.0, "step": 6230 }, { "entropy": 6.491186237335205, "epoch": 0.7195614541257934, "grad_norm": 1.3359375, "learning_rate": 0.000495866378725248, "loss": 6.3379, "mean_token_accuracy": 0.15854604691267013, "num_tokens": 15786006.0, "step": 6235 }, { "entropy": 6.407785272598266, "epoch": 0.7201384881708021, "grad_norm": 1.265625, "learning_rate": 0.000495858501649031, "loss": 6.3539, "mean_token_accuracy": 0.15561899542808533, "num_tokens": 15798078.0, "step": 6240 }, { "entropy": 6.3833420753479, "epoch": 0.7207155222158107, "grad_norm": 1.2421875, "learning_rate": 0.000495850617144348, "loss": 6.3406, "mean_token_accuracy": 0.15743837952613832, "num_tokens": 15810281.0, "step": 6245 }, { "entropy": 6.432937860488892, "epoch": 0.7212925562608193, "grad_norm": 1.15625, "learning_rate": 0.0004958427252114643, "loss": 6.4155, "mean_token_accuracy": 0.1525063246488571, "num_tokens": 15822593.0, "step": 6250 }, { "entropy": 6.489366436004639, "epoch": 0.7218695903058281, "grad_norm": 1.078125, "learning_rate": 0.000495834825850645, "loss": 6.3534, "mean_token_accuracy": 0.15766695141792297, "num_tokens": 15835181.0, "step": 6255 }, { "entropy": 6.476584815979004, "epoch": 0.7224466243508367, "grad_norm": 1.1015625, "learning_rate": 0.0004958269190621562, "loss": 6.3561, "mean_token_accuracy": 0.1545557916164398, "num_tokens": 15847679.0, "step": 6260 }, { "entropy": 6.45306282043457, "epoch": 0.7230236583958454, "grad_norm": 1.265625, "learning_rate": 0.0004958190048462637, "loss": 6.3914, "mean_token_accuracy": 0.15713143199682236, "num_tokens": 15860209.0, "step": 6265 }, { "entropy": 6.485035228729248, "epoch": 0.723600692440854, "grad_norm": 1.3046875, "learning_rate": 0.0004958110832032336, "loss": 6.3716, "mean_token_accuracy": 0.1563394472002983, "num_tokens": 15873165.0, "step": 6270 }, { "entropy": 6.390137529373169, "epoch": 0.7241777264858626, "grad_norm": 1.0390625, "learning_rate": 0.0004958031541333322, "loss": 6.3932, "mean_token_accuracy": 0.15398206412792206, "num_tokens": 15885201.0, "step": 6275 }, { "entropy": 6.590787267684936, "epoch": 0.7247547605308713, "grad_norm": 1.4375, "learning_rate": 0.0004957952176368267, "loss": 6.4638, "mean_token_accuracy": 0.1497330904006958, "num_tokens": 15899071.0, "step": 6280 }, { "entropy": 6.381853342056274, "epoch": 0.7253317945758799, "grad_norm": 1.1015625, "learning_rate": 0.0004957872737139836, "loss": 6.3386, "mean_token_accuracy": 0.15825416520237923, "num_tokens": 15912274.0, "step": 6285 }, { "entropy": 6.435012531280518, "epoch": 0.7259088286208887, "grad_norm": 1.328125, "learning_rate": 0.0004957793223650702, "loss": 6.3326, "mean_token_accuracy": 0.16138885617256166, "num_tokens": 15925302.0, "step": 6290 }, { "entropy": 6.3799999237060545, "epoch": 0.7264858626658973, "grad_norm": 1.3828125, "learning_rate": 0.000495771363590354, "loss": 6.392, "mean_token_accuracy": 0.1516269102692604, "num_tokens": 15938226.0, "step": 6295 }, { "entropy": 6.394499444961548, "epoch": 0.727062896710906, "grad_norm": 1.2578125, "learning_rate": 0.0004957633973901027, "loss": 6.384, "mean_token_accuracy": 0.15402197688817978, "num_tokens": 15951136.0, "step": 6300 }, { "entropy": 6.564555644989014, "epoch": 0.7276399307559146, "grad_norm": 1.2734375, "learning_rate": 0.0004957554237645841, "loss": 6.3203, "mean_token_accuracy": 0.15522871762514115, "num_tokens": 15962820.0, "step": 6305 }, { "entropy": 6.393157958984375, "epoch": 0.7282169648009232, "grad_norm": 1.1875, "learning_rate": 0.0004957474427140665, "loss": 6.3002, "mean_token_accuracy": 0.1554463192820549, "num_tokens": 15974871.0, "step": 6310 }, { "entropy": 6.330068969726563, "epoch": 0.7287939988459319, "grad_norm": 1.203125, "learning_rate": 0.0004957394542388182, "loss": 6.2902, "mean_token_accuracy": 0.1576317049562931, "num_tokens": 15986916.0, "step": 6315 }, { "entropy": 6.503025722503662, "epoch": 0.7293710328909405, "grad_norm": 1.328125, "learning_rate": 0.0004957314583391082, "loss": 6.4285, "mean_token_accuracy": 0.1535441353917122, "num_tokens": 15999735.0, "step": 6320 }, { "entropy": 6.462880992889405, "epoch": 0.7299480669359493, "grad_norm": 1.2265625, "learning_rate": 0.0004957234550152052, "loss": 6.3256, "mean_token_accuracy": 0.15937893241643905, "num_tokens": 16013137.0, "step": 6325 }, { "entropy": 6.423413181304932, "epoch": 0.7305251009809579, "grad_norm": 1.328125, "learning_rate": 0.0004957154442673784, "loss": 6.3429, "mean_token_accuracy": 0.15815951824188232, "num_tokens": 16026750.0, "step": 6330 }, { "entropy": 6.467150354385376, "epoch": 0.7311021350259665, "grad_norm": 1.1953125, "learning_rate": 0.0004957074260958972, "loss": 6.44, "mean_token_accuracy": 0.1503904193639755, "num_tokens": 16039028.0, "step": 6335 }, { "entropy": 6.422294855117798, "epoch": 0.7316791690709752, "grad_norm": 1.1015625, "learning_rate": 0.0004956994005010315, "loss": 6.3013, "mean_token_accuracy": 0.16040119528770447, "num_tokens": 16051349.0, "step": 6340 }, { "entropy": 6.459820508956909, "epoch": 0.7322562031159838, "grad_norm": 1.2109375, "learning_rate": 0.000495691367483051, "loss": 6.3379, "mean_token_accuracy": 0.15461637526750566, "num_tokens": 16064015.0, "step": 6345 }, { "entropy": 6.490715360641479, "epoch": 0.7328332371609925, "grad_norm": 1.203125, "learning_rate": 0.0004956833270422259, "loss": 6.3473, "mean_token_accuracy": 0.15606531947851182, "num_tokens": 16075571.0, "step": 6350 }, { "entropy": 6.381386137008667, "epoch": 0.7334102712060011, "grad_norm": 1.296875, "learning_rate": 0.0004956752791788269, "loss": 6.365, "mean_token_accuracy": 0.16088762283325195, "num_tokens": 16088176.0, "step": 6355 }, { "entropy": 6.450045108795166, "epoch": 0.7339873052510099, "grad_norm": 1.1328125, "learning_rate": 0.0004956672238931244, "loss": 6.3975, "mean_token_accuracy": 0.15093077719211578, "num_tokens": 16099933.0, "step": 6360 }, { "entropy": 6.377976322174073, "epoch": 0.7345643392960185, "grad_norm": 1.125, "learning_rate": 0.0004956591611853894, "loss": 6.2235, "mean_token_accuracy": 0.16211253106594087, "num_tokens": 16113200.0, "step": 6365 }, { "entropy": 6.424292087554932, "epoch": 0.7351413733410271, "grad_norm": 1.28125, "learning_rate": 0.0004956510910558931, "loss": 6.3801, "mean_token_accuracy": 0.16113436222076416, "num_tokens": 16125532.0, "step": 6370 }, { "entropy": 6.452923822402954, "epoch": 0.7357184073860358, "grad_norm": 1.3046875, "learning_rate": 0.0004956430135049071, "loss": 6.3211, "mean_token_accuracy": 0.15369930267333984, "num_tokens": 16137197.0, "step": 6375 }, { "entropy": 6.468174600601197, "epoch": 0.7362954414310444, "grad_norm": 1.3828125, "learning_rate": 0.0004956349285327028, "loss": 6.387, "mean_token_accuracy": 0.16085880845785142, "num_tokens": 16150481.0, "step": 6380 }, { "entropy": 6.512467575073242, "epoch": 0.7368724754760531, "grad_norm": 1.078125, "learning_rate": 0.0004956268361395523, "loss": 6.3866, "mean_token_accuracy": 0.16043339669704437, "num_tokens": 16162395.0, "step": 6385 }, { "entropy": 6.474280881881714, "epoch": 0.7374495095210617, "grad_norm": 1.390625, "learning_rate": 0.0004956187363257278, "loss": 6.3575, "mean_token_accuracy": 0.15275195389986038, "num_tokens": 16174550.0, "step": 6390 }, { "entropy": 6.465876197814941, "epoch": 0.7380265435660704, "grad_norm": 1.890625, "learning_rate": 0.0004956106290915017, "loss": 6.3673, "mean_token_accuracy": 0.1536040261387825, "num_tokens": 16187571.0, "step": 6395 }, { "entropy": 6.422832822799682, "epoch": 0.7386035776110791, "grad_norm": 1.0546875, "learning_rate": 0.0004956025144371467, "loss": 6.3985, "mean_token_accuracy": 0.15287847071886063, "num_tokens": 16199684.0, "step": 6400 }, { "entropy": 6.385442638397217, "epoch": 0.7391806116560877, "grad_norm": 1.3984375, "learning_rate": 0.0004955943923629356, "loss": 6.3548, "mean_token_accuracy": 0.1548342451453209, "num_tokens": 16211935.0, "step": 6405 }, { "entropy": 6.44033145904541, "epoch": 0.7397576457010964, "grad_norm": 1.3125, "learning_rate": 0.0004955862628691417, "loss": 6.3459, "mean_token_accuracy": 0.1508117288351059, "num_tokens": 16224346.0, "step": 6410 }, { "entropy": 6.487747716903686, "epoch": 0.740334679746105, "grad_norm": 1.5859375, "learning_rate": 0.0004955781259560386, "loss": 6.3897, "mean_token_accuracy": 0.14921767711639405, "num_tokens": 16238137.0, "step": 6415 }, { "entropy": 6.391067790985107, "epoch": 0.7409117137911136, "grad_norm": 1.1875, "learning_rate": 0.0004955699816238995, "loss": 6.3537, "mean_token_accuracy": 0.15329435765743255, "num_tokens": 16250777.0, "step": 6420 }, { "entropy": 6.545683860778809, "epoch": 0.7414887478361223, "grad_norm": 1.15625, "learning_rate": 0.0004955618298729988, "loss": 6.365, "mean_token_accuracy": 0.15731996297836304, "num_tokens": 16262440.0, "step": 6425 }, { "entropy": 6.4182055473327635, "epoch": 0.742065781881131, "grad_norm": 1.03125, "learning_rate": 0.0004955536707036105, "loss": 6.3149, "mean_token_accuracy": 0.15865564495325088, "num_tokens": 16275227.0, "step": 6430 }, { "entropy": 6.390710258483887, "epoch": 0.7426428159261397, "grad_norm": 1.234375, "learning_rate": 0.000495545504116009, "loss": 6.3697, "mean_token_accuracy": 0.16148028522729874, "num_tokens": 16287246.0, "step": 6435 }, { "entropy": 6.4247143268585205, "epoch": 0.7432198499711483, "grad_norm": 1.2734375, "learning_rate": 0.0004955373301104691, "loss": 6.25, "mean_token_accuracy": 0.16333142668008804, "num_tokens": 16298779.0, "step": 6440 }, { "entropy": 6.32188081741333, "epoch": 0.743796884016157, "grad_norm": 1.1640625, "learning_rate": 0.0004955291486872657, "loss": 6.2682, "mean_token_accuracy": 0.16090297400951387, "num_tokens": 16310965.0, "step": 6445 }, { "entropy": 6.425542116165161, "epoch": 0.7443739180611656, "grad_norm": 1.265625, "learning_rate": 0.0004955209598466738, "loss": 6.2903, "mean_token_accuracy": 0.15480603873729706, "num_tokens": 16324025.0, "step": 6450 }, { "entropy": 6.422914981842041, "epoch": 0.7449509521061742, "grad_norm": 1.6328125, "learning_rate": 0.000495512763588969, "loss": 6.3311, "mean_token_accuracy": 0.15080109387636184, "num_tokens": 16336152.0, "step": 6455 }, { "entropy": 6.359565687179566, "epoch": 0.7455279861511829, "grad_norm": 1.359375, "learning_rate": 0.0004955045599144269, "loss": 6.3426, "mean_token_accuracy": 0.15447487831115722, "num_tokens": 16349118.0, "step": 6460 }, { "entropy": 6.373418140411377, "epoch": 0.7461050201961916, "grad_norm": 1.4765625, "learning_rate": 0.0004954963488233235, "loss": 6.3055, "mean_token_accuracy": 0.15982365757226943, "num_tokens": 16362986.0, "step": 6465 }, { "entropy": 6.465278196334839, "epoch": 0.7466820542412003, "grad_norm": 1.21875, "learning_rate": 0.000495488130315935, "loss": 6.4488, "mean_token_accuracy": 0.14422052949666977, "num_tokens": 16376384.0, "step": 6470 }, { "entropy": 6.436511468887329, "epoch": 0.7472590882862089, "grad_norm": 1.375, "learning_rate": 0.0004954799043925377, "loss": 6.2663, "mean_token_accuracy": 0.15960704237222673, "num_tokens": 16388137.0, "step": 6475 }, { "entropy": 6.442381572723389, "epoch": 0.7478361223312175, "grad_norm": 1.1328125, "learning_rate": 0.0004954716710534082, "loss": 6.3868, "mean_token_accuracy": 0.15023239105939865, "num_tokens": 16400037.0, "step": 6480 }, { "entropy": 6.4429028034210205, "epoch": 0.7484131563762262, "grad_norm": 1.4140625, "learning_rate": 0.0004954634302988237, "loss": 6.3091, "mean_token_accuracy": 0.15836434438824654, "num_tokens": 16412065.0, "step": 6485 }, { "entropy": 6.423034954071045, "epoch": 0.7489901904212348, "grad_norm": 1.2734375, "learning_rate": 0.0004954551821290612, "loss": 6.3568, "mean_token_accuracy": 0.15571586638689042, "num_tokens": 16424345.0, "step": 6490 }, { "entropy": 6.433213615417481, "epoch": 0.7495672244662435, "grad_norm": 1.46875, "learning_rate": 0.0004954469265443981, "loss": 6.4097, "mean_token_accuracy": 0.1566193573176861, "num_tokens": 16436423.0, "step": 6495 }, { "entropy": 6.387920618057251, "epoch": 0.7501442585112522, "grad_norm": 1.140625, "learning_rate": 0.0004954386635451123, "loss": 6.3036, "mean_token_accuracy": 0.15891094803810119, "num_tokens": 16449496.0, "step": 6500 }, { "entropy": 6.435271167755127, "epoch": 0.7507212925562609, "grad_norm": 1.1640625, "learning_rate": 0.0004954303931314814, "loss": 6.3454, "mean_token_accuracy": 0.15708634853363038, "num_tokens": 16462193.0, "step": 6505 }, { "entropy": 6.427425193786621, "epoch": 0.7512983266012695, "grad_norm": 1.140625, "learning_rate": 0.0004954221153037837, "loss": 6.3555, "mean_token_accuracy": 0.15513187199831008, "num_tokens": 16474470.0, "step": 6510 }, { "entropy": 6.497897005081176, "epoch": 0.7518753606462781, "grad_norm": 1.1484375, "learning_rate": 0.0004954138300622978, "loss": 6.3487, "mean_token_accuracy": 0.15803459137678147, "num_tokens": 16487231.0, "step": 6515 }, { "entropy": 6.431686544418335, "epoch": 0.7524523946912868, "grad_norm": 1.2578125, "learning_rate": 0.000495405537407302, "loss": 6.4133, "mean_token_accuracy": 0.1513650543987751, "num_tokens": 16500822.0, "step": 6520 }, { "entropy": 6.419403791427612, "epoch": 0.7530294287362954, "grad_norm": 1.1875, "learning_rate": 0.0004953972373390755, "loss": 6.3641, "mean_token_accuracy": 0.1541321247816086, "num_tokens": 16514529.0, "step": 6525 }, { "entropy": 6.402029132843017, "epoch": 0.753606462781304, "grad_norm": 1.171875, "learning_rate": 0.0004953889298578975, "loss": 6.3215, "mean_token_accuracy": 0.151659794151783, "num_tokens": 16527281.0, "step": 6530 }, { "entropy": 6.446967220306396, "epoch": 0.7541834968263128, "grad_norm": 1.234375, "learning_rate": 0.0004953806149640473, "loss": 6.3285, "mean_token_accuracy": 0.15949189513921738, "num_tokens": 16539763.0, "step": 6535 }, { "entropy": 6.376011753082276, "epoch": 0.7547605308713214, "grad_norm": 1.0859375, "learning_rate": 0.0004953722926578045, "loss": 6.3066, "mean_token_accuracy": 0.16653935611248016, "num_tokens": 16552197.0, "step": 6540 }, { "entropy": 6.45217113494873, "epoch": 0.7553375649163301, "grad_norm": 1.0625, "learning_rate": 0.0004953639629394492, "loss": 6.3595, "mean_token_accuracy": 0.15816257297992706, "num_tokens": 16563988.0, "step": 6545 }, { "entropy": 6.346515941619873, "epoch": 0.7559145989613387, "grad_norm": 1.0859375, "learning_rate": 0.0004953556258092613, "loss": 6.354, "mean_token_accuracy": 0.152614526450634, "num_tokens": 16576982.0, "step": 6550 }, { "entropy": 6.500877237319946, "epoch": 0.7564916330063474, "grad_norm": 1.0859375, "learning_rate": 0.0004953472812675216, "loss": 6.3918, "mean_token_accuracy": 0.15306739658117294, "num_tokens": 16590268.0, "step": 6555 }, { "entropy": 6.4272643566131595, "epoch": 0.757068667051356, "grad_norm": 1.1171875, "learning_rate": 0.0004953389293145104, "loss": 6.2367, "mean_token_accuracy": 0.16499679684638976, "num_tokens": 16602599.0, "step": 6560 }, { "entropy": 6.439320850372314, "epoch": 0.7576457010963646, "grad_norm": 1.1875, "learning_rate": 0.0004953305699505088, "loss": 6.336, "mean_token_accuracy": 0.15458009764552116, "num_tokens": 16614278.0, "step": 6565 }, { "entropy": 6.435625171661377, "epoch": 0.7582227351413734, "grad_norm": 1.234375, "learning_rate": 0.0004953222031757979, "loss": 6.3623, "mean_token_accuracy": 0.15230781883001326, "num_tokens": 16626810.0, "step": 6570 }, { "entropy": 6.333204841613769, "epoch": 0.758799769186382, "grad_norm": 1.15625, "learning_rate": 0.0004953138289906592, "loss": 6.2958, "mean_token_accuracy": 0.15872435569763182, "num_tokens": 16639134.0, "step": 6575 }, { "entropy": 6.464828538894653, "epoch": 0.7593768032313907, "grad_norm": 1.5390625, "learning_rate": 0.0004953054473953742, "loss": 6.3366, "mean_token_accuracy": 0.15388649702072144, "num_tokens": 16652724.0, "step": 6580 }, { "entropy": 6.3356160640716555, "epoch": 0.7599538372763993, "grad_norm": 1.0546875, "learning_rate": 0.0004952970583902251, "loss": 6.3039, "mean_token_accuracy": 0.15653215497732162, "num_tokens": 16666045.0, "step": 6585 }, { "entropy": 6.404564905166626, "epoch": 0.760530871321408, "grad_norm": 1.234375, "learning_rate": 0.0004952886619754937, "loss": 6.4156, "mean_token_accuracy": 0.14934709966182708, "num_tokens": 16678422.0, "step": 6590 }, { "entropy": 6.406267356872559, "epoch": 0.7611079053664166, "grad_norm": 1.21875, "learning_rate": 0.0004952802581514625, "loss": 6.3248, "mean_token_accuracy": 0.15902172029018402, "num_tokens": 16690243.0, "step": 6595 }, { "entropy": 6.393883800506591, "epoch": 0.7616849394114252, "grad_norm": 1.1015625, "learning_rate": 0.0004952718469184144, "loss": 6.303, "mean_token_accuracy": 0.16410621106624604, "num_tokens": 16702418.0, "step": 6600 }, { "entropy": 6.468479824066162, "epoch": 0.762261973456434, "grad_norm": 1.15625, "learning_rate": 0.0004952634282766322, "loss": 6.3958, "mean_token_accuracy": 0.15294192880392074, "num_tokens": 16713974.0, "step": 6605 }, { "entropy": 6.432626152038575, "epoch": 0.7628390075014426, "grad_norm": 1.578125, "learning_rate": 0.0004952550022263988, "loss": 6.2699, "mean_token_accuracy": 0.1547722727060318, "num_tokens": 16726518.0, "step": 6610 }, { "entropy": 6.352759170532226, "epoch": 0.7634160415464513, "grad_norm": 1.3046875, "learning_rate": 0.0004952465687679979, "loss": 6.3028, "mean_token_accuracy": 0.1620583415031433, "num_tokens": 16738701.0, "step": 6615 }, { "entropy": 6.434079885482788, "epoch": 0.7639930755914599, "grad_norm": 1.3984375, "learning_rate": 0.000495238127901713, "loss": 6.3445, "mean_token_accuracy": 0.14946923404932022, "num_tokens": 16751251.0, "step": 6620 }, { "entropy": 6.453442096710205, "epoch": 0.7645701096364685, "grad_norm": 1.40625, "learning_rate": 0.0004952296796278282, "loss": 6.3561, "mean_token_accuracy": 0.15859053581953048, "num_tokens": 16764233.0, "step": 6625 }, { "entropy": 6.302823925018311, "epoch": 0.7651471436814772, "grad_norm": 1.34375, "learning_rate": 0.0004952212239466274, "loss": 6.3387, "mean_token_accuracy": 0.16784807592630385, "num_tokens": 16778408.0, "step": 6630 }, { "entropy": 6.466341161727906, "epoch": 0.7657241777264858, "grad_norm": 1.53125, "learning_rate": 0.0004952127608583953, "loss": 6.3576, "mean_token_accuracy": 0.1531306877732277, "num_tokens": 16789863.0, "step": 6635 }, { "entropy": 6.465719747543335, "epoch": 0.7663012117714946, "grad_norm": 2.078125, "learning_rate": 0.0004952042903634162, "loss": 6.2966, "mean_token_accuracy": 0.16282862573862075, "num_tokens": 16804448.0, "step": 6640 }, { "entropy": 6.363318300247192, "epoch": 0.7668782458165032, "grad_norm": 1.359375, "learning_rate": 0.0004951958124619752, "loss": 6.3713, "mean_token_accuracy": 0.15907371491193772, "num_tokens": 16817922.0, "step": 6645 }, { "entropy": 6.424112319946289, "epoch": 0.7674552798615119, "grad_norm": 1.2890625, "learning_rate": 0.0004951873271543573, "loss": 6.3752, "mean_token_accuracy": 0.16005789488554, "num_tokens": 16830322.0, "step": 6650 }, { "entropy": 6.532310724258423, "epoch": 0.7680323139065205, "grad_norm": 1.40625, "learning_rate": 0.0004951788344408483, "loss": 6.3789, "mean_token_accuracy": 0.1579961434006691, "num_tokens": 16843489.0, "step": 6655 }, { "entropy": 6.482181167602539, "epoch": 0.7686093479515291, "grad_norm": 1.6015625, "learning_rate": 0.0004951703343217335, "loss": 6.3652, "mean_token_accuracy": 0.1490263119339943, "num_tokens": 16855256.0, "step": 6660 }, { "entropy": 6.410966539382935, "epoch": 0.7691863819965378, "grad_norm": 1.671875, "learning_rate": 0.0004951618267972987, "loss": 6.3532, "mean_token_accuracy": 0.15816780030727387, "num_tokens": 16869927.0, "step": 6665 }, { "entropy": 6.371284675598145, "epoch": 0.7697634160415464, "grad_norm": 1.2109375, "learning_rate": 0.0004951533118678304, "loss": 6.2393, "mean_token_accuracy": 0.16636443585157396, "num_tokens": 16882095.0, "step": 6670 }, { "entropy": 6.5100563049316404, "epoch": 0.7703404500865552, "grad_norm": 1.40625, "learning_rate": 0.0004951447895336147, "loss": 6.4317, "mean_token_accuracy": 0.15491466969251633, "num_tokens": 16893338.0, "step": 6675 }, { "entropy": 6.3982367515563965, "epoch": 0.7709174841315638, "grad_norm": 1.2734375, "learning_rate": 0.0004951362597949384, "loss": 6.3991, "mean_token_accuracy": 0.15819637775421141, "num_tokens": 16907138.0, "step": 6680 }, { "entropy": 6.452460479736328, "epoch": 0.7714945181765724, "grad_norm": 2.125, "learning_rate": 0.0004951277226520883, "loss": 6.3306, "mean_token_accuracy": 0.15423502773046494, "num_tokens": 16919756.0, "step": 6685 }, { "entropy": 6.4641800880432125, "epoch": 0.7720715522215811, "grad_norm": 1.1875, "learning_rate": 0.0004951191781053517, "loss": 6.2621, "mean_token_accuracy": 0.16414030492305756, "num_tokens": 16932059.0, "step": 6690 }, { "entropy": 6.405013608932495, "epoch": 0.7726485862665897, "grad_norm": 1.3046875, "learning_rate": 0.0004951106261550157, "loss": 6.3545, "mean_token_accuracy": 0.15656148940324782, "num_tokens": 16944777.0, "step": 6695 }, { "entropy": 6.428842639923095, "epoch": 0.7732256203115984, "grad_norm": 1.9375, "learning_rate": 0.0004951020668013683, "loss": 6.3287, "mean_token_accuracy": 0.15988122075796127, "num_tokens": 16957111.0, "step": 6700 }, { "entropy": 6.433229970932007, "epoch": 0.773802654356607, "grad_norm": 2.0, "learning_rate": 0.0004950935000446972, "loss": 6.3975, "mean_token_accuracy": 0.14823095202445985, "num_tokens": 16968663.0, "step": 6705 }, { "entropy": 6.4144176006317135, "epoch": 0.7743796884016156, "grad_norm": 1.390625, "learning_rate": 0.0004950849258852905, "loss": 6.3352, "mean_token_accuracy": 0.1517917647957802, "num_tokens": 16980668.0, "step": 6710 }, { "entropy": 6.46686315536499, "epoch": 0.7749567224466244, "grad_norm": 1.5625, "learning_rate": 0.0004950763443234366, "loss": 6.362, "mean_token_accuracy": 0.16094649136066436, "num_tokens": 16993537.0, "step": 6715 }, { "entropy": 6.4711127281188965, "epoch": 0.775533756491633, "grad_norm": 1.453125, "learning_rate": 0.0004950677553594243, "loss": 6.3256, "mean_token_accuracy": 0.15494734719395636, "num_tokens": 17006268.0, "step": 6720 }, { "entropy": 6.444059276580811, "epoch": 0.7761107905366417, "grad_norm": 1.4609375, "learning_rate": 0.0004950591589935422, "loss": 6.3484, "mean_token_accuracy": 0.15666031688451768, "num_tokens": 17018643.0, "step": 6725 }, { "entropy": 6.418145561218262, "epoch": 0.7766878245816503, "grad_norm": 2.9375, "learning_rate": 0.0004950505552260798, "loss": 6.3034, "mean_token_accuracy": 0.16328714042901993, "num_tokens": 17030670.0, "step": 6730 }, { "entropy": 6.476660203933716, "epoch": 0.777264858626659, "grad_norm": 1.5703125, "learning_rate": 0.0004950419440573261, "loss": 6.3197, "mean_token_accuracy": 0.15912694185972215, "num_tokens": 17042617.0, "step": 6735 }, { "entropy": 6.406995248794556, "epoch": 0.7778418926716676, "grad_norm": 1.3671875, "learning_rate": 0.000495033325487571, "loss": 6.3565, "mean_token_accuracy": 0.15629192739725112, "num_tokens": 17055217.0, "step": 6740 }, { "entropy": 6.397409391403198, "epoch": 0.7784189267166762, "grad_norm": 1.71875, "learning_rate": 0.0004950246995171042, "loss": 6.2153, "mean_token_accuracy": 0.1760856807231903, "num_tokens": 17068614.0, "step": 6745 }, { "entropy": 6.403274583816528, "epoch": 0.778995960761685, "grad_norm": 1.5625, "learning_rate": 0.000495016066146216, "loss": 6.2584, "mean_token_accuracy": 0.1673291563987732, "num_tokens": 17079892.0, "step": 6750 }, { "entropy": 6.386370849609375, "epoch": 0.7795729948066936, "grad_norm": 1.4453125, "learning_rate": 0.0004950074253751968, "loss": 6.351, "mean_token_accuracy": 0.15970607101917267, "num_tokens": 17092113.0, "step": 6755 }, { "entropy": 6.390835618972778, "epoch": 0.7801500288517023, "grad_norm": 1.296875, "learning_rate": 0.000494998777204337, "loss": 6.3212, "mean_token_accuracy": 0.1628754422068596, "num_tokens": 17103387.0, "step": 6760 }, { "entropy": 6.480059051513672, "epoch": 0.7807270628967109, "grad_norm": 1.3828125, "learning_rate": 0.0004949901216339276, "loss": 6.3738, "mean_token_accuracy": 0.15862331688404083, "num_tokens": 17116008.0, "step": 6765 }, { "entropy": 6.376413249969483, "epoch": 0.7813040969417195, "grad_norm": 1.765625, "learning_rate": 0.0004949814586642598, "loss": 6.2674, "mean_token_accuracy": 0.16962072998285294, "num_tokens": 17129224.0, "step": 6770 }, { "entropy": 6.316375637054444, "epoch": 0.7818811309867282, "grad_norm": 1.453125, "learning_rate": 0.000494972788295625, "loss": 6.233, "mean_token_accuracy": 0.15894538313150405, "num_tokens": 17141357.0, "step": 6775 }, { "entropy": 6.3543017387390135, "epoch": 0.7824581650317368, "grad_norm": 1.25, "learning_rate": 0.0004949641105283144, "loss": 6.2748, "mean_token_accuracy": 0.15785481184720992, "num_tokens": 17153672.0, "step": 6780 }, { "entropy": 6.419472122192383, "epoch": 0.7830351990767456, "grad_norm": 1.5859375, "learning_rate": 0.0004949554253626205, "loss": 6.3656, "mean_token_accuracy": 0.1508081555366516, "num_tokens": 17168429.0, "step": 6785 }, { "entropy": 6.4885454177856445, "epoch": 0.7836122331217542, "grad_norm": 1.2890625, "learning_rate": 0.0004949467327988351, "loss": 6.3155, "mean_token_accuracy": 0.15907162874937059, "num_tokens": 17181000.0, "step": 6790 }, { "entropy": 6.396276998519897, "epoch": 0.7841892671667628, "grad_norm": 1.2421875, "learning_rate": 0.0004949380328372505, "loss": 6.3156, "mean_token_accuracy": 0.15487978011369705, "num_tokens": 17193984.0, "step": 6795 }, { "entropy": 6.482124853134155, "epoch": 0.7847663012117715, "grad_norm": 1.40625, "learning_rate": 0.0004949293254781595, "loss": 6.327, "mean_token_accuracy": 0.15890616029500962, "num_tokens": 17207289.0, "step": 6800 }, { "entropy": 6.413140916824341, "epoch": 0.7853433352567801, "grad_norm": 1.5703125, "learning_rate": 0.0004949206107218547, "loss": 6.3719, "mean_token_accuracy": 0.15868546366691588, "num_tokens": 17220785.0, "step": 6805 }, { "entropy": 6.459430408477783, "epoch": 0.7859203693017888, "grad_norm": 1.1328125, "learning_rate": 0.0004949118885686296, "loss": 6.3403, "mean_token_accuracy": 0.1554628610610962, "num_tokens": 17233475.0, "step": 6810 }, { "entropy": 6.440314626693725, "epoch": 0.7864974033467974, "grad_norm": 1.421875, "learning_rate": 0.0004949031590187774, "loss": 6.331, "mean_token_accuracy": 0.1579444646835327, "num_tokens": 17246652.0, "step": 6815 }, { "entropy": 6.4201226234436035, "epoch": 0.7870744373918062, "grad_norm": 2.28125, "learning_rate": 0.0004948944220725915, "loss": 6.3246, "mean_token_accuracy": 0.158696049451828, "num_tokens": 17259966.0, "step": 6820 }, { "entropy": 6.3556853294372555, "epoch": 0.7876514714368148, "grad_norm": 1.328125, "learning_rate": 0.000494885677730366, "loss": 6.2917, "mean_token_accuracy": 0.16671997755765916, "num_tokens": 17272556.0, "step": 6825 }, { "entropy": 6.431224250793457, "epoch": 0.7882285054818234, "grad_norm": 1.5390625, "learning_rate": 0.000494876925992395, "loss": 6.2959, "mean_token_accuracy": 0.15880678445100785, "num_tokens": 17285960.0, "step": 6830 }, { "entropy": 6.45187816619873, "epoch": 0.7888055395268321, "grad_norm": 1.234375, "learning_rate": 0.0004948681668589728, "loss": 6.4111, "mean_token_accuracy": 0.14944198802113534, "num_tokens": 17299743.0, "step": 6835 }, { "entropy": 6.4086791515350345, "epoch": 0.7893825735718407, "grad_norm": 1.234375, "learning_rate": 0.000494859400330394, "loss": 6.2756, "mean_token_accuracy": 0.15799426585435866, "num_tokens": 17312317.0, "step": 6840 }, { "entropy": 6.4271081447601315, "epoch": 0.7899596076168494, "grad_norm": 1.3203125, "learning_rate": 0.0004948506264069535, "loss": 6.3429, "mean_token_accuracy": 0.15904499739408492, "num_tokens": 17326204.0, "step": 6845 }, { "entropy": 6.375916767120361, "epoch": 0.790536641661858, "grad_norm": 1.703125, "learning_rate": 0.0004948418450889464, "loss": 6.2957, "mean_token_accuracy": 0.1635165348649025, "num_tokens": 17338362.0, "step": 6850 }, { "entropy": 6.390348434448242, "epoch": 0.7911136757068667, "grad_norm": 1.203125, "learning_rate": 0.000494833056376668, "loss": 6.3198, "mean_token_accuracy": 0.16242424845695497, "num_tokens": 17350713.0, "step": 6855 }, { "entropy": 6.476944398880005, "epoch": 0.7916907097518754, "grad_norm": 1.4453125, "learning_rate": 0.0004948242602704139, "loss": 6.3484, "mean_token_accuracy": 0.14923545345664024, "num_tokens": 17364055.0, "step": 6860 }, { "entropy": 6.442521095275879, "epoch": 0.792267743796884, "grad_norm": 1.3125, "learning_rate": 0.0004948154567704801, "loss": 6.4049, "mean_token_accuracy": 0.161513988673687, "num_tokens": 17377940.0, "step": 6865 }, { "entropy": 6.425199937820435, "epoch": 0.7928447778418927, "grad_norm": 1.328125, "learning_rate": 0.0004948066458771625, "loss": 6.3176, "mean_token_accuracy": 0.15831714868545532, "num_tokens": 17390348.0, "step": 6870 }, { "entropy": 6.433390998840332, "epoch": 0.7934218118869013, "grad_norm": 1.28125, "learning_rate": 0.0004947978275907577, "loss": 6.319, "mean_token_accuracy": 0.15604161992669105, "num_tokens": 17403406.0, "step": 6875 }, { "entropy": 6.44692759513855, "epoch": 0.79399884593191, "grad_norm": 1.2421875, "learning_rate": 0.000494789001911562, "loss": 6.3229, "mean_token_accuracy": 0.15025489330291747, "num_tokens": 17415306.0, "step": 6880 }, { "entropy": 6.500966596603393, "epoch": 0.7945758799769186, "grad_norm": 1.3046875, "learning_rate": 0.0004947801688398725, "loss": 6.3779, "mean_token_accuracy": 0.15381309092044831, "num_tokens": 17427901.0, "step": 6885 }, { "entropy": 6.417627954483033, "epoch": 0.7951529140219273, "grad_norm": 2.0, "learning_rate": 0.0004947713283759862, "loss": 6.3172, "mean_token_accuracy": 0.15818158090114592, "num_tokens": 17439812.0, "step": 6890 }, { "entropy": 6.404314374923706, "epoch": 0.795729948066936, "grad_norm": 1.328125, "learning_rate": 0.0004947624805202003, "loss": 6.432, "mean_token_accuracy": 0.15916587486863137, "num_tokens": 17453317.0, "step": 6895 }, { "entropy": 6.379020404815674, "epoch": 0.7963069821119446, "grad_norm": 1.90625, "learning_rate": 0.0004947536252728126, "loss": 6.3185, "mean_token_accuracy": 0.15128010660409927, "num_tokens": 17465563.0, "step": 6900 }, { "entropy": 6.4297808647155765, "epoch": 0.7968840161569533, "grad_norm": 1.625, "learning_rate": 0.0004947447626341209, "loss": 6.366, "mean_token_accuracy": 0.15720113217830659, "num_tokens": 17477672.0, "step": 6905 }, { "entropy": 6.426624536514282, "epoch": 0.7974610502019619, "grad_norm": 1.1328125, "learning_rate": 0.0004947358926044232, "loss": 6.3237, "mean_token_accuracy": 0.15934155583381654, "num_tokens": 17489061.0, "step": 6910 }, { "entropy": 6.392905282974243, "epoch": 0.7980380842469705, "grad_norm": 1.625, "learning_rate": 0.0004947270151840179, "loss": 6.371, "mean_token_accuracy": 0.15421160608530043, "num_tokens": 17501734.0, "step": 6915 }, { "entropy": 6.442747926712036, "epoch": 0.7986151182919792, "grad_norm": 1.3984375, "learning_rate": 0.0004947181303732038, "loss": 6.2726, "mean_token_accuracy": 0.15750008672475815, "num_tokens": 17514387.0, "step": 6920 }, { "entropy": 6.403343772888183, "epoch": 0.7991921523369879, "grad_norm": 1.578125, "learning_rate": 0.0004947092381722793, "loss": 6.2788, "mean_token_accuracy": 0.1647616818547249, "num_tokens": 17526483.0, "step": 6925 }, { "entropy": 6.44573745727539, "epoch": 0.7997691863819966, "grad_norm": 1.265625, "learning_rate": 0.0004947003385815438, "loss": 6.307, "mean_token_accuracy": 0.16297112554311752, "num_tokens": 17539809.0, "step": 6930 }, { "entropy": 6.416499471664428, "epoch": 0.8003462204270052, "grad_norm": 1.140625, "learning_rate": 0.0004946914316012964, "loss": 6.3167, "mean_token_accuracy": 0.15640088468790053, "num_tokens": 17552973.0, "step": 6935 }, { "entropy": 6.429599618911743, "epoch": 0.8009232544720138, "grad_norm": 1.3984375, "learning_rate": 0.000494682517231837, "loss": 6.3671, "mean_token_accuracy": 0.16080797612667083, "num_tokens": 17567803.0, "step": 6940 }, { "entropy": 6.481288766860962, "epoch": 0.8015002885170225, "grad_norm": 1.4921875, "learning_rate": 0.0004946735954734652, "loss": 6.3257, "mean_token_accuracy": 0.156865856051445, "num_tokens": 17579718.0, "step": 6945 }, { "entropy": 6.400873327255249, "epoch": 0.8020773225620311, "grad_norm": 1.453125, "learning_rate": 0.0004946646663264811, "loss": 6.3161, "mean_token_accuracy": 0.15859004408121108, "num_tokens": 17592384.0, "step": 6950 }, { "entropy": 6.439334154129028, "epoch": 0.8026543566070398, "grad_norm": 1.4140625, "learning_rate": 0.0004946557297911852, "loss": 6.225, "mean_token_accuracy": 0.16009974032640456, "num_tokens": 17604292.0, "step": 6955 }, { "entropy": 6.35125412940979, "epoch": 0.8032313906520485, "grad_norm": 1.4453125, "learning_rate": 0.0004946467858678777, "loss": 6.2405, "mean_token_accuracy": 0.16352516561746597, "num_tokens": 17616638.0, "step": 6960 }, { "entropy": 6.439220523834228, "epoch": 0.8038084246970572, "grad_norm": 1.265625, "learning_rate": 0.0004946378345568597, "loss": 6.3572, "mean_token_accuracy": 0.14690545722842216, "num_tokens": 17630672.0, "step": 6965 }, { "entropy": 6.457352066040039, "epoch": 0.8043854587420658, "grad_norm": 3.109375, "learning_rate": 0.0004946288758584324, "loss": 6.3248, "mean_token_accuracy": 0.15353938937187195, "num_tokens": 17644215.0, "step": 6970 }, { "entropy": 6.430181646347046, "epoch": 0.8049624927870744, "grad_norm": 1.3984375, "learning_rate": 0.0004946199097728968, "loss": 6.4047, "mean_token_accuracy": 0.15424128770828247, "num_tokens": 17655982.0, "step": 6975 }, { "entropy": 6.427625846862793, "epoch": 0.8055395268320831, "grad_norm": 1.1484375, "learning_rate": 0.0004946109363005548, "loss": 6.3272, "mean_token_accuracy": 0.15317181050777434, "num_tokens": 17668059.0, "step": 6980 }, { "entropy": 6.449534893035889, "epoch": 0.8061165608770917, "grad_norm": 2.078125, "learning_rate": 0.000494601955441708, "loss": 6.3512, "mean_token_accuracy": 0.1613871321082115, "num_tokens": 17680924.0, "step": 6985 }, { "entropy": 6.417742967605591, "epoch": 0.8066935949221004, "grad_norm": 1.9296875, "learning_rate": 0.0004945929671966585, "loss": 6.3544, "mean_token_accuracy": 0.15113742798566818, "num_tokens": 17693381.0, "step": 6990 }, { "entropy": 6.323920249938965, "epoch": 0.8072706289671091, "grad_norm": 1.34375, "learning_rate": 0.0004945839715657085, "loss": 6.2573, "mean_token_accuracy": 0.1607775092124939, "num_tokens": 17705900.0, "step": 6995 }, { "entropy": 6.417225408554077, "epoch": 0.8078476630121177, "grad_norm": 2.203125, "learning_rate": 0.0004945749685491607, "loss": 6.2688, "mean_token_accuracy": 0.16660031527280808, "num_tokens": 17719139.0, "step": 7000 }, { "entropy": 6.399656534194946, "epoch": 0.8084246970571264, "grad_norm": 1.71875, "learning_rate": 0.0004945659581473181, "loss": 6.2703, "mean_token_accuracy": 0.1602562978863716, "num_tokens": 17734312.0, "step": 7005 }, { "entropy": 6.474909067153931, "epoch": 0.809001731102135, "grad_norm": 1.296875, "learning_rate": 0.0004945569403604833, "loss": 6.3247, "mean_token_accuracy": 0.1548770174384117, "num_tokens": 17746137.0, "step": 7010 }, { "entropy": 6.39998688697815, "epoch": 0.8095787651471437, "grad_norm": 1.75, "learning_rate": 0.0004945479151889601, "loss": 6.1753, "mean_token_accuracy": 0.1639669805765152, "num_tokens": 17758879.0, "step": 7015 }, { "entropy": 6.332425308227539, "epoch": 0.8101557991921523, "grad_norm": 1.359375, "learning_rate": 0.0004945388826330517, "loss": 6.3147, "mean_token_accuracy": 0.16598912477493286, "num_tokens": 17770820.0, "step": 7020 }, { "entropy": 6.469837856292725, "epoch": 0.8107328332371609, "grad_norm": 1.4375, "learning_rate": 0.0004945298426930621, "loss": 6.3626, "mean_token_accuracy": 0.15875112563371657, "num_tokens": 17783495.0, "step": 7025 }, { "entropy": 6.473739576339722, "epoch": 0.8113098672821697, "grad_norm": 2.0625, "learning_rate": 0.0004945207953692952, "loss": 6.3452, "mean_token_accuracy": 0.15288871824741362, "num_tokens": 17795780.0, "step": 7030 }, { "entropy": 6.462626647949219, "epoch": 0.8118869013271783, "grad_norm": 1.6015625, "learning_rate": 0.0004945117406620556, "loss": 6.3471, "mean_token_accuracy": 0.15740556567907332, "num_tokens": 17809684.0, "step": 7035 }, { "entropy": 6.404884290695191, "epoch": 0.812463935372187, "grad_norm": 1.5, "learning_rate": 0.0004945026785716474, "loss": 6.3465, "mean_token_accuracy": 0.15713463425636293, "num_tokens": 17822719.0, "step": 7040 }, { "entropy": 6.485169458389282, "epoch": 0.8130409694171956, "grad_norm": 1.7421875, "learning_rate": 0.0004944936090983757, "loss": 6.3756, "mean_token_accuracy": 0.15452174842357635, "num_tokens": 17834883.0, "step": 7045 }, { "entropy": 6.423402452468872, "epoch": 0.8136180034622043, "grad_norm": 1.59375, "learning_rate": 0.0004944845322425455, "loss": 6.3131, "mean_token_accuracy": 0.16450032442808152, "num_tokens": 17847009.0, "step": 7050 }, { "entropy": 6.4183858871459964, "epoch": 0.8141950375072129, "grad_norm": 1.234375, "learning_rate": 0.0004944754480044621, "loss": 6.3147, "mean_token_accuracy": 0.15603942126035691, "num_tokens": 17859106.0, "step": 7055 }, { "entropy": 6.444196557998657, "epoch": 0.8147720715522215, "grad_norm": 2.0, "learning_rate": 0.0004944663563844311, "loss": 6.3201, "mean_token_accuracy": 0.15441031754016876, "num_tokens": 17871418.0, "step": 7060 }, { "entropy": 6.40857720375061, "epoch": 0.8153491055972303, "grad_norm": 1.1796875, "learning_rate": 0.0004944572573827581, "loss": 6.2908, "mean_token_accuracy": 0.1583213210105896, "num_tokens": 17884219.0, "step": 7065 }, { "entropy": 6.3658651351928714, "epoch": 0.8159261396422389, "grad_norm": 1.2421875, "learning_rate": 0.0004944481509997494, "loss": 6.3028, "mean_token_accuracy": 0.15765465348958968, "num_tokens": 17896206.0, "step": 7070 }, { "entropy": 6.43848180770874, "epoch": 0.8165031736872476, "grad_norm": 1.765625, "learning_rate": 0.000494439037235711, "loss": 6.3986, "mean_token_accuracy": 0.15387010723352432, "num_tokens": 17909488.0, "step": 7075 }, { "entropy": 6.43320894241333, "epoch": 0.8170802077322562, "grad_norm": 2.21875, "learning_rate": 0.0004944299160909495, "loss": 6.346, "mean_token_accuracy": 0.15420840233564376, "num_tokens": 17922851.0, "step": 7080 }, { "entropy": 6.46990966796875, "epoch": 0.8176572417772648, "grad_norm": 1.9921875, "learning_rate": 0.000494420787565772, "loss": 6.2682, "mean_token_accuracy": 0.16781508177518845, "num_tokens": 17934586.0, "step": 7085 }, { "entropy": 6.410624599456787, "epoch": 0.8182342758222735, "grad_norm": 1.65625, "learning_rate": 0.0004944116516604852, "loss": 6.3653, "mean_token_accuracy": 0.15871597677469254, "num_tokens": 17947637.0, "step": 7090 }, { "entropy": 6.419895935058594, "epoch": 0.8188113098672821, "grad_norm": 1.7890625, "learning_rate": 0.0004944025083753965, "loss": 6.3346, "mean_token_accuracy": 0.15860212296247483, "num_tokens": 17959601.0, "step": 7095 }, { "entropy": 6.42613205909729, "epoch": 0.8193883439122909, "grad_norm": 1.609375, "learning_rate": 0.0004943933577108133, "loss": 6.3047, "mean_token_accuracy": 0.1616590827703476, "num_tokens": 17972568.0, "step": 7100 }, { "entropy": 6.461557245254516, "epoch": 0.8199653779572995, "grad_norm": 1.25, "learning_rate": 0.0004943841996670436, "loss": 6.3088, "mean_token_accuracy": 0.1592638984322548, "num_tokens": 17984665.0, "step": 7105 }, { "entropy": 6.465728902816773, "epoch": 0.8205424120023082, "grad_norm": 1.3125, "learning_rate": 0.0004943750342443953, "loss": 6.3551, "mean_token_accuracy": 0.1517217919230461, "num_tokens": 17997140.0, "step": 7110 }, { "entropy": 6.459466886520386, "epoch": 0.8211194460473168, "grad_norm": 1.1796875, "learning_rate": 0.0004943658614431767, "loss": 6.3335, "mean_token_accuracy": 0.15835410803556443, "num_tokens": 18009361.0, "step": 7115 }, { "entropy": 6.377575302124024, "epoch": 0.8216964800923254, "grad_norm": 1.1640625, "learning_rate": 0.0004943566812636963, "loss": 6.2799, "mean_token_accuracy": 0.15527833849191666, "num_tokens": 18021233.0, "step": 7120 }, { "entropy": 6.3838001728057865, "epoch": 0.8222735141373341, "grad_norm": 1.953125, "learning_rate": 0.000494347493706263, "loss": 6.1757, "mean_token_accuracy": 0.1724259674549103, "num_tokens": 18034086.0, "step": 7125 }, { "entropy": 6.393672943115234, "epoch": 0.8228505481823427, "grad_norm": 2.46875, "learning_rate": 0.0004943382987711856, "loss": 6.2819, "mean_token_accuracy": 0.16438249498605728, "num_tokens": 18046604.0, "step": 7130 }, { "entropy": 6.414757633209229, "epoch": 0.8234275822273515, "grad_norm": 1.5078125, "learning_rate": 0.0004943290964587734, "loss": 6.3044, "mean_token_accuracy": 0.16008765250444412, "num_tokens": 18059185.0, "step": 7135 }, { "entropy": 6.397540616989136, "epoch": 0.8240046162723601, "grad_norm": 1.3125, "learning_rate": 0.0004943198867693361, "loss": 6.2537, "mean_token_accuracy": 0.16008234918117523, "num_tokens": 18071707.0, "step": 7140 }, { "entropy": 6.433577537536621, "epoch": 0.8245816503173687, "grad_norm": 4.8125, "learning_rate": 0.0004943106697031833, "loss": 6.4092, "mean_token_accuracy": 0.15259905457496642, "num_tokens": 18084657.0, "step": 7145 }, { "entropy": 6.472084045410156, "epoch": 0.8251586843623774, "grad_norm": 1.9296875, "learning_rate": 0.0004943014452606251, "loss": 6.3736, "mean_token_accuracy": 0.1545234352350235, "num_tokens": 18097084.0, "step": 7150 }, { "entropy": 6.420034742355346, "epoch": 0.825735718407386, "grad_norm": 1.546875, "learning_rate": 0.0004942922134419717, "loss": 6.283, "mean_token_accuracy": 0.15995100438594817, "num_tokens": 18109306.0, "step": 7155 }, { "entropy": 6.360563182830811, "epoch": 0.8263127524523947, "grad_norm": 1.484375, "learning_rate": 0.0004942829742475336, "loss": 6.1958, "mean_token_accuracy": 0.15680315494537353, "num_tokens": 18120300.0, "step": 7160 }, { "entropy": 6.409770345687866, "epoch": 0.8268897864974033, "grad_norm": 1.8984375, "learning_rate": 0.0004942737276776217, "loss": 6.3318, "mean_token_accuracy": 0.1568691462278366, "num_tokens": 18132251.0, "step": 7165 }, { "entropy": 6.3930370807647705, "epoch": 0.827466820542412, "grad_norm": 1.578125, "learning_rate": 0.0004942644737325468, "loss": 6.2378, "mean_token_accuracy": 0.16396623849868774, "num_tokens": 18146198.0, "step": 7170 }, { "entropy": 6.412364673614502, "epoch": 0.8280438545874207, "grad_norm": 1.3671875, "learning_rate": 0.0004942552124126202, "loss": 6.3532, "mean_token_accuracy": 0.15747751146554947, "num_tokens": 18159493.0, "step": 7175 }, { "entropy": 6.372334575653076, "epoch": 0.8286208886324293, "grad_norm": 1.2109375, "learning_rate": 0.0004942459437181535, "loss": 6.2454, "mean_token_accuracy": 0.16117880791425704, "num_tokens": 18172120.0, "step": 7180 }, { "entropy": 6.417788648605347, "epoch": 0.829197922677438, "grad_norm": 1.546875, "learning_rate": 0.0004942366676494584, "loss": 6.2758, "mean_token_accuracy": 0.15891496539115907, "num_tokens": 18184704.0, "step": 7185 }, { "entropy": 6.5040661811828615, "epoch": 0.8297749567224466, "grad_norm": 1.375, "learning_rate": 0.0004942273842068469, "loss": 6.378, "mean_token_accuracy": 0.1573457822203636, "num_tokens": 18196770.0, "step": 7190 }, { "entropy": 6.42578158378601, "epoch": 0.8303519907674553, "grad_norm": 1.4296875, "learning_rate": 0.0004942180933906311, "loss": 6.3353, "mean_token_accuracy": 0.1560923770070076, "num_tokens": 18209987.0, "step": 7195 }, { "entropy": 6.427188396453857, "epoch": 0.8309290248124639, "grad_norm": 1.4609375, "learning_rate": 0.0004942087952011237, "loss": 6.3619, "mean_token_accuracy": 0.15685783326625824, "num_tokens": 18224864.0, "step": 7200 }, { "entropy": 6.477103185653687, "epoch": 0.8315060588574726, "grad_norm": 1.390625, "learning_rate": 0.0004941994896386374, "loss": 6.3183, "mean_token_accuracy": 0.1615700140595436, "num_tokens": 18237270.0, "step": 7205 }, { "entropy": 6.358955335617066, "epoch": 0.8320830929024813, "grad_norm": 1.4453125, "learning_rate": 0.0004941901767034851, "loss": 6.3402, "mean_token_accuracy": 0.15311284065246583, "num_tokens": 18251227.0, "step": 7210 }, { "entropy": 6.375926876068116, "epoch": 0.8326601269474899, "grad_norm": 1.3515625, "learning_rate": 0.0004941808563959802, "loss": 6.2519, "mean_token_accuracy": 0.1678831934928894, "num_tokens": 18264762.0, "step": 7215 }, { "entropy": 6.457195186614991, "epoch": 0.8332371609924986, "grad_norm": 1.1484375, "learning_rate": 0.0004941715287164359, "loss": 6.2962, "mean_token_accuracy": 0.15596022307872773, "num_tokens": 18276836.0, "step": 7220 }, { "entropy": 6.384139442443848, "epoch": 0.8338141950375072, "grad_norm": 1.5703125, "learning_rate": 0.0004941621936651661, "loss": 6.3289, "mean_token_accuracy": 0.16242541372776031, "num_tokens": 18290362.0, "step": 7225 }, { "entropy": 6.4580583572387695, "epoch": 0.8343912290825158, "grad_norm": 1.6484375, "learning_rate": 0.0004941528512424849, "loss": 6.3579, "mean_token_accuracy": 0.1578863427042961, "num_tokens": 18303924.0, "step": 7230 }, { "entropy": 6.370277833938599, "epoch": 0.8349682631275245, "grad_norm": 1.171875, "learning_rate": 0.0004941435014487064, "loss": 6.2306, "mean_token_accuracy": 0.16379570066928864, "num_tokens": 18316490.0, "step": 7235 }, { "entropy": 6.417813491821289, "epoch": 0.8355452971725332, "grad_norm": 1.3203125, "learning_rate": 0.000494134144284145, "loss": 6.2853, "mean_token_accuracy": 0.15361817181110382, "num_tokens": 18328819.0, "step": 7240 }, { "entropy": 6.363092947006225, "epoch": 0.8361223312175419, "grad_norm": 1.375, "learning_rate": 0.0004941247797491156, "loss": 6.2611, "mean_token_accuracy": 0.16033381819725037, "num_tokens": 18341872.0, "step": 7245 }, { "entropy": 6.436460399627686, "epoch": 0.8366993652625505, "grad_norm": 1.515625, "learning_rate": 0.0004941154078439329, "loss": 6.2839, "mean_token_accuracy": 0.15880754142999648, "num_tokens": 18354644.0, "step": 7250 }, { "entropy": 6.445900964736938, "epoch": 0.8372763993075591, "grad_norm": 1.359375, "learning_rate": 0.0004941060285689126, "loss": 6.3164, "mean_token_accuracy": 0.1531373918056488, "num_tokens": 18367581.0, "step": 7255 }, { "entropy": 6.410998773574829, "epoch": 0.8378534333525678, "grad_norm": 1.140625, "learning_rate": 0.0004940966419243695, "loss": 6.2879, "mean_token_accuracy": 0.16572379171848298, "num_tokens": 18381123.0, "step": 7260 }, { "entropy": 6.344087362289429, "epoch": 0.8384304673975764, "grad_norm": 1.1328125, "learning_rate": 0.00049408724791062, "loss": 6.2591, "mean_token_accuracy": 0.1606621190905571, "num_tokens": 18395711.0, "step": 7265 }, { "entropy": 6.464009857177734, "epoch": 0.8390075014425851, "grad_norm": 1.0703125, "learning_rate": 0.0004940778465279797, "loss": 6.3763, "mean_token_accuracy": 0.14919317811727523, "num_tokens": 18409434.0, "step": 7270 }, { "entropy": 6.4164632797241214, "epoch": 0.8395845354875938, "grad_norm": 1.2890625, "learning_rate": 0.0004940684377767647, "loss": 6.3223, "mean_token_accuracy": 0.15381991267204284, "num_tokens": 18423138.0, "step": 7275 }, { "entropy": 6.401902055740356, "epoch": 0.8401615695326025, "grad_norm": 1.3203125, "learning_rate": 0.0004940590216572916, "loss": 6.3188, "mean_token_accuracy": 0.15444015413522721, "num_tokens": 18435655.0, "step": 7280 }, { "entropy": 6.337902498245239, "epoch": 0.8407386035776111, "grad_norm": 1.4140625, "learning_rate": 0.0004940495981698772, "loss": 6.197, "mean_token_accuracy": 0.16857851296663284, "num_tokens": 18448344.0, "step": 7285 }, { "entropy": 6.393205165863037, "epoch": 0.8413156376226197, "grad_norm": 1.3984375, "learning_rate": 0.0004940401673148384, "loss": 6.2057, "mean_token_accuracy": 0.16652216762304306, "num_tokens": 18460409.0, "step": 7290 }, { "entropy": 6.415207719802856, "epoch": 0.8418926716676284, "grad_norm": 1.359375, "learning_rate": 0.0004940307290924923, "loss": 6.3247, "mean_token_accuracy": 0.15722924172878266, "num_tokens": 18473650.0, "step": 7295 }, { "entropy": 6.35351300239563, "epoch": 0.842469705712637, "grad_norm": 1.109375, "learning_rate": 0.0004940212835031565, "loss": 6.2472, "mean_token_accuracy": 0.16438708156347276, "num_tokens": 18487108.0, "step": 7300 }, { "entropy": 6.432998180389404, "epoch": 0.8430467397576457, "grad_norm": 1.828125, "learning_rate": 0.0004940118305471486, "loss": 6.2857, "mean_token_accuracy": 0.15940231084823608, "num_tokens": 18500377.0, "step": 7305 }, { "entropy": 6.433759593963623, "epoch": 0.8436237738026544, "grad_norm": 1.3671875, "learning_rate": 0.0004940023702247866, "loss": 6.3466, "mean_token_accuracy": 0.1481998160481453, "num_tokens": 18513257.0, "step": 7310 }, { "entropy": 6.464117813110351, "epoch": 0.844200807847663, "grad_norm": 1.28125, "learning_rate": 0.0004939929025363886, "loss": 6.3405, "mean_token_accuracy": 0.15689841657876968, "num_tokens": 18525438.0, "step": 7315 }, { "entropy": 6.4316305160522464, "epoch": 0.8447778418926717, "grad_norm": 1.40625, "learning_rate": 0.0004939834274822731, "loss": 6.3755, "mean_token_accuracy": 0.16183712780475618, "num_tokens": 18537937.0, "step": 7320 }, { "entropy": 6.469800138473511, "epoch": 0.8453548759376803, "grad_norm": 1.4375, "learning_rate": 0.0004939739450627588, "loss": 6.3821, "mean_token_accuracy": 0.15115718245506288, "num_tokens": 18551629.0, "step": 7325 }, { "entropy": 6.4402059555053714, "epoch": 0.845931909982689, "grad_norm": 1.4765625, "learning_rate": 0.0004939644552781647, "loss": 6.3297, "mean_token_accuracy": 0.15563774853944778, "num_tokens": 18564549.0, "step": 7330 }, { "entropy": 6.371536636352539, "epoch": 0.8465089440276976, "grad_norm": 1.3046875, "learning_rate": 0.0004939549581288099, "loss": 6.3173, "mean_token_accuracy": 0.16682110875844955, "num_tokens": 18576536.0, "step": 7335 }, { "entropy": 6.324753952026367, "epoch": 0.8470859780727062, "grad_norm": 1.2578125, "learning_rate": 0.0004939454536150138, "loss": 6.2766, "mean_token_accuracy": 0.16521506160497665, "num_tokens": 18588655.0, "step": 7340 }, { "entropy": 6.4212664604187015, "epoch": 0.847663012117715, "grad_norm": 1.8046875, "learning_rate": 0.000493935941737096, "loss": 6.251, "mean_token_accuracy": 0.16551081836223602, "num_tokens": 18602152.0, "step": 7345 }, { "entropy": 6.347581577301026, "epoch": 0.8482400461627236, "grad_norm": 1.3984375, "learning_rate": 0.0004939264224953768, "loss": 6.2585, "mean_token_accuracy": 0.1667644664645195, "num_tokens": 18615391.0, "step": 7350 }, { "entropy": 6.302462100982666, "epoch": 0.8488170802077323, "grad_norm": 1.53125, "learning_rate": 0.000493916895890176, "loss": 6.3328, "mean_token_accuracy": 0.15009007528424262, "num_tokens": 18629987.0, "step": 7355 }, { "entropy": 6.5011743068695065, "epoch": 0.8493941142527409, "grad_norm": 1.4296875, "learning_rate": 0.000493907361921814, "loss": 6.38, "mean_token_accuracy": 0.15558104068040848, "num_tokens": 18643064.0, "step": 7360 }, { "entropy": 6.517504692077637, "epoch": 0.8499711482977496, "grad_norm": 1.5390625, "learning_rate": 0.0004938978205906118, "loss": 6.3399, "mean_token_accuracy": 0.15750785619020463, "num_tokens": 18654950.0, "step": 7365 }, { "entropy": 6.375610494613648, "epoch": 0.8505481823427582, "grad_norm": 1.4453125, "learning_rate": 0.0004938882718968901, "loss": 6.2809, "mean_token_accuracy": 0.15807467252016066, "num_tokens": 18666318.0, "step": 7370 }, { "entropy": 6.356922674179077, "epoch": 0.8511252163877668, "grad_norm": 1.6640625, "learning_rate": 0.0004938787158409702, "loss": 6.242, "mean_token_accuracy": 0.16371146887540816, "num_tokens": 18677357.0, "step": 7375 }, { "entropy": 6.3947381496429445, "epoch": 0.8517022504327756, "grad_norm": 1.28125, "learning_rate": 0.0004938691524231733, "loss": 6.2723, "mean_token_accuracy": 0.16164294630289078, "num_tokens": 18689563.0, "step": 7380 }, { "entropy": 6.312204122543335, "epoch": 0.8522792844777842, "grad_norm": 1.4921875, "learning_rate": 0.0004938595816438212, "loss": 6.2794, "mean_token_accuracy": 0.1561274692416191, "num_tokens": 18701442.0, "step": 7385 }, { "entropy": 6.441098594665528, "epoch": 0.8528563185227929, "grad_norm": 1.28125, "learning_rate": 0.0004938500035032358, "loss": 6.335, "mean_token_accuracy": 0.15520687401294708, "num_tokens": 18714942.0, "step": 7390 }, { "entropy": 6.293469429016113, "epoch": 0.8534333525678015, "grad_norm": 3.25, "learning_rate": 0.0004938404180017392, "loss": 6.3419, "mean_token_accuracy": 0.16100662648677827, "num_tokens": 18727752.0, "step": 7395 }, { "entropy": 6.428264188766479, "epoch": 0.8540103866128101, "grad_norm": 1.390625, "learning_rate": 0.0004938308251396539, "loss": 6.3428, "mean_token_accuracy": 0.1571537360548973, "num_tokens": 18741719.0, "step": 7400 }, { "entropy": 6.4747106552124025, "epoch": 0.8545874206578188, "grad_norm": 1.1796875, "learning_rate": 0.0004938212249173024, "loss": 6.2866, "mean_token_accuracy": 0.14972534030675888, "num_tokens": 18754472.0, "step": 7405 }, { "entropy": 6.4440333366394045, "epoch": 0.8551644547028274, "grad_norm": 1.875, "learning_rate": 0.0004938116173350078, "loss": 6.3288, "mean_token_accuracy": 0.15726516842842103, "num_tokens": 18766691.0, "step": 7410 }, { "entropy": 6.412831592559814, "epoch": 0.8557414887478362, "grad_norm": 1.4140625, "learning_rate": 0.0004938020023930932, "loss": 6.2983, "mean_token_accuracy": 0.15810909271240234, "num_tokens": 18780083.0, "step": 7415 }, { "entropy": 6.457475090026856, "epoch": 0.8563185227928448, "grad_norm": 1.8203125, "learning_rate": 0.0004937923800918817, "loss": 6.359, "mean_token_accuracy": 0.15542669594287872, "num_tokens": 18792559.0, "step": 7420 }, { "entropy": 6.3452540874481205, "epoch": 0.8568955568378535, "grad_norm": 1.6484375, "learning_rate": 0.0004937827504316974, "loss": 6.2176, "mean_token_accuracy": 0.16970468163490296, "num_tokens": 18805089.0, "step": 7425 }, { "entropy": 6.240821170806885, "epoch": 0.8574725908828621, "grad_norm": 1.234375, "learning_rate": 0.0004937731134128639, "loss": 6.2161, "mean_token_accuracy": 0.15851088762283325, "num_tokens": 18818476.0, "step": 7430 }, { "entropy": 6.44542875289917, "epoch": 0.8580496249278707, "grad_norm": 1.265625, "learning_rate": 0.0004937634690357054, "loss": 6.4014, "mean_token_accuracy": 0.15640219449996948, "num_tokens": 18830785.0, "step": 7435 }, { "entropy": 6.495653343200684, "epoch": 0.8586266589728794, "grad_norm": 1.375, "learning_rate": 0.0004937538173005462, "loss": 6.3712, "mean_token_accuracy": 0.1560351386666298, "num_tokens": 18844029.0, "step": 7440 }, { "entropy": 6.422978258132934, "epoch": 0.859203693017888, "grad_norm": 1.640625, "learning_rate": 0.0004937441582077111, "loss": 6.3346, "mean_token_accuracy": 0.15770572125911714, "num_tokens": 18857468.0, "step": 7445 }, { "entropy": 6.425333786010742, "epoch": 0.8597807270628968, "grad_norm": 1.1953125, "learning_rate": 0.0004937344917575249, "loss": 6.2786, "mean_token_accuracy": 0.15311031341552733, "num_tokens": 18870487.0, "step": 7450 }, { "entropy": 6.4155045509338375, "epoch": 0.8603577611079054, "grad_norm": 1.1875, "learning_rate": 0.0004937248179503127, "loss": 6.3045, "mean_token_accuracy": 0.1591097131371498, "num_tokens": 18883273.0, "step": 7455 }, { "entropy": 6.372232294082641, "epoch": 0.860934795152914, "grad_norm": 1.3671875, "learning_rate": 0.0004937151367863998, "loss": 6.2792, "mean_token_accuracy": 0.1714622050523758, "num_tokens": 18895863.0, "step": 7460 }, { "entropy": 6.392306852340698, "epoch": 0.8615118291979227, "grad_norm": 1.3515625, "learning_rate": 0.000493705448266112, "loss": 6.3424, "mean_token_accuracy": 0.1597261071205139, "num_tokens": 18909406.0, "step": 7465 }, { "entropy": 6.38096022605896, "epoch": 0.8620888632429313, "grad_norm": 1.5234375, "learning_rate": 0.0004936957523897752, "loss": 6.3049, "mean_token_accuracy": 0.16298051476478576, "num_tokens": 18922794.0, "step": 7470 }, { "entropy": 6.395741033554077, "epoch": 0.86266589728794, "grad_norm": 1.3125, "learning_rate": 0.0004936860491577153, "loss": 6.2997, "mean_token_accuracy": 0.1635509356856346, "num_tokens": 18936511.0, "step": 7475 }, { "entropy": 6.436820840835571, "epoch": 0.8632429313329486, "grad_norm": 1.3984375, "learning_rate": 0.0004936763385702588, "loss": 6.3391, "mean_token_accuracy": 0.15443028509616852, "num_tokens": 18948164.0, "step": 7480 }, { "entropy": 6.445798921585083, "epoch": 0.8638199653779572, "grad_norm": 2.765625, "learning_rate": 0.0004936666206277322, "loss": 6.3573, "mean_token_accuracy": 0.1542191758751869, "num_tokens": 18960608.0, "step": 7485 }, { "entropy": 6.390499258041382, "epoch": 0.864396999422966, "grad_norm": 1.3125, "learning_rate": 0.0004936568953304624, "loss": 6.2226, "mean_token_accuracy": 0.17056952118873597, "num_tokens": 18972266.0, "step": 7490 }, { "entropy": 6.33178129196167, "epoch": 0.8649740334679746, "grad_norm": 2.953125, "learning_rate": 0.0004936471626787766, "loss": 6.2737, "mean_token_accuracy": 0.15900991410017012, "num_tokens": 18984518.0, "step": 7495 }, { "entropy": 6.370002889633179, "epoch": 0.8655510675129833, "grad_norm": 1.484375, "learning_rate": 0.0004936374226730022, "loss": 6.2777, "mean_token_accuracy": 0.1658060982823372, "num_tokens": 18998611.0, "step": 7500 }, { "entropy": 6.413336277008057, "epoch": 0.8661281015579919, "grad_norm": 2.03125, "learning_rate": 0.0004936276753134666, "loss": 6.2949, "mean_token_accuracy": 0.15621051490306853, "num_tokens": 19012117.0, "step": 7505 }, { "entropy": 6.277068948745727, "epoch": 0.8667051356030006, "grad_norm": 1.0390625, "learning_rate": 0.0004936179206004976, "loss": 6.1665, "mean_token_accuracy": 0.16537234038114548, "num_tokens": 19024075.0, "step": 7510 }, { "entropy": 6.416962480545044, "epoch": 0.8672821696480092, "grad_norm": 1.671875, "learning_rate": 0.0004936081585344236, "loss": 6.3606, "mean_token_accuracy": 0.15432593673467637, "num_tokens": 19037350.0, "step": 7515 }, { "entropy": 6.509782838821411, "epoch": 0.8678592036930178, "grad_norm": 1.1875, "learning_rate": 0.0004935983891155727, "loss": 6.3553, "mean_token_accuracy": 0.15507148206233978, "num_tokens": 19049438.0, "step": 7520 }, { "entropy": 6.379511880874634, "epoch": 0.8684362377380266, "grad_norm": 1.2734375, "learning_rate": 0.0004935886123442737, "loss": 6.3226, "mean_token_accuracy": 0.15508285611867906, "num_tokens": 19061689.0, "step": 7525 }, { "entropy": 6.466004753112793, "epoch": 0.8690132717830352, "grad_norm": 1.4140625, "learning_rate": 0.0004935788282208551, "loss": 6.3727, "mean_token_accuracy": 0.15051396191120148, "num_tokens": 19075606.0, "step": 7530 }, { "entropy": 6.3925048351287845, "epoch": 0.8695903058280439, "grad_norm": 1.34375, "learning_rate": 0.0004935690367456464, "loss": 6.2911, "mean_token_accuracy": 0.15860063582658768, "num_tokens": 19088248.0, "step": 7535 }, { "entropy": 6.416834545135498, "epoch": 0.8701673398730525, "grad_norm": 1.6875, "learning_rate": 0.0004935592379189766, "loss": 6.2637, "mean_token_accuracy": 0.1581605017185211, "num_tokens": 19102480.0, "step": 7540 }, { "entropy": 6.363423204421997, "epoch": 0.8707443739180611, "grad_norm": 1.390625, "learning_rate": 0.0004935494317411754, "loss": 6.2578, "mean_token_accuracy": 0.16764952838420868, "num_tokens": 19114454.0, "step": 7545 }, { "entropy": 6.3521568298339846, "epoch": 0.8713214079630698, "grad_norm": 1.640625, "learning_rate": 0.0004935396182125726, "loss": 6.2943, "mean_token_accuracy": 0.16149284839630126, "num_tokens": 19126709.0, "step": 7550 }, { "entropy": 6.3308103561401365, "epoch": 0.8718984420080784, "grad_norm": 1.390625, "learning_rate": 0.0004935297973334983, "loss": 6.2911, "mean_token_accuracy": 0.1629858657717705, "num_tokens": 19138831.0, "step": 7555 }, { "entropy": 6.431607007980347, "epoch": 0.8724754760530872, "grad_norm": 2.046875, "learning_rate": 0.0004935199691042828, "loss": 6.1944, "mean_token_accuracy": 0.1633341908454895, "num_tokens": 19151555.0, "step": 7560 }, { "entropy": 6.300298261642456, "epoch": 0.8730525100980958, "grad_norm": 1.5, "learning_rate": 0.0004935101335252568, "loss": 6.2575, "mean_token_accuracy": 0.16245049238204956, "num_tokens": 19164557.0, "step": 7565 }, { "entropy": 6.392845678329468, "epoch": 0.8736295441431045, "grad_norm": 1.3125, "learning_rate": 0.0004935002905967509, "loss": 6.3803, "mean_token_accuracy": 0.15307363122701645, "num_tokens": 19177081.0, "step": 7570 }, { "entropy": 6.405813980102539, "epoch": 0.8742065781881131, "grad_norm": 1.1953125, "learning_rate": 0.0004934904403190963, "loss": 6.223, "mean_token_accuracy": 0.15920666754245758, "num_tokens": 19190209.0, "step": 7575 }, { "entropy": 6.415853786468506, "epoch": 0.8747836122331217, "grad_norm": 1.453125, "learning_rate": 0.0004934805826926242, "loss": 6.2746, "mean_token_accuracy": 0.1588641032576561, "num_tokens": 19202262.0, "step": 7580 }, { "entropy": 6.336044120788574, "epoch": 0.8753606462781304, "grad_norm": 1.4453125, "learning_rate": 0.0004934707177176663, "loss": 6.3027, "mean_token_accuracy": 0.15697792172431946, "num_tokens": 19214752.0, "step": 7585 }, { "entropy": 6.4314311981201175, "epoch": 0.875937680323139, "grad_norm": 1.453125, "learning_rate": 0.0004934608453945543, "loss": 6.3528, "mean_token_accuracy": 0.1546017959713936, "num_tokens": 19227320.0, "step": 7590 }, { "entropy": 6.463335561752319, "epoch": 0.8765147143681478, "grad_norm": 1.28125, "learning_rate": 0.0004934509657236203, "loss": 6.33, "mean_token_accuracy": 0.15523393899202348, "num_tokens": 19239571.0, "step": 7595 }, { "entropy": 6.394824266433716, "epoch": 0.8770917484131564, "grad_norm": 1.265625, "learning_rate": 0.0004934410787051965, "loss": 6.2782, "mean_token_accuracy": 0.16422777026891708, "num_tokens": 19252242.0, "step": 7600 }, { "entropy": 6.398877048492432, "epoch": 0.877668782458165, "grad_norm": 1.46875, "learning_rate": 0.0004934311843396157, "loss": 6.3362, "mean_token_accuracy": 0.16020542681217192, "num_tokens": 19265501.0, "step": 7605 }, { "entropy": 6.389577150344849, "epoch": 0.8782458165031737, "grad_norm": 1.28125, "learning_rate": 0.0004934212826272104, "loss": 6.1916, "mean_token_accuracy": 0.1710354968905449, "num_tokens": 19278152.0, "step": 7610 }, { "entropy": 6.268189096450806, "epoch": 0.8788228505481823, "grad_norm": 1.296875, "learning_rate": 0.0004934113735683137, "loss": 6.3076, "mean_token_accuracy": 0.15756093189120293, "num_tokens": 19290555.0, "step": 7615 }, { "entropy": 6.378724002838135, "epoch": 0.879399884593191, "grad_norm": 1.234375, "learning_rate": 0.000493401457163259, "loss": 6.252, "mean_token_accuracy": 0.16543366014957428, "num_tokens": 19302866.0, "step": 7620 }, { "entropy": 6.493717765808105, "epoch": 0.8799769186381996, "grad_norm": 2.453125, "learning_rate": 0.0004933915334123798, "loss": 6.349, "mean_token_accuracy": 0.15103889033198356, "num_tokens": 19315577.0, "step": 7625 }, { "entropy": 6.472537183761597, "epoch": 0.8805539526832084, "grad_norm": 2.28125, "learning_rate": 0.0004933816023160099, "loss": 6.3288, "mean_token_accuracy": 0.15646580904722213, "num_tokens": 19328593.0, "step": 7630 }, { "entropy": 6.432592248916626, "epoch": 0.881130986728217, "grad_norm": 1.3828125, "learning_rate": 0.0004933716638744832, "loss": 6.2837, "mean_token_accuracy": 0.1658412992954254, "num_tokens": 19341669.0, "step": 7635 }, { "entropy": 6.324086666107178, "epoch": 0.8817080207732256, "grad_norm": 1.4140625, "learning_rate": 0.000493361718088134, "loss": 6.2859, "mean_token_accuracy": 0.15649446547031404, "num_tokens": 19354268.0, "step": 7640 }, { "entropy": 6.411100578308106, "epoch": 0.8822850548182343, "grad_norm": 1.4140625, "learning_rate": 0.000493351764957297, "loss": 6.3361, "mean_token_accuracy": 0.15419866889715195, "num_tokens": 19367676.0, "step": 7645 }, { "entropy": 6.486693906784057, "epoch": 0.8828620888632429, "grad_norm": 1.1875, "learning_rate": 0.0004933418044823068, "loss": 6.3086, "mean_token_accuracy": 0.16112906634807586, "num_tokens": 19380726.0, "step": 7650 }, { "entropy": 6.410530614852905, "epoch": 0.8834391229082516, "grad_norm": 1.421875, "learning_rate": 0.0004933318366634984, "loss": 6.3102, "mean_token_accuracy": 0.15761423408985137, "num_tokens": 19392917.0, "step": 7655 }, { "entropy": 6.391311740875244, "epoch": 0.8840161569532602, "grad_norm": 2.25, "learning_rate": 0.0004933218615012072, "loss": 6.3448, "mean_token_accuracy": 0.1594384342432022, "num_tokens": 19406026.0, "step": 7660 }, { "entropy": 6.393275213241577, "epoch": 0.8845931909982689, "grad_norm": 1.4921875, "learning_rate": 0.0004933118789957687, "loss": 6.2815, "mean_token_accuracy": 0.1612059071660042, "num_tokens": 19418612.0, "step": 7665 }, { "entropy": 6.414052724838257, "epoch": 0.8851702250432776, "grad_norm": 1.328125, "learning_rate": 0.0004933018891475186, "loss": 6.3248, "mean_token_accuracy": 0.1564637005329132, "num_tokens": 19430746.0, "step": 7670 }, { "entropy": 6.396469593048096, "epoch": 0.8857472590882862, "grad_norm": 1.4765625, "learning_rate": 0.0004932918919567927, "loss": 6.3689, "mean_token_accuracy": 0.1536492109298706, "num_tokens": 19443043.0, "step": 7675 }, { "entropy": 6.478463459014892, "epoch": 0.8863242931332949, "grad_norm": 1.5546875, "learning_rate": 0.0004932818874239275, "loss": 6.3276, "mean_token_accuracy": 0.15937264189124106, "num_tokens": 19456463.0, "step": 7680 }, { "entropy": 6.444648313522339, "epoch": 0.8869013271783035, "grad_norm": 1.6328125, "learning_rate": 0.0004932718755492595, "loss": 6.305, "mean_token_accuracy": 0.15255717635154725, "num_tokens": 19468108.0, "step": 7685 }, { "entropy": 6.367991638183594, "epoch": 0.8874783612233121, "grad_norm": 1.75, "learning_rate": 0.0004932618563331254, "loss": 6.3265, "mean_token_accuracy": 0.15850533843040465, "num_tokens": 19480741.0, "step": 7690 }, { "entropy": 6.35459451675415, "epoch": 0.8880553952683208, "grad_norm": 1.4453125, "learning_rate": 0.0004932518297758622, "loss": 6.2542, "mean_token_accuracy": 0.1637923687696457, "num_tokens": 19492996.0, "step": 7695 }, { "entropy": 6.439085531234741, "epoch": 0.8886324293133295, "grad_norm": 1.21875, "learning_rate": 0.0004932417958778071, "loss": 6.2594, "mean_token_accuracy": 0.16098986119031905, "num_tokens": 19505513.0, "step": 7700 }, { "entropy": 6.417087125778198, "epoch": 0.8892094633583382, "grad_norm": 1.328125, "learning_rate": 0.0004932317546392976, "loss": 6.3979, "mean_token_accuracy": 0.15393300205469132, "num_tokens": 19518244.0, "step": 7705 }, { "entropy": 6.320071363449097, "epoch": 0.8897864974033468, "grad_norm": 2.46875, "learning_rate": 0.0004932217060606714, "loss": 6.2906, "mean_token_accuracy": 0.1595987156033516, "num_tokens": 19530987.0, "step": 7710 }, { "entropy": 6.3398231029510494, "epoch": 0.8903635314483554, "grad_norm": 1.1796875, "learning_rate": 0.0004932116501422665, "loss": 6.2154, "mean_token_accuracy": 0.1674814835190773, "num_tokens": 19543546.0, "step": 7715 }, { "entropy": 6.446526670455933, "epoch": 0.8909405654933641, "grad_norm": 1.3984375, "learning_rate": 0.0004932015868844211, "loss": 6.2946, "mean_token_accuracy": 0.1571994751691818, "num_tokens": 19556867.0, "step": 7720 }, { "entropy": 6.37026309967041, "epoch": 0.8915175995383727, "grad_norm": 1.5625, "learning_rate": 0.0004931915162874738, "loss": 6.2828, "mean_token_accuracy": 0.15851514786481857, "num_tokens": 19569738.0, "step": 7725 }, { "entropy": 6.363567304611206, "epoch": 0.8920946335833814, "grad_norm": 1.75, "learning_rate": 0.0004931814383517632, "loss": 6.3218, "mean_token_accuracy": 0.15662410855293274, "num_tokens": 19581701.0, "step": 7730 }, { "entropy": 6.377171468734741, "epoch": 0.8926716676283901, "grad_norm": 1.4453125, "learning_rate": 0.0004931713530776284, "loss": 6.247, "mean_token_accuracy": 0.16711300909519194, "num_tokens": 19593698.0, "step": 7735 }, { "entropy": 6.349302959442139, "epoch": 0.8932487016733988, "grad_norm": 1.234375, "learning_rate": 0.0004931612604654083, "loss": 6.303, "mean_token_accuracy": 0.15497682094573975, "num_tokens": 19605323.0, "step": 7740 }, { "entropy": 6.404062414169312, "epoch": 0.8938257357184074, "grad_norm": 1.3203125, "learning_rate": 0.0004931511605154428, "loss": 6.3447, "mean_token_accuracy": 0.1544952780008316, "num_tokens": 19616577.0, "step": 7745 }, { "entropy": 6.473753356933594, "epoch": 0.894402769763416, "grad_norm": 3.046875, "learning_rate": 0.0004931410532280711, "loss": 6.2382, "mean_token_accuracy": 0.15787958949804307, "num_tokens": 19629177.0, "step": 7750 }, { "entropy": 6.344061231613159, "epoch": 0.8949798038084247, "grad_norm": 2.109375, "learning_rate": 0.0004931309386036337, "loss": 6.2839, "mean_token_accuracy": 0.15972928553819657, "num_tokens": 19642170.0, "step": 7755 }, { "entropy": 6.308340644836425, "epoch": 0.8955568378534333, "grad_norm": 4.59375, "learning_rate": 0.0004931208166424704, "loss": 6.2324, "mean_token_accuracy": 0.16119810193777084, "num_tokens": 19655648.0, "step": 7760 }, { "entropy": 6.403913593292236, "epoch": 0.896133871898442, "grad_norm": 1.15625, "learning_rate": 0.0004931106873449219, "loss": 6.2052, "mean_token_accuracy": 0.16124669313430787, "num_tokens": 19667941.0, "step": 7765 }, { "entropy": 6.437334489822388, "epoch": 0.8967109059434507, "grad_norm": 1.390625, "learning_rate": 0.0004931005507113285, "loss": 6.3193, "mean_token_accuracy": 0.1630260318517685, "num_tokens": 19680523.0, "step": 7770 }, { "entropy": 6.261597490310669, "epoch": 0.8972879399884593, "grad_norm": 1.3984375, "learning_rate": 0.0004930904067420317, "loss": 6.276, "mean_token_accuracy": 0.16263071596622466, "num_tokens": 19692984.0, "step": 7775 }, { "entropy": 6.432254409790039, "epoch": 0.897864974033468, "grad_norm": 4.71875, "learning_rate": 0.0004930802554373723, "loss": 6.2354, "mean_token_accuracy": 0.16485002189874648, "num_tokens": 19705926.0, "step": 7780 }, { "entropy": 6.449591398239136, "epoch": 0.8984420080784766, "grad_norm": 1.4453125, "learning_rate": 0.0004930700967976918, "loss": 6.2797, "mean_token_accuracy": 0.16124334186315536, "num_tokens": 19717322.0, "step": 7785 }, { "entropy": 6.39738130569458, "epoch": 0.8990190421234853, "grad_norm": 1.578125, "learning_rate": 0.000493059930823332, "loss": 6.2975, "mean_token_accuracy": 0.14967879951000213, "num_tokens": 19730577.0, "step": 7790 }, { "entropy": 6.44396858215332, "epoch": 0.8995960761684939, "grad_norm": 2.125, "learning_rate": 0.0004930497575146346, "loss": 6.3116, "mean_token_accuracy": 0.15643653869628907, "num_tokens": 19744054.0, "step": 7795 }, { "entropy": 6.342684650421143, "epoch": 0.9001731102135025, "grad_norm": 1.25, "learning_rate": 0.0004930395768719421, "loss": 6.2894, "mean_token_accuracy": 0.1550717294216156, "num_tokens": 19755898.0, "step": 7800 }, { "entropy": 6.396816730499268, "epoch": 0.9007501442585113, "grad_norm": 1.1640625, "learning_rate": 0.0004930293888955966, "loss": 6.3557, "mean_token_accuracy": 0.15300133675336838, "num_tokens": 19769599.0, "step": 7805 }, { "entropy": 6.453741598129272, "epoch": 0.9013271783035199, "grad_norm": 1.34375, "learning_rate": 0.000493019193585941, "loss": 6.3723, "mean_token_accuracy": 0.14918754994869232, "num_tokens": 19783442.0, "step": 7810 }, { "entropy": 6.4418963432312015, "epoch": 0.9019042123485286, "grad_norm": 2.046875, "learning_rate": 0.000493008990943318, "loss": 6.3659, "mean_token_accuracy": 0.15801341980695724, "num_tokens": 19796039.0, "step": 7815 }, { "entropy": 6.478892612457275, "epoch": 0.9024812463935372, "grad_norm": 2.375, "learning_rate": 0.0004929987809680709, "loss": 6.3283, "mean_token_accuracy": 0.16183366179466246, "num_tokens": 19808695.0, "step": 7820 }, { "entropy": 6.390950679779053, "epoch": 0.9030582804385459, "grad_norm": 1.2890625, "learning_rate": 0.0004929885636605432, "loss": 6.2872, "mean_token_accuracy": 0.15758599042892457, "num_tokens": 19821173.0, "step": 7825 }, { "entropy": 6.370595455169678, "epoch": 0.9036353144835545, "grad_norm": 1.5390625, "learning_rate": 0.0004929783390210784, "loss": 6.3441, "mean_token_accuracy": 0.15149060785770416, "num_tokens": 19833804.0, "step": 7830 }, { "entropy": 6.405590677261353, "epoch": 0.9042123485285631, "grad_norm": 2.3125, "learning_rate": 0.0004929681070500204, "loss": 6.2947, "mean_token_accuracy": 0.1585235998034477, "num_tokens": 19845690.0, "step": 7835 }, { "entropy": 6.453483057022095, "epoch": 0.9047893825735719, "grad_norm": 1.1328125, "learning_rate": 0.0004929578677477135, "loss": 6.3082, "mean_token_accuracy": 0.1503335326910019, "num_tokens": 19859463.0, "step": 7840 }, { "entropy": 6.3136523246765135, "epoch": 0.9053664166185805, "grad_norm": 1.3984375, "learning_rate": 0.0004929476211145019, "loss": 6.1993, "mean_token_accuracy": 0.16918923556804658, "num_tokens": 19872168.0, "step": 7845 }, { "entropy": 6.331404352188111, "epoch": 0.9059434506635892, "grad_norm": 1.3984375, "learning_rate": 0.0004929373671507303, "loss": 6.2647, "mean_token_accuracy": 0.16442092657089233, "num_tokens": 19884927.0, "step": 7850 }, { "entropy": 6.3881467342376705, "epoch": 0.9065204847085978, "grad_norm": 1.3515625, "learning_rate": 0.0004929271058567436, "loss": 6.2781, "mean_token_accuracy": 0.16083337366580963, "num_tokens": 19897105.0, "step": 7855 }, { "entropy": 6.376621198654175, "epoch": 0.9070975187536064, "grad_norm": 1.4765625, "learning_rate": 0.000492916837232887, "loss": 6.2943, "mean_token_accuracy": 0.1583924874663353, "num_tokens": 19909973.0, "step": 7860 }, { "entropy": 6.371397638320923, "epoch": 0.9076745527986151, "grad_norm": 1.3203125, "learning_rate": 0.0004929065612795058, "loss": 6.2893, "mean_token_accuracy": 0.1654267877340317, "num_tokens": 19923674.0, "step": 7865 }, { "entropy": 6.401323223114014, "epoch": 0.9082515868436237, "grad_norm": 1.328125, "learning_rate": 0.0004928962779969456, "loss": 6.3279, "mean_token_accuracy": 0.1563215509057045, "num_tokens": 19935742.0, "step": 7870 }, { "entropy": 6.431182050704956, "epoch": 0.9088286208886325, "grad_norm": 1.9140625, "learning_rate": 0.0004928859873855524, "loss": 6.2985, "mean_token_accuracy": 0.15487526804208757, "num_tokens": 19947945.0, "step": 7875 }, { "entropy": 6.463040542602539, "epoch": 0.9094056549336411, "grad_norm": 1.1015625, "learning_rate": 0.0004928756894456723, "loss": 6.2667, "mean_token_accuracy": 0.16083851903676988, "num_tokens": 19961275.0, "step": 7880 }, { "entropy": 6.431319952011108, "epoch": 0.9099826889786498, "grad_norm": 1.28125, "learning_rate": 0.0004928653841776515, "loss": 6.3134, "mean_token_accuracy": 0.15611430555582045, "num_tokens": 19973634.0, "step": 7885 }, { "entropy": 6.450580596923828, "epoch": 0.9105597230236584, "grad_norm": 1.203125, "learning_rate": 0.0004928550715818368, "loss": 6.3138, "mean_token_accuracy": 0.15701612830162048, "num_tokens": 19985920.0, "step": 7890 }, { "entropy": 6.391114807128906, "epoch": 0.911136757068667, "grad_norm": 1.203125, "learning_rate": 0.0004928447516585749, "loss": 6.3351, "mean_token_accuracy": 0.15266132205724717, "num_tokens": 19999081.0, "step": 7895 }, { "entropy": 6.3048357486724855, "epoch": 0.9117137911136757, "grad_norm": 1.28125, "learning_rate": 0.000492834424408213, "loss": 6.2833, "mean_token_accuracy": 0.16531692892313005, "num_tokens": 20012801.0, "step": 7900 }, { "entropy": 6.479332065582275, "epoch": 0.9122908251586843, "grad_norm": 1.3515625, "learning_rate": 0.0004928240898310984, "loss": 6.3693, "mean_token_accuracy": 0.15050050467252732, "num_tokens": 20024618.0, "step": 7905 }, { "entropy": 6.47349362373352, "epoch": 0.9128678592036931, "grad_norm": 1.765625, "learning_rate": 0.0004928137479275789, "loss": 6.3076, "mean_token_accuracy": 0.16095187067985534, "num_tokens": 20038587.0, "step": 7910 }, { "entropy": 6.414200925827027, "epoch": 0.9134448932487017, "grad_norm": 2.015625, "learning_rate": 0.000492803398698002, "loss": 6.3259, "mean_token_accuracy": 0.15401843264698983, "num_tokens": 20051811.0, "step": 7915 }, { "entropy": 6.4483012676239015, "epoch": 0.9140219272937103, "grad_norm": 1.40625, "learning_rate": 0.0004927930421427161, "loss": 6.3042, "mean_token_accuracy": 0.15708602219820023, "num_tokens": 20064463.0, "step": 7920 }, { "entropy": 6.372395849227905, "epoch": 0.914598961338719, "grad_norm": 5.53125, "learning_rate": 0.0004927826782620694, "loss": 6.3181, "mean_token_accuracy": 0.1550089493393898, "num_tokens": 20076614.0, "step": 7925 }, { "entropy": 6.468643712997436, "epoch": 0.9151759953837276, "grad_norm": 1.7890625, "learning_rate": 0.0004927723070564104, "loss": 6.4253, "mean_token_accuracy": 0.15085637867450713, "num_tokens": 20090395.0, "step": 7930 }, { "entropy": 6.419011640548706, "epoch": 0.9157530294287363, "grad_norm": 1.28125, "learning_rate": 0.0004927619285260881, "loss": 6.3461, "mean_token_accuracy": 0.15481395423412322, "num_tokens": 20102736.0, "step": 7935 }, { "entropy": 6.410750818252564, "epoch": 0.9163300634737449, "grad_norm": 1.3828125, "learning_rate": 0.0004927515426714515, "loss": 6.321, "mean_token_accuracy": 0.15636474043130874, "num_tokens": 20116516.0, "step": 7940 }, { "entropy": 6.385376882553101, "epoch": 0.9169070975187537, "grad_norm": 1.3828125, "learning_rate": 0.00049274114949285, "loss": 6.291, "mean_token_accuracy": 0.16122057735919954, "num_tokens": 20128742.0, "step": 7945 }, { "entropy": 6.438413190841675, "epoch": 0.9174841315637623, "grad_norm": 1.53125, "learning_rate": 0.000492730748990633, "loss": 6.2602, "mean_token_accuracy": 0.1578374445438385, "num_tokens": 20140590.0, "step": 7950 }, { "entropy": 6.3685081005096436, "epoch": 0.9180611656087709, "grad_norm": 1.5, "learning_rate": 0.0004927203411651504, "loss": 6.2941, "mean_token_accuracy": 0.15343682318925858, "num_tokens": 20153748.0, "step": 7955 }, { "entropy": 6.46742205619812, "epoch": 0.9186381996537796, "grad_norm": 1.2734375, "learning_rate": 0.0004927099260167523, "loss": 6.2976, "mean_token_accuracy": 0.1620119497179985, "num_tokens": 20167094.0, "step": 7960 }, { "entropy": 6.400900650024414, "epoch": 0.9192152336987882, "grad_norm": 1.6015625, "learning_rate": 0.0004926995035457889, "loss": 6.2755, "mean_token_accuracy": 0.15437212586402893, "num_tokens": 20180716.0, "step": 7965 }, { "entropy": 6.422587203979492, "epoch": 0.9197922677437969, "grad_norm": 1.921875, "learning_rate": 0.000492689073752611, "loss": 6.3306, "mean_token_accuracy": 0.158352267742157, "num_tokens": 20192214.0, "step": 7970 }, { "entropy": 6.322636461257934, "epoch": 0.9203693017888055, "grad_norm": 1.984375, "learning_rate": 0.0004926786366375691, "loss": 6.186, "mean_token_accuracy": 0.159789976477623, "num_tokens": 20204789.0, "step": 7975 }, { "entropy": 6.395492315292358, "epoch": 0.9209463358338142, "grad_norm": 1.734375, "learning_rate": 0.0004926681922010145, "loss": 6.2937, "mean_token_accuracy": 0.15341563820838927, "num_tokens": 20217318.0, "step": 7980 }, { "entropy": 6.503517580032349, "epoch": 0.9215233698788229, "grad_norm": 1.296875, "learning_rate": 0.0004926577404432982, "loss": 6.2776, "mean_token_accuracy": 0.15594429075717925, "num_tokens": 20229757.0, "step": 7985 }, { "entropy": 6.401009654998779, "epoch": 0.9221004039238315, "grad_norm": 1.5, "learning_rate": 0.0004926472813647721, "loss": 6.3206, "mean_token_accuracy": 0.1593426927924156, "num_tokens": 20242042.0, "step": 7990 }, { "entropy": 6.317966318130493, "epoch": 0.9226774379688402, "grad_norm": 1.3671875, "learning_rate": 0.0004926368149657876, "loss": 6.2308, "mean_token_accuracy": 0.16747417151927949, "num_tokens": 20255188.0, "step": 7995 }, { "entropy": 6.4740152835845945, "epoch": 0.9232544720138488, "grad_norm": 1.4765625, "learning_rate": 0.0004926263412466972, "loss": 6.2961, "mean_token_accuracy": 0.16103923618793486, "num_tokens": 20267359.0, "step": 8000 }, { "entropy": 6.388199758529663, "epoch": 0.9238315060588574, "grad_norm": 1.6953125, "learning_rate": 0.0004926158602078527, "loss": 6.3689, "mean_token_accuracy": 0.15565205961465836, "num_tokens": 20280023.0, "step": 8005 }, { "entropy": 6.334804201126099, "epoch": 0.9244085401038661, "grad_norm": 2.171875, "learning_rate": 0.0004926053718496069, "loss": 6.2985, "mean_token_accuracy": 0.15743525475263595, "num_tokens": 20293043.0, "step": 8010 }, { "entropy": 6.403419828414917, "epoch": 0.9249855741488748, "grad_norm": 1.203125, "learning_rate": 0.0004925948761723126, "loss": 6.247, "mean_token_accuracy": 0.15326788574457167, "num_tokens": 20304929.0, "step": 8015 }, { "entropy": 6.409779071807861, "epoch": 0.9255626081938835, "grad_norm": 1.265625, "learning_rate": 0.0004925843731763226, "loss": 6.242, "mean_token_accuracy": 0.15896770507097244, "num_tokens": 20317024.0, "step": 8020 }, { "entropy": 6.434144783020019, "epoch": 0.9261396422388921, "grad_norm": 2.046875, "learning_rate": 0.0004925738628619904, "loss": 6.3182, "mean_token_accuracy": 0.1545105457305908, "num_tokens": 20329909.0, "step": 8025 }, { "entropy": 6.324703788757324, "epoch": 0.9267166762839008, "grad_norm": 1.234375, "learning_rate": 0.0004925633452296693, "loss": 6.28, "mean_token_accuracy": 0.15805017352104186, "num_tokens": 20344224.0, "step": 8030 }, { "entropy": 6.506214904785156, "epoch": 0.9272937103289094, "grad_norm": 1.3671875, "learning_rate": 0.0004925528202797131, "loss": 6.3046, "mean_token_accuracy": 0.15081962794065476, "num_tokens": 20357393.0, "step": 8035 }, { "entropy": 6.424812507629395, "epoch": 0.927870744373918, "grad_norm": 1.6875, "learning_rate": 0.0004925422880124761, "loss": 6.3061, "mean_token_accuracy": 0.16021231263875962, "num_tokens": 20369551.0, "step": 8040 }, { "entropy": 6.379309225082397, "epoch": 0.9284477784189267, "grad_norm": 1.4140625, "learning_rate": 0.0004925317484283121, "loss": 6.4167, "mean_token_accuracy": 0.14904050678014755, "num_tokens": 20382639.0, "step": 8045 }, { "entropy": 6.429602766036988, "epoch": 0.9290248124639354, "grad_norm": 1.2578125, "learning_rate": 0.0004925212015275758, "loss": 6.2348, "mean_token_accuracy": 0.16726955473423005, "num_tokens": 20394751.0, "step": 8050 }, { "entropy": 6.39623794555664, "epoch": 0.9296018465089441, "grad_norm": 1.46875, "learning_rate": 0.000492510647310622, "loss": 6.2848, "mean_token_accuracy": 0.1595268651843071, "num_tokens": 20408235.0, "step": 8055 }, { "entropy": 6.398084878921509, "epoch": 0.9301788805539527, "grad_norm": 1.4921875, "learning_rate": 0.0004925000857778055, "loss": 6.3392, "mean_token_accuracy": 0.15427375137805938, "num_tokens": 20423063.0, "step": 8060 }, { "entropy": 6.427191162109375, "epoch": 0.9307559145989613, "grad_norm": 1.1953125, "learning_rate": 0.0004924895169294818, "loss": 6.2369, "mean_token_accuracy": 0.1577201783657074, "num_tokens": 20436225.0, "step": 8065 }, { "entropy": 6.4034092903137205, "epoch": 0.93133294864397, "grad_norm": 2.0, "learning_rate": 0.0004924789407660062, "loss": 6.3375, "mean_token_accuracy": 0.1600277066230774, "num_tokens": 20447957.0, "step": 8070 }, { "entropy": 6.381423425674439, "epoch": 0.9319099826889786, "grad_norm": 2.21875, "learning_rate": 0.0004924683572877345, "loss": 6.2226, "mean_token_accuracy": 0.16029435247182847, "num_tokens": 20459836.0, "step": 8075 }, { "entropy": 6.533320760726928, "epoch": 0.9324870167339873, "grad_norm": 1.171875, "learning_rate": 0.0004924577664950225, "loss": 6.3824, "mean_token_accuracy": 0.15089137703180314, "num_tokens": 20471907.0, "step": 8080 }, { "entropy": 6.440421152114868, "epoch": 0.933064050778996, "grad_norm": 1.1796875, "learning_rate": 0.0004924471683882266, "loss": 6.3825, "mean_token_accuracy": 0.15363826006650924, "num_tokens": 20485166.0, "step": 8085 }, { "entropy": 6.420388221740723, "epoch": 0.9336410848240047, "grad_norm": 1.2421875, "learning_rate": 0.0004924365629677031, "loss": 6.1845, "mean_token_accuracy": 0.16712835282087327, "num_tokens": 20498973.0, "step": 8090 }, { "entropy": 6.355935859680176, "epoch": 0.9342181188690133, "grad_norm": 1.3046875, "learning_rate": 0.000492425950233809, "loss": 6.2747, "mean_token_accuracy": 0.16278841942548752, "num_tokens": 20511615.0, "step": 8095 }, { "entropy": 6.3108885288238525, "epoch": 0.9347951529140219, "grad_norm": 1.1328125, "learning_rate": 0.000492415330186901, "loss": 6.2678, "mean_token_accuracy": 0.15716547816991805, "num_tokens": 20523615.0, "step": 8100 }, { "entropy": 6.421422386169434, "epoch": 0.9353721869590306, "grad_norm": 1.40625, "learning_rate": 0.0004924047028273364, "loss": 6.2418, "mean_token_accuracy": 0.15872604250907899, "num_tokens": 20537048.0, "step": 8105 }, { "entropy": 6.393527889251709, "epoch": 0.9359492210040392, "grad_norm": 1.546875, "learning_rate": 0.0004923940681554725, "loss": 6.301, "mean_token_accuracy": 0.1614370346069336, "num_tokens": 20551041.0, "step": 8110 }, { "entropy": 6.415983819961548, "epoch": 0.9365262550490479, "grad_norm": 2.21875, "learning_rate": 0.0004923834261716672, "loss": 6.3455, "mean_token_accuracy": 0.15478847175836563, "num_tokens": 20563123.0, "step": 8115 }, { "entropy": 6.448668527603149, "epoch": 0.9371032890940566, "grad_norm": 2.75, "learning_rate": 0.0004923727768762782, "loss": 6.2795, "mean_token_accuracy": 0.16725585907697677, "num_tokens": 20577487.0, "step": 8120 }, { "entropy": 6.402075386047363, "epoch": 0.9376803231390652, "grad_norm": 1.3828125, "learning_rate": 0.000492362120269664, "loss": 6.2682, "mean_token_accuracy": 0.1627908691763878, "num_tokens": 20590125.0, "step": 8125 }, { "entropy": 6.418191576004029, "epoch": 0.9382573571840739, "grad_norm": 1.203125, "learning_rate": 0.0004923514563521827, "loss": 6.3141, "mean_token_accuracy": 0.15729555934667588, "num_tokens": 20603035.0, "step": 8130 }, { "entropy": 6.403626775741577, "epoch": 0.9388343912290825, "grad_norm": 1.328125, "learning_rate": 0.0004923407851241933, "loss": 6.2841, "mean_token_accuracy": 0.15334731638431548, "num_tokens": 20615280.0, "step": 8135 }, { "entropy": 6.4232524871826175, "epoch": 0.9394114252740912, "grad_norm": 1.4453125, "learning_rate": 0.0004923301065860545, "loss": 6.2766, "mean_token_accuracy": 0.15411915630102158, "num_tokens": 20627800.0, "step": 8140 }, { "entropy": 6.412774085998535, "epoch": 0.9399884593190998, "grad_norm": 1.515625, "learning_rate": 0.0004923194207381254, "loss": 6.2985, "mean_token_accuracy": 0.15818233788013458, "num_tokens": 20639264.0, "step": 8145 }, { "entropy": 6.378032875061035, "epoch": 0.9405654933641084, "grad_norm": 1.5390625, "learning_rate": 0.0004923087275807656, "loss": 6.2204, "mean_token_accuracy": 0.1706040620803833, "num_tokens": 20652155.0, "step": 8150 }, { "entropy": 6.391241407394409, "epoch": 0.9411425274091172, "grad_norm": 3.296875, "learning_rate": 0.0004922980271143347, "loss": 6.3063, "mean_token_accuracy": 0.15853582173585892, "num_tokens": 20665642.0, "step": 8155 }, { "entropy": 6.422382640838623, "epoch": 0.9417195614541258, "grad_norm": 1.34375, "learning_rate": 0.0004922873193391927, "loss": 6.2504, "mean_token_accuracy": 0.16132109612226486, "num_tokens": 20678685.0, "step": 8160 }, { "entropy": 6.333035278320312, "epoch": 0.9422965954991345, "grad_norm": 1.53125, "learning_rate": 0.0004922766042556994, "loss": 6.21, "mean_token_accuracy": 0.15850515216588973, "num_tokens": 20690714.0, "step": 8165 }, { "entropy": 6.418743991851807, "epoch": 0.9428736295441431, "grad_norm": 1.3203125, "learning_rate": 0.0004922658818642156, "loss": 6.3091, "mean_token_accuracy": 0.1515625908970833, "num_tokens": 20703316.0, "step": 8170 }, { "entropy": 6.327837753295898, "epoch": 0.9434506635891518, "grad_norm": 1.28125, "learning_rate": 0.0004922551521651018, "loss": 6.204, "mean_token_accuracy": 0.1694895327091217, "num_tokens": 20716144.0, "step": 8175 }, { "entropy": 6.418542194366455, "epoch": 0.9440276976341604, "grad_norm": 1.203125, "learning_rate": 0.0004922444151587189, "loss": 6.2522, "mean_token_accuracy": 0.15802036374807357, "num_tokens": 20728089.0, "step": 8180 }, { "entropy": 6.298161745071411, "epoch": 0.944604731679169, "grad_norm": 1.3828125, "learning_rate": 0.0004922336708454279, "loss": 6.2609, "mean_token_accuracy": 0.16404679417610168, "num_tokens": 20741684.0, "step": 8185 }, { "entropy": 6.420363283157348, "epoch": 0.9451817657241778, "grad_norm": 1.1328125, "learning_rate": 0.0004922229192255903, "loss": 6.3386, "mean_token_accuracy": 0.15321814119815827, "num_tokens": 20754840.0, "step": 8190 }, { "entropy": 6.379177618026733, "epoch": 0.9457587997691864, "grad_norm": 1.390625, "learning_rate": 0.0004922121602995678, "loss": 6.2035, "mean_token_accuracy": 0.16860224455595016, "num_tokens": 20767528.0, "step": 8195 }, { "entropy": 6.300572204589844, "epoch": 0.9463358338141951, "grad_norm": 1.2890625, "learning_rate": 0.0004922013940677221, "loss": 6.2703, "mean_token_accuracy": 0.16143476068973542, "num_tokens": 20778886.0, "step": 8200 }, { "entropy": 6.394140338897705, "epoch": 0.9469128678592037, "grad_norm": 1.1171875, "learning_rate": 0.0004921906205304155, "loss": 6.2467, "mean_token_accuracy": 0.1543475106358528, "num_tokens": 20792928.0, "step": 8205 }, { "entropy": 6.387519454956054, "epoch": 0.9474899019042123, "grad_norm": 1.6328125, "learning_rate": 0.0004921798396880101, "loss": 6.2372, "mean_token_accuracy": 0.1540800616145134, "num_tokens": 20805766.0, "step": 8210 }, { "entropy": 6.3942780017852785, "epoch": 0.948066935949221, "grad_norm": 1.203125, "learning_rate": 0.0004921690515408688, "loss": 6.273, "mean_token_accuracy": 0.1582356408238411, "num_tokens": 20819008.0, "step": 8215 }, { "entropy": 6.369224262237549, "epoch": 0.9486439699942296, "grad_norm": 1.3671875, "learning_rate": 0.0004921582560893543, "loss": 6.3415, "mean_token_accuracy": 0.1553818851709366, "num_tokens": 20832706.0, "step": 8220 }, { "entropy": 6.4350669384002686, "epoch": 0.9492210040392384, "grad_norm": 1.5546875, "learning_rate": 0.0004921474533338297, "loss": 6.2547, "mean_token_accuracy": 0.16016023606061935, "num_tokens": 20844568.0, "step": 8225 }, { "entropy": 6.399309062957764, "epoch": 0.949798038084247, "grad_norm": 1.3828125, "learning_rate": 0.0004921366432746585, "loss": 6.2834, "mean_token_accuracy": 0.1573599874973297, "num_tokens": 20856157.0, "step": 8230 }, { "entropy": 6.362299489974975, "epoch": 0.9503750721292556, "grad_norm": 1.3671875, "learning_rate": 0.000492125825912204, "loss": 6.2712, "mean_token_accuracy": 0.16097963899374007, "num_tokens": 20868039.0, "step": 8235 }, { "entropy": 6.463052082061767, "epoch": 0.9509521061742643, "grad_norm": 1.578125, "learning_rate": 0.0004921150012468302, "loss": 6.2857, "mean_token_accuracy": 0.15774607434868812, "num_tokens": 20880190.0, "step": 8240 }, { "entropy": 6.41200098991394, "epoch": 0.9515291402192729, "grad_norm": 1.1875, "learning_rate": 0.0004921041692789013, "loss": 6.2571, "mean_token_accuracy": 0.16535381972789764, "num_tokens": 20892996.0, "step": 8245 }, { "entropy": 6.455173110961914, "epoch": 0.9521061742642816, "grad_norm": 1.953125, "learning_rate": 0.0004920933300087813, "loss": 6.3289, "mean_token_accuracy": 0.15742640495300292, "num_tokens": 20906080.0, "step": 8250 }, { "entropy": 6.430334520339966, "epoch": 0.9526832083092902, "grad_norm": 1.7109375, "learning_rate": 0.0004920824834368353, "loss": 6.3609, "mean_token_accuracy": 0.15268936306238173, "num_tokens": 20917944.0, "step": 8255 }, { "entropy": 6.340414762496948, "epoch": 0.953260242354299, "grad_norm": 2.46875, "learning_rate": 0.0004920716295634275, "loss": 6.2397, "mean_token_accuracy": 0.17364375591278075, "num_tokens": 20929046.0, "step": 8260 }, { "entropy": 6.455630874633789, "epoch": 0.9538372763993076, "grad_norm": 1.2578125, "learning_rate": 0.0004920607683889235, "loss": 6.3942, "mean_token_accuracy": 0.1561593271791935, "num_tokens": 20941643.0, "step": 8265 }, { "entropy": 6.538067293167114, "epoch": 0.9544143104443162, "grad_norm": 2.15625, "learning_rate": 0.0004920498999136882, "loss": 6.3306, "mean_token_accuracy": 0.1545989155769348, "num_tokens": 20954620.0, "step": 8270 }, { "entropy": 6.4215727806091305, "epoch": 0.9549913444893249, "grad_norm": 1.4140625, "learning_rate": 0.0004920390241380874, "loss": 6.3429, "mean_token_accuracy": 0.15070486068725586, "num_tokens": 20968033.0, "step": 8275 }, { "entropy": 6.422377824783325, "epoch": 0.9555683785343335, "grad_norm": 1.8203125, "learning_rate": 0.0004920281410624868, "loss": 6.2661, "mean_token_accuracy": 0.16499000191688537, "num_tokens": 20980586.0, "step": 8280 }, { "entropy": 6.349878549575806, "epoch": 0.9561454125793422, "grad_norm": 1.34375, "learning_rate": 0.0004920172506872525, "loss": 6.2084, "mean_token_accuracy": 0.16240258812904357, "num_tokens": 20992346.0, "step": 8285 }, { "entropy": 6.268904733657837, "epoch": 0.9567224466243508, "grad_norm": 1.65625, "learning_rate": 0.0004920063530127508, "loss": 6.1527, "mean_token_accuracy": 0.17184782773256302, "num_tokens": 21004399.0, "step": 8290 }, { "entropy": 6.457413578033448, "epoch": 0.9572994806693594, "grad_norm": 1.890625, "learning_rate": 0.0004919954480393482, "loss": 6.3675, "mean_token_accuracy": 0.1487828180193901, "num_tokens": 21017066.0, "step": 8295 }, { "entropy": 6.539893627166748, "epoch": 0.9578765147143682, "grad_norm": 2.53125, "learning_rate": 0.0004919845357674114, "loss": 6.4393, "mean_token_accuracy": 0.14757169634103776, "num_tokens": 21031664.0, "step": 8300 }, { "entropy": 6.500674772262573, "epoch": 0.9584535487593768, "grad_norm": 1.265625, "learning_rate": 0.0004919736161973076, "loss": 6.272, "mean_token_accuracy": 0.1634308248758316, "num_tokens": 21043980.0, "step": 8305 }, { "entropy": 6.353540134429932, "epoch": 0.9590305828043855, "grad_norm": 1.6953125, "learning_rate": 0.000491962689329404, "loss": 6.3015, "mean_token_accuracy": 0.15528810173273086, "num_tokens": 21056916.0, "step": 8310 }, { "entropy": 6.502210283279419, "epoch": 0.9596076168493941, "grad_norm": 1.6875, "learning_rate": 0.0004919517551640681, "loss": 6.3659, "mean_token_accuracy": 0.1515677571296692, "num_tokens": 21070027.0, "step": 8315 }, { "entropy": 6.526283597946167, "epoch": 0.9601846508944027, "grad_norm": 1.6328125, "learning_rate": 0.0004919408137016677, "loss": 6.3125, "mean_token_accuracy": 0.15769415199756623, "num_tokens": 21082596.0, "step": 8320 }, { "entropy": 6.284257698059082, "epoch": 0.9607616849394114, "grad_norm": 3.359375, "learning_rate": 0.0004919298649425708, "loss": 6.1683, "mean_token_accuracy": 0.16701944917440414, "num_tokens": 21098160.0, "step": 8325 }, { "entropy": 6.364248371124267, "epoch": 0.96133871898442, "grad_norm": 1.2109375, "learning_rate": 0.0004919189088871456, "loss": 6.251, "mean_token_accuracy": 0.15590550601482392, "num_tokens": 21111562.0, "step": 8330 }, { "entropy": 6.41587643623352, "epoch": 0.9619157530294288, "grad_norm": 1.3046875, "learning_rate": 0.0004919079455357608, "loss": 6.2395, "mean_token_accuracy": 0.1601430892944336, "num_tokens": 21123177.0, "step": 8335 }, { "entropy": 6.406910991668701, "epoch": 0.9624927870744374, "grad_norm": 1.6015625, "learning_rate": 0.0004918969748887847, "loss": 6.2987, "mean_token_accuracy": 0.15528492927551268, "num_tokens": 21135390.0, "step": 8340 }, { "entropy": 6.391875457763672, "epoch": 0.9630698211194461, "grad_norm": 1.265625, "learning_rate": 0.0004918859969465868, "loss": 6.2587, "mean_token_accuracy": 0.16090984791517257, "num_tokens": 21148718.0, "step": 8345 }, { "entropy": 6.409095191955567, "epoch": 0.9636468551644547, "grad_norm": 1.1953125, "learning_rate": 0.0004918750117095361, "loss": 6.2722, "mean_token_accuracy": 0.15558131486177446, "num_tokens": 21161057.0, "step": 8350 }, { "entropy": 6.4546857357025145, "epoch": 0.9642238892094633, "grad_norm": 1.3515625, "learning_rate": 0.0004918640191780021, "loss": 6.2665, "mean_token_accuracy": 0.15689287930727006, "num_tokens": 21175048.0, "step": 8355 }, { "entropy": 6.404264736175537, "epoch": 0.964800923254472, "grad_norm": 1.359375, "learning_rate": 0.0004918530193523546, "loss": 6.2031, "mean_token_accuracy": 0.16269493997097015, "num_tokens": 21187995.0, "step": 8360 }, { "entropy": 6.339152526855469, "epoch": 0.9653779572994806, "grad_norm": 1.421875, "learning_rate": 0.0004918420122329634, "loss": 6.208, "mean_token_accuracy": 0.16081032305955886, "num_tokens": 21200685.0, "step": 8365 }, { "entropy": 6.348997116088867, "epoch": 0.9659549913444894, "grad_norm": 1.3125, "learning_rate": 0.0004918309978201989, "loss": 6.1992, "mean_token_accuracy": 0.1665423795580864, "num_tokens": 21212709.0, "step": 8370 }, { "entropy": 6.451622152328492, "epoch": 0.966532025389498, "grad_norm": 1.59375, "learning_rate": 0.0004918199761144315, "loss": 6.3389, "mean_token_accuracy": 0.15161336064338685, "num_tokens": 21224846.0, "step": 8375 }, { "entropy": 6.403325319290161, "epoch": 0.9671090594345066, "grad_norm": 1.9453125, "learning_rate": 0.0004918089471160318, "loss": 6.3308, "mean_token_accuracy": 0.16391047835350037, "num_tokens": 21238490.0, "step": 8380 }, { "entropy": 6.386717939376831, "epoch": 0.9676860934795153, "grad_norm": 1.515625, "learning_rate": 0.0004917979108253709, "loss": 6.2033, "mean_token_accuracy": 0.16050710380077363, "num_tokens": 21250064.0, "step": 8385 }, { "entropy": 6.421000051498413, "epoch": 0.9682631275245239, "grad_norm": 1.3359375, "learning_rate": 0.00049178686724282, "loss": 6.2117, "mean_token_accuracy": 0.15899699330329894, "num_tokens": 21262777.0, "step": 8390 }, { "entropy": 6.395197439193725, "epoch": 0.9688401615695326, "grad_norm": 1.3203125, "learning_rate": 0.0004917758163687506, "loss": 6.2687, "mean_token_accuracy": 0.16623124480247498, "num_tokens": 21274837.0, "step": 8395 }, { "entropy": 6.374613809585571, "epoch": 0.9694171956145412, "grad_norm": 1.625, "learning_rate": 0.0004917647582035341, "loss": 6.3607, "mean_token_accuracy": 0.15184668079018593, "num_tokens": 21287683.0, "step": 8400 }, { "entropy": 6.376201486587524, "epoch": 0.96999422965955, "grad_norm": 1.296875, "learning_rate": 0.0004917536927475428, "loss": 6.1818, "mean_token_accuracy": 0.16200344264507294, "num_tokens": 21300053.0, "step": 8405 }, { "entropy": 6.440302991867066, "epoch": 0.9705712637045586, "grad_norm": 1.3203125, "learning_rate": 0.0004917426200011486, "loss": 6.2611, "mean_token_accuracy": 0.1626146748661995, "num_tokens": 21312143.0, "step": 8410 }, { "entropy": 6.382162284851074, "epoch": 0.9711482977495672, "grad_norm": 1.2265625, "learning_rate": 0.000491731539964724, "loss": 6.264, "mean_token_accuracy": 0.1642318233847618, "num_tokens": 21324530.0, "step": 8415 }, { "entropy": 6.407947683334351, "epoch": 0.9717253317945759, "grad_norm": 1.15625, "learning_rate": 0.0004917204526386418, "loss": 6.3134, "mean_token_accuracy": 0.16119913905858993, "num_tokens": 21337766.0, "step": 8420 }, { "entropy": 6.442886304855347, "epoch": 0.9723023658395845, "grad_norm": 1.453125, "learning_rate": 0.0004917093580232748, "loss": 6.2729, "mean_token_accuracy": 0.16371907740831376, "num_tokens": 21350304.0, "step": 8425 }, { "entropy": 6.390522384643555, "epoch": 0.9728793998845932, "grad_norm": 1.4453125, "learning_rate": 0.0004916982561189962, "loss": 6.2756, "mean_token_accuracy": 0.15955062806606293, "num_tokens": 21362030.0, "step": 8430 }, { "entropy": 6.373282623291016, "epoch": 0.9734564339296018, "grad_norm": 1.2578125, "learning_rate": 0.0004916871469261794, "loss": 6.2956, "mean_token_accuracy": 0.1568213276565075, "num_tokens": 21374279.0, "step": 8435 }, { "entropy": 6.364431238174438, "epoch": 0.9740334679746105, "grad_norm": 2.609375, "learning_rate": 0.000491676030445198, "loss": 6.3004, "mean_token_accuracy": 0.16820743083953857, "num_tokens": 21388220.0, "step": 8440 }, { "entropy": 6.4249077320098875, "epoch": 0.9746105020196192, "grad_norm": 1.890625, "learning_rate": 0.0004916649066764259, "loss": 6.249, "mean_token_accuracy": 0.16421249657869338, "num_tokens": 21400770.0, "step": 8445 }, { "entropy": 6.374565935134887, "epoch": 0.9751875360646278, "grad_norm": 2.8125, "learning_rate": 0.0004916537756202375, "loss": 6.2807, "mean_token_accuracy": 0.16066452264785766, "num_tokens": 21413078.0, "step": 8450 }, { "entropy": 6.362772464752197, "epoch": 0.9757645701096365, "grad_norm": 1.421875, "learning_rate": 0.0004916426372770069, "loss": 6.3373, "mean_token_accuracy": 0.15732649713754654, "num_tokens": 21427285.0, "step": 8455 }, { "entropy": 6.42603907585144, "epoch": 0.9763416041546451, "grad_norm": 1.625, "learning_rate": 0.0004916314916471087, "loss": 6.3029, "mean_token_accuracy": 0.15744611397385597, "num_tokens": 21440659.0, "step": 8460 }, { "entropy": 6.410357141494751, "epoch": 0.9769186381996537, "grad_norm": 1.1875, "learning_rate": 0.0004916203387309179, "loss": 6.246, "mean_token_accuracy": 0.152059967815876, "num_tokens": 21452301.0, "step": 8465 }, { "entropy": 6.278444290161133, "epoch": 0.9774956722446624, "grad_norm": 1.2421875, "learning_rate": 0.0004916091785288096, "loss": 6.1978, "mean_token_accuracy": 0.16501330584287643, "num_tokens": 21466716.0, "step": 8470 }, { "entropy": 6.429250001907349, "epoch": 0.9780727062896711, "grad_norm": 1.6015625, "learning_rate": 0.0004915980110411593, "loss": 6.29, "mean_token_accuracy": 0.15631196796894073, "num_tokens": 21479314.0, "step": 8475 }, { "entropy": 6.427707147598267, "epoch": 0.9786497403346798, "grad_norm": 1.359375, "learning_rate": 0.0004915868362683425, "loss": 6.2077, "mean_token_accuracy": 0.16927620470523835, "num_tokens": 21491968.0, "step": 8480 }, { "entropy": 6.281297016143799, "epoch": 0.9792267743796884, "grad_norm": 1.3203125, "learning_rate": 0.0004915756542107349, "loss": 6.298, "mean_token_accuracy": 0.15860208868980408, "num_tokens": 21505744.0, "step": 8485 }, { "entropy": 6.404678392410278, "epoch": 0.979803808424697, "grad_norm": 1.8984375, "learning_rate": 0.0004915644648687127, "loss": 6.3305, "mean_token_accuracy": 0.15427371114492416, "num_tokens": 21520981.0, "step": 8490 }, { "entropy": 6.421433591842652, "epoch": 0.9803808424697057, "grad_norm": 1.1484375, "learning_rate": 0.0004915532682426524, "loss": 6.2965, "mean_token_accuracy": 0.15904518067836762, "num_tokens": 21533712.0, "step": 8495 }, { "entropy": 6.336588764190674, "epoch": 0.9809578765147143, "grad_norm": 1.421875, "learning_rate": 0.0004915420643329306, "loss": 6.1778, "mean_token_accuracy": 0.16007357686758042, "num_tokens": 21546875.0, "step": 8500 }, { "entropy": 6.358702325820923, "epoch": 0.981534910559723, "grad_norm": 1.265625, "learning_rate": 0.000491530853139924, "loss": 6.2287, "mean_token_accuracy": 0.16115213334560394, "num_tokens": 21559154.0, "step": 8505 }, { "entropy": 6.469691753387451, "epoch": 0.9821119446047317, "grad_norm": 1.7890625, "learning_rate": 0.0004915196346640095, "loss": 6.3238, "mean_token_accuracy": 0.15400136709213258, "num_tokens": 21573164.0, "step": 8510 }, { "entropy": 6.439447975158691, "epoch": 0.9826889786497404, "grad_norm": 1.7265625, "learning_rate": 0.0004915084089055648, "loss": 6.3306, "mean_token_accuracy": 0.14860097840428352, "num_tokens": 21585449.0, "step": 8515 }, { "entropy": 6.328643274307251, "epoch": 0.983266012694749, "grad_norm": 1.2578125, "learning_rate": 0.0004914971758649673, "loss": 6.27, "mean_token_accuracy": 0.16568298786878585, "num_tokens": 21598120.0, "step": 8520 }, { "entropy": 6.421794176101685, "epoch": 0.9838430467397576, "grad_norm": 3.203125, "learning_rate": 0.0004914859355425948, "loss": 6.3032, "mean_token_accuracy": 0.15581102222204207, "num_tokens": 21609912.0, "step": 8525 }, { "entropy": 6.466002559661865, "epoch": 0.9844200807847663, "grad_norm": 1.65625, "learning_rate": 0.0004914746879388255, "loss": 6.2581, "mean_token_accuracy": 0.16066803485155107, "num_tokens": 21623242.0, "step": 8530 }, { "entropy": 6.35989294052124, "epoch": 0.9849971148297749, "grad_norm": 1.2734375, "learning_rate": 0.0004914634330540373, "loss": 6.2925, "mean_token_accuracy": 0.16082993894815445, "num_tokens": 21635527.0, "step": 8535 }, { "entropy": 6.380307149887085, "epoch": 0.9855741488747836, "grad_norm": 1.78125, "learning_rate": 0.0004914521708886093, "loss": 6.2392, "mean_token_accuracy": 0.16111573278903962, "num_tokens": 21648994.0, "step": 8540 }, { "entropy": 6.379744577407837, "epoch": 0.9861511829197923, "grad_norm": 1.3359375, "learning_rate": 0.0004914409014429201, "loss": 6.2758, "mean_token_accuracy": 0.15881554186344146, "num_tokens": 21661512.0, "step": 8545 }, { "entropy": 6.381563758850097, "epoch": 0.986728216964801, "grad_norm": 1.2890625, "learning_rate": 0.0004914296247173486, "loss": 6.3171, "mean_token_accuracy": 0.15678785592317582, "num_tokens": 21674900.0, "step": 8550 }, { "entropy": 6.508550548553467, "epoch": 0.9873052510098096, "grad_norm": 1.3125, "learning_rate": 0.0004914183407122741, "loss": 6.5073, "mean_token_accuracy": 0.1529560297727585, "num_tokens": 21688451.0, "step": 8555 }, { "entropy": 6.460909605026245, "epoch": 0.9878822850548182, "grad_norm": 1.2109375, "learning_rate": 0.0004914070494280763, "loss": 6.2937, "mean_token_accuracy": 0.15463425517082213, "num_tokens": 21700350.0, "step": 8560 }, { "entropy": 6.382816743850708, "epoch": 0.9884593190998269, "grad_norm": 2.421875, "learning_rate": 0.0004913957508651349, "loss": 6.2653, "mean_token_accuracy": 0.16228749752044677, "num_tokens": 21713211.0, "step": 8565 }, { "entropy": 6.36720757484436, "epoch": 0.9890363531448355, "grad_norm": 2.03125, "learning_rate": 0.0004913844450238299, "loss": 6.2327, "mean_token_accuracy": 0.16315484046936035, "num_tokens": 21726105.0, "step": 8570 }, { "entropy": 6.412167978286743, "epoch": 0.9896133871898442, "grad_norm": 1.6953125, "learning_rate": 0.0004913731319045416, "loss": 6.2817, "mean_token_accuracy": 0.16310435831546782, "num_tokens": 21738075.0, "step": 8575 }, { "entropy": 6.411454057693481, "epoch": 0.9901904212348529, "grad_norm": 1.1875, "learning_rate": 0.0004913618115076505, "loss": 6.2542, "mean_token_accuracy": 0.16109486371278764, "num_tokens": 21750614.0, "step": 8580 }, { "entropy": 6.256771802902222, "epoch": 0.9907674552798615, "grad_norm": 1.28125, "learning_rate": 0.0004913504838335372, "loss": 6.2713, "mean_token_accuracy": 0.1610737442970276, "num_tokens": 21763670.0, "step": 8585 }, { "entropy": 6.344682216644287, "epoch": 0.9913444893248702, "grad_norm": 1.4609375, "learning_rate": 0.0004913391488825829, "loss": 6.238, "mean_token_accuracy": 0.16902547478675842, "num_tokens": 21776623.0, "step": 8590 }, { "entropy": 6.429253101348877, "epoch": 0.9919215233698788, "grad_norm": 2.0625, "learning_rate": 0.0004913278066551689, "loss": 6.2113, "mean_token_accuracy": 0.1598364844918251, "num_tokens": 21787903.0, "step": 8595 }, { "entropy": 6.308300876617432, "epoch": 0.9924985574148875, "grad_norm": 1.71875, "learning_rate": 0.0004913164571516765, "loss": 6.1519, "mean_token_accuracy": 0.1660546824336052, "num_tokens": 21800409.0, "step": 8600 }, { "entropy": 6.34729495048523, "epoch": 0.9930755914598961, "grad_norm": 1.2734375, "learning_rate": 0.0004913051003724876, "loss": 6.3579, "mean_token_accuracy": 0.15751274973154067, "num_tokens": 21812741.0, "step": 8605 }, { "entropy": 6.407994890213013, "epoch": 0.9936526255049047, "grad_norm": 2.03125, "learning_rate": 0.0004912937363179839, "loss": 6.2875, "mean_token_accuracy": 0.16249522119760512, "num_tokens": 21826180.0, "step": 8610 }, { "entropy": 6.504053926467895, "epoch": 0.9942296595499135, "grad_norm": 1.5, "learning_rate": 0.000491282364988548, "loss": 6.3495, "mean_token_accuracy": 0.15898843556642533, "num_tokens": 21838961.0, "step": 8615 }, { "entropy": 6.395296335220337, "epoch": 0.9948066935949221, "grad_norm": 1.328125, "learning_rate": 0.0004912709863845621, "loss": 6.2812, "mean_token_accuracy": 0.16122212558984755, "num_tokens": 21850942.0, "step": 8620 }, { "entropy": 6.361412048339844, "epoch": 0.9953837276399308, "grad_norm": 1.328125, "learning_rate": 0.000491259600506409, "loss": 6.1996, "mean_token_accuracy": 0.16818103045225144, "num_tokens": 21862666.0, "step": 8625 }, { "entropy": 6.396421813964844, "epoch": 0.9959607616849394, "grad_norm": 1.4921875, "learning_rate": 0.0004912482073544716, "loss": 6.2305, "mean_token_accuracy": 0.16952535808086394, "num_tokens": 21874866.0, "step": 8630 }, { "entropy": 6.403103637695312, "epoch": 0.996537795729948, "grad_norm": 1.578125, "learning_rate": 0.0004912368069291333, "loss": 6.3302, "mean_token_accuracy": 0.1602864071726799, "num_tokens": 21887886.0, "step": 8635 }, { "entropy": 6.4391790390014645, "epoch": 0.9971148297749567, "grad_norm": 1.7109375, "learning_rate": 0.0004912253992307773, "loss": 6.2807, "mean_token_accuracy": 0.15628421008586885, "num_tokens": 21901096.0, "step": 8640 }, { "entropy": 6.439533281326294, "epoch": 0.9976918638199653, "grad_norm": 1.921875, "learning_rate": 0.0004912139842597875, "loss": 6.3617, "mean_token_accuracy": 0.16195413023233413, "num_tokens": 21914018.0, "step": 8645 }, { "entropy": 6.36651029586792, "epoch": 0.9982688978649741, "grad_norm": 1.4453125, "learning_rate": 0.0004912025620165477, "loss": 6.2606, "mean_token_accuracy": 0.16470131576061248, "num_tokens": 21925488.0, "step": 8650 }, { "entropy": 6.478236961364746, "epoch": 0.9988459319099827, "grad_norm": 1.3125, "learning_rate": 0.0004911911325014421, "loss": 6.3725, "mean_token_accuracy": 0.14617064893245696, "num_tokens": 21938268.0, "step": 8655 }, { "entropy": 6.4387367248535154, "epoch": 0.9994229659549914, "grad_norm": 1.9140625, "learning_rate": 0.0004911796957148552, "loss": 6.3445, "mean_token_accuracy": 0.16030535250902175, "num_tokens": 21951219.0, "step": 8660 }, { "entropy": 6.430270862579346, "epoch": 1.0, "grad_norm": 1.84375, "learning_rate": 0.0004911682516571715, "loss": 6.2959, "mean_token_accuracy": 0.15840745270252227, "num_tokens": 21963117.0, "step": 8665 }, { "entropy": 6.426940965652466, "epoch": 1.0005770340450086, "grad_norm": 2.0625, "learning_rate": 0.0004911568003287761, "loss": 6.2376, "mean_token_accuracy": 0.1605121448636055, "num_tokens": 21974187.0, "step": 8670 }, { "entropy": 6.415137052536011, "epoch": 1.0011540680900173, "grad_norm": 1.5078125, "learning_rate": 0.0004911453417300541, "loss": 6.2486, "mean_token_accuracy": 0.16247110962867736, "num_tokens": 21987393.0, "step": 8675 }, { "entropy": 6.38947024345398, "epoch": 1.001731102135026, "grad_norm": 1.515625, "learning_rate": 0.0004911338758613909, "loss": 6.1214, "mean_token_accuracy": 0.16808023154735566, "num_tokens": 21998638.0, "step": 8680 }, { "entropy": 6.340237426757812, "epoch": 1.0023081361800346, "grad_norm": 1.96875, "learning_rate": 0.0004911224027231722, "loss": 6.1783, "mean_token_accuracy": 0.16497329473495484, "num_tokens": 22012231.0, "step": 8685 }, { "entropy": 6.314101123809815, "epoch": 1.0028851702250432, "grad_norm": 1.5078125, "learning_rate": 0.0004911109223157838, "loss": 6.0206, "mean_token_accuracy": 0.1724448785185814, "num_tokens": 22024929.0, "step": 8690 }, { "entropy": 6.372276830673218, "epoch": 1.0034622042700518, "grad_norm": 2.234375, "learning_rate": 0.0004910994346396118, "loss": 6.1297, "mean_token_accuracy": 0.16675959825515746, "num_tokens": 22037873.0, "step": 8695 }, { "entropy": 6.307498407363892, "epoch": 1.0040392383150605, "grad_norm": 1.4921875, "learning_rate": 0.0004910879396950427, "loss": 6.1082, "mean_token_accuracy": 0.16449054181575776, "num_tokens": 22049572.0, "step": 8700 }, { "entropy": 6.38808240890503, "epoch": 1.0046162723600693, "grad_norm": 1.3828125, "learning_rate": 0.000491076437482463, "loss": 6.2122, "mean_token_accuracy": 0.15654898583889007, "num_tokens": 22063290.0, "step": 8705 }, { "entropy": 6.271512460708618, "epoch": 1.005193306405078, "grad_norm": 1.484375, "learning_rate": 0.0004910649280022599, "loss": 6.0864, "mean_token_accuracy": 0.1705736681818962, "num_tokens": 22076387.0, "step": 8710 }, { "entropy": 6.347558546066284, "epoch": 1.0057703404500866, "grad_norm": 1.6015625, "learning_rate": 0.0004910534112548201, "loss": 6.1711, "mean_token_accuracy": 0.16337237358093262, "num_tokens": 22088780.0, "step": 8715 }, { "entropy": 6.276888036727906, "epoch": 1.0063473744950953, "grad_norm": 1.4375, "learning_rate": 0.0004910418872405312, "loss": 6.0633, "mean_token_accuracy": 0.1731952100992203, "num_tokens": 22102150.0, "step": 8720 }, { "entropy": 6.3603862762451175, "epoch": 1.006924408540104, "grad_norm": 1.7109375, "learning_rate": 0.0004910303559597806, "loss": 6.1491, "mean_token_accuracy": 0.16267468482255937, "num_tokens": 22115250.0, "step": 8725 }, { "entropy": 6.325836277008056, "epoch": 1.0075014425851125, "grad_norm": 2.125, "learning_rate": 0.0004910188174129564, "loss": 6.1948, "mean_token_accuracy": 0.1561719983816147, "num_tokens": 22129015.0, "step": 8730 }, { "entropy": 6.2975523471832275, "epoch": 1.0080784766301212, "grad_norm": 1.390625, "learning_rate": 0.0004910072716004466, "loss": 6.1954, "mean_token_accuracy": 0.16403840184211732, "num_tokens": 22141716.0, "step": 8735 }, { "entropy": 6.385508728027344, "epoch": 1.0086555106751298, "grad_norm": 1.4453125, "learning_rate": 0.0004909957185226394, "loss": 6.2501, "mean_token_accuracy": 0.1517787382006645, "num_tokens": 22153568.0, "step": 8740 }, { "entropy": 6.447339200973511, "epoch": 1.0092325447201385, "grad_norm": 1.390625, "learning_rate": 0.0004909841581799236, "loss": 6.2239, "mean_token_accuracy": 0.1596845343708992, "num_tokens": 22165443.0, "step": 8745 }, { "entropy": 6.389078998565674, "epoch": 1.009809578765147, "grad_norm": 2.15625, "learning_rate": 0.0004909725905726879, "loss": 6.1835, "mean_token_accuracy": 0.1615777239203453, "num_tokens": 22179068.0, "step": 8750 }, { "entropy": 6.350357580184936, "epoch": 1.0103866128101557, "grad_norm": 1.765625, "learning_rate": 0.0004909610157013214, "loss": 6.2675, "mean_token_accuracy": 0.15202371701598166, "num_tokens": 22191597.0, "step": 8755 }, { "entropy": 6.410714101791382, "epoch": 1.0109636468551644, "grad_norm": 1.5078125, "learning_rate": 0.0004909494335662134, "loss": 6.1896, "mean_token_accuracy": 0.16322282552719117, "num_tokens": 22203724.0, "step": 8760 }, { "entropy": 6.303729724884033, "epoch": 1.011540680900173, "grad_norm": 1.3203125, "learning_rate": 0.0004909378441677535, "loss": 6.1458, "mean_token_accuracy": 0.16659850329160691, "num_tokens": 22216100.0, "step": 8765 }, { "entropy": 6.359002780914307, "epoch": 1.0121177149451817, "grad_norm": 1.6640625, "learning_rate": 0.0004909262475063314, "loss": 6.1722, "mean_token_accuracy": 0.15876885056495665, "num_tokens": 22228162.0, "step": 8770 }, { "entropy": 6.332960414886474, "epoch": 1.0126947489901905, "grad_norm": 1.53125, "learning_rate": 0.0004909146435823373, "loss": 6.157, "mean_token_accuracy": 0.16825098544359207, "num_tokens": 22239756.0, "step": 8775 }, { "entropy": 6.333130693435669, "epoch": 1.0132717830351992, "grad_norm": 1.9140625, "learning_rate": 0.0004909030323961613, "loss": 6.1633, "mean_token_accuracy": 0.15986109226942063, "num_tokens": 22252781.0, "step": 8780 }, { "entropy": 6.3398871421813965, "epoch": 1.0138488170802078, "grad_norm": 1.453125, "learning_rate": 0.0004908914139481942, "loss": 6.2258, "mean_token_accuracy": 0.15804215222597123, "num_tokens": 22265171.0, "step": 8785 }, { "entropy": 6.337258434295654, "epoch": 1.0144258511252164, "grad_norm": 1.4296875, "learning_rate": 0.0004908797882388265, "loss": 6.1805, "mean_token_accuracy": 0.16364909410476686, "num_tokens": 22278121.0, "step": 8790 }, { "entropy": 6.275689315795899, "epoch": 1.015002885170225, "grad_norm": 1.828125, "learning_rate": 0.0004908681552684495, "loss": 6.0378, "mean_token_accuracy": 0.166185662150383, "num_tokens": 22290074.0, "step": 8795 }, { "entropy": 6.295356369018554, "epoch": 1.0155799192152337, "grad_norm": 2.09375, "learning_rate": 0.0004908565150374542, "loss": 6.1924, "mean_token_accuracy": 0.16460571438074112, "num_tokens": 22303088.0, "step": 8800 }, { "entropy": 6.413890361785889, "epoch": 1.0161569532602424, "grad_norm": 1.421875, "learning_rate": 0.0004908448675462323, "loss": 6.2355, "mean_token_accuracy": 0.1506106361746788, "num_tokens": 22317693.0, "step": 8805 }, { "entropy": 6.359114170074463, "epoch": 1.016733987305251, "grad_norm": 1.234375, "learning_rate": 0.0004908332127951756, "loss": 6.1808, "mean_token_accuracy": 0.1655200481414795, "num_tokens": 22330876.0, "step": 8810 }, { "entropy": 6.337749481201172, "epoch": 1.0173110213502596, "grad_norm": 1.296875, "learning_rate": 0.0004908215507846757, "loss": 6.1308, "mean_token_accuracy": 0.1639953449368477, "num_tokens": 22342620.0, "step": 8815 }, { "entropy": 6.328289365768432, "epoch": 1.0178880553952683, "grad_norm": 1.4765625, "learning_rate": 0.0004908098815151254, "loss": 6.1631, "mean_token_accuracy": 0.1632054179906845, "num_tokens": 22353733.0, "step": 8820 }, { "entropy": 6.461244201660156, "epoch": 1.018465089440277, "grad_norm": 1.265625, "learning_rate": 0.0004907982049869168, "loss": 6.2178, "mean_token_accuracy": 0.15410459488630296, "num_tokens": 22366857.0, "step": 8825 }, { "entropy": 6.299141931533813, "epoch": 1.0190421234852856, "grad_norm": 1.9921875, "learning_rate": 0.0004907865212004428, "loss": 6.0471, "mean_token_accuracy": 0.16742806285619735, "num_tokens": 22377658.0, "step": 8830 }, { "entropy": 6.279093837738037, "epoch": 1.0196191575302942, "grad_norm": 1.7421875, "learning_rate": 0.0004907748301560963, "loss": 6.206, "mean_token_accuracy": 0.15780699700117112, "num_tokens": 22390060.0, "step": 8835 }, { "entropy": 6.34080319404602, "epoch": 1.0201961915753028, "grad_norm": 2.0, "learning_rate": 0.0004907631318542707, "loss": 6.1819, "mean_token_accuracy": 0.1587137073278427, "num_tokens": 22402903.0, "step": 8840 }, { "entropy": 6.349684619903565, "epoch": 1.0207732256203117, "grad_norm": 1.359375, "learning_rate": 0.0004907514262953594, "loss": 6.1471, "mean_token_accuracy": 0.16755905002355576, "num_tokens": 22416036.0, "step": 8845 }, { "entropy": 6.399058294296265, "epoch": 1.0213502596653203, "grad_norm": 1.4609375, "learning_rate": 0.0004907397134797559, "loss": 6.16, "mean_token_accuracy": 0.16025111079216003, "num_tokens": 22428000.0, "step": 8850 }, { "entropy": 6.285398197174072, "epoch": 1.021927293710329, "grad_norm": 1.6484375, "learning_rate": 0.0004907279934078543, "loss": 6.1808, "mean_token_accuracy": 0.16548313647508622, "num_tokens": 22440029.0, "step": 8855 }, { "entropy": 6.307600975036621, "epoch": 1.0225043277553376, "grad_norm": 1.4765625, "learning_rate": 0.0004907162660800488, "loss": 6.2091, "mean_token_accuracy": 0.1566235363483429, "num_tokens": 22452906.0, "step": 8860 }, { "entropy": 6.368782329559326, "epoch": 1.0230813618003463, "grad_norm": 1.5390625, "learning_rate": 0.0004907045314967338, "loss": 6.0737, "mean_token_accuracy": 0.17112531810998916, "num_tokens": 22465853.0, "step": 8865 }, { "entropy": 6.359477853775024, "epoch": 1.023658395845355, "grad_norm": 4.71875, "learning_rate": 0.0004906927896583041, "loss": 6.1674, "mean_token_accuracy": 0.1638613685965538, "num_tokens": 22478583.0, "step": 8870 }, { "entropy": 6.2635619163513185, "epoch": 1.0242354298903635, "grad_norm": 1.4765625, "learning_rate": 0.0004906810405651546, "loss": 6.185, "mean_token_accuracy": 0.16508891731500625, "num_tokens": 22491665.0, "step": 8875 }, { "entropy": 6.332400894165039, "epoch": 1.0248124639353722, "grad_norm": 1.65625, "learning_rate": 0.0004906692842176803, "loss": 6.1711, "mean_token_accuracy": 0.16148089468479157, "num_tokens": 22504015.0, "step": 8880 }, { "entropy": 6.441442584991455, "epoch": 1.0253894979803808, "grad_norm": 1.890625, "learning_rate": 0.0004906575206162769, "loss": 6.2513, "mean_token_accuracy": 0.15498681217432023, "num_tokens": 22516385.0, "step": 8885 }, { "entropy": 6.370885753631592, "epoch": 1.0259665320253895, "grad_norm": 1.1953125, "learning_rate": 0.0004906457497613399, "loss": 6.1514, "mean_token_accuracy": 0.16406670212745667, "num_tokens": 22527988.0, "step": 8890 }, { "entropy": 6.2743278503417965, "epoch": 1.026543566070398, "grad_norm": 1.28125, "learning_rate": 0.0004906339716532651, "loss": 6.1883, "mean_token_accuracy": 0.16317007690668106, "num_tokens": 22540613.0, "step": 8895 }, { "entropy": 6.298226737976075, "epoch": 1.0271206001154067, "grad_norm": 1.4375, "learning_rate": 0.0004906221862924488, "loss": 6.1085, "mean_token_accuracy": 0.16695300936698915, "num_tokens": 22552137.0, "step": 8900 }, { "entropy": 6.369357299804688, "epoch": 1.0276976341604154, "grad_norm": 1.390625, "learning_rate": 0.0004906103936792875, "loss": 6.2491, "mean_token_accuracy": 0.15076114386320114, "num_tokens": 22564677.0, "step": 8905 }, { "entropy": 6.419727420806884, "epoch": 1.028274668205424, "grad_norm": 2.515625, "learning_rate": 0.0004905985938141777, "loss": 6.1798, "mean_token_accuracy": 0.1652047887444496, "num_tokens": 22578236.0, "step": 8910 }, { "entropy": 6.350459432601928, "epoch": 1.0288517022504329, "grad_norm": 1.203125, "learning_rate": 0.0004905867866975163, "loss": 6.1683, "mean_token_accuracy": 0.16516325920820235, "num_tokens": 22592533.0, "step": 8915 }, { "entropy": 6.358260679244995, "epoch": 1.0294287362954415, "grad_norm": 1.328125, "learning_rate": 0.0004905749723297003, "loss": 6.2329, "mean_token_accuracy": 0.15685783475637435, "num_tokens": 22606062.0, "step": 8920 }, { "entropy": 6.399117088317871, "epoch": 1.0300057703404502, "grad_norm": 1.1796875, "learning_rate": 0.0004905631507111271, "loss": 6.2389, "mean_token_accuracy": 0.15823203176259995, "num_tokens": 22619342.0, "step": 8925 }, { "entropy": 6.342332744598389, "epoch": 1.0305828043854588, "grad_norm": 1.703125, "learning_rate": 0.0004905513218421946, "loss": 6.1936, "mean_token_accuracy": 0.16186433136463166, "num_tokens": 22632003.0, "step": 8930 }, { "entropy": 6.3654186725616455, "epoch": 1.0311598384304674, "grad_norm": 1.4609375, "learning_rate": 0.0004905394857233004, "loss": 6.1736, "mean_token_accuracy": 0.16698863506317138, "num_tokens": 22644179.0, "step": 8935 }, { "entropy": 6.423052978515625, "epoch": 1.031736872475476, "grad_norm": 1.875, "learning_rate": 0.0004905276423548426, "loss": 6.2233, "mean_token_accuracy": 0.16120436564087867, "num_tokens": 22657544.0, "step": 8940 }, { "entropy": 6.401259517669677, "epoch": 1.0323139065204847, "grad_norm": 1.484375, "learning_rate": 0.0004905157917372197, "loss": 6.2665, "mean_token_accuracy": 0.15423907488584518, "num_tokens": 22670789.0, "step": 8945 }, { "entropy": 6.326565361022949, "epoch": 1.0328909405654934, "grad_norm": 1.2421875, "learning_rate": 0.0004905039338708302, "loss": 6.1676, "mean_token_accuracy": 0.15901732444763184, "num_tokens": 22682491.0, "step": 8950 }, { "entropy": 6.43274712562561, "epoch": 1.033467974610502, "grad_norm": 1.328125, "learning_rate": 0.0004904920687560728, "loss": 6.2071, "mean_token_accuracy": 0.16146688759326935, "num_tokens": 22695235.0, "step": 8955 }, { "entropy": 6.322785186767578, "epoch": 1.0340450086555106, "grad_norm": 1.265625, "learning_rate": 0.0004904801963933469, "loss": 6.2042, "mean_token_accuracy": 0.16150673478841782, "num_tokens": 22707222.0, "step": 8960 }, { "entropy": 6.356104993820191, "epoch": 1.0346220427005193, "grad_norm": 1.2109375, "learning_rate": 0.0004904683167830515, "loss": 6.2446, "mean_token_accuracy": 0.1534208372235298, "num_tokens": 22718820.0, "step": 8965 }, { "entropy": 6.398207187652588, "epoch": 1.035199076745528, "grad_norm": 1.34375, "learning_rate": 0.0004904564299255862, "loss": 6.1547, "mean_token_accuracy": 0.16409973949193954, "num_tokens": 22731265.0, "step": 8970 }, { "entropy": 6.334744119644165, "epoch": 1.0357761107905366, "grad_norm": 1.6171875, "learning_rate": 0.0004904445358213511, "loss": 6.139, "mean_token_accuracy": 0.1598776698112488, "num_tokens": 22744222.0, "step": 8975 }, { "entropy": 6.229028511047363, "epoch": 1.0363531448355452, "grad_norm": 1.484375, "learning_rate": 0.0004904326344707461, "loss": 6.1449, "mean_token_accuracy": 0.1658041372895241, "num_tokens": 22756190.0, "step": 8980 }, { "entropy": 6.297280120849609, "epoch": 1.036930178880554, "grad_norm": 1.3515625, "learning_rate": 0.0004904207258741712, "loss": 6.084, "mean_token_accuracy": 0.1679148942232132, "num_tokens": 22767943.0, "step": 8985 }, { "entropy": 6.369158220291138, "epoch": 1.0375072129255627, "grad_norm": 1.5, "learning_rate": 0.0004904088100320274, "loss": 6.1554, "mean_token_accuracy": 0.1659896582365036, "num_tokens": 22780972.0, "step": 8990 }, { "entropy": 6.400546598434448, "epoch": 1.0380842469705713, "grad_norm": 1.953125, "learning_rate": 0.0004903968869447151, "loss": 6.2692, "mean_token_accuracy": 0.1603499099612236, "num_tokens": 22792584.0, "step": 8995 }, { "entropy": 6.354660606384277, "epoch": 1.03866128101558, "grad_norm": 1.7890625, "learning_rate": 0.0004903849566126356, "loss": 6.1999, "mean_token_accuracy": 0.16254472136497497, "num_tokens": 22807385.0, "step": 9000 }, { "epoch": 1.03866128101558, "eval_entropy": 6.251975536007484, "eval_loss": 6.3294453620910645, "eval_mean_token_accuracy": 0.16032058560999918, "eval_num_tokens": 22807385.0, "eval_runtime": 22.7515, "eval_samples_per_second": 1236.663, "eval_steps_per_second": 154.583, "step": 9000 }, { "entropy": 6.375589609146118, "epoch": 1.0392383150605886, "grad_norm": 1.234375, "learning_rate": 0.0004903730190361902, "loss": 6.2186, "mean_token_accuracy": 0.1562452420592308, "num_tokens": 22820655.0, "step": 9005 }, { "entropy": 6.387510585784912, "epoch": 1.0398153491055973, "grad_norm": 1.609375, "learning_rate": 0.00049036107421578, "loss": 6.1143, "mean_token_accuracy": 0.16923735439777374, "num_tokens": 22833043.0, "step": 9010 }, { "entropy": 6.322872257232666, "epoch": 1.040392383150606, "grad_norm": 1.5859375, "learning_rate": 0.0004903491221518073, "loss": 6.2247, "mean_token_accuracy": 0.16158089339733123, "num_tokens": 22844414.0, "step": 9015 }, { "entropy": 6.334288787841797, "epoch": 1.0409694171956145, "grad_norm": 1.2578125, "learning_rate": 0.0004903371628446737, "loss": 6.121, "mean_token_accuracy": 0.16435754895210267, "num_tokens": 22855966.0, "step": 9020 }, { "entropy": 6.290288877487183, "epoch": 1.0415464512406232, "grad_norm": 1.234375, "learning_rate": 0.0004903251962947817, "loss": 6.1463, "mean_token_accuracy": 0.16436477303504943, "num_tokens": 22869300.0, "step": 9025 }, { "entropy": 6.392134428024292, "epoch": 1.0421234852856318, "grad_norm": 1.5078125, "learning_rate": 0.0004903132225025335, "loss": 6.1891, "mean_token_accuracy": 0.1661277323961258, "num_tokens": 22881040.0, "step": 9030 }, { "entropy": 6.345999336242675, "epoch": 1.0427005193306405, "grad_norm": 2.015625, "learning_rate": 0.0004903012414683322, "loss": 6.1113, "mean_token_accuracy": 0.1675960272550583, "num_tokens": 22892367.0, "step": 9035 }, { "entropy": 6.356339693069458, "epoch": 1.043277553375649, "grad_norm": 1.9140625, "learning_rate": 0.0004902892531925805, "loss": 6.2527, "mean_token_accuracy": 0.1567448541522026, "num_tokens": 22904737.0, "step": 9040 }, { "entropy": 6.377230978012085, "epoch": 1.0438545874206577, "grad_norm": 1.484375, "learning_rate": 0.0004902772576756818, "loss": 6.2375, "mean_token_accuracy": 0.15742040425539017, "num_tokens": 22917775.0, "step": 9045 }, { "entropy": 6.351797676086425, "epoch": 1.0444316214656664, "grad_norm": 1.921875, "learning_rate": 0.0004902652549180394, "loss": 6.2575, "mean_token_accuracy": 0.15253747701644899, "num_tokens": 22930496.0, "step": 9050 }, { "entropy": 6.380230855941773, "epoch": 1.0450086555106752, "grad_norm": 1.75, "learning_rate": 0.0004902532449200571, "loss": 6.2036, "mean_token_accuracy": 0.15602196007966995, "num_tokens": 22943787.0, "step": 9055 }, { "entropy": 6.360061550140381, "epoch": 1.0455856895556839, "grad_norm": 1.5859375, "learning_rate": 0.0004902412276821386, "loss": 6.1759, "mean_token_accuracy": 0.16011980623006822, "num_tokens": 22956399.0, "step": 9060 }, { "entropy": 6.331561517715454, "epoch": 1.0461627236006925, "grad_norm": 1.765625, "learning_rate": 0.0004902292032046887, "loss": 6.2718, "mean_token_accuracy": 0.15832901746034622, "num_tokens": 22969993.0, "step": 9065 }, { "entropy": 6.431485795974732, "epoch": 1.0467397576457012, "grad_norm": 1.359375, "learning_rate": 0.0004902171714881112, "loss": 6.2884, "mean_token_accuracy": 0.15681524723768234, "num_tokens": 22983807.0, "step": 9070 }, { "entropy": 6.39180817604065, "epoch": 1.0473167916907098, "grad_norm": 1.40625, "learning_rate": 0.0004902051325328112, "loss": 6.235, "mean_token_accuracy": 0.1634105086326599, "num_tokens": 22996238.0, "step": 9075 }, { "entropy": 6.372631359100342, "epoch": 1.0478938257357184, "grad_norm": 1.2265625, "learning_rate": 0.0004901930863391934, "loss": 6.2263, "mean_token_accuracy": 0.1627142459154129, "num_tokens": 23009084.0, "step": 9080 }, { "entropy": 6.471501731872559, "epoch": 1.048470859780727, "grad_norm": 1.3984375, "learning_rate": 0.000490181032907663, "loss": 6.289, "mean_token_accuracy": 0.15503096878528594, "num_tokens": 23022799.0, "step": 9085 }, { "entropy": 6.345464706420898, "epoch": 1.0490478938257357, "grad_norm": 1.1875, "learning_rate": 0.0004901689722386255, "loss": 6.224, "mean_token_accuracy": 0.1631155714392662, "num_tokens": 23035566.0, "step": 9090 }, { "entropy": 6.2709979057312015, "epoch": 1.0496249278707444, "grad_norm": 1.4609375, "learning_rate": 0.0004901569043324864, "loss": 6.1007, "mean_token_accuracy": 0.17416824996471406, "num_tokens": 23050156.0, "step": 9095 }, { "entropy": 6.332347631454468, "epoch": 1.050201961915753, "grad_norm": 1.8359375, "learning_rate": 0.0004901448291896518, "loss": 6.2069, "mean_token_accuracy": 0.16119893938302993, "num_tokens": 23063121.0, "step": 9100 }, { "entropy": 6.363145351409912, "epoch": 1.0507789959607616, "grad_norm": 1.421875, "learning_rate": 0.0004901327468105277, "loss": 6.0885, "mean_token_accuracy": 0.1751132309436798, "num_tokens": 23075236.0, "step": 9105 }, { "entropy": 6.300115585327148, "epoch": 1.0513560300057703, "grad_norm": 2.109375, "learning_rate": 0.0004901206571955205, "loss": 6.2693, "mean_token_accuracy": 0.16072097718715667, "num_tokens": 23089091.0, "step": 9110 }, { "entropy": 6.385873746871948, "epoch": 1.051933064050779, "grad_norm": 1.578125, "learning_rate": 0.0004901085603450369, "loss": 6.2176, "mean_token_accuracy": 0.15178074762225152, "num_tokens": 23101642.0, "step": 9115 }, { "entropy": 6.3707091331481935, "epoch": 1.0525100980957875, "grad_norm": 1.78125, "learning_rate": 0.0004900964562594838, "loss": 6.1347, "mean_token_accuracy": 0.16434525996446608, "num_tokens": 23113427.0, "step": 9120 }, { "entropy": 6.324672508239746, "epoch": 1.0530871321407964, "grad_norm": 1.3359375, "learning_rate": 0.000490084344939268, "loss": 6.1162, "mean_token_accuracy": 0.16822165101766587, "num_tokens": 23125857.0, "step": 9125 }, { "entropy": 6.295746231079102, "epoch": 1.053664166185805, "grad_norm": 1.7578125, "learning_rate": 0.0004900722263847973, "loss": 6.1563, "mean_token_accuracy": 0.16180892288684845, "num_tokens": 23138541.0, "step": 9130 }, { "entropy": 6.283871793746949, "epoch": 1.0542412002308137, "grad_norm": 1.3828125, "learning_rate": 0.0004900601005964791, "loss": 6.1741, "mean_token_accuracy": 0.1658548966050148, "num_tokens": 23151155.0, "step": 9135 }, { "entropy": 6.381706619262696, "epoch": 1.0548182342758223, "grad_norm": 1.1640625, "learning_rate": 0.0004900479675747212, "loss": 6.179, "mean_token_accuracy": 0.15879111289978026, "num_tokens": 23165478.0, "step": 9140 }, { "entropy": 6.3661736965179445, "epoch": 1.055395268320831, "grad_norm": 1.40625, "learning_rate": 0.0004900358273199316, "loss": 6.1881, "mean_token_accuracy": 0.15336017161607743, "num_tokens": 23178120.0, "step": 9145 }, { "entropy": 6.3876782894134525, "epoch": 1.0559723023658396, "grad_norm": 1.359375, "learning_rate": 0.000490023679832519, "loss": 6.2258, "mean_token_accuracy": 0.15789849311113358, "num_tokens": 23191275.0, "step": 9150 }, { "entropy": 6.295345401763916, "epoch": 1.0565493364108482, "grad_norm": 1.3125, "learning_rate": 0.0004900115251128916, "loss": 6.192, "mean_token_accuracy": 0.15735087543725967, "num_tokens": 23204518.0, "step": 9155 }, { "entropy": 6.415962743759155, "epoch": 1.057126370455857, "grad_norm": 1.296875, "learning_rate": 0.0004899993631614583, "loss": 6.2385, "mean_token_accuracy": 0.15383946001529694, "num_tokens": 23217488.0, "step": 9160 }, { "entropy": 6.418709421157837, "epoch": 1.0577034045008655, "grad_norm": 1.3203125, "learning_rate": 0.0004899871939786283, "loss": 6.2066, "mean_token_accuracy": 0.16239057183265687, "num_tokens": 23230101.0, "step": 9165 }, { "entropy": 6.295369005203247, "epoch": 1.0582804385458742, "grad_norm": 1.6875, "learning_rate": 0.0004899750175648107, "loss": 6.34, "mean_token_accuracy": 0.15164581537246705, "num_tokens": 23243747.0, "step": 9170 }, { "entropy": 6.400159597396851, "epoch": 1.0588574725908828, "grad_norm": 1.8125, "learning_rate": 0.0004899628339204154, "loss": 6.1433, "mean_token_accuracy": 0.1617654398083687, "num_tokens": 23256593.0, "step": 9175 }, { "entropy": 6.389183235168457, "epoch": 1.0594345066358914, "grad_norm": 1.953125, "learning_rate": 0.0004899506430458518, "loss": 6.2726, "mean_token_accuracy": 0.15196809992194177, "num_tokens": 23269359.0, "step": 9180 }, { "entropy": 6.304968214035034, "epoch": 1.0600115406809, "grad_norm": 2.65625, "learning_rate": 0.0004899384449415302, "loss": 6.1119, "mean_token_accuracy": 0.16750582456588745, "num_tokens": 23283462.0, "step": 9185 }, { "entropy": 6.301669359207153, "epoch": 1.0605885747259087, "grad_norm": 1.359375, "learning_rate": 0.0004899262396078606, "loss": 6.2079, "mean_token_accuracy": 0.16235196888446807, "num_tokens": 23295920.0, "step": 9190 }, { "entropy": 6.443309926986695, "epoch": 1.0611656087709176, "grad_norm": 1.515625, "learning_rate": 0.0004899140270452539, "loss": 6.1902, "mean_token_accuracy": 0.16026893705129625, "num_tokens": 23307433.0, "step": 9195 }, { "entropy": 6.360797882080078, "epoch": 1.0617426428159262, "grad_norm": 1.5390625, "learning_rate": 0.0004899018072541204, "loss": 6.1686, "mean_token_accuracy": 0.1604166179895401, "num_tokens": 23320265.0, "step": 9200 }, { "entropy": 6.2488456726074215, "epoch": 1.0623196768609349, "grad_norm": 1.640625, "learning_rate": 0.0004898895802348715, "loss": 6.0442, "mean_token_accuracy": 0.16586936563253402, "num_tokens": 23331951.0, "step": 9205 }, { "entropy": 6.276108264923096, "epoch": 1.0628967109059435, "grad_norm": 1.4140625, "learning_rate": 0.0004898773459879183, "loss": 6.2023, "mean_token_accuracy": 0.15901616886258124, "num_tokens": 23344862.0, "step": 9210 }, { "entropy": 6.370738840103149, "epoch": 1.0634737449509521, "grad_norm": 1.3984375, "learning_rate": 0.0004898651045136724, "loss": 6.1776, "mean_token_accuracy": 0.15551743656396866, "num_tokens": 23357212.0, "step": 9215 }, { "entropy": 6.334261131286621, "epoch": 1.0640507789959608, "grad_norm": 1.3046875, "learning_rate": 0.0004898528558125453, "loss": 6.1547, "mean_token_accuracy": 0.16699836254119874, "num_tokens": 23370114.0, "step": 9220 }, { "entropy": 6.3864648818969725, "epoch": 1.0646278130409694, "grad_norm": 1.3671875, "learning_rate": 0.0004898405998849492, "loss": 6.1723, "mean_token_accuracy": 0.15924877747893335, "num_tokens": 23382295.0, "step": 9225 }, { "entropy": 6.2677223682403564, "epoch": 1.065204847085978, "grad_norm": 1.5625, "learning_rate": 0.0004898283367312962, "loss": 6.1904, "mean_token_accuracy": 0.1685797780752182, "num_tokens": 23395477.0, "step": 9230 }, { "entropy": 6.282564926147461, "epoch": 1.0657818811309867, "grad_norm": 1.671875, "learning_rate": 0.0004898160663519988, "loss": 6.1465, "mean_token_accuracy": 0.16062789410352707, "num_tokens": 23407868.0, "step": 9235 }, { "entropy": 6.367104148864746, "epoch": 1.0663589151759953, "grad_norm": 1.90625, "learning_rate": 0.0004898037887474697, "loss": 6.2365, "mean_token_accuracy": 0.1604292392730713, "num_tokens": 23422156.0, "step": 9240 }, { "entropy": 6.323754930496216, "epoch": 1.066935949221004, "grad_norm": 1.578125, "learning_rate": 0.0004897915039181219, "loss": 6.1416, "mean_token_accuracy": 0.1669705554842949, "num_tokens": 23433951.0, "step": 9245 }, { "entropy": 6.293605089187622, "epoch": 1.0675129832660126, "grad_norm": 1.421875, "learning_rate": 0.0004897792118643685, "loss": 6.1905, "mean_token_accuracy": 0.16886758506298066, "num_tokens": 23447174.0, "step": 9250 }, { "entropy": 6.372821855545044, "epoch": 1.0680900173110213, "grad_norm": 1.1640625, "learning_rate": 0.0004897669125866231, "loss": 6.1598, "mean_token_accuracy": 0.16654045432806014, "num_tokens": 23458502.0, "step": 9255 }, { "entropy": 6.351552820205688, "epoch": 1.06866705135603, "grad_norm": 1.25, "learning_rate": 0.0004897546060852993, "loss": 6.2567, "mean_token_accuracy": 0.15953566431999205, "num_tokens": 23471572.0, "step": 9260 }, { "entropy": 6.332253694534302, "epoch": 1.0692440854010385, "grad_norm": 1.453125, "learning_rate": 0.0004897422923608108, "loss": 6.1396, "mean_token_accuracy": 0.16287099570035934, "num_tokens": 23484454.0, "step": 9265 }, { "entropy": 6.344149446487426, "epoch": 1.0698211194460474, "grad_norm": 1.2109375, "learning_rate": 0.0004897299714135721, "loss": 6.2177, "mean_token_accuracy": 0.15650669634342193, "num_tokens": 23497022.0, "step": 9270 }, { "entropy": 6.39455246925354, "epoch": 1.070398153491056, "grad_norm": 1.8359375, "learning_rate": 0.0004897176432439974, "loss": 6.2155, "mean_token_accuracy": 0.16501809060573577, "num_tokens": 23510714.0, "step": 9275 }, { "entropy": 6.408887195587158, "epoch": 1.0709751875360647, "grad_norm": 1.390625, "learning_rate": 0.0004897053078525016, "loss": 6.196, "mean_token_accuracy": 0.15856562554836273, "num_tokens": 23522927.0, "step": 9280 }, { "entropy": 6.287023735046387, "epoch": 1.0715522215810733, "grad_norm": 1.3671875, "learning_rate": 0.0004896929652394993, "loss": 6.0978, "mean_token_accuracy": 0.16473745703697204, "num_tokens": 23536042.0, "step": 9285 }, { "entropy": 6.364973068237305, "epoch": 1.072129255626082, "grad_norm": 1.4921875, "learning_rate": 0.0004896806154054057, "loss": 6.2441, "mean_token_accuracy": 0.15745574235916138, "num_tokens": 23549002.0, "step": 9290 }, { "entropy": 6.400933647155762, "epoch": 1.0727062896710906, "grad_norm": 1.5390625, "learning_rate": 0.0004896682583506363, "loss": 6.2686, "mean_token_accuracy": 0.15413917899131774, "num_tokens": 23563080.0, "step": 9295 }, { "entropy": 6.418299388885498, "epoch": 1.0732833237160992, "grad_norm": 1.6171875, "learning_rate": 0.0004896558940756067, "loss": 6.2007, "mean_token_accuracy": 0.15697152465581893, "num_tokens": 23577431.0, "step": 9300 }, { "entropy": 6.302762603759765, "epoch": 1.0738603577611079, "grad_norm": 1.6484375, "learning_rate": 0.0004896435225807327, "loss": 6.1245, "mean_token_accuracy": 0.16009364873170853, "num_tokens": 23591191.0, "step": 9305 }, { "entropy": 6.322522497177124, "epoch": 1.0744373918061165, "grad_norm": 1.234375, "learning_rate": 0.0004896311438664304, "loss": 6.0839, "mean_token_accuracy": 0.17335233688354493, "num_tokens": 23603195.0, "step": 9310 }, { "entropy": 6.314301586151123, "epoch": 1.0750144258511252, "grad_norm": 1.46875, "learning_rate": 0.0004896187579331163, "loss": 6.1446, "mean_token_accuracy": 0.16357824355363845, "num_tokens": 23615278.0, "step": 9315 }, { "entropy": 6.371065235137939, "epoch": 1.0755914598961338, "grad_norm": 1.3359375, "learning_rate": 0.0004896063647812068, "loss": 6.2056, "mean_token_accuracy": 0.16097504198551177, "num_tokens": 23627311.0, "step": 9320 }, { "entropy": 6.334024095535279, "epoch": 1.0761684939411424, "grad_norm": 1.4921875, "learning_rate": 0.0004895939644111189, "loss": 6.1931, "mean_token_accuracy": 0.1588624119758606, "num_tokens": 23640338.0, "step": 9325 }, { "entropy": 6.397532653808594, "epoch": 1.076745527986151, "grad_norm": 1.3359375, "learning_rate": 0.0004895815568232694, "loss": 6.2591, "mean_token_accuracy": 0.15749427080154418, "num_tokens": 23654541.0, "step": 9330 }, { "entropy": 6.384134292602539, "epoch": 1.07732256203116, "grad_norm": 1.296875, "learning_rate": 0.0004895691420180759, "loss": 6.2222, "mean_token_accuracy": 0.16097208261489868, "num_tokens": 23666837.0, "step": 9335 }, { "entropy": 6.424416351318359, "epoch": 1.0778995960761686, "grad_norm": 1.3828125, "learning_rate": 0.000489556719995956, "loss": 6.22, "mean_token_accuracy": 0.15995656698942184, "num_tokens": 23679270.0, "step": 9340 }, { "entropy": 6.345190954208374, "epoch": 1.0784766301211772, "grad_norm": 1.1484375, "learning_rate": 0.0004895442907573274, "loss": 6.2035, "mean_token_accuracy": 0.1626092180609703, "num_tokens": 23691640.0, "step": 9345 }, { "entropy": 6.308082056045532, "epoch": 1.0790536641661859, "grad_norm": 1.140625, "learning_rate": 0.000489531854302608, "loss": 6.2063, "mean_token_accuracy": 0.1572630599141121, "num_tokens": 23704545.0, "step": 9350 }, { "entropy": 6.277027750015259, "epoch": 1.0796306982111945, "grad_norm": 1.1484375, "learning_rate": 0.0004895194106322164, "loss": 6.1235, "mean_token_accuracy": 0.17247570157051087, "num_tokens": 23716319.0, "step": 9355 }, { "entropy": 6.384001874923706, "epoch": 1.0802077322562031, "grad_norm": 1.3984375, "learning_rate": 0.0004895069597465709, "loss": 6.2092, "mean_token_accuracy": 0.16064286977052689, "num_tokens": 23728633.0, "step": 9360 }, { "entropy": 6.416384887695313, "epoch": 1.0807847663012118, "grad_norm": 1.3515625, "learning_rate": 0.0004894945016460904, "loss": 6.2165, "mean_token_accuracy": 0.1609300494194031, "num_tokens": 23741370.0, "step": 9365 }, { "entropy": 6.349208211898803, "epoch": 1.0813618003462204, "grad_norm": 1.4921875, "learning_rate": 0.0004894820363311938, "loss": 6.1808, "mean_token_accuracy": 0.16120522022247313, "num_tokens": 23754026.0, "step": 9370 }, { "entropy": 6.358585834503174, "epoch": 1.081938834391229, "grad_norm": 1.234375, "learning_rate": 0.0004894695638023005, "loss": 6.2496, "mean_token_accuracy": 0.1550566226243973, "num_tokens": 23766950.0, "step": 9375 }, { "entropy": 6.364051389694214, "epoch": 1.0825158684362377, "grad_norm": 1.25, "learning_rate": 0.00048945708405983, "loss": 6.2438, "mean_token_accuracy": 0.16189382672309877, "num_tokens": 23780858.0, "step": 9380 }, { "entropy": 6.405634260177612, "epoch": 1.0830929024812463, "grad_norm": 1.421875, "learning_rate": 0.0004894445971042019, "loss": 6.1763, "mean_token_accuracy": 0.1622998982667923, "num_tokens": 23793213.0, "step": 9385 }, { "entropy": 6.302175426483155, "epoch": 1.083669936526255, "grad_norm": 1.796875, "learning_rate": 0.0004894321029358364, "loss": 6.1903, "mean_token_accuracy": 0.1612499751150608, "num_tokens": 23804754.0, "step": 9390 }, { "entropy": 6.287882852554321, "epoch": 1.0842469705712636, "grad_norm": 1.3828125, "learning_rate": 0.0004894196015551536, "loss": 6.2081, "mean_token_accuracy": 0.16173621714115144, "num_tokens": 23817503.0, "step": 9395 }, { "entropy": 6.3686400890350345, "epoch": 1.0848240046162723, "grad_norm": 1.40625, "learning_rate": 0.000489407092962574, "loss": 6.2052, "mean_token_accuracy": 0.1568010240793228, "num_tokens": 23830263.0, "step": 9400 }, { "entropy": 6.36795973777771, "epoch": 1.085401038661281, "grad_norm": 1.4140625, "learning_rate": 0.0004893945771585183, "loss": 6.1213, "mean_token_accuracy": 0.16961509138345718, "num_tokens": 23843734.0, "step": 9405 }, { "entropy": 6.360470724105835, "epoch": 1.0859780727062898, "grad_norm": 1.3828125, "learning_rate": 0.0004893820541434075, "loss": 6.2461, "mean_token_accuracy": 0.16234959214925765, "num_tokens": 23856857.0, "step": 9410 }, { "entropy": 6.344463777542114, "epoch": 1.0865551067512984, "grad_norm": 1.21875, "learning_rate": 0.0004893695239176629, "loss": 6.1358, "mean_token_accuracy": 0.16343702822923661, "num_tokens": 23869961.0, "step": 9415 }, { "entropy": 6.357371282577515, "epoch": 1.087132140796307, "grad_norm": 1.359375, "learning_rate": 0.0004893569864817057, "loss": 6.2664, "mean_token_accuracy": 0.15537794083356857, "num_tokens": 23884551.0, "step": 9420 }, { "entropy": 6.3662666320800785, "epoch": 1.0877091748413157, "grad_norm": 1.2734375, "learning_rate": 0.0004893444418359579, "loss": 6.2702, "mean_token_accuracy": 0.15453500151634217, "num_tokens": 23897240.0, "step": 9425 }, { "entropy": 6.384363794326783, "epoch": 1.0882862088863243, "grad_norm": 1.3671875, "learning_rate": 0.000489331889980841, "loss": 6.1507, "mean_token_accuracy": 0.1617793247103691, "num_tokens": 23909677.0, "step": 9430 }, { "entropy": 6.378599834442139, "epoch": 1.088863242931333, "grad_norm": 1.265625, "learning_rate": 0.0004893193309167778, "loss": 6.2053, "mean_token_accuracy": 0.15970574617385863, "num_tokens": 23921552.0, "step": 9435 }, { "entropy": 6.402880382537842, "epoch": 1.0894402769763416, "grad_norm": 4.65625, "learning_rate": 0.0004893067646441902, "loss": 6.2554, "mean_token_accuracy": 0.15138119906187059, "num_tokens": 23936315.0, "step": 9440 }, { "entropy": 6.350248575210571, "epoch": 1.0900173110213502, "grad_norm": 1.6875, "learning_rate": 0.000489294191163501, "loss": 6.229, "mean_token_accuracy": 0.15604216903448104, "num_tokens": 23948939.0, "step": 9445 }, { "entropy": 6.410356950759888, "epoch": 1.0905943450663589, "grad_norm": 1.5625, "learning_rate": 0.0004892816104751331, "loss": 6.2336, "mean_token_accuracy": 0.15622987747192382, "num_tokens": 23961657.0, "step": 9450 }, { "entropy": 6.4098145961761475, "epoch": 1.0911713791113675, "grad_norm": 1.328125, "learning_rate": 0.0004892690225795096, "loss": 6.3006, "mean_token_accuracy": 0.14848166555166245, "num_tokens": 23974085.0, "step": 9455 }, { "entropy": 6.303513717651367, "epoch": 1.0917484131563762, "grad_norm": 1.84375, "learning_rate": 0.0004892564274770542, "loss": 6.1443, "mean_token_accuracy": 0.1626450762152672, "num_tokens": 23987038.0, "step": 9460 }, { "entropy": 6.442585802078247, "epoch": 1.0923254472013848, "grad_norm": 1.484375, "learning_rate": 0.0004892438251681901, "loss": 6.2233, "mean_token_accuracy": 0.16099887639284133, "num_tokens": 24001051.0, "step": 9465 }, { "entropy": 6.355003547668457, "epoch": 1.0929024812463934, "grad_norm": 1.640625, "learning_rate": 0.0004892312156533413, "loss": 6.1834, "mean_token_accuracy": 0.15782278925180435, "num_tokens": 24013817.0, "step": 9470 }, { "entropy": 6.28466534614563, "epoch": 1.0934795152914023, "grad_norm": 1.5625, "learning_rate": 0.0004892185989329321, "loss": 6.1254, "mean_token_accuracy": 0.164686119556427, "num_tokens": 24025810.0, "step": 9475 }, { "entropy": 6.277740526199341, "epoch": 1.094056549336411, "grad_norm": 1.3828125, "learning_rate": 0.0004892059750073868, "loss": 6.1332, "mean_token_accuracy": 0.16929626762866973, "num_tokens": 24039796.0, "step": 9480 }, { "entropy": 6.366404342651367, "epoch": 1.0946335833814196, "grad_norm": 1.3046875, "learning_rate": 0.0004891933438771299, "loss": 6.1861, "mean_token_accuracy": 0.16250718981027604, "num_tokens": 24052721.0, "step": 9485 }, { "entropy": 6.3012937068939205, "epoch": 1.0952106174264282, "grad_norm": 1.3671875, "learning_rate": 0.0004891807055425862, "loss": 6.0907, "mean_token_accuracy": 0.17106976062059404, "num_tokens": 24064515.0, "step": 9490 }, { "entropy": 6.254371690750122, "epoch": 1.0957876514714369, "grad_norm": 1.375, "learning_rate": 0.0004891680600041809, "loss": 6.1401, "mean_token_accuracy": 0.15985100865364074, "num_tokens": 24078537.0, "step": 9495 }, { "entropy": 6.410112905502319, "epoch": 1.0963646855164455, "grad_norm": 1.578125, "learning_rate": 0.0004891554072623392, "loss": 6.2528, "mean_token_accuracy": 0.15630560666322707, "num_tokens": 24092067.0, "step": 9500 }, { "entropy": 6.368152618408203, "epoch": 1.0969417195614541, "grad_norm": 2.21875, "learning_rate": 0.0004891427473174869, "loss": 6.2061, "mean_token_accuracy": 0.15990003943443298, "num_tokens": 24105625.0, "step": 9505 }, { "entropy": 6.396222496032715, "epoch": 1.0975187536064628, "grad_norm": 1.1796875, "learning_rate": 0.0004891300801700496, "loss": 6.2431, "mean_token_accuracy": 0.15077004134654998, "num_tokens": 24119714.0, "step": 9510 }, { "entropy": 6.329865121841431, "epoch": 1.0980957876514714, "grad_norm": 1.21875, "learning_rate": 0.0004891174058204534, "loss": 6.132, "mean_token_accuracy": 0.1595097690820694, "num_tokens": 24132873.0, "step": 9515 }, { "entropy": 6.31348352432251, "epoch": 1.09867282169648, "grad_norm": 1.2421875, "learning_rate": 0.0004891047242691246, "loss": 6.1466, "mean_token_accuracy": 0.15776203125715255, "num_tokens": 24145550.0, "step": 9520 }, { "entropy": 6.367596292495728, "epoch": 1.0992498557414887, "grad_norm": 2.296875, "learning_rate": 0.0004890920355164897, "loss": 6.1561, "mean_token_accuracy": 0.15608249455690384, "num_tokens": 24158232.0, "step": 9525 }, { "entropy": 6.392232513427734, "epoch": 1.0998268897864973, "grad_norm": 5.21875, "learning_rate": 0.0004890793395629756, "loss": 6.2952, "mean_token_accuracy": 0.1520036354660988, "num_tokens": 24170780.0, "step": 9530 }, { "entropy": 6.346212100982666, "epoch": 1.100403923831506, "grad_norm": 1.8359375, "learning_rate": 0.0004890666364090093, "loss": 6.1696, "mean_token_accuracy": 0.16291800290346145, "num_tokens": 24182347.0, "step": 9535 }, { "entropy": 6.402856874465942, "epoch": 1.1009809578765146, "grad_norm": 1.796875, "learning_rate": 0.0004890539260550181, "loss": 6.2753, "mean_token_accuracy": 0.15678591281175613, "num_tokens": 24195215.0, "step": 9540 }, { "entropy": 6.30384635925293, "epoch": 1.1015579919215233, "grad_norm": 1.1640625, "learning_rate": 0.0004890412085014292, "loss": 6.1616, "mean_token_accuracy": 0.16906683444976806, "num_tokens": 24208214.0, "step": 9545 }, { "entropy": 6.382722663879394, "epoch": 1.1021350259665321, "grad_norm": 1.1328125, "learning_rate": 0.0004890284837486706, "loss": 6.187, "mean_token_accuracy": 0.1664133921265602, "num_tokens": 24220883.0, "step": 9550 }, { "entropy": 6.351633214950562, "epoch": 1.1027120600115408, "grad_norm": 1.1171875, "learning_rate": 0.0004890157517971704, "loss": 6.1088, "mean_token_accuracy": 0.16918679922819138, "num_tokens": 24233918.0, "step": 9555 }, { "entropy": 6.356971645355225, "epoch": 1.1032890940565494, "grad_norm": 1.4609375, "learning_rate": 0.0004890030126473566, "loss": 6.247, "mean_token_accuracy": 0.15816302448511124, "num_tokens": 24247307.0, "step": 9560 }, { "entropy": 6.337526273727417, "epoch": 1.103866128101558, "grad_norm": 2.25, "learning_rate": 0.0004889902662996578, "loss": 6.1669, "mean_token_accuracy": 0.15724012702703477, "num_tokens": 24260149.0, "step": 9565 }, { "entropy": 6.375165748596191, "epoch": 1.1044431621465667, "grad_norm": 1.5859375, "learning_rate": 0.0004889775127545027, "loss": 6.238, "mean_token_accuracy": 0.15898802280426025, "num_tokens": 24273675.0, "step": 9570 }, { "entropy": 6.340470027923584, "epoch": 1.1050201961915753, "grad_norm": 1.171875, "learning_rate": 0.0004889647520123202, "loss": 6.1316, "mean_token_accuracy": 0.1621945694088936, "num_tokens": 24285575.0, "step": 9575 }, { "entropy": 6.410197305679321, "epoch": 1.105597230236584, "grad_norm": 2.40625, "learning_rate": 0.0004889519840735396, "loss": 6.187, "mean_token_accuracy": 0.16513626426458358, "num_tokens": 24297908.0, "step": 9580 }, { "entropy": 6.233777141571045, "epoch": 1.1061742642815926, "grad_norm": 1.703125, "learning_rate": 0.0004889392089385903, "loss": 6.1212, "mean_token_accuracy": 0.16366908550262452, "num_tokens": 24310714.0, "step": 9585 }, { "entropy": 6.280074691772461, "epoch": 1.1067512983266012, "grad_norm": 1.78125, "learning_rate": 0.0004889264266079019, "loss": 6.1752, "mean_token_accuracy": 0.16871743351221086, "num_tokens": 24322367.0, "step": 9590 }, { "entropy": 6.287104368209839, "epoch": 1.1073283323716099, "grad_norm": 1.2890625, "learning_rate": 0.0004889136370819045, "loss": 6.1854, "mean_token_accuracy": 0.15897441729903222, "num_tokens": 24334256.0, "step": 9595 }, { "entropy": 6.3352649211883545, "epoch": 1.1079053664166185, "grad_norm": 1.5078125, "learning_rate": 0.0004889008403610281, "loss": 6.1601, "mean_token_accuracy": 0.1653594493865967, "num_tokens": 24346968.0, "step": 9600 }, { "entropy": 6.436962127685547, "epoch": 1.1084824004616272, "grad_norm": 1.2890625, "learning_rate": 0.0004888880364457033, "loss": 6.2534, "mean_token_accuracy": 0.1597901850938797, "num_tokens": 24360468.0, "step": 9605 }, { "entropy": 6.369411945343018, "epoch": 1.1090594345066358, "grad_norm": 1.265625, "learning_rate": 0.0004888752253363604, "loss": 6.1868, "mean_token_accuracy": 0.16491993069648742, "num_tokens": 24372330.0, "step": 9610 }, { "entropy": 6.2847589492797855, "epoch": 1.1096364685516447, "grad_norm": 1.53125, "learning_rate": 0.0004888624070334308, "loss": 6.1342, "mean_token_accuracy": 0.16332882195711135, "num_tokens": 24384864.0, "step": 9615 }, { "entropy": 6.321532726287842, "epoch": 1.1102135025966533, "grad_norm": 1.25, "learning_rate": 0.0004888495815373452, "loss": 6.0681, "mean_token_accuracy": 0.16914285868406295, "num_tokens": 24397408.0, "step": 9620 }, { "entropy": 6.317392492294312, "epoch": 1.110790536641662, "grad_norm": 1.4375, "learning_rate": 0.0004888367488485351, "loss": 6.1335, "mean_token_accuracy": 0.1612032026052475, "num_tokens": 24409113.0, "step": 9625 }, { "entropy": 6.314182138442993, "epoch": 1.1113675706866706, "grad_norm": 1.265625, "learning_rate": 0.0004888239089674323, "loss": 6.1601, "mean_token_accuracy": 0.16142479479312896, "num_tokens": 24420818.0, "step": 9630 }, { "entropy": 6.383041763305664, "epoch": 1.1119446047316792, "grad_norm": 1.6484375, "learning_rate": 0.0004888110618944686, "loss": 6.2779, "mean_token_accuracy": 0.15037421733140946, "num_tokens": 24434452.0, "step": 9635 }, { "entropy": 6.427024078369141, "epoch": 1.1125216387766879, "grad_norm": 1.65625, "learning_rate": 0.0004887982076300759, "loss": 6.2702, "mean_token_accuracy": 0.15480797290802, "num_tokens": 24448674.0, "step": 9640 }, { "entropy": 6.376167249679566, "epoch": 1.1130986728216965, "grad_norm": 1.7578125, "learning_rate": 0.0004887853461746867, "loss": 6.1727, "mean_token_accuracy": 0.15854671001434326, "num_tokens": 24461388.0, "step": 9645 }, { "entropy": 6.356609535217285, "epoch": 1.1136757068667051, "grad_norm": 1.375, "learning_rate": 0.0004887724775287336, "loss": 6.1436, "mean_token_accuracy": 0.16579209119081498, "num_tokens": 24474304.0, "step": 9650 }, { "entropy": 6.258968782424927, "epoch": 1.1142527409117138, "grad_norm": 1.4609375, "learning_rate": 0.0004887596016926494, "loss": 6.117, "mean_token_accuracy": 0.16495985984802247, "num_tokens": 24487175.0, "step": 9655 }, { "entropy": 6.345869302749634, "epoch": 1.1148297749567224, "grad_norm": 1.4765625, "learning_rate": 0.0004887467186668673, "loss": 6.1624, "mean_token_accuracy": 0.1574894145131111, "num_tokens": 24500160.0, "step": 9660 }, { "entropy": 6.4012657642364506, "epoch": 1.115406809001731, "grad_norm": 1.5546875, "learning_rate": 0.0004887338284518204, "loss": 6.2653, "mean_token_accuracy": 0.15609754621982574, "num_tokens": 24513358.0, "step": 9665 }, { "entropy": 6.367801094055176, "epoch": 1.1159838430467397, "grad_norm": 1.34375, "learning_rate": 0.0004887209310479423, "loss": 6.1507, "mean_token_accuracy": 0.16932276785373687, "num_tokens": 24526254.0, "step": 9670 }, { "entropy": 6.327196407318115, "epoch": 1.1165608770917483, "grad_norm": 1.375, "learning_rate": 0.0004887080264556668, "loss": 6.082, "mean_token_accuracy": 0.16644769310951232, "num_tokens": 24540023.0, "step": 9675 }, { "entropy": 6.344431686401367, "epoch": 1.117137911136757, "grad_norm": 1.78125, "learning_rate": 0.0004886951146754282, "loss": 6.1884, "mean_token_accuracy": 0.1614872083067894, "num_tokens": 24553270.0, "step": 9680 }, { "entropy": 6.389737462997436, "epoch": 1.1177149451817656, "grad_norm": 1.4296875, "learning_rate": 0.0004886821957076603, "loss": 6.1574, "mean_token_accuracy": 0.16487915813922882, "num_tokens": 24565576.0, "step": 9685 }, { "entropy": 6.313331651687622, "epoch": 1.1182919792267745, "grad_norm": 1.890625, "learning_rate": 0.000488669269552798, "loss": 6.2514, "mean_token_accuracy": 0.16085973232984543, "num_tokens": 24578825.0, "step": 9690 }, { "entropy": 6.3549232006073, "epoch": 1.1188690132717831, "grad_norm": 1.25, "learning_rate": 0.000488656336211276, "loss": 6.2449, "mean_token_accuracy": 0.15805209577083587, "num_tokens": 24592058.0, "step": 9695 }, { "entropy": 6.404150485992432, "epoch": 1.1194460473167918, "grad_norm": 1.2734375, "learning_rate": 0.0004886433956835292, "loss": 6.1607, "mean_token_accuracy": 0.16113292276859284, "num_tokens": 24605956.0, "step": 9700 }, { "entropy": 6.3350914478302, "epoch": 1.1200230813618004, "grad_norm": 1.6015625, "learning_rate": 0.0004886304479699929, "loss": 6.1736, "mean_token_accuracy": 0.16226267218589782, "num_tokens": 24618904.0, "step": 9705 }, { "entropy": 6.391560220718384, "epoch": 1.120600115406809, "grad_norm": 1.7265625, "learning_rate": 0.0004886174930711027, "loss": 6.3022, "mean_token_accuracy": 0.16147204041481017, "num_tokens": 24632720.0, "step": 9710 }, { "entropy": 6.404454040527344, "epoch": 1.1211771494518177, "grad_norm": 1.4296875, "learning_rate": 0.0004886045309872941, "loss": 6.2417, "mean_token_accuracy": 0.15741440653800964, "num_tokens": 24644863.0, "step": 9715 }, { "entropy": 6.412680292129517, "epoch": 1.1217541834968263, "grad_norm": 1.2890625, "learning_rate": 0.0004885915617190034, "loss": 6.2241, "mean_token_accuracy": 0.15678914189338683, "num_tokens": 24656884.0, "step": 9720 }, { "entropy": 6.399668502807617, "epoch": 1.122331217541835, "grad_norm": 1.484375, "learning_rate": 0.0004885785852666664, "loss": 6.2334, "mean_token_accuracy": 0.15685741007328033, "num_tokens": 24671008.0, "step": 9725 }, { "entropy": 6.36036114692688, "epoch": 1.1229082515868436, "grad_norm": 1.6171875, "learning_rate": 0.0004885656016307199, "loss": 6.2253, "mean_token_accuracy": 0.15478505194187164, "num_tokens": 24685787.0, "step": 9730 }, { "entropy": 6.463143396377563, "epoch": 1.1234852856318522, "grad_norm": 1.2109375, "learning_rate": 0.0004885526108116004, "loss": 6.2564, "mean_token_accuracy": 0.16071103662252426, "num_tokens": 24697233.0, "step": 9735 }, { "entropy": 6.365033102035523, "epoch": 1.1240623196768609, "grad_norm": 1.5, "learning_rate": 0.000488539612809745, "loss": 6.1716, "mean_token_accuracy": 0.162790547311306, "num_tokens": 24709409.0, "step": 9740 }, { "entropy": 6.303580236434937, "epoch": 1.1246393537218695, "grad_norm": 1.609375, "learning_rate": 0.0004885266076255907, "loss": 6.2484, "mean_token_accuracy": 0.15676273554563522, "num_tokens": 24722006.0, "step": 9745 }, { "entropy": 6.456765222549438, "epoch": 1.1252163877668782, "grad_norm": 1.578125, "learning_rate": 0.000488513595259575, "loss": 6.2482, "mean_token_accuracy": 0.15536370426416396, "num_tokens": 24736060.0, "step": 9750 }, { "entropy": 6.362082052230835, "epoch": 1.125793421811887, "grad_norm": 1.3828125, "learning_rate": 0.0004885005757121357, "loss": 6.222, "mean_token_accuracy": 0.1529646933078766, "num_tokens": 24748008.0, "step": 9755 }, { "entropy": 6.346718120574951, "epoch": 1.1263704558568954, "grad_norm": 1.578125, "learning_rate": 0.0004884875489837105, "loss": 6.2068, "mean_token_accuracy": 0.15854579210281372, "num_tokens": 24760631.0, "step": 9760 }, { "entropy": 6.198451948165894, "epoch": 1.1269474899019043, "grad_norm": 1.7265625, "learning_rate": 0.0004884745150747378, "loss": 6.0406, "mean_token_accuracy": 0.17826538532972336, "num_tokens": 24772646.0, "step": 9765 }, { "entropy": 6.310153341293335, "epoch": 1.127524523946913, "grad_norm": 1.5078125, "learning_rate": 0.0004884614739856556, "loss": 6.2322, "mean_token_accuracy": 0.15513329356908798, "num_tokens": 24784571.0, "step": 9770 }, { "entropy": 6.441531229019165, "epoch": 1.1281015579919216, "grad_norm": 1.4375, "learning_rate": 0.0004884484257169028, "loss": 6.218, "mean_token_accuracy": 0.16059867888689042, "num_tokens": 24797810.0, "step": 9775 }, { "entropy": 6.338571166992187, "epoch": 1.1286785920369302, "grad_norm": 1.125, "learning_rate": 0.0004884353702689183, "loss": 6.2187, "mean_token_accuracy": 0.16038416177034379, "num_tokens": 24810677.0, "step": 9780 }, { "entropy": 6.347803831100464, "epoch": 1.1292556260819389, "grad_norm": 1.65625, "learning_rate": 0.0004884223076421411, "loss": 6.1244, "mean_token_accuracy": 0.16551823019981385, "num_tokens": 24823138.0, "step": 9785 }, { "entropy": 6.200040245056153, "epoch": 1.1298326601269475, "grad_norm": 1.3203125, "learning_rate": 0.0004884092378370106, "loss": 6.1284, "mean_token_accuracy": 0.17274417281150817, "num_tokens": 24834548.0, "step": 9790 }, { "entropy": 6.300217199325561, "epoch": 1.1304096941719561, "grad_norm": 1.3359375, "learning_rate": 0.0004883961608539664, "loss": 6.2222, "mean_token_accuracy": 0.16022792905569078, "num_tokens": 24847326.0, "step": 9795 }, { "entropy": 6.326699066162109, "epoch": 1.1309867282169648, "grad_norm": 1.5703125, "learning_rate": 0.0004883830766934484, "loss": 6.07, "mean_token_accuracy": 0.16643578335642814, "num_tokens": 24860417.0, "step": 9800 }, { "entropy": 6.307373332977295, "epoch": 1.1315637622619734, "grad_norm": 1.6484375, "learning_rate": 0.0004883699853558965, "loss": 6.1698, "mean_token_accuracy": 0.15934834480285645, "num_tokens": 24872759.0, "step": 9805 }, { "entropy": 6.354069089889526, "epoch": 1.132140796306982, "grad_norm": 1.2109375, "learning_rate": 0.0004883568868417511, "loss": 6.1756, "mean_token_accuracy": 0.15413878858089447, "num_tokens": 24885278.0, "step": 9810 }, { "entropy": 6.389302158355713, "epoch": 1.1327178303519907, "grad_norm": 1.3984375, "learning_rate": 0.0004883437811514528, "loss": 6.253, "mean_token_accuracy": 0.15297829508781433, "num_tokens": 24898596.0, "step": 9815 }, { "entropy": 6.396500825881958, "epoch": 1.1332948643969993, "grad_norm": 1.3125, "learning_rate": 0.0004883306682854424, "loss": 6.1644, "mean_token_accuracy": 0.163560388982296, "num_tokens": 24911755.0, "step": 9820 }, { "entropy": 6.341898441314697, "epoch": 1.133871898442008, "grad_norm": 1.546875, "learning_rate": 0.0004883175482441611, "loss": 6.2487, "mean_token_accuracy": 0.1547734707593918, "num_tokens": 24925197.0, "step": 9825 }, { "entropy": 6.277676725387574, "epoch": 1.1344489324870168, "grad_norm": 2.15625, "learning_rate": 0.0004883044210280499, "loss": 6.0629, "mean_token_accuracy": 0.17149295508861542, "num_tokens": 24938204.0, "step": 9830 }, { "entropy": 6.299826765060425, "epoch": 1.1350259665320255, "grad_norm": 2.703125, "learning_rate": 0.0004882912866375505, "loss": 6.2069, "mean_token_accuracy": 0.16771370023489, "num_tokens": 24949382.0, "step": 9835 }, { "entropy": 6.248973083496094, "epoch": 1.1356030005770341, "grad_norm": 1.5859375, "learning_rate": 0.00048827814507310455, "loss": 6.1424, "mean_token_accuracy": 0.15670545101165773, "num_tokens": 24961685.0, "step": 9840 }, { "entropy": 6.33607850074768, "epoch": 1.1361800346220428, "grad_norm": 1.6640625, "learning_rate": 0.00048826499633515416, "loss": 6.1412, "mean_token_accuracy": 0.1669670268893242, "num_tokens": 24973619.0, "step": 9845 }, { "entropy": 6.331471538543701, "epoch": 1.1367570686670514, "grad_norm": 1.4765625, "learning_rate": 0.00048825184042414156, "loss": 6.1318, "mean_token_accuracy": 0.1675176814198494, "num_tokens": 24985156.0, "step": 9850 }, { "entropy": 6.311733245849609, "epoch": 1.13733410271206, "grad_norm": 1.8125, "learning_rate": 0.0004882386773405092, "loss": 6.1588, "mean_token_accuracy": 0.17118309289216996, "num_tokens": 24997891.0, "step": 9855 }, { "entropy": 6.35788254737854, "epoch": 1.1379111367570687, "grad_norm": 1.4375, "learning_rate": 0.0004882255070846999, "loss": 6.1654, "mean_token_accuracy": 0.16182998716831207, "num_tokens": 25009824.0, "step": 9860 }, { "entropy": 6.362553501129151, "epoch": 1.1384881708020773, "grad_norm": 1.140625, "learning_rate": 0.00048821232965715663, "loss": 6.2016, "mean_token_accuracy": 0.16237591803073884, "num_tokens": 25021574.0, "step": 9865 }, { "entropy": 6.32572078704834, "epoch": 1.139065204847086, "grad_norm": 1.3125, "learning_rate": 0.0004881991450583225, "loss": 6.1044, "mean_token_accuracy": 0.1635513037443161, "num_tokens": 25033315.0, "step": 9870 }, { "entropy": 6.2788228511810305, "epoch": 1.1396422388920946, "grad_norm": 1.578125, "learning_rate": 0.000488185953288641, "loss": 6.1806, "mean_token_accuracy": 0.16586582809686662, "num_tokens": 25046284.0, "step": 9875 }, { "entropy": 6.362651920318603, "epoch": 1.1402192729371032, "grad_norm": 1.625, "learning_rate": 0.0004881727543485559, "loss": 6.175, "mean_token_accuracy": 0.15997907221317292, "num_tokens": 25058484.0, "step": 9880 }, { "entropy": 6.3163597106933596, "epoch": 1.1407963069821119, "grad_norm": 1.6640625, "learning_rate": 0.00048815954823851107, "loss": 6.0916, "mean_token_accuracy": 0.1663131073117256, "num_tokens": 25070555.0, "step": 9885 }, { "entropy": 6.389148378372193, "epoch": 1.1413733410271205, "grad_norm": 1.375, "learning_rate": 0.00048814633495895067, "loss": 6.2474, "mean_token_accuracy": 0.15366053134202956, "num_tokens": 25083492.0, "step": 9890 }, { "entropy": 6.3734739303588865, "epoch": 1.1419503750721294, "grad_norm": 1.34375, "learning_rate": 0.0004881331145103192, "loss": 6.2516, "mean_token_accuracy": 0.15353629887104034, "num_tokens": 25096332.0, "step": 9895 }, { "entropy": 6.382818603515625, "epoch": 1.1425274091171378, "grad_norm": 1.9296875, "learning_rate": 0.0004881198868930614, "loss": 6.1785, "mean_token_accuracy": 0.15331874191761016, "num_tokens": 25110447.0, "step": 9900 }, { "entropy": 6.479769325256347, "epoch": 1.1431044431621467, "grad_norm": 1.5703125, "learning_rate": 0.00048810665210762195, "loss": 6.2074, "mean_token_accuracy": 0.16485313773155214, "num_tokens": 25123852.0, "step": 9905 }, { "entropy": 6.382903051376343, "epoch": 1.1436814772071553, "grad_norm": 1.3671875, "learning_rate": 0.00048809341015444615, "loss": 6.2096, "mean_token_accuracy": 0.15939941108226777, "num_tokens": 25136151.0, "step": 9910 }, { "entropy": 6.3541422367095945, "epoch": 1.144258511252164, "grad_norm": 1.984375, "learning_rate": 0.00048808016103397934, "loss": 6.168, "mean_token_accuracy": 0.16297494173049926, "num_tokens": 25149642.0, "step": 9915 }, { "entropy": 6.3219459533691404, "epoch": 1.1448355452971726, "grad_norm": 2.671875, "learning_rate": 0.0004880669047466671, "loss": 6.1206, "mean_token_accuracy": 0.17158780246973038, "num_tokens": 25162022.0, "step": 9920 }, { "entropy": 6.376477193832398, "epoch": 1.1454125793421812, "grad_norm": 1.859375, "learning_rate": 0.00048805364129295554, "loss": 6.2791, "mean_token_accuracy": 0.1544181153178215, "num_tokens": 25175404.0, "step": 9925 }, { "entropy": 6.315047931671143, "epoch": 1.1459896133871899, "grad_norm": 1.6015625, "learning_rate": 0.00048804037067329037, "loss": 6.0942, "mean_token_accuracy": 0.16884433776140212, "num_tokens": 25188148.0, "step": 9930 }, { "entropy": 6.355247545242309, "epoch": 1.1465666474321985, "grad_norm": 1.2421875, "learning_rate": 0.0004880270928881183, "loss": 6.1734, "mean_token_accuracy": 0.1672818660736084, "num_tokens": 25199960.0, "step": 9935 }, { "entropy": 6.2450096130371096, "epoch": 1.1471436814772071, "grad_norm": 1.9765625, "learning_rate": 0.0004880138079378857, "loss": 6.1302, "mean_token_accuracy": 0.16437119990587234, "num_tokens": 25211054.0, "step": 9940 }, { "entropy": 6.339324235916138, "epoch": 1.1477207155222158, "grad_norm": 1.5546875, "learning_rate": 0.0004880005158230395, "loss": 6.0889, "mean_token_accuracy": 0.17020729631185533, "num_tokens": 25222553.0, "step": 9945 }, { "entropy": 6.344603872299194, "epoch": 1.1482977495672244, "grad_norm": 1.7265625, "learning_rate": 0.0004879872165440268, "loss": 6.1685, "mean_token_accuracy": 0.155762979388237, "num_tokens": 25235472.0, "step": 9950 }, { "entropy": 6.270013475418091, "epoch": 1.148874783612233, "grad_norm": 1.421875, "learning_rate": 0.0004879739101012948, "loss": 6.2306, "mean_token_accuracy": 0.1624113589525223, "num_tokens": 25250209.0, "step": 9955 }, { "entropy": 6.363943099975586, "epoch": 1.1494518176572417, "grad_norm": 1.3125, "learning_rate": 0.0004879605964952911, "loss": 6.2106, "mean_token_accuracy": 0.1601069986820221, "num_tokens": 25262064.0, "step": 9960 }, { "entropy": 6.420304775238037, "epoch": 1.1500288517022503, "grad_norm": 2.328125, "learning_rate": 0.00048794727572646366, "loss": 6.1949, "mean_token_accuracy": 0.1625082701444626, "num_tokens": 25274833.0, "step": 9965 }, { "entropy": 6.368671655654907, "epoch": 1.1506058857472592, "grad_norm": 1.234375, "learning_rate": 0.0004879339477952603, "loss": 6.2022, "mean_token_accuracy": 0.16648445650935173, "num_tokens": 25288397.0, "step": 9970 }, { "entropy": 6.307248640060425, "epoch": 1.1511829197922678, "grad_norm": 1.8125, "learning_rate": 0.00048792061270212935, "loss": 6.133, "mean_token_accuracy": 0.17006682157516478, "num_tokens": 25300887.0, "step": 9975 }, { "entropy": 6.401169538497925, "epoch": 1.1517599538372765, "grad_norm": 1.484375, "learning_rate": 0.0004879072704475193, "loss": 6.2349, "mean_token_accuracy": 0.16358886212110518, "num_tokens": 25314686.0, "step": 9980 }, { "entropy": 6.440695905685425, "epoch": 1.1523369878822851, "grad_norm": 2.0625, "learning_rate": 0.00048789392103187906, "loss": 6.2611, "mean_token_accuracy": 0.16165925413370133, "num_tokens": 25328253.0, "step": 9985 }, { "entropy": 6.404678010940552, "epoch": 1.1529140219272938, "grad_norm": 2.03125, "learning_rate": 0.0004878805644556575, "loss": 6.1962, "mean_token_accuracy": 0.16324919015169143, "num_tokens": 25340583.0, "step": 9990 }, { "entropy": 6.297409296035767, "epoch": 1.1534910559723024, "grad_norm": 1.3203125, "learning_rate": 0.000487867200719304, "loss": 6.1262, "mean_token_accuracy": 0.1642940953373909, "num_tokens": 25352513.0, "step": 9995 }, { "entropy": 6.331809711456299, "epoch": 1.154068090017311, "grad_norm": 1.421875, "learning_rate": 0.0004878538298232678, "loss": 6.2146, "mean_token_accuracy": 0.15754812508821486, "num_tokens": 25365044.0, "step": 10000 }, { "entropy": 6.367120790481567, "epoch": 1.1546451240623197, "grad_norm": 1.3203125, "learning_rate": 0.0004878404517679988, "loss": 6.1761, "mean_token_accuracy": 0.15582527220249176, "num_tokens": 25377381.0, "step": 10005 }, { "entropy": 6.400685453414917, "epoch": 1.1552221581073283, "grad_norm": 1.4375, "learning_rate": 0.00048782706655394695, "loss": 6.18, "mean_token_accuracy": 0.1643991768360138, "num_tokens": 25390723.0, "step": 10010 }, { "entropy": 6.296201992034912, "epoch": 1.155799192152337, "grad_norm": 1.6328125, "learning_rate": 0.0004878136741815624, "loss": 6.1212, "mean_token_accuracy": 0.16537229716777802, "num_tokens": 25403501.0, "step": 10015 }, { "entropy": 6.271032047271729, "epoch": 1.1563762261973456, "grad_norm": 1.8671875, "learning_rate": 0.0004878002746512956, "loss": 6.1031, "mean_token_accuracy": 0.17037995159626007, "num_tokens": 25415565.0, "step": 10020 }, { "entropy": 6.283905696868897, "epoch": 1.1569532602423542, "grad_norm": 1.3046875, "learning_rate": 0.0004877868679635974, "loss": 6.1687, "mean_token_accuracy": 0.16751373708248138, "num_tokens": 25428261.0, "step": 10025 }, { "entropy": 6.377343845367432, "epoch": 1.1575302942873629, "grad_norm": 1.2734375, "learning_rate": 0.0004877734541189185, "loss": 6.181, "mean_token_accuracy": 0.15702162981033324, "num_tokens": 25439758.0, "step": 10030 }, { "entropy": 6.360610103607177, "epoch": 1.1581073283323717, "grad_norm": 1.3125, "learning_rate": 0.00048776003311771013, "loss": 6.2364, "mean_token_accuracy": 0.15337282419204712, "num_tokens": 25452162.0, "step": 10035 }, { "entropy": 6.4076014995574955, "epoch": 1.1586843623773802, "grad_norm": 1.515625, "learning_rate": 0.0004877466049604238, "loss": 6.2545, "mean_token_accuracy": 0.15962868332862853, "num_tokens": 25463741.0, "step": 10040 }, { "entropy": 6.320121145248413, "epoch": 1.159261396422389, "grad_norm": 1.5859375, "learning_rate": 0.00048773316964751106, "loss": 6.1871, "mean_token_accuracy": 0.15946279913187028, "num_tokens": 25476466.0, "step": 10045 }, { "entropy": 6.422423934936523, "epoch": 1.1598384304673977, "grad_norm": 2.09375, "learning_rate": 0.0004877197271794239, "loss": 6.1692, "mean_token_accuracy": 0.1618300974369049, "num_tokens": 25488453.0, "step": 10050 }, { "entropy": 6.3750358581542965, "epoch": 1.1604154645124063, "grad_norm": 1.40625, "learning_rate": 0.0004877062775566142, "loss": 6.1942, "mean_token_accuracy": 0.16088102161884307, "num_tokens": 25501803.0, "step": 10055 }, { "entropy": 6.349880695343018, "epoch": 1.160992498557415, "grad_norm": 2.0, "learning_rate": 0.00048769282077953464, "loss": 6.2892, "mean_token_accuracy": 0.15862567573785782, "num_tokens": 25515844.0, "step": 10060 }, { "entropy": 6.369120979309082, "epoch": 1.1615695326024236, "grad_norm": 1.59375, "learning_rate": 0.00048767935684863775, "loss": 6.183, "mean_token_accuracy": 0.16268929988145828, "num_tokens": 25528529.0, "step": 10065 }, { "entropy": 6.397540330886841, "epoch": 1.1621465666474322, "grad_norm": 1.4453125, "learning_rate": 0.0004876658857643762, "loss": 6.2204, "mean_token_accuracy": 0.15767233669757844, "num_tokens": 25540110.0, "step": 10070 }, { "entropy": 6.364495658874512, "epoch": 1.1627236006924409, "grad_norm": 1.375, "learning_rate": 0.0004876524075272034, "loss": 6.1908, "mean_token_accuracy": 0.158960822224617, "num_tokens": 25553332.0, "step": 10075 }, { "entropy": 6.348095035552978, "epoch": 1.1633006347374495, "grad_norm": 1.5703125, "learning_rate": 0.00048763892213757234, "loss": 6.1686, "mean_token_accuracy": 0.16090085208415986, "num_tokens": 25565852.0, "step": 10080 }, { "entropy": 6.36542158126831, "epoch": 1.1638776687824581, "grad_norm": 1.5703125, "learning_rate": 0.00048762542959593683, "loss": 6.1672, "mean_token_accuracy": 0.1625974088907242, "num_tokens": 25579642.0, "step": 10085 }, { "entropy": 6.2937578678131105, "epoch": 1.1644547028274668, "grad_norm": 1.515625, "learning_rate": 0.0004876119299027506, "loss": 6.1556, "mean_token_accuracy": 0.16866278797388076, "num_tokens": 25591452.0, "step": 10090 }, { "entropy": 6.290343618392944, "epoch": 1.1650317368724754, "grad_norm": 1.25, "learning_rate": 0.00048759842305846766, "loss": 6.1279, "mean_token_accuracy": 0.16313421428203584, "num_tokens": 25603426.0, "step": 10095 }, { "entropy": 6.355361557006836, "epoch": 1.165608770917484, "grad_norm": 1.5, "learning_rate": 0.0004875849090635425, "loss": 6.2365, "mean_token_accuracy": 0.15997890681028365, "num_tokens": 25617014.0, "step": 10100 }, { "entropy": 6.37194595336914, "epoch": 1.1661858049624927, "grad_norm": 1.3046875, "learning_rate": 0.00048757138791842943, "loss": 6.1972, "mean_token_accuracy": 0.16384346783161163, "num_tokens": 25629916.0, "step": 10105 }, { "entropy": 6.3468346118927, "epoch": 1.1667628390075016, "grad_norm": 1.421875, "learning_rate": 0.0004875578596235832, "loss": 6.1866, "mean_token_accuracy": 0.16534270495176315, "num_tokens": 25642301.0, "step": 10110 }, { "entropy": 6.327104473114014, "epoch": 1.1673398730525102, "grad_norm": 1.3828125, "learning_rate": 0.0004875443241794591, "loss": 6.1448, "mean_token_accuracy": 0.16186633408069612, "num_tokens": 25653976.0, "step": 10115 }, { "entropy": 6.33780460357666, "epoch": 1.1679169070975188, "grad_norm": 1.515625, "learning_rate": 0.00048753078158651227, "loss": 6.1864, "mean_token_accuracy": 0.1554411083459854, "num_tokens": 25666078.0, "step": 10120 }, { "entropy": 6.343927383422852, "epoch": 1.1684939411425275, "grad_norm": 1.6484375, "learning_rate": 0.000487517231845198, "loss": 6.2353, "mean_token_accuracy": 0.15490031838417054, "num_tokens": 25679780.0, "step": 10125 }, { "entropy": 6.408223009109497, "epoch": 1.169070975187536, "grad_norm": 1.2109375, "learning_rate": 0.0004875036749559724, "loss": 6.176, "mean_token_accuracy": 0.1544538825750351, "num_tokens": 25694179.0, "step": 10130 }, { "entropy": 6.275277757644654, "epoch": 1.1696480092325447, "grad_norm": 1.234375, "learning_rate": 0.00048749011091929115, "loss": 6.1543, "mean_token_accuracy": 0.17059712260961532, "num_tokens": 25707281.0, "step": 10135 }, { "entropy": 6.383667278289795, "epoch": 1.1702250432775534, "grad_norm": 1.3515625, "learning_rate": 0.0004874765397356105, "loss": 6.1877, "mean_token_accuracy": 0.16059649288654326, "num_tokens": 25719901.0, "step": 10140 }, { "entropy": 6.355267190933228, "epoch": 1.170802077322562, "grad_norm": 1.9453125, "learning_rate": 0.0004874629614053871, "loss": 6.1934, "mean_token_accuracy": 0.1627344861626625, "num_tokens": 25732063.0, "step": 10145 }, { "entropy": 6.267529439926148, "epoch": 1.1713791113675707, "grad_norm": 1.9140625, "learning_rate": 0.0004874493759290775, "loss": 6.1543, "mean_token_accuracy": 0.16306477189064025, "num_tokens": 25743966.0, "step": 10150 }, { "entropy": 6.147643136978149, "epoch": 1.1719561454125793, "grad_norm": 2.96875, "learning_rate": 0.00048743578330713854, "loss": 5.9489, "mean_token_accuracy": 0.1810133144259453, "num_tokens": 25757053.0, "step": 10155 }, { "entropy": 6.152535343170166, "epoch": 1.172533179457588, "grad_norm": 1.21875, "learning_rate": 0.0004874221835400277, "loss": 6.0279, "mean_token_accuracy": 0.17614102661609649, "num_tokens": 25769430.0, "step": 10160 }, { "entropy": 6.3164385795593265, "epoch": 1.1731102135025966, "grad_norm": 1.25, "learning_rate": 0.0004874085766282022, "loss": 6.1467, "mean_token_accuracy": 0.1642584428191185, "num_tokens": 25781687.0, "step": 10165 }, { "entropy": 6.316783618927002, "epoch": 1.1736872475476052, "grad_norm": 1.4609375, "learning_rate": 0.00048739496257211966, "loss": 6.1701, "mean_token_accuracy": 0.1690356597304344, "num_tokens": 25793646.0, "step": 10170 }, { "entropy": 6.33498969078064, "epoch": 1.1742642815926139, "grad_norm": 1.953125, "learning_rate": 0.00048738134137223815, "loss": 6.2383, "mean_token_accuracy": 0.1570924326777458, "num_tokens": 25807757.0, "step": 10175 }, { "entropy": 6.342399215698242, "epoch": 1.1748413156376225, "grad_norm": 2.546875, "learning_rate": 0.00048736771302901566, "loss": 6.1804, "mean_token_accuracy": 0.16174473017454147, "num_tokens": 25820063.0, "step": 10180 }, { "entropy": 6.319576597213745, "epoch": 1.1754183496826314, "grad_norm": 1.390625, "learning_rate": 0.00048735407754291063, "loss": 6.123, "mean_token_accuracy": 0.16988920718431472, "num_tokens": 25832974.0, "step": 10185 }, { "entropy": 6.379149007797241, "epoch": 1.17599538372764, "grad_norm": 1.3828125, "learning_rate": 0.00048734043491438175, "loss": 6.2003, "mean_token_accuracy": 0.15487931072711944, "num_tokens": 25845939.0, "step": 10190 }, { "entropy": 6.3196595191955565, "epoch": 1.1765724177726486, "grad_norm": 1.515625, "learning_rate": 0.00048732678514388773, "loss": 6.1455, "mean_token_accuracy": 0.16049207746982574, "num_tokens": 25857480.0, "step": 10195 }, { "entropy": 6.291083765029907, "epoch": 1.1771494518176573, "grad_norm": 1.8203125, "learning_rate": 0.0004873131282318878, "loss": 6.0832, "mean_token_accuracy": 0.1705268293619156, "num_tokens": 25869384.0, "step": 10200 }, { "entropy": 6.30240650177002, "epoch": 1.177726485862666, "grad_norm": 1.6484375, "learning_rate": 0.00048729946417884126, "loss": 6.1705, "mean_token_accuracy": 0.16226058602333068, "num_tokens": 25881705.0, "step": 10205 }, { "entropy": 6.36404013633728, "epoch": 1.1783035199076746, "grad_norm": 1.3515625, "learning_rate": 0.0004872857929852076, "loss": 6.1753, "mean_token_accuracy": 0.15568970143795013, "num_tokens": 25894072.0, "step": 10210 }, { "entropy": 6.363600587844848, "epoch": 1.1788805539526832, "grad_norm": 1.5, "learning_rate": 0.0004872721146514469, "loss": 6.0612, "mean_token_accuracy": 0.17028955072164537, "num_tokens": 25907358.0, "step": 10215 }, { "entropy": 6.243066787719727, "epoch": 1.1794575879976918, "grad_norm": 1.3359375, "learning_rate": 0.000487258429178019, "loss": 6.1396, "mean_token_accuracy": 0.17397456020116805, "num_tokens": 25918746.0, "step": 10220 }, { "entropy": 6.3143209457397464, "epoch": 1.1800346220427005, "grad_norm": 1.828125, "learning_rate": 0.00048724473656538427, "loss": 6.1761, "mean_token_accuracy": 0.1687172085046768, "num_tokens": 25930759.0, "step": 10225 }, { "entropy": 6.290168237686157, "epoch": 1.1806116560877091, "grad_norm": 1.640625, "learning_rate": 0.0004872310368140032, "loss": 6.0937, "mean_token_accuracy": 0.16777861267328262, "num_tokens": 25942364.0, "step": 10230 }, { "entropy": 6.269335699081421, "epoch": 1.1811886901327178, "grad_norm": 1.2890625, "learning_rate": 0.0004872173299243368, "loss": 6.1418, "mean_token_accuracy": 0.17016907334327697, "num_tokens": 25954254.0, "step": 10235 }, { "entropy": 6.335594272613525, "epoch": 1.1817657241777264, "grad_norm": 2.15625, "learning_rate": 0.00048720361589684575, "loss": 6.2474, "mean_token_accuracy": 0.16507446467876435, "num_tokens": 25966708.0, "step": 10240 }, { "entropy": 6.332195568084717, "epoch": 1.182342758222735, "grad_norm": 1.34375, "learning_rate": 0.00048718989473199147, "loss": 6.1933, "mean_token_accuracy": 0.1564444601535797, "num_tokens": 25979301.0, "step": 10245 }, { "entropy": 6.362717962265014, "epoch": 1.182919792267744, "grad_norm": 1.34375, "learning_rate": 0.0004871761664302356, "loss": 6.1521, "mean_token_accuracy": 0.16474512219429016, "num_tokens": 25992195.0, "step": 10250 }, { "entropy": 6.284235668182373, "epoch": 1.1834968263127525, "grad_norm": 1.2265625, "learning_rate": 0.0004871624309920397, "loss": 6.041, "mean_token_accuracy": 0.1756657689809799, "num_tokens": 26005078.0, "step": 10255 }, { "entropy": 6.291142082214355, "epoch": 1.1840738603577612, "grad_norm": 1.3359375, "learning_rate": 0.00048714868841786586, "loss": 6.1701, "mean_token_accuracy": 0.16087482869625092, "num_tokens": 26017227.0, "step": 10260 }, { "entropy": 6.382811117172241, "epoch": 1.1846508944027698, "grad_norm": 1.234375, "learning_rate": 0.00048713493870817626, "loss": 6.2511, "mean_token_accuracy": 0.16183987408876419, "num_tokens": 26030782.0, "step": 10265 }, { "entropy": 6.279626083374024, "epoch": 1.1852279284477785, "grad_norm": 1.2734375, "learning_rate": 0.00048712118186343336, "loss": 6.0983, "mean_token_accuracy": 0.1711464300751686, "num_tokens": 26042327.0, "step": 10270 }, { "entropy": 6.340450572967529, "epoch": 1.185804962492787, "grad_norm": 1.390625, "learning_rate": 0.00048710741788409985, "loss": 6.1993, "mean_token_accuracy": 0.15717075914144515, "num_tokens": 26055298.0, "step": 10275 }, { "entropy": 6.387430858612061, "epoch": 1.1863819965377957, "grad_norm": 1.3203125, "learning_rate": 0.0004870936467706387, "loss": 6.2193, "mean_token_accuracy": 0.15629870891571046, "num_tokens": 26067389.0, "step": 10280 }, { "entropy": 6.354550886154175, "epoch": 1.1869590305828044, "grad_norm": 1.1328125, "learning_rate": 0.0004870798685235131, "loss": 6.1647, "mean_token_accuracy": 0.1612406626343727, "num_tokens": 26080527.0, "step": 10285 }, { "entropy": 6.320342922210694, "epoch": 1.187536064627813, "grad_norm": 1.2578125, "learning_rate": 0.00048706608314318654, "loss": 6.2134, "mean_token_accuracy": 0.15583257228136063, "num_tokens": 26093684.0, "step": 10290 }, { "entropy": 6.312257146835327, "epoch": 1.1881130986728217, "grad_norm": 1.125, "learning_rate": 0.0004870522906301225, "loss": 6.1227, "mean_token_accuracy": 0.16510868221521377, "num_tokens": 26105235.0, "step": 10295 }, { "entropy": 6.306887769699097, "epoch": 1.1886901327178303, "grad_norm": 1.3984375, "learning_rate": 0.000487038490984785, "loss": 6.1452, "mean_token_accuracy": 0.1623164415359497, "num_tokens": 26117542.0, "step": 10300 }, { "entropy": 6.345963191986084, "epoch": 1.189267166762839, "grad_norm": 1.8125, "learning_rate": 0.00048702468420763826, "loss": 6.2605, "mean_token_accuracy": 0.15688117891550063, "num_tokens": 26130722.0, "step": 10305 }, { "entropy": 6.332888174057007, "epoch": 1.1898442008078476, "grad_norm": 1.515625, "learning_rate": 0.00048701087029914657, "loss": 6.0818, "mean_token_accuracy": 0.16274466514587402, "num_tokens": 26143420.0, "step": 10310 }, { "entropy": 6.385124921798706, "epoch": 1.1904212348528562, "grad_norm": 1.8359375, "learning_rate": 0.0004869970492597745, "loss": 6.2732, "mean_token_accuracy": 0.15256087481975555, "num_tokens": 26156041.0, "step": 10315 }, { "entropy": 6.275911903381347, "epoch": 1.1909982688978649, "grad_norm": 1.265625, "learning_rate": 0.0004869832210899871, "loss": 6.1044, "mean_token_accuracy": 0.16806990206241607, "num_tokens": 26168075.0, "step": 10320 }, { "entropy": 6.313507080078125, "epoch": 1.1915753029428737, "grad_norm": 1.1015625, "learning_rate": 0.00048696938579024927, "loss": 6.1054, "mean_token_accuracy": 0.1636284902691841, "num_tokens": 26180285.0, "step": 10325 }, { "entropy": 6.27633147239685, "epoch": 1.1921523369878824, "grad_norm": 1.171875, "learning_rate": 0.00048695554336102644, "loss": 6.121, "mean_token_accuracy": 0.16393174827098847, "num_tokens": 26193095.0, "step": 10330 }, { "entropy": 6.305689954757691, "epoch": 1.192729371032891, "grad_norm": 1.453125, "learning_rate": 0.00048694169380278417, "loss": 6.1467, "mean_token_accuracy": 0.16732767075300217, "num_tokens": 26205477.0, "step": 10335 }, { "entropy": 6.285434341430664, "epoch": 1.1933064050778996, "grad_norm": 1.2265625, "learning_rate": 0.0004869278371159884, "loss": 6.1043, "mean_token_accuracy": 0.17125446498394012, "num_tokens": 26220057.0, "step": 10340 }, { "entropy": 6.371880960464478, "epoch": 1.1938834391229083, "grad_norm": 1.296875, "learning_rate": 0.00048691397330110503, "loss": 6.1986, "mean_token_accuracy": 0.15532726496458055, "num_tokens": 26232327.0, "step": 10345 }, { "entropy": 6.229359245300293, "epoch": 1.194460473167917, "grad_norm": 1.34375, "learning_rate": 0.0004869001023586005, "loss": 6.1477, "mean_token_accuracy": 0.1645748496055603, "num_tokens": 26245087.0, "step": 10350 }, { "entropy": 6.387897205352783, "epoch": 1.1950375072129256, "grad_norm": 1.5546875, "learning_rate": 0.0004868862242889413, "loss": 6.2016, "mean_token_accuracy": 0.15893673598766328, "num_tokens": 26258041.0, "step": 10355 }, { "entropy": 6.408567094802857, "epoch": 1.1956145412579342, "grad_norm": 1.2890625, "learning_rate": 0.000486872339092594, "loss": 6.2046, "mean_token_accuracy": 0.15730382800102233, "num_tokens": 26270443.0, "step": 10360 }, { "entropy": 6.262932157516479, "epoch": 1.1961915753029428, "grad_norm": 1.375, "learning_rate": 0.000486858446770026, "loss": 6.1515, "mean_token_accuracy": 0.1608057364821434, "num_tokens": 26282685.0, "step": 10365 }, { "entropy": 6.319109964370727, "epoch": 1.1967686093479515, "grad_norm": 1.7578125, "learning_rate": 0.0004868445473217043, "loss": 6.2158, "mean_token_accuracy": 0.161103555560112, "num_tokens": 26296003.0, "step": 10370 }, { "entropy": 6.2928773880004885, "epoch": 1.1973456433929601, "grad_norm": 1.390625, "learning_rate": 0.0004868306407480965, "loss": 6.1029, "mean_token_accuracy": 0.16285141408443451, "num_tokens": 26309102.0, "step": 10375 }, { "entropy": 6.35385308265686, "epoch": 1.1979226774379688, "grad_norm": 1.6484375, "learning_rate": 0.00048681672704967036, "loss": 6.1494, "mean_token_accuracy": 0.164886237680912, "num_tokens": 26321571.0, "step": 10380 }, { "entropy": 6.421018648147583, "epoch": 1.1984997114829774, "grad_norm": 1.5390625, "learning_rate": 0.0004868028062268938, "loss": 6.2463, "mean_token_accuracy": 0.15964062064886092, "num_tokens": 26334761.0, "step": 10385 }, { "entropy": 6.310076951980591, "epoch": 1.1990767455279863, "grad_norm": 2.359375, "learning_rate": 0.00048678887828023504, "loss": 6.0642, "mean_token_accuracy": 0.1698111414909363, "num_tokens": 26348815.0, "step": 10390 }, { "entropy": 6.309312057495117, "epoch": 1.1996537795729947, "grad_norm": 1.15625, "learning_rate": 0.0004867749432101626, "loss": 6.1605, "mean_token_accuracy": 0.1607862025499344, "num_tokens": 26361675.0, "step": 10395 }, { "entropy": 6.306365489959717, "epoch": 1.2002308136180035, "grad_norm": 1.3046875, "learning_rate": 0.0004867610010171451, "loss": 6.2685, "mean_token_accuracy": 0.15660690665245056, "num_tokens": 26375010.0, "step": 10400 }, { "entropy": 6.455476760864258, "epoch": 1.2008078476630122, "grad_norm": 1.828125, "learning_rate": 0.00048674705170165147, "loss": 6.2228, "mean_token_accuracy": 0.16162673979997635, "num_tokens": 26388217.0, "step": 10405 }, { "entropy": 6.3156548023223875, "epoch": 1.2013848817080208, "grad_norm": 1.9375, "learning_rate": 0.000486733095264151, "loss": 6.1713, "mean_token_accuracy": 0.1644631251692772, "num_tokens": 26402088.0, "step": 10410 }, { "entropy": 6.300989246368408, "epoch": 1.2019619157530295, "grad_norm": 1.390625, "learning_rate": 0.00048671913170511306, "loss": 6.1699, "mean_token_accuracy": 0.16167462170124053, "num_tokens": 26414816.0, "step": 10415 }, { "entropy": 6.333500766754151, "epoch": 1.202538949798038, "grad_norm": 1.4765625, "learning_rate": 0.0004867051610250073, "loss": 6.1075, "mean_token_accuracy": 0.16527679413557053, "num_tokens": 26426345.0, "step": 10420 }, { "entropy": 6.232378339767456, "epoch": 1.2031159838430467, "grad_norm": 1.2421875, "learning_rate": 0.0004866911832243035, "loss": 5.9599, "mean_token_accuracy": 0.1687069922685623, "num_tokens": 26437982.0, "step": 10425 }, { "entropy": 6.195571947097778, "epoch": 1.2036930178880554, "grad_norm": 1.421875, "learning_rate": 0.00048667719830347203, "loss": 6.1396, "mean_token_accuracy": 0.15564415901899337, "num_tokens": 26449855.0, "step": 10430 }, { "entropy": 6.404849576950073, "epoch": 1.204270051933064, "grad_norm": 1.2265625, "learning_rate": 0.00048666320626298307, "loss": 6.1891, "mean_token_accuracy": 0.16427553296089173, "num_tokens": 26462927.0, "step": 10435 }, { "entropy": 6.369866466522216, "epoch": 1.2048470859780727, "grad_norm": 1.2890625, "learning_rate": 0.00048664920710330735, "loss": 6.1967, "mean_token_accuracy": 0.16102144569158555, "num_tokens": 26475022.0, "step": 10440 }, { "entropy": 6.272254943847656, "epoch": 1.2054241200230813, "grad_norm": 1.203125, "learning_rate": 0.00048663520082491564, "loss": 6.1338, "mean_token_accuracy": 0.1697706624865532, "num_tokens": 26486959.0, "step": 10445 }, { "entropy": 6.312459659576416, "epoch": 1.20600115406809, "grad_norm": 1.4765625, "learning_rate": 0.0004866211874282791, "loss": 6.2305, "mean_token_accuracy": 0.16129841059446334, "num_tokens": 26500345.0, "step": 10450 }, { "entropy": 6.3494813442230225, "epoch": 1.2065781881130986, "grad_norm": 1.6171875, "learning_rate": 0.000486607166913869, "loss": 6.2039, "mean_token_accuracy": 0.16385735422372819, "num_tokens": 26511625.0, "step": 10455 }, { "entropy": 6.3159326076507565, "epoch": 1.2071552221581072, "grad_norm": 1.46875, "learning_rate": 0.00048659313928215705, "loss": 6.1765, "mean_token_accuracy": 0.16436698138713837, "num_tokens": 26523764.0, "step": 10460 }, { "entropy": 6.311506223678589, "epoch": 1.207732256203116, "grad_norm": 1.6640625, "learning_rate": 0.0004865791045336149, "loss": 6.1735, "mean_token_accuracy": 0.1606744185090065, "num_tokens": 26536925.0, "step": 10465 }, { "entropy": 6.241578531265259, "epoch": 1.2083092902481247, "grad_norm": 1.8515625, "learning_rate": 0.0004865650626687146, "loss": 6.0318, "mean_token_accuracy": 0.17650363296270372, "num_tokens": 26549201.0, "step": 10470 }, { "entropy": 6.305879020690918, "epoch": 1.2088863242931334, "grad_norm": 1.34375, "learning_rate": 0.00048655101368792866, "loss": 6.158, "mean_token_accuracy": 0.16642459928989412, "num_tokens": 26561495.0, "step": 10475 }, { "entropy": 6.3534986019134525, "epoch": 1.209463358338142, "grad_norm": 1.3828125, "learning_rate": 0.0004865369575917293, "loss": 6.1958, "mean_token_accuracy": 0.15989347100257872, "num_tokens": 26573820.0, "step": 10480 }, { "entropy": 6.335755109786987, "epoch": 1.2100403923831506, "grad_norm": 1.40625, "learning_rate": 0.00048652289438058953, "loss": 6.1832, "mean_token_accuracy": 0.16023981124162673, "num_tokens": 26587468.0, "step": 10485 }, { "entropy": 6.260964012145996, "epoch": 1.2106174264281593, "grad_norm": 1.5703125, "learning_rate": 0.00048650882405498226, "loss": 6.2022, "mean_token_accuracy": 0.16167952865362167, "num_tokens": 26599884.0, "step": 10490 }, { "entropy": 6.255992984771728, "epoch": 1.211194460473168, "grad_norm": 1.53125, "learning_rate": 0.0004864947466153808, "loss": 6.1251, "mean_token_accuracy": 0.16567855775356294, "num_tokens": 26612501.0, "step": 10495 }, { "entropy": 6.383900165557861, "epoch": 1.2117714945181766, "grad_norm": 1.59375, "learning_rate": 0.0004864806620622585, "loss": 6.1492, "mean_token_accuracy": 0.17049698084592818, "num_tokens": 26624559.0, "step": 10500 }, { "entropy": 6.350470304489136, "epoch": 1.2123485285631852, "grad_norm": 1.4765625, "learning_rate": 0.0004864665703960892, "loss": 6.1593, "mean_token_accuracy": 0.1594645231962204, "num_tokens": 26636903.0, "step": 10505 }, { "entropy": 6.318430614471436, "epoch": 1.2129255626081938, "grad_norm": 1.3984375, "learning_rate": 0.0004864524716173469, "loss": 6.1214, "mean_token_accuracy": 0.16265250593423844, "num_tokens": 26649393.0, "step": 10510 }, { "entropy": 6.26350040435791, "epoch": 1.2135025966532025, "grad_norm": 1.5078125, "learning_rate": 0.0004864383657265058, "loss": 6.121, "mean_token_accuracy": 0.1690155252814293, "num_tokens": 26661134.0, "step": 10515 }, { "entropy": 6.280627727508545, "epoch": 1.2140796306982111, "grad_norm": 1.4921875, "learning_rate": 0.00048642425272404016, "loss": 6.2002, "mean_token_accuracy": 0.16160008162260056, "num_tokens": 26674451.0, "step": 10520 }, { "entropy": 6.328465127944947, "epoch": 1.2146566647432198, "grad_norm": 1.921875, "learning_rate": 0.0004864101326104248, "loss": 6.1461, "mean_token_accuracy": 0.1652497887611389, "num_tokens": 26686382.0, "step": 10525 }, { "entropy": 6.283163166046142, "epoch": 1.2152336987882286, "grad_norm": 1.359375, "learning_rate": 0.0004863960053861348, "loss": 6.1057, "mean_token_accuracy": 0.1680065721273422, "num_tokens": 26698491.0, "step": 10530 }, { "entropy": 6.267314338684082, "epoch": 1.215810732833237, "grad_norm": 1.703125, "learning_rate": 0.00048638187105164507, "loss": 6.1228, "mean_token_accuracy": 0.16545756608247758, "num_tokens": 26710836.0, "step": 10535 }, { "entropy": 6.323285484313965, "epoch": 1.216387766878246, "grad_norm": 1.8828125, "learning_rate": 0.0004863677296074311, "loss": 6.1311, "mean_token_accuracy": 0.16326241195201874, "num_tokens": 26723195.0, "step": 10540 }, { "entropy": 6.319986152648926, "epoch": 1.2169648009232545, "grad_norm": 1.546875, "learning_rate": 0.0004863535810539686, "loss": 6.1515, "mean_token_accuracy": 0.17019888758659363, "num_tokens": 26736048.0, "step": 10545 }, { "entropy": 6.2805334568023685, "epoch": 1.2175418349682632, "grad_norm": 1.671875, "learning_rate": 0.00048633942539173325, "loss": 6.2238, "mean_token_accuracy": 0.1601146176457405, "num_tokens": 26748712.0, "step": 10550 }, { "entropy": 6.339949321746826, "epoch": 1.2181188690132718, "grad_norm": 1.4453125, "learning_rate": 0.00048632526262120144, "loss": 6.2048, "mean_token_accuracy": 0.15875715762376785, "num_tokens": 26760546.0, "step": 10555 }, { "entropy": 6.344151830673217, "epoch": 1.2186959030582805, "grad_norm": 1.3671875, "learning_rate": 0.0004863110927428493, "loss": 6.108, "mean_token_accuracy": 0.16397978961467743, "num_tokens": 26772792.0, "step": 10560 }, { "entropy": 6.23669023513794, "epoch": 1.219272937103289, "grad_norm": 2.0625, "learning_rate": 0.0004862969157571536, "loss": 6.0775, "mean_token_accuracy": 0.16881214827299118, "num_tokens": 26785321.0, "step": 10565 }, { "entropy": 6.264487791061401, "epoch": 1.2198499711482977, "grad_norm": 1.4375, "learning_rate": 0.00048628273166459105, "loss": 6.0608, "mean_token_accuracy": 0.165188530087471, "num_tokens": 26797481.0, "step": 10570 }, { "entropy": 6.337562322616577, "epoch": 1.2204270051933064, "grad_norm": 1.8671875, "learning_rate": 0.00048626854046563876, "loss": 6.2219, "mean_token_accuracy": 0.1599225729703903, "num_tokens": 26810644.0, "step": 10575 }, { "entropy": 6.375046730041504, "epoch": 1.221004039238315, "grad_norm": 1.3828125, "learning_rate": 0.00048625434216077404, "loss": 6.1245, "mean_token_accuracy": 0.16600160151720048, "num_tokens": 26822545.0, "step": 10580 }, { "entropy": 6.209045267105102, "epoch": 1.2215810732833237, "grad_norm": 1.8515625, "learning_rate": 0.00048624013675047453, "loss": 6.168, "mean_token_accuracy": 0.1631156712770462, "num_tokens": 26836221.0, "step": 10585 }, { "entropy": 6.313969373703003, "epoch": 1.2221581073283323, "grad_norm": 1.6875, "learning_rate": 0.00048622592423521783, "loss": 6.2109, "mean_token_accuracy": 0.1565389335155487, "num_tokens": 26848543.0, "step": 10590 }, { "entropy": 6.435025596618653, "epoch": 1.222735141373341, "grad_norm": 1.125, "learning_rate": 0.0004862117046154822, "loss": 6.177, "mean_token_accuracy": 0.16341440230607987, "num_tokens": 26859833.0, "step": 10595 }, { "entropy": 6.351103830337524, "epoch": 1.2233121754183496, "grad_norm": 1.953125, "learning_rate": 0.00048619747789174577, "loss": 6.1531, "mean_token_accuracy": 0.1668863445520401, "num_tokens": 26873450.0, "step": 10600 }, { "entropy": 6.2641448974609375, "epoch": 1.2238892094633584, "grad_norm": 1.3828125, "learning_rate": 0.0004861832440644871, "loss": 6.1458, "mean_token_accuracy": 0.1593625470995903, "num_tokens": 26886545.0, "step": 10605 }, { "entropy": 6.28742151260376, "epoch": 1.224466243508367, "grad_norm": 1.5, "learning_rate": 0.00048616900313418486, "loss": 6.0731, "mean_token_accuracy": 0.16876358091831206, "num_tokens": 26898394.0, "step": 10610 }, { "entropy": 6.3268989562988285, "epoch": 1.2250432775533757, "grad_norm": 1.6171875, "learning_rate": 0.00048615475510131815, "loss": 6.1404, "mean_token_accuracy": 0.16805960536003112, "num_tokens": 26910172.0, "step": 10615 }, { "entropy": 6.253440999984742, "epoch": 1.2256203115983844, "grad_norm": 2.046875, "learning_rate": 0.00048614049996636614, "loss": 6.0143, "mean_token_accuracy": 0.17637682110071182, "num_tokens": 26922496.0, "step": 10620 }, { "entropy": 6.295119285583496, "epoch": 1.226197345643393, "grad_norm": 1.65625, "learning_rate": 0.00048612623772980825, "loss": 6.0815, "mean_token_accuracy": 0.17071359008550643, "num_tokens": 26935264.0, "step": 10625 }, { "entropy": 6.306150913238525, "epoch": 1.2267743796884016, "grad_norm": 1.5078125, "learning_rate": 0.00048611196839212426, "loss": 6.0947, "mean_token_accuracy": 0.1753847971558571, "num_tokens": 26949006.0, "step": 10630 }, { "entropy": 6.194625997543335, "epoch": 1.2273514137334103, "grad_norm": 1.3046875, "learning_rate": 0.000486097691953794, "loss": 6.0233, "mean_token_accuracy": 0.16946956366300583, "num_tokens": 26961305.0, "step": 10635 }, { "entropy": 6.303498363494873, "epoch": 1.227928447778419, "grad_norm": 1.328125, "learning_rate": 0.00048608340841529784, "loss": 6.1697, "mean_token_accuracy": 0.16096686720848083, "num_tokens": 26973445.0, "step": 10640 }, { "entropy": 6.2427514553070065, "epoch": 1.2285054818234276, "grad_norm": 1.4375, "learning_rate": 0.000486069117777116, "loss": 6.1154, "mean_token_accuracy": 0.16666444391012192, "num_tokens": 26986286.0, "step": 10645 }, { "entropy": 6.36623592376709, "epoch": 1.2290825158684362, "grad_norm": 1.5625, "learning_rate": 0.0004860548200397293, "loss": 6.1561, "mean_token_accuracy": 0.16069630533456802, "num_tokens": 26999281.0, "step": 10650 }, { "entropy": 6.38177375793457, "epoch": 1.2296595499134448, "grad_norm": 1.296875, "learning_rate": 0.00048604051520361846, "loss": 6.2931, "mean_token_accuracy": 0.15522295832633973, "num_tokens": 27011916.0, "step": 10655 }, { "entropy": 6.38488450050354, "epoch": 1.2302365839584535, "grad_norm": 1.421875, "learning_rate": 0.00048602620326926484, "loss": 6.1754, "mean_token_accuracy": 0.1675037696957588, "num_tokens": 27024442.0, "step": 10660 }, { "entropy": 6.414252138137817, "epoch": 1.2308136180034621, "grad_norm": 1.3984375, "learning_rate": 0.00048601188423714965, "loss": 6.2689, "mean_token_accuracy": 0.15624295622110368, "num_tokens": 27037978.0, "step": 10665 }, { "entropy": 6.334872579574585, "epoch": 1.231390652048471, "grad_norm": 1.4375, "learning_rate": 0.0004859975581077545, "loss": 6.2598, "mean_token_accuracy": 0.15260412395000458, "num_tokens": 27049447.0, "step": 10670 }, { "entropy": 6.296382093429566, "epoch": 1.2319676860934794, "grad_norm": 1.3984375, "learning_rate": 0.0004859832248815614, "loss": 6.1431, "mean_token_accuracy": 0.17176230102777482, "num_tokens": 27062961.0, "step": 10675 }, { "entropy": 6.392310857772827, "epoch": 1.2325447201384883, "grad_norm": 1.3125, "learning_rate": 0.0004859688845590522, "loss": 6.2079, "mean_token_accuracy": 0.16266993284225464, "num_tokens": 27076297.0, "step": 10680 }, { "entropy": 6.316580009460449, "epoch": 1.233121754183497, "grad_norm": 1.2578125, "learning_rate": 0.00048595453714070944, "loss": 6.2308, "mean_token_accuracy": 0.15837038457393646, "num_tokens": 27088496.0, "step": 10685 }, { "entropy": 6.401510953903198, "epoch": 1.2336987882285055, "grad_norm": 1.546875, "learning_rate": 0.0004859401826270156, "loss": 6.2055, "mean_token_accuracy": 0.15987962186336518, "num_tokens": 27100695.0, "step": 10690 }, { "entropy": 6.322301721572876, "epoch": 1.2342758222735142, "grad_norm": 1.515625, "learning_rate": 0.0004859258210184536, "loss": 6.208, "mean_token_accuracy": 0.16477376520633696, "num_tokens": 27113703.0, "step": 10695 }, { "entropy": 6.351233863830567, "epoch": 1.2348528563185228, "grad_norm": 1.2265625, "learning_rate": 0.00048591145231550623, "loss": 6.2269, "mean_token_accuracy": 0.15568701475858687, "num_tokens": 27128669.0, "step": 10700 }, { "entropy": 6.387229156494141, "epoch": 1.2354298903635315, "grad_norm": 1.4140625, "learning_rate": 0.00048589707651865697, "loss": 6.1804, "mean_token_accuracy": 0.16083226203918458, "num_tokens": 27141311.0, "step": 10705 }, { "entropy": 6.387057733535767, "epoch": 1.23600692440854, "grad_norm": 1.5859375, "learning_rate": 0.0004858826936283893, "loss": 6.1847, "mean_token_accuracy": 0.16173309981822967, "num_tokens": 27152935.0, "step": 10710 }, { "entropy": 6.302968740463257, "epoch": 1.2365839584535487, "grad_norm": 1.75, "learning_rate": 0.000485868303645187, "loss": 6.0807, "mean_token_accuracy": 0.16808868646621705, "num_tokens": 27166775.0, "step": 10715 }, { "entropy": 6.193493843078613, "epoch": 1.2371609924985574, "grad_norm": 1.59375, "learning_rate": 0.00048585390656953397, "loss": 6.1429, "mean_token_accuracy": 0.16636423021554947, "num_tokens": 27179406.0, "step": 10720 }, { "entropy": 6.3158278465271, "epoch": 1.237738026543566, "grad_norm": 1.7734375, "learning_rate": 0.0004858395024019147, "loss": 6.1274, "mean_token_accuracy": 0.1683789536356926, "num_tokens": 27191562.0, "step": 10725 }, { "entropy": 6.365101718902588, "epoch": 1.2383150605885747, "grad_norm": 1.265625, "learning_rate": 0.0004858250911428133, "loss": 6.1614, "mean_token_accuracy": 0.16290413737297058, "num_tokens": 27203827.0, "step": 10730 }, { "entropy": 6.311492300033569, "epoch": 1.2388920946335833, "grad_norm": 1.421875, "learning_rate": 0.0004858106727927148, "loss": 6.1333, "mean_token_accuracy": 0.16150906234979628, "num_tokens": 27217645.0, "step": 10735 }, { "entropy": 6.31927604675293, "epoch": 1.239469128678592, "grad_norm": 1.3046875, "learning_rate": 0.000485796247352104, "loss": 6.1873, "mean_token_accuracy": 0.1700813129544258, "num_tokens": 27230794.0, "step": 10740 }, { "entropy": 6.310563325881958, "epoch": 1.2400461627236008, "grad_norm": 1.4765625, "learning_rate": 0.0004857818148214662, "loss": 6.2377, "mean_token_accuracy": 0.15220990478992463, "num_tokens": 27243965.0, "step": 10745 }, { "entropy": 6.406279706954956, "epoch": 1.2406231967686094, "grad_norm": 1.453125, "learning_rate": 0.0004857673752012866, "loss": 6.1923, "mean_token_accuracy": 0.16095540374517442, "num_tokens": 27256951.0, "step": 10750 }, { "entropy": 6.376666307449341, "epoch": 1.241200230813618, "grad_norm": 1.5234375, "learning_rate": 0.00048575292849205114, "loss": 6.2496, "mean_token_accuracy": 0.1572696790099144, "num_tokens": 27268556.0, "step": 10755 }, { "entropy": 6.281139230728149, "epoch": 1.2417772648586267, "grad_norm": 1.4296875, "learning_rate": 0.0004857384746942456, "loss": 6.0908, "mean_token_accuracy": 0.15756804049015044, "num_tokens": 27280367.0, "step": 10760 }, { "entropy": 6.36142110824585, "epoch": 1.2423542989036354, "grad_norm": 1.625, "learning_rate": 0.0004857240138083562, "loss": 6.1589, "mean_token_accuracy": 0.17009591162204743, "num_tokens": 27293727.0, "step": 10765 }, { "entropy": 6.4208721160888675, "epoch": 1.242931332948644, "grad_norm": 1.375, "learning_rate": 0.0004857095458348692, "loss": 6.206, "mean_token_accuracy": 0.16630731970071794, "num_tokens": 27306677.0, "step": 10770 }, { "entropy": 6.421437358856201, "epoch": 1.2435083669936526, "grad_norm": 1.21875, "learning_rate": 0.00048569507077427134, "loss": 6.1739, "mean_token_accuracy": 0.16194156408309937, "num_tokens": 27319317.0, "step": 10775 }, { "entropy": 6.349999570846558, "epoch": 1.2440854010386613, "grad_norm": 1.5546875, "learning_rate": 0.0004856805886270494, "loss": 6.154, "mean_token_accuracy": 0.1680565133690834, "num_tokens": 27332021.0, "step": 10780 }, { "entropy": 6.234192276000977, "epoch": 1.24466243508367, "grad_norm": 1.375, "learning_rate": 0.0004856660993936905, "loss": 6.0452, "mean_token_accuracy": 0.17493621557950972, "num_tokens": 27343972.0, "step": 10785 }, { "entropy": 6.339166927337646, "epoch": 1.2452394691286786, "grad_norm": 1.375, "learning_rate": 0.000485651603074682, "loss": 6.2345, "mean_token_accuracy": 0.15476678535342217, "num_tokens": 27356712.0, "step": 10790 }, { "entropy": 6.254733991622925, "epoch": 1.2458165031736872, "grad_norm": 1.390625, "learning_rate": 0.0004856370996705115, "loss": 6.1038, "mean_token_accuracy": 0.16964900642633438, "num_tokens": 27369028.0, "step": 10795 }, { "entropy": 6.296901226043701, "epoch": 1.2463935372186958, "grad_norm": 1.3359375, "learning_rate": 0.0004856225891816667, "loss": 6.1239, "mean_token_accuracy": 0.1664896309375763, "num_tokens": 27380789.0, "step": 10800 }, { "entropy": 6.33326268196106, "epoch": 1.2469705712637045, "grad_norm": 1.5234375, "learning_rate": 0.0004856080716086358, "loss": 6.0895, "mean_token_accuracy": 0.1629282146692276, "num_tokens": 27394098.0, "step": 10805 }, { "entropy": 6.316369342803955, "epoch": 1.2475476053087133, "grad_norm": 1.1875, "learning_rate": 0.000485593546951907, "loss": 6.187, "mean_token_accuracy": 0.16884668171405792, "num_tokens": 27407270.0, "step": 10810 }, { "entropy": 6.313498497009277, "epoch": 1.2481246393537218, "grad_norm": 1.4296875, "learning_rate": 0.0004855790152119688, "loss": 6.1572, "mean_token_accuracy": 0.16334105879068375, "num_tokens": 27420397.0, "step": 10815 }, { "entropy": 6.3574518203735355, "epoch": 1.2487016733987306, "grad_norm": 1.5546875, "learning_rate": 0.0004855644763893102, "loss": 6.1963, "mean_token_accuracy": 0.16616567373275756, "num_tokens": 27433007.0, "step": 10820 }, { "entropy": 6.296497392654419, "epoch": 1.2492787074437393, "grad_norm": 1.265625, "learning_rate": 0.00048554993048441987, "loss": 6.177, "mean_token_accuracy": 0.15731592178344728, "num_tokens": 27446683.0, "step": 10825 }, { "entropy": 6.3187668800354, "epoch": 1.249855741488748, "grad_norm": 1.1796875, "learning_rate": 0.0004855353774977873, "loss": 6.1995, "mean_token_accuracy": 0.15644395351409912, "num_tokens": 27459298.0, "step": 10830 }, { "entropy": 6.342638778686523, "epoch": 1.2504327755337565, "grad_norm": 1.390625, "learning_rate": 0.00048552081742990184, "loss": 6.1643, "mean_token_accuracy": 0.1627936080098152, "num_tokens": 27472287.0, "step": 10835 }, { "entropy": 6.380952024459839, "epoch": 1.2510098095787652, "grad_norm": 1.59375, "learning_rate": 0.00048550625028125327, "loss": 6.1657, "mean_token_accuracy": 0.16333349347114562, "num_tokens": 27484808.0, "step": 10840 }, { "entropy": 6.348484134674072, "epoch": 1.2515868436237738, "grad_norm": 1.4609375, "learning_rate": 0.0004854916760523315, "loss": 6.1697, "mean_token_accuracy": 0.16139520555734635, "num_tokens": 27496980.0, "step": 10845 }, { "entropy": 6.282923889160156, "epoch": 1.2521638776687825, "grad_norm": 1.53125, "learning_rate": 0.00048547709474362684, "loss": 6.1984, "mean_token_accuracy": 0.15698642879724503, "num_tokens": 27509969.0, "step": 10850 }, { "entropy": 6.34557409286499, "epoch": 1.252740911713791, "grad_norm": 1.4765625, "learning_rate": 0.0004854625063556296, "loss": 6.1609, "mean_token_accuracy": 0.16385020911693574, "num_tokens": 27523410.0, "step": 10855 }, { "entropy": 6.387068557739258, "epoch": 1.2533179457587997, "grad_norm": 1.46875, "learning_rate": 0.0004854479108888305, "loss": 6.1361, "mean_token_accuracy": 0.1640760526061058, "num_tokens": 27535183.0, "step": 10860 }, { "entropy": 6.349454069137574, "epoch": 1.2538949798038084, "grad_norm": 1.3671875, "learning_rate": 0.00048543330834372047, "loss": 6.2117, "mean_token_accuracy": 0.1553926631808281, "num_tokens": 27548028.0, "step": 10865 }, { "entropy": 6.322198343276978, "epoch": 1.254472013848817, "grad_norm": 1.5546875, "learning_rate": 0.00048541869872079064, "loss": 6.1347, "mean_token_accuracy": 0.16066425293684006, "num_tokens": 27561302.0, "step": 10870 }, { "entropy": 6.269003582000733, "epoch": 1.2550490478938257, "grad_norm": 1.65625, "learning_rate": 0.0004854040820205324, "loss": 6.042, "mean_token_accuracy": 0.1691621169447899, "num_tokens": 27572933.0, "step": 10875 }, { "entropy": 6.346168088912964, "epoch": 1.2556260819388343, "grad_norm": 1.296875, "learning_rate": 0.0004853894582434373, "loss": 6.2337, "mean_token_accuracy": 0.1564677447080612, "num_tokens": 27586373.0, "step": 10880 }, { "entropy": 6.346892642974853, "epoch": 1.2562031159838432, "grad_norm": 1.828125, "learning_rate": 0.0004853748273899974, "loss": 6.0814, "mean_token_accuracy": 0.1748109444975853, "num_tokens": 27599236.0, "step": 10885 }, { "entropy": 6.302681541442871, "epoch": 1.2567801500288516, "grad_norm": 1.390625, "learning_rate": 0.0004853601894607046, "loss": 6.0979, "mean_token_accuracy": 0.16508190482854843, "num_tokens": 27611904.0, "step": 10890 }, { "entropy": 6.214655542373658, "epoch": 1.2573571840738604, "grad_norm": 2.84375, "learning_rate": 0.0004853455444560514, "loss": 6.056, "mean_token_accuracy": 0.16355132162570954, "num_tokens": 27625778.0, "step": 10895 }, { "entropy": 6.32364501953125, "epoch": 1.257934218118869, "grad_norm": 3.515625, "learning_rate": 0.0004853308923765302, "loss": 6.1785, "mean_token_accuracy": 0.17193194329738617, "num_tokens": 27638359.0, "step": 10900 }, { "entropy": 6.329800653457641, "epoch": 1.2585112521638777, "grad_norm": 1.2578125, "learning_rate": 0.000485316233222634, "loss": 6.1046, "mean_token_accuracy": 0.16803177893161775, "num_tokens": 27651107.0, "step": 10905 }, { "entropy": 6.320554113388061, "epoch": 1.2590882862088864, "grad_norm": 1.4453125, "learning_rate": 0.0004853015669948557, "loss": 6.2178, "mean_token_accuracy": 0.16287010610103608, "num_tokens": 27664060.0, "step": 10910 }, { "entropy": 6.312152290344239, "epoch": 1.259665320253895, "grad_norm": 1.4296875, "learning_rate": 0.00048528689369368863, "loss": 6.1404, "mean_token_accuracy": 0.16302927285432817, "num_tokens": 27676678.0, "step": 10915 }, { "entropy": 6.390170764923096, "epoch": 1.2602423542989036, "grad_norm": 1.6171875, "learning_rate": 0.0004852722133196264, "loss": 6.2006, "mean_token_accuracy": 0.15728381127119065, "num_tokens": 27689696.0, "step": 10920 }, { "entropy": 6.302979755401611, "epoch": 1.2608193883439123, "grad_norm": 1.359375, "learning_rate": 0.0004852575258731627, "loss": 6.0878, "mean_token_accuracy": 0.16694856733083724, "num_tokens": 27702144.0, "step": 10925 }, { "entropy": 6.359341430664062, "epoch": 1.261396422388921, "grad_norm": 1.625, "learning_rate": 0.0004852428313547916, "loss": 6.2068, "mean_token_accuracy": 0.1572053074836731, "num_tokens": 27714618.0, "step": 10930 }, { "entropy": 6.324438142776489, "epoch": 1.2619734564339296, "grad_norm": 2.03125, "learning_rate": 0.00048522812976500726, "loss": 6.1403, "mean_token_accuracy": 0.16266688853502273, "num_tokens": 27727002.0, "step": 10935 }, { "entropy": 6.310562229156494, "epoch": 1.2625504904789382, "grad_norm": 1.265625, "learning_rate": 0.00048521342110430417, "loss": 6.2034, "mean_token_accuracy": 0.1592251852154732, "num_tokens": 27739506.0, "step": 10940 }, { "entropy": 6.297001934051513, "epoch": 1.2631275245239468, "grad_norm": 1.734375, "learning_rate": 0.00048519870537317713, "loss": 6.0444, "mean_token_accuracy": 0.16531992256641387, "num_tokens": 27751959.0, "step": 10945 }, { "entropy": 6.2629921436309814, "epoch": 1.2637045585689557, "grad_norm": 1.578125, "learning_rate": 0.00048518398257212103, "loss": 6.0776, "mean_token_accuracy": 0.16900534927845, "num_tokens": 27762938.0, "step": 10950 }, { "entropy": 6.365654325485229, "epoch": 1.2642815926139641, "grad_norm": 1.3515625, "learning_rate": 0.0004851692527016311, "loss": 6.2081, "mean_token_accuracy": 0.15454971194267272, "num_tokens": 27776288.0, "step": 10955 }, { "entropy": 6.331540727615357, "epoch": 1.264858626658973, "grad_norm": 1.3125, "learning_rate": 0.0004851545157622027, "loss": 6.2372, "mean_token_accuracy": 0.15178136229515077, "num_tokens": 27788311.0, "step": 10960 }, { "entropy": 6.3813409328460695, "epoch": 1.2654356607039816, "grad_norm": 1.5234375, "learning_rate": 0.0004851397717543316, "loss": 6.1609, "mean_token_accuracy": 0.15812337547540664, "num_tokens": 27799589.0, "step": 10965 }, { "entropy": 6.274319410324097, "epoch": 1.2660126947489903, "grad_norm": 1.2578125, "learning_rate": 0.0004851250206785137, "loss": 6.0588, "mean_token_accuracy": 0.1667439490556717, "num_tokens": 27813057.0, "step": 10970 }, { "entropy": 6.277303171157837, "epoch": 1.266589728793999, "grad_norm": 1.3203125, "learning_rate": 0.00048511026253524503, "loss": 6.1465, "mean_token_accuracy": 0.16044363081455232, "num_tokens": 27826465.0, "step": 10975 }, { "entropy": 6.309837818145752, "epoch": 1.2671667628390075, "grad_norm": 1.265625, "learning_rate": 0.0004850954973250221, "loss": 6.1432, "mean_token_accuracy": 0.16380210518836974, "num_tokens": 27837157.0, "step": 10980 }, { "entropy": 6.386126470565796, "epoch": 1.2677437968840162, "grad_norm": 2.03125, "learning_rate": 0.00048508072504834144, "loss": 6.2431, "mean_token_accuracy": 0.16418514400720596, "num_tokens": 27850101.0, "step": 10985 }, { "entropy": 6.272424221038818, "epoch": 1.2683208309290248, "grad_norm": 1.2109375, "learning_rate": 0.00048506594570569997, "loss": 6.1588, "mean_token_accuracy": 0.16430216729640962, "num_tokens": 27862786.0, "step": 10990 }, { "entropy": 6.425026226043701, "epoch": 1.2688978649740335, "grad_norm": 1.3515625, "learning_rate": 0.0004850511592975947, "loss": 6.1663, "mean_token_accuracy": 0.16461049318313598, "num_tokens": 27875196.0, "step": 10995 }, { "entropy": 6.349469900131226, "epoch": 1.269474899019042, "grad_norm": 1.296875, "learning_rate": 0.0004850363658245231, "loss": 6.2633, "mean_token_accuracy": 0.1542629912495613, "num_tokens": 27888348.0, "step": 11000 }, { "entropy": 6.35367865562439, "epoch": 1.2700519330640507, "grad_norm": 1.3203125, "learning_rate": 0.0004850215652869826, "loss": 6.1909, "mean_token_accuracy": 0.16688053011894227, "num_tokens": 27901301.0, "step": 11005 }, { "entropy": 6.3888359546661375, "epoch": 1.2706289671090594, "grad_norm": 1.2578125, "learning_rate": 0.0004850067576854711, "loss": 6.2115, "mean_token_accuracy": 0.15654693841934203, "num_tokens": 27915665.0, "step": 11010 }, { "entropy": 6.297394275665283, "epoch": 1.271206001154068, "grad_norm": 1.3359375, "learning_rate": 0.0004849919430204867, "loss": 6.1552, "mean_token_accuracy": 0.16020799279212952, "num_tokens": 27928333.0, "step": 11015 }, { "entropy": 6.3494425296783445, "epoch": 1.2717830351990767, "grad_norm": 1.46875, "learning_rate": 0.0004849771212925275, "loss": 6.0888, "mean_token_accuracy": 0.16375294476747512, "num_tokens": 27940429.0, "step": 11020 }, { "entropy": 6.313184547424316, "epoch": 1.2723600692440855, "grad_norm": 1.8203125, "learning_rate": 0.00048496229250209223, "loss": 6.2169, "mean_token_accuracy": 0.1601503983139992, "num_tokens": 27953846.0, "step": 11025 }, { "entropy": 6.332328128814697, "epoch": 1.272937103289094, "grad_norm": 1.1328125, "learning_rate": 0.0004849474566496795, "loss": 6.0899, "mean_token_accuracy": 0.16779401600360871, "num_tokens": 27966393.0, "step": 11030 }, { "entropy": 6.264288711547851, "epoch": 1.2735141373341028, "grad_norm": 1.265625, "learning_rate": 0.0004849326137357883, "loss": 6.0361, "mean_token_accuracy": 0.1776391953229904, "num_tokens": 27979928.0, "step": 11035 }, { "entropy": 6.353927135467529, "epoch": 1.2740911713791114, "grad_norm": 1.359375, "learning_rate": 0.000484917763760918, "loss": 6.1312, "mean_token_accuracy": 0.16302897185087203, "num_tokens": 27991450.0, "step": 11040 }, { "entropy": 6.341830396652222, "epoch": 1.27466820542412, "grad_norm": 1.1640625, "learning_rate": 0.00048490290672556784, "loss": 6.1625, "mean_token_accuracy": 0.16186770498752595, "num_tokens": 28003696.0, "step": 11045 }, { "entropy": 6.251212215423584, "epoch": 1.2752452394691287, "grad_norm": 1.2421875, "learning_rate": 0.0004848880426302378, "loss": 6.1039, "mean_token_accuracy": 0.167728927731514, "num_tokens": 28015886.0, "step": 11050 }, { "entropy": 6.331211757659912, "epoch": 1.2758222735141374, "grad_norm": 1.59375, "learning_rate": 0.0004848731714754277, "loss": 6.1559, "mean_token_accuracy": 0.16511764675378798, "num_tokens": 28029552.0, "step": 11055 }, { "entropy": 6.295982503890992, "epoch": 1.276399307559146, "grad_norm": 1.296875, "learning_rate": 0.0004848582932616377, "loss": 6.2124, "mean_token_accuracy": 0.16154432594776152, "num_tokens": 28042275.0, "step": 11060 }, { "entropy": 6.2871945858001705, "epoch": 1.2769763416041546, "grad_norm": 1.546875, "learning_rate": 0.0004848434079893682, "loss": 6.101, "mean_token_accuracy": 0.17026014775037765, "num_tokens": 28054840.0, "step": 11065 }, { "entropy": 6.31745138168335, "epoch": 1.2775533756491633, "grad_norm": 1.8984375, "learning_rate": 0.0004848285156591201, "loss": 6.2333, "mean_token_accuracy": 0.1593561977148056, "num_tokens": 28068052.0, "step": 11070 }, { "entropy": 6.420611810684204, "epoch": 1.278130409694172, "grad_norm": 1.28125, "learning_rate": 0.00048481361627139384, "loss": 6.2162, "mean_token_accuracy": 0.15895957499742508, "num_tokens": 28081157.0, "step": 11075 }, { "entropy": 6.396226978302002, "epoch": 1.2787074437391805, "grad_norm": 1.6171875, "learning_rate": 0.00048479870982669096, "loss": 6.257, "mean_token_accuracy": 0.16313387006521224, "num_tokens": 28093842.0, "step": 11080 }, { "entropy": 6.40015058517456, "epoch": 1.2792844777841892, "grad_norm": 1.375, "learning_rate": 0.00048478379632551266, "loss": 6.1188, "mean_token_accuracy": 0.17054009437561035, "num_tokens": 28107529.0, "step": 11085 }, { "entropy": 6.291486501693726, "epoch": 1.279861511829198, "grad_norm": 1.125, "learning_rate": 0.0004847688757683606, "loss": 6.2009, "mean_token_accuracy": 0.16051672995090485, "num_tokens": 28119650.0, "step": 11090 }, { "entropy": 6.270731353759766, "epoch": 1.2804385458742065, "grad_norm": 1.15625, "learning_rate": 0.0004847539481557366, "loss": 6.1499, "mean_token_accuracy": 0.17015368193387986, "num_tokens": 28131209.0, "step": 11095 }, { "entropy": 6.332563591003418, "epoch": 1.2810155799192153, "grad_norm": 1.2578125, "learning_rate": 0.00048473901348814277, "loss": 6.1685, "mean_token_accuracy": 0.1653625950217247, "num_tokens": 28143624.0, "step": 11100 }, { "entropy": 6.43041090965271, "epoch": 1.281592613964224, "grad_norm": 1.2421875, "learning_rate": 0.0004847240717660814, "loss": 6.1952, "mean_token_accuracy": 0.16168740540742874, "num_tokens": 28156752.0, "step": 11105 }, { "entropy": 6.225031948089599, "epoch": 1.2821696480092326, "grad_norm": 1.5234375, "learning_rate": 0.00048470912299005493, "loss": 6.0443, "mean_token_accuracy": 0.17290171086788178, "num_tokens": 28169288.0, "step": 11110 }, { "entropy": 6.259183263778686, "epoch": 1.2827466820542412, "grad_norm": 1.421875, "learning_rate": 0.00048469416716056635, "loss": 6.1553, "mean_token_accuracy": 0.16693965941667557, "num_tokens": 28181739.0, "step": 11115 }, { "entropy": 6.299275255203247, "epoch": 1.28332371609925, "grad_norm": 1.359375, "learning_rate": 0.0004846792042781187, "loss": 6.1047, "mean_token_accuracy": 0.16790862381458282, "num_tokens": 28193861.0, "step": 11120 }, { "entropy": 6.28367805480957, "epoch": 1.2839007501442585, "grad_norm": 1.3359375, "learning_rate": 0.00048466423434321513, "loss": 6.03, "mean_token_accuracy": 0.1750580132007599, "num_tokens": 28205453.0, "step": 11125 }, { "entropy": 6.2496013164520265, "epoch": 1.2844777841892672, "grad_norm": 1.4375, "learning_rate": 0.00048464925735635907, "loss": 6.1232, "mean_token_accuracy": 0.16223495900630952, "num_tokens": 28217554.0, "step": 11130 }, { "entropy": 6.396459007263184, "epoch": 1.2850548182342758, "grad_norm": 1.265625, "learning_rate": 0.00048463427331805445, "loss": 6.2473, "mean_token_accuracy": 0.158101187646389, "num_tokens": 28230091.0, "step": 11135 }, { "entropy": 6.279246997833252, "epoch": 1.2856318522792844, "grad_norm": 1.34375, "learning_rate": 0.0004846192822288052, "loss": 6.1181, "mean_token_accuracy": 0.16716209203004836, "num_tokens": 28243285.0, "step": 11140 }, { "entropy": 6.256467676162719, "epoch": 1.286208886324293, "grad_norm": 1.25, "learning_rate": 0.0004846042840891155, "loss": 6.0446, "mean_token_accuracy": 0.17056648582220077, "num_tokens": 28256210.0, "step": 11145 }, { "entropy": 6.294454431533813, "epoch": 1.2867859203693017, "grad_norm": 1.875, "learning_rate": 0.0004845892788994899, "loss": 6.0873, "mean_token_accuracy": 0.1733658105134964, "num_tokens": 28268291.0, "step": 11150 }, { "entropy": 6.206016921997071, "epoch": 1.2873629544143104, "grad_norm": 1.25, "learning_rate": 0.0004845742666604329, "loss": 6.0748, "mean_token_accuracy": 0.17029971033334732, "num_tokens": 28281462.0, "step": 11155 }, { "entropy": 6.264611148834229, "epoch": 1.287939988459319, "grad_norm": 1.1484375, "learning_rate": 0.00048455924737244953, "loss": 6.2065, "mean_token_accuracy": 0.1581377938389778, "num_tokens": 28292766.0, "step": 11160 }, { "entropy": 6.273323631286621, "epoch": 1.2885170225043279, "grad_norm": 1.6875, "learning_rate": 0.00048454422103604505, "loss": 6.093, "mean_token_accuracy": 0.17237376421689987, "num_tokens": 28304500.0, "step": 11165 }, { "entropy": 6.362926387786866, "epoch": 1.2890940565493363, "grad_norm": 1.9921875, "learning_rate": 0.0004845291876517247, "loss": 6.1684, "mean_token_accuracy": 0.16565798670053483, "num_tokens": 28317262.0, "step": 11170 }, { "entropy": 6.215715932846069, "epoch": 1.2896710905943451, "grad_norm": 1.28125, "learning_rate": 0.00048451414721999424, "loss": 6.0599, "mean_token_accuracy": 0.17366328686475754, "num_tokens": 28330313.0, "step": 11175 }, { "entropy": 6.207749509811402, "epoch": 1.2902481246393538, "grad_norm": 1.3828125, "learning_rate": 0.00048449909974135954, "loss": 6.0742, "mean_token_accuracy": 0.16498281359672545, "num_tokens": 28344058.0, "step": 11180 }, { "entropy": 6.276063632965088, "epoch": 1.2908251586843624, "grad_norm": 1.234375, "learning_rate": 0.0004844840452163267, "loss": 6.1343, "mean_token_accuracy": 0.1621875062584877, "num_tokens": 28356664.0, "step": 11185 }, { "entropy": 6.368418121337891, "epoch": 1.291402192729371, "grad_norm": 1.2421875, "learning_rate": 0.000484468983645402, "loss": 6.1943, "mean_token_accuracy": 0.1614609658718109, "num_tokens": 28369040.0, "step": 11190 }, { "entropy": 6.265853071212769, "epoch": 1.2919792267743797, "grad_norm": 1.09375, "learning_rate": 0.00048445391502909213, "loss": 6.159, "mean_token_accuracy": 0.15824418812990187, "num_tokens": 28381788.0, "step": 11195 }, { "entropy": 6.321166610717773, "epoch": 1.2925562608193883, "grad_norm": 1.640625, "learning_rate": 0.00048443883936790386, "loss": 6.1928, "mean_token_accuracy": 0.16284841299057007, "num_tokens": 28394531.0, "step": 11200 }, { "entropy": 6.334868097305298, "epoch": 1.293133294864397, "grad_norm": 1.859375, "learning_rate": 0.00048442375666234427, "loss": 6.1199, "mean_token_accuracy": 0.16238492727279663, "num_tokens": 28407766.0, "step": 11205 }, { "entropy": 6.2941638946533205, "epoch": 1.2937103289094056, "grad_norm": 1.140625, "learning_rate": 0.0004844086669129206, "loss": 6.1924, "mean_token_accuracy": 0.16062195599079132, "num_tokens": 28420185.0, "step": 11210 }, { "entropy": 6.388847303390503, "epoch": 1.2942873629544143, "grad_norm": 1.3203125, "learning_rate": 0.00048439357012014045, "loss": 6.1364, "mean_token_accuracy": 0.16039270013570786, "num_tokens": 28432781.0, "step": 11215 }, { "entropy": 6.268585920333862, "epoch": 1.294864396999423, "grad_norm": 1.203125, "learning_rate": 0.0004843784662845116, "loss": 6.1237, "mean_token_accuracy": 0.16846691071987152, "num_tokens": 28446181.0, "step": 11220 }, { "entropy": 6.288886260986328, "epoch": 1.2954414310444315, "grad_norm": 1.1640625, "learning_rate": 0.000484363355406542, "loss": 6.0599, "mean_token_accuracy": 0.16910330504179, "num_tokens": 28457959.0, "step": 11225 }, { "entropy": 6.279118585586548, "epoch": 1.2960184650894404, "grad_norm": 1.34375, "learning_rate": 0.00048434823748674, "loss": 6.1589, "mean_token_accuracy": 0.16250982731580735, "num_tokens": 28470656.0, "step": 11230 }, { "entropy": 6.280978965759277, "epoch": 1.2965954991344488, "grad_norm": 1.328125, "learning_rate": 0.00048433311252561403, "loss": 6.181, "mean_token_accuracy": 0.1643814906477928, "num_tokens": 28483359.0, "step": 11235 }, { "entropy": 6.279931116104126, "epoch": 1.2971725331794577, "grad_norm": 1.53125, "learning_rate": 0.0004843179805236728, "loss": 6.1298, "mean_token_accuracy": 0.16412907987833023, "num_tokens": 28495984.0, "step": 11240 }, { "entropy": 6.2893836975097654, "epoch": 1.297749567224466, "grad_norm": 1.265625, "learning_rate": 0.00048430284148142516, "loss": 6.188, "mean_token_accuracy": 0.1599840596318245, "num_tokens": 28508629.0, "step": 11245 }, { "entropy": 6.3177934169769285, "epoch": 1.298326601269475, "grad_norm": 1.6953125, "learning_rate": 0.0004842876953993805, "loss": 6.2082, "mean_token_accuracy": 0.16367824673652648, "num_tokens": 28521952.0, "step": 11250 }, { "entropy": 6.315539360046387, "epoch": 1.2989036353144836, "grad_norm": 1.203125, "learning_rate": 0.0004842725422780482, "loss": 6.1008, "mean_token_accuracy": 0.1647193670272827, "num_tokens": 28535210.0, "step": 11255 }, { "entropy": 6.339979457855224, "epoch": 1.2994806693594922, "grad_norm": 1.34375, "learning_rate": 0.0004842573821179378, "loss": 6.216, "mean_token_accuracy": 0.15640299618244172, "num_tokens": 28547294.0, "step": 11260 }, { "entropy": 6.408569622039795, "epoch": 1.3000577034045009, "grad_norm": 1.7734375, "learning_rate": 0.0004842422149195593, "loss": 6.2359, "mean_token_accuracy": 0.15522149056196213, "num_tokens": 28558934.0, "step": 11265 }, { "entropy": 6.27472767829895, "epoch": 1.3006347374495095, "grad_norm": 1.8046875, "learning_rate": 0.00048422704068342294, "loss": 6.1151, "mean_token_accuracy": 0.15930722355842591, "num_tokens": 28571897.0, "step": 11270 }, { "entropy": 6.294620418548584, "epoch": 1.3012117714945182, "grad_norm": 1.171875, "learning_rate": 0.0004842118594100389, "loss": 6.155, "mean_token_accuracy": 0.16027718931436538, "num_tokens": 28584320.0, "step": 11275 }, { "entropy": 6.250262880325318, "epoch": 1.3017888055395268, "grad_norm": 1.21875, "learning_rate": 0.00048419667109991793, "loss": 6.0886, "mean_token_accuracy": 0.16860387623310089, "num_tokens": 28597018.0, "step": 11280 }, { "entropy": 6.248487567901611, "epoch": 1.3023658395845354, "grad_norm": 1.3203125, "learning_rate": 0.00048418147575357085, "loss": 6.0987, "mean_token_accuracy": 0.16950415819883347, "num_tokens": 28609145.0, "step": 11285 }, { "entropy": 6.32426905632019, "epoch": 1.302942873629544, "grad_norm": 1.3828125, "learning_rate": 0.0004841662733715087, "loss": 6.0984, "mean_token_accuracy": 0.16909146755933763, "num_tokens": 28622208.0, "step": 11290 }, { "entropy": 6.208732604980469, "epoch": 1.3035199076745527, "grad_norm": 1.6484375, "learning_rate": 0.00048415106395424294, "loss": 6.11, "mean_token_accuracy": 0.1594777375459671, "num_tokens": 28634719.0, "step": 11295 }, { "entropy": 6.29807767868042, "epoch": 1.3040969417195614, "grad_norm": 1.3671875, "learning_rate": 0.00048413584750228494, "loss": 6.164, "mean_token_accuracy": 0.1640383556485176, "num_tokens": 28647138.0, "step": 11300 }, { "entropy": 6.19341287612915, "epoch": 1.3046739757645702, "grad_norm": 1.25, "learning_rate": 0.00048412062401614653, "loss": 6.0934, "mean_token_accuracy": 0.16587843000888824, "num_tokens": 28660898.0, "step": 11305 }, { "entropy": 6.344057846069336, "epoch": 1.3052510098095786, "grad_norm": 1.3984375, "learning_rate": 0.00048410539349634, "loss": 6.2212, "mean_token_accuracy": 0.16715804785490035, "num_tokens": 28672898.0, "step": 11310 }, { "entropy": 6.31997652053833, "epoch": 1.3058280438545875, "grad_norm": 1.140625, "learning_rate": 0.00048409015594337725, "loss": 6.2326, "mean_token_accuracy": 0.16915102154016495, "num_tokens": 28684608.0, "step": 11315 }, { "entropy": 6.339677190780639, "epoch": 1.3064050778995961, "grad_norm": 1.109375, "learning_rate": 0.000484074911357771, "loss": 6.1071, "mean_token_accuracy": 0.17026219218969346, "num_tokens": 28696867.0, "step": 11320 }, { "entropy": 6.284737062454224, "epoch": 1.3069821119446048, "grad_norm": 1.171875, "learning_rate": 0.00048405965974003404, "loss": 6.1815, "mean_token_accuracy": 0.1607493944466114, "num_tokens": 28709533.0, "step": 11325 }, { "entropy": 6.273362398147583, "epoch": 1.3075591459896134, "grad_norm": 1.1953125, "learning_rate": 0.00048404440109067927, "loss": 6.1495, "mean_token_accuracy": 0.15757483690977098, "num_tokens": 28721647.0, "step": 11330 }, { "entropy": 6.358157205581665, "epoch": 1.308136180034622, "grad_norm": 1.5234375, "learning_rate": 0.0004840291354102198, "loss": 6.1643, "mean_token_accuracy": 0.1579637810587883, "num_tokens": 28735261.0, "step": 11335 }, { "entropy": 6.355404090881348, "epoch": 1.3087132140796307, "grad_norm": 1.3515625, "learning_rate": 0.0004840138626991693, "loss": 6.1813, "mean_token_accuracy": 0.16192290782928467, "num_tokens": 28747930.0, "step": 11340 }, { "entropy": 6.281838083267212, "epoch": 1.3092902481246393, "grad_norm": 1.46875, "learning_rate": 0.0004839985829580413, "loss": 6.1725, "mean_token_accuracy": 0.16236553341150284, "num_tokens": 28760497.0, "step": 11345 }, { "entropy": 6.378918027877807, "epoch": 1.309867282169648, "grad_norm": 1.2890625, "learning_rate": 0.00048398329618734977, "loss": 6.1821, "mean_token_accuracy": 0.16250278949737548, "num_tokens": 28772787.0, "step": 11350 }, { "entropy": 6.279808425903321, "epoch": 1.3104443162146566, "grad_norm": 1.4375, "learning_rate": 0.0004839680023876089, "loss": 6.1225, "mean_token_accuracy": 0.16467889100313188, "num_tokens": 28784901.0, "step": 11355 }, { "entropy": 6.267178392410278, "epoch": 1.3110213502596653, "grad_norm": 1.4921875, "learning_rate": 0.0004839527015593331, "loss": 6.1847, "mean_token_accuracy": 0.155230500549078, "num_tokens": 28797376.0, "step": 11360 }, { "entropy": 6.296201229095459, "epoch": 1.311598384304674, "grad_norm": 1.2265625, "learning_rate": 0.00048393739370303684, "loss": 6.0965, "mean_token_accuracy": 0.16835566163063048, "num_tokens": 28808805.0, "step": 11365 }, { "entropy": 6.336475372314453, "epoch": 1.3121754183496828, "grad_norm": 1.1953125, "learning_rate": 0.0004839220788192353, "loss": 6.236, "mean_token_accuracy": 0.15595455914735795, "num_tokens": 28821734.0, "step": 11370 }, { "entropy": 6.313124322891236, "epoch": 1.3127524523946912, "grad_norm": 1.40625, "learning_rate": 0.00048390675690844335, "loss": 6.1081, "mean_token_accuracy": 0.15779682695865632, "num_tokens": 28834864.0, "step": 11375 }, { "entropy": 6.213588857650757, "epoch": 1.3133294864397, "grad_norm": 1.609375, "learning_rate": 0.0004838914279711764, "loss": 6.1031, "mean_token_accuracy": 0.16101833879947663, "num_tokens": 28848154.0, "step": 11380 }, { "entropy": 6.278816747665405, "epoch": 1.3139065204847085, "grad_norm": 1.109375, "learning_rate": 0.00048387609200795003, "loss": 6.1566, "mean_token_accuracy": 0.16542939245700836, "num_tokens": 28861562.0, "step": 11385 }, { "entropy": 6.3024074077606205, "epoch": 1.3144835545297173, "grad_norm": 1.40625, "learning_rate": 0.00048386074901928, "loss": 6.1507, "mean_token_accuracy": 0.1619145765900612, "num_tokens": 28873921.0, "step": 11390 }, { "entropy": 6.294253396987915, "epoch": 1.315060588574726, "grad_norm": 1.4453125, "learning_rate": 0.0004838453990056825, "loss": 6.2042, "mean_token_accuracy": 0.15534769594669343, "num_tokens": 28886126.0, "step": 11395 }, { "entropy": 6.3025377750396725, "epoch": 1.3156376226197346, "grad_norm": 1.453125, "learning_rate": 0.00048383004196767373, "loss": 6.0669, "mean_token_accuracy": 0.16867079287767411, "num_tokens": 28897980.0, "step": 11400 }, { "entropy": 6.36027307510376, "epoch": 1.3162146566647432, "grad_norm": 1.1796875, "learning_rate": 0.0004838146779057702, "loss": 6.1161, "mean_token_accuracy": 0.1627037927508354, "num_tokens": 28910105.0, "step": 11405 }, { "entropy": 6.22172999382019, "epoch": 1.3167916907097519, "grad_norm": 1.3046875, "learning_rate": 0.0004837993068204887, "loss": 6.1778, "mean_token_accuracy": 0.16126993000507356, "num_tokens": 28922004.0, "step": 11410 }, { "entropy": 6.219480228424072, "epoch": 1.3173687247547605, "grad_norm": 1.140625, "learning_rate": 0.00048378392871234634, "loss": 6.0341, "mean_token_accuracy": 0.17347660958766936, "num_tokens": 28935990.0, "step": 11415 }, { "entropy": 6.357144784927368, "epoch": 1.3179457587997692, "grad_norm": 1.4140625, "learning_rate": 0.0004837685435818601, "loss": 6.1271, "mean_token_accuracy": 0.1658763289451599, "num_tokens": 28948274.0, "step": 11420 }, { "entropy": 6.311680173873901, "epoch": 1.3185227928447778, "grad_norm": 1.2421875, "learning_rate": 0.0004837531514295477, "loss": 6.228, "mean_token_accuracy": 0.155182783305645, "num_tokens": 28960101.0, "step": 11425 }, { "entropy": 6.284453725814819, "epoch": 1.3190998268897864, "grad_norm": 1.2578125, "learning_rate": 0.0004837377522559267, "loss": 6.1773, "mean_token_accuracy": 0.16812565177679062, "num_tokens": 28972408.0, "step": 11430 }, { "entropy": 6.337407922744751, "epoch": 1.319676860934795, "grad_norm": 1.265625, "learning_rate": 0.00048372234606151507, "loss": 6.1459, "mean_token_accuracy": 0.16081255227327346, "num_tokens": 28985025.0, "step": 11435 }, { "entropy": 6.349707365036011, "epoch": 1.3202538949798037, "grad_norm": 1.3515625, "learning_rate": 0.00048370693284683106, "loss": 6.2225, "mean_token_accuracy": 0.16389241069555283, "num_tokens": 28997568.0, "step": 11440 }, { "entropy": 6.323847770690918, "epoch": 1.3208309290248126, "grad_norm": 1.2109375, "learning_rate": 0.00048369151261239303, "loss": 6.2415, "mean_token_accuracy": 0.15582263171672822, "num_tokens": 29009567.0, "step": 11445 }, { "entropy": 6.289740896224975, "epoch": 1.321407963069821, "grad_norm": 1.453125, "learning_rate": 0.0004836760853587196, "loss": 6.1286, "mean_token_accuracy": 0.16066635698080062, "num_tokens": 29021403.0, "step": 11450 }, { "entropy": 6.277720832824707, "epoch": 1.3219849971148299, "grad_norm": 1.265625, "learning_rate": 0.00048366065108632967, "loss": 6.1198, "mean_token_accuracy": 0.16584020256996154, "num_tokens": 29033430.0, "step": 11455 }, { "entropy": 6.319123935699463, "epoch": 1.3225620311598385, "grad_norm": 1.2734375, "learning_rate": 0.00048364520979574246, "loss": 6.1489, "mean_token_accuracy": 0.1609363466501236, "num_tokens": 29045659.0, "step": 11460 }, { "entropy": 6.234172105789185, "epoch": 1.3231390652048471, "grad_norm": 1.3828125, "learning_rate": 0.00048362976148747715, "loss": 6.1121, "mean_token_accuracy": 0.1620397835969925, "num_tokens": 29058962.0, "step": 11465 }, { "entropy": 6.299294567108154, "epoch": 1.3237160992498558, "grad_norm": 1.5078125, "learning_rate": 0.0004836143061620536, "loss": 6.0509, "mean_token_accuracy": 0.165127757191658, "num_tokens": 29072009.0, "step": 11470 }, { "entropy": 6.163762044906616, "epoch": 1.3242931332948644, "grad_norm": 1.28125, "learning_rate": 0.0004835988438199914, "loss": 6.0393, "mean_token_accuracy": 0.17196400761604308, "num_tokens": 29084174.0, "step": 11475 }, { "entropy": 6.279996156692505, "epoch": 1.324870167339873, "grad_norm": 1.3046875, "learning_rate": 0.0004835833744618107, "loss": 6.1329, "mean_token_accuracy": 0.16213522255420684, "num_tokens": 29096189.0, "step": 11480 }, { "entropy": 6.312683248519898, "epoch": 1.3254472013848817, "grad_norm": 1.4765625, "learning_rate": 0.0004835678980880318, "loss": 6.0979, "mean_token_accuracy": 0.16390204429626465, "num_tokens": 29108212.0, "step": 11485 }, { "entropy": 6.309130334854126, "epoch": 1.3260242354298903, "grad_norm": 1.3515625, "learning_rate": 0.0004835524146991753, "loss": 6.1004, "mean_token_accuracy": 0.16586587578058243, "num_tokens": 29121058.0, "step": 11490 }, { "entropy": 6.241234064102173, "epoch": 1.326601269474899, "grad_norm": 1.203125, "learning_rate": 0.00048353692429576185, "loss": 6.188, "mean_token_accuracy": 0.16660408526659012, "num_tokens": 29132981.0, "step": 11495 }, { "entropy": 6.332604503631591, "epoch": 1.3271783035199076, "grad_norm": 1.25, "learning_rate": 0.0004835214268783126, "loss": 6.1632, "mean_token_accuracy": 0.15822002291679382, "num_tokens": 29145143.0, "step": 11500 }, { "entropy": 6.333203220367432, "epoch": 1.3277553375649163, "grad_norm": 1.078125, "learning_rate": 0.00048350592244734866, "loss": 6.0906, "mean_token_accuracy": 0.16814986616373062, "num_tokens": 29157548.0, "step": 11505 }, { "entropy": 6.203010225296021, "epoch": 1.3283323716099251, "grad_norm": 1.5390625, "learning_rate": 0.0004834904110033917, "loss": 6.0297, "mean_token_accuracy": 0.16850072741508484, "num_tokens": 29170243.0, "step": 11510 }, { "entropy": 6.297244215011597, "epoch": 1.3289094056549335, "grad_norm": 1.5625, "learning_rate": 0.00048347489254696327, "loss": 6.1258, "mean_token_accuracy": 0.16527609378099442, "num_tokens": 29181769.0, "step": 11515 }, { "entropy": 6.33937406539917, "epoch": 1.3294864396999424, "grad_norm": 1.2421875, "learning_rate": 0.0004834593670785854, "loss": 6.2181, "mean_token_accuracy": 0.15585944056510925, "num_tokens": 29194196.0, "step": 11520 }, { "entropy": 6.325269174575806, "epoch": 1.3300634737449508, "grad_norm": 1.2109375, "learning_rate": 0.00048344383459878024, "loss": 6.1271, "mean_token_accuracy": 0.1619534283876419, "num_tokens": 29206101.0, "step": 11525 }, { "entropy": 6.217943239212036, "epoch": 1.3306405077899597, "grad_norm": 1.6484375, "learning_rate": 0.00048342829510807024, "loss": 6.0847, "mean_token_accuracy": 0.16871753782033921, "num_tokens": 29217851.0, "step": 11530 }, { "entropy": 6.189042425155639, "epoch": 1.3312175418349683, "grad_norm": 1.234375, "learning_rate": 0.000483412748606978, "loss": 6.0601, "mean_token_accuracy": 0.17444779425859452, "num_tokens": 29231497.0, "step": 11535 }, { "entropy": 6.353026437759399, "epoch": 1.331794575879977, "grad_norm": 1.1953125, "learning_rate": 0.0004833971950960266, "loss": 6.208, "mean_token_accuracy": 0.1626723363995552, "num_tokens": 29245227.0, "step": 11540 }, { "entropy": 6.34786024093628, "epoch": 1.3323716099249856, "grad_norm": 2.578125, "learning_rate": 0.0004833816345757391, "loss": 6.1389, "mean_token_accuracy": 0.159043388068676, "num_tokens": 29259403.0, "step": 11545 }, { "entropy": 6.323790502548218, "epoch": 1.3329486439699942, "grad_norm": 1.3828125, "learning_rate": 0.0004833660670466387, "loss": 6.1127, "mean_token_accuracy": 0.16409413069486617, "num_tokens": 29270938.0, "step": 11550 }, { "entropy": 6.297755861282349, "epoch": 1.3335256780150029, "grad_norm": 1.359375, "learning_rate": 0.0004833504925092492, "loss": 6.1452, "mean_token_accuracy": 0.16037169843912125, "num_tokens": 29284078.0, "step": 11555 }, { "entropy": 6.286835145950318, "epoch": 1.3341027120600115, "grad_norm": 1.2734375, "learning_rate": 0.0004833349109640944, "loss": 6.1047, "mean_token_accuracy": 0.16069846004247665, "num_tokens": 29295698.0, "step": 11560 }, { "entropy": 6.289292192459106, "epoch": 1.3346797461050202, "grad_norm": 1.296875, "learning_rate": 0.0004833193224116983, "loss": 6.1341, "mean_token_accuracy": 0.16754496693611146, "num_tokens": 29307585.0, "step": 11565 }, { "entropy": 6.301826333999633, "epoch": 1.3352567801500288, "grad_norm": 1.546875, "learning_rate": 0.00048330372685258526, "loss": 6.1567, "mean_token_accuracy": 0.16277503669261933, "num_tokens": 29321027.0, "step": 11570 }, { "entropy": 6.293691682815552, "epoch": 1.3358338141950374, "grad_norm": 1.265625, "learning_rate": 0.0004832881242872799, "loss": 6.1722, "mean_token_accuracy": 0.1613366723060608, "num_tokens": 29333121.0, "step": 11575 }, { "entropy": 6.3491006851196286, "epoch": 1.336410848240046, "grad_norm": 1.6015625, "learning_rate": 0.0004832725147163069, "loss": 6.1535, "mean_token_accuracy": 0.15993758887052537, "num_tokens": 29346120.0, "step": 11580 }, { "entropy": 6.324691343307495, "epoch": 1.336987882285055, "grad_norm": 1.3984375, "learning_rate": 0.00048325689814019134, "loss": 6.1097, "mean_token_accuracy": 0.16394416689872743, "num_tokens": 29357872.0, "step": 11585 }, { "entropy": 6.338229036331176, "epoch": 1.3375649163300634, "grad_norm": 1.515625, "learning_rate": 0.0004832412745594585, "loss": 6.1739, "mean_token_accuracy": 0.1639093592762947, "num_tokens": 29370657.0, "step": 11590 }, { "entropy": 6.240398502349853, "epoch": 1.3381419503750722, "grad_norm": 1.3203125, "learning_rate": 0.00048322564397463376, "loss": 6.0945, "mean_token_accuracy": 0.17317451536655426, "num_tokens": 29384880.0, "step": 11595 }, { "entropy": 6.3124298572540285, "epoch": 1.3387189844200809, "grad_norm": 1.3359375, "learning_rate": 0.00048321000638624296, "loss": 6.1144, "mean_token_accuracy": 0.16322875767946243, "num_tokens": 29397215.0, "step": 11600 }, { "entropy": 6.282052659988404, "epoch": 1.3392960184650895, "grad_norm": 2.125, "learning_rate": 0.000483194361794812, "loss": 6.1033, "mean_token_accuracy": 0.16651321500539779, "num_tokens": 29409634.0, "step": 11605 }, { "entropy": 6.286690282821655, "epoch": 1.3398730525100981, "grad_norm": 1.546875, "learning_rate": 0.000483178710200867, "loss": 6.0536, "mean_token_accuracy": 0.17319692820310592, "num_tokens": 29422404.0, "step": 11610 }, { "entropy": 6.323809862136841, "epoch": 1.3404500865551068, "grad_norm": 1.25, "learning_rate": 0.0004831630516049346, "loss": 6.2113, "mean_token_accuracy": 0.16090573668479918, "num_tokens": 29434727.0, "step": 11615 }, { "entropy": 6.316535472869873, "epoch": 1.3410271206001154, "grad_norm": 1.6640625, "learning_rate": 0.0004831473860075414, "loss": 6.136, "mean_token_accuracy": 0.15914638340473175, "num_tokens": 29447176.0, "step": 11620 }, { "entropy": 6.277497625350952, "epoch": 1.341604154645124, "grad_norm": 2.5625, "learning_rate": 0.00048313171340921417, "loss": 6.0976, "mean_token_accuracy": 0.17469708025455474, "num_tokens": 29460080.0, "step": 11625 }, { "entropy": 6.240986299514771, "epoch": 1.3421811886901327, "grad_norm": 1.3828125, "learning_rate": 0.00048311603381048025, "loss": 6.1296, "mean_token_accuracy": 0.1626189112663269, "num_tokens": 29472503.0, "step": 11630 }, { "entropy": 6.272552442550659, "epoch": 1.3427582227351413, "grad_norm": 1.390625, "learning_rate": 0.0004831003472118668, "loss": 6.0962, "mean_token_accuracy": 0.16392599642276764, "num_tokens": 29485139.0, "step": 11635 }, { "entropy": 6.398651361465454, "epoch": 1.34333525678015, "grad_norm": 1.1953125, "learning_rate": 0.0004830846536139016, "loss": 6.1837, "mean_token_accuracy": 0.16744163930416106, "num_tokens": 29497455.0, "step": 11640 }, { "entropy": 6.3032959461212155, "epoch": 1.3439122908251586, "grad_norm": 1.4921875, "learning_rate": 0.0004830689530171124, "loss": 6.1284, "mean_token_accuracy": 0.1687514752149582, "num_tokens": 29509859.0, "step": 11645 }, { "entropy": 6.352106809616089, "epoch": 1.3444893248701673, "grad_norm": 1.34375, "learning_rate": 0.0004830532454220273, "loss": 6.1896, "mean_token_accuracy": 0.1648508906364441, "num_tokens": 29523117.0, "step": 11650 }, { "entropy": 6.255600261688232, "epoch": 1.345066358915176, "grad_norm": 1.765625, "learning_rate": 0.00048303753082917474, "loss": 6.0831, "mean_token_accuracy": 0.16598070561885833, "num_tokens": 29535943.0, "step": 11655 }, { "entropy": 6.291255092620849, "epoch": 1.3456433929601848, "grad_norm": 1.5, "learning_rate": 0.00048302180923908306, "loss": 6.1696, "mean_token_accuracy": 0.16465048789978026, "num_tokens": 29549036.0, "step": 11660 }, { "entropy": 6.290594291687012, "epoch": 1.3462204270051932, "grad_norm": 1.5078125, "learning_rate": 0.00048300608065228126, "loss": 6.1377, "mean_token_accuracy": 0.1643916040658951, "num_tokens": 29563465.0, "step": 11665 }, { "entropy": 6.274702882766723, "epoch": 1.346797461050202, "grad_norm": 1.203125, "learning_rate": 0.00048299034506929815, "loss": 6.0228, "mean_token_accuracy": 0.17369044125080108, "num_tokens": 29575891.0, "step": 11670 }, { "entropy": 6.33291220664978, "epoch": 1.3473744950952107, "grad_norm": 1.9453125, "learning_rate": 0.00048297460249066315, "loss": 6.2557, "mean_token_accuracy": 0.15672912448644638, "num_tokens": 29589162.0, "step": 11675 }, { "entropy": 6.331118774414063, "epoch": 1.3479515291402193, "grad_norm": 1.6015625, "learning_rate": 0.0004829588529169057, "loss": 6.0916, "mean_token_accuracy": 0.1665223941206932, "num_tokens": 29602735.0, "step": 11680 }, { "entropy": 6.220363473892212, "epoch": 1.348528563185228, "grad_norm": 1.265625, "learning_rate": 0.0004829430963485555, "loss": 6.0742, "mean_token_accuracy": 0.1701531946659088, "num_tokens": 29615683.0, "step": 11685 }, { "entropy": 6.316802501678467, "epoch": 1.3491055972302366, "grad_norm": 1.6328125, "learning_rate": 0.0004829273327861426, "loss": 6.1707, "mean_token_accuracy": 0.16423047631978988, "num_tokens": 29629606.0, "step": 11690 }, { "entropy": 6.291276979446411, "epoch": 1.3496826312752452, "grad_norm": 1.453125, "learning_rate": 0.0004829115622301971, "loss": 6.0758, "mean_token_accuracy": 0.17152973264455795, "num_tokens": 29642250.0, "step": 11695 }, { "entropy": 6.3764811038970945, "epoch": 1.3502596653202539, "grad_norm": 1.5234375, "learning_rate": 0.00048289578468124956, "loss": 6.1999, "mean_token_accuracy": 0.16525790095329285, "num_tokens": 29655689.0, "step": 11700 }, { "entropy": 6.153978443145752, "epoch": 1.3508366993652625, "grad_norm": 1.34375, "learning_rate": 0.00048288000013983046, "loss": 6.0987, "mean_token_accuracy": 0.16323120892047882, "num_tokens": 29670084.0, "step": 11705 }, { "entropy": 6.329030132293701, "epoch": 1.3514137334102712, "grad_norm": 1.90625, "learning_rate": 0.00048286420860647086, "loss": 6.1822, "mean_token_accuracy": 0.1604864478111267, "num_tokens": 29683453.0, "step": 11710 }, { "entropy": 6.313185548782348, "epoch": 1.3519907674552798, "grad_norm": 1.953125, "learning_rate": 0.00048284841008170185, "loss": 6.0545, "mean_token_accuracy": 0.16783878356218337, "num_tokens": 29695514.0, "step": 11715 }, { "entropy": 6.30164647102356, "epoch": 1.3525678015002884, "grad_norm": 1.6640625, "learning_rate": 0.00048283260456605487, "loss": 6.1151, "mean_token_accuracy": 0.1725817874073982, "num_tokens": 29708544.0, "step": 11720 }, { "entropy": 6.364648389816284, "epoch": 1.3531448355452973, "grad_norm": 2.234375, "learning_rate": 0.0004828167920600614, "loss": 6.0963, "mean_token_accuracy": 0.16400440484285356, "num_tokens": 29721310.0, "step": 11725 }, { "entropy": 6.348964786529541, "epoch": 1.3537218695903057, "grad_norm": 1.6328125, "learning_rate": 0.0004828009725642534, "loss": 6.1322, "mean_token_accuracy": 0.16307055801153184, "num_tokens": 29733995.0, "step": 11730 }, { "entropy": 6.314385557174683, "epoch": 1.3542989036353146, "grad_norm": 1.6328125, "learning_rate": 0.0004827851460791628, "loss": 6.1939, "mean_token_accuracy": 0.15663280338048935, "num_tokens": 29745896.0, "step": 11735 }, { "entropy": 6.3260167121887205, "epoch": 1.3548759376803232, "grad_norm": 1.21875, "learning_rate": 0.00048276931260532213, "loss": 6.0957, "mean_token_accuracy": 0.16611895859241485, "num_tokens": 29758967.0, "step": 11740 }, { "entropy": 6.299111270904541, "epoch": 1.3554529717253319, "grad_norm": 1.734375, "learning_rate": 0.0004827534721432639, "loss": 6.1453, "mean_token_accuracy": 0.15984882563352584, "num_tokens": 29772167.0, "step": 11745 }, { "entropy": 6.265276765823364, "epoch": 1.3560300057703405, "grad_norm": 1.25, "learning_rate": 0.0004827376246935207, "loss": 6.0998, "mean_token_accuracy": 0.16514657139778138, "num_tokens": 29783841.0, "step": 11750 }, { "entropy": 6.3505817413330075, "epoch": 1.3566070398153491, "grad_norm": 1.4140625, "learning_rate": 0.0004827217702566257, "loss": 6.1709, "mean_token_accuracy": 0.16244319677352906, "num_tokens": 29795993.0, "step": 11755 }, { "entropy": 6.288106441497803, "epoch": 1.3571840738603578, "grad_norm": 1.3984375, "learning_rate": 0.00048270590883311217, "loss": 6.1015, "mean_token_accuracy": 0.17155284732580184, "num_tokens": 29807692.0, "step": 11760 }, { "entropy": 6.287062501907348, "epoch": 1.3577611079053664, "grad_norm": 1.3359375, "learning_rate": 0.00048269004042351363, "loss": 6.1851, "mean_token_accuracy": 0.16180962175130845, "num_tokens": 29820778.0, "step": 11765 }, { "entropy": 6.317913389205932, "epoch": 1.358338141950375, "grad_norm": 1.3515625, "learning_rate": 0.0004826741650283637, "loss": 6.1186, "mean_token_accuracy": 0.1640876680612564, "num_tokens": 29833976.0, "step": 11770 }, { "entropy": 6.251207447052002, "epoch": 1.3589151759953837, "grad_norm": 1.671875, "learning_rate": 0.0004826582826481963, "loss": 6.0767, "mean_token_accuracy": 0.17455727756023406, "num_tokens": 29846226.0, "step": 11775 }, { "entropy": 6.219823408126831, "epoch": 1.3594922100403923, "grad_norm": 1.2734375, "learning_rate": 0.0004826423932835458, "loss": 6.0798, "mean_token_accuracy": 0.16895576119422911, "num_tokens": 29858483.0, "step": 11780 }, { "entropy": 6.314107465744018, "epoch": 1.360069244085401, "grad_norm": 1.34375, "learning_rate": 0.00048262649693494653, "loss": 6.1396, "mean_token_accuracy": 0.16297580003738404, "num_tokens": 29871178.0, "step": 11785 }, { "entropy": 6.4023756980896, "epoch": 1.3606462781304096, "grad_norm": 1.15625, "learning_rate": 0.0004826105936029332, "loss": 6.2018, "mean_token_accuracy": 0.15794295221567153, "num_tokens": 29885477.0, "step": 11790 }, { "entropy": 6.298975467681885, "epoch": 1.3612233121754183, "grad_norm": 1.53125, "learning_rate": 0.0004825946832880406, "loss": 6.1311, "mean_token_accuracy": 0.16285300999879837, "num_tokens": 29897917.0, "step": 11795 }, { "entropy": 6.278939914703369, "epoch": 1.3618003462204271, "grad_norm": 1.515625, "learning_rate": 0.00048257876599080404, "loss": 6.1943, "mean_token_accuracy": 0.16165986955165862, "num_tokens": 29911321.0, "step": 11800 }, { "entropy": 6.305810499191284, "epoch": 1.3623773802654355, "grad_norm": 1.2734375, "learning_rate": 0.00048256284171175874, "loss": 6.0903, "mean_token_accuracy": 0.17238346338272095, "num_tokens": 29924651.0, "step": 11805 }, { "entropy": 6.1934586524963375, "epoch": 1.3629544143104444, "grad_norm": 2.40625, "learning_rate": 0.00048254691045144035, "loss": 6.0301, "mean_token_accuracy": 0.16324946731328965, "num_tokens": 29937334.0, "step": 11810 }, { "entropy": 6.265475225448609, "epoch": 1.363531448355453, "grad_norm": 1.4921875, "learning_rate": 0.0004825309722103848, "loss": 6.073, "mean_token_accuracy": 0.17350615113973616, "num_tokens": 29949751.0, "step": 11815 }, { "entropy": 6.2313230514526365, "epoch": 1.3641084824004617, "grad_norm": 1.390625, "learning_rate": 0.000482515026989128, "loss": 6.081, "mean_token_accuracy": 0.1747325286269188, "num_tokens": 29961675.0, "step": 11820 }, { "entropy": 6.3038712501525875, "epoch": 1.3646855164454703, "grad_norm": 1.671875, "learning_rate": 0.00048249907478820634, "loss": 6.2137, "mean_token_accuracy": 0.1612464517354965, "num_tokens": 29973222.0, "step": 11825 }, { "entropy": 6.353469610214233, "epoch": 1.365262550490479, "grad_norm": 1.828125, "learning_rate": 0.00048248311560815637, "loss": 6.1997, "mean_token_accuracy": 0.16309360787272453, "num_tokens": 29985845.0, "step": 11830 }, { "entropy": 6.320858573913574, "epoch": 1.3658395845354876, "grad_norm": 1.5859375, "learning_rate": 0.0004824671494495149, "loss": 6.1476, "mean_token_accuracy": 0.16458719223737717, "num_tokens": 29998252.0, "step": 11835 }, { "entropy": 6.346536493301391, "epoch": 1.3664166185804962, "grad_norm": 3.3125, "learning_rate": 0.0004824511763128189, "loss": 6.0951, "mean_token_accuracy": 0.17218410074710847, "num_tokens": 30011150.0, "step": 11840 }, { "entropy": 6.357008361816407, "epoch": 1.3669936526255049, "grad_norm": 1.2109375, "learning_rate": 0.00048243519619860567, "loss": 6.2157, "mean_token_accuracy": 0.1605319306254387, "num_tokens": 30024750.0, "step": 11845 }, { "entropy": 6.286159610748291, "epoch": 1.3675706866705135, "grad_norm": 1.4765625, "learning_rate": 0.0004824192091074126, "loss": 6.0616, "mean_token_accuracy": 0.1729810953140259, "num_tokens": 30038317.0, "step": 11850 }, { "entropy": 6.283872461318969, "epoch": 1.3681477207155222, "grad_norm": 1.21875, "learning_rate": 0.0004824032150397775, "loss": 6.192, "mean_token_accuracy": 0.17048034220933914, "num_tokens": 30052156.0, "step": 11855 }, { "entropy": 6.305463886260986, "epoch": 1.3687247547605308, "grad_norm": 1.2109375, "learning_rate": 0.00048238721399623824, "loss": 6.1517, "mean_token_accuracy": 0.16549787670373917, "num_tokens": 30063463.0, "step": 11860 }, { "entropy": 6.304179716110229, "epoch": 1.3693017888055397, "grad_norm": 1.609375, "learning_rate": 0.00048237120597733316, "loss": 6.0799, "mean_token_accuracy": 0.17041393965482712, "num_tokens": 30075090.0, "step": 11865 }, { "entropy": 6.236459493637085, "epoch": 1.369878822850548, "grad_norm": 1.6015625, "learning_rate": 0.0004823551909836005, "loss": 6.0931, "mean_token_accuracy": 0.16820509731769562, "num_tokens": 30087618.0, "step": 11870 }, { "entropy": 6.319930219650269, "epoch": 1.370455856895557, "grad_norm": 1.328125, "learning_rate": 0.00048233916901557896, "loss": 6.08, "mean_token_accuracy": 0.16947691589593888, "num_tokens": 30098781.0, "step": 11875 }, { "entropy": 6.3354767799377445, "epoch": 1.3710328909405656, "grad_norm": 1.359375, "learning_rate": 0.00048232314007380753, "loss": 6.1378, "mean_token_accuracy": 0.1753944605588913, "num_tokens": 30111163.0, "step": 11880 }, { "entropy": 6.294744157791138, "epoch": 1.3716099249855742, "grad_norm": 1.703125, "learning_rate": 0.00048230710415882524, "loss": 6.1374, "mean_token_accuracy": 0.16997584998607634, "num_tokens": 30124609.0, "step": 11885 }, { "entropy": 6.316244983673096, "epoch": 1.3721869590305829, "grad_norm": 1.578125, "learning_rate": 0.00048229106127117144, "loss": 6.1872, "mean_token_accuracy": 0.16650330871343613, "num_tokens": 30137823.0, "step": 11890 }, { "entropy": 6.389352178573608, "epoch": 1.3727639930755915, "grad_norm": 1.59375, "learning_rate": 0.0004822750114113858, "loss": 6.1348, "mean_token_accuracy": 0.16203177869319915, "num_tokens": 30150295.0, "step": 11895 }, { "entropy": 6.263393402099609, "epoch": 1.3733410271206001, "grad_norm": 1.8671875, "learning_rate": 0.0004822589545800081, "loss": 6.072, "mean_token_accuracy": 0.1705651491880417, "num_tokens": 30163533.0, "step": 11900 }, { "entropy": 6.308654689788819, "epoch": 1.3739180611656088, "grad_norm": 2.171875, "learning_rate": 0.0004822428907775784, "loss": 6.1621, "mean_token_accuracy": 0.15814722031354905, "num_tokens": 30176437.0, "step": 11905 }, { "entropy": 6.218947982788086, "epoch": 1.3744950952106174, "grad_norm": 1.4453125, "learning_rate": 0.00048222682000463704, "loss": 6.0643, "mean_token_accuracy": 0.17379665672779082, "num_tokens": 30190181.0, "step": 11910 }, { "entropy": 6.212062406539917, "epoch": 1.375072129255626, "grad_norm": 1.265625, "learning_rate": 0.0004822107422617245, "loss": 6.1404, "mean_token_accuracy": 0.16834926456212998, "num_tokens": 30202374.0, "step": 11915 }, { "entropy": 6.24512882232666, "epoch": 1.3756491633006347, "grad_norm": 1.7734375, "learning_rate": 0.00048219465754938156, "loss": 6.0318, "mean_token_accuracy": 0.16531560868024825, "num_tokens": 30215009.0, "step": 11920 }, { "entropy": 6.35242805480957, "epoch": 1.3762261973456433, "grad_norm": 1.2109375, "learning_rate": 0.00048217856586814926, "loss": 6.1363, "mean_token_accuracy": 0.16434847116470336, "num_tokens": 30226688.0, "step": 11925 }, { "entropy": 6.3303159236907955, "epoch": 1.376803231390652, "grad_norm": 1.3515625, "learning_rate": 0.00048216246721856875, "loss": 6.1683, "mean_token_accuracy": 0.16100845187902452, "num_tokens": 30238501.0, "step": 11930 }, { "entropy": 6.335440397262573, "epoch": 1.3773802654356606, "grad_norm": 1.71875, "learning_rate": 0.00048214636160118164, "loss": 6.107, "mean_token_accuracy": 0.16803493201732636, "num_tokens": 30250216.0, "step": 11935 }, { "entropy": 6.3147039890289305, "epoch": 1.3779572994806695, "grad_norm": 1.109375, "learning_rate": 0.0004821302490165295, "loss": 6.1213, "mean_token_accuracy": 0.16672479808330537, "num_tokens": 30262555.0, "step": 11940 }, { "entropy": 6.233082962036133, "epoch": 1.378534333525678, "grad_norm": 1.1640625, "learning_rate": 0.0004821141294651544, "loss": 6.0262, "mean_token_accuracy": 0.1772979751229286, "num_tokens": 30274593.0, "step": 11945 }, { "entropy": 6.325069808959961, "epoch": 1.3791113675706868, "grad_norm": 1.71875, "learning_rate": 0.00048209800294759836, "loss": 6.0518, "mean_token_accuracy": 0.17313085049390792, "num_tokens": 30286579.0, "step": 11950 }, { "entropy": 6.351945686340332, "epoch": 1.3796884016156954, "grad_norm": 1.1484375, "learning_rate": 0.0004820818694644039, "loss": 6.1369, "mean_token_accuracy": 0.16453606635332108, "num_tokens": 30299186.0, "step": 11955 }, { "entropy": 6.3624310970306395, "epoch": 1.380265435660704, "grad_norm": 1.265625, "learning_rate": 0.00048206572901611364, "loss": 6.1881, "mean_token_accuracy": 0.15905419141054153, "num_tokens": 30311429.0, "step": 11960 }, { "entropy": 6.3475316047668455, "epoch": 1.3808424697057127, "grad_norm": 1.875, "learning_rate": 0.00048204958160327034, "loss": 6.1504, "mean_token_accuracy": 0.1662835657596588, "num_tokens": 30323323.0, "step": 11965 }, { "entropy": 6.276279354095459, "epoch": 1.3814195037507213, "grad_norm": 2.015625, "learning_rate": 0.00048203342722641726, "loss": 6.1237, "mean_token_accuracy": 0.16957689821720123, "num_tokens": 30335815.0, "step": 11970 }, { "entropy": 6.24206919670105, "epoch": 1.38199653779573, "grad_norm": 1.2734375, "learning_rate": 0.00048201726588609776, "loss": 6.0503, "mean_token_accuracy": 0.1701612576842308, "num_tokens": 30347426.0, "step": 11975 }, { "entropy": 6.314512062072754, "epoch": 1.3825735718407386, "grad_norm": 1.109375, "learning_rate": 0.00048200109758285534, "loss": 6.1244, "mean_token_accuracy": 0.16389783024787902, "num_tokens": 30359781.0, "step": 11980 }, { "entropy": 6.318188142776489, "epoch": 1.3831506058857472, "grad_norm": 1.6484375, "learning_rate": 0.0004819849223172337, "loss": 6.133, "mean_token_accuracy": 0.16730300784111024, "num_tokens": 30373399.0, "step": 11985 }, { "entropy": 6.202302885055542, "epoch": 1.3837276399307559, "grad_norm": 1.59375, "learning_rate": 0.00048196874008977716, "loss": 6.0891, "mean_token_accuracy": 0.17317621558904647, "num_tokens": 30386296.0, "step": 11990 }, { "entropy": 6.289775609970093, "epoch": 1.3843046739757645, "grad_norm": 1.7890625, "learning_rate": 0.0004819525509010298, "loss": 6.131, "mean_token_accuracy": 0.17061251550912857, "num_tokens": 30399496.0, "step": 11995 }, { "entropy": 6.286764621734619, "epoch": 1.3848817080207732, "grad_norm": 1.984375, "learning_rate": 0.0004819363547515361, "loss": 6.0803, "mean_token_accuracy": 0.16182739287614822, "num_tokens": 30412491.0, "step": 12000 }, { "epoch": 1.3848817080207732, "eval_entropy": 6.224000952614618, "eval_loss": 6.247929573059082, "eval_mean_token_accuracy": 0.16458880992324, "eval_num_tokens": 30412491.0, "eval_runtime": 22.6792, "eval_samples_per_second": 1240.607, "eval_steps_per_second": 155.076, "step": 12000 }, { "entropy": 6.369675827026367, "epoch": 1.385458742065782, "grad_norm": 1.2265625, "learning_rate": 0.000481920151641841, "loss": 6.2147, "mean_token_accuracy": 0.16291867345571517, "num_tokens": 30427600.0, "step": 12005 }, { "entropy": 6.355693054199219, "epoch": 1.3860357761107904, "grad_norm": 1.1875, "learning_rate": 0.00048190394157248935, "loss": 6.0842, "mean_token_accuracy": 0.171800796687603, "num_tokens": 30440534.0, "step": 12010 }, { "entropy": 6.275745153427124, "epoch": 1.3866128101557993, "grad_norm": 1.21875, "learning_rate": 0.0004818877245440264, "loss": 6.0815, "mean_token_accuracy": 0.16982559263706207, "num_tokens": 30453996.0, "step": 12015 }, { "entropy": 6.300146865844726, "epoch": 1.3871898442008077, "grad_norm": 1.3125, "learning_rate": 0.00048187150055699763, "loss": 6.1495, "mean_token_accuracy": 0.16266092360019685, "num_tokens": 30465667.0, "step": 12020 }, { "entropy": 6.351484680175782, "epoch": 1.3877668782458166, "grad_norm": 1.28125, "learning_rate": 0.0004818552696119487, "loss": 6.1958, "mean_token_accuracy": 0.1609213873744011, "num_tokens": 30478950.0, "step": 12025 }, { "entropy": 6.2422269821167, "epoch": 1.3883439122908252, "grad_norm": 1.2578125, "learning_rate": 0.0004818390317094255, "loss": 6.0572, "mean_token_accuracy": 0.17113839089870453, "num_tokens": 30490979.0, "step": 12030 }, { "entropy": 6.311171054840088, "epoch": 1.3889209463358339, "grad_norm": 1.9453125, "learning_rate": 0.0004818227868499742, "loss": 6.0909, "mean_token_accuracy": 0.17111729681491852, "num_tokens": 30504242.0, "step": 12035 }, { "entropy": 6.25700569152832, "epoch": 1.3894979803808425, "grad_norm": 1.09375, "learning_rate": 0.0004818065350341412, "loss": 6.1619, "mean_token_accuracy": 0.16251288056373597, "num_tokens": 30515739.0, "step": 12040 }, { "entropy": 6.387627744674683, "epoch": 1.3900750144258511, "grad_norm": 1.6328125, "learning_rate": 0.00048179027626247325, "loss": 6.1466, "mean_token_accuracy": 0.15438068956136702, "num_tokens": 30528338.0, "step": 12045 }, { "entropy": 6.408785104751587, "epoch": 1.3906520484708598, "grad_norm": 1.2734375, "learning_rate": 0.0004817740105355169, "loss": 6.1735, "mean_token_accuracy": 0.16251056343317033, "num_tokens": 30540572.0, "step": 12050 }, { "entropy": 6.360489416122436, "epoch": 1.3912290825158684, "grad_norm": 1.265625, "learning_rate": 0.00048175773785381947, "loss": 6.196, "mean_token_accuracy": 0.1643637403845787, "num_tokens": 30554317.0, "step": 12055 }, { "entropy": 6.341495227813721, "epoch": 1.391806116560877, "grad_norm": 1.1875, "learning_rate": 0.00048174145821792833, "loss": 6.1534, "mean_token_accuracy": 0.16100704222917556, "num_tokens": 30567177.0, "step": 12060 }, { "entropy": 6.35797700881958, "epoch": 1.3923831506058857, "grad_norm": 1.2890625, "learning_rate": 0.0004817251716283908, "loss": 6.1489, "mean_token_accuracy": 0.1654942288994789, "num_tokens": 30577948.0, "step": 12065 }, { "entropy": 6.228287220001221, "epoch": 1.3929601846508943, "grad_norm": 1.5078125, "learning_rate": 0.0004817088780857548, "loss": 6.1331, "mean_token_accuracy": 0.16523568630218505, "num_tokens": 30590548.0, "step": 12070 }, { "entropy": 6.303491497039795, "epoch": 1.393537218695903, "grad_norm": 1.5, "learning_rate": 0.00048169257759056845, "loss": 6.049, "mean_token_accuracy": 0.17548049986362457, "num_tokens": 30602735.0, "step": 12075 }, { "entropy": 6.357599115371704, "epoch": 1.3941142527409118, "grad_norm": 1.5390625, "learning_rate": 0.00048167627014337994, "loss": 6.1888, "mean_token_accuracy": 0.16183228939771652, "num_tokens": 30615112.0, "step": 12080 }, { "entropy": 6.253079414367676, "epoch": 1.3946912867859202, "grad_norm": 1.3203125, "learning_rate": 0.00048165995574473764, "loss": 6.1103, "mean_token_accuracy": 0.1625622555613518, "num_tokens": 30627406.0, "step": 12085 }, { "entropy": 6.312600135803223, "epoch": 1.395268320830929, "grad_norm": 1.8046875, "learning_rate": 0.00048164363439519043, "loss": 6.1182, "mean_token_accuracy": 0.1654726192355156, "num_tokens": 30639764.0, "step": 12090 }, { "entropy": 6.347026824951172, "epoch": 1.3958453548759377, "grad_norm": 1.2578125, "learning_rate": 0.0004816273060952873, "loss": 6.1022, "mean_token_accuracy": 0.16689932197332383, "num_tokens": 30652181.0, "step": 12095 }, { "entropy": 6.306456422805786, "epoch": 1.3964223889209464, "grad_norm": 1.4921875, "learning_rate": 0.00048161097084557726, "loss": 6.1286, "mean_token_accuracy": 0.1631346881389618, "num_tokens": 30663586.0, "step": 12100 }, { "entropy": 6.374965047836303, "epoch": 1.396999422965955, "grad_norm": 1.4453125, "learning_rate": 0.00048159462864660993, "loss": 6.1952, "mean_token_accuracy": 0.15762596130371093, "num_tokens": 30676218.0, "step": 12105 }, { "entropy": 6.339052629470825, "epoch": 1.3975764570109637, "grad_norm": 1.90625, "learning_rate": 0.0004815782794989348, "loss": 6.1864, "mean_token_accuracy": 0.1606118932366371, "num_tokens": 30688532.0, "step": 12110 }, { "entropy": 6.2383440971374515, "epoch": 1.3981534910559723, "grad_norm": 1.1953125, "learning_rate": 0.0004815619234031019, "loss": 6.1052, "mean_token_accuracy": 0.16475950181484222, "num_tokens": 30700698.0, "step": 12115 }, { "entropy": 6.2884252071380615, "epoch": 1.398730525100981, "grad_norm": 1.1796875, "learning_rate": 0.0004815455603596613, "loss": 6.1533, "mean_token_accuracy": 0.16549549996852875, "num_tokens": 30713032.0, "step": 12120 }, { "entropy": 6.294129419326782, "epoch": 1.3993075591459896, "grad_norm": 1.6171875, "learning_rate": 0.0004815291903691634, "loss": 6.0719, "mean_token_accuracy": 0.1696466714143753, "num_tokens": 30726829.0, "step": 12125 }, { "entropy": 6.337021923065185, "epoch": 1.3998845931909982, "grad_norm": 1.4921875, "learning_rate": 0.00048151281343215873, "loss": 6.1566, "mean_token_accuracy": 0.1605507642030716, "num_tokens": 30740280.0, "step": 12130 }, { "entropy": 6.21012511253357, "epoch": 1.4004616272360069, "grad_norm": 1.6953125, "learning_rate": 0.0004814964295491982, "loss": 6.0093, "mean_token_accuracy": 0.17915696054697036, "num_tokens": 30753467.0, "step": 12135 }, { "entropy": 6.279628944396973, "epoch": 1.4010386612810155, "grad_norm": 1.3515625, "learning_rate": 0.00048148003872083286, "loss": 6.0944, "mean_token_accuracy": 0.17217430621385574, "num_tokens": 30766958.0, "step": 12140 }, { "entropy": 6.305673313140869, "epoch": 1.4016156953260244, "grad_norm": 1.5859375, "learning_rate": 0.00048146364094761384, "loss": 6.1684, "mean_token_accuracy": 0.1595797434449196, "num_tokens": 30779114.0, "step": 12145 }, { "entropy": 6.294431924819946, "epoch": 1.4021927293710328, "grad_norm": 1.171875, "learning_rate": 0.00048144723623009297, "loss": 6.0811, "mean_token_accuracy": 0.16946638971567154, "num_tokens": 30792063.0, "step": 12150 }, { "entropy": 6.3064147472381595, "epoch": 1.4027697634160416, "grad_norm": 1.34375, "learning_rate": 0.0004814308245688218, "loss": 6.1343, "mean_token_accuracy": 0.16511736810207367, "num_tokens": 30804404.0, "step": 12155 }, { "entropy": 6.235158681869507, "epoch": 1.40334679746105, "grad_norm": 1.28125, "learning_rate": 0.00048141440596435235, "loss": 6.0719, "mean_token_accuracy": 0.17058005332946777, "num_tokens": 30817607.0, "step": 12160 }, { "entropy": 6.2955762386322025, "epoch": 1.403923831506059, "grad_norm": 1.3828125, "learning_rate": 0.0004813979804172369, "loss": 6.1501, "mean_token_accuracy": 0.1665330022573471, "num_tokens": 30831077.0, "step": 12165 }, { "entropy": 6.28407392501831, "epoch": 1.4045008655510676, "grad_norm": 1.609375, "learning_rate": 0.00048138154792802795, "loss": 6.2252, "mean_token_accuracy": 0.1606106773018837, "num_tokens": 30844096.0, "step": 12170 }, { "entropy": 6.323961544036865, "epoch": 1.4050778995960762, "grad_norm": 1.234375, "learning_rate": 0.0004813651084972781, "loss": 6.1439, "mean_token_accuracy": 0.1660185769200325, "num_tokens": 30856147.0, "step": 12175 }, { "entropy": 6.302383995056152, "epoch": 1.4056549336410848, "grad_norm": 1.125, "learning_rate": 0.00048134866212554036, "loss": 6.1361, "mean_token_accuracy": 0.15867800861597062, "num_tokens": 30869436.0, "step": 12180 }, { "entropy": 6.245109987258911, "epoch": 1.4062319676860935, "grad_norm": 1.1796875, "learning_rate": 0.0004813322088133679, "loss": 6.1151, "mean_token_accuracy": 0.16820482015609742, "num_tokens": 30882313.0, "step": 12185 }, { "entropy": 6.295883369445801, "epoch": 1.4068090017311021, "grad_norm": 1.3828125, "learning_rate": 0.00048131574856131407, "loss": 6.1159, "mean_token_accuracy": 0.16215179339051247, "num_tokens": 30895062.0, "step": 12190 }, { "entropy": 6.299847841262817, "epoch": 1.4073860357761108, "grad_norm": 1.265625, "learning_rate": 0.0004812992813699324, "loss": 6.1053, "mean_token_accuracy": 0.1652792364358902, "num_tokens": 30907736.0, "step": 12195 }, { "entropy": 6.322113800048828, "epoch": 1.4079630698211194, "grad_norm": 1.484375, "learning_rate": 0.000481282807239777, "loss": 6.1166, "mean_token_accuracy": 0.16788258105516435, "num_tokens": 30920462.0, "step": 12200 }, { "entropy": 6.28887448310852, "epoch": 1.408540103866128, "grad_norm": 1.1640625, "learning_rate": 0.0004812663261714019, "loss": 6.0392, "mean_token_accuracy": 0.17208631336688995, "num_tokens": 30933501.0, "step": 12205 }, { "entropy": 6.288034152984619, "epoch": 1.4091171379111367, "grad_norm": 1.1484375, "learning_rate": 0.0004812498381653613, "loss": 6.0682, "mean_token_accuracy": 0.17028167694807053, "num_tokens": 30944780.0, "step": 12210 }, { "entropy": 6.348947048187256, "epoch": 1.4096941719561453, "grad_norm": 1.2578125, "learning_rate": 0.0004812333432222098, "loss": 6.1574, "mean_token_accuracy": 0.16152927428483962, "num_tokens": 30957730.0, "step": 12215 }, { "entropy": 6.068280220031738, "epoch": 1.4102712060011542, "grad_norm": 1.28125, "learning_rate": 0.0004812168413425023, "loss": 5.9705, "mean_token_accuracy": 0.181918466091156, "num_tokens": 30969371.0, "step": 12220 }, { "entropy": 6.326417303085327, "epoch": 1.4108482400461626, "grad_norm": 1.3046875, "learning_rate": 0.00048120033252679374, "loss": 6.1889, "mean_token_accuracy": 0.16231568902730942, "num_tokens": 30983662.0, "step": 12225 }, { "entropy": 6.430174541473389, "epoch": 1.4114252740911715, "grad_norm": 1.1953125, "learning_rate": 0.00048118381677563946, "loss": 6.1601, "mean_token_accuracy": 0.1615968704223633, "num_tokens": 30995641.0, "step": 12230 }, { "entropy": 6.362520742416382, "epoch": 1.41200230813618, "grad_norm": 1.40625, "learning_rate": 0.0004811672940895949, "loss": 6.2089, "mean_token_accuracy": 0.16106947362422944, "num_tokens": 31008508.0, "step": 12235 }, { "entropy": 6.3622204780578615, "epoch": 1.4125793421811887, "grad_norm": 1.4375, "learning_rate": 0.0004811507644692158, "loss": 6.1686, "mean_token_accuracy": 0.16129661202430726, "num_tokens": 31020903.0, "step": 12240 }, { "entropy": 6.325216770172119, "epoch": 1.4131563762261974, "grad_norm": 1.4375, "learning_rate": 0.0004811342279150581, "loss": 6.1443, "mean_token_accuracy": 0.16731538027524948, "num_tokens": 31033668.0, "step": 12245 }, { "entropy": 6.345950746536255, "epoch": 1.413733410271206, "grad_norm": 1.59375, "learning_rate": 0.0004811176844276781, "loss": 6.1887, "mean_token_accuracy": 0.1661725699901581, "num_tokens": 31046980.0, "step": 12250 }, { "entropy": 6.335570049285889, "epoch": 1.4143104443162147, "grad_norm": 1.3125, "learning_rate": 0.0004811011340076322, "loss": 6.053, "mean_token_accuracy": 0.16766103059053422, "num_tokens": 31059023.0, "step": 12255 }, { "entropy": 6.250242805480957, "epoch": 1.4148874783612233, "grad_norm": 1.5625, "learning_rate": 0.00048108457665547695, "loss": 6.0954, "mean_token_accuracy": 0.17201029807329177, "num_tokens": 31070449.0, "step": 12260 }, { "entropy": 6.257473611831665, "epoch": 1.415464512406232, "grad_norm": 1.8828125, "learning_rate": 0.0004810680123717694, "loss": 6.06, "mean_token_accuracy": 0.17232086062431334, "num_tokens": 31081974.0, "step": 12265 }, { "entropy": 6.306641006469727, "epoch": 1.4160415464512406, "grad_norm": 1.3984375, "learning_rate": 0.0004810514411570666, "loss": 6.1572, "mean_token_accuracy": 0.1588302806019783, "num_tokens": 31094825.0, "step": 12270 }, { "entropy": 6.242742490768433, "epoch": 1.4166185804962492, "grad_norm": 1.40625, "learning_rate": 0.0004810348630119259, "loss": 6.0835, "mean_token_accuracy": 0.16637780368328095, "num_tokens": 31106589.0, "step": 12275 }, { "entropy": 6.383942031860352, "epoch": 1.4171956145412579, "grad_norm": 1.34375, "learning_rate": 0.00048101827793690493, "loss": 6.1439, "mean_token_accuracy": 0.157748444378376, "num_tokens": 31118228.0, "step": 12280 }, { "entropy": 6.387330436706543, "epoch": 1.4177726485862667, "grad_norm": 1.265625, "learning_rate": 0.0004810016859325615, "loss": 6.208, "mean_token_accuracy": 0.16304440647363663, "num_tokens": 31131396.0, "step": 12285 }, { "entropy": 6.327767467498779, "epoch": 1.4183496826312751, "grad_norm": 1.25, "learning_rate": 0.0004809850869994537, "loss": 6.1342, "mean_token_accuracy": 0.16658884882926941, "num_tokens": 31145524.0, "step": 12290 }, { "entropy": 6.349434852600098, "epoch": 1.418926716676284, "grad_norm": 1.25, "learning_rate": 0.0004809684811381398, "loss": 6.0971, "mean_token_accuracy": 0.17099672704935073, "num_tokens": 31157866.0, "step": 12295 }, { "entropy": 6.213384199142456, "epoch": 1.4195037507212924, "grad_norm": 1.484375, "learning_rate": 0.0004809518683491785, "loss": 6.0452, "mean_token_accuracy": 0.17853738218545914, "num_tokens": 31170634.0, "step": 12300 }, { "entropy": 6.281233596801758, "epoch": 1.4200807847663013, "grad_norm": 1.4375, "learning_rate": 0.00048093524863312823, "loss": 6.0843, "mean_token_accuracy": 0.16574939489364623, "num_tokens": 31183585.0, "step": 12305 }, { "entropy": 6.327755784988403, "epoch": 1.42065781881131, "grad_norm": 1.21875, "learning_rate": 0.0004809186219905482, "loss": 6.1063, "mean_token_accuracy": 0.16455602496862412, "num_tokens": 31196375.0, "step": 12310 }, { "entropy": 6.266958808898925, "epoch": 1.4212348528563186, "grad_norm": 1.0859375, "learning_rate": 0.0004809019884219976, "loss": 6.0963, "mean_token_accuracy": 0.17540175914764405, "num_tokens": 31209797.0, "step": 12315 }, { "entropy": 6.20970196723938, "epoch": 1.4218118869013272, "grad_norm": 1.203125, "learning_rate": 0.00048088534792803595, "loss": 5.9975, "mean_token_accuracy": 0.17160076051950454, "num_tokens": 31221196.0, "step": 12320 }, { "entropy": 6.305485630035401, "epoch": 1.4223889209463358, "grad_norm": 1.8515625, "learning_rate": 0.00048086870050922286, "loss": 6.1375, "mean_token_accuracy": 0.1657287821173668, "num_tokens": 31234126.0, "step": 12325 }, { "entropy": 6.313985776901245, "epoch": 1.4229659549913445, "grad_norm": 1.7578125, "learning_rate": 0.00048085204616611833, "loss": 6.1394, "mean_token_accuracy": 0.16098834723234176, "num_tokens": 31245933.0, "step": 12330 }, { "entropy": 6.293331670761108, "epoch": 1.4235429890363531, "grad_norm": 1.125, "learning_rate": 0.00048083538489928246, "loss": 6.1354, "mean_token_accuracy": 0.15946199297904967, "num_tokens": 31258734.0, "step": 12335 }, { "entropy": 6.274984502792359, "epoch": 1.4241200230813618, "grad_norm": 1.7421875, "learning_rate": 0.0004808187167092757, "loss": 6.0379, "mean_token_accuracy": 0.16822846084833146, "num_tokens": 31272487.0, "step": 12340 }, { "entropy": 6.23299126625061, "epoch": 1.4246970571263704, "grad_norm": 1.5625, "learning_rate": 0.0004808020415966586, "loss": 6.1069, "mean_token_accuracy": 0.16606823056936265, "num_tokens": 31285117.0, "step": 12345 }, { "entropy": 6.254212093353272, "epoch": 1.425274091171379, "grad_norm": 1.453125, "learning_rate": 0.000480785359561992, "loss": 6.0913, "mean_token_accuracy": 0.1718271940946579, "num_tokens": 31297772.0, "step": 12350 }, { "entropy": 6.278341388702392, "epoch": 1.4258511252163877, "grad_norm": 1.1875, "learning_rate": 0.00048076867060583704, "loss": 6.0946, "mean_token_accuracy": 0.1666000247001648, "num_tokens": 31310901.0, "step": 12355 }, { "entropy": 6.279241514205933, "epoch": 1.4264281592613965, "grad_norm": 2.234375, "learning_rate": 0.0004807519747287551, "loss": 6.1194, "mean_token_accuracy": 0.16237711459398269, "num_tokens": 31323090.0, "step": 12360 }, { "entropy": 6.275631761550903, "epoch": 1.427005193306405, "grad_norm": 1.390625, "learning_rate": 0.0004807352719313078, "loss": 6.0664, "mean_token_accuracy": 0.16846050322055817, "num_tokens": 31335883.0, "step": 12365 }, { "entropy": 6.350681781768799, "epoch": 1.4275822273514138, "grad_norm": 1.3359375, "learning_rate": 0.0004807185622140567, "loss": 6.1694, "mean_token_accuracy": 0.16167529821395873, "num_tokens": 31348237.0, "step": 12370 }, { "entropy": 6.219129180908203, "epoch": 1.4281592613964225, "grad_norm": 1.1796875, "learning_rate": 0.00048070184557756396, "loss": 6.0196, "mean_token_accuracy": 0.17124342024326325, "num_tokens": 31360414.0, "step": 12375 }, { "entropy": 6.2988440990448, "epoch": 1.428736295441431, "grad_norm": 1.7734375, "learning_rate": 0.00048068512202239177, "loss": 6.1451, "mean_token_accuracy": 0.16669683009386063, "num_tokens": 31372765.0, "step": 12380 }, { "entropy": 6.306262874603272, "epoch": 1.4293133294864397, "grad_norm": 1.71875, "learning_rate": 0.0004806683915491028, "loss": 6.1163, "mean_token_accuracy": 0.16952491849660872, "num_tokens": 31386176.0, "step": 12385 }, { "entropy": 6.350312519073486, "epoch": 1.4298903635314484, "grad_norm": 1.15625, "learning_rate": 0.0004806516541582596, "loss": 6.1894, "mean_token_accuracy": 0.15940093100070954, "num_tokens": 31398385.0, "step": 12390 }, { "entropy": 6.2261138439178465, "epoch": 1.430467397576457, "grad_norm": 1.3515625, "learning_rate": 0.00048063490985042506, "loss": 6.0459, "mean_token_accuracy": 0.16982655823230744, "num_tokens": 31410841.0, "step": 12395 }, { "entropy": 6.241001892089844, "epoch": 1.4310444316214657, "grad_norm": 1.375, "learning_rate": 0.0004806181586261626, "loss": 6.1138, "mean_token_accuracy": 0.1683602899312973, "num_tokens": 31425586.0, "step": 12400 }, { "entropy": 6.321263217926026, "epoch": 1.4316214656664743, "grad_norm": 1.4375, "learning_rate": 0.00048060140048603544, "loss": 6.0572, "mean_token_accuracy": 0.17428047508001326, "num_tokens": 31438943.0, "step": 12405 }, { "entropy": 6.241196346282959, "epoch": 1.432198499711483, "grad_norm": 1.4765625, "learning_rate": 0.0004805846354306073, "loss": 6.0361, "mean_token_accuracy": 0.1756817027926445, "num_tokens": 31452284.0, "step": 12410 }, { "entropy": 6.28016357421875, "epoch": 1.4327755337564916, "grad_norm": 1.6328125, "learning_rate": 0.00048056786346044214, "loss": 6.2197, "mean_token_accuracy": 0.1551727384328842, "num_tokens": 31466311.0, "step": 12415 }, { "entropy": 6.351090955734253, "epoch": 1.4333525678015002, "grad_norm": 1.4296875, "learning_rate": 0.00048055108457610395, "loss": 6.0679, "mean_token_accuracy": 0.1721023514866829, "num_tokens": 31478916.0, "step": 12420 }, { "entropy": 6.31014575958252, "epoch": 1.4339296018465089, "grad_norm": 1.734375, "learning_rate": 0.0004805342987781571, "loss": 6.1017, "mean_token_accuracy": 0.16851240694522857, "num_tokens": 31490337.0, "step": 12425 }, { "entropy": 6.290010833740235, "epoch": 1.4345066358915175, "grad_norm": 1.2109375, "learning_rate": 0.0004805175060671663, "loss": 6.1066, "mean_token_accuracy": 0.16243394911289216, "num_tokens": 31502625.0, "step": 12430 }, { "entropy": 6.323895978927612, "epoch": 1.4350836699365264, "grad_norm": 1.3828125, "learning_rate": 0.0004805007064436962, "loss": 6.1662, "mean_token_accuracy": 0.1605980172753334, "num_tokens": 31515440.0, "step": 12435 }, { "entropy": 6.297709703445435, "epoch": 1.4356607039815348, "grad_norm": 1.59375, "learning_rate": 0.0004804838999083119, "loss": 6.1129, "mean_token_accuracy": 0.16135017722845077, "num_tokens": 31527812.0, "step": 12440 }, { "entropy": 6.344575595855713, "epoch": 1.4362377380265436, "grad_norm": 1.59375, "learning_rate": 0.0004804670864615787, "loss": 6.1149, "mean_token_accuracy": 0.16526193022727967, "num_tokens": 31540249.0, "step": 12445 }, { "entropy": 6.285081386566162, "epoch": 1.4368147720715523, "grad_norm": 1.328125, "learning_rate": 0.00048045026610406223, "loss": 6.065, "mean_token_accuracy": 0.17280279397964476, "num_tokens": 31552312.0, "step": 12450 }, { "entropy": 6.2848773956298825, "epoch": 1.437391806116561, "grad_norm": 1.671875, "learning_rate": 0.000480433438836328, "loss": 6.1143, "mean_token_accuracy": 0.16405625715851785, "num_tokens": 31564496.0, "step": 12455 }, { "entropy": 6.360372257232666, "epoch": 1.4379688401615696, "grad_norm": 1.6171875, "learning_rate": 0.00048041660465894206, "loss": 6.1226, "mean_token_accuracy": 0.16145581156015396, "num_tokens": 31577705.0, "step": 12460 }, { "entropy": 6.3164557933807375, "epoch": 1.4385458742065782, "grad_norm": 1.1875, "learning_rate": 0.0004803997635724707, "loss": 6.1298, "mean_token_accuracy": 0.16466890573501586, "num_tokens": 31589566.0, "step": 12465 }, { "entropy": 6.304163312911987, "epoch": 1.4391229082515868, "grad_norm": 1.359375, "learning_rate": 0.0004803829155774804, "loss": 6.1433, "mean_token_accuracy": 0.16303829699754716, "num_tokens": 31602379.0, "step": 12470 }, { "entropy": 6.294868755340576, "epoch": 1.4396999422965955, "grad_norm": 1.1328125, "learning_rate": 0.0004803660606745377, "loss": 6.0728, "mean_token_accuracy": 0.17045496106147767, "num_tokens": 31615469.0, "step": 12475 }, { "entropy": 6.249364948272705, "epoch": 1.4402769763416041, "grad_norm": 1.3984375, "learning_rate": 0.00048034919886420953, "loss": 6.198, "mean_token_accuracy": 0.1614298328757286, "num_tokens": 31627129.0, "step": 12480 }, { "entropy": 6.392160129547119, "epoch": 1.4408540103866128, "grad_norm": 1.21875, "learning_rate": 0.00048033233014706304, "loss": 6.1553, "mean_token_accuracy": 0.16891637742519378, "num_tokens": 31639564.0, "step": 12485 }, { "entropy": 6.259813594818115, "epoch": 1.4414310444316214, "grad_norm": 1.0546875, "learning_rate": 0.00048031545452366565, "loss": 6.0918, "mean_token_accuracy": 0.16519918888807297, "num_tokens": 31651984.0, "step": 12490 }, { "entropy": 6.27579026222229, "epoch": 1.44200807847663, "grad_norm": 1.6015625, "learning_rate": 0.00048029857199458493, "loss": 6.1202, "mean_token_accuracy": 0.17073165774345397, "num_tokens": 31664850.0, "step": 12495 }, { "entropy": 6.299057912826538, "epoch": 1.442585112521639, "grad_norm": 1.671875, "learning_rate": 0.00048028168256038873, "loss": 6.0618, "mean_token_accuracy": 0.17626596838235856, "num_tokens": 31676993.0, "step": 12500 }, { "entropy": 6.314305353164673, "epoch": 1.4431621465666473, "grad_norm": 1.296875, "learning_rate": 0.00048026478622164513, "loss": 6.199, "mean_token_accuracy": 0.1673912525177002, "num_tokens": 31689632.0, "step": 12505 }, { "entropy": 6.3189842224121096, "epoch": 1.4437391806116562, "grad_norm": 1.25, "learning_rate": 0.00048024788297892234, "loss": 6.1337, "mean_token_accuracy": 0.16439658850431443, "num_tokens": 31701610.0, "step": 12510 }, { "entropy": 6.324826955795288, "epoch": 1.4443162146566648, "grad_norm": 1.2890625, "learning_rate": 0.000480230972832789, "loss": 6.0846, "mean_token_accuracy": 0.16393847912549972, "num_tokens": 31713838.0, "step": 12515 }, { "entropy": 6.257188940048218, "epoch": 1.4448932487016735, "grad_norm": 1.3359375, "learning_rate": 0.00048021405578381384, "loss": 6.0549, "mean_token_accuracy": 0.16817671060562134, "num_tokens": 31726097.0, "step": 12520 }, { "entropy": 6.286736917495728, "epoch": 1.445470282746682, "grad_norm": 2.390625, "learning_rate": 0.0004801971318325659, "loss": 6.0761, "mean_token_accuracy": 0.1660412147641182, "num_tokens": 31739646.0, "step": 12525 }, { "entropy": 6.279177141189575, "epoch": 1.4460473167916907, "grad_norm": 1.46875, "learning_rate": 0.0004801802009796142, "loss": 6.0792, "mean_token_accuracy": 0.16675680130720139, "num_tokens": 31752161.0, "step": 12530 }, { "entropy": 6.275993585586548, "epoch": 1.4466243508366994, "grad_norm": 1.515625, "learning_rate": 0.0004801632632255285, "loss": 6.0858, "mean_token_accuracy": 0.1660511910915375, "num_tokens": 31764498.0, "step": 12535 }, { "entropy": 6.336894416809082, "epoch": 1.447201384881708, "grad_norm": 1.7734375, "learning_rate": 0.0004801463185708783, "loss": 6.1314, "mean_token_accuracy": 0.16206191182136537, "num_tokens": 31776453.0, "step": 12540 }, { "entropy": 6.299965858459473, "epoch": 1.4477784189267167, "grad_norm": 2.0625, "learning_rate": 0.00048012936701623363, "loss": 6.1735, "mean_token_accuracy": 0.16327776312828063, "num_tokens": 31789761.0, "step": 12545 }, { "entropy": 6.394418525695801, "epoch": 1.4483554529717253, "grad_norm": 2.21875, "learning_rate": 0.00048011240856216456, "loss": 6.1803, "mean_token_accuracy": 0.16258420944213867, "num_tokens": 31802689.0, "step": 12550 }, { "entropy": 6.29752893447876, "epoch": 1.448932487016734, "grad_norm": 2.0, "learning_rate": 0.00048009544320924154, "loss": 6.169, "mean_token_accuracy": 0.16543462723493577, "num_tokens": 31816768.0, "step": 12555 }, { "entropy": 6.260969018936157, "epoch": 1.4495095210617426, "grad_norm": 1.3203125, "learning_rate": 0.0004800784709580351, "loss": 6.1266, "mean_token_accuracy": 0.16824788302183152, "num_tokens": 31828920.0, "step": 12560 }, { "entropy": 6.357678985595703, "epoch": 1.4500865551067512, "grad_norm": 1.390625, "learning_rate": 0.0004800614918091161, "loss": 6.1638, "mean_token_accuracy": 0.1669384077191353, "num_tokens": 31841467.0, "step": 12565 }, { "entropy": 6.349787187576294, "epoch": 1.4506635891517599, "grad_norm": 3.34375, "learning_rate": 0.0004800445057630558, "loss": 6.1629, "mean_token_accuracy": 0.1676136553287506, "num_tokens": 31855254.0, "step": 12570 }, { "entropy": 6.27349066734314, "epoch": 1.4512406231967687, "grad_norm": 1.28125, "learning_rate": 0.0004800275128204254, "loss": 6.1044, "mean_token_accuracy": 0.1662316232919693, "num_tokens": 31868234.0, "step": 12575 }, { "entropy": 6.35194959640503, "epoch": 1.4518176572417771, "grad_norm": 2.015625, "learning_rate": 0.00048001051298179637, "loss": 6.1405, "mean_token_accuracy": 0.17040657103061677, "num_tokens": 31880014.0, "step": 12580 }, { "entropy": 6.3423114776611325, "epoch": 1.452394691286786, "grad_norm": 1.53125, "learning_rate": 0.0004799935062477407, "loss": 6.0906, "mean_token_accuracy": 0.16711047291755676, "num_tokens": 31892019.0, "step": 12585 }, { "entropy": 6.354385280609131, "epoch": 1.4529717253317946, "grad_norm": 1.609375, "learning_rate": 0.00047997649261883013, "loss": 6.1275, "mean_token_accuracy": 0.15655057430267333, "num_tokens": 31905837.0, "step": 12590 }, { "entropy": 6.31659779548645, "epoch": 1.4535487593768033, "grad_norm": 1.65625, "learning_rate": 0.0004799594720956371, "loss": 6.0835, "mean_token_accuracy": 0.16454610973596573, "num_tokens": 31917823.0, "step": 12595 }, { "entropy": 6.348938417434693, "epoch": 1.454125793421812, "grad_norm": 3.34375, "learning_rate": 0.00047994244467873407, "loss": 6.1813, "mean_token_accuracy": 0.1576891675591469, "num_tokens": 31931221.0, "step": 12600 }, { "entropy": 6.339001035690307, "epoch": 1.4547028274668206, "grad_norm": 1.4921875, "learning_rate": 0.00047992541036869364, "loss": 6.1319, "mean_token_accuracy": 0.16306519508361816, "num_tokens": 31943739.0, "step": 12605 }, { "entropy": 6.3493794918060305, "epoch": 1.4552798615118292, "grad_norm": 2.109375, "learning_rate": 0.0004799083691660889, "loss": 6.1816, "mean_token_accuracy": 0.16041698455810546, "num_tokens": 31957805.0, "step": 12610 }, { "entropy": 6.352484798431396, "epoch": 1.4558568955568378, "grad_norm": 3.078125, "learning_rate": 0.0004798913210714929, "loss": 6.1328, "mean_token_accuracy": 0.17066436260938644, "num_tokens": 31970983.0, "step": 12615 }, { "entropy": 6.307969427108764, "epoch": 1.4564339296018465, "grad_norm": 1.8671875, "learning_rate": 0.00047987426608547915, "loss": 6.1348, "mean_token_accuracy": 0.1637205332517624, "num_tokens": 31982985.0, "step": 12620 }, { "entropy": 6.25712218284607, "epoch": 1.4570109636468551, "grad_norm": 1.7421875, "learning_rate": 0.0004798572042086212, "loss": 6.0702, "mean_token_accuracy": 0.16790583580732346, "num_tokens": 31994854.0, "step": 12625 }, { "entropy": 6.328677368164063, "epoch": 1.4575879976918638, "grad_norm": 1.6328125, "learning_rate": 0.00047984013544149286, "loss": 6.2202, "mean_token_accuracy": 0.15574894845485687, "num_tokens": 32007476.0, "step": 12630 }, { "entropy": 6.4281259059906, "epoch": 1.4581650317368724, "grad_norm": 1.4609375, "learning_rate": 0.00047982305978466836, "loss": 6.201, "mean_token_accuracy": 0.16399176120758058, "num_tokens": 32021417.0, "step": 12635 }, { "entropy": 6.320074844360351, "epoch": 1.4587420657818813, "grad_norm": 1.4453125, "learning_rate": 0.00047980597723872205, "loss": 6.1079, "mean_token_accuracy": 0.1619710475206375, "num_tokens": 32033997.0, "step": 12640 }, { "entropy": 6.289112663269043, "epoch": 1.4593190998268897, "grad_norm": 1.4140625, "learning_rate": 0.0004797888878042283, "loss": 6.1041, "mean_token_accuracy": 0.1678844302892685, "num_tokens": 32046797.0, "step": 12645 }, { "entropy": 6.276427221298218, "epoch": 1.4598961338718985, "grad_norm": 2.0, "learning_rate": 0.00047977179148176217, "loss": 6.1286, "mean_token_accuracy": 0.1663985624909401, "num_tokens": 32060797.0, "step": 12650 }, { "entropy": 6.30776014328003, "epoch": 1.4604731679169072, "grad_norm": 1.7890625, "learning_rate": 0.0004797546882718985, "loss": 6.2171, "mean_token_accuracy": 0.15766320675611495, "num_tokens": 32073936.0, "step": 12655 }, { "entropy": 6.3672514915466305, "epoch": 1.4610502019619158, "grad_norm": 2.40625, "learning_rate": 0.00047973757817521256, "loss": 6.0737, "mean_token_accuracy": 0.1655890852212906, "num_tokens": 32086730.0, "step": 12660 }, { "entropy": 6.404605484008789, "epoch": 1.4616272360069245, "grad_norm": 1.296875, "learning_rate": 0.0004797204611922799, "loss": 6.1674, "mean_token_accuracy": 0.16363464891910554, "num_tokens": 32099201.0, "step": 12665 }, { "entropy": 6.250916290283203, "epoch": 1.462204270051933, "grad_norm": 1.4140625, "learning_rate": 0.00047970333732367626, "loss": 6.1245, "mean_token_accuracy": 0.16768237501382827, "num_tokens": 32112475.0, "step": 12670 }, { "entropy": 6.351142501831054, "epoch": 1.4627813040969417, "grad_norm": 2.34375, "learning_rate": 0.00047968620656997754, "loss": 6.1456, "mean_token_accuracy": 0.16002534329891205, "num_tokens": 32124411.0, "step": 12675 }, { "entropy": 6.312311601638794, "epoch": 1.4633583381419504, "grad_norm": 1.25, "learning_rate": 0.00047966906893175994, "loss": 6.1315, "mean_token_accuracy": 0.17081220149993898, "num_tokens": 32136665.0, "step": 12680 }, { "entropy": 6.348316621780396, "epoch": 1.463935372186959, "grad_norm": 2.015625, "learning_rate": 0.0004796519244095998, "loss": 6.1543, "mean_token_accuracy": 0.16716521829366685, "num_tokens": 32149546.0, "step": 12685 }, { "entropy": 6.273695564270019, "epoch": 1.4645124062319677, "grad_norm": 1.390625, "learning_rate": 0.00047963477300407394, "loss": 6.0739, "mean_token_accuracy": 0.16554967164993287, "num_tokens": 32161327.0, "step": 12690 }, { "entropy": 6.307106685638428, "epoch": 1.4650894402769763, "grad_norm": 1.4921875, "learning_rate": 0.00047961761471575903, "loss": 6.0782, "mean_token_accuracy": 0.16557173281908036, "num_tokens": 32173678.0, "step": 12695 }, { "entropy": 6.207534408569336, "epoch": 1.465666474321985, "grad_norm": 1.3359375, "learning_rate": 0.00047960044954523237, "loss": 6.0288, "mean_token_accuracy": 0.1673967197537422, "num_tokens": 32186834.0, "step": 12700 }, { "entropy": 6.304496192932129, "epoch": 1.4662435083669936, "grad_norm": 1.6640625, "learning_rate": 0.00047958327749307117, "loss": 6.1396, "mean_token_accuracy": 0.17024445086717604, "num_tokens": 32198876.0, "step": 12705 }, { "entropy": 6.291701412200927, "epoch": 1.4668205424120022, "grad_norm": 1.5625, "learning_rate": 0.00047956609855985305, "loss": 6.0548, "mean_token_accuracy": 0.16752492636442184, "num_tokens": 32212190.0, "step": 12710 }, { "entropy": 6.335958576202392, "epoch": 1.467397576457011, "grad_norm": 1.6484375, "learning_rate": 0.0004795489127461559, "loss": 6.1112, "mean_token_accuracy": 0.165318101644516, "num_tokens": 32226129.0, "step": 12715 }, { "entropy": 6.2873485565185545, "epoch": 1.4679746105020195, "grad_norm": 1.265625, "learning_rate": 0.00047953172005255756, "loss": 6.1574, "mean_token_accuracy": 0.15961160510778427, "num_tokens": 32240116.0, "step": 12720 }, { "entropy": 6.333165073394776, "epoch": 1.4685516445470284, "grad_norm": 1.203125, "learning_rate": 0.0004795145204796365, "loss": 6.0513, "mean_token_accuracy": 0.16849917322397232, "num_tokens": 32252781.0, "step": 12725 }, { "entropy": 6.2766618728637695, "epoch": 1.469128678592037, "grad_norm": 1.3203125, "learning_rate": 0.0004794973140279711, "loss": 6.0605, "mean_token_accuracy": 0.17072835117578505, "num_tokens": 32265625.0, "step": 12730 }, { "entropy": 6.324501991271973, "epoch": 1.4697057126370456, "grad_norm": 1.7421875, "learning_rate": 0.00047948010069814005, "loss": 6.1673, "mean_token_accuracy": 0.16713138967752456, "num_tokens": 32278942.0, "step": 12735 }, { "entropy": 6.299522256851196, "epoch": 1.4702827466820543, "grad_norm": 1.1953125, "learning_rate": 0.0004794628804907225, "loss": 6.1279, "mean_token_accuracy": 0.16506323367357253, "num_tokens": 32292085.0, "step": 12740 }, { "entropy": 6.298580837249756, "epoch": 1.470859780727063, "grad_norm": 1.2265625, "learning_rate": 0.00047944565340629755, "loss": 6.1307, "mean_token_accuracy": 0.16882706582546234, "num_tokens": 32303880.0, "step": 12745 }, { "entropy": 6.234088325500489, "epoch": 1.4714368147720716, "grad_norm": 1.6171875, "learning_rate": 0.00047942841944544453, "loss": 6.064, "mean_token_accuracy": 0.17083367854356765, "num_tokens": 32315711.0, "step": 12750 }, { "entropy": 6.344754409790039, "epoch": 1.4720138488170802, "grad_norm": 1.140625, "learning_rate": 0.0004794111786087431, "loss": 6.1696, "mean_token_accuracy": 0.1633049726486206, "num_tokens": 32329344.0, "step": 12755 }, { "entropy": 6.303945016860962, "epoch": 1.4725908828620888, "grad_norm": 4.125, "learning_rate": 0.0004793939308967733, "loss": 6.1848, "mean_token_accuracy": 0.16809794306755066, "num_tokens": 32343335.0, "step": 12760 }, { "entropy": 6.258049535751343, "epoch": 1.4731679169070975, "grad_norm": 6.78125, "learning_rate": 0.0004793766763101152, "loss": 6.0793, "mean_token_accuracy": 0.16625706404447554, "num_tokens": 32357663.0, "step": 12765 }, { "entropy": 6.259440612792969, "epoch": 1.4737449509521061, "grad_norm": 1.46875, "learning_rate": 0.00047935941484934905, "loss": 6.0974, "mean_token_accuracy": 0.1702799528837204, "num_tokens": 32369310.0, "step": 12770 }, { "entropy": 6.247601699829102, "epoch": 1.4743219849971148, "grad_norm": 1.5703125, "learning_rate": 0.00047934214651505547, "loss": 6.1111, "mean_token_accuracy": 0.16637591719627381, "num_tokens": 32381478.0, "step": 12775 }, { "entropy": 6.2855452537536625, "epoch": 1.4748990190421236, "grad_norm": 1.578125, "learning_rate": 0.00047932487130781533, "loss": 6.0526, "mean_token_accuracy": 0.17474593371152877, "num_tokens": 32394697.0, "step": 12780 }, { "entropy": 6.227901601791382, "epoch": 1.475476053087132, "grad_norm": 1.203125, "learning_rate": 0.0004793075892282097, "loss": 5.9675, "mean_token_accuracy": 0.17708137333393098, "num_tokens": 32405456.0, "step": 12785 }, { "entropy": 6.235746669769287, "epoch": 1.476053087132141, "grad_norm": 1.359375, "learning_rate": 0.0004792903002768197, "loss": 6.0669, "mean_token_accuracy": 0.1676441565155983, "num_tokens": 32416772.0, "step": 12790 }, { "entropy": 6.221759462356568, "epoch": 1.4766301211771495, "grad_norm": 2.28125, "learning_rate": 0.00047927300445422687, "loss": 6.0199, "mean_token_accuracy": 0.17797380387783052, "num_tokens": 32429319.0, "step": 12795 }, { "entropy": 6.217854356765747, "epoch": 1.4772071552221582, "grad_norm": 1.765625, "learning_rate": 0.0004792557017610131, "loss": 5.9956, "mean_token_accuracy": 0.18017663508653642, "num_tokens": 32442017.0, "step": 12800 }, { "entropy": 6.242416000366211, "epoch": 1.4777841892671668, "grad_norm": 1.234375, "learning_rate": 0.00047923839219776027, "loss": 6.0055, "mean_token_accuracy": 0.17175121158361434, "num_tokens": 32454255.0, "step": 12805 }, { "entropy": 6.161380672454834, "epoch": 1.4783612233121755, "grad_norm": 1.4296875, "learning_rate": 0.0004792210757650506, "loss": 6.062, "mean_token_accuracy": 0.1737545147538185, "num_tokens": 32465471.0, "step": 12810 }, { "entropy": 6.248135375976562, "epoch": 1.478938257357184, "grad_norm": 1.078125, "learning_rate": 0.00047920375246346636, "loss": 6.1001, "mean_token_accuracy": 0.16704308986663818, "num_tokens": 32478271.0, "step": 12815 }, { "entropy": 6.362189865112304, "epoch": 1.4795152914021927, "grad_norm": 1.453125, "learning_rate": 0.00047918642229359044, "loss": 6.0901, "mean_token_accuracy": 0.16624097675085067, "num_tokens": 32490239.0, "step": 12820 }, { "entropy": 6.296052885055542, "epoch": 1.4800923254472014, "grad_norm": 1.15625, "learning_rate": 0.0004791690852560056, "loss": 6.1359, "mean_token_accuracy": 0.16350751668214797, "num_tokens": 32503511.0, "step": 12825 }, { "entropy": 6.24784746170044, "epoch": 1.48066935949221, "grad_norm": 1.375, "learning_rate": 0.000479151741351295, "loss": 6.1049, "mean_token_accuracy": 0.16343062818050386, "num_tokens": 32515652.0, "step": 12830 }, { "entropy": 6.277792072296142, "epoch": 1.4812463935372187, "grad_norm": 1.453125, "learning_rate": 0.000479134390580042, "loss": 6.1176, "mean_token_accuracy": 0.16031728088855743, "num_tokens": 32527620.0, "step": 12835 }, { "entropy": 6.39299464225769, "epoch": 1.4818234275822273, "grad_norm": 1.4921875, "learning_rate": 0.00047911703294283015, "loss": 6.127, "mean_token_accuracy": 0.16917325854301452, "num_tokens": 32540948.0, "step": 12840 }, { "entropy": 6.256704425811767, "epoch": 1.482400461627236, "grad_norm": 1.453125, "learning_rate": 0.00047909966844024334, "loss": 6.1118, "mean_token_accuracy": 0.1677668496966362, "num_tokens": 32553311.0, "step": 12845 }, { "entropy": 6.193738842010498, "epoch": 1.4829774956722446, "grad_norm": 1.140625, "learning_rate": 0.00047908229707286547, "loss": 5.9834, "mean_token_accuracy": 0.17342813462018966, "num_tokens": 32564639.0, "step": 12850 }, { "entropy": 6.245530033111573, "epoch": 1.4835545297172534, "grad_norm": 1.4375, "learning_rate": 0.000479064918841281, "loss": 6.1341, "mean_token_accuracy": 0.164619517326355, "num_tokens": 32577255.0, "step": 12855 }, { "entropy": 6.2433384418487545, "epoch": 1.4841315637622619, "grad_norm": 1.3125, "learning_rate": 0.00047904753374607427, "loss": 6.0864, "mean_token_accuracy": 0.16741010099649428, "num_tokens": 32590201.0, "step": 12860 }, { "entropy": 6.279276657104492, "epoch": 1.4847085978072707, "grad_norm": 1.15625, "learning_rate": 0.00047903014178783015, "loss": 6.0701, "mean_token_accuracy": 0.16273524165153502, "num_tokens": 32603010.0, "step": 12865 }, { "entropy": 6.354335880279541, "epoch": 1.4852856318522794, "grad_norm": 1.3125, "learning_rate": 0.0004790127429671335, "loss": 6.0863, "mean_token_accuracy": 0.1656494528055191, "num_tokens": 32614579.0, "step": 12870 }, { "entropy": 6.246316576004029, "epoch": 1.485862665897288, "grad_norm": 1.1484375, "learning_rate": 0.0004789953372845697, "loss": 6.064, "mean_token_accuracy": 0.1642582133412361, "num_tokens": 32627696.0, "step": 12875 }, { "entropy": 6.24684886932373, "epoch": 1.4864396999422966, "grad_norm": 1.375, "learning_rate": 0.000478977924740724, "loss": 6.171, "mean_token_accuracy": 0.15860685259103774, "num_tokens": 32640824.0, "step": 12880 }, { "entropy": 6.320673418045044, "epoch": 1.4870167339873053, "grad_norm": 1.1875, "learning_rate": 0.0004789605053361821, "loss": 6.0864, "mean_token_accuracy": 0.16608539447188378, "num_tokens": 32654373.0, "step": 12885 }, { "entropy": 6.3553577899932865, "epoch": 1.487593768032314, "grad_norm": 1.25, "learning_rate": 0.0004789430790715299, "loss": 6.206, "mean_token_accuracy": 0.1578859195113182, "num_tokens": 32667717.0, "step": 12890 }, { "entropy": 6.260083961486816, "epoch": 1.4881708020773226, "grad_norm": 1.421875, "learning_rate": 0.00047892564594735355, "loss": 6.1414, "mean_token_accuracy": 0.16327641457319259, "num_tokens": 32681529.0, "step": 12895 }, { "entropy": 6.357323503494262, "epoch": 1.4887478361223312, "grad_norm": 0.9921875, "learning_rate": 0.00047890820596423943, "loss": 6.1894, "mean_token_accuracy": 0.16188809275627136, "num_tokens": 32694883.0, "step": 12900 }, { "entropy": 6.320400857925415, "epoch": 1.4893248701673398, "grad_norm": 1.3828125, "learning_rate": 0.000478890759122774, "loss": 6.0706, "mean_token_accuracy": 0.1698184132575989, "num_tokens": 32706908.0, "step": 12905 }, { "entropy": 6.324786186218262, "epoch": 1.4899019042123485, "grad_norm": 1.875, "learning_rate": 0.0004788733054235443, "loss": 6.1161, "mean_token_accuracy": 0.1591644510626793, "num_tokens": 32720057.0, "step": 12910 }, { "entropy": 6.208461332321167, "epoch": 1.4904789382573571, "grad_norm": 1.234375, "learning_rate": 0.00047885584486713717, "loss": 6.0907, "mean_token_accuracy": 0.17133676409721374, "num_tokens": 32732200.0, "step": 12915 }, { "entropy": 6.282963752746582, "epoch": 1.491055972302366, "grad_norm": 1.1796875, "learning_rate": 0.0004788383774541399, "loss": 6.0879, "mean_token_accuracy": 0.16833843439817428, "num_tokens": 32745144.0, "step": 12920 }, { "entropy": 6.295819664001465, "epoch": 1.4916330063473744, "grad_norm": 1.4765625, "learning_rate": 0.0004788209031851402, "loss": 6.122, "mean_token_accuracy": 0.1617732271552086, "num_tokens": 32757495.0, "step": 12925 }, { "entropy": 6.223090553283692, "epoch": 1.4922100403923833, "grad_norm": 1.3359375, "learning_rate": 0.0004788034220607256, "loss": 5.9892, "mean_token_accuracy": 0.1723991960287094, "num_tokens": 32769562.0, "step": 12930 }, { "entropy": 6.260346746444702, "epoch": 1.4927870744373917, "grad_norm": 1.8046875, "learning_rate": 0.00047878593408148405, "loss": 6.0792, "mean_token_accuracy": 0.16787715405225753, "num_tokens": 32782234.0, "step": 12935 }, { "entropy": 6.21394419670105, "epoch": 1.4933641084824005, "grad_norm": 1.3046875, "learning_rate": 0.00047876843924800393, "loss": 6.0872, "mean_token_accuracy": 0.16682145297527312, "num_tokens": 32795274.0, "step": 12940 }, { "entropy": 6.271086740493774, "epoch": 1.4939411425274092, "grad_norm": 1.4765625, "learning_rate": 0.0004787509375608735, "loss": 6.0843, "mean_token_accuracy": 0.15776642337441443, "num_tokens": 32808338.0, "step": 12945 }, { "entropy": 6.294681644439697, "epoch": 1.4945181765724178, "grad_norm": 1.640625, "learning_rate": 0.00047873342902068157, "loss": 6.0906, "mean_token_accuracy": 0.16260672509670257, "num_tokens": 32820204.0, "step": 12950 }, { "entropy": 6.337964868545532, "epoch": 1.4950952106174265, "grad_norm": 1.4140625, "learning_rate": 0.00047871591362801694, "loss": 6.139, "mean_token_accuracy": 0.1639711320400238, "num_tokens": 32832998.0, "step": 12955 }, { "entropy": 6.223607349395752, "epoch": 1.495672244662435, "grad_norm": 1.2109375, "learning_rate": 0.0004786983913834687, "loss": 6.1281, "mean_token_accuracy": 0.16615548431873323, "num_tokens": 32845484.0, "step": 12960 }, { "entropy": 6.414913702011108, "epoch": 1.4962492787074437, "grad_norm": 1.3828125, "learning_rate": 0.00047868086228762633, "loss": 6.1956, "mean_token_accuracy": 0.16196768283843993, "num_tokens": 32857718.0, "step": 12965 }, { "entropy": 6.343223285675049, "epoch": 1.4968263127524524, "grad_norm": 1.6953125, "learning_rate": 0.00047866332634107926, "loss": 6.1177, "mean_token_accuracy": 0.16523806303739547, "num_tokens": 32869908.0, "step": 12970 }, { "entropy": 6.271601438522339, "epoch": 1.497403346797461, "grad_norm": 1.296875, "learning_rate": 0.00047864578354441743, "loss": 6.1172, "mean_token_accuracy": 0.16479604095220565, "num_tokens": 32882549.0, "step": 12975 }, { "entropy": 6.2289995670318605, "epoch": 1.4979803808424696, "grad_norm": 1.1640625, "learning_rate": 0.0004786282338982308, "loss": 6.0305, "mean_token_accuracy": 0.1769894078373909, "num_tokens": 32894587.0, "step": 12980 }, { "entropy": 6.339492082595825, "epoch": 1.4985574148874783, "grad_norm": 1.5703125, "learning_rate": 0.0004786106774031096, "loss": 6.1258, "mean_token_accuracy": 0.16558513790369034, "num_tokens": 32907001.0, "step": 12985 }, { "entropy": 6.32451868057251, "epoch": 1.499134448932487, "grad_norm": 1.3359375, "learning_rate": 0.0004785931140596445, "loss": 6.059, "mean_token_accuracy": 0.167315773665905, "num_tokens": 32919498.0, "step": 12990 }, { "entropy": 6.3400568008422855, "epoch": 1.4997114829774958, "grad_norm": 1.1328125, "learning_rate": 0.00047857554386842606, "loss": 6.1788, "mean_token_accuracy": 0.1587929204106331, "num_tokens": 32932611.0, "step": 12995 }, { "entropy": 6.306359529495239, "epoch": 1.5002885170225042, "grad_norm": 2.0, "learning_rate": 0.00047855796683004534, "loss": 6.0872, "mean_token_accuracy": 0.16214493662118912, "num_tokens": 32944845.0, "step": 13000 }, { "entropy": 6.368089056015014, "epoch": 1.500865551067513, "grad_norm": 1.484375, "learning_rate": 0.00047854038294509356, "loss": 6.1238, "mean_token_accuracy": 0.1523377075791359, "num_tokens": 32958076.0, "step": 13005 }, { "entropy": 6.357781219482422, "epoch": 1.5014425851125215, "grad_norm": 1.4921875, "learning_rate": 0.0004785227922141621, "loss": 6.0859, "mean_token_accuracy": 0.1753346249461174, "num_tokens": 32968984.0, "step": 13010 }, { "entropy": 6.359879016876221, "epoch": 1.5020196191575304, "grad_norm": 1.078125, "learning_rate": 0.00047850519463784263, "loss": 6.228, "mean_token_accuracy": 0.1593037635087967, "num_tokens": 32981488.0, "step": 13015 }, { "entropy": 6.3068126201629635, "epoch": 1.502596653202539, "grad_norm": 1.46875, "learning_rate": 0.00047848759021672693, "loss": 6.1443, "mean_token_accuracy": 0.16349516659975052, "num_tokens": 32994156.0, "step": 13020 }, { "entropy": 6.335974407196045, "epoch": 1.5031736872475476, "grad_norm": 1.4296875, "learning_rate": 0.0004784699789514073, "loss": 6.0814, "mean_token_accuracy": 0.16241802722215654, "num_tokens": 33007135.0, "step": 13025 }, { "entropy": 6.35773777961731, "epoch": 1.5037507212925563, "grad_norm": 2.0625, "learning_rate": 0.000478452360842476, "loss": 6.1742, "mean_token_accuracy": 0.15925257354974748, "num_tokens": 33021259.0, "step": 13030 }, { "entropy": 6.268192148208618, "epoch": 1.504327755337565, "grad_norm": 1.3671875, "learning_rate": 0.00047843473589052557, "loss": 6.1114, "mean_token_accuracy": 0.16721211671829223, "num_tokens": 33033690.0, "step": 13035 }, { "entropy": 6.382220840454101, "epoch": 1.5049047893825735, "grad_norm": 1.3359375, "learning_rate": 0.00047841710409614893, "loss": 6.1256, "mean_token_accuracy": 0.16039337813854218, "num_tokens": 33045744.0, "step": 13040 }, { "entropy": 6.359376525878906, "epoch": 1.5054818234275822, "grad_norm": 1.7890625, "learning_rate": 0.0004783994654599389, "loss": 6.1675, "mean_token_accuracy": 0.15905430912971497, "num_tokens": 33058307.0, "step": 13045 }, { "entropy": 6.391716718673706, "epoch": 1.5060588574725908, "grad_norm": 1.71875, "learning_rate": 0.00047838181998248897, "loss": 6.2093, "mean_token_accuracy": 0.15556481406092643, "num_tokens": 33073622.0, "step": 13050 }, { "entropy": 6.295185232162476, "epoch": 1.5066358915175995, "grad_norm": 1.7421875, "learning_rate": 0.0004783641676643925, "loss": 6.0359, "mean_token_accuracy": 0.16836757212877274, "num_tokens": 33087286.0, "step": 13055 }, { "entropy": 6.236673784255982, "epoch": 1.5072129255626083, "grad_norm": 1.484375, "learning_rate": 0.00047834650850624334, "loss": 6.109, "mean_token_accuracy": 0.1679818168282509, "num_tokens": 33100333.0, "step": 13060 }, { "entropy": 6.2044658184051515, "epoch": 1.5077899596076167, "grad_norm": 1.265625, "learning_rate": 0.0004783288425086353, "loss": 6.1113, "mean_token_accuracy": 0.1649872049689293, "num_tokens": 33111318.0, "step": 13065 }, { "entropy": 6.406934833526611, "epoch": 1.5083669936526256, "grad_norm": 1.953125, "learning_rate": 0.0004783111696721627, "loss": 6.1825, "mean_token_accuracy": 0.16137512922286987, "num_tokens": 33123766.0, "step": 13070 }, { "entropy": 6.325654792785644, "epoch": 1.508944027697634, "grad_norm": 1.734375, "learning_rate": 0.0004782934899974199, "loss": 6.0832, "mean_token_accuracy": 0.17172017246484755, "num_tokens": 33136042.0, "step": 13075 }, { "entropy": 6.260492467880249, "epoch": 1.5095210617426429, "grad_norm": 1.453125, "learning_rate": 0.00047827580348500147, "loss": 6.0174, "mean_token_accuracy": 0.17097728699445724, "num_tokens": 33148451.0, "step": 13080 }, { "entropy": 6.268058347702026, "epoch": 1.5100980957876513, "grad_norm": 1.5859375, "learning_rate": 0.00047825811013550246, "loss": 6.0869, "mean_token_accuracy": 0.1745191514492035, "num_tokens": 33161886.0, "step": 13085 }, { "entropy": 6.308102035522461, "epoch": 1.5106751298326602, "grad_norm": 1.6328125, "learning_rate": 0.00047824040994951786, "loss": 6.1993, "mean_token_accuracy": 0.16559694707393646, "num_tokens": 33174812.0, "step": 13090 }, { "entropy": 6.3163261890411375, "epoch": 1.5112521638776688, "grad_norm": 1.4609375, "learning_rate": 0.0004782227029276429, "loss": 6.1028, "mean_token_accuracy": 0.17115537822246552, "num_tokens": 33187389.0, "step": 13095 }, { "entropy": 6.218478345870972, "epoch": 1.5118291979226774, "grad_norm": 1.5, "learning_rate": 0.00047820498907047345, "loss": 6.0571, "mean_token_accuracy": 0.16387352347373962, "num_tokens": 33200106.0, "step": 13100 }, { "entropy": 6.287623453140259, "epoch": 1.512406231967686, "grad_norm": 3.109375, "learning_rate": 0.000478187268378605, "loss": 6.081, "mean_token_accuracy": 0.16405822485685348, "num_tokens": 33212929.0, "step": 13105 }, { "entropy": 6.3526145935058596, "epoch": 1.5129832660126947, "grad_norm": 1.3515625, "learning_rate": 0.00047816954085263375, "loss": 6.1577, "mean_token_accuracy": 0.1622457042336464, "num_tokens": 33226068.0, "step": 13110 }, { "entropy": 6.265248584747314, "epoch": 1.5135603000577034, "grad_norm": 1.3828125, "learning_rate": 0.0004781518064931559, "loss": 6.0269, "mean_token_accuracy": 0.16928547471761704, "num_tokens": 33237677.0, "step": 13115 }, { "entropy": 6.333219432830811, "epoch": 1.514137334102712, "grad_norm": 1.4453125, "learning_rate": 0.000478134065300768, "loss": 6.1473, "mean_token_accuracy": 0.16705526113510133, "num_tokens": 33250640.0, "step": 13120 }, { "entropy": 6.280381155014038, "epoch": 1.5147143681477209, "grad_norm": 2.125, "learning_rate": 0.0004781163172760667, "loss": 6.0739, "mean_token_accuracy": 0.17093583345413207, "num_tokens": 33262899.0, "step": 13125 }, { "entropy": 6.378185701370239, "epoch": 1.5152914021927293, "grad_norm": 1.1640625, "learning_rate": 0.00047809856241964893, "loss": 6.08, "mean_token_accuracy": 0.16901710629463196, "num_tokens": 33275073.0, "step": 13130 }, { "entropy": 6.205471515655518, "epoch": 1.5158684362377381, "grad_norm": 1.21875, "learning_rate": 0.0004780808007321119, "loss": 6.0516, "mean_token_accuracy": 0.16522097885608672, "num_tokens": 33286285.0, "step": 13135 }, { "entropy": 6.32527985572815, "epoch": 1.5164454702827466, "grad_norm": 1.2421875, "learning_rate": 0.0004780630322140531, "loss": 6.049, "mean_token_accuracy": 0.1732782319188118, "num_tokens": 33297745.0, "step": 13140 }, { "entropy": 6.356187438964843, "epoch": 1.5170225043277554, "grad_norm": 1.234375, "learning_rate": 0.00047804525686607, "loss": 6.1214, "mean_token_accuracy": 0.15876830518245696, "num_tokens": 33309463.0, "step": 13145 }, { "entropy": 6.308989381790161, "epoch": 1.5175995383727638, "grad_norm": 1.6015625, "learning_rate": 0.0004780274746887606, "loss": 6.147, "mean_token_accuracy": 0.15899598598480225, "num_tokens": 33322352.0, "step": 13150 }, { "entropy": 6.343785285949707, "epoch": 1.5181765724177727, "grad_norm": 1.3359375, "learning_rate": 0.00047800968568272284, "loss": 6.1776, "mean_token_accuracy": 0.16358117014169693, "num_tokens": 33336051.0, "step": 13155 }, { "entropy": 6.3434113502502445, "epoch": 1.5187536064627813, "grad_norm": 1.1640625, "learning_rate": 0.0004779918898485551, "loss": 6.1022, "mean_token_accuracy": 0.16069099232554435, "num_tokens": 33350321.0, "step": 13160 }, { "entropy": 6.337099504470825, "epoch": 1.51933064050779, "grad_norm": 1.65625, "learning_rate": 0.00047797408718685614, "loss": 6.0725, "mean_token_accuracy": 0.16448751240968704, "num_tokens": 33363637.0, "step": 13165 }, { "entropy": 6.224223947525024, "epoch": 1.5199076745527986, "grad_norm": 1.1171875, "learning_rate": 0.00047795627769822447, "loss": 6.0496, "mean_token_accuracy": 0.17334780991077423, "num_tokens": 33376257.0, "step": 13170 }, { "entropy": 6.165194988250732, "epoch": 1.5204847085978073, "grad_norm": 1.7421875, "learning_rate": 0.00047793846138325925, "loss": 6.0099, "mean_token_accuracy": 0.1717988818883896, "num_tokens": 33388812.0, "step": 13175 }, { "entropy": 6.248253870010376, "epoch": 1.521061742642816, "grad_norm": 1.0625, "learning_rate": 0.0004779206382425598, "loss": 6.1, "mean_token_accuracy": 0.1664251208305359, "num_tokens": 33401141.0, "step": 13180 }, { "entropy": 6.297205305099487, "epoch": 1.5216387766878245, "grad_norm": 1.40625, "learning_rate": 0.0004779028082767253, "loss": 6.0997, "mean_token_accuracy": 0.16420046240091324, "num_tokens": 33412821.0, "step": 13185 }, { "entropy": 6.258190584182739, "epoch": 1.5222158107328332, "grad_norm": 1.234375, "learning_rate": 0.0004778849714863557, "loss": 6.1259, "mean_token_accuracy": 0.1637619987130165, "num_tokens": 33424709.0, "step": 13190 }, { "entropy": 6.308904504776001, "epoch": 1.5227928447778418, "grad_norm": 1.2265625, "learning_rate": 0.0004778671278720508, "loss": 6.1683, "mean_token_accuracy": 0.1601940304040909, "num_tokens": 33437069.0, "step": 13195 }, { "entropy": 6.263119840621949, "epoch": 1.5233698788228507, "grad_norm": 1.2578125, "learning_rate": 0.0004778492774344109, "loss": 5.978, "mean_token_accuracy": 0.1729772388935089, "num_tokens": 33449441.0, "step": 13200 }, { "entropy": 6.2551123142242435, "epoch": 1.523946912867859, "grad_norm": 1.390625, "learning_rate": 0.0004778314201740363, "loss": 6.1833, "mean_token_accuracy": 0.15870602279901505, "num_tokens": 33463184.0, "step": 13205 }, { "entropy": 6.308429145812989, "epoch": 1.524523946912868, "grad_norm": 1.1484375, "learning_rate": 0.00047781355609152764, "loss": 6.0285, "mean_token_accuracy": 0.17487031370401382, "num_tokens": 33476118.0, "step": 13210 }, { "entropy": 6.277584075927734, "epoch": 1.5251009809578764, "grad_norm": 1.40625, "learning_rate": 0.0004777956851874858, "loss": 6.0615, "mean_token_accuracy": 0.16608939617872237, "num_tokens": 33487575.0, "step": 13215 }, { "entropy": 6.237762451171875, "epoch": 1.5256780150028852, "grad_norm": 1.28125, "learning_rate": 0.00047777780746251176, "loss": 6.1003, "mean_token_accuracy": 0.1641905725002289, "num_tokens": 33499507.0, "step": 13220 }, { "entropy": 6.2443382263183596, "epoch": 1.5262550490478937, "grad_norm": 1.53125, "learning_rate": 0.00047775992291720687, "loss": 6.083, "mean_token_accuracy": 0.16951340883970262, "num_tokens": 33513818.0, "step": 13225 }, { "entropy": 6.284352970123291, "epoch": 1.5268320830929025, "grad_norm": 1.3359375, "learning_rate": 0.0004777420315521728, "loss": 6.0771, "mean_token_accuracy": 0.16708099693059922, "num_tokens": 33525762.0, "step": 13230 }, { "entropy": 6.191858911514283, "epoch": 1.5274091171379112, "grad_norm": 1.078125, "learning_rate": 0.0004777241333680111, "loss": 5.9738, "mean_token_accuracy": 0.1767125442624092, "num_tokens": 33537469.0, "step": 13235 }, { "entropy": 6.221562433242798, "epoch": 1.5279861511829198, "grad_norm": 2.328125, "learning_rate": 0.0004777062283653239, "loss": 6.0999, "mean_token_accuracy": 0.17175007611513138, "num_tokens": 33550226.0, "step": 13240 }, { "entropy": 6.314879369735718, "epoch": 1.5285631852279284, "grad_norm": 2.515625, "learning_rate": 0.00047768831654471333, "loss": 6.1739, "mean_token_accuracy": 0.16319517195224761, "num_tokens": 33564164.0, "step": 13245 }, { "entropy": 6.277708244323731, "epoch": 1.529140219272937, "grad_norm": 1.25, "learning_rate": 0.00047767039790678204, "loss": 5.9983, "mean_token_accuracy": 0.16776868253946303, "num_tokens": 33576295.0, "step": 13250 }, { "entropy": 6.210209226608276, "epoch": 1.5297172533179457, "grad_norm": 1.3671875, "learning_rate": 0.00047765247245213255, "loss": 6.055, "mean_token_accuracy": 0.17595264613628386, "num_tokens": 33587950.0, "step": 13255 }, { "entropy": 6.216668558120728, "epoch": 1.5302942873629544, "grad_norm": 1.171875, "learning_rate": 0.0004776345401813678, "loss": 6.0519, "mean_token_accuracy": 0.17725253403186797, "num_tokens": 33600201.0, "step": 13260 }, { "entropy": 6.2638702392578125, "epoch": 1.5308713214079632, "grad_norm": 1.0625, "learning_rate": 0.00047761660109509095, "loss": 6.1106, "mean_token_accuracy": 0.1715979754924774, "num_tokens": 33612355.0, "step": 13265 }, { "entropy": 6.342147922515869, "epoch": 1.5314483554529716, "grad_norm": 1.390625, "learning_rate": 0.0004775986551939054, "loss": 6.1352, "mean_token_accuracy": 0.16366921961307526, "num_tokens": 33626322.0, "step": 13270 }, { "entropy": 6.246899604797363, "epoch": 1.5320253894979805, "grad_norm": 1.25, "learning_rate": 0.00047758070247841465, "loss": 6.0532, "mean_token_accuracy": 0.16893962174654006, "num_tokens": 33638433.0, "step": 13275 }, { "entropy": 6.2625486850738525, "epoch": 1.532602423542989, "grad_norm": 1.1953125, "learning_rate": 0.00047756274294922266, "loss": 6.0969, "mean_token_accuracy": 0.1695482537150383, "num_tokens": 33651743.0, "step": 13280 }, { "entropy": 6.351377201080322, "epoch": 1.5331794575879978, "grad_norm": 1.5234375, "learning_rate": 0.0004775447766069334, "loss": 6.1451, "mean_token_accuracy": 0.1712990552186966, "num_tokens": 33663546.0, "step": 13285 }, { "entropy": 6.283286142349243, "epoch": 1.5337564916330062, "grad_norm": 1.4765625, "learning_rate": 0.00047752680345215115, "loss": 6.101, "mean_token_accuracy": 0.16872385144233704, "num_tokens": 33675358.0, "step": 13290 }, { "entropy": 6.26472840309143, "epoch": 1.534333525678015, "grad_norm": 1.7890625, "learning_rate": 0.0004775088234854805, "loss": 6.0767, "mean_token_accuracy": 0.16253549009561538, "num_tokens": 33688066.0, "step": 13295 }, { "entropy": 6.2303605556488035, "epoch": 1.5349105597230237, "grad_norm": 1.296875, "learning_rate": 0.0004774908367075262, "loss": 6.087, "mean_token_accuracy": 0.17206478714942933, "num_tokens": 33700829.0, "step": 13300 }, { "entropy": 6.2332827091217045, "epoch": 1.5354875937680323, "grad_norm": 1.2890625, "learning_rate": 0.0004774728431188931, "loss": 6.0588, "mean_token_accuracy": 0.1641959458589554, "num_tokens": 33714049.0, "step": 13305 }, { "entropy": 6.240980577468872, "epoch": 1.536064627813041, "grad_norm": 1.28125, "learning_rate": 0.00047745484272018664, "loss": 6.0188, "mean_token_accuracy": 0.17436153143644334, "num_tokens": 33727026.0, "step": 13310 }, { "entropy": 6.289119005203247, "epoch": 1.5366416618580496, "grad_norm": 1.5390625, "learning_rate": 0.0004774368355120119, "loss": 6.057, "mean_token_accuracy": 0.17154422402381897, "num_tokens": 33740400.0, "step": 13315 }, { "entropy": 6.1061982154846195, "epoch": 1.5372186959030583, "grad_norm": 1.1171875, "learning_rate": 0.000477418821494975, "loss": 5.8766, "mean_token_accuracy": 0.1809625193476677, "num_tokens": 33753621.0, "step": 13320 }, { "entropy": 6.258587503433228, "epoch": 1.537795729948067, "grad_norm": 1.140625, "learning_rate": 0.0004774008006696814, "loss": 6.1166, "mean_token_accuracy": 0.1636723607778549, "num_tokens": 33765458.0, "step": 13325 }, { "entropy": 6.32735013961792, "epoch": 1.5383727639930755, "grad_norm": 2.90625, "learning_rate": 0.0004773827730367375, "loss": 6.144, "mean_token_accuracy": 0.16260947287082672, "num_tokens": 33777264.0, "step": 13330 }, { "entropy": 6.311409664154053, "epoch": 1.5389497980380842, "grad_norm": 1.6171875, "learning_rate": 0.00047736473859674955, "loss": 6.0977, "mean_token_accuracy": 0.17010506838560105, "num_tokens": 33789837.0, "step": 13335 }, { "entropy": 6.123340892791748, "epoch": 1.539526832083093, "grad_norm": 1.109375, "learning_rate": 0.00047734669735032404, "loss": 5.9457, "mean_token_accuracy": 0.17906959354877472, "num_tokens": 33801666.0, "step": 13340 }, { "entropy": 6.2019556045532225, "epoch": 1.5401038661281015, "grad_norm": 1.453125, "learning_rate": 0.00047732864929806796, "loss": 6.0901, "mean_token_accuracy": 0.1611937940120697, "num_tokens": 33813909.0, "step": 13345 }, { "entropy": 6.256455135345459, "epoch": 1.5406809001731103, "grad_norm": 1.078125, "learning_rate": 0.0004773105944405883, "loss": 6.0876, "mean_token_accuracy": 0.17180472016334533, "num_tokens": 33827081.0, "step": 13350 }, { "entropy": 6.224641418457031, "epoch": 1.5412579342181187, "grad_norm": 1.2578125, "learning_rate": 0.00047729253277849226, "loss": 6.0217, "mean_token_accuracy": 0.17465359568595887, "num_tokens": 33838261.0, "step": 13355 }, { "entropy": 6.285533332824707, "epoch": 1.5418349682631276, "grad_norm": 1.3828125, "learning_rate": 0.00047727446431238734, "loss": 6.1732, "mean_token_accuracy": 0.16222093552350997, "num_tokens": 33850189.0, "step": 13360 }, { "entropy": 6.394769525527954, "epoch": 1.542412002308136, "grad_norm": 1.4140625, "learning_rate": 0.0004772563890428813, "loss": 6.1958, "mean_token_accuracy": 0.16250339150428772, "num_tokens": 33863570.0, "step": 13365 }, { "entropy": 6.269595718383789, "epoch": 1.5429890363531449, "grad_norm": 1.28125, "learning_rate": 0.0004772383069705821, "loss": 6.1162, "mean_token_accuracy": 0.1639903500676155, "num_tokens": 33876583.0, "step": 13370 }, { "entropy": 6.305620288848877, "epoch": 1.5435660703981535, "grad_norm": 1.109375, "learning_rate": 0.0004772202180960978, "loss": 6.1124, "mean_token_accuracy": 0.16432901620864868, "num_tokens": 33889744.0, "step": 13375 }, { "entropy": 6.382720422744751, "epoch": 1.5441431044431622, "grad_norm": 1.7734375, "learning_rate": 0.00047720212242003703, "loss": 6.1648, "mean_token_accuracy": 0.16586382687091827, "num_tokens": 33904129.0, "step": 13380 }, { "entropy": 6.2075355052948, "epoch": 1.5447201384881708, "grad_norm": 1.25, "learning_rate": 0.00047718401994300825, "loss": 6.0131, "mean_token_accuracy": 0.173862124979496, "num_tokens": 33916277.0, "step": 13385 }, { "entropy": 6.262147378921509, "epoch": 1.5452971725331794, "grad_norm": 1.3203125, "learning_rate": 0.00047716591066562043, "loss": 6.1458, "mean_token_accuracy": 0.167170250415802, "num_tokens": 33929434.0, "step": 13390 }, { "entropy": 6.284850931167602, "epoch": 1.545874206578188, "grad_norm": 1.375, "learning_rate": 0.00047714779458848255, "loss": 6.1036, "mean_token_accuracy": 0.16530850380659104, "num_tokens": 33942376.0, "step": 13395 }, { "entropy": 6.329345703125, "epoch": 1.5464512406231967, "grad_norm": 1.28125, "learning_rate": 0.0004771296717122041, "loss": 6.1289, "mean_token_accuracy": 0.16672763228416443, "num_tokens": 33955013.0, "step": 13400 }, { "entropy": 6.318344497680664, "epoch": 1.5470282746682056, "grad_norm": 1.515625, "learning_rate": 0.0004771115420373945, "loss": 6.1355, "mean_token_accuracy": 0.1615862876176834, "num_tokens": 33966673.0, "step": 13405 }, { "entropy": 6.227231454849243, "epoch": 1.547605308713214, "grad_norm": 1.5859375, "learning_rate": 0.00047709340556466366, "loss": 6.0523, "mean_token_accuracy": 0.1722373753786087, "num_tokens": 33978400.0, "step": 13410 }, { "entropy": 6.331748580932617, "epoch": 1.5481823427582229, "grad_norm": 1.171875, "learning_rate": 0.00047707526229462144, "loss": 6.1714, "mean_token_accuracy": 0.1605384096503258, "num_tokens": 33990690.0, "step": 13415 }, { "entropy": 6.308060550689698, "epoch": 1.5487593768032313, "grad_norm": 1.234375, "learning_rate": 0.00047705711222787816, "loss": 6.0964, "mean_token_accuracy": 0.16687259823083878, "num_tokens": 34003992.0, "step": 13420 }, { "entropy": 6.286748695373535, "epoch": 1.5493364108482401, "grad_norm": 1.2421875, "learning_rate": 0.00047703895536504423, "loss": 6.0837, "mean_token_accuracy": 0.1681692436337471, "num_tokens": 34016075.0, "step": 13425 }, { "entropy": 6.280511522293091, "epoch": 1.5499134448932486, "grad_norm": 1.3984375, "learning_rate": 0.0004770207917067305, "loss": 6.0552, "mean_token_accuracy": 0.16778141260147095, "num_tokens": 34029143.0, "step": 13430 }, { "entropy": 6.256841468811035, "epoch": 1.5504904789382574, "grad_norm": 1.2734375, "learning_rate": 0.00047700262125354765, "loss": 6.1263, "mean_token_accuracy": 0.17276279330253602, "num_tokens": 34041269.0, "step": 13435 }, { "entropy": 6.292127561569214, "epoch": 1.551067512983266, "grad_norm": 1.3515625, "learning_rate": 0.00047698444400610707, "loss": 6.1481, "mean_token_accuracy": 0.16719116121530533, "num_tokens": 34054561.0, "step": 13440 }, { "entropy": 6.344380474090576, "epoch": 1.5516445470282747, "grad_norm": 1.5390625, "learning_rate": 0.00047696625996502, "loss": 6.0748, "mean_token_accuracy": 0.1604306936264038, "num_tokens": 34068009.0, "step": 13445 }, { "entropy": 6.280494642257691, "epoch": 1.5522215810732833, "grad_norm": 1.3828125, "learning_rate": 0.00047694806913089815, "loss": 6.1908, "mean_token_accuracy": 0.16584864556789397, "num_tokens": 34081217.0, "step": 13450 }, { "entropy": 6.321868991851806, "epoch": 1.552798615118292, "grad_norm": 1.421875, "learning_rate": 0.0004769298715043533, "loss": 6.1148, "mean_token_accuracy": 0.1603361338376999, "num_tokens": 34093903.0, "step": 13455 }, { "entropy": 6.34748387336731, "epoch": 1.5533756491633006, "grad_norm": 1.078125, "learning_rate": 0.0004769116670859975, "loss": 6.1551, "mean_token_accuracy": 0.16427400708198547, "num_tokens": 34105891.0, "step": 13460 }, { "entropy": 6.295809173583985, "epoch": 1.5539526832083093, "grad_norm": 1.25, "learning_rate": 0.00047689345587644314, "loss": 6.1441, "mean_token_accuracy": 0.16782208383083344, "num_tokens": 34118438.0, "step": 13465 }, { "entropy": 6.269343376159668, "epoch": 1.554529717253318, "grad_norm": 1.359375, "learning_rate": 0.00047687523787630256, "loss": 6.0041, "mean_token_accuracy": 0.17534742504358292, "num_tokens": 34130383.0, "step": 13470 }, { "entropy": 6.214257144927979, "epoch": 1.5551067512983265, "grad_norm": 1.15625, "learning_rate": 0.0004768570130861887, "loss": 6.1249, "mean_token_accuracy": 0.16669410318136216, "num_tokens": 34143805.0, "step": 13475 }, { "entropy": 6.295845174789429, "epoch": 1.5556837853433354, "grad_norm": 1.5703125, "learning_rate": 0.0004768387815067144, "loss": 6.0329, "mean_token_accuracy": 0.1684045284986496, "num_tokens": 34157053.0, "step": 13480 }, { "entropy": 6.367346620559692, "epoch": 1.5562608193883438, "grad_norm": 1.46875, "learning_rate": 0.00047682054313849304, "loss": 6.1567, "mean_token_accuracy": 0.16520717442035676, "num_tokens": 34168804.0, "step": 13485 }, { "entropy": 6.327089548110962, "epoch": 1.5568378534333527, "grad_norm": 1.28125, "learning_rate": 0.0004768022979821379, "loss": 6.142, "mean_token_accuracy": 0.16089055836200714, "num_tokens": 34181201.0, "step": 13490 }, { "entropy": 6.327263450622558, "epoch": 1.557414887478361, "grad_norm": 1.625, "learning_rate": 0.0004767840460382628, "loss": 6.1518, "mean_token_accuracy": 0.16688635051250458, "num_tokens": 34193906.0, "step": 13495 }, { "entropy": 6.298494577407837, "epoch": 1.55799192152337, "grad_norm": 1.5625, "learning_rate": 0.0004767657873074815, "loss": 6.148, "mean_token_accuracy": 0.16546330600976944, "num_tokens": 34207462.0, "step": 13500 }, { "entropy": 6.263404703140258, "epoch": 1.5585689555683784, "grad_norm": 1.5234375, "learning_rate": 0.0004767475217904081, "loss": 6.0006, "mean_token_accuracy": 0.1721050813794136, "num_tokens": 34219696.0, "step": 13505 }, { "entropy": 6.25515718460083, "epoch": 1.5591459896133872, "grad_norm": 2.828125, "learning_rate": 0.00047672924948765705, "loss": 6.0677, "mean_token_accuracy": 0.17219026386737823, "num_tokens": 34232413.0, "step": 13510 }, { "entropy": 6.330908012390137, "epoch": 1.5597230236583959, "grad_norm": 1.609375, "learning_rate": 0.00047671097039984293, "loss": 6.1494, "mean_token_accuracy": 0.16325631588697434, "num_tokens": 34245150.0, "step": 13515 }, { "entropy": 6.307193422317505, "epoch": 1.5603000577034045, "grad_norm": 1.171875, "learning_rate": 0.00047669268452758053, "loss": 6.0021, "mean_token_accuracy": 0.1737485185265541, "num_tokens": 34257416.0, "step": 13520 }, { "entropy": 6.241674613952637, "epoch": 1.5608770917484132, "grad_norm": 3.03125, "learning_rate": 0.00047667439187148476, "loss": 6.0485, "mean_token_accuracy": 0.17202006727457048, "num_tokens": 34269518.0, "step": 13525 }, { "entropy": 6.244004392623902, "epoch": 1.5614541257934218, "grad_norm": 2.1875, "learning_rate": 0.0004766560924321711, "loss": 6.0468, "mean_token_accuracy": 0.1732081651687622, "num_tokens": 34280965.0, "step": 13530 }, { "entropy": 6.3121312141418455, "epoch": 1.5620311598384304, "grad_norm": 1.328125, "learning_rate": 0.00047663778621025496, "loss": 6.1132, "mean_token_accuracy": 0.16684572100639344, "num_tokens": 34294051.0, "step": 13535 }, { "entropy": 6.288514518737793, "epoch": 1.562608193883439, "grad_norm": 1.7578125, "learning_rate": 0.0004766194732063519, "loss": 6.1479, "mean_token_accuracy": 0.15813490897417068, "num_tokens": 34308052.0, "step": 13540 }, { "entropy": 6.302996253967285, "epoch": 1.563185227928448, "grad_norm": 2.859375, "learning_rate": 0.00047660115342107814, "loss": 6.1005, "mean_token_accuracy": 0.16520090252161027, "num_tokens": 34321802.0, "step": 13545 }, { "entropy": 6.25574312210083, "epoch": 1.5637622619734564, "grad_norm": 1.515625, "learning_rate": 0.00047658282685504973, "loss": 6.0311, "mean_token_accuracy": 0.17565805912017823, "num_tokens": 34334789.0, "step": 13550 }, { "entropy": 6.323505210876465, "epoch": 1.5643392960184652, "grad_norm": 1.28125, "learning_rate": 0.000476564493508883, "loss": 6.0697, "mean_token_accuracy": 0.1631614997982979, "num_tokens": 34347167.0, "step": 13555 }, { "entropy": 6.392896747589111, "epoch": 1.5649163300634736, "grad_norm": 1.171875, "learning_rate": 0.00047654615338319466, "loss": 6.2075, "mean_token_accuracy": 0.15777474641799927, "num_tokens": 34360468.0, "step": 13560 }, { "entropy": 6.371495723724365, "epoch": 1.5654933641084825, "grad_norm": 1.6484375, "learning_rate": 0.0004765278064786016, "loss": 6.1411, "mean_token_accuracy": 0.16007252633571625, "num_tokens": 34373835.0, "step": 13565 }, { "entropy": 6.312303352355957, "epoch": 1.566070398153491, "grad_norm": 1.7734375, "learning_rate": 0.00047650945279572085, "loss": 6.1172, "mean_token_accuracy": 0.16909689903259278, "num_tokens": 34385591.0, "step": 13570 }, { "entropy": 6.34000563621521, "epoch": 1.5666474321984998, "grad_norm": 1.3125, "learning_rate": 0.0004764910923351698, "loss": 6.1949, "mean_token_accuracy": 0.15573060512542725, "num_tokens": 34398980.0, "step": 13575 }, { "entropy": 6.33928861618042, "epoch": 1.5672244662435084, "grad_norm": 1.2578125, "learning_rate": 0.00047647272509756584, "loss": 6.1339, "mean_token_accuracy": 0.1675115406513214, "num_tokens": 34412274.0, "step": 13580 }, { "entropy": 6.297660255432129, "epoch": 1.567801500288517, "grad_norm": 1.078125, "learning_rate": 0.0004764543510835269, "loss": 6.0849, "mean_token_accuracy": 0.1719527691602707, "num_tokens": 34425043.0, "step": 13585 }, { "entropy": 6.312202835083008, "epoch": 1.5683785343335257, "grad_norm": 1.2734375, "learning_rate": 0.000476435970293671, "loss": 6.154, "mean_token_accuracy": 0.16889333426952363, "num_tokens": 34437022.0, "step": 13590 }, { "entropy": 6.268210458755493, "epoch": 1.5689555683785343, "grad_norm": 4.0625, "learning_rate": 0.00047641758272861626, "loss": 5.9941, "mean_token_accuracy": 0.17029512375593187, "num_tokens": 34449668.0, "step": 13595 }, { "entropy": 6.270573329925537, "epoch": 1.569532602423543, "grad_norm": 1.2890625, "learning_rate": 0.0004763991883889811, "loss": 6.0436, "mean_token_accuracy": 0.16294163167476655, "num_tokens": 34461588.0, "step": 13600 }, { "entropy": 6.220047664642334, "epoch": 1.5701096364685516, "grad_norm": 1.4609375, "learning_rate": 0.0004763807872753843, "loss": 6.0681, "mean_token_accuracy": 0.16750042587518693, "num_tokens": 34474696.0, "step": 13605 }, { "entropy": 6.280921459197998, "epoch": 1.5706866705135603, "grad_norm": 1.5703125, "learning_rate": 0.00047636237938844484, "loss": 6.1026, "mean_token_accuracy": 0.16470820903778077, "num_tokens": 34488477.0, "step": 13610 }, { "entropy": 6.263820552825928, "epoch": 1.571263704558569, "grad_norm": 1.6015625, "learning_rate": 0.0004763439647287817, "loss": 6.0493, "mean_token_accuracy": 0.16895479708909988, "num_tokens": 34502159.0, "step": 13615 }, { "entropy": 6.248439455032349, "epoch": 1.5718407386035778, "grad_norm": 1.6171875, "learning_rate": 0.0004763255432970144, "loss": 6.0714, "mean_token_accuracy": 0.1683644562959671, "num_tokens": 34516247.0, "step": 13620 }, { "entropy": 6.161786127090454, "epoch": 1.5724177726485862, "grad_norm": 1.515625, "learning_rate": 0.00047630711509376235, "loss": 5.9466, "mean_token_accuracy": 0.17339649200439453, "num_tokens": 34528599.0, "step": 13625 }, { "entropy": 6.315026569366455, "epoch": 1.572994806693595, "grad_norm": 1.40625, "learning_rate": 0.0004762886801196455, "loss": 6.1762, "mean_token_accuracy": 0.15327844619750977, "num_tokens": 34541346.0, "step": 13630 }, { "entropy": 6.389235925674439, "epoch": 1.5735718407386035, "grad_norm": 1.671875, "learning_rate": 0.00047627023837528386, "loss": 6.1017, "mean_token_accuracy": 0.16337597817182542, "num_tokens": 34553934.0, "step": 13635 }, { "entropy": 6.329330778121948, "epoch": 1.5741488747836123, "grad_norm": 1.2890625, "learning_rate": 0.00047625178986129775, "loss": 6.1503, "mean_token_accuracy": 0.1708940386772156, "num_tokens": 34565739.0, "step": 13640 }, { "entropy": 6.214039516448975, "epoch": 1.5747259088286207, "grad_norm": 2.484375, "learning_rate": 0.0004762333345783078, "loss": 6.0717, "mean_token_accuracy": 0.17032964378595353, "num_tokens": 34579062.0, "step": 13645 }, { "entropy": 6.2890371799469, "epoch": 1.5753029428736296, "grad_norm": 1.3671875, "learning_rate": 0.00047621487252693436, "loss": 6.109, "mean_token_accuracy": 0.17146503627300264, "num_tokens": 34592090.0, "step": 13650 }, { "entropy": 6.215422916412353, "epoch": 1.5758799769186382, "grad_norm": 1.59375, "learning_rate": 0.00047619640370779876, "loss": 5.9818, "mean_token_accuracy": 0.16550679504871368, "num_tokens": 34604626.0, "step": 13655 }, { "entropy": 6.333647632598877, "epoch": 1.5764570109636469, "grad_norm": 1.5625, "learning_rate": 0.00047617792812152207, "loss": 6.1318, "mean_token_accuracy": 0.1639261156320572, "num_tokens": 34617174.0, "step": 13660 }, { "entropy": 6.230650806427002, "epoch": 1.5770340450086555, "grad_norm": 1.6484375, "learning_rate": 0.0004761594457687256, "loss": 5.9971, "mean_token_accuracy": 0.17324588149785997, "num_tokens": 34629909.0, "step": 13665 }, { "entropy": 6.257308387756348, "epoch": 1.5776110790536642, "grad_norm": 2.015625, "learning_rate": 0.0004761409566500313, "loss": 6.0872, "mean_token_accuracy": 0.17212423384189607, "num_tokens": 34643640.0, "step": 13670 }, { "entropy": 6.281475162506103, "epoch": 1.5781881130986728, "grad_norm": 1.3203125, "learning_rate": 0.00047612246076606066, "loss": 6.0142, "mean_token_accuracy": 0.1610131159424782, "num_tokens": 34655250.0, "step": 13675 }, { "entropy": 6.323982858657837, "epoch": 1.5787651471436814, "grad_norm": 1.515625, "learning_rate": 0.00047610395811743594, "loss": 6.0816, "mean_token_accuracy": 0.16235461086034775, "num_tokens": 34669318.0, "step": 13680 }, { "entropy": 6.237914276123047, "epoch": 1.5793421811886903, "grad_norm": 1.171875, "learning_rate": 0.00047608544870477956, "loss": 6.0607, "mean_token_accuracy": 0.1697299838066101, "num_tokens": 34680932.0, "step": 13685 }, { "entropy": 6.323851537704468, "epoch": 1.5799192152336987, "grad_norm": 1.875, "learning_rate": 0.00047606693252871395, "loss": 6.1738, "mean_token_accuracy": 0.16352701634168626, "num_tokens": 34693091.0, "step": 13690 }, { "entropy": 6.353163433074951, "epoch": 1.5804962492787076, "grad_norm": 1.328125, "learning_rate": 0.000476048409589862, "loss": 6.1665, "mean_token_accuracy": 0.16994237452745437, "num_tokens": 34706645.0, "step": 13695 }, { "entropy": 6.312082672119141, "epoch": 1.581073283323716, "grad_norm": 1.3046875, "learning_rate": 0.0004760298798888466, "loss": 6.1502, "mean_token_accuracy": 0.16166957914829255, "num_tokens": 34718974.0, "step": 13700 }, { "entropy": 6.258579730987549, "epoch": 1.5816503173687249, "grad_norm": 1.6484375, "learning_rate": 0.0004760113434262911, "loss": 6.1283, "mean_token_accuracy": 0.1639259859919548, "num_tokens": 34732424.0, "step": 13705 }, { "entropy": 6.27340145111084, "epoch": 1.5822273514137333, "grad_norm": 1.125, "learning_rate": 0.00047599280020281894, "loss": 6.0145, "mean_token_accuracy": 0.17224159985780715, "num_tokens": 34743865.0, "step": 13710 }, { "entropy": 6.236146402359009, "epoch": 1.5828043854587421, "grad_norm": 1.2109375, "learning_rate": 0.00047597425021905364, "loss": 5.9892, "mean_token_accuracy": 0.1733963370323181, "num_tokens": 34756415.0, "step": 13715 }, { "entropy": 6.32954421043396, "epoch": 1.5833814195037508, "grad_norm": 1.4765625, "learning_rate": 0.0004759556934756194, "loss": 6.1399, "mean_token_accuracy": 0.1598810486495495, "num_tokens": 34769666.0, "step": 13720 }, { "entropy": 6.132478141784668, "epoch": 1.5839584535487594, "grad_norm": 1.4140625, "learning_rate": 0.00047593712997314017, "loss": 5.9454, "mean_token_accuracy": 0.18104538768529893, "num_tokens": 34781523.0, "step": 13725 }, { "entropy": 6.255754470825195, "epoch": 1.584535487593768, "grad_norm": 1.0234375, "learning_rate": 0.00047591855971224035, "loss": 6.0319, "mean_token_accuracy": 0.16793281435966492, "num_tokens": 34794597.0, "step": 13730 }, { "entropy": 6.303833389282227, "epoch": 1.5851125216387767, "grad_norm": 1.3828125, "learning_rate": 0.0004758999826935446, "loss": 6.1652, "mean_token_accuracy": 0.1641547754406929, "num_tokens": 34807791.0, "step": 13735 }, { "entropy": 6.454448127746582, "epoch": 1.5856895556837853, "grad_norm": 1.8203125, "learning_rate": 0.0004758813989176778, "loss": 6.1679, "mean_token_accuracy": 0.16815381050109862, "num_tokens": 34821456.0, "step": 13740 }, { "entropy": 6.289196872711182, "epoch": 1.586266589728794, "grad_norm": 1.3046875, "learning_rate": 0.00047586280838526483, "loss": 6.0683, "mean_token_accuracy": 0.17699868679046632, "num_tokens": 34834786.0, "step": 13745 }, { "entropy": 6.2721411228179935, "epoch": 1.5868436237738026, "grad_norm": 1.3203125, "learning_rate": 0.0004758442110969312, "loss": 6.0719, "mean_token_accuracy": 0.16389156579971315, "num_tokens": 34846125.0, "step": 13750 }, { "entropy": 6.36556601524353, "epoch": 1.5874206578188113, "grad_norm": 1.1875, "learning_rate": 0.0004758256070533022, "loss": 6.1379, "mean_token_accuracy": 0.1652582183480263, "num_tokens": 34858438.0, "step": 13755 }, { "entropy": 6.269256162643432, "epoch": 1.5879976918638201, "grad_norm": 1.5078125, "learning_rate": 0.0004758069962550037, "loss": 6.1417, "mean_token_accuracy": 0.16086930483579637, "num_tokens": 34871340.0, "step": 13760 }, { "entropy": 6.320274209976196, "epoch": 1.5885747259088285, "grad_norm": 1.4921875, "learning_rate": 0.00047578837870266156, "loss": 6.0939, "mean_token_accuracy": 0.16528169810771942, "num_tokens": 34882111.0, "step": 13765 }, { "entropy": 6.327654838562012, "epoch": 1.5891517599538374, "grad_norm": 1.1640625, "learning_rate": 0.00047576975439690206, "loss": 6.1363, "mean_token_accuracy": 0.16278501451015473, "num_tokens": 34895539.0, "step": 13770 }, { "entropy": 6.314521789550781, "epoch": 1.5897287939988458, "grad_norm": 1.3515625, "learning_rate": 0.00047575112333835164, "loss": 6.075, "mean_token_accuracy": 0.16338768899440764, "num_tokens": 34907860.0, "step": 13775 }, { "entropy": 6.347145318984985, "epoch": 1.5903058280438547, "grad_norm": 1.1796875, "learning_rate": 0.00047573248552763684, "loss": 6.1797, "mean_token_accuracy": 0.16526250541210175, "num_tokens": 34920595.0, "step": 13780 }, { "entropy": 6.345773601531983, "epoch": 1.590882862088863, "grad_norm": 1.2734375, "learning_rate": 0.00047571384096538474, "loss": 6.1018, "mean_token_accuracy": 0.16914000362157822, "num_tokens": 34933458.0, "step": 13785 }, { "entropy": 6.261147594451904, "epoch": 1.591459896133872, "grad_norm": 1.3984375, "learning_rate": 0.0004756951896522222, "loss": 6.0385, "mean_token_accuracy": 0.17352436035871505, "num_tokens": 34946872.0, "step": 13790 }, { "entropy": 6.304848003387451, "epoch": 1.5920369301788806, "grad_norm": 3.375, "learning_rate": 0.0004756765315887766, "loss": 6.1094, "mean_token_accuracy": 0.16546263694763183, "num_tokens": 34959384.0, "step": 13795 }, { "entropy": 6.362481641769409, "epoch": 1.5926139642238892, "grad_norm": 1.28125, "learning_rate": 0.0004756578667756756, "loss": 6.129, "mean_token_accuracy": 0.16471261978149415, "num_tokens": 34971571.0, "step": 13800 }, { "entropy": 6.298099565505981, "epoch": 1.5931909982688979, "grad_norm": 1.5703125, "learning_rate": 0.0004756391952135469, "loss": 6.062, "mean_token_accuracy": 0.17933578938245773, "num_tokens": 34984897.0, "step": 13805 }, { "entropy": 6.322285318374634, "epoch": 1.5937680323139065, "grad_norm": 1.6484375, "learning_rate": 0.00047562051690301855, "loss": 6.138, "mean_token_accuracy": 0.1619904324412346, "num_tokens": 34998185.0, "step": 13810 }, { "entropy": 6.395644950866699, "epoch": 1.5943450663589152, "grad_norm": 1.6875, "learning_rate": 0.00047560183184471873, "loss": 6.0972, "mean_token_accuracy": 0.1668487012386322, "num_tokens": 35010985.0, "step": 13815 }, { "entropy": 6.311239624023438, "epoch": 1.5949221004039238, "grad_norm": 1.234375, "learning_rate": 0.000475583140039276, "loss": 6.1207, "mean_token_accuracy": 0.16769470274448395, "num_tokens": 35023785.0, "step": 13820 }, { "entropy": 6.369430828094482, "epoch": 1.5954991344489324, "grad_norm": 1.21875, "learning_rate": 0.00047556444148731897, "loss": 6.1613, "mean_token_accuracy": 0.15731503814458847, "num_tokens": 35035926.0, "step": 13825 }, { "entropy": 6.3039085388183596, "epoch": 1.596076168493941, "grad_norm": 1.421875, "learning_rate": 0.0004755457361894766, "loss": 6.1064, "mean_token_accuracy": 0.16659609824419022, "num_tokens": 35048290.0, "step": 13830 }, { "entropy": 6.290177297592163, "epoch": 1.59665320253895, "grad_norm": 1.3515625, "learning_rate": 0.00047552702414637793, "loss": 6.0144, "mean_token_accuracy": 0.17391386926174163, "num_tokens": 35059883.0, "step": 13835 }, { "entropy": 6.334092044830323, "epoch": 1.5972302365839584, "grad_norm": 1.421875, "learning_rate": 0.00047550830535865245, "loss": 6.1131, "mean_token_accuracy": 0.16483326703310014, "num_tokens": 35071747.0, "step": 13840 }, { "entropy": 6.252234888076782, "epoch": 1.5978072706289672, "grad_norm": 1.4765625, "learning_rate": 0.00047548957982692974, "loss": 6.132, "mean_token_accuracy": 0.16601303368806838, "num_tokens": 35083774.0, "step": 13845 }, { "entropy": 6.295589828491211, "epoch": 1.5983843046739756, "grad_norm": 2.109375, "learning_rate": 0.0004754708475518396, "loss": 6.0616, "mean_token_accuracy": 0.17326804846525193, "num_tokens": 35095757.0, "step": 13850 }, { "entropy": 6.31047887802124, "epoch": 1.5989613387189845, "grad_norm": 1.6015625, "learning_rate": 0.00047545210853401214, "loss": 6.0967, "mean_token_accuracy": 0.16631067395210267, "num_tokens": 35108788.0, "step": 13855 }, { "entropy": 6.352183723449707, "epoch": 1.599538372763993, "grad_norm": 1.1796875, "learning_rate": 0.00047543336277407753, "loss": 6.2169, "mean_token_accuracy": 0.16050542891025543, "num_tokens": 35121641.0, "step": 13860 }, { "entropy": 6.352316522598267, "epoch": 1.6001154068090018, "grad_norm": 1.4296875, "learning_rate": 0.00047541461027266624, "loss": 6.1502, "mean_token_accuracy": 0.16059670001268386, "num_tokens": 35133960.0, "step": 13865 }, { "entropy": 6.363188743591309, "epoch": 1.6006924408540104, "grad_norm": 1.2890625, "learning_rate": 0.0004753958510304091, "loss": 6.1361, "mean_token_accuracy": 0.1658671870827675, "num_tokens": 35146027.0, "step": 13870 }, { "entropy": 6.350321197509766, "epoch": 1.601269474899019, "grad_norm": 1.8125, "learning_rate": 0.00047537708504793714, "loss": 6.1071, "mean_token_accuracy": 0.16653528958559036, "num_tokens": 35158728.0, "step": 13875 }, { "entropy": 6.2908519268035885, "epoch": 1.6018465089440277, "grad_norm": 1.5703125, "learning_rate": 0.00047535831232588146, "loss": 6.1269, "mean_token_accuracy": 0.16270237565040588, "num_tokens": 35171734.0, "step": 13880 }, { "entropy": 6.360332727432251, "epoch": 1.6024235429890363, "grad_norm": 1.6640625, "learning_rate": 0.00047533953286487345, "loss": 6.1369, "mean_token_accuracy": 0.15890816748142242, "num_tokens": 35185074.0, "step": 13885 }, { "entropy": 6.3325221061706545, "epoch": 1.603000577034045, "grad_norm": 1.3125, "learning_rate": 0.0004753207466655447, "loss": 6.1518, "mean_token_accuracy": 0.16376099586486817, "num_tokens": 35197972.0, "step": 13890 }, { "entropy": 6.334444665908814, "epoch": 1.6035776110790536, "grad_norm": 1.3828125, "learning_rate": 0.0004753019537285273, "loss": 6.0818, "mean_token_accuracy": 0.1678009122610092, "num_tokens": 35210939.0, "step": 13895 }, { "entropy": 6.386923742294312, "epoch": 1.6041546451240625, "grad_norm": 1.25, "learning_rate": 0.00047528315405445296, "loss": 6.1734, "mean_token_accuracy": 0.16232287734746934, "num_tokens": 35223521.0, "step": 13900 }, { "entropy": 6.303661584854126, "epoch": 1.604731679169071, "grad_norm": 2.203125, "learning_rate": 0.00047526434764395435, "loss": 6.1578, "mean_token_accuracy": 0.16882762908935547, "num_tokens": 35235713.0, "step": 13905 }, { "entropy": 6.249205541610718, "epoch": 1.6053087132140798, "grad_norm": 1.2890625, "learning_rate": 0.00047524553449766386, "loss": 6.1123, "mean_token_accuracy": 0.16625256538391114, "num_tokens": 35248938.0, "step": 13910 }, { "entropy": 6.343287229537964, "epoch": 1.6058857472590882, "grad_norm": 1.25, "learning_rate": 0.00047522671461621433, "loss": 6.1235, "mean_token_accuracy": 0.16260135173797607, "num_tokens": 35260916.0, "step": 13915 }, { "entropy": 6.35877799987793, "epoch": 1.606462781304097, "grad_norm": 1.6875, "learning_rate": 0.0004752078880002386, "loss": 6.0874, "mean_token_accuracy": 0.16499348878860473, "num_tokens": 35273529.0, "step": 13920 }, { "entropy": 6.319088792800903, "epoch": 1.6070398153491054, "grad_norm": 1.296875, "learning_rate": 0.00047518905465037005, "loss": 6.0514, "mean_token_accuracy": 0.16407953053712845, "num_tokens": 35285500.0, "step": 13925 }, { "entropy": 6.29489312171936, "epoch": 1.6076168493941143, "grad_norm": 1.2890625, "learning_rate": 0.00047517021456724214, "loss": 6.1082, "mean_token_accuracy": 0.1632474958896637, "num_tokens": 35300039.0, "step": 13930 }, { "entropy": 6.309400177001953, "epoch": 1.608193883439123, "grad_norm": 1.1953125, "learning_rate": 0.00047515136775148843, "loss": 6.1973, "mean_token_accuracy": 0.15550429224967957, "num_tokens": 35313091.0, "step": 13935 }, { "entropy": 6.329781770706177, "epoch": 1.6087709174841316, "grad_norm": 1.3828125, "learning_rate": 0.0004751325142037429, "loss": 6.1284, "mean_token_accuracy": 0.16518935412168503, "num_tokens": 35325890.0, "step": 13940 }, { "entropy": 6.278371334075928, "epoch": 1.6093479515291402, "grad_norm": 1.453125, "learning_rate": 0.00047511365392463974, "loss": 6.0337, "mean_token_accuracy": 0.17123775631189347, "num_tokens": 35339395.0, "step": 13945 }, { "entropy": 6.252002334594726, "epoch": 1.6099249855741489, "grad_norm": 1.5078125, "learning_rate": 0.00047509478691481317, "loss": 6.0848, "mean_token_accuracy": 0.16890290081501008, "num_tokens": 35351163.0, "step": 13950 }, { "entropy": 6.394436597824097, "epoch": 1.6105020196191575, "grad_norm": 2.6875, "learning_rate": 0.00047507591317489783, "loss": 6.1041, "mean_token_accuracy": 0.1712552562355995, "num_tokens": 35364099.0, "step": 13955 }, { "entropy": 6.3305333137512205, "epoch": 1.6110790536641661, "grad_norm": 1.4296875, "learning_rate": 0.0004750570327055286, "loss": 6.1306, "mean_token_accuracy": 0.1640000745654106, "num_tokens": 35376768.0, "step": 13960 }, { "entropy": 6.344961166381836, "epoch": 1.6116560877091748, "grad_norm": 1.1484375, "learning_rate": 0.00047503814550734034, "loss": 6.1351, "mean_token_accuracy": 0.1643372043967247, "num_tokens": 35388892.0, "step": 13965 }, { "entropy": 6.371452808380127, "epoch": 1.6122331217541834, "grad_norm": 1.9140625, "learning_rate": 0.0004750192515809685, "loss": 6.1855, "mean_token_accuracy": 0.16151557713747025, "num_tokens": 35401573.0, "step": 13970 }, { "entropy": 6.332014751434326, "epoch": 1.6128101557991923, "grad_norm": 1.40625, "learning_rate": 0.00047500035092704843, "loss": 6.0987, "mean_token_accuracy": 0.16190767139196396, "num_tokens": 35415073.0, "step": 13975 }, { "entropy": 6.248025035858154, "epoch": 1.6133871898442007, "grad_norm": 1.7421875, "learning_rate": 0.0004749814435462159, "loss": 6.0687, "mean_token_accuracy": 0.1728854924440384, "num_tokens": 35428756.0, "step": 13980 }, { "entropy": 6.308794832229614, "epoch": 1.6139642238892096, "grad_norm": 1.3046875, "learning_rate": 0.0004749625294391069, "loss": 6.062, "mean_token_accuracy": 0.16338517218828202, "num_tokens": 35440387.0, "step": 13985 }, { "entropy": 6.26749005317688, "epoch": 1.614541257934218, "grad_norm": 1.2265625, "learning_rate": 0.00047494360860635755, "loss": 5.9829, "mean_token_accuracy": 0.18377355188131334, "num_tokens": 35454105.0, "step": 13990 }, { "entropy": 6.304738330841064, "epoch": 1.6151182919792268, "grad_norm": 1.484375, "learning_rate": 0.0004749246810486042, "loss": 6.1322, "mean_token_accuracy": 0.16615962982177734, "num_tokens": 35467775.0, "step": 13995 }, { "entropy": 6.271231174468994, "epoch": 1.6156953260242353, "grad_norm": 1.9140625, "learning_rate": 0.0004749057467664836, "loss": 6.1092, "mean_token_accuracy": 0.16965964138507844, "num_tokens": 35479217.0, "step": 14000 }, { "entropy": 6.302905178070068, "epoch": 1.6162723600692441, "grad_norm": 1.1875, "learning_rate": 0.00047488680576063247, "loss": 6.076, "mean_token_accuracy": 0.1761475294828415, "num_tokens": 35490676.0, "step": 14005 }, { "entropy": 6.224405097961426, "epoch": 1.6168493941142528, "grad_norm": 1.390625, "learning_rate": 0.0004748678580316878, "loss": 6.0433, "mean_token_accuracy": 0.16903021633625032, "num_tokens": 35503440.0, "step": 14010 }, { "entropy": 6.247961568832397, "epoch": 1.6174264281592614, "grad_norm": 1.1640625, "learning_rate": 0.00047484890358028714, "loss": 6.0403, "mean_token_accuracy": 0.1722070872783661, "num_tokens": 35515717.0, "step": 14015 }, { "entropy": 6.377208995819092, "epoch": 1.61800346220427, "grad_norm": 1.625, "learning_rate": 0.0004748299424070678, "loss": 6.0816, "mean_token_accuracy": 0.16644570976495743, "num_tokens": 35528445.0, "step": 14020 }, { "entropy": 6.203998327255249, "epoch": 1.6185804962492787, "grad_norm": 1.484375, "learning_rate": 0.0004748109745126677, "loss": 5.976, "mean_token_accuracy": 0.17228845208883287, "num_tokens": 35541652.0, "step": 14025 }, { "entropy": 6.157395648956299, "epoch": 1.6191575302942873, "grad_norm": 1.1875, "learning_rate": 0.00047479199989772464, "loss": 6.0205, "mean_token_accuracy": 0.1703417792916298, "num_tokens": 35555310.0, "step": 14030 }, { "entropy": 6.334373998641968, "epoch": 1.619734564339296, "grad_norm": 1.40625, "learning_rate": 0.000474773018562877, "loss": 6.0952, "mean_token_accuracy": 0.16538431942462922, "num_tokens": 35567830.0, "step": 14035 }, { "entropy": 6.271333789825439, "epoch": 1.6203115983843048, "grad_norm": 1.328125, "learning_rate": 0.00047475403050876297, "loss": 6.0555, "mean_token_accuracy": 0.16785277426242828, "num_tokens": 35579054.0, "step": 14040 }, { "entropy": 6.363547706604004, "epoch": 1.6208886324293132, "grad_norm": 1.6484375, "learning_rate": 0.0004747350357360214, "loss": 6.1628, "mean_token_accuracy": 0.16527276188135148, "num_tokens": 35592463.0, "step": 14045 }, { "entropy": 6.34897894859314, "epoch": 1.621465666474322, "grad_norm": 1.265625, "learning_rate": 0.0004747160342452912, "loss": 6.1284, "mean_token_accuracy": 0.1657451093196869, "num_tokens": 35605127.0, "step": 14050 }, { "entropy": 6.232157468795776, "epoch": 1.6220427005193305, "grad_norm": 1.203125, "learning_rate": 0.00047469702603721134, "loss": 6.0409, "mean_token_accuracy": 0.17249712347984314, "num_tokens": 35617509.0, "step": 14055 }, { "entropy": 6.257739067077637, "epoch": 1.6226197345643394, "grad_norm": 1.1484375, "learning_rate": 0.0004746780111124212, "loss": 6.0855, "mean_token_accuracy": 0.16773395836353303, "num_tokens": 35630788.0, "step": 14060 }, { "entropy": 6.354380941390991, "epoch": 1.6231967686093478, "grad_norm": 1.515625, "learning_rate": 0.00047465898947156033, "loss": 6.1451, "mean_token_accuracy": 0.16356271356344224, "num_tokens": 35643613.0, "step": 14065 }, { "entropy": 6.372706079483033, "epoch": 1.6237738026543567, "grad_norm": 2.53125, "learning_rate": 0.00047463996111526854, "loss": 6.1067, "mean_token_accuracy": 0.1694120690226555, "num_tokens": 35656495.0, "step": 14070 }, { "entropy": 6.3641197681427, "epoch": 1.6243508366993653, "grad_norm": 1.53125, "learning_rate": 0.00047462092604418576, "loss": 6.191, "mean_token_accuracy": 0.1535666763782501, "num_tokens": 35669661.0, "step": 14075 }, { "entropy": 6.269794607162476, "epoch": 1.624927870744374, "grad_norm": 1.2890625, "learning_rate": 0.00047460188425895236, "loss": 6.0978, "mean_token_accuracy": 0.16541868150234224, "num_tokens": 35682675.0, "step": 14080 }, { "entropy": 6.331015968322754, "epoch": 1.6255049047893826, "grad_norm": 1.3125, "learning_rate": 0.00047458283576020874, "loss": 6.1263, "mean_token_accuracy": 0.16866612434387207, "num_tokens": 35694571.0, "step": 14085 }, { "entropy": 6.305769634246826, "epoch": 1.6260819388343912, "grad_norm": 1.65625, "learning_rate": 0.00047456378054859554, "loss": 6.0442, "mean_token_accuracy": 0.1698611244559288, "num_tokens": 35707196.0, "step": 14090 }, { "entropy": 6.2425220012664795, "epoch": 1.6266589728793999, "grad_norm": 1.390625, "learning_rate": 0.00047454471862475375, "loss": 6.0519, "mean_token_accuracy": 0.17151181250810624, "num_tokens": 35719682.0, "step": 14095 }, { "entropy": 6.317946672439575, "epoch": 1.6272360069244085, "grad_norm": 1.1953125, "learning_rate": 0.00047452564998932446, "loss": 6.1473, "mean_token_accuracy": 0.16216070652008058, "num_tokens": 35732595.0, "step": 14100 }, { "entropy": 6.355157709121704, "epoch": 1.6278130409694171, "grad_norm": 1.40625, "learning_rate": 0.000474506574642949, "loss": 6.0666, "mean_token_accuracy": 0.1663676917552948, "num_tokens": 35744611.0, "step": 14105 }, { "entropy": 6.2730059146881105, "epoch": 1.6283900750144258, "grad_norm": 1.6875, "learning_rate": 0.000474487492586269, "loss": 6.0772, "mean_token_accuracy": 0.16661421656608583, "num_tokens": 35757288.0, "step": 14110 }, { "entropy": 6.374433422088623, "epoch": 1.6289671090594346, "grad_norm": 1.3125, "learning_rate": 0.0004744684038199263, "loss": 6.1371, "mean_token_accuracy": 0.16418022513389588, "num_tokens": 35769747.0, "step": 14115 }, { "entropy": 6.3676992893219, "epoch": 1.629544143104443, "grad_norm": 2.28125, "learning_rate": 0.00047444930834456293, "loss": 6.1704, "mean_token_accuracy": 0.16366525143384933, "num_tokens": 35781656.0, "step": 14120 }, { "entropy": 6.329796028137207, "epoch": 1.630121177149452, "grad_norm": 1.5703125, "learning_rate": 0.0004744302061608212, "loss": 6.153, "mean_token_accuracy": 0.16873974055051805, "num_tokens": 35794618.0, "step": 14125 }, { "entropy": 6.369326257705689, "epoch": 1.6306982111944603, "grad_norm": 1.8671875, "learning_rate": 0.00047441109726934345, "loss": 6.0348, "mean_token_accuracy": 0.16814184337854385, "num_tokens": 35807504.0, "step": 14130 }, { "entropy": 6.217661762237549, "epoch": 1.6312752452394692, "grad_norm": 1.34375, "learning_rate": 0.00047439198167077256, "loss": 6.0602, "mean_token_accuracy": 0.17050414085388182, "num_tokens": 35819668.0, "step": 14135 }, { "entropy": 6.300717782974243, "epoch": 1.6318522792844776, "grad_norm": 1.515625, "learning_rate": 0.0004743728593657514, "loss": 6.099, "mean_token_accuracy": 0.17155559360980988, "num_tokens": 35832078.0, "step": 14140 }, { "entropy": 6.3105512142181395, "epoch": 1.6324293133294865, "grad_norm": 1.25, "learning_rate": 0.0004743537303549231, "loss": 5.9889, "mean_token_accuracy": 0.17244088500738144, "num_tokens": 35843580.0, "step": 14145 }, { "entropy": 6.236100673675537, "epoch": 1.6330063473744951, "grad_norm": 1.3359375, "learning_rate": 0.0004743345946389311, "loss": 6.0669, "mean_token_accuracy": 0.17535771280527115, "num_tokens": 35857146.0, "step": 14150 }, { "entropy": 6.253125715255737, "epoch": 1.6335833814195038, "grad_norm": 3.171875, "learning_rate": 0.00047431545221841907, "loss": 6.0763, "mean_token_accuracy": 0.16937452852725982, "num_tokens": 35869374.0, "step": 14155 }, { "entropy": 6.396531057357788, "epoch": 1.6341604154645124, "grad_norm": 1.171875, "learning_rate": 0.00047429630309403086, "loss": 6.1255, "mean_token_accuracy": 0.15818234384059907, "num_tokens": 35881882.0, "step": 14160 }, { "entropy": 6.185387468338012, "epoch": 1.634737449509521, "grad_norm": 1.359375, "learning_rate": 0.00047427714726641044, "loss": 5.9409, "mean_token_accuracy": 0.179660464823246, "num_tokens": 35895512.0, "step": 14165 }, { "entropy": 6.18449034690857, "epoch": 1.6353144835545297, "grad_norm": 2.28125, "learning_rate": 0.00047425798473620215, "loss": 5.9598, "mean_token_accuracy": 0.1764688104391098, "num_tokens": 35908020.0, "step": 14170 }, { "entropy": 6.300310659408569, "epoch": 1.6358915175995383, "grad_norm": 1.3203125, "learning_rate": 0.0004742388155040505, "loss": 6.0202, "mean_token_accuracy": 0.17187013179063798, "num_tokens": 35920261.0, "step": 14175 }, { "entropy": 6.360107517242431, "epoch": 1.6364685516445472, "grad_norm": 1.34375, "learning_rate": 0.00047421963957060026, "loss": 6.1752, "mean_token_accuracy": 0.16400312632322311, "num_tokens": 35932135.0, "step": 14180 }, { "entropy": 6.245635604858398, "epoch": 1.6370455856895556, "grad_norm": 1.40625, "learning_rate": 0.0004742004569364964, "loss": 6.0604, "mean_token_accuracy": 0.16876980662345886, "num_tokens": 35944574.0, "step": 14185 }, { "entropy": 6.269022464752197, "epoch": 1.6376226197345645, "grad_norm": 1.828125, "learning_rate": 0.00047418126760238416, "loss": 6.0579, "mean_token_accuracy": 0.1743795841932297, "num_tokens": 35956877.0, "step": 14190 }, { "entropy": 6.316147232055664, "epoch": 1.6381996537795729, "grad_norm": 1.3125, "learning_rate": 0.00047416207156890887, "loss": 6.1537, "mean_token_accuracy": 0.16733625382184983, "num_tokens": 35968616.0, "step": 14195 }, { "entropy": 6.280966711044312, "epoch": 1.6387766878245817, "grad_norm": 1.390625, "learning_rate": 0.0004741428688367164, "loss": 6.1277, "mean_token_accuracy": 0.16590285897254944, "num_tokens": 35982401.0, "step": 14200 }, { "entropy": 6.303164863586426, "epoch": 1.6393537218695902, "grad_norm": 1.7421875, "learning_rate": 0.00047412365940645225, "loss": 6.0664, "mean_token_accuracy": 0.17370134890079497, "num_tokens": 35994907.0, "step": 14205 }, { "entropy": 6.327745819091797, "epoch": 1.639930755914599, "grad_norm": 2.015625, "learning_rate": 0.00047410444327876286, "loss": 6.0397, "mean_token_accuracy": 0.16742120534181595, "num_tokens": 36007109.0, "step": 14210 }, { "entropy": 6.253001260757446, "epoch": 1.6405077899596077, "grad_norm": 1.46875, "learning_rate": 0.00047408522045429426, "loss": 6.1394, "mean_token_accuracy": 0.16436311453580857, "num_tokens": 36018734.0, "step": 14215 }, { "entropy": 6.322027969360351, "epoch": 1.6410848240046163, "grad_norm": 1.28125, "learning_rate": 0.0004740659909336933, "loss": 6.182, "mean_token_accuracy": 0.16763557493686676, "num_tokens": 36031427.0, "step": 14220 }, { "entropy": 6.3208245754241945, "epoch": 1.641661858049625, "grad_norm": 1.5703125, "learning_rate": 0.00047404675471760655, "loss": 6.0957, "mean_token_accuracy": 0.16826531291007996, "num_tokens": 36044726.0, "step": 14225 }, { "entropy": 6.2171959400177, "epoch": 1.6422388920946336, "grad_norm": 1.7890625, "learning_rate": 0.0004740275118066811, "loss": 6.0971, "mean_token_accuracy": 0.16296851485967637, "num_tokens": 36056882.0, "step": 14230 }, { "entropy": 6.3228593349456785, "epoch": 1.6428159261396422, "grad_norm": 1.7109375, "learning_rate": 0.00047400826220156416, "loss": 6.1013, "mean_token_accuracy": 0.162416909635067, "num_tokens": 36068548.0, "step": 14235 }, { "entropy": 6.356378126144409, "epoch": 1.6433929601846509, "grad_norm": 1.8125, "learning_rate": 0.00047398900590290313, "loss": 6.0699, "mean_token_accuracy": 0.16246748268604277, "num_tokens": 36080652.0, "step": 14240 }, { "entropy": 6.2382556915283205, "epoch": 1.6439699942296595, "grad_norm": 1.2890625, "learning_rate": 0.00047396974291134575, "loss": 6.0953, "mean_token_accuracy": 0.16950343698263168, "num_tokens": 36093372.0, "step": 14245 }, { "entropy": 6.337120532989502, "epoch": 1.6445470282746681, "grad_norm": 1.375, "learning_rate": 0.00047395047322754, "loss": 6.1044, "mean_token_accuracy": 0.17220360785722733, "num_tokens": 36106023.0, "step": 14250 }, { "entropy": 6.349548196792602, "epoch": 1.645124062319677, "grad_norm": 1.796875, "learning_rate": 0.00047393119685213374, "loss": 6.0564, "mean_token_accuracy": 0.1731447085738182, "num_tokens": 36119627.0, "step": 14255 }, { "entropy": 6.130048561096191, "epoch": 1.6457010963646854, "grad_norm": 1.234375, "learning_rate": 0.0004739119137857756, "loss": 5.897, "mean_token_accuracy": 0.1846640169620514, "num_tokens": 36132835.0, "step": 14260 }, { "entropy": 6.287685298919678, "epoch": 1.6462781304096943, "grad_norm": 2.359375, "learning_rate": 0.00047389262402911404, "loss": 6.0702, "mean_token_accuracy": 0.16985928565263747, "num_tokens": 36144234.0, "step": 14265 }, { "entropy": 6.28140811920166, "epoch": 1.6468551644547027, "grad_norm": 1.484375, "learning_rate": 0.00047387332758279784, "loss": 6.0292, "mean_token_accuracy": 0.16954858899116515, "num_tokens": 36158556.0, "step": 14270 }, { "entropy": 6.276857662200928, "epoch": 1.6474321984997116, "grad_norm": 1.7265625, "learning_rate": 0.00047385402444747606, "loss": 6.0968, "mean_token_accuracy": 0.1673444241285324, "num_tokens": 36171698.0, "step": 14275 }, { "entropy": 6.280260753631592, "epoch": 1.64800923254472, "grad_norm": 1.828125, "learning_rate": 0.00047383471462379803, "loss": 6.1143, "mean_token_accuracy": 0.16841488927602768, "num_tokens": 36184649.0, "step": 14280 }, { "entropy": 6.3320068359375, "epoch": 1.6485862665897288, "grad_norm": 1.359375, "learning_rate": 0.000473815398112413, "loss": 6.0247, "mean_token_accuracy": 0.17274200022220612, "num_tokens": 36197127.0, "step": 14285 }, { "entropy": 6.297778749465943, "epoch": 1.6491633006347375, "grad_norm": 1.546875, "learning_rate": 0.0004737960749139708, "loss": 6.064, "mean_token_accuracy": 0.16634163707494737, "num_tokens": 36209471.0, "step": 14290 }, { "entropy": 6.3453363418579105, "epoch": 1.6497403346797461, "grad_norm": 1.25, "learning_rate": 0.0004737767450291215, "loss": 6.1189, "mean_token_accuracy": 0.16584311574697494, "num_tokens": 36221798.0, "step": 14295 }, { "entropy": 6.23340950012207, "epoch": 1.6503173687247548, "grad_norm": 1.21875, "learning_rate": 0.00047375740845851506, "loss": 6.0453, "mean_token_accuracy": 0.16708384156227113, "num_tokens": 36235758.0, "step": 14300 }, { "entropy": 6.240923690795898, "epoch": 1.6508944027697634, "grad_norm": 1.1484375, "learning_rate": 0.0004737380652028019, "loss": 6.0534, "mean_token_accuracy": 0.16766662746667862, "num_tokens": 36248484.0, "step": 14305 }, { "entropy": 6.218803548812867, "epoch": 1.651471436814772, "grad_norm": 1.0859375, "learning_rate": 0.00047371871526263263, "loss": 5.9181, "mean_token_accuracy": 0.18093321323394776, "num_tokens": 36260796.0, "step": 14310 }, { "entropy": 6.229616022109985, "epoch": 1.6520484708597807, "grad_norm": 1.421875, "learning_rate": 0.0004736993586386581, "loss": 6.0716, "mean_token_accuracy": 0.16974446326494216, "num_tokens": 36273617.0, "step": 14315 }, { "entropy": 6.202992248535156, "epoch": 1.6526255049047895, "grad_norm": 1.921875, "learning_rate": 0.00047367999533152934, "loss": 6.0228, "mean_token_accuracy": 0.17423105984926224, "num_tokens": 36286285.0, "step": 14320 }, { "entropy": 6.307953596115112, "epoch": 1.653202538949798, "grad_norm": 2.328125, "learning_rate": 0.00047366062534189756, "loss": 6.1595, "mean_token_accuracy": 0.16763816475868226, "num_tokens": 36298970.0, "step": 14325 }, { "entropy": 6.276805305480957, "epoch": 1.6537795729948068, "grad_norm": 1.375, "learning_rate": 0.00047364124867041446, "loss": 6.0462, "mean_token_accuracy": 0.176275734603405, "num_tokens": 36312684.0, "step": 14330 }, { "entropy": 6.253661394119263, "epoch": 1.6543566070398152, "grad_norm": 1.34375, "learning_rate": 0.00047362186531773156, "loss": 6.1084, "mean_token_accuracy": 0.16896721422672273, "num_tokens": 36326300.0, "step": 14335 }, { "entropy": 6.266036891937256, "epoch": 1.654933641084824, "grad_norm": 1.625, "learning_rate": 0.0004736024752845008, "loss": 6.0062, "mean_token_accuracy": 0.169168621301651, "num_tokens": 36338234.0, "step": 14340 }, { "entropy": 6.282933187484741, "epoch": 1.6555106751298325, "grad_norm": 1.1875, "learning_rate": 0.0004735830785713746, "loss": 6.1184, "mean_token_accuracy": 0.16418775916099548, "num_tokens": 36351032.0, "step": 14345 }, { "entropy": 6.279763555526733, "epoch": 1.6560877091748414, "grad_norm": 1.2265625, "learning_rate": 0.0004735636751790051, "loss": 5.9989, "mean_token_accuracy": 0.1654868558049202, "num_tokens": 36363267.0, "step": 14350 }, { "entropy": 6.2751750469207765, "epoch": 1.65666474321985, "grad_norm": 1.1953125, "learning_rate": 0.000473544265108045, "loss": 6.0844, "mean_token_accuracy": 0.17139649987220765, "num_tokens": 36375628.0, "step": 14355 }, { "entropy": 6.262072467803955, "epoch": 1.6572417772648587, "grad_norm": 1.21875, "learning_rate": 0.00047352484835914716, "loss": 6.12, "mean_token_accuracy": 0.16745211482048034, "num_tokens": 36388161.0, "step": 14360 }, { "entropy": 6.334037446975708, "epoch": 1.6578188113098673, "grad_norm": 1.59375, "learning_rate": 0.0004735054249329647, "loss": 6.082, "mean_token_accuracy": 0.169405734539032, "num_tokens": 36400287.0, "step": 14365 }, { "entropy": 6.40230073928833, "epoch": 1.658395845354876, "grad_norm": 1.6171875, "learning_rate": 0.00047348599483015087, "loss": 6.1608, "mean_token_accuracy": 0.16180269569158554, "num_tokens": 36413896.0, "step": 14370 }, { "entropy": 6.28045129776001, "epoch": 1.6589728793998846, "grad_norm": 1.1328125, "learning_rate": 0.00047346655805135916, "loss": 6.0279, "mean_token_accuracy": 0.17025929540395737, "num_tokens": 36425812.0, "step": 14375 }, { "entropy": 6.212641954421997, "epoch": 1.6595499134448932, "grad_norm": 1.1796875, "learning_rate": 0.0004734471145972434, "loss": 6.0843, "mean_token_accuracy": 0.1649244725704193, "num_tokens": 36438977.0, "step": 14380 }, { "entropy": 6.310390663146973, "epoch": 1.6601269474899019, "grad_norm": 1.390625, "learning_rate": 0.00047342766446845753, "loss": 6.0707, "mean_token_accuracy": 0.1669655993580818, "num_tokens": 36453173.0, "step": 14385 }, { "entropy": 6.309250164031982, "epoch": 1.6607039815349105, "grad_norm": 2.9375, "learning_rate": 0.0004734082076656557, "loss": 6.0591, "mean_token_accuracy": 0.1656690925359726, "num_tokens": 36464977.0, "step": 14390 }, { "entropy": 6.293370246887207, "epoch": 1.6612810155799194, "grad_norm": 1.1328125, "learning_rate": 0.00047338874418949235, "loss": 6.1555, "mean_token_accuracy": 0.16307076811790466, "num_tokens": 36476951.0, "step": 14395 }, { "entropy": 6.3167040824890135, "epoch": 1.6618580496249278, "grad_norm": 1.4609375, "learning_rate": 0.00047336927404062213, "loss": 6.1511, "mean_token_accuracy": 0.16583692729473115, "num_tokens": 36490387.0, "step": 14400 }, { "entropy": 6.362817287445068, "epoch": 1.6624350836699366, "grad_norm": 1.296875, "learning_rate": 0.00047334979721969995, "loss": 6.0889, "mean_token_accuracy": 0.1716933622956276, "num_tokens": 36501958.0, "step": 14405 }, { "entropy": 6.351159572601318, "epoch": 1.663012117714945, "grad_norm": 1.0625, "learning_rate": 0.0004733303137273808, "loss": 6.182, "mean_token_accuracy": 0.16345127671957016, "num_tokens": 36515355.0, "step": 14410 }, { "entropy": 6.361408281326294, "epoch": 1.663589151759954, "grad_norm": 1.2890625, "learning_rate": 0.00047331082356432015, "loss": 6.19, "mean_token_accuracy": 0.16078285574913026, "num_tokens": 36528288.0, "step": 14415 }, { "entropy": 6.388300895690918, "epoch": 1.6641661858049623, "grad_norm": 1.3671875, "learning_rate": 0.0004732913267311734, "loss": 6.17, "mean_token_accuracy": 0.16457592099905013, "num_tokens": 36541577.0, "step": 14420 }, { "entropy": 6.301159620285034, "epoch": 1.6647432198499712, "grad_norm": 1.2265625, "learning_rate": 0.0004732718232285964, "loss": 6.1006, "mean_token_accuracy": 0.1722007229924202, "num_tokens": 36554802.0, "step": 14425 }, { "entropy": 6.259671449661255, "epoch": 1.6653202538949798, "grad_norm": 1.1015625, "learning_rate": 0.00047325231305724507, "loss": 6.0326, "mean_token_accuracy": 0.1640797436237335, "num_tokens": 36567175.0, "step": 14430 }, { "entropy": 6.251500034332276, "epoch": 1.6658972879399885, "grad_norm": 1.1875, "learning_rate": 0.0004732327962177757, "loss": 6.0171, "mean_token_accuracy": 0.18299563825130463, "num_tokens": 36579391.0, "step": 14435 }, { "entropy": 6.341972541809082, "epoch": 1.6664743219849971, "grad_norm": 1.1640625, "learning_rate": 0.0004732132727108447, "loss": 6.1526, "mean_token_accuracy": 0.16472519487142562, "num_tokens": 36592684.0, "step": 14440 }, { "entropy": 6.3064422607421875, "epoch": 1.6670513560300058, "grad_norm": 1.3359375, "learning_rate": 0.00047319374253710874, "loss": 6.1486, "mean_token_accuracy": 0.16581295132637025, "num_tokens": 36604996.0, "step": 14445 }, { "entropy": 6.350444650650024, "epoch": 1.6676283900750144, "grad_norm": 1.15625, "learning_rate": 0.0004731742056972247, "loss": 6.0836, "mean_token_accuracy": 0.16828773766756058, "num_tokens": 36618914.0, "step": 14450 }, { "entropy": 6.259874773025513, "epoch": 1.668205424120023, "grad_norm": 1.8515625, "learning_rate": 0.0004731546621918497, "loss": 6.0123, "mean_token_accuracy": 0.1697782725095749, "num_tokens": 36630527.0, "step": 14455 }, { "entropy": 6.252018451690674, "epoch": 1.668782458165032, "grad_norm": 3.328125, "learning_rate": 0.000473135112021641, "loss": 6.1106, "mean_token_accuracy": 0.16840582937002183, "num_tokens": 36642605.0, "step": 14460 }, { "entropy": 6.2921864032745365, "epoch": 1.6693594922100403, "grad_norm": 1.25, "learning_rate": 0.00047311555518725617, "loss": 6.0538, "mean_token_accuracy": 0.16681113839149475, "num_tokens": 36655075.0, "step": 14465 }, { "entropy": 6.240460395812988, "epoch": 1.6699365262550492, "grad_norm": 1.328125, "learning_rate": 0.00047309599168935323, "loss": 6.0752, "mean_token_accuracy": 0.16931247115135192, "num_tokens": 36667684.0, "step": 14470 }, { "entropy": 6.286182641983032, "epoch": 1.6705135603000576, "grad_norm": 4.625, "learning_rate": 0.00047307642152858993, "loss": 6.0597, "mean_token_accuracy": 0.1699221059679985, "num_tokens": 36679656.0, "step": 14475 }, { "entropy": 6.269905281066895, "epoch": 1.6710905943450665, "grad_norm": 2.21875, "learning_rate": 0.00047305684470562453, "loss": 6.0321, "mean_token_accuracy": 0.1783604308962822, "num_tokens": 36691691.0, "step": 14480 }, { "entropy": 6.258505725860596, "epoch": 1.6716676283900749, "grad_norm": 1.4296875, "learning_rate": 0.0004730372612211156, "loss": 6.077, "mean_token_accuracy": 0.1736406207084656, "num_tokens": 36703615.0, "step": 14485 }, { "entropy": 6.27036304473877, "epoch": 1.6722446624350837, "grad_norm": 1.953125, "learning_rate": 0.00047301767107572174, "loss": 6.076, "mean_token_accuracy": 0.16444099098443984, "num_tokens": 36716299.0, "step": 14490 }, { "entropy": 6.333795166015625, "epoch": 1.6728216964800924, "grad_norm": 1.171875, "learning_rate": 0.0004729980742701018, "loss": 6.0409, "mean_token_accuracy": 0.16901907622814177, "num_tokens": 36727723.0, "step": 14495 }, { "entropy": 6.242728137969971, "epoch": 1.673398730525101, "grad_norm": 1.203125, "learning_rate": 0.0004729784708049151, "loss": 5.9147, "mean_token_accuracy": 0.17809747010469437, "num_tokens": 36740497.0, "step": 14500 }, { "entropy": 6.122395133972168, "epoch": 1.6739757645701097, "grad_norm": 1.546875, "learning_rate": 0.0004729588606808209, "loss": 5.9688, "mean_token_accuracy": 0.1696045443415642, "num_tokens": 36752862.0, "step": 14505 }, { "entropy": 6.329869270324707, "epoch": 1.6745527986151183, "grad_norm": 1.2578125, "learning_rate": 0.00047293924389847864, "loss": 6.0848, "mean_token_accuracy": 0.16898933798074722, "num_tokens": 36765948.0, "step": 14510 }, { "entropy": 6.2872460842132565, "epoch": 1.675129832660127, "grad_norm": 1.2421875, "learning_rate": 0.0004729196204585483, "loss": 6.0588, "mean_token_accuracy": 0.16923158019781112, "num_tokens": 36778768.0, "step": 14515 }, { "entropy": 6.289277219772339, "epoch": 1.6757068667051356, "grad_norm": 2.171875, "learning_rate": 0.00047289999036168983, "loss": 6.1205, "mean_token_accuracy": 0.1675689622759819, "num_tokens": 36790941.0, "step": 14520 }, { "entropy": 6.314367389678955, "epoch": 1.6762839007501442, "grad_norm": 1.8359375, "learning_rate": 0.0004728803536085634, "loss": 6.1636, "mean_token_accuracy": 0.1690709784626961, "num_tokens": 36803984.0, "step": 14525 }, { "entropy": 6.267935705184937, "epoch": 1.6768609347951529, "grad_norm": 1.90625, "learning_rate": 0.00047286071019982974, "loss": 6.0147, "mean_token_accuracy": 0.172528937458992, "num_tokens": 36815079.0, "step": 14530 }, { "entropy": 6.230243587493897, "epoch": 1.6774379688401617, "grad_norm": 1.078125, "learning_rate": 0.00047284106013614926, "loss": 6.0844, "mean_token_accuracy": 0.17123476564884185, "num_tokens": 36828007.0, "step": 14535 }, { "entropy": 6.433234691619873, "epoch": 1.6780150028851701, "grad_norm": 2.53125, "learning_rate": 0.000472821403418183, "loss": 6.2349, "mean_token_accuracy": 0.15828924477100373, "num_tokens": 36841762.0, "step": 14540 }, { "entropy": 6.321075105667115, "epoch": 1.678592036930179, "grad_norm": 1.0625, "learning_rate": 0.0004728017400465921, "loss": 6.0574, "mean_token_accuracy": 0.16850826889276505, "num_tokens": 36854624.0, "step": 14545 }, { "entropy": 6.263060855865478, "epoch": 1.6791690709751874, "grad_norm": 1.390625, "learning_rate": 0.00047278207002203796, "loss": 6.0273, "mean_token_accuracy": 0.1637829512357712, "num_tokens": 36866266.0, "step": 14550 }, { "entropy": 6.309200429916382, "epoch": 1.6797461050201963, "grad_norm": 1.40625, "learning_rate": 0.00047276239334518216, "loss": 6.1123, "mean_token_accuracy": 0.16346139907836915, "num_tokens": 36878813.0, "step": 14555 }, { "entropy": 6.256145763397217, "epoch": 1.6803231390652047, "grad_norm": 1.34375, "learning_rate": 0.00047274271001668646, "loss": 6.0709, "mean_token_accuracy": 0.16486488208174704, "num_tokens": 36891848.0, "step": 14560 }, { "entropy": 6.230090188980102, "epoch": 1.6809001731102136, "grad_norm": 1.859375, "learning_rate": 0.00047272302003721286, "loss": 6.0399, "mean_token_accuracy": 0.17097180038690568, "num_tokens": 36903861.0, "step": 14565 }, { "entropy": 6.310818386077881, "epoch": 1.6814772071552222, "grad_norm": 1.859375, "learning_rate": 0.00047270332340742377, "loss": 6.1226, "mean_token_accuracy": 0.16238213181495667, "num_tokens": 36916849.0, "step": 14570 }, { "entropy": 6.360727548599243, "epoch": 1.6820542412002308, "grad_norm": 1.140625, "learning_rate": 0.00047268362012798157, "loss": 6.1313, "mean_token_accuracy": 0.1568854719400406, "num_tokens": 36929559.0, "step": 14575 }, { "entropy": 6.244599103927612, "epoch": 1.6826312752452395, "grad_norm": 1.6328125, "learning_rate": 0.0004726639101995491, "loss": 5.9974, "mean_token_accuracy": 0.1702466532588005, "num_tokens": 36943958.0, "step": 14580 }, { "entropy": 6.22980580329895, "epoch": 1.6832083092902481, "grad_norm": 1.1796875, "learning_rate": 0.00047264419362278906, "loss": 6.0478, "mean_token_accuracy": 0.1754392057657242, "num_tokens": 36956542.0, "step": 14585 }, { "entropy": 6.289747095108032, "epoch": 1.6837853433352568, "grad_norm": 1.3671875, "learning_rate": 0.00047262447039836484, "loss": 6.0759, "mean_token_accuracy": 0.1649500235915184, "num_tokens": 36968872.0, "step": 14590 }, { "entropy": 6.285870981216431, "epoch": 1.6843623773802654, "grad_norm": 1.453125, "learning_rate": 0.00047260474052693963, "loss": 6.0647, "mean_token_accuracy": 0.1678180992603302, "num_tokens": 36982234.0, "step": 14595 }, { "entropy": 6.246563816070557, "epoch": 1.684939411425274, "grad_norm": 1.265625, "learning_rate": 0.00047258500400917724, "loss": 6.0466, "mean_token_accuracy": 0.16805330067873, "num_tokens": 36994407.0, "step": 14600 }, { "entropy": 6.325880527496338, "epoch": 1.6855164454702827, "grad_norm": 1.1171875, "learning_rate": 0.00047256526084574137, "loss": 6.0776, "mean_token_accuracy": 0.1641208603978157, "num_tokens": 37006147.0, "step": 14605 }, { "entropy": 6.266071701049805, "epoch": 1.6860934795152915, "grad_norm": 1.203125, "learning_rate": 0.00047254551103729597, "loss": 6.0499, "mean_token_accuracy": 0.16772838830947875, "num_tokens": 37018206.0, "step": 14610 }, { "entropy": 6.275664186477661, "epoch": 1.6866705135603, "grad_norm": 2.328125, "learning_rate": 0.0004725257545845055, "loss": 6.1231, "mean_token_accuracy": 0.16369811147451402, "num_tokens": 37030632.0, "step": 14615 }, { "entropy": 6.217998313903808, "epoch": 1.6872475476053088, "grad_norm": 1.0546875, "learning_rate": 0.00047250599148803443, "loss": 5.9618, "mean_token_accuracy": 0.1760655924677849, "num_tokens": 37041700.0, "step": 14620 }, { "entropy": 6.268389558792114, "epoch": 1.6878245816503172, "grad_norm": 1.390625, "learning_rate": 0.00047248622174854746, "loss": 6.0853, "mean_token_accuracy": 0.1739245593547821, "num_tokens": 37054467.0, "step": 14625 }, { "entropy": 6.202273797988892, "epoch": 1.688401615695326, "grad_norm": 1.140625, "learning_rate": 0.0004724664453667094, "loss": 5.9802, "mean_token_accuracy": 0.17177198827266693, "num_tokens": 37066596.0, "step": 14630 }, { "entropy": 6.2765673160552975, "epoch": 1.6889786497403345, "grad_norm": 1.4375, "learning_rate": 0.0004724466623431857, "loss": 6.1071, "mean_token_accuracy": 0.1682032197713852, "num_tokens": 37078812.0, "step": 14635 }, { "entropy": 6.285689496994019, "epoch": 1.6895556837853434, "grad_norm": 1.421875, "learning_rate": 0.0004724268726786415, "loss": 6.1031, "mean_token_accuracy": 0.16566502600908278, "num_tokens": 37090916.0, "step": 14640 }, { "entropy": 6.204647207260132, "epoch": 1.690132717830352, "grad_norm": 1.2265625, "learning_rate": 0.0004724070763737424, "loss": 5.9859, "mean_token_accuracy": 0.1659800134599209, "num_tokens": 37104687.0, "step": 14645 }, { "entropy": 6.312428569793701, "epoch": 1.6907097518753607, "grad_norm": 1.3984375, "learning_rate": 0.0004723872734291545, "loss": 6.1253, "mean_token_accuracy": 0.16727470308542253, "num_tokens": 37117763.0, "step": 14650 }, { "entropy": 6.279324579238891, "epoch": 1.6912867859203693, "grad_norm": 2.0, "learning_rate": 0.00047236746384554364, "loss": 6.0441, "mean_token_accuracy": 0.1683202251791954, "num_tokens": 37130355.0, "step": 14655 }, { "entropy": 6.299044466018676, "epoch": 1.691863819965378, "grad_norm": 3.609375, "learning_rate": 0.0004723476476235762, "loss": 6.0565, "mean_token_accuracy": 0.17116303145885467, "num_tokens": 37142116.0, "step": 14660 }, { "entropy": 6.232453632354736, "epoch": 1.6924408540103866, "grad_norm": 2.125, "learning_rate": 0.0004723278247639186, "loss": 6.023, "mean_token_accuracy": 0.1750013381242752, "num_tokens": 37153841.0, "step": 14665 }, { "entropy": 6.205951595306397, "epoch": 1.6930178880553952, "grad_norm": 1.46875, "learning_rate": 0.0004723079952672377, "loss": 6.0276, "mean_token_accuracy": 0.1719754680991173, "num_tokens": 37165119.0, "step": 14670 }, { "entropy": 6.308799934387207, "epoch": 1.693594922100404, "grad_norm": 1.1796875, "learning_rate": 0.00047228815913420035, "loss": 6.1138, "mean_token_accuracy": 0.16897120028734208, "num_tokens": 37178188.0, "step": 14675 }, { "entropy": 6.232822418212891, "epoch": 1.6941719561454125, "grad_norm": 1.8828125, "learning_rate": 0.0004722683163654738, "loss": 5.9946, "mean_token_accuracy": 0.17685008347034453, "num_tokens": 37190211.0, "step": 14680 }, { "entropy": 6.244020748138428, "epoch": 1.6947489901904214, "grad_norm": 1.3203125, "learning_rate": 0.0004722484669617254, "loss": 5.9841, "mean_token_accuracy": 0.17107994109392166, "num_tokens": 37202408.0, "step": 14685 }, { "entropy": 6.241586112976075, "epoch": 1.6953260242354298, "grad_norm": 1.734375, "learning_rate": 0.00047222861092362277, "loss": 6.097, "mean_token_accuracy": 0.16470692306756973, "num_tokens": 37214393.0, "step": 14690 }, { "entropy": 6.283365488052368, "epoch": 1.6959030582804386, "grad_norm": 1.6484375, "learning_rate": 0.00047220874825183387, "loss": 6.012, "mean_token_accuracy": 0.16655275076627732, "num_tokens": 37227212.0, "step": 14695 }, { "entropy": 6.161387777328491, "epoch": 1.696480092325447, "grad_norm": 1.6796875, "learning_rate": 0.00047218887894702656, "loss": 6.0363, "mean_token_accuracy": 0.1703656107187271, "num_tokens": 37239742.0, "step": 14700 }, { "entropy": 6.316285276412964, "epoch": 1.697057126370456, "grad_norm": 1.1484375, "learning_rate": 0.0004721690030098693, "loss": 6.1202, "mean_token_accuracy": 0.16381090879440308, "num_tokens": 37254037.0, "step": 14705 }, { "entropy": 6.318480205535889, "epoch": 1.6976341604154646, "grad_norm": 1.328125, "learning_rate": 0.0004721491204410305, "loss": 6.0954, "mean_token_accuracy": 0.16951050013303756, "num_tokens": 37265221.0, "step": 14710 }, { "entropy": 6.3138233661651615, "epoch": 1.6982111944604732, "grad_norm": 1.6328125, "learning_rate": 0.00047212923124117915, "loss": 6.0778, "mean_token_accuracy": 0.16995845586061478, "num_tokens": 37277992.0, "step": 14715 }, { "entropy": 6.260839462280273, "epoch": 1.6987882285054818, "grad_norm": 1.3828125, "learning_rate": 0.0004721093354109839, "loss": 6.0369, "mean_token_accuracy": 0.1694336861371994, "num_tokens": 37291608.0, "step": 14720 }, { "entropy": 6.2488401412963865, "epoch": 1.6993652625504905, "grad_norm": 1.1796875, "learning_rate": 0.00047208943295111406, "loss": 6.0675, "mean_token_accuracy": 0.16663674563169478, "num_tokens": 37303619.0, "step": 14725 }, { "entropy": 6.286404466629028, "epoch": 1.6999422965954991, "grad_norm": 1.4296875, "learning_rate": 0.00047206952386223905, "loss": 6.1235, "mean_token_accuracy": 0.1630891889333725, "num_tokens": 37316215.0, "step": 14730 }, { "entropy": 6.264311647415161, "epoch": 1.7005193306405078, "grad_norm": 1.5234375, "learning_rate": 0.0004720496081450285, "loss": 6.0987, "mean_token_accuracy": 0.17511145025491714, "num_tokens": 37328643.0, "step": 14735 }, { "entropy": 6.204177665710449, "epoch": 1.7010963646855164, "grad_norm": 1.34375, "learning_rate": 0.00047202968580015224, "loss": 5.9841, "mean_token_accuracy": 0.17457183748483657, "num_tokens": 37340792.0, "step": 14740 }, { "entropy": 6.296930885314941, "epoch": 1.701673398730525, "grad_norm": 1.5234375, "learning_rate": 0.00047200975682828045, "loss": 6.0496, "mean_token_accuracy": 0.16684187352657318, "num_tokens": 37353866.0, "step": 14745 }, { "entropy": 6.251866245269776, "epoch": 1.702250432775534, "grad_norm": 1.328125, "learning_rate": 0.0004719898212300832, "loss": 6.0468, "mean_token_accuracy": 0.16618564426898957, "num_tokens": 37365403.0, "step": 14750 }, { "entropy": 6.303374767303467, "epoch": 1.7028274668205423, "grad_norm": 1.84375, "learning_rate": 0.00047196987900623134, "loss": 6.0669, "mean_token_accuracy": 0.16828102320432664, "num_tokens": 37379487.0, "step": 14755 }, { "entropy": 6.296183347702026, "epoch": 1.7034045008655512, "grad_norm": 2.34375, "learning_rate": 0.00047194993015739527, "loss": 6.0298, "mean_token_accuracy": 0.16699840426445006, "num_tokens": 37392497.0, "step": 14760 }, { "entropy": 6.2065503120422365, "epoch": 1.7039815349105596, "grad_norm": 1.34375, "learning_rate": 0.00047192997468424624, "loss": 5.9886, "mean_token_accuracy": 0.16989068686962128, "num_tokens": 37407126.0, "step": 14765 }, { "entropy": 6.148230314254761, "epoch": 1.7045585689555685, "grad_norm": 1.640625, "learning_rate": 0.0004719100125874553, "loss": 6.0219, "mean_token_accuracy": 0.17883527129888535, "num_tokens": 37419768.0, "step": 14770 }, { "entropy": 6.247872018814087, "epoch": 1.7051356030005769, "grad_norm": 1.640625, "learning_rate": 0.0004718900438676939, "loss": 6.0585, "mean_token_accuracy": 0.1680767372250557, "num_tokens": 37432512.0, "step": 14775 }, { "entropy": 6.35809907913208, "epoch": 1.7057126370455857, "grad_norm": 1.21875, "learning_rate": 0.0004718700685256337, "loss": 6.1538, "mean_token_accuracy": 0.1664692386984825, "num_tokens": 37445006.0, "step": 14780 }, { "entropy": 6.297749042510986, "epoch": 1.7062896710905944, "grad_norm": 1.171875, "learning_rate": 0.0004718500865619465, "loss": 6.1331, "mean_token_accuracy": 0.16584955304861068, "num_tokens": 37457386.0, "step": 14785 }, { "entropy": 6.260836982727051, "epoch": 1.706866705135603, "grad_norm": 1.359375, "learning_rate": 0.0004718300979773044, "loss": 6.0229, "mean_token_accuracy": 0.1740827426314354, "num_tokens": 37469773.0, "step": 14790 }, { "entropy": 6.3344052791595455, "epoch": 1.7074437391806117, "grad_norm": 1.1015625, "learning_rate": 0.00047181010277237977, "loss": 6.0796, "mean_token_accuracy": 0.1703534796833992, "num_tokens": 37483301.0, "step": 14795 }, { "entropy": 6.317808389663696, "epoch": 1.7080207732256203, "grad_norm": 1.0859375, "learning_rate": 0.0004717901009478451, "loss": 6.0808, "mean_token_accuracy": 0.1657814547419548, "num_tokens": 37495110.0, "step": 14800 }, { "entropy": 6.229995775222778, "epoch": 1.708597807270629, "grad_norm": 1.1640625, "learning_rate": 0.00047177009250437313, "loss": 6.0358, "mean_token_accuracy": 0.17732647508382798, "num_tokens": 37509281.0, "step": 14805 }, { "entropy": 6.24862265586853, "epoch": 1.7091748413156376, "grad_norm": 1.25, "learning_rate": 0.00047175007744263683, "loss": 6.0537, "mean_token_accuracy": 0.1722698614001274, "num_tokens": 37522690.0, "step": 14810 }, { "entropy": 6.26502947807312, "epoch": 1.7097518753606464, "grad_norm": 1.2578125, "learning_rate": 0.00047173005576330935, "loss": 6.0587, "mean_token_accuracy": 0.1729898691177368, "num_tokens": 37534737.0, "step": 14815 }, { "entropy": 6.346290874481201, "epoch": 1.7103289094056549, "grad_norm": 1.1875, "learning_rate": 0.00047171002746706424, "loss": 6.119, "mean_token_accuracy": 0.16451414823532104, "num_tokens": 37547486.0, "step": 14820 }, { "entropy": 6.410305833816528, "epoch": 1.7109059434506637, "grad_norm": 1.6015625, "learning_rate": 0.00047168999255457506, "loss": 6.1556, "mean_token_accuracy": 0.16630878448486328, "num_tokens": 37560083.0, "step": 14825 }, { "entropy": 6.255903625488282, "epoch": 1.7114829774956721, "grad_norm": 1.328125, "learning_rate": 0.00047166995102651565, "loss": 6.0414, "mean_token_accuracy": 0.17067583948373793, "num_tokens": 37573260.0, "step": 14830 }, { "entropy": 6.331271076202393, "epoch": 1.712060011540681, "grad_norm": 1.9453125, "learning_rate": 0.0004716499028835601, "loss": 6.1287, "mean_token_accuracy": 0.16774001866579055, "num_tokens": 37586403.0, "step": 14835 }, { "entropy": 6.257412528991699, "epoch": 1.7126370455856894, "grad_norm": 1.84375, "learning_rate": 0.0004716298481263828, "loss": 6.0818, "mean_token_accuracy": 0.17623667418956757, "num_tokens": 37600771.0, "step": 14840 }, { "entropy": 6.320488119125367, "epoch": 1.7132140796306983, "grad_norm": 1.71875, "learning_rate": 0.0004716097867556583, "loss": 6.0556, "mean_token_accuracy": 0.16797322779893875, "num_tokens": 37613623.0, "step": 14845 }, { "entropy": 6.303245306015015, "epoch": 1.713791113675707, "grad_norm": 1.2734375, "learning_rate": 0.00047158971877206114, "loss": 5.9841, "mean_token_accuracy": 0.17387645542621613, "num_tokens": 37624539.0, "step": 14850 }, { "entropy": 6.279318332672119, "epoch": 1.7143681477207156, "grad_norm": 1.1328125, "learning_rate": 0.0004715696441762665, "loss": 6.0715, "mean_token_accuracy": 0.16603559702634813, "num_tokens": 37636556.0, "step": 14855 }, { "entropy": 6.298802757263184, "epoch": 1.7149451817657242, "grad_norm": 1.3125, "learning_rate": 0.00047154956296894954, "loss": 6.0558, "mean_token_accuracy": 0.168888820707798, "num_tokens": 37648369.0, "step": 14860 }, { "entropy": 6.315916061401367, "epoch": 1.7155222158107328, "grad_norm": 1.1171875, "learning_rate": 0.0004715294751507856, "loss": 6.1196, "mean_token_accuracy": 0.1606738820672035, "num_tokens": 37661118.0, "step": 14865 }, { "entropy": 6.247011470794678, "epoch": 1.7160992498557415, "grad_norm": 1.2421875, "learning_rate": 0.0004715093807224505, "loss": 6.0313, "mean_token_accuracy": 0.16982904225587844, "num_tokens": 37673915.0, "step": 14870 }, { "entropy": 6.208894538879394, "epoch": 1.71667628390075, "grad_norm": 1.3125, "learning_rate": 0.00047148927968462, "loss": 6.0498, "mean_token_accuracy": 0.1695188343524933, "num_tokens": 37687359.0, "step": 14875 }, { "entropy": 6.257250356674194, "epoch": 1.7172533179457588, "grad_norm": 1.5625, "learning_rate": 0.00047146917203797, "loss": 6.0668, "mean_token_accuracy": 0.16386288702487944, "num_tokens": 37700111.0, "step": 14880 }, { "entropy": 6.407634592056274, "epoch": 1.7178303519907674, "grad_norm": 1.25, "learning_rate": 0.0004714490577831771, "loss": 6.2126, "mean_token_accuracy": 0.1564957782626152, "num_tokens": 37712707.0, "step": 14885 }, { "entropy": 6.378075122833252, "epoch": 1.7184073860357763, "grad_norm": 1.4765625, "learning_rate": 0.0004714289369209177, "loss": 6.125, "mean_token_accuracy": 0.1596768781542778, "num_tokens": 37724242.0, "step": 14890 }, { "entropy": 6.327669858932495, "epoch": 1.7189844200807847, "grad_norm": 1.5078125, "learning_rate": 0.00047140880945186863, "loss": 6.0808, "mean_token_accuracy": 0.16967980414628983, "num_tokens": 37737451.0, "step": 14895 }, { "entropy": 6.327920198440552, "epoch": 1.7195614541257935, "grad_norm": 1.5390625, "learning_rate": 0.00047138867537670676, "loss": 6.1087, "mean_token_accuracy": 0.16197078824043273, "num_tokens": 37749968.0, "step": 14900 }, { "entropy": 6.268460416793824, "epoch": 1.720138488170802, "grad_norm": 1.28125, "learning_rate": 0.00047136853469610933, "loss": 5.9986, "mean_token_accuracy": 0.17554560899734498, "num_tokens": 37761961.0, "step": 14905 }, { "entropy": 6.233225727081299, "epoch": 1.7207155222158108, "grad_norm": 1.1953125, "learning_rate": 0.00047134838741075383, "loss": 6.064, "mean_token_accuracy": 0.17252259254455565, "num_tokens": 37775089.0, "step": 14910 }, { "entropy": 6.273133707046509, "epoch": 1.7212925562608192, "grad_norm": 3.875, "learning_rate": 0.00047132823352131787, "loss": 6.1222, "mean_token_accuracy": 0.1664955273270607, "num_tokens": 37787072.0, "step": 14915 }, { "entropy": 6.251991224288941, "epoch": 1.721869590305828, "grad_norm": 1.3671875, "learning_rate": 0.0004713080730284793, "loss": 6.0785, "mean_token_accuracy": 0.1657878965139389, "num_tokens": 37799162.0, "step": 14920 }, { "entropy": 6.262150382995605, "epoch": 1.7224466243508367, "grad_norm": 1.453125, "learning_rate": 0.00047128790593291617, "loss": 6.079, "mean_token_accuracy": 0.17039323300123216, "num_tokens": 37811560.0, "step": 14925 }, { "entropy": 6.338023710250854, "epoch": 1.7230236583958454, "grad_norm": 1.21875, "learning_rate": 0.00047126773223530677, "loss": 6.0091, "mean_token_accuracy": 0.1752539336681366, "num_tokens": 37823832.0, "step": 14930 }, { "entropy": 6.280074548721314, "epoch": 1.723600692440854, "grad_norm": 1.8515625, "learning_rate": 0.00047124755193632975, "loss": 6.099, "mean_token_accuracy": 0.1672136142849922, "num_tokens": 37836718.0, "step": 14935 }, { "entropy": 6.227765607833862, "epoch": 1.7241777264858626, "grad_norm": 1.40625, "learning_rate": 0.00047122736503666377, "loss": 6.0278, "mean_token_accuracy": 0.16516398787498474, "num_tokens": 37850001.0, "step": 14940 }, { "entropy": 6.167520570755005, "epoch": 1.7247547605308713, "grad_norm": 1.3984375, "learning_rate": 0.0004712071715369878, "loss": 5.9453, "mean_token_accuracy": 0.1785365030169487, "num_tokens": 37862425.0, "step": 14945 }, { "entropy": 6.249232196807862, "epoch": 1.72533179457588, "grad_norm": 1.1640625, "learning_rate": 0.0004711869714379812, "loss": 5.9925, "mean_token_accuracy": 0.17359684109687806, "num_tokens": 37874429.0, "step": 14950 }, { "entropy": 6.233495426177979, "epoch": 1.7259088286208888, "grad_norm": 1.8125, "learning_rate": 0.0004711667647403232, "loss": 6.0376, "mean_token_accuracy": 0.17523322850465775, "num_tokens": 37888317.0, "step": 14955 }, { "entropy": 6.216939306259155, "epoch": 1.7264858626658972, "grad_norm": 1.109375, "learning_rate": 0.00047114655144469354, "loss": 6.0329, "mean_token_accuracy": 0.17252569198608397, "num_tokens": 37901101.0, "step": 14960 }, { "entropy": 6.268746280670166, "epoch": 1.727062896710906, "grad_norm": 1.4140625, "learning_rate": 0.00047112633155177203, "loss": 6.0901, "mean_token_accuracy": 0.16735256612300872, "num_tokens": 37914013.0, "step": 14965 }, { "entropy": 6.229385900497436, "epoch": 1.7276399307559145, "grad_norm": 1.4140625, "learning_rate": 0.0004711061050622388, "loss": 5.9856, "mean_token_accuracy": 0.17679166793823242, "num_tokens": 37926799.0, "step": 14970 }, { "entropy": 6.24853138923645, "epoch": 1.7282169648009233, "grad_norm": 2.421875, "learning_rate": 0.00047108587197677404, "loss": 6.0088, "mean_token_accuracy": 0.17115989178419114, "num_tokens": 37939173.0, "step": 14975 }, { "entropy": 6.348738718032837, "epoch": 1.7287939988459318, "grad_norm": 1.140625, "learning_rate": 0.00047106563229605845, "loss": 6.1661, "mean_token_accuracy": 0.16205629259347915, "num_tokens": 37951030.0, "step": 14980 }, { "entropy": 6.321481847763062, "epoch": 1.7293710328909406, "grad_norm": 1.3828125, "learning_rate": 0.00047104538602077276, "loss": 6.1005, "mean_token_accuracy": 0.16491590738296508, "num_tokens": 37964005.0, "step": 14985 }, { "entropy": 6.220985364913941, "epoch": 1.7299480669359493, "grad_norm": 2.0, "learning_rate": 0.0004710251331515978, "loss": 6.0606, "mean_token_accuracy": 0.170199716091156, "num_tokens": 37975851.0, "step": 14990 }, { "entropy": 6.298024463653564, "epoch": 1.730525100980958, "grad_norm": 1.3671875, "learning_rate": 0.00047100487368921485, "loss": 6.0444, "mean_token_accuracy": 0.16759447902441024, "num_tokens": 37988008.0, "step": 14995 }, { "entropy": 6.294814109802246, "epoch": 1.7311021350259665, "grad_norm": 1.265625, "learning_rate": 0.0004709846076343055, "loss": 6.1433, "mean_token_accuracy": 0.16583738923072816, "num_tokens": 38000915.0, "step": 15000 }, { "epoch": 1.7311021350259665, "eval_entropy": 6.123954276588447, "eval_loss": 6.1699981689453125, "eval_mean_token_accuracy": 0.16904069022094115, "eval_num_tokens": 38000915.0, "eval_runtime": 22.6623, "eval_samples_per_second": 1241.532, "eval_steps_per_second": 155.191, "step": 15000 }, { "entropy": 6.24792218208313, "epoch": 1.7316791690709752, "grad_norm": 1.2265625, "learning_rate": 0.00047096433498755103, "loss": 6.0619, "mean_token_accuracy": 0.17191755622625352, "num_tokens": 38013109.0, "step": 15005 }, { "entropy": 6.256828117370605, "epoch": 1.7322562031159838, "grad_norm": 1.171875, "learning_rate": 0.00047094405574963364, "loss": 6.0626, "mean_token_accuracy": 0.17066695243120195, "num_tokens": 38025969.0, "step": 15010 }, { "entropy": 6.28236403465271, "epoch": 1.7328332371609925, "grad_norm": 1.203125, "learning_rate": 0.00047092376992123516, "loss": 6.048, "mean_token_accuracy": 0.16960776448249817, "num_tokens": 38039104.0, "step": 15015 }, { "entropy": 6.308421182632446, "epoch": 1.733410271206001, "grad_norm": 1.71875, "learning_rate": 0.00047090347750303803, "loss": 6.1151, "mean_token_accuracy": 0.17100338786840438, "num_tokens": 38053453.0, "step": 15020 }, { "entropy": 6.361363124847412, "epoch": 1.7339873052510097, "grad_norm": 2.015625, "learning_rate": 0.0004708831784957247, "loss": 6.1232, "mean_token_accuracy": 0.15991011261940002, "num_tokens": 38064932.0, "step": 15025 }, { "entropy": 6.315028858184815, "epoch": 1.7345643392960186, "grad_norm": 1.4140625, "learning_rate": 0.0004708628728999781, "loss": 6.0741, "mean_token_accuracy": 0.1607021138072014, "num_tokens": 38078904.0, "step": 15030 }, { "entropy": 6.308137226104736, "epoch": 1.735141373341027, "grad_norm": 1.140625, "learning_rate": 0.0004708425607164809, "loss": 6.1239, "mean_token_accuracy": 0.16347237974405288, "num_tokens": 38092605.0, "step": 15035 }, { "entropy": 6.280299425125122, "epoch": 1.7357184073860359, "grad_norm": 1.671875, "learning_rate": 0.0004708222419459165, "loss": 6.0219, "mean_token_accuracy": 0.1774211421608925, "num_tokens": 38105953.0, "step": 15040 }, { "entropy": 6.285515403747558, "epoch": 1.7362954414310443, "grad_norm": 1.4375, "learning_rate": 0.0004708019165889683, "loss": 6.1891, "mean_token_accuracy": 0.16232980489730836, "num_tokens": 38118485.0, "step": 15045 }, { "entropy": 6.34949746131897, "epoch": 1.7368724754760532, "grad_norm": 1.2578125, "learning_rate": 0.0004707815846463199, "loss": 6.1597, "mean_token_accuracy": 0.16315972208976745, "num_tokens": 38131220.0, "step": 15050 }, { "entropy": 6.239033269882202, "epoch": 1.7374495095210616, "grad_norm": 1.109375, "learning_rate": 0.0004707612461186552, "loss": 6.031, "mean_token_accuracy": 0.17054777294397355, "num_tokens": 38143012.0, "step": 15055 }, { "entropy": 6.256315422058106, "epoch": 1.7380265435660704, "grad_norm": 1.984375, "learning_rate": 0.00047074090100665805, "loss": 6.0141, "mean_token_accuracy": 0.17277972102165223, "num_tokens": 38155810.0, "step": 15060 }, { "entropy": 6.285384273529052, "epoch": 1.738603577611079, "grad_norm": 1.140625, "learning_rate": 0.00047072054931101306, "loss": 6.0988, "mean_token_accuracy": 0.16316191703081132, "num_tokens": 38169183.0, "step": 15065 }, { "entropy": 6.235709571838379, "epoch": 1.7391806116560877, "grad_norm": 1.6796875, "learning_rate": 0.0004707001910324046, "loss": 6.0805, "mean_token_accuracy": 0.1654953509569168, "num_tokens": 38182098.0, "step": 15070 }, { "entropy": 6.342658376693725, "epoch": 1.7397576457010964, "grad_norm": 1.1328125, "learning_rate": 0.00047067982617151737, "loss": 6.0952, "mean_token_accuracy": 0.16227303296327591, "num_tokens": 38194950.0, "step": 15075 }, { "entropy": 6.27519679069519, "epoch": 1.740334679746105, "grad_norm": 1.5078125, "learning_rate": 0.0004706594547290365, "loss": 6.0493, "mean_token_accuracy": 0.17537856101989746, "num_tokens": 38207600.0, "step": 15080 }, { "entropy": 6.234506750106812, "epoch": 1.7409117137911136, "grad_norm": 2.03125, "learning_rate": 0.00047063907670564695, "loss": 5.9848, "mean_token_accuracy": 0.18101305812597274, "num_tokens": 38219489.0, "step": 15085 }, { "entropy": 6.29203085899353, "epoch": 1.7414887478361223, "grad_norm": 1.2265625, "learning_rate": 0.0004706186921020342, "loss": 6.1122, "mean_token_accuracy": 0.16346038281917571, "num_tokens": 38233240.0, "step": 15090 }, { "entropy": 6.314747762680054, "epoch": 1.7420657818811311, "grad_norm": 1.15625, "learning_rate": 0.00047059830091888407, "loss": 6.059, "mean_token_accuracy": 0.16740975230932237, "num_tokens": 38245967.0, "step": 15095 }, { "entropy": 6.268871784210205, "epoch": 1.7426428159261396, "grad_norm": 1.4140625, "learning_rate": 0.0004705779031568821, "loss": 6.0446, "mean_token_accuracy": 0.16653717309236526, "num_tokens": 38258586.0, "step": 15100 }, { "entropy": 6.25105881690979, "epoch": 1.7432198499711484, "grad_norm": 1.203125, "learning_rate": 0.00047055749881671463, "loss": 6.0664, "mean_token_accuracy": 0.17233491986989974, "num_tokens": 38270007.0, "step": 15105 }, { "entropy": 6.320896196365356, "epoch": 1.7437968840161568, "grad_norm": 1.0859375, "learning_rate": 0.0004705370878990677, "loss": 6.0114, "mean_token_accuracy": 0.17320594638586045, "num_tokens": 38282580.0, "step": 15110 }, { "entropy": 6.226344156265259, "epoch": 1.7443739180611657, "grad_norm": 2.03125, "learning_rate": 0.00047051667040462806, "loss": 6.0185, "mean_token_accuracy": 0.16522823870182038, "num_tokens": 38295577.0, "step": 15115 }, { "entropy": 6.269693994522095, "epoch": 1.7449509521061741, "grad_norm": 1.0859375, "learning_rate": 0.00047049624633408224, "loss": 6.1309, "mean_token_accuracy": 0.16538017094135285, "num_tokens": 38307924.0, "step": 15120 }, { "entropy": 6.359875202178955, "epoch": 1.745527986151183, "grad_norm": 1.2265625, "learning_rate": 0.00047047581568811724, "loss": 6.0743, "mean_token_accuracy": 0.16466730535030366, "num_tokens": 38321573.0, "step": 15125 }, { "entropy": 6.304333209991455, "epoch": 1.7461050201961916, "grad_norm": 1.234375, "learning_rate": 0.00047045537846742043, "loss": 6.0607, "mean_token_accuracy": 0.17050682455301286, "num_tokens": 38333953.0, "step": 15130 }, { "entropy": 6.261137628555298, "epoch": 1.7466820542412003, "grad_norm": 1.296875, "learning_rate": 0.000470434934672679, "loss": 6.0718, "mean_token_accuracy": 0.16425079554319383, "num_tokens": 38346028.0, "step": 15135 }, { "entropy": 6.317224311828613, "epoch": 1.747259088286209, "grad_norm": 1.5, "learning_rate": 0.00047041448430458054, "loss": 5.9899, "mean_token_accuracy": 0.17166270464658737, "num_tokens": 38358806.0, "step": 15140 }, { "entropy": 6.222446775436401, "epoch": 1.7478361223312175, "grad_norm": 1.1171875, "learning_rate": 0.00047039402736381305, "loss": 5.9498, "mean_token_accuracy": 0.1746882528066635, "num_tokens": 38370396.0, "step": 15145 }, { "entropy": 6.24567985534668, "epoch": 1.7484131563762262, "grad_norm": 1.1640625, "learning_rate": 0.0004703735638510645, "loss": 6.172, "mean_token_accuracy": 0.16677465289831161, "num_tokens": 38383747.0, "step": 15150 }, { "entropy": 6.333199834823608, "epoch": 1.7489901904212348, "grad_norm": 1.1171875, "learning_rate": 0.0004703530937670232, "loss": 6.0572, "mean_token_accuracy": 0.1690805047750473, "num_tokens": 38396611.0, "step": 15155 }, { "entropy": 6.281210470199585, "epoch": 1.7495672244662435, "grad_norm": 1.375, "learning_rate": 0.0004703326171123776, "loss": 6.094, "mean_token_accuracy": 0.16737785041332245, "num_tokens": 38407627.0, "step": 15160 }, { "entropy": 6.160182142257691, "epoch": 1.750144258511252, "grad_norm": 1.2890625, "learning_rate": 0.0004703121338878164, "loss": 5.9978, "mean_token_accuracy": 0.17774373441934585, "num_tokens": 38420522.0, "step": 15165 }, { "entropy": 6.282178735733032, "epoch": 1.750721292556261, "grad_norm": 1.46875, "learning_rate": 0.0004702916440940286, "loss": 6.1264, "mean_token_accuracy": 0.16249785125255584, "num_tokens": 38433968.0, "step": 15170 }, { "entropy": 6.312160015106201, "epoch": 1.7512983266012694, "grad_norm": 1.4453125, "learning_rate": 0.0004702711477317034, "loss": 6.0757, "mean_token_accuracy": 0.17204999625682832, "num_tokens": 38445819.0, "step": 15175 }, { "entropy": 6.340288782119751, "epoch": 1.7518753606462782, "grad_norm": 1.21875, "learning_rate": 0.0004702506448015301, "loss": 6.0909, "mean_token_accuracy": 0.16886577010154724, "num_tokens": 38458823.0, "step": 15180 }, { "entropy": 6.2418297290802, "epoch": 1.7524523946912867, "grad_norm": 1.7421875, "learning_rate": 0.00047023013530419843, "loss": 6.0596, "mean_token_accuracy": 0.16895245462656022, "num_tokens": 38472553.0, "step": 15185 }, { "entropy": 6.294234561920166, "epoch": 1.7530294287362955, "grad_norm": 1.5390625, "learning_rate": 0.0004702096192403981, "loss": 6.0384, "mean_token_accuracy": 0.1733073890209198, "num_tokens": 38484143.0, "step": 15190 }, { "entropy": 6.221842432022095, "epoch": 1.753606462781304, "grad_norm": 1.2578125, "learning_rate": 0.0004701890966108192, "loss": 6.0565, "mean_token_accuracy": 0.16363780051469803, "num_tokens": 38496795.0, "step": 15195 }, { "entropy": 6.2286309719085695, "epoch": 1.7541834968263128, "grad_norm": 1.3984375, "learning_rate": 0.000470168567416152, "loss": 5.9689, "mean_token_accuracy": 0.17548104077577592, "num_tokens": 38509548.0, "step": 15200 }, { "entropy": 6.299403381347656, "epoch": 1.7547605308713214, "grad_norm": 1.2421875, "learning_rate": 0.0004701480316570869, "loss": 6.0866, "mean_token_accuracy": 0.16311995685100555, "num_tokens": 38524011.0, "step": 15205 }, { "entropy": 6.3120521068572994, "epoch": 1.75533756491633, "grad_norm": 1.25, "learning_rate": 0.0004701274893343147, "loss": 6.1045, "mean_token_accuracy": 0.1634999006986618, "num_tokens": 38536913.0, "step": 15210 }, { "entropy": 6.233125972747803, "epoch": 1.7559145989613387, "grad_norm": 1.1640625, "learning_rate": 0.00047010694044852643, "loss": 6.068, "mean_token_accuracy": 0.17134792655706405, "num_tokens": 38548759.0, "step": 15215 }, { "entropy": 6.314376878738403, "epoch": 1.7564916330063474, "grad_norm": 1.5703125, "learning_rate": 0.000470086385000413, "loss": 6.0631, "mean_token_accuracy": 0.17076184898614882, "num_tokens": 38562071.0, "step": 15220 }, { "entropy": 6.2503444194793705, "epoch": 1.757068667051356, "grad_norm": 1.3515625, "learning_rate": 0.0004700658229906661, "loss": 6.0194, "mean_token_accuracy": 0.1687441125512123, "num_tokens": 38573816.0, "step": 15225 }, { "entropy": 6.396673727035522, "epoch": 1.7576457010963646, "grad_norm": 2.265625, "learning_rate": 0.00047004525441997694, "loss": 6.1596, "mean_token_accuracy": 0.16280039995908738, "num_tokens": 38586625.0, "step": 15230 }, { "entropy": 6.261827564239502, "epoch": 1.7582227351413735, "grad_norm": 1.484375, "learning_rate": 0.0004700246792890376, "loss": 6.097, "mean_token_accuracy": 0.17354324609041213, "num_tokens": 38599391.0, "step": 15235 }, { "entropy": 6.203934097290039, "epoch": 1.758799769186382, "grad_norm": 1.1875, "learning_rate": 0.0004700040975985401, "loss": 5.9781, "mean_token_accuracy": 0.1821871742606163, "num_tokens": 38610822.0, "step": 15240 }, { "entropy": 6.23805685043335, "epoch": 1.7593768032313908, "grad_norm": 1.3359375, "learning_rate": 0.00046998350934917654, "loss": 6.0029, "mean_token_accuracy": 0.1770789697766304, "num_tokens": 38623886.0, "step": 15245 }, { "entropy": 6.236564683914184, "epoch": 1.7599538372763992, "grad_norm": 1.0234375, "learning_rate": 0.00046996291454163956, "loss": 5.9812, "mean_token_accuracy": 0.17420328557491302, "num_tokens": 38636680.0, "step": 15250 }, { "entropy": 6.2587113857269285, "epoch": 1.760530871321408, "grad_norm": 1.234375, "learning_rate": 0.0004699423131766218, "loss": 6.0823, "mean_token_accuracy": 0.17095499336719513, "num_tokens": 38648841.0, "step": 15255 }, { "entropy": 6.211136674880981, "epoch": 1.7611079053664165, "grad_norm": 1.6328125, "learning_rate": 0.0004699217052548161, "loss": 6.0056, "mean_token_accuracy": 0.17292061299085618, "num_tokens": 38660603.0, "step": 15260 }, { "entropy": 6.264367008209229, "epoch": 1.7616849394114253, "grad_norm": 1.2109375, "learning_rate": 0.00046990109077691577, "loss": 6.0593, "mean_token_accuracy": 0.17040781825780868, "num_tokens": 38674082.0, "step": 15265 }, { "entropy": 6.251727819442749, "epoch": 1.762261973456434, "grad_norm": 1.4453125, "learning_rate": 0.00046988046974361406, "loss": 5.9876, "mean_token_accuracy": 0.17488901168107987, "num_tokens": 38686274.0, "step": 15270 }, { "entropy": 6.312477970123291, "epoch": 1.7628390075014426, "grad_norm": 1.3671875, "learning_rate": 0.0004698598421556045, "loss": 6.0687, "mean_token_accuracy": 0.17141490131616594, "num_tokens": 38699260.0, "step": 15275 }, { "entropy": 6.240328598022461, "epoch": 1.7634160415464513, "grad_norm": 2.921875, "learning_rate": 0.0004698392080135809, "loss": 6.0628, "mean_token_accuracy": 0.17000517696142198, "num_tokens": 38712054.0, "step": 15280 }, { "entropy": 6.236440801620484, "epoch": 1.76399307559146, "grad_norm": 1.1953125, "learning_rate": 0.0004698185673182374, "loss": 5.9923, "mean_token_accuracy": 0.1765800029039383, "num_tokens": 38724634.0, "step": 15285 }, { "entropy": 6.25202693939209, "epoch": 1.7645701096364685, "grad_norm": 1.2578125, "learning_rate": 0.00046979792007026817, "loss": 5.9628, "mean_token_accuracy": 0.17394617944955826, "num_tokens": 38737294.0, "step": 15290 }, { "entropy": 6.330475282669068, "epoch": 1.7651471436814772, "grad_norm": 1.2421875, "learning_rate": 0.0004697772662703676, "loss": 6.1466, "mean_token_accuracy": 0.15854198187589646, "num_tokens": 38749578.0, "step": 15295 }, { "entropy": 6.262237167358398, "epoch": 1.7657241777264858, "grad_norm": 1.234375, "learning_rate": 0.00046975660591923047, "loss": 6.0442, "mean_token_accuracy": 0.15982145816087723, "num_tokens": 38762282.0, "step": 15300 }, { "entropy": 6.3007566928863525, "epoch": 1.7663012117714945, "grad_norm": 1.0703125, "learning_rate": 0.0004697359390175516, "loss": 6.0285, "mean_token_accuracy": 0.17306247353553772, "num_tokens": 38773861.0, "step": 15305 }, { "entropy": 6.301147747039795, "epoch": 1.7668782458165033, "grad_norm": 1.359375, "learning_rate": 0.00046971526556602625, "loss": 6.1427, "mean_token_accuracy": 0.16681707203388213, "num_tokens": 38786427.0, "step": 15310 }, { "entropy": 6.30169415473938, "epoch": 1.7674552798615117, "grad_norm": 1.5390625, "learning_rate": 0.0004696945855653495, "loss": 6.1021, "mean_token_accuracy": 0.16261772960424423, "num_tokens": 38798496.0, "step": 15315 }, { "entropy": 6.261436891555786, "epoch": 1.7680323139065206, "grad_norm": 1.421875, "learning_rate": 0.0004696738990162172, "loss": 6.1365, "mean_token_accuracy": 0.16127245575189592, "num_tokens": 38812069.0, "step": 15320 }, { "entropy": 6.29582257270813, "epoch": 1.768609347951529, "grad_norm": 1.3515625, "learning_rate": 0.000469653205919325, "loss": 6.1237, "mean_token_accuracy": 0.1679990828037262, "num_tokens": 38824465.0, "step": 15325 }, { "entropy": 6.353593111038208, "epoch": 1.7691863819965379, "grad_norm": 1.140625, "learning_rate": 0.00046963250627536884, "loss": 6.1229, "mean_token_accuracy": 0.16071866005659102, "num_tokens": 38837328.0, "step": 15330 }, { "entropy": 6.258993768692017, "epoch": 1.7697634160415463, "grad_norm": 1.2109375, "learning_rate": 0.0004696118000850451, "loss": 6.0489, "mean_token_accuracy": 0.16911157071590424, "num_tokens": 38849238.0, "step": 15335 }, { "entropy": 6.222685432434082, "epoch": 1.7703404500865552, "grad_norm": 1.7734375, "learning_rate": 0.00046959108734905003, "loss": 6.0825, "mean_token_accuracy": 0.1641075626015663, "num_tokens": 38861479.0, "step": 15340 }, { "entropy": 6.246473884582519, "epoch": 1.7709174841315638, "grad_norm": 1.34375, "learning_rate": 0.00046957036806808045, "loss": 6.007, "mean_token_accuracy": 0.1772461786866188, "num_tokens": 38874342.0, "step": 15345 }, { "entropy": 6.231625413894653, "epoch": 1.7714945181765724, "grad_norm": 1.1015625, "learning_rate": 0.0004695496422428332, "loss": 6.0482, "mean_token_accuracy": 0.1703166276216507, "num_tokens": 38886595.0, "step": 15350 }, { "entropy": 6.297798919677734, "epoch": 1.772071552221581, "grad_norm": 1.1171875, "learning_rate": 0.0004695289098740054, "loss": 6.0516, "mean_token_accuracy": 0.16702995151281358, "num_tokens": 38899338.0, "step": 15355 }, { "entropy": 6.289673328399658, "epoch": 1.7726485862665897, "grad_norm": 1.2109375, "learning_rate": 0.0004695081709622943, "loss": 6.0265, "mean_token_accuracy": 0.17137792557477952, "num_tokens": 38911765.0, "step": 15360 }, { "entropy": 6.209077072143555, "epoch": 1.7732256203115984, "grad_norm": 1.1953125, "learning_rate": 0.00046948742550839744, "loss": 5.9768, "mean_token_accuracy": 0.1811099350452423, "num_tokens": 38924137.0, "step": 15365 }, { "entropy": 6.293831920623779, "epoch": 1.773802654356607, "grad_norm": 1.1171875, "learning_rate": 0.0004694666735130127, "loss": 6.042, "mean_token_accuracy": 0.16767871677875518, "num_tokens": 38936401.0, "step": 15370 }, { "entropy": 6.273082637786866, "epoch": 1.7743796884016156, "grad_norm": 2.03125, "learning_rate": 0.000469445914976838, "loss": 6.0749, "mean_token_accuracy": 0.16592430025339128, "num_tokens": 38948224.0, "step": 15375 }, { "entropy": 6.273223733901977, "epoch": 1.7749567224466243, "grad_norm": 1.171875, "learning_rate": 0.0004694251499005715, "loss": 6.037, "mean_token_accuracy": 0.17387449145317077, "num_tokens": 38959924.0, "step": 15380 }, { "entropy": 6.215410614013672, "epoch": 1.7755337564916331, "grad_norm": 3.65625, "learning_rate": 0.0004694043782849116, "loss": 6.0723, "mean_token_accuracy": 0.1672881633043289, "num_tokens": 38973018.0, "step": 15385 }, { "entropy": 6.2906115531921385, "epoch": 1.7761107905366416, "grad_norm": 1.125, "learning_rate": 0.00046938360013055715, "loss": 6.1164, "mean_token_accuracy": 0.16135561764240264, "num_tokens": 38985634.0, "step": 15390 }, { "entropy": 6.3686277866363525, "epoch": 1.7766878245816504, "grad_norm": 1.3046875, "learning_rate": 0.00046936281543820673, "loss": 6.1421, "mean_token_accuracy": 0.1644715130329132, "num_tokens": 38999446.0, "step": 15395 }, { "entropy": 6.323219871520996, "epoch": 1.7772648586266588, "grad_norm": 1.6875, "learning_rate": 0.00046934202420855967, "loss": 6.1244, "mean_token_accuracy": 0.17120789289474486, "num_tokens": 39012974.0, "step": 15400 }, { "entropy": 6.157790231704712, "epoch": 1.7778418926716677, "grad_norm": 1.2578125, "learning_rate": 0.00046932122644231507, "loss": 6.0038, "mean_token_accuracy": 0.17291020452976227, "num_tokens": 39025316.0, "step": 15405 }, { "entropy": 6.209767818450928, "epoch": 1.7784189267166761, "grad_norm": 1.203125, "learning_rate": 0.00046930042214017256, "loss": 5.969, "mean_token_accuracy": 0.1822973057627678, "num_tokens": 39038174.0, "step": 15410 }, { "entropy": 6.363025379180908, "epoch": 1.778995960761685, "grad_norm": 1.171875, "learning_rate": 0.0004692796113028319, "loss": 6.1545, "mean_token_accuracy": 0.15527651011943816, "num_tokens": 39051943.0, "step": 15415 }, { "entropy": 6.228987741470337, "epoch": 1.7795729948066936, "grad_norm": 1.6796875, "learning_rate": 0.000469258793930993, "loss": 6.0561, "mean_token_accuracy": 0.16570292711257933, "num_tokens": 39064765.0, "step": 15420 }, { "entropy": 6.302031183242798, "epoch": 1.7801500288517023, "grad_norm": 1.1796875, "learning_rate": 0.00046923797002535605, "loss": 6.1258, "mean_token_accuracy": 0.16474866718053818, "num_tokens": 39077326.0, "step": 15425 }, { "entropy": 6.303848218917847, "epoch": 1.780727062896711, "grad_norm": 1.1015625, "learning_rate": 0.0004692171395866214, "loss": 6.0094, "mean_token_accuracy": 0.17039090692996978, "num_tokens": 39090049.0, "step": 15430 }, { "entropy": 6.22796106338501, "epoch": 1.7813040969417195, "grad_norm": 1.1328125, "learning_rate": 0.00046919630261548986, "loss": 6.0243, "mean_token_accuracy": 0.17326881736516953, "num_tokens": 39102805.0, "step": 15435 }, { "entropy": 6.148467016220093, "epoch": 1.7818811309867282, "grad_norm": 1.046875, "learning_rate": 0.00046917545911266207, "loss": 5.9339, "mean_token_accuracy": 0.18568576574325563, "num_tokens": 39115966.0, "step": 15440 }, { "entropy": 6.2328081130981445, "epoch": 1.7824581650317368, "grad_norm": 1.265625, "learning_rate": 0.00046915460907883923, "loss": 6.0783, "mean_token_accuracy": 0.16815552562475206, "num_tokens": 39128417.0, "step": 15445 }, { "entropy": 6.260302972793579, "epoch": 1.7830351990767457, "grad_norm": 1.546875, "learning_rate": 0.00046913375251472246, "loss": 6.028, "mean_token_accuracy": 0.17435874044895172, "num_tokens": 39142338.0, "step": 15450 }, { "entropy": 6.25403733253479, "epoch": 1.783612233121754, "grad_norm": 3.0, "learning_rate": 0.00046911288942101345, "loss": 6.0697, "mean_token_accuracy": 0.17178328335285187, "num_tokens": 39155055.0, "step": 15455 }, { "entropy": 6.327509355545044, "epoch": 1.784189267166763, "grad_norm": 3.546875, "learning_rate": 0.0004690920197984138, "loss": 6.088, "mean_token_accuracy": 0.16623275429010392, "num_tokens": 39167170.0, "step": 15460 }, { "entropy": 6.431978321075439, "epoch": 1.7847663012117714, "grad_norm": 1.265625, "learning_rate": 0.0004690711436476254, "loss": 6.1754, "mean_token_accuracy": 0.1634928062558174, "num_tokens": 39181389.0, "step": 15465 }, { "entropy": 6.399842214584351, "epoch": 1.7853433352567802, "grad_norm": 1.140625, "learning_rate": 0.00046905026096935056, "loss": 6.1594, "mean_token_accuracy": 0.16029439866542816, "num_tokens": 39194728.0, "step": 15470 }, { "entropy": 6.165746212005615, "epoch": 1.7859203693017887, "grad_norm": 1.5625, "learning_rate": 0.0004690293717642916, "loss": 5.9747, "mean_token_accuracy": 0.1781982809305191, "num_tokens": 39207945.0, "step": 15475 }, { "entropy": 6.262561368942261, "epoch": 1.7864974033467975, "grad_norm": 1.7109375, "learning_rate": 0.000469008476033151, "loss": 6.1209, "mean_token_accuracy": 0.1702757239341736, "num_tokens": 39221314.0, "step": 15480 }, { "entropy": 6.340551853179932, "epoch": 1.7870744373918062, "grad_norm": 1.1953125, "learning_rate": 0.00046898757377663176, "loss": 6.0694, "mean_token_accuracy": 0.16916078925132752, "num_tokens": 39233910.0, "step": 15485 }, { "entropy": 6.28997769355774, "epoch": 1.7876514714368148, "grad_norm": 1.09375, "learning_rate": 0.00046896666499543683, "loss": 6.0606, "mean_token_accuracy": 0.17222110480070113, "num_tokens": 39246027.0, "step": 15490 }, { "entropy": 6.221077728271484, "epoch": 1.7882285054818234, "grad_norm": 1.4453125, "learning_rate": 0.00046894574969026946, "loss": 6.0333, "mean_token_accuracy": 0.16958654075860977, "num_tokens": 39258456.0, "step": 15495 }, { "entropy": 6.365782451629639, "epoch": 1.788805539526832, "grad_norm": 1.0703125, "learning_rate": 0.00046892482786183313, "loss": 6.0906, "mean_token_accuracy": 0.16027437299489974, "num_tokens": 39270624.0, "step": 15500 }, { "entropy": 6.262175798416138, "epoch": 1.7893825735718407, "grad_norm": 1.9140625, "learning_rate": 0.00046890389951083155, "loss": 5.9906, "mean_token_accuracy": 0.16951557099819184, "num_tokens": 39283350.0, "step": 15505 }, { "entropy": 6.29289026260376, "epoch": 1.7899596076168494, "grad_norm": 1.2421875, "learning_rate": 0.00046888296463796857, "loss": 6.0783, "mean_token_accuracy": 0.17297891080379485, "num_tokens": 39296321.0, "step": 15510 }, { "entropy": 6.256748819351197, "epoch": 1.790536641661858, "grad_norm": 2.203125, "learning_rate": 0.0004688620232439485, "loss": 5.9794, "mean_token_accuracy": 0.1770552009344101, "num_tokens": 39309223.0, "step": 15515 }, { "entropy": 6.167249011993408, "epoch": 1.7911136757068666, "grad_norm": 2.640625, "learning_rate": 0.00046884107532947547, "loss": 5.9671, "mean_token_accuracy": 0.1709598571062088, "num_tokens": 39322348.0, "step": 15520 }, { "entropy": 6.285998582839966, "epoch": 1.7916907097518755, "grad_norm": 1.21875, "learning_rate": 0.00046882012089525415, "loss": 6.0561, "mean_token_accuracy": 0.1638656571507454, "num_tokens": 39335375.0, "step": 15525 }, { "entropy": 6.330535793304444, "epoch": 1.792267743796884, "grad_norm": 1.0546875, "learning_rate": 0.0004687991599419895, "loss": 6.0534, "mean_token_accuracy": 0.16950902789831163, "num_tokens": 39347865.0, "step": 15530 }, { "entropy": 6.270843029022217, "epoch": 1.7928447778418928, "grad_norm": 1.0546875, "learning_rate": 0.00046877819247038624, "loss": 6.0894, "mean_token_accuracy": 0.1685513213276863, "num_tokens": 39361402.0, "step": 15535 }, { "entropy": 6.257634687423706, "epoch": 1.7934218118869012, "grad_norm": 1.0703125, "learning_rate": 0.0004687572184811497, "loss": 5.946, "mean_token_accuracy": 0.17115099728107452, "num_tokens": 39372839.0, "step": 15540 }, { "entropy": 6.258444881439209, "epoch": 1.79399884593191, "grad_norm": 1.21875, "learning_rate": 0.00046873623797498545, "loss": 5.9962, "mean_token_accuracy": 0.16875378042459488, "num_tokens": 39385189.0, "step": 15545 }, { "entropy": 6.356871175765991, "epoch": 1.7945758799769185, "grad_norm": 1.875, "learning_rate": 0.000468715250952599, "loss": 6.1782, "mean_token_accuracy": 0.16155981868505478, "num_tokens": 39397871.0, "step": 15550 }, { "entropy": 6.331059503555298, "epoch": 1.7951529140219273, "grad_norm": 1.1640625, "learning_rate": 0.00046869425741469635, "loss": 6.0892, "mean_token_accuracy": 0.16324354857206344, "num_tokens": 39411222.0, "step": 15555 }, { "entropy": 6.283884048461914, "epoch": 1.795729948066936, "grad_norm": 1.2265625, "learning_rate": 0.0004686732573619835, "loss": 6.0929, "mean_token_accuracy": 0.1666042074561119, "num_tokens": 39423614.0, "step": 15560 }, { "entropy": 6.3039412021636965, "epoch": 1.7963069821119446, "grad_norm": 1.1875, "learning_rate": 0.0004686522507951669, "loss": 6.0173, "mean_token_accuracy": 0.16653052419424058, "num_tokens": 39436299.0, "step": 15565 }, { "entropy": 6.258326625823974, "epoch": 1.7968840161569533, "grad_norm": 1.28125, "learning_rate": 0.0004686312377149531, "loss": 6.1395, "mean_token_accuracy": 0.15843801349401473, "num_tokens": 39448994.0, "step": 15570 }, { "entropy": 6.3444324970245365, "epoch": 1.797461050201962, "grad_norm": 1.21875, "learning_rate": 0.00046861021812204874, "loss": 6.1192, "mean_token_accuracy": 0.1605915457010269, "num_tokens": 39462387.0, "step": 15575 }, { "entropy": 6.342525243759155, "epoch": 1.7980380842469705, "grad_norm": 1.328125, "learning_rate": 0.00046858919201716085, "loss": 6.1111, "mean_token_accuracy": 0.1640731140971184, "num_tokens": 39475082.0, "step": 15580 }, { "entropy": 6.29853310585022, "epoch": 1.7986151182919792, "grad_norm": 1.3046875, "learning_rate": 0.0004685681594009966, "loss": 6.0898, "mean_token_accuracy": 0.16256304532289506, "num_tokens": 39487272.0, "step": 15585 }, { "entropy": 6.239833211898803, "epoch": 1.799192152336988, "grad_norm": 1.3359375, "learning_rate": 0.00046854712027426357, "loss": 6.0776, "mean_token_accuracy": 0.16334139704704284, "num_tokens": 39502499.0, "step": 15590 }, { "entropy": 6.328673505783081, "epoch": 1.7997691863819965, "grad_norm": 1.046875, "learning_rate": 0.00046852607463766923, "loss": 6.0839, "mean_token_accuracy": 0.16911648958921432, "num_tokens": 39514652.0, "step": 15595 }, { "entropy": 6.401641321182251, "epoch": 1.8003462204270053, "grad_norm": 1.2109375, "learning_rate": 0.0004685050224919215, "loss": 6.1618, "mean_token_accuracy": 0.1580326199531555, "num_tokens": 39527859.0, "step": 15600 }, { "entropy": 6.261534261703491, "epoch": 1.8009232544720137, "grad_norm": 1.3828125, "learning_rate": 0.00046848396383772844, "loss": 6.0345, "mean_token_accuracy": 0.1679571434855461, "num_tokens": 39541099.0, "step": 15605 }, { "entropy": 6.204374647140503, "epoch": 1.8015002885170226, "grad_norm": 1.3671875, "learning_rate": 0.0004684628986757984, "loss": 6.0081, "mean_token_accuracy": 0.1721584215760231, "num_tokens": 39553233.0, "step": 15610 }, { "entropy": 6.285806322097779, "epoch": 1.802077322562031, "grad_norm": 1.4921875, "learning_rate": 0.0004684418270068398, "loss": 6.0228, "mean_token_accuracy": 0.16974806785583496, "num_tokens": 39565379.0, "step": 15615 }, { "entropy": 6.238617944717407, "epoch": 1.8026543566070399, "grad_norm": 1.34375, "learning_rate": 0.0004684207488315615, "loss": 5.975, "mean_token_accuracy": 0.17460445761680604, "num_tokens": 39577509.0, "step": 15620 }, { "entropy": 6.322760725021363, "epoch": 1.8032313906520485, "grad_norm": 1.4453125, "learning_rate": 0.0004683996641506724, "loss": 6.0739, "mean_token_accuracy": 0.1633619874715805, "num_tokens": 39589960.0, "step": 15625 }, { "entropy": 6.227279090881348, "epoch": 1.8038084246970572, "grad_norm": 1.3203125, "learning_rate": 0.00046837857296488163, "loss": 5.9781, "mean_token_accuracy": 0.17601959705352782, "num_tokens": 39602231.0, "step": 15630 }, { "entropy": 6.260754919052124, "epoch": 1.8043854587420658, "grad_norm": 1.625, "learning_rate": 0.00046835747527489857, "loss": 6.0532, "mean_token_accuracy": 0.1809969499707222, "num_tokens": 39615756.0, "step": 15635 }, { "entropy": 6.310202407836914, "epoch": 1.8049624927870744, "grad_norm": 1.4453125, "learning_rate": 0.000468336371081433, "loss": 6.0821, "mean_token_accuracy": 0.1634535536170006, "num_tokens": 39627810.0, "step": 15640 }, { "entropy": 6.2715802669525145, "epoch": 1.805539526832083, "grad_norm": 1.140625, "learning_rate": 0.00046831526038519444, "loss": 6.0666, "mean_token_accuracy": 0.16980360597372054, "num_tokens": 39640930.0, "step": 15645 }, { "entropy": 6.269176197052002, "epoch": 1.8061165608770917, "grad_norm": 1.1484375, "learning_rate": 0.0004682941431868933, "loss": 6.0093, "mean_token_accuracy": 0.1734122857451439, "num_tokens": 39652146.0, "step": 15650 }, { "entropy": 6.161038208007812, "epoch": 1.8066935949221004, "grad_norm": 1.15625, "learning_rate": 0.00046827301948723963, "loss": 5.9362, "mean_token_accuracy": 0.17960268557071685, "num_tokens": 39665156.0, "step": 15655 }, { "entropy": 6.255029582977295, "epoch": 1.807270628967109, "grad_norm": 1.1171875, "learning_rate": 0.00046825188928694393, "loss": 6.0758, "mean_token_accuracy": 0.16673412621021272, "num_tokens": 39677346.0, "step": 15660 }, { "entropy": 6.312059164047241, "epoch": 1.8078476630121179, "grad_norm": 1.1484375, "learning_rate": 0.0004682307525867169, "loss": 6.0247, "mean_token_accuracy": 0.1778455853462219, "num_tokens": 39690613.0, "step": 15665 }, { "entropy": 6.335729742050171, "epoch": 1.8084246970571263, "grad_norm": 1.6484375, "learning_rate": 0.0004682096093872695, "loss": 6.0163, "mean_token_accuracy": 0.17328280210494995, "num_tokens": 39703111.0, "step": 15670 }, { "entropy": 6.2205384254455565, "epoch": 1.8090017311021351, "grad_norm": 1.515625, "learning_rate": 0.00046818845968931284, "loss": 6.0623, "mean_token_accuracy": 0.1691240191459656, "num_tokens": 39715441.0, "step": 15675 }, { "entropy": 6.262801313400269, "epoch": 1.8095787651471436, "grad_norm": 1.0625, "learning_rate": 0.00046816730349355843, "loss": 6.0161, "mean_token_accuracy": 0.17307625114917755, "num_tokens": 39728437.0, "step": 15680 }, { "entropy": 6.241965198516846, "epoch": 1.8101557991921524, "grad_norm": 1.0625, "learning_rate": 0.00046814614080071756, "loss": 6.0466, "mean_token_accuracy": 0.17203230857849122, "num_tokens": 39740324.0, "step": 15685 }, { "entropy": 6.294243240356446, "epoch": 1.8107328332371608, "grad_norm": 1.0703125, "learning_rate": 0.00046812497161150224, "loss": 6.0171, "mean_token_accuracy": 0.16689405590295792, "num_tokens": 39752158.0, "step": 15690 }, { "entropy": 6.28272008895874, "epoch": 1.8113098672821697, "grad_norm": 1.265625, "learning_rate": 0.00046810379592662445, "loss": 6.0772, "mean_token_accuracy": 0.17248584032058717, "num_tokens": 39766296.0, "step": 15695 }, { "entropy": 6.234416913986206, "epoch": 1.8118869013271783, "grad_norm": 1.109375, "learning_rate": 0.00046808261374679637, "loss": 6.0515, "mean_token_accuracy": 0.17033150643110276, "num_tokens": 39779690.0, "step": 15700 }, { "entropy": 6.25835657119751, "epoch": 1.812463935372187, "grad_norm": 1.1875, "learning_rate": 0.0004680614250727305, "loss": 6.0099, "mean_token_accuracy": 0.1731962352991104, "num_tokens": 39790617.0, "step": 15705 }, { "entropy": 6.252574872970581, "epoch": 1.8130409694171956, "grad_norm": 1.203125, "learning_rate": 0.0004680402299051395, "loss": 6.036, "mean_token_accuracy": 0.1660449355840683, "num_tokens": 39802994.0, "step": 15710 }, { "entropy": 6.25236554145813, "epoch": 1.8136180034622043, "grad_norm": 1.1796875, "learning_rate": 0.0004680190282447363, "loss": 6.0521, "mean_token_accuracy": 0.169236396253109, "num_tokens": 39815618.0, "step": 15715 }, { "entropy": 6.24625039100647, "epoch": 1.814195037507213, "grad_norm": 1.140625, "learning_rate": 0.0004679978200922339, "loss": 6.0194, "mean_token_accuracy": 0.1698412522673607, "num_tokens": 39827283.0, "step": 15720 }, { "entropy": 6.2522207736969, "epoch": 1.8147720715522215, "grad_norm": 1.0703125, "learning_rate": 0.0004679766054483457, "loss": 5.9816, "mean_token_accuracy": 0.17221676111221312, "num_tokens": 39840116.0, "step": 15725 }, { "entropy": 6.15627088546753, "epoch": 1.8153491055972304, "grad_norm": 1.40625, "learning_rate": 0.0004679553843137852, "loss": 5.979, "mean_token_accuracy": 0.18153376132249832, "num_tokens": 39851770.0, "step": 15730 }, { "entropy": 6.156879806518555, "epoch": 1.8159261396422388, "grad_norm": 1.59375, "learning_rate": 0.00046793415668926625, "loss": 5.9414, "mean_token_accuracy": 0.17151160389184952, "num_tokens": 39863803.0, "step": 15735 }, { "entropy": 6.248953819274902, "epoch": 1.8165031736872477, "grad_norm": 1.25, "learning_rate": 0.0004679129225755028, "loss": 5.9871, "mean_token_accuracy": 0.17617322951555253, "num_tokens": 39875713.0, "step": 15740 }, { "entropy": 6.18450894355774, "epoch": 1.817080207732256, "grad_norm": 1.234375, "learning_rate": 0.000467891681973209, "loss": 5.9588, "mean_token_accuracy": 0.17611952871084213, "num_tokens": 39888670.0, "step": 15745 }, { "entropy": 6.142603588104248, "epoch": 1.817657241777265, "grad_norm": 1.7734375, "learning_rate": 0.00046787043488309926, "loss": 5.9825, "mean_token_accuracy": 0.18451358526945114, "num_tokens": 39900845.0, "step": 15750 }, { "entropy": 6.346268844604492, "epoch": 1.8182342758222734, "grad_norm": 1.046875, "learning_rate": 0.0004678491813058882, "loss": 6.0927, "mean_token_accuracy": 0.1648651421070099, "num_tokens": 39912268.0, "step": 15755 }, { "entropy": 6.277725410461426, "epoch": 1.8188113098672822, "grad_norm": 1.28125, "learning_rate": 0.0004678279212422908, "loss": 6.0369, "mean_token_accuracy": 0.1688872143626213, "num_tokens": 39924213.0, "step": 15760 }, { "entropy": 6.276968383789063, "epoch": 1.8193883439122909, "grad_norm": 1.265625, "learning_rate": 0.0004678066546930221, "loss": 6.0825, "mean_token_accuracy": 0.1626095324754715, "num_tokens": 39937069.0, "step": 15765 }, { "entropy": 6.237314939498901, "epoch": 1.8199653779572995, "grad_norm": 1.1484375, "learning_rate": 0.00046778538165879725, "loss": 6.0041, "mean_token_accuracy": 0.16766275614500045, "num_tokens": 39948988.0, "step": 15770 }, { "entropy": 6.2724080085754395, "epoch": 1.8205424120023082, "grad_norm": 1.328125, "learning_rate": 0.00046776410214033185, "loss": 6.0754, "mean_token_accuracy": 0.16913768351078035, "num_tokens": 39962177.0, "step": 15775 }, { "entropy": 6.317848825454712, "epoch": 1.8211194460473168, "grad_norm": 2.34375, "learning_rate": 0.0004677428161383417, "loss": 6.0752, "mean_token_accuracy": 0.16904523521661757, "num_tokens": 39975329.0, "step": 15780 }, { "entropy": 6.264898729324341, "epoch": 1.8216964800923254, "grad_norm": 2.453125, "learning_rate": 0.0004677215236535426, "loss": 6.0407, "mean_token_accuracy": 0.16779443323612214, "num_tokens": 39987923.0, "step": 15785 }, { "entropy": 6.34999647140503, "epoch": 1.822273514137334, "grad_norm": 1.6484375, "learning_rate": 0.0004677002246866508, "loss": 6.125, "mean_token_accuracy": 0.16695744693279266, "num_tokens": 40001596.0, "step": 15790 }, { "entropy": 6.289482831954956, "epoch": 1.8228505481823427, "grad_norm": 1.21875, "learning_rate": 0.00046767891923838264, "loss": 6.0273, "mean_token_accuracy": 0.1737503945827484, "num_tokens": 40014207.0, "step": 15795 }, { "entropy": 6.369691467285156, "epoch": 1.8234275822273514, "grad_norm": 1.1796875, "learning_rate": 0.0004676576073094548, "loss": 6.0887, "mean_token_accuracy": 0.16101481169462203, "num_tokens": 40027931.0, "step": 15800 }, { "entropy": 6.339088201522827, "epoch": 1.8240046162723602, "grad_norm": 1.296875, "learning_rate": 0.00046763628890058396, "loss": 6.0971, "mean_token_accuracy": 0.16571219712495805, "num_tokens": 40040463.0, "step": 15805 }, { "entropy": 6.221599912643432, "epoch": 1.8245816503173686, "grad_norm": 1.0546875, "learning_rate": 0.00046761496401248734, "loss": 5.9669, "mean_token_accuracy": 0.17340231388807298, "num_tokens": 40053085.0, "step": 15810 }, { "entropy": 6.316984224319458, "epoch": 1.8251586843623775, "grad_norm": 1.2734375, "learning_rate": 0.000467593632645882, "loss": 6.1351, "mean_token_accuracy": 0.1690345823764801, "num_tokens": 40065771.0, "step": 15815 }, { "entropy": 6.296414136886597, "epoch": 1.825735718407386, "grad_norm": 1.390625, "learning_rate": 0.0004675722948014855, "loss": 6.0543, "mean_token_accuracy": 0.17363547384738923, "num_tokens": 40078939.0, "step": 15820 }, { "entropy": 6.23414626121521, "epoch": 1.8263127524523948, "grad_norm": 1.296875, "learning_rate": 0.00046755095048001556, "loss": 5.9846, "mean_token_accuracy": 0.17467279732227325, "num_tokens": 40091565.0, "step": 15825 }, { "entropy": 6.167823934555054, "epoch": 1.8268897864974032, "grad_norm": 1.96875, "learning_rate": 0.0004675295996821899, "loss": 6.0007, "mean_token_accuracy": 0.16983738988637925, "num_tokens": 40103619.0, "step": 15830 }, { "entropy": 6.311656141281128, "epoch": 1.827466820542412, "grad_norm": 1.3203125, "learning_rate": 0.000467508242408727, "loss": 6.0797, "mean_token_accuracy": 0.1673286721110344, "num_tokens": 40116370.0, "step": 15835 }, { "entropy": 6.304900693893432, "epoch": 1.8280438545874207, "grad_norm": 1.140625, "learning_rate": 0.0004674868786603448, "loss": 5.9791, "mean_token_accuracy": 0.1691321074962616, "num_tokens": 40129015.0, "step": 15840 }, { "entropy": 6.241245222091675, "epoch": 1.8286208886324293, "grad_norm": 1.453125, "learning_rate": 0.0004674655084377622, "loss": 5.9891, "mean_token_accuracy": 0.1670050650835037, "num_tokens": 40141437.0, "step": 15845 }, { "entropy": 6.212176847457886, "epoch": 1.829197922677438, "grad_norm": 1.140625, "learning_rate": 0.0004674441317416978, "loss": 6.0434, "mean_token_accuracy": 0.16276399046182632, "num_tokens": 40154516.0, "step": 15850 }, { "entropy": 6.238998651504517, "epoch": 1.8297749567224466, "grad_norm": 1.1953125, "learning_rate": 0.00046742274857287057, "loss": 5.9534, "mean_token_accuracy": 0.1708405777812004, "num_tokens": 40166598.0, "step": 15855 }, { "entropy": 6.257824850082398, "epoch": 1.8303519907674553, "grad_norm": 1.2109375, "learning_rate": 0.0004674013589319998, "loss": 6.0465, "mean_token_accuracy": 0.1640569418668747, "num_tokens": 40178905.0, "step": 15860 }, { "entropy": 6.317538118362426, "epoch": 1.830929024812464, "grad_norm": 1.1640625, "learning_rate": 0.0004673799628198049, "loss": 6.1051, "mean_token_accuracy": 0.16486846506595612, "num_tokens": 40191678.0, "step": 15865 }, { "entropy": 6.285384607315064, "epoch": 1.8315060588574728, "grad_norm": 1.203125, "learning_rate": 0.00046735856023700546, "loss": 6.0262, "mean_token_accuracy": 0.16484537124633789, "num_tokens": 40204680.0, "step": 15870 }, { "entropy": 6.233611536026001, "epoch": 1.8320830929024812, "grad_norm": 1.2265625, "learning_rate": 0.0004673371511843215, "loss": 6.0817, "mean_token_accuracy": 0.17095134109258653, "num_tokens": 40217026.0, "step": 15875 }, { "entropy": 6.258399248123169, "epoch": 1.83266012694749, "grad_norm": 1.2890625, "learning_rate": 0.0004673157356624729, "loss": 5.9863, "mean_token_accuracy": 0.1706467315554619, "num_tokens": 40228950.0, "step": 15880 }, { "entropy": 6.287282991409302, "epoch": 1.8332371609924984, "grad_norm": 1.28125, "learning_rate": 0.0004672943136721801, "loss": 6.0836, "mean_token_accuracy": 0.16891248077154158, "num_tokens": 40241294.0, "step": 15885 }, { "entropy": 6.341698074340821, "epoch": 1.8338141950375073, "grad_norm": 1.2578125, "learning_rate": 0.0004672728852141636, "loss": 6.0943, "mean_token_accuracy": 0.16762983351945876, "num_tokens": 40253331.0, "step": 15890 }, { "entropy": 6.258095550537109, "epoch": 1.8343912290825157, "grad_norm": 1.609375, "learning_rate": 0.00046725145028914404, "loss": 6.0801, "mean_token_accuracy": 0.16581851840019227, "num_tokens": 40266059.0, "step": 15895 }, { "entropy": 6.256051778793335, "epoch": 1.8349682631275246, "grad_norm": 1.1171875, "learning_rate": 0.0004672300088978425, "loss": 6.0242, "mean_token_accuracy": 0.1764928877353668, "num_tokens": 40278732.0, "step": 15900 }, { "entropy": 6.2313501834869385, "epoch": 1.8355452971725332, "grad_norm": 1.625, "learning_rate": 0.0004672085610409801, "loss": 5.946, "mean_token_accuracy": 0.18284683674573898, "num_tokens": 40290428.0, "step": 15905 }, { "entropy": 6.177774572372437, "epoch": 1.8361223312175419, "grad_norm": 1.0, "learning_rate": 0.00046718710671927815, "loss": 6.0255, "mean_token_accuracy": 0.17687230110168456, "num_tokens": 40302153.0, "step": 15910 }, { "entropy": 6.310884857177735, "epoch": 1.8366993652625505, "grad_norm": 1.1796875, "learning_rate": 0.00046716564593345843, "loss": 6.0497, "mean_token_accuracy": 0.1659906193614006, "num_tokens": 40315493.0, "step": 15915 }, { "entropy": 6.3170911312103275, "epoch": 1.8372763993075591, "grad_norm": 1.34375, "learning_rate": 0.00046714417868424265, "loss": 6.071, "mean_token_accuracy": 0.1596185088157654, "num_tokens": 40328157.0, "step": 15920 }, { "entropy": 6.326702356338501, "epoch": 1.8378534333525678, "grad_norm": 1.4140625, "learning_rate": 0.00046712270497235284, "loss": 6.0964, "mean_token_accuracy": 0.1661912366747856, "num_tokens": 40341684.0, "step": 15925 }, { "entropy": 6.280466222763062, "epoch": 1.8384304673975764, "grad_norm": 1.3984375, "learning_rate": 0.0004671012247985112, "loss": 6.1368, "mean_token_accuracy": 0.16310458034276962, "num_tokens": 40354002.0, "step": 15930 }, { "entropy": 6.223762655258179, "epoch": 1.839007501442585, "grad_norm": 1.0859375, "learning_rate": 0.00046707973816344044, "loss": 6.0223, "mean_token_accuracy": 0.17710338532924652, "num_tokens": 40366211.0, "step": 15935 }, { "entropy": 6.310409069061279, "epoch": 1.8395845354875937, "grad_norm": 1.0390625, "learning_rate": 0.00046705824506786304, "loss": 6.098, "mean_token_accuracy": 0.1691246896982193, "num_tokens": 40377957.0, "step": 15940 }, { "entropy": 6.291127347946167, "epoch": 1.8401615695326026, "grad_norm": 3.203125, "learning_rate": 0.00046703674551250193, "loss": 6.0688, "mean_token_accuracy": 0.16395938247442246, "num_tokens": 40391018.0, "step": 15945 }, { "entropy": 6.228165149688721, "epoch": 1.840738603577611, "grad_norm": 1.265625, "learning_rate": 0.0004670152394980803, "loss": 6.0586, "mean_token_accuracy": 0.168018639087677, "num_tokens": 40405134.0, "step": 15950 }, { "entropy": 6.349109077453614, "epoch": 1.8413156376226198, "grad_norm": 4.15625, "learning_rate": 0.0004669937270253214, "loss": 6.1221, "mean_token_accuracy": 0.1632961302995682, "num_tokens": 40418131.0, "step": 15955 }, { "entropy": 6.31708927154541, "epoch": 1.8418926716676283, "grad_norm": 1.0625, "learning_rate": 0.000466972208094949, "loss": 6.0529, "mean_token_accuracy": 0.16544150561094284, "num_tokens": 40430614.0, "step": 15960 }, { "entropy": 6.308804941177368, "epoch": 1.8424697057126371, "grad_norm": 1.1875, "learning_rate": 0.00046695068270768665, "loss": 6.0683, "mean_token_accuracy": 0.16248993575572968, "num_tokens": 40443200.0, "step": 15965 }, { "entropy": 6.2004454135894775, "epoch": 1.8430467397576455, "grad_norm": 1.7421875, "learning_rate": 0.00046692915086425846, "loss": 6.0024, "mean_token_accuracy": 0.1657170385122299, "num_tokens": 40455662.0, "step": 15970 }, { "entropy": 6.319042015075683, "epoch": 1.8436237738026544, "grad_norm": 1.515625, "learning_rate": 0.00046690761256538857, "loss": 6.0141, "mean_token_accuracy": 0.1710167035460472, "num_tokens": 40468247.0, "step": 15975 }, { "entropy": 6.324203443527222, "epoch": 1.844200807847663, "grad_norm": 1.328125, "learning_rate": 0.0004668860678118015, "loss": 6.1585, "mean_token_accuracy": 0.16913821399211884, "num_tokens": 40480607.0, "step": 15980 }, { "entropy": 6.323934125900268, "epoch": 1.8447778418926717, "grad_norm": 1.0078125, "learning_rate": 0.00046686451660422185, "loss": 6.0394, "mean_token_accuracy": 0.16791746020317078, "num_tokens": 40492140.0, "step": 15985 }, { "entropy": 6.285348176956177, "epoch": 1.8453548759376803, "grad_norm": 1.1015625, "learning_rate": 0.00046684295894337455, "loss": 6.0897, "mean_token_accuracy": 0.16872338950634003, "num_tokens": 40504513.0, "step": 15990 }, { "entropy": 6.237533950805664, "epoch": 1.845931909982689, "grad_norm": 1.1875, "learning_rate": 0.0004668213948299845, "loss": 6.0184, "mean_token_accuracy": 0.16824758648872376, "num_tokens": 40517258.0, "step": 15995 }, { "entropy": 6.234326934814453, "epoch": 1.8465089440276976, "grad_norm": 1.109375, "learning_rate": 0.0004667998242647772, "loss": 6.0702, "mean_token_accuracy": 0.16491250544786454, "num_tokens": 40529092.0, "step": 16000 }, { "entropy": 6.266136550903321, "epoch": 1.8470859780727062, "grad_norm": 1.2265625, "learning_rate": 0.000466778247248478, "loss": 6.0419, "mean_token_accuracy": 0.1642804428935051, "num_tokens": 40543586.0, "step": 16005 }, { "entropy": 6.313886404037476, "epoch": 1.847663012117715, "grad_norm": 1.1953125, "learning_rate": 0.00046675666378181275, "loss": 6.0448, "mean_token_accuracy": 0.17515656352043152, "num_tokens": 40555721.0, "step": 16010 }, { "entropy": 6.2824138641357425, "epoch": 1.8482400461627235, "grad_norm": 1.1484375, "learning_rate": 0.0004667350738655074, "loss": 6.1204, "mean_token_accuracy": 0.1662580594420433, "num_tokens": 40567547.0, "step": 16015 }, { "entropy": 6.233053827285767, "epoch": 1.8488170802077324, "grad_norm": 1.578125, "learning_rate": 0.00046671347750028806, "loss": 5.9538, "mean_token_accuracy": 0.17195529937744142, "num_tokens": 40579498.0, "step": 16020 }, { "entropy": 6.263859844207763, "epoch": 1.8493941142527408, "grad_norm": 0.97265625, "learning_rate": 0.0004666918746868811, "loss": 6.1004, "mean_token_accuracy": 0.1605726420879364, "num_tokens": 40593853.0, "step": 16025 }, { "entropy": 6.250426197052002, "epoch": 1.8499711482977497, "grad_norm": 1.1328125, "learning_rate": 0.0004666702654260133, "loss": 5.992, "mean_token_accuracy": 0.17157431542873383, "num_tokens": 40605737.0, "step": 16030 }, { "entropy": 6.225319910049438, "epoch": 1.850548182342758, "grad_norm": 1.046875, "learning_rate": 0.00046664864971841113, "loss": 5.9642, "mean_token_accuracy": 0.172415129840374, "num_tokens": 40617839.0, "step": 16035 }, { "entropy": 6.265378141403199, "epoch": 1.851125216387767, "grad_norm": 1.515625, "learning_rate": 0.00046662702756480195, "loss": 6.0229, "mean_token_accuracy": 0.17276886850595474, "num_tokens": 40630247.0, "step": 16040 }, { "entropy": 6.222239351272583, "epoch": 1.8517022504327756, "grad_norm": 1.34375, "learning_rate": 0.00046660539896591286, "loss": 5.9997, "mean_token_accuracy": 0.17419626861810683, "num_tokens": 40643869.0, "step": 16045 }, { "entropy": 6.3070024967193605, "epoch": 1.8522792844777842, "grad_norm": 1.046875, "learning_rate": 0.0004665837639224713, "loss": 6.012, "mean_token_accuracy": 0.16875723153352737, "num_tokens": 40655389.0, "step": 16050 }, { "entropy": 6.279503965377808, "epoch": 1.8528563185227929, "grad_norm": 1.078125, "learning_rate": 0.00046656212243520505, "loss": 6.0528, "mean_token_accuracy": 0.165364670753479, "num_tokens": 40667663.0, "step": 16055 }, { "entropy": 6.244712591171265, "epoch": 1.8534333525678015, "grad_norm": 1.3671875, "learning_rate": 0.00046654047450484193, "loss": 5.9987, "mean_token_accuracy": 0.17057995349168778, "num_tokens": 40680623.0, "step": 16060 }, { "entropy": 6.220044422149658, "epoch": 1.8540103866128101, "grad_norm": 1.6328125, "learning_rate": 0.0004665188201321102, "loss": 5.9599, "mean_token_accuracy": 0.1741309642791748, "num_tokens": 40692679.0, "step": 16065 }, { "entropy": 6.258392667770385, "epoch": 1.8545874206578188, "grad_norm": 1.765625, "learning_rate": 0.00046649715931773795, "loss": 6.1387, "mean_token_accuracy": 0.1673455372452736, "num_tokens": 40705187.0, "step": 16070 }, { "entropy": 6.291736078262329, "epoch": 1.8551644547028274, "grad_norm": 1.1171875, "learning_rate": 0.000466475492062454, "loss": 6.087, "mean_token_accuracy": 0.17339060008525847, "num_tokens": 40717854.0, "step": 16075 }, { "entropy": 6.2766063690185545, "epoch": 1.855741488747836, "grad_norm": 1.03125, "learning_rate": 0.00046645381836698684, "loss": 6.1085, "mean_token_accuracy": 0.16265238225460052, "num_tokens": 40731039.0, "step": 16080 }, { "entropy": 6.2548644065856935, "epoch": 1.856318522792845, "grad_norm": 1.1328125, "learning_rate": 0.0004664321382320657, "loss": 6.0184, "mean_token_accuracy": 0.17314105480909348, "num_tokens": 40745065.0, "step": 16085 }, { "entropy": 6.258414602279663, "epoch": 1.8568955568378533, "grad_norm": 1.0703125, "learning_rate": 0.00046641045165841965, "loss": 6.1141, "mean_token_accuracy": 0.16226121485233308, "num_tokens": 40758107.0, "step": 16090 }, { "entropy": 6.270643854141236, "epoch": 1.8574725908828622, "grad_norm": 1.0703125, "learning_rate": 0.00046638875864677814, "loss": 6.1105, "mean_token_accuracy": 0.16872740387916565, "num_tokens": 40771082.0, "step": 16095 }, { "entropy": 6.305703115463257, "epoch": 1.8580496249278706, "grad_norm": 1.015625, "learning_rate": 0.0004663670591978708, "loss": 6.0308, "mean_token_accuracy": 0.16707999408245086, "num_tokens": 40784165.0, "step": 16100 }, { "entropy": 6.237900972366333, "epoch": 1.8586266589728795, "grad_norm": 1.09375, "learning_rate": 0.0004663453533124275, "loss": 5.9312, "mean_token_accuracy": 0.1778552234172821, "num_tokens": 40796279.0, "step": 16105 }, { "entropy": 6.1860754013061525, "epoch": 1.859203693017888, "grad_norm": 1.0625, "learning_rate": 0.0004663236409911783, "loss": 5.9726, "mean_token_accuracy": 0.1731626346707344, "num_tokens": 40809074.0, "step": 16110 }, { "entropy": 6.17712368965149, "epoch": 1.8597807270628968, "grad_norm": 1.2265625, "learning_rate": 0.00046630192223485345, "loss": 5.9326, "mean_token_accuracy": 0.17486831545829773, "num_tokens": 40821086.0, "step": 16115 }, { "entropy": 6.314848279953003, "epoch": 1.8603577611079054, "grad_norm": 1.1171875, "learning_rate": 0.00046628019704418345, "loss": 6.0452, "mean_token_accuracy": 0.16555711328983308, "num_tokens": 40832697.0, "step": 16120 }, { "entropy": 6.169562435150146, "epoch": 1.860934795152914, "grad_norm": 1.2890625, "learning_rate": 0.000466258465419899, "loss": 6.0551, "mean_token_accuracy": 0.16342287957668306, "num_tokens": 40845268.0, "step": 16125 }, { "entropy": 6.295875883102417, "epoch": 1.8615118291979227, "grad_norm": 1.1640625, "learning_rate": 0.0004662367273627312, "loss": 6.0789, "mean_token_accuracy": 0.15954152941703797, "num_tokens": 40858314.0, "step": 16130 }, { "entropy": 6.303014135360717, "epoch": 1.8620888632429313, "grad_norm": 1.109375, "learning_rate": 0.000466214982873411, "loss": 6.0057, "mean_token_accuracy": 0.17139186710119247, "num_tokens": 40869982.0, "step": 16135 }, { "entropy": 6.248759126663208, "epoch": 1.86266589728794, "grad_norm": 1.140625, "learning_rate": 0.00046619323195266975, "loss": 5.9716, "mean_token_accuracy": 0.1751272961497307, "num_tokens": 40881831.0, "step": 16140 }, { "entropy": 6.161066722869873, "epoch": 1.8632429313329486, "grad_norm": 1.3203125, "learning_rate": 0.0004661714746012392, "loss": 6.008, "mean_token_accuracy": 0.17016322016716004, "num_tokens": 40894279.0, "step": 16145 }, { "entropy": 6.233482503890992, "epoch": 1.8638199653779572, "grad_norm": 1.2734375, "learning_rate": 0.000466149710819851, "loss": 6.1207, "mean_token_accuracy": 0.16817092448472976, "num_tokens": 40906960.0, "step": 16150 }, { "entropy": 6.340131759643555, "epoch": 1.8643969994229659, "grad_norm": 1.2890625, "learning_rate": 0.0004661279406092373, "loss": 6.0666, "mean_token_accuracy": 0.16523224860429764, "num_tokens": 40920688.0, "step": 16155 }, { "entropy": 6.30043215751648, "epoch": 1.8649740334679747, "grad_norm": 1.34375, "learning_rate": 0.00046610616397013027, "loss": 6.0865, "mean_token_accuracy": 0.1653803125023842, "num_tokens": 40933017.0, "step": 16160 }, { "entropy": 6.219679450988769, "epoch": 1.8655510675129832, "grad_norm": 1.4765625, "learning_rate": 0.0004660843809032623, "loss": 5.9787, "mean_token_accuracy": 0.17148686349391937, "num_tokens": 40947179.0, "step": 16165 }, { "entropy": 6.283222913742065, "epoch": 1.866128101557992, "grad_norm": 1.28125, "learning_rate": 0.0004660625914093661, "loss": 6.0981, "mean_token_accuracy": 0.1636438712477684, "num_tokens": 40958806.0, "step": 16170 }, { "entropy": 6.313401699066162, "epoch": 1.8667051356030004, "grad_norm": 1.28125, "learning_rate": 0.0004660407954891745, "loss": 6.0434, "mean_token_accuracy": 0.17289685904979707, "num_tokens": 40970667.0, "step": 16175 }, { "entropy": 6.22429256439209, "epoch": 1.8672821696480093, "grad_norm": 1.2265625, "learning_rate": 0.0004660189931434207, "loss": 6.0033, "mean_token_accuracy": 0.16919858902692794, "num_tokens": 40982663.0, "step": 16180 }, { "entropy": 6.23825216293335, "epoch": 1.8678592036930177, "grad_norm": 1.8515625, "learning_rate": 0.0004659971843728379, "loss": 6.0046, "mean_token_accuracy": 0.16918305009603501, "num_tokens": 40995168.0, "step": 16185 }, { "entropy": 6.307004165649414, "epoch": 1.8684362377380266, "grad_norm": 1.1640625, "learning_rate": 0.0004659753691781597, "loss": 6.0791, "mean_token_accuracy": 0.1678227812051773, "num_tokens": 41007159.0, "step": 16190 }, { "entropy": 6.231713056564331, "epoch": 1.8690132717830352, "grad_norm": 1.3828125, "learning_rate": 0.0004659535475601198, "loss": 5.9706, "mean_token_accuracy": 0.16688550263643265, "num_tokens": 41019860.0, "step": 16195 }, { "entropy": 6.203270149230957, "epoch": 1.8695903058280439, "grad_norm": 1.7421875, "learning_rate": 0.00046593171951945226, "loss": 6.0379, "mean_token_accuracy": 0.1657431960105896, "num_tokens": 41031635.0, "step": 16200 }, { "entropy": 6.259737777709961, "epoch": 1.8701673398730525, "grad_norm": 1.0703125, "learning_rate": 0.00046590988505689114, "loss": 6.0626, "mean_token_accuracy": 0.16913105845451354, "num_tokens": 41044678.0, "step": 16205 }, { "entropy": 6.280846738815308, "epoch": 1.8707443739180611, "grad_norm": 1.390625, "learning_rate": 0.00046588804417317084, "loss": 6.1166, "mean_token_accuracy": 0.16795769333839417, "num_tokens": 41056799.0, "step": 16210 }, { "entropy": 6.287213611602783, "epoch": 1.8713214079630698, "grad_norm": 1.3359375, "learning_rate": 0.00046586619686902597, "loss": 6.1045, "mean_token_accuracy": 0.16530012637376784, "num_tokens": 41069700.0, "step": 16215 }, { "entropy": 6.308014869689941, "epoch": 1.8718984420080784, "grad_norm": 1.25, "learning_rate": 0.00046584434314519144, "loss": 6.0134, "mean_token_accuracy": 0.17250948995351792, "num_tokens": 41081427.0, "step": 16220 }, { "entropy": 6.290389108657837, "epoch": 1.8724754760530873, "grad_norm": 2.453125, "learning_rate": 0.0004658224830024022, "loss": 6.0395, "mean_token_accuracy": 0.17142314016819, "num_tokens": 41094770.0, "step": 16225 }, { "entropy": 6.228277778625488, "epoch": 1.8730525100980957, "grad_norm": 1.25, "learning_rate": 0.0004658006164413935, "loss": 5.9786, "mean_token_accuracy": 0.1729537844657898, "num_tokens": 41106802.0, "step": 16230 }, { "entropy": 6.216348171234131, "epoch": 1.8736295441431046, "grad_norm": 1.09375, "learning_rate": 0.0004657787434629009, "loss": 6.0816, "mean_token_accuracy": 0.17646737545728683, "num_tokens": 41120125.0, "step": 16235 }, { "entropy": 6.105568265914917, "epoch": 1.874206578188113, "grad_norm": 1.328125, "learning_rate": 0.00046575686406765993, "loss": 6.052, "mean_token_accuracy": 0.17620332092046737, "num_tokens": 41134267.0, "step": 16240 }, { "entropy": 6.314919900894165, "epoch": 1.8747836122331218, "grad_norm": 0.99609375, "learning_rate": 0.00046573497825640664, "loss": 6.0825, "mean_token_accuracy": 0.1711890734732151, "num_tokens": 41147266.0, "step": 16245 }, { "entropy": 6.271852016448975, "epoch": 1.8753606462781303, "grad_norm": 1.5625, "learning_rate": 0.0004657130860298771, "loss": 6.0167, "mean_token_accuracy": 0.17353598028421402, "num_tokens": 41159666.0, "step": 16250 }, { "entropy": 6.266560459136963, "epoch": 1.8759376803231391, "grad_norm": 1.1875, "learning_rate": 0.0004656911873888077, "loss": 6.0694, "mean_token_accuracy": 0.16777328699827193, "num_tokens": 41171947.0, "step": 16255 }, { "entropy": 6.214862108230591, "epoch": 1.8765147143681478, "grad_norm": 1.625, "learning_rate": 0.0004656692823339349, "loss": 6.0512, "mean_token_accuracy": 0.1780415490269661, "num_tokens": 41186376.0, "step": 16260 }, { "entropy": 6.257151699066162, "epoch": 1.8770917484131564, "grad_norm": 1.0625, "learning_rate": 0.0004656473708659955, "loss": 6.073, "mean_token_accuracy": 0.1731489807367325, "num_tokens": 41199730.0, "step": 16265 }, { "entropy": 6.250900554656982, "epoch": 1.877668782458165, "grad_norm": 1.375, "learning_rate": 0.00046562545298572646, "loss": 6.0228, "mean_token_accuracy": 0.17911915779113768, "num_tokens": 41212502.0, "step": 16270 }, { "entropy": 6.185820722579956, "epoch": 1.8782458165031737, "grad_norm": 1.4140625, "learning_rate": 0.000465603528693865, "loss": 5.9887, "mean_token_accuracy": 0.17167483866214753, "num_tokens": 41226006.0, "step": 16275 }, { "entropy": 6.316561460494995, "epoch": 1.8788228505481823, "grad_norm": 1.0546875, "learning_rate": 0.00046558159799114853, "loss": 6.044, "mean_token_accuracy": 0.16871319115161895, "num_tokens": 41239172.0, "step": 16280 }, { "entropy": 6.207419347763062, "epoch": 1.879399884593191, "grad_norm": 1.140625, "learning_rate": 0.0004655596608783147, "loss": 5.9569, "mean_token_accuracy": 0.17857006043195725, "num_tokens": 41251307.0, "step": 16285 }, { "entropy": 6.265816640853882, "epoch": 1.8799769186381996, "grad_norm": 1.2578125, "learning_rate": 0.00046553771735610136, "loss": 6.0126, "mean_token_accuracy": 0.16932079792022706, "num_tokens": 41264634.0, "step": 16290 }, { "entropy": 6.2975006103515625, "epoch": 1.8805539526832082, "grad_norm": 1.71875, "learning_rate": 0.0004655157674252465, "loss": 6.0935, "mean_token_accuracy": 0.15814897865056993, "num_tokens": 41278205.0, "step": 16295 }, { "entropy": 6.317185497283935, "epoch": 1.881130986728217, "grad_norm": 1.125, "learning_rate": 0.00046549381108648843, "loss": 6.0527, "mean_token_accuracy": 0.1710874080657959, "num_tokens": 41290447.0, "step": 16300 }, { "entropy": 6.305042934417725, "epoch": 1.8817080207732255, "grad_norm": 1.4609375, "learning_rate": 0.0004654718483405656, "loss": 5.9676, "mean_token_accuracy": 0.17561424076557158, "num_tokens": 41302948.0, "step": 16305 }, { "entropy": 6.232265901565552, "epoch": 1.8822850548182344, "grad_norm": 1.7109375, "learning_rate": 0.00046544987918821685, "loss": 6.1008, "mean_token_accuracy": 0.16179861277341842, "num_tokens": 41315237.0, "step": 16310 }, { "entropy": 6.131192016601562, "epoch": 1.8828620888632428, "grad_norm": 2.0625, "learning_rate": 0.000465427903630181, "loss": 5.9238, "mean_token_accuracy": 0.18151000291109085, "num_tokens": 41327426.0, "step": 16315 }, { "entropy": 6.361543273925781, "epoch": 1.8834391229082517, "grad_norm": 1.4453125, "learning_rate": 0.0004654059216671972, "loss": 6.1255, "mean_token_accuracy": 0.1627553418278694, "num_tokens": 41340517.0, "step": 16320 }, { "entropy": 6.213067150115966, "epoch": 1.88401615695326, "grad_norm": 1.6796875, "learning_rate": 0.0004653839333000048, "loss": 6.0259, "mean_token_accuracy": 0.1693815842270851, "num_tokens": 41353520.0, "step": 16325 }, { "entropy": 6.259006404876709, "epoch": 1.884593190998269, "grad_norm": 1.2890625, "learning_rate": 0.00046536193852934334, "loss": 6.0648, "mean_token_accuracy": 0.1702921360731125, "num_tokens": 41366326.0, "step": 16330 }, { "entropy": 6.230393600463867, "epoch": 1.8851702250432776, "grad_norm": 1.171875, "learning_rate": 0.00046533993735595273, "loss": 5.974, "mean_token_accuracy": 0.17455315291881562, "num_tokens": 41377405.0, "step": 16335 }, { "entropy": 6.313044166564941, "epoch": 1.8857472590882862, "grad_norm": 1.4921875, "learning_rate": 0.00046531792978057277, "loss": 6.1152, "mean_token_accuracy": 0.1636503666639328, "num_tokens": 41391038.0, "step": 16340 }, { "entropy": 6.267929553985596, "epoch": 1.8863242931332949, "grad_norm": 1.296875, "learning_rate": 0.0004652959158039438, "loss": 6.0527, "mean_token_accuracy": 0.1683339387178421, "num_tokens": 41404069.0, "step": 16345 }, { "entropy": 6.2727337837219235, "epoch": 1.8869013271783035, "grad_norm": 1.265625, "learning_rate": 0.0004652738954268062, "loss": 6.0436, "mean_token_accuracy": 0.1729697972536087, "num_tokens": 41416698.0, "step": 16350 }, { "entropy": 6.213017225265503, "epoch": 1.8874783612233121, "grad_norm": 1.9453125, "learning_rate": 0.00046525186864990073, "loss": 6.0148, "mean_token_accuracy": 0.17483233362436296, "num_tokens": 41429953.0, "step": 16355 }, { "entropy": 6.182444763183594, "epoch": 1.8880553952683208, "grad_norm": 1.2421875, "learning_rate": 0.00046522983547396806, "loss": 6.0384, "mean_token_accuracy": 0.16858932971954346, "num_tokens": 41442824.0, "step": 16360 }, { "entropy": 6.258214044570923, "epoch": 1.8886324293133296, "grad_norm": 1.859375, "learning_rate": 0.0004652077958997494, "loss": 6.0562, "mean_token_accuracy": 0.17258467972278596, "num_tokens": 41455062.0, "step": 16365 }, { "entropy": 6.214363622665405, "epoch": 1.889209463358338, "grad_norm": 1.484375, "learning_rate": 0.00046518574992798604, "loss": 5.9594, "mean_token_accuracy": 0.18245875984430313, "num_tokens": 41468147.0, "step": 16370 }, { "entropy": 6.234375715255737, "epoch": 1.889786497403347, "grad_norm": 1.6328125, "learning_rate": 0.00046516369755941945, "loss": 5.9635, "mean_token_accuracy": 0.1727774828672409, "num_tokens": 41480664.0, "step": 16375 }, { "entropy": 6.266945314407349, "epoch": 1.8903635314483553, "grad_norm": 1.046875, "learning_rate": 0.0004651416387947914, "loss": 6.0572, "mean_token_accuracy": 0.16870816498994828, "num_tokens": 41494578.0, "step": 16380 }, { "entropy": 6.309160470962524, "epoch": 1.8909405654933642, "grad_norm": 1.2578125, "learning_rate": 0.0004651195736348437, "loss": 6.0935, "mean_token_accuracy": 0.1649898260831833, "num_tokens": 41506528.0, "step": 16385 }, { "entropy": 6.325799036026001, "epoch": 1.8915175995383726, "grad_norm": 1.0625, "learning_rate": 0.0004650975020803186, "loss": 6.1549, "mean_token_accuracy": 0.16303233057260513, "num_tokens": 41520861.0, "step": 16390 }, { "entropy": 6.268583345413208, "epoch": 1.8920946335833815, "grad_norm": 1.5859375, "learning_rate": 0.0004650754241319584, "loss": 6.0208, "mean_token_accuracy": 0.17048420161008834, "num_tokens": 41533811.0, "step": 16395 }, { "entropy": 6.324508285522461, "epoch": 1.8926716676283901, "grad_norm": 1.0390625, "learning_rate": 0.00046505333979050573, "loss": 6.0909, "mean_token_accuracy": 0.16676845252513886, "num_tokens": 41546291.0, "step": 16400 }, { "entropy": 6.226980972290039, "epoch": 1.8932487016733988, "grad_norm": 1.296875, "learning_rate": 0.0004650312490567035, "loss": 5.9405, "mean_token_accuracy": 0.18085718005895615, "num_tokens": 41558157.0, "step": 16405 }, { "entropy": 6.266756439208985, "epoch": 1.8938257357184074, "grad_norm": 1.1640625, "learning_rate": 0.0004650091519312945, "loss": 6.0759, "mean_token_accuracy": 0.17133705019950868, "num_tokens": 41571346.0, "step": 16410 }, { "entropy": 6.298261976242065, "epoch": 1.894402769763416, "grad_norm": 1.0859375, "learning_rate": 0.00046498704841502203, "loss": 6.1362, "mean_token_accuracy": 0.16385228782892228, "num_tokens": 41583973.0, "step": 16415 }, { "entropy": 6.292732286453247, "epoch": 1.8949798038084247, "grad_norm": 1.1328125, "learning_rate": 0.0004649649385086296, "loss": 6.0488, "mean_token_accuracy": 0.16712913364171983, "num_tokens": 41596210.0, "step": 16420 }, { "entropy": 6.289768648147583, "epoch": 1.8955568378534333, "grad_norm": 1.078125, "learning_rate": 0.0004649428222128608, "loss": 6.1271, "mean_token_accuracy": 0.16882113367319107, "num_tokens": 41608297.0, "step": 16425 }, { "entropy": 6.313119888305664, "epoch": 1.896133871898442, "grad_norm": 1.4296875, "learning_rate": 0.00046492069952845953, "loss": 6.0681, "mean_token_accuracy": 0.1669365108013153, "num_tokens": 41621319.0, "step": 16430 }, { "entropy": 6.320606660842896, "epoch": 1.8967109059434506, "grad_norm": 0.9921875, "learning_rate": 0.00046489857045617, "loss": 5.9629, "mean_token_accuracy": 0.17546855211257933, "num_tokens": 41633282.0, "step": 16435 }, { "entropy": 6.16384072303772, "epoch": 1.8972879399884595, "grad_norm": 1.0703125, "learning_rate": 0.00046487643499673625, "loss": 6.0354, "mean_token_accuracy": 0.16361497044563295, "num_tokens": 41646573.0, "step": 16440 }, { "entropy": 6.252078866958618, "epoch": 1.8978649740334679, "grad_norm": 1.015625, "learning_rate": 0.0004648542931509029, "loss": 5.999, "mean_token_accuracy": 0.17221661657094955, "num_tokens": 41659596.0, "step": 16445 }, { "entropy": 6.289477062225342, "epoch": 1.8984420080784767, "grad_norm": 1.1015625, "learning_rate": 0.0004648321449194148, "loss": 6.0247, "mean_token_accuracy": 0.16427045613527297, "num_tokens": 41673612.0, "step": 16450 }, { "entropy": 6.313947153091431, "epoch": 1.8990190421234852, "grad_norm": 1.3671875, "learning_rate": 0.00046480999030301673, "loss": 6.1183, "mean_token_accuracy": 0.1691570982336998, "num_tokens": 41686583.0, "step": 16455 }, { "entropy": 6.2747705459594725, "epoch": 1.899596076168494, "grad_norm": 1.078125, "learning_rate": 0.00046478782930245395, "loss": 6.0277, "mean_token_accuracy": 0.16731169670820237, "num_tokens": 41698542.0, "step": 16460 }, { "entropy": 6.274620056152344, "epoch": 1.9001731102135024, "grad_norm": 1.265625, "learning_rate": 0.00046476566191847176, "loss": 6.0712, "mean_token_accuracy": 0.16262018978595733, "num_tokens": 41712461.0, "step": 16465 }, { "entropy": 6.319371175765991, "epoch": 1.9007501442585113, "grad_norm": 1.6484375, "learning_rate": 0.0004647434881518159, "loss": 6.0762, "mean_token_accuracy": 0.16481758207082747, "num_tokens": 41725450.0, "step": 16470 }, { "entropy": 6.324736642837524, "epoch": 1.90132717830352, "grad_norm": 1.1171875, "learning_rate": 0.00046472130800323194, "loss": 6.0425, "mean_token_accuracy": 0.17140338122844695, "num_tokens": 41737255.0, "step": 16475 }, { "entropy": 6.234397840499878, "epoch": 1.9019042123485286, "grad_norm": 1.1015625, "learning_rate": 0.0004646991214734661, "loss": 6.0915, "mean_token_accuracy": 0.1634446457028389, "num_tokens": 41749459.0, "step": 16480 }, { "entropy": 6.248945045471191, "epoch": 1.9024812463935372, "grad_norm": 1.140625, "learning_rate": 0.0004646769285632645, "loss": 6.0365, "mean_token_accuracy": 0.17080003917217254, "num_tokens": 41761603.0, "step": 16485 }, { "entropy": 6.2919713973999025, "epoch": 1.9030582804385459, "grad_norm": 1.109375, "learning_rate": 0.0004646547292733737, "loss": 6.1242, "mean_token_accuracy": 0.16482744812965394, "num_tokens": 41774865.0, "step": 16490 }, { "entropy": 6.240364503860474, "epoch": 1.9036353144835545, "grad_norm": 1.203125, "learning_rate": 0.0004646325236045402, "loss": 6.0715, "mean_token_accuracy": 0.17352937161922455, "num_tokens": 41787558.0, "step": 16495 }, { "entropy": 6.2833081722259525, "epoch": 1.9042123485285631, "grad_norm": 1.234375, "learning_rate": 0.000464610311557511, "loss": 5.9958, "mean_token_accuracy": 0.1723578542470932, "num_tokens": 41800754.0, "step": 16500 }, { "entropy": 6.26614818572998, "epoch": 1.904789382573572, "grad_norm": 1.0625, "learning_rate": 0.0004645880931330331, "loss": 5.9604, "mean_token_accuracy": 0.1790569856762886, "num_tokens": 41813133.0, "step": 16505 }, { "entropy": 6.22602105140686, "epoch": 1.9053664166185804, "grad_norm": 1.203125, "learning_rate": 0.0004645658683318539, "loss": 6.0363, "mean_token_accuracy": 0.16803948283195497, "num_tokens": 41825288.0, "step": 16510 }, { "entropy": 6.312449026107788, "epoch": 1.9059434506635893, "grad_norm": 1.2890625, "learning_rate": 0.0004645436371547209, "loss": 6.1145, "mean_token_accuracy": 0.1666354864835739, "num_tokens": 41837331.0, "step": 16515 }, { "entropy": 6.313289451599121, "epoch": 1.9065204847085977, "grad_norm": 1.0703125, "learning_rate": 0.00046452139960238186, "loss": 6.0976, "mean_token_accuracy": 0.170522104203701, "num_tokens": 41850536.0, "step": 16520 }, { "entropy": 6.264101219177246, "epoch": 1.9070975187536066, "grad_norm": 1.09375, "learning_rate": 0.00046449915567558467, "loss": 5.9937, "mean_token_accuracy": 0.17788014858961104, "num_tokens": 41862199.0, "step": 16525 }, { "entropy": 6.239650011062622, "epoch": 1.907674552798615, "grad_norm": 1.171875, "learning_rate": 0.0004644769053750775, "loss": 6.0172, "mean_token_accuracy": 0.17359801530838012, "num_tokens": 41872945.0, "step": 16530 }, { "entropy": 6.2783403396606445, "epoch": 1.9082515868436238, "grad_norm": 1.046875, "learning_rate": 0.0004644546487016087, "loss": 5.9911, "mean_token_accuracy": 0.1715606838464737, "num_tokens": 41884223.0, "step": 16535 }, { "entropy": 6.246064186096191, "epoch": 1.9088286208886325, "grad_norm": 0.95703125, "learning_rate": 0.00046443238565592687, "loss": 6.0527, "mean_token_accuracy": 0.16985336393117906, "num_tokens": 41896997.0, "step": 16540 }, { "entropy": 6.231339931488037, "epoch": 1.9094056549336411, "grad_norm": 1.3515625, "learning_rate": 0.00046441011623878087, "loss": 6.0796, "mean_token_accuracy": 0.16984277367591857, "num_tokens": 41910210.0, "step": 16545 }, { "entropy": 6.087150573730469, "epoch": 1.9099826889786498, "grad_norm": 1.2734375, "learning_rate": 0.0004643878404509197, "loss": 5.8959, "mean_token_accuracy": 0.18043217658996583, "num_tokens": 41922882.0, "step": 16550 }, { "entropy": 6.229480791091919, "epoch": 1.9105597230236584, "grad_norm": 1.1640625, "learning_rate": 0.00046436555829309264, "loss": 5.9189, "mean_token_accuracy": 0.1844248279929161, "num_tokens": 41934655.0, "step": 16555 }, { "entropy": 6.253088045120239, "epoch": 1.911136757068667, "grad_norm": 1.1484375, "learning_rate": 0.000464343269766049, "loss": 6.04, "mean_token_accuracy": 0.16934573352336885, "num_tokens": 41947946.0, "step": 16560 }, { "entropy": 6.3426737785339355, "epoch": 1.9117137911136757, "grad_norm": 1.3046875, "learning_rate": 0.00046432097487053857, "loss": 6.1505, "mean_token_accuracy": 0.16838859617710114, "num_tokens": 41962316.0, "step": 16565 }, { "entropy": 6.282298374176025, "epoch": 1.9122908251586843, "grad_norm": 1.1953125, "learning_rate": 0.00046429867360731124, "loss": 6.0264, "mean_token_accuracy": 0.17507038414478301, "num_tokens": 41976076.0, "step": 16570 }, { "entropy": 6.328230476379394, "epoch": 1.912867859203693, "grad_norm": 2.0625, "learning_rate": 0.00046427636597711695, "loss": 6.0817, "mean_token_accuracy": 0.16239470541477202, "num_tokens": 41988762.0, "step": 16575 }, { "entropy": 6.192126226425171, "epoch": 1.9134448932487018, "grad_norm": 1.0390625, "learning_rate": 0.00046425405198070624, "loss": 5.9454, "mean_token_accuracy": 0.17111702710390092, "num_tokens": 42000525.0, "step": 16580 }, { "entropy": 6.195065450668335, "epoch": 1.9140219272937102, "grad_norm": 1.234375, "learning_rate": 0.00046423173161882944, "loss": 5.9222, "mean_token_accuracy": 0.17092446684837342, "num_tokens": 42013716.0, "step": 16585 }, { "entropy": 6.277429103851318, "epoch": 1.914598961338719, "grad_norm": 1.1328125, "learning_rate": 0.00046420940489223735, "loss": 6.0313, "mean_token_accuracy": 0.17426891773939132, "num_tokens": 42026689.0, "step": 16590 }, { "entropy": 6.289929008483886, "epoch": 1.9151759953837275, "grad_norm": 1.015625, "learning_rate": 0.0004641870718016809, "loss": 6.0947, "mean_token_accuracy": 0.16388041228055955, "num_tokens": 42039907.0, "step": 16595 }, { "entropy": 6.276375436782837, "epoch": 1.9157530294287364, "grad_norm": 1.1953125, "learning_rate": 0.0004641647323479113, "loss": 6.0451, "mean_token_accuracy": 0.173135207593441, "num_tokens": 42052781.0, "step": 16600 }, { "entropy": 6.243412160873413, "epoch": 1.9163300634737448, "grad_norm": 1.921875, "learning_rate": 0.0004641423865316798, "loss": 6.0177, "mean_token_accuracy": 0.17488401681184768, "num_tokens": 42066695.0, "step": 16605 }, { "entropy": 6.1937644481658936, "epoch": 1.9169070975187537, "grad_norm": 1.109375, "learning_rate": 0.0004641200343537381, "loss": 5.941, "mean_token_accuracy": 0.17501333504915237, "num_tokens": 42079315.0, "step": 16610 }, { "entropy": 6.265763568878174, "epoch": 1.9174841315637623, "grad_norm": 1.109375, "learning_rate": 0.000464097675814838, "loss": 6.058, "mean_token_accuracy": 0.16800168603658677, "num_tokens": 42091915.0, "step": 16615 }, { "entropy": 6.3285560131073, "epoch": 1.918061165608771, "grad_norm": 1.1484375, "learning_rate": 0.0004640753109157316, "loss": 6.1058, "mean_token_accuracy": 0.16329863667488098, "num_tokens": 42105316.0, "step": 16620 }, { "entropy": 6.2566338062286375, "epoch": 1.9186381996537796, "grad_norm": 1.1640625, "learning_rate": 0.00046405293965717093, "loss": 5.9762, "mean_token_accuracy": 0.1756441429257393, "num_tokens": 42118078.0, "step": 16625 }, { "entropy": 6.134314250946045, "epoch": 1.9192152336987882, "grad_norm": 1.0390625, "learning_rate": 0.0004640305620399086, "loss": 5.961, "mean_token_accuracy": 0.18055089563131332, "num_tokens": 42130845.0, "step": 16630 }, { "entropy": 6.211712741851807, "epoch": 1.9197922677437969, "grad_norm": 1.125, "learning_rate": 0.0004640081780646971, "loss": 6.0069, "mean_token_accuracy": 0.17803016901016236, "num_tokens": 42142487.0, "step": 16635 }, { "entropy": 6.216660976409912, "epoch": 1.9203693017888055, "grad_norm": 1.3359375, "learning_rate": 0.00046398578773228954, "loss": 6.0323, "mean_token_accuracy": 0.17111165076494217, "num_tokens": 42154747.0, "step": 16640 }, { "entropy": 6.373775386810303, "epoch": 1.9209463358338144, "grad_norm": 1.2734375, "learning_rate": 0.00046396339104343886, "loss": 6.0687, "mean_token_accuracy": 0.1637737326323986, "num_tokens": 42167697.0, "step": 16645 }, { "entropy": 6.2525794506073, "epoch": 1.9215233698788228, "grad_norm": 0.97265625, "learning_rate": 0.0004639409879988984, "loss": 6.0448, "mean_token_accuracy": 0.17294813096523284, "num_tokens": 42179874.0, "step": 16650 }, { "entropy": 6.323226881027222, "epoch": 1.9221004039238316, "grad_norm": 1.1328125, "learning_rate": 0.0004639185785994216, "loss": 6.1124, "mean_token_accuracy": 0.1681394025683403, "num_tokens": 42192747.0, "step": 16655 }, { "entropy": 6.206807041168213, "epoch": 1.92267743796884, "grad_norm": 1.1171875, "learning_rate": 0.00046389616284576226, "loss": 6.0361, "mean_token_accuracy": 0.16698787957429886, "num_tokens": 42205534.0, "step": 16660 }, { "entropy": 6.251869058609008, "epoch": 1.923254472013849, "grad_norm": 2.609375, "learning_rate": 0.00046387374073867435, "loss": 6.044, "mean_token_accuracy": 0.17046794891357422, "num_tokens": 42217825.0, "step": 16665 }, { "entropy": 6.248140335083008, "epoch": 1.9238315060588573, "grad_norm": 1.078125, "learning_rate": 0.00046385131227891197, "loss": 6.0233, "mean_token_accuracy": 0.17224513739347458, "num_tokens": 42230162.0, "step": 16670 }, { "entropy": 6.189965867996216, "epoch": 1.9244085401038662, "grad_norm": 1.1640625, "learning_rate": 0.0004638288774672295, "loss": 6.0039, "mean_token_accuracy": 0.17534219622612, "num_tokens": 42242458.0, "step": 16675 }, { "entropy": 6.134315395355225, "epoch": 1.9249855741488748, "grad_norm": 1.1328125, "learning_rate": 0.0004638064363043816, "loss": 5.9364, "mean_token_accuracy": 0.17521344423294066, "num_tokens": 42254389.0, "step": 16680 }, { "entropy": 6.185854196548462, "epoch": 1.9255626081938835, "grad_norm": 1.09375, "learning_rate": 0.00046378398879112293, "loss": 6.0245, "mean_token_accuracy": 0.17561282962560654, "num_tokens": 42266421.0, "step": 16685 }, { "entropy": 6.145219898223877, "epoch": 1.9261396422388921, "grad_norm": 1.4765625, "learning_rate": 0.0004637615349282086, "loss": 5.9901, "mean_token_accuracy": 0.17165957987308503, "num_tokens": 42279189.0, "step": 16690 }, { "entropy": 6.226276779174805, "epoch": 1.9267166762839008, "grad_norm": 1.0234375, "learning_rate": 0.0004637390747163938, "loss": 6.0187, "mean_token_accuracy": 0.17052838951349258, "num_tokens": 42291970.0, "step": 16695 }, { "entropy": 6.288958930969239, "epoch": 1.9272937103289094, "grad_norm": 1.0390625, "learning_rate": 0.0004637166081564339, "loss": 6.1009, "mean_token_accuracy": 0.16882906556129457, "num_tokens": 42305185.0, "step": 16700 }, { "entropy": 6.345633840560913, "epoch": 1.927870744373918, "grad_norm": 1.2734375, "learning_rate": 0.00046369413524908473, "loss": 6.0885, "mean_token_accuracy": 0.16870655864477158, "num_tokens": 42317823.0, "step": 16705 }, { "entropy": 6.186788845062256, "epoch": 1.9284477784189267, "grad_norm": 1.0546875, "learning_rate": 0.00046367165599510207, "loss": 6.0494, "mean_token_accuracy": 0.17140022963285445, "num_tokens": 42330540.0, "step": 16710 }, { "entropy": 6.201239490509034, "epoch": 1.9290248124639353, "grad_norm": 1.0234375, "learning_rate": 0.0004636491703952419, "loss": 5.8622, "mean_token_accuracy": 0.18321040272712708, "num_tokens": 42342347.0, "step": 16715 }, { "entropy": 6.2329206466674805, "epoch": 1.9296018465089442, "grad_norm": 1.0546875, "learning_rate": 0.00046362667845026057, "loss": 6.0089, "mean_token_accuracy": 0.17573418319225312, "num_tokens": 42355004.0, "step": 16720 }, { "entropy": 6.245389366149903, "epoch": 1.9301788805539526, "grad_norm": 1.25, "learning_rate": 0.00046360418016091467, "loss": 5.9942, "mean_token_accuracy": 0.17386723011732103, "num_tokens": 42366700.0, "step": 16725 }, { "entropy": 6.2483916759490965, "epoch": 1.9307559145989615, "grad_norm": 1.140625, "learning_rate": 0.00046358167552796085, "loss": 6.0717, "mean_token_accuracy": 0.16806585043668748, "num_tokens": 42379723.0, "step": 16730 }, { "entropy": 6.20191330909729, "epoch": 1.9313329486439699, "grad_norm": 1.125, "learning_rate": 0.00046355916455215597, "loss": 5.9851, "mean_token_accuracy": 0.18643948137760163, "num_tokens": 42393505.0, "step": 16735 }, { "entropy": 6.259112405776977, "epoch": 1.9319099826889787, "grad_norm": 1.203125, "learning_rate": 0.0004635366472342573, "loss": 6.003, "mean_token_accuracy": 0.164619180560112, "num_tokens": 42406334.0, "step": 16740 }, { "entropy": 6.253616046905518, "epoch": 1.9324870167339872, "grad_norm": 1.03125, "learning_rate": 0.0004635141235750222, "loss": 6.022, "mean_token_accuracy": 0.1686533898115158, "num_tokens": 42418585.0, "step": 16745 }, { "entropy": 6.243710851669311, "epoch": 1.933064050778996, "grad_norm": 1.0390625, "learning_rate": 0.00046349159357520815, "loss": 5.98, "mean_token_accuracy": 0.18272491544485092, "num_tokens": 42430741.0, "step": 16750 }, { "entropy": 6.187639904022217, "epoch": 1.9336410848240047, "grad_norm": 1.203125, "learning_rate": 0.000463469057235573, "loss": 5.9783, "mean_token_accuracy": 0.17807655930519103, "num_tokens": 42443241.0, "step": 16755 }, { "entropy": 6.195738410949707, "epoch": 1.9342181188690133, "grad_norm": 1.078125, "learning_rate": 0.00046344651455687476, "loss": 6.0625, "mean_token_accuracy": 0.17015268355607988, "num_tokens": 42456476.0, "step": 16760 }, { "entropy": 6.336266040802002, "epoch": 1.934795152914022, "grad_norm": 1.2265625, "learning_rate": 0.00046342396553987155, "loss": 6.0827, "mean_token_accuracy": 0.16396595537662506, "num_tokens": 42468875.0, "step": 16765 }, { "entropy": 6.288597249984742, "epoch": 1.9353721869590306, "grad_norm": 1.2890625, "learning_rate": 0.00046340141018532186, "loss": 6.0448, "mean_token_accuracy": 0.16845245212316512, "num_tokens": 42483300.0, "step": 16770 }, { "entropy": 6.210137605667114, "epoch": 1.9359492210040392, "grad_norm": 1.3203125, "learning_rate": 0.0004633788484939843, "loss": 6.0626, "mean_token_accuracy": 0.17025937288999557, "num_tokens": 42497748.0, "step": 16775 }, { "entropy": 6.2557402610778805, "epoch": 1.9365262550490479, "grad_norm": 1.2109375, "learning_rate": 0.00046335628046661776, "loss": 6.0758, "mean_token_accuracy": 0.1684375673532486, "num_tokens": 42510464.0, "step": 16780 }, { "entropy": 6.335916376113891, "epoch": 1.9371032890940567, "grad_norm": 1.078125, "learning_rate": 0.00046333370610398135, "loss": 6.094, "mean_token_accuracy": 0.16555423587560653, "num_tokens": 42522298.0, "step": 16785 }, { "entropy": 6.318788480758667, "epoch": 1.9376803231390651, "grad_norm": 2.234375, "learning_rate": 0.0004633111254068342, "loss": 6.0237, "mean_token_accuracy": 0.16976431906223297, "num_tokens": 42535094.0, "step": 16790 }, { "entropy": 6.217743253707885, "epoch": 1.938257357184074, "grad_norm": 1.171875, "learning_rate": 0.0004632885383759359, "loss": 5.9903, "mean_token_accuracy": 0.17622564733028412, "num_tokens": 42547272.0, "step": 16795 }, { "entropy": 6.130745124816895, "epoch": 1.9388343912290824, "grad_norm": 1.1875, "learning_rate": 0.00046326594501204624, "loss": 5.8878, "mean_token_accuracy": 0.1842793568968773, "num_tokens": 42559568.0, "step": 16800 }, { "entropy": 6.2765467166900635, "epoch": 1.9394114252740913, "grad_norm": 1.28125, "learning_rate": 0.000463243345315925, "loss": 6.0805, "mean_token_accuracy": 0.16390738338232042, "num_tokens": 42573177.0, "step": 16805 }, { "entropy": 6.263757228851318, "epoch": 1.9399884593190997, "grad_norm": 1.359375, "learning_rate": 0.00046322073928833224, "loss": 5.9897, "mean_token_accuracy": 0.17142129838466644, "num_tokens": 42585436.0, "step": 16810 }, { "entropy": 6.274092197418213, "epoch": 1.9405654933641086, "grad_norm": 1.1484375, "learning_rate": 0.0004631981269300285, "loss": 6.066, "mean_token_accuracy": 0.16510260999202728, "num_tokens": 42599826.0, "step": 16815 }, { "entropy": 6.223218488693237, "epoch": 1.9411425274091172, "grad_norm": 1.4140625, "learning_rate": 0.0004631755082417742, "loss": 6.0508, "mean_token_accuracy": 0.1671837419271469, "num_tokens": 42613901.0, "step": 16820 }, { "entropy": 6.325699520111084, "epoch": 1.9417195614541258, "grad_norm": 1.875, "learning_rate": 0.0004631528832243302, "loss": 6.0685, "mean_token_accuracy": 0.1655432403087616, "num_tokens": 42626592.0, "step": 16825 }, { "entropy": 6.229167652130127, "epoch": 1.9422965954991345, "grad_norm": 1.1640625, "learning_rate": 0.00046313025187845735, "loss": 5.9619, "mean_token_accuracy": 0.17458304166793823, "num_tokens": 42639754.0, "step": 16830 }, { "entropy": 6.262476778030395, "epoch": 1.942873629544143, "grad_norm": 1.2109375, "learning_rate": 0.00046310761420491705, "loss": 5.9884, "mean_token_accuracy": 0.16979699730873107, "num_tokens": 42651321.0, "step": 16835 }, { "entropy": 6.246843433380127, "epoch": 1.9434506635891518, "grad_norm": 1.796875, "learning_rate": 0.0004630849702044705, "loss": 6.0391, "mean_token_accuracy": 0.17260385304689407, "num_tokens": 42664188.0, "step": 16840 }, { "entropy": 6.198481512069702, "epoch": 1.9440276976341604, "grad_norm": 1.109375, "learning_rate": 0.00046306231987787937, "loss": 6.0095, "mean_token_accuracy": 0.1676759049296379, "num_tokens": 42677882.0, "step": 16845 }, { "entropy": 6.212922239303589, "epoch": 1.944604731679169, "grad_norm": 1.34375, "learning_rate": 0.00046303966322590556, "loss": 5.9278, "mean_token_accuracy": 0.17638970911502838, "num_tokens": 42690595.0, "step": 16850 }, { "entropy": 6.2258812427520756, "epoch": 1.9451817657241777, "grad_norm": 1.671875, "learning_rate": 0.0004630170002493111, "loss": 5.9277, "mean_token_accuracy": 0.17367104142904283, "num_tokens": 42704784.0, "step": 16855 }, { "entropy": 6.168443441390991, "epoch": 1.9457587997691865, "grad_norm": 1.2734375, "learning_rate": 0.00046299433094885826, "loss": 5.9728, "mean_token_accuracy": 0.17192557603120803, "num_tokens": 42717012.0, "step": 16860 }, { "entropy": 6.279626703262329, "epoch": 1.946335833814195, "grad_norm": 1.484375, "learning_rate": 0.00046297165532530944, "loss": 6.0293, "mean_token_accuracy": 0.16916215866804124, "num_tokens": 42728879.0, "step": 16865 }, { "entropy": 6.295999956130982, "epoch": 1.9469128678592038, "grad_norm": 1.2265625, "learning_rate": 0.0004629489733794274, "loss": 6.076, "mean_token_accuracy": 0.16610499918460847, "num_tokens": 42742688.0, "step": 16870 }, { "entropy": 6.300163602828979, "epoch": 1.9474899019042122, "grad_norm": 1.7109375, "learning_rate": 0.000462926285111975, "loss": 6.0136, "mean_token_accuracy": 0.17265246957540512, "num_tokens": 42754955.0, "step": 16875 }, { "entropy": 6.188889646530152, "epoch": 1.948066935949221, "grad_norm": 1.5390625, "learning_rate": 0.00046290359052371535, "loss": 6.0522, "mean_token_accuracy": 0.16892243772745133, "num_tokens": 42767760.0, "step": 16880 }, { "entropy": 6.246478271484375, "epoch": 1.9486439699942295, "grad_norm": 1.0859375, "learning_rate": 0.0004628808896154117, "loss": 6.0019, "mean_token_accuracy": 0.16956818401813506, "num_tokens": 42779683.0, "step": 16885 }, { "entropy": 6.2639851570129395, "epoch": 1.9492210040392384, "grad_norm": 1.0703125, "learning_rate": 0.0004628581823878277, "loss": 6.0136, "mean_token_accuracy": 0.16905308216810228, "num_tokens": 42791289.0, "step": 16890 }, { "entropy": 6.233004856109619, "epoch": 1.949798038084247, "grad_norm": 1.40625, "learning_rate": 0.000462835468841727, "loss": 6.0669, "mean_token_accuracy": 0.17280749827623368, "num_tokens": 42803318.0, "step": 16895 }, { "entropy": 6.268746852874756, "epoch": 1.9503750721292556, "grad_norm": 1.0859375, "learning_rate": 0.0004628127489778737, "loss": 6.0779, "mean_token_accuracy": 0.1690628483891487, "num_tokens": 42815935.0, "step": 16900 }, { "entropy": 6.278210783004761, "epoch": 1.9509521061742643, "grad_norm": 1.078125, "learning_rate": 0.0004627900227970318, "loss": 6.0285, "mean_token_accuracy": 0.1742333874106407, "num_tokens": 42827759.0, "step": 16905 }, { "entropy": 6.227267503738403, "epoch": 1.951529140219273, "grad_norm": 1.34375, "learning_rate": 0.00046276729029996576, "loss": 6.003, "mean_token_accuracy": 0.17346829771995545, "num_tokens": 42840479.0, "step": 16910 }, { "entropy": 6.2318909645080565, "epoch": 1.9521061742642816, "grad_norm": 1.2421875, "learning_rate": 0.00046274455148744025, "loss": 6.0952, "mean_token_accuracy": 0.1659419283270836, "num_tokens": 42853972.0, "step": 16915 }, { "entropy": 6.221674251556396, "epoch": 1.9526832083092902, "grad_norm": 1.0234375, "learning_rate": 0.00046272180636022, "loss": 6.0415, "mean_token_accuracy": 0.16805387735366822, "num_tokens": 42866192.0, "step": 16920 }, { "entropy": 6.2549063205719, "epoch": 1.953260242354299, "grad_norm": 1.421875, "learning_rate": 0.00046269905491907, "loss": 5.9968, "mean_token_accuracy": 0.17463415563106538, "num_tokens": 42878661.0, "step": 16925 }, { "entropy": 6.230676937103271, "epoch": 1.9538372763993075, "grad_norm": 1.3125, "learning_rate": 0.0004626762971647555, "loss": 6.0225, "mean_token_accuracy": 0.17351190000772476, "num_tokens": 42891498.0, "step": 16930 }, { "entropy": 6.232025623321533, "epoch": 1.9544143104443163, "grad_norm": 1.265625, "learning_rate": 0.00046265353309804205, "loss": 5.979, "mean_token_accuracy": 0.1768836870789528, "num_tokens": 42904657.0, "step": 16935 }, { "entropy": 6.22298035621643, "epoch": 1.9549913444893248, "grad_norm": 1.0078125, "learning_rate": 0.0004626307627196952, "loss": 5.9937, "mean_token_accuracy": 0.17455218583345414, "num_tokens": 42916824.0, "step": 16940 }, { "entropy": 6.279146289825439, "epoch": 1.9555683785343336, "grad_norm": 1.546875, "learning_rate": 0.0004626079860304808, "loss": 6.053, "mean_token_accuracy": 0.17725331634283065, "num_tokens": 42929366.0, "step": 16945 }, { "entropy": 6.147270822525025, "epoch": 1.956145412579342, "grad_norm": 1.09375, "learning_rate": 0.00046258520303116496, "loss": 5.9108, "mean_token_accuracy": 0.18031210005283355, "num_tokens": 42941955.0, "step": 16950 }, { "entropy": 6.272320032119751, "epoch": 1.956722446624351, "grad_norm": 1.6796875, "learning_rate": 0.0004625624137225141, "loss": 6.0865, "mean_token_accuracy": 0.166519957780838, "num_tokens": 42954302.0, "step": 16955 }, { "entropy": 6.343348264694214, "epoch": 1.9572994806693593, "grad_norm": 1.0625, "learning_rate": 0.0004625396181052945, "loss": 6.0364, "mean_token_accuracy": 0.16592449694871902, "num_tokens": 42967225.0, "step": 16960 }, { "entropy": 6.157590579986572, "epoch": 1.9578765147143682, "grad_norm": 1.296875, "learning_rate": 0.00046251681618027316, "loss": 6.0209, "mean_token_accuracy": 0.1752626806497574, "num_tokens": 42981388.0, "step": 16965 }, { "entropy": 6.245779943466187, "epoch": 1.9584535487593768, "grad_norm": 1.265625, "learning_rate": 0.0004624940079482167, "loss": 6.0451, "mean_token_accuracy": 0.17435730695724488, "num_tokens": 42993110.0, "step": 16970 }, { "entropy": 6.225678825378418, "epoch": 1.9590305828043855, "grad_norm": 1.5390625, "learning_rate": 0.00046247119340989254, "loss": 6.0588, "mean_token_accuracy": 0.16311826258897782, "num_tokens": 43007309.0, "step": 16975 }, { "entropy": 6.3057647228240965, "epoch": 1.959607616849394, "grad_norm": 1.109375, "learning_rate": 0.0004624483725660678, "loss": 6.0006, "mean_token_accuracy": 0.17937014997005463, "num_tokens": 43020813.0, "step": 16980 }, { "entropy": 6.267711973190307, "epoch": 1.9601846508944027, "grad_norm": 1.1015625, "learning_rate": 0.0004624255454175102, "loss": 6.0235, "mean_token_accuracy": 0.1743055358529091, "num_tokens": 43033357.0, "step": 16985 }, { "entropy": 6.227343893051147, "epoch": 1.9607616849394114, "grad_norm": 1.0546875, "learning_rate": 0.0004624027119649875, "loss": 6.1083, "mean_token_accuracy": 0.16687651872634887, "num_tokens": 43046685.0, "step": 16990 }, { "entropy": 6.339546060562133, "epoch": 1.96133871898442, "grad_norm": 0.984375, "learning_rate": 0.00046237987220926766, "loss": 6.0799, "mean_token_accuracy": 0.1672934964299202, "num_tokens": 43059670.0, "step": 16995 }, { "entropy": 6.22210693359375, "epoch": 1.9619157530294289, "grad_norm": 1.109375, "learning_rate": 0.00046235702615111886, "loss": 5.9468, "mean_token_accuracy": 0.17477399855852127, "num_tokens": 43073515.0, "step": 17000 }, { "entropy": 6.229201745986939, "epoch": 1.9624927870744373, "grad_norm": 0.98828125, "learning_rate": 0.0004623341737913096, "loss": 6.0422, "mean_token_accuracy": 0.17302633225917816, "num_tokens": 43086046.0, "step": 17005 }, { "entropy": 6.224934053421021, "epoch": 1.9630698211194462, "grad_norm": 1.03125, "learning_rate": 0.0004623113151306085, "loss": 5.9269, "mean_token_accuracy": 0.17834639847278594, "num_tokens": 43097703.0, "step": 17010 }, { "entropy": 6.266271162033081, "epoch": 1.9636468551644546, "grad_norm": 1.09375, "learning_rate": 0.00046228845016978425, "loss": 6.0212, "mean_token_accuracy": 0.16586049050092697, "num_tokens": 43110378.0, "step": 17015 }, { "entropy": 6.296831846237183, "epoch": 1.9642238892094634, "grad_norm": 1.3828125, "learning_rate": 0.0004622655789096061, "loss": 6.042, "mean_token_accuracy": 0.1670925036072731, "num_tokens": 43122978.0, "step": 17020 }, { "entropy": 6.284532690048218, "epoch": 1.9648009232544719, "grad_norm": 2.0, "learning_rate": 0.00046224270135084315, "loss": 6.0846, "mean_token_accuracy": 0.1697956383228302, "num_tokens": 43135371.0, "step": 17025 }, { "entropy": 6.197793197631836, "epoch": 1.9653779572994807, "grad_norm": 1.1875, "learning_rate": 0.00046221981749426503, "loss": 5.9921, "mean_token_accuracy": 0.1699984058737755, "num_tokens": 43147251.0, "step": 17030 }, { "entropy": 6.269783020019531, "epoch": 1.9659549913444894, "grad_norm": 1.1484375, "learning_rate": 0.00046219692734064124, "loss": 5.9799, "mean_token_accuracy": 0.16827934384346008, "num_tokens": 43160276.0, "step": 17035 }, { "entropy": 6.286127424240112, "epoch": 1.966532025389498, "grad_norm": 1.1171875, "learning_rate": 0.0004621740308907419, "loss": 6.038, "mean_token_accuracy": 0.17274793982505798, "num_tokens": 43172443.0, "step": 17040 }, { "entropy": 6.257483434677124, "epoch": 1.9671090594345066, "grad_norm": 1.4296875, "learning_rate": 0.0004621511281453369, "loss": 6.0584, "mean_token_accuracy": 0.16886429041624068, "num_tokens": 43186350.0, "step": 17045 }, { "entropy": 6.218119812011719, "epoch": 1.9676860934795153, "grad_norm": 1.28125, "learning_rate": 0.0004621282191051967, "loss": 5.9859, "mean_token_accuracy": 0.17662974447011948, "num_tokens": 43198936.0, "step": 17050 }, { "entropy": 6.324996995925903, "epoch": 1.968263127524524, "grad_norm": 1.7734375, "learning_rate": 0.0004621053037710918, "loss": 6.1302, "mean_token_accuracy": 0.1648729309439659, "num_tokens": 43211793.0, "step": 17055 }, { "entropy": 6.251626491546631, "epoch": 1.9688401615695326, "grad_norm": 1.09375, "learning_rate": 0.000462082382143793, "loss": 5.9818, "mean_token_accuracy": 0.17532301992177962, "num_tokens": 43223817.0, "step": 17060 }, { "entropy": 6.19627890586853, "epoch": 1.9694171956145412, "grad_norm": 1.1640625, "learning_rate": 0.00046205945422407113, "loss": 6.0233, "mean_token_accuracy": 0.17594825774431228, "num_tokens": 43235769.0, "step": 17065 }, { "entropy": 6.22838978767395, "epoch": 1.9699942296595498, "grad_norm": 1.140625, "learning_rate": 0.00046203652001269754, "loss": 6.037, "mean_token_accuracy": 0.17000845670700074, "num_tokens": 43249309.0, "step": 17070 }, { "entropy": 6.279005813598633, "epoch": 1.9705712637045587, "grad_norm": 1.9296875, "learning_rate": 0.00046201357951044337, "loss": 6.0119, "mean_token_accuracy": 0.1684460759162903, "num_tokens": 43262814.0, "step": 17075 }, { "entropy": 6.315310621261597, "epoch": 1.9711482977495671, "grad_norm": 1.9375, "learning_rate": 0.00046199063271808047, "loss": 6.1099, "mean_token_accuracy": 0.16198794841766356, "num_tokens": 43276898.0, "step": 17080 }, { "entropy": 6.245305490493775, "epoch": 1.971725331794576, "grad_norm": 1.0703125, "learning_rate": 0.0004619676796363804, "loss": 5.9942, "mean_token_accuracy": 0.17359111309051514, "num_tokens": 43288902.0, "step": 17085 }, { "entropy": 6.257856369018555, "epoch": 1.9723023658395844, "grad_norm": 1.34375, "learning_rate": 0.00046194472026611546, "loss": 6.0347, "mean_token_accuracy": 0.17116419225931168, "num_tokens": 43301644.0, "step": 17090 }, { "entropy": 6.231047248840332, "epoch": 1.9728793998845933, "grad_norm": 1.3984375, "learning_rate": 0.0004619217546080576, "loss": 6.024, "mean_token_accuracy": 0.1758951172232628, "num_tokens": 43315550.0, "step": 17095 }, { "entropy": 6.350954198837281, "epoch": 1.9734564339296017, "grad_norm": 1.015625, "learning_rate": 0.0004618987826629794, "loss": 6.1074, "mean_token_accuracy": 0.16367050707340242, "num_tokens": 43328095.0, "step": 17100 }, { "entropy": 6.213918876647949, "epoch": 1.9740334679746105, "grad_norm": 1.171875, "learning_rate": 0.00046187580443165344, "loss": 6.0191, "mean_token_accuracy": 0.17428866624832154, "num_tokens": 43340461.0, "step": 17105 }, { "entropy": 6.293837833404541, "epoch": 1.9746105020196192, "grad_norm": 1.1484375, "learning_rate": 0.0004618528199148527, "loss": 5.9914, "mean_token_accuracy": 0.17793631553649902, "num_tokens": 43352322.0, "step": 17110 }, { "entropy": 6.2946436405181885, "epoch": 1.9751875360646278, "grad_norm": 1.6015625, "learning_rate": 0.00046182982911335016, "loss": 6.0919, "mean_token_accuracy": 0.17028756439685822, "num_tokens": 43366212.0, "step": 17115 }, { "entropy": 6.314712762832642, "epoch": 1.9757645701096365, "grad_norm": 1.609375, "learning_rate": 0.00046180683202791905, "loss": 6.1199, "mean_token_accuracy": 0.16482252925634383, "num_tokens": 43379123.0, "step": 17120 }, { "entropy": 6.320395517349243, "epoch": 1.976341604154645, "grad_norm": 1.09375, "learning_rate": 0.000461783828659333, "loss": 6.1507, "mean_token_accuracy": 0.15963018387556077, "num_tokens": 43393188.0, "step": 17125 }, { "entropy": 6.330562162399292, "epoch": 1.9769186381996537, "grad_norm": 1.015625, "learning_rate": 0.00046176081900836565, "loss": 6.0731, "mean_token_accuracy": 0.16618767976760865, "num_tokens": 43407448.0, "step": 17130 }, { "entropy": 6.234742307662964, "epoch": 1.9774956722446624, "grad_norm": 2.0625, "learning_rate": 0.00046173780307579086, "loss": 5.9955, "mean_token_accuracy": 0.16900865137577056, "num_tokens": 43420202.0, "step": 17135 }, { "entropy": 6.276762580871582, "epoch": 1.9780727062896712, "grad_norm": 1.5703125, "learning_rate": 0.0004617147808623829, "loss": 6.0736, "mean_token_accuracy": 0.16688749194145203, "num_tokens": 43433218.0, "step": 17140 }, { "entropy": 6.230731058120727, "epoch": 1.9786497403346797, "grad_norm": 1.109375, "learning_rate": 0.00046169175236891605, "loss": 6.0409, "mean_token_accuracy": 0.17231394499540328, "num_tokens": 43445721.0, "step": 17145 }, { "entropy": 6.259533452987671, "epoch": 1.9792267743796885, "grad_norm": 1.7421875, "learning_rate": 0.0004616687175961648, "loss": 6.0316, "mean_token_accuracy": 0.1742004543542862, "num_tokens": 43457470.0, "step": 17150 }, { "entropy": 6.2746974468231205, "epoch": 1.979803808424697, "grad_norm": 1.3359375, "learning_rate": 0.0004616456765449039, "loss": 6.0402, "mean_token_accuracy": 0.17770297527313234, "num_tokens": 43470693.0, "step": 17155 }, { "entropy": 6.29163088798523, "epoch": 1.9803808424697058, "grad_norm": 1.109375, "learning_rate": 0.00046162262921590845, "loss": 6.0524, "mean_token_accuracy": 0.1658223256468773, "num_tokens": 43482890.0, "step": 17160 }, { "entropy": 6.346973514556884, "epoch": 1.9809578765147142, "grad_norm": 1.1484375, "learning_rate": 0.0004615995756099535, "loss": 6.074, "mean_token_accuracy": 0.1686537370085716, "num_tokens": 43495444.0, "step": 17165 }, { "entropy": 6.248704862594605, "epoch": 1.981534910559723, "grad_norm": 1.0859375, "learning_rate": 0.0004615765157278146, "loss": 6.0425, "mean_token_accuracy": 0.16893480867147445, "num_tokens": 43507415.0, "step": 17170 }, { "entropy": 6.229138278961182, "epoch": 1.9821119446047317, "grad_norm": 1.4296875, "learning_rate": 0.00046155344957026726, "loss": 6.0765, "mean_token_accuracy": 0.16631700247526168, "num_tokens": 43520832.0, "step": 17175 }, { "entropy": 6.310163736343384, "epoch": 1.9826889786497404, "grad_norm": 1.28125, "learning_rate": 0.0004615303771380873, "loss": 5.9988, "mean_token_accuracy": 0.17154231816530227, "num_tokens": 43534459.0, "step": 17180 }, { "entropy": 6.201480484008789, "epoch": 1.983266012694749, "grad_norm": 1.1640625, "learning_rate": 0.00046150729843205077, "loss": 5.8558, "mean_token_accuracy": 0.18204520791769027, "num_tokens": 43546466.0, "step": 17185 }, { "entropy": 6.220339441299439, "epoch": 1.9838430467397576, "grad_norm": 1.0546875, "learning_rate": 0.00046148421345293384, "loss": 5.9301, "mean_token_accuracy": 0.17631548196077346, "num_tokens": 43558285.0, "step": 17190 }, { "entropy": 6.1403234004974365, "epoch": 1.9844200807847663, "grad_norm": 1.25, "learning_rate": 0.0004614611222015131, "loss": 5.9156, "mean_token_accuracy": 0.18074734061956405, "num_tokens": 43572117.0, "step": 17195 }, { "entropy": 6.262120151519776, "epoch": 1.984997114829775, "grad_norm": 2.140625, "learning_rate": 0.00046143802467856507, "loss": 6.187, "mean_token_accuracy": 0.16410153955221177, "num_tokens": 43586951.0, "step": 17200 }, { "entropy": 6.277947902679443, "epoch": 1.9855741488747836, "grad_norm": 1.1015625, "learning_rate": 0.00046141492088486673, "loss": 5.9645, "mean_token_accuracy": 0.17765239626169205, "num_tokens": 43600542.0, "step": 17205 }, { "entropy": 6.247993421554566, "epoch": 1.9861511829197922, "grad_norm": 1.15625, "learning_rate": 0.0004613918108211951, "loss": 6.0523, "mean_token_accuracy": 0.1717355266213417, "num_tokens": 43612928.0, "step": 17210 }, { "entropy": 6.333569145202636, "epoch": 1.986728216964801, "grad_norm": 1.1875, "learning_rate": 0.0004613686944883275, "loss": 6.0304, "mean_token_accuracy": 0.17236097604036332, "num_tokens": 43625362.0, "step": 17215 }, { "entropy": 6.213045835494995, "epoch": 1.9873052510098095, "grad_norm": 1.7421875, "learning_rate": 0.00046134557188704146, "loss": 6.0204, "mean_token_accuracy": 0.17817834466695787, "num_tokens": 43638165.0, "step": 17220 }, { "entropy": 6.135746431350708, "epoch": 1.9878822850548183, "grad_norm": 1.1875, "learning_rate": 0.00046132244301811466, "loss": 5.9393, "mean_token_accuracy": 0.17782478779554367, "num_tokens": 43650688.0, "step": 17225 }, { "entropy": 6.326607179641724, "epoch": 1.9884593190998268, "grad_norm": 1.21875, "learning_rate": 0.00046129930788232497, "loss": 6.0594, "mean_token_accuracy": 0.16792702078819274, "num_tokens": 43663168.0, "step": 17230 }, { "entropy": 6.254304552078247, "epoch": 1.9890363531448356, "grad_norm": 1.609375, "learning_rate": 0.00046127616648045073, "loss": 6.029, "mean_token_accuracy": 0.16387904584407806, "num_tokens": 43676391.0, "step": 17235 }, { "entropy": 6.3034281730651855, "epoch": 1.989613387189844, "grad_norm": 1.140625, "learning_rate": 0.00046125301881327007, "loss": 6.0229, "mean_token_accuracy": 0.16842008978128434, "num_tokens": 43689631.0, "step": 17240 }, { "entropy": 6.273438882827759, "epoch": 1.990190421234853, "grad_norm": 1.34375, "learning_rate": 0.00046122986488156167, "loss": 6.0479, "mean_token_accuracy": 0.17078548073768615, "num_tokens": 43703176.0, "step": 17245 }, { "entropy": 6.339113378524781, "epoch": 1.9907674552798615, "grad_norm": 1.0390625, "learning_rate": 0.00046120670468610426, "loss": 6.1197, "mean_token_accuracy": 0.16192102879285813, "num_tokens": 43717439.0, "step": 17250 }, { "entropy": 6.272079277038574, "epoch": 1.9913444893248702, "grad_norm": 1.3359375, "learning_rate": 0.00046118353822767683, "loss": 5.9796, "mean_token_accuracy": 0.1686514735221863, "num_tokens": 43730500.0, "step": 17255 }, { "entropy": 6.155890417098999, "epoch": 1.9919215233698788, "grad_norm": 1.3984375, "learning_rate": 0.0004611603655070586, "loss": 5.9199, "mean_token_accuracy": 0.17832320630550386, "num_tokens": 43744807.0, "step": 17260 }, { "entropy": 6.255143928527832, "epoch": 1.9924985574148875, "grad_norm": 1.1640625, "learning_rate": 0.00046113718652502896, "loss": 6.0038, "mean_token_accuracy": 0.17497580498456955, "num_tokens": 43756748.0, "step": 17265 }, { "entropy": 6.257786607742309, "epoch": 1.993075591459896, "grad_norm": 1.296875, "learning_rate": 0.0004611140012823675, "loss": 6.0644, "mean_token_accuracy": 0.16814451068639755, "num_tokens": 43769309.0, "step": 17270 }, { "entropy": 6.215093517303467, "epoch": 1.9936526255049047, "grad_norm": 1.171875, "learning_rate": 0.00046109080977985395, "loss": 6.0178, "mean_token_accuracy": 0.1774963155388832, "num_tokens": 43781057.0, "step": 17275 }, { "entropy": 6.306448173522949, "epoch": 1.9942296595499136, "grad_norm": 1.265625, "learning_rate": 0.00046106761201826854, "loss": 6.0576, "mean_token_accuracy": 0.16839146763086318, "num_tokens": 43794504.0, "step": 17280 }, { "entropy": 6.134201717376709, "epoch": 1.994806693594922, "grad_norm": 1.375, "learning_rate": 0.00046104440799839145, "loss": 5.8808, "mean_token_accuracy": 0.18590227514505386, "num_tokens": 43810214.0, "step": 17285 }, { "entropy": 6.216445350646973, "epoch": 1.9953837276399309, "grad_norm": 1.59375, "learning_rate": 0.000461021197721003, "loss": 6.0415, "mean_token_accuracy": 0.16848865598440171, "num_tokens": 43822197.0, "step": 17290 }, { "entropy": 6.314849901199341, "epoch": 1.9959607616849393, "grad_norm": 1.6171875, "learning_rate": 0.00046099798118688407, "loss": 6.021, "mean_token_accuracy": 0.1691252052783966, "num_tokens": 43835585.0, "step": 17295 }, { "entropy": 6.326150131225586, "epoch": 1.9965377957299482, "grad_norm": 1.6171875, "learning_rate": 0.0004609747583968154, "loss": 5.9943, "mean_token_accuracy": 0.1651899218559265, "num_tokens": 43848542.0, "step": 17300 }, { "entropy": 6.180682373046875, "epoch": 1.9971148297749566, "grad_norm": 2.6875, "learning_rate": 0.0004609515293515781, "loss": 6.0175, "mean_token_accuracy": 0.17395762950181962, "num_tokens": 43860717.0, "step": 17305 }, { "entropy": 6.2602049827575685, "epoch": 1.9976918638199654, "grad_norm": 1.3359375, "learning_rate": 0.0004609282940519535, "loss": 6.0779, "mean_token_accuracy": 0.1715341955423355, "num_tokens": 43873193.0, "step": 17310 }, { "entropy": 6.3034483909606935, "epoch": 1.998268897864974, "grad_norm": 1.296875, "learning_rate": 0.0004609050524987231, "loss": 6.0417, "mean_token_accuracy": 0.16786195784807206, "num_tokens": 43886241.0, "step": 17315 }, { "entropy": 6.274380493164062, "epoch": 1.9988459319099827, "grad_norm": 1.3359375, "learning_rate": 0.0004608818046926686, "loss": 6.018, "mean_token_accuracy": 0.17538921535015106, "num_tokens": 43899429.0, "step": 17320 }, { "entropy": 6.220386648178101, "epoch": 1.9994229659549914, "grad_norm": 1.6953125, "learning_rate": 0.0004608585506345719, "loss": 6.0432, "mean_token_accuracy": 0.16782113611698152, "num_tokens": 43913073.0, "step": 17325 }, { "entropy": 6.264380693435669, "epoch": 2.0, "grad_norm": 1.1875, "learning_rate": 0.0004608352903252152, "loss": 6.0018, "mean_token_accuracy": 0.17643982023000718, "num_tokens": 43926234.0, "step": 17330 }, { "entropy": 6.297075891494751, "epoch": 2.000577034045009, "grad_norm": 1.3046875, "learning_rate": 0.00046081202376538084, "loss": 5.9901, "mean_token_accuracy": 0.1705596461892128, "num_tokens": 43937787.0, "step": 17335 }, { "entropy": 6.214798879623413, "epoch": 2.0011540680900173, "grad_norm": 1.2734375, "learning_rate": 0.0004607887509558513, "loss": 6.0, "mean_token_accuracy": 0.17187341153621674, "num_tokens": 43951429.0, "step": 17340 }, { "entropy": 6.2717287063598635, "epoch": 2.001731102135026, "grad_norm": 1.7578125, "learning_rate": 0.0004607654718974094, "loss": 6.0265, "mean_token_accuracy": 0.17009468674659728, "num_tokens": 43964257.0, "step": 17345 }, { "entropy": 6.300295209884643, "epoch": 2.0023081361800346, "grad_norm": 2.015625, "learning_rate": 0.0004607421865908382, "loss": 5.929, "mean_token_accuracy": 0.1742121919989586, "num_tokens": 43975995.0, "step": 17350 }, { "entropy": 6.187320327758789, "epoch": 2.0028851702250434, "grad_norm": 1.1171875, "learning_rate": 0.0004607188950369207, "loss": 5.8799, "mean_token_accuracy": 0.17936831712722778, "num_tokens": 43989191.0, "step": 17355 }, { "entropy": 6.265660429000855, "epoch": 2.003462204270052, "grad_norm": 1.1484375, "learning_rate": 0.0004606955972364405, "loss": 5.9906, "mean_token_accuracy": 0.17080468833446502, "num_tokens": 44000583.0, "step": 17360 }, { "entropy": 6.1407544136047365, "epoch": 2.0040392383150607, "grad_norm": 1.1796875, "learning_rate": 0.0004606722931901812, "loss": 5.8517, "mean_token_accuracy": 0.1786182105541229, "num_tokens": 44013894.0, "step": 17365 }, { "entropy": 6.202847480773926, "epoch": 2.004616272360069, "grad_norm": 1.25, "learning_rate": 0.0004606489828989264, "loss": 5.9156, "mean_token_accuracy": 0.17088600397109985, "num_tokens": 44026701.0, "step": 17370 }, { "entropy": 6.175824975967407, "epoch": 2.005193306405078, "grad_norm": 1.21875, "learning_rate": 0.0004606256663634604, "loss": 5.9326, "mean_token_accuracy": 0.1767387419939041, "num_tokens": 44039775.0, "step": 17375 }, { "entropy": 6.25781946182251, "epoch": 2.0057703404500864, "grad_norm": 1.2578125, "learning_rate": 0.0004606023435845672, "loss": 5.974, "mean_token_accuracy": 0.17226887345314026, "num_tokens": 44052352.0, "step": 17380 }, { "entropy": 6.250827646255493, "epoch": 2.0063473744950953, "grad_norm": 1.1328125, "learning_rate": 0.0004605790145630314, "loss": 5.9554, "mean_token_accuracy": 0.17064084112644196, "num_tokens": 44066147.0, "step": 17385 }, { "entropy": 6.238795328140259, "epoch": 2.0069244085401037, "grad_norm": 1.2265625, "learning_rate": 0.0004605556792996377, "loss": 5.959, "mean_token_accuracy": 0.17261969149112702, "num_tokens": 44078692.0, "step": 17390 }, { "entropy": 6.296038961410522, "epoch": 2.0075014425851125, "grad_norm": 1.234375, "learning_rate": 0.0004605323377951709, "loss": 6.006, "mean_token_accuracy": 0.16696172207593918, "num_tokens": 44091511.0, "step": 17395 }, { "entropy": 6.22690978050232, "epoch": 2.008078476630121, "grad_norm": 1.4375, "learning_rate": 0.000460508990050416, "loss": 5.9448, "mean_token_accuracy": 0.170767118036747, "num_tokens": 44103423.0, "step": 17400 }, { "entropy": 6.131740474700928, "epoch": 2.00865551067513, "grad_norm": 1.1484375, "learning_rate": 0.0004604856360661584, "loss": 5.8242, "mean_token_accuracy": 0.18300881683826448, "num_tokens": 44116024.0, "step": 17405 }, { "entropy": 6.136595010757446, "epoch": 2.0092325447201387, "grad_norm": 1.09375, "learning_rate": 0.0004604622758431835, "loss": 5.8754, "mean_token_accuracy": 0.17836426347494125, "num_tokens": 44128595.0, "step": 17410 }, { "entropy": 6.280027580261231, "epoch": 2.009809578765147, "grad_norm": 1.1640625, "learning_rate": 0.00046043890938227724, "loss": 5.9718, "mean_token_accuracy": 0.1769594207406044, "num_tokens": 44140104.0, "step": 17415 }, { "entropy": 6.2423299789428714, "epoch": 2.010386612810156, "grad_norm": 1.296875, "learning_rate": 0.00046041553668422526, "loss": 5.9318, "mean_token_accuracy": 0.1780355080962181, "num_tokens": 44152681.0, "step": 17420 }, { "entropy": 6.12680401802063, "epoch": 2.0109636468551644, "grad_norm": 1.1640625, "learning_rate": 0.00046039215774981376, "loss": 5.965, "mean_token_accuracy": 0.17880391776561738, "num_tokens": 44165728.0, "step": 17425 }, { "entropy": 6.262257671356201, "epoch": 2.0115406809001732, "grad_norm": 1.25, "learning_rate": 0.00046036877257982917, "loss": 5.9904, "mean_token_accuracy": 0.16699692755937576, "num_tokens": 44178182.0, "step": 17430 }, { "entropy": 6.2879571437835695, "epoch": 2.0121177149451817, "grad_norm": 1.234375, "learning_rate": 0.000460345381175058, "loss": 5.9369, "mean_token_accuracy": 0.17570238560438156, "num_tokens": 44190954.0, "step": 17435 }, { "entropy": 6.242337083816528, "epoch": 2.0126947489901905, "grad_norm": 1.03125, "learning_rate": 0.000460321983536287, "loss": 5.9239, "mean_token_accuracy": 0.17687204331159592, "num_tokens": 44204123.0, "step": 17440 }, { "entropy": 6.183831357955933, "epoch": 2.013271783035199, "grad_norm": 1.6875, "learning_rate": 0.00046029857966430315, "loss": 5.9268, "mean_token_accuracy": 0.17197465896606445, "num_tokens": 44218656.0, "step": 17445 }, { "entropy": 6.203491353988648, "epoch": 2.013848817080208, "grad_norm": 1.28125, "learning_rate": 0.00046027516955989364, "loss": 5.9424, "mean_token_accuracy": 0.1783543273806572, "num_tokens": 44231191.0, "step": 17450 }, { "entropy": 6.273696565628052, "epoch": 2.014425851125216, "grad_norm": 1.2734375, "learning_rate": 0.00046025175322384577, "loss": 5.9481, "mean_token_accuracy": 0.17753272205591203, "num_tokens": 44244564.0, "step": 17455 }, { "entropy": 6.272516918182373, "epoch": 2.015002885170225, "grad_norm": 1.40625, "learning_rate": 0.00046022833065694727, "loss": 5.984, "mean_token_accuracy": 0.17100428342819213, "num_tokens": 44257545.0, "step": 17460 }, { "entropy": 6.192347669601441, "epoch": 2.0155799192152335, "grad_norm": 1.1953125, "learning_rate": 0.00046020490185998575, "loss": 5.9127, "mean_token_accuracy": 0.17826618552207946, "num_tokens": 44270416.0, "step": 17465 }, { "entropy": 6.214372444152832, "epoch": 2.0161569532602424, "grad_norm": 1.3359375, "learning_rate": 0.0004601814668337495, "loss": 5.9211, "mean_token_accuracy": 0.17736995220184326, "num_tokens": 44283366.0, "step": 17470 }, { "entropy": 6.20364727973938, "epoch": 2.016733987305251, "grad_norm": 1.203125, "learning_rate": 0.00046015802557902654, "loss": 5.979, "mean_token_accuracy": 0.17061620205640793, "num_tokens": 44296079.0, "step": 17475 }, { "entropy": 6.216525363922119, "epoch": 2.0173110213502596, "grad_norm": 2.453125, "learning_rate": 0.00046013457809660537, "loss": 5.9299, "mean_token_accuracy": 0.173180291056633, "num_tokens": 44308409.0, "step": 17480 }, { "entropy": 6.206072568893433, "epoch": 2.0178880553952685, "grad_norm": 1.0234375, "learning_rate": 0.00046011112438727454, "loss": 6.0231, "mean_token_accuracy": 0.17291929721832275, "num_tokens": 44321826.0, "step": 17485 }, { "entropy": 6.285996961593628, "epoch": 2.018465089440277, "grad_norm": 1.1328125, "learning_rate": 0.0004600876644518231, "loss": 5.9954, "mean_token_accuracy": 0.1680159881711006, "num_tokens": 44335630.0, "step": 17490 }, { "entropy": 6.087948226928711, "epoch": 2.0190421234852858, "grad_norm": 1.0078125, "learning_rate": 0.00046006419829104, "loss": 5.7567, "mean_token_accuracy": 0.18672087639570237, "num_tokens": 44349059.0, "step": 17495 }, { "entropy": 6.192037963867188, "epoch": 2.019619157530294, "grad_norm": 1.140625, "learning_rate": 0.0004600407259057145, "loss": 5.8764, "mean_token_accuracy": 0.17351363152265548, "num_tokens": 44361908.0, "step": 17500 }, { "entropy": 6.220724296569824, "epoch": 2.020196191575303, "grad_norm": 1.1875, "learning_rate": 0.0004600172472966361, "loss": 5.9722, "mean_token_accuracy": 0.16882861256599427, "num_tokens": 44375487.0, "step": 17505 }, { "entropy": 6.192804622650146, "epoch": 2.0207732256203115, "grad_norm": 1.59375, "learning_rate": 0.00045999376246459446, "loss": 5.9108, "mean_token_accuracy": 0.17260125130414963, "num_tokens": 44387881.0, "step": 17510 }, { "entropy": 6.209100961685181, "epoch": 2.0213502596653203, "grad_norm": 1.0234375, "learning_rate": 0.0004599702714103795, "loss": 5.8953, "mean_token_accuracy": 0.17245278358459473, "num_tokens": 44400609.0, "step": 17515 }, { "entropy": 6.170619869232178, "epoch": 2.0219272937103288, "grad_norm": 1.8671875, "learning_rate": 0.0004599467741347814, "loss": 5.8932, "mean_token_accuracy": 0.1790915235877037, "num_tokens": 44413341.0, "step": 17520 }, { "entropy": 6.221302604675293, "epoch": 2.0225043277553376, "grad_norm": 0.98828125, "learning_rate": 0.0004599232706385904, "loss": 6.0261, "mean_token_accuracy": 0.17114851176738738, "num_tokens": 44425790.0, "step": 17525 }, { "entropy": 6.184481763839722, "epoch": 2.023081361800346, "grad_norm": 1.0234375, "learning_rate": 0.000459899760922597, "loss": 5.8961, "mean_token_accuracy": 0.18134428858757018, "num_tokens": 44438204.0, "step": 17530 }, { "entropy": 6.192145204544067, "epoch": 2.023658395845355, "grad_norm": 1.0390625, "learning_rate": 0.0004598762449875921, "loss": 5.8576, "mean_token_accuracy": 0.17917026430368424, "num_tokens": 44450717.0, "step": 17535 }, { "entropy": 6.228597211837768, "epoch": 2.0242354298903633, "grad_norm": 1.015625, "learning_rate": 0.0004598527228343665, "loss": 5.8816, "mean_token_accuracy": 0.1814187839627266, "num_tokens": 44463391.0, "step": 17540 }, { "entropy": 6.161728239059448, "epoch": 2.024812463935372, "grad_norm": 1.0703125, "learning_rate": 0.0004598291944637112, "loss": 5.8686, "mean_token_accuracy": 0.17788388729095458, "num_tokens": 44477022.0, "step": 17545 }, { "entropy": 6.250133514404297, "epoch": 2.025389497980381, "grad_norm": 1.4921875, "learning_rate": 0.00045980565987641797, "loss": 5.9895, "mean_token_accuracy": 0.17265195846557618, "num_tokens": 44490616.0, "step": 17550 }, { "entropy": 6.236105871200562, "epoch": 2.0259665320253895, "grad_norm": 1.125, "learning_rate": 0.00045978211907327804, "loss": 5.9548, "mean_token_accuracy": 0.17624759078025817, "num_tokens": 44503307.0, "step": 17555 }, { "entropy": 6.265711402893066, "epoch": 2.0265435660703983, "grad_norm": 1.0625, "learning_rate": 0.0004597585720550834, "loss": 5.9679, "mean_token_accuracy": 0.1739831820130348, "num_tokens": 44516078.0, "step": 17560 }, { "entropy": 6.231649446487427, "epoch": 2.0271206001154067, "grad_norm": 1.1015625, "learning_rate": 0.000459735018822626, "loss": 5.9245, "mean_token_accuracy": 0.17394810765981675, "num_tokens": 44528485.0, "step": 17565 }, { "entropy": 6.240048360824585, "epoch": 2.0276976341604156, "grad_norm": 1.4453125, "learning_rate": 0.00045971145937669794, "loss": 5.8738, "mean_token_accuracy": 0.17736487239599227, "num_tokens": 44539946.0, "step": 17570 }, { "entropy": 6.132218885421753, "epoch": 2.028274668205424, "grad_norm": 1.453125, "learning_rate": 0.0004596878937180917, "loss": 5.958, "mean_token_accuracy": 0.1710592895746231, "num_tokens": 44552828.0, "step": 17575 }, { "entropy": 6.226531219482422, "epoch": 2.028851702250433, "grad_norm": 1.2734375, "learning_rate": 0.0004596643218475999, "loss": 5.9678, "mean_token_accuracy": 0.1757684901356697, "num_tokens": 44564930.0, "step": 17580 }, { "entropy": 6.2708100318908695, "epoch": 2.0294287362954413, "grad_norm": 0.9921875, "learning_rate": 0.00045964074376601534, "loss": 5.9457, "mean_token_accuracy": 0.17014985233545304, "num_tokens": 44578226.0, "step": 17585 }, { "entropy": 6.195923471450806, "epoch": 2.03000577034045, "grad_norm": 1.3828125, "learning_rate": 0.00045961715947413106, "loss": 5.9532, "mean_token_accuracy": 0.17502938061952591, "num_tokens": 44590704.0, "step": 17590 }, { "entropy": 6.199918508529663, "epoch": 2.0305828043854586, "grad_norm": 1.0, "learning_rate": 0.0004595935689727404, "loss": 5.9319, "mean_token_accuracy": 0.18110113143920897, "num_tokens": 44602758.0, "step": 17595 }, { "entropy": 6.124384832382202, "epoch": 2.0311598384304674, "grad_norm": 1.21875, "learning_rate": 0.0004595699722626367, "loss": 5.8945, "mean_token_accuracy": 0.1795112207531929, "num_tokens": 44614733.0, "step": 17600 }, { "entropy": 6.308047533035278, "epoch": 2.031736872475476, "grad_norm": 1.1015625, "learning_rate": 0.00045954636934461367, "loss": 6.0143, "mean_token_accuracy": 0.17096339911222458, "num_tokens": 44628339.0, "step": 17605 }, { "entropy": 6.294468355178833, "epoch": 2.0323139065204847, "grad_norm": 1.0078125, "learning_rate": 0.0004595227602194652, "loss": 5.9252, "mean_token_accuracy": 0.17322905659675597, "num_tokens": 44641382.0, "step": 17610 }, { "entropy": 6.156301641464234, "epoch": 2.0328909405654936, "grad_norm": 1.2421875, "learning_rate": 0.0004594991448879853, "loss": 5.9102, "mean_token_accuracy": 0.1699449121952057, "num_tokens": 44654618.0, "step": 17615 }, { "entropy": 6.299897193908691, "epoch": 2.033467974610502, "grad_norm": 1.1484375, "learning_rate": 0.0004594755233509683, "loss": 6.0546, "mean_token_accuracy": 0.16198293268680572, "num_tokens": 44667961.0, "step": 17620 }, { "entropy": 6.191911935806274, "epoch": 2.034045008655511, "grad_norm": 1.2421875, "learning_rate": 0.00045945189560920875, "loss": 5.9306, "mean_token_accuracy": 0.17262049913406372, "num_tokens": 44682185.0, "step": 17625 }, { "entropy": 6.27217288017273, "epoch": 2.0346220427005193, "grad_norm": 1.1875, "learning_rate": 0.0004594282616635013, "loss": 5.9646, "mean_token_accuracy": 0.17757879346609115, "num_tokens": 44695513.0, "step": 17630 }, { "entropy": 6.232735204696655, "epoch": 2.035199076745528, "grad_norm": 1.4765625, "learning_rate": 0.0004594046215146409, "loss": 5.9928, "mean_token_accuracy": 0.17601801156997682, "num_tokens": 44707051.0, "step": 17635 }, { "entropy": 6.237101078033447, "epoch": 2.0357761107905366, "grad_norm": 1.3984375, "learning_rate": 0.00045938097516342257, "loss": 5.982, "mean_token_accuracy": 0.17229001522064208, "num_tokens": 44719915.0, "step": 17640 }, { "entropy": 6.118812084197998, "epoch": 2.0363531448355454, "grad_norm": 1.1875, "learning_rate": 0.00045935732261064184, "loss": 5.837, "mean_token_accuracy": 0.1862248256802559, "num_tokens": 44733115.0, "step": 17645 }, { "entropy": 6.205551958084106, "epoch": 2.036930178880554, "grad_norm": 0.984375, "learning_rate": 0.00045933366385709405, "loss": 5.9436, "mean_token_accuracy": 0.1748773232102394, "num_tokens": 44744480.0, "step": 17650 }, { "entropy": 6.203357934951782, "epoch": 2.0375072129255627, "grad_norm": 1.078125, "learning_rate": 0.0004593099989035751, "loss": 5.9754, "mean_token_accuracy": 0.17659931629896164, "num_tokens": 44758200.0, "step": 17655 }, { "entropy": 6.316721200942993, "epoch": 2.038084246970571, "grad_norm": 1.25, "learning_rate": 0.0004592863277508809, "loss": 6.029, "mean_token_accuracy": 0.1700327605009079, "num_tokens": 44771407.0, "step": 17660 }, { "entropy": 6.287095546722412, "epoch": 2.03866128101558, "grad_norm": 1.1015625, "learning_rate": 0.0004592626503998076, "loss": 5.9155, "mean_token_accuracy": 0.17439333498477935, "num_tokens": 44783765.0, "step": 17665 }, { "entropy": 6.228414916992188, "epoch": 2.0392383150605884, "grad_norm": 1.09375, "learning_rate": 0.0004592389668511515, "loss": 5.9797, "mean_token_accuracy": 0.1745125100016594, "num_tokens": 44796550.0, "step": 17670 }, { "entropy": 6.192117929458618, "epoch": 2.0398153491055973, "grad_norm": 1.0078125, "learning_rate": 0.0004592152771057093, "loss": 5.939, "mean_token_accuracy": 0.17687230557203293, "num_tokens": 44808802.0, "step": 17675 }, { "entropy": 6.250724363327026, "epoch": 2.0403923831506057, "grad_norm": 1.1640625, "learning_rate": 0.00045919158116427785, "loss": 5.8742, "mean_token_accuracy": 0.17866400480270386, "num_tokens": 44821023.0, "step": 17680 }, { "entropy": 6.220262145996093, "epoch": 2.0409694171956145, "grad_norm": 1.0703125, "learning_rate": 0.00045916787902765396, "loss": 5.9044, "mean_token_accuracy": 0.175578336417675, "num_tokens": 44833822.0, "step": 17685 }, { "entropy": 6.197280168533325, "epoch": 2.0415464512406234, "grad_norm": 1.09375, "learning_rate": 0.0004591441706966349, "loss": 5.9274, "mean_token_accuracy": 0.17216354012489318, "num_tokens": 44846440.0, "step": 17690 }, { "entropy": 6.200249481201172, "epoch": 2.042123485285632, "grad_norm": 7.25, "learning_rate": 0.0004591204561720183, "loss": 5.9403, "mean_token_accuracy": 0.1695069521665573, "num_tokens": 44858257.0, "step": 17695 }, { "entropy": 6.175353002548218, "epoch": 2.0427005193306407, "grad_norm": 1.125, "learning_rate": 0.0004590967354546015, "loss": 5.9805, "mean_token_accuracy": 0.1676792249083519, "num_tokens": 44871339.0, "step": 17700 }, { "entropy": 6.270719003677368, "epoch": 2.043277553375649, "grad_norm": 1.1796875, "learning_rate": 0.0004590730085451824, "loss": 5.9391, "mean_token_accuracy": 0.1787752777338028, "num_tokens": 44884190.0, "step": 17705 }, { "entropy": 6.15546760559082, "epoch": 2.043854587420658, "grad_norm": 1.09375, "learning_rate": 0.00045904927544455914, "loss": 5.858, "mean_token_accuracy": 0.17509367167949677, "num_tokens": 44897530.0, "step": 17710 }, { "entropy": 6.192881536483765, "epoch": 2.0444316214656664, "grad_norm": 1.0625, "learning_rate": 0.00045902553615353005, "loss": 5.8848, "mean_token_accuracy": 0.1834646299481392, "num_tokens": 44910428.0, "step": 17715 }, { "entropy": 6.223622989654541, "epoch": 2.0450086555106752, "grad_norm": 0.9453125, "learning_rate": 0.0004590017906728933, "loss": 5.9294, "mean_token_accuracy": 0.17263387590646745, "num_tokens": 44922904.0, "step": 17720 }, { "entropy": 6.153698301315307, "epoch": 2.0455856895556837, "grad_norm": 1.1015625, "learning_rate": 0.00045897803900344774, "loss": 5.8738, "mean_token_accuracy": 0.17572209388017654, "num_tokens": 44935541.0, "step": 17725 }, { "entropy": 6.176003122329712, "epoch": 2.0461627236006925, "grad_norm": 1.09375, "learning_rate": 0.0004589542811459923, "loss": 5.9264, "mean_token_accuracy": 0.1788767859339714, "num_tokens": 44948483.0, "step": 17730 }, { "entropy": 6.233722305297851, "epoch": 2.046739757645701, "grad_norm": 1.4296875, "learning_rate": 0.0004589305171013259, "loss": 5.9362, "mean_token_accuracy": 0.1753383070230484, "num_tokens": 44961797.0, "step": 17735 }, { "entropy": 6.2383228778839115, "epoch": 2.04731679169071, "grad_norm": 1.2109375, "learning_rate": 0.000458906746870248, "loss": 5.9733, "mean_token_accuracy": 0.16818111687898635, "num_tokens": 44975426.0, "step": 17740 }, { "entropy": 6.220548105239868, "epoch": 2.047893825735718, "grad_norm": 1.625, "learning_rate": 0.000458882970453558, "loss": 5.9421, "mean_token_accuracy": 0.17429644018411636, "num_tokens": 44988272.0, "step": 17745 }, { "entropy": 6.1548073291778564, "epoch": 2.048470859780727, "grad_norm": 1.1171875, "learning_rate": 0.0004588591878520556, "loss": 5.8904, "mean_token_accuracy": 0.17755962610244752, "num_tokens": 45000609.0, "step": 17750 }, { "entropy": 6.313485479354858, "epoch": 2.049047893825736, "grad_norm": 1.1953125, "learning_rate": 0.0004588353990665407, "loss": 6.0308, "mean_token_accuracy": 0.16356184035539628, "num_tokens": 45012651.0, "step": 17755 }, { "entropy": 6.2108770370483395, "epoch": 2.0496249278707444, "grad_norm": 1.6875, "learning_rate": 0.0004588116040978136, "loss": 5.9973, "mean_token_accuracy": 0.17209396362304688, "num_tokens": 45025237.0, "step": 17760 }, { "entropy": 6.18538384437561, "epoch": 2.050201961915753, "grad_norm": 1.2421875, "learning_rate": 0.00045878780294667437, "loss": 6.0153, "mean_token_accuracy": 0.16943909376859664, "num_tokens": 45038329.0, "step": 17765 }, { "entropy": 6.2096922397613525, "epoch": 2.0507789959607616, "grad_norm": 0.98828125, "learning_rate": 0.0004587639956139237, "loss": 5.8662, "mean_token_accuracy": 0.17784364074468612, "num_tokens": 45050251.0, "step": 17770 }, { "entropy": 6.265796804428101, "epoch": 2.0513560300057705, "grad_norm": 1.0625, "learning_rate": 0.0004587401821003624, "loss": 5.9827, "mean_token_accuracy": 0.1691094607114792, "num_tokens": 45062701.0, "step": 17775 }, { "entropy": 6.1350870609283445, "epoch": 2.051933064050779, "grad_norm": 1.2421875, "learning_rate": 0.00045871636240679133, "loss": 5.878, "mean_token_accuracy": 0.18649837225675583, "num_tokens": 45077059.0, "step": 17780 }, { "entropy": 6.225623273849488, "epoch": 2.0525100980957878, "grad_norm": 1.0390625, "learning_rate": 0.0004586925365340117, "loss": 5.8858, "mean_token_accuracy": 0.17775747776031495, "num_tokens": 45089571.0, "step": 17785 }, { "entropy": 6.204924058914185, "epoch": 2.053087132140796, "grad_norm": 1.0703125, "learning_rate": 0.0004586687044828247, "loss": 5.8941, "mean_token_accuracy": 0.174189892411232, "num_tokens": 45101085.0, "step": 17790 }, { "entropy": 6.162897729873658, "epoch": 2.053664166185805, "grad_norm": 1.109375, "learning_rate": 0.0004586448662540322, "loss": 5.9485, "mean_token_accuracy": 0.1684534505009651, "num_tokens": 45113844.0, "step": 17795 }, { "entropy": 6.239241313934326, "epoch": 2.0542412002308135, "grad_norm": 1.1328125, "learning_rate": 0.0004586210218484358, "loss": 5.9866, "mean_token_accuracy": 0.1690887078642845, "num_tokens": 45126297.0, "step": 17800 }, { "entropy": 6.265953493118286, "epoch": 2.0548182342758223, "grad_norm": 1.0234375, "learning_rate": 0.00045859717126683745, "loss": 5.8603, "mean_token_accuracy": 0.18210013806819916, "num_tokens": 45139337.0, "step": 17805 }, { "entropy": 6.206180477142334, "epoch": 2.0553952683208307, "grad_norm": 1.109375, "learning_rate": 0.00045857331451003953, "loss": 5.9986, "mean_token_accuracy": 0.17050107568502426, "num_tokens": 45151698.0, "step": 17810 }, { "entropy": 6.199662876129151, "epoch": 2.0559723023658396, "grad_norm": 1.0859375, "learning_rate": 0.00045854945157884435, "loss": 5.8944, "mean_token_accuracy": 0.17789710760116578, "num_tokens": 45164615.0, "step": 17815 }, { "entropy": 6.235444402694702, "epoch": 2.056549336410848, "grad_norm": 1.390625, "learning_rate": 0.00045852558247405455, "loss": 5.9488, "mean_token_accuracy": 0.17498012036085128, "num_tokens": 45176630.0, "step": 17820 }, { "entropy": 6.209130382537841, "epoch": 2.057126370455857, "grad_norm": 2.375, "learning_rate": 0.00045850170719647287, "loss": 5.8856, "mean_token_accuracy": 0.18172849118709564, "num_tokens": 45188879.0, "step": 17825 }, { "entropy": 6.245654630661011, "epoch": 2.0577034045008658, "grad_norm": 1.2421875, "learning_rate": 0.00045847782574690254, "loss": 5.9596, "mean_token_accuracy": 0.16994517296552658, "num_tokens": 45201694.0, "step": 17830 }, { "entropy": 6.198729944229126, "epoch": 2.058280438545874, "grad_norm": 1.421875, "learning_rate": 0.00045845393812614664, "loss": 5.9081, "mean_token_accuracy": 0.17356704622507096, "num_tokens": 45215873.0, "step": 17835 }, { "entropy": 6.292256259918213, "epoch": 2.058857472590883, "grad_norm": 1.1015625, "learning_rate": 0.0004584300443350086, "loss": 6.0325, "mean_token_accuracy": 0.16657613068819047, "num_tokens": 45229660.0, "step": 17840 }, { "entropy": 6.233248519897461, "epoch": 2.0594345066358914, "grad_norm": 1.328125, "learning_rate": 0.0004584061443742922, "loss": 5.8899, "mean_token_accuracy": 0.17116474509239196, "num_tokens": 45243257.0, "step": 17845 }, { "entropy": 6.1754065990448, "epoch": 2.0600115406809003, "grad_norm": 1.0234375, "learning_rate": 0.00045838223824480124, "loss": 5.8782, "mean_token_accuracy": 0.18036632239818573, "num_tokens": 45256212.0, "step": 17850 }, { "entropy": 6.207752275466919, "epoch": 2.0605885747259087, "grad_norm": 1.2734375, "learning_rate": 0.0004583583259473397, "loss": 5.9363, "mean_token_accuracy": 0.1834060311317444, "num_tokens": 45268292.0, "step": 17855 }, { "entropy": 6.1441535472869875, "epoch": 2.0611656087709176, "grad_norm": 1.03125, "learning_rate": 0.00045833440748271203, "loss": 5.7908, "mean_token_accuracy": 0.20127416551113128, "num_tokens": 45284112.0, "step": 17860 }, { "entropy": 6.193862199783325, "epoch": 2.061742642815926, "grad_norm": 1.0859375, "learning_rate": 0.00045831048285172266, "loss": 5.8931, "mean_token_accuracy": 0.1810559496283531, "num_tokens": 45295839.0, "step": 17865 }, { "entropy": 6.141061782836914, "epoch": 2.062319676860935, "grad_norm": 1.2265625, "learning_rate": 0.0004582865520551762, "loss": 5.9293, "mean_token_accuracy": 0.1708131492137909, "num_tokens": 45309142.0, "step": 17870 }, { "entropy": 6.269522953033447, "epoch": 2.0628967109059433, "grad_norm": 1.4140625, "learning_rate": 0.00045826261509387755, "loss": 5.9701, "mean_token_accuracy": 0.17792370170354843, "num_tokens": 45322096.0, "step": 17875 }, { "entropy": 6.263595771789551, "epoch": 2.063473744950952, "grad_norm": 1.1171875, "learning_rate": 0.00045823867196863197, "loss": 5.992, "mean_token_accuracy": 0.17633334845304488, "num_tokens": 45333685.0, "step": 17880 }, { "entropy": 6.1949646949768065, "epoch": 2.0640507789959606, "grad_norm": 1.3515625, "learning_rate": 0.0004582147226802446, "loss": 5.9256, "mean_token_accuracy": 0.17821483314037323, "num_tokens": 45345417.0, "step": 17885 }, { "entropy": 6.200151824951172, "epoch": 2.0646278130409694, "grad_norm": 1.125, "learning_rate": 0.0004581907672295211, "loss": 5.934, "mean_token_accuracy": 0.17727133482694626, "num_tokens": 45357156.0, "step": 17890 }, { "entropy": 6.275757837295532, "epoch": 2.065204847085978, "grad_norm": 1.0703125, "learning_rate": 0.00045816680561726716, "loss": 5.9526, "mean_token_accuracy": 0.17532005161046982, "num_tokens": 45369627.0, "step": 17895 }, { "entropy": 6.222644901275634, "epoch": 2.0657818811309867, "grad_norm": 1.125, "learning_rate": 0.0004581428378442886, "loss": 5.9016, "mean_token_accuracy": 0.1732523813843727, "num_tokens": 45380603.0, "step": 17900 }, { "entropy": 6.197103118896484, "epoch": 2.0663589151759956, "grad_norm": 1.078125, "learning_rate": 0.00045811886391139173, "loss": 5.9035, "mean_token_accuracy": 0.1877364158630371, "num_tokens": 45394923.0, "step": 17905 }, { "entropy": 6.229747629165649, "epoch": 2.066935949221004, "grad_norm": 1.78125, "learning_rate": 0.00045809488381938284, "loss": 5.9232, "mean_token_accuracy": 0.17425263226032256, "num_tokens": 45407351.0, "step": 17910 }, { "entropy": 6.097294044494629, "epoch": 2.067512983266013, "grad_norm": 1.1171875, "learning_rate": 0.0004580708975690684, "loss": 5.9082, "mean_token_accuracy": 0.17824243754148483, "num_tokens": 45420783.0, "step": 17915 }, { "entropy": 6.217814922332764, "epoch": 2.0680900173110213, "grad_norm": 1.296875, "learning_rate": 0.0004580469051612554, "loss": 5.8777, "mean_token_accuracy": 0.17622975260019302, "num_tokens": 45433208.0, "step": 17920 }, { "entropy": 6.249103021621704, "epoch": 2.06866705135603, "grad_norm": 1.0390625, "learning_rate": 0.00045802290659675057, "loss": 6.0379, "mean_token_accuracy": 0.16410011649131775, "num_tokens": 45445872.0, "step": 17925 }, { "entropy": 6.2258580207824705, "epoch": 2.0692440854010385, "grad_norm": 1.2265625, "learning_rate": 0.00045799890187636123, "loss": 5.9794, "mean_token_accuracy": 0.17026836425065994, "num_tokens": 45458844.0, "step": 17930 }, { "entropy": 6.201646947860718, "epoch": 2.0698211194460474, "grad_norm": 1.1796875, "learning_rate": 0.00045797489100089464, "loss": 5.957, "mean_token_accuracy": 0.17284089624881743, "num_tokens": 45471919.0, "step": 17935 }, { "entropy": 6.218793487548828, "epoch": 2.070398153491056, "grad_norm": 1.0546875, "learning_rate": 0.0004579508739711585, "loss": 5.943, "mean_token_accuracy": 0.17847752720117568, "num_tokens": 45483769.0, "step": 17940 }, { "entropy": 6.286684274673462, "epoch": 2.0709751875360647, "grad_norm": 1.5390625, "learning_rate": 0.00045792685078796075, "loss": 6.0211, "mean_token_accuracy": 0.1702808380126953, "num_tokens": 45497077.0, "step": 17945 }, { "entropy": 6.243750429153442, "epoch": 2.071552221581073, "grad_norm": 1.2109375, "learning_rate": 0.000457902821452109, "loss": 5.9398, "mean_token_accuracy": 0.1820717990398407, "num_tokens": 45509229.0, "step": 17950 }, { "entropy": 6.238589191436768, "epoch": 2.072129255626082, "grad_norm": 1.0546875, "learning_rate": 0.00045787878596441193, "loss": 5.9315, "mean_token_accuracy": 0.1709604248404503, "num_tokens": 45521654.0, "step": 17955 }, { "entropy": 6.228718662261963, "epoch": 2.0727062896710904, "grad_norm": 1.265625, "learning_rate": 0.0004578547443256776, "loss": 5.9517, "mean_token_accuracy": 0.17131188362836838, "num_tokens": 45533488.0, "step": 17960 }, { "entropy": 6.198116397857666, "epoch": 2.0732833237160992, "grad_norm": 1.0859375, "learning_rate": 0.0004578306965367148, "loss": 5.8737, "mean_token_accuracy": 0.17840521186590194, "num_tokens": 45544938.0, "step": 17965 }, { "entropy": 6.221617031097412, "epoch": 2.073860357761108, "grad_norm": 1.09375, "learning_rate": 0.00045780664259833235, "loss": 5.9548, "mean_token_accuracy": 0.17204647958278657, "num_tokens": 45557085.0, "step": 17970 }, { "entropy": 6.249954557418823, "epoch": 2.0744373918061165, "grad_norm": 1.5078125, "learning_rate": 0.00045778258251133924, "loss": 5.8955, "mean_token_accuracy": 0.17703141123056412, "num_tokens": 45570174.0, "step": 17975 }, { "entropy": 6.208803415298462, "epoch": 2.0750144258511254, "grad_norm": 1.3671875, "learning_rate": 0.00045775851627654474, "loss": 5.9011, "mean_token_accuracy": 0.17877745032310485, "num_tokens": 45582174.0, "step": 17980 }, { "entropy": 6.200427007675171, "epoch": 2.075591459896134, "grad_norm": 1.390625, "learning_rate": 0.0004577344438947584, "loss": 5.992, "mean_token_accuracy": 0.17164078503847122, "num_tokens": 45595732.0, "step": 17985 }, { "entropy": 6.15403265953064, "epoch": 2.0761684939411427, "grad_norm": 1.28125, "learning_rate": 0.00045771036536678984, "loss": 5.9319, "mean_token_accuracy": 0.17511217743158342, "num_tokens": 45609675.0, "step": 17990 }, { "entropy": 6.279201984405518, "epoch": 2.076745527986151, "grad_norm": 2.0625, "learning_rate": 0.00045768628069344885, "loss": 5.9654, "mean_token_accuracy": 0.17805370539426804, "num_tokens": 45622467.0, "step": 17995 }, { "entropy": 6.270020294189453, "epoch": 2.07732256203116, "grad_norm": 1.671875, "learning_rate": 0.0004576621898755455, "loss": 6.0249, "mean_token_accuracy": 0.16146025508642198, "num_tokens": 45636246.0, "step": 18000 }, { "epoch": 2.07732256203116, "eval_entropy": 6.116413441577485, "eval_loss": 6.092830181121826, "eval_mean_token_accuracy": 0.1729923587462968, "eval_num_tokens": 45636246.0, "eval_runtime": 22.6545, "eval_samples_per_second": 1241.96, "eval_steps_per_second": 155.245, "step": 18000 }, { "entropy": 6.242395353317261, "epoch": 2.0778995960761684, "grad_norm": 1.1875, "learning_rate": 0.00045763809291389024, "loss": 5.8829, "mean_token_accuracy": 0.17664990276098252, "num_tokens": 45649127.0, "step": 18005 }, { "entropy": 6.251932859420776, "epoch": 2.0784766301211772, "grad_norm": 1.171875, "learning_rate": 0.0004576139898092933, "loss": 5.93, "mean_token_accuracy": 0.17574980109930038, "num_tokens": 45661633.0, "step": 18010 }, { "entropy": 6.1648228645324705, "epoch": 2.0790536641661856, "grad_norm": 0.98828125, "learning_rate": 0.0004575898805625657, "loss": 5.8679, "mean_token_accuracy": 0.18012765049934387, "num_tokens": 45673643.0, "step": 18015 }, { "entropy": 6.276806163787842, "epoch": 2.0796306982111945, "grad_norm": 2.109375, "learning_rate": 0.00045756576517451804, "loss": 5.9974, "mean_token_accuracy": 0.1685441628098488, "num_tokens": 45686125.0, "step": 18020 }, { "entropy": 6.196450567245483, "epoch": 2.080207732256203, "grad_norm": 1.140625, "learning_rate": 0.00045754164364596156, "loss": 5.8703, "mean_token_accuracy": 0.17436889410018921, "num_tokens": 45697919.0, "step": 18025 }, { "entropy": 6.212252378463745, "epoch": 2.080784766301212, "grad_norm": 1.2421875, "learning_rate": 0.0004575175159777076, "loss": 5.9339, "mean_token_accuracy": 0.17510858327150344, "num_tokens": 45709450.0, "step": 18030 }, { "entropy": 6.226101922988891, "epoch": 2.0813618003462206, "grad_norm": 1.109375, "learning_rate": 0.0004574933821705676, "loss": 5.903, "mean_token_accuracy": 0.1775021031498909, "num_tokens": 45721464.0, "step": 18035 }, { "entropy": 6.239909267425537, "epoch": 2.081938834391229, "grad_norm": 1.2421875, "learning_rate": 0.0004574692422253534, "loss": 5.997, "mean_token_accuracy": 0.17450278103351594, "num_tokens": 45733397.0, "step": 18040 }, { "entropy": 6.160855865478515, "epoch": 2.082515868436238, "grad_norm": 0.9765625, "learning_rate": 0.00045744509614287687, "loss": 5.9495, "mean_token_accuracy": 0.17414658963680268, "num_tokens": 45744953.0, "step": 18045 }, { "entropy": 6.224947929382324, "epoch": 2.0830929024812463, "grad_norm": 1.3671875, "learning_rate": 0.0004574209439239501, "loss": 5.8894, "mean_token_accuracy": 0.17783963531255723, "num_tokens": 45756914.0, "step": 18050 }, { "entropy": 6.22959337234497, "epoch": 2.083669936526255, "grad_norm": 1.03125, "learning_rate": 0.00045739678556938563, "loss": 5.9758, "mean_token_accuracy": 0.1755364254117012, "num_tokens": 45770888.0, "step": 18055 }, { "entropy": 6.221868658065796, "epoch": 2.0842469705712636, "grad_norm": 1.5625, "learning_rate": 0.00045737262107999575, "loss": 5.9405, "mean_token_accuracy": 0.17491403818130494, "num_tokens": 45783551.0, "step": 18060 }, { "entropy": 6.1950257301330565, "epoch": 2.0848240046162725, "grad_norm": 1.03125, "learning_rate": 0.0004573484504565934, "loss": 5.9148, "mean_token_accuracy": 0.1824825018644333, "num_tokens": 45795700.0, "step": 18065 }, { "entropy": 6.157202672958374, "epoch": 2.085401038661281, "grad_norm": 0.9296875, "learning_rate": 0.0004573242736999915, "loss": 5.8836, "mean_token_accuracy": 0.1819426953792572, "num_tokens": 45808414.0, "step": 18070 }, { "entropy": 6.22504997253418, "epoch": 2.0859780727062898, "grad_norm": 1.3046875, "learning_rate": 0.00045730009081100314, "loss": 5.8613, "mean_token_accuracy": 0.17845331579446794, "num_tokens": 45821710.0, "step": 18075 }, { "entropy": 6.160791349411011, "epoch": 2.086555106751298, "grad_norm": 1.28125, "learning_rate": 0.00045727590179044195, "loss": 5.912, "mean_token_accuracy": 0.1739562124013901, "num_tokens": 45835812.0, "step": 18080 }, { "entropy": 6.191755867004394, "epoch": 2.087132140796307, "grad_norm": 1.25, "learning_rate": 0.0004572517066391211, "loss": 5.9026, "mean_token_accuracy": 0.1821553200483322, "num_tokens": 45849076.0, "step": 18085 }, { "entropy": 6.258313703536987, "epoch": 2.0877091748413155, "grad_norm": 1.0234375, "learning_rate": 0.00045722750535785484, "loss": 5.9761, "mean_token_accuracy": 0.1702700823545456, "num_tokens": 45861375.0, "step": 18090 }, { "entropy": 6.212756967544555, "epoch": 2.0882862088863243, "grad_norm": 1.4140625, "learning_rate": 0.00045720329794745685, "loss": 5.9076, "mean_token_accuracy": 0.17553171664476394, "num_tokens": 45872096.0, "step": 18095 }, { "entropy": 6.15145845413208, "epoch": 2.0888632429313327, "grad_norm": 1.0546875, "learning_rate": 0.0004571790844087415, "loss": 5.8789, "mean_token_accuracy": 0.17751434594392776, "num_tokens": 45884843.0, "step": 18100 }, { "entropy": 6.237578344345093, "epoch": 2.0894402769763416, "grad_norm": 1.8046875, "learning_rate": 0.0004571548647425231, "loss": 5.9045, "mean_token_accuracy": 0.17498090863227844, "num_tokens": 45896644.0, "step": 18105 }, { "entropy": 6.285304403305053, "epoch": 2.0900173110213505, "grad_norm": 1.3125, "learning_rate": 0.0004571306389496164, "loss": 6.0258, "mean_token_accuracy": 0.16776983588933944, "num_tokens": 45910204.0, "step": 18110 }, { "entropy": 6.244596290588379, "epoch": 2.090594345066359, "grad_norm": 1.09375, "learning_rate": 0.00045710640703083594, "loss": 5.9348, "mean_token_accuracy": 0.1719875767827034, "num_tokens": 45923332.0, "step": 18115 }, { "entropy": 6.222869157791138, "epoch": 2.0911713791113677, "grad_norm": 1.0859375, "learning_rate": 0.00045708216898699707, "loss": 5.9541, "mean_token_accuracy": 0.176614148914814, "num_tokens": 45937322.0, "step": 18120 }, { "entropy": 6.245453834533691, "epoch": 2.091748413156376, "grad_norm": 1.0625, "learning_rate": 0.00045705792481891483, "loss": 5.9062, "mean_token_accuracy": 0.17339543551206588, "num_tokens": 45950369.0, "step": 18125 }, { "entropy": 6.272603368759155, "epoch": 2.092325447201385, "grad_norm": 1.0859375, "learning_rate": 0.00045703367452740477, "loss": 6.0512, "mean_token_accuracy": 0.17232666164636612, "num_tokens": 45963402.0, "step": 18130 }, { "entropy": 6.25339183807373, "epoch": 2.0929024812463934, "grad_norm": 1.3359375, "learning_rate": 0.00045700941811328247, "loss": 5.9672, "mean_token_accuracy": 0.1721173793077469, "num_tokens": 45976979.0, "step": 18135 }, { "entropy": 6.207638740539551, "epoch": 2.0934795152914023, "grad_norm": 1.2109375, "learning_rate": 0.00045698515557736374, "loss": 5.9717, "mean_token_accuracy": 0.17337723970413207, "num_tokens": 45990334.0, "step": 18140 }, { "entropy": 6.171046018600464, "epoch": 2.0940565493364107, "grad_norm": 1.125, "learning_rate": 0.00045696088692046477, "loss": 5.8522, "mean_token_accuracy": 0.18572404831647873, "num_tokens": 46002322.0, "step": 18145 }, { "entropy": 6.209211778640747, "epoch": 2.0946335833814196, "grad_norm": 1.0234375, "learning_rate": 0.00045693661214340174, "loss": 5.9573, "mean_token_accuracy": 0.17103371322154998, "num_tokens": 46014136.0, "step": 18150 }, { "entropy": 6.296702432632446, "epoch": 2.095210617426428, "grad_norm": 1.0078125, "learning_rate": 0.00045691233124699117, "loss": 5.9871, "mean_token_accuracy": 0.17024188190698625, "num_tokens": 46026686.0, "step": 18155 }, { "entropy": 6.278897476196289, "epoch": 2.095787651471437, "grad_norm": 1.0859375, "learning_rate": 0.0004568880442320497, "loss": 5.9099, "mean_token_accuracy": 0.17562095820903778, "num_tokens": 46038462.0, "step": 18160 }, { "entropy": 6.190706062316894, "epoch": 2.0963646855164453, "grad_norm": 1.21875, "learning_rate": 0.00045686375109939417, "loss": 5.9664, "mean_token_accuracy": 0.171871317923069, "num_tokens": 46051549.0, "step": 18165 }, { "entropy": 6.214040946960449, "epoch": 2.096941719561454, "grad_norm": 1.3203125, "learning_rate": 0.0004568394518498417, "loss": 5.9751, "mean_token_accuracy": 0.17257556617259978, "num_tokens": 46065282.0, "step": 18170 }, { "entropy": 6.249269962310791, "epoch": 2.0975187536064626, "grad_norm": 1.2265625, "learning_rate": 0.00045681514648420965, "loss": 5.9601, "mean_token_accuracy": 0.17436347603797914, "num_tokens": 46077238.0, "step": 18175 }, { "entropy": 6.293581247329712, "epoch": 2.0980957876514714, "grad_norm": 1.1796875, "learning_rate": 0.0004567908350033154, "loss": 5.9766, "mean_token_accuracy": 0.1720675766468048, "num_tokens": 46089044.0, "step": 18180 }, { "entropy": 6.234652948379517, "epoch": 2.0986728216964803, "grad_norm": 1.3671875, "learning_rate": 0.0004567665174079767, "loss": 6.0156, "mean_token_accuracy": 0.17009917348623277, "num_tokens": 46101246.0, "step": 18185 }, { "entropy": 6.269860029220581, "epoch": 2.0992498557414887, "grad_norm": 1.2109375, "learning_rate": 0.00045674219369901153, "loss": 5.9875, "mean_token_accuracy": 0.17488809376955033, "num_tokens": 46112735.0, "step": 18190 }, { "entropy": 6.214660596847534, "epoch": 2.0998268897864976, "grad_norm": 1.140625, "learning_rate": 0.0004567178638772379, "loss": 6.0302, "mean_token_accuracy": 0.17096078544855117, "num_tokens": 46125547.0, "step": 18195 }, { "entropy": 6.347840452194214, "epoch": 2.100403923831506, "grad_norm": 1.171875, "learning_rate": 0.0004566935279434742, "loss": 5.9981, "mean_token_accuracy": 0.16747518330812455, "num_tokens": 46137356.0, "step": 18200 }, { "entropy": 6.1926312923431395, "epoch": 2.100980957876515, "grad_norm": 1.0390625, "learning_rate": 0.00045666918589853895, "loss": 5.9094, "mean_token_accuracy": 0.17773739844560624, "num_tokens": 46149935.0, "step": 18205 }, { "entropy": 6.149626016616821, "epoch": 2.1015579919215233, "grad_norm": 0.9921875, "learning_rate": 0.00045664483774325094, "loss": 5.8524, "mean_token_accuracy": 0.1826179087162018, "num_tokens": 46162186.0, "step": 18210 }, { "entropy": 6.1907673358917235, "epoch": 2.102135025966532, "grad_norm": 1.34375, "learning_rate": 0.0004566204834784289, "loss": 5.8694, "mean_token_accuracy": 0.17748078852891921, "num_tokens": 46175221.0, "step": 18215 }, { "entropy": 6.201510906219482, "epoch": 2.1027120600115405, "grad_norm": 1.3828125, "learning_rate": 0.00045659612310489225, "loss": 5.9586, "mean_token_accuracy": 0.18019836395978928, "num_tokens": 46187898.0, "step": 18220 }, { "entropy": 6.209728860855103, "epoch": 2.1032890940565494, "grad_norm": 1.0703125, "learning_rate": 0.00045657175662346014, "loss": 5.8822, "mean_token_accuracy": 0.1802334815263748, "num_tokens": 46200792.0, "step": 18225 }, { "entropy": 6.159025526046753, "epoch": 2.103866128101558, "grad_norm": 3.09375, "learning_rate": 0.0004565473840349522, "loss": 5.9392, "mean_token_accuracy": 0.17072780430316925, "num_tokens": 46213791.0, "step": 18230 }, { "entropy": 6.192187929153443, "epoch": 2.1044431621465667, "grad_norm": 1.4609375, "learning_rate": 0.00045652300534018816, "loss": 5.9233, "mean_token_accuracy": 0.17740607112646103, "num_tokens": 46226229.0, "step": 18235 }, { "entropy": 6.192289400100708, "epoch": 2.105020196191575, "grad_norm": 1.265625, "learning_rate": 0.000456498620539988, "loss": 5.926, "mean_token_accuracy": 0.17601072639226914, "num_tokens": 46239253.0, "step": 18240 }, { "entropy": 6.2401594638824465, "epoch": 2.105597230236584, "grad_norm": 1.375, "learning_rate": 0.0004564742296351719, "loss": 5.9742, "mean_token_accuracy": 0.1719544380903244, "num_tokens": 46251578.0, "step": 18245 }, { "entropy": 6.280898237228394, "epoch": 2.106174264281593, "grad_norm": 1.0859375, "learning_rate": 0.00045644983262656014, "loss": 5.965, "mean_token_accuracy": 0.17226995527744293, "num_tokens": 46265421.0, "step": 18250 }, { "entropy": 6.250201892852783, "epoch": 2.1067512983266012, "grad_norm": 1.078125, "learning_rate": 0.0004564254295149735, "loss": 5.9651, "mean_token_accuracy": 0.1741169959306717, "num_tokens": 46277480.0, "step": 18255 }, { "entropy": 6.202625846862793, "epoch": 2.10732833237161, "grad_norm": 1.5703125, "learning_rate": 0.00045640102030123264, "loss": 6.0156, "mean_token_accuracy": 0.170202574133873, "num_tokens": 46289793.0, "step": 18260 }, { "entropy": 6.236398601531983, "epoch": 2.1079053664166185, "grad_norm": 1.3515625, "learning_rate": 0.00045637660498615865, "loss": 5.9274, "mean_token_accuracy": 0.1808223232626915, "num_tokens": 46301653.0, "step": 18265 }, { "entropy": 6.08497109413147, "epoch": 2.1084824004616274, "grad_norm": 1.109375, "learning_rate": 0.0004563521835705725, "loss": 5.8335, "mean_token_accuracy": 0.18415203988552092, "num_tokens": 46314368.0, "step": 18270 }, { "entropy": 6.258514070510865, "epoch": 2.109059434506636, "grad_norm": 2.25, "learning_rate": 0.00045632775605529587, "loss": 5.9696, "mean_token_accuracy": 0.16779158264398575, "num_tokens": 46327446.0, "step": 18275 }, { "entropy": 6.274258184432983, "epoch": 2.1096364685516447, "grad_norm": 1.0390625, "learning_rate": 0.0004563033224411501, "loss": 5.967, "mean_token_accuracy": 0.16915316730737687, "num_tokens": 46340370.0, "step": 18280 }, { "entropy": 6.2087993144989015, "epoch": 2.110213502596653, "grad_norm": 1.125, "learning_rate": 0.0004562788827289572, "loss": 5.9568, "mean_token_accuracy": 0.17465278506278992, "num_tokens": 46352675.0, "step": 18285 }, { "entropy": 6.150845050811768, "epoch": 2.110790536641662, "grad_norm": 1.1484375, "learning_rate": 0.00045625443691953914, "loss": 5.8823, "mean_token_accuracy": 0.1770549714565277, "num_tokens": 46365404.0, "step": 18290 }, { "entropy": 6.214556503295898, "epoch": 2.1113675706866704, "grad_norm": 0.99609375, "learning_rate": 0.0004562299850137181, "loss": 5.8913, "mean_token_accuracy": 0.17711358964443208, "num_tokens": 46377544.0, "step": 18295 }, { "entropy": 6.227174139022827, "epoch": 2.111944604731679, "grad_norm": 1.078125, "learning_rate": 0.0004562055270123166, "loss": 5.9894, "mean_token_accuracy": 0.1742199331521988, "num_tokens": 46390425.0, "step": 18300 }, { "entropy": 6.196693086624146, "epoch": 2.1125216387766876, "grad_norm": 1.3828125, "learning_rate": 0.00045618106291615715, "loss": 5.9197, "mean_token_accuracy": 0.17214723229408263, "num_tokens": 46403359.0, "step": 18305 }, { "entropy": 6.224980401992798, "epoch": 2.1130986728216965, "grad_norm": 1.2421875, "learning_rate": 0.0004561565927260627, "loss": 5.9763, "mean_token_accuracy": 0.17695431560277938, "num_tokens": 46414700.0, "step": 18310 }, { "entropy": 6.23972864151001, "epoch": 2.1136757068667054, "grad_norm": 1.1171875, "learning_rate": 0.0004561321164428561, "loss": 5.9649, "mean_token_accuracy": 0.1728884235024452, "num_tokens": 46427199.0, "step": 18315 }, { "entropy": 6.2846475601196286, "epoch": 2.114252740911714, "grad_norm": 1.125, "learning_rate": 0.0004561076340673609, "loss": 5.936, "mean_token_accuracy": 0.17691826820373535, "num_tokens": 46440143.0, "step": 18320 }, { "entropy": 6.24670181274414, "epoch": 2.1148297749567226, "grad_norm": 1.0, "learning_rate": 0.0004560831456004003, "loss": 5.9165, "mean_token_accuracy": 0.17078517973423005, "num_tokens": 46452868.0, "step": 18325 }, { "entropy": 6.2097993850708, "epoch": 2.115406809001731, "grad_norm": 1.0234375, "learning_rate": 0.0004560586510427981, "loss": 5.8911, "mean_token_accuracy": 0.179876109957695, "num_tokens": 46465648.0, "step": 18330 }, { "entropy": 6.155358743667603, "epoch": 2.11598384304674, "grad_norm": 1.3984375, "learning_rate": 0.0004560341503953781, "loss": 5.9482, "mean_token_accuracy": 0.17687012404203414, "num_tokens": 46478282.0, "step": 18335 }, { "entropy": 6.1971207618713375, "epoch": 2.1165608770917483, "grad_norm": 1.0, "learning_rate": 0.0004560096436589643, "loss": 5.8409, "mean_token_accuracy": 0.18354799300432206, "num_tokens": 46490299.0, "step": 18340 }, { "entropy": 6.157772064208984, "epoch": 2.117137911136757, "grad_norm": 1.0078125, "learning_rate": 0.00045598513083438115, "loss": 5.8665, "mean_token_accuracy": 0.18088093400001526, "num_tokens": 46502165.0, "step": 18345 }, { "entropy": 6.207816171646118, "epoch": 2.1177149451817656, "grad_norm": 1.0703125, "learning_rate": 0.00045596061192245297, "loss": 6.0133, "mean_token_accuracy": 0.16898939311504363, "num_tokens": 46514954.0, "step": 18350 }, { "entropy": 6.271923685073853, "epoch": 2.1182919792267745, "grad_norm": 1.0859375, "learning_rate": 0.0004559360869240045, "loss": 6.0332, "mean_token_accuracy": 0.1673020102083683, "num_tokens": 46527088.0, "step": 18355 }, { "entropy": 6.276559066772461, "epoch": 2.118869013271783, "grad_norm": 1.078125, "learning_rate": 0.0004559115558398606, "loss": 5.9809, "mean_token_accuracy": 0.1680253580212593, "num_tokens": 46538737.0, "step": 18360 }, { "entropy": 6.214357948303222, "epoch": 2.1194460473167918, "grad_norm": 0.9375, "learning_rate": 0.0004558870186708465, "loss": 5.9074, "mean_token_accuracy": 0.1808343708515167, "num_tokens": 46551963.0, "step": 18365 }, { "entropy": 6.22217869758606, "epoch": 2.1200230813618, "grad_norm": 0.99609375, "learning_rate": 0.00045586247541778724, "loss": 6.0179, "mean_token_accuracy": 0.17336802631616594, "num_tokens": 46564247.0, "step": 18370 }, { "entropy": 6.195797967910766, "epoch": 2.120600115406809, "grad_norm": 1.171875, "learning_rate": 0.0004558379260815085, "loss": 5.959, "mean_token_accuracy": 0.1755570724606514, "num_tokens": 46578491.0, "step": 18375 }, { "entropy": 6.248219442367554, "epoch": 2.1211771494518175, "grad_norm": 1.078125, "learning_rate": 0.0004558133706628359, "loss": 5.9531, "mean_token_accuracy": 0.17279623150825502, "num_tokens": 46591528.0, "step": 18380 }, { "entropy": 6.26521782875061, "epoch": 2.1217541834968263, "grad_norm": 1.640625, "learning_rate": 0.00045578880916259554, "loss": 6.0107, "mean_token_accuracy": 0.16866602301597594, "num_tokens": 46605028.0, "step": 18385 }, { "entropy": 6.189346647262573, "epoch": 2.122331217541835, "grad_norm": 1.3046875, "learning_rate": 0.0004557642415816132, "loss": 5.896, "mean_token_accuracy": 0.18203431665897368, "num_tokens": 46617713.0, "step": 18390 }, { "entropy": 6.227155113220215, "epoch": 2.1229082515868436, "grad_norm": 0.95703125, "learning_rate": 0.0004557396679207155, "loss": 6.0157, "mean_token_accuracy": 0.16739506721496583, "num_tokens": 46631897.0, "step": 18395 }, { "entropy": 6.265323686599731, "epoch": 2.1234852856318525, "grad_norm": 1.0859375, "learning_rate": 0.00045571508818072887, "loss": 6.0151, "mean_token_accuracy": 0.16782745271921157, "num_tokens": 46645457.0, "step": 18400 }, { "entropy": 6.281725883483887, "epoch": 2.124062319676861, "grad_norm": 1.3828125, "learning_rate": 0.0004556905023624799, "loss": 5.9885, "mean_token_accuracy": 0.17250981628894807, "num_tokens": 46657779.0, "step": 18405 }, { "entropy": 6.201862144470215, "epoch": 2.1246393537218697, "grad_norm": 1.0078125, "learning_rate": 0.00045566591046679577, "loss": 5.9359, "mean_token_accuracy": 0.1725264832377434, "num_tokens": 46670590.0, "step": 18410 }, { "entropy": 6.193232536315918, "epoch": 2.125216387766878, "grad_norm": 1.1875, "learning_rate": 0.00045564131249450343, "loss": 5.9053, "mean_token_accuracy": 0.17696632593870162, "num_tokens": 46683369.0, "step": 18415 }, { "entropy": 6.242049694061279, "epoch": 2.125793421811887, "grad_norm": 0.984375, "learning_rate": 0.0004556167084464302, "loss": 5.9065, "mean_token_accuracy": 0.1703455090522766, "num_tokens": 46695371.0, "step": 18420 }, { "entropy": 6.178325033187866, "epoch": 2.1263704558568954, "grad_norm": 2.40625, "learning_rate": 0.0004555920983234038, "loss": 5.9094, "mean_token_accuracy": 0.16967119425535201, "num_tokens": 46708422.0, "step": 18425 }, { "entropy": 6.190279960632324, "epoch": 2.1269474899019043, "grad_norm": 1.8046875, "learning_rate": 0.00045556748212625183, "loss": 5.9167, "mean_token_accuracy": 0.16888023316860198, "num_tokens": 46722236.0, "step": 18430 }, { "entropy": 6.287196636199951, "epoch": 2.1275245239469127, "grad_norm": 1.046875, "learning_rate": 0.0004555428598558023, "loss": 5.9249, "mean_token_accuracy": 0.17670912742614747, "num_tokens": 46733084.0, "step": 18435 }, { "entropy": 6.139206981658935, "epoch": 2.1281015579919216, "grad_norm": 1.4296875, "learning_rate": 0.0004555182315128833, "loss": 5.9405, "mean_token_accuracy": 0.170323446393013, "num_tokens": 46745174.0, "step": 18440 }, { "entropy": 6.298870611190796, "epoch": 2.12867859203693, "grad_norm": 1.1484375, "learning_rate": 0.0004554935970983234, "loss": 5.9951, "mean_token_accuracy": 0.17619017660617828, "num_tokens": 46758134.0, "step": 18445 }, { "entropy": 6.195008039474487, "epoch": 2.129255626081939, "grad_norm": 1.15625, "learning_rate": 0.0004554689566129509, "loss": 5.8611, "mean_token_accuracy": 0.1771741986274719, "num_tokens": 46770941.0, "step": 18450 }, { "entropy": 6.199351644515991, "epoch": 2.1298326601269473, "grad_norm": 1.234375, "learning_rate": 0.00045544431005759467, "loss": 5.9685, "mean_token_accuracy": 0.1785759299993515, "num_tokens": 46782532.0, "step": 18455 }, { "entropy": 6.145861291885376, "epoch": 2.130409694171956, "grad_norm": 1.125, "learning_rate": 0.00045541965743308376, "loss": 5.9046, "mean_token_accuracy": 0.18034725040197372, "num_tokens": 46794636.0, "step": 18460 }, { "entropy": 6.2272556781768795, "epoch": 2.130986728216965, "grad_norm": 1.015625, "learning_rate": 0.0004553949987402473, "loss": 5.9299, "mean_token_accuracy": 0.1736836090683937, "num_tokens": 46807797.0, "step": 18465 }, { "entropy": 6.243286943435669, "epoch": 2.1315637622619734, "grad_norm": 1.1328125, "learning_rate": 0.0004553703339799146, "loss": 5.9213, "mean_token_accuracy": 0.17754804641008376, "num_tokens": 46819838.0, "step": 18470 }, { "entropy": 6.128636407852173, "epoch": 2.1321407963069823, "grad_norm": 1.0859375, "learning_rate": 0.0004553456631529154, "loss": 5.8695, "mean_token_accuracy": 0.18137176036834718, "num_tokens": 46832172.0, "step": 18475 }, { "entropy": 6.265114498138428, "epoch": 2.1327178303519907, "grad_norm": 1.09375, "learning_rate": 0.0004553209862600794, "loss": 5.9937, "mean_token_accuracy": 0.16853537559509277, "num_tokens": 46844457.0, "step": 18480 }, { "entropy": 6.165822982788086, "epoch": 2.1332948643969996, "grad_norm": 1.1953125, "learning_rate": 0.0004552963033022365, "loss": 5.8619, "mean_token_accuracy": 0.1780229240655899, "num_tokens": 46857256.0, "step": 18485 }, { "entropy": 6.2471390724182125, "epoch": 2.133871898442008, "grad_norm": 1.1328125, "learning_rate": 0.00045527161428021706, "loss": 5.9491, "mean_token_accuracy": 0.17000543624162673, "num_tokens": 46870971.0, "step": 18490 }, { "entropy": 6.2426300048828125, "epoch": 2.134448932487017, "grad_norm": 1.125, "learning_rate": 0.0004552469191948514, "loss": 5.9197, "mean_token_accuracy": 0.17992283403873444, "num_tokens": 46882911.0, "step": 18495 }, { "entropy": 6.23798975944519, "epoch": 2.1350259665320253, "grad_norm": 2.109375, "learning_rate": 0.0004552222180469702, "loss": 5.931, "mean_token_accuracy": 0.17585217952728271, "num_tokens": 46895927.0, "step": 18500 }, { "entropy": 6.237430667877197, "epoch": 2.135603000577034, "grad_norm": 2.859375, "learning_rate": 0.00045519751083740413, "loss": 5.8958, "mean_token_accuracy": 0.17870725244283675, "num_tokens": 46908210.0, "step": 18505 }, { "entropy": 6.239075136184693, "epoch": 2.1361800346220425, "grad_norm": 1.09375, "learning_rate": 0.00045517279756698435, "loss": 5.9672, "mean_token_accuracy": 0.18029032796621322, "num_tokens": 46920197.0, "step": 18510 }, { "entropy": 6.254026937484741, "epoch": 2.1367570686670514, "grad_norm": 1.0546875, "learning_rate": 0.00045514807823654203, "loss": 5.8944, "mean_token_accuracy": 0.18046819418668747, "num_tokens": 46932628.0, "step": 18515 }, { "entropy": 6.215092468261719, "epoch": 2.13733410271206, "grad_norm": 1.328125, "learning_rate": 0.0004551233528469086, "loss": 5.9229, "mean_token_accuracy": 0.16904639899730683, "num_tokens": 46945479.0, "step": 18520 }, { "entropy": 6.200603246688843, "epoch": 2.1379111367570687, "grad_norm": 1.2421875, "learning_rate": 0.00045509862139891553, "loss": 5.9086, "mean_token_accuracy": 0.1746812269091606, "num_tokens": 46958178.0, "step": 18525 }, { "entropy": 6.278514242172241, "epoch": 2.138488170802077, "grad_norm": 1.21875, "learning_rate": 0.00045507388389339496, "loss": 6.0653, "mean_token_accuracy": 0.16110795587301255, "num_tokens": 46972959.0, "step": 18530 }, { "entropy": 6.296849870681763, "epoch": 2.139065204847086, "grad_norm": 1.125, "learning_rate": 0.00045504914033117866, "loss": 5.9954, "mean_token_accuracy": 0.17448684722185134, "num_tokens": 46985506.0, "step": 18535 }, { "entropy": 6.149590063095093, "epoch": 2.139642238892095, "grad_norm": 1.0, "learning_rate": 0.00045502439071309897, "loss": 5.9199, "mean_token_accuracy": 0.17310387939214705, "num_tokens": 46997928.0, "step": 18540 }, { "entropy": 6.111760044097901, "epoch": 2.1402192729371032, "grad_norm": 1.0390625, "learning_rate": 0.00045499963503998835, "loss": 5.7738, "mean_token_accuracy": 0.1954570844769478, "num_tokens": 47010097.0, "step": 18545 }, { "entropy": 6.226894521713257, "epoch": 2.140796306982112, "grad_norm": 1.4921875, "learning_rate": 0.0004549748733126794, "loss": 5.9459, "mean_token_accuracy": 0.1732877790927887, "num_tokens": 47021230.0, "step": 18550 }, { "entropy": 6.2623724937438965, "epoch": 2.1413733410271205, "grad_norm": 1.0859375, "learning_rate": 0.000454950105532005, "loss": 5.9899, "mean_token_accuracy": 0.17608155757188798, "num_tokens": 47034433.0, "step": 18555 }, { "entropy": 6.264982652664185, "epoch": 2.1419503750721294, "grad_norm": 1.1640625, "learning_rate": 0.00045492533169879816, "loss": 5.9194, "mean_token_accuracy": 0.17457908540964126, "num_tokens": 47046824.0, "step": 18560 }, { "entropy": 6.1724879264831545, "epoch": 2.142527409117138, "grad_norm": 1.1640625, "learning_rate": 0.00045490055181389216, "loss": 5.8902, "mean_token_accuracy": 0.18058053702116011, "num_tokens": 47058868.0, "step": 18565 }, { "entropy": 6.206031465530396, "epoch": 2.1431044431621467, "grad_norm": 1.078125, "learning_rate": 0.00045487576587812046, "loss": 5.9608, "mean_token_accuracy": 0.16733982115983964, "num_tokens": 47070898.0, "step": 18570 }, { "entropy": 6.247266578674316, "epoch": 2.143681477207155, "grad_norm": 1.3828125, "learning_rate": 0.00045485097389231675, "loss": 5.9567, "mean_token_accuracy": 0.17399024218320847, "num_tokens": 47083739.0, "step": 18575 }, { "entropy": 6.179333114624024, "epoch": 2.144258511252164, "grad_norm": 1.03125, "learning_rate": 0.0004548261758573149, "loss": 5.8709, "mean_token_accuracy": 0.17647884041070938, "num_tokens": 47095595.0, "step": 18580 }, { "entropy": 6.256615877151489, "epoch": 2.1448355452971724, "grad_norm": 1.1015625, "learning_rate": 0.0004548013717739489, "loss": 6.0437, "mean_token_accuracy": 0.16919712126255035, "num_tokens": 47108326.0, "step": 18585 }, { "entropy": 6.241568183898925, "epoch": 2.145412579342181, "grad_norm": 0.97265625, "learning_rate": 0.0004547765616430531, "loss": 5.9366, "mean_token_accuracy": 0.1774327889084816, "num_tokens": 47120494.0, "step": 18590 }, { "entropy": 6.225147438049317, "epoch": 2.14598961338719, "grad_norm": 1.0546875, "learning_rate": 0.0004547517454654619, "loss": 5.9671, "mean_token_accuracy": 0.17375273406505584, "num_tokens": 47133116.0, "step": 18595 }, { "entropy": 6.193332386016846, "epoch": 2.1465666474321985, "grad_norm": 1.3203125, "learning_rate": 0.00045472692324201005, "loss": 5.905, "mean_token_accuracy": 0.17857620865106583, "num_tokens": 47145208.0, "step": 18600 }, { "entropy": 6.228554677963257, "epoch": 2.1471436814772074, "grad_norm": 1.6015625, "learning_rate": 0.00045470209497353243, "loss": 5.9368, "mean_token_accuracy": 0.17507996857166291, "num_tokens": 47159217.0, "step": 18605 }, { "entropy": 6.249907732009888, "epoch": 2.1477207155222158, "grad_norm": 1.2109375, "learning_rate": 0.0004546772606608641, "loss": 5.9713, "mean_token_accuracy": 0.17326943725347518, "num_tokens": 47171781.0, "step": 18610 }, { "entropy": 6.234317064285278, "epoch": 2.1482977495672246, "grad_norm": 1.0546875, "learning_rate": 0.0004546524203048404, "loss": 5.9683, "mean_token_accuracy": 0.17872635424137115, "num_tokens": 47184045.0, "step": 18615 }, { "entropy": 6.179287052154541, "epoch": 2.148874783612233, "grad_norm": 1.0625, "learning_rate": 0.0004546275739062967, "loss": 5.8855, "mean_token_accuracy": 0.1790724664926529, "num_tokens": 47195511.0, "step": 18620 }, { "entropy": 6.163905191421509, "epoch": 2.149451817657242, "grad_norm": 1.0078125, "learning_rate": 0.0004546027214660688, "loss": 5.8806, "mean_token_accuracy": 0.18099177926778792, "num_tokens": 47206977.0, "step": 18625 }, { "entropy": 6.228483390808106, "epoch": 2.1500288517022503, "grad_norm": 1.1953125, "learning_rate": 0.0004545778629849926, "loss": 5.9068, "mean_token_accuracy": 0.17070182263851166, "num_tokens": 47218748.0, "step": 18630 }, { "entropy": 6.293354749679565, "epoch": 2.150605885747259, "grad_norm": 0.9375, "learning_rate": 0.0004545529984639042, "loss": 6.0288, "mean_token_accuracy": 0.1641404002904892, "num_tokens": 47230651.0, "step": 18635 }, { "entropy": 6.173253059387207, "epoch": 2.1511829197922676, "grad_norm": 1.015625, "learning_rate": 0.0004545281279036398, "loss": 5.8956, "mean_token_accuracy": 0.1823137879371643, "num_tokens": 47242959.0, "step": 18640 }, { "entropy": 6.168142986297608, "epoch": 2.1517599538372765, "grad_norm": 1.3359375, "learning_rate": 0.0004545032513050361, "loss": 5.9054, "mean_token_accuracy": 0.17626358568668365, "num_tokens": 47255113.0, "step": 18645 }, { "entropy": 6.200266122817993, "epoch": 2.152336987882285, "grad_norm": 0.953125, "learning_rate": 0.0004544783686689296, "loss": 6.0133, "mean_token_accuracy": 0.17102801501750947, "num_tokens": 47266873.0, "step": 18650 }, { "entropy": 6.3203010082244875, "epoch": 2.1529140219272938, "grad_norm": 1.1015625, "learning_rate": 0.00045445347999615736, "loss": 5.9827, "mean_token_accuracy": 0.1752153605222702, "num_tokens": 47278685.0, "step": 18655 }, { "entropy": 6.213234853744507, "epoch": 2.153491055972302, "grad_norm": 1.078125, "learning_rate": 0.00045442858528755653, "loss": 5.9814, "mean_token_accuracy": 0.18181101679801942, "num_tokens": 47291553.0, "step": 18660 }, { "entropy": 6.207487154006958, "epoch": 2.154068090017311, "grad_norm": 1.0390625, "learning_rate": 0.00045440368454396435, "loss": 5.8891, "mean_token_accuracy": 0.17823161482810973, "num_tokens": 47303890.0, "step": 18665 }, { "entropy": 6.203156280517578, "epoch": 2.15464512406232, "grad_norm": 1.09375, "learning_rate": 0.0004543787777662183, "loss": 5.8939, "mean_token_accuracy": 0.1782517820596695, "num_tokens": 47316990.0, "step": 18670 }, { "entropy": 6.206212997436523, "epoch": 2.1552221581073283, "grad_norm": 1.21875, "learning_rate": 0.00045435386495515617, "loss": 5.9626, "mean_token_accuracy": 0.17625533044338226, "num_tokens": 47330568.0, "step": 18675 }, { "entropy": 6.177602052688599, "epoch": 2.155799192152337, "grad_norm": 1.1953125, "learning_rate": 0.0004543289461116159, "loss": 5.9156, "mean_token_accuracy": 0.17385042011737822, "num_tokens": 47343563.0, "step": 18680 }, { "entropy": 6.258643531799317, "epoch": 2.1563762261973456, "grad_norm": 1.0703125, "learning_rate": 0.0004543040212364356, "loss": 5.9313, "mean_token_accuracy": 0.17511464655399323, "num_tokens": 47356272.0, "step": 18685 }, { "entropy": 6.222632789611817, "epoch": 2.1569532602423545, "grad_norm": 1.1484375, "learning_rate": 0.0004542790903304536, "loss": 5.954, "mean_token_accuracy": 0.1678279832005501, "num_tokens": 47370244.0, "step": 18690 }, { "entropy": 6.234720897674561, "epoch": 2.157530294287363, "grad_norm": 1.0234375, "learning_rate": 0.0004542541533945085, "loss": 5.9204, "mean_token_accuracy": 0.18038647323846818, "num_tokens": 47383120.0, "step": 18695 }, { "entropy": 6.2574015140533445, "epoch": 2.1581073283323717, "grad_norm": 1.0703125, "learning_rate": 0.00045422921042943885, "loss": 6.026, "mean_token_accuracy": 0.1677708551287651, "num_tokens": 47397274.0, "step": 18700 }, { "entropy": 6.178472709655762, "epoch": 2.15868436237738, "grad_norm": 0.95703125, "learning_rate": 0.000454204261436084, "loss": 5.8899, "mean_token_accuracy": 0.17316479980945587, "num_tokens": 47409611.0, "step": 18705 }, { "entropy": 6.203462886810303, "epoch": 2.159261396422389, "grad_norm": 1.0390625, "learning_rate": 0.00045417930641528255, "loss": 5.9202, "mean_token_accuracy": 0.1778599888086319, "num_tokens": 47421435.0, "step": 18710 }, { "entropy": 6.276810979843139, "epoch": 2.1598384304673974, "grad_norm": 1.1484375, "learning_rate": 0.00045415434536787424, "loss": 5.9995, "mean_token_accuracy": 0.17613883763551713, "num_tokens": 47434749.0, "step": 18715 }, { "entropy": 6.20872278213501, "epoch": 2.1604154645124063, "grad_norm": 0.98046875, "learning_rate": 0.0004541293782946985, "loss": 5.9431, "mean_token_accuracy": 0.17725253254175186, "num_tokens": 47446477.0, "step": 18720 }, { "entropy": 6.117638778686524, "epoch": 2.1609924985574147, "grad_norm": 1.015625, "learning_rate": 0.0004541044051965952, "loss": 5.8292, "mean_token_accuracy": 0.18287974447011948, "num_tokens": 47459547.0, "step": 18725 }, { "entropy": 6.269925165176391, "epoch": 2.1615695326024236, "grad_norm": 1.125, "learning_rate": 0.0004540794260744041, "loss": 6.0191, "mean_token_accuracy": 0.16641358882188798, "num_tokens": 47472294.0, "step": 18730 }, { "entropy": 6.23092622756958, "epoch": 2.162146566647432, "grad_norm": 0.98046875, "learning_rate": 0.0004540544409289655, "loss": 5.9058, "mean_token_accuracy": 0.17685572654008866, "num_tokens": 47484240.0, "step": 18735 }, { "entropy": 6.214578866958618, "epoch": 2.162723600692441, "grad_norm": 0.9375, "learning_rate": 0.0004540294497611197, "loss": 5.9856, "mean_token_accuracy": 0.17463434487581253, "num_tokens": 47498179.0, "step": 18740 }, { "entropy": 6.20415768623352, "epoch": 2.1633006347374497, "grad_norm": 1.1796875, "learning_rate": 0.00045400445257170725, "loss": 5.9266, "mean_token_accuracy": 0.17393019199371337, "num_tokens": 47511354.0, "step": 18745 }, { "entropy": 6.272518587112427, "epoch": 2.163877668782458, "grad_norm": 1.0703125, "learning_rate": 0.0004539794493615689, "loss": 6.0156, "mean_token_accuracy": 0.1667408227920532, "num_tokens": 47523589.0, "step": 18750 }, { "entropy": 6.136549711227417, "epoch": 2.164454702827467, "grad_norm": 1.1640625, "learning_rate": 0.0004539544401315458, "loss": 5.9327, "mean_token_accuracy": 0.17985440343618392, "num_tokens": 47536784.0, "step": 18755 }, { "entropy": 6.226091432571411, "epoch": 2.1650317368724754, "grad_norm": 1.6015625, "learning_rate": 0.000453929424882479, "loss": 5.9236, "mean_token_accuracy": 0.17071688771247864, "num_tokens": 47550560.0, "step": 18760 }, { "entropy": 6.227948236465454, "epoch": 2.1656087709174843, "grad_norm": 1.0234375, "learning_rate": 0.00045390440361520987, "loss": 5.895, "mean_token_accuracy": 0.17807429581880568, "num_tokens": 47564069.0, "step": 18765 }, { "entropy": 6.242389440536499, "epoch": 2.1661858049624927, "grad_norm": 1.078125, "learning_rate": 0.0004538793763305799, "loss": 5.9733, "mean_token_accuracy": 0.16201029866933822, "num_tokens": 47577570.0, "step": 18770 }, { "entropy": 6.212618494033814, "epoch": 2.1667628390075016, "grad_norm": 1.046875, "learning_rate": 0.00045385434302943104, "loss": 6.0142, "mean_token_accuracy": 0.17255715876817704, "num_tokens": 47590199.0, "step": 18775 }, { "entropy": 6.259509897232055, "epoch": 2.16733987305251, "grad_norm": 1.1328125, "learning_rate": 0.0004538293037126052, "loss": 5.9149, "mean_token_accuracy": 0.17407530844211577, "num_tokens": 47601697.0, "step": 18780 }, { "entropy": 6.272859239578247, "epoch": 2.167916907097519, "grad_norm": 0.9921875, "learning_rate": 0.00045380425838094444, "loss": 5.9577, "mean_token_accuracy": 0.1750097766518593, "num_tokens": 47615331.0, "step": 18785 }, { "entropy": 6.176296091079712, "epoch": 2.1684939411425272, "grad_norm": 1.015625, "learning_rate": 0.00045377920703529133, "loss": 5.9098, "mean_token_accuracy": 0.17534357011318208, "num_tokens": 47628455.0, "step": 18790 }, { "entropy": 6.254702377319336, "epoch": 2.169070975187536, "grad_norm": 1.0859375, "learning_rate": 0.0004537541496764885, "loss": 5.9253, "mean_token_accuracy": 0.17553993165493012, "num_tokens": 47642078.0, "step": 18795 }, { "entropy": 6.242267417907715, "epoch": 2.1696480092325445, "grad_norm": 1.0859375, "learning_rate": 0.0004537290863053786, "loss": 5.9378, "mean_token_accuracy": 0.1725284069776535, "num_tokens": 47653672.0, "step": 18800 }, { "entropy": 6.090953302383423, "epoch": 2.1702250432775534, "grad_norm": 1.3515625, "learning_rate": 0.00045370401692280455, "loss": 5.7931, "mean_token_accuracy": 0.18746485859155654, "num_tokens": 47666085.0, "step": 18805 }, { "entropy": 6.25534143447876, "epoch": 2.170802077322562, "grad_norm": 0.984375, "learning_rate": 0.00045367894152960976, "loss": 6.0072, "mean_token_accuracy": 0.1746744379401207, "num_tokens": 47678180.0, "step": 18810 }, { "entropy": 6.231589221954346, "epoch": 2.1713791113675707, "grad_norm": 1.21875, "learning_rate": 0.00045365386012663744, "loss": 5.9397, "mean_token_accuracy": 0.17218563407659532, "num_tokens": 47690631.0, "step": 18815 }, { "entropy": 6.2311194896697994, "epoch": 2.1719561454125795, "grad_norm": 1.03125, "learning_rate": 0.00045362877271473137, "loss": 5.8993, "mean_token_accuracy": 0.17505298256874086, "num_tokens": 47702577.0, "step": 18820 }, { "entropy": 6.198976993560791, "epoch": 2.172533179457588, "grad_norm": 1.25, "learning_rate": 0.00045360367929473517, "loss": 5.9298, "mean_token_accuracy": 0.18071759790182113, "num_tokens": 47714683.0, "step": 18825 }, { "entropy": 6.210054349899292, "epoch": 2.173110213502597, "grad_norm": 1.0, "learning_rate": 0.000453578579867493, "loss": 5.8748, "mean_token_accuracy": 0.17670900523662567, "num_tokens": 47726202.0, "step": 18830 }, { "entropy": 6.163262987136841, "epoch": 2.1736872475476052, "grad_norm": 1.0859375, "learning_rate": 0.00045355347443384896, "loss": 5.914, "mean_token_accuracy": 0.17876358926296235, "num_tokens": 47740178.0, "step": 18835 }, { "entropy": 6.221033239364624, "epoch": 2.174264281592614, "grad_norm": 1.015625, "learning_rate": 0.00045352836299464755, "loss": 5.9323, "mean_token_accuracy": 0.17617103904485704, "num_tokens": 47752710.0, "step": 18840 }, { "entropy": 6.205242776870728, "epoch": 2.1748413156376225, "grad_norm": 1.046875, "learning_rate": 0.0004535032455507333, "loss": 5.8558, "mean_token_accuracy": 0.17509319633245468, "num_tokens": 47765292.0, "step": 18845 }, { "entropy": 6.215845823287964, "epoch": 2.1754183496826314, "grad_norm": 1.1171875, "learning_rate": 0.00045347812210295107, "loss": 5.9082, "mean_token_accuracy": 0.17581940293312073, "num_tokens": 47777799.0, "step": 18850 }, { "entropy": 6.217535352706909, "epoch": 2.17599538372764, "grad_norm": 1.2265625, "learning_rate": 0.00045345299265214583, "loss": 5.9047, "mean_token_accuracy": 0.1748897075653076, "num_tokens": 47790705.0, "step": 18855 }, { "entropy": 6.152811431884766, "epoch": 2.1765724177726486, "grad_norm": 1.0546875, "learning_rate": 0.00045342785719916284, "loss": 5.8459, "mean_token_accuracy": 0.17450116872787474, "num_tokens": 47802169.0, "step": 18860 }, { "entropy": 6.069148826599121, "epoch": 2.177149451817657, "grad_norm": 1.046875, "learning_rate": 0.00045340271574484755, "loss": 5.8052, "mean_token_accuracy": 0.18310066014528276, "num_tokens": 47815832.0, "step": 18865 }, { "entropy": 6.290272855758667, "epoch": 2.177726485862666, "grad_norm": 1.0546875, "learning_rate": 0.0004533775682900454, "loss": 6.014, "mean_token_accuracy": 0.17042950987815858, "num_tokens": 47828967.0, "step": 18870 }, { "entropy": 6.222682809829712, "epoch": 2.1783035199076743, "grad_norm": 0.9609375, "learning_rate": 0.0004533524148356025, "loss": 5.8551, "mean_token_accuracy": 0.1862866297364235, "num_tokens": 47842114.0, "step": 18875 }, { "entropy": 6.076592254638672, "epoch": 2.178880553952683, "grad_norm": 0.97265625, "learning_rate": 0.0004533272553823646, "loss": 5.8291, "mean_token_accuracy": 0.17668368220329284, "num_tokens": 47855808.0, "step": 18880 }, { "entropy": 6.250540828704834, "epoch": 2.179457587997692, "grad_norm": 1.1171875, "learning_rate": 0.00045330208993117816, "loss": 5.9459, "mean_token_accuracy": 0.17007622569799424, "num_tokens": 47866866.0, "step": 18885 }, { "entropy": 6.22902479171753, "epoch": 2.1800346220427005, "grad_norm": 1.0234375, "learning_rate": 0.0004532769184828894, "loss": 5.9179, "mean_token_accuracy": 0.17572437971830368, "num_tokens": 47878823.0, "step": 18890 }, { "entropy": 6.200373554229737, "epoch": 2.1806116560877093, "grad_norm": 1.078125, "learning_rate": 0.0004532517410383451, "loss": 5.9678, "mean_token_accuracy": 0.17269928604364396, "num_tokens": 47890512.0, "step": 18895 }, { "entropy": 6.2269518852233885, "epoch": 2.1811886901327178, "grad_norm": 1.6796875, "learning_rate": 0.000453226557598392, "loss": 5.9764, "mean_token_accuracy": 0.16899292171001434, "num_tokens": 47903728.0, "step": 18900 }, { "entropy": 6.238075494766235, "epoch": 2.1817657241777266, "grad_norm": 1.0390625, "learning_rate": 0.0004532013681638771, "loss": 5.9799, "mean_token_accuracy": 0.17065757811069487, "num_tokens": 47914742.0, "step": 18905 }, { "entropy": 6.262040901184082, "epoch": 2.182342758222735, "grad_norm": 1.875, "learning_rate": 0.0004531761727356478, "loss": 5.9637, "mean_token_accuracy": 0.1727651610970497, "num_tokens": 47926737.0, "step": 18910 }, { "entropy": 6.238742256164551, "epoch": 2.182919792267744, "grad_norm": 1.0, "learning_rate": 0.0004531509713145514, "loss": 5.9314, "mean_token_accuracy": 0.174980790913105, "num_tokens": 47941207.0, "step": 18915 }, { "entropy": 6.208298969268799, "epoch": 2.1834968263127523, "grad_norm": 1.03125, "learning_rate": 0.00045312576390143557, "loss": 5.9828, "mean_token_accuracy": 0.16858302056789398, "num_tokens": 47953640.0, "step": 18920 }, { "entropy": 6.228661108016968, "epoch": 2.184073860357761, "grad_norm": 1.34375, "learning_rate": 0.00045310055049714815, "loss": 5.9659, "mean_token_accuracy": 0.17834703028202056, "num_tokens": 47966399.0, "step": 18925 }, { "entropy": 6.241978883743286, "epoch": 2.1846508944027696, "grad_norm": 1.0703125, "learning_rate": 0.00045307533110253726, "loss": 5.9175, "mean_token_accuracy": 0.17427961975336076, "num_tokens": 47979521.0, "step": 18930 }, { "entropy": 6.270679616928101, "epoch": 2.1852279284477785, "grad_norm": 1.015625, "learning_rate": 0.00045305010571845096, "loss": 5.9875, "mean_token_accuracy": 0.17076631486415864, "num_tokens": 47992780.0, "step": 18935 }, { "entropy": 6.319071340560913, "epoch": 2.185804962492787, "grad_norm": 1.375, "learning_rate": 0.0004530248743457378, "loss": 6.0078, "mean_token_accuracy": 0.17148044854402542, "num_tokens": 48005548.0, "step": 18940 }, { "entropy": 6.200914764404297, "epoch": 2.1863819965377957, "grad_norm": 1.1171875, "learning_rate": 0.0004529996369852465, "loss": 5.8982, "mean_token_accuracy": 0.17534489631652833, "num_tokens": 48017352.0, "step": 18945 }, { "entropy": 6.07051453590393, "epoch": 2.1869590305828046, "grad_norm": 1.0, "learning_rate": 0.00045297439363782576, "loss": 5.7113, "mean_token_accuracy": 0.19109055697917937, "num_tokens": 48029252.0, "step": 18950 }, { "entropy": 6.199999475479126, "epoch": 2.187536064627813, "grad_norm": 1.1171875, "learning_rate": 0.0004529491443043247, "loss": 5.9418, "mean_token_accuracy": 0.1842118799686432, "num_tokens": 48041534.0, "step": 18955 }, { "entropy": 6.1737473487854, "epoch": 2.188113098672822, "grad_norm": 1.125, "learning_rate": 0.0004529238889855926, "loss": 5.9869, "mean_token_accuracy": 0.1713000401854515, "num_tokens": 48054396.0, "step": 18960 }, { "entropy": 6.286145353317261, "epoch": 2.1886901327178303, "grad_norm": 1.0546875, "learning_rate": 0.0004528986276824789, "loss": 5.9492, "mean_token_accuracy": 0.17444169223308564, "num_tokens": 48066785.0, "step": 18965 }, { "entropy": 6.1863932609558105, "epoch": 2.189267166762839, "grad_norm": 1.0, "learning_rate": 0.0004528733603958331, "loss": 5.9085, "mean_token_accuracy": 0.18538776636123658, "num_tokens": 48079837.0, "step": 18970 }, { "entropy": 6.194906759262085, "epoch": 2.1898442008078476, "grad_norm": 1.3046875, "learning_rate": 0.0004528480871265053, "loss": 5.87, "mean_token_accuracy": 0.17983012944459914, "num_tokens": 48091670.0, "step": 18975 }, { "entropy": 6.255014896392822, "epoch": 2.1904212348528564, "grad_norm": 2.15625, "learning_rate": 0.00045282280787534537, "loss": 5.99, "mean_token_accuracy": 0.17368623316287995, "num_tokens": 48105261.0, "step": 18980 }, { "entropy": 6.2829742431640625, "epoch": 2.190998268897865, "grad_norm": 1.2578125, "learning_rate": 0.0004527975226432036, "loss": 5.9153, "mean_token_accuracy": 0.17215203493833542, "num_tokens": 48118272.0, "step": 18985 }, { "entropy": 6.190290689468384, "epoch": 2.1915753029428737, "grad_norm": 1.234375, "learning_rate": 0.00045277223143093057, "loss": 5.9195, "mean_token_accuracy": 0.17416684180498124, "num_tokens": 48130413.0, "step": 18990 }, { "entropy": 6.1797760963439945, "epoch": 2.192152336987882, "grad_norm": 1.1796875, "learning_rate": 0.00045274693423937674, "loss": 5.8944, "mean_token_accuracy": 0.1710223600268364, "num_tokens": 48143308.0, "step": 18995 }, { "entropy": 6.119444990158081, "epoch": 2.192729371032891, "grad_norm": 1.296875, "learning_rate": 0.00045272163106939314, "loss": 5.8411, "mean_token_accuracy": 0.18233658671379088, "num_tokens": 48155832.0, "step": 19000 }, { "entropy": 6.218946266174316, "epoch": 2.1933064050778994, "grad_norm": 1.046875, "learning_rate": 0.00045269632192183076, "loss": 6.0152, "mean_token_accuracy": 0.1638078957796097, "num_tokens": 48168390.0, "step": 19005 }, { "entropy": 6.267431020736694, "epoch": 2.1938834391229083, "grad_norm": 1.2265625, "learning_rate": 0.00045267100679754075, "loss": 5.9599, "mean_token_accuracy": 0.17242570966482162, "num_tokens": 48180918.0, "step": 19010 }, { "entropy": 6.216310119628906, "epoch": 2.1944604731679167, "grad_norm": 1.4921875, "learning_rate": 0.0004526456856973748, "loss": 5.9549, "mean_token_accuracy": 0.17398718148469924, "num_tokens": 48194251.0, "step": 19015 }, { "entropy": 6.266015577316284, "epoch": 2.1950375072129256, "grad_norm": 1.234375, "learning_rate": 0.0004526203586221844, "loss": 5.9513, "mean_token_accuracy": 0.17341589480638503, "num_tokens": 48206704.0, "step": 19020 }, { "entropy": 6.222143745422363, "epoch": 2.1956145412579344, "grad_norm": 1.296875, "learning_rate": 0.00045259502557282145, "loss": 5.9304, "mean_token_accuracy": 0.17723745554685594, "num_tokens": 48219390.0, "step": 19025 }, { "entropy": 6.134809350967407, "epoch": 2.196191575302943, "grad_norm": 1.1953125, "learning_rate": 0.0004525696865501381, "loss": 5.8949, "mean_token_accuracy": 0.17256021797657012, "num_tokens": 48231555.0, "step": 19030 }, { "entropy": 6.243925762176514, "epoch": 2.1967686093479517, "grad_norm": 1.203125, "learning_rate": 0.0004525443415549865, "loss": 5.9766, "mean_token_accuracy": 0.17290915101766585, "num_tokens": 48243763.0, "step": 19035 }, { "entropy": 6.211654376983643, "epoch": 2.19734564339296, "grad_norm": 0.94140625, "learning_rate": 0.00045251899058821915, "loss": 5.9834, "mean_token_accuracy": 0.17231059968471527, "num_tokens": 48257567.0, "step": 19040 }, { "entropy": 6.19317660331726, "epoch": 2.197922677437969, "grad_norm": 1.921875, "learning_rate": 0.0004524936336506887, "loss": 5.8512, "mean_token_accuracy": 0.18214067071676254, "num_tokens": 48270313.0, "step": 19045 }, { "entropy": 6.189791822433472, "epoch": 2.1984997114829774, "grad_norm": 1.1328125, "learning_rate": 0.0004524682707432482, "loss": 5.8669, "mean_token_accuracy": 0.17424180805683137, "num_tokens": 48282768.0, "step": 19050 }, { "entropy": 6.139924001693726, "epoch": 2.1990767455279863, "grad_norm": 1.046875, "learning_rate": 0.00045244290186675034, "loss": 5.8626, "mean_token_accuracy": 0.17862701565027236, "num_tokens": 48293861.0, "step": 19055 }, { "entropy": 6.194202089309693, "epoch": 2.1996537795729947, "grad_norm": 1.0859375, "learning_rate": 0.0004524175270220489, "loss": 5.8946, "mean_token_accuracy": 0.17505065798759462, "num_tokens": 48306062.0, "step": 19060 }, { "entropy": 6.251491737365723, "epoch": 2.2002308136180035, "grad_norm": 1.09375, "learning_rate": 0.00045239214620999683, "loss": 5.9766, "mean_token_accuracy": 0.16668111830949783, "num_tokens": 48318777.0, "step": 19065 }, { "entropy": 6.207370710372925, "epoch": 2.200807847663012, "grad_norm": 1.15625, "learning_rate": 0.0004523667594314481, "loss": 5.9334, "mean_token_accuracy": 0.17182350158691406, "num_tokens": 48330575.0, "step": 19070 }, { "entropy": 6.115412998199463, "epoch": 2.201384881708021, "grad_norm": 1.15625, "learning_rate": 0.00045234136668725655, "loss": 5.7773, "mean_token_accuracy": 0.18870446383953093, "num_tokens": 48343980.0, "step": 19075 }, { "entropy": 6.213305044174194, "epoch": 2.2019619157530292, "grad_norm": 1.0625, "learning_rate": 0.00045231596797827616, "loss": 5.8388, "mean_token_accuracy": 0.1812451496720314, "num_tokens": 48356140.0, "step": 19080 }, { "entropy": 6.174299716949463, "epoch": 2.202538949798038, "grad_norm": 0.97265625, "learning_rate": 0.00045229056330536134, "loss": 5.9042, "mean_token_accuracy": 0.18119534999132156, "num_tokens": 48367756.0, "step": 19085 }, { "entropy": 6.168049669265747, "epoch": 2.2031159838430465, "grad_norm": 1.1328125, "learning_rate": 0.00045226515266936644, "loss": 5.9393, "mean_token_accuracy": 0.16965750306844712, "num_tokens": 48381637.0, "step": 19090 }, { "entropy": 6.230480575561524, "epoch": 2.2036930178880554, "grad_norm": 0.97265625, "learning_rate": 0.0004522397360711462, "loss": 5.8748, "mean_token_accuracy": 0.17553682923316954, "num_tokens": 48394593.0, "step": 19095 }, { "entropy": 6.165048265457154, "epoch": 2.2042700519330642, "grad_norm": 1.1015625, "learning_rate": 0.0004522143135115555, "loss": 5.8574, "mean_token_accuracy": 0.1800720989704132, "num_tokens": 48408555.0, "step": 19100 }, { "entropy": 6.1731829166412355, "epoch": 2.2048470859780727, "grad_norm": 1.0078125, "learning_rate": 0.00045218888499144933, "loss": 5.8946, "mean_token_accuracy": 0.1775633677840233, "num_tokens": 48420359.0, "step": 19105 }, { "entropy": 6.254141187667846, "epoch": 2.2054241200230815, "grad_norm": 0.97265625, "learning_rate": 0.00045216345051168314, "loss": 6.0368, "mean_token_accuracy": 0.16812050044536592, "num_tokens": 48432516.0, "step": 19110 }, { "entropy": 6.192972087860108, "epoch": 2.20600115406809, "grad_norm": 1.03125, "learning_rate": 0.0004521380100731122, "loss": 5.9272, "mean_token_accuracy": 0.17607006281614304, "num_tokens": 48444355.0, "step": 19115 }, { "entropy": 6.170709800720215, "epoch": 2.206578188113099, "grad_norm": 1.140625, "learning_rate": 0.00045211256367659234, "loss": 5.8752, "mean_token_accuracy": 0.18138357400894164, "num_tokens": 48458341.0, "step": 19120 }, { "entropy": 6.17162766456604, "epoch": 2.207155222158107, "grad_norm": 1.1015625, "learning_rate": 0.0004520871113229793, "loss": 5.9257, "mean_token_accuracy": 0.17600769847631453, "num_tokens": 48471473.0, "step": 19125 }, { "entropy": 6.188865756988525, "epoch": 2.207732256203116, "grad_norm": 0.9921875, "learning_rate": 0.00045206165301312927, "loss": 5.9205, "mean_token_accuracy": 0.1756698504090309, "num_tokens": 48483149.0, "step": 19130 }, { "entropy": 6.243536329269409, "epoch": 2.2083092902481245, "grad_norm": 1.25, "learning_rate": 0.0004520361887478985, "loss": 5.9099, "mean_token_accuracy": 0.17231071293354033, "num_tokens": 48495617.0, "step": 19135 }, { "entropy": 6.098401594161987, "epoch": 2.2088863242931334, "grad_norm": 3.1875, "learning_rate": 0.0004520107185281435, "loss": 5.8987, "mean_token_accuracy": 0.17789782136678695, "num_tokens": 48509391.0, "step": 19140 }, { "entropy": 6.089808416366577, "epoch": 2.209463358338142, "grad_norm": 1.2578125, "learning_rate": 0.0004519852423547208, "loss": 5.8373, "mean_token_accuracy": 0.18326293528079987, "num_tokens": 48523127.0, "step": 19145 }, { "entropy": 6.135551261901855, "epoch": 2.2100403923831506, "grad_norm": 2.65625, "learning_rate": 0.0004519597602284875, "loss": 5.8662, "mean_token_accuracy": 0.1830893412232399, "num_tokens": 48536797.0, "step": 19150 }, { "entropy": 6.254802131652832, "epoch": 2.210617426428159, "grad_norm": 1.0546875, "learning_rate": 0.0004519342721503005, "loss": 5.9156, "mean_token_accuracy": 0.1770019993185997, "num_tokens": 48549088.0, "step": 19155 }, { "entropy": 6.185900688171387, "epoch": 2.211194460473168, "grad_norm": 1.0625, "learning_rate": 0.0004519087781210171, "loss": 5.8464, "mean_token_accuracy": 0.1776304841041565, "num_tokens": 48560451.0, "step": 19160 }, { "entropy": 6.117572355270386, "epoch": 2.2117714945181763, "grad_norm": 0.9921875, "learning_rate": 0.000451883278141495, "loss": 5.8671, "mean_token_accuracy": 0.17668378055095674, "num_tokens": 48572870.0, "step": 19165 }, { "entropy": 6.198688268661499, "epoch": 2.212348528563185, "grad_norm": 1.0859375, "learning_rate": 0.00045185777221259157, "loss": 5.9052, "mean_token_accuracy": 0.1720116391777992, "num_tokens": 48585909.0, "step": 19170 }, { "entropy": 6.227552270889282, "epoch": 2.212925562608194, "grad_norm": 1.125, "learning_rate": 0.0004518322603351648, "loss": 5.9127, "mean_token_accuracy": 0.18233373910188674, "num_tokens": 48599157.0, "step": 19175 }, { "entropy": 6.1833775520324705, "epoch": 2.2135025966532025, "grad_norm": 1.5, "learning_rate": 0.00045180674251007287, "loss": 5.8566, "mean_token_accuracy": 0.1842576578259468, "num_tokens": 48611740.0, "step": 19180 }, { "entropy": 6.152484560012818, "epoch": 2.2140796306982113, "grad_norm": 1.0859375, "learning_rate": 0.00045178121873817395, "loss": 5.9721, "mean_token_accuracy": 0.1699468493461609, "num_tokens": 48624893.0, "step": 19185 }, { "entropy": 6.189026546478272, "epoch": 2.2146566647432198, "grad_norm": 1.0546875, "learning_rate": 0.0004517556890203265, "loss": 5.9497, "mean_token_accuracy": 0.16636952012777328, "num_tokens": 48636414.0, "step": 19190 }, { "entropy": 6.176068592071533, "epoch": 2.2152336987882286, "grad_norm": 1.90625, "learning_rate": 0.00045173015335738925, "loss": 5.8886, "mean_token_accuracy": 0.17687400579452514, "num_tokens": 48649936.0, "step": 19195 }, { "entropy": 6.219943332672119, "epoch": 2.215810732833237, "grad_norm": 1.015625, "learning_rate": 0.00045170461175022116, "loss": 5.9104, "mean_token_accuracy": 0.1829262226819992, "num_tokens": 48662857.0, "step": 19200 }, { "entropy": 6.223324632644653, "epoch": 2.216387766878246, "grad_norm": 1.1484375, "learning_rate": 0.0004516790641996812, "loss": 5.8683, "mean_token_accuracy": 0.18157433569431305, "num_tokens": 48675087.0, "step": 19205 }, { "entropy": 6.131745100021362, "epoch": 2.2169648009232543, "grad_norm": 1.609375, "learning_rate": 0.0004516535107066286, "loss": 5.8224, "mean_token_accuracy": 0.1740524262189865, "num_tokens": 48687575.0, "step": 19210 }, { "entropy": 6.168126440048217, "epoch": 2.217541834968263, "grad_norm": 1.0390625, "learning_rate": 0.00045162795127192296, "loss": 5.8762, "mean_token_accuracy": 0.17217035144567489, "num_tokens": 48701115.0, "step": 19215 }, { "entropy": 6.251860284805298, "epoch": 2.2181188690132716, "grad_norm": 1.109375, "learning_rate": 0.000451602385896424, "loss": 6.0011, "mean_token_accuracy": 0.16828219592571259, "num_tokens": 48713738.0, "step": 19220 }, { "entropy": 6.2112242698669435, "epoch": 2.2186959030582805, "grad_norm": 1.203125, "learning_rate": 0.00045157681458099145, "loss": 5.8076, "mean_token_accuracy": 0.18412246257066728, "num_tokens": 48725282.0, "step": 19225 }, { "entropy": 6.170522260665893, "epoch": 2.2192729371032893, "grad_norm": 1.125, "learning_rate": 0.0004515512373264854, "loss": 5.8979, "mean_token_accuracy": 0.17799303233623504, "num_tokens": 48738476.0, "step": 19230 }, { "entropy": 6.189772510528565, "epoch": 2.2198499711482977, "grad_norm": 1.015625, "learning_rate": 0.00045152565413376623, "loss": 5.9089, "mean_token_accuracy": 0.17495458871126174, "num_tokens": 48751447.0, "step": 19235 }, { "entropy": 6.193010902404785, "epoch": 2.2204270051933066, "grad_norm": 1.1953125, "learning_rate": 0.0004515000650036944, "loss": 5.9375, "mean_token_accuracy": 0.17232024669647217, "num_tokens": 48764124.0, "step": 19240 }, { "entropy": 6.22163953781128, "epoch": 2.221004039238315, "grad_norm": 0.96484375, "learning_rate": 0.0004514744699371305, "loss": 5.9958, "mean_token_accuracy": 0.1685050144791603, "num_tokens": 48776414.0, "step": 19245 }, { "entropy": 6.254934215545655, "epoch": 2.221581073283324, "grad_norm": 1.0390625, "learning_rate": 0.00045144886893493547, "loss": 5.9314, "mean_token_accuracy": 0.17561885863542556, "num_tokens": 48789318.0, "step": 19250 }, { "entropy": 6.1196118831634525, "epoch": 2.2221581073283323, "grad_norm": 0.98828125, "learning_rate": 0.00045142326199797047, "loss": 5.8587, "mean_token_accuracy": 0.17800619453191757, "num_tokens": 48801773.0, "step": 19255 }, { "entropy": 6.239759874343872, "epoch": 2.222735141373341, "grad_norm": 1.1484375, "learning_rate": 0.00045139764912709656, "loss": 5.861, "mean_token_accuracy": 0.17993413656949997, "num_tokens": 48814137.0, "step": 19260 }, { "entropy": 6.19697527885437, "epoch": 2.2233121754183496, "grad_norm": 1.0625, "learning_rate": 0.0004513720303231754, "loss": 5.8682, "mean_token_accuracy": 0.17760514318943024, "num_tokens": 48826129.0, "step": 19265 }, { "entropy": 6.195125102996826, "epoch": 2.2238892094633584, "grad_norm": 1.0625, "learning_rate": 0.00045134640558706864, "loss": 5.9495, "mean_token_accuracy": 0.17445218861103057, "num_tokens": 48838930.0, "step": 19270 }, { "entropy": 6.245221185684204, "epoch": 2.224466243508367, "grad_norm": 1.109375, "learning_rate": 0.000451320774919638, "loss": 5.9168, "mean_token_accuracy": 0.17168458849191665, "num_tokens": 48851506.0, "step": 19275 }, { "entropy": 6.202529716491699, "epoch": 2.2250432775533757, "grad_norm": 1.1171875, "learning_rate": 0.00045129513832174587, "loss": 5.8892, "mean_token_accuracy": 0.17213271409273148, "num_tokens": 48865267.0, "step": 19280 }, { "entropy": 6.183564043045044, "epoch": 2.225620311598384, "grad_norm": 1.0078125, "learning_rate": 0.00045126949579425414, "loss": 5.9589, "mean_token_accuracy": 0.17022151350975037, "num_tokens": 48877642.0, "step": 19285 }, { "entropy": 6.328790330886841, "epoch": 2.226197345643393, "grad_norm": 1.046875, "learning_rate": 0.00045124384733802563, "loss": 6.0025, "mean_token_accuracy": 0.1685243621468544, "num_tokens": 48891135.0, "step": 19290 }, { "entropy": 6.246169519424439, "epoch": 2.2267743796884014, "grad_norm": 0.9921875, "learning_rate": 0.0004512181929539228, "loss": 5.9617, "mean_token_accuracy": 0.17567284852266313, "num_tokens": 48904361.0, "step": 19295 }, { "entropy": 6.1482072353363035, "epoch": 2.2273514137334103, "grad_norm": 1.09375, "learning_rate": 0.00045119253264280855, "loss": 5.9456, "mean_token_accuracy": 0.17884223759174347, "num_tokens": 48916497.0, "step": 19300 }, { "entropy": 6.253855752944946, "epoch": 2.227928447778419, "grad_norm": 1.0390625, "learning_rate": 0.00045116686640554607, "loss": 5.9073, "mean_token_accuracy": 0.17755719721317292, "num_tokens": 48928476.0, "step": 19305 }, { "entropy": 6.225940561294555, "epoch": 2.2285054818234276, "grad_norm": 1.4375, "learning_rate": 0.00045114119424299843, "loss": 5.958, "mean_token_accuracy": 0.17427153140306473, "num_tokens": 48942153.0, "step": 19310 }, { "entropy": 6.248000001907348, "epoch": 2.2290825158684364, "grad_norm": 1.15625, "learning_rate": 0.0004511155161560293, "loss": 5.9774, "mean_token_accuracy": 0.17155166268348693, "num_tokens": 48955313.0, "step": 19315 }, { "entropy": 6.198637628555298, "epoch": 2.229659549913445, "grad_norm": 0.9765625, "learning_rate": 0.00045108983214550225, "loss": 5.8672, "mean_token_accuracy": 0.18007466942071915, "num_tokens": 48967875.0, "step": 19320 }, { "entropy": 6.279212284088135, "epoch": 2.2302365839584537, "grad_norm": 1.0, "learning_rate": 0.0004510641422122811, "loss": 5.9204, "mean_token_accuracy": 0.17138898074626924, "num_tokens": 48979534.0, "step": 19325 }, { "entropy": 6.255653953552246, "epoch": 2.230813618003462, "grad_norm": 0.9765625, "learning_rate": 0.00045103844635723005, "loss": 5.9646, "mean_token_accuracy": 0.17417775243520736, "num_tokens": 48991425.0, "step": 19330 }, { "entropy": 6.114951229095459, "epoch": 2.231390652048471, "grad_norm": 1.0234375, "learning_rate": 0.00045101274458121335, "loss": 5.8303, "mean_token_accuracy": 0.18759170174598694, "num_tokens": 49003783.0, "step": 19335 }, { "entropy": 6.261584711074829, "epoch": 2.2319676860934794, "grad_norm": 1.1015625, "learning_rate": 0.00045098703688509537, "loss": 5.9823, "mean_token_accuracy": 0.1674163371324539, "num_tokens": 49017998.0, "step": 19340 }, { "entropy": 6.276994848251343, "epoch": 2.2325447201384883, "grad_norm": 1.0625, "learning_rate": 0.0004509613232697408, "loss": 5.9988, "mean_token_accuracy": 0.167509825527668, "num_tokens": 49030429.0, "step": 19345 }, { "entropy": 6.2080472946167, "epoch": 2.2331217541834967, "grad_norm": 1.0546875, "learning_rate": 0.0004509356037360145, "loss": 5.9082, "mean_token_accuracy": 0.17921029180288314, "num_tokens": 49043619.0, "step": 19350 }, { "entropy": 6.251058197021484, "epoch": 2.2336987882285055, "grad_norm": 1.0078125, "learning_rate": 0.0004509098782847816, "loss": 5.9337, "mean_token_accuracy": 0.17255532145500183, "num_tokens": 49056674.0, "step": 19355 }, { "entropy": 6.231851053237915, "epoch": 2.234275822273514, "grad_norm": 1.09375, "learning_rate": 0.0004508841469169073, "loss": 5.952, "mean_token_accuracy": 0.176688514649868, "num_tokens": 49069616.0, "step": 19360 }, { "entropy": 6.162151050567627, "epoch": 2.234852856318523, "grad_norm": 1.3671875, "learning_rate": 0.00045085840963325716, "loss": 5.902, "mean_token_accuracy": 0.17886948734521865, "num_tokens": 49082001.0, "step": 19365 }, { "entropy": 6.209615707397461, "epoch": 2.2354298903635312, "grad_norm": 1.15625, "learning_rate": 0.0004508326664346967, "loss": 5.8871, "mean_token_accuracy": 0.1740911200642586, "num_tokens": 49094433.0, "step": 19370 }, { "entropy": 6.174746799468994, "epoch": 2.23600692440854, "grad_norm": 1.09375, "learning_rate": 0.00045080691732209176, "loss": 5.8633, "mean_token_accuracy": 0.18208640515804292, "num_tokens": 49106152.0, "step": 19375 }, { "entropy": 6.178849172592163, "epoch": 2.236583958453549, "grad_norm": 1.1171875, "learning_rate": 0.00045078116229630864, "loss": 5.9521, "mean_token_accuracy": 0.18309886753559113, "num_tokens": 49120402.0, "step": 19380 }, { "entropy": 6.317041301727295, "epoch": 2.2371609924985574, "grad_norm": 1.0078125, "learning_rate": 0.00045075540135821343, "loss": 6.0472, "mean_token_accuracy": 0.16531797200441362, "num_tokens": 49133571.0, "step": 19385 }, { "entropy": 6.285482406616211, "epoch": 2.2377380265435662, "grad_norm": 1.09375, "learning_rate": 0.0004507296345086725, "loss": 6.0433, "mean_token_accuracy": 0.16770367175340653, "num_tokens": 49147268.0, "step": 19390 }, { "entropy": 6.216909456253052, "epoch": 2.2383150605885747, "grad_norm": 1.4453125, "learning_rate": 0.0004507038617485526, "loss": 5.8327, "mean_token_accuracy": 0.1768430009484291, "num_tokens": 49159043.0, "step": 19395 }, { "entropy": 6.187124443054199, "epoch": 2.2388920946335835, "grad_norm": 1.1171875, "learning_rate": 0.00045067808307872064, "loss": 5.9344, "mean_token_accuracy": 0.17853873074054719, "num_tokens": 49172164.0, "step": 19400 }, { "entropy": 6.238157081604004, "epoch": 2.239469128678592, "grad_norm": 1.125, "learning_rate": 0.00045065229850004365, "loss": 5.9049, "mean_token_accuracy": 0.1760144054889679, "num_tokens": 49185023.0, "step": 19405 }, { "entropy": 6.2631641864776615, "epoch": 2.240046162723601, "grad_norm": 0.94921875, "learning_rate": 0.0004506265080133888, "loss": 5.9316, "mean_token_accuracy": 0.1767286479473114, "num_tokens": 49198411.0, "step": 19410 }, { "entropy": 6.149572944641113, "epoch": 2.240623196768609, "grad_norm": 0.9453125, "learning_rate": 0.00045060071161962364, "loss": 5.9208, "mean_token_accuracy": 0.17646293342113495, "num_tokens": 49211162.0, "step": 19415 }, { "entropy": 6.227586889266968, "epoch": 2.241200230813618, "grad_norm": 1.25, "learning_rate": 0.0004505749093196158, "loss": 5.9655, "mean_token_accuracy": 0.1740314096212387, "num_tokens": 49223808.0, "step": 19420 }, { "entropy": 6.203909540176392, "epoch": 2.2417772648586265, "grad_norm": 1.2890625, "learning_rate": 0.000450549101114233, "loss": 5.8892, "mean_token_accuracy": 0.1805233746767044, "num_tokens": 49236947.0, "step": 19425 }, { "entropy": 6.23789119720459, "epoch": 2.2423542989036354, "grad_norm": 0.94921875, "learning_rate": 0.0004505232870043434, "loss": 5.9582, "mean_token_accuracy": 0.1749293550848961, "num_tokens": 49249932.0, "step": 19430 }, { "entropy": 6.18991231918335, "epoch": 2.2429313329486438, "grad_norm": 1.0390625, "learning_rate": 0.0004504974669908152, "loss": 5.9493, "mean_token_accuracy": 0.1756827101111412, "num_tokens": 49261783.0, "step": 19435 }, { "entropy": 6.327587842941284, "epoch": 2.2435083669936526, "grad_norm": 1.0859375, "learning_rate": 0.00045047164107451696, "loss": 5.9583, "mean_token_accuracy": 0.17252910435199736, "num_tokens": 49274495.0, "step": 19440 }, { "entropy": 6.2004626274108885, "epoch": 2.244085401038661, "grad_norm": 1.125, "learning_rate": 0.0004504458092563172, "loss": 5.9586, "mean_token_accuracy": 0.17035316228866576, "num_tokens": 49288450.0, "step": 19445 }, { "entropy": 6.239744567871094, "epoch": 2.24466243508367, "grad_norm": 0.99609375, "learning_rate": 0.00045041997153708475, "loss": 5.9496, "mean_token_accuracy": 0.17644737511873246, "num_tokens": 49300612.0, "step": 19450 }, { "entropy": 6.276393747329712, "epoch": 2.2452394691286788, "grad_norm": 0.96875, "learning_rate": 0.00045039412791768877, "loss": 5.9832, "mean_token_accuracy": 0.17354014962911607, "num_tokens": 49313860.0, "step": 19455 }, { "entropy": 6.225166273117066, "epoch": 2.245816503173687, "grad_norm": 1.015625, "learning_rate": 0.00045036827839899833, "loss": 5.9455, "mean_token_accuracy": 0.17199012637138367, "num_tokens": 49326864.0, "step": 19460 }, { "entropy": 6.2819251537323, "epoch": 2.246393537218696, "grad_norm": 1.1328125, "learning_rate": 0.00045034242298188303, "loss": 5.9544, "mean_token_accuracy": 0.1678101897239685, "num_tokens": 49339444.0, "step": 19465 }, { "entropy": 6.12954158782959, "epoch": 2.2469705712637045, "grad_norm": 1.0546875, "learning_rate": 0.0004503165616672124, "loss": 5.8615, "mean_token_accuracy": 0.18276833593845368, "num_tokens": 49352999.0, "step": 19470 }, { "entropy": 6.201620101928711, "epoch": 2.2475476053087133, "grad_norm": 1.0859375, "learning_rate": 0.0004502906944558563, "loss": 5.8898, "mean_token_accuracy": 0.17764174044132233, "num_tokens": 49365600.0, "step": 19475 }, { "entropy": 6.308801078796387, "epoch": 2.2481246393537218, "grad_norm": 1.15625, "learning_rate": 0.0004502648213486848, "loss": 5.9954, "mean_token_accuracy": 0.17161748558282852, "num_tokens": 49378121.0, "step": 19480 }, { "entropy": 6.1782279968261715, "epoch": 2.2487016733987306, "grad_norm": 1.125, "learning_rate": 0.00045023894234656807, "loss": 5.9314, "mean_token_accuracy": 0.17830360680818558, "num_tokens": 49390889.0, "step": 19485 }, { "entropy": 6.2839850902557375, "epoch": 2.249278707443739, "grad_norm": 0.921875, "learning_rate": 0.0004502130574503766, "loss": 5.9815, "mean_token_accuracy": 0.17739966809749602, "num_tokens": 49404613.0, "step": 19490 }, { "entropy": 6.256258344650268, "epoch": 2.249855741488748, "grad_norm": 1.1484375, "learning_rate": 0.0004501871666609809, "loss": 5.9335, "mean_token_accuracy": 0.1765059784054756, "num_tokens": 49416142.0, "step": 19495 }, { "entropy": 6.2220173358917235, "epoch": 2.2504327755337563, "grad_norm": 1.515625, "learning_rate": 0.0004501612699792519, "loss": 5.88, "mean_token_accuracy": 0.16992273181676865, "num_tokens": 49427848.0, "step": 19500 }, { "entropy": 6.331051683425903, "epoch": 2.251009809578765, "grad_norm": 0.96875, "learning_rate": 0.0004501353674060606, "loss": 6.0521, "mean_token_accuracy": 0.16149662882089616, "num_tokens": 49442338.0, "step": 19505 }, { "entropy": 6.24295973777771, "epoch": 2.251586843623774, "grad_norm": 1.09375, "learning_rate": 0.0004501094589422782, "loss": 5.935, "mean_token_accuracy": 0.17748762667179108, "num_tokens": 49455565.0, "step": 19510 }, { "entropy": 6.188134336471558, "epoch": 2.2521638776687825, "grad_norm": 0.9921875, "learning_rate": 0.00045008354458877614, "loss": 5.9141, "mean_token_accuracy": 0.17939674258232116, "num_tokens": 49468894.0, "step": 19515 }, { "entropy": 6.110340213775634, "epoch": 2.252740911713791, "grad_norm": 1.0, "learning_rate": 0.000450057624346426, "loss": 5.7611, "mean_token_accuracy": 0.1934901311993599, "num_tokens": 49480324.0, "step": 19520 }, { "entropy": 6.247253465652466, "epoch": 2.2533179457587997, "grad_norm": 1.0703125, "learning_rate": 0.00045003169821609967, "loss": 5.9207, "mean_token_accuracy": 0.17454594671726226, "num_tokens": 49493823.0, "step": 19525 }, { "entropy": 6.233027696609497, "epoch": 2.2538949798038086, "grad_norm": 1.1328125, "learning_rate": 0.00045000576619866914, "loss": 5.9071, "mean_token_accuracy": 0.17930898070335388, "num_tokens": 49506512.0, "step": 19530 }, { "entropy": 6.1688103675842285, "epoch": 2.254472013848817, "grad_norm": 1.0546875, "learning_rate": 0.00044997982829500657, "loss": 5.9167, "mean_token_accuracy": 0.17058774083852768, "num_tokens": 49518424.0, "step": 19535 }, { "entropy": 6.193355369567871, "epoch": 2.255049047893826, "grad_norm": 1.1953125, "learning_rate": 0.00044995388450598436, "loss": 5.9605, "mean_token_accuracy": 0.17754435241222383, "num_tokens": 49531828.0, "step": 19540 }, { "entropy": 6.238674116134644, "epoch": 2.2556260819388343, "grad_norm": 1.09375, "learning_rate": 0.0004499279348324751, "loss": 5.8964, "mean_token_accuracy": 0.16793029755353928, "num_tokens": 49545502.0, "step": 19545 }, { "entropy": 6.149578189849853, "epoch": 2.256203115983843, "grad_norm": 0.95703125, "learning_rate": 0.00044990197927535173, "loss": 5.8967, "mean_token_accuracy": 0.1788370653986931, "num_tokens": 49557323.0, "step": 19550 }, { "entropy": 6.139378929138184, "epoch": 2.2567801500288516, "grad_norm": 1.859375, "learning_rate": 0.00044987601783548703, "loss": 5.8089, "mean_token_accuracy": 0.18495144098997116, "num_tokens": 49570149.0, "step": 19555 }, { "entropy": 6.199171733856201, "epoch": 2.2573571840738604, "grad_norm": 1.0078125, "learning_rate": 0.0004498500505137545, "loss": 5.8407, "mean_token_accuracy": 0.1889175683259964, "num_tokens": 49581866.0, "step": 19560 }, { "entropy": 6.092684745788574, "epoch": 2.257934218118869, "grad_norm": 1.0234375, "learning_rate": 0.0004498240773110273, "loss": 5.8473, "mean_token_accuracy": 0.18385370969772338, "num_tokens": 49592785.0, "step": 19565 }, { "entropy": 6.244862270355225, "epoch": 2.2585112521638777, "grad_norm": 0.95703125, "learning_rate": 0.0004497980982281791, "loss": 6.0156, "mean_token_accuracy": 0.1703037440776825, "num_tokens": 49604925.0, "step": 19570 }, { "entropy": 6.2518209457397464, "epoch": 2.259088286208886, "grad_norm": 0.96484375, "learning_rate": 0.0004497721132660837, "loss": 5.9509, "mean_token_accuracy": 0.17581710517406463, "num_tokens": 49618548.0, "step": 19575 }, { "entropy": 6.187556648254395, "epoch": 2.259665320253895, "grad_norm": 1.15625, "learning_rate": 0.00044974612242561516, "loss": 5.9415, "mean_token_accuracy": 0.17620837986469268, "num_tokens": 49631968.0, "step": 19580 }, { "entropy": 6.185222244262695, "epoch": 2.260242354298904, "grad_norm": 1.4375, "learning_rate": 0.0004497201257076475, "loss": 5.9315, "mean_token_accuracy": 0.18308930695056916, "num_tokens": 49645269.0, "step": 19585 }, { "entropy": 6.237845849990845, "epoch": 2.2608193883439123, "grad_norm": 1.0234375, "learning_rate": 0.0004496941231130552, "loss": 5.891, "mean_token_accuracy": 0.18141574263572693, "num_tokens": 49655903.0, "step": 19590 }, { "entropy": 6.288414096832275, "epoch": 2.261396422388921, "grad_norm": 1.0703125, "learning_rate": 0.0004496681146427129, "loss": 5.9861, "mean_token_accuracy": 0.16647860109806062, "num_tokens": 49667982.0, "step": 19595 }, { "entropy": 6.214272165298462, "epoch": 2.2619734564339296, "grad_norm": 1.2734375, "learning_rate": 0.00044964210029749523, "loss": 5.8577, "mean_token_accuracy": 0.1796637073159218, "num_tokens": 49681441.0, "step": 19600 }, { "entropy": 6.1274974822998045, "epoch": 2.2625504904789384, "grad_norm": 1.15625, "learning_rate": 0.00044961608007827736, "loss": 5.8507, "mean_token_accuracy": 0.18508483171463014, "num_tokens": 49695805.0, "step": 19605 }, { "entropy": 6.187057113647461, "epoch": 2.263127524523947, "grad_norm": 1.0390625, "learning_rate": 0.0004495900539859344, "loss": 5.973, "mean_token_accuracy": 0.17697968930006028, "num_tokens": 49708762.0, "step": 19610 }, { "entropy": 6.27952127456665, "epoch": 2.2637045585689557, "grad_norm": 1.078125, "learning_rate": 0.00044956402202134157, "loss": 5.9378, "mean_token_accuracy": 0.18088844120502473, "num_tokens": 49724570.0, "step": 19615 }, { "entropy": 6.275792503356934, "epoch": 2.264281592613964, "grad_norm": 0.94140625, "learning_rate": 0.00044953798418537465, "loss": 5.94, "mean_token_accuracy": 0.17699608206748962, "num_tokens": 49736060.0, "step": 19620 }, { "entropy": 6.193467664718628, "epoch": 2.264858626658973, "grad_norm": 0.95703125, "learning_rate": 0.0004495119404789093, "loss": 5.9197, "mean_token_accuracy": 0.17421784102916718, "num_tokens": 49748520.0, "step": 19625 }, { "entropy": 6.23006501197815, "epoch": 2.2654356607039814, "grad_norm": 1.0703125, "learning_rate": 0.0004494858909028216, "loss": 5.9784, "mean_token_accuracy": 0.16674500256776809, "num_tokens": 49761097.0, "step": 19630 }, { "entropy": 6.214932680130005, "epoch": 2.2660126947489903, "grad_norm": 1.03125, "learning_rate": 0.0004494598354579875, "loss": 5.8704, "mean_token_accuracy": 0.18461449444293976, "num_tokens": 49773430.0, "step": 19635 }, { "entropy": 6.187216472625733, "epoch": 2.2665897287939987, "grad_norm": 1.078125, "learning_rate": 0.0004494337741452836, "loss": 5.9325, "mean_token_accuracy": 0.17151115089654922, "num_tokens": 49785525.0, "step": 19640 }, { "entropy": 6.178369617462158, "epoch": 2.2671667628390075, "grad_norm": 1.03125, "learning_rate": 0.0004494077069655863, "loss": 5.9369, "mean_token_accuracy": 0.1749401494860649, "num_tokens": 49796650.0, "step": 19645 }, { "entropy": 6.2306800365448, "epoch": 2.267743796884016, "grad_norm": 1.03125, "learning_rate": 0.0004493816339197724, "loss": 5.9266, "mean_token_accuracy": 0.1802807092666626, "num_tokens": 49808191.0, "step": 19650 }, { "entropy": 6.1881694316864015, "epoch": 2.268320830929025, "grad_norm": 1.0859375, "learning_rate": 0.00044935555500871897, "loss": 5.9515, "mean_token_accuracy": 0.17349853515625, "num_tokens": 49820051.0, "step": 19655 }, { "entropy": 6.264400243759155, "epoch": 2.2688978649740337, "grad_norm": 0.99609375, "learning_rate": 0.000449329470233303, "loss": 5.9709, "mean_token_accuracy": 0.17374078631401063, "num_tokens": 49835392.0, "step": 19660 }, { "entropy": 6.1371400356292725, "epoch": 2.269474899019042, "grad_norm": 1.140625, "learning_rate": 0.00044930337959440183, "loss": 5.9025, "mean_token_accuracy": 0.17800106406211852, "num_tokens": 49847344.0, "step": 19665 }, { "entropy": 6.221584177017212, "epoch": 2.270051933064051, "grad_norm": 1.390625, "learning_rate": 0.0004492772830928931, "loss": 5.95, "mean_token_accuracy": 0.16992736905813216, "num_tokens": 49859741.0, "step": 19670 }, { "entropy": 6.215978479385376, "epoch": 2.2706289671090594, "grad_norm": 0.98046875, "learning_rate": 0.00044925118072965456, "loss": 5.9152, "mean_token_accuracy": 0.1744893655180931, "num_tokens": 49871565.0, "step": 19675 }, { "entropy": 6.168155670166016, "epoch": 2.2712060011540682, "grad_norm": 1.1484375, "learning_rate": 0.000449225072505564, "loss": 5.882, "mean_token_accuracy": 0.1758724957704544, "num_tokens": 49883405.0, "step": 19680 }, { "entropy": 6.248301076889038, "epoch": 2.2717830351990767, "grad_norm": 0.98828125, "learning_rate": 0.00044919895842149976, "loss": 5.9506, "mean_token_accuracy": 0.17669990807771682, "num_tokens": 49895924.0, "step": 19685 }, { "entropy": 6.1905598640441895, "epoch": 2.2723600692440855, "grad_norm": 1.1328125, "learning_rate": 0.00044917283847834005, "loss": 5.8828, "mean_token_accuracy": 0.17163273692131042, "num_tokens": 49908506.0, "step": 19690 }, { "entropy": 6.2119269371032715, "epoch": 2.272937103289094, "grad_norm": 1.0234375, "learning_rate": 0.0004491467126769635, "loss": 5.9188, "mean_token_accuracy": 0.17607008367776872, "num_tokens": 49919917.0, "step": 19695 }, { "entropy": 6.207222509384155, "epoch": 2.273514137334103, "grad_norm": 1.015625, "learning_rate": 0.00044912058101824866, "loss": 5.904, "mean_token_accuracy": 0.1741974800825119, "num_tokens": 49932508.0, "step": 19700 }, { "entropy": 6.191767454147339, "epoch": 2.274091171379111, "grad_norm": 0.9921875, "learning_rate": 0.00044909444350307463, "loss": 5.9344, "mean_token_accuracy": 0.1761745110154152, "num_tokens": 49945065.0, "step": 19705 }, { "entropy": 6.172743940353394, "epoch": 2.27466820542412, "grad_norm": 1.015625, "learning_rate": 0.0004490683001323205, "loss": 5.8509, "mean_token_accuracy": 0.17929312735795974, "num_tokens": 49957530.0, "step": 19710 }, { "entropy": 6.146152830123901, "epoch": 2.2752452394691285, "grad_norm": 1.3125, "learning_rate": 0.00044904215090686554, "loss": 5.8801, "mean_token_accuracy": 0.17303403168916703, "num_tokens": 49969760.0, "step": 19715 }, { "entropy": 6.258595895767212, "epoch": 2.2758222735141374, "grad_norm": 1.234375, "learning_rate": 0.00044901599582758926, "loss": 5.9564, "mean_token_accuracy": 0.1772393137216568, "num_tokens": 49983151.0, "step": 19720 }, { "entropy": 6.181928110122681, "epoch": 2.2763993075591458, "grad_norm": 1.09375, "learning_rate": 0.00044898983489537143, "loss": 5.8337, "mean_token_accuracy": 0.1764400839805603, "num_tokens": 49995262.0, "step": 19725 }, { "entropy": 6.208969163894653, "epoch": 2.2769763416041546, "grad_norm": 1.3828125, "learning_rate": 0.000448963668111092, "loss": 5.8993, "mean_token_accuracy": 0.17962197512388228, "num_tokens": 50007153.0, "step": 19730 }, { "entropy": 6.162887144088745, "epoch": 2.2775533756491635, "grad_norm": 1.5703125, "learning_rate": 0.00044893749547563085, "loss": 5.9366, "mean_token_accuracy": 0.17497817277908326, "num_tokens": 50020145.0, "step": 19735 }, { "entropy": 6.155488443374634, "epoch": 2.278130409694172, "grad_norm": 1.109375, "learning_rate": 0.00044891131698986846, "loss": 5.9078, "mean_token_accuracy": 0.17562464624643326, "num_tokens": 50032741.0, "step": 19740 }, { "entropy": 6.162566900253296, "epoch": 2.2787074437391808, "grad_norm": 1.3203125, "learning_rate": 0.0004488851326546854, "loss": 5.9427, "mean_token_accuracy": 0.17191180139780043, "num_tokens": 50046112.0, "step": 19745 }, { "entropy": 6.242087411880493, "epoch": 2.279284477784189, "grad_norm": 1.078125, "learning_rate": 0.0004488589424709622, "loss": 5.8989, "mean_token_accuracy": 0.18044222593307496, "num_tokens": 50058718.0, "step": 19750 }, { "entropy": 6.147966098785401, "epoch": 2.279861511829198, "grad_norm": 1.0625, "learning_rate": 0.0004488327464395799, "loss": 5.8655, "mean_token_accuracy": 0.17074532955884933, "num_tokens": 50071759.0, "step": 19755 }, { "entropy": 6.244132232666016, "epoch": 2.2804385458742065, "grad_norm": 1.046875, "learning_rate": 0.0004488065445614195, "loss": 5.9034, "mean_token_accuracy": 0.17695511877536774, "num_tokens": 50083948.0, "step": 19760 }, { "entropy": 6.20736174583435, "epoch": 2.2810155799192153, "grad_norm": 1.109375, "learning_rate": 0.0004487803368373623, "loss": 5.9119, "mean_token_accuracy": 0.17644120901823043, "num_tokens": 50097310.0, "step": 19765 }, { "entropy": 6.1846113204956055, "epoch": 2.2815926139642237, "grad_norm": 1.0390625, "learning_rate": 0.0004487541232682898, "loss": 5.9435, "mean_token_accuracy": 0.17838864773511887, "num_tokens": 50109939.0, "step": 19770 }, { "entropy": 6.266738367080689, "epoch": 2.2821696480092326, "grad_norm": 1.1328125, "learning_rate": 0.0004487279038550836, "loss": 5.9815, "mean_token_accuracy": 0.1711701899766922, "num_tokens": 50120651.0, "step": 19775 }, { "entropy": 6.2213959217071535, "epoch": 2.282746682054241, "grad_norm": 0.99609375, "learning_rate": 0.0004487016785986258, "loss": 5.9244, "mean_token_accuracy": 0.17605694830417634, "num_tokens": 50133180.0, "step": 19780 }, { "entropy": 6.146054744720459, "epoch": 2.28332371609925, "grad_norm": 1.0703125, "learning_rate": 0.00044867544749979817, "loss": 5.902, "mean_token_accuracy": 0.1776263177394867, "num_tokens": 50144808.0, "step": 19785 }, { "entropy": 6.176597976684571, "epoch": 2.2839007501442588, "grad_norm": 0.95703125, "learning_rate": 0.00044864921055948317, "loss": 5.8998, "mean_token_accuracy": 0.17587872147560119, "num_tokens": 50157487.0, "step": 19790 }, { "entropy": 6.259101152420044, "epoch": 2.284477784189267, "grad_norm": 1.0703125, "learning_rate": 0.00044862296777856326, "loss": 5.9708, "mean_token_accuracy": 0.16480046957731248, "num_tokens": 50171837.0, "step": 19795 }, { "entropy": 6.228283309936524, "epoch": 2.2850548182342756, "grad_norm": 1.0859375, "learning_rate": 0.0004485967191579211, "loss": 5.8797, "mean_token_accuracy": 0.18508685678243636, "num_tokens": 50184802.0, "step": 19800 }, { "entropy": 6.209461212158203, "epoch": 2.2856318522792844, "grad_norm": 1.078125, "learning_rate": 0.0004485704646984394, "loss": 5.8914, "mean_token_accuracy": 0.17526766955852507, "num_tokens": 50196433.0, "step": 19805 }, { "entropy": 6.1189063549041744, "epoch": 2.2862088863242933, "grad_norm": 1.0234375, "learning_rate": 0.0004485442044010015, "loss": 5.835, "mean_token_accuracy": 0.19224470853805542, "num_tokens": 50209549.0, "step": 19810 }, { "entropy": 6.224236059188843, "epoch": 2.2867859203693017, "grad_norm": 0.9765625, "learning_rate": 0.0004485179382664904, "loss": 5.9863, "mean_token_accuracy": 0.17298453003168107, "num_tokens": 50220691.0, "step": 19815 }, { "entropy": 6.336439943313598, "epoch": 2.2873629544143106, "grad_norm": 1.1953125, "learning_rate": 0.0004484916662957896, "loss": 6.0277, "mean_token_accuracy": 0.1718783736228943, "num_tokens": 50233003.0, "step": 19820 }, { "entropy": 6.160794115066528, "epoch": 2.287939988459319, "grad_norm": 1.0078125, "learning_rate": 0.0004484653884897829, "loss": 5.8572, "mean_token_accuracy": 0.18045479953289031, "num_tokens": 50244742.0, "step": 19825 }, { "entropy": 6.094951963424682, "epoch": 2.288517022504328, "grad_norm": 1.4296875, "learning_rate": 0.00044843910484935394, "loss": 5.8215, "mean_token_accuracy": 0.18447613716125488, "num_tokens": 50258188.0, "step": 19830 }, { "entropy": 6.253140926361084, "epoch": 2.2890940565493363, "grad_norm": 1.0546875, "learning_rate": 0.0004484128153753868, "loss": 5.9649, "mean_token_accuracy": 0.17857753336429597, "num_tokens": 50271155.0, "step": 19835 }, { "entropy": 6.259934520721435, "epoch": 2.289671090594345, "grad_norm": 0.96875, "learning_rate": 0.00044838652006876583, "loss": 5.9484, "mean_token_accuracy": 0.1786944955587387, "num_tokens": 50283518.0, "step": 19840 }, { "entropy": 6.135973882675171, "epoch": 2.2902481246393536, "grad_norm": 1.046875, "learning_rate": 0.00044836021893037537, "loss": 5.8368, "mean_token_accuracy": 0.18843693882226945, "num_tokens": 50296208.0, "step": 19845 }, { "entropy": 6.154265737533569, "epoch": 2.2908251586843624, "grad_norm": 1.03125, "learning_rate": 0.0004483339119611001, "loss": 5.8718, "mean_token_accuracy": 0.1847282886505127, "num_tokens": 50309111.0, "step": 19850 }, { "entropy": 6.208286762237549, "epoch": 2.291402192729371, "grad_norm": 1.0625, "learning_rate": 0.00044830759916182476, "loss": 5.9524, "mean_token_accuracy": 0.1728263944387436, "num_tokens": 50321895.0, "step": 19855 }, { "entropy": 6.20464072227478, "epoch": 2.2919792267743797, "grad_norm": 1.9921875, "learning_rate": 0.0004482812805334344, "loss": 5.9917, "mean_token_accuracy": 0.16743112802505494, "num_tokens": 50335769.0, "step": 19860 }, { "entropy": 6.26806149482727, "epoch": 2.2925562608193886, "grad_norm": 1.6875, "learning_rate": 0.0004482549560768142, "loss": 5.9187, "mean_token_accuracy": 0.17352110594511033, "num_tokens": 50348576.0, "step": 19865 }, { "entropy": 6.221711444854736, "epoch": 2.293133294864397, "grad_norm": 1.0859375, "learning_rate": 0.0004482286257928497, "loss": 5.926, "mean_token_accuracy": 0.17436802685260772, "num_tokens": 50360652.0, "step": 19870 }, { "entropy": 6.177728652954102, "epoch": 2.293710328909406, "grad_norm": 1.0234375, "learning_rate": 0.0004482022896824263, "loss": 5.9429, "mean_token_accuracy": 0.17300977408885956, "num_tokens": 50373256.0, "step": 19875 }, { "entropy": 6.2224808692932125, "epoch": 2.2942873629544143, "grad_norm": 1.078125, "learning_rate": 0.00044817594774643004, "loss": 5.8255, "mean_token_accuracy": 0.18255933970212937, "num_tokens": 50385245.0, "step": 19880 }, { "entropy": 6.191463851928711, "epoch": 2.294864396999423, "grad_norm": 1.0546875, "learning_rate": 0.00044814959998574675, "loss": 5.9129, "mean_token_accuracy": 0.17643292397260665, "num_tokens": 50397276.0, "step": 19885 }, { "entropy": 6.273288202285767, "epoch": 2.2954414310444315, "grad_norm": 1.0546875, "learning_rate": 0.00044812324640126265, "loss": 6.0222, "mean_token_accuracy": 0.17482039630413054, "num_tokens": 50409725.0, "step": 19890 }, { "entropy": 6.262744665145874, "epoch": 2.2960184650894404, "grad_norm": 1.1796875, "learning_rate": 0.0004480968869938642, "loss": 5.9305, "mean_token_accuracy": 0.17356754541397096, "num_tokens": 50421987.0, "step": 19895 }, { "entropy": 6.1676928997039795, "epoch": 2.296595499134449, "grad_norm": 1.1953125, "learning_rate": 0.00044807052176443793, "loss": 5.9042, "mean_token_accuracy": 0.1803156927227974, "num_tokens": 50436153.0, "step": 19900 }, { "entropy": 6.124884366989136, "epoch": 2.2971725331794577, "grad_norm": 1.03125, "learning_rate": 0.00044804415071387067, "loss": 5.9951, "mean_token_accuracy": 0.17772471457719802, "num_tokens": 50449683.0, "step": 19905 }, { "entropy": 6.200593662261963, "epoch": 2.297749567224466, "grad_norm": 1.234375, "learning_rate": 0.0004480177738430492, "loss": 5.7895, "mean_token_accuracy": 0.18063700795173646, "num_tokens": 50461535.0, "step": 19910 }, { "entropy": 6.235341739654541, "epoch": 2.298326601269475, "grad_norm": 1.1640625, "learning_rate": 0.00044799139115286104, "loss": 5.9209, "mean_token_accuracy": 0.17471311539411544, "num_tokens": 50476094.0, "step": 19915 }, { "entropy": 6.181540203094483, "epoch": 2.2989036353144834, "grad_norm": 0.97265625, "learning_rate": 0.0004479650026441933, "loss": 5.8874, "mean_token_accuracy": 0.1754192292690277, "num_tokens": 50488751.0, "step": 19920 }, { "entropy": 6.220038938522339, "epoch": 2.2994806693594922, "grad_norm": 1.53125, "learning_rate": 0.00044793860831793356, "loss": 5.9475, "mean_token_accuracy": 0.17229341864585876, "num_tokens": 50502272.0, "step": 19925 }, { "entropy": 6.246703433990478, "epoch": 2.3000577034045007, "grad_norm": 1.0234375, "learning_rate": 0.00044791220817496963, "loss": 5.9187, "mean_token_accuracy": 0.17167287766933442, "num_tokens": 50514792.0, "step": 19930 }, { "entropy": 6.15828309059143, "epoch": 2.3006347374495095, "grad_norm": 1.0390625, "learning_rate": 0.0004478858022161895, "loss": 5.8417, "mean_token_accuracy": 0.18575220704078674, "num_tokens": 50528484.0, "step": 19935 }, { "entropy": 6.285755968093872, "epoch": 2.3012117714945184, "grad_norm": 0.99609375, "learning_rate": 0.0004478593904424813, "loss": 5.9919, "mean_token_accuracy": 0.17144529074430465, "num_tokens": 50540737.0, "step": 19940 }, { "entropy": 6.213376903533936, "epoch": 2.301788805539527, "grad_norm": 0.96484375, "learning_rate": 0.0004478329728547334, "loss": 5.9239, "mean_token_accuracy": 0.17930820733308792, "num_tokens": 50553819.0, "step": 19945 }, { "entropy": 6.238288450241089, "epoch": 2.3023658395845357, "grad_norm": 1.0, "learning_rate": 0.00044780654945383424, "loss": 5.953, "mean_token_accuracy": 0.1771923080086708, "num_tokens": 50566275.0, "step": 19950 }, { "entropy": 6.238650465011597, "epoch": 2.302942873629544, "grad_norm": 1.0625, "learning_rate": 0.00044778012024067267, "loss": 5.8737, "mean_token_accuracy": 0.18007982820272445, "num_tokens": 50577653.0, "step": 19955 }, { "entropy": 6.233930253982544, "epoch": 2.303519907674553, "grad_norm": 0.9609375, "learning_rate": 0.0004477536852161376, "loss": 5.9626, "mean_token_accuracy": 0.1656869351863861, "num_tokens": 50590237.0, "step": 19960 }, { "entropy": 6.168978595733643, "epoch": 2.3040969417195614, "grad_norm": 1.3515625, "learning_rate": 0.0004477272443811181, "loss": 5.8562, "mean_token_accuracy": 0.1712908536195755, "num_tokens": 50602333.0, "step": 19965 }, { "entropy": 6.262486791610717, "epoch": 2.3046739757645702, "grad_norm": 1.0, "learning_rate": 0.0004477007977365035, "loss": 5.9618, "mean_token_accuracy": 0.1690537542104721, "num_tokens": 50614232.0, "step": 19970 }, { "entropy": 6.247935342788696, "epoch": 2.3052510098095786, "grad_norm": 1.03125, "learning_rate": 0.0004476743452831834, "loss": 5.9541, "mean_token_accuracy": 0.17183466255664825, "num_tokens": 50627959.0, "step": 19975 }, { "entropy": 6.169540357589722, "epoch": 2.3058280438545875, "grad_norm": 1.1328125, "learning_rate": 0.00044764788702204747, "loss": 5.8152, "mean_token_accuracy": 0.1843651071190834, "num_tokens": 50639962.0, "step": 19980 }, { "entropy": 6.214004039764404, "epoch": 2.306405077899596, "grad_norm": 0.96484375, "learning_rate": 0.0004476214229539856, "loss": 5.9304, "mean_token_accuracy": 0.17756774574518203, "num_tokens": 50652291.0, "step": 19985 }, { "entropy": 6.233112430572509, "epoch": 2.306982111944605, "grad_norm": 1.09375, "learning_rate": 0.0004475949530798879, "loss": 5.9011, "mean_token_accuracy": 0.17774045169353486, "num_tokens": 50664993.0, "step": 19990 }, { "entropy": 6.14248218536377, "epoch": 2.307559145989613, "grad_norm": 1.1796875, "learning_rate": 0.00044756847740064475, "loss": 5.7793, "mean_token_accuracy": 0.17513145357370377, "num_tokens": 50677846.0, "step": 19995 }, { "entropy": 6.143243598937988, "epoch": 2.308136180034622, "grad_norm": 0.98828125, "learning_rate": 0.0004475419959171465, "loss": 5.8587, "mean_token_accuracy": 0.18726265281438828, "num_tokens": 50691068.0, "step": 20000 }, { "entropy": 6.171260356903076, "epoch": 2.3087132140796305, "grad_norm": 1.0, "learning_rate": 0.000447515508630284, "loss": 5.931, "mean_token_accuracy": 0.177291938662529, "num_tokens": 50703663.0, "step": 20005 }, { "entropy": 6.2965131282806395, "epoch": 2.3092902481246393, "grad_norm": 1.0703125, "learning_rate": 0.00044748901554094806, "loss": 5.9033, "mean_token_accuracy": 0.1819427266716957, "num_tokens": 50715709.0, "step": 20010 }, { "entropy": 6.198210048675537, "epoch": 2.309867282169648, "grad_norm": 1.0546875, "learning_rate": 0.0004474625166500297, "loss": 5.8687, "mean_token_accuracy": 0.18542738258838654, "num_tokens": 50727700.0, "step": 20015 }, { "entropy": 6.208634757995606, "epoch": 2.3104443162146566, "grad_norm": 1.0546875, "learning_rate": 0.00044743601195842026, "loss": 5.9009, "mean_token_accuracy": 0.17990079522132874, "num_tokens": 50740604.0, "step": 20020 }, { "entropy": 6.277386045455932, "epoch": 2.3110213502596655, "grad_norm": 1.0234375, "learning_rate": 0.00044740950146701127, "loss": 5.9924, "mean_token_accuracy": 0.17152770310640336, "num_tokens": 50753666.0, "step": 20025 }, { "entropy": 6.195950126647949, "epoch": 2.311598384304674, "grad_norm": 1.078125, "learning_rate": 0.0004473829851766943, "loss": 5.9452, "mean_token_accuracy": 0.17860945016145707, "num_tokens": 50766324.0, "step": 20030 }, { "entropy": 6.265624618530273, "epoch": 2.3121754183496828, "grad_norm": 1.0390625, "learning_rate": 0.0004473564630883612, "loss": 5.9371, "mean_token_accuracy": 0.17894651144742965, "num_tokens": 50779037.0, "step": 20035 }, { "entropy": 6.181953954696655, "epoch": 2.312752452394691, "grad_norm": 0.97265625, "learning_rate": 0.0004473299352029042, "loss": 5.8668, "mean_token_accuracy": 0.18175242394208907, "num_tokens": 50791089.0, "step": 20040 }, { "entropy": 6.1564857959747314, "epoch": 2.3133294864397, "grad_norm": 0.9296875, "learning_rate": 0.0004473034015212154, "loss": 5.8547, "mean_token_accuracy": 0.1750751867890358, "num_tokens": 50803608.0, "step": 20045 }, { "entropy": 6.173952054977417, "epoch": 2.3139065204847085, "grad_norm": 1.546875, "learning_rate": 0.0004472768620441872, "loss": 5.909, "mean_token_accuracy": 0.17483999580144882, "num_tokens": 50815712.0, "step": 20050 }, { "entropy": 6.243170690536499, "epoch": 2.3144835545297173, "grad_norm": 1.0703125, "learning_rate": 0.00044725031677271234, "loss": 5.8446, "mean_token_accuracy": 0.18447517454624177, "num_tokens": 50827409.0, "step": 20055 }, { "entropy": 6.165426301956177, "epoch": 2.3150605885747257, "grad_norm": 1.5625, "learning_rate": 0.0004472237657076837, "loss": 5.8925, "mean_token_accuracy": 0.17439614236354828, "num_tokens": 50840901.0, "step": 20060 }, { "entropy": 6.258820390701294, "epoch": 2.3156376226197346, "grad_norm": 1.1328125, "learning_rate": 0.0004471972088499942, "loss": 5.9661, "mean_token_accuracy": 0.17297065407037734, "num_tokens": 50854453.0, "step": 20065 }, { "entropy": 6.269705677032471, "epoch": 2.3162146566647435, "grad_norm": 0.98046875, "learning_rate": 0.0004471706462005371, "loss": 5.8945, "mean_token_accuracy": 0.1765055999159813, "num_tokens": 50866566.0, "step": 20070 }, { "entropy": 6.137576532363892, "epoch": 2.316791690709752, "grad_norm": 1.5234375, "learning_rate": 0.0004471440777602059, "loss": 5.9051, "mean_token_accuracy": 0.17659924328327178, "num_tokens": 50879695.0, "step": 20075 }, { "entropy": 6.127049732208252, "epoch": 2.3173687247547603, "grad_norm": 1.609375, "learning_rate": 0.00044711750352989407, "loss": 5.843, "mean_token_accuracy": 0.17433359920978547, "num_tokens": 50892350.0, "step": 20080 }, { "entropy": 6.255441665649414, "epoch": 2.317945758799769, "grad_norm": 1.0, "learning_rate": 0.0004470909235104956, "loss": 5.9548, "mean_token_accuracy": 0.17594036012887954, "num_tokens": 50905899.0, "step": 20085 }, { "entropy": 6.242904472351074, "epoch": 2.318522792844778, "grad_norm": 1.109375, "learning_rate": 0.0004470643377029043, "loss": 5.8895, "mean_token_accuracy": 0.18192937225103378, "num_tokens": 50919698.0, "step": 20090 }, { "entropy": 6.236587238311768, "epoch": 2.3190998268897864, "grad_norm": 0.9921875, "learning_rate": 0.0004470377461080145, "loss": 5.9695, "mean_token_accuracy": 0.17987661361694335, "num_tokens": 50932236.0, "step": 20095 }, { "entropy": 6.238249254226685, "epoch": 2.3196768609347953, "grad_norm": 0.9296875, "learning_rate": 0.0004470111487267206, "loss": 5.9123, "mean_token_accuracy": 0.1801683187484741, "num_tokens": 50945403.0, "step": 20100 }, { "entropy": 6.208332920074463, "epoch": 2.3202538949798037, "grad_norm": 1.03125, "learning_rate": 0.0004469845455599171, "loss": 5.9185, "mean_token_accuracy": 0.1714116394519806, "num_tokens": 50958854.0, "step": 20105 }, { "entropy": 6.259473562240601, "epoch": 2.3208309290248126, "grad_norm": 1.1640625, "learning_rate": 0.0004469579366084989, "loss": 5.9694, "mean_token_accuracy": 0.17025109976530076, "num_tokens": 50971545.0, "step": 20110 }, { "entropy": 6.2504490375518795, "epoch": 2.321407963069821, "grad_norm": 0.9609375, "learning_rate": 0.00044693132187336094, "loss": 6.0001, "mean_token_accuracy": 0.17513484954833985, "num_tokens": 50985282.0, "step": 20115 }, { "entropy": 6.165658330917358, "epoch": 2.32198499711483, "grad_norm": 1.2890625, "learning_rate": 0.0004469047013553983, "loss": 5.8862, "mean_token_accuracy": 0.17963058054447173, "num_tokens": 50998063.0, "step": 20120 }, { "entropy": 6.177840852737427, "epoch": 2.3225620311598383, "grad_norm": 0.92578125, "learning_rate": 0.00044687807505550646, "loss": 5.9096, "mean_token_accuracy": 0.18144043385982514, "num_tokens": 51011413.0, "step": 20125 }, { "entropy": 6.221637010574341, "epoch": 2.323139065204847, "grad_norm": 1.0625, "learning_rate": 0.00044685144297458096, "loss": 5.8834, "mean_token_accuracy": 0.18326039761304855, "num_tokens": 51023861.0, "step": 20130 }, { "entropy": 6.232079792022705, "epoch": 2.3237160992498556, "grad_norm": 1.21875, "learning_rate": 0.00044682480511351754, "loss": 5.875, "mean_token_accuracy": 0.18111318051815034, "num_tokens": 51035891.0, "step": 20135 }, { "entropy": 6.149922037124634, "epoch": 2.3242931332948644, "grad_norm": 0.97265625, "learning_rate": 0.0004467981614732121, "loss": 5.8481, "mean_token_accuracy": 0.18590421825647355, "num_tokens": 51048115.0, "step": 20140 }, { "entropy": 6.196219253540039, "epoch": 2.3248701673398733, "grad_norm": 0.9921875, "learning_rate": 0.00044677151205456086, "loss": 5.9211, "mean_token_accuracy": 0.17520425617694854, "num_tokens": 51061503.0, "step": 20145 }, { "entropy": 6.238576412200928, "epoch": 2.3254472013848817, "grad_norm": 2.296875, "learning_rate": 0.0004467448568584601, "loss": 5.9289, "mean_token_accuracy": 0.17929600328207015, "num_tokens": 51074052.0, "step": 20150 }, { "entropy": 6.236129093170166, "epoch": 2.32602423542989, "grad_norm": 0.9921875, "learning_rate": 0.0004467181958858064, "loss": 5.9597, "mean_token_accuracy": 0.18050430119037628, "num_tokens": 51089456.0, "step": 20155 }, { "entropy": 6.247223806381226, "epoch": 2.326601269474899, "grad_norm": 1.3125, "learning_rate": 0.0004466915291374965, "loss": 5.9676, "mean_token_accuracy": 0.16788686513900758, "num_tokens": 51102835.0, "step": 20160 }, { "entropy": 6.2244714260101315, "epoch": 2.327178303519908, "grad_norm": 1.0078125, "learning_rate": 0.0004466648566144273, "loss": 5.9395, "mean_token_accuracy": 0.1768688216805458, "num_tokens": 51115472.0, "step": 20165 }, { "entropy": 6.2383575439453125, "epoch": 2.3277553375649163, "grad_norm": 1.28125, "learning_rate": 0.000446638178317496, "loss": 5.9246, "mean_token_accuracy": 0.1741773083806038, "num_tokens": 51129768.0, "step": 20170 }, { "entropy": 6.202746438980102, "epoch": 2.328332371609925, "grad_norm": 1.1796875, "learning_rate": 0.00044661149424759974, "loss": 5.8963, "mean_token_accuracy": 0.17682316452264785, "num_tokens": 51143517.0, "step": 20175 }, { "entropy": 6.201585912704468, "epoch": 2.3289094056549335, "grad_norm": 1.578125, "learning_rate": 0.0004465848044056361, "loss": 5.784, "mean_token_accuracy": 0.18313243687152864, "num_tokens": 51157235.0, "step": 20180 }, { "entropy": 6.241024971008301, "epoch": 2.3294864396999424, "grad_norm": 0.90234375, "learning_rate": 0.0004465581087925028, "loss": 5.9012, "mean_token_accuracy": 0.17613800168037413, "num_tokens": 51169061.0, "step": 20185 }, { "entropy": 6.1859945297241214, "epoch": 2.330063473744951, "grad_norm": 1.1640625, "learning_rate": 0.0004465314074090978, "loss": 5.9147, "mean_token_accuracy": 0.17369749397039413, "num_tokens": 51181063.0, "step": 20190 }, { "entropy": 6.255963897705078, "epoch": 2.3306405077899597, "grad_norm": 1.0, "learning_rate": 0.00044650470025631904, "loss": 5.8258, "mean_token_accuracy": 0.18363078087568283, "num_tokens": 51193536.0, "step": 20195 }, { "entropy": 6.172869110107422, "epoch": 2.331217541834968, "grad_norm": 1.1953125, "learning_rate": 0.0004464779873350649, "loss": 5.8457, "mean_token_accuracy": 0.18686456829309464, "num_tokens": 51205960.0, "step": 20200 }, { "entropy": 6.235818147659302, "epoch": 2.331794575879977, "grad_norm": 0.984375, "learning_rate": 0.0004464512686462339, "loss": 6.0352, "mean_token_accuracy": 0.17198680937290192, "num_tokens": 51219227.0, "step": 20205 }, { "entropy": 6.26986722946167, "epoch": 2.3323716099249854, "grad_norm": 0.95703125, "learning_rate": 0.00044642454419072455, "loss": 5.8917, "mean_token_accuracy": 0.17737701833248137, "num_tokens": 51232781.0, "step": 20210 }, { "entropy": 6.1620416164398195, "epoch": 2.3329486439699942, "grad_norm": 0.9765625, "learning_rate": 0.0004463978139694358, "loss": 5.8911, "mean_token_accuracy": 0.18242465257644652, "num_tokens": 51245574.0, "step": 20215 }, { "entropy": 6.181765127182007, "epoch": 2.333525678015003, "grad_norm": 0.9921875, "learning_rate": 0.00044637107798326675, "loss": 5.9094, "mean_token_accuracy": 0.17442320585250853, "num_tokens": 51258710.0, "step": 20220 }, { "entropy": 6.303627157211304, "epoch": 2.3341027120600115, "grad_norm": 1.0703125, "learning_rate": 0.0004463443362331166, "loss": 5.9982, "mean_token_accuracy": 0.17676437944173812, "num_tokens": 51270382.0, "step": 20225 }, { "entropy": 6.296655225753784, "epoch": 2.3346797461050204, "grad_norm": 0.94921875, "learning_rate": 0.00044631758871988486, "loss": 6.0015, "mean_token_accuracy": 0.17527170479297638, "num_tokens": 51283923.0, "step": 20230 }, { "entropy": 6.296395015716553, "epoch": 2.335256780150029, "grad_norm": 1.1484375, "learning_rate": 0.0004462908354444711, "loss": 5.949, "mean_token_accuracy": 0.1749487653374672, "num_tokens": 51297671.0, "step": 20235 }, { "entropy": 6.188365316390991, "epoch": 2.3358338141950377, "grad_norm": 0.921875, "learning_rate": 0.0004462640764077751, "loss": 5.893, "mean_token_accuracy": 0.17709133625030518, "num_tokens": 51309339.0, "step": 20240 }, { "entropy": 6.241654634475708, "epoch": 2.336410848240046, "grad_norm": 1.0234375, "learning_rate": 0.0004462373116106971, "loss": 5.9949, "mean_token_accuracy": 0.17668516039848328, "num_tokens": 51321479.0, "step": 20245 }, { "entropy": 6.22584114074707, "epoch": 2.336987882285055, "grad_norm": 1.25, "learning_rate": 0.00044621054105413704, "loss": 5.9345, "mean_token_accuracy": 0.17172120362520218, "num_tokens": 51335135.0, "step": 20250 }, { "entropy": 6.133741807937622, "epoch": 2.3375649163300634, "grad_norm": 1.09375, "learning_rate": 0.00044618376473899555, "loss": 5.8699, "mean_token_accuracy": 0.1795585796236992, "num_tokens": 51346556.0, "step": 20255 }, { "entropy": 6.123044729232788, "epoch": 2.338141950375072, "grad_norm": 1.265625, "learning_rate": 0.0004461569826661732, "loss": 5.8347, "mean_token_accuracy": 0.18230682015419006, "num_tokens": 51359692.0, "step": 20260 }, { "entropy": 6.258272743225097, "epoch": 2.3387189844200806, "grad_norm": 0.94140625, "learning_rate": 0.0004461301948365707, "loss": 5.944, "mean_token_accuracy": 0.16859951466321946, "num_tokens": 51371682.0, "step": 20265 }, { "entropy": 6.238030576705933, "epoch": 2.3392960184650895, "grad_norm": 1.21875, "learning_rate": 0.0004461034012510891, "loss": 5.9245, "mean_token_accuracy": 0.1813396081328392, "num_tokens": 51383533.0, "step": 20270 }, { "entropy": 6.156278944015503, "epoch": 2.339873052510098, "grad_norm": 1.125, "learning_rate": 0.00044607660191062963, "loss": 5.8979, "mean_token_accuracy": 0.17602861672639847, "num_tokens": 51395696.0, "step": 20275 }, { "entropy": 6.193694400787353, "epoch": 2.340450086555107, "grad_norm": 1.109375, "learning_rate": 0.00044604979681609364, "loss": 5.8663, "mean_token_accuracy": 0.18097577840089799, "num_tokens": 51408460.0, "step": 20280 }, { "entropy": 6.147213506698608, "epoch": 2.341027120600115, "grad_norm": 0.98828125, "learning_rate": 0.00044602298596838264, "loss": 5.8235, "mean_token_accuracy": 0.18585553616285325, "num_tokens": 51420768.0, "step": 20285 }, { "entropy": 6.229567384719848, "epoch": 2.341604154645124, "grad_norm": 0.953125, "learning_rate": 0.00044599616936839853, "loss": 5.9126, "mean_token_accuracy": 0.17630589306354522, "num_tokens": 51434429.0, "step": 20290 }, { "entropy": 6.2479852676391605, "epoch": 2.342181188690133, "grad_norm": 1.1171875, "learning_rate": 0.0004459693470170432, "loss": 5.964, "mean_token_accuracy": 0.17569663673639296, "num_tokens": 51447146.0, "step": 20295 }, { "entropy": 6.163450908660889, "epoch": 2.3427582227351413, "grad_norm": 0.953125, "learning_rate": 0.0004459425189152187, "loss": 5.8526, "mean_token_accuracy": 0.18089221566915512, "num_tokens": 51458656.0, "step": 20300 }, { "entropy": 6.1185956478118895, "epoch": 2.34333525678015, "grad_norm": 1.875, "learning_rate": 0.00044591568506382757, "loss": 5.7917, "mean_token_accuracy": 0.18526783734560012, "num_tokens": 51473350.0, "step": 20305 }, { "entropy": 6.210563611984253, "epoch": 2.3439122908251586, "grad_norm": 1.125, "learning_rate": 0.00044588884546377226, "loss": 5.8819, "mean_token_accuracy": 0.18186958581209184, "num_tokens": 51486801.0, "step": 20310 }, { "entropy": 6.221357297897339, "epoch": 2.3444893248701675, "grad_norm": 1.390625, "learning_rate": 0.0004458620001159555, "loss": 5.9124, "mean_token_accuracy": 0.18402253985404968, "num_tokens": 51499217.0, "step": 20315 }, { "entropy": 6.258128213882446, "epoch": 2.345066358915176, "grad_norm": 1.1875, "learning_rate": 0.0004458351490212803, "loss": 5.9787, "mean_token_accuracy": 0.17318946570158006, "num_tokens": 51511714.0, "step": 20320 }, { "entropy": 6.1194176197052, "epoch": 2.3456433929601848, "grad_norm": 0.95703125, "learning_rate": 0.00044580829218064964, "loss": 5.7943, "mean_token_accuracy": 0.18501977026462554, "num_tokens": 51522725.0, "step": 20325 }, { "entropy": 6.2714615821838375, "epoch": 2.346220427005193, "grad_norm": 0.99609375, "learning_rate": 0.000445781429594967, "loss": 5.9029, "mean_token_accuracy": 0.18235889971256256, "num_tokens": 51535178.0, "step": 20330 }, { "entropy": 6.195360422134399, "epoch": 2.346797461050202, "grad_norm": 1.015625, "learning_rate": 0.0004457545612651357, "loss": 6.0008, "mean_token_accuracy": 0.17095666080713273, "num_tokens": 51546859.0, "step": 20335 }, { "entropy": 6.213983869552612, "epoch": 2.3473744950952105, "grad_norm": 1.046875, "learning_rate": 0.00044572768719205964, "loss": 5.9098, "mean_token_accuracy": 0.17400958389043808, "num_tokens": 51558719.0, "step": 20340 }, { "entropy": 6.2138770580291744, "epoch": 2.3479515291402193, "grad_norm": 1.03125, "learning_rate": 0.00044570080737664264, "loss": 5.9327, "mean_token_accuracy": 0.17676707804203035, "num_tokens": 51570630.0, "step": 20345 }, { "entropy": 6.228191184997558, "epoch": 2.3485285631852277, "grad_norm": 0.9921875, "learning_rate": 0.00044567392181978874, "loss": 5.8876, "mean_token_accuracy": 0.17099658101797105, "num_tokens": 51583463.0, "step": 20350 }, { "entropy": 6.2143758773803714, "epoch": 2.3491055972302366, "grad_norm": 1.4765625, "learning_rate": 0.00044564703052240223, "loss": 5.9353, "mean_token_accuracy": 0.17696345150470733, "num_tokens": 51597090.0, "step": 20355 }, { "entropy": 6.219122362136841, "epoch": 2.349682631275245, "grad_norm": 1.0234375, "learning_rate": 0.0004456201334853876, "loss": 5.8587, "mean_token_accuracy": 0.18090834617614746, "num_tokens": 51609288.0, "step": 20360 }, { "entropy": 6.1154890060424805, "epoch": 2.350259665320254, "grad_norm": 1.84375, "learning_rate": 0.00044559323070964956, "loss": 5.8541, "mean_token_accuracy": 0.1837046980857849, "num_tokens": 51622269.0, "step": 20365 }, { "entropy": 6.238179540634155, "epoch": 2.3508366993652627, "grad_norm": 1.078125, "learning_rate": 0.000445566322196093, "loss": 5.9468, "mean_token_accuracy": 0.1666563108563423, "num_tokens": 51634222.0, "step": 20370 }, { "entropy": 6.270152044296265, "epoch": 2.351413733410271, "grad_norm": 0.96875, "learning_rate": 0.0004455394079456228, "loss": 5.9197, "mean_token_accuracy": 0.17454564124345778, "num_tokens": 51646933.0, "step": 20375 }, { "entropy": 6.2179069995880125, "epoch": 2.35199076745528, "grad_norm": 1.0546875, "learning_rate": 0.00044551248795914446, "loss": 5.9337, "mean_token_accuracy": 0.17222847640514374, "num_tokens": 51658987.0, "step": 20380 }, { "entropy": 6.222844505310059, "epoch": 2.3525678015002884, "grad_norm": 1.0625, "learning_rate": 0.0004454855622375632, "loss": 5.9092, "mean_token_accuracy": 0.17403256595134736, "num_tokens": 51669513.0, "step": 20385 }, { "entropy": 6.2505049228668215, "epoch": 2.3531448355452973, "grad_norm": 1.015625, "learning_rate": 0.0004454586307817848, "loss": 5.9076, "mean_token_accuracy": 0.17644617408514024, "num_tokens": 51682084.0, "step": 20390 }, { "entropy": 6.1657110214233395, "epoch": 2.3537218695903057, "grad_norm": 0.98046875, "learning_rate": 0.000445431693592715, "loss": 5.9156, "mean_token_accuracy": 0.18160975426435472, "num_tokens": 51695335.0, "step": 20395 }, { "entropy": 6.303590488433838, "epoch": 2.3542989036353146, "grad_norm": 1.0859375, "learning_rate": 0.0004454047506712598, "loss": 6.0019, "mean_token_accuracy": 0.16991567760705947, "num_tokens": 51707856.0, "step": 20400 }, { "entropy": 6.257295179367065, "epoch": 2.354875937680323, "grad_norm": 1.1796875, "learning_rate": 0.00044537780201832545, "loss": 5.8853, "mean_token_accuracy": 0.1759468987584114, "num_tokens": 51719716.0, "step": 20405 }, { "entropy": 6.120660829544067, "epoch": 2.355452971725332, "grad_norm": 0.90625, "learning_rate": 0.0004453508476348184, "loss": 5.8576, "mean_token_accuracy": 0.1873482272028923, "num_tokens": 51733263.0, "step": 20410 }, { "entropy": 6.171567296981811, "epoch": 2.3560300057703403, "grad_norm": 1.0078125, "learning_rate": 0.0004453238875216452, "loss": 5.8262, "mean_token_accuracy": 0.18494777530431747, "num_tokens": 51745143.0, "step": 20415 }, { "entropy": 6.264321565628052, "epoch": 2.356607039815349, "grad_norm": 0.984375, "learning_rate": 0.0004452969216797127, "loss": 5.9456, "mean_token_accuracy": 0.17102426737546922, "num_tokens": 51757155.0, "step": 20420 }, { "entropy": 6.178544187545777, "epoch": 2.357184073860358, "grad_norm": 0.93359375, "learning_rate": 0.0004452699501099277, "loss": 5.8602, "mean_token_accuracy": 0.1825183629989624, "num_tokens": 51769170.0, "step": 20425 }, { "entropy": 6.224378490447998, "epoch": 2.3577611079053664, "grad_norm": 0.984375, "learning_rate": 0.00044524297281319766, "loss": 5.9331, "mean_token_accuracy": 0.17603640556335448, "num_tokens": 51781254.0, "step": 20430 }, { "entropy": 6.27843451499939, "epoch": 2.358338141950375, "grad_norm": 0.9375, "learning_rate": 0.00044521598979042963, "loss": 5.9701, "mean_token_accuracy": 0.17067469358444215, "num_tokens": 51793425.0, "step": 20435 }, { "entropy": 6.208112382888794, "epoch": 2.3589151759953837, "grad_norm": 1.125, "learning_rate": 0.00044518900104253154, "loss": 5.8863, "mean_token_accuracy": 0.1794102519750595, "num_tokens": 51806196.0, "step": 20440 }, { "entropy": 6.08141679763794, "epoch": 2.3594922100403926, "grad_norm": 1.1640625, "learning_rate": 0.0004451620065704108, "loss": 5.909, "mean_token_accuracy": 0.1794336900115013, "num_tokens": 51819137.0, "step": 20445 }, { "entropy": 6.230327129364014, "epoch": 2.360069244085401, "grad_norm": 0.99609375, "learning_rate": 0.00044513500637497546, "loss": 5.9676, "mean_token_accuracy": 0.17364402115345, "num_tokens": 51830924.0, "step": 20450 }, { "entropy": 6.2120137214660645, "epoch": 2.36064627813041, "grad_norm": 0.98828125, "learning_rate": 0.00044510800045713373, "loss": 5.8613, "mean_token_accuracy": 0.17585181295871735, "num_tokens": 51843503.0, "step": 20455 }, { "entropy": 6.174780321121216, "epoch": 2.3612233121754183, "grad_norm": 1.0625, "learning_rate": 0.00044508098881779396, "loss": 5.9327, "mean_token_accuracy": 0.17654947489500045, "num_tokens": 51855818.0, "step": 20460 }, { "entropy": 6.192159175872803, "epoch": 2.361800346220427, "grad_norm": 0.9609375, "learning_rate": 0.0004450539714578645, "loss": 5.9015, "mean_token_accuracy": 0.18018826544284822, "num_tokens": 51867033.0, "step": 20465 }, { "entropy": 6.2804539680480955, "epoch": 2.3623773802654355, "grad_norm": 1.3671875, "learning_rate": 0.0004450269483782543, "loss": 5.9246, "mean_token_accuracy": 0.1715424582362175, "num_tokens": 51880845.0, "step": 20470 }, { "entropy": 6.175959062576294, "epoch": 2.3629544143104444, "grad_norm": 0.98046875, "learning_rate": 0.0004449999195798721, "loss": 5.9509, "mean_token_accuracy": 0.1731112152338028, "num_tokens": 51893761.0, "step": 20475 }, { "entropy": 6.216841125488282, "epoch": 2.363531448355453, "grad_norm": 0.95703125, "learning_rate": 0.00044497288506362706, "loss": 5.9011, "mean_token_accuracy": 0.1775978684425354, "num_tokens": 51907478.0, "step": 20480 }, { "entropy": 6.25024037361145, "epoch": 2.3641084824004617, "grad_norm": 1.015625, "learning_rate": 0.0004449458448304284, "loss": 5.8986, "mean_token_accuracy": 0.18205091655254363, "num_tokens": 51919242.0, "step": 20485 }, { "entropy": 6.244975900650024, "epoch": 2.36468551644547, "grad_norm": 1.03125, "learning_rate": 0.00044491879888118574, "loss": 5.9593, "mean_token_accuracy": 0.17636770755052567, "num_tokens": 51930791.0, "step": 20490 }, { "entropy": 6.109720230102539, "epoch": 2.365262550490479, "grad_norm": 0.953125, "learning_rate": 0.0004448917472168087, "loss": 5.7711, "mean_token_accuracy": 0.1822209522128105, "num_tokens": 51943848.0, "step": 20495 }, { "entropy": 6.246545028686524, "epoch": 2.365839584535488, "grad_norm": 0.97265625, "learning_rate": 0.00044486468983820707, "loss": 5.9557, "mean_token_accuracy": 0.1686646580696106, "num_tokens": 51956648.0, "step": 20500 }, { "entropy": 6.234007215499878, "epoch": 2.3664166185804962, "grad_norm": 0.94140625, "learning_rate": 0.000444837626746291, "loss": 5.9126, "mean_token_accuracy": 0.17662867456674575, "num_tokens": 51969068.0, "step": 20505 }, { "entropy": 6.211513042449951, "epoch": 2.366993652625505, "grad_norm": 1.1015625, "learning_rate": 0.0004448105579419707, "loss": 5.9168, "mean_token_accuracy": 0.17582010626792907, "num_tokens": 51981856.0, "step": 20510 }, { "entropy": 6.257792949676514, "epoch": 2.3675706866705135, "grad_norm": 0.984375, "learning_rate": 0.0004447834834261567, "loss": 5.9791, "mean_token_accuracy": 0.16998671889305114, "num_tokens": 51994428.0, "step": 20515 }, { "entropy": 6.1701915740966795, "epoch": 2.3681477207155224, "grad_norm": 1.0, "learning_rate": 0.0004447564031997595, "loss": 5.8249, "mean_token_accuracy": 0.1855105385184288, "num_tokens": 52007875.0, "step": 20520 }, { "entropy": 6.1876523971557615, "epoch": 2.368724754760531, "grad_norm": 1.03125, "learning_rate": 0.00044472931726369, "loss": 5.8072, "mean_token_accuracy": 0.18526231050491332, "num_tokens": 52020876.0, "step": 20525 }, { "entropy": 6.313043832778931, "epoch": 2.3693017888055397, "grad_norm": 1.609375, "learning_rate": 0.00044470222561885926, "loss": 5.9765, "mean_token_accuracy": 0.16895418912172316, "num_tokens": 52032056.0, "step": 20530 }, { "entropy": 6.229685974121094, "epoch": 2.369878822850548, "grad_norm": 1.0078125, "learning_rate": 0.00044467512826617845, "loss": 5.9194, "mean_token_accuracy": 0.17216948568820953, "num_tokens": 52044488.0, "step": 20535 }, { "entropy": 6.194803714752197, "epoch": 2.370455856895557, "grad_norm": 0.96484375, "learning_rate": 0.00044464802520655897, "loss": 5.918, "mean_token_accuracy": 0.17740179896354674, "num_tokens": 52056186.0, "step": 20540 }, { "entropy": 6.27158522605896, "epoch": 2.3710328909405654, "grad_norm": 1.015625, "learning_rate": 0.0004446209164409124, "loss": 5.8929, "mean_token_accuracy": 0.17821502685546875, "num_tokens": 52068218.0, "step": 20545 }, { "entropy": 6.1447595119476315, "epoch": 2.371609924985574, "grad_norm": 0.90625, "learning_rate": 0.0004445938019701506, "loss": 5.8197, "mean_token_accuracy": 0.19037968665361404, "num_tokens": 52081854.0, "step": 20550 }, { "entropy": 6.138282728195191, "epoch": 2.3721869590305826, "grad_norm": 0.98046875, "learning_rate": 0.0004445666817951855, "loss": 5.8201, "mean_token_accuracy": 0.1810576945543289, "num_tokens": 52094022.0, "step": 20555 }, { "entropy": 6.2049354076385494, "epoch": 2.3727639930755915, "grad_norm": 1.046875, "learning_rate": 0.0004445395559169293, "loss": 5.8504, "mean_token_accuracy": 0.18278271555900574, "num_tokens": 52105677.0, "step": 20560 }, { "entropy": 6.20401782989502, "epoch": 2.3733410271206, "grad_norm": 1.1171875, "learning_rate": 0.0004445124243362943, "loss": 5.9219, "mean_token_accuracy": 0.1751824989914894, "num_tokens": 52118039.0, "step": 20565 }, { "entropy": 6.217830038070678, "epoch": 2.3739180611656088, "grad_norm": 1.0546875, "learning_rate": 0.0004444852870541932, "loss": 5.8951, "mean_token_accuracy": 0.18027360439300538, "num_tokens": 52131519.0, "step": 20570 }, { "entropy": 6.223957586288452, "epoch": 2.3744950952106176, "grad_norm": 1.0078125, "learning_rate": 0.0004444581440715386, "loss": 5.9052, "mean_token_accuracy": 0.17486371994018554, "num_tokens": 52143240.0, "step": 20575 }, { "entropy": 6.156794452667237, "epoch": 2.375072129255626, "grad_norm": 0.98828125, "learning_rate": 0.00044443099538924347, "loss": 5.8348, "mean_token_accuracy": 0.1791414126753807, "num_tokens": 52155977.0, "step": 20580 }, { "entropy": 6.174764204025268, "epoch": 2.375649163300635, "grad_norm": 0.984375, "learning_rate": 0.0004444038410082211, "loss": 5.8923, "mean_token_accuracy": 0.1771896630525589, "num_tokens": 52169388.0, "step": 20585 }, { "entropy": 6.1451273441314695, "epoch": 2.3762261973456433, "grad_norm": 1.015625, "learning_rate": 0.0004443766809293846, "loss": 5.8173, "mean_token_accuracy": 0.1791497439146042, "num_tokens": 52181830.0, "step": 20590 }, { "entropy": 6.145556116104126, "epoch": 2.376803231390652, "grad_norm": 1.0390625, "learning_rate": 0.0004443495151536475, "loss": 5.7948, "mean_token_accuracy": 0.18753628581762313, "num_tokens": 52194255.0, "step": 20595 }, { "entropy": 6.218704557418823, "epoch": 2.3773802654356606, "grad_norm": 0.9609375, "learning_rate": 0.0004443223436819237, "loss": 5.9057, "mean_token_accuracy": 0.17673536837100984, "num_tokens": 52205646.0, "step": 20600 }, { "entropy": 6.216388416290283, "epoch": 2.3779572994806695, "grad_norm": 0.94921875, "learning_rate": 0.00044429516651512687, "loss": 5.8749, "mean_token_accuracy": 0.17649720460176468, "num_tokens": 52217519.0, "step": 20605 }, { "entropy": 6.181417036056518, "epoch": 2.378534333525678, "grad_norm": 1.015625, "learning_rate": 0.00044426798365417133, "loss": 5.9024, "mean_token_accuracy": 0.18006114661693573, "num_tokens": 52230139.0, "step": 20610 }, { "entropy": 6.159763383865356, "epoch": 2.3791113675706868, "grad_norm": 1.578125, "learning_rate": 0.00044424079509997104, "loss": 6.0185, "mean_token_accuracy": 0.1719463661313057, "num_tokens": 52244049.0, "step": 20615 }, { "entropy": 6.236967277526856, "epoch": 2.379688401615695, "grad_norm": 1.0546875, "learning_rate": 0.0004442136008534409, "loss": 5.902, "mean_token_accuracy": 0.18061581999063492, "num_tokens": 52257180.0, "step": 20620 }, { "entropy": 6.223541164398194, "epoch": 2.380265435660704, "grad_norm": 1.078125, "learning_rate": 0.00044418640091549525, "loss": 5.9095, "mean_token_accuracy": 0.1799600303173065, "num_tokens": 52270260.0, "step": 20625 }, { "entropy": 6.080956268310547, "epoch": 2.3808424697057124, "grad_norm": 1.078125, "learning_rate": 0.000444159195287049, "loss": 5.8505, "mean_token_accuracy": 0.18108619451522828, "num_tokens": 52282335.0, "step": 20630 }, { "entropy": 6.247951030731201, "epoch": 2.3814195037507213, "grad_norm": 1.125, "learning_rate": 0.0004441319839690173, "loss": 5.8854, "mean_token_accuracy": 0.17612518668174743, "num_tokens": 52296547.0, "step": 20635 }, { "entropy": 6.2390968799591064, "epoch": 2.3819965377957297, "grad_norm": 1.0078125, "learning_rate": 0.0004441047669623153, "loss": 5.933, "mean_token_accuracy": 0.1712224617600441, "num_tokens": 52309523.0, "step": 20640 }, { "entropy": 6.192690086364746, "epoch": 2.3825735718407386, "grad_norm": 1.0234375, "learning_rate": 0.00044407754426785845, "loss": 5.8802, "mean_token_accuracy": 0.1796162709593773, "num_tokens": 52322476.0, "step": 20645 }, { "entropy": 6.12495059967041, "epoch": 2.3831506058857475, "grad_norm": 2.125, "learning_rate": 0.0004440503158865625, "loss": 5.8206, "mean_token_accuracy": 0.18461779803037642, "num_tokens": 52335919.0, "step": 20650 }, { "entropy": 6.224644613265991, "epoch": 2.383727639930756, "grad_norm": 1.0703125, "learning_rate": 0.00044402308181934295, "loss": 5.8806, "mean_token_accuracy": 0.1802664205431938, "num_tokens": 52347636.0, "step": 20655 }, { "entropy": 6.275594902038574, "epoch": 2.3843046739757647, "grad_norm": 0.9140625, "learning_rate": 0.0004439958420671162, "loss": 5.8984, "mean_token_accuracy": 0.1733878329396248, "num_tokens": 52360181.0, "step": 20660 }, { "entropy": 6.190026378631591, "epoch": 2.384881708020773, "grad_norm": 1.015625, "learning_rate": 0.00044396859663079814, "loss": 5.9203, "mean_token_accuracy": 0.18247169107198716, "num_tokens": 52373525.0, "step": 20665 }, { "entropy": 6.126813983917236, "epoch": 2.385458742065782, "grad_norm": 1.046875, "learning_rate": 0.00044394134551130533, "loss": 5.7935, "mean_token_accuracy": 0.18269770294427873, "num_tokens": 52386252.0, "step": 20670 }, { "entropy": 6.168920612335205, "epoch": 2.3860357761107904, "grad_norm": 1.03125, "learning_rate": 0.0004439140887095542, "loss": 5.8237, "mean_token_accuracy": 0.18038810044527054, "num_tokens": 52398056.0, "step": 20675 }, { "entropy": 6.160497331619263, "epoch": 2.3866128101557993, "grad_norm": 1.078125, "learning_rate": 0.00044388682622646165, "loss": 5.8866, "mean_token_accuracy": 0.18339675068855285, "num_tokens": 52409861.0, "step": 20680 }, { "entropy": 6.153534173965454, "epoch": 2.3871898442008077, "grad_norm": 1.0234375, "learning_rate": 0.0004438595580629446, "loss": 5.8642, "mean_token_accuracy": 0.17689687460660936, "num_tokens": 52423252.0, "step": 20685 }, { "entropy": 6.231155490875244, "epoch": 2.3877668782458166, "grad_norm": 0.93359375, "learning_rate": 0.0004438322842199202, "loss": 5.8119, "mean_token_accuracy": 0.18488748669624328, "num_tokens": 52435950.0, "step": 20690 }, { "entropy": 6.181946468353272, "epoch": 2.388343912290825, "grad_norm": 0.921875, "learning_rate": 0.0004438050046983057, "loss": 5.8772, "mean_token_accuracy": 0.18326539695262908, "num_tokens": 52449257.0, "step": 20695 }, { "entropy": 6.129793930053711, "epoch": 2.388920946335834, "grad_norm": 1.5390625, "learning_rate": 0.00044377771949901876, "loss": 5.8776, "mean_token_accuracy": 0.1826947495341301, "num_tokens": 52461543.0, "step": 20700 }, { "entropy": 6.034094667434692, "epoch": 2.3894979803808427, "grad_norm": 0.984375, "learning_rate": 0.00044375042862297703, "loss": 5.7827, "mean_token_accuracy": 0.18628005534410477, "num_tokens": 52473752.0, "step": 20705 }, { "entropy": 6.250870418548584, "epoch": 2.390075014425851, "grad_norm": 0.98828125, "learning_rate": 0.00044372313207109856, "loss": 5.936, "mean_token_accuracy": 0.17118626981973648, "num_tokens": 52485885.0, "step": 20710 }, { "entropy": 6.232921504974366, "epoch": 2.3906520484708595, "grad_norm": 1.0390625, "learning_rate": 0.00044369582984430127, "loss": 5.8967, "mean_token_accuracy": 0.17732545882463455, "num_tokens": 52498389.0, "step": 20715 }, { "entropy": 6.161101770401001, "epoch": 2.3912290825158684, "grad_norm": 1.125, "learning_rate": 0.00044366852194350354, "loss": 5.9196, "mean_token_accuracy": 0.17828254997730256, "num_tokens": 52511176.0, "step": 20720 }, { "entropy": 6.2019850730896, "epoch": 2.3918061165608773, "grad_norm": 0.98046875, "learning_rate": 0.0004436412083696239, "loss": 5.858, "mean_token_accuracy": 0.17637231349945068, "num_tokens": 52523173.0, "step": 20725 }, { "entropy": 6.180507469177246, "epoch": 2.3923831506058857, "grad_norm": 1.0859375, "learning_rate": 0.00044361388912358095, "loss": 5.8576, "mean_token_accuracy": 0.1753206104040146, "num_tokens": 52535776.0, "step": 20730 }, { "entropy": 6.0130421161651615, "epoch": 2.3929601846508946, "grad_norm": 1.1640625, "learning_rate": 0.0004435865642062936, "loss": 5.6563, "mean_token_accuracy": 0.19541964679956436, "num_tokens": 52549416.0, "step": 20735 }, { "entropy": 6.154394340515137, "epoch": 2.393537218695903, "grad_norm": 1.046875, "learning_rate": 0.0004435592336186809, "loss": 5.8559, "mean_token_accuracy": 0.18084726482629776, "num_tokens": 52562300.0, "step": 20740 }, { "entropy": 6.264912223815918, "epoch": 2.394114252740912, "grad_norm": 0.97265625, "learning_rate": 0.0004435318973616622, "loss": 5.9503, "mean_token_accuracy": 0.17170136272907258, "num_tokens": 52573906.0, "step": 20745 }, { "entropy": 6.226292419433594, "epoch": 2.3946912867859202, "grad_norm": 0.94140625, "learning_rate": 0.00044350455543615665, "loss": 5.848, "mean_token_accuracy": 0.18819532096385955, "num_tokens": 52586138.0, "step": 20750 }, { "entropy": 6.221322345733642, "epoch": 2.395268320830929, "grad_norm": 0.91015625, "learning_rate": 0.0004434772078430843, "loss": 5.9211, "mean_token_accuracy": 0.17501968443393706, "num_tokens": 52599705.0, "step": 20755 }, { "entropy": 6.20050082206726, "epoch": 2.3958453548759375, "grad_norm": 1.0234375, "learning_rate": 0.0004434498545833646, "loss": 5.9694, "mean_token_accuracy": 0.17441977709531784, "num_tokens": 52612041.0, "step": 20760 }, { "entropy": 6.275346374511718, "epoch": 2.3964223889209464, "grad_norm": 1.15625, "learning_rate": 0.0004434224956579177, "loss": 5.9354, "mean_token_accuracy": 0.1756373316049576, "num_tokens": 52625634.0, "step": 20765 }, { "entropy": 6.119609260559082, "epoch": 2.396999422965955, "grad_norm": 1.1484375, "learning_rate": 0.0004433951310676639, "loss": 5.7395, "mean_token_accuracy": 0.19740791916847228, "num_tokens": 52638706.0, "step": 20770 }, { "entropy": 6.067688941955566, "epoch": 2.3975764570109637, "grad_norm": 0.96484375, "learning_rate": 0.00044336776081352347, "loss": 5.8935, "mean_token_accuracy": 0.18710660338401794, "num_tokens": 52650876.0, "step": 20775 }, { "entropy": 6.181147623062134, "epoch": 2.3981534910559725, "grad_norm": 0.953125, "learning_rate": 0.00044334038489641706, "loss": 5.8468, "mean_token_accuracy": 0.18153303414583205, "num_tokens": 52663664.0, "step": 20780 }, { "entropy": 6.249605894088745, "epoch": 2.398730525100981, "grad_norm": 1.5703125, "learning_rate": 0.00044331300331726544, "loss": 5.969, "mean_token_accuracy": 0.17528854310512543, "num_tokens": 52675870.0, "step": 20785 }, { "entropy": 6.19515962600708, "epoch": 2.3993075591459894, "grad_norm": 1.1640625, "learning_rate": 0.00044328561607698947, "loss": 5.9009, "mean_token_accuracy": 0.17321067303419113, "num_tokens": 52687029.0, "step": 20790 }, { "entropy": 6.1399908542633055, "epoch": 2.3998845931909982, "grad_norm": 1.171875, "learning_rate": 0.0004432582231765105, "loss": 5.7928, "mean_token_accuracy": 0.1765931084752083, "num_tokens": 52700242.0, "step": 20795 }, { "entropy": 6.125870227813721, "epoch": 2.400461627236007, "grad_norm": 0.98046875, "learning_rate": 0.00044323082461674974, "loss": 5.8552, "mean_token_accuracy": 0.1790474236011505, "num_tokens": 52711561.0, "step": 20800 }, { "entropy": 6.098082399368286, "epoch": 2.4010386612810155, "grad_norm": 1.0546875, "learning_rate": 0.0004432034203986287, "loss": 5.8224, "mean_token_accuracy": 0.179676416516304, "num_tokens": 52725101.0, "step": 20805 }, { "entropy": 6.260610103607178, "epoch": 2.4016156953260244, "grad_norm": 1.25, "learning_rate": 0.0004431760105230693, "loss": 5.9327, "mean_token_accuracy": 0.1707353785634041, "num_tokens": 52738315.0, "step": 20810 }, { "entropy": 6.253695631027222, "epoch": 2.402192729371033, "grad_norm": 1.09375, "learning_rate": 0.00044314859499099325, "loss": 6.0138, "mean_token_accuracy": 0.1738351672887802, "num_tokens": 52752547.0, "step": 20815 }, { "entropy": 6.238799381256103, "epoch": 2.4027697634160416, "grad_norm": 0.98828125, "learning_rate": 0.00044312117380332274, "loss": 5.9741, "mean_token_accuracy": 0.17198569625616072, "num_tokens": 52765831.0, "step": 20820 }, { "entropy": 6.203983211517334, "epoch": 2.40334679746105, "grad_norm": 0.96875, "learning_rate": 0.00044309374696098, "loss": 5.8477, "mean_token_accuracy": 0.1774840086698532, "num_tokens": 52779144.0, "step": 20825 }, { "entropy": 6.17804536819458, "epoch": 2.403923831506059, "grad_norm": 1.0234375, "learning_rate": 0.0004430663144648876, "loss": 5.8744, "mean_token_accuracy": 0.18458810150623323, "num_tokens": 52790956.0, "step": 20830 }, { "entropy": 6.212011384963989, "epoch": 2.4045008655510673, "grad_norm": 0.94140625, "learning_rate": 0.00044303887631596823, "loss": 5.9118, "mean_token_accuracy": 0.1782439947128296, "num_tokens": 52804057.0, "step": 20835 }, { "entropy": 6.2021739959716795, "epoch": 2.405077899596076, "grad_norm": 0.9765625, "learning_rate": 0.0004430114325151447, "loss": 5.8207, "mean_token_accuracy": 0.17667302638292312, "num_tokens": 52817197.0, "step": 20840 }, { "entropy": 6.252050304412842, "epoch": 2.4056549336410846, "grad_norm": 0.9921875, "learning_rate": 0.0004429839830633401, "loss": 5.9263, "mean_token_accuracy": 0.17479386329650878, "num_tokens": 52830162.0, "step": 20845 }, { "entropy": 6.147500848770141, "epoch": 2.4062319676860935, "grad_norm": 1.0703125, "learning_rate": 0.0004429565279614777, "loss": 5.9127, "mean_token_accuracy": 0.17931033670902252, "num_tokens": 52843681.0, "step": 20850 }, { "entropy": 6.217716884613037, "epoch": 2.4068090017311023, "grad_norm": 1.09375, "learning_rate": 0.00044292906721048094, "loss": 5.9099, "mean_token_accuracy": 0.18140170574188233, "num_tokens": 52857297.0, "step": 20855 }, { "entropy": 6.04101710319519, "epoch": 2.4073860357761108, "grad_norm": 1.09375, "learning_rate": 0.0004429016008112733, "loss": 5.6437, "mean_token_accuracy": 0.1920620620250702, "num_tokens": 52870551.0, "step": 20860 }, { "entropy": 6.204928207397461, "epoch": 2.4079630698211196, "grad_norm": 1.171875, "learning_rate": 0.0004428741287647788, "loss": 5.8678, "mean_token_accuracy": 0.18151758164167403, "num_tokens": 52884628.0, "step": 20865 }, { "entropy": 6.219751262664795, "epoch": 2.408540103866128, "grad_norm": 1.1171875, "learning_rate": 0.00044284665107192136, "loss": 5.8465, "mean_token_accuracy": 0.18571862429380417, "num_tokens": 52897079.0, "step": 20870 }, { "entropy": 6.2039085865020756, "epoch": 2.409117137911137, "grad_norm": 1.0859375, "learning_rate": 0.0004428191677336251, "loss": 5.9341, "mean_token_accuracy": 0.1741613671183586, "num_tokens": 52909990.0, "step": 20875 }, { "entropy": 6.224388694763183, "epoch": 2.4096941719561453, "grad_norm": 1.1015625, "learning_rate": 0.0004427916787508146, "loss": 5.9164, "mean_token_accuracy": 0.17620352655649185, "num_tokens": 52922732.0, "step": 20880 }, { "entropy": 6.319819927215576, "epoch": 2.410271206001154, "grad_norm": 1.0, "learning_rate": 0.0004427641841244144, "loss": 5.9392, "mean_token_accuracy": 0.17118202596902848, "num_tokens": 52934648.0, "step": 20885 }, { "entropy": 6.240547323226929, "epoch": 2.4108482400461626, "grad_norm": 1.625, "learning_rate": 0.000442736683855349, "loss": 5.9929, "mean_token_accuracy": 0.1720513328909874, "num_tokens": 52947913.0, "step": 20890 }, { "entropy": 6.202064085006714, "epoch": 2.4114252740911715, "grad_norm": 0.9140625, "learning_rate": 0.0004427091779445437, "loss": 5.9067, "mean_token_accuracy": 0.17776024490594863, "num_tokens": 52960491.0, "step": 20895 }, { "entropy": 6.2297093868255615, "epoch": 2.41200230813618, "grad_norm": 0.99609375, "learning_rate": 0.0004426816663929235, "loss": 5.8968, "mean_token_accuracy": 0.17991008013486862, "num_tokens": 52972813.0, "step": 20900 }, { "entropy": 6.256739854812622, "epoch": 2.4125793421811887, "grad_norm": 1.140625, "learning_rate": 0.00044265414920141366, "loss": 5.9157, "mean_token_accuracy": 0.17677846252918245, "num_tokens": 52985548.0, "step": 20905 }, { "entropy": 6.209710121154785, "epoch": 2.413156376226197, "grad_norm": 1.0234375, "learning_rate": 0.00044262662637093987, "loss": 5.8355, "mean_token_accuracy": 0.18242569118738175, "num_tokens": 52998911.0, "step": 20910 }, { "entropy": 6.094181299209595, "epoch": 2.413733410271206, "grad_norm": 1.3203125, "learning_rate": 0.00044259909790242776, "loss": 5.8137, "mean_token_accuracy": 0.18979533314704894, "num_tokens": 53011205.0, "step": 20915 }, { "entropy": 6.189552450180054, "epoch": 2.4143104443162144, "grad_norm": 0.98828125, "learning_rate": 0.0004425715637968032, "loss": 5.8986, "mean_token_accuracy": 0.17822712957859038, "num_tokens": 53023428.0, "step": 20920 }, { "entropy": 6.286620140075684, "epoch": 2.4148874783612233, "grad_norm": 1.015625, "learning_rate": 0.0004425440240549923, "loss": 5.9922, "mean_token_accuracy": 0.16845131367444993, "num_tokens": 53035488.0, "step": 20925 }, { "entropy": 6.119616508483887, "epoch": 2.415464512406232, "grad_norm": 1.3125, "learning_rate": 0.00044251647867792147, "loss": 5.7615, "mean_token_accuracy": 0.19196383357048036, "num_tokens": 53048416.0, "step": 20930 }, { "entropy": 6.206809568405151, "epoch": 2.4160415464512406, "grad_norm": 1.2265625, "learning_rate": 0.00044248892766651706, "loss": 6.012, "mean_token_accuracy": 0.17298592031002044, "num_tokens": 53061763.0, "step": 20935 }, { "entropy": 6.2102940559387205, "epoch": 2.4166185804962494, "grad_norm": 0.97265625, "learning_rate": 0.0004424613710217057, "loss": 5.8226, "mean_token_accuracy": 0.1838536038994789, "num_tokens": 53073666.0, "step": 20940 }, { "entropy": 6.109739542007446, "epoch": 2.417195614541258, "grad_norm": 1.0390625, "learning_rate": 0.00044243380874441437, "loss": 5.7945, "mean_token_accuracy": 0.1887991577386856, "num_tokens": 53087155.0, "step": 20945 }, { "entropy": 6.188466739654541, "epoch": 2.4177726485862667, "grad_norm": 1.109375, "learning_rate": 0.00044240624083557, "loss": 5.9308, "mean_token_accuracy": 0.17866060733795167, "num_tokens": 53099199.0, "step": 20950 }, { "entropy": 6.232250165939331, "epoch": 2.418349682631275, "grad_norm": 1.171875, "learning_rate": 0.00044237866729609994, "loss": 5.9363, "mean_token_accuracy": 0.17470151782035828, "num_tokens": 53111997.0, "step": 20955 }, { "entropy": 6.067967510223388, "epoch": 2.418926716676284, "grad_norm": 1.1015625, "learning_rate": 0.0004423510881269315, "loss": 5.8507, "mean_token_accuracy": 0.1857800379395485, "num_tokens": 53123812.0, "step": 20960 }, { "entropy": 6.243478584289551, "epoch": 2.4195037507212924, "grad_norm": 1.21875, "learning_rate": 0.0004423235033289924, "loss": 5.9855, "mean_token_accuracy": 0.1670878440141678, "num_tokens": 53137232.0, "step": 20965 }, { "entropy": 6.27320122718811, "epoch": 2.4200807847663013, "grad_norm": 1.015625, "learning_rate": 0.0004422959129032103, "loss": 5.9064, "mean_token_accuracy": 0.17410949617624283, "num_tokens": 53149183.0, "step": 20970 }, { "entropy": 6.081487798690796, "epoch": 2.4206578188113097, "grad_norm": 1.15625, "learning_rate": 0.00044226831685051333, "loss": 5.8092, "mean_token_accuracy": 0.18246926218271256, "num_tokens": 53163187.0, "step": 20975 }, { "entropy": 6.272024440765381, "epoch": 2.4212348528563186, "grad_norm": 1.03125, "learning_rate": 0.0004422407151718296, "loss": 5.912, "mean_token_accuracy": 0.18224563598632812, "num_tokens": 53178441.0, "step": 20980 }, { "entropy": 6.255713939666748, "epoch": 2.4218118869013274, "grad_norm": 0.953125, "learning_rate": 0.00044221310786808746, "loss": 5.8991, "mean_token_accuracy": 0.17704823911190032, "num_tokens": 53190042.0, "step": 20985 }, { "entropy": 6.235786724090576, "epoch": 2.422388920946336, "grad_norm": 1.1015625, "learning_rate": 0.0004421854949402155, "loss": 5.887, "mean_token_accuracy": 0.17682436257600784, "num_tokens": 53201724.0, "step": 20990 }, { "entropy": 6.165446186065674, "epoch": 2.4229659549913443, "grad_norm": 1.046875, "learning_rate": 0.00044215787638914245, "loss": 5.867, "mean_token_accuracy": 0.17937190979719161, "num_tokens": 53213415.0, "step": 20995 }, { "entropy": 6.219665288925171, "epoch": 2.423542989036353, "grad_norm": 1.4140625, "learning_rate": 0.0004421302522157973, "loss": 5.9, "mean_token_accuracy": 0.1843603178858757, "num_tokens": 53227324.0, "step": 21000 }, { "epoch": 2.423542989036353, "eval_entropy": 6.076491791109894, "eval_loss": 6.019885540008545, "eval_mean_token_accuracy": 0.17840918350434112, "eval_num_tokens": 53227324.0, "eval_runtime": 22.7497, "eval_samples_per_second": 1236.761, "eval_steps_per_second": 154.595, "step": 21000 }, { "entropy": 6.230165576934814, "epoch": 2.424120023081362, "grad_norm": 1.1484375, "learning_rate": 0.0004421026224211091, "loss": 5.934, "mean_token_accuracy": 0.17129454314708709, "num_tokens": 53240325.0, "step": 21005 }, { "entropy": 6.134762001037598, "epoch": 2.4246970571263704, "grad_norm": 1.109375, "learning_rate": 0.00044207498700600724, "loss": 5.7844, "mean_token_accuracy": 0.18430345356464387, "num_tokens": 53251857.0, "step": 21010 }, { "entropy": 6.222596931457519, "epoch": 2.4252740911713793, "grad_norm": 0.9609375, "learning_rate": 0.00044204734597142115, "loss": 5.9991, "mean_token_accuracy": 0.17335744947195053, "num_tokens": 53266309.0, "step": 21015 }, { "entropy": 6.2669469833374025, "epoch": 2.4258511252163877, "grad_norm": 1.0390625, "learning_rate": 0.00044201969931828057, "loss": 5.8677, "mean_token_accuracy": 0.18234310448169708, "num_tokens": 53278085.0, "step": 21020 }, { "entropy": 6.2235143184661865, "epoch": 2.4264281592613965, "grad_norm": 0.94921875, "learning_rate": 0.0004419920470475154, "loss": 5.8775, "mean_token_accuracy": 0.1721951812505722, "num_tokens": 53291395.0, "step": 21025 }, { "entropy": 6.277893877029419, "epoch": 2.427005193306405, "grad_norm": 1.015625, "learning_rate": 0.0004419643891600556, "loss": 6.0218, "mean_token_accuracy": 0.17307724058628082, "num_tokens": 53304735.0, "step": 21030 }, { "entropy": 6.2512092113494875, "epoch": 2.427582227351414, "grad_norm": 1.0546875, "learning_rate": 0.00044193672565683153, "loss": 5.9068, "mean_token_accuracy": 0.18121398389339446, "num_tokens": 53316467.0, "step": 21035 }, { "entropy": 6.135804843902588, "epoch": 2.4281592613964222, "grad_norm": 0.96484375, "learning_rate": 0.0004419090565387736, "loss": 5.8901, "mean_token_accuracy": 0.1738771915435791, "num_tokens": 53328591.0, "step": 21040 }, { "entropy": 6.252773952484131, "epoch": 2.428736295441431, "grad_norm": 1.34375, "learning_rate": 0.00044188138180681255, "loss": 5.9323, "mean_token_accuracy": 0.17573420852422714, "num_tokens": 53340640.0, "step": 21045 }, { "entropy": 6.271492004394531, "epoch": 2.4293133294864395, "grad_norm": 0.98046875, "learning_rate": 0.000441853701461879, "loss": 5.9015, "mean_token_accuracy": 0.17789920717477797, "num_tokens": 53351798.0, "step": 21050 }, { "entropy": 6.239266872406006, "epoch": 2.4298903635314484, "grad_norm": 0.9609375, "learning_rate": 0.00044182601550490414, "loss": 5.9497, "mean_token_accuracy": 0.17646777331829072, "num_tokens": 53364994.0, "step": 21055 }, { "entropy": 6.318173408508301, "epoch": 2.4304673975764572, "grad_norm": 0.98828125, "learning_rate": 0.0004417983239368192, "loss": 6.0036, "mean_token_accuracy": 0.17207963168621063, "num_tokens": 53376729.0, "step": 21060 }, { "entropy": 6.222643661499023, "epoch": 2.4310444316214657, "grad_norm": 0.984375, "learning_rate": 0.00044177062675855534, "loss": 5.9576, "mean_token_accuracy": 0.17806044220924377, "num_tokens": 53389723.0, "step": 21065 }, { "entropy": 6.229648637771606, "epoch": 2.431621465666474, "grad_norm": 1.0625, "learning_rate": 0.0004417429239710444, "loss": 5.9615, "mean_token_accuracy": 0.17081690430641175, "num_tokens": 53402102.0, "step": 21070 }, { "entropy": 6.1297372341156, "epoch": 2.432198499711483, "grad_norm": 1.140625, "learning_rate": 0.0004417152155752179, "loss": 5.7789, "mean_token_accuracy": 0.19271715134382247, "num_tokens": 53416246.0, "step": 21075 }, { "entropy": 6.21894941329956, "epoch": 2.432775533756492, "grad_norm": 1.015625, "learning_rate": 0.0004416875015720081, "loss": 5.8315, "mean_token_accuracy": 0.17722507417201996, "num_tokens": 53430666.0, "step": 21080 }, { "entropy": 6.166200828552246, "epoch": 2.4333525678015, "grad_norm": 0.9375, "learning_rate": 0.0004416597819623469, "loss": 5.8011, "mean_token_accuracy": 0.18992147594690323, "num_tokens": 53442302.0, "step": 21085 }, { "entropy": 6.184221410751343, "epoch": 2.433929601846509, "grad_norm": 1.0, "learning_rate": 0.00044163205674716666, "loss": 5.9174, "mean_token_accuracy": 0.17275547981262207, "num_tokens": 53454288.0, "step": 21090 }, { "entropy": 6.289410352706909, "epoch": 2.4345066358915175, "grad_norm": 1.0, "learning_rate": 0.00044160432592740015, "loss": 5.9595, "mean_token_accuracy": 0.17322028130292894, "num_tokens": 53465307.0, "step": 21095 }, { "entropy": 6.198148584365844, "epoch": 2.4350836699365264, "grad_norm": 0.98046875, "learning_rate": 0.00044157658950397965, "loss": 5.828, "mean_token_accuracy": 0.18212511390447617, "num_tokens": 53478465.0, "step": 21100 }, { "entropy": 6.217931413650513, "epoch": 2.435660703981535, "grad_norm": 1.125, "learning_rate": 0.00044154884747783844, "loss": 5.9445, "mean_token_accuracy": 0.17746067941188812, "num_tokens": 53490783.0, "step": 21105 }, { "entropy": 6.186709356307984, "epoch": 2.4362377380265436, "grad_norm": 0.9296875, "learning_rate": 0.00044152109984990954, "loss": 5.824, "mean_token_accuracy": 0.18825887739658356, "num_tokens": 53502716.0, "step": 21110 }, { "entropy": 6.182549142837525, "epoch": 2.436814772071552, "grad_norm": 0.9765625, "learning_rate": 0.000441493346621126, "loss": 5.9456, "mean_token_accuracy": 0.17565467059612275, "num_tokens": 53514962.0, "step": 21115 }, { "entropy": 6.263493394851684, "epoch": 2.437391806116561, "grad_norm": 0.96875, "learning_rate": 0.00044146558779242155, "loss": 5.9457, "mean_token_accuracy": 0.17664034068584442, "num_tokens": 53527741.0, "step": 21120 }, { "entropy": 6.155855655670166, "epoch": 2.4379688401615693, "grad_norm": 1.21875, "learning_rate": 0.0004414378233647298, "loss": 5.8943, "mean_token_accuracy": 0.17725570648908615, "num_tokens": 53539705.0, "step": 21125 }, { "entropy": 6.167147397994995, "epoch": 2.438545874206578, "grad_norm": 1.9140625, "learning_rate": 0.00044141005333898437, "loss": 5.8583, "mean_token_accuracy": 0.1794601321220398, "num_tokens": 53552310.0, "step": 21130 }, { "entropy": 6.176887559890747, "epoch": 2.439122908251587, "grad_norm": 1.03125, "learning_rate": 0.0004413822777161196, "loss": 5.8445, "mean_token_accuracy": 0.1860383003950119, "num_tokens": 53565553.0, "step": 21135 }, { "entropy": 6.2276452541351315, "epoch": 2.4396999422965955, "grad_norm": 0.96875, "learning_rate": 0.0004413544964970695, "loss": 5.9259, "mean_token_accuracy": 0.17372694462537766, "num_tokens": 53578837.0, "step": 21140 }, { "entropy": 6.206234121322632, "epoch": 2.4402769763416043, "grad_norm": 1.34375, "learning_rate": 0.0004413267096827686, "loss": 5.8569, "mean_token_accuracy": 0.18036649823188783, "num_tokens": 53591286.0, "step": 21145 }, { "entropy": 6.228763246536255, "epoch": 2.4408540103866128, "grad_norm": 0.984375, "learning_rate": 0.0004412989172741514, "loss": 5.9031, "mean_token_accuracy": 0.1840852752327919, "num_tokens": 53603395.0, "step": 21150 }, { "entropy": 6.123088312149048, "epoch": 2.4414310444316216, "grad_norm": 0.94921875, "learning_rate": 0.00044127111927215267, "loss": 5.8742, "mean_token_accuracy": 0.17809473276138305, "num_tokens": 53616134.0, "step": 21155 }, { "entropy": 6.17396650314331, "epoch": 2.44200807847663, "grad_norm": 1.7734375, "learning_rate": 0.00044124331567770746, "loss": 5.8321, "mean_token_accuracy": 0.18286345899105072, "num_tokens": 53628736.0, "step": 21160 }, { "entropy": 6.247747707366943, "epoch": 2.442585112521639, "grad_norm": 1.0546875, "learning_rate": 0.0004412155064917509, "loss": 5.88, "mean_token_accuracy": 0.1826551675796509, "num_tokens": 53640921.0, "step": 21165 }, { "entropy": 6.150192737579346, "epoch": 2.4431621465666473, "grad_norm": 0.953125, "learning_rate": 0.00044118769171521836, "loss": 5.8688, "mean_token_accuracy": 0.1746382847428322, "num_tokens": 53653483.0, "step": 21170 }, { "entropy": 6.260478067398071, "epoch": 2.443739180611656, "grad_norm": 3.859375, "learning_rate": 0.00044115987134904543, "loss": 5.8602, "mean_token_accuracy": 0.18295249938964844, "num_tokens": 53666175.0, "step": 21175 }, { "entropy": 6.1524045944213865, "epoch": 2.4443162146566646, "grad_norm": 0.9765625, "learning_rate": 0.00044113204539416776, "loss": 5.8163, "mean_token_accuracy": 0.1850590541958809, "num_tokens": 53678509.0, "step": 21180 }, { "entropy": 6.195194101333618, "epoch": 2.4448932487016735, "grad_norm": 1.078125, "learning_rate": 0.0004411042138515212, "loss": 5.8969, "mean_token_accuracy": 0.18193794637918473, "num_tokens": 53690825.0, "step": 21185 }, { "entropy": 6.138634300231933, "epoch": 2.445470282746682, "grad_norm": 1.046875, "learning_rate": 0.0004410763767220419, "loss": 5.8419, "mean_token_accuracy": 0.1866929441690445, "num_tokens": 53703730.0, "step": 21190 }, { "entropy": 6.23060359954834, "epoch": 2.4460473167916907, "grad_norm": 1.015625, "learning_rate": 0.0004410485340066662, "loss": 5.9313, "mean_token_accuracy": 0.17497013807296752, "num_tokens": 53715467.0, "step": 21195 }, { "entropy": 6.259818363189697, "epoch": 2.446624350836699, "grad_norm": 0.9609375, "learning_rate": 0.0004410206857063305, "loss": 5.8612, "mean_token_accuracy": 0.17825368344783782, "num_tokens": 53728559.0, "step": 21200 }, { "entropy": 6.22233829498291, "epoch": 2.447201384881708, "grad_norm": 0.96875, "learning_rate": 0.0004409928318219715, "loss": 5.9014, "mean_token_accuracy": 0.17439157664775848, "num_tokens": 53740862.0, "step": 21205 }, { "entropy": 6.141938924789429, "epoch": 2.447778418926717, "grad_norm": 1.0078125, "learning_rate": 0.0004409649723545262, "loss": 5.8574, "mean_token_accuracy": 0.17874789983034134, "num_tokens": 53753026.0, "step": 21210 }, { "entropy": 6.2839446544647215, "epoch": 2.4483554529717253, "grad_norm": 0.91796875, "learning_rate": 0.0004409371073049313, "loss": 5.9209, "mean_token_accuracy": 0.174986369907856, "num_tokens": 53765318.0, "step": 21215 }, { "entropy": 6.210834074020386, "epoch": 2.448932487016734, "grad_norm": 0.9375, "learning_rate": 0.0004409092366741243, "loss": 5.8834, "mean_token_accuracy": 0.1839582920074463, "num_tokens": 53777199.0, "step": 21220 }, { "entropy": 6.107977199554443, "epoch": 2.4495095210617426, "grad_norm": 1.078125, "learning_rate": 0.0004408813604630425, "loss": 5.8635, "mean_token_accuracy": 0.1781278893351555, "num_tokens": 53790229.0, "step": 21225 }, { "entropy": 6.149947452545166, "epoch": 2.4500865551067514, "grad_norm": 1.1328125, "learning_rate": 0.0004408534786726236, "loss": 5.8052, "mean_token_accuracy": 0.1819358617067337, "num_tokens": 53803194.0, "step": 21230 }, { "entropy": 6.183941984176636, "epoch": 2.45066358915176, "grad_norm": 1.125, "learning_rate": 0.0004408255913038053, "loss": 5.8736, "mean_token_accuracy": 0.1778736636042595, "num_tokens": 53815710.0, "step": 21235 }, { "entropy": 6.265126419067383, "epoch": 2.4512406231967687, "grad_norm": 0.984375, "learning_rate": 0.0004407976983575256, "loss": 6.0046, "mean_token_accuracy": 0.17137757688760757, "num_tokens": 53829427.0, "step": 21240 }, { "entropy": 6.212850141525268, "epoch": 2.451817657241777, "grad_norm": 1.109375, "learning_rate": 0.0004407697998347227, "loss": 5.8438, "mean_token_accuracy": 0.17882610708475113, "num_tokens": 53842515.0, "step": 21245 }, { "entropy": 6.20806736946106, "epoch": 2.452394691286786, "grad_norm": 0.96484375, "learning_rate": 0.0004407418957363349, "loss": 5.9061, "mean_token_accuracy": 0.17825556695461273, "num_tokens": 53855913.0, "step": 21250 }, { "entropy": 6.199302816390992, "epoch": 2.4529717253317944, "grad_norm": 1.015625, "learning_rate": 0.00044071398606330075, "loss": 5.8625, "mean_token_accuracy": 0.18881430327892304, "num_tokens": 53869354.0, "step": 21255 }, { "entropy": 6.149003553390503, "epoch": 2.4535487593768033, "grad_norm": 1.015625, "learning_rate": 0.000440686070816559, "loss": 5.8544, "mean_token_accuracy": 0.18218761384487153, "num_tokens": 53881149.0, "step": 21260 }, { "entropy": 6.206202411651612, "epoch": 2.4541257934218117, "grad_norm": 1.0078125, "learning_rate": 0.0004406581499970486, "loss": 5.8998, "mean_token_accuracy": 0.18592076152563095, "num_tokens": 53893930.0, "step": 21265 }, { "entropy": 6.190030717849732, "epoch": 2.4547028274668206, "grad_norm": 1.0234375, "learning_rate": 0.0004406302236057086, "loss": 5.8637, "mean_token_accuracy": 0.18284722715616225, "num_tokens": 53905306.0, "step": 21270 }, { "entropy": 6.270929956436158, "epoch": 2.455279861511829, "grad_norm": 0.95703125, "learning_rate": 0.00044060229164347826, "loss": 5.9625, "mean_token_accuracy": 0.1789903849363327, "num_tokens": 53918405.0, "step": 21275 }, { "entropy": 6.164856338500977, "epoch": 2.455856895556838, "grad_norm": 0.9765625, "learning_rate": 0.00044057435411129714, "loss": 5.8212, "mean_token_accuracy": 0.18167843520641327, "num_tokens": 53932931.0, "step": 21280 }, { "entropy": 6.2761815071105955, "epoch": 2.4564339296018467, "grad_norm": 0.95703125, "learning_rate": 0.00044054641101010485, "loss": 5.9392, "mean_token_accuracy": 0.17176334857940673, "num_tokens": 53945438.0, "step": 21285 }, { "entropy": 6.227966785430908, "epoch": 2.457010963646855, "grad_norm": 1.1953125, "learning_rate": 0.00044051846234084127, "loss": 5.9342, "mean_token_accuracy": 0.17109089940786362, "num_tokens": 53958552.0, "step": 21290 }, { "entropy": 6.188142347335815, "epoch": 2.457587997691864, "grad_norm": 1.0390625, "learning_rate": 0.0004404905081044464, "loss": 5.8369, "mean_token_accuracy": 0.18699333667755128, "num_tokens": 53970776.0, "step": 21295 }, { "entropy": 6.17668604850769, "epoch": 2.4581650317368724, "grad_norm": 0.9453125, "learning_rate": 0.0004404625483018605, "loss": 5.9755, "mean_token_accuracy": 0.18093385994434358, "num_tokens": 53982667.0, "step": 21300 }, { "entropy": 6.251619434356689, "epoch": 2.4587420657818813, "grad_norm": 0.9921875, "learning_rate": 0.000440434582934024, "loss": 5.8748, "mean_token_accuracy": 0.18301041275262833, "num_tokens": 53994603.0, "step": 21305 }, { "entropy": 6.218372440338134, "epoch": 2.4593190998268897, "grad_norm": 1.03125, "learning_rate": 0.00044040661200187746, "loss": 5.9255, "mean_token_accuracy": 0.17349501103162765, "num_tokens": 54007499.0, "step": 21310 }, { "entropy": 6.168102264404297, "epoch": 2.4598961338718985, "grad_norm": 1.078125, "learning_rate": 0.00044037863550636173, "loss": 5.8876, "mean_token_accuracy": 0.1771981120109558, "num_tokens": 54019471.0, "step": 21315 }, { "entropy": 6.195329380035401, "epoch": 2.460473167916907, "grad_norm": 1.078125, "learning_rate": 0.00044035065344841766, "loss": 5.856, "mean_token_accuracy": 0.18363291770219803, "num_tokens": 54032352.0, "step": 21320 }, { "entropy": 6.205634355545044, "epoch": 2.461050201961916, "grad_norm": 1.0703125, "learning_rate": 0.00044032266582898655, "loss": 5.908, "mean_token_accuracy": 0.18235446214675904, "num_tokens": 54046284.0, "step": 21325 }, { "entropy": 6.1461199760437015, "epoch": 2.4616272360069242, "grad_norm": 1.0390625, "learning_rate": 0.0004402946726490097, "loss": 5.8277, "mean_token_accuracy": 0.18235756158828736, "num_tokens": 54058867.0, "step": 21330 }, { "entropy": 6.152193260192871, "epoch": 2.462204270051933, "grad_norm": 0.9375, "learning_rate": 0.00044026667390942867, "loss": 5.791, "mean_token_accuracy": 0.18168945908546447, "num_tokens": 54070587.0, "step": 21335 }, { "entropy": 6.104036474227906, "epoch": 2.462781304096942, "grad_norm": 0.953125, "learning_rate": 0.0004402386696111851, "loss": 5.7838, "mean_token_accuracy": 0.18518714904785155, "num_tokens": 54083707.0, "step": 21340 }, { "entropy": 6.217674112319946, "epoch": 2.4633583381419504, "grad_norm": 0.94921875, "learning_rate": 0.00044021065975522096, "loss": 5.8232, "mean_token_accuracy": 0.1845399856567383, "num_tokens": 54095166.0, "step": 21345 }, { "entropy": 6.189757442474365, "epoch": 2.463935372186959, "grad_norm": 0.90625, "learning_rate": 0.0004401826443424784, "loss": 5.9071, "mean_token_accuracy": 0.17897473275661469, "num_tokens": 54108329.0, "step": 21350 }, { "entropy": 6.2229245662689205, "epoch": 2.4645124062319677, "grad_norm": 0.91796875, "learning_rate": 0.00044015462337389954, "loss": 5.9053, "mean_token_accuracy": 0.18149892538785933, "num_tokens": 54120799.0, "step": 21355 }, { "entropy": 6.24553804397583, "epoch": 2.4650894402769765, "grad_norm": 0.9453125, "learning_rate": 0.00044012659685042704, "loss": 5.9401, "mean_token_accuracy": 0.17447718232870102, "num_tokens": 54133346.0, "step": 21360 }, { "entropy": 6.2007505893707275, "epoch": 2.465666474321985, "grad_norm": 1.03125, "learning_rate": 0.0004400985647730034, "loss": 5.8715, "mean_token_accuracy": 0.18146896362304688, "num_tokens": 54146633.0, "step": 21365 }, { "entropy": 6.175316715240479, "epoch": 2.466243508366994, "grad_norm": 0.953125, "learning_rate": 0.00044007052714257165, "loss": 5.7918, "mean_token_accuracy": 0.18526008278131484, "num_tokens": 54158708.0, "step": 21370 }, { "entropy": 6.082137632369995, "epoch": 2.466820542412002, "grad_norm": 0.96875, "learning_rate": 0.0004400424839600747, "loss": 5.7923, "mean_token_accuracy": 0.18420593589544296, "num_tokens": 54171707.0, "step": 21375 }, { "entropy": 6.174465322494507, "epoch": 2.467397576457011, "grad_norm": 1.3515625, "learning_rate": 0.00044001443522645575, "loss": 5.8629, "mean_token_accuracy": 0.17182135730981826, "num_tokens": 54184778.0, "step": 21380 }, { "entropy": 6.181794452667236, "epoch": 2.4679746105020195, "grad_norm": 0.9375, "learning_rate": 0.0004399863809426582, "loss": 5.888, "mean_token_accuracy": 0.17853653877973558, "num_tokens": 54197199.0, "step": 21385 }, { "entropy": 6.217908239364624, "epoch": 2.4685516445470284, "grad_norm": 0.921875, "learning_rate": 0.00043995832110962576, "loss": 5.8481, "mean_token_accuracy": 0.18075670748949052, "num_tokens": 54211277.0, "step": 21390 }, { "entropy": 6.2485222816467285, "epoch": 2.4691286785920368, "grad_norm": 1.015625, "learning_rate": 0.00043993025572830203, "loss": 5.8977, "mean_token_accuracy": 0.17664981335401536, "num_tokens": 54224342.0, "step": 21395 }, { "entropy": 6.212941360473633, "epoch": 2.4697057126370456, "grad_norm": 1.0625, "learning_rate": 0.00043990218479963115, "loss": 5.8589, "mean_token_accuracy": 0.18220894932746887, "num_tokens": 54236115.0, "step": 21400 }, { "entropy": 6.113332319259643, "epoch": 2.470282746682054, "grad_norm": 0.9921875, "learning_rate": 0.00043987410832455715, "loss": 5.7566, "mean_token_accuracy": 0.18675069510936737, "num_tokens": 54248665.0, "step": 21405 }, { "entropy": 6.130006456375122, "epoch": 2.470859780727063, "grad_norm": 1.015625, "learning_rate": 0.00043984602630402447, "loss": 5.8323, "mean_token_accuracy": 0.18561057597398758, "num_tokens": 54260280.0, "step": 21410 }, { "entropy": 6.234626388549804, "epoch": 2.4714368147720718, "grad_norm": 1.0625, "learning_rate": 0.00043981793873897756, "loss": 5.8595, "mean_token_accuracy": 0.18214363157749175, "num_tokens": 54271057.0, "step": 21415 }, { "entropy": 6.160151624679566, "epoch": 2.47201384881708, "grad_norm": 1.1015625, "learning_rate": 0.0004397898456303612, "loss": 5.7658, "mean_token_accuracy": 0.18412299305200577, "num_tokens": 54284568.0, "step": 21420 }, { "entropy": 6.041882467269898, "epoch": 2.472590882862089, "grad_norm": 0.9296875, "learning_rate": 0.00043976174697912015, "loss": 5.7038, "mean_token_accuracy": 0.19323309808969497, "num_tokens": 54297722.0, "step": 21425 }, { "entropy": 6.214208793640137, "epoch": 2.4731679169070975, "grad_norm": 1.015625, "learning_rate": 0.0004397336427861996, "loss": 5.9186, "mean_token_accuracy": 0.17974215894937515, "num_tokens": 54310992.0, "step": 21430 }, { "entropy": 6.329280424118042, "epoch": 2.4737449509521063, "grad_norm": 1.046875, "learning_rate": 0.0004397055330525448, "loss": 5.9617, "mean_token_accuracy": 0.17033447325229645, "num_tokens": 54323540.0, "step": 21435 }, { "entropy": 6.164299154281617, "epoch": 2.4743219849971148, "grad_norm": 0.94921875, "learning_rate": 0.0004396774177791012, "loss": 5.8877, "mean_token_accuracy": 0.17505358159542084, "num_tokens": 54335522.0, "step": 21440 }, { "entropy": 6.195537281036377, "epoch": 2.4748990190421236, "grad_norm": 0.9140625, "learning_rate": 0.00043964929696681444, "loss": 5.8605, "mean_token_accuracy": 0.1807871699333191, "num_tokens": 54347216.0, "step": 21445 }, { "entropy": 6.191735124588012, "epoch": 2.475476053087132, "grad_norm": 1.5, "learning_rate": 0.0004396211706166305, "loss": 5.8763, "mean_token_accuracy": 0.17860430032014846, "num_tokens": 54360261.0, "step": 21450 }, { "entropy": 6.142237758636474, "epoch": 2.476053087132141, "grad_norm": 0.984375, "learning_rate": 0.0004395930387294951, "loss": 5.8097, "mean_token_accuracy": 0.18718330413103104, "num_tokens": 54373279.0, "step": 21455 }, { "entropy": 6.225560808181763, "epoch": 2.4766301211771493, "grad_norm": 0.98828125, "learning_rate": 0.0004395649013063546, "loss": 5.9007, "mean_token_accuracy": 0.17708432525396348, "num_tokens": 54386266.0, "step": 21460 }, { "entropy": 6.21087794303894, "epoch": 2.477207155222158, "grad_norm": 0.95703125, "learning_rate": 0.0004395367583481554, "loss": 5.8721, "mean_token_accuracy": 0.182944592833519, "num_tokens": 54398839.0, "step": 21465 }, { "entropy": 6.12814507484436, "epoch": 2.4777841892671666, "grad_norm": 1.0625, "learning_rate": 0.00043950860985584423, "loss": 5.7662, "mean_token_accuracy": 0.18537706285715103, "num_tokens": 54409879.0, "step": 21470 }, { "entropy": 6.1023633003234865, "epoch": 2.4783612233121755, "grad_norm": 1.0546875, "learning_rate": 0.0004394804558303675, "loss": 5.8117, "mean_token_accuracy": 0.17815116792917252, "num_tokens": 54421641.0, "step": 21475 }, { "entropy": 6.273129940032959, "epoch": 2.478938257357184, "grad_norm": 0.9921875, "learning_rate": 0.0004394522962726724, "loss": 5.9005, "mean_token_accuracy": 0.17826270163059235, "num_tokens": 54434169.0, "step": 21480 }, { "entropy": 6.222082042694092, "epoch": 2.4795152914021927, "grad_norm": 1.0, "learning_rate": 0.00043942413118370604, "loss": 5.8673, "mean_token_accuracy": 0.17851683497428894, "num_tokens": 54447814.0, "step": 21485 }, { "entropy": 6.1406800746917725, "epoch": 2.4800923254472016, "grad_norm": 2.203125, "learning_rate": 0.0004393959605644157, "loss": 5.9221, "mean_token_accuracy": 0.17649478018283843, "num_tokens": 54460589.0, "step": 21490 }, { "entropy": 6.239633512496948, "epoch": 2.48066935949221, "grad_norm": 0.984375, "learning_rate": 0.0004393677844157488, "loss": 5.8195, "mean_token_accuracy": 0.18858450055122375, "num_tokens": 54473328.0, "step": 21495 }, { "entropy": 6.185845947265625, "epoch": 2.481246393537219, "grad_norm": 1.1171875, "learning_rate": 0.0004393396027386532, "loss": 5.8978, "mean_token_accuracy": 0.18077711910009384, "num_tokens": 54486763.0, "step": 21500 }, { "entropy": 6.112710046768188, "epoch": 2.4818234275822273, "grad_norm": 0.97265625, "learning_rate": 0.00043931141553407667, "loss": 5.8241, "mean_token_accuracy": 0.1887489527463913, "num_tokens": 54499081.0, "step": 21505 }, { "entropy": 6.161634206771851, "epoch": 2.482400461627236, "grad_norm": 0.99609375, "learning_rate": 0.0004392832228029672, "loss": 5.7967, "mean_token_accuracy": 0.1848980739712715, "num_tokens": 54511776.0, "step": 21510 }, { "entropy": 6.168097496032715, "epoch": 2.4829774956722446, "grad_norm": 0.99609375, "learning_rate": 0.00043925502454627327, "loss": 5.835, "mean_token_accuracy": 0.18515201210975646, "num_tokens": 54524784.0, "step": 21515 }, { "entropy": 6.2054120063781735, "epoch": 2.4835545297172534, "grad_norm": 1.0546875, "learning_rate": 0.0004392268207649431, "loss": 5.8878, "mean_token_accuracy": 0.177184621989727, "num_tokens": 54537028.0, "step": 21520 }, { "entropy": 6.310422897338867, "epoch": 2.484131563762262, "grad_norm": 1.8125, "learning_rate": 0.00043919861145992546, "loss": 6.0682, "mean_token_accuracy": 0.16663777828216553, "num_tokens": 54550889.0, "step": 21525 }, { "entropy": 6.25194239616394, "epoch": 2.4847085978072707, "grad_norm": 1.203125, "learning_rate": 0.000439170396632169, "loss": 5.9824, "mean_token_accuracy": 0.17062321603298186, "num_tokens": 54565218.0, "step": 21530 }, { "entropy": 6.218824434280395, "epoch": 2.485285631852279, "grad_norm": 0.94921875, "learning_rate": 0.0004391421762826229, "loss": 5.8584, "mean_token_accuracy": 0.177971813082695, "num_tokens": 54577622.0, "step": 21535 }, { "entropy": 6.178410625457763, "epoch": 2.485862665897288, "grad_norm": 1.1328125, "learning_rate": 0.0004391139504122362, "loss": 5.8539, "mean_token_accuracy": 0.1888299837708473, "num_tokens": 54590213.0, "step": 21540 }, { "entropy": 6.145999145507813, "epoch": 2.4864396999422964, "grad_norm": 1.34375, "learning_rate": 0.00043908571902195827, "loss": 5.8629, "mean_token_accuracy": 0.18371896594762802, "num_tokens": 54603615.0, "step": 21545 }, { "entropy": 6.193444538116455, "epoch": 2.4870167339873053, "grad_norm": 1.0078125, "learning_rate": 0.00043905748211273864, "loss": 5.8509, "mean_token_accuracy": 0.17773962914943695, "num_tokens": 54615924.0, "step": 21550 }, { "entropy": 6.248504543304444, "epoch": 2.4875937680323137, "grad_norm": 2.0, "learning_rate": 0.00043902923968552714, "loss": 5.8459, "mean_token_accuracy": 0.18016792088747025, "num_tokens": 54629184.0, "step": 21555 }, { "entropy": 6.171130847930908, "epoch": 2.4881708020773226, "grad_norm": 0.9296875, "learning_rate": 0.0004390009917412737, "loss": 5.9015, "mean_token_accuracy": 0.18237817287445068, "num_tokens": 54642669.0, "step": 21560 }, { "entropy": 6.189037704467774, "epoch": 2.4887478361223314, "grad_norm": 0.9609375, "learning_rate": 0.00043897273828092824, "loss": 5.8547, "mean_token_accuracy": 0.18548583984375, "num_tokens": 54655229.0, "step": 21565 }, { "entropy": 6.234196281433105, "epoch": 2.48932487016734, "grad_norm": 1.0, "learning_rate": 0.0004389444793054413, "loss": 5.9161, "mean_token_accuracy": 0.1780890628695488, "num_tokens": 54667516.0, "step": 21570 }, { "entropy": 6.133837509155273, "epoch": 2.4899019042123487, "grad_norm": 1.3515625, "learning_rate": 0.00043891621481576324, "loss": 5.8095, "mean_token_accuracy": 0.18189657479524612, "num_tokens": 54679832.0, "step": 21575 }, { "entropy": 6.081688690185547, "epoch": 2.490478938257357, "grad_norm": 1.8046875, "learning_rate": 0.0004388879448128446, "loss": 5.7079, "mean_token_accuracy": 0.1902725487947464, "num_tokens": 54693943.0, "step": 21580 }, { "entropy": 6.176182842254638, "epoch": 2.491055972302366, "grad_norm": 1.1640625, "learning_rate": 0.00043885966929763635, "loss": 5.8102, "mean_token_accuracy": 0.18683638870716096, "num_tokens": 54706404.0, "step": 21585 }, { "entropy": 6.168729639053344, "epoch": 2.4916330063473744, "grad_norm": 1.1640625, "learning_rate": 0.00043883138827108964, "loss": 5.8496, "mean_token_accuracy": 0.17861776649951935, "num_tokens": 54718323.0, "step": 21590 }, { "entropy": 6.206038904190064, "epoch": 2.4922100403923833, "grad_norm": 0.97265625, "learning_rate": 0.0004388031017341555, "loss": 5.9334, "mean_token_accuracy": 0.1766161561012268, "num_tokens": 54730128.0, "step": 21595 }, { "entropy": 6.1698990821838375, "epoch": 2.4927870744373917, "grad_norm": 1.03125, "learning_rate": 0.00043877480968778536, "loss": 5.8396, "mean_token_accuracy": 0.18942066431045532, "num_tokens": 54743437.0, "step": 21600 }, { "entropy": 6.120104265213013, "epoch": 2.4933641084824005, "grad_norm": 1.0390625, "learning_rate": 0.0004387465121329309, "loss": 5.9076, "mean_token_accuracy": 0.17566175311803817, "num_tokens": 54755573.0, "step": 21605 }, { "entropy": 6.2447713851928714, "epoch": 2.493941142527409, "grad_norm": 1.2734375, "learning_rate": 0.00043871820907054375, "loss": 5.9155, "mean_token_accuracy": 0.17744822949171066, "num_tokens": 54768071.0, "step": 21610 }, { "entropy": 6.28808274269104, "epoch": 2.494518176572418, "grad_norm": 0.9765625, "learning_rate": 0.00043868990050157617, "loss": 5.9116, "mean_token_accuracy": 0.17353134751319885, "num_tokens": 54782245.0, "step": 21615 }, { "entropy": 6.108926153182983, "epoch": 2.4950952106174267, "grad_norm": 0.96875, "learning_rate": 0.0004386615864269799, "loss": 5.7889, "mean_token_accuracy": 0.18992384821176528, "num_tokens": 54794335.0, "step": 21620 }, { "entropy": 6.127848196029663, "epoch": 2.495672244662435, "grad_norm": 1.046875, "learning_rate": 0.00043863326684770746, "loss": 5.8774, "mean_token_accuracy": 0.18150349855422973, "num_tokens": 54807015.0, "step": 21625 }, { "entropy": 6.187694263458252, "epoch": 2.4962492787074435, "grad_norm": 1.0, "learning_rate": 0.0004386049417647115, "loss": 5.7918, "mean_token_accuracy": 0.17833972126245498, "num_tokens": 54821278.0, "step": 21630 }, { "entropy": 6.247255516052246, "epoch": 2.4968263127524524, "grad_norm": 1.0078125, "learning_rate": 0.0004385766111789445, "loss": 5.9114, "mean_token_accuracy": 0.18119488060474395, "num_tokens": 54834905.0, "step": 21635 }, { "entropy": 6.1341376304626465, "epoch": 2.4974033467974612, "grad_norm": 1.09375, "learning_rate": 0.0004385482750913595, "loss": 5.8336, "mean_token_accuracy": 0.18655134439468385, "num_tokens": 54847597.0, "step": 21640 }, { "entropy": 6.106540012359619, "epoch": 2.4979803808424696, "grad_norm": 1.0234375, "learning_rate": 0.0004385199335029094, "loss": 5.7571, "mean_token_accuracy": 0.1906038284301758, "num_tokens": 54859747.0, "step": 21645 }, { "entropy": 6.140057563781738, "epoch": 2.4985574148874785, "grad_norm": 1.140625, "learning_rate": 0.00043849158641454767, "loss": 5.8761, "mean_token_accuracy": 0.17953258007764816, "num_tokens": 54873025.0, "step": 21650 }, { "entropy": 6.187953186035156, "epoch": 2.499134448932487, "grad_norm": 1.40625, "learning_rate": 0.00043846323382722765, "loss": 5.8184, "mean_token_accuracy": 0.18455153256654738, "num_tokens": 54884718.0, "step": 21655 }, { "entropy": 6.1051928997039795, "epoch": 2.499711482977496, "grad_norm": 0.99609375, "learning_rate": 0.00043843487574190285, "loss": 5.7548, "mean_token_accuracy": 0.18575444221496581, "num_tokens": 54896557.0, "step": 21660 }, { "entropy": 6.281343841552735, "epoch": 2.500288517022504, "grad_norm": 1.1796875, "learning_rate": 0.00043840651215952726, "loss": 5.9865, "mean_token_accuracy": 0.17045235633850098, "num_tokens": 54909608.0, "step": 21665 }, { "entropy": 6.247969722747802, "epoch": 2.500865551067513, "grad_norm": 0.96875, "learning_rate": 0.00043837814308105477, "loss": 5.8158, "mean_token_accuracy": 0.18350847959518432, "num_tokens": 54921794.0, "step": 21670 }, { "entropy": 6.228341293334961, "epoch": 2.5014425851125215, "grad_norm": 1.1171875, "learning_rate": 0.00043834976850743964, "loss": 5.9147, "mean_token_accuracy": 0.17788248509168625, "num_tokens": 54934527.0, "step": 21675 }, { "entropy": 6.1380973815917965, "epoch": 2.5020196191575304, "grad_norm": 1.0859375, "learning_rate": 0.0004383213884396361, "loss": 5.8231, "mean_token_accuracy": 0.18515776842832565, "num_tokens": 54947074.0, "step": 21680 }, { "entropy": 6.195892572402954, "epoch": 2.5025966532025388, "grad_norm": 1.078125, "learning_rate": 0.0004382930028785989, "loss": 5.8595, "mean_token_accuracy": 0.17820197939872742, "num_tokens": 54958677.0, "step": 21685 }, { "entropy": 6.123137474060059, "epoch": 2.5031736872475476, "grad_norm": 1.3125, "learning_rate": 0.0004382646118252826, "loss": 5.8025, "mean_token_accuracy": 0.1913789242506027, "num_tokens": 54972067.0, "step": 21690 }, { "entropy": 6.1770933151245115, "epoch": 2.5037507212925565, "grad_norm": 0.9453125, "learning_rate": 0.00043823621528064216, "loss": 5.8862, "mean_token_accuracy": 0.1763715460896492, "num_tokens": 54985010.0, "step": 21695 }, { "entropy": 6.2625343799591064, "epoch": 2.504327755337565, "grad_norm": 1.109375, "learning_rate": 0.00043820781324563276, "loss": 5.9181, "mean_token_accuracy": 0.17570398151874542, "num_tokens": 54998731.0, "step": 21700 }, { "entropy": 6.143558740615845, "epoch": 2.5049047893825733, "grad_norm": 0.9375, "learning_rate": 0.00043817940572120963, "loss": 5.7779, "mean_token_accuracy": 0.18513636738061906, "num_tokens": 55011288.0, "step": 21705 }, { "entropy": 6.144919776916504, "epoch": 2.505481823427582, "grad_norm": 1.046875, "learning_rate": 0.00043815099270832814, "loss": 5.8486, "mean_token_accuracy": 0.18193407505750656, "num_tokens": 55023718.0, "step": 21710 }, { "entropy": 6.1648200988769535, "epoch": 2.506058857472591, "grad_norm": 1.078125, "learning_rate": 0.00043812257420794415, "loss": 5.7996, "mean_token_accuracy": 0.18745406568050385, "num_tokens": 55036628.0, "step": 21715 }, { "entropy": 6.214187908172607, "epoch": 2.5066358915175995, "grad_norm": 0.984375, "learning_rate": 0.00043809415022101335, "loss": 5.9035, "mean_token_accuracy": 0.1827463150024414, "num_tokens": 55049765.0, "step": 21720 }, { "entropy": 6.14854588508606, "epoch": 2.5072129255626083, "grad_norm": 0.96875, "learning_rate": 0.0004380657207484919, "loss": 5.8145, "mean_token_accuracy": 0.18578870445489884, "num_tokens": 55061852.0, "step": 21725 }, { "entropy": 6.269407463073731, "epoch": 2.5077899596076167, "grad_norm": 0.9453125, "learning_rate": 0.00043803728579133586, "loss": 6.0257, "mean_token_accuracy": 0.17544178813695907, "num_tokens": 55074560.0, "step": 21730 }, { "entropy": 6.204534530639648, "epoch": 2.5083669936526256, "grad_norm": 0.984375, "learning_rate": 0.0004380088453505017, "loss": 5.8251, "mean_token_accuracy": 0.18425490707159042, "num_tokens": 55086886.0, "step": 21735 }, { "entropy": 6.162876081466675, "epoch": 2.508944027697634, "grad_norm": 1.2421875, "learning_rate": 0.00043798039942694603, "loss": 5.8532, "mean_token_accuracy": 0.176558955013752, "num_tokens": 55100503.0, "step": 21740 }, { "entropy": 6.199307155609131, "epoch": 2.509521061742643, "grad_norm": 0.9375, "learning_rate": 0.00043795194802162557, "loss": 5.7926, "mean_token_accuracy": 0.18185302764177322, "num_tokens": 55113212.0, "step": 21745 }, { "entropy": 6.3023333072662355, "epoch": 2.5100980957876513, "grad_norm": 1.3671875, "learning_rate": 0.0004379234911354973, "loss": 6.0092, "mean_token_accuracy": 0.16873298436403275, "num_tokens": 55127391.0, "step": 21750 }, { "entropy": 6.205758380889892, "epoch": 2.51067512983266, "grad_norm": 1.109375, "learning_rate": 0.00043789502876951834, "loss": 5.8793, "mean_token_accuracy": 0.17774643003940582, "num_tokens": 55139990.0, "step": 21755 }, { "entropy": 6.143463611602783, "epoch": 2.5112521638776686, "grad_norm": 1.1875, "learning_rate": 0.0004378665609246459, "loss": 5.7649, "mean_token_accuracy": 0.18519463241100312, "num_tokens": 55152472.0, "step": 21760 }, { "entropy": 6.227129077911377, "epoch": 2.5118291979226774, "grad_norm": 0.8671875, "learning_rate": 0.00043783808760183764, "loss": 5.8776, "mean_token_accuracy": 0.18210879415273667, "num_tokens": 55166342.0, "step": 21765 }, { "entropy": 6.232834911346435, "epoch": 2.5124062319676863, "grad_norm": 0.94140625, "learning_rate": 0.00043780960880205125, "loss": 5.8924, "mean_token_accuracy": 0.17831755429506302, "num_tokens": 55177925.0, "step": 21770 }, { "entropy": 6.187525033950806, "epoch": 2.5129832660126947, "grad_norm": 0.93359375, "learning_rate": 0.00043778112452624445, "loss": 5.8784, "mean_token_accuracy": 0.17896425426006318, "num_tokens": 55189179.0, "step": 21775 }, { "entropy": 6.270234394073486, "epoch": 2.513560300057703, "grad_norm": 0.98828125, "learning_rate": 0.00043775263477537546, "loss": 5.8999, "mean_token_accuracy": 0.17543237060308456, "num_tokens": 55202244.0, "step": 21780 }, { "entropy": 6.174876689910889, "epoch": 2.514137334102712, "grad_norm": 0.98046875, "learning_rate": 0.0004377241395504024, "loss": 5.8461, "mean_token_accuracy": 0.17749062180519104, "num_tokens": 55214545.0, "step": 21785 }, { "entropy": 6.173722791671753, "epoch": 2.514714368147721, "grad_norm": 1.1015625, "learning_rate": 0.0004376956388522837, "loss": 5.7967, "mean_token_accuracy": 0.1798494577407837, "num_tokens": 55227766.0, "step": 21790 }, { "entropy": 6.2526191711425785, "epoch": 2.5152914021927293, "grad_norm": 1.078125, "learning_rate": 0.0004376671326819781, "loss": 5.9369, "mean_token_accuracy": 0.1758306846022606, "num_tokens": 55239841.0, "step": 21795 }, { "entropy": 6.081368827819825, "epoch": 2.515868436237738, "grad_norm": 1.0546875, "learning_rate": 0.00043763862104044424, "loss": 5.7562, "mean_token_accuracy": 0.19104499667882918, "num_tokens": 55253440.0, "step": 21800 }, { "entropy": 6.237401914596558, "epoch": 2.5164454702827466, "grad_norm": 0.9375, "learning_rate": 0.00043761010392864114, "loss": 5.8854, "mean_token_accuracy": 0.17310586273670198, "num_tokens": 55264698.0, "step": 21805 }, { "entropy": 6.2173669815063475, "epoch": 2.5170225043277554, "grad_norm": 1.0390625, "learning_rate": 0.00043758158134752793, "loss": 5.8445, "mean_token_accuracy": 0.1770642429590225, "num_tokens": 55276923.0, "step": 21810 }, { "entropy": 6.206795644760132, "epoch": 2.517599538372764, "grad_norm": 0.9375, "learning_rate": 0.0004375530532980642, "loss": 5.9123, "mean_token_accuracy": 0.1775376632809639, "num_tokens": 55289774.0, "step": 21815 }, { "entropy": 6.196282768249512, "epoch": 2.5181765724177727, "grad_norm": 0.94140625, "learning_rate": 0.000437524519781209, "loss": 5.902, "mean_token_accuracy": 0.1796469047665596, "num_tokens": 55301877.0, "step": 21820 }, { "entropy": 6.160347890853882, "epoch": 2.5187536064627816, "grad_norm": 1.0, "learning_rate": 0.0004374959807979224, "loss": 5.859, "mean_token_accuracy": 0.18730694353580474, "num_tokens": 55314680.0, "step": 21825 }, { "entropy": 6.22357668876648, "epoch": 2.51933064050779, "grad_norm": 1.015625, "learning_rate": 0.0004374674363491642, "loss": 5.8695, "mean_token_accuracy": 0.17928709387779235, "num_tokens": 55326874.0, "step": 21830 }, { "entropy": 6.177434206008911, "epoch": 2.5199076745527984, "grad_norm": 1.1171875, "learning_rate": 0.00043743888643589453, "loss": 5.8762, "mean_token_accuracy": 0.17795808613300323, "num_tokens": 55339281.0, "step": 21835 }, { "entropy": 6.172960376739502, "epoch": 2.5204847085978073, "grad_norm": 0.96875, "learning_rate": 0.00043741033105907355, "loss": 5.86, "mean_token_accuracy": 0.18426252603530885, "num_tokens": 55351187.0, "step": 21840 }, { "entropy": 6.225103950500488, "epoch": 2.521061742642816, "grad_norm": 1.03125, "learning_rate": 0.0004373817702196618, "loss": 5.8494, "mean_token_accuracy": 0.18199699521064758, "num_tokens": 55365122.0, "step": 21845 }, { "entropy": 6.123576259613037, "epoch": 2.5216387766878245, "grad_norm": 1.0234375, "learning_rate": 0.00043735320391861986, "loss": 5.8673, "mean_token_accuracy": 0.17788007110357285, "num_tokens": 55376494.0, "step": 21850 }, { "entropy": 6.273983430862427, "epoch": 2.522215810732833, "grad_norm": 1.1953125, "learning_rate": 0.0004373246321569085, "loss": 5.903, "mean_token_accuracy": 0.18144610077142714, "num_tokens": 55388037.0, "step": 21855 }, { "entropy": 6.140970182418823, "epoch": 2.522792844777842, "grad_norm": 1.0234375, "learning_rate": 0.0004372960549354888, "loss": 5.813, "mean_token_accuracy": 0.1791406214237213, "num_tokens": 55401356.0, "step": 21860 }, { "entropy": 5.9759265899658205, "epoch": 2.5233698788228507, "grad_norm": 1.1328125, "learning_rate": 0.00043726747225532195, "loss": 5.6977, "mean_token_accuracy": 0.19044179767370223, "num_tokens": 55414332.0, "step": 21865 }, { "entropy": 6.219502973556518, "epoch": 2.523946912867859, "grad_norm": 0.953125, "learning_rate": 0.0004372388841173692, "loss": 5.8609, "mean_token_accuracy": 0.18201821446418762, "num_tokens": 55426886.0, "step": 21870 }, { "entropy": 6.246579217910766, "epoch": 2.524523946912868, "grad_norm": 1.34375, "learning_rate": 0.0004372102905225922, "loss": 5.8581, "mean_token_accuracy": 0.18200962692499162, "num_tokens": 55439688.0, "step": 21875 }, { "entropy": 6.119673347473144, "epoch": 2.5251009809578764, "grad_norm": 1.015625, "learning_rate": 0.00043718169147195275, "loss": 5.8156, "mean_token_accuracy": 0.18275847136974335, "num_tokens": 55451597.0, "step": 21880 }, { "entropy": 6.165056610107422, "epoch": 2.5256780150028852, "grad_norm": 0.9765625, "learning_rate": 0.00043715308696641255, "loss": 5.8293, "mean_token_accuracy": 0.17857772707939149, "num_tokens": 55463627.0, "step": 21885 }, { "entropy": 6.273014211654663, "epoch": 2.5262550490478937, "grad_norm": 0.9921875, "learning_rate": 0.0004371244770069338, "loss": 5.9275, "mean_token_accuracy": 0.17339976280927658, "num_tokens": 55477071.0, "step": 21890 }, { "entropy": 6.150373029708862, "epoch": 2.5268320830929025, "grad_norm": 1.140625, "learning_rate": 0.00043709586159447884, "loss": 5.8142, "mean_token_accuracy": 0.1759146958589554, "num_tokens": 55489338.0, "step": 21895 }, { "entropy": 6.1999053955078125, "epoch": 2.5274091171379114, "grad_norm": 1.0078125, "learning_rate": 0.00043706724073001017, "loss": 5.875, "mean_token_accuracy": 0.1795965000987053, "num_tokens": 55503770.0, "step": 21900 }, { "entropy": 6.170782470703125, "epoch": 2.52798615118292, "grad_norm": 1.03125, "learning_rate": 0.0004370386144144902, "loss": 5.8669, "mean_token_accuracy": 0.1774355113506317, "num_tokens": 55516832.0, "step": 21905 }, { "entropy": 6.276739454269409, "epoch": 2.5285631852279282, "grad_norm": 1.125, "learning_rate": 0.0004370099826488821, "loss": 5.8784, "mean_token_accuracy": 0.1805236369371414, "num_tokens": 55530280.0, "step": 21910 }, { "entropy": 6.0720977783203125, "epoch": 2.529140219272937, "grad_norm": 1.703125, "learning_rate": 0.0004369813454341486, "loss": 5.8016, "mean_token_accuracy": 0.18719504177570342, "num_tokens": 55542688.0, "step": 21915 }, { "entropy": 6.099076890945435, "epoch": 2.529717253317946, "grad_norm": 1.1796875, "learning_rate": 0.00043695270277125303, "loss": 5.818, "mean_token_accuracy": 0.18461127281188966, "num_tokens": 55555921.0, "step": 21920 }, { "entropy": 6.199017477035523, "epoch": 2.5302942873629544, "grad_norm": 1.109375, "learning_rate": 0.0004369240546611587, "loss": 5.8786, "mean_token_accuracy": 0.17888905256986617, "num_tokens": 55569667.0, "step": 21925 }, { "entropy": 6.230369281768799, "epoch": 2.5308713214079632, "grad_norm": 1.0, "learning_rate": 0.00043689540110482933, "loss": 5.8684, "mean_token_accuracy": 0.1831066742539406, "num_tokens": 55582170.0, "step": 21930 }, { "entropy": 6.195162010192871, "epoch": 2.5314483554529716, "grad_norm": 1.078125, "learning_rate": 0.0004368667421032285, "loss": 5.906, "mean_token_accuracy": 0.17713675647974014, "num_tokens": 55595170.0, "step": 21935 }, { "entropy": 6.225862598419189, "epoch": 2.5320253894979805, "grad_norm": 0.92578125, "learning_rate": 0.00043683807765732013, "loss": 5.8582, "mean_token_accuracy": 0.18258154690265654, "num_tokens": 55606794.0, "step": 21940 }, { "entropy": 6.181500577926636, "epoch": 2.532602423542989, "grad_norm": 1.0859375, "learning_rate": 0.00043680940776806847, "loss": 5.8281, "mean_token_accuracy": 0.18431926667690277, "num_tokens": 55619423.0, "step": 21945 }, { "entropy": 6.199829006195069, "epoch": 2.533179457587998, "grad_norm": 0.98828125, "learning_rate": 0.0004367807324364378, "loss": 5.8363, "mean_token_accuracy": 0.18326984196901322, "num_tokens": 55630934.0, "step": 21950 }, { "entropy": 6.1872265338897705, "epoch": 2.533756491633006, "grad_norm": 0.9921875, "learning_rate": 0.00043675205166339247, "loss": 5.8933, "mean_token_accuracy": 0.17747756987810134, "num_tokens": 55643781.0, "step": 21955 }, { "entropy": 6.236071825027466, "epoch": 2.534333525678015, "grad_norm": 1.015625, "learning_rate": 0.0004367233654498973, "loss": 5.9842, "mean_token_accuracy": 0.17563940733671188, "num_tokens": 55655564.0, "step": 21960 }, { "entropy": 6.198457717895508, "epoch": 2.5349105597230235, "grad_norm": 0.98046875, "learning_rate": 0.0004366946737969171, "loss": 5.8805, "mean_token_accuracy": 0.17978014647960663, "num_tokens": 55667408.0, "step": 21965 }, { "entropy": 6.210017681121826, "epoch": 2.5354875937680323, "grad_norm": 1.0546875, "learning_rate": 0.0004366659767054168, "loss": 5.7694, "mean_token_accuracy": 0.18559402078390122, "num_tokens": 55680876.0, "step": 21970 }, { "entropy": 6.153652334213257, "epoch": 2.536064627813041, "grad_norm": 1.359375, "learning_rate": 0.00043663727417636166, "loss": 5.8364, "mean_token_accuracy": 0.17415307611227035, "num_tokens": 55694639.0, "step": 21975 }, { "entropy": 6.135266590118408, "epoch": 2.5366416618580496, "grad_norm": 1.0390625, "learning_rate": 0.0004366085662107171, "loss": 5.8601, "mean_token_accuracy": 0.18313330560922622, "num_tokens": 55707221.0, "step": 21980 }, { "entropy": 6.238986444473267, "epoch": 2.537218695903058, "grad_norm": 0.96875, "learning_rate": 0.00043657985280944875, "loss": 5.8111, "mean_token_accuracy": 0.1860315188765526, "num_tokens": 55720750.0, "step": 21985 }, { "entropy": 6.194635057449341, "epoch": 2.537795729948067, "grad_norm": 0.93359375, "learning_rate": 0.0004365511339735223, "loss": 5.8865, "mean_token_accuracy": 0.1789993092417717, "num_tokens": 55732550.0, "step": 21990 }, { "entropy": 6.16865177154541, "epoch": 2.5383727639930758, "grad_norm": 1.109375, "learning_rate": 0.0004365224097039036, "loss": 5.8488, "mean_token_accuracy": 0.18228582441806793, "num_tokens": 55745468.0, "step": 21995 }, { "entropy": 6.109445858001709, "epoch": 2.538949798038084, "grad_norm": 1.03125, "learning_rate": 0.000436493680001559, "loss": 5.8489, "mean_token_accuracy": 0.18128757923841476, "num_tokens": 55757193.0, "step": 22000 }, { "entropy": 6.194368457794189, "epoch": 2.539526832083093, "grad_norm": 0.9453125, "learning_rate": 0.00043646494486745464, "loss": 5.8437, "mean_token_accuracy": 0.18295118808746338, "num_tokens": 55770185.0, "step": 22005 }, { "entropy": 6.221388339996338, "epoch": 2.5401038661281015, "grad_norm": 1.03125, "learning_rate": 0.0004364362043025571, "loss": 5.8603, "mean_token_accuracy": 0.17937735170125962, "num_tokens": 55782204.0, "step": 22010 }, { "entropy": 6.110798168182373, "epoch": 2.5406809001731103, "grad_norm": 0.91796875, "learning_rate": 0.00043640745830783297, "loss": 5.7682, "mean_token_accuracy": 0.1868910536170006, "num_tokens": 55795077.0, "step": 22015 }, { "entropy": 6.232817268371582, "epoch": 2.5412579342181187, "grad_norm": 0.98828125, "learning_rate": 0.0004363787068842491, "loss": 5.8717, "mean_token_accuracy": 0.18311762511730195, "num_tokens": 55808876.0, "step": 22020 }, { "entropy": 6.23801622390747, "epoch": 2.5418349682631276, "grad_norm": 1.078125, "learning_rate": 0.0004363499500327727, "loss": 5.9718, "mean_token_accuracy": 0.17709683030843734, "num_tokens": 55822861.0, "step": 22025 }, { "entropy": 6.223509120941162, "epoch": 2.542412002308136, "grad_norm": 0.9921875, "learning_rate": 0.00043632118775437085, "loss": 5.8767, "mean_token_accuracy": 0.18123848587274552, "num_tokens": 55835523.0, "step": 22030 }, { "entropy": 6.218843221664429, "epoch": 2.542989036353145, "grad_norm": 0.9453125, "learning_rate": 0.00043629242005001096, "loss": 5.9086, "mean_token_accuracy": 0.17581363320350646, "num_tokens": 55848377.0, "step": 22035 }, { "entropy": 6.2499762058258055, "epoch": 2.5435660703981533, "grad_norm": 0.92578125, "learning_rate": 0.0004362636469206607, "loss": 5.9474, "mean_token_accuracy": 0.1790979251265526, "num_tokens": 55862074.0, "step": 22040 }, { "entropy": 6.1936921119689945, "epoch": 2.544143104443162, "grad_norm": 0.9609375, "learning_rate": 0.0004362348683672877, "loss": 5.8437, "mean_token_accuracy": 0.17577889263629914, "num_tokens": 55874816.0, "step": 22045 }, { "entropy": 6.256429624557495, "epoch": 2.544720138488171, "grad_norm": 1.015625, "learning_rate": 0.0004362060843908601, "loss": 5.9163, "mean_token_accuracy": 0.17813948839902877, "num_tokens": 55887424.0, "step": 22050 }, { "entropy": 6.168146419525146, "epoch": 2.5452971725331794, "grad_norm": 0.94140625, "learning_rate": 0.0004361772949923458, "loss": 5.8821, "mean_token_accuracy": 0.18185821771621705, "num_tokens": 55900532.0, "step": 22055 }, { "entropy": 6.167166423797608, "epoch": 2.545874206578188, "grad_norm": 0.96875, "learning_rate": 0.0004361485001727132, "loss": 5.8475, "mean_token_accuracy": 0.18121427297592163, "num_tokens": 55912599.0, "step": 22060 }, { "entropy": 6.209183263778686, "epoch": 2.5464512406231967, "grad_norm": 0.91796875, "learning_rate": 0.000436119699932931, "loss": 5.8887, "mean_token_accuracy": 0.1795339912176132, "num_tokens": 55925012.0, "step": 22065 }, { "entropy": 6.117090129852295, "epoch": 2.5470282746682056, "grad_norm": 0.9296875, "learning_rate": 0.00043609089427396763, "loss": 5.8296, "mean_token_accuracy": 0.18406159281730652, "num_tokens": 55938058.0, "step": 22070 }, { "entropy": 6.221741676330566, "epoch": 2.547605308713214, "grad_norm": 1.0390625, "learning_rate": 0.00043606208319679215, "loss": 5.9764, "mean_token_accuracy": 0.17183651328086852, "num_tokens": 55951439.0, "step": 22075 }, { "entropy": 6.1748284816741945, "epoch": 2.548182342758223, "grad_norm": 1.2109375, "learning_rate": 0.0004360332667023734, "loss": 5.8049, "mean_token_accuracy": 0.18733201473951339, "num_tokens": 55964583.0, "step": 22080 }, { "entropy": 6.099901103973389, "epoch": 2.5487593768032313, "grad_norm": 0.9453125, "learning_rate": 0.00043600444479168084, "loss": 5.7426, "mean_token_accuracy": 0.194771471619606, "num_tokens": 55978072.0, "step": 22085 }, { "entropy": 6.18526668548584, "epoch": 2.54933641084824, "grad_norm": 1.0078125, "learning_rate": 0.0004359756174656836, "loss": 5.8195, "mean_token_accuracy": 0.18424388766288757, "num_tokens": 55990278.0, "step": 22090 }, { "entropy": 6.171966314315796, "epoch": 2.5499134448932486, "grad_norm": 1.046875, "learning_rate": 0.00043594678472535153, "loss": 5.8932, "mean_token_accuracy": 0.17368784546852112, "num_tokens": 56003303.0, "step": 22095 }, { "entropy": 6.223716783523559, "epoch": 2.5504904789382574, "grad_norm": 0.984375, "learning_rate": 0.00043591794657165425, "loss": 5.8501, "mean_token_accuracy": 0.1813538357615471, "num_tokens": 56015131.0, "step": 22100 }, { "entropy": 6.114982843399048, "epoch": 2.5510675129832663, "grad_norm": 0.94921875, "learning_rate": 0.0004358891030055617, "loss": 5.8066, "mean_token_accuracy": 0.1844347357749939, "num_tokens": 56027804.0, "step": 22105 }, { "entropy": 6.237184619903564, "epoch": 2.5516445470282747, "grad_norm": 1.234375, "learning_rate": 0.0004358602540280443, "loss": 5.9629, "mean_token_accuracy": 0.17398676723241807, "num_tokens": 56040485.0, "step": 22110 }, { "entropy": 6.236841106414795, "epoch": 2.552221581073283, "grad_norm": 0.93359375, "learning_rate": 0.00043583139964007203, "loss": 5.86, "mean_token_accuracy": 0.1779933124780655, "num_tokens": 56052091.0, "step": 22115 }, { "entropy": 6.146714210510254, "epoch": 2.552798615118292, "grad_norm": 1.0390625, "learning_rate": 0.00043580253984261554, "loss": 5.7983, "mean_token_accuracy": 0.18871628493070602, "num_tokens": 56063291.0, "step": 22120 }, { "entropy": 6.126740550994873, "epoch": 2.553375649163301, "grad_norm": 0.93359375, "learning_rate": 0.00043577367463664546, "loss": 5.8542, "mean_token_accuracy": 0.17438943684101105, "num_tokens": 56074219.0, "step": 22125 }, { "entropy": 6.120125579833984, "epoch": 2.5539526832083093, "grad_norm": 0.95703125, "learning_rate": 0.0004357448040231327, "loss": 5.8161, "mean_token_accuracy": 0.17922122031450272, "num_tokens": 56088126.0, "step": 22130 }, { "entropy": 6.262707757949829, "epoch": 2.5545297172533177, "grad_norm": 0.92578125, "learning_rate": 0.0004357159280030483, "loss": 5.907, "mean_token_accuracy": 0.17797035127878189, "num_tokens": 56101686.0, "step": 22135 }, { "entropy": 6.170461416244507, "epoch": 2.5551067512983265, "grad_norm": 0.9140625, "learning_rate": 0.0004356870465773635, "loss": 5.9057, "mean_token_accuracy": 0.17853282690048217, "num_tokens": 56114605.0, "step": 22140 }, { "entropy": 6.090783596038818, "epoch": 2.5556837853433354, "grad_norm": 1.015625, "learning_rate": 0.00043565815974704974, "loss": 5.7609, "mean_token_accuracy": 0.18233157098293304, "num_tokens": 56127955.0, "step": 22145 }, { "entropy": 6.26212511062622, "epoch": 2.556260819388344, "grad_norm": 0.96875, "learning_rate": 0.00043562926751307857, "loss": 5.9817, "mean_token_accuracy": 0.17383843958377837, "num_tokens": 56140691.0, "step": 22150 }, { "entropy": 6.21481671333313, "epoch": 2.5568378534333527, "grad_norm": 0.90234375, "learning_rate": 0.00043560036987642177, "loss": 5.844, "mean_token_accuracy": 0.18300168365240096, "num_tokens": 56153815.0, "step": 22155 }, { "entropy": 6.226272869110107, "epoch": 2.557414887478361, "grad_norm": 0.94921875, "learning_rate": 0.00043557146683805134, "loss": 5.8628, "mean_token_accuracy": 0.18471735417842866, "num_tokens": 56167186.0, "step": 22160 }, { "entropy": 6.157123613357544, "epoch": 2.55799192152337, "grad_norm": 1.0546875, "learning_rate": 0.0004355425583989393, "loss": 5.8508, "mean_token_accuracy": 0.18059379905462264, "num_tokens": 56179307.0, "step": 22165 }, { "entropy": 6.2211833000183105, "epoch": 2.5585689555683784, "grad_norm": 0.875, "learning_rate": 0.00043551364456005816, "loss": 5.8833, "mean_token_accuracy": 0.17549400478601457, "num_tokens": 56191398.0, "step": 22170 }, { "entropy": 6.131880474090576, "epoch": 2.5591459896133872, "grad_norm": 0.921875, "learning_rate": 0.00043548472532238015, "loss": 5.7801, "mean_token_accuracy": 0.1897474303841591, "num_tokens": 56203871.0, "step": 22175 }, { "entropy": 6.11757001876831, "epoch": 2.559723023658396, "grad_norm": 1.1796875, "learning_rate": 0.00043545580068687836, "loss": 5.8255, "mean_token_accuracy": 0.17875247895717622, "num_tokens": 56215262.0, "step": 22180 }, { "entropy": 6.214519453048706, "epoch": 2.5603000577034045, "grad_norm": 0.8671875, "learning_rate": 0.0004354268706545252, "loss": 5.8846, "mean_token_accuracy": 0.18168828189373015, "num_tokens": 56230190.0, "step": 22185 }, { "entropy": 6.1590415954589846, "epoch": 2.560877091748413, "grad_norm": 0.87890625, "learning_rate": 0.00043539793522629405, "loss": 5.7857, "mean_token_accuracy": 0.18879222124814987, "num_tokens": 56243841.0, "step": 22190 }, { "entropy": 6.17527403831482, "epoch": 2.561454125793422, "grad_norm": 1.046875, "learning_rate": 0.00043536899440315796, "loss": 5.858, "mean_token_accuracy": 0.18398841917514802, "num_tokens": 56257500.0, "step": 22195 }, { "entropy": 6.1491899490356445, "epoch": 2.5620311598384307, "grad_norm": 0.9765625, "learning_rate": 0.0004353400481860904, "loss": 5.8153, "mean_token_accuracy": 0.1786172717809677, "num_tokens": 56269732.0, "step": 22200 }, { "entropy": 6.237949991226197, "epoch": 2.562608193883439, "grad_norm": 1.1484375, "learning_rate": 0.00043531109657606504, "loss": 5.8928, "mean_token_accuracy": 0.17821228951215745, "num_tokens": 56283192.0, "step": 22205 }, { "entropy": 6.160229682922363, "epoch": 2.563185227928448, "grad_norm": 1.0390625, "learning_rate": 0.0004352821395740555, "loss": 5.8182, "mean_token_accuracy": 0.17565051317214966, "num_tokens": 56296312.0, "step": 22210 }, { "entropy": 6.200014877319336, "epoch": 2.5637622619734564, "grad_norm": 1.015625, "learning_rate": 0.0004352531771810359, "loss": 5.8773, "mean_token_accuracy": 0.18192670196294786, "num_tokens": 56309964.0, "step": 22215 }, { "entropy": 6.1748268604278564, "epoch": 2.564339296018465, "grad_norm": 0.953125, "learning_rate": 0.0004352242093979802, "loss": 5.8909, "mean_token_accuracy": 0.18217986822128296, "num_tokens": 56324002.0, "step": 22220 }, { "entropy": 6.218401384353638, "epoch": 2.5649163300634736, "grad_norm": 0.9375, "learning_rate": 0.0004351952362258628, "loss": 5.8966, "mean_token_accuracy": 0.17519856989383698, "num_tokens": 56336339.0, "step": 22225 }, { "entropy": 6.157708406448364, "epoch": 2.5654933641084825, "grad_norm": 0.98046875, "learning_rate": 0.00043516625766565825, "loss": 5.8763, "mean_token_accuracy": 0.18050243854522705, "num_tokens": 56347819.0, "step": 22230 }, { "entropy": 6.197275638580322, "epoch": 2.566070398153491, "grad_norm": 0.94921875, "learning_rate": 0.0004351372737183412, "loss": 5.8415, "mean_token_accuracy": 0.17831179946660997, "num_tokens": 56360764.0, "step": 22235 }, { "entropy": 6.172028303146362, "epoch": 2.5666474321985, "grad_norm": 0.9453125, "learning_rate": 0.0004351082843848865, "loss": 5.8349, "mean_token_accuracy": 0.17641243785619737, "num_tokens": 56372731.0, "step": 22240 }, { "entropy": 6.195551347732544, "epoch": 2.567224466243508, "grad_norm": 0.953125, "learning_rate": 0.00043507928966626916, "loss": 5.8413, "mean_token_accuracy": 0.18241804391145705, "num_tokens": 56385650.0, "step": 22245 }, { "entropy": 6.203982734680176, "epoch": 2.567801500288517, "grad_norm": 1.921875, "learning_rate": 0.0004350502895634644, "loss": 5.8601, "mean_token_accuracy": 0.184727743268013, "num_tokens": 56397076.0, "step": 22250 }, { "entropy": 6.13416485786438, "epoch": 2.568378534333526, "grad_norm": 0.91796875, "learning_rate": 0.0004350212840774476, "loss": 5.803, "mean_token_accuracy": 0.18511220961809158, "num_tokens": 56409779.0, "step": 22255 }, { "entropy": 6.203754043579101, "epoch": 2.5689555683785343, "grad_norm": 1.015625, "learning_rate": 0.00043499227320919456, "loss": 5.903, "mean_token_accuracy": 0.1732098087668419, "num_tokens": 56423204.0, "step": 22260 }, { "entropy": 6.177084875106812, "epoch": 2.5695326024235428, "grad_norm": 0.953125, "learning_rate": 0.00043496325695968076, "loss": 5.9169, "mean_token_accuracy": 0.17664153426885604, "num_tokens": 56436379.0, "step": 22265 }, { "entropy": 6.204816055297852, "epoch": 2.5701096364685516, "grad_norm": 1.0078125, "learning_rate": 0.0004349342353298823, "loss": 5.8336, "mean_token_accuracy": 0.18492823094129562, "num_tokens": 56449558.0, "step": 22270 }, { "entropy": 6.212637662887573, "epoch": 2.5706866705135605, "grad_norm": 0.95703125, "learning_rate": 0.0004349052083207753, "loss": 5.8662, "mean_token_accuracy": 0.17576610296964645, "num_tokens": 56463541.0, "step": 22275 }, { "entropy": 6.291454124450683, "epoch": 2.571263704558569, "grad_norm": 1.0, "learning_rate": 0.000434876175933336, "loss": 5.9757, "mean_token_accuracy": 0.1727263242006302, "num_tokens": 56476849.0, "step": 22280 }, { "entropy": 6.142795372009277, "epoch": 2.5718407386035778, "grad_norm": 0.89453125, "learning_rate": 0.00043484713816854093, "loss": 5.8459, "mean_token_accuracy": 0.17979540526866913, "num_tokens": 56490089.0, "step": 22285 }, { "entropy": 6.150353002548218, "epoch": 2.572417772648586, "grad_norm": 1.0625, "learning_rate": 0.0004348180950273668, "loss": 5.7761, "mean_token_accuracy": 0.1880112811923027, "num_tokens": 56501392.0, "step": 22290 }, { "entropy": 6.104298543930054, "epoch": 2.572994806693595, "grad_norm": 1.140625, "learning_rate": 0.0004347890465107905, "loss": 5.7734, "mean_token_accuracy": 0.18166673332452773, "num_tokens": 56513573.0, "step": 22295 }, { "entropy": 6.171061754226685, "epoch": 2.5735718407386035, "grad_norm": 1.0078125, "learning_rate": 0.00043475999261978894, "loss": 5.8748, "mean_token_accuracy": 0.17986850291490555, "num_tokens": 56526762.0, "step": 22300 }, { "entropy": 6.133188247680664, "epoch": 2.5741488747836123, "grad_norm": 0.9296875, "learning_rate": 0.0004347309333553393, "loss": 5.8224, "mean_token_accuracy": 0.1850934535264969, "num_tokens": 56538264.0, "step": 22305 }, { "entropy": 6.233757019042969, "epoch": 2.5747259088286207, "grad_norm": 0.97265625, "learning_rate": 0.00043470186871841915, "loss": 5.9173, "mean_token_accuracy": 0.16918342858552932, "num_tokens": 56550296.0, "step": 22310 }, { "entropy": 6.166134834289551, "epoch": 2.5753029428736296, "grad_norm": 1.0, "learning_rate": 0.000434672798710006, "loss": 5.8666, "mean_token_accuracy": 0.1760929062962532, "num_tokens": 56563542.0, "step": 22315 }, { "entropy": 6.139899110794067, "epoch": 2.575879976918638, "grad_norm": 1.0234375, "learning_rate": 0.00043464372333107756, "loss": 5.8291, "mean_token_accuracy": 0.1866592586040497, "num_tokens": 56576992.0, "step": 22320 }, { "entropy": 6.206593036651611, "epoch": 2.576457010963647, "grad_norm": 1.171875, "learning_rate": 0.00043461464258261174, "loss": 5.8115, "mean_token_accuracy": 0.18988906890153884, "num_tokens": 56589271.0, "step": 22325 }, { "entropy": 5.979550552368164, "epoch": 2.5770340450086557, "grad_norm": 1.140625, "learning_rate": 0.0004345855564655867, "loss": 5.5526, "mean_token_accuracy": 0.20181859880685807, "num_tokens": 56600796.0, "step": 22330 }, { "entropy": 6.100833749771118, "epoch": 2.577611079053664, "grad_norm": 2.015625, "learning_rate": 0.00043455646498098075, "loss": 5.7927, "mean_token_accuracy": 0.18895177245140077, "num_tokens": 56613327.0, "step": 22335 }, { "entropy": 6.1338671207427975, "epoch": 2.5781881130986726, "grad_norm": 0.953125, "learning_rate": 0.00043452736812977236, "loss": 5.8321, "mean_token_accuracy": 0.18056489527225494, "num_tokens": 56626554.0, "step": 22340 }, { "entropy": 6.23466854095459, "epoch": 2.5787651471436814, "grad_norm": 0.953125, "learning_rate": 0.0004344982659129402, "loss": 5.859, "mean_token_accuracy": 0.1847481310367584, "num_tokens": 56639960.0, "step": 22345 }, { "entropy": 6.136874103546143, "epoch": 2.5793421811886903, "grad_norm": 0.98046875, "learning_rate": 0.0004344691583314631, "loss": 5.8237, "mean_token_accuracy": 0.18483690321445465, "num_tokens": 56651330.0, "step": 22350 }, { "entropy": 6.215026140213013, "epoch": 2.5799192152336987, "grad_norm": 1.140625, "learning_rate": 0.00043444004538632005, "loss": 5.9473, "mean_token_accuracy": 0.18039728254079818, "num_tokens": 56664359.0, "step": 22355 }, { "entropy": 6.193694114685059, "epoch": 2.5804962492787076, "grad_norm": 1.0390625, "learning_rate": 0.00043441092707849024, "loss": 5.8498, "mean_token_accuracy": 0.1780017077922821, "num_tokens": 56676095.0, "step": 22360 }, { "entropy": 6.206061744689942, "epoch": 2.581073283323716, "grad_norm": 0.98046875, "learning_rate": 0.00043438180340895315, "loss": 5.9102, "mean_token_accuracy": 0.17930631786584855, "num_tokens": 56689918.0, "step": 22365 }, { "entropy": 6.277228593826294, "epoch": 2.581650317368725, "grad_norm": 0.9765625, "learning_rate": 0.00043435267437868825, "loss": 5.9054, "mean_token_accuracy": 0.18055343627929688, "num_tokens": 56702308.0, "step": 22370 }, { "entropy": 6.1466456890106205, "epoch": 2.5822273514137333, "grad_norm": 0.953125, "learning_rate": 0.0004343235399886753, "loss": 5.8509, "mean_token_accuracy": 0.18117641508579255, "num_tokens": 56713928.0, "step": 22375 }, { "entropy": 6.232672452926636, "epoch": 2.582804385458742, "grad_norm": 1.203125, "learning_rate": 0.0004342944002398942, "loss": 5.9054, "mean_token_accuracy": 0.18088122457265854, "num_tokens": 56727065.0, "step": 22380 }, { "entropy": 6.162808561325074, "epoch": 2.583381419503751, "grad_norm": 1.0703125, "learning_rate": 0.0004342652551333251, "loss": 5.8572, "mean_token_accuracy": 0.18189468681812287, "num_tokens": 56739517.0, "step": 22385 }, { "entropy": 6.158969783782959, "epoch": 2.5839584535487594, "grad_norm": 1.953125, "learning_rate": 0.0004342361046699482, "loss": 5.8515, "mean_token_accuracy": 0.17724740207195283, "num_tokens": 56753044.0, "step": 22390 }, { "entropy": 6.177622509002686, "epoch": 2.584535487593768, "grad_norm": 1.0546875, "learning_rate": 0.0004342069488507441, "loss": 5.83, "mean_token_accuracy": 0.17820962965488435, "num_tokens": 56765500.0, "step": 22395 }, { "entropy": 6.2537233352661135, "epoch": 2.5851125216387767, "grad_norm": 0.93359375, "learning_rate": 0.0004341777876766933, "loss": 5.923, "mean_token_accuracy": 0.17215094119310378, "num_tokens": 56777895.0, "step": 22400 }, { "entropy": 6.206136703491211, "epoch": 2.5856895556837856, "grad_norm": 1.0703125, "learning_rate": 0.0004341486211487767, "loss": 5.7942, "mean_token_accuracy": 0.18706935048103332, "num_tokens": 56791523.0, "step": 22405 }, { "entropy": 6.158300065994263, "epoch": 2.586266589728794, "grad_norm": 0.9765625, "learning_rate": 0.0004341194492679753, "loss": 5.8933, "mean_token_accuracy": 0.17521030008792876, "num_tokens": 56803490.0, "step": 22410 }, { "entropy": 6.24560317993164, "epoch": 2.5868436237738024, "grad_norm": 1.0390625, "learning_rate": 0.00043409027203527016, "loss": 5.8913, "mean_token_accuracy": 0.174959959089756, "num_tokens": 56814398.0, "step": 22415 }, { "entropy": 6.102668190002442, "epoch": 2.5874206578188113, "grad_norm": 1.3203125, "learning_rate": 0.00043406108945164283, "loss": 5.8111, "mean_token_accuracy": 0.18775819838047028, "num_tokens": 56826591.0, "step": 22420 }, { "entropy": 6.122554016113281, "epoch": 2.58799769186382, "grad_norm": 1.0390625, "learning_rate": 0.00043403190151807474, "loss": 5.8244, "mean_token_accuracy": 0.17712070196866989, "num_tokens": 56839208.0, "step": 22425 }, { "entropy": 6.1992920398712155, "epoch": 2.5885747259088285, "grad_norm": 1.0859375, "learning_rate": 0.0004340027082355477, "loss": 5.8622, "mean_token_accuracy": 0.17706735134124757, "num_tokens": 56852211.0, "step": 22430 }, { "entropy": 6.122121286392212, "epoch": 2.5891517599538374, "grad_norm": 0.95703125, "learning_rate": 0.0004339735096050434, "loss": 5.8376, "mean_token_accuracy": 0.18258956223726272, "num_tokens": 56864691.0, "step": 22435 }, { "entropy": 6.20952353477478, "epoch": 2.589728793998846, "grad_norm": 0.953125, "learning_rate": 0.0004339443056275443, "loss": 5.7929, "mean_token_accuracy": 0.18961059153079987, "num_tokens": 56877473.0, "step": 22440 }, { "entropy": 6.247283840179444, "epoch": 2.5903058280438547, "grad_norm": 0.98828125, "learning_rate": 0.00043391509630403224, "loss": 5.9191, "mean_token_accuracy": 0.18167265951633454, "num_tokens": 56889852.0, "step": 22445 }, { "entropy": 6.231794357299805, "epoch": 2.590882862088863, "grad_norm": 1.015625, "learning_rate": 0.00043388588163549, "loss": 5.9432, "mean_token_accuracy": 0.17553926706314088, "num_tokens": 56901882.0, "step": 22450 }, { "entropy": 6.25377631187439, "epoch": 2.591459896133872, "grad_norm": 1.046875, "learning_rate": 0.00043385666162289995, "loss": 5.8584, "mean_token_accuracy": 0.18067149221897125, "num_tokens": 56913212.0, "step": 22455 }, { "entropy": 6.176819562911987, "epoch": 2.592036930178881, "grad_norm": 0.96875, "learning_rate": 0.00043382743626724506, "loss": 5.8979, "mean_token_accuracy": 0.17613870203495025, "num_tokens": 56924490.0, "step": 22460 }, { "entropy": 6.216876792907715, "epoch": 2.5926139642238892, "grad_norm": 1.046875, "learning_rate": 0.0004337982055695082, "loss": 5.9621, "mean_token_accuracy": 0.17417846173048018, "num_tokens": 56937558.0, "step": 22465 }, { "entropy": 6.149514627456665, "epoch": 2.5931909982688977, "grad_norm": 0.91796875, "learning_rate": 0.0004337689695306726, "loss": 5.8374, "mean_token_accuracy": 0.18988426476716996, "num_tokens": 56950544.0, "step": 22470 }, { "entropy": 6.235901975631714, "epoch": 2.5937680323139065, "grad_norm": 1.0703125, "learning_rate": 0.0004337397281517215, "loss": 5.87, "mean_token_accuracy": 0.17309301793575288, "num_tokens": 56962972.0, "step": 22475 }, { "entropy": 6.211310338973999, "epoch": 2.5943450663589154, "grad_norm": 1.015625, "learning_rate": 0.0004337104814336386, "loss": 5.847, "mean_token_accuracy": 0.17467414140701293, "num_tokens": 56975972.0, "step": 22480 }, { "entropy": 6.277341842651367, "epoch": 2.594922100403924, "grad_norm": 1.234375, "learning_rate": 0.0004336812293774075, "loss": 5.9832, "mean_token_accuracy": 0.17419557720422746, "num_tokens": 56989106.0, "step": 22485 }, { "entropy": 6.155555486679077, "epoch": 2.595499134448932, "grad_norm": 1.0234375, "learning_rate": 0.00043365197198401195, "loss": 5.856, "mean_token_accuracy": 0.17909400910139084, "num_tokens": 57002544.0, "step": 22490 }, { "entropy": 6.2688497543334964, "epoch": 2.596076168493941, "grad_norm": 1.0, "learning_rate": 0.0004336227092544362, "loss": 5.9188, "mean_token_accuracy": 0.17357267439365387, "num_tokens": 57016526.0, "step": 22495 }, { "entropy": 6.294514799118042, "epoch": 2.59665320253895, "grad_norm": 1.21875, "learning_rate": 0.0004335934411896644, "loss": 5.9078, "mean_token_accuracy": 0.1818125218153, "num_tokens": 57029817.0, "step": 22500 }, { "entropy": 6.10988826751709, "epoch": 2.5972302365839584, "grad_norm": 0.9375, "learning_rate": 0.000433564167790681, "loss": 5.8322, "mean_token_accuracy": 0.18750934898853303, "num_tokens": 57042189.0, "step": 22505 }, { "entropy": 6.152314138412476, "epoch": 2.597807270628967, "grad_norm": 0.97265625, "learning_rate": 0.0004335348890584706, "loss": 5.8396, "mean_token_accuracy": 0.18023107200860977, "num_tokens": 57054297.0, "step": 22510 }, { "entropy": 6.193462610244751, "epoch": 2.5983843046739756, "grad_norm": 0.98046875, "learning_rate": 0.00043350560499401793, "loss": 5.8282, "mean_token_accuracy": 0.1868427127599716, "num_tokens": 57067530.0, "step": 22515 }, { "entropy": 6.210541725158691, "epoch": 2.5989613387189845, "grad_norm": 0.96875, "learning_rate": 0.0004334763155983079, "loss": 5.9267, "mean_token_accuracy": 0.17492200434207916, "num_tokens": 57080877.0, "step": 22520 }, { "entropy": 6.236031532287598, "epoch": 2.599538372763993, "grad_norm": 1.046875, "learning_rate": 0.00043344702087232584, "loss": 5.8711, "mean_token_accuracy": 0.18254067599773408, "num_tokens": 57092716.0, "step": 22525 }, { "entropy": 6.0933469295501705, "epoch": 2.6001154068090018, "grad_norm": 1.1015625, "learning_rate": 0.0004334177208170569, "loss": 5.8306, "mean_token_accuracy": 0.1827499106526375, "num_tokens": 57107335.0, "step": 22530 }, { "entropy": 6.215653657913208, "epoch": 2.6006924408540106, "grad_norm": 0.93359375, "learning_rate": 0.00043338841543348654, "loss": 5.8437, "mean_token_accuracy": 0.18515121638774873, "num_tokens": 57121691.0, "step": 22535 }, { "entropy": 6.196254396438599, "epoch": 2.601269474899019, "grad_norm": 0.96484375, "learning_rate": 0.00043335910472260057, "loss": 5.9195, "mean_token_accuracy": 0.17326430529356002, "num_tokens": 57134536.0, "step": 22540 }, { "entropy": 6.200167274475097, "epoch": 2.6018465089440275, "grad_norm": 1.140625, "learning_rate": 0.00043332978868538483, "loss": 5.8288, "mean_token_accuracy": 0.1783520206809044, "num_tokens": 57147141.0, "step": 22545 }, { "entropy": 6.157841968536377, "epoch": 2.6024235429890363, "grad_norm": 0.984375, "learning_rate": 0.00043330046732282515, "loss": 5.8142, "mean_token_accuracy": 0.19236651360988616, "num_tokens": 57160097.0, "step": 22550 }, { "entropy": 6.045707750320434, "epoch": 2.603000577034045, "grad_norm": 0.9296875, "learning_rate": 0.00043327114063590797, "loss": 5.7335, "mean_token_accuracy": 0.2020871952176094, "num_tokens": 57173378.0, "step": 22555 }, { "entropy": 6.125089836120606, "epoch": 2.6035776110790536, "grad_norm": 1.109375, "learning_rate": 0.0004332418086256196, "loss": 5.8373, "mean_token_accuracy": 0.1871074229478836, "num_tokens": 57187957.0, "step": 22560 }, { "entropy": 6.209305953979492, "epoch": 2.6041546451240625, "grad_norm": 0.9375, "learning_rate": 0.0004332124712929466, "loss": 5.888, "mean_token_accuracy": 0.1780647099018097, "num_tokens": 57202186.0, "step": 22565 }, { "entropy": 6.264482593536377, "epoch": 2.604731679169071, "grad_norm": 1.0390625, "learning_rate": 0.00043318312863887566, "loss": 5.8676, "mean_token_accuracy": 0.17797986567020416, "num_tokens": 57213841.0, "step": 22570 }, { "entropy": 6.208065366744995, "epoch": 2.6053087132140798, "grad_norm": 0.99609375, "learning_rate": 0.00043315378066439384, "loss": 5.8618, "mean_token_accuracy": 0.18109374940395356, "num_tokens": 57226445.0, "step": 22575 }, { "entropy": 6.134828519821167, "epoch": 2.605885747259088, "grad_norm": 0.9453125, "learning_rate": 0.0004331244273704881, "loss": 5.8116, "mean_token_accuracy": 0.19002193212509155, "num_tokens": 57238913.0, "step": 22580 }, { "entropy": 6.119336175918579, "epoch": 2.606462781304097, "grad_norm": 0.8984375, "learning_rate": 0.0004330950687581458, "loss": 5.8125, "mean_token_accuracy": 0.19199034571647644, "num_tokens": 57251082.0, "step": 22585 }, { "entropy": 6.197483110427856, "epoch": 2.6070398153491054, "grad_norm": 1.1328125, "learning_rate": 0.00043306570482835443, "loss": 5.8825, "mean_token_accuracy": 0.18067598044872285, "num_tokens": 57263267.0, "step": 22590 }, { "entropy": 6.235991144180298, "epoch": 2.6076168493941143, "grad_norm": 1.0390625, "learning_rate": 0.0004330363355821016, "loss": 5.8547, "mean_token_accuracy": 0.18330008238554002, "num_tokens": 57277053.0, "step": 22595 }, { "entropy": 6.172784519195557, "epoch": 2.6081938834391227, "grad_norm": 0.8828125, "learning_rate": 0.0004330069610203751, "loss": 5.7873, "mean_token_accuracy": 0.1853868395090103, "num_tokens": 57289962.0, "step": 22600 }, { "entropy": 6.190165567398071, "epoch": 2.6087709174841316, "grad_norm": 1.1484375, "learning_rate": 0.0004329775811441629, "loss": 5.8971, "mean_token_accuracy": 0.1774592414498329, "num_tokens": 57302397.0, "step": 22605 }, { "entropy": 6.18120002746582, "epoch": 2.6093479515291405, "grad_norm": 1.0078125, "learning_rate": 0.00043294819595445324, "loss": 5.7932, "mean_token_accuracy": 0.1860073208808899, "num_tokens": 57316645.0, "step": 22610 }, { "entropy": 6.165102243423462, "epoch": 2.609924985574149, "grad_norm": 1.21875, "learning_rate": 0.0004329188054522345, "loss": 5.8189, "mean_token_accuracy": 0.18246632665395737, "num_tokens": 57329714.0, "step": 22615 }, { "entropy": 6.2067405700683596, "epoch": 2.6105020196191573, "grad_norm": 1.03125, "learning_rate": 0.0004328894096384952, "loss": 5.8971, "mean_token_accuracy": 0.17518771439790726, "num_tokens": 57342940.0, "step": 22620 }, { "entropy": 6.1361020565032955, "epoch": 2.611079053664166, "grad_norm": 0.88671875, "learning_rate": 0.000432860008514224, "loss": 5.7378, "mean_token_accuracy": 0.18514444828033447, "num_tokens": 57354729.0, "step": 22625 }, { "entropy": 6.271011018753052, "epoch": 2.611656087709175, "grad_norm": 1.296875, "learning_rate": 0.0004328306020804099, "loss": 5.8937, "mean_token_accuracy": 0.17303266376256943, "num_tokens": 57368778.0, "step": 22630 }, { "entropy": 6.180638217926026, "epoch": 2.6122331217541834, "grad_norm": 0.953125, "learning_rate": 0.00043280119033804184, "loss": 5.8636, "mean_token_accuracy": 0.1785882219672203, "num_tokens": 57382266.0, "step": 22635 }, { "entropy": 6.188758850097656, "epoch": 2.6128101557991923, "grad_norm": 0.9375, "learning_rate": 0.00043277177328810914, "loss": 5.8259, "mean_token_accuracy": 0.18019461184740065, "num_tokens": 57394127.0, "step": 22640 }, { "entropy": 6.19890513420105, "epoch": 2.6133871898442007, "grad_norm": 0.95703125, "learning_rate": 0.0004327423509316012, "loss": 5.8244, "mean_token_accuracy": 0.1807365223765373, "num_tokens": 57405711.0, "step": 22645 }, { "entropy": 6.173237562179565, "epoch": 2.6139642238892096, "grad_norm": 0.91796875, "learning_rate": 0.00043271292326950764, "loss": 5.9256, "mean_token_accuracy": 0.17277692258358002, "num_tokens": 57418603.0, "step": 22650 }, { "entropy": 6.215972232818603, "epoch": 2.614541257934218, "grad_norm": 0.87109375, "learning_rate": 0.0004326834903028182, "loss": 5.7443, "mean_token_accuracy": 0.18458559960126877, "num_tokens": 57430582.0, "step": 22655 }, { "entropy": 6.168799257278442, "epoch": 2.615118291979227, "grad_norm": 1.0390625, "learning_rate": 0.000432654052032523, "loss": 5.8031, "mean_token_accuracy": 0.1851634979248047, "num_tokens": 57442592.0, "step": 22660 }, { "entropy": 6.145985746383667, "epoch": 2.6156953260242353, "grad_norm": 0.8984375, "learning_rate": 0.000432624608459612, "loss": 5.8616, "mean_token_accuracy": 0.18371669352054595, "num_tokens": 57455016.0, "step": 22665 }, { "entropy": 6.159763479232788, "epoch": 2.616272360069244, "grad_norm": 0.9921875, "learning_rate": 0.0004325951595850756, "loss": 5.7587, "mean_token_accuracy": 0.1854664921760559, "num_tokens": 57467228.0, "step": 22670 }, { "entropy": 6.160779428482056, "epoch": 2.6168493941142525, "grad_norm": 1.0078125, "learning_rate": 0.00043256570540990425, "loss": 5.7753, "mean_token_accuracy": 0.18470061123371123, "num_tokens": 57479654.0, "step": 22675 }, { "entropy": 6.203868961334228, "epoch": 2.6174264281592614, "grad_norm": 1.078125, "learning_rate": 0.0004325362459350888, "loss": 5.8842, "mean_token_accuracy": 0.17926905751228334, "num_tokens": 57492695.0, "step": 22680 }, { "entropy": 6.205330038070679, "epoch": 2.6180034622042703, "grad_norm": 0.9375, "learning_rate": 0.00043250678116161985, "loss": 5.9065, "mean_token_accuracy": 0.18414704203605653, "num_tokens": 57504619.0, "step": 22685 }, { "entropy": 6.232370328903198, "epoch": 2.6185804962492787, "grad_norm": 1.1015625, "learning_rate": 0.00043247731109048856, "loss": 5.8923, "mean_token_accuracy": 0.17923021018505098, "num_tokens": 57517141.0, "step": 22690 }, { "entropy": 6.173137092590332, "epoch": 2.619157530294287, "grad_norm": 0.97265625, "learning_rate": 0.0004324478357226861, "loss": 5.8417, "mean_token_accuracy": 0.18583366870880128, "num_tokens": 57529759.0, "step": 22695 }, { "entropy": 6.197889995574951, "epoch": 2.619734564339296, "grad_norm": 1.0703125, "learning_rate": 0.00043241835505920405, "loss": 5.8301, "mean_token_accuracy": 0.17693443298339845, "num_tokens": 57542587.0, "step": 22700 }, { "entropy": 6.198021316528321, "epoch": 2.620311598384305, "grad_norm": 1.0234375, "learning_rate": 0.0004323888691010337, "loss": 5.8535, "mean_token_accuracy": 0.18374460190534592, "num_tokens": 57554539.0, "step": 22705 }, { "entropy": 6.246301698684692, "epoch": 2.6208886324293132, "grad_norm": 0.98046875, "learning_rate": 0.00043235937784916694, "loss": 5.831, "mean_token_accuracy": 0.18612860143184662, "num_tokens": 57567436.0, "step": 22710 }, { "entropy": 6.098443222045899, "epoch": 2.621465666474322, "grad_norm": 1.0546875, "learning_rate": 0.00043232988130459567, "loss": 5.7574, "mean_token_accuracy": 0.18867213726043702, "num_tokens": 57579656.0, "step": 22715 }, { "entropy": 6.038045406341553, "epoch": 2.6220427005193305, "grad_norm": 0.953125, "learning_rate": 0.000432300379468312, "loss": 5.7335, "mean_token_accuracy": 0.1917673110961914, "num_tokens": 57591794.0, "step": 22720 }, { "entropy": 6.091014623641968, "epoch": 2.6226197345643394, "grad_norm": 1.0078125, "learning_rate": 0.0004322708723413082, "loss": 5.787, "mean_token_accuracy": 0.18332008719444276, "num_tokens": 57603982.0, "step": 22725 }, { "entropy": 6.23874797821045, "epoch": 2.623196768609348, "grad_norm": 0.9453125, "learning_rate": 0.00043224135992457667, "loss": 5.9055, "mean_token_accuracy": 0.1817587748169899, "num_tokens": 57616769.0, "step": 22730 }, { "entropy": 6.125768566131592, "epoch": 2.6237738026543567, "grad_norm": 1.234375, "learning_rate": 0.0004322118422191102, "loss": 5.7888, "mean_token_accuracy": 0.1895359516143799, "num_tokens": 57628995.0, "step": 22735 }, { "entropy": 6.1930314064025875, "epoch": 2.6243508366993655, "grad_norm": 1.03125, "learning_rate": 0.00043218231922590144, "loss": 5.8196, "mean_token_accuracy": 0.19127937406301498, "num_tokens": 57642417.0, "step": 22740 }, { "entropy": 6.0228982925415036, "epoch": 2.624927870744374, "grad_norm": 1.015625, "learning_rate": 0.0004321527909459435, "loss": 5.6678, "mean_token_accuracy": 0.18513512015342712, "num_tokens": 57654395.0, "step": 22745 }, { "entropy": 6.201718091964722, "epoch": 2.6255049047893824, "grad_norm": 0.9921875, "learning_rate": 0.00043212325738022946, "loss": 5.8623, "mean_token_accuracy": 0.17867814153432846, "num_tokens": 57667010.0, "step": 22750 }, { "entropy": 6.13390851020813, "epoch": 2.6260819388343912, "grad_norm": 0.984375, "learning_rate": 0.0004320937185297527, "loss": 5.8167, "mean_token_accuracy": 0.18668165057897568, "num_tokens": 57678726.0, "step": 22755 }, { "entropy": 6.169459342956543, "epoch": 2.6266589728794, "grad_norm": 1.53125, "learning_rate": 0.00043206417439550684, "loss": 5.893, "mean_token_accuracy": 0.18388821184635162, "num_tokens": 57692386.0, "step": 22760 }, { "entropy": 6.155322551727295, "epoch": 2.6272360069244085, "grad_norm": 0.98046875, "learning_rate": 0.00043203462497848534, "loss": 5.8152, "mean_token_accuracy": 0.18205110281705855, "num_tokens": 57704647.0, "step": 22765 }, { "entropy": 6.081495046615601, "epoch": 2.627813040969417, "grad_norm": 0.92578125, "learning_rate": 0.00043200507027968236, "loss": 5.7704, "mean_token_accuracy": 0.19250834733247757, "num_tokens": 57717652.0, "step": 22770 }, { "entropy": 6.16862530708313, "epoch": 2.628390075014426, "grad_norm": 1.0078125, "learning_rate": 0.0004319755103000918, "loss": 5.8647, "mean_token_accuracy": 0.1885334476828575, "num_tokens": 57730531.0, "step": 22775 }, { "entropy": 6.079220962524414, "epoch": 2.6289671090594346, "grad_norm": 1.2109375, "learning_rate": 0.0004319459450407079, "loss": 5.6871, "mean_token_accuracy": 0.1937173992395401, "num_tokens": 57742627.0, "step": 22780 }, { "entropy": 6.147434091567993, "epoch": 2.629544143104443, "grad_norm": 1.0078125, "learning_rate": 0.00043191637450252514, "loss": 5.8313, "mean_token_accuracy": 0.17829314172267913, "num_tokens": 57755894.0, "step": 22785 }, { "entropy": 6.232344913482666, "epoch": 2.630121177149452, "grad_norm": 0.94921875, "learning_rate": 0.000431886798686538, "loss": 5.8878, "mean_token_accuracy": 0.1800585061311722, "num_tokens": 57769003.0, "step": 22790 }, { "entropy": 6.158716249465942, "epoch": 2.6306982111944603, "grad_norm": 1.078125, "learning_rate": 0.0004318572175937414, "loss": 5.8669, "mean_token_accuracy": 0.18777997195720672, "num_tokens": 57781230.0, "step": 22795 }, { "entropy": 6.16593108177185, "epoch": 2.631275245239469, "grad_norm": 0.98046875, "learning_rate": 0.0004318276312251301, "loss": 5.7983, "mean_token_accuracy": 0.18250776678323746, "num_tokens": 57793167.0, "step": 22800 }, { "entropy": 6.145012617111206, "epoch": 2.6318522792844776, "grad_norm": 1.0625, "learning_rate": 0.0004317980395816994, "loss": 5.789, "mean_token_accuracy": 0.1874377980828285, "num_tokens": 57805306.0, "step": 22805 }, { "entropy": 6.126709365844727, "epoch": 2.6324293133294865, "grad_norm": 1.1015625, "learning_rate": 0.0004317684426644445, "loss": 5.7608, "mean_token_accuracy": 0.18417045325040818, "num_tokens": 57818844.0, "step": 22810 }, { "entropy": 6.186257839202881, "epoch": 2.6330063473744953, "grad_norm": 1.0546875, "learning_rate": 0.00043173884047436093, "loss": 5.9246, "mean_token_accuracy": 0.17446522414684296, "num_tokens": 57832017.0, "step": 22815 }, { "entropy": 6.1840986728668215, "epoch": 2.6335833814195038, "grad_norm": 0.99609375, "learning_rate": 0.0004317092330124443, "loss": 5.8519, "mean_token_accuracy": 0.18455812633037566, "num_tokens": 57844900.0, "step": 22820 }, { "entropy": 6.213629817962646, "epoch": 2.634160415464512, "grad_norm": 1.0390625, "learning_rate": 0.00043167962027969043, "loss": 5.8457, "mean_token_accuracy": 0.17783587872982026, "num_tokens": 57858297.0, "step": 22825 }, { "entropy": 6.163678932189941, "epoch": 2.634737449509521, "grad_norm": 0.953125, "learning_rate": 0.0004316500022770954, "loss": 5.8192, "mean_token_accuracy": 0.18586844950914383, "num_tokens": 57870613.0, "step": 22830 }, { "entropy": 6.214581489562988, "epoch": 2.63531448355453, "grad_norm": 1.1953125, "learning_rate": 0.00043162037900565533, "loss": 5.8916, "mean_token_accuracy": 0.1730441316962242, "num_tokens": 57883991.0, "step": 22835 }, { "entropy": 6.2626752853393555, "epoch": 2.6358915175995383, "grad_norm": 0.94140625, "learning_rate": 0.00043159075046636666, "loss": 5.9093, "mean_token_accuracy": 0.17782390117645264, "num_tokens": 57896400.0, "step": 22840 }, { "entropy": 6.103964328765869, "epoch": 2.636468551644547, "grad_norm": 0.94921875, "learning_rate": 0.0004315611166602258, "loss": 5.7805, "mean_token_accuracy": 0.1902986317873001, "num_tokens": 57908558.0, "step": 22845 }, { "entropy": 6.089307260513306, "epoch": 2.6370455856895556, "grad_norm": 1.0, "learning_rate": 0.00043153147758822957, "loss": 5.7618, "mean_token_accuracy": 0.18054557591676712, "num_tokens": 57922312.0, "step": 22850 }, { "entropy": 6.195387697219848, "epoch": 2.6376226197345645, "grad_norm": 1.0859375, "learning_rate": 0.0004315018332513749, "loss": 5.7757, "mean_token_accuracy": 0.18656957298517227, "num_tokens": 57934406.0, "step": 22855 }, { "entropy": 6.155811071395874, "epoch": 2.638199653779573, "grad_norm": 0.9609375, "learning_rate": 0.0004314721836506587, "loss": 5.8794, "mean_token_accuracy": 0.1820259690284729, "num_tokens": 57946854.0, "step": 22860 }, { "entropy": 6.215509033203125, "epoch": 2.6387766878245817, "grad_norm": 0.98828125, "learning_rate": 0.00043144252878707845, "loss": 5.9281, "mean_token_accuracy": 0.1770135998725891, "num_tokens": 57959075.0, "step": 22865 }, { "entropy": 6.120176601409912, "epoch": 2.63935372186959, "grad_norm": 1.03125, "learning_rate": 0.0004314128686616314, "loss": 5.7203, "mean_token_accuracy": 0.19129203855991364, "num_tokens": 57970501.0, "step": 22870 }, { "entropy": 6.048280096054077, "epoch": 2.639930755914599, "grad_norm": 1.09375, "learning_rate": 0.0004313832032753152, "loss": 5.7591, "mean_token_accuracy": 0.1910104587674141, "num_tokens": 57983683.0, "step": 22875 }, { "entropy": 6.211901140213013, "epoch": 2.6405077899596074, "grad_norm": 0.921875, "learning_rate": 0.00043135353262912764, "loss": 5.8558, "mean_token_accuracy": 0.18604885488748552, "num_tokens": 57997603.0, "step": 22880 }, { "entropy": 6.283529663085938, "epoch": 2.6410848240046163, "grad_norm": 0.90625, "learning_rate": 0.00043132385672406664, "loss": 5.9466, "mean_token_accuracy": 0.1737075001001358, "num_tokens": 58010225.0, "step": 22885 }, { "entropy": 6.132202672958374, "epoch": 2.641661858049625, "grad_norm": 0.95703125, "learning_rate": 0.0004312941755611305, "loss": 5.7351, "mean_token_accuracy": 0.19030017256736756, "num_tokens": 58023581.0, "step": 22890 }, { "entropy": 6.167155075073242, "epoch": 2.6422388920946336, "grad_norm": 0.921875, "learning_rate": 0.00043126448914131724, "loss": 5.8681, "mean_token_accuracy": 0.1788954794406891, "num_tokens": 58035508.0, "step": 22895 }, { "entropy": 6.248766279220581, "epoch": 2.642815926139642, "grad_norm": 0.9609375, "learning_rate": 0.0004312347974656256, "loss": 5.8354, "mean_token_accuracy": 0.17860854268074036, "num_tokens": 58046762.0, "step": 22900 }, { "entropy": 6.228690481185913, "epoch": 2.643392960184651, "grad_norm": 0.97265625, "learning_rate": 0.0004312051005350541, "loss": 5.9067, "mean_token_accuracy": 0.17975085377693176, "num_tokens": 58059626.0, "step": 22905 }, { "entropy": 6.136456918716431, "epoch": 2.6439699942296597, "grad_norm": 1.09375, "learning_rate": 0.00043117539835060164, "loss": 5.7981, "mean_token_accuracy": 0.19189803451299667, "num_tokens": 58073482.0, "step": 22910 }, { "entropy": 6.153267812728882, "epoch": 2.644547028274668, "grad_norm": 0.953125, "learning_rate": 0.0004311456909132673, "loss": 5.8394, "mean_token_accuracy": 0.184129199385643, "num_tokens": 58086375.0, "step": 22915 }, { "entropy": 6.2739767074584964, "epoch": 2.645124062319677, "grad_norm": 0.8984375, "learning_rate": 0.0004311159782240502, "loss": 5.8521, "mean_token_accuracy": 0.17692941278219224, "num_tokens": 58097953.0, "step": 22920 }, { "entropy": 6.16820387840271, "epoch": 2.6457010963646854, "grad_norm": 0.91796875, "learning_rate": 0.0004310862602839496, "loss": 5.8726, "mean_token_accuracy": 0.18403665572404862, "num_tokens": 58109602.0, "step": 22925 }, { "entropy": 6.049224853515625, "epoch": 2.6462781304096943, "grad_norm": 1.09375, "learning_rate": 0.0004310565370939653, "loss": 5.7647, "mean_token_accuracy": 0.1887705072760582, "num_tokens": 58123033.0, "step": 22930 }, { "entropy": 6.20648980140686, "epoch": 2.6468551644547027, "grad_norm": 0.98046875, "learning_rate": 0.00043102680865509687, "loss": 5.9095, "mean_token_accuracy": 0.1757308855652809, "num_tokens": 58135629.0, "step": 22935 }, { "entropy": 6.24998369216919, "epoch": 2.6474321984997116, "grad_norm": 0.9375, "learning_rate": 0.0004309970749683442, "loss": 5.8592, "mean_token_accuracy": 0.18160168528556825, "num_tokens": 58149178.0, "step": 22940 }, { "entropy": 6.153095293045044, "epoch": 2.64800923254472, "grad_norm": 0.94921875, "learning_rate": 0.00043096733603470737, "loss": 5.7384, "mean_token_accuracy": 0.18905709087848663, "num_tokens": 58160752.0, "step": 22945 }, { "entropy": 6.163722038269043, "epoch": 2.648586266589729, "grad_norm": 1.28125, "learning_rate": 0.00043093759185518677, "loss": 5.9308, "mean_token_accuracy": 0.17847282886505128, "num_tokens": 58174680.0, "step": 22950 }, { "entropy": 6.252099990844727, "epoch": 2.6491633006347373, "grad_norm": 0.99609375, "learning_rate": 0.00043090784243078264, "loss": 5.8979, "mean_token_accuracy": 0.17616451978683473, "num_tokens": 58186945.0, "step": 22955 }, { "entropy": 6.223245477676391, "epoch": 2.649740334679746, "grad_norm": 0.9140625, "learning_rate": 0.0004308780877624957, "loss": 5.8383, "mean_token_accuracy": 0.18151946514844894, "num_tokens": 58198940.0, "step": 22960 }, { "entropy": 6.184252595901489, "epoch": 2.650317368724755, "grad_norm": 0.99609375, "learning_rate": 0.0004308483278513267, "loss": 5.8718, "mean_token_accuracy": 0.18212129324674606, "num_tokens": 58212778.0, "step": 22965 }, { "entropy": 6.1689540386199955, "epoch": 2.6508944027697634, "grad_norm": 1.0078125, "learning_rate": 0.00043081856269827656, "loss": 5.8303, "mean_token_accuracy": 0.18636085242033004, "num_tokens": 58225378.0, "step": 22970 }, { "entropy": 6.157000350952148, "epoch": 2.651471436814772, "grad_norm": 0.97265625, "learning_rate": 0.0004307887923043465, "loss": 5.792, "mean_token_accuracy": 0.1931401327252388, "num_tokens": 58238012.0, "step": 22975 }, { "entropy": 6.238514184951782, "epoch": 2.6520484708597807, "grad_norm": 1.0390625, "learning_rate": 0.0004307590166705379, "loss": 5.9452, "mean_token_accuracy": 0.1742991492152214, "num_tokens": 58250527.0, "step": 22980 }, { "entropy": 6.142331838607788, "epoch": 2.6526255049047895, "grad_norm": 1.0625, "learning_rate": 0.00043072923579785203, "loss": 5.7686, "mean_token_accuracy": 0.1900982975959778, "num_tokens": 58262805.0, "step": 22985 }, { "entropy": 6.192170715332031, "epoch": 2.653202538949798, "grad_norm": 0.96484375, "learning_rate": 0.0004306994496872907, "loss": 5.9087, "mean_token_accuracy": 0.17857062667608262, "num_tokens": 58275622.0, "step": 22990 }, { "entropy": 6.0951831340789795, "epoch": 2.653779572994807, "grad_norm": 0.9453125, "learning_rate": 0.00043066965833985567, "loss": 5.9036, "mean_token_accuracy": 0.17930659353733064, "num_tokens": 58288505.0, "step": 22995 }, { "entropy": 6.184918308258057, "epoch": 2.6543566070398152, "grad_norm": 0.98046875, "learning_rate": 0.00043063986175654906, "loss": 5.8034, "mean_token_accuracy": 0.18367572724819184, "num_tokens": 58301083.0, "step": 23000 }, { "entropy": 6.157433605194091, "epoch": 2.654933641084824, "grad_norm": 1.0703125, "learning_rate": 0.00043061005993837306, "loss": 5.7581, "mean_token_accuracy": 0.18601444363594055, "num_tokens": 58313494.0, "step": 23005 }, { "entropy": 6.1464615821838375, "epoch": 2.6555106751298325, "grad_norm": 1.328125, "learning_rate": 0.00043058025288632995, "loss": 5.826, "mean_token_accuracy": 0.189591246843338, "num_tokens": 58327350.0, "step": 23010 }, { "entropy": 6.205576419830322, "epoch": 2.6560877091748414, "grad_norm": 0.91796875, "learning_rate": 0.00043055044060142224, "loss": 5.8823, "mean_token_accuracy": 0.18251786530017852, "num_tokens": 58340664.0, "step": 23015 }, { "entropy": 6.193451690673828, "epoch": 2.6566647432198502, "grad_norm": 0.87890625, "learning_rate": 0.00043052062308465277, "loss": 5.8058, "mean_token_accuracy": 0.17998293340206145, "num_tokens": 58353461.0, "step": 23020 }, { "entropy": 6.192967462539673, "epoch": 2.6572417772648587, "grad_norm": 0.94140625, "learning_rate": 0.0004304908003370244, "loss": 5.8518, "mean_token_accuracy": 0.18132518231868744, "num_tokens": 58366872.0, "step": 23025 }, { "entropy": 6.190752363204956, "epoch": 2.657818811309867, "grad_norm": 0.98828125, "learning_rate": 0.00043046097235954024, "loss": 5.7997, "mean_token_accuracy": 0.19072414934635162, "num_tokens": 58378587.0, "step": 23030 }, { "entropy": 6.135037183761597, "epoch": 2.658395845354876, "grad_norm": 1.0859375, "learning_rate": 0.00043043113915320345, "loss": 5.7715, "mean_token_accuracy": 0.1846110001206398, "num_tokens": 58390368.0, "step": 23035 }, { "entropy": 6.167164945602417, "epoch": 2.658972879399885, "grad_norm": 0.921875, "learning_rate": 0.00043040130071901747, "loss": 5.8829, "mean_token_accuracy": 0.18048466444015504, "num_tokens": 58403803.0, "step": 23040 }, { "entropy": 6.209956645965576, "epoch": 2.659549913444893, "grad_norm": 0.91796875, "learning_rate": 0.00043037145705798605, "loss": 5.86, "mean_token_accuracy": 0.18303288370370865, "num_tokens": 58416819.0, "step": 23045 }, { "entropy": 6.196471643447876, "epoch": 2.6601269474899016, "grad_norm": 0.9921875, "learning_rate": 0.00043034160817111275, "loss": 5.8312, "mean_token_accuracy": 0.18922780454158783, "num_tokens": 58428681.0, "step": 23050 }, { "entropy": 6.160715961456299, "epoch": 2.6607039815349105, "grad_norm": 1.09375, "learning_rate": 0.00043031175405940157, "loss": 5.8466, "mean_token_accuracy": 0.18477230817079543, "num_tokens": 58440235.0, "step": 23055 }, { "entropy": 6.191605281829834, "epoch": 2.6612810155799194, "grad_norm": 1.265625, "learning_rate": 0.0004302818947238568, "loss": 5.8602, "mean_token_accuracy": 0.18682175427675246, "num_tokens": 58452547.0, "step": 23060 }, { "entropy": 6.091343355178833, "epoch": 2.661858049624928, "grad_norm": 1.0078125, "learning_rate": 0.00043025203016548263, "loss": 5.7705, "mean_token_accuracy": 0.1843006744980812, "num_tokens": 58466683.0, "step": 23065 }, { "entropy": 6.142626857757568, "epoch": 2.6624350836699366, "grad_norm": 0.9453125, "learning_rate": 0.00043022216038528347, "loss": 5.8357, "mean_token_accuracy": 0.18257568180561065, "num_tokens": 58480353.0, "step": 23070 }, { "entropy": 6.223905229568482, "epoch": 2.663012117714945, "grad_norm": 1.125, "learning_rate": 0.00043019228538426416, "loss": 5.8335, "mean_token_accuracy": 0.18898356705904007, "num_tokens": 58493213.0, "step": 23075 }, { "entropy": 6.1856465339660645, "epoch": 2.663589151759954, "grad_norm": 0.95703125, "learning_rate": 0.00043016240516342933, "loss": 5.8817, "mean_token_accuracy": 0.1808542713522911, "num_tokens": 58505386.0, "step": 23080 }, { "entropy": 6.160248756408691, "epoch": 2.6641661858049623, "grad_norm": 1.2421875, "learning_rate": 0.00043013251972378404, "loss": 5.8299, "mean_token_accuracy": 0.18217852115631103, "num_tokens": 58518067.0, "step": 23085 }, { "entropy": 6.190211963653565, "epoch": 2.664743219849971, "grad_norm": 0.875, "learning_rate": 0.00043010262906633355, "loss": 5.8739, "mean_token_accuracy": 0.17838504314422607, "num_tokens": 58532138.0, "step": 23090 }, { "entropy": 6.195870304107666, "epoch": 2.66532025389498, "grad_norm": 0.97265625, "learning_rate": 0.00043007273319208326, "loss": 5.89, "mean_token_accuracy": 0.18403186947107314, "num_tokens": 58546464.0, "step": 23095 }, { "entropy": 6.2662766456604, "epoch": 2.6658972879399885, "grad_norm": 0.9375, "learning_rate": 0.0004300428321020385, "loss": 5.8947, "mean_token_accuracy": 0.17792199552059174, "num_tokens": 58559463.0, "step": 23100 }, { "entropy": 6.2804466724395756, "epoch": 2.666474321984997, "grad_norm": 1.5703125, "learning_rate": 0.00043001292579720514, "loss": 5.8947, "mean_token_accuracy": 0.18157547563314438, "num_tokens": 58572125.0, "step": 23105 }, { "entropy": 6.106372451782226, "epoch": 2.6670513560300058, "grad_norm": 2.296875, "learning_rate": 0.000429983014278589, "loss": 5.7776, "mean_token_accuracy": 0.18735108077526091, "num_tokens": 58585312.0, "step": 23110 }, { "entropy": 6.1410932540893555, "epoch": 2.6676283900750146, "grad_norm": 0.96484375, "learning_rate": 0.0004299530975471962, "loss": 5.7834, "mean_token_accuracy": 0.1863879904150963, "num_tokens": 58598006.0, "step": 23115 }, { "entropy": 6.153367948532105, "epoch": 2.668205424120023, "grad_norm": 0.9296875, "learning_rate": 0.0004299231756040329, "loss": 5.7685, "mean_token_accuracy": 0.18700756430625914, "num_tokens": 58609741.0, "step": 23120 }, { "entropy": 6.168306684494018, "epoch": 2.668782458165032, "grad_norm": 0.94921875, "learning_rate": 0.0004298932484501055, "loss": 5.8204, "mean_token_accuracy": 0.18301159292459487, "num_tokens": 58623076.0, "step": 23125 }, { "entropy": 6.227231359481811, "epoch": 2.6693594922100403, "grad_norm": 0.97265625, "learning_rate": 0.00042986331608642076, "loss": 5.8543, "mean_token_accuracy": 0.1850983902812004, "num_tokens": 58634558.0, "step": 23130 }, { "entropy": 6.062982988357544, "epoch": 2.669936526255049, "grad_norm": 0.9765625, "learning_rate": 0.00042983337851398525, "loss": 5.7634, "mean_token_accuracy": 0.1951274588704109, "num_tokens": 58647305.0, "step": 23135 }, { "entropy": 6.174078559875488, "epoch": 2.6705135603000576, "grad_norm": 0.91015625, "learning_rate": 0.00042980343573380595, "loss": 5.8479, "mean_token_accuracy": 0.18469816595315933, "num_tokens": 58659723.0, "step": 23140 }, { "entropy": 6.139213705062867, "epoch": 2.6710905943450665, "grad_norm": 0.98046875, "learning_rate": 0.00042977348774688996, "loss": 5.8854, "mean_token_accuracy": 0.18793033212423324, "num_tokens": 58670932.0, "step": 23145 }, { "entropy": 6.221418571472168, "epoch": 2.671667628390075, "grad_norm": 0.9296875, "learning_rate": 0.0004297435345542445, "loss": 5.852, "mean_token_accuracy": 0.17453705370426179, "num_tokens": 58682337.0, "step": 23150 }, { "entropy": 6.268413162231445, "epoch": 2.6722446624350837, "grad_norm": 0.94921875, "learning_rate": 0.0004297135761568773, "loss": 5.8087, "mean_token_accuracy": 0.18703240305185317, "num_tokens": 58694667.0, "step": 23155 }, { "entropy": 6.147421216964721, "epoch": 2.672821696480092, "grad_norm": 1.046875, "learning_rate": 0.00042968361255579573, "loss": 5.8385, "mean_token_accuracy": 0.18575343489646912, "num_tokens": 58707478.0, "step": 23160 }, { "entropy": 6.187603569030761, "epoch": 2.673398730525101, "grad_norm": 0.9609375, "learning_rate": 0.00042965364375200765, "loss": 5.8071, "mean_token_accuracy": 0.18542922735214235, "num_tokens": 58720660.0, "step": 23165 }, { "entropy": 6.148350715637207, "epoch": 2.67397576457011, "grad_norm": 0.96875, "learning_rate": 0.0004296236697465212, "loss": 5.7836, "mean_token_accuracy": 0.18650804907083512, "num_tokens": 58732835.0, "step": 23170 }, { "entropy": 6.130046653747558, "epoch": 2.6745527986151183, "grad_norm": 0.8515625, "learning_rate": 0.0004295936905403444, "loss": 5.8191, "mean_token_accuracy": 0.1780240699648857, "num_tokens": 58745432.0, "step": 23175 }, { "entropy": 6.156208848953247, "epoch": 2.6751298326601267, "grad_norm": 0.984375, "learning_rate": 0.0004295637061344855, "loss": 5.7747, "mean_token_accuracy": 0.18617688864469528, "num_tokens": 58758837.0, "step": 23180 }, { "entropy": 6.129476070404053, "epoch": 2.6757068667051356, "grad_norm": 1.0859375, "learning_rate": 0.0004295337165299532, "loss": 5.7591, "mean_token_accuracy": 0.1869099661707878, "num_tokens": 58772347.0, "step": 23185 }, { "entropy": 6.170158958435058, "epoch": 2.6762839007501444, "grad_norm": 0.99609375, "learning_rate": 0.00042950372172775614, "loss": 5.8263, "mean_token_accuracy": 0.1768513023853302, "num_tokens": 58784278.0, "step": 23190 }, { "entropy": 6.151766395568847, "epoch": 2.676860934795153, "grad_norm": 0.91796875, "learning_rate": 0.000429473721728903, "loss": 5.7627, "mean_token_accuracy": 0.18710385710000993, "num_tokens": 58795788.0, "step": 23195 }, { "entropy": 6.208158493041992, "epoch": 2.6774379688401617, "grad_norm": 0.95703125, "learning_rate": 0.0004294437165344031, "loss": 5.8631, "mean_token_accuracy": 0.17992291152477263, "num_tokens": 58808394.0, "step": 23200 }, { "entropy": 6.161670732498169, "epoch": 2.67801500288517, "grad_norm": 0.953125, "learning_rate": 0.00042941370614526554, "loss": 5.7899, "mean_token_accuracy": 0.19086406975984574, "num_tokens": 58819570.0, "step": 23205 }, { "entropy": 6.124743986129761, "epoch": 2.678592036930179, "grad_norm": 1.2890625, "learning_rate": 0.0004293836905624996, "loss": 5.843, "mean_token_accuracy": 0.1866921991109848, "num_tokens": 58831049.0, "step": 23210 }, { "entropy": 6.289630317687989, "epoch": 2.6791690709751874, "grad_norm": 1.03125, "learning_rate": 0.00042935366978711487, "loss": 5.951, "mean_token_accuracy": 0.1732814535498619, "num_tokens": 58844753.0, "step": 23215 }, { "entropy": 6.1924584865570065, "epoch": 2.6797461050201963, "grad_norm": 1.015625, "learning_rate": 0.00042932364382012125, "loss": 5.828, "mean_token_accuracy": 0.1831527054309845, "num_tokens": 58856796.0, "step": 23220 }, { "entropy": 6.21537504196167, "epoch": 2.6803231390652047, "grad_norm": 1.1484375, "learning_rate": 0.00042929361266252843, "loss": 5.8528, "mean_token_accuracy": 0.1887661799788475, "num_tokens": 58869046.0, "step": 23225 }, { "entropy": 6.167904663085937, "epoch": 2.6809001731102136, "grad_norm": 0.9765625, "learning_rate": 0.0004292635763153466, "loss": 5.8335, "mean_token_accuracy": 0.18496952652931214, "num_tokens": 58880993.0, "step": 23230 }, { "entropy": 6.216453933715821, "epoch": 2.681477207155222, "grad_norm": 0.9453125, "learning_rate": 0.00042923353477958607, "loss": 5.814, "mean_token_accuracy": 0.1836557060480118, "num_tokens": 58893519.0, "step": 23235 }, { "entropy": 6.17032527923584, "epoch": 2.682054241200231, "grad_norm": 0.94921875, "learning_rate": 0.00042920348805625716, "loss": 5.8219, "mean_token_accuracy": 0.18259599655866623, "num_tokens": 58905904.0, "step": 23240 }, { "entropy": 6.185873937606812, "epoch": 2.6826312752452397, "grad_norm": 0.984375, "learning_rate": 0.00042917343614637057, "loss": 5.85, "mean_token_accuracy": 0.1853163793683052, "num_tokens": 58918271.0, "step": 23245 }, { "entropy": 6.196112489700317, "epoch": 2.683208309290248, "grad_norm": 1.265625, "learning_rate": 0.00042914337905093695, "loss": 5.8383, "mean_token_accuracy": 0.1808432936668396, "num_tokens": 58930381.0, "step": 23250 }, { "entropy": 6.197277450561524, "epoch": 2.6837853433352565, "grad_norm": 0.90234375, "learning_rate": 0.0004291133167709674, "loss": 5.7465, "mean_token_accuracy": 0.18375710546970367, "num_tokens": 58942506.0, "step": 23255 }, { "entropy": 6.129807233810425, "epoch": 2.6843623773802654, "grad_norm": 0.99609375, "learning_rate": 0.00042908324930747297, "loss": 5.8696, "mean_token_accuracy": 0.18315427452325822, "num_tokens": 58954383.0, "step": 23260 }, { "entropy": 6.197905158996582, "epoch": 2.6849394114252743, "grad_norm": 0.921875, "learning_rate": 0.00042905317666146496, "loss": 5.948, "mean_token_accuracy": 0.17622523307800292, "num_tokens": 58967110.0, "step": 23265 }, { "entropy": 6.260257434844971, "epoch": 2.6855164454702827, "grad_norm": 1.3515625, "learning_rate": 0.00042902309883395497, "loss": 5.8235, "mean_token_accuracy": 0.18633091747760772, "num_tokens": 58980314.0, "step": 23270 }, { "entropy": 6.18588695526123, "epoch": 2.6860934795152915, "grad_norm": 1.0, "learning_rate": 0.0004289930158259545, "loss": 5.9316, "mean_token_accuracy": 0.17162706702947617, "num_tokens": 58993544.0, "step": 23275 }, { "entropy": 6.2314550399780275, "epoch": 2.6866705135603, "grad_norm": 1.1328125, "learning_rate": 0.00042896292763847544, "loss": 5.8778, "mean_token_accuracy": 0.19867659658193587, "num_tokens": 59006043.0, "step": 23280 }, { "entropy": 6.270898771286011, "epoch": 2.687247547605309, "grad_norm": 1.1875, "learning_rate": 0.00042893283427252984, "loss": 5.8935, "mean_token_accuracy": 0.17977669984102249, "num_tokens": 59018691.0, "step": 23285 }, { "entropy": 6.188410377502441, "epoch": 2.6878245816503172, "grad_norm": 1.0078125, "learning_rate": 0.0004289027357291297, "loss": 5.8397, "mean_token_accuracy": 0.1844502329826355, "num_tokens": 59031493.0, "step": 23290 }, { "entropy": 6.071956205368042, "epoch": 2.688401615695326, "grad_norm": 0.96484375, "learning_rate": 0.0004288726320092876, "loss": 5.722, "mean_token_accuracy": 0.1941444382071495, "num_tokens": 59045464.0, "step": 23295 }, { "entropy": 6.251468181610107, "epoch": 2.6889786497403345, "grad_norm": 0.984375, "learning_rate": 0.0004288425231140159, "loss": 5.823, "mean_token_accuracy": 0.18416701704263688, "num_tokens": 59057391.0, "step": 23300 }, { "entropy": 6.070117807388305, "epoch": 2.6895556837853434, "grad_norm": 1.015625, "learning_rate": 0.00042881240904432737, "loss": 5.6905, "mean_token_accuracy": 0.19433396309614182, "num_tokens": 59070175.0, "step": 23305 }, { "entropy": 6.149970483779907, "epoch": 2.690132717830352, "grad_norm": 0.9765625, "learning_rate": 0.0004287822898012348, "loss": 5.8407, "mean_token_accuracy": 0.185240176320076, "num_tokens": 59083605.0, "step": 23310 }, { "entropy": 6.134791517257691, "epoch": 2.6907097518753607, "grad_norm": 0.9765625, "learning_rate": 0.0004287521653857514, "loss": 5.7687, "mean_token_accuracy": 0.19423387795686722, "num_tokens": 59095799.0, "step": 23315 }, { "entropy": 6.160860347747803, "epoch": 2.6912867859203695, "grad_norm": 0.953125, "learning_rate": 0.00042872203579889025, "loss": 5.8445, "mean_token_accuracy": 0.185671566426754, "num_tokens": 59109982.0, "step": 23320 }, { "entropy": 6.205086088180542, "epoch": 2.691863819965378, "grad_norm": 0.98828125, "learning_rate": 0.00042869190104166476, "loss": 5.8742, "mean_token_accuracy": 0.1778896704316139, "num_tokens": 59122478.0, "step": 23325 }, { "entropy": 6.201913833618164, "epoch": 2.6924408540103864, "grad_norm": 0.94921875, "learning_rate": 0.0004286617611150886, "loss": 5.8548, "mean_token_accuracy": 0.18144448697566987, "num_tokens": 59134342.0, "step": 23330 }, { "entropy": 6.270397281646728, "epoch": 2.693017888055395, "grad_norm": 0.921875, "learning_rate": 0.00042863161602017536, "loss": 5.9195, "mean_token_accuracy": 0.17555266469717026, "num_tokens": 59146628.0, "step": 23335 }, { "entropy": 6.141443252563477, "epoch": 2.693594922100404, "grad_norm": 0.9296875, "learning_rate": 0.0004286014657579391, "loss": 5.7835, "mean_token_accuracy": 0.1902693510055542, "num_tokens": 59160043.0, "step": 23340 }, { "entropy": 6.2056488513946535, "epoch": 2.6941719561454125, "grad_norm": 0.87890625, "learning_rate": 0.0004285713103293938, "loss": 5.8536, "mean_token_accuracy": 0.17837955802679062, "num_tokens": 59173710.0, "step": 23345 }, { "entropy": 6.128909587860107, "epoch": 2.6947489901904214, "grad_norm": 1.03125, "learning_rate": 0.0004285411497355537, "loss": 5.7606, "mean_token_accuracy": 0.18160916566848756, "num_tokens": 59186069.0, "step": 23350 }, { "entropy": 6.173884010314941, "epoch": 2.6953260242354298, "grad_norm": 0.91796875, "learning_rate": 0.00042851098397743334, "loss": 5.8683, "mean_token_accuracy": 0.18132909536361694, "num_tokens": 59199305.0, "step": 23355 }, { "entropy": 6.2042299747467045, "epoch": 2.6959030582804386, "grad_norm": 0.96484375, "learning_rate": 0.0004284808130560473, "loss": 5.8095, "mean_token_accuracy": 0.18014252334833145, "num_tokens": 59212135.0, "step": 23360 }, { "entropy": 6.250422477722168, "epoch": 2.696480092325447, "grad_norm": 0.92578125, "learning_rate": 0.00042845063697241034, "loss": 5.8693, "mean_token_accuracy": 0.17942632585763932, "num_tokens": 59226651.0, "step": 23365 }, { "entropy": 6.111573362350464, "epoch": 2.697057126370456, "grad_norm": 0.88671875, "learning_rate": 0.0004284204557275374, "loss": 5.8208, "mean_token_accuracy": 0.17859306782484055, "num_tokens": 59238630.0, "step": 23370 }, { "entropy": 6.157173442840576, "epoch": 2.6976341604154648, "grad_norm": 0.9375, "learning_rate": 0.0004283902693224437, "loss": 5.825, "mean_token_accuracy": 0.18013526797294616, "num_tokens": 59251465.0, "step": 23375 }, { "entropy": 6.197487735748291, "epoch": 2.698211194460473, "grad_norm": 0.91796875, "learning_rate": 0.00042836007775814446, "loss": 5.7956, "mean_token_accuracy": 0.19154615551233292, "num_tokens": 59264058.0, "step": 23380 }, { "entropy": 6.117607116699219, "epoch": 2.6987882285054816, "grad_norm": 1.125, "learning_rate": 0.0004283298810356551, "loss": 5.7133, "mean_token_accuracy": 0.19167850017547608, "num_tokens": 59276937.0, "step": 23385 }, { "entropy": 6.117186164855957, "epoch": 2.6993652625504905, "grad_norm": 0.953125, "learning_rate": 0.0004282996791559914, "loss": 5.8164, "mean_token_accuracy": 0.18485463559627532, "num_tokens": 59288747.0, "step": 23390 }, { "entropy": 6.153876781463623, "epoch": 2.6999422965954993, "grad_norm": 0.953125, "learning_rate": 0.00042826947212016924, "loss": 5.8205, "mean_token_accuracy": 0.18580360263586043, "num_tokens": 59301690.0, "step": 23395 }, { "entropy": 6.133680391311645, "epoch": 2.7005193306405078, "grad_norm": 0.984375, "learning_rate": 0.0004282392599292045, "loss": 5.7532, "mean_token_accuracy": 0.18659163266420364, "num_tokens": 59312964.0, "step": 23400 }, { "entropy": 6.234754753112793, "epoch": 2.701096364685516, "grad_norm": 0.93359375, "learning_rate": 0.0004282090425841133, "loss": 5.9417, "mean_token_accuracy": 0.17786754071712493, "num_tokens": 59325242.0, "step": 23405 }, { "entropy": 6.179014682769775, "epoch": 2.701673398730525, "grad_norm": 1.0703125, "learning_rate": 0.0004281788200859121, "loss": 5.8338, "mean_token_accuracy": 0.1878078043460846, "num_tokens": 59337877.0, "step": 23410 }, { "entropy": 6.206895065307617, "epoch": 2.702250432775534, "grad_norm": 0.95703125, "learning_rate": 0.00042814859243561727, "loss": 5.8435, "mean_token_accuracy": 0.18348279148340224, "num_tokens": 59349757.0, "step": 23415 }, { "entropy": 6.163533639907837, "epoch": 2.7028274668205423, "grad_norm": 1.0390625, "learning_rate": 0.00042811835963424573, "loss": 5.7973, "mean_token_accuracy": 0.186604243516922, "num_tokens": 59364268.0, "step": 23420 }, { "entropy": 6.209364223480224, "epoch": 2.703404500865551, "grad_norm": 0.90625, "learning_rate": 0.00042808812168281413, "loss": 5.8853, "mean_token_accuracy": 0.1777723625302315, "num_tokens": 59376896.0, "step": 23425 }, { "entropy": 6.226865530014038, "epoch": 2.7039815349105596, "grad_norm": 1.078125, "learning_rate": 0.00042805787858233966, "loss": 5.8765, "mean_token_accuracy": 0.17968610525131226, "num_tokens": 59390905.0, "step": 23430 }, { "entropy": 6.150434446334839, "epoch": 2.7045585689555685, "grad_norm": 1.0625, "learning_rate": 0.0004280276303338395, "loss": 5.7907, "mean_token_accuracy": 0.19126541763544083, "num_tokens": 59403896.0, "step": 23435 }, { "entropy": 6.1717979431152346, "epoch": 2.705135603000577, "grad_norm": 0.98828125, "learning_rate": 0.000427997376938331, "loss": 5.7485, "mean_token_accuracy": 0.18864676505327224, "num_tokens": 59416050.0, "step": 23440 }, { "entropy": 6.150090980529785, "epoch": 2.7057126370455857, "grad_norm": 0.8984375, "learning_rate": 0.0004279671183968317, "loss": 5.8254, "mean_token_accuracy": 0.1847640573978424, "num_tokens": 59428127.0, "step": 23445 }, { "entropy": 6.165274810791016, "epoch": 2.7062896710905946, "grad_norm": 1.0234375, "learning_rate": 0.0004279368547103593, "loss": 5.8112, "mean_token_accuracy": 0.18552787899971007, "num_tokens": 59442708.0, "step": 23450 }, { "entropy": 6.168972063064575, "epoch": 2.706866705135603, "grad_norm": 1.03125, "learning_rate": 0.0004279065858799318, "loss": 5.8875, "mean_token_accuracy": 0.18229120522737502, "num_tokens": 59456126.0, "step": 23455 }, { "entropy": 6.168537998199463, "epoch": 2.7074437391806114, "grad_norm": 0.9296875, "learning_rate": 0.00042787631190656725, "loss": 5.83, "mean_token_accuracy": 0.1861049562692642, "num_tokens": 59469331.0, "step": 23460 }, { "entropy": 6.075778579711914, "epoch": 2.7080207732256203, "grad_norm": 0.87890625, "learning_rate": 0.00042784603279128386, "loss": 5.7633, "mean_token_accuracy": 0.19445625245571135, "num_tokens": 59483084.0, "step": 23465 }, { "entropy": 6.192923355102539, "epoch": 2.708597807270629, "grad_norm": 0.9296875, "learning_rate": 0.0004278157485351001, "loss": 5.8616, "mean_token_accuracy": 0.17950499057769775, "num_tokens": 59494746.0, "step": 23470 }, { "entropy": 6.203206491470337, "epoch": 2.7091748413156376, "grad_norm": 0.8984375, "learning_rate": 0.00042778545913903454, "loss": 5.8437, "mean_token_accuracy": 0.18603405952453614, "num_tokens": 59507266.0, "step": 23475 }, { "entropy": 6.229127359390259, "epoch": 2.7097518753606464, "grad_norm": 1.0390625, "learning_rate": 0.00042775516460410594, "loss": 5.8741, "mean_token_accuracy": 0.1794537678360939, "num_tokens": 59521876.0, "step": 23480 }, { "entropy": 6.201447010040283, "epoch": 2.710328909405655, "grad_norm": 0.8984375, "learning_rate": 0.0004277248649313333, "loss": 5.8491, "mean_token_accuracy": 0.18010489642620087, "num_tokens": 59535512.0, "step": 23485 }, { "entropy": 6.195682144165039, "epoch": 2.7109059434506637, "grad_norm": 0.9375, "learning_rate": 0.0004276945601217357, "loss": 5.9564, "mean_token_accuracy": 0.17316356003284455, "num_tokens": 59549596.0, "step": 23490 }, { "entropy": 6.20859842300415, "epoch": 2.711482977495672, "grad_norm": 0.9453125, "learning_rate": 0.00042766425017633236, "loss": 5.8888, "mean_token_accuracy": 0.18614009022712708, "num_tokens": 59562455.0, "step": 23495 }, { "entropy": 6.136179733276367, "epoch": 2.712060011540681, "grad_norm": 1.0703125, "learning_rate": 0.00042763393509614284, "loss": 5.773, "mean_token_accuracy": 0.18201442062854767, "num_tokens": 59574897.0, "step": 23500 }, { "entropy": 6.198714685440064, "epoch": 2.7126370455856894, "grad_norm": 1.015625, "learning_rate": 0.0004276036148821867, "loss": 5.7977, "mean_token_accuracy": 0.18542479425668718, "num_tokens": 59586472.0, "step": 23505 }, { "entropy": 6.178706121444702, "epoch": 2.7132140796306983, "grad_norm": 0.9765625, "learning_rate": 0.00042757328953548385, "loss": 5.7969, "mean_token_accuracy": 0.1838708609342575, "num_tokens": 59597788.0, "step": 23510 }, { "entropy": 6.116839790344239, "epoch": 2.7137911136757067, "grad_norm": 1.0859375, "learning_rate": 0.0004275429590570541, "loss": 5.819, "mean_token_accuracy": 0.17778913378715516, "num_tokens": 59611045.0, "step": 23515 }, { "entropy": 6.062789058685302, "epoch": 2.7143681477207156, "grad_norm": 0.83203125, "learning_rate": 0.00042751262344791776, "loss": 5.6316, "mean_token_accuracy": 0.1953550472855568, "num_tokens": 59624251.0, "step": 23520 }, { "entropy": 6.168734741210938, "epoch": 2.7149451817657244, "grad_norm": 0.96875, "learning_rate": 0.000427482282709095, "loss": 5.769, "mean_token_accuracy": 0.18882142454385759, "num_tokens": 59635604.0, "step": 23525 }, { "entropy": 6.176315593719482, "epoch": 2.715522215810733, "grad_norm": 1.046875, "learning_rate": 0.0004274519368416065, "loss": 5.764, "mean_token_accuracy": 0.18330251425504684, "num_tokens": 59647591.0, "step": 23530 }, { "entropy": 6.176680040359497, "epoch": 2.7160992498557412, "grad_norm": 0.93359375, "learning_rate": 0.0004274215858464727, "loss": 5.8774, "mean_token_accuracy": 0.17968627959489822, "num_tokens": 59660693.0, "step": 23535 }, { "entropy": 6.156770038604736, "epoch": 2.71667628390075, "grad_norm": 0.99609375, "learning_rate": 0.00042739122972471473, "loss": 5.7895, "mean_token_accuracy": 0.1843475267291069, "num_tokens": 59673792.0, "step": 23540 }, { "entropy": 6.001822853088379, "epoch": 2.717253317945759, "grad_norm": 1.515625, "learning_rate": 0.0004273608684773534, "loss": 5.6485, "mean_token_accuracy": 0.20021015107631684, "num_tokens": 59687415.0, "step": 23545 }, { "entropy": 6.165789175033569, "epoch": 2.7178303519907674, "grad_norm": 0.96484375, "learning_rate": 0.00042733050210540984, "loss": 5.7931, "mean_token_accuracy": 0.1891214907169342, "num_tokens": 59699721.0, "step": 23550 }, { "entropy": 6.175017166137695, "epoch": 2.7184073860357763, "grad_norm": 0.9296875, "learning_rate": 0.0004273001306099056, "loss": 5.814, "mean_token_accuracy": 0.19010271430015563, "num_tokens": 59712517.0, "step": 23555 }, { "entropy": 6.080675554275513, "epoch": 2.7189844200807847, "grad_norm": 1.0390625, "learning_rate": 0.0004272697539918621, "loss": 5.7821, "mean_token_accuracy": 0.19143579602241517, "num_tokens": 59725132.0, "step": 23560 }, { "entropy": 6.092270803451538, "epoch": 2.7195614541257935, "grad_norm": 1.09375, "learning_rate": 0.0004272393722523011, "loss": 5.8172, "mean_token_accuracy": 0.18737081438302994, "num_tokens": 59738515.0, "step": 23565 }, { "entropy": 6.146021604537964, "epoch": 2.720138488170802, "grad_norm": 0.94921875, "learning_rate": 0.00042720898539224436, "loss": 5.7586, "mean_token_accuracy": 0.1918032720685005, "num_tokens": 59750141.0, "step": 23570 }, { "entropy": 6.23243556022644, "epoch": 2.720715522215811, "grad_norm": 0.9296875, "learning_rate": 0.0004271785934127141, "loss": 6.0125, "mean_token_accuracy": 0.17802267223596574, "num_tokens": 59762580.0, "step": 23575 }, { "entropy": 6.210177707672119, "epoch": 2.7212925562608192, "grad_norm": 0.99609375, "learning_rate": 0.00042714819631473234, "loss": 5.8767, "mean_token_accuracy": 0.17955715209245682, "num_tokens": 59776039.0, "step": 23580 }, { "entropy": 6.204678726196289, "epoch": 2.721869590305828, "grad_norm": 1.015625, "learning_rate": 0.00042711779409932164, "loss": 5.8523, "mean_token_accuracy": 0.18440286666154862, "num_tokens": 59789305.0, "step": 23585 }, { "entropy": 6.169595003128052, "epoch": 2.7224466243508365, "grad_norm": 1.0546875, "learning_rate": 0.00042708738676750446, "loss": 5.7659, "mean_token_accuracy": 0.19036545902490615, "num_tokens": 59801771.0, "step": 23590 }, { "entropy": 6.230128431320191, "epoch": 2.7230236583958454, "grad_norm": 0.96875, "learning_rate": 0.0004270569743203036, "loss": 5.8152, "mean_token_accuracy": 0.18158550709486007, "num_tokens": 59815281.0, "step": 23595 }, { "entropy": 6.185557126998901, "epoch": 2.7236006924408542, "grad_norm": 0.87890625, "learning_rate": 0.0004270265567587419, "loss": 5.8143, "mean_token_accuracy": 0.18081941306591034, "num_tokens": 59827292.0, "step": 23600 }, { "entropy": 6.1336852550506595, "epoch": 2.7241777264858626, "grad_norm": 0.95703125, "learning_rate": 0.00042699613408384246, "loss": 5.7825, "mean_token_accuracy": 0.18778499513864516, "num_tokens": 59840024.0, "step": 23605 }, { "entropy": 6.224751758575439, "epoch": 2.724754760530871, "grad_norm": 0.94140625, "learning_rate": 0.0004269657062966286, "loss": 5.8772, "mean_token_accuracy": 0.17981754541397094, "num_tokens": 59851499.0, "step": 23610 }, { "entropy": 6.124369859695435, "epoch": 2.72533179457588, "grad_norm": 1.0234375, "learning_rate": 0.0004269352733981238, "loss": 5.7821, "mean_token_accuracy": 0.18569391816854477, "num_tokens": 59863057.0, "step": 23615 }, { "entropy": 6.123807907104492, "epoch": 2.725908828620889, "grad_norm": 1.03125, "learning_rate": 0.00042690483538935137, "loss": 5.7824, "mean_token_accuracy": 0.18660981357097625, "num_tokens": 59876132.0, "step": 23620 }, { "entropy": 6.167468118667602, "epoch": 2.726485862665897, "grad_norm": 0.90234375, "learning_rate": 0.0004268743922713354, "loss": 5.8265, "mean_token_accuracy": 0.1824280649423599, "num_tokens": 59888543.0, "step": 23625 }, { "entropy": 6.211517953872681, "epoch": 2.727062896710906, "grad_norm": 1.0625, "learning_rate": 0.00042684394404509957, "loss": 5.7933, "mean_token_accuracy": 0.18391778320074081, "num_tokens": 59900508.0, "step": 23630 }, { "entropy": 6.127938079833984, "epoch": 2.7276399307559145, "grad_norm": 0.96484375, "learning_rate": 0.00042681349071166814, "loss": 5.8312, "mean_token_accuracy": 0.18280233144760133, "num_tokens": 59913065.0, "step": 23635 }, { "entropy": 6.210356664657593, "epoch": 2.7282169648009233, "grad_norm": 0.93359375, "learning_rate": 0.00042678303227206536, "loss": 5.8787, "mean_token_accuracy": 0.1786747008562088, "num_tokens": 59926173.0, "step": 23640 }, { "entropy": 6.241761875152588, "epoch": 2.7287939988459318, "grad_norm": 0.9296875, "learning_rate": 0.0004267525687273157, "loss": 5.8811, "mean_token_accuracy": 0.1799023285508156, "num_tokens": 59939206.0, "step": 23645 }, { "entropy": 6.265921354293823, "epoch": 2.7293710328909406, "grad_norm": 0.953125, "learning_rate": 0.00042672210007844383, "loss": 5.8631, "mean_token_accuracy": 0.18714073896408082, "num_tokens": 59951093.0, "step": 23650 }, { "entropy": 6.129597568511963, "epoch": 2.7299480669359495, "grad_norm": 0.9140625, "learning_rate": 0.00042669162632647434, "loss": 5.8481, "mean_token_accuracy": 0.17962536364793777, "num_tokens": 59962804.0, "step": 23655 }, { "entropy": 6.179275226593018, "epoch": 2.730525100980958, "grad_norm": 1.28125, "learning_rate": 0.00042666114747243243, "loss": 5.8492, "mean_token_accuracy": 0.17971125096082688, "num_tokens": 59975649.0, "step": 23660 }, { "entropy": 6.15836820602417, "epoch": 2.7311021350259663, "grad_norm": 0.96484375, "learning_rate": 0.0004266306635173432, "loss": 5.8096, "mean_token_accuracy": 0.18173106014728546, "num_tokens": 59989496.0, "step": 23665 }, { "entropy": 6.243234539031983, "epoch": 2.731679169070975, "grad_norm": 0.96875, "learning_rate": 0.0004266001744622319, "loss": 5.9029, "mean_token_accuracy": 0.18467528074979783, "num_tokens": 60002125.0, "step": 23670 }, { "entropy": 6.198999881744385, "epoch": 2.732256203115984, "grad_norm": 0.9609375, "learning_rate": 0.000426569680308124, "loss": 5.8536, "mean_token_accuracy": 0.1782796248793602, "num_tokens": 60013395.0, "step": 23675 }, { "entropy": 6.21286907196045, "epoch": 2.7328332371609925, "grad_norm": 0.93359375, "learning_rate": 0.00042653918105604524, "loss": 5.8317, "mean_token_accuracy": 0.1833585724234581, "num_tokens": 60026527.0, "step": 23680 }, { "entropy": 6.197463417053223, "epoch": 2.733410271206001, "grad_norm": 0.98046875, "learning_rate": 0.00042650867670702123, "loss": 5.905, "mean_token_accuracy": 0.18060424476861953, "num_tokens": 60039671.0, "step": 23685 }, { "entropy": 6.147560119628906, "epoch": 2.7339873052510097, "grad_norm": 0.91796875, "learning_rate": 0.0004264781672620783, "loss": 5.8248, "mean_token_accuracy": 0.18963334411382676, "num_tokens": 60051908.0, "step": 23690 }, { "entropy": 6.218137741088867, "epoch": 2.7345643392960186, "grad_norm": 0.91015625, "learning_rate": 0.0004264476527222425, "loss": 5.8712, "mean_token_accuracy": 0.18271903246641158, "num_tokens": 60065295.0, "step": 23695 }, { "entropy": 6.164173746109009, "epoch": 2.735141373341027, "grad_norm": 0.9453125, "learning_rate": 0.0004264171330885401, "loss": 5.7658, "mean_token_accuracy": 0.18747562766075135, "num_tokens": 60076903.0, "step": 23700 }, { "entropy": 6.170087385177612, "epoch": 2.735718407386036, "grad_norm": 0.91796875, "learning_rate": 0.00042638660836199756, "loss": 5.8227, "mean_token_accuracy": 0.175394731760025, "num_tokens": 60089091.0, "step": 23705 }, { "entropy": 6.17940125465393, "epoch": 2.7362954414310443, "grad_norm": 1.2109375, "learning_rate": 0.00042635607854364166, "loss": 5.7276, "mean_token_accuracy": 0.18890163749456407, "num_tokens": 60100986.0, "step": 23710 }, { "entropy": 6.069400596618652, "epoch": 2.736872475476053, "grad_norm": 0.9609375, "learning_rate": 0.00042632554363449926, "loss": 5.7463, "mean_token_accuracy": 0.1896691083908081, "num_tokens": 60113806.0, "step": 23715 }, { "entropy": 6.206710290908814, "epoch": 2.7374495095210616, "grad_norm": 0.96484375, "learning_rate": 0.00042629500363559734, "loss": 5.8174, "mean_token_accuracy": 0.1911667987704277, "num_tokens": 60126076.0, "step": 23720 }, { "entropy": 6.235867977142334, "epoch": 2.7380265435660704, "grad_norm": 0.90625, "learning_rate": 0.00042626445854796326, "loss": 5.896, "mean_token_accuracy": 0.18047737032175065, "num_tokens": 60139435.0, "step": 23725 }, { "entropy": 6.174714612960815, "epoch": 2.7386035776110793, "grad_norm": 0.9375, "learning_rate": 0.0004262339083726241, "loss": 5.8573, "mean_token_accuracy": 0.17811036556959153, "num_tokens": 60152252.0, "step": 23730 }, { "entropy": 6.1112288475036625, "epoch": 2.7391806116560877, "grad_norm": 1.2109375, "learning_rate": 0.0004262033531106076, "loss": 5.7212, "mean_token_accuracy": 0.18555221408605577, "num_tokens": 60164575.0, "step": 23735 }, { "entropy": 6.204973840713501, "epoch": 2.739757645701096, "grad_norm": 1.0078125, "learning_rate": 0.00042617279276294145, "loss": 5.8614, "mean_token_accuracy": 0.17902258932590484, "num_tokens": 60177085.0, "step": 23740 }, { "entropy": 6.185987663269043, "epoch": 2.740334679746105, "grad_norm": 1.0390625, "learning_rate": 0.0004261422273306535, "loss": 5.787, "mean_token_accuracy": 0.18618640303611755, "num_tokens": 60188923.0, "step": 23745 }, { "entropy": 6.16752028465271, "epoch": 2.740911713791114, "grad_norm": 1.03125, "learning_rate": 0.0004261116568147718, "loss": 5.8181, "mean_token_accuracy": 0.18826280981302262, "num_tokens": 60200439.0, "step": 23750 }, { "entropy": 6.118758583068848, "epoch": 2.7414887478361223, "grad_norm": 0.921875, "learning_rate": 0.0004260810812163246, "loss": 5.7694, "mean_token_accuracy": 0.19570343494415282, "num_tokens": 60213618.0, "step": 23755 }, { "entropy": 6.246321058273315, "epoch": 2.742065781881131, "grad_norm": 1.1171875, "learning_rate": 0.00042605050053634027, "loss": 5.851, "mean_token_accuracy": 0.18420463651418686, "num_tokens": 60225617.0, "step": 23760 }, { "entropy": 6.147588872909546, "epoch": 2.7426428159261396, "grad_norm": 0.953125, "learning_rate": 0.0004260199147758474, "loss": 5.7904, "mean_token_accuracy": 0.18074362277984618, "num_tokens": 60238406.0, "step": 23765 }, { "entropy": 6.154901933670044, "epoch": 2.7432198499711484, "grad_norm": 0.92578125, "learning_rate": 0.0004259893239358747, "loss": 5.8856, "mean_token_accuracy": 0.17359059005975724, "num_tokens": 60250733.0, "step": 23770 }, { "entropy": 6.17216010093689, "epoch": 2.743796884016157, "grad_norm": 0.91015625, "learning_rate": 0.00042595872801745106, "loss": 5.7994, "mean_token_accuracy": 0.18428043723106385, "num_tokens": 60262625.0, "step": 23775 }, { "entropy": 6.229062128067016, "epoch": 2.7443739180611657, "grad_norm": 0.953125, "learning_rate": 0.0004259281270216056, "loss": 5.9112, "mean_token_accuracy": 0.18263706117868422, "num_tokens": 60274428.0, "step": 23780 }, { "entropy": 6.202558994293213, "epoch": 2.744950952106174, "grad_norm": 1.1875, "learning_rate": 0.00042589752094936763, "loss": 5.9094, "mean_token_accuracy": 0.17718964219093322, "num_tokens": 60286131.0, "step": 23785 }, { "entropy": 6.151939344406128, "epoch": 2.745527986151183, "grad_norm": 0.9140625, "learning_rate": 0.0004258669098017664, "loss": 5.7916, "mean_token_accuracy": 0.18867217451334, "num_tokens": 60299151.0, "step": 23790 }, { "entropy": 6.088631534576416, "epoch": 2.7461050201961914, "grad_norm": 1.0546875, "learning_rate": 0.00042583629357983164, "loss": 5.7308, "mean_token_accuracy": 0.1825684502720833, "num_tokens": 60311557.0, "step": 23795 }, { "entropy": 6.234161376953125, "epoch": 2.7466820542412003, "grad_norm": 1.359375, "learning_rate": 0.00042580567228459303, "loss": 5.8852, "mean_token_accuracy": 0.17799129337072372, "num_tokens": 60324364.0, "step": 23800 }, { "entropy": 6.242687606811524, "epoch": 2.747259088286209, "grad_norm": 1.0078125, "learning_rate": 0.0004257750459170806, "loss": 5.8751, "mean_token_accuracy": 0.18489039391279222, "num_tokens": 60336141.0, "step": 23805 }, { "entropy": 6.207920408248901, "epoch": 2.7478361223312175, "grad_norm": 0.98046875, "learning_rate": 0.00042574441447832436, "loss": 5.866, "mean_token_accuracy": 0.18113742619752884, "num_tokens": 60349006.0, "step": 23810 }, { "entropy": 6.169639921188354, "epoch": 2.748413156376226, "grad_norm": 0.9375, "learning_rate": 0.0004257137779693546, "loss": 5.8399, "mean_token_accuracy": 0.18505763113498688, "num_tokens": 60361361.0, "step": 23815 }, { "entropy": 6.1327532768249515, "epoch": 2.748990190421235, "grad_norm": 0.8515625, "learning_rate": 0.0004256831363912018, "loss": 5.8371, "mean_token_accuracy": 0.1820719614624977, "num_tokens": 60375261.0, "step": 23820 }, { "entropy": 6.17534327507019, "epoch": 2.7495672244662437, "grad_norm": 0.9921875, "learning_rate": 0.00042565248974489654, "loss": 5.738, "mean_token_accuracy": 0.18637765496969222, "num_tokens": 60387129.0, "step": 23825 }, { "entropy": 6.1087689876556395, "epoch": 2.750144258511252, "grad_norm": 0.91796875, "learning_rate": 0.0004256218380314697, "loss": 5.7644, "mean_token_accuracy": 0.19168006926774978, "num_tokens": 60398581.0, "step": 23830 }, { "entropy": 6.216979026794434, "epoch": 2.750721292556261, "grad_norm": 0.93359375, "learning_rate": 0.0004255911812519521, "loss": 5.867, "mean_token_accuracy": 0.18237381279468537, "num_tokens": 60412105.0, "step": 23835 }, { "entropy": 6.239885520935059, "epoch": 2.7512983266012694, "grad_norm": 0.859375, "learning_rate": 0.0004255605194073749, "loss": 5.7899, "mean_token_accuracy": 0.18544149100780488, "num_tokens": 60423880.0, "step": 23840 }, { "entropy": 6.188281583786011, "epoch": 2.7518753606462782, "grad_norm": 0.921875, "learning_rate": 0.0004255298524987695, "loss": 5.8774, "mean_token_accuracy": 0.17875241339206696, "num_tokens": 60435968.0, "step": 23845 }, { "entropy": 6.1402302265167235, "epoch": 2.7524523946912867, "grad_norm": 0.890625, "learning_rate": 0.0004254991805271672, "loss": 5.8443, "mean_token_accuracy": 0.17654843181371688, "num_tokens": 60449003.0, "step": 23850 }, { "entropy": 6.2346738338470455, "epoch": 2.7530294287362955, "grad_norm": 0.97265625, "learning_rate": 0.00042546850349359976, "loss": 5.8464, "mean_token_accuracy": 0.17728771269321442, "num_tokens": 60462083.0, "step": 23855 }, { "entropy": 6.215177822113037, "epoch": 2.753606462781304, "grad_norm": 0.96484375, "learning_rate": 0.00042543782139909894, "loss": 5.8151, "mean_token_accuracy": 0.1816414251923561, "num_tokens": 60473804.0, "step": 23860 }, { "entropy": 6.173917818069458, "epoch": 2.754183496826313, "grad_norm": 0.91015625, "learning_rate": 0.00042540713424469667, "loss": 5.8632, "mean_token_accuracy": 0.18780239522457123, "num_tokens": 60486361.0, "step": 23865 }, { "entropy": 6.1345775604248045, "epoch": 2.7547605308713212, "grad_norm": 0.94140625, "learning_rate": 0.00042537644203142523, "loss": 5.7347, "mean_token_accuracy": 0.19797743409872054, "num_tokens": 60498522.0, "step": 23870 }, { "entropy": 6.249479818344116, "epoch": 2.75533756491633, "grad_norm": 0.94140625, "learning_rate": 0.00042534574476031683, "loss": 5.9229, "mean_token_accuracy": 0.17691561430692673, "num_tokens": 60510974.0, "step": 23875 }, { "entropy": 6.248273038864136, "epoch": 2.755914598961339, "grad_norm": 1.0390625, "learning_rate": 0.000425315042432404, "loss": 5.8542, "mean_token_accuracy": 0.18343111127614975, "num_tokens": 60524756.0, "step": 23880 }, { "entropy": 6.040663337707519, "epoch": 2.7564916330063474, "grad_norm": 0.9453125, "learning_rate": 0.00042528433504871935, "loss": 5.7302, "mean_token_accuracy": 0.19474226385354995, "num_tokens": 60536286.0, "step": 23885 }, { "entropy": 6.215526485443116, "epoch": 2.757068667051356, "grad_norm": 0.9140625, "learning_rate": 0.0004252536226102958, "loss": 5.8284, "mean_token_accuracy": 0.1841632381081581, "num_tokens": 60548971.0, "step": 23890 }, { "entropy": 6.172806930541992, "epoch": 2.7576457010963646, "grad_norm": 1.046875, "learning_rate": 0.0004252229051181662, "loss": 5.8706, "mean_token_accuracy": 0.1718157559633255, "num_tokens": 60562078.0, "step": 23895 }, { "entropy": 6.1992229461669925, "epoch": 2.7582227351413735, "grad_norm": 1.0390625, "learning_rate": 0.00042519218257336383, "loss": 5.8082, "mean_token_accuracy": 0.18301571756601334, "num_tokens": 60575378.0, "step": 23900 }, { "entropy": 6.12810206413269, "epoch": 2.758799769186382, "grad_norm": 0.875, "learning_rate": 0.00042516145497692204, "loss": 5.8073, "mean_token_accuracy": 0.18741518259048462, "num_tokens": 60588958.0, "step": 23905 }, { "entropy": 6.090682315826416, "epoch": 2.759376803231391, "grad_norm": 1.078125, "learning_rate": 0.00042513072232987426, "loss": 5.7329, "mean_token_accuracy": 0.19598086625337602, "num_tokens": 60600904.0, "step": 23910 }, { "entropy": 6.212270641326905, "epoch": 2.759953837276399, "grad_norm": 0.98046875, "learning_rate": 0.0004250999846332543, "loss": 5.785, "mean_token_accuracy": 0.18600962162017823, "num_tokens": 60612655.0, "step": 23915 }, { "entropy": 6.168171691894531, "epoch": 2.760530871321408, "grad_norm": 0.94921875, "learning_rate": 0.00042506924188809574, "loss": 5.8476, "mean_token_accuracy": 0.1838272586464882, "num_tokens": 60625491.0, "step": 23920 }, { "entropy": 6.154070663452148, "epoch": 2.7611079053664165, "grad_norm": 0.9921875, "learning_rate": 0.000425038494095433, "loss": 5.8238, "mean_token_accuracy": 0.18354423195123673, "num_tokens": 60637814.0, "step": 23925 }, { "entropy": 6.20363221168518, "epoch": 2.7616849394114253, "grad_norm": 1.109375, "learning_rate": 0.00042500774125629986, "loss": 5.8165, "mean_token_accuracy": 0.18765195161104203, "num_tokens": 60650031.0, "step": 23930 }, { "entropy": 6.206214237213135, "epoch": 2.762261973456434, "grad_norm": 0.9296875, "learning_rate": 0.0004249769833717309, "loss": 5.8362, "mean_token_accuracy": 0.18461532145738602, "num_tokens": 60662257.0, "step": 23935 }, { "entropy": 6.219572067260742, "epoch": 2.7628390075014426, "grad_norm": 0.92578125, "learning_rate": 0.00042494622044276066, "loss": 5.8635, "mean_token_accuracy": 0.18422316014766693, "num_tokens": 60675557.0, "step": 23940 }, { "entropy": 6.136008644104004, "epoch": 2.763416041546451, "grad_norm": 0.953125, "learning_rate": 0.0004249154524704237, "loss": 5.8008, "mean_token_accuracy": 0.18340324759483337, "num_tokens": 60686984.0, "step": 23945 }, { "entropy": 6.2107688903808596, "epoch": 2.76399307559146, "grad_norm": 0.984375, "learning_rate": 0.000424884679455755, "loss": 5.8884, "mean_token_accuracy": 0.17726579159498215, "num_tokens": 60698904.0, "step": 23950 }, { "entropy": 6.175592947006225, "epoch": 2.7645701096364688, "grad_norm": 0.8984375, "learning_rate": 0.00042485390139978955, "loss": 5.798, "mean_token_accuracy": 0.18251847475767136, "num_tokens": 60710972.0, "step": 23955 }, { "entropy": 6.187010955810547, "epoch": 2.765147143681477, "grad_norm": 0.94921875, "learning_rate": 0.0004248231183035626, "loss": 5.8954, "mean_token_accuracy": 0.18239185959100723, "num_tokens": 60723780.0, "step": 23960 }, { "entropy": 6.154711198806763, "epoch": 2.7657241777264856, "grad_norm": 0.953125, "learning_rate": 0.0004247923301681095, "loss": 5.7858, "mean_token_accuracy": 0.1891516774892807, "num_tokens": 60735381.0, "step": 23965 }, { "entropy": 6.0915274143219, "epoch": 2.7663012117714945, "grad_norm": 0.8984375, "learning_rate": 0.00042476153699446567, "loss": 5.7645, "mean_token_accuracy": 0.19561954885721206, "num_tokens": 60748495.0, "step": 23970 }, { "entropy": 6.231597948074341, "epoch": 2.7668782458165033, "grad_norm": 0.90234375, "learning_rate": 0.00042473073878366695, "loss": 5.8777, "mean_token_accuracy": 0.17465647608041762, "num_tokens": 60761984.0, "step": 23975 }, { "entropy": 6.224951648712159, "epoch": 2.7674552798615117, "grad_norm": 1.171875, "learning_rate": 0.0004246999355367493, "loss": 5.8824, "mean_token_accuracy": 0.1791698306798935, "num_tokens": 60774590.0, "step": 23980 }, { "entropy": 6.245056867599487, "epoch": 2.7680323139065206, "grad_norm": 0.859375, "learning_rate": 0.00042466912725474865, "loss": 5.8721, "mean_token_accuracy": 0.18126921802759172, "num_tokens": 60788647.0, "step": 23985 }, { "entropy": 6.220222806930542, "epoch": 2.768609347951529, "grad_norm": 1.15625, "learning_rate": 0.00042463831393870123, "loss": 5.8197, "mean_token_accuracy": 0.18331341594457626, "num_tokens": 60799913.0, "step": 23990 }, { "entropy": 6.18059401512146, "epoch": 2.769186381996538, "grad_norm": 0.94140625, "learning_rate": 0.00042460749558964346, "loss": 5.9081, "mean_token_accuracy": 0.17576878666877746, "num_tokens": 60812343.0, "step": 23995 }, { "entropy": 6.242327404022217, "epoch": 2.7697634160415463, "grad_norm": 0.96875, "learning_rate": 0.0004245766722086118, "loss": 5.8221, "mean_token_accuracy": 0.1815970480442047, "num_tokens": 60824677.0, "step": 24000 }, { "epoch": 2.7697634160415463, "eval_entropy": 6.063597902168358, "eval_loss": 5.926702976226807, "eval_mean_token_accuracy": 0.1853055248070346, "eval_num_tokens": 60824677.0, "eval_runtime": 22.7196, "eval_samples_per_second": 1238.402, "eval_steps_per_second": 154.8, "step": 24000 }, { "entropy": 6.19868278503418, "epoch": 2.770340450086555, "grad_norm": 1.015625, "learning_rate": 0.00042454584379664326, "loss": 5.8272, "mean_token_accuracy": 0.18617044091224672, "num_tokens": 60837453.0, "step": 24005 }, { "entropy": 6.142568969726563, "epoch": 2.770917484131564, "grad_norm": 1.0, "learning_rate": 0.0004245150103547744, "loss": 5.7947, "mean_token_accuracy": 0.18765759468078613, "num_tokens": 60850229.0, "step": 24010 }, { "entropy": 6.224448204040527, "epoch": 2.7714945181765724, "grad_norm": 0.94921875, "learning_rate": 0.00042448417188404246, "loss": 5.809, "mean_token_accuracy": 0.1853519007563591, "num_tokens": 60862108.0, "step": 24015 }, { "entropy": 6.148353958129883, "epoch": 2.772071552221581, "grad_norm": 1.03125, "learning_rate": 0.0004244533283854847, "loss": 5.8472, "mean_token_accuracy": 0.18446369469165802, "num_tokens": 60875339.0, "step": 24020 }, { "entropy": 6.144625186920166, "epoch": 2.7726485862665897, "grad_norm": 0.94140625, "learning_rate": 0.0004244224798601385, "loss": 5.8111, "mean_token_accuracy": 0.1819521129131317, "num_tokens": 60888869.0, "step": 24025 }, { "entropy": 6.181143283843994, "epoch": 2.7732256203115986, "grad_norm": 1.015625, "learning_rate": 0.00042439162630904134, "loss": 5.8931, "mean_token_accuracy": 0.17629420906305313, "num_tokens": 60902344.0, "step": 24030 }, { "entropy": 6.243525695800781, "epoch": 2.773802654356607, "grad_norm": 0.984375, "learning_rate": 0.0004243607677332311, "loss": 5.8645, "mean_token_accuracy": 0.17917369455099105, "num_tokens": 60915114.0, "step": 24035 }, { "entropy": 6.192512559890747, "epoch": 2.7743796884016154, "grad_norm": 1.140625, "learning_rate": 0.00042432990413374556, "loss": 5.7962, "mean_token_accuracy": 0.18864602446556092, "num_tokens": 60928228.0, "step": 24040 }, { "entropy": 6.135471296310425, "epoch": 2.7749567224466243, "grad_norm": 1.21875, "learning_rate": 0.00042429903551162283, "loss": 5.7809, "mean_token_accuracy": 0.1851405009627342, "num_tokens": 60941923.0, "step": 24045 }, { "entropy": 6.176653289794922, "epoch": 2.775533756491633, "grad_norm": 1.03125, "learning_rate": 0.0004242681618679013, "loss": 5.7971, "mean_token_accuracy": 0.1788968861103058, "num_tokens": 60955537.0, "step": 24050 }, { "entropy": 6.1557084083557125, "epoch": 2.7761107905366416, "grad_norm": 0.9140625, "learning_rate": 0.00042423728320361924, "loss": 5.8469, "mean_token_accuracy": 0.18565410226583481, "num_tokens": 60968121.0, "step": 24055 }, { "entropy": 6.171410846710205, "epoch": 2.7766878245816504, "grad_norm": 1.0859375, "learning_rate": 0.00042420639951981534, "loss": 5.7975, "mean_token_accuracy": 0.186527718603611, "num_tokens": 60980256.0, "step": 24060 }, { "entropy": 6.258060264587402, "epoch": 2.777264858626659, "grad_norm": 1.0546875, "learning_rate": 0.00042417551081752825, "loss": 5.8906, "mean_token_accuracy": 0.176424802839756, "num_tokens": 60992989.0, "step": 24065 }, { "entropy": 6.216572904586792, "epoch": 2.7778418926716677, "grad_norm": 1.09375, "learning_rate": 0.00042414461709779696, "loss": 5.8576, "mean_token_accuracy": 0.17997607290744783, "num_tokens": 61005792.0, "step": 24070 }, { "entropy": 6.156715631484985, "epoch": 2.778418926716676, "grad_norm": 0.84765625, "learning_rate": 0.0004241137183616606, "loss": 5.8729, "mean_token_accuracy": 0.18681135177612304, "num_tokens": 61019448.0, "step": 24075 }, { "entropy": 6.177115440368652, "epoch": 2.778995960761685, "grad_norm": 0.87890625, "learning_rate": 0.0004240828146101584, "loss": 5.7828, "mean_token_accuracy": 0.18995569050312042, "num_tokens": 61033449.0, "step": 24080 }, { "entropy": 6.263371229171753, "epoch": 2.779572994806694, "grad_norm": 0.9375, "learning_rate": 0.00042405190584432966, "loss": 5.8635, "mean_token_accuracy": 0.18435943126678467, "num_tokens": 61044912.0, "step": 24085 }, { "entropy": 6.180558919906616, "epoch": 2.7801500288517023, "grad_norm": 0.97265625, "learning_rate": 0.0004240209920652142, "loss": 5.7965, "mean_token_accuracy": 0.1852031782269478, "num_tokens": 61057003.0, "step": 24090 }, { "entropy": 6.15169939994812, "epoch": 2.7807270628967107, "grad_norm": 0.99609375, "learning_rate": 0.00042399007327385173, "loss": 5.7984, "mean_token_accuracy": 0.18453529328107834, "num_tokens": 61068721.0, "step": 24095 }, { "entropy": 6.172250032424927, "epoch": 2.7813040969417195, "grad_norm": 1.0546875, "learning_rate": 0.0004239591494712821, "loss": 5.7722, "mean_token_accuracy": 0.18817009627819062, "num_tokens": 61081938.0, "step": 24100 }, { "entropy": 6.201770067214966, "epoch": 2.7818811309867284, "grad_norm": 0.97265625, "learning_rate": 0.0004239282206585455, "loss": 5.8643, "mean_token_accuracy": 0.18166793286800384, "num_tokens": 61094918.0, "step": 24105 }, { "entropy": 6.125176095962525, "epoch": 2.782458165031737, "grad_norm": 0.96484375, "learning_rate": 0.0004238972868366822, "loss": 5.7933, "mean_token_accuracy": 0.18579421043395997, "num_tokens": 61107201.0, "step": 24110 }, { "entropy": 6.129706287384034, "epoch": 2.7830351990767457, "grad_norm": 1.0078125, "learning_rate": 0.00042386634800673255, "loss": 5.6957, "mean_token_accuracy": 0.20030567944049835, "num_tokens": 61121092.0, "step": 24115 }, { "entropy": 6.168320417404175, "epoch": 2.783612233121754, "grad_norm": 1.0078125, "learning_rate": 0.0004238354041697372, "loss": 5.8612, "mean_token_accuracy": 0.1814897760748863, "num_tokens": 61133819.0, "step": 24120 }, { "entropy": 6.208771133422852, "epoch": 2.784189267166763, "grad_norm": 1.0625, "learning_rate": 0.00042380445532673705, "loss": 5.9235, "mean_token_accuracy": 0.17213354408740997, "num_tokens": 61147182.0, "step": 24125 }, { "entropy": 6.264519929885864, "epoch": 2.7847663012117714, "grad_norm": 0.92578125, "learning_rate": 0.0004237735014787729, "loss": 5.9022, "mean_token_accuracy": 0.1765430524945259, "num_tokens": 61159729.0, "step": 24130 }, { "entropy": 6.2641078472137455, "epoch": 2.7853433352567802, "grad_norm": 1.0234375, "learning_rate": 0.000423742542626886, "loss": 5.8449, "mean_token_accuracy": 0.1809821233153343, "num_tokens": 61172528.0, "step": 24135 }, { "entropy": 6.265717029571533, "epoch": 2.7859203693017887, "grad_norm": 1.015625, "learning_rate": 0.0004237115787721176, "loss": 5.9428, "mean_token_accuracy": 0.175088506937027, "num_tokens": 61186874.0, "step": 24140 }, { "entropy": 6.226970577239991, "epoch": 2.7864974033467975, "grad_norm": 0.98828125, "learning_rate": 0.00042368060991550895, "loss": 5.7829, "mean_token_accuracy": 0.1872684195637703, "num_tokens": 61199353.0, "step": 24145 }, { "entropy": 6.1586408615112305, "epoch": 2.787074437391806, "grad_norm": 0.890625, "learning_rate": 0.0004236496360581019, "loss": 5.8003, "mean_token_accuracy": 0.18614619225263596, "num_tokens": 61211799.0, "step": 24150 }, { "entropy": 6.219261741638183, "epoch": 2.787651471436815, "grad_norm": 1.0078125, "learning_rate": 0.00042361865720093826, "loss": 5.837, "mean_token_accuracy": 0.18358803391456605, "num_tokens": 61225029.0, "step": 24155 }, { "entropy": 6.140805244445801, "epoch": 2.7882285054818237, "grad_norm": 1.328125, "learning_rate": 0.00042358767334505984, "loss": 5.7485, "mean_token_accuracy": 0.18711104840040207, "num_tokens": 61238415.0, "step": 24160 }, { "entropy": 6.15421233177185, "epoch": 2.788805539526832, "grad_norm": 0.98828125, "learning_rate": 0.00042355668449150884, "loss": 5.8419, "mean_token_accuracy": 0.1833636298775673, "num_tokens": 61251193.0, "step": 24165 }, { "entropy": 6.163024520874023, "epoch": 2.7893825735718405, "grad_norm": 0.98828125, "learning_rate": 0.00042352569064132756, "loss": 5.8197, "mean_token_accuracy": 0.18791975378990172, "num_tokens": 61264752.0, "step": 24170 }, { "entropy": 6.17081298828125, "epoch": 2.7899596076168494, "grad_norm": 1.203125, "learning_rate": 0.00042349469179555845, "loss": 5.8006, "mean_token_accuracy": 0.19208011627197266, "num_tokens": 61277409.0, "step": 24175 }, { "entropy": 6.171252822875976, "epoch": 2.790536641661858, "grad_norm": 0.984375, "learning_rate": 0.00042346368795524416, "loss": 5.7636, "mean_token_accuracy": 0.18603039532899857, "num_tokens": 61288810.0, "step": 24180 }, { "entropy": 6.219677972793579, "epoch": 2.7911136757068666, "grad_norm": 0.99609375, "learning_rate": 0.0004234326791214274, "loss": 5.7651, "mean_token_accuracy": 0.18796777874231338, "num_tokens": 61301080.0, "step": 24185 }, { "entropy": 6.190580749511719, "epoch": 2.7916907097518755, "grad_norm": 0.94140625, "learning_rate": 0.0004234016652951513, "loss": 5.8611, "mean_token_accuracy": 0.1816395029425621, "num_tokens": 61313202.0, "step": 24190 }, { "entropy": 6.104137182235718, "epoch": 2.792267743796884, "grad_norm": 1.046875, "learning_rate": 0.00042337064647745887, "loss": 5.7755, "mean_token_accuracy": 0.18244900554418564, "num_tokens": 61326090.0, "step": 24195 }, { "entropy": 6.272701168060303, "epoch": 2.792844777841893, "grad_norm": 0.921875, "learning_rate": 0.00042333962266939343, "loss": 5.8703, "mean_token_accuracy": 0.1829444631934166, "num_tokens": 61338640.0, "step": 24200 }, { "entropy": 6.183998870849609, "epoch": 2.793421811886901, "grad_norm": 0.87890625, "learning_rate": 0.00042330859387199846, "loss": 5.7816, "mean_token_accuracy": 0.19163548201322556, "num_tokens": 61351324.0, "step": 24205 }, { "entropy": 6.169540452957153, "epoch": 2.79399884593191, "grad_norm": 0.890625, "learning_rate": 0.0004232775600863176, "loss": 5.7587, "mean_token_accuracy": 0.1945983037352562, "num_tokens": 61362547.0, "step": 24210 }, { "entropy": 6.0055286407470705, "epoch": 2.7945758799769185, "grad_norm": 0.84765625, "learning_rate": 0.00042324652131339475, "loss": 5.6191, "mean_token_accuracy": 0.2038264036178589, "num_tokens": 61376084.0, "step": 24215 }, { "entropy": 6.18643159866333, "epoch": 2.7951529140219273, "grad_norm": 0.921875, "learning_rate": 0.0004232154775542737, "loss": 5.8277, "mean_token_accuracy": 0.18713755309581756, "num_tokens": 61388440.0, "step": 24220 }, { "entropy": 6.238617372512818, "epoch": 2.7957299480669358, "grad_norm": 1.0859375, "learning_rate": 0.0004231844288099987, "loss": 5.8876, "mean_token_accuracy": 0.17568867206573485, "num_tokens": 61402255.0, "step": 24225 }, { "entropy": 6.165315437316894, "epoch": 2.7963069821119446, "grad_norm": 0.91796875, "learning_rate": 0.00042315337508161405, "loss": 5.7447, "mean_token_accuracy": 0.18500784784555435, "num_tokens": 61414871.0, "step": 24230 }, { "entropy": 6.181436586380005, "epoch": 2.7968840161569535, "grad_norm": 0.984375, "learning_rate": 0.00042312231637016423, "loss": 5.8117, "mean_token_accuracy": 0.18590328246355056, "num_tokens": 61427127.0, "step": 24235 }, { "entropy": 6.183506155014038, "epoch": 2.797461050201962, "grad_norm": 1.0, "learning_rate": 0.00042309125267669386, "loss": 5.7866, "mean_token_accuracy": 0.1843393936753273, "num_tokens": 61439191.0, "step": 24240 }, { "entropy": 6.134817886352539, "epoch": 2.7980380842469703, "grad_norm": 1.2109375, "learning_rate": 0.0004230601840022478, "loss": 5.7783, "mean_token_accuracy": 0.18546461462974548, "num_tokens": 61452508.0, "step": 24245 }, { "entropy": 6.21579909324646, "epoch": 2.798615118291979, "grad_norm": 1.0703125, "learning_rate": 0.000423029110347871, "loss": 5.8466, "mean_token_accuracy": 0.17796468436717988, "num_tokens": 61466475.0, "step": 24250 }, { "entropy": 6.159425258636475, "epoch": 2.799192152336988, "grad_norm": 0.921875, "learning_rate": 0.00042299803171460854, "loss": 5.7605, "mean_token_accuracy": 0.1877009317278862, "num_tokens": 61478523.0, "step": 24255 }, { "entropy": 6.210866689682007, "epoch": 2.7997691863819965, "grad_norm": 0.83984375, "learning_rate": 0.00042296694810350585, "loss": 5.7951, "mean_token_accuracy": 0.18575677275657654, "num_tokens": 61490591.0, "step": 24260 }, { "entropy": 6.19249119758606, "epoch": 2.8003462204270053, "grad_norm": 1.0078125, "learning_rate": 0.0004229358595156083, "loss": 5.8166, "mean_token_accuracy": 0.18493679761886597, "num_tokens": 61503414.0, "step": 24265 }, { "entropy": 6.172161340713501, "epoch": 2.8009232544720137, "grad_norm": 1.015625, "learning_rate": 0.0004229047659519617, "loss": 5.7625, "mean_token_accuracy": 0.19090480357408524, "num_tokens": 61516655.0, "step": 24270 }, { "entropy": 6.3251043319702145, "epoch": 2.8015002885170226, "grad_norm": 1.03125, "learning_rate": 0.0004228736674136117, "loss": 5.9208, "mean_token_accuracy": 0.18344197422266006, "num_tokens": 61529589.0, "step": 24275 }, { "entropy": 6.168008756637573, "epoch": 2.802077322562031, "grad_norm": 0.91015625, "learning_rate": 0.0004228425639016044, "loss": 5.7674, "mean_token_accuracy": 0.18482994735240937, "num_tokens": 61541648.0, "step": 24280 }, { "entropy": 6.171618986129761, "epoch": 2.80265435660704, "grad_norm": 1.4921875, "learning_rate": 0.0004228114554169858, "loss": 5.8482, "mean_token_accuracy": 0.18270285427570343, "num_tokens": 61552864.0, "step": 24285 }, { "entropy": 6.185155296325684, "epoch": 2.8032313906520487, "grad_norm": 0.9296875, "learning_rate": 0.0004227803419608024, "loss": 5.9095, "mean_token_accuracy": 0.17858732789754866, "num_tokens": 61565179.0, "step": 24290 }, { "entropy": 6.277147340774536, "epoch": 2.803808424697057, "grad_norm": 0.94140625, "learning_rate": 0.00042274922353410056, "loss": 5.8606, "mean_token_accuracy": 0.18767596781253815, "num_tokens": 61577386.0, "step": 24295 }, { "entropy": 6.189168405532837, "epoch": 2.8043854587420656, "grad_norm": 0.90234375, "learning_rate": 0.00042271810013792696, "loss": 5.8136, "mean_token_accuracy": 0.1885599747300148, "num_tokens": 61590519.0, "step": 24300 }, { "entropy": 6.151488494873047, "epoch": 2.8049624927870744, "grad_norm": 0.875, "learning_rate": 0.0004226869717733285, "loss": 5.8437, "mean_token_accuracy": 0.18423136025667192, "num_tokens": 61603323.0, "step": 24305 }, { "entropy": 6.205613613128662, "epoch": 2.8055395268320833, "grad_norm": 0.9296875, "learning_rate": 0.00042265583844135207, "loss": 5.7631, "mean_token_accuracy": 0.18863353431224822, "num_tokens": 61615637.0, "step": 24310 }, { "entropy": 6.155217981338501, "epoch": 2.8061165608770917, "grad_norm": 1.078125, "learning_rate": 0.00042262470014304486, "loss": 5.7638, "mean_token_accuracy": 0.19537921100854874, "num_tokens": 61628004.0, "step": 24315 }, { "entropy": 6.1550205707550045, "epoch": 2.8066935949221, "grad_norm": 0.9453125, "learning_rate": 0.0004225935568794542, "loss": 5.7275, "mean_token_accuracy": 0.19332590252161025, "num_tokens": 61641274.0, "step": 24320 }, { "entropy": 6.209946870803833, "epoch": 2.807270628967109, "grad_norm": 0.9921875, "learning_rate": 0.00042256240865162764, "loss": 5.9141, "mean_token_accuracy": 0.1799610212445259, "num_tokens": 61654398.0, "step": 24325 }, { "entropy": 6.233845233917236, "epoch": 2.807847663012118, "grad_norm": 1.015625, "learning_rate": 0.00042253125546061265, "loss": 5.873, "mean_token_accuracy": 0.17753645926713943, "num_tokens": 61667261.0, "step": 24330 }, { "entropy": 6.28053126335144, "epoch": 2.8084246970571263, "grad_norm": 0.95703125, "learning_rate": 0.0004225000973074572, "loss": 5.9042, "mean_token_accuracy": 0.18290190845727922, "num_tokens": 61678871.0, "step": 24335 }, { "entropy": 6.1552042961120605, "epoch": 2.809001731102135, "grad_norm": 0.90234375, "learning_rate": 0.00042246893419320923, "loss": 5.8203, "mean_token_accuracy": 0.19056282788515091, "num_tokens": 61692124.0, "step": 24340 }, { "entropy": 6.1690881729125975, "epoch": 2.8095787651471436, "grad_norm": 0.95703125, "learning_rate": 0.000422437766118917, "loss": 6.0049, "mean_token_accuracy": 0.18519874513149262, "num_tokens": 61704164.0, "step": 24345 }, { "entropy": 6.116635322570801, "epoch": 2.8101557991921524, "grad_norm": 1.1015625, "learning_rate": 0.0004224065930856286, "loss": 5.7702, "mean_token_accuracy": 0.18663939386606215, "num_tokens": 61716031.0, "step": 24350 }, { "entropy": 6.252239322662353, "epoch": 2.810732833237161, "grad_norm": 1.0625, "learning_rate": 0.0004223754150943927, "loss": 5.8029, "mean_token_accuracy": 0.1906353548169136, "num_tokens": 61728663.0, "step": 24355 }, { "entropy": 6.196207809448242, "epoch": 2.8113098672821697, "grad_norm": 1.0078125, "learning_rate": 0.000422344232146258, "loss": 5.7841, "mean_token_accuracy": 0.18982133716344834, "num_tokens": 61740998.0, "step": 24360 }, { "entropy": 6.106575345993042, "epoch": 2.8118869013271786, "grad_norm": 0.859375, "learning_rate": 0.00042231304424227315, "loss": 5.8081, "mean_token_accuracy": 0.18961165547370912, "num_tokens": 61753231.0, "step": 24365 }, { "entropy": 6.193637418746948, "epoch": 2.812463935372187, "grad_norm": 1.03125, "learning_rate": 0.00042228185138348736, "loss": 5.8824, "mean_token_accuracy": 0.17971400022506714, "num_tokens": 61765046.0, "step": 24370 }, { "entropy": 6.177429723739624, "epoch": 2.8130409694171954, "grad_norm": 0.99609375, "learning_rate": 0.0004222506535709496, "loss": 5.7369, "mean_token_accuracy": 0.1918184667825699, "num_tokens": 61776705.0, "step": 24375 }, { "entropy": 6.229557085037231, "epoch": 2.8136180034622043, "grad_norm": 1.0859375, "learning_rate": 0.0004222194508057092, "loss": 5.7933, "mean_token_accuracy": 0.18529320508241653, "num_tokens": 61790682.0, "step": 24380 }, { "entropy": 6.120730209350586, "epoch": 2.814195037507213, "grad_norm": 0.9765625, "learning_rate": 0.0004221882430888157, "loss": 5.7524, "mean_token_accuracy": 0.1902666687965393, "num_tokens": 61803329.0, "step": 24385 }, { "entropy": 6.138819074630737, "epoch": 2.8147720715522215, "grad_norm": 0.921875, "learning_rate": 0.00042215703042131883, "loss": 5.7971, "mean_token_accuracy": 0.18944026827812194, "num_tokens": 61815996.0, "step": 24390 }, { "entropy": 6.155755615234375, "epoch": 2.8153491055972304, "grad_norm": 0.99609375, "learning_rate": 0.0004221258128042682, "loss": 5.7808, "mean_token_accuracy": 0.19141545295715331, "num_tokens": 61828281.0, "step": 24395 }, { "entropy": 6.221925210952759, "epoch": 2.815926139642239, "grad_norm": 0.9296875, "learning_rate": 0.00042209459023871405, "loss": 5.8719, "mean_token_accuracy": 0.1785180911421776, "num_tokens": 61840894.0, "step": 24400 }, { "entropy": 6.228180551528931, "epoch": 2.8165031736872477, "grad_norm": 0.8984375, "learning_rate": 0.00042206336272570643, "loss": 5.8429, "mean_token_accuracy": 0.18124893456697463, "num_tokens": 61852767.0, "step": 24405 }, { "entropy": 6.226462078094483, "epoch": 2.817080207732256, "grad_norm": 0.9765625, "learning_rate": 0.00042203213026629566, "loss": 5.7607, "mean_token_accuracy": 0.18627342879772185, "num_tokens": 61866497.0, "step": 24410 }, { "entropy": 6.182011890411377, "epoch": 2.817657241777265, "grad_norm": 0.93359375, "learning_rate": 0.00042200089286153217, "loss": 5.8813, "mean_token_accuracy": 0.18050605803728104, "num_tokens": 61879024.0, "step": 24415 }, { "entropy": 6.139136266708374, "epoch": 2.8182342758222734, "grad_norm": 0.9453125, "learning_rate": 0.0004219696505124667, "loss": 5.7468, "mean_token_accuracy": 0.18669730871915818, "num_tokens": 61890582.0, "step": 24420 }, { "entropy": 6.165212678909302, "epoch": 2.8188113098672822, "grad_norm": 1.078125, "learning_rate": 0.00042193840322015, "loss": 5.7605, "mean_token_accuracy": 0.18675775378942489, "num_tokens": 61903140.0, "step": 24425 }, { "entropy": 6.1244893074035645, "epoch": 2.8193883439122907, "grad_norm": 0.90234375, "learning_rate": 0.00042190715098563313, "loss": 5.7172, "mean_token_accuracy": 0.1883280023932457, "num_tokens": 61915953.0, "step": 24430 }, { "entropy": 6.139819765090943, "epoch": 2.8199653779572995, "grad_norm": 0.98046875, "learning_rate": 0.0004218758938099672, "loss": 5.8658, "mean_token_accuracy": 0.18507246673107147, "num_tokens": 61928120.0, "step": 24435 }, { "entropy": 6.2485874652862545, "epoch": 2.8205424120023084, "grad_norm": 0.8828125, "learning_rate": 0.0004218446316942035, "loss": 5.8294, "mean_token_accuracy": 0.18644487261772155, "num_tokens": 61941164.0, "step": 24440 }, { "entropy": 6.145779275894165, "epoch": 2.821119446047317, "grad_norm": 0.9140625, "learning_rate": 0.0004218133646393937, "loss": 5.7889, "mean_token_accuracy": 0.19110679924488067, "num_tokens": 61954310.0, "step": 24445 }, { "entropy": 6.198514032363891, "epoch": 2.821696480092325, "grad_norm": 1.109375, "learning_rate": 0.0004217820926465892, "loss": 5.8485, "mean_token_accuracy": 0.18392210304737092, "num_tokens": 61966952.0, "step": 24450 }, { "entropy": 6.200435400009155, "epoch": 2.822273514137334, "grad_norm": 0.953125, "learning_rate": 0.0004217508157168418, "loss": 5.8006, "mean_token_accuracy": 0.1839941754937172, "num_tokens": 61979547.0, "step": 24455 }, { "entropy": 6.1755468368530275, "epoch": 2.822850548182343, "grad_norm": 1.0234375, "learning_rate": 0.00042171953385120384, "loss": 5.8424, "mean_token_accuracy": 0.18718830198049546, "num_tokens": 61992188.0, "step": 24460 }, { "entropy": 6.224154090881347, "epoch": 2.8234275822273514, "grad_norm": 1.1484375, "learning_rate": 0.00042168824705072713, "loss": 5.8042, "mean_token_accuracy": 0.19423746019601823, "num_tokens": 62005426.0, "step": 24465 }, { "entropy": 6.062999820709228, "epoch": 2.82400461627236, "grad_norm": 0.9140625, "learning_rate": 0.0004216569553164641, "loss": 5.7434, "mean_token_accuracy": 0.1871136888861656, "num_tokens": 62018247.0, "step": 24470 }, { "entropy": 6.092436838150024, "epoch": 2.8245816503173686, "grad_norm": 0.9375, "learning_rate": 0.00042162565864946723, "loss": 5.8167, "mean_token_accuracy": 0.18545281887054443, "num_tokens": 62030503.0, "step": 24475 }, { "entropy": 6.31914496421814, "epoch": 2.8251586843623775, "grad_norm": 1.0, "learning_rate": 0.0004215943570507891, "loss": 5.8503, "mean_token_accuracy": 0.18152353614568711, "num_tokens": 62043453.0, "step": 24480 }, { "entropy": 6.148798513412475, "epoch": 2.825735718407386, "grad_norm": 0.9375, "learning_rate": 0.00042156305052148263, "loss": 5.7275, "mean_token_accuracy": 0.19739930331707, "num_tokens": 62057317.0, "step": 24485 }, { "entropy": 6.10639181137085, "epoch": 2.8263127524523948, "grad_norm": 1.0078125, "learning_rate": 0.00042153173906260083, "loss": 5.8201, "mean_token_accuracy": 0.18516720235347747, "num_tokens": 62069360.0, "step": 24490 }, { "entropy": 6.182285165786743, "epoch": 2.826889786497403, "grad_norm": 1.0390625, "learning_rate": 0.00042150042267519665, "loss": 5.8326, "mean_token_accuracy": 0.18462236523628234, "num_tokens": 62082157.0, "step": 24495 }, { "entropy": 6.143859577178955, "epoch": 2.827466820542412, "grad_norm": 1.0, "learning_rate": 0.00042146910136032367, "loss": 5.7447, "mean_token_accuracy": 0.19464441984891892, "num_tokens": 62094268.0, "step": 24500 }, { "entropy": 6.169033098220825, "epoch": 2.8280438545874205, "grad_norm": 0.93359375, "learning_rate": 0.00042143777511903513, "loss": 5.7834, "mean_token_accuracy": 0.18847947865724562, "num_tokens": 62107610.0, "step": 24505 }, { "entropy": 6.150124740600586, "epoch": 2.8286208886324293, "grad_norm": 1.0078125, "learning_rate": 0.00042140644395238477, "loss": 5.7807, "mean_token_accuracy": 0.19214766174554826, "num_tokens": 62120279.0, "step": 24510 }, { "entropy": 6.096494579315186, "epoch": 2.829197922677438, "grad_norm": 1.0, "learning_rate": 0.0004213751078614264, "loss": 5.703, "mean_token_accuracy": 0.1975172147154808, "num_tokens": 62134204.0, "step": 24515 }, { "entropy": 6.1175798892974855, "epoch": 2.8297749567224466, "grad_norm": 0.953125, "learning_rate": 0.000421343766847214, "loss": 5.7332, "mean_token_accuracy": 0.19724698662757872, "num_tokens": 62147241.0, "step": 24520 }, { "entropy": 6.1617988586425785, "epoch": 2.830351990767455, "grad_norm": 1.0390625, "learning_rate": 0.0004213124209108016, "loss": 5.761, "mean_token_accuracy": 0.18851809501647948, "num_tokens": 62159935.0, "step": 24525 }, { "entropy": 6.100178480148315, "epoch": 2.830929024812464, "grad_norm": 0.90625, "learning_rate": 0.0004212810700532437, "loss": 5.7487, "mean_token_accuracy": 0.19553690850734712, "num_tokens": 62172498.0, "step": 24530 }, { "entropy": 6.1133757591247555, "epoch": 2.8315060588574728, "grad_norm": 0.96484375, "learning_rate": 0.0004212497142755947, "loss": 5.7746, "mean_token_accuracy": 0.183367919921875, "num_tokens": 62186150.0, "step": 24535 }, { "entropy": 6.262248611450195, "epoch": 2.832083092902481, "grad_norm": 1.0625, "learning_rate": 0.00042121835357890916, "loss": 5.8965, "mean_token_accuracy": 0.18269695043563844, "num_tokens": 62199455.0, "step": 24540 }, { "entropy": 6.212676286697388, "epoch": 2.83266012694749, "grad_norm": 0.953125, "learning_rate": 0.0004211869879642419, "loss": 5.8295, "mean_token_accuracy": 0.1768409490585327, "num_tokens": 62213459.0, "step": 24545 }, { "entropy": 6.166826057434082, "epoch": 2.8332371609924984, "grad_norm": 0.94921875, "learning_rate": 0.00042115561743264797, "loss": 5.7797, "mean_token_accuracy": 0.18591320812702178, "num_tokens": 62225250.0, "step": 24550 }, { "entropy": 6.147188901901245, "epoch": 2.8338141950375073, "grad_norm": 0.9296875, "learning_rate": 0.0004211242419851824, "loss": 5.7759, "mean_token_accuracy": 0.19254399687051774, "num_tokens": 62238334.0, "step": 24555 }, { "entropy": 6.216676187515259, "epoch": 2.8343912290825157, "grad_norm": 0.91015625, "learning_rate": 0.00042109286162290055, "loss": 5.8274, "mean_token_accuracy": 0.18938308507204055, "num_tokens": 62251498.0, "step": 24560 }, { "entropy": 6.222916889190674, "epoch": 2.8349682631275246, "grad_norm": 0.9375, "learning_rate": 0.0004210614763468579, "loss": 5.8604, "mean_token_accuracy": 0.18268202245235443, "num_tokens": 62264423.0, "step": 24565 }, { "entropy": 6.155679655075073, "epoch": 2.8355452971725335, "grad_norm": 0.921875, "learning_rate": 0.00042103008615811, "loss": 5.7626, "mean_token_accuracy": 0.18701843172311783, "num_tokens": 62276889.0, "step": 24570 }, { "entropy": 6.207239389419556, "epoch": 2.836122331217542, "grad_norm": 0.9765625, "learning_rate": 0.0004209986910577127, "loss": 5.8413, "mean_token_accuracy": 0.18645787090063096, "num_tokens": 62289043.0, "step": 24575 }, { "entropy": 6.19259238243103, "epoch": 2.8366993652625503, "grad_norm": 0.99609375, "learning_rate": 0.00042096729104672194, "loss": 5.8514, "mean_token_accuracy": 0.18569687902927398, "num_tokens": 62301445.0, "step": 24580 }, { "entropy": 6.210863542556763, "epoch": 2.837276399307559, "grad_norm": 0.94921875, "learning_rate": 0.00042093588612619385, "loss": 5.8636, "mean_token_accuracy": 0.17950042635202407, "num_tokens": 62314263.0, "step": 24585 }, { "entropy": 6.2886528968811035, "epoch": 2.837853433352568, "grad_norm": 1.0, "learning_rate": 0.0004209044762971847, "loss": 5.8165, "mean_token_accuracy": 0.19024156779050827, "num_tokens": 62327873.0, "step": 24590 }, { "entropy": 6.238538980484009, "epoch": 2.8384304673975764, "grad_norm": 1.109375, "learning_rate": 0.000420873061560751, "loss": 5.8346, "mean_token_accuracy": 0.17738230377435685, "num_tokens": 62340827.0, "step": 24595 }, { "entropy": 6.246775531768799, "epoch": 2.839007501442585, "grad_norm": 0.94140625, "learning_rate": 0.0004208416419179494, "loss": 5.929, "mean_token_accuracy": 0.1809936672449112, "num_tokens": 62352995.0, "step": 24600 }, { "entropy": 6.232808542251587, "epoch": 2.8395845354875937, "grad_norm": 0.98828125, "learning_rate": 0.00042081021736983657, "loss": 5.8607, "mean_token_accuracy": 0.1842508167028427, "num_tokens": 62365647.0, "step": 24605 }, { "entropy": 6.190806531906128, "epoch": 2.8401615695326026, "grad_norm": 1.1171875, "learning_rate": 0.0004207787879174695, "loss": 5.7846, "mean_token_accuracy": 0.18463329076766968, "num_tokens": 62377277.0, "step": 24610 }, { "entropy": 6.135664463043213, "epoch": 2.840738603577611, "grad_norm": 1.046875, "learning_rate": 0.00042074735356190525, "loss": 5.8261, "mean_token_accuracy": 0.18321821540594102, "num_tokens": 62389338.0, "step": 24615 }, { "entropy": 6.20417971611023, "epoch": 2.84131563762262, "grad_norm": 0.98828125, "learning_rate": 0.0004207159143042012, "loss": 5.8274, "mean_token_accuracy": 0.18021536618471146, "num_tokens": 62401933.0, "step": 24620 }, { "entropy": 6.188966274261475, "epoch": 2.8418926716676283, "grad_norm": 0.9921875, "learning_rate": 0.0004206844701454148, "loss": 5.7641, "mean_token_accuracy": 0.1921963319182396, "num_tokens": 62414738.0, "step": 24625 }, { "entropy": 6.237261819839477, "epoch": 2.842469705712637, "grad_norm": 0.9609375, "learning_rate": 0.00042065302108660355, "loss": 5.8905, "mean_token_accuracy": 0.17836265861988068, "num_tokens": 62426565.0, "step": 24630 }, { "entropy": 6.100368928909302, "epoch": 2.8430467397576455, "grad_norm": 1.0625, "learning_rate": 0.0004206215671288253, "loss": 5.7612, "mean_token_accuracy": 0.19400888532400132, "num_tokens": 62438992.0, "step": 24635 }, { "entropy": 6.1758119583129885, "epoch": 2.8436237738026544, "grad_norm": 0.89453125, "learning_rate": 0.00042059010827313794, "loss": 5.8212, "mean_token_accuracy": 0.18566527515649794, "num_tokens": 62453004.0, "step": 24640 }, { "entropy": 6.297257661819458, "epoch": 2.8442008078476633, "grad_norm": 1.0390625, "learning_rate": 0.00042055864452059967, "loss": 5.8788, "mean_token_accuracy": 0.17976783514022826, "num_tokens": 62466367.0, "step": 24645 }, { "entropy": 6.137363243103027, "epoch": 2.8447778418926717, "grad_norm": 0.90234375, "learning_rate": 0.0004205271758722687, "loss": 5.7024, "mean_token_accuracy": 0.19127903282642364, "num_tokens": 62479881.0, "step": 24650 }, { "entropy": 6.236714792251587, "epoch": 2.84535487593768, "grad_norm": 0.890625, "learning_rate": 0.0004204957023292034, "loss": 5.9681, "mean_token_accuracy": 0.17598249912261962, "num_tokens": 62493634.0, "step": 24655 }, { "entropy": 6.183877468109131, "epoch": 2.845931909982689, "grad_norm": 0.984375, "learning_rate": 0.00042046422389246246, "loss": 5.7305, "mean_token_accuracy": 0.1946361169219017, "num_tokens": 62505045.0, "step": 24660 }, { "entropy": 6.135823774337768, "epoch": 2.846508944027698, "grad_norm": 0.9375, "learning_rate": 0.00042043274056310454, "loss": 5.8104, "mean_token_accuracy": 0.1842285603284836, "num_tokens": 62517403.0, "step": 24665 }, { "entropy": 6.123856830596924, "epoch": 2.8470859780727062, "grad_norm": 0.95703125, "learning_rate": 0.0004204012523421888, "loss": 5.749, "mean_token_accuracy": 0.1858529895544052, "num_tokens": 62529276.0, "step": 24670 }, { "entropy": 6.1114264011383055, "epoch": 2.847663012117715, "grad_norm": 0.9765625, "learning_rate": 0.000420369759230774, "loss": 5.661, "mean_token_accuracy": 0.19927244931459426, "num_tokens": 62542705.0, "step": 24675 }, { "entropy": 6.153840398788452, "epoch": 2.8482400461627235, "grad_norm": 0.8671875, "learning_rate": 0.00042033826122991956, "loss": 5.7966, "mean_token_accuracy": 0.1818278804421425, "num_tokens": 62555547.0, "step": 24680 }, { "entropy": 6.046644973754883, "epoch": 2.8488170802077324, "grad_norm": 0.9609375, "learning_rate": 0.000420306758340685, "loss": 5.7347, "mean_token_accuracy": 0.18865351378917694, "num_tokens": 62569118.0, "step": 24685 }, { "entropy": 6.122761535644531, "epoch": 2.849394114252741, "grad_norm": 0.92578125, "learning_rate": 0.00042027525056412973, "loss": 5.7241, "mean_token_accuracy": 0.18449884206056594, "num_tokens": 62580632.0, "step": 24690 }, { "entropy": 6.106462812423706, "epoch": 2.8499711482977497, "grad_norm": 0.9140625, "learning_rate": 0.0004202437379013136, "loss": 5.6609, "mean_token_accuracy": 0.19353797286748886, "num_tokens": 62593554.0, "step": 24695 }, { "entropy": 6.127063751220703, "epoch": 2.850548182342758, "grad_norm": 0.94921875, "learning_rate": 0.0004202122203532965, "loss": 5.8283, "mean_token_accuracy": 0.18047186881303787, "num_tokens": 62606454.0, "step": 24700 }, { "entropy": 6.195889329910278, "epoch": 2.851125216387767, "grad_norm": 0.8984375, "learning_rate": 0.00042018069792113845, "loss": 5.8153, "mean_token_accuracy": 0.1847582593560219, "num_tokens": 62620665.0, "step": 24705 }, { "entropy": 6.117110347747802, "epoch": 2.8517022504327754, "grad_norm": 0.875, "learning_rate": 0.0004201491706058998, "loss": 5.7621, "mean_token_accuracy": 0.19461952298879623, "num_tokens": 62632849.0, "step": 24710 }, { "entropy": 6.181552171707153, "epoch": 2.8522792844777842, "grad_norm": 1.0625, "learning_rate": 0.0004201176384086408, "loss": 5.7987, "mean_token_accuracy": 0.18936560451984405, "num_tokens": 62644355.0, "step": 24715 }, { "entropy": 6.179149341583252, "epoch": 2.852856318522793, "grad_norm": 0.93359375, "learning_rate": 0.0004200861013304222, "loss": 5.7981, "mean_token_accuracy": 0.19061631411314012, "num_tokens": 62656642.0, "step": 24720 }, { "entropy": 6.137886047363281, "epoch": 2.8534333525678015, "grad_norm": 0.99609375, "learning_rate": 0.00042005455937230466, "loss": 5.7535, "mean_token_accuracy": 0.18561313301324844, "num_tokens": 62669993.0, "step": 24725 }, { "entropy": 6.233130073547363, "epoch": 2.85401038661281, "grad_norm": 0.91015625, "learning_rate": 0.000420023012535349, "loss": 5.841, "mean_token_accuracy": 0.18337019979953767, "num_tokens": 62682336.0, "step": 24730 }, { "entropy": 6.261335992813111, "epoch": 2.854587420657819, "grad_norm": 0.89453125, "learning_rate": 0.0004199914608206164, "loss": 5.8806, "mean_token_accuracy": 0.18259891420602797, "num_tokens": 62694893.0, "step": 24735 }, { "entropy": 6.158029985427857, "epoch": 2.8551644547028276, "grad_norm": 0.9296875, "learning_rate": 0.000419959904229168, "loss": 5.7876, "mean_token_accuracy": 0.1849174126982689, "num_tokens": 62707486.0, "step": 24740 }, { "entropy": 6.280964326858521, "epoch": 2.855741488747836, "grad_norm": 0.875, "learning_rate": 0.0004199283427620653, "loss": 5.8971, "mean_token_accuracy": 0.18116282671689987, "num_tokens": 62721350.0, "step": 24745 }, { "entropy": 6.071496391296387, "epoch": 2.856318522792845, "grad_norm": 0.98046875, "learning_rate": 0.00041989677642036973, "loss": 5.6762, "mean_token_accuracy": 0.1947805941104889, "num_tokens": 62734133.0, "step": 24750 }, { "entropy": 6.117844104766846, "epoch": 2.8568955568378533, "grad_norm": 0.93359375, "learning_rate": 0.00041986520520514303, "loss": 5.7009, "mean_token_accuracy": 0.19389776438474654, "num_tokens": 62746218.0, "step": 24755 }, { "entropy": 6.211564588546753, "epoch": 2.857472590882862, "grad_norm": 0.9296875, "learning_rate": 0.00041983362911744715, "loss": 5.859, "mean_token_accuracy": 0.18451776057481767, "num_tokens": 62759137.0, "step": 24760 }, { "entropy": 6.204450511932373, "epoch": 2.8580496249278706, "grad_norm": 1.3984375, "learning_rate": 0.0004198020481583441, "loss": 5.826, "mean_token_accuracy": 0.18509777784347534, "num_tokens": 62772287.0, "step": 24765 }, { "entropy": 6.2304027557373045, "epoch": 2.8586266589728795, "grad_norm": 0.99609375, "learning_rate": 0.00041977046232889606, "loss": 5.8035, "mean_token_accuracy": 0.18370132446289061, "num_tokens": 62785354.0, "step": 24770 }, { "entropy": 6.21972804069519, "epoch": 2.859203693017888, "grad_norm": 1.703125, "learning_rate": 0.00041973887163016546, "loss": 5.8589, "mean_token_accuracy": 0.1828300714492798, "num_tokens": 62798356.0, "step": 24775 }, { "entropy": 6.135252046585083, "epoch": 2.8597807270628968, "grad_norm": 1.0859375, "learning_rate": 0.0004197072760632147, "loss": 5.7418, "mean_token_accuracy": 0.19170485138893129, "num_tokens": 62809966.0, "step": 24780 }, { "entropy": 6.168164825439453, "epoch": 2.860357761107905, "grad_norm": 0.9140625, "learning_rate": 0.00041967567562910675, "loss": 5.7514, "mean_token_accuracy": 0.18814047425985336, "num_tokens": 62821833.0, "step": 24785 }, { "entropy": 6.176520299911499, "epoch": 2.860934795152914, "grad_norm": 0.9140625, "learning_rate": 0.00041964407032890426, "loss": 5.753, "mean_token_accuracy": 0.193022421002388, "num_tokens": 62833619.0, "step": 24790 }, { "entropy": 6.154019165039062, "epoch": 2.861511829197923, "grad_norm": 1.2734375, "learning_rate": 0.00041961246016367033, "loss": 5.7934, "mean_token_accuracy": 0.1848568081855774, "num_tokens": 62846373.0, "step": 24795 }, { "entropy": 6.189772129058838, "epoch": 2.8620888632429313, "grad_norm": 0.94921875, "learning_rate": 0.00041958084513446807, "loss": 5.8802, "mean_token_accuracy": 0.18780339807271956, "num_tokens": 62859311.0, "step": 24800 }, { "entropy": 6.194692850112915, "epoch": 2.8626658972879397, "grad_norm": 0.94140625, "learning_rate": 0.000419549225242361, "loss": 5.8434, "mean_token_accuracy": 0.18864173144102098, "num_tokens": 62871824.0, "step": 24805 }, { "entropy": 6.156630945205689, "epoch": 2.8632429313329486, "grad_norm": 0.98046875, "learning_rate": 0.0004195176004884124, "loss": 5.7789, "mean_token_accuracy": 0.1891074389219284, "num_tokens": 62883795.0, "step": 24810 }, { "entropy": 6.197795820236206, "epoch": 2.8638199653779575, "grad_norm": 1.1171875, "learning_rate": 0.0004194859708736863, "loss": 5.8544, "mean_token_accuracy": 0.18445490747690202, "num_tokens": 62896331.0, "step": 24815 }, { "entropy": 6.237935161590576, "epoch": 2.864396999422966, "grad_norm": 1.0546875, "learning_rate": 0.00041945433639924617, "loss": 5.8694, "mean_token_accuracy": 0.18260905593633653, "num_tokens": 62907656.0, "step": 24820 }, { "entropy": 6.060537433624267, "epoch": 2.8649740334679747, "grad_norm": 1.0390625, "learning_rate": 0.00041942269706615623, "loss": 5.7009, "mean_token_accuracy": 0.19327386766672133, "num_tokens": 62921132.0, "step": 24825 }, { "entropy": 6.110379600524903, "epoch": 2.865551067512983, "grad_norm": 0.984375, "learning_rate": 0.00041939105287548055, "loss": 5.7741, "mean_token_accuracy": 0.19144950956106185, "num_tokens": 62933989.0, "step": 24830 }, { "entropy": 6.133320426940918, "epoch": 2.866128101557992, "grad_norm": 0.9296875, "learning_rate": 0.00041935940382828365, "loss": 5.8507, "mean_token_accuracy": 0.1785710334777832, "num_tokens": 62946284.0, "step": 24835 }, { "entropy": 6.146940135955811, "epoch": 2.8667051356030004, "grad_norm": 1.109375, "learning_rate": 0.0004193277499256299, "loss": 5.8296, "mean_token_accuracy": 0.19064295440912246, "num_tokens": 62958690.0, "step": 24840 }, { "entropy": 6.231950187683106, "epoch": 2.8672821696480093, "grad_norm": 1.1640625, "learning_rate": 0.00041929609116858385, "loss": 5.8362, "mean_token_accuracy": 0.18415248095989228, "num_tokens": 62970374.0, "step": 24845 }, { "entropy": 6.094867515563965, "epoch": 2.8678592036930177, "grad_norm": 0.96484375, "learning_rate": 0.00041926442755821055, "loss": 5.7411, "mean_token_accuracy": 0.19062764048576356, "num_tokens": 62982245.0, "step": 24850 }, { "entropy": 6.138445854187012, "epoch": 2.8684362377380266, "grad_norm": 0.99609375, "learning_rate": 0.0004192327590955748, "loss": 5.7563, "mean_token_accuracy": 0.18891474306583406, "num_tokens": 62995546.0, "step": 24855 }, { "entropy": 6.205418252944947, "epoch": 2.869013271783035, "grad_norm": 0.90234375, "learning_rate": 0.00041920108578174197, "loss": 5.8411, "mean_token_accuracy": 0.18665518164634703, "num_tokens": 63006937.0, "step": 24860 }, { "entropy": 6.2241579532623295, "epoch": 2.869590305828044, "grad_norm": 0.90234375, "learning_rate": 0.0004191694076177772, "loss": 5.747, "mean_token_accuracy": 0.18665951490402222, "num_tokens": 63019722.0, "step": 24865 }, { "entropy": 6.169949579238891, "epoch": 2.8701673398730527, "grad_norm": 1.0078125, "learning_rate": 0.00041913772460474603, "loss": 5.8733, "mean_token_accuracy": 0.18358385413885117, "num_tokens": 63031627.0, "step": 24870 }, { "entropy": 6.195762872695923, "epoch": 2.870744373918061, "grad_norm": 0.90234375, "learning_rate": 0.00041910603674371406, "loss": 5.8848, "mean_token_accuracy": 0.180596986413002, "num_tokens": 63043781.0, "step": 24875 }, { "entropy": 6.222542381286621, "epoch": 2.8713214079630696, "grad_norm": 0.96484375, "learning_rate": 0.0004190743440357471, "loss": 5.7805, "mean_token_accuracy": 0.18950323909521102, "num_tokens": 63057196.0, "step": 24880 }, { "entropy": 6.131774806976319, "epoch": 2.8718984420080784, "grad_norm": 1.0703125, "learning_rate": 0.0004190426464819112, "loss": 5.748, "mean_token_accuracy": 0.1905028373003006, "num_tokens": 63070013.0, "step": 24885 }, { "entropy": 6.189122009277344, "epoch": 2.8724754760530873, "grad_norm": 0.89453125, "learning_rate": 0.0004190109440832724, "loss": 5.8275, "mean_token_accuracy": 0.18342624455690384, "num_tokens": 63082733.0, "step": 24890 }, { "entropy": 6.245053148269653, "epoch": 2.8730525100980957, "grad_norm": 0.93359375, "learning_rate": 0.00041897923684089714, "loss": 5.8664, "mean_token_accuracy": 0.18298491835594177, "num_tokens": 63095275.0, "step": 24895 }, { "entropy": 6.156535053253174, "epoch": 2.8736295441431046, "grad_norm": 1.0078125, "learning_rate": 0.0004189475247558516, "loss": 5.8121, "mean_token_accuracy": 0.18865811079740524, "num_tokens": 63108184.0, "step": 24900 }, { "entropy": 6.182178401947022, "epoch": 2.874206578188113, "grad_norm": 1.671875, "learning_rate": 0.00041891580782920263, "loss": 5.7241, "mean_token_accuracy": 0.18523198664188384, "num_tokens": 63120157.0, "step": 24905 }, { "entropy": 6.139427661895752, "epoch": 2.874783612233122, "grad_norm": 0.921875, "learning_rate": 0.00041888408606201695, "loss": 5.7997, "mean_token_accuracy": 0.18744218498468398, "num_tokens": 63132390.0, "step": 24910 }, { "entropy": 6.125626707077027, "epoch": 2.8753606462781303, "grad_norm": 0.9296875, "learning_rate": 0.0004188523594553615, "loss": 5.8164, "mean_token_accuracy": 0.1867370069026947, "num_tokens": 63145567.0, "step": 24915 }, { "entropy": 6.212437915802002, "epoch": 2.875937680323139, "grad_norm": 0.89453125, "learning_rate": 0.0004188206280103034, "loss": 5.8159, "mean_token_accuracy": 0.18868955969810486, "num_tokens": 63157921.0, "step": 24920 }, { "entropy": 6.220640325546265, "epoch": 2.876514714368148, "grad_norm": 0.88671875, "learning_rate": 0.00041878889172790995, "loss": 5.7672, "mean_token_accuracy": 0.19261593669652938, "num_tokens": 63169848.0, "step": 24925 }, { "entropy": 6.192274141311645, "epoch": 2.8770917484131564, "grad_norm": 0.9296875, "learning_rate": 0.0004187571506092485, "loss": 5.9087, "mean_token_accuracy": 0.18260124921798707, "num_tokens": 63182827.0, "step": 24930 }, { "entropy": 6.171605968475342, "epoch": 2.877668782458165, "grad_norm": 0.94921875, "learning_rate": 0.0004187254046553867, "loss": 5.8115, "mean_token_accuracy": 0.18643954247236252, "num_tokens": 63195636.0, "step": 24935 }, { "entropy": 6.2117541313171385, "epoch": 2.8782458165031737, "grad_norm": 1.1875, "learning_rate": 0.00041869365386739234, "loss": 5.8603, "mean_token_accuracy": 0.18119559735059737, "num_tokens": 63210045.0, "step": 24940 }, { "entropy": 6.231222820281983, "epoch": 2.8788228505481825, "grad_norm": 1.0390625, "learning_rate": 0.00041866189824633335, "loss": 5.7923, "mean_token_accuracy": 0.1802116572856903, "num_tokens": 63223696.0, "step": 24945 }, { "entropy": 6.154783868789673, "epoch": 2.879399884593191, "grad_norm": 1.03125, "learning_rate": 0.0004186301377932777, "loss": 5.7872, "mean_token_accuracy": 0.18940824270248413, "num_tokens": 63236325.0, "step": 24950 }, { "entropy": 6.149294233322143, "epoch": 2.8799769186381994, "grad_norm": 0.9140625, "learning_rate": 0.0004185983725092937, "loss": 5.8537, "mean_token_accuracy": 0.18002549558877945, "num_tokens": 63249099.0, "step": 24955 }, { "entropy": 6.297961044311523, "epoch": 2.8805539526832082, "grad_norm": 0.9140625, "learning_rate": 0.0004185666023954498, "loss": 5.9022, "mean_token_accuracy": 0.18504872769117356, "num_tokens": 63261346.0, "step": 24960 }, { "entropy": 6.129104566574097, "epoch": 2.881130986728217, "grad_norm": 1.015625, "learning_rate": 0.0004185348274528146, "loss": 5.7287, "mean_token_accuracy": 0.19116574078798293, "num_tokens": 63274574.0, "step": 24965 }, { "entropy": 6.100711250305176, "epoch": 2.8817080207732255, "grad_norm": 0.97265625, "learning_rate": 0.00041850304768245675, "loss": 5.7079, "mean_token_accuracy": 0.19610214680433274, "num_tokens": 63286708.0, "step": 24970 }, { "entropy": 6.199342584609985, "epoch": 2.8822850548182344, "grad_norm": 0.94140625, "learning_rate": 0.0004184712630854451, "loss": 5.7402, "mean_token_accuracy": 0.18573962301015853, "num_tokens": 63298769.0, "step": 24975 }, { "entropy": 6.1939269542694095, "epoch": 2.882862088863243, "grad_norm": 1.421875, "learning_rate": 0.0004184394736628488, "loss": 5.8171, "mean_token_accuracy": 0.18373859226703643, "num_tokens": 63311228.0, "step": 24980 }, { "entropy": 6.223619508743286, "epoch": 2.8834391229082517, "grad_norm": 1.4375, "learning_rate": 0.0004184076794157371, "loss": 5.8734, "mean_token_accuracy": 0.1806168407201767, "num_tokens": 63323450.0, "step": 24985 }, { "entropy": 6.152713680267334, "epoch": 2.88401615695326, "grad_norm": 0.94921875, "learning_rate": 0.0004183758803451793, "loss": 5.7335, "mean_token_accuracy": 0.19684639424085618, "num_tokens": 63336948.0, "step": 24990 }, { "entropy": 6.186556482315064, "epoch": 2.884593190998269, "grad_norm": 0.95703125, "learning_rate": 0.00041834407645224505, "loss": 5.8128, "mean_token_accuracy": 0.18363571912050247, "num_tokens": 63348328.0, "step": 24995 }, { "entropy": 6.155422973632812, "epoch": 2.885170225043278, "grad_norm": 1.0546875, "learning_rate": 0.0004183122677380039, "loss": 5.7555, "mean_token_accuracy": 0.18719779700040817, "num_tokens": 63359761.0, "step": 25000 }, { "entropy": 6.171518087387085, "epoch": 2.885747259088286, "grad_norm": 0.96875, "learning_rate": 0.00041828045420352585, "loss": 5.789, "mean_token_accuracy": 0.1850059986114502, "num_tokens": 63371949.0, "step": 25005 }, { "entropy": 6.162282085418701, "epoch": 2.8863242931332946, "grad_norm": 0.96484375, "learning_rate": 0.00041824863584988086, "loss": 5.8306, "mean_token_accuracy": 0.1803960993885994, "num_tokens": 63385021.0, "step": 25010 }, { "entropy": 6.129031467437744, "epoch": 2.8869013271783035, "grad_norm": 0.94140625, "learning_rate": 0.0004182168126781392, "loss": 5.7323, "mean_token_accuracy": 0.19003615975379945, "num_tokens": 63398391.0, "step": 25015 }, { "entropy": 6.286478471755982, "epoch": 2.8874783612233124, "grad_norm": 0.9375, "learning_rate": 0.0004181849846893712, "loss": 5.8697, "mean_token_accuracy": 0.17848527878522874, "num_tokens": 63411161.0, "step": 25020 }, { "entropy": 6.103060293197632, "epoch": 2.888055395268321, "grad_norm": 0.92578125, "learning_rate": 0.0004181531518846474, "loss": 5.7708, "mean_token_accuracy": 0.1908055678009987, "num_tokens": 63424686.0, "step": 25025 }, { "entropy": 6.163610553741455, "epoch": 2.8886324293133296, "grad_norm": 1.0078125, "learning_rate": 0.00041812131426503834, "loss": 5.8309, "mean_token_accuracy": 0.18692435473203659, "num_tokens": 63437424.0, "step": 25030 }, { "entropy": 6.226094055175781, "epoch": 2.889209463358338, "grad_norm": 0.890625, "learning_rate": 0.0004180894718316151, "loss": 5.8824, "mean_token_accuracy": 0.1801483854651451, "num_tokens": 63452194.0, "step": 25035 }, { "entropy": 6.224396705627441, "epoch": 2.889786497403347, "grad_norm": 0.96875, "learning_rate": 0.00041805762458544846, "loss": 5.7795, "mean_token_accuracy": 0.1879183515906334, "num_tokens": 63465113.0, "step": 25040 }, { "entropy": 6.2037876605987545, "epoch": 2.8903635314483553, "grad_norm": 0.9921875, "learning_rate": 0.00041802577252760963, "loss": 5.858, "mean_token_accuracy": 0.18454415649175643, "num_tokens": 63477791.0, "step": 25045 }, { "entropy": 6.176325798034668, "epoch": 2.890940565493364, "grad_norm": 0.89453125, "learning_rate": 0.00041799391565917, "loss": 5.8111, "mean_token_accuracy": 0.18566223084926606, "num_tokens": 63490280.0, "step": 25050 }, { "entropy": 6.242665338516235, "epoch": 2.8915175995383726, "grad_norm": 1.0078125, "learning_rate": 0.00041796205398120115, "loss": 5.8352, "mean_token_accuracy": 0.18668083399534224, "num_tokens": 63502617.0, "step": 25055 }, { "entropy": 6.117324352264404, "epoch": 2.8920946335833815, "grad_norm": 0.94140625, "learning_rate": 0.00041793018749477454, "loss": 5.64, "mean_token_accuracy": 0.19256674945354463, "num_tokens": 63515209.0, "step": 25060 }, { "entropy": 6.201242065429687, "epoch": 2.89267166762839, "grad_norm": 1.046875, "learning_rate": 0.0004178983162009621, "loss": 5.8782, "mean_token_accuracy": 0.18686506897211075, "num_tokens": 63527870.0, "step": 25065 }, { "entropy": 6.1623327255249025, "epoch": 2.8932487016733988, "grad_norm": 0.97265625, "learning_rate": 0.0004178664401008358, "loss": 5.7887, "mean_token_accuracy": 0.18549591600894927, "num_tokens": 63541187.0, "step": 25070 }, { "entropy": 6.197692775726319, "epoch": 2.8938257357184076, "grad_norm": 1.015625, "learning_rate": 0.00041783455919546767, "loss": 5.7883, "mean_token_accuracy": 0.1858491361141205, "num_tokens": 63553892.0, "step": 25075 }, { "entropy": 6.131242895126343, "epoch": 2.894402769763416, "grad_norm": 0.9921875, "learning_rate": 0.00041780267348593016, "loss": 5.7234, "mean_token_accuracy": 0.19532606154680252, "num_tokens": 63565149.0, "step": 25080 }, { "entropy": 6.114775514602661, "epoch": 2.8949798038084245, "grad_norm": 0.96484375, "learning_rate": 0.0004177707829732956, "loss": 5.7759, "mean_token_accuracy": 0.1934100180864334, "num_tokens": 63577114.0, "step": 25085 }, { "entropy": 6.142133188247681, "epoch": 2.8955568378534333, "grad_norm": 0.89453125, "learning_rate": 0.00041773888765863677, "loss": 5.7239, "mean_token_accuracy": 0.19358953088521957, "num_tokens": 63589689.0, "step": 25090 }, { "entropy": 6.262591075897217, "epoch": 2.896133871898442, "grad_norm": 0.9140625, "learning_rate": 0.0004177069875430263, "loss": 5.8313, "mean_token_accuracy": 0.1825080171227455, "num_tokens": 63601888.0, "step": 25095 }, { "entropy": 6.180368328094483, "epoch": 2.8967109059434506, "grad_norm": 0.94140625, "learning_rate": 0.0004176750826275372, "loss": 5.8646, "mean_token_accuracy": 0.17671932876110077, "num_tokens": 63614663.0, "step": 25100 }, { "entropy": 6.135539102554321, "epoch": 2.8972879399884595, "grad_norm": 0.9375, "learning_rate": 0.0004176431729132426, "loss": 5.7626, "mean_token_accuracy": 0.18939124047756195, "num_tokens": 63626191.0, "step": 25105 }, { "entropy": 6.164480209350586, "epoch": 2.897864974033468, "grad_norm": 1.0, "learning_rate": 0.00041761125840121565, "loss": 5.7858, "mean_token_accuracy": 0.18773820847272873, "num_tokens": 63638778.0, "step": 25110 }, { "entropy": 6.133819675445556, "epoch": 2.8984420080784767, "grad_norm": 0.9765625, "learning_rate": 0.0004175793390925299, "loss": 5.6957, "mean_token_accuracy": 0.1860012397170067, "num_tokens": 63653369.0, "step": 25115 }, { "entropy": 6.226192331314087, "epoch": 2.899019042123485, "grad_norm": 0.984375, "learning_rate": 0.0004175474149882589, "loss": 5.7866, "mean_token_accuracy": 0.18243784159421922, "num_tokens": 63665442.0, "step": 25120 }, { "entropy": 6.103700160980225, "epoch": 2.899596076168494, "grad_norm": 0.91796875, "learning_rate": 0.0004175154860894765, "loss": 5.7158, "mean_token_accuracy": 0.2028720647096634, "num_tokens": 63678221.0, "step": 25125 }, { "entropy": 6.091815423965454, "epoch": 2.9001731102135024, "grad_norm": 0.90234375, "learning_rate": 0.0004174835523972563, "loss": 5.7016, "mean_token_accuracy": 0.19763491600751876, "num_tokens": 63690619.0, "step": 25130 }, { "entropy": 6.127394723892212, "epoch": 2.9007501442585113, "grad_norm": 0.88671875, "learning_rate": 0.00041745161391267276, "loss": 5.7686, "mean_token_accuracy": 0.190999336540699, "num_tokens": 63703742.0, "step": 25135 }, { "entropy": 6.158084869384766, "epoch": 2.9013271783035197, "grad_norm": 1.046875, "learning_rate": 0.00041741967063679993, "loss": 5.7971, "mean_token_accuracy": 0.182604843378067, "num_tokens": 63716929.0, "step": 25140 }, { "entropy": 6.11389274597168, "epoch": 2.9019042123485286, "grad_norm": 0.91796875, "learning_rate": 0.00041738772257071216, "loss": 5.7366, "mean_token_accuracy": 0.18962296694517136, "num_tokens": 63730301.0, "step": 25145 }, { "entropy": 6.1299182891845705, "epoch": 2.9024812463935374, "grad_norm": 1.0546875, "learning_rate": 0.0004173557697154841, "loss": 5.6606, "mean_token_accuracy": 0.1935422122478485, "num_tokens": 63744294.0, "step": 25150 }, { "entropy": 6.182842779159546, "epoch": 2.903058280438546, "grad_norm": 1.09375, "learning_rate": 0.00041732381207219046, "loss": 5.8583, "mean_token_accuracy": 0.17903222292661666, "num_tokens": 63756634.0, "step": 25155 }, { "entropy": 6.194612741470337, "epoch": 2.9036353144835543, "grad_norm": 0.93359375, "learning_rate": 0.00041729184964190607, "loss": 5.7642, "mean_token_accuracy": 0.18766499906778336, "num_tokens": 63768920.0, "step": 25160 }, { "entropy": 6.1540539264678955, "epoch": 2.904212348528563, "grad_norm": 0.97265625, "learning_rate": 0.00041725988242570603, "loss": 5.7271, "mean_token_accuracy": 0.19254759401082994, "num_tokens": 63781315.0, "step": 25165 }, { "entropy": 6.171711206436157, "epoch": 2.904789382573572, "grad_norm": 0.94140625, "learning_rate": 0.00041722791042466545, "loss": 5.8349, "mean_token_accuracy": 0.18272597938776017, "num_tokens": 63793453.0, "step": 25170 }, { "entropy": 6.258182001113892, "epoch": 2.9053664166185804, "grad_norm": 0.97265625, "learning_rate": 0.0004171959336398598, "loss": 5.8302, "mean_token_accuracy": 0.18577373325824736, "num_tokens": 63806929.0, "step": 25175 }, { "entropy": 6.104452896118164, "epoch": 2.9059434506635893, "grad_norm": 0.91015625, "learning_rate": 0.0004171639520723646, "loss": 5.7474, "mean_token_accuracy": 0.19049512594938278, "num_tokens": 63819794.0, "step": 25180 }, { "entropy": 6.116134595870972, "epoch": 2.9065204847085977, "grad_norm": 0.9375, "learning_rate": 0.0004171319657232554, "loss": 5.6947, "mean_token_accuracy": 0.1970692068338394, "num_tokens": 63831494.0, "step": 25185 }, { "entropy": 6.144589519500732, "epoch": 2.9070975187536066, "grad_norm": 0.94140625, "learning_rate": 0.0004170999745936082, "loss": 5.7827, "mean_token_accuracy": 0.18278268724679947, "num_tokens": 63844472.0, "step": 25190 }, { "entropy": 6.1718353748321535, "epoch": 2.907674552798615, "grad_norm": 0.921875, "learning_rate": 0.0004170679786844989, "loss": 5.7711, "mean_token_accuracy": 0.18623567074537278, "num_tokens": 63856028.0, "step": 25195 }, { "entropy": 6.118298292160034, "epoch": 2.908251586843624, "grad_norm": 1.125, "learning_rate": 0.0004170359779970037, "loss": 5.7784, "mean_token_accuracy": 0.17982750236988068, "num_tokens": 63870137.0, "step": 25200 }, { "entropy": 6.2560032367706295, "epoch": 2.9088286208886327, "grad_norm": 0.90625, "learning_rate": 0.0004170039725321989, "loss": 5.8316, "mean_token_accuracy": 0.1833975613117218, "num_tokens": 63882152.0, "step": 25205 }, { "entropy": 6.146197700500489, "epoch": 2.909405654933641, "grad_norm": 0.98828125, "learning_rate": 0.00041697196229116106, "loss": 5.7697, "mean_token_accuracy": 0.18322059661149978, "num_tokens": 63894624.0, "step": 25210 }, { "entropy": 6.017905426025391, "epoch": 2.9099826889786495, "grad_norm": 0.99609375, "learning_rate": 0.0004169399472749668, "loss": 5.5523, "mean_token_accuracy": 0.20819265246391297, "num_tokens": 63907439.0, "step": 25215 }, { "entropy": 6.194882583618164, "epoch": 2.9105597230236584, "grad_norm": 0.99609375, "learning_rate": 0.000416907927484693, "loss": 5.8419, "mean_token_accuracy": 0.18219007104635238, "num_tokens": 63920432.0, "step": 25220 }, { "entropy": 6.209870100021362, "epoch": 2.9111367570686673, "grad_norm": 0.89453125, "learning_rate": 0.00041687590292141644, "loss": 5.764, "mean_token_accuracy": 0.1942257508635521, "num_tokens": 63935682.0, "step": 25225 }, { "entropy": 6.073653507232666, "epoch": 2.9117137911136757, "grad_norm": 0.8984375, "learning_rate": 0.00041684387358621435, "loss": 5.7607, "mean_token_accuracy": 0.20043881237506866, "num_tokens": 63949109.0, "step": 25230 }, { "entropy": 6.208702230453492, "epoch": 2.912290825158684, "grad_norm": 1.140625, "learning_rate": 0.00041681183948016404, "loss": 5.7593, "mean_token_accuracy": 0.18617864996194838, "num_tokens": 63962859.0, "step": 25235 }, { "entropy": 6.241482782363891, "epoch": 2.912867859203693, "grad_norm": 0.91796875, "learning_rate": 0.000416779800604343, "loss": 5.889, "mean_token_accuracy": 0.17649127393960953, "num_tokens": 63975641.0, "step": 25240 }, { "entropy": 6.192310428619384, "epoch": 2.913444893248702, "grad_norm": 0.859375, "learning_rate": 0.00041674775695982883, "loss": 5.8007, "mean_token_accuracy": 0.18588081002235413, "num_tokens": 63988419.0, "step": 25245 }, { "entropy": 6.142047166824341, "epoch": 2.9140219272937102, "grad_norm": 0.9921875, "learning_rate": 0.0004167157085476992, "loss": 5.7904, "mean_token_accuracy": 0.18138567954301835, "num_tokens": 64000217.0, "step": 25250 }, { "entropy": 6.193149423599243, "epoch": 2.914598961338719, "grad_norm": 0.92578125, "learning_rate": 0.0004166836553690321, "loss": 5.8271, "mean_token_accuracy": 0.1848229244351387, "num_tokens": 64013083.0, "step": 25255 }, { "entropy": 6.105286693572998, "epoch": 2.9151759953837275, "grad_norm": 0.93359375, "learning_rate": 0.0004166515974249056, "loss": 5.7222, "mean_token_accuracy": 0.1918478712439537, "num_tokens": 64025769.0, "step": 25260 }, { "entropy": 6.225525331497193, "epoch": 2.9157530294287364, "grad_norm": 0.94921875, "learning_rate": 0.00041661953471639797, "loss": 5.7891, "mean_token_accuracy": 0.1853489100933075, "num_tokens": 64037526.0, "step": 25265 }, { "entropy": 6.127283811569214, "epoch": 2.916330063473745, "grad_norm": 0.94921875, "learning_rate": 0.00041658746724458775, "loss": 5.7521, "mean_token_accuracy": 0.19490110874176025, "num_tokens": 64050542.0, "step": 25270 }, { "entropy": 6.165182209014892, "epoch": 2.9169070975187537, "grad_norm": 1.0234375, "learning_rate": 0.00041655539501055333, "loss": 5.6944, "mean_token_accuracy": 0.1959969386458397, "num_tokens": 64063097.0, "step": 25275 }, { "entropy": 6.180014944076538, "epoch": 2.9174841315637625, "grad_norm": 0.921875, "learning_rate": 0.0004165233180153735, "loss": 5.8078, "mean_token_accuracy": 0.18777673840522766, "num_tokens": 64076104.0, "step": 25280 }, { "entropy": 6.1819206237792965, "epoch": 2.918061165608771, "grad_norm": 0.94140625, "learning_rate": 0.0004164912362601272, "loss": 5.791, "mean_token_accuracy": 0.18828150480985642, "num_tokens": 64090351.0, "step": 25285 }, { "entropy": 6.089034175872802, "epoch": 2.9186381996537794, "grad_norm": 0.89453125, "learning_rate": 0.00041645914974589347, "loss": 5.6435, "mean_token_accuracy": 0.19078212827444077, "num_tokens": 64103408.0, "step": 25290 }, { "entropy": 6.064705944061279, "epoch": 2.919215233698788, "grad_norm": 0.94140625, "learning_rate": 0.00041642705847375137, "loss": 5.6788, "mean_token_accuracy": 0.19690516591072083, "num_tokens": 64116733.0, "step": 25295 }, { "entropy": 6.123806381225586, "epoch": 2.919792267743797, "grad_norm": 1.1328125, "learning_rate": 0.0004163949624447806, "loss": 5.7584, "mean_token_accuracy": 0.19039979279041291, "num_tokens": 64129040.0, "step": 25300 }, { "entropy": 6.1485144138336185, "epoch": 2.9203693017888055, "grad_norm": 0.9375, "learning_rate": 0.00041636286166006045, "loss": 5.7789, "mean_token_accuracy": 0.1803423896431923, "num_tokens": 64140437.0, "step": 25305 }, { "entropy": 6.081819486618042, "epoch": 2.9209463358338144, "grad_norm": 0.88671875, "learning_rate": 0.0004163307561206706, "loss": 5.6848, "mean_token_accuracy": 0.19848719239234924, "num_tokens": 64153771.0, "step": 25310 }, { "entropy": 6.139738512039185, "epoch": 2.9215233698788228, "grad_norm": 0.94140625, "learning_rate": 0.000416298645827691, "loss": 5.7579, "mean_token_accuracy": 0.18604142516851424, "num_tokens": 64165492.0, "step": 25315 }, { "entropy": 6.2124255180358885, "epoch": 2.9221004039238316, "grad_norm": 1.0, "learning_rate": 0.0004162665307822016, "loss": 5.7815, "mean_token_accuracy": 0.1850111499428749, "num_tokens": 64178898.0, "step": 25320 }, { "entropy": 6.2393402576446535, "epoch": 2.92267743796884, "grad_norm": 0.8828125, "learning_rate": 0.00041623441098528267, "loss": 5.8291, "mean_token_accuracy": 0.18239922523498536, "num_tokens": 64190529.0, "step": 25325 }, { "entropy": 6.213286304473877, "epoch": 2.923254472013849, "grad_norm": 1.0546875, "learning_rate": 0.00041620228643801443, "loss": 5.7182, "mean_token_accuracy": 0.1871095210313797, "num_tokens": 64203073.0, "step": 25330 }, { "entropy": 6.192132139205933, "epoch": 2.9238315060588573, "grad_norm": 0.9296875, "learning_rate": 0.0004161701571414775, "loss": 5.8446, "mean_token_accuracy": 0.1829073280096054, "num_tokens": 64216103.0, "step": 25335 }, { "entropy": 6.195889139175415, "epoch": 2.924408540103866, "grad_norm": 0.90234375, "learning_rate": 0.00041613802309675235, "loss": 5.8485, "mean_token_accuracy": 0.18504202216863633, "num_tokens": 64228451.0, "step": 25340 }, { "entropy": 6.136723518371582, "epoch": 2.9249855741488746, "grad_norm": 1.4375, "learning_rate": 0.00041610588430492, "loss": 5.7099, "mean_token_accuracy": 0.19221784323453903, "num_tokens": 64239858.0, "step": 25345 }, { "entropy": 6.118024206161499, "epoch": 2.9255626081938835, "grad_norm": 0.89453125, "learning_rate": 0.00041607374076706123, "loss": 5.7102, "mean_token_accuracy": 0.19761201739311218, "num_tokens": 64252150.0, "step": 25350 }, { "entropy": 6.271979570388794, "epoch": 2.9261396422388923, "grad_norm": 0.97265625, "learning_rate": 0.00041604159248425737, "loss": 5.9261, "mean_token_accuracy": 0.1815897911787033, "num_tokens": 64264600.0, "step": 25355 }, { "entropy": 6.208084678649902, "epoch": 2.9267166762839008, "grad_norm": 0.95703125, "learning_rate": 0.0004160094394575896, "loss": 5.7605, "mean_token_accuracy": 0.18767553120851516, "num_tokens": 64276533.0, "step": 25360 }, { "entropy": 6.174940776824951, "epoch": 2.927293710328909, "grad_norm": 0.96484375, "learning_rate": 0.0004159772816881393, "loss": 5.7561, "mean_token_accuracy": 0.19796690642833709, "num_tokens": 64288628.0, "step": 25365 }, { "entropy": 6.180430889129639, "epoch": 2.927870744373918, "grad_norm": 0.88671875, "learning_rate": 0.00041594511917698813, "loss": 5.7819, "mean_token_accuracy": 0.19161266684532166, "num_tokens": 64301584.0, "step": 25370 }, { "entropy": 6.164112091064453, "epoch": 2.928447778418927, "grad_norm": 0.9921875, "learning_rate": 0.00041591295192521796, "loss": 5.8281, "mean_token_accuracy": 0.18357709646224976, "num_tokens": 64313363.0, "step": 25375 }, { "entropy": 6.125766372680664, "epoch": 2.9290248124639353, "grad_norm": 1.0234375, "learning_rate": 0.0004158807799339107, "loss": 5.7293, "mean_token_accuracy": 0.19762576073408128, "num_tokens": 64325284.0, "step": 25380 }, { "entropy": 6.22836012840271, "epoch": 2.929601846508944, "grad_norm": 0.9765625, "learning_rate": 0.00041584860320414827, "loss": 5.8249, "mean_token_accuracy": 0.18303842544555665, "num_tokens": 64336886.0, "step": 25385 }, { "entropy": 6.172658538818359, "epoch": 2.9301788805539526, "grad_norm": 0.98046875, "learning_rate": 0.00041581642173701305, "loss": 5.7617, "mean_token_accuracy": 0.18735713511705399, "num_tokens": 64349299.0, "step": 25390 }, { "entropy": 6.0893817901611325, "epoch": 2.9307559145989615, "grad_norm": 0.91796875, "learning_rate": 0.00041578423553358747, "loss": 5.7768, "mean_token_accuracy": 0.18666261583566665, "num_tokens": 64360997.0, "step": 25395 }, { "entropy": 6.207407903671265, "epoch": 2.93133294864397, "grad_norm": 0.89453125, "learning_rate": 0.00041575204459495406, "loss": 5.82, "mean_token_accuracy": 0.1894814893603325, "num_tokens": 64375083.0, "step": 25400 }, { "entropy": 6.165468978881836, "epoch": 2.9319099826889787, "grad_norm": 0.9921875, "learning_rate": 0.00041571984892219556, "loss": 5.8625, "mean_token_accuracy": 0.1828040137887001, "num_tokens": 64387882.0, "step": 25405 }, { "entropy": 6.068056869506836, "epoch": 2.932487016733987, "grad_norm": 0.97265625, "learning_rate": 0.0004156876485163948, "loss": 5.6644, "mean_token_accuracy": 0.19635545760393142, "num_tokens": 64399876.0, "step": 25410 }, { "entropy": 6.147058820724487, "epoch": 2.933064050778996, "grad_norm": 1.015625, "learning_rate": 0.00041565544337863493, "loss": 5.7543, "mean_token_accuracy": 0.19321614056825637, "num_tokens": 64411479.0, "step": 25415 }, { "entropy": 6.110343503952026, "epoch": 2.9336410848240044, "grad_norm": 0.85546875, "learning_rate": 0.000415623233509999, "loss": 5.7264, "mean_token_accuracy": 0.19031729251146318, "num_tokens": 64425009.0, "step": 25420 }, { "entropy": 6.072913074493409, "epoch": 2.9342181188690133, "grad_norm": 1.6171875, "learning_rate": 0.0004155910189115705, "loss": 5.7416, "mean_token_accuracy": 0.19084058105945587, "num_tokens": 64436635.0, "step": 25425 }, { "entropy": 6.064367866516113, "epoch": 2.934795152914022, "grad_norm": 1.0078125, "learning_rate": 0.00041555879958443296, "loss": 5.6888, "mean_token_accuracy": 0.19550212770700454, "num_tokens": 64449338.0, "step": 25430 }, { "entropy": 6.207567739486694, "epoch": 2.9353721869590306, "grad_norm": 1.0703125, "learning_rate": 0.00041552657552967, "loss": 5.8814, "mean_token_accuracy": 0.1787579044699669, "num_tokens": 64461124.0, "step": 25435 }, { "entropy": 6.271834039688111, "epoch": 2.935949221004039, "grad_norm": 1.0859375, "learning_rate": 0.0004154943467483654, "loss": 5.8426, "mean_token_accuracy": 0.19018956869840623, "num_tokens": 64474093.0, "step": 25440 }, { "entropy": 6.188777160644531, "epoch": 2.936526255049048, "grad_norm": 0.99609375, "learning_rate": 0.0004154621132416033, "loss": 5.7508, "mean_token_accuracy": 0.18046221733093262, "num_tokens": 64486408.0, "step": 25445 }, { "entropy": 6.0724719047546385, "epoch": 2.9371032890940567, "grad_norm": 1.03125, "learning_rate": 0.00041542987501046777, "loss": 5.7547, "mean_token_accuracy": 0.19533833414316176, "num_tokens": 64499390.0, "step": 25450 }, { "entropy": 6.1832510471344, "epoch": 2.937680323139065, "grad_norm": 0.92578125, "learning_rate": 0.00041539763205604316, "loss": 5.746, "mean_token_accuracy": 0.1905984714627266, "num_tokens": 64511307.0, "step": 25455 }, { "entropy": 6.153995132446289, "epoch": 2.938257357184074, "grad_norm": 1.09375, "learning_rate": 0.0004153653843794139, "loss": 5.7321, "mean_token_accuracy": 0.19005557894706726, "num_tokens": 64523027.0, "step": 25460 }, { "entropy": 6.180675983428955, "epoch": 2.9388343912290824, "grad_norm": 0.9375, "learning_rate": 0.0004153331319816647, "loss": 5.9144, "mean_token_accuracy": 0.17679677456617354, "num_tokens": 64535472.0, "step": 25465 }, { "entropy": 6.186362266540527, "epoch": 2.9394114252740913, "grad_norm": 0.91015625, "learning_rate": 0.0004153008748638803, "loss": 5.7573, "mean_token_accuracy": 0.18966278731822966, "num_tokens": 64547935.0, "step": 25470 }, { "entropy": 6.203519296646118, "epoch": 2.9399884593190997, "grad_norm": 0.8203125, "learning_rate": 0.0004152686130271457, "loss": 5.8733, "mean_token_accuracy": 0.18067746311426164, "num_tokens": 64561773.0, "step": 25475 }, { "entropy": 6.181817436218262, "epoch": 2.9405654933641086, "grad_norm": 0.96875, "learning_rate": 0.00041523634647254595, "loss": 5.7545, "mean_token_accuracy": 0.1912101075053215, "num_tokens": 64576465.0, "step": 25480 }, { "entropy": 6.133107423782349, "epoch": 2.9411425274091174, "grad_norm": 0.953125, "learning_rate": 0.00041520407520116633, "loss": 5.7739, "mean_token_accuracy": 0.1880086123943329, "num_tokens": 64589890.0, "step": 25485 }, { "entropy": 6.127618932723999, "epoch": 2.941719561454126, "grad_norm": 1.0078125, "learning_rate": 0.0004151717992140923, "loss": 5.7295, "mean_token_accuracy": 0.19406392723321914, "num_tokens": 64601423.0, "step": 25490 }, { "entropy": 6.177945470809936, "epoch": 2.9422965954991342, "grad_norm": 0.953125, "learning_rate": 0.00041513951851240947, "loss": 5.8098, "mean_token_accuracy": 0.1866205230355263, "num_tokens": 64614532.0, "step": 25495 }, { "entropy": 6.154408597946167, "epoch": 2.942873629544143, "grad_norm": 0.97265625, "learning_rate": 0.00041510723309720344, "loss": 5.7756, "mean_token_accuracy": 0.1892290785908699, "num_tokens": 64628260.0, "step": 25500 }, { "entropy": 6.171898221969604, "epoch": 2.943450663589152, "grad_norm": 0.828125, "learning_rate": 0.0004150749429695603, "loss": 5.789, "mean_token_accuracy": 0.18955737650394439, "num_tokens": 64640913.0, "step": 25505 }, { "entropy": 6.085756587982178, "epoch": 2.9440276976341604, "grad_norm": 0.96484375, "learning_rate": 0.00041504264813056605, "loss": 5.7245, "mean_token_accuracy": 0.19082649946212768, "num_tokens": 64653438.0, "step": 25510 }, { "entropy": 6.114610624313355, "epoch": 2.944604731679169, "grad_norm": 0.953125, "learning_rate": 0.00041501034858130683, "loss": 5.6753, "mean_token_accuracy": 0.19089840203523636, "num_tokens": 64665753.0, "step": 25515 }, { "entropy": 6.235386991500855, "epoch": 2.9451817657241777, "grad_norm": 0.94921875, "learning_rate": 0.00041497804432286914, "loss": 5.8835, "mean_token_accuracy": 0.1835867464542389, "num_tokens": 64676872.0, "step": 25520 }, { "entropy": 6.075920820236206, "epoch": 2.9457587997691865, "grad_norm": 0.91796875, "learning_rate": 0.0004149457353563394, "loss": 5.7124, "mean_token_accuracy": 0.20068821758031846, "num_tokens": 64690216.0, "step": 25525 }, { "entropy": 6.135827112197876, "epoch": 2.946335833814195, "grad_norm": 0.8984375, "learning_rate": 0.00041491342168280444, "loss": 5.7751, "mean_token_accuracy": 0.19033685475587844, "num_tokens": 64704210.0, "step": 25530 }, { "entropy": 6.237697887420654, "epoch": 2.946912867859204, "grad_norm": 1.0390625, "learning_rate": 0.00041488110330335093, "loss": 5.7925, "mean_token_accuracy": 0.18624559342861174, "num_tokens": 64717142.0, "step": 25535 }, { "entropy": 6.102040576934814, "epoch": 2.9474899019042122, "grad_norm": 0.9375, "learning_rate": 0.00041484878021906605, "loss": 5.6541, "mean_token_accuracy": 0.19631390869617463, "num_tokens": 64729783.0, "step": 25540 }, { "entropy": 6.130129957199097, "epoch": 2.948066935949221, "grad_norm": 1.046875, "learning_rate": 0.00041481645243103695, "loss": 5.8099, "mean_token_accuracy": 0.1839154615998268, "num_tokens": 64742179.0, "step": 25545 }, { "entropy": 6.236168098449707, "epoch": 2.9486439699942295, "grad_norm": 0.91796875, "learning_rate": 0.00041478411994035086, "loss": 5.8002, "mean_token_accuracy": 0.18524857461452485, "num_tokens": 64754925.0, "step": 25550 }, { "entropy": 6.103754138946533, "epoch": 2.9492210040392384, "grad_norm": 0.93359375, "learning_rate": 0.00041475178274809544, "loss": 5.7593, "mean_token_accuracy": 0.19133903086185455, "num_tokens": 64768341.0, "step": 25555 }, { "entropy": 6.17221040725708, "epoch": 2.9497980380842472, "grad_norm": 1.03125, "learning_rate": 0.00041471944085535805, "loss": 5.8188, "mean_token_accuracy": 0.18680384755134583, "num_tokens": 64780780.0, "step": 25560 }, { "entropy": 6.236133241653443, "epoch": 2.9503750721292556, "grad_norm": 1.0, "learning_rate": 0.0004146870942632268, "loss": 5.8429, "mean_token_accuracy": 0.18068062663078308, "num_tokens": 64792495.0, "step": 25565 }, { "entropy": 6.240812015533447, "epoch": 2.950952106174264, "grad_norm": 0.90234375, "learning_rate": 0.00041465474297278955, "loss": 5.7729, "mean_token_accuracy": 0.19019680470228195, "num_tokens": 64804696.0, "step": 25570 }, { "entropy": 6.125988340377807, "epoch": 2.951529140219273, "grad_norm": 0.96484375, "learning_rate": 0.0004146223869851343, "loss": 5.7084, "mean_token_accuracy": 0.19415107518434524, "num_tokens": 64817146.0, "step": 25575 }, { "entropy": 6.111772966384888, "epoch": 2.952106174264282, "grad_norm": 0.8984375, "learning_rate": 0.0004145900263013494, "loss": 5.7821, "mean_token_accuracy": 0.18447566628456116, "num_tokens": 64828833.0, "step": 25580 }, { "entropy": 6.1927549839019775, "epoch": 2.95268320830929, "grad_norm": 0.9296875, "learning_rate": 0.0004145576609225234, "loss": 5.7733, "mean_token_accuracy": 0.1915595769882202, "num_tokens": 64843811.0, "step": 25585 }, { "entropy": 6.073775911331177, "epoch": 2.953260242354299, "grad_norm": 0.92578125, "learning_rate": 0.0004145252908497448, "loss": 5.6878, "mean_token_accuracy": 0.1998982161283493, "num_tokens": 64856829.0, "step": 25590 }, { "entropy": 6.034066200256348, "epoch": 2.9538372763993075, "grad_norm": 0.92578125, "learning_rate": 0.00041449291608410227, "loss": 5.6365, "mean_token_accuracy": 0.1892428144812584, "num_tokens": 64869044.0, "step": 25595 }, { "entropy": 6.217815971374511, "epoch": 2.9544143104443163, "grad_norm": 1.0390625, "learning_rate": 0.00041446053662668483, "loss": 5.8742, "mean_token_accuracy": 0.18574898391962053, "num_tokens": 64882330.0, "step": 25600 }, { "entropy": 6.197320604324341, "epoch": 2.9549913444893248, "grad_norm": 0.9765625, "learning_rate": 0.0004144281524785815, "loss": 5.7815, "mean_token_accuracy": 0.19254770427942275, "num_tokens": 64894609.0, "step": 25605 }, { "entropy": 6.07693452835083, "epoch": 2.9555683785343336, "grad_norm": 1.0, "learning_rate": 0.0004143957636408815, "loss": 5.7649, "mean_token_accuracy": 0.19174301326274873, "num_tokens": 64907251.0, "step": 25610 }, { "entropy": 6.2032591819763185, "epoch": 2.956145412579342, "grad_norm": 0.99609375, "learning_rate": 0.00041436337011467426, "loss": 5.7889, "mean_token_accuracy": 0.19160752147436141, "num_tokens": 64919114.0, "step": 25615 }, { "entropy": 6.18372368812561, "epoch": 2.956722446624351, "grad_norm": 0.9453125, "learning_rate": 0.00041433097190104936, "loss": 5.8438, "mean_token_accuracy": 0.17706149071455002, "num_tokens": 64933064.0, "step": 25620 }, { "entropy": 6.16905460357666, "epoch": 2.9572994806693593, "grad_norm": 0.984375, "learning_rate": 0.00041429856900109636, "loss": 5.7907, "mean_token_accuracy": 0.19139077961444856, "num_tokens": 64946625.0, "step": 25625 }, { "entropy": 6.129648017883301, "epoch": 2.957876514714368, "grad_norm": 0.9765625, "learning_rate": 0.0004142661614159051, "loss": 5.662, "mean_token_accuracy": 0.19387938231229782, "num_tokens": 64958577.0, "step": 25630 }, { "entropy": 6.179660940170288, "epoch": 2.958453548759377, "grad_norm": 0.97265625, "learning_rate": 0.00041423374914656587, "loss": 5.8645, "mean_token_accuracy": 0.1814304083585739, "num_tokens": 64971588.0, "step": 25635 }, { "entropy": 6.174642705917359, "epoch": 2.9590305828043855, "grad_norm": 0.90234375, "learning_rate": 0.0004142013321941685, "loss": 5.8224, "mean_token_accuracy": 0.18751190453767777, "num_tokens": 64984448.0, "step": 25640 }, { "entropy": 6.168317461013794, "epoch": 2.959607616849394, "grad_norm": 0.96484375, "learning_rate": 0.00041416891055980347, "loss": 5.768, "mean_token_accuracy": 0.1889842540025711, "num_tokens": 64996759.0, "step": 25645 }, { "entropy": 6.2113720893859865, "epoch": 2.9601846508944027, "grad_norm": 0.96484375, "learning_rate": 0.00041413648424456134, "loss": 5.829, "mean_token_accuracy": 0.18671383410692216, "num_tokens": 65009732.0, "step": 25650 }, { "entropy": 6.182887029647827, "epoch": 2.9607616849394116, "grad_norm": 0.9765625, "learning_rate": 0.00041410405324953265, "loss": 5.864, "mean_token_accuracy": 0.1773914724588394, "num_tokens": 65021479.0, "step": 25655 }, { "entropy": 6.23884220123291, "epoch": 2.96133871898442, "grad_norm": 0.8671875, "learning_rate": 0.0004140716175758082, "loss": 5.8286, "mean_token_accuracy": 0.18784796446561813, "num_tokens": 65034782.0, "step": 25660 }, { "entropy": 6.155757141113281, "epoch": 2.961915753029429, "grad_norm": 0.8515625, "learning_rate": 0.00041403917722447896, "loss": 5.814, "mean_token_accuracy": 0.18590835481882095, "num_tokens": 65047427.0, "step": 25665 }, { "entropy": 6.166055059432983, "epoch": 2.9624927870744373, "grad_norm": 0.94921875, "learning_rate": 0.0004140067321966361, "loss": 5.7648, "mean_token_accuracy": 0.19290081411600113, "num_tokens": 65060867.0, "step": 25670 }, { "entropy": 6.143200159072876, "epoch": 2.963069821119446, "grad_norm": 0.9375, "learning_rate": 0.0004139742824933709, "loss": 5.7128, "mean_token_accuracy": 0.19452529698610305, "num_tokens": 65074394.0, "step": 25675 }, { "entropy": 6.074012660980225, "epoch": 2.9636468551644546, "grad_norm": 1.3984375, "learning_rate": 0.0004139418281157747, "loss": 5.71, "mean_token_accuracy": 0.1997675970196724, "num_tokens": 65088352.0, "step": 25680 }, { "entropy": 6.175407838821411, "epoch": 2.9642238892094634, "grad_norm": 0.9140625, "learning_rate": 0.0004139093690649391, "loss": 5.7782, "mean_token_accuracy": 0.19033325463533401, "num_tokens": 65101113.0, "step": 25685 }, { "entropy": 6.19824628829956, "epoch": 2.964800923254472, "grad_norm": 0.91015625, "learning_rate": 0.00041387690534195584, "loss": 5.7832, "mean_token_accuracy": 0.18356478810310364, "num_tokens": 65112894.0, "step": 25690 }, { "entropy": 6.150338745117187, "epoch": 2.9653779572994807, "grad_norm": 0.90625, "learning_rate": 0.0004138444369479169, "loss": 5.7755, "mean_token_accuracy": 0.18152814209461213, "num_tokens": 65125087.0, "step": 25695 }, { "entropy": 6.161756467819214, "epoch": 2.965954991344489, "grad_norm": 0.89453125, "learning_rate": 0.0004138119638839143, "loss": 5.7422, "mean_token_accuracy": 0.19545589983463288, "num_tokens": 65138345.0, "step": 25700 }, { "entropy": 6.206123399734497, "epoch": 2.966532025389498, "grad_norm": 1.0703125, "learning_rate": 0.00041377948615104024, "loss": 5.7826, "mean_token_accuracy": 0.18727729320526124, "num_tokens": 65151337.0, "step": 25705 }, { "entropy": 6.024678421020508, "epoch": 2.967109059434507, "grad_norm": 1.2421875, "learning_rate": 0.0004137470037503871, "loss": 5.6566, "mean_token_accuracy": 0.1973340168595314, "num_tokens": 65163061.0, "step": 25710 }, { "entropy": 6.185911798477173, "epoch": 2.9676860934795153, "grad_norm": 0.9453125, "learning_rate": 0.0004137145166830474, "loss": 5.7662, "mean_token_accuracy": 0.18733941167593002, "num_tokens": 65176358.0, "step": 25715 }, { "entropy": 6.182557010650635, "epoch": 2.9682631275245237, "grad_norm": 0.9375, "learning_rate": 0.0004136820249501139, "loss": 5.7879, "mean_token_accuracy": 0.1872107282280922, "num_tokens": 65188189.0, "step": 25720 }, { "entropy": 6.17884578704834, "epoch": 2.9688401615695326, "grad_norm": 0.95703125, "learning_rate": 0.0004136495285526792, "loss": 5.7779, "mean_token_accuracy": 0.18638554960489273, "num_tokens": 65200748.0, "step": 25725 }, { "entropy": 6.172512245178223, "epoch": 2.9694171956145414, "grad_norm": 0.93359375, "learning_rate": 0.00041361702749183663, "loss": 5.7582, "mean_token_accuracy": 0.19288298785686492, "num_tokens": 65212871.0, "step": 25730 }, { "entropy": 6.083426523208618, "epoch": 2.96999422965955, "grad_norm": 0.97265625, "learning_rate": 0.0004135845217686791, "loss": 5.6906, "mean_token_accuracy": 0.20035747587680816, "num_tokens": 65224604.0, "step": 25735 }, { "entropy": 6.139448785781861, "epoch": 2.9705712637045587, "grad_norm": 0.94140625, "learning_rate": 0.0004135520113843001, "loss": 5.7365, "mean_token_accuracy": 0.19355759024620056, "num_tokens": 65236757.0, "step": 25740 }, { "entropy": 6.210270118713379, "epoch": 2.971148297749567, "grad_norm": 0.9296875, "learning_rate": 0.000413519496339793, "loss": 5.7494, "mean_token_accuracy": 0.18610137403011323, "num_tokens": 65250735.0, "step": 25745 }, { "entropy": 6.021968412399292, "epoch": 2.971725331794576, "grad_norm": 0.84375, "learning_rate": 0.00041348697663625144, "loss": 5.6415, "mean_token_accuracy": 0.20317477881908416, "num_tokens": 65263543.0, "step": 25750 }, { "entropy": 6.137899923324585, "epoch": 2.9723023658395844, "grad_norm": 1.2734375, "learning_rate": 0.0004134544522747692, "loss": 5.7988, "mean_token_accuracy": 0.18780627399682998, "num_tokens": 65275637.0, "step": 25755 }, { "entropy": 6.11231803894043, "epoch": 2.9728793998845933, "grad_norm": 0.9609375, "learning_rate": 0.00041342192325644024, "loss": 5.6483, "mean_token_accuracy": 0.202757366001606, "num_tokens": 65287564.0, "step": 25760 }, { "entropy": 6.134401655197143, "epoch": 2.9734564339296017, "grad_norm": 0.93359375, "learning_rate": 0.0004133893895823586, "loss": 5.8118, "mean_token_accuracy": 0.19222568422555925, "num_tokens": 65299255.0, "step": 25765 }, { "entropy": 6.225218820571899, "epoch": 2.9740334679746105, "grad_norm": 0.921875, "learning_rate": 0.0004133568512536187, "loss": 5.7886, "mean_token_accuracy": 0.1872355595231056, "num_tokens": 65311749.0, "step": 25770 }, { "entropy": 6.10582127571106, "epoch": 2.974610502019619, "grad_norm": 0.9765625, "learning_rate": 0.00041332430827131474, "loss": 5.7158, "mean_token_accuracy": 0.19686691612005233, "num_tokens": 65325391.0, "step": 25775 }, { "entropy": 6.182678937911987, "epoch": 2.975187536064628, "grad_norm": 1.171875, "learning_rate": 0.00041329176063654137, "loss": 5.8569, "mean_token_accuracy": 0.17983190566301346, "num_tokens": 65338640.0, "step": 25780 }, { "entropy": 6.114098978042603, "epoch": 2.9757645701096367, "grad_norm": 0.921875, "learning_rate": 0.00041325920835039344, "loss": 5.6331, "mean_token_accuracy": 0.19274860620498657, "num_tokens": 65351378.0, "step": 25785 }, { "entropy": 6.227236366271972, "epoch": 2.976341604154645, "grad_norm": 0.9453125, "learning_rate": 0.0004132266514139656, "loss": 5.8398, "mean_token_accuracy": 0.18156189024448394, "num_tokens": 65364072.0, "step": 25790 }, { "entropy": 6.145966720581055, "epoch": 2.9769186381996535, "grad_norm": 0.91796875, "learning_rate": 0.00041319408982835306, "loss": 5.7311, "mean_token_accuracy": 0.19451336562633514, "num_tokens": 65377019.0, "step": 25795 }, { "entropy": 6.126743173599243, "epoch": 2.9774956722446624, "grad_norm": 0.95703125, "learning_rate": 0.00041316152359465087, "loss": 5.7244, "mean_token_accuracy": 0.1898722916841507, "num_tokens": 65390465.0, "step": 25800 }, { "entropy": 6.194520139694214, "epoch": 2.9780727062896712, "grad_norm": 1.1171875, "learning_rate": 0.00041312895271395457, "loss": 5.7457, "mean_token_accuracy": 0.1883865177631378, "num_tokens": 65402947.0, "step": 25805 }, { "entropy": 6.161165428161621, "epoch": 2.9786497403346797, "grad_norm": 0.91796875, "learning_rate": 0.0004130963771873595, "loss": 5.8258, "mean_token_accuracy": 0.17923434376716613, "num_tokens": 65414725.0, "step": 25810 }, { "entropy": 6.213643026351929, "epoch": 2.9792267743796885, "grad_norm": 0.96875, "learning_rate": 0.00041306379701596134, "loss": 5.7162, "mean_token_accuracy": 0.1917021244764328, "num_tokens": 65427417.0, "step": 25815 }, { "entropy": 6.0661111831665036, "epoch": 2.979803808424697, "grad_norm": 0.97265625, "learning_rate": 0.00041303121220085607, "loss": 5.751, "mean_token_accuracy": 0.19381363987922667, "num_tokens": 65440151.0, "step": 25820 }, { "entropy": 6.128991174697876, "epoch": 2.980380842469706, "grad_norm": 0.91796875, "learning_rate": 0.0004129986227431394, "loss": 5.7996, "mean_token_accuracy": 0.19028945565223693, "num_tokens": 65453774.0, "step": 25825 }, { "entropy": 6.251294040679932, "epoch": 2.9809578765147142, "grad_norm": 1.0, "learning_rate": 0.0004129660286439077, "loss": 5.8405, "mean_token_accuracy": 0.18535294830799104, "num_tokens": 65466523.0, "step": 25830 }, { "entropy": 6.242503595352173, "epoch": 2.981534910559723, "grad_norm": 1.1328125, "learning_rate": 0.00041293342990425714, "loss": 5.9239, "mean_token_accuracy": 0.1738576591014862, "num_tokens": 65480728.0, "step": 25835 }, { "entropy": 6.164182090759278, "epoch": 2.982111944604732, "grad_norm": 0.890625, "learning_rate": 0.00041290082652528415, "loss": 5.8636, "mean_token_accuracy": 0.18174926936626434, "num_tokens": 65494086.0, "step": 25840 }, { "entropy": 6.144267940521241, "epoch": 2.9826889786497404, "grad_norm": 1.0234375, "learning_rate": 0.0004128682185080854, "loss": 5.7004, "mean_token_accuracy": 0.19243649542331695, "num_tokens": 65508079.0, "step": 25845 }, { "entropy": 6.1460533618927, "epoch": 2.983266012694749, "grad_norm": 0.8125, "learning_rate": 0.0004128356058537576, "loss": 5.7212, "mean_token_accuracy": 0.1948441118001938, "num_tokens": 65523511.0, "step": 25850 }, { "entropy": 6.07674012184143, "epoch": 2.9838430467397576, "grad_norm": 1.015625, "learning_rate": 0.00041280298856339763, "loss": 5.6909, "mean_token_accuracy": 0.19042058736085893, "num_tokens": 65535968.0, "step": 25855 }, { "entropy": 6.101561164855957, "epoch": 2.9844200807847665, "grad_norm": 1.0, "learning_rate": 0.00041277036663810266, "loss": 5.7901, "mean_token_accuracy": 0.18664904981851577, "num_tokens": 65548009.0, "step": 25860 }, { "entropy": 6.217222261428833, "epoch": 2.984997114829775, "grad_norm": 1.203125, "learning_rate": 0.00041273774007896983, "loss": 5.7239, "mean_token_accuracy": 0.19082981795072557, "num_tokens": 65561076.0, "step": 25865 }, { "entropy": 6.090844583511353, "epoch": 2.9855741488747833, "grad_norm": 0.90234375, "learning_rate": 0.0004127051088870964, "loss": 5.6381, "mean_token_accuracy": 0.20527324974536895, "num_tokens": 65573982.0, "step": 25870 }, { "entropy": 6.170323371887207, "epoch": 2.986151182919792, "grad_norm": 0.96875, "learning_rate": 0.0004126724730635801, "loss": 5.8406, "mean_token_accuracy": 0.18809180110692977, "num_tokens": 65585923.0, "step": 25875 }, { "entropy": 6.141154384613037, "epoch": 2.986728216964801, "grad_norm": 0.97265625, "learning_rate": 0.00041263983260951857, "loss": 5.7218, "mean_token_accuracy": 0.18971893340349197, "num_tokens": 65597366.0, "step": 25880 }, { "entropy": 6.244146919250488, "epoch": 2.9873052510098095, "grad_norm": 1.015625, "learning_rate": 0.0004126071875260097, "loss": 5.871, "mean_token_accuracy": 0.188421767950058, "num_tokens": 65610200.0, "step": 25885 }, { "entropy": 6.134675121307373, "epoch": 2.9878822850548183, "grad_norm": 0.96484375, "learning_rate": 0.0004125745378141513, "loss": 5.7744, "mean_token_accuracy": 0.19529479146003723, "num_tokens": 65623270.0, "step": 25890 }, { "entropy": 6.048443794250488, "epoch": 2.9884593190998268, "grad_norm": 1.1015625, "learning_rate": 0.0004125418834750418, "loss": 5.6646, "mean_token_accuracy": 0.20220012366771697, "num_tokens": 65637443.0, "step": 25895 }, { "entropy": 6.239281082153321, "epoch": 2.9890363531448356, "grad_norm": 1.0390625, "learning_rate": 0.0004125092245097793, "loss": 5.8275, "mean_token_accuracy": 0.1816248133778572, "num_tokens": 65650004.0, "step": 25900 }, { "entropy": 6.171496438980102, "epoch": 2.989613387189844, "grad_norm": 0.921875, "learning_rate": 0.00041247656091946235, "loss": 5.7348, "mean_token_accuracy": 0.18765859603881835, "num_tokens": 65662832.0, "step": 25905 }, { "entropy": 6.141176700592041, "epoch": 2.990190421234853, "grad_norm": 0.90234375, "learning_rate": 0.0004124438927051895, "loss": 5.7863, "mean_token_accuracy": 0.18915551006793976, "num_tokens": 65675545.0, "step": 25910 }, { "entropy": 6.2161157608032225, "epoch": 2.9907674552798618, "grad_norm": 0.90625, "learning_rate": 0.0004124112198680597, "loss": 5.8068, "mean_token_accuracy": 0.18392547369003295, "num_tokens": 65688194.0, "step": 25915 }, { "entropy": 6.269847440719604, "epoch": 2.99134448932487, "grad_norm": 0.88671875, "learning_rate": 0.0004123785424091717, "loss": 5.8361, "mean_token_accuracy": 0.18446499556303025, "num_tokens": 65701410.0, "step": 25920 }, { "entropy": 6.207719373703003, "epoch": 2.9919215233698786, "grad_norm": 0.921875, "learning_rate": 0.0004123458603296247, "loss": 5.8049, "mean_token_accuracy": 0.19142566323280336, "num_tokens": 65714540.0, "step": 25925 }, { "entropy": 6.205081939697266, "epoch": 2.9924985574148875, "grad_norm": 0.91015625, "learning_rate": 0.0004123131736305178, "loss": 5.8251, "mean_token_accuracy": 0.1890667736530304, "num_tokens": 65727774.0, "step": 25930 }, { "entropy": 6.196783399581909, "epoch": 2.9930755914598963, "grad_norm": 1.0078125, "learning_rate": 0.0004122804823129507, "loss": 5.851, "mean_token_accuracy": 0.18182846903800964, "num_tokens": 65740040.0, "step": 25935 }, { "entropy": 6.184090566635132, "epoch": 2.9936526255049047, "grad_norm": 1.0, "learning_rate": 0.0004122477863780227, "loss": 5.8251, "mean_token_accuracy": 0.18570015132427214, "num_tokens": 65751188.0, "step": 25940 }, { "entropy": 6.212691831588745, "epoch": 2.9942296595499136, "grad_norm": 0.89453125, "learning_rate": 0.0004122150858268335, "loss": 5.7821, "mean_token_accuracy": 0.18940315544605255, "num_tokens": 65762960.0, "step": 25945 }, { "entropy": 6.296775913238525, "epoch": 2.994806693594922, "grad_norm": 0.90625, "learning_rate": 0.00041218238066048315, "loss": 5.8341, "mean_token_accuracy": 0.18633692115545272, "num_tokens": 65775069.0, "step": 25950 }, { "entropy": 6.19817886352539, "epoch": 2.995383727639931, "grad_norm": 0.890625, "learning_rate": 0.0004121496708800715, "loss": 5.8558, "mean_token_accuracy": 0.18426271080970763, "num_tokens": 65788181.0, "step": 25955 }, { "entropy": 6.121626520156861, "epoch": 2.9959607616849393, "grad_norm": 0.87890625, "learning_rate": 0.00041211695648669884, "loss": 5.719, "mean_token_accuracy": 0.2072511687874794, "num_tokens": 65801038.0, "step": 25960 }, { "entropy": 6.108192586898804, "epoch": 2.996537795729948, "grad_norm": 0.89453125, "learning_rate": 0.0004120842374814654, "loss": 5.7022, "mean_token_accuracy": 0.19959067851305007, "num_tokens": 65813631.0, "step": 25965 }, { "entropy": 6.190539789199829, "epoch": 2.9971148297749566, "grad_norm": 0.91015625, "learning_rate": 0.00041205151386547174, "loss": 5.7796, "mean_token_accuracy": 0.18970050066709518, "num_tokens": 65825345.0, "step": 25970 }, { "entropy": 6.1861536502838135, "epoch": 2.9976918638199654, "grad_norm": 1.0625, "learning_rate": 0.00041201878563981855, "loss": 5.7587, "mean_token_accuracy": 0.1962239846587181, "num_tokens": 65837144.0, "step": 25975 }, { "entropy": 6.0960300922393795, "epoch": 2.998268897864974, "grad_norm": 0.9765625, "learning_rate": 0.00041198605280560655, "loss": 5.7218, "mean_token_accuracy": 0.2002798691391945, "num_tokens": 65850458.0, "step": 25980 }, { "entropy": 6.268774461746216, "epoch": 2.9988459319099827, "grad_norm": 0.89453125, "learning_rate": 0.0004119533153639367, "loss": 5.8235, "mean_token_accuracy": 0.18734786212444304, "num_tokens": 65863659.0, "step": 25985 }, { "entropy": 6.124815797805786, "epoch": 2.9994229659549916, "grad_norm": 1.0234375, "learning_rate": 0.00041192057331591, "loss": 5.7715, "mean_token_accuracy": 0.1886030152440071, "num_tokens": 65877129.0, "step": 25990 }, { "entropy": 6.2515641212463375, "epoch": 3.0, "grad_norm": 0.99609375, "learning_rate": 0.000411887826662628, "loss": 5.8443, "mean_token_accuracy": 0.1817408338189125, "num_tokens": 65889351.0, "step": 25995 }, { "entropy": 6.103536176681518, "epoch": 3.000577034045009, "grad_norm": 0.9140625, "learning_rate": 0.0004118550754051919, "loss": 5.6964, "mean_token_accuracy": 0.19620571434497833, "num_tokens": 65901967.0, "step": 26000 }, { "entropy": 6.070988512039184, "epoch": 3.0011540680900173, "grad_norm": 0.953125, "learning_rate": 0.0004118223195447033, "loss": 5.5774, "mean_token_accuracy": 0.20379541218280792, "num_tokens": 65915259.0, "step": 26005 }, { "entropy": 6.180714750289917, "epoch": 3.001731102135026, "grad_norm": 0.9453125, "learning_rate": 0.00041178955908226396, "loss": 5.7063, "mean_token_accuracy": 0.19393839538097382, "num_tokens": 65928236.0, "step": 26010 }, { "entropy": 6.130123281478882, "epoch": 3.0023081361800346, "grad_norm": 0.984375, "learning_rate": 0.0004117567940189757, "loss": 5.7146, "mean_token_accuracy": 0.19025546908378602, "num_tokens": 65941290.0, "step": 26015 }, { "entropy": 6.146258878707886, "epoch": 3.0028851702250434, "grad_norm": 0.84375, "learning_rate": 0.0004117240243559406, "loss": 5.7777, "mean_token_accuracy": 0.17930715382099152, "num_tokens": 65954301.0, "step": 26020 }, { "entropy": 6.244616603851318, "epoch": 3.003462204270052, "grad_norm": 0.93359375, "learning_rate": 0.0004116912500942609, "loss": 5.7581, "mean_token_accuracy": 0.19302790910005568, "num_tokens": 65966406.0, "step": 26025 }, { "entropy": 6.099221801757812, "epoch": 3.0040392383150607, "grad_norm": 0.94921875, "learning_rate": 0.0004116584712350389, "loss": 5.6754, "mean_token_accuracy": 0.19372874200344087, "num_tokens": 65979177.0, "step": 26030 }, { "entropy": 6.05877366065979, "epoch": 3.004616272360069, "grad_norm": 0.89453125, "learning_rate": 0.0004116256877793771, "loss": 5.6509, "mean_token_accuracy": 0.1997956305742264, "num_tokens": 65992326.0, "step": 26035 }, { "entropy": 6.231365919113159, "epoch": 3.005193306405078, "grad_norm": 0.96875, "learning_rate": 0.00041159289972837813, "loss": 5.6941, "mean_token_accuracy": 0.19710197001695634, "num_tokens": 66003481.0, "step": 26040 }, { "entropy": 6.215103340148926, "epoch": 3.0057703404500864, "grad_norm": 0.90234375, "learning_rate": 0.00041156010708314487, "loss": 5.7768, "mean_token_accuracy": 0.18236880451440812, "num_tokens": 66015552.0, "step": 26045 }, { "entropy": 6.192623519897461, "epoch": 3.0063473744950953, "grad_norm": 1.0390625, "learning_rate": 0.0004115273098447802, "loss": 5.7336, "mean_token_accuracy": 0.19326211959123613, "num_tokens": 66028506.0, "step": 26050 }, { "entropy": 6.187188911437988, "epoch": 3.0069244085401037, "grad_norm": 0.94921875, "learning_rate": 0.00041149450801438727, "loss": 5.6924, "mean_token_accuracy": 0.18974484354257584, "num_tokens": 66040938.0, "step": 26055 }, { "entropy": 6.104094076156616, "epoch": 3.0075014425851125, "grad_norm": 1.0546875, "learning_rate": 0.00041146170159306946, "loss": 5.6314, "mean_token_accuracy": 0.18857638090848922, "num_tokens": 66052838.0, "step": 26060 }, { "entropy": 6.176004314422608, "epoch": 3.008078476630121, "grad_norm": 1.09375, "learning_rate": 0.00041142889058193, "loss": 5.6849, "mean_token_accuracy": 0.19574964046478271, "num_tokens": 66065286.0, "step": 26065 }, { "entropy": 6.1532289505004885, "epoch": 3.00865551067513, "grad_norm": 0.91015625, "learning_rate": 0.00041139607498207265, "loss": 5.7334, "mean_token_accuracy": 0.19025952816009523, "num_tokens": 66077174.0, "step": 26070 }, { "entropy": 6.170625448226929, "epoch": 3.0092325447201387, "grad_norm": 0.94140625, "learning_rate": 0.000411363254794601, "loss": 5.7704, "mean_token_accuracy": 0.19564634412527085, "num_tokens": 66092510.0, "step": 26075 }, { "entropy": 6.188890075683593, "epoch": 3.009809578765147, "grad_norm": 0.8828125, "learning_rate": 0.000411330430020619, "loss": 5.6948, "mean_token_accuracy": 0.2006187155842781, "num_tokens": 66105001.0, "step": 26080 }, { "entropy": 6.146265125274658, "epoch": 3.010386612810156, "grad_norm": 0.953125, "learning_rate": 0.0004112976006612308, "loss": 5.6913, "mean_token_accuracy": 0.1987504929304123, "num_tokens": 66117264.0, "step": 26085 }, { "entropy": 6.111363410949707, "epoch": 3.0109636468551644, "grad_norm": 0.9609375, "learning_rate": 0.00041126476671754037, "loss": 5.7288, "mean_token_accuracy": 0.19112110882997513, "num_tokens": 66130954.0, "step": 26090 }, { "entropy": 6.189563894271851, "epoch": 3.0115406809001732, "grad_norm": 0.95703125, "learning_rate": 0.00041123192819065234, "loss": 5.7194, "mean_token_accuracy": 0.1923195481300354, "num_tokens": 66143560.0, "step": 26095 }, { "entropy": 6.256980752944946, "epoch": 3.0121177149451817, "grad_norm": 0.93359375, "learning_rate": 0.000411199085081671, "loss": 5.7744, "mean_token_accuracy": 0.19028388261795043, "num_tokens": 66157169.0, "step": 26100 }, { "entropy": 6.167681169509888, "epoch": 3.0126947489901905, "grad_norm": 0.90234375, "learning_rate": 0.00041116623739170105, "loss": 5.7122, "mean_token_accuracy": 0.18988695442676545, "num_tokens": 66171331.0, "step": 26105 }, { "entropy": 6.182020854949951, "epoch": 3.013271783035199, "grad_norm": 0.94140625, "learning_rate": 0.0004111333851218474, "loss": 5.7432, "mean_token_accuracy": 0.193082532286644, "num_tokens": 66184428.0, "step": 26110 }, { "entropy": 6.191115522384644, "epoch": 3.013848817080208, "grad_norm": 0.96484375, "learning_rate": 0.00041110052827321496, "loss": 5.7007, "mean_token_accuracy": 0.19426756352186203, "num_tokens": 66196602.0, "step": 26115 }, { "entropy": 6.069936084747314, "epoch": 3.014425851125216, "grad_norm": 1.046875, "learning_rate": 0.00041106766684690884, "loss": 5.6559, "mean_token_accuracy": 0.19884906560182572, "num_tokens": 66209603.0, "step": 26120 }, { "entropy": 6.13335018157959, "epoch": 3.015002885170225, "grad_norm": 0.984375, "learning_rate": 0.0004110348008440344, "loss": 5.7338, "mean_token_accuracy": 0.1877104803919792, "num_tokens": 66221587.0, "step": 26125 }, { "entropy": 6.274585247039795, "epoch": 3.0155799192152335, "grad_norm": 0.99609375, "learning_rate": 0.00041100193026569686, "loss": 5.7735, "mean_token_accuracy": 0.18737897872924805, "num_tokens": 66233243.0, "step": 26130 }, { "entropy": 6.096971464157105, "epoch": 3.0161569532602424, "grad_norm": 0.91796875, "learning_rate": 0.00041096905511300207, "loss": 5.6865, "mean_token_accuracy": 0.19875524789094925, "num_tokens": 66245831.0, "step": 26135 }, { "entropy": 6.241936302185058, "epoch": 3.016733987305251, "grad_norm": 0.9609375, "learning_rate": 0.0004109361753870556, "loss": 5.7666, "mean_token_accuracy": 0.18903570473194123, "num_tokens": 66259113.0, "step": 26140 }, { "entropy": 6.1352049827575685, "epoch": 3.0173110213502596, "grad_norm": 1.2265625, "learning_rate": 0.0004109032910889635, "loss": 5.6728, "mean_token_accuracy": 0.19991651475429534, "num_tokens": 66272633.0, "step": 26145 }, { "entropy": 6.2056357860565186, "epoch": 3.0178880553952685, "grad_norm": 0.94140625, "learning_rate": 0.0004108704022198316, "loss": 5.6933, "mean_token_accuracy": 0.1884486123919487, "num_tokens": 66286100.0, "step": 26150 }, { "entropy": 6.129799842834473, "epoch": 3.018465089440277, "grad_norm": 1.0234375, "learning_rate": 0.00041083750878076627, "loss": 5.6322, "mean_token_accuracy": 0.1919589802622795, "num_tokens": 66297623.0, "step": 26155 }, { "entropy": 6.100574254989624, "epoch": 3.0190421234852858, "grad_norm": 1.125, "learning_rate": 0.0004108046107728737, "loss": 5.7118, "mean_token_accuracy": 0.1900741547346115, "num_tokens": 66311688.0, "step": 26160 }, { "entropy": 6.1915263652801515, "epoch": 3.019619157530294, "grad_norm": 0.9453125, "learning_rate": 0.00041077170819726064, "loss": 5.7294, "mean_token_accuracy": 0.18557717502117158, "num_tokens": 66324317.0, "step": 26165 }, { "entropy": 6.144586896896362, "epoch": 3.020196191575303, "grad_norm": 0.99609375, "learning_rate": 0.00041073880105503346, "loss": 5.6758, "mean_token_accuracy": 0.1939310312271118, "num_tokens": 66337152.0, "step": 26170 }, { "entropy": 6.261649751663208, "epoch": 3.0207732256203115, "grad_norm": 0.9609375, "learning_rate": 0.00041070588934729923, "loss": 5.7897, "mean_token_accuracy": 0.186767840385437, "num_tokens": 66349043.0, "step": 26175 }, { "entropy": 6.060703134536743, "epoch": 3.0213502596653203, "grad_norm": 0.9921875, "learning_rate": 0.0004106729730751649, "loss": 5.5948, "mean_token_accuracy": 0.20910189747810365, "num_tokens": 66362283.0, "step": 26180 }, { "entropy": 6.065590906143188, "epoch": 3.0219272937103288, "grad_norm": 0.95703125, "learning_rate": 0.00041064005223973737, "loss": 5.5758, "mean_token_accuracy": 0.20630859583616257, "num_tokens": 66376919.0, "step": 26185 }, { "entropy": 6.063845252990722, "epoch": 3.0225043277553376, "grad_norm": 0.98046875, "learning_rate": 0.0004106071268421241, "loss": 5.5982, "mean_token_accuracy": 0.2077121764421463, "num_tokens": 66389285.0, "step": 26190 }, { "entropy": 6.156057548522949, "epoch": 3.023081361800346, "grad_norm": 1.046875, "learning_rate": 0.00041057419688343255, "loss": 5.7779, "mean_token_accuracy": 0.19199763089418412, "num_tokens": 66402196.0, "step": 26195 }, { "entropy": 6.036690139770508, "epoch": 3.023658395845355, "grad_norm": 1.1015625, "learning_rate": 0.0004105412623647702, "loss": 5.6393, "mean_token_accuracy": 0.1942216619849205, "num_tokens": 66414334.0, "step": 26200 }, { "entropy": 6.16955156326294, "epoch": 3.0242354298903633, "grad_norm": 1.015625, "learning_rate": 0.00041050832328724476, "loss": 5.7505, "mean_token_accuracy": 0.1834244728088379, "num_tokens": 66425975.0, "step": 26205 }, { "entropy": 6.120315504074097, "epoch": 3.024812463935372, "grad_norm": 1.5546875, "learning_rate": 0.0004104753796519642, "loss": 5.6315, "mean_token_accuracy": 0.19852339923381807, "num_tokens": 66438841.0, "step": 26210 }, { "entropy": 6.251455450057984, "epoch": 3.025389497980381, "grad_norm": 0.875, "learning_rate": 0.0004104424314600365, "loss": 5.7502, "mean_token_accuracy": 0.18712622076272964, "num_tokens": 66451100.0, "step": 26215 }, { "entropy": 6.155909872055053, "epoch": 3.0259665320253895, "grad_norm": 0.94140625, "learning_rate": 0.00041040947871257, "loss": 5.7105, "mean_token_accuracy": 0.1956273227930069, "num_tokens": 66463613.0, "step": 26220 }, { "entropy": 6.141160011291504, "epoch": 3.0265435660703983, "grad_norm": 0.921875, "learning_rate": 0.00041037652141067294, "loss": 5.6759, "mean_token_accuracy": 0.19774365723133086, "num_tokens": 66476676.0, "step": 26225 }, { "entropy": 6.224869012832642, "epoch": 3.0271206001154067, "grad_norm": 1.0859375, "learning_rate": 0.00041034355955545375, "loss": 5.7508, "mean_token_accuracy": 0.1915663704276085, "num_tokens": 66489577.0, "step": 26230 }, { "entropy": 6.147612047195435, "epoch": 3.0276976341604156, "grad_norm": 0.91796875, "learning_rate": 0.00041031059314802114, "loss": 5.7023, "mean_token_accuracy": 0.18792953342199326, "num_tokens": 66500732.0, "step": 26235 }, { "entropy": 6.105926656723023, "epoch": 3.028274668205424, "grad_norm": 1.0625, "learning_rate": 0.00041027762218948403, "loss": 5.6576, "mean_token_accuracy": 0.20472156256437302, "num_tokens": 66512342.0, "step": 26240 }, { "entropy": 6.1010932445526125, "epoch": 3.028851702250433, "grad_norm": 0.91796875, "learning_rate": 0.00041024464668095123, "loss": 5.7144, "mean_token_accuracy": 0.19461794048547745, "num_tokens": 66526042.0, "step": 26245 }, { "entropy": 6.151596403121948, "epoch": 3.0294287362954413, "grad_norm": 0.96484375, "learning_rate": 0.000410211666623532, "loss": 5.6801, "mean_token_accuracy": 0.19064646810293198, "num_tokens": 66537995.0, "step": 26250 }, { "entropy": 6.108174753189087, "epoch": 3.03000577034045, "grad_norm": 0.9140625, "learning_rate": 0.00041017868201833545, "loss": 5.7791, "mean_token_accuracy": 0.18986818939447403, "num_tokens": 66550684.0, "step": 26255 }, { "entropy": 6.143332004547119, "epoch": 3.0305828043854586, "grad_norm": 0.9921875, "learning_rate": 0.0004101456928664711, "loss": 5.6746, "mean_token_accuracy": 0.19494170397520066, "num_tokens": 66563940.0, "step": 26260 }, { "entropy": 6.075266313552857, "epoch": 3.0311598384304674, "grad_norm": 0.96875, "learning_rate": 0.0004101126991690485, "loss": 5.6444, "mean_token_accuracy": 0.1995875656604767, "num_tokens": 66577411.0, "step": 26265 }, { "entropy": 6.175258445739746, "epoch": 3.031736872475476, "grad_norm": 0.91015625, "learning_rate": 0.0004100797009271774, "loss": 5.757, "mean_token_accuracy": 0.19028777331113816, "num_tokens": 66589520.0, "step": 26270 }, { "entropy": 6.179210090637207, "epoch": 3.0323139065204847, "grad_norm": 0.9140625, "learning_rate": 0.0004100466981419676, "loss": 5.716, "mean_token_accuracy": 0.19614706933498383, "num_tokens": 66602573.0, "step": 26275 }, { "entropy": 6.035876131057739, "epoch": 3.0328909405654936, "grad_norm": 0.91015625, "learning_rate": 0.00041001369081452926, "loss": 5.5739, "mean_token_accuracy": 0.20045224130153655, "num_tokens": 66614739.0, "step": 26280 }, { "entropy": 6.1427703380584715, "epoch": 3.033467974610502, "grad_norm": 0.921875, "learning_rate": 0.00040998067894597247, "loss": 5.7963, "mean_token_accuracy": 0.1862247109413147, "num_tokens": 66628635.0, "step": 26285 }, { "entropy": 6.247771215438843, "epoch": 3.034045008655511, "grad_norm": 1.0703125, "learning_rate": 0.00040994766253740756, "loss": 5.8089, "mean_token_accuracy": 0.18791309297084807, "num_tokens": 66640911.0, "step": 26290 }, { "entropy": 6.048626375198364, "epoch": 3.0346220427005193, "grad_norm": 0.80859375, "learning_rate": 0.00040991464158994506, "loss": 5.5785, "mean_token_accuracy": 0.2054696187376976, "num_tokens": 66654150.0, "step": 26295 }, { "entropy": 6.089620685577392, "epoch": 3.035199076745528, "grad_norm": 0.9453125, "learning_rate": 0.0004098816161046956, "loss": 5.7522, "mean_token_accuracy": 0.18896272033452988, "num_tokens": 66666026.0, "step": 26300 }, { "entropy": 6.139586591720581, "epoch": 3.0357761107905366, "grad_norm": 0.9140625, "learning_rate": 0.00040984858608277, "loss": 5.6296, "mean_token_accuracy": 0.19342040419578552, "num_tokens": 66679446.0, "step": 26305 }, { "entropy": 6.2065582275390625, "epoch": 3.0363531448355454, "grad_norm": 0.921875, "learning_rate": 0.0004098155515252793, "loss": 5.7985, "mean_token_accuracy": 0.19067757874727248, "num_tokens": 66692689.0, "step": 26310 }, { "entropy": 6.176087236404419, "epoch": 3.036930178880554, "grad_norm": 1.0078125, "learning_rate": 0.0004097825124333343, "loss": 5.6241, "mean_token_accuracy": 0.20387111455202103, "num_tokens": 66705765.0, "step": 26315 }, { "entropy": 6.092849206924439, "epoch": 3.0375072129255627, "grad_norm": 1.0546875, "learning_rate": 0.0004097494688080466, "loss": 5.6624, "mean_token_accuracy": 0.1970837026834488, "num_tokens": 66718856.0, "step": 26320 }, { "entropy": 6.196405363082886, "epoch": 3.038084246970571, "grad_norm": 0.8984375, "learning_rate": 0.00040971642065052734, "loss": 5.7207, "mean_token_accuracy": 0.19337523132562637, "num_tokens": 66731330.0, "step": 26325 }, { "entropy": 6.159465599060058, "epoch": 3.03866128101558, "grad_norm": 0.890625, "learning_rate": 0.0004096833679618882, "loss": 5.7269, "mean_token_accuracy": 0.19103855788707733, "num_tokens": 66743676.0, "step": 26330 }, { "entropy": 6.112085294723511, "epoch": 3.0392383150605884, "grad_norm": 0.99609375, "learning_rate": 0.00040965031074324094, "loss": 5.6569, "mean_token_accuracy": 0.195459346473217, "num_tokens": 66757663.0, "step": 26335 }, { "entropy": 6.12399468421936, "epoch": 3.0398153491055973, "grad_norm": 1.015625, "learning_rate": 0.0004096172489956973, "loss": 5.6958, "mean_token_accuracy": 0.1900702640414238, "num_tokens": 66770149.0, "step": 26340 }, { "entropy": 6.143730020523071, "epoch": 3.0403923831506057, "grad_norm": 0.89453125, "learning_rate": 0.0004095841827203694, "loss": 5.6652, "mean_token_accuracy": 0.19444374591112137, "num_tokens": 66781754.0, "step": 26345 }, { "entropy": 6.040595626831054, "epoch": 3.0409694171956145, "grad_norm": 1.109375, "learning_rate": 0.0004095511119183693, "loss": 5.5352, "mean_token_accuracy": 0.20391818284988403, "num_tokens": 66795213.0, "step": 26350 }, { "entropy": 6.186661577224731, "epoch": 3.0415464512406234, "grad_norm": 0.87109375, "learning_rate": 0.0004095180365908094, "loss": 5.6991, "mean_token_accuracy": 0.19509964436292648, "num_tokens": 66808514.0, "step": 26355 }, { "entropy": 5.970676851272583, "epoch": 3.042123485285632, "grad_norm": 0.94921875, "learning_rate": 0.0004094849567388022, "loss": 5.5257, "mean_token_accuracy": 0.2070065051317215, "num_tokens": 66821665.0, "step": 26360 }, { "entropy": 6.129239511489868, "epoch": 3.0427005193306407, "grad_norm": 0.87890625, "learning_rate": 0.0004094518723634603, "loss": 5.7015, "mean_token_accuracy": 0.1878933623433113, "num_tokens": 66834447.0, "step": 26365 }, { "entropy": 6.204967737197876, "epoch": 3.043277553375649, "grad_norm": 1.0234375, "learning_rate": 0.0004094187834658964, "loss": 5.7395, "mean_token_accuracy": 0.18758202642202376, "num_tokens": 66846199.0, "step": 26370 }, { "entropy": 6.151585578918457, "epoch": 3.043854587420658, "grad_norm": 0.9609375, "learning_rate": 0.0004093856900472236, "loss": 5.7064, "mean_token_accuracy": 0.19432766139507293, "num_tokens": 66858055.0, "step": 26375 }, { "entropy": 6.178366994857788, "epoch": 3.0444316214656664, "grad_norm": 1.03125, "learning_rate": 0.00040935259210855477, "loss": 5.6956, "mean_token_accuracy": 0.1904509335756302, "num_tokens": 66870779.0, "step": 26380 }, { "entropy": 6.074148511886596, "epoch": 3.0450086555106752, "grad_norm": 0.984375, "learning_rate": 0.0004093194896510033, "loss": 5.6791, "mean_token_accuracy": 0.20142536014318466, "num_tokens": 66883212.0, "step": 26385 }, { "entropy": 6.107582664489746, "epoch": 3.0455856895556837, "grad_norm": 0.890625, "learning_rate": 0.00040928638267568245, "loss": 5.631, "mean_token_accuracy": 0.20406220853328705, "num_tokens": 66897019.0, "step": 26390 }, { "entropy": 6.180645990371704, "epoch": 3.0461627236006925, "grad_norm": 0.94921875, "learning_rate": 0.00040925327118370586, "loss": 5.7394, "mean_token_accuracy": 0.19447785317897798, "num_tokens": 66909415.0, "step": 26395 }, { "entropy": 6.11536922454834, "epoch": 3.046739757645701, "grad_norm": 1.09375, "learning_rate": 0.00040922015517618724, "loss": 5.726, "mean_token_accuracy": 0.19340649098157883, "num_tokens": 66921459.0, "step": 26400 }, { "entropy": 6.12619161605835, "epoch": 3.04731679169071, "grad_norm": 0.9296875, "learning_rate": 0.0004091870346542403, "loss": 5.6164, "mean_token_accuracy": 0.20126460492610931, "num_tokens": 66933558.0, "step": 26405 }, { "entropy": 6.111900901794433, "epoch": 3.047893825735718, "grad_norm": 0.90625, "learning_rate": 0.0004091539096189791, "loss": 5.7159, "mean_token_accuracy": 0.19719034135341645, "num_tokens": 66945950.0, "step": 26410 }, { "entropy": 6.10090069770813, "epoch": 3.048470859780727, "grad_norm": 0.96875, "learning_rate": 0.00040912078007151776, "loss": 5.6672, "mean_token_accuracy": 0.19310089200735092, "num_tokens": 66958848.0, "step": 26415 }, { "entropy": 6.097727203369141, "epoch": 3.049047893825736, "grad_norm": 0.92578125, "learning_rate": 0.00040908764601297064, "loss": 5.5949, "mean_token_accuracy": 0.20191023051738738, "num_tokens": 66970302.0, "step": 26420 }, { "entropy": 6.144336843490601, "epoch": 3.0496249278707444, "grad_norm": 1.03125, "learning_rate": 0.0004090545074444522, "loss": 5.7238, "mean_token_accuracy": 0.19061239957809448, "num_tokens": 66984465.0, "step": 26425 }, { "entropy": 6.136382913589477, "epoch": 3.050201961915753, "grad_norm": 0.98046875, "learning_rate": 0.00040902136436707696, "loss": 5.6472, "mean_token_accuracy": 0.193617807328701, "num_tokens": 66995555.0, "step": 26430 }, { "entropy": 6.152734041213989, "epoch": 3.0507789959607616, "grad_norm": 0.96484375, "learning_rate": 0.0004089882167819596, "loss": 5.7297, "mean_token_accuracy": 0.19138612002134323, "num_tokens": 67007823.0, "step": 26435 }, { "entropy": 6.1525016784667965, "epoch": 3.0513560300057705, "grad_norm": 1.0859375, "learning_rate": 0.0004089550646902153, "loss": 5.6498, "mean_token_accuracy": 0.19544131308794022, "num_tokens": 67019963.0, "step": 26440 }, { "entropy": 5.967006015777588, "epoch": 3.051933064050779, "grad_norm": 0.9453125, "learning_rate": 0.00040892190809295876, "loss": 5.5305, "mean_token_accuracy": 0.21141353398561477, "num_tokens": 67032721.0, "step": 26445 }, { "entropy": 6.125797080993652, "epoch": 3.0525100980957878, "grad_norm": 0.9765625, "learning_rate": 0.0004088887469913055, "loss": 5.6563, "mean_token_accuracy": 0.1992385521531105, "num_tokens": 67046713.0, "step": 26450 }, { "entropy": 6.186389064788818, "epoch": 3.053087132140796, "grad_norm": 1.0, "learning_rate": 0.0004088555813863707, "loss": 5.749, "mean_token_accuracy": 0.18884366899728774, "num_tokens": 67059874.0, "step": 26455 }, { "entropy": 6.20120530128479, "epoch": 3.053664166185805, "grad_norm": 0.90234375, "learning_rate": 0.0004088224112792699, "loss": 5.7115, "mean_token_accuracy": 0.19516452252864838, "num_tokens": 67071897.0, "step": 26460 }, { "entropy": 6.025647926330566, "epoch": 3.0542412002308135, "grad_norm": 1.0546875, "learning_rate": 0.00040878923667111874, "loss": 5.6048, "mean_token_accuracy": 0.19705188274383545, "num_tokens": 67084489.0, "step": 26465 }, { "entropy": 6.131008768081665, "epoch": 3.0548182342758223, "grad_norm": 0.9375, "learning_rate": 0.00040875605756303314, "loss": 5.7014, "mean_token_accuracy": 0.1943628817796707, "num_tokens": 67095812.0, "step": 26470 }, { "entropy": 6.1213202476501465, "epoch": 3.0553952683208307, "grad_norm": 0.9296875, "learning_rate": 0.0004087228739561289, "loss": 5.6182, "mean_token_accuracy": 0.20195652395486832, "num_tokens": 67108551.0, "step": 26475 }, { "entropy": 6.104694986343384, "epoch": 3.0559723023658396, "grad_norm": 0.921875, "learning_rate": 0.0004086896858515223, "loss": 5.6982, "mean_token_accuracy": 0.19177381247282027, "num_tokens": 67120887.0, "step": 26480 }, { "entropy": 6.12642388343811, "epoch": 3.056549336410848, "grad_norm": 0.94921875, "learning_rate": 0.0004086564932503294, "loss": 5.6792, "mean_token_accuracy": 0.19861301630735398, "num_tokens": 67133758.0, "step": 26485 }, { "entropy": 6.126889753341675, "epoch": 3.057126370455857, "grad_norm": 0.91796875, "learning_rate": 0.0004086232961536669, "loss": 5.6201, "mean_token_accuracy": 0.19907300621271135, "num_tokens": 67145880.0, "step": 26490 }, { "entropy": 6.125477409362793, "epoch": 3.0577034045008658, "grad_norm": 0.96875, "learning_rate": 0.00040859009456265113, "loss": 5.6763, "mean_token_accuracy": 0.19218284785747528, "num_tokens": 67158104.0, "step": 26495 }, { "entropy": 6.170765066146851, "epoch": 3.058280438545874, "grad_norm": 0.96875, "learning_rate": 0.00040855688847839884, "loss": 5.7127, "mean_token_accuracy": 0.18946211636066437, "num_tokens": 67170179.0, "step": 26500 }, { "entropy": 6.198104286193848, "epoch": 3.058857472590883, "grad_norm": 0.8671875, "learning_rate": 0.00040852367790202693, "loss": 5.783, "mean_token_accuracy": 0.1860157936811447, "num_tokens": 67182318.0, "step": 26505 }, { "entropy": 6.208402824401856, "epoch": 3.0594345066358914, "grad_norm": 0.94921875, "learning_rate": 0.0004084904628346525, "loss": 5.7536, "mean_token_accuracy": 0.1904895156621933, "num_tokens": 67195302.0, "step": 26510 }, { "entropy": 6.2347949028015135, "epoch": 3.0600115406809003, "grad_norm": 1.03125, "learning_rate": 0.00040845724327739273, "loss": 5.7325, "mean_token_accuracy": 0.19044644236564637, "num_tokens": 67208191.0, "step": 26515 }, { "entropy": 6.079102611541748, "epoch": 3.0605885747259087, "grad_norm": 0.9609375, "learning_rate": 0.00040842401923136477, "loss": 5.6731, "mean_token_accuracy": 0.19952663034200668, "num_tokens": 67221410.0, "step": 26520 }, { "entropy": 6.111173009872436, "epoch": 3.0611656087709176, "grad_norm": 0.9296875, "learning_rate": 0.00040839079069768627, "loss": 5.6919, "mean_token_accuracy": 0.19796486794948578, "num_tokens": 67233958.0, "step": 26525 }, { "entropy": 6.090298223495483, "epoch": 3.061742642815926, "grad_norm": 1.0078125, "learning_rate": 0.0004083575576774747, "loss": 5.634, "mean_token_accuracy": 0.20558057129383087, "num_tokens": 67246622.0, "step": 26530 }, { "entropy": 6.1435261249542235, "epoch": 3.062319676860935, "grad_norm": 1.09375, "learning_rate": 0.00040832432017184797, "loss": 5.7086, "mean_token_accuracy": 0.19658363461494446, "num_tokens": 67258942.0, "step": 26535 }, { "entropy": 6.201191711425781, "epoch": 3.0628967109059433, "grad_norm": 0.9765625, "learning_rate": 0.000408291078181924, "loss": 5.7049, "mean_token_accuracy": 0.18951683342456818, "num_tokens": 67271094.0, "step": 26540 }, { "entropy": 6.137856531143188, "epoch": 3.063473744950952, "grad_norm": 1.0234375, "learning_rate": 0.00040825783170882077, "loss": 5.7076, "mean_token_accuracy": 0.1904965028166771, "num_tokens": 67284715.0, "step": 26545 }, { "entropy": 6.185946798324585, "epoch": 3.0640507789959606, "grad_norm": 0.94921875, "learning_rate": 0.00040822458075365654, "loss": 5.6824, "mean_token_accuracy": 0.19310538619756698, "num_tokens": 67298096.0, "step": 26550 }, { "entropy": 6.084507417678833, "epoch": 3.0646278130409694, "grad_norm": 0.9765625, "learning_rate": 0.0004081913253175498, "loss": 5.6769, "mean_token_accuracy": 0.1873644009232521, "num_tokens": 67310548.0, "step": 26555 }, { "entropy": 6.147056770324707, "epoch": 3.065204847085978, "grad_norm": 1.0625, "learning_rate": 0.00040815806540161895, "loss": 5.687, "mean_token_accuracy": 0.1979440465569496, "num_tokens": 67322771.0, "step": 26560 }, { "entropy": 6.093401670455933, "epoch": 3.0657818811309867, "grad_norm": 0.96875, "learning_rate": 0.0004081248010069827, "loss": 5.6095, "mean_token_accuracy": 0.20410916060209275, "num_tokens": 67336565.0, "step": 26565 }, { "entropy": 6.051231718063354, "epoch": 3.0663589151759956, "grad_norm": 1.0078125, "learning_rate": 0.00040809153213475983, "loss": 5.679, "mean_token_accuracy": 0.19722304940223695, "num_tokens": 67348390.0, "step": 26570 }, { "entropy": 6.108557510375976, "epoch": 3.066935949221004, "grad_norm": 0.9375, "learning_rate": 0.00040805825878606944, "loss": 5.6483, "mean_token_accuracy": 0.19871712177991868, "num_tokens": 67360686.0, "step": 26575 }, { "entropy": 6.1745765686035154, "epoch": 3.067512983266013, "grad_norm": 0.94140625, "learning_rate": 0.0004080249809620307, "loss": 5.7234, "mean_token_accuracy": 0.19749303311109542, "num_tokens": 67372092.0, "step": 26580 }, { "entropy": 6.113530492782592, "epoch": 3.0680900173110213, "grad_norm": 0.9765625, "learning_rate": 0.00040799169866376266, "loss": 5.6383, "mean_token_accuracy": 0.1920008584856987, "num_tokens": 67386017.0, "step": 26585 }, { "entropy": 6.130209827423096, "epoch": 3.06866705135603, "grad_norm": 0.921875, "learning_rate": 0.00040795841189238504, "loss": 5.7445, "mean_token_accuracy": 0.19548604041337966, "num_tokens": 67397987.0, "step": 26590 }, { "entropy": 6.232554578781128, "epoch": 3.0692440854010385, "grad_norm": 0.93359375, "learning_rate": 0.00040792512064901715, "loss": 5.8177, "mean_token_accuracy": 0.18661231100559234, "num_tokens": 67410756.0, "step": 26595 }, { "entropy": 6.268054389953614, "epoch": 3.0698211194460474, "grad_norm": 0.91015625, "learning_rate": 0.00040789182493477887, "loss": 5.7909, "mean_token_accuracy": 0.19176454693078995, "num_tokens": 67423528.0, "step": 26600 }, { "entropy": 6.112860822677613, "epoch": 3.070398153491056, "grad_norm": 1.0234375, "learning_rate": 0.00040785852475079017, "loss": 5.7464, "mean_token_accuracy": 0.19084911197423934, "num_tokens": 67436131.0, "step": 26605 }, { "entropy": 6.06038646697998, "epoch": 3.0709751875360647, "grad_norm": 0.87890625, "learning_rate": 0.0004078252200981709, "loss": 5.7182, "mean_token_accuracy": 0.19264955818653107, "num_tokens": 67449422.0, "step": 26610 }, { "entropy": 6.239610767364502, "epoch": 3.071552221581073, "grad_norm": 0.9296875, "learning_rate": 0.00040779191097804133, "loss": 5.725, "mean_token_accuracy": 0.1877145528793335, "num_tokens": 67461997.0, "step": 26615 }, { "entropy": 6.255790758132934, "epoch": 3.072129255626082, "grad_norm": 0.9296875, "learning_rate": 0.00040775859739152187, "loss": 5.8136, "mean_token_accuracy": 0.18494182229042053, "num_tokens": 67474758.0, "step": 26620 }, { "entropy": 6.040949821472168, "epoch": 3.0727062896710904, "grad_norm": 1.09375, "learning_rate": 0.0004077252793397329, "loss": 5.6302, "mean_token_accuracy": 0.19428464025259018, "num_tokens": 67487437.0, "step": 26625 }, { "entropy": 6.114373779296875, "epoch": 3.0732833237160992, "grad_norm": 1.015625, "learning_rate": 0.000407691956823795, "loss": 5.6769, "mean_token_accuracy": 0.19175334572792052, "num_tokens": 67500850.0, "step": 26630 }, { "entropy": 6.155919218063355, "epoch": 3.073860357761108, "grad_norm": 0.9296875, "learning_rate": 0.00040765862984482916, "loss": 5.6348, "mean_token_accuracy": 0.1979771926999092, "num_tokens": 67512303.0, "step": 26635 }, { "entropy": 6.176354455947876, "epoch": 3.0744373918061165, "grad_norm": 0.984375, "learning_rate": 0.0004076252984039561, "loss": 5.7717, "mean_token_accuracy": 0.1902720347046852, "num_tokens": 67524561.0, "step": 26640 }, { "entropy": 6.177938413619995, "epoch": 3.0750144258511254, "grad_norm": 0.90625, "learning_rate": 0.00040759196250229706, "loss": 5.745, "mean_token_accuracy": 0.184525465965271, "num_tokens": 67536859.0, "step": 26645 }, { "entropy": 6.1658063411712645, "epoch": 3.075591459896134, "grad_norm": 1.265625, "learning_rate": 0.00040755862214097326, "loss": 5.7477, "mean_token_accuracy": 0.18829769790172576, "num_tokens": 67549265.0, "step": 26650 }, { "entropy": 6.098076868057251, "epoch": 3.0761684939411427, "grad_norm": 0.8828125, "learning_rate": 0.000407525277321106, "loss": 5.6981, "mean_token_accuracy": 0.1875301256775856, "num_tokens": 67562630.0, "step": 26655 }, { "entropy": 6.229063844680786, "epoch": 3.076745527986151, "grad_norm": 1.078125, "learning_rate": 0.0004074919280438169, "loss": 5.7247, "mean_token_accuracy": 0.19259355068206788, "num_tokens": 67574358.0, "step": 26660 }, { "entropy": 6.207111883163452, "epoch": 3.07732256203116, "grad_norm": 1.0078125, "learning_rate": 0.00040745857431022755, "loss": 5.8207, "mean_token_accuracy": 0.1826626479625702, "num_tokens": 67587514.0, "step": 26665 }, { "entropy": 6.229054260253906, "epoch": 3.0778995960761684, "grad_norm": 0.921875, "learning_rate": 0.00040742521612145986, "loss": 5.8285, "mean_token_accuracy": 0.1867430552840233, "num_tokens": 67600406.0, "step": 26670 }, { "entropy": 6.113597679138183, "epoch": 3.0784766301211772, "grad_norm": 0.89453125, "learning_rate": 0.00040739185347863586, "loss": 5.6345, "mean_token_accuracy": 0.20075120478868486, "num_tokens": 67612988.0, "step": 26675 }, { "entropy": 6.109706878662109, "epoch": 3.0790536641661856, "grad_norm": 0.90625, "learning_rate": 0.0004073584863828776, "loss": 5.6924, "mean_token_accuracy": 0.19725033342838288, "num_tokens": 67625949.0, "step": 26680 }, { "entropy": 6.148903846740723, "epoch": 3.0796306982111945, "grad_norm": 0.9375, "learning_rate": 0.0004073251148353074, "loss": 5.6832, "mean_token_accuracy": 0.19956444352865219, "num_tokens": 67637971.0, "step": 26685 }, { "entropy": 6.128827619552612, "epoch": 3.080207732256203, "grad_norm": 0.94140625, "learning_rate": 0.0004072917388370477, "loss": 5.6621, "mean_token_accuracy": 0.19446104764938354, "num_tokens": 67650311.0, "step": 26690 }, { "entropy": 6.115025806427002, "epoch": 3.080784766301212, "grad_norm": 0.87890625, "learning_rate": 0.00040725835838922105, "loss": 5.7023, "mean_token_accuracy": 0.1935811772942543, "num_tokens": 67662812.0, "step": 26695 }, { "entropy": 6.1605547904968265, "epoch": 3.0813618003462206, "grad_norm": 0.93359375, "learning_rate": 0.0004072249734929502, "loss": 5.7693, "mean_token_accuracy": 0.18660773932933808, "num_tokens": 67674878.0, "step": 26700 }, { "entropy": 6.180890083312988, "epoch": 3.081938834391229, "grad_norm": 0.90625, "learning_rate": 0.00040719158414935806, "loss": 5.7122, "mean_token_accuracy": 0.19786154627799987, "num_tokens": 67687562.0, "step": 26705 }, { "entropy": 6.266283941268921, "epoch": 3.082515868436238, "grad_norm": 0.984375, "learning_rate": 0.0004071581903595677, "loss": 5.8158, "mean_token_accuracy": 0.18455517441034316, "num_tokens": 67699546.0, "step": 26710 }, { "entropy": 6.114570188522339, "epoch": 3.0830929024812463, "grad_norm": 1.171875, "learning_rate": 0.00040712479212470223, "loss": 5.5815, "mean_token_accuracy": 0.20124581307172776, "num_tokens": 67711247.0, "step": 26715 }, { "entropy": 6.066486644744873, "epoch": 3.083669936526255, "grad_norm": 0.9375, "learning_rate": 0.000407091389445885, "loss": 5.7208, "mean_token_accuracy": 0.18863172829151154, "num_tokens": 67724305.0, "step": 26720 }, { "entropy": 6.120010900497436, "epoch": 3.0842469705712636, "grad_norm": 1.2109375, "learning_rate": 0.0004070579823242395, "loss": 5.7166, "mean_token_accuracy": 0.19494422227144242, "num_tokens": 67737015.0, "step": 26725 }, { "entropy": 6.209732532501221, "epoch": 3.0848240046162725, "grad_norm": 0.98046875, "learning_rate": 0.00040702457076088937, "loss": 5.757, "mean_token_accuracy": 0.18922561258077622, "num_tokens": 67748883.0, "step": 26730 }, { "entropy": 6.1650079727172855, "epoch": 3.085401038661281, "grad_norm": 1.0390625, "learning_rate": 0.0004069911547569584, "loss": 5.6933, "mean_token_accuracy": 0.19975563883781433, "num_tokens": 67761278.0, "step": 26735 }, { "entropy": 6.141102981567383, "epoch": 3.0859780727062898, "grad_norm": 0.92578125, "learning_rate": 0.00040695773431357034, "loss": 5.7219, "mean_token_accuracy": 0.18901601433753967, "num_tokens": 67772823.0, "step": 26740 }, { "entropy": 6.14684796333313, "epoch": 3.086555106751298, "grad_norm": 0.9609375, "learning_rate": 0.0004069243094318496, "loss": 5.7379, "mean_token_accuracy": 0.19299978613853455, "num_tokens": 67786490.0, "step": 26745 }, { "entropy": 6.150284290313721, "epoch": 3.087132140796307, "grad_norm": 0.91796875, "learning_rate": 0.00040689088011292024, "loss": 5.6758, "mean_token_accuracy": 0.19601108133792877, "num_tokens": 67799123.0, "step": 26750 }, { "entropy": 6.112508058547974, "epoch": 3.0877091748413155, "grad_norm": 1.15625, "learning_rate": 0.0004068574463579066, "loss": 5.6202, "mean_token_accuracy": 0.192739400267601, "num_tokens": 67811860.0, "step": 26755 }, { "entropy": 6.093053340911865, "epoch": 3.0882862088863243, "grad_norm": 0.94921875, "learning_rate": 0.00040682400816793326, "loss": 5.7346, "mean_token_accuracy": 0.1894342765212059, "num_tokens": 67824251.0, "step": 26760 }, { "entropy": 6.243050622940063, "epoch": 3.0888632429313327, "grad_norm": 0.94140625, "learning_rate": 0.00040679056554412485, "loss": 5.8139, "mean_token_accuracy": 0.18186367750167848, "num_tokens": 67837316.0, "step": 26765 }, { "entropy": 6.272124624252319, "epoch": 3.0894402769763416, "grad_norm": 1.0234375, "learning_rate": 0.0004067571184876063, "loss": 5.8028, "mean_token_accuracy": 0.19087813049554825, "num_tokens": 67850257.0, "step": 26770 }, { "entropy": 6.171517467498779, "epoch": 3.0900173110213505, "grad_norm": 1.0234375, "learning_rate": 0.00040672366699950245, "loss": 5.74, "mean_token_accuracy": 0.19003414660692214, "num_tokens": 67862715.0, "step": 26775 }, { "entropy": 6.210683107376099, "epoch": 3.090594345066359, "grad_norm": 0.96484375, "learning_rate": 0.00040669021108093856, "loss": 5.7095, "mean_token_accuracy": 0.19171876460313797, "num_tokens": 67875282.0, "step": 26780 }, { "entropy": 6.120309114456177, "epoch": 3.0911713791113677, "grad_norm": 0.9453125, "learning_rate": 0.0004066567507330398, "loss": 5.6681, "mean_token_accuracy": 0.1940741464495659, "num_tokens": 67886797.0, "step": 26785 }, { "entropy": 6.016139268875122, "epoch": 3.091748413156376, "grad_norm": 0.91796875, "learning_rate": 0.0004066232859569316, "loss": 5.6429, "mean_token_accuracy": 0.19710179567337036, "num_tokens": 67899581.0, "step": 26790 }, { "entropy": 6.109029245376587, "epoch": 3.092325447201385, "grad_norm": 0.9453125, "learning_rate": 0.0004065898167537396, "loss": 5.6831, "mean_token_accuracy": 0.19441143572330474, "num_tokens": 67911640.0, "step": 26795 }, { "entropy": 6.17063159942627, "epoch": 3.0929024812463934, "grad_norm": 0.93359375, "learning_rate": 0.0004065563431245895, "loss": 5.7205, "mean_token_accuracy": 0.1947186291217804, "num_tokens": 67925094.0, "step": 26800 }, { "entropy": 6.08087797164917, "epoch": 3.0934795152914023, "grad_norm": 1.21875, "learning_rate": 0.0004065228650706071, "loss": 5.67, "mean_token_accuracy": 0.19813878685235978, "num_tokens": 67937774.0, "step": 26805 }, { "entropy": 6.165895557403564, "epoch": 3.0940565493364107, "grad_norm": 0.93359375, "learning_rate": 0.00040648938259291845, "loss": 5.6739, "mean_token_accuracy": 0.19740253537893296, "num_tokens": 67950240.0, "step": 26810 }, { "entropy": 6.167765760421753, "epoch": 3.0946335833814196, "grad_norm": 0.91796875, "learning_rate": 0.0004064558956926497, "loss": 5.6649, "mean_token_accuracy": 0.1949150264263153, "num_tokens": 67963503.0, "step": 26815 }, { "entropy": 6.140791893005371, "epoch": 3.095210617426428, "grad_norm": 0.94140625, "learning_rate": 0.0004064224043709273, "loss": 5.7213, "mean_token_accuracy": 0.19097324460744858, "num_tokens": 67974610.0, "step": 26820 }, { "entropy": 6.094710206985473, "epoch": 3.095787651471437, "grad_norm": 0.98046875, "learning_rate": 0.0004063889086288776, "loss": 5.6301, "mean_token_accuracy": 0.20011126697063447, "num_tokens": 67988172.0, "step": 26825 }, { "entropy": 6.116142749786377, "epoch": 3.0963646855164453, "grad_norm": 0.88671875, "learning_rate": 0.00040635540846762713, "loss": 5.6781, "mean_token_accuracy": 0.19725194722414016, "num_tokens": 68001489.0, "step": 26830 }, { "entropy": 6.146768426895141, "epoch": 3.096941719561454, "grad_norm": 1.015625, "learning_rate": 0.0004063219038883028, "loss": 5.7275, "mean_token_accuracy": 0.19413065761327744, "num_tokens": 68014291.0, "step": 26835 }, { "entropy": 6.159466171264649, "epoch": 3.0975187536064626, "grad_norm": 0.87109375, "learning_rate": 0.00040628839489203144, "loss": 5.7027, "mean_token_accuracy": 0.18735834062099457, "num_tokens": 68026735.0, "step": 26840 }, { "entropy": 6.221561431884766, "epoch": 3.0980957876514714, "grad_norm": 1.015625, "learning_rate": 0.00040625488147994025, "loss": 5.8162, "mean_token_accuracy": 0.18988598585128785, "num_tokens": 68039943.0, "step": 26845 }, { "entropy": 6.087126350402832, "epoch": 3.0986728216964803, "grad_norm": 1.015625, "learning_rate": 0.00040622136365315616, "loss": 5.6801, "mean_token_accuracy": 0.1903586581349373, "num_tokens": 68053358.0, "step": 26850 }, { "entropy": 6.160599279403686, "epoch": 3.0992498557414887, "grad_norm": 1.0625, "learning_rate": 0.00040618784141280674, "loss": 5.6497, "mean_token_accuracy": 0.19572605639696122, "num_tokens": 68066002.0, "step": 26855 }, { "entropy": 6.123009252548218, "epoch": 3.0998268897864976, "grad_norm": 0.95703125, "learning_rate": 0.00040615431476001947, "loss": 5.646, "mean_token_accuracy": 0.20059366375207902, "num_tokens": 68079221.0, "step": 26860 }, { "entropy": 6.174410152435303, "epoch": 3.100403923831506, "grad_norm": 1.1484375, "learning_rate": 0.0004061207836959219, "loss": 5.7259, "mean_token_accuracy": 0.18995708227157593, "num_tokens": 68091388.0, "step": 26865 }, { "entropy": 6.194659042358398, "epoch": 3.100980957876515, "grad_norm": 0.984375, "learning_rate": 0.00040608724822164193, "loss": 5.7886, "mean_token_accuracy": 0.18564740121364592, "num_tokens": 68104016.0, "step": 26870 }, { "entropy": 6.177530670166016, "epoch": 3.1015579919215233, "grad_norm": 0.93359375, "learning_rate": 0.0004060537083383076, "loss": 5.6287, "mean_token_accuracy": 0.2020028918981552, "num_tokens": 68117762.0, "step": 26875 }, { "entropy": 6.115578079223633, "epoch": 3.102135025966532, "grad_norm": 0.93359375, "learning_rate": 0.00040602016404704666, "loss": 5.6791, "mean_token_accuracy": 0.20041325688362122, "num_tokens": 68129913.0, "step": 26880 }, { "entropy": 6.1328596591949465, "epoch": 3.1027120600115405, "grad_norm": 0.953125, "learning_rate": 0.0004059866153489878, "loss": 5.735, "mean_token_accuracy": 0.19435964077711104, "num_tokens": 68142582.0, "step": 26885 }, { "entropy": 6.231853914260864, "epoch": 3.1032890940565494, "grad_norm": 1.0234375, "learning_rate": 0.00040595306224525904, "loss": 5.7308, "mean_token_accuracy": 0.19070784151554107, "num_tokens": 68156233.0, "step": 26890 }, { "entropy": 6.166604375839233, "epoch": 3.103866128101558, "grad_norm": 0.95703125, "learning_rate": 0.0004059195047369892, "loss": 5.6914, "mean_token_accuracy": 0.19259731322526932, "num_tokens": 68168672.0, "step": 26895 }, { "entropy": 6.145269966125488, "epoch": 3.1044431621465667, "grad_norm": 0.8984375, "learning_rate": 0.0004058859428253068, "loss": 5.7659, "mean_token_accuracy": 0.18957958817481996, "num_tokens": 68180934.0, "step": 26900 }, { "entropy": 6.152492523193359, "epoch": 3.105020196191575, "grad_norm": 1.703125, "learning_rate": 0.0004058523765113407, "loss": 5.7027, "mean_token_accuracy": 0.19278210401535034, "num_tokens": 68193788.0, "step": 26905 }, { "entropy": 6.1945576667785645, "epoch": 3.105597230236584, "grad_norm": 0.9375, "learning_rate": 0.00040581880579621996, "loss": 5.6802, "mean_token_accuracy": 0.19895323365926743, "num_tokens": 68204908.0, "step": 26910 }, { "entropy": 6.161127614974975, "epoch": 3.106174264281593, "grad_norm": 0.890625, "learning_rate": 0.00040578523068107367, "loss": 5.6974, "mean_token_accuracy": 0.1886743575334549, "num_tokens": 68217956.0, "step": 26915 }, { "entropy": 6.114270782470703, "epoch": 3.1067512983266012, "grad_norm": 1.0078125, "learning_rate": 0.00040575165116703103, "loss": 5.6303, "mean_token_accuracy": 0.199447900056839, "num_tokens": 68229755.0, "step": 26920 }, { "entropy": 6.205735492706299, "epoch": 3.10732833237161, "grad_norm": 0.9375, "learning_rate": 0.00040571806725522164, "loss": 5.7513, "mean_token_accuracy": 0.1872178941965103, "num_tokens": 68242620.0, "step": 26925 }, { "entropy": 6.036647510528565, "epoch": 3.1079053664166185, "grad_norm": 1.03125, "learning_rate": 0.00040568447894677494, "loss": 5.6305, "mean_token_accuracy": 0.1973928615450859, "num_tokens": 68256045.0, "step": 26930 }, { "entropy": 6.119180202484131, "epoch": 3.1084824004616274, "grad_norm": 1.015625, "learning_rate": 0.00040565088624282074, "loss": 5.6344, "mean_token_accuracy": 0.2013043314218521, "num_tokens": 68269378.0, "step": 26935 }, { "entropy": 6.179052352905273, "epoch": 3.109059434506636, "grad_norm": 1.0078125, "learning_rate": 0.0004056172891444889, "loss": 5.6994, "mean_token_accuracy": 0.1950487896800041, "num_tokens": 68281575.0, "step": 26940 }, { "entropy": 6.142611742019653, "epoch": 3.1096364685516447, "grad_norm": 0.921875, "learning_rate": 0.00040558368765290933, "loss": 5.6492, "mean_token_accuracy": 0.198221755027771, "num_tokens": 68293690.0, "step": 26945 }, { "entropy": 6.178358268737793, "epoch": 3.110213502596653, "grad_norm": 0.9921875, "learning_rate": 0.00040555008176921235, "loss": 5.7682, "mean_token_accuracy": 0.18755603730678558, "num_tokens": 68305200.0, "step": 26950 }, { "entropy": 6.1204619884490965, "epoch": 3.110790536641662, "grad_norm": 0.91796875, "learning_rate": 0.0004055164714945282, "loss": 5.6574, "mean_token_accuracy": 0.19494971483945847, "num_tokens": 68317259.0, "step": 26955 }, { "entropy": 6.102750539779663, "epoch": 3.1113675706866704, "grad_norm": 0.91015625, "learning_rate": 0.00040548285682998736, "loss": 5.6853, "mean_token_accuracy": 0.19803863018751144, "num_tokens": 68330101.0, "step": 26960 }, { "entropy": 6.143659782409668, "epoch": 3.111944604731679, "grad_norm": 0.94140625, "learning_rate": 0.00040544923777672046, "loss": 5.7166, "mean_token_accuracy": 0.19461364597082137, "num_tokens": 68342438.0, "step": 26965 }, { "entropy": 6.080714988708496, "epoch": 3.1125216387766876, "grad_norm": 1.0390625, "learning_rate": 0.0004054156143358583, "loss": 5.648, "mean_token_accuracy": 0.20194706022739412, "num_tokens": 68355202.0, "step": 26970 }, { "entropy": 6.112496852874756, "epoch": 3.1130986728216965, "grad_norm": 0.99609375, "learning_rate": 0.00040538198650853156, "loss": 5.6267, "mean_token_accuracy": 0.19803008437156677, "num_tokens": 68366586.0, "step": 26975 }, { "entropy": 6.1533894538879395, "epoch": 3.1136757068667054, "grad_norm": 0.98046875, "learning_rate": 0.0004053483542958717, "loss": 5.7281, "mean_token_accuracy": 0.1937193751335144, "num_tokens": 68381132.0, "step": 26980 }, { "entropy": 6.163727331161499, "epoch": 3.114252740911714, "grad_norm": 1.0, "learning_rate": 0.00040531471769900953, "loss": 5.7361, "mean_token_accuracy": 0.1895759552717209, "num_tokens": 68392691.0, "step": 26985 }, { "entropy": 6.153784561157226, "epoch": 3.1148297749567226, "grad_norm": 0.96875, "learning_rate": 0.0004052810767190766, "loss": 5.6966, "mean_token_accuracy": 0.19710321426391603, "num_tokens": 68405499.0, "step": 26990 }, { "entropy": 6.139175462722778, "epoch": 3.115406809001731, "grad_norm": 1.03125, "learning_rate": 0.00040524743135720437, "loss": 5.7602, "mean_token_accuracy": 0.19449110925197602, "num_tokens": 68418485.0, "step": 26995 }, { "entropy": 6.17497501373291, "epoch": 3.11598384304674, "grad_norm": 0.9140625, "learning_rate": 0.0004052137816145245, "loss": 5.7286, "mean_token_accuracy": 0.19408611953258514, "num_tokens": 68432409.0, "step": 27000 }, { "epoch": 3.11598384304674, "eval_entropy": 5.987836458007144, "eval_loss": 5.857382297515869, "eval_mean_token_accuracy": 0.19283583052911846, "eval_num_tokens": 68432409.0, "eval_runtime": 22.748, "eval_samples_per_second": 1236.856, "eval_steps_per_second": 154.607, "step": 27000 }, { "entropy": 6.116707515716553, "epoch": 3.1165608770917483, "grad_norm": 0.91796875, "learning_rate": 0.0004051801274921688, "loss": 5.6403, "mean_token_accuracy": 0.19760415703058243, "num_tokens": 68444516.0, "step": 27005 }, { "entropy": 6.186652040481567, "epoch": 3.117137911136757, "grad_norm": 0.9765625, "learning_rate": 0.00040514646899126905, "loss": 5.7633, "mean_token_accuracy": 0.1909859895706177, "num_tokens": 68458326.0, "step": 27010 }, { "entropy": 6.194436073303223, "epoch": 3.1177149451817656, "grad_norm": 0.953125, "learning_rate": 0.0004051128061129576, "loss": 5.6982, "mean_token_accuracy": 0.18686971813440323, "num_tokens": 68472500.0, "step": 27015 }, { "entropy": 6.152800178527832, "epoch": 3.1182919792267745, "grad_norm": 0.94921875, "learning_rate": 0.00040507913885836646, "loss": 5.7544, "mean_token_accuracy": 0.19872835725545884, "num_tokens": 68485280.0, "step": 27020 }, { "entropy": 6.150189208984375, "epoch": 3.118869013271783, "grad_norm": 1.125, "learning_rate": 0.0004050454672286281, "loss": 5.6948, "mean_token_accuracy": 0.1894780769944191, "num_tokens": 68497792.0, "step": 27025 }, { "entropy": 6.073841762542725, "epoch": 3.1194460473167918, "grad_norm": 0.9140625, "learning_rate": 0.0004050117912248751, "loss": 5.6322, "mean_token_accuracy": 0.20315015465021133, "num_tokens": 68510444.0, "step": 27030 }, { "entropy": 6.088042211532593, "epoch": 3.1200230813618, "grad_norm": 0.9609375, "learning_rate": 0.00040497811084824005, "loss": 5.6425, "mean_token_accuracy": 0.19691527187824248, "num_tokens": 68522414.0, "step": 27035 }, { "entropy": 6.1867858409881595, "epoch": 3.120600115406809, "grad_norm": 1.015625, "learning_rate": 0.0004049444260998558, "loss": 5.6901, "mean_token_accuracy": 0.19433800131082535, "num_tokens": 68534389.0, "step": 27040 }, { "entropy": 6.076087093353271, "epoch": 3.1211771494518175, "grad_norm": 0.9453125, "learning_rate": 0.0004049107369808553, "loss": 5.6633, "mean_token_accuracy": 0.19283735305070876, "num_tokens": 68545881.0, "step": 27045 }, { "entropy": 6.231611680984497, "epoch": 3.1217541834968263, "grad_norm": 1.0078125, "learning_rate": 0.00040487704349237175, "loss": 5.723, "mean_token_accuracy": 0.19022363275289536, "num_tokens": 68558758.0, "step": 27050 }, { "entropy": 6.139404582977295, "epoch": 3.122331217541835, "grad_norm": 0.94921875, "learning_rate": 0.00040484334563553836, "loss": 5.6617, "mean_token_accuracy": 0.20138685256242753, "num_tokens": 68570551.0, "step": 27055 }, { "entropy": 6.113898754119873, "epoch": 3.1229082515868436, "grad_norm": 0.84765625, "learning_rate": 0.0004048096434114885, "loss": 5.7726, "mean_token_accuracy": 0.18614590167999268, "num_tokens": 68583012.0, "step": 27060 }, { "entropy": 6.098631095886231, "epoch": 3.1234852856318525, "grad_norm": 0.8984375, "learning_rate": 0.00040477593682135575, "loss": 5.6838, "mean_token_accuracy": 0.19528522193431855, "num_tokens": 68594235.0, "step": 27065 }, { "entropy": 6.15474214553833, "epoch": 3.124062319676861, "grad_norm": 0.94921875, "learning_rate": 0.0004047422258662739, "loss": 5.7062, "mean_token_accuracy": 0.1918144553899765, "num_tokens": 68605978.0, "step": 27070 }, { "entropy": 6.1452208995819095, "epoch": 3.1246393537218697, "grad_norm": 0.87109375, "learning_rate": 0.00040470851054737666, "loss": 5.7057, "mean_token_accuracy": 0.19720974415540696, "num_tokens": 68619385.0, "step": 27075 }, { "entropy": 6.080608129501343, "epoch": 3.125216387766878, "grad_norm": 0.98828125, "learning_rate": 0.0004046747908657982, "loss": 5.656, "mean_token_accuracy": 0.19955915808677674, "num_tokens": 68631986.0, "step": 27080 }, { "entropy": 6.151964426040649, "epoch": 3.125793421811887, "grad_norm": 0.9921875, "learning_rate": 0.00040464106682267236, "loss": 5.6859, "mean_token_accuracy": 0.19174427539110184, "num_tokens": 68644262.0, "step": 27085 }, { "entropy": 6.129231882095337, "epoch": 3.1263704558568954, "grad_norm": 0.921875, "learning_rate": 0.0004046073384191338, "loss": 5.7095, "mean_token_accuracy": 0.1935574308037758, "num_tokens": 68656941.0, "step": 27090 }, { "entropy": 6.157695579528808, "epoch": 3.1269474899019043, "grad_norm": 0.92578125, "learning_rate": 0.00040457360565631674, "loss": 5.7965, "mean_token_accuracy": 0.18418788611888887, "num_tokens": 68669231.0, "step": 27095 }, { "entropy": 6.1517857074737545, "epoch": 3.1275245239469127, "grad_norm": 0.97265625, "learning_rate": 0.00040453986853535587, "loss": 5.6884, "mean_token_accuracy": 0.19333977550268172, "num_tokens": 68681882.0, "step": 27100 }, { "entropy": 6.1447900295257565, "epoch": 3.1281015579919216, "grad_norm": 0.94140625, "learning_rate": 0.0004045061270573858, "loss": 5.5659, "mean_token_accuracy": 0.2177928566932678, "num_tokens": 68693970.0, "step": 27105 }, { "entropy": 6.028097820281983, "epoch": 3.12867859203693, "grad_norm": 0.9453125, "learning_rate": 0.00040447238122354146, "loss": 5.6438, "mean_token_accuracy": 0.195227912068367, "num_tokens": 68706367.0, "step": 27110 }, { "entropy": 6.2195396900177, "epoch": 3.129255626081939, "grad_norm": 0.94921875, "learning_rate": 0.0004044386310349579, "loss": 5.8069, "mean_token_accuracy": 0.18571565449237823, "num_tokens": 68718644.0, "step": 27115 }, { "entropy": 6.126541423797607, "epoch": 3.1298326601269473, "grad_norm": 0.91796875, "learning_rate": 0.00040440487649277037, "loss": 5.633, "mean_token_accuracy": 0.1973568856716156, "num_tokens": 68730545.0, "step": 27120 }, { "entropy": 6.160487508773803, "epoch": 3.130409694171956, "grad_norm": 0.93359375, "learning_rate": 0.00040437111759811397, "loss": 5.7312, "mean_token_accuracy": 0.19705376625061036, "num_tokens": 68743093.0, "step": 27125 }, { "entropy": 6.126802062988281, "epoch": 3.130986728216965, "grad_norm": 0.94140625, "learning_rate": 0.00040433735435212436, "loss": 5.7251, "mean_token_accuracy": 0.19497810304164886, "num_tokens": 68756437.0, "step": 27130 }, { "entropy": 6.08596363067627, "epoch": 3.1315637622619734, "grad_norm": 0.98828125, "learning_rate": 0.0004043035867559371, "loss": 5.6938, "mean_token_accuracy": 0.1972505435347557, "num_tokens": 68769380.0, "step": 27135 }, { "entropy": 6.177377033233642, "epoch": 3.1321407963069823, "grad_norm": 0.98046875, "learning_rate": 0.00040426981481068785, "loss": 5.6979, "mean_token_accuracy": 0.19830397069454192, "num_tokens": 68782390.0, "step": 27140 }, { "entropy": 6.099611759185791, "epoch": 3.1327178303519907, "grad_norm": 1.140625, "learning_rate": 0.00040423603851751273, "loss": 5.5893, "mean_token_accuracy": 0.2013296142220497, "num_tokens": 68793931.0, "step": 27145 }, { "entropy": 6.077713203430176, "epoch": 3.1332948643969996, "grad_norm": 1.0078125, "learning_rate": 0.00040420225787754754, "loss": 5.7283, "mean_token_accuracy": 0.19569722414016724, "num_tokens": 68806020.0, "step": 27150 }, { "entropy": 6.1687322616577145, "epoch": 3.133871898442008, "grad_norm": 1.1015625, "learning_rate": 0.0004041684728919286, "loss": 5.7726, "mean_token_accuracy": 0.1871213957667351, "num_tokens": 68818616.0, "step": 27155 }, { "entropy": 6.177014255523682, "epoch": 3.134448932487017, "grad_norm": 0.96484375, "learning_rate": 0.00040413468356179224, "loss": 5.7204, "mean_token_accuracy": 0.19158955216407775, "num_tokens": 68831549.0, "step": 27160 }, { "entropy": 6.20126633644104, "epoch": 3.1350259665320253, "grad_norm": 0.94921875, "learning_rate": 0.000404100889888275, "loss": 5.6866, "mean_token_accuracy": 0.19375785291194916, "num_tokens": 68842551.0, "step": 27165 }, { "entropy": 6.147972631454468, "epoch": 3.135603000577034, "grad_norm": 0.89453125, "learning_rate": 0.0004040670918725133, "loss": 5.7273, "mean_token_accuracy": 0.19284260720014573, "num_tokens": 68855525.0, "step": 27170 }, { "entropy": 6.108228158950806, "epoch": 3.1361800346220425, "grad_norm": 0.8671875, "learning_rate": 0.0004040332895156443, "loss": 5.7106, "mean_token_accuracy": 0.19711076021194457, "num_tokens": 68869570.0, "step": 27175 }, { "entropy": 6.18882303237915, "epoch": 3.1367570686670514, "grad_norm": 1.25, "learning_rate": 0.0004039994828188045, "loss": 5.7008, "mean_token_accuracy": 0.19134557098150254, "num_tokens": 68881392.0, "step": 27180 }, { "entropy": 6.0376002311706545, "epoch": 3.13733410271206, "grad_norm": 0.90234375, "learning_rate": 0.00040396567178313124, "loss": 5.6718, "mean_token_accuracy": 0.195427830517292, "num_tokens": 68894107.0, "step": 27185 }, { "entropy": 6.24177303314209, "epoch": 3.1379111367570687, "grad_norm": 0.9375, "learning_rate": 0.00040393185640976174, "loss": 5.7615, "mean_token_accuracy": 0.19118544459342957, "num_tokens": 68905734.0, "step": 27190 }, { "entropy": 6.232033109664917, "epoch": 3.138488170802077, "grad_norm": 0.9375, "learning_rate": 0.0004038980366998332, "loss": 5.7701, "mean_token_accuracy": 0.187275230884552, "num_tokens": 68918996.0, "step": 27195 }, { "entropy": 6.056928873062134, "epoch": 3.139065204847086, "grad_norm": 0.87109375, "learning_rate": 0.0004038642126544833, "loss": 5.6535, "mean_token_accuracy": 0.20074088275432586, "num_tokens": 68931381.0, "step": 27200 }, { "entropy": 6.149992561340332, "epoch": 3.139642238892095, "grad_norm": 0.92578125, "learning_rate": 0.0004038303842748496, "loss": 5.7509, "mean_token_accuracy": 0.1898006409406662, "num_tokens": 68943615.0, "step": 27205 }, { "entropy": 6.124445962905884, "epoch": 3.1402192729371032, "grad_norm": 1.0078125, "learning_rate": 0.00040379655156206983, "loss": 5.6156, "mean_token_accuracy": 0.19554246962070465, "num_tokens": 68955115.0, "step": 27210 }, { "entropy": 6.05906662940979, "epoch": 3.140796306982112, "grad_norm": 0.9453125, "learning_rate": 0.0004037627145172822, "loss": 5.6075, "mean_token_accuracy": 0.20224371403455735, "num_tokens": 68968042.0, "step": 27215 }, { "entropy": 6.12451171875, "epoch": 3.1413733410271205, "grad_norm": 1.0390625, "learning_rate": 0.0004037288731416245, "loss": 5.6571, "mean_token_accuracy": 0.2077217683196068, "num_tokens": 68982178.0, "step": 27220 }, { "entropy": 6.094468832015991, "epoch": 3.1419503750721294, "grad_norm": 0.9609375, "learning_rate": 0.0004036950274362351, "loss": 5.7369, "mean_token_accuracy": 0.18722873628139497, "num_tokens": 68994546.0, "step": 27225 }, { "entropy": 6.16364541053772, "epoch": 3.142527409117138, "grad_norm": 0.9921875, "learning_rate": 0.0004036611774022524, "loss": 5.6819, "mean_token_accuracy": 0.19240596890449524, "num_tokens": 69007134.0, "step": 27230 }, { "entropy": 6.1228940963745115, "epoch": 3.1431044431621467, "grad_norm": 0.9609375, "learning_rate": 0.0004036273230408149, "loss": 5.6921, "mean_token_accuracy": 0.196954445540905, "num_tokens": 69019668.0, "step": 27235 }, { "entropy": 6.17612509727478, "epoch": 3.143681477207155, "grad_norm": 0.98828125, "learning_rate": 0.0004035934643530613, "loss": 5.7308, "mean_token_accuracy": 0.19115004688501358, "num_tokens": 69032127.0, "step": 27240 }, { "entropy": 6.162550163269043, "epoch": 3.144258511252164, "grad_norm": 0.94140625, "learning_rate": 0.00040355960134013036, "loss": 5.7307, "mean_token_accuracy": 0.1894148588180542, "num_tokens": 69044926.0, "step": 27245 }, { "entropy": 6.131181478500366, "epoch": 3.1448355452971724, "grad_norm": 0.94140625, "learning_rate": 0.0004035257340031611, "loss": 5.644, "mean_token_accuracy": 0.19221512973308563, "num_tokens": 69056326.0, "step": 27250 }, { "entropy": 6.168639469146728, "epoch": 3.145412579342181, "grad_norm": 0.94140625, "learning_rate": 0.0004034918623432926, "loss": 5.7516, "mean_token_accuracy": 0.1910143032670021, "num_tokens": 69069696.0, "step": 27255 }, { "entropy": 6.16878457069397, "epoch": 3.14598961338719, "grad_norm": 0.92578125, "learning_rate": 0.00040345798636166424, "loss": 5.7069, "mean_token_accuracy": 0.19244280010461806, "num_tokens": 69082517.0, "step": 27260 }, { "entropy": 6.08049168586731, "epoch": 3.1465666474321985, "grad_norm": 0.92578125, "learning_rate": 0.00040342410605941526, "loss": 5.6425, "mean_token_accuracy": 0.19867913275957108, "num_tokens": 69095774.0, "step": 27265 }, { "entropy": 6.1829994201660154, "epoch": 3.1471436814772074, "grad_norm": 0.9765625, "learning_rate": 0.00040339022143768524, "loss": 5.6909, "mean_token_accuracy": 0.1935090869665146, "num_tokens": 69109575.0, "step": 27270 }, { "entropy": 6.073039579391479, "epoch": 3.1477207155222158, "grad_norm": 0.8515625, "learning_rate": 0.00040335633249761387, "loss": 5.6837, "mean_token_accuracy": 0.19323285520076752, "num_tokens": 69123365.0, "step": 27275 }, { "entropy": 6.162595129013061, "epoch": 3.1482977495672246, "grad_norm": 0.875, "learning_rate": 0.00040332243924034105, "loss": 5.7336, "mean_token_accuracy": 0.1946937620639801, "num_tokens": 69136187.0, "step": 27280 }, { "entropy": 6.097646045684814, "epoch": 3.148874783612233, "grad_norm": 0.94140625, "learning_rate": 0.0004032885416670068, "loss": 5.6746, "mean_token_accuracy": 0.20315638929605484, "num_tokens": 69150271.0, "step": 27285 }, { "entropy": 6.142451047897339, "epoch": 3.149451817657242, "grad_norm": 0.99609375, "learning_rate": 0.0004032546397787511, "loss": 5.7284, "mean_token_accuracy": 0.19465454667806625, "num_tokens": 69161906.0, "step": 27290 }, { "entropy": 6.171128273010254, "epoch": 3.1500288517022503, "grad_norm": 1.0625, "learning_rate": 0.0004032207335767142, "loss": 5.6652, "mean_token_accuracy": 0.19658414870500565, "num_tokens": 69174367.0, "step": 27295 }, { "entropy": 6.101913928985596, "epoch": 3.150605885747259, "grad_norm": 0.95703125, "learning_rate": 0.0004031868230620368, "loss": 5.7316, "mean_token_accuracy": 0.19344296157360077, "num_tokens": 69186970.0, "step": 27300 }, { "entropy": 6.155976343154907, "epoch": 3.1511829197922676, "grad_norm": 0.9140625, "learning_rate": 0.0004031529082358592, "loss": 5.7205, "mean_token_accuracy": 0.19540518820285796, "num_tokens": 69199347.0, "step": 27305 }, { "entropy": 6.0524097919464115, "epoch": 3.1517599538372765, "grad_norm": 0.85546875, "learning_rate": 0.0004031189890993222, "loss": 5.6576, "mean_token_accuracy": 0.19292837083339692, "num_tokens": 69211710.0, "step": 27310 }, { "entropy": 6.11064658164978, "epoch": 3.152336987882285, "grad_norm": 1.0234375, "learning_rate": 0.00040308506565356664, "loss": 5.6851, "mean_token_accuracy": 0.19722912907600404, "num_tokens": 69224153.0, "step": 27315 }, { "entropy": 6.184148359298706, "epoch": 3.1529140219272938, "grad_norm": 0.94921875, "learning_rate": 0.00040305113789973354, "loss": 5.719, "mean_token_accuracy": 0.18931434750556947, "num_tokens": 69236046.0, "step": 27320 }, { "entropy": 6.10137906074524, "epoch": 3.153491055972302, "grad_norm": 0.9375, "learning_rate": 0.0004030172058389639, "loss": 5.661, "mean_token_accuracy": 0.1945364996790886, "num_tokens": 69247997.0, "step": 27325 }, { "entropy": 6.120266151428223, "epoch": 3.154068090017311, "grad_norm": 0.984375, "learning_rate": 0.00040298326947239935, "loss": 5.673, "mean_token_accuracy": 0.2005025789141655, "num_tokens": 69261189.0, "step": 27330 }, { "entropy": 6.12740535736084, "epoch": 3.15464512406232, "grad_norm": 0.96875, "learning_rate": 0.0004029493288011809, "loss": 5.7153, "mean_token_accuracy": 0.19623589366674424, "num_tokens": 69274039.0, "step": 27335 }, { "entropy": 6.009217548370361, "epoch": 3.1552221581073283, "grad_norm": 0.984375, "learning_rate": 0.0004029153838264504, "loss": 5.6667, "mean_token_accuracy": 0.2013350784778595, "num_tokens": 69286759.0, "step": 27340 }, { "entropy": 6.131100177764893, "epoch": 3.155799192152337, "grad_norm": 1.109375, "learning_rate": 0.0004028814345493496, "loss": 5.6996, "mean_token_accuracy": 0.19019987136125566, "num_tokens": 69299619.0, "step": 27345 }, { "entropy": 6.076996326446533, "epoch": 3.1563762261973456, "grad_norm": 1.1796875, "learning_rate": 0.00040284748097102013, "loss": 5.5706, "mean_token_accuracy": 0.2010394126176834, "num_tokens": 69311593.0, "step": 27350 }, { "entropy": 6.149994850158691, "epoch": 3.1569532602423545, "grad_norm": 0.984375, "learning_rate": 0.00040281352309260414, "loss": 5.7157, "mean_token_accuracy": 0.1869497463107109, "num_tokens": 69324686.0, "step": 27355 }, { "entropy": 6.121657848358154, "epoch": 3.157530294287363, "grad_norm": 1.0390625, "learning_rate": 0.0004027795609152439, "loss": 5.6574, "mean_token_accuracy": 0.19951744228601456, "num_tokens": 69337042.0, "step": 27360 }, { "entropy": 6.031878662109375, "epoch": 3.1581073283323717, "grad_norm": 0.8984375, "learning_rate": 0.0004027455944400815, "loss": 5.5803, "mean_token_accuracy": 0.2017280265688896, "num_tokens": 69350244.0, "step": 27365 }, { "entropy": 6.1586519241333, "epoch": 3.15868436237738, "grad_norm": 0.94921875, "learning_rate": 0.0004027116236682596, "loss": 5.7628, "mean_token_accuracy": 0.18867990821599961, "num_tokens": 69362813.0, "step": 27370 }, { "entropy": 6.249085521697998, "epoch": 3.159261396422389, "grad_norm": 0.96875, "learning_rate": 0.0004026776486009206, "loss": 5.7815, "mean_token_accuracy": 0.1933159902691841, "num_tokens": 69375397.0, "step": 27375 }, { "entropy": 6.158890342712402, "epoch": 3.1598384304673974, "grad_norm": 0.83984375, "learning_rate": 0.00040264366923920735, "loss": 5.7501, "mean_token_accuracy": 0.18520111739635467, "num_tokens": 69388107.0, "step": 27380 }, { "entropy": 6.107667922973633, "epoch": 3.1604154645124063, "grad_norm": 0.93359375, "learning_rate": 0.00040260968558426265, "loss": 5.7069, "mean_token_accuracy": 0.19940268993377686, "num_tokens": 69401894.0, "step": 27385 }, { "entropy": 6.1452759265899655, "epoch": 3.1609924985574147, "grad_norm": 0.97265625, "learning_rate": 0.0004025756976372296, "loss": 5.6449, "mean_token_accuracy": 0.20127691626548766, "num_tokens": 69414581.0, "step": 27390 }, { "entropy": 6.146435308456421, "epoch": 3.1615695326024236, "grad_norm": 0.984375, "learning_rate": 0.0004025417053992513, "loss": 5.6883, "mean_token_accuracy": 0.1978426143527031, "num_tokens": 69428943.0, "step": 27395 }, { "entropy": 6.183188009262085, "epoch": 3.162146566647432, "grad_norm": 1.0078125, "learning_rate": 0.0004025077088714711, "loss": 5.7551, "mean_token_accuracy": 0.1931930214166641, "num_tokens": 69442670.0, "step": 27400 }, { "entropy": 6.147484397888183, "epoch": 3.162723600692441, "grad_norm": 1.0, "learning_rate": 0.0004024737080550324, "loss": 5.6901, "mean_token_accuracy": 0.19142468571662902, "num_tokens": 69454784.0, "step": 27405 }, { "entropy": 6.062293624877929, "epoch": 3.1633006347374497, "grad_norm": 1.0078125, "learning_rate": 0.0004024397029510789, "loss": 5.6586, "mean_token_accuracy": 0.20212570428848267, "num_tokens": 69467683.0, "step": 27410 }, { "entropy": 6.136881971359253, "epoch": 3.163877668782458, "grad_norm": 1.1171875, "learning_rate": 0.0004024056935607543, "loss": 5.6431, "mean_token_accuracy": 0.2008592501282692, "num_tokens": 69480741.0, "step": 27415 }, { "entropy": 6.170301675796509, "epoch": 3.164454702827467, "grad_norm": 1.015625, "learning_rate": 0.00040237167988520245, "loss": 5.7207, "mean_token_accuracy": 0.18927052319049836, "num_tokens": 69493130.0, "step": 27420 }, { "entropy": 6.0939685821533205, "epoch": 3.1650317368724754, "grad_norm": 0.93359375, "learning_rate": 0.0004023376619255674, "loss": 5.6918, "mean_token_accuracy": 0.20142821371555328, "num_tokens": 69504962.0, "step": 27425 }, { "entropy": 6.04275336265564, "epoch": 3.1656087709174843, "grad_norm": 0.97265625, "learning_rate": 0.00040230363968299344, "loss": 5.6502, "mean_token_accuracy": 0.19614885449409486, "num_tokens": 69517295.0, "step": 27430 }, { "entropy": 6.176437282562256, "epoch": 3.1661858049624927, "grad_norm": 0.9375, "learning_rate": 0.0004022696131586247, "loss": 5.7175, "mean_token_accuracy": 0.19070173054933548, "num_tokens": 69529768.0, "step": 27435 }, { "entropy": 6.123783254623413, "epoch": 3.1667628390075016, "grad_norm": 1.0234375, "learning_rate": 0.0004022355823536058, "loss": 5.7042, "mean_token_accuracy": 0.20241218507289888, "num_tokens": 69541746.0, "step": 27440 }, { "entropy": 6.164044761657715, "epoch": 3.16733987305251, "grad_norm": 0.9375, "learning_rate": 0.00040220154726908127, "loss": 5.6968, "mean_token_accuracy": 0.19764174222946168, "num_tokens": 69553778.0, "step": 27445 }, { "entropy": 6.183361434936524, "epoch": 3.167916907097519, "grad_norm": 0.921875, "learning_rate": 0.0004021675079061959, "loss": 5.7013, "mean_token_accuracy": 0.19016370326280593, "num_tokens": 69566317.0, "step": 27450 }, { "entropy": 6.105200529098511, "epoch": 3.1684939411425272, "grad_norm": 0.8671875, "learning_rate": 0.00040213346426609453, "loss": 5.6403, "mean_token_accuracy": 0.2026249185204506, "num_tokens": 69577656.0, "step": 27455 }, { "entropy": 6.113854598999024, "epoch": 3.169070975187536, "grad_norm": 0.95703125, "learning_rate": 0.00040209941634992226, "loss": 5.7087, "mean_token_accuracy": 0.1921801671385765, "num_tokens": 69589020.0, "step": 27460 }, { "entropy": 6.186026191711425, "epoch": 3.1696480092325445, "grad_norm": 0.94921875, "learning_rate": 0.0004020653641588242, "loss": 5.6498, "mean_token_accuracy": 0.19333481341600417, "num_tokens": 69602003.0, "step": 27465 }, { "entropy": 6.191118383407593, "epoch": 3.1702250432775534, "grad_norm": 0.9921875, "learning_rate": 0.0004020313076939458, "loss": 5.7352, "mean_token_accuracy": 0.18799963891506194, "num_tokens": 69614123.0, "step": 27470 }, { "entropy": 6.093089866638183, "epoch": 3.170802077322562, "grad_norm": 1.0703125, "learning_rate": 0.0004019972469564325, "loss": 5.5549, "mean_token_accuracy": 0.20680705159902574, "num_tokens": 69628490.0, "step": 27475 }, { "entropy": 6.093897008895874, "epoch": 3.1713791113675707, "grad_norm": 1.0234375, "learning_rate": 0.00040196318194742975, "loss": 5.6792, "mean_token_accuracy": 0.19264387339353561, "num_tokens": 69641313.0, "step": 27480 }, { "entropy": 6.08471269607544, "epoch": 3.1719561454125795, "grad_norm": 0.9296875, "learning_rate": 0.00040192911266808356, "loss": 5.5489, "mean_token_accuracy": 0.20377940088510513, "num_tokens": 69652849.0, "step": 27485 }, { "entropy": 6.088257503509522, "epoch": 3.172533179457588, "grad_norm": 0.94140625, "learning_rate": 0.0004018950391195397, "loss": 5.7017, "mean_token_accuracy": 0.19392950981855392, "num_tokens": 69664396.0, "step": 27490 }, { "entropy": 6.1147418975830075, "epoch": 3.173110213502597, "grad_norm": 1.046875, "learning_rate": 0.0004018609613029442, "loss": 5.6611, "mean_token_accuracy": 0.19233012199401855, "num_tokens": 69677022.0, "step": 27495 }, { "entropy": 6.125004243850708, "epoch": 3.1736872475476052, "grad_norm": 0.91796875, "learning_rate": 0.0004018268792194433, "loss": 5.695, "mean_token_accuracy": 0.1952821910381317, "num_tokens": 69689132.0, "step": 27500 }, { "entropy": 6.169435977935791, "epoch": 3.174264281592614, "grad_norm": 0.92578125, "learning_rate": 0.00040179279287018334, "loss": 5.7129, "mean_token_accuracy": 0.1946713373064995, "num_tokens": 69701704.0, "step": 27505 }, { "entropy": 6.156677865982056, "epoch": 3.1748413156376225, "grad_norm": 0.96484375, "learning_rate": 0.00040175870225631066, "loss": 5.7784, "mean_token_accuracy": 0.19002797305583954, "num_tokens": 69715362.0, "step": 27510 }, { "entropy": 6.157092666625976, "epoch": 3.1754183496826314, "grad_norm": 1.0703125, "learning_rate": 0.0004017246073789721, "loss": 5.6943, "mean_token_accuracy": 0.1891680344939232, "num_tokens": 69726745.0, "step": 27515 }, { "entropy": 6.092809247970581, "epoch": 3.17599538372764, "grad_norm": 0.921875, "learning_rate": 0.0004016905082393143, "loss": 5.6202, "mean_token_accuracy": 0.19824722558259963, "num_tokens": 69740074.0, "step": 27520 }, { "entropy": 6.0835113525390625, "epoch": 3.1765724177726486, "grad_norm": 0.94921875, "learning_rate": 0.00040165640483848415, "loss": 5.6956, "mean_token_accuracy": 0.20157905220985411, "num_tokens": 69751220.0, "step": 27525 }, { "entropy": 6.111167526245117, "epoch": 3.177149451817657, "grad_norm": 0.91796875, "learning_rate": 0.00040162229717762883, "loss": 5.7535, "mean_token_accuracy": 0.19212746173143386, "num_tokens": 69764532.0, "step": 27530 }, { "entropy": 6.1592050075531, "epoch": 3.177726485862666, "grad_norm": 0.96875, "learning_rate": 0.0004015881852578953, "loss": 5.6895, "mean_token_accuracy": 0.195404751598835, "num_tokens": 69776862.0, "step": 27535 }, { "entropy": 6.094680500030518, "epoch": 3.1783035199076743, "grad_norm": 0.97265625, "learning_rate": 0.00040155406908043114, "loss": 5.6608, "mean_token_accuracy": 0.19931994527578353, "num_tokens": 69789667.0, "step": 27540 }, { "entropy": 6.104642629623413, "epoch": 3.178880553952683, "grad_norm": 0.95703125, "learning_rate": 0.0004015199486463837, "loss": 5.682, "mean_token_accuracy": 0.1939501479268074, "num_tokens": 69802112.0, "step": 27545 }, { "entropy": 6.108482503890992, "epoch": 3.179457587997692, "grad_norm": 0.96484375, "learning_rate": 0.0004014858239569006, "loss": 5.705, "mean_token_accuracy": 0.1937064126133919, "num_tokens": 69813908.0, "step": 27550 }, { "entropy": 6.108286333084107, "epoch": 3.1800346220427005, "grad_norm": 0.953125, "learning_rate": 0.00040145169501312966, "loss": 5.6166, "mean_token_accuracy": 0.20078689604997635, "num_tokens": 69825920.0, "step": 27555 }, { "entropy": 6.146532011032105, "epoch": 3.1806116560877093, "grad_norm": 0.97265625, "learning_rate": 0.0004014175618162188, "loss": 5.6735, "mean_token_accuracy": 0.19559755474328994, "num_tokens": 69839657.0, "step": 27560 }, { "entropy": 6.139887762069702, "epoch": 3.1811886901327178, "grad_norm": 0.89453125, "learning_rate": 0.00040138342436731603, "loss": 5.6782, "mean_token_accuracy": 0.19961002320051194, "num_tokens": 69851778.0, "step": 27565 }, { "entropy": 6.114302396774292, "epoch": 3.1817657241777266, "grad_norm": 0.99609375, "learning_rate": 0.00040134928266756954, "loss": 5.7056, "mean_token_accuracy": 0.19824820905923843, "num_tokens": 69865011.0, "step": 27570 }, { "entropy": 6.140068292617798, "epoch": 3.182342758222735, "grad_norm": 0.91796875, "learning_rate": 0.0004013151367181277, "loss": 5.7391, "mean_token_accuracy": 0.1893114075064659, "num_tokens": 69877740.0, "step": 27575 }, { "entropy": 6.200154972076416, "epoch": 3.182919792267744, "grad_norm": 0.8671875, "learning_rate": 0.0004012809865201391, "loss": 5.7108, "mean_token_accuracy": 0.1902512013912201, "num_tokens": 69890102.0, "step": 27580 }, { "entropy": 6.090849781036377, "epoch": 3.1834968263127523, "grad_norm": 0.96875, "learning_rate": 0.00040124683207475205, "loss": 5.6367, "mean_token_accuracy": 0.19401753395795823, "num_tokens": 69902500.0, "step": 27585 }, { "entropy": 6.120217800140381, "epoch": 3.184073860357761, "grad_norm": 0.921875, "learning_rate": 0.00040121267338311556, "loss": 5.7241, "mean_token_accuracy": 0.19053917676210402, "num_tokens": 69915013.0, "step": 27590 }, { "entropy": 6.148542022705078, "epoch": 3.1846508944027696, "grad_norm": 0.9921875, "learning_rate": 0.00040117851044637855, "loss": 5.5684, "mean_token_accuracy": 0.21735063940286636, "num_tokens": 69927149.0, "step": 27595 }, { "entropy": 6.162502908706665, "epoch": 3.1852279284477785, "grad_norm": 1.0625, "learning_rate": 0.00040114434326569005, "loss": 5.6982, "mean_token_accuracy": 0.1941469430923462, "num_tokens": 69939924.0, "step": 27600 }, { "entropy": 6.063241052627563, "epoch": 3.185804962492787, "grad_norm": 0.9140625, "learning_rate": 0.00040111017184219915, "loss": 5.6569, "mean_token_accuracy": 0.19664947241544722, "num_tokens": 69952068.0, "step": 27605 }, { "entropy": 6.0914960384368895, "epoch": 3.1863819965377957, "grad_norm": 1.0390625, "learning_rate": 0.00040107599617705527, "loss": 5.6537, "mean_token_accuracy": 0.1954856261610985, "num_tokens": 69965270.0, "step": 27610 }, { "entropy": 6.204733514785767, "epoch": 3.1869590305828046, "grad_norm": 0.9609375, "learning_rate": 0.000401041816271408, "loss": 5.7672, "mean_token_accuracy": 0.18885004371404648, "num_tokens": 69977138.0, "step": 27615 }, { "entropy": 6.179504776000977, "epoch": 3.187536064627813, "grad_norm": 0.93359375, "learning_rate": 0.00040100763212640666, "loss": 5.7339, "mean_token_accuracy": 0.18840832859277726, "num_tokens": 69989599.0, "step": 27620 }, { "entropy": 6.190329599380493, "epoch": 3.188113098672822, "grad_norm": 0.96484375, "learning_rate": 0.0004009734437432013, "loss": 5.7558, "mean_token_accuracy": 0.1908293694257736, "num_tokens": 70000887.0, "step": 27625 }, { "entropy": 6.067487621307373, "epoch": 3.1886901327178303, "grad_norm": 0.90234375, "learning_rate": 0.00040093925112294173, "loss": 5.6362, "mean_token_accuracy": 0.197028449177742, "num_tokens": 70013868.0, "step": 27630 }, { "entropy": 6.186224365234375, "epoch": 3.189267166762839, "grad_norm": 0.890625, "learning_rate": 0.000400905054266778, "loss": 5.6757, "mean_token_accuracy": 0.19788626581430435, "num_tokens": 70026307.0, "step": 27635 }, { "entropy": 6.0445051193237305, "epoch": 3.1898442008078476, "grad_norm": 1.0390625, "learning_rate": 0.0004008708531758603, "loss": 5.6291, "mean_token_accuracy": 0.21009810119867325, "num_tokens": 70040481.0, "step": 27640 }, { "entropy": 6.059706497192383, "epoch": 3.1904212348528564, "grad_norm": 1.0546875, "learning_rate": 0.000400836647851339, "loss": 5.6197, "mean_token_accuracy": 0.1999824598431587, "num_tokens": 70052067.0, "step": 27645 }, { "entropy": 6.1772455215454105, "epoch": 3.190998268897865, "grad_norm": 0.8984375, "learning_rate": 0.0004008024382943645, "loss": 5.773, "mean_token_accuracy": 0.18657677620649338, "num_tokens": 70064513.0, "step": 27650 }, { "entropy": 6.083112096786499, "epoch": 3.1915753029428737, "grad_norm": 0.8515625, "learning_rate": 0.00040076822450608757, "loss": 5.6362, "mean_token_accuracy": 0.19627652764320375, "num_tokens": 70077496.0, "step": 27655 }, { "entropy": 6.140889978408813, "epoch": 3.192152336987882, "grad_norm": 0.84375, "learning_rate": 0.0004007340064876588, "loss": 5.7466, "mean_token_accuracy": 0.19131832122802733, "num_tokens": 70091035.0, "step": 27660 }, { "entropy": 6.203101968765258, "epoch": 3.192729371032891, "grad_norm": 0.87890625, "learning_rate": 0.0004006997842402292, "loss": 5.7655, "mean_token_accuracy": 0.1944819062948227, "num_tokens": 70104773.0, "step": 27665 }, { "entropy": 6.126469659805298, "epoch": 3.1933064050778994, "grad_norm": 0.95703125, "learning_rate": 0.0004006655577649498, "loss": 5.7176, "mean_token_accuracy": 0.1977926805615425, "num_tokens": 70118019.0, "step": 27670 }, { "entropy": 6.081540441513061, "epoch": 3.1938834391229083, "grad_norm": 0.9296875, "learning_rate": 0.0004006313270629718, "loss": 5.6952, "mean_token_accuracy": 0.19859555661678313, "num_tokens": 70130642.0, "step": 27675 }, { "entropy": 6.128610134124756, "epoch": 3.1944604731679167, "grad_norm": 0.984375, "learning_rate": 0.00040059709213544656, "loss": 5.5971, "mean_token_accuracy": 0.20044137835502623, "num_tokens": 70144053.0, "step": 27680 }, { "entropy": 6.1069989681243895, "epoch": 3.1950375072129256, "grad_norm": 0.94140625, "learning_rate": 0.0004005628529835255, "loss": 5.6836, "mean_token_accuracy": 0.19584569483995437, "num_tokens": 70156765.0, "step": 27685 }, { "entropy": 6.095725727081299, "epoch": 3.1956145412579344, "grad_norm": 1.1953125, "learning_rate": 0.0004005286096083602, "loss": 5.6617, "mean_token_accuracy": 0.19987715035676956, "num_tokens": 70169515.0, "step": 27690 }, { "entropy": 6.087531423568725, "epoch": 3.196191575302943, "grad_norm": 0.87890625, "learning_rate": 0.00040049436201110246, "loss": 5.6744, "mean_token_accuracy": 0.1999328151345253, "num_tokens": 70183958.0, "step": 27695 }, { "entropy": 6.164551687240601, "epoch": 3.1967686093479517, "grad_norm": 0.9765625, "learning_rate": 0.00040046011019290417, "loss": 5.7439, "mean_token_accuracy": 0.18895459324121475, "num_tokens": 70196381.0, "step": 27700 }, { "entropy": 6.085721635818482, "epoch": 3.19734564339296, "grad_norm": 0.91796875, "learning_rate": 0.00040042585415491747, "loss": 5.6887, "mean_token_accuracy": 0.1930871933698654, "num_tokens": 70208685.0, "step": 27705 }, { "entropy": 6.181350183486939, "epoch": 3.197922677437969, "grad_norm": 0.94140625, "learning_rate": 0.0004003915938982944, "loss": 5.7457, "mean_token_accuracy": 0.18845361173152925, "num_tokens": 70220651.0, "step": 27710 }, { "entropy": 6.14144868850708, "epoch": 3.1984997114829774, "grad_norm": 0.90234375, "learning_rate": 0.0004003573294241875, "loss": 5.7247, "mean_token_accuracy": 0.18952881395816804, "num_tokens": 70233315.0, "step": 27715 }, { "entropy": 6.095832061767578, "epoch": 3.1990767455279863, "grad_norm": 0.9296875, "learning_rate": 0.00040032306073374893, "loss": 5.6499, "mean_token_accuracy": 0.19654903709888458, "num_tokens": 70244845.0, "step": 27720 }, { "entropy": 6.107531642913818, "epoch": 3.1996537795729947, "grad_norm": 0.88671875, "learning_rate": 0.0004002887878281315, "loss": 5.7119, "mean_token_accuracy": 0.1910250574350357, "num_tokens": 70258242.0, "step": 27725 }, { "entropy": 6.170880365371704, "epoch": 3.2002308136180035, "grad_norm": 0.87109375, "learning_rate": 0.00040025451070848793, "loss": 5.7643, "mean_token_accuracy": 0.19094973653554917, "num_tokens": 70270568.0, "step": 27730 }, { "entropy": 6.138811492919922, "epoch": 3.200807847663012, "grad_norm": 1.0625, "learning_rate": 0.00040022022937597114, "loss": 5.6635, "mean_token_accuracy": 0.1937575876712799, "num_tokens": 70284180.0, "step": 27735 }, { "entropy": 6.183554220199585, "epoch": 3.201384881708021, "grad_norm": 1.125, "learning_rate": 0.00040018594383173407, "loss": 5.7699, "mean_token_accuracy": 0.18765608668327333, "num_tokens": 70296970.0, "step": 27740 }, { "entropy": 6.1393286228179935, "epoch": 3.2019619157530292, "grad_norm": 0.96875, "learning_rate": 0.00040015165407693005, "loss": 5.6642, "mean_token_accuracy": 0.195418281853199, "num_tokens": 70308814.0, "step": 27745 }, { "entropy": 6.093904209136963, "epoch": 3.202538949798038, "grad_norm": 1.0234375, "learning_rate": 0.0004001173601127123, "loss": 5.6902, "mean_token_accuracy": 0.20344341844320296, "num_tokens": 70320608.0, "step": 27750 }, { "entropy": 6.03027720451355, "epoch": 3.2031159838430465, "grad_norm": 0.94140625, "learning_rate": 0.00040008306194023427, "loss": 5.6602, "mean_token_accuracy": 0.19518781155347825, "num_tokens": 70333550.0, "step": 27755 }, { "entropy": 6.1123401641845705, "epoch": 3.2036930178880554, "grad_norm": 0.92578125, "learning_rate": 0.0004000487595606496, "loss": 5.6059, "mean_token_accuracy": 0.20316351652145387, "num_tokens": 70346417.0, "step": 27760 }, { "entropy": 6.173285579681396, "epoch": 3.2042700519330642, "grad_norm": 0.98046875, "learning_rate": 0.0004000144529751119, "loss": 5.6831, "mean_token_accuracy": 0.19262183010578154, "num_tokens": 70359820.0, "step": 27765 }, { "entropy": 6.0782546043396, "epoch": 3.2048470859780727, "grad_norm": 0.97265625, "learning_rate": 0.0003999801421847753, "loss": 5.7313, "mean_token_accuracy": 0.19237934350967406, "num_tokens": 70373835.0, "step": 27770 }, { "entropy": 6.135693025588989, "epoch": 3.2054241200230815, "grad_norm": 0.94921875, "learning_rate": 0.00039994582719079364, "loss": 5.655, "mean_token_accuracy": 0.19483501762151717, "num_tokens": 70387162.0, "step": 27775 }, { "entropy": 6.16173529624939, "epoch": 3.20600115406809, "grad_norm": 0.9765625, "learning_rate": 0.00039991150799432117, "loss": 5.7053, "mean_token_accuracy": 0.19465212970972062, "num_tokens": 70399443.0, "step": 27780 }, { "entropy": 6.137966632843018, "epoch": 3.206578188113099, "grad_norm": 0.93359375, "learning_rate": 0.0003998771845965122, "loss": 5.6474, "mean_token_accuracy": 0.1973962590098381, "num_tokens": 70411256.0, "step": 27785 }, { "entropy": 6.067451763153076, "epoch": 3.207155222158107, "grad_norm": 0.88671875, "learning_rate": 0.00039984285699852116, "loss": 5.6634, "mean_token_accuracy": 0.1996780127286911, "num_tokens": 70424327.0, "step": 27790 }, { "entropy": 6.12373161315918, "epoch": 3.207732256203116, "grad_norm": 0.9609375, "learning_rate": 0.00039980852520150255, "loss": 5.6505, "mean_token_accuracy": 0.19766132086515426, "num_tokens": 70436869.0, "step": 27795 }, { "entropy": 6.118344259262085, "epoch": 3.2083092902481245, "grad_norm": 1.1640625, "learning_rate": 0.0003997741892066113, "loss": 5.7234, "mean_token_accuracy": 0.19439528435468673, "num_tokens": 70449803.0, "step": 27800 }, { "entropy": 6.1401876449584964, "epoch": 3.2088863242931334, "grad_norm": 0.96875, "learning_rate": 0.0003997398490150021, "loss": 5.6802, "mean_token_accuracy": 0.18971627503633498, "num_tokens": 70461822.0, "step": 27805 }, { "entropy": 6.131408262252807, "epoch": 3.209463358338142, "grad_norm": 0.9765625, "learning_rate": 0.0003997055046278301, "loss": 5.668, "mean_token_accuracy": 0.19413064569234847, "num_tokens": 70473906.0, "step": 27810 }, { "entropy": 6.034913158416748, "epoch": 3.2100403923831506, "grad_norm": 0.9765625, "learning_rate": 0.0003996711560462503, "loss": 5.5759, "mean_token_accuracy": 0.20933042466640472, "num_tokens": 70486915.0, "step": 27815 }, { "entropy": 6.140358257293701, "epoch": 3.210617426428159, "grad_norm": 1.0078125, "learning_rate": 0.0003996368032714182, "loss": 5.6901, "mean_token_accuracy": 0.20078474283218384, "num_tokens": 70500180.0, "step": 27820 }, { "entropy": 6.098399353027344, "epoch": 3.211194460473168, "grad_norm": 0.91015625, "learning_rate": 0.0003996024463044891, "loss": 5.6267, "mean_token_accuracy": 0.1992820158600807, "num_tokens": 70512785.0, "step": 27825 }, { "entropy": 6.169175863265991, "epoch": 3.2117714945181763, "grad_norm": 0.9609375, "learning_rate": 0.0003995680851466186, "loss": 5.7214, "mean_token_accuracy": 0.19246959686279297, "num_tokens": 70525187.0, "step": 27830 }, { "entropy": 6.138226556777954, "epoch": 3.212348528563185, "grad_norm": 0.9609375, "learning_rate": 0.0003995337197989624, "loss": 5.6955, "mean_token_accuracy": 0.18921154737472534, "num_tokens": 70538252.0, "step": 27835 }, { "entropy": 6.074362802505493, "epoch": 3.212925562608194, "grad_norm": 0.921875, "learning_rate": 0.00039949935026267644, "loss": 5.6821, "mean_token_accuracy": 0.19398800879716874, "num_tokens": 70549826.0, "step": 27840 }, { "entropy": 6.203020668029785, "epoch": 3.2135025966532025, "grad_norm": 0.97265625, "learning_rate": 0.00039946497653891666, "loss": 5.6651, "mean_token_accuracy": 0.20169676840305328, "num_tokens": 70561580.0, "step": 27845 }, { "entropy": 6.205409336090088, "epoch": 3.2140796306982113, "grad_norm": 1.046875, "learning_rate": 0.00039943059862883925, "loss": 5.8202, "mean_token_accuracy": 0.18746827840805053, "num_tokens": 70575246.0, "step": 27850 }, { "entropy": 6.201395845413208, "epoch": 3.2146566647432198, "grad_norm": 0.9375, "learning_rate": 0.00039939621653360045, "loss": 5.823, "mean_token_accuracy": 0.18765945732593536, "num_tokens": 70588457.0, "step": 27855 }, { "entropy": 6.170694875717163, "epoch": 3.2152336987882286, "grad_norm": 0.9140625, "learning_rate": 0.0003993618302543566, "loss": 5.6831, "mean_token_accuracy": 0.19841423481702805, "num_tokens": 70599772.0, "step": 27860 }, { "entropy": 6.079241561889648, "epoch": 3.215810732833237, "grad_norm": 1.0234375, "learning_rate": 0.0003993274397922645, "loss": 5.6318, "mean_token_accuracy": 0.19536245316267015, "num_tokens": 70611901.0, "step": 27865 }, { "entropy": 6.0728436470031735, "epoch": 3.216387766878246, "grad_norm": 0.86328125, "learning_rate": 0.0003992930451484807, "loss": 5.6484, "mean_token_accuracy": 0.19923944324254989, "num_tokens": 70625613.0, "step": 27870 }, { "entropy": 6.20472092628479, "epoch": 3.2169648009232543, "grad_norm": 0.9296875, "learning_rate": 0.000399258646324162, "loss": 5.8218, "mean_token_accuracy": 0.19123612642288207, "num_tokens": 70639286.0, "step": 27875 }, { "entropy": 6.172567749023438, "epoch": 3.217541834968263, "grad_norm": 0.9609375, "learning_rate": 0.0003992242433204655, "loss": 5.7003, "mean_token_accuracy": 0.19108872562646867, "num_tokens": 70651021.0, "step": 27880 }, { "entropy": 6.180254888534546, "epoch": 3.2181188690132716, "grad_norm": 0.953125, "learning_rate": 0.00039918983613854825, "loss": 5.6625, "mean_token_accuracy": 0.19786344468593597, "num_tokens": 70664417.0, "step": 27885 }, { "entropy": 6.132473468780518, "epoch": 3.2186959030582805, "grad_norm": 0.97265625, "learning_rate": 0.0003991554247795676, "loss": 5.6675, "mean_token_accuracy": 0.1980031371116638, "num_tokens": 70677517.0, "step": 27890 }, { "entropy": 6.099011039733886, "epoch": 3.2192729371032893, "grad_norm": 0.95703125, "learning_rate": 0.0003991210092446808, "loss": 5.6786, "mean_token_accuracy": 0.1918819233775139, "num_tokens": 70689746.0, "step": 27895 }, { "entropy": 6.114844942092896, "epoch": 3.2198499711482977, "grad_norm": 1.0, "learning_rate": 0.00039908658953504567, "loss": 5.7492, "mean_token_accuracy": 0.1947510063648224, "num_tokens": 70702356.0, "step": 27900 }, { "entropy": 6.009182405471802, "epoch": 3.2204270051933066, "grad_norm": 1.0234375, "learning_rate": 0.00039905216565181963, "loss": 5.5593, "mean_token_accuracy": 0.21047858148813248, "num_tokens": 70715147.0, "step": 27905 }, { "entropy": 6.2126298427581785, "epoch": 3.221004039238315, "grad_norm": 0.96875, "learning_rate": 0.0003990177375961607, "loss": 5.8137, "mean_token_accuracy": 0.1922590434551239, "num_tokens": 70727951.0, "step": 27910 }, { "entropy": 6.102776527404785, "epoch": 3.221581073283324, "grad_norm": 0.9921875, "learning_rate": 0.00039898330536922665, "loss": 5.6389, "mean_token_accuracy": 0.1978570118546486, "num_tokens": 70740823.0, "step": 27915 }, { "entropy": 6.147250699996948, "epoch": 3.2221581073283323, "grad_norm": 0.9765625, "learning_rate": 0.0003989488689721758, "loss": 5.6846, "mean_token_accuracy": 0.19394493103027344, "num_tokens": 70753323.0, "step": 27920 }, { "entropy": 6.1066591262817385, "epoch": 3.222735141373341, "grad_norm": 0.94921875, "learning_rate": 0.0003989144284061662, "loss": 5.6414, "mean_token_accuracy": 0.1983753561973572, "num_tokens": 70765546.0, "step": 27925 }, { "entropy": 6.052069234848022, "epoch": 3.2233121754183496, "grad_norm": 0.9453125, "learning_rate": 0.0003988799836723565, "loss": 5.6809, "mean_token_accuracy": 0.1958295002579689, "num_tokens": 70778869.0, "step": 27930 }, { "entropy": 6.12645788192749, "epoch": 3.2238892094633584, "grad_norm": 0.9375, "learning_rate": 0.000398845534771905, "loss": 5.6483, "mean_token_accuracy": 0.20348383039236068, "num_tokens": 70792227.0, "step": 27935 }, { "entropy": 6.229370880126953, "epoch": 3.224466243508367, "grad_norm": 0.97265625, "learning_rate": 0.0003988110817059705, "loss": 5.7592, "mean_token_accuracy": 0.19297787696123123, "num_tokens": 70804979.0, "step": 27940 }, { "entropy": 6.034563064575195, "epoch": 3.2250432775533757, "grad_norm": 0.99609375, "learning_rate": 0.0003987766244757117, "loss": 5.6722, "mean_token_accuracy": 0.20018650889396666, "num_tokens": 70817538.0, "step": 27945 }, { "entropy": 6.162887239456177, "epoch": 3.225620311598384, "grad_norm": 0.95703125, "learning_rate": 0.00039874216308228764, "loss": 5.7196, "mean_token_accuracy": 0.19467681795358657, "num_tokens": 70830186.0, "step": 27950 }, { "entropy": 6.132397127151489, "epoch": 3.226197345643393, "grad_norm": 0.97265625, "learning_rate": 0.00039870769752685744, "loss": 5.7086, "mean_token_accuracy": 0.19618593752384186, "num_tokens": 70841367.0, "step": 27955 }, { "entropy": 6.126722717285157, "epoch": 3.2267743796884014, "grad_norm": 0.96484375, "learning_rate": 0.00039867322781058024, "loss": 5.6594, "mean_token_accuracy": 0.197601780295372, "num_tokens": 70853630.0, "step": 27960 }, { "entropy": 6.209865760803223, "epoch": 3.2273514137334103, "grad_norm": 0.90234375, "learning_rate": 0.00039863875393461546, "loss": 5.7935, "mean_token_accuracy": 0.19246441423892974, "num_tokens": 70866966.0, "step": 27965 }, { "entropy": 6.1236084461212155, "epoch": 3.227928447778419, "grad_norm": 1.1484375, "learning_rate": 0.0003986042759001226, "loss": 5.6854, "mean_token_accuracy": 0.1907464936375618, "num_tokens": 70879287.0, "step": 27970 }, { "entropy": 6.095495986938476, "epoch": 3.2285054818234276, "grad_norm": 1.3359375, "learning_rate": 0.0003985697937082613, "loss": 5.6577, "mean_token_accuracy": 0.19225332736968995, "num_tokens": 70892749.0, "step": 27975 }, { "entropy": 6.150600481033325, "epoch": 3.2290825158684364, "grad_norm": 0.91796875, "learning_rate": 0.00039853530736019143, "loss": 5.649, "mean_token_accuracy": 0.19959256947040557, "num_tokens": 70905463.0, "step": 27980 }, { "entropy": 6.116052484512329, "epoch": 3.229659549913445, "grad_norm": 0.89453125, "learning_rate": 0.0003985008168570728, "loss": 5.6695, "mean_token_accuracy": 0.1962723046541214, "num_tokens": 70919630.0, "step": 27985 }, { "entropy": 6.0763952255249025, "epoch": 3.2302365839584537, "grad_norm": 1.03125, "learning_rate": 0.0003984663222000656, "loss": 5.62, "mean_token_accuracy": 0.19935242235660552, "num_tokens": 70931810.0, "step": 27990 }, { "entropy": 6.113321256637573, "epoch": 3.230813618003462, "grad_norm": 1.015625, "learning_rate": 0.00039843182339032997, "loss": 5.6994, "mean_token_accuracy": 0.19373810887336732, "num_tokens": 70945003.0, "step": 27995 }, { "entropy": 6.123551750183106, "epoch": 3.231390652048471, "grad_norm": 1.0, "learning_rate": 0.0003983973204290263, "loss": 5.6773, "mean_token_accuracy": 0.20523401945829392, "num_tokens": 70958889.0, "step": 28000 }, { "entropy": 6.0941650390625, "epoch": 3.2319676860934794, "grad_norm": 0.98828125, "learning_rate": 0.00039836281331731495, "loss": 5.6101, "mean_token_accuracy": 0.19690290987491607, "num_tokens": 70972003.0, "step": 28005 }, { "entropy": 6.223172950744629, "epoch": 3.2325447201384883, "grad_norm": 0.9296875, "learning_rate": 0.00039832830205635675, "loss": 5.7321, "mean_token_accuracy": 0.18877068907022476, "num_tokens": 70984269.0, "step": 28010 }, { "entropy": 6.09482159614563, "epoch": 3.2331217541834967, "grad_norm": 0.87109375, "learning_rate": 0.00039829378664731226, "loss": 5.6818, "mean_token_accuracy": 0.19647594690322875, "num_tokens": 70998602.0, "step": 28015 }, { "entropy": 6.098766469955445, "epoch": 3.2336987882285055, "grad_norm": 0.8828125, "learning_rate": 0.00039825926709134257, "loss": 5.6861, "mean_token_accuracy": 0.19949979484081268, "num_tokens": 71011095.0, "step": 28020 }, { "entropy": 6.190096616744995, "epoch": 3.234275822273514, "grad_norm": 0.95703125, "learning_rate": 0.0003982247433896087, "loss": 5.7123, "mean_token_accuracy": 0.19168585687875747, "num_tokens": 71022610.0, "step": 28025 }, { "entropy": 6.168711805343628, "epoch": 3.234852856318523, "grad_norm": 1.03125, "learning_rate": 0.00039819021554327174, "loss": 5.7533, "mean_token_accuracy": 0.1923417791724205, "num_tokens": 71035896.0, "step": 28030 }, { "entropy": 6.13963623046875, "epoch": 3.2354298903635312, "grad_norm": 0.94921875, "learning_rate": 0.0003981556835534931, "loss": 5.7043, "mean_token_accuracy": 0.19601708501577378, "num_tokens": 71047793.0, "step": 28035 }, { "entropy": 6.197778987884521, "epoch": 3.23600692440854, "grad_norm": 0.94140625, "learning_rate": 0.0003981211474214342, "loss": 5.7238, "mean_token_accuracy": 0.19796839058399202, "num_tokens": 71060481.0, "step": 28040 }, { "entropy": 6.168506240844726, "epoch": 3.236583958453549, "grad_norm": 0.8515625, "learning_rate": 0.0003980866071482566, "loss": 5.7084, "mean_token_accuracy": 0.197569739818573, "num_tokens": 71073757.0, "step": 28045 }, { "entropy": 6.103160762786866, "epoch": 3.2371609924985574, "grad_norm": 0.91796875, "learning_rate": 0.0003980520627351222, "loss": 5.7101, "mean_token_accuracy": 0.2021234005689621, "num_tokens": 71087158.0, "step": 28050 }, { "entropy": 6.153443288803101, "epoch": 3.2377380265435662, "grad_norm": 0.95703125, "learning_rate": 0.0003980175141831928, "loss": 5.7309, "mean_token_accuracy": 0.19064217805862427, "num_tokens": 71099242.0, "step": 28055 }, { "entropy": 6.159456396102906, "epoch": 3.2383150605885747, "grad_norm": 1.046875, "learning_rate": 0.00039798296149363033, "loss": 5.6525, "mean_token_accuracy": 0.19336422085762023, "num_tokens": 71110971.0, "step": 28060 }, { "entropy": 6.11139554977417, "epoch": 3.2388920946335835, "grad_norm": 0.8828125, "learning_rate": 0.00039794840466759714, "loss": 5.7469, "mean_token_accuracy": 0.19323474466800689, "num_tokens": 71125024.0, "step": 28065 }, { "entropy": 6.115737581253052, "epoch": 3.239469128678592, "grad_norm": 1.0078125, "learning_rate": 0.00039791384370625537, "loss": 5.5826, "mean_token_accuracy": 0.19599466621875763, "num_tokens": 71138030.0, "step": 28070 }, { "entropy": 6.173791599273682, "epoch": 3.240046162723601, "grad_norm": 0.91015625, "learning_rate": 0.0003978792786107675, "loss": 5.7519, "mean_token_accuracy": 0.19325887262821198, "num_tokens": 71150763.0, "step": 28075 }, { "entropy": 6.122519063949585, "epoch": 3.240623196768609, "grad_norm": 0.921875, "learning_rate": 0.00039784470938229624, "loss": 5.6262, "mean_token_accuracy": 0.20141390562057496, "num_tokens": 71163235.0, "step": 28080 }, { "entropy": 6.023569345474243, "epoch": 3.241200230813618, "grad_norm": 0.94921875, "learning_rate": 0.00039781013602200406, "loss": 5.645, "mean_token_accuracy": 0.19679532200098038, "num_tokens": 71176119.0, "step": 28085 }, { "entropy": 6.059888696670532, "epoch": 3.2417772648586265, "grad_norm": 0.87890625, "learning_rate": 0.0003977755585310541, "loss": 5.6097, "mean_token_accuracy": 0.20407044589519502, "num_tokens": 71190919.0, "step": 28090 }, { "entropy": 6.191178321838379, "epoch": 3.2423542989036354, "grad_norm": 0.9453125, "learning_rate": 0.0003977409769106091, "loss": 5.7317, "mean_token_accuracy": 0.1891528382897377, "num_tokens": 71202589.0, "step": 28095 }, { "entropy": 6.096343898773194, "epoch": 3.2429313329486438, "grad_norm": 1.09375, "learning_rate": 0.0003977063911618323, "loss": 5.666, "mean_token_accuracy": 0.20136779993772508, "num_tokens": 71214632.0, "step": 28100 }, { "entropy": 6.0593907833099365, "epoch": 3.2435083669936526, "grad_norm": 0.91796875, "learning_rate": 0.0003976718012858871, "loss": 5.6188, "mean_token_accuracy": 0.20363556444644929, "num_tokens": 71226864.0, "step": 28105 }, { "entropy": 6.1296711444854735, "epoch": 3.244085401038661, "grad_norm": 1.09375, "learning_rate": 0.0003976372072839367, "loss": 5.6825, "mean_token_accuracy": 0.19185557216405869, "num_tokens": 71239254.0, "step": 28110 }, { "entropy": 6.117106533050537, "epoch": 3.24466243508367, "grad_norm": 1.0078125, "learning_rate": 0.0003976026091571448, "loss": 5.7227, "mean_token_accuracy": 0.19308591037988662, "num_tokens": 71252215.0, "step": 28115 }, { "entropy": 6.119906997680664, "epoch": 3.2452394691286788, "grad_norm": 0.96875, "learning_rate": 0.00039756800690667505, "loss": 5.6848, "mean_token_accuracy": 0.20117004513740538, "num_tokens": 71263733.0, "step": 28120 }, { "entropy": 6.094219303131103, "epoch": 3.245816503173687, "grad_norm": 1.046875, "learning_rate": 0.00039753340053369116, "loss": 5.7188, "mean_token_accuracy": 0.19860861897468568, "num_tokens": 71277556.0, "step": 28125 }, { "entropy": 6.189479875564575, "epoch": 3.246393537218696, "grad_norm": 0.921875, "learning_rate": 0.00039749879003935743, "loss": 5.7394, "mean_token_accuracy": 0.19267741441726685, "num_tokens": 71289942.0, "step": 28130 }, { "entropy": 6.263569784164429, "epoch": 3.2469705712637045, "grad_norm": 0.9296875, "learning_rate": 0.0003974641754248375, "loss": 5.8222, "mean_token_accuracy": 0.18577689081430435, "num_tokens": 71302517.0, "step": 28135 }, { "entropy": 6.0751505374908445, "epoch": 3.2475476053087133, "grad_norm": 0.9765625, "learning_rate": 0.00039742955669129607, "loss": 5.6913, "mean_token_accuracy": 0.20028978139162062, "num_tokens": 71315022.0, "step": 28140 }, { "entropy": 6.042082166671753, "epoch": 3.2481246393537218, "grad_norm": 1.3515625, "learning_rate": 0.00039739493383989714, "loss": 5.5883, "mean_token_accuracy": 0.19971897155046464, "num_tokens": 71329335.0, "step": 28145 }, { "entropy": 6.125881338119507, "epoch": 3.2487016733987306, "grad_norm": 0.890625, "learning_rate": 0.0003973603068718055, "loss": 5.7168, "mean_token_accuracy": 0.19682153612375258, "num_tokens": 71342739.0, "step": 28150 }, { "entropy": 6.094817638397217, "epoch": 3.249278707443739, "grad_norm": 1.0390625, "learning_rate": 0.00039732567578818574, "loss": 5.621, "mean_token_accuracy": 0.19936226904392243, "num_tokens": 71355367.0, "step": 28155 }, { "entropy": 6.131360960006714, "epoch": 3.249855741488748, "grad_norm": 1.046875, "learning_rate": 0.0003972910405902026, "loss": 5.6528, "mean_token_accuracy": 0.19836146831512452, "num_tokens": 71367163.0, "step": 28160 }, { "entropy": 6.0587163925170895, "epoch": 3.2504327755337563, "grad_norm": 0.9765625, "learning_rate": 0.0003972564012790211, "loss": 5.6966, "mean_token_accuracy": 0.19916419237852095, "num_tokens": 71379424.0, "step": 28165 }, { "entropy": 6.183052682876587, "epoch": 3.251009809578765, "grad_norm": 0.890625, "learning_rate": 0.00039722175785580617, "loss": 5.7551, "mean_token_accuracy": 0.19467741698026658, "num_tokens": 71392115.0, "step": 28170 }, { "entropy": 6.117837429046631, "epoch": 3.251586843623774, "grad_norm": 0.875, "learning_rate": 0.0003971871103217232, "loss": 5.6812, "mean_token_accuracy": 0.1975853368639946, "num_tokens": 71404339.0, "step": 28175 }, { "entropy": 6.112961292266846, "epoch": 3.2521638776687825, "grad_norm": 0.95703125, "learning_rate": 0.00039715245867793744, "loss": 5.6886, "mean_token_accuracy": 0.19479491263628007, "num_tokens": 71416331.0, "step": 28180 }, { "entropy": 6.116593885421753, "epoch": 3.252740911713791, "grad_norm": 0.96875, "learning_rate": 0.0003971178029256144, "loss": 5.6487, "mean_token_accuracy": 0.20387978702783585, "num_tokens": 71428511.0, "step": 28185 }, { "entropy": 6.136179065704345, "epoch": 3.2533179457587997, "grad_norm": 0.99609375, "learning_rate": 0.00039708314306591974, "loss": 5.6816, "mean_token_accuracy": 0.19546741545200347, "num_tokens": 71440708.0, "step": 28190 }, { "entropy": 6.0933012008667, "epoch": 3.2538949798038086, "grad_norm": 0.92578125, "learning_rate": 0.00039704847910001926, "loss": 5.6567, "mean_token_accuracy": 0.1944028839468956, "num_tokens": 71453363.0, "step": 28195 }, { "entropy": 6.094995832443237, "epoch": 3.254472013848817, "grad_norm": 0.94140625, "learning_rate": 0.0003970138110290787, "loss": 5.5986, "mean_token_accuracy": 0.20314981043338776, "num_tokens": 71465390.0, "step": 28200 }, { "entropy": 6.185604000091553, "epoch": 3.255049047893826, "grad_norm": 0.88671875, "learning_rate": 0.00039697913885426424, "loss": 5.7902, "mean_token_accuracy": 0.1876772627234459, "num_tokens": 71478148.0, "step": 28205 }, { "entropy": 6.086142349243164, "epoch": 3.2556260819388343, "grad_norm": 0.8828125, "learning_rate": 0.00039694446257674203, "loss": 5.6375, "mean_token_accuracy": 0.2032093420624733, "num_tokens": 71490604.0, "step": 28210 }, { "entropy": 6.104994678497315, "epoch": 3.256203115983843, "grad_norm": 0.9453125, "learning_rate": 0.00039690978219767846, "loss": 5.7821, "mean_token_accuracy": 0.18981408774852754, "num_tokens": 71503379.0, "step": 28215 }, { "entropy": 6.226002311706543, "epoch": 3.2567801500288516, "grad_norm": 0.97265625, "learning_rate": 0.0003968750977182399, "loss": 5.6973, "mean_token_accuracy": 0.19314495623111724, "num_tokens": 71516350.0, "step": 28220 }, { "entropy": 6.1495274066925045, "epoch": 3.2573571840738604, "grad_norm": 0.99609375, "learning_rate": 0.00039684040913959295, "loss": 5.6489, "mean_token_accuracy": 0.19741449356079102, "num_tokens": 71528314.0, "step": 28225 }, { "entropy": 6.081626605987549, "epoch": 3.257934218118869, "grad_norm": 0.93359375, "learning_rate": 0.0003968057164629043, "loss": 5.6723, "mean_token_accuracy": 0.20468200892210006, "num_tokens": 71540987.0, "step": 28230 }, { "entropy": 6.063146162033081, "epoch": 3.2585112521638777, "grad_norm": 0.9296875, "learning_rate": 0.000396771019689341, "loss": 5.5989, "mean_token_accuracy": 0.20137522667646407, "num_tokens": 71553605.0, "step": 28235 }, { "entropy": 6.126628971099853, "epoch": 3.259088286208886, "grad_norm": 0.96875, "learning_rate": 0.00039673631882006986, "loss": 5.6954, "mean_token_accuracy": 0.19189148843288423, "num_tokens": 71565744.0, "step": 28240 }, { "entropy": 6.217823505401611, "epoch": 3.259665320253895, "grad_norm": 0.98046875, "learning_rate": 0.00039670161385625815, "loss": 5.7657, "mean_token_accuracy": 0.19321134686470032, "num_tokens": 71577756.0, "step": 28245 }, { "entropy": 6.114751195907592, "epoch": 3.260242354298904, "grad_norm": 0.9609375, "learning_rate": 0.00039666690479907307, "loss": 5.6842, "mean_token_accuracy": 0.19664305299520493, "num_tokens": 71590814.0, "step": 28250 }, { "entropy": 6.156188917160034, "epoch": 3.2608193883439123, "grad_norm": 1.0546875, "learning_rate": 0.00039663219164968213, "loss": 5.7002, "mean_token_accuracy": 0.19467169493436814, "num_tokens": 71602960.0, "step": 28255 }, { "entropy": 6.231931829452515, "epoch": 3.261396422388921, "grad_norm": 0.99609375, "learning_rate": 0.00039659747440925277, "loss": 5.823, "mean_token_accuracy": 0.18830994069576262, "num_tokens": 71614568.0, "step": 28260 }, { "entropy": 6.139056444168091, "epoch": 3.2619734564339296, "grad_norm": 0.984375, "learning_rate": 0.00039656275307895286, "loss": 5.7385, "mean_token_accuracy": 0.19024017453193665, "num_tokens": 71628103.0, "step": 28265 }, { "entropy": 6.047552013397217, "epoch": 3.2625504904789384, "grad_norm": 0.9609375, "learning_rate": 0.00039652802765995006, "loss": 5.5823, "mean_token_accuracy": 0.20624837428331375, "num_tokens": 71640343.0, "step": 28270 }, { "entropy": 6.103335952758789, "epoch": 3.263127524523947, "grad_norm": 0.96875, "learning_rate": 0.00039649329815341243, "loss": 5.6129, "mean_token_accuracy": 0.1963995724916458, "num_tokens": 71653430.0, "step": 28275 }, { "entropy": 6.075761604309082, "epoch": 3.2637045585689557, "grad_norm": 0.9375, "learning_rate": 0.00039645856456050813, "loss": 5.6257, "mean_token_accuracy": 0.20027599930763246, "num_tokens": 71665635.0, "step": 28280 }, { "entropy": 5.953153276443482, "epoch": 3.264281592613964, "grad_norm": 0.9140625, "learning_rate": 0.0003964238268824052, "loss": 5.546, "mean_token_accuracy": 0.2134902521967888, "num_tokens": 71679190.0, "step": 28285 }, { "entropy": 6.103391075134278, "epoch": 3.264858626658973, "grad_norm": 0.83984375, "learning_rate": 0.0003963890851202723, "loss": 5.6743, "mean_token_accuracy": 0.19676871001720428, "num_tokens": 71693938.0, "step": 28290 }, { "entropy": 6.125302791595459, "epoch": 3.2654356607039814, "grad_norm": 0.875, "learning_rate": 0.00039635433927527776, "loss": 5.6028, "mean_token_accuracy": 0.2024545818567276, "num_tokens": 71706682.0, "step": 28295 }, { "entropy": 6.19836688041687, "epoch": 3.2660126947489903, "grad_norm": 1.140625, "learning_rate": 0.00039631958934859023, "loss": 5.7153, "mean_token_accuracy": 0.19123188853263856, "num_tokens": 71718454.0, "step": 28300 }, { "entropy": 6.154357051849365, "epoch": 3.2665897287939987, "grad_norm": 0.9609375, "learning_rate": 0.00039628483534137865, "loss": 5.7262, "mean_token_accuracy": 0.20406693667173387, "num_tokens": 71731270.0, "step": 28305 }, { "entropy": 6.151256656646728, "epoch": 3.2671667628390075, "grad_norm": 1.015625, "learning_rate": 0.00039625007725481193, "loss": 5.7089, "mean_token_accuracy": 0.19369070678949357, "num_tokens": 71744086.0, "step": 28310 }, { "entropy": 6.13329176902771, "epoch": 3.267743796884016, "grad_norm": 0.984375, "learning_rate": 0.000396215315090059, "loss": 5.6796, "mean_token_accuracy": 0.19493555426597595, "num_tokens": 71756496.0, "step": 28315 }, { "entropy": 6.116254901885986, "epoch": 3.268320830929025, "grad_norm": 1.015625, "learning_rate": 0.00039618054884828924, "loss": 5.6604, "mean_token_accuracy": 0.20112556219100952, "num_tokens": 71768939.0, "step": 28320 }, { "entropy": 6.09043402671814, "epoch": 3.2688978649740337, "grad_norm": 0.95703125, "learning_rate": 0.0003961457785306719, "loss": 5.6318, "mean_token_accuracy": 0.1919059321284294, "num_tokens": 71780555.0, "step": 28325 }, { "entropy": 6.1364072322845455, "epoch": 3.269474899019042, "grad_norm": 0.93359375, "learning_rate": 0.0003961110041383764, "loss": 5.7971, "mean_token_accuracy": 0.19151452034711838, "num_tokens": 71795705.0, "step": 28330 }, { "entropy": 6.17677755355835, "epoch": 3.270051933064051, "grad_norm": 0.96875, "learning_rate": 0.0003960762256725725, "loss": 5.6725, "mean_token_accuracy": 0.20107867270708085, "num_tokens": 71807582.0, "step": 28335 }, { "entropy": 6.189778184890747, "epoch": 3.2706289671090594, "grad_norm": 0.92578125, "learning_rate": 0.00039604144313442984, "loss": 5.7479, "mean_token_accuracy": 0.19078557342290878, "num_tokens": 71819349.0, "step": 28340 }, { "entropy": 6.154573726654053, "epoch": 3.2712060011540682, "grad_norm": 0.9765625, "learning_rate": 0.00039600665652511836, "loss": 5.6923, "mean_token_accuracy": 0.20255973190069199, "num_tokens": 71832443.0, "step": 28345 }, { "entropy": 6.089715194702149, "epoch": 3.2717830351990767, "grad_norm": 0.953125, "learning_rate": 0.00039597186584580814, "loss": 5.709, "mean_token_accuracy": 0.18834333270788192, "num_tokens": 71844961.0, "step": 28350 }, { "entropy": 6.155925941467285, "epoch": 3.2723600692440855, "grad_norm": 0.8828125, "learning_rate": 0.0003959370710976693, "loss": 5.7375, "mean_token_accuracy": 0.1984020322561264, "num_tokens": 71858158.0, "step": 28355 }, { "entropy": 6.153133201599121, "epoch": 3.272937103289094, "grad_norm": 0.92578125, "learning_rate": 0.00039590227228187213, "loss": 5.7066, "mean_token_accuracy": 0.20005539804697037, "num_tokens": 71870985.0, "step": 28360 }, { "entropy": 6.137960767745971, "epoch": 3.273514137334103, "grad_norm": 0.92578125, "learning_rate": 0.0003958674693995871, "loss": 5.6939, "mean_token_accuracy": 0.19767895340919495, "num_tokens": 71883687.0, "step": 28365 }, { "entropy": 6.143102550506592, "epoch": 3.274091171379111, "grad_norm": 1.03125, "learning_rate": 0.0003958326624519848, "loss": 5.7571, "mean_token_accuracy": 0.1857014700770378, "num_tokens": 71896678.0, "step": 28370 }, { "entropy": 6.108162927627563, "epoch": 3.27466820542412, "grad_norm": 1.0234375, "learning_rate": 0.00039579785144023595, "loss": 5.6663, "mean_token_accuracy": 0.20057436674833298, "num_tokens": 71910722.0, "step": 28375 }, { "entropy": 6.125950622558594, "epoch": 3.2752452394691285, "grad_norm": 0.91796875, "learning_rate": 0.0003957630363655113, "loss": 5.6714, "mean_token_accuracy": 0.19949873685836791, "num_tokens": 71922849.0, "step": 28380 }, { "entropy": 6.113627624511719, "epoch": 3.2758222735141374, "grad_norm": 1.0, "learning_rate": 0.00039572821722898185, "loss": 5.6253, "mean_token_accuracy": 0.19689620286226273, "num_tokens": 71937106.0, "step": 28385 }, { "entropy": 6.176388359069824, "epoch": 3.2763993075591458, "grad_norm": 1.0234375, "learning_rate": 0.0003956933940318189, "loss": 5.7059, "mean_token_accuracy": 0.19192722588777542, "num_tokens": 71949384.0, "step": 28390 }, { "entropy": 6.077463960647583, "epoch": 3.2769763416041546, "grad_norm": 0.93359375, "learning_rate": 0.0003956585667751935, "loss": 5.6517, "mean_token_accuracy": 0.19595678448677062, "num_tokens": 71961906.0, "step": 28395 }, { "entropy": 6.072017621994019, "epoch": 3.2775533756491635, "grad_norm": 1.0390625, "learning_rate": 0.00039562373546027726, "loss": 5.6179, "mean_token_accuracy": 0.2000121220946312, "num_tokens": 71974684.0, "step": 28400 }, { "entropy": 6.1156532764434814, "epoch": 3.278130409694172, "grad_norm": 0.8984375, "learning_rate": 0.0003955889000882415, "loss": 5.6693, "mean_token_accuracy": 0.18992233872413636, "num_tokens": 71987410.0, "step": 28405 }, { "entropy": 6.11706428527832, "epoch": 3.2787074437391808, "grad_norm": 0.98046875, "learning_rate": 0.00039555406066025796, "loss": 5.6911, "mean_token_accuracy": 0.19453849792480468, "num_tokens": 72000155.0, "step": 28410 }, { "entropy": 6.160224676132202, "epoch": 3.279284477784189, "grad_norm": 0.95703125, "learning_rate": 0.0003955192171774986, "loss": 5.7166, "mean_token_accuracy": 0.19104048758745193, "num_tokens": 72013057.0, "step": 28415 }, { "entropy": 6.11291537284851, "epoch": 3.279861511829198, "grad_norm": 1.0078125, "learning_rate": 0.0003954843696411351, "loss": 5.653, "mean_token_accuracy": 0.18929742276668549, "num_tokens": 72024875.0, "step": 28420 }, { "entropy": 6.13860855102539, "epoch": 3.2804385458742065, "grad_norm": 0.96484375, "learning_rate": 0.0003954495180523397, "loss": 5.6667, "mean_token_accuracy": 0.19640615284442903, "num_tokens": 72036932.0, "step": 28425 }, { "entropy": 6.107240104675293, "epoch": 3.2810155799192153, "grad_norm": 0.9453125, "learning_rate": 0.00039541466241228466, "loss": 5.6867, "mean_token_accuracy": 0.19907524287700654, "num_tokens": 72049081.0, "step": 28430 }, { "entropy": 6.144339179992675, "epoch": 3.2815926139642237, "grad_norm": 2.96875, "learning_rate": 0.00039537980272214224, "loss": 5.6487, "mean_token_accuracy": 0.19673170894384384, "num_tokens": 72061334.0, "step": 28435 }, { "entropy": 6.102508497238159, "epoch": 3.2821696480092326, "grad_norm": 0.91015625, "learning_rate": 0.0003953449389830849, "loss": 5.6383, "mean_token_accuracy": 0.19665226042270662, "num_tokens": 72073446.0, "step": 28440 }, { "entropy": 6.094725513458252, "epoch": 3.282746682054241, "grad_norm": 0.9375, "learning_rate": 0.0003953100711962853, "loss": 5.6225, "mean_token_accuracy": 0.2013086885213852, "num_tokens": 72086219.0, "step": 28445 }, { "entropy": 6.125956106185913, "epoch": 3.28332371609925, "grad_norm": 0.98828125, "learning_rate": 0.00039527519936291626, "loss": 5.7183, "mean_token_accuracy": 0.19325001984834672, "num_tokens": 72098442.0, "step": 28450 }, { "entropy": 6.141130638122559, "epoch": 3.2839007501442588, "grad_norm": 0.92578125, "learning_rate": 0.00039524032348415075, "loss": 5.6924, "mean_token_accuracy": 0.1980439692735672, "num_tokens": 72111416.0, "step": 28455 }, { "entropy": 6.068466281890869, "epoch": 3.284477784189267, "grad_norm": 0.92578125, "learning_rate": 0.0003952054435611615, "loss": 5.6284, "mean_token_accuracy": 0.20466866195201874, "num_tokens": 72124077.0, "step": 28460 }, { "entropy": 6.169934177398682, "epoch": 3.2850548182342756, "grad_norm": 0.9296875, "learning_rate": 0.00039517055959512195, "loss": 5.7232, "mean_token_accuracy": 0.19903453290462494, "num_tokens": 72136170.0, "step": 28465 }, { "entropy": 6.065824031829834, "epoch": 3.2856318522792844, "grad_norm": 0.90234375, "learning_rate": 0.0003951356715872053, "loss": 5.6374, "mean_token_accuracy": 0.20355813056230546, "num_tokens": 72148868.0, "step": 28470 }, { "entropy": 6.137563705444336, "epoch": 3.2862088863242933, "grad_norm": 0.91796875, "learning_rate": 0.000395100779538585, "loss": 5.6672, "mean_token_accuracy": 0.19911954551935196, "num_tokens": 72162225.0, "step": 28475 }, { "entropy": 6.1495139598846436, "epoch": 3.2867859203693017, "grad_norm": 0.8671875, "learning_rate": 0.0003950658834504347, "loss": 5.7365, "mean_token_accuracy": 0.192801333963871, "num_tokens": 72174424.0, "step": 28480 }, { "entropy": 6.184037065505981, "epoch": 3.2873629544143106, "grad_norm": 0.87109375, "learning_rate": 0.000395030983323928, "loss": 5.6659, "mean_token_accuracy": 0.19671981036663055, "num_tokens": 72187672.0, "step": 28485 }, { "entropy": 6.036303281784058, "epoch": 3.287939988459319, "grad_norm": 0.99609375, "learning_rate": 0.00039499607916023885, "loss": 5.5365, "mean_token_accuracy": 0.20413777679204942, "num_tokens": 72201575.0, "step": 28490 }, { "entropy": 6.018047094345093, "epoch": 3.288517022504328, "grad_norm": 0.94140625, "learning_rate": 0.0003949611709605411, "loss": 5.5415, "mean_token_accuracy": 0.2080550193786621, "num_tokens": 72215035.0, "step": 28495 }, { "entropy": 6.184219074249268, "epoch": 3.2890940565493363, "grad_norm": 0.94140625, "learning_rate": 0.000394926258726009, "loss": 5.7228, "mean_token_accuracy": 0.19657255858182907, "num_tokens": 72227152.0, "step": 28500 }, { "entropy": 6.106447076797485, "epoch": 3.289671090594345, "grad_norm": 0.9453125, "learning_rate": 0.0003948913424578168, "loss": 5.6705, "mean_token_accuracy": 0.19262617826461792, "num_tokens": 72240770.0, "step": 28505 }, { "entropy": 6.14880256652832, "epoch": 3.2902481246393536, "grad_norm": 0.9375, "learning_rate": 0.0003948564221571388, "loss": 5.6493, "mean_token_accuracy": 0.20426878482103347, "num_tokens": 72253254.0, "step": 28510 }, { "entropy": 6.07218565940857, "epoch": 3.2908251586843624, "grad_norm": 1.3671875, "learning_rate": 0.00039482149782514955, "loss": 5.6529, "mean_token_accuracy": 0.20243048369884492, "num_tokens": 72267863.0, "step": 28515 }, { "entropy": 6.1394964218139645, "epoch": 3.291402192729371, "grad_norm": 0.953125, "learning_rate": 0.0003947865694630238, "loss": 5.6506, "mean_token_accuracy": 0.19797384589910508, "num_tokens": 72279867.0, "step": 28520 }, { "entropy": 6.022223663330078, "epoch": 3.2919792267743797, "grad_norm": 1.0703125, "learning_rate": 0.0003947516370719362, "loss": 5.513, "mean_token_accuracy": 0.21671516299247742, "num_tokens": 72293347.0, "step": 28525 }, { "entropy": 6.127876472473145, "epoch": 3.2925562608193886, "grad_norm": 0.87890625, "learning_rate": 0.0003947167006530618, "loss": 5.724, "mean_token_accuracy": 0.19348247945308686, "num_tokens": 72306216.0, "step": 28530 }, { "entropy": 6.149895286560058, "epoch": 3.293133294864397, "grad_norm": 1.015625, "learning_rate": 0.00039468176020757573, "loss": 5.7082, "mean_token_accuracy": 0.19451941400766373, "num_tokens": 72318253.0, "step": 28535 }, { "entropy": 6.091161394119263, "epoch": 3.293710328909406, "grad_norm": 0.94140625, "learning_rate": 0.000394646815736653, "loss": 5.697, "mean_token_accuracy": 0.1967163398861885, "num_tokens": 72331451.0, "step": 28540 }, { "entropy": 6.175706768035889, "epoch": 3.2942873629544143, "grad_norm": 0.984375, "learning_rate": 0.0003946118672414692, "loss": 5.7118, "mean_token_accuracy": 0.19456691145896912, "num_tokens": 72343532.0, "step": 28545 }, { "entropy": 6.1448719024658205, "epoch": 3.294864396999423, "grad_norm": 0.91015625, "learning_rate": 0.00039457691472319953, "loss": 5.7237, "mean_token_accuracy": 0.18762239068746567, "num_tokens": 72355803.0, "step": 28550 }, { "entropy": 6.122489500045776, "epoch": 3.2954414310444315, "grad_norm": 0.91796875, "learning_rate": 0.0003945419581830197, "loss": 5.6205, "mean_token_accuracy": 0.19542174488306047, "num_tokens": 72370056.0, "step": 28555 }, { "entropy": 6.079394197463989, "epoch": 3.2960184650894404, "grad_norm": 0.91796875, "learning_rate": 0.00039450699762210556, "loss": 5.5515, "mean_token_accuracy": 0.20370566695928574, "num_tokens": 72382444.0, "step": 28560 }, { "entropy": 6.063602304458618, "epoch": 3.296595499134449, "grad_norm": 0.953125, "learning_rate": 0.00039447203304163295, "loss": 5.6254, "mean_token_accuracy": 0.20646788328886032, "num_tokens": 72396773.0, "step": 28565 }, { "entropy": 6.068623018264771, "epoch": 3.2971725331794577, "grad_norm": 1.0078125, "learning_rate": 0.0003944370644427777, "loss": 5.5642, "mean_token_accuracy": 0.20680238008499147, "num_tokens": 72409922.0, "step": 28570 }, { "entropy": 6.178087949752808, "epoch": 3.297749567224466, "grad_norm": 0.90234375, "learning_rate": 0.0003944020918267163, "loss": 5.6803, "mean_token_accuracy": 0.20366569608449936, "num_tokens": 72423011.0, "step": 28575 }, { "entropy": 6.0516369342803955, "epoch": 3.298326601269475, "grad_norm": 0.984375, "learning_rate": 0.00039436711519462474, "loss": 5.622, "mean_token_accuracy": 0.198382431268692, "num_tokens": 72434888.0, "step": 28580 }, { "entropy": 6.122730875015259, "epoch": 3.2989036353144834, "grad_norm": 0.96875, "learning_rate": 0.0003943321345476796, "loss": 5.6493, "mean_token_accuracy": 0.2048882484436035, "num_tokens": 72447202.0, "step": 28585 }, { "entropy": 5.954018020629883, "epoch": 3.2994806693594922, "grad_norm": 1.078125, "learning_rate": 0.00039429714988705735, "loss": 5.5965, "mean_token_accuracy": 0.20587584674358367, "num_tokens": 72460232.0, "step": 28590 }, { "entropy": 6.149437093734742, "epoch": 3.3000577034045007, "grad_norm": 0.93359375, "learning_rate": 0.00039426216121393477, "loss": 5.6619, "mean_token_accuracy": 0.19850059300661088, "num_tokens": 72472665.0, "step": 28595 }, { "entropy": 6.094783163070678, "epoch": 3.3006347374495095, "grad_norm": 0.9296875, "learning_rate": 0.0003942271685294886, "loss": 5.6789, "mean_token_accuracy": 0.20599209815263747, "num_tokens": 72484766.0, "step": 28600 }, { "entropy": 6.212546396255493, "epoch": 3.3012117714945184, "grad_norm": 0.87109375, "learning_rate": 0.00039419217183489594, "loss": 5.7195, "mean_token_accuracy": 0.19344098418951033, "num_tokens": 72497352.0, "step": 28605 }, { "entropy": 6.200887823104859, "epoch": 3.301788805539527, "grad_norm": 1.125, "learning_rate": 0.00039415717113133356, "loss": 5.7599, "mean_token_accuracy": 0.19536616653203964, "num_tokens": 72509057.0, "step": 28610 }, { "entropy": 6.200597190856934, "epoch": 3.3023658395845357, "grad_norm": 0.9765625, "learning_rate": 0.0003941221664199791, "loss": 5.7398, "mean_token_accuracy": 0.1925618976354599, "num_tokens": 72521624.0, "step": 28615 }, { "entropy": 6.123512125015258, "epoch": 3.302942873629544, "grad_norm": 0.9140625, "learning_rate": 0.00039408715770200976, "loss": 5.6528, "mean_token_accuracy": 0.2027030423283577, "num_tokens": 72534078.0, "step": 28620 }, { "entropy": 6.0805620670318605, "epoch": 3.303519907674553, "grad_norm": 1.03125, "learning_rate": 0.00039405214497860295, "loss": 5.6461, "mean_token_accuracy": 0.1997436463832855, "num_tokens": 72547310.0, "step": 28625 }, { "entropy": 6.187747478485107, "epoch": 3.3040969417195614, "grad_norm": 1.0859375, "learning_rate": 0.0003940171282509363, "loss": 5.6791, "mean_token_accuracy": 0.19879880994558335, "num_tokens": 72559758.0, "step": 28630 }, { "entropy": 6.120146179199219, "epoch": 3.3046739757645702, "grad_norm": 0.953125, "learning_rate": 0.0003939821075201878, "loss": 5.701, "mean_token_accuracy": 0.19482448399066926, "num_tokens": 72571365.0, "step": 28635 }, { "entropy": 6.19158902168274, "epoch": 3.3052510098095786, "grad_norm": 0.94921875, "learning_rate": 0.0003939470827875352, "loss": 5.7396, "mean_token_accuracy": 0.19038573354482652, "num_tokens": 72583425.0, "step": 28640 }, { "entropy": 6.138459205627441, "epoch": 3.3058280438545875, "grad_norm": 0.95703125, "learning_rate": 0.0003939120540541565, "loss": 5.6512, "mean_token_accuracy": 0.2009557455778122, "num_tokens": 72595743.0, "step": 28645 }, { "entropy": 6.148765945434571, "epoch": 3.306405077899596, "grad_norm": 1.15625, "learning_rate": 0.00039387702132122993, "loss": 5.7282, "mean_token_accuracy": 0.1975986823439598, "num_tokens": 72608510.0, "step": 28650 }, { "entropy": 6.068108558654785, "epoch": 3.306982111944605, "grad_norm": 0.98046875, "learning_rate": 0.00039384198458993386, "loss": 5.589, "mean_token_accuracy": 0.20037676990032197, "num_tokens": 72620681.0, "step": 28655 }, { "entropy": 6.164902544021606, "epoch": 3.307559145989613, "grad_norm": 0.95703125, "learning_rate": 0.00039380694386144665, "loss": 5.7064, "mean_token_accuracy": 0.19251110255718232, "num_tokens": 72632970.0, "step": 28660 }, { "entropy": 6.148618888854981, "epoch": 3.308136180034622, "grad_norm": 0.96484375, "learning_rate": 0.00039377189913694687, "loss": 5.7357, "mean_token_accuracy": 0.19509387463331224, "num_tokens": 72647953.0, "step": 28665 }, { "entropy": 6.226953792572021, "epoch": 3.3087132140796305, "grad_norm": 1.0, "learning_rate": 0.00039373685041761323, "loss": 5.6941, "mean_token_accuracy": 0.19258223921060563, "num_tokens": 72660333.0, "step": 28670 }, { "entropy": 6.107355117797852, "epoch": 3.3092902481246393, "grad_norm": 1.1015625, "learning_rate": 0.0003937017977046247, "loss": 5.6652, "mean_token_accuracy": 0.19594338089227675, "num_tokens": 72673620.0, "step": 28675 }, { "entropy": 6.143393802642822, "epoch": 3.309867282169648, "grad_norm": 0.98828125, "learning_rate": 0.00039366674099916007, "loss": 5.7698, "mean_token_accuracy": 0.1875929519534111, "num_tokens": 72686285.0, "step": 28680 }, { "entropy": 6.012445116043091, "epoch": 3.3104443162146566, "grad_norm": 0.94921875, "learning_rate": 0.0003936316803023986, "loss": 5.4968, "mean_token_accuracy": 0.20871724486351012, "num_tokens": 72699209.0, "step": 28685 }, { "entropy": 6.080950927734375, "epoch": 3.3110213502596655, "grad_norm": 1.0078125, "learning_rate": 0.00039359661561551946, "loss": 5.6787, "mean_token_accuracy": 0.19370285421609879, "num_tokens": 72711825.0, "step": 28690 }, { "entropy": 6.058858108520508, "epoch": 3.311598384304674, "grad_norm": 1.0078125, "learning_rate": 0.00039356154693970214, "loss": 5.6221, "mean_token_accuracy": 0.19335783123970032, "num_tokens": 72724908.0, "step": 28695 }, { "entropy": 6.143716335296631, "epoch": 3.3121754183496828, "grad_norm": 0.96875, "learning_rate": 0.00039352647427612597, "loss": 5.6474, "mean_token_accuracy": 0.2015886574983597, "num_tokens": 72738431.0, "step": 28700 }, { "entropy": 6.117425203323364, "epoch": 3.312752452394691, "grad_norm": 0.91015625, "learning_rate": 0.0003934913976259709, "loss": 5.6698, "mean_token_accuracy": 0.19382237643003464, "num_tokens": 72750800.0, "step": 28705 }, { "entropy": 6.119411468505859, "epoch": 3.3133294864397, "grad_norm": 0.96875, "learning_rate": 0.0003934563169904164, "loss": 5.6372, "mean_token_accuracy": 0.20595670044422149, "num_tokens": 72763343.0, "step": 28710 }, { "entropy": 6.1254864692687985, "epoch": 3.3139065204847085, "grad_norm": 0.9921875, "learning_rate": 0.0003934212323706425, "loss": 5.625, "mean_token_accuracy": 0.20556642413139342, "num_tokens": 72775865.0, "step": 28715 }, { "entropy": 6.046801519393921, "epoch": 3.3144835545297173, "grad_norm": 0.9296875, "learning_rate": 0.0003933861437678292, "loss": 5.6872, "mean_token_accuracy": 0.195333631336689, "num_tokens": 72789579.0, "step": 28720 }, { "entropy": 6.069760179519653, "epoch": 3.3150605885747257, "grad_norm": 0.8984375, "learning_rate": 0.0003933510511831569, "loss": 5.6082, "mean_token_accuracy": 0.20962165743112565, "num_tokens": 72802952.0, "step": 28725 }, { "entropy": 6.093776845932007, "epoch": 3.3156376226197346, "grad_norm": 0.9609375, "learning_rate": 0.00039331595461780574, "loss": 5.6516, "mean_token_accuracy": 0.19898153692483903, "num_tokens": 72816571.0, "step": 28730 }, { "entropy": 6.103912353515625, "epoch": 3.3162146566647435, "grad_norm": 1.0234375, "learning_rate": 0.00039328085407295616, "loss": 5.5928, "mean_token_accuracy": 0.20080455243587494, "num_tokens": 72829077.0, "step": 28735 }, { "entropy": 6.0752137184143065, "epoch": 3.316791690709752, "grad_norm": 0.9375, "learning_rate": 0.00039324574954978885, "loss": 5.6545, "mean_token_accuracy": 0.19743015021085739, "num_tokens": 72842530.0, "step": 28740 }, { "entropy": 6.1761727809906, "epoch": 3.3173687247547603, "grad_norm": 0.91796875, "learning_rate": 0.00039321064104948456, "loss": 5.731, "mean_token_accuracy": 0.18902297765016557, "num_tokens": 72854534.0, "step": 28745 }, { "entropy": 6.070225954055786, "epoch": 3.317945758799769, "grad_norm": 1.0, "learning_rate": 0.00039317552857322404, "loss": 5.7465, "mean_token_accuracy": 0.19280608296394347, "num_tokens": 72866860.0, "step": 28750 }, { "entropy": 6.2420454025268555, "epoch": 3.318522792844778, "grad_norm": 0.953125, "learning_rate": 0.00039314041212218826, "loss": 5.7338, "mean_token_accuracy": 0.19116558283567428, "num_tokens": 72879074.0, "step": 28755 }, { "entropy": 6.097189903259277, "epoch": 3.3190998268897864, "grad_norm": 0.91015625, "learning_rate": 0.0003931052916975584, "loss": 5.5829, "mean_token_accuracy": 0.20671233534812927, "num_tokens": 72890981.0, "step": 28760 }, { "entropy": 6.075610494613647, "epoch": 3.3196768609347953, "grad_norm": 1.0390625, "learning_rate": 0.00039307016730051576, "loss": 5.6852, "mean_token_accuracy": 0.19994308352470397, "num_tokens": 72903068.0, "step": 28765 }, { "entropy": 6.069404888153076, "epoch": 3.3202538949798037, "grad_norm": 0.92578125, "learning_rate": 0.0003930350389322417, "loss": 5.6715, "mean_token_accuracy": 0.19757690280675888, "num_tokens": 72917805.0, "step": 28770 }, { "entropy": 6.116404581069946, "epoch": 3.3208309290248126, "grad_norm": 1.140625, "learning_rate": 0.0003929999065939177, "loss": 5.625, "mean_token_accuracy": 0.20093947947025298, "num_tokens": 72930665.0, "step": 28775 }, { "entropy": 6.147107839584351, "epoch": 3.321407963069821, "grad_norm": 0.890625, "learning_rate": 0.00039296477028672545, "loss": 5.6852, "mean_token_accuracy": 0.19490035623311996, "num_tokens": 72943841.0, "step": 28780 }, { "entropy": 6.134539842605591, "epoch": 3.32198499711483, "grad_norm": 0.9375, "learning_rate": 0.00039292963001184676, "loss": 5.7218, "mean_token_accuracy": 0.19435421824455262, "num_tokens": 72957886.0, "step": 28785 }, { "entropy": 6.157153940200805, "epoch": 3.3225620311598383, "grad_norm": 0.96875, "learning_rate": 0.0003928944857704636, "loss": 5.6561, "mean_token_accuracy": 0.20160724818706513, "num_tokens": 72969698.0, "step": 28790 }, { "entropy": 6.072511386871338, "epoch": 3.323139065204847, "grad_norm": 1.0859375, "learning_rate": 0.00039285933756375794, "loss": 5.5837, "mean_token_accuracy": 0.20369360893964766, "num_tokens": 72983356.0, "step": 28795 }, { "entropy": 6.03831672668457, "epoch": 3.3237160992498556, "grad_norm": 0.90234375, "learning_rate": 0.0003928241853929119, "loss": 5.6639, "mean_token_accuracy": 0.20169093012809752, "num_tokens": 72995839.0, "step": 28800 }, { "entropy": 6.064248037338257, "epoch": 3.3242931332948644, "grad_norm": 0.953125, "learning_rate": 0.00039278902925910815, "loss": 5.6469, "mean_token_accuracy": 0.19969455897808075, "num_tokens": 73008337.0, "step": 28805 }, { "entropy": 6.1179803848266605, "epoch": 3.3248701673398733, "grad_norm": 0.93359375, "learning_rate": 0.00039275386916352866, "loss": 5.7074, "mean_token_accuracy": 0.19655280113220214, "num_tokens": 73020262.0, "step": 28810 }, { "entropy": 6.159458255767822, "epoch": 3.3254472013848817, "grad_norm": 0.8671875, "learning_rate": 0.0003927187051073564, "loss": 5.7707, "mean_token_accuracy": 0.18897237330675126, "num_tokens": 73034142.0, "step": 28815 }, { "entropy": 6.182563066482544, "epoch": 3.32602423542989, "grad_norm": 0.89453125, "learning_rate": 0.00039268353709177395, "loss": 5.7086, "mean_token_accuracy": 0.1969788894057274, "num_tokens": 73046973.0, "step": 28820 }, { "entropy": 6.1018201351165775, "epoch": 3.326601269474899, "grad_norm": 1.0546875, "learning_rate": 0.0003926483651179642, "loss": 5.6798, "mean_token_accuracy": 0.1932616800069809, "num_tokens": 73060036.0, "step": 28825 }, { "entropy": 6.030070018768311, "epoch": 3.327178303519908, "grad_norm": 1.0625, "learning_rate": 0.0003926131891871101, "loss": 5.6104, "mean_token_accuracy": 0.1999261423945427, "num_tokens": 73072017.0, "step": 28830 }, { "entropy": 6.0897620677947994, "epoch": 3.3277553375649163, "grad_norm": 0.8984375, "learning_rate": 0.00039257800930039485, "loss": 5.5744, "mean_token_accuracy": 0.20028634816408158, "num_tokens": 73083937.0, "step": 28835 }, { "entropy": 6.0535084247589115, "epoch": 3.328332371609925, "grad_norm": 0.9296875, "learning_rate": 0.0003925428254590016, "loss": 5.7055, "mean_token_accuracy": 0.19825107455253602, "num_tokens": 73096084.0, "step": 28840 }, { "entropy": 6.186150979995728, "epoch": 3.3289094056549335, "grad_norm": 1.1328125, "learning_rate": 0.00039250763766411384, "loss": 5.7882, "mean_token_accuracy": 0.19582255631685258, "num_tokens": 73109109.0, "step": 28845 }, { "entropy": 6.127252912521362, "epoch": 3.3294864396999424, "grad_norm": 0.94921875, "learning_rate": 0.00039247244591691504, "loss": 5.6153, "mean_token_accuracy": 0.20720813125371934, "num_tokens": 73121843.0, "step": 28850 }, { "entropy": 6.1502635955810545, "epoch": 3.330063473744951, "grad_norm": 1.046875, "learning_rate": 0.00039243725021858894, "loss": 5.7425, "mean_token_accuracy": 0.18707681745290755, "num_tokens": 73135102.0, "step": 28855 }, { "entropy": 6.093119859695435, "epoch": 3.3306405077899597, "grad_norm": 1.046875, "learning_rate": 0.0003924020505703191, "loss": 5.6274, "mean_token_accuracy": 0.203123739361763, "num_tokens": 73148575.0, "step": 28860 }, { "entropy": 6.1708704948425295, "epoch": 3.331217541834968, "grad_norm": 1.0078125, "learning_rate": 0.00039236684697328974, "loss": 5.7501, "mean_token_accuracy": 0.1887365072965622, "num_tokens": 73160795.0, "step": 28865 }, { "entropy": 6.08322958946228, "epoch": 3.331794575879977, "grad_norm": 0.95703125, "learning_rate": 0.00039233163942868475, "loss": 5.6556, "mean_token_accuracy": 0.20242613255977632, "num_tokens": 73173407.0, "step": 28870 }, { "entropy": 6.101664066314697, "epoch": 3.3323716099249854, "grad_norm": 0.93359375, "learning_rate": 0.0003922964279376883, "loss": 5.6329, "mean_token_accuracy": 0.20785931795835494, "num_tokens": 73187781.0, "step": 28875 }, { "entropy": 6.158063793182373, "epoch": 3.3329486439699942, "grad_norm": 1.0234375, "learning_rate": 0.0003922612125014848, "loss": 5.7243, "mean_token_accuracy": 0.19410327523946763, "num_tokens": 73201701.0, "step": 28880 }, { "entropy": 6.062568521499633, "epoch": 3.333525678015003, "grad_norm": 0.9609375, "learning_rate": 0.00039222599312125874, "loss": 5.7067, "mean_token_accuracy": 0.1908780500292778, "num_tokens": 73214144.0, "step": 28885 }, { "entropy": 6.087817859649658, "epoch": 3.3341027120600115, "grad_norm": 0.9765625, "learning_rate": 0.0003921907697981946, "loss": 5.5624, "mean_token_accuracy": 0.2039722129702568, "num_tokens": 73227314.0, "step": 28890 }, { "entropy": 6.139893865585327, "epoch": 3.3346797461050204, "grad_norm": 0.84765625, "learning_rate": 0.00039215554253347706, "loss": 5.6709, "mean_token_accuracy": 0.19554894417524338, "num_tokens": 73240285.0, "step": 28895 }, { "entropy": 6.117650079727173, "epoch": 3.335256780150029, "grad_norm": 0.90234375, "learning_rate": 0.0003921203113282911, "loss": 5.7253, "mean_token_accuracy": 0.19506211578845978, "num_tokens": 73252839.0, "step": 28900 }, { "entropy": 6.077865839004517, "epoch": 3.3358338141950377, "grad_norm": 0.88671875, "learning_rate": 0.0003920850761838216, "loss": 5.6353, "mean_token_accuracy": 0.2037528470158577, "num_tokens": 73266894.0, "step": 28905 }, { "entropy": 6.144443130493164, "epoch": 3.336410848240046, "grad_norm": 0.98046875, "learning_rate": 0.00039204983710125377, "loss": 5.7025, "mean_token_accuracy": 0.1994447484612465, "num_tokens": 73279867.0, "step": 28910 }, { "entropy": 6.138685655593872, "epoch": 3.336987882285055, "grad_norm": 0.9296875, "learning_rate": 0.00039201459408177275, "loss": 5.703, "mean_token_accuracy": 0.19226930290460587, "num_tokens": 73292080.0, "step": 28915 }, { "entropy": 6.110139989852906, "epoch": 3.3375649163300634, "grad_norm": 0.9765625, "learning_rate": 0.0003919793471265641, "loss": 5.6134, "mean_token_accuracy": 0.19952233433723449, "num_tokens": 73303502.0, "step": 28920 }, { "entropy": 6.036711406707764, "epoch": 3.338141950375072, "grad_norm": 0.91796875, "learning_rate": 0.00039194409623681303, "loss": 5.5699, "mean_token_accuracy": 0.2070951670408249, "num_tokens": 73316169.0, "step": 28925 }, { "entropy": 6.16759467124939, "epoch": 3.3387189844200806, "grad_norm": 0.97265625, "learning_rate": 0.00039190884141370553, "loss": 5.6585, "mean_token_accuracy": 0.20364924371242524, "num_tokens": 73327929.0, "step": 28930 }, { "entropy": 6.016793632507325, "epoch": 3.3392960184650895, "grad_norm": 1.0, "learning_rate": 0.00039187358265842714, "loss": 5.6084, "mean_token_accuracy": 0.20275096446275712, "num_tokens": 73339951.0, "step": 28935 }, { "entropy": 6.059000825881958, "epoch": 3.339873052510098, "grad_norm": 1.125, "learning_rate": 0.00039183831997216393, "loss": 5.5784, "mean_token_accuracy": 0.1988500952720642, "num_tokens": 73351959.0, "step": 28940 }, { "entropy": 6.012447357177734, "epoch": 3.340450086555107, "grad_norm": 1.0390625, "learning_rate": 0.0003918030533561018, "loss": 5.5723, "mean_token_accuracy": 0.20370370894670486, "num_tokens": 73366727.0, "step": 28945 }, { "entropy": 6.1245378971099855, "epoch": 3.341027120600115, "grad_norm": 0.93359375, "learning_rate": 0.00039176778281142696, "loss": 5.6147, "mean_token_accuracy": 0.20102010667324066, "num_tokens": 73378429.0, "step": 28950 }, { "entropy": 6.09379734992981, "epoch": 3.341604154645124, "grad_norm": 1.046875, "learning_rate": 0.00039173250833932576, "loss": 5.5839, "mean_token_accuracy": 0.20450549125671386, "num_tokens": 73391901.0, "step": 28955 }, { "entropy": 6.042441558837891, "epoch": 3.342181188690133, "grad_norm": 1.015625, "learning_rate": 0.00039169722994098464, "loss": 5.6415, "mean_token_accuracy": 0.20028617829084397, "num_tokens": 73404827.0, "step": 28960 }, { "entropy": 6.149498128890992, "epoch": 3.3427582227351413, "grad_norm": 0.9296875, "learning_rate": 0.00039166194761759015, "loss": 5.6924, "mean_token_accuracy": 0.19924909770488738, "num_tokens": 73417941.0, "step": 28965 }, { "entropy": 6.1962748050689695, "epoch": 3.34333525678015, "grad_norm": 0.90234375, "learning_rate": 0.00039162666137032906, "loss": 5.7091, "mean_token_accuracy": 0.19753915518522264, "num_tokens": 73429838.0, "step": 28970 }, { "entropy": 6.169246959686279, "epoch": 3.3439122908251586, "grad_norm": 0.93359375, "learning_rate": 0.0003915913712003882, "loss": 5.6863, "mean_token_accuracy": 0.19088172167539597, "num_tokens": 73441559.0, "step": 28975 }, { "entropy": 6.145298767089844, "epoch": 3.3444893248701675, "grad_norm": 1.0078125, "learning_rate": 0.0003915560771089543, "loss": 5.736, "mean_token_accuracy": 0.18661364316940307, "num_tokens": 73454665.0, "step": 28980 }, { "entropy": 6.115599250793457, "epoch": 3.345066358915176, "grad_norm": 0.96484375, "learning_rate": 0.0003915207790972147, "loss": 5.6211, "mean_token_accuracy": 0.20005884468555452, "num_tokens": 73466969.0, "step": 28985 }, { "entropy": 6.151247835159301, "epoch": 3.3456433929601848, "grad_norm": 0.8828125, "learning_rate": 0.0003914854771663567, "loss": 5.706, "mean_token_accuracy": 0.19477426260709763, "num_tokens": 73481939.0, "step": 28990 }, { "entropy": 6.169728946685791, "epoch": 3.346220427005193, "grad_norm": 0.87890625, "learning_rate": 0.00039145017131756745, "loss": 5.6837, "mean_token_accuracy": 0.19861585050821304, "num_tokens": 73496650.0, "step": 28995 }, { "entropy": 6.086485958099365, "epoch": 3.346797461050202, "grad_norm": 0.91796875, "learning_rate": 0.0003914148615520345, "loss": 5.6279, "mean_token_accuracy": 0.206010702252388, "num_tokens": 73508363.0, "step": 29000 }, { "entropy": 6.033454036712646, "epoch": 3.3473744950952105, "grad_norm": 0.890625, "learning_rate": 0.00039137954787094546, "loss": 5.615, "mean_token_accuracy": 0.19520912766456605, "num_tokens": 73522530.0, "step": 29005 }, { "entropy": 6.080453157424927, "epoch": 3.3479515291402193, "grad_norm": 0.99609375, "learning_rate": 0.00039134423027548825, "loss": 5.6086, "mean_token_accuracy": 0.20337537825107574, "num_tokens": 73535204.0, "step": 29010 }, { "entropy": 6.140754890441895, "epoch": 3.3485285631852277, "grad_norm": 0.87109375, "learning_rate": 0.00039130890876685066, "loss": 5.6849, "mean_token_accuracy": 0.19961223900318145, "num_tokens": 73547783.0, "step": 29015 }, { "entropy": 6.067149591445923, "epoch": 3.3491055972302366, "grad_norm": 1.0, "learning_rate": 0.0003912735833462206, "loss": 5.7959, "mean_token_accuracy": 0.19198202341794968, "num_tokens": 73559707.0, "step": 29020 }, { "entropy": 6.12426905632019, "epoch": 3.349682631275245, "grad_norm": 0.93359375, "learning_rate": 0.00039123825401478633, "loss": 5.6733, "mean_token_accuracy": 0.20417928397655488, "num_tokens": 73571749.0, "step": 29025 }, { "entropy": 6.07002625465393, "epoch": 3.350259665320254, "grad_norm": 0.9375, "learning_rate": 0.0003912029207737363, "loss": 5.6365, "mean_token_accuracy": 0.2024119019508362, "num_tokens": 73583876.0, "step": 29030 }, { "entropy": 5.989030838012695, "epoch": 3.3508366993652627, "grad_norm": 1.0625, "learning_rate": 0.00039116758362425856, "loss": 5.5716, "mean_token_accuracy": 0.20426071137189866, "num_tokens": 73596899.0, "step": 29035 }, { "entropy": 6.091226053237915, "epoch": 3.351413733410271, "grad_norm": 0.98828125, "learning_rate": 0.0003911322425675419, "loss": 5.6258, "mean_token_accuracy": 0.20146955400705338, "num_tokens": 73609190.0, "step": 29040 }, { "entropy": 6.173632621765137, "epoch": 3.35199076745528, "grad_norm": 0.9140625, "learning_rate": 0.0003910968976047749, "loss": 5.6723, "mean_token_accuracy": 0.19326019585132598, "num_tokens": 73622410.0, "step": 29045 }, { "entropy": 5.932807922363281, "epoch": 3.3525678015002884, "grad_norm": 1.3515625, "learning_rate": 0.0003910615487371465, "loss": 5.4816, "mean_token_accuracy": 0.21557075828313826, "num_tokens": 73634540.0, "step": 29050 }, { "entropy": 6.0248185157775875, "epoch": 3.3531448355452973, "grad_norm": 0.9296875, "learning_rate": 0.0003910261959658455, "loss": 5.674, "mean_token_accuracy": 0.2020629957318306, "num_tokens": 73646392.0, "step": 29055 }, { "entropy": 6.099936580657959, "epoch": 3.3537218695903057, "grad_norm": 0.96484375, "learning_rate": 0.0003909908392920611, "loss": 5.6675, "mean_token_accuracy": 0.20144849866628647, "num_tokens": 73657929.0, "step": 29060 }, { "entropy": 6.061476564407348, "epoch": 3.3542989036353146, "grad_norm": 0.890625, "learning_rate": 0.00039095547871698236, "loss": 5.6626, "mean_token_accuracy": 0.2021855190396309, "num_tokens": 73670190.0, "step": 29065 }, { "entropy": 6.048135280609131, "epoch": 3.354875937680323, "grad_norm": 0.9453125, "learning_rate": 0.00039092011424179875, "loss": 5.6314, "mean_token_accuracy": 0.20407300293445588, "num_tokens": 73682634.0, "step": 29070 }, { "entropy": 6.162403774261475, "epoch": 3.355452971725332, "grad_norm": 0.94140625, "learning_rate": 0.0003908847458676996, "loss": 5.6159, "mean_token_accuracy": 0.20729955285787582, "num_tokens": 73694627.0, "step": 29075 }, { "entropy": 6.160260820388794, "epoch": 3.3560300057703403, "grad_norm": 0.93359375, "learning_rate": 0.0003908493735958747, "loss": 5.8224, "mean_token_accuracy": 0.18829547613859177, "num_tokens": 73707618.0, "step": 29080 }, { "entropy": 6.041449451446534, "epoch": 3.356607039815349, "grad_norm": 1.0234375, "learning_rate": 0.00039081399742751363, "loss": 5.5586, "mean_token_accuracy": 0.20376075357198714, "num_tokens": 73719354.0, "step": 29085 }, { "entropy": 6.132792568206787, "epoch": 3.357184073860358, "grad_norm": 0.95703125, "learning_rate": 0.00039077861736380617, "loss": 5.6456, "mean_token_accuracy": 0.1984936699271202, "num_tokens": 73731586.0, "step": 29090 }, { "entropy": 6.12219123840332, "epoch": 3.3577611079053664, "grad_norm": 1.0625, "learning_rate": 0.00039074323340594256, "loss": 5.7533, "mean_token_accuracy": 0.19600808322429658, "num_tokens": 73745907.0, "step": 29095 }, { "entropy": 6.000311422348022, "epoch": 3.358338141950375, "grad_norm": 1.0703125, "learning_rate": 0.00039070784555511276, "loss": 5.5001, "mean_token_accuracy": 0.21606164574623107, "num_tokens": 73759458.0, "step": 29100 }, { "entropy": 6.140221643447876, "epoch": 3.3589151759953837, "grad_norm": 1.0, "learning_rate": 0.000390672453812507, "loss": 5.6417, "mean_token_accuracy": 0.20022647827863693, "num_tokens": 73771116.0, "step": 29105 }, { "entropy": 6.069024467468262, "epoch": 3.3594922100403926, "grad_norm": 0.953125, "learning_rate": 0.00039063705817931574, "loss": 5.7175, "mean_token_accuracy": 0.193771331012249, "num_tokens": 73784573.0, "step": 29110 }, { "entropy": 6.145127201080323, "epoch": 3.360069244085401, "grad_norm": 0.9765625, "learning_rate": 0.0003906016586567295, "loss": 5.6604, "mean_token_accuracy": 0.2027412474155426, "num_tokens": 73797402.0, "step": 29115 }, { "entropy": 6.223798513412476, "epoch": 3.36064627813041, "grad_norm": 0.828125, "learning_rate": 0.0003905662552459389, "loss": 5.7465, "mean_token_accuracy": 0.1938004106283188, "num_tokens": 73810924.0, "step": 29120 }, { "entropy": 6.11265230178833, "epoch": 3.3612233121754183, "grad_norm": 0.859375, "learning_rate": 0.00039053084794813466, "loss": 5.6766, "mean_token_accuracy": 0.1990928515791893, "num_tokens": 73824439.0, "step": 29125 }, { "entropy": 6.09653377532959, "epoch": 3.361800346220427, "grad_norm": 0.92578125, "learning_rate": 0.00039049543676450773, "loss": 5.6852, "mean_token_accuracy": 0.19784125685691833, "num_tokens": 73838322.0, "step": 29130 }, { "entropy": 6.145147848129272, "epoch": 3.3623773802654355, "grad_norm": 0.93359375, "learning_rate": 0.0003904600216962491, "loss": 5.6761, "mean_token_accuracy": 0.19254917800426483, "num_tokens": 73850598.0, "step": 29135 }, { "entropy": 6.116708850860595, "epoch": 3.3629544143104444, "grad_norm": 0.91796875, "learning_rate": 0.0003904246027445501, "loss": 5.6658, "mean_token_accuracy": 0.199068121612072, "num_tokens": 73863335.0, "step": 29140 }, { "entropy": 6.151806640625, "epoch": 3.363531448355453, "grad_norm": 0.9453125, "learning_rate": 0.00039038917991060187, "loss": 5.751, "mean_token_accuracy": 0.19046205133199692, "num_tokens": 73876638.0, "step": 29145 }, { "entropy": 6.110155344009399, "epoch": 3.3641084824004617, "grad_norm": 0.91015625, "learning_rate": 0.0003903537531955959, "loss": 5.7324, "mean_token_accuracy": 0.19594415575265883, "num_tokens": 73889640.0, "step": 29150 }, { "entropy": 6.109386587142945, "epoch": 3.36468551644547, "grad_norm": 0.94921875, "learning_rate": 0.0003903183226007237, "loss": 5.6865, "mean_token_accuracy": 0.2000272437930107, "num_tokens": 73901883.0, "step": 29155 }, { "entropy": 6.124618434906006, "epoch": 3.365262550490479, "grad_norm": 1.0, "learning_rate": 0.00039028288812717715, "loss": 5.6299, "mean_token_accuracy": 0.20795801728963853, "num_tokens": 73913717.0, "step": 29160 }, { "entropy": 6.07931547164917, "epoch": 3.365839584535488, "grad_norm": 1.2109375, "learning_rate": 0.0003902474497761478, "loss": 5.6274, "mean_token_accuracy": 0.19971617609262465, "num_tokens": 73928057.0, "step": 29165 }, { "entropy": 6.135083246231079, "epoch": 3.3664166185804962, "grad_norm": 0.8828125, "learning_rate": 0.00039021200754882774, "loss": 5.7324, "mean_token_accuracy": 0.19539804756641388, "num_tokens": 73941184.0, "step": 29170 }, { "entropy": 6.211198616027832, "epoch": 3.366993652625505, "grad_norm": 0.9296875, "learning_rate": 0.000390176561446409, "loss": 5.7556, "mean_token_accuracy": 0.18804158568382262, "num_tokens": 73953607.0, "step": 29175 }, { "entropy": 6.146896409988403, "epoch": 3.3675706866705135, "grad_norm": 0.9375, "learning_rate": 0.0003901411114700839, "loss": 5.6065, "mean_token_accuracy": 0.20742944926023482, "num_tokens": 73965238.0, "step": 29180 }, { "entropy": 6.093308782577514, "epoch": 3.3681477207155224, "grad_norm": 1.078125, "learning_rate": 0.0003901056576210447, "loss": 5.6361, "mean_token_accuracy": 0.19821404069662094, "num_tokens": 73979213.0, "step": 29185 }, { "entropy": 6.123352336883545, "epoch": 3.368724754760531, "grad_norm": 0.89453125, "learning_rate": 0.00039007019990048387, "loss": 5.6683, "mean_token_accuracy": 0.19590487331151962, "num_tokens": 73991852.0, "step": 29190 }, { "entropy": 6.160832500457763, "epoch": 3.3693017888055397, "grad_norm": 0.8828125, "learning_rate": 0.00039003473830959395, "loss": 5.7759, "mean_token_accuracy": 0.19638842344284058, "num_tokens": 74005244.0, "step": 29195 }, { "entropy": 5.995227432250976, "epoch": 3.369878822850548, "grad_norm": 1.0234375, "learning_rate": 0.00038999927284956784, "loss": 5.4528, "mean_token_accuracy": 0.21742042303085327, "num_tokens": 74018163.0, "step": 29200 }, { "entropy": 6.10787353515625, "epoch": 3.370455856895557, "grad_norm": 0.96484375, "learning_rate": 0.00038996380352159833, "loss": 5.7078, "mean_token_accuracy": 0.1898741155862808, "num_tokens": 74030857.0, "step": 29205 }, { "entropy": 6.068977880477905, "epoch": 3.3710328909405654, "grad_norm": 0.8671875, "learning_rate": 0.00038992833032687837, "loss": 5.5841, "mean_token_accuracy": 0.20431800335645675, "num_tokens": 74042659.0, "step": 29210 }, { "entropy": 6.213417482376099, "epoch": 3.371609924985574, "grad_norm": 0.87109375, "learning_rate": 0.000389892853266601, "loss": 5.7026, "mean_token_accuracy": 0.19185577929019929, "num_tokens": 74055412.0, "step": 29215 }, { "entropy": 6.12598557472229, "epoch": 3.3721869590305826, "grad_norm": 0.91796875, "learning_rate": 0.00038985737234195975, "loss": 5.6655, "mean_token_accuracy": 0.20019135177135466, "num_tokens": 74068160.0, "step": 29220 }, { "entropy": 6.122549533843994, "epoch": 3.3727639930755915, "grad_norm": 0.9375, "learning_rate": 0.00038982188755414774, "loss": 5.6403, "mean_token_accuracy": 0.2009674921631813, "num_tokens": 74080119.0, "step": 29225 }, { "entropy": 6.115718650817871, "epoch": 3.3733410271206, "grad_norm": 0.96484375, "learning_rate": 0.00038978639890435853, "loss": 5.7088, "mean_token_accuracy": 0.19333766251802445, "num_tokens": 74091768.0, "step": 29230 }, { "entropy": 6.140683126449585, "epoch": 3.3739180611656088, "grad_norm": 1.03125, "learning_rate": 0.0003897509063937859, "loss": 5.6983, "mean_token_accuracy": 0.1911182314157486, "num_tokens": 74104265.0, "step": 29235 }, { "entropy": 6.255893135070801, "epoch": 3.3744950952106176, "grad_norm": 0.9609375, "learning_rate": 0.0003897154100236235, "loss": 5.7419, "mean_token_accuracy": 0.19009674936532975, "num_tokens": 74116322.0, "step": 29240 }, { "entropy": 6.206576490402222, "epoch": 3.375072129255626, "grad_norm": 0.921875, "learning_rate": 0.0003896799097950653, "loss": 5.7686, "mean_token_accuracy": 0.18801714330911637, "num_tokens": 74127665.0, "step": 29245 }, { "entropy": 6.114025115966797, "epoch": 3.375649163300635, "grad_norm": 0.96875, "learning_rate": 0.0003896444057093052, "loss": 5.6666, "mean_token_accuracy": 0.1956649050116539, "num_tokens": 74140860.0, "step": 29250 }, { "entropy": 6.136866521835327, "epoch": 3.3762261973456433, "grad_norm": 0.98828125, "learning_rate": 0.00038960889776753756, "loss": 5.739, "mean_token_accuracy": 0.19141697138547897, "num_tokens": 74153049.0, "step": 29255 }, { "entropy": 6.2237043380737305, "epoch": 3.376803231390652, "grad_norm": 0.9609375, "learning_rate": 0.0003895733859709565, "loss": 5.7883, "mean_token_accuracy": 0.18805213123559952, "num_tokens": 74166701.0, "step": 29260 }, { "entropy": 6.154474544525146, "epoch": 3.3773802654356606, "grad_norm": 0.90234375, "learning_rate": 0.0003895378703207566, "loss": 5.6574, "mean_token_accuracy": 0.18983679711818696, "num_tokens": 74178995.0, "step": 29265 }, { "entropy": 6.068514966964722, "epoch": 3.3779572994806695, "grad_norm": 0.93359375, "learning_rate": 0.0003895023508181323, "loss": 5.601, "mean_token_accuracy": 0.20221629589796067, "num_tokens": 74191579.0, "step": 29270 }, { "entropy": 6.06135630607605, "epoch": 3.378534333525678, "grad_norm": 0.92578125, "learning_rate": 0.00038946682746427824, "loss": 5.629, "mean_token_accuracy": 0.2009536638855934, "num_tokens": 74206241.0, "step": 29275 }, { "entropy": 6.209331512451172, "epoch": 3.3791113675706868, "grad_norm": 0.8515625, "learning_rate": 0.00038943130026038934, "loss": 5.7095, "mean_token_accuracy": 0.1880050778388977, "num_tokens": 74218380.0, "step": 29280 }, { "entropy": 6.094493770599366, "epoch": 3.379688401615695, "grad_norm": 1.0703125, "learning_rate": 0.0003893957692076605, "loss": 5.5648, "mean_token_accuracy": 0.205158269405365, "num_tokens": 74230352.0, "step": 29285 }, { "entropy": 5.9807212352752686, "epoch": 3.380265435660704, "grad_norm": 0.8203125, "learning_rate": 0.00038936023430728684, "loss": 5.5468, "mean_token_accuracy": 0.2043629989027977, "num_tokens": 74242817.0, "step": 29290 }, { "entropy": 6.1047436714172365, "epoch": 3.3808424697057124, "grad_norm": 1.0, "learning_rate": 0.0003893246955604635, "loss": 5.6448, "mean_token_accuracy": 0.1972112163901329, "num_tokens": 74255937.0, "step": 29295 }, { "entropy": 6.0725905418396, "epoch": 3.3814195037507213, "grad_norm": 1.09375, "learning_rate": 0.0003892891529683857, "loss": 5.6046, "mean_token_accuracy": 0.2048858106136322, "num_tokens": 74269179.0, "step": 29300 }, { "entropy": 6.035662889480591, "epoch": 3.3819965377957297, "grad_norm": 0.91796875, "learning_rate": 0.00038925360653224906, "loss": 5.6314, "mean_token_accuracy": 0.20917874425649643, "num_tokens": 74281623.0, "step": 29305 }, { "entropy": 6.09220814704895, "epoch": 3.3825735718407386, "grad_norm": 0.9375, "learning_rate": 0.0003892180562532491, "loss": 5.6006, "mean_token_accuracy": 0.20383199900388718, "num_tokens": 74293079.0, "step": 29310 }, { "entropy": 6.18207106590271, "epoch": 3.3831506058857475, "grad_norm": 0.94140625, "learning_rate": 0.0003891825021325817, "loss": 5.7448, "mean_token_accuracy": 0.18867139369249344, "num_tokens": 74306034.0, "step": 29315 }, { "entropy": 6.109046602249146, "epoch": 3.383727639930756, "grad_norm": 1.265625, "learning_rate": 0.00038914694417144235, "loss": 5.6382, "mean_token_accuracy": 0.20215804725885392, "num_tokens": 74318576.0, "step": 29320 }, { "entropy": 6.099431085586548, "epoch": 3.3843046739757647, "grad_norm": 0.95703125, "learning_rate": 0.00038911138237102735, "loss": 5.6562, "mean_token_accuracy": 0.18943738639354707, "num_tokens": 74330856.0, "step": 29325 }, { "entropy": 6.1361926078796385, "epoch": 3.384881708020773, "grad_norm": 0.94921875, "learning_rate": 0.0003890758167325327, "loss": 5.6913, "mean_token_accuracy": 0.19551837146282197, "num_tokens": 74343488.0, "step": 29330 }, { "entropy": 6.176275968551636, "epoch": 3.385458742065782, "grad_norm": 0.9296875, "learning_rate": 0.00038904024725715453, "loss": 5.8028, "mean_token_accuracy": 0.1887669861316681, "num_tokens": 74356592.0, "step": 29335 }, { "entropy": 6.186302185058594, "epoch": 3.3860357761107904, "grad_norm": 0.921875, "learning_rate": 0.00038900467394608934, "loss": 5.6769, "mean_token_accuracy": 0.19546194225549698, "num_tokens": 74369987.0, "step": 29340 }, { "entropy": 6.161084699630737, "epoch": 3.3866128101557993, "grad_norm": 0.89453125, "learning_rate": 0.0003889690968005336, "loss": 5.6633, "mean_token_accuracy": 0.2024553120136261, "num_tokens": 74382186.0, "step": 29345 }, { "entropy": 6.038913774490356, "epoch": 3.3871898442008077, "grad_norm": 0.9375, "learning_rate": 0.00038893351582168387, "loss": 5.6172, "mean_token_accuracy": 0.20843385756015778, "num_tokens": 74395486.0, "step": 29350 }, { "entropy": 6.074850130081177, "epoch": 3.3877668782458166, "grad_norm": 0.953125, "learning_rate": 0.00038889793101073696, "loss": 5.6685, "mean_token_accuracy": 0.1960757628083229, "num_tokens": 74407641.0, "step": 29355 }, { "entropy": 6.1654150009155275, "epoch": 3.388343912290825, "grad_norm": 0.9375, "learning_rate": 0.00038886234236888966, "loss": 5.6902, "mean_token_accuracy": 0.19943959563970565, "num_tokens": 74420036.0, "step": 29360 }, { "entropy": 5.984434509277344, "epoch": 3.388920946335834, "grad_norm": 1.0859375, "learning_rate": 0.0003888267498973391, "loss": 5.5644, "mean_token_accuracy": 0.2148554190993309, "num_tokens": 74433682.0, "step": 29365 }, { "entropy": 6.1506205081939695, "epoch": 3.3894979803808427, "grad_norm": 0.89453125, "learning_rate": 0.0003887911535972823, "loss": 5.7739, "mean_token_accuracy": 0.19183535128831863, "num_tokens": 74445127.0, "step": 29370 }, { "entropy": 6.102530288696289, "epoch": 3.390075014425851, "grad_norm": 0.95703125, "learning_rate": 0.0003887555534699166, "loss": 5.5839, "mean_token_accuracy": 0.2062132939696312, "num_tokens": 74458445.0, "step": 29375 }, { "entropy": 6.091544198989868, "epoch": 3.3906520484708595, "grad_norm": 0.8515625, "learning_rate": 0.0003887199495164393, "loss": 5.6401, "mean_token_accuracy": 0.19999001622200013, "num_tokens": 74472025.0, "step": 29380 }, { "entropy": 6.178681373596191, "epoch": 3.3912290825158684, "grad_norm": 0.9296875, "learning_rate": 0.000388684341738048, "loss": 5.7175, "mean_token_accuracy": 0.19466122090816498, "num_tokens": 74485016.0, "step": 29385 }, { "entropy": 6.1808967113494875, "epoch": 3.3918061165608773, "grad_norm": 0.90234375, "learning_rate": 0.00038864873013594043, "loss": 5.7361, "mean_token_accuracy": 0.19160934090614318, "num_tokens": 74498762.0, "step": 29390 }, { "entropy": 6.145447015762329, "epoch": 3.3923831506058857, "grad_norm": 0.953125, "learning_rate": 0.0003886131147113143, "loss": 5.7773, "mean_token_accuracy": 0.18902845233678817, "num_tokens": 74511864.0, "step": 29395 }, { "entropy": 6.1231317043304445, "epoch": 3.3929601846508946, "grad_norm": 0.921875, "learning_rate": 0.0003885774954653673, "loss": 5.679, "mean_token_accuracy": 0.1956196904182434, "num_tokens": 74524887.0, "step": 29400 }, { "entropy": 6.140392446517945, "epoch": 3.393537218695903, "grad_norm": 0.91796875, "learning_rate": 0.0003885418723992977, "loss": 5.6012, "mean_token_accuracy": 0.2015588954091072, "num_tokens": 74537490.0, "step": 29405 }, { "entropy": 6.019869327545166, "epoch": 3.394114252740912, "grad_norm": 0.953125, "learning_rate": 0.0003885062455143038, "loss": 5.5171, "mean_token_accuracy": 0.21081402599811555, "num_tokens": 74550027.0, "step": 29410 }, { "entropy": 6.007146310806275, "epoch": 3.3946912867859202, "grad_norm": 1.0, "learning_rate": 0.00038847061481158356, "loss": 5.5995, "mean_token_accuracy": 0.2112478122115135, "num_tokens": 74562318.0, "step": 29415 }, { "entropy": 6.156685495376587, "epoch": 3.395268320830929, "grad_norm": 0.9296875, "learning_rate": 0.00038843498029233553, "loss": 5.7231, "mean_token_accuracy": 0.19226054549217225, "num_tokens": 74575316.0, "step": 29420 }, { "entropy": 6.137768363952636, "epoch": 3.3958453548759375, "grad_norm": 1.0078125, "learning_rate": 0.0003883993419577584, "loss": 5.6658, "mean_token_accuracy": 0.20140229314565658, "num_tokens": 74589043.0, "step": 29425 }, { "entropy": 5.976077508926392, "epoch": 3.3964223889209464, "grad_norm": 0.8984375, "learning_rate": 0.0003883636998090507, "loss": 5.5387, "mean_token_accuracy": 0.2075169414281845, "num_tokens": 74602796.0, "step": 29430 }, { "entropy": 6.112657165527343, "epoch": 3.396999422965955, "grad_norm": 0.93359375, "learning_rate": 0.00038832805384741124, "loss": 5.6386, "mean_token_accuracy": 0.20106805860996246, "num_tokens": 74615987.0, "step": 29435 }, { "entropy": 6.195538330078125, "epoch": 3.3975764570109637, "grad_norm": 0.91015625, "learning_rate": 0.0003882924040740389, "loss": 5.7369, "mean_token_accuracy": 0.18946260064840317, "num_tokens": 74627940.0, "step": 29440 }, { "entropy": 6.184897804260254, "epoch": 3.3981534910559725, "grad_norm": 0.890625, "learning_rate": 0.000388256750490133, "loss": 5.7017, "mean_token_accuracy": 0.1875414788722992, "num_tokens": 74641977.0, "step": 29445 }, { "entropy": 6.149797439575195, "epoch": 3.398730525100981, "grad_norm": 0.8828125, "learning_rate": 0.0003882210930968924, "loss": 5.6634, "mean_token_accuracy": 0.19859969913959502, "num_tokens": 74655119.0, "step": 29450 }, { "entropy": 6.124272012710572, "epoch": 3.3993075591459894, "grad_norm": 0.921875, "learning_rate": 0.0003881854318955167, "loss": 5.7287, "mean_token_accuracy": 0.19595022797584533, "num_tokens": 74667548.0, "step": 29455 }, { "entropy": 6.10913667678833, "epoch": 3.3998845931909982, "grad_norm": 0.9296875, "learning_rate": 0.00038814976688720523, "loss": 5.6325, "mean_token_accuracy": 0.20080644637346268, "num_tokens": 74679365.0, "step": 29460 }, { "entropy": 6.120306587219238, "epoch": 3.400461627236007, "grad_norm": 0.9296875, "learning_rate": 0.00038811409807315746, "loss": 5.684, "mean_token_accuracy": 0.19400031715631486, "num_tokens": 74690713.0, "step": 29465 }, { "entropy": 6.083793354034424, "epoch": 3.4010386612810155, "grad_norm": 0.8984375, "learning_rate": 0.0003880784254545732, "loss": 5.5889, "mean_token_accuracy": 0.20644036084413528, "num_tokens": 74703106.0, "step": 29470 }, { "entropy": 6.129297351837158, "epoch": 3.4016156953260244, "grad_norm": 0.91796875, "learning_rate": 0.00038804274903265226, "loss": 5.7176, "mean_token_accuracy": 0.19394056349992753, "num_tokens": 74715602.0, "step": 29475 }, { "entropy": 6.147923469543457, "epoch": 3.402192729371033, "grad_norm": 0.921875, "learning_rate": 0.0003880070688085947, "loss": 5.6516, "mean_token_accuracy": 0.19438060671091079, "num_tokens": 74727842.0, "step": 29480 }, { "entropy": 6.100360679626465, "epoch": 3.4027697634160416, "grad_norm": 0.97265625, "learning_rate": 0.0003879713847836004, "loss": 5.635, "mean_token_accuracy": 0.2019089177250862, "num_tokens": 74740480.0, "step": 29485 }, { "entropy": 5.960062074661255, "epoch": 3.40334679746105, "grad_norm": 0.8984375, "learning_rate": 0.00038793569695886964, "loss": 5.5248, "mean_token_accuracy": 0.20709266662597656, "num_tokens": 74753939.0, "step": 29490 }, { "entropy": 6.057261514663696, "epoch": 3.403923831506059, "grad_norm": 0.94140625, "learning_rate": 0.000387900005335603, "loss": 5.5106, "mean_token_accuracy": 0.20501282662153245, "num_tokens": 74767055.0, "step": 29495 }, { "entropy": 6.056798315048217, "epoch": 3.4045008655510673, "grad_norm": 0.8984375, "learning_rate": 0.00038786430991500064, "loss": 5.5768, "mean_token_accuracy": 0.2034056305885315, "num_tokens": 74779927.0, "step": 29500 }, { "entropy": 6.104568958282471, "epoch": 3.405077899596076, "grad_norm": 1.0078125, "learning_rate": 0.00038782861069826323, "loss": 5.7033, "mean_token_accuracy": 0.19332396537065505, "num_tokens": 74792845.0, "step": 29505 }, { "entropy": 6.098080444335937, "epoch": 3.4056549336410846, "grad_norm": 0.95703125, "learning_rate": 0.0003877929076865917, "loss": 5.6164, "mean_token_accuracy": 0.2020713523030281, "num_tokens": 74807288.0, "step": 29510 }, { "entropy": 6.210349178314209, "epoch": 3.4062319676860935, "grad_norm": 0.91015625, "learning_rate": 0.00038775720088118665, "loss": 5.7326, "mean_token_accuracy": 0.19356990307569505, "num_tokens": 74819537.0, "step": 29515 }, { "entropy": 6.173000812530518, "epoch": 3.4068090017311023, "grad_norm": 1.0703125, "learning_rate": 0.00038772149028324916, "loss": 5.7539, "mean_token_accuracy": 0.1912834197282791, "num_tokens": 74830890.0, "step": 29520 }, { "entropy": 6.109610748291016, "epoch": 3.4073860357761108, "grad_norm": 0.921875, "learning_rate": 0.00038768577589398033, "loss": 5.6735, "mean_token_accuracy": 0.204718779027462, "num_tokens": 74843286.0, "step": 29525 }, { "entropy": 6.098098182678223, "epoch": 3.4079630698211196, "grad_norm": 0.94140625, "learning_rate": 0.00038765005771458145, "loss": 5.6208, "mean_token_accuracy": 0.20144327878952026, "num_tokens": 74854743.0, "step": 29530 }, { "entropy": 6.1022031784057615, "epoch": 3.408540103866128, "grad_norm": 0.89453125, "learning_rate": 0.0003876143357462538, "loss": 5.651, "mean_token_accuracy": 0.19274944067001343, "num_tokens": 74867031.0, "step": 29535 }, { "entropy": 6.085686588287354, "epoch": 3.409117137911137, "grad_norm": 0.9296875, "learning_rate": 0.0003875786099901989, "loss": 5.5849, "mean_token_accuracy": 0.20769606679677963, "num_tokens": 74880045.0, "step": 29540 }, { "entropy": 6.096614694595337, "epoch": 3.4096941719561453, "grad_norm": 1.0078125, "learning_rate": 0.00038754288044761835, "loss": 5.7055, "mean_token_accuracy": 0.1931267186999321, "num_tokens": 74893671.0, "step": 29545 }, { "entropy": 6.17376971244812, "epoch": 3.410271206001154, "grad_norm": 1.015625, "learning_rate": 0.00038750714711971397, "loss": 5.7209, "mean_token_accuracy": 0.1895170271396637, "num_tokens": 74906580.0, "step": 29550 }, { "entropy": 6.1414618492126465, "epoch": 3.4108482400461626, "grad_norm": 0.86328125, "learning_rate": 0.00038747141000768754, "loss": 5.7186, "mean_token_accuracy": 0.1929113507270813, "num_tokens": 74919540.0, "step": 29555 }, { "entropy": 6.073526620864868, "epoch": 3.4114252740911715, "grad_norm": 0.984375, "learning_rate": 0.00038743566911274117, "loss": 5.6117, "mean_token_accuracy": 0.19729551821947097, "num_tokens": 74930931.0, "step": 29560 }, { "entropy": 6.047491931915284, "epoch": 3.41200230813618, "grad_norm": 0.98046875, "learning_rate": 0.00038739992443607686, "loss": 5.6043, "mean_token_accuracy": 0.20607941150665282, "num_tokens": 74943531.0, "step": 29565 }, { "entropy": 6.127089881896973, "epoch": 3.4125793421811887, "grad_norm": 0.90625, "learning_rate": 0.00038736417597889694, "loss": 5.7204, "mean_token_accuracy": 0.19538949579000472, "num_tokens": 74955808.0, "step": 29570 }, { "entropy": 6.150683736801147, "epoch": 3.413156376226197, "grad_norm": 0.9765625, "learning_rate": 0.0003873284237424038, "loss": 5.6547, "mean_token_accuracy": 0.2048019826412201, "num_tokens": 74967412.0, "step": 29575 }, { "entropy": 6.09517731666565, "epoch": 3.413733410271206, "grad_norm": 1.015625, "learning_rate": 0.00038729266772779994, "loss": 5.6447, "mean_token_accuracy": 0.19893274009227752, "num_tokens": 74979889.0, "step": 29580 }, { "entropy": 6.106925916671753, "epoch": 3.4143104443162144, "grad_norm": 0.94921875, "learning_rate": 0.00038725690793628794, "loss": 5.6048, "mean_token_accuracy": 0.20259840935468673, "num_tokens": 74992550.0, "step": 29585 }, { "entropy": 6.088739490509033, "epoch": 3.4148874783612233, "grad_norm": 0.96875, "learning_rate": 0.00038722114436907056, "loss": 5.6795, "mean_token_accuracy": 0.19715912640094757, "num_tokens": 75005940.0, "step": 29590 }, { "entropy": 6.081855726242066, "epoch": 3.415464512406232, "grad_norm": 0.9140625, "learning_rate": 0.0003871853770273508, "loss": 5.6012, "mean_token_accuracy": 0.198858542740345, "num_tokens": 75018102.0, "step": 29595 }, { "entropy": 6.134600687026977, "epoch": 3.4160415464512406, "grad_norm": 0.96484375, "learning_rate": 0.0003871496059123316, "loss": 5.6571, "mean_token_accuracy": 0.19920790195465088, "num_tokens": 75031192.0, "step": 29600 }, { "entropy": 6.148057126998902, "epoch": 3.4166185804962494, "grad_norm": 0.93359375, "learning_rate": 0.0003871138310252161, "loss": 5.7188, "mean_token_accuracy": 0.20085345953702927, "num_tokens": 75042791.0, "step": 29605 }, { "entropy": 6.135023784637451, "epoch": 3.417195614541258, "grad_norm": 0.93359375, "learning_rate": 0.0003870780523672075, "loss": 5.6842, "mean_token_accuracy": 0.19695188999176025, "num_tokens": 75055649.0, "step": 29610 }, { "entropy": 6.0502818584442135, "epoch": 3.4177726485862667, "grad_norm": 0.90234375, "learning_rate": 0.0003870422699395094, "loss": 5.6054, "mean_token_accuracy": 0.20833633989095687, "num_tokens": 75068209.0, "step": 29615 }, { "entropy": 6.117885112762451, "epoch": 3.418349682631275, "grad_norm": 0.9609375, "learning_rate": 0.00038700648374332514, "loss": 5.6231, "mean_token_accuracy": 0.2067483514547348, "num_tokens": 75080606.0, "step": 29620 }, { "entropy": 6.151182460784912, "epoch": 3.418926716676284, "grad_norm": 0.93359375, "learning_rate": 0.0003869706937798585, "loss": 5.7085, "mean_token_accuracy": 0.19779286980628968, "num_tokens": 75094585.0, "step": 29625 }, { "entropy": 6.175467395782471, "epoch": 3.4195037507212924, "grad_norm": 0.91796875, "learning_rate": 0.00038693490005031316, "loss": 5.765, "mean_token_accuracy": 0.19431446641683578, "num_tokens": 75106953.0, "step": 29630 }, { "entropy": 6.1615156650543215, "epoch": 3.4200807847663013, "grad_norm": 0.875, "learning_rate": 0.00038689910255589304, "loss": 5.7342, "mean_token_accuracy": 0.18868091106414794, "num_tokens": 75119506.0, "step": 29635 }, { "entropy": 6.085178852081299, "epoch": 3.4206578188113097, "grad_norm": 0.97265625, "learning_rate": 0.00038686330129780223, "loss": 5.5538, "mean_token_accuracy": 0.20220239609479904, "num_tokens": 75132219.0, "step": 29640 }, { "entropy": 6.153129911422729, "epoch": 3.4212348528563186, "grad_norm": 0.8984375, "learning_rate": 0.00038682749627724485, "loss": 5.7022, "mean_token_accuracy": 0.19907985478639603, "num_tokens": 75143880.0, "step": 29645 }, { "entropy": 6.052488231658936, "epoch": 3.4218118869013274, "grad_norm": 0.9453125, "learning_rate": 0.0003867916874954251, "loss": 5.5956, "mean_token_accuracy": 0.20786201804876328, "num_tokens": 75156673.0, "step": 29650 }, { "entropy": 6.104920434951782, "epoch": 3.422388920946336, "grad_norm": 0.92578125, "learning_rate": 0.0003867558749535475, "loss": 5.6067, "mean_token_accuracy": 0.19818609654903413, "num_tokens": 75168846.0, "step": 29655 }, { "entropy": 6.153359460830688, "epoch": 3.4229659549913443, "grad_norm": 0.9765625, "learning_rate": 0.0003867200586528166, "loss": 5.6826, "mean_token_accuracy": 0.2006438657641411, "num_tokens": 75181046.0, "step": 29660 }, { "entropy": 6.0886023998260494, "epoch": 3.423542989036353, "grad_norm": 0.90234375, "learning_rate": 0.00038668423859443705, "loss": 5.622, "mean_token_accuracy": 0.20443181544542313, "num_tokens": 75193266.0, "step": 29665 }, { "entropy": 6.017653083801269, "epoch": 3.424120023081362, "grad_norm": 1.03125, "learning_rate": 0.0003866484147796136, "loss": 5.5372, "mean_token_accuracy": 0.20884893089532852, "num_tokens": 75204267.0, "step": 29670 }, { "entropy": 6.119679880142212, "epoch": 3.4246970571263704, "grad_norm": 0.92578125, "learning_rate": 0.00038661258720955105, "loss": 5.7099, "mean_token_accuracy": 0.19929271340370178, "num_tokens": 75216932.0, "step": 29675 }, { "entropy": 6.08361177444458, "epoch": 3.4252740911713793, "grad_norm": 1.015625, "learning_rate": 0.00038657675588545467, "loss": 5.5936, "mean_token_accuracy": 0.20028530210256576, "num_tokens": 75229084.0, "step": 29680 }, { "entropy": 6.047318172454834, "epoch": 3.4258511252163877, "grad_norm": 0.95703125, "learning_rate": 0.0003865409208085295, "loss": 5.6856, "mean_token_accuracy": 0.197913059592247, "num_tokens": 75241356.0, "step": 29685 }, { "entropy": 6.052640295028686, "epoch": 3.4264281592613965, "grad_norm": 0.94921875, "learning_rate": 0.00038650508197998095, "loss": 5.6026, "mean_token_accuracy": 0.204889939725399, "num_tokens": 75252768.0, "step": 29690 }, { "entropy": 6.075566387176513, "epoch": 3.427005193306405, "grad_norm": 0.98828125, "learning_rate": 0.0003864692394010143, "loss": 5.6342, "mean_token_accuracy": 0.20133931785821915, "num_tokens": 75265517.0, "step": 29695 }, { "entropy": 6.2092978954315186, "epoch": 3.427582227351414, "grad_norm": 1.0, "learning_rate": 0.00038643339307283507, "loss": 5.8072, "mean_token_accuracy": 0.18519458025693894, "num_tokens": 75278191.0, "step": 29700 }, { "entropy": 6.098193979263305, "epoch": 3.4281592613964222, "grad_norm": 1.0390625, "learning_rate": 0.00038639754299664913, "loss": 5.5716, "mean_token_accuracy": 0.2043537065386772, "num_tokens": 75290794.0, "step": 29705 }, { "entropy": 6.1307285785675045, "epoch": 3.428736295441431, "grad_norm": 0.90625, "learning_rate": 0.00038636168917366214, "loss": 5.729, "mean_token_accuracy": 0.19462745487689972, "num_tokens": 75303438.0, "step": 29710 }, { "entropy": 6.06499490737915, "epoch": 3.4293133294864395, "grad_norm": 0.94140625, "learning_rate": 0.00038632583160508, "loss": 5.6315, "mean_token_accuracy": 0.19745396375656127, "num_tokens": 75317336.0, "step": 29715 }, { "entropy": 6.164554691314697, "epoch": 3.4298903635314484, "grad_norm": 0.95703125, "learning_rate": 0.00038628997029210887, "loss": 5.6883, "mean_token_accuracy": 0.19707987010478972, "num_tokens": 75328952.0, "step": 29720 }, { "entropy": 6.189921903610229, "epoch": 3.4304673975764572, "grad_norm": 0.9921875, "learning_rate": 0.00038625410523595487, "loss": 5.7309, "mean_token_accuracy": 0.1925668701529503, "num_tokens": 75341116.0, "step": 29725 }, { "entropy": 6.115351819992066, "epoch": 3.4310444316214657, "grad_norm": 0.875, "learning_rate": 0.00038621823643782426, "loss": 5.715, "mean_token_accuracy": 0.19497351348400116, "num_tokens": 75354150.0, "step": 29730 }, { "entropy": 6.127152633666992, "epoch": 3.431621465666474, "grad_norm": 0.9765625, "learning_rate": 0.0003861823638989235, "loss": 5.6333, "mean_token_accuracy": 0.20510401725769042, "num_tokens": 75367809.0, "step": 29735 }, { "entropy": 5.998108196258545, "epoch": 3.432198499711483, "grad_norm": 1.0078125, "learning_rate": 0.00038614648762045923, "loss": 5.5162, "mean_token_accuracy": 0.21514474004507064, "num_tokens": 75380536.0, "step": 29740 }, { "entropy": 6.008195495605468, "epoch": 3.432775533756492, "grad_norm": 0.8984375, "learning_rate": 0.000386110607603638, "loss": 5.5644, "mean_token_accuracy": 0.2020410791039467, "num_tokens": 75392994.0, "step": 29745 }, { "entropy": 6.11928014755249, "epoch": 3.4333525678015, "grad_norm": 0.95703125, "learning_rate": 0.0003860747238496667, "loss": 5.6601, "mean_token_accuracy": 0.19896188378334045, "num_tokens": 75405344.0, "step": 29750 }, { "entropy": 6.146852827072143, "epoch": 3.433929601846509, "grad_norm": 0.91015625, "learning_rate": 0.00038603883635975224, "loss": 5.7394, "mean_token_accuracy": 0.1926712363958359, "num_tokens": 75418059.0, "step": 29755 }, { "entropy": 6.156238651275634, "epoch": 3.4345066358915175, "grad_norm": 0.9296875, "learning_rate": 0.0003860029451351016, "loss": 5.7103, "mean_token_accuracy": 0.19851579368114472, "num_tokens": 75431316.0, "step": 29760 }, { "entropy": 6.127622365951538, "epoch": 3.4350836699365264, "grad_norm": 0.9375, "learning_rate": 0.00038596705017692216, "loss": 5.6404, "mean_token_accuracy": 0.200221648812294, "num_tokens": 75443542.0, "step": 29765 }, { "entropy": 6.101916790008545, "epoch": 3.435660703981535, "grad_norm": 0.94921875, "learning_rate": 0.00038593115148642107, "loss": 5.6967, "mean_token_accuracy": 0.19485777020454406, "num_tokens": 75455422.0, "step": 29770 }, { "entropy": 6.04071307182312, "epoch": 3.4362377380265436, "grad_norm": 0.91796875, "learning_rate": 0.00038589524906480576, "loss": 5.6359, "mean_token_accuracy": 0.20377057790756226, "num_tokens": 75468702.0, "step": 29775 }, { "entropy": 6.078157997131347, "epoch": 3.436814772071552, "grad_norm": 0.94140625, "learning_rate": 0.0003858593429132838, "loss": 5.5813, "mean_token_accuracy": 0.2084820792078972, "num_tokens": 75480217.0, "step": 29780 }, { "entropy": 6.1541829109191895, "epoch": 3.437391806116561, "grad_norm": 0.91015625, "learning_rate": 0.00038582343303306306, "loss": 5.6918, "mean_token_accuracy": 0.1958676680922508, "num_tokens": 75492826.0, "step": 29785 }, { "entropy": 6.1325288772583, "epoch": 3.4379688401615693, "grad_norm": 0.9140625, "learning_rate": 0.0003857875194253511, "loss": 5.7224, "mean_token_accuracy": 0.19690243005752564, "num_tokens": 75504398.0, "step": 29790 }, { "entropy": 6.113526630401611, "epoch": 3.438545874206578, "grad_norm": 0.90234375, "learning_rate": 0.0003857516020913559, "loss": 5.6434, "mean_token_accuracy": 0.19955738335847856, "num_tokens": 75516028.0, "step": 29795 }, { "entropy": 6.1810108661651615, "epoch": 3.439122908251587, "grad_norm": 0.90234375, "learning_rate": 0.00038571568103228565, "loss": 5.6899, "mean_token_accuracy": 0.20068355053663253, "num_tokens": 75528811.0, "step": 29800 }, { "entropy": 6.084721946716309, "epoch": 3.4396999422965955, "grad_norm": 1.1171875, "learning_rate": 0.0003856797562493485, "loss": 5.579, "mean_token_accuracy": 0.2105577364563942, "num_tokens": 75542784.0, "step": 29805 }, { "entropy": 6.183552837371826, "epoch": 3.4402769763416043, "grad_norm": 0.97265625, "learning_rate": 0.0003856438277437527, "loss": 5.7185, "mean_token_accuracy": 0.1952583149075508, "num_tokens": 75555295.0, "step": 29810 }, { "entropy": 6.1390893936157225, "epoch": 3.4408540103866128, "grad_norm": 0.953125, "learning_rate": 0.00038560789551670663, "loss": 5.7117, "mean_token_accuracy": 0.1996374875307083, "num_tokens": 75568234.0, "step": 29815 }, { "entropy": 6.114632940292358, "epoch": 3.4414310444316216, "grad_norm": 0.9453125, "learning_rate": 0.00038557195956941896, "loss": 5.6728, "mean_token_accuracy": 0.19620812833309173, "num_tokens": 75580865.0, "step": 29820 }, { "entropy": 6.187064981460571, "epoch": 3.44200807847663, "grad_norm": 1.0546875, "learning_rate": 0.00038553601990309845, "loss": 5.7315, "mean_token_accuracy": 0.18760953694581986, "num_tokens": 75593679.0, "step": 29825 }, { "entropy": 6.2334929466247555, "epoch": 3.442585112521639, "grad_norm": 0.89453125, "learning_rate": 0.00038550007651895376, "loss": 5.7552, "mean_token_accuracy": 0.19637635201215745, "num_tokens": 75607061.0, "step": 29830 }, { "entropy": 6.1914153575897215, "epoch": 3.4431621465666473, "grad_norm": 0.9296875, "learning_rate": 0.00038546412941819385, "loss": 5.6557, "mean_token_accuracy": 0.19760273694992064, "num_tokens": 75619729.0, "step": 29835 }, { "entropy": 6.212173795700073, "epoch": 3.443739180611656, "grad_norm": 0.98828125, "learning_rate": 0.0003854281786020279, "loss": 5.7283, "mean_token_accuracy": 0.18926496505737306, "num_tokens": 75631942.0, "step": 29840 }, { "entropy": 6.124419403076172, "epoch": 3.4443162146566646, "grad_norm": 0.94140625, "learning_rate": 0.00038539222407166495, "loss": 5.6556, "mean_token_accuracy": 0.2042503371834755, "num_tokens": 75646181.0, "step": 29845 }, { "entropy": 6.0467602729797365, "epoch": 3.4448932487016735, "grad_norm": 1.0234375, "learning_rate": 0.0003853562658283144, "loss": 5.5389, "mean_token_accuracy": 0.2085070088505745, "num_tokens": 75657808.0, "step": 29850 }, { "entropy": 6.101883792877198, "epoch": 3.445470282746682, "grad_norm": 0.8984375, "learning_rate": 0.00038532030387318565, "loss": 5.6297, "mean_token_accuracy": 0.2070928171277046, "num_tokens": 75670166.0, "step": 29855 }, { "entropy": 6.158042001724243, "epoch": 3.4460473167916907, "grad_norm": 0.97265625, "learning_rate": 0.00038528433820748833, "loss": 5.7725, "mean_token_accuracy": 0.19122541099786758, "num_tokens": 75682511.0, "step": 29860 }, { "entropy": 6.241187047958374, "epoch": 3.446624350836699, "grad_norm": 0.99609375, "learning_rate": 0.00038524836883243197, "loss": 5.7343, "mean_token_accuracy": 0.19922872483730317, "num_tokens": 75694785.0, "step": 29865 }, { "entropy": 6.171201515197754, "epoch": 3.447201384881708, "grad_norm": 0.9453125, "learning_rate": 0.00038521239574922664, "loss": 5.7396, "mean_token_accuracy": 0.19373102933168412, "num_tokens": 75707908.0, "step": 29870 }, { "entropy": 6.118019390106201, "epoch": 3.447778418926717, "grad_norm": 0.9296875, "learning_rate": 0.000385176418959082, "loss": 5.6314, "mean_token_accuracy": 0.1992066130042076, "num_tokens": 75720733.0, "step": 29875 }, { "entropy": 6.058538627624512, "epoch": 3.4483554529717253, "grad_norm": 0.92578125, "learning_rate": 0.00038514043846320825, "loss": 5.5394, "mean_token_accuracy": 0.20247066915035247, "num_tokens": 75732511.0, "step": 29880 }, { "entropy": 6.078581619262695, "epoch": 3.448932487016734, "grad_norm": 0.921875, "learning_rate": 0.00038510445426281556, "loss": 5.6344, "mean_token_accuracy": 0.2075391560792923, "num_tokens": 75744949.0, "step": 29885 }, { "entropy": 6.052122259140015, "epoch": 3.4495095210617426, "grad_norm": 0.94921875, "learning_rate": 0.0003850684663591143, "loss": 5.6593, "mean_token_accuracy": 0.20081855803728105, "num_tokens": 75758049.0, "step": 29890 }, { "entropy": 6.11500358581543, "epoch": 3.4500865551067514, "grad_norm": 0.953125, "learning_rate": 0.0003850324747533148, "loss": 5.5933, "mean_token_accuracy": 0.20215218067169188, "num_tokens": 75772242.0, "step": 29895 }, { "entropy": 6.0574428081512455, "epoch": 3.45066358915176, "grad_norm": 0.9609375, "learning_rate": 0.0003849964794466277, "loss": 5.6042, "mean_token_accuracy": 0.20257695019245148, "num_tokens": 75784711.0, "step": 29900 }, { "entropy": 6.184817266464234, "epoch": 3.4512406231967687, "grad_norm": 0.8984375, "learning_rate": 0.0003849604804402636, "loss": 5.7421, "mean_token_accuracy": 0.18540485352277755, "num_tokens": 75796757.0, "step": 29905 }, { "entropy": 6.119535970687866, "epoch": 3.451817657241777, "grad_norm": 0.9375, "learning_rate": 0.00038492447773543344, "loss": 5.7091, "mean_token_accuracy": 0.19726979732513428, "num_tokens": 75810195.0, "step": 29910 }, { "entropy": 6.145711421966553, "epoch": 3.452394691286786, "grad_norm": 1.1015625, "learning_rate": 0.000384888471333348, "loss": 5.6758, "mean_token_accuracy": 0.20566664785146713, "num_tokens": 75822645.0, "step": 29915 }, { "entropy": 6.099514055252075, "epoch": 3.4529717253317944, "grad_norm": 0.953125, "learning_rate": 0.0003848524612352184, "loss": 5.6856, "mean_token_accuracy": 0.1920801430940628, "num_tokens": 75834277.0, "step": 29920 }, { "entropy": 6.133346652984619, "epoch": 3.4535487593768033, "grad_norm": 0.91015625, "learning_rate": 0.0003848164474422559, "loss": 5.6784, "mean_token_accuracy": 0.19923868924379348, "num_tokens": 75846111.0, "step": 29925 }, { "entropy": 6.224630117416382, "epoch": 3.4541257934218117, "grad_norm": 0.984375, "learning_rate": 0.00038478042995567175, "loss": 5.7037, "mean_token_accuracy": 0.19568544030189514, "num_tokens": 75858453.0, "step": 29930 }, { "entropy": 6.14057502746582, "epoch": 3.4547028274668206, "grad_norm": 0.890625, "learning_rate": 0.0003847444087766773, "loss": 5.7376, "mean_token_accuracy": 0.19105585813522338, "num_tokens": 75870127.0, "step": 29935 }, { "entropy": 6.026944828033447, "epoch": 3.455279861511829, "grad_norm": 1.03125, "learning_rate": 0.00038470838390648423, "loss": 5.5559, "mean_token_accuracy": 0.20011749863624573, "num_tokens": 75883320.0, "step": 29940 }, { "entropy": 6.069692182540893, "epoch": 3.455856895556838, "grad_norm": 0.9140625, "learning_rate": 0.00038467235534630405, "loss": 5.6433, "mean_token_accuracy": 0.1909273758530617, "num_tokens": 75897433.0, "step": 29945 }, { "entropy": 6.154717588424683, "epoch": 3.4564339296018467, "grad_norm": 0.92578125, "learning_rate": 0.0003846363230973488, "loss": 5.6346, "mean_token_accuracy": 0.1993203043937683, "num_tokens": 75909919.0, "step": 29950 }, { "entropy": 6.145422649383545, "epoch": 3.457010963646855, "grad_norm": 0.953125, "learning_rate": 0.00038460028716083024, "loss": 5.7148, "mean_token_accuracy": 0.198944990336895, "num_tokens": 75923101.0, "step": 29955 }, { "entropy": 6.022760200500488, "epoch": 3.457587997691864, "grad_norm": 0.9140625, "learning_rate": 0.0003845642475379605, "loss": 5.6163, "mean_token_accuracy": 0.19617946296930314, "num_tokens": 75936331.0, "step": 29960 }, { "entropy": 6.14332947731018, "epoch": 3.4581650317368724, "grad_norm": 1.0390625, "learning_rate": 0.0003845282042299516, "loss": 5.5985, "mean_token_accuracy": 0.20384318083524705, "num_tokens": 75947921.0, "step": 29965 }, { "entropy": 6.136355543136597, "epoch": 3.4587420657818813, "grad_norm": 0.9453125, "learning_rate": 0.0003844921572380161, "loss": 5.62, "mean_token_accuracy": 0.1979285404086113, "num_tokens": 75960454.0, "step": 29970 }, { "entropy": 6.107445621490479, "epoch": 3.4593190998268897, "grad_norm": 1.140625, "learning_rate": 0.0003844561065633662, "loss": 5.7218, "mean_token_accuracy": 0.19018979072570802, "num_tokens": 75972909.0, "step": 29975 }, { "entropy": 6.128451633453369, "epoch": 3.4598961338718985, "grad_norm": 0.84375, "learning_rate": 0.0003844200522072145, "loss": 5.6193, "mean_token_accuracy": 0.1998048573732376, "num_tokens": 75985360.0, "step": 29980 }, { "entropy": 6.137365913391113, "epoch": 3.460473167916907, "grad_norm": 0.92578125, "learning_rate": 0.0003843839941707738, "loss": 5.5964, "mean_token_accuracy": 0.2057602271437645, "num_tokens": 75996434.0, "step": 29985 }, { "entropy": 6.055975151062012, "epoch": 3.461050201961916, "grad_norm": 0.921875, "learning_rate": 0.0003843479324552567, "loss": 5.6117, "mean_token_accuracy": 0.19530674815177917, "num_tokens": 76008721.0, "step": 29990 }, { "entropy": 6.133390188217163, "epoch": 3.4616272360069242, "grad_norm": 0.9765625, "learning_rate": 0.00038431186706187626, "loss": 5.6959, "mean_token_accuracy": 0.19397947639226915, "num_tokens": 76021775.0, "step": 29995 }, { "entropy": 6.104957056045532, "epoch": 3.462204270051933, "grad_norm": 1.0390625, "learning_rate": 0.00038427579799184546, "loss": 5.6331, "mean_token_accuracy": 0.20255368947982788, "num_tokens": 76034607.0, "step": 30000 }, { "epoch": 3.462204270051933, "eval_entropy": 5.971964979700518, "eval_loss": 5.795499801635742, "eval_mean_token_accuracy": 0.2002593917851086, "eval_num_tokens": 76034607.0, "eval_runtime": 22.8734, "eval_samples_per_second": 1230.076, "eval_steps_per_second": 153.76, "step": 30000 }, { "entropy": 6.116971206665039, "epoch": 3.462781304096942, "grad_norm": 0.9609375, "learning_rate": 0.0003842397252463774, "loss": 5.6857, "mean_token_accuracy": 0.19487107545137405, "num_tokens": 76048694.0, "step": 30005 }, { "entropy": 6.163836860656739, "epoch": 3.4633583381419504, "grad_norm": 0.9296875, "learning_rate": 0.0003842036488266856, "loss": 5.63, "mean_token_accuracy": 0.19729094505310057, "num_tokens": 76061130.0, "step": 30010 }, { "entropy": 6.082635068893433, "epoch": 3.463935372186959, "grad_norm": 0.91796875, "learning_rate": 0.0003841675687339832, "loss": 5.5723, "mean_token_accuracy": 0.19619133323431015, "num_tokens": 76072933.0, "step": 30015 }, { "entropy": 6.1245582580566404, "epoch": 3.4645124062319677, "grad_norm": 1.015625, "learning_rate": 0.0003841314849694839, "loss": 5.6615, "mean_token_accuracy": 0.1994563892483711, "num_tokens": 76085380.0, "step": 30020 }, { "entropy": 6.074115467071533, "epoch": 3.4650894402769765, "grad_norm": 1.078125, "learning_rate": 0.0003840953975344012, "loss": 5.6277, "mean_token_accuracy": 0.20541253238916396, "num_tokens": 76097948.0, "step": 30025 }, { "entropy": 6.185827398300171, "epoch": 3.465666474321985, "grad_norm": 1.1015625, "learning_rate": 0.00038405930642994914, "loss": 5.6916, "mean_token_accuracy": 0.19627868086099626, "num_tokens": 76111665.0, "step": 30030 }, { "entropy": 6.105507659912109, "epoch": 3.466243508366994, "grad_norm": 0.97265625, "learning_rate": 0.0003840232116573414, "loss": 5.6577, "mean_token_accuracy": 0.19467235803604127, "num_tokens": 76124060.0, "step": 30035 }, { "entropy": 6.182118988037109, "epoch": 3.466820542412002, "grad_norm": 0.92578125, "learning_rate": 0.0003839871132177921, "loss": 5.7096, "mean_token_accuracy": 0.1960706204175949, "num_tokens": 76136865.0, "step": 30040 }, { "entropy": 6.088036346435547, "epoch": 3.467397576457011, "grad_norm": 0.953125, "learning_rate": 0.0003839510111125155, "loss": 5.6312, "mean_token_accuracy": 0.195370677113533, "num_tokens": 76151068.0, "step": 30045 }, { "entropy": 6.060251951217651, "epoch": 3.4679746105020195, "grad_norm": 0.9296875, "learning_rate": 0.0003839149053427256, "loss": 5.5311, "mean_token_accuracy": 0.21270291805267333, "num_tokens": 76163481.0, "step": 30050 }, { "entropy": 6.109107255935669, "epoch": 3.4685516445470284, "grad_norm": 0.9140625, "learning_rate": 0.00038387879590963696, "loss": 5.6341, "mean_token_accuracy": 0.2059398427605629, "num_tokens": 76175673.0, "step": 30055 }, { "entropy": 6.082851934432983, "epoch": 3.4691286785920368, "grad_norm": 0.8828125, "learning_rate": 0.0003838426828144642, "loss": 5.6161, "mean_token_accuracy": 0.19848414957523347, "num_tokens": 76188113.0, "step": 30060 }, { "entropy": 6.155608320236206, "epoch": 3.4697057126370456, "grad_norm": 0.96875, "learning_rate": 0.00038380656605842186, "loss": 5.681, "mean_token_accuracy": 0.18838610202074052, "num_tokens": 76200318.0, "step": 30065 }, { "entropy": 6.06912145614624, "epoch": 3.470282746682054, "grad_norm": 0.953125, "learning_rate": 0.0003837704456427247, "loss": 5.6579, "mean_token_accuracy": 0.20329781472682953, "num_tokens": 76212135.0, "step": 30070 }, { "entropy": 6.104427242279053, "epoch": 3.470859780727063, "grad_norm": 0.99609375, "learning_rate": 0.00038373432156858756, "loss": 5.6381, "mean_token_accuracy": 0.20531237572431565, "num_tokens": 76225023.0, "step": 30075 }, { "entropy": 6.190938282012939, "epoch": 3.4714368147720718, "grad_norm": 1.0, "learning_rate": 0.0003836981938372256, "loss": 5.7401, "mean_token_accuracy": 0.18945249617099763, "num_tokens": 76238196.0, "step": 30080 }, { "entropy": 6.169899749755859, "epoch": 3.47201384881708, "grad_norm": 0.94140625, "learning_rate": 0.00038366206244985383, "loss": 5.7319, "mean_token_accuracy": 0.194173426926136, "num_tokens": 76251634.0, "step": 30085 }, { "entropy": 6.173556566238403, "epoch": 3.472590882862089, "grad_norm": 0.9921875, "learning_rate": 0.00038362592740768766, "loss": 5.6606, "mean_token_accuracy": 0.19777562469244003, "num_tokens": 76265378.0, "step": 30090 }, { "entropy": 6.07429256439209, "epoch": 3.4731679169070975, "grad_norm": 0.92578125, "learning_rate": 0.00038358978871194226, "loss": 5.6711, "mean_token_accuracy": 0.19805676937103273, "num_tokens": 76277889.0, "step": 30095 }, { "entropy": 6.139761304855346, "epoch": 3.4737449509521063, "grad_norm": 0.93359375, "learning_rate": 0.0003835536463638334, "loss": 5.6663, "mean_token_accuracy": 0.1934621140360832, "num_tokens": 76289891.0, "step": 30100 }, { "entropy": 6.138318586349487, "epoch": 3.4743219849971148, "grad_norm": 0.96484375, "learning_rate": 0.0003835175003645764, "loss": 5.6807, "mean_token_accuracy": 0.19737306386232376, "num_tokens": 76301362.0, "step": 30105 }, { "entropy": 6.135520076751709, "epoch": 3.4748990190421236, "grad_norm": 0.90625, "learning_rate": 0.0003834813507153873, "loss": 5.6234, "mean_token_accuracy": 0.1988933190703392, "num_tokens": 76313243.0, "step": 30110 }, { "entropy": 6.063269090652466, "epoch": 3.475476053087132, "grad_norm": 0.9609375, "learning_rate": 0.0003834451974174818, "loss": 5.6281, "mean_token_accuracy": 0.2100749433040619, "num_tokens": 76325777.0, "step": 30115 }, { "entropy": 6.143790531158447, "epoch": 3.476053087132141, "grad_norm": 0.9765625, "learning_rate": 0.00038340904047207597, "loss": 5.6811, "mean_token_accuracy": 0.19428813308477402, "num_tokens": 76338783.0, "step": 30120 }, { "entropy": 6.120352268218994, "epoch": 3.4766301211771493, "grad_norm": 1.046875, "learning_rate": 0.00038337287988038593, "loss": 5.6893, "mean_token_accuracy": 0.19149962812662125, "num_tokens": 76350626.0, "step": 30125 }, { "entropy": 6.11890606880188, "epoch": 3.477207155222158, "grad_norm": 1.0859375, "learning_rate": 0.00038333671564362787, "loss": 5.6325, "mean_token_accuracy": 0.19931449145078659, "num_tokens": 76363819.0, "step": 30130 }, { "entropy": 6.125185537338257, "epoch": 3.4777841892671666, "grad_norm": 0.92578125, "learning_rate": 0.0003833005477630182, "loss": 5.5743, "mean_token_accuracy": 0.20325966626405717, "num_tokens": 76375119.0, "step": 30135 }, { "entropy": 6.152893304824829, "epoch": 3.4783612233121755, "grad_norm": 0.921875, "learning_rate": 0.0003832643762397734, "loss": 5.7171, "mean_token_accuracy": 0.19343860000371932, "num_tokens": 76387762.0, "step": 30140 }, { "entropy": 6.050218629837036, "epoch": 3.478938257357184, "grad_norm": 0.80078125, "learning_rate": 0.0003832282010751101, "loss": 5.6516, "mean_token_accuracy": 0.2044332057237625, "num_tokens": 76401449.0, "step": 30145 }, { "entropy": 6.126082992553711, "epoch": 3.4795152914021927, "grad_norm": 0.9765625, "learning_rate": 0.00038319202227024503, "loss": 5.6309, "mean_token_accuracy": 0.2095692291855812, "num_tokens": 76414591.0, "step": 30150 }, { "entropy": 6.1600096225738525, "epoch": 3.4800923254472016, "grad_norm": 0.88671875, "learning_rate": 0.000383155839826395, "loss": 5.6315, "mean_token_accuracy": 0.20340606570243835, "num_tokens": 76426987.0, "step": 30155 }, { "entropy": 6.141730880737304, "epoch": 3.48066935949221, "grad_norm": 1.0, "learning_rate": 0.000383119653744777, "loss": 5.6727, "mean_token_accuracy": 0.1953875780105591, "num_tokens": 76439733.0, "step": 30160 }, { "entropy": 6.180585813522339, "epoch": 3.481246393537219, "grad_norm": 0.98046875, "learning_rate": 0.00038308346402660825, "loss": 5.7049, "mean_token_accuracy": 0.19781098365783692, "num_tokens": 76451836.0, "step": 30165 }, { "entropy": 6.148232173919678, "epoch": 3.4818234275822273, "grad_norm": 0.9296875, "learning_rate": 0.0003830472706731058, "loss": 5.7443, "mean_token_accuracy": 0.19583188742399216, "num_tokens": 76465036.0, "step": 30170 }, { "entropy": 6.067029333114624, "epoch": 3.482400461627236, "grad_norm": 1.109375, "learning_rate": 0.0003830110736854871, "loss": 5.5874, "mean_token_accuracy": 0.20140080600976945, "num_tokens": 76477523.0, "step": 30175 }, { "entropy": 6.002858829498291, "epoch": 3.4829774956722446, "grad_norm": 0.97265625, "learning_rate": 0.0003829748730649695, "loss": 5.5125, "mean_token_accuracy": 0.20988383144140244, "num_tokens": 76490456.0, "step": 30180 }, { "entropy": 6.095826196670532, "epoch": 3.4835545297172534, "grad_norm": 1.0859375, "learning_rate": 0.00038293866881277083, "loss": 5.662, "mean_token_accuracy": 0.19799549132585526, "num_tokens": 76503371.0, "step": 30185 }, { "entropy": 6.054685735702515, "epoch": 3.484131563762262, "grad_norm": 0.9296875, "learning_rate": 0.00038290246093010855, "loss": 5.6571, "mean_token_accuracy": 0.1949399471282959, "num_tokens": 76516434.0, "step": 30190 }, { "entropy": 6.16289005279541, "epoch": 3.4847085978072707, "grad_norm": 1.015625, "learning_rate": 0.00038286624941820066, "loss": 5.6912, "mean_token_accuracy": 0.20036305636167526, "num_tokens": 76530147.0, "step": 30195 }, { "entropy": 6.17379322052002, "epoch": 3.485285631852279, "grad_norm": 0.9453125, "learning_rate": 0.00038283003427826503, "loss": 5.768, "mean_token_accuracy": 0.19312623292207717, "num_tokens": 76543563.0, "step": 30200 }, { "entropy": 6.110541105270386, "epoch": 3.485862665897288, "grad_norm": 1.0625, "learning_rate": 0.00038279381551151973, "loss": 5.5952, "mean_token_accuracy": 0.20653214156627656, "num_tokens": 76556488.0, "step": 30205 }, { "entropy": 6.157381010055542, "epoch": 3.4864396999422964, "grad_norm": 0.953125, "learning_rate": 0.0003827575931191829, "loss": 5.6688, "mean_token_accuracy": 0.2037475049495697, "num_tokens": 76569800.0, "step": 30210 }, { "entropy": 6.135750150680542, "epoch": 3.4870167339873053, "grad_norm": 0.97265625, "learning_rate": 0.0003827213671024731, "loss": 5.7277, "mean_token_accuracy": 0.19277291148900985, "num_tokens": 76582468.0, "step": 30215 }, { "entropy": 6.155987405776978, "epoch": 3.4875937680323137, "grad_norm": 0.984375, "learning_rate": 0.0003826851374626086, "loss": 5.7058, "mean_token_accuracy": 0.1915629878640175, "num_tokens": 76595207.0, "step": 30220 }, { "entropy": 6.20315523147583, "epoch": 3.4881708020773226, "grad_norm": 0.96484375, "learning_rate": 0.00038264890420080795, "loss": 5.7562, "mean_token_accuracy": 0.19180708676576613, "num_tokens": 76608020.0, "step": 30225 }, { "entropy": 6.128471803665161, "epoch": 3.4887478361223314, "grad_norm": 1.078125, "learning_rate": 0.0003826126673182899, "loss": 5.6408, "mean_token_accuracy": 0.1984275385737419, "num_tokens": 76620671.0, "step": 30230 }, { "entropy": 6.203733348846436, "epoch": 3.48932487016734, "grad_norm": 0.9921875, "learning_rate": 0.0003825764268162733, "loss": 5.7742, "mean_token_accuracy": 0.18989548236131668, "num_tokens": 76632723.0, "step": 30235 }, { "entropy": 6.123423957824707, "epoch": 3.4899019042123487, "grad_norm": 0.92578125, "learning_rate": 0.0003825401826959769, "loss": 5.7142, "mean_token_accuracy": 0.19327777475118638, "num_tokens": 76644811.0, "step": 30240 }, { "entropy": 6.074578714370728, "epoch": 3.490478938257357, "grad_norm": 1.0546875, "learning_rate": 0.0003825039349586199, "loss": 5.6406, "mean_token_accuracy": 0.20226256251335145, "num_tokens": 76656674.0, "step": 30245 }, { "entropy": 6.2125060081481935, "epoch": 3.491055972302366, "grad_norm": 0.90234375, "learning_rate": 0.0003824676836054215, "loss": 5.7074, "mean_token_accuracy": 0.1934037834405899, "num_tokens": 76669421.0, "step": 30250 }, { "entropy": 6.183376789093018, "epoch": 3.4916330063473744, "grad_norm": 0.890625, "learning_rate": 0.00038243142863760086, "loss": 5.7032, "mean_token_accuracy": 0.19767117649316787, "num_tokens": 76681273.0, "step": 30255 }, { "entropy": 6.094620180130005, "epoch": 3.4922100403923833, "grad_norm": 1.0078125, "learning_rate": 0.0003823951700563776, "loss": 5.6076, "mean_token_accuracy": 0.20499284714460372, "num_tokens": 76692949.0, "step": 30260 }, { "entropy": 6.083004999160766, "epoch": 3.4927870744373917, "grad_norm": 0.94140625, "learning_rate": 0.0003823589078629711, "loss": 5.6975, "mean_token_accuracy": 0.19626200646162034, "num_tokens": 76705650.0, "step": 30265 }, { "entropy": 6.184039115905762, "epoch": 3.4933641084824005, "grad_norm": 0.95703125, "learning_rate": 0.00038232264205860105, "loss": 5.6651, "mean_token_accuracy": 0.20441165417432786, "num_tokens": 76718756.0, "step": 30270 }, { "entropy": 6.2080934047698975, "epoch": 3.493941142527409, "grad_norm": 0.875, "learning_rate": 0.00038228637264448717, "loss": 5.7025, "mean_token_accuracy": 0.19622491002082826, "num_tokens": 76731434.0, "step": 30275 }, { "entropy": 6.174611043930054, "epoch": 3.494518176572418, "grad_norm": 1.0, "learning_rate": 0.00038225009962184956, "loss": 5.6761, "mean_token_accuracy": 0.19993743002414704, "num_tokens": 76743413.0, "step": 30280 }, { "entropy": 6.121385097503662, "epoch": 3.4950952106174267, "grad_norm": 0.9375, "learning_rate": 0.00038221382299190803, "loss": 5.6897, "mean_token_accuracy": 0.19764068871736526, "num_tokens": 76756545.0, "step": 30285 }, { "entropy": 6.055549049377442, "epoch": 3.495672244662435, "grad_norm": 0.95703125, "learning_rate": 0.0003821775427558829, "loss": 5.577, "mean_token_accuracy": 0.2102785140275955, "num_tokens": 76769795.0, "step": 30290 }, { "entropy": 6.132511615753174, "epoch": 3.4962492787074435, "grad_norm": 1.0234375, "learning_rate": 0.0003821412589149943, "loss": 5.6917, "mean_token_accuracy": 0.1965790271759033, "num_tokens": 76782713.0, "step": 30295 }, { "entropy": 6.094518184661865, "epoch": 3.4968263127524524, "grad_norm": 0.91796875, "learning_rate": 0.0003821049714704627, "loss": 5.6439, "mean_token_accuracy": 0.19943341761827468, "num_tokens": 76794588.0, "step": 30300 }, { "entropy": 6.061864376068115, "epoch": 3.4974033467974612, "grad_norm": 0.953125, "learning_rate": 0.00038206868042350855, "loss": 5.5752, "mean_token_accuracy": 0.20061683654785156, "num_tokens": 76807358.0, "step": 30305 }, { "entropy": 6.072805500030517, "epoch": 3.4979803808424696, "grad_norm": 0.92578125, "learning_rate": 0.0003820323857753526, "loss": 5.6811, "mean_token_accuracy": 0.19788562804460524, "num_tokens": 76821334.0, "step": 30310 }, { "entropy": 6.065698909759521, "epoch": 3.4985574148874785, "grad_norm": 0.8984375, "learning_rate": 0.00038199608752721535, "loss": 5.5677, "mean_token_accuracy": 0.2045666053891182, "num_tokens": 76835691.0, "step": 30315 }, { "entropy": 6.179615449905396, "epoch": 3.499134448932487, "grad_norm": 0.9296875, "learning_rate": 0.000381959785680318, "loss": 5.6928, "mean_token_accuracy": 0.19413203746080399, "num_tokens": 76847277.0, "step": 30320 }, { "entropy": 6.167409896850586, "epoch": 3.499711482977496, "grad_norm": 0.91796875, "learning_rate": 0.00038192348023588144, "loss": 5.7129, "mean_token_accuracy": 0.193221053481102, "num_tokens": 76860063.0, "step": 30325 }, { "entropy": 6.1212207794189455, "epoch": 3.500288517022504, "grad_norm": 0.9453125, "learning_rate": 0.0003818871711951266, "loss": 5.7027, "mean_token_accuracy": 0.19126492738723755, "num_tokens": 76871748.0, "step": 30330 }, { "entropy": 6.200066375732422, "epoch": 3.500865551067513, "grad_norm": 0.875, "learning_rate": 0.0003818508585592749, "loss": 5.7544, "mean_token_accuracy": 0.19638368487358093, "num_tokens": 76884958.0, "step": 30335 }, { "entropy": 6.160165119171142, "epoch": 3.5014425851125215, "grad_norm": 0.94140625, "learning_rate": 0.0003818145423295476, "loss": 5.6893, "mean_token_accuracy": 0.19635801166296005, "num_tokens": 76897924.0, "step": 30340 }, { "entropy": 6.127073764801025, "epoch": 3.5020196191575304, "grad_norm": 1.03125, "learning_rate": 0.0003817782225071663, "loss": 5.7466, "mean_token_accuracy": 0.19972751587629317, "num_tokens": 76909374.0, "step": 30345 }, { "entropy": 6.132970476150513, "epoch": 3.5025966532025388, "grad_norm": 0.921875, "learning_rate": 0.0003817418990933525, "loss": 5.6498, "mean_token_accuracy": 0.2034968763589859, "num_tokens": 76920629.0, "step": 30350 }, { "entropy": 6.156960153579712, "epoch": 3.5031736872475476, "grad_norm": 0.94140625, "learning_rate": 0.00038170557208932793, "loss": 5.7445, "mean_token_accuracy": 0.19333231151103974, "num_tokens": 76932539.0, "step": 30355 }, { "entropy": 6.190456914901733, "epoch": 3.5037507212925565, "grad_norm": 0.89453125, "learning_rate": 0.00038166924149631444, "loss": 5.7344, "mean_token_accuracy": 0.19323522001504898, "num_tokens": 76945210.0, "step": 30360 }, { "entropy": 6.135421657562256, "epoch": 3.504327755337565, "grad_norm": 1.03125, "learning_rate": 0.00038163290731553403, "loss": 5.7077, "mean_token_accuracy": 0.19858040064573287, "num_tokens": 76958465.0, "step": 30365 }, { "entropy": 6.0406403064727785, "epoch": 3.5049047893825733, "grad_norm": 1.1640625, "learning_rate": 0.0003815965695482088, "loss": 5.5159, "mean_token_accuracy": 0.20895894169807433, "num_tokens": 76970563.0, "step": 30370 }, { "entropy": 6.128117465972901, "epoch": 3.505481823427582, "grad_norm": 0.88671875, "learning_rate": 0.0003815602281955608, "loss": 5.7071, "mean_token_accuracy": 0.19536690413951874, "num_tokens": 76983215.0, "step": 30375 }, { "entropy": 6.135241174697876, "epoch": 3.506058857472591, "grad_norm": 0.87109375, "learning_rate": 0.00038152388325881243, "loss": 5.651, "mean_token_accuracy": 0.19385750740766525, "num_tokens": 76995433.0, "step": 30380 }, { "entropy": 6.131248664855957, "epoch": 3.5066358915175995, "grad_norm": 0.921875, "learning_rate": 0.0003814875347391862, "loss": 5.6456, "mean_token_accuracy": 0.20077474415302277, "num_tokens": 77007427.0, "step": 30385 }, { "entropy": 6.129200267791748, "epoch": 3.5072129255626083, "grad_norm": 0.9921875, "learning_rate": 0.00038145118263790474, "loss": 5.627, "mean_token_accuracy": 0.2046310856938362, "num_tokens": 77019916.0, "step": 30390 }, { "entropy": 6.117960453033447, "epoch": 3.5077899596076167, "grad_norm": 1.328125, "learning_rate": 0.0003814148269561905, "loss": 5.6825, "mean_token_accuracy": 0.2021052598953247, "num_tokens": 77032385.0, "step": 30395 }, { "entropy": 6.131684923171997, "epoch": 3.5083669936526256, "grad_norm": 0.9140625, "learning_rate": 0.00038137846769526645, "loss": 5.6988, "mean_token_accuracy": 0.1952743798494339, "num_tokens": 77045459.0, "step": 30400 }, { "entropy": 6.205504083633423, "epoch": 3.508944027697634, "grad_norm": 0.8984375, "learning_rate": 0.0003813421048563555, "loss": 5.6866, "mean_token_accuracy": 0.19790969043970108, "num_tokens": 77058386.0, "step": 30405 }, { "entropy": 6.10381851196289, "epoch": 3.509521061742643, "grad_norm": 1.0859375, "learning_rate": 0.0003813057384406807, "loss": 5.6482, "mean_token_accuracy": 0.20617625415325164, "num_tokens": 77071085.0, "step": 30410 }, { "entropy": 6.115856122970581, "epoch": 3.5100980957876513, "grad_norm": 0.90625, "learning_rate": 0.0003812693684494652, "loss": 5.6986, "mean_token_accuracy": 0.1923053815960884, "num_tokens": 77084619.0, "step": 30415 }, { "entropy": 6.1303667545318605, "epoch": 3.51067512983266, "grad_norm": 0.9140625, "learning_rate": 0.00038123299488393225, "loss": 5.6267, "mean_token_accuracy": 0.20061812847852706, "num_tokens": 77097144.0, "step": 30420 }, { "entropy": 6.002131605148316, "epoch": 3.5112521638776686, "grad_norm": 0.9140625, "learning_rate": 0.0003811966177453052, "loss": 5.4938, "mean_token_accuracy": 0.2166547879576683, "num_tokens": 77109875.0, "step": 30425 }, { "entropy": 6.120227909088134, "epoch": 3.5118291979226774, "grad_norm": 0.89453125, "learning_rate": 0.0003811602370348078, "loss": 5.6678, "mean_token_accuracy": 0.20702530443668365, "num_tokens": 77123022.0, "step": 30430 }, { "entropy": 6.107196950912476, "epoch": 3.5124062319676863, "grad_norm": 1.03125, "learning_rate": 0.00038112385275366345, "loss": 5.6153, "mean_token_accuracy": 0.20772140920162202, "num_tokens": 77134845.0, "step": 30435 }, { "entropy": 6.093294954299926, "epoch": 3.5129832660126947, "grad_norm": 0.9609375, "learning_rate": 0.0003810874649030961, "loss": 5.5404, "mean_token_accuracy": 0.21414842903614045, "num_tokens": 77147204.0, "step": 30440 }, { "entropy": 6.12237696647644, "epoch": 3.513560300057703, "grad_norm": 0.94140625, "learning_rate": 0.00038105107348432955, "loss": 5.6181, "mean_token_accuracy": 0.21166556179523469, "num_tokens": 77160374.0, "step": 30445 }, { "entropy": 6.041955614089966, "epoch": 3.514137334102712, "grad_norm": 0.93359375, "learning_rate": 0.00038101467849858777, "loss": 5.635, "mean_token_accuracy": 0.2026488408446312, "num_tokens": 77172558.0, "step": 30450 }, { "entropy": 6.167855834960937, "epoch": 3.514714368147721, "grad_norm": 0.96875, "learning_rate": 0.000380978279947095, "loss": 5.6769, "mean_token_accuracy": 0.19385907500982286, "num_tokens": 77185838.0, "step": 30455 }, { "entropy": 6.014473724365234, "epoch": 3.5152914021927293, "grad_norm": 0.9765625, "learning_rate": 0.00038094187783107545, "loss": 5.5321, "mean_token_accuracy": 0.2116029068827629, "num_tokens": 77197335.0, "step": 30460 }, { "entropy": 6.128593063354492, "epoch": 3.515868436237738, "grad_norm": 0.97265625, "learning_rate": 0.00038090547215175336, "loss": 5.6881, "mean_token_accuracy": 0.19996896833181382, "num_tokens": 77209180.0, "step": 30465 }, { "entropy": 6.026110696792602, "epoch": 3.5164454702827466, "grad_norm": 0.9609375, "learning_rate": 0.0003808690629103534, "loss": 5.4983, "mean_token_accuracy": 0.2137421876192093, "num_tokens": 77221393.0, "step": 30470 }, { "entropy": 5.930377435684204, "epoch": 3.5170225043277554, "grad_norm": 0.921875, "learning_rate": 0.0003808326501081001, "loss": 5.5155, "mean_token_accuracy": 0.21995847374200822, "num_tokens": 77234152.0, "step": 30475 }, { "entropy": 6.126913022994995, "epoch": 3.517599538372764, "grad_norm": 0.89453125, "learning_rate": 0.00038079623374621816, "loss": 5.672, "mean_token_accuracy": 0.19826942384243013, "num_tokens": 77248056.0, "step": 30480 }, { "entropy": 6.110919618606568, "epoch": 3.5181765724177727, "grad_norm": 0.8984375, "learning_rate": 0.00038075981382593236, "loss": 5.6768, "mean_token_accuracy": 0.19786618053913116, "num_tokens": 77262006.0, "step": 30485 }, { "entropy": 6.119785499572754, "epoch": 3.5187536064627816, "grad_norm": 0.93359375, "learning_rate": 0.0003807233903484679, "loss": 5.7, "mean_token_accuracy": 0.19304803162813186, "num_tokens": 77275419.0, "step": 30490 }, { "entropy": 6.162968254089355, "epoch": 3.51933064050779, "grad_norm": 0.94140625, "learning_rate": 0.0003806869633150497, "loss": 5.6819, "mean_token_accuracy": 0.19188643097877503, "num_tokens": 77287960.0, "step": 30495 }, { "entropy": 6.056926250457764, "epoch": 3.5199076745527984, "grad_norm": 0.96875, "learning_rate": 0.00038065053272690297, "loss": 5.5824, "mean_token_accuracy": 0.2100779339671135, "num_tokens": 77300174.0, "step": 30500 }, { "entropy": 6.079039287567139, "epoch": 3.5204847085978073, "grad_norm": 0.9375, "learning_rate": 0.000380614098585253, "loss": 5.5571, "mean_token_accuracy": 0.2080882743000984, "num_tokens": 77312736.0, "step": 30505 }, { "entropy": 6.083523559570312, "epoch": 3.521061742642816, "grad_norm": 1.015625, "learning_rate": 0.00038057766089132533, "loss": 5.6459, "mean_token_accuracy": 0.20180234909057618, "num_tokens": 77325344.0, "step": 30510 }, { "entropy": 6.1154541015625, "epoch": 3.5216387766878245, "grad_norm": 0.96875, "learning_rate": 0.00038054121964634547, "loss": 5.6107, "mean_token_accuracy": 0.20732833594083785, "num_tokens": 77337917.0, "step": 30515 }, { "entropy": 6.06594033241272, "epoch": 3.522215810732833, "grad_norm": 0.9375, "learning_rate": 0.0003805047748515391, "loss": 5.6897, "mean_token_accuracy": 0.2076156795024872, "num_tokens": 77350654.0, "step": 30520 }, { "entropy": 6.010657501220703, "epoch": 3.522792844777842, "grad_norm": 0.9296875, "learning_rate": 0.000380468326508132, "loss": 5.6097, "mean_token_accuracy": 0.20525875836610794, "num_tokens": 77363969.0, "step": 30525 }, { "entropy": 6.073437023162842, "epoch": 3.5233698788228507, "grad_norm": 0.984375, "learning_rate": 0.00038043187461735025, "loss": 5.5762, "mean_token_accuracy": 0.2024112582206726, "num_tokens": 77377354.0, "step": 30530 }, { "entropy": 6.205715703964233, "epoch": 3.523946912867859, "grad_norm": 0.9375, "learning_rate": 0.0003803954191804197, "loss": 5.6985, "mean_token_accuracy": 0.1945109859108925, "num_tokens": 77389990.0, "step": 30535 }, { "entropy": 6.10283899307251, "epoch": 3.524523946912868, "grad_norm": 0.8984375, "learning_rate": 0.00038035896019856656, "loss": 5.5798, "mean_token_accuracy": 0.20296572744846345, "num_tokens": 77401809.0, "step": 30540 }, { "entropy": 5.96373233795166, "epoch": 3.5251009809578764, "grad_norm": 1.0234375, "learning_rate": 0.00038032249767301716, "loss": 5.5204, "mean_token_accuracy": 0.2058837056159973, "num_tokens": 77413763.0, "step": 30545 }, { "entropy": 6.066835355758667, "epoch": 3.5256780150028852, "grad_norm": 0.98046875, "learning_rate": 0.00038028603160499783, "loss": 5.6438, "mean_token_accuracy": 0.19838371574878694, "num_tokens": 77427132.0, "step": 30550 }, { "entropy": 6.115768003463745, "epoch": 3.5262550490478937, "grad_norm": 0.95703125, "learning_rate": 0.00038024956199573514, "loss": 5.6428, "mean_token_accuracy": 0.2061450108885765, "num_tokens": 77439074.0, "step": 30555 }, { "entropy": 6.158787202835083, "epoch": 3.5268320830929025, "grad_norm": 0.94140625, "learning_rate": 0.0003802130888464557, "loss": 5.6896, "mean_token_accuracy": 0.19760521948337556, "num_tokens": 77452159.0, "step": 30560 }, { "entropy": 6.136129570007324, "epoch": 3.5274091171379114, "grad_norm": 1.0859375, "learning_rate": 0.0003801766121583863, "loss": 5.6553, "mean_token_accuracy": 0.19396378546953202, "num_tokens": 77465139.0, "step": 30565 }, { "entropy": 6.06098313331604, "epoch": 3.52798615118292, "grad_norm": 0.9921875, "learning_rate": 0.0003801401319327538, "loss": 5.6353, "mean_token_accuracy": 0.2043432429432869, "num_tokens": 77478577.0, "step": 30570 }, { "entropy": 6.1209249019622805, "epoch": 3.5285631852279282, "grad_norm": 0.8984375, "learning_rate": 0.00038010364817078513, "loss": 5.6132, "mean_token_accuracy": 0.2048458054661751, "num_tokens": 77491352.0, "step": 30575 }, { "entropy": 6.040082406997681, "epoch": 3.529140219272937, "grad_norm": 1.359375, "learning_rate": 0.0003800671608737076, "loss": 5.5735, "mean_token_accuracy": 0.2121508464217186, "num_tokens": 77503465.0, "step": 30580 }, { "entropy": 6.199835252761841, "epoch": 3.529717253317946, "grad_norm": 0.91015625, "learning_rate": 0.0003800306700427481, "loss": 5.7001, "mean_token_accuracy": 0.19505725353956221, "num_tokens": 77516558.0, "step": 30585 }, { "entropy": 6.047958326339722, "epoch": 3.5302942873629544, "grad_norm": 1.0546875, "learning_rate": 0.00037999417567913436, "loss": 5.6151, "mean_token_accuracy": 0.19728896617889405, "num_tokens": 77530335.0, "step": 30590 }, { "entropy": 6.104905891418457, "epoch": 3.5308713214079632, "grad_norm": 1.03125, "learning_rate": 0.0003799576777840936, "loss": 5.6137, "mean_token_accuracy": 0.21162358224391936, "num_tokens": 77543996.0, "step": 30595 }, { "entropy": 6.1977808475494385, "epoch": 3.5314483554529716, "grad_norm": 0.9375, "learning_rate": 0.00037992117635885354, "loss": 5.7086, "mean_token_accuracy": 0.19997528791427613, "num_tokens": 77556585.0, "step": 30600 }, { "entropy": 6.133581829071045, "epoch": 3.5320253894979805, "grad_norm": 1.0234375, "learning_rate": 0.0003798846714046418, "loss": 5.6366, "mean_token_accuracy": 0.20247101336717604, "num_tokens": 77569254.0, "step": 30605 }, { "entropy": 6.115343332290649, "epoch": 3.532602423542989, "grad_norm": 0.90625, "learning_rate": 0.0003798481629226862, "loss": 5.656, "mean_token_accuracy": 0.2043052703142166, "num_tokens": 77582308.0, "step": 30610 }, { "entropy": 6.081429147720337, "epoch": 3.533179457587998, "grad_norm": 0.87890625, "learning_rate": 0.0003798116509142147, "loss": 5.6248, "mean_token_accuracy": 0.2031274288892746, "num_tokens": 77596161.0, "step": 30615 }, { "entropy": 6.148749732971192, "epoch": 3.533756491633006, "grad_norm": 0.875, "learning_rate": 0.00037977513538045544, "loss": 5.7282, "mean_token_accuracy": 0.19472491145133972, "num_tokens": 77608387.0, "step": 30620 }, { "entropy": 6.197894144058227, "epoch": 3.534333525678015, "grad_norm": 0.94921875, "learning_rate": 0.00037973861632263655, "loss": 5.668, "mean_token_accuracy": 0.20166428834199907, "num_tokens": 77620502.0, "step": 30625 }, { "entropy": 6.129067325592041, "epoch": 3.5349105597230235, "grad_norm": 0.87890625, "learning_rate": 0.0003797020937419863, "loss": 5.6979, "mean_token_accuracy": 0.1904497981071472, "num_tokens": 77633106.0, "step": 30630 }, { "entropy": 6.018396043777466, "epoch": 3.5354875937680323, "grad_norm": 0.9609375, "learning_rate": 0.00037966556763973313, "loss": 5.6115, "mean_token_accuracy": 0.2036408379673958, "num_tokens": 77644938.0, "step": 30635 }, { "entropy": 6.127925968170166, "epoch": 3.536064627813041, "grad_norm": 0.9140625, "learning_rate": 0.0003796290380171056, "loss": 5.6214, "mean_token_accuracy": 0.20307651460170745, "num_tokens": 77656192.0, "step": 30640 }, { "entropy": 6.057373189926148, "epoch": 3.5366416618580496, "grad_norm": 0.9296875, "learning_rate": 0.0003795925048753324, "loss": 5.5721, "mean_token_accuracy": 0.21015395671129228, "num_tokens": 77667845.0, "step": 30645 }, { "entropy": 6.098120546340942, "epoch": 3.537218695903058, "grad_norm": 0.99609375, "learning_rate": 0.00037955596821564216, "loss": 5.6624, "mean_token_accuracy": 0.2039669007062912, "num_tokens": 77679401.0, "step": 30650 }, { "entropy": 6.151260232925415, "epoch": 3.537795729948067, "grad_norm": 0.91796875, "learning_rate": 0.0003795194280392639, "loss": 5.6745, "mean_token_accuracy": 0.19547478407621383, "num_tokens": 77692223.0, "step": 30655 }, { "entropy": 6.0903863430023195, "epoch": 3.5383727639930758, "grad_norm": 0.90625, "learning_rate": 0.0003794828843474266, "loss": 5.6113, "mean_token_accuracy": 0.19964486509561538, "num_tokens": 77703955.0, "step": 30660 }, { "entropy": 6.066116666793823, "epoch": 3.538949798038084, "grad_norm": 0.8984375, "learning_rate": 0.0003794463371413594, "loss": 5.6664, "mean_token_accuracy": 0.19972672015428544, "num_tokens": 77716861.0, "step": 30665 }, { "entropy": 6.104123973846436, "epoch": 3.539526832083093, "grad_norm": 0.91796875, "learning_rate": 0.00037940978642229153, "loss": 5.6402, "mean_token_accuracy": 0.20932407677173615, "num_tokens": 77728650.0, "step": 30670 }, { "entropy": 6.11107873916626, "epoch": 3.5401038661281015, "grad_norm": 0.9140625, "learning_rate": 0.00037937323219145233, "loss": 5.6551, "mean_token_accuracy": 0.1996922791004181, "num_tokens": 77740676.0, "step": 30675 }, { "entropy": 6.154971170425415, "epoch": 3.5406809001731103, "grad_norm": 0.9609375, "learning_rate": 0.00037933667445007123, "loss": 5.6433, "mean_token_accuracy": 0.19993229508399962, "num_tokens": 77753126.0, "step": 30680 }, { "entropy": 5.966343212127685, "epoch": 3.5412579342181187, "grad_norm": 1.015625, "learning_rate": 0.00037930011319937815, "loss": 5.5073, "mean_token_accuracy": 0.21381933689117433, "num_tokens": 77766089.0, "step": 30685 }, { "entropy": 6.14495325088501, "epoch": 3.5418349682631276, "grad_norm": 1.0234375, "learning_rate": 0.00037926354844060236, "loss": 5.7256, "mean_token_accuracy": 0.19190252125263213, "num_tokens": 77779171.0, "step": 30690 }, { "entropy": 6.198380994796753, "epoch": 3.542412002308136, "grad_norm": 0.90234375, "learning_rate": 0.00037922698017497393, "loss": 5.7077, "mean_token_accuracy": 0.19388759583234788, "num_tokens": 77792172.0, "step": 30695 }, { "entropy": 6.151600933074951, "epoch": 3.542989036353145, "grad_norm": 0.8984375, "learning_rate": 0.0003791904084037229, "loss": 5.7357, "mean_token_accuracy": 0.18923739343881607, "num_tokens": 77804629.0, "step": 30700 }, { "entropy": 6.086050176620484, "epoch": 3.5435660703981533, "grad_norm": 1.0078125, "learning_rate": 0.0003791538331280792, "loss": 5.6417, "mean_token_accuracy": 0.2014468416571617, "num_tokens": 77816954.0, "step": 30705 }, { "entropy": 6.116134786605835, "epoch": 3.544143104443162, "grad_norm": 0.96875, "learning_rate": 0.000379117254349273, "loss": 5.6296, "mean_token_accuracy": 0.21035561561584473, "num_tokens": 77829192.0, "step": 30710 }, { "entropy": 6.170983219146729, "epoch": 3.544720138488171, "grad_norm": 0.9140625, "learning_rate": 0.0003790806720685347, "loss": 5.694, "mean_token_accuracy": 0.20258939564228057, "num_tokens": 77842529.0, "step": 30715 }, { "entropy": 6.049699831008911, "epoch": 3.5452971725331794, "grad_norm": 0.93359375, "learning_rate": 0.0003790440862870947, "loss": 5.5656, "mean_token_accuracy": 0.20837958604097367, "num_tokens": 77855910.0, "step": 30720 }, { "entropy": 6.140993928909301, "epoch": 3.545874206578188, "grad_norm": 0.9765625, "learning_rate": 0.00037900749700618355, "loss": 5.5867, "mean_token_accuracy": 0.1982567086815834, "num_tokens": 77867321.0, "step": 30725 }, { "entropy": 6.04323182106018, "epoch": 3.5464512406231967, "grad_norm": 0.98046875, "learning_rate": 0.00037897090422703186, "loss": 5.5682, "mean_token_accuracy": 0.20740952342748642, "num_tokens": 77880022.0, "step": 30730 }, { "entropy": 6.0994984149932865, "epoch": 3.5470282746682056, "grad_norm": 1.0703125, "learning_rate": 0.00037893430795087047, "loss": 5.6565, "mean_token_accuracy": 0.20117796957492828, "num_tokens": 77892903.0, "step": 30735 }, { "entropy": 6.085923957824707, "epoch": 3.547605308713214, "grad_norm": 0.921875, "learning_rate": 0.0003788977081789302, "loss": 5.6054, "mean_token_accuracy": 0.2040314793586731, "num_tokens": 77905860.0, "step": 30740 }, { "entropy": 6.081289148330688, "epoch": 3.548182342758223, "grad_norm": 0.93359375, "learning_rate": 0.0003788611049124422, "loss": 5.6399, "mean_token_accuracy": 0.1989624246954918, "num_tokens": 77918747.0, "step": 30745 }, { "entropy": 6.067815256118775, "epoch": 3.5487593768032313, "grad_norm": 0.94140625, "learning_rate": 0.00037882449815263757, "loss": 5.657, "mean_token_accuracy": 0.19605450332164764, "num_tokens": 77931575.0, "step": 30750 }, { "entropy": 6.14686131477356, "epoch": 3.54933641084824, "grad_norm": 0.9453125, "learning_rate": 0.0003787878879007474, "loss": 5.7459, "mean_token_accuracy": 0.19474599808454512, "num_tokens": 77944281.0, "step": 30755 }, { "entropy": 6.19490385055542, "epoch": 3.5499134448932486, "grad_norm": 0.95703125, "learning_rate": 0.00037875127415800324, "loss": 5.6551, "mean_token_accuracy": 0.1992063343524933, "num_tokens": 77956416.0, "step": 30760 }, { "entropy": 6.08354115486145, "epoch": 3.5504904789382574, "grad_norm": 0.953125, "learning_rate": 0.00037871465692563655, "loss": 5.6009, "mean_token_accuracy": 0.2053515985608101, "num_tokens": 77970420.0, "step": 30765 }, { "entropy": 6.011940383911133, "epoch": 3.5510675129832663, "grad_norm": 0.9609375, "learning_rate": 0.00037867803620487885, "loss": 5.5667, "mean_token_accuracy": 0.20466463565826415, "num_tokens": 77982752.0, "step": 30770 }, { "entropy": 6.1181739330291744, "epoch": 3.5516445470282747, "grad_norm": 0.93359375, "learning_rate": 0.0003786414119969619, "loss": 5.7109, "mean_token_accuracy": 0.19602808505296707, "num_tokens": 77995106.0, "step": 30775 }, { "entropy": 6.192669486999511, "epoch": 3.552221581073283, "grad_norm": 0.89453125, "learning_rate": 0.0003786047843031175, "loss": 5.689, "mean_token_accuracy": 0.1950067847967148, "num_tokens": 78007387.0, "step": 30780 }, { "entropy": 6.170553970336914, "epoch": 3.552798615118292, "grad_norm": 0.87109375, "learning_rate": 0.00037856815312457777, "loss": 5.709, "mean_token_accuracy": 0.19518875032663346, "num_tokens": 78020301.0, "step": 30785 }, { "entropy": 6.0381241798400875, "epoch": 3.553375649163301, "grad_norm": 1.0703125, "learning_rate": 0.00037853151846257456, "loss": 5.5402, "mean_token_accuracy": 0.2079501673579216, "num_tokens": 78032909.0, "step": 30790 }, { "entropy": 6.11513876914978, "epoch": 3.5539526832083093, "grad_norm": 0.99609375, "learning_rate": 0.00037849488031834014, "loss": 5.705, "mean_token_accuracy": 0.19704343229532242, "num_tokens": 78045123.0, "step": 30795 }, { "entropy": 6.1120264530181885, "epoch": 3.5545297172533177, "grad_norm": 0.890625, "learning_rate": 0.00037845823869310687, "loss": 5.6536, "mean_token_accuracy": 0.19778777062892913, "num_tokens": 78057399.0, "step": 30800 }, { "entropy": 6.171220541000366, "epoch": 3.5551067512983265, "grad_norm": 0.9453125, "learning_rate": 0.0003784215935881071, "loss": 5.6992, "mean_token_accuracy": 0.19713576287031173, "num_tokens": 78069439.0, "step": 30805 }, { "entropy": 6.183669328689575, "epoch": 3.5556837853433354, "grad_norm": 0.9140625, "learning_rate": 0.00037838494500457346, "loss": 5.7341, "mean_token_accuracy": 0.19349171221256256, "num_tokens": 78081882.0, "step": 30810 }, { "entropy": 6.102444124221802, "epoch": 3.556260819388344, "grad_norm": 0.9375, "learning_rate": 0.00037834829294373847, "loss": 5.6589, "mean_token_accuracy": 0.19830785393714906, "num_tokens": 78094914.0, "step": 30815 }, { "entropy": 6.135072708129883, "epoch": 3.5568378534333527, "grad_norm": 0.90234375, "learning_rate": 0.000378311637406835, "loss": 5.7151, "mean_token_accuracy": 0.19131042510271073, "num_tokens": 78106700.0, "step": 30820 }, { "entropy": 6.095702028274536, "epoch": 3.557414887478361, "grad_norm": 0.91796875, "learning_rate": 0.00037827497839509596, "loss": 5.6731, "mean_token_accuracy": 0.20272047370672225, "num_tokens": 78120616.0, "step": 30825 }, { "entropy": 6.230276012420655, "epoch": 3.55799192152337, "grad_norm": 0.96484375, "learning_rate": 0.00037823831590975434, "loss": 5.7252, "mean_token_accuracy": 0.19898563772439956, "num_tokens": 78133068.0, "step": 30830 }, { "entropy": 6.039736795425415, "epoch": 3.5585689555683784, "grad_norm": 1.0703125, "learning_rate": 0.0003782016499520432, "loss": 5.606, "mean_token_accuracy": 0.20099491328001023, "num_tokens": 78146283.0, "step": 30835 }, { "entropy": 6.146065425872803, "epoch": 3.5591459896133872, "grad_norm": 0.98046875, "learning_rate": 0.00037816498052319574, "loss": 5.6758, "mean_token_accuracy": 0.19377929866313934, "num_tokens": 78159014.0, "step": 30840 }, { "entropy": 6.210922622680664, "epoch": 3.559723023658396, "grad_norm": 0.9765625, "learning_rate": 0.00037812830762444554, "loss": 5.6838, "mean_token_accuracy": 0.19790124148130417, "num_tokens": 78171710.0, "step": 30845 }, { "entropy": 6.07824296951294, "epoch": 3.5603000577034045, "grad_norm": 0.97265625, "learning_rate": 0.0003780916312570259, "loss": 5.6375, "mean_token_accuracy": 0.19316561967134477, "num_tokens": 78185193.0, "step": 30850 }, { "entropy": 6.027272033691406, "epoch": 3.560877091748413, "grad_norm": 0.96484375, "learning_rate": 0.0003780549514221705, "loss": 5.5578, "mean_token_accuracy": 0.2072715863585472, "num_tokens": 78198026.0, "step": 30855 }, { "entropy": 6.073961353302002, "epoch": 3.561454125793422, "grad_norm": 1.015625, "learning_rate": 0.00037801826812111297, "loss": 5.6121, "mean_token_accuracy": 0.1993874117732048, "num_tokens": 78210301.0, "step": 30860 }, { "entropy": 6.105393362045288, "epoch": 3.5620311598384307, "grad_norm": 0.94921875, "learning_rate": 0.0003779815813550871, "loss": 5.7344, "mean_token_accuracy": 0.18953127712011336, "num_tokens": 78223778.0, "step": 30865 }, { "entropy": 6.124974966049194, "epoch": 3.562608193883439, "grad_norm": 0.88671875, "learning_rate": 0.00037794489112532697, "loss": 5.6508, "mean_token_accuracy": 0.20686106383800507, "num_tokens": 78236262.0, "step": 30870 }, { "entropy": 6.092332649230957, "epoch": 3.563185227928448, "grad_norm": 0.9296875, "learning_rate": 0.0003779081974330665, "loss": 5.6781, "mean_token_accuracy": 0.19358438104391099, "num_tokens": 78249010.0, "step": 30875 }, { "entropy": 6.0862384796142575, "epoch": 3.5637622619734564, "grad_norm": 0.8359375, "learning_rate": 0.00037787150027953996, "loss": 5.5807, "mean_token_accuracy": 0.2047438457608223, "num_tokens": 78260914.0, "step": 30880 }, { "entropy": 6.111524534225464, "epoch": 3.564339296018465, "grad_norm": 0.984375, "learning_rate": 0.0003778347996659816, "loss": 5.7261, "mean_token_accuracy": 0.1966250240802765, "num_tokens": 78273266.0, "step": 30885 }, { "entropy": 6.180128479003907, "epoch": 3.5649163300634736, "grad_norm": 0.9453125, "learning_rate": 0.0003777980955936259, "loss": 5.6688, "mean_token_accuracy": 0.19904460459947587, "num_tokens": 78284816.0, "step": 30890 }, { "entropy": 6.0757588863372805, "epoch": 3.5654933641084825, "grad_norm": 0.95703125, "learning_rate": 0.00037776138806370726, "loss": 5.6405, "mean_token_accuracy": 0.20568201690912247, "num_tokens": 78298126.0, "step": 30895 }, { "entropy": 6.093035888671875, "epoch": 3.566070398153491, "grad_norm": 1.0390625, "learning_rate": 0.00037772467707746036, "loss": 5.6245, "mean_token_accuracy": 0.2015541449189186, "num_tokens": 78309578.0, "step": 30900 }, { "entropy": 6.153381252288819, "epoch": 3.5666474321985, "grad_norm": 0.93359375, "learning_rate": 0.00037768796263612, "loss": 5.6829, "mean_token_accuracy": 0.2004859685897827, "num_tokens": 78321920.0, "step": 30905 }, { "entropy": 6.10942440032959, "epoch": 3.567224466243508, "grad_norm": 0.9375, "learning_rate": 0.00037765124474092095, "loss": 5.6633, "mean_token_accuracy": 0.2028588369488716, "num_tokens": 78335786.0, "step": 30910 }, { "entropy": 6.015158939361572, "epoch": 3.567801500288517, "grad_norm": 0.828125, "learning_rate": 0.00037761452339309836, "loss": 5.5211, "mean_token_accuracy": 0.21581538170576095, "num_tokens": 78349247.0, "step": 30915 }, { "entropy": 6.094883584976197, "epoch": 3.568378534333526, "grad_norm": 0.92578125, "learning_rate": 0.0003775777985938872, "loss": 5.6072, "mean_token_accuracy": 0.2047165647149086, "num_tokens": 78361942.0, "step": 30920 }, { "entropy": 6.116112995147705, "epoch": 3.5689555683785343, "grad_norm": 0.96484375, "learning_rate": 0.0003775410703445228, "loss": 5.6696, "mean_token_accuracy": 0.19665875732898713, "num_tokens": 78374667.0, "step": 30925 }, { "entropy": 6.136280059814453, "epoch": 3.5695326024235428, "grad_norm": 0.9375, "learning_rate": 0.0003775043386462404, "loss": 5.7255, "mean_token_accuracy": 0.19536905139684677, "num_tokens": 78387174.0, "step": 30930 }, { "entropy": 6.0984354496002195, "epoch": 3.5701096364685516, "grad_norm": 0.953125, "learning_rate": 0.0003774676035002755, "loss": 5.6695, "mean_token_accuracy": 0.19262166172266007, "num_tokens": 78401032.0, "step": 30935 }, { "entropy": 6.1314390182495115, "epoch": 3.5706866705135605, "grad_norm": 0.90234375, "learning_rate": 0.0003774308649078636, "loss": 5.7591, "mean_token_accuracy": 0.19342711716890335, "num_tokens": 78413626.0, "step": 30940 }, { "entropy": 6.1283214569091795, "epoch": 3.571263704558569, "grad_norm": 0.94140625, "learning_rate": 0.0003773941228702405, "loss": 5.6279, "mean_token_accuracy": 0.20067551583051682, "num_tokens": 78426073.0, "step": 30945 }, { "entropy": 6.116126918792725, "epoch": 3.5718407386035778, "grad_norm": 0.8984375, "learning_rate": 0.0003773573773886419, "loss": 5.6541, "mean_token_accuracy": 0.19624051451683044, "num_tokens": 78439139.0, "step": 30950 }, { "entropy": 6.138286781311035, "epoch": 3.572417772648586, "grad_norm": 0.86328125, "learning_rate": 0.00037732062846430376, "loss": 5.681, "mean_token_accuracy": 0.202020500600338, "num_tokens": 78452266.0, "step": 30955 }, { "entropy": 6.053314065933227, "epoch": 3.572994806693595, "grad_norm": 1.203125, "learning_rate": 0.0003772838760984621, "loss": 5.5844, "mean_token_accuracy": 0.2030759036540985, "num_tokens": 78465828.0, "step": 30960 }, { "entropy": 6.166993618011475, "epoch": 3.5735718407386035, "grad_norm": 0.91015625, "learning_rate": 0.0003772471202923531, "loss": 5.7308, "mean_token_accuracy": 0.196023128926754, "num_tokens": 78478648.0, "step": 30965 }, { "entropy": 6.140810585021972, "epoch": 3.5741488747836123, "grad_norm": 0.93359375, "learning_rate": 0.00037721036104721296, "loss": 5.6955, "mean_token_accuracy": 0.19484125524759294, "num_tokens": 78490364.0, "step": 30970 }, { "entropy": 6.074029159545899, "epoch": 3.5747259088286207, "grad_norm": 0.85546875, "learning_rate": 0.00037717359836427817, "loss": 5.6084, "mean_token_accuracy": 0.19940755367279053, "num_tokens": 78502375.0, "step": 30975 }, { "entropy": 6.125685834884644, "epoch": 3.5753029428736296, "grad_norm": 0.94921875, "learning_rate": 0.0003771368322447851, "loss": 5.6987, "mean_token_accuracy": 0.19677154272794722, "num_tokens": 78515138.0, "step": 30980 }, { "entropy": 6.094970655441284, "epoch": 3.575879976918638, "grad_norm": 0.9453125, "learning_rate": 0.0003771000626899704, "loss": 5.5526, "mean_token_accuracy": 0.2114349529147148, "num_tokens": 78526204.0, "step": 30985 }, { "entropy": 6.097543573379516, "epoch": 3.576457010963647, "grad_norm": 0.90625, "learning_rate": 0.00037706328970107077, "loss": 5.6693, "mean_token_accuracy": 0.19401396363973616, "num_tokens": 78539014.0, "step": 30990 }, { "entropy": 6.110267591476441, "epoch": 3.5770340450086557, "grad_norm": 0.890625, "learning_rate": 0.00037702651327932326, "loss": 5.6504, "mean_token_accuracy": 0.20237064808607103, "num_tokens": 78551404.0, "step": 30995 }, { "entropy": 6.13531904220581, "epoch": 3.577611079053664, "grad_norm": 0.99609375, "learning_rate": 0.0003769897334259645, "loss": 5.6423, "mean_token_accuracy": 0.19947001785039903, "num_tokens": 78563934.0, "step": 31000 }, { "entropy": 6.088009357452393, "epoch": 3.5781881130986726, "grad_norm": 0.94921875, "learning_rate": 0.0003769529501422317, "loss": 5.6951, "mean_token_accuracy": 0.19454893469810486, "num_tokens": 78576869.0, "step": 31005 }, { "entropy": 6.166034984588623, "epoch": 3.5787651471436814, "grad_norm": 0.9921875, "learning_rate": 0.00037691616342936215, "loss": 5.6157, "mean_token_accuracy": 0.20636184364557267, "num_tokens": 78589569.0, "step": 31010 }, { "entropy": 6.109597206115723, "epoch": 3.5793421811886903, "grad_norm": 0.84765625, "learning_rate": 0.00037687937328859306, "loss": 5.6355, "mean_token_accuracy": 0.20117154270410537, "num_tokens": 78602241.0, "step": 31015 }, { "entropy": 5.994266605377197, "epoch": 3.5799192152336987, "grad_norm": 0.875, "learning_rate": 0.00037684257972116187, "loss": 5.5466, "mean_token_accuracy": 0.2096637010574341, "num_tokens": 78615508.0, "step": 31020 }, { "entropy": 6.063689804077148, "epoch": 3.5804962492787076, "grad_norm": 0.91015625, "learning_rate": 0.000376805782728306, "loss": 5.5702, "mean_token_accuracy": 0.20972448140382766, "num_tokens": 78627825.0, "step": 31025 }, { "entropy": 6.10751519203186, "epoch": 3.581073283323716, "grad_norm": 0.98828125, "learning_rate": 0.0003767689823112633, "loss": 5.6622, "mean_token_accuracy": 0.19690069705247878, "num_tokens": 78640934.0, "step": 31030 }, { "entropy": 6.151818943023682, "epoch": 3.581650317368725, "grad_norm": 0.9140625, "learning_rate": 0.0003767321784712714, "loss": 5.7085, "mean_token_accuracy": 0.19243402034044266, "num_tokens": 78653189.0, "step": 31035 }, { "entropy": 6.146539926528931, "epoch": 3.5822273514137333, "grad_norm": 1.109375, "learning_rate": 0.0003766953712095682, "loss": 5.6837, "mean_token_accuracy": 0.19898529797792436, "num_tokens": 78665520.0, "step": 31040 }, { "entropy": 6.073436117172241, "epoch": 3.582804385458742, "grad_norm": 0.8515625, "learning_rate": 0.0003766585605273917, "loss": 5.5918, "mean_token_accuracy": 0.20371832549571992, "num_tokens": 78678617.0, "step": 31045 }, { "entropy": 6.134043169021607, "epoch": 3.583381419503751, "grad_norm": 0.96875, "learning_rate": 0.00037662174642598, "loss": 5.6918, "mean_token_accuracy": 0.19946915209293364, "num_tokens": 78690267.0, "step": 31050 }, { "entropy": 6.096961545944214, "epoch": 3.5839584535487594, "grad_norm": 0.93359375, "learning_rate": 0.00037658492890657136, "loss": 5.6132, "mean_token_accuracy": 0.206666000187397, "num_tokens": 78702885.0, "step": 31055 }, { "entropy": 6.092486429214477, "epoch": 3.584535487593768, "grad_norm": 1.09375, "learning_rate": 0.00037654810797040414, "loss": 5.5558, "mean_token_accuracy": 0.2064187854528427, "num_tokens": 78715511.0, "step": 31060 }, { "entropy": 6.14454836845398, "epoch": 3.5851125216387767, "grad_norm": 1.046875, "learning_rate": 0.0003765112836187166, "loss": 5.6911, "mean_token_accuracy": 0.1931006669998169, "num_tokens": 78729020.0, "step": 31065 }, { "entropy": 6.101726770401001, "epoch": 3.5856895556837856, "grad_norm": 2.328125, "learning_rate": 0.0003764744558527476, "loss": 5.5702, "mean_token_accuracy": 0.2070610851049423, "num_tokens": 78742049.0, "step": 31070 }, { "entropy": 6.214226198196411, "epoch": 3.586266589728794, "grad_norm": 0.92578125, "learning_rate": 0.00037643762467373567, "loss": 5.763, "mean_token_accuracy": 0.19577471017837525, "num_tokens": 78753444.0, "step": 31075 }, { "entropy": 6.126230955123901, "epoch": 3.5868436237738024, "grad_norm": 0.89453125, "learning_rate": 0.0003764007900829196, "loss": 5.6398, "mean_token_accuracy": 0.19948194026947022, "num_tokens": 78765793.0, "step": 31080 }, { "entropy": 6.112858676910401, "epoch": 3.5874206578188113, "grad_norm": 0.94140625, "learning_rate": 0.0003763639520815383, "loss": 5.6104, "mean_token_accuracy": 0.20604192614555358, "num_tokens": 78777896.0, "step": 31085 }, { "entropy": 6.1368941307067875, "epoch": 3.58799769186382, "grad_norm": 0.93359375, "learning_rate": 0.0003763271106708309, "loss": 5.7312, "mean_token_accuracy": 0.19502220749855043, "num_tokens": 78789836.0, "step": 31090 }, { "entropy": 6.172865200042724, "epoch": 3.5885747259088285, "grad_norm": 1.0625, "learning_rate": 0.00037629026585203634, "loss": 5.7335, "mean_token_accuracy": 0.1922583431005478, "num_tokens": 78803440.0, "step": 31095 }, { "entropy": 6.145515012741089, "epoch": 3.5891517599538374, "grad_norm": 0.921875, "learning_rate": 0.0003762534176263941, "loss": 5.6746, "mean_token_accuracy": 0.19972286969423295, "num_tokens": 78815627.0, "step": 31100 }, { "entropy": 6.136574029922485, "epoch": 3.589728793998846, "grad_norm": 1.0703125, "learning_rate": 0.00037621656599514335, "loss": 5.6348, "mean_token_accuracy": 0.20076872706413268, "num_tokens": 78828676.0, "step": 31105 }, { "entropy": 6.201172494888306, "epoch": 3.5903058280438547, "grad_norm": 0.9609375, "learning_rate": 0.0003761797109595238, "loss": 5.7091, "mean_token_accuracy": 0.1937038704752922, "num_tokens": 78841551.0, "step": 31110 }, { "entropy": 6.126094150543213, "epoch": 3.590882862088863, "grad_norm": 0.97265625, "learning_rate": 0.0003761428525207749, "loss": 5.6651, "mean_token_accuracy": 0.20048174262046814, "num_tokens": 78853855.0, "step": 31115 }, { "entropy": 6.168135690689087, "epoch": 3.591459896133872, "grad_norm": 0.9453125, "learning_rate": 0.00037610599068013635, "loss": 5.7135, "mean_token_accuracy": 0.19472835659980775, "num_tokens": 78865747.0, "step": 31120 }, { "entropy": 6.063004207611084, "epoch": 3.592036930178881, "grad_norm": 0.9765625, "learning_rate": 0.0003760691254388481, "loss": 5.5392, "mean_token_accuracy": 0.2051069974899292, "num_tokens": 78877965.0, "step": 31125 }, { "entropy": 6.178427696228027, "epoch": 3.5926139642238892, "grad_norm": 0.89453125, "learning_rate": 0.0003760322567981499, "loss": 5.7009, "mean_token_accuracy": 0.19913222789764404, "num_tokens": 78890152.0, "step": 31130 }, { "entropy": 6.078564071655274, "epoch": 3.5931909982688977, "grad_norm": 1.0, "learning_rate": 0.000375995384759282, "loss": 5.6685, "mean_token_accuracy": 0.20232728868722916, "num_tokens": 78903777.0, "step": 31135 }, { "entropy": 6.074064588546753, "epoch": 3.5937680323139065, "grad_norm": 0.94140625, "learning_rate": 0.0003759585093234845, "loss": 5.6579, "mean_token_accuracy": 0.19905036985874175, "num_tokens": 78916452.0, "step": 31140 }, { "entropy": 6.202279949188233, "epoch": 3.5943450663589154, "grad_norm": 1.1328125, "learning_rate": 0.0003759216304919977, "loss": 5.6549, "mean_token_accuracy": 0.2038138896226883, "num_tokens": 78928990.0, "step": 31145 }, { "entropy": 6.20055456161499, "epoch": 3.594922100403924, "grad_norm": 1.0625, "learning_rate": 0.00037588474826606195, "loss": 5.8073, "mean_token_accuracy": 0.18546199500560762, "num_tokens": 78943068.0, "step": 31150 }, { "entropy": 6.096027088165283, "epoch": 3.595499134448932, "grad_norm": 1.046875, "learning_rate": 0.00037584786264691783, "loss": 5.61, "mean_token_accuracy": 0.20543482005596161, "num_tokens": 78956572.0, "step": 31155 }, { "entropy": 6.1550483226776125, "epoch": 3.596076168493941, "grad_norm": 0.98046875, "learning_rate": 0.00037581097363580595, "loss": 5.7362, "mean_token_accuracy": 0.19378693252801896, "num_tokens": 78969339.0, "step": 31160 }, { "entropy": 6.17869086265564, "epoch": 3.59665320253895, "grad_norm": 1.0, "learning_rate": 0.00037577408123396703, "loss": 5.6656, "mean_token_accuracy": 0.2036919116973877, "num_tokens": 78981860.0, "step": 31165 }, { "entropy": 6.159994745254517, "epoch": 3.5972302365839584, "grad_norm": 0.8828125, "learning_rate": 0.00037573718544264194, "loss": 5.6571, "mean_token_accuracy": 0.19783925414085388, "num_tokens": 78993184.0, "step": 31170 }, { "entropy": 6.07230396270752, "epoch": 3.597807270628967, "grad_norm": 0.94140625, "learning_rate": 0.0003757002862630717, "loss": 5.6408, "mean_token_accuracy": 0.198989836871624, "num_tokens": 79004836.0, "step": 31175 }, { "entropy": 6.12829852104187, "epoch": 3.5983843046739756, "grad_norm": 0.98828125, "learning_rate": 0.0003756633836964974, "loss": 5.6089, "mean_token_accuracy": 0.20449527949094773, "num_tokens": 79016593.0, "step": 31180 }, { "entropy": 6.113247394561768, "epoch": 3.5989613387189845, "grad_norm": 0.98828125, "learning_rate": 0.0003756264777441601, "loss": 5.6588, "mean_token_accuracy": 0.20088752508163452, "num_tokens": 79030150.0, "step": 31185 }, { "entropy": 6.154535484313965, "epoch": 3.599538372763993, "grad_norm": 0.97265625, "learning_rate": 0.0003755895684073012, "loss": 5.6677, "mean_token_accuracy": 0.19760429710149766, "num_tokens": 79042407.0, "step": 31190 }, { "entropy": 6.067593050003052, "epoch": 3.6001154068090018, "grad_norm": 0.96484375, "learning_rate": 0.00037555265568716214, "loss": 5.6681, "mean_token_accuracy": 0.2039575919508934, "num_tokens": 79055169.0, "step": 31195 }, { "entropy": 6.104705572128296, "epoch": 3.6006924408540106, "grad_norm": 0.85546875, "learning_rate": 0.0003755157395849845, "loss": 5.6724, "mean_token_accuracy": 0.20768189430236816, "num_tokens": 79069907.0, "step": 31200 }, { "entropy": 6.1781505107879635, "epoch": 3.601269474899019, "grad_norm": 0.99609375, "learning_rate": 0.00037547882010200985, "loss": 5.7283, "mean_token_accuracy": 0.2009938195347786, "num_tokens": 79082270.0, "step": 31205 }, { "entropy": 6.166623640060425, "epoch": 3.6018465089440275, "grad_norm": 0.99609375, "learning_rate": 0.00037544189723948005, "loss": 5.6681, "mean_token_accuracy": 0.20290228575468064, "num_tokens": 79094648.0, "step": 31210 }, { "entropy": 6.038410568237305, "epoch": 3.6024235429890363, "grad_norm": 0.9765625, "learning_rate": 0.0003754049709986368, "loss": 5.5687, "mean_token_accuracy": 0.2051565796136856, "num_tokens": 79106360.0, "step": 31215 }, { "entropy": 6.184214544296265, "epoch": 3.603000577034045, "grad_norm": 1.0234375, "learning_rate": 0.0003753680413807223, "loss": 5.7577, "mean_token_accuracy": 0.19263286888599396, "num_tokens": 79120030.0, "step": 31220 }, { "entropy": 6.142088794708252, "epoch": 3.6035776110790536, "grad_norm": 0.97265625, "learning_rate": 0.0003753311083869786, "loss": 5.6498, "mean_token_accuracy": 0.20029440373182297, "num_tokens": 79132200.0, "step": 31225 }, { "entropy": 6.084656143188477, "epoch": 3.6041546451240625, "grad_norm": 0.9375, "learning_rate": 0.0003752941720186479, "loss": 5.6411, "mean_token_accuracy": 0.2016658678650856, "num_tokens": 79144520.0, "step": 31230 }, { "entropy": 6.113428068161011, "epoch": 3.604731679169071, "grad_norm": 0.95703125, "learning_rate": 0.00037525723227697255, "loss": 5.5905, "mean_token_accuracy": 0.20646243691444396, "num_tokens": 79159203.0, "step": 31235 }, { "entropy": 6.121013355255127, "epoch": 3.6053087132140798, "grad_norm": 0.96484375, "learning_rate": 0.000375220289163195, "loss": 5.7295, "mean_token_accuracy": 0.19636738002300264, "num_tokens": 79171490.0, "step": 31240 }, { "entropy": 6.109932565689087, "epoch": 3.605885747259088, "grad_norm": 1.1015625, "learning_rate": 0.0003751833426785578, "loss": 5.6564, "mean_token_accuracy": 0.2032413586974144, "num_tokens": 79184835.0, "step": 31245 }, { "entropy": 6.104979991912842, "epoch": 3.606462781304097, "grad_norm": 1.0, "learning_rate": 0.00037514639282430355, "loss": 5.6169, "mean_token_accuracy": 0.20019723773002623, "num_tokens": 79197554.0, "step": 31250 }, { "entropy": 6.168771028518677, "epoch": 3.6070398153491054, "grad_norm": 1.0859375, "learning_rate": 0.0003751094396016752, "loss": 5.6995, "mean_token_accuracy": 0.20213110893964767, "num_tokens": 79212034.0, "step": 31255 }, { "entropy": 6.129372692108154, "epoch": 3.6076168493941143, "grad_norm": 0.91015625, "learning_rate": 0.0003750724830119156, "loss": 5.6832, "mean_token_accuracy": 0.19807273298501968, "num_tokens": 79225180.0, "step": 31260 }, { "entropy": 6.145452785491943, "epoch": 3.6081938834391227, "grad_norm": 0.890625, "learning_rate": 0.0003750355230562677, "loss": 5.7132, "mean_token_accuracy": 0.19505878388881684, "num_tokens": 79238447.0, "step": 31265 }, { "entropy": 6.029267930984497, "epoch": 3.6087709174841316, "grad_norm": 0.87109375, "learning_rate": 0.00037499855973597467, "loss": 5.5644, "mean_token_accuracy": 0.21064301282167436, "num_tokens": 79251636.0, "step": 31270 }, { "entropy": 6.031064510345459, "epoch": 3.6093479515291405, "grad_norm": 0.91796875, "learning_rate": 0.0003749615930522798, "loss": 5.5616, "mean_token_accuracy": 0.21446867138147355, "num_tokens": 79264555.0, "step": 31275 }, { "entropy": 6.08279275894165, "epoch": 3.609924985574149, "grad_norm": 0.984375, "learning_rate": 0.0003749246230064264, "loss": 5.6043, "mean_token_accuracy": 0.20554226785898208, "num_tokens": 79277224.0, "step": 31280 }, { "entropy": 6.154872608184815, "epoch": 3.6105020196191573, "grad_norm": 0.9765625, "learning_rate": 0.0003748876495996579, "loss": 5.6278, "mean_token_accuracy": 0.19912316352128984, "num_tokens": 79289411.0, "step": 31285 }, { "entropy": 6.084700632095337, "epoch": 3.611079053664166, "grad_norm": 0.90625, "learning_rate": 0.00037485067283321794, "loss": 5.6332, "mean_token_accuracy": 0.20061580538749696, "num_tokens": 79302692.0, "step": 31290 }, { "entropy": 5.981883335113525, "epoch": 3.611656087709175, "grad_norm": 0.9140625, "learning_rate": 0.00037481369270835014, "loss": 5.5458, "mean_token_accuracy": 0.21054453253746033, "num_tokens": 79316309.0, "step": 31295 }, { "entropy": 6.198971366882324, "epoch": 3.6122331217541834, "grad_norm": 0.83203125, "learning_rate": 0.00037477670922629846, "loss": 5.7164, "mean_token_accuracy": 0.19782219529151918, "num_tokens": 79330595.0, "step": 31300 }, { "entropy": 6.192024183273316, "epoch": 3.6128101557991923, "grad_norm": 0.96484375, "learning_rate": 0.00037473972238830674, "loss": 5.7029, "mean_token_accuracy": 0.19738591760396956, "num_tokens": 79342539.0, "step": 31305 }, { "entropy": 5.916602087020874, "epoch": 3.6133871898442007, "grad_norm": 0.7890625, "learning_rate": 0.00037470273219561895, "loss": 5.4534, "mean_token_accuracy": 0.21594885140657424, "num_tokens": 79355566.0, "step": 31310 }, { "entropy": 6.106811761856079, "epoch": 3.6139642238892096, "grad_norm": 1.078125, "learning_rate": 0.00037466573864947925, "loss": 5.6467, "mean_token_accuracy": 0.19952652752399444, "num_tokens": 79368500.0, "step": 31315 }, { "entropy": 6.128374910354614, "epoch": 3.614541257934218, "grad_norm": 0.93359375, "learning_rate": 0.00037462874175113193, "loss": 5.646, "mean_token_accuracy": 0.19766153693199157, "num_tokens": 79380558.0, "step": 31320 }, { "entropy": 6.0616683006286625, "epoch": 3.615118291979227, "grad_norm": 0.90234375, "learning_rate": 0.0003745917415018214, "loss": 5.6455, "mean_token_accuracy": 0.20524810403585433, "num_tokens": 79393590.0, "step": 31325 }, { "entropy": 6.130316066741943, "epoch": 3.6156953260242353, "grad_norm": 0.88671875, "learning_rate": 0.00037455473790279223, "loss": 5.6335, "mean_token_accuracy": 0.1942039117217064, "num_tokens": 79405403.0, "step": 31330 }, { "entropy": 6.099060583114624, "epoch": 3.616272360069244, "grad_norm": 0.9375, "learning_rate": 0.0003745177309552887, "loss": 5.6684, "mean_token_accuracy": 0.19182250499725342, "num_tokens": 79417867.0, "step": 31335 }, { "entropy": 5.975255060195923, "epoch": 3.6168493941142525, "grad_norm": 0.86328125, "learning_rate": 0.0003744807206605558, "loss": 5.4463, "mean_token_accuracy": 0.2217454880475998, "num_tokens": 79431355.0, "step": 31340 }, { "entropy": 6.097650623321533, "epoch": 3.6174264281592614, "grad_norm": 0.92578125, "learning_rate": 0.0003744437070198383, "loss": 5.6256, "mean_token_accuracy": 0.19868793189525605, "num_tokens": 79443355.0, "step": 31345 }, { "entropy": 6.163055086135865, "epoch": 3.6180034622042703, "grad_norm": 0.95703125, "learning_rate": 0.0003744066900343812, "loss": 5.7217, "mean_token_accuracy": 0.19222093373537064, "num_tokens": 79457082.0, "step": 31350 }, { "entropy": 6.184404182434082, "epoch": 3.6185804962492787, "grad_norm": 1.078125, "learning_rate": 0.0003743696697054293, "loss": 5.6926, "mean_token_accuracy": 0.20261137932538986, "num_tokens": 79469529.0, "step": 31355 }, { "entropy": 6.102014017105103, "epoch": 3.619157530294287, "grad_norm": 0.8984375, "learning_rate": 0.000374332646034228, "loss": 5.617, "mean_token_accuracy": 0.20069116950035096, "num_tokens": 79481994.0, "step": 31360 }, { "entropy": 6.175708436965943, "epoch": 3.619734564339296, "grad_norm": 0.9375, "learning_rate": 0.00037429561902202246, "loss": 5.7504, "mean_token_accuracy": 0.18803782314062117, "num_tokens": 79496813.0, "step": 31365 }, { "entropy": 6.144582653045655, "epoch": 3.620311598384305, "grad_norm": 0.9765625, "learning_rate": 0.00037425858867005815, "loss": 5.6686, "mean_token_accuracy": 0.1948112055659294, "num_tokens": 79508898.0, "step": 31370 }, { "entropy": 6.175226783752441, "epoch": 3.6208886324293132, "grad_norm": 0.9375, "learning_rate": 0.0003742215549795805, "loss": 5.6721, "mean_token_accuracy": 0.20321782380342485, "num_tokens": 79521026.0, "step": 31375 }, { "entropy": 6.166785764694214, "epoch": 3.621465666474322, "grad_norm": 0.99609375, "learning_rate": 0.000374184517951835, "loss": 5.6464, "mean_token_accuracy": 0.20286843925714493, "num_tokens": 79532434.0, "step": 31380 }, { "entropy": 6.119183158874511, "epoch": 3.6220427005193305, "grad_norm": 1.09375, "learning_rate": 0.00037414747758806764, "loss": 5.6938, "mean_token_accuracy": 0.19908654689788818, "num_tokens": 79545144.0, "step": 31385 }, { "entropy": 6.1015989780426025, "epoch": 3.6226197345643394, "grad_norm": 1.0546875, "learning_rate": 0.00037411043388952417, "loss": 5.6543, "mean_token_accuracy": 0.19497503638267516, "num_tokens": 79557266.0, "step": 31390 }, { "entropy": 6.11690731048584, "epoch": 3.623196768609348, "grad_norm": 0.9765625, "learning_rate": 0.0003740733868574504, "loss": 5.6307, "mean_token_accuracy": 0.19708458185195923, "num_tokens": 79571091.0, "step": 31395 }, { "entropy": 6.059296703338623, "epoch": 3.6237738026543567, "grad_norm": 0.98046875, "learning_rate": 0.0003740363364930925, "loss": 5.5911, "mean_token_accuracy": 0.20651842206716536, "num_tokens": 79584151.0, "step": 31400 }, { "entropy": 6.0477519035339355, "epoch": 3.6243508366993655, "grad_norm": 0.96484375, "learning_rate": 0.0003739992827976966, "loss": 5.6074, "mean_token_accuracy": 0.20339070856571198, "num_tokens": 79596110.0, "step": 31405 }, { "entropy": 6.184017133712769, "epoch": 3.624927870744374, "grad_norm": 0.953125, "learning_rate": 0.000373962225772509, "loss": 5.6691, "mean_token_accuracy": 0.1967795044183731, "num_tokens": 79608559.0, "step": 31410 }, { "entropy": 6.211363792419434, "epoch": 3.6255049047893824, "grad_norm": 1.046875, "learning_rate": 0.00037392516541877606, "loss": 5.6728, "mean_token_accuracy": 0.2042370244860649, "num_tokens": 79621267.0, "step": 31415 }, { "entropy": 6.085593748092651, "epoch": 3.6260819388343912, "grad_norm": 0.96484375, "learning_rate": 0.0003738881017377444, "loss": 5.6292, "mean_token_accuracy": 0.19884878695011138, "num_tokens": 79633282.0, "step": 31420 }, { "entropy": 6.102064180374145, "epoch": 3.6266589728794, "grad_norm": 0.9375, "learning_rate": 0.0003738510347306605, "loss": 5.651, "mean_token_accuracy": 0.20146681368350983, "num_tokens": 79644705.0, "step": 31425 }, { "entropy": 6.099654722213745, "epoch": 3.6272360069244085, "grad_norm": 0.9296875, "learning_rate": 0.00037381396439877115, "loss": 5.5985, "mean_token_accuracy": 0.2030884489417076, "num_tokens": 79657846.0, "step": 31430 }, { "entropy": 6.141608333587646, "epoch": 3.627813040969417, "grad_norm": 0.90625, "learning_rate": 0.0003737768907433232, "loss": 5.6223, "mean_token_accuracy": 0.20401741117238997, "num_tokens": 79669753.0, "step": 31435 }, { "entropy": 6.084135389328003, "epoch": 3.628390075014426, "grad_norm": 0.84375, "learning_rate": 0.0003737398137655636, "loss": 5.611, "mean_token_accuracy": 0.2058655336499214, "num_tokens": 79683812.0, "step": 31440 }, { "entropy": 6.0418041229248045, "epoch": 3.6289671090594346, "grad_norm": 0.9609375, "learning_rate": 0.00037370273346673945, "loss": 5.6166, "mean_token_accuracy": 0.20544273257255555, "num_tokens": 79697162.0, "step": 31445 }, { "entropy": 6.100403261184693, "epoch": 3.629544143104443, "grad_norm": 0.9453125, "learning_rate": 0.0003736656498480978, "loss": 5.6244, "mean_token_accuracy": 0.2104505330324173, "num_tokens": 79710195.0, "step": 31450 }, { "entropy": 6.04806227684021, "epoch": 3.630121177149452, "grad_norm": 0.96484375, "learning_rate": 0.0003736285629108861, "loss": 5.583, "mean_token_accuracy": 0.2008063316345215, "num_tokens": 79722127.0, "step": 31455 }, { "entropy": 6.110556697845459, "epoch": 3.6306982111944603, "grad_norm": 0.96484375, "learning_rate": 0.00037359147265635166, "loss": 5.6567, "mean_token_accuracy": 0.19124801456928253, "num_tokens": 79733360.0, "step": 31460 }, { "entropy": 6.197495937347412, "epoch": 3.631275245239469, "grad_norm": 0.8515625, "learning_rate": 0.000373554379085742, "loss": 5.7007, "mean_token_accuracy": 0.20026664882898332, "num_tokens": 79746948.0, "step": 31465 }, { "entropy": 6.004641771316528, "epoch": 3.6318522792844776, "grad_norm": 0.98828125, "learning_rate": 0.0003735172822003048, "loss": 5.551, "mean_token_accuracy": 0.21951310932636262, "num_tokens": 79759816.0, "step": 31470 }, { "entropy": 6.110378551483154, "epoch": 3.6324293133294865, "grad_norm": 0.92578125, "learning_rate": 0.0003734801820012878, "loss": 5.6079, "mean_token_accuracy": 0.19847784638404847, "num_tokens": 79772205.0, "step": 31475 }, { "entropy": 6.080461645126343, "epoch": 3.6330063473744953, "grad_norm": 1.0390625, "learning_rate": 0.00037344307848993856, "loss": 5.6062, "mean_token_accuracy": 0.20924705266952515, "num_tokens": 79785886.0, "step": 31480 }, { "entropy": 6.084271717071533, "epoch": 3.6335833814195038, "grad_norm": 1.0078125, "learning_rate": 0.00037340597166750546, "loss": 5.6346, "mean_token_accuracy": 0.20435042530298234, "num_tokens": 79798223.0, "step": 31485 }, { "entropy": 6.123413944244385, "epoch": 3.634160415464512, "grad_norm": 0.92578125, "learning_rate": 0.00037336886153523633, "loss": 5.7318, "mean_token_accuracy": 0.20027197301387786, "num_tokens": 79812374.0, "step": 31490 }, { "entropy": 6.14485993385315, "epoch": 3.634737449509521, "grad_norm": 0.9765625, "learning_rate": 0.0003733317480943795, "loss": 5.6858, "mean_token_accuracy": 0.1963226854801178, "num_tokens": 79825406.0, "step": 31495 }, { "entropy": 6.153828144073486, "epoch": 3.63531448355453, "grad_norm": 0.98046875, "learning_rate": 0.000373294631346183, "loss": 5.659, "mean_token_accuracy": 0.2052447095513344, "num_tokens": 79839684.0, "step": 31500 }, { "entropy": 6.101085996627807, "epoch": 3.6358915175995383, "grad_norm": 1.0703125, "learning_rate": 0.0003732575112918955, "loss": 5.6744, "mean_token_accuracy": 0.20450015962123871, "num_tokens": 79851673.0, "step": 31505 }, { "entropy": 6.074370670318603, "epoch": 3.636468551644547, "grad_norm": 0.91796875, "learning_rate": 0.0003732203879327654, "loss": 5.5735, "mean_token_accuracy": 0.20676430612802504, "num_tokens": 79864996.0, "step": 31510 }, { "entropy": 6.201430368423462, "epoch": 3.6370455856895556, "grad_norm": 0.99609375, "learning_rate": 0.0003731832612700413, "loss": 5.7188, "mean_token_accuracy": 0.19358039051294326, "num_tokens": 79877067.0, "step": 31515 }, { "entropy": 6.09938383102417, "epoch": 3.6376226197345645, "grad_norm": 1.015625, "learning_rate": 0.00037314613130497203, "loss": 5.6407, "mean_token_accuracy": 0.2018402874469757, "num_tokens": 79889246.0, "step": 31520 }, { "entropy": 6.1251811504364015, "epoch": 3.638199653779573, "grad_norm": 1.203125, "learning_rate": 0.00037310899803880636, "loss": 5.7036, "mean_token_accuracy": 0.1957951843738556, "num_tokens": 79903020.0, "step": 31525 }, { "entropy": 6.089523792266846, "epoch": 3.6387766878245817, "grad_norm": 0.93359375, "learning_rate": 0.0003730718614727934, "loss": 5.6061, "mean_token_accuracy": 0.2040889173746109, "num_tokens": 79914688.0, "step": 31530 }, { "entropy": 6.084633922576904, "epoch": 3.63935372186959, "grad_norm": 1.0234375, "learning_rate": 0.00037303472160818196, "loss": 5.5667, "mean_token_accuracy": 0.19837968945503234, "num_tokens": 79927489.0, "step": 31535 }, { "entropy": 6.089060115814209, "epoch": 3.639930755914599, "grad_norm": 0.9609375, "learning_rate": 0.00037299757844622134, "loss": 5.669, "mean_token_accuracy": 0.20063736885786057, "num_tokens": 79939760.0, "step": 31540 }, { "entropy": 6.131798601150512, "epoch": 3.6405077899596074, "grad_norm": 0.96875, "learning_rate": 0.0003729604319881608, "loss": 5.6852, "mean_token_accuracy": 0.20525304675102235, "num_tokens": 79952651.0, "step": 31545 }, { "entropy": 6.07037672996521, "epoch": 3.6410848240046163, "grad_norm": 0.9921875, "learning_rate": 0.0003729232822352499, "loss": 5.5902, "mean_token_accuracy": 0.20292763859033586, "num_tokens": 79965058.0, "step": 31550 }, { "entropy": 6.131277751922608, "epoch": 3.641661858049625, "grad_norm": 0.9453125, "learning_rate": 0.00037288612918873806, "loss": 5.6853, "mean_token_accuracy": 0.1946774885058403, "num_tokens": 79978167.0, "step": 31555 }, { "entropy": 6.111083507537842, "epoch": 3.6422388920946336, "grad_norm": 0.91015625, "learning_rate": 0.00037284897284987483, "loss": 5.5665, "mean_token_accuracy": 0.21005533039569854, "num_tokens": 79991170.0, "step": 31560 }, { "entropy": 6.084380674362182, "epoch": 3.642815926139642, "grad_norm": 0.96875, "learning_rate": 0.00037281181321991005, "loss": 5.6336, "mean_token_accuracy": 0.20630927234888077, "num_tokens": 80003220.0, "step": 31565 }, { "entropy": 5.968671894073486, "epoch": 3.643392960184651, "grad_norm": 1.0, "learning_rate": 0.00037277465030009343, "loss": 5.5643, "mean_token_accuracy": 0.2134526029229164, "num_tokens": 80015928.0, "step": 31570 }, { "entropy": 6.100400924682617, "epoch": 3.6439699942296597, "grad_norm": 0.9921875, "learning_rate": 0.0003727374840916751, "loss": 5.5705, "mean_token_accuracy": 0.21390258967876435, "num_tokens": 80028314.0, "step": 31575 }, { "entropy": 6.099554061889648, "epoch": 3.644547028274668, "grad_norm": 1.015625, "learning_rate": 0.000372700314595905, "loss": 5.5845, "mean_token_accuracy": 0.20813449323177338, "num_tokens": 80040581.0, "step": 31580 }, { "entropy": 6.104198884963989, "epoch": 3.645124062319677, "grad_norm": 0.9609375, "learning_rate": 0.00037266314181403336, "loss": 5.6477, "mean_token_accuracy": 0.20370962470769882, "num_tokens": 80052501.0, "step": 31585 }, { "entropy": 6.0481285572052, "epoch": 3.6457010963646854, "grad_norm": 1.15625, "learning_rate": 0.00037262596574731043, "loss": 5.4381, "mean_token_accuracy": 0.21739273220300676, "num_tokens": 80065692.0, "step": 31590 }, { "entropy": 6.01230754852295, "epoch": 3.6462781304096943, "grad_norm": 0.9609375, "learning_rate": 0.00037258878639698673, "loss": 5.5625, "mean_token_accuracy": 0.21352598071098328, "num_tokens": 80079033.0, "step": 31595 }, { "entropy": 6.015496683120728, "epoch": 3.6468551644547027, "grad_norm": 0.90234375, "learning_rate": 0.00037255160376431257, "loss": 5.6469, "mean_token_accuracy": 0.20038847327232362, "num_tokens": 80092362.0, "step": 31600 }, { "entropy": 6.121754503250122, "epoch": 3.6474321984997116, "grad_norm": 0.98828125, "learning_rate": 0.00037251441785053873, "loss": 5.6576, "mean_token_accuracy": 0.2037595272064209, "num_tokens": 80106094.0, "step": 31605 }, { "entropy": 6.077968549728394, "epoch": 3.64800923254472, "grad_norm": 0.98828125, "learning_rate": 0.00037247722865691585, "loss": 5.5859, "mean_token_accuracy": 0.21136993616819383, "num_tokens": 80120000.0, "step": 31610 }, { "entropy": 6.1014386177062985, "epoch": 3.648586266589729, "grad_norm": 0.96484375, "learning_rate": 0.0003724400361846948, "loss": 5.6064, "mean_token_accuracy": 0.20282262116670607, "num_tokens": 80131769.0, "step": 31615 }, { "entropy": 6.049617958068848, "epoch": 3.6491633006347373, "grad_norm": 0.96875, "learning_rate": 0.00037240284043512663, "loss": 5.5564, "mean_token_accuracy": 0.21292811930179595, "num_tokens": 80143870.0, "step": 31620 }, { "entropy": 6.060082960128784, "epoch": 3.649740334679746, "grad_norm": 0.90234375, "learning_rate": 0.0003723656414094622, "loss": 5.5724, "mean_token_accuracy": 0.20353516042232514, "num_tokens": 80157753.0, "step": 31625 }, { "entropy": 6.075562238693237, "epoch": 3.650317368724755, "grad_norm": 0.95703125, "learning_rate": 0.00037232843910895276, "loss": 5.5855, "mean_token_accuracy": 0.20195764750242234, "num_tokens": 80170432.0, "step": 31630 }, { "entropy": 6.0409571647644045, "epoch": 3.6508944027697634, "grad_norm": 0.890625, "learning_rate": 0.0003722912335348497, "loss": 5.6243, "mean_token_accuracy": 0.20404012352228165, "num_tokens": 80182855.0, "step": 31635 }, { "entropy": 6.110857391357422, "epoch": 3.651471436814772, "grad_norm": 0.921875, "learning_rate": 0.0003722540246884043, "loss": 5.6566, "mean_token_accuracy": 0.2052586182951927, "num_tokens": 80195509.0, "step": 31640 }, { "entropy": 6.084488201141357, "epoch": 3.6520484708597807, "grad_norm": 0.9375, "learning_rate": 0.0003722168125708681, "loss": 5.6234, "mean_token_accuracy": 0.20165701061487198, "num_tokens": 80208055.0, "step": 31645 }, { "entropy": 6.10513744354248, "epoch": 3.6526255049047895, "grad_norm": 0.921875, "learning_rate": 0.00037217959718349264, "loss": 5.623, "mean_token_accuracy": 0.20423029214143754, "num_tokens": 80219653.0, "step": 31650 }, { "entropy": 6.163469839096069, "epoch": 3.653202538949798, "grad_norm": 0.953125, "learning_rate": 0.0003721423785275298, "loss": 5.6164, "mean_token_accuracy": 0.20854012668132782, "num_tokens": 80232793.0, "step": 31655 }, { "entropy": 6.124817609786987, "epoch": 3.653779572994807, "grad_norm": 0.95703125, "learning_rate": 0.0003721051566042313, "loss": 5.6171, "mean_token_accuracy": 0.20256602317094802, "num_tokens": 80245237.0, "step": 31660 }, { "entropy": 6.075761890411377, "epoch": 3.6543566070398152, "grad_norm": 0.8671875, "learning_rate": 0.000372067931414849, "loss": 5.5633, "mean_token_accuracy": 0.20456094443798065, "num_tokens": 80258934.0, "step": 31665 }, { "entropy": 6.164009284973145, "epoch": 3.654933641084824, "grad_norm": 0.921875, "learning_rate": 0.0003720307029606351, "loss": 5.7022, "mean_token_accuracy": 0.19464025795459747, "num_tokens": 80271605.0, "step": 31670 }, { "entropy": 6.068563556671142, "epoch": 3.6555106751298325, "grad_norm": 0.921875, "learning_rate": 0.00037199347124284167, "loss": 5.5203, "mean_token_accuracy": 0.2149454951286316, "num_tokens": 80284332.0, "step": 31675 }, { "entropy": 6.1339404582977295, "epoch": 3.6560877091748414, "grad_norm": 0.85546875, "learning_rate": 0.0003719562362627211, "loss": 5.6466, "mean_token_accuracy": 0.1995929554104805, "num_tokens": 80297277.0, "step": 31680 }, { "entropy": 6.114528608322144, "epoch": 3.6566647432198502, "grad_norm": 0.921875, "learning_rate": 0.00037191899802152556, "loss": 5.7024, "mean_token_accuracy": 0.1973910540342331, "num_tokens": 80310915.0, "step": 31685 }, { "entropy": 6.118069076538086, "epoch": 3.6572417772648587, "grad_norm": 0.93359375, "learning_rate": 0.00037188175652050776, "loss": 5.6699, "mean_token_accuracy": 0.19662147015333176, "num_tokens": 80323041.0, "step": 31690 }, { "entropy": 6.114025974273682, "epoch": 3.657818811309867, "grad_norm": 0.9609375, "learning_rate": 0.0003718445117609202, "loss": 5.6346, "mean_token_accuracy": 0.2040783792734146, "num_tokens": 80335543.0, "step": 31695 }, { "entropy": 6.098688316345215, "epoch": 3.658395845354876, "grad_norm": 0.9609375, "learning_rate": 0.00037180726374401555, "loss": 5.6487, "mean_token_accuracy": 0.20411901772022248, "num_tokens": 80348362.0, "step": 31700 }, { "entropy": 6.075296688079834, "epoch": 3.658972879399885, "grad_norm": 0.8828125, "learning_rate": 0.0003717700124710467, "loss": 5.5031, "mean_token_accuracy": 0.21381102949380876, "num_tokens": 80361189.0, "step": 31705 }, { "entropy": 6.168242454528809, "epoch": 3.659549913444893, "grad_norm": 1.046875, "learning_rate": 0.0003717327579432665, "loss": 5.7004, "mean_token_accuracy": 0.20038793683052064, "num_tokens": 80373732.0, "step": 31710 }, { "entropy": 5.927784585952759, "epoch": 3.6601269474899016, "grad_norm": 0.92578125, "learning_rate": 0.00037169550016192805, "loss": 5.5107, "mean_token_accuracy": 0.21772821247577667, "num_tokens": 80388140.0, "step": 31715 }, { "entropy": 5.994295883178711, "epoch": 3.6607039815349105, "grad_norm": 0.95703125, "learning_rate": 0.00037165823912828453, "loss": 5.5563, "mean_token_accuracy": 0.21009753793478012, "num_tokens": 80402085.0, "step": 31720 }, { "entropy": 6.139581871032715, "epoch": 3.6612810155799194, "grad_norm": 0.8671875, "learning_rate": 0.0003716209748435891, "loss": 5.6694, "mean_token_accuracy": 0.20428819954395294, "num_tokens": 80414433.0, "step": 31725 }, { "entropy": 6.054508543014526, "epoch": 3.661858049624928, "grad_norm": 0.87109375, "learning_rate": 0.0003715837073090952, "loss": 5.6241, "mean_token_accuracy": 0.20364027470350266, "num_tokens": 80427414.0, "step": 31730 }, { "entropy": 6.183839225769043, "epoch": 3.6624350836699366, "grad_norm": 0.88671875, "learning_rate": 0.0003715464365260563, "loss": 5.7128, "mean_token_accuracy": 0.20573733747005463, "num_tokens": 80441525.0, "step": 31735 }, { "entropy": 6.212820720672608, "epoch": 3.663012117714945, "grad_norm": 0.9453125, "learning_rate": 0.0003715091624957259, "loss": 5.7024, "mean_token_accuracy": 0.19779739081859588, "num_tokens": 80453555.0, "step": 31740 }, { "entropy": 6.091965055465698, "epoch": 3.663589151759954, "grad_norm": 0.890625, "learning_rate": 0.00037147188521935784, "loss": 5.6264, "mean_token_accuracy": 0.20326377153396608, "num_tokens": 80466817.0, "step": 31745 }, { "entropy": 6.129201173782349, "epoch": 3.6641661858049623, "grad_norm": 0.95703125, "learning_rate": 0.0003714346046982058, "loss": 5.6564, "mean_token_accuracy": 0.20087906271219252, "num_tokens": 80477792.0, "step": 31750 }, { "entropy": 6.096215391159058, "epoch": 3.664743219849971, "grad_norm": 0.90625, "learning_rate": 0.0003713973209335237, "loss": 5.5781, "mean_token_accuracy": 0.20512400269508363, "num_tokens": 80489913.0, "step": 31755 }, { "entropy": 6.001148509979248, "epoch": 3.66532025389498, "grad_norm": 1.0078125, "learning_rate": 0.00037136003392656565, "loss": 5.527, "mean_token_accuracy": 0.20822664499282836, "num_tokens": 80502361.0, "step": 31760 }, { "entropy": 6.0439900875091555, "epoch": 3.6658972879399885, "grad_norm": 0.8984375, "learning_rate": 0.0003713227436785858, "loss": 5.5834, "mean_token_accuracy": 0.21159652918577193, "num_tokens": 80515117.0, "step": 31765 }, { "entropy": 6.117327785491943, "epoch": 3.666474321984997, "grad_norm": 1.03125, "learning_rate": 0.0003712854501908382, "loss": 5.6715, "mean_token_accuracy": 0.20520202070474625, "num_tokens": 80527726.0, "step": 31770 }, { "entropy": 6.110523128509522, "epoch": 3.6670513560300058, "grad_norm": 0.88671875, "learning_rate": 0.0003712481534645772, "loss": 5.6218, "mean_token_accuracy": 0.2014847904443741, "num_tokens": 80540863.0, "step": 31775 }, { "entropy": 5.997666931152343, "epoch": 3.6676283900750146, "grad_norm": 1.296875, "learning_rate": 0.00037121085350105755, "loss": 5.5299, "mean_token_accuracy": 0.21280371248722077, "num_tokens": 80553597.0, "step": 31780 }, { "entropy": 6.07890362739563, "epoch": 3.668205424120023, "grad_norm": 1.046875, "learning_rate": 0.0003711735503015336, "loss": 5.6014, "mean_token_accuracy": 0.20825276523828506, "num_tokens": 80566644.0, "step": 31785 }, { "entropy": 6.170917558670044, "epoch": 3.668782458165032, "grad_norm": 1.03125, "learning_rate": 0.00037113624386726004, "loss": 5.7298, "mean_token_accuracy": 0.19499072879552842, "num_tokens": 80579696.0, "step": 31790 }, { "entropy": 6.083804702758789, "epoch": 3.6693594922100403, "grad_norm": 0.9453125, "learning_rate": 0.0003710989341994916, "loss": 5.5953, "mean_token_accuracy": 0.2050243452191353, "num_tokens": 80592794.0, "step": 31795 }, { "entropy": 6.066362810134888, "epoch": 3.669936526255049, "grad_norm": 0.98828125, "learning_rate": 0.00037106162129948333, "loss": 5.6143, "mean_token_accuracy": 0.19946397244930267, "num_tokens": 80606587.0, "step": 31800 }, { "entropy": 6.152547931671142, "epoch": 3.6705135603000576, "grad_norm": 0.95703125, "learning_rate": 0.00037102430516849016, "loss": 5.6642, "mean_token_accuracy": 0.1996324509382248, "num_tokens": 80618912.0, "step": 31805 }, { "entropy": 6.0614057064056395, "epoch": 3.6710905943450665, "grad_norm": 0.9140625, "learning_rate": 0.00037098698580776714, "loss": 5.5849, "mean_token_accuracy": 0.2072437062859535, "num_tokens": 80631352.0, "step": 31810 }, { "entropy": 6.115705585479736, "epoch": 3.671667628390075, "grad_norm": 0.9140625, "learning_rate": 0.0003709496632185695, "loss": 5.6446, "mean_token_accuracy": 0.19653357863426207, "num_tokens": 80643430.0, "step": 31815 }, { "entropy": 6.082391166687012, "epoch": 3.6722446624350837, "grad_norm": 1.0703125, "learning_rate": 0.0003709123374021527, "loss": 5.6185, "mean_token_accuracy": 0.21651341617107392, "num_tokens": 80657786.0, "step": 31820 }, { "entropy": 6.124112892150879, "epoch": 3.672821696480092, "grad_norm": 0.88671875, "learning_rate": 0.000370875008359772, "loss": 5.6309, "mean_token_accuracy": 0.20375102907419204, "num_tokens": 80671131.0, "step": 31825 }, { "entropy": 6.10866150856018, "epoch": 3.673398730525101, "grad_norm": 0.89453125, "learning_rate": 0.000370837676092683, "loss": 5.6525, "mean_token_accuracy": 0.20393079817295073, "num_tokens": 80686579.0, "step": 31830 }, { "entropy": 6.0974045753479, "epoch": 3.67397576457011, "grad_norm": 0.9296875, "learning_rate": 0.00037080034060214134, "loss": 5.6047, "mean_token_accuracy": 0.20704250931739807, "num_tokens": 80698280.0, "step": 31835 }, { "entropy": 6.072479867935181, "epoch": 3.6745527986151183, "grad_norm": 0.92578125, "learning_rate": 0.00037076300188940294, "loss": 5.5711, "mean_token_accuracy": 0.19920947402715683, "num_tokens": 80711057.0, "step": 31840 }, { "entropy": 6.137829828262329, "epoch": 3.6751298326601267, "grad_norm": 0.96875, "learning_rate": 0.00037072565995572345, "loss": 5.6934, "mean_token_accuracy": 0.1974475786089897, "num_tokens": 80724085.0, "step": 31845 }, { "entropy": 6.129719829559326, "epoch": 3.6757068667051356, "grad_norm": 0.98828125, "learning_rate": 0.00037068831480235897, "loss": 5.6965, "mean_token_accuracy": 0.20455853939056395, "num_tokens": 80736705.0, "step": 31850 }, { "entropy": 6.080997133255005, "epoch": 3.6762839007501444, "grad_norm": 0.98046875, "learning_rate": 0.00037065096643056544, "loss": 5.5986, "mean_token_accuracy": 0.19893429726362227, "num_tokens": 80749172.0, "step": 31855 }, { "entropy": 6.10428261756897, "epoch": 3.676860934795153, "grad_norm": 0.9296875, "learning_rate": 0.00037061361484159934, "loss": 5.607, "mean_token_accuracy": 0.2059983417391777, "num_tokens": 80762569.0, "step": 31860 }, { "entropy": 6.160522174835205, "epoch": 3.6774379688401617, "grad_norm": 0.9765625, "learning_rate": 0.00037057626003671667, "loss": 5.6538, "mean_token_accuracy": 0.20354978740215302, "num_tokens": 80775372.0, "step": 31865 }, { "entropy": 6.107165908813476, "epoch": 3.67801500288517, "grad_norm": 0.984375, "learning_rate": 0.00037053890201717407, "loss": 5.6494, "mean_token_accuracy": 0.19876522868871688, "num_tokens": 80787026.0, "step": 31870 }, { "entropy": 6.018663787841797, "epoch": 3.678592036930179, "grad_norm": 0.9296875, "learning_rate": 0.00037050154078422786, "loss": 5.5878, "mean_token_accuracy": 0.20987798869609833, "num_tokens": 80799720.0, "step": 31875 }, { "entropy": 6.196094036102295, "epoch": 3.6791690709751874, "grad_norm": 0.96875, "learning_rate": 0.0003704641763391348, "loss": 5.71, "mean_token_accuracy": 0.19274294525384902, "num_tokens": 80812487.0, "step": 31880 }, { "entropy": 6.091052913665772, "epoch": 3.6797461050201963, "grad_norm": 1.203125, "learning_rate": 0.0003704268086831516, "loss": 5.5394, "mean_token_accuracy": 0.20878402888774872, "num_tokens": 80825001.0, "step": 31885 }, { "entropy": 6.052421951293946, "epoch": 3.6803231390652047, "grad_norm": 0.9765625, "learning_rate": 0.00037038943781753515, "loss": 5.6115, "mean_token_accuracy": 0.2030135825276375, "num_tokens": 80838068.0, "step": 31890 }, { "entropy": 6.073292636871338, "epoch": 3.6809001731102136, "grad_norm": 0.98046875, "learning_rate": 0.00037035206374354224, "loss": 5.6319, "mean_token_accuracy": 0.20013385266065598, "num_tokens": 80849474.0, "step": 31895 }, { "entropy": 6.156754493713379, "epoch": 3.681477207155222, "grad_norm": 0.9375, "learning_rate": 0.00037031468646243004, "loss": 5.7455, "mean_token_accuracy": 0.19427785277366638, "num_tokens": 80863217.0, "step": 31900 }, { "entropy": 6.136698055267334, "epoch": 3.682054241200231, "grad_norm": 0.94140625, "learning_rate": 0.00037027730597545577, "loss": 5.6765, "mean_token_accuracy": 0.19656821191310883, "num_tokens": 80876706.0, "step": 31905 }, { "entropy": 6.2177637100219725, "epoch": 3.6826312752452397, "grad_norm": 0.9609375, "learning_rate": 0.0003702399222838766, "loss": 5.6494, "mean_token_accuracy": 0.1916962280869484, "num_tokens": 80888853.0, "step": 31910 }, { "entropy": 6.158915233612061, "epoch": 3.683208309290248, "grad_norm": 1.0, "learning_rate": 0.00037020253538895, "loss": 5.6672, "mean_token_accuracy": 0.20122171938419342, "num_tokens": 80900411.0, "step": 31915 }, { "entropy": 6.146502542495727, "epoch": 3.6837853433352565, "grad_norm": 1.0546875, "learning_rate": 0.00037016514529193337, "loss": 5.6888, "mean_token_accuracy": 0.1991058737039566, "num_tokens": 80914093.0, "step": 31920 }, { "entropy": 6.09154109954834, "epoch": 3.6843623773802654, "grad_norm": 1.2421875, "learning_rate": 0.00037012775199408434, "loss": 5.5246, "mean_token_accuracy": 0.21300326734781266, "num_tokens": 80926078.0, "step": 31925 }, { "entropy": 6.078769826889038, "epoch": 3.6849394114252743, "grad_norm": 1.1796875, "learning_rate": 0.00037009035549666065, "loss": 5.6248, "mean_token_accuracy": 0.20796998590230942, "num_tokens": 80939343.0, "step": 31930 }, { "entropy": 6.053972387313843, "epoch": 3.6855164454702827, "grad_norm": 0.95703125, "learning_rate": 0.0003700529558009201, "loss": 5.5209, "mean_token_accuracy": 0.21146876066923143, "num_tokens": 80951264.0, "step": 31935 }, { "entropy": 5.973317956924438, "epoch": 3.6860934795152915, "grad_norm": 0.984375, "learning_rate": 0.0003700155529081205, "loss": 5.4417, "mean_token_accuracy": 0.21474826484918594, "num_tokens": 80964847.0, "step": 31940 }, { "entropy": 6.107014989852905, "epoch": 3.6866705135603, "grad_norm": 1.015625, "learning_rate": 0.00036997814681952, "loss": 5.7559, "mean_token_accuracy": 0.1906362697482109, "num_tokens": 80976743.0, "step": 31945 }, { "entropy": 6.125425052642822, "epoch": 3.687247547605309, "grad_norm": 0.9140625, "learning_rate": 0.0003699407375363768, "loss": 5.6344, "mean_token_accuracy": 0.20296656787395478, "num_tokens": 80989116.0, "step": 31950 }, { "entropy": 6.127856349945068, "epoch": 3.6878245816503172, "grad_norm": 1.0859375, "learning_rate": 0.000369903325059949, "loss": 5.6371, "mean_token_accuracy": 0.20229786932468413, "num_tokens": 81001984.0, "step": 31955 }, { "entropy": 6.125501203536987, "epoch": 3.688401615695326, "grad_norm": 0.95703125, "learning_rate": 0.00036986590939149503, "loss": 5.628, "mean_token_accuracy": 0.20030225664377213, "num_tokens": 81013816.0, "step": 31960 }, { "entropy": 6.056718015670777, "epoch": 3.6889786497403345, "grad_norm": 0.9296875, "learning_rate": 0.0003698284905322732, "loss": 5.5715, "mean_token_accuracy": 0.21383861750364302, "num_tokens": 81027688.0, "step": 31965 }, { "entropy": 6.088495826721191, "epoch": 3.6895556837853434, "grad_norm": 0.96875, "learning_rate": 0.00036979106848354236, "loss": 5.6118, "mean_token_accuracy": 0.20607208758592604, "num_tokens": 81039963.0, "step": 31970 }, { "entropy": 6.148860073089599, "epoch": 3.690132717830352, "grad_norm": 0.94921875, "learning_rate": 0.00036975364324656095, "loss": 5.659, "mean_token_accuracy": 0.19596734493970872, "num_tokens": 81053193.0, "step": 31975 }, { "entropy": 6.10787615776062, "epoch": 3.6907097518753607, "grad_norm": 0.92578125, "learning_rate": 0.0003697162148225878, "loss": 5.6756, "mean_token_accuracy": 0.20186924189329147, "num_tokens": 81065271.0, "step": 31980 }, { "entropy": 6.144801950454712, "epoch": 3.6912867859203695, "grad_norm": 0.89453125, "learning_rate": 0.00036967878321288183, "loss": 5.73, "mean_token_accuracy": 0.19592429101467132, "num_tokens": 81078183.0, "step": 31985 }, { "entropy": 6.148482847213745, "epoch": 3.691863819965378, "grad_norm": 1.09375, "learning_rate": 0.00036964134841870207, "loss": 5.6445, "mean_token_accuracy": 0.2033967360854149, "num_tokens": 81090665.0, "step": 31990 }, { "entropy": 6.2074870586395265, "epoch": 3.6924408540103864, "grad_norm": 1.0078125, "learning_rate": 0.00036960391044130755, "loss": 5.7612, "mean_token_accuracy": 0.18606630861759185, "num_tokens": 81102834.0, "step": 31995 }, { "entropy": 6.060525369644165, "epoch": 3.693017888055395, "grad_norm": 0.96875, "learning_rate": 0.0003695664692819574, "loss": 5.5456, "mean_token_accuracy": 0.2055351734161377, "num_tokens": 81116380.0, "step": 32000 }, { "entropy": 6.051888370513916, "epoch": 3.693594922100404, "grad_norm": 0.9140625, "learning_rate": 0.00036952902494191106, "loss": 5.5608, "mean_token_accuracy": 0.20717490017414092, "num_tokens": 81128304.0, "step": 32005 }, { "entropy": 5.976141023635864, "epoch": 3.6941719561454125, "grad_norm": 0.92578125, "learning_rate": 0.00036949157742242796, "loss": 5.5333, "mean_token_accuracy": 0.20976489931344985, "num_tokens": 81141162.0, "step": 32010 }, { "entropy": 6.136828327178955, "epoch": 3.6947489901904214, "grad_norm": 0.98046875, "learning_rate": 0.00036945412672476763, "loss": 5.662, "mean_token_accuracy": 0.19366756081581116, "num_tokens": 81152690.0, "step": 32015 }, { "entropy": 6.094586896896362, "epoch": 3.6953260242354298, "grad_norm": 0.921875, "learning_rate": 0.0003694166728501896, "loss": 5.6671, "mean_token_accuracy": 0.20372935235500336, "num_tokens": 81166778.0, "step": 32020 }, { "entropy": 6.108336639404297, "epoch": 3.6959030582804386, "grad_norm": 0.9921875, "learning_rate": 0.0003693792157999537, "loss": 5.5932, "mean_token_accuracy": 0.20055043399333955, "num_tokens": 81178551.0, "step": 32025 }, { "entropy": 6.094335746765137, "epoch": 3.696480092325447, "grad_norm": 0.94921875, "learning_rate": 0.0003693417555753197, "loss": 5.5842, "mean_token_accuracy": 0.21113443970680237, "num_tokens": 81191555.0, "step": 32030 }, { "entropy": 6.049908781051636, "epoch": 3.697057126370456, "grad_norm": 0.9765625, "learning_rate": 0.00036930429217754766, "loss": 5.5589, "mean_token_accuracy": 0.20537756830453874, "num_tokens": 81204181.0, "step": 32035 }, { "entropy": 6.191805458068847, "epoch": 3.6976341604154648, "grad_norm": 0.94140625, "learning_rate": 0.0003692668256078976, "loss": 5.7766, "mean_token_accuracy": 0.19429351389408112, "num_tokens": 81216307.0, "step": 32040 }, { "entropy": 6.16627459526062, "epoch": 3.698211194460473, "grad_norm": 0.91796875, "learning_rate": 0.0003692293558676297, "loss": 5.6404, "mean_token_accuracy": 0.2060305267572403, "num_tokens": 81228985.0, "step": 32045 }, { "entropy": 6.083999395370483, "epoch": 3.6987882285054816, "grad_norm": 0.9140625, "learning_rate": 0.0003691918829580042, "loss": 5.6404, "mean_token_accuracy": 0.20266406685113908, "num_tokens": 81242650.0, "step": 32050 }, { "entropy": 6.062539100646973, "epoch": 3.6993652625504905, "grad_norm": 0.9375, "learning_rate": 0.00036915440688028154, "loss": 5.6173, "mean_token_accuracy": 0.20183532536029816, "num_tokens": 81255574.0, "step": 32055 }, { "entropy": 6.068630647659302, "epoch": 3.6999422965954993, "grad_norm": 0.9296875, "learning_rate": 0.00036911692763572215, "loss": 5.5375, "mean_token_accuracy": 0.20998241156339645, "num_tokens": 81268774.0, "step": 32060 }, { "entropy": 6.131548833847046, "epoch": 3.7005193306405078, "grad_norm": 0.90234375, "learning_rate": 0.0003690794452255866, "loss": 5.6378, "mean_token_accuracy": 0.20096139162778853, "num_tokens": 81281717.0, "step": 32065 }, { "entropy": 6.029264831542969, "epoch": 3.701096364685516, "grad_norm": 1.1171875, "learning_rate": 0.0003690419596511357, "loss": 5.6085, "mean_token_accuracy": 0.20901645570993424, "num_tokens": 81293697.0, "step": 32070 }, { "entropy": 6.166714859008789, "epoch": 3.701673398730525, "grad_norm": 0.98828125, "learning_rate": 0.00036900447091363017, "loss": 5.653, "mean_token_accuracy": 0.19878632575273514, "num_tokens": 81306728.0, "step": 32075 }, { "entropy": 6.086012887954712, "epoch": 3.702250432775534, "grad_norm": 0.984375, "learning_rate": 0.000368966979014331, "loss": 5.5343, "mean_token_accuracy": 0.20614220649003984, "num_tokens": 81317864.0, "step": 32080 }, { "entropy": 6.100617170333862, "epoch": 3.7028274668205423, "grad_norm": 0.89453125, "learning_rate": 0.0003689294839544991, "loss": 5.6902, "mean_token_accuracy": 0.19468800574541092, "num_tokens": 81332027.0, "step": 32085 }, { "entropy": 6.152664375305176, "epoch": 3.703404500865551, "grad_norm": 0.99609375, "learning_rate": 0.00036889198573539575, "loss": 5.6194, "mean_token_accuracy": 0.20684202909469604, "num_tokens": 81343472.0, "step": 32090 }, { "entropy": 6.142629384994507, "epoch": 3.7039815349105596, "grad_norm": 0.9765625, "learning_rate": 0.00036885448435828205, "loss": 5.6542, "mean_token_accuracy": 0.2024760514497757, "num_tokens": 81356023.0, "step": 32095 }, { "entropy": 5.9660240650177006, "epoch": 3.7045585689555685, "grad_norm": 0.875, "learning_rate": 0.0003688169798244194, "loss": 5.4978, "mean_token_accuracy": 0.22084505409002303, "num_tokens": 81369327.0, "step": 32100 }, { "entropy": 6.178499603271485, "epoch": 3.705135603000577, "grad_norm": 0.9609375, "learning_rate": 0.0003687794721350692, "loss": 5.7253, "mean_token_accuracy": 0.19795726239681244, "num_tokens": 81381470.0, "step": 32105 }, { "entropy": 6.144916629791259, "epoch": 3.7057126370455857, "grad_norm": 0.99609375, "learning_rate": 0.00036874196129149303, "loss": 5.5749, "mean_token_accuracy": 0.2026337668299675, "num_tokens": 81393764.0, "step": 32110 }, { "entropy": 6.1313048839569095, "epoch": 3.7062896710905946, "grad_norm": 0.98828125, "learning_rate": 0.0003687044472949526, "loss": 5.7123, "mean_token_accuracy": 0.19428895860910417, "num_tokens": 81405257.0, "step": 32115 }, { "entropy": 6.082985210418701, "epoch": 3.706866705135603, "grad_norm": 0.984375, "learning_rate": 0.0003686669301467097, "loss": 5.6037, "mean_token_accuracy": 0.21281479597091674, "num_tokens": 81417938.0, "step": 32120 }, { "entropy": 6.133819055557251, "epoch": 3.7074437391806114, "grad_norm": 0.90625, "learning_rate": 0.000368629409848026, "loss": 5.5802, "mean_token_accuracy": 0.2060667559504509, "num_tokens": 81430183.0, "step": 32125 }, { "entropy": 6.029097986221314, "epoch": 3.7080207732256203, "grad_norm": 1.0546875, "learning_rate": 0.00036859188640016365, "loss": 5.5732, "mean_token_accuracy": 0.20648828744888306, "num_tokens": 81441831.0, "step": 32130 }, { "entropy": 6.119962310791015, "epoch": 3.708597807270629, "grad_norm": 0.921875, "learning_rate": 0.0003685543598043847, "loss": 5.7341, "mean_token_accuracy": 0.19169845879077912, "num_tokens": 81453327.0, "step": 32135 }, { "entropy": 6.1532786846160885, "epoch": 3.7091748413156376, "grad_norm": 1.015625, "learning_rate": 0.0003685168300619513, "loss": 5.6517, "mean_token_accuracy": 0.20710574686527253, "num_tokens": 81466462.0, "step": 32140 }, { "entropy": 6.135969352722168, "epoch": 3.7097518753606464, "grad_norm": 0.8828125, "learning_rate": 0.00036847929717412586, "loss": 5.5632, "mean_token_accuracy": 0.20706499069929124, "num_tokens": 81478768.0, "step": 32145 }, { "entropy": 6.101963472366333, "epoch": 3.710328909405655, "grad_norm": 1.21875, "learning_rate": 0.0003684417611421706, "loss": 5.6502, "mean_token_accuracy": 0.1990034058690071, "num_tokens": 81492942.0, "step": 32150 }, { "entropy": 6.104153394699097, "epoch": 3.7109059434506637, "grad_norm": 0.98828125, "learning_rate": 0.0003684042219673481, "loss": 5.636, "mean_token_accuracy": 0.20014396011829377, "num_tokens": 81504010.0, "step": 32155 }, { "entropy": 6.106266021728516, "epoch": 3.711482977495672, "grad_norm": 0.91015625, "learning_rate": 0.00036836667965092106, "loss": 5.6078, "mean_token_accuracy": 0.2027534544467926, "num_tokens": 81517327.0, "step": 32160 }, { "entropy": 6.145915746688843, "epoch": 3.712060011540681, "grad_norm": 0.96875, "learning_rate": 0.00036832913419415213, "loss": 5.6022, "mean_token_accuracy": 0.20093379616737367, "num_tokens": 81528712.0, "step": 32165 }, { "entropy": 5.9268005847930905, "epoch": 3.7126370455856894, "grad_norm": 0.90234375, "learning_rate": 0.0003682915855983041, "loss": 5.411, "mean_token_accuracy": 0.2226401910185814, "num_tokens": 81541406.0, "step": 32170 }, { "entropy": 6.095519542694092, "epoch": 3.7132140796306983, "grad_norm": 0.92578125, "learning_rate": 0.00036825403386464, "loss": 5.5704, "mean_token_accuracy": 0.20921113193035126, "num_tokens": 81554235.0, "step": 32175 }, { "entropy": 6.052953290939331, "epoch": 3.7137911136757067, "grad_norm": 1.046875, "learning_rate": 0.00036821647899442267, "loss": 5.6269, "mean_token_accuracy": 0.20576815456151962, "num_tokens": 81566527.0, "step": 32180 }, { "entropy": 6.028816843032837, "epoch": 3.7143681477207156, "grad_norm": 0.87890625, "learning_rate": 0.0003681789209889155, "loss": 5.526, "mean_token_accuracy": 0.20969487279653548, "num_tokens": 81579093.0, "step": 32185 }, { "entropy": 6.089748191833496, "epoch": 3.7149451817657244, "grad_norm": 1.015625, "learning_rate": 0.00036814135984938146, "loss": 5.6348, "mean_token_accuracy": 0.19932120740413667, "num_tokens": 81591907.0, "step": 32190 }, { "entropy": 6.158211755752563, "epoch": 3.715522215810733, "grad_norm": 0.99609375, "learning_rate": 0.0003681037955770842, "loss": 5.6779, "mean_token_accuracy": 0.20113901048898697, "num_tokens": 81604744.0, "step": 32195 }, { "entropy": 6.145216941833496, "epoch": 3.7160992498557412, "grad_norm": 0.90625, "learning_rate": 0.00036806622817328697, "loss": 5.673, "mean_token_accuracy": 0.1975746050477028, "num_tokens": 81618122.0, "step": 32200 }, { "entropy": 6.092971324920654, "epoch": 3.71667628390075, "grad_norm": 1.0078125, "learning_rate": 0.00036802865763925334, "loss": 5.658, "mean_token_accuracy": 0.19615527838468552, "num_tokens": 81630710.0, "step": 32205 }, { "entropy": 6.064430475234985, "epoch": 3.717253317945759, "grad_norm": 0.90625, "learning_rate": 0.00036799108397624704, "loss": 5.5793, "mean_token_accuracy": 0.2079721987247467, "num_tokens": 81643629.0, "step": 32210 }, { "entropy": 6.131985902786255, "epoch": 3.7178303519907674, "grad_norm": 0.84375, "learning_rate": 0.0003679535071855318, "loss": 5.7067, "mean_token_accuracy": 0.19480953812599183, "num_tokens": 81656489.0, "step": 32215 }, { "entropy": 6.185256242752075, "epoch": 3.7184073860357763, "grad_norm": 0.90234375, "learning_rate": 0.0003679159272683716, "loss": 5.6569, "mean_token_accuracy": 0.20028447955846787, "num_tokens": 81669767.0, "step": 32220 }, { "entropy": 6.1107412815094, "epoch": 3.7189844200807847, "grad_norm": 1.203125, "learning_rate": 0.0003678783442260303, "loss": 5.5728, "mean_token_accuracy": 0.21131436973810197, "num_tokens": 81682404.0, "step": 32225 }, { "entropy": 6.067472362518311, "epoch": 3.7195614541257935, "grad_norm": 0.875, "learning_rate": 0.00036784075805977194, "loss": 5.6601, "mean_token_accuracy": 0.20134028494358064, "num_tokens": 81694778.0, "step": 32230 }, { "entropy": 6.07591986656189, "epoch": 3.720138488170802, "grad_norm": 0.8984375, "learning_rate": 0.0003678031687708609, "loss": 5.6338, "mean_token_accuracy": 0.2068109005689621, "num_tokens": 81708823.0, "step": 32235 }, { "entropy": 5.955157327651977, "epoch": 3.720715522215811, "grad_norm": 1.015625, "learning_rate": 0.0003677655763605614, "loss": 5.4912, "mean_token_accuracy": 0.20995953381061555, "num_tokens": 81721558.0, "step": 32240 }, { "entropy": 6.091207122802734, "epoch": 3.7212925562608192, "grad_norm": 0.98046875, "learning_rate": 0.00036772798083013774, "loss": 5.6482, "mean_token_accuracy": 0.202237831056118, "num_tokens": 81733170.0, "step": 32245 }, { "entropy": 6.07231297492981, "epoch": 3.721869590305828, "grad_norm": 0.8984375, "learning_rate": 0.0003676903821808545, "loss": 5.5973, "mean_token_accuracy": 0.20762179642915726, "num_tokens": 81747076.0, "step": 32250 }, { "entropy": 6.134697151184082, "epoch": 3.7224466243508365, "grad_norm": 0.86328125, "learning_rate": 0.00036765278041397633, "loss": 5.6568, "mean_token_accuracy": 0.20537785291671753, "num_tokens": 81758908.0, "step": 32255 }, { "entropy": 6.059366750717163, "epoch": 3.7230236583958454, "grad_norm": 1.0546875, "learning_rate": 0.00036761517553076794, "loss": 5.5451, "mean_token_accuracy": 0.21384347677230836, "num_tokens": 81772398.0, "step": 32260 }, { "entropy": 6.054136562347412, "epoch": 3.7236006924408542, "grad_norm": 1.1484375, "learning_rate": 0.0003675775675324941, "loss": 5.6192, "mean_token_accuracy": 0.20268476903438568, "num_tokens": 81784048.0, "step": 32265 }, { "entropy": 6.1055957794189455, "epoch": 3.7241777264858626, "grad_norm": 0.953125, "learning_rate": 0.00036753995642041976, "loss": 5.6109, "mean_token_accuracy": 0.20258331000804902, "num_tokens": 81796301.0, "step": 32270 }, { "entropy": 6.1669464111328125, "epoch": 3.724754760530871, "grad_norm": 0.98828125, "learning_rate": 0.0003675023421958099, "loss": 5.7571, "mean_token_accuracy": 0.19046144783496857, "num_tokens": 81807897.0, "step": 32275 }, { "entropy": 6.1084295272827145, "epoch": 3.72533179457588, "grad_norm": 0.94140625, "learning_rate": 0.0003674647248599298, "loss": 5.6064, "mean_token_accuracy": 0.20409170985221864, "num_tokens": 81820138.0, "step": 32280 }, { "entropy": 6.14130802154541, "epoch": 3.725908828620889, "grad_norm": 0.9609375, "learning_rate": 0.0003674271044140446, "loss": 5.6587, "mean_token_accuracy": 0.20303584337234498, "num_tokens": 81832147.0, "step": 32285 }, { "entropy": 6.120838594436646, "epoch": 3.726485862665897, "grad_norm": 0.98046875, "learning_rate": 0.0003673894808594196, "loss": 5.638, "mean_token_accuracy": 0.2116558387875557, "num_tokens": 81844714.0, "step": 32290 }, { "entropy": 6.150388288497925, "epoch": 3.727062896710906, "grad_norm": 0.91015625, "learning_rate": 0.0003673518541973203, "loss": 5.5673, "mean_token_accuracy": 0.2091709017753601, "num_tokens": 81857310.0, "step": 32295 }, { "entropy": 6.0021473407745365, "epoch": 3.7276399307559145, "grad_norm": 0.921875, "learning_rate": 0.00036731422442901236, "loss": 5.5737, "mean_token_accuracy": 0.20878852307796478, "num_tokens": 81871441.0, "step": 32300 }, { "entropy": 6.019360828399658, "epoch": 3.7282169648009233, "grad_norm": 0.9296875, "learning_rate": 0.0003672765915557613, "loss": 5.5562, "mean_token_accuracy": 0.2149242043495178, "num_tokens": 81883523.0, "step": 32305 }, { "entropy": 6.074365425109863, "epoch": 3.7287939988459318, "grad_norm": 0.9140625, "learning_rate": 0.0003672389555788328, "loss": 5.6582, "mean_token_accuracy": 0.20570338666439056, "num_tokens": 81896910.0, "step": 32310 }, { "entropy": 6.1055327415466305, "epoch": 3.7293710328909406, "grad_norm": 0.89453125, "learning_rate": 0.00036720131649949295, "loss": 5.6657, "mean_token_accuracy": 0.20025507658720015, "num_tokens": 81911205.0, "step": 32315 }, { "entropy": 6.09299144744873, "epoch": 3.7299480669359495, "grad_norm": 0.91796875, "learning_rate": 0.0003671636743190076, "loss": 5.6204, "mean_token_accuracy": 0.19980547279119493, "num_tokens": 81923556.0, "step": 32320 }, { "entropy": 6.098953056335449, "epoch": 3.730525100980958, "grad_norm": 0.921875, "learning_rate": 0.00036712602903864286, "loss": 5.6434, "mean_token_accuracy": 0.20586923360824586, "num_tokens": 81935613.0, "step": 32325 }, { "entropy": 6.109227991104126, "epoch": 3.7311021350259663, "grad_norm": 0.94140625, "learning_rate": 0.0003670883806596649, "loss": 5.5783, "mean_token_accuracy": 0.20650579333305358, "num_tokens": 81947951.0, "step": 32330 }, { "entropy": 6.105522298812867, "epoch": 3.731679169070975, "grad_norm": 0.9140625, "learning_rate": 0.0003670507291833399, "loss": 5.6459, "mean_token_accuracy": 0.1967855527997017, "num_tokens": 81960622.0, "step": 32335 }, { "entropy": 6.052056503295899, "epoch": 3.732256203115984, "grad_norm": 1.0078125, "learning_rate": 0.0003670130746109344, "loss": 5.6375, "mean_token_accuracy": 0.20374275594949723, "num_tokens": 81974110.0, "step": 32340 }, { "entropy": 6.13268256187439, "epoch": 3.7328332371609925, "grad_norm": 0.98828125, "learning_rate": 0.00036697541694371487, "loss": 5.6309, "mean_token_accuracy": 0.20146786272525788, "num_tokens": 81987392.0, "step": 32345 }, { "entropy": 6.132433652877808, "epoch": 3.733410271206001, "grad_norm": 0.94921875, "learning_rate": 0.0003669377561829479, "loss": 5.6546, "mean_token_accuracy": 0.20318444520235063, "num_tokens": 81999751.0, "step": 32350 }, { "entropy": 6.148645305633545, "epoch": 3.7339873052510097, "grad_norm": 0.9921875, "learning_rate": 0.00036690009232990016, "loss": 5.6802, "mean_token_accuracy": 0.20016422420740126, "num_tokens": 82013751.0, "step": 32355 }, { "entropy": 6.070813322067261, "epoch": 3.7345643392960186, "grad_norm": 1.0390625, "learning_rate": 0.00036686242538583845, "loss": 5.5573, "mean_token_accuracy": 0.20743968486785888, "num_tokens": 82026681.0, "step": 32360 }, { "entropy": 6.051439189910889, "epoch": 3.735141373341027, "grad_norm": 1.15625, "learning_rate": 0.0003668247553520297, "loss": 5.5989, "mean_token_accuracy": 0.20208120942115784, "num_tokens": 82039624.0, "step": 32365 }, { "entropy": 6.084421634674072, "epoch": 3.735718407386036, "grad_norm": 1.0234375, "learning_rate": 0.00036678708222974096, "loss": 5.6735, "mean_token_accuracy": 0.20162639021873474, "num_tokens": 82052106.0, "step": 32370 }, { "entropy": 5.97212700843811, "epoch": 3.7362954414310443, "grad_norm": 0.92578125, "learning_rate": 0.0003667494060202392, "loss": 5.5307, "mean_token_accuracy": 0.207809779047966, "num_tokens": 82064647.0, "step": 32375 }, { "entropy": 6.106335926055908, "epoch": 3.736872475476053, "grad_norm": 1.0234375, "learning_rate": 0.00036671172672479176, "loss": 5.6239, "mean_token_accuracy": 0.2098295956850052, "num_tokens": 82077242.0, "step": 32380 }, { "entropy": 6.081893062591552, "epoch": 3.7374495095210616, "grad_norm": 0.94140625, "learning_rate": 0.000366674044344666, "loss": 5.62, "mean_token_accuracy": 0.20567358285188675, "num_tokens": 82090667.0, "step": 32385 }, { "entropy": 6.1361884593963625, "epoch": 3.7380265435660704, "grad_norm": 0.9453125, "learning_rate": 0.00036663635888112923, "loss": 5.579, "mean_token_accuracy": 0.20831230282783508, "num_tokens": 82104303.0, "step": 32390 }, { "entropy": 6.086204147338867, "epoch": 3.7386035776110793, "grad_norm": 1.03125, "learning_rate": 0.00036659867033544914, "loss": 5.5816, "mean_token_accuracy": 0.21155169755220413, "num_tokens": 82117398.0, "step": 32395 }, { "entropy": 6.118532514572143, "epoch": 3.7391806116560877, "grad_norm": 1.015625, "learning_rate": 0.0003665609787088932, "loss": 5.5997, "mean_token_accuracy": 0.1960316300392151, "num_tokens": 82132716.0, "step": 32400 }, { "entropy": 6.103175687789917, "epoch": 3.739757645701096, "grad_norm": 1.03125, "learning_rate": 0.0003665232840027292, "loss": 5.6407, "mean_token_accuracy": 0.20233808755874633, "num_tokens": 82145442.0, "step": 32405 }, { "entropy": 6.148085021972657, "epoch": 3.740334679746105, "grad_norm": 0.875, "learning_rate": 0.0003664855862182251, "loss": 5.6916, "mean_token_accuracy": 0.20155177414417266, "num_tokens": 82157802.0, "step": 32410 }, { "entropy": 5.986072540283203, "epoch": 3.740911713791114, "grad_norm": 0.94921875, "learning_rate": 0.00036644788535664867, "loss": 5.5148, "mean_token_accuracy": 0.2107320696115494, "num_tokens": 82170587.0, "step": 32415 }, { "entropy": 6.094866514205933, "epoch": 3.7414887478361223, "grad_norm": 0.93359375, "learning_rate": 0.0003664101814192681, "loss": 5.6424, "mean_token_accuracy": 0.2065053954720497, "num_tokens": 82183010.0, "step": 32420 }, { "entropy": 6.180253267288208, "epoch": 3.742065781881131, "grad_norm": 0.890625, "learning_rate": 0.00036637247440735146, "loss": 5.7195, "mean_token_accuracy": 0.19784776717424393, "num_tokens": 82195340.0, "step": 32425 }, { "entropy": 6.1490922451019285, "epoch": 3.7426428159261396, "grad_norm": 0.97265625, "learning_rate": 0.000366334764322167, "loss": 5.6692, "mean_token_accuracy": 0.2010624051094055, "num_tokens": 82208489.0, "step": 32430 }, { "entropy": 6.157190895080566, "epoch": 3.7432198499711484, "grad_norm": 0.92578125, "learning_rate": 0.00036629705116498313, "loss": 5.669, "mean_token_accuracy": 0.20122681558132172, "num_tokens": 82220456.0, "step": 32435 }, { "entropy": 6.027271842956543, "epoch": 3.743796884016157, "grad_norm": 0.99609375, "learning_rate": 0.00036625933493706833, "loss": 5.5141, "mean_token_accuracy": 0.2121756851673126, "num_tokens": 82233253.0, "step": 32440 }, { "entropy": 6.059979724884033, "epoch": 3.7443739180611657, "grad_norm": 1.078125, "learning_rate": 0.0003662216156396911, "loss": 5.5843, "mean_token_accuracy": 0.2064562827348709, "num_tokens": 82246006.0, "step": 32445 }, { "entropy": 6.150467824935913, "epoch": 3.744950952106174, "grad_norm": 1.0546875, "learning_rate": 0.0003661838932741201, "loss": 5.7059, "mean_token_accuracy": 0.20373200327157975, "num_tokens": 82258504.0, "step": 32450 }, { "entropy": 6.008761072158814, "epoch": 3.745527986151183, "grad_norm": 0.9296875, "learning_rate": 0.0003661461678416242, "loss": 5.4907, "mean_token_accuracy": 0.20857551395893098, "num_tokens": 82271388.0, "step": 32455 }, { "entropy": 6.131132125854492, "epoch": 3.7461050201961914, "grad_norm": 0.9921875, "learning_rate": 0.0003661084393434722, "loss": 5.6546, "mean_token_accuracy": 0.19991757720708847, "num_tokens": 82284092.0, "step": 32460 }, { "entropy": 6.052231788635254, "epoch": 3.7466820542412003, "grad_norm": 0.95703125, "learning_rate": 0.0003660707077809331, "loss": 5.5109, "mean_token_accuracy": 0.22182962745428086, "num_tokens": 82296470.0, "step": 32465 }, { "entropy": 6.0498615264892575, "epoch": 3.747259088286209, "grad_norm": 1.0234375, "learning_rate": 0.000366032973155276, "loss": 5.664, "mean_token_accuracy": 0.20293652415275573, "num_tokens": 82310048.0, "step": 32470 }, { "entropy": 6.0782859325408936, "epoch": 3.7478361223312175, "grad_norm": 0.94921875, "learning_rate": 0.0003659952354677701, "loss": 5.5424, "mean_token_accuracy": 0.2100034087896347, "num_tokens": 82322618.0, "step": 32475 }, { "entropy": 6.119845294952393, "epoch": 3.748413156376226, "grad_norm": 1.1015625, "learning_rate": 0.0003659574947196845, "loss": 5.609, "mean_token_accuracy": 0.19862225651741028, "num_tokens": 82335179.0, "step": 32480 }, { "entropy": 6.11025562286377, "epoch": 3.748990190421235, "grad_norm": 0.9609375, "learning_rate": 0.0003659197509122889, "loss": 5.6331, "mean_token_accuracy": 0.20117217004299165, "num_tokens": 82346807.0, "step": 32485 }, { "entropy": 6.035577821731567, "epoch": 3.7495672244662437, "grad_norm": 1.53125, "learning_rate": 0.00036588200404685263, "loss": 5.5832, "mean_token_accuracy": 0.20178569704294205, "num_tokens": 82358914.0, "step": 32490 }, { "entropy": 6.1075663566589355, "epoch": 3.750144258511252, "grad_norm": 0.91015625, "learning_rate": 0.00036584425412464525, "loss": 5.6186, "mean_token_accuracy": 0.19736004173755645, "num_tokens": 82371417.0, "step": 32495 }, { "entropy": 6.146180009841919, "epoch": 3.750721292556261, "grad_norm": 0.94921875, "learning_rate": 0.00036580650114693654, "loss": 5.5702, "mean_token_accuracy": 0.20541742891073228, "num_tokens": 82384013.0, "step": 32500 }, { "entropy": 6.180217361450195, "epoch": 3.7512983266012694, "grad_norm": 1.109375, "learning_rate": 0.0003657687451149962, "loss": 5.6528, "mean_token_accuracy": 0.20355466306209563, "num_tokens": 82398546.0, "step": 32505 }, { "entropy": 6.053690719604492, "epoch": 3.7518753606462782, "grad_norm": 0.953125, "learning_rate": 0.00036573098603009425, "loss": 5.5698, "mean_token_accuracy": 0.2176451340317726, "num_tokens": 82410321.0, "step": 32510 }, { "entropy": 6.042766523361206, "epoch": 3.7524523946912867, "grad_norm": 0.94140625, "learning_rate": 0.0003656932238935007, "loss": 5.5071, "mean_token_accuracy": 0.21227299869060517, "num_tokens": 82422463.0, "step": 32515 }, { "entropy": 6.133840274810791, "epoch": 3.7530294287362955, "grad_norm": 0.921875, "learning_rate": 0.00036565545870648555, "loss": 5.6877, "mean_token_accuracy": 0.19425924271345138, "num_tokens": 82434430.0, "step": 32520 }, { "entropy": 6.084829998016358, "epoch": 3.753606462781304, "grad_norm": 0.97265625, "learning_rate": 0.00036561769047031904, "loss": 5.5517, "mean_token_accuracy": 0.20324511528015138, "num_tokens": 82445731.0, "step": 32525 }, { "entropy": 6.2098170757293705, "epoch": 3.754183496826313, "grad_norm": 0.96484375, "learning_rate": 0.0003655799191862716, "loss": 5.7579, "mean_token_accuracy": 0.18895328491926194, "num_tokens": 82458894.0, "step": 32530 }, { "entropy": 6.085763072967529, "epoch": 3.7547605308713212, "grad_norm": 0.796875, "learning_rate": 0.00036554214485561357, "loss": 5.6517, "mean_token_accuracy": 0.20021233707666397, "num_tokens": 82472043.0, "step": 32535 }, { "entropy": 6.143430900573731, "epoch": 3.75533756491633, "grad_norm": 1.0078125, "learning_rate": 0.0003655043674796155, "loss": 5.5601, "mean_token_accuracy": 0.20251185148954393, "num_tokens": 82483304.0, "step": 32540 }, { "entropy": 6.16084771156311, "epoch": 3.755914598961339, "grad_norm": 0.9609375, "learning_rate": 0.0003654665870595479, "loss": 5.6474, "mean_token_accuracy": 0.20687719732522963, "num_tokens": 82495902.0, "step": 32545 }, { "entropy": 6.153928470611572, "epoch": 3.7564916330063474, "grad_norm": 0.9921875, "learning_rate": 0.00036542880359668155, "loss": 5.6609, "mean_token_accuracy": 0.2065740406513214, "num_tokens": 82508350.0, "step": 32550 }, { "entropy": 6.008171558380127, "epoch": 3.757068667051356, "grad_norm": 0.94140625, "learning_rate": 0.00036539101709228745, "loss": 5.5566, "mean_token_accuracy": 0.21697248071432113, "num_tokens": 82521992.0, "step": 32555 }, { "entropy": 6.12149863243103, "epoch": 3.7576457010963646, "grad_norm": 0.96875, "learning_rate": 0.00036535322754763634, "loss": 5.6703, "mean_token_accuracy": 0.19976507723331452, "num_tokens": 82534408.0, "step": 32560 }, { "entropy": 6.109060573577881, "epoch": 3.7582227351413735, "grad_norm": 1.0234375, "learning_rate": 0.00036531543496399923, "loss": 5.5734, "mean_token_accuracy": 0.21320396661758423, "num_tokens": 82547372.0, "step": 32565 }, { "entropy": 5.975702953338623, "epoch": 3.758799769186382, "grad_norm": 0.92578125, "learning_rate": 0.00036527763934264735, "loss": 5.4823, "mean_token_accuracy": 0.22043978422880173, "num_tokens": 82559335.0, "step": 32570 }, { "entropy": 6.161577606201172, "epoch": 3.759376803231391, "grad_norm": 0.9296875, "learning_rate": 0.000365239840684852, "loss": 5.658, "mean_token_accuracy": 0.1953011304140091, "num_tokens": 82571420.0, "step": 32575 }, { "entropy": 6.117753601074218, "epoch": 3.759953837276399, "grad_norm": 0.96875, "learning_rate": 0.0003652020389918844, "loss": 5.6144, "mean_token_accuracy": 0.20099452883005142, "num_tokens": 82585105.0, "step": 32580 }, { "entropy": 6.046821117401123, "epoch": 3.760530871321408, "grad_norm": 1.0, "learning_rate": 0.00036516423426501593, "loss": 5.5997, "mean_token_accuracy": 0.20807549208402634, "num_tokens": 82597305.0, "step": 32585 }, { "entropy": 6.084345006942749, "epoch": 3.7611079053664165, "grad_norm": 1.0078125, "learning_rate": 0.0003651264265055183, "loss": 5.5154, "mean_token_accuracy": 0.21751891523599626, "num_tokens": 82610779.0, "step": 32590 }, { "entropy": 6.110610914230347, "epoch": 3.7616849394114253, "grad_norm": 0.9609375, "learning_rate": 0.00036508861571466313, "loss": 5.6102, "mean_token_accuracy": 0.20716689229011537, "num_tokens": 82624152.0, "step": 32595 }, { "entropy": 6.064979410171508, "epoch": 3.762261973456434, "grad_norm": 0.90625, "learning_rate": 0.00036505080189372206, "loss": 5.6117, "mean_token_accuracy": 0.2089684158563614, "num_tokens": 82637638.0, "step": 32600 }, { "entropy": 6.0444416999816895, "epoch": 3.7628390075014426, "grad_norm": 0.98046875, "learning_rate": 0.000365012985043967, "loss": 5.5543, "mean_token_accuracy": 0.20645839273929595, "num_tokens": 82650665.0, "step": 32605 }, { "entropy": 6.099220132827758, "epoch": 3.763416041546451, "grad_norm": 0.890625, "learning_rate": 0.0003649751651666699, "loss": 5.6003, "mean_token_accuracy": 0.2077594816684723, "num_tokens": 82663317.0, "step": 32610 }, { "entropy": 6.048624086380005, "epoch": 3.76399307559146, "grad_norm": 0.96484375, "learning_rate": 0.0003649373422631028, "loss": 5.575, "mean_token_accuracy": 0.21233842968940736, "num_tokens": 82676310.0, "step": 32615 }, { "entropy": 6.155058479309082, "epoch": 3.7645701096364688, "grad_norm": 0.90234375, "learning_rate": 0.0003648995163345379, "loss": 5.6596, "mean_token_accuracy": 0.20171172320842742, "num_tokens": 82687832.0, "step": 32620 }, { "entropy": 6.196661853790284, "epoch": 3.765147143681477, "grad_norm": 0.9375, "learning_rate": 0.0003648616873822474, "loss": 5.731, "mean_token_accuracy": 0.19700943529605866, "num_tokens": 82700870.0, "step": 32625 }, { "entropy": 6.151900148391723, "epoch": 3.7657241777264856, "grad_norm": 0.91015625, "learning_rate": 0.00036482385540750374, "loss": 5.6878, "mean_token_accuracy": 0.2043942928314209, "num_tokens": 82713141.0, "step": 32630 }, { "entropy": 6.095987129211426, "epoch": 3.7663012117714945, "grad_norm": 1.0625, "learning_rate": 0.00036478602041157925, "loss": 5.6258, "mean_token_accuracy": 0.20356874614953996, "num_tokens": 82725354.0, "step": 32635 }, { "entropy": 6.0637561798095705, "epoch": 3.7668782458165033, "grad_norm": 0.94921875, "learning_rate": 0.00036474818239574664, "loss": 5.5142, "mean_token_accuracy": 0.21121003180742265, "num_tokens": 82737728.0, "step": 32640 }, { "entropy": 6.044016695022583, "epoch": 3.7674552798615117, "grad_norm": 0.9921875, "learning_rate": 0.0003647103413612784, "loss": 5.6443, "mean_token_accuracy": 0.20572449564933776, "num_tokens": 82749262.0, "step": 32645 }, { "entropy": 6.005218839645385, "epoch": 3.7680323139065206, "grad_norm": 0.97265625, "learning_rate": 0.00036467249730944744, "loss": 5.5386, "mean_token_accuracy": 0.21305883377790452, "num_tokens": 82762622.0, "step": 32650 }, { "entropy": 6.13591685295105, "epoch": 3.768609347951529, "grad_norm": 0.9296875, "learning_rate": 0.0003646346502415266, "loss": 5.7109, "mean_token_accuracy": 0.19854780584573745, "num_tokens": 82774795.0, "step": 32655 }, { "entropy": 6.185804843902588, "epoch": 3.769186381996538, "grad_norm": 0.9375, "learning_rate": 0.00036459680015878875, "loss": 5.6672, "mean_token_accuracy": 0.20425862967967987, "num_tokens": 82786437.0, "step": 32660 }, { "entropy": 6.187558364868164, "epoch": 3.7697634160415463, "grad_norm": 1.2421875, "learning_rate": 0.0003645589470625071, "loss": 5.6831, "mean_token_accuracy": 0.19404049813747407, "num_tokens": 82798813.0, "step": 32665 }, { "entropy": 5.974389934539795, "epoch": 3.770340450086555, "grad_norm": 0.984375, "learning_rate": 0.0003645210909539547, "loss": 5.5305, "mean_token_accuracy": 0.21113889217376708, "num_tokens": 82810765.0, "step": 32670 }, { "entropy": 6.078088092803955, "epoch": 3.770917484131564, "grad_norm": 0.984375, "learning_rate": 0.0003644832318344049, "loss": 5.5524, "mean_token_accuracy": 0.21098872423171997, "num_tokens": 82824046.0, "step": 32675 }, { "entropy": 6.137503910064697, "epoch": 3.7714945181765724, "grad_norm": 0.86328125, "learning_rate": 0.000364445369705131, "loss": 5.6642, "mean_token_accuracy": 0.20074114799499512, "num_tokens": 82837629.0, "step": 32680 }, { "entropy": 5.910543584823609, "epoch": 3.772071552221581, "grad_norm": 1.0546875, "learning_rate": 0.00036440750456740665, "loss": 5.4883, "mean_token_accuracy": 0.2203031063079834, "num_tokens": 82850921.0, "step": 32685 }, { "entropy": 6.110146474838257, "epoch": 3.7726485862665897, "grad_norm": 1.0703125, "learning_rate": 0.0003643696364225052, "loss": 5.6069, "mean_token_accuracy": 0.2026948794722557, "num_tokens": 82864114.0, "step": 32690 }, { "entropy": 6.149781513214111, "epoch": 3.7732256203115986, "grad_norm": 0.94921875, "learning_rate": 0.0003643317652717004, "loss": 5.6809, "mean_token_accuracy": 0.20298480242490768, "num_tokens": 82876384.0, "step": 32695 }, { "entropy": 6.064359569549561, "epoch": 3.773802654356607, "grad_norm": 1.0078125, "learning_rate": 0.00036429389111626614, "loss": 5.5679, "mean_token_accuracy": 0.2105186551809311, "num_tokens": 82887890.0, "step": 32700 }, { "entropy": 6.1342222690582275, "epoch": 3.7743796884016154, "grad_norm": 0.9296875, "learning_rate": 0.00036425601395747616, "loss": 5.6703, "mean_token_accuracy": 0.2015447735786438, "num_tokens": 82901033.0, "step": 32705 }, { "entropy": 6.057837057113647, "epoch": 3.7749567224466243, "grad_norm": 1.015625, "learning_rate": 0.00036421813379660447, "loss": 5.5293, "mean_token_accuracy": 0.20858179032802582, "num_tokens": 82913562.0, "step": 32710 }, { "entropy": 6.201757526397705, "epoch": 3.775533756491633, "grad_norm": 0.96484375, "learning_rate": 0.0003641802506349251, "loss": 5.7605, "mean_token_accuracy": 0.19189680069684983, "num_tokens": 82926175.0, "step": 32715 }, { "entropy": 6.125349712371826, "epoch": 3.7761107905366416, "grad_norm": 0.92578125, "learning_rate": 0.0003641423644737124, "loss": 5.6589, "mean_token_accuracy": 0.2019471138715744, "num_tokens": 82937797.0, "step": 32720 }, { "entropy": 6.1520851135253904, "epoch": 3.7766878245816504, "grad_norm": 0.92578125, "learning_rate": 0.00036410447531424057, "loss": 5.6349, "mean_token_accuracy": 0.20505717992782593, "num_tokens": 82950554.0, "step": 32725 }, { "entropy": 6.164891242980957, "epoch": 3.777264858626659, "grad_norm": 1.09375, "learning_rate": 0.00036406658315778386, "loss": 5.6508, "mean_token_accuracy": 0.20125698447227477, "num_tokens": 82962378.0, "step": 32730 }, { "entropy": 6.136154890060425, "epoch": 3.7778418926716677, "grad_norm": 1.0078125, "learning_rate": 0.00036402868800561696, "loss": 5.7003, "mean_token_accuracy": 0.19722906947135926, "num_tokens": 82974510.0, "step": 32735 }, { "entropy": 6.022222185134888, "epoch": 3.778418926716676, "grad_norm": 0.921875, "learning_rate": 0.0003639907898590143, "loss": 5.6466, "mean_token_accuracy": 0.20063384771347045, "num_tokens": 82988086.0, "step": 32740 }, { "entropy": 6.170497941970825, "epoch": 3.778995960761685, "grad_norm": 1.0234375, "learning_rate": 0.00036395288871925066, "loss": 5.7086, "mean_token_accuracy": 0.19816850423812865, "num_tokens": 83000787.0, "step": 32745 }, { "entropy": 6.096740818023681, "epoch": 3.779572994806694, "grad_norm": 1.015625, "learning_rate": 0.0003639149845876008, "loss": 5.5825, "mean_token_accuracy": 0.21283321976661682, "num_tokens": 83013365.0, "step": 32750 }, { "entropy": 6.082970905303955, "epoch": 3.7801500288517023, "grad_norm": 0.91796875, "learning_rate": 0.00036387707746533956, "loss": 5.6463, "mean_token_accuracy": 0.20189248770475388, "num_tokens": 83025184.0, "step": 32755 }, { "entropy": 6.1701476097106935, "epoch": 3.7807270628967107, "grad_norm": 0.94140625, "learning_rate": 0.00036383916735374205, "loss": 5.6839, "mean_token_accuracy": 0.1987305536866188, "num_tokens": 83037490.0, "step": 32760 }, { "entropy": 6.159075736999512, "epoch": 3.7813040969417195, "grad_norm": 0.91015625, "learning_rate": 0.00036380125425408325, "loss": 5.61, "mean_token_accuracy": 0.19836454689502717, "num_tokens": 83049831.0, "step": 32765 }, { "entropy": 6.107798957824707, "epoch": 3.7818811309867284, "grad_norm": 0.8828125, "learning_rate": 0.0003637633381676383, "loss": 5.6009, "mean_token_accuracy": 0.21274805814027786, "num_tokens": 83063299.0, "step": 32770 }, { "entropy": 6.126123046875, "epoch": 3.782458165031737, "grad_norm": 0.953125, "learning_rate": 0.0003637254190956826, "loss": 5.6562, "mean_token_accuracy": 0.20219721794128417, "num_tokens": 83076085.0, "step": 32775 }, { "entropy": 6.108048439025879, "epoch": 3.7830351990767457, "grad_norm": 0.9140625, "learning_rate": 0.0003636874970394915, "loss": 5.5945, "mean_token_accuracy": 0.20824381858110427, "num_tokens": 83089466.0, "step": 32780 }, { "entropy": 6.139750051498413, "epoch": 3.783612233121754, "grad_norm": 0.9375, "learning_rate": 0.00036364957200034055, "loss": 5.6455, "mean_token_accuracy": 0.19942262321710585, "num_tokens": 83102208.0, "step": 32785 }, { "entropy": 6.032274913787842, "epoch": 3.784189267166763, "grad_norm": 0.96484375, "learning_rate": 0.0003636116439795052, "loss": 5.4957, "mean_token_accuracy": 0.21652564853429795, "num_tokens": 83115804.0, "step": 32790 }, { "entropy": 6.087881088256836, "epoch": 3.7847663012117714, "grad_norm": 0.8671875, "learning_rate": 0.00036357371297826124, "loss": 5.6633, "mean_token_accuracy": 0.19774015694856645, "num_tokens": 83129599.0, "step": 32795 }, { "entropy": 6.076316213607788, "epoch": 3.7853433352567802, "grad_norm": 1.0, "learning_rate": 0.0003635357789978845, "loss": 5.6161, "mean_token_accuracy": 0.19634360522031785, "num_tokens": 83142019.0, "step": 32800 }, { "entropy": 6.12406964302063, "epoch": 3.7859203693017887, "grad_norm": 0.89453125, "learning_rate": 0.00036349784203965074, "loss": 5.6794, "mean_token_accuracy": 0.19823502749204636, "num_tokens": 83155099.0, "step": 32805 }, { "entropy": 6.10956301689148, "epoch": 3.7864974033467975, "grad_norm": 0.95703125, "learning_rate": 0.00036345990210483604, "loss": 5.6104, "mean_token_accuracy": 0.21280012428760528, "num_tokens": 83168294.0, "step": 32810 }, { "entropy": 6.132806968688965, "epoch": 3.787074437391806, "grad_norm": 0.92578125, "learning_rate": 0.0003634219591947165, "loss": 5.5843, "mean_token_accuracy": 0.20933948010206221, "num_tokens": 83181453.0, "step": 32815 }, { "entropy": 6.208439016342163, "epoch": 3.787651471436815, "grad_norm": 0.91796875, "learning_rate": 0.00036338401331056827, "loss": 5.7389, "mean_token_accuracy": 0.19418902397155763, "num_tokens": 83193942.0, "step": 32820 }, { "entropy": 6.11561598777771, "epoch": 3.7882285054818237, "grad_norm": 0.95703125, "learning_rate": 0.0003633460644536676, "loss": 5.6703, "mean_token_accuracy": 0.20308802276849747, "num_tokens": 83206507.0, "step": 32825 }, { "entropy": 6.078601121902466, "epoch": 3.788805539526832, "grad_norm": 1.015625, "learning_rate": 0.000363308112625291, "loss": 5.548, "mean_token_accuracy": 0.2040304198861122, "num_tokens": 83219383.0, "step": 32830 }, { "entropy": 6.072515392303467, "epoch": 3.7893825735718405, "grad_norm": 1.1484375, "learning_rate": 0.00036327015782671487, "loss": 5.6083, "mean_token_accuracy": 0.2036228060722351, "num_tokens": 83231178.0, "step": 32835 }, { "entropy": 6.126521015167237, "epoch": 3.7899596076168494, "grad_norm": 0.9609375, "learning_rate": 0.00036323220005921584, "loss": 5.6053, "mean_token_accuracy": 0.2092042863368988, "num_tokens": 83242804.0, "step": 32840 }, { "entropy": 6.132390451431275, "epoch": 3.790536641661858, "grad_norm": 0.953125, "learning_rate": 0.0003631942393240706, "loss": 5.6412, "mean_token_accuracy": 0.2018760234117508, "num_tokens": 83255483.0, "step": 32845 }, { "entropy": 6.074113941192627, "epoch": 3.7911136757068666, "grad_norm": 1.0, "learning_rate": 0.0003631562756225559, "loss": 5.6031, "mean_token_accuracy": 0.20220310091972352, "num_tokens": 83268442.0, "step": 32850 }, { "entropy": 6.151972961425781, "epoch": 3.7916907097518755, "grad_norm": 0.96484375, "learning_rate": 0.00036311830895594866, "loss": 5.7149, "mean_token_accuracy": 0.20267511457204818, "num_tokens": 83281089.0, "step": 32855 }, { "entropy": 6.024322032928467, "epoch": 3.792267743796884, "grad_norm": 0.875, "learning_rate": 0.0003630803393255259, "loss": 5.4699, "mean_token_accuracy": 0.2122853457927704, "num_tokens": 83293134.0, "step": 32860 }, { "entropy": 6.017717504501343, "epoch": 3.792844777841893, "grad_norm": 0.98828125, "learning_rate": 0.00036304236673256467, "loss": 5.5166, "mean_token_accuracy": 0.2070764809846878, "num_tokens": 83305717.0, "step": 32865 }, { "entropy": 6.128232383728028, "epoch": 3.793421811886901, "grad_norm": 1.0234375, "learning_rate": 0.0003630043911783422, "loss": 5.557, "mean_token_accuracy": 0.21078261882066726, "num_tokens": 83317411.0, "step": 32870 }, { "entropy": 6.079075860977173, "epoch": 3.79399884593191, "grad_norm": 0.98046875, "learning_rate": 0.00036296641266413566, "loss": 5.6663, "mean_token_accuracy": 0.205397766828537, "num_tokens": 83330245.0, "step": 32875 }, { "entropy": 6.045082092285156, "epoch": 3.7945758799769185, "grad_norm": 0.99609375, "learning_rate": 0.0003629284311912226, "loss": 5.5792, "mean_token_accuracy": 0.20603713691234588, "num_tokens": 83342617.0, "step": 32880 }, { "entropy": 6.065017795562744, "epoch": 3.7951529140219273, "grad_norm": 0.984375, "learning_rate": 0.00036289044676088045, "loss": 5.5379, "mean_token_accuracy": 0.21593087613582612, "num_tokens": 83354238.0, "step": 32885 }, { "entropy": 6.043313121795654, "epoch": 3.7957299480669358, "grad_norm": 0.96875, "learning_rate": 0.0003628524593743867, "loss": 5.5122, "mean_token_accuracy": 0.20442054867744447, "num_tokens": 83366838.0, "step": 32890 }, { "entropy": 6.043250608444214, "epoch": 3.7963069821119446, "grad_norm": 0.90625, "learning_rate": 0.00036281446903301917, "loss": 5.5633, "mean_token_accuracy": 0.20783358216285705, "num_tokens": 83378293.0, "step": 32895 }, { "entropy": 6.143496990203857, "epoch": 3.7968840161569535, "grad_norm": 0.90625, "learning_rate": 0.00036277647573805554, "loss": 5.6184, "mean_token_accuracy": 0.20373995006084442, "num_tokens": 83391345.0, "step": 32900 }, { "entropy": 6.148879528045654, "epoch": 3.797461050201962, "grad_norm": 0.9375, "learning_rate": 0.00036273847949077384, "loss": 5.6735, "mean_token_accuracy": 0.1974882960319519, "num_tokens": 83403764.0, "step": 32905 }, { "entropy": 6.078379726409912, "epoch": 3.7980380842469703, "grad_norm": 0.95703125, "learning_rate": 0.0003627004802924519, "loss": 5.5828, "mean_token_accuracy": 0.20430790930986403, "num_tokens": 83416496.0, "step": 32910 }, { "entropy": 6.101625728607178, "epoch": 3.798615118291979, "grad_norm": 0.93359375, "learning_rate": 0.00036266247814436794, "loss": 5.5799, "mean_token_accuracy": 0.2013986587524414, "num_tokens": 83429915.0, "step": 32915 }, { "entropy": 6.1453032970428465, "epoch": 3.799192152336988, "grad_norm": 0.97265625, "learning_rate": 0.00036262447304779996, "loss": 5.6366, "mean_token_accuracy": 0.1979958161711693, "num_tokens": 83442195.0, "step": 32920 }, { "entropy": 6.194523000717163, "epoch": 3.7997691863819965, "grad_norm": 1.0, "learning_rate": 0.00036258646500402636, "loss": 5.7321, "mean_token_accuracy": 0.19568776041269303, "num_tokens": 83454105.0, "step": 32925 }, { "entropy": 6.082583379745484, "epoch": 3.8003462204270053, "grad_norm": 1.109375, "learning_rate": 0.00036254845401432556, "loss": 5.5765, "mean_token_accuracy": 0.21255692839622498, "num_tokens": 83466487.0, "step": 32930 }, { "entropy": 6.049877691268921, "epoch": 3.8009232544720137, "grad_norm": 0.98046875, "learning_rate": 0.00036251044007997607, "loss": 5.5233, "mean_token_accuracy": 0.21362363696098327, "num_tokens": 83478688.0, "step": 32935 }, { "entropy": 6.125126361846924, "epoch": 3.8015002885170226, "grad_norm": 1.0234375, "learning_rate": 0.0003624724232022563, "loss": 5.68, "mean_token_accuracy": 0.20447041392326354, "num_tokens": 83492474.0, "step": 32940 }, { "entropy": 6.136812591552735, "epoch": 3.802077322562031, "grad_norm": 0.96484375, "learning_rate": 0.00036243440338244503, "loss": 5.6274, "mean_token_accuracy": 0.20964494496583938, "num_tokens": 83505409.0, "step": 32945 }, { "entropy": 6.062854051589966, "epoch": 3.80265435660704, "grad_norm": 0.984375, "learning_rate": 0.0003623963806218211, "loss": 5.5439, "mean_token_accuracy": 0.208920019865036, "num_tokens": 83518502.0, "step": 32950 }, { "entropy": 6.221317195892334, "epoch": 3.8032313906520487, "grad_norm": 1.015625, "learning_rate": 0.00036235835492166326, "loss": 5.812, "mean_token_accuracy": 0.18976594656705856, "num_tokens": 83531688.0, "step": 32955 }, { "entropy": 6.185259485244751, "epoch": 3.803808424697057, "grad_norm": 0.94140625, "learning_rate": 0.0003623203262832505, "loss": 5.6891, "mean_token_accuracy": 0.19513944387435914, "num_tokens": 83544845.0, "step": 32960 }, { "entropy": 6.0592139720916744, "epoch": 3.8043854587420656, "grad_norm": 0.953125, "learning_rate": 0.0003622822947078621, "loss": 5.586, "mean_token_accuracy": 0.20544871240854262, "num_tokens": 83558178.0, "step": 32965 }, { "entropy": 6.047280788421631, "epoch": 3.8049624927870744, "grad_norm": 0.98046875, "learning_rate": 0.0003622442601967769, "loss": 5.6343, "mean_token_accuracy": 0.1995137721300125, "num_tokens": 83570405.0, "step": 32970 }, { "entropy": 6.122627830505371, "epoch": 3.8055395268320833, "grad_norm": 0.98046875, "learning_rate": 0.0003622062227512745, "loss": 5.6297, "mean_token_accuracy": 0.20263560712337494, "num_tokens": 83584225.0, "step": 32975 }, { "entropy": 6.146964168548584, "epoch": 3.8061165608770917, "grad_norm": 1.0703125, "learning_rate": 0.00036216818237263393, "loss": 5.6139, "mean_token_accuracy": 0.2086881786584854, "num_tokens": 83596187.0, "step": 32980 }, { "entropy": 6.076435708999634, "epoch": 3.8066935949221, "grad_norm": 1.03125, "learning_rate": 0.000362130139062135, "loss": 5.6076, "mean_token_accuracy": 0.20205966681241988, "num_tokens": 83608798.0, "step": 32985 }, { "entropy": 6.103664541244507, "epoch": 3.807270628967109, "grad_norm": 1.0234375, "learning_rate": 0.0003620920928210571, "loss": 5.5517, "mean_token_accuracy": 0.20823033452033995, "num_tokens": 83621826.0, "step": 32990 }, { "entropy": 6.055540227890015, "epoch": 3.807847663012118, "grad_norm": 0.90625, "learning_rate": 0.0003620540436506799, "loss": 5.6002, "mean_token_accuracy": 0.2017235904932022, "num_tokens": 83633632.0, "step": 32995 }, { "entropy": 6.098191022872925, "epoch": 3.8084246970571263, "grad_norm": 0.9765625, "learning_rate": 0.00036201599155228313, "loss": 5.6355, "mean_token_accuracy": 0.2051863595843315, "num_tokens": 83647659.0, "step": 33000 }, { "epoch": 3.8084246970571263, "eval_entropy": 6.002264706899336, "eval_loss": 5.746444225311279, "eval_mean_token_accuracy": 0.2049994945615098, "eval_num_tokens": 83647659.0, "eval_runtime": 22.9958, "eval_samples_per_second": 1223.53, "eval_steps_per_second": 152.941, "step": 33000 }, { "entropy": 6.115227508544922, "epoch": 3.809001731102135, "grad_norm": 0.99609375, "learning_rate": 0.0003619779365271468, "loss": 5.5523, "mean_token_accuracy": 0.2084027573466301, "num_tokens": 83660950.0, "step": 33005 }, { "entropy": 6.137101650238037, "epoch": 3.8095787651471436, "grad_norm": 0.93359375, "learning_rate": 0.00036193987857655074, "loss": 5.62, "mean_token_accuracy": 0.20889806002378464, "num_tokens": 83673671.0, "step": 33010 }, { "entropy": 6.092999982833862, "epoch": 3.8101557991921524, "grad_norm": 0.89453125, "learning_rate": 0.00036190181770177503, "loss": 5.5949, "mean_token_accuracy": 0.20383886694908143, "num_tokens": 83685851.0, "step": 33015 }, { "entropy": 6.116231966018677, "epoch": 3.810732833237161, "grad_norm": 0.96484375, "learning_rate": 0.0003618637539040998, "loss": 5.5794, "mean_token_accuracy": 0.20814661234617232, "num_tokens": 83699138.0, "step": 33020 }, { "entropy": 6.08889799118042, "epoch": 3.8113098672821697, "grad_norm": 0.89453125, "learning_rate": 0.0003618256871848054, "loss": 5.6346, "mean_token_accuracy": 0.2052951991558075, "num_tokens": 83711392.0, "step": 33025 }, { "entropy": 6.04820442199707, "epoch": 3.8118869013271786, "grad_norm": 0.84375, "learning_rate": 0.0003617876175451722, "loss": 5.604, "mean_token_accuracy": 0.21000177413225174, "num_tokens": 83726170.0, "step": 33030 }, { "entropy": 6.121216201782227, "epoch": 3.812463935372187, "grad_norm": 0.96484375, "learning_rate": 0.00036174954498648055, "loss": 5.6153, "mean_token_accuracy": 0.21042023450136185, "num_tokens": 83738724.0, "step": 33035 }, { "entropy": 6.003577136993409, "epoch": 3.8130409694171954, "grad_norm": 0.95703125, "learning_rate": 0.000361711469510011, "loss": 5.56, "mean_token_accuracy": 0.21309767961502074, "num_tokens": 83752177.0, "step": 33040 }, { "entropy": 6.0856188297271725, "epoch": 3.8136180034622043, "grad_norm": 0.95703125, "learning_rate": 0.0003616733911170443, "loss": 5.5925, "mean_token_accuracy": 0.20746787786483764, "num_tokens": 83764645.0, "step": 33045 }, { "entropy": 6.147206020355225, "epoch": 3.814195037507213, "grad_norm": 0.9765625, "learning_rate": 0.00036163530980886114, "loss": 5.5931, "mean_token_accuracy": 0.1981767639517784, "num_tokens": 83775843.0, "step": 33050 }, { "entropy": 6.113157415390015, "epoch": 3.8147720715522215, "grad_norm": 1.3125, "learning_rate": 0.0003615972255867424, "loss": 5.5825, "mean_token_accuracy": 0.20405851304531097, "num_tokens": 83788308.0, "step": 33055 }, { "entropy": 6.139213609695434, "epoch": 3.8153491055972304, "grad_norm": 1.046875, "learning_rate": 0.00036155913845196903, "loss": 5.6362, "mean_token_accuracy": 0.20707210898399353, "num_tokens": 83800947.0, "step": 33060 }, { "entropy": 6.087186336517334, "epoch": 3.815926139642239, "grad_norm": 0.953125, "learning_rate": 0.0003615210484058219, "loss": 5.5891, "mean_token_accuracy": 0.21279811561107637, "num_tokens": 83814332.0, "step": 33065 }, { "entropy": 6.127863264083862, "epoch": 3.8165031736872477, "grad_norm": 1.140625, "learning_rate": 0.0003614829554495823, "loss": 5.6754, "mean_token_accuracy": 0.19855415672063828, "num_tokens": 83825942.0, "step": 33070 }, { "entropy": 6.17516713142395, "epoch": 3.817080207732256, "grad_norm": 0.96875, "learning_rate": 0.00036144485958453153, "loss": 5.6587, "mean_token_accuracy": 0.20230256766080856, "num_tokens": 83837841.0, "step": 33075 }, { "entropy": 6.080211496353149, "epoch": 3.817657241777265, "grad_norm": 0.9453125, "learning_rate": 0.0003614067608119508, "loss": 5.5952, "mean_token_accuracy": 0.2020416870713234, "num_tokens": 83849675.0, "step": 33080 }, { "entropy": 6.109024286270142, "epoch": 3.8182342758222734, "grad_norm": 0.93359375, "learning_rate": 0.0003613686591331216, "loss": 5.6302, "mean_token_accuracy": 0.20066949725151062, "num_tokens": 83861834.0, "step": 33085 }, { "entropy": 6.0655725479125975, "epoch": 3.8188113098672822, "grad_norm": 0.890625, "learning_rate": 0.0003613305545493255, "loss": 5.5421, "mean_token_accuracy": 0.20998494774103166, "num_tokens": 83874360.0, "step": 33090 }, { "entropy": 6.124150657653809, "epoch": 3.8193883439122907, "grad_norm": 0.984375, "learning_rate": 0.000361292447061844, "loss": 5.6752, "mean_token_accuracy": 0.20430647134780883, "num_tokens": 83889262.0, "step": 33095 }, { "entropy": 6.205819034576416, "epoch": 3.8199653779572995, "grad_norm": 0.99609375, "learning_rate": 0.00036125433667195896, "loss": 5.686, "mean_token_accuracy": 0.19616526067256929, "num_tokens": 83901967.0, "step": 33100 }, { "entropy": 6.085394954681396, "epoch": 3.8205424120023084, "grad_norm": 0.94140625, "learning_rate": 0.0003612162233809521, "loss": 5.5914, "mean_token_accuracy": 0.2094152271747589, "num_tokens": 83914909.0, "step": 33105 }, { "entropy": 6.0280091762542725, "epoch": 3.821119446047317, "grad_norm": 1.109375, "learning_rate": 0.0003611781071901054, "loss": 5.6194, "mean_token_accuracy": 0.2058122530579567, "num_tokens": 83927414.0, "step": 33110 }, { "entropy": 6.151128101348877, "epoch": 3.821696480092325, "grad_norm": 0.8203125, "learning_rate": 0.00036113998810070094, "loss": 5.659, "mean_token_accuracy": 0.20045981258153917, "num_tokens": 83940341.0, "step": 33115 }, { "entropy": 6.171204614639282, "epoch": 3.822273514137334, "grad_norm": 0.90234375, "learning_rate": 0.00036110186611402074, "loss": 5.626, "mean_token_accuracy": 0.19879001677036284, "num_tokens": 83952509.0, "step": 33120 }, { "entropy": 6.104555416107178, "epoch": 3.822850548182343, "grad_norm": 0.93359375, "learning_rate": 0.000361063741231347, "loss": 5.645, "mean_token_accuracy": 0.19978587478399276, "num_tokens": 83964455.0, "step": 33125 }, { "entropy": 6.100145387649536, "epoch": 3.8234275822273514, "grad_norm": 1.015625, "learning_rate": 0.0003610256134539621, "loss": 5.5868, "mean_token_accuracy": 0.2091189667582512, "num_tokens": 83977003.0, "step": 33130 }, { "entropy": 6.170768928527832, "epoch": 3.82400461627236, "grad_norm": 0.97265625, "learning_rate": 0.0003609874827831484, "loss": 5.6778, "mean_token_accuracy": 0.19716740101575853, "num_tokens": 83988740.0, "step": 33135 }, { "entropy": 6.089428853988648, "epoch": 3.8245816503173686, "grad_norm": 0.98046875, "learning_rate": 0.00036094934922018847, "loss": 5.6189, "mean_token_accuracy": 0.20273886620998383, "num_tokens": 84001814.0, "step": 33140 }, { "entropy": 6.039244985580444, "epoch": 3.8251586843623775, "grad_norm": 1.0, "learning_rate": 0.00036091121276636486, "loss": 5.5637, "mean_token_accuracy": 0.21307864636182786, "num_tokens": 84013889.0, "step": 33145 }, { "entropy": 6.0446113586425785, "epoch": 3.825735718407386, "grad_norm": 1.8125, "learning_rate": 0.0003608730734229602, "loss": 5.5768, "mean_token_accuracy": 0.2095784768462181, "num_tokens": 84025453.0, "step": 33150 }, { "entropy": 6.085889053344727, "epoch": 3.8263127524523948, "grad_norm": 0.95703125, "learning_rate": 0.0003608349311912575, "loss": 5.5547, "mean_token_accuracy": 0.19999430775642396, "num_tokens": 84038246.0, "step": 33155 }, { "entropy": 6.198304986953735, "epoch": 3.826889786497403, "grad_norm": 0.96875, "learning_rate": 0.00036079678607253945, "loss": 5.7339, "mean_token_accuracy": 0.19320725351572038, "num_tokens": 84049559.0, "step": 33160 }, { "entropy": 6.095018768310547, "epoch": 3.827466820542412, "grad_norm": 1.015625, "learning_rate": 0.0003607586380680892, "loss": 5.6464, "mean_token_accuracy": 0.21408105045557022, "num_tokens": 84060969.0, "step": 33165 }, { "entropy": 6.165418672561645, "epoch": 3.8280438545874205, "grad_norm": 0.953125, "learning_rate": 0.0003607204871791896, "loss": 5.6829, "mean_token_accuracy": 0.19782189279794693, "num_tokens": 84074623.0, "step": 33170 }, { "entropy": 5.951971817016601, "epoch": 3.8286208886324293, "grad_norm": 0.93359375, "learning_rate": 0.00036068233340712415, "loss": 5.4868, "mean_token_accuracy": 0.21891556829214096, "num_tokens": 84087187.0, "step": 33175 }, { "entropy": 6.096566867828369, "epoch": 3.829197922677438, "grad_norm": 0.97265625, "learning_rate": 0.0003606441767531759, "loss": 5.6831, "mean_token_accuracy": 0.19806020557880402, "num_tokens": 84099392.0, "step": 33180 }, { "entropy": 6.056458854675293, "epoch": 3.8297749567224466, "grad_norm": 0.98828125, "learning_rate": 0.00036060601721862835, "loss": 5.5279, "mean_token_accuracy": 0.21461428552865983, "num_tokens": 84114191.0, "step": 33185 }, { "entropy": 6.036667156219482, "epoch": 3.830351990767455, "grad_norm": 0.94140625, "learning_rate": 0.0003605678548047649, "loss": 5.5752, "mean_token_accuracy": 0.2035483315587044, "num_tokens": 84126013.0, "step": 33190 }, { "entropy": 6.0725034236907955, "epoch": 3.830929024812464, "grad_norm": 0.8984375, "learning_rate": 0.00036052968951286917, "loss": 5.6617, "mean_token_accuracy": 0.2068752095103264, "num_tokens": 84138702.0, "step": 33195 }, { "entropy": 6.125632381439209, "epoch": 3.8315060588574728, "grad_norm": 0.890625, "learning_rate": 0.0003604915213442248, "loss": 5.61, "mean_token_accuracy": 0.2049739181995392, "num_tokens": 84151854.0, "step": 33200 }, { "entropy": 6.055310153961182, "epoch": 3.832083092902481, "grad_norm": 0.89453125, "learning_rate": 0.00036045335030011563, "loss": 5.6128, "mean_token_accuracy": 0.20610808283090593, "num_tokens": 84165183.0, "step": 33205 }, { "entropy": 6.07265453338623, "epoch": 3.83266012694749, "grad_norm": 0.9296875, "learning_rate": 0.0003604151763818254, "loss": 5.565, "mean_token_accuracy": 0.19883307218551635, "num_tokens": 84177082.0, "step": 33210 }, { "entropy": 6.142414283752442, "epoch": 3.8332371609924984, "grad_norm": 1.0234375, "learning_rate": 0.0003603769995906382, "loss": 5.6089, "mean_token_accuracy": 0.20537890940904618, "num_tokens": 84189289.0, "step": 33215 }, { "entropy": 6.032017850875855, "epoch": 3.8338141950375073, "grad_norm": 0.9453125, "learning_rate": 0.000360338819927838, "loss": 5.5256, "mean_token_accuracy": 0.21574822068214417, "num_tokens": 84201877.0, "step": 33220 }, { "entropy": 6.16310749053955, "epoch": 3.8343912290825157, "grad_norm": 0.9453125, "learning_rate": 0.000360300637394709, "loss": 5.6747, "mean_token_accuracy": 0.19754361659288405, "num_tokens": 84212963.0, "step": 33225 }, { "entropy": 6.070192956924439, "epoch": 3.8349682631275246, "grad_norm": 1.0546875, "learning_rate": 0.0003602624519925354, "loss": 5.5556, "mean_token_accuracy": 0.21068055331707, "num_tokens": 84227577.0, "step": 33230 }, { "entropy": 6.1115833759307865, "epoch": 3.8355452971725335, "grad_norm": 0.90625, "learning_rate": 0.00036022426372260156, "loss": 5.7118, "mean_token_accuracy": 0.19522076100111008, "num_tokens": 84240285.0, "step": 33235 }, { "entropy": 6.104603958129883, "epoch": 3.836122331217542, "grad_norm": 0.9296875, "learning_rate": 0.00036018607258619196, "loss": 5.6036, "mean_token_accuracy": 0.20627150684595108, "num_tokens": 84253308.0, "step": 33240 }, { "entropy": 6.095502185821533, "epoch": 3.8366993652625503, "grad_norm": 0.9609375, "learning_rate": 0.0003601478785845912, "loss": 5.595, "mean_token_accuracy": 0.20843304842710494, "num_tokens": 84265213.0, "step": 33245 }, { "entropy": 6.1630088806152346, "epoch": 3.837276399307559, "grad_norm": 1.0625, "learning_rate": 0.0003601096817190837, "loss": 5.6728, "mean_token_accuracy": 0.20044924467802047, "num_tokens": 84277865.0, "step": 33250 }, { "entropy": 6.159406042098999, "epoch": 3.837853433352568, "grad_norm": 0.953125, "learning_rate": 0.0003600714819909544, "loss": 5.7262, "mean_token_accuracy": 0.19874559193849564, "num_tokens": 84289771.0, "step": 33255 }, { "entropy": 6.191400241851807, "epoch": 3.8384304673975764, "grad_norm": 1.03125, "learning_rate": 0.0003600332794014881, "loss": 5.6583, "mean_token_accuracy": 0.20253454446792601, "num_tokens": 84300716.0, "step": 33260 }, { "entropy": 6.099560737609863, "epoch": 3.839007501442585, "grad_norm": 0.94140625, "learning_rate": 0.0003599950739519697, "loss": 5.6785, "mean_token_accuracy": 0.20405016839504242, "num_tokens": 84312274.0, "step": 33265 }, { "entropy": 6.152928352355957, "epoch": 3.8395845354875937, "grad_norm": 0.9296875, "learning_rate": 0.0003599568656436841, "loss": 5.6313, "mean_token_accuracy": 0.20496930330991744, "num_tokens": 84324550.0, "step": 33270 }, { "entropy": 6.09661979675293, "epoch": 3.8401615695326026, "grad_norm": 0.9296875, "learning_rate": 0.0003599186544779166, "loss": 5.6012, "mean_token_accuracy": 0.20848660171031952, "num_tokens": 84336935.0, "step": 33275 }, { "entropy": 6.110539293289184, "epoch": 3.840738603577611, "grad_norm": 0.875, "learning_rate": 0.0003598804404559523, "loss": 5.65, "mean_token_accuracy": 0.20124222189188004, "num_tokens": 84349757.0, "step": 33280 }, { "entropy": 6.139134454727173, "epoch": 3.84131563762262, "grad_norm": 1.03125, "learning_rate": 0.00035984222357907667, "loss": 5.589, "mean_token_accuracy": 0.2093803256750107, "num_tokens": 84361149.0, "step": 33285 }, { "entropy": 5.919655656814575, "epoch": 3.8418926716676283, "grad_norm": 1.046875, "learning_rate": 0.00035980400384857486, "loss": 5.4104, "mean_token_accuracy": 0.22745767384767532, "num_tokens": 84373714.0, "step": 33290 }, { "entropy": 6.180468368530273, "epoch": 3.842469705712637, "grad_norm": 0.92578125, "learning_rate": 0.0003597657812657325, "loss": 5.6793, "mean_token_accuracy": 0.19682663232088088, "num_tokens": 84386193.0, "step": 33295 }, { "entropy": 6.185771417617798, "epoch": 3.8430467397576455, "grad_norm": 0.90234375, "learning_rate": 0.00035972755583183526, "loss": 5.6793, "mean_token_accuracy": 0.19723526984453202, "num_tokens": 84399122.0, "step": 33300 }, { "entropy": 6.039923858642578, "epoch": 3.8436237738026544, "grad_norm": 0.94140625, "learning_rate": 0.00035968932754816877, "loss": 5.6108, "mean_token_accuracy": 0.20566056966781615, "num_tokens": 84413058.0, "step": 33305 }, { "entropy": 6.129089593887329, "epoch": 3.8442008078476633, "grad_norm": 0.890625, "learning_rate": 0.0003596510964160188, "loss": 5.5797, "mean_token_accuracy": 0.20427815169095992, "num_tokens": 84425003.0, "step": 33310 }, { "entropy": 6.022801113128662, "epoch": 3.8447778418926717, "grad_norm": 1.421875, "learning_rate": 0.00035961286243667116, "loss": 5.4697, "mean_token_accuracy": 0.2220272034406662, "num_tokens": 84437873.0, "step": 33315 }, { "entropy": 6.0829442024230955, "epoch": 3.84535487593768, "grad_norm": 0.9921875, "learning_rate": 0.000359574625611412, "loss": 5.6626, "mean_token_accuracy": 0.20509454607963562, "num_tokens": 84450991.0, "step": 33320 }, { "entropy": 6.022344446182251, "epoch": 3.845931909982689, "grad_norm": 1.0078125, "learning_rate": 0.0003595363859415273, "loss": 5.5577, "mean_token_accuracy": 0.20722992420196534, "num_tokens": 84464464.0, "step": 33325 }, { "entropy": 6.083918523788452, "epoch": 3.846508944027698, "grad_norm": 1.0625, "learning_rate": 0.00035949814342830334, "loss": 5.5997, "mean_token_accuracy": 0.20815321505069734, "num_tokens": 84477757.0, "step": 33330 }, { "entropy": 6.119990015029908, "epoch": 3.8470859780727062, "grad_norm": 0.92578125, "learning_rate": 0.0003594598980730262, "loss": 5.4876, "mean_token_accuracy": 0.20616916865110396, "num_tokens": 84490470.0, "step": 33335 }, { "entropy": 6.165686893463135, "epoch": 3.847663012117715, "grad_norm": 0.9609375, "learning_rate": 0.0003594216498769824, "loss": 5.602, "mean_token_accuracy": 0.20258891731500625, "num_tokens": 84503093.0, "step": 33340 }, { "entropy": 6.046669244766235, "epoch": 3.8482400461627235, "grad_norm": 0.9296875, "learning_rate": 0.00035938339884145824, "loss": 5.6079, "mean_token_accuracy": 0.20831372886896132, "num_tokens": 84515135.0, "step": 33345 }, { "entropy": 6.1239931106567385, "epoch": 3.8488170802077324, "grad_norm": 1.09375, "learning_rate": 0.0003593451449677405, "loss": 5.6386, "mean_token_accuracy": 0.2001243159174919, "num_tokens": 84526988.0, "step": 33350 }, { "entropy": 6.136247539520264, "epoch": 3.849394114252741, "grad_norm": 0.91796875, "learning_rate": 0.0003593068882571156, "loss": 5.5566, "mean_token_accuracy": 0.2071867674589157, "num_tokens": 84539350.0, "step": 33355 }, { "entropy": 6.036378526687622, "epoch": 3.8499711482977497, "grad_norm": 0.9921875, "learning_rate": 0.00035926862871087046, "loss": 5.5548, "mean_token_accuracy": 0.20641928315162658, "num_tokens": 84551562.0, "step": 33360 }, { "entropy": 6.111506557464599, "epoch": 3.850548182342758, "grad_norm": 0.94140625, "learning_rate": 0.0003592303663302919, "loss": 5.6251, "mean_token_accuracy": 0.20090053528547286, "num_tokens": 84563487.0, "step": 33365 }, { "entropy": 6.125816679000854, "epoch": 3.851125216387767, "grad_norm": 0.921875, "learning_rate": 0.0003591921011166667, "loss": 5.5992, "mean_token_accuracy": 0.20233289003372193, "num_tokens": 84575865.0, "step": 33370 }, { "entropy": 6.08932785987854, "epoch": 3.8517022504327754, "grad_norm": 0.95703125, "learning_rate": 0.000359153833071282, "loss": 5.6471, "mean_token_accuracy": 0.20459658801555633, "num_tokens": 84589183.0, "step": 33375 }, { "entropy": 6.065012645721436, "epoch": 3.8522792844777842, "grad_norm": 0.9765625, "learning_rate": 0.00035911556219542495, "loss": 5.5694, "mean_token_accuracy": 0.20598982125520707, "num_tokens": 84603798.0, "step": 33380 }, { "entropy": 6.103428173065185, "epoch": 3.852856318522793, "grad_norm": 0.9765625, "learning_rate": 0.0003590772884903828, "loss": 5.5781, "mean_token_accuracy": 0.2167849987745285, "num_tokens": 84616056.0, "step": 33385 }, { "entropy": 6.1010619640350345, "epoch": 3.8534333525678015, "grad_norm": 0.984375, "learning_rate": 0.00035903901195744276, "loss": 5.5789, "mean_token_accuracy": 0.2054425969719887, "num_tokens": 84629854.0, "step": 33390 }, { "entropy": 6.087514495849609, "epoch": 3.85401038661281, "grad_norm": 0.9140625, "learning_rate": 0.0003590007325978923, "loss": 5.663, "mean_token_accuracy": 0.1989055022597313, "num_tokens": 84642015.0, "step": 33395 }, { "entropy": 6.140673685073852, "epoch": 3.854587420657819, "grad_norm": 0.91796875, "learning_rate": 0.000358962450413019, "loss": 5.6457, "mean_token_accuracy": 0.2022153079509735, "num_tokens": 84654732.0, "step": 33400 }, { "entropy": 6.1412034034729, "epoch": 3.8551644547028276, "grad_norm": 0.953125, "learning_rate": 0.0003589241654041103, "loss": 5.6813, "mean_token_accuracy": 0.2025569811463356, "num_tokens": 84667315.0, "step": 33405 }, { "entropy": 6.141792297363281, "epoch": 3.855741488747836, "grad_norm": 0.98046875, "learning_rate": 0.000358885877572454, "loss": 5.6459, "mean_token_accuracy": 0.19607073813676834, "num_tokens": 84680291.0, "step": 33410 }, { "entropy": 6.064030408859253, "epoch": 3.856318522792845, "grad_norm": 1.046875, "learning_rate": 0.00035884758691933787, "loss": 5.5756, "mean_token_accuracy": 0.20241304934024812, "num_tokens": 84692716.0, "step": 33415 }, { "entropy": 6.074345111846924, "epoch": 3.8568955568378533, "grad_norm": 1.046875, "learning_rate": 0.0003588092934460498, "loss": 5.5397, "mean_token_accuracy": 0.2167934238910675, "num_tokens": 84704822.0, "step": 33420 }, { "entropy": 6.087766408920288, "epoch": 3.857472590882862, "grad_norm": 0.8984375, "learning_rate": 0.00035877099715387776, "loss": 5.6489, "mean_token_accuracy": 0.19916362017393113, "num_tokens": 84718047.0, "step": 33425 }, { "entropy": 6.169582557678223, "epoch": 3.8580496249278706, "grad_norm": 0.9453125, "learning_rate": 0.00035873269804410993, "loss": 5.7337, "mean_token_accuracy": 0.19794039726257323, "num_tokens": 84731209.0, "step": 33430 }, { "entropy": 6.105790710449218, "epoch": 3.8586266589728795, "grad_norm": 0.921875, "learning_rate": 0.0003586943961180343, "loss": 5.6645, "mean_token_accuracy": 0.19722446501255037, "num_tokens": 84745014.0, "step": 33435 }, { "entropy": 6.09491753578186, "epoch": 3.859203693017888, "grad_norm": 1.1015625, "learning_rate": 0.00035865609137693933, "loss": 5.5895, "mean_token_accuracy": 0.21143753230571746, "num_tokens": 84758751.0, "step": 33440 }, { "entropy": 6.14051570892334, "epoch": 3.8597807270628968, "grad_norm": 0.93359375, "learning_rate": 0.0003586177838221132, "loss": 5.6027, "mean_token_accuracy": 0.1978860840201378, "num_tokens": 84772108.0, "step": 33445 }, { "entropy": 6.110732841491699, "epoch": 3.860357761107905, "grad_norm": 0.93359375, "learning_rate": 0.00035857947345484454, "loss": 5.6628, "mean_token_accuracy": 0.20033389180898667, "num_tokens": 84785120.0, "step": 33450 }, { "entropy": 6.180313491821289, "epoch": 3.860934795152914, "grad_norm": 0.89453125, "learning_rate": 0.0003585411602764217, "loss": 5.688, "mean_token_accuracy": 0.19840385317802428, "num_tokens": 84797941.0, "step": 33455 }, { "entropy": 6.056058740615844, "epoch": 3.861511829197923, "grad_norm": 0.94921875, "learning_rate": 0.00035850284428813346, "loss": 5.5353, "mean_token_accuracy": 0.21057915687561035, "num_tokens": 84809065.0, "step": 33460 }, { "entropy": 6.097518968582153, "epoch": 3.8620888632429313, "grad_norm": 0.90625, "learning_rate": 0.0003584645254912685, "loss": 5.6428, "mean_token_accuracy": 0.20579753965139388, "num_tokens": 84821865.0, "step": 33465 }, { "entropy": 6.101900672912597, "epoch": 3.8626658972879397, "grad_norm": 0.9296875, "learning_rate": 0.00035842620388711575, "loss": 5.5593, "mean_token_accuracy": 0.20282736718654631, "num_tokens": 84835451.0, "step": 33470 }, { "entropy": 6.084393548965454, "epoch": 3.8632429313329486, "grad_norm": 1.015625, "learning_rate": 0.0003583878794769641, "loss": 5.6032, "mean_token_accuracy": 0.20311120748519898, "num_tokens": 84847732.0, "step": 33475 }, { "entropy": 6.057758474349976, "epoch": 3.8638199653779575, "grad_norm": 0.98046875, "learning_rate": 0.0003583495522621024, "loss": 5.5535, "mean_token_accuracy": 0.2112577587366104, "num_tokens": 84860431.0, "step": 33480 }, { "entropy": 6.035004901885986, "epoch": 3.864396999422966, "grad_norm": 0.90625, "learning_rate": 0.00035831122224382, "loss": 5.573, "mean_token_accuracy": 0.2079429879784584, "num_tokens": 84872810.0, "step": 33485 }, { "entropy": 6.062376546859741, "epoch": 3.8649740334679747, "grad_norm": 0.9453125, "learning_rate": 0.00035827288942340605, "loss": 5.6099, "mean_token_accuracy": 0.2063120722770691, "num_tokens": 84885394.0, "step": 33490 }, { "entropy": 6.10299859046936, "epoch": 3.865551067512983, "grad_norm": 0.94140625, "learning_rate": 0.00035823455380214984, "loss": 5.6076, "mean_token_accuracy": 0.20408399701118468, "num_tokens": 84898416.0, "step": 33495 }, { "entropy": 6.079794597625733, "epoch": 3.866128101557992, "grad_norm": 0.96875, "learning_rate": 0.0003581962153813406, "loss": 5.5482, "mean_token_accuracy": 0.2129485249519348, "num_tokens": 84910550.0, "step": 33500 }, { "entropy": 6.043974924087524, "epoch": 3.8667051356030004, "grad_norm": 0.96875, "learning_rate": 0.0003581578741622682, "loss": 5.5745, "mean_token_accuracy": 0.20866378545761108, "num_tokens": 84923177.0, "step": 33505 }, { "entropy": 6.090998697280884, "epoch": 3.8672821696480093, "grad_norm": 0.984375, "learning_rate": 0.0003581195301462219, "loss": 5.6049, "mean_token_accuracy": 0.2031246930360794, "num_tokens": 84935032.0, "step": 33510 }, { "entropy": 5.993401050567627, "epoch": 3.8678592036930177, "grad_norm": 0.8828125, "learning_rate": 0.0003580811833344915, "loss": 5.4978, "mean_token_accuracy": 0.21389926671981813, "num_tokens": 84947660.0, "step": 33515 }, { "entropy": 6.118982887268066, "epoch": 3.8684362377380266, "grad_norm": 0.9375, "learning_rate": 0.0003580428337283667, "loss": 5.6738, "mean_token_accuracy": 0.2047731786966324, "num_tokens": 84960916.0, "step": 33520 }, { "entropy": 6.154660415649414, "epoch": 3.869013271783035, "grad_norm": 1.03125, "learning_rate": 0.00035800448132913755, "loss": 5.6245, "mean_token_accuracy": 0.2007632613182068, "num_tokens": 84974022.0, "step": 33525 }, { "entropy": 6.087403440475464, "epoch": 3.869590305828044, "grad_norm": 1.0703125, "learning_rate": 0.0003579661261380938, "loss": 5.5966, "mean_token_accuracy": 0.2088603690266609, "num_tokens": 84987654.0, "step": 33530 }, { "entropy": 6.098627519607544, "epoch": 3.8701673398730527, "grad_norm": 0.9140625, "learning_rate": 0.0003579277681565257, "loss": 5.6741, "mean_token_accuracy": 0.19669127762317656, "num_tokens": 85000781.0, "step": 33535 }, { "entropy": 6.154697370529175, "epoch": 3.870744373918061, "grad_norm": 0.98046875, "learning_rate": 0.00035788940738572326, "loss": 5.6863, "mean_token_accuracy": 0.19641603529453278, "num_tokens": 85013145.0, "step": 33540 }, { "entropy": 6.104619455337525, "epoch": 3.8713214079630696, "grad_norm": 0.92578125, "learning_rate": 0.00035785104382697673, "loss": 5.6071, "mean_token_accuracy": 0.20106724053621292, "num_tokens": 85025795.0, "step": 33545 }, { "entropy": 6.126614999771118, "epoch": 3.8718984420080784, "grad_norm": 0.98046875, "learning_rate": 0.0003578126774815766, "loss": 5.6084, "mean_token_accuracy": 0.20979945361614227, "num_tokens": 85038123.0, "step": 33550 }, { "entropy": 6.104243898391724, "epoch": 3.8724754760530873, "grad_norm": 0.91015625, "learning_rate": 0.0003577743083508132, "loss": 5.6244, "mean_token_accuracy": 0.2064577892422676, "num_tokens": 85050323.0, "step": 33555 }, { "entropy": 6.0725977420806885, "epoch": 3.8730525100980957, "grad_norm": 0.890625, "learning_rate": 0.000357735936435977, "loss": 5.605, "mean_token_accuracy": 0.20157973766326903, "num_tokens": 85061897.0, "step": 33560 }, { "entropy": 6.089364719390869, "epoch": 3.8736295441431046, "grad_norm": 0.90625, "learning_rate": 0.00035769756173835866, "loss": 5.5729, "mean_token_accuracy": 0.20399502217769622, "num_tokens": 85074536.0, "step": 33565 }, { "entropy": 6.132237291336059, "epoch": 3.874206578188113, "grad_norm": 0.921875, "learning_rate": 0.00035765918425924894, "loss": 5.6443, "mean_token_accuracy": 0.2067454054951668, "num_tokens": 85087493.0, "step": 33570 }, { "entropy": 5.971921682357788, "epoch": 3.874783612233122, "grad_norm": 0.8515625, "learning_rate": 0.00035762080399993863, "loss": 5.446, "mean_token_accuracy": 0.2301473543047905, "num_tokens": 85101037.0, "step": 33575 }, { "entropy": 5.985307025909424, "epoch": 3.8753606462781303, "grad_norm": 0.96875, "learning_rate": 0.00035758242096171856, "loss": 5.4892, "mean_token_accuracy": 0.2119239941239357, "num_tokens": 85114268.0, "step": 33580 }, { "entropy": 6.125138998031616, "epoch": 3.875937680323139, "grad_norm": 0.84375, "learning_rate": 0.0003575440351458798, "loss": 5.7185, "mean_token_accuracy": 0.19590566903352738, "num_tokens": 85127059.0, "step": 33585 }, { "entropy": 6.152217149734497, "epoch": 3.876514714368148, "grad_norm": 0.9375, "learning_rate": 0.0003575056465537135, "loss": 5.619, "mean_token_accuracy": 0.20546552985906602, "num_tokens": 85139353.0, "step": 33590 }, { "entropy": 5.932551670074463, "epoch": 3.8770917484131564, "grad_norm": 0.94921875, "learning_rate": 0.0003574672551865107, "loss": 5.4573, "mean_token_accuracy": 0.21776998043060303, "num_tokens": 85153312.0, "step": 33595 }, { "entropy": 6.13020601272583, "epoch": 3.877668782458165, "grad_norm": 1.03125, "learning_rate": 0.0003574288610455627, "loss": 5.6524, "mean_token_accuracy": 0.19965772479772567, "num_tokens": 85165440.0, "step": 33600 }, { "entropy": 6.128564500808716, "epoch": 3.8782458165031737, "grad_norm": 0.9140625, "learning_rate": 0.00035739046413216095, "loss": 5.6839, "mean_token_accuracy": 0.19749677032232285, "num_tokens": 85178673.0, "step": 33605 }, { "entropy": 6.088786935806274, "epoch": 3.8788228505481825, "grad_norm": 0.96875, "learning_rate": 0.0003573520644475968, "loss": 5.7057, "mean_token_accuracy": 0.20382700860500336, "num_tokens": 85192587.0, "step": 33610 }, { "entropy": 6.027975034713745, "epoch": 3.879399884593191, "grad_norm": 0.90625, "learning_rate": 0.00035731366199316195, "loss": 5.5131, "mean_token_accuracy": 0.20946575999259948, "num_tokens": 85204247.0, "step": 33615 }, { "entropy": 6.07987265586853, "epoch": 3.8799769186381994, "grad_norm": 0.92578125, "learning_rate": 0.000357275256770148, "loss": 5.5702, "mean_token_accuracy": 0.20465978235006332, "num_tokens": 85217096.0, "step": 33620 }, { "entropy": 6.093013525009155, "epoch": 3.8805539526832082, "grad_norm": 0.96484375, "learning_rate": 0.0003572368487798465, "loss": 5.6047, "mean_token_accuracy": 0.20413179099559783, "num_tokens": 85229988.0, "step": 33625 }, { "entropy": 6.136398601531982, "epoch": 3.881130986728217, "grad_norm": 0.9375, "learning_rate": 0.0003571984380235496, "loss": 5.6681, "mean_token_accuracy": 0.19391278624534608, "num_tokens": 85242386.0, "step": 33630 }, { "entropy": 6.104293966293335, "epoch": 3.8817080207732255, "grad_norm": 1.0, "learning_rate": 0.000357160024502549, "loss": 5.6218, "mean_token_accuracy": 0.1969421312212944, "num_tokens": 85253723.0, "step": 33635 }, { "entropy": 6.153084325790405, "epoch": 3.8822850548182344, "grad_norm": 0.88671875, "learning_rate": 0.0003571216082181368, "loss": 5.6366, "mean_token_accuracy": 0.20404088497161865, "num_tokens": 85267296.0, "step": 33640 }, { "entropy": 6.043382883071899, "epoch": 3.882862088863243, "grad_norm": 0.94921875, "learning_rate": 0.00035708318917160504, "loss": 5.5437, "mean_token_accuracy": 0.2082097128033638, "num_tokens": 85278620.0, "step": 33645 }, { "entropy": 6.086602592468262, "epoch": 3.8834391229082517, "grad_norm": 1.15625, "learning_rate": 0.0003570447673642461, "loss": 5.6513, "mean_token_accuracy": 0.20131202787160873, "num_tokens": 85290522.0, "step": 33650 }, { "entropy": 6.182232999801636, "epoch": 3.88401615695326, "grad_norm": 0.96875, "learning_rate": 0.00035700634279735207, "loss": 5.6537, "mean_token_accuracy": 0.20291696041822432, "num_tokens": 85304629.0, "step": 33655 }, { "entropy": 6.1675389289855955, "epoch": 3.884593190998269, "grad_norm": 1.15625, "learning_rate": 0.0003569679154722155, "loss": 5.6923, "mean_token_accuracy": 0.19452993869781493, "num_tokens": 85317844.0, "step": 33660 }, { "entropy": 6.055772495269776, "epoch": 3.885170225043278, "grad_norm": 0.87890625, "learning_rate": 0.0003569294853901288, "loss": 5.5664, "mean_token_accuracy": 0.20586709231138228, "num_tokens": 85330819.0, "step": 33665 }, { "entropy": 6.05358772277832, "epoch": 3.885747259088286, "grad_norm": 0.96484375, "learning_rate": 0.0003568910525523844, "loss": 5.5775, "mean_token_accuracy": 0.20565457195043563, "num_tokens": 85342833.0, "step": 33670 }, { "entropy": 6.082759428024292, "epoch": 3.8863242931332946, "grad_norm": 1.0, "learning_rate": 0.00035685261696027524, "loss": 5.6196, "mean_token_accuracy": 0.2065345123410225, "num_tokens": 85355250.0, "step": 33675 }, { "entropy": 6.096784448623657, "epoch": 3.8869013271783035, "grad_norm": 0.9921875, "learning_rate": 0.000356814178615094, "loss": 5.6002, "mean_token_accuracy": 0.20772335529327393, "num_tokens": 85367112.0, "step": 33680 }, { "entropy": 6.052044630050659, "epoch": 3.8874783612233124, "grad_norm": 0.97265625, "learning_rate": 0.0003567757375181335, "loss": 5.5937, "mean_token_accuracy": 0.2097228616476059, "num_tokens": 85379935.0, "step": 33685 }, { "entropy": 6.060841178894043, "epoch": 3.888055395268321, "grad_norm": 0.8828125, "learning_rate": 0.0003567372936706867, "loss": 5.6187, "mean_token_accuracy": 0.1991729959845543, "num_tokens": 85393378.0, "step": 33690 }, { "entropy": 6.147786855697632, "epoch": 3.8886324293133296, "grad_norm": 1.109375, "learning_rate": 0.00035669884707404656, "loss": 5.594, "mean_token_accuracy": 0.20705071836709976, "num_tokens": 85407181.0, "step": 33695 }, { "entropy": 6.092485475540161, "epoch": 3.889209463358338, "grad_norm": 0.92578125, "learning_rate": 0.0003566603977295063, "loss": 5.5539, "mean_token_accuracy": 0.2103789210319519, "num_tokens": 85419795.0, "step": 33700 }, { "entropy": 6.018665981292725, "epoch": 3.889786497403347, "grad_norm": 0.94921875, "learning_rate": 0.0003566219456383592, "loss": 5.6047, "mean_token_accuracy": 0.20543065369129182, "num_tokens": 85432973.0, "step": 33705 }, { "entropy": 6.144924163818359, "epoch": 3.8903635314483553, "grad_norm": 0.96875, "learning_rate": 0.00035658349080189847, "loss": 5.6155, "mean_token_accuracy": 0.20156259536743165, "num_tokens": 85445256.0, "step": 33710 }, { "entropy": 6.105436849594116, "epoch": 3.890940565493364, "grad_norm": 0.90234375, "learning_rate": 0.0003565450332214175, "loss": 5.665, "mean_token_accuracy": 0.2001728817820549, "num_tokens": 85458400.0, "step": 33715 }, { "entropy": 6.163173580169678, "epoch": 3.8915175995383726, "grad_norm": 0.96875, "learning_rate": 0.00035650657289820986, "loss": 5.664, "mean_token_accuracy": 0.1991086483001709, "num_tokens": 85469711.0, "step": 33720 }, { "entropy": 6.164878940582275, "epoch": 3.8920946335833815, "grad_norm": 0.921875, "learning_rate": 0.0003564681098335692, "loss": 5.6295, "mean_token_accuracy": 0.20740173161029815, "num_tokens": 85481672.0, "step": 33725 }, { "entropy": 6.196621465682983, "epoch": 3.89267166762839, "grad_norm": 0.94921875, "learning_rate": 0.00035642964402878897, "loss": 5.7435, "mean_token_accuracy": 0.19491058588027954, "num_tokens": 85494511.0, "step": 33730 }, { "entropy": 6.032270240783691, "epoch": 3.8932487016733988, "grad_norm": 0.93359375, "learning_rate": 0.00035639117548516325, "loss": 5.5114, "mean_token_accuracy": 0.21603468507528306, "num_tokens": 85507085.0, "step": 33735 }, { "entropy": 6.0698925971984865, "epoch": 3.8938257357184076, "grad_norm": 0.94140625, "learning_rate": 0.00035635270420398575, "loss": 5.6263, "mean_token_accuracy": 0.2079391896724701, "num_tokens": 85520688.0, "step": 33740 }, { "entropy": 6.131998300552368, "epoch": 3.894402769763416, "grad_norm": 0.9453125, "learning_rate": 0.0003563142301865505, "loss": 5.6057, "mean_token_accuracy": 0.20017666220664979, "num_tokens": 85533427.0, "step": 33745 }, { "entropy": 6.161380863189697, "epoch": 3.8949798038084245, "grad_norm": 1.0234375, "learning_rate": 0.00035627575343415136, "loss": 5.6341, "mean_token_accuracy": 0.20435797423124313, "num_tokens": 85545362.0, "step": 33750 }, { "entropy": 6.079386758804321, "epoch": 3.8955568378534333, "grad_norm": 0.94921875, "learning_rate": 0.0003562372739480827, "loss": 5.5923, "mean_token_accuracy": 0.20815217941999437, "num_tokens": 85558189.0, "step": 33755 }, { "entropy": 5.971133279800415, "epoch": 3.896133871898442, "grad_norm": 1.0078125, "learning_rate": 0.0003561987917296387, "loss": 5.5222, "mean_token_accuracy": 0.2101283222436905, "num_tokens": 85571513.0, "step": 33760 }, { "entropy": 6.060505390167236, "epoch": 3.8967109059434506, "grad_norm": 0.9375, "learning_rate": 0.0003561603067801137, "loss": 5.5749, "mean_token_accuracy": 0.2111502930521965, "num_tokens": 85583977.0, "step": 33765 }, { "entropy": 6.132311201095581, "epoch": 3.8972879399884595, "grad_norm": 1.046875, "learning_rate": 0.00035612181910080204, "loss": 5.6349, "mean_token_accuracy": 0.20717811584472656, "num_tokens": 85595543.0, "step": 33770 }, { "entropy": 6.079429674148559, "epoch": 3.897864974033468, "grad_norm": 0.9375, "learning_rate": 0.00035608332869299837, "loss": 5.5534, "mean_token_accuracy": 0.2110853835940361, "num_tokens": 85608621.0, "step": 33775 }, { "entropy": 6.0897375583648685, "epoch": 3.8984420080784767, "grad_norm": 0.90625, "learning_rate": 0.0003560448355579971, "loss": 5.5337, "mean_token_accuracy": 0.21005466878414153, "num_tokens": 85621607.0, "step": 33780 }, { "entropy": 5.973836946487427, "epoch": 3.899019042123485, "grad_norm": 0.90625, "learning_rate": 0.0003560063396970932, "loss": 5.5175, "mean_token_accuracy": 0.21489454060792923, "num_tokens": 85633957.0, "step": 33785 }, { "entropy": 6.126867055892944, "epoch": 3.899596076168494, "grad_norm": 0.91796875, "learning_rate": 0.0003559678411115811, "loss": 5.738, "mean_token_accuracy": 0.19460658580064774, "num_tokens": 85646930.0, "step": 33790 }, { "entropy": 6.117756128311157, "epoch": 3.9001731102135024, "grad_norm": 0.8828125, "learning_rate": 0.00035592933980275603, "loss": 5.6057, "mean_token_accuracy": 0.2055487647652626, "num_tokens": 85659305.0, "step": 33795 }, { "entropy": 6.130749702453613, "epoch": 3.9007501442585113, "grad_norm": 0.96875, "learning_rate": 0.00035589083577191276, "loss": 5.6281, "mean_token_accuracy": 0.21119747310876846, "num_tokens": 85671669.0, "step": 33800 }, { "entropy": 6.11531252861023, "epoch": 3.9013271783035197, "grad_norm": 0.94140625, "learning_rate": 0.0003558523290203465, "loss": 5.6396, "mean_token_accuracy": 0.20355551093816757, "num_tokens": 85683725.0, "step": 33805 }, { "entropy": 6.1662764072418215, "epoch": 3.9019042123485286, "grad_norm": 0.9453125, "learning_rate": 0.0003558138195493522, "loss": 5.6128, "mean_token_accuracy": 0.20136215686798095, "num_tokens": 85695193.0, "step": 33810 }, { "entropy": 6.0813981056213375, "epoch": 3.9024812463935374, "grad_norm": 1.0078125, "learning_rate": 0.00035577530736022523, "loss": 5.6346, "mean_token_accuracy": 0.20283491313457488, "num_tokens": 85708972.0, "step": 33815 }, { "entropy": 6.105281019210816, "epoch": 3.903058280438546, "grad_norm": 0.984375, "learning_rate": 0.00035573679245426095, "loss": 5.5747, "mean_token_accuracy": 0.20464861392974854, "num_tokens": 85721333.0, "step": 33820 }, { "entropy": 6.002027130126953, "epoch": 3.9036353144835543, "grad_norm": 0.890625, "learning_rate": 0.00035569827483275475, "loss": 5.5463, "mean_token_accuracy": 0.2111913576722145, "num_tokens": 85735248.0, "step": 33825 }, { "entropy": 6.051641178131104, "epoch": 3.904212348528563, "grad_norm": 0.91796875, "learning_rate": 0.00035565975449700223, "loss": 5.5299, "mean_token_accuracy": 0.2117503046989441, "num_tokens": 85746575.0, "step": 33830 }, { "entropy": 6.066372632980347, "epoch": 3.904789382573572, "grad_norm": 0.94140625, "learning_rate": 0.0003556212314482988, "loss": 5.5742, "mean_token_accuracy": 0.20425924211740493, "num_tokens": 85760086.0, "step": 33835 }, { "entropy": 6.127329301834107, "epoch": 3.9053664166185804, "grad_norm": 0.9296875, "learning_rate": 0.00035558270568794044, "loss": 5.6624, "mean_token_accuracy": 0.2022235855460167, "num_tokens": 85771952.0, "step": 33840 }, { "entropy": 6.079333734512329, "epoch": 3.9059434506635893, "grad_norm": 0.81640625, "learning_rate": 0.00035554417721722273, "loss": 5.5872, "mean_token_accuracy": 0.2000998467206955, "num_tokens": 85784736.0, "step": 33845 }, { "entropy": 6.049238538742065, "epoch": 3.9065204847085977, "grad_norm": 0.95703125, "learning_rate": 0.00035550564603744163, "loss": 5.5478, "mean_token_accuracy": 0.21463964134454727, "num_tokens": 85797152.0, "step": 33850 }, { "entropy": 6.203660726547241, "epoch": 3.9070975187536066, "grad_norm": 1.0546875, "learning_rate": 0.0003554671121498931, "loss": 5.7027, "mean_token_accuracy": 0.1982257753610611, "num_tokens": 85807935.0, "step": 33855 }, { "entropy": 6.094870138168335, "epoch": 3.907674552798615, "grad_norm": 0.921875, "learning_rate": 0.0003554285755558732, "loss": 5.6192, "mean_token_accuracy": 0.20157722681760787, "num_tokens": 85819876.0, "step": 33860 }, { "entropy": 6.115404272079468, "epoch": 3.908251586843624, "grad_norm": 0.89453125, "learning_rate": 0.0003553900362566782, "loss": 5.6322, "mean_token_accuracy": 0.2049118772149086, "num_tokens": 85832563.0, "step": 33865 }, { "entropy": 6.077067708969116, "epoch": 3.9088286208886327, "grad_norm": 1.0546875, "learning_rate": 0.0003553514942536042, "loss": 5.5502, "mean_token_accuracy": 0.21306779980659485, "num_tokens": 85845260.0, "step": 33870 }, { "entropy": 6.10785231590271, "epoch": 3.909405654933641, "grad_norm": 1.03125, "learning_rate": 0.00035531294954794764, "loss": 5.7037, "mean_token_accuracy": 0.1998100146651268, "num_tokens": 85857536.0, "step": 33875 }, { "entropy": 6.0291038990020756, "epoch": 3.9099826889786495, "grad_norm": 1.0390625, "learning_rate": 0.0003552744021410049, "loss": 5.4841, "mean_token_accuracy": 0.21486638933420182, "num_tokens": 85870090.0, "step": 33880 }, { "entropy": 6.054075908660889, "epoch": 3.9105597230236584, "grad_norm": 0.9921875, "learning_rate": 0.0003552358520340725, "loss": 5.5379, "mean_token_accuracy": 0.21507245302200317, "num_tokens": 85883363.0, "step": 33885 }, { "entropy": 6.090999794006348, "epoch": 3.9111367570686673, "grad_norm": 0.98046875, "learning_rate": 0.00035519729922844705, "loss": 5.6359, "mean_token_accuracy": 0.20017725676298143, "num_tokens": 85896080.0, "step": 33890 }, { "entropy": 6.088406133651733, "epoch": 3.9117137911136757, "grad_norm": 0.98828125, "learning_rate": 0.00035515874372542527, "loss": 5.6332, "mean_token_accuracy": 0.2104274958372116, "num_tokens": 85908961.0, "step": 33895 }, { "entropy": 6.100196266174317, "epoch": 3.912290825158684, "grad_norm": 1.03125, "learning_rate": 0.0003551201855263041, "loss": 5.4948, "mean_token_accuracy": 0.21800185590982438, "num_tokens": 85920496.0, "step": 33900 }, { "entropy": 6.1130064010620115, "epoch": 3.912867859203693, "grad_norm": 0.90625, "learning_rate": 0.0003550816246323802, "loss": 5.6702, "mean_token_accuracy": 0.20012075304985047, "num_tokens": 85933149.0, "step": 33905 }, { "entropy": 6.041610527038574, "epoch": 3.913444893248702, "grad_norm": 0.95703125, "learning_rate": 0.0003550430610449506, "loss": 5.5822, "mean_token_accuracy": 0.20414189696311952, "num_tokens": 85945644.0, "step": 33910 }, { "entropy": 6.100792407989502, "epoch": 3.9140219272937102, "grad_norm": 0.90234375, "learning_rate": 0.00035500449476531245, "loss": 5.5798, "mean_token_accuracy": 0.20422907024621964, "num_tokens": 85957796.0, "step": 33915 }, { "entropy": 6.099258279800415, "epoch": 3.914598961338719, "grad_norm": 0.94140625, "learning_rate": 0.0003549659257947628, "loss": 5.5717, "mean_token_accuracy": 0.20179478377103804, "num_tokens": 85970186.0, "step": 33920 }, { "entropy": 6.170908880233765, "epoch": 3.9151759953837275, "grad_norm": 0.9453125, "learning_rate": 0.000354927354134599, "loss": 5.6642, "mean_token_accuracy": 0.2043335035443306, "num_tokens": 85984056.0, "step": 33925 }, { "entropy": 6.095730209350586, "epoch": 3.9157530294287364, "grad_norm": 1.140625, "learning_rate": 0.00035488877978611836, "loss": 5.5829, "mean_token_accuracy": 0.21233381628990172, "num_tokens": 85996802.0, "step": 33930 }, { "entropy": 6.120232105255127, "epoch": 3.916330063473745, "grad_norm": 0.9609375, "learning_rate": 0.00035485020275061825, "loss": 5.6285, "mean_token_accuracy": 0.20354021787643434, "num_tokens": 86009063.0, "step": 33935 }, { "entropy": 6.054386138916016, "epoch": 3.9169070975187537, "grad_norm": 0.92578125, "learning_rate": 0.0003548116230293962, "loss": 5.557, "mean_token_accuracy": 0.2120618298649788, "num_tokens": 86021793.0, "step": 33940 }, { "entropy": 6.1094207763671875, "epoch": 3.9174841315637625, "grad_norm": 0.98828125, "learning_rate": 0.00035477304062374993, "loss": 5.6342, "mean_token_accuracy": 0.2037036806344986, "num_tokens": 86033707.0, "step": 33945 }, { "entropy": 6.092756652832032, "epoch": 3.918061165608771, "grad_norm": 0.9765625, "learning_rate": 0.0003547344555349771, "loss": 5.5615, "mean_token_accuracy": 0.2100572556257248, "num_tokens": 86045841.0, "step": 33950 }, { "entropy": 5.985999059677124, "epoch": 3.9186381996537794, "grad_norm": 0.8515625, "learning_rate": 0.0003546958677643754, "loss": 5.5233, "mean_token_accuracy": 0.21066182255744934, "num_tokens": 86059875.0, "step": 33955 }, { "entropy": 6.0427368640899655, "epoch": 3.919215233698788, "grad_norm": 1.046875, "learning_rate": 0.00035465727731324277, "loss": 5.5958, "mean_token_accuracy": 0.2058490887284279, "num_tokens": 86073536.0, "step": 33960 }, { "entropy": 6.059695434570313, "epoch": 3.919792267743797, "grad_norm": 0.97265625, "learning_rate": 0.0003546186841828772, "loss": 5.5058, "mean_token_accuracy": 0.22149794548749924, "num_tokens": 86085874.0, "step": 33965 }, { "entropy": 6.097062349319458, "epoch": 3.9203693017888055, "grad_norm": 0.9296875, "learning_rate": 0.0003545800883745767, "loss": 5.6243, "mean_token_accuracy": 0.19834984540939332, "num_tokens": 86096805.0, "step": 33970 }, { "entropy": 6.156413269042969, "epoch": 3.9209463358338144, "grad_norm": 0.93359375, "learning_rate": 0.00035454148988963953, "loss": 5.6447, "mean_token_accuracy": 0.20302644073963166, "num_tokens": 86108138.0, "step": 33975 }, { "entropy": 6.123766660690308, "epoch": 3.9215233698788228, "grad_norm": 0.95703125, "learning_rate": 0.0003545028887293638, "loss": 5.6137, "mean_token_accuracy": 0.2032058998942375, "num_tokens": 86120329.0, "step": 33980 }, { "entropy": 6.09746994972229, "epoch": 3.9221004039238316, "grad_norm": 0.91796875, "learning_rate": 0.0003544642848950479, "loss": 5.6125, "mean_token_accuracy": 0.20709274858236312, "num_tokens": 86133014.0, "step": 33985 }, { "entropy": 6.072454738616943, "epoch": 3.92267743796884, "grad_norm": 0.8828125, "learning_rate": 0.00035442567838799027, "loss": 5.5731, "mean_token_accuracy": 0.20567707419395448, "num_tokens": 86146458.0, "step": 33990 }, { "entropy": 6.055431938171386, "epoch": 3.923254472013849, "grad_norm": 0.93359375, "learning_rate": 0.00035438706920948944, "loss": 5.5139, "mean_token_accuracy": 0.20984887480735778, "num_tokens": 86158700.0, "step": 33995 }, { "entropy": 6.124488258361817, "epoch": 3.9238315060588573, "grad_norm": 0.95703125, "learning_rate": 0.00035434845736084385, "loss": 5.7165, "mean_token_accuracy": 0.1972483292222023, "num_tokens": 86172038.0, "step": 34000 }, { "entropy": 6.09891791343689, "epoch": 3.924408540103866, "grad_norm": 0.94921875, "learning_rate": 0.00035430984284335243, "loss": 5.5725, "mean_token_accuracy": 0.21213222593069075, "num_tokens": 86184300.0, "step": 34005 }, { "entropy": 6.028426837921143, "epoch": 3.9249855741488746, "grad_norm": 0.89453125, "learning_rate": 0.00035427122565831384, "loss": 5.5198, "mean_token_accuracy": 0.21397937536239625, "num_tokens": 86198042.0, "step": 34010 }, { "entropy": 6.09245080947876, "epoch": 3.9255626081938835, "grad_norm": 0.953125, "learning_rate": 0.00035423260580702695, "loss": 5.6045, "mean_token_accuracy": 0.21403784304857254, "num_tokens": 86209999.0, "step": 34015 }, { "entropy": 6.111929655075073, "epoch": 3.9261396422388923, "grad_norm": 0.97265625, "learning_rate": 0.0003541939832907907, "loss": 5.6226, "mean_token_accuracy": 0.20569241493940355, "num_tokens": 86224503.0, "step": 34020 }, { "entropy": 6.061177492141724, "epoch": 3.9267166762839008, "grad_norm": 0.953125, "learning_rate": 0.00035415535811090404, "loss": 5.5962, "mean_token_accuracy": 0.20923683792352676, "num_tokens": 86238586.0, "step": 34025 }, { "entropy": 6.020795679092407, "epoch": 3.927293710328909, "grad_norm": 0.96875, "learning_rate": 0.00035411673026866636, "loss": 5.5637, "mean_token_accuracy": 0.20788252353668213, "num_tokens": 86252244.0, "step": 34030 }, { "entropy": 6.1387275695800785, "epoch": 3.927870744373918, "grad_norm": 0.98046875, "learning_rate": 0.00035407809976537675, "loss": 5.653, "mean_token_accuracy": 0.2002102926373482, "num_tokens": 86263427.0, "step": 34035 }, { "entropy": 6.190771627426147, "epoch": 3.928447778418927, "grad_norm": 1.0234375, "learning_rate": 0.00035403946660233457, "loss": 5.6629, "mean_token_accuracy": 0.20265832990407945, "num_tokens": 86275972.0, "step": 34040 }, { "entropy": 6.137822818756104, "epoch": 3.9290248124639353, "grad_norm": 0.984375, "learning_rate": 0.00035400083078083913, "loss": 5.6717, "mean_token_accuracy": 0.19944227039813994, "num_tokens": 86289330.0, "step": 34045 }, { "entropy": 6.089179849624633, "epoch": 3.929601846508944, "grad_norm": 0.9453125, "learning_rate": 0.00035396219230218994, "loss": 5.6048, "mean_token_accuracy": 0.20957937389612197, "num_tokens": 86301584.0, "step": 34050 }, { "entropy": 6.047177696228028, "epoch": 3.9301788805539526, "grad_norm": 0.921875, "learning_rate": 0.0003539235511676867, "loss": 5.5488, "mean_token_accuracy": 0.21274682730436326, "num_tokens": 86313796.0, "step": 34055 }, { "entropy": 6.0519298076629635, "epoch": 3.9307559145989615, "grad_norm": 1.0546875, "learning_rate": 0.00035388490737862905, "loss": 5.4976, "mean_token_accuracy": 0.21602849811315536, "num_tokens": 86326379.0, "step": 34060 }, { "entropy": 6.077120113372803, "epoch": 3.93133294864397, "grad_norm": 0.8984375, "learning_rate": 0.0003538462609363166, "loss": 5.6307, "mean_token_accuracy": 0.19990917295217514, "num_tokens": 86339119.0, "step": 34065 }, { "entropy": 6.075619554519653, "epoch": 3.9319099826889787, "grad_norm": 0.96875, "learning_rate": 0.00035380761184204945, "loss": 5.5616, "mean_token_accuracy": 0.2067670777440071, "num_tokens": 86350840.0, "step": 34070 }, { "entropy": 6.07916841506958, "epoch": 3.932487016733987, "grad_norm": 0.95703125, "learning_rate": 0.0003537689600971274, "loss": 5.5766, "mean_token_accuracy": 0.2027121141552925, "num_tokens": 86364520.0, "step": 34075 }, { "entropy": 6.149055099487304, "epoch": 3.933064050778996, "grad_norm": 0.984375, "learning_rate": 0.00035373030570285053, "loss": 5.6367, "mean_token_accuracy": 0.1999443918466568, "num_tokens": 86375888.0, "step": 34080 }, { "entropy": 6.11506757736206, "epoch": 3.9336410848240044, "grad_norm": 1.0546875, "learning_rate": 0.00035369164866051885, "loss": 5.6036, "mean_token_accuracy": 0.20841236412525177, "num_tokens": 86388251.0, "step": 34085 }, { "entropy": 6.092437219619751, "epoch": 3.9342181188690133, "grad_norm": 1.0078125, "learning_rate": 0.0003536529889714327, "loss": 5.5961, "mean_token_accuracy": 0.21188106387853622, "num_tokens": 86401491.0, "step": 34090 }, { "entropy": 6.124885320663452, "epoch": 3.934795152914022, "grad_norm": 1.0234375, "learning_rate": 0.00035361432663689237, "loss": 5.621, "mean_token_accuracy": 0.20653427243232728, "num_tokens": 86414931.0, "step": 34095 }, { "entropy": 6.0764488697052, "epoch": 3.9353721869590306, "grad_norm": 0.91796875, "learning_rate": 0.00035357566165819814, "loss": 5.6112, "mean_token_accuracy": 0.19901864975690842, "num_tokens": 86426720.0, "step": 34100 }, { "entropy": 6.0422587394714355, "epoch": 3.935949221004039, "grad_norm": 1.046875, "learning_rate": 0.0003535369940366506, "loss": 5.518, "mean_token_accuracy": 0.2147801086306572, "num_tokens": 86439559.0, "step": 34105 }, { "entropy": 6.097068643569946, "epoch": 3.936526255049048, "grad_norm": 0.90625, "learning_rate": 0.0003534983237735503, "loss": 5.5462, "mean_token_accuracy": 0.20530952513217926, "num_tokens": 86450810.0, "step": 34110 }, { "entropy": 6.063716411590576, "epoch": 3.9371032890940567, "grad_norm": 0.9375, "learning_rate": 0.0003534596508701979, "loss": 5.6593, "mean_token_accuracy": 0.2004273533821106, "num_tokens": 86465034.0, "step": 34115 }, { "entropy": 6.044253778457642, "epoch": 3.937680323139065, "grad_norm": 1.03125, "learning_rate": 0.00035342097532789404, "loss": 5.441, "mean_token_accuracy": 0.2190190151333809, "num_tokens": 86477678.0, "step": 34120 }, { "entropy": 5.9745402336120605, "epoch": 3.938257357184074, "grad_norm": 0.8984375, "learning_rate": 0.00035338229714793957, "loss": 5.4768, "mean_token_accuracy": 0.2211019903421402, "num_tokens": 86490209.0, "step": 34125 }, { "entropy": 5.966192817687988, "epoch": 3.9388343912290824, "grad_norm": 0.90625, "learning_rate": 0.00035334361633163557, "loss": 5.5014, "mean_token_accuracy": 0.2125539854168892, "num_tokens": 86504554.0, "step": 34130 }, { "entropy": 6.09911527633667, "epoch": 3.9394114252740913, "grad_norm": 0.91796875, "learning_rate": 0.000353304932880283, "loss": 5.6291, "mean_token_accuracy": 0.207482248544693, "num_tokens": 86516571.0, "step": 34135 }, { "entropy": 6.092695236206055, "epoch": 3.9399884593190997, "grad_norm": 1.0390625, "learning_rate": 0.00035326624679518284, "loss": 5.6512, "mean_token_accuracy": 0.1950303226709366, "num_tokens": 86529191.0, "step": 34140 }, { "entropy": 6.0369203090667725, "epoch": 3.9405654933641086, "grad_norm": 0.921875, "learning_rate": 0.0003532275580776363, "loss": 5.5179, "mean_token_accuracy": 0.20641598999500274, "num_tokens": 86542109.0, "step": 34145 }, { "entropy": 5.9909604549407955, "epoch": 3.9411425274091174, "grad_norm": 0.91015625, "learning_rate": 0.00035318886672894474, "loss": 5.4947, "mean_token_accuracy": 0.21550468355417252, "num_tokens": 86554267.0, "step": 34150 }, { "entropy": 6.089364719390869, "epoch": 3.941719561454126, "grad_norm": 0.90625, "learning_rate": 0.0003531501727504095, "loss": 5.5284, "mean_token_accuracy": 0.20988584607839583, "num_tokens": 86567841.0, "step": 34155 }, { "entropy": 6.098076200485229, "epoch": 3.9422965954991342, "grad_norm": 0.94921875, "learning_rate": 0.00035311147614333204, "loss": 5.6007, "mean_token_accuracy": 0.21065972447395326, "num_tokens": 86579729.0, "step": 34160 }, { "entropy": 6.107254505157471, "epoch": 3.942873629544143, "grad_norm": 0.90234375, "learning_rate": 0.0003530727769090138, "loss": 5.6665, "mean_token_accuracy": 0.2033235639333725, "num_tokens": 86592375.0, "step": 34165 }, { "entropy": 6.09987096786499, "epoch": 3.943450663589152, "grad_norm": 0.90234375, "learning_rate": 0.00035303407504875655, "loss": 5.5452, "mean_token_accuracy": 0.21543767750263215, "num_tokens": 86604934.0, "step": 34170 }, { "entropy": 6.056863641738891, "epoch": 3.9440276976341604, "grad_norm": 0.96484375, "learning_rate": 0.000352995370563862, "loss": 5.5802, "mean_token_accuracy": 0.20921788960695267, "num_tokens": 86618705.0, "step": 34175 }, { "entropy": 6.134924507141113, "epoch": 3.944604731679169, "grad_norm": 0.94921875, "learning_rate": 0.0003529566634556319, "loss": 5.5335, "mean_token_accuracy": 0.21077499389648438, "num_tokens": 86631116.0, "step": 34180 }, { "entropy": 6.123343896865845, "epoch": 3.9451817657241777, "grad_norm": 0.8828125, "learning_rate": 0.000352917953725368, "loss": 5.6637, "mean_token_accuracy": 0.20194773823022844, "num_tokens": 86643649.0, "step": 34185 }, { "entropy": 6.106112337112426, "epoch": 3.9457587997691865, "grad_norm": 0.890625, "learning_rate": 0.0003528792413743725, "loss": 5.5815, "mean_token_accuracy": 0.21331805288791655, "num_tokens": 86656269.0, "step": 34190 }, { "entropy": 6.1351221084594725, "epoch": 3.946335833814195, "grad_norm": 1.1015625, "learning_rate": 0.0003528405264039475, "loss": 5.6044, "mean_token_accuracy": 0.20997445583343505, "num_tokens": 86669245.0, "step": 34195 }, { "entropy": 6.090846061706543, "epoch": 3.946912867859204, "grad_norm": 0.91796875, "learning_rate": 0.000352801808815395, "loss": 5.6061, "mean_token_accuracy": 0.20263096392154695, "num_tokens": 86682005.0, "step": 34200 }, { "entropy": 5.996529388427734, "epoch": 3.9474899019042122, "grad_norm": 1.015625, "learning_rate": 0.00035276308861001724, "loss": 5.5134, "mean_token_accuracy": 0.2083194762468338, "num_tokens": 86695468.0, "step": 34205 }, { "entropy": 6.141702604293823, "epoch": 3.948066935949221, "grad_norm": 0.9296875, "learning_rate": 0.00035272436578911667, "loss": 5.6828, "mean_token_accuracy": 0.19777455180883408, "num_tokens": 86708021.0, "step": 34210 }, { "entropy": 6.106406021118164, "epoch": 3.9486439699942295, "grad_norm": 0.98046875, "learning_rate": 0.0003526856403539957, "loss": 5.6038, "mean_token_accuracy": 0.21075500696897506, "num_tokens": 86720427.0, "step": 34215 }, { "entropy": 6.138281202316284, "epoch": 3.9492210040392384, "grad_norm": 0.98828125, "learning_rate": 0.00035264691230595677, "loss": 5.6208, "mean_token_accuracy": 0.20158367455005646, "num_tokens": 86732562.0, "step": 34220 }, { "entropy": 6.0598243236541744, "epoch": 3.9497980380842472, "grad_norm": 1.0078125, "learning_rate": 0.0003526081816463025, "loss": 5.5617, "mean_token_accuracy": 0.2076629713177681, "num_tokens": 86746303.0, "step": 34225 }, { "entropy": 6.0711382865905765, "epoch": 3.9503750721292556, "grad_norm": 1.109375, "learning_rate": 0.0003525694483763356, "loss": 5.6141, "mean_token_accuracy": 0.20496369153261185, "num_tokens": 86759317.0, "step": 34230 }, { "entropy": 6.152827739715576, "epoch": 3.950952106174264, "grad_norm": 0.94921875, "learning_rate": 0.00035253071249735884, "loss": 5.6332, "mean_token_accuracy": 0.20343178659677505, "num_tokens": 86771103.0, "step": 34235 }, { "entropy": 6.086332988739014, "epoch": 3.951529140219273, "grad_norm": 0.9453125, "learning_rate": 0.0003524919740106751, "loss": 5.6096, "mean_token_accuracy": 0.20374724566936492, "num_tokens": 86783210.0, "step": 34240 }, { "entropy": 6.065157651901245, "epoch": 3.952106174264282, "grad_norm": 0.94140625, "learning_rate": 0.0003524532329175873, "loss": 5.5341, "mean_token_accuracy": 0.2141427293419838, "num_tokens": 86795293.0, "step": 34245 }, { "entropy": 6.102271509170532, "epoch": 3.95268320830929, "grad_norm": 1.015625, "learning_rate": 0.0003524144892193984, "loss": 5.6131, "mean_token_accuracy": 0.2004251480102539, "num_tokens": 86807526.0, "step": 34250 }, { "entropy": 6.031961679458618, "epoch": 3.953260242354299, "grad_norm": 0.9296875, "learning_rate": 0.0003523757429174117, "loss": 5.523, "mean_token_accuracy": 0.21525313705205917, "num_tokens": 86821568.0, "step": 34255 }, { "entropy": 6.150691938400269, "epoch": 3.9538372763993075, "grad_norm": 0.93359375, "learning_rate": 0.00035233699401293037, "loss": 5.6832, "mean_token_accuracy": 0.20531666427850723, "num_tokens": 86834504.0, "step": 34260 }, { "entropy": 6.072914934158325, "epoch": 3.9544143104443163, "grad_norm": 0.9921875, "learning_rate": 0.00035229824250725757, "loss": 5.6305, "mean_token_accuracy": 0.20377937704324722, "num_tokens": 86847212.0, "step": 34265 }, { "entropy": 6.142857217788697, "epoch": 3.9549913444893248, "grad_norm": 1.0, "learning_rate": 0.00035225948840169675, "loss": 5.6421, "mean_token_accuracy": 0.20208427757024766, "num_tokens": 86859493.0, "step": 34270 }, { "entropy": 6.0962928295135494, "epoch": 3.9555683785343336, "grad_norm": 0.96875, "learning_rate": 0.00035222073169755144, "loss": 5.4915, "mean_token_accuracy": 0.2181245669722557, "num_tokens": 86873409.0, "step": 34275 }, { "entropy": 6.029172086715699, "epoch": 3.956145412579342, "grad_norm": 0.8828125, "learning_rate": 0.0003521819723961253, "loss": 5.6175, "mean_token_accuracy": 0.2116535097360611, "num_tokens": 86886715.0, "step": 34280 }, { "entropy": 6.0778555393219, "epoch": 3.956722446624351, "grad_norm": 1.0078125, "learning_rate": 0.0003521432104987217, "loss": 5.5307, "mean_token_accuracy": 0.20899896770715715, "num_tokens": 86898415.0, "step": 34285 }, { "entropy": 6.025340032577515, "epoch": 3.9572994806693593, "grad_norm": 1.0, "learning_rate": 0.00035210444600664454, "loss": 5.5369, "mean_token_accuracy": 0.2082712933421135, "num_tokens": 86911399.0, "step": 34290 }, { "entropy": 5.994102668762207, "epoch": 3.957876514714368, "grad_norm": 0.91015625, "learning_rate": 0.00035206567892119773, "loss": 5.5092, "mean_token_accuracy": 0.2213461682200432, "num_tokens": 86923935.0, "step": 34295 }, { "entropy": 6.105885982513428, "epoch": 3.958453548759377, "grad_norm": 0.9453125, "learning_rate": 0.0003520269092436851, "loss": 5.6046, "mean_token_accuracy": 0.2052093654870987, "num_tokens": 86937116.0, "step": 34300 }, { "entropy": 6.126477241516113, "epoch": 3.9590305828043855, "grad_norm": 0.94921875, "learning_rate": 0.0003519881369754106, "loss": 5.6757, "mean_token_accuracy": 0.20096003711223603, "num_tokens": 86949701.0, "step": 34305 }, { "entropy": 6.085348510742188, "epoch": 3.959607616849394, "grad_norm": 0.97265625, "learning_rate": 0.00035194936211767824, "loss": 5.5577, "mean_token_accuracy": 0.20440681129693986, "num_tokens": 86963431.0, "step": 34310 }, { "entropy": 6.157261848449707, "epoch": 3.9601846508944027, "grad_norm": 0.90234375, "learning_rate": 0.0003519105846717924, "loss": 5.6978, "mean_token_accuracy": 0.201397080719471, "num_tokens": 86975965.0, "step": 34315 }, { "entropy": 6.039133930206299, "epoch": 3.9607616849394116, "grad_norm": 0.93359375, "learning_rate": 0.00035187180463905733, "loss": 5.5313, "mean_token_accuracy": 0.21336714625358583, "num_tokens": 86988575.0, "step": 34320 }, { "entropy": 6.0220293521881105, "epoch": 3.96133871898442, "grad_norm": 1.03125, "learning_rate": 0.00035183302202077725, "loss": 5.5428, "mean_token_accuracy": 0.21505910903215408, "num_tokens": 87000623.0, "step": 34325 }, { "entropy": 6.068096017837524, "epoch": 3.961915753029429, "grad_norm": 0.9765625, "learning_rate": 0.00035179423681825663, "loss": 5.559, "mean_token_accuracy": 0.2072800800204277, "num_tokens": 87013129.0, "step": 34330 }, { "entropy": 6.09013090133667, "epoch": 3.9624927870744373, "grad_norm": 0.9765625, "learning_rate": 0.0003517554490327999, "loss": 5.6564, "mean_token_accuracy": 0.19848361909389495, "num_tokens": 87024906.0, "step": 34335 }, { "entropy": 6.125682687759399, "epoch": 3.963069821119446, "grad_norm": 0.9453125, "learning_rate": 0.0003517166586657119, "loss": 5.691, "mean_token_accuracy": 0.2008557692170143, "num_tokens": 87037974.0, "step": 34340 }, { "entropy": 6.1886663913726805, "epoch": 3.9636468551644546, "grad_norm": 0.9296875, "learning_rate": 0.0003516778657182971, "loss": 5.6453, "mean_token_accuracy": 0.20642592906951904, "num_tokens": 87051149.0, "step": 34345 }, { "entropy": 6.036720275878906, "epoch": 3.9642238892094634, "grad_norm": 0.94140625, "learning_rate": 0.00035163907019186046, "loss": 5.5614, "mean_token_accuracy": 0.20383604764938354, "num_tokens": 87062682.0, "step": 34350 }, { "entropy": 6.147052145004272, "epoch": 3.964800923254472, "grad_norm": 0.87109375, "learning_rate": 0.0003516002720877067, "loss": 5.6469, "mean_token_accuracy": 0.19538031965494157, "num_tokens": 87076150.0, "step": 34355 }, { "entropy": 5.9898974895477295, "epoch": 3.9653779572994807, "grad_norm": 0.7890625, "learning_rate": 0.0003515614714071408, "loss": 5.4767, "mean_token_accuracy": 0.21158430874347686, "num_tokens": 87089717.0, "step": 34360 }, { "entropy": 6.1503664493560795, "epoch": 3.965954991344489, "grad_norm": 0.9453125, "learning_rate": 0.000351522668151468, "loss": 5.6275, "mean_token_accuracy": 0.2006218194961548, "num_tokens": 87101621.0, "step": 34365 }, { "entropy": 6.031438827514648, "epoch": 3.966532025389498, "grad_norm": 0.875, "learning_rate": 0.0003514838623219932, "loss": 5.5821, "mean_token_accuracy": 0.20545547604560851, "num_tokens": 87114347.0, "step": 34370 }, { "entropy": 6.134225654602051, "epoch": 3.967109059434507, "grad_norm": 0.96875, "learning_rate": 0.0003514450539200216, "loss": 5.6732, "mean_token_accuracy": 0.2022982656955719, "num_tokens": 87126197.0, "step": 34375 }, { "entropy": 6.088818359375, "epoch": 3.9676860934795153, "grad_norm": 0.91796875, "learning_rate": 0.0003514062429468586, "loss": 5.6006, "mean_token_accuracy": 0.20101480633020402, "num_tokens": 87137307.0, "step": 34380 }, { "entropy": 6.098271131515503, "epoch": 3.9682631275245237, "grad_norm": 0.8984375, "learning_rate": 0.0003513674294038096, "loss": 5.5939, "mean_token_accuracy": 0.2085874229669571, "num_tokens": 87149892.0, "step": 34385 }, { "entropy": 6.167271709442138, "epoch": 3.9688401615695326, "grad_norm": 0.90234375, "learning_rate": 0.0003513286132921801, "loss": 5.6051, "mean_token_accuracy": 0.2024668499827385, "num_tokens": 87161112.0, "step": 34390 }, { "entropy": 6.1227614402771, "epoch": 3.9694171956145414, "grad_norm": 0.96484375, "learning_rate": 0.00035128979461327553, "loss": 5.6074, "mean_token_accuracy": 0.20293567031621934, "num_tokens": 87171515.0, "step": 34395 }, { "entropy": 6.102714252471924, "epoch": 3.96999422965955, "grad_norm": 0.87890625, "learning_rate": 0.00035125097336840167, "loss": 5.6258, "mean_token_accuracy": 0.20371688455343245, "num_tokens": 87183792.0, "step": 34400 }, { "entropy": 6.1023924350738525, "epoch": 3.9705712637045587, "grad_norm": 0.8515625, "learning_rate": 0.00035121214955886415, "loss": 5.5976, "mean_token_accuracy": 0.20437540113925934, "num_tokens": 87195737.0, "step": 34405 }, { "entropy": 6.084439277648926, "epoch": 3.971148297749567, "grad_norm": 0.95703125, "learning_rate": 0.00035117332318596885, "loss": 5.6293, "mean_token_accuracy": 0.20420658588409424, "num_tokens": 87208522.0, "step": 34410 }, { "entropy": 6.045976877212524, "epoch": 3.971725331794576, "grad_norm": 0.98046875, "learning_rate": 0.0003511344942510217, "loss": 5.5711, "mean_token_accuracy": 0.21201349794864655, "num_tokens": 87220893.0, "step": 34415 }, { "entropy": 6.138035106658935, "epoch": 3.9723023658395844, "grad_norm": 0.91015625, "learning_rate": 0.00035109566275532854, "loss": 5.6308, "mean_token_accuracy": 0.20123392194509507, "num_tokens": 87233245.0, "step": 34420 }, { "entropy": 6.062977504730225, "epoch": 3.9728793998845933, "grad_norm": 1.0546875, "learning_rate": 0.00035105682870019574, "loss": 5.6715, "mean_token_accuracy": 0.19215962737798692, "num_tokens": 87246029.0, "step": 34425 }, { "entropy": 6.130942106246948, "epoch": 3.9734564339296017, "grad_norm": 1.03125, "learning_rate": 0.0003510179920869291, "loss": 5.5993, "mean_token_accuracy": 0.20385899245738984, "num_tokens": 87259740.0, "step": 34430 }, { "entropy": 6.108812761306763, "epoch": 3.9740334679746105, "grad_norm": 0.9375, "learning_rate": 0.00035097915291683524, "loss": 5.6076, "mean_token_accuracy": 0.2115843877196312, "num_tokens": 87272771.0, "step": 34435 }, { "entropy": 6.006356811523437, "epoch": 3.974610502019619, "grad_norm": 0.93359375, "learning_rate": 0.0003509403111912202, "loss": 5.501, "mean_token_accuracy": 0.22150854468345643, "num_tokens": 87285684.0, "step": 34440 }, { "entropy": 6.116124773025513, "epoch": 3.975187536064628, "grad_norm": 0.96875, "learning_rate": 0.0003509014669113905, "loss": 5.6191, "mean_token_accuracy": 0.20603700429201127, "num_tokens": 87298722.0, "step": 34445 }, { "entropy": 6.028958749771118, "epoch": 3.9757645701096367, "grad_norm": 0.94921875, "learning_rate": 0.0003508626200786527, "loss": 5.5554, "mean_token_accuracy": 0.20523949712514877, "num_tokens": 87311668.0, "step": 34450 }, { "entropy": 6.143246078491211, "epoch": 3.976341604154645, "grad_norm": 0.96875, "learning_rate": 0.00035082377069431343, "loss": 5.6738, "mean_token_accuracy": 0.2047056719660759, "num_tokens": 87324786.0, "step": 34455 }, { "entropy": 6.066857957839966, "epoch": 3.9769186381996535, "grad_norm": 1.1015625, "learning_rate": 0.00035078491875967916, "loss": 5.5362, "mean_token_accuracy": 0.21922508627176285, "num_tokens": 87337873.0, "step": 34460 }, { "entropy": 6.1323166847229, "epoch": 3.9774956722446624, "grad_norm": 0.97265625, "learning_rate": 0.0003507460642760569, "loss": 5.7295, "mean_token_accuracy": 0.20169539302587508, "num_tokens": 87350464.0, "step": 34465 }, { "entropy": 6.044235801696777, "epoch": 3.9780727062896712, "grad_norm": 0.9140625, "learning_rate": 0.0003507072072447534, "loss": 5.5242, "mean_token_accuracy": 0.20335896462202072, "num_tokens": 87362448.0, "step": 34470 }, { "entropy": 6.102519607543945, "epoch": 3.9786497403346797, "grad_norm": 0.953125, "learning_rate": 0.00035066834766707546, "loss": 5.5532, "mean_token_accuracy": 0.21501004099845886, "num_tokens": 87374456.0, "step": 34475 }, { "entropy": 6.079614162445068, "epoch": 3.9792267743796885, "grad_norm": 0.94921875, "learning_rate": 0.00035062948554433025, "loss": 5.5441, "mean_token_accuracy": 0.20899610072374344, "num_tokens": 87387467.0, "step": 34480 }, { "entropy": 6.128240442276001, "epoch": 3.979803808424697, "grad_norm": 0.921875, "learning_rate": 0.00035059062087782497, "loss": 5.6293, "mean_token_accuracy": 0.20750930458307265, "num_tokens": 87402236.0, "step": 34485 }, { "entropy": 6.06376953125, "epoch": 3.980380842469706, "grad_norm": 0.96875, "learning_rate": 0.0003505517536688667, "loss": 5.5046, "mean_token_accuracy": 0.21335405111312866, "num_tokens": 87416514.0, "step": 34490 }, { "entropy": 6.0376605033874515, "epoch": 3.9809578765147142, "grad_norm": 1.0390625, "learning_rate": 0.0003505128839187626, "loss": 5.574, "mean_token_accuracy": 0.2085227608680725, "num_tokens": 87428474.0, "step": 34495 }, { "entropy": 6.040627193450928, "epoch": 3.981534910559723, "grad_norm": 0.984375, "learning_rate": 0.0003504740116288203, "loss": 5.6181, "mean_token_accuracy": 0.203532937169075, "num_tokens": 87440945.0, "step": 34500 }, { "entropy": 6.063632154464722, "epoch": 3.982111944604732, "grad_norm": 0.9921875, "learning_rate": 0.000350435136800347, "loss": 5.5314, "mean_token_accuracy": 0.21654371172189713, "num_tokens": 87454193.0, "step": 34505 }, { "entropy": 6.1012945652008055, "epoch": 3.9826889786497404, "grad_norm": 0.81640625, "learning_rate": 0.0003503962594346504, "loss": 5.5648, "mean_token_accuracy": 0.20970981568098068, "num_tokens": 87467775.0, "step": 34510 }, { "entropy": 6.013328218460083, "epoch": 3.983266012694749, "grad_norm": 0.95703125, "learning_rate": 0.0003503573795330381, "loss": 5.5939, "mean_token_accuracy": 0.2044184222817421, "num_tokens": 87481210.0, "step": 34515 }, { "entropy": 6.112621450424195, "epoch": 3.9838430467397576, "grad_norm": 0.8984375, "learning_rate": 0.0003503184970968176, "loss": 5.6126, "mean_token_accuracy": 0.2013202890753746, "num_tokens": 87493464.0, "step": 34520 }, { "entropy": 6.059024953842163, "epoch": 3.9844200807847665, "grad_norm": 0.875, "learning_rate": 0.00035027961212729704, "loss": 5.5301, "mean_token_accuracy": 0.21107590794563294, "num_tokens": 87505980.0, "step": 34525 }, { "entropy": 6.004796171188355, "epoch": 3.984997114829775, "grad_norm": 0.94140625, "learning_rate": 0.0003502407246257841, "loss": 5.5083, "mean_token_accuracy": 0.20867787301540375, "num_tokens": 87518941.0, "step": 34530 }, { "entropy": 6.128394603729248, "epoch": 3.9855741488747833, "grad_norm": 0.9140625, "learning_rate": 0.00035020183459358675, "loss": 5.664, "mean_token_accuracy": 0.20174337327480316, "num_tokens": 87532342.0, "step": 34535 }, { "entropy": 6.130295324325561, "epoch": 3.986151182919792, "grad_norm": 0.96875, "learning_rate": 0.000350162942032013, "loss": 5.6104, "mean_token_accuracy": 0.21007633656263353, "num_tokens": 87544921.0, "step": 34540 }, { "entropy": 6.10325517654419, "epoch": 3.986728216964801, "grad_norm": 1.1015625, "learning_rate": 0.00035012404694237105, "loss": 5.6131, "mean_token_accuracy": 0.20724945962429048, "num_tokens": 87559131.0, "step": 34545 }, { "entropy": 6.081124210357666, "epoch": 3.9873052510098095, "grad_norm": 0.98046875, "learning_rate": 0.00035008514932596905, "loss": 5.5983, "mean_token_accuracy": 0.20876982808113098, "num_tokens": 87571776.0, "step": 34550 }, { "entropy": 6.136280298233032, "epoch": 3.9878822850548183, "grad_norm": 0.9453125, "learning_rate": 0.00035004624918411547, "loss": 5.6615, "mean_token_accuracy": 0.1971665322780609, "num_tokens": 87582901.0, "step": 34555 }, { "entropy": 6.064534664154053, "epoch": 3.9884593190998268, "grad_norm": 0.9296875, "learning_rate": 0.0003500073465181185, "loss": 5.6144, "mean_token_accuracy": 0.20179163813591003, "num_tokens": 87596225.0, "step": 34560 }, { "entropy": 6.172553634643554, "epoch": 3.9890363531448356, "grad_norm": 0.96484375, "learning_rate": 0.0003499684413292867, "loss": 5.6469, "mean_token_accuracy": 0.2037851795554161, "num_tokens": 87608977.0, "step": 34565 }, { "entropy": 6.137198114395142, "epoch": 3.989613387189844, "grad_norm": 0.93359375, "learning_rate": 0.0003499295336189286, "loss": 5.6596, "mean_token_accuracy": 0.20181216448545455, "num_tokens": 87622132.0, "step": 34570 }, { "entropy": 6.132321453094482, "epoch": 3.990190421234853, "grad_norm": 0.96875, "learning_rate": 0.00034989062338835293, "loss": 5.6279, "mean_token_accuracy": 0.19931786209344865, "num_tokens": 87634939.0, "step": 34575 }, { "entropy": 5.941410684585572, "epoch": 3.9907674552798618, "grad_norm": 0.9609375, "learning_rate": 0.00034985171063886826, "loss": 5.4978, "mean_token_accuracy": 0.21616897284984588, "num_tokens": 87647323.0, "step": 34580 }, { "entropy": 5.928447341918945, "epoch": 3.99134448932487, "grad_norm": 0.94921875, "learning_rate": 0.0003498127953717835, "loss": 5.3827, "mean_token_accuracy": 0.22963026016950608, "num_tokens": 87660426.0, "step": 34585 }, { "entropy": 6.096912479400634, "epoch": 3.9919215233698786, "grad_norm": 0.90234375, "learning_rate": 0.0003497738775884075, "loss": 5.6128, "mean_token_accuracy": 0.2134929731488228, "num_tokens": 87673445.0, "step": 34590 }, { "entropy": 6.094749689102173, "epoch": 3.9924985574148875, "grad_norm": 0.94140625, "learning_rate": 0.00034973495729004935, "loss": 5.6564, "mean_token_accuracy": 0.20441095978021623, "num_tokens": 87686970.0, "step": 34595 }, { "entropy": 6.039253807067871, "epoch": 3.9930755914598963, "grad_norm": 0.94921875, "learning_rate": 0.000349696034478018, "loss": 5.634, "mean_token_accuracy": 0.20482555478811265, "num_tokens": 87699062.0, "step": 34600 }, { "entropy": 6.185580396652222, "epoch": 3.9936526255049047, "grad_norm": 0.93359375, "learning_rate": 0.00034965710915362257, "loss": 5.6252, "mean_token_accuracy": 0.2027628555893898, "num_tokens": 87711329.0, "step": 34605 }, { "entropy": 6.097812128067017, "epoch": 3.9942296595499136, "grad_norm": 0.98046875, "learning_rate": 0.0003496181813181724, "loss": 5.5908, "mean_token_accuracy": 0.20764925926923752, "num_tokens": 87724650.0, "step": 34610 }, { "entropy": 6.012580919265747, "epoch": 3.994806693594922, "grad_norm": 1.015625, "learning_rate": 0.0003495792509729768, "loss": 5.5586, "mean_token_accuracy": 0.21214479058980942, "num_tokens": 87738230.0, "step": 34615 }, { "entropy": 6.027355337142945, "epoch": 3.995383727639931, "grad_norm": 0.87890625, "learning_rate": 0.0003495403181193451, "loss": 5.4734, "mean_token_accuracy": 0.21015517860651017, "num_tokens": 87751716.0, "step": 34620 }, { "entropy": 6.214514446258545, "epoch": 3.9959607616849393, "grad_norm": 1.015625, "learning_rate": 0.0003495013827585868, "loss": 5.6981, "mean_token_accuracy": 0.19951127469539642, "num_tokens": 87764626.0, "step": 34625 }, { "entropy": 6.107736492156983, "epoch": 3.996537795729948, "grad_norm": 1.109375, "learning_rate": 0.00034946244489201156, "loss": 5.6938, "mean_token_accuracy": 0.1990364745259285, "num_tokens": 87776868.0, "step": 34630 }, { "entropy": 6.159733629226684, "epoch": 3.9971148297749566, "grad_norm": 0.94921875, "learning_rate": 0.00034942350452092896, "loss": 5.6297, "mean_token_accuracy": 0.203691266477108, "num_tokens": 87788870.0, "step": 34635 }, { "entropy": 6.105396318435669, "epoch": 3.9976918638199654, "grad_norm": 0.9921875, "learning_rate": 0.0003493845616466488, "loss": 5.5772, "mean_token_accuracy": 0.20774596631526948, "num_tokens": 87801306.0, "step": 34640 }, { "entropy": 6.0374228954315186, "epoch": 3.998268897864974, "grad_norm": 0.94921875, "learning_rate": 0.00034934561627048076, "loss": 5.5535, "mean_token_accuracy": 0.20272466987371446, "num_tokens": 87814320.0, "step": 34645 }, { "entropy": 6.141267395019531, "epoch": 3.9988459319099827, "grad_norm": 0.94921875, "learning_rate": 0.0003493066683937349, "loss": 5.6372, "mean_token_accuracy": 0.20017722696065904, "num_tokens": 87826939.0, "step": 34650 }, { "entropy": 6.091874980926514, "epoch": 3.9994229659549916, "grad_norm": 0.9765625, "learning_rate": 0.0003492677180177212, "loss": 5.5658, "mean_token_accuracy": 0.20687366873025895, "num_tokens": 87839769.0, "step": 34655 }, { "entropy": 6.094721698760987, "epoch": 4.0, "grad_norm": 0.9921875, "learning_rate": 0.0003492287651437496, "loss": 5.5966, "mean_token_accuracy": 0.20685495734214782, "num_tokens": 87852468.0, "step": 34660 }, { "entropy": 6.07154107093811, "epoch": 4.000577034045008, "grad_norm": 0.9296875, "learning_rate": 0.00034918980977313035, "loss": 5.5197, "mean_token_accuracy": 0.20995810776948928, "num_tokens": 87864594.0, "step": 34665 }, { "entropy": 6.073631811141968, "epoch": 4.001154068090018, "grad_norm": 0.91015625, "learning_rate": 0.0003491508519071738, "loss": 5.554, "mean_token_accuracy": 0.2091823026537895, "num_tokens": 87878129.0, "step": 34670 }, { "entropy": 6.096306991577149, "epoch": 4.001731102135026, "grad_norm": 0.91015625, "learning_rate": 0.00034911189154719017, "loss": 5.5819, "mean_token_accuracy": 0.207656329870224, "num_tokens": 87891110.0, "step": 34675 }, { "entropy": 6.062782049179077, "epoch": 4.002308136180035, "grad_norm": 0.9453125, "learning_rate": 0.0003490729286944899, "loss": 5.494, "mean_token_accuracy": 0.20850566476583482, "num_tokens": 87903015.0, "step": 34680 }, { "entropy": 6.093405628204346, "epoch": 4.002885170225043, "grad_norm": 0.96484375, "learning_rate": 0.0003490339633503833, "loss": 5.5535, "mean_token_accuracy": 0.20809932947158813, "num_tokens": 87916832.0, "step": 34685 }, { "entropy": 6.122495079040528, "epoch": 4.003462204270052, "grad_norm": 0.94140625, "learning_rate": 0.00034899499551618125, "loss": 5.4839, "mean_token_accuracy": 0.21101561933755875, "num_tokens": 87929187.0, "step": 34690 }, { "entropy": 6.044330263137818, "epoch": 4.004039238315061, "grad_norm": 0.94140625, "learning_rate": 0.00034895602519319425, "loss": 5.4949, "mean_token_accuracy": 0.2122476115822792, "num_tokens": 87941966.0, "step": 34695 }, { "entropy": 6.04209156036377, "epoch": 4.004616272360069, "grad_norm": 0.8984375, "learning_rate": 0.0003489170523827331, "loss": 5.5199, "mean_token_accuracy": 0.20395033061504364, "num_tokens": 87953683.0, "step": 34700 }, { "entropy": 6.103100967407227, "epoch": 4.0051933064050775, "grad_norm": 0.97265625, "learning_rate": 0.0003488780770861086, "loss": 5.5468, "mean_token_accuracy": 0.20174019634723664, "num_tokens": 87965394.0, "step": 34705 }, { "entropy": 6.037567138671875, "epoch": 4.005770340450087, "grad_norm": 1.0078125, "learning_rate": 0.00034883909930463167, "loss": 5.4428, "mean_token_accuracy": 0.2161940738558769, "num_tokens": 87978478.0, "step": 34710 }, { "entropy": 5.922917222976684, "epoch": 4.006347374495095, "grad_norm": 0.8515625, "learning_rate": 0.00034880011903961337, "loss": 5.3963, "mean_token_accuracy": 0.22060333490371703, "num_tokens": 87992029.0, "step": 34715 }, { "entropy": 6.0579345703125, "epoch": 4.006924408540104, "grad_norm": 0.8984375, "learning_rate": 0.0003487611362923646, "loss": 5.4871, "mean_token_accuracy": 0.21774370223283768, "num_tokens": 88004589.0, "step": 34720 }, { "entropy": 6.050927782058716, "epoch": 4.007501442585112, "grad_norm": 0.9375, "learning_rate": 0.0003487221510641967, "loss": 5.5142, "mean_token_accuracy": 0.2204449087381363, "num_tokens": 88018711.0, "step": 34725 }, { "entropy": 6.143491458892822, "epoch": 4.008078476630121, "grad_norm": 1.0, "learning_rate": 0.0003486831633564209, "loss": 5.563, "mean_token_accuracy": 0.21282918155193328, "num_tokens": 88030944.0, "step": 34730 }, { "entropy": 6.090694427490234, "epoch": 4.00865551067513, "grad_norm": 1.046875, "learning_rate": 0.0003486441731703485, "loss": 5.5893, "mean_token_accuracy": 0.2057602122426033, "num_tokens": 88044283.0, "step": 34735 }, { "entropy": 6.053262996673584, "epoch": 4.009232544720138, "grad_norm": 0.9375, "learning_rate": 0.0003486051805072909, "loss": 5.5303, "mean_token_accuracy": 0.21125535070896148, "num_tokens": 88056658.0, "step": 34740 }, { "entropy": 6.114913654327393, "epoch": 4.0098095787651475, "grad_norm": 0.99609375, "learning_rate": 0.0003485661853685596, "loss": 5.6682, "mean_token_accuracy": 0.20412778109312057, "num_tokens": 88069880.0, "step": 34745 }, { "entropy": 6.189751148223877, "epoch": 4.010386612810156, "grad_norm": 0.96484375, "learning_rate": 0.0003485271877554662, "loss": 5.5933, "mean_token_accuracy": 0.20338854640722276, "num_tokens": 88082350.0, "step": 34750 }, { "entropy": 6.084666109085083, "epoch": 4.010963646855164, "grad_norm": 0.9296875, "learning_rate": 0.00034848818766932234, "loss": 5.5135, "mean_token_accuracy": 0.21101275831460953, "num_tokens": 88095330.0, "step": 34755 }, { "entropy": 6.0886983394622805, "epoch": 4.011540680900173, "grad_norm": 1.0625, "learning_rate": 0.0003484491851114399, "loss": 5.5631, "mean_token_accuracy": 0.20131635814905166, "num_tokens": 88106689.0, "step": 34760 }, { "entropy": 6.088760423660278, "epoch": 4.012117714945182, "grad_norm": 1.0, "learning_rate": 0.00034841018008313054, "loss": 5.5676, "mean_token_accuracy": 0.2107717737555504, "num_tokens": 88118917.0, "step": 34765 }, { "entropy": 6.123544502258301, "epoch": 4.0126947489901905, "grad_norm": 0.953125, "learning_rate": 0.0003483711725857062, "loss": 5.6126, "mean_token_accuracy": 0.20976841747760772, "num_tokens": 88131857.0, "step": 34770 }, { "entropy": 6.041328191757202, "epoch": 4.013271783035199, "grad_norm": 1.015625, "learning_rate": 0.00034833216262047896, "loss": 5.4697, "mean_token_accuracy": 0.2147274672985077, "num_tokens": 88144197.0, "step": 34775 }, { "entropy": 6.042860412597657, "epoch": 4.013848817080207, "grad_norm": 0.88671875, "learning_rate": 0.00034829315018876085, "loss": 5.5192, "mean_token_accuracy": 0.21206455826759338, "num_tokens": 88157091.0, "step": 34780 }, { "entropy": 6.034541320800781, "epoch": 4.014425851125217, "grad_norm": 0.99609375, "learning_rate": 0.000348254135291864, "loss": 5.4621, "mean_token_accuracy": 0.21467296183109283, "num_tokens": 88171332.0, "step": 34785 }, { "entropy": 6.137015628814697, "epoch": 4.015002885170225, "grad_norm": 0.94140625, "learning_rate": 0.0003482151179311008, "loss": 5.6597, "mean_token_accuracy": 0.19899375289678572, "num_tokens": 88183379.0, "step": 34790 }, { "entropy": 6.166791248321533, "epoch": 4.0155799192152335, "grad_norm": 0.95703125, "learning_rate": 0.00034817609810778335, "loss": 5.5885, "mean_token_accuracy": 0.21038224995136262, "num_tokens": 88195899.0, "step": 34795 }, { "entropy": 6.099807024002075, "epoch": 4.016156953260242, "grad_norm": 1.0, "learning_rate": 0.00034813707582322426, "loss": 5.4833, "mean_token_accuracy": 0.20996502935886383, "num_tokens": 88207395.0, "step": 34800 }, { "entropy": 6.047596263885498, "epoch": 4.016733987305251, "grad_norm": 0.97265625, "learning_rate": 0.00034809805107873594, "loss": 5.5208, "mean_token_accuracy": 0.2173555999994278, "num_tokens": 88220157.0, "step": 34805 }, { "entropy": 6.144260120391846, "epoch": 4.01731102135026, "grad_norm": 0.95703125, "learning_rate": 0.000348059023875631, "loss": 5.6472, "mean_token_accuracy": 0.20201577693223954, "num_tokens": 88233355.0, "step": 34810 }, { "entropy": 6.18580207824707, "epoch": 4.017888055395268, "grad_norm": 0.92578125, "learning_rate": 0.000348019994215222, "loss": 5.5808, "mean_token_accuracy": 0.20198184996843338, "num_tokens": 88244906.0, "step": 34815 }, { "entropy": 6.142538738250733, "epoch": 4.018465089440277, "grad_norm": 1.1328125, "learning_rate": 0.00034798096209882185, "loss": 5.5866, "mean_token_accuracy": 0.20428550243377686, "num_tokens": 88257777.0, "step": 34820 }, { "entropy": 5.976137924194336, "epoch": 4.019042123485286, "grad_norm": 0.9609375, "learning_rate": 0.0003479419275277433, "loss": 5.4636, "mean_token_accuracy": 0.21240369230508804, "num_tokens": 88270532.0, "step": 34825 }, { "entropy": 6.037280797958374, "epoch": 4.019619157530294, "grad_norm": 2.28125, "learning_rate": 0.0003479028905032992, "loss": 5.4183, "mean_token_accuracy": 0.22472108155488968, "num_tokens": 88283084.0, "step": 34830 }, { "entropy": 6.03937029838562, "epoch": 4.020196191575303, "grad_norm": 0.94140625, "learning_rate": 0.00034786385102680264, "loss": 5.5017, "mean_token_accuracy": 0.21006458401679992, "num_tokens": 88296161.0, "step": 34835 }, { "entropy": 6.065213918685913, "epoch": 4.020773225620312, "grad_norm": 0.890625, "learning_rate": 0.00034782480909956653, "loss": 5.51, "mean_token_accuracy": 0.2059015691280365, "num_tokens": 88309008.0, "step": 34840 }, { "entropy": 6.134440469741821, "epoch": 4.02135025966532, "grad_norm": 0.91796875, "learning_rate": 0.0003477857647229043, "loss": 5.5697, "mean_token_accuracy": 0.20829159915447235, "num_tokens": 88323420.0, "step": 34845 }, { "entropy": 5.983515739440918, "epoch": 4.021927293710329, "grad_norm": 0.91796875, "learning_rate": 0.0003477467178981289, "loss": 5.3734, "mean_token_accuracy": 0.23136326670646667, "num_tokens": 88337154.0, "step": 34850 }, { "entropy": 6.010545635223389, "epoch": 4.022504327755337, "grad_norm": 1.171875, "learning_rate": 0.00034770766862655386, "loss": 5.4444, "mean_token_accuracy": 0.21841942369937897, "num_tokens": 88350397.0, "step": 34855 }, { "entropy": 6.070789909362793, "epoch": 4.0230813618003465, "grad_norm": 1.0234375, "learning_rate": 0.0003476686169094925, "loss": 5.5244, "mean_token_accuracy": 0.21290499418973924, "num_tokens": 88363848.0, "step": 34860 }, { "entropy": 6.058571481704712, "epoch": 4.023658395845355, "grad_norm": 1.2734375, "learning_rate": 0.00034762956274825827, "loss": 5.403, "mean_token_accuracy": 0.22446643561124802, "num_tokens": 88375811.0, "step": 34865 }, { "entropy": 6.059533023834229, "epoch": 4.024235429890363, "grad_norm": 1.0703125, "learning_rate": 0.0003475905061441648, "loss": 5.5481, "mean_token_accuracy": 0.2168492391705513, "num_tokens": 88388797.0, "step": 34870 }, { "entropy": 6.045244407653809, "epoch": 4.024812463935373, "grad_norm": 0.9765625, "learning_rate": 0.0003475514470985257, "loss": 5.4841, "mean_token_accuracy": 0.21442991346120835, "num_tokens": 88401150.0, "step": 34875 }, { "entropy": 6.04743447303772, "epoch": 4.025389497980381, "grad_norm": 0.94921875, "learning_rate": 0.00034751238561265467, "loss": 5.4667, "mean_token_accuracy": 0.2109408125281334, "num_tokens": 88414359.0, "step": 34880 }, { "entropy": 6.023638677597046, "epoch": 4.0259665320253895, "grad_norm": 0.95703125, "learning_rate": 0.0003474733216878656, "loss": 5.4559, "mean_token_accuracy": 0.21457384079694747, "num_tokens": 88427110.0, "step": 34885 }, { "entropy": 6.02948579788208, "epoch": 4.026543566070398, "grad_norm": 1.0625, "learning_rate": 0.0003474342553254724, "loss": 5.4984, "mean_token_accuracy": 0.21211129575967788, "num_tokens": 88440221.0, "step": 34890 }, { "entropy": 6.075586748123169, "epoch": 4.027120600115407, "grad_norm": 1.0234375, "learning_rate": 0.000347395186526789, "loss": 5.5281, "mean_token_accuracy": 0.21080708503723145, "num_tokens": 88452177.0, "step": 34895 }, { "entropy": 6.135594749450684, "epoch": 4.027697634160416, "grad_norm": 0.97265625, "learning_rate": 0.00034735611529312937, "loss": 5.5853, "mean_token_accuracy": 0.20992309600114822, "num_tokens": 88464704.0, "step": 34900 }, { "entropy": 6.085616779327393, "epoch": 4.028274668205424, "grad_norm": 0.90625, "learning_rate": 0.00034731704162580787, "loss": 5.5849, "mean_token_accuracy": 0.2090852826833725, "num_tokens": 88478102.0, "step": 34905 }, { "entropy": 6.1202089309692385, "epoch": 4.028851702250432, "grad_norm": 1.0546875, "learning_rate": 0.00034727796552613854, "loss": 5.5246, "mean_token_accuracy": 0.20304690301418304, "num_tokens": 88490817.0, "step": 34910 }, { "entropy": 6.0862287998199465, "epoch": 4.029428736295442, "grad_norm": 0.9609375, "learning_rate": 0.00034723888699543564, "loss": 5.5884, "mean_token_accuracy": 0.20916266441345216, "num_tokens": 88504118.0, "step": 34915 }, { "entropy": 6.033890008926392, "epoch": 4.03000577034045, "grad_norm": 0.98046875, "learning_rate": 0.0003471998060350138, "loss": 5.5026, "mean_token_accuracy": 0.20833633840084076, "num_tokens": 88517146.0, "step": 34920 }, { "entropy": 6.00624041557312, "epoch": 4.030582804385459, "grad_norm": 1.3359375, "learning_rate": 0.0003471607226461873, "loss": 5.4075, "mean_token_accuracy": 0.21588986814022065, "num_tokens": 88529338.0, "step": 34925 }, { "entropy": 6.022734308242798, "epoch": 4.031159838430467, "grad_norm": 1.0078125, "learning_rate": 0.0003471216368302707, "loss": 5.4843, "mean_token_accuracy": 0.22091287821531297, "num_tokens": 88541795.0, "step": 34930 }, { "entropy": 6.011997127532959, "epoch": 4.031736872475476, "grad_norm": 0.89453125, "learning_rate": 0.0003470825485885787, "loss": 5.4811, "mean_token_accuracy": 0.22161715477705002, "num_tokens": 88554971.0, "step": 34935 }, { "entropy": 5.905759954452515, "epoch": 4.032313906520485, "grad_norm": 0.9921875, "learning_rate": 0.00034704345792242606, "loss": 5.4751, "mean_token_accuracy": 0.21288659572601318, "num_tokens": 88567037.0, "step": 34940 }, { "entropy": 6.1228782653808596, "epoch": 4.032890940565493, "grad_norm": 0.89453125, "learning_rate": 0.0003470043648331274, "loss": 5.5992, "mean_token_accuracy": 0.2074059873819351, "num_tokens": 88580773.0, "step": 34945 }, { "entropy": 6.1154704093933105, "epoch": 4.033467974610502, "grad_norm": 0.9921875, "learning_rate": 0.0003469652693219977, "loss": 5.6103, "mean_token_accuracy": 0.20879853367805482, "num_tokens": 88594829.0, "step": 34950 }, { "entropy": 6.057131290435791, "epoch": 4.034045008655511, "grad_norm": 0.9609375, "learning_rate": 0.00034692617139035195, "loss": 5.5198, "mean_token_accuracy": 0.2102598488330841, "num_tokens": 88607824.0, "step": 34955 }, { "entropy": 6.062717485427856, "epoch": 4.034622042700519, "grad_norm": 1.03125, "learning_rate": 0.00034688707103950516, "loss": 5.5017, "mean_token_accuracy": 0.2109762579202652, "num_tokens": 88620743.0, "step": 34960 }, { "entropy": 6.085350418090821, "epoch": 4.035199076745528, "grad_norm": 0.99609375, "learning_rate": 0.00034684796827077243, "loss": 5.5337, "mean_token_accuracy": 0.21046335995197296, "num_tokens": 88632938.0, "step": 34965 }, { "entropy": 6.090941143035889, "epoch": 4.035776110790537, "grad_norm": 0.98828125, "learning_rate": 0.0003468088630854689, "loss": 5.6041, "mean_token_accuracy": 0.2118572399020195, "num_tokens": 88644900.0, "step": 34970 }, { "entropy": 6.054655456542969, "epoch": 4.036353144835545, "grad_norm": 0.9296875, "learning_rate": 0.00034676975548491006, "loss": 5.4802, "mean_token_accuracy": 0.21850402504205704, "num_tokens": 88657828.0, "step": 34975 }, { "entropy": 6.093479061126709, "epoch": 4.036930178880554, "grad_norm": 0.92578125, "learning_rate": 0.00034673064547041107, "loss": 5.54, "mean_token_accuracy": 0.21199256032705308, "num_tokens": 88670346.0, "step": 34980 }, { "entropy": 6.032238292694092, "epoch": 4.037507212925562, "grad_norm": 0.9765625, "learning_rate": 0.00034669153304328745, "loss": 5.4768, "mean_token_accuracy": 0.21034955978393555, "num_tokens": 88682699.0, "step": 34985 }, { "entropy": 6.089202737808227, "epoch": 4.0380842469705716, "grad_norm": 0.95703125, "learning_rate": 0.0003466524182048548, "loss": 5.5534, "mean_token_accuracy": 0.209945248067379, "num_tokens": 88694873.0, "step": 34990 }, { "entropy": 5.9667998313903805, "epoch": 4.03866128101558, "grad_norm": 1.046875, "learning_rate": 0.0003466133009564286, "loss": 5.4528, "mean_token_accuracy": 0.22358045130968093, "num_tokens": 88707709.0, "step": 34995 }, { "entropy": 6.096726989746093, "epoch": 4.039238315060588, "grad_norm": 1.015625, "learning_rate": 0.00034657418129932456, "loss": 5.6226, "mean_token_accuracy": 0.20594664067029952, "num_tokens": 88720263.0, "step": 35000 }, { "entropy": 6.084662342071534, "epoch": 4.039815349105597, "grad_norm": 0.90625, "learning_rate": 0.0003465350592348586, "loss": 5.5159, "mean_token_accuracy": 0.20816581845283508, "num_tokens": 88733664.0, "step": 35005 }, { "entropy": 6.042846584320069, "epoch": 4.040392383150606, "grad_norm": 0.91796875, "learning_rate": 0.00034649593476434627, "loss": 5.4799, "mean_token_accuracy": 0.21679667979478837, "num_tokens": 88746441.0, "step": 35010 }, { "entropy": 6.101603841781616, "epoch": 4.0409694171956145, "grad_norm": 0.91015625, "learning_rate": 0.00034645680788910385, "loss": 5.5213, "mean_token_accuracy": 0.2122953027486801, "num_tokens": 88758194.0, "step": 35015 }, { "entropy": 6.043791246414185, "epoch": 4.041546451240623, "grad_norm": 0.9765625, "learning_rate": 0.0003464176786104471, "loss": 5.5445, "mean_token_accuracy": 0.21630258560180665, "num_tokens": 88771471.0, "step": 35020 }, { "entropy": 6.110648775100708, "epoch": 4.042123485285632, "grad_norm": 1.0234375, "learning_rate": 0.00034637854692969223, "loss": 5.5532, "mean_token_accuracy": 0.21201925724744797, "num_tokens": 88783592.0, "step": 35025 }, { "entropy": 6.021303176879883, "epoch": 4.042700519330641, "grad_norm": 0.96484375, "learning_rate": 0.0003463394128481554, "loss": 5.4586, "mean_token_accuracy": 0.21380839198827745, "num_tokens": 88796445.0, "step": 35030 }, { "entropy": 5.988835334777832, "epoch": 4.043277553375649, "grad_norm": 0.94921875, "learning_rate": 0.0003463002763671528, "loss": 5.4529, "mean_token_accuracy": 0.2160557672381401, "num_tokens": 88809118.0, "step": 35035 }, { "entropy": 6.0822868824005125, "epoch": 4.0438545874206575, "grad_norm": 0.96875, "learning_rate": 0.0003462611374880009, "loss": 5.506, "mean_token_accuracy": 0.2135401651263237, "num_tokens": 88821163.0, "step": 35040 }, { "entropy": 6.133023691177368, "epoch": 4.044431621465667, "grad_norm": 0.86328125, "learning_rate": 0.00034622199621201606, "loss": 5.6046, "mean_token_accuracy": 0.20615515410900115, "num_tokens": 88833323.0, "step": 35045 }, { "entropy": 6.1287635326385494, "epoch": 4.045008655510675, "grad_norm": 1.0, "learning_rate": 0.0003461828525405147, "loss": 5.5835, "mean_token_accuracy": 0.2061597466468811, "num_tokens": 88845378.0, "step": 35050 }, { "entropy": 6.080401229858398, "epoch": 4.045585689555684, "grad_norm": 0.98046875, "learning_rate": 0.0003461437064748135, "loss": 5.5322, "mean_token_accuracy": 0.20550114810466766, "num_tokens": 88858365.0, "step": 35055 }, { "entropy": 6.057364416122437, "epoch": 4.046162723600692, "grad_norm": 0.98828125, "learning_rate": 0.000346104558016229, "loss": 5.5062, "mean_token_accuracy": 0.2132334053516388, "num_tokens": 88870879.0, "step": 35060 }, { "entropy": 6.100865411758423, "epoch": 4.046739757645701, "grad_norm": 0.8671875, "learning_rate": 0.000346065407166078, "loss": 5.5484, "mean_token_accuracy": 0.2093985304236412, "num_tokens": 88883525.0, "step": 35065 }, { "entropy": 6.090194129943848, "epoch": 4.04731679169071, "grad_norm": 1.0, "learning_rate": 0.0003460262539256774, "loss": 5.5481, "mean_token_accuracy": 0.20774607062339784, "num_tokens": 88897293.0, "step": 35070 }, { "entropy": 6.069189834594726, "epoch": 4.047893825735718, "grad_norm": 0.921875, "learning_rate": 0.000345987098296344, "loss": 5.5602, "mean_token_accuracy": 0.20843006372451783, "num_tokens": 88910697.0, "step": 35075 }, { "entropy": 6.1488330364227295, "epoch": 4.048470859780727, "grad_norm": 0.9140625, "learning_rate": 0.0003459479402793948, "loss": 5.5731, "mean_token_accuracy": 0.20986740291118622, "num_tokens": 88924325.0, "step": 35080 }, { "entropy": 6.1072039127349855, "epoch": 4.049047893825736, "grad_norm": 1.0390625, "learning_rate": 0.00034590877987614687, "loss": 5.5836, "mean_token_accuracy": 0.19938248693943023, "num_tokens": 88937218.0, "step": 35085 }, { "entropy": 5.942077255249023, "epoch": 4.049624927870744, "grad_norm": 0.91796875, "learning_rate": 0.0003458696170879174, "loss": 5.3773, "mean_token_accuracy": 0.23093982189893722, "num_tokens": 88949849.0, "step": 35090 }, { "entropy": 6.006182384490967, "epoch": 4.050201961915753, "grad_norm": 0.953125, "learning_rate": 0.0003458304519160235, "loss": 5.4263, "mean_token_accuracy": 0.21751437485218048, "num_tokens": 88963466.0, "step": 35095 }, { "entropy": 6.096313238143921, "epoch": 4.050778995960762, "grad_norm": 0.91015625, "learning_rate": 0.00034579128436178257, "loss": 5.6251, "mean_token_accuracy": 0.2097773402929306, "num_tokens": 88977431.0, "step": 35100 }, { "entropy": 6.026976490020752, "epoch": 4.0513560300057705, "grad_norm": 0.984375, "learning_rate": 0.00034575211442651195, "loss": 5.481, "mean_token_accuracy": 0.22147003710269927, "num_tokens": 88989822.0, "step": 35105 }, { "entropy": 6.1603217124938965, "epoch": 4.051933064050779, "grad_norm": 0.90625, "learning_rate": 0.0003457129421115291, "loss": 5.591, "mean_token_accuracy": 0.20492201596498488, "num_tokens": 89002469.0, "step": 35110 }, { "entropy": 6.060435056686401, "epoch": 4.052510098095787, "grad_norm": 0.94921875, "learning_rate": 0.0003456737674181516, "loss": 5.5298, "mean_token_accuracy": 0.2116502732038498, "num_tokens": 89015658.0, "step": 35115 }, { "entropy": 6.064583253860474, "epoch": 4.053087132140797, "grad_norm": 0.9375, "learning_rate": 0.00034563459034769693, "loss": 5.5803, "mean_token_accuracy": 0.20522839277982713, "num_tokens": 89028708.0, "step": 35120 }, { "entropy": 6.128100156784058, "epoch": 4.053664166185805, "grad_norm": 1.109375, "learning_rate": 0.000345595410901483, "loss": 5.5775, "mean_token_accuracy": 0.20922085344791413, "num_tokens": 89040935.0, "step": 35125 }, { "entropy": 6.068128156661987, "epoch": 4.0542412002308135, "grad_norm": 0.98828125, "learning_rate": 0.00034555622908082745, "loss": 5.5816, "mean_token_accuracy": 0.19945605099201202, "num_tokens": 89051848.0, "step": 35130 }, { "entropy": 6.065807962417603, "epoch": 4.054818234275822, "grad_norm": 0.9453125, "learning_rate": 0.0003455170448870482, "loss": 5.4788, "mean_token_accuracy": 0.2141215533018112, "num_tokens": 89064094.0, "step": 35135 }, { "entropy": 6.131045770645142, "epoch": 4.055395268320831, "grad_norm": 0.953125, "learning_rate": 0.0003454778583214632, "loss": 5.6014, "mean_token_accuracy": 0.2104654550552368, "num_tokens": 89076460.0, "step": 35140 }, { "entropy": 6.164707040786743, "epoch": 4.05597230236584, "grad_norm": 0.890625, "learning_rate": 0.0003454386693853904, "loss": 5.6821, "mean_token_accuracy": 0.20278911739587785, "num_tokens": 89089576.0, "step": 35145 }, { "entropy": 6.011860466003418, "epoch": 4.056549336410848, "grad_norm": 0.93359375, "learning_rate": 0.00034539947808014793, "loss": 5.4699, "mean_token_accuracy": 0.21467145383358002, "num_tokens": 89103289.0, "step": 35150 }, { "entropy": 6.121705341339111, "epoch": 4.057126370455857, "grad_norm": 0.9609375, "learning_rate": 0.000345360284407054, "loss": 5.5781, "mean_token_accuracy": 0.2018578514456749, "num_tokens": 89115856.0, "step": 35155 }, { "entropy": 6.089470529556275, "epoch": 4.057703404500866, "grad_norm": 0.921875, "learning_rate": 0.00034532108836742687, "loss": 5.5793, "mean_token_accuracy": 0.20609953850507737, "num_tokens": 89127623.0, "step": 35160 }, { "entropy": 6.123625326156616, "epoch": 4.058280438545874, "grad_norm": 0.87890625, "learning_rate": 0.00034528188996258487, "loss": 5.5591, "mean_token_accuracy": 0.2040885269641876, "num_tokens": 89142041.0, "step": 35165 }, { "entropy": 6.090643692016601, "epoch": 4.058857472590883, "grad_norm": 0.87890625, "learning_rate": 0.00034524268919384636, "loss": 5.5252, "mean_token_accuracy": 0.20539493411779403, "num_tokens": 89154025.0, "step": 35170 }, { "entropy": 6.016414642333984, "epoch": 4.059434506635892, "grad_norm": 0.8359375, "learning_rate": 0.00034520348606252994, "loss": 5.4725, "mean_token_accuracy": 0.2165176197886467, "num_tokens": 89168168.0, "step": 35175 }, { "entropy": 6.029225063323975, "epoch": 4.0600115406809, "grad_norm": 1.0390625, "learning_rate": 0.0003451642805699541, "loss": 5.4753, "mean_token_accuracy": 0.21871232241392136, "num_tokens": 89181201.0, "step": 35180 }, { "entropy": 6.026586627960205, "epoch": 4.060588574725909, "grad_norm": 1.0625, "learning_rate": 0.00034512507271743765, "loss": 5.4433, "mean_token_accuracy": 0.22248812019824982, "num_tokens": 89193691.0, "step": 35185 }, { "entropy": 6.082807731628418, "epoch": 4.061165608770917, "grad_norm": 1.0078125, "learning_rate": 0.0003450858625062991, "loss": 5.5998, "mean_token_accuracy": 0.19912096709012986, "num_tokens": 89205546.0, "step": 35190 }, { "entropy": 6.085789966583252, "epoch": 4.0617426428159265, "grad_norm": 0.98828125, "learning_rate": 0.0003450466499378574, "loss": 5.5064, "mean_token_accuracy": 0.21895743608474733, "num_tokens": 89218102.0, "step": 35195 }, { "entropy": 6.104584360122681, "epoch": 4.062319676860935, "grad_norm": 0.9765625, "learning_rate": 0.0003450074350134314, "loss": 5.5486, "mean_token_accuracy": 0.2057262495160103, "num_tokens": 89229879.0, "step": 35200 }, { "entropy": 5.942384862899781, "epoch": 4.062896710905943, "grad_norm": 1.015625, "learning_rate": 0.00034496821773434024, "loss": 5.4206, "mean_token_accuracy": 0.21874017566442489, "num_tokens": 89242644.0, "step": 35205 }, { "entropy": 6.103714323043823, "epoch": 4.063473744950952, "grad_norm": 1.0, "learning_rate": 0.0003449289981019026, "loss": 5.5917, "mean_token_accuracy": 0.20302655696868896, "num_tokens": 89254419.0, "step": 35210 }, { "entropy": 6.117969083786011, "epoch": 4.064050778995961, "grad_norm": 0.98046875, "learning_rate": 0.000344889776117438, "loss": 5.5643, "mean_token_accuracy": 0.20394493341445924, "num_tokens": 89267274.0, "step": 35215 }, { "entropy": 6.110006809234619, "epoch": 4.064627813040969, "grad_norm": 0.94140625, "learning_rate": 0.00034485055178226545, "loss": 5.6056, "mean_token_accuracy": 0.20921236723661424, "num_tokens": 89279890.0, "step": 35220 }, { "entropy": 6.0223987102508545, "epoch": 4.065204847085978, "grad_norm": 1.0234375, "learning_rate": 0.0003448113250977043, "loss": 5.502, "mean_token_accuracy": 0.21321035027503968, "num_tokens": 89292583.0, "step": 35225 }, { "entropy": 6.046645641326904, "epoch": 4.065781881130987, "grad_norm": 1.0234375, "learning_rate": 0.00034477209606507394, "loss": 5.5724, "mean_token_accuracy": 0.2063037022948265, "num_tokens": 89305218.0, "step": 35230 }, { "entropy": 6.119129419326782, "epoch": 4.066358915175996, "grad_norm": 0.95703125, "learning_rate": 0.00034473286468569375, "loss": 5.5821, "mean_token_accuracy": 0.20413969606161117, "num_tokens": 89317900.0, "step": 35235 }, { "entropy": 6.119109964370727, "epoch": 4.066935949221004, "grad_norm": 0.86328125, "learning_rate": 0.0003446936309608833, "loss": 5.5804, "mean_token_accuracy": 0.20921165943145753, "num_tokens": 89332038.0, "step": 35240 }, { "entropy": 6.053035545349121, "epoch": 4.067512983266012, "grad_norm": 0.94140625, "learning_rate": 0.00034465439489196213, "loss": 5.4823, "mean_token_accuracy": 0.21430400013923645, "num_tokens": 89346701.0, "step": 35245 }, { "entropy": 5.9432168960571286, "epoch": 4.068090017311022, "grad_norm": 0.9296875, "learning_rate": 0.00034461515648025003, "loss": 5.3716, "mean_token_accuracy": 0.22382305413484574, "num_tokens": 89359766.0, "step": 35250 }, { "entropy": 6.0504148483276365, "epoch": 4.06866705135603, "grad_norm": 1.0078125, "learning_rate": 0.0003445759157270668, "loss": 5.5363, "mean_token_accuracy": 0.21363147497177123, "num_tokens": 89372137.0, "step": 35255 }, { "entropy": 5.916083192825317, "epoch": 4.0692440854010385, "grad_norm": 1.0390625, "learning_rate": 0.00034453667263373213, "loss": 5.3403, "mean_token_accuracy": 0.2247455358505249, "num_tokens": 89385949.0, "step": 35260 }, { "entropy": 6.037625646591186, "epoch": 4.069821119446047, "grad_norm": 0.88671875, "learning_rate": 0.00034449742720156604, "loss": 5.5264, "mean_token_accuracy": 0.2109056830406189, "num_tokens": 89398464.0, "step": 35265 }, { "entropy": 6.076513957977295, "epoch": 4.070398153491056, "grad_norm": 0.92578125, "learning_rate": 0.00034445817943188847, "loss": 5.5256, "mean_token_accuracy": 0.203271521627903, "num_tokens": 89410937.0, "step": 35270 }, { "entropy": 5.939506769180298, "epoch": 4.070975187536065, "grad_norm": 0.98046875, "learning_rate": 0.0003444189293260196, "loss": 5.4479, "mean_token_accuracy": 0.2124747022986412, "num_tokens": 89423887.0, "step": 35275 }, { "entropy": 6.090556478500366, "epoch": 4.071552221581073, "grad_norm": 1.0390625, "learning_rate": 0.00034437967688527945, "loss": 5.5282, "mean_token_accuracy": 0.21709538400173187, "num_tokens": 89435297.0, "step": 35280 }, { "entropy": 5.99617109298706, "epoch": 4.0721292556260815, "grad_norm": 0.96875, "learning_rate": 0.00034434042211098836, "loss": 5.4142, "mean_token_accuracy": 0.21990175247192384, "num_tokens": 89447514.0, "step": 35285 }, { "entropy": 6.121022415161133, "epoch": 4.072706289671091, "grad_norm": 0.9921875, "learning_rate": 0.0003443011650044666, "loss": 5.6505, "mean_token_accuracy": 0.198582661151886, "num_tokens": 89461078.0, "step": 35290 }, { "entropy": 6.137017631530762, "epoch": 4.073283323716099, "grad_norm": 0.98046875, "learning_rate": 0.0003442619055670346, "loss": 5.5499, "mean_token_accuracy": 0.2109602928161621, "num_tokens": 89473294.0, "step": 35295 }, { "entropy": 6.070271301269531, "epoch": 4.073860357761108, "grad_norm": 0.86328125, "learning_rate": 0.00034422264380001285, "loss": 5.5216, "mean_token_accuracy": 0.21472931355237962, "num_tokens": 89485957.0, "step": 35300 }, { "entropy": 6.07611312866211, "epoch": 4.074437391806117, "grad_norm": 0.9140625, "learning_rate": 0.0003441833797047218, "loss": 5.5736, "mean_token_accuracy": 0.20550290048122405, "num_tokens": 89497702.0, "step": 35305 }, { "entropy": 6.057424068450928, "epoch": 4.075014425851125, "grad_norm": 0.875, "learning_rate": 0.00034414411328248214, "loss": 5.564, "mean_token_accuracy": 0.20878633111715317, "num_tokens": 89510520.0, "step": 35310 }, { "entropy": 6.131303405761718, "epoch": 4.075591459896134, "grad_norm": 0.95703125, "learning_rate": 0.00034410484453461463, "loss": 5.6081, "mean_token_accuracy": 0.20582737773656845, "num_tokens": 89523521.0, "step": 35315 }, { "entropy": 5.984634637832642, "epoch": 4.076168493941142, "grad_norm": 0.9453125, "learning_rate": 0.0003440655734624399, "loss": 5.4316, "mean_token_accuracy": 0.21949629634618759, "num_tokens": 89535543.0, "step": 35320 }, { "entropy": 5.942215347290039, "epoch": 4.0767455279861515, "grad_norm": 0.95703125, "learning_rate": 0.000344026300067279, "loss": 5.431, "mean_token_accuracy": 0.21890262514352798, "num_tokens": 89548521.0, "step": 35325 }, { "entropy": 6.14573450088501, "epoch": 4.07732256203116, "grad_norm": 0.90234375, "learning_rate": 0.0003439870243504528, "loss": 5.5861, "mean_token_accuracy": 0.2013203412294388, "num_tokens": 89561251.0, "step": 35330 }, { "entropy": 6.043168354034424, "epoch": 4.077899596076168, "grad_norm": 0.9140625, "learning_rate": 0.00034394774631328227, "loss": 5.4607, "mean_token_accuracy": 0.2202374055981636, "num_tokens": 89573192.0, "step": 35335 }, { "entropy": 6.0670102596282955, "epoch": 4.078476630121177, "grad_norm": 1.015625, "learning_rate": 0.0003439084659570886, "loss": 5.5746, "mean_token_accuracy": 0.20714314728975297, "num_tokens": 89585960.0, "step": 35340 }, { "entropy": 6.055860805511474, "epoch": 4.079053664166186, "grad_norm": 0.96484375, "learning_rate": 0.00034386918328319283, "loss": 5.5136, "mean_token_accuracy": 0.21303393691778183, "num_tokens": 89599703.0, "step": 35345 }, { "entropy": 6.077237749099732, "epoch": 4.0796306982111945, "grad_norm": 0.984375, "learning_rate": 0.00034382989829291627, "loss": 5.4843, "mean_token_accuracy": 0.21803004890680314, "num_tokens": 89611815.0, "step": 35350 }, { "entropy": 5.90229754447937, "epoch": 4.080207732256203, "grad_norm": 0.9921875, "learning_rate": 0.0003437906109875803, "loss": 5.4214, "mean_token_accuracy": 0.214641210436821, "num_tokens": 89624556.0, "step": 35355 }, { "entropy": 6.0637694835662845, "epoch": 4.080784766301211, "grad_norm": 1.0, "learning_rate": 0.00034375132136850635, "loss": 5.5098, "mean_token_accuracy": 0.21228972673416138, "num_tokens": 89637685.0, "step": 35360 }, { "entropy": 6.109176588058472, "epoch": 4.081361800346221, "grad_norm": 0.90234375, "learning_rate": 0.0003437120294370158, "loss": 5.5671, "mean_token_accuracy": 0.21146745681762696, "num_tokens": 89650900.0, "step": 35365 }, { "entropy": 5.9502928256988525, "epoch": 4.081938834391229, "grad_norm": 1.015625, "learning_rate": 0.0003436727351944303, "loss": 5.3942, "mean_token_accuracy": 0.2216118723154068, "num_tokens": 89662840.0, "step": 35370 }, { "entropy": 6.0189612865447994, "epoch": 4.0825158684362375, "grad_norm": 0.9765625, "learning_rate": 0.0003436334386420714, "loss": 5.4818, "mean_token_accuracy": 0.21849386543035507, "num_tokens": 89675433.0, "step": 35375 }, { "entropy": 6.132223463058471, "epoch": 4.083092902481247, "grad_norm": 1.0390625, "learning_rate": 0.0003435941397812609, "loss": 5.5892, "mean_token_accuracy": 0.20545320063829423, "num_tokens": 89687533.0, "step": 35380 }, { "entropy": 6.054631853103638, "epoch": 4.083669936526255, "grad_norm": 0.94140625, "learning_rate": 0.00034355483861332064, "loss": 5.4423, "mean_token_accuracy": 0.22038716673851014, "num_tokens": 89700757.0, "step": 35385 }, { "entropy": 6.007598733901977, "epoch": 4.084246970571264, "grad_norm": 0.96875, "learning_rate": 0.0003435155351395724, "loss": 5.4891, "mean_token_accuracy": 0.2149067848920822, "num_tokens": 89713135.0, "step": 35390 }, { "entropy": 6.059642934799195, "epoch": 4.084824004616272, "grad_norm": 1.0078125, "learning_rate": 0.0003434762293613382, "loss": 5.4926, "mean_token_accuracy": 0.2180089011788368, "num_tokens": 89723910.0, "step": 35395 }, { "entropy": 6.020151519775391, "epoch": 4.085401038661281, "grad_norm": 0.8671875, "learning_rate": 0.00034343692127993995, "loss": 5.497, "mean_token_accuracy": 0.21171986311674118, "num_tokens": 89736603.0, "step": 35400 }, { "entropy": 6.010009622573852, "epoch": 4.08597807270629, "grad_norm": 0.87890625, "learning_rate": 0.0003433976108967, "loss": 5.4939, "mean_token_accuracy": 0.21410107016563415, "num_tokens": 89750203.0, "step": 35405 }, { "entropy": 6.155652093887329, "epoch": 4.086555106751298, "grad_norm": 1.03125, "learning_rate": 0.0003433582982129403, "loss": 5.5418, "mean_token_accuracy": 0.20297714471817016, "num_tokens": 89762078.0, "step": 35410 }, { "entropy": 6.025065898895264, "epoch": 4.087132140796307, "grad_norm": 1.015625, "learning_rate": 0.0003433189832299831, "loss": 5.4692, "mean_token_accuracy": 0.21612975597381592, "num_tokens": 89775421.0, "step": 35415 }, { "entropy": 6.024143171310425, "epoch": 4.087709174841316, "grad_norm": 0.96484375, "learning_rate": 0.00034327966594915096, "loss": 5.566, "mean_token_accuracy": 0.20120743811130523, "num_tokens": 89788196.0, "step": 35420 }, { "entropy": 6.135048484802246, "epoch": 4.088286208886324, "grad_norm": 0.96484375, "learning_rate": 0.00034324034637176615, "loss": 5.5526, "mean_token_accuracy": 0.20458617210388183, "num_tokens": 89800167.0, "step": 35425 }, { "entropy": 6.111774444580078, "epoch": 4.088863242931333, "grad_norm": 1.0546875, "learning_rate": 0.0003432010244991512, "loss": 5.5649, "mean_token_accuracy": 0.20744165629148484, "num_tokens": 89812102.0, "step": 35430 }, { "entropy": 6.113587760925293, "epoch": 4.089440276976342, "grad_norm": 0.94140625, "learning_rate": 0.0003431617003326286, "loss": 5.6284, "mean_token_accuracy": 0.20039559602737428, "num_tokens": 89824235.0, "step": 35435 }, { "entropy": 6.052518081665039, "epoch": 4.0900173110213505, "grad_norm": 1.0546875, "learning_rate": 0.0003431223738735211, "loss": 5.5937, "mean_token_accuracy": 0.2117765724658966, "num_tokens": 89838535.0, "step": 35440 }, { "entropy": 6.075787591934204, "epoch": 4.090594345066359, "grad_norm": 0.984375, "learning_rate": 0.0003430830451231514, "loss": 5.5976, "mean_token_accuracy": 0.20219520777463912, "num_tokens": 89851022.0, "step": 35445 }, { "entropy": 6.058403158187867, "epoch": 4.091171379111367, "grad_norm": 0.9296875, "learning_rate": 0.00034304371408284235, "loss": 5.4784, "mean_token_accuracy": 0.21215640902519226, "num_tokens": 89864466.0, "step": 35450 }, { "entropy": 6.028244543075561, "epoch": 4.091748413156377, "grad_norm": 0.9296875, "learning_rate": 0.0003430043807539167, "loss": 5.5544, "mean_token_accuracy": 0.21020198464393616, "num_tokens": 89878179.0, "step": 35455 }, { "entropy": 6.093299102783203, "epoch": 4.092325447201385, "grad_norm": 0.94140625, "learning_rate": 0.0003429650451376975, "loss": 5.5574, "mean_token_accuracy": 0.21927787661552428, "num_tokens": 89890933.0, "step": 35460 }, { "entropy": 6.146709775924682, "epoch": 4.092902481246393, "grad_norm": 0.9296875, "learning_rate": 0.00034292570723550773, "loss": 5.6325, "mean_token_accuracy": 0.20091886967420577, "num_tokens": 89903677.0, "step": 35465 }, { "entropy": 6.067857933044434, "epoch": 4.093479515291402, "grad_norm": 0.85546875, "learning_rate": 0.00034288636704867063, "loss": 5.5238, "mean_token_accuracy": 0.21076389998197556, "num_tokens": 89917550.0, "step": 35470 }, { "entropy": 5.957700872421265, "epoch": 4.094056549336411, "grad_norm": 0.98828125, "learning_rate": 0.00034284702457850917, "loss": 5.3994, "mean_token_accuracy": 0.2170511394739151, "num_tokens": 89929730.0, "step": 35475 }, { "entropy": 6.062205076217651, "epoch": 4.09463358338142, "grad_norm": 1.0, "learning_rate": 0.0003428076798263469, "loss": 5.5141, "mean_token_accuracy": 0.21333808749914168, "num_tokens": 89941644.0, "step": 35480 }, { "entropy": 6.048794794082641, "epoch": 4.095210617426428, "grad_norm": 1.078125, "learning_rate": 0.0003427683327935069, "loss": 5.4976, "mean_token_accuracy": 0.2092871129512787, "num_tokens": 89953966.0, "step": 35485 }, { "entropy": 6.052239847183228, "epoch": 4.095787651471436, "grad_norm": 0.94140625, "learning_rate": 0.00034272898348131276, "loss": 5.4875, "mean_token_accuracy": 0.20827424824237822, "num_tokens": 89967916.0, "step": 35490 }, { "entropy": 5.992624950408936, "epoch": 4.096364685516446, "grad_norm": 1.0234375, "learning_rate": 0.00034268963189108777, "loss": 5.4722, "mean_token_accuracy": 0.21729318797588348, "num_tokens": 89981901.0, "step": 35495 }, { "entropy": 6.115233325958252, "epoch": 4.096941719561454, "grad_norm": 1.078125, "learning_rate": 0.0003426502780241558, "loss": 5.5972, "mean_token_accuracy": 0.20486102253198624, "num_tokens": 89994139.0, "step": 35500 }, { "entropy": 6.049506759643554, "epoch": 4.097518753606463, "grad_norm": 0.93359375, "learning_rate": 0.00034261092188184015, "loss": 5.5207, "mean_token_accuracy": 0.21402349025011064, "num_tokens": 90007259.0, "step": 35505 }, { "entropy": 6.167341518402099, "epoch": 4.098095787651472, "grad_norm": 0.9453125, "learning_rate": 0.0003425715634654649, "loss": 5.628, "mean_token_accuracy": 0.19943179786205292, "num_tokens": 90019771.0, "step": 35510 }, { "entropy": 6.110190343856812, "epoch": 4.09867282169648, "grad_norm": 1.09375, "learning_rate": 0.0003425322027763536, "loss": 5.5744, "mean_token_accuracy": 0.21097375005483626, "num_tokens": 90032392.0, "step": 35515 }, { "entropy": 6.134899473190307, "epoch": 4.099249855741489, "grad_norm": 0.90625, "learning_rate": 0.0003424928398158301, "loss": 5.5992, "mean_token_accuracy": 0.20266730338335037, "num_tokens": 90044467.0, "step": 35520 }, { "entropy": 6.073607349395752, "epoch": 4.099826889786497, "grad_norm": 0.984375, "learning_rate": 0.0003424534745852186, "loss": 5.45, "mean_token_accuracy": 0.21179691851139068, "num_tokens": 90057554.0, "step": 35525 }, { "entropy": 5.977625894546509, "epoch": 4.100403923831506, "grad_norm": 1.171875, "learning_rate": 0.000342414107085843, "loss": 5.4596, "mean_token_accuracy": 0.2172801285982132, "num_tokens": 90070708.0, "step": 35530 }, { "entropy": 6.113221502304077, "epoch": 4.100980957876515, "grad_norm": 0.94921875, "learning_rate": 0.00034237473731902734, "loss": 5.612, "mean_token_accuracy": 0.20872834026813508, "num_tokens": 90083547.0, "step": 35535 }, { "entropy": 6.1904645442962645, "epoch": 4.101557991921523, "grad_norm": 0.94921875, "learning_rate": 0.0003423353652860959, "loss": 5.5555, "mean_token_accuracy": 0.20782464146614074, "num_tokens": 90095410.0, "step": 35540 }, { "entropy": 6.103205442428589, "epoch": 4.102135025966532, "grad_norm": 1.046875, "learning_rate": 0.0003422959909883728, "loss": 5.5731, "mean_token_accuracy": 0.2067727565765381, "num_tokens": 90107704.0, "step": 35545 }, { "entropy": 5.874544477462768, "epoch": 4.102712060011541, "grad_norm": 1.0390625, "learning_rate": 0.00034225661442718246, "loss": 5.3214, "mean_token_accuracy": 0.22959463596343993, "num_tokens": 90120941.0, "step": 35550 }, { "entropy": 6.113426160812378, "epoch": 4.103289094056549, "grad_norm": 0.93359375, "learning_rate": 0.00034221723560384944, "loss": 5.5797, "mean_token_accuracy": 0.21372756063938142, "num_tokens": 90133432.0, "step": 35555 }, { "entropy": 6.076683235168457, "epoch": 4.103866128101558, "grad_norm": 0.98828125, "learning_rate": 0.0003421778545196981, "loss": 5.5013, "mean_token_accuracy": 0.21161381751298905, "num_tokens": 90146680.0, "step": 35560 }, { "entropy": 6.081414842605591, "epoch": 4.104443162146566, "grad_norm": 0.92578125, "learning_rate": 0.0003421384711760528, "loss": 5.5812, "mean_token_accuracy": 0.2071981281042099, "num_tokens": 90159257.0, "step": 35565 }, { "entropy": 6.047891426086426, "epoch": 4.1050201961915755, "grad_norm": 0.9609375, "learning_rate": 0.00034209908557423846, "loss": 5.5274, "mean_token_accuracy": 0.2077357366681099, "num_tokens": 90172369.0, "step": 35570 }, { "entropy": 6.129982948303223, "epoch": 4.105597230236584, "grad_norm": 1.1015625, "learning_rate": 0.0003420596977155798, "loss": 5.5582, "mean_token_accuracy": 0.20510038137435913, "num_tokens": 90184840.0, "step": 35575 }, { "entropy": 6.033859348297119, "epoch": 4.106174264281592, "grad_norm": 0.94921875, "learning_rate": 0.00034202030760140144, "loss": 5.4897, "mean_token_accuracy": 0.22107934951782227, "num_tokens": 90197752.0, "step": 35580 }, { "entropy": 6.089110422134399, "epoch": 4.106751298326602, "grad_norm": 0.921875, "learning_rate": 0.00034198091523302834, "loss": 5.5947, "mean_token_accuracy": 0.20557233393192292, "num_tokens": 90211092.0, "step": 35585 }, { "entropy": 6.156796455383301, "epoch": 4.10732833237161, "grad_norm": 0.94140625, "learning_rate": 0.0003419415206117854, "loss": 5.6474, "mean_token_accuracy": 0.200355464220047, "num_tokens": 90225239.0, "step": 35590 }, { "entropy": 6.14080843925476, "epoch": 4.1079053664166185, "grad_norm": 0.96484375, "learning_rate": 0.0003419021237389977, "loss": 5.623, "mean_token_accuracy": 0.19885305762290956, "num_tokens": 90238484.0, "step": 35595 }, { "entropy": 6.035296249389648, "epoch": 4.108482400461627, "grad_norm": 1.1171875, "learning_rate": 0.00034186272461599027, "loss": 5.5225, "mean_token_accuracy": 0.20796301513910292, "num_tokens": 90249975.0, "step": 35600 }, { "entropy": 6.127810716629028, "epoch": 4.109059434506636, "grad_norm": 0.99609375, "learning_rate": 0.00034182332324408834, "loss": 5.5727, "mean_token_accuracy": 0.21209159046411513, "num_tokens": 90262647.0, "step": 35605 }, { "entropy": 6.147694396972656, "epoch": 4.109636468551645, "grad_norm": 1.375, "learning_rate": 0.00034178391962461714, "loss": 5.6069, "mean_token_accuracy": 0.20603940039873123, "num_tokens": 90276088.0, "step": 35610 }, { "entropy": 5.99590573310852, "epoch": 4.110213502596653, "grad_norm": 1.015625, "learning_rate": 0.0003417445137589019, "loss": 5.4803, "mean_token_accuracy": 0.2151528298854828, "num_tokens": 90288740.0, "step": 35615 }, { "entropy": 6.051789999008179, "epoch": 4.1107905366416615, "grad_norm": 1.0234375, "learning_rate": 0.00034170510564826816, "loss": 5.4712, "mean_token_accuracy": 0.2125127136707306, "num_tokens": 90300422.0, "step": 35620 }, { "entropy": 6.103476858139038, "epoch": 4.111367570686671, "grad_norm": 0.9765625, "learning_rate": 0.0003416656952940413, "loss": 5.5429, "mean_token_accuracy": 0.21694846749305724, "num_tokens": 90312595.0, "step": 35625 }, { "entropy": 6.040262365341187, "epoch": 4.111944604731679, "grad_norm": 0.9375, "learning_rate": 0.00034162628269754694, "loss": 5.5166, "mean_token_accuracy": 0.2167874366044998, "num_tokens": 90325404.0, "step": 35630 }, { "entropy": 6.06687331199646, "epoch": 4.112521638776688, "grad_norm": 0.96484375, "learning_rate": 0.0003415868678601106, "loss": 5.517, "mean_token_accuracy": 0.21294075548648833, "num_tokens": 90337579.0, "step": 35635 }, { "entropy": 6.069899225234986, "epoch": 4.113098672821696, "grad_norm": 1.03125, "learning_rate": 0.00034154745078305806, "loss": 5.5505, "mean_token_accuracy": 0.2093985930085182, "num_tokens": 90350535.0, "step": 35640 }, { "entropy": 6.129082679748535, "epoch": 4.113675706866705, "grad_norm": 1.0, "learning_rate": 0.000341508031467715, "loss": 5.5761, "mean_token_accuracy": 0.20228931903839112, "num_tokens": 90363635.0, "step": 35645 }, { "entropy": 6.052897357940674, "epoch": 4.114252740911714, "grad_norm": 0.91796875, "learning_rate": 0.0003414686099154074, "loss": 5.5255, "mean_token_accuracy": 0.2128541052341461, "num_tokens": 90376119.0, "step": 35650 }, { "entropy": 5.958323431015015, "epoch": 4.114829774956722, "grad_norm": 0.99609375, "learning_rate": 0.00034142918612746124, "loss": 5.3818, "mean_token_accuracy": 0.21763400137424468, "num_tokens": 90388784.0, "step": 35655 }, { "entropy": 6.111651849746704, "epoch": 4.1154068090017315, "grad_norm": 1.0078125, "learning_rate": 0.0003413897601052023, "loss": 5.6284, "mean_token_accuracy": 0.20257425010204316, "num_tokens": 90401273.0, "step": 35660 }, { "entropy": 6.10703125, "epoch": 4.11598384304674, "grad_norm": 0.91796875, "learning_rate": 0.0003413503318499566, "loss": 5.5258, "mean_token_accuracy": 0.20975951552391053, "num_tokens": 90414421.0, "step": 35665 }, { "entropy": 5.985723686218262, "epoch": 4.116560877091748, "grad_norm": 1.046875, "learning_rate": 0.00034131090136305066, "loss": 5.3852, "mean_token_accuracy": 0.22481465935707093, "num_tokens": 90427391.0, "step": 35670 }, { "entropy": 6.100257396697998, "epoch": 4.117137911136757, "grad_norm": 0.9375, "learning_rate": 0.00034127146864581045, "loss": 5.5691, "mean_token_accuracy": 0.21422185450792314, "num_tokens": 90439712.0, "step": 35675 }, { "entropy": 5.993046045303345, "epoch": 4.117714945181766, "grad_norm": 0.953125, "learning_rate": 0.00034123203369956225, "loss": 5.5111, "mean_token_accuracy": 0.21299288868904115, "num_tokens": 90452514.0, "step": 35680 }, { "entropy": 6.132471942901612, "epoch": 4.1182919792267745, "grad_norm": 0.91796875, "learning_rate": 0.00034119259652563253, "loss": 5.6189, "mean_token_accuracy": 0.2062388017773628, "num_tokens": 90465245.0, "step": 35685 }, { "entropy": 6.094356393814087, "epoch": 4.118869013271783, "grad_norm": 0.96484375, "learning_rate": 0.0003411531571253477, "loss": 5.4881, "mean_token_accuracy": 0.22057535499334335, "num_tokens": 90477747.0, "step": 35690 }, { "entropy": 6.096591854095459, "epoch": 4.119446047316791, "grad_norm": 1.015625, "learning_rate": 0.00034111371550003426, "loss": 5.525, "mean_token_accuracy": 0.20705520659685134, "num_tokens": 90489982.0, "step": 35695 }, { "entropy": 5.992465591430664, "epoch": 4.120023081361801, "grad_norm": 0.98828125, "learning_rate": 0.0003410742716510189, "loss": 5.4238, "mean_token_accuracy": 0.22328459620475768, "num_tokens": 90502336.0, "step": 35700 }, { "entropy": 6.086414861679077, "epoch": 4.120600115406809, "grad_norm": 0.93359375, "learning_rate": 0.0003410348255796282, "loss": 5.5187, "mean_token_accuracy": 0.21496592313051224, "num_tokens": 90514566.0, "step": 35705 }, { "entropy": 6.039079332351685, "epoch": 4.1211771494518175, "grad_norm": 0.96484375, "learning_rate": 0.00034099537728718893, "loss": 5.5345, "mean_token_accuracy": 0.20865318328142166, "num_tokens": 90528222.0, "step": 35710 }, { "entropy": 6.160186338424682, "epoch": 4.121754183496826, "grad_norm": 0.94140625, "learning_rate": 0.00034095592677502797, "loss": 5.5779, "mean_token_accuracy": 0.21000425815582274, "num_tokens": 90541189.0, "step": 35715 }, { "entropy": 6.082367181777954, "epoch": 4.122331217541835, "grad_norm": 1.0390625, "learning_rate": 0.00034091647404447216, "loss": 5.5384, "mean_token_accuracy": 0.21051134467124938, "num_tokens": 90555211.0, "step": 35720 }, { "entropy": 6.073507165908813, "epoch": 4.122908251586844, "grad_norm": 0.94921875, "learning_rate": 0.00034087701909684846, "loss": 5.5497, "mean_token_accuracy": 0.2095015153288841, "num_tokens": 90568117.0, "step": 35725 }, { "entropy": 5.99535722732544, "epoch": 4.123485285631852, "grad_norm": 0.91015625, "learning_rate": 0.000340837561933484, "loss": 5.449, "mean_token_accuracy": 0.21343269497156142, "num_tokens": 90582397.0, "step": 35730 }, { "entropy": 6.11025218963623, "epoch": 4.124062319676861, "grad_norm": 0.97265625, "learning_rate": 0.00034079810255570575, "loss": 5.5759, "mean_token_accuracy": 0.20200441926717758, "num_tokens": 90594878.0, "step": 35735 }, { "entropy": 6.010230922698975, "epoch": 4.12463935372187, "grad_norm": 0.96484375, "learning_rate": 0.0003407586409648411, "loss": 5.4875, "mean_token_accuracy": 0.20678807348012923, "num_tokens": 90607418.0, "step": 35740 }, { "entropy": 6.069612884521485, "epoch": 4.125216387766878, "grad_norm": 0.91015625, "learning_rate": 0.00034071917716221715, "loss": 5.5257, "mean_token_accuracy": 0.21699086278676988, "num_tokens": 90619945.0, "step": 35745 }, { "entropy": 6.015505981445313, "epoch": 4.125793421811887, "grad_norm": 0.99609375, "learning_rate": 0.0003406797111491614, "loss": 5.4706, "mean_token_accuracy": 0.22581159323453903, "num_tokens": 90633983.0, "step": 35750 }, { "entropy": 6.134730672836303, "epoch": 4.126370455856896, "grad_norm": 0.97265625, "learning_rate": 0.0003406402429270011, "loss": 5.5355, "mean_token_accuracy": 0.20724848359823228, "num_tokens": 90646773.0, "step": 35755 }, { "entropy": 6.00944676399231, "epoch": 4.126947489901904, "grad_norm": 0.98046875, "learning_rate": 0.00034060077249706397, "loss": 5.5074, "mean_token_accuracy": 0.21261016577482222, "num_tokens": 90659771.0, "step": 35760 }, { "entropy": 5.9040679931640625, "epoch": 4.127524523946913, "grad_norm": 0.98046875, "learning_rate": 0.0003405612998606774, "loss": 5.3254, "mean_token_accuracy": 0.2295476481318474, "num_tokens": 90673448.0, "step": 35765 }, { "entropy": 6.050318193435669, "epoch": 4.128101557991921, "grad_norm": 0.8828125, "learning_rate": 0.0003405218250191689, "loss": 5.53, "mean_token_accuracy": 0.20032575577497483, "num_tokens": 90686277.0, "step": 35770 }, { "entropy": 6.060693216323853, "epoch": 4.12867859203693, "grad_norm": 0.9140625, "learning_rate": 0.00034048234797386654, "loss": 5.5522, "mean_token_accuracy": 0.21081956923007966, "num_tokens": 90698793.0, "step": 35775 }, { "entropy": 6.151148748397827, "epoch": 4.129255626081939, "grad_norm": 1.0703125, "learning_rate": 0.0003404428687260979, "loss": 5.6085, "mean_token_accuracy": 0.20680249333381653, "num_tokens": 90712325.0, "step": 35780 }, { "entropy": 6.111231803894043, "epoch": 4.129832660126947, "grad_norm": 1.0078125, "learning_rate": 0.00034040338727719087, "loss": 5.5445, "mean_token_accuracy": 0.211186720430851, "num_tokens": 90724845.0, "step": 35785 }, { "entropy": 6.061575317382813, "epoch": 4.130409694171956, "grad_norm": 0.93359375, "learning_rate": 0.00034036390362847337, "loss": 5.5527, "mean_token_accuracy": 0.20894260406494142, "num_tokens": 90737136.0, "step": 35790 }, { "entropy": 6.093926000595093, "epoch": 4.130986728216965, "grad_norm": 0.96875, "learning_rate": 0.0003403244177812735, "loss": 5.531, "mean_token_accuracy": 0.21399353742599486, "num_tokens": 90749703.0, "step": 35795 }, { "entropy": 6.020750999450684, "epoch": 4.131563762261973, "grad_norm": 1.03125, "learning_rate": 0.00034028492973691923, "loss": 5.4501, "mean_token_accuracy": 0.21650319844484328, "num_tokens": 90763264.0, "step": 35800 }, { "entropy": 6.102464437484741, "epoch": 4.132140796306982, "grad_norm": 0.9453125, "learning_rate": 0.0003402454394967388, "loss": 5.629, "mean_token_accuracy": 0.20359870940446853, "num_tokens": 90775290.0, "step": 35805 }, { "entropy": 6.04753942489624, "epoch": 4.132717830351991, "grad_norm": 0.83203125, "learning_rate": 0.0003402059470620604, "loss": 5.4746, "mean_token_accuracy": 0.21019257009029388, "num_tokens": 90788765.0, "step": 35810 }, { "entropy": 6.030824041366577, "epoch": 4.133294864397, "grad_norm": 0.87890625, "learning_rate": 0.00034016645243421236, "loss": 5.4678, "mean_token_accuracy": 0.2205435112118721, "num_tokens": 90801141.0, "step": 35815 }, { "entropy": 6.14891881942749, "epoch": 4.133871898442008, "grad_norm": 0.98828125, "learning_rate": 0.0003401269556145231, "loss": 5.5944, "mean_token_accuracy": 0.20381052941083908, "num_tokens": 90813451.0, "step": 35820 }, { "entropy": 6.079682397842407, "epoch": 4.134448932487016, "grad_norm": 0.96484375, "learning_rate": 0.00034008745660432107, "loss": 5.5841, "mean_token_accuracy": 0.2068340927362442, "num_tokens": 90826283.0, "step": 35825 }, { "entropy": 6.017327165603637, "epoch": 4.135025966532026, "grad_norm": 1.046875, "learning_rate": 0.00034004795540493464, "loss": 5.3992, "mean_token_accuracy": 0.2253447636961937, "num_tokens": 90838391.0, "step": 35830 }, { "entropy": 6.088587999343872, "epoch": 4.135603000577034, "grad_norm": 1.0078125, "learning_rate": 0.00034000845201769263, "loss": 5.5711, "mean_token_accuracy": 0.21017614006996155, "num_tokens": 90850234.0, "step": 35835 }, { "entropy": 6.075516986846924, "epoch": 4.1361800346220425, "grad_norm": 0.9296875, "learning_rate": 0.0003399689464439236, "loss": 5.4644, "mean_token_accuracy": 0.21411296278238295, "num_tokens": 90862771.0, "step": 35840 }, { "entropy": 6.001401138305664, "epoch": 4.136757068667051, "grad_norm": 0.859375, "learning_rate": 0.00033992943868495635, "loss": 5.4976, "mean_token_accuracy": 0.21470560431480407, "num_tokens": 90877217.0, "step": 35845 }, { "entropy": 6.053483343124389, "epoch": 4.13733410271206, "grad_norm": 0.90234375, "learning_rate": 0.0003398899287421197, "loss": 5.5035, "mean_token_accuracy": 0.22157915383577348, "num_tokens": 90891283.0, "step": 35850 }, { "entropy": 6.114140796661377, "epoch": 4.137911136757069, "grad_norm": 0.94140625, "learning_rate": 0.0003398504166167425, "loss": 5.5392, "mean_token_accuracy": 0.2111232742667198, "num_tokens": 90902618.0, "step": 35855 }, { "entropy": 6.061532735824585, "epoch": 4.138488170802077, "grad_norm": 0.9453125, "learning_rate": 0.00033981090231015375, "loss": 5.5588, "mean_token_accuracy": 0.20485687404870986, "num_tokens": 90914711.0, "step": 35860 }, { "entropy": 5.985019636154175, "epoch": 4.139065204847086, "grad_norm": 0.9375, "learning_rate": 0.0003397713858236825, "loss": 5.5147, "mean_token_accuracy": 0.2078494518995285, "num_tokens": 90928579.0, "step": 35865 }, { "entropy": 6.08093671798706, "epoch": 4.139642238892095, "grad_norm": 0.92578125, "learning_rate": 0.00033973186715865783, "loss": 5.546, "mean_token_accuracy": 0.21357639580965043, "num_tokens": 90942196.0, "step": 35870 }, { "entropy": 6.034729242324829, "epoch": 4.140219272937103, "grad_norm": 0.90234375, "learning_rate": 0.000339692346316409, "loss": 5.4648, "mean_token_accuracy": 0.2130606696009636, "num_tokens": 90955092.0, "step": 35875 }, { "entropy": 6.035179519653321, "epoch": 4.140796306982112, "grad_norm": 0.9375, "learning_rate": 0.00033965282329826525, "loss": 5.4707, "mean_token_accuracy": 0.2174498438835144, "num_tokens": 90967887.0, "step": 35880 }, { "entropy": 6.006946420669555, "epoch": 4.141373341027121, "grad_norm": 0.921875, "learning_rate": 0.00033961329810555587, "loss": 5.484, "mean_token_accuracy": 0.21400219202041626, "num_tokens": 90980077.0, "step": 35885 }, { "entropy": 6.172068929672241, "epoch": 4.141950375072129, "grad_norm": 0.9765625, "learning_rate": 0.00033957377073961034, "loss": 5.6863, "mean_token_accuracy": 0.19841102212667466, "num_tokens": 90991544.0, "step": 35890 }, { "entropy": 6.0838698387146, "epoch": 4.142527409117138, "grad_norm": 1.015625, "learning_rate": 0.00033953424120175806, "loss": 5.5413, "mean_token_accuracy": 0.21244185715913771, "num_tokens": 91004739.0, "step": 35895 }, { "entropy": 6.018929576873779, "epoch": 4.143104443162146, "grad_norm": 0.9921875, "learning_rate": 0.00033949470949332864, "loss": 5.454, "mean_token_accuracy": 0.21465598344802855, "num_tokens": 91018090.0, "step": 35900 }, { "entropy": 5.949872636795044, "epoch": 4.1436814772071555, "grad_norm": 0.88671875, "learning_rate": 0.00033945517561565175, "loss": 5.4436, "mean_token_accuracy": 0.21365102678537368, "num_tokens": 91032294.0, "step": 35905 }, { "entropy": 6.015384149551392, "epoch": 4.144258511252164, "grad_norm": 1.1640625, "learning_rate": 0.00033941563957005705, "loss": 5.465, "mean_token_accuracy": 0.2187521368265152, "num_tokens": 91045593.0, "step": 35910 }, { "entropy": 6.03531060218811, "epoch": 4.144835545297172, "grad_norm": 0.984375, "learning_rate": 0.0003393761013578742, "loss": 5.4888, "mean_token_accuracy": 0.20976669043302537, "num_tokens": 91058163.0, "step": 35915 }, { "entropy": 6.124438714981079, "epoch": 4.145412579342181, "grad_norm": 0.91015625, "learning_rate": 0.00033933656098043325, "loss": 5.5912, "mean_token_accuracy": 0.20663621723651887, "num_tokens": 91072155.0, "step": 35920 }, { "entropy": 6.081832361221314, "epoch": 4.14598961338719, "grad_norm": 0.9453125, "learning_rate": 0.00033929701843906404, "loss": 5.5765, "mean_token_accuracy": 0.21051104217767716, "num_tokens": 91085560.0, "step": 35925 }, { "entropy": 5.946006536483765, "epoch": 4.1465666474321985, "grad_norm": 0.96484375, "learning_rate": 0.0003392574737350966, "loss": 5.4435, "mean_token_accuracy": 0.21187988370656968, "num_tokens": 91097517.0, "step": 35930 }, { "entropy": 6.138819980621338, "epoch": 4.147143681477207, "grad_norm": 0.94140625, "learning_rate": 0.00033921792686986076, "loss": 5.5822, "mean_token_accuracy": 0.20238389372825621, "num_tokens": 91109785.0, "step": 35935 }, { "entropy": 5.956558799743652, "epoch": 4.147720715522216, "grad_norm": 0.9609375, "learning_rate": 0.00033917837784468695, "loss": 5.3888, "mean_token_accuracy": 0.2254834845662117, "num_tokens": 91122610.0, "step": 35940 }, { "entropy": 6.120345258712769, "epoch": 4.148297749567225, "grad_norm": 0.87890625, "learning_rate": 0.0003391388266609052, "loss": 5.5987, "mean_token_accuracy": 0.20726500153541566, "num_tokens": 91137596.0, "step": 35945 }, { "entropy": 6.048577070236206, "epoch": 4.148874783612233, "grad_norm": 0.98046875, "learning_rate": 0.000339099273319846, "loss": 5.517, "mean_token_accuracy": 0.21385516077280045, "num_tokens": 91149240.0, "step": 35950 }, { "entropy": 6.029694271087647, "epoch": 4.1494518176572415, "grad_norm": 1.015625, "learning_rate": 0.00033905971782283964, "loss": 5.4923, "mean_token_accuracy": 0.21502895951271056, "num_tokens": 91161983.0, "step": 35955 }, { "entropy": 6.055621194839477, "epoch": 4.150028851702251, "grad_norm": 0.9921875, "learning_rate": 0.00033902016017121634, "loss": 5.5372, "mean_token_accuracy": 0.2109047681093216, "num_tokens": 91175496.0, "step": 35960 }, { "entropy": 6.112962913513184, "epoch": 4.150605885747259, "grad_norm": 0.984375, "learning_rate": 0.0003389806003663068, "loss": 5.6688, "mean_token_accuracy": 0.20245399624109267, "num_tokens": 91189208.0, "step": 35965 }, { "entropy": 6.118751001358032, "epoch": 4.151182919792268, "grad_norm": 1.03125, "learning_rate": 0.0003389410384094416, "loss": 5.5891, "mean_token_accuracy": 0.20861436426639557, "num_tokens": 91201027.0, "step": 35970 }, { "entropy": 6.089512348175049, "epoch": 4.151759953837276, "grad_norm": 0.9765625, "learning_rate": 0.0003389014743019513, "loss": 5.585, "mean_token_accuracy": 0.20493076294660567, "num_tokens": 91213380.0, "step": 35975 }, { "entropy": 6.073336219787597, "epoch": 4.152336987882285, "grad_norm": 0.9453125, "learning_rate": 0.0003388619080451666, "loss": 5.5068, "mean_token_accuracy": 0.21620817482471466, "num_tokens": 91224860.0, "step": 35980 }, { "entropy": 6.023465347290039, "epoch": 4.152914021927294, "grad_norm": 1.015625, "learning_rate": 0.00033882233964041835, "loss": 5.4973, "mean_token_accuracy": 0.21763940453529357, "num_tokens": 91236844.0, "step": 35985 }, { "entropy": 6.075516176223755, "epoch": 4.153491055972302, "grad_norm": 1.015625, "learning_rate": 0.00033878276908903756, "loss": 5.5435, "mean_token_accuracy": 0.20915375053882598, "num_tokens": 91249059.0, "step": 35990 }, { "entropy": 6.195187711715699, "epoch": 4.1540680900173115, "grad_norm": 0.99609375, "learning_rate": 0.00033874319639235487, "loss": 5.6374, "mean_token_accuracy": 0.20203358978033065, "num_tokens": 91260513.0, "step": 35995 }, { "entropy": 6.037358570098877, "epoch": 4.15464512406232, "grad_norm": 0.98046875, "learning_rate": 0.0003387036215517014, "loss": 5.4943, "mean_token_accuracy": 0.2176566556096077, "num_tokens": 91272488.0, "step": 36000 }, { "epoch": 4.15464512406232, "eval_entropy": 5.858769298853914, "eval_loss": 5.717448711395264, "eval_mean_token_accuracy": 0.20955150646684792, "eval_num_tokens": 91272488.0, "eval_runtime": 23.476, "eval_samples_per_second": 1198.499, "eval_steps_per_second": 149.812, "step": 36000 }, { "entropy": 5.978639698028564, "epoch": 4.155222158107328, "grad_norm": 1.0078125, "learning_rate": 0.0003386640445684084, "loss": 5.4509, "mean_token_accuracy": 0.21751538515090943, "num_tokens": 91284814.0, "step": 36005 }, { "entropy": 6.080470085144043, "epoch": 4.155799192152337, "grad_norm": 1.0859375, "learning_rate": 0.0003386244654438068, "loss": 5.5315, "mean_token_accuracy": 0.20885832309722902, "num_tokens": 91296635.0, "step": 36010 }, { "entropy": 6.075433397293091, "epoch": 4.156376226197346, "grad_norm": 0.8828125, "learning_rate": 0.00033858488417922794, "loss": 5.5553, "mean_token_accuracy": 0.2061830624938011, "num_tokens": 91309803.0, "step": 36015 }, { "entropy": 6.107651948928833, "epoch": 4.1569532602423545, "grad_norm": 1.015625, "learning_rate": 0.00033854530077600305, "loss": 5.6009, "mean_token_accuracy": 0.20393964797258377, "num_tokens": 91321796.0, "step": 36020 }, { "entropy": 6.129538440704346, "epoch": 4.157530294287363, "grad_norm": 1.0234375, "learning_rate": 0.00033850571523546353, "loss": 5.5566, "mean_token_accuracy": 0.2077781468629837, "num_tokens": 91334290.0, "step": 36025 }, { "entropy": 6.017099761962891, "epoch": 4.158107328332371, "grad_norm": 0.93359375, "learning_rate": 0.00033846612755894084, "loss": 5.4585, "mean_token_accuracy": 0.2182576909661293, "num_tokens": 91348226.0, "step": 36030 }, { "entropy": 6.151995658874512, "epoch": 4.158684362377381, "grad_norm": 0.96484375, "learning_rate": 0.00033842653774776647, "loss": 5.6414, "mean_token_accuracy": 0.20287489742040635, "num_tokens": 91360195.0, "step": 36035 }, { "entropy": 6.101355075836182, "epoch": 4.159261396422389, "grad_norm": 0.953125, "learning_rate": 0.00033838694580327205, "loss": 5.5066, "mean_token_accuracy": 0.21247724294662476, "num_tokens": 91373048.0, "step": 36040 }, { "entropy": 6.059773969650268, "epoch": 4.159838430467397, "grad_norm": 0.9921875, "learning_rate": 0.00033834735172678915, "loss": 5.5594, "mean_token_accuracy": 0.2153088182210922, "num_tokens": 91385801.0, "step": 36045 }, { "entropy": 6.0652406215667725, "epoch": 4.160415464512406, "grad_norm": 0.86328125, "learning_rate": 0.00033830775551964954, "loss": 5.5492, "mean_token_accuracy": 0.2091422498226166, "num_tokens": 91398803.0, "step": 36050 }, { "entropy": 6.088028192520142, "epoch": 4.160992498557415, "grad_norm": 1.0625, "learning_rate": 0.0003382681571831851, "loss": 5.5547, "mean_token_accuracy": 0.20253238677978516, "num_tokens": 91410083.0, "step": 36055 }, { "entropy": 6.1005878925323485, "epoch": 4.161569532602424, "grad_norm": 0.91015625, "learning_rate": 0.0003382285567187275, "loss": 5.5517, "mean_token_accuracy": 0.2081000491976738, "num_tokens": 91422306.0, "step": 36060 }, { "entropy": 5.976929378509522, "epoch": 4.162146566647432, "grad_norm": 0.9375, "learning_rate": 0.00033818895412760885, "loss": 5.4847, "mean_token_accuracy": 0.22056014984846115, "num_tokens": 91434108.0, "step": 36065 }, { "entropy": 6.069995403289795, "epoch": 4.162723600692441, "grad_norm": 1.0078125, "learning_rate": 0.0003381493494111612, "loss": 5.5096, "mean_token_accuracy": 0.20841262936592103, "num_tokens": 91446547.0, "step": 36070 }, { "entropy": 5.942376279830933, "epoch": 4.16330063473745, "grad_norm": 0.94921875, "learning_rate": 0.0003381097425707164, "loss": 5.3638, "mean_token_accuracy": 0.22560459226369858, "num_tokens": 91458394.0, "step": 36075 }, { "entropy": 6.0690834522247314, "epoch": 4.163877668782458, "grad_norm": 0.8828125, "learning_rate": 0.0003380701336076068, "loss": 5.5104, "mean_token_accuracy": 0.21953116357326508, "num_tokens": 91471526.0, "step": 36080 }, { "entropy": 6.041635274887085, "epoch": 4.1644547028274665, "grad_norm": 0.92578125, "learning_rate": 0.00033803052252316456, "loss": 5.5275, "mean_token_accuracy": 0.21013310849666594, "num_tokens": 91484709.0, "step": 36085 }, { "entropy": 5.935430335998535, "epoch": 4.165031736872476, "grad_norm": 1.078125, "learning_rate": 0.00033799090931872213, "loss": 5.3996, "mean_token_accuracy": 0.2252883121371269, "num_tokens": 91498405.0, "step": 36090 }, { "entropy": 6.011941194534302, "epoch": 4.165608770917484, "grad_norm": 0.9921875, "learning_rate": 0.00033795129399561167, "loss": 5.4644, "mean_token_accuracy": 0.22101012617349625, "num_tokens": 91511811.0, "step": 36095 }, { "entropy": 6.003114318847656, "epoch": 4.166185804962493, "grad_norm": 0.82421875, "learning_rate": 0.00033791167655516577, "loss": 5.5126, "mean_token_accuracy": 0.2159534603357315, "num_tokens": 91525350.0, "step": 36100 }, { "entropy": 6.008171653747558, "epoch": 4.166762839007501, "grad_norm": 0.92578125, "learning_rate": 0.00033787205699871675, "loss": 5.4591, "mean_token_accuracy": 0.21674319356679916, "num_tokens": 91539036.0, "step": 36105 }, { "entropy": 6.1081925392150875, "epoch": 4.16733987305251, "grad_norm": 1.015625, "learning_rate": 0.0003378324353275974, "loss": 5.6162, "mean_token_accuracy": 0.2078762486577034, "num_tokens": 91551188.0, "step": 36110 }, { "entropy": 6.074532175064087, "epoch": 4.167916907097519, "grad_norm": 1.0, "learning_rate": 0.00033779281154314037, "loss": 5.5102, "mean_token_accuracy": 0.21162545531988144, "num_tokens": 91563586.0, "step": 36115 }, { "entropy": 6.0588624477386475, "epoch": 4.168493941142527, "grad_norm": 0.97265625, "learning_rate": 0.00033775318564667825, "loss": 5.4547, "mean_token_accuracy": 0.22079792767763137, "num_tokens": 91575124.0, "step": 36120 }, { "entropy": 6.084282159805298, "epoch": 4.169070975187536, "grad_norm": 0.9296875, "learning_rate": 0.0003377135576395438, "loss": 5.551, "mean_token_accuracy": 0.2125624969601631, "num_tokens": 91587086.0, "step": 36125 }, { "entropy": 6.042050313949585, "epoch": 4.169648009232545, "grad_norm": 1.0078125, "learning_rate": 0.00033767392752307015, "loss": 5.4265, "mean_token_accuracy": 0.22312956303358078, "num_tokens": 91598357.0, "step": 36130 }, { "entropy": 6.016818523406982, "epoch": 4.170225043277553, "grad_norm": 0.86328125, "learning_rate": 0.00033763429529858996, "loss": 5.5073, "mean_token_accuracy": 0.21356083303689957, "num_tokens": 91612601.0, "step": 36135 }, { "entropy": 6.0931182384490965, "epoch": 4.170802077322562, "grad_norm": 0.93359375, "learning_rate": 0.00033759466096743647, "loss": 5.5235, "mean_token_accuracy": 0.2094171777367592, "num_tokens": 91625313.0, "step": 36140 }, { "entropy": 6.0659037113189695, "epoch": 4.171379111367571, "grad_norm": 0.99609375, "learning_rate": 0.00033755502453094256, "loss": 5.4995, "mean_token_accuracy": 0.21348541975021362, "num_tokens": 91638709.0, "step": 36145 }, { "entropy": 6.077402496337891, "epoch": 4.1719561454125795, "grad_norm": 1.015625, "learning_rate": 0.0003375153859904415, "loss": 5.5708, "mean_token_accuracy": 0.2069834738969803, "num_tokens": 91650860.0, "step": 36150 }, { "entropy": 6.077566528320313, "epoch": 4.172533179457588, "grad_norm": 0.94140625, "learning_rate": 0.00033747574534726655, "loss": 5.5815, "mean_token_accuracy": 0.20579287707805632, "num_tokens": 91663162.0, "step": 36155 }, { "entropy": 6.144608879089356, "epoch": 4.173110213502596, "grad_norm": 0.98828125, "learning_rate": 0.0003374361026027509, "loss": 5.5292, "mean_token_accuracy": 0.21433990746736525, "num_tokens": 91674874.0, "step": 36160 }, { "entropy": 6.0306562900543215, "epoch": 4.173687247547606, "grad_norm": 0.953125, "learning_rate": 0.0003373964577582278, "loss": 5.5631, "mean_token_accuracy": 0.2087247058749199, "num_tokens": 91687592.0, "step": 36165 }, { "entropy": 6.122583627700806, "epoch": 4.174264281592614, "grad_norm": 0.99609375, "learning_rate": 0.0003373568108150311, "loss": 5.6388, "mean_token_accuracy": 0.20406082421541213, "num_tokens": 91699406.0, "step": 36170 }, { "entropy": 6.096256923675537, "epoch": 4.1748413156376225, "grad_norm": 1.0078125, "learning_rate": 0.0003373171617744939, "loss": 5.5064, "mean_token_accuracy": 0.21386712044477463, "num_tokens": 91711664.0, "step": 36175 }, { "entropy": 5.992486524581909, "epoch": 4.175418349682631, "grad_norm": 1.0234375, "learning_rate": 0.00033727751063794987, "loss": 5.4413, "mean_token_accuracy": 0.2214311107993126, "num_tokens": 91725622.0, "step": 36180 }, { "entropy": 6.040131330490112, "epoch": 4.17599538372764, "grad_norm": 0.9296875, "learning_rate": 0.0003372378574067328, "loss": 5.4766, "mean_token_accuracy": 0.21044879108667375, "num_tokens": 91737123.0, "step": 36185 }, { "entropy": 5.953706216812134, "epoch": 4.176572417772649, "grad_norm": 0.9140625, "learning_rate": 0.0003371982020821762, "loss": 5.4445, "mean_token_accuracy": 0.21513064205646515, "num_tokens": 91749774.0, "step": 36190 }, { "entropy": 6.060849285125732, "epoch": 4.177149451817657, "grad_norm": 1.0625, "learning_rate": 0.0003371585446656141, "loss": 5.5457, "mean_token_accuracy": 0.2157866835594177, "num_tokens": 91762045.0, "step": 36195 }, { "entropy": 6.10784683227539, "epoch": 4.1777264858626655, "grad_norm": 1.015625, "learning_rate": 0.0003371188851583802, "loss": 5.5245, "mean_token_accuracy": 0.2092201367020607, "num_tokens": 91774277.0, "step": 36200 }, { "entropy": 6.055388689041138, "epoch": 4.178303519907675, "grad_norm": 0.94140625, "learning_rate": 0.0003370792235618084, "loss": 5.5769, "mean_token_accuracy": 0.20751824229955673, "num_tokens": 91786247.0, "step": 36205 }, { "entropy": 6.071255397796631, "epoch": 4.178880553952683, "grad_norm": 0.9921875, "learning_rate": 0.00033703955987723276, "loss": 5.4734, "mean_token_accuracy": 0.21457559019327163, "num_tokens": 91798964.0, "step": 36210 }, { "entropy": 5.987832403182983, "epoch": 4.179457587997692, "grad_norm": 1.0390625, "learning_rate": 0.0003369998941059874, "loss": 5.4681, "mean_token_accuracy": 0.21751263737678528, "num_tokens": 91812271.0, "step": 36215 }, { "entropy": 5.911073017120361, "epoch": 4.180034622042701, "grad_norm": 0.8984375, "learning_rate": 0.0003369602262494064, "loss": 5.4321, "mean_token_accuracy": 0.219881047308445, "num_tokens": 91826272.0, "step": 36220 }, { "entropy": 5.92738528251648, "epoch": 4.180611656087709, "grad_norm": 0.98828125, "learning_rate": 0.00033692055630882387, "loss": 5.4461, "mean_token_accuracy": 0.21457289755344391, "num_tokens": 91839012.0, "step": 36225 }, { "entropy": 6.102661943435669, "epoch": 4.181188690132718, "grad_norm": 0.8984375, "learning_rate": 0.00033688088428557425, "loss": 5.5461, "mean_token_accuracy": 0.2107859417796135, "num_tokens": 91852768.0, "step": 36230 }, { "entropy": 6.023000717163086, "epoch": 4.181765724177726, "grad_norm": 0.9453125, "learning_rate": 0.0003368412101809918, "loss": 5.5019, "mean_token_accuracy": 0.21322470605373384, "num_tokens": 91865845.0, "step": 36235 }, { "entropy": 5.92189769744873, "epoch": 4.1823427582227355, "grad_norm": 0.95703125, "learning_rate": 0.000336801533996411, "loss": 5.382, "mean_token_accuracy": 0.22423402220010757, "num_tokens": 91880151.0, "step": 36240 }, { "entropy": 6.0993907928466795, "epoch": 4.182919792267744, "grad_norm": 0.890625, "learning_rate": 0.0003367618557331663, "loss": 5.5551, "mean_token_accuracy": 0.21040874421596528, "num_tokens": 91892565.0, "step": 36245 }, { "entropy": 6.1127783298492435, "epoch": 4.183496826312752, "grad_norm": 0.9296875, "learning_rate": 0.0003367221753925922, "loss": 5.5529, "mean_token_accuracy": 0.20397200882434846, "num_tokens": 91904504.0, "step": 36250 }, { "entropy": 6.143336200714112, "epoch": 4.184073860357761, "grad_norm": 0.95703125, "learning_rate": 0.00033668249297602343, "loss": 5.535, "mean_token_accuracy": 0.20913943350315095, "num_tokens": 91916822.0, "step": 36255 }, { "entropy": 6.063420104980469, "epoch": 4.18465089440277, "grad_norm": 0.9375, "learning_rate": 0.0003366428084847947, "loss": 5.5257, "mean_token_accuracy": 0.2174711376428604, "num_tokens": 91930596.0, "step": 36260 }, { "entropy": 6.096650552749634, "epoch": 4.1852279284477785, "grad_norm": 0.93359375, "learning_rate": 0.0003366031219202406, "loss": 5.6003, "mean_token_accuracy": 0.21027973890304566, "num_tokens": 91944007.0, "step": 36265 }, { "entropy": 6.060778093338013, "epoch": 4.185804962492787, "grad_norm": 0.9296875, "learning_rate": 0.00033656343328369615, "loss": 5.4611, "mean_token_accuracy": 0.21989932805299758, "num_tokens": 91956374.0, "step": 36270 }, { "entropy": 6.046530914306641, "epoch": 4.186381996537795, "grad_norm": 0.984375, "learning_rate": 0.00033652374257649625, "loss": 5.5896, "mean_token_accuracy": 0.20774901807308196, "num_tokens": 91967768.0, "step": 36275 }, { "entropy": 6.014452075958252, "epoch": 4.186959030582805, "grad_norm": 0.92578125, "learning_rate": 0.0003364840497999759, "loss": 5.4547, "mean_token_accuracy": 0.21547582298517226, "num_tokens": 91981660.0, "step": 36280 }, { "entropy": 5.987741231918335, "epoch": 4.187536064627813, "grad_norm": 1.015625, "learning_rate": 0.00033644435495546994, "loss": 5.4055, "mean_token_accuracy": 0.22181856632232666, "num_tokens": 91994959.0, "step": 36285 }, { "entropy": 6.0608429431915285, "epoch": 4.188113098672821, "grad_norm": 0.98046875, "learning_rate": 0.00033640465804431365, "loss": 5.5555, "mean_token_accuracy": 0.20919679701328278, "num_tokens": 92007805.0, "step": 36290 }, { "entropy": 6.0707409381866455, "epoch": 4.188690132717831, "grad_norm": 0.93359375, "learning_rate": 0.0003363649590678422, "loss": 5.5156, "mean_token_accuracy": 0.21529030799865723, "num_tokens": 92020144.0, "step": 36295 }, { "entropy": 6.1062415599822994, "epoch": 4.189267166762839, "grad_norm": 1.0546875, "learning_rate": 0.00033632525802739085, "loss": 5.5759, "mean_token_accuracy": 0.20948645025491713, "num_tokens": 92033659.0, "step": 36300 }, { "entropy": 6.095681762695312, "epoch": 4.189844200807848, "grad_norm": 0.984375, "learning_rate": 0.00033628555492429485, "loss": 5.5708, "mean_token_accuracy": 0.20862073749303817, "num_tokens": 92046569.0, "step": 36305 }, { "entropy": 6.024930620193482, "epoch": 4.190421234852856, "grad_norm": 1.078125, "learning_rate": 0.00033624584975988967, "loss": 5.5196, "mean_token_accuracy": 0.21469273865222932, "num_tokens": 92059324.0, "step": 36310 }, { "entropy": 6.044795227050781, "epoch": 4.190998268897865, "grad_norm": 1.0703125, "learning_rate": 0.0003362061425355108, "loss": 5.4972, "mean_token_accuracy": 0.21813523173332214, "num_tokens": 92071971.0, "step": 36315 }, { "entropy": 6.094405221939087, "epoch": 4.191575302942874, "grad_norm": 1.0, "learning_rate": 0.0003361664332524937, "loss": 5.5328, "mean_token_accuracy": 0.21547052264213562, "num_tokens": 92083393.0, "step": 36320 }, { "entropy": 6.064061260223388, "epoch": 4.192152336987882, "grad_norm": 0.8828125, "learning_rate": 0.00033612672191217404, "loss": 5.4772, "mean_token_accuracy": 0.20958197116851807, "num_tokens": 92095321.0, "step": 36325 }, { "entropy": 6.076068639755249, "epoch": 4.192729371032891, "grad_norm": 0.9609375, "learning_rate": 0.00033608700851588737, "loss": 5.5472, "mean_token_accuracy": 0.20471175611019135, "num_tokens": 92108112.0, "step": 36330 }, { "entropy": 6.095101928710937, "epoch": 4.1933064050779, "grad_norm": 0.9296875, "learning_rate": 0.00033604729306496955, "loss": 5.6052, "mean_token_accuracy": 0.20969596952199937, "num_tokens": 92120965.0, "step": 36335 }, { "entropy": 6.094717407226563, "epoch": 4.193883439122908, "grad_norm": 1.0390625, "learning_rate": 0.0003360075755607564, "loss": 5.5452, "mean_token_accuracy": 0.2095690831542015, "num_tokens": 92132180.0, "step": 36340 }, { "entropy": 6.109365177154541, "epoch": 4.194460473167917, "grad_norm": 0.92578125, "learning_rate": 0.0003359678560045836, "loss": 5.507, "mean_token_accuracy": 0.20993925780057907, "num_tokens": 92144211.0, "step": 36345 }, { "entropy": 6.10888557434082, "epoch": 4.195037507212925, "grad_norm": 1.0234375, "learning_rate": 0.00033592813439778743, "loss": 5.4497, "mean_token_accuracy": 0.21592015624046326, "num_tokens": 92156645.0, "step": 36350 }, { "entropy": 6.038032817840576, "epoch": 4.195614541257934, "grad_norm": 0.9921875, "learning_rate": 0.0003358884107417036, "loss": 5.5118, "mean_token_accuracy": 0.2106542021036148, "num_tokens": 92170324.0, "step": 36355 }, { "entropy": 6.061372947692871, "epoch": 4.196191575302943, "grad_norm": 0.98046875, "learning_rate": 0.0003358486850376685, "loss": 5.5596, "mean_token_accuracy": 0.19926372468471526, "num_tokens": 92181691.0, "step": 36360 }, { "entropy": 6.024242639541626, "epoch": 4.196768609347951, "grad_norm": 1.046875, "learning_rate": 0.0003358089572870179, "loss": 5.4796, "mean_token_accuracy": 0.21465114504098892, "num_tokens": 92193447.0, "step": 36365 }, { "entropy": 6.091886568069458, "epoch": 4.197345643392961, "grad_norm": 0.9609375, "learning_rate": 0.0003357692274910883, "loss": 5.5216, "mean_token_accuracy": 0.21384626775979995, "num_tokens": 92206269.0, "step": 36370 }, { "entropy": 6.0934326171875, "epoch": 4.197922677437969, "grad_norm": 0.921875, "learning_rate": 0.0003357294956512159, "loss": 5.5558, "mean_token_accuracy": 0.20839828103780747, "num_tokens": 92219210.0, "step": 36375 }, { "entropy": 6.113658809661866, "epoch": 4.198499711482977, "grad_norm": 0.97265625, "learning_rate": 0.00033568976176873714, "loss": 5.5904, "mean_token_accuracy": 0.20379132628440857, "num_tokens": 92232169.0, "step": 36380 }, { "entropy": 6.113116216659546, "epoch": 4.199076745527986, "grad_norm": 0.98046875, "learning_rate": 0.0003356500258449883, "loss": 5.5544, "mean_token_accuracy": 0.20726522505283357, "num_tokens": 92245249.0, "step": 36385 }, { "entropy": 6.061218643188477, "epoch": 4.199653779572995, "grad_norm": 1.3359375, "learning_rate": 0.0003356102878813061, "loss": 5.56, "mean_token_accuracy": 0.2075910300016403, "num_tokens": 92256545.0, "step": 36390 }, { "entropy": 6.054666137695312, "epoch": 4.2002308136180035, "grad_norm": 0.9453125, "learning_rate": 0.0003355705478790268, "loss": 5.5732, "mean_token_accuracy": 0.20639955699443818, "num_tokens": 92268819.0, "step": 36395 }, { "entropy": 6.169286251068115, "epoch": 4.200807847663012, "grad_norm": 0.9921875, "learning_rate": 0.0003355308058394874, "loss": 5.6439, "mean_token_accuracy": 0.2057584270834923, "num_tokens": 92280746.0, "step": 36400 }, { "entropy": 6.145860815048218, "epoch": 4.20138488170802, "grad_norm": 1.0078125, "learning_rate": 0.00033549106176402433, "loss": 5.5736, "mean_token_accuracy": 0.20965632945299148, "num_tokens": 92293368.0, "step": 36405 }, { "entropy": 6.163086891174316, "epoch": 4.20196191575303, "grad_norm": 0.9765625, "learning_rate": 0.00033545131565397443, "loss": 5.6941, "mean_token_accuracy": 0.199113629758358, "num_tokens": 92305395.0, "step": 36410 }, { "entropy": 6.039909076690674, "epoch": 4.202538949798038, "grad_norm": 1.0390625, "learning_rate": 0.0003354115675106745, "loss": 5.4674, "mean_token_accuracy": 0.2235013023018837, "num_tokens": 92320196.0, "step": 36415 }, { "entropy": 6.049898862838745, "epoch": 4.2031159838430465, "grad_norm": 0.91796875, "learning_rate": 0.0003353718173354615, "loss": 5.5441, "mean_token_accuracy": 0.21430354863405227, "num_tokens": 92332530.0, "step": 36420 }, { "entropy": 6.104065847396851, "epoch": 4.203693017888055, "grad_norm": 0.94140625, "learning_rate": 0.0003353320651296725, "loss": 5.5714, "mean_token_accuracy": 0.21216470152139663, "num_tokens": 92343985.0, "step": 36425 }, { "entropy": 5.988610410690308, "epoch": 4.204270051933064, "grad_norm": 1.03125, "learning_rate": 0.00033529231089464445, "loss": 5.4763, "mean_token_accuracy": 0.21894935220479966, "num_tokens": 92356222.0, "step": 36430 }, { "entropy": 5.986466312408448, "epoch": 4.204847085978073, "grad_norm": 0.98046875, "learning_rate": 0.00033525255463171444, "loss": 5.4053, "mean_token_accuracy": 0.22800421565771103, "num_tokens": 92368734.0, "step": 36435 }, { "entropy": 6.037365818023682, "epoch": 4.205424120023081, "grad_norm": 1.0234375, "learning_rate": 0.00033521279634221975, "loss": 5.519, "mean_token_accuracy": 0.21274163573980331, "num_tokens": 92382360.0, "step": 36440 }, { "entropy": 6.023008537292481, "epoch": 4.20600115406809, "grad_norm": 0.94921875, "learning_rate": 0.00033517303602749747, "loss": 5.5306, "mean_token_accuracy": 0.21234100908041, "num_tokens": 92394924.0, "step": 36445 }, { "entropy": 6.060986566543579, "epoch": 4.206578188113099, "grad_norm": 0.98046875, "learning_rate": 0.00033513327368888513, "loss": 5.5807, "mean_token_accuracy": 0.2081702783703804, "num_tokens": 92407939.0, "step": 36450 }, { "entropy": 6.071784448623657, "epoch": 4.207155222158107, "grad_norm": 0.93359375, "learning_rate": 0.0003350935093277199, "loss": 5.5056, "mean_token_accuracy": 0.21452544629573822, "num_tokens": 92419528.0, "step": 36455 }, { "entropy": 6.034239482879639, "epoch": 4.207732256203116, "grad_norm": 1.046875, "learning_rate": 0.00033505374294533934, "loss": 5.4754, "mean_token_accuracy": 0.2186982214450836, "num_tokens": 92431244.0, "step": 36460 }, { "entropy": 5.965225553512573, "epoch": 4.208309290248125, "grad_norm": 1.0703125, "learning_rate": 0.00033501397454308094, "loss": 5.3508, "mean_token_accuracy": 0.2274266764521599, "num_tokens": 92444912.0, "step": 36465 }, { "entropy": 5.927420282363892, "epoch": 4.208886324293133, "grad_norm": 0.984375, "learning_rate": 0.0003349742041222824, "loss": 5.4381, "mean_token_accuracy": 0.22362808734178544, "num_tokens": 92458302.0, "step": 36470 }, { "entropy": 6.131619548797607, "epoch": 4.209463358338142, "grad_norm": 0.859375, "learning_rate": 0.0003349344316842812, "loss": 5.6113, "mean_token_accuracy": 0.2088275134563446, "num_tokens": 92470605.0, "step": 36475 }, { "entropy": 6.083338642120362, "epoch": 4.21004039238315, "grad_norm": 0.93359375, "learning_rate": 0.0003348946572304153, "loss": 5.5149, "mean_token_accuracy": 0.2127673640847206, "num_tokens": 92483139.0, "step": 36480 }, { "entropy": 6.062240028381348, "epoch": 4.2106174264281595, "grad_norm": 1.0078125, "learning_rate": 0.0003348548807620223, "loss": 5.5443, "mean_token_accuracy": 0.21471376419067384, "num_tokens": 92495334.0, "step": 36485 }, { "entropy": 6.106533813476562, "epoch": 4.211194460473168, "grad_norm": 0.984375, "learning_rate": 0.00033481510228044006, "loss": 5.6199, "mean_token_accuracy": 0.2119092807173729, "num_tokens": 92508362.0, "step": 36490 }, { "entropy": 6.065465354919434, "epoch": 4.211771494518176, "grad_norm": 1.046875, "learning_rate": 0.0003347753217870066, "loss": 5.5149, "mean_token_accuracy": 0.21460752338171005, "num_tokens": 92520869.0, "step": 36495 }, { "entropy": 5.977196121215821, "epoch": 4.212348528563186, "grad_norm": 0.96875, "learning_rate": 0.0003347355392830599, "loss": 5.4589, "mean_token_accuracy": 0.21670080870389938, "num_tokens": 92532615.0, "step": 36500 }, { "entropy": 6.0456725597381595, "epoch": 4.212925562608194, "grad_norm": 0.94140625, "learning_rate": 0.000334695754769938, "loss": 5.4946, "mean_token_accuracy": 0.22031136602163315, "num_tokens": 92544813.0, "step": 36505 }, { "entropy": 6.1500200748443605, "epoch": 4.2135025966532025, "grad_norm": 0.97265625, "learning_rate": 0.000334655968248979, "loss": 5.602, "mean_token_accuracy": 0.20118348002433778, "num_tokens": 92557256.0, "step": 36510 }, { "entropy": 6.110830974578858, "epoch": 4.214079630698211, "grad_norm": 0.90234375, "learning_rate": 0.0003346161797215211, "loss": 5.5547, "mean_token_accuracy": 0.21246470212936402, "num_tokens": 92569629.0, "step": 36515 }, { "entropy": 6.104619359970092, "epoch": 4.21465666474322, "grad_norm": 1.0390625, "learning_rate": 0.00033457638918890273, "loss": 5.561, "mean_token_accuracy": 0.210816653072834, "num_tokens": 92582543.0, "step": 36520 }, { "entropy": 6.102493762969971, "epoch": 4.215233698788229, "grad_norm": 0.9765625, "learning_rate": 0.00033453659665246205, "loss": 5.5936, "mean_token_accuracy": 0.2060997098684311, "num_tokens": 92594708.0, "step": 36525 }, { "entropy": 6.144442081451416, "epoch": 4.215810732833237, "grad_norm": 0.9375, "learning_rate": 0.00033449680211353753, "loss": 5.5695, "mean_token_accuracy": 0.20857217460870742, "num_tokens": 92607430.0, "step": 36530 }, { "entropy": 6.041609287261963, "epoch": 4.2163877668782455, "grad_norm": 1.0625, "learning_rate": 0.00033445700557346766, "loss": 5.4364, "mean_token_accuracy": 0.2212654948234558, "num_tokens": 92618919.0, "step": 36535 }, { "entropy": 6.048991060256958, "epoch": 4.216964800923255, "grad_norm": 1.09375, "learning_rate": 0.0003344172070335908, "loss": 5.5685, "mean_token_accuracy": 0.2035675898194313, "num_tokens": 92630092.0, "step": 36540 }, { "entropy": 6.154643964767456, "epoch": 4.217541834968263, "grad_norm": 0.96875, "learning_rate": 0.00033437740649524584, "loss": 5.6238, "mean_token_accuracy": 0.2028792291879654, "num_tokens": 92642108.0, "step": 36545 }, { "entropy": 6.219081830978394, "epoch": 4.218118869013272, "grad_norm": 0.96875, "learning_rate": 0.0003343376039597712, "loss": 5.6485, "mean_token_accuracy": 0.2034117251634598, "num_tokens": 92653662.0, "step": 36550 }, { "entropy": 6.084265661239624, "epoch": 4.21869590305828, "grad_norm": 0.96875, "learning_rate": 0.0003342977994285058, "loss": 5.4962, "mean_token_accuracy": 0.21776273250579833, "num_tokens": 92665899.0, "step": 36555 }, { "entropy": 6.046296310424805, "epoch": 4.219272937103289, "grad_norm": 0.96875, "learning_rate": 0.0003342579929027883, "loss": 5.5022, "mean_token_accuracy": 0.21380335986614227, "num_tokens": 92677475.0, "step": 36560 }, { "entropy": 6.15334997177124, "epoch": 4.219849971148298, "grad_norm": 1.03125, "learning_rate": 0.0003342181843839578, "loss": 5.5629, "mean_token_accuracy": 0.21173277050256728, "num_tokens": 92690629.0, "step": 36565 }, { "entropy": 6.116700792312622, "epoch": 4.220427005193306, "grad_norm": 1.0546875, "learning_rate": 0.00033417837387335293, "loss": 5.5598, "mean_token_accuracy": 0.20802867859601976, "num_tokens": 92702274.0, "step": 36570 }, { "entropy": 6.059780836105347, "epoch": 4.2210040392383155, "grad_norm": 0.96875, "learning_rate": 0.0003341385613723129, "loss": 5.5397, "mean_token_accuracy": 0.20720929503440857, "num_tokens": 92715779.0, "step": 36575 }, { "entropy": 6.0751426219940186, "epoch": 4.221581073283324, "grad_norm": 1.2890625, "learning_rate": 0.00033409874688217667, "loss": 5.5522, "mean_token_accuracy": 0.211833356320858, "num_tokens": 92727316.0, "step": 36580 }, { "entropy": 6.0430460453033445, "epoch": 4.222158107328332, "grad_norm": 0.9296875, "learning_rate": 0.0003340589304042836, "loss": 5.5333, "mean_token_accuracy": 0.21074459999799727, "num_tokens": 92741004.0, "step": 36585 }, { "entropy": 6.153020763397217, "epoch": 4.222735141373341, "grad_norm": 0.87890625, "learning_rate": 0.00033401911193997266, "loss": 5.6303, "mean_token_accuracy": 0.19995790719985962, "num_tokens": 92754748.0, "step": 36590 }, { "entropy": 6.20211763381958, "epoch": 4.22331217541835, "grad_norm": 0.9140625, "learning_rate": 0.00033397929149058317, "loss": 5.6376, "mean_token_accuracy": 0.2024789646267891, "num_tokens": 92766697.0, "step": 36595 }, { "entropy": 6.103918027877808, "epoch": 4.223889209463358, "grad_norm": 0.93359375, "learning_rate": 0.00033393946905745456, "loss": 5.5413, "mean_token_accuracy": 0.21390598863363267, "num_tokens": 92779283.0, "step": 36600 }, { "entropy": 6.045347070693969, "epoch": 4.224466243508367, "grad_norm": 0.9609375, "learning_rate": 0.0003338996446419261, "loss": 5.5728, "mean_token_accuracy": 0.2157061830163002, "num_tokens": 92792454.0, "step": 36605 }, { "entropy": 6.013524293899536, "epoch": 4.225043277553375, "grad_norm": 0.9765625, "learning_rate": 0.00033385981824533747, "loss": 5.5023, "mean_token_accuracy": 0.21211120933294297, "num_tokens": 92804446.0, "step": 36610 }, { "entropy": 6.01087760925293, "epoch": 4.225620311598385, "grad_norm": 0.99609375, "learning_rate": 0.000333819989869028, "loss": 5.4885, "mean_token_accuracy": 0.20864471644163132, "num_tokens": 92817719.0, "step": 36615 }, { "entropy": 6.026328897476196, "epoch": 4.226197345643393, "grad_norm": 1.0078125, "learning_rate": 0.0003337801595143374, "loss": 5.4778, "mean_token_accuracy": 0.21421949714422225, "num_tokens": 92830224.0, "step": 36620 }, { "entropy": 6.086988019943237, "epoch": 4.226774379688401, "grad_norm": 1.0546875, "learning_rate": 0.00033374032718260535, "loss": 5.6056, "mean_token_accuracy": 0.2036181226372719, "num_tokens": 92841349.0, "step": 36625 }, { "entropy": 6.104330730438233, "epoch": 4.227351413733411, "grad_norm": 1.0390625, "learning_rate": 0.0003337004928751716, "loss": 5.5096, "mean_token_accuracy": 0.21468435525894164, "num_tokens": 92853713.0, "step": 36630 }, { "entropy": 6.043995904922485, "epoch": 4.227928447778419, "grad_norm": 0.97265625, "learning_rate": 0.00033366065659337586, "loss": 5.4671, "mean_token_accuracy": 0.21673654168844222, "num_tokens": 92865767.0, "step": 36635 }, { "entropy": 6.025083875656128, "epoch": 4.228505481823428, "grad_norm": 0.9921875, "learning_rate": 0.0003336208183385581, "loss": 5.4773, "mean_token_accuracy": 0.21581257581710817, "num_tokens": 92878487.0, "step": 36640 }, { "entropy": 6.000425386428833, "epoch": 4.229082515868436, "grad_norm": 1.0703125, "learning_rate": 0.0003335809781120583, "loss": 5.4712, "mean_token_accuracy": 0.2150888293981552, "num_tokens": 92890515.0, "step": 36645 }, { "entropy": 6.124005365371704, "epoch": 4.229659549913445, "grad_norm": 1.0234375, "learning_rate": 0.0003335411359152163, "loss": 5.6558, "mean_token_accuracy": 0.20216683000326158, "num_tokens": 92902313.0, "step": 36650 }, { "entropy": 5.906117630004883, "epoch": 4.230236583958454, "grad_norm": 1.0234375, "learning_rate": 0.00033350129174937237, "loss": 5.3512, "mean_token_accuracy": 0.23351780623197554, "num_tokens": 92915419.0, "step": 36655 }, { "entropy": 5.958498239517212, "epoch": 4.230813618003462, "grad_norm": 0.98828125, "learning_rate": 0.0003334614456158665, "loss": 5.447, "mean_token_accuracy": 0.2175373911857605, "num_tokens": 92927631.0, "step": 36660 }, { "entropy": 6.165533971786499, "epoch": 4.2313906520484705, "grad_norm": 0.98828125, "learning_rate": 0.00033342159751603896, "loss": 5.6076, "mean_token_accuracy": 0.20217154771089554, "num_tokens": 92940312.0, "step": 36665 }, { "entropy": 6.154601144790649, "epoch": 4.23196768609348, "grad_norm": 0.96484375, "learning_rate": 0.00033338174745123003, "loss": 5.5302, "mean_token_accuracy": 0.21061812490224838, "num_tokens": 92953103.0, "step": 36670 }, { "entropy": 6.135361814498902, "epoch": 4.232544720138488, "grad_norm": 0.90234375, "learning_rate": 0.00033334189542277994, "loss": 5.6492, "mean_token_accuracy": 0.20071909427642823, "num_tokens": 92967033.0, "step": 36675 }, { "entropy": 6.062571287155151, "epoch": 4.233121754183497, "grad_norm": 0.9453125, "learning_rate": 0.00033330204143202925, "loss": 5.6108, "mean_token_accuracy": 0.2030896618962288, "num_tokens": 92978840.0, "step": 36680 }, { "entropy": 5.999409532546997, "epoch": 4.233698788228505, "grad_norm": 0.90625, "learning_rate": 0.0003332621854803183, "loss": 5.407, "mean_token_accuracy": 0.22284828275442123, "num_tokens": 92991370.0, "step": 36685 }, { "entropy": 6.072699642181396, "epoch": 4.234275822273514, "grad_norm": 0.93359375, "learning_rate": 0.0003332223275689877, "loss": 5.4929, "mean_token_accuracy": 0.2187053382396698, "num_tokens": 93004744.0, "step": 36690 }, { "entropy": 6.136489057540894, "epoch": 4.234852856318523, "grad_norm": 0.890625, "learning_rate": 0.0003331824676993781, "loss": 5.5942, "mean_token_accuracy": 0.20887219458818435, "num_tokens": 93018395.0, "step": 36695 }, { "entropy": 6.07927885055542, "epoch": 4.235429890363531, "grad_norm": 1.0, "learning_rate": 0.00033314260587283, "loss": 5.5265, "mean_token_accuracy": 0.21734849065542222, "num_tokens": 93030912.0, "step": 36700 }, { "entropy": 6.0258125305175785, "epoch": 4.2360069244085405, "grad_norm": 1.046875, "learning_rate": 0.0003331027420906843, "loss": 5.5189, "mean_token_accuracy": 0.2087923526763916, "num_tokens": 93043439.0, "step": 36705 }, { "entropy": 6.119767808914185, "epoch": 4.236583958453549, "grad_norm": 0.921875, "learning_rate": 0.00033306287635428175, "loss": 5.5733, "mean_token_accuracy": 0.20359193831682204, "num_tokens": 93055803.0, "step": 36710 }, { "entropy": 6.054043531417847, "epoch": 4.237160992498557, "grad_norm": 1.0, "learning_rate": 0.0003330230086649631, "loss": 5.5695, "mean_token_accuracy": 0.2102679044008255, "num_tokens": 93068495.0, "step": 36715 }, { "entropy": 5.954505348205567, "epoch": 4.237738026543566, "grad_norm": 0.96484375, "learning_rate": 0.00033298313902406946, "loss": 5.3865, "mean_token_accuracy": 0.22322705388069153, "num_tokens": 93082406.0, "step": 36720 }, { "entropy": 6.086103057861328, "epoch": 4.238315060588575, "grad_norm": 1.0390625, "learning_rate": 0.00033294326743294166, "loss": 5.4831, "mean_token_accuracy": 0.21080585569143295, "num_tokens": 93094606.0, "step": 36725 }, { "entropy": 6.086388778686524, "epoch": 4.2388920946335835, "grad_norm": 0.953125, "learning_rate": 0.0003329033938929209, "loss": 5.5468, "mean_token_accuracy": 0.2204357847571373, "num_tokens": 93107389.0, "step": 36730 }, { "entropy": 6.087401294708252, "epoch": 4.239469128678592, "grad_norm": 0.91796875, "learning_rate": 0.00033286351840534835, "loss": 5.4878, "mean_token_accuracy": 0.2128287747502327, "num_tokens": 93119022.0, "step": 36735 }, { "entropy": 6.032084798812866, "epoch": 4.2400461627236, "grad_norm": 1.2265625, "learning_rate": 0.00033282364097156494, "loss": 5.4722, "mean_token_accuracy": 0.21232181191444396, "num_tokens": 93132636.0, "step": 36740 }, { "entropy": 6.060864877700806, "epoch": 4.24062319676861, "grad_norm": 0.96484375, "learning_rate": 0.0003327837615929121, "loss": 5.4977, "mean_token_accuracy": 0.21614027321338652, "num_tokens": 93145454.0, "step": 36745 }, { "entropy": 6.120479774475098, "epoch": 4.241200230813618, "grad_norm": 0.921875, "learning_rate": 0.00033274388027073123, "loss": 5.5736, "mean_token_accuracy": 0.20774539709091186, "num_tokens": 93158465.0, "step": 36750 }, { "entropy": 6.056994533538818, "epoch": 4.2417772648586265, "grad_norm": 0.9453125, "learning_rate": 0.00033270399700636354, "loss": 5.5093, "mean_token_accuracy": 0.2096223771572113, "num_tokens": 93171285.0, "step": 36755 }, { "entropy": 6.1011322975158695, "epoch": 4.242354298903635, "grad_norm": 1.0078125, "learning_rate": 0.0003326641118011506, "loss": 5.5567, "mean_token_accuracy": 0.20576124340295793, "num_tokens": 93182402.0, "step": 36760 }, { "entropy": 6.051559972763061, "epoch": 4.242931332948644, "grad_norm": 0.97265625, "learning_rate": 0.000332624224656434, "loss": 5.5538, "mean_token_accuracy": 0.21190761774778366, "num_tokens": 93194719.0, "step": 36765 }, { "entropy": 6.116247129440308, "epoch": 4.243508366993653, "grad_norm": 0.99609375, "learning_rate": 0.0003325843355735551, "loss": 5.5583, "mean_token_accuracy": 0.20830961614847182, "num_tokens": 93207246.0, "step": 36770 }, { "entropy": 6.14764633178711, "epoch": 4.244085401038661, "grad_norm": 0.88671875, "learning_rate": 0.00033254444455385574, "loss": 5.5905, "mean_token_accuracy": 0.2091515764594078, "num_tokens": 93219838.0, "step": 36775 }, { "entropy": 6.14138970375061, "epoch": 4.24466243508367, "grad_norm": 1.0703125, "learning_rate": 0.00033250455159867755, "loss": 5.647, "mean_token_accuracy": 0.2065313458442688, "num_tokens": 93231690.0, "step": 36780 }, { "entropy": 6.070845460891723, "epoch": 4.245239469128679, "grad_norm": 1.0546875, "learning_rate": 0.0003324646567093624, "loss": 5.5388, "mean_token_accuracy": 0.21307261288166046, "num_tokens": 93245489.0, "step": 36785 }, { "entropy": 6.175360441207886, "epoch": 4.245816503173687, "grad_norm": 0.97265625, "learning_rate": 0.0003324247598872519, "loss": 5.6603, "mean_token_accuracy": 0.20349411368370057, "num_tokens": 93258532.0, "step": 36790 }, { "entropy": 6.025357055664062, "epoch": 4.246393537218696, "grad_norm": 0.8828125, "learning_rate": 0.00033238486113368825, "loss": 5.4999, "mean_token_accuracy": 0.21715618371963502, "num_tokens": 93271176.0, "step": 36795 }, { "entropy": 6.035335350036621, "epoch": 4.246970571263705, "grad_norm": 0.984375, "learning_rate": 0.0003323449604500133, "loss": 5.5176, "mean_token_accuracy": 0.2138695552945137, "num_tokens": 93282476.0, "step": 36800 }, { "entropy": 6.027915573120117, "epoch": 4.247547605308713, "grad_norm": 1.03125, "learning_rate": 0.000332305057837569, "loss": 5.4676, "mean_token_accuracy": 0.21152154803276063, "num_tokens": 93294597.0, "step": 36805 }, { "entropy": 6.145900249481201, "epoch": 4.248124639353722, "grad_norm": 1.0078125, "learning_rate": 0.0003322651532976976, "loss": 5.5399, "mean_token_accuracy": 0.20556803196668624, "num_tokens": 93305324.0, "step": 36810 }, { "entropy": 5.961233520507813, "epoch": 4.24870167339873, "grad_norm": 0.88671875, "learning_rate": 0.00033222524683174126, "loss": 5.4928, "mean_token_accuracy": 0.21724716573953629, "num_tokens": 93319856.0, "step": 36815 }, { "entropy": 6.082091474533081, "epoch": 4.2492787074437395, "grad_norm": 1.0234375, "learning_rate": 0.00033218533844104215, "loss": 5.51, "mean_token_accuracy": 0.21420908868312835, "num_tokens": 93331965.0, "step": 36820 }, { "entropy": 5.999950170516968, "epoch": 4.249855741488748, "grad_norm": 1.0078125, "learning_rate": 0.0003321454281269426, "loss": 5.4852, "mean_token_accuracy": 0.20520174205303193, "num_tokens": 93344293.0, "step": 36825 }, { "entropy": 5.913121223449707, "epoch": 4.250432775533756, "grad_norm": 1.0078125, "learning_rate": 0.0003321055158907849, "loss": 5.3519, "mean_token_accuracy": 0.2235862523317337, "num_tokens": 93356959.0, "step": 36830 }, { "entropy": 6.064392614364624, "epoch": 4.251009809578765, "grad_norm": 0.97265625, "learning_rate": 0.0003320656017339116, "loss": 5.5388, "mean_token_accuracy": 0.2102576643228531, "num_tokens": 93370810.0, "step": 36835 }, { "entropy": 6.074534559249878, "epoch": 4.251586843623774, "grad_norm": 0.953125, "learning_rate": 0.0003320256856576651, "loss": 5.5458, "mean_token_accuracy": 0.21450243890285492, "num_tokens": 93383100.0, "step": 36840 }, { "entropy": 6.088781833648682, "epoch": 4.2521638776687825, "grad_norm": 0.98046875, "learning_rate": 0.000331985767663388, "loss": 5.5655, "mean_token_accuracy": 0.20969249159097672, "num_tokens": 93396091.0, "step": 36845 }, { "entropy": 6.115301942825317, "epoch": 4.252740911713791, "grad_norm": 0.97265625, "learning_rate": 0.00033194584775242294, "loss": 5.5624, "mean_token_accuracy": 0.2136012688279152, "num_tokens": 93409658.0, "step": 36850 }, { "entropy": 6.0740166187286375, "epoch": 4.2533179457588, "grad_norm": 0.8828125, "learning_rate": 0.00033190592592611254, "loss": 5.4885, "mean_token_accuracy": 0.2175256922841072, "num_tokens": 93420865.0, "step": 36855 }, { "entropy": 6.0554931640625, "epoch": 4.253894979803809, "grad_norm": 0.90234375, "learning_rate": 0.0003318660021857996, "loss": 5.5076, "mean_token_accuracy": 0.21305003017187119, "num_tokens": 93432995.0, "step": 36860 }, { "entropy": 6.118357181549072, "epoch": 4.254472013848817, "grad_norm": 0.90625, "learning_rate": 0.0003318260765328269, "loss": 5.6151, "mean_token_accuracy": 0.2058679550886154, "num_tokens": 93445463.0, "step": 36865 }, { "entropy": 6.068684053421021, "epoch": 4.255049047893825, "grad_norm": 0.984375, "learning_rate": 0.00033178614896853736, "loss": 5.5317, "mean_token_accuracy": 0.20980582684278487, "num_tokens": 93458153.0, "step": 36870 }, { "entropy": 6.075751638412475, "epoch": 4.255626081938835, "grad_norm": 1.0859375, "learning_rate": 0.0003317462194942739, "loss": 5.4812, "mean_token_accuracy": 0.21523391753435134, "num_tokens": 93470800.0, "step": 36875 }, { "entropy": 6.078428554534912, "epoch": 4.256203115983843, "grad_norm": 1.09375, "learning_rate": 0.00033170628811137956, "loss": 5.555, "mean_token_accuracy": 0.206775526702404, "num_tokens": 93483960.0, "step": 36880 }, { "entropy": 5.962617826461792, "epoch": 4.256780150028852, "grad_norm": 0.9375, "learning_rate": 0.0003316663548211973, "loss": 5.464, "mean_token_accuracy": 0.22148096412420273, "num_tokens": 93497583.0, "step": 36885 }, { "entropy": 6.092488098144531, "epoch": 4.25735718407386, "grad_norm": 0.9375, "learning_rate": 0.00033162641962507044, "loss": 5.5205, "mean_token_accuracy": 0.21008556187152863, "num_tokens": 93510009.0, "step": 36890 }, { "entropy": 6.0640229225158695, "epoch": 4.257934218118869, "grad_norm": 0.92578125, "learning_rate": 0.000331586482524342, "loss": 5.5107, "mean_token_accuracy": 0.2138819396495819, "num_tokens": 93522928.0, "step": 36895 }, { "entropy": 6.037232398986816, "epoch": 4.258511252163878, "grad_norm": 0.94921875, "learning_rate": 0.00033154654352035546, "loss": 5.4735, "mean_token_accuracy": 0.22069062441587448, "num_tokens": 93536092.0, "step": 36900 }, { "entropy": 6.097039747238159, "epoch": 4.259088286208886, "grad_norm": 0.953125, "learning_rate": 0.0003315066026144539, "loss": 5.6105, "mean_token_accuracy": 0.20378256738185882, "num_tokens": 93550257.0, "step": 36905 }, { "entropy": 6.082575845718384, "epoch": 4.2596653202538945, "grad_norm": 0.98828125, "learning_rate": 0.0003314666598079809, "loss": 5.5744, "mean_token_accuracy": 0.20678354501724244, "num_tokens": 93562603.0, "step": 36910 }, { "entropy": 6.015063047409058, "epoch": 4.260242354298904, "grad_norm": 0.98828125, "learning_rate": 0.0003314267151022798, "loss": 5.4917, "mean_token_accuracy": 0.2138369455933571, "num_tokens": 93574888.0, "step": 36915 }, { "entropy": 6.097263336181641, "epoch": 4.260819388343912, "grad_norm": 0.99609375, "learning_rate": 0.0003313867684986942, "loss": 5.5081, "mean_token_accuracy": 0.21456323117017745, "num_tokens": 93588471.0, "step": 36920 }, { "entropy": 5.952257871627808, "epoch": 4.261396422388921, "grad_norm": 0.92578125, "learning_rate": 0.00033134681999856763, "loss": 5.4884, "mean_token_accuracy": 0.21704992204904555, "num_tokens": 93601292.0, "step": 36925 }, { "entropy": 6.0868504524230955, "epoch": 4.26197345643393, "grad_norm": 0.9296875, "learning_rate": 0.0003313068696032438, "loss": 5.5075, "mean_token_accuracy": 0.21078077107667922, "num_tokens": 93613495.0, "step": 36930 }, { "entropy": 6.040879726409912, "epoch": 4.262550490478938, "grad_norm": 0.859375, "learning_rate": 0.00033126691731406627, "loss": 5.4756, "mean_token_accuracy": 0.20989009588956833, "num_tokens": 93626961.0, "step": 36935 }, { "entropy": 6.091657638549805, "epoch": 4.263127524523947, "grad_norm": 1.0, "learning_rate": 0.000331226963132379, "loss": 5.6326, "mean_token_accuracy": 0.21292945146560668, "num_tokens": 93640268.0, "step": 36940 }, { "entropy": 5.944855117797852, "epoch": 4.263704558568955, "grad_norm": 0.95703125, "learning_rate": 0.00033118700705952575, "loss": 5.4868, "mean_token_accuracy": 0.21734652817249298, "num_tokens": 93653224.0, "step": 36945 }, { "entropy": 6.086842107772827, "epoch": 4.2642815926139646, "grad_norm": 0.953125, "learning_rate": 0.00033114704909685045, "loss": 5.5676, "mean_token_accuracy": 0.20482129603624344, "num_tokens": 93665986.0, "step": 36950 }, { "entropy": 6.149227237701416, "epoch": 4.264858626658973, "grad_norm": 0.9453125, "learning_rate": 0.000331107089245697, "loss": 5.5039, "mean_token_accuracy": 0.2117534503340721, "num_tokens": 93677353.0, "step": 36955 }, { "entropy": 6.113183879852295, "epoch": 4.265435660703981, "grad_norm": 0.93359375, "learning_rate": 0.00033106712750740946, "loss": 5.6199, "mean_token_accuracy": 0.19657696187496185, "num_tokens": 93690115.0, "step": 36960 }, { "entropy": 6.13093409538269, "epoch": 4.26601269474899, "grad_norm": 0.96484375, "learning_rate": 0.000331027163883332, "loss": 5.5835, "mean_token_accuracy": 0.21113261431455613, "num_tokens": 93703101.0, "step": 36965 }, { "entropy": 6.088113117218017, "epoch": 4.266589728793999, "grad_norm": 0.96875, "learning_rate": 0.00033098719837480875, "loss": 5.5843, "mean_token_accuracy": 0.2116773709654808, "num_tokens": 93715846.0, "step": 36970 }, { "entropy": 5.979647922515869, "epoch": 4.2671667628390075, "grad_norm": 0.890625, "learning_rate": 0.00033094723098318375, "loss": 5.4267, "mean_token_accuracy": 0.2239473730325699, "num_tokens": 93728678.0, "step": 36975 }, { "entropy": 6.024152231216431, "epoch": 4.267743796884016, "grad_norm": 1.0703125, "learning_rate": 0.00033090726170980153, "loss": 5.526, "mean_token_accuracy": 0.21221805214881898, "num_tokens": 93740189.0, "step": 36980 }, { "entropy": 6.0541150093078615, "epoch": 4.268320830929024, "grad_norm": 0.97265625, "learning_rate": 0.00033086729055600627, "loss": 5.5646, "mean_token_accuracy": 0.21142414063215256, "num_tokens": 93753292.0, "step": 36985 }, { "entropy": 6.075201845169067, "epoch": 4.268897864974034, "grad_norm": 0.95703125, "learning_rate": 0.0003308273175231425, "loss": 5.4829, "mean_token_accuracy": 0.215493343770504, "num_tokens": 93765732.0, "step": 36990 }, { "entropy": 6.039456129074097, "epoch": 4.269474899019042, "grad_norm": 1.0078125, "learning_rate": 0.0003307873426125546, "loss": 5.5046, "mean_token_accuracy": 0.21588677316904067, "num_tokens": 93777372.0, "step": 36995 }, { "entropy": 6.061505937576294, "epoch": 4.2700519330640505, "grad_norm": 1.0078125, "learning_rate": 0.0003307473658255871, "loss": 5.5285, "mean_token_accuracy": 0.20815494805574417, "num_tokens": 93790537.0, "step": 37000 }, { "entropy": 6.118732738494873, "epoch": 4.27062896710906, "grad_norm": 0.88671875, "learning_rate": 0.00033070738716358474, "loss": 5.5863, "mean_token_accuracy": 0.20679013282060624, "num_tokens": 93803374.0, "step": 37005 }, { "entropy": 6.105179262161255, "epoch": 4.271206001154068, "grad_norm": 0.94140625, "learning_rate": 0.0003306674066278921, "loss": 5.5664, "mean_token_accuracy": 0.2113454282283783, "num_tokens": 93815289.0, "step": 37010 }, { "entropy": 6.068741369247436, "epoch": 4.271783035199077, "grad_norm": 0.9453125, "learning_rate": 0.00033062742421985375, "loss": 5.5883, "mean_token_accuracy": 0.20627841353416443, "num_tokens": 93828313.0, "step": 37015 }, { "entropy": 6.086719226837158, "epoch": 4.272360069244085, "grad_norm": 0.97265625, "learning_rate": 0.00033058743994081476, "loss": 5.54, "mean_token_accuracy": 0.21010360717773438, "num_tokens": 93842322.0, "step": 37020 }, { "entropy": 6.039522695541382, "epoch": 4.272937103289094, "grad_norm": 0.8828125, "learning_rate": 0.00033054745379211976, "loss": 5.502, "mean_token_accuracy": 0.21405955404043198, "num_tokens": 93855661.0, "step": 37025 }, { "entropy": 6.038384532928466, "epoch": 4.273514137334103, "grad_norm": 1.0078125, "learning_rate": 0.00033050746577511375, "loss": 5.4888, "mean_token_accuracy": 0.21556802839040756, "num_tokens": 93867319.0, "step": 37030 }, { "entropy": 6.121209049224854, "epoch": 4.274091171379111, "grad_norm": 1.0078125, "learning_rate": 0.0003304674758911417, "loss": 5.6246, "mean_token_accuracy": 0.2007503941655159, "num_tokens": 93879868.0, "step": 37035 }, { "entropy": 6.130085563659668, "epoch": 4.27466820542412, "grad_norm": 1.0, "learning_rate": 0.0003304274841415487, "loss": 5.5391, "mean_token_accuracy": 0.21511986702680588, "num_tokens": 93892312.0, "step": 37040 }, { "entropy": 6.008040237426758, "epoch": 4.275245239469129, "grad_norm": 0.9921875, "learning_rate": 0.00033038749052767975, "loss": 5.497, "mean_token_accuracy": 0.21065040826797485, "num_tokens": 93905465.0, "step": 37045 }, { "entropy": 6.016496658325195, "epoch": 4.275822273514137, "grad_norm": 0.90234375, "learning_rate": 0.00033034749505088005, "loss": 5.5083, "mean_token_accuracy": 0.21184003353118896, "num_tokens": 93917777.0, "step": 37050 }, { "entropy": 6.104601287841797, "epoch": 4.276399307559146, "grad_norm": 1.0390625, "learning_rate": 0.000330307497712495, "loss": 5.5522, "mean_token_accuracy": 0.20863109678030015, "num_tokens": 93931029.0, "step": 37055 }, { "entropy": 6.069776439666748, "epoch": 4.276976341604154, "grad_norm": 0.9140625, "learning_rate": 0.0003302674985138695, "loss": 5.529, "mean_token_accuracy": 0.21211292147636412, "num_tokens": 93944443.0, "step": 37060 }, { "entropy": 6.115158033370972, "epoch": 4.2775533756491635, "grad_norm": 0.98046875, "learning_rate": 0.00033022749745634933, "loss": 5.6339, "mean_token_accuracy": 0.20906228125095366, "num_tokens": 93956793.0, "step": 37065 }, { "entropy": 6.147492408752441, "epoch": 4.278130409694172, "grad_norm": 0.9453125, "learning_rate": 0.00033018749454127963, "loss": 5.5958, "mean_token_accuracy": 0.20936065018177033, "num_tokens": 93969635.0, "step": 37070 }, { "entropy": 6.094863986968994, "epoch": 4.27870744373918, "grad_norm": 0.98828125, "learning_rate": 0.00033014748977000595, "loss": 5.6128, "mean_token_accuracy": 0.210265588760376, "num_tokens": 93982360.0, "step": 37075 }, { "entropy": 6.153415584564209, "epoch": 4.27928447778419, "grad_norm": 0.9296875, "learning_rate": 0.00033010748314387387, "loss": 5.5754, "mean_token_accuracy": 0.21480638682842254, "num_tokens": 93995760.0, "step": 37080 }, { "entropy": 6.15511794090271, "epoch": 4.279861511829198, "grad_norm": 1.03125, "learning_rate": 0.000330067474664229, "loss": 5.5941, "mean_token_accuracy": 0.2037149429321289, "num_tokens": 94009560.0, "step": 37085 }, { "entropy": 6.0596918106079105, "epoch": 4.2804385458742065, "grad_norm": 0.91796875, "learning_rate": 0.0003300274643324169, "loss": 5.5223, "mean_token_accuracy": 0.21079382300376892, "num_tokens": 94022122.0, "step": 37090 }, { "entropy": 5.946433782577515, "epoch": 4.281015579919215, "grad_norm": 1.0703125, "learning_rate": 0.00032998745214978344, "loss": 5.4367, "mean_token_accuracy": 0.2178565517067909, "num_tokens": 94034393.0, "step": 37095 }, { "entropy": 6.020993375778199, "epoch": 4.281592613964224, "grad_norm": 1.0078125, "learning_rate": 0.0003299474381176743, "loss": 5.4577, "mean_token_accuracy": 0.2173493206501007, "num_tokens": 94046464.0, "step": 37100 }, { "entropy": 6.124178123474121, "epoch": 4.282169648009233, "grad_norm": 1.109375, "learning_rate": 0.00032990742223743544, "loss": 5.5954, "mean_token_accuracy": 0.2051453560590744, "num_tokens": 94058494.0, "step": 37105 }, { "entropy": 6.102830600738526, "epoch": 4.282746682054241, "grad_norm": 1.109375, "learning_rate": 0.0003298674045104126, "loss": 5.6093, "mean_token_accuracy": 0.20323268622159957, "num_tokens": 94071755.0, "step": 37110 }, { "entropy": 6.143615055084228, "epoch": 4.2833237160992494, "grad_norm": 1.15625, "learning_rate": 0.00032982738493795194, "loss": 5.5293, "mean_token_accuracy": 0.20884324014186859, "num_tokens": 94084888.0, "step": 37115 }, { "entropy": 6.062659025192261, "epoch": 4.283900750144259, "grad_norm": 0.9375, "learning_rate": 0.00032978736352139935, "loss": 5.5911, "mean_token_accuracy": 0.2056392550468445, "num_tokens": 94098799.0, "step": 37120 }, { "entropy": 6.085668992996216, "epoch": 4.284477784189267, "grad_norm": 1.0859375, "learning_rate": 0.0003297473402621011, "loss": 5.5559, "mean_token_accuracy": 0.2036893054842949, "num_tokens": 94112690.0, "step": 37125 }, { "entropy": 6.110815191268921, "epoch": 4.285054818234276, "grad_norm": 0.953125, "learning_rate": 0.0003297073151614032, "loss": 5.5993, "mean_token_accuracy": 0.20985495299100876, "num_tokens": 94125788.0, "step": 37130 }, { "entropy": 6.124050903320312, "epoch": 4.285631852279285, "grad_norm": 1.0, "learning_rate": 0.00032966728822065195, "loss": 5.5508, "mean_token_accuracy": 0.20489866137504578, "num_tokens": 94138310.0, "step": 37135 }, { "entropy": 6.0855231285095215, "epoch": 4.286208886324293, "grad_norm": 0.93359375, "learning_rate": 0.0003296272594411936, "loss": 5.5575, "mean_token_accuracy": 0.20213690102100373, "num_tokens": 94151475.0, "step": 37140 }, { "entropy": 6.08251256942749, "epoch": 4.286785920369302, "grad_norm": 0.8828125, "learning_rate": 0.0003295872288243745, "loss": 5.5885, "mean_token_accuracy": 0.20802915543317796, "num_tokens": 94164049.0, "step": 37145 }, { "entropy": 5.946686315536499, "epoch": 4.28736295441431, "grad_norm": 0.97265625, "learning_rate": 0.00032954719637154107, "loss": 5.4234, "mean_token_accuracy": 0.21805307120084763, "num_tokens": 94176006.0, "step": 37150 }, { "entropy": 6.0492674827575685, "epoch": 4.2879399884593195, "grad_norm": 1.0078125, "learning_rate": 0.0003295071620840398, "loss": 5.5318, "mean_token_accuracy": 0.21225418746471406, "num_tokens": 94188855.0, "step": 37155 }, { "entropy": 5.979133796691895, "epoch": 4.288517022504328, "grad_norm": 1.0625, "learning_rate": 0.0003294671259632172, "loss": 5.4774, "mean_token_accuracy": 0.21421956568956374, "num_tokens": 94202089.0, "step": 37160 }, { "entropy": 6.073222255706787, "epoch": 4.289094056549336, "grad_norm": 0.953125, "learning_rate": 0.00032942708801041994, "loss": 5.5408, "mean_token_accuracy": 0.21121585071086885, "num_tokens": 94215378.0, "step": 37165 }, { "entropy": 6.028712320327759, "epoch": 4.289671090594345, "grad_norm": 1.03125, "learning_rate": 0.00032938704822699455, "loss": 5.4492, "mean_token_accuracy": 0.2216843456029892, "num_tokens": 94227652.0, "step": 37170 }, { "entropy": 6.114678382873535, "epoch": 4.290248124639354, "grad_norm": 0.90625, "learning_rate": 0.0003293470066142878, "loss": 5.5362, "mean_token_accuracy": 0.20887450724840165, "num_tokens": 94239978.0, "step": 37175 }, { "entropy": 6.079232168197632, "epoch": 4.290825158684362, "grad_norm": 0.953125, "learning_rate": 0.0003293069631736465, "loss": 5.6049, "mean_token_accuracy": 0.20437259674072267, "num_tokens": 94252363.0, "step": 37180 }, { "entropy": 6.061615753173828, "epoch": 4.291402192729371, "grad_norm": 1.0234375, "learning_rate": 0.0003292669179064174, "loss": 5.528, "mean_token_accuracy": 0.20877125561237336, "num_tokens": 94264691.0, "step": 37185 }, { "entropy": 6.1360156536102295, "epoch": 4.29197922677438, "grad_norm": 0.95703125, "learning_rate": 0.0003292268708139476, "loss": 5.5541, "mean_token_accuracy": 0.20805031061172485, "num_tokens": 94276744.0, "step": 37190 }, { "entropy": 6.102462482452393, "epoch": 4.292556260819389, "grad_norm": 0.96484375, "learning_rate": 0.0003291868218975839, "loss": 5.563, "mean_token_accuracy": 0.20221893787384032, "num_tokens": 94289094.0, "step": 37195 }, { "entropy": 6.03277177810669, "epoch": 4.293133294864397, "grad_norm": 0.96875, "learning_rate": 0.0003291467711586733, "loss": 5.4851, "mean_token_accuracy": 0.2170744374394417, "num_tokens": 94301607.0, "step": 37200 }, { "entropy": 6.071797323226929, "epoch": 4.293710328909405, "grad_norm": 1.0078125, "learning_rate": 0.00032910671859856294, "loss": 5.5604, "mean_token_accuracy": 0.2095652401447296, "num_tokens": 94314749.0, "step": 37205 }, { "entropy": 6.036343193054199, "epoch": 4.294287362954415, "grad_norm": 0.96875, "learning_rate": 0.0003290666642186, "loss": 5.4826, "mean_token_accuracy": 0.2189536601305008, "num_tokens": 94327445.0, "step": 37210 }, { "entropy": 5.964126253128052, "epoch": 4.294864396999423, "grad_norm": 1.203125, "learning_rate": 0.0003290266080201318, "loss": 5.395, "mean_token_accuracy": 0.21892424821853637, "num_tokens": 94340299.0, "step": 37215 }, { "entropy": 6.016927480697632, "epoch": 4.2954414310444315, "grad_norm": 1.09375, "learning_rate": 0.0003289865500045053, "loss": 5.4236, "mean_token_accuracy": 0.21890969574451447, "num_tokens": 94353102.0, "step": 37220 }, { "entropy": 6.126763248443604, "epoch": 4.29601846508944, "grad_norm": 0.92578125, "learning_rate": 0.00032894649017306803, "loss": 5.5541, "mean_token_accuracy": 0.21068424880504608, "num_tokens": 94365325.0, "step": 37225 }, { "entropy": 6.10079345703125, "epoch": 4.296595499134449, "grad_norm": 1.0078125, "learning_rate": 0.00032890642852716743, "loss": 5.4988, "mean_token_accuracy": 0.20940596610307693, "num_tokens": 94376978.0, "step": 37230 }, { "entropy": 5.94501485824585, "epoch": 4.297172533179458, "grad_norm": 0.9375, "learning_rate": 0.0003288663650681508, "loss": 5.3932, "mean_token_accuracy": 0.22746245563030243, "num_tokens": 94390088.0, "step": 37235 }, { "entropy": 6.073201036453247, "epoch": 4.297749567224466, "grad_norm": 0.9375, "learning_rate": 0.00032882629979736586, "loss": 5.5832, "mean_token_accuracy": 0.2104768618941307, "num_tokens": 94403042.0, "step": 37240 }, { "entropy": 6.044022703170777, "epoch": 4.2983266012694745, "grad_norm": 0.97265625, "learning_rate": 0.00032878623271616, "loss": 5.5016, "mean_token_accuracy": 0.2118683859705925, "num_tokens": 94415026.0, "step": 37245 }, { "entropy": 6.0431571960449215, "epoch": 4.298903635314484, "grad_norm": 0.91796875, "learning_rate": 0.00032874616382588085, "loss": 5.5231, "mean_token_accuracy": 0.21760049909353257, "num_tokens": 94427626.0, "step": 37250 }, { "entropy": 6.123611545562744, "epoch": 4.299480669359492, "grad_norm": 1.0234375, "learning_rate": 0.00032870609312787624, "loss": 5.5756, "mean_token_accuracy": 0.20616432279348373, "num_tokens": 94439680.0, "step": 37255 }, { "entropy": 6.015365028381348, "epoch": 4.300057703404501, "grad_norm": 1.0546875, "learning_rate": 0.0003286660206234939, "loss": 5.3759, "mean_token_accuracy": 0.22906897366046905, "num_tokens": 94451479.0, "step": 37260 }, { "entropy": 6.056613206863403, "epoch": 4.30063473744951, "grad_norm": 1.03125, "learning_rate": 0.0003286259463140816, "loss": 5.546, "mean_token_accuracy": 0.2036583825945854, "num_tokens": 94463944.0, "step": 37265 }, { "entropy": 6.016312980651856, "epoch": 4.301211771494518, "grad_norm": 0.87890625, "learning_rate": 0.0003285858702009871, "loss": 5.4819, "mean_token_accuracy": 0.21575609296560289, "num_tokens": 94477758.0, "step": 37270 }, { "entropy": 6.045917320251465, "epoch": 4.301788805539527, "grad_norm": 0.99609375, "learning_rate": 0.00032854579228555863, "loss": 5.4702, "mean_token_accuracy": 0.21647740304470062, "num_tokens": 94489882.0, "step": 37275 }, { "entropy": 6.086464548110962, "epoch": 4.302365839584535, "grad_norm": 0.99609375, "learning_rate": 0.00032850571256914403, "loss": 5.5655, "mean_token_accuracy": 0.20549890398979187, "num_tokens": 94502617.0, "step": 37280 }, { "entropy": 5.99830732345581, "epoch": 4.3029428736295445, "grad_norm": 0.91796875, "learning_rate": 0.00032846563105309135, "loss": 5.5654, "mean_token_accuracy": 0.20827167779207229, "num_tokens": 94516178.0, "step": 37285 }, { "entropy": 6.055520153045654, "epoch": 4.303519907674553, "grad_norm": 0.93359375, "learning_rate": 0.00032842554773874865, "loss": 5.4718, "mean_token_accuracy": 0.21731895655393602, "num_tokens": 94527690.0, "step": 37290 }, { "entropy": 6.126521015167237, "epoch": 4.304096941719561, "grad_norm": 0.9296875, "learning_rate": 0.0003283854626274642, "loss": 5.6047, "mean_token_accuracy": 0.20535658448934554, "num_tokens": 94539464.0, "step": 37295 }, { "entropy": 6.153177499771118, "epoch": 4.30467397576457, "grad_norm": 0.90625, "learning_rate": 0.00032834537572058633, "loss": 5.5725, "mean_token_accuracy": 0.20498090088367463, "num_tokens": 94551898.0, "step": 37300 }, { "entropy": 6.116275978088379, "epoch": 4.305251009809579, "grad_norm": 0.89453125, "learning_rate": 0.0003283052870194632, "loss": 5.5894, "mean_token_accuracy": 0.20348978489637376, "num_tokens": 94564416.0, "step": 37305 }, { "entropy": 6.052024602890015, "epoch": 4.3058280438545875, "grad_norm": 1.0078125, "learning_rate": 0.00032826519652544317, "loss": 5.5283, "mean_token_accuracy": 0.21288257241249084, "num_tokens": 94576638.0, "step": 37310 }, { "entropy": 6.108341884613037, "epoch": 4.306405077899596, "grad_norm": 0.98828125, "learning_rate": 0.00032822510423987473, "loss": 5.574, "mean_token_accuracy": 0.21100868731737138, "num_tokens": 94588454.0, "step": 37315 }, { "entropy": 6.106811285018921, "epoch": 4.306982111944604, "grad_norm": 1.0, "learning_rate": 0.00032818501016410636, "loss": 5.5495, "mean_token_accuracy": 0.21424442231655122, "num_tokens": 94601052.0, "step": 37320 }, { "entropy": 6.128977060317993, "epoch": 4.307559145989614, "grad_norm": 0.93359375, "learning_rate": 0.0003281449142994867, "loss": 5.6175, "mean_token_accuracy": 0.19523419439792633, "num_tokens": 94612953.0, "step": 37325 }, { "entropy": 6.07106499671936, "epoch": 4.308136180034622, "grad_norm": 0.9453125, "learning_rate": 0.00032810481664736406, "loss": 5.5481, "mean_token_accuracy": 0.20889983475208282, "num_tokens": 94625666.0, "step": 37330 }, { "entropy": 6.078600883483887, "epoch": 4.3087132140796305, "grad_norm": 0.9765625, "learning_rate": 0.00032806471720908735, "loss": 5.5551, "mean_token_accuracy": 0.21396995186805726, "num_tokens": 94637575.0, "step": 37335 }, { "entropy": 6.02612624168396, "epoch": 4.30929024812464, "grad_norm": 1.1796875, "learning_rate": 0.0003280246159860053, "loss": 5.4859, "mean_token_accuracy": 0.21429236829280854, "num_tokens": 94650551.0, "step": 37340 }, { "entropy": 6.056289434432983, "epoch": 4.309867282169648, "grad_norm": 0.9765625, "learning_rate": 0.0003279845129794666, "loss": 5.5169, "mean_token_accuracy": 0.21121500581502914, "num_tokens": 94662398.0, "step": 37345 }, { "entropy": 6.129547834396362, "epoch": 4.310444316214657, "grad_norm": 0.921875, "learning_rate": 0.00032794440819082006, "loss": 5.5435, "mean_token_accuracy": 0.20888321995735168, "num_tokens": 94675477.0, "step": 37350 }, { "entropy": 6.129523658752442, "epoch": 4.311021350259665, "grad_norm": 1.0390625, "learning_rate": 0.0003279043016214147, "loss": 5.573, "mean_token_accuracy": 0.20681553930044175, "num_tokens": 94688151.0, "step": 37355 }, { "entropy": 6.052450513839721, "epoch": 4.311598384304674, "grad_norm": 1.0078125, "learning_rate": 0.00032786419327259945, "loss": 5.4959, "mean_token_accuracy": 0.21740474551916122, "num_tokens": 94700147.0, "step": 37360 }, { "entropy": 6.087112283706665, "epoch": 4.312175418349683, "grad_norm": 0.92578125, "learning_rate": 0.0003278240831457234, "loss": 5.572, "mean_token_accuracy": 0.20994939059019088, "num_tokens": 94712809.0, "step": 37365 }, { "entropy": 6.102428579330445, "epoch": 4.312752452394691, "grad_norm": 0.94140625, "learning_rate": 0.0003277839712421354, "loss": 5.5566, "mean_token_accuracy": 0.20368150621652603, "num_tokens": 94725538.0, "step": 37370 }, { "entropy": 6.052475547790527, "epoch": 4.3133294864397, "grad_norm": 0.9375, "learning_rate": 0.00032774385756318477, "loss": 5.4931, "mean_token_accuracy": 0.20910515785217285, "num_tokens": 94739577.0, "step": 37375 }, { "entropy": 6.084396171569824, "epoch": 4.313906520484709, "grad_norm": 1.03125, "learning_rate": 0.00032770374211022076, "loss": 5.5507, "mean_token_accuracy": 0.20866205245256425, "num_tokens": 94750378.0, "step": 37380 }, { "entropy": 6.076275110244751, "epoch": 4.314483554529717, "grad_norm": 0.9609375, "learning_rate": 0.00032766362488459254, "loss": 5.4887, "mean_token_accuracy": 0.21786177009344102, "num_tokens": 94762587.0, "step": 37385 }, { "entropy": 6.073229837417602, "epoch": 4.315060588574726, "grad_norm": 0.97265625, "learning_rate": 0.0003276235058876494, "loss": 5.4965, "mean_token_accuracy": 0.210693921148777, "num_tokens": 94775063.0, "step": 37390 }, { "entropy": 5.964566421508789, "epoch": 4.315637622619734, "grad_norm": 0.95703125, "learning_rate": 0.00032758338512074085, "loss": 5.4678, "mean_token_accuracy": 0.21732085794210435, "num_tokens": 94786743.0, "step": 37395 }, { "entropy": 6.070464944839477, "epoch": 4.3162146566647435, "grad_norm": 0.9609375, "learning_rate": 0.0003275432625852163, "loss": 5.5527, "mean_token_accuracy": 0.20926856398582458, "num_tokens": 94798811.0, "step": 37400 }, { "entropy": 5.931460523605347, "epoch": 4.316791690709752, "grad_norm": 1.0, "learning_rate": 0.0003275031382824251, "loss": 5.449, "mean_token_accuracy": 0.2196829542517662, "num_tokens": 94811908.0, "step": 37405 }, { "entropy": 6.103973007202148, "epoch": 4.31736872475476, "grad_norm": 1.015625, "learning_rate": 0.0003274630122137169, "loss": 5.5701, "mean_token_accuracy": 0.2101457953453064, "num_tokens": 94825533.0, "step": 37410 }, { "entropy": 6.026005268096924, "epoch": 4.31794575879977, "grad_norm": 1.0078125, "learning_rate": 0.0003274228843804415, "loss": 5.5175, "mean_token_accuracy": 0.2105269104242325, "num_tokens": 94837424.0, "step": 37415 }, { "entropy": 6.0348903179168705, "epoch": 4.318522792844778, "grad_norm": 1.0234375, "learning_rate": 0.00032738275478394837, "loss": 5.4989, "mean_token_accuracy": 0.21298986226320266, "num_tokens": 94851058.0, "step": 37420 }, { "entropy": 6.1331987380981445, "epoch": 4.319099826889786, "grad_norm": 1.0, "learning_rate": 0.00032734262342558725, "loss": 5.609, "mean_token_accuracy": 0.20900993943214416, "num_tokens": 94864389.0, "step": 37425 }, { "entropy": 6.045484399795532, "epoch": 4.319676860934795, "grad_norm": 0.9765625, "learning_rate": 0.000327302490306708, "loss": 5.4505, "mean_token_accuracy": 0.2170125037431717, "num_tokens": 94876384.0, "step": 37430 }, { "entropy": 6.065686511993408, "epoch": 4.320253894979804, "grad_norm": 0.98046875, "learning_rate": 0.00032726235542866045, "loss": 5.5227, "mean_token_accuracy": 0.21027269959449768, "num_tokens": 94888238.0, "step": 37435 }, { "entropy": 6.0775025367736815, "epoch": 4.320830929024813, "grad_norm": 0.921875, "learning_rate": 0.00032722221879279454, "loss": 5.5496, "mean_token_accuracy": 0.21131379008293152, "num_tokens": 94901263.0, "step": 37440 }, { "entropy": 6.073624801635742, "epoch": 4.321407963069821, "grad_norm": 0.9140625, "learning_rate": 0.00032718208040046035, "loss": 5.5098, "mean_token_accuracy": 0.21032853722572326, "num_tokens": 94914794.0, "step": 37445 }, { "entropy": 6.043347644805908, "epoch": 4.321984997114829, "grad_norm": 0.99609375, "learning_rate": 0.0003271419402530077, "loss": 5.5043, "mean_token_accuracy": 0.20913120806217195, "num_tokens": 94927636.0, "step": 37450 }, { "entropy": 6.103030443191528, "epoch": 4.322562031159839, "grad_norm": 0.89453125, "learning_rate": 0.00032710179835178675, "loss": 5.5876, "mean_token_accuracy": 0.20516337752342223, "num_tokens": 94941329.0, "step": 37455 }, { "entropy": 6.13333215713501, "epoch": 4.323139065204847, "grad_norm": 0.96484375, "learning_rate": 0.00032706165469814787, "loss": 5.6193, "mean_token_accuracy": 0.20392811000347139, "num_tokens": 94954275.0, "step": 37460 }, { "entropy": 6.04155387878418, "epoch": 4.323716099249856, "grad_norm": 0.91015625, "learning_rate": 0.00032702150929344096, "loss": 5.5158, "mean_token_accuracy": 0.21225043386220932, "num_tokens": 94966509.0, "step": 37465 }, { "entropy": 6.032373428344727, "epoch": 4.324293133294864, "grad_norm": 0.921875, "learning_rate": 0.0003269813621390164, "loss": 5.4367, "mean_token_accuracy": 0.21376957297325133, "num_tokens": 94978818.0, "step": 37470 }, { "entropy": 6.028779745101929, "epoch": 4.324870167339873, "grad_norm": 1.0390625, "learning_rate": 0.00032694121323622455, "loss": 5.4517, "mean_token_accuracy": 0.21804199367761612, "num_tokens": 94991577.0, "step": 37475 }, { "entropy": 6.089264726638794, "epoch": 4.325447201384882, "grad_norm": 1.1640625, "learning_rate": 0.00032690106258641586, "loss": 5.6616, "mean_token_accuracy": 0.20593415647745134, "num_tokens": 95004242.0, "step": 37480 }, { "entropy": 6.0682073593139645, "epoch": 4.32602423542989, "grad_norm": 1.0078125, "learning_rate": 0.00032686091019094074, "loss": 5.4848, "mean_token_accuracy": 0.21447964906692504, "num_tokens": 95016673.0, "step": 37485 }, { "entropy": 6.104940938949585, "epoch": 4.326601269474899, "grad_norm": 0.9375, "learning_rate": 0.0003268207560511496, "loss": 5.5943, "mean_token_accuracy": 0.2044106036424637, "num_tokens": 95028453.0, "step": 37490 }, { "entropy": 5.995596551895142, "epoch": 4.327178303519908, "grad_norm": 0.953125, "learning_rate": 0.00032678060016839305, "loss": 5.4838, "mean_token_accuracy": 0.22168498933315278, "num_tokens": 95042668.0, "step": 37495 }, { "entropy": 6.06745228767395, "epoch": 4.327755337564916, "grad_norm": 1.0390625, "learning_rate": 0.0003267404425440217, "loss": 5.4872, "mean_token_accuracy": 0.21586869657039642, "num_tokens": 95053495.0, "step": 37500 }, { "entropy": 6.064965915679932, "epoch": 4.328332371609925, "grad_norm": 0.9765625, "learning_rate": 0.00032670028317938643, "loss": 5.5101, "mean_token_accuracy": 0.21433160305023194, "num_tokens": 95065992.0, "step": 37505 }, { "entropy": 6.019883632659912, "epoch": 4.328909405654934, "grad_norm": 1.0546875, "learning_rate": 0.0003266601220758377, "loss": 5.5106, "mean_token_accuracy": 0.2149416223168373, "num_tokens": 95078884.0, "step": 37510 }, { "entropy": 6.074158620834351, "epoch": 4.329486439699942, "grad_norm": 1.0234375, "learning_rate": 0.0003266199592347264, "loss": 5.5069, "mean_token_accuracy": 0.2107894629240036, "num_tokens": 95090487.0, "step": 37515 }, { "entropy": 6.084133529663086, "epoch": 4.330063473744951, "grad_norm": 1.015625, "learning_rate": 0.0003265797946574035, "loss": 5.5994, "mean_token_accuracy": 0.20072934329509734, "num_tokens": 95102842.0, "step": 37520 }, { "entropy": 6.150358629226685, "epoch": 4.330640507789959, "grad_norm": 0.96875, "learning_rate": 0.0003265396283452198, "loss": 5.5881, "mean_token_accuracy": 0.20757602751255036, "num_tokens": 95114523.0, "step": 37525 }, { "entropy": 6.012509536743164, "epoch": 4.3312175418349685, "grad_norm": 0.93359375, "learning_rate": 0.0003264994602995263, "loss": 5.4371, "mean_token_accuracy": 0.22838186472654343, "num_tokens": 95127370.0, "step": 37530 }, { "entropy": 6.0408416271209715, "epoch": 4.331794575879977, "grad_norm": 0.98046875, "learning_rate": 0.000326459290521674, "loss": 5.5972, "mean_token_accuracy": 0.2083314284682274, "num_tokens": 95139543.0, "step": 37535 }, { "entropy": 6.137928915023804, "epoch": 4.332371609924985, "grad_norm": 0.921875, "learning_rate": 0.00032641911901301406, "loss": 5.5842, "mean_token_accuracy": 0.20809554010629655, "num_tokens": 95151837.0, "step": 37540 }, { "entropy": 6.0659466743469235, "epoch": 4.332948643969994, "grad_norm": 0.890625, "learning_rate": 0.0003263789457748976, "loss": 5.4716, "mean_token_accuracy": 0.21733748465776442, "num_tokens": 95165188.0, "step": 37545 }, { "entropy": 6.115704154968261, "epoch": 4.333525678015003, "grad_norm": 1.015625, "learning_rate": 0.00032633877080867575, "loss": 5.5571, "mean_token_accuracy": 0.2118029475212097, "num_tokens": 95178311.0, "step": 37550 }, { "entropy": 6.044954442977906, "epoch": 4.3341027120600115, "grad_norm": 0.9375, "learning_rate": 0.00032629859411569987, "loss": 5.4755, "mean_token_accuracy": 0.2190798595547676, "num_tokens": 95191078.0, "step": 37555 }, { "entropy": 6.052467632293701, "epoch": 4.33467974610502, "grad_norm": 0.95703125, "learning_rate": 0.0003262584156973213, "loss": 5.5035, "mean_token_accuracy": 0.21078290045261383, "num_tokens": 95205222.0, "step": 37560 }, { "entropy": 5.990278816223144, "epoch": 4.335256780150029, "grad_norm": 0.83203125, "learning_rate": 0.0003262182355548913, "loss": 5.4387, "mean_token_accuracy": 0.2187832310795784, "num_tokens": 95218754.0, "step": 37565 }, { "entropy": 6.042447710037232, "epoch": 4.335833814195038, "grad_norm": 0.9921875, "learning_rate": 0.0003261780536897615, "loss": 5.5031, "mean_token_accuracy": 0.2175952523946762, "num_tokens": 95232786.0, "step": 37570 }, { "entropy": 6.132240724563599, "epoch": 4.336410848240046, "grad_norm": 1.0234375, "learning_rate": 0.00032613787010328326, "loss": 5.565, "mean_token_accuracy": 0.20693478137254714, "num_tokens": 95245100.0, "step": 37575 }, { "entropy": 6.020465230941772, "epoch": 4.3369878822850545, "grad_norm": 1.09375, "learning_rate": 0.0003260976847968081, "loss": 5.5096, "mean_token_accuracy": 0.21758360415697098, "num_tokens": 95257161.0, "step": 37580 }, { "entropy": 6.042992639541626, "epoch": 4.337564916330064, "grad_norm": 1.0234375, "learning_rate": 0.00032605749777168773, "loss": 5.4845, "mean_token_accuracy": 0.21659012734889985, "num_tokens": 95269453.0, "step": 37585 }, { "entropy": 6.132225418090821, "epoch": 4.338141950375072, "grad_norm": 0.89453125, "learning_rate": 0.0003260173090292738, "loss": 5.5932, "mean_token_accuracy": 0.20707600563764572, "num_tokens": 95282496.0, "step": 37590 }, { "entropy": 6.075981950759887, "epoch": 4.338718984420081, "grad_norm": 0.95703125, "learning_rate": 0.000325977118570918, "loss": 5.5628, "mean_token_accuracy": 0.2111838400363922, "num_tokens": 95295747.0, "step": 37595 }, { "entropy": 6.119698333740234, "epoch": 4.339296018465089, "grad_norm": 0.953125, "learning_rate": 0.00032593692639797215, "loss": 5.5387, "mean_token_accuracy": 0.2100005567073822, "num_tokens": 95307568.0, "step": 37600 }, { "entropy": 5.99921875, "epoch": 4.339873052510098, "grad_norm": 0.87890625, "learning_rate": 0.0003258967325117881, "loss": 5.4744, "mean_token_accuracy": 0.2237042099237442, "num_tokens": 95320988.0, "step": 37605 }, { "entropy": 6.082865810394287, "epoch": 4.340450086555107, "grad_norm": 0.98828125, "learning_rate": 0.00032585653691371777, "loss": 5.5275, "mean_token_accuracy": 0.21049854159355164, "num_tokens": 95334606.0, "step": 37610 }, { "entropy": 6.121924543380738, "epoch": 4.341027120600115, "grad_norm": 0.99609375, "learning_rate": 0.00032581633960511295, "loss": 5.5383, "mean_token_accuracy": 0.20518902093172073, "num_tokens": 95346421.0, "step": 37615 }, { "entropy": 6.167167091369629, "epoch": 4.341604154645124, "grad_norm": 0.9765625, "learning_rate": 0.0003257761405873259, "loss": 5.5941, "mean_token_accuracy": 0.20753082036972045, "num_tokens": 95360052.0, "step": 37620 }, { "entropy": 6.095099592208863, "epoch": 4.342181188690133, "grad_norm": 0.96875, "learning_rate": 0.00032573593986170854, "loss": 5.5704, "mean_token_accuracy": 0.2097340151667595, "num_tokens": 95373290.0, "step": 37625 }, { "entropy": 6.0287370681762695, "epoch": 4.342758222735141, "grad_norm": 0.90234375, "learning_rate": 0.000325695737429613, "loss": 5.4569, "mean_token_accuracy": 0.2172936052083969, "num_tokens": 95385278.0, "step": 37630 }, { "entropy": 6.121437311172485, "epoch": 4.34333525678015, "grad_norm": 0.984375, "learning_rate": 0.00032565553329239164, "loss": 5.574, "mean_token_accuracy": 0.21242649257183074, "num_tokens": 95398012.0, "step": 37635 }, { "entropy": 6.110891342163086, "epoch": 4.343912290825159, "grad_norm": 0.9375, "learning_rate": 0.0003256153274513964, "loss": 5.5289, "mean_token_accuracy": 0.21502980589866638, "num_tokens": 95411172.0, "step": 37640 }, { "entropy": 5.982211256027222, "epoch": 4.3444893248701675, "grad_norm": 0.96484375, "learning_rate": 0.0003255751199079799, "loss": 5.4508, "mean_token_accuracy": 0.22060692608356475, "num_tokens": 95423025.0, "step": 37645 }, { "entropy": 6.051953506469727, "epoch": 4.345066358915176, "grad_norm": 1.0546875, "learning_rate": 0.0003255349106634943, "loss": 5.5126, "mean_token_accuracy": 0.21430380195379256, "num_tokens": 95435111.0, "step": 37650 }, { "entropy": 6.029353332519531, "epoch": 4.345643392960184, "grad_norm": 0.9453125, "learning_rate": 0.0003254946997192922, "loss": 5.4873, "mean_token_accuracy": 0.21657829582691193, "num_tokens": 95448047.0, "step": 37655 }, { "entropy": 6.0411865234375, "epoch": 4.346220427005194, "grad_norm": 0.9296875, "learning_rate": 0.0003254544870767259, "loss": 5.4748, "mean_token_accuracy": 0.2143942892551422, "num_tokens": 95459806.0, "step": 37660 }, { "entropy": 6.038434934616089, "epoch": 4.346797461050202, "grad_norm": 1.015625, "learning_rate": 0.0003254142727371479, "loss": 5.5186, "mean_token_accuracy": 0.20796762257814408, "num_tokens": 95471759.0, "step": 37665 }, { "entropy": 6.034385538101196, "epoch": 4.3473744950952105, "grad_norm": 0.99609375, "learning_rate": 0.0003253740567019109, "loss": 5.5043, "mean_token_accuracy": 0.21245481818914413, "num_tokens": 95483371.0, "step": 37670 }, { "entropy": 6.06047887802124, "epoch": 4.347951529140219, "grad_norm": 0.9296875, "learning_rate": 0.00032533383897236757, "loss": 5.5773, "mean_token_accuracy": 0.21378377974033355, "num_tokens": 95496348.0, "step": 37675 }, { "entropy": 6.057560873031616, "epoch": 4.348528563185228, "grad_norm": 0.96484375, "learning_rate": 0.0003252936195498706, "loss": 5.4769, "mean_token_accuracy": 0.2145786166191101, "num_tokens": 95508349.0, "step": 37680 }, { "entropy": 5.965884494781494, "epoch": 4.349105597230237, "grad_norm": 0.98046875, "learning_rate": 0.00032525339843577267, "loss": 5.3978, "mean_token_accuracy": 0.2242712140083313, "num_tokens": 95520389.0, "step": 37685 }, { "entropy": 6.0365142822265625, "epoch": 4.349682631275245, "grad_norm": 1.4453125, "learning_rate": 0.0003252131756314266, "loss": 5.5416, "mean_token_accuracy": 0.20944399535655975, "num_tokens": 95533962.0, "step": 37690 }, { "entropy": 5.943994951248169, "epoch": 4.350259665320253, "grad_norm": 0.99609375, "learning_rate": 0.0003251729511381854, "loss": 5.4332, "mean_token_accuracy": 0.22141103595495223, "num_tokens": 95545830.0, "step": 37695 }, { "entropy": 6.007016611099243, "epoch": 4.350836699365263, "grad_norm": 1.03125, "learning_rate": 0.00032513272495740195, "loss": 5.4606, "mean_token_accuracy": 0.21607156842947006, "num_tokens": 95558988.0, "step": 37700 }, { "entropy": 6.157297563552857, "epoch": 4.351413733410271, "grad_norm": 1.4375, "learning_rate": 0.00032509249709042906, "loss": 5.6447, "mean_token_accuracy": 0.197378209233284, "num_tokens": 95572379.0, "step": 37705 }, { "entropy": 6.088064861297608, "epoch": 4.35199076745528, "grad_norm": 0.93359375, "learning_rate": 0.00032505226753862, "loss": 5.5042, "mean_token_accuracy": 0.21784281432628633, "num_tokens": 95586219.0, "step": 37710 }, { "entropy": 6.17486252784729, "epoch": 4.352567801500289, "grad_norm": 1.03125, "learning_rate": 0.00032501203630332776, "loss": 5.6351, "mean_token_accuracy": 0.20502230226993562, "num_tokens": 95598604.0, "step": 37715 }, { "entropy": 6.1081318855285645, "epoch": 4.353144835545297, "grad_norm": 0.984375, "learning_rate": 0.00032497180338590556, "loss": 5.627, "mean_token_accuracy": 0.20080945938825606, "num_tokens": 95611995.0, "step": 37720 }, { "entropy": 6.045156335830688, "epoch": 4.353721869590306, "grad_norm": 0.91796875, "learning_rate": 0.0003249315687877065, "loss": 5.5462, "mean_token_accuracy": 0.21181490570306777, "num_tokens": 95624719.0, "step": 37725 }, { "entropy": 6.0576849460601805, "epoch": 4.354298903635314, "grad_norm": 1.015625, "learning_rate": 0.000324891332510084, "loss": 5.4982, "mean_token_accuracy": 0.21005320698022842, "num_tokens": 95637982.0, "step": 37730 }, { "entropy": 6.117294263839722, "epoch": 4.354875937680323, "grad_norm": 0.95703125, "learning_rate": 0.00032485109455439125, "loss": 5.6164, "mean_token_accuracy": 0.20527080744504927, "num_tokens": 95650708.0, "step": 37735 }, { "entropy": 6.148378324508667, "epoch": 4.355452971725332, "grad_norm": 0.95703125, "learning_rate": 0.00032481085492198176, "loss": 5.5758, "mean_token_accuracy": 0.21194101870059967, "num_tokens": 95663118.0, "step": 37740 }, { "entropy": 6.10278639793396, "epoch": 4.35603000577034, "grad_norm": 1.0625, "learning_rate": 0.0003247706136142088, "loss": 5.5961, "mean_token_accuracy": 0.20882778018712997, "num_tokens": 95675736.0, "step": 37745 }, { "entropy": 6.0739710330963135, "epoch": 4.356607039815349, "grad_norm": 0.97265625, "learning_rate": 0.0003247303706324261, "loss": 5.5504, "mean_token_accuracy": 0.19995128065347673, "num_tokens": 95688194.0, "step": 37750 }, { "entropy": 6.119931745529175, "epoch": 4.357184073860358, "grad_norm": 0.90234375, "learning_rate": 0.00032469012597798703, "loss": 5.5444, "mean_token_accuracy": 0.21032788455486298, "num_tokens": 95700524.0, "step": 37755 }, { "entropy": 6.092657804489136, "epoch": 4.357761107905366, "grad_norm": 0.98046875, "learning_rate": 0.0003246498796522453, "loss": 5.566, "mean_token_accuracy": 0.20645192563533782, "num_tokens": 95712510.0, "step": 37760 }, { "entropy": 6.0990458011627195, "epoch": 4.358338141950375, "grad_norm": 1.015625, "learning_rate": 0.00032460963165655444, "loss": 5.5202, "mean_token_accuracy": 0.21628334522247314, "num_tokens": 95724728.0, "step": 37765 }, { "entropy": 6.068203449249268, "epoch": 4.358915175995384, "grad_norm": 1.171875, "learning_rate": 0.00032456938199226825, "loss": 5.5288, "mean_token_accuracy": 0.2114872395992279, "num_tokens": 95736212.0, "step": 37770 }, { "entropy": 5.9820150375366214, "epoch": 4.359492210040393, "grad_norm": 0.94140625, "learning_rate": 0.00032452913066074063, "loss": 5.4487, "mean_token_accuracy": 0.21543620824813842, "num_tokens": 95747789.0, "step": 37775 }, { "entropy": 6.053436279296875, "epoch": 4.360069244085401, "grad_norm": 0.99609375, "learning_rate": 0.00032448887766332526, "loss": 5.4542, "mean_token_accuracy": 0.2163073256611824, "num_tokens": 95759628.0, "step": 37780 }, { "entropy": 6.036184358596802, "epoch": 4.360646278130409, "grad_norm": 0.95703125, "learning_rate": 0.000324448623001376, "loss": 5.4966, "mean_token_accuracy": 0.21180918216705322, "num_tokens": 95773164.0, "step": 37785 }, { "entropy": 6.04491958618164, "epoch": 4.361223312175419, "grad_norm": 0.953125, "learning_rate": 0.00032440836667624697, "loss": 5.5101, "mean_token_accuracy": 0.2127455785870552, "num_tokens": 95786315.0, "step": 37790 }, { "entropy": 5.965170669555664, "epoch": 4.361800346220427, "grad_norm": 0.98046875, "learning_rate": 0.00032436810868929206, "loss": 5.393, "mean_token_accuracy": 0.2238956719636917, "num_tokens": 95798839.0, "step": 37795 }, { "entropy": 5.98937840461731, "epoch": 4.3623773802654355, "grad_norm": 1.0234375, "learning_rate": 0.0003243278490418653, "loss": 5.3851, "mean_token_accuracy": 0.22631475627422332, "num_tokens": 95812980.0, "step": 37800 }, { "entropy": 5.96692304611206, "epoch": 4.362954414310444, "grad_norm": 0.97265625, "learning_rate": 0.00032428758773532084, "loss": 5.4303, "mean_token_accuracy": 0.22445688396692276, "num_tokens": 95825112.0, "step": 37805 }, { "entropy": 6.096612215042114, "epoch": 4.363531448355453, "grad_norm": 0.94921875, "learning_rate": 0.0003242473247710128, "loss": 5.5401, "mean_token_accuracy": 0.20766531974077224, "num_tokens": 95837395.0, "step": 37810 }, { "entropy": 6.103021430969238, "epoch": 4.364108482400462, "grad_norm": 0.9609375, "learning_rate": 0.0003242070601502956, "loss": 5.5651, "mean_token_accuracy": 0.2003348335623741, "num_tokens": 95850351.0, "step": 37815 }, { "entropy": 6.139268398284912, "epoch": 4.36468551644547, "grad_norm": 1.015625, "learning_rate": 0.0003241667938745232, "loss": 5.573, "mean_token_accuracy": 0.20128797441720964, "num_tokens": 95863582.0, "step": 37820 }, { "entropy": 6.099933528900147, "epoch": 4.365262550490479, "grad_norm": 0.984375, "learning_rate": 0.00032412652594505025, "loss": 5.54, "mean_token_accuracy": 0.21333780586719514, "num_tokens": 95876496.0, "step": 37825 }, { "entropy": 6.059851789474488, "epoch": 4.365839584535488, "grad_norm": 0.94921875, "learning_rate": 0.0003240862563632309, "loss": 5.4486, "mean_token_accuracy": 0.21509270071983339, "num_tokens": 95889921.0, "step": 37830 }, { "entropy": 6.044889259338379, "epoch": 4.366416618580496, "grad_norm": 1.015625, "learning_rate": 0.00032404598513041975, "loss": 5.4398, "mean_token_accuracy": 0.22177815437316895, "num_tokens": 95901783.0, "step": 37835 }, { "entropy": 6.010998487472534, "epoch": 4.366993652625505, "grad_norm": 0.84375, "learning_rate": 0.0003240057122479713, "loss": 5.4839, "mean_token_accuracy": 0.22154007703065873, "num_tokens": 95915640.0, "step": 37840 }, { "entropy": 6.075091457366943, "epoch": 4.367570686670514, "grad_norm": 0.98046875, "learning_rate": 0.00032396543771724, "loss": 5.5393, "mean_token_accuracy": 0.21626498252153398, "num_tokens": 95928851.0, "step": 37845 }, { "entropy": 6.083856821060181, "epoch": 4.368147720715522, "grad_norm": 1.03125, "learning_rate": 0.0003239251615395805, "loss": 5.4851, "mean_token_accuracy": 0.22281526774168015, "num_tokens": 95941497.0, "step": 37850 }, { "entropy": 6.082077121734619, "epoch": 4.368724754760531, "grad_norm": 1.0390625, "learning_rate": 0.0003238848837163476, "loss": 5.4706, "mean_token_accuracy": 0.21153527200222016, "num_tokens": 95952389.0, "step": 37855 }, { "entropy": 5.9567546367645265, "epoch": 4.369301788805539, "grad_norm": 0.90625, "learning_rate": 0.0003238446042488958, "loss": 5.4521, "mean_token_accuracy": 0.2161433592438698, "num_tokens": 95965043.0, "step": 37860 }, { "entropy": 6.032352590560913, "epoch": 4.3698788228505485, "grad_norm": 0.9453125, "learning_rate": 0.0003238043231385801, "loss": 5.5346, "mean_token_accuracy": 0.22179989218711854, "num_tokens": 95979478.0, "step": 37865 }, { "entropy": 6.053231048583984, "epoch": 4.370455856895557, "grad_norm": 1.0390625, "learning_rate": 0.0003237640403867551, "loss": 5.5172, "mean_token_accuracy": 0.21583304256200792, "num_tokens": 95992502.0, "step": 37870 }, { "entropy": 6.107642269134521, "epoch": 4.371032890940565, "grad_norm": 0.96484375, "learning_rate": 0.00032372375599477594, "loss": 5.5126, "mean_token_accuracy": 0.20702233612537385, "num_tokens": 96006433.0, "step": 37875 }, { "entropy": 6.076223134994507, "epoch": 4.371609924985574, "grad_norm": 0.9453125, "learning_rate": 0.0003236834699639974, "loss": 5.5239, "mean_token_accuracy": 0.21021799594163895, "num_tokens": 96019525.0, "step": 37880 }, { "entropy": 6.031029224395752, "epoch": 4.372186959030583, "grad_norm": 1.359375, "learning_rate": 0.00032364318229577454, "loss": 5.5524, "mean_token_accuracy": 0.20655781179666519, "num_tokens": 96031342.0, "step": 37885 }, { "entropy": 6.115832948684693, "epoch": 4.3727639930755915, "grad_norm": 1.046875, "learning_rate": 0.0003236028929914624, "loss": 5.5427, "mean_token_accuracy": 0.20653196424245834, "num_tokens": 96043370.0, "step": 37890 }, { "entropy": 6.024349355697632, "epoch": 4.3733410271206, "grad_norm": 0.9609375, "learning_rate": 0.0003235626020524161, "loss": 5.4632, "mean_token_accuracy": 0.22202130407094955, "num_tokens": 96057617.0, "step": 37895 }, { "entropy": 6.036150121688843, "epoch": 4.373918061165609, "grad_norm": 0.94140625, "learning_rate": 0.00032352230947999087, "loss": 5.4563, "mean_token_accuracy": 0.21486581563949586, "num_tokens": 96069579.0, "step": 37900 }, { "entropy": 5.970242595672607, "epoch": 4.374495095210618, "grad_norm": 0.9140625, "learning_rate": 0.00032348201527554184, "loss": 5.4826, "mean_token_accuracy": 0.22254715412855147, "num_tokens": 96083167.0, "step": 37905 }, { "entropy": 6.062537431716919, "epoch": 4.375072129255626, "grad_norm": 0.96875, "learning_rate": 0.00032344171944042417, "loss": 5.5705, "mean_token_accuracy": 0.20287540256977082, "num_tokens": 96095697.0, "step": 37910 }, { "entropy": 6.047841596603393, "epoch": 4.3756491633006345, "grad_norm": 0.91015625, "learning_rate": 0.00032340142197599344, "loss": 5.558, "mean_token_accuracy": 0.21379594653844833, "num_tokens": 96110000.0, "step": 37915 }, { "entropy": 5.990476369857788, "epoch": 4.376226197345644, "grad_norm": 0.98828125, "learning_rate": 0.0003233611228836049, "loss": 5.4135, "mean_token_accuracy": 0.21861625760793685, "num_tokens": 96122187.0, "step": 37920 }, { "entropy": 6.128258514404297, "epoch": 4.376803231390652, "grad_norm": 1.015625, "learning_rate": 0.00032332082216461405, "loss": 5.4945, "mean_token_accuracy": 0.21603007912635802, "num_tokens": 96134314.0, "step": 37925 }, { "entropy": 5.960884237289429, "epoch": 4.377380265435661, "grad_norm": 0.97265625, "learning_rate": 0.0003232805198203763, "loss": 5.4882, "mean_token_accuracy": 0.21946474611759187, "num_tokens": 96146497.0, "step": 37930 }, { "entropy": 6.106948614120483, "epoch": 4.377957299480669, "grad_norm": 0.9140625, "learning_rate": 0.00032324021585224735, "loss": 5.5557, "mean_token_accuracy": 0.20852634757757188, "num_tokens": 96160291.0, "step": 37935 }, { "entropy": 6.15196795463562, "epoch": 4.378534333525678, "grad_norm": 0.90234375, "learning_rate": 0.00032319991026158256, "loss": 5.6604, "mean_token_accuracy": 0.20207667350769043, "num_tokens": 96173240.0, "step": 37940 }, { "entropy": 6.164811038970948, "epoch": 4.379111367570687, "grad_norm": 1.046875, "learning_rate": 0.0003231596030497378, "loss": 5.6154, "mean_token_accuracy": 0.208014814555645, "num_tokens": 96184313.0, "step": 37945 }, { "entropy": 6.102305793762207, "epoch": 4.379688401615695, "grad_norm": 0.98046875, "learning_rate": 0.00032311929421806866, "loss": 5.5079, "mean_token_accuracy": 0.21211728304624558, "num_tokens": 96195953.0, "step": 37950 }, { "entropy": 6.138415002822876, "epoch": 4.380265435660704, "grad_norm": 0.98046875, "learning_rate": 0.000323078983767931, "loss": 5.6069, "mean_token_accuracy": 0.20362795889377594, "num_tokens": 96207956.0, "step": 37955 }, { "entropy": 6.0936614036560055, "epoch": 4.380842469705713, "grad_norm": 0.88671875, "learning_rate": 0.00032303867170068064, "loss": 5.5568, "mean_token_accuracy": 0.2089806854724884, "num_tokens": 96220017.0, "step": 37960 }, { "entropy": 6.160920810699463, "epoch": 4.381419503750721, "grad_norm": 1.046875, "learning_rate": 0.0003229983580176734, "loss": 5.6256, "mean_token_accuracy": 0.20560528337955475, "num_tokens": 96232549.0, "step": 37965 }, { "entropy": 6.018291378021241, "epoch": 4.38199653779573, "grad_norm": 1.015625, "learning_rate": 0.00032295804272026524, "loss": 5.4568, "mean_token_accuracy": 0.21562202125787736, "num_tokens": 96244778.0, "step": 37970 }, { "entropy": 6.039153575897217, "epoch": 4.382573571840739, "grad_norm": 0.890625, "learning_rate": 0.00032291772580981203, "loss": 5.5494, "mean_token_accuracy": 0.21221984922885895, "num_tokens": 96258087.0, "step": 37975 }, { "entropy": 6.224298477172852, "epoch": 4.3831506058857475, "grad_norm": 1.0078125, "learning_rate": 0.0003228774072876701, "loss": 5.6551, "mean_token_accuracy": 0.20120372623205185, "num_tokens": 96271101.0, "step": 37980 }, { "entropy": 6.091609954833984, "epoch": 4.383727639930756, "grad_norm": 1.015625, "learning_rate": 0.00032283708715519525, "loss": 5.5934, "mean_token_accuracy": 0.2053753286600113, "num_tokens": 96282734.0, "step": 37985 }, { "entropy": 6.0761994361877445, "epoch": 4.384304673975764, "grad_norm": 0.96484375, "learning_rate": 0.00032279676541374376, "loss": 5.5731, "mean_token_accuracy": 0.20398081392049788, "num_tokens": 96295955.0, "step": 37990 }, { "entropy": 6.138612127304077, "epoch": 4.384881708020774, "grad_norm": 1.2265625, "learning_rate": 0.00032275644206467176, "loss": 5.5531, "mean_token_accuracy": 0.21061747372150422, "num_tokens": 96308618.0, "step": 37995 }, { "entropy": 6.090914058685303, "epoch": 4.385458742065782, "grad_norm": 0.8828125, "learning_rate": 0.0003227161171093356, "loss": 5.5878, "mean_token_accuracy": 0.21030182540416717, "num_tokens": 96321933.0, "step": 38000 }, { "entropy": 6.0297308444976805, "epoch": 4.38603577611079, "grad_norm": 0.98046875, "learning_rate": 0.00032267579054909154, "loss": 5.5512, "mean_token_accuracy": 0.21415201127529143, "num_tokens": 96333970.0, "step": 38005 }, { "entropy": 6.014867639541626, "epoch": 4.386612810155799, "grad_norm": 0.98828125, "learning_rate": 0.00032263546238529595, "loss": 5.4573, "mean_token_accuracy": 0.21842311024665834, "num_tokens": 96346227.0, "step": 38010 }, { "entropy": 6.102007913589477, "epoch": 4.387189844200808, "grad_norm": 0.9375, "learning_rate": 0.00032259513261930525, "loss": 5.5856, "mean_token_accuracy": 0.20976892113685608, "num_tokens": 96358585.0, "step": 38015 }, { "entropy": 6.118472290039063, "epoch": 4.387766878245817, "grad_norm": 1.0, "learning_rate": 0.0003225548012524759, "loss": 5.5585, "mean_token_accuracy": 0.21225176006555557, "num_tokens": 96372693.0, "step": 38020 }, { "entropy": 6.0720155239105225, "epoch": 4.388343912290825, "grad_norm": 1.0234375, "learning_rate": 0.0003225144682861644, "loss": 5.4539, "mean_token_accuracy": 0.20865799635648727, "num_tokens": 96384001.0, "step": 38025 }, { "entropy": 6.080781078338623, "epoch": 4.388920946335833, "grad_norm": 0.9296875, "learning_rate": 0.0003224741337217273, "loss": 5.5239, "mean_token_accuracy": 0.212342569231987, "num_tokens": 96396281.0, "step": 38030 }, { "entropy": 6.054772806167603, "epoch": 4.389497980380843, "grad_norm": 0.97265625, "learning_rate": 0.00032243379756052143, "loss": 5.508, "mean_token_accuracy": 0.21675640046596528, "num_tokens": 96409820.0, "step": 38035 }, { "entropy": 6.037151956558228, "epoch": 4.390075014425851, "grad_norm": 0.99609375, "learning_rate": 0.00032239345980390326, "loss": 5.5013, "mean_token_accuracy": 0.2079442709684372, "num_tokens": 96423038.0, "step": 38040 }, { "entropy": 6.022721242904663, "epoch": 4.3906520484708595, "grad_norm": 0.97265625, "learning_rate": 0.0003223531204532297, "loss": 5.4769, "mean_token_accuracy": 0.21164907813072203, "num_tokens": 96435395.0, "step": 38045 }, { "entropy": 6.020797252655029, "epoch": 4.391229082515869, "grad_norm": 0.94921875, "learning_rate": 0.0003223127795098574, "loss": 5.5019, "mean_token_accuracy": 0.20482718646526338, "num_tokens": 96449094.0, "step": 38050 }, { "entropy": 6.095019388198852, "epoch": 4.391806116560877, "grad_norm": 1.0859375, "learning_rate": 0.0003222724369751432, "loss": 5.4689, "mean_token_accuracy": 0.22095294296741486, "num_tokens": 96461754.0, "step": 38055 }, { "entropy": 5.9862569808959964, "epoch": 4.392383150605886, "grad_norm": 0.93359375, "learning_rate": 0.0003222320928504441, "loss": 5.4059, "mean_token_accuracy": 0.22218168526887894, "num_tokens": 96475510.0, "step": 38060 }, { "entropy": 6.0490086555480955, "epoch": 4.392960184650894, "grad_norm": 0.99609375, "learning_rate": 0.00032219174713711703, "loss": 5.5129, "mean_token_accuracy": 0.2090813234448433, "num_tokens": 96488056.0, "step": 38065 }, { "entropy": 6.173478651046753, "epoch": 4.393537218695903, "grad_norm": 0.9921875, "learning_rate": 0.00032215139983651905, "loss": 5.6758, "mean_token_accuracy": 0.20194595605134963, "num_tokens": 96501406.0, "step": 38070 }, { "entropy": 6.115729808807373, "epoch": 4.394114252740912, "grad_norm": 0.9609375, "learning_rate": 0.0003221110509500071, "loss": 5.5605, "mean_token_accuracy": 0.20267103463411332, "num_tokens": 96513715.0, "step": 38075 }, { "entropy": 6.104687643051148, "epoch": 4.39469128678592, "grad_norm": 1.015625, "learning_rate": 0.00032207070047893835, "loss": 5.5955, "mean_token_accuracy": 0.21220980882644652, "num_tokens": 96525819.0, "step": 38080 }, { "entropy": 6.0767608165740965, "epoch": 4.395268320830929, "grad_norm": 0.93359375, "learning_rate": 0.00032203034842467, "loss": 5.4925, "mean_token_accuracy": 0.22021742165088654, "num_tokens": 96538329.0, "step": 38085 }, { "entropy": 6.052501964569092, "epoch": 4.395845354875938, "grad_norm": 1.1796875, "learning_rate": 0.00032198999478855915, "loss": 5.5037, "mean_token_accuracy": 0.21344990581274031, "num_tokens": 96552037.0, "step": 38090 }, { "entropy": 6.113233661651611, "epoch": 4.396422388920946, "grad_norm": 1.0, "learning_rate": 0.0003219496395719633, "loss": 5.518, "mean_token_accuracy": 0.20924248099327086, "num_tokens": 96564058.0, "step": 38095 }, { "entropy": 6.057490348815918, "epoch": 4.396999422965955, "grad_norm": 0.96484375, "learning_rate": 0.0003219092827762395, "loss": 5.44, "mean_token_accuracy": 0.22290195226669313, "num_tokens": 96576676.0, "step": 38100 }, { "entropy": 6.118477058410645, "epoch": 4.397576457010963, "grad_norm": 0.9765625, "learning_rate": 0.0003218689244027453, "loss": 5.5708, "mean_token_accuracy": 0.209315487742424, "num_tokens": 96589815.0, "step": 38105 }, { "entropy": 6.0406107902526855, "epoch": 4.3981534910559725, "grad_norm": 1.015625, "learning_rate": 0.0003218285644528383, "loss": 5.5138, "mean_token_accuracy": 0.2156430035829544, "num_tokens": 96601880.0, "step": 38110 }, { "entropy": 6.046216106414795, "epoch": 4.398730525100981, "grad_norm": 1.1015625, "learning_rate": 0.00032178820292787566, "loss": 5.4971, "mean_token_accuracy": 0.21180468052625656, "num_tokens": 96615180.0, "step": 38115 }, { "entropy": 5.99285569190979, "epoch": 4.399307559145989, "grad_norm": 0.9140625, "learning_rate": 0.00032174783982921495, "loss": 5.435, "mean_token_accuracy": 0.2249556228518486, "num_tokens": 96627236.0, "step": 38120 }, { "entropy": 6.028314638137817, "epoch": 4.399884593190999, "grad_norm": 0.96484375, "learning_rate": 0.000321707475158214, "loss": 5.5398, "mean_token_accuracy": 0.21656513065099717, "num_tokens": 96639928.0, "step": 38125 }, { "entropy": 6.048867321014404, "epoch": 4.400461627236007, "grad_norm": 1.0390625, "learning_rate": 0.0003216671089162303, "loss": 5.4641, "mean_token_accuracy": 0.2193652793765068, "num_tokens": 96651262.0, "step": 38130 }, { "entropy": 6.079772043228149, "epoch": 4.4010386612810155, "grad_norm": 1.0, "learning_rate": 0.0003216267411046216, "loss": 5.5717, "mean_token_accuracy": 0.20986044257879258, "num_tokens": 96663570.0, "step": 38135 }, { "entropy": 6.106496143341064, "epoch": 4.401615695326024, "grad_norm": 1.0, "learning_rate": 0.00032158637172474556, "loss": 5.5906, "mean_token_accuracy": 0.20118582844734192, "num_tokens": 96675121.0, "step": 38140 }, { "entropy": 6.033359622955322, "epoch": 4.402192729371033, "grad_norm": 0.96484375, "learning_rate": 0.0003215460007779601, "loss": 5.5123, "mean_token_accuracy": 0.21977071613073348, "num_tokens": 96688228.0, "step": 38145 }, { "entropy": 6.151213884353638, "epoch": 4.402769763416042, "grad_norm": 1.1171875, "learning_rate": 0.00032150562826562294, "loss": 5.5662, "mean_token_accuracy": 0.2116177797317505, "num_tokens": 96701902.0, "step": 38150 }, { "entropy": 6.0421003818511965, "epoch": 4.40334679746105, "grad_norm": 1.0078125, "learning_rate": 0.0003214652541890922, "loss": 5.5119, "mean_token_accuracy": 0.21780835837125778, "num_tokens": 96714322.0, "step": 38155 }, { "entropy": 6.055783224105835, "epoch": 4.4039238315060585, "grad_norm": 1.1328125, "learning_rate": 0.0003214248785497256, "loss": 5.5263, "mean_token_accuracy": 0.21067825853824615, "num_tokens": 96728137.0, "step": 38160 }, { "entropy": 6.055116367340088, "epoch": 4.404500865551068, "grad_norm": 1.03125, "learning_rate": 0.0003213845013488813, "loss": 5.5202, "mean_token_accuracy": 0.2144872322678566, "num_tokens": 96741200.0, "step": 38165 }, { "entropy": 5.973556470870972, "epoch": 4.405077899596076, "grad_norm": 1.0390625, "learning_rate": 0.0003213441225879174, "loss": 5.4432, "mean_token_accuracy": 0.22491636425256728, "num_tokens": 96753530.0, "step": 38170 }, { "entropy": 5.817392778396607, "epoch": 4.405654933641085, "grad_norm": 1.015625, "learning_rate": 0.00032130374226819195, "loss": 5.2288, "mean_token_accuracy": 0.23348209708929063, "num_tokens": 96765487.0, "step": 38175 }, { "entropy": 6.150087451934814, "epoch": 4.406231967686093, "grad_norm": 0.96875, "learning_rate": 0.0003212633603910631, "loss": 5.5724, "mean_token_accuracy": 0.20882961004972458, "num_tokens": 96777480.0, "step": 38180 }, { "entropy": 6.076144504547119, "epoch": 4.406809001731102, "grad_norm": 0.96875, "learning_rate": 0.00032122297695788907, "loss": 5.5624, "mean_token_accuracy": 0.21048825085163117, "num_tokens": 96790028.0, "step": 38185 }, { "entropy": 6.079936838150024, "epoch": 4.407386035776111, "grad_norm": 0.97265625, "learning_rate": 0.0003211825919700282, "loss": 5.5713, "mean_token_accuracy": 0.20939162522554397, "num_tokens": 96803678.0, "step": 38190 }, { "entropy": 6.196528768539428, "epoch": 4.407963069821119, "grad_norm": 0.984375, "learning_rate": 0.00032114220542883877, "loss": 5.6776, "mean_token_accuracy": 0.20235282182693481, "num_tokens": 96817116.0, "step": 38195 }, { "entropy": 6.044260406494141, "epoch": 4.4085401038661285, "grad_norm": 0.98046875, "learning_rate": 0.00032110181733567924, "loss": 5.4394, "mean_token_accuracy": 0.2215522438287735, "num_tokens": 96828640.0, "step": 38200 }, { "entropy": 6.041435384750367, "epoch": 4.409117137911137, "grad_norm": 1.0, "learning_rate": 0.00032106142769190786, "loss": 5.568, "mean_token_accuracy": 0.20948518961668014, "num_tokens": 96840859.0, "step": 38205 }, { "entropy": 6.105862188339233, "epoch": 4.409694171956145, "grad_norm": 0.8671875, "learning_rate": 0.00032102103649888334, "loss": 5.564, "mean_token_accuracy": 0.21221884191036225, "num_tokens": 96853073.0, "step": 38210 }, { "entropy": 6.09613823890686, "epoch": 4.410271206001154, "grad_norm": 0.9453125, "learning_rate": 0.00032098064375796415, "loss": 5.6518, "mean_token_accuracy": 0.2037271037697792, "num_tokens": 96866139.0, "step": 38215 }, { "entropy": 6.044867134094238, "epoch": 4.410848240046163, "grad_norm": 0.96875, "learning_rate": 0.00032094024947050884, "loss": 5.5423, "mean_token_accuracy": 0.21265282928943635, "num_tokens": 96878203.0, "step": 38220 }, { "entropy": 6.104527139663697, "epoch": 4.4114252740911715, "grad_norm": 0.96484375, "learning_rate": 0.0003208998536378759, "loss": 5.5841, "mean_token_accuracy": 0.20305479019880296, "num_tokens": 96891132.0, "step": 38225 }, { "entropy": 6.06794056892395, "epoch": 4.41200230813618, "grad_norm": 0.96484375, "learning_rate": 0.00032085945626142437, "loss": 5.4644, "mean_token_accuracy": 0.2225763276219368, "num_tokens": 96903713.0, "step": 38230 }, { "entropy": 6.054664421081543, "epoch": 4.412579342181188, "grad_norm": 1.015625, "learning_rate": 0.00032081905734251276, "loss": 5.5274, "mean_token_accuracy": 0.2090901955962181, "num_tokens": 96916654.0, "step": 38235 }, { "entropy": 6.17134804725647, "epoch": 4.413156376226198, "grad_norm": 1.109375, "learning_rate": 0.0003207786568824999, "loss": 5.6572, "mean_token_accuracy": 0.19880637973546983, "num_tokens": 96929960.0, "step": 38240 }, { "entropy": 6.082594776153565, "epoch": 4.413733410271206, "grad_norm": 1.0078125, "learning_rate": 0.0003207382548827446, "loss": 5.5599, "mean_token_accuracy": 0.21472093909978868, "num_tokens": 96942529.0, "step": 38245 }, { "entropy": 6.145193481445313, "epoch": 4.414310444316214, "grad_norm": 0.94140625, "learning_rate": 0.00032069785134460587, "loss": 5.5676, "mean_token_accuracy": 0.20699049532413483, "num_tokens": 96955561.0, "step": 38250 }, { "entropy": 6.000232267379761, "epoch": 4.414887478361223, "grad_norm": 1.0234375, "learning_rate": 0.0003206574462694426, "loss": 5.4674, "mean_token_accuracy": 0.2158682733774185, "num_tokens": 96967955.0, "step": 38255 }, { "entropy": 6.037531232833862, "epoch": 4.415464512406232, "grad_norm": 0.96484375, "learning_rate": 0.00032061703965861383, "loss": 5.5685, "mean_token_accuracy": 0.21087002158164977, "num_tokens": 96980858.0, "step": 38260 }, { "entropy": 6.073329925537109, "epoch": 4.416041546451241, "grad_norm": 0.953125, "learning_rate": 0.00032057663151347854, "loss": 5.6017, "mean_token_accuracy": 0.20727828443050383, "num_tokens": 96995292.0, "step": 38265 }, { "entropy": 6.064919710159302, "epoch": 4.416618580496249, "grad_norm": 1.0234375, "learning_rate": 0.00032053622183539593, "loss": 5.4899, "mean_token_accuracy": 0.21314300298690797, "num_tokens": 97007968.0, "step": 38270 }, { "entropy": 6.102100944519043, "epoch": 4.417195614541258, "grad_norm": 0.91015625, "learning_rate": 0.00032049581062572514, "loss": 5.5244, "mean_token_accuracy": 0.21712785661220552, "num_tokens": 97021600.0, "step": 38275 }, { "entropy": 5.9598664283752445, "epoch": 4.417772648586267, "grad_norm": 1.0390625, "learning_rate": 0.00032045539788582534, "loss": 5.3264, "mean_token_accuracy": 0.22414463758468628, "num_tokens": 97032529.0, "step": 38280 }, { "entropy": 6.038284587860107, "epoch": 4.418349682631275, "grad_norm": 1.0078125, "learning_rate": 0.00032041498361705574, "loss": 5.5662, "mean_token_accuracy": 0.20591207593679428, "num_tokens": 97045046.0, "step": 38285 }, { "entropy": 6.0646473407745365, "epoch": 4.418926716676284, "grad_norm": 0.94140625, "learning_rate": 0.0003203745678207758, "loss": 5.4344, "mean_token_accuracy": 0.21799015998840332, "num_tokens": 97058844.0, "step": 38290 }, { "entropy": 5.99240460395813, "epoch": 4.419503750721293, "grad_norm": 0.9609375, "learning_rate": 0.00032033415049834477, "loss": 5.466, "mean_token_accuracy": 0.21117955297231675, "num_tokens": 97072002.0, "step": 38295 }, { "entropy": 5.937837028503418, "epoch": 4.420080784766301, "grad_norm": 0.98828125, "learning_rate": 0.00032029373165112215, "loss": 5.4274, "mean_token_accuracy": 0.22193049788475036, "num_tokens": 97083861.0, "step": 38300 }, { "entropy": 6.031952571868897, "epoch": 4.42065781881131, "grad_norm": 0.953125, "learning_rate": 0.00032025331128046733, "loss": 5.479, "mean_token_accuracy": 0.22137761861085892, "num_tokens": 97096039.0, "step": 38305 }, { "entropy": 6.109057283401489, "epoch": 4.421234852856318, "grad_norm": 1.03125, "learning_rate": 0.00032021288938773984, "loss": 5.59, "mean_token_accuracy": 0.20899964421987532, "num_tokens": 97108306.0, "step": 38310 }, { "entropy": 6.1162055969238285, "epoch": 4.421811886901327, "grad_norm": 0.93359375, "learning_rate": 0.0003201724659742993, "loss": 5.4904, "mean_token_accuracy": 0.21170012652873993, "num_tokens": 97120028.0, "step": 38315 }, { "entropy": 6.043722438812256, "epoch": 4.422388920946336, "grad_norm": 1.03125, "learning_rate": 0.00032013204104150536, "loss": 5.4081, "mean_token_accuracy": 0.22663921117782593, "num_tokens": 97133741.0, "step": 38320 }, { "entropy": 5.949843168258667, "epoch": 4.422965954991344, "grad_norm": 0.9140625, "learning_rate": 0.00032009161459071756, "loss": 5.4432, "mean_token_accuracy": 0.22553859651088715, "num_tokens": 97145853.0, "step": 38325 }, { "entropy": 5.97238392829895, "epoch": 4.423542989036353, "grad_norm": 0.9921875, "learning_rate": 0.0003200511866232957, "loss": 5.4444, "mean_token_accuracy": 0.2190261095762253, "num_tokens": 97159771.0, "step": 38330 }, { "entropy": 5.973358106613159, "epoch": 4.424120023081362, "grad_norm": 0.96484375, "learning_rate": 0.00032001075714059964, "loss": 5.541, "mean_token_accuracy": 0.20798029750585556, "num_tokens": 97173415.0, "step": 38335 }, { "entropy": 6.00677375793457, "epoch": 4.42469705712637, "grad_norm": 0.9609375, "learning_rate": 0.0003199703261439891, "loss": 5.4068, "mean_token_accuracy": 0.22706763744354247, "num_tokens": 97186742.0, "step": 38340 }, { "entropy": 6.056438970565796, "epoch": 4.425274091171379, "grad_norm": 1.0234375, "learning_rate": 0.0003199298936348239, "loss": 5.5453, "mean_token_accuracy": 0.21169002652168273, "num_tokens": 97199553.0, "step": 38345 }, { "entropy": 6.038198804855346, "epoch": 4.425851125216388, "grad_norm": 0.9921875, "learning_rate": 0.000319889459614464, "loss": 5.5512, "mean_token_accuracy": 0.21199320554733275, "num_tokens": 97212603.0, "step": 38350 }, { "entropy": 6.041984128952026, "epoch": 4.4264281592613965, "grad_norm": 1.0078125, "learning_rate": 0.0003198490240842696, "loss": 5.4768, "mean_token_accuracy": 0.21151960492134095, "num_tokens": 97226247.0, "step": 38355 }, { "entropy": 6.065248250961304, "epoch": 4.427005193306405, "grad_norm": 1.1015625, "learning_rate": 0.00031980858704560043, "loss": 5.5227, "mean_token_accuracy": 0.21060474812984467, "num_tokens": 97237875.0, "step": 38360 }, { "entropy": 6.028769207000733, "epoch": 4.427582227351413, "grad_norm": 0.9140625, "learning_rate": 0.0003197681484998168, "loss": 5.5282, "mean_token_accuracy": 0.20810441821813583, "num_tokens": 97251988.0, "step": 38365 }, { "entropy": 6.140949821472168, "epoch": 4.428159261396423, "grad_norm": 0.98828125, "learning_rate": 0.00031972770844827857, "loss": 5.575, "mean_token_accuracy": 0.2073147252202034, "num_tokens": 97265002.0, "step": 38370 }, { "entropy": 6.047188758850098, "epoch": 4.428736295441431, "grad_norm": 0.9765625, "learning_rate": 0.00031968726689234625, "loss": 5.5182, "mean_token_accuracy": 0.21059317141771317, "num_tokens": 97278527.0, "step": 38375 }, { "entropy": 6.038583421707154, "epoch": 4.4293133294864395, "grad_norm": 0.9453125, "learning_rate": 0.00031964682383337986, "loss": 5.5956, "mean_token_accuracy": 0.20662633329629898, "num_tokens": 97290813.0, "step": 38380 }, { "entropy": 6.067373323440552, "epoch": 4.429890363531449, "grad_norm": 1.015625, "learning_rate": 0.0003196063792727397, "loss": 5.4897, "mean_token_accuracy": 0.2151740238070488, "num_tokens": 97303389.0, "step": 38385 }, { "entropy": 6.114503574371338, "epoch": 4.430467397576457, "grad_norm": 1.03125, "learning_rate": 0.0003195659332117861, "loss": 5.5621, "mean_token_accuracy": 0.2133955329656601, "num_tokens": 97315058.0, "step": 38390 }, { "entropy": 6.043418598175049, "epoch": 4.431044431621466, "grad_norm": 0.9609375, "learning_rate": 0.0003195254856518795, "loss": 5.4771, "mean_token_accuracy": 0.21980277001857756, "num_tokens": 97328005.0, "step": 38395 }, { "entropy": 6.108169317245483, "epoch": 4.431621465666474, "grad_norm": 1.0703125, "learning_rate": 0.0003194850365943803, "loss": 5.5733, "mean_token_accuracy": 0.20297864824533463, "num_tokens": 97340044.0, "step": 38400 }, { "entropy": 6.052076005935669, "epoch": 4.432198499711483, "grad_norm": 1.03125, "learning_rate": 0.000319444586040649, "loss": 5.4874, "mean_token_accuracy": 0.22086975425481797, "num_tokens": 97352011.0, "step": 38405 }, { "entropy": 6.056350898742676, "epoch": 4.432775533756492, "grad_norm": 0.953125, "learning_rate": 0.00031940413399204616, "loss": 5.6007, "mean_token_accuracy": 0.20261027812957763, "num_tokens": 97364493.0, "step": 38410 }, { "entropy": 6.08653416633606, "epoch": 4.4333525678015, "grad_norm": 0.9609375, "learning_rate": 0.00031936368044993227, "loss": 5.5044, "mean_token_accuracy": 0.22014954835176467, "num_tokens": 97377797.0, "step": 38415 }, { "entropy": 6.049614381790161, "epoch": 4.433929601846509, "grad_norm": 1.03125, "learning_rate": 0.00031932322541566806, "loss": 5.4614, "mean_token_accuracy": 0.22082065790891647, "num_tokens": 97389928.0, "step": 38420 }, { "entropy": 6.061914253234863, "epoch": 4.434506635891518, "grad_norm": 0.96875, "learning_rate": 0.0003192827688906142, "loss": 5.5037, "mean_token_accuracy": 0.22080715000629425, "num_tokens": 97402978.0, "step": 38425 }, { "entropy": 6.032214164733887, "epoch": 4.435083669936526, "grad_norm": 0.953125, "learning_rate": 0.0003192423108761314, "loss": 5.5194, "mean_token_accuracy": 0.20826325714588165, "num_tokens": 97415084.0, "step": 38430 }, { "entropy": 5.987477779388428, "epoch": 4.435660703981535, "grad_norm": 1.0234375, "learning_rate": 0.0003192018513735804, "loss": 5.4147, "mean_token_accuracy": 0.22825562506914138, "num_tokens": 97426831.0, "step": 38435 }, { "entropy": 6.010431146621704, "epoch": 4.436237738026543, "grad_norm": 0.97265625, "learning_rate": 0.00031916139038432213, "loss": 5.4509, "mean_token_accuracy": 0.22023300528526307, "num_tokens": 97439148.0, "step": 38440 }, { "entropy": 6.116638994216919, "epoch": 4.4368147720715525, "grad_norm": 0.95703125, "learning_rate": 0.0003191209279097174, "loss": 5.6753, "mean_token_accuracy": 0.20192406475543975, "num_tokens": 97453106.0, "step": 38445 }, { "entropy": 6.128074216842651, "epoch": 4.437391806116561, "grad_norm": 0.9921875, "learning_rate": 0.00031908046395112715, "loss": 5.6097, "mean_token_accuracy": 0.20352471321821214, "num_tokens": 97465735.0, "step": 38450 }, { "entropy": 6.0342264652252195, "epoch": 4.437968840161569, "grad_norm": 0.984375, "learning_rate": 0.00031903999850991247, "loss": 5.4692, "mean_token_accuracy": 0.21654055118560792, "num_tokens": 97478584.0, "step": 38455 }, { "entropy": 6.051268625259399, "epoch": 4.438545874206579, "grad_norm": 0.9921875, "learning_rate": 0.00031899953158743427, "loss": 5.4289, "mean_token_accuracy": 0.22036666721105574, "num_tokens": 97491940.0, "step": 38460 }, { "entropy": 6.020132160186767, "epoch": 4.439122908251587, "grad_norm": 0.91796875, "learning_rate": 0.0003189590631850537, "loss": 5.4934, "mean_token_accuracy": 0.21575690656900406, "num_tokens": 97505625.0, "step": 38465 }, { "entropy": 6.147014331817627, "epoch": 4.4396999422965955, "grad_norm": 0.9296875, "learning_rate": 0.00031891859330413186, "loss": 5.6382, "mean_token_accuracy": 0.19720063507556915, "num_tokens": 97518074.0, "step": 38470 }, { "entropy": 6.106230306625366, "epoch": 4.440276976341604, "grad_norm": 1.0078125, "learning_rate": 0.0003188781219460299, "loss": 5.5278, "mean_token_accuracy": 0.21203760504722596, "num_tokens": 97530466.0, "step": 38475 }, { "entropy": 6.131121587753296, "epoch": 4.440854010386613, "grad_norm": 0.984375, "learning_rate": 0.00031883764911210915, "loss": 5.6276, "mean_token_accuracy": 0.20531610250473023, "num_tokens": 97543658.0, "step": 38480 }, { "entropy": 5.995190858840942, "epoch": 4.441431044431622, "grad_norm": 0.96484375, "learning_rate": 0.0003187971748037309, "loss": 5.4657, "mean_token_accuracy": 0.21458000391721727, "num_tokens": 97557243.0, "step": 38485 }, { "entropy": 6.0263184070587155, "epoch": 4.44200807847663, "grad_norm": 0.93359375, "learning_rate": 0.00031875669902225643, "loss": 5.4051, "mean_token_accuracy": 0.2193518966436386, "num_tokens": 97569230.0, "step": 38490 }, { "entropy": 6.127245664596558, "epoch": 4.4425851125216385, "grad_norm": 1.0, "learning_rate": 0.000318716221769047, "loss": 5.641, "mean_token_accuracy": 0.20181012749671937, "num_tokens": 97582068.0, "step": 38495 }, { "entropy": 6.013142681121826, "epoch": 4.443162146566648, "grad_norm": 0.9609375, "learning_rate": 0.0003186757430454643, "loss": 5.4241, "mean_token_accuracy": 0.22312005013227462, "num_tokens": 97595039.0, "step": 38500 }, { "entropy": 5.983185434341431, "epoch": 4.443739180611656, "grad_norm": 0.98828125, "learning_rate": 0.00031863526285286957, "loss": 5.4516, "mean_token_accuracy": 0.2144797459244728, "num_tokens": 97606703.0, "step": 38505 }, { "entropy": 6.091512298583984, "epoch": 4.444316214656665, "grad_norm": 0.98828125, "learning_rate": 0.0003185947811926246, "loss": 5.5426, "mean_token_accuracy": 0.2147781506180763, "num_tokens": 97618401.0, "step": 38510 }, { "entropy": 6.073824739456176, "epoch": 4.444893248701673, "grad_norm": 0.9609375, "learning_rate": 0.0003185542980660906, "loss": 5.4908, "mean_token_accuracy": 0.21741002053022385, "num_tokens": 97630650.0, "step": 38515 }, { "entropy": 5.92982702255249, "epoch": 4.445470282746682, "grad_norm": 0.9453125, "learning_rate": 0.0003185138134746296, "loss": 5.3744, "mean_token_accuracy": 0.21576071232557298, "num_tokens": 97643192.0, "step": 38520 }, { "entropy": 6.038323068618775, "epoch": 4.446047316791691, "grad_norm": 1.0078125, "learning_rate": 0.000318473327419603, "loss": 5.525, "mean_token_accuracy": 0.2184448093175888, "num_tokens": 97656559.0, "step": 38525 }, { "entropy": 6.114233589172363, "epoch": 4.446624350836699, "grad_norm": 0.89453125, "learning_rate": 0.0003184328399023727, "loss": 5.5604, "mean_token_accuracy": 0.20933341085910798, "num_tokens": 97669778.0, "step": 38530 }, { "entropy": 6.106561136245728, "epoch": 4.4472013848817085, "grad_norm": 1.0625, "learning_rate": 0.0003183923509243003, "loss": 5.5675, "mean_token_accuracy": 0.21007578521966935, "num_tokens": 97682260.0, "step": 38535 }, { "entropy": 6.082838439941407, "epoch": 4.447778418926717, "grad_norm": 1.015625, "learning_rate": 0.00031835186048674786, "loss": 5.6133, "mean_token_accuracy": 0.20035274624824523, "num_tokens": 97693812.0, "step": 38540 }, { "entropy": 6.056507349014282, "epoch": 4.448355452971725, "grad_norm": 0.921875, "learning_rate": 0.0003183113685910771, "loss": 5.5248, "mean_token_accuracy": 0.2132405236363411, "num_tokens": 97707149.0, "step": 38545 }, { "entropy": 6.113850736618042, "epoch": 4.448932487016734, "grad_norm": 0.9765625, "learning_rate": 0.0003182708752386499, "loss": 5.548, "mean_token_accuracy": 0.20951681733131408, "num_tokens": 97719202.0, "step": 38550 }, { "entropy": 6.106725692749023, "epoch": 4.449509521061743, "grad_norm": 0.9609375, "learning_rate": 0.0003182303804308283, "loss": 5.5999, "mean_token_accuracy": 0.20964802503585817, "num_tokens": 97730958.0, "step": 38555 }, { "entropy": 6.147523260116577, "epoch": 4.450086555106751, "grad_norm": 1.046875, "learning_rate": 0.00031818988416897444, "loss": 5.5938, "mean_token_accuracy": 0.2121189519762993, "num_tokens": 97743366.0, "step": 38560 }, { "entropy": 6.031114006042481, "epoch": 4.45066358915176, "grad_norm": 1.0234375, "learning_rate": 0.0003181493864544502, "loss": 5.4968, "mean_token_accuracy": 0.2140096455812454, "num_tokens": 97756140.0, "step": 38565 }, { "entropy": 6.026924562454224, "epoch": 4.451240623196768, "grad_norm": 0.94921875, "learning_rate": 0.0003181088872886178, "loss": 5.5173, "mean_token_accuracy": 0.2145009696483612, "num_tokens": 97770092.0, "step": 38570 }, { "entropy": 6.0982198238372805, "epoch": 4.451817657241778, "grad_norm": 0.93359375, "learning_rate": 0.0003180683866728394, "loss": 5.5159, "mean_token_accuracy": 0.21397635191679001, "num_tokens": 97783815.0, "step": 38575 }, { "entropy": 6.046237373352051, "epoch": 4.452394691286786, "grad_norm": 0.98046875, "learning_rate": 0.00031802788460847715, "loss": 5.527, "mean_token_accuracy": 0.2051728844642639, "num_tokens": 97796149.0, "step": 38580 }, { "entropy": 6.053700733184814, "epoch": 4.452971725331794, "grad_norm": 0.97265625, "learning_rate": 0.0003179873810968934, "loss": 5.5285, "mean_token_accuracy": 0.2062440723180771, "num_tokens": 97808310.0, "step": 38585 }, { "entropy": 6.0198523044586185, "epoch": 4.453548759376803, "grad_norm": 1.0703125, "learning_rate": 0.0003179468761394504, "loss": 5.4264, "mean_token_accuracy": 0.21690552532672883, "num_tokens": 97820840.0, "step": 38590 }, { "entropy": 6.087871742248535, "epoch": 4.454125793421812, "grad_norm": 1.0703125, "learning_rate": 0.0003179063697375107, "loss": 5.5598, "mean_token_accuracy": 0.21034959852695465, "num_tokens": 97834359.0, "step": 38595 }, { "entropy": 6.097955799102783, "epoch": 4.454702827466821, "grad_norm": 1.0234375, "learning_rate": 0.00031786586189243646, "loss": 5.5552, "mean_token_accuracy": 0.20411264896392822, "num_tokens": 97848018.0, "step": 38600 }, { "entropy": 6.0513042449951175, "epoch": 4.455279861511829, "grad_norm": 0.9765625, "learning_rate": 0.0003178253526055902, "loss": 5.5245, "mean_token_accuracy": 0.21323073655366898, "num_tokens": 97861598.0, "step": 38605 }, { "entropy": 6.0582154273986815, "epoch": 4.455856895556838, "grad_norm": 0.98828125, "learning_rate": 0.00031778484187833456, "loss": 5.5435, "mean_token_accuracy": 0.21287302672863007, "num_tokens": 97873280.0, "step": 38610 }, { "entropy": 6.063132095336914, "epoch": 4.456433929601847, "grad_norm": 0.96484375, "learning_rate": 0.00031774432971203205, "loss": 5.5142, "mean_token_accuracy": 0.20476548224687577, "num_tokens": 97886713.0, "step": 38615 }, { "entropy": 5.940737724304199, "epoch": 4.457010963646855, "grad_norm": 0.98046875, "learning_rate": 0.0003177038161080451, "loss": 5.4044, "mean_token_accuracy": 0.22060102969408035, "num_tokens": 97899233.0, "step": 38620 }, { "entropy": 5.959931564331055, "epoch": 4.4575879976918635, "grad_norm": 0.98046875, "learning_rate": 0.0003176633010677366, "loss": 5.4166, "mean_token_accuracy": 0.21378268748521806, "num_tokens": 97912069.0, "step": 38625 }, { "entropy": 6.086202383041382, "epoch": 4.458165031736873, "grad_norm": 0.94140625, "learning_rate": 0.00031762278459246916, "loss": 5.5286, "mean_token_accuracy": 0.21167900115251542, "num_tokens": 97925095.0, "step": 38630 }, { "entropy": 6.127517127990723, "epoch": 4.458742065781881, "grad_norm": 0.9921875, "learning_rate": 0.00031758226668360555, "loss": 5.5918, "mean_token_accuracy": 0.20698390305042266, "num_tokens": 97937648.0, "step": 38635 }, { "entropy": 6.07396388053894, "epoch": 4.45931909982689, "grad_norm": 0.98046875, "learning_rate": 0.00031754174734250853, "loss": 5.5258, "mean_token_accuracy": 0.21063694059848787, "num_tokens": 97950182.0, "step": 38640 }, { "entropy": 6.0780500888824465, "epoch": 4.459896133871898, "grad_norm": 0.93359375, "learning_rate": 0.0003175012265705409, "loss": 5.5295, "mean_token_accuracy": 0.20857050865888596, "num_tokens": 97963099.0, "step": 38645 }, { "entropy": 6.1557262420654295, "epoch": 4.460473167916907, "grad_norm": 0.890625, "learning_rate": 0.00031746070436906577, "loss": 5.601, "mean_token_accuracy": 0.2056301310658455, "num_tokens": 97976061.0, "step": 38650 }, { "entropy": 6.099689579010009, "epoch": 4.461050201961916, "grad_norm": 1.0234375, "learning_rate": 0.0003174201807394459, "loss": 5.5265, "mean_token_accuracy": 0.20930353850126265, "num_tokens": 97988096.0, "step": 38655 }, { "entropy": 6.026842308044434, "epoch": 4.461627236006924, "grad_norm": 0.9296875, "learning_rate": 0.0003173796556830442, "loss": 5.5061, "mean_token_accuracy": 0.2063517689704895, "num_tokens": 98000408.0, "step": 38660 }, { "entropy": 6.055496644973755, "epoch": 4.462204270051933, "grad_norm": 0.92578125, "learning_rate": 0.00031733912920122397, "loss": 5.5559, "mean_token_accuracy": 0.21148732602596282, "num_tokens": 98014132.0, "step": 38665 }, { "entropy": 6.104442691802978, "epoch": 4.462781304096942, "grad_norm": 1.0234375, "learning_rate": 0.0003172986012953481, "loss": 5.5082, "mean_token_accuracy": 0.20375020205974578, "num_tokens": 98026987.0, "step": 38670 }, { "entropy": 6.015497159957886, "epoch": 4.46335833814195, "grad_norm": 0.890625, "learning_rate": 0.0003172580719667798, "loss": 5.4273, "mean_token_accuracy": 0.21826139390468596, "num_tokens": 98039480.0, "step": 38675 }, { "entropy": 5.990102529525757, "epoch": 4.463935372186959, "grad_norm": 0.9765625, "learning_rate": 0.00031721754121688225, "loss": 5.4396, "mean_token_accuracy": 0.2210967093706131, "num_tokens": 98051633.0, "step": 38680 }, { "entropy": 6.13384165763855, "epoch": 4.464512406231968, "grad_norm": 0.921875, "learning_rate": 0.00031717700904701864, "loss": 5.6509, "mean_token_accuracy": 0.20338100343942642, "num_tokens": 98065704.0, "step": 38685 }, { "entropy": 6.004337930679322, "epoch": 4.4650894402769765, "grad_norm": 0.9140625, "learning_rate": 0.0003171364754585523, "loss": 5.4479, "mean_token_accuracy": 0.21626182943582534, "num_tokens": 98079091.0, "step": 38690 }, { "entropy": 6.060029745101929, "epoch": 4.465666474321985, "grad_norm": 0.984375, "learning_rate": 0.00031709594045284655, "loss": 5.5218, "mean_token_accuracy": 0.2135891318321228, "num_tokens": 98091735.0, "step": 38695 }, { "entropy": 6.064213514328003, "epoch": 4.466243508366993, "grad_norm": 0.9921875, "learning_rate": 0.0003170554040312647, "loss": 5.5455, "mean_token_accuracy": 0.2111101806163788, "num_tokens": 98105490.0, "step": 38700 }, { "entropy": 6.0144736766815186, "epoch": 4.466820542412003, "grad_norm": 0.9765625, "learning_rate": 0.0003170148661951703, "loss": 5.4559, "mean_token_accuracy": 0.21411906331777572, "num_tokens": 98118936.0, "step": 38705 }, { "entropy": 6.052533435821533, "epoch": 4.467397576457011, "grad_norm": 1.015625, "learning_rate": 0.0003169743269459267, "loss": 5.5169, "mean_token_accuracy": 0.22226731330156327, "num_tokens": 98130627.0, "step": 38710 }, { "entropy": 6.134881830215454, "epoch": 4.4679746105020195, "grad_norm": 0.9609375, "learning_rate": 0.00031693378628489747, "loss": 5.5054, "mean_token_accuracy": 0.21126098185777664, "num_tokens": 98142408.0, "step": 38715 }, { "entropy": 6.083096122741699, "epoch": 4.468551644547028, "grad_norm": 1.125, "learning_rate": 0.0003168932442134461, "loss": 5.5642, "mean_token_accuracy": 0.21005493253469468, "num_tokens": 98155158.0, "step": 38720 }, { "entropy": 5.962113094329834, "epoch": 4.469128678592037, "grad_norm": 0.9296875, "learning_rate": 0.00031685270073293637, "loss": 5.5078, "mean_token_accuracy": 0.21187253594398497, "num_tokens": 98167981.0, "step": 38725 }, { "entropy": 6.01308856010437, "epoch": 4.469705712637046, "grad_norm": 0.94921875, "learning_rate": 0.00031681215584473184, "loss": 5.4618, "mean_token_accuracy": 0.2126472532749176, "num_tokens": 98180974.0, "step": 38730 }, { "entropy": 5.95109748840332, "epoch": 4.470282746682054, "grad_norm": 1.1015625, "learning_rate": 0.00031677160955019616, "loss": 5.3795, "mean_token_accuracy": 0.23298151344060897, "num_tokens": 98194857.0, "step": 38735 }, { "entropy": 6.053857326507568, "epoch": 4.4708597807270625, "grad_norm": 1.09375, "learning_rate": 0.00031673106185069324, "loss": 5.524, "mean_token_accuracy": 0.21251145154237747, "num_tokens": 98206695.0, "step": 38740 }, { "entropy": 6.074065923690796, "epoch": 4.471436814772072, "grad_norm": 1.015625, "learning_rate": 0.0003166905127475866, "loss": 5.5205, "mean_token_accuracy": 0.2104508951306343, "num_tokens": 98219132.0, "step": 38745 }, { "entropy": 6.0658153057098385, "epoch": 4.47201384881708, "grad_norm": 0.9921875, "learning_rate": 0.00031664996224224043, "loss": 5.5287, "mean_token_accuracy": 0.20999520421028137, "num_tokens": 98230074.0, "step": 38750 }, { "entropy": 5.989320278167725, "epoch": 4.472590882862089, "grad_norm": 0.8984375, "learning_rate": 0.0003166094103360184, "loss": 5.487, "mean_token_accuracy": 0.21548508554697038, "num_tokens": 98242503.0, "step": 38755 }, { "entropy": 6.089497661590576, "epoch": 4.473167916907098, "grad_norm": 0.875, "learning_rate": 0.0003165688570302846, "loss": 5.5763, "mean_token_accuracy": 0.207134610414505, "num_tokens": 98254874.0, "step": 38760 }, { "entropy": 6.054527139663696, "epoch": 4.473744950952106, "grad_norm": 0.99609375, "learning_rate": 0.00031652830232640285, "loss": 5.4548, "mean_token_accuracy": 0.20933595001697541, "num_tokens": 98266847.0, "step": 38765 }, { "entropy": 6.097812557220459, "epoch": 4.474321984997115, "grad_norm": 1.03125, "learning_rate": 0.00031648774622573735, "loss": 5.6257, "mean_token_accuracy": 0.20380248576402665, "num_tokens": 98279818.0, "step": 38770 }, { "entropy": 5.966616678237915, "epoch": 4.474899019042123, "grad_norm": 1.1171875, "learning_rate": 0.00031644718872965205, "loss": 5.3859, "mean_token_accuracy": 0.23135214000940324, "num_tokens": 98292648.0, "step": 38775 }, { "entropy": 6.097874021530151, "epoch": 4.4754760530871325, "grad_norm": 0.9375, "learning_rate": 0.0003164066298395112, "loss": 5.5779, "mean_token_accuracy": 0.2002714082598686, "num_tokens": 98305553.0, "step": 38780 }, { "entropy": 6.0839455127716064, "epoch": 4.476053087132141, "grad_norm": 0.9921875, "learning_rate": 0.0003163660695566789, "loss": 5.4562, "mean_token_accuracy": 0.2160343959927559, "num_tokens": 98317236.0, "step": 38785 }, { "entropy": 5.966993093490601, "epoch": 4.476630121177149, "grad_norm": 0.96484375, "learning_rate": 0.00031632550788251936, "loss": 5.4073, "mean_token_accuracy": 0.22457791566848756, "num_tokens": 98329991.0, "step": 38790 }, { "entropy": 6.011926174163818, "epoch": 4.477207155222158, "grad_norm": 0.98828125, "learning_rate": 0.0003162849448183969, "loss": 5.5234, "mean_token_accuracy": 0.21728626638650894, "num_tokens": 98342930.0, "step": 38795 }, { "entropy": 6.074259042739868, "epoch": 4.477784189267167, "grad_norm": 1.015625, "learning_rate": 0.0003162443803656759, "loss": 5.5529, "mean_token_accuracy": 0.21781429499387742, "num_tokens": 98355358.0, "step": 38800 }, { "entropy": 6.026161241531372, "epoch": 4.4783612233121755, "grad_norm": 1.015625, "learning_rate": 0.0003162038145257206, "loss": 5.5152, "mean_token_accuracy": 0.21540616303682328, "num_tokens": 98368639.0, "step": 38805 }, { "entropy": 5.98667688369751, "epoch": 4.478938257357184, "grad_norm": 0.98828125, "learning_rate": 0.0003161632472998954, "loss": 5.459, "mean_token_accuracy": 0.21354019790887832, "num_tokens": 98381042.0, "step": 38810 }, { "entropy": 6.086393404006958, "epoch": 4.479515291402192, "grad_norm": 0.94140625, "learning_rate": 0.00031612267868956495, "loss": 5.5599, "mean_token_accuracy": 0.2123895213007927, "num_tokens": 98393987.0, "step": 38815 }, { "entropy": 5.98841667175293, "epoch": 4.480092325447202, "grad_norm": 0.92578125, "learning_rate": 0.0003160821086960936, "loss": 5.3876, "mean_token_accuracy": 0.22227954119443893, "num_tokens": 98406369.0, "step": 38820 }, { "entropy": 6.043635034561158, "epoch": 4.48066935949221, "grad_norm": 0.953125, "learning_rate": 0.00031604153732084594, "loss": 5.485, "mean_token_accuracy": 0.21418891698122025, "num_tokens": 98419175.0, "step": 38825 }, { "entropy": 6.076495361328125, "epoch": 4.481246393537218, "grad_norm": 1.0, "learning_rate": 0.0003160009645651865, "loss": 5.5823, "mean_token_accuracy": 0.203786039352417, "num_tokens": 98431422.0, "step": 38830 }, { "entropy": 6.102094507217407, "epoch": 4.481823427582228, "grad_norm": 1.1328125, "learning_rate": 0.00031596039043048005, "loss": 5.5608, "mean_token_accuracy": 0.20975770354270934, "num_tokens": 98444610.0, "step": 38835 }, { "entropy": 6.111818552017212, "epoch": 4.482400461627236, "grad_norm": 1.0859375, "learning_rate": 0.00031591981491809113, "loss": 5.4964, "mean_token_accuracy": 0.21085863262414933, "num_tokens": 98457090.0, "step": 38840 }, { "entropy": 6.059669399261475, "epoch": 4.482977495672245, "grad_norm": 1.0390625, "learning_rate": 0.00031587923802938464, "loss": 5.5375, "mean_token_accuracy": 0.20962127447128295, "num_tokens": 98469530.0, "step": 38845 }, { "entropy": 6.090096759796142, "epoch": 4.483554529717253, "grad_norm": 3.28125, "learning_rate": 0.0003158386597657252, "loss": 5.4784, "mean_token_accuracy": 0.20562033653259276, "num_tokens": 98482378.0, "step": 38850 }, { "entropy": 6.155495977401733, "epoch": 4.484131563762262, "grad_norm": 0.9296875, "learning_rate": 0.00031579808012847775, "loss": 5.603, "mean_token_accuracy": 0.2058682084083557, "num_tokens": 98495958.0, "step": 38855 }, { "entropy": 5.990966415405273, "epoch": 4.484708597807271, "grad_norm": 0.99609375, "learning_rate": 0.0003157574991190072, "loss": 5.3948, "mean_token_accuracy": 0.22254487723112107, "num_tokens": 98508665.0, "step": 38860 }, { "entropy": 5.987441062927246, "epoch": 4.485285631852279, "grad_norm": 0.984375, "learning_rate": 0.0003157169167386784, "loss": 5.501, "mean_token_accuracy": 0.2165486231446266, "num_tokens": 98521309.0, "step": 38865 }, { "entropy": 6.012189197540283, "epoch": 4.4858626658972875, "grad_norm": 0.9765625, "learning_rate": 0.0003156763329888563, "loss": 5.4295, "mean_token_accuracy": 0.2175240471959114, "num_tokens": 98534160.0, "step": 38870 }, { "entropy": 6.043825292587281, "epoch": 4.486439699942297, "grad_norm": 0.98828125, "learning_rate": 0.0003156357478709059, "loss": 5.5631, "mean_token_accuracy": 0.20687729567289354, "num_tokens": 98545770.0, "step": 38875 }, { "entropy": 6.077350521087647, "epoch": 4.487016733987305, "grad_norm": 0.9140625, "learning_rate": 0.00031559516138619244, "loss": 5.5743, "mean_token_accuracy": 0.21374419331550598, "num_tokens": 98557667.0, "step": 38880 }, { "entropy": 6.131553983688354, "epoch": 4.487593768032314, "grad_norm": 0.953125, "learning_rate": 0.0003155545735360808, "loss": 5.5127, "mean_token_accuracy": 0.21122974753379822, "num_tokens": 98569222.0, "step": 38885 }, { "entropy": 6.042634010314941, "epoch": 4.488170802077322, "grad_norm": 1.1171875, "learning_rate": 0.0003155139843219362, "loss": 5.5282, "mean_token_accuracy": 0.20985184907913207, "num_tokens": 98582771.0, "step": 38890 }, { "entropy": 6.042370176315307, "epoch": 4.488747836122331, "grad_norm": 0.9140625, "learning_rate": 0.0003154733937451239, "loss": 5.5473, "mean_token_accuracy": 0.21339697390794754, "num_tokens": 98595219.0, "step": 38895 }, { "entropy": 5.927421379089355, "epoch": 4.48932487016734, "grad_norm": 1.0234375, "learning_rate": 0.0003154328018070091, "loss": 5.301, "mean_token_accuracy": 0.2331530526280403, "num_tokens": 98607449.0, "step": 38900 }, { "entropy": 6.0977026462554935, "epoch": 4.489901904212348, "grad_norm": 1.0, "learning_rate": 0.0003153922085089571, "loss": 5.5622, "mean_token_accuracy": 0.2080818682909012, "num_tokens": 98618702.0, "step": 38905 }, { "entropy": 6.082994508743286, "epoch": 4.4904789382573576, "grad_norm": 1.015625, "learning_rate": 0.00031535161385233323, "loss": 5.5004, "mean_token_accuracy": 0.21401818841695786, "num_tokens": 98630797.0, "step": 38910 }, { "entropy": 6.07491660118103, "epoch": 4.491055972302366, "grad_norm": 1.0078125, "learning_rate": 0.00031531101783850284, "loss": 5.5688, "mean_token_accuracy": 0.20805783271789552, "num_tokens": 98642464.0, "step": 38915 }, { "entropy": 6.033314418792725, "epoch": 4.491633006347374, "grad_norm": 1.0, "learning_rate": 0.0003152704204688315, "loss": 5.4752, "mean_token_accuracy": 0.21202450543642043, "num_tokens": 98654451.0, "step": 38920 }, { "entropy": 6.072428512573242, "epoch": 4.492210040392383, "grad_norm": 0.99609375, "learning_rate": 0.00031522982174468444, "loss": 5.5286, "mean_token_accuracy": 0.2166917309165001, "num_tokens": 98667765.0, "step": 38925 }, { "entropy": 5.999984931945801, "epoch": 4.492787074437392, "grad_norm": 0.9453125, "learning_rate": 0.00031518922166742737, "loss": 5.4683, "mean_token_accuracy": 0.22029939591884612, "num_tokens": 98681996.0, "step": 38930 }, { "entropy": 6.0265637874603275, "epoch": 4.4933641084824005, "grad_norm": 0.98828125, "learning_rate": 0.0003151486202384258, "loss": 5.4606, "mean_token_accuracy": 0.21285815984010698, "num_tokens": 98694394.0, "step": 38935 }, { "entropy": 6.0405174732208256, "epoch": 4.493941142527409, "grad_norm": 0.92578125, "learning_rate": 0.00031510801745904526, "loss": 5.5394, "mean_token_accuracy": 0.2090293988585472, "num_tokens": 98706655.0, "step": 38940 }, { "entropy": 6.091063070297241, "epoch": 4.494518176572417, "grad_norm": 1.0078125, "learning_rate": 0.00031506741333065154, "loss": 5.5394, "mean_token_accuracy": 0.21001248061656952, "num_tokens": 98718623.0, "step": 38945 }, { "entropy": 6.003238582611084, "epoch": 4.495095210617427, "grad_norm": 0.94140625, "learning_rate": 0.0003150268078546103, "loss": 5.5091, "mean_token_accuracy": 0.2139189913868904, "num_tokens": 98732002.0, "step": 38950 }, { "entropy": 6.030997848510742, "epoch": 4.495672244662435, "grad_norm": 0.93359375, "learning_rate": 0.0003149862010322872, "loss": 5.4784, "mean_token_accuracy": 0.21097345203161239, "num_tokens": 98744216.0, "step": 38955 }, { "entropy": 6.019388675689697, "epoch": 4.4962492787074435, "grad_norm": 0.984375, "learning_rate": 0.0003149455928650481, "loss": 5.4755, "mean_token_accuracy": 0.2156911388039589, "num_tokens": 98755629.0, "step": 38960 }, { "entropy": 6.0697589874267575, "epoch": 4.496826312752452, "grad_norm": 1.0, "learning_rate": 0.0003149049833542589, "loss": 5.5341, "mean_token_accuracy": 0.20544422268867493, "num_tokens": 98767619.0, "step": 38965 }, { "entropy": 6.106377124786377, "epoch": 4.497403346797461, "grad_norm": 0.9375, "learning_rate": 0.00031486437250128534, "loss": 5.5258, "mean_token_accuracy": 0.20506151169538497, "num_tokens": 98779445.0, "step": 38970 }, { "entropy": 6.020062971115112, "epoch": 4.49798038084247, "grad_norm": 0.91015625, "learning_rate": 0.0003148237603074934, "loss": 5.4661, "mean_token_accuracy": 0.2236568883061409, "num_tokens": 98793433.0, "step": 38975 }, { "entropy": 6.076809215545654, "epoch": 4.498557414887478, "grad_norm": 0.98046875, "learning_rate": 0.000314783146774249, "loss": 5.5951, "mean_token_accuracy": 0.20681009739637374, "num_tokens": 98804870.0, "step": 38980 }, { "entropy": 6.022223472595215, "epoch": 4.499134448932487, "grad_norm": 0.97265625, "learning_rate": 0.00031474253190291843, "loss": 5.4706, "mean_token_accuracy": 0.21976792812347412, "num_tokens": 98818015.0, "step": 38985 }, { "entropy": 6.02209849357605, "epoch": 4.499711482977496, "grad_norm": 0.9921875, "learning_rate": 0.0003147019156948674, "loss": 5.5424, "mean_token_accuracy": 0.21284134536981583, "num_tokens": 98830496.0, "step": 38990 }, { "entropy": 6.084675073623657, "epoch": 4.500288517022504, "grad_norm": 1.0390625, "learning_rate": 0.0003146612981514621, "loss": 5.4818, "mean_token_accuracy": 0.22049425095319747, "num_tokens": 98843926.0, "step": 38995 }, { "entropy": 6.031761932373047, "epoch": 4.500865551067513, "grad_norm": 1.0078125, "learning_rate": 0.0003146206792740688, "loss": 5.483, "mean_token_accuracy": 0.21585797816514968, "num_tokens": 98855792.0, "step": 39000 }, { "epoch": 4.500865551067513, "eval_entropy": 5.8790941585489795, "eval_loss": 5.683927059173584, "eval_mean_token_accuracy": 0.21207002264584945, "eval_num_tokens": 98855792.0, "eval_runtime": 22.8507, "eval_samples_per_second": 1231.298, "eval_steps_per_second": 153.912, "step": 39000 }, { "entropy": 6.058261871337891, "epoch": 4.501442585112522, "grad_norm": 0.96875, "learning_rate": 0.0003145800590640537, "loss": 5.5797, "mean_token_accuracy": 0.20696779042482377, "num_tokens": 98866485.0, "step": 39005 }, { "entropy": 6.0534892082214355, "epoch": 4.50201961915753, "grad_norm": 1.2109375, "learning_rate": 0.0003145394375227829, "loss": 5.4257, "mean_token_accuracy": 0.22497599571943283, "num_tokens": 98878786.0, "step": 39010 }, { "entropy": 6.135503911972046, "epoch": 4.502596653202539, "grad_norm": 0.97265625, "learning_rate": 0.0003144988146516227, "loss": 5.6134, "mean_token_accuracy": 0.212575863301754, "num_tokens": 98891882.0, "step": 39015 }, { "entropy": 6.118965768814087, "epoch": 4.503173687247548, "grad_norm": 0.96484375, "learning_rate": 0.0003144581904519396, "loss": 5.5803, "mean_token_accuracy": 0.20736913681030272, "num_tokens": 98904532.0, "step": 39020 }, { "entropy": 6.067539358139038, "epoch": 4.5037507212925565, "grad_norm": 1.0078125, "learning_rate": 0.0003144175649250998, "loss": 5.4889, "mean_token_accuracy": 0.21242594122886657, "num_tokens": 98916378.0, "step": 39025 }, { "entropy": 6.091108798980713, "epoch": 4.504327755337565, "grad_norm": 1.0546875, "learning_rate": 0.00031437693807246985, "loss": 5.5891, "mean_token_accuracy": 0.20822285413742064, "num_tokens": 98929968.0, "step": 39030 }, { "entropy": 6.0288303852081295, "epoch": 4.504904789382573, "grad_norm": 0.9453125, "learning_rate": 0.00031433630989541604, "loss": 5.5164, "mean_token_accuracy": 0.20927223563194275, "num_tokens": 98943830.0, "step": 39035 }, { "entropy": 6.1323905944824215, "epoch": 4.505481823427582, "grad_norm": 0.9609375, "learning_rate": 0.0003142956803953051, "loss": 5.5545, "mean_token_accuracy": 0.21695072203874588, "num_tokens": 98956853.0, "step": 39040 }, { "entropy": 6.064871072769165, "epoch": 4.506058857472591, "grad_norm": 0.95703125, "learning_rate": 0.00031425504957350344, "loss": 5.4957, "mean_token_accuracy": 0.21694860905408858, "num_tokens": 98968422.0, "step": 39045 }, { "entropy": 6.029691934585571, "epoch": 4.5066358915175995, "grad_norm": 0.9375, "learning_rate": 0.0003142144174313777, "loss": 5.4738, "mean_token_accuracy": 0.21867966502904893, "num_tokens": 98981153.0, "step": 39050 }, { "entropy": 6.0517956733703615, "epoch": 4.507212925562608, "grad_norm": 0.93359375, "learning_rate": 0.00031417378397029445, "loss": 5.5162, "mean_token_accuracy": 0.21556487530469895, "num_tokens": 98994016.0, "step": 39055 }, { "entropy": 6.080186271667481, "epoch": 4.507789959607617, "grad_norm": 1.0078125, "learning_rate": 0.00031413314919162045, "loss": 5.456, "mean_token_accuracy": 0.21728504151105882, "num_tokens": 99006564.0, "step": 39060 }, { "entropy": 6.032404899597168, "epoch": 4.508366993652626, "grad_norm": 1.046875, "learning_rate": 0.0003140925130967224, "loss": 5.5638, "mean_token_accuracy": 0.21023759692907334, "num_tokens": 99020202.0, "step": 39065 }, { "entropy": 5.961019611358642, "epoch": 4.508944027697634, "grad_norm": 0.9765625, "learning_rate": 0.0003140518756869672, "loss": 5.4544, "mean_token_accuracy": 0.22588376253843306, "num_tokens": 99032965.0, "step": 39070 }, { "entropy": 6.044476556777954, "epoch": 4.5095210617426424, "grad_norm": 0.9140625, "learning_rate": 0.00031401123696372143, "loss": 5.5551, "mean_token_accuracy": 0.2122431591153145, "num_tokens": 99047618.0, "step": 39075 }, { "entropy": 6.174966859817505, "epoch": 4.510098095787652, "grad_norm": 1.015625, "learning_rate": 0.00031397059692835213, "loss": 5.6228, "mean_token_accuracy": 0.20695795565843583, "num_tokens": 99059866.0, "step": 39080 }, { "entropy": 6.129109907150268, "epoch": 4.51067512983266, "grad_norm": 0.87109375, "learning_rate": 0.00031392995558222615, "loss": 5.5893, "mean_token_accuracy": 0.20488440096378327, "num_tokens": 99071729.0, "step": 39085 }, { "entropy": 6.047139596939087, "epoch": 4.511252163877669, "grad_norm": 0.9453125, "learning_rate": 0.00031388931292671045, "loss": 5.4937, "mean_token_accuracy": 0.21503215581178664, "num_tokens": 99083766.0, "step": 39090 }, { "entropy": 6.013152599334717, "epoch": 4.511829197922678, "grad_norm": 0.9921875, "learning_rate": 0.000313848668963172, "loss": 5.4782, "mean_token_accuracy": 0.21693350970745087, "num_tokens": 99095110.0, "step": 39095 }, { "entropy": 5.990360593795776, "epoch": 4.512406231967686, "grad_norm": 0.99609375, "learning_rate": 0.000313808023692978, "loss": 5.5355, "mean_token_accuracy": 0.21664632707834244, "num_tokens": 99107510.0, "step": 39100 }, { "entropy": 6.0199596881866455, "epoch": 4.512983266012695, "grad_norm": 0.97265625, "learning_rate": 0.0003137673771174953, "loss": 5.4882, "mean_token_accuracy": 0.2168717622756958, "num_tokens": 99120598.0, "step": 39105 }, { "entropy": 6.093764591217041, "epoch": 4.513560300057703, "grad_norm": 0.98046875, "learning_rate": 0.00031372672923809115, "loss": 5.5957, "mean_token_accuracy": 0.20528324395418168, "num_tokens": 99133964.0, "step": 39110 }, { "entropy": 5.997952890396118, "epoch": 4.514137334102712, "grad_norm": 0.93359375, "learning_rate": 0.00031368608005613265, "loss": 5.4237, "mean_token_accuracy": 0.21976717859506606, "num_tokens": 99146739.0, "step": 39115 }, { "entropy": 6.052892732620239, "epoch": 4.514714368147721, "grad_norm": 0.96484375, "learning_rate": 0.0003136454295729871, "loss": 5.5149, "mean_token_accuracy": 0.20980237126350404, "num_tokens": 99158766.0, "step": 39120 }, { "entropy": 6.080827903747559, "epoch": 4.515291402192729, "grad_norm": 0.98046875, "learning_rate": 0.0003136047777900217, "loss": 5.5192, "mean_token_accuracy": 0.20828806459903718, "num_tokens": 99171849.0, "step": 39125 }, { "entropy": 6.003246450424195, "epoch": 4.515868436237738, "grad_norm": 0.94921875, "learning_rate": 0.0003135641247086038, "loss": 5.4754, "mean_token_accuracy": 0.21498167961835862, "num_tokens": 99183182.0, "step": 39130 }, { "entropy": 6.072053337097168, "epoch": 4.516445470282747, "grad_norm": 1.03125, "learning_rate": 0.0003135234703301008, "loss": 5.5074, "mean_token_accuracy": 0.21812089383602143, "num_tokens": 99195833.0, "step": 39135 }, { "entropy": 6.06141300201416, "epoch": 4.517022504327755, "grad_norm": 1.2421875, "learning_rate": 0.0003134828146558798, "loss": 5.4977, "mean_token_accuracy": 0.21854747235774993, "num_tokens": 99208546.0, "step": 39140 }, { "entropy": 6.058836126327515, "epoch": 4.517599538372764, "grad_norm": 0.96484375, "learning_rate": 0.00031344215768730856, "loss": 5.4879, "mean_token_accuracy": 0.2205967754125595, "num_tokens": 99220930.0, "step": 39145 }, { "entropy": 6.061733627319336, "epoch": 4.518176572417772, "grad_norm": 1.0390625, "learning_rate": 0.00031340149942575443, "loss": 5.5251, "mean_token_accuracy": 0.2117103949189186, "num_tokens": 99234578.0, "step": 39150 }, { "entropy": 6.038629341125488, "epoch": 4.518753606462782, "grad_norm": 0.98828125, "learning_rate": 0.000313360839872585, "loss": 5.5235, "mean_token_accuracy": 0.20940779894590378, "num_tokens": 99245823.0, "step": 39155 }, { "entropy": 6.0264537811279295, "epoch": 4.51933064050779, "grad_norm": 1.078125, "learning_rate": 0.00031332017902916775, "loss": 5.4488, "mean_token_accuracy": 0.21725354045629502, "num_tokens": 99258386.0, "step": 39160 }, { "entropy": 6.009280586242676, "epoch": 4.519907674552798, "grad_norm": 0.96484375, "learning_rate": 0.00031327951689687027, "loss": 5.4926, "mean_token_accuracy": 0.21567383110523225, "num_tokens": 99270648.0, "step": 39165 }, { "entropy": 6.0526360988616945, "epoch": 4.520484708597808, "grad_norm": 1.0234375, "learning_rate": 0.00031323885347706026, "loss": 5.5735, "mean_token_accuracy": 0.2092253088951111, "num_tokens": 99282678.0, "step": 39170 }, { "entropy": 6.074481534957886, "epoch": 4.521061742642816, "grad_norm": 0.9296875, "learning_rate": 0.0003131981887711055, "loss": 5.4815, "mean_token_accuracy": 0.21493065655231475, "num_tokens": 99295031.0, "step": 39175 }, { "entropy": 6.078620672225952, "epoch": 4.5216387766878245, "grad_norm": 0.90625, "learning_rate": 0.00031315752278037357, "loss": 5.5235, "mean_token_accuracy": 0.21108047366142274, "num_tokens": 99307144.0, "step": 39180 }, { "entropy": 6.004184246063232, "epoch": 4.522215810732833, "grad_norm": 0.91796875, "learning_rate": 0.00031311685550623226, "loss": 5.4431, "mean_token_accuracy": 0.21694666445255278, "num_tokens": 99320763.0, "step": 39185 }, { "entropy": 6.00265097618103, "epoch": 4.522792844777842, "grad_norm": 0.9765625, "learning_rate": 0.0003130761869500495, "loss": 5.5141, "mean_token_accuracy": 0.21193920820951462, "num_tokens": 99332833.0, "step": 39190 }, { "entropy": 6.1322413921356205, "epoch": 4.523369878822851, "grad_norm": 0.953125, "learning_rate": 0.00031303551711319317, "loss": 5.5824, "mean_token_accuracy": 0.20419093817472458, "num_tokens": 99345126.0, "step": 39195 }, { "entropy": 6.111878299713135, "epoch": 4.523946912867859, "grad_norm": 0.90625, "learning_rate": 0.00031299484599703103, "loss": 5.5811, "mean_token_accuracy": 0.21282886266708373, "num_tokens": 99358746.0, "step": 39200 }, { "entropy": 6.079991292953491, "epoch": 4.5245239469128675, "grad_norm": 1.0625, "learning_rate": 0.00031295417360293113, "loss": 5.5893, "mean_token_accuracy": 0.2062515303492546, "num_tokens": 99370496.0, "step": 39205 }, { "entropy": 6.060204935073853, "epoch": 4.525100980957877, "grad_norm": 1.1328125, "learning_rate": 0.0003129134999322615, "loss": 5.5006, "mean_token_accuracy": 0.21328499019145966, "num_tokens": 99381817.0, "step": 39210 }, { "entropy": 6.092281866073608, "epoch": 4.525678015002885, "grad_norm": 0.98828125, "learning_rate": 0.0003128728249863901, "loss": 5.5182, "mean_token_accuracy": 0.2151888594031334, "num_tokens": 99394141.0, "step": 39215 }, { "entropy": 6.0464883804321286, "epoch": 4.526255049047894, "grad_norm": 0.96484375, "learning_rate": 0.00031283214876668504, "loss": 5.5979, "mean_token_accuracy": 0.1997549131512642, "num_tokens": 99405900.0, "step": 39220 }, { "entropy": 6.1588362693786625, "epoch": 4.526832083092902, "grad_norm": 1.2421875, "learning_rate": 0.0003127914712745144, "loss": 5.5994, "mean_token_accuracy": 0.20104878395795822, "num_tokens": 99418621.0, "step": 39225 }, { "entropy": 6.04631814956665, "epoch": 4.527409117137911, "grad_norm": 1.015625, "learning_rate": 0.00031275079251124645, "loss": 5.4854, "mean_token_accuracy": 0.2172614499926567, "num_tokens": 99430276.0, "step": 39230 }, { "entropy": 6.004769897460937, "epoch": 4.52798615118292, "grad_norm": 0.921875, "learning_rate": 0.0003127101124782494, "loss": 5.4442, "mean_token_accuracy": 0.21340155154466628, "num_tokens": 99443320.0, "step": 39235 }, { "entropy": 6.0623210906982425, "epoch": 4.528563185227928, "grad_norm": 1.0078125, "learning_rate": 0.00031266943117689135, "loss": 5.5454, "mean_token_accuracy": 0.2072186976671219, "num_tokens": 99455222.0, "step": 39240 }, { "entropy": 6.15461049079895, "epoch": 4.5291402192729375, "grad_norm": 0.93359375, "learning_rate": 0.0003126287486085407, "loss": 5.6168, "mean_token_accuracy": 0.20534174293279647, "num_tokens": 99467930.0, "step": 39245 }, { "entropy": 6.07463264465332, "epoch": 4.529717253317946, "grad_norm": 1.1484375, "learning_rate": 0.0003125880647745658, "loss": 5.4782, "mean_token_accuracy": 0.21575211435556413, "num_tokens": 99479752.0, "step": 39250 }, { "entropy": 6.016558647155762, "epoch": 4.530294287362954, "grad_norm": 0.984375, "learning_rate": 0.00031254737967633506, "loss": 5.4606, "mean_token_accuracy": 0.21810299158096313, "num_tokens": 99491195.0, "step": 39255 }, { "entropy": 6.070026922225952, "epoch": 4.530871321407963, "grad_norm": 0.9375, "learning_rate": 0.00031250669331521686, "loss": 5.6088, "mean_token_accuracy": 0.2064017176628113, "num_tokens": 99504159.0, "step": 39260 }, { "entropy": 6.069992971420288, "epoch": 4.531448355452972, "grad_norm": 0.9765625, "learning_rate": 0.00031246600569257956, "loss": 5.4041, "mean_token_accuracy": 0.22241573184728622, "num_tokens": 99517395.0, "step": 39265 }, { "entropy": 6.070858955383301, "epoch": 4.5320253894979805, "grad_norm": 1.03125, "learning_rate": 0.0003124253168097918, "loss": 5.5183, "mean_token_accuracy": 0.2170992448925972, "num_tokens": 99530740.0, "step": 39270 }, { "entropy": 5.980552768707275, "epoch": 4.532602423542989, "grad_norm": 0.89453125, "learning_rate": 0.00031238462666822217, "loss": 5.4307, "mean_token_accuracy": 0.22284302711486817, "num_tokens": 99542642.0, "step": 39275 }, { "entropy": 6.010508251190186, "epoch": 4.533179457587997, "grad_norm": 0.96875, "learning_rate": 0.0003123439352692392, "loss": 5.4878, "mean_token_accuracy": 0.22187323421239852, "num_tokens": 99554584.0, "step": 39280 }, { "entropy": 6.0084432601928714, "epoch": 4.533756491633007, "grad_norm": 0.96875, "learning_rate": 0.0003123032426142114, "loss": 5.5269, "mean_token_accuracy": 0.21809304058551787, "num_tokens": 99567546.0, "step": 39285 }, { "entropy": 6.043466949462891, "epoch": 4.534333525678015, "grad_norm": 0.984375, "learning_rate": 0.00031226254870450767, "loss": 5.494, "mean_token_accuracy": 0.22058373391628266, "num_tokens": 99581154.0, "step": 39290 }, { "entropy": 6.087696218490601, "epoch": 4.5349105597230235, "grad_norm": 0.953125, "learning_rate": 0.00031222185354149655, "loss": 5.568, "mean_token_accuracy": 0.2059185966849327, "num_tokens": 99594019.0, "step": 39295 }, { "entropy": 5.973210859298706, "epoch": 4.535487593768032, "grad_norm": 1.140625, "learning_rate": 0.00031218115712654693, "loss": 5.5273, "mean_token_accuracy": 0.20920064747333528, "num_tokens": 99607529.0, "step": 39300 }, { "entropy": 6.0646647930145265, "epoch": 4.536064627813041, "grad_norm": 0.99609375, "learning_rate": 0.0003121404594610275, "loss": 5.5093, "mean_token_accuracy": 0.20972030907869338, "num_tokens": 99619853.0, "step": 39305 }, { "entropy": 6.095301580429077, "epoch": 4.53664166185805, "grad_norm": 0.94921875, "learning_rate": 0.0003120997605463073, "loss": 5.5133, "mean_token_accuracy": 0.2138122648000717, "num_tokens": 99632232.0, "step": 39310 }, { "entropy": 6.04727578163147, "epoch": 4.537218695903058, "grad_norm": 0.98046875, "learning_rate": 0.00031205906038375496, "loss": 5.5435, "mean_token_accuracy": 0.2152028948068619, "num_tokens": 99644680.0, "step": 39315 }, { "entropy": 6.027457904815674, "epoch": 4.537795729948067, "grad_norm": 0.94140625, "learning_rate": 0.0003120183589747396, "loss": 5.4443, "mean_token_accuracy": 0.21704814881086348, "num_tokens": 99657829.0, "step": 39320 }, { "entropy": 6.050464868545532, "epoch": 4.538372763993076, "grad_norm": 0.9140625, "learning_rate": 0.00031197765632063007, "loss": 5.4536, "mean_token_accuracy": 0.21014560610055924, "num_tokens": 99669932.0, "step": 39325 }, { "entropy": 6.045565462112426, "epoch": 4.538949798038084, "grad_norm": 1.015625, "learning_rate": 0.00031193695242279543, "loss": 5.464, "mean_token_accuracy": 0.22082182466983796, "num_tokens": 99683984.0, "step": 39330 }, { "entropy": 5.969738626480103, "epoch": 4.539526832083093, "grad_norm": 0.9375, "learning_rate": 0.00031189624728260475, "loss": 5.4174, "mean_token_accuracy": 0.22220737487077713, "num_tokens": 99697309.0, "step": 39335 }, { "entropy": 6.024098491668701, "epoch": 4.540103866128102, "grad_norm": 0.890625, "learning_rate": 0.00031185554090142715, "loss": 5.5312, "mean_token_accuracy": 0.21594950556755066, "num_tokens": 99711906.0, "step": 39340 }, { "entropy": 5.967256116867065, "epoch": 4.54068090017311, "grad_norm": 0.91015625, "learning_rate": 0.00031181483328063177, "loss": 5.3855, "mean_token_accuracy": 0.21761398911476135, "num_tokens": 99725181.0, "step": 39345 }, { "entropy": 6.097359275817871, "epoch": 4.541257934218119, "grad_norm": 0.90234375, "learning_rate": 0.00031177412442158763, "loss": 5.5091, "mean_token_accuracy": 0.20836860239505767, "num_tokens": 99737554.0, "step": 39350 }, { "entropy": 6.031353330612182, "epoch": 4.541834968263127, "grad_norm": 0.98046875, "learning_rate": 0.00031173341432566424, "loss": 5.5121, "mean_token_accuracy": 0.21167874336242676, "num_tokens": 99750490.0, "step": 39355 }, { "entropy": 6.024143934249878, "epoch": 4.5424120023081365, "grad_norm": 1.09375, "learning_rate": 0.00031169270299423056, "loss": 5.477, "mean_token_accuracy": 0.211247019469738, "num_tokens": 99761954.0, "step": 39360 }, { "entropy": 5.9345029354095455, "epoch": 4.542989036353145, "grad_norm": 0.9921875, "learning_rate": 0.0003116519904286562, "loss": 5.403, "mean_token_accuracy": 0.22890340983867646, "num_tokens": 99775013.0, "step": 39365 }, { "entropy": 6.060037660598755, "epoch": 4.543566070398153, "grad_norm": 0.96484375, "learning_rate": 0.0003116112766303102, "loss": 5.4674, "mean_token_accuracy": 0.21734015196561812, "num_tokens": 99788109.0, "step": 39370 }, { "entropy": 6.007438993453979, "epoch": 4.544143104443162, "grad_norm": 0.984375, "learning_rate": 0.00031157056160056217, "loss": 5.4587, "mean_token_accuracy": 0.21650406569242478, "num_tokens": 99802384.0, "step": 39375 }, { "entropy": 5.9942090034484865, "epoch": 4.544720138488171, "grad_norm": 1.0, "learning_rate": 0.0003115298453407815, "loss": 5.4231, "mean_token_accuracy": 0.21298206150531768, "num_tokens": 99814274.0, "step": 39380 }, { "entropy": 6.051714658737183, "epoch": 4.545297172533179, "grad_norm": 0.95703125, "learning_rate": 0.0003114891278523376, "loss": 5.5524, "mean_token_accuracy": 0.21761103272438048, "num_tokens": 99827202.0, "step": 39385 }, { "entropy": 5.937704229354859, "epoch": 4.545874206578188, "grad_norm": 1.765625, "learning_rate": 0.00031144840913659996, "loss": 5.3301, "mean_token_accuracy": 0.2386062115430832, "num_tokens": 99839985.0, "step": 39390 }, { "entropy": 6.057811594009399, "epoch": 4.546451240623197, "grad_norm": 0.9375, "learning_rate": 0.0003114076891949382, "loss": 5.5903, "mean_token_accuracy": 0.19804765582084655, "num_tokens": 99853399.0, "step": 39395 }, { "entropy": 5.987566184997559, "epoch": 4.547028274668206, "grad_norm": 1.1796875, "learning_rate": 0.00031136696802872195, "loss": 5.4652, "mean_token_accuracy": 0.22220586836338044, "num_tokens": 99866540.0, "step": 39400 }, { "entropy": 6.096220874786377, "epoch": 4.547605308713214, "grad_norm": 0.99609375, "learning_rate": 0.00031132624563932074, "loss": 5.5067, "mean_token_accuracy": 0.21738308072090148, "num_tokens": 99877708.0, "step": 39405 }, { "entropy": 5.959886932373047, "epoch": 4.548182342758222, "grad_norm": 1.0, "learning_rate": 0.00031128552202810424, "loss": 5.4683, "mean_token_accuracy": 0.2102986454963684, "num_tokens": 99890468.0, "step": 39410 }, { "entropy": 5.961117744445801, "epoch": 4.548759376803232, "grad_norm": 0.9921875, "learning_rate": 0.00031124479719644234, "loss": 5.4061, "mean_token_accuracy": 0.22255504727363587, "num_tokens": 99903158.0, "step": 39415 }, { "entropy": 6.066654396057129, "epoch": 4.54933641084824, "grad_norm": 0.9609375, "learning_rate": 0.0003112040711457047, "loss": 5.5403, "mean_token_accuracy": 0.20981570929288865, "num_tokens": 99914826.0, "step": 39420 }, { "entropy": 6.071909236907959, "epoch": 4.549913444893249, "grad_norm": 0.98828125, "learning_rate": 0.0003111633438772611, "loss": 5.5671, "mean_token_accuracy": 0.20716703981161116, "num_tokens": 99927403.0, "step": 39425 }, { "entropy": 5.929892730712891, "epoch": 4.550490478938257, "grad_norm": 0.98828125, "learning_rate": 0.0003111226153924813, "loss": 5.3692, "mean_token_accuracy": 0.22776197493076325, "num_tokens": 99939559.0, "step": 39430 }, { "entropy": 6.178140020370483, "epoch": 4.551067512983266, "grad_norm": 0.98828125, "learning_rate": 0.0003110818856927353, "loss": 5.5659, "mean_token_accuracy": 0.20862917900085448, "num_tokens": 99950944.0, "step": 39435 }, { "entropy": 6.027177047729492, "epoch": 4.551644547028275, "grad_norm": 1.015625, "learning_rate": 0.0003110411547793931, "loss": 5.4491, "mean_token_accuracy": 0.21976558715105057, "num_tokens": 99963608.0, "step": 39440 }, { "entropy": 6.057816457748413, "epoch": 4.552221581073283, "grad_norm": 0.984375, "learning_rate": 0.0003110004226538245, "loss": 5.6431, "mean_token_accuracy": 0.20254571586847306, "num_tokens": 99976188.0, "step": 39445 }, { "entropy": 6.089889287948608, "epoch": 4.5527986151182915, "grad_norm": 0.98046875, "learning_rate": 0.0003109596893173995, "loss": 5.5653, "mean_token_accuracy": 0.20962436199188234, "num_tokens": 99989166.0, "step": 39450 }, { "entropy": 6.0351152420043945, "epoch": 4.553375649163301, "grad_norm": 0.9765625, "learning_rate": 0.0003109189547714883, "loss": 5.4547, "mean_token_accuracy": 0.2187407210469246, "num_tokens": 100002545.0, "step": 39455 }, { "entropy": 6.0733642578125, "epoch": 4.553952683208309, "grad_norm": 1.03125, "learning_rate": 0.0003108782190174609, "loss": 5.5309, "mean_token_accuracy": 0.21088054776191711, "num_tokens": 100016268.0, "step": 39460 }, { "entropy": 6.134630966186523, "epoch": 4.554529717253318, "grad_norm": 1.03125, "learning_rate": 0.0003108374820566874, "loss": 5.5925, "mean_token_accuracy": 0.20737059116363527, "num_tokens": 100029594.0, "step": 39465 }, { "entropy": 6.086150646209717, "epoch": 4.555106751298327, "grad_norm": 0.94140625, "learning_rate": 0.000310796743890538, "loss": 5.4804, "mean_token_accuracy": 0.21270056962966918, "num_tokens": 100042207.0, "step": 39470 }, { "entropy": 6.070754623413086, "epoch": 4.555683785343335, "grad_norm": 1.0, "learning_rate": 0.00031075600452038285, "loss": 5.4744, "mean_token_accuracy": 0.22236666977405548, "num_tokens": 100055033.0, "step": 39475 }, { "entropy": 5.938803243637085, "epoch": 4.556260819388344, "grad_norm": 0.88671875, "learning_rate": 0.00031071526394759233, "loss": 5.4662, "mean_token_accuracy": 0.21735987663269044, "num_tokens": 100067595.0, "step": 39480 }, { "entropy": 6.049497938156128, "epoch": 4.556837853433352, "grad_norm": 1.0234375, "learning_rate": 0.0003106745221735366, "loss": 5.495, "mean_token_accuracy": 0.22013844400644303, "num_tokens": 100079945.0, "step": 39485 }, { "entropy": 6.106379795074463, "epoch": 4.5574148874783615, "grad_norm": 0.984375, "learning_rate": 0.000310633779199586, "loss": 5.5671, "mean_token_accuracy": 0.20960116982460023, "num_tokens": 100091942.0, "step": 39490 }, { "entropy": 6.172228717803955, "epoch": 4.55799192152337, "grad_norm": 0.96875, "learning_rate": 0.000310593035027111, "loss": 5.6157, "mean_token_accuracy": 0.2081824481487274, "num_tokens": 100104285.0, "step": 39495 }, { "entropy": 6.009035396575928, "epoch": 4.558568955568378, "grad_norm": 1.0625, "learning_rate": 0.00031055228965748194, "loss": 5.5328, "mean_token_accuracy": 0.21313058584928513, "num_tokens": 100117798.0, "step": 39500 }, { "entropy": 6.073286437988282, "epoch": 4.559145989613388, "grad_norm": 0.8828125, "learning_rate": 0.0003105115430920693, "loss": 5.518, "mean_token_accuracy": 0.21984363794326783, "num_tokens": 100131338.0, "step": 39505 }, { "entropy": 6.075874900817871, "epoch": 4.559723023658396, "grad_norm": 0.953125, "learning_rate": 0.00031047079533224356, "loss": 5.5307, "mean_token_accuracy": 0.21363597214221955, "num_tokens": 100143978.0, "step": 39510 }, { "entropy": 6.082835721969604, "epoch": 4.5603000577034045, "grad_norm": 1.1875, "learning_rate": 0.0003104300463793751, "loss": 5.4747, "mean_token_accuracy": 0.21285403668880462, "num_tokens": 100157529.0, "step": 39515 }, { "entropy": 6.051505661010742, "epoch": 4.560877091748413, "grad_norm": 0.9453125, "learning_rate": 0.00031038929623483473, "loss": 5.5091, "mean_token_accuracy": 0.22028353661298752, "num_tokens": 100170502.0, "step": 39520 }, { "entropy": 6.0016210079193115, "epoch": 4.561454125793421, "grad_norm": 0.96484375, "learning_rate": 0.00031034854489999297, "loss": 5.4024, "mean_token_accuracy": 0.2216365307569504, "num_tokens": 100183086.0, "step": 39525 }, { "entropy": 6.046122407913208, "epoch": 4.562031159838431, "grad_norm": 0.96484375, "learning_rate": 0.0003103077923762204, "loss": 5.5438, "mean_token_accuracy": 0.21107827872037888, "num_tokens": 100195237.0, "step": 39530 }, { "entropy": 6.033243989944458, "epoch": 4.562608193883439, "grad_norm": 0.93359375, "learning_rate": 0.00031026703866488784, "loss": 5.545, "mean_token_accuracy": 0.21325092166662216, "num_tokens": 100208586.0, "step": 39535 }, { "entropy": 6.03102068901062, "epoch": 4.5631852279284475, "grad_norm": 0.9609375, "learning_rate": 0.00031022628376736587, "loss": 5.4608, "mean_token_accuracy": 0.221030892431736, "num_tokens": 100221588.0, "step": 39540 }, { "entropy": 6.089952039718628, "epoch": 4.563762261973457, "grad_norm": 0.9765625, "learning_rate": 0.0003101855276850254, "loss": 5.5212, "mean_token_accuracy": 0.21016396284103395, "num_tokens": 100234978.0, "step": 39545 }, { "entropy": 6.003946018218994, "epoch": 4.564339296018465, "grad_norm": 1.03125, "learning_rate": 0.00031014477041923724, "loss": 5.4236, "mean_token_accuracy": 0.22133288383483887, "num_tokens": 100249248.0, "step": 39550 }, { "entropy": 6.041824102401733, "epoch": 4.564916330063474, "grad_norm": 1.0078125, "learning_rate": 0.0003101040119713721, "loss": 5.5975, "mean_token_accuracy": 0.2022898405790329, "num_tokens": 100263047.0, "step": 39555 }, { "entropy": 6.171460723876953, "epoch": 4.565493364108482, "grad_norm": 1.046875, "learning_rate": 0.00031006325234280097, "loss": 5.6387, "mean_token_accuracy": 0.20130623281002044, "num_tokens": 100276220.0, "step": 39560 }, { "entropy": 6.132236003875732, "epoch": 4.566070398153491, "grad_norm": 1.0546875, "learning_rate": 0.00031002249153489473, "loss": 5.5486, "mean_token_accuracy": 0.2062343180179596, "num_tokens": 100287946.0, "step": 39565 }, { "entropy": 5.989096307754517, "epoch": 4.5666474321985, "grad_norm": 0.9140625, "learning_rate": 0.00030998172954902446, "loss": 5.4275, "mean_token_accuracy": 0.22464457750320435, "num_tokens": 100300023.0, "step": 39570 }, { "entropy": 5.866420125961303, "epoch": 4.567224466243508, "grad_norm": 1.0078125, "learning_rate": 0.0003099409663865611, "loss": 5.3013, "mean_token_accuracy": 0.23131477534770967, "num_tokens": 100312686.0, "step": 39575 }, { "entropy": 6.02342586517334, "epoch": 4.5678015002885175, "grad_norm": 0.94140625, "learning_rate": 0.00030990020204887557, "loss": 5.5141, "mean_token_accuracy": 0.21159286201000213, "num_tokens": 100325833.0, "step": 39580 }, { "entropy": 5.975371789932251, "epoch": 4.568378534333526, "grad_norm": 1.078125, "learning_rate": 0.0003098594365373392, "loss": 5.4306, "mean_token_accuracy": 0.22996634244918823, "num_tokens": 100339386.0, "step": 39585 }, { "entropy": 6.05181360244751, "epoch": 4.568955568378534, "grad_norm": 1.0, "learning_rate": 0.00030981866985332305, "loss": 5.4862, "mean_token_accuracy": 0.20718948692083358, "num_tokens": 100350812.0, "step": 39590 }, { "entropy": 6.129055595397949, "epoch": 4.569532602423543, "grad_norm": 1.0703125, "learning_rate": 0.0003097779019981981, "loss": 5.5787, "mean_token_accuracy": 0.20898860692977905, "num_tokens": 100363576.0, "step": 39595 }, { "entropy": 5.9428795337677, "epoch": 4.570109636468551, "grad_norm": 0.92578125, "learning_rate": 0.0003097371329733357, "loss": 5.4685, "mean_token_accuracy": 0.21806725561618806, "num_tokens": 100376137.0, "step": 39600 }, { "entropy": 5.9458106517791744, "epoch": 4.5706866705135605, "grad_norm": 0.8984375, "learning_rate": 0.00030969636278010715, "loss": 5.3976, "mean_token_accuracy": 0.2217326581478119, "num_tokens": 100389474.0, "step": 39605 }, { "entropy": 6.052435636520386, "epoch": 4.571263704558569, "grad_norm": 0.9609375, "learning_rate": 0.0003096555914198837, "loss": 5.5398, "mean_token_accuracy": 0.2088010311126709, "num_tokens": 100401562.0, "step": 39610 }, { "entropy": 6.070488452911377, "epoch": 4.571840738603577, "grad_norm": 0.92578125, "learning_rate": 0.0003096148188940366, "loss": 5.4801, "mean_token_accuracy": 0.21927041113376616, "num_tokens": 100413711.0, "step": 39615 }, { "entropy": 6.017584371566772, "epoch": 4.572417772648587, "grad_norm": 1.0, "learning_rate": 0.0003095740452039372, "loss": 5.4622, "mean_token_accuracy": 0.21482844203710555, "num_tokens": 100425977.0, "step": 39620 }, { "entropy": 6.029469776153564, "epoch": 4.572994806693595, "grad_norm": 0.97265625, "learning_rate": 0.000309533270350957, "loss": 5.5211, "mean_token_accuracy": 0.2164745584130287, "num_tokens": 100439167.0, "step": 39625 }, { "entropy": 6.083765697479248, "epoch": 4.5735718407386035, "grad_norm": 0.98046875, "learning_rate": 0.00030949249433646746, "loss": 5.663, "mean_token_accuracy": 0.20389586240053176, "num_tokens": 100451336.0, "step": 39630 }, { "entropy": 6.1409605026245115, "epoch": 4.574148874783612, "grad_norm": 1.0625, "learning_rate": 0.00030945171716184003, "loss": 5.5238, "mean_token_accuracy": 0.21577880829572677, "num_tokens": 100463401.0, "step": 39635 }, { "entropy": 6.055810546875, "epoch": 4.574725908828621, "grad_norm": 0.8984375, "learning_rate": 0.00030941093882844606, "loss": 5.5762, "mean_token_accuracy": 0.21321677565574645, "num_tokens": 100476594.0, "step": 39640 }, { "entropy": 6.093710708618164, "epoch": 4.57530294287363, "grad_norm": 0.9296875, "learning_rate": 0.0003093701593376574, "loss": 5.5835, "mean_token_accuracy": 0.2159482792019844, "num_tokens": 100489140.0, "step": 39645 }, { "entropy": 6.105528020858765, "epoch": 4.575879976918638, "grad_norm": 0.93359375, "learning_rate": 0.00030932937869084545, "loss": 5.5576, "mean_token_accuracy": 0.21341225802898406, "num_tokens": 100501831.0, "step": 39650 }, { "entropy": 6.091807174682617, "epoch": 4.576457010963647, "grad_norm": 0.984375, "learning_rate": 0.0003092885968893819, "loss": 5.4983, "mean_token_accuracy": 0.2166688397526741, "num_tokens": 100513814.0, "step": 39655 }, { "entropy": 6.077985763549805, "epoch": 4.577034045008656, "grad_norm": 1.0078125, "learning_rate": 0.00030924781393463835, "loss": 5.5578, "mean_token_accuracy": 0.20960844308137894, "num_tokens": 100525913.0, "step": 39660 }, { "entropy": 6.158643293380737, "epoch": 4.577611079053664, "grad_norm": 1.0078125, "learning_rate": 0.00030920702982798663, "loss": 5.6545, "mean_token_accuracy": 0.20176791548728942, "num_tokens": 100538802.0, "step": 39665 }, { "entropy": 6.098426246643067, "epoch": 4.578188113098673, "grad_norm": 0.91796875, "learning_rate": 0.00030916624457079855, "loss": 5.5654, "mean_token_accuracy": 0.20966840535402298, "num_tokens": 100552839.0, "step": 39670 }, { "entropy": 6.100569343566894, "epoch": 4.578765147143681, "grad_norm": 0.9375, "learning_rate": 0.0003091254581644458, "loss": 5.5344, "mean_token_accuracy": 0.21703532934188843, "num_tokens": 100565642.0, "step": 39675 }, { "entropy": 6.055329179763794, "epoch": 4.57934218118869, "grad_norm": 0.9453125, "learning_rate": 0.00030908467061030004, "loss": 5.4573, "mean_token_accuracy": 0.21789049059152604, "num_tokens": 100577217.0, "step": 39680 }, { "entropy": 6.088983106613159, "epoch": 4.579919215233699, "grad_norm": 1.0078125, "learning_rate": 0.0003090438819097335, "loss": 5.5893, "mean_token_accuracy": 0.21278050541877747, "num_tokens": 100589405.0, "step": 39685 }, { "entropy": 6.055174207687378, "epoch": 4.580496249278707, "grad_norm": 0.93359375, "learning_rate": 0.0003090030920641178, "loss": 5.5525, "mean_token_accuracy": 0.20813312977552414, "num_tokens": 100601739.0, "step": 39690 }, { "entropy": 6.162087392807007, "epoch": 4.581073283323716, "grad_norm": 0.98046875, "learning_rate": 0.00030896230107482504, "loss": 5.6462, "mean_token_accuracy": 0.20202667713165284, "num_tokens": 100615077.0, "step": 39695 }, { "entropy": 5.974533557891846, "epoch": 4.581650317368725, "grad_norm": 0.91796875, "learning_rate": 0.00030892150894322717, "loss": 5.4887, "mean_token_accuracy": 0.2161990523338318, "num_tokens": 100628352.0, "step": 39700 }, { "entropy": 6.023526668548584, "epoch": 4.582227351413733, "grad_norm": 1.03125, "learning_rate": 0.00030888071567069614, "loss": 5.5737, "mean_token_accuracy": 0.2099379912018776, "num_tokens": 100640826.0, "step": 39705 }, { "entropy": 6.041655206680298, "epoch": 4.582804385458742, "grad_norm": 1.0625, "learning_rate": 0.00030883992125860406, "loss": 5.5127, "mean_token_accuracy": 0.21921360045671462, "num_tokens": 100652102.0, "step": 39710 }, { "entropy": 6.172430992126465, "epoch": 4.583381419503751, "grad_norm": 0.93359375, "learning_rate": 0.0003087991257083231, "loss": 5.6361, "mean_token_accuracy": 0.20719803720712662, "num_tokens": 100665722.0, "step": 39715 }, { "entropy": 6.005380058288575, "epoch": 4.583958453548759, "grad_norm": 0.94921875, "learning_rate": 0.0003087583290212253, "loss": 5.4569, "mean_token_accuracy": 0.2170966923236847, "num_tokens": 100677910.0, "step": 39720 }, { "entropy": 6.049957370758056, "epoch": 4.584535487593768, "grad_norm": 0.91796875, "learning_rate": 0.0003087175311986828, "loss": 5.5447, "mean_token_accuracy": 0.21826043725013733, "num_tokens": 100690187.0, "step": 39725 }, { "entropy": 5.901098299026489, "epoch": 4.585112521638777, "grad_norm": 1.015625, "learning_rate": 0.00030867673224206806, "loss": 5.365, "mean_token_accuracy": 0.23597146272659303, "num_tokens": 100702942.0, "step": 39730 }, { "entropy": 6.058048057556152, "epoch": 4.585689555683786, "grad_norm": 1.0, "learning_rate": 0.000308635932152753, "loss": 5.5214, "mean_token_accuracy": 0.21089319437742232, "num_tokens": 100716716.0, "step": 39735 }, { "entropy": 6.122119188308716, "epoch": 4.586266589728794, "grad_norm": 0.91015625, "learning_rate": 0.00030859513093211015, "loss": 5.6285, "mean_token_accuracy": 0.21020228713750838, "num_tokens": 100731017.0, "step": 39740 }, { "entropy": 6.066273880004883, "epoch": 4.586843623773802, "grad_norm": 0.890625, "learning_rate": 0.0003085543285815117, "loss": 5.4738, "mean_token_accuracy": 0.21074859648942948, "num_tokens": 100743546.0, "step": 39745 }, { "entropy": 5.9989426612854, "epoch": 4.587420657818812, "grad_norm": 0.89453125, "learning_rate": 0.00030851352510233017, "loss": 5.4501, "mean_token_accuracy": 0.21823455393314362, "num_tokens": 100756668.0, "step": 39750 }, { "entropy": 6.023809289932251, "epoch": 4.58799769186382, "grad_norm": 0.9609375, "learning_rate": 0.0003084727204959378, "loss": 5.525, "mean_token_accuracy": 0.21621302813291549, "num_tokens": 100769491.0, "step": 39755 }, { "entropy": 6.068006563186645, "epoch": 4.5885747259088285, "grad_norm": 0.90625, "learning_rate": 0.0003084319147637072, "loss": 5.531, "mean_token_accuracy": 0.20983080416917801, "num_tokens": 100784434.0, "step": 39760 }, { "entropy": 6.05798454284668, "epoch": 4.589151759953837, "grad_norm": 0.875, "learning_rate": 0.00030839110790701057, "loss": 5.5055, "mean_token_accuracy": 0.20944105833768845, "num_tokens": 100797638.0, "step": 39765 }, { "entropy": 6.047077178955078, "epoch": 4.589728793998846, "grad_norm": 1.015625, "learning_rate": 0.00030835029992722074, "loss": 5.505, "mean_token_accuracy": 0.21706412136554717, "num_tokens": 100810542.0, "step": 39770 }, { "entropy": 6.017255973815918, "epoch": 4.590305828043855, "grad_norm": 0.984375, "learning_rate": 0.00030830949082571015, "loss": 5.4978, "mean_token_accuracy": 0.21799633353948594, "num_tokens": 100822476.0, "step": 39775 }, { "entropy": 6.054379940032959, "epoch": 4.590882862088863, "grad_norm": 1.0078125, "learning_rate": 0.0003082686806038513, "loss": 5.4226, "mean_token_accuracy": 0.2249370813369751, "num_tokens": 100834990.0, "step": 39780 }, { "entropy": 6.054190635681152, "epoch": 4.5914598961338715, "grad_norm": 1.0, "learning_rate": 0.000308227869263017, "loss": 5.5095, "mean_token_accuracy": 0.21247874498367308, "num_tokens": 100846308.0, "step": 39785 }, { "entropy": 6.019290447235107, "epoch": 4.592036930178881, "grad_norm": 0.96484375, "learning_rate": 0.0003081870568045798, "loss": 5.5334, "mean_token_accuracy": 0.20970378667116166, "num_tokens": 100860326.0, "step": 39790 }, { "entropy": 5.990709209442139, "epoch": 4.592613964223889, "grad_norm": 0.921875, "learning_rate": 0.00030814624322991237, "loss": 5.5024, "mean_token_accuracy": 0.21360168159008025, "num_tokens": 100872304.0, "step": 39795 }, { "entropy": 6.073654365539551, "epoch": 4.593190998268898, "grad_norm": 1.0078125, "learning_rate": 0.0003081054285403875, "loss": 5.4861, "mean_token_accuracy": 0.21650294661521913, "num_tokens": 100885387.0, "step": 39800 }, { "entropy": 6.08500337600708, "epoch": 4.593768032313907, "grad_norm": 0.96875, "learning_rate": 0.000308064612737378, "loss": 5.5446, "mean_token_accuracy": 0.21620493829250337, "num_tokens": 100898457.0, "step": 39805 }, { "entropy": 6.044233942031861, "epoch": 4.594345066358915, "grad_norm": 0.96484375, "learning_rate": 0.0003080237958222567, "loss": 5.459, "mean_token_accuracy": 0.2133478432893753, "num_tokens": 100911419.0, "step": 39810 }, { "entropy": 5.9902441024780275, "epoch": 4.594922100403924, "grad_norm": 0.984375, "learning_rate": 0.0003079829777963965, "loss": 5.4638, "mean_token_accuracy": 0.21956752687692643, "num_tokens": 100924195.0, "step": 39815 }, { "entropy": 6.01695237159729, "epoch": 4.595499134448932, "grad_norm": 0.98828125, "learning_rate": 0.00030794215866117015, "loss": 5.4651, "mean_token_accuracy": 0.2226399302482605, "num_tokens": 100936699.0, "step": 39820 }, { "entropy": 5.903493928909302, "epoch": 4.5960761684939415, "grad_norm": 0.91015625, "learning_rate": 0.00030790133841795064, "loss": 5.36, "mean_token_accuracy": 0.23130894601345062, "num_tokens": 100949381.0, "step": 39825 }, { "entropy": 6.0256048202514645, "epoch": 4.59665320253895, "grad_norm": 0.98046875, "learning_rate": 0.00030786051706811095, "loss": 5.4577, "mean_token_accuracy": 0.21627974212169648, "num_tokens": 100963139.0, "step": 39830 }, { "entropy": 6.092518377304077, "epoch": 4.597230236583958, "grad_norm": 0.90625, "learning_rate": 0.0003078196946130242, "loss": 5.5805, "mean_token_accuracy": 0.20136864483356476, "num_tokens": 100976723.0, "step": 39835 }, { "entropy": 6.006163597106934, "epoch": 4.597807270628967, "grad_norm": 1.0546875, "learning_rate": 0.0003077788710540632, "loss": 5.5018, "mean_token_accuracy": 0.21340110898017883, "num_tokens": 100989563.0, "step": 39840 }, { "entropy": 6.088361072540283, "epoch": 4.598384304673976, "grad_norm": 0.93359375, "learning_rate": 0.00030773804639260124, "loss": 5.5261, "mean_token_accuracy": 0.2132933869957924, "num_tokens": 101002182.0, "step": 39845 }, { "entropy": 6.10531702041626, "epoch": 4.5989613387189845, "grad_norm": 0.8359375, "learning_rate": 0.0003076972206300113, "loss": 5.539, "mean_token_accuracy": 0.20818218737840652, "num_tokens": 101015332.0, "step": 39850 }, { "entropy": 5.935640001296997, "epoch": 4.599538372763993, "grad_norm": 1.046875, "learning_rate": 0.0003076563937676666, "loss": 5.3636, "mean_token_accuracy": 0.21997026354074478, "num_tokens": 101027138.0, "step": 39855 }, { "entropy": 5.979724788665772, "epoch": 4.600115406809001, "grad_norm": 0.92578125, "learning_rate": 0.0003076155658069403, "loss": 5.4803, "mean_token_accuracy": 0.21426504403352736, "num_tokens": 101039843.0, "step": 39860 }, { "entropy": 6.104697799682617, "epoch": 4.600692440854011, "grad_norm": 0.96875, "learning_rate": 0.0003075747367492056, "loss": 5.5811, "mean_token_accuracy": 0.21186555922031403, "num_tokens": 101052123.0, "step": 39865 }, { "entropy": 5.999017763137817, "epoch": 4.601269474899019, "grad_norm": 0.890625, "learning_rate": 0.0003075339065958359, "loss": 5.4436, "mean_token_accuracy": 0.21938565522432327, "num_tokens": 101065391.0, "step": 39870 }, { "entropy": 6.067542982101441, "epoch": 4.6018465089440275, "grad_norm": 1.0, "learning_rate": 0.00030749307534820445, "loss": 5.4892, "mean_token_accuracy": 0.21351806819438934, "num_tokens": 101076499.0, "step": 39875 }, { "entropy": 6.085097885131836, "epoch": 4.602423542989037, "grad_norm": 0.94921875, "learning_rate": 0.00030745224300768445, "loss": 5.5694, "mean_token_accuracy": 0.21838047802448274, "num_tokens": 101090272.0, "step": 39880 }, { "entropy": 6.068652582168579, "epoch": 4.603000577034045, "grad_norm": 0.9609375, "learning_rate": 0.00030741140957564944, "loss": 5.5351, "mean_token_accuracy": 0.2065625548362732, "num_tokens": 101102656.0, "step": 39885 }, { "entropy": 5.951930809020996, "epoch": 4.603577611079054, "grad_norm": 1.015625, "learning_rate": 0.0003073705750534727, "loss": 5.3901, "mean_token_accuracy": 0.22713368386030197, "num_tokens": 101115081.0, "step": 39890 }, { "entropy": 6.0828031539917, "epoch": 4.604154645124062, "grad_norm": 0.953125, "learning_rate": 0.0003073297394425278, "loss": 5.5927, "mean_token_accuracy": 0.21093661934137345, "num_tokens": 101126959.0, "step": 39895 }, { "entropy": 6.097988939285278, "epoch": 4.604731679169071, "grad_norm": 0.99609375, "learning_rate": 0.0003072889027441881, "loss": 5.4927, "mean_token_accuracy": 0.21615091115236282, "num_tokens": 101139483.0, "step": 39900 }, { "entropy": 6.056278038024902, "epoch": 4.60530871321408, "grad_norm": 0.94140625, "learning_rate": 0.0003072480649598274, "loss": 5.5813, "mean_token_accuracy": 0.20850392282009125, "num_tokens": 101152248.0, "step": 39905 }, { "entropy": 6.082311487197876, "epoch": 4.605885747259088, "grad_norm": 0.9609375, "learning_rate": 0.0003072072260908188, "loss": 5.5373, "mean_token_accuracy": 0.2132813647389412, "num_tokens": 101164969.0, "step": 39910 }, { "entropy": 5.982616806030274, "epoch": 4.606462781304097, "grad_norm": 0.96484375, "learning_rate": 0.00030716638613853623, "loss": 5.3876, "mean_token_accuracy": 0.22186468690633773, "num_tokens": 101179328.0, "step": 39915 }, { "entropy": 6.002566337585449, "epoch": 4.607039815349106, "grad_norm": 0.96875, "learning_rate": 0.0003071255451043533, "loss": 5.5026, "mean_token_accuracy": 0.21773656755685805, "num_tokens": 101193068.0, "step": 39920 }, { "entropy": 6.042377567291259, "epoch": 4.607616849394114, "grad_norm": 1.0546875, "learning_rate": 0.0003070847029896436, "loss": 5.5407, "mean_token_accuracy": 0.2098624274134636, "num_tokens": 101204619.0, "step": 39925 }, { "entropy": 6.002839469909668, "epoch": 4.608193883439123, "grad_norm": 1.0234375, "learning_rate": 0.0003070438597957808, "loss": 5.4674, "mean_token_accuracy": 0.22082670032978058, "num_tokens": 101217105.0, "step": 39930 }, { "entropy": 5.99722728729248, "epoch": 4.608770917484131, "grad_norm": 0.98828125, "learning_rate": 0.00030700301552413875, "loss": 5.432, "mean_token_accuracy": 0.22525749504566192, "num_tokens": 101229354.0, "step": 39935 }, { "entropy": 5.989676141738892, "epoch": 4.6093479515291405, "grad_norm": 0.98828125, "learning_rate": 0.0003069621701760912, "loss": 5.4841, "mean_token_accuracy": 0.2130702406167984, "num_tokens": 101242027.0, "step": 39940 }, { "entropy": 6.0434986591339115, "epoch": 4.609924985574149, "grad_norm": 0.9765625, "learning_rate": 0.0003069213237530118, "loss": 5.485, "mean_token_accuracy": 0.21681522727012634, "num_tokens": 101254494.0, "step": 39945 }, { "entropy": 6.088327884674072, "epoch": 4.610502019619157, "grad_norm": 0.96484375, "learning_rate": 0.00030688047625627464, "loss": 5.4885, "mean_token_accuracy": 0.21699120700359345, "num_tokens": 101266951.0, "step": 39950 }, { "entropy": 6.107674312591553, "epoch": 4.611079053664167, "grad_norm": 0.8984375, "learning_rate": 0.0003068396276872534, "loss": 5.5382, "mean_token_accuracy": 0.21126474142074586, "num_tokens": 101280983.0, "step": 39955 }, { "entropy": 6.027893781661987, "epoch": 4.611656087709175, "grad_norm": 1.0078125, "learning_rate": 0.0003067987780473222, "loss": 5.4854, "mean_token_accuracy": 0.21899836659431457, "num_tokens": 101294107.0, "step": 39960 }, { "entropy": 6.105498504638672, "epoch": 4.612233121754183, "grad_norm": 0.9921875, "learning_rate": 0.00030675792733785484, "loss": 5.5955, "mean_token_accuracy": 0.20831957459449768, "num_tokens": 101307313.0, "step": 39965 }, { "entropy": 6.05607237815857, "epoch": 4.612810155799192, "grad_norm": 0.9296875, "learning_rate": 0.0003067170755602254, "loss": 5.4696, "mean_token_accuracy": 0.20868636220693587, "num_tokens": 101320437.0, "step": 39970 }, { "entropy": 6.040258884429932, "epoch": 4.613387189844201, "grad_norm": 0.83203125, "learning_rate": 0.00030667622271580785, "loss": 5.5135, "mean_token_accuracy": 0.21233072876930237, "num_tokens": 101333798.0, "step": 39975 }, { "entropy": 5.98102560043335, "epoch": 4.61396422388921, "grad_norm": 0.96875, "learning_rate": 0.0003066353688059763, "loss": 5.5177, "mean_token_accuracy": 0.2155057445168495, "num_tokens": 101346355.0, "step": 39980 }, { "entropy": 6.022253847122192, "epoch": 4.614541257934218, "grad_norm": 0.96875, "learning_rate": 0.0003065945138321049, "loss": 5.4791, "mean_token_accuracy": 0.22370898723602295, "num_tokens": 101359882.0, "step": 39985 }, { "entropy": 6.06699538230896, "epoch": 4.615118291979226, "grad_norm": 1.015625, "learning_rate": 0.00030655365779556773, "loss": 5.5047, "mean_token_accuracy": 0.2193661227822304, "num_tokens": 101371009.0, "step": 39990 }, { "entropy": 6.093859767913818, "epoch": 4.615695326024236, "grad_norm": 0.9375, "learning_rate": 0.0003065128006977388, "loss": 5.5473, "mean_token_accuracy": 0.2165049284696579, "num_tokens": 101384570.0, "step": 39995 }, { "entropy": 5.958289337158203, "epoch": 4.616272360069244, "grad_norm": 0.98046875, "learning_rate": 0.00030647194253999256, "loss": 5.4093, "mean_token_accuracy": 0.2202360600233078, "num_tokens": 101398104.0, "step": 40000 }, { "entropy": 6.111950206756592, "epoch": 4.6168493941142525, "grad_norm": 1.03125, "learning_rate": 0.00030643108332370316, "loss": 5.5213, "mean_token_accuracy": 0.21204749047756194, "num_tokens": 101409790.0, "step": 40005 }, { "entropy": 6.075001811981201, "epoch": 4.617426428159261, "grad_norm": 1.0078125, "learning_rate": 0.0003063902230502449, "loss": 5.566, "mean_token_accuracy": 0.20609041303396225, "num_tokens": 101421350.0, "step": 40010 }, { "entropy": 6.0637177467346195, "epoch": 4.61800346220427, "grad_norm": 1.0078125, "learning_rate": 0.00030634936172099206, "loss": 5.5843, "mean_token_accuracy": 0.20862679928541183, "num_tokens": 101432423.0, "step": 40015 }, { "entropy": 6.063412141799927, "epoch": 4.618580496249279, "grad_norm": 1.0078125, "learning_rate": 0.00030630849933731903, "loss": 5.5406, "mean_token_accuracy": 0.21451467275619507, "num_tokens": 101443706.0, "step": 40020 }, { "entropy": 5.93739128112793, "epoch": 4.619157530294287, "grad_norm": 1.03125, "learning_rate": 0.0003062676359006001, "loss": 5.3475, "mean_token_accuracy": 0.22942973524332047, "num_tokens": 101456524.0, "step": 40025 }, { "entropy": 6.048275899887085, "epoch": 4.619734564339296, "grad_norm": 0.96875, "learning_rate": 0.00030622677141220987, "loss": 5.4492, "mean_token_accuracy": 0.22029660642147064, "num_tokens": 101469623.0, "step": 40030 }, { "entropy": 6.051504135131836, "epoch": 4.620311598384305, "grad_norm": 1.015625, "learning_rate": 0.0003061859058735227, "loss": 5.5085, "mean_token_accuracy": 0.211344350874424, "num_tokens": 101483109.0, "step": 40035 }, { "entropy": 6.009643936157227, "epoch": 4.620888632429313, "grad_norm": 1.0078125, "learning_rate": 0.000306145039285913, "loss": 5.4181, "mean_token_accuracy": 0.21842905580997468, "num_tokens": 101494181.0, "step": 40040 }, { "entropy": 6.048507738113403, "epoch": 4.621465666474322, "grad_norm": 1.0078125, "learning_rate": 0.00030610417165075537, "loss": 5.4857, "mean_token_accuracy": 0.2160505011677742, "num_tokens": 101506221.0, "step": 40045 }, { "entropy": 6.060896921157837, "epoch": 4.622042700519331, "grad_norm": 0.9375, "learning_rate": 0.0003060633029694245, "loss": 5.5689, "mean_token_accuracy": 0.21058838963508605, "num_tokens": 101519953.0, "step": 40050 }, { "entropy": 6.114691209793091, "epoch": 4.622619734564339, "grad_norm": 0.98046875, "learning_rate": 0.00030602243324329473, "loss": 5.5082, "mean_token_accuracy": 0.21910332888364792, "num_tokens": 101532720.0, "step": 40055 }, { "entropy": 6.052140951156616, "epoch": 4.623196768609348, "grad_norm": 0.9375, "learning_rate": 0.00030598156247374085, "loss": 5.5625, "mean_token_accuracy": 0.20924121141433716, "num_tokens": 101545205.0, "step": 40060 }, { "entropy": 6.13967981338501, "epoch": 4.623773802654356, "grad_norm": 0.96875, "learning_rate": 0.00030594069066213755, "loss": 5.6257, "mean_token_accuracy": 0.20198575556278228, "num_tokens": 101559373.0, "step": 40065 }, { "entropy": 6.181623268127441, "epoch": 4.6243508366993655, "grad_norm": 0.9296875, "learning_rate": 0.0003058998178098595, "loss": 5.6248, "mean_token_accuracy": 0.20573222637176514, "num_tokens": 101571162.0, "step": 40070 }, { "entropy": 6.122658681869507, "epoch": 4.624927870744374, "grad_norm": 0.94140625, "learning_rate": 0.0003058589439182813, "loss": 5.6034, "mean_token_accuracy": 0.20781558603048325, "num_tokens": 101583182.0, "step": 40075 }, { "entropy": 6.0718262672424315, "epoch": 4.625504904789382, "grad_norm": 0.9609375, "learning_rate": 0.00030581806898877803, "loss": 5.5186, "mean_token_accuracy": 0.2113463893532753, "num_tokens": 101596332.0, "step": 40080 }, { "entropy": 6.070315790176392, "epoch": 4.626081938834391, "grad_norm": 0.96484375, "learning_rate": 0.00030577719302272424, "loss": 5.4949, "mean_token_accuracy": 0.21204714328050614, "num_tokens": 101607455.0, "step": 40085 }, { "entropy": 5.961989545822144, "epoch": 4.6266589728794, "grad_norm": 1.015625, "learning_rate": 0.0003057363160214948, "loss": 5.4431, "mean_token_accuracy": 0.22714711725711823, "num_tokens": 101620331.0, "step": 40090 }, { "entropy": 6.012278985977173, "epoch": 4.6272360069244085, "grad_norm": 0.94921875, "learning_rate": 0.0003056954379864648, "loss": 5.5276, "mean_token_accuracy": 0.20908010005950928, "num_tokens": 101632817.0, "step": 40095 }, { "entropy": 5.9790740489959715, "epoch": 4.627813040969417, "grad_norm": 1.0078125, "learning_rate": 0.00030565455891900877, "loss": 5.4614, "mean_token_accuracy": 0.21819052398204802, "num_tokens": 101644677.0, "step": 40100 }, { "entropy": 6.110869121551514, "epoch": 4.628390075014426, "grad_norm": 0.94921875, "learning_rate": 0.00030561367882050197, "loss": 5.6214, "mean_token_accuracy": 0.2094668596982956, "num_tokens": 101655835.0, "step": 40105 }, { "entropy": 6.145654582977295, "epoch": 4.628967109059435, "grad_norm": 0.96875, "learning_rate": 0.0003055727976923193, "loss": 5.6142, "mean_token_accuracy": 0.20257598310709, "num_tokens": 101668373.0, "step": 40110 }, { "entropy": 6.056234979629517, "epoch": 4.629544143104443, "grad_norm": 0.99609375, "learning_rate": 0.00030553191553583584, "loss": 5.5188, "mean_token_accuracy": 0.20837038308382033, "num_tokens": 101680711.0, "step": 40115 }, { "entropy": 6.049994277954101, "epoch": 4.6301211771494515, "grad_norm": 0.98828125, "learning_rate": 0.0003054910323524265, "loss": 5.4742, "mean_token_accuracy": 0.22557793706655502, "num_tokens": 101693795.0, "step": 40120 }, { "entropy": 5.994244766235352, "epoch": 4.630698211194461, "grad_norm": 0.9375, "learning_rate": 0.0003054501481434664, "loss": 5.4556, "mean_token_accuracy": 0.2223817527294159, "num_tokens": 101707223.0, "step": 40125 }, { "entropy": 6.081955194473267, "epoch": 4.631275245239469, "grad_norm": 0.9609375, "learning_rate": 0.0003054092629103307, "loss": 5.5473, "mean_token_accuracy": 0.2087576672434807, "num_tokens": 101719325.0, "step": 40130 }, { "entropy": 6.048444652557373, "epoch": 4.631852279284478, "grad_norm": 1.0, "learning_rate": 0.0003053683766543946, "loss": 5.4777, "mean_token_accuracy": 0.22106947898864746, "num_tokens": 101733033.0, "step": 40135 }, { "entropy": 6.004821109771728, "epoch": 4.632429313329487, "grad_norm": 0.97265625, "learning_rate": 0.00030532748937703313, "loss": 5.4496, "mean_token_accuracy": 0.20908743888139725, "num_tokens": 101745633.0, "step": 40140 }, { "entropy": 6.111246776580811, "epoch": 4.633006347374495, "grad_norm": 0.9609375, "learning_rate": 0.0003052866010796218, "loss": 5.5116, "mean_token_accuracy": 0.2124009683728218, "num_tokens": 101757290.0, "step": 40145 }, { "entropy": 5.997294569015503, "epoch": 4.633583381419504, "grad_norm": 1.1640625, "learning_rate": 0.0003052457117635355, "loss": 5.3963, "mean_token_accuracy": 0.22513843923807145, "num_tokens": 101770275.0, "step": 40150 }, { "entropy": 6.032103252410889, "epoch": 4.634160415464512, "grad_norm": 0.921875, "learning_rate": 0.0003052048214301498, "loss": 5.5333, "mean_token_accuracy": 0.22218757569789888, "num_tokens": 101784463.0, "step": 40155 }, { "entropy": 5.9645768165588375, "epoch": 4.634737449509521, "grad_norm": 1.0390625, "learning_rate": 0.00030516393008083993, "loss": 5.3772, "mean_token_accuracy": 0.230370232462883, "num_tokens": 101798474.0, "step": 40160 }, { "entropy": 6.090016412734985, "epoch": 4.63531448355453, "grad_norm": 0.97265625, "learning_rate": 0.00030512303771698126, "loss": 5.5642, "mean_token_accuracy": 0.20714891850948333, "num_tokens": 101810694.0, "step": 40165 }, { "entropy": 6.04038634300232, "epoch": 4.635891517599538, "grad_norm": 1.0703125, "learning_rate": 0.00030508214433994915, "loss": 5.5017, "mean_token_accuracy": 0.2169783666729927, "num_tokens": 101822968.0, "step": 40170 }, { "entropy": 5.979956483840942, "epoch": 4.636468551644547, "grad_norm": 0.96875, "learning_rate": 0.0003050412499511191, "loss": 5.5168, "mean_token_accuracy": 0.22230055779218674, "num_tokens": 101835550.0, "step": 40175 }, { "entropy": 6.030199956893921, "epoch": 4.637045585689556, "grad_norm": 0.97265625, "learning_rate": 0.0003050003545518665, "loss": 5.564, "mean_token_accuracy": 0.20780004262924195, "num_tokens": 101847916.0, "step": 40180 }, { "entropy": 6.110112953186035, "epoch": 4.6376226197345645, "grad_norm": 1.0625, "learning_rate": 0.00030495945814356686, "loss": 5.59, "mean_token_accuracy": 0.2112215742468834, "num_tokens": 101860357.0, "step": 40185 }, { "entropy": 6.058466577529908, "epoch": 4.638199653779573, "grad_norm": 0.96484375, "learning_rate": 0.00030491856072759575, "loss": 5.582, "mean_token_accuracy": 0.20878954976797104, "num_tokens": 101873782.0, "step": 40190 }, { "entropy": 6.066515922546387, "epoch": 4.638776687824581, "grad_norm": 1.0, "learning_rate": 0.0003048776623053287, "loss": 5.4386, "mean_token_accuracy": 0.21951247304677962, "num_tokens": 101886187.0, "step": 40195 }, { "entropy": 6.183600425720215, "epoch": 4.639353721869591, "grad_norm": 0.89453125, "learning_rate": 0.00030483676287814125, "loss": 5.6893, "mean_token_accuracy": 0.1957939237356186, "num_tokens": 101897849.0, "step": 40200 }, { "entropy": 6.015444374084472, "epoch": 4.639930755914599, "grad_norm": 0.98828125, "learning_rate": 0.00030479586244740924, "loss": 5.4217, "mean_token_accuracy": 0.21342692226171495, "num_tokens": 101910117.0, "step": 40205 }, { "entropy": 5.990631437301635, "epoch": 4.640507789959607, "grad_norm": 0.93359375, "learning_rate": 0.00030475496101450817, "loss": 5.4472, "mean_token_accuracy": 0.2224772483110428, "num_tokens": 101922252.0, "step": 40210 }, { "entropy": 6.104843282699585, "epoch": 4.641084824004617, "grad_norm": 1.0234375, "learning_rate": 0.00030471405858081374, "loss": 5.552, "mean_token_accuracy": 0.20883577018976213, "num_tokens": 101933893.0, "step": 40215 }, { "entropy": 6.05994553565979, "epoch": 4.641661858049625, "grad_norm": 0.9453125, "learning_rate": 0.00030467315514770164, "loss": 5.5226, "mean_token_accuracy": 0.21765454560518266, "num_tokens": 101947093.0, "step": 40220 }, { "entropy": 6.011163711547852, "epoch": 4.642238892094634, "grad_norm": 0.9375, "learning_rate": 0.00030463225071654783, "loss": 5.4545, "mean_token_accuracy": 0.21549930721521376, "num_tokens": 101958931.0, "step": 40225 }, { "entropy": 6.057373571395874, "epoch": 4.642815926139642, "grad_norm": 1.015625, "learning_rate": 0.00030459134528872795, "loss": 5.5204, "mean_token_accuracy": 0.21093595325946807, "num_tokens": 101971884.0, "step": 40230 }, { "entropy": 6.148956537246704, "epoch": 4.64339296018465, "grad_norm": 1.015625, "learning_rate": 0.0003045504388656178, "loss": 5.5503, "mean_token_accuracy": 0.2084178328514099, "num_tokens": 101983528.0, "step": 40235 }, { "entropy": 6.120232677459716, "epoch": 4.64396999422966, "grad_norm": 0.97265625, "learning_rate": 0.0003045095314485933, "loss": 5.5321, "mean_token_accuracy": 0.2111535221338272, "num_tokens": 101996206.0, "step": 40240 }, { "entropy": 6.115531969070434, "epoch": 4.644547028274668, "grad_norm": 0.9296875, "learning_rate": 0.0003044686230390305, "loss": 5.5944, "mean_token_accuracy": 0.20840590447187424, "num_tokens": 102009429.0, "step": 40245 }, { "entropy": 6.040201234817505, "epoch": 4.645124062319677, "grad_norm": 1.0, "learning_rate": 0.00030442771363830515, "loss": 5.4953, "mean_token_accuracy": 0.2116700142621994, "num_tokens": 102021531.0, "step": 40250 }, { "entropy": 6.148918962478637, "epoch": 4.645701096364686, "grad_norm": 0.91796875, "learning_rate": 0.0003043868032477933, "loss": 5.616, "mean_token_accuracy": 0.20456252992153168, "num_tokens": 102034800.0, "step": 40255 }, { "entropy": 5.948317766189575, "epoch": 4.646278130409694, "grad_norm": 0.89453125, "learning_rate": 0.0003043458918688708, "loss": 5.3826, "mean_token_accuracy": 0.2217560812830925, "num_tokens": 102047934.0, "step": 40260 }, { "entropy": 6.167413949966431, "epoch": 4.646855164454703, "grad_norm": 0.98046875, "learning_rate": 0.00030430497950291387, "loss": 5.6501, "mean_token_accuracy": 0.19922988265752792, "num_tokens": 102059871.0, "step": 40265 }, { "entropy": 6.111153268814087, "epoch": 4.647432198499711, "grad_norm": 0.95703125, "learning_rate": 0.0003042640661512985, "loss": 5.5236, "mean_token_accuracy": 0.2110740065574646, "num_tokens": 102072780.0, "step": 40270 }, { "entropy": 6.108676433563232, "epoch": 4.64800923254472, "grad_norm": 1.0390625, "learning_rate": 0.00030422315181540086, "loss": 5.5466, "mean_token_accuracy": 0.2154386579990387, "num_tokens": 102085713.0, "step": 40275 }, { "entropy": 6.21439528465271, "epoch": 4.648586266589729, "grad_norm": 0.96484375, "learning_rate": 0.000304182236496597, "loss": 5.6565, "mean_token_accuracy": 0.2038946896791458, "num_tokens": 102097471.0, "step": 40280 }, { "entropy": 5.991228103637695, "epoch": 4.649163300634737, "grad_norm": 0.984375, "learning_rate": 0.00030414132019626307, "loss": 5.4461, "mean_token_accuracy": 0.22149051427841188, "num_tokens": 102110987.0, "step": 40285 }, { "entropy": 6.04875431060791, "epoch": 4.649740334679747, "grad_norm": 1.109375, "learning_rate": 0.00030410040291577536, "loss": 5.4961, "mean_token_accuracy": 0.21272838711738587, "num_tokens": 102123599.0, "step": 40290 }, { "entropy": 6.092485666275024, "epoch": 4.650317368724755, "grad_norm": 0.94921875, "learning_rate": 0.00030405948465651, "loss": 5.5541, "mean_token_accuracy": 0.20986680835485458, "num_tokens": 102135997.0, "step": 40295 }, { "entropy": 6.0224292278289795, "epoch": 4.650894402769763, "grad_norm": 1.0703125, "learning_rate": 0.00030401856541984335, "loss": 5.5239, "mean_token_accuracy": 0.213881978392601, "num_tokens": 102149290.0, "step": 40300 }, { "entropy": 6.025422430038452, "epoch": 4.651471436814772, "grad_norm": 0.96875, "learning_rate": 0.0003039776452071516, "loss": 5.4551, "mean_token_accuracy": 0.22320044040679932, "num_tokens": 102162124.0, "step": 40305 }, { "entropy": 6.086610794067383, "epoch": 4.65204847085978, "grad_norm": 0.9765625, "learning_rate": 0.0003039367240198112, "loss": 5.5206, "mean_token_accuracy": 0.20983438491821288, "num_tokens": 102174173.0, "step": 40310 }, { "entropy": 6.021279144287109, "epoch": 4.6526255049047895, "grad_norm": 0.94921875, "learning_rate": 0.0003038958018591985, "loss": 5.4167, "mean_token_accuracy": 0.21398167312145233, "num_tokens": 102186388.0, "step": 40315 }, { "entropy": 6.050440835952759, "epoch": 4.653202538949798, "grad_norm": 1.015625, "learning_rate": 0.0003038548787266898, "loss": 5.5425, "mean_token_accuracy": 0.20860018730163574, "num_tokens": 102199860.0, "step": 40320 }, { "entropy": 6.138425636291504, "epoch": 4.653779572994806, "grad_norm": 1.140625, "learning_rate": 0.0003038139546236616, "loss": 5.5871, "mean_token_accuracy": 0.21366337388753892, "num_tokens": 102212810.0, "step": 40325 }, { "entropy": 5.998503065109253, "epoch": 4.654356607039816, "grad_norm": 0.9921875, "learning_rate": 0.00030377302955149034, "loss": 5.4552, "mean_token_accuracy": 0.2115766927599907, "num_tokens": 102223748.0, "step": 40330 }, { "entropy": 5.924293851852417, "epoch": 4.654933641084824, "grad_norm": 0.9453125, "learning_rate": 0.00030373210351155254, "loss": 5.4416, "mean_token_accuracy": 0.2317650258541107, "num_tokens": 102237052.0, "step": 40335 }, { "entropy": 6.101961135864258, "epoch": 4.6555106751298325, "grad_norm": 0.96484375, "learning_rate": 0.00030369117650522475, "loss": 5.4624, "mean_token_accuracy": 0.21635974794626237, "num_tokens": 102249298.0, "step": 40340 }, { "entropy": 6.016424560546875, "epoch": 4.656087709174841, "grad_norm": 0.83203125, "learning_rate": 0.0003036502485338834, "loss": 5.4485, "mean_token_accuracy": 0.21837669163942336, "num_tokens": 102263758.0, "step": 40345 }, { "entropy": 6.049523639678955, "epoch": 4.65666474321985, "grad_norm": 0.9453125, "learning_rate": 0.00030360931959890516, "loss": 5.5368, "mean_token_accuracy": 0.21151572167873384, "num_tokens": 102276461.0, "step": 40350 }, { "entropy": 6.074767637252807, "epoch": 4.657241777264859, "grad_norm": 0.91796875, "learning_rate": 0.0003035683897016667, "loss": 5.5448, "mean_token_accuracy": 0.21361365020275117, "num_tokens": 102289594.0, "step": 40355 }, { "entropy": 6.036602640151978, "epoch": 4.657818811309867, "grad_norm": 0.9453125, "learning_rate": 0.00030352745884354475, "loss": 5.4473, "mean_token_accuracy": 0.21512358337640763, "num_tokens": 102300959.0, "step": 40360 }, { "entropy": 5.991143608093262, "epoch": 4.658395845354876, "grad_norm": 0.9609375, "learning_rate": 0.00030348652702591586, "loss": 5.4517, "mean_token_accuracy": 0.22633498162031174, "num_tokens": 102313736.0, "step": 40365 }, { "entropy": 6.057518005371094, "epoch": 4.658972879399885, "grad_norm": 1.0390625, "learning_rate": 0.0003034455942501567, "loss": 5.5689, "mean_token_accuracy": 0.21355525851249696, "num_tokens": 102326302.0, "step": 40370 }, { "entropy": 6.107525587081909, "epoch": 4.659549913444893, "grad_norm": 0.9453125, "learning_rate": 0.0003034046605176441, "loss": 5.5176, "mean_token_accuracy": 0.21311535984277724, "num_tokens": 102337682.0, "step": 40375 }, { "entropy": 6.051120042800903, "epoch": 4.660126947489902, "grad_norm": 1.234375, "learning_rate": 0.00030336372582975493, "loss": 5.555, "mean_token_accuracy": 0.2172890067100525, "num_tokens": 102350046.0, "step": 40380 }, { "entropy": 6.078455829620362, "epoch": 4.660703981534911, "grad_norm": 0.91796875, "learning_rate": 0.0003033227901878659, "loss": 5.5699, "mean_token_accuracy": 0.210324989259243, "num_tokens": 102362905.0, "step": 40385 }, { "entropy": 6.121299362182617, "epoch": 4.661281015579919, "grad_norm": 0.98046875, "learning_rate": 0.0003032818535933538, "loss": 5.5045, "mean_token_accuracy": 0.21094539612531663, "num_tokens": 102374684.0, "step": 40390 }, { "entropy": 6.174676322937012, "epoch": 4.661858049624928, "grad_norm": 0.90234375, "learning_rate": 0.0003032409160475957, "loss": 5.6106, "mean_token_accuracy": 0.20823263078927995, "num_tokens": 102387268.0, "step": 40395 }, { "entropy": 6.069587230682373, "epoch": 4.662435083669936, "grad_norm": 1.0, "learning_rate": 0.0003031999775519685, "loss": 5.5582, "mean_token_accuracy": 0.2067757800221443, "num_tokens": 102398985.0, "step": 40400 }, { "entropy": 5.999266147613525, "epoch": 4.6630121177149455, "grad_norm": 0.96875, "learning_rate": 0.00030315903810784896, "loss": 5.4253, "mean_token_accuracy": 0.22282031178474426, "num_tokens": 102411531.0, "step": 40405 }, { "entropy": 6.182189226150513, "epoch": 4.663589151759954, "grad_norm": 0.9765625, "learning_rate": 0.0003031180977166141, "loss": 5.5796, "mean_token_accuracy": 0.20635385513305665, "num_tokens": 102424805.0, "step": 40410 }, { "entropy": 6.055428743362427, "epoch": 4.664166185804962, "grad_norm": 0.9609375, "learning_rate": 0.0003030771563796411, "loss": 5.5504, "mean_token_accuracy": 0.20864809453487396, "num_tokens": 102436132.0, "step": 40415 }, { "entropy": 6.000490760803222, "epoch": 4.664743219849971, "grad_norm": 0.9375, "learning_rate": 0.00030303621409830686, "loss": 5.423, "mean_token_accuracy": 0.22001756131649017, "num_tokens": 102448708.0, "step": 40420 }, { "entropy": 6.062108278274536, "epoch": 4.66532025389498, "grad_norm": 0.96875, "learning_rate": 0.00030299527087398846, "loss": 5.5652, "mean_token_accuracy": 0.20293550342321395, "num_tokens": 102459940.0, "step": 40425 }, { "entropy": 6.08624849319458, "epoch": 4.6658972879399885, "grad_norm": 0.9609375, "learning_rate": 0.00030295432670806303, "loss": 5.5075, "mean_token_accuracy": 0.20980108231306077, "num_tokens": 102473429.0, "step": 40430 }, { "entropy": 6.122294282913208, "epoch": 4.666474321984997, "grad_norm": 1.0078125, "learning_rate": 0.0003029133816019077, "loss": 5.537, "mean_token_accuracy": 0.21689476519823075, "num_tokens": 102486752.0, "step": 40435 }, { "entropy": 5.9142271995544435, "epoch": 4.667051356030006, "grad_norm": 0.94921875, "learning_rate": 0.0003028724355568997, "loss": 5.3954, "mean_token_accuracy": 0.2256261706352234, "num_tokens": 102500455.0, "step": 40440 }, { "entropy": 6.075957632064819, "epoch": 4.667628390075015, "grad_norm": 1.0234375, "learning_rate": 0.00030283148857441616, "loss": 5.5213, "mean_token_accuracy": 0.21587922871112825, "num_tokens": 102512688.0, "step": 40445 }, { "entropy": 5.963104343414306, "epoch": 4.668205424120023, "grad_norm": 1.0390625, "learning_rate": 0.0003027905406558343, "loss": 5.4315, "mean_token_accuracy": 0.22278572916984557, "num_tokens": 102525525.0, "step": 40450 }, { "entropy": 6.112188053131104, "epoch": 4.6687824581650315, "grad_norm": 0.9921875, "learning_rate": 0.0003027495918025314, "loss": 5.5313, "mean_token_accuracy": 0.20939795672893524, "num_tokens": 102537309.0, "step": 40455 }, { "entropy": 6.087237215042114, "epoch": 4.669359492210041, "grad_norm": 0.921875, "learning_rate": 0.00030270864201588485, "loss": 5.5387, "mean_token_accuracy": 0.20934234112501143, "num_tokens": 102549647.0, "step": 40460 }, { "entropy": 6.000871658325195, "epoch": 4.669936526255049, "grad_norm": 1.0234375, "learning_rate": 0.00030266769129727177, "loss": 5.4792, "mean_token_accuracy": 0.21280010789632797, "num_tokens": 102561736.0, "step": 40465 }, { "entropy": 5.9513002872467045, "epoch": 4.670513560300058, "grad_norm": 0.9375, "learning_rate": 0.00030262673964806975, "loss": 5.3783, "mean_token_accuracy": 0.23099043667316438, "num_tokens": 102575171.0, "step": 40470 }, { "entropy": 6.081803798675537, "epoch": 4.671090594345066, "grad_norm": 0.94921875, "learning_rate": 0.0003025857870696559, "loss": 5.5691, "mean_token_accuracy": 0.21026743352413177, "num_tokens": 102587500.0, "step": 40475 }, { "entropy": 6.009596920013427, "epoch": 4.671667628390075, "grad_norm": 1.09375, "learning_rate": 0.00030254483356340794, "loss": 5.4175, "mean_token_accuracy": 0.22356452643871308, "num_tokens": 102601674.0, "step": 40480 }, { "entropy": 6.0100830078125, "epoch": 4.672244662435084, "grad_norm": 0.984375, "learning_rate": 0.00030250387913070316, "loss": 5.4425, "mean_token_accuracy": 0.22131087481975556, "num_tokens": 102615370.0, "step": 40485 }, { "entropy": 6.114531230926514, "epoch": 4.672821696480092, "grad_norm": 0.90625, "learning_rate": 0.00030246292377291914, "loss": 5.5214, "mean_token_accuracy": 0.20989109575748444, "num_tokens": 102627755.0, "step": 40490 }, { "entropy": 6.0195910930633545, "epoch": 4.673398730525101, "grad_norm": 0.95703125, "learning_rate": 0.00030242196749143314, "loss": 5.5442, "mean_token_accuracy": 0.20827856957912444, "num_tokens": 102641095.0, "step": 40495 }, { "entropy": 5.998216962814331, "epoch": 4.67397576457011, "grad_norm": 1.015625, "learning_rate": 0.000302381010287623, "loss": 5.4269, "mean_token_accuracy": 0.221379292011261, "num_tokens": 102652582.0, "step": 40500 }, { "entropy": 6.112171316146851, "epoch": 4.674552798615118, "grad_norm": 0.97265625, "learning_rate": 0.0003023400521628662, "loss": 5.5914, "mean_token_accuracy": 0.20505908578634263, "num_tokens": 102665476.0, "step": 40505 }, { "entropy": 6.202398490905762, "epoch": 4.675129832660127, "grad_norm": 0.92578125, "learning_rate": 0.0003022990931185403, "loss": 5.6067, "mean_token_accuracy": 0.2000592902302742, "num_tokens": 102677440.0, "step": 40510 }, { "entropy": 6.161210823059082, "epoch": 4.675706866705136, "grad_norm": 0.96484375, "learning_rate": 0.0003022581331560229, "loss": 5.555, "mean_token_accuracy": 0.2069035455584526, "num_tokens": 102690400.0, "step": 40515 }, { "entropy": 6.058077383041382, "epoch": 4.676283900750144, "grad_norm": 1.0, "learning_rate": 0.0003022171722766918, "loss": 5.4938, "mean_token_accuracy": 0.21703884601593018, "num_tokens": 102703758.0, "step": 40520 }, { "entropy": 6.006094980239868, "epoch": 4.676860934795153, "grad_norm": 0.9765625, "learning_rate": 0.00030217621048192467, "loss": 5.4529, "mean_token_accuracy": 0.22131969183683395, "num_tokens": 102715237.0, "step": 40525 }, { "entropy": 6.05950813293457, "epoch": 4.677437968840161, "grad_norm": 0.9296875, "learning_rate": 0.00030213524777309916, "loss": 5.5388, "mean_token_accuracy": 0.20908078253269197, "num_tokens": 102728766.0, "step": 40530 }, { "entropy": 6.074459266662598, "epoch": 4.678015002885171, "grad_norm": 0.9296875, "learning_rate": 0.00030209428415159303, "loss": 5.5557, "mean_token_accuracy": 0.2142320990562439, "num_tokens": 102742393.0, "step": 40535 }, { "entropy": 6.168030214309693, "epoch": 4.678592036930179, "grad_norm": 0.9375, "learning_rate": 0.0003020533196187841, "loss": 5.6318, "mean_token_accuracy": 0.20276992172002792, "num_tokens": 102756089.0, "step": 40540 }, { "entropy": 6.106509113311768, "epoch": 4.679169070975187, "grad_norm": 0.93359375, "learning_rate": 0.00030201235417605024, "loss": 5.551, "mean_token_accuracy": 0.21083916425704957, "num_tokens": 102768654.0, "step": 40545 }, { "entropy": 6.0760866641998295, "epoch": 4.679746105020196, "grad_norm": 1.0859375, "learning_rate": 0.0003019713878247693, "loss": 5.5729, "mean_token_accuracy": 0.2167840138077736, "num_tokens": 102781443.0, "step": 40550 }, { "entropy": 6.120911026000977, "epoch": 4.680323139065205, "grad_norm": 0.99609375, "learning_rate": 0.000301930420566319, "loss": 5.6031, "mean_token_accuracy": 0.2029586985707283, "num_tokens": 102793028.0, "step": 40555 }, { "entropy": 6.0567920207977295, "epoch": 4.680900173110214, "grad_norm": 1.453125, "learning_rate": 0.00030188945240207756, "loss": 5.4807, "mean_token_accuracy": 0.22060326784849166, "num_tokens": 102805652.0, "step": 40560 }, { "entropy": 6.0971879959106445, "epoch": 4.681477207155222, "grad_norm": 1.03125, "learning_rate": 0.00030184848333342267, "loss": 5.5688, "mean_token_accuracy": 0.21173155307769775, "num_tokens": 102817959.0, "step": 40565 }, { "entropy": 6.079104995727539, "epoch": 4.68205424120023, "grad_norm": 1.0, "learning_rate": 0.0003018075133617324, "loss": 5.5244, "mean_token_accuracy": 0.21249692440032958, "num_tokens": 102830692.0, "step": 40570 }, { "entropy": 6.074726915359497, "epoch": 4.68263127524524, "grad_norm": 0.921875, "learning_rate": 0.0003017665424883846, "loss": 5.5355, "mean_token_accuracy": 0.21349019408226014, "num_tokens": 102843495.0, "step": 40575 }, { "entropy": 6.0668299198150635, "epoch": 4.683208309290248, "grad_norm": 0.98046875, "learning_rate": 0.0003017255707147576, "loss": 5.4996, "mean_token_accuracy": 0.22020189166069032, "num_tokens": 102856585.0, "step": 40580 }, { "entropy": 6.111496925354004, "epoch": 4.6837853433352565, "grad_norm": 1.09375, "learning_rate": 0.00030168459804222927, "loss": 5.5844, "mean_token_accuracy": 0.2090723305940628, "num_tokens": 102869750.0, "step": 40585 }, { "entropy": 6.044322204589844, "epoch": 4.684362377380266, "grad_norm": 0.9296875, "learning_rate": 0.0003016436244721777, "loss": 5.4797, "mean_token_accuracy": 0.22113304287195207, "num_tokens": 102883680.0, "step": 40590 }, { "entropy": 6.044998550415039, "epoch": 4.684939411425274, "grad_norm": 1.0, "learning_rate": 0.0003016026500059811, "loss": 5.5064, "mean_token_accuracy": 0.214402474462986, "num_tokens": 102896869.0, "step": 40595 }, { "entropy": 6.031843852996826, "epoch": 4.685516445470283, "grad_norm": 1.0, "learning_rate": 0.00030156167464501747, "loss": 5.4457, "mean_token_accuracy": 0.2232113763689995, "num_tokens": 102910469.0, "step": 40600 }, { "entropy": 6.112345457077026, "epoch": 4.686093479515291, "grad_norm": 0.9453125, "learning_rate": 0.0003015206983906652, "loss": 5.5375, "mean_token_accuracy": 0.20791415274143218, "num_tokens": 102922363.0, "step": 40605 }, { "entropy": 6.03321681022644, "epoch": 4.6866705135603, "grad_norm": 0.96484375, "learning_rate": 0.00030147972124430246, "loss": 5.579, "mean_token_accuracy": 0.2131233423948288, "num_tokens": 102934855.0, "step": 40610 }, { "entropy": 6.057859754562378, "epoch": 4.687247547605309, "grad_norm": 0.984375, "learning_rate": 0.00030143874320730734, "loss": 5.5408, "mean_token_accuracy": 0.21599163264036178, "num_tokens": 102948088.0, "step": 40615 }, { "entropy": 6.110048151016235, "epoch": 4.687824581650317, "grad_norm": 0.9765625, "learning_rate": 0.0003013977642810583, "loss": 5.5623, "mean_token_accuracy": 0.21446237713098526, "num_tokens": 102962152.0, "step": 40620 }, { "entropy": 5.978468990325927, "epoch": 4.688401615695326, "grad_norm": 1.109375, "learning_rate": 0.00030135678446693354, "loss": 5.4435, "mean_token_accuracy": 0.21835525184869767, "num_tokens": 102975004.0, "step": 40625 }, { "entropy": 5.973551082611084, "epoch": 4.688978649740335, "grad_norm": 0.921875, "learning_rate": 0.00030131580376631145, "loss": 5.3749, "mean_token_accuracy": 0.22152878046035768, "num_tokens": 102988278.0, "step": 40630 }, { "entropy": 6.049982500076294, "epoch": 4.689555683785343, "grad_norm": 1.03125, "learning_rate": 0.00030127482218057035, "loss": 5.4757, "mean_token_accuracy": 0.21126235127449036, "num_tokens": 103000246.0, "step": 40635 }, { "entropy": 6.013923406600952, "epoch": 4.690132717830352, "grad_norm": 0.92578125, "learning_rate": 0.0003012338397110886, "loss": 5.4848, "mean_token_accuracy": 0.213090743124485, "num_tokens": 103014001.0, "step": 40640 }, { "entropy": 6.0590473175048825, "epoch": 4.69070975187536, "grad_norm": 0.9140625, "learning_rate": 0.00030119285635924484, "loss": 5.5176, "mean_token_accuracy": 0.2110501080751419, "num_tokens": 103027539.0, "step": 40645 }, { "entropy": 6.025898361206055, "epoch": 4.6912867859203695, "grad_norm": 0.94921875, "learning_rate": 0.00030115187212641724, "loss": 5.435, "mean_token_accuracy": 0.2183668226003647, "num_tokens": 103040991.0, "step": 40650 }, { "entropy": 5.991097068786621, "epoch": 4.691863819965378, "grad_norm": 0.99609375, "learning_rate": 0.0003011108870139845, "loss": 5.3892, "mean_token_accuracy": 0.22508731633424758, "num_tokens": 103053671.0, "step": 40655 }, { "entropy": 6.025773811340332, "epoch": 4.692440854010386, "grad_norm": 0.9453125, "learning_rate": 0.0003010699010233249, "loss": 5.462, "mean_token_accuracy": 0.22039386183023452, "num_tokens": 103065152.0, "step": 40660 }, { "entropy": 5.994659948348999, "epoch": 4.693017888055396, "grad_norm": 0.984375, "learning_rate": 0.00030102891415581724, "loss": 5.4255, "mean_token_accuracy": 0.22461961656808854, "num_tokens": 103078114.0, "step": 40665 }, { "entropy": 5.98750581741333, "epoch": 4.693594922100404, "grad_norm": 0.92578125, "learning_rate": 0.00030098792641283995, "loss": 5.4152, "mean_token_accuracy": 0.21898276060819627, "num_tokens": 103089869.0, "step": 40670 }, { "entropy": 6.028250026702881, "epoch": 4.6941719561454125, "grad_norm": 1.0390625, "learning_rate": 0.00030094693779577177, "loss": 5.4619, "mean_token_accuracy": 0.21789764165878295, "num_tokens": 103103371.0, "step": 40675 }, { "entropy": 6.020797872543335, "epoch": 4.694748990190421, "grad_norm": 0.953125, "learning_rate": 0.00030090594830599104, "loss": 5.4616, "mean_token_accuracy": 0.2280898854136467, "num_tokens": 103116526.0, "step": 40680 }, { "entropy": 5.92597770690918, "epoch": 4.69532602423543, "grad_norm": 1.015625, "learning_rate": 0.0003008649579448767, "loss": 5.3479, "mean_token_accuracy": 0.23473746031522752, "num_tokens": 103129493.0, "step": 40685 }, { "entropy": 5.989361953735352, "epoch": 4.695903058280439, "grad_norm": 0.96875, "learning_rate": 0.00030082396671380734, "loss": 5.5248, "mean_token_accuracy": 0.2192692995071411, "num_tokens": 103143721.0, "step": 40690 }, { "entropy": 6.086354351043701, "epoch": 4.696480092325447, "grad_norm": 1.1328125, "learning_rate": 0.0003007829746141617, "loss": 5.6002, "mean_token_accuracy": 0.21117883920669556, "num_tokens": 103157976.0, "step": 40695 }, { "entropy": 6.078159999847412, "epoch": 4.6970571263704555, "grad_norm": 0.9765625, "learning_rate": 0.00030074198164731854, "loss": 5.4782, "mean_token_accuracy": 0.21990445852279664, "num_tokens": 103169356.0, "step": 40700 }, { "entropy": 6.11819543838501, "epoch": 4.697634160415465, "grad_norm": 1.0234375, "learning_rate": 0.0003007009878146566, "loss": 5.5506, "mean_token_accuracy": 0.2135201498866081, "num_tokens": 103181204.0, "step": 40705 }, { "entropy": 6.076857233047486, "epoch": 4.698211194460473, "grad_norm": 0.84765625, "learning_rate": 0.00030065999311755466, "loss": 5.5967, "mean_token_accuracy": 0.2082436889410019, "num_tokens": 103195101.0, "step": 40710 }, { "entropy": 6.055859184265136, "epoch": 4.698788228505482, "grad_norm": 1.0078125, "learning_rate": 0.0003006189975573916, "loss": 5.4453, "mean_token_accuracy": 0.2220652461051941, "num_tokens": 103208129.0, "step": 40715 }, { "entropy": 6.0622953414917, "epoch": 4.69936526255049, "grad_norm": 1.015625, "learning_rate": 0.00030057800113554627, "loss": 5.4505, "mean_token_accuracy": 0.21694075167179108, "num_tokens": 103220743.0, "step": 40720 }, { "entropy": 6.059666872024536, "epoch": 4.699942296595499, "grad_norm": 0.9921875, "learning_rate": 0.00030053700385339766, "loss": 5.5488, "mean_token_accuracy": 0.20757769793272018, "num_tokens": 103233664.0, "step": 40725 }, { "entropy": 6.071609783172607, "epoch": 4.700519330640508, "grad_norm": 0.95703125, "learning_rate": 0.0003004960057123246, "loss": 5.4654, "mean_token_accuracy": 0.21064720600843428, "num_tokens": 103247144.0, "step": 40730 }, { "entropy": 6.116744899749756, "epoch": 4.701096364685516, "grad_norm": 0.98046875, "learning_rate": 0.000300455006713706, "loss": 5.5842, "mean_token_accuracy": 0.2080810397863388, "num_tokens": 103258735.0, "step": 40735 }, { "entropy": 6.037677669525147, "epoch": 4.7016733987305255, "grad_norm": 0.91796875, "learning_rate": 0.00030041400685892086, "loss": 5.4948, "mean_token_accuracy": 0.21213069558143616, "num_tokens": 103272370.0, "step": 40740 }, { "entropy": 5.990386724472046, "epoch": 4.702250432775534, "grad_norm": 1.0078125, "learning_rate": 0.0003003730061493483, "loss": 5.4663, "mean_token_accuracy": 0.21988701373338698, "num_tokens": 103284215.0, "step": 40745 }, { "entropy": 6.119244003295899, "epoch": 4.702827466820542, "grad_norm": 0.91796875, "learning_rate": 0.00030033200458636714, "loss": 5.5562, "mean_token_accuracy": 0.21128773987293242, "num_tokens": 103297560.0, "step": 40750 }, { "entropy": 5.98164553642273, "epoch": 4.703404500865551, "grad_norm": 0.9453125, "learning_rate": 0.00030029100217135674, "loss": 5.3948, "mean_token_accuracy": 0.2216815397143364, "num_tokens": 103309861.0, "step": 40755 }, { "entropy": 5.983503437042236, "epoch": 4.70398153491056, "grad_norm": 1.0078125, "learning_rate": 0.00030024999890569605, "loss": 5.4354, "mean_token_accuracy": 0.2225635066628456, "num_tokens": 103322244.0, "step": 40760 }, { "entropy": 6.081357336044311, "epoch": 4.7045585689555685, "grad_norm": 0.96484375, "learning_rate": 0.0003002089947907641, "loss": 5.5848, "mean_token_accuracy": 0.21002936959266663, "num_tokens": 103334943.0, "step": 40765 }, { "entropy": 6.1299222946167, "epoch": 4.705135603000577, "grad_norm": 0.94140625, "learning_rate": 0.0003001679898279402, "loss": 5.5531, "mean_token_accuracy": 0.20946212708950043, "num_tokens": 103346851.0, "step": 40770 }, { "entropy": 6.078902244567871, "epoch": 4.705712637045586, "grad_norm": 0.9140625, "learning_rate": 0.0003001269840186034, "loss": 5.5241, "mean_token_accuracy": 0.21239568442106246, "num_tokens": 103359434.0, "step": 40775 }, { "entropy": 6.0624631404876705, "epoch": 4.706289671090595, "grad_norm": 1.171875, "learning_rate": 0.00030008597736413305, "loss": 5.4825, "mean_token_accuracy": 0.20944168716669082, "num_tokens": 103371945.0, "step": 40780 }, { "entropy": 6.023629283905029, "epoch": 4.706866705135603, "grad_norm": 1.0703125, "learning_rate": 0.00030004496986590825, "loss": 5.4984, "mean_token_accuracy": 0.21912001669406891, "num_tokens": 103385204.0, "step": 40785 }, { "entropy": 6.022859191894531, "epoch": 4.707443739180611, "grad_norm": 0.94140625, "learning_rate": 0.00030000396152530834, "loss": 5.477, "mean_token_accuracy": 0.218401937186718, "num_tokens": 103398024.0, "step": 40790 }, { "entropy": 6.062512922286987, "epoch": 4.70802077322562, "grad_norm": 0.97265625, "learning_rate": 0.0002999629523437127, "loss": 5.5153, "mean_token_accuracy": 0.21566094905138017, "num_tokens": 103410877.0, "step": 40795 }, { "entropy": 6.0337498664855955, "epoch": 4.708597807270629, "grad_norm": 1.0, "learning_rate": 0.0002999219423225005, "loss": 5.4405, "mean_token_accuracy": 0.21865384727716447, "num_tokens": 103423329.0, "step": 40800 }, { "entropy": 6.02803111076355, "epoch": 4.709174841315638, "grad_norm": 0.95703125, "learning_rate": 0.00029988093146305104, "loss": 5.4869, "mean_token_accuracy": 0.2196614056825638, "num_tokens": 103435434.0, "step": 40805 }, { "entropy": 6.008598518371582, "epoch": 4.709751875360646, "grad_norm": 1.0078125, "learning_rate": 0.000299839919766744, "loss": 5.4641, "mean_token_accuracy": 0.2177417680621147, "num_tokens": 103447696.0, "step": 40810 }, { "entropy": 5.986138439178466, "epoch": 4.710328909405655, "grad_norm": 0.93359375, "learning_rate": 0.0002997989072349584, "loss": 5.4263, "mean_token_accuracy": 0.22091514021158218, "num_tokens": 103460749.0, "step": 40815 }, { "entropy": 6.046768760681152, "epoch": 4.710905943450664, "grad_norm": 0.9296875, "learning_rate": 0.00029975789386907397, "loss": 5.5364, "mean_token_accuracy": 0.20974406003952026, "num_tokens": 103472951.0, "step": 40820 }, { "entropy": 6.050793695449829, "epoch": 4.711482977495672, "grad_norm": 0.96484375, "learning_rate": 0.00029971687967047004, "loss": 5.5111, "mean_token_accuracy": 0.21794998943805693, "num_tokens": 103486240.0, "step": 40825 }, { "entropy": 6.173254346847534, "epoch": 4.7120600115406805, "grad_norm": 1.2265625, "learning_rate": 0.00029967586464052623, "loss": 5.6145, "mean_token_accuracy": 0.2032383620738983, "num_tokens": 103498934.0, "step": 40830 }, { "entropy": 6.058687210083008, "epoch": 4.71263704558569, "grad_norm": 0.94921875, "learning_rate": 0.0002996348487806219, "loss": 5.5129, "mean_token_accuracy": 0.21091001927852632, "num_tokens": 103513094.0, "step": 40835 }, { "entropy": 6.062951850891113, "epoch": 4.713214079630698, "grad_norm": 1.015625, "learning_rate": 0.0002995938320921367, "loss": 5.542, "mean_token_accuracy": 0.20624936372041702, "num_tokens": 103525705.0, "step": 40840 }, { "entropy": 6.097893285751343, "epoch": 4.713791113675707, "grad_norm": 0.96484375, "learning_rate": 0.00029955281457645015, "loss": 5.5605, "mean_token_accuracy": 0.20943787097930908, "num_tokens": 103539160.0, "step": 40845 }, { "entropy": 6.13492488861084, "epoch": 4.714368147720716, "grad_norm": 0.984375, "learning_rate": 0.0002995117962349419, "loss": 5.4996, "mean_token_accuracy": 0.21205293238162995, "num_tokens": 103551602.0, "step": 40850 }, { "entropy": 6.047506093978882, "epoch": 4.714945181765724, "grad_norm": 0.94921875, "learning_rate": 0.0002994707770689915, "loss": 5.4847, "mean_token_accuracy": 0.2184184432029724, "num_tokens": 103564281.0, "step": 40855 }, { "entropy": 6.056606674194336, "epoch": 4.715522215810733, "grad_norm": 0.9453125, "learning_rate": 0.0002994297570799787, "loss": 5.5489, "mean_token_accuracy": 0.20512326210737228, "num_tokens": 103576533.0, "step": 40860 }, { "entropy": 6.098846197128296, "epoch": 4.716099249855741, "grad_norm": 0.99609375, "learning_rate": 0.00029938873626928327, "loss": 5.5152, "mean_token_accuracy": 0.2128812462091446, "num_tokens": 103588916.0, "step": 40865 }, { "entropy": 6.063002061843872, "epoch": 4.71667628390075, "grad_norm": 0.9453125, "learning_rate": 0.00029934771463828463, "loss": 5.5468, "mean_token_accuracy": 0.2154998615384102, "num_tokens": 103602224.0, "step": 40870 }, { "entropy": 5.978532123565674, "epoch": 4.717253317945759, "grad_norm": 1.0, "learning_rate": 0.00029930669218836283, "loss": 5.4142, "mean_token_accuracy": 0.22095377892255783, "num_tokens": 103614975.0, "step": 40875 }, { "entropy": 6.088528156280518, "epoch": 4.717830351990767, "grad_norm": 1.0546875, "learning_rate": 0.0002992656689208974, "loss": 5.5481, "mean_token_accuracy": 0.2112618550658226, "num_tokens": 103626752.0, "step": 40880 }, { "entropy": 6.144932556152344, "epoch": 4.718407386035776, "grad_norm": 0.9609375, "learning_rate": 0.00029922464483726833, "loss": 5.5768, "mean_token_accuracy": 0.20175130665302277, "num_tokens": 103639841.0, "step": 40885 }, { "entropy": 6.095277547836304, "epoch": 4.718984420080785, "grad_norm": 1.015625, "learning_rate": 0.00029918361993885536, "loss": 5.5269, "mean_token_accuracy": 0.2107507675886154, "num_tokens": 103653064.0, "step": 40890 }, { "entropy": 6.075502204895019, "epoch": 4.7195614541257935, "grad_norm": 0.99609375, "learning_rate": 0.0002991425942270383, "loss": 5.5212, "mean_token_accuracy": 0.21893896162509918, "num_tokens": 103666109.0, "step": 40895 }, { "entropy": 6.056168460845948, "epoch": 4.720138488170802, "grad_norm": 0.96484375, "learning_rate": 0.00029910156770319714, "loss": 5.5139, "mean_token_accuracy": 0.21284041106700896, "num_tokens": 103678728.0, "step": 40900 }, { "entropy": 6.1105872631073, "epoch": 4.72071552221581, "grad_norm": 0.9765625, "learning_rate": 0.00029906054036871166, "loss": 5.5479, "mean_token_accuracy": 0.2111024796962738, "num_tokens": 103691488.0, "step": 40905 }, { "entropy": 6.117109107971191, "epoch": 4.72129255626082, "grad_norm": 0.984375, "learning_rate": 0.00029901951222496186, "loss": 5.5742, "mean_token_accuracy": 0.20292351245880128, "num_tokens": 103703954.0, "step": 40910 }, { "entropy": 6.08160662651062, "epoch": 4.721869590305828, "grad_norm": 0.9375, "learning_rate": 0.00029897848327332775, "loss": 5.5468, "mean_token_accuracy": 0.21015863865613937, "num_tokens": 103717128.0, "step": 40915 }, { "entropy": 5.963445043563842, "epoch": 4.7224466243508365, "grad_norm": 0.875, "learning_rate": 0.00029893745351518926, "loss": 5.4468, "mean_token_accuracy": 0.221268193423748, "num_tokens": 103729206.0, "step": 40920 }, { "entropy": 6.0469564437866214, "epoch": 4.723023658395846, "grad_norm": 1.0234375, "learning_rate": 0.0002988964229519264, "loss": 5.5042, "mean_token_accuracy": 0.2128221198916435, "num_tokens": 103742156.0, "step": 40925 }, { "entropy": 6.023454236984253, "epoch": 4.723600692440854, "grad_norm": 0.96484375, "learning_rate": 0.00029885539158491916, "loss": 5.4906, "mean_token_accuracy": 0.21182971596717834, "num_tokens": 103754123.0, "step": 40930 }, { "entropy": 6.096383190155029, "epoch": 4.724177726485863, "grad_norm": 0.99609375, "learning_rate": 0.0002988143594155478, "loss": 5.5939, "mean_token_accuracy": 0.2097270295023918, "num_tokens": 103767001.0, "step": 40935 }, { "entropy": 6.088947677612305, "epoch": 4.724754760530871, "grad_norm": 1.0078125, "learning_rate": 0.00029877332644519223, "loss": 5.5007, "mean_token_accuracy": 0.21239416152238846, "num_tokens": 103778434.0, "step": 40940 }, { "entropy": 6.058033418655396, "epoch": 4.7253317945758795, "grad_norm": 0.984375, "learning_rate": 0.0002987322926752326, "loss": 5.4808, "mean_token_accuracy": 0.21226408183574677, "num_tokens": 103791200.0, "step": 40945 }, { "entropy": 6.052468347549438, "epoch": 4.725908828620889, "grad_norm": 0.953125, "learning_rate": 0.00029869125810704904, "loss": 5.4018, "mean_token_accuracy": 0.22025685310363768, "num_tokens": 103802698.0, "step": 40950 }, { "entropy": 5.957513666152954, "epoch": 4.726485862665897, "grad_norm": 1.046875, "learning_rate": 0.0002986502227420219, "loss": 5.3751, "mean_token_accuracy": 0.22531258016824723, "num_tokens": 103814952.0, "step": 40955 }, { "entropy": 5.969437313079834, "epoch": 4.727062896710906, "grad_norm": 0.96875, "learning_rate": 0.00029860918658153123, "loss": 5.4229, "mean_token_accuracy": 0.21807370632886885, "num_tokens": 103828006.0, "step": 40960 }, { "entropy": 6.065869426727295, "epoch": 4.727639930755915, "grad_norm": 1.015625, "learning_rate": 0.00029856814962695734, "loss": 5.6246, "mean_token_accuracy": 0.20851611942052842, "num_tokens": 103840978.0, "step": 40965 }, { "entropy": 6.05151333808899, "epoch": 4.728216964800923, "grad_norm": 0.96484375, "learning_rate": 0.00029852711187968036, "loss": 5.5559, "mean_token_accuracy": 0.20919988602399825, "num_tokens": 103852922.0, "step": 40970 }, { "entropy": 6.074489259719849, "epoch": 4.728793998845932, "grad_norm": 0.9375, "learning_rate": 0.00029848607334108065, "loss": 5.4347, "mean_token_accuracy": 0.22283679842948914, "num_tokens": 103865976.0, "step": 40975 }, { "entropy": 6.070368957519531, "epoch": 4.72937103289094, "grad_norm": 1.015625, "learning_rate": 0.00029844503401253866, "loss": 5.5209, "mean_token_accuracy": 0.2183467611670494, "num_tokens": 103879595.0, "step": 40980 }, { "entropy": 6.064594173431397, "epoch": 4.7299480669359495, "grad_norm": 1.0, "learning_rate": 0.0002984039938954344, "loss": 5.579, "mean_token_accuracy": 0.20583467185497284, "num_tokens": 103892799.0, "step": 40985 }, { "entropy": 6.025279760360718, "epoch": 4.730525100980958, "grad_norm": 0.9375, "learning_rate": 0.00029836295299114855, "loss": 5.4034, "mean_token_accuracy": 0.22447287887334824, "num_tokens": 103904962.0, "step": 40990 }, { "entropy": 6.061993885040283, "epoch": 4.731102135025966, "grad_norm": 1.0, "learning_rate": 0.0002983219113010614, "loss": 5.4631, "mean_token_accuracy": 0.22052764892578125, "num_tokens": 103919198.0, "step": 40995 }, { "entropy": 5.9834754943847654, "epoch": 4.731679169070976, "grad_norm": 0.890625, "learning_rate": 0.00029828086882655334, "loss": 5.5115, "mean_token_accuracy": 0.21856827288866043, "num_tokens": 103932955.0, "step": 41000 }, { "entropy": 6.038109064102173, "epoch": 4.732256203115984, "grad_norm": 1.0078125, "learning_rate": 0.0002982398255690048, "loss": 5.5211, "mean_token_accuracy": 0.2128079727292061, "num_tokens": 103944901.0, "step": 41005 }, { "entropy": 6.036848497390747, "epoch": 4.7328332371609925, "grad_norm": 0.984375, "learning_rate": 0.00029819878152979624, "loss": 5.4663, "mean_token_accuracy": 0.21948096454143523, "num_tokens": 103956798.0, "step": 41010 }, { "entropy": 5.9218159198760985, "epoch": 4.733410271206001, "grad_norm": 0.94140625, "learning_rate": 0.0002981577367103082, "loss": 5.3434, "mean_token_accuracy": 0.2228821337223053, "num_tokens": 103970566.0, "step": 41015 }, { "entropy": 6.064480876922607, "epoch": 4.73398730525101, "grad_norm": 0.98046875, "learning_rate": 0.00029811669111192123, "loss": 5.4991, "mean_token_accuracy": 0.21889271438121796, "num_tokens": 103982756.0, "step": 41020 }, { "entropy": 6.033596134185791, "epoch": 4.734564339296019, "grad_norm": 0.984375, "learning_rate": 0.00029807564473601585, "loss": 5.48, "mean_token_accuracy": 0.21389850080013276, "num_tokens": 103995414.0, "step": 41025 }, { "entropy": 6.007001876831055, "epoch": 4.735141373341027, "grad_norm": 1.0625, "learning_rate": 0.0002980345975839726, "loss": 5.3953, "mean_token_accuracy": 0.2226052924990654, "num_tokens": 104006656.0, "step": 41030 }, { "entropy": 5.99414291381836, "epoch": 4.7357184073860354, "grad_norm": 1.015625, "learning_rate": 0.0002979935496571721, "loss": 5.4481, "mean_token_accuracy": 0.22291264981031417, "num_tokens": 104019075.0, "step": 41035 }, { "entropy": 6.078718137741089, "epoch": 4.736295441431045, "grad_norm": 1.015625, "learning_rate": 0.00029795250095699494, "loss": 5.5429, "mean_token_accuracy": 0.21271851360797883, "num_tokens": 104032280.0, "step": 41040 }, { "entropy": 6.020309400558472, "epoch": 4.736872475476053, "grad_norm": 1.0234375, "learning_rate": 0.0002979114514848218, "loss": 5.4535, "mean_token_accuracy": 0.2141135513782501, "num_tokens": 104044783.0, "step": 41045 }, { "entropy": 6.138972997665405, "epoch": 4.737449509521062, "grad_norm": 0.984375, "learning_rate": 0.00029787040124203346, "loss": 5.5618, "mean_token_accuracy": 0.20506847351789476, "num_tokens": 104057224.0, "step": 41050 }, { "entropy": 6.098556852340698, "epoch": 4.73802654356607, "grad_norm": 1.0, "learning_rate": 0.00029782935023001046, "loss": 5.5916, "mean_token_accuracy": 0.21267506927251817, "num_tokens": 104071187.0, "step": 41055 }, { "entropy": 6.095409774780274, "epoch": 4.738603577611079, "grad_norm": 0.94921875, "learning_rate": 0.0002977882984501336, "loss": 5.5383, "mean_token_accuracy": 0.2130522459745407, "num_tokens": 104084788.0, "step": 41060 }, { "entropy": 6.064972162246704, "epoch": 4.739180611656088, "grad_norm": 1.0078125, "learning_rate": 0.0002977472459037837, "loss": 5.4513, "mean_token_accuracy": 0.2187037467956543, "num_tokens": 104097452.0, "step": 41065 }, { "entropy": 5.983641624450684, "epoch": 4.739757645701096, "grad_norm": 1.046875, "learning_rate": 0.00029770619259234145, "loss": 5.3842, "mean_token_accuracy": 0.2228585109114647, "num_tokens": 104111197.0, "step": 41070 }, { "entropy": 6.117957735061646, "epoch": 4.7403346797461055, "grad_norm": 0.984375, "learning_rate": 0.00029766513851718765, "loss": 5.5811, "mean_token_accuracy": 0.20884908735752106, "num_tokens": 104124065.0, "step": 41075 }, { "entropy": 5.982294988632202, "epoch": 4.740911713791114, "grad_norm": 1.046875, "learning_rate": 0.0002976240836797032, "loss": 5.4455, "mean_token_accuracy": 0.22249816358089447, "num_tokens": 104137441.0, "step": 41080 }, { "entropy": 6.037612676620483, "epoch": 4.741488747836122, "grad_norm": 1.0546875, "learning_rate": 0.00029758302808126895, "loss": 5.4973, "mean_token_accuracy": 0.21552164405584334, "num_tokens": 104149154.0, "step": 41085 }, { "entropy": 6.1168077945709225, "epoch": 4.742065781881131, "grad_norm": 0.95703125, "learning_rate": 0.0002975419717232658, "loss": 5.6265, "mean_token_accuracy": 0.21063170582056046, "num_tokens": 104160482.0, "step": 41090 }, { "entropy": 6.088898372650147, "epoch": 4.74264281592614, "grad_norm": 0.96875, "learning_rate": 0.00029750091460707456, "loss": 5.5104, "mean_token_accuracy": 0.2148719012737274, "num_tokens": 104173648.0, "step": 41095 }, { "entropy": 6.096096658706665, "epoch": 4.743219849971148, "grad_norm": 0.984375, "learning_rate": 0.0002974598567340763, "loss": 5.478, "mean_token_accuracy": 0.21064760237932206, "num_tokens": 104185129.0, "step": 41100 }, { "entropy": 5.954454374313355, "epoch": 4.743796884016157, "grad_norm": 1.015625, "learning_rate": 0.0002974187981056519, "loss": 5.4121, "mean_token_accuracy": 0.22588610649108887, "num_tokens": 104198235.0, "step": 41105 }, { "entropy": 6.0615723609924315, "epoch": 4.744373918061165, "grad_norm": 0.94140625, "learning_rate": 0.0002973777387231824, "loss": 5.536, "mean_token_accuracy": 0.21372592449188232, "num_tokens": 104212892.0, "step": 41110 }, { "entropy": 6.126613330841065, "epoch": 4.744950952106175, "grad_norm": 0.984375, "learning_rate": 0.00029733667858804864, "loss": 5.5666, "mean_token_accuracy": 0.20422818511724472, "num_tokens": 104225366.0, "step": 41115 }, { "entropy": 6.089966535568237, "epoch": 4.745527986151183, "grad_norm": 0.96484375, "learning_rate": 0.00029729561770163186, "loss": 5.5443, "mean_token_accuracy": 0.2123413488268852, "num_tokens": 104236791.0, "step": 41120 }, { "entropy": 5.967685842514038, "epoch": 4.746105020196191, "grad_norm": 1.015625, "learning_rate": 0.0002972545560653131, "loss": 5.3715, "mean_token_accuracy": 0.22523281276226043, "num_tokens": 104249003.0, "step": 41125 }, { "entropy": 5.980962705612183, "epoch": 4.7466820542412, "grad_norm": 0.9921875, "learning_rate": 0.0002972134936804734, "loss": 5.4012, "mean_token_accuracy": 0.22716932743787766, "num_tokens": 104261773.0, "step": 41130 }, { "entropy": 6.018964385986328, "epoch": 4.747259088286209, "grad_norm": 0.9921875, "learning_rate": 0.0002971724305484938, "loss": 5.4963, "mean_token_accuracy": 0.2135877400636673, "num_tokens": 104274847.0, "step": 41135 }, { "entropy": 6.043982410430909, "epoch": 4.7478361223312175, "grad_norm": 0.984375, "learning_rate": 0.00029713136667075556, "loss": 5.5009, "mean_token_accuracy": 0.2169567123055458, "num_tokens": 104287650.0, "step": 41140 }, { "entropy": 6.138433742523193, "epoch": 4.748413156376226, "grad_norm": 0.953125, "learning_rate": 0.00029709030204863975, "loss": 5.5291, "mean_token_accuracy": 0.2167165294289589, "num_tokens": 104300106.0, "step": 41145 }, { "entropy": 6.044185161590576, "epoch": 4.748990190421235, "grad_norm": 1.046875, "learning_rate": 0.00029704923668352767, "loss": 5.4632, "mean_token_accuracy": 0.21755122989416123, "num_tokens": 104314288.0, "step": 41150 }, { "entropy": 5.973044538497925, "epoch": 4.749567224466244, "grad_norm": 1.0390625, "learning_rate": 0.0002970081705768005, "loss": 5.431, "mean_token_accuracy": 0.2229637995362282, "num_tokens": 104327826.0, "step": 41155 }, { "entropy": 5.958447504043579, "epoch": 4.750144258511252, "grad_norm": 0.96875, "learning_rate": 0.00029696710372983926, "loss": 5.3956, "mean_token_accuracy": 0.224171444773674, "num_tokens": 104340535.0, "step": 41160 }, { "entropy": 6.063758373260498, "epoch": 4.7507212925562605, "grad_norm": 1.078125, "learning_rate": 0.0002969260361440255, "loss": 5.517, "mean_token_accuracy": 0.21696289032697677, "num_tokens": 104352444.0, "step": 41165 }, { "entropy": 6.073453140258789, "epoch": 4.75129832660127, "grad_norm": 0.9765625, "learning_rate": 0.00029688496782074046, "loss": 5.4681, "mean_token_accuracy": 0.21553591191768645, "num_tokens": 104364434.0, "step": 41170 }, { "entropy": 6.031896543502808, "epoch": 4.751875360646278, "grad_norm": 0.92578125, "learning_rate": 0.00029684389876136544, "loss": 5.447, "mean_token_accuracy": 0.22167080342769624, "num_tokens": 104378352.0, "step": 41175 }, { "entropy": 5.99749526977539, "epoch": 4.752452394691287, "grad_norm": 1.0, "learning_rate": 0.0002968028289672816, "loss": 5.4582, "mean_token_accuracy": 0.2226710394024849, "num_tokens": 104390096.0, "step": 41180 }, { "entropy": 5.988511943817139, "epoch": 4.753029428736295, "grad_norm": 1.015625, "learning_rate": 0.0002967617584398705, "loss": 5.4613, "mean_token_accuracy": 0.21954770833253862, "num_tokens": 104403746.0, "step": 41185 }, { "entropy": 5.845155811309814, "epoch": 4.753606462781304, "grad_norm": 0.9453125, "learning_rate": 0.0002967206871805135, "loss": 5.2796, "mean_token_accuracy": 0.23126329481601715, "num_tokens": 104416796.0, "step": 41190 }, { "entropy": 6.160752677917481, "epoch": 4.754183496826313, "grad_norm": 0.9296875, "learning_rate": 0.00029667961519059193, "loss": 5.5588, "mean_token_accuracy": 0.20575629770755768, "num_tokens": 104428959.0, "step": 41195 }, { "entropy": 6.070642280578613, "epoch": 4.754760530871321, "grad_norm": 0.99609375, "learning_rate": 0.0002966385424714872, "loss": 5.5414, "mean_token_accuracy": 0.21221750676631929, "num_tokens": 104442992.0, "step": 41200 }, { "entropy": 6.01796145439148, "epoch": 4.75533756491633, "grad_norm": 1.0234375, "learning_rate": 0.000296597469024581, "loss": 5.4557, "mean_token_accuracy": 0.21803570091724395, "num_tokens": 104454621.0, "step": 41205 }, { "entropy": 6.13784122467041, "epoch": 4.755914598961339, "grad_norm": 0.9921875, "learning_rate": 0.0002965563948512545, "loss": 5.5406, "mean_token_accuracy": 0.20647853314876558, "num_tokens": 104465674.0, "step": 41210 }, { "entropy": 6.133686304092407, "epoch": 4.756491633006347, "grad_norm": 1.0546875, "learning_rate": 0.0002965153199528895, "loss": 5.6044, "mean_token_accuracy": 0.20142944306135177, "num_tokens": 104477197.0, "step": 41215 }, { "entropy": 6.099056720733643, "epoch": 4.757068667051356, "grad_norm": 1.0078125, "learning_rate": 0.0002964742443308674, "loss": 5.5212, "mean_token_accuracy": 0.20995987355709075, "num_tokens": 104489720.0, "step": 41220 }, { "entropy": 6.0465374946594235, "epoch": 4.757645701096365, "grad_norm": 1.0078125, "learning_rate": 0.00029643316798656967, "loss": 5.4687, "mean_token_accuracy": 0.22009489834308624, "num_tokens": 104502279.0, "step": 41225 }, { "entropy": 5.9896721839904785, "epoch": 4.7582227351413735, "grad_norm": 0.9921875, "learning_rate": 0.000296392090921378, "loss": 5.4265, "mean_token_accuracy": 0.2296479046344757, "num_tokens": 104515865.0, "step": 41230 }, { "entropy": 6.043453550338745, "epoch": 4.758799769186382, "grad_norm": 1.0234375, "learning_rate": 0.000296351013136674, "loss": 5.6027, "mean_token_accuracy": 0.2050420805811882, "num_tokens": 104531117.0, "step": 41235 }, { "entropy": 5.996869325637817, "epoch": 4.75937680323139, "grad_norm": 1.046875, "learning_rate": 0.0002963099346338393, "loss": 5.4059, "mean_token_accuracy": 0.22415702193975448, "num_tokens": 104542621.0, "step": 41240 }, { "entropy": 6.0908228874206545, "epoch": 4.7599538372764, "grad_norm": 0.9375, "learning_rate": 0.00029626885541425546, "loss": 5.5956, "mean_token_accuracy": 0.20917401015758513, "num_tokens": 104555859.0, "step": 41245 }, { "entropy": 6.156450605392456, "epoch": 4.760530871321408, "grad_norm": 1.09375, "learning_rate": 0.0002962277754793043, "loss": 5.5883, "mean_token_accuracy": 0.20979728400707245, "num_tokens": 104569322.0, "step": 41250 }, { "entropy": 6.130332136154175, "epoch": 4.7611079053664165, "grad_norm": 0.95703125, "learning_rate": 0.0002961866948303675, "loss": 5.5935, "mean_token_accuracy": 0.20549824088811874, "num_tokens": 104582542.0, "step": 41255 }, { "entropy": 6.095255422592163, "epoch": 4.761684939411425, "grad_norm": 0.94921875, "learning_rate": 0.0002961456134688266, "loss": 5.5586, "mean_token_accuracy": 0.20963636487722398, "num_tokens": 104594772.0, "step": 41260 }, { "entropy": 6.027664852142334, "epoch": 4.762261973456434, "grad_norm": 0.98046875, "learning_rate": 0.0002961045313960636, "loss": 5.4349, "mean_token_accuracy": 0.21449389308691025, "num_tokens": 104608077.0, "step": 41265 }, { "entropy": 6.146485614776611, "epoch": 4.762839007501443, "grad_norm": 0.93359375, "learning_rate": 0.00029606344861346013, "loss": 5.6589, "mean_token_accuracy": 0.20151630342006682, "num_tokens": 104620725.0, "step": 41270 }, { "entropy": 6.105652236938477, "epoch": 4.763416041546451, "grad_norm": 1.0625, "learning_rate": 0.00029602236512239803, "loss": 5.5305, "mean_token_accuracy": 0.20572818368673323, "num_tokens": 104633868.0, "step": 41275 }, { "entropy": 6.115200805664062, "epoch": 4.7639930755914595, "grad_norm": 1.03125, "learning_rate": 0.0002959812809242592, "loss": 5.535, "mean_token_accuracy": 0.2111074447631836, "num_tokens": 104646846.0, "step": 41280 }, { "entropy": 6.069597673416138, "epoch": 4.764570109636469, "grad_norm": 1.0, "learning_rate": 0.00029594019602042533, "loss": 5.5963, "mean_token_accuracy": 0.20269977897405625, "num_tokens": 104658957.0, "step": 41285 }, { "entropy": 6.107734823226929, "epoch": 4.765147143681477, "grad_norm": 0.98828125, "learning_rate": 0.00029589911041227835, "loss": 5.4872, "mean_token_accuracy": 0.2133088916540146, "num_tokens": 104670707.0, "step": 41290 }, { "entropy": 6.160231351852417, "epoch": 4.765724177726486, "grad_norm": 0.92578125, "learning_rate": 0.00029585802410120023, "loss": 5.5981, "mean_token_accuracy": 0.21329203397035598, "num_tokens": 104683689.0, "step": 41295 }, { "entropy": 6.154626893997192, "epoch": 4.766301211771495, "grad_norm": 0.96484375, "learning_rate": 0.00029581693708857277, "loss": 5.5321, "mean_token_accuracy": 0.21114071756601333, "num_tokens": 104696398.0, "step": 41300 }, { "entropy": 5.91089243888855, "epoch": 4.766878245816503, "grad_norm": 0.984375, "learning_rate": 0.000295775849375778, "loss": 5.3818, "mean_token_accuracy": 0.2205381453037262, "num_tokens": 104708212.0, "step": 41305 }, { "entropy": 6.053814888000488, "epoch": 4.767455279861512, "grad_norm": 0.85546875, "learning_rate": 0.0002957347609641979, "loss": 5.5167, "mean_token_accuracy": 0.21384516060352327, "num_tokens": 104722215.0, "step": 41310 }, { "entropy": 6.095475149154663, "epoch": 4.76803231390652, "grad_norm": 0.92578125, "learning_rate": 0.00029569367185521434, "loss": 5.5733, "mean_token_accuracy": 0.20726267248392105, "num_tokens": 104733585.0, "step": 41315 }, { "entropy": 6.082965755462647, "epoch": 4.7686093479515295, "grad_norm": 1.0078125, "learning_rate": 0.00029565258205020944, "loss": 5.448, "mean_token_accuracy": 0.22041648328304292, "num_tokens": 104745147.0, "step": 41320 }, { "entropy": 5.899153137207032, "epoch": 4.769186381996538, "grad_norm": 0.9765625, "learning_rate": 0.0002956114915505652, "loss": 5.3914, "mean_token_accuracy": 0.2258801519870758, "num_tokens": 104758316.0, "step": 41325 }, { "entropy": 6.024810552597046, "epoch": 4.769763416041546, "grad_norm": 1.0078125, "learning_rate": 0.0002955704003576637, "loss": 5.51, "mean_token_accuracy": 0.2152888759970665, "num_tokens": 104769838.0, "step": 41330 }, { "entropy": 6.080876398086548, "epoch": 4.770340450086556, "grad_norm": 1.109375, "learning_rate": 0.000295529308472887, "loss": 5.4944, "mean_token_accuracy": 0.21570412814617157, "num_tokens": 104781925.0, "step": 41335 }, { "entropy": 6.083562135696411, "epoch": 4.770917484131564, "grad_norm": 0.98046875, "learning_rate": 0.00029548821589761717, "loss": 5.5594, "mean_token_accuracy": 0.21082534193992614, "num_tokens": 104795762.0, "step": 41340 }, { "entropy": 6.031008720397949, "epoch": 4.771494518176572, "grad_norm": 0.92578125, "learning_rate": 0.00029544712263323636, "loss": 5.3941, "mean_token_accuracy": 0.2175571858882904, "num_tokens": 104807073.0, "step": 41345 }, { "entropy": 5.932028532028198, "epoch": 4.772071552221581, "grad_norm": 0.90625, "learning_rate": 0.0002954060286811268, "loss": 5.3427, "mean_token_accuracy": 0.23438269197940825, "num_tokens": 104819816.0, "step": 41350 }, { "entropy": 5.9605449676513675, "epoch": 4.772648586266589, "grad_norm": 0.9921875, "learning_rate": 0.0002953649340426706, "loss": 5.4292, "mean_token_accuracy": 0.2205592140555382, "num_tokens": 104833067.0, "step": 41355 }, { "entropy": 6.028792190551758, "epoch": 4.773225620311599, "grad_norm": 0.96875, "learning_rate": 0.0002953238387192499, "loss": 5.4552, "mean_token_accuracy": 0.21971480995416642, "num_tokens": 104845844.0, "step": 41360 }, { "entropy": 6.134691286087036, "epoch": 4.773802654356607, "grad_norm": 0.984375, "learning_rate": 0.000295282742712247, "loss": 5.5621, "mean_token_accuracy": 0.20757120251655578, "num_tokens": 104859291.0, "step": 41365 }, { "entropy": 6.0594720363616945, "epoch": 4.774379688401615, "grad_norm": 1.015625, "learning_rate": 0.0002952416460230442, "loss": 5.5259, "mean_token_accuracy": 0.2145521342754364, "num_tokens": 104872761.0, "step": 41370 }, { "entropy": 6.093132591247558, "epoch": 4.774956722446625, "grad_norm": 1.171875, "learning_rate": 0.0002952005486530236, "loss": 5.5442, "mean_token_accuracy": 0.21537879407405852, "num_tokens": 104885268.0, "step": 41375 }, { "entropy": 6.176255130767823, "epoch": 4.775533756491633, "grad_norm": 1.03125, "learning_rate": 0.0002951594506035676, "loss": 5.5909, "mean_token_accuracy": 0.20619026720523834, "num_tokens": 104897443.0, "step": 41380 }, { "entropy": 6.135396432876587, "epoch": 4.776110790536642, "grad_norm": 0.9296875, "learning_rate": 0.0002951183518760585, "loss": 5.5959, "mean_token_accuracy": 0.20602556318044662, "num_tokens": 104910199.0, "step": 41385 }, { "entropy": 6.0705383777618405, "epoch": 4.77668782458165, "grad_norm": 1.0, "learning_rate": 0.00029507725247187867, "loss": 5.5288, "mean_token_accuracy": 0.21240886002779008, "num_tokens": 104922713.0, "step": 41390 }, { "entropy": 6.025086879730225, "epoch": 4.777264858626659, "grad_norm": 0.96875, "learning_rate": 0.00029503615239241036, "loss": 5.4602, "mean_token_accuracy": 0.21857306510210037, "num_tokens": 104935399.0, "step": 41395 }, { "entropy": 6.074596881866455, "epoch": 4.777841892671668, "grad_norm": 1.09375, "learning_rate": 0.0002949950516390361, "loss": 5.5013, "mean_token_accuracy": 0.21360948979854583, "num_tokens": 104947595.0, "step": 41400 }, { "entropy": 5.992557144165039, "epoch": 4.778418926716676, "grad_norm": 0.96484375, "learning_rate": 0.00029495395021313813, "loss": 5.4083, "mean_token_accuracy": 0.21428395360708236, "num_tokens": 104960278.0, "step": 41405 }, { "entropy": 6.025417709350586, "epoch": 4.778995960761685, "grad_norm": 0.98046875, "learning_rate": 0.000294912848116099, "loss": 5.4173, "mean_token_accuracy": 0.22592977732419967, "num_tokens": 104972766.0, "step": 41410 }, { "entropy": 6.184357357025147, "epoch": 4.779572994806694, "grad_norm": 0.94140625, "learning_rate": 0.00029487174534930104, "loss": 5.6082, "mean_token_accuracy": 0.2092226043343544, "num_tokens": 104986361.0, "step": 41415 }, { "entropy": 5.976289367675781, "epoch": 4.780150028851702, "grad_norm": 1.0078125, "learning_rate": 0.0002948306419141269, "loss": 5.3971, "mean_token_accuracy": 0.22283859699964523, "num_tokens": 104998449.0, "step": 41420 }, { "entropy": 6.0617103099823, "epoch": 4.780727062896711, "grad_norm": 0.9453125, "learning_rate": 0.0002947895378119589, "loss": 5.5593, "mean_token_accuracy": 0.20727822929620743, "num_tokens": 105010661.0, "step": 41425 }, { "entropy": 6.135581827163696, "epoch": 4.781304096941719, "grad_norm": 1.0390625, "learning_rate": 0.00029474843304417957, "loss": 5.5758, "mean_token_accuracy": 0.2071564868092537, "num_tokens": 105022557.0, "step": 41430 }, { "entropy": 6.120849609375, "epoch": 4.781881130986728, "grad_norm": 1.03125, "learning_rate": 0.00029470732761217167, "loss": 5.5602, "mean_token_accuracy": 0.21098630726337433, "num_tokens": 105033873.0, "step": 41435 }, { "entropy": 5.958856248855591, "epoch": 4.782458165031737, "grad_norm": 0.89453125, "learning_rate": 0.00029466622151731747, "loss": 5.3475, "mean_token_accuracy": 0.22708093076944352, "num_tokens": 105047006.0, "step": 41440 }, { "entropy": 6.025007057189941, "epoch": 4.783035199076745, "grad_norm": 1.0078125, "learning_rate": 0.0002946251147609997, "loss": 5.4787, "mean_token_accuracy": 0.21694047451019288, "num_tokens": 105058269.0, "step": 41445 }, { "entropy": 6.091573572158813, "epoch": 4.7836122331217545, "grad_norm": 1.0078125, "learning_rate": 0.00029458400734460097, "loss": 5.4496, "mean_token_accuracy": 0.2201585814356804, "num_tokens": 105071489.0, "step": 41450 }, { "entropy": 6.081538105010987, "epoch": 4.784189267166763, "grad_norm": 0.9921875, "learning_rate": 0.0002945428992695039, "loss": 5.4953, "mean_token_accuracy": 0.21984046697616577, "num_tokens": 105083729.0, "step": 41455 }, { "entropy": 6.01912636756897, "epoch": 4.784766301211771, "grad_norm": 0.88671875, "learning_rate": 0.0002945017905370911, "loss": 5.5144, "mean_token_accuracy": 0.2168918326497078, "num_tokens": 105097091.0, "step": 41460 }, { "entropy": 5.99334602355957, "epoch": 4.78534333525678, "grad_norm": 0.99609375, "learning_rate": 0.00029446068114874523, "loss": 5.4633, "mean_token_accuracy": 0.21733350604772567, "num_tokens": 105108298.0, "step": 41465 }, { "entropy": 6.097963333129883, "epoch": 4.785920369301789, "grad_norm": 0.984375, "learning_rate": 0.000294419571105849, "loss": 5.5477, "mean_token_accuracy": 0.21434574127197265, "num_tokens": 105121276.0, "step": 41470 }, { "entropy": 6.149650573730469, "epoch": 4.7864974033467975, "grad_norm": 0.98828125, "learning_rate": 0.0002943784604097852, "loss": 5.6099, "mean_token_accuracy": 0.20802673995494841, "num_tokens": 105132970.0, "step": 41475 }, { "entropy": 6.031307792663574, "epoch": 4.787074437391806, "grad_norm": 0.92578125, "learning_rate": 0.0002943373490619365, "loss": 5.5006, "mean_token_accuracy": 0.21768438518047334, "num_tokens": 105146247.0, "step": 41480 }, { "entropy": 6.0566246032714846, "epoch": 4.787651471436815, "grad_norm": 0.98046875, "learning_rate": 0.0002942962370636856, "loss": 5.5398, "mean_token_accuracy": 0.21586243510246278, "num_tokens": 105160490.0, "step": 41485 }, { "entropy": 6.0782383441925045, "epoch": 4.788228505481824, "grad_norm": 0.93359375, "learning_rate": 0.0002942551244164154, "loss": 5.5135, "mean_token_accuracy": 0.2113226607441902, "num_tokens": 105172828.0, "step": 41490 }, { "entropy": 6.04362998008728, "epoch": 4.788805539526832, "grad_norm": 0.9609375, "learning_rate": 0.0002942140111215087, "loss": 5.4744, "mean_token_accuracy": 0.21949948668479918, "num_tokens": 105185855.0, "step": 41495 }, { "entropy": 6.111118793487549, "epoch": 4.7893825735718405, "grad_norm": 0.94921875, "learning_rate": 0.0002941728971803483, "loss": 5.5255, "mean_token_accuracy": 0.2162104919552803, "num_tokens": 105197598.0, "step": 41500 }, { "entropy": 6.049832344055176, "epoch": 4.789959607616849, "grad_norm": 0.97265625, "learning_rate": 0.0002941317825943169, "loss": 5.4874, "mean_token_accuracy": 0.21283673495054245, "num_tokens": 105209179.0, "step": 41505 }, { "entropy": 5.980673933029175, "epoch": 4.790536641661858, "grad_norm": 0.97265625, "learning_rate": 0.0002940906673647976, "loss": 5.3883, "mean_token_accuracy": 0.2258274033665657, "num_tokens": 105222565.0, "step": 41510 }, { "entropy": 5.91896653175354, "epoch": 4.791113675706867, "grad_norm": 1.03125, "learning_rate": 0.0002940495514931731, "loss": 5.3778, "mean_token_accuracy": 0.22174662202596665, "num_tokens": 105234708.0, "step": 41515 }, { "entropy": 6.088687229156494, "epoch": 4.791690709751875, "grad_norm": 0.96875, "learning_rate": 0.00029400843498082654, "loss": 5.512, "mean_token_accuracy": 0.2184618815779686, "num_tokens": 105246265.0, "step": 41520 }, { "entropy": 6.053173589706421, "epoch": 4.792267743796884, "grad_norm": 1.015625, "learning_rate": 0.0002939673178291406, "loss": 5.4935, "mean_token_accuracy": 0.21846381723880767, "num_tokens": 105258512.0, "step": 41525 }, { "entropy": 6.0618218898773195, "epoch": 4.792844777841893, "grad_norm": 1.03125, "learning_rate": 0.0002939262000394984, "loss": 5.4616, "mean_token_accuracy": 0.21793500781059266, "num_tokens": 105270020.0, "step": 41530 }, { "entropy": 6.00270676612854, "epoch": 4.793421811886901, "grad_norm": 0.90234375, "learning_rate": 0.00029388508161328283, "loss": 5.5347, "mean_token_accuracy": 0.21377929896116257, "num_tokens": 105283388.0, "step": 41535 }, { "entropy": 6.119080591201782, "epoch": 4.79399884593191, "grad_norm": 1.0, "learning_rate": 0.0002938439625518769, "loss": 5.5872, "mean_token_accuracy": 0.20289211869239807, "num_tokens": 105296644.0, "step": 41540 }, { "entropy": 6.114306449890137, "epoch": 4.794575879976919, "grad_norm": 0.93359375, "learning_rate": 0.00029380284285666366, "loss": 5.5289, "mean_token_accuracy": 0.21145639717578887, "num_tokens": 105310268.0, "step": 41545 }, { "entropy": 6.04633092880249, "epoch": 4.795152914021927, "grad_norm": 1.046875, "learning_rate": 0.0002937617225290261, "loss": 5.4764, "mean_token_accuracy": 0.21371156573295594, "num_tokens": 105323180.0, "step": 41550 }, { "entropy": 6.04849100112915, "epoch": 4.795729948066936, "grad_norm": 0.93359375, "learning_rate": 0.00029372060157034744, "loss": 5.4599, "mean_token_accuracy": 0.21785809993743896, "num_tokens": 105336206.0, "step": 41555 }, { "entropy": 6.0739411354064945, "epoch": 4.796306982111945, "grad_norm": 0.94140625, "learning_rate": 0.0002936794799820105, "loss": 5.6084, "mean_token_accuracy": 0.21283904016017913, "num_tokens": 105348759.0, "step": 41560 }, { "entropy": 5.9736074924469, "epoch": 4.7968840161569535, "grad_norm": 1.015625, "learning_rate": 0.00029363835776539867, "loss": 5.3722, "mean_token_accuracy": 0.23410444408655168, "num_tokens": 105361318.0, "step": 41565 }, { "entropy": 6.09433913230896, "epoch": 4.797461050201962, "grad_norm": 1.109375, "learning_rate": 0.00029359723492189486, "loss": 5.5378, "mean_token_accuracy": 0.2156742572784424, "num_tokens": 105374536.0, "step": 41570 }, { "entropy": 6.020211172103882, "epoch": 4.79803808424697, "grad_norm": 0.96484375, "learning_rate": 0.0002935561114528823, "loss": 5.4753, "mean_token_accuracy": 0.22142890840768814, "num_tokens": 105386972.0, "step": 41575 }, { "entropy": 6.014218759536743, "epoch": 4.798615118291979, "grad_norm": 0.95703125, "learning_rate": 0.0002935149873597442, "loss": 5.4352, "mean_token_accuracy": 0.21854821145534514, "num_tokens": 105399898.0, "step": 41580 }, { "entropy": 6.062388706207275, "epoch": 4.799192152336988, "grad_norm": 0.9921875, "learning_rate": 0.0002934738626438636, "loss": 5.5497, "mean_token_accuracy": 0.20619071424007415, "num_tokens": 105412039.0, "step": 41585 }, { "entropy": 6.112994432449341, "epoch": 4.7997691863819965, "grad_norm": 0.95703125, "learning_rate": 0.00029343273730662384, "loss": 5.5497, "mean_token_accuracy": 0.20765966325998306, "num_tokens": 105423735.0, "step": 41590 }, { "entropy": 6.000195646286011, "epoch": 4.800346220427005, "grad_norm": 0.92578125, "learning_rate": 0.0002933916113494081, "loss": 5.4678, "mean_token_accuracy": 0.21727635562419892, "num_tokens": 105435753.0, "step": 41595 }, { "entropy": 6.107688093185425, "epoch": 4.800923254472014, "grad_norm": 1.0859375, "learning_rate": 0.00029335048477359974, "loss": 5.5165, "mean_token_accuracy": 0.20927537977695465, "num_tokens": 105446925.0, "step": 41600 }, { "entropy": 6.10490665435791, "epoch": 4.801500288517023, "grad_norm": 1.0234375, "learning_rate": 0.0002933093575805819, "loss": 5.5291, "mean_token_accuracy": 0.21377342492341994, "num_tokens": 105459764.0, "step": 41605 }, { "entropy": 6.066596460342407, "epoch": 4.802077322562031, "grad_norm": 0.94921875, "learning_rate": 0.0002932682297717379, "loss": 5.4906, "mean_token_accuracy": 0.21600044667720794, "num_tokens": 105474508.0, "step": 41610 }, { "entropy": 6.020422315597534, "epoch": 4.802654356607039, "grad_norm": 1.0, "learning_rate": 0.000293227101348451, "loss": 5.4502, "mean_token_accuracy": 0.22096077054739, "num_tokens": 105488679.0, "step": 41615 }, { "entropy": 6.084559202194214, "epoch": 4.803231390652049, "grad_norm": 0.9375, "learning_rate": 0.0002931859723121047, "loss": 5.4825, "mean_token_accuracy": 0.21959920674562455, "num_tokens": 105501859.0, "step": 41620 }, { "entropy": 6.030162286758423, "epoch": 4.803808424697057, "grad_norm": 0.96875, "learning_rate": 0.0002931448426640822, "loss": 5.4456, "mean_token_accuracy": 0.21540820002555847, "num_tokens": 105514757.0, "step": 41625 }, { "entropy": 5.99525408744812, "epoch": 4.804385458742066, "grad_norm": 0.96484375, "learning_rate": 0.000293103712405767, "loss": 5.4925, "mean_token_accuracy": 0.21668670028448106, "num_tokens": 105526747.0, "step": 41630 }, { "entropy": 6.059666109085083, "epoch": 4.804962492787075, "grad_norm": 0.9375, "learning_rate": 0.0002930625815385424, "loss": 5.4937, "mean_token_accuracy": 0.21525411754846574, "num_tokens": 105539892.0, "step": 41635 }, { "entropy": 6.075288391113281, "epoch": 4.805539526832083, "grad_norm": 0.99609375, "learning_rate": 0.0002930214500637917, "loss": 5.4666, "mean_token_accuracy": 0.2126723572611809, "num_tokens": 105552958.0, "step": 41640 }, { "entropy": 5.961076736450195, "epoch": 4.806116560877092, "grad_norm": 0.92578125, "learning_rate": 0.0002929803179828986, "loss": 5.4337, "mean_token_accuracy": 0.219391368329525, "num_tokens": 105565617.0, "step": 41645 }, { "entropy": 6.092890930175781, "epoch": 4.8066935949221, "grad_norm": 1.0078125, "learning_rate": 0.0002929391852972465, "loss": 5.5209, "mean_token_accuracy": 0.21151095479726792, "num_tokens": 105578644.0, "step": 41650 }, { "entropy": 6.0649425983428955, "epoch": 4.807270628967109, "grad_norm": 0.99609375, "learning_rate": 0.00029289805200821874, "loss": 5.5233, "mean_token_accuracy": 0.21722752898931502, "num_tokens": 105591833.0, "step": 41655 }, { "entropy": 6.060564374923706, "epoch": 4.807847663012118, "grad_norm": 1.0703125, "learning_rate": 0.00029285691811719883, "loss": 5.4705, "mean_token_accuracy": 0.21344552636146547, "num_tokens": 105602644.0, "step": 41660 }, { "entropy": 6.047170495986938, "epoch": 4.808424697057126, "grad_norm": 1.0078125, "learning_rate": 0.00029281578362557045, "loss": 5.4983, "mean_token_accuracy": 0.21394772678613663, "num_tokens": 105615392.0, "step": 41665 }, { "entropy": 6.023516368865967, "epoch": 4.809001731102135, "grad_norm": 0.91015625, "learning_rate": 0.00029277464853471696, "loss": 5.4865, "mean_token_accuracy": 0.21132300347089766, "num_tokens": 105628227.0, "step": 41670 }, { "entropy": 6.008621788024902, "epoch": 4.809578765147144, "grad_norm": 0.953125, "learning_rate": 0.00029273351284602204, "loss": 5.4758, "mean_token_accuracy": 0.21179116517305374, "num_tokens": 105640587.0, "step": 41675 }, { "entropy": 6.045520448684693, "epoch": 4.810155799192152, "grad_norm": 0.9453125, "learning_rate": 0.00029269237656086923, "loss": 5.4284, "mean_token_accuracy": 0.2278468430042267, "num_tokens": 105653131.0, "step": 41680 }, { "entropy": 6.005474328994751, "epoch": 4.810732833237161, "grad_norm": 1.0234375, "learning_rate": 0.0002926512396806421, "loss": 5.4152, "mean_token_accuracy": 0.22410652041435242, "num_tokens": 105666303.0, "step": 41685 }, { "entropy": 6.016945743560791, "epoch": 4.811309867282169, "grad_norm": 0.9140625, "learning_rate": 0.00029261010220672437, "loss": 5.5054, "mean_token_accuracy": 0.21547868549823762, "num_tokens": 105678776.0, "step": 41690 }, { "entropy": 6.053600406646728, "epoch": 4.811886901327179, "grad_norm": 0.92578125, "learning_rate": 0.0002925689641404995, "loss": 5.5078, "mean_token_accuracy": 0.21156597137451172, "num_tokens": 105692403.0, "step": 41695 }, { "entropy": 6.0752159595489506, "epoch": 4.812463935372187, "grad_norm": 1.0, "learning_rate": 0.00029252782548335127, "loss": 5.5587, "mean_token_accuracy": 0.207550747692585, "num_tokens": 105704505.0, "step": 41700 }, { "entropy": 6.037029600143432, "epoch": 4.813040969417195, "grad_norm": 0.94921875, "learning_rate": 0.00029248668623666336, "loss": 5.409, "mean_token_accuracy": 0.2211407944560051, "num_tokens": 105717250.0, "step": 41705 }, { "entropy": 6.090919733047485, "epoch": 4.813618003462205, "grad_norm": 1.0078125, "learning_rate": 0.0002924455464018194, "loss": 5.5354, "mean_token_accuracy": 0.21743592321872712, "num_tokens": 105729208.0, "step": 41710 }, { "entropy": 6.0492791652679445, "epoch": 4.814195037507213, "grad_norm": 0.88671875, "learning_rate": 0.00029240440598020325, "loss": 5.4572, "mean_token_accuracy": 0.22621232122182847, "num_tokens": 105741727.0, "step": 41715 }, { "entropy": 6.051457023620605, "epoch": 4.8147720715522215, "grad_norm": 1.015625, "learning_rate": 0.0002923632649731984, "loss": 5.5007, "mean_token_accuracy": 0.21788737028837205, "num_tokens": 105753349.0, "step": 41720 }, { "entropy": 6.037710857391358, "epoch": 4.81534910559723, "grad_norm": 0.953125, "learning_rate": 0.0002923221233821888, "loss": 5.4983, "mean_token_accuracy": 0.21543957144021988, "num_tokens": 105764915.0, "step": 41725 }, { "entropy": 5.956029844284058, "epoch": 4.815926139642239, "grad_norm": 0.984375, "learning_rate": 0.0002922809812085583, "loss": 5.4408, "mean_token_accuracy": 0.22386123090982438, "num_tokens": 105779055.0, "step": 41730 }, { "entropy": 6.117808675765991, "epoch": 4.816503173687248, "grad_norm": 0.921875, "learning_rate": 0.0002922398384536905, "loss": 5.5681, "mean_token_accuracy": 0.2072658881545067, "num_tokens": 105792307.0, "step": 41735 }, { "entropy": 6.140282201766968, "epoch": 4.817080207732256, "grad_norm": 0.98828125, "learning_rate": 0.0002921986951189693, "loss": 5.5109, "mean_token_accuracy": 0.21260603070259093, "num_tokens": 105805995.0, "step": 41740 }, { "entropy": 6.092316770553589, "epoch": 4.8176572417772645, "grad_norm": 1.0859375, "learning_rate": 0.00029215755120577853, "loss": 5.5303, "mean_token_accuracy": 0.21037748456001282, "num_tokens": 105817961.0, "step": 41745 }, { "entropy": 6.042257165908813, "epoch": 4.818234275822274, "grad_norm": 0.984375, "learning_rate": 0.000292116406715502, "loss": 5.5017, "mean_token_accuracy": 0.21728186160326005, "num_tokens": 105829051.0, "step": 41750 }, { "entropy": 6.023566961288452, "epoch": 4.818811309867282, "grad_norm": 0.98046875, "learning_rate": 0.00029207526164952375, "loss": 5.476, "mean_token_accuracy": 0.21348415911197663, "num_tokens": 105841370.0, "step": 41755 }, { "entropy": 6.0289342403411865, "epoch": 4.819388343912291, "grad_norm": 0.9140625, "learning_rate": 0.00029203411600922744, "loss": 5.4397, "mean_token_accuracy": 0.22370845675468445, "num_tokens": 105854895.0, "step": 41760 }, { "entropy": 6.034477281570434, "epoch": 4.819965377957299, "grad_norm": 0.9765625, "learning_rate": 0.00029199296979599723, "loss": 5.5269, "mean_token_accuracy": 0.20602592825889587, "num_tokens": 105866650.0, "step": 41765 }, { "entropy": 6.10467209815979, "epoch": 4.820542412002308, "grad_norm": 1.015625, "learning_rate": 0.00029195182301121683, "loss": 5.5568, "mean_token_accuracy": 0.21620430946350097, "num_tokens": 105878682.0, "step": 41770 }, { "entropy": 6.048243761062622, "epoch": 4.821119446047317, "grad_norm": 0.84765625, "learning_rate": 0.00029191067565627034, "loss": 5.4833, "mean_token_accuracy": 0.22307748198509217, "num_tokens": 105892127.0, "step": 41775 }, { "entropy": 6.030547142028809, "epoch": 4.821696480092325, "grad_norm": 1.015625, "learning_rate": 0.00029186952773254163, "loss": 5.45, "mean_token_accuracy": 0.21983271688222886, "num_tokens": 105904634.0, "step": 41780 }, { "entropy": 6.097190904617309, "epoch": 4.8222735141373345, "grad_norm": 0.9921875, "learning_rate": 0.00029182837924141464, "loss": 5.5553, "mean_token_accuracy": 0.20591573119163514, "num_tokens": 105917267.0, "step": 41785 }, { "entropy": 6.059438848495484, "epoch": 4.822850548182343, "grad_norm": 0.9140625, "learning_rate": 0.0002917872301842736, "loss": 5.5112, "mean_token_accuracy": 0.21491246223449706, "num_tokens": 105930612.0, "step": 41790 }, { "entropy": 6.121038198471069, "epoch": 4.823427582227351, "grad_norm": 0.90625, "learning_rate": 0.0002917460805625024, "loss": 5.5893, "mean_token_accuracy": 0.20605832785367967, "num_tokens": 105943162.0, "step": 41795 }, { "entropy": 6.0964601039886475, "epoch": 4.82400461627236, "grad_norm": 0.92578125, "learning_rate": 0.0002917049303774851, "loss": 5.5121, "mean_token_accuracy": 0.21484218537807465, "num_tokens": 105955907.0, "step": 41800 }, { "entropy": 6.092317819595337, "epoch": 4.824581650317369, "grad_norm": 1.046875, "learning_rate": 0.00029166377963060574, "loss": 5.5166, "mean_token_accuracy": 0.2166803926229477, "num_tokens": 105970078.0, "step": 41805 }, { "entropy": 6.027702856063843, "epoch": 4.8251586843623775, "grad_norm": 0.98828125, "learning_rate": 0.0002916226283232484, "loss": 5.4195, "mean_token_accuracy": 0.21365920156240464, "num_tokens": 105981817.0, "step": 41810 }, { "entropy": 5.950418281555176, "epoch": 4.825735718407386, "grad_norm": 0.921875, "learning_rate": 0.00029158147645679726, "loss": 5.3022, "mean_token_accuracy": 0.23412099331617356, "num_tokens": 105994146.0, "step": 41815 }, { "entropy": 6.082836294174195, "epoch": 4.826312752452394, "grad_norm": 1.0234375, "learning_rate": 0.0002915403240326364, "loss": 5.5549, "mean_token_accuracy": 0.21540736258029938, "num_tokens": 106007120.0, "step": 41820 }, { "entropy": 6.000719499588013, "epoch": 4.826889786497404, "grad_norm": 1.0546875, "learning_rate": 0.00029149917105214995, "loss": 5.4785, "mean_token_accuracy": 0.22026052474975585, "num_tokens": 106021807.0, "step": 41825 }, { "entropy": 6.106930923461914, "epoch": 4.827466820542412, "grad_norm": 0.96875, "learning_rate": 0.00029145801751672204, "loss": 5.5743, "mean_token_accuracy": 0.20442667454481125, "num_tokens": 106034250.0, "step": 41830 }, { "entropy": 6.142507934570313, "epoch": 4.8280438545874205, "grad_norm": 0.90234375, "learning_rate": 0.00029141686342773693, "loss": 5.5439, "mean_token_accuracy": 0.21021172404289246, "num_tokens": 106048507.0, "step": 41835 }, { "entropy": 5.977290153503418, "epoch": 4.828620888632429, "grad_norm": 1.0703125, "learning_rate": 0.00029137570878657877, "loss": 5.3779, "mean_token_accuracy": 0.23080142587423325, "num_tokens": 106060923.0, "step": 41840 }, { "entropy": 6.045567178726197, "epoch": 4.829197922677438, "grad_norm": 1.0390625, "learning_rate": 0.00029133455359463175, "loss": 5.4597, "mean_token_accuracy": 0.21228379756212234, "num_tokens": 106073518.0, "step": 41845 }, { "entropy": 5.915381193161011, "epoch": 4.829774956722447, "grad_norm": 0.97265625, "learning_rate": 0.0002912933978532802, "loss": 5.3213, "mean_token_accuracy": 0.22838466316461564, "num_tokens": 106086453.0, "step": 41850 }, { "entropy": 5.9941082954406735, "epoch": 4.830351990767455, "grad_norm": 0.9375, "learning_rate": 0.0002912522415639082, "loss": 5.4301, "mean_token_accuracy": 0.2179124668240547, "num_tokens": 106099086.0, "step": 41855 }, { "entropy": 6.013785266876221, "epoch": 4.830929024812464, "grad_norm": 1.0234375, "learning_rate": 0.0002912110847279002, "loss": 5.5111, "mean_token_accuracy": 0.21364900171756745, "num_tokens": 106112964.0, "step": 41860 }, { "entropy": 6.029106664657593, "epoch": 4.831506058857473, "grad_norm": 1.1328125, "learning_rate": 0.0002911699273466403, "loss": 5.4382, "mean_token_accuracy": 0.2227054789662361, "num_tokens": 106126915.0, "step": 41865 }, { "entropy": 6.107553482055664, "epoch": 4.832083092902481, "grad_norm": 1.0078125, "learning_rate": 0.00029112876942151314, "loss": 5.5537, "mean_token_accuracy": 0.2108403339982033, "num_tokens": 106139704.0, "step": 41870 }, { "entropy": 6.074220895767212, "epoch": 4.83266012694749, "grad_norm": 1.015625, "learning_rate": 0.0002910876109539027, "loss": 5.4674, "mean_token_accuracy": 0.2125176638364792, "num_tokens": 106152352.0, "step": 41875 }, { "entropy": 6.032215929031372, "epoch": 4.833237160992499, "grad_norm": 0.98046875, "learning_rate": 0.00029104645194519345, "loss": 5.4944, "mean_token_accuracy": 0.22198151797056198, "num_tokens": 106165333.0, "step": 41880 }, { "entropy": 6.142093706130981, "epoch": 4.833814195037507, "grad_norm": 1.0546875, "learning_rate": 0.0002910052923967698, "loss": 5.5704, "mean_token_accuracy": 0.21293933987617492, "num_tokens": 106177522.0, "step": 41885 }, { "entropy": 6.072480821609497, "epoch": 4.834391229082516, "grad_norm": 0.9375, "learning_rate": 0.0002909641323100161, "loss": 5.5168, "mean_token_accuracy": 0.20957802683115007, "num_tokens": 106189969.0, "step": 41890 }, { "entropy": 6.072681617736817, "epoch": 4.834968263127524, "grad_norm": 0.95703125, "learning_rate": 0.0002909229716863167, "loss": 5.516, "mean_token_accuracy": 0.21778736561536788, "num_tokens": 106202016.0, "step": 41895 }, { "entropy": 6.030926895141602, "epoch": 4.8355452971725335, "grad_norm": 0.9609375, "learning_rate": 0.0002908818105270561, "loss": 5.4172, "mean_token_accuracy": 0.22090569734573365, "num_tokens": 106214558.0, "step": 41900 }, { "entropy": 6.065970706939697, "epoch": 4.836122331217542, "grad_norm": 0.8984375, "learning_rate": 0.0002908406488336186, "loss": 5.507, "mean_token_accuracy": 0.2176358923316002, "num_tokens": 106227845.0, "step": 41905 }, { "entropy": 6.102239036560059, "epoch": 4.83669936526255, "grad_norm": 0.9609375, "learning_rate": 0.00029079948660738883, "loss": 5.5083, "mean_token_accuracy": 0.2149672254920006, "num_tokens": 106240592.0, "step": 41910 }, { "entropy": 6.102728366851807, "epoch": 4.837276399307559, "grad_norm": 0.95703125, "learning_rate": 0.0002907583238497512, "loss": 5.5413, "mean_token_accuracy": 0.20700691789388656, "num_tokens": 106254902.0, "step": 41915 }, { "entropy": 6.133925247192383, "epoch": 4.837853433352568, "grad_norm": 0.984375, "learning_rate": 0.0002907171605620901, "loss": 5.5952, "mean_token_accuracy": 0.20930389165878296, "num_tokens": 106268142.0, "step": 41920 }, { "entropy": 6.102343606948852, "epoch": 4.838430467397576, "grad_norm": 0.99609375, "learning_rate": 0.00029067599674579013, "loss": 5.4961, "mean_token_accuracy": 0.21084205359220504, "num_tokens": 106279177.0, "step": 41925 }, { "entropy": 6.131048059463501, "epoch": 4.839007501442585, "grad_norm": 0.90625, "learning_rate": 0.0002906348324022358, "loss": 5.6683, "mean_token_accuracy": 0.20389731377363204, "num_tokens": 106291526.0, "step": 41930 }, { "entropy": 6.0369102478027346, "epoch": 4.839584535487594, "grad_norm": 0.96875, "learning_rate": 0.0002905936675328117, "loss": 5.4636, "mean_token_accuracy": 0.21381203830242157, "num_tokens": 106305520.0, "step": 41935 }, { "entropy": 6.152507972717285, "epoch": 4.840161569532603, "grad_norm": 1.0, "learning_rate": 0.00029055250213890226, "loss": 5.4809, "mean_token_accuracy": 0.21613842397928237, "num_tokens": 106316947.0, "step": 41940 }, { "entropy": 6.043904113769531, "epoch": 4.840738603577611, "grad_norm": 1.046875, "learning_rate": 0.00029051133622189215, "loss": 5.5282, "mean_token_accuracy": 0.21606215536594392, "num_tokens": 106329961.0, "step": 41945 }, { "entropy": 6.02126407623291, "epoch": 4.841315637622619, "grad_norm": 0.92578125, "learning_rate": 0.00029047016978316596, "loss": 5.5217, "mean_token_accuracy": 0.21577370017766953, "num_tokens": 106342369.0, "step": 41950 }, { "entropy": 6.136128950119018, "epoch": 4.841892671667629, "grad_norm": 0.99609375, "learning_rate": 0.00029042900282410833, "loss": 5.5612, "mean_token_accuracy": 0.20706587582826613, "num_tokens": 106353810.0, "step": 41955 }, { "entropy": 6.052432537078857, "epoch": 4.842469705712637, "grad_norm": 0.98046875, "learning_rate": 0.00029038783534610384, "loss": 5.4642, "mean_token_accuracy": 0.21803044825792312, "num_tokens": 106365920.0, "step": 41960 }, { "entropy": 6.064763593673706, "epoch": 4.8430467397576455, "grad_norm": 0.96875, "learning_rate": 0.0002903466673505371, "loss": 5.4617, "mean_token_accuracy": 0.22036785036325454, "num_tokens": 106377959.0, "step": 41965 }, { "entropy": 6.029982423782348, "epoch": 4.843623773802655, "grad_norm": 0.97265625, "learning_rate": 0.0002903054988387928, "loss": 5.5568, "mean_token_accuracy": 0.22074573785066604, "num_tokens": 106391106.0, "step": 41970 }, { "entropy": 6.103996276855469, "epoch": 4.844200807847663, "grad_norm": 0.98828125, "learning_rate": 0.00029026432981225583, "loss": 5.4919, "mean_token_accuracy": 0.21445810049772263, "num_tokens": 106402958.0, "step": 41975 }, { "entropy": 6.130579900741577, "epoch": 4.844777841892672, "grad_norm": 0.9765625, "learning_rate": 0.00029022316027231055, "loss": 5.5813, "mean_token_accuracy": 0.21052951812744142, "num_tokens": 106415710.0, "step": 41980 }, { "entropy": 6.053104591369629, "epoch": 4.84535487593768, "grad_norm": 1.015625, "learning_rate": 0.0002901819902203419, "loss": 5.478, "mean_token_accuracy": 0.22126443982124328, "num_tokens": 106429004.0, "step": 41985 }, { "entropy": 6.061376333236694, "epoch": 4.8459319099826885, "grad_norm": 0.99609375, "learning_rate": 0.00029014081965773457, "loss": 5.5617, "mean_token_accuracy": 0.21525579541921616, "num_tokens": 106441590.0, "step": 41990 }, { "entropy": 6.005907726287842, "epoch": 4.846508944027698, "grad_norm": 0.95703125, "learning_rate": 0.00029009964858587326, "loss": 5.4526, "mean_token_accuracy": 0.21998029947280884, "num_tokens": 106454567.0, "step": 41995 }, { "entropy": 6.065983867645263, "epoch": 4.847085978072706, "grad_norm": 0.9609375, "learning_rate": 0.00029005847700614275, "loss": 5.5299, "mean_token_accuracy": 0.2138586938381195, "num_tokens": 106468022.0, "step": 42000 }, { "epoch": 4.847085978072706, "eval_entropy": 5.868718833451519, "eval_loss": 5.651386260986328, "eval_mean_token_accuracy": 0.21457421298109403, "eval_num_tokens": 106468022.0, "eval_runtime": 23.0621, "eval_samples_per_second": 1220.01, "eval_steps_per_second": 152.501, "step": 42000 }, { "entropy": 6.01589789390564, "epoch": 4.847663012117715, "grad_norm": 0.9296875, "learning_rate": 0.00029001730491992785, "loss": 5.4704, "mean_token_accuracy": 0.22318455576896667, "num_tokens": 106481191.0, "step": 42005 }, { "entropy": 6.032896566390991, "epoch": 4.848240046162724, "grad_norm": 1.0078125, "learning_rate": 0.00028997613232861335, "loss": 5.4867, "mean_token_accuracy": 0.2166577696800232, "num_tokens": 106492887.0, "step": 42010 }, { "entropy": 6.0560060977935795, "epoch": 4.848817080207732, "grad_norm": 1.0, "learning_rate": 0.0002899349592335841, "loss": 5.4865, "mean_token_accuracy": 0.21756270974874498, "num_tokens": 106506121.0, "step": 42015 }, { "entropy": 6.040227794647217, "epoch": 4.849394114252741, "grad_norm": 0.9765625, "learning_rate": 0.00028989378563622486, "loss": 5.4693, "mean_token_accuracy": 0.2161123275756836, "num_tokens": 106518625.0, "step": 42020 }, { "entropy": 6.110466575622558, "epoch": 4.849971148297749, "grad_norm": 0.9765625, "learning_rate": 0.0002898526115379206, "loss": 5.5449, "mean_token_accuracy": 0.2067861005663872, "num_tokens": 106532438.0, "step": 42025 }, { "entropy": 6.008976411819458, "epoch": 4.8505481823427585, "grad_norm": 0.9140625, "learning_rate": 0.0002898114369400562, "loss": 5.4401, "mean_token_accuracy": 0.2157757431268692, "num_tokens": 106544725.0, "step": 42030 }, { "entropy": 5.973070573806763, "epoch": 4.851125216387767, "grad_norm": 0.96875, "learning_rate": 0.0002897702618440163, "loss": 5.4348, "mean_token_accuracy": 0.21859724223613738, "num_tokens": 106557527.0, "step": 42035 }, { "entropy": 6.100250720977783, "epoch": 4.851702250432775, "grad_norm": 0.95703125, "learning_rate": 0.0002897290862511861, "loss": 5.5714, "mean_token_accuracy": 0.20295725166797637, "num_tokens": 106569254.0, "step": 42040 }, { "entropy": 6.081954669952393, "epoch": 4.852279284477785, "grad_norm": 1.1484375, "learning_rate": 0.00028968791016295044, "loss": 5.4889, "mean_token_accuracy": 0.21217907667160035, "num_tokens": 106581554.0, "step": 42045 }, { "entropy": 6.087125492095947, "epoch": 4.852856318522793, "grad_norm": 0.92578125, "learning_rate": 0.00028964673358069414, "loss": 5.531, "mean_token_accuracy": 0.20894382297992706, "num_tokens": 106594993.0, "step": 42050 }, { "entropy": 5.986484622955322, "epoch": 4.8534333525678015, "grad_norm": 1.03125, "learning_rate": 0.00028960555650580223, "loss": 5.3768, "mean_token_accuracy": 0.23385561406612396, "num_tokens": 106607408.0, "step": 42055 }, { "entropy": 5.986668729782105, "epoch": 4.85401038661281, "grad_norm": 0.92578125, "learning_rate": 0.0002895643789396596, "loss": 5.5039, "mean_token_accuracy": 0.21539508700370788, "num_tokens": 106620338.0, "step": 42060 }, { "entropy": 6.07614951133728, "epoch": 4.854587420657818, "grad_norm": 1.0078125, "learning_rate": 0.0002895232008836515, "loss": 5.4915, "mean_token_accuracy": 0.2159276932477951, "num_tokens": 106632523.0, "step": 42065 }, { "entropy": 6.074080848693848, "epoch": 4.855164454702828, "grad_norm": 1.1640625, "learning_rate": 0.0002894820223391627, "loss": 5.4465, "mean_token_accuracy": 0.22079320549964904, "num_tokens": 106646033.0, "step": 42070 }, { "entropy": 5.912979936599731, "epoch": 4.855741488747836, "grad_norm": 0.94921875, "learning_rate": 0.00028944084330757814, "loss": 5.3442, "mean_token_accuracy": 0.2312565639615059, "num_tokens": 106658754.0, "step": 42075 }, { "entropy": 5.999143934249878, "epoch": 4.8563185227928445, "grad_norm": 0.99609375, "learning_rate": 0.0002893996637902831, "loss": 5.5024, "mean_token_accuracy": 0.21659717857837676, "num_tokens": 106671653.0, "step": 42080 }, { "entropy": 6.176541519165039, "epoch": 4.856895556837854, "grad_norm": 0.91796875, "learning_rate": 0.00028935848378866254, "loss": 5.5554, "mean_token_accuracy": 0.21208382844924928, "num_tokens": 106683241.0, "step": 42085 }, { "entropy": 5.99263710975647, "epoch": 4.857472590882862, "grad_norm": 0.859375, "learning_rate": 0.0002893173033041015, "loss": 5.4094, "mean_token_accuracy": 0.22358872443437577, "num_tokens": 106696702.0, "step": 42090 }, { "entropy": 5.993108606338501, "epoch": 4.858049624927871, "grad_norm": 0.98046875, "learning_rate": 0.000289276122337985, "loss": 5.4576, "mean_token_accuracy": 0.2163296863436699, "num_tokens": 106708588.0, "step": 42095 }, { "entropy": 6.107447910308838, "epoch": 4.858626658972879, "grad_norm": 0.94140625, "learning_rate": 0.0002892349408916983, "loss": 5.5259, "mean_token_accuracy": 0.212727190554142, "num_tokens": 106721138.0, "step": 42100 }, { "entropy": 6.028909301757812, "epoch": 4.859203693017888, "grad_norm": 1.046875, "learning_rate": 0.0002891937589666264, "loss": 5.4274, "mean_token_accuracy": 0.21823488026857377, "num_tokens": 106734430.0, "step": 42105 }, { "entropy": 6.0682297706604, "epoch": 4.859780727062897, "grad_norm": 0.97265625, "learning_rate": 0.0002891525765641545, "loss": 5.5248, "mean_token_accuracy": 0.20743386149406434, "num_tokens": 106746474.0, "step": 42110 }, { "entropy": 6.177525377273559, "epoch": 4.860357761107905, "grad_norm": 1.046875, "learning_rate": 0.00028911139368566766, "loss": 5.5242, "mean_token_accuracy": 0.21512916535139084, "num_tokens": 106758486.0, "step": 42115 }, { "entropy": 6.060549402236939, "epoch": 4.8609347951529145, "grad_norm": 1.0078125, "learning_rate": 0.0002890702103325512, "loss": 5.4737, "mean_token_accuracy": 0.22206600606441498, "num_tokens": 106770737.0, "step": 42120 }, { "entropy": 6.089299535751342, "epoch": 4.861511829197923, "grad_norm": 0.98828125, "learning_rate": 0.00028902902650619004, "loss": 5.6143, "mean_token_accuracy": 0.20724078714847566, "num_tokens": 106782983.0, "step": 42125 }, { "entropy": 6.085077571868896, "epoch": 4.862088863242931, "grad_norm": 1.078125, "learning_rate": 0.0002889878422079697, "loss": 5.5509, "mean_token_accuracy": 0.21497012674808502, "num_tokens": 106795890.0, "step": 42130 }, { "entropy": 6.077599716186524, "epoch": 4.86266589728794, "grad_norm": 1.09375, "learning_rate": 0.0002889466574392751, "loss": 5.4605, "mean_token_accuracy": 0.22520923614501953, "num_tokens": 106808603.0, "step": 42135 }, { "entropy": 6.052433681488037, "epoch": 4.863242931332948, "grad_norm": 0.9609375, "learning_rate": 0.0002889054722014917, "loss": 5.5067, "mean_token_accuracy": 0.21787955164909362, "num_tokens": 106821414.0, "step": 42140 }, { "entropy": 6.053203964233399, "epoch": 4.8638199653779575, "grad_norm": 1.0078125, "learning_rate": 0.00028886428649600466, "loss": 5.493, "mean_token_accuracy": 0.21190803945064546, "num_tokens": 106833714.0, "step": 42145 }, { "entropy": 6.074897193908692, "epoch": 4.864396999422966, "grad_norm": 0.9453125, "learning_rate": 0.00028882310032419915, "loss": 5.5547, "mean_token_accuracy": 0.21016849875450133, "num_tokens": 106846975.0, "step": 42150 }, { "entropy": 6.05290036201477, "epoch": 4.864974033467974, "grad_norm": 1.015625, "learning_rate": 0.0002887819136874606, "loss": 5.4482, "mean_token_accuracy": 0.21339240074157714, "num_tokens": 106859654.0, "step": 42155 }, { "entropy": 6.081863164901733, "epoch": 4.865551067512984, "grad_norm": 1.0, "learning_rate": 0.0002887407265871742, "loss": 5.5591, "mean_token_accuracy": 0.21253576129674911, "num_tokens": 106872532.0, "step": 42160 }, { "entropy": 6.083760690689087, "epoch": 4.866128101557992, "grad_norm": 1.0078125, "learning_rate": 0.00028869953902472536, "loss": 5.5787, "mean_token_accuracy": 0.20476481318473816, "num_tokens": 106884396.0, "step": 42165 }, { "entropy": 6.082341480255127, "epoch": 4.866705135603, "grad_norm": 0.984375, "learning_rate": 0.00028865835100149926, "loss": 5.5117, "mean_token_accuracy": 0.21547332853078843, "num_tokens": 106897069.0, "step": 42170 }, { "entropy": 6.089553546905518, "epoch": 4.867282169648009, "grad_norm": 0.9609375, "learning_rate": 0.0002886171625188813, "loss": 5.5414, "mean_token_accuracy": 0.21292500644922258, "num_tokens": 106910347.0, "step": 42175 }, { "entropy": 6.010037231445312, "epoch": 4.867859203693018, "grad_norm": 0.9765625, "learning_rate": 0.0002885759735782568, "loss": 5.4427, "mean_token_accuracy": 0.2145748034119606, "num_tokens": 106923552.0, "step": 42180 }, { "entropy": 5.980557918548584, "epoch": 4.868436237738027, "grad_norm": 1.0390625, "learning_rate": 0.0002885347841810112, "loss": 5.3473, "mean_token_accuracy": 0.22816805094480513, "num_tokens": 106935452.0, "step": 42185 }, { "entropy": 6.046111965179444, "epoch": 4.869013271783035, "grad_norm": 0.96875, "learning_rate": 0.0002884935943285299, "loss": 5.4902, "mean_token_accuracy": 0.21253160685300826, "num_tokens": 106947460.0, "step": 42190 }, { "entropy": 6.020666694641113, "epoch": 4.869590305828044, "grad_norm": 0.984375, "learning_rate": 0.0002884524040221983, "loss": 5.4503, "mean_token_accuracy": 0.22385992258787155, "num_tokens": 106959219.0, "step": 42195 }, { "entropy": 6.055613994598389, "epoch": 4.870167339873053, "grad_norm": 1.015625, "learning_rate": 0.0002884112132634017, "loss": 5.5362, "mean_token_accuracy": 0.21146431863307952, "num_tokens": 106971208.0, "step": 42200 }, { "entropy": 6.0770158767700195, "epoch": 4.870744373918061, "grad_norm": 0.91015625, "learning_rate": 0.0002883700220535256, "loss": 5.5127, "mean_token_accuracy": 0.2192384496331215, "num_tokens": 106984729.0, "step": 42205 }, { "entropy": 6.076972627639771, "epoch": 4.87132140796307, "grad_norm": 0.93359375, "learning_rate": 0.00028832883039395544, "loss": 5.5113, "mean_token_accuracy": 0.21844467669725418, "num_tokens": 106997551.0, "step": 42210 }, { "entropy": 6.08613429069519, "epoch": 4.871898442008078, "grad_norm": 1.0703125, "learning_rate": 0.0002882876382860768, "loss": 5.539, "mean_token_accuracy": 0.2118827849626541, "num_tokens": 107010368.0, "step": 42215 }, { "entropy": 6.1925537109375, "epoch": 4.872475476053087, "grad_norm": 0.92578125, "learning_rate": 0.0002882464457312749, "loss": 5.5783, "mean_token_accuracy": 0.20799676179885865, "num_tokens": 107023217.0, "step": 42220 }, { "entropy": 6.08561520576477, "epoch": 4.873052510098096, "grad_norm": 0.96875, "learning_rate": 0.0002882052527309354, "loss": 5.548, "mean_token_accuracy": 0.21356784254312516, "num_tokens": 107037056.0, "step": 42225 }, { "entropy": 5.9867613315582275, "epoch": 4.873629544143104, "grad_norm": 1.015625, "learning_rate": 0.0002881640592864439, "loss": 5.4267, "mean_token_accuracy": 0.2184175208210945, "num_tokens": 107050454.0, "step": 42230 }, { "entropy": 6.033309507369995, "epoch": 4.874206578188113, "grad_norm": 0.9765625, "learning_rate": 0.0002881228653991857, "loss": 5.4266, "mean_token_accuracy": 0.22961031049489974, "num_tokens": 107062365.0, "step": 42235 }, { "entropy": 5.905626058578491, "epoch": 4.874783612233122, "grad_norm": 0.88671875, "learning_rate": 0.0002880816710705464, "loss": 5.3426, "mean_token_accuracy": 0.2287436991930008, "num_tokens": 107075173.0, "step": 42240 }, { "entropy": 6.067697954177857, "epoch": 4.87536064627813, "grad_norm": 1.0078125, "learning_rate": 0.0002880404763019117, "loss": 5.4985, "mean_token_accuracy": 0.21249936521053314, "num_tokens": 107086272.0, "step": 42245 }, { "entropy": 6.111725378036499, "epoch": 4.875937680323139, "grad_norm": 0.984375, "learning_rate": 0.00028799928109466707, "loss": 5.5503, "mean_token_accuracy": 0.21670805662870407, "num_tokens": 107098790.0, "step": 42250 }, { "entropy": 6.00868501663208, "epoch": 4.876514714368148, "grad_norm": 0.97265625, "learning_rate": 0.00028795808545019797, "loss": 5.449, "mean_token_accuracy": 0.21645189821720123, "num_tokens": 107110296.0, "step": 42255 }, { "entropy": 6.091307353973389, "epoch": 4.877091748413156, "grad_norm": 0.93359375, "learning_rate": 0.0002879168893698901, "loss": 5.5438, "mean_token_accuracy": 0.21070765554904938, "num_tokens": 107123888.0, "step": 42260 }, { "entropy": 6.08305721282959, "epoch": 4.877668782458165, "grad_norm": 0.91796875, "learning_rate": 0.0002878756928551292, "loss": 5.5659, "mean_token_accuracy": 0.21068717688322067, "num_tokens": 107137204.0, "step": 42265 }, { "entropy": 6.0707193374633786, "epoch": 4.878245816503174, "grad_norm": 0.890625, "learning_rate": 0.00028783449590730073, "loss": 5.4271, "mean_token_accuracy": 0.2317424550652504, "num_tokens": 107150466.0, "step": 42270 }, { "entropy": 6.033425903320312, "epoch": 4.8788228505481825, "grad_norm": 0.953125, "learning_rate": 0.0002877932985277903, "loss": 5.4922, "mean_token_accuracy": 0.2129114642739296, "num_tokens": 107162490.0, "step": 42275 }, { "entropy": 6.040828704833984, "epoch": 4.879399884593191, "grad_norm": 0.9453125, "learning_rate": 0.00028775210071798365, "loss": 5.5157, "mean_token_accuracy": 0.2181906819343567, "num_tokens": 107176562.0, "step": 42280 }, { "entropy": 6.044349002838135, "epoch": 4.879976918638199, "grad_norm": 0.9453125, "learning_rate": 0.00028771090247926644, "loss": 5.4775, "mean_token_accuracy": 0.2157879039645195, "num_tokens": 107189075.0, "step": 42285 }, { "entropy": 6.037503862380982, "epoch": 4.880553952683209, "grad_norm": 0.98828125, "learning_rate": 0.0002876697038130243, "loss": 5.459, "mean_token_accuracy": 0.22896388471126555, "num_tokens": 107201462.0, "step": 42290 }, { "entropy": 6.076305913925171, "epoch": 4.881130986728217, "grad_norm": 1.046875, "learning_rate": 0.0002876285047206431, "loss": 5.5356, "mean_token_accuracy": 0.2162700816988945, "num_tokens": 107214250.0, "step": 42295 }, { "entropy": 6.01119589805603, "epoch": 4.8817080207732255, "grad_norm": 0.9375, "learning_rate": 0.00028758730520350826, "loss": 5.4665, "mean_token_accuracy": 0.21472443789243698, "num_tokens": 107226680.0, "step": 42300 }, { "entropy": 6.094110774993896, "epoch": 4.882285054818234, "grad_norm": 1.078125, "learning_rate": 0.00028754610526300574, "loss": 5.5523, "mean_token_accuracy": 0.20786332637071608, "num_tokens": 107239245.0, "step": 42305 }, { "entropy": 6.06618185043335, "epoch": 4.882862088863243, "grad_norm": 0.953125, "learning_rate": 0.00028750490490052116, "loss": 5.4779, "mean_token_accuracy": 0.21719125360250474, "num_tokens": 107252004.0, "step": 42310 }, { "entropy": 5.980462598800659, "epoch": 4.883439122908252, "grad_norm": 1.046875, "learning_rate": 0.00028746370411744036, "loss": 5.498, "mean_token_accuracy": 0.21749580800533294, "num_tokens": 107264008.0, "step": 42315 }, { "entropy": 6.078024911880493, "epoch": 4.88401615695326, "grad_norm": 1.09375, "learning_rate": 0.000287422502915149, "loss": 5.5544, "mean_token_accuracy": 0.21611079424619675, "num_tokens": 107276119.0, "step": 42320 }, { "entropy": 6.115493535995483, "epoch": 4.8845931909982685, "grad_norm": 0.96484375, "learning_rate": 0.000287381301295033, "loss": 5.5364, "mean_token_accuracy": 0.21301726698875428, "num_tokens": 107288837.0, "step": 42325 }, { "entropy": 6.054299020767212, "epoch": 4.885170225043278, "grad_norm": 0.92578125, "learning_rate": 0.00028734009925847803, "loss": 5.4678, "mean_token_accuracy": 0.21994746029376983, "num_tokens": 107301831.0, "step": 42330 }, { "entropy": 6.094528770446777, "epoch": 4.885747259088286, "grad_norm": 0.98046875, "learning_rate": 0.00028729889680687, "loss": 5.5109, "mean_token_accuracy": 0.21619769483804702, "num_tokens": 107313680.0, "step": 42335 }, { "entropy": 6.124050188064575, "epoch": 4.886324293133295, "grad_norm": 0.9453125, "learning_rate": 0.0002872576939415947, "loss": 5.6108, "mean_token_accuracy": 0.20930839627981185, "num_tokens": 107326160.0, "step": 42340 }, { "entropy": 6.069322681427002, "epoch": 4.886901327178304, "grad_norm": 0.9609375, "learning_rate": 0.0002872164906640378, "loss": 5.5046, "mean_token_accuracy": 0.2140672102570534, "num_tokens": 107339479.0, "step": 42345 }, { "entropy": 6.110053443908692, "epoch": 4.887478361223312, "grad_norm": 1.015625, "learning_rate": 0.00028717528697558536, "loss": 5.6014, "mean_token_accuracy": 0.20572398751974105, "num_tokens": 107352327.0, "step": 42350 }, { "entropy": 6.1258350849151615, "epoch": 4.888055395268321, "grad_norm": 0.96484375, "learning_rate": 0.00028713408287762325, "loss": 5.5285, "mean_token_accuracy": 0.21264512538909913, "num_tokens": 107365232.0, "step": 42355 }, { "entropy": 5.916987323760987, "epoch": 4.888632429313329, "grad_norm": 0.96875, "learning_rate": 0.00028709287837153737, "loss": 5.3993, "mean_token_accuracy": 0.22558772414922715, "num_tokens": 107378632.0, "step": 42360 }, { "entropy": 6.063654899597168, "epoch": 4.8892094633583385, "grad_norm": 0.98046875, "learning_rate": 0.0002870516734587134, "loss": 5.5048, "mean_token_accuracy": 0.2170914277434349, "num_tokens": 107390729.0, "step": 42365 }, { "entropy": 6.103580665588379, "epoch": 4.889786497403347, "grad_norm": 0.90625, "learning_rate": 0.0002870104681405374, "loss": 5.5364, "mean_token_accuracy": 0.21508759111166, "num_tokens": 107402497.0, "step": 42370 }, { "entropy": 6.030554294586182, "epoch": 4.890363531448355, "grad_norm": 0.9375, "learning_rate": 0.0002869692624183953, "loss": 5.4201, "mean_token_accuracy": 0.22807493060827255, "num_tokens": 107416276.0, "step": 42375 }, { "entropy": 6.030253982543945, "epoch": 4.890940565493364, "grad_norm": 0.8984375, "learning_rate": 0.00028692805629367294, "loss": 5.4502, "mean_token_accuracy": 0.21923165321350097, "num_tokens": 107429806.0, "step": 42380 }, { "entropy": 6.042533731460571, "epoch": 4.891517599538373, "grad_norm": 1.0234375, "learning_rate": 0.00028688684976775646, "loss": 5.4597, "mean_token_accuracy": 0.21634673923254014, "num_tokens": 107441707.0, "step": 42385 }, { "entropy": 6.091143178939819, "epoch": 4.8920946335833815, "grad_norm": 0.93359375, "learning_rate": 0.0002868456428420316, "loss": 5.5421, "mean_token_accuracy": 0.21324512213468552, "num_tokens": 107455572.0, "step": 42390 }, { "entropy": 6.001121187210083, "epoch": 4.89267166762839, "grad_norm": 0.93359375, "learning_rate": 0.0002868044355178845, "loss": 5.4195, "mean_token_accuracy": 0.215337535738945, "num_tokens": 107468324.0, "step": 42395 }, { "entropy": 6.098383808135987, "epoch": 4.893248701673398, "grad_norm": 0.9765625, "learning_rate": 0.000286763227796701, "loss": 5.5066, "mean_token_accuracy": 0.21163651645183562, "num_tokens": 107479984.0, "step": 42400 }, { "entropy": 6.159455966949463, "epoch": 4.893825735718408, "grad_norm": 0.9609375, "learning_rate": 0.0002867220196798672, "loss": 5.5945, "mean_token_accuracy": 0.2068368449807167, "num_tokens": 107492374.0, "step": 42405 }, { "entropy": 6.081700134277344, "epoch": 4.894402769763416, "grad_norm": 0.94140625, "learning_rate": 0.000286680811168769, "loss": 5.579, "mean_token_accuracy": 0.20862532258033753, "num_tokens": 107504176.0, "step": 42410 }, { "entropy": 6.02947735786438, "epoch": 4.8949798038084245, "grad_norm": 1.0078125, "learning_rate": 0.00028663960226479266, "loss": 5.4765, "mean_token_accuracy": 0.2185306578874588, "num_tokens": 107515692.0, "step": 42415 }, { "entropy": 6.000588607788086, "epoch": 4.895556837853434, "grad_norm": 0.97265625, "learning_rate": 0.00028659839296932407, "loss": 5.4555, "mean_token_accuracy": 0.21624449789524078, "num_tokens": 107527802.0, "step": 42420 }, { "entropy": 6.088767051696777, "epoch": 4.896133871898442, "grad_norm": 0.953125, "learning_rate": 0.00028655718328374924, "loss": 5.5646, "mean_token_accuracy": 0.2129533752799034, "num_tokens": 107539496.0, "step": 42425 }, { "entropy": 6.032118463516236, "epoch": 4.896710905943451, "grad_norm": 1.0703125, "learning_rate": 0.00028651597320945426, "loss": 5.4675, "mean_token_accuracy": 0.21630681902170182, "num_tokens": 107551265.0, "step": 42430 }, { "entropy": 6.050626230239868, "epoch": 4.897287939988459, "grad_norm": 1.015625, "learning_rate": 0.0002864747627478253, "loss": 5.4763, "mean_token_accuracy": 0.21886650770902633, "num_tokens": 107562448.0, "step": 42435 }, { "entropy": 6.113722896575927, "epoch": 4.897864974033468, "grad_norm": 1.0078125, "learning_rate": 0.00028643355190024843, "loss": 5.5995, "mean_token_accuracy": 0.20752845257520675, "num_tokens": 107575386.0, "step": 42440 }, { "entropy": 6.135255479812622, "epoch": 4.898442008078477, "grad_norm": 1.03125, "learning_rate": 0.00028639234066810967, "loss": 5.5253, "mean_token_accuracy": 0.21387504786252975, "num_tokens": 107588569.0, "step": 42445 }, { "entropy": 6.001686763763428, "epoch": 4.899019042123485, "grad_norm": 1.0390625, "learning_rate": 0.00028635112905279515, "loss": 5.4387, "mean_token_accuracy": 0.21784890443086624, "num_tokens": 107602053.0, "step": 42450 }, { "entropy": 5.9554901123046875, "epoch": 4.899596076168494, "grad_norm": 0.95703125, "learning_rate": 0.0002863099170556911, "loss": 5.4166, "mean_token_accuracy": 0.21788729429244996, "num_tokens": 107614445.0, "step": 42455 }, { "entropy": 6.041926288604737, "epoch": 4.900173110213503, "grad_norm": 0.98828125, "learning_rate": 0.0002862687046781836, "loss": 5.483, "mean_token_accuracy": 0.21106954514980317, "num_tokens": 107628981.0, "step": 42460 }, { "entropy": 6.1609711170196535, "epoch": 4.900750144258511, "grad_norm": 0.94140625, "learning_rate": 0.0002862274919216588, "loss": 5.5463, "mean_token_accuracy": 0.20651800483465194, "num_tokens": 107641952.0, "step": 42465 }, { "entropy": 6.140533542633056, "epoch": 4.90132717830352, "grad_norm": 0.97265625, "learning_rate": 0.00028618627878750286, "loss": 5.566, "mean_token_accuracy": 0.20501160025596618, "num_tokens": 107652949.0, "step": 42470 }, { "entropy": 6.0371479988098145, "epoch": 4.901904212348528, "grad_norm": 0.9140625, "learning_rate": 0.00028614506527710205, "loss": 5.4885, "mean_token_accuracy": 0.21945639252662658, "num_tokens": 107665878.0, "step": 42475 }, { "entropy": 6.07598910331726, "epoch": 4.902481246393537, "grad_norm": 1.09375, "learning_rate": 0.00028610385139184245, "loss": 5.5248, "mean_token_accuracy": 0.20897335112094878, "num_tokens": 107678666.0, "step": 42480 }, { "entropy": 6.0083451747894285, "epoch": 4.903058280438546, "grad_norm": 0.953125, "learning_rate": 0.00028606263713311044, "loss": 5.4359, "mean_token_accuracy": 0.22138419449329377, "num_tokens": 107691259.0, "step": 42485 }, { "entropy": 6.014791488647461, "epoch": 4.903635314483554, "grad_norm": 0.98046875, "learning_rate": 0.0002860214225022919, "loss": 5.512, "mean_token_accuracy": 0.21296166628599167, "num_tokens": 107703848.0, "step": 42490 }, { "entropy": 6.062704277038574, "epoch": 4.904212348528564, "grad_norm": 1.015625, "learning_rate": 0.0002859802075007735, "loss": 5.5111, "mean_token_accuracy": 0.21279639154672622, "num_tokens": 107716770.0, "step": 42495 }, { "entropy": 6.024626636505127, "epoch": 4.904789382573572, "grad_norm": 0.9296875, "learning_rate": 0.0002859389921299412, "loss": 5.4977, "mean_token_accuracy": 0.21681968569755555, "num_tokens": 107730046.0, "step": 42500 }, { "entropy": 6.009398889541626, "epoch": 4.90536641661858, "grad_norm": 1.046875, "learning_rate": 0.00028589777639118134, "loss": 5.3802, "mean_token_accuracy": 0.22787190675735475, "num_tokens": 107742806.0, "step": 42505 }, { "entropy": 6.074196100234985, "epoch": 4.905943450663589, "grad_norm": 0.95703125, "learning_rate": 0.00028585656028588016, "loss": 5.5676, "mean_token_accuracy": 0.21569931656122207, "num_tokens": 107758001.0, "step": 42510 }, { "entropy": 6.077644395828247, "epoch": 4.906520484708598, "grad_norm": 1.0078125, "learning_rate": 0.000285815343815424, "loss": 5.4791, "mean_token_accuracy": 0.21419319212436677, "num_tokens": 107771008.0, "step": 42515 }, { "entropy": 6.026212453842163, "epoch": 4.907097518753607, "grad_norm": 0.95703125, "learning_rate": 0.0002857741269811991, "loss": 5.5135, "mean_token_accuracy": 0.2148035004734993, "num_tokens": 107784276.0, "step": 42520 }, { "entropy": 6.076160526275634, "epoch": 4.907674552798615, "grad_norm": 0.95703125, "learning_rate": 0.0002857329097845918, "loss": 5.5011, "mean_token_accuracy": 0.20898256748914718, "num_tokens": 107796555.0, "step": 42525 }, { "entropy": 6.092764568328858, "epoch": 4.908251586843623, "grad_norm": 0.89453125, "learning_rate": 0.0002856916922269884, "loss": 5.5552, "mean_token_accuracy": 0.2083060175180435, "num_tokens": 107811899.0, "step": 42530 }, { "entropy": 6.0735053539276125, "epoch": 4.908828620888633, "grad_norm": 0.98828125, "learning_rate": 0.00028565047430977524, "loss": 5.5252, "mean_token_accuracy": 0.21149604320526122, "num_tokens": 107824514.0, "step": 42535 }, { "entropy": 6.0582245826721195, "epoch": 4.909405654933641, "grad_norm": 0.96875, "learning_rate": 0.0002856092560343387, "loss": 5.4537, "mean_token_accuracy": 0.2141177847981453, "num_tokens": 107837523.0, "step": 42540 }, { "entropy": 6.008212518692017, "epoch": 4.9099826889786495, "grad_norm": 0.8828125, "learning_rate": 0.0002855680374020651, "loss": 5.4323, "mean_token_accuracy": 0.2156248614192009, "num_tokens": 107849033.0, "step": 42545 }, { "entropy": 6.048239517211914, "epoch": 4.910559723023658, "grad_norm": 1.0, "learning_rate": 0.00028552681841434083, "loss": 5.5069, "mean_token_accuracy": 0.21879953145980835, "num_tokens": 107860856.0, "step": 42550 }, { "entropy": 6.029404544830323, "epoch": 4.911136757068667, "grad_norm": 0.94140625, "learning_rate": 0.0002854855990725522, "loss": 5.4954, "mean_token_accuracy": 0.21359726041555405, "num_tokens": 107872802.0, "step": 42555 }, { "entropy": 6.089948749542236, "epoch": 4.911713791113676, "grad_norm": 0.953125, "learning_rate": 0.00028544437937808563, "loss": 5.5862, "mean_token_accuracy": 0.20500381290912628, "num_tokens": 107885882.0, "step": 42560 }, { "entropy": 6.095817565917969, "epoch": 4.912290825158684, "grad_norm": 0.95703125, "learning_rate": 0.0002854031593323276, "loss": 5.4565, "mean_token_accuracy": 0.21755782663822174, "num_tokens": 107897363.0, "step": 42565 }, { "entropy": 6.0812242984771725, "epoch": 4.912867859203693, "grad_norm": 0.94140625, "learning_rate": 0.00028536193893666446, "loss": 5.4826, "mean_token_accuracy": 0.2122122198343277, "num_tokens": 107910329.0, "step": 42570 }, { "entropy": 6.067883825302124, "epoch": 4.913444893248702, "grad_norm": 0.96875, "learning_rate": 0.0002853207181924827, "loss": 5.5474, "mean_token_accuracy": 0.20889407247304917, "num_tokens": 107922316.0, "step": 42575 }, { "entropy": 6.051030445098877, "epoch": 4.91402192729371, "grad_norm": 1.0546875, "learning_rate": 0.00028527949710116865, "loss": 5.4007, "mean_token_accuracy": 0.22093999087810517, "num_tokens": 107934005.0, "step": 42580 }, { "entropy": 6.043297147750854, "epoch": 4.914598961338719, "grad_norm": 0.953125, "learning_rate": 0.00028523827566410883, "loss": 5.4023, "mean_token_accuracy": 0.2306014209985733, "num_tokens": 107946981.0, "step": 42585 }, { "entropy": 5.920707130432129, "epoch": 4.915175995383728, "grad_norm": 0.98046875, "learning_rate": 0.0002851970538826897, "loss": 5.3459, "mean_token_accuracy": 0.2286318376660347, "num_tokens": 107959018.0, "step": 42590 }, { "entropy": 5.990842580795288, "epoch": 4.915753029428736, "grad_norm": 0.94921875, "learning_rate": 0.0002851558317582977, "loss": 5.4864, "mean_token_accuracy": 0.21997285038232803, "num_tokens": 107971495.0, "step": 42595 }, { "entropy": 6.134239387512207, "epoch": 4.916330063473745, "grad_norm": 0.94140625, "learning_rate": 0.00028511460929231934, "loss": 5.5897, "mean_token_accuracy": 0.20877509117126464, "num_tokens": 107984159.0, "step": 42600 }, { "entropy": 6.062919950485229, "epoch": 4.916907097518754, "grad_norm": 0.96484375, "learning_rate": 0.00028507338648614116, "loss": 5.4625, "mean_token_accuracy": 0.21399381309747695, "num_tokens": 107996661.0, "step": 42605 }, { "entropy": 6.043512678146362, "epoch": 4.9174841315637625, "grad_norm": 0.93359375, "learning_rate": 0.00028503216334114964, "loss": 5.4954, "mean_token_accuracy": 0.21791517734527588, "num_tokens": 108010054.0, "step": 42610 }, { "entropy": 6.085896015167236, "epoch": 4.918061165608771, "grad_norm": 1.0625, "learning_rate": 0.00028499093985873125, "loss": 5.5665, "mean_token_accuracy": 0.20890969783067703, "num_tokens": 108022667.0, "step": 42615 }, { "entropy": 5.995922994613648, "epoch": 4.918638199653779, "grad_norm": 1.0, "learning_rate": 0.0002849497160402726, "loss": 5.4307, "mean_token_accuracy": 0.22446546256542205, "num_tokens": 108034498.0, "step": 42620 }, { "entropy": 6.070241260528564, "epoch": 4.919215233698788, "grad_norm": 1.1015625, "learning_rate": 0.0002849084918871602, "loss": 5.5213, "mean_token_accuracy": 0.21241340041160583, "num_tokens": 108047678.0, "step": 42625 }, { "entropy": 6.091761493682862, "epoch": 4.919792267743797, "grad_norm": 0.98828125, "learning_rate": 0.0002848672674007805, "loss": 5.552, "mean_token_accuracy": 0.21082081496715546, "num_tokens": 108061072.0, "step": 42630 }, { "entropy": 6.126362943649292, "epoch": 4.9203693017888055, "grad_norm": 0.984375, "learning_rate": 0.00028482604258252026, "loss": 5.5749, "mean_token_accuracy": 0.21069298386573793, "num_tokens": 108073710.0, "step": 42635 }, { "entropy": 6.041939353942871, "epoch": 4.920946335833814, "grad_norm": 1.0078125, "learning_rate": 0.0002847848174337659, "loss": 5.454, "mean_token_accuracy": 0.22192743569612502, "num_tokens": 108086377.0, "step": 42640 }, { "entropy": 6.077037334442139, "epoch": 4.921523369878823, "grad_norm": 0.96484375, "learning_rate": 0.00028474359195590417, "loss": 5.4961, "mean_token_accuracy": 0.21405644416809083, "num_tokens": 108098181.0, "step": 42645 }, { "entropy": 6.02266674041748, "epoch": 4.922100403923832, "grad_norm": 0.83203125, "learning_rate": 0.0002847023661503214, "loss": 5.4658, "mean_token_accuracy": 0.2223532721400261, "num_tokens": 108111365.0, "step": 42650 }, { "entropy": 6.054823303222657, "epoch": 4.92267743796884, "grad_norm": 1.03125, "learning_rate": 0.0002846611400184045, "loss": 5.4981, "mean_token_accuracy": 0.21125366240739823, "num_tokens": 108123718.0, "step": 42655 }, { "entropy": 5.946111488342285, "epoch": 4.9232544720138485, "grad_norm": 0.9609375, "learning_rate": 0.0002846199135615399, "loss": 5.3657, "mean_token_accuracy": 0.2319044515490532, "num_tokens": 108136533.0, "step": 42660 }, { "entropy": 6.037826299667358, "epoch": 4.923831506058858, "grad_norm": 0.92578125, "learning_rate": 0.0002845786867811143, "loss": 5.4683, "mean_token_accuracy": 0.21365686357021332, "num_tokens": 108149340.0, "step": 42665 }, { "entropy": 5.891231966018677, "epoch": 4.924408540103866, "grad_norm": 0.8984375, "learning_rate": 0.00028453745967851435, "loss": 5.3095, "mean_token_accuracy": 0.23251685202121736, "num_tokens": 108163229.0, "step": 42670 }, { "entropy": 6.097901916503906, "epoch": 4.924985574148875, "grad_norm": 1.0234375, "learning_rate": 0.0002844962322551266, "loss": 5.549, "mean_token_accuracy": 0.2108125388622284, "num_tokens": 108175847.0, "step": 42675 }, { "entropy": 6.03236231803894, "epoch": 4.925562608193884, "grad_norm": 0.9453125, "learning_rate": 0.00028445500451233785, "loss": 5.5276, "mean_token_accuracy": 0.217990905046463, "num_tokens": 108189888.0, "step": 42680 }, { "entropy": 5.996472597122192, "epoch": 4.926139642238892, "grad_norm": 1.0078125, "learning_rate": 0.00028441377645153476, "loss": 5.4023, "mean_token_accuracy": 0.22852868884801864, "num_tokens": 108201555.0, "step": 42685 }, { "entropy": 5.986435270309448, "epoch": 4.926716676283901, "grad_norm": 1.0234375, "learning_rate": 0.0002843725480741039, "loss": 5.3497, "mean_token_accuracy": 0.2356192350387573, "num_tokens": 108214386.0, "step": 42690 }, { "entropy": 6.0332691192626955, "epoch": 4.927293710328909, "grad_norm": 1.03125, "learning_rate": 0.000284331319381432, "loss": 5.4503, "mean_token_accuracy": 0.2227146580815315, "num_tokens": 108227359.0, "step": 42695 }, { "entropy": 6.008638000488281, "epoch": 4.927870744373918, "grad_norm": 1.0, "learning_rate": 0.000284290090374906, "loss": 5.4864, "mean_token_accuracy": 0.2140437811613083, "num_tokens": 108239407.0, "step": 42700 }, { "entropy": 6.025502490997314, "epoch": 4.928447778418927, "grad_norm": 0.96484375, "learning_rate": 0.00028424886105591225, "loss": 5.4031, "mean_token_accuracy": 0.22531924545764923, "num_tokens": 108252372.0, "step": 42705 }, { "entropy": 6.013317394256592, "epoch": 4.929024812463935, "grad_norm": 1.0703125, "learning_rate": 0.0002842076314258377, "loss": 5.4331, "mean_token_accuracy": 0.22245500832796097, "num_tokens": 108263791.0, "step": 42710 }, { "entropy": 6.021922779083252, "epoch": 4.929601846508944, "grad_norm": 1.0546875, "learning_rate": 0.00028416640148606903, "loss": 5.4973, "mean_token_accuracy": 0.21262186020612717, "num_tokens": 108276897.0, "step": 42715 }, { "entropy": 5.952204942703247, "epoch": 4.930178880553953, "grad_norm": 0.94921875, "learning_rate": 0.00028412517123799306, "loss": 5.4224, "mean_token_accuracy": 0.21960787028074263, "num_tokens": 108290577.0, "step": 42720 }, { "entropy": 5.980778169631958, "epoch": 4.9307559145989615, "grad_norm": 0.94921875, "learning_rate": 0.0002840839406829965, "loss": 5.3573, "mean_token_accuracy": 0.22540011405944824, "num_tokens": 108303426.0, "step": 42725 }, { "entropy": 6.144718885421753, "epoch": 4.93133294864397, "grad_norm": 1.0390625, "learning_rate": 0.000284042709822466, "loss": 5.5896, "mean_token_accuracy": 0.19863436967134476, "num_tokens": 108315736.0, "step": 42730 }, { "entropy": 6.060486268997193, "epoch": 4.931909982688978, "grad_norm": 0.96484375, "learning_rate": 0.0002840014786577885, "loss": 5.4504, "mean_token_accuracy": 0.2206668183207512, "num_tokens": 108329150.0, "step": 42735 }, { "entropy": 6.104358339309693, "epoch": 4.932487016733988, "grad_norm": 0.9453125, "learning_rate": 0.00028396024719035075, "loss": 5.5301, "mean_token_accuracy": 0.20877788215875626, "num_tokens": 108341334.0, "step": 42740 }, { "entropy": 6.003159046173096, "epoch": 4.933064050778996, "grad_norm": 1.0078125, "learning_rate": 0.0002839190154215395, "loss": 5.4754, "mean_token_accuracy": 0.21796131879091263, "num_tokens": 108353039.0, "step": 42745 }, { "entropy": 6.089808797836303, "epoch": 4.933641084824004, "grad_norm": 0.890625, "learning_rate": 0.0002838777833527416, "loss": 5.5257, "mean_token_accuracy": 0.21428242921829224, "num_tokens": 108366293.0, "step": 42750 }, { "entropy": 6.1134514808654785, "epoch": 4.934218118869014, "grad_norm": 0.99609375, "learning_rate": 0.0002838365509853439, "loss": 5.5635, "mean_token_accuracy": 0.21114464700222016, "num_tokens": 108378857.0, "step": 42755 }, { "entropy": 5.956152105331421, "epoch": 4.934795152914022, "grad_norm": 1.015625, "learning_rate": 0.0002837953183207332, "loss": 5.4261, "mean_token_accuracy": 0.222879259288311, "num_tokens": 108391113.0, "step": 42760 }, { "entropy": 6.114244365692139, "epoch": 4.935372186959031, "grad_norm": 0.91015625, "learning_rate": 0.0002837540853602963, "loss": 5.4697, "mean_token_accuracy": 0.2117037668824196, "num_tokens": 108404304.0, "step": 42765 }, { "entropy": 5.991312551498413, "epoch": 4.935949221004039, "grad_norm": 1.0390625, "learning_rate": 0.00028371285210542006, "loss": 5.3663, "mean_token_accuracy": 0.22580697536468505, "num_tokens": 108415973.0, "step": 42770 }, { "entropy": 5.948039293289185, "epoch": 4.936526255049047, "grad_norm": 1.0234375, "learning_rate": 0.0002836716185574915, "loss": 5.4508, "mean_token_accuracy": 0.21183349639177323, "num_tokens": 108428668.0, "step": 42775 }, { "entropy": 6.064259481430054, "epoch": 4.937103289094057, "grad_norm": 0.9765625, "learning_rate": 0.00028363038471789724, "loss": 5.5303, "mean_token_accuracy": 0.2114143803715706, "num_tokens": 108441722.0, "step": 42780 }, { "entropy": 6.030072116851807, "epoch": 4.937680323139065, "grad_norm": 1.0625, "learning_rate": 0.0002835891505880243, "loss": 5.459, "mean_token_accuracy": 0.22549148201942443, "num_tokens": 108454157.0, "step": 42785 }, { "entropy": 6.032482719421386, "epoch": 4.9382573571840735, "grad_norm": 0.87109375, "learning_rate": 0.00028354791616925964, "loss": 5.436, "mean_token_accuracy": 0.22359249591827393, "num_tokens": 108467028.0, "step": 42790 }, { "entropy": 5.9496900081634525, "epoch": 4.938834391229083, "grad_norm": 1.1328125, "learning_rate": 0.0002835066814629899, "loss": 5.404, "mean_token_accuracy": 0.22584114223718643, "num_tokens": 108479460.0, "step": 42795 }, { "entropy": 5.9788023948669435, "epoch": 4.939411425274091, "grad_norm": 0.9609375, "learning_rate": 0.0002834654464706023, "loss": 5.437, "mean_token_accuracy": 0.22376679480075837, "num_tokens": 108491698.0, "step": 42800 }, { "entropy": 6.008862018585205, "epoch": 4.9399884593191, "grad_norm": 1.0, "learning_rate": 0.0002834242111934835, "loss": 5.388, "mean_token_accuracy": 0.22189870476722717, "num_tokens": 108503191.0, "step": 42805 }, { "entropy": 6.1356651306152346, "epoch": 4.940565493364108, "grad_norm": 0.98828125, "learning_rate": 0.00028338297563302054, "loss": 5.5563, "mean_token_accuracy": 0.20657484531402587, "num_tokens": 108516269.0, "step": 42810 }, { "entropy": 6.085603809356689, "epoch": 4.941142527409117, "grad_norm": 0.96875, "learning_rate": 0.00028334173979060047, "loss": 5.5043, "mean_token_accuracy": 0.222974793612957, "num_tokens": 108529880.0, "step": 42815 }, { "entropy": 6.02394061088562, "epoch": 4.941719561454126, "grad_norm": 0.9765625, "learning_rate": 0.0002833005036676101, "loss": 5.4745, "mean_token_accuracy": 0.2152271181344986, "num_tokens": 108542063.0, "step": 42820 }, { "entropy": 6.01603946685791, "epoch": 4.942296595499134, "grad_norm": 1.0234375, "learning_rate": 0.00028325926726543635, "loss": 5.4658, "mean_token_accuracy": 0.223656365275383, "num_tokens": 108554654.0, "step": 42825 }, { "entropy": 5.984672260284424, "epoch": 4.9428736295441436, "grad_norm": 0.92578125, "learning_rate": 0.0002832180305854663, "loss": 5.4662, "mean_token_accuracy": 0.2179507076740265, "num_tokens": 108567375.0, "step": 42830 }, { "entropy": 6.03062219619751, "epoch": 4.943450663589152, "grad_norm": 1.1484375, "learning_rate": 0.0002831767936290869, "loss": 5.4641, "mean_token_accuracy": 0.2168751984834671, "num_tokens": 108580721.0, "step": 42835 }, { "entropy": 6.084998703002929, "epoch": 4.94402769763416, "grad_norm": 0.94921875, "learning_rate": 0.00028313555639768504, "loss": 5.5261, "mean_token_accuracy": 0.21340830624103546, "num_tokens": 108594106.0, "step": 42840 }, { "entropy": 5.9906532764434814, "epoch": 4.944604731679169, "grad_norm": 1.015625, "learning_rate": 0.0002830943188926477, "loss": 5.4681, "mean_token_accuracy": 0.21862661093473434, "num_tokens": 108605373.0, "step": 42845 }, { "entropy": 5.989369010925293, "epoch": 4.945181765724178, "grad_norm": 1.015625, "learning_rate": 0.00028305308111536216, "loss": 5.441, "mean_token_accuracy": 0.2241882011294365, "num_tokens": 108618208.0, "step": 42850 }, { "entropy": 6.142806434631348, "epoch": 4.9457587997691865, "grad_norm": 0.98046875, "learning_rate": 0.0002830118430672151, "loss": 5.6231, "mean_token_accuracy": 0.21054959148168564, "num_tokens": 108631260.0, "step": 42855 }, { "entropy": 6.096552181243896, "epoch": 4.946335833814195, "grad_norm": 1.0390625, "learning_rate": 0.00028297060474959373, "loss": 5.5498, "mean_token_accuracy": 0.20989176630973816, "num_tokens": 108644577.0, "step": 42860 }, { "entropy": 6.04664978981018, "epoch": 4.946912867859203, "grad_norm": 1.109375, "learning_rate": 0.00028292936616388503, "loss": 5.5143, "mean_token_accuracy": 0.2106948733329773, "num_tokens": 108656239.0, "step": 42865 }, { "entropy": 6.0369397640228275, "epoch": 4.947489901904213, "grad_norm": 0.93359375, "learning_rate": 0.000282888127311476, "loss": 5.4179, "mean_token_accuracy": 0.22064224183559417, "num_tokens": 108668562.0, "step": 42870 }, { "entropy": 5.892840051651001, "epoch": 4.948066935949221, "grad_norm": 1.0390625, "learning_rate": 0.00028284688819375374, "loss": 5.2901, "mean_token_accuracy": 0.23528130054473878, "num_tokens": 108680186.0, "step": 42875 }, { "entropy": 5.976221227645874, "epoch": 4.9486439699942295, "grad_norm": 0.9609375, "learning_rate": 0.00028280564881210535, "loss": 5.4734, "mean_token_accuracy": 0.2145787388086319, "num_tokens": 108692444.0, "step": 42880 }, { "entropy": 6.023977613449096, "epoch": 4.949221004039238, "grad_norm": 1.140625, "learning_rate": 0.0002827644091679178, "loss": 5.4631, "mean_token_accuracy": 0.2159357711672783, "num_tokens": 108704972.0, "step": 42885 }, { "entropy": 5.972660732269287, "epoch": 4.949798038084247, "grad_norm": 0.984375, "learning_rate": 0.00028272316926257815, "loss": 5.3349, "mean_token_accuracy": 0.23300850242376328, "num_tokens": 108718735.0, "step": 42890 }, { "entropy": 6.079352760314942, "epoch": 4.950375072129256, "grad_norm": 0.9296875, "learning_rate": 0.00028268192909747367, "loss": 5.5774, "mean_token_accuracy": 0.21249482333660125, "num_tokens": 108732119.0, "step": 42895 }, { "entropy": 6.102401876449585, "epoch": 4.950952106174264, "grad_norm": 1.0078125, "learning_rate": 0.00028264068867399117, "loss": 5.5164, "mean_token_accuracy": 0.21498086750507356, "num_tokens": 108743445.0, "step": 42900 }, { "entropy": 6.060680246353149, "epoch": 4.951529140219273, "grad_norm": 0.921875, "learning_rate": 0.00028259944799351796, "loss": 5.4436, "mean_token_accuracy": 0.22306081652641296, "num_tokens": 108756566.0, "step": 42905 }, { "entropy": 6.000123119354248, "epoch": 4.952106174264282, "grad_norm": 1.03125, "learning_rate": 0.0002825582070574411, "loss": 5.4621, "mean_token_accuracy": 0.21929712891578673, "num_tokens": 108768382.0, "step": 42910 }, { "entropy": 5.923867130279541, "epoch": 4.95268320830929, "grad_norm": 0.98828125, "learning_rate": 0.0002825169658671477, "loss": 5.3787, "mean_token_accuracy": 0.229587422311306, "num_tokens": 108780905.0, "step": 42915 }, { "entropy": 6.134624481201172, "epoch": 4.953260242354299, "grad_norm": 0.95703125, "learning_rate": 0.0002824757244240249, "loss": 5.6432, "mean_token_accuracy": 0.2025127574801445, "num_tokens": 108794029.0, "step": 42920 }, { "entropy": 6.021833848953247, "epoch": 4.953837276399308, "grad_norm": 3.28125, "learning_rate": 0.0002824344827294599, "loss": 5.4937, "mean_token_accuracy": 0.22164767533540725, "num_tokens": 108805936.0, "step": 42925 }, { "entropy": 6.116102600097657, "epoch": 4.954414310444316, "grad_norm": 1.0078125, "learning_rate": 0.0002823932407848396, "loss": 5.5467, "mean_token_accuracy": 0.20866008400917052, "num_tokens": 108818259.0, "step": 42930 }, { "entropy": 6.096166610717773, "epoch": 4.954991344489325, "grad_norm": 0.9453125, "learning_rate": 0.00028235199859155143, "loss": 5.5349, "mean_token_accuracy": 0.2173505961894989, "num_tokens": 108830449.0, "step": 42935 }, { "entropy": 6.04797329902649, "epoch": 4.955568378534333, "grad_norm": 0.9765625, "learning_rate": 0.0002823107561509824, "loss": 5.4565, "mean_token_accuracy": 0.22156455367803574, "num_tokens": 108843586.0, "step": 42940 }, { "entropy": 6.0117346286773685, "epoch": 4.9561454125793425, "grad_norm": 1.078125, "learning_rate": 0.00028226951346451974, "loss": 5.4601, "mean_token_accuracy": 0.22760563492774963, "num_tokens": 108856190.0, "step": 42945 }, { "entropy": 6.040597820281983, "epoch": 4.956722446624351, "grad_norm": 1.1015625, "learning_rate": 0.0002822282705335505, "loss": 5.6003, "mean_token_accuracy": 0.2147225633263588, "num_tokens": 108869677.0, "step": 42950 }, { "entropy": 6.011884307861328, "epoch": 4.957299480669359, "grad_norm": 1.0078125, "learning_rate": 0.00028218702735946207, "loss": 5.3966, "mean_token_accuracy": 0.22292168587446212, "num_tokens": 108882953.0, "step": 42955 }, { "entropy": 6.014325761795044, "epoch": 4.957876514714368, "grad_norm": 1.0078125, "learning_rate": 0.00028214578394364153, "loss": 5.4345, "mean_token_accuracy": 0.22130564898252486, "num_tokens": 108896471.0, "step": 42960 }, { "entropy": 6.01017689704895, "epoch": 4.958453548759377, "grad_norm": 0.96875, "learning_rate": 0.0002821045402874762, "loss": 5.3785, "mean_token_accuracy": 0.22776084244251252, "num_tokens": 108909922.0, "step": 42965 }, { "entropy": 6.095320177078247, "epoch": 4.9590305828043855, "grad_norm": 0.94921875, "learning_rate": 0.00028206329639235303, "loss": 5.5167, "mean_token_accuracy": 0.21930584758520127, "num_tokens": 108922972.0, "step": 42970 }, { "entropy": 6.008806943893433, "epoch": 4.959607616849394, "grad_norm": 1.0, "learning_rate": 0.00028202205225965943, "loss": 5.4834, "mean_token_accuracy": 0.22035084366798402, "num_tokens": 108934523.0, "step": 42975 }, { "entropy": 6.064395523071289, "epoch": 4.960184650894403, "grad_norm": 1.0625, "learning_rate": 0.0002819808078907827, "loss": 5.4931, "mean_token_accuracy": 0.21269882917404176, "num_tokens": 108947148.0, "step": 42980 }, { "entropy": 5.988593244552613, "epoch": 4.960761684939412, "grad_norm": 0.921875, "learning_rate": 0.0002819395632871098, "loss": 5.4012, "mean_token_accuracy": 0.2195812940597534, "num_tokens": 108960236.0, "step": 42985 }, { "entropy": 6.007198333740234, "epoch": 4.96133871898442, "grad_norm": 0.9609375, "learning_rate": 0.00028189831845002816, "loss": 5.4779, "mean_token_accuracy": 0.22291641533374787, "num_tokens": 108974464.0, "step": 42990 }, { "entropy": 6.01093864440918, "epoch": 4.9619157530294284, "grad_norm": 0.984375, "learning_rate": 0.0002818570733809251, "loss": 5.4372, "mean_token_accuracy": 0.22423449605703355, "num_tokens": 108988986.0, "step": 42995 }, { "entropy": 5.990017652511597, "epoch": 4.962492787074438, "grad_norm": 0.93359375, "learning_rate": 0.00028181582808118775, "loss": 5.4336, "mean_token_accuracy": 0.22402408570051194, "num_tokens": 109002899.0, "step": 43000 }, { "entropy": 6.000071907043457, "epoch": 4.963069821119446, "grad_norm": 0.93359375, "learning_rate": 0.0002817745825522034, "loss": 5.3667, "mean_token_accuracy": 0.23070352673530578, "num_tokens": 109015312.0, "step": 43005 }, { "entropy": 6.1429602146148685, "epoch": 4.963646855164455, "grad_norm": 0.984375, "learning_rate": 0.0002817333367953593, "loss": 5.5415, "mean_token_accuracy": 0.21176917403936385, "num_tokens": 109027569.0, "step": 43010 }, { "entropy": 6.108979845046997, "epoch": 4.964223889209463, "grad_norm": 1.03125, "learning_rate": 0.00028169209081204283, "loss": 5.5457, "mean_token_accuracy": 0.20894451737403869, "num_tokens": 109039718.0, "step": 43015 }, { "entropy": 6.055894899368286, "epoch": 4.964800923254472, "grad_norm": 0.98046875, "learning_rate": 0.0002816508446036412, "loss": 5.4795, "mean_token_accuracy": 0.21691870242357253, "num_tokens": 109051525.0, "step": 43020 }, { "entropy": 6.05994143486023, "epoch": 4.965377957299481, "grad_norm": 0.98828125, "learning_rate": 0.0002816095981715417, "loss": 5.4981, "mean_token_accuracy": 0.22089499235153198, "num_tokens": 109063865.0, "step": 43025 }, { "entropy": 6.045294380187988, "epoch": 4.965954991344489, "grad_norm": 1.0, "learning_rate": 0.00028156835151713154, "loss": 5.511, "mean_token_accuracy": 0.21797371059656143, "num_tokens": 109075768.0, "step": 43030 }, { "entropy": 6.0039207458496096, "epoch": 4.966532025389498, "grad_norm": 0.9609375, "learning_rate": 0.00028152710464179827, "loss": 5.4396, "mean_token_accuracy": 0.22051458954811096, "num_tokens": 109088417.0, "step": 43035 }, { "entropy": 6.089677095413208, "epoch": 4.967109059434507, "grad_norm": 1.078125, "learning_rate": 0.0002814858575469291, "loss": 5.5869, "mean_token_accuracy": 0.2123097538948059, "num_tokens": 109100170.0, "step": 43040 }, { "entropy": 6.0384680271148685, "epoch": 4.967686093479515, "grad_norm": 0.96484375, "learning_rate": 0.00028144461023391125, "loss": 5.434, "mean_token_accuracy": 0.22179457694292068, "num_tokens": 109112680.0, "step": 43045 }, { "entropy": 6.027723884582519, "epoch": 4.968263127524524, "grad_norm": 1.0, "learning_rate": 0.00028140336270413214, "loss": 5.4376, "mean_token_accuracy": 0.22216033339500427, "num_tokens": 109125169.0, "step": 43050 }, { "entropy": 6.083027029037476, "epoch": 4.968840161569533, "grad_norm": 1.0546875, "learning_rate": 0.00028136211495897914, "loss": 5.5017, "mean_token_accuracy": 0.21493292301893235, "num_tokens": 109137049.0, "step": 43055 }, { "entropy": 6.128494739532471, "epoch": 4.969417195614541, "grad_norm": 1.015625, "learning_rate": 0.00028132086699983954, "loss": 5.5474, "mean_token_accuracy": 0.21425151973962783, "num_tokens": 109149005.0, "step": 43060 }, { "entropy": 6.004573059082031, "epoch": 4.96999422965955, "grad_norm": 0.92578125, "learning_rate": 0.00028127961882810074, "loss": 5.4998, "mean_token_accuracy": 0.21845198571681976, "num_tokens": 109162628.0, "step": 43065 }, { "entropy": 6.028212213516236, "epoch": 4.970571263704558, "grad_norm": 0.99609375, "learning_rate": 0.00028123837044515, "loss": 5.5116, "mean_token_accuracy": 0.21566485464572907, "num_tokens": 109175105.0, "step": 43070 }, { "entropy": 6.056178283691406, "epoch": 4.971148297749568, "grad_norm": 1.0390625, "learning_rate": 0.0002811971218523749, "loss": 5.4763, "mean_token_accuracy": 0.22011447995901107, "num_tokens": 109187387.0, "step": 43075 }, { "entropy": 6.075297784805298, "epoch": 4.971725331794576, "grad_norm": 0.96484375, "learning_rate": 0.0002811558730511626, "loss": 5.5008, "mean_token_accuracy": 0.2134289026260376, "num_tokens": 109198705.0, "step": 43080 }, { "entropy": 6.108932161331177, "epoch": 4.972302365839584, "grad_norm": 0.90234375, "learning_rate": 0.00028111462404290064, "loss": 5.5391, "mean_token_accuracy": 0.21483826339244844, "num_tokens": 109212001.0, "step": 43085 }, { "entropy": 6.006114387512207, "epoch": 4.972879399884593, "grad_norm": 0.96484375, "learning_rate": 0.0002810733748289762, "loss": 5.4496, "mean_token_accuracy": 0.22773292660713196, "num_tokens": 109223733.0, "step": 43090 }, { "entropy": 6.04915771484375, "epoch": 4.973456433929602, "grad_norm": 0.953125, "learning_rate": 0.000281032125410777, "loss": 5.4692, "mean_token_accuracy": 0.21967923939228057, "num_tokens": 109236055.0, "step": 43095 }, { "entropy": 6.019994020462036, "epoch": 4.9740334679746105, "grad_norm": 1.015625, "learning_rate": 0.0002809908757896901, "loss": 5.4873, "mean_token_accuracy": 0.2136274680495262, "num_tokens": 109247662.0, "step": 43100 }, { "entropy": 6.084213733673096, "epoch": 4.974610502019619, "grad_norm": 1.0, "learning_rate": 0.00028094962596710314, "loss": 5.5586, "mean_token_accuracy": 0.21334403455257417, "num_tokens": 109259932.0, "step": 43105 }, { "entropy": 6.086196756362915, "epoch": 4.975187536064627, "grad_norm": 1.0234375, "learning_rate": 0.0002809083759444035, "loss": 5.5243, "mean_token_accuracy": 0.21859664022922515, "num_tokens": 109273122.0, "step": 43110 }, { "entropy": 6.07145586013794, "epoch": 4.975764570109637, "grad_norm": 1.0, "learning_rate": 0.0002808671257229785, "loss": 5.5414, "mean_token_accuracy": 0.2049272373318672, "num_tokens": 109285600.0, "step": 43115 }, { "entropy": 6.0434510707855225, "epoch": 4.976341604154645, "grad_norm": 0.98046875, "learning_rate": 0.0002808258753042157, "loss": 5.4547, "mean_token_accuracy": 0.2106258124113083, "num_tokens": 109297820.0, "step": 43120 }, { "entropy": 6.080720090866089, "epoch": 4.9769186381996535, "grad_norm": 0.9609375, "learning_rate": 0.0002807846246895024, "loss": 5.5158, "mean_token_accuracy": 0.21140980273485183, "num_tokens": 109309313.0, "step": 43125 }, { "entropy": 6.0035765171051025, "epoch": 4.977495672244663, "grad_norm": 0.953125, "learning_rate": 0.00028074337388022617, "loss": 5.4669, "mean_token_accuracy": 0.22074911445379258, "num_tokens": 109321987.0, "step": 43130 }, { "entropy": 6.025129985809326, "epoch": 4.978072706289671, "grad_norm": 0.99609375, "learning_rate": 0.0002807021228777744, "loss": 5.4636, "mean_token_accuracy": 0.21835483461618424, "num_tokens": 109333911.0, "step": 43135 }, { "entropy": 6.079827880859375, "epoch": 4.97864974033468, "grad_norm": 0.95703125, "learning_rate": 0.0002806608716835346, "loss": 5.5737, "mean_token_accuracy": 0.2068240001797676, "num_tokens": 109346755.0, "step": 43140 }, { "entropy": 6.012156867980957, "epoch": 4.979226774379688, "grad_norm": 0.9609375, "learning_rate": 0.00028061962029889414, "loss": 5.4835, "mean_token_accuracy": 0.21426208466291427, "num_tokens": 109360584.0, "step": 43145 }, { "entropy": 6.022485733032227, "epoch": 4.979803808424697, "grad_norm": 0.96875, "learning_rate": 0.0002805783687252405, "loss": 5.4609, "mean_token_accuracy": 0.21524961292743683, "num_tokens": 109372165.0, "step": 43150 }, { "entropy": 6.079935550689697, "epoch": 4.980380842469706, "grad_norm": 0.96875, "learning_rate": 0.00028053711696396133, "loss": 5.478, "mean_token_accuracy": 0.2228081315755844, "num_tokens": 109384653.0, "step": 43155 }, { "entropy": 5.981617975234985, "epoch": 4.980957876514714, "grad_norm": 0.9921875, "learning_rate": 0.00028049586501644385, "loss": 5.4568, "mean_token_accuracy": 0.22147443294525146, "num_tokens": 109397203.0, "step": 43160 }, { "entropy": 6.013154315948486, "epoch": 4.981534910559723, "grad_norm": 0.9921875, "learning_rate": 0.00028045461288407576, "loss": 5.4935, "mean_token_accuracy": 0.21586854606866837, "num_tokens": 109410059.0, "step": 43165 }, { "entropy": 6.0732649803161625, "epoch": 4.982111944604732, "grad_norm": 0.95703125, "learning_rate": 0.00028041336056824445, "loss": 5.5211, "mean_token_accuracy": 0.21231584399938583, "num_tokens": 109423509.0, "step": 43170 }, { "entropy": 6.084903860092163, "epoch": 4.98268897864974, "grad_norm": 0.94921875, "learning_rate": 0.00028037210807033754, "loss": 5.5499, "mean_token_accuracy": 0.21949520707130432, "num_tokens": 109436885.0, "step": 43175 }, { "entropy": 6.051956510543823, "epoch": 4.983266012694749, "grad_norm": 0.93359375, "learning_rate": 0.00028033085539174227, "loss": 5.4899, "mean_token_accuracy": 0.21759622544050217, "num_tokens": 109450583.0, "step": 43180 }, { "entropy": 6.083387994766236, "epoch": 4.983843046739757, "grad_norm": 0.98828125, "learning_rate": 0.0002802896025338464, "loss": 5.5652, "mean_token_accuracy": 0.21513134241104126, "num_tokens": 109462769.0, "step": 43185 }, { "entropy": 6.070533704757691, "epoch": 4.9844200807847665, "grad_norm": 1.015625, "learning_rate": 0.0002802483494980375, "loss": 5.5389, "mean_token_accuracy": 0.21402060985565186, "num_tokens": 109475565.0, "step": 43190 }, { "entropy": 6.102189350128174, "epoch": 4.984997114829775, "grad_norm": 0.984375, "learning_rate": 0.0002802070962857028, "loss": 5.505, "mean_token_accuracy": 0.21299435645341874, "num_tokens": 109488102.0, "step": 43195 }, { "entropy": 6.13311505317688, "epoch": 4.985574148874783, "grad_norm": 0.94921875, "learning_rate": 0.00028016584289823, "loss": 5.5641, "mean_token_accuracy": 0.21746873259544372, "num_tokens": 109500656.0, "step": 43200 }, { "entropy": 6.082438278198242, "epoch": 4.986151182919793, "grad_norm": 0.92578125, "learning_rate": 0.00028012458933700674, "loss": 5.4965, "mean_token_accuracy": 0.2175798863172531, "num_tokens": 109514305.0, "step": 43205 }, { "entropy": 6.057926034927368, "epoch": 4.986728216964801, "grad_norm": 0.99609375, "learning_rate": 0.0002800833356034204, "loss": 5.5214, "mean_token_accuracy": 0.21364598125219345, "num_tokens": 109526506.0, "step": 43210 }, { "entropy": 6.049296712875366, "epoch": 4.9873052510098095, "grad_norm": 0.91796875, "learning_rate": 0.0002800420816988587, "loss": 5.4578, "mean_token_accuracy": 0.2186858057975769, "num_tokens": 109539256.0, "step": 43215 }, { "entropy": 6.113685178756714, "epoch": 4.987882285054818, "grad_norm": 1.0078125, "learning_rate": 0.000280000827624709, "loss": 5.5207, "mean_token_accuracy": 0.21198918521404267, "num_tokens": 109550667.0, "step": 43220 }, { "entropy": 6.017138242721558, "epoch": 4.988459319099827, "grad_norm": 0.99609375, "learning_rate": 0.00027995957338235893, "loss": 5.4269, "mean_token_accuracy": 0.2152409479022026, "num_tokens": 109563739.0, "step": 43225 }, { "entropy": 6.085301399230957, "epoch": 4.989036353144836, "grad_norm": 1.0625, "learning_rate": 0.00027991831897319615, "loss": 5.5452, "mean_token_accuracy": 0.21240639090538024, "num_tokens": 109575417.0, "step": 43230 }, { "entropy": 6.048946905136108, "epoch": 4.989613387189844, "grad_norm": 1.0390625, "learning_rate": 0.0002798770643986081, "loss": 5.4895, "mean_token_accuracy": 0.2093876227736473, "num_tokens": 109588770.0, "step": 43235 }, { "entropy": 6.095553636550903, "epoch": 4.990190421234853, "grad_norm": 1.0390625, "learning_rate": 0.0002798358096599824, "loss": 5.5944, "mean_token_accuracy": 0.21540394723415374, "num_tokens": 109600760.0, "step": 43240 }, { "entropy": 6.009504175186157, "epoch": 4.990767455279862, "grad_norm": 0.97265625, "learning_rate": 0.0002797945547587066, "loss": 5.4494, "mean_token_accuracy": 0.21644032150506973, "num_tokens": 109613731.0, "step": 43245 }, { "entropy": 6.057441568374633, "epoch": 4.99134448932487, "grad_norm": 1.03125, "learning_rate": 0.0002797532996961684, "loss": 5.4726, "mean_token_accuracy": 0.2163127601146698, "num_tokens": 109626051.0, "step": 43250 }, { "entropy": 6.102918529510498, "epoch": 4.991921523369879, "grad_norm": 1.0234375, "learning_rate": 0.0002797120444737553, "loss": 5.5338, "mean_token_accuracy": 0.21369542926549911, "num_tokens": 109638095.0, "step": 43255 }, { "entropy": 6.021718120574951, "epoch": 4.992498557414887, "grad_norm": 0.9921875, "learning_rate": 0.00027967078909285495, "loss": 5.53, "mean_token_accuracy": 0.21121876537799836, "num_tokens": 109650330.0, "step": 43260 }, { "entropy": 6.084610033035278, "epoch": 4.993075591459896, "grad_norm": 0.89453125, "learning_rate": 0.0002796295335548549, "loss": 5.4748, "mean_token_accuracy": 0.2149845376610756, "num_tokens": 109663537.0, "step": 43265 }, { "entropy": 6.093011045455933, "epoch": 4.993652625504905, "grad_norm": 0.9375, "learning_rate": 0.00027958827786114283, "loss": 5.4804, "mean_token_accuracy": 0.2195744812488556, "num_tokens": 109675382.0, "step": 43270 }, { "entropy": 6.0562254905700685, "epoch": 4.994229659549913, "grad_norm": 0.94140625, "learning_rate": 0.00027954702201310634, "loss": 5.5745, "mean_token_accuracy": 0.21120424717664718, "num_tokens": 109688649.0, "step": 43275 }, { "entropy": 6.116166400909424, "epoch": 4.9948066935949225, "grad_norm": 0.96875, "learning_rate": 0.0002795057660121329, "loss": 5.5472, "mean_token_accuracy": 0.2126206561923027, "num_tokens": 109701483.0, "step": 43280 }, { "entropy": 6.038506937026978, "epoch": 4.995383727639931, "grad_norm": 0.94921875, "learning_rate": 0.00027946450985961036, "loss": 5.4858, "mean_token_accuracy": 0.2234092429280281, "num_tokens": 109715764.0, "step": 43285 }, { "entropy": 6.095676422119141, "epoch": 4.995960761684939, "grad_norm": 0.8984375, "learning_rate": 0.00027942325355692627, "loss": 5.5783, "mean_token_accuracy": 0.2065901055932045, "num_tokens": 109728320.0, "step": 43290 }, { "entropy": 6.054702234268189, "epoch": 4.996537795729948, "grad_norm": 1.0, "learning_rate": 0.00027938199710546817, "loss": 5.4618, "mean_token_accuracy": 0.2177264451980591, "num_tokens": 109740110.0, "step": 43295 }, { "entropy": 6.076013517379761, "epoch": 4.997114829774957, "grad_norm": 0.9453125, "learning_rate": 0.00027934074050662384, "loss": 5.4899, "mean_token_accuracy": 0.2115508198738098, "num_tokens": 109753186.0, "step": 43300 }, { "entropy": 6.026408863067627, "epoch": 4.997691863819965, "grad_norm": 0.984375, "learning_rate": 0.0002792994837617808, "loss": 5.3889, "mean_token_accuracy": 0.22212812453508377, "num_tokens": 109766125.0, "step": 43305 }, { "entropy": 6.00216121673584, "epoch": 4.998268897864974, "grad_norm": 0.9296875, "learning_rate": 0.00027925822687232675, "loss": 5.4285, "mean_token_accuracy": 0.2226571962237358, "num_tokens": 109779108.0, "step": 43310 }, { "entropy": 5.972737264633179, "epoch": 4.998845931909983, "grad_norm": 1.0078125, "learning_rate": 0.0002792169698396494, "loss": 5.46, "mean_token_accuracy": 0.21331502348184586, "num_tokens": 109791171.0, "step": 43315 }, { "entropy": 6.031192111968994, "epoch": 4.999422965954992, "grad_norm": 1.0859375, "learning_rate": 0.0002791757126651364, "loss": 5.5314, "mean_token_accuracy": 0.2099149838089943, "num_tokens": 109803198.0, "step": 43320 }, { "entropy": 5.979723358154297, "epoch": 5.0, "grad_norm": 0.9609375, "learning_rate": 0.0002791344553501752, "loss": 5.4097, "mean_token_accuracy": 0.222554911673069, "num_tokens": 109815585.0, "step": 43325 }, { "entropy": 6.057002878189087, "epoch": 5.000577034045008, "grad_norm": 0.875, "learning_rate": 0.00027909319789615384, "loss": 5.411, "mean_token_accuracy": 0.21840555667877198, "num_tokens": 109829087.0, "step": 43330 }, { "entropy": 6.0135149478912355, "epoch": 5.001154068090018, "grad_norm": 1.0234375, "learning_rate": 0.0002790519403044597, "loss": 5.3842, "mean_token_accuracy": 0.2211799815297127, "num_tokens": 109843102.0, "step": 43335 }, { "entropy": 6.011963129043579, "epoch": 5.001731102135026, "grad_norm": 1.03125, "learning_rate": 0.00027901068257648063, "loss": 5.3962, "mean_token_accuracy": 0.2208527460694313, "num_tokens": 109855373.0, "step": 43340 }, { "entropy": 6.0466187477111815, "epoch": 5.002308136180035, "grad_norm": 0.9375, "learning_rate": 0.00027896942471360413, "loss": 5.4358, "mean_token_accuracy": 0.21855471283197403, "num_tokens": 109868291.0, "step": 43345 }, { "entropy": 6.09973292350769, "epoch": 5.002885170225043, "grad_norm": 0.91015625, "learning_rate": 0.00027892816671721817, "loss": 5.5186, "mean_token_accuracy": 0.21402830481529236, "num_tokens": 109881775.0, "step": 43350 }, { "entropy": 6.074065446853638, "epoch": 5.003462204270052, "grad_norm": 0.95703125, "learning_rate": 0.0002788869085887102, "loss": 5.4648, "mean_token_accuracy": 0.21933338642120362, "num_tokens": 109893968.0, "step": 43355 }, { "entropy": 6.00483021736145, "epoch": 5.004039238315061, "grad_norm": 1.0, "learning_rate": 0.00027884565032946796, "loss": 5.386, "mean_token_accuracy": 0.22136774957180022, "num_tokens": 109906610.0, "step": 43360 }, { "entropy": 6.038157987594604, "epoch": 5.004616272360069, "grad_norm": 1.03125, "learning_rate": 0.0002788043919408791, "loss": 5.4556, "mean_token_accuracy": 0.22546171098947526, "num_tokens": 109919641.0, "step": 43365 }, { "entropy": 6.093091297149658, "epoch": 5.0051933064050775, "grad_norm": 1.0703125, "learning_rate": 0.00027876313342433155, "loss": 5.4462, "mean_token_accuracy": 0.21399179100990295, "num_tokens": 109930948.0, "step": 43370 }, { "entropy": 5.999747323989868, "epoch": 5.005770340450087, "grad_norm": 1.1015625, "learning_rate": 0.00027872187478121286, "loss": 5.3871, "mean_token_accuracy": 0.22151034474372863, "num_tokens": 109943885.0, "step": 43375 }, { "entropy": 6.021550607681275, "epoch": 5.006347374495095, "grad_norm": 0.9921875, "learning_rate": 0.0002786806160129108, "loss": 5.4329, "mean_token_accuracy": 0.2237292245030403, "num_tokens": 109955418.0, "step": 43380 }, { "entropy": 6.058311700820923, "epoch": 5.006924408540104, "grad_norm": 0.9921875, "learning_rate": 0.0002786393571208129, "loss": 5.4124, "mean_token_accuracy": 0.22067750245332718, "num_tokens": 109967392.0, "step": 43385 }, { "entropy": 6.070983219146728, "epoch": 5.007501442585112, "grad_norm": 1.0390625, "learning_rate": 0.00027859809810630717, "loss": 5.4457, "mean_token_accuracy": 0.21794684380292892, "num_tokens": 109979129.0, "step": 43390 }, { "entropy": 6.035621166229248, "epoch": 5.008078476630121, "grad_norm": 1.015625, "learning_rate": 0.0002785568389707811, "loss": 5.4222, "mean_token_accuracy": 0.21813954561948776, "num_tokens": 109990672.0, "step": 43395 }, { "entropy": 5.960146522521972, "epoch": 5.00865551067513, "grad_norm": 1.0, "learning_rate": 0.0002785155797156226, "loss": 5.3678, "mean_token_accuracy": 0.22357719093561174, "num_tokens": 110005009.0, "step": 43400 }, { "entropy": 6.027435159683227, "epoch": 5.009232544720138, "grad_norm": 0.95703125, "learning_rate": 0.0002784743203422192, "loss": 5.3714, "mean_token_accuracy": 0.22740354835987092, "num_tokens": 110017239.0, "step": 43405 }, { "entropy": 5.953833150863647, "epoch": 5.0098095787651475, "grad_norm": 0.94140625, "learning_rate": 0.00027843306085195886, "loss": 5.2906, "mean_token_accuracy": 0.22527462989091873, "num_tokens": 110029789.0, "step": 43410 }, { "entropy": 6.080698251724243, "epoch": 5.010386612810156, "grad_norm": 0.96875, "learning_rate": 0.0002783918012462292, "loss": 5.5204, "mean_token_accuracy": 0.2130571871995926, "num_tokens": 110042094.0, "step": 43415 }, { "entropy": 6.062127113342285, "epoch": 5.010963646855164, "grad_norm": 0.9765625, "learning_rate": 0.000278350541526418, "loss": 5.4487, "mean_token_accuracy": 0.22809096574783325, "num_tokens": 110055464.0, "step": 43420 }, { "entropy": 6.0731995582580565, "epoch": 5.011540680900173, "grad_norm": 1.0078125, "learning_rate": 0.00027830928169391295, "loss": 5.462, "mean_token_accuracy": 0.21829243004322052, "num_tokens": 110067771.0, "step": 43425 }, { "entropy": 6.026186466217041, "epoch": 5.012117714945182, "grad_norm": 1.015625, "learning_rate": 0.0002782680217501019, "loss": 5.3742, "mean_token_accuracy": 0.22001130729913712, "num_tokens": 110079746.0, "step": 43430 }, { "entropy": 6.065733003616333, "epoch": 5.0126947489901905, "grad_norm": 0.9296875, "learning_rate": 0.00027822676169637255, "loss": 5.4586, "mean_token_accuracy": 0.21646685749292374, "num_tokens": 110091970.0, "step": 43435 }, { "entropy": 6.041999244689942, "epoch": 5.013271783035199, "grad_norm": 0.98828125, "learning_rate": 0.00027818550153411276, "loss": 5.3826, "mean_token_accuracy": 0.22398083806037902, "num_tokens": 110104545.0, "step": 43440 }, { "entropy": 6.009548568725586, "epoch": 5.013848817080207, "grad_norm": 0.87890625, "learning_rate": 0.0002781442412647101, "loss": 5.3611, "mean_token_accuracy": 0.23100339472293854, "num_tokens": 110117280.0, "step": 43445 }, { "entropy": 6.00257682800293, "epoch": 5.014425851125217, "grad_norm": 1.09375, "learning_rate": 0.0002781029808895525, "loss": 5.4074, "mean_token_accuracy": 0.2265898421406746, "num_tokens": 110130526.0, "step": 43450 }, { "entropy": 6.010365962982178, "epoch": 5.015002885170225, "grad_norm": 0.96875, "learning_rate": 0.00027806172041002766, "loss": 5.427, "mean_token_accuracy": 0.2144506588578224, "num_tokens": 110143336.0, "step": 43455 }, { "entropy": 6.060679864883423, "epoch": 5.0155799192152335, "grad_norm": 0.96875, "learning_rate": 0.00027802045982752336, "loss": 5.4366, "mean_token_accuracy": 0.21671856790781022, "num_tokens": 110155220.0, "step": 43460 }, { "entropy": 5.9916623592376705, "epoch": 5.016156953260242, "grad_norm": 0.94921875, "learning_rate": 0.00027797919914342736, "loss": 5.3761, "mean_token_accuracy": 0.22382241487503052, "num_tokens": 110169163.0, "step": 43465 }, { "entropy": 5.984676265716553, "epoch": 5.016733987305251, "grad_norm": 1.28125, "learning_rate": 0.0002779379383591275, "loss": 5.3955, "mean_token_accuracy": 0.22768711745738984, "num_tokens": 110181887.0, "step": 43470 }, { "entropy": 6.030897855758667, "epoch": 5.01731102135026, "grad_norm": 0.9609375, "learning_rate": 0.0002778966774760116, "loss": 5.3853, "mean_token_accuracy": 0.228704833984375, "num_tokens": 110194402.0, "step": 43475 }, { "entropy": 6.107543134689331, "epoch": 5.017888055395268, "grad_norm": 1.015625, "learning_rate": 0.00027785541649546743, "loss": 5.5118, "mean_token_accuracy": 0.21228811740875245, "num_tokens": 110207521.0, "step": 43480 }, { "entropy": 6.047583723068238, "epoch": 5.018465089440277, "grad_norm": 1.0390625, "learning_rate": 0.0002778141554188826, "loss": 5.4229, "mean_token_accuracy": 0.22110394090414048, "num_tokens": 110219240.0, "step": 43485 }, { "entropy": 6.052866363525391, "epoch": 5.019042123485286, "grad_norm": 1.0078125, "learning_rate": 0.00027777289424764514, "loss": 5.4499, "mean_token_accuracy": 0.21959130465984344, "num_tokens": 110231186.0, "step": 43490 }, { "entropy": 6.035445356369019, "epoch": 5.019619157530294, "grad_norm": 1.0, "learning_rate": 0.00027773163298314276, "loss": 5.452, "mean_token_accuracy": 0.22017614245414735, "num_tokens": 110243185.0, "step": 43495 }, { "entropy": 6.103040552139282, "epoch": 5.020196191575303, "grad_norm": 1.015625, "learning_rate": 0.0002776903716267632, "loss": 5.4572, "mean_token_accuracy": 0.21248776316642762, "num_tokens": 110254840.0, "step": 43500 }, { "entropy": 6.074078559875488, "epoch": 5.020773225620312, "grad_norm": 1.0, "learning_rate": 0.00027764911017989443, "loss": 5.4705, "mean_token_accuracy": 0.2233603611588478, "num_tokens": 110267263.0, "step": 43505 }, { "entropy": 6.103983449935913, "epoch": 5.02135025966532, "grad_norm": 0.9921875, "learning_rate": 0.00027760784864392404, "loss": 5.5296, "mean_token_accuracy": 0.21100655496120452, "num_tokens": 110280057.0, "step": 43510 }, { "entropy": 6.048934555053711, "epoch": 5.021927293710329, "grad_norm": 1.015625, "learning_rate": 0.00027756658702024, "loss": 5.4041, "mean_token_accuracy": 0.21984410434961318, "num_tokens": 110292827.0, "step": 43515 }, { "entropy": 5.979860544204712, "epoch": 5.022504327755337, "grad_norm": 0.921875, "learning_rate": 0.0002775253253102301, "loss": 5.306, "mean_token_accuracy": 0.22724293917417526, "num_tokens": 110305449.0, "step": 43520 }, { "entropy": 6.053369379043579, "epoch": 5.0230813618003465, "grad_norm": 1.0, "learning_rate": 0.00027748406351528216, "loss": 5.4624, "mean_token_accuracy": 0.21502453833818436, "num_tokens": 110317922.0, "step": 43525 }, { "entropy": 6.0136621475219725, "epoch": 5.023658395845355, "grad_norm": 0.97265625, "learning_rate": 0.0002774428016367839, "loss": 5.4129, "mean_token_accuracy": 0.22424203306436538, "num_tokens": 110330377.0, "step": 43530 }, { "entropy": 6.015083312988281, "epoch": 5.024235429890363, "grad_norm": 0.9453125, "learning_rate": 0.00027740153967612327, "loss": 5.4141, "mean_token_accuracy": 0.223326875269413, "num_tokens": 110343353.0, "step": 43535 }, { "entropy": 6.013021326065063, "epoch": 5.024812463935373, "grad_norm": 0.97265625, "learning_rate": 0.00027736027763468807, "loss": 5.4195, "mean_token_accuracy": 0.22434018552303314, "num_tokens": 110355953.0, "step": 43540 }, { "entropy": 6.14027214050293, "epoch": 5.025389497980381, "grad_norm": 1.0859375, "learning_rate": 0.00027731901551386606, "loss": 5.549, "mean_token_accuracy": 0.21244252920150758, "num_tokens": 110367905.0, "step": 43545 }, { "entropy": 6.060546398162842, "epoch": 5.0259665320253895, "grad_norm": 0.98046875, "learning_rate": 0.0002772777533150451, "loss": 5.4001, "mean_token_accuracy": 0.22276355773210527, "num_tokens": 110381255.0, "step": 43550 }, { "entropy": 6.036908960342407, "epoch": 5.026543566070398, "grad_norm": 0.94140625, "learning_rate": 0.0002772364910396131, "loss": 5.4117, "mean_token_accuracy": 0.22621753811836243, "num_tokens": 110393287.0, "step": 43555 }, { "entropy": 6.002397584915161, "epoch": 5.027120600115407, "grad_norm": 0.96875, "learning_rate": 0.00027719522868895774, "loss": 5.4344, "mean_token_accuracy": 0.221749347448349, "num_tokens": 110406378.0, "step": 43560 }, { "entropy": 6.049661874771118, "epoch": 5.027697634160416, "grad_norm": 1.0703125, "learning_rate": 0.000277153966264467, "loss": 5.3826, "mean_token_accuracy": 0.22492537200450896, "num_tokens": 110419153.0, "step": 43565 }, { "entropy": 6.08701982498169, "epoch": 5.028274668205424, "grad_norm": 1.0234375, "learning_rate": 0.0002771127037675288, "loss": 5.4385, "mean_token_accuracy": 0.22303762584924697, "num_tokens": 110431418.0, "step": 43570 }, { "entropy": 5.97638430595398, "epoch": 5.028851702250432, "grad_norm": 0.9765625, "learning_rate": 0.0002770714411995307, "loss": 5.428, "mean_token_accuracy": 0.22077428847551345, "num_tokens": 110444999.0, "step": 43575 }, { "entropy": 6.061025905609131, "epoch": 5.029428736295442, "grad_norm": 1.0546875, "learning_rate": 0.00027703017856186077, "loss": 5.4722, "mean_token_accuracy": 0.2129136011004448, "num_tokens": 110456263.0, "step": 43580 }, { "entropy": 6.047892427444458, "epoch": 5.03000577034045, "grad_norm": 1.078125, "learning_rate": 0.0002769889158559067, "loss": 5.4443, "mean_token_accuracy": 0.2185959190130234, "num_tokens": 110469019.0, "step": 43585 }, { "entropy": 6.002608871459961, "epoch": 5.030582804385459, "grad_norm": 1.0, "learning_rate": 0.0002769476530830566, "loss": 5.4108, "mean_token_accuracy": 0.2232239380478859, "num_tokens": 110481046.0, "step": 43590 }, { "entropy": 6.076695919036865, "epoch": 5.031159838430467, "grad_norm": 1.0546875, "learning_rate": 0.000276906390244698, "loss": 5.4771, "mean_token_accuracy": 0.21442841589450837, "num_tokens": 110495091.0, "step": 43595 }, { "entropy": 6.061804246902466, "epoch": 5.031736872475476, "grad_norm": 1.0234375, "learning_rate": 0.00027686512734221896, "loss": 5.4872, "mean_token_accuracy": 0.219915272295475, "num_tokens": 110507465.0, "step": 43600 }, { "entropy": 6.036294889450073, "epoch": 5.032313906520485, "grad_norm": 1.0078125, "learning_rate": 0.00027682386437700735, "loss": 5.4281, "mean_token_accuracy": 0.22256449609994888, "num_tokens": 110519564.0, "step": 43605 }, { "entropy": 6.070567226409912, "epoch": 5.032890940565493, "grad_norm": 1.0703125, "learning_rate": 0.00027678260135045093, "loss": 5.3928, "mean_token_accuracy": 0.22905297130346297, "num_tokens": 110532961.0, "step": 43610 }, { "entropy": 6.1446428298950195, "epoch": 5.033467974610502, "grad_norm": 1.03125, "learning_rate": 0.00027674133826393753, "loss": 5.4993, "mean_token_accuracy": 0.21308950036764146, "num_tokens": 110544445.0, "step": 43615 }, { "entropy": 6.089685678482056, "epoch": 5.034045008655511, "grad_norm": 0.921875, "learning_rate": 0.0002767000751188552, "loss": 5.498, "mean_token_accuracy": 0.2153544694185257, "num_tokens": 110558462.0, "step": 43620 }, { "entropy": 5.9756715297698975, "epoch": 5.034622042700519, "grad_norm": 1.0078125, "learning_rate": 0.0002766588119165916, "loss": 5.3546, "mean_token_accuracy": 0.2213977411389351, "num_tokens": 110571071.0, "step": 43625 }, { "entropy": 6.030717897415161, "epoch": 5.035199076745528, "grad_norm": 0.9453125, "learning_rate": 0.0002766175486585348, "loss": 5.4131, "mean_token_accuracy": 0.22668559104204178, "num_tokens": 110583430.0, "step": 43630 }, { "entropy": 6.100792455673218, "epoch": 5.035776110790537, "grad_norm": 0.98046875, "learning_rate": 0.0002765762853460724, "loss": 5.4906, "mean_token_accuracy": 0.21438062191009521, "num_tokens": 110596730.0, "step": 43635 }, { "entropy": 6.107109117507934, "epoch": 5.036353144835545, "grad_norm": 1.015625, "learning_rate": 0.0002765350219805925, "loss": 5.4758, "mean_token_accuracy": 0.21680520325899125, "num_tokens": 110608793.0, "step": 43640 }, { "entropy": 6.078278303146362, "epoch": 5.036930178880554, "grad_norm": 0.97265625, "learning_rate": 0.00027649375856348286, "loss": 5.469, "mean_token_accuracy": 0.21492241621017455, "num_tokens": 110621432.0, "step": 43645 }, { "entropy": 5.941734361648559, "epoch": 5.037507212925562, "grad_norm": 0.984375, "learning_rate": 0.00027645249509613147, "loss": 5.4082, "mean_token_accuracy": 0.22579283863306046, "num_tokens": 110634059.0, "step": 43650 }, { "entropy": 6.008061933517456, "epoch": 5.0380842469705716, "grad_norm": 1.0859375, "learning_rate": 0.00027641123157992603, "loss": 5.4025, "mean_token_accuracy": 0.22261736840009688, "num_tokens": 110647070.0, "step": 43655 }, { "entropy": 6.00016417503357, "epoch": 5.03866128101558, "grad_norm": 0.94921875, "learning_rate": 0.00027636996801625466, "loss": 5.4018, "mean_token_accuracy": 0.21993223428726197, "num_tokens": 110660062.0, "step": 43660 }, { "entropy": 6.1118992328643795, "epoch": 5.039238315060588, "grad_norm": 0.9375, "learning_rate": 0.00027632870440650497, "loss": 5.4389, "mean_token_accuracy": 0.22095718383789062, "num_tokens": 110673009.0, "step": 43665 }, { "entropy": 5.991368150711059, "epoch": 5.039815349105597, "grad_norm": 1.0390625, "learning_rate": 0.000276287440752065, "loss": 5.4128, "mean_token_accuracy": 0.22291670441627504, "num_tokens": 110685180.0, "step": 43670 }, { "entropy": 6.073290252685547, "epoch": 5.040392383150606, "grad_norm": 1.046875, "learning_rate": 0.0002762461770543226, "loss": 5.439, "mean_token_accuracy": 0.224125699698925, "num_tokens": 110697883.0, "step": 43675 }, { "entropy": 5.9949424266815186, "epoch": 5.0409694171956145, "grad_norm": 0.9453125, "learning_rate": 0.00027620491331466565, "loss": 5.3806, "mean_token_accuracy": 0.22720801532268525, "num_tokens": 110710916.0, "step": 43680 }, { "entropy": 6.005471849441529, "epoch": 5.041546451240623, "grad_norm": 0.98046875, "learning_rate": 0.0002761636495344821, "loss": 5.3962, "mean_token_accuracy": 0.22628005594015121, "num_tokens": 110723291.0, "step": 43685 }, { "entropy": 5.998024559020996, "epoch": 5.042123485285632, "grad_norm": 1.0546875, "learning_rate": 0.00027612238571515975, "loss": 5.3743, "mean_token_accuracy": 0.22809399515390397, "num_tokens": 110736008.0, "step": 43690 }, { "entropy": 6.045644950866699, "epoch": 5.042700519330641, "grad_norm": 0.96484375, "learning_rate": 0.00027608112185808646, "loss": 5.4274, "mean_token_accuracy": 0.22308100312948226, "num_tokens": 110749464.0, "step": 43695 }, { "entropy": 6.015965366363526, "epoch": 5.043277553375649, "grad_norm": 0.97265625, "learning_rate": 0.0002760398579646502, "loss": 5.4474, "mean_token_accuracy": 0.2218312442302704, "num_tokens": 110762437.0, "step": 43700 }, { "entropy": 6.03645691871643, "epoch": 5.0438545874206575, "grad_norm": 0.9765625, "learning_rate": 0.00027599859403623883, "loss": 5.4247, "mean_token_accuracy": 0.2206249788403511, "num_tokens": 110775364.0, "step": 43705 }, { "entropy": 6.012313747406006, "epoch": 5.044431621465667, "grad_norm": 0.98828125, "learning_rate": 0.0002759573300742403, "loss": 5.3688, "mean_token_accuracy": 0.2273314744234085, "num_tokens": 110787668.0, "step": 43710 }, { "entropy": 6.045507001876831, "epoch": 5.045008655510675, "grad_norm": 0.98828125, "learning_rate": 0.0002759160660800424, "loss": 5.4285, "mean_token_accuracy": 0.21761375963687896, "num_tokens": 110799522.0, "step": 43715 }, { "entropy": 6.0433127880096436, "epoch": 5.045585689555684, "grad_norm": 1.0390625, "learning_rate": 0.000275874802055033, "loss": 5.3969, "mean_token_accuracy": 0.22407684326171876, "num_tokens": 110811576.0, "step": 43720 }, { "entropy": 5.968475580215454, "epoch": 5.046162723600692, "grad_norm": 1.0546875, "learning_rate": 0.0002758335380006002, "loss": 5.3672, "mean_token_accuracy": 0.22569257915019988, "num_tokens": 110823824.0, "step": 43725 }, { "entropy": 6.141472578048706, "epoch": 5.046739757645701, "grad_norm": 1.0625, "learning_rate": 0.0002757922739181317, "loss": 5.5027, "mean_token_accuracy": 0.2123544842004776, "num_tokens": 110837656.0, "step": 43730 }, { "entropy": 6.100065803527832, "epoch": 5.04731679169071, "grad_norm": 0.9609375, "learning_rate": 0.00027575100980901544, "loss": 5.4927, "mean_token_accuracy": 0.2117149218916893, "num_tokens": 110852148.0, "step": 43735 }, { "entropy": 6.093953561782837, "epoch": 5.047893825735718, "grad_norm": 1.0703125, "learning_rate": 0.00027570974567463934, "loss": 5.5321, "mean_token_accuracy": 0.2087482437491417, "num_tokens": 110865884.0, "step": 43740 }, { "entropy": 6.048941373825073, "epoch": 5.048470859780727, "grad_norm": 1.0546875, "learning_rate": 0.00027566848151639134, "loss": 5.4201, "mean_token_accuracy": 0.22149043828248977, "num_tokens": 110877512.0, "step": 43745 }, { "entropy": 6.0919266700744625, "epoch": 5.049047893825736, "grad_norm": 0.98046875, "learning_rate": 0.0002756272173356593, "loss": 5.4356, "mean_token_accuracy": 0.2235841080546379, "num_tokens": 110890499.0, "step": 43750 }, { "entropy": 6.026390504837036, "epoch": 5.049624927870744, "grad_norm": 1.0, "learning_rate": 0.0002755859531338311, "loss": 5.4783, "mean_token_accuracy": 0.2191991999745369, "num_tokens": 110903376.0, "step": 43755 }, { "entropy": 6.04155707359314, "epoch": 5.050201961915753, "grad_norm": 0.97265625, "learning_rate": 0.00027554468891229463, "loss": 5.446, "mean_token_accuracy": 0.21936483234167098, "num_tokens": 110916376.0, "step": 43760 }, { "entropy": 6.027285242080689, "epoch": 5.050778995960762, "grad_norm": 0.984375, "learning_rate": 0.0002755034246724378, "loss": 5.47, "mean_token_accuracy": 0.2123220220208168, "num_tokens": 110928719.0, "step": 43765 }, { "entropy": 6.05591197013855, "epoch": 5.0513560300057705, "grad_norm": 0.9765625, "learning_rate": 0.00027546216041564856, "loss": 5.4302, "mean_token_accuracy": 0.2223159059882164, "num_tokens": 110941361.0, "step": 43770 }, { "entropy": 6.076092004776001, "epoch": 5.051933064050779, "grad_norm": 1.046875, "learning_rate": 0.0002754208961433149, "loss": 5.4691, "mean_token_accuracy": 0.22302059978246688, "num_tokens": 110954068.0, "step": 43775 }, { "entropy": 5.895540618896485, "epoch": 5.052510098095787, "grad_norm": 0.9765625, "learning_rate": 0.0002753796318568244, "loss": 5.2876, "mean_token_accuracy": 0.23152270168066025, "num_tokens": 110967819.0, "step": 43780 }, { "entropy": 6.023781394958496, "epoch": 5.053087132140797, "grad_norm": 0.9375, "learning_rate": 0.0002753383675575653, "loss": 5.4126, "mean_token_accuracy": 0.22144342511892318, "num_tokens": 110981153.0, "step": 43785 }, { "entropy": 6.085490942001343, "epoch": 5.053664166185805, "grad_norm": 0.96875, "learning_rate": 0.00027529710324692536, "loss": 5.5039, "mean_token_accuracy": 0.21074877828359603, "num_tokens": 110993242.0, "step": 43790 }, { "entropy": 6.038920068740845, "epoch": 5.0542412002308135, "grad_norm": 1.0625, "learning_rate": 0.00027525583892629255, "loss": 5.3804, "mean_token_accuracy": 0.2290875256061554, "num_tokens": 111006937.0, "step": 43795 }, { "entropy": 5.986760091781616, "epoch": 5.054818234275822, "grad_norm": 0.96484375, "learning_rate": 0.00027521457459705464, "loss": 5.4085, "mean_token_accuracy": 0.22843277156352998, "num_tokens": 111019942.0, "step": 43800 }, { "entropy": 6.02552604675293, "epoch": 5.055395268320831, "grad_norm": 1.0546875, "learning_rate": 0.00027517331026059963, "loss": 5.3876, "mean_token_accuracy": 0.21961864829063416, "num_tokens": 111031199.0, "step": 43805 }, { "entropy": 6.061905431747436, "epoch": 5.05597230236584, "grad_norm": 1.09375, "learning_rate": 0.0002751320459183154, "loss": 5.4812, "mean_token_accuracy": 0.21339097172021865, "num_tokens": 111043252.0, "step": 43810 }, { "entropy": 6.060674571990967, "epoch": 5.056549336410848, "grad_norm": 1.0234375, "learning_rate": 0.0002750907815715899, "loss": 5.4729, "mean_token_accuracy": 0.22339835464954377, "num_tokens": 111054969.0, "step": 43815 }, { "entropy": 6.088775539398194, "epoch": 5.057126370455857, "grad_norm": 0.9453125, "learning_rate": 0.00027504951722181104, "loss": 5.4099, "mean_token_accuracy": 0.22435894310474397, "num_tokens": 111067028.0, "step": 43820 }, { "entropy": 6.014452743530273, "epoch": 5.057703404500866, "grad_norm": 0.94921875, "learning_rate": 0.0002750082528703666, "loss": 5.4367, "mean_token_accuracy": 0.22171470671892166, "num_tokens": 111079317.0, "step": 43825 }, { "entropy": 5.963097953796387, "epoch": 5.058280438545874, "grad_norm": 0.9453125, "learning_rate": 0.0002749669885186447, "loss": 5.3484, "mean_token_accuracy": 0.22546017915010452, "num_tokens": 111092052.0, "step": 43830 }, { "entropy": 6.066402864456177, "epoch": 5.058857472590883, "grad_norm": 0.984375, "learning_rate": 0.0002749257241680331, "loss": 5.4791, "mean_token_accuracy": 0.2186070203781128, "num_tokens": 111104616.0, "step": 43835 }, { "entropy": 5.969967842102051, "epoch": 5.059434506635892, "grad_norm": 0.94921875, "learning_rate": 0.0002748844598199196, "loss": 5.3698, "mean_token_accuracy": 0.22845522463321685, "num_tokens": 111118394.0, "step": 43840 }, { "entropy": 6.05379638671875, "epoch": 5.0600115406809, "grad_norm": 1.2578125, "learning_rate": 0.00027484319547569237, "loss": 5.4199, "mean_token_accuracy": 0.2178450882434845, "num_tokens": 111130812.0, "step": 43845 }, { "entropy": 6.103090095520019, "epoch": 5.060588574725909, "grad_norm": 1.078125, "learning_rate": 0.0002748019311367391, "loss": 5.4998, "mean_token_accuracy": 0.21108583956956864, "num_tokens": 111143332.0, "step": 43850 }, { "entropy": 6.078620862960816, "epoch": 5.061165608770917, "grad_norm": 1.0390625, "learning_rate": 0.0002747606668044479, "loss": 5.4217, "mean_token_accuracy": 0.2254311040043831, "num_tokens": 111156273.0, "step": 43855 }, { "entropy": 6.064867258071899, "epoch": 5.0617426428159265, "grad_norm": 1.015625, "learning_rate": 0.00027471940248020637, "loss": 5.4615, "mean_token_accuracy": 0.21778440475463867, "num_tokens": 111169408.0, "step": 43860 }, { "entropy": 5.954033660888672, "epoch": 5.062319676860935, "grad_norm": 0.96484375, "learning_rate": 0.00027467813816540277, "loss": 5.348, "mean_token_accuracy": 0.22130090445280076, "num_tokens": 111181346.0, "step": 43865 }, { "entropy": 6.066328668594361, "epoch": 5.062896710905943, "grad_norm": 0.96484375, "learning_rate": 0.0002746368738614247, "loss": 5.4252, "mean_token_accuracy": 0.218902787566185, "num_tokens": 111193013.0, "step": 43870 }, { "entropy": 6.0883392810821535, "epoch": 5.063473744950952, "grad_norm": 1.015625, "learning_rate": 0.00027459560956966036, "loss": 5.5008, "mean_token_accuracy": 0.21469320207834244, "num_tokens": 111205255.0, "step": 43875 }, { "entropy": 6.073800945281983, "epoch": 5.064050778995961, "grad_norm": 1.0859375, "learning_rate": 0.0002745543452914973, "loss": 5.4458, "mean_token_accuracy": 0.22309898883104323, "num_tokens": 111218825.0, "step": 43880 }, { "entropy": 6.072566986083984, "epoch": 5.064627813040969, "grad_norm": 1.0078125, "learning_rate": 0.00027451308102832375, "loss": 5.4736, "mean_token_accuracy": 0.22132294476032258, "num_tokens": 111231655.0, "step": 43885 }, { "entropy": 6.0426851272583, "epoch": 5.065204847085978, "grad_norm": 1.03125, "learning_rate": 0.0002744718167815274, "loss": 5.4215, "mean_token_accuracy": 0.2223377600312233, "num_tokens": 111245039.0, "step": 43890 }, { "entropy": 6.04015703201294, "epoch": 5.065781881130987, "grad_norm": 0.953125, "learning_rate": 0.0002744305525524963, "loss": 5.4903, "mean_token_accuracy": 0.21566438525915146, "num_tokens": 111257790.0, "step": 43895 }, { "entropy": 6.1207441806793215, "epoch": 5.066358915175996, "grad_norm": 1.1015625, "learning_rate": 0.0002743892883426182, "loss": 5.5735, "mean_token_accuracy": 0.21036375612020491, "num_tokens": 111270435.0, "step": 43900 }, { "entropy": 6.15555214881897, "epoch": 5.066935949221004, "grad_norm": 1.1015625, "learning_rate": 0.00027434802415328115, "loss": 5.5271, "mean_token_accuracy": 0.21542391180992126, "num_tokens": 111283418.0, "step": 43905 }, { "entropy": 6.092133522033691, "epoch": 5.067512983266012, "grad_norm": 1.0, "learning_rate": 0.00027430675998587294, "loss": 5.4792, "mean_token_accuracy": 0.21991305351257323, "num_tokens": 111296717.0, "step": 43910 }, { "entropy": 5.90102252960205, "epoch": 5.068090017311022, "grad_norm": 0.98828125, "learning_rate": 0.00027426549584178163, "loss": 5.2205, "mean_token_accuracy": 0.2448872983455658, "num_tokens": 111310222.0, "step": 43915 }, { "entropy": 6.018193483352661, "epoch": 5.06866705135603, "grad_norm": 1.0, "learning_rate": 0.00027422423172239485, "loss": 5.4635, "mean_token_accuracy": 0.21214070320129394, "num_tokens": 111321838.0, "step": 43920 }, { "entropy": 5.953082609176636, "epoch": 5.0692440854010385, "grad_norm": 1.1640625, "learning_rate": 0.00027418296762910075, "loss": 5.3204, "mean_token_accuracy": 0.2320536643266678, "num_tokens": 111335297.0, "step": 43925 }, { "entropy": 6.072371149063111, "epoch": 5.069821119446047, "grad_norm": 0.9921875, "learning_rate": 0.000274141703563287, "loss": 5.4374, "mean_token_accuracy": 0.21538564413785935, "num_tokens": 111346571.0, "step": 43930 }, { "entropy": 5.9878864765167235, "epoch": 5.070398153491056, "grad_norm": 1.1640625, "learning_rate": 0.0002741004395263418, "loss": 5.3723, "mean_token_accuracy": 0.22695438116788863, "num_tokens": 111359080.0, "step": 43935 }, { "entropy": 6.03265528678894, "epoch": 5.070975187536065, "grad_norm": 0.91796875, "learning_rate": 0.0002740591755196527, "loss": 5.3929, "mean_token_accuracy": 0.2247341215610504, "num_tokens": 111372013.0, "step": 43940 }, { "entropy": 6.024111032485962, "epoch": 5.071552221581073, "grad_norm": 1.015625, "learning_rate": 0.0002740179115446079, "loss": 5.408, "mean_token_accuracy": 0.22659876495599746, "num_tokens": 111384097.0, "step": 43945 }, { "entropy": 6.062497806549072, "epoch": 5.0721292556260815, "grad_norm": 1.03125, "learning_rate": 0.0002739766476025951, "loss": 5.4394, "mean_token_accuracy": 0.21750799417495728, "num_tokens": 111397025.0, "step": 43950 }, { "entropy": 6.1084648132324215, "epoch": 5.072706289671091, "grad_norm": 0.96875, "learning_rate": 0.00027393538369500226, "loss": 5.4946, "mean_token_accuracy": 0.21657062768936158, "num_tokens": 111409256.0, "step": 43955 }, { "entropy": 5.967855548858642, "epoch": 5.073283323716099, "grad_norm": 0.98046875, "learning_rate": 0.0002738941198232172, "loss": 5.3623, "mean_token_accuracy": 0.23110650926828386, "num_tokens": 111422401.0, "step": 43960 }, { "entropy": 6.00794825553894, "epoch": 5.073860357761108, "grad_norm": 1.0078125, "learning_rate": 0.00027385285598862795, "loss": 5.4588, "mean_token_accuracy": 0.22129245698451996, "num_tokens": 111434855.0, "step": 43965 }, { "entropy": 6.047057104110718, "epoch": 5.074437391806117, "grad_norm": 1.0625, "learning_rate": 0.0002738115921926223, "loss": 5.4187, "mean_token_accuracy": 0.21995000541210175, "num_tokens": 111448089.0, "step": 43970 }, { "entropy": 6.019506359100342, "epoch": 5.075014425851125, "grad_norm": 1.1171875, "learning_rate": 0.0002737703284365882, "loss": 5.3858, "mean_token_accuracy": 0.2197961390018463, "num_tokens": 111460290.0, "step": 43975 }, { "entropy": 5.972984981536865, "epoch": 5.075591459896134, "grad_norm": 1.6328125, "learning_rate": 0.0002737290647219134, "loss": 5.3676, "mean_token_accuracy": 0.22668742537498474, "num_tokens": 111473901.0, "step": 43980 }, { "entropy": 6.074132013320923, "epoch": 5.076168493941142, "grad_norm": 0.9296875, "learning_rate": 0.00027368780104998594, "loss": 5.4614, "mean_token_accuracy": 0.22270818054676056, "num_tokens": 111486309.0, "step": 43985 }, { "entropy": 6.084434890747071, "epoch": 5.0767455279861515, "grad_norm": 0.99609375, "learning_rate": 0.0002736465374221936, "loss": 5.5097, "mean_token_accuracy": 0.20677373558282852, "num_tokens": 111498220.0, "step": 43990 }, { "entropy": 6.0118903636932375, "epoch": 5.07732256203116, "grad_norm": 0.92578125, "learning_rate": 0.0002736052738399243, "loss": 5.4077, "mean_token_accuracy": 0.2176373153924942, "num_tokens": 111511789.0, "step": 43995 }, { "entropy": 6.067039680480957, "epoch": 5.077899596076168, "grad_norm": 1.1875, "learning_rate": 0.00027356401030456597, "loss": 5.439, "mean_token_accuracy": 0.22006991356611252, "num_tokens": 111524304.0, "step": 44000 }, { "entropy": 6.071492624282837, "epoch": 5.078476630121177, "grad_norm": 0.96875, "learning_rate": 0.0002735227468175064, "loss": 5.4405, "mean_token_accuracy": 0.21808840632438659, "num_tokens": 111537149.0, "step": 44005 }, { "entropy": 6.1197710037231445, "epoch": 5.079053664166186, "grad_norm": 1.0703125, "learning_rate": 0.0002734814833801335, "loss": 5.543, "mean_token_accuracy": 0.21046993136405945, "num_tokens": 111551166.0, "step": 44010 }, { "entropy": 6.014575672149658, "epoch": 5.0796306982111945, "grad_norm": 0.98046875, "learning_rate": 0.0002734402199938352, "loss": 5.3542, "mean_token_accuracy": 0.23357006460428237, "num_tokens": 111563982.0, "step": 44015 }, { "entropy": 6.074667358398438, "epoch": 5.080207732256203, "grad_norm": 0.96875, "learning_rate": 0.0002733989566599993, "loss": 5.3914, "mean_token_accuracy": 0.22708164006471634, "num_tokens": 111577298.0, "step": 44020 }, { "entropy": 6.018869066238404, "epoch": 5.080784766301211, "grad_norm": 0.95703125, "learning_rate": 0.00027335769338001373, "loss": 5.4182, "mean_token_accuracy": 0.22038844972848892, "num_tokens": 111590044.0, "step": 44025 }, { "entropy": 5.94426326751709, "epoch": 5.081361800346221, "grad_norm": 0.99609375, "learning_rate": 0.00027331643015526623, "loss": 5.2582, "mean_token_accuracy": 0.24838035106658934, "num_tokens": 111603811.0, "step": 44030 }, { "entropy": 5.89699273109436, "epoch": 5.081938834391229, "grad_norm": 1.03125, "learning_rate": 0.0002732751669871449, "loss": 5.3123, "mean_token_accuracy": 0.23269784897565843, "num_tokens": 111615198.0, "step": 44035 }, { "entropy": 5.9873229503631595, "epoch": 5.0825158684362375, "grad_norm": 0.99609375, "learning_rate": 0.00027323390387703735, "loss": 5.341, "mean_token_accuracy": 0.2299254059791565, "num_tokens": 111627873.0, "step": 44040 }, { "entropy": 6.038514089584351, "epoch": 5.083092902481247, "grad_norm": 1.046875, "learning_rate": 0.0002731926408263317, "loss": 5.4665, "mean_token_accuracy": 0.21882090121507644, "num_tokens": 111640493.0, "step": 44045 }, { "entropy": 5.97344479560852, "epoch": 5.083669936526255, "grad_norm": 0.9453125, "learning_rate": 0.0002731513778364155, "loss": 5.3725, "mean_token_accuracy": 0.23172066509723663, "num_tokens": 111652701.0, "step": 44050 }, { "entropy": 6.013360834121704, "epoch": 5.084246970571264, "grad_norm": 0.9921875, "learning_rate": 0.00027311011490867694, "loss": 5.4463, "mean_token_accuracy": 0.21674323529005052, "num_tokens": 111664467.0, "step": 44055 }, { "entropy": 6.002835416793824, "epoch": 5.084824004616272, "grad_norm": 1.0390625, "learning_rate": 0.0002730688520445036, "loss": 5.3616, "mean_token_accuracy": 0.22356657832860946, "num_tokens": 111677129.0, "step": 44060 }, { "entropy": 6.014926195144653, "epoch": 5.085401038661281, "grad_norm": 1.0234375, "learning_rate": 0.0002730275892452836, "loss": 5.3801, "mean_token_accuracy": 0.22070738226175307, "num_tokens": 111689546.0, "step": 44065 }, { "entropy": 6.076750898361206, "epoch": 5.08597807270629, "grad_norm": 1.0390625, "learning_rate": 0.0002729863265124046, "loss": 5.4684, "mean_token_accuracy": 0.22009487748146056, "num_tokens": 111702015.0, "step": 44070 }, { "entropy": 6.1154650211334225, "epoch": 5.086555106751298, "grad_norm": 1.0625, "learning_rate": 0.0002729450638472545, "loss": 5.5007, "mean_token_accuracy": 0.21336942613124849, "num_tokens": 111713559.0, "step": 44075 }, { "entropy": 6.013238716125488, "epoch": 5.087132140796307, "grad_norm": 1.1015625, "learning_rate": 0.0002729038012512211, "loss": 5.4505, "mean_token_accuracy": 0.21332897394895553, "num_tokens": 111725249.0, "step": 44080 }, { "entropy": 6.0834942817687985, "epoch": 5.087709174841316, "grad_norm": 1.046875, "learning_rate": 0.0002728625387256924, "loss": 5.4971, "mean_token_accuracy": 0.21392269134521485, "num_tokens": 111736978.0, "step": 44085 }, { "entropy": 6.066761207580567, "epoch": 5.088286208886324, "grad_norm": 1.0390625, "learning_rate": 0.00027282127627205604, "loss": 5.4875, "mean_token_accuracy": 0.21301310658454894, "num_tokens": 111749129.0, "step": 44090 }, { "entropy": 6.019028425216675, "epoch": 5.088863242931333, "grad_norm": 0.9765625, "learning_rate": 0.0002727800138917001, "loss": 5.4452, "mean_token_accuracy": 0.22329931259155272, "num_tokens": 111762348.0, "step": 44095 }, { "entropy": 6.001850032806397, "epoch": 5.089440276976342, "grad_norm": 1.1171875, "learning_rate": 0.00027273875158601214, "loss": 5.4377, "mean_token_accuracy": 0.21423040330410004, "num_tokens": 111775847.0, "step": 44100 }, { "entropy": 6.078058576583862, "epoch": 5.0900173110213505, "grad_norm": 0.953125, "learning_rate": 0.00027269748935638026, "loss": 5.4679, "mean_token_accuracy": 0.22060146927833557, "num_tokens": 111789175.0, "step": 44105 }, { "entropy": 6.084034967422485, "epoch": 5.090594345066359, "grad_norm": 0.98046875, "learning_rate": 0.0002726562272041921, "loss": 5.466, "mean_token_accuracy": 0.21976256221532822, "num_tokens": 111801294.0, "step": 44110 }, { "entropy": 6.018796586990357, "epoch": 5.091171379111367, "grad_norm": 0.9921875, "learning_rate": 0.00027261496513083567, "loss": 5.3825, "mean_token_accuracy": 0.22294479012489318, "num_tokens": 111814006.0, "step": 44115 }, { "entropy": 5.953041124343872, "epoch": 5.091748413156377, "grad_norm": 1.0546875, "learning_rate": 0.00027257370313769864, "loss": 5.2922, "mean_token_accuracy": 0.23157981038093567, "num_tokens": 111825714.0, "step": 44120 }, { "entropy": 6.021838808059693, "epoch": 5.092325447201385, "grad_norm": 1.0234375, "learning_rate": 0.000272532441226169, "loss": 5.5264, "mean_token_accuracy": 0.21223487854003906, "num_tokens": 111838264.0, "step": 44125 }, { "entropy": 6.104084587097168, "epoch": 5.092902481246393, "grad_norm": 1.0234375, "learning_rate": 0.00027249117939763437, "loss": 5.4681, "mean_token_accuracy": 0.2156369060277939, "num_tokens": 111850281.0, "step": 44130 }, { "entropy": 6.043744516372681, "epoch": 5.093479515291402, "grad_norm": 1.0390625, "learning_rate": 0.00027244991765348263, "loss": 5.4612, "mean_token_accuracy": 0.2171190470457077, "num_tokens": 111863512.0, "step": 44135 }, { "entropy": 5.979039287567138, "epoch": 5.094056549336411, "grad_norm": 1.046875, "learning_rate": 0.00027240865599510174, "loss": 5.3363, "mean_token_accuracy": 0.2315061643719673, "num_tokens": 111875673.0, "step": 44140 }, { "entropy": 6.036716365814209, "epoch": 5.09463358338142, "grad_norm": 0.89453125, "learning_rate": 0.00027236739442387944, "loss": 5.4812, "mean_token_accuracy": 0.21775710284709932, "num_tokens": 111889280.0, "step": 44145 }, { "entropy": 6.065521478652954, "epoch": 5.095210617426428, "grad_norm": 1.03125, "learning_rate": 0.00027232613294120344, "loss": 5.4455, "mean_token_accuracy": 0.22125951945781708, "num_tokens": 111900895.0, "step": 44150 }, { "entropy": 6.0401082038879395, "epoch": 5.095787651471436, "grad_norm": 0.9921875, "learning_rate": 0.0002722848715484616, "loss": 5.4652, "mean_token_accuracy": 0.2165570318698883, "num_tokens": 111912874.0, "step": 44155 }, { "entropy": 5.986469411849976, "epoch": 5.096364685516446, "grad_norm": 1.0703125, "learning_rate": 0.00027224361024704184, "loss": 5.3364, "mean_token_accuracy": 0.23090906739234923, "num_tokens": 111925787.0, "step": 44160 }, { "entropy": 6.135260963439942, "epoch": 5.096941719561454, "grad_norm": 1.03125, "learning_rate": 0.0002722023490383318, "loss": 5.5271, "mean_token_accuracy": 0.21275327801704408, "num_tokens": 111937150.0, "step": 44165 }, { "entropy": 6.005226278305054, "epoch": 5.097518753606463, "grad_norm": 0.9921875, "learning_rate": 0.00027216108792371945, "loss": 5.4413, "mean_token_accuracy": 0.2194020479917526, "num_tokens": 111949570.0, "step": 44170 }, { "entropy": 6.039155673980713, "epoch": 5.098095787651472, "grad_norm": 0.91796875, "learning_rate": 0.00027211982690459246, "loss": 5.5213, "mean_token_accuracy": 0.2094275176525116, "num_tokens": 111962220.0, "step": 44175 }, { "entropy": 6.079327917098999, "epoch": 5.09867282169648, "grad_norm": 1.0078125, "learning_rate": 0.00027207856598233867, "loss": 5.4439, "mean_token_accuracy": 0.21620655357837676, "num_tokens": 111975098.0, "step": 44180 }, { "entropy": 6.100356912612915, "epoch": 5.099249855741489, "grad_norm": 1.0625, "learning_rate": 0.00027203730515834584, "loss": 5.4751, "mean_token_accuracy": 0.22408611178398133, "num_tokens": 111987629.0, "step": 44185 }, { "entropy": 6.056990146636963, "epoch": 5.099826889786497, "grad_norm": 1.0234375, "learning_rate": 0.0002719960444340018, "loss": 5.4472, "mean_token_accuracy": 0.21904900521039963, "num_tokens": 112000416.0, "step": 44190 }, { "entropy": 6.029079914093018, "epoch": 5.100403923831506, "grad_norm": 0.9140625, "learning_rate": 0.00027195478381069433, "loss": 5.4277, "mean_token_accuracy": 0.2184651955962181, "num_tokens": 112012531.0, "step": 44195 }, { "entropy": 5.997275733947754, "epoch": 5.100980957876515, "grad_norm": 1.0546875, "learning_rate": 0.00027191352328981115, "loss": 5.3848, "mean_token_accuracy": 0.22130489200353623, "num_tokens": 112023662.0, "step": 44200 }, { "entropy": 6.000210189819336, "epoch": 5.101557991921523, "grad_norm": 1.015625, "learning_rate": 0.00027187226287274006, "loss": 5.4165, "mean_token_accuracy": 0.21802253127098084, "num_tokens": 112036135.0, "step": 44205 }, { "entropy": 6.09615569114685, "epoch": 5.102135025966532, "grad_norm": 1.0, "learning_rate": 0.000271831002560869, "loss": 5.5001, "mean_token_accuracy": 0.21643033772706985, "num_tokens": 112050234.0, "step": 44210 }, { "entropy": 6.010221672058106, "epoch": 5.102712060011541, "grad_norm": 0.96875, "learning_rate": 0.00027178974235558546, "loss": 5.341, "mean_token_accuracy": 0.22517186552286148, "num_tokens": 112063860.0, "step": 44215 }, { "entropy": 5.995897388458252, "epoch": 5.103289094056549, "grad_norm": 1.0703125, "learning_rate": 0.00027174848225827735, "loss": 5.4175, "mean_token_accuracy": 0.21974959522485732, "num_tokens": 112076381.0, "step": 44220 }, { "entropy": 5.970018625259399, "epoch": 5.103866128101558, "grad_norm": 1.0078125, "learning_rate": 0.00027170722227033245, "loss": 5.3887, "mean_token_accuracy": 0.22539203613996506, "num_tokens": 112088828.0, "step": 44225 }, { "entropy": 6.031030511856079, "epoch": 5.104443162146566, "grad_norm": 1.0546875, "learning_rate": 0.0002716659623931386, "loss": 5.4167, "mean_token_accuracy": 0.22228151559829712, "num_tokens": 112102488.0, "step": 44230 }, { "entropy": 6.0417201042175295, "epoch": 5.1050201961915755, "grad_norm": 0.98828125, "learning_rate": 0.00027162470262808325, "loss": 5.3842, "mean_token_accuracy": 0.22782442569732667, "num_tokens": 112115372.0, "step": 44235 }, { "entropy": 6.065902519226074, "epoch": 5.105597230236584, "grad_norm": 0.96875, "learning_rate": 0.00027158344297655446, "loss": 5.4537, "mean_token_accuracy": 0.21784008890390397, "num_tokens": 112128660.0, "step": 44240 }, { "entropy": 6.010843944549561, "epoch": 5.106174264281592, "grad_norm": 1.0546875, "learning_rate": 0.00027154218343993983, "loss": 5.4105, "mean_token_accuracy": 0.2173339068889618, "num_tokens": 112141122.0, "step": 44245 }, { "entropy": 6.104519653320312, "epoch": 5.106751298326602, "grad_norm": 1.046875, "learning_rate": 0.00027150092401962724, "loss": 5.509, "mean_token_accuracy": 0.21041673868894578, "num_tokens": 112152992.0, "step": 44250 }, { "entropy": 5.994868278503418, "epoch": 5.10732833237161, "grad_norm": 0.984375, "learning_rate": 0.0002714596647170042, "loss": 5.3521, "mean_token_accuracy": 0.23054351806640624, "num_tokens": 112166817.0, "step": 44255 }, { "entropy": 6.034130716323853, "epoch": 5.1079053664166185, "grad_norm": 1.0078125, "learning_rate": 0.00027141840553345864, "loss": 5.4247, "mean_token_accuracy": 0.22292573004961014, "num_tokens": 112179934.0, "step": 44260 }, { "entropy": 6.0555338859558105, "epoch": 5.108482400461627, "grad_norm": 0.97265625, "learning_rate": 0.0002713771464703782, "loss": 5.4361, "mean_token_accuracy": 0.2198113650083542, "num_tokens": 112192916.0, "step": 44265 }, { "entropy": 6.013733434677124, "epoch": 5.109059434506636, "grad_norm": 1.1015625, "learning_rate": 0.00027133588752915075, "loss": 5.3808, "mean_token_accuracy": 0.22532901167869568, "num_tokens": 112205618.0, "step": 44270 }, { "entropy": 6.11332950592041, "epoch": 5.109636468551645, "grad_norm": 1.0, "learning_rate": 0.00027129462871116375, "loss": 5.5319, "mean_token_accuracy": 0.207612980902195, "num_tokens": 112217337.0, "step": 44275 }, { "entropy": 6.0811244487762455, "epoch": 5.110213502596653, "grad_norm": 1.078125, "learning_rate": 0.00027125337001780513, "loss": 5.4945, "mean_token_accuracy": 0.21728063374757767, "num_tokens": 112229281.0, "step": 44280 }, { "entropy": 6.079291915893554, "epoch": 5.1107905366416615, "grad_norm": 1.046875, "learning_rate": 0.0002712121114504625, "loss": 5.4784, "mean_token_accuracy": 0.21370008140802382, "num_tokens": 112241762.0, "step": 44285 }, { "entropy": 5.9831983089447025, "epoch": 5.111367570686671, "grad_norm": 0.9609375, "learning_rate": 0.00027117085301052375, "loss": 5.3679, "mean_token_accuracy": 0.22413185387849807, "num_tokens": 112254457.0, "step": 44290 }, { "entropy": 5.995687818527221, "epoch": 5.111944604731679, "grad_norm": 1.0390625, "learning_rate": 0.0002711295946993764, "loss": 5.3478, "mean_token_accuracy": 0.22914140671491623, "num_tokens": 112267961.0, "step": 44295 }, { "entropy": 6.033307790756226, "epoch": 5.112521638776688, "grad_norm": 1.0234375, "learning_rate": 0.0002710883365184082, "loss": 5.4283, "mean_token_accuracy": 0.22290459126234055, "num_tokens": 112281107.0, "step": 44300 }, { "entropy": 6.054268741607666, "epoch": 5.113098672821696, "grad_norm": 1.046875, "learning_rate": 0.0002710470784690068, "loss": 5.4281, "mean_token_accuracy": 0.2260906368494034, "num_tokens": 112294141.0, "step": 44305 }, { "entropy": 5.956476736068725, "epoch": 5.113675706866705, "grad_norm": 0.90234375, "learning_rate": 0.0002710058205525601, "loss": 5.4063, "mean_token_accuracy": 0.22675709128379823, "num_tokens": 112308105.0, "step": 44310 }, { "entropy": 5.948278856277466, "epoch": 5.114252740911714, "grad_norm": 1.0, "learning_rate": 0.00027096456277045546, "loss": 5.3837, "mean_token_accuracy": 0.23046501725912094, "num_tokens": 112321997.0, "step": 44315 }, { "entropy": 6.042380952835083, "epoch": 5.114829774956722, "grad_norm": 0.9609375, "learning_rate": 0.00027092330512408085, "loss": 5.4116, "mean_token_accuracy": 0.22785115242004395, "num_tokens": 112335495.0, "step": 44320 }, { "entropy": 5.898266696929932, "epoch": 5.1154068090017315, "grad_norm": 0.96484375, "learning_rate": 0.0002708820476148238, "loss": 5.2687, "mean_token_accuracy": 0.23632698953151704, "num_tokens": 112350053.0, "step": 44325 }, { "entropy": 6.028501081466675, "epoch": 5.11598384304674, "grad_norm": 1.0234375, "learning_rate": 0.0002708407902440721, "loss": 5.4573, "mean_token_accuracy": 0.22067195177078247, "num_tokens": 112362197.0, "step": 44330 }, { "entropy": 5.971458530426025, "epoch": 5.116560877091748, "grad_norm": 1.0625, "learning_rate": 0.0002707995330132133, "loss": 5.3196, "mean_token_accuracy": 0.23021223694086074, "num_tokens": 112374416.0, "step": 44335 }, { "entropy": 5.887787961959839, "epoch": 5.117137911136757, "grad_norm": 1.203125, "learning_rate": 0.0002707582759236352, "loss": 5.275, "mean_token_accuracy": 0.23801162838935852, "num_tokens": 112387748.0, "step": 44340 }, { "entropy": 6.059664678573609, "epoch": 5.117714945181766, "grad_norm": 1.09375, "learning_rate": 0.00027071701897672526, "loss": 5.3827, "mean_token_accuracy": 0.22549789100885392, "num_tokens": 112398878.0, "step": 44345 }, { "entropy": 6.133424520492554, "epoch": 5.1182919792267745, "grad_norm": 0.94921875, "learning_rate": 0.00027067576217387133, "loss": 5.5131, "mean_token_accuracy": 0.21598127037286757, "num_tokens": 112410877.0, "step": 44350 }, { "entropy": 6.046455717086792, "epoch": 5.118869013271783, "grad_norm": 1.015625, "learning_rate": 0.00027063450551646095, "loss": 5.4378, "mean_token_accuracy": 0.221391561627388, "num_tokens": 112422464.0, "step": 44355 }, { "entropy": 6.0207763671875, "epoch": 5.119446047316791, "grad_norm": 1.0703125, "learning_rate": 0.00027059324900588185, "loss": 5.3938, "mean_token_accuracy": 0.22808483093976975, "num_tokens": 112434517.0, "step": 44360 }, { "entropy": 5.987870836257935, "epoch": 5.120023081361801, "grad_norm": 1.0078125, "learning_rate": 0.0002705519926435216, "loss": 5.4184, "mean_token_accuracy": 0.2249480426311493, "num_tokens": 112446568.0, "step": 44365 }, { "entropy": 6.004012250900269, "epoch": 5.120600115406809, "grad_norm": 0.96484375, "learning_rate": 0.00027051073643076794, "loss": 5.3387, "mean_token_accuracy": 0.2288269206881523, "num_tokens": 112459472.0, "step": 44370 }, { "entropy": 6.024369525909424, "epoch": 5.1211771494518175, "grad_norm": 0.9140625, "learning_rate": 0.00027046948036900837, "loss": 5.4111, "mean_token_accuracy": 0.21618709564208985, "num_tokens": 112472612.0, "step": 44375 }, { "entropy": 6.026199865341186, "epoch": 5.121754183496826, "grad_norm": 1.0390625, "learning_rate": 0.0002704282244596306, "loss": 5.4618, "mean_token_accuracy": 0.22158183157444, "num_tokens": 112485299.0, "step": 44380 }, { "entropy": 6.083711814880371, "epoch": 5.122331217541835, "grad_norm": 0.98828125, "learning_rate": 0.00027038696870402217, "loss": 5.489, "mean_token_accuracy": 0.21162751764059068, "num_tokens": 112497870.0, "step": 44385 }, { "entropy": 5.962233543395996, "epoch": 5.122908251586844, "grad_norm": 0.921875, "learning_rate": 0.0002703457131035709, "loss": 5.2949, "mean_token_accuracy": 0.22972021102905274, "num_tokens": 112510596.0, "step": 44390 }, { "entropy": 5.895632362365722, "epoch": 5.123485285631852, "grad_norm": 0.98828125, "learning_rate": 0.00027030445765966404, "loss": 5.2866, "mean_token_accuracy": 0.22984685003757477, "num_tokens": 112524421.0, "step": 44395 }, { "entropy": 6.001127767562866, "epoch": 5.124062319676861, "grad_norm": 1.0625, "learning_rate": 0.00027026320237368955, "loss": 5.3675, "mean_token_accuracy": 0.2265291541814804, "num_tokens": 112536033.0, "step": 44400 }, { "entropy": 6.075658941268921, "epoch": 5.12463935372187, "grad_norm": 1.046875, "learning_rate": 0.00027022194724703484, "loss": 5.4754, "mean_token_accuracy": 0.2165545180439949, "num_tokens": 112549095.0, "step": 44405 }, { "entropy": 6.017171859741211, "epoch": 5.125216387766878, "grad_norm": 1.078125, "learning_rate": 0.0002701806922810877, "loss": 5.4197, "mean_token_accuracy": 0.2216867044568062, "num_tokens": 112560939.0, "step": 44410 }, { "entropy": 6.074033641815186, "epoch": 5.125793421811887, "grad_norm": 0.9296875, "learning_rate": 0.0002701394374772354, "loss": 5.5165, "mean_token_accuracy": 0.218694768846035, "num_tokens": 112574602.0, "step": 44415 }, { "entropy": 6.1506813049316404, "epoch": 5.126370455856896, "grad_norm": 0.9765625, "learning_rate": 0.0002700981828368659, "loss": 5.4736, "mean_token_accuracy": 0.21896029114723206, "num_tokens": 112587227.0, "step": 44420 }, { "entropy": 6.021144580841065, "epoch": 5.126947489901904, "grad_norm": 1.015625, "learning_rate": 0.00027005692836136637, "loss": 5.372, "mean_token_accuracy": 0.2248900443315506, "num_tokens": 112600624.0, "step": 44425 }, { "entropy": 5.963524866104126, "epoch": 5.127524523946913, "grad_norm": 0.96484375, "learning_rate": 0.0002700156740521248, "loss": 5.3836, "mean_token_accuracy": 0.22393372803926467, "num_tokens": 112612643.0, "step": 44430 }, { "entropy": 5.993826484680175, "epoch": 5.128101557991921, "grad_norm": 1.015625, "learning_rate": 0.0002699744199105284, "loss": 5.448, "mean_token_accuracy": 0.2290252134203911, "num_tokens": 112625282.0, "step": 44435 }, { "entropy": 5.933115530014038, "epoch": 5.12867859203693, "grad_norm": 1.046875, "learning_rate": 0.000269933165937965, "loss": 5.3302, "mean_token_accuracy": 0.219595205783844, "num_tokens": 112636880.0, "step": 44440 }, { "entropy": 6.063958692550659, "epoch": 5.129255626081939, "grad_norm": 0.984375, "learning_rate": 0.000269891912135822, "loss": 5.4424, "mean_token_accuracy": 0.21860643923282624, "num_tokens": 112649381.0, "step": 44445 }, { "entropy": 6.005603313446045, "epoch": 5.129832660126947, "grad_norm": 1.0546875, "learning_rate": 0.000269850658505487, "loss": 5.4176, "mean_token_accuracy": 0.21815809458494187, "num_tokens": 112660787.0, "step": 44450 }, { "entropy": 6.045212125778198, "epoch": 5.130409694171956, "grad_norm": 0.921875, "learning_rate": 0.00026980940504834743, "loss": 5.4979, "mean_token_accuracy": 0.21226125508546828, "num_tokens": 112672777.0, "step": 44455 }, { "entropy": 5.912465381622314, "epoch": 5.130986728216965, "grad_norm": 1.03125, "learning_rate": 0.00026976815176579116, "loss": 5.278, "mean_token_accuracy": 0.23653078079223633, "num_tokens": 112685894.0, "step": 44460 }, { "entropy": 6.073809814453125, "epoch": 5.131563762261973, "grad_norm": 1.0234375, "learning_rate": 0.00026972689865920534, "loss": 5.4485, "mean_token_accuracy": 0.21514449417591094, "num_tokens": 112698627.0, "step": 44465 }, { "entropy": 6.055767965316773, "epoch": 5.132140796306982, "grad_norm": 1.0390625, "learning_rate": 0.0002696856457299777, "loss": 5.4398, "mean_token_accuracy": 0.2137020170688629, "num_tokens": 112709642.0, "step": 44470 }, { "entropy": 5.933177280426025, "epoch": 5.132717830351991, "grad_norm": 1.0, "learning_rate": 0.0002696443929794957, "loss": 5.3004, "mean_token_accuracy": 0.23580056428909302, "num_tokens": 112723488.0, "step": 44475 }, { "entropy": 6.0547089099884035, "epoch": 5.133294864397, "grad_norm": 1.0234375, "learning_rate": 0.000269603140409147, "loss": 5.5068, "mean_token_accuracy": 0.2118276223540306, "num_tokens": 112735320.0, "step": 44480 }, { "entropy": 6.050627851486206, "epoch": 5.133871898442008, "grad_norm": 1.03125, "learning_rate": 0.00026956188802031893, "loss": 5.3951, "mean_token_accuracy": 0.22158414870500565, "num_tokens": 112747921.0, "step": 44485 }, { "entropy": 6.054494428634643, "epoch": 5.134448932487016, "grad_norm": 0.91015625, "learning_rate": 0.00026952063581439905, "loss": 5.4695, "mean_token_accuracy": 0.22435725182294847, "num_tokens": 112760123.0, "step": 44490 }, { "entropy": 6.090556240081787, "epoch": 5.135025966532026, "grad_norm": 1.046875, "learning_rate": 0.00026947938379277484, "loss": 5.499, "mean_token_accuracy": 0.2141335979104042, "num_tokens": 112773407.0, "step": 44495 }, { "entropy": 5.854138326644898, "epoch": 5.135603000577034, "grad_norm": 1.0625, "learning_rate": 0.00026943813195683385, "loss": 5.2329, "mean_token_accuracy": 0.24058865010738373, "num_tokens": 112787594.0, "step": 44500 }, { "entropy": 5.976094913482666, "epoch": 5.1361800346220425, "grad_norm": 0.97265625, "learning_rate": 0.0002693968803079635, "loss": 5.3712, "mean_token_accuracy": 0.2286993995308876, "num_tokens": 112800766.0, "step": 44505 }, { "entropy": 5.990269804000855, "epoch": 5.136757068667051, "grad_norm": 1.078125, "learning_rate": 0.00026935562884755133, "loss": 5.3783, "mean_token_accuracy": 0.22347110360860825, "num_tokens": 112814072.0, "step": 44510 }, { "entropy": 6.128317356109619, "epoch": 5.13733410271206, "grad_norm": 1.0234375, "learning_rate": 0.00026931437757698475, "loss": 5.5226, "mean_token_accuracy": 0.21437612622976304, "num_tokens": 112825821.0, "step": 44515 }, { "entropy": 6.021499729156494, "epoch": 5.137911136757069, "grad_norm": 1.0234375, "learning_rate": 0.00026927312649765127, "loss": 5.3849, "mean_token_accuracy": 0.22333071380853653, "num_tokens": 112837681.0, "step": 44520 }, { "entropy": 6.010371255874634, "epoch": 5.138488170802077, "grad_norm": 1.03125, "learning_rate": 0.00026923187561093834, "loss": 5.4116, "mean_token_accuracy": 0.22103540748357772, "num_tokens": 112851476.0, "step": 44525 }, { "entropy": 6.081694412231445, "epoch": 5.139065204847086, "grad_norm": 0.93359375, "learning_rate": 0.00026919062491823336, "loss": 5.5225, "mean_token_accuracy": 0.21470822393894196, "num_tokens": 112863722.0, "step": 44530 }, { "entropy": 6.045423269271851, "epoch": 5.139642238892095, "grad_norm": 0.9375, "learning_rate": 0.00026914937442092384, "loss": 5.3447, "mean_token_accuracy": 0.22357507795095444, "num_tokens": 112876399.0, "step": 44535 }, { "entropy": 6.038230133056641, "epoch": 5.140219272937103, "grad_norm": 0.9921875, "learning_rate": 0.00026910812412039734, "loss": 5.4592, "mean_token_accuracy": 0.22503597140312195, "num_tokens": 112889765.0, "step": 44540 }, { "entropy": 5.99134407043457, "epoch": 5.140796306982112, "grad_norm": 0.9609375, "learning_rate": 0.000269066874018041, "loss": 5.3788, "mean_token_accuracy": 0.2356344297528267, "num_tokens": 112902136.0, "step": 44545 }, { "entropy": 5.959253358840942, "epoch": 5.141373341027121, "grad_norm": 1.078125, "learning_rate": 0.0002690256241152424, "loss": 5.3359, "mean_token_accuracy": 0.2273300901055336, "num_tokens": 112914324.0, "step": 44550 }, { "entropy": 5.926967668533325, "epoch": 5.141950375072129, "grad_norm": 1.21875, "learning_rate": 0.000268984374413389, "loss": 5.291, "mean_token_accuracy": 0.23139042407274246, "num_tokens": 112927732.0, "step": 44555 }, { "entropy": 6.006013488769531, "epoch": 5.142527409117138, "grad_norm": 0.95703125, "learning_rate": 0.0002689431249138682, "loss": 5.4005, "mean_token_accuracy": 0.22160426378250123, "num_tokens": 112940765.0, "step": 44560 }, { "entropy": 6.005873775482177, "epoch": 5.143104443162146, "grad_norm": 0.97265625, "learning_rate": 0.00026890187561806747, "loss": 5.3421, "mean_token_accuracy": 0.22981645464897155, "num_tokens": 112954162.0, "step": 44565 }, { "entropy": 6.0560156345367435, "epoch": 5.1436814772071555, "grad_norm": 1.0234375, "learning_rate": 0.000268860626527374, "loss": 5.4152, "mean_token_accuracy": 0.22137005925178527, "num_tokens": 112968166.0, "step": 44570 }, { "entropy": 5.985534906387329, "epoch": 5.144258511252164, "grad_norm": 1.0078125, "learning_rate": 0.0002688193776431753, "loss": 5.3472, "mean_token_accuracy": 0.22974993139505387, "num_tokens": 112981246.0, "step": 44575 }, { "entropy": 6.000988245010376, "epoch": 5.144835545297172, "grad_norm": 1.0078125, "learning_rate": 0.0002687781289668588, "loss": 5.3616, "mean_token_accuracy": 0.22493812292814255, "num_tokens": 112992828.0, "step": 44580 }, { "entropy": 6.131247282028198, "epoch": 5.145412579342181, "grad_norm": 1.03125, "learning_rate": 0.0002687368804998119, "loss": 5.5341, "mean_token_accuracy": 0.21079110503196716, "num_tokens": 113005542.0, "step": 44585 }, { "entropy": 5.924923276901245, "epoch": 5.14598961338719, "grad_norm": 0.98046875, "learning_rate": 0.0002686956322434218, "loss": 5.2804, "mean_token_accuracy": 0.2421203076839447, "num_tokens": 113019656.0, "step": 44590 }, { "entropy": 5.983460855484009, "epoch": 5.1465666474321985, "grad_norm": 0.99609375, "learning_rate": 0.00026865438419907604, "loss": 5.3875, "mean_token_accuracy": 0.2214603915810585, "num_tokens": 113032007.0, "step": 44595 }, { "entropy": 6.03508620262146, "epoch": 5.147143681477207, "grad_norm": 1.015625, "learning_rate": 0.00026861313636816195, "loss": 5.4286, "mean_token_accuracy": 0.22106152772903442, "num_tokens": 113044305.0, "step": 44600 }, { "entropy": 6.095164775848389, "epoch": 5.147720715522216, "grad_norm": 1.015625, "learning_rate": 0.00026857188875206684, "loss": 5.5463, "mean_token_accuracy": 0.21622940748929978, "num_tokens": 113056412.0, "step": 44605 }, { "entropy": 6.004116106033325, "epoch": 5.148297749567225, "grad_norm": 1.0078125, "learning_rate": 0.00026853064135217797, "loss": 5.4397, "mean_token_accuracy": 0.21877771764993667, "num_tokens": 113068793.0, "step": 44610 }, { "entropy": 6.031514358520508, "epoch": 5.148874783612233, "grad_norm": 1.0703125, "learning_rate": 0.00026848939416988283, "loss": 5.4002, "mean_token_accuracy": 0.22823102176189422, "num_tokens": 113080869.0, "step": 44615 }, { "entropy": 5.997077178955078, "epoch": 5.1494518176572415, "grad_norm": 0.95703125, "learning_rate": 0.0002684481472065686, "loss": 5.3956, "mean_token_accuracy": 0.22227750718593597, "num_tokens": 113092764.0, "step": 44620 }, { "entropy": 5.971799850463867, "epoch": 5.150028851702251, "grad_norm": 1.2890625, "learning_rate": 0.0002684069004636229, "loss": 5.3942, "mean_token_accuracy": 0.22672227323055266, "num_tokens": 113105157.0, "step": 44625 }, { "entropy": 6.116018390655517, "epoch": 5.150605885747259, "grad_norm": 0.98828125, "learning_rate": 0.0002683656539424326, "loss": 5.4268, "mean_token_accuracy": 0.22036228477954864, "num_tokens": 113118600.0, "step": 44630 }, { "entropy": 6.110688591003418, "epoch": 5.151182919792268, "grad_norm": 1.0078125, "learning_rate": 0.0002683244076443854, "loss": 5.503, "mean_token_accuracy": 0.2101044088602066, "num_tokens": 113131451.0, "step": 44635 }, { "entropy": 6.063616371154785, "epoch": 5.151759953837276, "grad_norm": 1.078125, "learning_rate": 0.0002682831615708683, "loss": 5.4768, "mean_token_accuracy": 0.21707184612751007, "num_tokens": 113143676.0, "step": 44640 }, { "entropy": 6.077631187438965, "epoch": 5.152336987882285, "grad_norm": 1.0, "learning_rate": 0.0002682419157232688, "loss": 5.4585, "mean_token_accuracy": 0.2191653937101364, "num_tokens": 113156355.0, "step": 44645 }, { "entropy": 6.035669660568237, "epoch": 5.152914021927294, "grad_norm": 0.9765625, "learning_rate": 0.00026820067010297405, "loss": 5.435, "mean_token_accuracy": 0.22112427949905394, "num_tokens": 113170094.0, "step": 44650 }, { "entropy": 6.019174003601075, "epoch": 5.153491055972302, "grad_norm": 1.0390625, "learning_rate": 0.00026815942471137145, "loss": 5.3489, "mean_token_accuracy": 0.22874856144189834, "num_tokens": 113182033.0, "step": 44655 }, { "entropy": 6.073612022399902, "epoch": 5.1540680900173115, "grad_norm": 1.0625, "learning_rate": 0.0002681181795498481, "loss": 5.4862, "mean_token_accuracy": 0.21422306448221207, "num_tokens": 113194387.0, "step": 44660 }, { "entropy": 6.139192390441894, "epoch": 5.15464512406232, "grad_norm": 1.015625, "learning_rate": 0.00026807693461979157, "loss": 5.5143, "mean_token_accuracy": 0.20934156328439713, "num_tokens": 113206754.0, "step": 44665 }, { "entropy": 6.045892953872681, "epoch": 5.155222158107328, "grad_norm": 0.9765625, "learning_rate": 0.0002680356899225887, "loss": 5.3808, "mean_token_accuracy": 0.2265696719288826, "num_tokens": 113218705.0, "step": 44670 }, { "entropy": 5.982802391052246, "epoch": 5.155799192152337, "grad_norm": 0.98828125, "learning_rate": 0.00026799444545962705, "loss": 5.4217, "mean_token_accuracy": 0.22309057861566545, "num_tokens": 113231089.0, "step": 44675 }, { "entropy": 6.0090666770935055, "epoch": 5.156376226197346, "grad_norm": 0.97265625, "learning_rate": 0.00026795320123229366, "loss": 5.3326, "mean_token_accuracy": 0.22865242809057235, "num_tokens": 113243080.0, "step": 44680 }, { "entropy": 6.021140623092651, "epoch": 5.1569532602423545, "grad_norm": 1.015625, "learning_rate": 0.0002679119572419759, "loss": 5.3553, "mean_token_accuracy": 0.22254408597946168, "num_tokens": 113256273.0, "step": 44685 }, { "entropy": 5.988370132446289, "epoch": 5.157530294287363, "grad_norm": 1.046875, "learning_rate": 0.00026787071349006095, "loss": 5.4323, "mean_token_accuracy": 0.2243028461933136, "num_tokens": 113268860.0, "step": 44690 }, { "entropy": 5.938693046569824, "epoch": 5.158107328332371, "grad_norm": 0.984375, "learning_rate": 0.000267829469977936, "loss": 5.3825, "mean_token_accuracy": 0.22711580097675324, "num_tokens": 113281216.0, "step": 44695 }, { "entropy": 6.030620813369751, "epoch": 5.158684362377381, "grad_norm": 0.9921875, "learning_rate": 0.00026778822670698823, "loss": 5.4024, "mean_token_accuracy": 0.21856730580329894, "num_tokens": 113294158.0, "step": 44700 }, { "entropy": 6.011349058151245, "epoch": 5.159261396422389, "grad_norm": 1.078125, "learning_rate": 0.00026774698367860496, "loss": 5.4233, "mean_token_accuracy": 0.21693855077028273, "num_tokens": 113307424.0, "step": 44705 }, { "entropy": 5.949773693084717, "epoch": 5.159838430467397, "grad_norm": 0.97265625, "learning_rate": 0.0002677057408941732, "loss": 5.3639, "mean_token_accuracy": 0.23049382269382476, "num_tokens": 113319331.0, "step": 44710 }, { "entropy": 6.027141046524048, "epoch": 5.160415464512406, "grad_norm": 0.93359375, "learning_rate": 0.0002676644983550802, "loss": 5.3948, "mean_token_accuracy": 0.2188984528183937, "num_tokens": 113331803.0, "step": 44715 }, { "entropy": 6.158699655532837, "epoch": 5.160992498557415, "grad_norm": 1.015625, "learning_rate": 0.0002676232560627132, "loss": 5.4916, "mean_token_accuracy": 0.21258330792188646, "num_tokens": 113343211.0, "step": 44720 }, { "entropy": 5.944718551635742, "epoch": 5.161569532602424, "grad_norm": 0.97265625, "learning_rate": 0.00026758201401845945, "loss": 5.3102, "mean_token_accuracy": 0.22187620997428895, "num_tokens": 113356503.0, "step": 44725 }, { "entropy": 6.034282588958741, "epoch": 5.162146566647432, "grad_norm": 1.0390625, "learning_rate": 0.00026754077222370575, "loss": 5.4526, "mean_token_accuracy": 0.21784512400627137, "num_tokens": 113368274.0, "step": 44730 }, { "entropy": 5.991609239578247, "epoch": 5.162723600692441, "grad_norm": 0.9453125, "learning_rate": 0.0002674995306798396, "loss": 5.3517, "mean_token_accuracy": 0.2291390687227249, "num_tokens": 113382432.0, "step": 44735 }, { "entropy": 6.10571928024292, "epoch": 5.16330063473745, "grad_norm": 1.125, "learning_rate": 0.00026745828938824794, "loss": 5.4862, "mean_token_accuracy": 0.20711445659399033, "num_tokens": 113394358.0, "step": 44740 }, { "entropy": 6.102712631225586, "epoch": 5.163877668782458, "grad_norm": 0.9921875, "learning_rate": 0.00026741704835031804, "loss": 5.5124, "mean_token_accuracy": 0.20864539444446564, "num_tokens": 113406785.0, "step": 44745 }, { "entropy": 6.035008192062378, "epoch": 5.1644547028274665, "grad_norm": 1.0625, "learning_rate": 0.0002673758075674369, "loss": 5.3439, "mean_token_accuracy": 0.22151231169700622, "num_tokens": 113419815.0, "step": 44750 }, { "entropy": 5.990100765228272, "epoch": 5.165031736872476, "grad_norm": 1.03125, "learning_rate": 0.00026733456704099173, "loss": 5.4019, "mean_token_accuracy": 0.2248249277472496, "num_tokens": 113431387.0, "step": 44755 }, { "entropy": 6.028573083877563, "epoch": 5.165608770917484, "grad_norm": 0.9921875, "learning_rate": 0.00026729332677236957, "loss": 5.4527, "mean_token_accuracy": 0.21799647212028503, "num_tokens": 113443690.0, "step": 44760 }, { "entropy": 6.070745992660522, "epoch": 5.166185804962493, "grad_norm": 0.9609375, "learning_rate": 0.0002672520867629576, "loss": 5.4423, "mean_token_accuracy": 0.21718568354845047, "num_tokens": 113456695.0, "step": 44765 }, { "entropy": 5.85064058303833, "epoch": 5.166762839007501, "grad_norm": 1.0625, "learning_rate": 0.00026721084701414273, "loss": 5.183, "mean_token_accuracy": 0.2460350960493088, "num_tokens": 113470521.0, "step": 44770 }, { "entropy": 5.933103847503662, "epoch": 5.16733987305251, "grad_norm": 0.984375, "learning_rate": 0.0002671696075273122, "loss": 5.4274, "mean_token_accuracy": 0.22143907099962234, "num_tokens": 113484542.0, "step": 44775 }, { "entropy": 6.104251337051392, "epoch": 5.167916907097519, "grad_norm": 1.0390625, "learning_rate": 0.000267128368303853, "loss": 5.5326, "mean_token_accuracy": 0.21054575890302657, "num_tokens": 113497962.0, "step": 44780 }, { "entropy": 6.085057878494263, "epoch": 5.168493941142527, "grad_norm": 0.984375, "learning_rate": 0.00026708712934515226, "loss": 5.4555, "mean_token_accuracy": 0.22229008078575135, "num_tokens": 113511684.0, "step": 44785 }, { "entropy": 6.15748085975647, "epoch": 5.169070975187536, "grad_norm": 0.9375, "learning_rate": 0.00026704589065259696, "loss": 5.586, "mean_token_accuracy": 0.20541545897722244, "num_tokens": 113525055.0, "step": 44790 }, { "entropy": 6.105576229095459, "epoch": 5.169648009232545, "grad_norm": 1.015625, "learning_rate": 0.0002670046522275743, "loss": 5.521, "mean_token_accuracy": 0.2187458097934723, "num_tokens": 113537940.0, "step": 44795 }, { "entropy": 6.056947994232178, "epoch": 5.170225043277553, "grad_norm": 1.046875, "learning_rate": 0.000266963414071471, "loss": 5.4461, "mean_token_accuracy": 0.21187059432268143, "num_tokens": 113549955.0, "step": 44800 }, { "entropy": 5.942605924606323, "epoch": 5.170802077322562, "grad_norm": 0.93359375, "learning_rate": 0.00026692217618567445, "loss": 5.392, "mean_token_accuracy": 0.21558916121721267, "num_tokens": 113563947.0, "step": 44805 }, { "entropy": 6.0644816875457765, "epoch": 5.171379111367571, "grad_norm": 0.91015625, "learning_rate": 0.00026688093857157137, "loss": 5.4009, "mean_token_accuracy": 0.22395075410604476, "num_tokens": 113577240.0, "step": 44810 }, { "entropy": 6.079711771011352, "epoch": 5.1719561454125795, "grad_norm": 0.98828125, "learning_rate": 0.00026683970123054894, "loss": 5.4251, "mean_token_accuracy": 0.22018396258354186, "num_tokens": 113590575.0, "step": 44815 }, { "entropy": 6.048147583007813, "epoch": 5.172533179457588, "grad_norm": 1.0859375, "learning_rate": 0.0002667984641639941, "loss": 5.5083, "mean_token_accuracy": 0.20902777314186097, "num_tokens": 113603039.0, "step": 44820 }, { "entropy": 6.053910923004151, "epoch": 5.173110213502596, "grad_norm": 1.0, "learning_rate": 0.0002667572273732938, "loss": 5.4217, "mean_token_accuracy": 0.22254975885152817, "num_tokens": 113616736.0, "step": 44825 }, { "entropy": 6.10822491645813, "epoch": 5.173687247547606, "grad_norm": 1.078125, "learning_rate": 0.0002667159908598351, "loss": 5.4066, "mean_token_accuracy": 0.2141740381717682, "num_tokens": 113628177.0, "step": 44830 }, { "entropy": 5.989495897293091, "epoch": 5.174264281592614, "grad_norm": 1.015625, "learning_rate": 0.000266674754625005, "loss": 5.3938, "mean_token_accuracy": 0.22373245358467103, "num_tokens": 113639792.0, "step": 44835 }, { "entropy": 5.931725120544433, "epoch": 5.1748413156376225, "grad_norm": 1.0, "learning_rate": 0.0002666335186701903, "loss": 5.3315, "mean_token_accuracy": 0.2324563205242157, "num_tokens": 113652390.0, "step": 44840 }, { "entropy": 5.983621740341187, "epoch": 5.175418349682631, "grad_norm": 1.0546875, "learning_rate": 0.00026659228299677804, "loss": 5.341, "mean_token_accuracy": 0.22976835668087006, "num_tokens": 113664608.0, "step": 44845 }, { "entropy": 5.988905382156372, "epoch": 5.17599538372764, "grad_norm": 1.328125, "learning_rate": 0.00026655104760615515, "loss": 5.3004, "mean_token_accuracy": 0.23790231049060823, "num_tokens": 113676787.0, "step": 44850 }, { "entropy": 6.0241286277771, "epoch": 5.176572417772649, "grad_norm": 1.0390625, "learning_rate": 0.00026650981249970874, "loss": 5.3972, "mean_token_accuracy": 0.22648463100194932, "num_tokens": 113689022.0, "step": 44855 }, { "entropy": 5.948133754730224, "epoch": 5.177149451817657, "grad_norm": 0.953125, "learning_rate": 0.00026646857767882536, "loss": 5.4182, "mean_token_accuracy": 0.21624010056257248, "num_tokens": 113702744.0, "step": 44860 }, { "entropy": 5.973331546783447, "epoch": 5.1777264858626655, "grad_norm": 1.0546875, "learning_rate": 0.00026642734314489224, "loss": 5.3599, "mean_token_accuracy": 0.23160626888275146, "num_tokens": 113715318.0, "step": 44865 }, { "entropy": 5.9750227451324465, "epoch": 5.178303519907675, "grad_norm": 1.0, "learning_rate": 0.0002663861088992962, "loss": 5.3173, "mean_token_accuracy": 0.2294831618666649, "num_tokens": 113728547.0, "step": 44870 }, { "entropy": 5.96131067276001, "epoch": 5.178880553952683, "grad_norm": 0.97265625, "learning_rate": 0.0002663448749434241, "loss": 5.3801, "mean_token_accuracy": 0.23026080429553986, "num_tokens": 113741188.0, "step": 44875 }, { "entropy": 5.997134399414063, "epoch": 5.179457587997692, "grad_norm": 1.0625, "learning_rate": 0.00026630364127866273, "loss": 5.3637, "mean_token_accuracy": 0.22123554944992066, "num_tokens": 113753789.0, "step": 44880 }, { "entropy": 6.0182726860046385, "epoch": 5.180034622042701, "grad_norm": 0.984375, "learning_rate": 0.00026626240790639916, "loss": 5.4342, "mean_token_accuracy": 0.22021446377038956, "num_tokens": 113767437.0, "step": 44885 }, { "entropy": 6.044240856170655, "epoch": 5.180611656087709, "grad_norm": 1.0390625, "learning_rate": 0.0002662211748280201, "loss": 5.4451, "mean_token_accuracy": 0.22081341296434404, "num_tokens": 113779768.0, "step": 44890 }, { "entropy": 6.061866664886475, "epoch": 5.181188690132718, "grad_norm": 1.0625, "learning_rate": 0.0002661799420449126, "loss": 5.3919, "mean_token_accuracy": 0.22339577227830887, "num_tokens": 113792050.0, "step": 44895 }, { "entropy": 6.027600717544556, "epoch": 5.181765724177726, "grad_norm": 1.21875, "learning_rate": 0.0002661387095584632, "loss": 5.4084, "mean_token_accuracy": 0.22313836514949797, "num_tokens": 113803828.0, "step": 44900 }, { "entropy": 6.0872053623199465, "epoch": 5.1823427582227355, "grad_norm": 1.046875, "learning_rate": 0.000266097477370059, "loss": 5.477, "mean_token_accuracy": 0.22224216163158417, "num_tokens": 113815807.0, "step": 44905 }, { "entropy": 6.047957468032837, "epoch": 5.182919792267744, "grad_norm": 1.0546875, "learning_rate": 0.00026605624548108666, "loss": 5.4785, "mean_token_accuracy": 0.21966487765312195, "num_tokens": 113828608.0, "step": 44910 }, { "entropy": 6.124171400070191, "epoch": 5.183496826312752, "grad_norm": 1.0546875, "learning_rate": 0.00026601501389293317, "loss": 5.5078, "mean_token_accuracy": 0.20982252210378646, "num_tokens": 113839838.0, "step": 44915 }, { "entropy": 6.061716747283936, "epoch": 5.184073860357761, "grad_norm": 1.0390625, "learning_rate": 0.00026597378260698505, "loss": 5.4486, "mean_token_accuracy": 0.22021180093288423, "num_tokens": 113852233.0, "step": 44920 }, { "entropy": 6.138302183151245, "epoch": 5.18465089440277, "grad_norm": 0.921875, "learning_rate": 0.0002659325516246294, "loss": 5.5179, "mean_token_accuracy": 0.2113403469324112, "num_tokens": 113864263.0, "step": 44925 }, { "entropy": 6.086659097671509, "epoch": 5.1852279284477785, "grad_norm": 1.0, "learning_rate": 0.0002658913209472528, "loss": 5.4711, "mean_token_accuracy": 0.21501243710517884, "num_tokens": 113877400.0, "step": 44930 }, { "entropy": 5.988292026519775, "epoch": 5.185804962492787, "grad_norm": 1.046875, "learning_rate": 0.0002658500905762422, "loss": 5.3618, "mean_token_accuracy": 0.22192232459783554, "num_tokens": 113888797.0, "step": 44935 }, { "entropy": 5.968055295944214, "epoch": 5.186381996537795, "grad_norm": 1.0234375, "learning_rate": 0.00026580886051298414, "loss": 5.3519, "mean_token_accuracy": 0.23253681212663652, "num_tokens": 113899931.0, "step": 44940 }, { "entropy": 6.133341598510742, "epoch": 5.186959030582805, "grad_norm": 0.98046875, "learning_rate": 0.0002657676307588656, "loss": 5.47, "mean_token_accuracy": 0.21322982162237167, "num_tokens": 113912482.0, "step": 44945 }, { "entropy": 6.11820912361145, "epoch": 5.187536064627813, "grad_norm": 1.0390625, "learning_rate": 0.00026572640131527315, "loss": 5.5278, "mean_token_accuracy": 0.21246123164892197, "num_tokens": 113925345.0, "step": 44950 }, { "entropy": 6.044606351852417, "epoch": 5.188113098672821, "grad_norm": 0.96875, "learning_rate": 0.0002656851721835935, "loss": 5.4435, "mean_token_accuracy": 0.22434695512056352, "num_tokens": 113938800.0, "step": 44955 }, { "entropy": 6.106613445281982, "epoch": 5.188690132717831, "grad_norm": 1.0234375, "learning_rate": 0.0002656439433652136, "loss": 5.4949, "mean_token_accuracy": 0.21674506962299347, "num_tokens": 113951408.0, "step": 44960 }, { "entropy": 6.141059398651123, "epoch": 5.189267166762839, "grad_norm": 1.0703125, "learning_rate": 0.00026560271486152, "loss": 5.5041, "mean_token_accuracy": 0.21088642328977586, "num_tokens": 113963593.0, "step": 44965 }, { "entropy": 6.05765290260315, "epoch": 5.189844200807848, "grad_norm": 0.953125, "learning_rate": 0.00026556148667389936, "loss": 5.4583, "mean_token_accuracy": 0.21746560037136078, "num_tokens": 113975777.0, "step": 44970 }, { "entropy": 6.006952571868896, "epoch": 5.190421234852856, "grad_norm": 1.0546875, "learning_rate": 0.0002655202588037384, "loss": 5.4302, "mean_token_accuracy": 0.21962960809469223, "num_tokens": 113988840.0, "step": 44975 }, { "entropy": 5.984322500228882, "epoch": 5.190998268897865, "grad_norm": 0.87890625, "learning_rate": 0.00026547903125242393, "loss": 5.3413, "mean_token_accuracy": 0.22475039064884186, "num_tokens": 114001905.0, "step": 44980 }, { "entropy": 5.982054615020752, "epoch": 5.191575302942874, "grad_norm": 1.0546875, "learning_rate": 0.0002654378040213425, "loss": 5.2853, "mean_token_accuracy": 0.23152008652687073, "num_tokens": 114014290.0, "step": 44985 }, { "entropy": 6.027858543395996, "epoch": 5.192152336987882, "grad_norm": 1.0, "learning_rate": 0.00026539657711188074, "loss": 5.4463, "mean_token_accuracy": 0.21847382932901382, "num_tokens": 114026105.0, "step": 44990 }, { "entropy": 5.993068695068359, "epoch": 5.192729371032891, "grad_norm": 1.0859375, "learning_rate": 0.0002653553505254253, "loss": 5.47, "mean_token_accuracy": 0.21498792469501496, "num_tokens": 114038643.0, "step": 44995 }, { "entropy": 5.895764303207398, "epoch": 5.1933064050779, "grad_norm": 0.94140625, "learning_rate": 0.00026531412426336295, "loss": 5.3549, "mean_token_accuracy": 0.22395807206630708, "num_tokens": 114050253.0, "step": 45000 }, { "epoch": 5.1933064050779, "eval_entropy": 5.893099537823123, "eval_loss": 5.628840923309326, "eval_mean_token_accuracy": 0.21704788898367552, "eval_num_tokens": 114050253.0, "eval_runtime": 23.0197, "eval_samples_per_second": 1222.259, "eval_steps_per_second": 152.782, "step": 45000 }, { "entropy": 6.085718441009521, "epoch": 5.193883439122908, "grad_norm": 0.98046875, "learning_rate": 0.00026527289832708014, "loss": 5.4535, "mean_token_accuracy": 0.21541539281606675, "num_tokens": 114062469.0, "step": 45005 }, { "entropy": 5.977302742004395, "epoch": 5.194460473167917, "grad_norm": 1.5078125, "learning_rate": 0.00026523167271796363, "loss": 5.2835, "mean_token_accuracy": 0.22833088040351868, "num_tokens": 114074093.0, "step": 45010 }, { "entropy": 6.058987808227539, "epoch": 5.195037507212925, "grad_norm": 0.99609375, "learning_rate": 0.00026519044743739985, "loss": 5.4956, "mean_token_accuracy": 0.20970632135868073, "num_tokens": 114086419.0, "step": 45015 }, { "entropy": 6.06822772026062, "epoch": 5.195614541257934, "grad_norm": 1.0234375, "learning_rate": 0.00026514922248677564, "loss": 5.4515, "mean_token_accuracy": 0.21829158961772918, "num_tokens": 114098263.0, "step": 45020 }, { "entropy": 6.098209524154663, "epoch": 5.196191575302943, "grad_norm": 1.0390625, "learning_rate": 0.0002651079978674773, "loss": 5.4619, "mean_token_accuracy": 0.21429959088563919, "num_tokens": 114109964.0, "step": 45025 }, { "entropy": 6.108616638183594, "epoch": 5.196768609347951, "grad_norm": 1.03125, "learning_rate": 0.00026506677358089167, "loss": 5.5027, "mean_token_accuracy": 0.2161307543516159, "num_tokens": 114121157.0, "step": 45030 }, { "entropy": 6.059918212890625, "epoch": 5.197345643392961, "grad_norm": 1.015625, "learning_rate": 0.000265025549628405, "loss": 5.3968, "mean_token_accuracy": 0.22774211317300797, "num_tokens": 114133413.0, "step": 45035 }, { "entropy": 6.017913436889648, "epoch": 5.197922677437969, "grad_norm": 0.97265625, "learning_rate": 0.0002649843260114042, "loss": 5.4462, "mean_token_accuracy": 0.2191135674715042, "num_tokens": 114145293.0, "step": 45040 }, { "entropy": 5.992886972427368, "epoch": 5.198499711482977, "grad_norm": 1.0, "learning_rate": 0.00026494310273127554, "loss": 5.3548, "mean_token_accuracy": 0.2265837535262108, "num_tokens": 114157871.0, "step": 45045 }, { "entropy": 6.089379930496216, "epoch": 5.199076745527986, "grad_norm": 1.0078125, "learning_rate": 0.0002649018797894056, "loss": 5.5359, "mean_token_accuracy": 0.2060634970664978, "num_tokens": 114170224.0, "step": 45050 }, { "entropy": 6.121094655990601, "epoch": 5.199653779572995, "grad_norm": 1.015625, "learning_rate": 0.00026486065718718093, "loss": 5.4878, "mean_token_accuracy": 0.21787628680467605, "num_tokens": 114182180.0, "step": 45055 }, { "entropy": 6.116237735748291, "epoch": 5.2002308136180035, "grad_norm": 0.91796875, "learning_rate": 0.0002648194349259881, "loss": 5.5231, "mean_token_accuracy": 0.21248628348112106, "num_tokens": 114196207.0, "step": 45060 }, { "entropy": 6.0709761619567875, "epoch": 5.200807847663012, "grad_norm": 1.0078125, "learning_rate": 0.0002647782130072134, "loss": 5.4465, "mean_token_accuracy": 0.21946109235286712, "num_tokens": 114208413.0, "step": 45065 }, { "entropy": 6.041269111633301, "epoch": 5.20138488170802, "grad_norm": 0.984375, "learning_rate": 0.0002647369914322435, "loss": 5.4219, "mean_token_accuracy": 0.22239066809415817, "num_tokens": 114220419.0, "step": 45070 }, { "entropy": 5.9519435405731205, "epoch": 5.20196191575303, "grad_norm": 1.0390625, "learning_rate": 0.00026469577020246475, "loss": 5.3752, "mean_token_accuracy": 0.22457602620124817, "num_tokens": 114232516.0, "step": 45075 }, { "entropy": 6.177624607086182, "epoch": 5.202538949798038, "grad_norm": 1.046875, "learning_rate": 0.00026465454931926376, "loss": 5.5322, "mean_token_accuracy": 0.2095390170812607, "num_tokens": 114245719.0, "step": 45080 }, { "entropy": 6.0798999786376955, "epoch": 5.2031159838430465, "grad_norm": 1.0234375, "learning_rate": 0.0002646133287840267, "loss": 5.3975, "mean_token_accuracy": 0.21895123571157454, "num_tokens": 114257329.0, "step": 45085 }, { "entropy": 6.051014947891235, "epoch": 5.203693017888055, "grad_norm": 0.98046875, "learning_rate": 0.0002645721085981403, "loss": 5.4513, "mean_token_accuracy": 0.22007804811000825, "num_tokens": 114271343.0, "step": 45090 }, { "entropy": 5.978876256942749, "epoch": 5.204270051933064, "grad_norm": 1.0234375, "learning_rate": 0.00026453088876299074, "loss": 5.3819, "mean_token_accuracy": 0.22488144785165787, "num_tokens": 114284809.0, "step": 45095 }, { "entropy": 6.070902538299561, "epoch": 5.204847085978073, "grad_norm": 1.0703125, "learning_rate": 0.00026448966927996464, "loss": 5.4654, "mean_token_accuracy": 0.21619082391262054, "num_tokens": 114296513.0, "step": 45100 }, { "entropy": 6.078530263900757, "epoch": 5.205424120023081, "grad_norm": 1.0625, "learning_rate": 0.0002644484501504482, "loss": 5.4495, "mean_token_accuracy": 0.21460527032613755, "num_tokens": 114307899.0, "step": 45105 }, { "entropy": 6.129922199249267, "epoch": 5.20600115406809, "grad_norm": 1.1796875, "learning_rate": 0.000264407231375828, "loss": 5.5275, "mean_token_accuracy": 0.2129510149359703, "num_tokens": 114321279.0, "step": 45110 }, { "entropy": 6.056185102462768, "epoch": 5.206578188113099, "grad_norm": 0.99609375, "learning_rate": 0.0002643660129574902, "loss": 5.4078, "mean_token_accuracy": 0.2148822322487831, "num_tokens": 114333125.0, "step": 45115 }, { "entropy": 6.039197063446045, "epoch": 5.207155222158107, "grad_norm": 0.92578125, "learning_rate": 0.00026432479489682135, "loss": 5.4342, "mean_token_accuracy": 0.21803785413503646, "num_tokens": 114345378.0, "step": 45120 }, { "entropy": 6.014359712600708, "epoch": 5.207732256203116, "grad_norm": 1.046875, "learning_rate": 0.0002642835771952077, "loss": 5.4194, "mean_token_accuracy": 0.22385931760072708, "num_tokens": 114359177.0, "step": 45125 }, { "entropy": 6.118495273590088, "epoch": 5.208309290248125, "grad_norm": 1.046875, "learning_rate": 0.0002642423598540356, "loss": 5.4692, "mean_token_accuracy": 0.21097501516342163, "num_tokens": 114372276.0, "step": 45130 }, { "entropy": 5.990920782089233, "epoch": 5.208886324293133, "grad_norm": 1.0, "learning_rate": 0.0002642011428746914, "loss": 5.3842, "mean_token_accuracy": 0.22625180929899216, "num_tokens": 114384309.0, "step": 45135 }, { "entropy": 6.005770683288574, "epoch": 5.209463358338142, "grad_norm": 0.96484375, "learning_rate": 0.00026415992625856136, "loss": 5.4326, "mean_token_accuracy": 0.22662307173013688, "num_tokens": 114396947.0, "step": 45140 }, { "entropy": 6.15014910697937, "epoch": 5.21004039238315, "grad_norm": 1.015625, "learning_rate": 0.0002641187100070319, "loss": 5.5391, "mean_token_accuracy": 0.2087978184223175, "num_tokens": 114408781.0, "step": 45145 }, { "entropy": 6.003570985794068, "epoch": 5.2106174264281595, "grad_norm": 1.015625, "learning_rate": 0.0002640774941214891, "loss": 5.3817, "mean_token_accuracy": 0.23329296112060546, "num_tokens": 114422642.0, "step": 45150 }, { "entropy": 5.985604095458984, "epoch": 5.211194460473168, "grad_norm": 0.94921875, "learning_rate": 0.0002640362786033194, "loss": 5.3926, "mean_token_accuracy": 0.22371471375226976, "num_tokens": 114435965.0, "step": 45155 }, { "entropy": 6.086255407333374, "epoch": 5.211771494518176, "grad_norm": 1.0234375, "learning_rate": 0.0002639950634539091, "loss": 5.4629, "mean_token_accuracy": 0.21352626830339433, "num_tokens": 114447836.0, "step": 45160 }, { "entropy": 6.0727424144744875, "epoch": 5.212348528563186, "grad_norm": 0.98828125, "learning_rate": 0.00026395384867464427, "loss": 5.454, "mean_token_accuracy": 0.2201738879084587, "num_tokens": 114460108.0, "step": 45165 }, { "entropy": 6.070657539367676, "epoch": 5.212925562608194, "grad_norm": 1.078125, "learning_rate": 0.00026391263426691133, "loss": 5.4588, "mean_token_accuracy": 0.21811470091342927, "num_tokens": 114472732.0, "step": 45170 }, { "entropy": 6.054652452468872, "epoch": 5.2135025966532025, "grad_norm": 1.0390625, "learning_rate": 0.00026387142023209635, "loss": 5.4401, "mean_token_accuracy": 0.2167653888463974, "num_tokens": 114485047.0, "step": 45175 }, { "entropy": 6.084554004669189, "epoch": 5.214079630698211, "grad_norm": 1.078125, "learning_rate": 0.00026383020657158574, "loss": 5.4792, "mean_token_accuracy": 0.2225968673825264, "num_tokens": 114497512.0, "step": 45180 }, { "entropy": 6.039117527008057, "epoch": 5.21465666474322, "grad_norm": 0.91796875, "learning_rate": 0.0002637889932867655, "loss": 5.4051, "mean_token_accuracy": 0.22163076102733612, "num_tokens": 114511633.0, "step": 45185 }, { "entropy": 6.075606870651245, "epoch": 5.215233698788229, "grad_norm": 0.9375, "learning_rate": 0.000263747780379022, "loss": 5.376, "mean_token_accuracy": 0.2312086835503578, "num_tokens": 114524717.0, "step": 45190 }, { "entropy": 6.0291016578674315, "epoch": 5.215810732833237, "grad_norm": 0.94921875, "learning_rate": 0.00026370656784974113, "loss": 5.4307, "mean_token_accuracy": 0.2245592087507248, "num_tokens": 114537531.0, "step": 45195 }, { "entropy": 5.994745206832886, "epoch": 5.2163877668782455, "grad_norm": 0.95703125, "learning_rate": 0.00026366535570030943, "loss": 5.4346, "mean_token_accuracy": 0.22165384590625764, "num_tokens": 114551554.0, "step": 45200 }, { "entropy": 6.053288745880127, "epoch": 5.216964800923255, "grad_norm": 1.0234375, "learning_rate": 0.0002636241439321127, "loss": 5.4485, "mean_token_accuracy": 0.22053719460964202, "num_tokens": 114566059.0, "step": 45205 }, { "entropy": 5.948758935928344, "epoch": 5.217541834968263, "grad_norm": 1.015625, "learning_rate": 0.0002635829325465374, "loss": 5.3114, "mean_token_accuracy": 0.23304682224988937, "num_tokens": 114579157.0, "step": 45210 }, { "entropy": 6.009933614730835, "epoch": 5.218118869013272, "grad_norm": 1.109375, "learning_rate": 0.00026354172154496934, "loss": 5.3887, "mean_token_accuracy": 0.2248021423816681, "num_tokens": 114591227.0, "step": 45215 }, { "entropy": 5.981044578552246, "epoch": 5.21869590305828, "grad_norm": 0.984375, "learning_rate": 0.0002635005109287949, "loss": 5.4187, "mean_token_accuracy": 0.21806665062904357, "num_tokens": 114602649.0, "step": 45220 }, { "entropy": 6.039129543304443, "epoch": 5.219272937103289, "grad_norm": 1.0390625, "learning_rate": 0.0002634593006994, "loss": 5.4102, "mean_token_accuracy": 0.22095916867256166, "num_tokens": 114615128.0, "step": 45225 }, { "entropy": 6.0418919086456295, "epoch": 5.219849971148298, "grad_norm": 1.0234375, "learning_rate": 0.00026341809085817083, "loss": 5.4016, "mean_token_accuracy": 0.22474279701709748, "num_tokens": 114627901.0, "step": 45230 }, { "entropy": 6.0987687587738035, "epoch": 5.220427005193306, "grad_norm": 1.0078125, "learning_rate": 0.00026337688140649337, "loss": 5.4566, "mean_token_accuracy": 0.22007470428943635, "num_tokens": 114639580.0, "step": 45235 }, { "entropy": 6.10085015296936, "epoch": 5.2210040392383155, "grad_norm": 0.953125, "learning_rate": 0.0002633356723457538, "loss": 5.5598, "mean_token_accuracy": 0.21457237303256987, "num_tokens": 114651724.0, "step": 45240 }, { "entropy": 6.180582857131958, "epoch": 5.221581073283324, "grad_norm": 1.0078125, "learning_rate": 0.000263294463677338, "loss": 5.5101, "mean_token_accuracy": 0.21046366393566132, "num_tokens": 114663642.0, "step": 45245 }, { "entropy": 6.084267807006836, "epoch": 5.222158107328332, "grad_norm": 1.0546875, "learning_rate": 0.0002632532554026322, "loss": 5.4316, "mean_token_accuracy": 0.2243875578045845, "num_tokens": 114675504.0, "step": 45250 }, { "entropy": 6.0650732040405275, "epoch": 5.222735141373341, "grad_norm": 0.98828125, "learning_rate": 0.0002632120475230222, "loss": 5.4879, "mean_token_accuracy": 0.21120632886886598, "num_tokens": 114687217.0, "step": 45255 }, { "entropy": 6.097438478469849, "epoch": 5.22331217541835, "grad_norm": 1.0390625, "learning_rate": 0.0002631708400398942, "loss": 5.4815, "mean_token_accuracy": 0.22111869156360625, "num_tokens": 114699574.0, "step": 45260 }, { "entropy": 6.0115748882293705, "epoch": 5.223889209463358, "grad_norm": 0.890625, "learning_rate": 0.00026312963295463415, "loss": 5.3801, "mean_token_accuracy": 0.2280147925019264, "num_tokens": 114714023.0, "step": 45265 }, { "entropy": 5.943530797958374, "epoch": 5.224466243508367, "grad_norm": 1.015625, "learning_rate": 0.000263088426268628, "loss": 5.4008, "mean_token_accuracy": 0.22573857009410858, "num_tokens": 114726221.0, "step": 45270 }, { "entropy": 6.060222911834717, "epoch": 5.225043277553375, "grad_norm": 0.96875, "learning_rate": 0.0002630472199832616, "loss": 5.3801, "mean_token_accuracy": 0.2247287943959236, "num_tokens": 114739699.0, "step": 45275 }, { "entropy": 5.961628532409668, "epoch": 5.225620311598385, "grad_norm": 0.90625, "learning_rate": 0.00026300601409992114, "loss": 5.334, "mean_token_accuracy": 0.22202873975038528, "num_tokens": 114752814.0, "step": 45280 }, { "entropy": 6.015863943099975, "epoch": 5.226197345643393, "grad_norm": 0.97265625, "learning_rate": 0.0002629648086199924, "loss": 5.3766, "mean_token_accuracy": 0.221244478225708, "num_tokens": 114766238.0, "step": 45285 }, { "entropy": 6.008779382705688, "epoch": 5.226774379688401, "grad_norm": 1.0390625, "learning_rate": 0.00026292360354486136, "loss": 5.4437, "mean_token_accuracy": 0.21783802956342696, "num_tokens": 114778576.0, "step": 45290 }, { "entropy": 6.04606614112854, "epoch": 5.227351413733411, "grad_norm": 0.94921875, "learning_rate": 0.0002628823988759139, "loss": 5.4661, "mean_token_accuracy": 0.21952925771474838, "num_tokens": 114790657.0, "step": 45295 }, { "entropy": 5.973862743377685, "epoch": 5.227928447778419, "grad_norm": 1.2421875, "learning_rate": 0.00026284119461453595, "loss": 5.4014, "mean_token_accuracy": 0.22855849862098693, "num_tokens": 114805053.0, "step": 45300 }, { "entropy": 6.011316919326783, "epoch": 5.228505481823428, "grad_norm": 1.015625, "learning_rate": 0.00026279999076211333, "loss": 5.3663, "mean_token_accuracy": 0.23429108709096907, "num_tokens": 114818377.0, "step": 45305 }, { "entropy": 5.965339851379395, "epoch": 5.229082515868436, "grad_norm": 0.98046875, "learning_rate": 0.00026275878732003207, "loss": 5.3582, "mean_token_accuracy": 0.22599933594465255, "num_tokens": 114830692.0, "step": 45310 }, { "entropy": 5.955980682373047, "epoch": 5.229659549913445, "grad_norm": 1.09375, "learning_rate": 0.00026271758428967777, "loss": 5.3138, "mean_token_accuracy": 0.23254485428333282, "num_tokens": 114843518.0, "step": 45315 }, { "entropy": 5.981691122055054, "epoch": 5.230236583958454, "grad_norm": 1.0546875, "learning_rate": 0.00026267638167243654, "loss": 5.3846, "mean_token_accuracy": 0.22669032961130142, "num_tokens": 114856226.0, "step": 45320 }, { "entropy": 6.090505123138428, "epoch": 5.230813618003462, "grad_norm": 1.046875, "learning_rate": 0.00026263517946969393, "loss": 5.5583, "mean_token_accuracy": 0.21266670078039168, "num_tokens": 114867775.0, "step": 45325 }, { "entropy": 6.058550119400024, "epoch": 5.2313906520484705, "grad_norm": 1.0546875, "learning_rate": 0.00026259397768283615, "loss": 5.3965, "mean_token_accuracy": 0.22703013718128204, "num_tokens": 114879156.0, "step": 45330 }, { "entropy": 6.0846270561218265, "epoch": 5.23196768609348, "grad_norm": 1.0625, "learning_rate": 0.0002625527763132486, "loss": 5.4585, "mean_token_accuracy": 0.22403827160596848, "num_tokens": 114891144.0, "step": 45335 }, { "entropy": 5.919776439666748, "epoch": 5.232544720138488, "grad_norm": 0.94140625, "learning_rate": 0.00026251157536231735, "loss": 5.2769, "mean_token_accuracy": 0.2378045827150345, "num_tokens": 114905460.0, "step": 45340 }, { "entropy": 6.04665732383728, "epoch": 5.233121754183497, "grad_norm": 0.9765625, "learning_rate": 0.0002624703748314279, "loss": 5.4511, "mean_token_accuracy": 0.22117620706558228, "num_tokens": 114918261.0, "step": 45345 }, { "entropy": 6.071588945388794, "epoch": 5.233698788228505, "grad_norm": 0.96484375, "learning_rate": 0.0002624291747219663, "loss": 5.4599, "mean_token_accuracy": 0.2253224402666092, "num_tokens": 114930339.0, "step": 45350 }, { "entropy": 6.014683437347412, "epoch": 5.234275822273514, "grad_norm": 1.0078125, "learning_rate": 0.00026238797503531816, "loss": 5.4018, "mean_token_accuracy": 0.22180467396974562, "num_tokens": 114942985.0, "step": 45355 }, { "entropy": 6.12723388671875, "epoch": 5.234852856318523, "grad_norm": 0.94140625, "learning_rate": 0.0002623467757728691, "loss": 5.4964, "mean_token_accuracy": 0.21537711322307587, "num_tokens": 114955270.0, "step": 45360 }, { "entropy": 6.043020296096802, "epoch": 5.235429890363531, "grad_norm": 1.03125, "learning_rate": 0.00026230557693600505, "loss": 5.4814, "mean_token_accuracy": 0.217724771797657, "num_tokens": 114967585.0, "step": 45365 }, { "entropy": 6.023756313323974, "epoch": 5.2360069244085405, "grad_norm": 0.984375, "learning_rate": 0.00026226437852611156, "loss": 5.4766, "mean_token_accuracy": 0.2226881802082062, "num_tokens": 114980714.0, "step": 45370 }, { "entropy": 6.091431999206543, "epoch": 5.236583958453549, "grad_norm": 1.046875, "learning_rate": 0.0002622231805445745, "loss": 5.4456, "mean_token_accuracy": 0.21698398888111115, "num_tokens": 114992453.0, "step": 45375 }, { "entropy": 6.051722526550293, "epoch": 5.237160992498557, "grad_norm": 1.1171875, "learning_rate": 0.0002621819829927793, "loss": 5.3861, "mean_token_accuracy": 0.22146398574113846, "num_tokens": 115004147.0, "step": 45380 }, { "entropy": 5.998739957809448, "epoch": 5.237738026543566, "grad_norm": 0.9921875, "learning_rate": 0.0002621407858721117, "loss": 5.4289, "mean_token_accuracy": 0.22249038517475128, "num_tokens": 115017131.0, "step": 45385 }, { "entropy": 5.991521787643433, "epoch": 5.238315060588575, "grad_norm": 0.99609375, "learning_rate": 0.00026209958918395744, "loss": 5.4288, "mean_token_accuracy": 0.2191956713795662, "num_tokens": 115030872.0, "step": 45390 }, { "entropy": 6.0833639144897464, "epoch": 5.2388920946335835, "grad_norm": 1.03125, "learning_rate": 0.0002620583929297022, "loss": 5.5547, "mean_token_accuracy": 0.20820025205612183, "num_tokens": 115044181.0, "step": 45395 }, { "entropy": 5.99387035369873, "epoch": 5.239469128678592, "grad_norm": 1.1484375, "learning_rate": 0.0002620171971107313, "loss": 5.2937, "mean_token_accuracy": 0.23721488416194916, "num_tokens": 115057066.0, "step": 45400 }, { "entropy": 6.179176092147827, "epoch": 5.2400461627236, "grad_norm": 0.98046875, "learning_rate": 0.00026197600172843063, "loss": 5.6402, "mean_token_accuracy": 0.204765285551548, "num_tokens": 115070292.0, "step": 45405 }, { "entropy": 6.0735204219818115, "epoch": 5.24062319676861, "grad_norm": 1.078125, "learning_rate": 0.0002619348067841856, "loss": 5.49, "mean_token_accuracy": 0.21091417372226715, "num_tokens": 115083101.0, "step": 45410 }, { "entropy": 6.049989318847656, "epoch": 5.241200230813618, "grad_norm": 1.0703125, "learning_rate": 0.00026189361227938195, "loss": 5.4554, "mean_token_accuracy": 0.2197912648320198, "num_tokens": 115095615.0, "step": 45415 }, { "entropy": 5.99624195098877, "epoch": 5.2417772648586265, "grad_norm": 1.09375, "learning_rate": 0.00026185241821540504, "loss": 5.4355, "mean_token_accuracy": 0.2310975581407547, "num_tokens": 115108347.0, "step": 45420 }, { "entropy": 6.043016529083252, "epoch": 5.242354298903635, "grad_norm": 0.99609375, "learning_rate": 0.0002618112245936406, "loss": 5.404, "mean_token_accuracy": 0.22040394991636275, "num_tokens": 115120022.0, "step": 45425 }, { "entropy": 5.9708325386047365, "epoch": 5.242931332948644, "grad_norm": 1.015625, "learning_rate": 0.00026177003141547394, "loss": 5.433, "mean_token_accuracy": 0.21992162764072418, "num_tokens": 115133471.0, "step": 45430 }, { "entropy": 6.0564188957214355, "epoch": 5.243508366993653, "grad_norm": 1.03125, "learning_rate": 0.00026172883868229085, "loss": 5.4263, "mean_token_accuracy": 0.22573087513446807, "num_tokens": 115145027.0, "step": 45435 }, { "entropy": 6.149946308135986, "epoch": 5.244085401038661, "grad_norm": 1.0703125, "learning_rate": 0.0002616876463954766, "loss": 5.5686, "mean_token_accuracy": 0.21413047313690187, "num_tokens": 115156420.0, "step": 45440 }, { "entropy": 6.017841339111328, "epoch": 5.24466243508367, "grad_norm": 0.9765625, "learning_rate": 0.00026164645455641685, "loss": 5.4071, "mean_token_accuracy": 0.22935985326766967, "num_tokens": 115169888.0, "step": 45445 }, { "entropy": 6.000409507751465, "epoch": 5.245239469128679, "grad_norm": 0.96484375, "learning_rate": 0.0002616052631664968, "loss": 5.3867, "mean_token_accuracy": 0.22754311710596084, "num_tokens": 115182899.0, "step": 45450 }, { "entropy": 6.005731439590454, "epoch": 5.245816503173687, "grad_norm": 0.98046875, "learning_rate": 0.0002615640722271023, "loss": 5.4608, "mean_token_accuracy": 0.22232909202575685, "num_tokens": 115196270.0, "step": 45455 }, { "entropy": 5.947475147247315, "epoch": 5.246393537218696, "grad_norm": 1.0546875, "learning_rate": 0.0002615228817396183, "loss": 5.315, "mean_token_accuracy": 0.23969982117414473, "num_tokens": 115208846.0, "step": 45460 }, { "entropy": 6.056642198562622, "epoch": 5.246970571263705, "grad_norm": 1.1484375, "learning_rate": 0.0002614816917054306, "loss": 5.4162, "mean_token_accuracy": 0.22341176569461824, "num_tokens": 115221442.0, "step": 45465 }, { "entropy": 6.0510334968566895, "epoch": 5.247547605308713, "grad_norm": 0.97265625, "learning_rate": 0.0002614405021259245, "loss": 5.4568, "mean_token_accuracy": 0.21845282912254332, "num_tokens": 115233965.0, "step": 45470 }, { "entropy": 6.004269647598266, "epoch": 5.248124639353722, "grad_norm": 0.94921875, "learning_rate": 0.00026139931300248536, "loss": 5.4203, "mean_token_accuracy": 0.21801410913467406, "num_tokens": 115246907.0, "step": 45475 }, { "entropy": 6.0250917911529545, "epoch": 5.24870167339873, "grad_norm": 0.9765625, "learning_rate": 0.00026135812433649856, "loss": 5.4083, "mean_token_accuracy": 0.21793183833360671, "num_tokens": 115260161.0, "step": 45480 }, { "entropy": 6.0069538116455075, "epoch": 5.2492787074437395, "grad_norm": 0.96484375, "learning_rate": 0.0002613169361293495, "loss": 5.3858, "mean_token_accuracy": 0.23049605786800384, "num_tokens": 115274029.0, "step": 45485 }, { "entropy": 5.968023443222046, "epoch": 5.249855741488748, "grad_norm": 0.9609375, "learning_rate": 0.0002612757483824234, "loss": 5.36, "mean_token_accuracy": 0.22484962195158004, "num_tokens": 115286899.0, "step": 45490 }, { "entropy": 6.05524377822876, "epoch": 5.250432775533756, "grad_norm": 1.046875, "learning_rate": 0.00026123456109710584, "loss": 5.4819, "mean_token_accuracy": 0.21921216994524, "num_tokens": 115299435.0, "step": 45495 }, { "entropy": 5.948203039169312, "epoch": 5.251009809578765, "grad_norm": 1.015625, "learning_rate": 0.0002611933742747819, "loss": 5.2605, "mean_token_accuracy": 0.23185878694057466, "num_tokens": 115311916.0, "step": 45500 }, { "entropy": 5.944322347640991, "epoch": 5.251586843623774, "grad_norm": 0.99609375, "learning_rate": 0.00026115218791683694, "loss": 5.41, "mean_token_accuracy": 0.22838055789470674, "num_tokens": 115324772.0, "step": 45505 }, { "entropy": 6.032688188552856, "epoch": 5.2521638776687825, "grad_norm": 1.0859375, "learning_rate": 0.0002611110020246563, "loss": 5.4389, "mean_token_accuracy": 0.21994860470294952, "num_tokens": 115337056.0, "step": 45510 }, { "entropy": 5.986717987060547, "epoch": 5.252740911713791, "grad_norm": 0.96875, "learning_rate": 0.0002610698165996252, "loss": 5.3927, "mean_token_accuracy": 0.2265930250287056, "num_tokens": 115349137.0, "step": 45515 }, { "entropy": 6.063390827178955, "epoch": 5.2533179457588, "grad_norm": 1.0234375, "learning_rate": 0.00026102863164312887, "loss": 5.4233, "mean_token_accuracy": 0.2270804077386856, "num_tokens": 115362738.0, "step": 45520 }, { "entropy": 6.02864031791687, "epoch": 5.253894979803809, "grad_norm": 0.9921875, "learning_rate": 0.0002609874471565526, "loss": 5.4479, "mean_token_accuracy": 0.2173398479819298, "num_tokens": 115374894.0, "step": 45525 }, { "entropy": 6.051260948181152, "epoch": 5.254472013848817, "grad_norm": 1.0078125, "learning_rate": 0.0002609462631412815, "loss": 5.3779, "mean_token_accuracy": 0.22599852234125137, "num_tokens": 115387528.0, "step": 45530 }, { "entropy": 5.980574750900269, "epoch": 5.255049047893825, "grad_norm": 1.046875, "learning_rate": 0.000260905079598701, "loss": 5.3579, "mean_token_accuracy": 0.22937343865633011, "num_tokens": 115401002.0, "step": 45535 }, { "entropy": 6.044390439987183, "epoch": 5.255626081938835, "grad_norm": 1.09375, "learning_rate": 0.00026086389653019607, "loss": 5.457, "mean_token_accuracy": 0.21695838868618011, "num_tokens": 115411941.0, "step": 45540 }, { "entropy": 6.036340951919556, "epoch": 5.256203115983843, "grad_norm": 1.0078125, "learning_rate": 0.000260822713937152, "loss": 5.3961, "mean_token_accuracy": 0.22130239605903626, "num_tokens": 115424426.0, "step": 45545 }, { "entropy": 6.075245380401611, "epoch": 5.256780150028852, "grad_norm": 0.93359375, "learning_rate": 0.00026078153182095383, "loss": 5.4382, "mean_token_accuracy": 0.21842439323663712, "num_tokens": 115437329.0, "step": 45550 }, { "entropy": 6.058662080764771, "epoch": 5.25735718407386, "grad_norm": 1.140625, "learning_rate": 0.00026074035018298686, "loss": 5.466, "mean_token_accuracy": 0.2246864840388298, "num_tokens": 115449879.0, "step": 45555 }, { "entropy": 6.060898113250732, "epoch": 5.257934218118869, "grad_norm": 1.078125, "learning_rate": 0.000260699169024636, "loss": 5.4304, "mean_token_accuracy": 0.22123443335294724, "num_tokens": 115461854.0, "step": 45560 }, { "entropy": 6.010336875915527, "epoch": 5.258511252163878, "grad_norm": 0.9921875, "learning_rate": 0.00026065798834728674, "loss": 5.4342, "mean_token_accuracy": 0.2219907432794571, "num_tokens": 115475899.0, "step": 45565 }, { "entropy": 5.982123565673828, "epoch": 5.259088286208886, "grad_norm": 1.0234375, "learning_rate": 0.00026061680815232357, "loss": 5.3028, "mean_token_accuracy": 0.2310809910297394, "num_tokens": 115489532.0, "step": 45570 }, { "entropy": 6.12529673576355, "epoch": 5.2596653202538945, "grad_norm": 0.99609375, "learning_rate": 0.0002605756284411322, "loss": 5.5408, "mean_token_accuracy": 0.20360140949487687, "num_tokens": 115502188.0, "step": 45575 }, { "entropy": 6.005586051940918, "epoch": 5.260242354298904, "grad_norm": 0.97265625, "learning_rate": 0.00026053444921509723, "loss": 5.4329, "mean_token_accuracy": 0.22544600069522858, "num_tokens": 115514346.0, "step": 45580 }, { "entropy": 6.1189343452453615, "epoch": 5.260819388343912, "grad_norm": 0.98046875, "learning_rate": 0.000260493270475604, "loss": 5.4924, "mean_token_accuracy": 0.214700448513031, "num_tokens": 115525855.0, "step": 45585 }, { "entropy": 6.070477294921875, "epoch": 5.261396422388921, "grad_norm": 0.984375, "learning_rate": 0.0002604520922240373, "loss": 5.4442, "mean_token_accuracy": 0.22412650287151337, "num_tokens": 115538115.0, "step": 45590 }, { "entropy": 6.091808462142945, "epoch": 5.26197345643393, "grad_norm": 1.15625, "learning_rate": 0.0002604109144617823, "loss": 5.5031, "mean_token_accuracy": 0.21764739751815795, "num_tokens": 115550827.0, "step": 45595 }, { "entropy": 6.004638004302978, "epoch": 5.262550490478938, "grad_norm": 1.2421875, "learning_rate": 0.000260369737190224, "loss": 5.3885, "mean_token_accuracy": 0.22925753891468048, "num_tokens": 115563790.0, "step": 45600 }, { "entropy": 6.1441141128540036, "epoch": 5.263127524523947, "grad_norm": 1.03125, "learning_rate": 0.0002603285604107473, "loss": 5.632, "mean_token_accuracy": 0.20858521163463592, "num_tokens": 115577194.0, "step": 45605 }, { "entropy": 6.0799883842468265, "epoch": 5.263704558568955, "grad_norm": 1.0546875, "learning_rate": 0.0002602873841247371, "loss": 5.4538, "mean_token_accuracy": 0.22601577788591384, "num_tokens": 115590385.0, "step": 45610 }, { "entropy": 6.084481906890869, "epoch": 5.2642815926139646, "grad_norm": 1.078125, "learning_rate": 0.0002602462083335785, "loss": 5.4373, "mean_token_accuracy": 0.2222571238875389, "num_tokens": 115602809.0, "step": 45615 }, { "entropy": 5.991938924789428, "epoch": 5.264858626658973, "grad_norm": 0.96875, "learning_rate": 0.00026020503303865634, "loss": 5.4214, "mean_token_accuracy": 0.2216294676065445, "num_tokens": 115616688.0, "step": 45620 }, { "entropy": 6.006976461410522, "epoch": 5.265435660703981, "grad_norm": 1.0546875, "learning_rate": 0.0002601638582413556, "loss": 5.4335, "mean_token_accuracy": 0.2221789687871933, "num_tokens": 115629608.0, "step": 45625 }, { "entropy": 6.02233920097351, "epoch": 5.26601269474899, "grad_norm": 1.0546875, "learning_rate": 0.000260122683943061, "loss": 5.3138, "mean_token_accuracy": 0.2278474673628807, "num_tokens": 115641478.0, "step": 45630 }, { "entropy": 6.138080692291259, "epoch": 5.266589728793999, "grad_norm": 1.046875, "learning_rate": 0.0002600815101451576, "loss": 5.5255, "mean_token_accuracy": 0.20745670199394226, "num_tokens": 115653490.0, "step": 45635 }, { "entropy": 6.032846069335937, "epoch": 5.2671667628390075, "grad_norm": 1.1015625, "learning_rate": 0.0002600403368490302, "loss": 5.4494, "mean_token_accuracy": 0.22217857986688613, "num_tokens": 115665547.0, "step": 45640 }, { "entropy": 6.134988594055176, "epoch": 5.267743796884016, "grad_norm": 1.078125, "learning_rate": 0.00025999916405606367, "loss": 5.4888, "mean_token_accuracy": 0.21783046126365663, "num_tokens": 115679102.0, "step": 45645 }, { "entropy": 6.056014633178711, "epoch": 5.268320830929024, "grad_norm": 1.0625, "learning_rate": 0.00025995799176764273, "loss": 5.4184, "mean_token_accuracy": 0.22798133194446563, "num_tokens": 115693469.0, "step": 45650 }, { "entropy": 6.077406549453736, "epoch": 5.268897864974034, "grad_norm": 0.98828125, "learning_rate": 0.0002599168199851523, "loss": 5.5079, "mean_token_accuracy": 0.21468451917171477, "num_tokens": 115706327.0, "step": 45655 }, { "entropy": 5.939985179901123, "epoch": 5.269474899019042, "grad_norm": 1.1171875, "learning_rate": 0.0002598756487099771, "loss": 5.3166, "mean_token_accuracy": 0.23756767064332962, "num_tokens": 115719129.0, "step": 45660 }, { "entropy": 6.025173759460449, "epoch": 5.2700519330640505, "grad_norm": 1.0390625, "learning_rate": 0.00025983447794350207, "loss": 5.418, "mean_token_accuracy": 0.22448321729898452, "num_tokens": 115730117.0, "step": 45665 }, { "entropy": 6.073547601699829, "epoch": 5.27062896710906, "grad_norm": 0.86328125, "learning_rate": 0.00025979330768711165, "loss": 5.4996, "mean_token_accuracy": 0.21458194106817247, "num_tokens": 115743743.0, "step": 45670 }, { "entropy": 6.089326000213623, "epoch": 5.271206001154068, "grad_norm": 1.1171875, "learning_rate": 0.00025975213794219096, "loss": 5.4931, "mean_token_accuracy": 0.2180785819888115, "num_tokens": 115756290.0, "step": 45675 }, { "entropy": 6.06765456199646, "epoch": 5.271783035199077, "grad_norm": 0.94140625, "learning_rate": 0.0002597109687101244, "loss": 5.4337, "mean_token_accuracy": 0.22488387078046798, "num_tokens": 115769489.0, "step": 45680 }, { "entropy": 6.073848676681519, "epoch": 5.272360069244085, "grad_norm": 1.0390625, "learning_rate": 0.0002596697999922969, "loss": 5.4384, "mean_token_accuracy": 0.21921130418777465, "num_tokens": 115782557.0, "step": 45685 }, { "entropy": 5.98873119354248, "epoch": 5.272937103289094, "grad_norm": 0.90625, "learning_rate": 0.000259628631790093, "loss": 5.3804, "mean_token_accuracy": 0.23462460339069366, "num_tokens": 115795706.0, "step": 45690 }, { "entropy": 6.069477844238281, "epoch": 5.273514137334103, "grad_norm": 0.98828125, "learning_rate": 0.00025958746410489745, "loss": 5.4902, "mean_token_accuracy": 0.21369931250810623, "num_tokens": 115808736.0, "step": 45695 }, { "entropy": 6.03880877494812, "epoch": 5.274091171379111, "grad_norm": 1.0390625, "learning_rate": 0.0002595462969380949, "loss": 5.4314, "mean_token_accuracy": 0.22609738856554032, "num_tokens": 115820862.0, "step": 45700 }, { "entropy": 6.087772083282471, "epoch": 5.27466820542412, "grad_norm": 1.015625, "learning_rate": 0.00025950513029106997, "loss": 5.4789, "mean_token_accuracy": 0.21456007212400435, "num_tokens": 115833334.0, "step": 45705 }, { "entropy": 5.966684484481812, "epoch": 5.275245239469129, "grad_norm": 1.0859375, "learning_rate": 0.0002594639641652073, "loss": 5.3186, "mean_token_accuracy": 0.22581247240304947, "num_tokens": 115846965.0, "step": 45710 }, { "entropy": 5.989447069168091, "epoch": 5.275822273514137, "grad_norm": 1.046875, "learning_rate": 0.0002594227985618915, "loss": 5.4214, "mean_token_accuracy": 0.22116950750350953, "num_tokens": 115858381.0, "step": 45715 }, { "entropy": 5.9788047790527346, "epoch": 5.276399307559146, "grad_norm": 0.98828125, "learning_rate": 0.00025938163348250705, "loss": 5.3615, "mean_token_accuracy": 0.22843966335058213, "num_tokens": 115870523.0, "step": 45720 }, { "entropy": 6.080673551559448, "epoch": 5.276976341604154, "grad_norm": 1.0859375, "learning_rate": 0.0002593404689284387, "loss": 5.4317, "mean_token_accuracy": 0.22181939333677292, "num_tokens": 115882938.0, "step": 45725 }, { "entropy": 6.080872821807861, "epoch": 5.2775533756491635, "grad_norm": 0.9296875, "learning_rate": 0.00025929930490107086, "loss": 5.42, "mean_token_accuracy": 0.21461830288171768, "num_tokens": 115895364.0, "step": 45730 }, { "entropy": 5.9829041957855225, "epoch": 5.278130409694172, "grad_norm": 0.99609375, "learning_rate": 0.0002592581414017881, "loss": 5.3655, "mean_token_accuracy": 0.22573001086711883, "num_tokens": 115908995.0, "step": 45735 }, { "entropy": 5.987601947784424, "epoch": 5.27870744373918, "grad_norm": 1.0625, "learning_rate": 0.0002592169784319749, "loss": 5.3298, "mean_token_accuracy": 0.22656229734420777, "num_tokens": 115921910.0, "step": 45740 }, { "entropy": 6.074593162536621, "epoch": 5.27928447778419, "grad_norm": 1.0234375, "learning_rate": 0.00025917581599301583, "loss": 5.4642, "mean_token_accuracy": 0.22030116319656373, "num_tokens": 115936895.0, "step": 45745 }, { "entropy": 6.057330369949341, "epoch": 5.279861511829198, "grad_norm": 1.0390625, "learning_rate": 0.0002591346540862953, "loss": 5.3785, "mean_token_accuracy": 0.23026176244020463, "num_tokens": 115948541.0, "step": 45750 }, { "entropy": 6.049112319946289, "epoch": 5.2804385458742065, "grad_norm": 1.0234375, "learning_rate": 0.0002590934927131978, "loss": 5.4991, "mean_token_accuracy": 0.22063111662864685, "num_tokens": 115961635.0, "step": 45755 }, { "entropy": 5.915291213989258, "epoch": 5.281015579919215, "grad_norm": 0.98828125, "learning_rate": 0.0002590523318751078, "loss": 5.3373, "mean_token_accuracy": 0.22988480627536773, "num_tokens": 115974022.0, "step": 45760 }, { "entropy": 6.0499063491821286, "epoch": 5.281592613964224, "grad_norm": 1.0, "learning_rate": 0.0002590111715734096, "loss": 5.4767, "mean_token_accuracy": 0.2208188593387604, "num_tokens": 115987068.0, "step": 45765 }, { "entropy": 5.997831678390503, "epoch": 5.282169648009233, "grad_norm": 0.953125, "learning_rate": 0.00025897001180948787, "loss": 5.3338, "mean_token_accuracy": 0.2302880734205246, "num_tokens": 116000621.0, "step": 45770 }, { "entropy": 6.053753232955932, "epoch": 5.282746682054241, "grad_norm": 1.046875, "learning_rate": 0.0002589288525847267, "loss": 5.4714, "mean_token_accuracy": 0.21738363355398177, "num_tokens": 116013321.0, "step": 45775 }, { "entropy": 6.013989210128784, "epoch": 5.2833237160992494, "grad_norm": 1.0234375, "learning_rate": 0.00025888769390051064, "loss": 5.427, "mean_token_accuracy": 0.21772615909576415, "num_tokens": 116025458.0, "step": 45780 }, { "entropy": 5.96270751953125, "epoch": 5.283900750144259, "grad_norm": 0.9375, "learning_rate": 0.000258846535758224, "loss": 5.3868, "mean_token_accuracy": 0.22570870220661163, "num_tokens": 116039574.0, "step": 45785 }, { "entropy": 6.051803112030029, "epoch": 5.284477784189267, "grad_norm": 1.0078125, "learning_rate": 0.0002588053781592511, "loss": 5.3861, "mean_token_accuracy": 0.2221839427947998, "num_tokens": 116052369.0, "step": 45790 }, { "entropy": 6.016679477691651, "epoch": 5.285054818234276, "grad_norm": 0.9921875, "learning_rate": 0.0002587642211049762, "loss": 5.4829, "mean_token_accuracy": 0.21720351427793502, "num_tokens": 116064688.0, "step": 45795 }, { "entropy": 5.956248140335083, "epoch": 5.285631852279285, "grad_norm": 0.98046875, "learning_rate": 0.00025872306459678374, "loss": 5.2938, "mean_token_accuracy": 0.23636026084423065, "num_tokens": 116079254.0, "step": 45800 }, { "entropy": 6.03924789428711, "epoch": 5.286208886324293, "grad_norm": 0.984375, "learning_rate": 0.00025868190863605786, "loss": 5.3819, "mean_token_accuracy": 0.22168154418468475, "num_tokens": 116091845.0, "step": 45805 }, { "entropy": 5.926907062530518, "epoch": 5.286785920369302, "grad_norm": 1.0234375, "learning_rate": 0.000258640753224183, "loss": 5.2364, "mean_token_accuracy": 0.2368401825428009, "num_tokens": 116104111.0, "step": 45810 }, { "entropy": 5.934835004806518, "epoch": 5.28736295441431, "grad_norm": 0.99609375, "learning_rate": 0.00025859959836254314, "loss": 5.3555, "mean_token_accuracy": 0.22716329991817474, "num_tokens": 116116894.0, "step": 45815 }, { "entropy": 6.023984956741333, "epoch": 5.2879399884593195, "grad_norm": 1.0703125, "learning_rate": 0.0002585584440525227, "loss": 5.4313, "mean_token_accuracy": 0.22012444138526915, "num_tokens": 116129045.0, "step": 45820 }, { "entropy": 6.0685387134552, "epoch": 5.288517022504328, "grad_norm": 1.0390625, "learning_rate": 0.0002585172902955058, "loss": 5.4479, "mean_token_accuracy": 0.21874248683452607, "num_tokens": 116140569.0, "step": 45825 }, { "entropy": 6.094815349578857, "epoch": 5.289094056549336, "grad_norm": 0.97265625, "learning_rate": 0.0002584761370928767, "loss": 5.5058, "mean_token_accuracy": 0.21773842275142669, "num_tokens": 116152967.0, "step": 45830 }, { "entropy": 5.977795171737671, "epoch": 5.289671090594345, "grad_norm": 1.0234375, "learning_rate": 0.0002584349844460194, "loss": 5.4079, "mean_token_accuracy": 0.22074140161275863, "num_tokens": 116164730.0, "step": 45835 }, { "entropy": 5.9802539348602295, "epoch": 5.290248124639354, "grad_norm": 1.078125, "learning_rate": 0.0002583938323563183, "loss": 5.3109, "mean_token_accuracy": 0.22782213240861893, "num_tokens": 116177239.0, "step": 45840 }, { "entropy": 6.014317989349365, "epoch": 5.290825158684362, "grad_norm": 1.0, "learning_rate": 0.0002583526808251573, "loss": 5.3303, "mean_token_accuracy": 0.23677037358283998, "num_tokens": 116189313.0, "step": 45845 }, { "entropy": 6.061425256729126, "epoch": 5.291402192729371, "grad_norm": 1.0234375, "learning_rate": 0.0002583115298539208, "loss": 5.442, "mean_token_accuracy": 0.22103138715028764, "num_tokens": 116201814.0, "step": 45850 }, { "entropy": 6.003198957443237, "epoch": 5.29197922677438, "grad_norm": 0.9140625, "learning_rate": 0.0002582703794439925, "loss": 5.4064, "mean_token_accuracy": 0.2240051031112671, "num_tokens": 116214857.0, "step": 45855 }, { "entropy": 6.0059796333312985, "epoch": 5.292556260819389, "grad_norm": 1.09375, "learning_rate": 0.00025822922959675676, "loss": 5.4331, "mean_token_accuracy": 0.22569094598293304, "num_tokens": 116226528.0, "step": 45860 }, { "entropy": 6.0012462615966795, "epoch": 5.293133294864397, "grad_norm": 1.046875, "learning_rate": 0.00025818808031359753, "loss": 5.3859, "mean_token_accuracy": 0.2283470779657364, "num_tokens": 116239120.0, "step": 45865 }, { "entropy": 5.941596555709839, "epoch": 5.293710328909405, "grad_norm": 1.0703125, "learning_rate": 0.00025814693159589895, "loss": 5.3297, "mean_token_accuracy": 0.22873965352773667, "num_tokens": 116251248.0, "step": 45870 }, { "entropy": 6.036790275573731, "epoch": 5.294287362954415, "grad_norm": 1.0078125, "learning_rate": 0.00025810578344504485, "loss": 5.4725, "mean_token_accuracy": 0.21692661941051483, "num_tokens": 116263536.0, "step": 45875 }, { "entropy": 6.0626240253448485, "epoch": 5.294864396999423, "grad_norm": 0.97265625, "learning_rate": 0.00025806463586241943, "loss": 5.4063, "mean_token_accuracy": 0.22704166769981385, "num_tokens": 116277119.0, "step": 45880 }, { "entropy": 5.9592243194580075, "epoch": 5.2954414310444315, "grad_norm": 0.9921875, "learning_rate": 0.0002580234888494064, "loss": 5.3547, "mean_token_accuracy": 0.2287086546421051, "num_tokens": 116289315.0, "step": 45885 }, { "entropy": 6.0819557189941404, "epoch": 5.29601846508944, "grad_norm": 1.0, "learning_rate": 0.0002579823424073901, "loss": 5.5206, "mean_token_accuracy": 0.20929814130067825, "num_tokens": 116302322.0, "step": 45890 }, { "entropy": 6.033450937271118, "epoch": 5.296595499134449, "grad_norm": 1.0, "learning_rate": 0.0002579411965377541, "loss": 5.3729, "mean_token_accuracy": 0.22816126942634582, "num_tokens": 116314688.0, "step": 45895 }, { "entropy": 6.015622091293335, "epoch": 5.297172533179458, "grad_norm": 0.98046875, "learning_rate": 0.00025790005124188257, "loss": 5.3632, "mean_token_accuracy": 0.21758892983198166, "num_tokens": 116326242.0, "step": 45900 }, { "entropy": 5.946031475067139, "epoch": 5.297749567224466, "grad_norm": 0.95703125, "learning_rate": 0.00025785890652115927, "loss": 5.3799, "mean_token_accuracy": 0.2278321698307991, "num_tokens": 116338794.0, "step": 45905 }, { "entropy": 6.084583282470703, "epoch": 5.2983266012694745, "grad_norm": 0.98046875, "learning_rate": 0.00025781776237696817, "loss": 5.5029, "mean_token_accuracy": 0.21626635491847992, "num_tokens": 116351215.0, "step": 45910 }, { "entropy": 6.027676296234131, "epoch": 5.298903635314484, "grad_norm": 1.1484375, "learning_rate": 0.0002577766188106931, "loss": 5.3917, "mean_token_accuracy": 0.2203213930130005, "num_tokens": 116363522.0, "step": 45915 }, { "entropy": 6.056950378417969, "epoch": 5.299480669359492, "grad_norm": 1.078125, "learning_rate": 0.00025773547582371787, "loss": 5.44, "mean_token_accuracy": 0.21464321464300157, "num_tokens": 116374778.0, "step": 45920 }, { "entropy": 6.007820749282837, "epoch": 5.300057703404501, "grad_norm": 1.03125, "learning_rate": 0.0002576943334174263, "loss": 5.3907, "mean_token_accuracy": 0.2243694022297859, "num_tokens": 116387546.0, "step": 45925 }, { "entropy": 6.010303354263305, "epoch": 5.30063473744951, "grad_norm": 0.99609375, "learning_rate": 0.0002576531915932024, "loss": 5.4524, "mean_token_accuracy": 0.21511386930942536, "num_tokens": 116401907.0, "step": 45930 }, { "entropy": 6.067706298828125, "epoch": 5.301211771494518, "grad_norm": 0.94140625, "learning_rate": 0.00025761205035242964, "loss": 5.4194, "mean_token_accuracy": 0.22609938234090804, "num_tokens": 116414300.0, "step": 45935 }, { "entropy": 6.007501316070557, "epoch": 5.301788805539527, "grad_norm": 1.046875, "learning_rate": 0.000257570909696492, "loss": 5.3333, "mean_token_accuracy": 0.22426329255104066, "num_tokens": 116427313.0, "step": 45940 }, { "entropy": 6.078638362884521, "epoch": 5.302365839584535, "grad_norm": 1.03125, "learning_rate": 0.000257529769626773, "loss": 5.5283, "mean_token_accuracy": 0.21886655539274216, "num_tokens": 116441131.0, "step": 45945 }, { "entropy": 6.100323963165283, "epoch": 5.3029428736295445, "grad_norm": 1.0859375, "learning_rate": 0.00025748863014465667, "loss": 5.5551, "mean_token_accuracy": 0.21367793679237365, "num_tokens": 116454164.0, "step": 45950 }, { "entropy": 6.037721967697143, "epoch": 5.303519907674553, "grad_norm": 0.96484375, "learning_rate": 0.0002574474912515265, "loss": 5.4417, "mean_token_accuracy": 0.21962355971336364, "num_tokens": 116466836.0, "step": 45955 }, { "entropy": 6.092635583877564, "epoch": 5.304096941719561, "grad_norm": 1.140625, "learning_rate": 0.00025740635294876636, "loss": 5.4381, "mean_token_accuracy": 0.2162007212638855, "num_tokens": 116478371.0, "step": 45960 }, { "entropy": 6.026547908782959, "epoch": 5.30467397576457, "grad_norm": 1.0859375, "learning_rate": 0.00025736521523775965, "loss": 5.43, "mean_token_accuracy": 0.22337144315242768, "num_tokens": 116490871.0, "step": 45965 }, { "entropy": 6.121276426315307, "epoch": 5.305251009809579, "grad_norm": 1.046875, "learning_rate": 0.00025732407811989024, "loss": 5.5556, "mean_token_accuracy": 0.2097402811050415, "num_tokens": 116503204.0, "step": 45970 }, { "entropy": 5.976197719573975, "epoch": 5.3058280438545875, "grad_norm": 1.0, "learning_rate": 0.00025728294159654163, "loss": 5.3238, "mean_token_accuracy": 0.229198095202446, "num_tokens": 116517020.0, "step": 45975 }, { "entropy": 6.0076884746551515, "epoch": 5.306405077899596, "grad_norm": 0.984375, "learning_rate": 0.0002572418056690976, "loss": 5.4166, "mean_token_accuracy": 0.22581440806388856, "num_tokens": 116529760.0, "step": 45980 }, { "entropy": 6.026073169708252, "epoch": 5.306982111944604, "grad_norm": 1.015625, "learning_rate": 0.00025720067033894144, "loss": 5.3895, "mean_token_accuracy": 0.22563980519771576, "num_tokens": 116542464.0, "step": 45985 }, { "entropy": 5.93888521194458, "epoch": 5.307559145989614, "grad_norm": 1.03125, "learning_rate": 0.000257159535607457, "loss": 5.2922, "mean_token_accuracy": 0.2282860517501831, "num_tokens": 116554550.0, "step": 45990 }, { "entropy": 6.052002620697022, "epoch": 5.308136180034622, "grad_norm": 1.0859375, "learning_rate": 0.00025711840147602774, "loss": 5.4443, "mean_token_accuracy": 0.22774358987808227, "num_tokens": 116566242.0, "step": 45995 }, { "entropy": 6.092132043838501, "epoch": 5.3087132140796305, "grad_norm": 1.1953125, "learning_rate": 0.00025707726794603714, "loss": 5.4895, "mean_token_accuracy": 0.21957289427518845, "num_tokens": 116579108.0, "step": 46000 }, { "entropy": 5.944806098937988, "epoch": 5.30929024812464, "grad_norm": 1.125, "learning_rate": 0.0002570361350188687, "loss": 5.2938, "mean_token_accuracy": 0.23232382982969285, "num_tokens": 116590918.0, "step": 46005 }, { "entropy": 6.070037364959717, "epoch": 5.309867282169648, "grad_norm": 1.078125, "learning_rate": 0.00025699500269590593, "loss": 5.4645, "mean_token_accuracy": 0.218390528857708, "num_tokens": 116602342.0, "step": 46010 }, { "entropy": 6.0561624526977536, "epoch": 5.310444316214657, "grad_norm": 1.0703125, "learning_rate": 0.0002569538709785323, "loss": 5.4451, "mean_token_accuracy": 0.2190216898918152, "num_tokens": 116614737.0, "step": 46015 }, { "entropy": 5.9866249561309814, "epoch": 5.311021350259665, "grad_norm": 0.98046875, "learning_rate": 0.00025691273986813137, "loss": 5.3572, "mean_token_accuracy": 0.22852537781000137, "num_tokens": 116626859.0, "step": 46020 }, { "entropy": 5.93863263130188, "epoch": 5.311598384304674, "grad_norm": 1.078125, "learning_rate": 0.0002568716093660863, "loss": 5.3209, "mean_token_accuracy": 0.22840829491615294, "num_tokens": 116640319.0, "step": 46025 }, { "entropy": 6.06455283164978, "epoch": 5.312175418349683, "grad_norm": 0.96484375, "learning_rate": 0.0002568304794737807, "loss": 5.4969, "mean_token_accuracy": 0.2117247074842453, "num_tokens": 116653293.0, "step": 46030 }, { "entropy": 6.054355430603027, "epoch": 5.312752452394691, "grad_norm": 1.03125, "learning_rate": 0.00025678935019259784, "loss": 5.3965, "mean_token_accuracy": 0.22374956905841828, "num_tokens": 116664989.0, "step": 46035 }, { "entropy": 6.085732126235962, "epoch": 5.3133294864397, "grad_norm": 0.97265625, "learning_rate": 0.0002567482215239213, "loss": 5.4923, "mean_token_accuracy": 0.22013434767723083, "num_tokens": 116677868.0, "step": 46040 }, { "entropy": 6.021775484085083, "epoch": 5.313906520484709, "grad_norm": 1.0078125, "learning_rate": 0.00025670709346913413, "loss": 5.4562, "mean_token_accuracy": 0.22161409854888917, "num_tokens": 116691234.0, "step": 46045 }, { "entropy": 6.082256603240967, "epoch": 5.314483554529717, "grad_norm": 0.96875, "learning_rate": 0.0002566659660296198, "loss": 5.4822, "mean_token_accuracy": 0.21662663519382477, "num_tokens": 116703317.0, "step": 46050 }, { "entropy": 6.056056785583496, "epoch": 5.315060588574726, "grad_norm": 0.96875, "learning_rate": 0.00025662483920676154, "loss": 5.4602, "mean_token_accuracy": 0.21702508628368378, "num_tokens": 116716638.0, "step": 46055 }, { "entropy": 6.05317907333374, "epoch": 5.315637622619734, "grad_norm": 1.0390625, "learning_rate": 0.0002565837130019428, "loss": 5.4115, "mean_token_accuracy": 0.22450577318668366, "num_tokens": 116730501.0, "step": 46060 }, { "entropy": 5.972889614105225, "epoch": 5.3162146566647435, "grad_norm": 1.0078125, "learning_rate": 0.0002565425874165467, "loss": 5.3748, "mean_token_accuracy": 0.22214292138814926, "num_tokens": 116743184.0, "step": 46065 }, { "entropy": 6.033910179138184, "epoch": 5.316791690709752, "grad_norm": 1.0859375, "learning_rate": 0.00025650146245195647, "loss": 5.4857, "mean_token_accuracy": 0.21719806641340256, "num_tokens": 116755592.0, "step": 46070 }, { "entropy": 5.98660569190979, "epoch": 5.31736872475476, "grad_norm": 0.9609375, "learning_rate": 0.0002564603381095554, "loss": 5.4535, "mean_token_accuracy": 0.2213363915681839, "num_tokens": 116768618.0, "step": 46075 }, { "entropy": 6.0146771430969235, "epoch": 5.31794575879977, "grad_norm": 1.046875, "learning_rate": 0.00025641921439072666, "loss": 5.4594, "mean_token_accuracy": 0.21577292084693908, "num_tokens": 116782063.0, "step": 46080 }, { "entropy": 6.14362735748291, "epoch": 5.318522792844778, "grad_norm": 1.0625, "learning_rate": 0.00025637809129685336, "loss": 5.4821, "mean_token_accuracy": 0.21354314535856248, "num_tokens": 116793939.0, "step": 46085 }, { "entropy": 6.0629908561706545, "epoch": 5.319099826889786, "grad_norm": 1.0625, "learning_rate": 0.0002563369688293187, "loss": 5.4142, "mean_token_accuracy": 0.22511038035154343, "num_tokens": 116806161.0, "step": 46090 }, { "entropy": 6.060305643081665, "epoch": 5.319676860934795, "grad_norm": 1.0546875, "learning_rate": 0.00025629584698950585, "loss": 5.488, "mean_token_accuracy": 0.20859711170196532, "num_tokens": 116818365.0, "step": 46095 }, { "entropy": 6.097740030288696, "epoch": 5.320253894979804, "grad_norm": 1.015625, "learning_rate": 0.000256254725778798, "loss": 5.4562, "mean_token_accuracy": 0.21608344614505767, "num_tokens": 116832219.0, "step": 46100 }, { "entropy": 6.0411949634552, "epoch": 5.320830929024813, "grad_norm": 1.0625, "learning_rate": 0.000256213605198578, "loss": 5.3689, "mean_token_accuracy": 0.2298753410577774, "num_tokens": 116844899.0, "step": 46105 }, { "entropy": 6.077473545074463, "epoch": 5.321407963069821, "grad_norm": 1.046875, "learning_rate": 0.0002561724852502291, "loss": 5.4568, "mean_token_accuracy": 0.22031740248203277, "num_tokens": 116856804.0, "step": 46110 }, { "entropy": 5.987808465957642, "epoch": 5.321984997114829, "grad_norm": 1.0234375, "learning_rate": 0.0002561313659351342, "loss": 5.4077, "mean_token_accuracy": 0.22933365702629088, "num_tokens": 116870369.0, "step": 46115 }, { "entropy": 6.1456560611724855, "epoch": 5.322562031159839, "grad_norm": 1.0390625, "learning_rate": 0.00025609024725467664, "loss": 5.5458, "mean_token_accuracy": 0.21556393802165985, "num_tokens": 116883509.0, "step": 46120 }, { "entropy": 6.033176374435425, "epoch": 5.323139065204847, "grad_norm": 0.96875, "learning_rate": 0.0002560491292102391, "loss": 5.389, "mean_token_accuracy": 0.23220531791448593, "num_tokens": 116897247.0, "step": 46125 }, { "entropy": 5.965729904174805, "epoch": 5.323716099249856, "grad_norm": 1.0234375, "learning_rate": 0.00025600801180320463, "loss": 5.3454, "mean_token_accuracy": 0.23463781625032426, "num_tokens": 116910489.0, "step": 46130 }, { "entropy": 6.099097108840942, "epoch": 5.324293133294864, "grad_norm": 1.140625, "learning_rate": 0.0002559668950349563, "loss": 5.4848, "mean_token_accuracy": 0.21454005241394042, "num_tokens": 116922257.0, "step": 46135 }, { "entropy": 6.0517219543457035, "epoch": 5.324870167339873, "grad_norm": 1.078125, "learning_rate": 0.00025592577890687715, "loss": 5.4061, "mean_token_accuracy": 0.2247065007686615, "num_tokens": 116934634.0, "step": 46140 }, { "entropy": 5.985164785385132, "epoch": 5.325447201384882, "grad_norm": 1.0078125, "learning_rate": 0.00025588466342034975, "loss": 5.4136, "mean_token_accuracy": 0.21729756891727448, "num_tokens": 116947566.0, "step": 46145 }, { "entropy": 6.0302205085754395, "epoch": 5.32602423542989, "grad_norm": 1.0390625, "learning_rate": 0.0002558435485767572, "loss": 5.4068, "mean_token_accuracy": 0.22710861414670944, "num_tokens": 116960798.0, "step": 46150 }, { "entropy": 5.947607612609863, "epoch": 5.326601269474899, "grad_norm": 0.97265625, "learning_rate": 0.0002558024343774825, "loss": 5.2952, "mean_token_accuracy": 0.22909213453531266, "num_tokens": 116973916.0, "step": 46155 }, { "entropy": 6.048489618301391, "epoch": 5.327178303519908, "grad_norm": 1.1796875, "learning_rate": 0.0002557613208239083, "loss": 5.521, "mean_token_accuracy": 0.2122193083167076, "num_tokens": 116986681.0, "step": 46160 }, { "entropy": 6.003508710861206, "epoch": 5.327755337564916, "grad_norm": 1.03125, "learning_rate": 0.00025572020791741763, "loss": 5.4508, "mean_token_accuracy": 0.22063050121068956, "num_tokens": 116999787.0, "step": 46165 }, { "entropy": 6.022827243804931, "epoch": 5.328332371609925, "grad_norm": 0.90234375, "learning_rate": 0.0002556790956593931, "loss": 5.4166, "mean_token_accuracy": 0.2288016691803932, "num_tokens": 117012542.0, "step": 46170 }, { "entropy": 5.9424480438232425, "epoch": 5.328909405654934, "grad_norm": 1.0703125, "learning_rate": 0.0002556379840512176, "loss": 5.2842, "mean_token_accuracy": 0.2203609138727188, "num_tokens": 117024383.0, "step": 46175 }, { "entropy": 6.041703891754151, "epoch": 5.329486439699942, "grad_norm": 0.99609375, "learning_rate": 0.0002555968730942738, "loss": 5.4748, "mean_token_accuracy": 0.21999604105949402, "num_tokens": 117037289.0, "step": 46180 }, { "entropy": 6.0298840522766115, "epoch": 5.330063473744951, "grad_norm": 1.0, "learning_rate": 0.00025555576278994474, "loss": 5.4642, "mean_token_accuracy": 0.22020394802093507, "num_tokens": 117049692.0, "step": 46185 }, { "entropy": 6.006472730636597, "epoch": 5.330640507789959, "grad_norm": 0.96875, "learning_rate": 0.00025551465313961274, "loss": 5.34, "mean_token_accuracy": 0.23253780454397202, "num_tokens": 117063423.0, "step": 46190 }, { "entropy": 6.056939315795899, "epoch": 5.3312175418349685, "grad_norm": 0.96484375, "learning_rate": 0.00025547354414466085, "loss": 5.4388, "mean_token_accuracy": 0.22065360695123673, "num_tokens": 117076329.0, "step": 46195 }, { "entropy": 6.016411352157593, "epoch": 5.331794575879977, "grad_norm": 1.0703125, "learning_rate": 0.0002554324358064715, "loss": 5.4071, "mean_token_accuracy": 0.2158508449792862, "num_tokens": 117088367.0, "step": 46200 }, { "entropy": 6.035438013076782, "epoch": 5.332371609924985, "grad_norm": 2.25, "learning_rate": 0.00025539132812642755, "loss": 5.4438, "mean_token_accuracy": 0.22043509036302567, "num_tokens": 117101134.0, "step": 46205 }, { "entropy": 6.026764965057373, "epoch": 5.332948643969994, "grad_norm": 0.9296875, "learning_rate": 0.00025535022110591147, "loss": 5.385, "mean_token_accuracy": 0.22913145571947097, "num_tokens": 117113539.0, "step": 46210 }, { "entropy": 6.050382852554321, "epoch": 5.333525678015003, "grad_norm": 0.92578125, "learning_rate": 0.00025530911474630594, "loss": 5.5, "mean_token_accuracy": 0.21475670039653777, "num_tokens": 117125573.0, "step": 46215 }, { "entropy": 6.005392789840698, "epoch": 5.3341027120600115, "grad_norm": 1.0390625, "learning_rate": 0.00025526800904899355, "loss": 5.376, "mean_token_accuracy": 0.21866468489170074, "num_tokens": 117138436.0, "step": 46220 }, { "entropy": 6.032098245620728, "epoch": 5.33467974610502, "grad_norm": 1.0703125, "learning_rate": 0.000255226904015357, "loss": 5.4484, "mean_token_accuracy": 0.2152218922972679, "num_tokens": 117151282.0, "step": 46225 }, { "entropy": 6.079346179962158, "epoch": 5.335256780150029, "grad_norm": 1.3671875, "learning_rate": 0.00025518579964677854, "loss": 5.4352, "mean_token_accuracy": 0.22209523022174835, "num_tokens": 117163434.0, "step": 46230 }, { "entropy": 5.990505599975586, "epoch": 5.335833814195038, "grad_norm": 0.97265625, "learning_rate": 0.0002551446959446409, "loss": 5.3685, "mean_token_accuracy": 0.22944666892290116, "num_tokens": 117176520.0, "step": 46235 }, { "entropy": 6.000926828384399, "epoch": 5.336410848240046, "grad_norm": 0.90234375, "learning_rate": 0.0002551035929103266, "loss": 5.4011, "mean_token_accuracy": 0.22566193491220474, "num_tokens": 117189525.0, "step": 46240 }, { "entropy": 6.082267141342163, "epoch": 5.3369878822850545, "grad_norm": 1.015625, "learning_rate": 0.00025506249054521807, "loss": 5.4259, "mean_token_accuracy": 0.2284848153591156, "num_tokens": 117203747.0, "step": 46245 }, { "entropy": 6.033232164382935, "epoch": 5.337564916330064, "grad_norm": 1.0390625, "learning_rate": 0.00025502138885069776, "loss": 5.4518, "mean_token_accuracy": 0.21333421319723128, "num_tokens": 117218016.0, "step": 46250 }, { "entropy": 6.078038740158081, "epoch": 5.338141950375072, "grad_norm": 1.0859375, "learning_rate": 0.00025498028782814806, "loss": 5.4762, "mean_token_accuracy": 0.2225479304790497, "num_tokens": 117229272.0, "step": 46255 }, { "entropy": 6.080319595336914, "epoch": 5.338718984420081, "grad_norm": 0.98046875, "learning_rate": 0.00025493918747895145, "loss": 5.4498, "mean_token_accuracy": 0.21851986348629, "num_tokens": 117241708.0, "step": 46260 }, { "entropy": 6.124478101730347, "epoch": 5.339296018465089, "grad_norm": 1.0390625, "learning_rate": 0.00025489808780449044, "loss": 5.4256, "mean_token_accuracy": 0.21361800730228425, "num_tokens": 117253438.0, "step": 46265 }, { "entropy": 6.04870982170105, "epoch": 5.339873052510098, "grad_norm": 0.984375, "learning_rate": 0.00025485698880614707, "loss": 5.4593, "mean_token_accuracy": 0.21864764839410783, "num_tokens": 117267087.0, "step": 46270 }, { "entropy": 6.008804988861084, "epoch": 5.340450086555107, "grad_norm": 1.0078125, "learning_rate": 0.000254815890485304, "loss": 5.4423, "mean_token_accuracy": 0.2245807632803917, "num_tokens": 117280013.0, "step": 46275 }, { "entropy": 6.015140438079834, "epoch": 5.341027120600115, "grad_norm": 0.96875, "learning_rate": 0.0002547747928433433, "loss": 5.4093, "mean_token_accuracy": 0.2231789782643318, "num_tokens": 117292634.0, "step": 46280 }, { "entropy": 6.0914304733276365, "epoch": 5.341604154645124, "grad_norm": 0.9453125, "learning_rate": 0.0002547336958816476, "loss": 5.4927, "mean_token_accuracy": 0.2136649966239929, "num_tokens": 117305570.0, "step": 46285 }, { "entropy": 5.982283258438111, "epoch": 5.342181188690133, "grad_norm": 0.95703125, "learning_rate": 0.0002546925996015988, "loss": 5.333, "mean_token_accuracy": 0.23774474412202834, "num_tokens": 117318991.0, "step": 46290 }, { "entropy": 5.968101930618286, "epoch": 5.342758222735141, "grad_norm": 1.2109375, "learning_rate": 0.0002546515040045794, "loss": 5.3121, "mean_token_accuracy": 0.22973464876413346, "num_tokens": 117331994.0, "step": 46295 }, { "entropy": 6.033121585845947, "epoch": 5.34333525678015, "grad_norm": 1.0078125, "learning_rate": 0.00025461040909197146, "loss": 5.4616, "mean_token_accuracy": 0.221347576379776, "num_tokens": 117344735.0, "step": 46300 }, { "entropy": 6.062983894348145, "epoch": 5.343912290825159, "grad_norm": 1.078125, "learning_rate": 0.00025456931486515745, "loss": 5.4874, "mean_token_accuracy": 0.21916218847036362, "num_tokens": 117357747.0, "step": 46305 }, { "entropy": 6.064911651611328, "epoch": 5.3444893248701675, "grad_norm": 1.03125, "learning_rate": 0.00025452822132551923, "loss": 5.4573, "mean_token_accuracy": 0.21743026971817017, "num_tokens": 117369970.0, "step": 46310 }, { "entropy": 5.976342725753784, "epoch": 5.345066358915176, "grad_norm": 0.99609375, "learning_rate": 0.0002544871284744392, "loss": 5.2765, "mean_token_accuracy": 0.23414543122053147, "num_tokens": 117381923.0, "step": 46315 }, { "entropy": 6.093671035766602, "epoch": 5.345643392960184, "grad_norm": 1.015625, "learning_rate": 0.0002544460363132994, "loss": 5.4771, "mean_token_accuracy": 0.21469964534044267, "num_tokens": 117393395.0, "step": 46320 }, { "entropy": 6.054122734069824, "epoch": 5.346220427005194, "grad_norm": 0.96875, "learning_rate": 0.000254404944843482, "loss": 5.4066, "mean_token_accuracy": 0.22262776792049407, "num_tokens": 117406017.0, "step": 46325 }, { "entropy": 6.048027229309082, "epoch": 5.346797461050202, "grad_norm": 1.046875, "learning_rate": 0.0002543638540663689, "loss": 5.4554, "mean_token_accuracy": 0.21837498098611832, "num_tokens": 117419769.0, "step": 46330 }, { "entropy": 6.0547269821167, "epoch": 5.3473744950952105, "grad_norm": 1.0859375, "learning_rate": 0.00025432276398334254, "loss": 5.3976, "mean_token_accuracy": 0.2258692130446434, "num_tokens": 117432050.0, "step": 46335 }, { "entropy": 6.002361392974853, "epoch": 5.347951529140219, "grad_norm": 0.9609375, "learning_rate": 0.00025428167459578453, "loss": 5.445, "mean_token_accuracy": 0.21855174750089645, "num_tokens": 117444447.0, "step": 46340 }, { "entropy": 6.043699312210083, "epoch": 5.348528563185228, "grad_norm": 0.97265625, "learning_rate": 0.00025424058590507725, "loss": 5.4072, "mean_token_accuracy": 0.21950049102306365, "num_tokens": 117457804.0, "step": 46345 }, { "entropy": 5.956660223007202, "epoch": 5.349105597230237, "grad_norm": 1.140625, "learning_rate": 0.00025419949791260246, "loss": 5.3147, "mean_token_accuracy": 0.2253398835659027, "num_tokens": 117471731.0, "step": 46350 }, { "entropy": 6.07152624130249, "epoch": 5.349682631275245, "grad_norm": 1.046875, "learning_rate": 0.0002541584106197423, "loss": 5.4362, "mean_token_accuracy": 0.22245904058218002, "num_tokens": 117485290.0, "step": 46355 }, { "entropy": 6.024050855636597, "epoch": 5.350259665320253, "grad_norm": 0.98046875, "learning_rate": 0.0002541173240278786, "loss": 5.3514, "mean_token_accuracy": 0.22893767952919006, "num_tokens": 117496469.0, "step": 46360 }, { "entropy": 6.077806758880615, "epoch": 5.350836699365263, "grad_norm": 1.03125, "learning_rate": 0.0002540762381383934, "loss": 5.5237, "mean_token_accuracy": 0.21693225353956222, "num_tokens": 117507862.0, "step": 46365 }, { "entropy": 6.030594682693481, "epoch": 5.351413733410271, "grad_norm": 1.0, "learning_rate": 0.00025403515295266844, "loss": 5.4154, "mean_token_accuracy": 0.22298555076122284, "num_tokens": 117520208.0, "step": 46370 }, { "entropy": 5.948260831832886, "epoch": 5.35199076745528, "grad_norm": 1.078125, "learning_rate": 0.00025399406847208576, "loss": 5.2917, "mean_token_accuracy": 0.23446203172206878, "num_tokens": 117532838.0, "step": 46375 }, { "entropy": 5.980932760238647, "epoch": 5.352567801500289, "grad_norm": 1.0390625, "learning_rate": 0.00025395298469802705, "loss": 5.4071, "mean_token_accuracy": 0.22854914218187333, "num_tokens": 117545765.0, "step": 46380 }, { "entropy": 6.104554319381714, "epoch": 5.353144835545297, "grad_norm": 0.9921875, "learning_rate": 0.00025391190163187436, "loss": 5.5505, "mean_token_accuracy": 0.21074844747781754, "num_tokens": 117557844.0, "step": 46385 }, { "entropy": 6.007717180252075, "epoch": 5.353721869590306, "grad_norm": 1.0234375, "learning_rate": 0.00025387081927500933, "loss": 5.42, "mean_token_accuracy": 0.2155975356698036, "num_tokens": 117569170.0, "step": 46390 }, { "entropy": 5.99181056022644, "epoch": 5.354298903635314, "grad_norm": 1.0859375, "learning_rate": 0.0002538297376288139, "loss": 5.4058, "mean_token_accuracy": 0.21757039278745652, "num_tokens": 117581344.0, "step": 46395 }, { "entropy": 6.142331933975219, "epoch": 5.354875937680323, "grad_norm": 1.0703125, "learning_rate": 0.0002537886566946696, "loss": 5.464, "mean_token_accuracy": 0.21811507493257523, "num_tokens": 117593486.0, "step": 46400 }, { "entropy": 6.095344972610474, "epoch": 5.355452971725332, "grad_norm": 1.078125, "learning_rate": 0.0002537475764739583, "loss": 5.4751, "mean_token_accuracy": 0.21605441719293594, "num_tokens": 117605233.0, "step": 46405 }, { "entropy": 5.996577167510987, "epoch": 5.35603000577034, "grad_norm": 1.078125, "learning_rate": 0.00025370649696806173, "loss": 5.3766, "mean_token_accuracy": 0.2289374738931656, "num_tokens": 117618463.0, "step": 46410 }, { "entropy": 6.009560251235962, "epoch": 5.356607039815349, "grad_norm": 1.03125, "learning_rate": 0.0002536654181783617, "loss": 5.4432, "mean_token_accuracy": 0.22371635288000108, "num_tokens": 117630325.0, "step": 46415 }, { "entropy": 6.171038103103638, "epoch": 5.357184073860358, "grad_norm": 0.9609375, "learning_rate": 0.00025362434010623954, "loss": 5.5263, "mean_token_accuracy": 0.21389693170785903, "num_tokens": 117642971.0, "step": 46420 }, { "entropy": 6.057511615753174, "epoch": 5.357761107905366, "grad_norm": 1.046875, "learning_rate": 0.00025358326275307715, "loss": 5.4001, "mean_token_accuracy": 0.22465806305408478, "num_tokens": 117654995.0, "step": 46425 }, { "entropy": 6.073803091049195, "epoch": 5.358338141950375, "grad_norm": 1.0390625, "learning_rate": 0.000253542186120256, "loss": 5.508, "mean_token_accuracy": 0.2089098021388054, "num_tokens": 117667671.0, "step": 46430 }, { "entropy": 5.918203926086425, "epoch": 5.358915175995384, "grad_norm": 0.92578125, "learning_rate": 0.00025350111020915793, "loss": 5.3106, "mean_token_accuracy": 0.23617036640644073, "num_tokens": 117681773.0, "step": 46435 }, { "entropy": 6.088286304473877, "epoch": 5.359492210040393, "grad_norm": 0.984375, "learning_rate": 0.00025346003502116425, "loss": 5.4485, "mean_token_accuracy": 0.22191868871450424, "num_tokens": 117695520.0, "step": 46440 }, { "entropy": 6.1003193855285645, "epoch": 5.360069244085401, "grad_norm": 1.0, "learning_rate": 0.00025341896055765663, "loss": 5.4696, "mean_token_accuracy": 0.2207578808069229, "num_tokens": 117707748.0, "step": 46445 }, { "entropy": 6.039443922042847, "epoch": 5.360646278130409, "grad_norm": 0.96484375, "learning_rate": 0.00025337788682001645, "loss": 5.4463, "mean_token_accuracy": 0.2190927892923355, "num_tokens": 117721638.0, "step": 46450 }, { "entropy": 6.018512916564942, "epoch": 5.361223312175419, "grad_norm": 1.015625, "learning_rate": 0.00025333681380962543, "loss": 5.4174, "mean_token_accuracy": 0.22454916536808014, "num_tokens": 117733644.0, "step": 46455 }, { "entropy": 6.111059856414795, "epoch": 5.361800346220427, "grad_norm": 0.953125, "learning_rate": 0.00025329574152786483, "loss": 5.4739, "mean_token_accuracy": 0.21339171081781388, "num_tokens": 117746112.0, "step": 46460 }, { "entropy": 6.07945408821106, "epoch": 5.3623773802654355, "grad_norm": 1.0234375, "learning_rate": 0.0002532546699761162, "loss": 5.4759, "mean_token_accuracy": 0.21625843048095703, "num_tokens": 117758864.0, "step": 46465 }, { "entropy": 6.01701545715332, "epoch": 5.362954414310444, "grad_norm": 1.0, "learning_rate": 0.00025321359915576094, "loss": 5.4261, "mean_token_accuracy": 0.21516769379377365, "num_tokens": 117772185.0, "step": 46470 }, { "entropy": 6.083926105499268, "epoch": 5.363531448355453, "grad_norm": 1.140625, "learning_rate": 0.0002531725290681805, "loss": 5.4459, "mean_token_accuracy": 0.22386471629142762, "num_tokens": 117784622.0, "step": 46475 }, { "entropy": 6.090250253677368, "epoch": 5.364108482400462, "grad_norm": 0.92578125, "learning_rate": 0.00025313145971475614, "loss": 5.4557, "mean_token_accuracy": 0.21698042005300522, "num_tokens": 117797029.0, "step": 46480 }, { "entropy": 6.05199875831604, "epoch": 5.36468551644547, "grad_norm": 1.03125, "learning_rate": 0.00025309039109686933, "loss": 5.4413, "mean_token_accuracy": 0.2256188228726387, "num_tokens": 117810291.0, "step": 46485 }, { "entropy": 6.020019292831421, "epoch": 5.365262550490479, "grad_norm": 1.0, "learning_rate": 0.00025304932321590124, "loss": 5.4245, "mean_token_accuracy": 0.22318026423454285, "num_tokens": 117823196.0, "step": 46490 }, { "entropy": 6.064975929260254, "epoch": 5.365839584535488, "grad_norm": 0.9765625, "learning_rate": 0.0002530082560732334, "loss": 5.4612, "mean_token_accuracy": 0.2136770263314247, "num_tokens": 117836234.0, "step": 46495 }, { "entropy": 6.034855079650879, "epoch": 5.366416618580496, "grad_norm": 1.125, "learning_rate": 0.00025296718967024684, "loss": 5.4701, "mean_token_accuracy": 0.22009082287549972, "num_tokens": 117848465.0, "step": 46500 }, { "entropy": 6.104257202148437, "epoch": 5.366993652625505, "grad_norm": 1.046875, "learning_rate": 0.0002529261240083229, "loss": 5.4963, "mean_token_accuracy": 0.2233443319797516, "num_tokens": 117860945.0, "step": 46505 }, { "entropy": 6.065873718261718, "epoch": 5.367570686670514, "grad_norm": 0.94921875, "learning_rate": 0.00025288505908884287, "loss": 5.5067, "mean_token_accuracy": 0.22102196961641313, "num_tokens": 117874283.0, "step": 46510 }, { "entropy": 6.017688369750976, "epoch": 5.368147720715522, "grad_norm": 0.9765625, "learning_rate": 0.0002528439949131879, "loss": 5.43, "mean_token_accuracy": 0.22176415026187896, "num_tokens": 117886707.0, "step": 46515 }, { "entropy": 6.039252519607544, "epoch": 5.368724754760531, "grad_norm": 0.88671875, "learning_rate": 0.00025280293148273914, "loss": 5.3989, "mean_token_accuracy": 0.23084511160850524, "num_tokens": 117899810.0, "step": 46520 }, { "entropy": 5.997358179092407, "epoch": 5.369301788805539, "grad_norm": 1.03125, "learning_rate": 0.0002527618687988777, "loss": 5.3798, "mean_token_accuracy": 0.22086113542318345, "num_tokens": 117912607.0, "step": 46525 }, { "entropy": 6.046096277236939, "epoch": 5.3698788228505485, "grad_norm": 0.9609375, "learning_rate": 0.00025272080686298474, "loss": 5.4071, "mean_token_accuracy": 0.22432028353214264, "num_tokens": 117927038.0, "step": 46530 }, { "entropy": 6.028098678588867, "epoch": 5.370455856895557, "grad_norm": 1.015625, "learning_rate": 0.0002526797456764415, "loss": 5.4021, "mean_token_accuracy": 0.22417077720165252, "num_tokens": 117939595.0, "step": 46535 }, { "entropy": 6.004332208633423, "epoch": 5.371032890940565, "grad_norm": 1.03125, "learning_rate": 0.00025263868524062885, "loss": 5.4281, "mean_token_accuracy": 0.23470542579889297, "num_tokens": 117952327.0, "step": 46540 }, { "entropy": 5.911421775817871, "epoch": 5.371609924985574, "grad_norm": 1.03125, "learning_rate": 0.00025259762555692795, "loss": 5.3212, "mean_token_accuracy": 0.23034425526857377, "num_tokens": 117964619.0, "step": 46545 }, { "entropy": 6.098479843139648, "epoch": 5.372186959030583, "grad_norm": 0.98828125, "learning_rate": 0.00025255656662671975, "loss": 5.5728, "mean_token_accuracy": 0.21262627542018891, "num_tokens": 117978489.0, "step": 46550 }, { "entropy": 6.07009220123291, "epoch": 5.3727639930755915, "grad_norm": 1.03125, "learning_rate": 0.0002525155084513852, "loss": 5.4331, "mean_token_accuracy": 0.21783585846424103, "num_tokens": 117993539.0, "step": 46555 }, { "entropy": 6.074240064620971, "epoch": 5.3733410271206, "grad_norm": 0.95703125, "learning_rate": 0.00025247445103230556, "loss": 5.4358, "mean_token_accuracy": 0.22158272415399552, "num_tokens": 118006521.0, "step": 46560 }, { "entropy": 6.0861289501190186, "epoch": 5.373918061165609, "grad_norm": 0.97265625, "learning_rate": 0.00025243339437086137, "loss": 5.4578, "mean_token_accuracy": 0.21503166407346724, "num_tokens": 118019237.0, "step": 46565 }, { "entropy": 6.100465202331543, "epoch": 5.374495095210618, "grad_norm": 0.9375, "learning_rate": 0.00025239233846843383, "loss": 5.4623, "mean_token_accuracy": 0.219967320561409, "num_tokens": 118032020.0, "step": 46570 }, { "entropy": 6.11424674987793, "epoch": 5.375072129255626, "grad_norm": 1.0078125, "learning_rate": 0.0002523512833264038, "loss": 5.4974, "mean_token_accuracy": 0.2167445167899132, "num_tokens": 118044317.0, "step": 46575 }, { "entropy": 5.948747444152832, "epoch": 5.3756491633006345, "grad_norm": 0.90625, "learning_rate": 0.00025231022894615213, "loss": 5.3687, "mean_token_accuracy": 0.23021965324878693, "num_tokens": 118058537.0, "step": 46580 }, { "entropy": 5.885046672821045, "epoch": 5.376226197345644, "grad_norm": 1.0, "learning_rate": 0.00025226917532905955, "loss": 5.3064, "mean_token_accuracy": 0.22981446981430054, "num_tokens": 118072638.0, "step": 46585 }, { "entropy": 5.983325052261352, "epoch": 5.376803231390652, "grad_norm": 1.0, "learning_rate": 0.000252228122476507, "loss": 5.4153, "mean_token_accuracy": 0.22390871942043306, "num_tokens": 118086200.0, "step": 46590 }, { "entropy": 6.058635711669922, "epoch": 5.377380265435661, "grad_norm": 0.96484375, "learning_rate": 0.00025218707038987515, "loss": 5.4038, "mean_token_accuracy": 0.22339641451835632, "num_tokens": 118099101.0, "step": 46595 }, { "entropy": 6.10756287574768, "epoch": 5.377957299480669, "grad_norm": 1.0390625, "learning_rate": 0.000252146019070545, "loss": 5.5342, "mean_token_accuracy": 0.21020758002996445, "num_tokens": 118111724.0, "step": 46600 }, { "entropy": 6.062566757202148, "epoch": 5.378534333525678, "grad_norm": 1.0078125, "learning_rate": 0.00025210496851989705, "loss": 5.5042, "mean_token_accuracy": 0.20720487385988234, "num_tokens": 118125034.0, "step": 46605 }, { "entropy": 5.987087631225586, "epoch": 5.379111367570687, "grad_norm": 1.0390625, "learning_rate": 0.0002520639187393122, "loss": 5.3618, "mean_token_accuracy": 0.2269548088312149, "num_tokens": 118138460.0, "step": 46610 }, { "entropy": 6.085792970657349, "epoch": 5.379688401615695, "grad_norm": 1.0390625, "learning_rate": 0.000252022869730171, "loss": 5.4327, "mean_token_accuracy": 0.2233018696308136, "num_tokens": 118150687.0, "step": 46615 }, { "entropy": 6.003587532043457, "epoch": 5.380265435660704, "grad_norm": 1.09375, "learning_rate": 0.0002519818214938542, "loss": 5.3994, "mean_token_accuracy": 0.2293952986598015, "num_tokens": 118162794.0, "step": 46620 }, { "entropy": 5.954463100433349, "epoch": 5.380842469705713, "grad_norm": 1.1171875, "learning_rate": 0.0002519407740317423, "loss": 5.3785, "mean_token_accuracy": 0.22495761513710022, "num_tokens": 118174744.0, "step": 46625 }, { "entropy": 5.950168943405151, "epoch": 5.381419503750721, "grad_norm": 1.0234375, "learning_rate": 0.0002518997273452161, "loss": 5.3261, "mean_token_accuracy": 0.2330923080444336, "num_tokens": 118186543.0, "step": 46630 }, { "entropy": 6.031841373443603, "epoch": 5.38199653779573, "grad_norm": 0.96875, "learning_rate": 0.000251858681435656, "loss": 5.3508, "mean_token_accuracy": 0.2257835417985916, "num_tokens": 118198801.0, "step": 46635 }, { "entropy": 6.073264455795288, "epoch": 5.382573571840739, "grad_norm": 0.98828125, "learning_rate": 0.00025181763630444283, "loss": 5.4428, "mean_token_accuracy": 0.22036836296319962, "num_tokens": 118212010.0, "step": 46640 }, { "entropy": 6.069288158416748, "epoch": 5.3831506058857475, "grad_norm": 1.0546875, "learning_rate": 0.00025177659195295675, "loss": 5.4225, "mean_token_accuracy": 0.22528850585222243, "num_tokens": 118224568.0, "step": 46645 }, { "entropy": 6.032807064056397, "epoch": 5.383727639930756, "grad_norm": 0.9765625, "learning_rate": 0.00025173554838257855, "loss": 5.4433, "mean_token_accuracy": 0.2188011109828949, "num_tokens": 118236575.0, "step": 46650 }, { "entropy": 6.136781072616577, "epoch": 5.384304673975764, "grad_norm": 1.0859375, "learning_rate": 0.0002516945055946886, "loss": 5.4979, "mean_token_accuracy": 0.21484594643115998, "num_tokens": 118249523.0, "step": 46655 }, { "entropy": 6.082072019577026, "epoch": 5.384881708020774, "grad_norm": 1.0078125, "learning_rate": 0.0002516534635906675, "loss": 5.4515, "mean_token_accuracy": 0.2174357905983925, "num_tokens": 118261440.0, "step": 46660 }, { "entropy": 5.928796100616455, "epoch": 5.385458742065782, "grad_norm": 0.984375, "learning_rate": 0.0002516124223718954, "loss": 5.4253, "mean_token_accuracy": 0.22346831113100052, "num_tokens": 118275352.0, "step": 46665 }, { "entropy": 6.01789927482605, "epoch": 5.38603577611079, "grad_norm": 1.0234375, "learning_rate": 0.0002515713819397529, "loss": 5.4172, "mean_token_accuracy": 0.2251511797308922, "num_tokens": 118289355.0, "step": 46670 }, { "entropy": 6.146826171875, "epoch": 5.386612810155799, "grad_norm": 1.015625, "learning_rate": 0.00025153034229562037, "loss": 5.4533, "mean_token_accuracy": 0.21645608693361282, "num_tokens": 118302769.0, "step": 46675 }, { "entropy": 5.979436254501342, "epoch": 5.387189844200808, "grad_norm": 1.0859375, "learning_rate": 0.0002514893034408782, "loss": 5.3486, "mean_token_accuracy": 0.23287110179662704, "num_tokens": 118313908.0, "step": 46680 }, { "entropy": 6.010890007019043, "epoch": 5.387766878245817, "grad_norm": 0.90625, "learning_rate": 0.00025144826537690647, "loss": 5.514, "mean_token_accuracy": 0.21533904522657393, "num_tokens": 118328604.0, "step": 46685 }, { "entropy": 6.003427124023437, "epoch": 5.388343912290825, "grad_norm": 1.0390625, "learning_rate": 0.0002514072281050857, "loss": 5.3631, "mean_token_accuracy": 0.2217478260397911, "num_tokens": 118340876.0, "step": 46690 }, { "entropy": 6.031282997131347, "epoch": 5.388920946335833, "grad_norm": 1.0390625, "learning_rate": 0.000251366191626796, "loss": 5.4147, "mean_token_accuracy": 0.2243668869137764, "num_tokens": 118353746.0, "step": 46695 }, { "entropy": 6.08333158493042, "epoch": 5.389497980380843, "grad_norm": 0.984375, "learning_rate": 0.0002513251559434179, "loss": 5.4723, "mean_token_accuracy": 0.22129524052143096, "num_tokens": 118367459.0, "step": 46700 }, { "entropy": 5.935800457000733, "epoch": 5.390075014425851, "grad_norm": 0.98046875, "learning_rate": 0.0002512841210563313, "loss": 5.3079, "mean_token_accuracy": 0.23677830398082733, "num_tokens": 118380481.0, "step": 46705 }, { "entropy": 6.065203666687012, "epoch": 5.3906520484708595, "grad_norm": 0.9921875, "learning_rate": 0.00025124308696691653, "loss": 5.4283, "mean_token_accuracy": 0.22849969565868378, "num_tokens": 118393255.0, "step": 46710 }, { "entropy": 5.990964412689209, "epoch": 5.391229082515869, "grad_norm": 1.0078125, "learning_rate": 0.0002512020536765536, "loss": 5.4001, "mean_token_accuracy": 0.2225814312696457, "num_tokens": 118406148.0, "step": 46715 }, { "entropy": 6.050089931488037, "epoch": 5.391806116560877, "grad_norm": 1.0078125, "learning_rate": 0.00025116102118662306, "loss": 5.4161, "mean_token_accuracy": 0.21961817592382432, "num_tokens": 118417775.0, "step": 46720 }, { "entropy": 6.013803005218506, "epoch": 5.392383150605886, "grad_norm": 1.015625, "learning_rate": 0.00025111998949850446, "loss": 5.4336, "mean_token_accuracy": 0.2194457858800888, "num_tokens": 118430760.0, "step": 46725 }, { "entropy": 6.02965669631958, "epoch": 5.392960184650894, "grad_norm": 1.046875, "learning_rate": 0.00025107895861357834, "loss": 5.4203, "mean_token_accuracy": 0.216534985601902, "num_tokens": 118443010.0, "step": 46730 }, { "entropy": 6.018858575820923, "epoch": 5.393537218695903, "grad_norm": 1.046875, "learning_rate": 0.00025103792853322445, "loss": 5.3264, "mean_token_accuracy": 0.22580075562000274, "num_tokens": 118454712.0, "step": 46735 }, { "entropy": 5.959798383712768, "epoch": 5.394114252740912, "grad_norm": 1.109375, "learning_rate": 0.00025099689925882297, "loss": 5.3754, "mean_token_accuracy": 0.22562704086303711, "num_tokens": 118468362.0, "step": 46740 }, { "entropy": 6.018317937850952, "epoch": 5.39469128678592, "grad_norm": 1.03125, "learning_rate": 0.0002509558707917538, "loss": 5.438, "mean_token_accuracy": 0.22785538882017137, "num_tokens": 118481015.0, "step": 46745 }, { "entropy": 6.055947971343994, "epoch": 5.395268320830929, "grad_norm": 1.0234375, "learning_rate": 0.00025091484313339706, "loss": 5.4383, "mean_token_accuracy": 0.22215741276741027, "num_tokens": 118493843.0, "step": 46750 }, { "entropy": 6.095442914962769, "epoch": 5.395845354875938, "grad_norm": 1.0703125, "learning_rate": 0.00025087381628513257, "loss": 5.5172, "mean_token_accuracy": 0.21285209506750108, "num_tokens": 118506635.0, "step": 46755 }, { "entropy": 6.137464237213135, "epoch": 5.396422388920946, "grad_norm": 1.046875, "learning_rate": 0.00025083279024834033, "loss": 5.4979, "mean_token_accuracy": 0.2162633016705513, "num_tokens": 118518767.0, "step": 46760 }, { "entropy": 6.085399866104126, "epoch": 5.396999422965955, "grad_norm": 0.98828125, "learning_rate": 0.0002507917650244001, "loss": 5.4318, "mean_token_accuracy": 0.219040122628212, "num_tokens": 118531347.0, "step": 46765 }, { "entropy": 6.053800201416015, "epoch": 5.397576457010963, "grad_norm": 1.03125, "learning_rate": 0.00025075074061469197, "loss": 5.4698, "mean_token_accuracy": 0.21922803223133086, "num_tokens": 118545076.0, "step": 46770 }, { "entropy": 6.042861080169677, "epoch": 5.3981534910559725, "grad_norm": 1.03125, "learning_rate": 0.00025070971702059546, "loss": 5.4149, "mean_token_accuracy": 0.2174384132027626, "num_tokens": 118557978.0, "step": 46775 }, { "entropy": 6.042640209197998, "epoch": 5.398730525100981, "grad_norm": 1.046875, "learning_rate": 0.00025066869424349066, "loss": 5.4293, "mean_token_accuracy": 0.22148347347974778, "num_tokens": 118569763.0, "step": 46780 }, { "entropy": 6.07701416015625, "epoch": 5.399307559145989, "grad_norm": 1.0234375, "learning_rate": 0.0002506276722847571, "loss": 5.3932, "mean_token_accuracy": 0.21393050849437714, "num_tokens": 118583189.0, "step": 46785 }, { "entropy": 6.080574226379395, "epoch": 5.399884593190999, "grad_norm": 1.09375, "learning_rate": 0.0002505866511457749, "loss": 5.5012, "mean_token_accuracy": 0.21454430967569352, "num_tokens": 118595532.0, "step": 46790 }, { "entropy": 5.862489509582519, "epoch": 5.400461627236007, "grad_norm": 1.046875, "learning_rate": 0.00025054563082792345, "loss": 5.2306, "mean_token_accuracy": 0.24630296677351, "num_tokens": 118607534.0, "step": 46795 }, { "entropy": 6.084830188751221, "epoch": 5.4010386612810155, "grad_norm": 1.0859375, "learning_rate": 0.0002505046113325825, "loss": 5.4613, "mean_token_accuracy": 0.21699014753103257, "num_tokens": 118619264.0, "step": 46800 }, { "entropy": 6.0267627239227295, "epoch": 5.401615695326024, "grad_norm": 0.99609375, "learning_rate": 0.00025046359266113184, "loss": 5.4466, "mean_token_accuracy": 0.22269827127456665, "num_tokens": 118632341.0, "step": 46805 }, { "entropy": 6.027035236358643, "epoch": 5.402192729371033, "grad_norm": 0.953125, "learning_rate": 0.0002504225748149511, "loss": 5.467, "mean_token_accuracy": 0.22000111639499664, "num_tokens": 118645537.0, "step": 46810 }, { "entropy": 6.041680765151978, "epoch": 5.402769763416042, "grad_norm": 1.0078125, "learning_rate": 0.00025038155779541976, "loss": 5.3922, "mean_token_accuracy": 0.22586773037910463, "num_tokens": 118658031.0, "step": 46815 }, { "entropy": 6.017295837402344, "epoch": 5.40334679746105, "grad_norm": 0.98046875, "learning_rate": 0.0002503405416039176, "loss": 5.4335, "mean_token_accuracy": 0.21777289360761642, "num_tokens": 118671521.0, "step": 46820 }, { "entropy": 6.067204761505127, "epoch": 5.4039238315060585, "grad_norm": 0.9453125, "learning_rate": 0.00025029952624182393, "loss": 5.4342, "mean_token_accuracy": 0.22069837152957916, "num_tokens": 118685069.0, "step": 46825 }, { "entropy": 6.059438848495484, "epoch": 5.404500865551068, "grad_norm": 0.9296875, "learning_rate": 0.0002502585117105186, "loss": 5.3808, "mean_token_accuracy": 0.22172050029039383, "num_tokens": 118697423.0, "step": 46830 }, { "entropy": 5.96149320602417, "epoch": 5.405077899596076, "grad_norm": 1.0546875, "learning_rate": 0.0002502174980113808, "loss": 5.3576, "mean_token_accuracy": 0.2294830098748207, "num_tokens": 118710970.0, "step": 46835 }, { "entropy": 6.01069450378418, "epoch": 5.405654933641085, "grad_norm": 1.0390625, "learning_rate": 0.00025017648514579014, "loss": 5.395, "mean_token_accuracy": 0.22226380854845046, "num_tokens": 118723915.0, "step": 46840 }, { "entropy": 5.9598448276519775, "epoch": 5.406231967686093, "grad_norm": 0.984375, "learning_rate": 0.00025013547311512614, "loss": 5.3552, "mean_token_accuracy": 0.23078590780496597, "num_tokens": 118736917.0, "step": 46845 }, { "entropy": 6.065068340301513, "epoch": 5.406809001731102, "grad_norm": 0.9765625, "learning_rate": 0.0002500944619207682, "loss": 5.4971, "mean_token_accuracy": 0.2155863255262375, "num_tokens": 118748420.0, "step": 46850 }, { "entropy": 5.963948822021484, "epoch": 5.407386035776111, "grad_norm": 0.97265625, "learning_rate": 0.00025005345156409555, "loss": 5.3579, "mean_token_accuracy": 0.2259705826640129, "num_tokens": 118760388.0, "step": 46855 }, { "entropy": 5.962028932571411, "epoch": 5.407963069821119, "grad_norm": 0.96484375, "learning_rate": 0.0002500124420464877, "loss": 5.3629, "mean_token_accuracy": 0.22914329767227173, "num_tokens": 118773317.0, "step": 46860 }, { "entropy": 6.106974172592163, "epoch": 5.4085401038661285, "grad_norm": 1.125, "learning_rate": 0.0002499714333693239, "loss": 5.5269, "mean_token_accuracy": 0.2157278537750244, "num_tokens": 118786435.0, "step": 46865 }, { "entropy": 6.147992467880249, "epoch": 5.409117137911137, "grad_norm": 0.984375, "learning_rate": 0.00024993042553398363, "loss": 5.5075, "mean_token_accuracy": 0.21184257715940474, "num_tokens": 118798567.0, "step": 46870 }, { "entropy": 5.9270271301269535, "epoch": 5.409694171956145, "grad_norm": 1.140625, "learning_rate": 0.0002498894185418459, "loss": 5.2974, "mean_token_accuracy": 0.2363997533917427, "num_tokens": 118811199.0, "step": 46875 }, { "entropy": 5.978492498397827, "epoch": 5.410271206001154, "grad_norm": 1.078125, "learning_rate": 0.00024984841239429026, "loss": 5.4237, "mean_token_accuracy": 0.2273360162973404, "num_tokens": 118824544.0, "step": 46880 }, { "entropy": 6.010010290145874, "epoch": 5.410848240046163, "grad_norm": 0.9609375, "learning_rate": 0.0002498074070926956, "loss": 5.4176, "mean_token_accuracy": 0.2197552815079689, "num_tokens": 118838687.0, "step": 46885 }, { "entropy": 6.03066782951355, "epoch": 5.4114252740911715, "grad_norm": 1.125, "learning_rate": 0.00024976640263844153, "loss": 5.3977, "mean_token_accuracy": 0.2246936932206154, "num_tokens": 118851122.0, "step": 46890 }, { "entropy": 5.975719356536866, "epoch": 5.41200230813618, "grad_norm": 1.0703125, "learning_rate": 0.00024972539903290677, "loss": 5.3595, "mean_token_accuracy": 0.22878360748291016, "num_tokens": 118862870.0, "step": 46895 }, { "entropy": 5.945103025436401, "epoch": 5.412579342181188, "grad_norm": 1.171875, "learning_rate": 0.0002496843962774707, "loss": 5.3014, "mean_token_accuracy": 0.2252539098262787, "num_tokens": 118875085.0, "step": 46900 }, { "entropy": 5.874655103683471, "epoch": 5.413156376226198, "grad_norm": 0.94140625, "learning_rate": 0.00024964339437351233, "loss": 5.2425, "mean_token_accuracy": 0.23313433825969695, "num_tokens": 118887638.0, "step": 46905 }, { "entropy": 5.942875909805298, "epoch": 5.413733410271206, "grad_norm": 1.0625, "learning_rate": 0.00024960239332241096, "loss": 5.321, "mean_token_accuracy": 0.22468236982822418, "num_tokens": 118901156.0, "step": 46910 }, { "entropy": 6.001813459396362, "epoch": 5.414310444316214, "grad_norm": 1.0703125, "learning_rate": 0.0002495613931255454, "loss": 5.3554, "mean_token_accuracy": 0.23009416908025743, "num_tokens": 118913570.0, "step": 46915 }, { "entropy": 6.005325078964233, "epoch": 5.414887478361223, "grad_norm": 1.078125, "learning_rate": 0.00024952039378429476, "loss": 5.4258, "mean_token_accuracy": 0.22464391142129897, "num_tokens": 118926462.0, "step": 46920 }, { "entropy": 6.036478805541992, "epoch": 5.415464512406232, "grad_norm": 1.109375, "learning_rate": 0.0002494793953000379, "loss": 5.4351, "mean_token_accuracy": 0.22260603159666062, "num_tokens": 118938457.0, "step": 46925 }, { "entropy": 5.873511743545532, "epoch": 5.416041546451241, "grad_norm": 1.140625, "learning_rate": 0.00024943839767415407, "loss": 5.2642, "mean_token_accuracy": 0.2437032252550125, "num_tokens": 118951256.0, "step": 46930 }, { "entropy": 5.981058263778687, "epoch": 5.416618580496249, "grad_norm": 1.0546875, "learning_rate": 0.00024939740090802195, "loss": 5.3289, "mean_token_accuracy": 0.23051441758871077, "num_tokens": 118964416.0, "step": 46935 }, { "entropy": 6.091514682769775, "epoch": 5.417195614541258, "grad_norm": 0.94140625, "learning_rate": 0.00024935640500302054, "loss": 5.4645, "mean_token_accuracy": 0.2147015541791916, "num_tokens": 118977723.0, "step": 46940 }, { "entropy": 6.041667222976685, "epoch": 5.417772648586267, "grad_norm": 1.1015625, "learning_rate": 0.00024931540996052864, "loss": 5.4267, "mean_token_accuracy": 0.21578050553798675, "num_tokens": 118990050.0, "step": 46945 }, { "entropy": 6.0305774211883545, "epoch": 5.418349682631275, "grad_norm": 1.0, "learning_rate": 0.00024927441578192523, "loss": 5.4392, "mean_token_accuracy": 0.2179943487048149, "num_tokens": 119002388.0, "step": 46950 }, { "entropy": 6.064316082000732, "epoch": 5.418926716676284, "grad_norm": 0.9921875, "learning_rate": 0.00024923342246858915, "loss": 5.4766, "mean_token_accuracy": 0.21512299329042434, "num_tokens": 119013058.0, "step": 46955 }, { "entropy": 6.063048267364502, "epoch": 5.419503750721293, "grad_norm": 1.0625, "learning_rate": 0.00024919243002189897, "loss": 5.5153, "mean_token_accuracy": 0.2197794571518898, "num_tokens": 119024280.0, "step": 46960 }, { "entropy": 6.019555902481079, "epoch": 5.420080784766301, "grad_norm": 1.0546875, "learning_rate": 0.0002491514384432337, "loss": 5.4272, "mean_token_accuracy": 0.22230074852705, "num_tokens": 119037219.0, "step": 46965 }, { "entropy": 6.047335577011109, "epoch": 5.42065781881131, "grad_norm": 1.0234375, "learning_rate": 0.00024911044773397184, "loss": 5.4507, "mean_token_accuracy": 0.21714093387126923, "num_tokens": 119050924.0, "step": 46970 }, { "entropy": 6.083111000061035, "epoch": 5.421234852856318, "grad_norm": 1.015625, "learning_rate": 0.00024906945789549234, "loss": 5.4488, "mean_token_accuracy": 0.22303324788808823, "num_tokens": 119063496.0, "step": 46975 }, { "entropy": 5.966890525817871, "epoch": 5.421811886901327, "grad_norm": 1.0625, "learning_rate": 0.00024902846892917364, "loss": 5.3495, "mean_token_accuracy": 0.21838210970163346, "num_tokens": 119076205.0, "step": 46980 }, { "entropy": 6.060811519622803, "epoch": 5.422388920946336, "grad_norm": 0.92578125, "learning_rate": 0.00024898748083639457, "loss": 5.4442, "mean_token_accuracy": 0.2119682490825653, "num_tokens": 119087892.0, "step": 46985 }, { "entropy": 6.006797504425049, "epoch": 5.422965954991344, "grad_norm": 0.90234375, "learning_rate": 0.0002489464936185336, "loss": 5.3869, "mean_token_accuracy": 0.22254968285560608, "num_tokens": 119100533.0, "step": 46990 }, { "entropy": 6.032630777359008, "epoch": 5.423542989036353, "grad_norm": 1.078125, "learning_rate": 0.0002489055072769694, "loss": 5.4273, "mean_token_accuracy": 0.22533710896968842, "num_tokens": 119112901.0, "step": 46995 }, { "entropy": 6.030189371109008, "epoch": 5.424120023081362, "grad_norm": 1.0078125, "learning_rate": 0.00024886452181308044, "loss": 5.378, "mean_token_accuracy": 0.22474608123302459, "num_tokens": 119125468.0, "step": 47000 }, { "entropy": 6.04746446609497, "epoch": 5.42469705712637, "grad_norm": 1.078125, "learning_rate": 0.0002488235372282454, "loss": 5.4246, "mean_token_accuracy": 0.2229582354426384, "num_tokens": 119137986.0, "step": 47005 }, { "entropy": 6.011452722549438, "epoch": 5.425274091171379, "grad_norm": 0.98046875, "learning_rate": 0.0002487825535238426, "loss": 5.3885, "mean_token_accuracy": 0.22094323486089706, "num_tokens": 119150889.0, "step": 47010 }, { "entropy": 5.966135263442993, "epoch": 5.425851125216388, "grad_norm": 1.1484375, "learning_rate": 0.0002487415707012507, "loss": 5.3353, "mean_token_accuracy": 0.22834445238113404, "num_tokens": 119162923.0, "step": 47015 }, { "entropy": 6.033320713043213, "epoch": 5.4264281592613965, "grad_norm": 0.98046875, "learning_rate": 0.0002487005887618479, "loss": 5.4682, "mean_token_accuracy": 0.22073763906955718, "num_tokens": 119175793.0, "step": 47020 }, { "entropy": 6.045900058746338, "epoch": 5.427005193306405, "grad_norm": 0.9765625, "learning_rate": 0.00024865960770701284, "loss": 5.4847, "mean_token_accuracy": 0.21898182332515717, "num_tokens": 119188177.0, "step": 47025 }, { "entropy": 6.0004877090454105, "epoch": 5.427582227351413, "grad_norm": 1.2109375, "learning_rate": 0.0002486186275381237, "loss": 5.3371, "mean_token_accuracy": 0.23148736357688904, "num_tokens": 119200928.0, "step": 47030 }, { "entropy": 6.0511674880981445, "epoch": 5.428159261396423, "grad_norm": 1.0859375, "learning_rate": 0.00024857764825655904, "loss": 5.4538, "mean_token_accuracy": 0.21596154272556306, "num_tokens": 119212585.0, "step": 47035 }, { "entropy": 6.014525270462036, "epoch": 5.428736295441431, "grad_norm": 1.0390625, "learning_rate": 0.00024853666986369695, "loss": 5.3913, "mean_token_accuracy": 0.22385192662477493, "num_tokens": 119224794.0, "step": 47040 }, { "entropy": 6.081261444091797, "epoch": 5.4293133294864395, "grad_norm": 1.0703125, "learning_rate": 0.00024849569236091583, "loss": 5.4042, "mean_token_accuracy": 0.2265527844429016, "num_tokens": 119237606.0, "step": 47045 }, { "entropy": 5.873202133178711, "epoch": 5.429890363531449, "grad_norm": 1.0625, "learning_rate": 0.00024845471574959393, "loss": 5.2988, "mean_token_accuracy": 0.2256266549229622, "num_tokens": 119250883.0, "step": 47050 }, { "entropy": 5.921171760559082, "epoch": 5.430467397576457, "grad_norm": 1.03125, "learning_rate": 0.00024841374003110953, "loss": 5.3223, "mean_token_accuracy": 0.23034353107213973, "num_tokens": 119263044.0, "step": 47055 }, { "entropy": 5.994158124923706, "epoch": 5.431044431621466, "grad_norm": 1.0234375, "learning_rate": 0.0002483727652068408, "loss": 5.3592, "mean_token_accuracy": 0.23060242831707, "num_tokens": 119275504.0, "step": 47060 }, { "entropy": 6.015261316299439, "epoch": 5.431621465666474, "grad_norm": 1.0703125, "learning_rate": 0.0002483317912781658, "loss": 5.3986, "mean_token_accuracy": 0.22417777627706528, "num_tokens": 119288144.0, "step": 47065 }, { "entropy": 6.042486000061035, "epoch": 5.432198499711483, "grad_norm": 0.9921875, "learning_rate": 0.00024829081824646274, "loss": 5.3955, "mean_token_accuracy": 0.2259470283985138, "num_tokens": 119301897.0, "step": 47070 }, { "entropy": 5.942798328399658, "epoch": 5.432775533756492, "grad_norm": 1.09375, "learning_rate": 0.00024824984611310983, "loss": 5.3177, "mean_token_accuracy": 0.2392435312271118, "num_tokens": 119315401.0, "step": 47075 }, { "entropy": 6.0097898006439205, "epoch": 5.4333525678015, "grad_norm": 1.109375, "learning_rate": 0.000248208874879485, "loss": 5.4164, "mean_token_accuracy": 0.21938502490520478, "num_tokens": 119328329.0, "step": 47080 }, { "entropy": 6.084555006027221, "epoch": 5.433929601846509, "grad_norm": 0.96875, "learning_rate": 0.00024816790454696645, "loss": 5.5007, "mean_token_accuracy": 0.21589263379573823, "num_tokens": 119341056.0, "step": 47085 }, { "entropy": 6.096207046508789, "epoch": 5.434506635891518, "grad_norm": 1.046875, "learning_rate": 0.00024812693511693196, "loss": 5.517, "mean_token_accuracy": 0.21363582462072372, "num_tokens": 119351902.0, "step": 47090 }, { "entropy": 6.0990509510040285, "epoch": 5.435083669936526, "grad_norm": 0.984375, "learning_rate": 0.00024808596659075985, "loss": 5.526, "mean_token_accuracy": 0.2152347519993782, "num_tokens": 119365129.0, "step": 47095 }, { "entropy": 6.109220790863037, "epoch": 5.435660703981535, "grad_norm": 1.0390625, "learning_rate": 0.0002480449989698277, "loss": 5.5087, "mean_token_accuracy": 0.21715941578149794, "num_tokens": 119376877.0, "step": 47100 }, { "entropy": 6.0271636009216305, "epoch": 5.436237738026543, "grad_norm": 1.0546875, "learning_rate": 0.0002480040322555137, "loss": 5.4222, "mean_token_accuracy": 0.2216916099190712, "num_tokens": 119388797.0, "step": 47105 }, { "entropy": 6.0596565246582035, "epoch": 5.4368147720715525, "grad_norm": 1.0, "learning_rate": 0.0002479630664491956, "loss": 5.4518, "mean_token_accuracy": 0.2175812765955925, "num_tokens": 119400892.0, "step": 47110 }, { "entropy": 6.068880605697632, "epoch": 5.437391806116561, "grad_norm": 1.0234375, "learning_rate": 0.00024792210155225145, "loss": 5.4357, "mean_token_accuracy": 0.21811304092407227, "num_tokens": 119412486.0, "step": 47115 }, { "entropy": 6.034269189834594, "epoch": 5.437968840161569, "grad_norm": 1.0703125, "learning_rate": 0.00024788113756605884, "loss": 5.4436, "mean_token_accuracy": 0.2227180063724518, "num_tokens": 119425878.0, "step": 47120 }, { "entropy": 5.984864950180054, "epoch": 5.438545874206579, "grad_norm": 1.0546875, "learning_rate": 0.0002478401744919958, "loss": 5.3774, "mean_token_accuracy": 0.2204645276069641, "num_tokens": 119438644.0, "step": 47125 }, { "entropy": 6.059547328948975, "epoch": 5.439122908251587, "grad_norm": 1.0078125, "learning_rate": 0.0002477992123314399, "loss": 5.4077, "mean_token_accuracy": 0.21533680707216263, "num_tokens": 119451385.0, "step": 47130 }, { "entropy": 6.066489791870117, "epoch": 5.4396999422965955, "grad_norm": 1.0234375, "learning_rate": 0.00024775825108576903, "loss": 5.4629, "mean_token_accuracy": 0.22821397781372071, "num_tokens": 119462742.0, "step": 47135 }, { "entropy": 6.0465186595916744, "epoch": 5.440276976341604, "grad_norm": 1.1015625, "learning_rate": 0.00024771729075636083, "loss": 5.4575, "mean_token_accuracy": 0.22218911349773407, "num_tokens": 119474996.0, "step": 47140 }, { "entropy": 6.062842798233032, "epoch": 5.440854010386613, "grad_norm": 1.109375, "learning_rate": 0.0002476763313445931, "loss": 5.4655, "mean_token_accuracy": 0.21930796951055526, "num_tokens": 119486331.0, "step": 47145 }, { "entropy": 6.011796617507935, "epoch": 5.441431044431622, "grad_norm": 1.0078125, "learning_rate": 0.00024763537285184327, "loss": 5.4387, "mean_token_accuracy": 0.2246139571070671, "num_tokens": 119500081.0, "step": 47150 }, { "entropy": 6.094286584854126, "epoch": 5.44200807847663, "grad_norm": 1.0625, "learning_rate": 0.0002475944152794892, "loss": 5.4985, "mean_token_accuracy": 0.22111781239509581, "num_tokens": 119512991.0, "step": 47155 }, { "entropy": 6.101238059997558, "epoch": 5.4425851125216385, "grad_norm": 0.99609375, "learning_rate": 0.0002475534586289082, "loss": 5.5133, "mean_token_accuracy": 0.21180179566144944, "num_tokens": 119526051.0, "step": 47160 }, { "entropy": 6.094206428527832, "epoch": 5.443162146566648, "grad_norm": 1.0234375, "learning_rate": 0.0002475125029014782, "loss": 5.4585, "mean_token_accuracy": 0.21571704000234604, "num_tokens": 119537609.0, "step": 47165 }, { "entropy": 6.02075343132019, "epoch": 5.443739180611656, "grad_norm": 1.046875, "learning_rate": 0.0002474715480985763, "loss": 5.4065, "mean_token_accuracy": 0.22066868096590042, "num_tokens": 119550082.0, "step": 47170 }, { "entropy": 5.954913234710693, "epoch": 5.444316214656665, "grad_norm": 1.015625, "learning_rate": 0.00024743059422158034, "loss": 5.3359, "mean_token_accuracy": 0.2281467780470848, "num_tokens": 119562304.0, "step": 47175 }, { "entropy": 6.028477954864502, "epoch": 5.444893248701673, "grad_norm": 1.0546875, "learning_rate": 0.0002473896412718675, "loss": 5.4589, "mean_token_accuracy": 0.22400152385234834, "num_tokens": 119575040.0, "step": 47180 }, { "entropy": 6.048852777481079, "epoch": 5.445470282746682, "grad_norm": 1.015625, "learning_rate": 0.0002473486892508156, "loss": 5.5052, "mean_token_accuracy": 0.21516649127006532, "num_tokens": 119587136.0, "step": 47185 }, { "entropy": 6.073791122436523, "epoch": 5.446047316791691, "grad_norm": 1.0390625, "learning_rate": 0.0002473077381598016, "loss": 5.4069, "mean_token_accuracy": 0.21754737198352814, "num_tokens": 119598831.0, "step": 47190 }, { "entropy": 6.111522626876831, "epoch": 5.446624350836699, "grad_norm": 0.95703125, "learning_rate": 0.0002472667880002032, "loss": 5.4937, "mean_token_accuracy": 0.21168259680271148, "num_tokens": 119611529.0, "step": 47195 }, { "entropy": 6.0160486698150635, "epoch": 5.4472013848817085, "grad_norm": 0.9921875, "learning_rate": 0.0002472258387733975, "loss": 5.409, "mean_token_accuracy": 0.22990969717502593, "num_tokens": 119623964.0, "step": 47200 }, { "entropy": 6.066016721725464, "epoch": 5.447778418926717, "grad_norm": 0.9375, "learning_rate": 0.000247184890480762, "loss": 5.5077, "mean_token_accuracy": 0.21833514273166657, "num_tokens": 119637407.0, "step": 47205 }, { "entropy": 6.018775701522827, "epoch": 5.448355452971725, "grad_norm": 1.0078125, "learning_rate": 0.0002471439431236738, "loss": 5.4155, "mean_token_accuracy": 0.21863548308610917, "num_tokens": 119650539.0, "step": 47210 }, { "entropy": 6.133881425857544, "epoch": 5.448932487016734, "grad_norm": 1.09375, "learning_rate": 0.00024710299670351033, "loss": 5.5008, "mean_token_accuracy": 0.21724879145622253, "num_tokens": 119662793.0, "step": 47215 }, { "entropy": 6.106074523925781, "epoch": 5.449509521061743, "grad_norm": 1.03125, "learning_rate": 0.0002470620512216486, "loss": 5.5232, "mean_token_accuracy": 0.21195166260004045, "num_tokens": 119675866.0, "step": 47220 }, { "entropy": 6.070609426498413, "epoch": 5.450086555106751, "grad_norm": 0.97265625, "learning_rate": 0.00024702110667946603, "loss": 5.4365, "mean_token_accuracy": 0.2222458690404892, "num_tokens": 119688667.0, "step": 47225 }, { "entropy": 6.04173092842102, "epoch": 5.45066358915176, "grad_norm": 0.99609375, "learning_rate": 0.0002469801630783395, "loss": 5.4111, "mean_token_accuracy": 0.21891222149133682, "num_tokens": 119701432.0, "step": 47230 }, { "entropy": 5.903676891326905, "epoch": 5.451240623196768, "grad_norm": 1.046875, "learning_rate": 0.0002469392204196464, "loss": 5.3025, "mean_token_accuracy": 0.22939080744981766, "num_tokens": 119714824.0, "step": 47235 }, { "entropy": 6.072595071792603, "epoch": 5.451817657241778, "grad_norm": 1.1328125, "learning_rate": 0.0002468982787047636, "loss": 5.4491, "mean_token_accuracy": 0.2178298532962799, "num_tokens": 119726647.0, "step": 47240 }, { "entropy": 5.997278881072998, "epoch": 5.452394691286786, "grad_norm": 1.015625, "learning_rate": 0.0002468573379350684, "loss": 5.3815, "mean_token_accuracy": 0.2236155554652214, "num_tokens": 119738755.0, "step": 47245 }, { "entropy": 5.907790088653565, "epoch": 5.452971725331794, "grad_norm": 1.0390625, "learning_rate": 0.0002468163981119375, "loss": 5.2945, "mean_token_accuracy": 0.22780349850654602, "num_tokens": 119751682.0, "step": 47250 }, { "entropy": 6.148678159713745, "epoch": 5.453548759376803, "grad_norm": 1.0078125, "learning_rate": 0.000246775459236748, "loss": 5.5637, "mean_token_accuracy": 0.2070833995938301, "num_tokens": 119764283.0, "step": 47255 }, { "entropy": 6.072327899932861, "epoch": 5.454125793421812, "grad_norm": 1.0625, "learning_rate": 0.000246734521310877, "loss": 5.4178, "mean_token_accuracy": 0.21845017075538636, "num_tokens": 119776605.0, "step": 47260 }, { "entropy": 6.12420072555542, "epoch": 5.454702827466821, "grad_norm": 1.0390625, "learning_rate": 0.00024669358433570133, "loss": 5.501, "mean_token_accuracy": 0.21198708266019822, "num_tokens": 119789097.0, "step": 47265 }, { "entropy": 5.979126930236816, "epoch": 5.455279861511829, "grad_norm": 1.0, "learning_rate": 0.00024665264831259787, "loss": 5.34, "mean_token_accuracy": 0.23209788352251054, "num_tokens": 119802007.0, "step": 47270 }, { "entropy": 6.051213169097901, "epoch": 5.455856895556838, "grad_norm": 0.98828125, "learning_rate": 0.00024661171324294353, "loss": 5.4513, "mean_token_accuracy": 0.2172643020749092, "num_tokens": 119814322.0, "step": 47275 }, { "entropy": 6.064874839782715, "epoch": 5.456433929601847, "grad_norm": 1.09375, "learning_rate": 0.00024657077912811504, "loss": 5.5199, "mean_token_accuracy": 0.211814284324646, "num_tokens": 119827417.0, "step": 47280 }, { "entropy": 6.066554260253906, "epoch": 5.457010963646855, "grad_norm": 1.0078125, "learning_rate": 0.0002465298459694894, "loss": 5.456, "mean_token_accuracy": 0.219671568274498, "num_tokens": 119839914.0, "step": 47285 }, { "entropy": 5.995786046981811, "epoch": 5.4575879976918635, "grad_norm": 1.015625, "learning_rate": 0.00024648891376844313, "loss": 5.3774, "mean_token_accuracy": 0.2309603810310364, "num_tokens": 119852685.0, "step": 47290 }, { "entropy": 6.085952377319336, "epoch": 5.458165031736873, "grad_norm": 1.125, "learning_rate": 0.00024644798252635314, "loss": 5.5347, "mean_token_accuracy": 0.21341227889060974, "num_tokens": 119865329.0, "step": 47295 }, { "entropy": 6.077068901062011, "epoch": 5.458742065781881, "grad_norm": 1.046875, "learning_rate": 0.00024640705224459605, "loss": 5.5226, "mean_token_accuracy": 0.21247559487819673, "num_tokens": 119876706.0, "step": 47300 }, { "entropy": 6.052985143661499, "epoch": 5.45931909982689, "grad_norm": 0.984375, "learning_rate": 0.0002463661229245486, "loss": 5.409, "mean_token_accuracy": 0.2194671928882599, "num_tokens": 119890326.0, "step": 47305 }, { "entropy": 6.067802047729492, "epoch": 5.459896133871898, "grad_norm": 1.0703125, "learning_rate": 0.00024632519456758734, "loss": 5.3982, "mean_token_accuracy": 0.22458083927631378, "num_tokens": 119902502.0, "step": 47310 }, { "entropy": 6.1157200813293455, "epoch": 5.460473167916907, "grad_norm": 1.0, "learning_rate": 0.00024628426717508895, "loss": 5.5868, "mean_token_accuracy": 0.20857702940702438, "num_tokens": 119915454.0, "step": 47315 }, { "entropy": 5.999802494049073, "epoch": 5.461050201961916, "grad_norm": 0.9765625, "learning_rate": 0.0002462433407484299, "loss": 5.418, "mean_token_accuracy": 0.22297434657812118, "num_tokens": 119928719.0, "step": 47320 }, { "entropy": 5.989492988586425, "epoch": 5.461627236006924, "grad_norm": 0.94140625, "learning_rate": 0.0002462024152889869, "loss": 5.3809, "mean_token_accuracy": 0.2281783863902092, "num_tokens": 119940441.0, "step": 47325 }, { "entropy": 6.043868541717529, "epoch": 5.462204270051933, "grad_norm": 1.015625, "learning_rate": 0.0002461614907981363, "loss": 5.4194, "mean_token_accuracy": 0.21828266978263855, "num_tokens": 119953262.0, "step": 47330 }, { "entropy": 6.0951252460479735, "epoch": 5.462781304096942, "grad_norm": 0.98828125, "learning_rate": 0.00024612056727725464, "loss": 5.4896, "mean_token_accuracy": 0.21910643726587295, "num_tokens": 119966154.0, "step": 47335 }, { "entropy": 6.067836284637451, "epoch": 5.46335833814195, "grad_norm": 1.078125, "learning_rate": 0.00024607964472771833, "loss": 5.4219, "mean_token_accuracy": 0.21964521259069442, "num_tokens": 119978595.0, "step": 47340 }, { "entropy": 6.003082799911499, "epoch": 5.463935372186959, "grad_norm": 1.0078125, "learning_rate": 0.00024603872315090387, "loss": 5.3282, "mean_token_accuracy": 0.2387758955359459, "num_tokens": 119991226.0, "step": 47345 }, { "entropy": 6.026238059997558, "epoch": 5.464512406231968, "grad_norm": 1.015625, "learning_rate": 0.0002459978025481875, "loss": 5.4525, "mean_token_accuracy": 0.21932094395160676, "num_tokens": 120004783.0, "step": 47350 }, { "entropy": 6.07522497177124, "epoch": 5.4650894402769765, "grad_norm": 1.0703125, "learning_rate": 0.0002459568829209456, "loss": 5.4665, "mean_token_accuracy": 0.2183040276169777, "num_tokens": 120017218.0, "step": 47355 }, { "entropy": 6.029198360443115, "epoch": 5.465666474321985, "grad_norm": 0.984375, "learning_rate": 0.0002459159642705546, "loss": 5.3945, "mean_token_accuracy": 0.23083268254995346, "num_tokens": 120030436.0, "step": 47360 }, { "entropy": 6.066330432891846, "epoch": 5.466243508366993, "grad_norm": 1.03125, "learning_rate": 0.0002458750465983907, "loss": 5.4748, "mean_token_accuracy": 0.21342501789331436, "num_tokens": 120042214.0, "step": 47365 }, { "entropy": 6.032370567321777, "epoch": 5.466820542412003, "grad_norm": 0.953125, "learning_rate": 0.00024583412990583013, "loss": 5.4469, "mean_token_accuracy": 0.21803742051124572, "num_tokens": 120055215.0, "step": 47370 }, { "entropy": 6.115511178970337, "epoch": 5.467397576457011, "grad_norm": 1.078125, "learning_rate": 0.00024579321419424904, "loss": 5.4174, "mean_token_accuracy": 0.21940379440784455, "num_tokens": 120068549.0, "step": 47375 }, { "entropy": 6.080186271667481, "epoch": 5.4679746105020195, "grad_norm": 0.97265625, "learning_rate": 0.00024575229946502376, "loss": 5.4795, "mean_token_accuracy": 0.22196500301361083, "num_tokens": 120082753.0, "step": 47380 }, { "entropy": 5.95504903793335, "epoch": 5.468551644547028, "grad_norm": 1.03125, "learning_rate": 0.00024571138571953034, "loss": 5.4048, "mean_token_accuracy": 0.22288473397493364, "num_tokens": 120096109.0, "step": 47385 }, { "entropy": 6.061520910263061, "epoch": 5.469128678592037, "grad_norm": 0.984375, "learning_rate": 0.00024567047295914496, "loss": 5.4399, "mean_token_accuracy": 0.21826471835374833, "num_tokens": 120108033.0, "step": 47390 }, { "entropy": 6.005728721618652, "epoch": 5.469705712637046, "grad_norm": 1.0, "learning_rate": 0.00024562956118524354, "loss": 5.3914, "mean_token_accuracy": 0.22716316133737563, "num_tokens": 120121467.0, "step": 47395 }, { "entropy": 6.070115566253662, "epoch": 5.470282746682054, "grad_norm": 1.0, "learning_rate": 0.00024558865039920236, "loss": 5.4438, "mean_token_accuracy": 0.21918773651123047, "num_tokens": 120132979.0, "step": 47400 }, { "entropy": 6.097302722930908, "epoch": 5.4708597807270625, "grad_norm": 1.0, "learning_rate": 0.0002455477406023972, "loss": 5.4285, "mean_token_accuracy": 0.2207154229283333, "num_tokens": 120144743.0, "step": 47405 }, { "entropy": 6.05715045928955, "epoch": 5.471436814772072, "grad_norm": 0.96484375, "learning_rate": 0.00024550683179620433, "loss": 5.4517, "mean_token_accuracy": 0.2223209857940674, "num_tokens": 120157487.0, "step": 47410 }, { "entropy": 6.003508853912353, "epoch": 5.47201384881708, "grad_norm": 1.109375, "learning_rate": 0.00024546592398199936, "loss": 5.3884, "mean_token_accuracy": 0.22468466758728028, "num_tokens": 120170622.0, "step": 47415 }, { "entropy": 5.987598085403443, "epoch": 5.472590882862089, "grad_norm": 1.0078125, "learning_rate": 0.0002454250171611584, "loss": 5.334, "mean_token_accuracy": 0.23570979833602906, "num_tokens": 120184215.0, "step": 47420 }, { "entropy": 6.058071231842041, "epoch": 5.473167916907098, "grad_norm": 1.0, "learning_rate": 0.0002453841113350573, "loss": 5.4062, "mean_token_accuracy": 0.2212895005941391, "num_tokens": 120196058.0, "step": 47425 }, { "entropy": 6.015315103530884, "epoch": 5.473744950952106, "grad_norm": 1.0078125, "learning_rate": 0.00024534320650507197, "loss": 5.501, "mean_token_accuracy": 0.2167505294084549, "num_tokens": 120208823.0, "step": 47430 }, { "entropy": 6.053440952301026, "epoch": 5.474321984997115, "grad_norm": 1.0625, "learning_rate": 0.000245302302672578, "loss": 5.3932, "mean_token_accuracy": 0.23017980754375458, "num_tokens": 120220081.0, "step": 47435 }, { "entropy": 6.083408975601197, "epoch": 5.474899019042123, "grad_norm": 1.0546875, "learning_rate": 0.00024526139983895153, "loss": 5.5177, "mean_token_accuracy": 0.2169123575091362, "num_tokens": 120232450.0, "step": 47440 }, { "entropy": 6.044406270980835, "epoch": 5.4754760530871325, "grad_norm": 1.046875, "learning_rate": 0.0002452204980055679, "loss": 5.4706, "mean_token_accuracy": 0.22209678143262862, "num_tokens": 120243952.0, "step": 47445 }, { "entropy": 6.012739467620849, "epoch": 5.476053087132141, "grad_norm": 1.0, "learning_rate": 0.00024517959717380324, "loss": 5.4239, "mean_token_accuracy": 0.22665991336107255, "num_tokens": 120257282.0, "step": 47450 }, { "entropy": 6.050950717926026, "epoch": 5.476630121177149, "grad_norm": 1.1015625, "learning_rate": 0.00024513869734503284, "loss": 5.376, "mean_token_accuracy": 0.2304854065179825, "num_tokens": 120268957.0, "step": 47455 }, { "entropy": 6.105955314636231, "epoch": 5.477207155222158, "grad_norm": 1.0, "learning_rate": 0.0002450977985206327, "loss": 5.5999, "mean_token_accuracy": 0.20874406695365905, "num_tokens": 120281600.0, "step": 47460 }, { "entropy": 5.980347681045532, "epoch": 5.477784189267167, "grad_norm": 1.0703125, "learning_rate": 0.00024505690070197807, "loss": 5.4072, "mean_token_accuracy": 0.22288106828927995, "num_tokens": 120294725.0, "step": 47465 }, { "entropy": 6.034222841262817, "epoch": 5.4783612233121755, "grad_norm": 1.046875, "learning_rate": 0.0002450160038904448, "loss": 5.3452, "mean_token_accuracy": 0.22752912789583207, "num_tokens": 120306822.0, "step": 47470 }, { "entropy": 6.05337438583374, "epoch": 5.478938257357184, "grad_norm": 0.9609375, "learning_rate": 0.0002449751080874083, "loss": 5.4105, "mean_token_accuracy": 0.21632318198680878, "num_tokens": 120319902.0, "step": 47475 }, { "entropy": 5.985331773757935, "epoch": 5.479515291402192, "grad_norm": 1.0390625, "learning_rate": 0.0002449342132942443, "loss": 5.3615, "mean_token_accuracy": 0.22828896194696427, "num_tokens": 120333623.0, "step": 47480 }, { "entropy": 5.9836499214172365, "epoch": 5.480092325447202, "grad_norm": 0.98828125, "learning_rate": 0.0002448933195123278, "loss": 5.3861, "mean_token_accuracy": 0.22556522488594055, "num_tokens": 120345458.0, "step": 47485 }, { "entropy": 6.062854671478272, "epoch": 5.48066935949221, "grad_norm": 1.0234375, "learning_rate": 0.0002448524267430348, "loss": 5.4561, "mean_token_accuracy": 0.213370643556118, "num_tokens": 120358757.0, "step": 47490 }, { "entropy": 6.093607568740845, "epoch": 5.481246393537218, "grad_norm": 1.078125, "learning_rate": 0.0002448115349877403, "loss": 5.5078, "mean_token_accuracy": 0.21637726724147796, "num_tokens": 120371062.0, "step": 47495 }, { "entropy": 6.1550556182861325, "epoch": 5.481823427582228, "grad_norm": 1.046875, "learning_rate": 0.0002447706442478199, "loss": 5.5315, "mean_token_accuracy": 0.21053755134344102, "num_tokens": 120382934.0, "step": 47500 }, { "entropy": 6.062007284164428, "epoch": 5.482400461627236, "grad_norm": 0.953125, "learning_rate": 0.0002447297545246489, "loss": 5.4233, "mean_token_accuracy": 0.2202950969338417, "num_tokens": 120395103.0, "step": 47505 }, { "entropy": 6.056242656707764, "epoch": 5.482977495672245, "grad_norm": 0.96875, "learning_rate": 0.0002446888658196025, "loss": 5.43, "mean_token_accuracy": 0.22057365775108337, "num_tokens": 120406852.0, "step": 47510 }, { "entropy": 5.998345994949341, "epoch": 5.483554529717253, "grad_norm": 0.98828125, "learning_rate": 0.000244647978134056, "loss": 5.3725, "mean_token_accuracy": 0.22972165644168854, "num_tokens": 120419813.0, "step": 47515 }, { "entropy": 5.972995328903198, "epoch": 5.484131563762262, "grad_norm": 1.0234375, "learning_rate": 0.00024460709146938473, "loss": 5.3677, "mean_token_accuracy": 0.2235831692814827, "num_tokens": 120432103.0, "step": 47520 }, { "entropy": 5.968393087387085, "epoch": 5.484708597807271, "grad_norm": 0.9453125, "learning_rate": 0.00024456620582696386, "loss": 5.3884, "mean_token_accuracy": 0.222498719394207, "num_tokens": 120446458.0, "step": 47525 }, { "entropy": 6.034120893478393, "epoch": 5.485285631852279, "grad_norm": 1.0234375, "learning_rate": 0.00024452532120816856, "loss": 5.3883, "mean_token_accuracy": 0.21942399591207504, "num_tokens": 120459456.0, "step": 47530 }, { "entropy": 6.013608598709107, "epoch": 5.4858626658972875, "grad_norm": 1.0703125, "learning_rate": 0.0002444844376143739, "loss": 5.3238, "mean_token_accuracy": 0.22153729647397996, "num_tokens": 120472475.0, "step": 47535 }, { "entropy": 5.953195190429687, "epoch": 5.486439699942297, "grad_norm": 1.09375, "learning_rate": 0.00024444355504695507, "loss": 5.3311, "mean_token_accuracy": 0.23062245845794677, "num_tokens": 120486782.0, "step": 47540 }, { "entropy": 5.976576423645019, "epoch": 5.487016733987305, "grad_norm": 1.015625, "learning_rate": 0.000244402673507287, "loss": 5.3564, "mean_token_accuracy": 0.22411105483770372, "num_tokens": 120499866.0, "step": 47545 }, { "entropy": 6.015101480484009, "epoch": 5.487593768032314, "grad_norm": 0.99609375, "learning_rate": 0.0002443617929967449, "loss": 5.4647, "mean_token_accuracy": 0.2205308571457863, "num_tokens": 120512920.0, "step": 47550 }, { "entropy": 5.935817289352417, "epoch": 5.488170802077322, "grad_norm": 0.96875, "learning_rate": 0.00024432091351670354, "loss": 5.3037, "mean_token_accuracy": 0.23296899795532228, "num_tokens": 120525262.0, "step": 47555 }, { "entropy": 6.0095116138458256, "epoch": 5.488747836122331, "grad_norm": 1.078125, "learning_rate": 0.0002442800350685382, "loss": 5.4062, "mean_token_accuracy": 0.22227492183446884, "num_tokens": 120537888.0, "step": 47560 }, { "entropy": 6.096463441848755, "epoch": 5.48932487016734, "grad_norm": 1.0, "learning_rate": 0.0002442391576536235, "loss": 5.5657, "mean_token_accuracy": 0.21110780090093612, "num_tokens": 120550826.0, "step": 47565 }, { "entropy": 6.102590322494507, "epoch": 5.489901904212348, "grad_norm": 1.0625, "learning_rate": 0.0002441982812733345, "loss": 5.4156, "mean_token_accuracy": 0.22429123073816298, "num_tokens": 120562801.0, "step": 47570 }, { "entropy": 6.0433797359466555, "epoch": 5.4904789382573576, "grad_norm": 1.0703125, "learning_rate": 0.00024415740592904597, "loss": 5.398, "mean_token_accuracy": 0.2184971123933792, "num_tokens": 120575080.0, "step": 47575 }, { "entropy": 6.011787557601929, "epoch": 5.491055972302366, "grad_norm": 1.015625, "learning_rate": 0.00024411653162213282, "loss": 5.4585, "mean_token_accuracy": 0.21966557651758195, "num_tokens": 120587460.0, "step": 47580 }, { "entropy": 6.052439594268799, "epoch": 5.491633006347374, "grad_norm": 1.0703125, "learning_rate": 0.0002440756583539697, "loss": 5.4146, "mean_token_accuracy": 0.2198610469698906, "num_tokens": 120599970.0, "step": 47585 }, { "entropy": 5.9410182476043705, "epoch": 5.492210040392383, "grad_norm": 1.0546875, "learning_rate": 0.00024403478612593156, "loss": 5.3648, "mean_token_accuracy": 0.22431038469076156, "num_tokens": 120612546.0, "step": 47590 }, { "entropy": 6.047664785385132, "epoch": 5.492787074437392, "grad_norm": 1.03125, "learning_rate": 0.00024399391493939293, "loss": 5.4638, "mean_token_accuracy": 0.21801050305366515, "num_tokens": 120624648.0, "step": 47595 }, { "entropy": 6.113511180877685, "epoch": 5.4933641084824005, "grad_norm": 1.03125, "learning_rate": 0.0002439530447957286, "loss": 5.4757, "mean_token_accuracy": 0.21548536866903306, "num_tokens": 120637530.0, "step": 47600 }, { "entropy": 6.051801538467407, "epoch": 5.493941142527409, "grad_norm": 1.03125, "learning_rate": 0.00024391217569631318, "loss": 5.4024, "mean_token_accuracy": 0.2266889750957489, "num_tokens": 120649836.0, "step": 47605 }, { "entropy": 6.06033411026001, "epoch": 5.494518176572417, "grad_norm": 0.94921875, "learning_rate": 0.0002438713076425213, "loss": 5.5336, "mean_token_accuracy": 0.21252259314060212, "num_tokens": 120662535.0, "step": 47610 }, { "entropy": 6.048929929733276, "epoch": 5.495095210617427, "grad_norm": 1.0390625, "learning_rate": 0.0002438304406357275, "loss": 5.4076, "mean_token_accuracy": 0.2256210908293724, "num_tokens": 120675289.0, "step": 47615 }, { "entropy": 6.141551446914673, "epoch": 5.495672244662435, "grad_norm": 1.0078125, "learning_rate": 0.00024378957467730645, "loss": 5.4675, "mean_token_accuracy": 0.21609950810670853, "num_tokens": 120689208.0, "step": 47620 }, { "entropy": 6.0638526439666744, "epoch": 5.4962492787074435, "grad_norm": 1.0390625, "learning_rate": 0.0002437487097686324, "loss": 5.3945, "mean_token_accuracy": 0.22044505923986435, "num_tokens": 120700660.0, "step": 47625 }, { "entropy": 6.009811305999756, "epoch": 5.496826312752452, "grad_norm": 1.0234375, "learning_rate": 0.00024370784591108002, "loss": 5.3857, "mean_token_accuracy": 0.222472120821476, "num_tokens": 120712114.0, "step": 47630 }, { "entropy": 6.029832887649536, "epoch": 5.497403346797461, "grad_norm": 1.0078125, "learning_rate": 0.0002436669831060237, "loss": 5.3918, "mean_token_accuracy": 0.23503619879484178, "num_tokens": 120725751.0, "step": 47635 }, { "entropy": 6.019428396224976, "epoch": 5.49798038084247, "grad_norm": 1.0546875, "learning_rate": 0.00024362612135483792, "loss": 5.4228, "mean_token_accuracy": 0.22621234655380248, "num_tokens": 120738396.0, "step": 47640 }, { "entropy": 6.02667236328125, "epoch": 5.498557414887478, "grad_norm": 1.0625, "learning_rate": 0.00024358526065889686, "loss": 5.3715, "mean_token_accuracy": 0.22395648509263993, "num_tokens": 120750460.0, "step": 47645 }, { "entropy": 6.022999858856201, "epoch": 5.499134448932487, "grad_norm": 1.0625, "learning_rate": 0.00024354440101957505, "loss": 5.4314, "mean_token_accuracy": 0.22071062177419662, "num_tokens": 120763227.0, "step": 47650 }, { "entropy": 6.132009840011596, "epoch": 5.499711482977496, "grad_norm": 1.078125, "learning_rate": 0.00024350354243824659, "loss": 5.5243, "mean_token_accuracy": 0.20742686986923217, "num_tokens": 120774786.0, "step": 47655 }, { "entropy": 6.013866996765136, "epoch": 5.500288517022504, "grad_norm": 0.921875, "learning_rate": 0.0002434626849162859, "loss": 5.4096, "mean_token_accuracy": 0.2245435893535614, "num_tokens": 120787806.0, "step": 47660 }, { "entropy": 6.13320574760437, "epoch": 5.500865551067513, "grad_norm": 1.0078125, "learning_rate": 0.00024342182845506712, "loss": 5.5137, "mean_token_accuracy": 0.21297620087862015, "num_tokens": 120800580.0, "step": 47665 }, { "entropy": 6.0649432182312015, "epoch": 5.501442585112522, "grad_norm": 1.0390625, "learning_rate": 0.00024338097305596446, "loss": 5.4349, "mean_token_accuracy": 0.22557477951049804, "num_tokens": 120813684.0, "step": 47670 }, { "entropy": 6.006740236282349, "epoch": 5.50201961915753, "grad_norm": 0.953125, "learning_rate": 0.000243340118720352, "loss": 5.429, "mean_token_accuracy": 0.2203612744808197, "num_tokens": 120828743.0, "step": 47675 }, { "entropy": 6.054507160186768, "epoch": 5.502596653202539, "grad_norm": 1.046875, "learning_rate": 0.00024329926544960402, "loss": 5.4541, "mean_token_accuracy": 0.21979046165943145, "num_tokens": 120841731.0, "step": 47680 }, { "entropy": 6.000650262832641, "epoch": 5.503173687247548, "grad_norm": 1.1953125, "learning_rate": 0.00024325841324509447, "loss": 5.3505, "mean_token_accuracy": 0.23008284270763396, "num_tokens": 120854457.0, "step": 47685 }, { "entropy": 5.9935808181762695, "epoch": 5.5037507212925565, "grad_norm": 1.0625, "learning_rate": 0.00024321756210819734, "loss": 5.4077, "mean_token_accuracy": 0.22334915846586229, "num_tokens": 120866635.0, "step": 47690 }, { "entropy": 6.067073631286621, "epoch": 5.504327755337565, "grad_norm": 0.9765625, "learning_rate": 0.0002431767120402868, "loss": 5.4607, "mean_token_accuracy": 0.21895507723093033, "num_tokens": 120879074.0, "step": 47695 }, { "entropy": 6.061027717590332, "epoch": 5.504904789382573, "grad_norm": 0.97265625, "learning_rate": 0.00024313586304273676, "loss": 5.439, "mean_token_accuracy": 0.21975450068712235, "num_tokens": 120891468.0, "step": 47700 }, { "entropy": 5.980240106582642, "epoch": 5.505481823427582, "grad_norm": 1.0234375, "learning_rate": 0.00024309501511692112, "loss": 5.3291, "mean_token_accuracy": 0.22788507640361785, "num_tokens": 120903559.0, "step": 47705 }, { "entropy": 6.059676456451416, "epoch": 5.506058857472591, "grad_norm": 0.94921875, "learning_rate": 0.0002430541682642138, "loss": 5.4684, "mean_token_accuracy": 0.21489742994308472, "num_tokens": 120916875.0, "step": 47710 }, { "entropy": 6.099525594711304, "epoch": 5.5066358915175995, "grad_norm": 0.98046875, "learning_rate": 0.0002430133224859886, "loss": 5.481, "mean_token_accuracy": 0.22402574867010117, "num_tokens": 120929676.0, "step": 47715 }, { "entropy": 6.073724603652954, "epoch": 5.507212925562608, "grad_norm": 1.03125, "learning_rate": 0.00024297247778361952, "loss": 5.4655, "mean_token_accuracy": 0.21962770223617553, "num_tokens": 120941913.0, "step": 47720 }, { "entropy": 6.069832420349121, "epoch": 5.507789959607617, "grad_norm": 1.0390625, "learning_rate": 0.00024293163415848012, "loss": 5.4931, "mean_token_accuracy": 0.22217957973480223, "num_tokens": 120953614.0, "step": 47725 }, { "entropy": 6.058898115158081, "epoch": 5.508366993652626, "grad_norm": 0.9375, "learning_rate": 0.00024289079161194437, "loss": 5.4537, "mean_token_accuracy": 0.22171433568000792, "num_tokens": 120967921.0, "step": 47730 }, { "entropy": 6.112684726715088, "epoch": 5.508944027697634, "grad_norm": 0.9375, "learning_rate": 0.00024284995014538585, "loss": 5.4763, "mean_token_accuracy": 0.22013049125671386, "num_tokens": 120980838.0, "step": 47735 }, { "entropy": 6.022745180130005, "epoch": 5.5095210617426424, "grad_norm": 0.984375, "learning_rate": 0.00024280910976017835, "loss": 5.4452, "mean_token_accuracy": 0.22427271604537963, "num_tokens": 120992772.0, "step": 47740 }, { "entropy": 5.993321275711059, "epoch": 5.510098095787652, "grad_norm": 0.984375, "learning_rate": 0.0002427682704576954, "loss": 5.4221, "mean_token_accuracy": 0.22051352262496948, "num_tokens": 121005767.0, "step": 47745 }, { "entropy": 6.042178201675415, "epoch": 5.51067512983266, "grad_norm": 0.95703125, "learning_rate": 0.0002427274322393106, "loss": 5.368, "mean_token_accuracy": 0.22791897505521774, "num_tokens": 121018137.0, "step": 47750 }, { "entropy": 6.010069799423218, "epoch": 5.511252163877669, "grad_norm": 1.0390625, "learning_rate": 0.0002426865951063977, "loss": 5.3828, "mean_token_accuracy": 0.22456735223531724, "num_tokens": 121029980.0, "step": 47755 }, { "entropy": 5.962734651565552, "epoch": 5.511829197922678, "grad_norm": 0.98046875, "learning_rate": 0.00024264575906033, "loss": 5.3912, "mean_token_accuracy": 0.21795674711465834, "num_tokens": 121042270.0, "step": 47760 }, { "entropy": 6.015217018127442, "epoch": 5.512406231967686, "grad_norm": 1.0546875, "learning_rate": 0.00024260492410248125, "loss": 5.4571, "mean_token_accuracy": 0.2169657602906227, "num_tokens": 121053808.0, "step": 47765 }, { "entropy": 6.045488691329956, "epoch": 5.512983266012695, "grad_norm": 1.078125, "learning_rate": 0.0002425640902342247, "loss": 5.4444, "mean_token_accuracy": 0.2223682537674904, "num_tokens": 121066112.0, "step": 47770 }, { "entropy": 6.067818975448608, "epoch": 5.513560300057703, "grad_norm": 1.0, "learning_rate": 0.0002425232574569339, "loss": 5.4313, "mean_token_accuracy": 0.22687044590711594, "num_tokens": 121079687.0, "step": 47775 }, { "entropy": 6.010495805740357, "epoch": 5.514137334102712, "grad_norm": 1.078125, "learning_rate": 0.0002424824257719822, "loss": 5.3328, "mean_token_accuracy": 0.22875746637582778, "num_tokens": 121091446.0, "step": 47780 }, { "entropy": 6.044916439056396, "epoch": 5.514714368147721, "grad_norm": 1.0390625, "learning_rate": 0.000242441595180743, "loss": 5.4493, "mean_token_accuracy": 0.21559704095125198, "num_tokens": 121104326.0, "step": 47785 }, { "entropy": 6.007753705978393, "epoch": 5.515291402192729, "grad_norm": 1.046875, "learning_rate": 0.00024240076568458947, "loss": 5.3847, "mean_token_accuracy": 0.2253635972738266, "num_tokens": 121116717.0, "step": 47790 }, { "entropy": 6.063485622406006, "epoch": 5.515868436237738, "grad_norm": 0.94921875, "learning_rate": 0.00024235993728489508, "loss": 5.4731, "mean_token_accuracy": 0.21702780425548554, "num_tokens": 121130737.0, "step": 47795 }, { "entropy": 6.06763801574707, "epoch": 5.516445470282747, "grad_norm": 1.0390625, "learning_rate": 0.00024231910998303292, "loss": 5.496, "mean_token_accuracy": 0.21376340389251708, "num_tokens": 121142663.0, "step": 47800 }, { "entropy": 5.987742233276367, "epoch": 5.517022504327755, "grad_norm": 1.0078125, "learning_rate": 0.00024227828378037635, "loss": 5.405, "mean_token_accuracy": 0.2216850697994232, "num_tokens": 121154873.0, "step": 47805 }, { "entropy": 6.020955753326416, "epoch": 5.517599538372764, "grad_norm": 1.0078125, "learning_rate": 0.00024223745867829838, "loss": 5.4195, "mean_token_accuracy": 0.22612695693969725, "num_tokens": 121167564.0, "step": 47810 }, { "entropy": 5.975015020370483, "epoch": 5.518176572417772, "grad_norm": 0.98046875, "learning_rate": 0.00024219663467817226, "loss": 5.4245, "mean_token_accuracy": 0.2225605145096779, "num_tokens": 121181296.0, "step": 47815 }, { "entropy": 6.1260621547698975, "epoch": 5.518753606462782, "grad_norm": 0.9609375, "learning_rate": 0.00024215581178137097, "loss": 5.4409, "mean_token_accuracy": 0.22733189910650253, "num_tokens": 121194282.0, "step": 47820 }, { "entropy": 6.017096710205078, "epoch": 5.51933064050779, "grad_norm": 1.0546875, "learning_rate": 0.00024211498998926773, "loss": 5.4058, "mean_token_accuracy": 0.22633518129587174, "num_tokens": 121207170.0, "step": 47825 }, { "entropy": 6.006448459625244, "epoch": 5.519907674552798, "grad_norm": 0.97265625, "learning_rate": 0.00024207416930323539, "loss": 5.3562, "mean_token_accuracy": 0.2306416615843773, "num_tokens": 121220484.0, "step": 47830 }, { "entropy": 5.999253511428833, "epoch": 5.520484708597808, "grad_norm": 1.0625, "learning_rate": 0.0002420333497246471, "loss": 5.3574, "mean_token_accuracy": 0.22625994235277175, "num_tokens": 121233302.0, "step": 47835 }, { "entropy": 6.053505754470825, "epoch": 5.521061742642816, "grad_norm": 0.9921875, "learning_rate": 0.00024199253125487558, "loss": 5.5222, "mean_token_accuracy": 0.20680065751075744, "num_tokens": 121245633.0, "step": 47840 }, { "entropy": 6.008155679702758, "epoch": 5.5216387766878245, "grad_norm": 0.953125, "learning_rate": 0.00024195171389529402, "loss": 5.3799, "mean_token_accuracy": 0.22610725164413453, "num_tokens": 121258278.0, "step": 47845 }, { "entropy": 6.010450935363769, "epoch": 5.522215810732833, "grad_norm": 0.984375, "learning_rate": 0.00024191089764727503, "loss": 5.3871, "mean_token_accuracy": 0.22943540066480636, "num_tokens": 121272504.0, "step": 47850 }, { "entropy": 6.006346035003662, "epoch": 5.522792844777842, "grad_norm": 1.0234375, "learning_rate": 0.00024187008251219167, "loss": 5.3207, "mean_token_accuracy": 0.22688601911067963, "num_tokens": 121284389.0, "step": 47855 }, { "entropy": 6.204504108428955, "epoch": 5.523369878822851, "grad_norm": 1.046875, "learning_rate": 0.00024182926849141646, "loss": 5.594, "mean_token_accuracy": 0.20778852701187134, "num_tokens": 121297039.0, "step": 47860 }, { "entropy": 6.010227537155151, "epoch": 5.523946912867859, "grad_norm": 1.0, "learning_rate": 0.00024178845558632252, "loss": 5.4471, "mean_token_accuracy": 0.2188406467437744, "num_tokens": 121309748.0, "step": 47865 }, { "entropy": 6.105253553390503, "epoch": 5.5245239469128675, "grad_norm": 1.046875, "learning_rate": 0.00024174764379828224, "loss": 5.4981, "mean_token_accuracy": 0.21365632861852646, "num_tokens": 121321103.0, "step": 47870 }, { "entropy": 6.0800862312316895, "epoch": 5.525100980957877, "grad_norm": 0.98828125, "learning_rate": 0.00024170683312866854, "loss": 5.4297, "mean_token_accuracy": 0.21937412917613983, "num_tokens": 121332960.0, "step": 47875 }, { "entropy": 6.0757159233093265, "epoch": 5.525678015002885, "grad_norm": 1.0390625, "learning_rate": 0.00024166602357885393, "loss": 5.4347, "mean_token_accuracy": 0.22198549062013626, "num_tokens": 121345361.0, "step": 47880 }, { "entropy": 6.073025035858154, "epoch": 5.526255049047894, "grad_norm": 1.015625, "learning_rate": 0.00024162521515021102, "loss": 5.4934, "mean_token_accuracy": 0.21564815044403077, "num_tokens": 121358858.0, "step": 47885 }, { "entropy": 6.130002021789551, "epoch": 5.526832083092902, "grad_norm": 1.0546875, "learning_rate": 0.00024158440784411244, "loss": 5.4811, "mean_token_accuracy": 0.21908482015132905, "num_tokens": 121372106.0, "step": 47890 }, { "entropy": 6.098454713821411, "epoch": 5.527409117137911, "grad_norm": 1.0546875, "learning_rate": 0.0002415436016619308, "loss": 5.4684, "mean_token_accuracy": 0.22149865925312043, "num_tokens": 121385340.0, "step": 47895 }, { "entropy": 6.021191072463989, "epoch": 5.52798615118292, "grad_norm": 0.98828125, "learning_rate": 0.00024150279660503838, "loss": 5.429, "mean_token_accuracy": 0.22179484814405442, "num_tokens": 121397962.0, "step": 47900 }, { "entropy": 6.031183338165283, "epoch": 5.528563185227928, "grad_norm": 0.98828125, "learning_rate": 0.00024146199267480778, "loss": 5.4712, "mean_token_accuracy": 0.2198013424873352, "num_tokens": 121409678.0, "step": 47905 }, { "entropy": 6.053447198867798, "epoch": 5.5291402192729375, "grad_norm": 1.0, "learning_rate": 0.0002414211898726114, "loss": 5.4368, "mean_token_accuracy": 0.2185912847518921, "num_tokens": 121422499.0, "step": 47910 }, { "entropy": 6.119691371917725, "epoch": 5.529717253317946, "grad_norm": 1.0234375, "learning_rate": 0.00024138038819982173, "loss": 5.5087, "mean_token_accuracy": 0.21256650239229202, "num_tokens": 121434562.0, "step": 47915 }, { "entropy": 6.003648567199707, "epoch": 5.530294287362954, "grad_norm": 1.0078125, "learning_rate": 0.00024133958765781084, "loss": 5.4237, "mean_token_accuracy": 0.22699394673109055, "num_tokens": 121447708.0, "step": 47920 }, { "entropy": 6.122247409820557, "epoch": 5.530871321407963, "grad_norm": 1.03125, "learning_rate": 0.00024129878824795127, "loss": 5.5456, "mean_token_accuracy": 0.2117946833372116, "num_tokens": 121459580.0, "step": 47925 }, { "entropy": 5.9470449924469, "epoch": 5.531448355452972, "grad_norm": 0.93359375, "learning_rate": 0.0002412579899716152, "loss": 5.3503, "mean_token_accuracy": 0.23912058919668197, "num_tokens": 121472520.0, "step": 47930 }, { "entropy": 6.036983060836792, "epoch": 5.5320253894979805, "grad_norm": 0.9765625, "learning_rate": 0.0002412171928301749, "loss": 5.3577, "mean_token_accuracy": 0.232684625685215, "num_tokens": 121485220.0, "step": 47935 }, { "entropy": 5.952143621444702, "epoch": 5.532602423542989, "grad_norm": 1.03125, "learning_rate": 0.00024117639682500253, "loss": 5.3743, "mean_token_accuracy": 0.2347503498196602, "num_tokens": 121499731.0, "step": 47940 }, { "entropy": 5.994808197021484, "epoch": 5.533179457587997, "grad_norm": 1.0859375, "learning_rate": 0.00024113560195747024, "loss": 5.4141, "mean_token_accuracy": 0.2176785558462143, "num_tokens": 121512445.0, "step": 47945 }, { "entropy": 6.119512844085693, "epoch": 5.533756491633007, "grad_norm": 0.93359375, "learning_rate": 0.00024109480822895012, "loss": 5.4882, "mean_token_accuracy": 0.2130196288228035, "num_tokens": 121527174.0, "step": 47950 }, { "entropy": 6.003230953216553, "epoch": 5.534333525678015, "grad_norm": 0.98828125, "learning_rate": 0.00024105401564081442, "loss": 5.3411, "mean_token_accuracy": 0.23128325790166854, "num_tokens": 121540541.0, "step": 47955 }, { "entropy": 6.017929744720459, "epoch": 5.5349105597230235, "grad_norm": 1.03125, "learning_rate": 0.0002410132241944349, "loss": 5.4135, "mean_token_accuracy": 0.22472924143075942, "num_tokens": 121552536.0, "step": 47960 }, { "entropy": 5.965036535263062, "epoch": 5.535487593768032, "grad_norm": 0.984375, "learning_rate": 0.00024097243389118377, "loss": 5.3169, "mean_token_accuracy": 0.2277855783700943, "num_tokens": 121565737.0, "step": 47965 }, { "entropy": 6.0405150890350345, "epoch": 5.536064627813041, "grad_norm": 1.0078125, "learning_rate": 0.00024093164473243283, "loss": 5.4157, "mean_token_accuracy": 0.2299483373761177, "num_tokens": 121577382.0, "step": 47970 }, { "entropy": 6.082750415802002, "epoch": 5.53664166185805, "grad_norm": 1.0546875, "learning_rate": 0.0002408908567195543, "loss": 5.5376, "mean_token_accuracy": 0.2111786499619484, "num_tokens": 121590595.0, "step": 47975 }, { "entropy": 6.0435713768005375, "epoch": 5.537218695903058, "grad_norm": 1.046875, "learning_rate": 0.00024085006985391966, "loss": 5.4121, "mean_token_accuracy": 0.22380685657262803, "num_tokens": 121603237.0, "step": 47980 }, { "entropy": 6.0881125926971436, "epoch": 5.537795729948067, "grad_norm": 1.0625, "learning_rate": 0.00024080928413690105, "loss": 5.468, "mean_token_accuracy": 0.2131459578871727, "num_tokens": 121614377.0, "step": 47985 }, { "entropy": 5.9977563381195065, "epoch": 5.538372763993076, "grad_norm": 1.015625, "learning_rate": 0.00024076849956987013, "loss": 5.3402, "mean_token_accuracy": 0.23828363418579102, "num_tokens": 121627115.0, "step": 47990 }, { "entropy": 6.038291883468628, "epoch": 5.538949798038084, "grad_norm": 0.97265625, "learning_rate": 0.0002407277161541988, "loss": 5.4412, "mean_token_accuracy": 0.22136062532663345, "num_tokens": 121641392.0, "step": 47995 }, { "entropy": 5.990301036834717, "epoch": 5.539526832083093, "grad_norm": 1.03125, "learning_rate": 0.00024068693389125867, "loss": 5.3982, "mean_token_accuracy": 0.22406841069459915, "num_tokens": 121654998.0, "step": 48000 }, { "epoch": 5.539526832083093, "eval_entropy": 5.838063651606343, "eval_loss": 5.613852024078369, "eval_mean_token_accuracy": 0.21948676820731075, "eval_num_tokens": 121654998.0, "eval_runtime": 22.7255, "eval_samples_per_second": 1238.08, "eval_steps_per_second": 154.76, "step": 48000 }, { "entropy": 6.126865100860596, "epoch": 5.540103866128102, "grad_norm": 0.984375, "learning_rate": 0.00024064615278242147, "loss": 5.4786, "mean_token_accuracy": 0.21697935461997986, "num_tokens": 121666714.0, "step": 48005 }, { "entropy": 6.011840152740478, "epoch": 5.54068090017311, "grad_norm": 0.96484375, "learning_rate": 0.00024060537282905882, "loss": 5.3997, "mean_token_accuracy": 0.22318132668733598, "num_tokens": 121679129.0, "step": 48010 }, { "entropy": 6.008998537063599, "epoch": 5.541257934218119, "grad_norm": 0.9921875, "learning_rate": 0.0002405645940325425, "loss": 5.3898, "mean_token_accuracy": 0.22001457512378692, "num_tokens": 121692416.0, "step": 48015 }, { "entropy": 6.0934515476226805, "epoch": 5.541834968263127, "grad_norm": 0.9921875, "learning_rate": 0.00024052381639424382, "loss": 5.4936, "mean_token_accuracy": 0.21239448338747025, "num_tokens": 121705956.0, "step": 48020 }, { "entropy": 6.075184869766235, "epoch": 5.5424120023081365, "grad_norm": 1.0078125, "learning_rate": 0.00024048303991553455, "loss": 5.4762, "mean_token_accuracy": 0.22139879018068315, "num_tokens": 121718009.0, "step": 48025 }, { "entropy": 6.03062162399292, "epoch": 5.542989036353145, "grad_norm": 1.0703125, "learning_rate": 0.00024044226459778596, "loss": 5.4662, "mean_token_accuracy": 0.21916611194610597, "num_tokens": 121730719.0, "step": 48030 }, { "entropy": 6.0477649688720705, "epoch": 5.543566070398153, "grad_norm": 0.9921875, "learning_rate": 0.0002404014904423698, "loss": 5.4828, "mean_token_accuracy": 0.21260360330343248, "num_tokens": 121743720.0, "step": 48035 }, { "entropy": 6.088364171981811, "epoch": 5.544143104443162, "grad_norm": 0.98046875, "learning_rate": 0.0002403607174506572, "loss": 5.452, "mean_token_accuracy": 0.22121359258890153, "num_tokens": 121755883.0, "step": 48040 }, { "entropy": 6.091207790374756, "epoch": 5.544720138488171, "grad_norm": 1.0234375, "learning_rate": 0.00024031994562401972, "loss": 5.4622, "mean_token_accuracy": 0.21255310326814653, "num_tokens": 121768832.0, "step": 48045 }, { "entropy": 6.112627649307251, "epoch": 5.545297172533179, "grad_norm": 1.1171875, "learning_rate": 0.00024027917496382856, "loss": 5.4902, "mean_token_accuracy": 0.2171428233385086, "num_tokens": 121781396.0, "step": 48050 }, { "entropy": 6.060887622833252, "epoch": 5.545874206578188, "grad_norm": 1.0078125, "learning_rate": 0.0002402384054714552, "loss": 5.4583, "mean_token_accuracy": 0.20708019584417342, "num_tokens": 121795758.0, "step": 48055 }, { "entropy": 5.846577215194702, "epoch": 5.546451240623197, "grad_norm": 0.97265625, "learning_rate": 0.00024019763714827077, "loss": 5.1755, "mean_token_accuracy": 0.24399437606334687, "num_tokens": 121808114.0, "step": 48060 }, { "entropy": 6.042523765563965, "epoch": 5.547028274668206, "grad_norm": 1.0703125, "learning_rate": 0.0002401568699956465, "loss": 5.4221, "mean_token_accuracy": 0.21863186806440355, "num_tokens": 121820130.0, "step": 48065 }, { "entropy": 6.059017610549927, "epoch": 5.547605308713214, "grad_norm": 1.0078125, "learning_rate": 0.0002401161040149536, "loss": 5.4687, "mean_token_accuracy": 0.21921880543231964, "num_tokens": 121833344.0, "step": 48070 }, { "entropy": 6.051173877716065, "epoch": 5.548182342758222, "grad_norm": 1.078125, "learning_rate": 0.0002400753392075633, "loss": 5.4172, "mean_token_accuracy": 0.22536935210227965, "num_tokens": 121846322.0, "step": 48075 }, { "entropy": 5.9434576511383055, "epoch": 5.548759376803232, "grad_norm": 1.2265625, "learning_rate": 0.00024003457557484655, "loss": 5.3034, "mean_token_accuracy": 0.22719025611877441, "num_tokens": 121859334.0, "step": 48080 }, { "entropy": 6.103307247161865, "epoch": 5.54933641084824, "grad_norm": 1.0390625, "learning_rate": 0.00023999381311817447, "loss": 5.416, "mean_token_accuracy": 0.21675145030021667, "num_tokens": 121871421.0, "step": 48085 }, { "entropy": 6.0599720001220705, "epoch": 5.549913444893249, "grad_norm": 0.9609375, "learning_rate": 0.00023995305183891808, "loss": 5.4923, "mean_token_accuracy": 0.21771734207868576, "num_tokens": 121883335.0, "step": 48090 }, { "entropy": 6.0812835693359375, "epoch": 5.550490478938257, "grad_norm": 1.046875, "learning_rate": 0.00023991229173844848, "loss": 5.507, "mean_token_accuracy": 0.21519697159528733, "num_tokens": 121895875.0, "step": 48095 }, { "entropy": 5.980572080612182, "epoch": 5.551067512983266, "grad_norm": 0.96484375, "learning_rate": 0.0002398715328181364, "loss": 5.381, "mean_token_accuracy": 0.2272232487797737, "num_tokens": 121909044.0, "step": 48100 }, { "entropy": 6.041309118270874, "epoch": 5.551644547028275, "grad_norm": 0.92578125, "learning_rate": 0.00023983077507935298, "loss": 5.3919, "mean_token_accuracy": 0.22771453708410264, "num_tokens": 121922050.0, "step": 48105 }, { "entropy": 6.047741365432739, "epoch": 5.552221581073283, "grad_norm": 1.0234375, "learning_rate": 0.00023979001852346882, "loss": 5.4519, "mean_token_accuracy": 0.22750690281391145, "num_tokens": 121935808.0, "step": 48110 }, { "entropy": 6.018998479843139, "epoch": 5.5527986151182915, "grad_norm": 1.0234375, "learning_rate": 0.00023974926315185508, "loss": 5.3671, "mean_token_accuracy": 0.2309811681509018, "num_tokens": 121948511.0, "step": 48115 }, { "entropy": 6.071750593185425, "epoch": 5.553375649163301, "grad_norm": 1.0078125, "learning_rate": 0.00023970850896588226, "loss": 5.4913, "mean_token_accuracy": 0.22058721780776977, "num_tokens": 121960540.0, "step": 48120 }, { "entropy": 5.987504005432129, "epoch": 5.553952683208309, "grad_norm": 1.015625, "learning_rate": 0.0002396677559669212, "loss": 5.3577, "mean_token_accuracy": 0.22762912660837173, "num_tokens": 121973034.0, "step": 48125 }, { "entropy": 6.048416376113892, "epoch": 5.554529717253318, "grad_norm": 1.03125, "learning_rate": 0.00023962700415634258, "loss": 5.4507, "mean_token_accuracy": 0.22076354175806046, "num_tokens": 121985189.0, "step": 48130 }, { "entropy": 6.059376525878906, "epoch": 5.555106751298327, "grad_norm": 0.99609375, "learning_rate": 0.00023958625353551728, "loss": 5.4102, "mean_token_accuracy": 0.22135140746831894, "num_tokens": 121996187.0, "step": 48135 }, { "entropy": 5.993706512451172, "epoch": 5.555683785343335, "grad_norm": 1.0546875, "learning_rate": 0.00023954550410581555, "loss": 5.4293, "mean_token_accuracy": 0.22049858719110488, "num_tokens": 122008211.0, "step": 48140 }, { "entropy": 5.986296558380127, "epoch": 5.556260819388344, "grad_norm": 1.0859375, "learning_rate": 0.00023950475586860832, "loss": 5.3992, "mean_token_accuracy": 0.22768102288246156, "num_tokens": 122019779.0, "step": 48145 }, { "entropy": 6.114831733703613, "epoch": 5.556837853433352, "grad_norm": 1.015625, "learning_rate": 0.00023946400882526587, "loss": 5.5148, "mean_token_accuracy": 0.21687258034944534, "num_tokens": 122031698.0, "step": 48150 }, { "entropy": 6.109345579147339, "epoch": 5.5574148874783615, "grad_norm": 1.0859375, "learning_rate": 0.00023942326297715888, "loss": 5.4646, "mean_token_accuracy": 0.21639580726623536, "num_tokens": 122043273.0, "step": 48155 }, { "entropy": 6.071987152099609, "epoch": 5.55799192152337, "grad_norm": 0.9921875, "learning_rate": 0.00023938251832565782, "loss": 5.4708, "mean_token_accuracy": 0.2200428992509842, "num_tokens": 122055848.0, "step": 48160 }, { "entropy": 6.062953472137451, "epoch": 5.558568955568378, "grad_norm": 1.0390625, "learning_rate": 0.00023934177487213305, "loss": 5.4559, "mean_token_accuracy": 0.21780041009187698, "num_tokens": 122069717.0, "step": 48165 }, { "entropy": 6.013491249084472, "epoch": 5.559145989613388, "grad_norm": 0.9765625, "learning_rate": 0.00023930103261795495, "loss": 5.4165, "mean_token_accuracy": 0.2225350931286812, "num_tokens": 122081739.0, "step": 48170 }, { "entropy": 6.058135652542115, "epoch": 5.559723023658396, "grad_norm": 1.0625, "learning_rate": 0.00023926029156449386, "loss": 5.4846, "mean_token_accuracy": 0.2168823555111885, "num_tokens": 122094232.0, "step": 48175 }, { "entropy": 5.928902292251587, "epoch": 5.5603000577034045, "grad_norm": 1.0234375, "learning_rate": 0.00023921955171312016, "loss": 5.2735, "mean_token_accuracy": 0.23009622246026992, "num_tokens": 122107609.0, "step": 48180 }, { "entropy": 5.976681661605835, "epoch": 5.560877091748413, "grad_norm": 1.0703125, "learning_rate": 0.00023917881306520405, "loss": 5.3341, "mean_token_accuracy": 0.23436030000448227, "num_tokens": 122119873.0, "step": 48185 }, { "entropy": 6.118724298477173, "epoch": 5.561454125793421, "grad_norm": 0.984375, "learning_rate": 0.00023913807562211576, "loss": 5.516, "mean_token_accuracy": 0.21213323324918748, "num_tokens": 122133495.0, "step": 48190 }, { "entropy": 6.023125839233399, "epoch": 5.562031159838431, "grad_norm": 1.03125, "learning_rate": 0.00023909733938522543, "loss": 5.474, "mean_token_accuracy": 0.2208007350564003, "num_tokens": 122146517.0, "step": 48195 }, { "entropy": 6.031644868850708, "epoch": 5.562608193883439, "grad_norm": 0.99609375, "learning_rate": 0.00023905660435590337, "loss": 5.44, "mean_token_accuracy": 0.2191479504108429, "num_tokens": 122158397.0, "step": 48200 }, { "entropy": 6.070740509033203, "epoch": 5.5631852279284475, "grad_norm": 0.984375, "learning_rate": 0.00023901587053551949, "loss": 5.4682, "mean_token_accuracy": 0.215529964864254, "num_tokens": 122170564.0, "step": 48205 }, { "entropy": 6.123462390899658, "epoch": 5.563762261973457, "grad_norm": 1.0703125, "learning_rate": 0.00023897513792544396, "loss": 5.4975, "mean_token_accuracy": 0.21910422146320344, "num_tokens": 122183678.0, "step": 48210 }, { "entropy": 6.0267009258270265, "epoch": 5.564339296018465, "grad_norm": 0.98828125, "learning_rate": 0.00023893440652704673, "loss": 5.4326, "mean_token_accuracy": 0.22356181740760803, "num_tokens": 122196605.0, "step": 48215 }, { "entropy": 6.009166622161866, "epoch": 5.564916330063474, "grad_norm": 1.03125, "learning_rate": 0.0002388936763416979, "loss": 5.375, "mean_token_accuracy": 0.22460194379091264, "num_tokens": 122208553.0, "step": 48220 }, { "entropy": 6.091078090667724, "epoch": 5.565493364108482, "grad_norm": 1.0859375, "learning_rate": 0.00023885294737076724, "loss": 5.5185, "mean_token_accuracy": 0.21584667414426803, "num_tokens": 122221369.0, "step": 48225 }, { "entropy": 6.115704011917114, "epoch": 5.566070398153491, "grad_norm": 1.046875, "learning_rate": 0.00023881221961562487, "loss": 5.5135, "mean_token_accuracy": 0.21113484352827072, "num_tokens": 122233834.0, "step": 48230 }, { "entropy": 6.061873817443848, "epoch": 5.5666474321985, "grad_norm": 1.0703125, "learning_rate": 0.00023877149307764036, "loss": 5.4167, "mean_token_accuracy": 0.22458745986223222, "num_tokens": 122246931.0, "step": 48235 }, { "entropy": 6.025534534454346, "epoch": 5.567224466243508, "grad_norm": 0.984375, "learning_rate": 0.0002387307677581838, "loss": 5.4283, "mean_token_accuracy": 0.21867556869983673, "num_tokens": 122260708.0, "step": 48240 }, { "entropy": 6.0145917415618895, "epoch": 5.5678015002885175, "grad_norm": 1.078125, "learning_rate": 0.0002386900436586248, "loss": 5.3744, "mean_token_accuracy": 0.22899825423955916, "num_tokens": 122272923.0, "step": 48245 }, { "entropy": 6.0559875011444095, "epoch": 5.568378534333526, "grad_norm": 1.03125, "learning_rate": 0.0002386493207803332, "loss": 5.4755, "mean_token_accuracy": 0.21398269087076188, "num_tokens": 122285175.0, "step": 48250 }, { "entropy": 6.02157187461853, "epoch": 5.568955568378534, "grad_norm": 1.0546875, "learning_rate": 0.00023860859912467851, "loss": 5.3589, "mean_token_accuracy": 0.2268316239118576, "num_tokens": 122298639.0, "step": 48255 }, { "entropy": 6.121217584609985, "epoch": 5.569532602423543, "grad_norm": 1.0546875, "learning_rate": 0.00023856787869303066, "loss": 5.4914, "mean_token_accuracy": 0.20833466947078705, "num_tokens": 122312177.0, "step": 48260 }, { "entropy": 5.960158586502075, "epoch": 5.570109636468551, "grad_norm": 1.171875, "learning_rate": 0.00023852715948675897, "loss": 5.4139, "mean_token_accuracy": 0.2261803850531578, "num_tokens": 122324287.0, "step": 48265 }, { "entropy": 6.02413272857666, "epoch": 5.5706866705135605, "grad_norm": 1.03125, "learning_rate": 0.0002384864415072333, "loss": 5.4153, "mean_token_accuracy": 0.22435270249843597, "num_tokens": 122335579.0, "step": 48270 }, { "entropy": 6.08406982421875, "epoch": 5.571263704558569, "grad_norm": 0.98046875, "learning_rate": 0.00023844572475582293, "loss": 5.4232, "mean_token_accuracy": 0.21796109676361083, "num_tokens": 122349095.0, "step": 48275 }, { "entropy": 6.0598142623901365, "epoch": 5.571840738603577, "grad_norm": 1.0390625, "learning_rate": 0.00023840500923389752, "loss": 5.4363, "mean_token_accuracy": 0.22123051583766937, "num_tokens": 122360017.0, "step": 48280 }, { "entropy": 5.98394284248352, "epoch": 5.572417772648587, "grad_norm": 1.0234375, "learning_rate": 0.00023836429494282634, "loss": 5.4147, "mean_token_accuracy": 0.21494778096675873, "num_tokens": 122372627.0, "step": 48285 }, { "entropy": 6.123559045791626, "epoch": 5.572994806693595, "grad_norm": 1.0546875, "learning_rate": 0.00023832358188397907, "loss": 5.4563, "mean_token_accuracy": 0.22776223123073577, "num_tokens": 122385446.0, "step": 48290 }, { "entropy": 6.039320373535157, "epoch": 5.5735718407386035, "grad_norm": 1.0234375, "learning_rate": 0.00023828287005872473, "loss": 5.418, "mean_token_accuracy": 0.22595112174749374, "num_tokens": 122398432.0, "step": 48295 }, { "entropy": 6.050453233718872, "epoch": 5.574148874783612, "grad_norm": 1.0078125, "learning_rate": 0.00023824215946843293, "loss": 5.4418, "mean_token_accuracy": 0.22706850469112397, "num_tokens": 122412324.0, "step": 48300 }, { "entropy": 5.9739116668701175, "epoch": 5.574725908828621, "grad_norm": 0.984375, "learning_rate": 0.00023820145011447274, "loss": 5.3668, "mean_token_accuracy": 0.22244611978530884, "num_tokens": 122424733.0, "step": 48305 }, { "entropy": 5.960130262374878, "epoch": 5.57530294287363, "grad_norm": 1.0625, "learning_rate": 0.00023816074199821364, "loss": 5.3941, "mean_token_accuracy": 0.22321381121873857, "num_tokens": 122436543.0, "step": 48310 }, { "entropy": 5.989117527008057, "epoch": 5.575879976918638, "grad_norm": 1.0078125, "learning_rate": 0.00023812003512102453, "loss": 5.3786, "mean_token_accuracy": 0.2229514792561531, "num_tokens": 122448898.0, "step": 48315 }, { "entropy": 6.013726902008057, "epoch": 5.576457010963647, "grad_norm": 1.03125, "learning_rate": 0.00023807932948427486, "loss": 5.3739, "mean_token_accuracy": 0.2266082987189293, "num_tokens": 122461727.0, "step": 48320 }, { "entropy": 6.029468297958374, "epoch": 5.577034045008656, "grad_norm": 1.0859375, "learning_rate": 0.0002380386250893335, "loss": 5.4154, "mean_token_accuracy": 0.2189100831747055, "num_tokens": 122473656.0, "step": 48325 }, { "entropy": 6.0521844863891605, "epoch": 5.577611079053664, "grad_norm": 1.0546875, "learning_rate": 0.0002379979219375697, "loss": 5.4806, "mean_token_accuracy": 0.2151751697063446, "num_tokens": 122485240.0, "step": 48330 }, { "entropy": 6.068121099472046, "epoch": 5.578188113098673, "grad_norm": 1.03125, "learning_rate": 0.0002379572200303523, "loss": 5.4473, "mean_token_accuracy": 0.22772873044013978, "num_tokens": 122498452.0, "step": 48335 }, { "entropy": 6.1030010223388675, "epoch": 5.578765147143681, "grad_norm": 1.0625, "learning_rate": 0.00023791651936905058, "loss": 5.4599, "mean_token_accuracy": 0.21725086718797684, "num_tokens": 122511165.0, "step": 48340 }, { "entropy": 6.05709867477417, "epoch": 5.57934218118869, "grad_norm": 0.95703125, "learning_rate": 0.0002378758199550331, "loss": 5.4454, "mean_token_accuracy": 0.2280835524201393, "num_tokens": 122525312.0, "step": 48345 }, { "entropy": 6.036635017395019, "epoch": 5.579919215233699, "grad_norm": 1.0, "learning_rate": 0.00023783512178966916, "loss": 5.449, "mean_token_accuracy": 0.21545152515172958, "num_tokens": 122537629.0, "step": 48350 }, { "entropy": 6.073492383956909, "epoch": 5.580496249278707, "grad_norm": 0.953125, "learning_rate": 0.00023779442487432734, "loss": 5.4622, "mean_token_accuracy": 0.2206231728196144, "num_tokens": 122551170.0, "step": 48355 }, { "entropy": 5.982183933258057, "epoch": 5.581073283323716, "grad_norm": 1.078125, "learning_rate": 0.00023775372921037657, "loss": 5.3645, "mean_token_accuracy": 0.2302156463265419, "num_tokens": 122563161.0, "step": 48360 }, { "entropy": 6.017331552505493, "epoch": 5.581650317368725, "grad_norm": 1.0390625, "learning_rate": 0.0002377130347991856, "loss": 5.3934, "mean_token_accuracy": 0.22583483010530472, "num_tokens": 122575652.0, "step": 48365 }, { "entropy": 6.043704605102539, "epoch": 5.582227351413733, "grad_norm": 1.0625, "learning_rate": 0.0002376723416421233, "loss": 5.4272, "mean_token_accuracy": 0.21747861057519913, "num_tokens": 122587781.0, "step": 48370 }, { "entropy": 5.964584684371948, "epoch": 5.582804385458742, "grad_norm": 0.9921875, "learning_rate": 0.00023763164974055812, "loss": 5.4008, "mean_token_accuracy": 0.22738104313611984, "num_tokens": 122600600.0, "step": 48375 }, { "entropy": 6.088488388061523, "epoch": 5.583381419503751, "grad_norm": 0.93359375, "learning_rate": 0.00023759095909585886, "loss": 5.4726, "mean_token_accuracy": 0.2209407016634941, "num_tokens": 122613160.0, "step": 48380 }, { "entropy": 6.084336805343628, "epoch": 5.583958453548759, "grad_norm": 0.94140625, "learning_rate": 0.00023755026970939414, "loss": 5.4479, "mean_token_accuracy": 0.22390652298927308, "num_tokens": 122625104.0, "step": 48385 }, { "entropy": 5.947153186798095, "epoch": 5.584535487593768, "grad_norm": 1.0390625, "learning_rate": 0.0002375095815825325, "loss": 5.3215, "mean_token_accuracy": 0.23465052247047424, "num_tokens": 122638991.0, "step": 48390 }, { "entropy": 5.9636482238769535, "epoch": 5.585112521638777, "grad_norm": 1.0234375, "learning_rate": 0.0002374688947166424, "loss": 5.3457, "mean_token_accuracy": 0.234133517742157, "num_tokens": 122652947.0, "step": 48395 }, { "entropy": 6.020062780380249, "epoch": 5.585689555683786, "grad_norm": 0.99609375, "learning_rate": 0.0002374282091130925, "loss": 5.397, "mean_token_accuracy": 0.22638286352157594, "num_tokens": 122667323.0, "step": 48400 }, { "entropy": 6.0355278015136715, "epoch": 5.586266589728794, "grad_norm": 0.91015625, "learning_rate": 0.00023738752477325099, "loss": 5.3982, "mean_token_accuracy": 0.2267741620540619, "num_tokens": 122679972.0, "step": 48405 }, { "entropy": 5.960158586502075, "epoch": 5.586843623773802, "grad_norm": 1.0546875, "learning_rate": 0.00023734684169848648, "loss": 5.3831, "mean_token_accuracy": 0.23085542470216752, "num_tokens": 122693616.0, "step": 48410 }, { "entropy": 6.063619136810303, "epoch": 5.587420657818812, "grad_norm": 1.0390625, "learning_rate": 0.00023730615989016725, "loss": 5.438, "mean_token_accuracy": 0.21528619825839995, "num_tokens": 122705596.0, "step": 48415 }, { "entropy": 6.012936019897461, "epoch": 5.58799769186382, "grad_norm": 1.0390625, "learning_rate": 0.0002372654793496616, "loss": 5.3741, "mean_token_accuracy": 0.22619224190711976, "num_tokens": 122718406.0, "step": 48420 }, { "entropy": 6.049465560913086, "epoch": 5.5885747259088285, "grad_norm": 0.99609375, "learning_rate": 0.00023722480007833775, "loss": 5.4947, "mean_token_accuracy": 0.22253556847572326, "num_tokens": 122730693.0, "step": 48425 }, { "entropy": 6.002363586425782, "epoch": 5.589151759953837, "grad_norm": 0.9765625, "learning_rate": 0.00023718412207756408, "loss": 5.4214, "mean_token_accuracy": 0.22305867224931716, "num_tokens": 122742353.0, "step": 48430 }, { "entropy": 6.089612340927124, "epoch": 5.589728793998846, "grad_norm": 0.9765625, "learning_rate": 0.00023714344534870858, "loss": 5.4666, "mean_token_accuracy": 0.22018018513917922, "num_tokens": 122754993.0, "step": 48435 }, { "entropy": 6.06230354309082, "epoch": 5.590305828043855, "grad_norm": 1.0390625, "learning_rate": 0.00023710276989313955, "loss": 5.4404, "mean_token_accuracy": 0.21110750436782838, "num_tokens": 122768154.0, "step": 48440 }, { "entropy": 6.028749275207519, "epoch": 5.590882862088863, "grad_norm": 0.98046875, "learning_rate": 0.00023706209571222497, "loss": 5.4508, "mean_token_accuracy": 0.2165164276957512, "num_tokens": 122780895.0, "step": 48445 }, { "entropy": 5.8899320602417, "epoch": 5.5914598961338715, "grad_norm": 1.015625, "learning_rate": 0.00023702142280733308, "loss": 5.2928, "mean_token_accuracy": 0.23407047092914582, "num_tokens": 122794439.0, "step": 48450 }, { "entropy": 5.992277908325195, "epoch": 5.592036930178881, "grad_norm": 1.03125, "learning_rate": 0.0002369807511798317, "loss": 5.3148, "mean_token_accuracy": 0.2304818481206894, "num_tokens": 122807089.0, "step": 48455 }, { "entropy": 6.074002027511597, "epoch": 5.592613964223889, "grad_norm": 1.0390625, "learning_rate": 0.00023694008083108886, "loss": 5.4756, "mean_token_accuracy": 0.2115398555994034, "num_tokens": 122819767.0, "step": 48460 }, { "entropy": 6.094053745269775, "epoch": 5.593190998268898, "grad_norm": 1.1171875, "learning_rate": 0.00023689941176247242, "loss": 5.4612, "mean_token_accuracy": 0.21423859596252443, "num_tokens": 122831260.0, "step": 48465 }, { "entropy": 6.1231413841247555, "epoch": 5.593768032313907, "grad_norm": 0.984375, "learning_rate": 0.0002368587439753505, "loss": 5.5252, "mean_token_accuracy": 0.22157291918992997, "num_tokens": 122843516.0, "step": 48470 }, { "entropy": 5.909885120391846, "epoch": 5.594345066358915, "grad_norm": 1.0078125, "learning_rate": 0.00023681807747109068, "loss": 5.3158, "mean_token_accuracy": 0.23961429595947265, "num_tokens": 122857791.0, "step": 48475 }, { "entropy": 5.983511352539063, "epoch": 5.594922100403924, "grad_norm": 1.0390625, "learning_rate": 0.00023677741225106092, "loss": 5.3859, "mean_token_accuracy": 0.2277877390384674, "num_tokens": 122870179.0, "step": 48480 }, { "entropy": 6.062080049514771, "epoch": 5.595499134448932, "grad_norm": 1.0703125, "learning_rate": 0.00023673674831662877, "loss": 5.459, "mean_token_accuracy": 0.22217997759580613, "num_tokens": 122883450.0, "step": 48485 }, { "entropy": 6.010832786560059, "epoch": 5.5960761684939415, "grad_norm": 0.9609375, "learning_rate": 0.00023669608566916227, "loss": 5.4137, "mean_token_accuracy": 0.2213813528418541, "num_tokens": 122896381.0, "step": 48490 }, { "entropy": 6.075430154800415, "epoch": 5.59665320253895, "grad_norm": 1.109375, "learning_rate": 0.0002366554243100288, "loss": 5.4337, "mean_token_accuracy": 0.2199198216199875, "num_tokens": 122908822.0, "step": 48495 }, { "entropy": 6.124392461776734, "epoch": 5.597230236583958, "grad_norm": 1.109375, "learning_rate": 0.00023661476424059614, "loss": 5.5358, "mean_token_accuracy": 0.20775512903928756, "num_tokens": 122920551.0, "step": 48500 }, { "entropy": 6.135513544082642, "epoch": 5.597807270628967, "grad_norm": 0.98046875, "learning_rate": 0.00023657410546223175, "loss": 5.5224, "mean_token_accuracy": 0.20922305434942245, "num_tokens": 122933180.0, "step": 48505 }, { "entropy": 6.0686439037322994, "epoch": 5.598384304673976, "grad_norm": 1.015625, "learning_rate": 0.00023653344797630333, "loss": 5.4966, "mean_token_accuracy": 0.20996746122837068, "num_tokens": 122944701.0, "step": 48510 }, { "entropy": 6.074875593185425, "epoch": 5.5989613387189845, "grad_norm": 1.1328125, "learning_rate": 0.00023649279178417816, "loss": 5.4703, "mean_token_accuracy": 0.2156743362545967, "num_tokens": 122957748.0, "step": 48515 }, { "entropy": 6.031651639938355, "epoch": 5.599538372763993, "grad_norm": 1.0625, "learning_rate": 0.0002364521368872239, "loss": 5.3483, "mean_token_accuracy": 0.23394380062818526, "num_tokens": 122970789.0, "step": 48520 }, { "entropy": 6.035295200347901, "epoch": 5.600115406809001, "grad_norm": 1.0390625, "learning_rate": 0.00023641148328680777, "loss": 5.4263, "mean_token_accuracy": 0.22339330315589906, "num_tokens": 122983900.0, "step": 48525 }, { "entropy": 6.081436395645142, "epoch": 5.600692440854011, "grad_norm": 0.96875, "learning_rate": 0.00023637083098429734, "loss": 5.4952, "mean_token_accuracy": 0.22286250740289687, "num_tokens": 122997531.0, "step": 48530 }, { "entropy": 6.044224786758423, "epoch": 5.601269474899019, "grad_norm": 0.9296875, "learning_rate": 0.00023633017998105977, "loss": 5.4771, "mean_token_accuracy": 0.22007400095462798, "num_tokens": 123010568.0, "step": 48535 }, { "entropy": 6.055957651138305, "epoch": 5.6018465089440275, "grad_norm": 1.1953125, "learning_rate": 0.0002362895302784624, "loss": 5.5211, "mean_token_accuracy": 0.21879362165927888, "num_tokens": 123023645.0, "step": 48540 }, { "entropy": 6.060488843917847, "epoch": 5.602423542989037, "grad_norm": 0.984375, "learning_rate": 0.00023624888187787242, "loss": 5.4451, "mean_token_accuracy": 0.21792462319135666, "num_tokens": 123036529.0, "step": 48545 }, { "entropy": 5.933151292800903, "epoch": 5.603000577034045, "grad_norm": 1.0390625, "learning_rate": 0.00023620823478065706, "loss": 5.2873, "mean_token_accuracy": 0.23199762254953385, "num_tokens": 123049746.0, "step": 48550 }, { "entropy": 5.95906662940979, "epoch": 5.603577611079054, "grad_norm": 1.0703125, "learning_rate": 0.00023616758898818352, "loss": 5.3554, "mean_token_accuracy": 0.23741820305585862, "num_tokens": 123061320.0, "step": 48555 }, { "entropy": 6.048046970367432, "epoch": 5.604154645124062, "grad_norm": 1.0703125, "learning_rate": 0.00023612694450181877, "loss": 5.4331, "mean_token_accuracy": 0.22897976040840148, "num_tokens": 123073113.0, "step": 48560 }, { "entropy": 6.043319511413574, "epoch": 5.604731679169071, "grad_norm": 1.078125, "learning_rate": 0.00023608630132292992, "loss": 5.4742, "mean_token_accuracy": 0.217577263712883, "num_tokens": 123085820.0, "step": 48565 }, { "entropy": 6.075659322738647, "epoch": 5.60530871321408, "grad_norm": 0.93359375, "learning_rate": 0.00023604565945288403, "loss": 5.491, "mean_token_accuracy": 0.22011861801147461, "num_tokens": 123099676.0, "step": 48570 }, { "entropy": 6.0593139171600345, "epoch": 5.605885747259088, "grad_norm": 1.0703125, "learning_rate": 0.00023600501889304808, "loss": 5.4581, "mean_token_accuracy": 0.2181072399020195, "num_tokens": 123111866.0, "step": 48575 }, { "entropy": 6.079110336303711, "epoch": 5.606462781304097, "grad_norm": 0.98046875, "learning_rate": 0.00023596437964478885, "loss": 5.4577, "mean_token_accuracy": 0.21434439569711686, "num_tokens": 123123177.0, "step": 48580 }, { "entropy": 5.996688508987427, "epoch": 5.607039815349106, "grad_norm": 1.0703125, "learning_rate": 0.0002359237417094734, "loss": 5.4172, "mean_token_accuracy": 0.22447736114263533, "num_tokens": 123135934.0, "step": 48585 }, { "entropy": 6.040232706069946, "epoch": 5.607616849394114, "grad_norm": 1.046875, "learning_rate": 0.00023588310508846844, "loss": 5.3918, "mean_token_accuracy": 0.22378274351358413, "num_tokens": 123147920.0, "step": 48590 }, { "entropy": 6.031450891494751, "epoch": 5.608193883439123, "grad_norm": 1.0390625, "learning_rate": 0.00023584246978314088, "loss": 5.4343, "mean_token_accuracy": 0.22294647097587586, "num_tokens": 123161903.0, "step": 48595 }, { "entropy": 6.045877885818482, "epoch": 5.608770917484131, "grad_norm": 1.0078125, "learning_rate": 0.00023580183579485726, "loss": 5.4228, "mean_token_accuracy": 0.2190336748957634, "num_tokens": 123175438.0, "step": 48600 }, { "entropy": 6.0033563613891605, "epoch": 5.6093479515291405, "grad_norm": 1.078125, "learning_rate": 0.0002357612031249846, "loss": 5.4301, "mean_token_accuracy": 0.22248134016990662, "num_tokens": 123188039.0, "step": 48605 }, { "entropy": 6.026626873016357, "epoch": 5.609924985574149, "grad_norm": 1.046875, "learning_rate": 0.0002357205717748892, "loss": 5.4696, "mean_token_accuracy": 0.21874606609344482, "num_tokens": 123200202.0, "step": 48610 }, { "entropy": 6.088913059234619, "epoch": 5.610502019619157, "grad_norm": 1.03125, "learning_rate": 0.000235679941745938, "loss": 5.4973, "mean_token_accuracy": 0.21340277493000032, "num_tokens": 123212000.0, "step": 48615 }, { "entropy": 6.115221071243286, "epoch": 5.611079053664167, "grad_norm": 1.0625, "learning_rate": 0.00023563931303949732, "loss": 5.534, "mean_token_accuracy": 0.21489989012479782, "num_tokens": 123225007.0, "step": 48620 }, { "entropy": 6.033494377136231, "epoch": 5.611656087709175, "grad_norm": 1.0625, "learning_rate": 0.00023559868565693393, "loss": 5.3796, "mean_token_accuracy": 0.2395218625664711, "num_tokens": 123239252.0, "step": 48625 }, { "entropy": 5.988898801803589, "epoch": 5.612233121754183, "grad_norm": 0.99609375, "learning_rate": 0.00023555805959961406, "loss": 5.3729, "mean_token_accuracy": 0.22880322784185408, "num_tokens": 123251505.0, "step": 48630 }, { "entropy": 6.0421360492706295, "epoch": 5.612810155799192, "grad_norm": 1.03125, "learning_rate": 0.00023551743486890432, "loss": 5.3978, "mean_token_accuracy": 0.22480324059724807, "num_tokens": 123262607.0, "step": 48635 }, { "entropy": 5.971423530578614, "epoch": 5.613387189844201, "grad_norm": 1.140625, "learning_rate": 0.000235476811466171, "loss": 5.3022, "mean_token_accuracy": 0.23616798222064972, "num_tokens": 123273674.0, "step": 48640 }, { "entropy": 6.050618457794189, "epoch": 5.61396422388921, "grad_norm": 1.1171875, "learning_rate": 0.00023543618939278057, "loss": 5.4549, "mean_token_accuracy": 0.22302118837833404, "num_tokens": 123286638.0, "step": 48645 }, { "entropy": 6.0823108673095705, "epoch": 5.614541257934218, "grad_norm": 1.0390625, "learning_rate": 0.0002353955686500992, "loss": 5.4453, "mean_token_accuracy": 0.22052307277917862, "num_tokens": 123299587.0, "step": 48650 }, { "entropy": 6.052453517913818, "epoch": 5.615118291979226, "grad_norm": 1.0, "learning_rate": 0.0002353549492394932, "loss": 5.4798, "mean_token_accuracy": 0.22392387986183165, "num_tokens": 123312511.0, "step": 48655 }, { "entropy": 6.020852565765381, "epoch": 5.615695326024236, "grad_norm": 1.03125, "learning_rate": 0.00023531433116232876, "loss": 5.3954, "mean_token_accuracy": 0.23296763896942138, "num_tokens": 123324711.0, "step": 48660 }, { "entropy": 6.041205835342407, "epoch": 5.616272360069244, "grad_norm": 1.109375, "learning_rate": 0.0002352737144199722, "loss": 5.382, "mean_token_accuracy": 0.22759367674589157, "num_tokens": 123336940.0, "step": 48665 }, { "entropy": 6.0020036697387695, "epoch": 5.6168493941142525, "grad_norm": 1.0546875, "learning_rate": 0.0002352330990137894, "loss": 5.356, "mean_token_accuracy": 0.22978801131248475, "num_tokens": 123349107.0, "step": 48670 }, { "entropy": 6.009737396240235, "epoch": 5.617426428159261, "grad_norm": 1.015625, "learning_rate": 0.0002351924849451466, "loss": 5.436, "mean_token_accuracy": 0.22415084689855574, "num_tokens": 123361710.0, "step": 48675 }, { "entropy": 6.0294764041900635, "epoch": 5.61800346220427, "grad_norm": 1.0703125, "learning_rate": 0.0002351518722154098, "loss": 5.4043, "mean_token_accuracy": 0.21810402572155, "num_tokens": 123373716.0, "step": 48680 }, { "entropy": 6.059708738327027, "epoch": 5.618580496249279, "grad_norm": 0.9921875, "learning_rate": 0.00023511126082594502, "loss": 5.5482, "mean_token_accuracy": 0.21546269804239274, "num_tokens": 123389052.0, "step": 48685 }, { "entropy": 5.957034683227539, "epoch": 5.619157530294287, "grad_norm": 0.97265625, "learning_rate": 0.00023507065077811812, "loss": 5.2727, "mean_token_accuracy": 0.229182368516922, "num_tokens": 123401716.0, "step": 48690 }, { "entropy": 6.053309059143066, "epoch": 5.619734564339296, "grad_norm": 1.0625, "learning_rate": 0.00023503004207329505, "loss": 5.4568, "mean_token_accuracy": 0.2248503476381302, "num_tokens": 123414462.0, "step": 48695 }, { "entropy": 6.066244411468506, "epoch": 5.620311598384305, "grad_norm": 1.15625, "learning_rate": 0.00023498943471284163, "loss": 5.3851, "mean_token_accuracy": 0.2312533065676689, "num_tokens": 123426369.0, "step": 48700 }, { "entropy": 6.064543104171753, "epoch": 5.620888632429313, "grad_norm": 1.0078125, "learning_rate": 0.00023494882869812378, "loss": 5.4579, "mean_token_accuracy": 0.21964575946331025, "num_tokens": 123438404.0, "step": 48705 }, { "entropy": 5.984299039840698, "epoch": 5.621465666474322, "grad_norm": 0.98828125, "learning_rate": 0.00023490822403050715, "loss": 5.3476, "mean_token_accuracy": 0.22685596495866775, "num_tokens": 123450552.0, "step": 48710 }, { "entropy": 5.9882887840271, "epoch": 5.622042700519331, "grad_norm": 1.0078125, "learning_rate": 0.0002348676207113575, "loss": 5.3744, "mean_token_accuracy": 0.22609336525201798, "num_tokens": 123465061.0, "step": 48715 }, { "entropy": 5.98761215209961, "epoch": 5.622619734564339, "grad_norm": 0.9375, "learning_rate": 0.00023482701874204042, "loss": 5.3811, "mean_token_accuracy": 0.2279409572482109, "num_tokens": 123477189.0, "step": 48720 }, { "entropy": 6.022925519943238, "epoch": 5.623196768609348, "grad_norm": 1.0, "learning_rate": 0.0002347864181239217, "loss": 5.4072, "mean_token_accuracy": 0.21891028881073, "num_tokens": 123489334.0, "step": 48725 }, { "entropy": 6.086496257781983, "epoch": 5.623773802654356, "grad_norm": 1.046875, "learning_rate": 0.00023474581885836676, "loss": 5.5844, "mean_token_accuracy": 0.21108290553092957, "num_tokens": 123502187.0, "step": 48730 }, { "entropy": 6.0198976516723635, "epoch": 5.6243508366993655, "grad_norm": 0.95703125, "learning_rate": 0.0002347052209467413, "loss": 5.4007, "mean_token_accuracy": 0.22978236377239228, "num_tokens": 123516912.0, "step": 48735 }, { "entropy": 6.13423719406128, "epoch": 5.624927870744374, "grad_norm": 1.1171875, "learning_rate": 0.0002346646243904106, "loss": 5.5218, "mean_token_accuracy": 0.2146674707531929, "num_tokens": 123528649.0, "step": 48740 }, { "entropy": 5.993073463439941, "epoch": 5.625504904789382, "grad_norm": 1.0625, "learning_rate": 0.00023462402919074033, "loss": 5.2912, "mean_token_accuracy": 0.23484388887882232, "num_tokens": 123540881.0, "step": 48745 }, { "entropy": 5.997282218933106, "epoch": 5.626081938834391, "grad_norm": 1.078125, "learning_rate": 0.0002345834353490957, "loss": 5.3545, "mean_token_accuracy": 0.22546696215867995, "num_tokens": 123553725.0, "step": 48750 }, { "entropy": 5.987742280960083, "epoch": 5.6266589728794, "grad_norm": 1.28125, "learning_rate": 0.00023454284286684218, "loss": 5.353, "mean_token_accuracy": 0.23213544338941575, "num_tokens": 123566078.0, "step": 48755 }, { "entropy": 5.9443034648895265, "epoch": 5.6272360069244085, "grad_norm": 0.890625, "learning_rate": 0.00023450225174534501, "loss": 5.3991, "mean_token_accuracy": 0.2314183384180069, "num_tokens": 123579767.0, "step": 48760 }, { "entropy": 5.916303968429565, "epoch": 5.627813040969417, "grad_norm": 1.1171875, "learning_rate": 0.00023446166198596964, "loss": 5.3162, "mean_token_accuracy": 0.23134373128414154, "num_tokens": 123591940.0, "step": 48765 }, { "entropy": 6.0680896759033205, "epoch": 5.628390075014426, "grad_norm": 1.03125, "learning_rate": 0.00023442107359008093, "loss": 5.4147, "mean_token_accuracy": 0.22324239313602448, "num_tokens": 123604110.0, "step": 48770 }, { "entropy": 6.071094942092896, "epoch": 5.628967109059435, "grad_norm": 1.015625, "learning_rate": 0.00023438048655904437, "loss": 5.3931, "mean_token_accuracy": 0.22426164895296097, "num_tokens": 123616506.0, "step": 48775 }, { "entropy": 6.012036228179932, "epoch": 5.629544143104443, "grad_norm": 0.99609375, "learning_rate": 0.0002343399008942249, "loss": 5.3416, "mean_token_accuracy": 0.2312915414571762, "num_tokens": 123628790.0, "step": 48780 }, { "entropy": 6.047964763641358, "epoch": 5.6301211771494515, "grad_norm": 1.0546875, "learning_rate": 0.0002342993165969878, "loss": 5.4354, "mean_token_accuracy": 0.21887692511081697, "num_tokens": 123641395.0, "step": 48785 }, { "entropy": 6.126016521453858, "epoch": 5.630698211194461, "grad_norm": 1.0234375, "learning_rate": 0.00023425873366869775, "loss": 5.5492, "mean_token_accuracy": 0.21036146432161332, "num_tokens": 123652433.0, "step": 48790 }, { "entropy": 6.082267427444458, "epoch": 5.631275245239469, "grad_norm": 0.984375, "learning_rate": 0.00023421815211072016, "loss": 5.4921, "mean_token_accuracy": 0.20746401697397232, "num_tokens": 123664021.0, "step": 48795 }, { "entropy": 6.096015357971192, "epoch": 5.631852279284478, "grad_norm": 1.0078125, "learning_rate": 0.00023417757192441963, "loss": 5.4937, "mean_token_accuracy": 0.21198517233133315, "num_tokens": 123676476.0, "step": 48800 }, { "entropy": 6.104717159271241, "epoch": 5.632429313329487, "grad_norm": 0.98828125, "learning_rate": 0.0002341369931111613, "loss": 5.4843, "mean_token_accuracy": 0.21767588704824448, "num_tokens": 123688232.0, "step": 48805 }, { "entropy": 6.084763431549073, "epoch": 5.633006347374495, "grad_norm": 1.0859375, "learning_rate": 0.00023409641567230982, "loss": 5.5039, "mean_token_accuracy": 0.22262796461582185, "num_tokens": 123700693.0, "step": 48810 }, { "entropy": 6.023290729522705, "epoch": 5.633583381419504, "grad_norm": 0.9921875, "learning_rate": 0.0002340558396092301, "loss": 5.3816, "mean_token_accuracy": 0.22340599000453948, "num_tokens": 123712874.0, "step": 48815 }, { "entropy": 6.000479030609131, "epoch": 5.634160415464512, "grad_norm": 0.96484375, "learning_rate": 0.0002340152649232869, "loss": 5.3362, "mean_token_accuracy": 0.2256360560655594, "num_tokens": 123725012.0, "step": 48820 }, { "entropy": 6.072154712677002, "epoch": 5.634737449509521, "grad_norm": 0.96875, "learning_rate": 0.00023397469161584494, "loss": 5.4333, "mean_token_accuracy": 0.21912608593702315, "num_tokens": 123737339.0, "step": 48825 }, { "entropy": 5.912534475326538, "epoch": 5.63531448355453, "grad_norm": 1.0, "learning_rate": 0.00023393411968826878, "loss": 5.305, "mean_token_accuracy": 0.23952589631080629, "num_tokens": 123750024.0, "step": 48830 }, { "entropy": 6.008257913589477, "epoch": 5.635891517599538, "grad_norm": 0.953125, "learning_rate": 0.00023389354914192311, "loss": 5.4507, "mean_token_accuracy": 0.22470761835575104, "num_tokens": 123764051.0, "step": 48835 }, { "entropy": 6.007625865936279, "epoch": 5.636468551644547, "grad_norm": 1.0390625, "learning_rate": 0.0002338529799781725, "loss": 5.3723, "mean_token_accuracy": 0.2204154297709465, "num_tokens": 123776952.0, "step": 48840 }, { "entropy": 5.956822156906128, "epoch": 5.637045585689556, "grad_norm": 0.86328125, "learning_rate": 0.00023381241219838156, "loss": 5.3695, "mean_token_accuracy": 0.22407499998807906, "num_tokens": 123790476.0, "step": 48845 }, { "entropy": 6.05647463798523, "epoch": 5.6376226197345645, "grad_norm": 1.078125, "learning_rate": 0.00023377184580391453, "loss": 5.45, "mean_token_accuracy": 0.21693085134029388, "num_tokens": 123802390.0, "step": 48850 }, { "entropy": 5.997595596313476, "epoch": 5.638199653779573, "grad_norm": 1.0625, "learning_rate": 0.0002337312807961361, "loss": 5.451, "mean_token_accuracy": 0.21662611216306688, "num_tokens": 123816434.0, "step": 48855 }, { "entropy": 6.021866750717163, "epoch": 5.638776687824581, "grad_norm": 0.99609375, "learning_rate": 0.00023369071717641048, "loss": 5.3808, "mean_token_accuracy": 0.23188189715147017, "num_tokens": 123829036.0, "step": 48860 }, { "entropy": 5.8233500003814695, "epoch": 5.639353721869591, "grad_norm": 0.9453125, "learning_rate": 0.00023365015494610213, "loss": 5.2539, "mean_token_accuracy": 0.23892807513475417, "num_tokens": 123843321.0, "step": 48865 }, { "entropy": 6.051720094680786, "epoch": 5.639930755914599, "grad_norm": 1.046875, "learning_rate": 0.00023360959410657523, "loss": 5.4926, "mean_token_accuracy": 0.2142215132713318, "num_tokens": 123856834.0, "step": 48870 }, { "entropy": 6.060619688034057, "epoch": 5.640507789959607, "grad_norm": 0.984375, "learning_rate": 0.00023356903465919404, "loss": 5.4241, "mean_token_accuracy": 0.2278833732008934, "num_tokens": 123869209.0, "step": 48875 }, { "entropy": 6.083366394042969, "epoch": 5.641084824004617, "grad_norm": 1.0625, "learning_rate": 0.00023352847660532283, "loss": 5.4145, "mean_token_accuracy": 0.2221358209848404, "num_tokens": 123881464.0, "step": 48880 }, { "entropy": 6.039099597930909, "epoch": 5.641661858049625, "grad_norm": 1.0546875, "learning_rate": 0.00023348791994632574, "loss": 5.4163, "mean_token_accuracy": 0.22200752496719361, "num_tokens": 123893215.0, "step": 48885 }, { "entropy": 6.003465032577514, "epoch": 5.642238892094634, "grad_norm": 1.0859375, "learning_rate": 0.0002334473646835668, "loss": 5.3195, "mean_token_accuracy": 0.23744122982025145, "num_tokens": 123906836.0, "step": 48890 }, { "entropy": 6.01914348602295, "epoch": 5.642815926139642, "grad_norm": 1.0390625, "learning_rate": 0.00023340681081841016, "loss": 5.4539, "mean_token_accuracy": 0.21955888867378234, "num_tokens": 123920008.0, "step": 48895 }, { "entropy": 6.072041034698486, "epoch": 5.64339296018465, "grad_norm": 1.0859375, "learning_rate": 0.0002333662583522197, "loss": 5.4592, "mean_token_accuracy": 0.22103455364704133, "num_tokens": 123932715.0, "step": 48900 }, { "entropy": 6.104324197769165, "epoch": 5.64396999422966, "grad_norm": 1.0, "learning_rate": 0.00023332570728635955, "loss": 5.4926, "mean_token_accuracy": 0.218172025680542, "num_tokens": 123945791.0, "step": 48905 }, { "entropy": 6.018582010269165, "epoch": 5.644547028274668, "grad_norm": 0.96875, "learning_rate": 0.00023328515762219344, "loss": 5.4619, "mean_token_accuracy": 0.22064395546913146, "num_tokens": 123957889.0, "step": 48910 }, { "entropy": 6.029186105728149, "epoch": 5.645124062319677, "grad_norm": 1.0, "learning_rate": 0.00023324460936108537, "loss": 5.3675, "mean_token_accuracy": 0.22603900730609894, "num_tokens": 123969970.0, "step": 48915 }, { "entropy": 6.056659746170044, "epoch": 5.645701096364686, "grad_norm": 1.03125, "learning_rate": 0.00023320406250439913, "loss": 5.446, "mean_token_accuracy": 0.22046137005090713, "num_tokens": 123982008.0, "step": 48920 }, { "entropy": 6.073990678787231, "epoch": 5.646278130409694, "grad_norm": 1.03125, "learning_rate": 0.00023316351705349853, "loss": 5.4677, "mean_token_accuracy": 0.21452061086893082, "num_tokens": 123994539.0, "step": 48925 }, { "entropy": 6.073710250854492, "epoch": 5.646855164454703, "grad_norm": 0.9296875, "learning_rate": 0.00023312297300974715, "loss": 5.5101, "mean_token_accuracy": 0.21114504039287568, "num_tokens": 124007875.0, "step": 48930 }, { "entropy": 6.011294507980347, "epoch": 5.647432198499711, "grad_norm": 1.0390625, "learning_rate": 0.0002330824303745089, "loss": 5.3979, "mean_token_accuracy": 0.22747056931257248, "num_tokens": 124020689.0, "step": 48935 }, { "entropy": 6.06277871131897, "epoch": 5.64800923254472, "grad_norm": 1.046875, "learning_rate": 0.00023304188914914715, "loss": 5.3898, "mean_token_accuracy": 0.22909726053476334, "num_tokens": 124033055.0, "step": 48940 }, { "entropy": 6.006246089935303, "epoch": 5.648586266589729, "grad_norm": 1.0625, "learning_rate": 0.0002330013493350257, "loss": 5.4385, "mean_token_accuracy": 0.2278904914855957, "num_tokens": 124046328.0, "step": 48945 }, { "entropy": 6.0035881996154785, "epoch": 5.649163300634737, "grad_norm": 1.0625, "learning_rate": 0.00023296081093350797, "loss": 5.4012, "mean_token_accuracy": 0.22369564920663834, "num_tokens": 124059864.0, "step": 48950 }, { "entropy": 6.016777229309082, "epoch": 5.649740334679747, "grad_norm": 1.0546875, "learning_rate": 0.00023292027394595743, "loss": 5.3591, "mean_token_accuracy": 0.23101101368665694, "num_tokens": 124072005.0, "step": 48955 }, { "entropy": 6.050408124923706, "epoch": 5.650317368724755, "grad_norm": 0.9765625, "learning_rate": 0.00023287973837373766, "loss": 5.4565, "mean_token_accuracy": 0.22186203449964523, "num_tokens": 124085338.0, "step": 48960 }, { "entropy": 6.033575868606567, "epoch": 5.650894402769763, "grad_norm": 1.0546875, "learning_rate": 0.00023283920421821193, "loss": 5.4052, "mean_token_accuracy": 0.2284867972135544, "num_tokens": 124098735.0, "step": 48965 }, { "entropy": 6.003314685821533, "epoch": 5.651471436814772, "grad_norm": 0.98828125, "learning_rate": 0.0002327986714807437, "loss": 5.4671, "mean_token_accuracy": 0.21685291081666946, "num_tokens": 124112452.0, "step": 48970 }, { "entropy": 6.068099641799927, "epoch": 5.65204847085978, "grad_norm": 0.97265625, "learning_rate": 0.00023275814016269608, "loss": 5.4846, "mean_token_accuracy": 0.22210833430290222, "num_tokens": 124127107.0, "step": 48975 }, { "entropy": 6.079826211929321, "epoch": 5.6526255049047895, "grad_norm": 1.0, "learning_rate": 0.00023271761026543258, "loss": 5.3971, "mean_token_accuracy": 0.23116786479949952, "num_tokens": 124139866.0, "step": 48980 }, { "entropy": 5.978127098083496, "epoch": 5.653202538949798, "grad_norm": 1.0546875, "learning_rate": 0.00023267708179031604, "loss": 5.3838, "mean_token_accuracy": 0.21716877967119216, "num_tokens": 124152476.0, "step": 48985 }, { "entropy": 5.948775053024292, "epoch": 5.653779572994806, "grad_norm": 1.046875, "learning_rate": 0.00023263655473871003, "loss": 5.3268, "mean_token_accuracy": 0.2256606176495552, "num_tokens": 124163903.0, "step": 48990 }, { "entropy": 6.05572280883789, "epoch": 5.654356607039816, "grad_norm": 1.0546875, "learning_rate": 0.00023259602911197735, "loss": 5.4437, "mean_token_accuracy": 0.21947384178638457, "num_tokens": 124175779.0, "step": 48995 }, { "entropy": 6.058055686950683, "epoch": 5.654933641084824, "grad_norm": 1.0078125, "learning_rate": 0.00023255550491148126, "loss": 5.4506, "mean_token_accuracy": 0.22696993499994278, "num_tokens": 124187877.0, "step": 49000 }, { "entropy": 6.019927215576172, "epoch": 5.6555106751298325, "grad_norm": 1.09375, "learning_rate": 0.00023251498213858456, "loss": 5.3285, "mean_token_accuracy": 0.23231821805238723, "num_tokens": 124200748.0, "step": 49005 }, { "entropy": 6.035115957260132, "epoch": 5.656087709174841, "grad_norm": 1.0390625, "learning_rate": 0.0002324744607946504, "loss": 5.4808, "mean_token_accuracy": 0.21874619424343109, "num_tokens": 124212912.0, "step": 49010 }, { "entropy": 6.043200254440308, "epoch": 5.65666474321985, "grad_norm": 1.0390625, "learning_rate": 0.00023243394088104158, "loss": 5.4261, "mean_token_accuracy": 0.21857526600360871, "num_tokens": 124224761.0, "step": 49015 }, { "entropy": 6.10180401802063, "epoch": 5.657241777264859, "grad_norm": 1.1171875, "learning_rate": 0.0002323934223991211, "loss": 5.484, "mean_token_accuracy": 0.2132047474384308, "num_tokens": 124236482.0, "step": 49020 }, { "entropy": 6.102551460266113, "epoch": 5.657818811309867, "grad_norm": 1.0, "learning_rate": 0.0002323529053502516, "loss": 5.5545, "mean_token_accuracy": 0.20767866671085358, "num_tokens": 124249619.0, "step": 49025 }, { "entropy": 6.080642414093018, "epoch": 5.658395845354876, "grad_norm": 1.0234375, "learning_rate": 0.000232312389735796, "loss": 5.4679, "mean_token_accuracy": 0.2189650282263756, "num_tokens": 124262569.0, "step": 49030 }, { "entropy": 6.040057849884033, "epoch": 5.658972879399885, "grad_norm": 0.984375, "learning_rate": 0.00023227187555711692, "loss": 5.3473, "mean_token_accuracy": 0.22882839292287827, "num_tokens": 124274302.0, "step": 49035 }, { "entropy": 5.952656364440918, "epoch": 5.659549913444893, "grad_norm": 1.15625, "learning_rate": 0.00023223136281557723, "loss": 5.3513, "mean_token_accuracy": 0.2263977512717247, "num_tokens": 124285978.0, "step": 49040 }, { "entropy": 6.098104953765869, "epoch": 5.660126947489902, "grad_norm": 1.078125, "learning_rate": 0.0002321908515125392, "loss": 5.4576, "mean_token_accuracy": 0.21454819440841674, "num_tokens": 124297947.0, "step": 49045 }, { "entropy": 6.087552309036255, "epoch": 5.660703981534911, "grad_norm": 1.0078125, "learning_rate": 0.00023215034164936576, "loss": 5.4298, "mean_token_accuracy": 0.2161904200911522, "num_tokens": 124310612.0, "step": 49050 }, { "entropy": 5.984824562072754, "epoch": 5.661281015579919, "grad_norm": 1.078125, "learning_rate": 0.0002321098332274192, "loss": 5.4039, "mean_token_accuracy": 0.22638904750347139, "num_tokens": 124322605.0, "step": 49055 }, { "entropy": 5.971964693069458, "epoch": 5.661858049624928, "grad_norm": 0.9921875, "learning_rate": 0.0002320693262480622, "loss": 5.4085, "mean_token_accuracy": 0.2309669479727745, "num_tokens": 124334859.0, "step": 49060 }, { "entropy": 6.085665369033814, "epoch": 5.662435083669936, "grad_norm": 1.046875, "learning_rate": 0.00023202882071265702, "loss": 5.4456, "mean_token_accuracy": 0.22254098802804947, "num_tokens": 124346565.0, "step": 49065 }, { "entropy": 6.018671941757202, "epoch": 5.6630121177149455, "grad_norm": 1.0078125, "learning_rate": 0.00023198831662256614, "loss": 5.3427, "mean_token_accuracy": 0.22837089002132416, "num_tokens": 124360539.0, "step": 49070 }, { "entropy": 6.0850873470306395, "epoch": 5.663589151759954, "grad_norm": 1.125, "learning_rate": 0.00023194781397915178, "loss": 5.481, "mean_token_accuracy": 0.2100539892911911, "num_tokens": 124371414.0, "step": 49075 }, { "entropy": 6.0110148906707765, "epoch": 5.664166185804962, "grad_norm": 1.1328125, "learning_rate": 0.00023190731278377642, "loss": 5.4549, "mean_token_accuracy": 0.21831038743257522, "num_tokens": 124383433.0, "step": 49080 }, { "entropy": 6.000651073455811, "epoch": 5.664743219849971, "grad_norm": 0.95703125, "learning_rate": 0.0002318668130378021, "loss": 5.3831, "mean_token_accuracy": 0.23168915510177612, "num_tokens": 124396567.0, "step": 49085 }, { "entropy": 5.98125958442688, "epoch": 5.66532025389498, "grad_norm": 0.9765625, "learning_rate": 0.00023182631474259115, "loss": 5.3514, "mean_token_accuracy": 0.22967492789030075, "num_tokens": 124408893.0, "step": 49090 }, { "entropy": 5.910297822952271, "epoch": 5.6658972879399885, "grad_norm": 0.94921875, "learning_rate": 0.00023178581789950564, "loss": 5.3682, "mean_token_accuracy": 0.23053745180368423, "num_tokens": 124422996.0, "step": 49095 }, { "entropy": 6.0870767593383786, "epoch": 5.666474321984997, "grad_norm": 1.0078125, "learning_rate": 0.00023174532250990777, "loss": 5.4467, "mean_token_accuracy": 0.21906241476535798, "num_tokens": 124435722.0, "step": 49100 }, { "entropy": 5.959550142288208, "epoch": 5.667051356030006, "grad_norm": 0.984375, "learning_rate": 0.00023170482857515933, "loss": 5.2997, "mean_token_accuracy": 0.2282679095864296, "num_tokens": 124450820.0, "step": 49105 }, { "entropy": 6.088429260253906, "epoch": 5.667628390075015, "grad_norm": 1.078125, "learning_rate": 0.00023166433609662256, "loss": 5.4841, "mean_token_accuracy": 0.21828382164239885, "num_tokens": 124464083.0, "step": 49110 }, { "entropy": 6.0429881572723385, "epoch": 5.668205424120023, "grad_norm": 1.03125, "learning_rate": 0.0002316238450756593, "loss": 5.4283, "mean_token_accuracy": 0.2175286054611206, "num_tokens": 124475730.0, "step": 49115 }, { "entropy": 6.073699903488159, "epoch": 5.6687824581650315, "grad_norm": 1.109375, "learning_rate": 0.00023158335551363152, "loss": 5.4501, "mean_token_accuracy": 0.221943998336792, "num_tokens": 124488901.0, "step": 49120 }, { "entropy": 6.075283765792847, "epoch": 5.669359492210041, "grad_norm": 0.99609375, "learning_rate": 0.00023154286741190096, "loss": 5.4947, "mean_token_accuracy": 0.2154714584350586, "num_tokens": 124501256.0, "step": 49125 }, { "entropy": 6.036823654174805, "epoch": 5.669936526255049, "grad_norm": 1.09375, "learning_rate": 0.0002315023807718295, "loss": 5.4528, "mean_token_accuracy": 0.22234490811824797, "num_tokens": 124513395.0, "step": 49130 }, { "entropy": 6.053715181350708, "epoch": 5.670513560300058, "grad_norm": 0.953125, "learning_rate": 0.00023146189559477876, "loss": 5.4162, "mean_token_accuracy": 0.2245945706963539, "num_tokens": 124525440.0, "step": 49135 }, { "entropy": 6.05609540939331, "epoch": 5.671090594345066, "grad_norm": 0.96484375, "learning_rate": 0.00023142141188211069, "loss": 5.4571, "mean_token_accuracy": 0.21906668394804002, "num_tokens": 124538437.0, "step": 49140 }, { "entropy": 6.041209650039673, "epoch": 5.671667628390075, "grad_norm": 1.0, "learning_rate": 0.00023138092963518664, "loss": 5.4005, "mean_token_accuracy": 0.22646197080612182, "num_tokens": 124551361.0, "step": 49145 }, { "entropy": 6.067145299911499, "epoch": 5.672244662435084, "grad_norm": 1.109375, "learning_rate": 0.00023134044885536847, "loss": 5.4715, "mean_token_accuracy": 0.21563300341367722, "num_tokens": 124564089.0, "step": 49150 }, { "entropy": 5.957214832305908, "epoch": 5.672821696480092, "grad_norm": 1.0546875, "learning_rate": 0.0002312999695440175, "loss": 5.3184, "mean_token_accuracy": 0.22793530374765397, "num_tokens": 124576493.0, "step": 49155 }, { "entropy": 6.0703206062316895, "epoch": 5.673398730525101, "grad_norm": 1.0390625, "learning_rate": 0.0002312594917024955, "loss": 5.5082, "mean_token_accuracy": 0.2087271273136139, "num_tokens": 124589614.0, "step": 49160 }, { "entropy": 6.090281867980957, "epoch": 5.67397576457011, "grad_norm": 0.94921875, "learning_rate": 0.0002312190153321636, "loss": 5.4038, "mean_token_accuracy": 0.22756052613258362, "num_tokens": 124602829.0, "step": 49165 }, { "entropy": 5.981957340240479, "epoch": 5.674552798615118, "grad_norm": 0.98828125, "learning_rate": 0.00023117854043438346, "loss": 5.3202, "mean_token_accuracy": 0.2388827383518219, "num_tokens": 124616542.0, "step": 49170 }, { "entropy": 5.908977317810058, "epoch": 5.675129832660127, "grad_norm": 1.015625, "learning_rate": 0.0002311380670105163, "loss": 5.3274, "mean_token_accuracy": 0.23150137215852737, "num_tokens": 124628818.0, "step": 49175 }, { "entropy": 5.969433307647705, "epoch": 5.675706866705136, "grad_norm": 1.0546875, "learning_rate": 0.00023109759506192363, "loss": 5.3476, "mean_token_accuracy": 0.22930223494768143, "num_tokens": 124641063.0, "step": 49180 }, { "entropy": 5.971551990509033, "epoch": 5.676283900750144, "grad_norm": 0.984375, "learning_rate": 0.00023105712458996636, "loss": 5.4117, "mean_token_accuracy": 0.22480900436639786, "num_tokens": 124655787.0, "step": 49185 }, { "entropy": 6.0313554286956785, "epoch": 5.676860934795153, "grad_norm": 0.92578125, "learning_rate": 0.00023101665559600593, "loss": 5.46, "mean_token_accuracy": 0.22012256234884262, "num_tokens": 124669093.0, "step": 49190 }, { "entropy": 6.069334840774536, "epoch": 5.677437968840161, "grad_norm": 0.9765625, "learning_rate": 0.0002309761880814034, "loss": 5.4218, "mean_token_accuracy": 0.21948032230138778, "num_tokens": 124681413.0, "step": 49195 }, { "entropy": 5.993844938278198, "epoch": 5.678015002885171, "grad_norm": 0.9921875, "learning_rate": 0.00023093572204752007, "loss": 5.3545, "mean_token_accuracy": 0.23845473378896714, "num_tokens": 124695225.0, "step": 49200 }, { "entropy": 6.01864013671875, "epoch": 5.678592036930179, "grad_norm": 1.125, "learning_rate": 0.0002308952574957167, "loss": 5.3794, "mean_token_accuracy": 0.2287394091486931, "num_tokens": 124707924.0, "step": 49205 }, { "entropy": 6.013266324996948, "epoch": 5.679169070975187, "grad_norm": 0.9765625, "learning_rate": 0.00023085479442735448, "loss": 5.3522, "mean_token_accuracy": 0.22471704035997392, "num_tokens": 124721058.0, "step": 49210 }, { "entropy": 6.038667297363281, "epoch": 5.679746105020196, "grad_norm": 1.046875, "learning_rate": 0.00023081433284379428, "loss": 5.4632, "mean_token_accuracy": 0.21689773648977279, "num_tokens": 124734153.0, "step": 49215 }, { "entropy": 5.980361270904541, "epoch": 5.680323139065205, "grad_norm": 1.0546875, "learning_rate": 0.0002307738727463971, "loss": 5.3139, "mean_token_accuracy": 0.22912372797727584, "num_tokens": 124747783.0, "step": 49220 }, { "entropy": 6.000739574432373, "epoch": 5.680900173110214, "grad_norm": 1.015625, "learning_rate": 0.00023073341413652371, "loss": 5.4258, "mean_token_accuracy": 0.22797234058380128, "num_tokens": 124760789.0, "step": 49225 }, { "entropy": 6.070571660995483, "epoch": 5.681477207155222, "grad_norm": 0.96484375, "learning_rate": 0.000230692957015535, "loss": 5.4604, "mean_token_accuracy": 0.21844085156917573, "num_tokens": 124773506.0, "step": 49230 }, { "entropy": 6.025353813171387, "epoch": 5.68205424120023, "grad_norm": 1.078125, "learning_rate": 0.00023065250138479154, "loss": 5.4385, "mean_token_accuracy": 0.22111011445522308, "num_tokens": 124787662.0, "step": 49235 }, { "entropy": 6.065636348724365, "epoch": 5.68263127524524, "grad_norm": 1.015625, "learning_rate": 0.00023061204724565432, "loss": 5.4192, "mean_token_accuracy": 0.2225457862019539, "num_tokens": 124800113.0, "step": 49240 }, { "entropy": 5.9465583801269535, "epoch": 5.683208309290248, "grad_norm": 0.87890625, "learning_rate": 0.0002305715945994838, "loss": 5.3031, "mean_token_accuracy": 0.23550986796617507, "num_tokens": 124813677.0, "step": 49245 }, { "entropy": 5.942675304412842, "epoch": 5.6837853433352565, "grad_norm": 1.0234375, "learning_rate": 0.00023053114344764059, "loss": 5.3325, "mean_token_accuracy": 0.2373376339673996, "num_tokens": 124826832.0, "step": 49250 }, { "entropy": 6.108705377578735, "epoch": 5.684362377380266, "grad_norm": 1.015625, "learning_rate": 0.00023049069379148525, "loss": 5.5695, "mean_token_accuracy": 0.20624623894691468, "num_tokens": 124838983.0, "step": 49255 }, { "entropy": 6.065599489212036, "epoch": 5.684939411425274, "grad_norm": 1.0390625, "learning_rate": 0.00023045024563237844, "loss": 5.4244, "mean_token_accuracy": 0.2298648998141289, "num_tokens": 124852090.0, "step": 49260 }, { "entropy": 6.08922176361084, "epoch": 5.685516445470283, "grad_norm": 1.0390625, "learning_rate": 0.00023040979897168034, "loss": 5.5427, "mean_token_accuracy": 0.21237729340791703, "num_tokens": 124866073.0, "step": 49265 }, { "entropy": 5.925222778320313, "epoch": 5.686093479515291, "grad_norm": 1.015625, "learning_rate": 0.00023036935381075163, "loss": 5.2939, "mean_token_accuracy": 0.23084749281406403, "num_tokens": 124879814.0, "step": 49270 }, { "entropy": 6.017553901672363, "epoch": 5.6866705135603, "grad_norm": 1.046875, "learning_rate": 0.00023032891015095243, "loss": 5.432, "mean_token_accuracy": 0.2248712420463562, "num_tokens": 124892915.0, "step": 49275 }, { "entropy": 6.0236412525177006, "epoch": 5.687247547605309, "grad_norm": 1.0546875, "learning_rate": 0.00023028846799364323, "loss": 5.4137, "mean_token_accuracy": 0.22685618847608566, "num_tokens": 124905658.0, "step": 49280 }, { "entropy": 6.039088869094849, "epoch": 5.687824581650317, "grad_norm": 0.96484375, "learning_rate": 0.0002302480273401842, "loss": 5.4605, "mean_token_accuracy": 0.21875010430812836, "num_tokens": 124918505.0, "step": 49285 }, { "entropy": 6.031147241592407, "epoch": 5.688401615695326, "grad_norm": 1.0234375, "learning_rate": 0.0002302075881919355, "loss": 5.4336, "mean_token_accuracy": 0.21850383579730986, "num_tokens": 124931645.0, "step": 49290 }, { "entropy": 6.064820384979248, "epoch": 5.688978649740335, "grad_norm": 1.0859375, "learning_rate": 0.00023016715055025727, "loss": 5.4782, "mean_token_accuracy": 0.21740976274013518, "num_tokens": 124944184.0, "step": 49295 }, { "entropy": 6.003515005111694, "epoch": 5.689555683785343, "grad_norm": 1.03125, "learning_rate": 0.0002301267144165098, "loss": 5.3466, "mean_token_accuracy": 0.23011250346899031, "num_tokens": 124956918.0, "step": 49300 }, { "entropy": 6.043768072128296, "epoch": 5.690132717830352, "grad_norm": 0.98828125, "learning_rate": 0.00023008627979205287, "loss": 5.4443, "mean_token_accuracy": 0.21665253937244416, "num_tokens": 124970080.0, "step": 49305 }, { "entropy": 5.978387022018433, "epoch": 5.69070975187536, "grad_norm": 1.015625, "learning_rate": 0.00023004584667824668, "loss": 5.3224, "mean_token_accuracy": 0.2366739481687546, "num_tokens": 124982416.0, "step": 49310 }, { "entropy": 6.0595170021057125, "epoch": 5.6912867859203695, "grad_norm": 1.078125, "learning_rate": 0.00023000541507645105, "loss": 5.4839, "mean_token_accuracy": 0.22066294997930527, "num_tokens": 124996205.0, "step": 49315 }, { "entropy": 6.082577753067016, "epoch": 5.691863819965378, "grad_norm": 1.03125, "learning_rate": 0.00022996498498802605, "loss": 5.5136, "mean_token_accuracy": 0.2163488268852234, "num_tokens": 125010169.0, "step": 49320 }, { "entropy": 6.094366979598999, "epoch": 5.692440854010386, "grad_norm": 1.015625, "learning_rate": 0.0002299245564143313, "loss": 5.4489, "mean_token_accuracy": 0.22005174160003663, "num_tokens": 125022213.0, "step": 49325 }, { "entropy": 6.010295629501343, "epoch": 5.693017888055396, "grad_norm": 1.0546875, "learning_rate": 0.00022988412935672677, "loss": 5.4032, "mean_token_accuracy": 0.22347027957439422, "num_tokens": 125034355.0, "step": 49330 }, { "entropy": 6.028240203857422, "epoch": 5.693594922100404, "grad_norm": 1.0859375, "learning_rate": 0.000229843703816572, "loss": 5.3611, "mean_token_accuracy": 0.2266454353928566, "num_tokens": 125046525.0, "step": 49335 }, { "entropy": 6.063290119171143, "epoch": 5.6941719561454125, "grad_norm": 1.046875, "learning_rate": 0.00022980327979522702, "loss": 5.4696, "mean_token_accuracy": 0.224091237783432, "num_tokens": 125059164.0, "step": 49340 }, { "entropy": 5.909367990493775, "epoch": 5.694748990190421, "grad_norm": 1.0390625, "learning_rate": 0.0002297628572940511, "loss": 5.2753, "mean_token_accuracy": 0.2388189196586609, "num_tokens": 125072068.0, "step": 49345 }, { "entropy": 6.10900764465332, "epoch": 5.69532602423543, "grad_norm": 0.984375, "learning_rate": 0.0002297224363144041, "loss": 5.5336, "mean_token_accuracy": 0.21222119331359862, "num_tokens": 125085192.0, "step": 49350 }, { "entropy": 6.051606845855713, "epoch": 5.695903058280439, "grad_norm": 1.03125, "learning_rate": 0.00022968201685764545, "loss": 5.4159, "mean_token_accuracy": 0.22583380937576295, "num_tokens": 125097883.0, "step": 49355 }, { "entropy": 6.09923906326294, "epoch": 5.696480092325447, "grad_norm": 0.9765625, "learning_rate": 0.00022964159892513458, "loss": 5.4685, "mean_token_accuracy": 0.21610894054174423, "num_tokens": 125110532.0, "step": 49360 }, { "entropy": 6.132844638824463, "epoch": 5.6970571263704555, "grad_norm": 0.94140625, "learning_rate": 0.0002296011825182312, "loss": 5.5194, "mean_token_accuracy": 0.21789731830358505, "num_tokens": 125124315.0, "step": 49365 }, { "entropy": 6.038289594650268, "epoch": 5.697634160415465, "grad_norm": 0.9609375, "learning_rate": 0.0002295607676382943, "loss": 5.3835, "mean_token_accuracy": 0.22340624630451203, "num_tokens": 125137353.0, "step": 49370 }, { "entropy": 6.072018480300903, "epoch": 5.698211194460473, "grad_norm": 1.0546875, "learning_rate": 0.00022952035428668355, "loss": 5.5248, "mean_token_accuracy": 0.21980332285165788, "num_tokens": 125149501.0, "step": 49375 }, { "entropy": 5.977984428405762, "epoch": 5.698788228505482, "grad_norm": 0.93359375, "learning_rate": 0.0002294799424647579, "loss": 5.3075, "mean_token_accuracy": 0.234373015165329, "num_tokens": 125162007.0, "step": 49380 }, { "entropy": 6.0247578620910645, "epoch": 5.69936526255049, "grad_norm": 1.015625, "learning_rate": 0.00022943953217387697, "loss": 5.3727, "mean_token_accuracy": 0.22241763770580292, "num_tokens": 125173834.0, "step": 49385 }, { "entropy": 6.060000896453857, "epoch": 5.699942296595499, "grad_norm": 0.9765625, "learning_rate": 0.00022939912341539965, "loss": 5.4921, "mean_token_accuracy": 0.21621426194906235, "num_tokens": 125186241.0, "step": 49390 }, { "entropy": 6.044709873199463, "epoch": 5.700519330640508, "grad_norm": 0.984375, "learning_rate": 0.00022935871619068522, "loss": 5.3999, "mean_token_accuracy": 0.21451074331998826, "num_tokens": 125198440.0, "step": 49395 }, { "entropy": 5.998664855957031, "epoch": 5.701096364685516, "grad_norm": 1.0390625, "learning_rate": 0.00022931831050109264, "loss": 5.3459, "mean_token_accuracy": 0.22312902808189392, "num_tokens": 125211610.0, "step": 49400 }, { "entropy": 6.083296871185302, "epoch": 5.7016733987305255, "grad_norm": 1.0546875, "learning_rate": 0.00022927790634798102, "loss": 5.4729, "mean_token_accuracy": 0.21423638015985488, "num_tokens": 125224928.0, "step": 49405 }, { "entropy": 6.023882055282593, "epoch": 5.702250432775534, "grad_norm": 1.125, "learning_rate": 0.00022923750373270925, "loss": 5.4793, "mean_token_accuracy": 0.2190165251493454, "num_tokens": 125236611.0, "step": 49410 }, { "entropy": 5.962625932693482, "epoch": 5.702827466820542, "grad_norm": 1.0, "learning_rate": 0.00022919710265663647, "loss": 5.2999, "mean_token_accuracy": 0.23331550359725953, "num_tokens": 125248934.0, "step": 49415 }, { "entropy": 6.02288122177124, "epoch": 5.703404500865551, "grad_norm": 1.0078125, "learning_rate": 0.0002291567031211212, "loss": 5.4169, "mean_token_accuracy": 0.2240486890077591, "num_tokens": 125262339.0, "step": 49420 }, { "entropy": 6.056442499160767, "epoch": 5.70398153491056, "grad_norm": 1.0390625, "learning_rate": 0.00022911630512752258, "loss": 5.4355, "mean_token_accuracy": 0.22386209964752196, "num_tokens": 125275286.0, "step": 49425 }, { "entropy": 6.017352962493897, "epoch": 5.7045585689555685, "grad_norm": 1.0234375, "learning_rate": 0.00022907590867719913, "loss": 5.4129, "mean_token_accuracy": 0.21933057755231858, "num_tokens": 125287403.0, "step": 49430 }, { "entropy": 6.0339724063873295, "epoch": 5.705135603000577, "grad_norm": 1.0234375, "learning_rate": 0.00022903551377150984, "loss": 5.4168, "mean_token_accuracy": 0.22614537179470062, "num_tokens": 125299540.0, "step": 49435 }, { "entropy": 6.020222997665405, "epoch": 5.705712637045586, "grad_norm": 1.0546875, "learning_rate": 0.00022899512041181307, "loss": 5.425, "mean_token_accuracy": 0.22286488711833954, "num_tokens": 125312440.0, "step": 49440 }, { "entropy": 6.058001184463501, "epoch": 5.706289671090595, "grad_norm": 1.046875, "learning_rate": 0.00022895472859946764, "loss": 5.4876, "mean_token_accuracy": 0.22050503194332122, "num_tokens": 125324834.0, "step": 49445 }, { "entropy": 6.014037609100342, "epoch": 5.706866705135603, "grad_norm": 0.9921875, "learning_rate": 0.00022891433833583202, "loss": 5.3965, "mean_token_accuracy": 0.22351069003343582, "num_tokens": 125336807.0, "step": 49450 }, { "entropy": 6.027551651000977, "epoch": 5.707443739180611, "grad_norm": 1.046875, "learning_rate": 0.00022887394962226476, "loss": 5.412, "mean_token_accuracy": 0.22454663664102553, "num_tokens": 125350067.0, "step": 49455 }, { "entropy": 6.030701351165772, "epoch": 5.70802077322562, "grad_norm": 1.0078125, "learning_rate": 0.00022883356246012428, "loss": 5.4463, "mean_token_accuracy": 0.21859916001558305, "num_tokens": 125363726.0, "step": 49460 }, { "entropy": 6.082229852676392, "epoch": 5.708597807270629, "grad_norm": 1.0703125, "learning_rate": 0.000228793176850769, "loss": 5.4687, "mean_token_accuracy": 0.21768958419561385, "num_tokens": 125376470.0, "step": 49465 }, { "entropy": 6.010114574432373, "epoch": 5.709174841315638, "grad_norm": 1.0, "learning_rate": 0.0002287527927955572, "loss": 5.3223, "mean_token_accuracy": 0.2245061680674553, "num_tokens": 125389294.0, "step": 49470 }, { "entropy": 6.087443542480469, "epoch": 5.709751875360646, "grad_norm": 1.015625, "learning_rate": 0.00022871241029584732, "loss": 5.4648, "mean_token_accuracy": 0.22029041200876237, "num_tokens": 125402476.0, "step": 49475 }, { "entropy": 6.020562028884887, "epoch": 5.710328909405655, "grad_norm": 1.0, "learning_rate": 0.0002286720293529975, "loss": 5.4595, "mean_token_accuracy": 0.21875909417867662, "num_tokens": 125415636.0, "step": 49480 }, { "entropy": 5.9906861782073975, "epoch": 5.710905943450664, "grad_norm": 1.046875, "learning_rate": 0.000228631649968366, "loss": 5.3044, "mean_token_accuracy": 0.23321988433599472, "num_tokens": 125427294.0, "step": 49485 }, { "entropy": 6.011280632019043, "epoch": 5.711482977495672, "grad_norm": 1.078125, "learning_rate": 0.00022859127214331084, "loss": 5.4006, "mean_token_accuracy": 0.22245244830846786, "num_tokens": 125439528.0, "step": 49490 }, { "entropy": 6.032044792175293, "epoch": 5.7120600115406805, "grad_norm": 1.125, "learning_rate": 0.0002285508958791903, "loss": 5.4398, "mean_token_accuracy": 0.22025610208511354, "num_tokens": 125452951.0, "step": 49495 }, { "entropy": 6.099039077758789, "epoch": 5.71263704558569, "grad_norm": 1.03125, "learning_rate": 0.00022851052117736222, "loss": 5.5745, "mean_token_accuracy": 0.20847016721963882, "num_tokens": 125466179.0, "step": 49500 }, { "entropy": 5.992461729049682, "epoch": 5.713214079630698, "grad_norm": 1.015625, "learning_rate": 0.00022847014803918466, "loss": 5.3834, "mean_token_accuracy": 0.2252698212862015, "num_tokens": 125478417.0, "step": 49505 }, { "entropy": 5.958797454833984, "epoch": 5.713791113675707, "grad_norm": 0.98828125, "learning_rate": 0.00022842977646601553, "loss": 5.4441, "mean_token_accuracy": 0.2254386067390442, "num_tokens": 125491506.0, "step": 49510 }, { "entropy": 5.992489910125732, "epoch": 5.714368147720716, "grad_norm": 1.015625, "learning_rate": 0.00022838940645921284, "loss": 5.3779, "mean_token_accuracy": 0.2238729029893875, "num_tokens": 125505619.0, "step": 49515 }, { "entropy": 6.117829656600952, "epoch": 5.714945181765724, "grad_norm": 0.9765625, "learning_rate": 0.00022834903802013425, "loss": 5.4618, "mean_token_accuracy": 0.21533117145299913, "num_tokens": 125519667.0, "step": 49520 }, { "entropy": 6.0782386302948, "epoch": 5.715522215810733, "grad_norm": 1.0234375, "learning_rate": 0.00022830867115013765, "loss": 5.4128, "mean_token_accuracy": 0.22341126948595047, "num_tokens": 125532068.0, "step": 49525 }, { "entropy": 5.97263731956482, "epoch": 5.716099249855741, "grad_norm": 0.9453125, "learning_rate": 0.00022826830585058062, "loss": 5.3697, "mean_token_accuracy": 0.22721271216869354, "num_tokens": 125545205.0, "step": 49530 }, { "entropy": 6.001164484024048, "epoch": 5.71667628390075, "grad_norm": 1.0390625, "learning_rate": 0.000228227942122821, "loss": 5.4092, "mean_token_accuracy": 0.22437716722488404, "num_tokens": 125557215.0, "step": 49535 }, { "entropy": 6.049753475189209, "epoch": 5.717253317945759, "grad_norm": 1.046875, "learning_rate": 0.0002281875799682162, "loss": 5.4171, "mean_token_accuracy": 0.21761631071567536, "num_tokens": 125568496.0, "step": 49540 }, { "entropy": 6.045251655578613, "epoch": 5.717830351990767, "grad_norm": 1.0546875, "learning_rate": 0.00022814721938812398, "loss": 5.4505, "mean_token_accuracy": 0.221990704536438, "num_tokens": 125581426.0, "step": 49545 }, { "entropy": 5.998879384994507, "epoch": 5.718407386035776, "grad_norm": 0.890625, "learning_rate": 0.0002281068603839017, "loss": 5.3727, "mean_token_accuracy": 0.23033248484134675, "num_tokens": 125595220.0, "step": 49550 }, { "entropy": 6.022923851013184, "epoch": 5.718984420080785, "grad_norm": 1.09375, "learning_rate": 0.00022806650295690702, "loss": 5.3735, "mean_token_accuracy": 0.22625367492437362, "num_tokens": 125607310.0, "step": 49555 }, { "entropy": 6.019437456130982, "epoch": 5.7195614541257935, "grad_norm": 1.03125, "learning_rate": 0.000228026147108497, "loss": 5.3951, "mean_token_accuracy": 0.22167592942714692, "num_tokens": 125619789.0, "step": 49560 }, { "entropy": 6.043296384811401, "epoch": 5.720138488170802, "grad_norm": 0.9765625, "learning_rate": 0.00022798579284002935, "loss": 5.5065, "mean_token_accuracy": 0.21331021040678025, "num_tokens": 125632371.0, "step": 49565 }, { "entropy": 6.021444034576416, "epoch": 5.72071552221581, "grad_norm": 0.9765625, "learning_rate": 0.00022794544015286106, "loss": 5.3945, "mean_token_accuracy": 0.2248529702425003, "num_tokens": 125644886.0, "step": 49570 }, { "entropy": 6.043733167648315, "epoch": 5.72129255626082, "grad_norm": 1.0546875, "learning_rate": 0.00022790508904834967, "loss": 5.3897, "mean_token_accuracy": 0.22720012813806534, "num_tokens": 125656604.0, "step": 49575 }, { "entropy": 6.08525505065918, "epoch": 5.721869590305828, "grad_norm": 1.1015625, "learning_rate": 0.00022786473952785214, "loss": 5.5247, "mean_token_accuracy": 0.21613952964544297, "num_tokens": 125668702.0, "step": 49580 }, { "entropy": 6.0983521938323975, "epoch": 5.7224466243508365, "grad_norm": 1.046875, "learning_rate": 0.00022782439159272567, "loss": 5.4464, "mean_token_accuracy": 0.21784875988960267, "num_tokens": 125679605.0, "step": 49585 }, { "entropy": 6.077865362167358, "epoch": 5.723023658395846, "grad_norm": 1.0390625, "learning_rate": 0.00022778404524432733, "loss": 5.481, "mean_token_accuracy": 0.21043082028627397, "num_tokens": 125690820.0, "step": 49590 }, { "entropy": 6.015727472305298, "epoch": 5.723600692440854, "grad_norm": 0.984375, "learning_rate": 0.00022774370048401428, "loss": 5.4087, "mean_token_accuracy": 0.21982302516698837, "num_tokens": 125704560.0, "step": 49595 }, { "entropy": 5.949781084060669, "epoch": 5.724177726485863, "grad_norm": 0.9921875, "learning_rate": 0.0002277033573131433, "loss": 5.3339, "mean_token_accuracy": 0.2331131175160408, "num_tokens": 125717281.0, "step": 49600 }, { "entropy": 6.006426763534546, "epoch": 5.724754760530871, "grad_norm": 1.0546875, "learning_rate": 0.00022766301573307147, "loss": 5.4263, "mean_token_accuracy": 0.22441961616277695, "num_tokens": 125730281.0, "step": 49605 }, { "entropy": 5.976651763916015, "epoch": 5.7253317945758795, "grad_norm": 1.0859375, "learning_rate": 0.0002276226757451555, "loss": 5.3856, "mean_token_accuracy": 0.2272988587617874, "num_tokens": 125742157.0, "step": 49610 }, { "entropy": 6.079996061325073, "epoch": 5.725908828620889, "grad_norm": 1.0625, "learning_rate": 0.0002275823373507524, "loss": 5.4628, "mean_token_accuracy": 0.21890117824077607, "num_tokens": 125754860.0, "step": 49615 }, { "entropy": 5.970008659362793, "epoch": 5.726485862665897, "grad_norm": 1.046875, "learning_rate": 0.00022754200055121878, "loss": 5.2697, "mean_token_accuracy": 0.23564553409814834, "num_tokens": 125768993.0, "step": 49620 }, { "entropy": 6.055458688735962, "epoch": 5.727062896710906, "grad_norm": 0.984375, "learning_rate": 0.00022750166534791139, "loss": 5.487, "mean_token_accuracy": 0.21542387455701828, "num_tokens": 125780775.0, "step": 49625 }, { "entropy": 6.019528818130493, "epoch": 5.727639930755915, "grad_norm": 1.0546875, "learning_rate": 0.00022746133174218687, "loss": 5.3689, "mean_token_accuracy": 0.2287971258163452, "num_tokens": 125793269.0, "step": 49630 }, { "entropy": 6.0886589050292965, "epoch": 5.728216964800923, "grad_norm": 0.9921875, "learning_rate": 0.00022742099973540193, "loss": 5.466, "mean_token_accuracy": 0.2193503424525261, "num_tokens": 125806386.0, "step": 49635 }, { "entropy": 6.104493427276611, "epoch": 5.728793998845932, "grad_norm": 0.88671875, "learning_rate": 0.00022738066932891294, "loss": 5.5403, "mean_token_accuracy": 0.21566086858510972, "num_tokens": 125819164.0, "step": 49640 }, { "entropy": 5.929534196853638, "epoch": 5.72937103289094, "grad_norm": 1.046875, "learning_rate": 0.00022734034052407655, "loss": 5.3415, "mean_token_accuracy": 0.22868810147047042, "num_tokens": 125831952.0, "step": 49645 }, { "entropy": 5.997420167922973, "epoch": 5.7299480669359495, "grad_norm": 0.9765625, "learning_rate": 0.00022730001332224903, "loss": 5.3486, "mean_token_accuracy": 0.22770389318466186, "num_tokens": 125844537.0, "step": 49650 }, { "entropy": 6.0090131759643555, "epoch": 5.730525100980958, "grad_norm": 1.0625, "learning_rate": 0.000227259687724787, "loss": 5.3545, "mean_token_accuracy": 0.22506375908851622, "num_tokens": 125855946.0, "step": 49655 }, { "entropy": 6.107216787338257, "epoch": 5.731102135025966, "grad_norm": 1.0078125, "learning_rate": 0.00022721936373304658, "loss": 5.5474, "mean_token_accuracy": 0.21119464933872223, "num_tokens": 125868298.0, "step": 49660 }, { "entropy": 6.053257608413697, "epoch": 5.731679169070976, "grad_norm": 0.9453125, "learning_rate": 0.00022717904134838412, "loss": 5.5353, "mean_token_accuracy": 0.21726712435483933, "num_tokens": 125879984.0, "step": 49665 }, { "entropy": 6.09370903968811, "epoch": 5.732256203115984, "grad_norm": 1.03125, "learning_rate": 0.00022713872057215584, "loss": 5.5058, "mean_token_accuracy": 0.21583452820777893, "num_tokens": 125892668.0, "step": 49670 }, { "entropy": 6.109275436401367, "epoch": 5.7328332371609925, "grad_norm": 1.125, "learning_rate": 0.00022709840140571803, "loss": 5.4524, "mean_token_accuracy": 0.2226664289832115, "num_tokens": 125904768.0, "step": 49675 }, { "entropy": 6.014448022842407, "epoch": 5.733410271206001, "grad_norm": 0.99609375, "learning_rate": 0.00022705808385042658, "loss": 5.4281, "mean_token_accuracy": 0.22407831400632858, "num_tokens": 125917439.0, "step": 49680 }, { "entropy": 6.064894390106201, "epoch": 5.73398730525101, "grad_norm": 1.078125, "learning_rate": 0.00022701776790763772, "loss": 5.4871, "mean_token_accuracy": 0.2175563395023346, "num_tokens": 125930159.0, "step": 49685 }, { "entropy": 6.058375358581543, "epoch": 5.734564339296019, "grad_norm": 1.078125, "learning_rate": 0.00022697745357870737, "loss": 5.4282, "mean_token_accuracy": 0.21238384246826172, "num_tokens": 125941886.0, "step": 49690 }, { "entropy": 6.04431676864624, "epoch": 5.735141373341027, "grad_norm": 1.046875, "learning_rate": 0.00022693714086499157, "loss": 5.461, "mean_token_accuracy": 0.22099485397338867, "num_tokens": 125954526.0, "step": 49695 }, { "entropy": 6.054618215560913, "epoch": 5.7357184073860354, "grad_norm": 1.0390625, "learning_rate": 0.0002268968297678461, "loss": 5.4897, "mean_token_accuracy": 0.2189372271299362, "num_tokens": 125966539.0, "step": 49700 }, { "entropy": 6.0252748966217045, "epoch": 5.736295441431045, "grad_norm": 1.078125, "learning_rate": 0.0002268565202886269, "loss": 5.3762, "mean_token_accuracy": 0.22499978840351104, "num_tokens": 125978712.0, "step": 49705 }, { "entropy": 6.028599500656128, "epoch": 5.736872475476053, "grad_norm": 0.98828125, "learning_rate": 0.00022681621242868967, "loss": 5.4316, "mean_token_accuracy": 0.22541026324033736, "num_tokens": 125990942.0, "step": 49710 }, { "entropy": 5.966779327392578, "epoch": 5.737449509521062, "grad_norm": 1.0234375, "learning_rate": 0.00022677590618939031, "loss": 5.3434, "mean_token_accuracy": 0.2317936524748802, "num_tokens": 126003956.0, "step": 49715 }, { "entropy": 6.00062141418457, "epoch": 5.73802654356607, "grad_norm": 0.9921875, "learning_rate": 0.00022673560157208435, "loss": 5.4257, "mean_token_accuracy": 0.22327411770820618, "num_tokens": 126016524.0, "step": 49720 }, { "entropy": 6.032732963562012, "epoch": 5.738603577611079, "grad_norm": 1.0390625, "learning_rate": 0.00022669529857812743, "loss": 5.4939, "mean_token_accuracy": 0.21566978991031646, "num_tokens": 126028432.0, "step": 49725 }, { "entropy": 6.074692821502685, "epoch": 5.739180611656088, "grad_norm": 1.0234375, "learning_rate": 0.00022665499720887506, "loss": 5.4381, "mean_token_accuracy": 0.22237212657928468, "num_tokens": 126039476.0, "step": 49730 }, { "entropy": 6.011688375473023, "epoch": 5.739757645701096, "grad_norm": 1.0390625, "learning_rate": 0.00022661469746568304, "loss": 5.3558, "mean_token_accuracy": 0.2296280339360237, "num_tokens": 126052599.0, "step": 49735 }, { "entropy": 5.901757621765137, "epoch": 5.7403346797461055, "grad_norm": 0.98828125, "learning_rate": 0.00022657439934990647, "loss": 5.3188, "mean_token_accuracy": 0.23965569734573364, "num_tokens": 126066176.0, "step": 49740 }, { "entropy": 5.996234798431397, "epoch": 5.740911713791114, "grad_norm": 1.046875, "learning_rate": 0.00022653410286290105, "loss": 5.3528, "mean_token_accuracy": 0.22932596653699874, "num_tokens": 126077773.0, "step": 49745 }, { "entropy": 6.077146911621094, "epoch": 5.741488747836122, "grad_norm": 1.0625, "learning_rate": 0.00022649380800602193, "loss": 5.4536, "mean_token_accuracy": 0.22362992763519288, "num_tokens": 126090167.0, "step": 49750 }, { "entropy": 6.041822719573974, "epoch": 5.742065781881131, "grad_norm": 1.0703125, "learning_rate": 0.00022645351478062437, "loss": 5.5182, "mean_token_accuracy": 0.21482108980417253, "num_tokens": 126102075.0, "step": 49755 }, { "entropy": 6.044607210159302, "epoch": 5.74264281592614, "grad_norm": 1.0, "learning_rate": 0.00022641322318806397, "loss": 5.4713, "mean_token_accuracy": 0.22000051736831666, "num_tokens": 126115269.0, "step": 49760 }, { "entropy": 6.038962650299072, "epoch": 5.743219849971148, "grad_norm": 1.046875, "learning_rate": 0.0002263729332296955, "loss": 5.4869, "mean_token_accuracy": 0.21887048780918122, "num_tokens": 126128115.0, "step": 49765 }, { "entropy": 6.084073638916015, "epoch": 5.743796884016157, "grad_norm": 1.0546875, "learning_rate": 0.0002263326449068744, "loss": 5.4642, "mean_token_accuracy": 0.22342609018087387, "num_tokens": 126139677.0, "step": 49770 }, { "entropy": 6.040108728408813, "epoch": 5.744373918061165, "grad_norm": 1.0546875, "learning_rate": 0.0002262923582209555, "loss": 5.3806, "mean_token_accuracy": 0.22168772369623185, "num_tokens": 126153393.0, "step": 49775 }, { "entropy": 6.081512212753296, "epoch": 5.744950952106175, "grad_norm": 0.92578125, "learning_rate": 0.000226252073173294, "loss": 5.5135, "mean_token_accuracy": 0.21374876350164412, "num_tokens": 126165172.0, "step": 49780 }, { "entropy": 5.962333106994629, "epoch": 5.745527986151183, "grad_norm": 1.25, "learning_rate": 0.0002262117897652447, "loss": 5.2425, "mean_token_accuracy": 0.24064727872610092, "num_tokens": 126177929.0, "step": 49785 }, { "entropy": 5.981118488311767, "epoch": 5.746105020196191, "grad_norm": 1.0, "learning_rate": 0.00022617150799816277, "loss": 5.3662, "mean_token_accuracy": 0.22630050778388977, "num_tokens": 126192013.0, "step": 49790 }, { "entropy": 6.025222826004028, "epoch": 5.7466820542412, "grad_norm": 0.9296875, "learning_rate": 0.00022613122787340279, "loss": 5.4736, "mean_token_accuracy": 0.2192372128367424, "num_tokens": 126205142.0, "step": 49795 }, { "entropy": 6.100870132446289, "epoch": 5.747259088286209, "grad_norm": 1.0703125, "learning_rate": 0.00022609094939231978, "loss": 5.4296, "mean_token_accuracy": 0.22028184235095977, "num_tokens": 126217939.0, "step": 49800 }, { "entropy": 5.908008670806884, "epoch": 5.7478361223312175, "grad_norm": 1.03125, "learning_rate": 0.00022605067255626832, "loss": 5.3053, "mean_token_accuracy": 0.23460683375597, "num_tokens": 126230073.0, "step": 49805 }, { "entropy": 5.975973892211914, "epoch": 5.748413156376226, "grad_norm": 0.96484375, "learning_rate": 0.00022601039736660323, "loss": 5.4325, "mean_token_accuracy": 0.2241601303219795, "num_tokens": 126243141.0, "step": 49810 }, { "entropy": 5.9624570369720455, "epoch": 5.748990190421235, "grad_norm": 1.0078125, "learning_rate": 0.00022597012382467903, "loss": 5.3772, "mean_token_accuracy": 0.22081854939460754, "num_tokens": 126256389.0, "step": 49815 }, { "entropy": 6.038847589492798, "epoch": 5.749567224466244, "grad_norm": 1.09375, "learning_rate": 0.0002259298519318504, "loss": 5.3369, "mean_token_accuracy": 0.2268427237868309, "num_tokens": 126268255.0, "step": 49820 }, { "entropy": 6.035766315460205, "epoch": 5.750144258511252, "grad_norm": 0.91796875, "learning_rate": 0.00022588958168947182, "loss": 5.4331, "mean_token_accuracy": 0.22694395184516908, "num_tokens": 126281250.0, "step": 49825 }, { "entropy": 6.049199008941651, "epoch": 5.7507212925562605, "grad_norm": 1.0390625, "learning_rate": 0.00022584931309889783, "loss": 5.4564, "mean_token_accuracy": 0.2150783956050873, "num_tokens": 126292572.0, "step": 49830 }, { "entropy": 5.958545875549317, "epoch": 5.75129832660127, "grad_norm": 1.0234375, "learning_rate": 0.00022580904616148267, "loss": 5.3985, "mean_token_accuracy": 0.22599672079086303, "num_tokens": 126305222.0, "step": 49835 }, { "entropy": 5.969755983352661, "epoch": 5.751875360646278, "grad_norm": 0.98828125, "learning_rate": 0.00022576878087858082, "loss": 5.3804, "mean_token_accuracy": 0.2245454952120781, "num_tokens": 126320193.0, "step": 49840 }, { "entropy": 6.08737621307373, "epoch": 5.752452394691287, "grad_norm": 1.03125, "learning_rate": 0.00022572851725154657, "loss": 5.4531, "mean_token_accuracy": 0.22295423448085785, "num_tokens": 126332865.0, "step": 49845 }, { "entropy": 6.078256750106812, "epoch": 5.753029428736295, "grad_norm": 0.96484375, "learning_rate": 0.00022568825528173427, "loss": 5.4528, "mean_token_accuracy": 0.2178967148065567, "num_tokens": 126345830.0, "step": 49850 }, { "entropy": 5.994029235839844, "epoch": 5.753606462781304, "grad_norm": 1.1015625, "learning_rate": 0.00022564799497049794, "loss": 5.299, "mean_token_accuracy": 0.23850910663604735, "num_tokens": 126357014.0, "step": 49855 }, { "entropy": 6.059012794494629, "epoch": 5.754183496826313, "grad_norm": 0.9765625, "learning_rate": 0.0002256077363191918, "loss": 5.4323, "mean_token_accuracy": 0.22131062299013138, "num_tokens": 126368326.0, "step": 49860 }, { "entropy": 6.034923839569092, "epoch": 5.754760530871321, "grad_norm": 1.03125, "learning_rate": 0.0002255674793291698, "loss": 5.4652, "mean_token_accuracy": 0.219676411151886, "num_tokens": 126381647.0, "step": 49865 }, { "entropy": 6.06753945350647, "epoch": 5.75533756491633, "grad_norm": 1.0546875, "learning_rate": 0.00022552722400178627, "loss": 5.4841, "mean_token_accuracy": 0.21351805776357652, "num_tokens": 126393772.0, "step": 49870 }, { "entropy": 6.103093814849854, "epoch": 5.755914598961339, "grad_norm": 1.0625, "learning_rate": 0.00022548697033839487, "loss": 5.5211, "mean_token_accuracy": 0.21728209406137466, "num_tokens": 126405824.0, "step": 49875 }, { "entropy": 6.115517234802246, "epoch": 5.756491633006347, "grad_norm": 1.1796875, "learning_rate": 0.00022544671834034968, "loss": 5.5161, "mean_token_accuracy": 0.22121085673570634, "num_tokens": 126417663.0, "step": 49880 }, { "entropy": 5.970009708404541, "epoch": 5.757068667051356, "grad_norm": 0.94140625, "learning_rate": 0.0002254064680090044, "loss": 5.3553, "mean_token_accuracy": 0.2329029530286789, "num_tokens": 126429709.0, "step": 49885 }, { "entropy": 5.913326263427734, "epoch": 5.757645701096365, "grad_norm": 1.015625, "learning_rate": 0.0002253662193457131, "loss": 5.2207, "mean_token_accuracy": 0.23543574362993241, "num_tokens": 126441859.0, "step": 49890 }, { "entropy": 5.947325372695923, "epoch": 5.7582227351413735, "grad_norm": 1.0078125, "learning_rate": 0.00022532597235182922, "loss": 5.3907, "mean_token_accuracy": 0.2207629755139351, "num_tokens": 126455330.0, "step": 49895 }, { "entropy": 6.047615957260132, "epoch": 5.758799769186382, "grad_norm": 1.0859375, "learning_rate": 0.00022528572702870664, "loss": 5.3868, "mean_token_accuracy": 0.21666864156723023, "num_tokens": 126467028.0, "step": 49900 }, { "entropy": 6.074980783462524, "epoch": 5.75937680323139, "grad_norm": 1.0703125, "learning_rate": 0.0002252454833776989, "loss": 5.4508, "mean_token_accuracy": 0.21478413939476013, "num_tokens": 126478638.0, "step": 49905 }, { "entropy": 5.99262580871582, "epoch": 5.7599538372764, "grad_norm": 0.99609375, "learning_rate": 0.00022520524140015968, "loss": 5.402, "mean_token_accuracy": 0.22312563061714172, "num_tokens": 126490639.0, "step": 49910 }, { "entropy": 5.994853687286377, "epoch": 5.760530871321408, "grad_norm": 1.1171875, "learning_rate": 0.00022516500109744236, "loss": 5.3326, "mean_token_accuracy": 0.22468214482069016, "num_tokens": 126502968.0, "step": 49915 }, { "entropy": 5.999149560928345, "epoch": 5.7611079053664165, "grad_norm": 1.1171875, "learning_rate": 0.0002251247624709005, "loss": 5.4003, "mean_token_accuracy": 0.22592335790395737, "num_tokens": 126514931.0, "step": 49920 }, { "entropy": 6.031009101867676, "epoch": 5.761684939411425, "grad_norm": 0.90234375, "learning_rate": 0.00022508452552188752, "loss": 5.3771, "mean_token_accuracy": 0.22444205582141877, "num_tokens": 126528082.0, "step": 49925 }, { "entropy": 6.082283210754395, "epoch": 5.762261973456434, "grad_norm": 1.0, "learning_rate": 0.00022504429025175672, "loss": 5.4668, "mean_token_accuracy": 0.22562110275030137, "num_tokens": 126540194.0, "step": 49930 }, { "entropy": 6.033959293365479, "epoch": 5.762839007501443, "grad_norm": 1.0078125, "learning_rate": 0.00022500405666186135, "loss": 5.4779, "mean_token_accuracy": 0.21441821604967118, "num_tokens": 126554694.0, "step": 49935 }, { "entropy": 5.9843250751495365, "epoch": 5.763416041546451, "grad_norm": 1.0859375, "learning_rate": 0.00022496382475355477, "loss": 5.3555, "mean_token_accuracy": 0.22191950678825378, "num_tokens": 126567993.0, "step": 49940 }, { "entropy": 5.978922176361084, "epoch": 5.7639930755914595, "grad_norm": 1.03125, "learning_rate": 0.00022492359452819, "loss": 5.3791, "mean_token_accuracy": 0.2332445651292801, "num_tokens": 126580020.0, "step": 49945 }, { "entropy": 5.922740793228149, "epoch": 5.764570109636469, "grad_norm": 1.0234375, "learning_rate": 0.00022488336598712032, "loss": 5.3329, "mean_token_accuracy": 0.23084624111652374, "num_tokens": 126593373.0, "step": 49950 }, { "entropy": 6.07316837310791, "epoch": 5.765147143681477, "grad_norm": 1.0390625, "learning_rate": 0.00022484313913169874, "loss": 5.4426, "mean_token_accuracy": 0.22318137139081956, "num_tokens": 126606247.0, "step": 49955 }, { "entropy": 6.1736674308776855, "epoch": 5.765724177726486, "grad_norm": 1.0625, "learning_rate": 0.00022480291396327818, "loss": 5.5727, "mean_token_accuracy": 0.21208734214305877, "num_tokens": 126618736.0, "step": 49960 }, { "entropy": 5.87519416809082, "epoch": 5.766301211771495, "grad_norm": 1.4140625, "learning_rate": 0.00022476269048321175, "loss": 5.1992, "mean_token_accuracy": 0.2513745278120041, "num_tokens": 126632353.0, "step": 49965 }, { "entropy": 6.012812232971191, "epoch": 5.766878245816503, "grad_norm": 1.0234375, "learning_rate": 0.00022472246869285228, "loss": 5.4111, "mean_token_accuracy": 0.22521844655275344, "num_tokens": 126644101.0, "step": 49970 }, { "entropy": 5.99951868057251, "epoch": 5.767455279861512, "grad_norm": 1.0, "learning_rate": 0.00022468224859355256, "loss": 5.4225, "mean_token_accuracy": 0.22927317023277283, "num_tokens": 126657234.0, "step": 49975 }, { "entropy": 5.994365692138672, "epoch": 5.76803231390652, "grad_norm": 1.1015625, "learning_rate": 0.00022464203018666545, "loss": 5.3539, "mean_token_accuracy": 0.22960476130247115, "num_tokens": 126669557.0, "step": 49980 }, { "entropy": 5.967706108093262, "epoch": 5.7686093479515295, "grad_norm": 1.0234375, "learning_rate": 0.00022460181347354352, "loss": 5.2847, "mean_token_accuracy": 0.2337131306529045, "num_tokens": 126683203.0, "step": 49985 }, { "entropy": 6.055516147613526, "epoch": 5.769186381996538, "grad_norm": 0.9765625, "learning_rate": 0.00022456159845553976, "loss": 5.3713, "mean_token_accuracy": 0.22442142963409423, "num_tokens": 126696446.0, "step": 49990 }, { "entropy": 5.970490169525147, "epoch": 5.769763416041546, "grad_norm": 1.0546875, "learning_rate": 0.00022452138513400643, "loss": 5.3657, "mean_token_accuracy": 0.23229675143957138, "num_tokens": 126709302.0, "step": 49995 }, { "entropy": 6.00638427734375, "epoch": 5.770340450086556, "grad_norm": 1.046875, "learning_rate": 0.00022448117351029633, "loss": 5.4234, "mean_token_accuracy": 0.21543505191802978, "num_tokens": 126721495.0, "step": 50000 }, { "entropy": 6.02474889755249, "epoch": 5.770917484131564, "grad_norm": 1.1171875, "learning_rate": 0.00022444096358576176, "loss": 5.3996, "mean_token_accuracy": 0.21535304486751555, "num_tokens": 126734102.0, "step": 50005 }, { "entropy": 6.110607290267945, "epoch": 5.771494518176572, "grad_norm": 1.0859375, "learning_rate": 0.0002244007553617554, "loss": 5.4824, "mean_token_accuracy": 0.21578304916620256, "num_tokens": 126748363.0, "step": 50010 }, { "entropy": 6.066141748428345, "epoch": 5.772071552221581, "grad_norm": 0.98828125, "learning_rate": 0.00022436054883962937, "loss": 5.4571, "mean_token_accuracy": 0.21879150420427323, "num_tokens": 126760546.0, "step": 50015 }, { "entropy": 5.972143030166626, "epoch": 5.772648586266589, "grad_norm": 1.0546875, "learning_rate": 0.0002243203440207362, "loss": 5.3292, "mean_token_accuracy": 0.23004869669675826, "num_tokens": 126772062.0, "step": 50020 }, { "entropy": 6.010297584533691, "epoch": 5.773225620311599, "grad_norm": 1.0625, "learning_rate": 0.00022428014090642806, "loss": 5.4769, "mean_token_accuracy": 0.2178845226764679, "num_tokens": 126785147.0, "step": 50025 }, { "entropy": 6.048260927200317, "epoch": 5.773802654356607, "grad_norm": 0.9765625, "learning_rate": 0.00022423993949805722, "loss": 5.4405, "mean_token_accuracy": 0.221363665163517, "num_tokens": 126797916.0, "step": 50030 }, { "entropy": 6.134730386734009, "epoch": 5.774379688401615, "grad_norm": 0.99609375, "learning_rate": 0.00022419973979697573, "loss": 5.5011, "mean_token_accuracy": 0.21450162976980208, "num_tokens": 126809340.0, "step": 50035 }, { "entropy": 6.079486560821533, "epoch": 5.774956722446625, "grad_norm": 0.98046875, "learning_rate": 0.00022415954180453584, "loss": 5.5198, "mean_token_accuracy": 0.21297764629125596, "num_tokens": 126821735.0, "step": 50040 }, { "entropy": 5.96282205581665, "epoch": 5.775533756491633, "grad_norm": 1.0625, "learning_rate": 0.0002241193455220894, "loss": 5.3953, "mean_token_accuracy": 0.23137205392122268, "num_tokens": 126834703.0, "step": 50045 }, { "entropy": 6.089934825897217, "epoch": 5.776110790536642, "grad_norm": 1.1171875, "learning_rate": 0.00022407915095098868, "loss": 5.435, "mean_token_accuracy": 0.2171575039625168, "num_tokens": 126845984.0, "step": 50050 }, { "entropy": 6.0216522216796875, "epoch": 5.77668782458165, "grad_norm": 1.0546875, "learning_rate": 0.00022403895809258522, "loss": 5.4092, "mean_token_accuracy": 0.22644775956869126, "num_tokens": 126860204.0, "step": 50055 }, { "entropy": 6.06054277420044, "epoch": 5.777264858626659, "grad_norm": 1.015625, "learning_rate": 0.00022399876694823123, "loss": 5.4196, "mean_token_accuracy": 0.21965304017066956, "num_tokens": 126871829.0, "step": 50060 }, { "entropy": 5.975581645965576, "epoch": 5.777841892671668, "grad_norm": 1.046875, "learning_rate": 0.0002239585775192783, "loss": 5.4145, "mean_token_accuracy": 0.22135410606861114, "num_tokens": 126885888.0, "step": 50065 }, { "entropy": 5.947051763534546, "epoch": 5.778418926716676, "grad_norm": 0.94921875, "learning_rate": 0.00022391838980707836, "loss": 5.3647, "mean_token_accuracy": 0.2250747114419937, "num_tokens": 126898742.0, "step": 50070 }, { "entropy": 6.101533269882202, "epoch": 5.778995960761685, "grad_norm": 0.9453125, "learning_rate": 0.0002238782038129829, "loss": 5.445, "mean_token_accuracy": 0.22581405192613602, "num_tokens": 126912988.0, "step": 50075 }, { "entropy": 6.018276643753052, "epoch": 5.779572994806694, "grad_norm": 0.95703125, "learning_rate": 0.0002238380195383437, "loss": 5.4134, "mean_token_accuracy": 0.22227396070957184, "num_tokens": 126925513.0, "step": 50080 }, { "entropy": 5.925036144256592, "epoch": 5.780150028851702, "grad_norm": 1.09375, "learning_rate": 0.00022379783698451227, "loss": 5.3001, "mean_token_accuracy": 0.23089775145053865, "num_tokens": 126938355.0, "step": 50085 }, { "entropy": 6.027796936035156, "epoch": 5.780727062896711, "grad_norm": 0.9921875, "learning_rate": 0.00022375765615284028, "loss": 5.4483, "mean_token_accuracy": 0.22097047567367553, "num_tokens": 126951000.0, "step": 50090 }, { "entropy": 6.096664381027222, "epoch": 5.781304096941719, "grad_norm": 1.1015625, "learning_rate": 0.00022371747704467892, "loss": 5.4939, "mean_token_accuracy": 0.2167383164167404, "num_tokens": 126962477.0, "step": 50095 }, { "entropy": 6.008701181411743, "epoch": 5.781881130986728, "grad_norm": 1.0546875, "learning_rate": 0.0002236772996613799, "loss": 5.3954, "mean_token_accuracy": 0.22348914444446563, "num_tokens": 126974890.0, "step": 50100 }, { "entropy": 5.889964485168457, "epoch": 5.782458165031737, "grad_norm": 1.0390625, "learning_rate": 0.0002236371240042942, "loss": 5.278, "mean_token_accuracy": 0.24203188121318817, "num_tokens": 126988376.0, "step": 50105 }, { "entropy": 5.979335927963257, "epoch": 5.783035199076745, "grad_norm": 1.015625, "learning_rate": 0.0002235969500747735, "loss": 5.3626, "mean_token_accuracy": 0.22512841671705247, "num_tokens": 127001061.0, "step": 50110 }, { "entropy": 6.014907026290894, "epoch": 5.7836122331217545, "grad_norm": 1.0078125, "learning_rate": 0.00022355677787416878, "loss": 5.3657, "mean_token_accuracy": 0.22747167199850082, "num_tokens": 127014368.0, "step": 50115 }, { "entropy": 6.017622566223144, "epoch": 5.784189267166763, "grad_norm": 1.1171875, "learning_rate": 0.00022351660740383135, "loss": 5.3681, "mean_token_accuracy": 0.23234473317861556, "num_tokens": 127027207.0, "step": 50120 }, { "entropy": 6.017213296890259, "epoch": 5.784766301211771, "grad_norm": 1.0546875, "learning_rate": 0.00022347643866511214, "loss": 5.5171, "mean_token_accuracy": 0.21721160113811494, "num_tokens": 127040276.0, "step": 50125 }, { "entropy": 5.990512418746948, "epoch": 5.78534333525678, "grad_norm": 1.015625, "learning_rate": 0.0002234362716593624, "loss": 5.3775, "mean_token_accuracy": 0.2281092420220375, "num_tokens": 127053622.0, "step": 50130 }, { "entropy": 6.101986694335937, "epoch": 5.785920369301789, "grad_norm": 1.1171875, "learning_rate": 0.000223396106387933, "loss": 5.4255, "mean_token_accuracy": 0.22069344520568848, "num_tokens": 127066009.0, "step": 50135 }, { "entropy": 6.102804660797119, "epoch": 5.7864974033467975, "grad_norm": 1.078125, "learning_rate": 0.00022335594285217503, "loss": 5.4435, "mean_token_accuracy": 0.21678621023893357, "num_tokens": 127078455.0, "step": 50140 }, { "entropy": 6.011951303482055, "epoch": 5.787074437391806, "grad_norm": 1.015625, "learning_rate": 0.00022331578105343918, "loss": 5.4157, "mean_token_accuracy": 0.2207127407193184, "num_tokens": 127092224.0, "step": 50145 }, { "entropy": 6.049638748168945, "epoch": 5.787651471436815, "grad_norm": 1.046875, "learning_rate": 0.00022327562099307634, "loss": 5.4251, "mean_token_accuracy": 0.2205551117658615, "num_tokens": 127104704.0, "step": 50150 }, { "entropy": 6.065674781799316, "epoch": 5.788228505481824, "grad_norm": 0.921875, "learning_rate": 0.00022323546267243732, "loss": 5.4496, "mean_token_accuracy": 0.21896771639585494, "num_tokens": 127117485.0, "step": 50155 }, { "entropy": 6.061332035064697, "epoch": 5.788805539526832, "grad_norm": 0.91796875, "learning_rate": 0.00022319530609287282, "loss": 5.4623, "mean_token_accuracy": 0.2144940212368965, "num_tokens": 127130076.0, "step": 50160 }, { "entropy": 6.018175363540649, "epoch": 5.7893825735718405, "grad_norm": 1.09375, "learning_rate": 0.00022315515125573355, "loss": 5.3835, "mean_token_accuracy": 0.22282203584909438, "num_tokens": 127142077.0, "step": 50165 }, { "entropy": 6.039028263092041, "epoch": 5.789959607616849, "grad_norm": 1.0234375, "learning_rate": 0.0002231149981623699, "loss": 5.3353, "mean_token_accuracy": 0.2287507548928261, "num_tokens": 127153863.0, "step": 50170 }, { "entropy": 5.959327173233032, "epoch": 5.790536641661858, "grad_norm": 1.0703125, "learning_rate": 0.00022307484681413254, "loss": 5.3662, "mean_token_accuracy": 0.23061311691999437, "num_tokens": 127165802.0, "step": 50175 }, { "entropy": 5.8730137825012205, "epoch": 5.791113675706867, "grad_norm": 1.1015625, "learning_rate": 0.0002230346972123719, "loss": 5.2725, "mean_token_accuracy": 0.23711815029382705, "num_tokens": 127179346.0, "step": 50180 }, { "entropy": 6.08215479850769, "epoch": 5.791690709751875, "grad_norm": 0.953125, "learning_rate": 0.00022299454935843845, "loss": 5.4655, "mean_token_accuracy": 0.21458880603313446, "num_tokens": 127191523.0, "step": 50185 }, { "entropy": 6.062656497955322, "epoch": 5.792267743796884, "grad_norm": 0.98046875, "learning_rate": 0.00022295440325368243, "loss": 5.4392, "mean_token_accuracy": 0.2195281684398651, "num_tokens": 127205063.0, "step": 50190 }, { "entropy": 6.028362035751343, "epoch": 5.792844777841893, "grad_norm": 0.95703125, "learning_rate": 0.00022291425889945426, "loss": 5.4781, "mean_token_accuracy": 0.22332883924245833, "num_tokens": 127219711.0, "step": 50195 }, { "entropy": 6.000434350967407, "epoch": 5.793421811886901, "grad_norm": 1.03125, "learning_rate": 0.00022287411629710408, "loss": 5.3932, "mean_token_accuracy": 0.22552696168422698, "num_tokens": 127231466.0, "step": 50200 }, { "entropy": 6.020996618270874, "epoch": 5.79399884593191, "grad_norm": 1.0546875, "learning_rate": 0.00022283397544798223, "loss": 5.3763, "mean_token_accuracy": 0.23099322468042374, "num_tokens": 127243936.0, "step": 50205 }, { "entropy": 6.043927240371704, "epoch": 5.794575879976919, "grad_norm": 1.078125, "learning_rate": 0.00022279383635343854, "loss": 5.4125, "mean_token_accuracy": 0.21853159070014955, "num_tokens": 127256444.0, "step": 50210 }, { "entropy": 5.9943962574005125, "epoch": 5.795152914021927, "grad_norm": 1.015625, "learning_rate": 0.00022275369901482333, "loss": 5.4111, "mean_token_accuracy": 0.22530001699924468, "num_tokens": 127269298.0, "step": 50215 }, { "entropy": 5.988767194747925, "epoch": 5.795729948066936, "grad_norm": 1.0390625, "learning_rate": 0.00022271356343348642, "loss": 5.3522, "mean_token_accuracy": 0.22620439231395723, "num_tokens": 127281061.0, "step": 50220 }, { "entropy": 6.030716753005981, "epoch": 5.796306982111945, "grad_norm": 0.99609375, "learning_rate": 0.00022267342961077797, "loss": 5.445, "mean_token_accuracy": 0.2158772960305214, "num_tokens": 127294217.0, "step": 50225 }, { "entropy": 6.027329826354981, "epoch": 5.7968840161569535, "grad_norm": 1.0234375, "learning_rate": 0.0002226332975480476, "loss": 5.4264, "mean_token_accuracy": 0.22051745802164077, "num_tokens": 127306463.0, "step": 50230 }, { "entropy": 5.963424158096314, "epoch": 5.797461050201962, "grad_norm": 1.1328125, "learning_rate": 0.0002225931672466453, "loss": 5.3329, "mean_token_accuracy": 0.2327040657401085, "num_tokens": 127319625.0, "step": 50235 }, { "entropy": 5.9281950950622555, "epoch": 5.79803808424697, "grad_norm": 1.0234375, "learning_rate": 0.00022255303870792077, "loss": 5.3906, "mean_token_accuracy": 0.23432537764310837, "num_tokens": 127333735.0, "step": 50240 }, { "entropy": 6.138464403152466, "epoch": 5.798615118291979, "grad_norm": 1.0234375, "learning_rate": 0.00022251291193322377, "loss": 5.5601, "mean_token_accuracy": 0.2133669897913933, "num_tokens": 127346043.0, "step": 50245 }, { "entropy": 6.015682935714722, "epoch": 5.799192152336988, "grad_norm": 0.9921875, "learning_rate": 0.00022247278692390387, "loss": 5.3946, "mean_token_accuracy": 0.22676908671855928, "num_tokens": 127358225.0, "step": 50250 }, { "entropy": 6.0067120552062985, "epoch": 5.7997691863819965, "grad_norm": 1.09375, "learning_rate": 0.0002224326636813107, "loss": 5.3755, "mean_token_accuracy": 0.22662544697523118, "num_tokens": 127370924.0, "step": 50255 }, { "entropy": 6.067869329452515, "epoch": 5.800346220427005, "grad_norm": 1.0078125, "learning_rate": 0.00022239254220679373, "loss": 5.4149, "mean_token_accuracy": 0.22250195890665053, "num_tokens": 127382060.0, "step": 50260 }, { "entropy": 6.01682596206665, "epoch": 5.800923254472014, "grad_norm": 1.046875, "learning_rate": 0.00022235242250170256, "loss": 5.4209, "mean_token_accuracy": 0.21754756420850754, "num_tokens": 127394559.0, "step": 50265 }, { "entropy": 5.899926567077637, "epoch": 5.801500288517023, "grad_norm": 1.03125, "learning_rate": 0.00022231230456738643, "loss": 5.2785, "mean_token_accuracy": 0.23758705109357833, "num_tokens": 127407072.0, "step": 50270 }, { "entropy": 6.061111736297607, "epoch": 5.802077322562031, "grad_norm": 1.0078125, "learning_rate": 0.0002222721884051948, "loss": 5.5075, "mean_token_accuracy": 0.2173176422715187, "num_tokens": 127420364.0, "step": 50275 }, { "entropy": 6.086686658859253, "epoch": 5.802654356607039, "grad_norm": 1.0390625, "learning_rate": 0.0002222320740164769, "loss": 5.5006, "mean_token_accuracy": 0.21597716808319092, "num_tokens": 127433569.0, "step": 50280 }, { "entropy": 6.040704202651978, "epoch": 5.803231390652049, "grad_norm": 1.0859375, "learning_rate": 0.00022219196140258203, "loss": 5.4181, "mean_token_accuracy": 0.22443622797727586, "num_tokens": 127445734.0, "step": 50285 }, { "entropy": 5.977840328216553, "epoch": 5.803808424697057, "grad_norm": 1.015625, "learning_rate": 0.00022215185056485926, "loss": 5.3559, "mean_token_accuracy": 0.23254020214080812, "num_tokens": 127458553.0, "step": 50290 }, { "entropy": 6.00077977180481, "epoch": 5.804385458742066, "grad_norm": 1.0390625, "learning_rate": 0.0002221117415046578, "loss": 5.3898, "mean_token_accuracy": 0.2300723522901535, "num_tokens": 127470686.0, "step": 50295 }, { "entropy": 6.035689735412598, "epoch": 5.804962492787075, "grad_norm": 1.046875, "learning_rate": 0.00022207163422332653, "loss": 5.4023, "mean_token_accuracy": 0.22128079682588578, "num_tokens": 127482867.0, "step": 50300 }, { "entropy": 5.999207162857056, "epoch": 5.805539526832083, "grad_norm": 1.015625, "learning_rate": 0.00022203152872221467, "loss": 5.3665, "mean_token_accuracy": 0.225989992916584, "num_tokens": 127496237.0, "step": 50305 }, { "entropy": 5.940468645095825, "epoch": 5.806116560877092, "grad_norm": 0.984375, "learning_rate": 0.00022199142500267094, "loss": 5.3473, "mean_token_accuracy": 0.23692095130681992, "num_tokens": 127509833.0, "step": 50310 }, { "entropy": 6.028581428527832, "epoch": 5.8066935949221, "grad_norm": 1.140625, "learning_rate": 0.00022195132306604437, "loss": 5.3839, "mean_token_accuracy": 0.22225600779056548, "num_tokens": 127522967.0, "step": 50315 }, { "entropy": 6.022025108337402, "epoch": 5.807270628967109, "grad_norm": 1.0234375, "learning_rate": 0.00022191122291368364, "loss": 5.414, "mean_token_accuracy": 0.22748849987983705, "num_tokens": 127535466.0, "step": 50320 }, { "entropy": 6.047796106338501, "epoch": 5.807847663012118, "grad_norm": 0.99609375, "learning_rate": 0.00022187112454693765, "loss": 5.419, "mean_token_accuracy": 0.2235051855444908, "num_tokens": 127548068.0, "step": 50325 }, { "entropy": 5.996612882614135, "epoch": 5.808424697057126, "grad_norm": 1.1640625, "learning_rate": 0.00022183102796715493, "loss": 5.3234, "mean_token_accuracy": 0.23644556999206542, "num_tokens": 127560648.0, "step": 50330 }, { "entropy": 5.920382738113403, "epoch": 5.809001731102135, "grad_norm": 0.99609375, "learning_rate": 0.00022179093317568416, "loss": 5.3199, "mean_token_accuracy": 0.22743216902017593, "num_tokens": 127573034.0, "step": 50335 }, { "entropy": 6.035889625549316, "epoch": 5.809578765147144, "grad_norm": 1.078125, "learning_rate": 0.00022175084017387394, "loss": 5.4615, "mean_token_accuracy": 0.21759170442819595, "num_tokens": 127585377.0, "step": 50340 }, { "entropy": 6.012312126159668, "epoch": 5.810155799192152, "grad_norm": 1.6875, "learning_rate": 0.0002217107489630728, "loss": 5.3887, "mean_token_accuracy": 0.22402003407478333, "num_tokens": 127597593.0, "step": 50345 }, { "entropy": 6.122308397293091, "epoch": 5.810732833237161, "grad_norm": 1.015625, "learning_rate": 0.00022167065954462907, "loss": 5.4703, "mean_token_accuracy": 0.2186146304011345, "num_tokens": 127611891.0, "step": 50350 }, { "entropy": 6.0643054962158205, "epoch": 5.811309867282169, "grad_norm": 1.046875, "learning_rate": 0.00022163057191989128, "loss": 5.3967, "mean_token_accuracy": 0.21922862082719802, "num_tokens": 127624512.0, "step": 50355 }, { "entropy": 5.853642177581787, "epoch": 5.811886901327179, "grad_norm": 1.046875, "learning_rate": 0.0002215904860902076, "loss": 5.2042, "mean_token_accuracy": 0.24209549725055696, "num_tokens": 127636857.0, "step": 50360 }, { "entropy": 6.0192639350891115, "epoch": 5.812463935372187, "grad_norm": 1.0234375, "learning_rate": 0.0002215504020569265, "loss": 5.4108, "mean_token_accuracy": 0.22073237746953964, "num_tokens": 127649577.0, "step": 50365 }, { "entropy": 6.17706069946289, "epoch": 5.813040969417195, "grad_norm": 1.046875, "learning_rate": 0.00022151031982139602, "loss": 5.5159, "mean_token_accuracy": 0.21245130896568298, "num_tokens": 127661876.0, "step": 50370 }, { "entropy": 5.946478843688965, "epoch": 5.813618003462205, "grad_norm": 1.046875, "learning_rate": 0.0002214702393849644, "loss": 5.3091, "mean_token_accuracy": 0.2342524379491806, "num_tokens": 127674786.0, "step": 50375 }, { "entropy": 6.025868988037109, "epoch": 5.814195037507213, "grad_norm": 1.0078125, "learning_rate": 0.00022143016074897964, "loss": 5.4269, "mean_token_accuracy": 0.22212120592594148, "num_tokens": 127687041.0, "step": 50380 }, { "entropy": 6.006273889541626, "epoch": 5.8147720715522215, "grad_norm": 1.09375, "learning_rate": 0.00022139008391478988, "loss": 5.4211, "mean_token_accuracy": 0.22161509841680527, "num_tokens": 127698178.0, "step": 50385 }, { "entropy": 6.0416015625, "epoch": 5.81534910559723, "grad_norm": 1.078125, "learning_rate": 0.00022135000888374296, "loss": 5.4544, "mean_token_accuracy": 0.22033730447292327, "num_tokens": 127709422.0, "step": 50390 }, { "entropy": 6.064035367965698, "epoch": 5.815926139642239, "grad_norm": 1.03125, "learning_rate": 0.00022130993565718687, "loss": 5.4691, "mean_token_accuracy": 0.21578666865825652, "num_tokens": 127721259.0, "step": 50395 }, { "entropy": 6.102241563796997, "epoch": 5.816503173687248, "grad_norm": 1.0234375, "learning_rate": 0.00022126986423646937, "loss": 5.474, "mean_token_accuracy": 0.221116741001606, "num_tokens": 127733537.0, "step": 50400 }, { "entropy": 6.047968816757202, "epoch": 5.817080207732256, "grad_norm": 1.0078125, "learning_rate": 0.00022122979462293842, "loss": 5.4421, "mean_token_accuracy": 0.22333806604146958, "num_tokens": 127745735.0, "step": 50405 }, { "entropy": 6.080864334106446, "epoch": 5.8176572417772645, "grad_norm": 0.9453125, "learning_rate": 0.00022118972681794152, "loss": 5.3961, "mean_token_accuracy": 0.22876183539628983, "num_tokens": 127758406.0, "step": 50410 }, { "entropy": 6.022109603881836, "epoch": 5.818234275822274, "grad_norm": 0.99609375, "learning_rate": 0.00022114966082282644, "loss": 5.4241, "mean_token_accuracy": 0.22243682593107222, "num_tokens": 127770049.0, "step": 50415 }, { "entropy": 5.9110535144805905, "epoch": 5.818811309867282, "grad_norm": 0.96875, "learning_rate": 0.00022110959663894077, "loss": 5.3702, "mean_token_accuracy": 0.23012958467006683, "num_tokens": 127784114.0, "step": 50420 }, { "entropy": 6.095863962173462, "epoch": 5.819388343912291, "grad_norm": 1.0234375, "learning_rate": 0.0002210695342676321, "loss": 5.4865, "mean_token_accuracy": 0.21268316209316254, "num_tokens": 127797139.0, "step": 50425 }, { "entropy": 6.03691668510437, "epoch": 5.819965377957299, "grad_norm": 1.015625, "learning_rate": 0.0002210294737102478, "loss": 5.4564, "mean_token_accuracy": 0.22031344920396806, "num_tokens": 127809314.0, "step": 50430 }, { "entropy": 5.9681525230407715, "epoch": 5.820542412002308, "grad_norm": 0.96875, "learning_rate": 0.00022098941496813534, "loss": 5.3793, "mean_token_accuracy": 0.23264460414648055, "num_tokens": 127822607.0, "step": 50435 }, { "entropy": 6.0978330135345455, "epoch": 5.821119446047317, "grad_norm": 0.984375, "learning_rate": 0.00022094935804264205, "loss": 5.4825, "mean_token_accuracy": 0.21497157961130142, "num_tokens": 127835428.0, "step": 50440 }, { "entropy": 6.140019083023072, "epoch": 5.821696480092325, "grad_norm": 1.03125, "learning_rate": 0.0002209093029351154, "loss": 5.4736, "mean_token_accuracy": 0.21492733657360077, "num_tokens": 127847351.0, "step": 50445 }, { "entropy": 6.074713563919067, "epoch": 5.8222735141373345, "grad_norm": 0.99609375, "learning_rate": 0.0002208692496469023, "loss": 5.462, "mean_token_accuracy": 0.2184465542435646, "num_tokens": 127859843.0, "step": 50450 }, { "entropy": 6.044490242004395, "epoch": 5.822850548182343, "grad_norm": 0.99609375, "learning_rate": 0.0002208291981793502, "loss": 5.363, "mean_token_accuracy": 0.22210218012332916, "num_tokens": 127871953.0, "step": 50455 }, { "entropy": 6.000745153427124, "epoch": 5.823427582227351, "grad_norm": 1.1171875, "learning_rate": 0.00022078914853380604, "loss": 5.4085, "mean_token_accuracy": 0.23046095222234725, "num_tokens": 127885162.0, "step": 50460 }, { "entropy": 5.9967468738555905, "epoch": 5.82400461627236, "grad_norm": 1.015625, "learning_rate": 0.0002207491007116171, "loss": 5.4032, "mean_token_accuracy": 0.23266995549201966, "num_tokens": 127897425.0, "step": 50465 }, { "entropy": 5.904079389572144, "epoch": 5.824581650317369, "grad_norm": 0.984375, "learning_rate": 0.00022070905471413004, "loss": 5.3529, "mean_token_accuracy": 0.2272264376282692, "num_tokens": 127911088.0, "step": 50470 }, { "entropy": 6.0410847663879395, "epoch": 5.8251586843623775, "grad_norm": 1.03125, "learning_rate": 0.00022066901054269207, "loss": 5.4237, "mean_token_accuracy": 0.22082597762346268, "num_tokens": 127923359.0, "step": 50475 }, { "entropy": 5.991813039779663, "epoch": 5.825735718407386, "grad_norm": 1.0703125, "learning_rate": 0.0002206289681986498, "loss": 5.3776, "mean_token_accuracy": 0.2273949921131134, "num_tokens": 127935450.0, "step": 50480 }, { "entropy": 6.027788400650024, "epoch": 5.826312752452394, "grad_norm": 0.97265625, "learning_rate": 0.00022058892768335038, "loss": 5.4406, "mean_token_accuracy": 0.21817007511854172, "num_tokens": 127948436.0, "step": 50485 }, { "entropy": 5.9902318000793455, "epoch": 5.826889786497404, "grad_norm": 1.0, "learning_rate": 0.00022054888899814012, "loss": 5.3533, "mean_token_accuracy": 0.22581617385149003, "num_tokens": 127961639.0, "step": 50490 }, { "entropy": 6.03393588066101, "epoch": 5.827466820542412, "grad_norm": 1.0859375, "learning_rate": 0.00022050885214436618, "loss": 5.4297, "mean_token_accuracy": 0.22351187020540236, "num_tokens": 127974376.0, "step": 50495 }, { "entropy": 6.050661420822143, "epoch": 5.8280438545874205, "grad_norm": 1.03125, "learning_rate": 0.00022046881712337475, "loss": 5.4378, "mean_token_accuracy": 0.2202516421675682, "num_tokens": 127987221.0, "step": 50500 }, { "entropy": 6.01173095703125, "epoch": 5.828620888632429, "grad_norm": 1.09375, "learning_rate": 0.0002204287839365126, "loss": 5.3522, "mean_token_accuracy": 0.2260069102048874, "num_tokens": 127999512.0, "step": 50505 }, { "entropy": 6.0701940059661865, "epoch": 5.829197922677438, "grad_norm": 1.0234375, "learning_rate": 0.0002203887525851262, "loss": 5.4425, "mean_token_accuracy": 0.22250343710184098, "num_tokens": 128013408.0, "step": 50510 }, { "entropy": 6.071457099914551, "epoch": 5.829774956722447, "grad_norm": 1.0234375, "learning_rate": 0.00022034872307056204, "loss": 5.4146, "mean_token_accuracy": 0.22135910838842393, "num_tokens": 128025839.0, "step": 50515 }, { "entropy": 5.995633602142334, "epoch": 5.830351990767455, "grad_norm": 0.98828125, "learning_rate": 0.00022030869539416638, "loss": 5.3519, "mean_token_accuracy": 0.2197800561785698, "num_tokens": 128039935.0, "step": 50520 }, { "entropy": 6.043131399154663, "epoch": 5.830929024812464, "grad_norm": 0.94140625, "learning_rate": 0.0002202686695572856, "loss": 5.4312, "mean_token_accuracy": 0.2271645188331604, "num_tokens": 128052297.0, "step": 50525 }, { "entropy": 6.061482191085815, "epoch": 5.831506058857473, "grad_norm": 1.078125, "learning_rate": 0.00022022864556126587, "loss": 5.4615, "mean_token_accuracy": 0.2227476179599762, "num_tokens": 128064393.0, "step": 50530 }, { "entropy": 5.991846370697021, "epoch": 5.832083092902481, "grad_norm": 1.015625, "learning_rate": 0.00022018862340745355, "loss": 5.3873, "mean_token_accuracy": 0.2262405723333359, "num_tokens": 128077514.0, "step": 50535 }, { "entropy": 6.089515829086304, "epoch": 5.83266012694749, "grad_norm": 1.109375, "learning_rate": 0.0002201486030971946, "loss": 5.4218, "mean_token_accuracy": 0.2243250235915184, "num_tokens": 128089834.0, "step": 50540 }, { "entropy": 6.050447463989258, "epoch": 5.833237160992499, "grad_norm": 0.96875, "learning_rate": 0.00022010858463183508, "loss": 5.4456, "mean_token_accuracy": 0.22340308278799056, "num_tokens": 128103083.0, "step": 50545 }, { "entropy": 6.014553499221802, "epoch": 5.833814195037507, "grad_norm": 0.8828125, "learning_rate": 0.00022006856801272114, "loss": 5.3639, "mean_token_accuracy": 0.22425753474235535, "num_tokens": 128115786.0, "step": 50550 }, { "entropy": 5.9598688125610355, "epoch": 5.834391229082516, "grad_norm": 1.03125, "learning_rate": 0.00022002855324119853, "loss": 5.3316, "mean_token_accuracy": 0.23018798232078552, "num_tokens": 128127485.0, "step": 50555 }, { "entropy": 6.038669490814209, "epoch": 5.834968263127524, "grad_norm": 1.046875, "learning_rate": 0.00021998854031861332, "loss": 5.3826, "mean_token_accuracy": 0.22737166732549668, "num_tokens": 128140282.0, "step": 50560 }, { "entropy": 6.0039464950561525, "epoch": 5.8355452971725335, "grad_norm": 1.0546875, "learning_rate": 0.0002199485292463112, "loss": 5.3891, "mean_token_accuracy": 0.23098409175872803, "num_tokens": 128153293.0, "step": 50565 }, { "entropy": 6.037856101989746, "epoch": 5.836122331217542, "grad_norm": 1.015625, "learning_rate": 0.00021990852002563794, "loss": 5.4717, "mean_token_accuracy": 0.21816712617874146, "num_tokens": 128166087.0, "step": 50570 }, { "entropy": 6.042622089385986, "epoch": 5.83669936526255, "grad_norm": 1.03125, "learning_rate": 0.00021986851265793923, "loss": 5.4435, "mean_token_accuracy": 0.22034710347652436, "num_tokens": 128178642.0, "step": 50575 }, { "entropy": 5.988347959518433, "epoch": 5.837276399307559, "grad_norm": 1.046875, "learning_rate": 0.0002198285071445608, "loss": 5.4234, "mean_token_accuracy": 0.2197228953242302, "num_tokens": 128190713.0, "step": 50580 }, { "entropy": 6.056886100769043, "epoch": 5.837853433352568, "grad_norm": 1.09375, "learning_rate": 0.00021978850348684803, "loss": 5.3601, "mean_token_accuracy": 0.22639572471380234, "num_tokens": 128202030.0, "step": 50585 }, { "entropy": 6.025046253204346, "epoch": 5.838430467397576, "grad_norm": 1.03125, "learning_rate": 0.00021974850168614656, "loss": 5.4135, "mean_token_accuracy": 0.21961946338415145, "num_tokens": 128214240.0, "step": 50590 }, { "entropy": 5.98553318977356, "epoch": 5.839007501442585, "grad_norm": 1.0234375, "learning_rate": 0.00021970850174380174, "loss": 5.4151, "mean_token_accuracy": 0.21660540848970414, "num_tokens": 128227733.0, "step": 50595 }, { "entropy": 5.945986986160278, "epoch": 5.839584535487594, "grad_norm": 1.1171875, "learning_rate": 0.00021966850366115915, "loss": 5.3422, "mean_token_accuracy": 0.22543343305587768, "num_tokens": 128239964.0, "step": 50600 }, { "entropy": 6.061747360229492, "epoch": 5.840161569532603, "grad_norm": 1.1796875, "learning_rate": 0.00021962850743956382, "loss": 5.4699, "mean_token_accuracy": 0.21340246498584747, "num_tokens": 128252647.0, "step": 50605 }, { "entropy": 6.086827564239502, "epoch": 5.840738603577611, "grad_norm": 1.1015625, "learning_rate": 0.00021958851308036116, "loss": 5.4675, "mean_token_accuracy": 0.21760924607515336, "num_tokens": 128264876.0, "step": 50610 }, { "entropy": 6.120539569854737, "epoch": 5.841315637622619, "grad_norm": 0.984375, "learning_rate": 0.00021954852058489634, "loss": 5.4813, "mean_token_accuracy": 0.2170608103275299, "num_tokens": 128278572.0, "step": 50615 }, { "entropy": 5.974930477142334, "epoch": 5.841892671667629, "grad_norm": 1.0859375, "learning_rate": 0.00021950852995451453, "loss": 5.3533, "mean_token_accuracy": 0.22724754810333253, "num_tokens": 128291052.0, "step": 50620 }, { "entropy": 6.099519968032837, "epoch": 5.842469705712637, "grad_norm": 1.03125, "learning_rate": 0.0002194685411905607, "loss": 5.4917, "mean_token_accuracy": 0.21947124749422073, "num_tokens": 128303582.0, "step": 50625 }, { "entropy": 6.02627272605896, "epoch": 5.8430467397576455, "grad_norm": 0.94140625, "learning_rate": 0.0002194285542943799, "loss": 5.4156, "mean_token_accuracy": 0.22575947195291518, "num_tokens": 128317367.0, "step": 50630 }, { "entropy": 6.07182240486145, "epoch": 5.843623773802655, "grad_norm": 1.03125, "learning_rate": 0.00021938856926731704, "loss": 5.5115, "mean_token_accuracy": 0.2182227909564972, "num_tokens": 128329652.0, "step": 50635 }, { "entropy": 5.958067417144775, "epoch": 5.844200807847663, "grad_norm": 1.078125, "learning_rate": 0.00021934858611071719, "loss": 5.3523, "mean_token_accuracy": 0.2276764467358589, "num_tokens": 128341538.0, "step": 50640 }, { "entropy": 6.075793695449829, "epoch": 5.844777841892672, "grad_norm": 1.0703125, "learning_rate": 0.00021930860482592484, "loss": 5.4548, "mean_token_accuracy": 0.21957226991653442, "num_tokens": 128353533.0, "step": 50645 }, { "entropy": 6.091213226318359, "epoch": 5.84535487593768, "grad_norm": 0.98828125, "learning_rate": 0.000219268625414285, "loss": 5.4527, "mean_token_accuracy": 0.2202288642525673, "num_tokens": 128367028.0, "step": 50650 }, { "entropy": 5.9958878517150875, "epoch": 5.8459319099826885, "grad_norm": 0.99609375, "learning_rate": 0.00021922864787714215, "loss": 5.4744, "mean_token_accuracy": 0.21656205207109452, "num_tokens": 128378759.0, "step": 50655 }, { "entropy": 6.097091245651245, "epoch": 5.846508944027698, "grad_norm": 1.109375, "learning_rate": 0.0002191886722158411, "loss": 5.4662, "mean_token_accuracy": 0.21781108379364014, "num_tokens": 128390689.0, "step": 50660 }, { "entropy": 6.130036067962647, "epoch": 5.847085978072706, "grad_norm": 1.046875, "learning_rate": 0.0002191486984317263, "loss": 5.4266, "mean_token_accuracy": 0.21853924095630645, "num_tokens": 128402774.0, "step": 50665 }, { "entropy": 6.017915105819702, "epoch": 5.847663012117715, "grad_norm": 1.03125, "learning_rate": 0.00021910872652614234, "loss": 5.4131, "mean_token_accuracy": 0.22539464086294175, "num_tokens": 128416237.0, "step": 50670 }, { "entropy": 6.010024499893189, "epoch": 5.848240046162724, "grad_norm": 1.078125, "learning_rate": 0.00021906875650043356, "loss": 5.3807, "mean_token_accuracy": 0.23103055208921433, "num_tokens": 128428298.0, "step": 50675 }, { "entropy": 6.102875566482544, "epoch": 5.848817080207732, "grad_norm": 1.03125, "learning_rate": 0.00021902878835594443, "loss": 5.376, "mean_token_accuracy": 0.22378448098897935, "num_tokens": 128439925.0, "step": 50680 }, { "entropy": 5.91007432937622, "epoch": 5.849394114252741, "grad_norm": 1.03125, "learning_rate": 0.00021898882209401915, "loss": 5.2412, "mean_token_accuracy": 0.23623914569616317, "num_tokens": 128453908.0, "step": 50685 }, { "entropy": 6.054044008255005, "epoch": 5.849971148297749, "grad_norm": 1.0546875, "learning_rate": 0.00021894885771600204, "loss": 5.4946, "mean_token_accuracy": 0.21876438558101655, "num_tokens": 128466695.0, "step": 50690 }, { "entropy": 6.035588026046753, "epoch": 5.8505481823427585, "grad_norm": 0.953125, "learning_rate": 0.0002189088952232372, "loss": 5.3946, "mean_token_accuracy": 0.22270541936159133, "num_tokens": 128479312.0, "step": 50695 }, { "entropy": 5.870685958862305, "epoch": 5.851125216387767, "grad_norm": 0.84375, "learning_rate": 0.00021886893461706892, "loss": 5.2587, "mean_token_accuracy": 0.23716987520456315, "num_tokens": 128491469.0, "step": 50700 }, { "entropy": 5.998844146728516, "epoch": 5.851702250432775, "grad_norm": 1.0078125, "learning_rate": 0.000218828975898841, "loss": 5.4141, "mean_token_accuracy": 0.2196686178445816, "num_tokens": 128503059.0, "step": 50705 }, { "entropy": 6.131736183166504, "epoch": 5.852279284477785, "grad_norm": 1.0078125, "learning_rate": 0.00021878901906989767, "loss": 5.5001, "mean_token_accuracy": 0.2119828701019287, "num_tokens": 128517689.0, "step": 50710 }, { "entropy": 6.022342777252197, "epoch": 5.852856318522793, "grad_norm": 1.0625, "learning_rate": 0.00021874906413158268, "loss": 5.3884, "mean_token_accuracy": 0.23145127147436143, "num_tokens": 128530240.0, "step": 50715 }, { "entropy": 6.052708959579467, "epoch": 5.8534333525678015, "grad_norm": 1.0859375, "learning_rate": 0.0002187091110852401, "loss": 5.4694, "mean_token_accuracy": 0.2142168790102005, "num_tokens": 128542832.0, "step": 50720 }, { "entropy": 6.0598667621612545, "epoch": 5.85401038661281, "grad_norm": 0.9765625, "learning_rate": 0.00021866915993221353, "loss": 5.4693, "mean_token_accuracy": 0.21437126845121385, "num_tokens": 128556304.0, "step": 50725 }, { "entropy": 6.003561687469483, "epoch": 5.854587420657818, "grad_norm": 1.0078125, "learning_rate": 0.00021862921067384683, "loss": 5.3894, "mean_token_accuracy": 0.23023393005132675, "num_tokens": 128569192.0, "step": 50730 }, { "entropy": 6.012569570541382, "epoch": 5.855164454702828, "grad_norm": 0.9921875, "learning_rate": 0.00021858926331148356, "loss": 5.4147, "mean_token_accuracy": 0.22599702328443527, "num_tokens": 128582767.0, "step": 50735 }, { "entropy": 6.026070165634155, "epoch": 5.855741488747836, "grad_norm": 0.94921875, "learning_rate": 0.00021854931784646747, "loss": 5.408, "mean_token_accuracy": 0.22527667880058289, "num_tokens": 128596200.0, "step": 50740 }, { "entropy": 6.038392448425293, "epoch": 5.8563185227928445, "grad_norm": 1.0, "learning_rate": 0.00021850937428014196, "loss": 5.4279, "mean_token_accuracy": 0.22600363045930863, "num_tokens": 128610298.0, "step": 50745 }, { "entropy": 6.003039407730102, "epoch": 5.856895556837854, "grad_norm": 1.078125, "learning_rate": 0.00021846943261385067, "loss": 5.3744, "mean_token_accuracy": 0.2263938993215561, "num_tokens": 128622274.0, "step": 50750 }, { "entropy": 6.075804996490478, "epoch": 5.857472590882862, "grad_norm": 0.95703125, "learning_rate": 0.0002184294928489368, "loss": 5.4372, "mean_token_accuracy": 0.2138909727334976, "num_tokens": 128634772.0, "step": 50755 }, { "entropy": 6.0322585105896, "epoch": 5.858049624927871, "grad_norm": 1.015625, "learning_rate": 0.00021838955498674402, "loss": 5.4585, "mean_token_accuracy": 0.22602907866239547, "num_tokens": 128647283.0, "step": 50760 }, { "entropy": 5.969331216812134, "epoch": 5.858626658972879, "grad_norm": 1.0, "learning_rate": 0.00021834961902861527, "loss": 5.3436, "mean_token_accuracy": 0.23066012412309647, "num_tokens": 128659277.0, "step": 50765 }, { "entropy": 6.022809076309204, "epoch": 5.859203693017888, "grad_norm": 1.09375, "learning_rate": 0.00021830968497589404, "loss": 5.3272, "mean_token_accuracy": 0.23730990290641785, "num_tokens": 128670499.0, "step": 50770 }, { "entropy": 5.933892345428466, "epoch": 5.859780727062897, "grad_norm": 1.1328125, "learning_rate": 0.00021826975282992334, "loss": 5.3352, "mean_token_accuracy": 0.22655107378959655, "num_tokens": 128683153.0, "step": 50775 }, { "entropy": 5.933896589279175, "epoch": 5.860357761107905, "grad_norm": 1.0390625, "learning_rate": 0.00021822982259204644, "loss": 5.3717, "mean_token_accuracy": 0.22985600233078002, "num_tokens": 128696067.0, "step": 50780 }, { "entropy": 6.115619468688965, "epoch": 5.8609347951529145, "grad_norm": 1.015625, "learning_rate": 0.00021818989426360613, "loss": 5.5854, "mean_token_accuracy": 0.21275230199098588, "num_tokens": 128709220.0, "step": 50785 }, { "entropy": 6.144386529922485, "epoch": 5.861511829197923, "grad_norm": 0.9453125, "learning_rate": 0.00021814996784594553, "loss": 5.5551, "mean_token_accuracy": 0.2121775820851326, "num_tokens": 128722363.0, "step": 50790 }, { "entropy": 6.10267071723938, "epoch": 5.862088863242931, "grad_norm": 1.0078125, "learning_rate": 0.00021811004334040753, "loss": 5.4615, "mean_token_accuracy": 0.2197597399353981, "num_tokens": 128734413.0, "step": 50795 }, { "entropy": 6.015191650390625, "epoch": 5.86266589728794, "grad_norm": 0.9921875, "learning_rate": 0.00021807012074833505, "loss": 5.3643, "mean_token_accuracy": 0.22646291553974152, "num_tokens": 128746333.0, "step": 50800 }, { "entropy": 5.973905420303344, "epoch": 5.863242931332948, "grad_norm": 0.99609375, "learning_rate": 0.00021803020007107066, "loss": 5.3981, "mean_token_accuracy": 0.22852888852357864, "num_tokens": 128758889.0, "step": 50805 }, { "entropy": 6.01613335609436, "epoch": 5.8638199653779575, "grad_norm": 1.0390625, "learning_rate": 0.00021799028130995723, "loss": 5.3557, "mean_token_accuracy": 0.23281191736459733, "num_tokens": 128771089.0, "step": 50810 }, { "entropy": 6.040916776657104, "epoch": 5.864396999422966, "grad_norm": 1.0625, "learning_rate": 0.00021795036446633736, "loss": 5.3886, "mean_token_accuracy": 0.22952151596546172, "num_tokens": 128784590.0, "step": 50815 }, { "entropy": 6.0145426273345945, "epoch": 5.864974033467974, "grad_norm": 1.0234375, "learning_rate": 0.00021791044954155375, "loss": 5.4272, "mean_token_accuracy": 0.21972869485616683, "num_tokens": 128798415.0, "step": 50820 }, { "entropy": 5.94070954322815, "epoch": 5.865551067512984, "grad_norm": 0.96875, "learning_rate": 0.00021787053653694866, "loss": 5.3086, "mean_token_accuracy": 0.2368646591901779, "num_tokens": 128812405.0, "step": 50825 }, { "entropy": 6.076986265182495, "epoch": 5.866128101557992, "grad_norm": 0.98828125, "learning_rate": 0.00021783062545386477, "loss": 5.4708, "mean_token_accuracy": 0.21962153613567353, "num_tokens": 128824665.0, "step": 50830 }, { "entropy": 6.005318927764892, "epoch": 5.866705135603, "grad_norm": 1.0859375, "learning_rate": 0.0002177907162936444, "loss": 5.397, "mean_token_accuracy": 0.22843997776508332, "num_tokens": 128837561.0, "step": 50835 }, { "entropy": 6.0911918640136715, "epoch": 5.867282169648009, "grad_norm": 1.0, "learning_rate": 0.0002177508090576299, "loss": 5.4723, "mean_token_accuracy": 0.21704014986753464, "num_tokens": 128849954.0, "step": 50840 }, { "entropy": 6.0029552459716795, "epoch": 5.867859203693018, "grad_norm": 1.0078125, "learning_rate": 0.0002177109037471634, "loss": 5.3657, "mean_token_accuracy": 0.2323867380619049, "num_tokens": 128864258.0, "step": 50845 }, { "entropy": 5.99102520942688, "epoch": 5.868436237738027, "grad_norm": 1.0, "learning_rate": 0.0002176710003635873, "loss": 5.3429, "mean_token_accuracy": 0.23248618543148042, "num_tokens": 128877708.0, "step": 50850 }, { "entropy": 6.038684701919555, "epoch": 5.869013271783035, "grad_norm": 1.078125, "learning_rate": 0.0002176310989082435, "loss": 5.374, "mean_token_accuracy": 0.22527575343847275, "num_tokens": 128890039.0, "step": 50855 }, { "entropy": 6.018736982345581, "epoch": 5.869590305828044, "grad_norm": 1.0390625, "learning_rate": 0.00021759119938247434, "loss": 5.343, "mean_token_accuracy": 0.22151255905628203, "num_tokens": 128901873.0, "step": 50860 }, { "entropy": 6.012150239944458, "epoch": 5.870167339873053, "grad_norm": 0.9453125, "learning_rate": 0.00021755130178762155, "loss": 5.4482, "mean_token_accuracy": 0.22416732013225554, "num_tokens": 128915151.0, "step": 50865 }, { "entropy": 6.021463060379029, "epoch": 5.870744373918061, "grad_norm": 1.078125, "learning_rate": 0.00021751140612502734, "loss": 5.3704, "mean_token_accuracy": 0.22769350409507752, "num_tokens": 128927948.0, "step": 50870 }, { "entropy": 5.9567488670349125, "epoch": 5.87132140796307, "grad_norm": 1.03125, "learning_rate": 0.00021747151239603324, "loss": 5.3884, "mean_token_accuracy": 0.22673175632953643, "num_tokens": 128940564.0, "step": 50875 }, { "entropy": 6.0511589527130125, "epoch": 5.871898442008078, "grad_norm": 1.03125, "learning_rate": 0.00021743162060198134, "loss": 5.3979, "mean_token_accuracy": 0.23280119150877, "num_tokens": 128954579.0, "step": 50880 }, { "entropy": 5.927225542068482, "epoch": 5.872475476053087, "grad_norm": 1.125, "learning_rate": 0.00021739173074421331, "loss": 5.2451, "mean_token_accuracy": 0.24241523295640946, "num_tokens": 128967706.0, "step": 50885 }, { "entropy": 6.064105987548828, "epoch": 5.873052510098096, "grad_norm": 1.046875, "learning_rate": 0.00021735184282407077, "loss": 5.452, "mean_token_accuracy": 0.22285414934158326, "num_tokens": 128980416.0, "step": 50890 }, { "entropy": 6.044906520843506, "epoch": 5.873629544143104, "grad_norm": 1.0, "learning_rate": 0.00021731195684289534, "loss": 5.4474, "mean_token_accuracy": 0.22325989454984665, "num_tokens": 128993765.0, "step": 50895 }, { "entropy": 6.016779899597168, "epoch": 5.874206578188113, "grad_norm": 1.046875, "learning_rate": 0.00021727207280202866, "loss": 5.3659, "mean_token_accuracy": 0.22246128171682358, "num_tokens": 129005562.0, "step": 50900 }, { "entropy": 5.930756664276123, "epoch": 5.874783612233122, "grad_norm": 1.1171875, "learning_rate": 0.00021723219070281203, "loss": 5.3151, "mean_token_accuracy": 0.2313905492424965, "num_tokens": 129017836.0, "step": 50905 }, { "entropy": 6.047598266601563, "epoch": 5.87536064627813, "grad_norm": 1.0703125, "learning_rate": 0.00021719231054658707, "loss": 5.4383, "mean_token_accuracy": 0.22508041560649872, "num_tokens": 129030881.0, "step": 50910 }, { "entropy": 6.0395432472229, "epoch": 5.875937680323139, "grad_norm": 1.0, "learning_rate": 0.00021715243233469495, "loss": 5.4367, "mean_token_accuracy": 0.22594944685697554, "num_tokens": 129043415.0, "step": 50915 }, { "entropy": 6.013824510574341, "epoch": 5.876514714368148, "grad_norm": 1.0625, "learning_rate": 0.00021711255606847706, "loss": 5.3929, "mean_token_accuracy": 0.22822608351707457, "num_tokens": 129057097.0, "step": 50920 }, { "entropy": 5.946033668518067, "epoch": 5.877091748413156, "grad_norm": 1.09375, "learning_rate": 0.00021707268174927459, "loss": 5.3636, "mean_token_accuracy": 0.22646875828504562, "num_tokens": 129072562.0, "step": 50925 }, { "entropy": 5.958529043197632, "epoch": 5.877668782458165, "grad_norm": 1.0859375, "learning_rate": 0.00021703280937842879, "loss": 5.3135, "mean_token_accuracy": 0.23903025984764098, "num_tokens": 129086007.0, "step": 50930 }, { "entropy": 5.991726493835449, "epoch": 5.878245816503174, "grad_norm": 0.953125, "learning_rate": 0.0002169929389572805, "loss": 5.4012, "mean_token_accuracy": 0.22207655608654023, "num_tokens": 129097903.0, "step": 50935 }, { "entropy": 6.144826602935791, "epoch": 5.8788228505481825, "grad_norm": 1.03125, "learning_rate": 0.000216953070487171, "loss": 5.572, "mean_token_accuracy": 0.21332115530967713, "num_tokens": 129111229.0, "step": 50940 }, { "entropy": 6.032774257659912, "epoch": 5.879399884593191, "grad_norm": 1.0625, "learning_rate": 0.00021691320396944103, "loss": 5.4081, "mean_token_accuracy": 0.22807783782482147, "num_tokens": 129123853.0, "step": 50945 }, { "entropy": 6.027386093139649, "epoch": 5.879976918638199, "grad_norm": 1.046875, "learning_rate": 0.00021687333940543173, "loss": 5.4157, "mean_token_accuracy": 0.2205837145447731, "num_tokens": 129135717.0, "step": 50950 }, { "entropy": 6.111490917205811, "epoch": 5.880553952683209, "grad_norm": 0.99609375, "learning_rate": 0.00021683347679648369, "loss": 5.4938, "mean_token_accuracy": 0.2160240516066551, "num_tokens": 129149733.0, "step": 50955 }, { "entropy": 6.070977592468262, "epoch": 5.881130986728217, "grad_norm": 1.0390625, "learning_rate": 0.00021679361614393777, "loss": 5.4071, "mean_token_accuracy": 0.22597229331731797, "num_tokens": 129161623.0, "step": 50960 }, { "entropy": 6.02405571937561, "epoch": 5.8817080207732255, "grad_norm": 1.0, "learning_rate": 0.00021675375744913467, "loss": 5.3948, "mean_token_accuracy": 0.22637299746274947, "num_tokens": 129174730.0, "step": 50965 }, { "entropy": 6.020820236206054, "epoch": 5.882285054818234, "grad_norm": 0.96484375, "learning_rate": 0.000216713900713415, "loss": 5.3855, "mean_token_accuracy": 0.22477019876241683, "num_tokens": 129188961.0, "step": 50970 }, { "entropy": 5.972708034515381, "epoch": 5.882862088863243, "grad_norm": 0.96484375, "learning_rate": 0.0002166740459381194, "loss": 5.331, "mean_token_accuracy": 0.2267143651843071, "num_tokens": 129202263.0, "step": 50975 }, { "entropy": 6.039251661300659, "epoch": 5.883439122908252, "grad_norm": 0.98046875, "learning_rate": 0.0002166341931245882, "loss": 5.468, "mean_token_accuracy": 0.2169051706790924, "num_tokens": 129215631.0, "step": 50980 }, { "entropy": 6.010639667510986, "epoch": 5.88401615695326, "grad_norm": 1.1328125, "learning_rate": 0.00021659434227416197, "loss": 5.3566, "mean_token_accuracy": 0.22541877925395964, "num_tokens": 129228004.0, "step": 50985 }, { "entropy": 6.100912475585938, "epoch": 5.8845931909982685, "grad_norm": 0.9453125, "learning_rate": 0.00021655449338818102, "loss": 5.4332, "mean_token_accuracy": 0.2221224844455719, "num_tokens": 129240185.0, "step": 50990 }, { "entropy": 5.853770303726196, "epoch": 5.885170225043278, "grad_norm": 1.0546875, "learning_rate": 0.00021651464646798568, "loss": 5.2237, "mean_token_accuracy": 0.2406178742647171, "num_tokens": 129252524.0, "step": 50995 }, { "entropy": 6.060685539245606, "epoch": 5.885747259088286, "grad_norm": 1.0234375, "learning_rate": 0.0002164748015149161, "loss": 5.5067, "mean_token_accuracy": 0.21363474279642106, "num_tokens": 129265409.0, "step": 51000 }, { "epoch": 5.885747259088286, "eval_entropy": 5.845093757549673, "eval_loss": 5.596216678619385, "eval_mean_token_accuracy": 0.22051587693005553, "eval_num_tokens": 129265409.0, "eval_runtime": 22.9165, "eval_samples_per_second": 1227.762, "eval_steps_per_second": 153.47, "step": 51000 } ], "logging_steps": 5, "max_steps": 86650, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.9069394614272e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }