{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.462204270051933, "eval_steps": 3000, "global_step": 30000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742519760131836, "epoch": 0.0005770340450086555, "grad_norm": 4.78125, "learning_rate": 2e-06, "loss": 10.7834, "mean_token_accuracy": 0.0, "num_tokens": 11955.0, "step": 5 }, { "entropy": 10.742532062530518, "epoch": 0.001154068090017311, "grad_norm": 5.15625, "learning_rate": 4.5e-06, "loss": 10.7821, "mean_token_accuracy": 7.552870083600282e-05, "num_tokens": 24473.0, "step": 10 }, { "entropy": 10.742538166046142, "epoch": 0.0017311021350259665, "grad_norm": 5.4375, "learning_rate": 7e-06, "loss": 10.7615, "mean_token_accuracy": 0.00016723573207855225, "num_tokens": 36716.0, "step": 15 }, { "entropy": 10.742550373077393, "epoch": 0.002308136180034622, "grad_norm": 5.125, "learning_rate": 9.5e-06, "loss": 10.7088, "mean_token_accuracy": 0.0010991264251060783, "num_tokens": 49747.0, "step": 20 }, { "entropy": 10.742451667785645, "epoch": 0.0028851702250432777, "grad_norm": 4.71875, "learning_rate": 1.2e-05, "loss": 10.6029, "mean_token_accuracy": 0.01508477891329676, "num_tokens": 61991.0, "step": 25 }, { "entropy": 10.741979122161865, "epoch": 0.003462204270051933, "grad_norm": 3.875, "learning_rate": 1.4500000000000002e-05, "loss": 10.4994, "mean_token_accuracy": 0.0400444071739912, "num_tokens": 74918.0, "step": 30 }, { "entropy": 10.740076923370362, "epoch": 0.004039238315060588, "grad_norm": 3.109375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3732, "mean_token_accuracy": 0.05369483157992363, "num_tokens": 87833.0, "step": 35 }, { "entropy": 10.733743858337402, "epoch": 0.004616272360069244, "grad_norm": 2.53125, "learning_rate": 1.95e-05, "loss": 10.2264, "mean_token_accuracy": 0.0561745673418045, "num_tokens": 101031.0, "step": 40 }, { "entropy": 10.72265920639038, "epoch": 0.0051933064050779, "grad_norm": 2.296875, "learning_rate": 2.2e-05, "loss": 10.1107, "mean_token_accuracy": 0.05086057800799608, "num_tokens": 114085.0, "step": 45 }, { "entropy": 10.712560367584228, "epoch": 0.005770340450086555, "grad_norm": 2.046875, "learning_rate": 2.4500000000000003e-05, "loss": 10.0728, "mean_token_accuracy": 0.05095174703747034, "num_tokens": 126190.0, "step": 50 }, { "entropy": 10.708724021911621, "epoch": 0.006347374495095211, "grad_norm": 1.9453125, "learning_rate": 2.7e-05, "loss": 9.9872, "mean_token_accuracy": 0.05040723979473114, "num_tokens": 138933.0, "step": 55 }, { "entropy": 10.705632781982422, "epoch": 0.006924408540103866, "grad_norm": 1.96875, "learning_rate": 2.95e-05, "loss": 9.9165, "mean_token_accuracy": 0.05702933557331562, "num_tokens": 150542.0, "step": 60 }, { "entropy": 10.699434947967529, "epoch": 0.0075014425851125215, "grad_norm": 1.9609375, "learning_rate": 3.2e-05, "loss": 9.9117, "mean_token_accuracy": 0.05192887857556343, "num_tokens": 163507.0, "step": 65 }, { "entropy": 10.691042518615722, "epoch": 0.008078476630121177, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.8663, "mean_token_accuracy": 0.0556206401437521, "num_tokens": 176668.0, "step": 70 }, { "entropy": 10.68201036453247, "epoch": 0.008655510675129832, "grad_norm": 1.921875, "learning_rate": 3.7e-05, "loss": 9.8051, "mean_token_accuracy": 0.05544878952205181, "num_tokens": 191413.0, "step": 75 }, { "entropy": 10.66737766265869, "epoch": 0.009232544720138488, "grad_norm": 1.859375, "learning_rate": 3.95e-05, "loss": 9.739, "mean_token_accuracy": 0.06524630598723888, "num_tokens": 204176.0, "step": 80 }, { "entropy": 10.650106525421142, "epoch": 0.009809578765147143, "grad_norm": 2.015625, "learning_rate": 4.2000000000000004e-05, "loss": 9.6842, "mean_token_accuracy": 0.06752815209329129, "num_tokens": 216851.0, "step": 85 }, { "entropy": 10.636476421356202, "epoch": 0.0103866128101558, "grad_norm": 1.8125, "learning_rate": 4.45e-05, "loss": 9.6572, "mean_token_accuracy": 0.0653569109737873, "num_tokens": 229621.0, "step": 90 }, { "entropy": 10.622958183288574, "epoch": 0.010963646855164455, "grad_norm": 1.953125, "learning_rate": 4.7000000000000004e-05, "loss": 9.6025, "mean_token_accuracy": 0.06540683954954148, "num_tokens": 242074.0, "step": 95 }, { "entropy": 10.592237091064453, "epoch": 0.01154068090017311, "grad_norm": 1.703125, "learning_rate": 4.9500000000000004e-05, "loss": 9.474, "mean_token_accuracy": 0.07080609016120434, "num_tokens": 254094.0, "step": 100 }, { "entropy": 10.51324234008789, "epoch": 0.012117714945181766, "grad_norm": 2.046875, "learning_rate": 5.2e-05, "loss": 9.4787, "mean_token_accuracy": 0.07307280339300633, "num_tokens": 267560.0, "step": 105 }, { "entropy": 10.503196525573731, "epoch": 0.012694748990190421, "grad_norm": 1.4453125, "learning_rate": 5.45e-05, "loss": 9.4426, "mean_token_accuracy": 0.07156955860555173, "num_tokens": 280717.0, "step": 110 }, { "entropy": 10.523096179962158, "epoch": 0.013271783035199077, "grad_norm": 1.7421875, "learning_rate": 5.7e-05, "loss": 9.3915, "mean_token_accuracy": 0.07147992886602879, "num_tokens": 293856.0, "step": 115 }, { "entropy": 10.484137058258057, "epoch": 0.013848817080207732, "grad_norm": 1.4609375, "learning_rate": 5.9499999999999996e-05, "loss": 9.2251, "mean_token_accuracy": 0.07240887582302094, "num_tokens": 305191.0, "step": 120 }, { "entropy": 10.420050239562988, "epoch": 0.014425851125216388, "grad_norm": 1.4375, "learning_rate": 6.2e-05, "loss": 9.2288, "mean_token_accuracy": 0.07244622334837914, "num_tokens": 318544.0, "step": 125 }, { "entropy": 10.332412433624267, "epoch": 0.015002885170225043, "grad_norm": 1.4375, "learning_rate": 6.450000000000001e-05, "loss": 9.0584, "mean_token_accuracy": 0.08713233023881913, "num_tokens": 331445.0, "step": 130 }, { "entropy": 10.288755512237548, "epoch": 0.015579919215233698, "grad_norm": 1.28125, "learning_rate": 6.7e-05, "loss": 9.0833, "mean_token_accuracy": 0.07415068708360195, "num_tokens": 344775.0, "step": 135 }, { "entropy": 10.267962074279785, "epoch": 0.016156953260242354, "grad_norm": 1.1640625, "learning_rate": 6.950000000000001e-05, "loss": 8.9864, "mean_token_accuracy": 0.07388804033398629, "num_tokens": 357804.0, "step": 140 }, { "entropy": 10.174692630767822, "epoch": 0.01673398730525101, "grad_norm": 1.3671875, "learning_rate": 7.2e-05, "loss": 8.8543, "mean_token_accuracy": 0.08084411099553108, "num_tokens": 369826.0, "step": 145 }, { "entropy": 10.011744403839112, "epoch": 0.017311021350259664, "grad_norm": 1.0390625, "learning_rate": 7.45e-05, "loss": 8.7823, "mean_token_accuracy": 0.08401374593377113, "num_tokens": 382768.0, "step": 150 }, { "entropy": 9.914338493347168, "epoch": 0.01788805539526832, "grad_norm": 1.3046875, "learning_rate": 7.7e-05, "loss": 8.7625, "mean_token_accuracy": 0.08076213970780373, "num_tokens": 395910.0, "step": 155 }, { "entropy": 9.87332878112793, "epoch": 0.018465089440276975, "grad_norm": 1.015625, "learning_rate": 7.950000000000001e-05, "loss": 8.725, "mean_token_accuracy": 0.07417598105967045, "num_tokens": 408140.0, "step": 160 }, { "entropy": 9.752376747131347, "epoch": 0.019042123485285632, "grad_norm": 0.99609375, "learning_rate": 8.2e-05, "loss": 8.5835, "mean_token_accuracy": 0.08260673955082894, "num_tokens": 420486.0, "step": 165 }, { "entropy": 9.501761531829834, "epoch": 0.019619157530294286, "grad_norm": 0.88671875, "learning_rate": 8.450000000000001e-05, "loss": 8.5107, "mean_token_accuracy": 0.09241977110505104, "num_tokens": 433207.0, "step": 170 }, { "entropy": 9.351601791381835, "epoch": 0.020196191575302943, "grad_norm": 0.83984375, "learning_rate": 8.7e-05, "loss": 8.4638, "mean_token_accuracy": 0.08450455963611603, "num_tokens": 444880.0, "step": 175 }, { "entropy": 9.297267818450928, "epoch": 0.0207732256203116, "grad_norm": 1.3125, "learning_rate": 8.95e-05, "loss": 8.4926, "mean_token_accuracy": 0.08199871554970742, "num_tokens": 456650.0, "step": 180 }, { "entropy": 9.096736717224122, "epoch": 0.021350259665320254, "grad_norm": 1.109375, "learning_rate": 9.2e-05, "loss": 8.4572, "mean_token_accuracy": 0.08327073007822036, "num_tokens": 469667.0, "step": 185 }, { "entropy": 9.029964542388916, "epoch": 0.02192729371032891, "grad_norm": 1.578125, "learning_rate": 9.45e-05, "loss": 8.3783, "mean_token_accuracy": 0.09304521456360818, "num_tokens": 481952.0, "step": 190 }, { "entropy": 8.89255895614624, "epoch": 0.022504327755337564, "grad_norm": 1.6953125, "learning_rate": 9.7e-05, "loss": 8.399, "mean_token_accuracy": 0.09114565178751946, "num_tokens": 494352.0, "step": 195 }, { "entropy": 8.913476753234864, "epoch": 0.02308136180034622, "grad_norm": 1.140625, "learning_rate": 9.95e-05, "loss": 8.3105, "mean_token_accuracy": 0.0925761379301548, "num_tokens": 506937.0, "step": 200 }, { "entropy": 8.781428337097168, "epoch": 0.023658395845354875, "grad_norm": 0.77734375, "learning_rate": 0.000102, "loss": 8.303, "mean_token_accuracy": 0.0928865760564804, "num_tokens": 519552.0, "step": 205 }, { "entropy": 8.800222492218017, "epoch": 0.024235429890363532, "grad_norm": 0.9296875, "learning_rate": 0.00010449999999999999, "loss": 8.3412, "mean_token_accuracy": 0.08962251469492913, "num_tokens": 531359.0, "step": 210 }, { "entropy": 8.806383419036866, "epoch": 0.024812463935372186, "grad_norm": 1.1796875, "learning_rate": 0.000107, "loss": 8.3542, "mean_token_accuracy": 0.09396427646279334, "num_tokens": 544197.0, "step": 215 }, { "entropy": 8.8606746673584, "epoch": 0.025389497980380843, "grad_norm": 1.1875, "learning_rate": 0.0001095, "loss": 8.3106, "mean_token_accuracy": 0.09081738814711571, "num_tokens": 556818.0, "step": 220 }, { "entropy": 8.742358875274657, "epoch": 0.025966532025389497, "grad_norm": 0.85546875, "learning_rate": 0.000112, "loss": 8.3253, "mean_token_accuracy": 0.0934368498623371, "num_tokens": 569363.0, "step": 225 }, { "entropy": 8.80865125656128, "epoch": 0.026543566070398154, "grad_norm": 0.80859375, "learning_rate": 0.0001145, "loss": 8.3076, "mean_token_accuracy": 0.09487870410084724, "num_tokens": 581645.0, "step": 230 }, { "entropy": 8.763648796081544, "epoch": 0.027120600115406807, "grad_norm": 0.79296875, "learning_rate": 0.00011700000000000001, "loss": 8.259, "mean_token_accuracy": 0.08925148844718933, "num_tokens": 593501.0, "step": 235 }, { "entropy": 8.715390586853028, "epoch": 0.027697634160415464, "grad_norm": 1.046875, "learning_rate": 0.00011949999999999999, "loss": 8.2462, "mean_token_accuracy": 0.09425812289118767, "num_tokens": 606328.0, "step": 240 }, { "entropy": 8.573129081726075, "epoch": 0.02827466820542412, "grad_norm": 1.046875, "learning_rate": 0.000122, "loss": 8.1457, "mean_token_accuracy": 0.1065749242901802, "num_tokens": 619003.0, "step": 245 }, { "entropy": 8.62852210998535, "epoch": 0.028851702250432775, "grad_norm": 0.9921875, "learning_rate": 0.0001245, "loss": 8.2725, "mean_token_accuracy": 0.09227693155407905, "num_tokens": 632910.0, "step": 250 }, { "entropy": 8.616901016235351, "epoch": 0.029428736295441432, "grad_norm": 0.96875, "learning_rate": 0.000127, "loss": 8.2065, "mean_token_accuracy": 0.09859882518649102, "num_tokens": 645959.0, "step": 255 }, { "entropy": 8.623135948181153, "epoch": 0.030005770340450086, "grad_norm": 0.953125, "learning_rate": 0.0001295, "loss": 8.1911, "mean_token_accuracy": 0.10357227995991707, "num_tokens": 658620.0, "step": 260 }, { "entropy": 8.548318576812743, "epoch": 0.030582804385458743, "grad_norm": 1.0703125, "learning_rate": 0.000132, "loss": 8.1897, "mean_token_accuracy": 0.10186770558357239, "num_tokens": 670804.0, "step": 265 }, { "entropy": 8.512144851684571, "epoch": 0.031159838430467397, "grad_norm": 0.75, "learning_rate": 0.00013450000000000002, "loss": 8.191, "mean_token_accuracy": 0.09745052307844163, "num_tokens": 683656.0, "step": 270 }, { "entropy": 8.583205032348634, "epoch": 0.031736872475476054, "grad_norm": 1.140625, "learning_rate": 0.00013700000000000002, "loss": 8.1635, "mean_token_accuracy": 0.10382118448615074, "num_tokens": 696629.0, "step": 275 }, { "entropy": 8.513082599639892, "epoch": 0.03231390652048471, "grad_norm": 0.85546875, "learning_rate": 0.0001395, "loss": 8.1849, "mean_token_accuracy": 0.0984301395714283, "num_tokens": 709053.0, "step": 280 }, { "entropy": 8.52897834777832, "epoch": 0.03289094056549336, "grad_norm": 0.86328125, "learning_rate": 0.00014199999999999998, "loss": 8.1378, "mean_token_accuracy": 0.101743233948946, "num_tokens": 721947.0, "step": 285 }, { "entropy": 8.485254192352295, "epoch": 0.03346797461050202, "grad_norm": 0.94921875, "learning_rate": 0.0001445, "loss": 8.1318, "mean_token_accuracy": 0.10095292180776597, "num_tokens": 734495.0, "step": 290 }, { "entropy": 8.4556489944458, "epoch": 0.034045008655510675, "grad_norm": 0.9296875, "learning_rate": 0.000147, "loss": 8.1574, "mean_token_accuracy": 0.09864982217550278, "num_tokens": 746965.0, "step": 295 }, { "entropy": 8.541684627532959, "epoch": 0.03462204270051933, "grad_norm": 0.94921875, "learning_rate": 0.0001495, "loss": 8.1759, "mean_token_accuracy": 0.09848161116242408, "num_tokens": 760105.0, "step": 300 }, { "entropy": 8.439905643463135, "epoch": 0.03519907674552799, "grad_norm": 0.92578125, "learning_rate": 0.000152, "loss": 8.0742, "mean_token_accuracy": 0.1082187220454216, "num_tokens": 771765.0, "step": 305 }, { "entropy": 8.54954652786255, "epoch": 0.03577611079053664, "grad_norm": 1.40625, "learning_rate": 0.00015450000000000001, "loss": 8.1565, "mean_token_accuracy": 0.10081454515457153, "num_tokens": 784895.0, "step": 310 }, { "entropy": 8.430934238433839, "epoch": 0.0363531448355453, "grad_norm": 1.109375, "learning_rate": 0.000157, "loss": 8.0908, "mean_token_accuracy": 0.10850713253021241, "num_tokens": 797139.0, "step": 315 }, { "entropy": 8.501363563537598, "epoch": 0.03693017888055395, "grad_norm": 0.8046875, "learning_rate": 0.0001595, "loss": 8.0515, "mean_token_accuracy": 0.11537543162703515, "num_tokens": 809169.0, "step": 320 }, { "entropy": 8.328963375091552, "epoch": 0.03750721292556261, "grad_norm": 0.94921875, "learning_rate": 0.000162, "loss": 8.1059, "mean_token_accuracy": 0.10505361780524254, "num_tokens": 821737.0, "step": 325 }, { "entropy": 8.49581003189087, "epoch": 0.038084246970571264, "grad_norm": 0.90234375, "learning_rate": 0.00016450000000000001, "loss": 8.019, "mean_token_accuracy": 0.1122775912284851, "num_tokens": 834365.0, "step": 330 }, { "entropy": 8.393208026885986, "epoch": 0.03866128101557992, "grad_norm": 1.0, "learning_rate": 0.00016700000000000002, "loss": 8.0675, "mean_token_accuracy": 0.10942035019397736, "num_tokens": 846445.0, "step": 335 }, { "entropy": 8.460633182525635, "epoch": 0.03923831506058857, "grad_norm": 0.875, "learning_rate": 0.00016950000000000003, "loss": 8.1142, "mean_token_accuracy": 0.10697392895817756, "num_tokens": 858558.0, "step": 340 }, { "entropy": 8.396363449096679, "epoch": 0.03981534910559723, "grad_norm": 0.9296875, "learning_rate": 0.00017199999999999998, "loss": 8.1058, "mean_token_accuracy": 0.10723683908581734, "num_tokens": 871209.0, "step": 345 }, { "entropy": 8.491197395324708, "epoch": 0.040392383150605886, "grad_norm": 0.9375, "learning_rate": 0.00017449999999999999, "loss": 8.0555, "mean_token_accuracy": 0.10949232503771782, "num_tokens": 883270.0, "step": 350 }, { "entropy": 8.352670478820801, "epoch": 0.04096941719561454, "grad_norm": 0.9609375, "learning_rate": 0.000177, "loss": 8.0601, "mean_token_accuracy": 0.10984272882342339, "num_tokens": 895468.0, "step": 355 }, { "entropy": 8.47718162536621, "epoch": 0.0415464512406232, "grad_norm": 0.99609375, "learning_rate": 0.0001795, "loss": 8.0213, "mean_token_accuracy": 0.11185759902000428, "num_tokens": 907900.0, "step": 360 }, { "entropy": 8.211096382141113, "epoch": 0.042123485285631854, "grad_norm": 1.078125, "learning_rate": 0.000182, "loss": 8.0331, "mean_token_accuracy": 0.11285770758986473, "num_tokens": 920036.0, "step": 365 }, { "entropy": 8.389335536956787, "epoch": 0.04270051933064051, "grad_norm": 1.0078125, "learning_rate": 0.0001845, "loss": 7.9946, "mean_token_accuracy": 0.11674289256334305, "num_tokens": 932525.0, "step": 370 }, { "entropy": 8.290297317504884, "epoch": 0.04327755337564916, "grad_norm": 1.0859375, "learning_rate": 0.000187, "loss": 7.9705, "mean_token_accuracy": 0.11729388907551766, "num_tokens": 943581.0, "step": 375 }, { "entropy": 8.457341861724853, "epoch": 0.04385458742065782, "grad_norm": 1.015625, "learning_rate": 0.0001895, "loss": 8.0767, "mean_token_accuracy": 0.10796716287732125, "num_tokens": 956270.0, "step": 380 }, { "entropy": 8.334104824066163, "epoch": 0.044431621465666475, "grad_norm": 0.9140625, "learning_rate": 0.000192, "loss": 8.0281, "mean_token_accuracy": 0.11211411207914353, "num_tokens": 967631.0, "step": 385 }, { "entropy": 8.407048511505128, "epoch": 0.04500865551067513, "grad_norm": 0.84765625, "learning_rate": 0.0001945, "loss": 8.037, "mean_token_accuracy": 0.10723293125629425, "num_tokens": 980999.0, "step": 390 }, { "entropy": 8.267741298675537, "epoch": 0.04558568955568378, "grad_norm": 0.96875, "learning_rate": 0.00019700000000000002, "loss": 7.9457, "mean_token_accuracy": 0.11497977301478386, "num_tokens": 993404.0, "step": 395 }, { "entropy": 8.311189937591553, "epoch": 0.04616272360069244, "grad_norm": 1.0078125, "learning_rate": 0.00019950000000000002, "loss": 7.959, "mean_token_accuracy": 0.11699348911643029, "num_tokens": 1006009.0, "step": 400 }, { "entropy": 8.301223659515381, "epoch": 0.0467397576457011, "grad_norm": 0.94921875, "learning_rate": 0.000202, "loss": 8.0537, "mean_token_accuracy": 0.1106877088546753, "num_tokens": 1019644.0, "step": 405 }, { "entropy": 8.281110191345215, "epoch": 0.04731679169070975, "grad_norm": 0.83203125, "learning_rate": 0.00020449999999999998, "loss": 7.9529, "mean_token_accuracy": 0.12168486937880515, "num_tokens": 1032196.0, "step": 410 }, { "entropy": 8.194720458984374, "epoch": 0.04789382573571841, "grad_norm": 1.1953125, "learning_rate": 0.000207, "loss": 7.9104, "mean_token_accuracy": 0.12571991384029388, "num_tokens": 1044211.0, "step": 415 }, { "entropy": 8.374266242980957, "epoch": 0.048470859780727064, "grad_norm": 0.921875, "learning_rate": 0.0002095, "loss": 7.9692, "mean_token_accuracy": 0.11775951310992241, "num_tokens": 1055743.0, "step": 420 }, { "entropy": 8.280481624603272, "epoch": 0.04904789382573572, "grad_norm": 0.85546875, "learning_rate": 0.000212, "loss": 7.9728, "mean_token_accuracy": 0.11407571211457253, "num_tokens": 1068550.0, "step": 425 }, { "entropy": 8.259190368652344, "epoch": 0.04962492787074437, "grad_norm": 0.90234375, "learning_rate": 0.0002145, "loss": 7.876, "mean_token_accuracy": 0.12458330690860749, "num_tokens": 1079878.0, "step": 430 }, { "entropy": 8.264352798461914, "epoch": 0.05020196191575303, "grad_norm": 1.109375, "learning_rate": 0.00021700000000000002, "loss": 7.9461, "mean_token_accuracy": 0.11022370159626008, "num_tokens": 1093331.0, "step": 435 }, { "entropy": 8.320549201965331, "epoch": 0.050778995960761686, "grad_norm": 0.94921875, "learning_rate": 0.0002195, "loss": 7.8988, "mean_token_accuracy": 0.12245648875832557, "num_tokens": 1105830.0, "step": 440 }, { "entropy": 8.242807865142822, "epoch": 0.05135603000577034, "grad_norm": 1.0, "learning_rate": 0.000222, "loss": 7.9022, "mean_token_accuracy": 0.1231141023337841, "num_tokens": 1118071.0, "step": 445 }, { "entropy": 8.150061178207398, "epoch": 0.05193306405077899, "grad_norm": 1.015625, "learning_rate": 0.0002245, "loss": 7.9205, "mean_token_accuracy": 0.11648782640695572, "num_tokens": 1129781.0, "step": 450 }, { "entropy": 8.264570999145509, "epoch": 0.052510098095787654, "grad_norm": 0.87890625, "learning_rate": 0.00022700000000000002, "loss": 7.9593, "mean_token_accuracy": 0.11766693964600564, "num_tokens": 1142750.0, "step": 455 }, { "entropy": 8.244252777099609, "epoch": 0.05308713214079631, "grad_norm": 1.015625, "learning_rate": 0.00022950000000000002, "loss": 7.8898, "mean_token_accuracy": 0.11929678991436958, "num_tokens": 1154314.0, "step": 460 }, { "entropy": 8.212209606170655, "epoch": 0.05366416618580496, "grad_norm": 0.88671875, "learning_rate": 0.00023200000000000003, "loss": 7.9087, "mean_token_accuracy": 0.12657537683844566, "num_tokens": 1167199.0, "step": 465 }, { "entropy": 8.202026081085204, "epoch": 0.054241200230813615, "grad_norm": 1.09375, "learning_rate": 0.00023449999999999998, "loss": 7.8846, "mean_token_accuracy": 0.12224558740854263, "num_tokens": 1179654.0, "step": 470 }, { "entropy": 8.187808513641357, "epoch": 0.054818234275822275, "grad_norm": 0.9296875, "learning_rate": 0.000237, "loss": 7.867, "mean_token_accuracy": 0.12207963541150094, "num_tokens": 1190713.0, "step": 475 }, { "entropy": 8.158800506591797, "epoch": 0.05539526832083093, "grad_norm": 0.89453125, "learning_rate": 0.0002395, "loss": 7.8509, "mean_token_accuracy": 0.12055787444114685, "num_tokens": 1203881.0, "step": 480 }, { "entropy": 8.259974384307862, "epoch": 0.05597230236583958, "grad_norm": 1.078125, "learning_rate": 0.000242, "loss": 7.9146, "mean_token_accuracy": 0.11428983137011528, "num_tokens": 1215795.0, "step": 485 }, { "entropy": 8.06658124923706, "epoch": 0.05654933641084824, "grad_norm": 0.98828125, "learning_rate": 0.0002445, "loss": 7.8294, "mean_token_accuracy": 0.12558024376630783, "num_tokens": 1227773.0, "step": 490 }, { "entropy": 8.268111038208009, "epoch": 0.0571263704558569, "grad_norm": 1.046875, "learning_rate": 0.000247, "loss": 7.8281, "mean_token_accuracy": 0.12732664570212365, "num_tokens": 1240217.0, "step": 495 }, { "entropy": 8.184942293167115, "epoch": 0.05770340450086555, "grad_norm": 1.375, "learning_rate": 0.0002495, "loss": 7.8963, "mean_token_accuracy": 0.12094444781541824, "num_tokens": 1253324.0, "step": 500 }, { "entropy": 8.097318315505982, "epoch": 0.058280438545874204, "grad_norm": 1.265625, "learning_rate": 0.000252, "loss": 7.8021, "mean_token_accuracy": 0.11756076738238334, "num_tokens": 1266007.0, "step": 505 }, { "entropy": 8.119937992095947, "epoch": 0.058857472590882864, "grad_norm": 0.9296875, "learning_rate": 0.0002545, "loss": 7.8449, "mean_token_accuracy": 0.12364009171724319, "num_tokens": 1278403.0, "step": 510 }, { "entropy": 8.165720081329345, "epoch": 0.05943450663589152, "grad_norm": 0.9609375, "learning_rate": 0.000257, "loss": 7.8565, "mean_token_accuracy": 0.12108651399612427, "num_tokens": 1290352.0, "step": 515 }, { "entropy": 8.166333532333374, "epoch": 0.06001154068090017, "grad_norm": 1.0546875, "learning_rate": 0.0002595, "loss": 7.8677, "mean_token_accuracy": 0.11767618358135223, "num_tokens": 1302304.0, "step": 520 }, { "entropy": 8.154673862457276, "epoch": 0.060588574725908825, "grad_norm": 1.0546875, "learning_rate": 0.000262, "loss": 7.8293, "mean_token_accuracy": 0.1254723496735096, "num_tokens": 1314014.0, "step": 525 }, { "entropy": 8.189765071868896, "epoch": 0.061165608770917486, "grad_norm": 1.03125, "learning_rate": 0.00026450000000000003, "loss": 7.8617, "mean_token_accuracy": 0.11876866742968559, "num_tokens": 1326751.0, "step": 530 }, { "entropy": 8.086573696136474, "epoch": 0.06174264281592614, "grad_norm": 1.109375, "learning_rate": 0.00026700000000000004, "loss": 7.7429, "mean_token_accuracy": 0.1276994377374649, "num_tokens": 1339070.0, "step": 535 }, { "entropy": 8.00021333694458, "epoch": 0.06231967686093479, "grad_norm": 1.0625, "learning_rate": 0.00026950000000000005, "loss": 7.7617, "mean_token_accuracy": 0.12492593899369239, "num_tokens": 1351345.0, "step": 540 }, { "entropy": 8.155957984924317, "epoch": 0.06289671090594345, "grad_norm": 0.984375, "learning_rate": 0.00027200000000000005, "loss": 7.8454, "mean_token_accuracy": 0.11729749515652657, "num_tokens": 1364331.0, "step": 545 }, { "entropy": 7.948654079437256, "epoch": 0.06347374495095211, "grad_norm": 0.91796875, "learning_rate": 0.0002745, "loss": 7.7274, "mean_token_accuracy": 0.1307520568370819, "num_tokens": 1377426.0, "step": 550 }, { "entropy": 8.21699333190918, "epoch": 0.06405077899596076, "grad_norm": 1.03125, "learning_rate": 0.000277, "loss": 7.8456, "mean_token_accuracy": 0.11890435740351676, "num_tokens": 1391553.0, "step": 555 }, { "entropy": 8.080363225936889, "epoch": 0.06462781304096941, "grad_norm": 1.3125, "learning_rate": 0.0002795, "loss": 7.83, "mean_token_accuracy": 0.12511808127164842, "num_tokens": 1405526.0, "step": 560 }, { "entropy": 8.142201614379882, "epoch": 0.06520484708597807, "grad_norm": 0.9375, "learning_rate": 0.00028199999999999997, "loss": 7.8219, "mean_token_accuracy": 0.12369688302278518, "num_tokens": 1417868.0, "step": 565 }, { "entropy": 7.928612327575683, "epoch": 0.06578188113098672, "grad_norm": 0.94140625, "learning_rate": 0.0002845, "loss": 7.7407, "mean_token_accuracy": 0.12715482115745544, "num_tokens": 1429907.0, "step": 570 }, { "entropy": 8.15863070487976, "epoch": 0.06635891517599539, "grad_norm": 1.0078125, "learning_rate": 0.000287, "loss": 7.751, "mean_token_accuracy": 0.12095296233892441, "num_tokens": 1442552.0, "step": 575 }, { "entropy": 8.045605039596557, "epoch": 0.06693594922100404, "grad_norm": 0.9453125, "learning_rate": 0.0002895, "loss": 7.8095, "mean_token_accuracy": 0.12216803878545761, "num_tokens": 1455717.0, "step": 580 }, { "entropy": 8.157436180114747, "epoch": 0.0675129832660127, "grad_norm": 0.98046875, "learning_rate": 0.000292, "loss": 7.8052, "mean_token_accuracy": 0.11941280439496041, "num_tokens": 1468263.0, "step": 585 }, { "entropy": 7.988013124465942, "epoch": 0.06809001731102135, "grad_norm": 1.0078125, "learning_rate": 0.0002945, "loss": 7.7479, "mean_token_accuracy": 0.12465541884303093, "num_tokens": 1481632.0, "step": 590 }, { "entropy": 8.01614761352539, "epoch": 0.06866705135603, "grad_norm": 1.1875, "learning_rate": 0.000297, "loss": 7.7005, "mean_token_accuracy": 0.12634204924106598, "num_tokens": 1495121.0, "step": 595 }, { "entropy": 7.969437456130981, "epoch": 0.06924408540103866, "grad_norm": 0.921875, "learning_rate": 0.0002995, "loss": 7.7509, "mean_token_accuracy": 0.1271022602915764, "num_tokens": 1507669.0, "step": 600 }, { "entropy": 8.026603889465331, "epoch": 0.06982111944604731, "grad_norm": 1.0859375, "learning_rate": 0.000302, "loss": 7.7853, "mean_token_accuracy": 0.12059543505311013, "num_tokens": 1520707.0, "step": 605 }, { "entropy": 7.99562668800354, "epoch": 0.07039815349105598, "grad_norm": 0.87109375, "learning_rate": 0.0003045, "loss": 7.696, "mean_token_accuracy": 0.12601862624287605, "num_tokens": 1532974.0, "step": 610 }, { "entropy": 7.974084091186524, "epoch": 0.07097518753606463, "grad_norm": 0.984375, "learning_rate": 0.000307, "loss": 7.682, "mean_token_accuracy": 0.12723494321107864, "num_tokens": 1544085.0, "step": 615 }, { "entropy": 7.9744525909423825, "epoch": 0.07155222158107329, "grad_norm": 0.94140625, "learning_rate": 0.0003095, "loss": 7.7045, "mean_token_accuracy": 0.1308353565633297, "num_tokens": 1556945.0, "step": 620 }, { "entropy": 7.941751766204834, "epoch": 0.07212925562608194, "grad_norm": 0.9609375, "learning_rate": 0.000312, "loss": 7.6518, "mean_token_accuracy": 0.13126163482666015, "num_tokens": 1569570.0, "step": 625 }, { "entropy": 7.943236637115478, "epoch": 0.0727062896710906, "grad_norm": 0.93359375, "learning_rate": 0.0003145, "loss": 7.7317, "mean_token_accuracy": 0.12612373903393745, "num_tokens": 1582529.0, "step": 630 }, { "entropy": 7.964515161514282, "epoch": 0.07328332371609925, "grad_norm": 0.9921875, "learning_rate": 0.000317, "loss": 7.6504, "mean_token_accuracy": 0.13465792536735535, "num_tokens": 1595976.0, "step": 635 }, { "entropy": 7.939415836334229, "epoch": 0.0738603577611079, "grad_norm": 1.0234375, "learning_rate": 0.0003195, "loss": 7.6945, "mean_token_accuracy": 0.12841632589697838, "num_tokens": 1609093.0, "step": 640 }, { "entropy": 7.928447484970093, "epoch": 0.07443739180611655, "grad_norm": 0.9609375, "learning_rate": 0.000322, "loss": 7.6804, "mean_token_accuracy": 0.12497531697154045, "num_tokens": 1622233.0, "step": 645 }, { "entropy": 8.020674419403075, "epoch": 0.07501442585112522, "grad_norm": 0.87109375, "learning_rate": 0.00032450000000000003, "loss": 7.728, "mean_token_accuracy": 0.1262144438922405, "num_tokens": 1635354.0, "step": 650 }, { "entropy": 7.9559979915618895, "epoch": 0.07559145989613388, "grad_norm": 1.5, "learning_rate": 0.00032700000000000003, "loss": 7.7083, "mean_token_accuracy": 0.12276372462511062, "num_tokens": 1648223.0, "step": 655 }, { "entropy": 7.932180786132813, "epoch": 0.07616849394114253, "grad_norm": 1.0, "learning_rate": 0.00032950000000000004, "loss": 7.695, "mean_token_accuracy": 0.12331497594714165, "num_tokens": 1661652.0, "step": 660 }, { "entropy": 7.91778302192688, "epoch": 0.07674552798615118, "grad_norm": 1.203125, "learning_rate": 0.00033200000000000005, "loss": 7.598, "mean_token_accuracy": 0.13565101027488707, "num_tokens": 1674778.0, "step": 665 }, { "entropy": 7.959203672409058, "epoch": 0.07732256203115984, "grad_norm": 1.0546875, "learning_rate": 0.00033450000000000005, "loss": 7.6853, "mean_token_accuracy": 0.1240819051861763, "num_tokens": 1686966.0, "step": 670 }, { "entropy": 7.902504253387451, "epoch": 0.07789959607616849, "grad_norm": 1.203125, "learning_rate": 0.000337, "loss": 7.6563, "mean_token_accuracy": 0.13484344854950905, "num_tokens": 1699979.0, "step": 675 }, { "entropy": 7.8624763011932375, "epoch": 0.07847663012117714, "grad_norm": 0.9375, "learning_rate": 0.0003395, "loss": 7.5949, "mean_token_accuracy": 0.12701699286699294, "num_tokens": 1712306.0, "step": 680 }, { "entropy": 7.84359302520752, "epoch": 0.07905366416618581, "grad_norm": 1.078125, "learning_rate": 0.000342, "loss": 7.6427, "mean_token_accuracy": 0.12926456406712533, "num_tokens": 1724670.0, "step": 685 }, { "entropy": 7.9609299659729, "epoch": 0.07963069821119446, "grad_norm": 1.0, "learning_rate": 0.00034449999999999997, "loss": 7.7196, "mean_token_accuracy": 0.12713819071650506, "num_tokens": 1736987.0, "step": 690 }, { "entropy": 7.934039688110351, "epoch": 0.08020773225620312, "grad_norm": 0.94140625, "learning_rate": 0.000347, "loss": 7.6931, "mean_token_accuracy": 0.126790152490139, "num_tokens": 1750587.0, "step": 695 }, { "entropy": 7.82976803779602, "epoch": 0.08078476630121177, "grad_norm": 1.15625, "learning_rate": 0.0003495, "loss": 7.6356, "mean_token_accuracy": 0.12186335176229476, "num_tokens": 1763432.0, "step": 700 }, { "entropy": 7.907923984527588, "epoch": 0.08136180034622043, "grad_norm": 0.94140625, "learning_rate": 0.000352, "loss": 7.5615, "mean_token_accuracy": 0.13086110800504686, "num_tokens": 1777705.0, "step": 705 }, { "entropy": 7.8514200210571286, "epoch": 0.08193883439122908, "grad_norm": 1.03125, "learning_rate": 0.0003545, "loss": 7.6198, "mean_token_accuracy": 0.13134256303310393, "num_tokens": 1790673.0, "step": 710 }, { "entropy": 7.8153650760650635, "epoch": 0.08251586843623773, "grad_norm": 0.9609375, "learning_rate": 0.000357, "loss": 7.6619, "mean_token_accuracy": 0.12541591748595238, "num_tokens": 1803258.0, "step": 715 }, { "entropy": 7.950216341018677, "epoch": 0.0830929024812464, "grad_norm": 0.98046875, "learning_rate": 0.0003595, "loss": 7.6293, "mean_token_accuracy": 0.12917107716202736, "num_tokens": 1816534.0, "step": 720 }, { "entropy": 7.836187028884888, "epoch": 0.08366993652625505, "grad_norm": 1.0390625, "learning_rate": 0.000362, "loss": 7.5809, "mean_token_accuracy": 0.12518987879157067, "num_tokens": 1828335.0, "step": 725 }, { "entropy": 7.771939277648926, "epoch": 0.08424697057126371, "grad_norm": 1.0, "learning_rate": 0.0003645, "loss": 7.5899, "mean_token_accuracy": 0.134027336537838, "num_tokens": 1839327.0, "step": 730 }, { "entropy": 7.924041652679444, "epoch": 0.08482400461627236, "grad_norm": 1.0078125, "learning_rate": 0.000367, "loss": 7.6636, "mean_token_accuracy": 0.12406575530767441, "num_tokens": 1851168.0, "step": 735 }, { "entropy": 7.836169338226318, "epoch": 0.08540103866128101, "grad_norm": 0.9296875, "learning_rate": 0.0003695, "loss": 7.6255, "mean_token_accuracy": 0.1251351036131382, "num_tokens": 1863875.0, "step": 740 }, { "entropy": 7.870956707000732, "epoch": 0.08597807270628967, "grad_norm": 1.09375, "learning_rate": 0.000372, "loss": 7.5523, "mean_token_accuracy": 0.12497681528329849, "num_tokens": 1876613.0, "step": 745 }, { "entropy": 7.877524900436401, "epoch": 0.08655510675129832, "grad_norm": 0.92578125, "learning_rate": 0.0003745, "loss": 7.6508, "mean_token_accuracy": 0.12530745193362236, "num_tokens": 1890311.0, "step": 750 }, { "entropy": 7.7698094844818115, "epoch": 0.08713214079630698, "grad_norm": 1.03125, "learning_rate": 0.000377, "loss": 7.6137, "mean_token_accuracy": 0.12359317764639854, "num_tokens": 1902925.0, "step": 755 }, { "entropy": 7.891464757919311, "epoch": 0.08770917484131564, "grad_norm": 1.046875, "learning_rate": 0.0003795, "loss": 7.5955, "mean_token_accuracy": 0.12298363819718361, "num_tokens": 1915186.0, "step": 760 }, { "entropy": 7.836678600311279, "epoch": 0.0882862088863243, "grad_norm": 1.0078125, "learning_rate": 0.000382, "loss": 7.5912, "mean_token_accuracy": 0.1303836189210415, "num_tokens": 1927184.0, "step": 765 }, { "entropy": 7.795164489746094, "epoch": 0.08886324293133295, "grad_norm": 1.015625, "learning_rate": 0.0003845, "loss": 7.5682, "mean_token_accuracy": 0.1343364216387272, "num_tokens": 1940275.0, "step": 770 }, { "entropy": 7.860983610153198, "epoch": 0.0894402769763416, "grad_norm": 0.9765625, "learning_rate": 0.00038700000000000003, "loss": 7.6057, "mean_token_accuracy": 0.1272793047130108, "num_tokens": 1952583.0, "step": 775 }, { "entropy": 7.830558156967163, "epoch": 0.09001731102135026, "grad_norm": 0.875, "learning_rate": 0.00038950000000000003, "loss": 7.5118, "mean_token_accuracy": 0.12738451659679412, "num_tokens": 1965219.0, "step": 780 }, { "entropy": 7.71030740737915, "epoch": 0.09059434506635891, "grad_norm": 0.91796875, "learning_rate": 0.00039200000000000004, "loss": 7.5456, "mean_token_accuracy": 0.13100098669528962, "num_tokens": 1977193.0, "step": 785 }, { "entropy": 7.909699869155884, "epoch": 0.09117137911136756, "grad_norm": 0.98828125, "learning_rate": 0.00039450000000000005, "loss": 7.4505, "mean_token_accuracy": 0.13711674883961678, "num_tokens": 1988955.0, "step": 790 }, { "entropy": 7.730215835571289, "epoch": 0.09174841315637623, "grad_norm": 0.87109375, "learning_rate": 0.00039700000000000005, "loss": 7.5988, "mean_token_accuracy": 0.12491806000471115, "num_tokens": 2001647.0, "step": 795 }, { "entropy": 7.779358577728272, "epoch": 0.09232544720138489, "grad_norm": 0.90625, "learning_rate": 0.0003995, "loss": 7.5131, "mean_token_accuracy": 0.13641507402062417, "num_tokens": 2015185.0, "step": 800 }, { "entropy": 7.82036943435669, "epoch": 0.09290248124639354, "grad_norm": 1.0078125, "learning_rate": 0.000402, "loss": 7.6135, "mean_token_accuracy": 0.12739918157458305, "num_tokens": 2027257.0, "step": 805 }, { "entropy": 7.603882265090943, "epoch": 0.0934795152914022, "grad_norm": 1.0078125, "learning_rate": 0.0004045, "loss": 7.4517, "mean_token_accuracy": 0.13969765827059746, "num_tokens": 2040716.0, "step": 810 }, { "entropy": 7.850926303863526, "epoch": 0.09405654933641085, "grad_norm": 1.21875, "learning_rate": 0.00040699999999999997, "loss": 7.5796, "mean_token_accuracy": 0.12389181852340699, "num_tokens": 2053240.0, "step": 815 }, { "entropy": 7.774610376358032, "epoch": 0.0946335833814195, "grad_norm": 1.1875, "learning_rate": 0.0004095, "loss": 7.5473, "mean_token_accuracy": 0.12548824697732924, "num_tokens": 2065693.0, "step": 820 }, { "entropy": 7.716372299194336, "epoch": 0.09521061742642815, "grad_norm": 1.046875, "learning_rate": 0.000412, "loss": 7.5014, "mean_token_accuracy": 0.1397644318640232, "num_tokens": 2077649.0, "step": 825 }, { "entropy": 7.756848621368408, "epoch": 0.09578765147143682, "grad_norm": 0.9765625, "learning_rate": 0.0004145, "loss": 7.5233, "mean_token_accuracy": 0.1290776789188385, "num_tokens": 2090780.0, "step": 830 }, { "entropy": 7.749186420440674, "epoch": 0.09636468551644548, "grad_norm": 0.90625, "learning_rate": 0.000417, "loss": 7.5311, "mean_token_accuracy": 0.13137806951999664, "num_tokens": 2104096.0, "step": 835 }, { "entropy": 7.7773672580719, "epoch": 0.09694171956145413, "grad_norm": 1.046875, "learning_rate": 0.0004195, "loss": 7.527, "mean_token_accuracy": 0.12679293751716614, "num_tokens": 2117157.0, "step": 840 }, { "entropy": 7.73278284072876, "epoch": 0.09751875360646278, "grad_norm": 0.84765625, "learning_rate": 0.000422, "loss": 7.4858, "mean_token_accuracy": 0.12687554210424423, "num_tokens": 2129309.0, "step": 845 }, { "entropy": 7.768968677520752, "epoch": 0.09809578765147144, "grad_norm": 0.9765625, "learning_rate": 0.0004245, "loss": 7.5307, "mean_token_accuracy": 0.13160400986671447, "num_tokens": 2142344.0, "step": 850 }, { "entropy": 7.714959239959716, "epoch": 0.09867282169648009, "grad_norm": 1.140625, "learning_rate": 0.000427, "loss": 7.5686, "mean_token_accuracy": 0.1227949745953083, "num_tokens": 2155059.0, "step": 855 }, { "entropy": 7.734045362472534, "epoch": 0.09924985574148874, "grad_norm": 1.0, "learning_rate": 0.0004295, "loss": 7.567, "mean_token_accuracy": 0.12749878615140914, "num_tokens": 2168901.0, "step": 860 }, { "entropy": 7.731997871398926, "epoch": 0.0998268897864974, "grad_norm": 0.9140625, "learning_rate": 0.000432, "loss": 7.3702, "mean_token_accuracy": 0.14134701043367387, "num_tokens": 2180953.0, "step": 865 }, { "entropy": 7.591903018951416, "epoch": 0.10040392383150606, "grad_norm": 1.1328125, "learning_rate": 0.0004345, "loss": 7.4942, "mean_token_accuracy": 0.1371511548757553, "num_tokens": 2194097.0, "step": 870 }, { "entropy": 7.695831298828125, "epoch": 0.10098095787651472, "grad_norm": 0.9921875, "learning_rate": 0.000437, "loss": 7.4334, "mean_token_accuracy": 0.13365770354866982, "num_tokens": 2206475.0, "step": 875 }, { "entropy": 7.78225154876709, "epoch": 0.10155799192152337, "grad_norm": 0.91015625, "learning_rate": 0.0004395, "loss": 7.4645, "mean_token_accuracy": 0.1278185375034809, "num_tokens": 2220006.0, "step": 880 }, { "entropy": 7.65887417793274, "epoch": 0.10213502596653203, "grad_norm": 1.03125, "learning_rate": 0.000442, "loss": 7.5351, "mean_token_accuracy": 0.12350780516862869, "num_tokens": 2234082.0, "step": 885 }, { "entropy": 7.669657945632935, "epoch": 0.10271206001154068, "grad_norm": 1.0390625, "learning_rate": 0.0004445, "loss": 7.5227, "mean_token_accuracy": 0.12489003017544746, "num_tokens": 2246871.0, "step": 890 }, { "entropy": 7.669128274917602, "epoch": 0.10328909405654933, "grad_norm": 0.8515625, "learning_rate": 0.000447, "loss": 7.4567, "mean_token_accuracy": 0.13411386385560037, "num_tokens": 2260172.0, "step": 895 }, { "entropy": 7.77032732963562, "epoch": 0.10386612810155799, "grad_norm": 1.0234375, "learning_rate": 0.00044950000000000003, "loss": 7.5057, "mean_token_accuracy": 0.11949166432023048, "num_tokens": 2272848.0, "step": 900 }, { "entropy": 7.673234939575195, "epoch": 0.10444316214656665, "grad_norm": 1.0625, "learning_rate": 0.00045200000000000004, "loss": 7.452, "mean_token_accuracy": 0.12722696289420127, "num_tokens": 2285673.0, "step": 905 }, { "entropy": 7.741328477859497, "epoch": 0.10502019619157531, "grad_norm": 0.9375, "learning_rate": 0.00045450000000000004, "loss": 7.489, "mean_token_accuracy": 0.12697241380810736, "num_tokens": 2298459.0, "step": 910 }, { "entropy": 7.641606569290161, "epoch": 0.10559723023658396, "grad_norm": 0.84765625, "learning_rate": 0.00045700000000000005, "loss": 7.448, "mean_token_accuracy": 0.13017196208238602, "num_tokens": 2311226.0, "step": 915 }, { "entropy": 7.574088287353516, "epoch": 0.10617426428159261, "grad_norm": 1.0234375, "learning_rate": 0.00045950000000000006, "loss": 7.3847, "mean_token_accuracy": 0.1277943417429924, "num_tokens": 2323481.0, "step": 920 }, { "entropy": 7.646576309204102, "epoch": 0.10675129832660127, "grad_norm": 0.8984375, "learning_rate": 0.000462, "loss": 7.414, "mean_token_accuracy": 0.1307280629873276, "num_tokens": 2336181.0, "step": 925 }, { "entropy": 7.636479043960572, "epoch": 0.10732833237160992, "grad_norm": 0.94140625, "learning_rate": 0.0004645, "loss": 7.3716, "mean_token_accuracy": 0.13296475633978844, "num_tokens": 2348941.0, "step": 930 }, { "entropy": 7.661097192764283, "epoch": 0.10790536641661858, "grad_norm": 0.91796875, "learning_rate": 0.000467, "loss": 7.3294, "mean_token_accuracy": 0.12712401077151297, "num_tokens": 2361618.0, "step": 935 }, { "entropy": 7.540031290054321, "epoch": 0.10848240046162723, "grad_norm": 1.03125, "learning_rate": 0.0004695, "loss": 7.2806, "mean_token_accuracy": 0.14269692525267602, "num_tokens": 2376108.0, "step": 940 }, { "entropy": 7.573352289199829, "epoch": 0.1090594345066359, "grad_norm": 0.91015625, "learning_rate": 0.000472, "loss": 7.382, "mean_token_accuracy": 0.13606224954128265, "num_tokens": 2387774.0, "step": 945 }, { "entropy": 7.616125917434692, "epoch": 0.10963646855164455, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 7.4187, "mean_token_accuracy": 0.13490517437458038, "num_tokens": 2400816.0, "step": 950 }, { "entropy": 7.538399982452392, "epoch": 0.1102135025966532, "grad_norm": 0.88671875, "learning_rate": 0.000477, "loss": 7.3513, "mean_token_accuracy": 0.13397277891635895, "num_tokens": 2412970.0, "step": 955 }, { "entropy": 7.531917762756348, "epoch": 0.11079053664166186, "grad_norm": 0.953125, "learning_rate": 0.0004795, "loss": 7.3595, "mean_token_accuracy": 0.13522982075810433, "num_tokens": 2424622.0, "step": 960 }, { "entropy": 7.65097861289978, "epoch": 0.11136757068667051, "grad_norm": 0.83203125, "learning_rate": 0.000482, "loss": 7.4384, "mean_token_accuracy": 0.13235584348440171, "num_tokens": 2437293.0, "step": 965 }, { "entropy": 7.556930351257324, "epoch": 0.11194460473167916, "grad_norm": 1.0859375, "learning_rate": 0.0004845, "loss": 7.3101, "mean_token_accuracy": 0.13271362110972404, "num_tokens": 2449934.0, "step": 970 }, { "entropy": 7.62783989906311, "epoch": 0.11252163877668782, "grad_norm": 0.8828125, "learning_rate": 0.000487, "loss": 7.3979, "mean_token_accuracy": 0.12683349400758742, "num_tokens": 2463139.0, "step": 975 }, { "entropy": 7.5757801055908205, "epoch": 0.11309867282169649, "grad_norm": 1.109375, "learning_rate": 0.0004895, "loss": 7.4281, "mean_token_accuracy": 0.1270056739449501, "num_tokens": 2474273.0, "step": 980 }, { "entropy": 7.627140283584595, "epoch": 0.11367570686670514, "grad_norm": 1.078125, "learning_rate": 0.000492, "loss": 7.381, "mean_token_accuracy": 0.1371190808713436, "num_tokens": 2486643.0, "step": 985 }, { "entropy": 7.516345596313476, "epoch": 0.1142527409117138, "grad_norm": 1.0, "learning_rate": 0.0004945, "loss": 7.3769, "mean_token_accuracy": 0.12875159829854965, "num_tokens": 2499018.0, "step": 990 }, { "entropy": 7.49490532875061, "epoch": 0.11482977495672245, "grad_norm": 0.9609375, "learning_rate": 0.000497, "loss": 7.3419, "mean_token_accuracy": 0.1379355698823929, "num_tokens": 2510463.0, "step": 995 }, { "entropy": 7.580066394805908, "epoch": 0.1154068090017311, "grad_norm": 0.87109375, "learning_rate": 0.0004995, "loss": 7.3689, "mean_token_accuracy": 0.13574447557330133, "num_tokens": 2522671.0, "step": 1000 }, { "entropy": 7.525820398330689, "epoch": 0.11598384304673975, "grad_norm": 0.91796875, "learning_rate": 0.0004999999975783157, "loss": 7.3706, "mean_token_accuracy": 0.1312769442796707, "num_tokens": 2534508.0, "step": 1005 }, { "entropy": 7.571441793441773, "epoch": 0.11656087709174841, "grad_norm": 0.89453125, "learning_rate": 0.0004999999877402236, "loss": 7.3274, "mean_token_accuracy": 0.13784680590033532, "num_tokens": 2546804.0, "step": 1010 }, { "entropy": 7.521267461776733, "epoch": 0.11713791113675708, "grad_norm": 0.875, "learning_rate": 0.0004999999703343686, "loss": 7.3429, "mean_token_accuracy": 0.13090137392282486, "num_tokens": 2558786.0, "step": 1015 }, { "entropy": 7.574562740325928, "epoch": 0.11771494518176573, "grad_norm": 0.94140625, "learning_rate": 0.0004999999453607515, "loss": 7.3165, "mean_token_accuracy": 0.13034487813711165, "num_tokens": 2570834.0, "step": 1020 }, { "entropy": 7.461473798751831, "epoch": 0.11829197922677438, "grad_norm": 0.9921875, "learning_rate": 0.0004999999128193729, "loss": 7.2709, "mean_token_accuracy": 0.14077538400888442, "num_tokens": 2583342.0, "step": 1025 }, { "entropy": 7.511537408828735, "epoch": 0.11886901327178304, "grad_norm": 1.015625, "learning_rate": 0.000499999872710234, "loss": 7.3162, "mean_token_accuracy": 0.1330413155257702, "num_tokens": 2594878.0, "step": 1030 }, { "entropy": 7.390342903137207, "epoch": 0.11944604731679169, "grad_norm": 0.9453125, "learning_rate": 0.0004999998250333361, "loss": 7.281, "mean_token_accuracy": 0.13540845960378647, "num_tokens": 2607070.0, "step": 1035 }, { "entropy": 7.526187515258789, "epoch": 0.12002308136180034, "grad_norm": 0.890625, "learning_rate": 0.000499999769788681, "loss": 7.3157, "mean_token_accuracy": 0.13957726508378981, "num_tokens": 2620761.0, "step": 1040 }, { "entropy": 7.498535776138306, "epoch": 0.120600115406809, "grad_norm": 0.8046875, "learning_rate": 0.0004999997069762703, "loss": 7.3307, "mean_token_accuracy": 0.1318868264555931, "num_tokens": 2634161.0, "step": 1045 }, { "entropy": 7.453407907485962, "epoch": 0.12117714945181765, "grad_norm": 0.8984375, "learning_rate": 0.0004999996365961062, "loss": 7.2874, "mean_token_accuracy": 0.1383284404873848, "num_tokens": 2647459.0, "step": 1050 }, { "entropy": 7.446234273910522, "epoch": 0.12175418349682632, "grad_norm": 0.92578125, "learning_rate": 0.0004999995586481912, "loss": 7.2872, "mean_token_accuracy": 0.1340254984796047, "num_tokens": 2660840.0, "step": 1055 }, { "entropy": 7.483492088317871, "epoch": 0.12233121754183497, "grad_norm": 0.97265625, "learning_rate": 0.0004999994731325276, "loss": 7.2865, "mean_token_accuracy": 0.13337128460407258, "num_tokens": 2672673.0, "step": 1060 }, { "entropy": 7.395563697814941, "epoch": 0.12290825158684363, "grad_norm": 0.890625, "learning_rate": 0.0004999993800491187, "loss": 7.2987, "mean_token_accuracy": 0.13419368714094163, "num_tokens": 2685744.0, "step": 1065 }, { "entropy": 7.416986179351807, "epoch": 0.12348528563185228, "grad_norm": 0.90625, "learning_rate": 0.0004999992793979672, "loss": 7.2196, "mean_token_accuracy": 0.14943781048059462, "num_tokens": 2697068.0, "step": 1070 }, { "entropy": 7.524578285217285, "epoch": 0.12406231967686093, "grad_norm": 1.1171875, "learning_rate": 0.0004999991711790769, "loss": 7.3467, "mean_token_accuracy": 0.12948699221014975, "num_tokens": 2710418.0, "step": 1075 }, { "entropy": 7.54997706413269, "epoch": 0.12463935372186959, "grad_norm": 0.89453125, "learning_rate": 0.0004999990553924511, "loss": 7.3065, "mean_token_accuracy": 0.12690478786826134, "num_tokens": 2722440.0, "step": 1080 }, { "entropy": 7.381335258483887, "epoch": 0.12521638776687824, "grad_norm": 0.8359375, "learning_rate": 0.0004999989320380939, "loss": 7.2963, "mean_token_accuracy": 0.12917414531111718, "num_tokens": 2735486.0, "step": 1085 }, { "entropy": 7.532785177230835, "epoch": 0.1257934218118869, "grad_norm": 0.90625, "learning_rate": 0.0004999988011160094, "loss": 7.3223, "mean_token_accuracy": 0.13123588562011718, "num_tokens": 2747620.0, "step": 1090 }, { "entropy": 7.407538604736328, "epoch": 0.12637045585689555, "grad_norm": 0.92578125, "learning_rate": 0.000499998662626202, "loss": 7.2571, "mean_token_accuracy": 0.1341471828520298, "num_tokens": 2760987.0, "step": 1095 }, { "entropy": 7.483826351165772, "epoch": 0.12694748990190421, "grad_norm": 0.98046875, "learning_rate": 0.0004999985165686764, "loss": 7.234, "mean_token_accuracy": 0.1353903256356716, "num_tokens": 2773161.0, "step": 1100 }, { "entropy": 7.336683225631714, "epoch": 0.12752452394691285, "grad_norm": 0.93359375, "learning_rate": 0.0004999983629434373, "loss": 7.1573, "mean_token_accuracy": 0.15311394929885863, "num_tokens": 2786179.0, "step": 1105 }, { "entropy": 7.440242195129395, "epoch": 0.12810155799192152, "grad_norm": 0.90625, "learning_rate": 0.0004999982017504901, "loss": 7.1926, "mean_token_accuracy": 0.14265231788158417, "num_tokens": 2798859.0, "step": 1110 }, { "entropy": 7.385885190963745, "epoch": 0.1286785920369302, "grad_norm": 0.859375, "learning_rate": 0.0004999980329898401, "loss": 7.2944, "mean_token_accuracy": 0.1360294461250305, "num_tokens": 2813048.0, "step": 1115 }, { "entropy": 7.456379127502442, "epoch": 0.12925562608193883, "grad_norm": 0.953125, "learning_rate": 0.000499997856661493, "loss": 7.2612, "mean_token_accuracy": 0.13587961345911026, "num_tokens": 2826032.0, "step": 1120 }, { "entropy": 7.430348825454712, "epoch": 0.1298326601269475, "grad_norm": 0.984375, "learning_rate": 0.000499997672765455, "loss": 7.2962, "mean_token_accuracy": 0.13529185801744462, "num_tokens": 2839253.0, "step": 1125 }, { "entropy": 7.3566066265106205, "epoch": 0.13040969417195614, "grad_norm": 1.2109375, "learning_rate": 0.0004999974813017318, "loss": 7.2183, "mean_token_accuracy": 0.14149424508213998, "num_tokens": 2852542.0, "step": 1130 }, { "entropy": 7.3935285091400145, "epoch": 0.1309867282169648, "grad_norm": 0.97265625, "learning_rate": 0.0004999972822703301, "loss": 7.2395, "mean_token_accuracy": 0.14146022573113443, "num_tokens": 2863967.0, "step": 1135 }, { "entropy": 7.422988605499268, "epoch": 0.13156376226197344, "grad_norm": 0.91015625, "learning_rate": 0.0004999970756712567, "loss": 7.3171, "mean_token_accuracy": 0.13306807354092598, "num_tokens": 2876141.0, "step": 1140 }, { "entropy": 7.2979803562164305, "epoch": 0.1321407963069821, "grad_norm": 0.90234375, "learning_rate": 0.0004999968615045183, "loss": 7.145, "mean_token_accuracy": 0.14133854061365128, "num_tokens": 2888395.0, "step": 1145 }, { "entropy": 7.431983804702758, "epoch": 0.13271783035199078, "grad_norm": 0.9453125, "learning_rate": 0.0004999966397701222, "loss": 7.3261, "mean_token_accuracy": 0.12834407463669778, "num_tokens": 2902399.0, "step": 1150 }, { "entropy": 7.406958770751953, "epoch": 0.13329486439699942, "grad_norm": 0.9609375, "learning_rate": 0.0004999964104680759, "loss": 7.0835, "mean_token_accuracy": 0.1402672976255417, "num_tokens": 2914999.0, "step": 1155 }, { "entropy": 7.348841714859009, "epoch": 0.13387189844200809, "grad_norm": 1.0, "learning_rate": 0.0004999961735983871, "loss": 7.0785, "mean_token_accuracy": 0.1498357504606247, "num_tokens": 2928091.0, "step": 1160 }, { "entropy": 7.33998703956604, "epoch": 0.13444893248701673, "grad_norm": 0.82421875, "learning_rate": 0.0004999959291610639, "loss": 7.2138, "mean_token_accuracy": 0.1341881737112999, "num_tokens": 2940840.0, "step": 1165 }, { "entropy": 7.289854049682617, "epoch": 0.1350259665320254, "grad_norm": 1.0, "learning_rate": 0.0004999956771561143, "loss": 7.1303, "mean_token_accuracy": 0.14412761703133584, "num_tokens": 2952980.0, "step": 1170 }, { "entropy": 7.357520866394043, "epoch": 0.13560300057703403, "grad_norm": 0.87109375, "learning_rate": 0.0004999954175835469, "loss": 7.1748, "mean_token_accuracy": 0.13631198480725287, "num_tokens": 2965437.0, "step": 1175 }, { "entropy": 7.3787942886352536, "epoch": 0.1361800346220427, "grad_norm": 0.91015625, "learning_rate": 0.0004999951504433703, "loss": 7.2047, "mean_token_accuracy": 0.1348996601998806, "num_tokens": 2978077.0, "step": 1180 }, { "entropy": 7.40587363243103, "epoch": 0.13675706866705137, "grad_norm": 0.921875, "learning_rate": 0.0004999948757355935, "loss": 7.298, "mean_token_accuracy": 0.13351393342018128, "num_tokens": 2990498.0, "step": 1185 }, { "entropy": 7.413915586471558, "epoch": 0.13733410271206, "grad_norm": 0.86328125, "learning_rate": 0.000499994593460226, "loss": 7.2412, "mean_token_accuracy": 0.1355881556868553, "num_tokens": 3002784.0, "step": 1190 }, { "entropy": 7.372391653060913, "epoch": 0.13791113675706868, "grad_norm": 0.9140625, "learning_rate": 0.0004999943036172771, "loss": 7.1807, "mean_token_accuracy": 0.13228997811675072, "num_tokens": 3015689.0, "step": 1195 }, { "entropy": 7.241599178314209, "epoch": 0.13848817080207732, "grad_norm": 0.984375, "learning_rate": 0.0004999940062067565, "loss": 7.1264, "mean_token_accuracy": 0.1455356404185295, "num_tokens": 3026623.0, "step": 1200 }, { "entropy": 7.376918649673462, "epoch": 0.13906520484708598, "grad_norm": 0.99609375, "learning_rate": 0.0004999937012286742, "loss": 7.1615, "mean_token_accuracy": 0.1412371888756752, "num_tokens": 3039769.0, "step": 1205 }, { "entropy": 7.27626667022705, "epoch": 0.13964223889209462, "grad_norm": 0.96875, "learning_rate": 0.0004999933886830405, "loss": 7.1505, "mean_token_accuracy": 0.13528102561831473, "num_tokens": 3052044.0, "step": 1210 }, { "entropy": 7.345494079589844, "epoch": 0.1402192729371033, "grad_norm": 0.91015625, "learning_rate": 0.000499993068569866, "loss": 7.1241, "mean_token_accuracy": 0.1391813077032566, "num_tokens": 3063937.0, "step": 1215 }, { "entropy": 7.187998628616333, "epoch": 0.14079630698211196, "grad_norm": 1.09375, "learning_rate": 0.0004999927408891614, "loss": 7.0939, "mean_token_accuracy": 0.14361393451690674, "num_tokens": 3076645.0, "step": 1220 }, { "entropy": 7.401137399673462, "epoch": 0.1413733410271206, "grad_norm": 0.94921875, "learning_rate": 0.0004999924056409378, "loss": 7.1542, "mean_token_accuracy": 0.13744900077581407, "num_tokens": 3088985.0, "step": 1225 }, { "entropy": 7.271087980270385, "epoch": 0.14195037507212926, "grad_norm": 0.875, "learning_rate": 0.0004999920628252063, "loss": 7.1543, "mean_token_accuracy": 0.1385358177125454, "num_tokens": 3101270.0, "step": 1230 }, { "entropy": 7.236308813095093, "epoch": 0.1425274091171379, "grad_norm": 0.85546875, "learning_rate": 0.0004999917124419785, "loss": 7.1713, "mean_token_accuracy": 0.13507955446839331, "num_tokens": 3115420.0, "step": 1235 }, { "entropy": 7.414693069458008, "epoch": 0.14310444316214657, "grad_norm": 0.90625, "learning_rate": 0.0004999913544912664, "loss": 7.1106, "mean_token_accuracy": 0.13970131129026414, "num_tokens": 3126176.0, "step": 1240 }, { "entropy": 7.252271461486816, "epoch": 0.1436814772071552, "grad_norm": 0.828125, "learning_rate": 0.0004999909889730817, "loss": 7.1516, "mean_token_accuracy": 0.14178458228707314, "num_tokens": 3139136.0, "step": 1245 }, { "entropy": 7.280838823318481, "epoch": 0.14425851125216388, "grad_norm": 0.91015625, "learning_rate": 0.0004999906158874368, "loss": 7.1044, "mean_token_accuracy": 0.1472743645310402, "num_tokens": 3152036.0, "step": 1250 }, { "entropy": 7.349875354766846, "epoch": 0.14483554529717255, "grad_norm": 0.90234375, "learning_rate": 0.0004999902352343444, "loss": 7.1386, "mean_token_accuracy": 0.14143830314278602, "num_tokens": 3164060.0, "step": 1255 }, { "entropy": 7.355139827728271, "epoch": 0.1454125793421812, "grad_norm": 0.95703125, "learning_rate": 0.0004999898470138171, "loss": 7.206, "mean_token_accuracy": 0.12975897416472434, "num_tokens": 3176410.0, "step": 1260 }, { "entropy": 7.291885662078857, "epoch": 0.14598961338718985, "grad_norm": 0.8125, "learning_rate": 0.0004999894512258681, "loss": 7.2261, "mean_token_accuracy": 0.13479177728295327, "num_tokens": 3189784.0, "step": 1265 }, { "entropy": 7.3698536396026615, "epoch": 0.1465666474321985, "grad_norm": 0.83984375, "learning_rate": 0.0004999890478705107, "loss": 7.1471, "mean_token_accuracy": 0.1365978240966797, "num_tokens": 3202274.0, "step": 1270 }, { "entropy": 7.3492168426513675, "epoch": 0.14714368147720716, "grad_norm": 0.90625, "learning_rate": 0.0004999886369477585, "loss": 7.2021, "mean_token_accuracy": 0.13651041984558104, "num_tokens": 3215593.0, "step": 1275 }, { "entropy": 7.264506483078003, "epoch": 0.1477207155222158, "grad_norm": 0.8984375, "learning_rate": 0.0004999882184576251, "loss": 7.1145, "mean_token_accuracy": 0.1358187846839428, "num_tokens": 3228307.0, "step": 1280 }, { "entropy": 7.262033987045288, "epoch": 0.14829774956722447, "grad_norm": 0.7890625, "learning_rate": 0.0004999877924001248, "loss": 7.0714, "mean_token_accuracy": 0.13908419981598855, "num_tokens": 3241676.0, "step": 1285 }, { "entropy": 7.289368486404419, "epoch": 0.1488747836122331, "grad_norm": 0.91015625, "learning_rate": 0.0004999873587752718, "loss": 7.1412, "mean_token_accuracy": 0.13665730655193328, "num_tokens": 3255190.0, "step": 1290 }, { "entropy": 7.299326705932617, "epoch": 0.14945181765724178, "grad_norm": 0.875, "learning_rate": 0.0004999869175830808, "loss": 7.1635, "mean_token_accuracy": 0.13522787094116212, "num_tokens": 3268236.0, "step": 1295 }, { "entropy": 7.349583387374878, "epoch": 0.15002885170225044, "grad_norm": 0.91796875, "learning_rate": 0.0004999864688235666, "loss": 7.1786, "mean_token_accuracy": 0.13588001057505608, "num_tokens": 3281316.0, "step": 1300 }, { "entropy": 7.291733837127685, "epoch": 0.15060588574725908, "grad_norm": 0.8515625, "learning_rate": 0.0004999860124967442, "loss": 7.0853, "mean_token_accuracy": 0.1390770271420479, "num_tokens": 3293517.0, "step": 1305 }, { "entropy": 7.185279273986817, "epoch": 0.15118291979226775, "grad_norm": 0.84765625, "learning_rate": 0.0004999855486026291, "loss": 7.0715, "mean_token_accuracy": 0.14518356174230576, "num_tokens": 3306814.0, "step": 1310 }, { "entropy": 7.301711988449097, "epoch": 0.1517599538372764, "grad_norm": 1.0625, "learning_rate": 0.0004999850771412369, "loss": 7.1333, "mean_token_accuracy": 0.13459300100803376, "num_tokens": 3318722.0, "step": 1315 }, { "entropy": 7.199785852432251, "epoch": 0.15233698788228506, "grad_norm": 1.53125, "learning_rate": 0.0004999845981125832, "loss": 7.0873, "mean_token_accuracy": 0.14142397046089172, "num_tokens": 3331212.0, "step": 1320 }, { "entropy": 7.31465106010437, "epoch": 0.1529140219272937, "grad_norm": 0.81640625, "learning_rate": 0.0004999841115166844, "loss": 7.0661, "mean_token_accuracy": 0.13654675781726838, "num_tokens": 3343999.0, "step": 1325 }, { "entropy": 7.124961471557617, "epoch": 0.15349105597230236, "grad_norm": 0.91015625, "learning_rate": 0.0004999836173535568, "loss": 7.0068, "mean_token_accuracy": 0.14172771871089934, "num_tokens": 3356281.0, "step": 1330 }, { "entropy": 7.201707267761231, "epoch": 0.15406809001731103, "grad_norm": 0.94140625, "learning_rate": 0.0004999831156232169, "loss": 7.0726, "mean_token_accuracy": 0.1406794235110283, "num_tokens": 3369370.0, "step": 1335 }, { "entropy": 7.341475009918213, "epoch": 0.15464512406231967, "grad_norm": 0.8515625, "learning_rate": 0.0004999826063256818, "loss": 7.2012, "mean_token_accuracy": 0.13309285268187523, "num_tokens": 3382400.0, "step": 1340 }, { "entropy": 7.232538366317749, "epoch": 0.15522215810732834, "grad_norm": 0.9140625, "learning_rate": 0.0004999820894609683, "loss": 7.0778, "mean_token_accuracy": 0.13890645131468773, "num_tokens": 3393666.0, "step": 1345 }, { "entropy": 7.243199300765991, "epoch": 0.15579919215233698, "grad_norm": 0.8046875, "learning_rate": 0.0004999815650290941, "loss": 7.0914, "mean_token_accuracy": 0.1401012994349003, "num_tokens": 3405920.0, "step": 1350 }, { "entropy": 7.1591578960418705, "epoch": 0.15637622619734565, "grad_norm": 0.97265625, "learning_rate": 0.0004999810330300766, "loss": 6.9923, "mean_token_accuracy": 0.14642595648765563, "num_tokens": 3417886.0, "step": 1355 }, { "entropy": 7.254940557479858, "epoch": 0.1569532602423543, "grad_norm": 0.828125, "learning_rate": 0.000499980493463934, "loss": 7.1075, "mean_token_accuracy": 0.13476622179150582, "num_tokens": 3430626.0, "step": 1360 }, { "entropy": 7.202736520767212, "epoch": 0.15753029428736295, "grad_norm": 0.9453125, "learning_rate": 0.0004999799463306841, "loss": 7.0076, "mean_token_accuracy": 0.1388716422021389, "num_tokens": 3443248.0, "step": 1365 }, { "entropy": 7.213499069213867, "epoch": 0.15810732833237162, "grad_norm": 0.9140625, "learning_rate": 0.0004999793916303455, "loss": 7.0503, "mean_token_accuracy": 0.13839739933609962, "num_tokens": 3456163.0, "step": 1370 }, { "entropy": 7.167108821868896, "epoch": 0.15868436237738026, "grad_norm": 0.98828125, "learning_rate": 0.0004999788293629368, "loss": 7.0754, "mean_token_accuracy": 0.13633116707205772, "num_tokens": 3468862.0, "step": 1375 }, { "entropy": 7.2402849197387695, "epoch": 0.15926139642238893, "grad_norm": 0.90234375, "learning_rate": 0.000499978259528477, "loss": 7.0663, "mean_token_accuracy": 0.14658810272812844, "num_tokens": 3481516.0, "step": 1380 }, { "entropy": 7.265804767608643, "epoch": 0.15983843046739757, "grad_norm": 0.87109375, "learning_rate": 0.0004999776821269852, "loss": 7.1273, "mean_token_accuracy": 0.12971169799566268, "num_tokens": 3493063.0, "step": 1385 }, { "entropy": 7.229140663146973, "epoch": 0.16041546451240624, "grad_norm": 0.83203125, "learning_rate": 0.0004999770971584807, "loss": 7.0123, "mean_token_accuracy": 0.13699770867824554, "num_tokens": 3505460.0, "step": 1390 }, { "entropy": 7.235083723068238, "epoch": 0.16099249855741488, "grad_norm": 0.828125, "learning_rate": 0.0004999765046229834, "loss": 7.1218, "mean_token_accuracy": 0.13258355781435965, "num_tokens": 3519232.0, "step": 1395 }, { "entropy": 7.22713418006897, "epoch": 0.16156953260242354, "grad_norm": 0.90625, "learning_rate": 0.000499975904520513, "loss": 7.0295, "mean_token_accuracy": 0.1445997752249241, "num_tokens": 3531759.0, "step": 1400 }, { "entropy": 7.201732730865478, "epoch": 0.1621465666474322, "grad_norm": 0.8984375, "learning_rate": 0.00049997529685109, "loss": 6.9829, "mean_token_accuracy": 0.15084661841392516, "num_tokens": 3543457.0, "step": 1405 }, { "entropy": 7.160426235198974, "epoch": 0.16272360069244085, "grad_norm": 0.92578125, "learning_rate": 0.0004999746816147344, "loss": 7.1195, "mean_token_accuracy": 0.1298399582505226, "num_tokens": 3557036.0, "step": 1410 }, { "entropy": 7.306451225280762, "epoch": 0.16330063473744952, "grad_norm": 0.89453125, "learning_rate": 0.0004999740588114673, "loss": 7.0716, "mean_token_accuracy": 0.1405071273446083, "num_tokens": 3569415.0, "step": 1415 }, { "entropy": 7.171466588973999, "epoch": 0.16387766878245816, "grad_norm": 0.96484375, "learning_rate": 0.0004999734284413095, "loss": 7.0696, "mean_token_accuracy": 0.13537402525544168, "num_tokens": 3581452.0, "step": 1420 }, { "entropy": 7.184612178802491, "epoch": 0.16445470282746683, "grad_norm": 0.89453125, "learning_rate": 0.000499972790504282, "loss": 7.094, "mean_token_accuracy": 0.13849470168352127, "num_tokens": 3593482.0, "step": 1425 }, { "entropy": 7.202459335327148, "epoch": 0.16503173687247547, "grad_norm": 0.9765625, "learning_rate": 0.0004999721450004067, "loss": 7.0864, "mean_token_accuracy": 0.13760560154914855, "num_tokens": 3606062.0, "step": 1430 }, { "entropy": 7.222452545166016, "epoch": 0.16560877091748413, "grad_norm": 0.93359375, "learning_rate": 0.0004999714919297049, "loss": 7.0499, "mean_token_accuracy": 0.14111001044511795, "num_tokens": 3619210.0, "step": 1435 }, { "entropy": 7.180074310302734, "epoch": 0.1661858049624928, "grad_norm": 0.8203125, "learning_rate": 0.0004999708312921987, "loss": 7.0919, "mean_token_accuracy": 0.13837566673755647, "num_tokens": 3631952.0, "step": 1440 }, { "entropy": 7.17976598739624, "epoch": 0.16676283900750144, "grad_norm": 0.84765625, "learning_rate": 0.0004999701630879103, "loss": 6.9734, "mean_token_accuracy": 0.14263298735022545, "num_tokens": 3644864.0, "step": 1445 }, { "entropy": 7.166555690765381, "epoch": 0.1673398730525101, "grad_norm": 0.87890625, "learning_rate": 0.0004999694873168623, "loss": 7.0507, "mean_token_accuracy": 0.1378322072327137, "num_tokens": 3657504.0, "step": 1450 }, { "entropy": 7.19564905166626, "epoch": 0.16791690709751875, "grad_norm": 0.9140625, "learning_rate": 0.0004999688039790773, "loss": 6.9587, "mean_token_accuracy": 0.14702803492546082, "num_tokens": 3670304.0, "step": 1455 }, { "entropy": 7.150408220291138, "epoch": 0.16849394114252741, "grad_norm": 0.96484375, "learning_rate": 0.0004999681130745784, "loss": 6.9859, "mean_token_accuracy": 0.13595322594046594, "num_tokens": 3681503.0, "step": 1460 }, { "entropy": 7.162327766418457, "epoch": 0.16907097518753605, "grad_norm": 0.953125, "learning_rate": 0.0004999674146033888, "loss": 7.0123, "mean_token_accuracy": 0.137976536154747, "num_tokens": 3693248.0, "step": 1465 }, { "entropy": 7.136591291427612, "epoch": 0.16964800923254472, "grad_norm": 0.90625, "learning_rate": 0.0004999667085655318, "loss": 7.0248, "mean_token_accuracy": 0.14202336519956588, "num_tokens": 3705285.0, "step": 1470 }, { "entropy": 7.1525966167449955, "epoch": 0.1702250432775534, "grad_norm": 0.84375, "learning_rate": 0.0004999659949610313, "loss": 7.0489, "mean_token_accuracy": 0.13094842061400414, "num_tokens": 3719025.0, "step": 1475 }, { "entropy": 7.2398560523986815, "epoch": 0.17080207732256203, "grad_norm": 0.8984375, "learning_rate": 0.0004999652737899114, "loss": 7.0371, "mean_token_accuracy": 0.14026156663894654, "num_tokens": 3732054.0, "step": 1480 }, { "entropy": 7.175600671768189, "epoch": 0.1713791113675707, "grad_norm": 0.92578125, "learning_rate": 0.0004999645450521963, "loss": 7.0023, "mean_token_accuracy": 0.141888265311718, "num_tokens": 3744080.0, "step": 1485 }, { "entropy": 7.114497375488281, "epoch": 0.17195614541257934, "grad_norm": 0.7890625, "learning_rate": 0.0004999638087479104, "loss": 7.0391, "mean_token_accuracy": 0.13951010257005692, "num_tokens": 3756371.0, "step": 1490 }, { "entropy": 7.245286512374878, "epoch": 0.172533179457588, "grad_norm": 0.91796875, "learning_rate": 0.0004999630648770786, "loss": 6.9683, "mean_token_accuracy": 0.1364215262234211, "num_tokens": 3769307.0, "step": 1495 }, { "entropy": 7.008484745025635, "epoch": 0.17311021350259664, "grad_norm": 0.98828125, "learning_rate": 0.0004999623134397257, "loss": 6.9637, "mean_token_accuracy": 0.14434833228588104, "num_tokens": 3782826.0, "step": 1500 }, { "entropy": 7.155062961578369, "epoch": 0.1736872475476053, "grad_norm": 0.8515625, "learning_rate": 0.0004999615544358774, "loss": 6.969, "mean_token_accuracy": 0.13818738386034965, "num_tokens": 3794566.0, "step": 1505 }, { "entropy": 7.102244281768799, "epoch": 0.17426428159261395, "grad_norm": 0.90234375, "learning_rate": 0.0004999607878655587, "loss": 7.0508, "mean_token_accuracy": 0.13246384710073472, "num_tokens": 3807058.0, "step": 1510 }, { "entropy": 7.190773010253906, "epoch": 0.17484131563762262, "grad_norm": 0.87109375, "learning_rate": 0.0004999600137287958, "loss": 6.9966, "mean_token_accuracy": 0.1451525256037712, "num_tokens": 3819836.0, "step": 1515 }, { "entropy": 7.112970066070557, "epoch": 0.17541834968263129, "grad_norm": 0.91015625, "learning_rate": 0.0004999592320256146, "loss": 7.0526, "mean_token_accuracy": 0.13325869366526605, "num_tokens": 3832081.0, "step": 1520 }, { "entropy": 7.19920711517334, "epoch": 0.17599538372763993, "grad_norm": 0.86328125, "learning_rate": 0.0004999584427560412, "loss": 6.9666, "mean_token_accuracy": 0.14759944379329681, "num_tokens": 3843279.0, "step": 1525 }, { "entropy": 7.110972738265991, "epoch": 0.1765724177726486, "grad_norm": 0.9140625, "learning_rate": 0.0004999576459201024, "loss": 7.0377, "mean_token_accuracy": 0.14277849197387696, "num_tokens": 3855479.0, "step": 1530 }, { "entropy": 7.166525030136109, "epoch": 0.17714945181765723, "grad_norm": 0.84375, "learning_rate": 0.000499956841517825, "loss": 7.0261, "mean_token_accuracy": 0.14007299840450288, "num_tokens": 3868111.0, "step": 1535 }, { "entropy": 7.039232683181763, "epoch": 0.1777264858626659, "grad_norm": 0.9609375, "learning_rate": 0.000499956029549236, "loss": 6.9523, "mean_token_accuracy": 0.14354307875037192, "num_tokens": 3880062.0, "step": 1540 }, { "entropy": 7.2218320846557615, "epoch": 0.17830351990767454, "grad_norm": 0.8515625, "learning_rate": 0.0004999552100143625, "loss": 7.038, "mean_token_accuracy": 0.1351063035428524, "num_tokens": 3892293.0, "step": 1545 }, { "entropy": 7.088453531265259, "epoch": 0.1788805539526832, "grad_norm": 0.91796875, "learning_rate": 0.0004999543829132324, "loss": 6.9011, "mean_token_accuracy": 0.14455311074852945, "num_tokens": 3904549.0, "step": 1550 }, { "entropy": 7.0796609878540036, "epoch": 0.17945758799769188, "grad_norm": 0.95703125, "learning_rate": 0.0004999535482458734, "loss": 6.952, "mean_token_accuracy": 0.14381684213876725, "num_tokens": 3916693.0, "step": 1555 }, { "entropy": 7.087669706344604, "epoch": 0.18003462204270052, "grad_norm": 0.90234375, "learning_rate": 0.0004999527060123135, "loss": 6.9651, "mean_token_accuracy": 0.13298058956861497, "num_tokens": 3930488.0, "step": 1560 }, { "entropy": 7.125672006607056, "epoch": 0.18061165608770918, "grad_norm": 0.8984375, "learning_rate": 0.0004999518562125811, "loss": 6.9626, "mean_token_accuracy": 0.14101526886224747, "num_tokens": 3942353.0, "step": 1565 }, { "entropy": 7.161968660354614, "epoch": 0.18118869013271782, "grad_norm": 0.8984375, "learning_rate": 0.0004999509988467047, "loss": 7.0103, "mean_token_accuracy": 0.13919673189520837, "num_tokens": 3953868.0, "step": 1570 }, { "entropy": 7.124320602416992, "epoch": 0.1817657241777265, "grad_norm": 0.890625, "learning_rate": 0.0004999501339147132, "loss": 7.0217, "mean_token_accuracy": 0.1360984094440937, "num_tokens": 3965148.0, "step": 1575 }, { "entropy": 7.110309076309204, "epoch": 0.18234275822273513, "grad_norm": 0.94140625, "learning_rate": 0.0004999492614166357, "loss": 6.9888, "mean_token_accuracy": 0.14489941596984862, "num_tokens": 3977323.0, "step": 1580 }, { "entropy": 7.14143214225769, "epoch": 0.1829197922677438, "grad_norm": 0.85546875, "learning_rate": 0.0004999483813525014, "loss": 6.9486, "mean_token_accuracy": 0.14665654599666594, "num_tokens": 3990076.0, "step": 1585 }, { "entropy": 7.0736024379730225, "epoch": 0.18349682631275246, "grad_norm": 0.8984375, "learning_rate": 0.0004999474937223403, "loss": 6.958, "mean_token_accuracy": 0.13847637176513672, "num_tokens": 4001996.0, "step": 1590 }, { "entropy": 7.1584230899810795, "epoch": 0.1840738603577611, "grad_norm": 0.875, "learning_rate": 0.0004999465985261818, "loss": 6.996, "mean_token_accuracy": 0.13838272169232368, "num_tokens": 4015095.0, "step": 1595 }, { "entropy": 7.085082769393921, "epoch": 0.18465089440276977, "grad_norm": 0.87109375, "learning_rate": 0.0004999456957640562, "loss": 6.8885, "mean_token_accuracy": 0.14849510788917542, "num_tokens": 4028633.0, "step": 1600 }, { "entropy": 7.059274530410766, "epoch": 0.1852279284477784, "grad_norm": 0.85546875, "learning_rate": 0.0004999447854359939, "loss": 6.9902, "mean_token_accuracy": 0.14084767922759056, "num_tokens": 4042265.0, "step": 1605 }, { "entropy": 7.04382438659668, "epoch": 0.18580496249278708, "grad_norm": 0.8828125, "learning_rate": 0.0004999438675420255, "loss": 6.9434, "mean_token_accuracy": 0.14098646268248557, "num_tokens": 4054467.0, "step": 1610 }, { "entropy": 7.100906753540039, "epoch": 0.18638199653779572, "grad_norm": 1.140625, "learning_rate": 0.0004999429420821818, "loss": 6.9422, "mean_token_accuracy": 0.14708167761564256, "num_tokens": 4068053.0, "step": 1615 }, { "entropy": 6.988407993316651, "epoch": 0.1869590305828044, "grad_norm": 1.015625, "learning_rate": 0.000499942009056494, "loss": 6.9174, "mean_token_accuracy": 0.14443018585443496, "num_tokens": 4080867.0, "step": 1620 }, { "entropy": 7.123555755615234, "epoch": 0.18753606462781305, "grad_norm": 1.0078125, "learning_rate": 0.0004999410684649935, "loss": 6.9813, "mean_token_accuracy": 0.13821664601564407, "num_tokens": 4093228.0, "step": 1625 }, { "entropy": 7.086485910415649, "epoch": 0.1881130986728217, "grad_norm": 0.87109375, "learning_rate": 0.0004999401203077119, "loss": 6.9764, "mean_token_accuracy": 0.14208749383687974, "num_tokens": 4104929.0, "step": 1630 }, { "entropy": 7.062161016464233, "epoch": 0.18869013271783036, "grad_norm": 0.8203125, "learning_rate": 0.000499939164584681, "loss": 6.9907, "mean_token_accuracy": 0.15021519139409065, "num_tokens": 4119445.0, "step": 1635 }, { "entropy": 7.106227540969849, "epoch": 0.189267166762839, "grad_norm": 1.125, "learning_rate": 0.0004999382012959331, "loss": 6.8918, "mean_token_accuracy": 0.15079083889722825, "num_tokens": 4131558.0, "step": 1640 }, { "entropy": 7.123133182525635, "epoch": 0.18984420080784767, "grad_norm": 0.9140625, "learning_rate": 0.0004999372304415005, "loss": 7.0313, "mean_token_accuracy": 0.12920064106583595, "num_tokens": 4144566.0, "step": 1645 }, { "entropy": 7.113665962219239, "epoch": 0.1904212348528563, "grad_norm": 0.98046875, "learning_rate": 0.0004999362520214159, "loss": 6.9219, "mean_token_accuracy": 0.14697587639093398, "num_tokens": 4157295.0, "step": 1650 }, { "entropy": 7.081795692443848, "epoch": 0.19099826889786498, "grad_norm": 0.859375, "learning_rate": 0.0004999352660357122, "loss": 6.9574, "mean_token_accuracy": 0.1411465436220169, "num_tokens": 4170229.0, "step": 1655 }, { "entropy": 7.1123281955719, "epoch": 0.19157530294287364, "grad_norm": 0.87109375, "learning_rate": 0.0004999342724844226, "loss": 6.9703, "mean_token_accuracy": 0.13845267817378043, "num_tokens": 4182906.0, "step": 1660 }, { "entropy": 7.087953901290893, "epoch": 0.19215233698788228, "grad_norm": 0.875, "learning_rate": 0.0004999332713675804, "loss": 6.9325, "mean_token_accuracy": 0.143193506449461, "num_tokens": 4195556.0, "step": 1665 }, { "entropy": 7.084608936309815, "epoch": 0.19272937103289095, "grad_norm": 0.86328125, "learning_rate": 0.0004999322626852193, "loss": 6.902, "mean_token_accuracy": 0.13993172571063042, "num_tokens": 4207616.0, "step": 1670 }, { "entropy": 7.025543546676635, "epoch": 0.1933064050778996, "grad_norm": 0.828125, "learning_rate": 0.0004999312464373734, "loss": 6.8576, "mean_token_accuracy": 0.14821547120809556, "num_tokens": 4219299.0, "step": 1675 }, { "entropy": 7.017240190505982, "epoch": 0.19388343912290826, "grad_norm": 0.92578125, "learning_rate": 0.0004999302226240767, "loss": 6.997, "mean_token_accuracy": 0.13786116614937782, "num_tokens": 4232098.0, "step": 1680 }, { "entropy": 7.080112934112549, "epoch": 0.1944604731679169, "grad_norm": 0.98828125, "learning_rate": 0.0004999291912453637, "loss": 6.8995, "mean_token_accuracy": 0.14469338953495026, "num_tokens": 4243879.0, "step": 1685 }, { "entropy": 7.064555072784424, "epoch": 0.19503750721292556, "grad_norm": 0.92578125, "learning_rate": 0.0004999281523012691, "loss": 6.9828, "mean_token_accuracy": 0.13740749657154083, "num_tokens": 4256507.0, "step": 1690 }, { "entropy": 7.218221855163574, "epoch": 0.1956145412579342, "grad_norm": 0.875, "learning_rate": 0.0004999271057918278, "loss": 7.0398, "mean_token_accuracy": 0.13457229733467102, "num_tokens": 4270763.0, "step": 1695 }, { "entropy": 7.035730075836182, "epoch": 0.19619157530294287, "grad_norm": 0.8515625, "learning_rate": 0.0004999260517170751, "loss": 6.9131, "mean_token_accuracy": 0.14340217858552934, "num_tokens": 4284380.0, "step": 1700 }, { "entropy": 7.1246764183044435, "epoch": 0.19676860934795154, "grad_norm": 0.8828125, "learning_rate": 0.0004999249900770463, "loss": 7.0215, "mean_token_accuracy": 0.13842824175953866, "num_tokens": 4297812.0, "step": 1705 }, { "entropy": 7.021434783935547, "epoch": 0.19734564339296018, "grad_norm": 1.0703125, "learning_rate": 0.0004999239208717772, "loss": 6.9875, "mean_token_accuracy": 0.14540473818778993, "num_tokens": 4310374.0, "step": 1710 }, { "entropy": 7.130036401748657, "epoch": 0.19792267743796885, "grad_norm": 0.953125, "learning_rate": 0.0004999228441013037, "loss": 6.9861, "mean_token_accuracy": 0.13793584629893302, "num_tokens": 4322330.0, "step": 1715 }, { "entropy": 7.092807817459106, "epoch": 0.1984997114829775, "grad_norm": 0.80859375, "learning_rate": 0.000499921759765662, "loss": 6.9437, "mean_token_accuracy": 0.14130837395787238, "num_tokens": 4335204.0, "step": 1720 }, { "entropy": 6.928855037689209, "epoch": 0.19907674552798615, "grad_norm": 0.90234375, "learning_rate": 0.0004999206678648888, "loss": 6.8285, "mean_token_accuracy": 0.14999809116125107, "num_tokens": 4347339.0, "step": 1725 }, { "entropy": 7.080965518951416, "epoch": 0.1996537795729948, "grad_norm": 1.71875, "learning_rate": 0.0004999195683990206, "loss": 6.8898, "mean_token_accuracy": 0.14809404462575912, "num_tokens": 4360273.0, "step": 1730 }, { "entropy": 7.013464021682739, "epoch": 0.20023081361800346, "grad_norm": 0.94921875, "learning_rate": 0.0004999184613680945, "loss": 6.9012, "mean_token_accuracy": 0.14106058850884437, "num_tokens": 4373424.0, "step": 1735 }, { "entropy": 7.049986457824707, "epoch": 0.20080784766301213, "grad_norm": 0.92578125, "learning_rate": 0.0004999173467721476, "loss": 6.8544, "mean_token_accuracy": 0.15058322101831437, "num_tokens": 4386125.0, "step": 1740 }, { "entropy": 7.018032741546631, "epoch": 0.20138488170802077, "grad_norm": 0.9140625, "learning_rate": 0.0004999162246112175, "loss": 6.9365, "mean_token_accuracy": 0.13854823932051658, "num_tokens": 4399214.0, "step": 1745 }, { "entropy": 6.9998067855834964, "epoch": 0.20196191575302944, "grad_norm": 0.88671875, "learning_rate": 0.0004999150948853419, "loss": 6.8127, "mean_token_accuracy": 0.14680370092391967, "num_tokens": 4411282.0, "step": 1750 }, { "entropy": 6.969420385360718, "epoch": 0.20253894979803808, "grad_norm": 0.96484375, "learning_rate": 0.0004999139575945587, "loss": 6.909, "mean_token_accuracy": 0.14443379119038582, "num_tokens": 4423448.0, "step": 1755 }, { "entropy": 7.101949882507324, "epoch": 0.20311598384304674, "grad_norm": 0.875, "learning_rate": 0.0004999128127389065, "loss": 6.8176, "mean_token_accuracy": 0.15111797004938127, "num_tokens": 4436498.0, "step": 1760 }, { "entropy": 6.992865753173828, "epoch": 0.20369301788805538, "grad_norm": 0.89453125, "learning_rate": 0.0004999116603184233, "loss": 6.8342, "mean_token_accuracy": 0.1466807797551155, "num_tokens": 4448641.0, "step": 1765 }, { "entropy": 6.9575080394744875, "epoch": 0.20427005193306405, "grad_norm": 0.91015625, "learning_rate": 0.0004999105003331482, "loss": 6.8404, "mean_token_accuracy": 0.1423793762922287, "num_tokens": 4460539.0, "step": 1770 }, { "entropy": 7.0623860359191895, "epoch": 0.20484708597807272, "grad_norm": 0.8515625, "learning_rate": 0.0004999093327831202, "loss": 6.8898, "mean_token_accuracy": 0.14088162109255792, "num_tokens": 4472487.0, "step": 1775 }, { "entropy": 6.952205657958984, "epoch": 0.20542412002308136, "grad_norm": 0.90234375, "learning_rate": 0.0004999081576683784, "loss": 6.8802, "mean_token_accuracy": 0.1421337030827999, "num_tokens": 4485164.0, "step": 1780 }, { "entropy": 7.1306853771209715, "epoch": 0.20600115406809003, "grad_norm": 0.84375, "learning_rate": 0.0004999069749889626, "loss": 6.8973, "mean_token_accuracy": 0.14712294787168503, "num_tokens": 4497708.0, "step": 1785 }, { "entropy": 6.940166759490967, "epoch": 0.20657818811309867, "grad_norm": 0.875, "learning_rate": 0.0004999057847449123, "loss": 6.9329, "mean_token_accuracy": 0.1391274891793728, "num_tokens": 4510648.0, "step": 1790 }, { "entropy": 7.065713214874267, "epoch": 0.20715522215810733, "grad_norm": 0.859375, "learning_rate": 0.0004999045869362678, "loss": 6.8511, "mean_token_accuracy": 0.14565493836998938, "num_tokens": 4522699.0, "step": 1795 }, { "entropy": 6.939832353591919, "epoch": 0.20773225620311597, "grad_norm": 0.88671875, "learning_rate": 0.000499903381563069, "loss": 6.8936, "mean_token_accuracy": 0.13873664960265158, "num_tokens": 4536060.0, "step": 1800 }, { "entropy": 6.97990312576294, "epoch": 0.20830929024812464, "grad_norm": 0.8515625, "learning_rate": 0.0004999021686253568, "loss": 6.8257, "mean_token_accuracy": 0.13769187703728675, "num_tokens": 4549876.0, "step": 1805 }, { "entropy": 7.080778312683106, "epoch": 0.2088863242931333, "grad_norm": 0.8203125, "learning_rate": 0.0004999009481231719, "loss": 6.8655, "mean_token_accuracy": 0.14449936226010324, "num_tokens": 4563638.0, "step": 1810 }, { "entropy": 6.9409098625183105, "epoch": 0.20946335833814195, "grad_norm": 0.91796875, "learning_rate": 0.0004998997200565553, "loss": 6.8057, "mean_token_accuracy": 0.14341058060526848, "num_tokens": 4575396.0, "step": 1815 }, { "entropy": 6.935875415802002, "epoch": 0.21004039238315061, "grad_norm": 0.87109375, "learning_rate": 0.0004998984844255483, "loss": 6.8199, "mean_token_accuracy": 0.14724263399839402, "num_tokens": 4587261.0, "step": 1820 }, { "entropy": 7.076818370819092, "epoch": 0.21061742642815925, "grad_norm": 0.78125, "learning_rate": 0.0004998972412301925, "loss": 6.9409, "mean_token_accuracy": 0.14100464209914207, "num_tokens": 4600086.0, "step": 1825 }, { "entropy": 7.006335687637329, "epoch": 0.21119446047316792, "grad_norm": 0.8359375, "learning_rate": 0.0004998959904705297, "loss": 6.8993, "mean_token_accuracy": 0.14008133336901665, "num_tokens": 4612320.0, "step": 1830 }, { "entropy": 6.99210262298584, "epoch": 0.21177149451817656, "grad_norm": 0.95703125, "learning_rate": 0.0004998947321466021, "loss": 6.8464, "mean_token_accuracy": 0.14648700058460234, "num_tokens": 4623545.0, "step": 1835 }, { "entropy": 6.954314517974853, "epoch": 0.21234852856318523, "grad_norm": 0.9453125, "learning_rate": 0.0004998934662584518, "loss": 6.7498, "mean_token_accuracy": 0.1578306920826435, "num_tokens": 4637223.0, "step": 1840 }, { "entropy": 6.826448059082031, "epoch": 0.2129255626081939, "grad_norm": 0.91796875, "learning_rate": 0.0004998921928061214, "loss": 6.837, "mean_token_accuracy": 0.14694164842367172, "num_tokens": 4649748.0, "step": 1845 }, { "entropy": 7.0238566398620605, "epoch": 0.21350259665320254, "grad_norm": 0.765625, "learning_rate": 0.0004998909117896539, "loss": 6.8732, "mean_token_accuracy": 0.1458170548081398, "num_tokens": 4662441.0, "step": 1850 }, { "entropy": 6.895988988876343, "epoch": 0.2140796306982112, "grad_norm": 0.984375, "learning_rate": 0.0004998896232090922, "loss": 6.8337, "mean_token_accuracy": 0.15489335879683494, "num_tokens": 4675546.0, "step": 1855 }, { "entropy": 7.177361154556275, "epoch": 0.21465666474321984, "grad_norm": 0.90234375, "learning_rate": 0.0004998883270644798, "loss": 6.9068, "mean_token_accuracy": 0.13811369463801385, "num_tokens": 4687601.0, "step": 1860 }, { "entropy": 6.91638216972351, "epoch": 0.2152336987882285, "grad_norm": 0.90234375, "learning_rate": 0.0004998870233558602, "loss": 6.7837, "mean_token_accuracy": 0.15353625565767287, "num_tokens": 4699336.0, "step": 1865 }, { "entropy": 6.911949300765992, "epoch": 0.21581073283323715, "grad_norm": 0.80859375, "learning_rate": 0.0004998857120832774, "loss": 6.9744, "mean_token_accuracy": 0.13845321610569955, "num_tokens": 4714312.0, "step": 1870 }, { "entropy": 6.956019687652588, "epoch": 0.21638776687824582, "grad_norm": 0.84375, "learning_rate": 0.0004998843932467751, "loss": 6.7036, "mean_token_accuracy": 0.15298319831490517, "num_tokens": 4726436.0, "step": 1875 }, { "entropy": 6.97105393409729, "epoch": 0.21696480092325446, "grad_norm": 1.0078125, "learning_rate": 0.0004998830668463982, "loss": 6.9324, "mean_token_accuracy": 0.13379157483577728, "num_tokens": 4739821.0, "step": 1880 }, { "entropy": 7.089961147308349, "epoch": 0.21754183496826313, "grad_norm": 0.84765625, "learning_rate": 0.0004998817328821909, "loss": 6.9187, "mean_token_accuracy": 0.13890728428959848, "num_tokens": 4752701.0, "step": 1885 }, { "entropy": 6.965564870834351, "epoch": 0.2181188690132718, "grad_norm": 0.828125, "learning_rate": 0.0004998803913541983, "loss": 6.9329, "mean_token_accuracy": 0.14065297245979308, "num_tokens": 4766755.0, "step": 1890 }, { "entropy": 7.006665802001953, "epoch": 0.21869590305828043, "grad_norm": 0.890625, "learning_rate": 0.0004998790422624654, "loss": 6.8586, "mean_token_accuracy": 0.1429077446460724, "num_tokens": 4780201.0, "step": 1895 }, { "entropy": 6.957398748397827, "epoch": 0.2192729371032891, "grad_norm": 0.88671875, "learning_rate": 0.0004998776856070376, "loss": 6.81, "mean_token_accuracy": 0.1421031355857849, "num_tokens": 4792488.0, "step": 1900 }, { "entropy": 6.996427440643311, "epoch": 0.21984997114829774, "grad_norm": 0.88671875, "learning_rate": 0.0004998763213879606, "loss": 6.7886, "mean_token_accuracy": 0.14664288908243178, "num_tokens": 4805154.0, "step": 1905 }, { "entropy": 6.966566801071167, "epoch": 0.2204270051933064, "grad_norm": 0.859375, "learning_rate": 0.0004998749496052803, "loss": 6.8471, "mean_token_accuracy": 0.14108580872416496, "num_tokens": 4817947.0, "step": 1910 }, { "entropy": 6.996940803527832, "epoch": 0.22100403923831505, "grad_norm": 0.91015625, "learning_rate": 0.0004998735702590426, "loss": 6.828, "mean_token_accuracy": 0.1447738878428936, "num_tokens": 4830296.0, "step": 1915 }, { "entropy": 6.933389377593994, "epoch": 0.22158107328332372, "grad_norm": 0.91796875, "learning_rate": 0.0004998721833492942, "loss": 6.8253, "mean_token_accuracy": 0.14365117698907853, "num_tokens": 4841210.0, "step": 1920 }, { "entropy": 7.029626893997192, "epoch": 0.22215810732833238, "grad_norm": 0.9140625, "learning_rate": 0.0004998707888760816, "loss": 6.8996, "mean_token_accuracy": 0.13317479714751243, "num_tokens": 4854406.0, "step": 1925 }, { "entropy": 6.965882301330566, "epoch": 0.22273514137334102, "grad_norm": 0.91015625, "learning_rate": 0.0004998693868394516, "loss": 6.8706, "mean_token_accuracy": 0.14146279469132422, "num_tokens": 4868156.0, "step": 1930 }, { "entropy": 7.022164821624756, "epoch": 0.2233121754183497, "grad_norm": 0.953125, "learning_rate": 0.0004998679772394516, "loss": 6.804, "mean_token_accuracy": 0.15072066336870193, "num_tokens": 4880314.0, "step": 1935 }, { "entropy": 6.920300674438477, "epoch": 0.22388920946335833, "grad_norm": 0.88671875, "learning_rate": 0.0004998665600761289, "loss": 6.813, "mean_token_accuracy": 0.14527895897626877, "num_tokens": 4892652.0, "step": 1940 }, { "entropy": 7.060734128952026, "epoch": 0.224466243508367, "grad_norm": 0.83203125, "learning_rate": 0.000499865135349531, "loss": 6.9048, "mean_token_accuracy": 0.13892186135053636, "num_tokens": 4905791.0, "step": 1945 }, { "entropy": 6.940855360031128, "epoch": 0.22504327755337564, "grad_norm": 0.8515625, "learning_rate": 0.0004998637030597061, "loss": 6.8723, "mean_token_accuracy": 0.14380484744906424, "num_tokens": 4917359.0, "step": 1950 }, { "entropy": 7.036824655532837, "epoch": 0.2256203115983843, "grad_norm": 0.84375, "learning_rate": 0.0004998622632067022, "loss": 6.8305, "mean_token_accuracy": 0.14697285592556, "num_tokens": 4928762.0, "step": 1955 }, { "entropy": 6.926147079467773, "epoch": 0.22619734564339297, "grad_norm": 0.87109375, "learning_rate": 0.0004998608157905678, "loss": 6.8447, "mean_token_accuracy": 0.14583281725645064, "num_tokens": 4940879.0, "step": 1960 }, { "entropy": 7.006029081344605, "epoch": 0.2267743796884016, "grad_norm": 0.828125, "learning_rate": 0.0004998593608113515, "loss": 6.8538, "mean_token_accuracy": 0.14606458991765975, "num_tokens": 4952979.0, "step": 1965 }, { "entropy": 6.918392038345337, "epoch": 0.22735141373341028, "grad_norm": 0.8203125, "learning_rate": 0.0004998578982691024, "loss": 6.7524, "mean_token_accuracy": 0.1569880038499832, "num_tokens": 4965465.0, "step": 1970 }, { "entropy": 6.9123780727386475, "epoch": 0.22792844777841892, "grad_norm": 0.86328125, "learning_rate": 0.0004998564281638694, "loss": 6.8233, "mean_token_accuracy": 0.14547210037708283, "num_tokens": 4977960.0, "step": 1975 }, { "entropy": 6.97648549079895, "epoch": 0.2285054818234276, "grad_norm": 0.78515625, "learning_rate": 0.0004998549504957023, "loss": 6.8274, "mean_token_accuracy": 0.14264762550592422, "num_tokens": 4990732.0, "step": 1980 }, { "entropy": 6.921519327163696, "epoch": 0.22908251586843623, "grad_norm": 0.8828125, "learning_rate": 0.0004998534652646506, "loss": 6.7678, "mean_token_accuracy": 0.14480722099542617, "num_tokens": 5002482.0, "step": 1985 }, { "entropy": 6.902936887741089, "epoch": 0.2296595499134449, "grad_norm": 0.8515625, "learning_rate": 0.0004998519724707642, "loss": 6.7529, "mean_token_accuracy": 0.14723773747682573, "num_tokens": 5014932.0, "step": 1990 }, { "entropy": 6.885674381256104, "epoch": 0.23023658395845356, "grad_norm": 0.80078125, "learning_rate": 0.0004998504721140934, "loss": 6.8837, "mean_token_accuracy": 0.138965655118227, "num_tokens": 5027661.0, "step": 1995 }, { "entropy": 6.906474590301514, "epoch": 0.2308136180034622, "grad_norm": 0.96875, "learning_rate": 0.0004998489641946887, "loss": 6.6331, "mean_token_accuracy": 0.1527172051370144, "num_tokens": 5040657.0, "step": 2000 }, { "entropy": 6.975762939453125, "epoch": 0.23139065204847087, "grad_norm": 0.87109375, "learning_rate": 0.0004998474487126009, "loss": 6.9063, "mean_token_accuracy": 0.13616069480776788, "num_tokens": 5054408.0, "step": 2005 }, { "entropy": 6.98120608329773, "epoch": 0.2319676860934795, "grad_norm": 0.9296875, "learning_rate": 0.0004998459256678806, "loss": 6.7998, "mean_token_accuracy": 0.14582831785082817, "num_tokens": 5065499.0, "step": 2010 }, { "entropy": 6.935510063171387, "epoch": 0.23254472013848818, "grad_norm": 0.86328125, "learning_rate": 0.0004998443950605796, "loss": 6.7508, "mean_token_accuracy": 0.15238589197397232, "num_tokens": 5077009.0, "step": 2015 }, { "entropy": 6.931089639663696, "epoch": 0.23312175418349682, "grad_norm": 0.87109375, "learning_rate": 0.0004998428568907488, "loss": 6.925, "mean_token_accuracy": 0.13808261305093766, "num_tokens": 5089462.0, "step": 2020 }, { "entropy": 6.99543948173523, "epoch": 0.23369878822850548, "grad_norm": 0.90625, "learning_rate": 0.0004998413111584403, "loss": 6.8333, "mean_token_accuracy": 0.1430407203733921, "num_tokens": 5101816.0, "step": 2025 }, { "entropy": 6.949823617935181, "epoch": 0.23427582227351415, "grad_norm": 0.84375, "learning_rate": 0.0004998397578637059, "loss": 6.7939, "mean_token_accuracy": 0.1399306148290634, "num_tokens": 5115085.0, "step": 2030 }, { "entropy": 6.912753963470459, "epoch": 0.2348528563185228, "grad_norm": 0.85546875, "learning_rate": 0.000499838197006598, "loss": 6.8265, "mean_token_accuracy": 0.1417170412838459, "num_tokens": 5127705.0, "step": 2035 }, { "entropy": 6.916851139068603, "epoch": 0.23542989036353146, "grad_norm": 0.78125, "learning_rate": 0.000499836628587169, "loss": 6.786, "mean_token_accuracy": 0.1507592000067234, "num_tokens": 5140509.0, "step": 2040 }, { "entropy": 6.963552236557007, "epoch": 0.2360069244085401, "grad_norm": 0.8671875, "learning_rate": 0.0004998350526054716, "loss": 6.8285, "mean_token_accuracy": 0.1409867897629738, "num_tokens": 5153538.0, "step": 2045 }, { "entropy": 6.918388509750367, "epoch": 0.23658395845354876, "grad_norm": 0.95703125, "learning_rate": 0.0004998334690615591, "loss": 6.7526, "mean_token_accuracy": 0.14691582769155503, "num_tokens": 5166181.0, "step": 2050 }, { "entropy": 6.877604293823242, "epoch": 0.2371609924985574, "grad_norm": 0.9140625, "learning_rate": 0.0004998318779554844, "loss": 6.7855, "mean_token_accuracy": 0.14772634357213973, "num_tokens": 5177209.0, "step": 2055 }, { "entropy": 6.908311414718628, "epoch": 0.23773802654356607, "grad_norm": 0.96484375, "learning_rate": 0.0004998302792873012, "loss": 6.8049, "mean_token_accuracy": 0.14239051789045334, "num_tokens": 5189786.0, "step": 2060 }, { "entropy": 6.952730369567871, "epoch": 0.23831506058857474, "grad_norm": 0.81640625, "learning_rate": 0.0004998286730570631, "loss": 6.7892, "mean_token_accuracy": 0.1510260708630085, "num_tokens": 5202629.0, "step": 2065 }, { "entropy": 6.907465410232544, "epoch": 0.23889209463358338, "grad_norm": 0.87109375, "learning_rate": 0.0004998270592648245, "loss": 6.8561, "mean_token_accuracy": 0.13883134126663207, "num_tokens": 5215339.0, "step": 2070 }, { "entropy": 6.9621459484100345, "epoch": 0.23946912867859205, "grad_norm": 0.8203125, "learning_rate": 0.0004998254379106394, "loss": 6.7359, "mean_token_accuracy": 0.14754440188407897, "num_tokens": 5227666.0, "step": 2075 }, { "entropy": 6.7812415599823, "epoch": 0.2400461627236007, "grad_norm": 0.8828125, "learning_rate": 0.0004998238089945622, "loss": 6.7107, "mean_token_accuracy": 0.1521335408091545, "num_tokens": 5238200.0, "step": 2080 }, { "entropy": 6.852583646774292, "epoch": 0.24062319676860935, "grad_norm": 0.88671875, "learning_rate": 0.0004998221725166479, "loss": 6.6654, "mean_token_accuracy": 0.15192302465438842, "num_tokens": 5250023.0, "step": 2085 }, { "entropy": 6.927479076385498, "epoch": 0.241200230813618, "grad_norm": 0.92578125, "learning_rate": 0.0004998205284769516, "loss": 6.8416, "mean_token_accuracy": 0.1361626349389553, "num_tokens": 5262634.0, "step": 2090 }, { "entropy": 6.945438241958618, "epoch": 0.24177726485862666, "grad_norm": 0.87109375, "learning_rate": 0.0004998188768755285, "loss": 6.8404, "mean_token_accuracy": 0.1391704946756363, "num_tokens": 5275739.0, "step": 2095 }, { "entropy": 6.907373285293579, "epoch": 0.2423542989036353, "grad_norm": 0.84375, "learning_rate": 0.0004998172177124341, "loss": 6.8036, "mean_token_accuracy": 0.14423199594020844, "num_tokens": 5289223.0, "step": 2100 }, { "entropy": 6.921164560317993, "epoch": 0.24293133294864397, "grad_norm": 0.8671875, "learning_rate": 0.0004998155509877242, "loss": 6.7918, "mean_token_accuracy": 0.14191285520792007, "num_tokens": 5301869.0, "step": 2105 }, { "entropy": 6.931911897659302, "epoch": 0.24350836699365264, "grad_norm": 0.796875, "learning_rate": 0.000499813876701455, "loss": 6.8142, "mean_token_accuracy": 0.140006385743618, "num_tokens": 5314999.0, "step": 2110 }, { "entropy": 6.918317890167236, "epoch": 0.24408540103866128, "grad_norm": 0.82421875, "learning_rate": 0.0004998121948536828, "loss": 6.8173, "mean_token_accuracy": 0.14651304483413696, "num_tokens": 5328247.0, "step": 2115 }, { "entropy": 6.985309028625489, "epoch": 0.24466243508366994, "grad_norm": 0.85546875, "learning_rate": 0.0004998105054444639, "loss": 6.804, "mean_token_accuracy": 0.13474133610725403, "num_tokens": 5341054.0, "step": 2120 }, { "entropy": 6.888967895507813, "epoch": 0.24523946912867858, "grad_norm": 0.82421875, "learning_rate": 0.0004998088084738555, "loss": 6.8269, "mean_token_accuracy": 0.14804685413837432, "num_tokens": 5353857.0, "step": 2125 }, { "entropy": 6.884988164901733, "epoch": 0.24581650317368725, "grad_norm": 0.91015625, "learning_rate": 0.0004998071039419144, "loss": 6.7622, "mean_token_accuracy": 0.14388485997915268, "num_tokens": 5366072.0, "step": 2130 }, { "entropy": 6.902663278579712, "epoch": 0.2463935372186959, "grad_norm": 0.87890625, "learning_rate": 0.000499805391848698, "loss": 6.7641, "mean_token_accuracy": 0.1469337075948715, "num_tokens": 5379613.0, "step": 2135 }, { "entropy": 6.88670859336853, "epoch": 0.24697057126370456, "grad_norm": 0.8515625, "learning_rate": 0.000499803672194264, "loss": 6.8005, "mean_token_accuracy": 0.14418511241674423, "num_tokens": 5392394.0, "step": 2140 }, { "entropy": 6.805346250534058, "epoch": 0.24754760530871323, "grad_norm": 0.90625, "learning_rate": 0.0004998019449786701, "loss": 6.77, "mean_token_accuracy": 0.14892241209745408, "num_tokens": 5404127.0, "step": 2145 }, { "entropy": 7.025264120101928, "epoch": 0.24812463935372187, "grad_norm": 0.78515625, "learning_rate": 0.0004998002102019744, "loss": 6.8739, "mean_token_accuracy": 0.13671603947877883, "num_tokens": 5417317.0, "step": 2150 }, { "entropy": 6.881466197967529, "epoch": 0.24870167339873053, "grad_norm": 0.84375, "learning_rate": 0.0004997984678642354, "loss": 6.7279, "mean_token_accuracy": 0.1475033514201641, "num_tokens": 5429991.0, "step": 2155 }, { "entropy": 6.890996217727661, "epoch": 0.24927870744373917, "grad_norm": 0.84375, "learning_rate": 0.0004997967179655115, "loss": 6.7702, "mean_token_accuracy": 0.13975565731525422, "num_tokens": 5442661.0, "step": 2160 }, { "entropy": 6.903371953964234, "epoch": 0.24985574148874784, "grad_norm": 0.984375, "learning_rate": 0.0004997949605058617, "loss": 6.7731, "mean_token_accuracy": 0.1479140818119049, "num_tokens": 5455876.0, "step": 2165 }, { "entropy": 6.838821744918823, "epoch": 0.2504327755337565, "grad_norm": 0.85546875, "learning_rate": 0.0004997931954853451, "loss": 6.7326, "mean_token_accuracy": 0.1502830758690834, "num_tokens": 5468151.0, "step": 2170 }, { "entropy": 6.829051685333252, "epoch": 0.2510098095787651, "grad_norm": 0.8671875, "learning_rate": 0.000499791422904021, "loss": 6.7642, "mean_token_accuracy": 0.15258670300245286, "num_tokens": 5481327.0, "step": 2175 }, { "entropy": 6.854774093627929, "epoch": 0.2515868436237738, "grad_norm": 0.8984375, "learning_rate": 0.0004997896427619491, "loss": 6.726, "mean_token_accuracy": 0.14523358941078185, "num_tokens": 5493794.0, "step": 2180 }, { "entropy": 6.833822202682495, "epoch": 0.25216387766878245, "grad_norm": 0.8359375, "learning_rate": 0.0004997878550591892, "loss": 6.7622, "mean_token_accuracy": 0.14095828533172608, "num_tokens": 5506831.0, "step": 2185 }, { "entropy": 6.8861846923828125, "epoch": 0.2527409117137911, "grad_norm": 1.078125, "learning_rate": 0.0004997860597958013, "loss": 6.6629, "mean_token_accuracy": 0.15049846321344376, "num_tokens": 5518988.0, "step": 2190 }, { "entropy": 6.720967817306518, "epoch": 0.2533179457587998, "grad_norm": 0.90625, "learning_rate": 0.0004997842569718461, "loss": 6.6284, "mean_token_accuracy": 0.15226881206035614, "num_tokens": 5530757.0, "step": 2195 }, { "entropy": 6.8386878490448, "epoch": 0.25389497980380843, "grad_norm": 0.87890625, "learning_rate": 0.000499782446587384, "loss": 6.7462, "mean_token_accuracy": 0.14984930008649827, "num_tokens": 5542819.0, "step": 2200 }, { "entropy": 6.887057685852051, "epoch": 0.25447201384881707, "grad_norm": 0.98046875, "learning_rate": 0.000499780628642476, "loss": 6.7516, "mean_token_accuracy": 0.1436480388045311, "num_tokens": 5555797.0, "step": 2205 }, { "entropy": 6.8565185546875, "epoch": 0.2550490478938257, "grad_norm": 0.8984375, "learning_rate": 0.0004997788031371834, "loss": 6.8377, "mean_token_accuracy": 0.13526439368724824, "num_tokens": 5570086.0, "step": 2210 }, { "entropy": 6.880842208862305, "epoch": 0.2556260819388344, "grad_norm": 0.88671875, "learning_rate": 0.0004997769700715672, "loss": 6.6616, "mean_token_accuracy": 0.15116312801837922, "num_tokens": 5582182.0, "step": 2215 }, { "entropy": 6.771800470352173, "epoch": 0.25620311598384304, "grad_norm": 0.859375, "learning_rate": 0.0004997751294456892, "loss": 6.7557, "mean_token_accuracy": 0.1484261780977249, "num_tokens": 5595395.0, "step": 2220 }, { "entropy": 6.907889366149902, "epoch": 0.2567801500288517, "grad_norm": 0.7734375, "learning_rate": 0.0004997732812596114, "loss": 6.7655, "mean_token_accuracy": 0.14601099640130996, "num_tokens": 5608555.0, "step": 2225 }, { "entropy": 6.852161073684693, "epoch": 0.2573571840738604, "grad_norm": 0.875, "learning_rate": 0.0004997714255133961, "loss": 6.7211, "mean_token_accuracy": 0.14606622010469436, "num_tokens": 5620933.0, "step": 2230 }, { "entropy": 6.908066129684448, "epoch": 0.257934218118869, "grad_norm": 0.828125, "learning_rate": 0.0004997695622071054, "loss": 6.7645, "mean_token_accuracy": 0.14898824393749238, "num_tokens": 5634061.0, "step": 2235 }, { "entropy": 6.929029846191407, "epoch": 0.25851125216387766, "grad_norm": 0.84765625, "learning_rate": 0.0004997676913408021, "loss": 6.7291, "mean_token_accuracy": 0.1483811229467392, "num_tokens": 5646617.0, "step": 2240 }, { "entropy": 6.87813811302185, "epoch": 0.2590882862088863, "grad_norm": 0.8515625, "learning_rate": 0.0004997658129145493, "loss": 6.811, "mean_token_accuracy": 0.14377271234989167, "num_tokens": 5659361.0, "step": 2245 }, { "entropy": 6.849423265457153, "epoch": 0.259665320253895, "grad_norm": 0.9140625, "learning_rate": 0.0004997639269284099, "loss": 6.6528, "mean_token_accuracy": 0.15414825975894927, "num_tokens": 5670591.0, "step": 2250 }, { "entropy": 6.851912260055542, "epoch": 0.26024235429890363, "grad_norm": 0.9296875, "learning_rate": 0.0004997620333824476, "loss": 6.7722, "mean_token_accuracy": 0.14549338743090628, "num_tokens": 5683211.0, "step": 2255 }, { "entropy": 6.851926565170288, "epoch": 0.2608193883439123, "grad_norm": 0.89453125, "learning_rate": 0.0004997601322767258, "loss": 6.7653, "mean_token_accuracy": 0.145635487139225, "num_tokens": 5695654.0, "step": 2260 }, { "entropy": 6.795074939727783, "epoch": 0.26139642238892097, "grad_norm": 0.88671875, "learning_rate": 0.0004997582236113087, "loss": 6.6557, "mean_token_accuracy": 0.15083891600370408, "num_tokens": 5707776.0, "step": 2265 }, { "entropy": 6.822677946090698, "epoch": 0.2619734564339296, "grad_norm": 0.8046875, "learning_rate": 0.0004997563073862603, "loss": 6.7076, "mean_token_accuracy": 0.14838095828890802, "num_tokens": 5719895.0, "step": 2270 }, { "entropy": 6.895277500152588, "epoch": 0.26255049047893825, "grad_norm": 0.83203125, "learning_rate": 0.0004997543836016453, "loss": 6.7302, "mean_token_accuracy": 0.15407091453671456, "num_tokens": 5733280.0, "step": 2275 }, { "entropy": 6.825756692886353, "epoch": 0.2631275245239469, "grad_norm": 0.86328125, "learning_rate": 0.0004997524522575281, "loss": 6.7713, "mean_token_accuracy": 0.14787696152925492, "num_tokens": 5746563.0, "step": 2280 }, { "entropy": 6.933543157577515, "epoch": 0.2637045585689556, "grad_norm": 0.85546875, "learning_rate": 0.0004997505133539738, "loss": 6.8251, "mean_token_accuracy": 0.14116834327578545, "num_tokens": 5760735.0, "step": 2285 }, { "entropy": 6.7919364929199215, "epoch": 0.2642815926139642, "grad_norm": 0.8125, "learning_rate": 0.0004997485668910476, "loss": 6.7403, "mean_token_accuracy": 0.13866735473275185, "num_tokens": 5774304.0, "step": 2290 }, { "entropy": 6.707546329498291, "epoch": 0.26485862665897286, "grad_norm": 0.86328125, "learning_rate": 0.0004997466128688151, "loss": 6.6343, "mean_token_accuracy": 0.1520386144518852, "num_tokens": 5786045.0, "step": 2295 }, { "entropy": 6.8912115573883055, "epoch": 0.26543566070398156, "grad_norm": 0.99609375, "learning_rate": 0.000499744651287342, "loss": 6.7038, "mean_token_accuracy": 0.1507314458489418, "num_tokens": 5798126.0, "step": 2300 }, { "entropy": 6.800000524520874, "epoch": 0.2660126947489902, "grad_norm": 0.8359375, "learning_rate": 0.000499742682146694, "loss": 6.708, "mean_token_accuracy": 0.15146253854036332, "num_tokens": 5809778.0, "step": 2305 }, { "entropy": 6.887187433242798, "epoch": 0.26658972879399884, "grad_norm": 0.84375, "learning_rate": 0.0004997407054469377, "loss": 6.7913, "mean_token_accuracy": 0.14095485657453538, "num_tokens": 5821902.0, "step": 2310 }, { "entropy": 6.898465633392334, "epoch": 0.2671667628390075, "grad_norm": 0.8125, "learning_rate": 0.0004997387211881392, "loss": 6.7311, "mean_token_accuracy": 0.14221810474991797, "num_tokens": 5835162.0, "step": 2315 }, { "entropy": 6.761828851699829, "epoch": 0.26774379688401617, "grad_norm": 1.2109375, "learning_rate": 0.0004997367293703656, "loss": 6.7284, "mean_token_accuracy": 0.1507745712995529, "num_tokens": 5847708.0, "step": 2320 }, { "entropy": 6.91298017501831, "epoch": 0.2683208309290248, "grad_norm": 0.82421875, "learning_rate": 0.0004997347299936837, "loss": 6.7346, "mean_token_accuracy": 0.14922600761055946, "num_tokens": 5860983.0, "step": 2325 }, { "entropy": 6.769803524017334, "epoch": 0.26889786497403345, "grad_norm": 0.84375, "learning_rate": 0.0004997327230581608, "loss": 6.6998, "mean_token_accuracy": 0.1437514305114746, "num_tokens": 5873878.0, "step": 2330 }, { "entropy": 6.783571243286133, "epoch": 0.26947489901904215, "grad_norm": 0.86328125, "learning_rate": 0.0004997307085638644, "loss": 6.7147, "mean_token_accuracy": 0.14909254312515258, "num_tokens": 5886577.0, "step": 2335 }, { "entropy": 6.906566333770752, "epoch": 0.2700519330640508, "grad_norm": 1.109375, "learning_rate": 0.0004997286865108621, "loss": 6.7362, "mean_token_accuracy": 0.13940049409866334, "num_tokens": 5900373.0, "step": 2340 }, { "entropy": 6.771531581878662, "epoch": 0.2706289671090594, "grad_norm": 0.89453125, "learning_rate": 0.0004997266568992222, "loss": 6.708, "mean_token_accuracy": 0.14844308495521547, "num_tokens": 5913038.0, "step": 2345 }, { "entropy": 6.791477632522583, "epoch": 0.27120600115406807, "grad_norm": 0.80859375, "learning_rate": 0.0004997246197290128, "loss": 6.6815, "mean_token_accuracy": 0.1516631633043289, "num_tokens": 5926096.0, "step": 2350 }, { "entropy": 6.820218896865844, "epoch": 0.27178303519907676, "grad_norm": 0.85546875, "learning_rate": 0.0004997225750003024, "loss": 6.6836, "mean_token_accuracy": 0.15230127722024916, "num_tokens": 5937992.0, "step": 2355 }, { "entropy": 6.786269426345825, "epoch": 0.2723600692440854, "grad_norm": 0.9375, "learning_rate": 0.0004997205227131599, "loss": 6.6959, "mean_token_accuracy": 0.15331070870161057, "num_tokens": 5949685.0, "step": 2360 }, { "entropy": 6.8500142097473145, "epoch": 0.27293710328909404, "grad_norm": 0.8828125, "learning_rate": 0.0004997184628676542, "loss": 6.77, "mean_token_accuracy": 0.14370569810271264, "num_tokens": 5962751.0, "step": 2365 }, { "entropy": 6.743644428253174, "epoch": 0.27351413733410274, "grad_norm": 0.80859375, "learning_rate": 0.0004997163954638546, "loss": 6.5676, "mean_token_accuracy": 0.15582787990570068, "num_tokens": 5976043.0, "step": 2370 }, { "entropy": 6.826035118103027, "epoch": 0.2740911713791114, "grad_norm": 0.83984375, "learning_rate": 0.0004997143205018306, "loss": 6.7138, "mean_token_accuracy": 0.14594173580408096, "num_tokens": 5988146.0, "step": 2375 }, { "entropy": 6.795579051971435, "epoch": 0.27466820542412, "grad_norm": 0.875, "learning_rate": 0.0004997122379816523, "loss": 6.6587, "mean_token_accuracy": 0.15158178210258483, "num_tokens": 6000542.0, "step": 2380 }, { "entropy": 6.742963075637817, "epoch": 0.27524523946912866, "grad_norm": 0.765625, "learning_rate": 0.0004997101479033893, "loss": 6.7064, "mean_token_accuracy": 0.14576518833637236, "num_tokens": 6013574.0, "step": 2385 }, { "entropy": 6.739541244506836, "epoch": 0.27582227351413735, "grad_norm": 0.8125, "learning_rate": 0.0004997080502671122, "loss": 6.594, "mean_token_accuracy": 0.15022992491722106, "num_tokens": 6025391.0, "step": 2390 }, { "entropy": 6.859225606918335, "epoch": 0.276399307559146, "grad_norm": 0.8203125, "learning_rate": 0.0004997059450728913, "loss": 6.7201, "mean_token_accuracy": 0.14635233953595161, "num_tokens": 6036595.0, "step": 2395 }, { "entropy": 6.836587810516358, "epoch": 0.27697634160415463, "grad_norm": 0.859375, "learning_rate": 0.0004997038323207977, "loss": 6.8146, "mean_token_accuracy": 0.1395593300461769, "num_tokens": 6048852.0, "step": 2400 }, { "entropy": 6.825769519805908, "epoch": 0.2775533756491633, "grad_norm": 0.8359375, "learning_rate": 0.0004997017120109022, "loss": 6.6492, "mean_token_accuracy": 0.15694630444049834, "num_tokens": 6061694.0, "step": 2405 }, { "entropy": 6.7436662197113035, "epoch": 0.27813040969417197, "grad_norm": 0.83984375, "learning_rate": 0.0004996995841432762, "loss": 6.725, "mean_token_accuracy": 0.15039588510990143, "num_tokens": 6074244.0, "step": 2410 }, { "entropy": 6.894833898544311, "epoch": 0.2787074437391806, "grad_norm": 0.86328125, "learning_rate": 0.0004996974487179915, "loss": 6.7051, "mean_token_accuracy": 0.1497049979865551, "num_tokens": 6085550.0, "step": 2415 }, { "entropy": 6.791318702697754, "epoch": 0.27928447778418924, "grad_norm": 0.88671875, "learning_rate": 0.0004996953057351195, "loss": 6.7501, "mean_token_accuracy": 0.14439913034439086, "num_tokens": 6096749.0, "step": 2420 }, { "entropy": 6.856110286712647, "epoch": 0.27986151182919794, "grad_norm": 0.86328125, "learning_rate": 0.0004996931551947327, "loss": 6.6462, "mean_token_accuracy": 0.14740088433027268, "num_tokens": 6109490.0, "step": 2425 }, { "entropy": 6.801775121688843, "epoch": 0.2804385458742066, "grad_norm": 0.83203125, "learning_rate": 0.0004996909970969031, "loss": 6.8126, "mean_token_accuracy": 0.13891539573669434, "num_tokens": 6122656.0, "step": 2430 }, { "entropy": 6.949873161315918, "epoch": 0.2810155799192152, "grad_norm": 0.87109375, "learning_rate": 0.0004996888314417034, "loss": 6.7062, "mean_token_accuracy": 0.14734956696629525, "num_tokens": 6135461.0, "step": 2435 }, { "entropy": 6.737766313552856, "epoch": 0.2815926139642239, "grad_norm": 0.86328125, "learning_rate": 0.0004996866582292067, "loss": 6.7563, "mean_token_accuracy": 0.1486450642347336, "num_tokens": 6147698.0, "step": 2440 }, { "entropy": 6.906767129898071, "epoch": 0.28216964800923255, "grad_norm": 0.8203125, "learning_rate": 0.0004996844774594856, "loss": 6.6995, "mean_token_accuracy": 0.15024199485778808, "num_tokens": 6160456.0, "step": 2445 }, { "entropy": 6.721561002731323, "epoch": 0.2827466820542412, "grad_norm": 0.87890625, "learning_rate": 0.0004996822891326138, "loss": 6.6952, "mean_token_accuracy": 0.14862452447414398, "num_tokens": 6173606.0, "step": 2450 }, { "entropy": 6.840061807632447, "epoch": 0.28332371609924983, "grad_norm": 0.83203125, "learning_rate": 0.0004996800932486648, "loss": 6.7195, "mean_token_accuracy": 0.14363468587398528, "num_tokens": 6185355.0, "step": 2455 }, { "entropy": 6.82087197303772, "epoch": 0.28390075014425853, "grad_norm": 0.83203125, "learning_rate": 0.0004996778898077126, "loss": 6.7452, "mean_token_accuracy": 0.14526572227478027, "num_tokens": 6198154.0, "step": 2460 }, { "entropy": 6.825610780715943, "epoch": 0.28447778418926717, "grad_norm": 0.9765625, "learning_rate": 0.0004996756788098309, "loss": 6.6295, "mean_token_accuracy": 0.1540285274386406, "num_tokens": 6209901.0, "step": 2465 }, { "entropy": 6.724011659622192, "epoch": 0.2850548182342758, "grad_norm": 0.7890625, "learning_rate": 0.0004996734602550945, "loss": 6.6914, "mean_token_accuracy": 0.14896469041705132, "num_tokens": 6222052.0, "step": 2470 }, { "entropy": 6.822287702560425, "epoch": 0.2856318522792845, "grad_norm": 0.828125, "learning_rate": 0.0004996712341435779, "loss": 6.6874, "mean_token_accuracy": 0.1531086578965187, "num_tokens": 6235112.0, "step": 2475 }, { "entropy": 6.779771232604981, "epoch": 0.28620888632429314, "grad_norm": 1.0, "learning_rate": 0.0004996690004753559, "loss": 6.7241, "mean_token_accuracy": 0.1425678864121437, "num_tokens": 6248225.0, "step": 2480 }, { "entropy": 6.827151918411255, "epoch": 0.2867859203693018, "grad_norm": 0.90234375, "learning_rate": 0.0004996667592505037, "loss": 6.6731, "mean_token_accuracy": 0.15249393209815026, "num_tokens": 6259518.0, "step": 2485 }, { "entropy": 6.752045726776123, "epoch": 0.2873629544143104, "grad_norm": 0.8359375, "learning_rate": 0.0004996645104690967, "loss": 6.6827, "mean_token_accuracy": 0.1392819695174694, "num_tokens": 6271832.0, "step": 2490 }, { "entropy": 6.84897813796997, "epoch": 0.2879399884593191, "grad_norm": 0.85546875, "learning_rate": 0.0004996622541312103, "loss": 6.7198, "mean_token_accuracy": 0.1458892524242401, "num_tokens": 6284328.0, "step": 2495 }, { "entropy": 6.746988677978516, "epoch": 0.28851702250432776, "grad_norm": 0.875, "learning_rate": 0.0004996599902369207, "loss": 6.6617, "mean_token_accuracy": 0.1465374030172825, "num_tokens": 6296100.0, "step": 2500 }, { "entropy": 6.685969734191895, "epoch": 0.2890940565493364, "grad_norm": 0.80859375, "learning_rate": 0.0004996577187863039, "loss": 6.6493, "mean_token_accuracy": 0.15570555478334427, "num_tokens": 6308262.0, "step": 2505 }, { "entropy": 6.827516984939575, "epoch": 0.2896710905943451, "grad_norm": 0.75, "learning_rate": 0.0004996554397794364, "loss": 6.6959, "mean_token_accuracy": 0.1382772818207741, "num_tokens": 6319953.0, "step": 2510 }, { "entropy": 6.807676601409912, "epoch": 0.29024812463935373, "grad_norm": 0.82421875, "learning_rate": 0.0004996531532163947, "loss": 6.6329, "mean_token_accuracy": 0.15100528299808502, "num_tokens": 6332953.0, "step": 2515 }, { "entropy": 6.77238130569458, "epoch": 0.2908251586843624, "grad_norm": 0.828125, "learning_rate": 0.0004996508590972558, "loss": 6.6873, "mean_token_accuracy": 0.1495242863893509, "num_tokens": 6345692.0, "step": 2520 }, { "entropy": 6.78111777305603, "epoch": 0.291402192729371, "grad_norm": 0.94921875, "learning_rate": 0.0004996485574220969, "loss": 6.6698, "mean_token_accuracy": 0.14763007685542107, "num_tokens": 6358058.0, "step": 2525 }, { "entropy": 6.842091226577759, "epoch": 0.2919792267743797, "grad_norm": 0.921875, "learning_rate": 0.0004996462481909953, "loss": 6.7157, "mean_token_accuracy": 0.149982488155365, "num_tokens": 6370469.0, "step": 2530 }, { "entropy": 6.7619242668151855, "epoch": 0.29255626081938835, "grad_norm": 0.84375, "learning_rate": 0.0004996439314040287, "loss": 6.7762, "mean_token_accuracy": 0.1360616222023964, "num_tokens": 6384333.0, "step": 2535 }, { "entropy": 6.855607652664185, "epoch": 0.293133294864397, "grad_norm": 0.80859375, "learning_rate": 0.000499641607061275, "loss": 6.7016, "mean_token_accuracy": 0.1434970736503601, "num_tokens": 6397688.0, "step": 2540 }, { "entropy": 6.819028520584107, "epoch": 0.2937103289094057, "grad_norm": 0.8046875, "learning_rate": 0.0004996392751628126, "loss": 6.6602, "mean_token_accuracy": 0.14889983236789703, "num_tokens": 6410188.0, "step": 2545 }, { "entropy": 6.722808504104615, "epoch": 0.2942873629544143, "grad_norm": 0.859375, "learning_rate": 0.0004996369357087196, "loss": 6.6805, "mean_token_accuracy": 0.14856439232826232, "num_tokens": 6423313.0, "step": 2550 }, { "entropy": 6.845215559005737, "epoch": 0.29486439699942296, "grad_norm": 0.765625, "learning_rate": 0.000499634588699075, "loss": 6.7135, "mean_token_accuracy": 0.14631582498550416, "num_tokens": 6435853.0, "step": 2555 }, { "entropy": 6.713652801513672, "epoch": 0.2954414310444316, "grad_norm": 0.8046875, "learning_rate": 0.0004996322341339575, "loss": 6.6397, "mean_token_accuracy": 0.14477873146533965, "num_tokens": 6448659.0, "step": 2560 }, { "entropy": 6.7395094871521, "epoch": 0.2960184650894403, "grad_norm": 0.84375, "learning_rate": 0.0004996298720134465, "loss": 6.6985, "mean_token_accuracy": 0.14935118854045867, "num_tokens": 6460534.0, "step": 2565 }, { "entropy": 6.828916740417481, "epoch": 0.29659549913444894, "grad_norm": 0.8515625, "learning_rate": 0.0004996275023376213, "loss": 6.6741, "mean_token_accuracy": 0.14743488729000093, "num_tokens": 6472368.0, "step": 2570 }, { "entropy": 6.772326993942261, "epoch": 0.2971725331794576, "grad_norm": 0.9296875, "learning_rate": 0.0004996251251065615, "loss": 6.6763, "mean_token_accuracy": 0.14429058134555817, "num_tokens": 6485430.0, "step": 2575 }, { "entropy": 6.764473915100098, "epoch": 0.2977495672244662, "grad_norm": 0.80078125, "learning_rate": 0.0004996227403203473, "loss": 6.656, "mean_token_accuracy": 0.15102906972169877, "num_tokens": 6497303.0, "step": 2580 }, { "entropy": 6.816898822784424, "epoch": 0.2983266012694749, "grad_norm": 0.83984375, "learning_rate": 0.0004996203479790589, "loss": 6.7282, "mean_token_accuracy": 0.15129706114530564, "num_tokens": 6510154.0, "step": 2585 }, { "entropy": 6.819794940948486, "epoch": 0.29890363531448355, "grad_norm": 0.8125, "learning_rate": 0.0004996179480827764, "loss": 6.7073, "mean_token_accuracy": 0.14853841662406922, "num_tokens": 6523091.0, "step": 2590 }, { "entropy": 6.845903539657593, "epoch": 0.2994806693594922, "grad_norm": 1.21875, "learning_rate": 0.000499615540631581, "loss": 6.6167, "mean_token_accuracy": 0.15361105501651764, "num_tokens": 6536043.0, "step": 2595 }, { "entropy": 6.660343933105469, "epoch": 0.3000577034045009, "grad_norm": 0.88671875, "learning_rate": 0.0004996131256255534, "loss": 6.6328, "mean_token_accuracy": 0.15334705710411073, "num_tokens": 6548227.0, "step": 2600 }, { "entropy": 6.819034004211426, "epoch": 0.3006347374495095, "grad_norm": 0.890625, "learning_rate": 0.0004996107030647749, "loss": 6.692, "mean_token_accuracy": 0.14152004942297935, "num_tokens": 6560204.0, "step": 2605 }, { "entropy": 6.756571340560913, "epoch": 0.30121177149451817, "grad_norm": 1.28125, "learning_rate": 0.0004996082729493269, "loss": 6.6744, "mean_token_accuracy": 0.15325141996145247, "num_tokens": 6573235.0, "step": 2610 }, { "entropy": 6.73859806060791, "epoch": 0.3017888055395268, "grad_norm": 0.83203125, "learning_rate": 0.0004996058352792913, "loss": 6.7054, "mean_token_accuracy": 0.14550871774554253, "num_tokens": 6585118.0, "step": 2615 }, { "entropy": 6.755663061141968, "epoch": 0.3023658395845355, "grad_norm": 0.96484375, "learning_rate": 0.00049960339005475, "loss": 6.5996, "mean_token_accuracy": 0.14909390211105347, "num_tokens": 6596690.0, "step": 2620 }, { "entropy": 6.764217233657837, "epoch": 0.30294287362954414, "grad_norm": 0.890625, "learning_rate": 0.0004996009372757852, "loss": 6.5965, "mean_token_accuracy": 0.1569955661892891, "num_tokens": 6609076.0, "step": 2625 }, { "entropy": 6.729177474975586, "epoch": 0.3035199076745528, "grad_norm": 0.828125, "learning_rate": 0.0004995984769424795, "loss": 6.7118, "mean_token_accuracy": 0.14563166871666908, "num_tokens": 6621352.0, "step": 2630 }, { "entropy": 6.814102125167847, "epoch": 0.3040969417195615, "grad_norm": 1.3515625, "learning_rate": 0.0004995960090549155, "loss": 6.5982, "mean_token_accuracy": 0.1499995172023773, "num_tokens": 6633924.0, "step": 2635 }, { "entropy": 6.754621171951294, "epoch": 0.3046739757645701, "grad_norm": 0.86328125, "learning_rate": 0.0004995935336131764, "loss": 6.7238, "mean_token_accuracy": 0.1473952054977417, "num_tokens": 6646490.0, "step": 2640 }, { "entropy": 6.8332771301269535, "epoch": 0.30525100980957875, "grad_norm": 0.89453125, "learning_rate": 0.0004995910506173452, "loss": 6.6893, "mean_token_accuracy": 0.14203061014413834, "num_tokens": 6660171.0, "step": 2645 }, { "entropy": 6.768089628219604, "epoch": 0.3058280438545874, "grad_norm": 0.828125, "learning_rate": 0.0004995885600675059, "loss": 6.7052, "mean_token_accuracy": 0.1487940713763237, "num_tokens": 6673505.0, "step": 2650 }, { "entropy": 6.782451200485229, "epoch": 0.3064050778995961, "grad_norm": 0.8125, "learning_rate": 0.0004995860619637415, "loss": 6.7004, "mean_token_accuracy": 0.1495489463210106, "num_tokens": 6685798.0, "step": 2655 }, { "entropy": 6.705468416213989, "epoch": 0.30698211194460473, "grad_norm": 0.90234375, "learning_rate": 0.0004995835563061367, "loss": 6.5514, "mean_token_accuracy": 0.15502395033836364, "num_tokens": 6699254.0, "step": 2660 }, { "entropy": 6.736592388153076, "epoch": 0.30755914598961337, "grad_norm": 0.84765625, "learning_rate": 0.0004995810430947756, "loss": 6.6154, "mean_token_accuracy": 0.15057491064071654, "num_tokens": 6711088.0, "step": 2665 }, { "entropy": 6.759505414962769, "epoch": 0.30813618003462206, "grad_norm": 0.83984375, "learning_rate": 0.0004995785223297426, "loss": 6.6807, "mean_token_accuracy": 0.14461947679519654, "num_tokens": 6723373.0, "step": 2670 }, { "entropy": 6.741917705535888, "epoch": 0.3087132140796307, "grad_norm": 0.73828125, "learning_rate": 0.0004995759940111225, "loss": 6.6848, "mean_token_accuracy": 0.14381011575460434, "num_tokens": 6737984.0, "step": 2675 }, { "entropy": 6.773638963699341, "epoch": 0.30929024812463934, "grad_norm": 0.86328125, "learning_rate": 0.0004995734581390005, "loss": 6.6328, "mean_token_accuracy": 0.14959122091531754, "num_tokens": 6751283.0, "step": 2680 }, { "entropy": 6.680616760253907, "epoch": 0.309867282169648, "grad_norm": 0.76953125, "learning_rate": 0.0004995709147134617, "loss": 6.6046, "mean_token_accuracy": 0.15074616074562072, "num_tokens": 6765012.0, "step": 2685 }, { "entropy": 6.775850296020508, "epoch": 0.3104443162146567, "grad_norm": 0.81640625, "learning_rate": 0.0004995683637345919, "loss": 6.6392, "mean_token_accuracy": 0.15261454582214357, "num_tokens": 6777708.0, "step": 2690 }, { "entropy": 6.7052594184875485, "epoch": 0.3110213502596653, "grad_norm": 0.82421875, "learning_rate": 0.0004995658052024765, "loss": 6.5669, "mean_token_accuracy": 0.16054244190454484, "num_tokens": 6791325.0, "step": 2695 }, { "entropy": 6.722959423065186, "epoch": 0.31159838430467396, "grad_norm": 0.78125, "learning_rate": 0.0004995632391172019, "loss": 6.718, "mean_token_accuracy": 0.13914413154125213, "num_tokens": 6805659.0, "step": 2700 }, { "entropy": 6.812787103652954, "epoch": 0.31217541834968265, "grad_norm": 0.84765625, "learning_rate": 0.0004995606654788543, "loss": 6.637, "mean_token_accuracy": 0.14895061701536177, "num_tokens": 6818110.0, "step": 2705 }, { "entropy": 6.727897787094117, "epoch": 0.3127524523946913, "grad_norm": 0.86328125, "learning_rate": 0.0004995580842875202, "loss": 6.6378, "mean_token_accuracy": 0.14641101211309432, "num_tokens": 6830959.0, "step": 2710 }, { "entropy": 6.807159328460694, "epoch": 0.31332948643969993, "grad_norm": 0.8671875, "learning_rate": 0.0004995554955432866, "loss": 6.6977, "mean_token_accuracy": 0.14908618479967117, "num_tokens": 6843318.0, "step": 2715 }, { "entropy": 6.718437242507934, "epoch": 0.3139065204847086, "grad_norm": 0.90234375, "learning_rate": 0.0004995528992462404, "loss": 6.5811, "mean_token_accuracy": 0.1510560542345047, "num_tokens": 6855154.0, "step": 2720 }, { "entropy": 6.71838641166687, "epoch": 0.31448355452971727, "grad_norm": 0.8359375, "learning_rate": 0.000499550295396469, "loss": 6.6456, "mean_token_accuracy": 0.14983784556388854, "num_tokens": 6867428.0, "step": 2725 }, { "entropy": 6.756401872634887, "epoch": 0.3150605885747259, "grad_norm": 0.85546875, "learning_rate": 0.0004995476839940598, "loss": 6.6363, "mean_token_accuracy": 0.15786276906728744, "num_tokens": 6879989.0, "step": 2730 }, { "entropy": 6.777546310424805, "epoch": 0.31563762261973455, "grad_norm": 0.80078125, "learning_rate": 0.000499545065039101, "loss": 6.6447, "mean_token_accuracy": 0.1432705909013748, "num_tokens": 6893179.0, "step": 2735 }, { "entropy": 6.786166429519653, "epoch": 0.31621465666474324, "grad_norm": 0.87890625, "learning_rate": 0.0004995424385316803, "loss": 6.6354, "mean_token_accuracy": 0.1462482675909996, "num_tokens": 6905647.0, "step": 2740 }, { "entropy": 6.713575553894043, "epoch": 0.3167916907097519, "grad_norm": 0.80078125, "learning_rate": 0.0004995398044718863, "loss": 6.6146, "mean_token_accuracy": 0.15827973783016205, "num_tokens": 6917361.0, "step": 2745 }, { "entropy": 6.780123996734619, "epoch": 0.3173687247547605, "grad_norm": 0.91796875, "learning_rate": 0.0004995371628598074, "loss": 6.6339, "mean_token_accuracy": 0.14651651680469513, "num_tokens": 6929515.0, "step": 2750 }, { "entropy": 6.748660898208618, "epoch": 0.31794575879976916, "grad_norm": 0.78125, "learning_rate": 0.0004995345136955328, "loss": 6.6036, "mean_token_accuracy": 0.15300127118825912, "num_tokens": 6942265.0, "step": 2755 }, { "entropy": 6.7021361827850345, "epoch": 0.31852279284477786, "grad_norm": 0.80078125, "learning_rate": 0.0004995318569791512, "loss": 6.661, "mean_token_accuracy": 0.15360585749149322, "num_tokens": 6955151.0, "step": 2760 }, { "entropy": 6.784101343154907, "epoch": 0.3190998268897865, "grad_norm": 0.88671875, "learning_rate": 0.0004995291927107522, "loss": 6.6172, "mean_token_accuracy": 0.1502458855509758, "num_tokens": 6968378.0, "step": 2765 }, { "entropy": 6.669129657745361, "epoch": 0.31967686093479514, "grad_norm": 1.046875, "learning_rate": 0.0004995265208904252, "loss": 6.6216, "mean_token_accuracy": 0.14923231303691864, "num_tokens": 6980083.0, "step": 2770 }, { "entropy": 6.747028255462647, "epoch": 0.32025389497980383, "grad_norm": 0.86328125, "learning_rate": 0.0004995238415182603, "loss": 6.6581, "mean_token_accuracy": 0.1432106763124466, "num_tokens": 6992981.0, "step": 2775 }, { "entropy": 6.844202852249145, "epoch": 0.3208309290248125, "grad_norm": 0.80859375, "learning_rate": 0.0004995211545943476, "loss": 6.6409, "mean_token_accuracy": 0.14744580015540124, "num_tokens": 7006115.0, "step": 2780 }, { "entropy": 6.653217697143555, "epoch": 0.3214079630698211, "grad_norm": 0.8359375, "learning_rate": 0.0004995184601187772, "loss": 6.6014, "mean_token_accuracy": 0.15577706843614578, "num_tokens": 7019176.0, "step": 2785 }, { "entropy": 6.641081857681274, "epoch": 0.32198499711482975, "grad_norm": 0.85546875, "learning_rate": 0.00049951575809164, "loss": 6.5282, "mean_token_accuracy": 0.16437966525554656, "num_tokens": 7031214.0, "step": 2790 }, { "entropy": 6.66480655670166, "epoch": 0.32256203115983845, "grad_norm": 0.875, "learning_rate": 0.0004995130485130269, "loss": 6.6088, "mean_token_accuracy": 0.15185024589300156, "num_tokens": 7044702.0, "step": 2795 }, { "entropy": 6.752944231033325, "epoch": 0.3231390652048471, "grad_norm": 0.81640625, "learning_rate": 0.0004995103313830289, "loss": 6.6018, "mean_token_accuracy": 0.15165336132049562, "num_tokens": 7056489.0, "step": 2800 }, { "entropy": 6.729215812683106, "epoch": 0.3237160992498557, "grad_norm": 0.95703125, "learning_rate": 0.0004995076067017373, "loss": 6.6406, "mean_token_accuracy": 0.14547208398580552, "num_tokens": 7068972.0, "step": 2805 }, { "entropy": 6.74854302406311, "epoch": 0.3242931332948644, "grad_norm": 0.94921875, "learning_rate": 0.0004995048744692439, "loss": 6.5746, "mean_token_accuracy": 0.15244885683059692, "num_tokens": 7080894.0, "step": 2810 }, { "entropy": 6.713599061965942, "epoch": 0.32487016733987306, "grad_norm": 0.76953125, "learning_rate": 0.0004995021346856405, "loss": 6.6122, "mean_token_accuracy": 0.14793540984392167, "num_tokens": 7094427.0, "step": 2815 }, { "entropy": 6.65841121673584, "epoch": 0.3254472013848817, "grad_norm": 0.78515625, "learning_rate": 0.0004994993873510196, "loss": 6.5596, "mean_token_accuracy": 0.16087264865636824, "num_tokens": 7105710.0, "step": 2820 }, { "entropy": 6.793656873703003, "epoch": 0.32602423542989034, "grad_norm": 0.85546875, "learning_rate": 0.0004994966324654731, "loss": 6.5838, "mean_token_accuracy": 0.14802931025624275, "num_tokens": 7119042.0, "step": 2825 }, { "entropy": 6.634446716308593, "epoch": 0.32660126947489904, "grad_norm": 0.84765625, "learning_rate": 0.000499493870029094, "loss": 6.6077, "mean_token_accuracy": 0.148269946873188, "num_tokens": 7132146.0, "step": 2830 }, { "entropy": 6.726744699478149, "epoch": 0.3271783035199077, "grad_norm": 0.80859375, "learning_rate": 0.0004994911000419749, "loss": 6.562, "mean_token_accuracy": 0.15012803077697753, "num_tokens": 7144805.0, "step": 2835 }, { "entropy": 6.6751384258270265, "epoch": 0.3277553375649163, "grad_norm": 0.859375, "learning_rate": 0.0004994883225042093, "loss": 6.5475, "mean_token_accuracy": 0.16178591400384904, "num_tokens": 7156906.0, "step": 2840 }, { "entropy": 6.753067064285278, "epoch": 0.328332371609925, "grad_norm": 0.94921875, "learning_rate": 0.0004994855374158905, "loss": 6.5298, "mean_token_accuracy": 0.15081926435232162, "num_tokens": 7169451.0, "step": 2845 }, { "entropy": 6.7513651847839355, "epoch": 0.32890940565493365, "grad_norm": 0.75, "learning_rate": 0.000499482744777112, "loss": 6.675, "mean_token_accuracy": 0.14404026567935943, "num_tokens": 7183211.0, "step": 2850 }, { "entropy": 6.7373758316040036, "epoch": 0.3294864396999423, "grad_norm": 0.88671875, "learning_rate": 0.000499479944587968, "loss": 6.6147, "mean_token_accuracy": 0.1517378196120262, "num_tokens": 7196062.0, "step": 2855 }, { "entropy": 6.794651794433594, "epoch": 0.33006347374495093, "grad_norm": 0.91796875, "learning_rate": 0.0004994771368485526, "loss": 6.7089, "mean_token_accuracy": 0.14450829550623895, "num_tokens": 7208079.0, "step": 2860 }, { "entropy": 6.799776029586792, "epoch": 0.3306405077899596, "grad_norm": 0.92578125, "learning_rate": 0.0004994743215589602, "loss": 6.656, "mean_token_accuracy": 0.14721468538045884, "num_tokens": 7221537.0, "step": 2865 }, { "entropy": 6.66144700050354, "epoch": 0.33121754183496827, "grad_norm": 0.79296875, "learning_rate": 0.0004994714987192854, "loss": 6.6285, "mean_token_accuracy": 0.14779918044805526, "num_tokens": 7234472.0, "step": 2870 }, { "entropy": 6.707424116134644, "epoch": 0.3317945758799769, "grad_norm": 0.890625, "learning_rate": 0.0004994686683296234, "loss": 6.5847, "mean_token_accuracy": 0.15313812494277954, "num_tokens": 7247818.0, "step": 2875 }, { "entropy": 6.695041847229004, "epoch": 0.3323716099249856, "grad_norm": 0.7421875, "learning_rate": 0.0004994658303900691, "loss": 6.6729, "mean_token_accuracy": 0.15236686170101166, "num_tokens": 7261351.0, "step": 2880 }, { "entropy": 6.677237319946289, "epoch": 0.33294864396999424, "grad_norm": 0.80078125, "learning_rate": 0.0004994629849007182, "loss": 6.5247, "mean_token_accuracy": 0.15475201308727266, "num_tokens": 7274310.0, "step": 2885 }, { "entropy": 6.6607647895812985, "epoch": 0.3335256780150029, "grad_norm": 0.8203125, "learning_rate": 0.0004994601318616663, "loss": 6.5631, "mean_token_accuracy": 0.15157887637615203, "num_tokens": 7286560.0, "step": 2890 }, { "entropy": 6.811610126495362, "epoch": 0.3341027120600115, "grad_norm": 0.79296875, "learning_rate": 0.0004994572712730092, "loss": 6.6486, "mean_token_accuracy": 0.14426497519016265, "num_tokens": 7300337.0, "step": 2895 }, { "entropy": 6.691228675842285, "epoch": 0.3346797461050202, "grad_norm": 0.80078125, "learning_rate": 0.0004994544031348434, "loss": 6.6194, "mean_token_accuracy": 0.1486266866326332, "num_tokens": 7313436.0, "step": 2900 }, { "entropy": 6.666589450836182, "epoch": 0.33525678015002885, "grad_norm": 0.8125, "learning_rate": 0.0004994515274472653, "loss": 6.4758, "mean_token_accuracy": 0.16475249975919723, "num_tokens": 7325766.0, "step": 2905 }, { "entropy": 6.611915159225464, "epoch": 0.3358338141950375, "grad_norm": 0.9609375, "learning_rate": 0.0004994486442103715, "loss": 6.5599, "mean_token_accuracy": 0.14973128736019134, "num_tokens": 7337904.0, "step": 2910 }, { "entropy": 6.648727655410767, "epoch": 0.3364108482400462, "grad_norm": 0.82421875, "learning_rate": 0.000499445753424259, "loss": 6.5601, "mean_token_accuracy": 0.15160418599843978, "num_tokens": 7350448.0, "step": 2915 }, { "entropy": 6.7852109432220455, "epoch": 0.33698788228505483, "grad_norm": 0.78515625, "learning_rate": 0.0004994428550890251, "loss": 6.5957, "mean_token_accuracy": 0.1476546384394169, "num_tokens": 7363859.0, "step": 2920 }, { "entropy": 6.703492069244385, "epoch": 0.33756491633006347, "grad_norm": 0.8125, "learning_rate": 0.0004994399492047672, "loss": 6.6148, "mean_token_accuracy": 0.1489669606089592, "num_tokens": 7376963.0, "step": 2925 }, { "entropy": 6.677239227294922, "epoch": 0.3381419503750721, "grad_norm": 0.8203125, "learning_rate": 0.0004994370357715832, "loss": 6.6462, "mean_token_accuracy": 0.14910098984837533, "num_tokens": 7390370.0, "step": 2930 }, { "entropy": 6.712501335144043, "epoch": 0.3387189844200808, "grad_norm": 0.79296875, "learning_rate": 0.000499434114789571, "loss": 6.5836, "mean_token_accuracy": 0.15484795421361924, "num_tokens": 7402851.0, "step": 2935 }, { "entropy": 6.638098287582397, "epoch": 0.33929601846508944, "grad_norm": 0.8046875, "learning_rate": 0.0004994311862588286, "loss": 6.6003, "mean_token_accuracy": 0.14664260819554328, "num_tokens": 7415428.0, "step": 2940 }, { "entropy": 6.786514616012573, "epoch": 0.3398730525100981, "grad_norm": 0.7890625, "learning_rate": 0.0004994282501794551, "loss": 6.5911, "mean_token_accuracy": 0.15048429667949675, "num_tokens": 7428420.0, "step": 2945 }, { "entropy": 6.686578941345215, "epoch": 0.3404500865551068, "grad_norm": 0.921875, "learning_rate": 0.0004994253065515486, "loss": 6.6436, "mean_token_accuracy": 0.15113215446472167, "num_tokens": 7439626.0, "step": 2950 }, { "entropy": 6.725645685195923, "epoch": 0.3410271206001154, "grad_norm": 0.83203125, "learning_rate": 0.0004994223553752084, "loss": 6.5901, "mean_token_accuracy": 0.1514264941215515, "num_tokens": 7452797.0, "step": 2955 }, { "entropy": 6.65960373878479, "epoch": 0.34160415464512406, "grad_norm": 0.8359375, "learning_rate": 0.0004994193966505339, "loss": 6.5682, "mean_token_accuracy": 0.15812762975692748, "num_tokens": 7464311.0, "step": 2960 }, { "entropy": 6.6784382343292235, "epoch": 0.3421811886901327, "grad_norm": 0.8828125, "learning_rate": 0.0004994164303776244, "loss": 6.5852, "mean_token_accuracy": 0.15011241137981415, "num_tokens": 7475706.0, "step": 2965 }, { "entropy": 6.7143481254577635, "epoch": 0.3427582227351414, "grad_norm": 0.8125, "learning_rate": 0.0004994134565565797, "loss": 6.6579, "mean_token_accuracy": 0.1478770911693573, "num_tokens": 7489077.0, "step": 2970 }, { "entropy": 6.736965751647949, "epoch": 0.34333525678015003, "grad_norm": 0.796875, "learning_rate": 0.0004994104751875, "loss": 6.6074, "mean_token_accuracy": 0.15452702343463898, "num_tokens": 7501598.0, "step": 2975 }, { "entropy": 6.608485174179077, "epoch": 0.3439122908251587, "grad_norm": 0.9921875, "learning_rate": 0.0004994074862704854, "loss": 6.4109, "mean_token_accuracy": 0.16355000287294388, "num_tokens": 7514776.0, "step": 2980 }, { "entropy": 6.584009838104248, "epoch": 0.3444893248701673, "grad_norm": 0.81640625, "learning_rate": 0.0004994044898056363, "loss": 6.5766, "mean_token_accuracy": 0.15253832191228867, "num_tokens": 7527795.0, "step": 2985 }, { "entropy": 6.702622604370117, "epoch": 0.345066358915176, "grad_norm": 0.8828125, "learning_rate": 0.0004994014857930538, "loss": 6.4427, "mean_token_accuracy": 0.1624614641070366, "num_tokens": 7541392.0, "step": 2990 }, { "entropy": 6.615006446838379, "epoch": 0.34564339296018465, "grad_norm": 0.8046875, "learning_rate": 0.0004993984742328387, "loss": 6.601, "mean_token_accuracy": 0.15036358386278154, "num_tokens": 7554369.0, "step": 2995 }, { "entropy": 6.672338581085205, "epoch": 0.3462204270051933, "grad_norm": 0.92578125, "learning_rate": 0.0004993954551250925, "loss": 6.603, "mean_token_accuracy": 0.154202963411808, "num_tokens": 7567528.0, "step": 3000 }, { "epoch": 0.3462204270051933, "eval_entropy": 6.5903391438110805, "eval_loss": 6.633339881896973, "eval_mean_token_accuracy": 0.15343972800560624, "eval_num_tokens": 7567528.0, "eval_runtime": 17.6947, "eval_samples_per_second": 1590.081, "eval_steps_per_second": 198.76, "step": 3000 }, { "entropy": 6.706592988967896, "epoch": 0.346797461050202, "grad_norm": 0.7890625, "learning_rate": 0.0004993924284699165, "loss": 6.5524, "mean_token_accuracy": 0.15312376469373704, "num_tokens": 7579146.0, "step": 3005 }, { "entropy": 6.66014552116394, "epoch": 0.3473744950952106, "grad_norm": 0.84765625, "learning_rate": 0.0004993893942674127, "loss": 6.64, "mean_token_accuracy": 0.1477951481938362, "num_tokens": 7591902.0, "step": 3010 }, { "entropy": 6.799589061737061, "epoch": 0.34795152914021926, "grad_norm": 0.8671875, "learning_rate": 0.000499386352517683, "loss": 6.6448, "mean_token_accuracy": 0.1552356779575348, "num_tokens": 7605565.0, "step": 3015 }, { "entropy": 6.7373872756958, "epoch": 0.3485285631852279, "grad_norm": 0.7578125, "learning_rate": 0.00049938330322083, "loss": 6.5734, "mean_token_accuracy": 0.15451606512069702, "num_tokens": 7618380.0, "step": 3020 }, { "entropy": 6.653174638748169, "epoch": 0.3491055972302366, "grad_norm": 0.80859375, "learning_rate": 0.0004993802463769558, "loss": 6.6035, "mean_token_accuracy": 0.14853976368904115, "num_tokens": 7632092.0, "step": 3025 }, { "entropy": 6.6859503269195555, "epoch": 0.34968263127524524, "grad_norm": 0.9140625, "learning_rate": 0.0004993771819861636, "loss": 6.6097, "mean_token_accuracy": 0.14797925502061843, "num_tokens": 7644185.0, "step": 3030 }, { "entropy": 6.741736364364624, "epoch": 0.3502596653202539, "grad_norm": 0.83203125, "learning_rate": 0.0004993741100485564, "loss": 6.5012, "mean_token_accuracy": 0.15530159771442414, "num_tokens": 7656635.0, "step": 3035 }, { "entropy": 6.64942421913147, "epoch": 0.35083669936526257, "grad_norm": 0.8203125, "learning_rate": 0.0004993710305642374, "loss": 6.5621, "mean_token_accuracy": 0.15173622369766235, "num_tokens": 7669643.0, "step": 3040 }, { "entropy": 6.688398933410644, "epoch": 0.3514137334102712, "grad_norm": 0.79296875, "learning_rate": 0.0004993679435333102, "loss": 6.5822, "mean_token_accuracy": 0.14759134352207184, "num_tokens": 7682489.0, "step": 3045 }, { "entropy": 6.630285358428955, "epoch": 0.35199076745527985, "grad_norm": 1.2421875, "learning_rate": 0.0004993648489558788, "loss": 6.5269, "mean_token_accuracy": 0.15159836709499358, "num_tokens": 7696670.0, "step": 3050 }, { "entropy": 6.6929933547973635, "epoch": 0.3525678015002885, "grad_norm": 0.859375, "learning_rate": 0.0004993617468320471, "loss": 6.5451, "mean_token_accuracy": 0.15906845778226852, "num_tokens": 7709054.0, "step": 3055 }, { "entropy": 6.634079313278198, "epoch": 0.3531448355452972, "grad_norm": 0.87109375, "learning_rate": 0.0004993586371619193, "loss": 6.5548, "mean_token_accuracy": 0.15278329253196715, "num_tokens": 7721710.0, "step": 3060 }, { "entropy": 6.722148132324219, "epoch": 0.3537218695903058, "grad_norm": 0.77734375, "learning_rate": 0.0004993555199456004, "loss": 6.6095, "mean_token_accuracy": 0.1526441752910614, "num_tokens": 7733689.0, "step": 3065 }, { "entropy": 6.66739444732666, "epoch": 0.35429890363531447, "grad_norm": 0.8046875, "learning_rate": 0.0004993523951831949, "loss": 6.5803, "mean_token_accuracy": 0.1555978015065193, "num_tokens": 7745735.0, "step": 3070 }, { "entropy": 6.7588379859924315, "epoch": 0.35487593768032316, "grad_norm": 0.83203125, "learning_rate": 0.0004993492628748081, "loss": 6.5894, "mean_token_accuracy": 0.14369118213653564, "num_tokens": 7757352.0, "step": 3075 }, { "entropy": 6.6846785068511965, "epoch": 0.3554529717253318, "grad_norm": 0.83984375, "learning_rate": 0.0004993461230205453, "loss": 6.5369, "mean_token_accuracy": 0.14949805587530135, "num_tokens": 7768363.0, "step": 3080 }, { "entropy": 6.668369150161743, "epoch": 0.35603000577034044, "grad_norm": 0.83203125, "learning_rate": 0.0004993429756205121, "loss": 6.6618, "mean_token_accuracy": 0.14399161487817763, "num_tokens": 7781133.0, "step": 3085 }, { "entropy": 6.810355234146118, "epoch": 0.3566070398153491, "grad_norm": 0.8515625, "learning_rate": 0.0004993398206748142, "loss": 6.6461, "mean_token_accuracy": 0.14326538443565368, "num_tokens": 7794445.0, "step": 3090 }, { "entropy": 6.689512538909912, "epoch": 0.3571840738603578, "grad_norm": 0.79296875, "learning_rate": 0.0004993366581835581, "loss": 6.5431, "mean_token_accuracy": 0.15431275665760041, "num_tokens": 7807601.0, "step": 3095 }, { "entropy": 6.592484951019287, "epoch": 0.3577611079053664, "grad_norm": 0.80859375, "learning_rate": 0.0004993334881468498, "loss": 6.5139, "mean_token_accuracy": 0.1561570018529892, "num_tokens": 7819821.0, "step": 3100 }, { "entropy": 6.691237831115723, "epoch": 0.35833814195037506, "grad_norm": 0.91796875, "learning_rate": 0.0004993303105647961, "loss": 6.5343, "mean_token_accuracy": 0.15187687054276466, "num_tokens": 7832214.0, "step": 3105 }, { "entropy": 6.638499784469604, "epoch": 0.35891517599538375, "grad_norm": 0.8671875, "learning_rate": 0.0004993271254375038, "loss": 6.5741, "mean_token_accuracy": 0.16051387637853623, "num_tokens": 7844566.0, "step": 3110 }, { "entropy": 6.710163545608521, "epoch": 0.3594922100403924, "grad_norm": 0.78125, "learning_rate": 0.00049932393276508, "loss": 6.5434, "mean_token_accuracy": 0.15657812282443045, "num_tokens": 7857965.0, "step": 3115 }, { "entropy": 6.603605270385742, "epoch": 0.36006924408540103, "grad_norm": 1.0859375, "learning_rate": 0.0004993207325476323, "loss": 6.5691, "mean_token_accuracy": 0.1569638028740883, "num_tokens": 7870902.0, "step": 3120 }, { "entropy": 6.778155136108398, "epoch": 0.36064627813040967, "grad_norm": 0.828125, "learning_rate": 0.0004993175247852681, "loss": 6.6299, "mean_token_accuracy": 0.14303801953792572, "num_tokens": 7883694.0, "step": 3125 }, { "entropy": 6.624432468414307, "epoch": 0.36122331217541837, "grad_norm": 0.84765625, "learning_rate": 0.0004993143094780954, "loss": 6.52, "mean_token_accuracy": 0.1570071041584015, "num_tokens": 7896693.0, "step": 3130 }, { "entropy": 6.6653848648071286, "epoch": 0.361800346220427, "grad_norm": 0.765625, "learning_rate": 0.0004993110866262224, "loss": 6.519, "mean_token_accuracy": 0.15744696259498597, "num_tokens": 7910010.0, "step": 3135 }, { "entropy": 6.7992534160614015, "epoch": 0.36237738026543564, "grad_norm": 0.87109375, "learning_rate": 0.0004993078562297573, "loss": 6.6268, "mean_token_accuracy": 0.13919368460774423, "num_tokens": 7922026.0, "step": 3140 }, { "entropy": 6.626803922653198, "epoch": 0.36295441431044434, "grad_norm": 0.87890625, "learning_rate": 0.0004993046182888089, "loss": 6.5974, "mean_token_accuracy": 0.14518485516309737, "num_tokens": 7934633.0, "step": 3145 }, { "entropy": 6.703473472595215, "epoch": 0.363531448355453, "grad_norm": 0.94921875, "learning_rate": 0.0004993013728034861, "loss": 6.5012, "mean_token_accuracy": 0.15910948514938356, "num_tokens": 7947189.0, "step": 3150 }, { "entropy": 6.645997714996338, "epoch": 0.3641084824004616, "grad_norm": 1.421875, "learning_rate": 0.000499298119773898, "loss": 6.5815, "mean_token_accuracy": 0.15228615552186966, "num_tokens": 7961283.0, "step": 3155 }, { "entropy": 6.584298086166382, "epoch": 0.36468551644547026, "grad_norm": 0.859375, "learning_rate": 0.0004992948592001541, "loss": 6.549, "mean_token_accuracy": 0.157489425688982, "num_tokens": 7974589.0, "step": 3160 }, { "entropy": 6.723839282989502, "epoch": 0.36526255049047895, "grad_norm": 0.8515625, "learning_rate": 0.000499291591082364, "loss": 6.5873, "mean_token_accuracy": 0.1510259687900543, "num_tokens": 7987148.0, "step": 3165 }, { "entropy": 6.713741779327393, "epoch": 0.3658395845354876, "grad_norm": 0.796875, "learning_rate": 0.0004992883154206377, "loss": 6.6151, "mean_token_accuracy": 0.15011707395315171, "num_tokens": 8000679.0, "step": 3170 }, { "entropy": 6.601009368896484, "epoch": 0.36641661858049623, "grad_norm": 0.828125, "learning_rate": 0.0004992850322150853, "loss": 6.4989, "mean_token_accuracy": 0.1541821539402008, "num_tokens": 8014011.0, "step": 3175 }, { "entropy": 6.708580017089844, "epoch": 0.36699365262550493, "grad_norm": 0.7734375, "learning_rate": 0.0004992817414658172, "loss": 6.5279, "mean_token_accuracy": 0.1508907914161682, "num_tokens": 8026022.0, "step": 3180 }, { "entropy": 6.696759557723999, "epoch": 0.36757068667051357, "grad_norm": 0.90625, "learning_rate": 0.0004992784431729442, "loss": 6.5946, "mean_token_accuracy": 0.15226232409477233, "num_tokens": 8040123.0, "step": 3185 }, { "entropy": 6.711783027648925, "epoch": 0.3681477207155222, "grad_norm": 0.87109375, "learning_rate": 0.0004992751373365771, "loss": 6.5655, "mean_token_accuracy": 0.1614807665348053, "num_tokens": 8053320.0, "step": 3190 }, { "entropy": 6.583008337020874, "epoch": 0.36872475476053085, "grad_norm": 0.76953125, "learning_rate": 0.0004992718239568273, "loss": 6.5506, "mean_token_accuracy": 0.15854466408491136, "num_tokens": 8066682.0, "step": 3195 }, { "entropy": 6.743299245834351, "epoch": 0.36930178880553954, "grad_norm": 0.7890625, "learning_rate": 0.000499268503033806, "loss": 6.5441, "mean_token_accuracy": 0.15438564270734786, "num_tokens": 8078887.0, "step": 3200 }, { "entropy": 6.632726764678955, "epoch": 0.3698788228505482, "grad_norm": 0.8671875, "learning_rate": 0.0004992651745676249, "loss": 6.5254, "mean_token_accuracy": 0.14970515072345733, "num_tokens": 8090801.0, "step": 3205 }, { "entropy": 6.689233827590942, "epoch": 0.3704558568955568, "grad_norm": 0.86328125, "learning_rate": 0.0004992618385583962, "loss": 6.6118, "mean_token_accuracy": 0.150309057533741, "num_tokens": 8103387.0, "step": 3210 }, { "entropy": 6.599812173843384, "epoch": 0.3710328909405655, "grad_norm": 0.84375, "learning_rate": 0.0004992584950062319, "loss": 6.4614, "mean_token_accuracy": 0.15385584011673928, "num_tokens": 8115356.0, "step": 3215 }, { "entropy": 6.6642804622650145, "epoch": 0.37160992498557416, "grad_norm": 0.83203125, "learning_rate": 0.0004992551439112446, "loss": 6.5755, "mean_token_accuracy": 0.15292710214853286, "num_tokens": 8129141.0, "step": 3220 }, { "entropy": 6.788556814193726, "epoch": 0.3721869590305828, "grad_norm": 0.83203125, "learning_rate": 0.0004992517852735469, "loss": 6.6057, "mean_token_accuracy": 0.15070945620536805, "num_tokens": 8142453.0, "step": 3225 }, { "entropy": 6.635298871994019, "epoch": 0.37276399307559144, "grad_norm": 0.8046875, "learning_rate": 0.0004992484190932517, "loss": 6.5671, "mean_token_accuracy": 0.15121689140796662, "num_tokens": 8154361.0, "step": 3230 }, { "entropy": 6.688446187973023, "epoch": 0.37334102712060013, "grad_norm": 0.81640625, "learning_rate": 0.0004992450453704723, "loss": 6.6194, "mean_token_accuracy": 0.1466634377837181, "num_tokens": 8168354.0, "step": 3235 }, { "entropy": 6.704189300537109, "epoch": 0.3739180611656088, "grad_norm": 0.8125, "learning_rate": 0.0004992416641053223, "loss": 6.561, "mean_token_accuracy": 0.1562179759144783, "num_tokens": 8180700.0, "step": 3240 }, { "entropy": 6.630801677703857, "epoch": 0.3744950952106174, "grad_norm": 0.765625, "learning_rate": 0.0004992382752979153, "loss": 6.5558, "mean_token_accuracy": 0.15030025094747543, "num_tokens": 8193987.0, "step": 3245 }, { "entropy": 6.665634822845459, "epoch": 0.3750721292556261, "grad_norm": 0.78125, "learning_rate": 0.0004992348789483651, "loss": 6.6435, "mean_token_accuracy": 0.15180691108107566, "num_tokens": 8207150.0, "step": 3250 }, { "entropy": 6.734830856323242, "epoch": 0.37564916330063475, "grad_norm": 0.7734375, "learning_rate": 0.0004992314750567864, "loss": 6.5991, "mean_token_accuracy": 0.1455582395195961, "num_tokens": 8221050.0, "step": 3255 }, { "entropy": 6.682382249832154, "epoch": 0.3762261973456434, "grad_norm": 0.8046875, "learning_rate": 0.0004992280636232933, "loss": 6.5269, "mean_token_accuracy": 0.1531355321407318, "num_tokens": 8233641.0, "step": 3260 }, { "entropy": 6.685485553741455, "epoch": 0.376803231390652, "grad_norm": 0.828125, "learning_rate": 0.0004992246446480007, "loss": 6.5393, "mean_token_accuracy": 0.1599086806178093, "num_tokens": 8246717.0, "step": 3265 }, { "entropy": 6.670789384841919, "epoch": 0.3773802654356607, "grad_norm": 0.859375, "learning_rate": 0.0004992212181310235, "loss": 6.5781, "mean_token_accuracy": 0.1480855494737625, "num_tokens": 8258549.0, "step": 3270 }, { "entropy": 6.667711162567139, "epoch": 0.37795729948066936, "grad_norm": 1.0078125, "learning_rate": 0.000499217784072477, "loss": 6.5681, "mean_token_accuracy": 0.15179934725165367, "num_tokens": 8271580.0, "step": 3275 }, { "entropy": 6.632532358169556, "epoch": 0.378534333525678, "grad_norm": 0.93359375, "learning_rate": 0.0004992143424724768, "loss": 6.5012, "mean_token_accuracy": 0.16231818795204161, "num_tokens": 8283866.0, "step": 3280 }, { "entropy": 6.666814136505127, "epoch": 0.3791113675706867, "grad_norm": 0.89453125, "learning_rate": 0.0004992108933311385, "loss": 6.546, "mean_token_accuracy": 0.1500297874212265, "num_tokens": 8296141.0, "step": 3285 }, { "entropy": 6.701229381561279, "epoch": 0.37968840161569534, "grad_norm": 0.9140625, "learning_rate": 0.0004992074366485782, "loss": 6.5113, "mean_token_accuracy": 0.15184457004070281, "num_tokens": 8309028.0, "step": 3290 }, { "entropy": 6.686760330200196, "epoch": 0.380265435660704, "grad_norm": 0.82421875, "learning_rate": 0.000499203972424912, "loss": 6.498, "mean_token_accuracy": 0.15328776091337204, "num_tokens": 8321268.0, "step": 3295 }, { "entropy": 6.590341329574585, "epoch": 0.3808424697057126, "grad_norm": 0.828125, "learning_rate": 0.0004992005006602567, "loss": 6.507, "mean_token_accuracy": 0.16145216226577758, "num_tokens": 8333518.0, "step": 3300 }, { "entropy": 6.609353303909302, "epoch": 0.3814195037507213, "grad_norm": 0.88671875, "learning_rate": 0.0004991970213547289, "loss": 6.5272, "mean_token_accuracy": 0.15743554830551149, "num_tokens": 8345639.0, "step": 3305 }, { "entropy": 6.561810779571533, "epoch": 0.38199653779572995, "grad_norm": 0.828125, "learning_rate": 0.0004991935345084457, "loss": 6.4193, "mean_token_accuracy": 0.15771780014038086, "num_tokens": 8358136.0, "step": 3310 }, { "entropy": 6.7044079303741455, "epoch": 0.3825735718407386, "grad_norm": 0.8359375, "learning_rate": 0.0004991900401215243, "loss": 6.5946, "mean_token_accuracy": 0.14319533258676528, "num_tokens": 8370480.0, "step": 3315 }, { "entropy": 6.665462303161621, "epoch": 0.3831506058857473, "grad_norm": 0.8984375, "learning_rate": 0.0004991865381940822, "loss": 6.5106, "mean_token_accuracy": 0.15779313147068025, "num_tokens": 8382894.0, "step": 3320 }, { "entropy": 6.643408632278442, "epoch": 0.3837276399307559, "grad_norm": 0.8671875, "learning_rate": 0.0004991830287262374, "loss": 6.603, "mean_token_accuracy": 0.15157458335161209, "num_tokens": 8395864.0, "step": 3325 }, { "entropy": 6.72900710105896, "epoch": 0.38430467397576457, "grad_norm": 0.828125, "learning_rate": 0.0004991795117181077, "loss": 6.6255, "mean_token_accuracy": 0.14565462321043016, "num_tokens": 8408242.0, "step": 3330 }, { "entropy": 6.697143411636352, "epoch": 0.3848817080207732, "grad_norm": 0.83203125, "learning_rate": 0.0004991759871698113, "loss": 6.5052, "mean_token_accuracy": 0.15765076875686646, "num_tokens": 8420677.0, "step": 3335 }, { "entropy": 6.566110467910766, "epoch": 0.3854587420657819, "grad_norm": 0.875, "learning_rate": 0.0004991724550814671, "loss": 6.5212, "mean_token_accuracy": 0.16033077090978623, "num_tokens": 8434505.0, "step": 3340 }, { "entropy": 6.772804021835327, "epoch": 0.38603577611079054, "grad_norm": 0.8515625, "learning_rate": 0.0004991689154531937, "loss": 6.5408, "mean_token_accuracy": 0.1514905296266079, "num_tokens": 8447393.0, "step": 3345 }, { "entropy": 6.630925416946411, "epoch": 0.3866128101557992, "grad_norm": 0.8359375, "learning_rate": 0.0004991653682851102, "loss": 6.4492, "mean_token_accuracy": 0.15575905442237853, "num_tokens": 8459659.0, "step": 3350 }, { "entropy": 6.618975067138672, "epoch": 0.3871898442008078, "grad_norm": 0.78125, "learning_rate": 0.000499161813577336, "loss": 6.5953, "mean_token_accuracy": 0.1454840660095215, "num_tokens": 8473783.0, "step": 3355 }, { "entropy": 6.637290287017822, "epoch": 0.3877668782458165, "grad_norm": 0.84375, "learning_rate": 0.0004991582513299903, "loss": 6.38, "mean_token_accuracy": 0.15462302714586257, "num_tokens": 8486532.0, "step": 3360 }, { "entropy": 6.563358974456787, "epoch": 0.38834391229082516, "grad_norm": 1.1875, "learning_rate": 0.0004991546815431932, "loss": 6.5613, "mean_token_accuracy": 0.15162240266799926, "num_tokens": 8499133.0, "step": 3365 }, { "entropy": 6.700711011886597, "epoch": 0.3889209463358338, "grad_norm": 0.80078125, "learning_rate": 0.000499151104217065, "loss": 6.5991, "mean_token_accuracy": 0.1459987446665764, "num_tokens": 8513391.0, "step": 3370 }, { "entropy": 6.657787609100342, "epoch": 0.3894979803808425, "grad_norm": 0.79296875, "learning_rate": 0.0004991475193517254, "loss": 6.5366, "mean_token_accuracy": 0.1531873255968094, "num_tokens": 8527191.0, "step": 3375 }, { "entropy": 6.656068611145019, "epoch": 0.39007501442585113, "grad_norm": 0.76171875, "learning_rate": 0.0004991439269472956, "loss": 6.5855, "mean_token_accuracy": 0.15025382339954377, "num_tokens": 8541328.0, "step": 3380 }, { "entropy": 6.641211032867432, "epoch": 0.39065204847085977, "grad_norm": 0.92578125, "learning_rate": 0.0004991403270038961, "loss": 6.493, "mean_token_accuracy": 0.14907428622245789, "num_tokens": 8553381.0, "step": 3385 }, { "entropy": 6.629001951217651, "epoch": 0.3912290825158684, "grad_norm": 0.91015625, "learning_rate": 0.000499136719521648, "loss": 6.5109, "mean_token_accuracy": 0.14996647387742995, "num_tokens": 8565149.0, "step": 3390 }, { "entropy": 6.6479668617248535, "epoch": 0.3918061165608771, "grad_norm": 1.390625, "learning_rate": 0.0004991331045006726, "loss": 6.5134, "mean_token_accuracy": 0.1577385514974594, "num_tokens": 8576767.0, "step": 3395 }, { "entropy": 6.707239389419556, "epoch": 0.39238315060588574, "grad_norm": 0.83203125, "learning_rate": 0.0004991294819410916, "loss": 6.5702, "mean_token_accuracy": 0.15049649626016617, "num_tokens": 8589948.0, "step": 3400 }, { "entropy": 6.554754066467285, "epoch": 0.3929601846508944, "grad_norm": 0.80078125, "learning_rate": 0.0004991258518430268, "loss": 6.4066, "mean_token_accuracy": 0.1551789790391922, "num_tokens": 8602233.0, "step": 3405 }, { "entropy": 6.66826901435852, "epoch": 0.3935372186959031, "grad_norm": 1.2890625, "learning_rate": 0.0004991222142066003, "loss": 6.4969, "mean_token_accuracy": 0.15271663516759873, "num_tokens": 8614938.0, "step": 3410 }, { "entropy": 6.688100671768188, "epoch": 0.3941142527409117, "grad_norm": 0.78125, "learning_rate": 0.0004991185690319345, "loss": 6.5324, "mean_token_accuracy": 0.1585379496216774, "num_tokens": 8628203.0, "step": 3415 }, { "entropy": 6.593408536911011, "epoch": 0.39469128678592036, "grad_norm": 0.84765625, "learning_rate": 0.000499114916319152, "loss": 6.5038, "mean_token_accuracy": 0.1594579190015793, "num_tokens": 8640959.0, "step": 3420 }, { "entropy": 6.617645931243897, "epoch": 0.395268320830929, "grad_norm": 0.7265625, "learning_rate": 0.0004991112560683755, "loss": 6.5159, "mean_token_accuracy": 0.15616845935583115, "num_tokens": 8656995.0, "step": 3425 }, { "entropy": 6.678982210159302, "epoch": 0.3958453548759377, "grad_norm": 0.7578125, "learning_rate": 0.0004991075882797283, "loss": 6.5291, "mean_token_accuracy": 0.15549861565232276, "num_tokens": 8671476.0, "step": 3430 }, { "entropy": 6.627415466308594, "epoch": 0.39642238892094633, "grad_norm": 0.87890625, "learning_rate": 0.0004991039129533337, "loss": 6.5481, "mean_token_accuracy": 0.1529051437973976, "num_tokens": 8683667.0, "step": 3435 }, { "entropy": 6.644215297698975, "epoch": 0.396999422965955, "grad_norm": 0.8125, "learning_rate": 0.0004991002300893152, "loss": 6.5546, "mean_token_accuracy": 0.1545812577009201, "num_tokens": 8696564.0, "step": 3440 }, { "entropy": 6.669400453567505, "epoch": 0.39757645701096367, "grad_norm": 0.83203125, "learning_rate": 0.0004990965396877969, "loss": 6.4865, "mean_token_accuracy": 0.15339938551187515, "num_tokens": 8708512.0, "step": 3445 }, { "entropy": 6.609234380722046, "epoch": 0.3981534910559723, "grad_norm": 0.8359375, "learning_rate": 0.0004990928417489027, "loss": 6.3673, "mean_token_accuracy": 0.16587528437376023, "num_tokens": 8721015.0, "step": 3450 }, { "entropy": 6.567390012741089, "epoch": 0.39873052510098095, "grad_norm": 0.83984375, "learning_rate": 0.0004990891362727572, "loss": 6.4854, "mean_token_accuracy": 0.15047257542610168, "num_tokens": 8732538.0, "step": 3455 }, { "entropy": 6.679238510131836, "epoch": 0.3993075591459896, "grad_norm": 0.78515625, "learning_rate": 0.0004990854232594848, "loss": 6.5582, "mean_token_accuracy": 0.15114261358976364, "num_tokens": 8745093.0, "step": 3460 }, { "entropy": 6.634946250915528, "epoch": 0.3998845931909983, "grad_norm": 0.78515625, "learning_rate": 0.0004990817027092106, "loss": 6.4983, "mean_token_accuracy": 0.15687089264392853, "num_tokens": 8757441.0, "step": 3465 }, { "entropy": 6.660363864898682, "epoch": 0.4004616272360069, "grad_norm": 0.859375, "learning_rate": 0.0004990779746220595, "loss": 6.5185, "mean_token_accuracy": 0.15596205741167068, "num_tokens": 8770307.0, "step": 3470 }, { "entropy": 6.5660014152526855, "epoch": 0.40103866128101556, "grad_norm": 0.765625, "learning_rate": 0.0004990742389981572, "loss": 6.5366, "mean_token_accuracy": 0.1550653576850891, "num_tokens": 8782575.0, "step": 3475 }, { "entropy": 6.664673566818237, "epoch": 0.40161569532602426, "grad_norm": 0.8046875, "learning_rate": 0.000499070495837629, "loss": 6.5848, "mean_token_accuracy": 0.14479815810918809, "num_tokens": 8794962.0, "step": 3480 }, { "entropy": 6.661259126663208, "epoch": 0.4021927293710329, "grad_norm": 0.80859375, "learning_rate": 0.0004990667451406012, "loss": 6.5674, "mean_token_accuracy": 0.1521621063351631, "num_tokens": 8807434.0, "step": 3485 }, { "entropy": 6.673516368865966, "epoch": 0.40276976341604154, "grad_norm": 0.91015625, "learning_rate": 0.0004990629869071995, "loss": 6.5391, "mean_token_accuracy": 0.14591969475150107, "num_tokens": 8820748.0, "step": 3490 }, { "entropy": 6.604957246780396, "epoch": 0.4033467974610502, "grad_norm": 0.83203125, "learning_rate": 0.0004990592211375506, "loss": 6.465, "mean_token_accuracy": 0.15596169531345366, "num_tokens": 8833428.0, "step": 3495 }, { "entropy": 6.66051025390625, "epoch": 0.4039238315060589, "grad_norm": 0.828125, "learning_rate": 0.0004990554478317811, "loss": 6.5121, "mean_token_accuracy": 0.14970427826046945, "num_tokens": 8845892.0, "step": 3500 }, { "entropy": 6.575010538101196, "epoch": 0.4045008655510675, "grad_norm": 0.85546875, "learning_rate": 0.0004990516669900179, "loss": 6.4569, "mean_token_accuracy": 0.155875825881958, "num_tokens": 8857508.0, "step": 3505 }, { "entropy": 6.607421207427978, "epoch": 0.40507789959607615, "grad_norm": 0.859375, "learning_rate": 0.0004990478786123882, "loss": 6.492, "mean_token_accuracy": 0.1571622833609581, "num_tokens": 8868730.0, "step": 3510 }, { "entropy": 6.664318418502807, "epoch": 0.40565493364108485, "grad_norm": 0.75390625, "learning_rate": 0.0004990440826990193, "loss": 6.4882, "mean_token_accuracy": 0.14911171048879623, "num_tokens": 8882687.0, "step": 3515 }, { "entropy": 6.578036642074585, "epoch": 0.4062319676860935, "grad_norm": 0.83984375, "learning_rate": 0.0004990402792500392, "loss": 6.5032, "mean_token_accuracy": 0.15692729353904725, "num_tokens": 8894723.0, "step": 3520 }, { "entropy": 6.5801005363464355, "epoch": 0.4068090017311021, "grad_norm": 0.87109375, "learning_rate": 0.0004990364682655754, "loss": 6.4722, "mean_token_accuracy": 0.15482148230075837, "num_tokens": 8906373.0, "step": 3525 }, { "entropy": 6.604721021652222, "epoch": 0.40738603577611077, "grad_norm": 0.80078125, "learning_rate": 0.0004990326497457564, "loss": 6.4737, "mean_token_accuracy": 0.15373015254735947, "num_tokens": 8918681.0, "step": 3530 }, { "entropy": 6.652784156799316, "epoch": 0.40796306982111946, "grad_norm": 0.7890625, "learning_rate": 0.0004990288236907104, "loss": 6.5282, "mean_token_accuracy": 0.1494688406586647, "num_tokens": 8930232.0, "step": 3535 }, { "entropy": 6.576983118057251, "epoch": 0.4085401038661281, "grad_norm": 0.84375, "learning_rate": 0.0004990249901005661, "loss": 6.4193, "mean_token_accuracy": 0.15579718947410584, "num_tokens": 8942264.0, "step": 3540 }, { "entropy": 6.643110370635986, "epoch": 0.40911713791113674, "grad_norm": 0.828125, "learning_rate": 0.0004990211489754527, "loss": 6.5992, "mean_token_accuracy": 0.1467343896627426, "num_tokens": 8955679.0, "step": 3545 }, { "entropy": 6.642524147033692, "epoch": 0.40969417195614544, "grad_norm": 0.8125, "learning_rate": 0.0004990173003154993, "loss": 6.4317, "mean_token_accuracy": 0.1543587066233158, "num_tokens": 8968421.0, "step": 3550 }, { "entropy": 6.565263557434082, "epoch": 0.4102712060011541, "grad_norm": 0.7890625, "learning_rate": 0.0004990134441208351, "loss": 6.5003, "mean_token_accuracy": 0.15063199996948243, "num_tokens": 8981063.0, "step": 3555 }, { "entropy": 6.604219722747803, "epoch": 0.4108482400461627, "grad_norm": 0.86328125, "learning_rate": 0.0004990095803915901, "loss": 6.4315, "mean_token_accuracy": 0.16306943893432618, "num_tokens": 8993740.0, "step": 3560 }, { "entropy": 6.59393835067749, "epoch": 0.41142527409117136, "grad_norm": 0.83203125, "learning_rate": 0.0004990057091278942, "loss": 6.4888, "mean_token_accuracy": 0.14942816495895386, "num_tokens": 9007135.0, "step": 3565 }, { "entropy": 6.600633573532105, "epoch": 0.41200230813618005, "grad_norm": 0.84375, "learning_rate": 0.0004990018303298773, "loss": 6.5045, "mean_token_accuracy": 0.15680433362722396, "num_tokens": 9021596.0, "step": 3570 }, { "entropy": 6.61022539138794, "epoch": 0.4125793421811887, "grad_norm": 0.8125, "learning_rate": 0.0004989979439976703, "loss": 6.44, "mean_token_accuracy": 0.16000102311372758, "num_tokens": 9033523.0, "step": 3575 }, { "entropy": 6.593396806716919, "epoch": 0.41315637622619733, "grad_norm": 0.88671875, "learning_rate": 0.0004989940501314037, "loss": 6.4126, "mean_token_accuracy": 0.15999998301267623, "num_tokens": 9045690.0, "step": 3580 }, { "entropy": 6.580743408203125, "epoch": 0.413733410271206, "grad_norm": 0.8671875, "learning_rate": 0.0004989901487312084, "loss": 6.4811, "mean_token_accuracy": 0.1552786871790886, "num_tokens": 9057672.0, "step": 3585 }, { "entropy": 6.589711141586304, "epoch": 0.41431044431621467, "grad_norm": 0.80859375, "learning_rate": 0.0004989862397972157, "loss": 6.537, "mean_token_accuracy": 0.15031036734580994, "num_tokens": 9070004.0, "step": 3590 }, { "entropy": 6.658974361419678, "epoch": 0.4148874783612233, "grad_norm": 0.8984375, "learning_rate": 0.0004989823233295572, "loss": 6.4971, "mean_token_accuracy": 0.15876225233078003, "num_tokens": 9082453.0, "step": 3595 }, { "entropy": 6.593294286727906, "epoch": 0.41546451240623195, "grad_norm": 0.84375, "learning_rate": 0.0004989783993283644, "loss": 6.5122, "mean_token_accuracy": 0.1508851870894432, "num_tokens": 9095839.0, "step": 3600 }, { "entropy": 6.563176059722901, "epoch": 0.41604154645124064, "grad_norm": 0.85546875, "learning_rate": 0.0004989744677937694, "loss": 6.4782, "mean_token_accuracy": 0.1590025931596756, "num_tokens": 9109476.0, "step": 3605 }, { "entropy": 6.619072437286377, "epoch": 0.4166185804962493, "grad_norm": 0.77734375, "learning_rate": 0.0004989705287259046, "loss": 6.4072, "mean_token_accuracy": 0.1609771430492401, "num_tokens": 9122354.0, "step": 3610 }, { "entropy": 6.532887077331543, "epoch": 0.4171956145412579, "grad_norm": 0.8515625, "learning_rate": 0.0004989665821249021, "loss": 6.4261, "mean_token_accuracy": 0.16253601163625717, "num_tokens": 9135502.0, "step": 3615 }, { "entropy": 6.664855527877807, "epoch": 0.4177726485862666, "grad_norm": 0.78515625, "learning_rate": 0.000498962627990895, "loss": 6.5659, "mean_token_accuracy": 0.15357777327299119, "num_tokens": 9147654.0, "step": 3620 }, { "entropy": 6.56908655166626, "epoch": 0.41834968263127525, "grad_norm": 0.81640625, "learning_rate": 0.0004989586663240161, "loss": 6.4847, "mean_token_accuracy": 0.1522589549422264, "num_tokens": 9161907.0, "step": 3625 }, { "entropy": 6.620093536376953, "epoch": 0.4189267166762839, "grad_norm": 0.859375, "learning_rate": 0.0004989546971243988, "loss": 6.513, "mean_token_accuracy": 0.14616103172302247, "num_tokens": 9175395.0, "step": 3630 }, { "entropy": 6.614277410507202, "epoch": 0.41950375072129253, "grad_norm": 0.83203125, "learning_rate": 0.0004989507203921763, "loss": 6.4278, "mean_token_accuracy": 0.1567081741988659, "num_tokens": 9187688.0, "step": 3635 }, { "entropy": 6.550759267807007, "epoch": 0.42008078476630123, "grad_norm": 0.8203125, "learning_rate": 0.0004989467361274828, "loss": 6.4669, "mean_token_accuracy": 0.15715653598308563, "num_tokens": 9199773.0, "step": 3640 }, { "entropy": 6.521318578720093, "epoch": 0.42065781881130987, "grad_norm": 0.6953125, "learning_rate": 0.0004989427443304519, "loss": 6.4367, "mean_token_accuracy": 0.1557897448539734, "num_tokens": 9213997.0, "step": 3645 }, { "entropy": 6.621791362762451, "epoch": 0.4212348528563185, "grad_norm": 1.0390625, "learning_rate": 0.000498938745001218, "loss": 6.4908, "mean_token_accuracy": 0.15198236405849458, "num_tokens": 9227187.0, "step": 3650 }, { "entropy": 6.67909688949585, "epoch": 0.4218118869013272, "grad_norm": 0.80859375, "learning_rate": 0.0004989347381399158, "loss": 6.5423, "mean_token_accuracy": 0.1490216538310051, "num_tokens": 9240860.0, "step": 3655 }, { "entropy": 6.584900903701782, "epoch": 0.42238892094633584, "grad_norm": 0.7578125, "learning_rate": 0.0004989307237466799, "loss": 6.436, "mean_token_accuracy": 0.15650416314601898, "num_tokens": 9253771.0, "step": 3660 }, { "entropy": 6.587461662292481, "epoch": 0.4229659549913445, "grad_norm": 0.76171875, "learning_rate": 0.0004989267018216453, "loss": 6.4773, "mean_token_accuracy": 0.15263158679008484, "num_tokens": 9268380.0, "step": 3665 }, { "entropy": 6.588645076751709, "epoch": 0.4235429890363531, "grad_norm": 0.8515625, "learning_rate": 0.0004989226723649473, "loss": 6.4562, "mean_token_accuracy": 0.1565222844481468, "num_tokens": 9279911.0, "step": 3670 }, { "entropy": 6.556595277786255, "epoch": 0.4241200230813618, "grad_norm": 0.90234375, "learning_rate": 0.0004989186353767214, "loss": 6.446, "mean_token_accuracy": 0.16146985441446304, "num_tokens": 9292105.0, "step": 3675 }, { "entropy": 6.591396760940552, "epoch": 0.42469705712637046, "grad_norm": 0.7890625, "learning_rate": 0.0004989145908571035, "loss": 6.5677, "mean_token_accuracy": 0.15078672766685486, "num_tokens": 9305503.0, "step": 3680 }, { "entropy": 6.630074405670166, "epoch": 0.4252740911713791, "grad_norm": 0.80859375, "learning_rate": 0.0004989105388062295, "loss": 6.4605, "mean_token_accuracy": 0.1556406855583191, "num_tokens": 9317978.0, "step": 3685 }, { "entropy": 6.619613599777222, "epoch": 0.4258511252163878, "grad_norm": 0.76171875, "learning_rate": 0.0004989064792242358, "loss": 6.5252, "mean_token_accuracy": 0.15357265770435333, "num_tokens": 9332676.0, "step": 3690 }, { "entropy": 6.579876184463501, "epoch": 0.42642815926139643, "grad_norm": 0.8671875, "learning_rate": 0.0004989024121112589, "loss": 6.426, "mean_token_accuracy": 0.1560150146484375, "num_tokens": 9345594.0, "step": 3695 }, { "entropy": 6.6138917922973635, "epoch": 0.4270051933064051, "grad_norm": 0.9296875, "learning_rate": 0.0004988983374674356, "loss": 6.5109, "mean_token_accuracy": 0.1485238753259182, "num_tokens": 9358303.0, "step": 3700 }, { "entropy": 6.520889186859131, "epoch": 0.4275822273514137, "grad_norm": 0.7890625, "learning_rate": 0.0004988942552929029, "loss": 6.3956, "mean_token_accuracy": 0.16093592643737792, "num_tokens": 9370953.0, "step": 3705 }, { "entropy": 6.522710132598877, "epoch": 0.4281592613964224, "grad_norm": 0.8828125, "learning_rate": 0.0004988901655877981, "loss": 6.4721, "mean_token_accuracy": 0.15702161937952042, "num_tokens": 9384563.0, "step": 3710 }, { "entropy": 6.60606837272644, "epoch": 0.42873629544143105, "grad_norm": 0.87109375, "learning_rate": 0.0004988860683522589, "loss": 6.4222, "mean_token_accuracy": 0.16118086278438568, "num_tokens": 9396401.0, "step": 3715 }, { "entropy": 6.555063343048095, "epoch": 0.4293133294864397, "grad_norm": 0.87890625, "learning_rate": 0.000498881963586423, "loss": 6.4308, "mean_token_accuracy": 0.15848347842693328, "num_tokens": 9408520.0, "step": 3720 }, { "entropy": 6.4073954105377195, "epoch": 0.4298903635314484, "grad_norm": 0.765625, "learning_rate": 0.0004988778512904282, "loss": 6.3381, "mean_token_accuracy": 0.16240834444761276, "num_tokens": 9421431.0, "step": 3725 }, { "entropy": 6.549575996398926, "epoch": 0.430467397576457, "grad_norm": 0.85546875, "learning_rate": 0.0004988737314644134, "loss": 6.4617, "mean_token_accuracy": 0.15462952852249146, "num_tokens": 9432566.0, "step": 3730 }, { "entropy": 6.6500896453857425, "epoch": 0.43104443162146566, "grad_norm": 0.84375, "learning_rate": 0.0004988696041085168, "loss": 6.5593, "mean_token_accuracy": 0.15154415518045425, "num_tokens": 9444885.0, "step": 3735 }, { "entropy": 6.667054796218872, "epoch": 0.4316214656664743, "grad_norm": 1.09375, "learning_rate": 0.0004988654692228772, "loss": 6.5498, "mean_token_accuracy": 0.15102049708366394, "num_tokens": 9457823.0, "step": 3740 }, { "entropy": 6.563848447799683, "epoch": 0.432198499711483, "grad_norm": 0.8125, "learning_rate": 0.0004988613268076335, "loss": 6.3991, "mean_token_accuracy": 0.16212892681360244, "num_tokens": 9470799.0, "step": 3745 }, { "entropy": 6.535583543777466, "epoch": 0.43277553375649164, "grad_norm": 0.88671875, "learning_rate": 0.0004988571768629257, "loss": 6.4583, "mean_token_accuracy": 0.16189608722925186, "num_tokens": 9484175.0, "step": 3750 }, { "entropy": 6.63653335571289, "epoch": 0.4333525678015003, "grad_norm": 0.890625, "learning_rate": 0.0004988530193888927, "loss": 6.5043, "mean_token_accuracy": 0.15041833072900773, "num_tokens": 9497809.0, "step": 3755 }, { "entropy": 6.56855206489563, "epoch": 0.4339296018465089, "grad_norm": 0.84765625, "learning_rate": 0.0004988488543856747, "loss": 6.4451, "mean_token_accuracy": 0.15440599322319032, "num_tokens": 9509755.0, "step": 3760 }, { "entropy": 6.524028348922729, "epoch": 0.4345066358915176, "grad_norm": 0.75, "learning_rate": 0.0004988446818534115, "loss": 6.4522, "mean_token_accuracy": 0.15307800620794296, "num_tokens": 9523801.0, "step": 3765 }, { "entropy": 6.563017177581787, "epoch": 0.43508366993652625, "grad_norm": 0.88671875, "learning_rate": 0.0004988405017922438, "loss": 6.4373, "mean_token_accuracy": 0.16271546185016633, "num_tokens": 9535846.0, "step": 3770 }, { "entropy": 6.650265073776245, "epoch": 0.4356607039815349, "grad_norm": 0.82421875, "learning_rate": 0.000498836314202312, "loss": 6.5108, "mean_token_accuracy": 0.15331310480833055, "num_tokens": 9548194.0, "step": 3775 }, { "entropy": 6.523101472854615, "epoch": 0.4362377380265436, "grad_norm": 0.78515625, "learning_rate": 0.0004988321190837568, "loss": 6.4047, "mean_token_accuracy": 0.15477531999349595, "num_tokens": 9561069.0, "step": 3780 }, { "entropy": 6.466052484512329, "epoch": 0.4368147720715522, "grad_norm": 0.828125, "learning_rate": 0.0004988279164367196, "loss": 6.3793, "mean_token_accuracy": 0.15896909236907958, "num_tokens": 9573778.0, "step": 3785 }, { "entropy": 6.535996627807617, "epoch": 0.43739180611656087, "grad_norm": 0.90625, "learning_rate": 0.0004988237062613415, "loss": 6.3608, "mean_token_accuracy": 0.1710158884525299, "num_tokens": 9586616.0, "step": 3790 }, { "entropy": 6.576893711090088, "epoch": 0.4379688401615695, "grad_norm": 0.91796875, "learning_rate": 0.0004988194885577644, "loss": 6.4697, "mean_token_accuracy": 0.1554633378982544, "num_tokens": 9597943.0, "step": 3795 }, { "entropy": 6.500680875778198, "epoch": 0.4385458742065782, "grad_norm": 0.8203125, "learning_rate": 0.0004988152633261299, "loss": 6.4066, "mean_token_accuracy": 0.16017991304397583, "num_tokens": 9609861.0, "step": 3800 }, { "entropy": 6.532161569595337, "epoch": 0.43912290825158684, "grad_norm": 0.81640625, "learning_rate": 0.00049881103056658, "loss": 6.4607, "mean_token_accuracy": 0.16110374480485917, "num_tokens": 9623307.0, "step": 3805 }, { "entropy": 6.590618324279785, "epoch": 0.4396999422965955, "grad_norm": 0.86328125, "learning_rate": 0.0004988067902792575, "loss": 6.4706, "mean_token_accuracy": 0.15618328303098677, "num_tokens": 9635827.0, "step": 3810 }, { "entropy": 6.584213638305664, "epoch": 0.4402769763416042, "grad_norm": 0.8359375, "learning_rate": 0.0004988025424643047, "loss": 6.5281, "mean_token_accuracy": 0.15362918823957444, "num_tokens": 9649422.0, "step": 3815 }, { "entropy": 6.539908409118652, "epoch": 0.4408540103866128, "grad_norm": 0.87109375, "learning_rate": 0.0004987982871218645, "loss": 6.4985, "mean_token_accuracy": 0.16369809061288834, "num_tokens": 9661542.0, "step": 3820 }, { "entropy": 6.592797899246216, "epoch": 0.44143104443162146, "grad_norm": 0.78515625, "learning_rate": 0.0004987940242520802, "loss": 6.4823, "mean_token_accuracy": 0.15268328189849853, "num_tokens": 9674684.0, "step": 3825 }, { "entropy": 6.680898857116699, "epoch": 0.4420080784766301, "grad_norm": 0.7890625, "learning_rate": 0.000498789753855095, "loss": 6.5, "mean_token_accuracy": 0.1492106169462204, "num_tokens": 9687522.0, "step": 3830 }, { "entropy": 6.574478960037231, "epoch": 0.4425851125216388, "grad_norm": 0.8203125, "learning_rate": 0.0004987854759310526, "loss": 6.4528, "mean_token_accuracy": 0.15816389620304108, "num_tokens": 9699518.0, "step": 3835 }, { "entropy": 6.567315101623535, "epoch": 0.44316214656664743, "grad_norm": 0.78515625, "learning_rate": 0.0004987811904800968, "loss": 6.5127, "mean_token_accuracy": 0.15438069850206376, "num_tokens": 9711918.0, "step": 3840 }, { "entropy": 6.596231937408447, "epoch": 0.44373918061165607, "grad_norm": 0.75390625, "learning_rate": 0.0004987768975023719, "loss": 6.3862, "mean_token_accuracy": 0.15680329352617264, "num_tokens": 9725643.0, "step": 3845 }, { "entropy": 6.530617141723633, "epoch": 0.44431621465666477, "grad_norm": 0.85546875, "learning_rate": 0.0004987725969980222, "loss": 6.403, "mean_token_accuracy": 0.1597583845257759, "num_tokens": 9738871.0, "step": 3850 }, { "entropy": 6.540352916717529, "epoch": 0.4448932487016734, "grad_norm": 0.8203125, "learning_rate": 0.0004987682889671923, "loss": 6.3894, "mean_token_accuracy": 0.1617853969335556, "num_tokens": 9751166.0, "step": 3855 }, { "entropy": 6.512079095840454, "epoch": 0.44547028274668204, "grad_norm": 0.83203125, "learning_rate": 0.0004987639734100272, "loss": 6.3536, "mean_token_accuracy": 0.16155828088521956, "num_tokens": 9765165.0, "step": 3860 }, { "entropy": 6.56067123413086, "epoch": 0.4460473167916907, "grad_norm": 0.84375, "learning_rate": 0.0004987596503266721, "loss": 6.4014, "mean_token_accuracy": 0.1621742233633995, "num_tokens": 9776625.0, "step": 3865 }, { "entropy": 6.538637399673462, "epoch": 0.4466243508366994, "grad_norm": 0.84765625, "learning_rate": 0.0004987553197172722, "loss": 6.4152, "mean_token_accuracy": 0.16095769703388213, "num_tokens": 9789689.0, "step": 3870 }, { "entropy": 6.617307853698731, "epoch": 0.447201384881708, "grad_norm": 0.9140625, "learning_rate": 0.0004987509815819732, "loss": 6.5181, "mean_token_accuracy": 0.15431652069091797, "num_tokens": 9801124.0, "step": 3875 }, { "entropy": 6.545049571990967, "epoch": 0.44777841892671666, "grad_norm": 0.8203125, "learning_rate": 0.0004987466359209213, "loss": 6.4654, "mean_token_accuracy": 0.1531405434012413, "num_tokens": 9814264.0, "step": 3880 }, { "entropy": 6.532504224777222, "epoch": 0.44835545297172535, "grad_norm": 0.828125, "learning_rate": 0.0004987422827342622, "loss": 6.3939, "mean_token_accuracy": 0.16244966238737107, "num_tokens": 9826149.0, "step": 3885 }, { "entropy": 6.605834484100342, "epoch": 0.448932487016734, "grad_norm": 0.875, "learning_rate": 0.0004987379220221426, "loss": 6.4765, "mean_token_accuracy": 0.15153736919164656, "num_tokens": 9838485.0, "step": 3890 }, { "entropy": 6.5250184535980225, "epoch": 0.44950952106174263, "grad_norm": 0.8359375, "learning_rate": 0.0004987335537847092, "loss": 6.4029, "mean_token_accuracy": 0.1562870755791664, "num_tokens": 9851371.0, "step": 3895 }, { "entropy": 6.563957357406617, "epoch": 0.4500865551067513, "grad_norm": 0.78515625, "learning_rate": 0.0004987291780221088, "loss": 6.4599, "mean_token_accuracy": 0.15669308006763458, "num_tokens": 9864371.0, "step": 3900 }, { "entropy": 6.585865068435669, "epoch": 0.45066358915175997, "grad_norm": 0.796875, "learning_rate": 0.0004987247947344887, "loss": 6.4487, "mean_token_accuracy": 0.15703559517860413, "num_tokens": 9876086.0, "step": 3905 }, { "entropy": 6.544737100601196, "epoch": 0.4512406231967686, "grad_norm": 0.8515625, "learning_rate": 0.0004987204039219962, "loss": 6.4455, "mean_token_accuracy": 0.15367899984121322, "num_tokens": 9888850.0, "step": 3910 }, { "entropy": 6.561423492431641, "epoch": 0.45181765724177725, "grad_norm": 0.8125, "learning_rate": 0.0004987160055847791, "loss": 6.4777, "mean_token_accuracy": 0.15599952191114425, "num_tokens": 9901467.0, "step": 3915 }, { "entropy": 6.574502992630005, "epoch": 0.45239469128678594, "grad_norm": 0.76953125, "learning_rate": 0.0004987115997229852, "loss": 6.4479, "mean_token_accuracy": 0.15445881485939025, "num_tokens": 9914431.0, "step": 3920 }, { "entropy": 6.613849687576294, "epoch": 0.4529717253317946, "grad_norm": 0.7890625, "learning_rate": 0.0004987071863367629, "loss": 6.4776, "mean_token_accuracy": 0.15640159994363784, "num_tokens": 9926863.0, "step": 3925 }, { "entropy": 6.555788230895996, "epoch": 0.4535487593768032, "grad_norm": 0.84375, "learning_rate": 0.0004987027654262604, "loss": 6.4231, "mean_token_accuracy": 0.1610432580113411, "num_tokens": 9939064.0, "step": 3930 }, { "entropy": 6.492784738540649, "epoch": 0.45412579342181186, "grad_norm": 0.83984375, "learning_rate": 0.0004986983369916264, "loss": 6.4221, "mean_token_accuracy": 0.15522423386573792, "num_tokens": 9950897.0, "step": 3935 }, { "entropy": 6.640955543518066, "epoch": 0.45470282746682056, "grad_norm": 0.77734375, "learning_rate": 0.0004986939010330102, "loss": 6.4711, "mean_token_accuracy": 0.15500133484601974, "num_tokens": 9964388.0, "step": 3940 }, { "entropy": 6.412693643569947, "epoch": 0.4552798615118292, "grad_norm": 0.8203125, "learning_rate": 0.0004986894575505606, "loss": 6.2872, "mean_token_accuracy": 0.1698276601731777, "num_tokens": 9977363.0, "step": 3945 }, { "entropy": 6.545732498168945, "epoch": 0.45585689555683784, "grad_norm": 0.83984375, "learning_rate": 0.0004986850065444272, "loss": 6.3485, "mean_token_accuracy": 0.16417437195777893, "num_tokens": 9989691.0, "step": 3950 }, { "entropy": 6.592774343490601, "epoch": 0.45643392960184653, "grad_norm": 0.77734375, "learning_rate": 0.0004986805480147598, "loss": 6.4064, "mean_token_accuracy": 0.15252988934516906, "num_tokens": 10002177.0, "step": 3955 }, { "entropy": 6.508685827255249, "epoch": 0.4570109636468552, "grad_norm": 0.828125, "learning_rate": 0.0004986760819617082, "loss": 6.4662, "mean_token_accuracy": 0.15122403651475907, "num_tokens": 10014844.0, "step": 3960 }, { "entropy": 6.652512836456299, "epoch": 0.4575879976918638, "grad_norm": 0.77734375, "learning_rate": 0.0004986716083854228, "loss": 6.4914, "mean_token_accuracy": 0.1520856276154518, "num_tokens": 10028351.0, "step": 3965 }, { "entropy": 6.521466636657715, "epoch": 0.45816503173687245, "grad_norm": 0.84375, "learning_rate": 0.0004986671272860538, "loss": 6.3913, "mean_token_accuracy": 0.15310998558998107, "num_tokens": 10041318.0, "step": 3970 }, { "entropy": 6.557436227798462, "epoch": 0.45874206578188115, "grad_norm": 0.8359375, "learning_rate": 0.0004986626386637521, "loss": 6.4107, "mean_token_accuracy": 0.1517535850405693, "num_tokens": 10054985.0, "step": 3975 }, { "entropy": 6.552952146530151, "epoch": 0.4593190998268898, "grad_norm": 0.78515625, "learning_rate": 0.0004986581425186688, "loss": 6.4803, "mean_token_accuracy": 0.1568808764219284, "num_tokens": 10067528.0, "step": 3980 }, { "entropy": 6.526756238937378, "epoch": 0.4598961338718984, "grad_norm": 0.75390625, "learning_rate": 0.0004986536388509548, "loss": 6.3925, "mean_token_accuracy": 0.15640367493033408, "num_tokens": 10080210.0, "step": 3985 }, { "entropy": 6.520599222183227, "epoch": 0.4604731679169071, "grad_norm": 0.78125, "learning_rate": 0.0004986491276607618, "loss": 6.4428, "mean_token_accuracy": 0.15482764691114426, "num_tokens": 10092040.0, "step": 3990 }, { "entropy": 6.584397268295288, "epoch": 0.46105020196191576, "grad_norm": 0.89453125, "learning_rate": 0.0004986446089482416, "loss": 6.399, "mean_token_accuracy": 0.1545254573225975, "num_tokens": 10104923.0, "step": 3995 }, { "entropy": 6.528775930404663, "epoch": 0.4616272360069244, "grad_norm": 0.84765625, "learning_rate": 0.0004986400827135459, "loss": 6.3908, "mean_token_accuracy": 0.15947159230709076, "num_tokens": 10118963.0, "step": 4000 }, { "entropy": 6.557057237625122, "epoch": 0.46220427005193304, "grad_norm": 0.8046875, "learning_rate": 0.0004986355489568272, "loss": 6.3496, "mean_token_accuracy": 0.16494845151901244, "num_tokens": 10131457.0, "step": 4005 }, { "entropy": 6.524343824386596, "epoch": 0.46278130409694174, "grad_norm": 0.859375, "learning_rate": 0.0004986310076782379, "loss": 6.4309, "mean_token_accuracy": 0.15816483348608018, "num_tokens": 10143796.0, "step": 4010 }, { "entropy": 6.474204587936401, "epoch": 0.4633583381419504, "grad_norm": 0.8359375, "learning_rate": 0.0004986264588779307, "loss": 6.4078, "mean_token_accuracy": 0.161160147190094, "num_tokens": 10156723.0, "step": 4015 }, { "entropy": 6.524495840072632, "epoch": 0.463935372186959, "grad_norm": 0.8046875, "learning_rate": 0.0004986219025560586, "loss": 6.4278, "mean_token_accuracy": 0.15114813968539237, "num_tokens": 10168701.0, "step": 4020 }, { "entropy": 6.57913761138916, "epoch": 0.4645124062319677, "grad_norm": 0.79296875, "learning_rate": 0.000498617338712775, "loss": 6.3816, "mean_token_accuracy": 0.16238873600959777, "num_tokens": 10182308.0, "step": 4025 }, { "entropy": 6.52322735786438, "epoch": 0.46508944027697635, "grad_norm": 0.83203125, "learning_rate": 0.0004986127673482332, "loss": 6.371, "mean_token_accuracy": 0.16324072778224946, "num_tokens": 10194237.0, "step": 4030 }, { "entropy": 6.512039661407471, "epoch": 0.465666474321985, "grad_norm": 0.7890625, "learning_rate": 0.0004986081884625871, "loss": 6.4611, "mean_token_accuracy": 0.15732699781656265, "num_tokens": 10208570.0, "step": 4035 }, { "entropy": 6.647953844070434, "epoch": 0.46624350836699363, "grad_norm": 0.81640625, "learning_rate": 0.0004986036020559906, "loss": 6.4109, "mean_token_accuracy": 0.15890434235334397, "num_tokens": 10221079.0, "step": 4040 }, { "entropy": 6.42305359840393, "epoch": 0.4668205424120023, "grad_norm": 0.88671875, "learning_rate": 0.000498599008128598, "loss": 6.3319, "mean_token_accuracy": 0.1590804174542427, "num_tokens": 10233473.0, "step": 4045 }, { "entropy": 6.588786363601685, "epoch": 0.46739757645701097, "grad_norm": 0.75, "learning_rate": 0.0004985944066805639, "loss": 6.4683, "mean_token_accuracy": 0.1552932158112526, "num_tokens": 10247840.0, "step": 4050 }, { "entropy": 6.566417503356933, "epoch": 0.4679746105020196, "grad_norm": 0.80859375, "learning_rate": 0.000498589797712043, "loss": 6.3949, "mean_token_accuracy": 0.16800516694784165, "num_tokens": 10261471.0, "step": 4055 }, { "entropy": 6.484035158157349, "epoch": 0.4685516445470283, "grad_norm": 0.84375, "learning_rate": 0.0004985851812231903, "loss": 6.3991, "mean_token_accuracy": 0.1583906292915344, "num_tokens": 10274386.0, "step": 4060 }, { "entropy": 6.553869724273682, "epoch": 0.46912867859203694, "grad_norm": 0.80078125, "learning_rate": 0.0004985805572141611, "loss": 6.4131, "mean_token_accuracy": 0.15777539014816283, "num_tokens": 10286405.0, "step": 4065 }, { "entropy": 6.558121299743652, "epoch": 0.4697057126370456, "grad_norm": 0.79296875, "learning_rate": 0.0004985759256851108, "loss": 6.4603, "mean_token_accuracy": 0.15484957844018937, "num_tokens": 10300084.0, "step": 4070 }, { "entropy": 6.565396356582641, "epoch": 0.4702827466820542, "grad_norm": 0.83984375, "learning_rate": 0.0004985712866361954, "loss": 6.4674, "mean_token_accuracy": 0.16278457939624785, "num_tokens": 10312558.0, "step": 4075 }, { "entropy": 6.541759634017945, "epoch": 0.4708597807270629, "grad_norm": 0.91796875, "learning_rate": 0.0004985666400675709, "loss": 6.3687, "mean_token_accuracy": 0.16311410516500474, "num_tokens": 10324185.0, "step": 4080 }, { "entropy": 6.4401655197143555, "epoch": 0.47143681477207156, "grad_norm": 0.75, "learning_rate": 0.0004985619859793934, "loss": 6.4018, "mean_token_accuracy": 0.15202204287052154, "num_tokens": 10338634.0, "step": 4085 }, { "entropy": 6.673071384429932, "epoch": 0.4720138488170802, "grad_norm": 0.8359375, "learning_rate": 0.0004985573243718195, "loss": 6.4702, "mean_token_accuracy": 0.1487300381064415, "num_tokens": 10351272.0, "step": 4090 }, { "entropy": 6.562505865097046, "epoch": 0.4725908828620889, "grad_norm": 0.828125, "learning_rate": 0.0004985526552450061, "loss": 6.4052, "mean_token_accuracy": 0.15442484468221665, "num_tokens": 10362894.0, "step": 4095 }, { "entropy": 6.557220220565796, "epoch": 0.47316791690709753, "grad_norm": 0.80078125, "learning_rate": 0.0004985479785991103, "loss": 6.5136, "mean_token_accuracy": 0.15173576027154922, "num_tokens": 10376120.0, "step": 4100 }, { "entropy": 6.551002073287964, "epoch": 0.47374495095210617, "grad_norm": 0.94921875, "learning_rate": 0.0004985432944342892, "loss": 6.4281, "mean_token_accuracy": 0.15780509859323502, "num_tokens": 10387986.0, "step": 4105 }, { "entropy": 6.5132355213165285, "epoch": 0.4743219849971148, "grad_norm": 0.87890625, "learning_rate": 0.0004985386027507003, "loss": 6.4441, "mean_token_accuracy": 0.1574099436402321, "num_tokens": 10400920.0, "step": 4110 }, { "entropy": 6.636253833770752, "epoch": 0.4748990190421235, "grad_norm": 0.8046875, "learning_rate": 0.0004985339035485018, "loss": 6.4511, "mean_token_accuracy": 0.1540090411901474, "num_tokens": 10413835.0, "step": 4115 }, { "entropy": 6.511466121673584, "epoch": 0.47547605308713214, "grad_norm": 0.7109375, "learning_rate": 0.0004985291968278513, "loss": 6.4537, "mean_token_accuracy": 0.15455947071313858, "num_tokens": 10426959.0, "step": 4120 }, { "entropy": 6.5830864906311035, "epoch": 0.4760530871321408, "grad_norm": 0.7890625, "learning_rate": 0.0004985244825889074, "loss": 6.4912, "mean_token_accuracy": 0.15826078802347182, "num_tokens": 10440319.0, "step": 4125 }, { "entropy": 6.533916664123535, "epoch": 0.4766301211771495, "grad_norm": 0.8046875, "learning_rate": 0.0004985197608318284, "loss": 6.4479, "mean_token_accuracy": 0.15521639585494995, "num_tokens": 10453715.0, "step": 4130 }, { "entropy": 6.575965356826782, "epoch": 0.4772071552221581, "grad_norm": 0.80859375, "learning_rate": 0.0004985150315567735, "loss": 6.4414, "mean_token_accuracy": 0.15350656658411027, "num_tokens": 10465574.0, "step": 4135 }, { "entropy": 6.519655561447143, "epoch": 0.47778418926716676, "grad_norm": 0.84765625, "learning_rate": 0.0004985102947639013, "loss": 6.4083, "mean_token_accuracy": 0.15839099436998366, "num_tokens": 10478105.0, "step": 4140 }, { "entropy": 6.4816258430480955, "epoch": 0.4783612233121754, "grad_norm": 0.86328125, "learning_rate": 0.0004985055504533715, "loss": 6.4284, "mean_token_accuracy": 0.15900716781616211, "num_tokens": 10490723.0, "step": 4145 }, { "entropy": 6.624292707443237, "epoch": 0.4789382573571841, "grad_norm": 0.8203125, "learning_rate": 0.0004985007986253435, "loss": 6.452, "mean_token_accuracy": 0.15452224612236024, "num_tokens": 10503155.0, "step": 4150 }, { "entropy": 6.526167535781861, "epoch": 0.47951529140219273, "grad_norm": 0.8828125, "learning_rate": 0.0004984960392799772, "loss": 6.4215, "mean_token_accuracy": 0.14876818060874938, "num_tokens": 10515077.0, "step": 4155 }, { "entropy": 6.6001299858093265, "epoch": 0.4800923254472014, "grad_norm": 0.83203125, "learning_rate": 0.0004984912724174326, "loss": 6.3883, "mean_token_accuracy": 0.15346773862838745, "num_tokens": 10528445.0, "step": 4160 }, { "entropy": 6.559596395492553, "epoch": 0.48066935949221, "grad_norm": 0.7734375, "learning_rate": 0.0004984864980378701, "loss": 6.4379, "mean_token_accuracy": 0.15837605893611909, "num_tokens": 10541877.0, "step": 4165 }, { "entropy": 6.54767746925354, "epoch": 0.4812463935372187, "grad_norm": 0.83984375, "learning_rate": 0.0004984817161414502, "loss": 6.4044, "mean_token_accuracy": 0.15747998505830765, "num_tokens": 10553527.0, "step": 4170 }, { "entropy": 6.479561614990234, "epoch": 0.48182342758222735, "grad_norm": 0.8203125, "learning_rate": 0.0004984769267283338, "loss": 6.4136, "mean_token_accuracy": 0.15314011722803117, "num_tokens": 10566492.0, "step": 4175 }, { "entropy": 6.467929792404175, "epoch": 0.482400461627236, "grad_norm": 0.8125, "learning_rate": 0.0004984721297986819, "loss": 6.3739, "mean_token_accuracy": 0.15953933745622634, "num_tokens": 10578962.0, "step": 4180 }, { "entropy": 6.5416004180908205, "epoch": 0.4829774956722447, "grad_norm": 0.86328125, "learning_rate": 0.0004984673253526561, "loss": 6.3665, "mean_token_accuracy": 0.15812182426452637, "num_tokens": 10591254.0, "step": 4185 }, { "entropy": 6.557770919799805, "epoch": 0.4835545297172533, "grad_norm": 1.4453125, "learning_rate": 0.0004984625133904176, "loss": 6.4061, "mean_token_accuracy": 0.1579806312918663, "num_tokens": 10604961.0, "step": 4190 }, { "entropy": 6.499729299545288, "epoch": 0.48413156376226196, "grad_norm": 0.84765625, "learning_rate": 0.0004984576939121286, "loss": 6.3885, "mean_token_accuracy": 0.16066249012947081, "num_tokens": 10617419.0, "step": 4195 }, { "entropy": 6.50909194946289, "epoch": 0.4847085978072706, "grad_norm": 1.2578125, "learning_rate": 0.0004984528669179511, "loss": 6.4186, "mean_token_accuracy": 0.15439673513174057, "num_tokens": 10629721.0, "step": 4200 }, { "entropy": 6.625107002258301, "epoch": 0.4852856318522793, "grad_norm": 0.82421875, "learning_rate": 0.0004984480324080472, "loss": 6.4535, "mean_token_accuracy": 0.15551864504814147, "num_tokens": 10643869.0, "step": 4205 }, { "entropy": 6.590443325042725, "epoch": 0.48586266589728794, "grad_norm": 0.8046875, "learning_rate": 0.00049844319038258, "loss": 6.5082, "mean_token_accuracy": 0.14841593205928802, "num_tokens": 10658418.0, "step": 4210 }, { "entropy": 6.542080116271973, "epoch": 0.4864396999422966, "grad_norm": 0.85546875, "learning_rate": 0.0004984383408417119, "loss": 6.3939, "mean_token_accuracy": 0.16221137195825577, "num_tokens": 10671105.0, "step": 4215 }, { "entropy": 6.542936706542969, "epoch": 0.4870167339873053, "grad_norm": 0.84765625, "learning_rate": 0.0004984334837856064, "loss": 6.4929, "mean_token_accuracy": 0.15168781727552413, "num_tokens": 10683862.0, "step": 4220 }, { "entropy": 6.539501905441284, "epoch": 0.4875937680323139, "grad_norm": 0.85546875, "learning_rate": 0.0004984286192144263, "loss": 6.3919, "mean_token_accuracy": 0.1602101057767868, "num_tokens": 10696559.0, "step": 4225 }, { "entropy": 6.5565080642700195, "epoch": 0.48817080207732255, "grad_norm": 0.80859375, "learning_rate": 0.0004984237471283359, "loss": 6.4623, "mean_token_accuracy": 0.157669498026371, "num_tokens": 10710227.0, "step": 4230 }, { "entropy": 6.489563083648681, "epoch": 0.4887478361223312, "grad_norm": 0.92578125, "learning_rate": 0.0004984188675274986, "loss": 6.4311, "mean_token_accuracy": 0.15578922182321547, "num_tokens": 10722761.0, "step": 4235 }, { "entropy": 6.552829694747925, "epoch": 0.4893248701673399, "grad_norm": 0.78515625, "learning_rate": 0.0004984139804120787, "loss": 6.3864, "mean_token_accuracy": 0.15277379006147385, "num_tokens": 10734126.0, "step": 4240 }, { "entropy": 6.524606513977051, "epoch": 0.4899019042123485, "grad_norm": 0.7734375, "learning_rate": 0.0004984090857822406, "loss": 6.4398, "mean_token_accuracy": 0.15711746215820313, "num_tokens": 10747570.0, "step": 4245 }, { "entropy": 6.61868577003479, "epoch": 0.49047893825735717, "grad_norm": 0.6875, "learning_rate": 0.0004984041836381488, "loss": 6.5498, "mean_token_accuracy": 0.14832186549901963, "num_tokens": 10762975.0, "step": 4250 }, { "entropy": 6.625642156600952, "epoch": 0.49105597230236586, "grad_norm": 0.8203125, "learning_rate": 0.0004983992739799682, "loss": 6.3846, "mean_token_accuracy": 0.1586022138595581, "num_tokens": 10774520.0, "step": 4255 }, { "entropy": 6.455063724517823, "epoch": 0.4916330063473745, "grad_norm": 0.859375, "learning_rate": 0.0004983943568078642, "loss": 6.3108, "mean_token_accuracy": 0.16183219701051713, "num_tokens": 10786250.0, "step": 4260 }, { "entropy": 6.565676832199097, "epoch": 0.49221004039238314, "grad_norm": 0.76171875, "learning_rate": 0.0004983894321220017, "loss": 6.4387, "mean_token_accuracy": 0.15883514136075974, "num_tokens": 10799831.0, "step": 4265 }, { "entropy": 6.5317785263061525, "epoch": 0.4927870744373918, "grad_norm": 0.859375, "learning_rate": 0.0004983844999225468, "loss": 6.3715, "mean_token_accuracy": 0.16067612767219544, "num_tokens": 10812803.0, "step": 4270 }, { "entropy": 6.497241115570068, "epoch": 0.4933641084824005, "grad_norm": 0.85546875, "learning_rate": 0.0004983795602096651, "loss": 6.3904, "mean_token_accuracy": 0.1601540118455887, "num_tokens": 10825150.0, "step": 4275 }, { "entropy": 6.598751640319824, "epoch": 0.4939411425274091, "grad_norm": 0.8046875, "learning_rate": 0.000498374612983523, "loss": 6.506, "mean_token_accuracy": 0.15289822071790696, "num_tokens": 10838337.0, "step": 4280 }, { "entropy": 6.5518717765808105, "epoch": 0.49451817657241776, "grad_norm": 0.81640625, "learning_rate": 0.0004983696582442866, "loss": 6.334, "mean_token_accuracy": 0.17550577819347382, "num_tokens": 10852288.0, "step": 4285 }, { "entropy": 6.514918279647827, "epoch": 0.49509521061742645, "grad_norm": 0.83984375, "learning_rate": 0.0004983646959921227, "loss": 6.439, "mean_token_accuracy": 0.15471772402524947, "num_tokens": 10864189.0, "step": 4290 }, { "entropy": 6.618105697631836, "epoch": 0.4956722446624351, "grad_norm": 0.7578125, "learning_rate": 0.0004983597262271984, "loss": 6.4346, "mean_token_accuracy": 0.1550702318549156, "num_tokens": 10877410.0, "step": 4295 }, { "entropy": 6.503079223632812, "epoch": 0.49624927870744373, "grad_norm": 0.84765625, "learning_rate": 0.0004983547489496804, "loss": 6.4053, "mean_token_accuracy": 0.15499556958675384, "num_tokens": 10889757.0, "step": 4300 }, { "entropy": 6.490525484085083, "epoch": 0.49682631275245237, "grad_norm": 0.8828125, "learning_rate": 0.0004983497641597365, "loss": 6.3195, "mean_token_accuracy": 0.16428075432777406, "num_tokens": 10901636.0, "step": 4305 }, { "entropy": 6.480206155776978, "epoch": 0.49740334679746107, "grad_norm": 0.76171875, "learning_rate": 0.0004983447718575342, "loss": 6.3544, "mean_token_accuracy": 0.1630442336201668, "num_tokens": 10914063.0, "step": 4310 }, { "entropy": 6.595718622207642, "epoch": 0.4979803808424697, "grad_norm": 0.796875, "learning_rate": 0.0004983397720432414, "loss": 6.3886, "mean_token_accuracy": 0.16058591455221177, "num_tokens": 10927730.0, "step": 4315 }, { "entropy": 6.534880208969116, "epoch": 0.49855741488747835, "grad_norm": 0.8125, "learning_rate": 0.0004983347647170264, "loss": 6.4898, "mean_token_accuracy": 0.15413855165243148, "num_tokens": 10942440.0, "step": 4320 }, { "entropy": 6.512958288192749, "epoch": 0.49913444893248704, "grad_norm": 1.28125, "learning_rate": 0.0004983297498790574, "loss": 6.3992, "mean_token_accuracy": 0.156264328956604, "num_tokens": 10955801.0, "step": 4325 }, { "entropy": 6.5469934940338135, "epoch": 0.4997114829774957, "grad_norm": 0.8203125, "learning_rate": 0.0004983247275295034, "loss": 6.3887, "mean_token_accuracy": 0.1580841600894928, "num_tokens": 10967918.0, "step": 4330 }, { "entropy": 6.508872032165527, "epoch": 0.5002885170225043, "grad_norm": 0.8515625, "learning_rate": 0.0004983196976685329, "loss": 6.3267, "mean_token_accuracy": 0.16289351582527162, "num_tokens": 10979652.0, "step": 4335 }, { "entropy": 6.387019300460816, "epoch": 0.500865551067513, "grad_norm": 0.890625, "learning_rate": 0.0004983146602963155, "loss": 6.2607, "mean_token_accuracy": 0.17579997777938844, "num_tokens": 10991433.0, "step": 4340 }, { "entropy": 6.460304498672485, "epoch": 0.5014425851125216, "grad_norm": 0.86328125, "learning_rate": 0.0004983096154130203, "loss": 6.4603, "mean_token_accuracy": 0.15860795527696608, "num_tokens": 11003976.0, "step": 4345 }, { "entropy": 6.599706220626831, "epoch": 0.5020196191575302, "grad_norm": 0.79296875, "learning_rate": 0.0004983045630188171, "loss": 6.4366, "mean_token_accuracy": 0.15410916805267333, "num_tokens": 11018848.0, "step": 4350 }, { "entropy": 6.57402777671814, "epoch": 0.502596653202539, "grad_norm": 0.76953125, "learning_rate": 0.0004982995031138759, "loss": 6.4038, "mean_token_accuracy": 0.15641804337501525, "num_tokens": 11030803.0, "step": 4355 }, { "entropy": 6.586047887802124, "epoch": 0.5031736872475476, "grad_norm": 0.7890625, "learning_rate": 0.0004982944356983666, "loss": 6.4921, "mean_token_accuracy": 0.15291229784488677, "num_tokens": 11044688.0, "step": 4360 }, { "entropy": 6.524409008026123, "epoch": 0.5037507212925563, "grad_norm": 0.859375, "learning_rate": 0.0004982893607724602, "loss": 6.4306, "mean_token_accuracy": 0.15263819694519043, "num_tokens": 11057026.0, "step": 4365 }, { "entropy": 6.639001178741455, "epoch": 0.5043277553375649, "grad_norm": 0.76953125, "learning_rate": 0.000498284278336327, "loss": 6.4538, "mean_token_accuracy": 0.15304491817951202, "num_tokens": 11070407.0, "step": 4370 }, { "entropy": 6.5000138759613035, "epoch": 0.5049047893825735, "grad_norm": 0.83984375, "learning_rate": 0.0004982791883901379, "loss": 6.3616, "mean_token_accuracy": 0.16394442021846772, "num_tokens": 11082655.0, "step": 4375 }, { "entropy": 6.462573575973511, "epoch": 0.5054818234275822, "grad_norm": 0.7578125, "learning_rate": 0.0004982740909340643, "loss": 6.3301, "mean_token_accuracy": 0.16755695044994354, "num_tokens": 11095948.0, "step": 4380 }, { "entropy": 6.589680433273315, "epoch": 0.5060588574725908, "grad_norm": 0.8046875, "learning_rate": 0.0004982689859682775, "loss": 6.382, "mean_token_accuracy": 0.15594714432954787, "num_tokens": 11108105.0, "step": 4385 }, { "entropy": 6.5538736343383786, "epoch": 0.5066358915175996, "grad_norm": 0.7890625, "learning_rate": 0.0004982638734929492, "loss": 6.4291, "mean_token_accuracy": 0.15332048535346984, "num_tokens": 11120322.0, "step": 4390 }, { "entropy": 6.386771297454834, "epoch": 0.5072129255626082, "grad_norm": 0.75390625, "learning_rate": 0.0004982587535082515, "loss": 6.2161, "mean_token_accuracy": 0.16631432473659516, "num_tokens": 11133903.0, "step": 4395 }, { "entropy": 6.46461238861084, "epoch": 0.5077899596076169, "grad_norm": 0.84765625, "learning_rate": 0.0004982536260143565, "loss": 6.2861, "mean_token_accuracy": 0.16543451994657515, "num_tokens": 11145607.0, "step": 4400 }, { "entropy": 6.536594581604004, "epoch": 0.5083669936526255, "grad_norm": 0.875, "learning_rate": 0.0004982484910114367, "loss": 6.391, "mean_token_accuracy": 0.15751007944345474, "num_tokens": 11157332.0, "step": 4405 }, { "entropy": 6.527062559127808, "epoch": 0.5089440276976341, "grad_norm": 0.859375, "learning_rate": 0.0004982433484996648, "loss": 6.4747, "mean_token_accuracy": 0.1585505411028862, "num_tokens": 11169404.0, "step": 4410 }, { "entropy": 6.553807020187378, "epoch": 0.5095210617426428, "grad_norm": 0.80859375, "learning_rate": 0.0004982381984792138, "loss": 6.3707, "mean_token_accuracy": 0.15870761573314668, "num_tokens": 11182506.0, "step": 4415 }, { "entropy": 6.516544485092163, "epoch": 0.5100980957876514, "grad_norm": 0.82421875, "learning_rate": 0.0004982330409502568, "loss": 6.3395, "mean_token_accuracy": 0.1521760679781437, "num_tokens": 11195507.0, "step": 4420 }, { "entropy": 6.505952548980713, "epoch": 0.5106751298326602, "grad_norm": 0.84765625, "learning_rate": 0.0004982278759129674, "loss": 6.3472, "mean_token_accuracy": 0.16159432679414748, "num_tokens": 11207219.0, "step": 4425 }, { "entropy": 6.456001710891724, "epoch": 0.5112521638776688, "grad_norm": 0.83203125, "learning_rate": 0.0004982227033675194, "loss": 6.3242, "mean_token_accuracy": 0.16376312375068663, "num_tokens": 11219301.0, "step": 4430 }, { "entropy": 6.460791826248169, "epoch": 0.5118291979226774, "grad_norm": 0.8828125, "learning_rate": 0.0004982175233140865, "loss": 6.3282, "mean_token_accuracy": 0.16003126353025438, "num_tokens": 11230957.0, "step": 4435 }, { "entropy": 6.537653398513794, "epoch": 0.5124062319676861, "grad_norm": 0.83203125, "learning_rate": 0.0004982123357528431, "loss": 6.3529, "mean_token_accuracy": 0.15861166417598724, "num_tokens": 11242813.0, "step": 4440 }, { "entropy": 6.4945403099060055, "epoch": 0.5129832660126947, "grad_norm": 0.8359375, "learning_rate": 0.0004982071406839636, "loss": 6.3613, "mean_token_accuracy": 0.1551041141152382, "num_tokens": 11255193.0, "step": 4445 }, { "entropy": 6.403803586959839, "epoch": 0.5135603000577034, "grad_norm": 0.87109375, "learning_rate": 0.0004982019381076229, "loss": 6.336, "mean_token_accuracy": 0.16265275329351425, "num_tokens": 11267988.0, "step": 4450 }, { "entropy": 6.558556795120239, "epoch": 0.514137334102712, "grad_norm": 0.828125, "learning_rate": 0.0004981967280239958, "loss": 6.4116, "mean_token_accuracy": 0.15306541174650193, "num_tokens": 11280456.0, "step": 4455 }, { "entropy": 6.527243995666504, "epoch": 0.5147143681477208, "grad_norm": 0.8046875, "learning_rate": 0.0004981915104332578, "loss": 6.4394, "mean_token_accuracy": 0.15262870788574218, "num_tokens": 11293304.0, "step": 4460 }, { "entropy": 6.479492855072022, "epoch": 0.5152914021927294, "grad_norm": 0.79296875, "learning_rate": 0.000498186285335584, "loss": 6.3962, "mean_token_accuracy": 0.15405147820711135, "num_tokens": 11305936.0, "step": 4465 }, { "entropy": 6.617494297027588, "epoch": 0.515868436237738, "grad_norm": 0.7890625, "learning_rate": 0.0004981810527311505, "loss": 6.4403, "mean_token_accuracy": 0.1522215947508812, "num_tokens": 11319991.0, "step": 4470 }, { "entropy": 6.508704996109008, "epoch": 0.5164454702827467, "grad_norm": 0.83203125, "learning_rate": 0.000498175812620133, "loss": 6.3465, "mean_token_accuracy": 0.16412411332130433, "num_tokens": 11332572.0, "step": 4475 }, { "entropy": 6.460049343109131, "epoch": 0.5170225043277553, "grad_norm": 0.8984375, "learning_rate": 0.0004981705650027081, "loss": 6.3431, "mean_token_accuracy": 0.16454764157533647, "num_tokens": 11344435.0, "step": 4480 }, { "entropy": 6.47212586402893, "epoch": 0.517599538372764, "grad_norm": 0.90625, "learning_rate": 0.000498165309879052, "loss": 6.273, "mean_token_accuracy": 0.16744499206542968, "num_tokens": 11356078.0, "step": 4485 }, { "entropy": 6.43641505241394, "epoch": 0.5181765724177726, "grad_norm": 0.890625, "learning_rate": 0.0004981600472493415, "loss": 6.3231, "mean_token_accuracy": 0.16197210550308228, "num_tokens": 11368933.0, "step": 4490 }, { "entropy": 6.587095832824707, "epoch": 0.5187536064627813, "grad_norm": 0.84765625, "learning_rate": 0.0004981547771137537, "loss": 6.4412, "mean_token_accuracy": 0.15295076966285706, "num_tokens": 11380810.0, "step": 4495 }, { "entropy": 6.448738145828247, "epoch": 0.51933064050779, "grad_norm": 0.90625, "learning_rate": 0.0004981494994724658, "loss": 6.3362, "mean_token_accuracy": 0.16053746342658998, "num_tokens": 11392447.0, "step": 4500 }, { "entropy": 6.471343231201172, "epoch": 0.5199076745527986, "grad_norm": 0.87890625, "learning_rate": 0.0004981442143256554, "loss": 6.3946, "mean_token_accuracy": 0.1577278733253479, "num_tokens": 11405237.0, "step": 4505 }, { "entropy": 6.582560443878174, "epoch": 0.5204847085978073, "grad_norm": 0.765625, "learning_rate": 0.0004981389216735001, "loss": 6.5039, "mean_token_accuracy": 0.14747137874364852, "num_tokens": 11418951.0, "step": 4510 }, { "entropy": 6.54022970199585, "epoch": 0.5210617426428159, "grad_norm": 0.75, "learning_rate": 0.000498133621516178, "loss": 6.4038, "mean_token_accuracy": 0.15998345464468003, "num_tokens": 11432587.0, "step": 4515 }, { "entropy": 6.507716655731201, "epoch": 0.5216387766878245, "grad_norm": 0.78515625, "learning_rate": 0.0004981283138538675, "loss": 6.4289, "mean_token_accuracy": 0.15074404031038285, "num_tokens": 11445572.0, "step": 4520 }, { "entropy": 6.524649286270142, "epoch": 0.5222158107328332, "grad_norm": 0.85546875, "learning_rate": 0.000498122998686747, "loss": 6.3821, "mean_token_accuracy": 0.16107590049505233, "num_tokens": 11457469.0, "step": 4525 }, { "entropy": 6.531647729873657, "epoch": 0.5227928447778419, "grad_norm": 0.81640625, "learning_rate": 0.0004981176760149951, "loss": 6.4269, "mean_token_accuracy": 0.1588137172162533, "num_tokens": 11470306.0, "step": 4530 }, { "entropy": 6.553733444213867, "epoch": 0.5233698788228506, "grad_norm": 0.84375, "learning_rate": 0.0004981123458387911, "loss": 6.4024, "mean_token_accuracy": 0.16188153773546218, "num_tokens": 11483839.0, "step": 4535 }, { "entropy": 6.549627828598022, "epoch": 0.5239469128678592, "grad_norm": 0.91015625, "learning_rate": 0.0004981070081583142, "loss": 6.3946, "mean_token_accuracy": 0.15353466868400573, "num_tokens": 11495703.0, "step": 4540 }, { "entropy": 6.5704262256622314, "epoch": 0.5245239469128679, "grad_norm": 0.81640625, "learning_rate": 0.000498101662973744, "loss": 6.4888, "mean_token_accuracy": 0.15426429733633995, "num_tokens": 11508061.0, "step": 4545 }, { "entropy": 6.487470436096191, "epoch": 0.5251009809578765, "grad_norm": 0.79296875, "learning_rate": 0.00049809631028526, "loss": 6.3195, "mean_token_accuracy": 0.16369524449110032, "num_tokens": 11520135.0, "step": 4550 }, { "entropy": 6.492602396011352, "epoch": 0.5256780150028851, "grad_norm": 0.828125, "learning_rate": 0.0004980909500930424, "loss": 6.3946, "mean_token_accuracy": 0.15684450417757034, "num_tokens": 11532255.0, "step": 4555 }, { "entropy": 6.544296550750732, "epoch": 0.5262550490478938, "grad_norm": 0.86328125, "learning_rate": 0.0004980855823972717, "loss": 6.3394, "mean_token_accuracy": 0.1619937911629677, "num_tokens": 11544596.0, "step": 4560 }, { "entropy": 6.4948595523834225, "epoch": 0.5268320830929025, "grad_norm": 0.8671875, "learning_rate": 0.000498080207198128, "loss": 6.4627, "mean_token_accuracy": 0.1510115385055542, "num_tokens": 11556758.0, "step": 4565 }, { "entropy": 6.56593132019043, "epoch": 0.5274091171379112, "grad_norm": 0.8125, "learning_rate": 0.0004980748244957925, "loss": 6.4435, "mean_token_accuracy": 0.14832553789019584, "num_tokens": 11570070.0, "step": 4570 }, { "entropy": 6.518224000930786, "epoch": 0.5279861511829198, "grad_norm": 0.83984375, "learning_rate": 0.0004980694342904461, "loss": 6.3229, "mean_token_accuracy": 0.16714330315589904, "num_tokens": 11582566.0, "step": 4575 }, { "entropy": 6.45475206375122, "epoch": 0.5285631852279284, "grad_norm": 0.796875, "learning_rate": 0.0004980640365822701, "loss": 6.2754, "mean_token_accuracy": 0.16809093654155732, "num_tokens": 11595238.0, "step": 4580 }, { "entropy": 6.546554517745972, "epoch": 0.5291402192729371, "grad_norm": 0.80859375, "learning_rate": 0.000498058631371446, "loss": 6.4037, "mean_token_accuracy": 0.1609138697385788, "num_tokens": 11608646.0, "step": 4585 }, { "entropy": 6.4840919971466064, "epoch": 0.5297172533179457, "grad_norm": 0.8046875, "learning_rate": 0.0004980532186581555, "loss": 6.3518, "mean_token_accuracy": 0.1566994830965996, "num_tokens": 11619610.0, "step": 4590 }, { "entropy": 6.437766647338867, "epoch": 0.5302942873629544, "grad_norm": 0.8203125, "learning_rate": 0.000498047798442581, "loss": 6.2399, "mean_token_accuracy": 0.17291501462459563, "num_tokens": 11631691.0, "step": 4595 }, { "entropy": 6.4640161991119385, "epoch": 0.5308713214079631, "grad_norm": 0.7890625, "learning_rate": 0.0004980423707249044, "loss": 6.286, "mean_token_accuracy": 0.16628182977437972, "num_tokens": 11644330.0, "step": 4600 }, { "entropy": 6.56778769493103, "epoch": 0.5314483554529718, "grad_norm": 0.8203125, "learning_rate": 0.0004980369355053086, "loss": 6.4038, "mean_token_accuracy": 0.15543297529220582, "num_tokens": 11656826.0, "step": 4605 }, { "entropy": 6.468916130065918, "epoch": 0.5320253894979804, "grad_norm": 0.9375, "learning_rate": 0.0004980314927839763, "loss": 6.3838, "mean_token_accuracy": 0.1545664668083191, "num_tokens": 11668669.0, "step": 4610 }, { "entropy": 6.521239757537842, "epoch": 0.532602423542989, "grad_norm": 0.80859375, "learning_rate": 0.0004980260425610903, "loss": 6.3392, "mean_token_accuracy": 0.15642919391393661, "num_tokens": 11681237.0, "step": 4615 }, { "entropy": 6.442376375198364, "epoch": 0.5331794575879977, "grad_norm": 0.84375, "learning_rate": 0.0004980205848368343, "loss": 6.3934, "mean_token_accuracy": 0.15855768769979478, "num_tokens": 11693953.0, "step": 4620 }, { "entropy": 6.447347021102905, "epoch": 0.5337564916330063, "grad_norm": 0.8671875, "learning_rate": 0.0004980151196113917, "loss": 6.3594, "mean_token_accuracy": 0.1600581720471382, "num_tokens": 11705364.0, "step": 4625 }, { "entropy": 6.5338707447052, "epoch": 0.534333525678015, "grad_norm": 0.80078125, "learning_rate": 0.0004980096468849464, "loss": 6.3732, "mean_token_accuracy": 0.15663958638906478, "num_tokens": 11717664.0, "step": 4630 }, { "entropy": 6.507907485961914, "epoch": 0.5349105597230237, "grad_norm": 0.81640625, "learning_rate": 0.0004980041666576823, "loss": 6.3688, "mean_token_accuracy": 0.15612590909004212, "num_tokens": 11731143.0, "step": 4635 }, { "entropy": 6.513534021377564, "epoch": 0.5354875937680323, "grad_norm": 0.83984375, "learning_rate": 0.0004979986789297837, "loss": 6.3105, "mean_token_accuracy": 0.1600772351026535, "num_tokens": 11743904.0, "step": 4640 }, { "entropy": 6.3788543224334715, "epoch": 0.536064627813041, "grad_norm": 0.83984375, "learning_rate": 0.0004979931837014355, "loss": 6.1961, "mean_token_accuracy": 0.16465394496917723, "num_tokens": 11756731.0, "step": 4645 }, { "entropy": 6.432486915588379, "epoch": 0.5366416618580496, "grad_norm": 0.83984375, "learning_rate": 0.0004979876809728223, "loss": 6.3189, "mean_token_accuracy": 0.16390772312879562, "num_tokens": 11768597.0, "step": 4650 }, { "entropy": 6.424148178100586, "epoch": 0.5372186959030583, "grad_norm": 0.87109375, "learning_rate": 0.0004979821707441292, "loss": 6.2386, "mean_token_accuracy": 0.1694170728325844, "num_tokens": 11781464.0, "step": 4655 }, { "entropy": 6.385573053359986, "epoch": 0.5377957299480669, "grad_norm": 0.82421875, "learning_rate": 0.0004979766530155416, "loss": 6.2189, "mean_token_accuracy": 0.17261924147605895, "num_tokens": 11794215.0, "step": 4660 }, { "entropy": 6.4749983787536625, "epoch": 0.5383727639930755, "grad_norm": 0.87109375, "learning_rate": 0.0004979711277872449, "loss": 6.444, "mean_token_accuracy": 0.15245128124952317, "num_tokens": 11807456.0, "step": 4665 }, { "entropy": 6.4587053775787355, "epoch": 0.5389497980380843, "grad_norm": 0.796875, "learning_rate": 0.0004979655950594252, "loss": 6.337, "mean_token_accuracy": 0.1637497663497925, "num_tokens": 11819730.0, "step": 4670 }, { "entropy": 6.460689640045166, "epoch": 0.5395268320830929, "grad_norm": 0.8046875, "learning_rate": 0.0004979600548322684, "loss": 6.3466, "mean_token_accuracy": 0.17143890559673308, "num_tokens": 11831892.0, "step": 4675 }, { "entropy": 6.456334400177002, "epoch": 0.5401038661281016, "grad_norm": 0.81640625, "learning_rate": 0.000497954507105961, "loss": 6.3654, "mean_token_accuracy": 0.15969292372465133, "num_tokens": 11844114.0, "step": 4680 }, { "entropy": 6.526745080947876, "epoch": 0.5406809001731102, "grad_norm": 0.7890625, "learning_rate": 0.0004979489518806893, "loss": 6.3234, "mean_token_accuracy": 0.15686967074871064, "num_tokens": 11855832.0, "step": 4685 }, { "entropy": 6.465781307220459, "epoch": 0.5412579342181189, "grad_norm": 0.73828125, "learning_rate": 0.0004979433891566405, "loss": 6.4208, "mean_token_accuracy": 0.15778311640024184, "num_tokens": 11868837.0, "step": 4690 }, { "entropy": 6.4877008438110355, "epoch": 0.5418349682631275, "grad_norm": 0.80859375, "learning_rate": 0.0004979378189340015, "loss": 6.3289, "mean_token_accuracy": 0.16794711649417876, "num_tokens": 11880608.0, "step": 4695 }, { "entropy": 6.476086235046386, "epoch": 0.5424120023081361, "grad_norm": 0.859375, "learning_rate": 0.0004979322412129597, "loss": 6.344, "mean_token_accuracy": 0.15937476307153703, "num_tokens": 11892652.0, "step": 4700 }, { "entropy": 6.458676815032959, "epoch": 0.5429890363531449, "grad_norm": 0.78515625, "learning_rate": 0.0004979266559937028, "loss": 6.2977, "mean_token_accuracy": 0.15880679041147233, "num_tokens": 11904572.0, "step": 4705 }, { "entropy": 6.5893689632415775, "epoch": 0.5435660703981535, "grad_norm": 0.8046875, "learning_rate": 0.0004979210632764185, "loss": 6.4386, "mean_token_accuracy": 0.15327975898981094, "num_tokens": 11917794.0, "step": 4710 }, { "entropy": 6.511403131484985, "epoch": 0.5441431044431622, "grad_norm": 0.80859375, "learning_rate": 0.0004979154630612949, "loss": 6.3223, "mean_token_accuracy": 0.156440269947052, "num_tokens": 11930403.0, "step": 4715 }, { "entropy": 6.556756973266602, "epoch": 0.5447201384881708, "grad_norm": 0.921875, "learning_rate": 0.0004979098553485205, "loss": 6.4268, "mean_token_accuracy": 0.15392898991703988, "num_tokens": 11943974.0, "step": 4720 }, { "entropy": 6.528595209121704, "epoch": 0.5452971725331794, "grad_norm": 0.81640625, "learning_rate": 0.0004979042401382838, "loss": 6.4272, "mean_token_accuracy": 0.14962007254362106, "num_tokens": 11956887.0, "step": 4725 }, { "entropy": 6.554116296768188, "epoch": 0.5458742065781881, "grad_norm": 0.82421875, "learning_rate": 0.0004978986174307737, "loss": 6.2719, "mean_token_accuracy": 0.1685679391026497, "num_tokens": 11969504.0, "step": 4730 }, { "entropy": 6.43930287361145, "epoch": 0.5464512406231967, "grad_norm": 0.80859375, "learning_rate": 0.0004978929872261794, "loss": 6.326, "mean_token_accuracy": 0.16304372251033783, "num_tokens": 11983432.0, "step": 4735 }, { "entropy": 6.510177850723267, "epoch": 0.5470282746682055, "grad_norm": 0.84765625, "learning_rate": 0.0004978873495246901, "loss": 6.3165, "mean_token_accuracy": 0.1688837394118309, "num_tokens": 11995915.0, "step": 4740 }, { "entropy": 6.414366436004639, "epoch": 0.5476053087132141, "grad_norm": 0.734375, "learning_rate": 0.0004978817043264955, "loss": 6.3199, "mean_token_accuracy": 0.1632016494870186, "num_tokens": 12008395.0, "step": 4745 }, { "entropy": 6.401845407485962, "epoch": 0.5481823427582228, "grad_norm": 0.93359375, "learning_rate": 0.0004978760516317856, "loss": 6.2892, "mean_token_accuracy": 0.16130719035863877, "num_tokens": 12021179.0, "step": 4750 }, { "entropy": 6.523613595962525, "epoch": 0.5487593768032314, "grad_norm": 0.8046875, "learning_rate": 0.0004978703914407503, "loss": 6.3688, "mean_token_accuracy": 0.1535087063908577, "num_tokens": 12033798.0, "step": 4755 }, { "entropy": 6.5373670101165775, "epoch": 0.54933641084824, "grad_norm": 0.8671875, "learning_rate": 0.0004978647237535802, "loss": 6.3837, "mean_token_accuracy": 0.15837208032608033, "num_tokens": 12045720.0, "step": 4760 }, { "entropy": 6.5291375637054445, "epoch": 0.5499134448932487, "grad_norm": 0.86328125, "learning_rate": 0.0004978590485704657, "loss": 6.3069, "mean_token_accuracy": 0.16414411664009093, "num_tokens": 12058616.0, "step": 4765 }, { "entropy": 6.459080219268799, "epoch": 0.5504904789382573, "grad_norm": 0.80859375, "learning_rate": 0.0004978533658915979, "loss": 6.4107, "mean_token_accuracy": 0.15961592346429826, "num_tokens": 12070173.0, "step": 4770 }, { "entropy": 6.411388826370239, "epoch": 0.5510675129832661, "grad_norm": 0.98828125, "learning_rate": 0.0004978476757171678, "loss": 6.2896, "mean_token_accuracy": 0.17188112884759904, "num_tokens": 12083499.0, "step": 4775 }, { "entropy": 6.456639385223388, "epoch": 0.5516445470282747, "grad_norm": 0.81640625, "learning_rate": 0.0004978419780473668, "loss": 6.3513, "mean_token_accuracy": 0.16023088991641998, "num_tokens": 12095773.0, "step": 4780 }, { "entropy": 6.460473442077637, "epoch": 0.5522215810732833, "grad_norm": 0.81640625, "learning_rate": 0.0004978362728823865, "loss": 6.3514, "mean_token_accuracy": 0.16689216941595078, "num_tokens": 12107640.0, "step": 4785 }, { "entropy": 6.499213218688965, "epoch": 0.552798615118292, "grad_norm": 0.8046875, "learning_rate": 0.0004978305602224189, "loss": 6.297, "mean_token_accuracy": 0.15836577117443085, "num_tokens": 12120433.0, "step": 4790 }, { "entropy": 6.43018364906311, "epoch": 0.5533756491633006, "grad_norm": 1.078125, "learning_rate": 0.0004978248400676562, "loss": 6.2886, "mean_token_accuracy": 0.16459263265132903, "num_tokens": 12133326.0, "step": 4795 }, { "entropy": 6.528225231170654, "epoch": 0.5539526832083093, "grad_norm": 0.7578125, "learning_rate": 0.0004978191124182905, "loss": 6.3795, "mean_token_accuracy": 0.15583104342222215, "num_tokens": 12145119.0, "step": 4800 }, { "entropy": 6.500142383575439, "epoch": 0.5545297172533179, "grad_norm": 0.8203125, "learning_rate": 0.0004978133772745149, "loss": 6.3437, "mean_token_accuracy": 0.1544487237930298, "num_tokens": 12157414.0, "step": 4805 }, { "entropy": 6.3837847232818605, "epoch": 0.5551067512983267, "grad_norm": 0.828125, "learning_rate": 0.0004978076346365218, "loss": 6.2201, "mean_token_accuracy": 0.16513165831565857, "num_tokens": 12170226.0, "step": 4810 }, { "entropy": 6.448636436462403, "epoch": 0.5556837853433353, "grad_norm": 0.84765625, "learning_rate": 0.0004978018845045047, "loss": 6.2578, "mean_token_accuracy": 0.16587026715278624, "num_tokens": 12182804.0, "step": 4815 }, { "entropy": 6.569641876220703, "epoch": 0.5562608193883439, "grad_norm": 0.8046875, "learning_rate": 0.0004977961268786568, "loss": 6.3685, "mean_token_accuracy": 0.16015153974294663, "num_tokens": 12194795.0, "step": 4820 }, { "entropy": 6.4354218482971195, "epoch": 0.5568378534333526, "grad_norm": 0.828125, "learning_rate": 0.0004977903617591719, "loss": 6.3301, "mean_token_accuracy": 0.16911077052354812, "num_tokens": 12207880.0, "step": 4825 }, { "entropy": 6.479910516738892, "epoch": 0.5574148874783612, "grad_norm": 0.8984375, "learning_rate": 0.0004977845891462439, "loss": 6.3835, "mean_token_accuracy": 0.15894741415977479, "num_tokens": 12219434.0, "step": 4830 }, { "entropy": 6.427562856674195, "epoch": 0.5579919215233698, "grad_norm": 0.82421875, "learning_rate": 0.0004977788090400668, "loss": 6.3085, "mean_token_accuracy": 0.16785141825675964, "num_tokens": 12232775.0, "step": 4835 }, { "entropy": 6.477736520767212, "epoch": 0.5585689555683785, "grad_norm": 0.85546875, "learning_rate": 0.0004977730214408352, "loss": 6.2896, "mean_token_accuracy": 0.16171760335564614, "num_tokens": 12245306.0, "step": 4840 }, { "entropy": 6.389444780349732, "epoch": 0.5591459896133872, "grad_norm": 0.83984375, "learning_rate": 0.0004977672263487435, "loss": 6.2348, "mean_token_accuracy": 0.1595480427145958, "num_tokens": 12257553.0, "step": 4845 }, { "entropy": 6.3948791980743405, "epoch": 0.5597230236583959, "grad_norm": 0.890625, "learning_rate": 0.000497761423763987, "loss": 6.2974, "mean_token_accuracy": 0.16309260874986647, "num_tokens": 12269626.0, "step": 4850 }, { "entropy": 6.498226833343506, "epoch": 0.5603000577034045, "grad_norm": 0.83203125, "learning_rate": 0.0004977556136867606, "loss": 6.3464, "mean_token_accuracy": 0.1585548087954521, "num_tokens": 12282180.0, "step": 4855 }, { "entropy": 6.541059827804565, "epoch": 0.5608770917484132, "grad_norm": 0.8046875, "learning_rate": 0.0004977497961172598, "loss": 6.381, "mean_token_accuracy": 0.16513874679803847, "num_tokens": 12296315.0, "step": 4860 }, { "entropy": 6.445973348617554, "epoch": 0.5614541257934218, "grad_norm": 0.8203125, "learning_rate": 0.0004977439710556802, "loss": 6.3057, "mean_token_accuracy": 0.15708381831645965, "num_tokens": 12308800.0, "step": 4865 }, { "entropy": 6.436301040649414, "epoch": 0.5620311598384304, "grad_norm": 0.75390625, "learning_rate": 0.0004977381385022179, "loss": 6.3618, "mean_token_accuracy": 0.16087310016155243, "num_tokens": 12321717.0, "step": 4870 }, { "entropy": 6.537671327590942, "epoch": 0.5626081938834391, "grad_norm": 0.7578125, "learning_rate": 0.0004977322984570688, "loss": 6.3885, "mean_token_accuracy": 0.15361500531435013, "num_tokens": 12335446.0, "step": 4875 }, { "entropy": 6.453512048721313, "epoch": 0.5631852279284478, "grad_norm": 0.83984375, "learning_rate": 0.0004977264509204296, "loss": 6.3143, "mean_token_accuracy": 0.1592903256416321, "num_tokens": 12348677.0, "step": 4880 }, { "entropy": 6.4898766040802, "epoch": 0.5637622619734565, "grad_norm": 0.77734375, "learning_rate": 0.0004977205958924967, "loss": 6.3472, "mean_token_accuracy": 0.16099169105291367, "num_tokens": 12360934.0, "step": 4885 }, { "entropy": 6.5359296798706055, "epoch": 0.5643392960184651, "grad_norm": 0.84375, "learning_rate": 0.0004977147333734673, "loss": 6.4269, "mean_token_accuracy": 0.156376850605011, "num_tokens": 12373538.0, "step": 4890 }, { "entropy": 6.398646211624145, "epoch": 0.5649163300634737, "grad_norm": 0.80078125, "learning_rate": 0.0004977088633635385, "loss": 6.332, "mean_token_accuracy": 0.15687417089939118, "num_tokens": 12385291.0, "step": 4895 }, { "entropy": 6.582235097885132, "epoch": 0.5654933641084824, "grad_norm": 0.89453125, "learning_rate": 0.0004977029858629076, "loss": 6.3601, "mean_token_accuracy": 0.15636546015739441, "num_tokens": 12398324.0, "step": 4900 }, { "entropy": 6.457294559478759, "epoch": 0.566070398153491, "grad_norm": 0.83984375, "learning_rate": 0.0004976971008717726, "loss": 6.3267, "mean_token_accuracy": 0.15693403780460358, "num_tokens": 12409807.0, "step": 4905 }, { "entropy": 6.483905696868897, "epoch": 0.5666474321984997, "grad_norm": 0.859375, "learning_rate": 0.0004976912083903309, "loss": 6.4167, "mean_token_accuracy": 0.1543364331126213, "num_tokens": 12422658.0, "step": 4910 }, { "entropy": 6.564264154434204, "epoch": 0.5672244662435084, "grad_norm": 0.78515625, "learning_rate": 0.0004976853084187814, "loss": 6.335, "mean_token_accuracy": 0.15391853898763658, "num_tokens": 12435912.0, "step": 4915 }, { "entropy": 6.4374730587005615, "epoch": 0.5678015002885171, "grad_norm": 0.8046875, "learning_rate": 0.0004976794009573219, "loss": 6.3374, "mean_token_accuracy": 0.16345978677272796, "num_tokens": 12448382.0, "step": 4920 }, { "entropy": 6.52530608177185, "epoch": 0.5683785343335257, "grad_norm": 0.78125, "learning_rate": 0.0004976734860061515, "loss": 6.4579, "mean_token_accuracy": 0.1543452709913254, "num_tokens": 12461355.0, "step": 4925 }, { "entropy": 6.517202425003052, "epoch": 0.5689555683785343, "grad_norm": 0.92578125, "learning_rate": 0.0004976675635654688, "loss": 6.2824, "mean_token_accuracy": 0.16503604203462602, "num_tokens": 12473931.0, "step": 4930 }, { "entropy": 6.439925289154052, "epoch": 0.569532602423543, "grad_norm": 0.83203125, "learning_rate": 0.0004976616336354733, "loss": 6.336, "mean_token_accuracy": 0.16363679096102715, "num_tokens": 12486130.0, "step": 4935 }, { "entropy": 6.407979440689087, "epoch": 0.5701096364685516, "grad_norm": 0.8359375, "learning_rate": 0.0004976556962163645, "loss": 6.2576, "mean_token_accuracy": 0.16573751717805862, "num_tokens": 12499336.0, "step": 4940 }, { "entropy": 6.503925704956055, "epoch": 0.5706866705135603, "grad_norm": 0.8203125, "learning_rate": 0.0004976497513083419, "loss": 6.2713, "mean_token_accuracy": 0.16759575754404069, "num_tokens": 12512875.0, "step": 4945 }, { "entropy": 6.4720992088317875, "epoch": 0.571263704558569, "grad_norm": 0.828125, "learning_rate": 0.0004976437989116055, "loss": 6.3864, "mean_token_accuracy": 0.15907713323831557, "num_tokens": 12524985.0, "step": 4950 }, { "entropy": 6.469041061401367, "epoch": 0.5718407386035776, "grad_norm": 0.83984375, "learning_rate": 0.0004976378390263554, "loss": 6.3316, "mean_token_accuracy": 0.16550833880901336, "num_tokens": 12538244.0, "step": 4955 }, { "entropy": 6.539459848403931, "epoch": 0.5724177726485863, "grad_norm": 0.8359375, "learning_rate": 0.0004976318716527924, "loss": 6.3286, "mean_token_accuracy": 0.16238382309675217, "num_tokens": 12550769.0, "step": 4960 }, { "entropy": 6.3982970237731935, "epoch": 0.5729948066935949, "grad_norm": 0.828125, "learning_rate": 0.0004976258967911168, "loss": 6.3497, "mean_token_accuracy": 0.16136492043733597, "num_tokens": 12563294.0, "step": 4965 }, { "entropy": 6.467198228836059, "epoch": 0.5735718407386036, "grad_norm": 0.78515625, "learning_rate": 0.0004976199144415298, "loss": 6.3404, "mean_token_accuracy": 0.1579903855919838, "num_tokens": 12575857.0, "step": 4970 }, { "entropy": 6.509387397766114, "epoch": 0.5741488747836122, "grad_norm": 0.9453125, "learning_rate": 0.0004976139246042325, "loss": 6.2934, "mean_token_accuracy": 0.16424267292022704, "num_tokens": 12589881.0, "step": 4975 }, { "entropy": 6.504959058761597, "epoch": 0.5747259088286208, "grad_norm": 0.9765625, "learning_rate": 0.0004976079272794265, "loss": 6.3632, "mean_token_accuracy": 0.15701202750205995, "num_tokens": 12604100.0, "step": 4980 }, { "entropy": 6.4913969993591305, "epoch": 0.5753029428736296, "grad_norm": 0.84375, "learning_rate": 0.0004976019224673134, "loss": 6.3798, "mean_token_accuracy": 0.1594866156578064, "num_tokens": 12616643.0, "step": 4985 }, { "entropy": 6.417438554763794, "epoch": 0.5758799769186382, "grad_norm": 0.87109375, "learning_rate": 0.0004975959101680953, "loss": 6.3119, "mean_token_accuracy": 0.16797322630882264, "num_tokens": 12627676.0, "step": 4990 }, { "entropy": 6.41131820678711, "epoch": 0.5764570109636469, "grad_norm": 1.0703125, "learning_rate": 0.0004975898903819742, "loss": 6.2615, "mean_token_accuracy": 0.16815593391656875, "num_tokens": 12639352.0, "step": 4995 }, { "entropy": 6.454370927810669, "epoch": 0.5770340450086555, "grad_norm": 0.8046875, "learning_rate": 0.0004975838631091527, "loss": 6.2447, "mean_token_accuracy": 0.1643560364842415, "num_tokens": 12652102.0, "step": 5000 }, { "entropy": 6.509260559082032, "epoch": 0.5776110790536642, "grad_norm": 0.859375, "learning_rate": 0.0004975778283498336, "loss": 6.3592, "mean_token_accuracy": 0.1578929305076599, "num_tokens": 12665084.0, "step": 5005 }, { "entropy": 6.360739755630493, "epoch": 0.5781881130986728, "grad_norm": 0.7578125, "learning_rate": 0.0004975717861042198, "loss": 6.2652, "mean_token_accuracy": 0.16091600209474563, "num_tokens": 12677512.0, "step": 5010 }, { "entropy": 6.524038887023925, "epoch": 0.5787651471436814, "grad_norm": 0.8046875, "learning_rate": 0.0004975657363725146, "loss": 6.3909, "mean_token_accuracy": 0.1512112334370613, "num_tokens": 12690488.0, "step": 5015 }, { "entropy": 6.54783821105957, "epoch": 0.5793421811886902, "grad_norm": 0.8359375, "learning_rate": 0.0004975596791549213, "loss": 6.3248, "mean_token_accuracy": 0.15481803715229034, "num_tokens": 12703830.0, "step": 5020 }, { "entropy": 6.459069347381591, "epoch": 0.5799192152336988, "grad_norm": 0.8046875, "learning_rate": 0.0004975536144516437, "loss": 6.3317, "mean_token_accuracy": 0.16206814646720885, "num_tokens": 12716020.0, "step": 5025 }, { "entropy": 6.49042387008667, "epoch": 0.5804962492787075, "grad_norm": 0.8671875, "learning_rate": 0.000497547542262886, "loss": 6.3974, "mean_token_accuracy": 0.15198142379522322, "num_tokens": 12728989.0, "step": 5030 }, { "entropy": 6.5610472679138185, "epoch": 0.5810732833237161, "grad_norm": 0.828125, "learning_rate": 0.0004975414625888521, "loss": 6.2683, "mean_token_accuracy": 0.1594917967915535, "num_tokens": 12741090.0, "step": 5035 }, { "entropy": 6.464597845077515, "epoch": 0.5816503173687247, "grad_norm": 0.86328125, "learning_rate": 0.0004975353754297468, "loss": 6.3082, "mean_token_accuracy": 0.16099455803632737, "num_tokens": 12754176.0, "step": 5040 }, { "entropy": 6.39254412651062, "epoch": 0.5822273514137334, "grad_norm": 0.890625, "learning_rate": 0.0004975292807857745, "loss": 6.2864, "mean_token_accuracy": 0.15810506939888, "num_tokens": 12766149.0, "step": 5045 }, { "entropy": 6.485265731811523, "epoch": 0.582804385458742, "grad_norm": 0.890625, "learning_rate": 0.0004975231786571406, "loss": 6.3554, "mean_token_accuracy": 0.16003530323505402, "num_tokens": 12778337.0, "step": 5050 }, { "entropy": 6.46652660369873, "epoch": 0.5833814195037508, "grad_norm": 0.8359375, "learning_rate": 0.0004975170690440499, "loss": 6.2617, "mean_token_accuracy": 0.16169480085372925, "num_tokens": 12790146.0, "step": 5055 }, { "entropy": 6.452705526351929, "epoch": 0.5839584535487594, "grad_norm": 0.859375, "learning_rate": 0.0004975109519467083, "loss": 6.249, "mean_token_accuracy": 0.16325473338365554, "num_tokens": 12802821.0, "step": 5060 }, { "entropy": 6.394228124618531, "epoch": 0.584535487593768, "grad_norm": 0.86328125, "learning_rate": 0.0004975048273653212, "loss": 6.397, "mean_token_accuracy": 0.16143627166748048, "num_tokens": 12814409.0, "step": 5065 }, { "entropy": 6.498150205612182, "epoch": 0.5851125216387767, "grad_norm": 0.80078125, "learning_rate": 0.0004974986953000948, "loss": 6.3009, "mean_token_accuracy": 0.15540309697389604, "num_tokens": 12827398.0, "step": 5070 }, { "entropy": 6.4518615245819095, "epoch": 0.5856895556837853, "grad_norm": 0.8984375, "learning_rate": 0.0004974925557512354, "loss": 6.2709, "mean_token_accuracy": 0.16093710511922837, "num_tokens": 12840378.0, "step": 5075 }, { "entropy": 6.448571586608887, "epoch": 0.586266589728794, "grad_norm": 0.8203125, "learning_rate": 0.0004974864087189493, "loss": 6.357, "mean_token_accuracy": 0.16484926640987396, "num_tokens": 12853493.0, "step": 5080 }, { "entropy": 6.437574625015259, "epoch": 0.5868436237738026, "grad_norm": 1.078125, "learning_rate": 0.0004974802542034434, "loss": 6.2316, "mean_token_accuracy": 0.1698588877916336, "num_tokens": 12865052.0, "step": 5085 }, { "entropy": 6.47462739944458, "epoch": 0.5874206578188114, "grad_norm": 0.8046875, "learning_rate": 0.0004974740922049246, "loss": 6.3696, "mean_token_accuracy": 0.15433994829654693, "num_tokens": 12878095.0, "step": 5090 }, { "entropy": 6.512469148635864, "epoch": 0.58799769186382, "grad_norm": 0.87890625, "learning_rate": 0.0004974679227236004, "loss": 6.2207, "mean_token_accuracy": 0.17119740098714828, "num_tokens": 12890855.0, "step": 5095 }, { "entropy": 6.409336709976197, "epoch": 0.5885747259088286, "grad_norm": 0.828125, "learning_rate": 0.0004974617457596779, "loss": 6.2785, "mean_token_accuracy": 0.1650840535759926, "num_tokens": 12903833.0, "step": 5100 }, { "entropy": 6.506627464294434, "epoch": 0.5891517599538373, "grad_norm": 0.796875, "learning_rate": 0.0004974555613133652, "loss": 6.4079, "mean_token_accuracy": 0.15667158514261245, "num_tokens": 12917579.0, "step": 5105 }, { "entropy": 6.480052518844604, "epoch": 0.5897287939988459, "grad_norm": 0.83203125, "learning_rate": 0.0004974493693848702, "loss": 6.3818, "mean_token_accuracy": 0.1637255698442459, "num_tokens": 12929718.0, "step": 5110 }, { "entropy": 6.324490737915039, "epoch": 0.5903058280438546, "grad_norm": 0.8203125, "learning_rate": 0.0004974431699744011, "loss": 6.221, "mean_token_accuracy": 0.16753413528203964, "num_tokens": 12943031.0, "step": 5115 }, { "entropy": 6.465872192382813, "epoch": 0.5908828620888632, "grad_norm": 0.80859375, "learning_rate": 0.0004974369630821665, "loss": 6.3385, "mean_token_accuracy": 0.1643362522125244, "num_tokens": 12954843.0, "step": 5120 }, { "entropy": 6.429745864868164, "epoch": 0.5914598961338718, "grad_norm": 0.84765625, "learning_rate": 0.0004974307487083752, "loss": 6.3302, "mean_token_accuracy": 0.16157597452402114, "num_tokens": 12966915.0, "step": 5125 }, { "entropy": 6.483998966217041, "epoch": 0.5920369301788806, "grad_norm": 0.7734375, "learning_rate": 0.0004974245268532361, "loss": 6.3713, "mean_token_accuracy": 0.1558799222111702, "num_tokens": 12979941.0, "step": 5130 }, { "entropy": 6.499818563461304, "epoch": 0.5926139642238892, "grad_norm": 0.97265625, "learning_rate": 0.0004974182975169585, "loss": 6.2561, "mean_token_accuracy": 0.16042693704366684, "num_tokens": 12992836.0, "step": 5135 }, { "entropy": 6.474150991439819, "epoch": 0.5931909982688979, "grad_norm": 0.87890625, "learning_rate": 0.000497412060699752, "loss": 6.3075, "mean_token_accuracy": 0.16249936521053315, "num_tokens": 13005246.0, "step": 5140 }, { "entropy": 6.422859621047974, "epoch": 0.5937680323139065, "grad_norm": 0.88671875, "learning_rate": 0.0004974058164018263, "loss": 6.2729, "mean_token_accuracy": 0.159485824406147, "num_tokens": 13016842.0, "step": 5145 }, { "entropy": 6.379044771194458, "epoch": 0.5943450663589152, "grad_norm": 0.87109375, "learning_rate": 0.0004973995646233914, "loss": 6.277, "mean_token_accuracy": 0.16455476433038713, "num_tokens": 13028388.0, "step": 5150 }, { "entropy": 6.483341646194458, "epoch": 0.5949221004039238, "grad_norm": 0.8046875, "learning_rate": 0.0004973933053646576, "loss": 6.2963, "mean_token_accuracy": 0.16036218404769897, "num_tokens": 13041895.0, "step": 5155 }, { "entropy": 6.4746462345123295, "epoch": 0.5954991344489324, "grad_norm": 0.82421875, "learning_rate": 0.0004973870386258355, "loss": 6.3554, "mean_token_accuracy": 0.16368395537137986, "num_tokens": 13055984.0, "step": 5160 }, { "entropy": 6.484179830551147, "epoch": 0.5960761684939412, "grad_norm": 0.96875, "learning_rate": 0.0004973807644071357, "loss": 6.303, "mean_token_accuracy": 0.16322016417980195, "num_tokens": 13068735.0, "step": 5165 }, { "entropy": 6.49740834236145, "epoch": 0.5966532025389498, "grad_norm": 0.765625, "learning_rate": 0.0004973744827087695, "loss": 6.3685, "mean_token_accuracy": 0.160064959526062, "num_tokens": 13081564.0, "step": 5170 }, { "entropy": 6.477915859222412, "epoch": 0.5972302365839585, "grad_norm": 0.85546875, "learning_rate": 0.000497368193530948, "loss": 6.2975, "mean_token_accuracy": 0.16501372158527375, "num_tokens": 13094146.0, "step": 5175 }, { "entropy": 6.37415885925293, "epoch": 0.5978072706289671, "grad_norm": 0.8046875, "learning_rate": 0.0004973618968738828, "loss": 6.2557, "mean_token_accuracy": 0.16740904450416566, "num_tokens": 13106753.0, "step": 5180 }, { "entropy": 6.414618730545044, "epoch": 0.5983843046739757, "grad_norm": 0.7890625, "learning_rate": 0.0004973555927377856, "loss": 6.217, "mean_token_accuracy": 0.17282827198505402, "num_tokens": 13118645.0, "step": 5185 }, { "entropy": 6.46846227645874, "epoch": 0.5989613387189844, "grad_norm": 0.796875, "learning_rate": 0.0004973492811228685, "loss": 6.344, "mean_token_accuracy": 0.16316265612840652, "num_tokens": 13132250.0, "step": 5190 }, { "entropy": 6.466949081420898, "epoch": 0.599538372763993, "grad_norm": 0.859375, "learning_rate": 0.0004973429620293438, "loss": 6.3362, "mean_token_accuracy": 0.15950386077165604, "num_tokens": 13145069.0, "step": 5195 }, { "entropy": 6.456646823883057, "epoch": 0.6001154068090018, "grad_norm": 0.7890625, "learning_rate": 0.0004973366354574239, "loss": 6.3034, "mean_token_accuracy": 0.16648412495851517, "num_tokens": 13158244.0, "step": 5200 }, { "entropy": 6.455355453491211, "epoch": 0.6006924408540104, "grad_norm": 0.83203125, "learning_rate": 0.0004973303014073219, "loss": 6.3623, "mean_token_accuracy": 0.15627395808696748, "num_tokens": 13171810.0, "step": 5205 }, { "entropy": 6.448964262008667, "epoch": 0.601269474899019, "grad_norm": 0.83203125, "learning_rate": 0.0004973239598792504, "loss": 6.1955, "mean_token_accuracy": 0.1658018559217453, "num_tokens": 13184448.0, "step": 5210 }, { "entropy": 6.448535013198852, "epoch": 0.6018465089440277, "grad_norm": 0.83984375, "learning_rate": 0.0004973176108734232, "loss": 6.3448, "mean_token_accuracy": 0.15199785232543944, "num_tokens": 13198350.0, "step": 5215 }, { "entropy": 6.465864801406861, "epoch": 0.6024235429890363, "grad_norm": 0.8203125, "learning_rate": 0.0004973112543900535, "loss": 6.2841, "mean_token_accuracy": 0.16358843743801116, "num_tokens": 13210660.0, "step": 5220 }, { "entropy": 6.406602478027343, "epoch": 0.603000577034045, "grad_norm": 0.890625, "learning_rate": 0.0004973048904293551, "loss": 6.2393, "mean_token_accuracy": 0.1710536241531372, "num_tokens": 13222991.0, "step": 5225 }, { "entropy": 6.444959449768066, "epoch": 0.6035776110790536, "grad_norm": 1.0625, "learning_rate": 0.0004972985189915422, "loss": 6.3254, "mean_token_accuracy": 0.16002852469682693, "num_tokens": 13237693.0, "step": 5230 }, { "entropy": 6.444726753234863, "epoch": 0.6041546451240624, "grad_norm": 0.8046875, "learning_rate": 0.000497292140076829, "loss": 6.3317, "mean_token_accuracy": 0.1622207522392273, "num_tokens": 13249843.0, "step": 5235 }, { "entropy": 6.439457941055298, "epoch": 0.604731679169071, "grad_norm": 0.81640625, "learning_rate": 0.0004972857536854301, "loss": 6.3119, "mean_token_accuracy": 0.16525271087884902, "num_tokens": 13262185.0, "step": 5240 }, { "entropy": 6.4337084770202635, "epoch": 0.6053087132140796, "grad_norm": 0.796875, "learning_rate": 0.0004972793598175603, "loss": 6.3505, "mean_token_accuracy": 0.15734633207321166, "num_tokens": 13275344.0, "step": 5245 }, { "entropy": 6.473100423812866, "epoch": 0.6058857472590883, "grad_norm": 0.8515625, "learning_rate": 0.0004972729584734347, "loss": 6.2688, "mean_token_accuracy": 0.15891817957162857, "num_tokens": 13287741.0, "step": 5250 }, { "entropy": 6.470854473114014, "epoch": 0.6064627813040969, "grad_norm": 0.8203125, "learning_rate": 0.0004972665496532685, "loss": 6.2701, "mean_token_accuracy": 0.16430861055850982, "num_tokens": 13299918.0, "step": 5255 }, { "entropy": 6.368015956878662, "epoch": 0.6070398153491056, "grad_norm": 0.7890625, "learning_rate": 0.0004972601333572774, "loss": 6.2533, "mean_token_accuracy": 0.15958417505025863, "num_tokens": 13312765.0, "step": 5260 }, { "entropy": 6.462191009521485, "epoch": 0.6076168493941142, "grad_norm": 0.8359375, "learning_rate": 0.0004972537095856769, "loss": 6.2398, "mean_token_accuracy": 0.16111138761043547, "num_tokens": 13325324.0, "step": 5265 }, { "entropy": 6.485791730880737, "epoch": 0.608193883439123, "grad_norm": 0.8671875, "learning_rate": 0.0004972472783386834, "loss": 6.3451, "mean_token_accuracy": 0.15810697078704833, "num_tokens": 13337578.0, "step": 5270 }, { "entropy": 6.464807462692261, "epoch": 0.6087709174841316, "grad_norm": 0.8828125, "learning_rate": 0.0004972408396165132, "loss": 6.3088, "mean_token_accuracy": 0.1609449043869972, "num_tokens": 13349218.0, "step": 5275 }, { "entropy": 6.441641569137573, "epoch": 0.6093479515291402, "grad_norm": 0.9375, "learning_rate": 0.0004972343934193826, "loss": 6.2705, "mean_token_accuracy": 0.1591146320104599, "num_tokens": 13362221.0, "step": 5280 }, { "entropy": 6.434703302383423, "epoch": 0.6099249855741489, "grad_norm": 0.8828125, "learning_rate": 0.0004972279397475086, "loss": 6.2645, "mean_token_accuracy": 0.17187120169401168, "num_tokens": 13374147.0, "step": 5285 }, { "entropy": 6.378955316543579, "epoch": 0.6105020196191575, "grad_norm": 0.7890625, "learning_rate": 0.0004972214786011083, "loss": 6.2197, "mean_token_accuracy": 0.16266336888074875, "num_tokens": 13386077.0, "step": 5290 }, { "entropy": 6.500459098815918, "epoch": 0.6110790536641661, "grad_norm": 0.828125, "learning_rate": 0.000497215009980399, "loss": 6.297, "mean_token_accuracy": 0.16877201348543167, "num_tokens": 13398442.0, "step": 5295 }, { "entropy": 6.4331823825836185, "epoch": 0.6116560877091748, "grad_norm": 0.80078125, "learning_rate": 0.000497208533885598, "loss": 6.3029, "mean_token_accuracy": 0.16564711034297944, "num_tokens": 13411249.0, "step": 5300 }, { "entropy": 6.43955626487732, "epoch": 0.6122331217541835, "grad_norm": 0.79296875, "learning_rate": 0.0004972020503169235, "loss": 6.2878, "mean_token_accuracy": 0.16612933129072188, "num_tokens": 13424518.0, "step": 5305 }, { "entropy": 6.467305707931518, "epoch": 0.6128101557991922, "grad_norm": 0.8828125, "learning_rate": 0.0004971955592745934, "loss": 6.3069, "mean_token_accuracy": 0.1545131728053093, "num_tokens": 13438530.0, "step": 5310 }, { "entropy": 6.410894584655762, "epoch": 0.6133871898442008, "grad_norm": 0.80859375, "learning_rate": 0.000497189060758826, "loss": 6.2452, "mean_token_accuracy": 0.16825231909751892, "num_tokens": 13451154.0, "step": 5315 }, { "entropy": 6.409408855438232, "epoch": 0.6139642238892095, "grad_norm": 0.890625, "learning_rate": 0.00049718255476984, "loss": 6.2859, "mean_token_accuracy": 0.16544894725084305, "num_tokens": 13461938.0, "step": 5320 }, { "entropy": 6.377069711685181, "epoch": 0.6145412579342181, "grad_norm": 0.76953125, "learning_rate": 0.0004971760413078539, "loss": 6.2693, "mean_token_accuracy": 0.1646272733807564, "num_tokens": 13474423.0, "step": 5325 }, { "entropy": 6.502867031097412, "epoch": 0.6151182919792267, "grad_norm": 0.828125, "learning_rate": 0.0004971695203730872, "loss": 6.2578, "mean_token_accuracy": 0.17385480105876921, "num_tokens": 13486882.0, "step": 5330 }, { "entropy": 6.399074077606201, "epoch": 0.6156953260242354, "grad_norm": 0.78515625, "learning_rate": 0.000497162991965759, "loss": 6.2091, "mean_token_accuracy": 0.16568703651428224, "num_tokens": 13499692.0, "step": 5335 }, { "entropy": 6.454089546203614, "epoch": 0.6162723600692441, "grad_norm": 0.7734375, "learning_rate": 0.0004971564560860889, "loss": 6.2921, "mean_token_accuracy": 0.1587091013789177, "num_tokens": 13512995.0, "step": 5340 }, { "entropy": 6.335466384887695, "epoch": 0.6168493941142528, "grad_norm": 0.80859375, "learning_rate": 0.0004971499127342968, "loss": 6.1969, "mean_token_accuracy": 0.1680700197815895, "num_tokens": 13525804.0, "step": 5345 }, { "entropy": 6.4052308082580565, "epoch": 0.6174264281592614, "grad_norm": 0.859375, "learning_rate": 0.0004971433619106027, "loss": 6.3092, "mean_token_accuracy": 0.16079850047826766, "num_tokens": 13537807.0, "step": 5350 }, { "entropy": 6.485114002227784, "epoch": 0.61800346220427, "grad_norm": 0.82421875, "learning_rate": 0.000497136803615227, "loss": 6.3762, "mean_token_accuracy": 0.1530951127409935, "num_tokens": 13550765.0, "step": 5355 }, { "entropy": 6.4439774513244625, "epoch": 0.6185804962492787, "grad_norm": 0.78515625, "learning_rate": 0.0004971302378483902, "loss": 6.2689, "mean_token_accuracy": 0.165410552918911, "num_tokens": 13565084.0, "step": 5360 }, { "entropy": 6.476373338699341, "epoch": 0.6191575302942873, "grad_norm": 0.77734375, "learning_rate": 0.0004971236646103132, "loss": 6.2655, "mean_token_accuracy": 0.16471700817346574, "num_tokens": 13578851.0, "step": 5365 }, { "entropy": 6.406863832473755, "epoch": 0.619734564339296, "grad_norm": 0.8515625, "learning_rate": 0.0004971170839012171, "loss": 6.1939, "mean_token_accuracy": 0.17038790881633759, "num_tokens": 13589984.0, "step": 5370 }, { "entropy": 6.3514081001281735, "epoch": 0.6203115983843047, "grad_norm": 0.796875, "learning_rate": 0.0004971104957213233, "loss": 6.2624, "mean_token_accuracy": 0.16135939061641694, "num_tokens": 13602899.0, "step": 5375 }, { "entropy": 6.490747451782227, "epoch": 0.6208886324293134, "grad_norm": 1.140625, "learning_rate": 0.0004971039000708531, "loss": 6.418, "mean_token_accuracy": 0.1528172329068184, "num_tokens": 13617672.0, "step": 5380 }, { "entropy": 6.473091506958008, "epoch": 0.621465666474322, "grad_norm": 0.77734375, "learning_rate": 0.0004970972969500286, "loss": 6.2773, "mean_token_accuracy": 0.1603806808590889, "num_tokens": 13630029.0, "step": 5385 }, { "entropy": 6.401896953582764, "epoch": 0.6220427005193306, "grad_norm": 0.83984375, "learning_rate": 0.000497090686359072, "loss": 6.2523, "mean_token_accuracy": 0.1648557275533676, "num_tokens": 13643091.0, "step": 5390 }, { "entropy": 6.350330066680908, "epoch": 0.6226197345643393, "grad_norm": 1.1796875, "learning_rate": 0.0004970840682982054, "loss": 6.1293, "mean_token_accuracy": 0.17030057311058044, "num_tokens": 13654790.0, "step": 5395 }, { "entropy": 6.439556312561035, "epoch": 0.6231967686093479, "grad_norm": 0.8359375, "learning_rate": 0.0004970774427676514, "loss": 6.2464, "mean_token_accuracy": 0.16800362020730972, "num_tokens": 13667425.0, "step": 5400 }, { "entropy": 6.429106521606445, "epoch": 0.6237738026543566, "grad_norm": 0.85546875, "learning_rate": 0.000497070809767633, "loss": 6.3099, "mean_token_accuracy": 0.16256403923034668, "num_tokens": 13680199.0, "step": 5405 }, { "entropy": 6.471726417541504, "epoch": 0.6243508366993653, "grad_norm": 0.7890625, "learning_rate": 0.0004970641692983731, "loss": 6.3267, "mean_token_accuracy": 0.16009956300258638, "num_tokens": 13693613.0, "step": 5410 }, { "entropy": 6.32947187423706, "epoch": 0.624927870744374, "grad_norm": 0.8359375, "learning_rate": 0.0004970575213600954, "loss": 6.2661, "mean_token_accuracy": 0.160757178068161, "num_tokens": 13706809.0, "step": 5415 }, { "entropy": 6.40821270942688, "epoch": 0.6255049047893826, "grad_norm": 0.9140625, "learning_rate": 0.0004970508659530231, "loss": 6.2302, "mean_token_accuracy": 0.16359151303768157, "num_tokens": 13718976.0, "step": 5420 }, { "entropy": 6.440737009048462, "epoch": 0.6260819388343912, "grad_norm": 0.81640625, "learning_rate": 0.0004970442030773802, "loss": 6.2155, "mean_token_accuracy": 0.1657729595899582, "num_tokens": 13731037.0, "step": 5425 }, { "entropy": 6.358583593368531, "epoch": 0.6266589728793999, "grad_norm": 0.93359375, "learning_rate": 0.0004970375327333909, "loss": 6.2887, "mean_token_accuracy": 0.16418557167053222, "num_tokens": 13743816.0, "step": 5430 }, { "entropy": 6.3964362144470215, "epoch": 0.6272360069244085, "grad_norm": 0.75390625, "learning_rate": 0.0004970308549212796, "loss": 6.282, "mean_token_accuracy": 0.16759266555309296, "num_tokens": 13757165.0, "step": 5435 }, { "entropy": 6.450726795196533, "epoch": 0.6278130409694171, "grad_norm": 0.80078125, "learning_rate": 0.0004970241696412705, "loss": 6.2452, "mean_token_accuracy": 0.17060438096523284, "num_tokens": 13769982.0, "step": 5440 }, { "entropy": 6.434137296676636, "epoch": 0.6283900750144259, "grad_norm": 0.86328125, "learning_rate": 0.000497017476893589, "loss": 6.272, "mean_token_accuracy": 0.16804485619068146, "num_tokens": 13782922.0, "step": 5445 }, { "entropy": 6.38315167427063, "epoch": 0.6289671090594345, "grad_norm": 0.7890625, "learning_rate": 0.0004970107766784598, "loss": 6.2659, "mean_token_accuracy": 0.1645989775657654, "num_tokens": 13795683.0, "step": 5450 }, { "entropy": 6.467908000946045, "epoch": 0.6295441431044432, "grad_norm": 0.95703125, "learning_rate": 0.0004970040689961084, "loss": 6.3515, "mean_token_accuracy": 0.16600358933210374, "num_tokens": 13808332.0, "step": 5455 }, { "entropy": 6.430469560623169, "epoch": 0.6301211771494518, "grad_norm": 0.7890625, "learning_rate": 0.0004969973538467605, "loss": 6.3109, "mean_token_accuracy": 0.16642144173383713, "num_tokens": 13820949.0, "step": 5460 }, { "entropy": 6.349089574813843, "epoch": 0.6306982111944605, "grad_norm": 0.875, "learning_rate": 0.0004969906312306419, "loss": 6.2808, "mean_token_accuracy": 0.16602863222360612, "num_tokens": 13833623.0, "step": 5465 }, { "entropy": 6.47224531173706, "epoch": 0.6312752452394691, "grad_norm": 0.875, "learning_rate": 0.0004969839011479786, "loss": 6.2311, "mean_token_accuracy": 0.17260048240423204, "num_tokens": 13844368.0, "step": 5470 }, { "entropy": 6.46555233001709, "epoch": 0.6318522792844777, "grad_norm": 0.9140625, "learning_rate": 0.000496977163598997, "loss": 6.2693, "mean_token_accuracy": 0.16359723955392838, "num_tokens": 13857261.0, "step": 5475 }, { "entropy": 6.241572618484497, "epoch": 0.6324293133294865, "grad_norm": 0.84765625, "learning_rate": 0.0004969704185839239, "loss": 6.1323, "mean_token_accuracy": 0.16393650248646735, "num_tokens": 13869438.0, "step": 5480 }, { "entropy": 6.454886245727539, "epoch": 0.6330063473744951, "grad_norm": 0.8515625, "learning_rate": 0.0004969636661029859, "loss": 6.3533, "mean_token_accuracy": 0.15374770537018775, "num_tokens": 13883353.0, "step": 5485 }, { "entropy": 6.484453201293945, "epoch": 0.6335833814195038, "grad_norm": 0.8203125, "learning_rate": 0.0004969569061564103, "loss": 6.2837, "mean_token_accuracy": 0.168526728451252, "num_tokens": 13896950.0, "step": 5490 }, { "entropy": 6.4666359424591064, "epoch": 0.6341604154645124, "grad_norm": 0.74609375, "learning_rate": 0.0004969501387444245, "loss": 6.2937, "mean_token_accuracy": 0.16304062455892562, "num_tokens": 13910447.0, "step": 5495 }, { "entropy": 6.418818473815918, "epoch": 0.634737449509521, "grad_norm": 0.8125, "learning_rate": 0.0004969433638672559, "loss": 6.2849, "mean_token_accuracy": 0.17183531671762467, "num_tokens": 13922894.0, "step": 5500 }, { "entropy": 6.437852239608764, "epoch": 0.6353144835545297, "grad_norm": 0.8359375, "learning_rate": 0.0004969365815251325, "loss": 6.3015, "mean_token_accuracy": 0.16050758361816406, "num_tokens": 13936558.0, "step": 5505 }, { "entropy": 6.433607149124145, "epoch": 0.6358915175995383, "grad_norm": 0.76953125, "learning_rate": 0.0004969297917182825, "loss": 6.2436, "mean_token_accuracy": 0.16257888972759246, "num_tokens": 13949005.0, "step": 5510 }, { "entropy": 6.431810188293457, "epoch": 0.6364685516445471, "grad_norm": 0.80859375, "learning_rate": 0.0004969229944469342, "loss": 6.2808, "mean_token_accuracy": 0.15686439871788024, "num_tokens": 13962285.0, "step": 5515 }, { "entropy": 6.484597444534302, "epoch": 0.6370455856895557, "grad_norm": 0.8046875, "learning_rate": 0.0004969161897113162, "loss": 6.2797, "mean_token_accuracy": 0.16125818341970444, "num_tokens": 13976037.0, "step": 5520 }, { "entropy": 6.454035043716431, "epoch": 0.6376226197345644, "grad_norm": 0.79296875, "learning_rate": 0.0004969093775116574, "loss": 6.2329, "mean_token_accuracy": 0.16799202859401702, "num_tokens": 13989028.0, "step": 5525 }, { "entropy": 6.353673887252808, "epoch": 0.638199653779573, "grad_norm": 0.8984375, "learning_rate": 0.0004969025578481869, "loss": 6.2199, "mean_token_accuracy": 0.16663924157619475, "num_tokens": 14001814.0, "step": 5530 }, { "entropy": 6.490426683425904, "epoch": 0.6387766878245816, "grad_norm": 0.8203125, "learning_rate": 0.000496895730721134, "loss": 6.3185, "mean_token_accuracy": 0.15284908413887024, "num_tokens": 14014305.0, "step": 5535 }, { "entropy": 6.4198565006256105, "epoch": 0.6393537218695903, "grad_norm": 0.84765625, "learning_rate": 0.0004968888961307286, "loss": 6.1901, "mean_token_accuracy": 0.17025423794984818, "num_tokens": 14027475.0, "step": 5540 }, { "entropy": 6.402793550491333, "epoch": 0.6399307559145989, "grad_norm": 0.77734375, "learning_rate": 0.0004968820540772003, "loss": 6.2554, "mean_token_accuracy": 0.16645244061946868, "num_tokens": 14041031.0, "step": 5545 }, { "entropy": 6.391665887832642, "epoch": 0.6405077899596077, "grad_norm": 0.81640625, "learning_rate": 0.0004968752045607794, "loss": 6.212, "mean_token_accuracy": 0.1631389558315277, "num_tokens": 14054138.0, "step": 5550 }, { "entropy": 6.474399709701538, "epoch": 0.6410848240046163, "grad_norm": 0.796875, "learning_rate": 0.0004968683475816961, "loss": 6.2339, "mean_token_accuracy": 0.16551497131586074, "num_tokens": 14066708.0, "step": 5555 }, { "entropy": 6.412665510177613, "epoch": 0.641661858049625, "grad_norm": 0.78515625, "learning_rate": 0.0004968614831401811, "loss": 6.319, "mean_token_accuracy": 0.15504314005374908, "num_tokens": 14080251.0, "step": 5560 }, { "entropy": 6.486737298965454, "epoch": 0.6422388920946336, "grad_norm": 0.85546875, "learning_rate": 0.0004968546112364654, "loss": 6.2944, "mean_token_accuracy": 0.156815817207098, "num_tokens": 14092622.0, "step": 5565 }, { "entropy": 6.457394075393677, "epoch": 0.6428159261396422, "grad_norm": 0.7734375, "learning_rate": 0.00049684773187078, "loss": 6.3607, "mean_token_accuracy": 0.15759846270084382, "num_tokens": 14107033.0, "step": 5570 }, { "entropy": 6.415627193450928, "epoch": 0.6433929601846509, "grad_norm": 1.0, "learning_rate": 0.0004968408450433565, "loss": 6.0985, "mean_token_accuracy": 0.16721982806921004, "num_tokens": 14119264.0, "step": 5575 }, { "entropy": 6.409555053710937, "epoch": 0.6439699942296595, "grad_norm": 0.83984375, "learning_rate": 0.0004968339507544263, "loss": 6.2658, "mean_token_accuracy": 0.16522011756896973, "num_tokens": 14131360.0, "step": 5580 }, { "entropy": 6.331378602981568, "epoch": 0.6445470282746683, "grad_norm": 0.85546875, "learning_rate": 0.0004968270490042212, "loss": 6.2574, "mean_token_accuracy": 0.16861171871423722, "num_tokens": 14143236.0, "step": 5585 }, { "entropy": 6.466990947723389, "epoch": 0.6451240623196769, "grad_norm": 0.828125, "learning_rate": 0.0004968201397929737, "loss": 6.2703, "mean_token_accuracy": 0.16277870833873748, "num_tokens": 14156470.0, "step": 5590 }, { "entropy": 6.471270656585693, "epoch": 0.6457010963646855, "grad_norm": 0.83203125, "learning_rate": 0.0004968132231209158, "loss": 6.3218, "mean_token_accuracy": 0.157097789645195, "num_tokens": 14169359.0, "step": 5595 }, { "entropy": 6.400879669189453, "epoch": 0.6462781304096942, "grad_norm": 0.84765625, "learning_rate": 0.0004968062989882803, "loss": 6.3446, "mean_token_accuracy": 0.15832698345184326, "num_tokens": 14181980.0, "step": 5600 }, { "entropy": 6.470687961578369, "epoch": 0.6468551644547028, "grad_norm": 0.87109375, "learning_rate": 0.0004967993673953003, "loss": 6.2859, "mean_token_accuracy": 0.16663094758987426, "num_tokens": 14195456.0, "step": 5605 }, { "entropy": 6.371501111984253, "epoch": 0.6474321984997115, "grad_norm": 0.8125, "learning_rate": 0.0004967924283422087, "loss": 6.1873, "mean_token_accuracy": 0.1712810918688774, "num_tokens": 14208269.0, "step": 5610 }, { "entropy": 6.420989894866944, "epoch": 0.6480092325447201, "grad_norm": 0.859375, "learning_rate": 0.000496785481829239, "loss": 6.302, "mean_token_accuracy": 0.16031478866934776, "num_tokens": 14221474.0, "step": 5615 }, { "entropy": 6.473630666732788, "epoch": 0.6485862665897288, "grad_norm": 0.9140625, "learning_rate": 0.0004967785278566245, "loss": 6.2696, "mean_token_accuracy": 0.16501279324293136, "num_tokens": 14234185.0, "step": 5620 }, { "entropy": 6.3897919178009035, "epoch": 0.6491633006347375, "grad_norm": 0.84375, "learning_rate": 0.0004967715664245997, "loss": 6.238, "mean_token_accuracy": 0.1660897359251976, "num_tokens": 14246853.0, "step": 5625 }, { "entropy": 6.398458003997803, "epoch": 0.6497403346797461, "grad_norm": 0.80078125, "learning_rate": 0.0004967645975333983, "loss": 6.3224, "mean_token_accuracy": 0.16524122506380082, "num_tokens": 14260047.0, "step": 5630 }, { "entropy": 6.4040333271026615, "epoch": 0.6503173687247548, "grad_norm": 0.91015625, "learning_rate": 0.0004967576211832548, "loss": 6.1934, "mean_token_accuracy": 0.1748912051320076, "num_tokens": 14273478.0, "step": 5635 }, { "entropy": 6.471810722351075, "epoch": 0.6508944027697634, "grad_norm": 0.7890625, "learning_rate": 0.0004967506373744039, "loss": 6.2874, "mean_token_accuracy": 0.15878912657499314, "num_tokens": 14286085.0, "step": 5640 }, { "entropy": 6.379119968414306, "epoch": 0.651471436814772, "grad_norm": 1.1796875, "learning_rate": 0.0004967436461070805, "loss": 6.2396, "mean_token_accuracy": 0.1718211367726326, "num_tokens": 14299472.0, "step": 5645 }, { "entropy": 6.398261547088623, "epoch": 0.6520484708597807, "grad_norm": 0.7421875, "learning_rate": 0.0004967366473815196, "loss": 6.2043, "mean_token_accuracy": 0.16658677011728287, "num_tokens": 14312624.0, "step": 5650 }, { "entropy": 6.396186256408692, "epoch": 0.6526255049047894, "grad_norm": 0.8125, "learning_rate": 0.0004967296411979568, "loss": 6.1951, "mean_token_accuracy": 0.17445577383041383, "num_tokens": 14325418.0, "step": 5655 }, { "entropy": 6.32066240310669, "epoch": 0.6532025389497981, "grad_norm": 0.8203125, "learning_rate": 0.0004967226275566275, "loss": 6.239, "mean_token_accuracy": 0.166211299598217, "num_tokens": 14337360.0, "step": 5660 }, { "entropy": 6.44496717453003, "epoch": 0.6537795729948067, "grad_norm": 0.85546875, "learning_rate": 0.000496715606457768, "loss": 6.222, "mean_token_accuracy": 0.16578047275543212, "num_tokens": 14349119.0, "step": 5665 }, { "entropy": 6.448485326766968, "epoch": 0.6543566070398154, "grad_norm": 0.84765625, "learning_rate": 0.0004967085779016142, "loss": 6.2683, "mean_token_accuracy": 0.17126621007919313, "num_tokens": 14361760.0, "step": 5670 }, { "entropy": 6.330710077285767, "epoch": 0.654933641084824, "grad_norm": 0.82421875, "learning_rate": 0.0004967015418884022, "loss": 6.2345, "mean_token_accuracy": 0.16232049018144606, "num_tokens": 14374725.0, "step": 5675 }, { "entropy": 6.394761943817139, "epoch": 0.6555106751298326, "grad_norm": 0.84375, "learning_rate": 0.0004966944984183692, "loss": 6.1996, "mean_token_accuracy": 0.16768215894699096, "num_tokens": 14387267.0, "step": 5680 }, { "entropy": 6.432275915145874, "epoch": 0.6560877091748413, "grad_norm": 0.8046875, "learning_rate": 0.0004966874474917518, "loss": 6.2603, "mean_token_accuracy": 0.1640935719013214, "num_tokens": 14400531.0, "step": 5685 }, { "entropy": 6.437908411026001, "epoch": 0.65666474321985, "grad_norm": 0.859375, "learning_rate": 0.0004966803891087873, "loss": 6.2716, "mean_token_accuracy": 0.15894663482904434, "num_tokens": 14412507.0, "step": 5690 }, { "entropy": 6.434341669082642, "epoch": 0.6572417772648587, "grad_norm": 0.83984375, "learning_rate": 0.000496673323269713, "loss": 6.2589, "mean_token_accuracy": 0.16347626149654387, "num_tokens": 14424934.0, "step": 5695 }, { "entropy": 6.457496786117554, "epoch": 0.6578188113098673, "grad_norm": 0.78515625, "learning_rate": 0.0004966662499747666, "loss": 6.3639, "mean_token_accuracy": 0.15038072019815446, "num_tokens": 14438875.0, "step": 5700 }, { "entropy": 6.40140323638916, "epoch": 0.6583958453548759, "grad_norm": 0.78515625, "learning_rate": 0.0004966591692241859, "loss": 6.1693, "mean_token_accuracy": 0.1677701637148857, "num_tokens": 14451089.0, "step": 5705 }, { "entropy": 6.424305438995361, "epoch": 0.6589728793998846, "grad_norm": 0.78125, "learning_rate": 0.0004966520810182092, "loss": 6.2889, "mean_token_accuracy": 0.1674267664551735, "num_tokens": 14463557.0, "step": 5710 }, { "entropy": 6.356392765045166, "epoch": 0.6595499134448932, "grad_norm": 0.85546875, "learning_rate": 0.0004966449853570749, "loss": 6.1922, "mean_token_accuracy": 0.1630517616868019, "num_tokens": 14475865.0, "step": 5715 }, { "entropy": 6.433615684509277, "epoch": 0.6601269474899019, "grad_norm": 0.8125, "learning_rate": 0.0004966378822410215, "loss": 6.2999, "mean_token_accuracy": 0.16027793437242507, "num_tokens": 14487534.0, "step": 5720 }, { "entropy": 6.4160982131958, "epoch": 0.6607039815349106, "grad_norm": 0.78515625, "learning_rate": 0.0004966307716702881, "loss": 6.2466, "mean_token_accuracy": 0.1649463638663292, "num_tokens": 14500006.0, "step": 5725 }, { "entropy": 6.478086137771607, "epoch": 0.6612810155799193, "grad_norm": 0.859375, "learning_rate": 0.0004966236536451138, "loss": 6.3556, "mean_token_accuracy": 0.15748382806777955, "num_tokens": 14512844.0, "step": 5730 }, { "entropy": 6.474676275253296, "epoch": 0.6618580496249279, "grad_norm": 0.8984375, "learning_rate": 0.000496616528165738, "loss": 6.3073, "mean_token_accuracy": 0.15954205095767976, "num_tokens": 14525555.0, "step": 5735 }, { "entropy": 6.387700939178467, "epoch": 0.6624350836699365, "grad_norm": 0.8671875, "learning_rate": 0.0004966093952324003, "loss": 6.2908, "mean_token_accuracy": 0.15595891401171685, "num_tokens": 14537861.0, "step": 5740 }, { "entropy": 6.43832688331604, "epoch": 0.6630121177149452, "grad_norm": 0.8359375, "learning_rate": 0.0004966022548453406, "loss": 6.254, "mean_token_accuracy": 0.16284551173448564, "num_tokens": 14550116.0, "step": 5745 }, { "entropy": 6.444856739044189, "epoch": 0.6635891517599538, "grad_norm": 0.77734375, "learning_rate": 0.0004965951070047993, "loss": 6.2261, "mean_token_accuracy": 0.16848643720149994, "num_tokens": 14561841.0, "step": 5750 }, { "entropy": 6.411498022079468, "epoch": 0.6641661858049625, "grad_norm": 0.8046875, "learning_rate": 0.0004965879517110166, "loss": 6.2768, "mean_token_accuracy": 0.16119781583547593, "num_tokens": 14574889.0, "step": 5755 }, { "entropy": 6.336085510253906, "epoch": 0.6647432198499712, "grad_norm": 0.84375, "learning_rate": 0.0004965807889642333, "loss": 6.2622, "mean_token_accuracy": 0.16737145632505418, "num_tokens": 14587032.0, "step": 5760 }, { "entropy": 6.412449836730957, "epoch": 0.6653202538949798, "grad_norm": 0.8046875, "learning_rate": 0.00049657361876469, "loss": 6.2303, "mean_token_accuracy": 0.16632368713617324, "num_tokens": 14599654.0, "step": 5765 }, { "entropy": 6.332269334793091, "epoch": 0.6658972879399885, "grad_norm": 0.85546875, "learning_rate": 0.0004965664411126282, "loss": 6.1506, "mean_token_accuracy": 0.17118496000766753, "num_tokens": 14611740.0, "step": 5770 }, { "entropy": 6.410775899887085, "epoch": 0.6664743219849971, "grad_norm": 0.70703125, "learning_rate": 0.0004965592560082894, "loss": 6.2481, "mean_token_accuracy": 0.16527822315692903, "num_tokens": 14625038.0, "step": 5775 }, { "entropy": 6.458446931838989, "epoch": 0.6670513560300058, "grad_norm": 0.796875, "learning_rate": 0.0004965520634519149, "loss": 6.3134, "mean_token_accuracy": 0.15978550016880036, "num_tokens": 14638318.0, "step": 5780 }, { "entropy": 6.399044179916382, "epoch": 0.6676283900750144, "grad_norm": 0.8125, "learning_rate": 0.0004965448634437468, "loss": 6.2815, "mean_token_accuracy": 0.15635018050670624, "num_tokens": 14651519.0, "step": 5785 }, { "entropy": 6.4846090316772464, "epoch": 0.668205424120023, "grad_norm": 0.86328125, "learning_rate": 0.0004965376559840272, "loss": 6.2521, "mean_token_accuracy": 0.16233301162719727, "num_tokens": 14662994.0, "step": 5790 }, { "entropy": 6.413419342041015, "epoch": 0.6687824581650318, "grad_norm": 0.8359375, "learning_rate": 0.0004965304410729986, "loss": 6.2138, "mean_token_accuracy": 0.169295796751976, "num_tokens": 14675488.0, "step": 5795 }, { "entropy": 6.341550636291504, "epoch": 0.6693594922100404, "grad_norm": 0.859375, "learning_rate": 0.0004965232187109037, "loss": 6.1536, "mean_token_accuracy": 0.1739507034420967, "num_tokens": 14688512.0, "step": 5800 }, { "entropy": 6.425643396377564, "epoch": 0.6699365262550491, "grad_norm": 0.875, "learning_rate": 0.0004965159888979854, "loss": 6.2133, "mean_token_accuracy": 0.1665024146437645, "num_tokens": 14700740.0, "step": 5805 }, { "entropy": 6.373208665847779, "epoch": 0.6705135603000577, "grad_norm": 0.81640625, "learning_rate": 0.0004965087516344869, "loss": 6.2559, "mean_token_accuracy": 0.16404303461313247, "num_tokens": 14713769.0, "step": 5810 }, { "entropy": 6.37481460571289, "epoch": 0.6710905943450663, "grad_norm": 0.8515625, "learning_rate": 0.0004965015069206515, "loss": 6.1449, "mean_token_accuracy": 0.17123078256845475, "num_tokens": 14725710.0, "step": 5815 }, { "entropy": 6.382030820846557, "epoch": 0.671667628390075, "grad_norm": 0.78515625, "learning_rate": 0.000496494254756723, "loss": 6.1415, "mean_token_accuracy": 0.17618792951107026, "num_tokens": 14738504.0, "step": 5820 }, { "entropy": 6.413110065460205, "epoch": 0.6722446624350836, "grad_norm": 0.82421875, "learning_rate": 0.0004964869951429451, "loss": 6.2643, "mean_token_accuracy": 0.16108937114477156, "num_tokens": 14750344.0, "step": 5825 }, { "entropy": 6.433046150207519, "epoch": 0.6728216964800924, "grad_norm": 0.80078125, "learning_rate": 0.0004964797280795622, "loss": 6.3041, "mean_token_accuracy": 0.16477554887533188, "num_tokens": 14764316.0, "step": 5830 }, { "entropy": 6.371626186370849, "epoch": 0.673398730525101, "grad_norm": 0.86328125, "learning_rate": 0.0004964724535668188, "loss": 6.2249, "mean_token_accuracy": 0.1627054274082184, "num_tokens": 14776404.0, "step": 5835 }, { "entropy": 6.490979194641113, "epoch": 0.6739757645701097, "grad_norm": 0.79296875, "learning_rate": 0.0004964651716049593, "loss": 6.2583, "mean_token_accuracy": 0.16423558443784714, "num_tokens": 14788843.0, "step": 5840 }, { "entropy": 6.37471375465393, "epoch": 0.6745527986151183, "grad_norm": 0.82421875, "learning_rate": 0.0004964578821942288, "loss": 6.1898, "mean_token_accuracy": 0.1714974358677864, "num_tokens": 14802662.0, "step": 5845 }, { "entropy": 6.375233840942383, "epoch": 0.6751298326601269, "grad_norm": 0.79296875, "learning_rate": 0.0004964505853348724, "loss": 6.2682, "mean_token_accuracy": 0.1575095996260643, "num_tokens": 14814354.0, "step": 5850 }, { "entropy": 6.404491424560547, "epoch": 0.6757068667051356, "grad_norm": 1.1875, "learning_rate": 0.0004964432810271356, "loss": 6.169, "mean_token_accuracy": 0.17374546974897384, "num_tokens": 14826404.0, "step": 5855 }, { "entropy": 6.397090053558349, "epoch": 0.6762839007501442, "grad_norm": 0.74609375, "learning_rate": 0.0004964359692712641, "loss": 6.2305, "mean_token_accuracy": 0.16469545364379884, "num_tokens": 14840046.0, "step": 5860 }, { "entropy": 6.359001588821411, "epoch": 0.676860934795153, "grad_norm": 0.80859375, "learning_rate": 0.0004964286500675037, "loss": 6.2521, "mean_token_accuracy": 0.15627662539482118, "num_tokens": 14853566.0, "step": 5865 }, { "entropy": 6.397631883621216, "epoch": 0.6774379688401616, "grad_norm": 0.84375, "learning_rate": 0.0004964213234161007, "loss": 6.1925, "mean_token_accuracy": 0.16885973513126373, "num_tokens": 14866538.0, "step": 5870 }, { "entropy": 6.3361509323120115, "epoch": 0.6780150028851702, "grad_norm": 0.81640625, "learning_rate": 0.0004964139893173014, "loss": 6.1521, "mean_token_accuracy": 0.17438876032829284, "num_tokens": 14879237.0, "step": 5875 }, { "entropy": 6.442409992218018, "epoch": 0.6785920369301789, "grad_norm": 0.82421875, "learning_rate": 0.0004964066477713525, "loss": 6.2748, "mean_token_accuracy": 0.1616318017244339, "num_tokens": 14891295.0, "step": 5880 }, { "entropy": 6.412937259674072, "epoch": 0.6791690709751875, "grad_norm": 0.890625, "learning_rate": 0.0004963992987785011, "loss": 6.2673, "mean_token_accuracy": 0.16440023183822633, "num_tokens": 14902927.0, "step": 5885 }, { "entropy": 6.350733757019043, "epoch": 0.6797461050201962, "grad_norm": 0.82421875, "learning_rate": 0.0004963919423389942, "loss": 6.2349, "mean_token_accuracy": 0.16148411780595778, "num_tokens": 14915203.0, "step": 5890 }, { "entropy": 6.369336748123169, "epoch": 0.6803231390652048, "grad_norm": 0.85546875, "learning_rate": 0.0004963845784530794, "loss": 6.099, "mean_token_accuracy": 0.17276938557624816, "num_tokens": 14927428.0, "step": 5895 }, { "entropy": 6.338372755050659, "epoch": 0.6809001731102136, "grad_norm": 0.81640625, "learning_rate": 0.000496377207121004, "loss": 6.2514, "mean_token_accuracy": 0.16943022161722182, "num_tokens": 14939979.0, "step": 5900 }, { "entropy": 6.460256767272949, "epoch": 0.6814772071552222, "grad_norm": 0.81640625, "learning_rate": 0.0004963698283430164, "loss": 6.2375, "mean_token_accuracy": 0.1650419846177101, "num_tokens": 14952292.0, "step": 5905 }, { "entropy": 6.392317628860473, "epoch": 0.6820542412002308, "grad_norm": 0.80078125, "learning_rate": 0.0004963624421193646, "loss": 6.2536, "mean_token_accuracy": 0.15970679968595505, "num_tokens": 14964942.0, "step": 5910 }, { "entropy": 6.431348752975464, "epoch": 0.6826312752452395, "grad_norm": 0.8828125, "learning_rate": 0.000496355048450297, "loss": 6.3675, "mean_token_accuracy": 0.15923905968666077, "num_tokens": 14979196.0, "step": 5915 }, { "entropy": 6.4473936557769775, "epoch": 0.6832083092902481, "grad_norm": 0.86328125, "learning_rate": 0.0004963476473360623, "loss": 6.2204, "mean_token_accuracy": 0.16636578887701034, "num_tokens": 14991162.0, "step": 5920 }, { "entropy": 6.332076978683472, "epoch": 0.6837853433352568, "grad_norm": 0.8515625, "learning_rate": 0.0004963402387769094, "loss": 6.2417, "mean_token_accuracy": 0.16846334040164948, "num_tokens": 15003207.0, "step": 5925 }, { "entropy": 6.35644760131836, "epoch": 0.6843623773802654, "grad_norm": 0.8125, "learning_rate": 0.0004963328227730876, "loss": 6.2604, "mean_token_accuracy": 0.1596489131450653, "num_tokens": 15016633.0, "step": 5930 }, { "entropy": 6.392962121963501, "epoch": 0.684939411425274, "grad_norm": 0.86328125, "learning_rate": 0.0004963253993248461, "loss": 6.198, "mean_token_accuracy": 0.17046815901994705, "num_tokens": 15029256.0, "step": 5935 }, { "entropy": 6.344196081161499, "epoch": 0.6855164454702828, "grad_norm": 0.8515625, "learning_rate": 0.0004963179684324349, "loss": 6.1649, "mean_token_accuracy": 0.17169316112995148, "num_tokens": 15041162.0, "step": 5940 }, { "entropy": 6.346894645690918, "epoch": 0.6860934795152914, "grad_norm": 0.76953125, "learning_rate": 0.0004963105300961036, "loss": 6.2151, "mean_token_accuracy": 0.17179548889398574, "num_tokens": 15054122.0, "step": 5945 }, { "entropy": 6.368085193634033, "epoch": 0.6866705135603001, "grad_norm": 0.8359375, "learning_rate": 0.0004963030843161026, "loss": 6.2176, "mean_token_accuracy": 0.1642700269818306, "num_tokens": 15066123.0, "step": 5950 }, { "entropy": 6.261136484146118, "epoch": 0.6872475476053087, "grad_norm": 0.85546875, "learning_rate": 0.0004962956310926823, "loss": 6.1427, "mean_token_accuracy": 0.1735681861639023, "num_tokens": 15078192.0, "step": 5955 }, { "entropy": 6.413783311843872, "epoch": 0.6878245816503173, "grad_norm": 0.80078125, "learning_rate": 0.0004962881704260934, "loss": 6.1818, "mean_token_accuracy": 0.1730615571141243, "num_tokens": 15090227.0, "step": 5960 }, { "entropy": 6.358871221542358, "epoch": 0.688401615695326, "grad_norm": 0.80859375, "learning_rate": 0.0004962807023165868, "loss": 6.3066, "mean_token_accuracy": 0.1696085214614868, "num_tokens": 15104093.0, "step": 5965 }, { "entropy": 6.3496081829071045, "epoch": 0.6889786497403346, "grad_norm": 0.76171875, "learning_rate": 0.0004962732267644138, "loss": 6.2006, "mean_token_accuracy": 0.16877583116292955, "num_tokens": 15118064.0, "step": 5970 }, { "entropy": 6.392092323303222, "epoch": 0.6895556837853434, "grad_norm": 1.1484375, "learning_rate": 0.0004962657437698254, "loss": 6.0972, "mean_token_accuracy": 0.17405418753623964, "num_tokens": 15131686.0, "step": 5975 }, { "entropy": 6.378844308853149, "epoch": 0.690132717830352, "grad_norm": 0.80859375, "learning_rate": 0.0004962582533330739, "loss": 6.2949, "mean_token_accuracy": 0.15710055381059645, "num_tokens": 15143920.0, "step": 5980 }, { "entropy": 6.44266266822815, "epoch": 0.6907097518753607, "grad_norm": 0.82421875, "learning_rate": 0.0004962507554544109, "loss": 6.2552, "mean_token_accuracy": 0.16559473276138306, "num_tokens": 15156989.0, "step": 5985 }, { "entropy": 6.503173542022705, "epoch": 0.6912867859203693, "grad_norm": 0.88671875, "learning_rate": 0.0004962432501340886, "loss": 6.3219, "mean_token_accuracy": 0.15267299860715866, "num_tokens": 15169068.0, "step": 5990 }, { "entropy": 6.377065753936767, "epoch": 0.6918638199653779, "grad_norm": 0.8359375, "learning_rate": 0.0004962357373723596, "loss": 6.2871, "mean_token_accuracy": 0.16362386345863342, "num_tokens": 15182081.0, "step": 5995 }, { "entropy": 6.492167615890503, "epoch": 0.6924408540103866, "grad_norm": 0.82421875, "learning_rate": 0.0004962282171694763, "loss": 6.2605, "mean_token_accuracy": 0.16491686552762985, "num_tokens": 15194474.0, "step": 6000 }, { "epoch": 0.6924408540103866, "eval_entropy": 6.244893937006504, "eval_loss": 6.277975559234619, "eval_mean_token_accuracy": 0.16690639868687931, "eval_num_tokens": 15194474.0, "eval_runtime": 17.4205, "eval_samples_per_second": 1615.111, "eval_steps_per_second": 201.889, "step": 6000 }, { "entropy": 6.419049692153931, "epoch": 0.6930178880553952, "grad_norm": 0.8125, "learning_rate": 0.0004962206895256919, "loss": 6.2318, "mean_token_accuracy": 0.16573894619941712, "num_tokens": 15206371.0, "step": 6005 }, { "entropy": 6.34908356666565, "epoch": 0.693594922100404, "grad_norm": 0.83203125, "learning_rate": 0.0004962131544412595, "loss": 6.2544, "mean_token_accuracy": 0.16422042697668077, "num_tokens": 15218913.0, "step": 6010 }, { "entropy": 6.471472215652466, "epoch": 0.6941719561454126, "grad_norm": 0.77734375, "learning_rate": 0.0004962056119164325, "loss": 6.2344, "mean_token_accuracy": 0.1708833560347557, "num_tokens": 15231647.0, "step": 6015 }, { "entropy": 6.392230892181397, "epoch": 0.6947489901904212, "grad_norm": 0.79296875, "learning_rate": 0.0004961980619514646, "loss": 6.2363, "mean_token_accuracy": 0.16547508537769318, "num_tokens": 15243764.0, "step": 6020 }, { "entropy": 6.415359783172607, "epoch": 0.6953260242354299, "grad_norm": 0.7734375, "learning_rate": 0.0004961905045466098, "loss": 6.2948, "mean_token_accuracy": 0.15680457055568695, "num_tokens": 15256165.0, "step": 6025 }, { "entropy": 6.357501459121704, "epoch": 0.6959030582804385, "grad_norm": 0.83203125, "learning_rate": 0.0004961829397021222, "loss": 6.169, "mean_token_accuracy": 0.16878628879785537, "num_tokens": 15269169.0, "step": 6030 }, { "entropy": 6.377862071990966, "epoch": 0.6964800923254472, "grad_norm": 0.75390625, "learning_rate": 0.0004961753674182564, "loss": 6.2119, "mean_token_accuracy": 0.16564356088638305, "num_tokens": 15281530.0, "step": 6035 }, { "entropy": 6.375745582580566, "epoch": 0.6970571263704558, "grad_norm": 0.9453125, "learning_rate": 0.0004961677876952669, "loss": 6.1756, "mean_token_accuracy": 0.16821483224630357, "num_tokens": 15295578.0, "step": 6040 }, { "entropy": 6.376891565322876, "epoch": 0.6976341604154646, "grad_norm": 0.7734375, "learning_rate": 0.0004961602005334087, "loss": 6.2514, "mean_token_accuracy": 0.16718253195285798, "num_tokens": 15308258.0, "step": 6045 }, { "entropy": 6.4180299758911135, "epoch": 0.6982111944604732, "grad_norm": 0.8359375, "learning_rate": 0.000496152605932937, "loss": 6.2718, "mean_token_accuracy": 0.1603887066245079, "num_tokens": 15320370.0, "step": 6050 }, { "entropy": 6.440406322479248, "epoch": 0.6987882285054818, "grad_norm": 0.94921875, "learning_rate": 0.0004961450038941074, "loss": 6.2492, "mean_token_accuracy": 0.16523093432188035, "num_tokens": 15332350.0, "step": 6055 }, { "entropy": 6.333216190338135, "epoch": 0.6993652625504905, "grad_norm": 0.80859375, "learning_rate": 0.0004961373944171754, "loss": 6.1742, "mean_token_accuracy": 0.1691560611128807, "num_tokens": 15343424.0, "step": 6060 }, { "entropy": 6.359563398361206, "epoch": 0.6999422965954991, "grad_norm": 0.8203125, "learning_rate": 0.0004961297775023968, "loss": 6.1927, "mean_token_accuracy": 0.1697380304336548, "num_tokens": 15356126.0, "step": 6065 }, { "entropy": 6.346981000900269, "epoch": 0.7005193306405078, "grad_norm": 0.8671875, "learning_rate": 0.000496122153150028, "loss": 6.0971, "mean_token_accuracy": 0.17148021459579468, "num_tokens": 15369253.0, "step": 6070 }, { "entropy": 6.4445713520050045, "epoch": 0.7010963646855164, "grad_norm": 0.77734375, "learning_rate": 0.0004961145213603255, "loss": 6.2621, "mean_token_accuracy": 0.16077155470848084, "num_tokens": 15382679.0, "step": 6075 }, { "entropy": 6.3669038772583, "epoch": 0.7016733987305251, "grad_norm": 0.73046875, "learning_rate": 0.000496106882133546, "loss": 6.276, "mean_token_accuracy": 0.1646697610616684, "num_tokens": 15396052.0, "step": 6080 }, { "entropy": 6.421784114837647, "epoch": 0.7022504327755338, "grad_norm": 0.80859375, "learning_rate": 0.0004960992354699463, "loss": 6.2941, "mean_token_accuracy": 0.15852054804563523, "num_tokens": 15409249.0, "step": 6085 }, { "entropy": 6.455357551574707, "epoch": 0.7028274668205424, "grad_norm": 0.8359375, "learning_rate": 0.0004960915813697836, "loss": 6.1779, "mean_token_accuracy": 0.16108503490686416, "num_tokens": 15421060.0, "step": 6090 }, { "entropy": 6.378384447097778, "epoch": 0.7034045008655511, "grad_norm": 0.74609375, "learning_rate": 0.0004960839198333154, "loss": 6.2629, "mean_token_accuracy": 0.16128408163785934, "num_tokens": 15433083.0, "step": 6095 }, { "entropy": 6.3820489883422855, "epoch": 0.7039815349105597, "grad_norm": 0.82421875, "learning_rate": 0.0004960762508607994, "loss": 6.08, "mean_token_accuracy": 0.17403190284967424, "num_tokens": 15446664.0, "step": 6100 }, { "entropy": 6.398230504989624, "epoch": 0.7045585689555683, "grad_norm": 0.7890625, "learning_rate": 0.0004960685744524934, "loss": 6.243, "mean_token_accuracy": 0.1608691543340683, "num_tokens": 15458609.0, "step": 6105 }, { "entropy": 6.359479999542236, "epoch": 0.705135603000577, "grad_norm": 0.8359375, "learning_rate": 0.0004960608906086558, "loss": 6.144, "mean_token_accuracy": 0.17022748589515685, "num_tokens": 15470091.0, "step": 6110 }, { "entropy": 6.411485767364502, "epoch": 0.7057126370455857, "grad_norm": 0.7578125, "learning_rate": 0.000496053199329545, "loss": 6.2529, "mean_token_accuracy": 0.16091013103723525, "num_tokens": 15483557.0, "step": 6115 }, { "entropy": 6.395710134506226, "epoch": 0.7062896710905944, "grad_norm": 0.78125, "learning_rate": 0.0004960455006154196, "loss": 6.211, "mean_token_accuracy": 0.16187724471092224, "num_tokens": 15497437.0, "step": 6120 }, { "entropy": 6.403597688674926, "epoch": 0.706866705135603, "grad_norm": 0.83984375, "learning_rate": 0.0004960377944665386, "loss": 6.2439, "mean_token_accuracy": 0.16568287909030915, "num_tokens": 15509942.0, "step": 6125 }, { "entropy": 6.3745523452758786, "epoch": 0.7074437391806117, "grad_norm": 0.83984375, "learning_rate": 0.0004960300808831611, "loss": 6.194, "mean_token_accuracy": 0.17037154287099837, "num_tokens": 15522866.0, "step": 6130 }, { "entropy": 6.407792663574218, "epoch": 0.7080207732256203, "grad_norm": 0.859375, "learning_rate": 0.0004960223598655467, "loss": 6.1858, "mean_token_accuracy": 0.1648655503988266, "num_tokens": 15534731.0, "step": 6135 }, { "entropy": 6.34327073097229, "epoch": 0.7085978072706289, "grad_norm": 0.84375, "learning_rate": 0.000496014631413955, "loss": 6.223, "mean_token_accuracy": 0.16448917090892792, "num_tokens": 15546401.0, "step": 6140 }, { "entropy": 6.450383615493775, "epoch": 0.7091748413156376, "grad_norm": 0.80859375, "learning_rate": 0.0004960068955286459, "loss": 6.2292, "mean_token_accuracy": 0.16138217896223067, "num_tokens": 15559532.0, "step": 6145 }, { "entropy": 6.38635630607605, "epoch": 0.7097518753606463, "grad_norm": 0.78515625, "learning_rate": 0.0004959991522098797, "loss": 6.1771, "mean_token_accuracy": 0.1652152955532074, "num_tokens": 15572426.0, "step": 6150 }, { "entropy": 6.419304513931275, "epoch": 0.710328909405655, "grad_norm": 0.80078125, "learning_rate": 0.0004959914014579168, "loss": 6.2391, "mean_token_accuracy": 0.162534636259079, "num_tokens": 15584422.0, "step": 6155 }, { "entropy": 6.413751649856567, "epoch": 0.7109059434506636, "grad_norm": 0.91015625, "learning_rate": 0.0004959836432730178, "loss": 6.231, "mean_token_accuracy": 0.16499146223068237, "num_tokens": 15595538.0, "step": 6160 }, { "entropy": 6.337444114685058, "epoch": 0.7114829774956722, "grad_norm": 0.83984375, "learning_rate": 0.0004959758776554438, "loss": 6.1783, "mean_token_accuracy": 0.17357258945703508, "num_tokens": 15608315.0, "step": 6165 }, { "entropy": 6.39624662399292, "epoch": 0.7120600115406809, "grad_norm": 0.8515625, "learning_rate": 0.000495968104605456, "loss": 6.2659, "mean_token_accuracy": 0.16520965546369554, "num_tokens": 15620181.0, "step": 6170 }, { "entropy": 6.34517502784729, "epoch": 0.7126370455856895, "grad_norm": 0.88671875, "learning_rate": 0.0004959603241233157, "loss": 6.1166, "mean_token_accuracy": 0.16953941881656648, "num_tokens": 15632100.0, "step": 6175 }, { "entropy": 6.311384630203247, "epoch": 0.7132140796306982, "grad_norm": 0.796875, "learning_rate": 0.0004959525362092846, "loss": 6.1495, "mean_token_accuracy": 0.16864179223775863, "num_tokens": 15644185.0, "step": 6180 }, { "entropy": 6.354869842529297, "epoch": 0.7137911136757069, "grad_norm": 0.890625, "learning_rate": 0.0004959447408636247, "loss": 6.1944, "mean_token_accuracy": 0.1726676657795906, "num_tokens": 15657761.0, "step": 6185 }, { "entropy": 6.350826025009155, "epoch": 0.7143681477207156, "grad_norm": 0.80859375, "learning_rate": 0.0004959369380865983, "loss": 6.2315, "mean_token_accuracy": 0.15910745710134505, "num_tokens": 15671135.0, "step": 6190 }, { "entropy": 6.378980588912964, "epoch": 0.7149451817657242, "grad_norm": 0.84375, "learning_rate": 0.0004959291278784676, "loss": 6.1955, "mean_token_accuracy": 0.15981043577194215, "num_tokens": 15683286.0, "step": 6195 }, { "entropy": 6.351711416244507, "epoch": 0.7155222158107328, "grad_norm": 0.7734375, "learning_rate": 0.0004959213102394954, "loss": 6.1165, "mean_token_accuracy": 0.1762665629386902, "num_tokens": 15697535.0, "step": 6200 }, { "entropy": 6.344398021697998, "epoch": 0.7160992498557415, "grad_norm": 0.859375, "learning_rate": 0.0004959134851699449, "loss": 6.2067, "mean_token_accuracy": 0.16598029881715776, "num_tokens": 15708748.0, "step": 6205 }, { "entropy": 6.413574361801148, "epoch": 0.7166762839007501, "grad_norm": 0.85546875, "learning_rate": 0.0004959056526700788, "loss": 6.1852, "mean_token_accuracy": 0.16717519015073776, "num_tokens": 15721720.0, "step": 6210 }, { "entropy": 6.368403530120849, "epoch": 0.7172533179457588, "grad_norm": 0.88671875, "learning_rate": 0.0004958978127401609, "loss": 6.1315, "mean_token_accuracy": 0.17073239833116532, "num_tokens": 15734854.0, "step": 6215 }, { "entropy": 6.339862442016601, "epoch": 0.7178303519907675, "grad_norm": 0.8515625, "learning_rate": 0.0004958899653804548, "loss": 6.1926, "mean_token_accuracy": 0.16976216584444045, "num_tokens": 15747575.0, "step": 6220 }, { "entropy": 6.308337545394897, "epoch": 0.7184073860357761, "grad_norm": 1.140625, "learning_rate": 0.0004958821105912246, "loss": 6.2057, "mean_token_accuracy": 0.16995695233345032, "num_tokens": 15760917.0, "step": 6225 }, { "entropy": 6.464078569412232, "epoch": 0.7189844200807848, "grad_norm": 0.85546875, "learning_rate": 0.000495874248372734, "loss": 6.279, "mean_token_accuracy": 0.15709616243839264, "num_tokens": 15774045.0, "step": 6230 }, { "entropy": 6.406183242797852, "epoch": 0.7195614541257934, "grad_norm": 0.8984375, "learning_rate": 0.000495866378725248, "loss": 6.1858, "mean_token_accuracy": 0.1691389873623848, "num_tokens": 15786006.0, "step": 6235 }, { "entropy": 6.314851379394531, "epoch": 0.7201384881708021, "grad_norm": 0.88671875, "learning_rate": 0.000495858501649031, "loss": 6.1934, "mean_token_accuracy": 0.16714197844266893, "num_tokens": 15798078.0, "step": 6240 }, { "entropy": 6.398427200317383, "epoch": 0.7207155222158107, "grad_norm": 0.84375, "learning_rate": 0.000495850617144348, "loss": 6.1999, "mean_token_accuracy": 0.167718106508255, "num_tokens": 15810281.0, "step": 6245 }, { "entropy": 6.419170761108399, "epoch": 0.7212925562608193, "grad_norm": 0.71875, "learning_rate": 0.0004958427252114643, "loss": 6.2836, "mean_token_accuracy": 0.1600424215197563, "num_tokens": 15822593.0, "step": 6250 }, { "entropy": 6.408493232727051, "epoch": 0.7218695903058281, "grad_norm": 0.79296875, "learning_rate": 0.000495834825850645, "loss": 6.2203, "mean_token_accuracy": 0.1696522206068039, "num_tokens": 15835181.0, "step": 6255 }, { "entropy": 6.452267456054687, "epoch": 0.7224466243508367, "grad_norm": 0.75, "learning_rate": 0.0004958269190621562, "loss": 6.2164, "mean_token_accuracy": 0.16248857825994492, "num_tokens": 15847679.0, "step": 6260 }, { "entropy": 6.379993677139282, "epoch": 0.7230236583958454, "grad_norm": 0.8515625, "learning_rate": 0.0004958190048462637, "loss": 6.2552, "mean_token_accuracy": 0.16551875323057175, "num_tokens": 15860209.0, "step": 6265 }, { "entropy": 6.4074663639068605, "epoch": 0.723600692440854, "grad_norm": 0.87890625, "learning_rate": 0.0004958110832032336, "loss": 6.2241, "mean_token_accuracy": 0.1634237140417099, "num_tokens": 15873165.0, "step": 6270 }, { "entropy": 6.370559549331665, "epoch": 0.7241777264858626, "grad_norm": 0.82421875, "learning_rate": 0.0004958031541333322, "loss": 6.2481, "mean_token_accuracy": 0.16408838033676149, "num_tokens": 15885201.0, "step": 6275 }, { "entropy": 6.477904367446899, "epoch": 0.7247547605308713, "grad_norm": 0.79296875, "learning_rate": 0.0004957952176368267, "loss": 6.2923, "mean_token_accuracy": 0.16007572412490845, "num_tokens": 15899071.0, "step": 6280 }, { "entropy": 6.339187717437744, "epoch": 0.7253317945758799, "grad_norm": 0.79296875, "learning_rate": 0.0004957872737139836, "loss": 6.1956, "mean_token_accuracy": 0.16685390919446946, "num_tokens": 15912274.0, "step": 6285 }, { "entropy": 6.358347415924072, "epoch": 0.7259088286208887, "grad_norm": 0.83203125, "learning_rate": 0.0004957793223650702, "loss": 6.1697, "mean_token_accuracy": 0.17283968180418013, "num_tokens": 15925302.0, "step": 6290 }, { "entropy": 6.350992727279663, "epoch": 0.7264858626658973, "grad_norm": 0.80859375, "learning_rate": 0.000495771363590354, "loss": 6.2221, "mean_token_accuracy": 0.16327236741781234, "num_tokens": 15938226.0, "step": 6295 }, { "entropy": 6.3598075866699215, "epoch": 0.727062896710906, "grad_norm": 0.96484375, "learning_rate": 0.0004957633973901027, "loss": 6.2529, "mean_token_accuracy": 0.16555078625679015, "num_tokens": 15951136.0, "step": 6300 }, { "entropy": 6.5036924362182615, "epoch": 0.7276399307559146, "grad_norm": 0.9140625, "learning_rate": 0.0004957554237645841, "loss": 6.182, "mean_token_accuracy": 0.16397586315870286, "num_tokens": 15962820.0, "step": 6305 }, { "entropy": 6.3505518436431885, "epoch": 0.7282169648009232, "grad_norm": 0.828125, "learning_rate": 0.0004957474427140665, "loss": 6.1517, "mean_token_accuracy": 0.16915166974067689, "num_tokens": 15974871.0, "step": 6310 }, { "entropy": 6.292996549606324, "epoch": 0.7287939988459319, "grad_norm": 0.80859375, "learning_rate": 0.0004957394542388182, "loss": 6.1424, "mean_token_accuracy": 0.16711995154619216, "num_tokens": 15986916.0, "step": 6315 }, { "entropy": 6.4575494766235355, "epoch": 0.7293710328909405, "grad_norm": 0.8125, "learning_rate": 0.0004957314583391082, "loss": 6.2829, "mean_token_accuracy": 0.1611138626933098, "num_tokens": 15999735.0, "step": 6320 }, { "entropy": 6.395171499252319, "epoch": 0.7299480669359493, "grad_norm": 0.8203125, "learning_rate": 0.0004957234550152052, "loss": 6.1495, "mean_token_accuracy": 0.16820143014192582, "num_tokens": 16013137.0, "step": 6325 }, { "entropy": 6.411394023895264, "epoch": 0.7305251009809579, "grad_norm": 0.77734375, "learning_rate": 0.0004957154442673784, "loss": 6.1912, "mean_token_accuracy": 0.1681437909603119, "num_tokens": 16026750.0, "step": 6330 }, { "entropy": 6.4092567443847654, "epoch": 0.7311021350259665, "grad_norm": 0.82421875, "learning_rate": 0.0004957074260958972, "loss": 6.2858, "mean_token_accuracy": 0.16070856600999833, "num_tokens": 16039028.0, "step": 6335 }, { "entropy": 6.334304571151733, "epoch": 0.7316791690709752, "grad_norm": 0.79296875, "learning_rate": 0.0004956994005010315, "loss": 6.1644, "mean_token_accuracy": 0.16928236484527587, "num_tokens": 16051349.0, "step": 6340 }, { "entropy": 6.428053951263427, "epoch": 0.7322562031159838, "grad_norm": 0.8828125, "learning_rate": 0.000495691367483051, "loss": 6.1938, "mean_token_accuracy": 0.16701492369174958, "num_tokens": 16064015.0, "step": 6345 }, { "entropy": 6.399576091766358, "epoch": 0.7328332371609925, "grad_norm": 0.82421875, "learning_rate": 0.0004956833270422259, "loss": 6.2058, "mean_token_accuracy": 0.16545607447624205, "num_tokens": 16075571.0, "step": 6350 }, { "entropy": 6.313619899749756, "epoch": 0.7334102712060011, "grad_norm": 0.81640625, "learning_rate": 0.0004956752791788269, "loss": 6.2174, "mean_token_accuracy": 0.17301566898822784, "num_tokens": 16088176.0, "step": 6355 }, { "entropy": 6.446109962463379, "epoch": 0.7339873052510099, "grad_norm": 0.87890625, "learning_rate": 0.0004956672238931244, "loss": 6.2416, "mean_token_accuracy": 0.16300074756145477, "num_tokens": 16099933.0, "step": 6360 }, { "entropy": 6.3145325660705565, "epoch": 0.7345643392960185, "grad_norm": 0.8359375, "learning_rate": 0.0004956591611853894, "loss": 6.0568, "mean_token_accuracy": 0.17523580491542817, "num_tokens": 16113200.0, "step": 6365 }, { "entropy": 6.3287248611450195, "epoch": 0.7351413733410271, "grad_norm": 0.81640625, "learning_rate": 0.0004956510910558931, "loss": 6.226, "mean_token_accuracy": 0.1691768139600754, "num_tokens": 16125532.0, "step": 6370 }, { "entropy": 6.4246572971344, "epoch": 0.7357184073860358, "grad_norm": 0.7734375, "learning_rate": 0.0004956430135049071, "loss": 6.1668, "mean_token_accuracy": 0.16189181953668594, "num_tokens": 16137197.0, "step": 6375 }, { "entropy": 6.420309734344483, "epoch": 0.7362954414310444, "grad_norm": 0.81640625, "learning_rate": 0.0004956349285327028, "loss": 6.2291, "mean_token_accuracy": 0.170423786342144, "num_tokens": 16150481.0, "step": 6380 }, { "entropy": 6.436809253692627, "epoch": 0.7368724754760531, "grad_norm": 0.84765625, "learning_rate": 0.0004956268361395523, "loss": 6.243, "mean_token_accuracy": 0.16785213947296143, "num_tokens": 16162395.0, "step": 6385 }, { "entropy": 6.395518732070923, "epoch": 0.7374495095210617, "grad_norm": 0.8203125, "learning_rate": 0.0004956187363257278, "loss": 6.2114, "mean_token_accuracy": 0.16164291948080062, "num_tokens": 16174550.0, "step": 6390 }, { "entropy": 6.441514873504639, "epoch": 0.7380265435660704, "grad_norm": 0.87890625, "learning_rate": 0.0004956106290915017, "loss": 6.224, "mean_token_accuracy": 0.16265684217214585, "num_tokens": 16187571.0, "step": 6395 }, { "entropy": 6.387861871719361, "epoch": 0.7386035776110791, "grad_norm": 0.765625, "learning_rate": 0.0004956025144371467, "loss": 6.2354, "mean_token_accuracy": 0.16527050733566284, "num_tokens": 16199684.0, "step": 6400 }, { "entropy": 6.3519782543182375, "epoch": 0.7391806116560877, "grad_norm": 0.8125, "learning_rate": 0.0004955943923629356, "loss": 6.209, "mean_token_accuracy": 0.1613857090473175, "num_tokens": 16211935.0, "step": 6405 }, { "entropy": 6.381722450256348, "epoch": 0.7397576457010964, "grad_norm": 0.76953125, "learning_rate": 0.0004955862628691417, "loss": 6.2057, "mean_token_accuracy": 0.16139667183160783, "num_tokens": 16224346.0, "step": 6410 }, { "entropy": 6.384852361679077, "epoch": 0.740334679746105, "grad_norm": 0.82421875, "learning_rate": 0.0004955781259560386, "loss": 6.2382, "mean_token_accuracy": 0.16073639541864396, "num_tokens": 16238137.0, "step": 6415 }, { "entropy": 6.42009801864624, "epoch": 0.7409117137911136, "grad_norm": 0.80078125, "learning_rate": 0.0004955699816238995, "loss": 6.2115, "mean_token_accuracy": 0.1616441637277603, "num_tokens": 16250777.0, "step": 6420 }, { "entropy": 6.490957832336425, "epoch": 0.7414887478361223, "grad_norm": 0.82421875, "learning_rate": 0.0004955618298729988, "loss": 6.216, "mean_token_accuracy": 0.16838435977697372, "num_tokens": 16262440.0, "step": 6425 }, { "entropy": 6.3685378074646, "epoch": 0.742065781881131, "grad_norm": 0.80859375, "learning_rate": 0.0004955536707036105, "loss": 6.1605, "mean_token_accuracy": 0.1693017989397049, "num_tokens": 16275227.0, "step": 6430 }, { "entropy": 6.362598896026611, "epoch": 0.7426428159261397, "grad_norm": 0.8359375, "learning_rate": 0.000495545504116009, "loss": 6.2191, "mean_token_accuracy": 0.16907331794500352, "num_tokens": 16287246.0, "step": 6435 }, { "entropy": 6.334651374816895, "epoch": 0.7432198499711483, "grad_norm": 0.84375, "learning_rate": 0.0004955373301104691, "loss": 6.0844, "mean_token_accuracy": 0.1756950169801712, "num_tokens": 16298779.0, "step": 6440 }, { "entropy": 6.257397556304932, "epoch": 0.743796884016157, "grad_norm": 0.90625, "learning_rate": 0.0004955291486872657, "loss": 6.094, "mean_token_accuracy": 0.17155533283948898, "num_tokens": 16310965.0, "step": 6445 }, { "entropy": 6.422209453582764, "epoch": 0.7443739180611656, "grad_norm": 0.81640625, "learning_rate": 0.0004955209598466738, "loss": 6.1489, "mean_token_accuracy": 0.16697419285774232, "num_tokens": 16324025.0, "step": 6450 }, { "entropy": 6.4021642208099365, "epoch": 0.7449509521061742, "grad_norm": 0.7890625, "learning_rate": 0.000495512763588969, "loss": 6.1812, "mean_token_accuracy": 0.1613484129309654, "num_tokens": 16336152.0, "step": 6455 }, { "entropy": 6.3049877166748045, "epoch": 0.7455279861511829, "grad_norm": 0.859375, "learning_rate": 0.0004955045599144269, "loss": 6.1725, "mean_token_accuracy": 0.16346538215875625, "num_tokens": 16349118.0, "step": 6460 }, { "entropy": 6.290837526321411, "epoch": 0.7461050201961916, "grad_norm": 0.85546875, "learning_rate": 0.0004954963488233235, "loss": 6.1527, "mean_token_accuracy": 0.16980938464403153, "num_tokens": 16362986.0, "step": 6465 }, { "entropy": 6.390332794189453, "epoch": 0.7466820542412003, "grad_norm": 0.78515625, "learning_rate": 0.000495488130315935, "loss": 6.2864, "mean_token_accuracy": 0.15601871460676192, "num_tokens": 16376384.0, "step": 6470 }, { "entropy": 6.3824310302734375, "epoch": 0.7472590882862089, "grad_norm": 0.83203125, "learning_rate": 0.0004954799043925377, "loss": 6.0944, "mean_token_accuracy": 0.16927106827497482, "num_tokens": 16388137.0, "step": 6475 }, { "entropy": 6.397792720794678, "epoch": 0.7478361223312175, "grad_norm": 0.8671875, "learning_rate": 0.0004954716710534082, "loss": 6.2386, "mean_token_accuracy": 0.15695064812898635, "num_tokens": 16400037.0, "step": 6480 }, { "entropy": 6.404593467712402, "epoch": 0.7484131563762262, "grad_norm": 0.796875, "learning_rate": 0.0004954634302988237, "loss": 6.1692, "mean_token_accuracy": 0.16684277951717377, "num_tokens": 16412065.0, "step": 6485 }, { "entropy": 6.392002153396606, "epoch": 0.7489901904212348, "grad_norm": 0.8828125, "learning_rate": 0.0004954551821290612, "loss": 6.1886, "mean_token_accuracy": 0.1650811791419983, "num_tokens": 16424345.0, "step": 6490 }, { "entropy": 6.408037185668945, "epoch": 0.7495672244662435, "grad_norm": 0.890625, "learning_rate": 0.0004954469265443981, "loss": 6.2616, "mean_token_accuracy": 0.16495269536972046, "num_tokens": 16436423.0, "step": 6495 }, { "entropy": 6.3400726318359375, "epoch": 0.7501442585112522, "grad_norm": 0.78125, "learning_rate": 0.0004954386635451123, "loss": 6.1597, "mean_token_accuracy": 0.16760794222354888, "num_tokens": 16449496.0, "step": 6500 }, { "entropy": 6.373304224014282, "epoch": 0.7507212925562609, "grad_norm": 0.81640625, "learning_rate": 0.0004954303931314814, "loss": 6.1806, "mean_token_accuracy": 0.16673036217689513, "num_tokens": 16462193.0, "step": 6505 }, { "entropy": 6.355952978134155, "epoch": 0.7512983266012695, "grad_norm": 0.796875, "learning_rate": 0.0004954221153037837, "loss": 6.2043, "mean_token_accuracy": 0.1631313681602478, "num_tokens": 16474470.0, "step": 6510 }, { "entropy": 6.425698757171631, "epoch": 0.7518753606462781, "grad_norm": 0.83203125, "learning_rate": 0.0004954138300622978, "loss": 6.1706, "mean_token_accuracy": 0.17431595772504807, "num_tokens": 16487231.0, "step": 6515 }, { "entropy": 6.373720026016235, "epoch": 0.7524523946912868, "grad_norm": 0.7890625, "learning_rate": 0.000495405537407302, "loss": 6.2687, "mean_token_accuracy": 0.16340657472610473, "num_tokens": 16500822.0, "step": 6520 }, { "entropy": 6.301622486114502, "epoch": 0.7530294287362954, "grad_norm": 0.87109375, "learning_rate": 0.0004953972373390755, "loss": 6.2006, "mean_token_accuracy": 0.16783786863088607, "num_tokens": 16514529.0, "step": 6525 }, { "entropy": 6.352727317810059, "epoch": 0.753606462781304, "grad_norm": 0.828125, "learning_rate": 0.0004953889298578975, "loss": 6.1729, "mean_token_accuracy": 0.1620926558971405, "num_tokens": 16527281.0, "step": 6530 }, { "entropy": 6.431893682479858, "epoch": 0.7541834968263128, "grad_norm": 0.93359375, "learning_rate": 0.0004953806149640473, "loss": 6.1662, "mean_token_accuracy": 0.16912026554346085, "num_tokens": 16539763.0, "step": 6535 }, { "entropy": 6.268726921081543, "epoch": 0.7547605308713214, "grad_norm": 0.73828125, "learning_rate": 0.0004953722926578045, "loss": 6.1403, "mean_token_accuracy": 0.17996453493833542, "num_tokens": 16552197.0, "step": 6540 }, { "entropy": 6.44415316581726, "epoch": 0.7553375649163301, "grad_norm": 0.8203125, "learning_rate": 0.0004953639629394492, "loss": 6.2006, "mean_token_accuracy": 0.16660022884607315, "num_tokens": 16563988.0, "step": 6545 }, { "entropy": 6.337887763977051, "epoch": 0.7559145989613387, "grad_norm": 0.75390625, "learning_rate": 0.0004953556258092613, "loss": 6.1856, "mean_token_accuracy": 0.16377629339694977, "num_tokens": 16576982.0, "step": 6550 }, { "entropy": 6.3525402545928955, "epoch": 0.7564916330063474, "grad_norm": 0.80859375, "learning_rate": 0.0004953472812675216, "loss": 6.2339, "mean_token_accuracy": 0.16399967223405837, "num_tokens": 16590268.0, "step": 6555 }, { "entropy": 6.381183433532715, "epoch": 0.757068667051356, "grad_norm": 0.796875, "learning_rate": 0.0004953389293145104, "loss": 6.0784, "mean_token_accuracy": 0.1773386687040329, "num_tokens": 16602599.0, "step": 6560 }, { "entropy": 6.38706521987915, "epoch": 0.7576457010963646, "grad_norm": 0.84375, "learning_rate": 0.0004953305699505088, "loss": 6.1784, "mean_token_accuracy": 0.16482038497924806, "num_tokens": 16614278.0, "step": 6565 }, { "entropy": 6.376954698562622, "epoch": 0.7582227351413734, "grad_norm": 0.8828125, "learning_rate": 0.0004953222031757979, "loss": 6.1969, "mean_token_accuracy": 0.16000646650791167, "num_tokens": 16626810.0, "step": 6570 }, { "entropy": 6.30605149269104, "epoch": 0.758799769186382, "grad_norm": 0.796875, "learning_rate": 0.0004953138289906592, "loss": 6.147, "mean_token_accuracy": 0.16598434895277023, "num_tokens": 16639134.0, "step": 6575 }, { "entropy": 6.401002597808838, "epoch": 0.7593768032313907, "grad_norm": 0.90625, "learning_rate": 0.0004953054473953742, "loss": 6.174, "mean_token_accuracy": 0.16408377885818481, "num_tokens": 16652724.0, "step": 6580 }, { "entropy": 6.300872707366944, "epoch": 0.7599538372763993, "grad_norm": 0.7890625, "learning_rate": 0.0004952970583902251, "loss": 6.1405, "mean_token_accuracy": 0.16957145929336548, "num_tokens": 16666045.0, "step": 6585 }, { "entropy": 6.358345413208008, "epoch": 0.760530871321408, "grad_norm": 0.8046875, "learning_rate": 0.0004952886619754937, "loss": 6.2554, "mean_token_accuracy": 0.16089996993541716, "num_tokens": 16678422.0, "step": 6590 }, { "entropy": 6.361907529830932, "epoch": 0.7611079053664166, "grad_norm": 0.8203125, "learning_rate": 0.0004952802581514625, "loss": 6.1704, "mean_token_accuracy": 0.17014944702386856, "num_tokens": 16690243.0, "step": 6595 }, { "entropy": 6.311407661437988, "epoch": 0.7616849394114252, "grad_norm": 0.8359375, "learning_rate": 0.0004952718469184144, "loss": 6.1312, "mean_token_accuracy": 0.17277286797761918, "num_tokens": 16702418.0, "step": 6600 }, { "entropy": 6.436389970779419, "epoch": 0.762261973456434, "grad_norm": 0.796875, "learning_rate": 0.0004952634282766322, "loss": 6.2206, "mean_token_accuracy": 0.15880272090435027, "num_tokens": 16713974.0, "step": 6605 }, { "entropy": 6.349586820602417, "epoch": 0.7628390075014426, "grad_norm": 0.921875, "learning_rate": 0.0004952550022263988, "loss": 6.1066, "mean_token_accuracy": 0.17593667209148406, "num_tokens": 16726518.0, "step": 6610 }, { "entropy": 6.310934448242188, "epoch": 0.7634160415464513, "grad_norm": 0.76953125, "learning_rate": 0.0004952465687679979, "loss": 6.1369, "mean_token_accuracy": 0.17361938208341599, "num_tokens": 16738701.0, "step": 6615 }, { "entropy": 6.3912577629089355, "epoch": 0.7639930755914599, "grad_norm": 0.76953125, "learning_rate": 0.000495238127901713, "loss": 6.186, "mean_token_accuracy": 0.1613457351922989, "num_tokens": 16751251.0, "step": 6620 }, { "entropy": 6.388515663146973, "epoch": 0.7645701096364685, "grad_norm": 0.78515625, "learning_rate": 0.0004952296796278282, "loss": 6.1779, "mean_token_accuracy": 0.16940819919109346, "num_tokens": 16764233.0, "step": 6625 }, { "entropy": 6.276236534118652, "epoch": 0.7651471436814772, "grad_norm": 0.88671875, "learning_rate": 0.0004952212239466274, "loss": 6.1759, "mean_token_accuracy": 0.1788155049085617, "num_tokens": 16778408.0, "step": 6630 }, { "entropy": 6.3944172859191895, "epoch": 0.7657241777264858, "grad_norm": 0.8203125, "learning_rate": 0.0004952127608583953, "loss": 6.2105, "mean_token_accuracy": 0.16523972898721695, "num_tokens": 16789863.0, "step": 6635 }, { "entropy": 6.392884111404419, "epoch": 0.7663012117714946, "grad_norm": 0.83203125, "learning_rate": 0.0004952042903634162, "loss": 6.1331, "mean_token_accuracy": 0.17282791584730148, "num_tokens": 16804448.0, "step": 6640 }, { "entropy": 6.314636993408203, "epoch": 0.7668782458165032, "grad_norm": 0.83984375, "learning_rate": 0.0004951958124619752, "loss": 6.231, "mean_token_accuracy": 0.16494413763284682, "num_tokens": 16817922.0, "step": 6645 }, { "entropy": 6.392580652236939, "epoch": 0.7674552798615119, "grad_norm": 0.75390625, "learning_rate": 0.0004951873271543573, "loss": 6.2165, "mean_token_accuracy": 0.16729218661785125, "num_tokens": 16830322.0, "step": 6650 }, { "entropy": 6.465516519546509, "epoch": 0.7680323139065205, "grad_norm": 0.890625, "learning_rate": 0.0004951788344408483, "loss": 6.2252, "mean_token_accuracy": 0.16338257789611815, "num_tokens": 16843489.0, "step": 6655 }, { "entropy": 6.345834875106812, "epoch": 0.7686093479515291, "grad_norm": 0.8125, "learning_rate": 0.0004951703343217335, "loss": 6.1887, "mean_token_accuracy": 0.16055528968572616, "num_tokens": 16855256.0, "step": 6660 }, { "entropy": 6.285180187225341, "epoch": 0.7691863819965378, "grad_norm": 0.7890625, "learning_rate": 0.0004951618267972987, "loss": 6.171, "mean_token_accuracy": 0.1670081600546837, "num_tokens": 16869927.0, "step": 6665 }, { "entropy": 6.294586229324341, "epoch": 0.7697634160415464, "grad_norm": 0.91015625, "learning_rate": 0.0004951533118678304, "loss": 6.0723, "mean_token_accuracy": 0.18153493106365204, "num_tokens": 16882095.0, "step": 6670 }, { "entropy": 6.4467226505279545, "epoch": 0.7703404500865552, "grad_norm": 0.90625, "learning_rate": 0.0004951447895336147, "loss": 6.2758, "mean_token_accuracy": 0.16662507206201554, "num_tokens": 16893338.0, "step": 6675 }, { "entropy": 6.349839162826538, "epoch": 0.7709174841315638, "grad_norm": 0.828125, "learning_rate": 0.0004951362597949384, "loss": 6.2421, "mean_token_accuracy": 0.16923239529132844, "num_tokens": 16907138.0, "step": 6680 }, { "entropy": 6.409167861938476, "epoch": 0.7714945181765724, "grad_norm": 1.0390625, "learning_rate": 0.0004951277226520883, "loss": 6.1483, "mean_token_accuracy": 0.16991439014673232, "num_tokens": 16919756.0, "step": 6685 }, { "entropy": 6.386492919921875, "epoch": 0.7720715522215811, "grad_norm": 0.8125, "learning_rate": 0.0004951191781053517, "loss": 6.104, "mean_token_accuracy": 0.17598668336868287, "num_tokens": 16932059.0, "step": 6690 }, { "entropy": 6.321619033813477, "epoch": 0.7726485862665897, "grad_norm": 0.9296875, "learning_rate": 0.0004951106261550157, "loss": 6.2057, "mean_token_accuracy": 0.16631946563720704, "num_tokens": 16944777.0, "step": 6695 }, { "entropy": 6.380236434936523, "epoch": 0.7732256203115984, "grad_norm": 0.8046875, "learning_rate": 0.0004951020668013683, "loss": 6.1656, "mean_token_accuracy": 0.17202370017766952, "num_tokens": 16957111.0, "step": 6700 }, { "entropy": 6.385104084014893, "epoch": 0.773802654356607, "grad_norm": 0.84375, "learning_rate": 0.0004950935000446972, "loss": 6.2429, "mean_token_accuracy": 0.15982713252305986, "num_tokens": 16968663.0, "step": 6705 }, { "entropy": 6.359501457214355, "epoch": 0.7743796884016156, "grad_norm": 0.80078125, "learning_rate": 0.0004950849258852905, "loss": 6.168, "mean_token_accuracy": 0.16180971562862395, "num_tokens": 16980668.0, "step": 6710 }, { "entropy": 6.346779251098633, "epoch": 0.7749567224466244, "grad_norm": 0.7890625, "learning_rate": 0.0004950763443234366, "loss": 6.2033, "mean_token_accuracy": 0.16977418661117555, "num_tokens": 16993537.0, "step": 6715 }, { "entropy": 6.372853565216064, "epoch": 0.775533756491633, "grad_norm": 0.765625, "learning_rate": 0.0004950677553594243, "loss": 6.18, "mean_token_accuracy": 0.16297179460525513, "num_tokens": 17006268.0, "step": 6720 }, { "entropy": 6.383951425552368, "epoch": 0.7761107905366417, "grad_norm": 0.84375, "learning_rate": 0.0004950591589935422, "loss": 6.1762, "mean_token_accuracy": 0.1659395158290863, "num_tokens": 17018643.0, "step": 6725 }, { "entropy": 6.294509315490723, "epoch": 0.7766878245816503, "grad_norm": 0.87890625, "learning_rate": 0.0004950505552260798, "loss": 6.1452, "mean_token_accuracy": 0.17016030550003053, "num_tokens": 17030670.0, "step": 6730 }, { "entropy": 6.4208496570587155, "epoch": 0.777264858626659, "grad_norm": 0.828125, "learning_rate": 0.0004950419440573261, "loss": 6.155, "mean_token_accuracy": 0.17145975232124328, "num_tokens": 17042617.0, "step": 6735 }, { "entropy": 6.289498710632325, "epoch": 0.7778418926716676, "grad_norm": 0.8046875, "learning_rate": 0.000495033325487571, "loss": 6.2014, "mean_token_accuracy": 0.16481405943632127, "num_tokens": 17055217.0, "step": 6740 }, { "entropy": 6.231577014923095, "epoch": 0.7784189267166762, "grad_norm": 0.828125, "learning_rate": 0.0004950246995171042, "loss": 6.054, "mean_token_accuracy": 0.18304862976074218, "num_tokens": 17068614.0, "step": 6745 }, { "entropy": 6.345638132095337, "epoch": 0.778995960761685, "grad_norm": 0.921875, "learning_rate": 0.000495016066146216, "loss": 6.089, "mean_token_accuracy": 0.17975687980651855, "num_tokens": 17079892.0, "step": 6750 }, { "entropy": 6.320506286621094, "epoch": 0.7795729948066936, "grad_norm": 0.85546875, "learning_rate": 0.0004950074253751968, "loss": 6.187, "mean_token_accuracy": 0.17330573499202728, "num_tokens": 17092113.0, "step": 6755 }, { "entropy": 6.373245906829834, "epoch": 0.7801500288517023, "grad_norm": 0.87890625, "learning_rate": 0.000494998777204337, "loss": 6.1624, "mean_token_accuracy": 0.1723353922367096, "num_tokens": 17103387.0, "step": 6760 }, { "entropy": 6.408647680282593, "epoch": 0.7807270628967109, "grad_norm": 0.828125, "learning_rate": 0.0004949901216339276, "loss": 6.2118, "mean_token_accuracy": 0.16432149559259415, "num_tokens": 17116008.0, "step": 6765 }, { "entropy": 6.3029053688049315, "epoch": 0.7813040969417195, "grad_norm": 0.7890625, "learning_rate": 0.0004949814586642598, "loss": 6.0949, "mean_token_accuracy": 0.1802838459610939, "num_tokens": 17129224.0, "step": 6770 }, { "entropy": 6.2848211288452145, "epoch": 0.7818811309867282, "grad_norm": 0.8515625, "learning_rate": 0.000494972788295625, "loss": 6.0943, "mean_token_accuracy": 0.16807924062013627, "num_tokens": 17141357.0, "step": 6775 }, { "entropy": 6.308895206451416, "epoch": 0.7824581650317368, "grad_norm": 0.79296875, "learning_rate": 0.0004949641105283144, "loss": 6.1263, "mean_token_accuracy": 0.17011737823486328, "num_tokens": 17153672.0, "step": 6780 }, { "entropy": 6.329161548614502, "epoch": 0.7830351990767456, "grad_norm": 0.84765625, "learning_rate": 0.0004949554253626205, "loss": 6.1984, "mean_token_accuracy": 0.16174544990062714, "num_tokens": 17168429.0, "step": 6785 }, { "entropy": 6.412427520751953, "epoch": 0.7836122331217542, "grad_norm": 0.85546875, "learning_rate": 0.0004949467327988351, "loss": 6.1309, "mean_token_accuracy": 0.16915023773908616, "num_tokens": 17181000.0, "step": 6790 }, { "entropy": 6.298403978347778, "epoch": 0.7841892671667628, "grad_norm": 0.82421875, "learning_rate": 0.0004949380328372505, "loss": 6.1312, "mean_token_accuracy": 0.16709219068288803, "num_tokens": 17193984.0, "step": 6795 }, { "entropy": 6.35187873840332, "epoch": 0.7847663012117715, "grad_norm": 0.84765625, "learning_rate": 0.0004949293254781595, "loss": 6.1563, "mean_token_accuracy": 0.17206377685070037, "num_tokens": 17207289.0, "step": 6800 }, { "entropy": 6.3366005420684814, "epoch": 0.7853433352567801, "grad_norm": 0.80078125, "learning_rate": 0.0004949206107218547, "loss": 6.207, "mean_token_accuracy": 0.16879773288965225, "num_tokens": 17220785.0, "step": 6805 }, { "entropy": 6.426763868331909, "epoch": 0.7859203693017888, "grad_norm": 0.86328125, "learning_rate": 0.0004949118885686296, "loss": 6.1794, "mean_token_accuracy": 0.1629263088107109, "num_tokens": 17233475.0, "step": 6810 }, { "entropy": 6.387394714355469, "epoch": 0.7864974033467974, "grad_norm": 0.796875, "learning_rate": 0.0004949031590187774, "loss": 6.154, "mean_token_accuracy": 0.1672731891274452, "num_tokens": 17246652.0, "step": 6815 }, { "entropy": 6.331944465637207, "epoch": 0.7870744373918062, "grad_norm": 0.859375, "learning_rate": 0.0004948944220725915, "loss": 6.1632, "mean_token_accuracy": 0.1671597495675087, "num_tokens": 17259966.0, "step": 6820 }, { "entropy": 6.285306072235107, "epoch": 0.7876514714368148, "grad_norm": 0.796875, "learning_rate": 0.000494885677730366, "loss": 6.0972, "mean_token_accuracy": 0.1782669961452484, "num_tokens": 17272556.0, "step": 6825 }, { "entropy": 6.356509113311768, "epoch": 0.7882285054818234, "grad_norm": 0.890625, "learning_rate": 0.000494876925992395, "loss": 6.1213, "mean_token_accuracy": 0.1762054055929184, "num_tokens": 17285960.0, "step": 6830 }, { "entropy": 6.398293352127075, "epoch": 0.7888055395268321, "grad_norm": 0.8515625, "learning_rate": 0.0004948681668589728, "loss": 6.2315, "mean_token_accuracy": 0.15961660146713258, "num_tokens": 17299743.0, "step": 6835 }, { "entropy": 6.301696109771728, "epoch": 0.7893825735718407, "grad_norm": 0.8125, "learning_rate": 0.000494859400330394, "loss": 6.1103, "mean_token_accuracy": 0.16794033199548722, "num_tokens": 17312317.0, "step": 6840 }, { "entropy": 6.351978206634522, "epoch": 0.7899596076168494, "grad_norm": 0.7734375, "learning_rate": 0.0004948506264069535, "loss": 6.1624, "mean_token_accuracy": 0.167983041703701, "num_tokens": 17326204.0, "step": 6845 }, { "entropy": 6.338317823410034, "epoch": 0.790536641661858, "grad_norm": 0.83984375, "learning_rate": 0.0004948418450889464, "loss": 6.1077, "mean_token_accuracy": 0.1751476228237152, "num_tokens": 17338362.0, "step": 6850 }, { "entropy": 6.257613039016723, "epoch": 0.7911136757068667, "grad_norm": 0.77734375, "learning_rate": 0.000494833056376668, "loss": 6.1526, "mean_token_accuracy": 0.1725895255804062, "num_tokens": 17350713.0, "step": 6855 }, { "entropy": 6.426647043228149, "epoch": 0.7916907097518754, "grad_norm": 1.015625, "learning_rate": 0.0004948242602704139, "loss": 6.185, "mean_token_accuracy": 0.16246354728937148, "num_tokens": 17364055.0, "step": 6860 }, { "entropy": 6.354440021514892, "epoch": 0.792267743796884, "grad_norm": 0.8515625, "learning_rate": 0.0004948154567704801, "loss": 6.2338, "mean_token_accuracy": 0.1697024703025818, "num_tokens": 17377940.0, "step": 6865 }, { "entropy": 6.37884521484375, "epoch": 0.7928447778418927, "grad_norm": 0.82421875, "learning_rate": 0.0004948066458771625, "loss": 6.1571, "mean_token_accuracy": 0.17270761132240295, "num_tokens": 17390348.0, "step": 6870 }, { "entropy": 6.355157947540283, "epoch": 0.7934218118869013, "grad_norm": 0.859375, "learning_rate": 0.0004947978275907577, "loss": 6.1631, "mean_token_accuracy": 0.17038169950246812, "num_tokens": 17403406.0, "step": 6875 }, { "entropy": 6.323590803146362, "epoch": 0.79399884593191, "grad_norm": 0.8203125, "learning_rate": 0.000494789001911562, "loss": 6.1659, "mean_token_accuracy": 0.16402290314435958, "num_tokens": 17415306.0, "step": 6880 }, { "entropy": 6.354849624633789, "epoch": 0.7945758799769186, "grad_norm": 0.80859375, "learning_rate": 0.0004947801688398725, "loss": 6.2131, "mean_token_accuracy": 0.16550301611423493, "num_tokens": 17427901.0, "step": 6885 }, { "entropy": 6.385193347930908, "epoch": 0.7951529140219273, "grad_norm": 0.87109375, "learning_rate": 0.0004947713283759862, "loss": 6.1557, "mean_token_accuracy": 0.16478197127580643, "num_tokens": 17439812.0, "step": 6890 }, { "entropy": 6.380311965942383, "epoch": 0.795729948066936, "grad_norm": 0.81640625, "learning_rate": 0.0004947624805202003, "loss": 6.2637, "mean_token_accuracy": 0.16673970818519593, "num_tokens": 17453317.0, "step": 6895 }, { "entropy": 6.315207052230835, "epoch": 0.7963069821119446, "grad_norm": 0.80859375, "learning_rate": 0.0004947536252728126, "loss": 6.1383, "mean_token_accuracy": 0.16237509697675706, "num_tokens": 17465563.0, "step": 6900 }, { "entropy": 6.343274450302124, "epoch": 0.7968840161569533, "grad_norm": 0.9296875, "learning_rate": 0.0004947447626341209, "loss": 6.2019, "mean_token_accuracy": 0.16558388322591783, "num_tokens": 17477672.0, "step": 6905 }, { "entropy": 6.394934368133545, "epoch": 0.7974610502019619, "grad_norm": 0.81640625, "learning_rate": 0.0004947358926044232, "loss": 6.168, "mean_token_accuracy": 0.16697321683168412, "num_tokens": 17489061.0, "step": 6910 }, { "entropy": 6.357774353027343, "epoch": 0.7980380842469705, "grad_norm": 0.8359375, "learning_rate": 0.0004947270151840179, "loss": 6.1935, "mean_token_accuracy": 0.1671817809343338, "num_tokens": 17501734.0, "step": 6915 }, { "entropy": 6.3456621170043945, "epoch": 0.7986151182919792, "grad_norm": 0.859375, "learning_rate": 0.0004947181303732038, "loss": 6.1014, "mean_token_accuracy": 0.16575353741645812, "num_tokens": 17514387.0, "step": 6920 }, { "entropy": 6.3213715076446535, "epoch": 0.7991921523369879, "grad_norm": 0.89453125, "learning_rate": 0.0004947092381722793, "loss": 6.1093, "mean_token_accuracy": 0.176436585187912, "num_tokens": 17526483.0, "step": 6925 }, { "entropy": 6.3709863185882565, "epoch": 0.7997691863819966, "grad_norm": 0.80859375, "learning_rate": 0.0004947003385815438, "loss": 6.1283, "mean_token_accuracy": 0.17597151696681976, "num_tokens": 17539809.0, "step": 6930 }, { "entropy": 6.328467512130738, "epoch": 0.8003462204270052, "grad_norm": 0.85546875, "learning_rate": 0.0004946914316012964, "loss": 6.1598, "mean_token_accuracy": 0.16539319902658461, "num_tokens": 17552973.0, "step": 6935 }, { "entropy": 6.3325916767120365, "epoch": 0.8009232544720138, "grad_norm": 0.80078125, "learning_rate": 0.000494682517231837, "loss": 6.1964, "mean_token_accuracy": 0.16823789924383165, "num_tokens": 17567803.0, "step": 6940 }, { "entropy": 6.404011678695679, "epoch": 0.8015002885170225, "grad_norm": 0.80859375, "learning_rate": 0.0004946735954734652, "loss": 6.1555, "mean_token_accuracy": 0.16666851192712784, "num_tokens": 17579718.0, "step": 6945 }, { "entropy": 6.385808038711548, "epoch": 0.8020773225620311, "grad_norm": 0.8984375, "learning_rate": 0.0004946646663264811, "loss": 6.1333, "mean_token_accuracy": 0.1694340467453003, "num_tokens": 17592384.0, "step": 6950 }, { "entropy": 6.309904003143311, "epoch": 0.8026543566070398, "grad_norm": 0.84375, "learning_rate": 0.0004946557297911852, "loss": 6.0212, "mean_token_accuracy": 0.17547217458486558, "num_tokens": 17604292.0, "step": 6955 }, { "entropy": 6.287991714477539, "epoch": 0.8032313906520485, "grad_norm": 0.80859375, "learning_rate": 0.0004946467858678777, "loss": 6.075, "mean_token_accuracy": 0.17394087314605713, "num_tokens": 17616638.0, "step": 6960 }, { "entropy": 6.383854913711548, "epoch": 0.8038084246970572, "grad_norm": 0.80078125, "learning_rate": 0.0004946378345568597, "loss": 6.1799, "mean_token_accuracy": 0.16211076080799103, "num_tokens": 17630672.0, "step": 6965 }, { "entropy": 6.366672039031982, "epoch": 0.8043854587420658, "grad_norm": 1.1328125, "learning_rate": 0.0004946288758584324, "loss": 6.1695, "mean_token_accuracy": 0.16282691508531572, "num_tokens": 17644215.0, "step": 6970 }, { "entropy": 6.3507161140441895, "epoch": 0.8049624927870744, "grad_norm": 0.84375, "learning_rate": 0.0004946199097728968, "loss": 6.2385, "mean_token_accuracy": 0.1637930914759636, "num_tokens": 17655982.0, "step": 6975 }, { "entropy": 6.403667640686035, "epoch": 0.8055395268320831, "grad_norm": 0.90625, "learning_rate": 0.0004946109363005548, "loss": 6.1556, "mean_token_accuracy": 0.16717308312654494, "num_tokens": 17668059.0, "step": 6980 }, { "entropy": 6.378528499603272, "epoch": 0.8061165608770917, "grad_norm": 0.84375, "learning_rate": 0.000494601955441708, "loss": 6.1703, "mean_token_accuracy": 0.17550845742225646, "num_tokens": 17680924.0, "step": 6985 }, { "entropy": 6.313846302032471, "epoch": 0.8066935949221004, "grad_norm": 0.78515625, "learning_rate": 0.0004945929671966585, "loss": 6.1863, "mean_token_accuracy": 0.1592755913734436, "num_tokens": 17693381.0, "step": 6990 }, { "entropy": 6.293050956726074, "epoch": 0.8072706289671091, "grad_norm": 0.83203125, "learning_rate": 0.0004945839715657085, "loss": 6.0838, "mean_token_accuracy": 0.1738973081111908, "num_tokens": 17705900.0, "step": 6995 }, { "entropy": 6.292917346954345, "epoch": 0.8078476630121177, "grad_norm": 0.80078125, "learning_rate": 0.0004945749685491607, "loss": 6.0748, "mean_token_accuracy": 0.17757318913936615, "num_tokens": 17719139.0, "step": 7000 }, { "entropy": 6.337329006195068, "epoch": 0.8084246970571264, "grad_norm": 0.75390625, "learning_rate": 0.0004945659581473181, "loss": 6.0884, "mean_token_accuracy": 0.17271215915679933, "num_tokens": 17734312.0, "step": 7005 }, { "entropy": 6.381900072097778, "epoch": 0.809001731102135, "grad_norm": 0.86328125, "learning_rate": 0.0004945569403604833, "loss": 6.1688, "mean_token_accuracy": 0.16242203563451768, "num_tokens": 17746137.0, "step": 7010 }, { "entropy": 6.320837736129761, "epoch": 0.8095787651471437, "grad_norm": 0.83203125, "learning_rate": 0.0004945479151889601, "loss": 5.9999, "mean_token_accuracy": 0.17752463966608048, "num_tokens": 17758879.0, "step": 7015 }, { "entropy": 6.252843236923217, "epoch": 0.8101557991921523, "grad_norm": 0.875, "learning_rate": 0.0004945388826330517, "loss": 6.1388, "mean_token_accuracy": 0.1744886964559555, "num_tokens": 17770820.0, "step": 7020 }, { "entropy": 6.382633686065674, "epoch": 0.8107328332371609, "grad_norm": 0.8359375, "learning_rate": 0.0004945298426930621, "loss": 6.1936, "mean_token_accuracy": 0.16758178621530534, "num_tokens": 17783495.0, "step": 7025 }, { "entropy": 6.428963232040405, "epoch": 0.8113098672821697, "grad_norm": 0.86328125, "learning_rate": 0.0004945207953692952, "loss": 6.1614, "mean_token_accuracy": 0.1685134768486023, "num_tokens": 17795780.0, "step": 7030 }, { "entropy": 6.311816883087158, "epoch": 0.8118869013271783, "grad_norm": 0.83203125, "learning_rate": 0.0004945117406620556, "loss": 6.1866, "mean_token_accuracy": 0.1712436020374298, "num_tokens": 17809684.0, "step": 7035 }, { "entropy": 6.322688293457031, "epoch": 0.812463935372187, "grad_norm": 0.85546875, "learning_rate": 0.0004945026785716474, "loss": 6.1805, "mean_token_accuracy": 0.16512720435857772, "num_tokens": 17822719.0, "step": 7040 }, { "entropy": 6.381142044067383, "epoch": 0.8130409694171956, "grad_norm": 0.8046875, "learning_rate": 0.0004944936090983757, "loss": 6.2109, "mean_token_accuracy": 0.16516452431678771, "num_tokens": 17834883.0, "step": 7045 }, { "entropy": 6.307264518737793, "epoch": 0.8136180034622043, "grad_norm": 0.7890625, "learning_rate": 0.0004944845322425455, "loss": 6.1272, "mean_token_accuracy": 0.1770351156592369, "num_tokens": 17847009.0, "step": 7050 }, { "entropy": 6.375383043289185, "epoch": 0.8141950375072129, "grad_norm": 0.8125, "learning_rate": 0.0004944754480044621, "loss": 6.152, "mean_token_accuracy": 0.1666557177901268, "num_tokens": 17859106.0, "step": 7055 }, { "entropy": 6.412518787384033, "epoch": 0.8147720715522215, "grad_norm": 0.8125, "learning_rate": 0.0004944663563844311, "loss": 6.1608, "mean_token_accuracy": 0.16627125889062883, "num_tokens": 17871418.0, "step": 7060 }, { "entropy": 6.2879682064056395, "epoch": 0.8153491055972303, "grad_norm": 0.75390625, "learning_rate": 0.0004944572573827581, "loss": 6.1249, "mean_token_accuracy": 0.17137539982795716, "num_tokens": 17884219.0, "step": 7065 }, { "entropy": 6.307466506958008, "epoch": 0.8159261396422389, "grad_norm": 0.8203125, "learning_rate": 0.0004944481509997494, "loss": 6.131, "mean_token_accuracy": 0.1689067393541336, "num_tokens": 17896206.0, "step": 7070 }, { "entropy": 6.3939979553222654, "epoch": 0.8165031736872476, "grad_norm": 0.77734375, "learning_rate": 0.000494439037235711, "loss": 6.2326, "mean_token_accuracy": 0.16438301056623458, "num_tokens": 17909488.0, "step": 7075 }, { "entropy": 6.375418043136596, "epoch": 0.8170802077322562, "grad_norm": 0.8359375, "learning_rate": 0.0004944299160909495, "loss": 6.1777, "mean_token_accuracy": 0.16011893153190612, "num_tokens": 17922851.0, "step": 7080 }, { "entropy": 6.360374975204468, "epoch": 0.8176572417772648, "grad_norm": 0.90625, "learning_rate": 0.000494420787565772, "loss": 6.0912, "mean_token_accuracy": 0.1776879087090492, "num_tokens": 17934586.0, "step": 7085 }, { "entropy": 6.310594892501831, "epoch": 0.8182342758222735, "grad_norm": 0.78125, "learning_rate": 0.0004944116516604852, "loss": 6.1938, "mean_token_accuracy": 0.16266183257102967, "num_tokens": 17947637.0, "step": 7090 }, { "entropy": 6.354241228103637, "epoch": 0.8188113098672821, "grad_norm": 0.859375, "learning_rate": 0.0004944025083753965, "loss": 6.1478, "mean_token_accuracy": 0.16983843892812728, "num_tokens": 17959601.0, "step": 7095 }, { "entropy": 6.352024364471435, "epoch": 0.8193883439122909, "grad_norm": 0.84765625, "learning_rate": 0.0004943933577108133, "loss": 6.1451, "mean_token_accuracy": 0.17091177701950072, "num_tokens": 17972568.0, "step": 7100 }, { "entropy": 6.36655969619751, "epoch": 0.8199653779572995, "grad_norm": 0.8984375, "learning_rate": 0.0004943841996670436, "loss": 6.1432, "mean_token_accuracy": 0.17002700716257096, "num_tokens": 17984665.0, "step": 7105 }, { "entropy": 6.368354558944702, "epoch": 0.8205424120023082, "grad_norm": 0.8046875, "learning_rate": 0.0004943750342443953, "loss": 6.1736, "mean_token_accuracy": 0.1608754187822342, "num_tokens": 17997140.0, "step": 7110 }, { "entropy": 6.355606889724731, "epoch": 0.8211194460473168, "grad_norm": 0.84765625, "learning_rate": 0.0004943658614431767, "loss": 6.1686, "mean_token_accuracy": 0.17113997787237167, "num_tokens": 18009361.0, "step": 7115 }, { "entropy": 6.314159536361695, "epoch": 0.8216964800923254, "grad_norm": 0.80078125, "learning_rate": 0.0004943566812636963, "loss": 6.1279, "mean_token_accuracy": 0.16654883027076722, "num_tokens": 18021233.0, "step": 7120 }, { "entropy": 6.274408292770386, "epoch": 0.8222735141373341, "grad_norm": 0.76953125, "learning_rate": 0.000494347493706263, "loss": 5.995, "mean_token_accuracy": 0.18178044259548187, "num_tokens": 18034086.0, "step": 7125 }, { "entropy": 6.336907291412354, "epoch": 0.8228505481823427, "grad_norm": 0.7578125, "learning_rate": 0.0004943382987711856, "loss": 6.0874, "mean_token_accuracy": 0.1737489327788353, "num_tokens": 18046604.0, "step": 7130 }, { "entropy": 6.3122608184814455, "epoch": 0.8234275822273515, "grad_norm": 0.8125, "learning_rate": 0.0004943290964587734, "loss": 6.1347, "mean_token_accuracy": 0.17065211534500122, "num_tokens": 18059185.0, "step": 7135 }, { "entropy": 6.315145111083984, "epoch": 0.8240046162723601, "grad_norm": 0.71875, "learning_rate": 0.0004943198867693361, "loss": 6.0646, "mean_token_accuracy": 0.16893559992313384, "num_tokens": 18071707.0, "step": 7140 }, { "entropy": 6.3502250671386715, "epoch": 0.8245816503173687, "grad_norm": 0.84765625, "learning_rate": 0.0004943106697031833, "loss": 6.2012, "mean_token_accuracy": 0.16397445499897004, "num_tokens": 18084657.0, "step": 7145 }, { "entropy": 6.363767099380493, "epoch": 0.8251586843623774, "grad_norm": 0.8515625, "learning_rate": 0.0004943014452606251, "loss": 6.1819, "mean_token_accuracy": 0.1693504735827446, "num_tokens": 18097084.0, "step": 7150 }, { "entropy": 6.316252565383911, "epoch": 0.825735718407386, "grad_norm": 0.8125, "learning_rate": 0.0004942922134419717, "loss": 6.1042, "mean_token_accuracy": 0.1739456221461296, "num_tokens": 18109306.0, "step": 7155 }, { "entropy": 6.270631885528564, "epoch": 0.8263127524523947, "grad_norm": 0.85546875, "learning_rate": 0.0004942829742475336, "loss": 6.0179, "mean_token_accuracy": 0.1746932238340378, "num_tokens": 18120300.0, "step": 7160 }, { "entropy": 6.370210361480713, "epoch": 0.8268897864974033, "grad_norm": 0.92578125, "learning_rate": 0.0004942737276776217, "loss": 6.1463, "mean_token_accuracy": 0.16830987781286239, "num_tokens": 18132251.0, "step": 7165 }, { "entropy": 6.304517507553101, "epoch": 0.827466820542412, "grad_norm": 0.796875, "learning_rate": 0.0004942644737325468, "loss": 6.0868, "mean_token_accuracy": 0.17027855664491653, "num_tokens": 18146198.0, "step": 7170 }, { "entropy": 6.336374759674072, "epoch": 0.8280438545874207, "grad_norm": 0.79296875, "learning_rate": 0.0004942552124126202, "loss": 6.1675, "mean_token_accuracy": 0.16987940073013305, "num_tokens": 18159493.0, "step": 7175 }, { "entropy": 6.277276945114136, "epoch": 0.8286208886324293, "grad_norm": 0.77734375, "learning_rate": 0.0004942459437181535, "loss": 6.0566, "mean_token_accuracy": 0.17661636918783188, "num_tokens": 18172120.0, "step": 7180 }, { "entropy": 6.330974435806274, "epoch": 0.829197922677438, "grad_norm": 0.8046875, "learning_rate": 0.0004942366676494584, "loss": 6.0871, "mean_token_accuracy": 0.17477403432130814, "num_tokens": 18184704.0, "step": 7185 }, { "entropy": 6.365555334091186, "epoch": 0.8297749567224466, "grad_norm": 0.88671875, "learning_rate": 0.0004942273842068469, "loss": 6.2001, "mean_token_accuracy": 0.16935209333896636, "num_tokens": 18196770.0, "step": 7190 }, { "entropy": 6.337525033950806, "epoch": 0.8303519907674553, "grad_norm": 0.8828125, "learning_rate": 0.0004942180933906311, "loss": 6.1627, "mean_token_accuracy": 0.1656957224011421, "num_tokens": 18209987.0, "step": 7195 }, { "entropy": 6.353645181655883, "epoch": 0.8309290248124639, "grad_norm": 0.765625, "learning_rate": 0.0004942087952011237, "loss": 6.1678, "mean_token_accuracy": 0.16775988191366195, "num_tokens": 18224864.0, "step": 7200 }, { "entropy": 6.3907112121582035, "epoch": 0.8315060588574726, "grad_norm": 0.8828125, "learning_rate": 0.0004941994896386374, "loss": 6.1344, "mean_token_accuracy": 0.17219291627407074, "num_tokens": 18237270.0, "step": 7205 }, { "entropy": 6.274297666549683, "epoch": 0.8320830929024813, "grad_norm": 0.80859375, "learning_rate": 0.0004941901767034851, "loss": 6.1408, "mean_token_accuracy": 0.16556089669466018, "num_tokens": 18251227.0, "step": 7210 }, { "entropy": 6.282907962799072, "epoch": 0.8326601269474899, "grad_norm": 0.80859375, "learning_rate": 0.0004941808563959802, "loss": 6.0705, "mean_token_accuracy": 0.17843919098377228, "num_tokens": 18264762.0, "step": 7215 }, { "entropy": 6.360298109054566, "epoch": 0.8332371609924986, "grad_norm": 0.86328125, "learning_rate": 0.0004941715287164359, "loss": 6.1437, "mean_token_accuracy": 0.16581116169691085, "num_tokens": 18276836.0, "step": 7220 }, { "entropy": 6.303939580917358, "epoch": 0.8338141950375072, "grad_norm": 0.83203125, "learning_rate": 0.0004941621936651661, "loss": 6.1484, "mean_token_accuracy": 0.1756073772907257, "num_tokens": 18290362.0, "step": 7225 }, { "entropy": 6.3812695980072025, "epoch": 0.8343912290825158, "grad_norm": 0.80078125, "learning_rate": 0.0004941528512424849, "loss": 6.1855, "mean_token_accuracy": 0.1699386864900589, "num_tokens": 18303924.0, "step": 7230 }, { "entropy": 6.256930303573609, "epoch": 0.8349682631275245, "grad_norm": 0.85546875, "learning_rate": 0.0004941435014487064, "loss": 6.0611, "mean_token_accuracy": 0.17561491429805756, "num_tokens": 18316490.0, "step": 7235 }, { "entropy": 6.353484201431274, "epoch": 0.8355452971725332, "grad_norm": 0.765625, "learning_rate": 0.000494134144284145, "loss": 6.1025, "mean_token_accuracy": 0.1660989746451378, "num_tokens": 18328819.0, "step": 7240 }, { "entropy": 6.304037189483642, "epoch": 0.8361223312175419, "grad_norm": 0.79296875, "learning_rate": 0.0004941247797491156, "loss": 6.0602, "mean_token_accuracy": 0.1737822934985161, "num_tokens": 18341872.0, "step": 7245 }, { "entropy": 6.340513896942139, "epoch": 0.8366993652625505, "grad_norm": 0.85546875, "learning_rate": 0.0004941154078439329, "loss": 6.1038, "mean_token_accuracy": 0.16772937178611755, "num_tokens": 18354644.0, "step": 7250 }, { "entropy": 6.343120098114014, "epoch": 0.8372763993075591, "grad_norm": 0.8203125, "learning_rate": 0.0004941060285689126, "loss": 6.1118, "mean_token_accuracy": 0.16333391666412353, "num_tokens": 18367581.0, "step": 7255 }, { "entropy": 6.312895965576172, "epoch": 0.8378534333525678, "grad_norm": 0.82421875, "learning_rate": 0.0004940966419243695, "loss": 6.1211, "mean_token_accuracy": 0.17633418142795562, "num_tokens": 18381123.0, "step": 7260 }, { "entropy": 6.286964797973633, "epoch": 0.8384304673975764, "grad_norm": 0.7734375, "learning_rate": 0.00049408724791062, "loss": 6.0478, "mean_token_accuracy": 0.17762214839458465, "num_tokens": 18395711.0, "step": 7265 }, { "entropy": 6.341670942306519, "epoch": 0.8390075014425851, "grad_norm": 0.79296875, "learning_rate": 0.0004940778465279797, "loss": 6.182, "mean_token_accuracy": 0.16106790006160737, "num_tokens": 18409434.0, "step": 7270 }, { "entropy": 6.362900352478027, "epoch": 0.8395845354875938, "grad_norm": 0.765625, "learning_rate": 0.0004940684377767647, "loss": 6.1384, "mean_token_accuracy": 0.16549608409404754, "num_tokens": 18423138.0, "step": 7275 }, { "entropy": 6.352203893661499, "epoch": 0.8401615695326025, "grad_norm": 0.84765625, "learning_rate": 0.0004940590216572916, "loss": 6.1294, "mean_token_accuracy": 0.1653735965490341, "num_tokens": 18435655.0, "step": 7280 }, { "entropy": 6.256585645675659, "epoch": 0.8407386035776111, "grad_norm": 0.7734375, "learning_rate": 0.0004940495981698772, "loss": 6.0172, "mean_token_accuracy": 0.1793304905295372, "num_tokens": 18448344.0, "step": 7285 }, { "entropy": 6.291251516342163, "epoch": 0.8413156376226197, "grad_norm": 0.87890625, "learning_rate": 0.0004940401673148384, "loss": 6.0295, "mean_token_accuracy": 0.1761486664414406, "num_tokens": 18460409.0, "step": 7290 }, { "entropy": 6.3027403354644775, "epoch": 0.8418926716676284, "grad_norm": 0.87890625, "learning_rate": 0.0004940307290924923, "loss": 6.1387, "mean_token_accuracy": 0.16713238060474395, "num_tokens": 18473650.0, "step": 7295 }, { "entropy": 6.2306482791900635, "epoch": 0.842469705712637, "grad_norm": 0.828125, "learning_rate": 0.0004940212835031565, "loss": 6.0544, "mean_token_accuracy": 0.17755862772464753, "num_tokens": 18487108.0, "step": 7300 }, { "entropy": 6.340290069580078, "epoch": 0.8430467397576457, "grad_norm": 1.3203125, "learning_rate": 0.0004940118305471486, "loss": 6.0866, "mean_token_accuracy": 0.17275313138961793, "num_tokens": 18500377.0, "step": 7305 }, { "entropy": 6.35522575378418, "epoch": 0.8436237738026544, "grad_norm": 0.80859375, "learning_rate": 0.0004940023702247866, "loss": 6.151, "mean_token_accuracy": 0.16355671882629394, "num_tokens": 18513257.0, "step": 7310 }, { "entropy": 6.301067304611206, "epoch": 0.844200807847663, "grad_norm": 0.84765625, "learning_rate": 0.0004939929025363886, "loss": 6.1754, "mean_token_accuracy": 0.16708555519580842, "num_tokens": 18525438.0, "step": 7315 }, { "entropy": 6.382996892929077, "epoch": 0.8447778418926717, "grad_norm": 0.82421875, "learning_rate": 0.0004939834274822731, "loss": 6.1996, "mean_token_accuracy": 0.16973353773355485, "num_tokens": 18537937.0, "step": 7320 }, { "entropy": 6.446295928955078, "epoch": 0.8453548759376803, "grad_norm": 0.80859375, "learning_rate": 0.0004939739450627588, "loss": 6.2119, "mean_token_accuracy": 0.1619974046945572, "num_tokens": 18551629.0, "step": 7325 }, { "entropy": 6.287714242935181, "epoch": 0.845931909982689, "grad_norm": 0.89453125, "learning_rate": 0.0004939644552781647, "loss": 6.1511, "mean_token_accuracy": 0.16715734750032424, "num_tokens": 18564549.0, "step": 7330 }, { "entropy": 6.365425777435303, "epoch": 0.8465089440276976, "grad_norm": 0.90234375, "learning_rate": 0.0004939549581288099, "loss": 6.1246, "mean_token_accuracy": 0.17667931765317918, "num_tokens": 18576536.0, "step": 7335 }, { "entropy": 6.259944009780884, "epoch": 0.8470859780727062, "grad_norm": 0.90625, "learning_rate": 0.0004939454536150138, "loss": 6.1022, "mean_token_accuracy": 0.1768004596233368, "num_tokens": 18588655.0, "step": 7340 }, { "entropy": 6.272363328933716, "epoch": 0.847663012117715, "grad_norm": 0.94921875, "learning_rate": 0.000493935941737096, "loss": 6.0528, "mean_token_accuracy": 0.18020471781492234, "num_tokens": 18602152.0, "step": 7345 }, { "entropy": 6.318509721755982, "epoch": 0.8482400461627236, "grad_norm": 0.83984375, "learning_rate": 0.0004939264224953768, "loss": 6.0656, "mean_token_accuracy": 0.17690059542655945, "num_tokens": 18615391.0, "step": 7350 }, { "entropy": 6.310171890258789, "epoch": 0.8488170802077323, "grad_norm": 0.86328125, "learning_rate": 0.000493916895890176, "loss": 6.1261, "mean_token_accuracy": 0.16611895263195037, "num_tokens": 18629987.0, "step": 7355 }, { "entropy": 6.41483244895935, "epoch": 0.8493941142527409, "grad_norm": 0.8046875, "learning_rate": 0.000493907361921814, "loss": 6.2245, "mean_token_accuracy": 0.16478994786739348, "num_tokens": 18643064.0, "step": 7360 }, { "entropy": 6.428786897659302, "epoch": 0.8499711482977496, "grad_norm": 0.890625, "learning_rate": 0.0004938978205906118, "loss": 6.1505, "mean_token_accuracy": 0.16683144271373748, "num_tokens": 18654950.0, "step": 7365 }, { "entropy": 6.333185768127441, "epoch": 0.8505481823427582, "grad_norm": 0.8515625, "learning_rate": 0.0004938882718968901, "loss": 6.1116, "mean_token_accuracy": 0.16756715178489684, "num_tokens": 18666318.0, "step": 7370 }, { "entropy": 6.29099555015564, "epoch": 0.8511252163877668, "grad_norm": 0.8515625, "learning_rate": 0.0004938787158409702, "loss": 6.0553, "mean_token_accuracy": 0.17675474882125855, "num_tokens": 18677357.0, "step": 7375 }, { "entropy": 6.326018810272217, "epoch": 0.8517022504327756, "grad_norm": 0.89453125, "learning_rate": 0.0004938691524231733, "loss": 6.089, "mean_token_accuracy": 0.17274203151464462, "num_tokens": 18689563.0, "step": 7380 }, { "entropy": 6.243793678283692, "epoch": 0.8522792844777842, "grad_norm": 0.89453125, "learning_rate": 0.0004938595816438212, "loss": 6.0914, "mean_token_accuracy": 0.17055510282516478, "num_tokens": 18701442.0, "step": 7385 }, { "entropy": 6.345879173278808, "epoch": 0.8528563185227929, "grad_norm": 0.8359375, "learning_rate": 0.0004938500035032358, "loss": 6.1358, "mean_token_accuracy": 0.16795708388090133, "num_tokens": 18714942.0, "step": 7390 }, { "entropy": 6.301207065582275, "epoch": 0.8534333525678015, "grad_norm": 1.265625, "learning_rate": 0.0004938404180017392, "loss": 6.1479, "mean_token_accuracy": 0.17592194825410842, "num_tokens": 18727752.0, "step": 7395 }, { "entropy": 6.375054931640625, "epoch": 0.8540103866128101, "grad_norm": 0.91796875, "learning_rate": 0.0004938308251396539, "loss": 6.1466, "mean_token_accuracy": 0.1679084911942482, "num_tokens": 18741719.0, "step": 7400 }, { "entropy": 6.36941819190979, "epoch": 0.8545874206578188, "grad_norm": 0.875, "learning_rate": 0.0004938212249173024, "loss": 6.1028, "mean_token_accuracy": 0.16361988335847855, "num_tokens": 18754472.0, "step": 7405 }, { "entropy": 6.340943050384522, "epoch": 0.8551644547028274, "grad_norm": 0.82421875, "learning_rate": 0.0004938116173350078, "loss": 6.1826, "mean_token_accuracy": 0.17019001990556717, "num_tokens": 18766691.0, "step": 7410 }, { "entropy": 6.338998222351075, "epoch": 0.8557414887478362, "grad_norm": 0.84375, "learning_rate": 0.0004938020023930932, "loss": 6.1005, "mean_token_accuracy": 0.17442042529582977, "num_tokens": 18780083.0, "step": 7415 }, { "entropy": 6.400058031082153, "epoch": 0.8563185227928448, "grad_norm": 0.7578125, "learning_rate": 0.0004937923800918817, "loss": 6.1818, "mean_token_accuracy": 0.16902839243412018, "num_tokens": 18792559.0, "step": 7420 }, { "entropy": 6.251423120498657, "epoch": 0.8568955568378535, "grad_norm": 0.78125, "learning_rate": 0.0004937827504316974, "loss": 6.0284, "mean_token_accuracy": 0.18225133568048477, "num_tokens": 18805089.0, "step": 7425 }, { "entropy": 6.211493444442749, "epoch": 0.8574725908828621, "grad_norm": 0.8203125, "learning_rate": 0.0004937731134128639, "loss": 6.0332, "mean_token_accuracy": 0.1719786286354065, "num_tokens": 18818476.0, "step": 7430 }, { "entropy": 6.3511707305908205, "epoch": 0.8580496249278707, "grad_norm": 0.83984375, "learning_rate": 0.0004937634690357054, "loss": 6.2004, "mean_token_accuracy": 0.16616718769073485, "num_tokens": 18830785.0, "step": 7435 }, { "entropy": 6.408740901947022, "epoch": 0.8586266589728794, "grad_norm": 0.89453125, "learning_rate": 0.0004937538173005462, "loss": 6.1835, "mean_token_accuracy": 0.16461452692747117, "num_tokens": 18844029.0, "step": 7440 }, { "entropy": 6.291387891769409, "epoch": 0.859203693017888, "grad_norm": 0.88671875, "learning_rate": 0.0004937441582077111, "loss": 6.1483, "mean_token_accuracy": 0.17121766805648803, "num_tokens": 18857468.0, "step": 7445 }, { "entropy": 6.330543279647827, "epoch": 0.8597807270628968, "grad_norm": 0.75, "learning_rate": 0.0004937344917575249, "loss": 6.0788, "mean_token_accuracy": 0.16908426731824874, "num_tokens": 18870487.0, "step": 7450 }, { "entropy": 6.330011510848999, "epoch": 0.8603577611079054, "grad_norm": 0.80078125, "learning_rate": 0.0004937248179503127, "loss": 6.1243, "mean_token_accuracy": 0.16731321513652803, "num_tokens": 18883273.0, "step": 7455 }, { "entropy": 6.275924921035767, "epoch": 0.860934795152914, "grad_norm": 0.86328125, "learning_rate": 0.0004937151367863998, "loss": 6.1026, "mean_token_accuracy": 0.1796159490942955, "num_tokens": 18895863.0, "step": 7460 }, { "entropy": 6.320479679107666, "epoch": 0.8615118291979227, "grad_norm": 0.8046875, "learning_rate": 0.000493705448266112, "loss": 6.1605, "mean_token_accuracy": 0.17161056995391846, "num_tokens": 18909406.0, "step": 7465 }, { "entropy": 6.242699718475341, "epoch": 0.8620888632429313, "grad_norm": 0.8046875, "learning_rate": 0.0004936957523897752, "loss": 6.0972, "mean_token_accuracy": 0.17375921010971068, "num_tokens": 18922794.0, "step": 7470 }, { "entropy": 6.2935127258300785, "epoch": 0.86266589728794, "grad_norm": 0.84765625, "learning_rate": 0.0004936860491577153, "loss": 6.1127, "mean_token_accuracy": 0.17393147498369216, "num_tokens": 18936511.0, "step": 7475 }, { "entropy": 6.371639537811279, "epoch": 0.8632429313329486, "grad_norm": 0.8671875, "learning_rate": 0.0004936763385702588, "loss": 6.1866, "mean_token_accuracy": 0.16243817955255507, "num_tokens": 18948164.0, "step": 7480 }, { "entropy": 6.3689943790435795, "epoch": 0.8638199653779572, "grad_norm": 0.7734375, "learning_rate": 0.0004936666206277322, "loss": 6.1756, "mean_token_accuracy": 0.16454965472221375, "num_tokens": 18960608.0, "step": 7485 }, { "entropy": 6.296132802963257, "epoch": 0.864396999422966, "grad_norm": 0.796875, "learning_rate": 0.0004936568953304624, "loss": 6.031, "mean_token_accuracy": 0.18456006944179534, "num_tokens": 18972266.0, "step": 7490 }, { "entropy": 6.284459924697876, "epoch": 0.8649740334679746, "grad_norm": 0.8125, "learning_rate": 0.0004936471626787766, "loss": 6.0742, "mean_token_accuracy": 0.17050421088933945, "num_tokens": 18984518.0, "step": 7495 }, { "entropy": 6.2937500953674315, "epoch": 0.8655510675129833, "grad_norm": 0.84375, "learning_rate": 0.0004936374226730022, "loss": 6.1031, "mean_token_accuracy": 0.17538830041885375, "num_tokens": 18998611.0, "step": 7500 }, { "entropy": 6.312690019607544, "epoch": 0.8661281015579919, "grad_norm": 0.86328125, "learning_rate": 0.0004936276753134666, "loss": 6.0866, "mean_token_accuracy": 0.17135524600744248, "num_tokens": 19012117.0, "step": 7505 }, { "entropy": 6.209308815002442, "epoch": 0.8667051356030006, "grad_norm": 0.765625, "learning_rate": 0.0004936179206004976, "loss": 6.003, "mean_token_accuracy": 0.1783718004822731, "num_tokens": 19024075.0, "step": 7510 }, { "entropy": 6.337769603729248, "epoch": 0.8672821696480092, "grad_norm": 0.80078125, "learning_rate": 0.0004936081585344236, "loss": 6.1795, "mean_token_accuracy": 0.16607438176870346, "num_tokens": 19037350.0, "step": 7515 }, { "entropy": 6.41182656288147, "epoch": 0.8678592036930178, "grad_norm": 0.84375, "learning_rate": 0.0004935983891155727, "loss": 6.1854, "mean_token_accuracy": 0.1657259300351143, "num_tokens": 19049438.0, "step": 7520 }, { "entropy": 6.26032190322876, "epoch": 0.8684362377380266, "grad_norm": 0.7890625, "learning_rate": 0.0004935886123442737, "loss": 6.139, "mean_token_accuracy": 0.1676519051194191, "num_tokens": 19061689.0, "step": 7525 }, { "entropy": 6.391968154907227, "epoch": 0.8690132717830352, "grad_norm": 0.94921875, "learning_rate": 0.0004935788282208551, "loss": 6.1892, "mean_token_accuracy": 0.1616821691393852, "num_tokens": 19075606.0, "step": 7530 }, { "entropy": 6.353225660324097, "epoch": 0.8695903058280439, "grad_norm": 0.83984375, "learning_rate": 0.0004935690367456464, "loss": 6.1027, "mean_token_accuracy": 0.17230516970157622, "num_tokens": 19088248.0, "step": 7535 }, { "entropy": 6.297004318237304, "epoch": 0.8701673398730525, "grad_norm": 0.80859375, "learning_rate": 0.0004935592379189766, "loss": 6.0805, "mean_token_accuracy": 0.17194265127182007, "num_tokens": 19102480.0, "step": 7540 }, { "entropy": 6.260242652893067, "epoch": 0.8707443739180611, "grad_norm": 0.859375, "learning_rate": 0.0004935494317411754, "loss": 6.0698, "mean_token_accuracy": 0.18137836903333665, "num_tokens": 19114454.0, "step": 7545 }, { "entropy": 6.308724689483642, "epoch": 0.8713214079630698, "grad_norm": 0.8359375, "learning_rate": 0.0004935396182125726, "loss": 6.1046, "mean_token_accuracy": 0.17647117376327515, "num_tokens": 19126709.0, "step": 7550 }, { "entropy": 6.270776891708374, "epoch": 0.8718984420080784, "grad_norm": 0.87109375, "learning_rate": 0.0004935297973334983, "loss": 6.1159, "mean_token_accuracy": 0.17235394865274428, "num_tokens": 19138831.0, "step": 7555 }, { "entropy": 6.326720905303955, "epoch": 0.8724754760530872, "grad_norm": 0.7890625, "learning_rate": 0.0004935199691042828, "loss": 5.9959, "mean_token_accuracy": 0.1755734920501709, "num_tokens": 19151555.0, "step": 7560 }, { "entropy": 6.307219934463501, "epoch": 0.8730525100980958, "grad_norm": 0.828125, "learning_rate": 0.0004935101335252568, "loss": 6.0574, "mean_token_accuracy": 0.17710819989442825, "num_tokens": 19164557.0, "step": 7565 }, { "entropy": 6.3488623142242435, "epoch": 0.8736295441431045, "grad_norm": 0.8515625, "learning_rate": 0.0004935002905967509, "loss": 6.1943, "mean_token_accuracy": 0.1654577985405922, "num_tokens": 19177081.0, "step": 7570 }, { "entropy": 6.294558429718018, "epoch": 0.8742065781881131, "grad_norm": 0.8046875, "learning_rate": 0.0004934904403190963, "loss": 6.0486, "mean_token_accuracy": 0.17522133886814117, "num_tokens": 19190209.0, "step": 7575 }, { "entropy": 6.328292036056519, "epoch": 0.8747836122331217, "grad_norm": 0.8359375, "learning_rate": 0.0004934805826926242, "loss": 6.097, "mean_token_accuracy": 0.1691294565796852, "num_tokens": 19202262.0, "step": 7580 }, { "entropy": 6.295896530151367, "epoch": 0.8753606462781304, "grad_norm": 0.96875, "learning_rate": 0.0004934707177176663, "loss": 6.1196, "mean_token_accuracy": 0.17082754224538804, "num_tokens": 19214752.0, "step": 7585 }, { "entropy": 6.347747945785523, "epoch": 0.875937680323139, "grad_norm": 0.81640625, "learning_rate": 0.0004934608453945543, "loss": 6.1597, "mean_token_accuracy": 0.16672886908054352, "num_tokens": 19227320.0, "step": 7590 }, { "entropy": 6.350468921661377, "epoch": 0.8765147143681478, "grad_norm": 0.78515625, "learning_rate": 0.0004934509657236203, "loss": 6.1475, "mean_token_accuracy": 0.16858987361192704, "num_tokens": 19239571.0, "step": 7595 }, { "entropy": 6.335233497619629, "epoch": 0.8770917484131564, "grad_norm": 0.77734375, "learning_rate": 0.0004934410787051965, "loss": 6.0903, "mean_token_accuracy": 0.1747870922088623, "num_tokens": 19252242.0, "step": 7600 }, { "entropy": 6.353438425064087, "epoch": 0.877668782458165, "grad_norm": 0.84765625, "learning_rate": 0.0004934311843396157, "loss": 6.1536, "mean_token_accuracy": 0.16885416358709335, "num_tokens": 19265501.0, "step": 7605 }, { "entropy": 6.254431247711182, "epoch": 0.8782458165031737, "grad_norm": 0.80859375, "learning_rate": 0.0004934212826272104, "loss": 6.0048, "mean_token_accuracy": 0.18254768401384353, "num_tokens": 19278152.0, "step": 7610 }, { "entropy": 6.249722099304199, "epoch": 0.8788228505481823, "grad_norm": 0.90234375, "learning_rate": 0.0004934113735683137, "loss": 6.1195, "mean_token_accuracy": 0.1660146526992321, "num_tokens": 19290555.0, "step": 7615 }, { "entropy": 6.320179605484009, "epoch": 0.879399884593191, "grad_norm": 0.796875, "learning_rate": 0.000493401457163259, "loss": 6.0742, "mean_token_accuracy": 0.17674531638622284, "num_tokens": 19302866.0, "step": 7620 }, { "entropy": 6.364961194992065, "epoch": 0.8799769186381996, "grad_norm": 0.9453125, "learning_rate": 0.0004933915334123798, "loss": 6.1585, "mean_token_accuracy": 0.16327778846025467, "num_tokens": 19315577.0, "step": 7625 }, { "entropy": 6.353976726531982, "epoch": 0.8805539526832084, "grad_norm": 0.89453125, "learning_rate": 0.0004933816023160099, "loss": 6.1489, "mean_token_accuracy": 0.16975017488002778, "num_tokens": 19328593.0, "step": 7630 }, { "entropy": 6.3438011646270756, "epoch": 0.881130986728217, "grad_norm": 0.921875, "learning_rate": 0.0004933716638744832, "loss": 6.1096, "mean_token_accuracy": 0.17835207879543305, "num_tokens": 19341669.0, "step": 7635 }, { "entropy": 6.283733320236206, "epoch": 0.8817080207732256, "grad_norm": 0.828125, "learning_rate": 0.000493361718088134, "loss": 6.0937, "mean_token_accuracy": 0.17275342345237732, "num_tokens": 19354268.0, "step": 7640 }, { "entropy": 6.345350837707519, "epoch": 0.8822850548182343, "grad_norm": 0.77734375, "learning_rate": 0.000493351764957297, "loss": 6.1448, "mean_token_accuracy": 0.16772449910640716, "num_tokens": 19367676.0, "step": 7645 }, { "entropy": 6.375120687484741, "epoch": 0.8828620888632429, "grad_norm": 0.80078125, "learning_rate": 0.0004933418044823068, "loss": 6.0982, "mean_token_accuracy": 0.17239805161952973, "num_tokens": 19380726.0, "step": 7650 }, { "entropy": 6.311630487442017, "epoch": 0.8834391229082516, "grad_norm": 0.96875, "learning_rate": 0.0004933318366634984, "loss": 6.1146, "mean_token_accuracy": 0.16780938059091569, "num_tokens": 19392917.0, "step": 7655 }, { "entropy": 6.36509075164795, "epoch": 0.8840161569532602, "grad_norm": 0.8046875, "learning_rate": 0.0004933218615012072, "loss": 6.1418, "mean_token_accuracy": 0.17104663252830504, "num_tokens": 19406026.0, "step": 7660 }, { "entropy": 6.322006559371948, "epoch": 0.8845931909982689, "grad_norm": 0.8515625, "learning_rate": 0.0004933118789957687, "loss": 6.1075, "mean_token_accuracy": 0.17266625314950942, "num_tokens": 19418612.0, "step": 7665 }, { "entropy": 6.3031665802001955, "epoch": 0.8851702250432776, "grad_norm": 0.85546875, "learning_rate": 0.0004933018891475186, "loss": 6.1445, "mean_token_accuracy": 0.16820344775915147, "num_tokens": 19430746.0, "step": 7670 }, { "entropy": 6.3470458984375, "epoch": 0.8857472590882862, "grad_norm": 0.875, "learning_rate": 0.0004932918919567927, "loss": 6.1882, "mean_token_accuracy": 0.16353080421686172, "num_tokens": 19443043.0, "step": 7675 }, { "entropy": 6.37825984954834, "epoch": 0.8863242931332949, "grad_norm": 0.7421875, "learning_rate": 0.0004932818874239275, "loss": 6.1202, "mean_token_accuracy": 0.1737432137131691, "num_tokens": 19456463.0, "step": 7680 }, { "entropy": 6.364214897155762, "epoch": 0.8869013271783035, "grad_norm": 0.8203125, "learning_rate": 0.0004932718755492595, "loss": 6.1201, "mean_token_accuracy": 0.1649479940533638, "num_tokens": 19468108.0, "step": 7685 }, { "entropy": 6.3020881652832035, "epoch": 0.8874783612233121, "grad_norm": 0.83203125, "learning_rate": 0.0004932618563331254, "loss": 6.1433, "mean_token_accuracy": 0.16941626369953156, "num_tokens": 19480741.0, "step": 7690 }, { "entropy": 6.326077938079834, "epoch": 0.8880553952683208, "grad_norm": 0.83984375, "learning_rate": 0.0004932518297758622, "loss": 6.076, "mean_token_accuracy": 0.17261420786380768, "num_tokens": 19492996.0, "step": 7695 }, { "entropy": 6.355397272109985, "epoch": 0.8886324293133295, "grad_norm": 0.796875, "learning_rate": 0.0004932417958778071, "loss": 6.0986, "mean_token_accuracy": 0.17076902687549592, "num_tokens": 19505513.0, "step": 7700 }, { "entropy": 6.336492681503296, "epoch": 0.8892094633583382, "grad_norm": 0.80078125, "learning_rate": 0.0004932317546392976, "loss": 6.21, "mean_token_accuracy": 0.16580649316310883, "num_tokens": 19518244.0, "step": 7705 }, { "entropy": 6.319612598419189, "epoch": 0.8897864974033468, "grad_norm": 0.8359375, "learning_rate": 0.0004932217060606714, "loss": 6.1084, "mean_token_accuracy": 0.17041295915842056, "num_tokens": 19530987.0, "step": 7710 }, { "entropy": 6.298898792266845, "epoch": 0.8903635314483554, "grad_norm": 0.7578125, "learning_rate": 0.0004932116501422665, "loss": 6.0194, "mean_token_accuracy": 0.17620886564254762, "num_tokens": 19543546.0, "step": 7715 }, { "entropy": 6.3706581592559814, "epoch": 0.8909405654933641, "grad_norm": 0.87109375, "learning_rate": 0.0004932015868844211, "loss": 6.1005, "mean_token_accuracy": 0.16944789588451387, "num_tokens": 19556867.0, "step": 7720 }, { "entropy": 6.28508243560791, "epoch": 0.8915175995383727, "grad_norm": 0.85546875, "learning_rate": 0.0004931915162874738, "loss": 6.0956, "mean_token_accuracy": 0.1710782304406166, "num_tokens": 19569738.0, "step": 7725 }, { "entropy": 6.323682594299316, "epoch": 0.8920946335833814, "grad_norm": 0.81640625, "learning_rate": 0.0004931814383517632, "loss": 6.1219, "mean_token_accuracy": 0.1682348594069481, "num_tokens": 19581701.0, "step": 7730 }, { "entropy": 6.300376987457275, "epoch": 0.8926716676283901, "grad_norm": 0.859375, "learning_rate": 0.0004931713530776284, "loss": 6.0451, "mean_token_accuracy": 0.1782558888196945, "num_tokens": 19593698.0, "step": 7735 }, { "entropy": 6.293739461898804, "epoch": 0.8932487016733988, "grad_norm": 0.8515625, "learning_rate": 0.0004931612604654083, "loss": 6.111, "mean_token_accuracy": 0.17010954022407532, "num_tokens": 19605323.0, "step": 7740 }, { "entropy": 6.367745971679687, "epoch": 0.8938257357184074, "grad_norm": 0.8828125, "learning_rate": 0.0004931511605154428, "loss": 6.149, "mean_token_accuracy": 0.16876049041748048, "num_tokens": 19616577.0, "step": 7745 }, { "entropy": 6.328808069229126, "epoch": 0.894402769763416, "grad_norm": 0.9296875, "learning_rate": 0.0004931410532280711, "loss": 6.0588, "mean_token_accuracy": 0.17267925143241883, "num_tokens": 19629177.0, "step": 7750 }, { "entropy": 6.28749303817749, "epoch": 0.8949798038084247, "grad_norm": 0.90625, "learning_rate": 0.0004931309386036337, "loss": 6.0895, "mean_token_accuracy": 0.16957223564386367, "num_tokens": 19642170.0, "step": 7755 }, { "entropy": 6.2514848709106445, "epoch": 0.8955568378534333, "grad_norm": 0.8203125, "learning_rate": 0.0004931208166424704, "loss": 6.0435, "mean_token_accuracy": 0.17608153969049453, "num_tokens": 19655648.0, "step": 7760 }, { "entropy": 6.278182458877564, "epoch": 0.896133871898442, "grad_norm": 0.75, "learning_rate": 0.0004931106873449219, "loss": 6.0284, "mean_token_accuracy": 0.17348928600549698, "num_tokens": 19667941.0, "step": 7765 }, { "entropy": 6.33781328201294, "epoch": 0.8967109059434507, "grad_norm": 0.8125, "learning_rate": 0.0004931005507113285, "loss": 6.1276, "mean_token_accuracy": 0.17680104076862335, "num_tokens": 19680523.0, "step": 7770 }, { "entropy": 6.186305379867553, "epoch": 0.8972879399884593, "grad_norm": 0.8046875, "learning_rate": 0.0004930904067420317, "loss": 6.0853, "mean_token_accuracy": 0.17290082722902297, "num_tokens": 19692984.0, "step": 7775 }, { "entropy": 6.357298135757446, "epoch": 0.897864974033468, "grad_norm": 0.890625, "learning_rate": 0.0004930802554373723, "loss": 6.0333, "mean_token_accuracy": 0.17422391027212142, "num_tokens": 19705926.0, "step": 7780 }, { "entropy": 6.330864429473877, "epoch": 0.8984420080784766, "grad_norm": 0.91015625, "learning_rate": 0.0004930700967976918, "loss": 6.1001, "mean_token_accuracy": 0.17609639912843705, "num_tokens": 19717322.0, "step": 7785 }, { "entropy": 6.271629285812378, "epoch": 0.8990190421234853, "grad_norm": 0.80078125, "learning_rate": 0.000493059930823332, "loss": 6.1051, "mean_token_accuracy": 0.1606309935450554, "num_tokens": 19730577.0, "step": 7790 }, { "entropy": 6.341148757934571, "epoch": 0.8995960761684939, "grad_norm": 0.84375, "learning_rate": 0.0004930497575146346, "loss": 6.1059, "mean_token_accuracy": 0.17063196897506713, "num_tokens": 19744054.0, "step": 7795 }, { "entropy": 6.293493986129761, "epoch": 0.9001731102135025, "grad_norm": 0.83203125, "learning_rate": 0.0004930395768719421, "loss": 6.1121, "mean_token_accuracy": 0.16904201358556747, "num_tokens": 19755898.0, "step": 7800 }, { "entropy": 6.325391483306885, "epoch": 0.9007501442585113, "grad_norm": 0.7421875, "learning_rate": 0.0004930293888955966, "loss": 6.1668, "mean_token_accuracy": 0.1650414600968361, "num_tokens": 19769599.0, "step": 7805 }, { "entropy": 6.402347612380981, "epoch": 0.9013271783035199, "grad_norm": 0.84375, "learning_rate": 0.000493019193585941, "loss": 6.1494, "mean_token_accuracy": 0.16273540258407593, "num_tokens": 19783442.0, "step": 7810 }, { "entropy": 6.3388293266296385, "epoch": 0.9019042123485286, "grad_norm": 0.87890625, "learning_rate": 0.000493008990943318, "loss": 6.1781, "mean_token_accuracy": 0.16862280368804933, "num_tokens": 19796039.0, "step": 7815 }, { "entropy": 6.331880807876587, "epoch": 0.9024812463935372, "grad_norm": 0.8515625, "learning_rate": 0.0004929987809680709, "loss": 6.1204, "mean_token_accuracy": 0.17673451751470565, "num_tokens": 19808695.0, "step": 7820 }, { "entropy": 6.3146881580352785, "epoch": 0.9030582804385459, "grad_norm": 0.85546875, "learning_rate": 0.0004929885636605432, "loss": 6.0867, "mean_token_accuracy": 0.17208350598812103, "num_tokens": 19821173.0, "step": 7825 }, { "entropy": 6.29907455444336, "epoch": 0.9036353144835545, "grad_norm": 0.80078125, "learning_rate": 0.0004929783390210784, "loss": 6.1543, "mean_token_accuracy": 0.1662888213992119, "num_tokens": 19833804.0, "step": 7830 }, { "entropy": 6.392211389541626, "epoch": 0.9042123485285631, "grad_norm": 0.83984375, "learning_rate": 0.0004929681070500204, "loss": 6.093, "mean_token_accuracy": 0.16855536997318268, "num_tokens": 19845690.0, "step": 7835 }, { "entropy": 6.29790940284729, "epoch": 0.9047893825735719, "grad_norm": 0.765625, "learning_rate": 0.0004929578677477135, "loss": 6.1018, "mean_token_accuracy": 0.16329824179410934, "num_tokens": 19859463.0, "step": 7840 }, { "entropy": 6.232066822052002, "epoch": 0.9053664166185805, "grad_norm": 0.83984375, "learning_rate": 0.0004929476211145019, "loss": 5.9956, "mean_token_accuracy": 0.1839672550559044, "num_tokens": 19872168.0, "step": 7845 }, { "entropy": 6.315573358535767, "epoch": 0.9059434506635892, "grad_norm": 0.84765625, "learning_rate": 0.0004929373671507303, "loss": 6.077, "mean_token_accuracy": 0.1776381567120552, "num_tokens": 19884927.0, "step": 7850 }, { "entropy": 6.283964967727661, "epoch": 0.9065204847085978, "grad_norm": 0.8984375, "learning_rate": 0.0004929271058567436, "loss": 6.0684, "mean_token_accuracy": 0.17240298688411712, "num_tokens": 19897105.0, "step": 7855 }, { "entropy": 6.282452011108399, "epoch": 0.9070975187536064, "grad_norm": 0.77734375, "learning_rate": 0.000492916837232887, "loss": 6.0928, "mean_token_accuracy": 0.1691648006439209, "num_tokens": 19909973.0, "step": 7860 }, { "entropy": 6.319969892501831, "epoch": 0.9076745527986151, "grad_norm": 0.87109375, "learning_rate": 0.0004929065612795058, "loss": 6.0996, "mean_token_accuracy": 0.1771798312664032, "num_tokens": 19923674.0, "step": 7865 }, { "entropy": 6.378555679321289, "epoch": 0.9082515868436237, "grad_norm": 0.921875, "learning_rate": 0.0004928962779969456, "loss": 6.1113, "mean_token_accuracy": 0.16915464848279954, "num_tokens": 19935742.0, "step": 7870 }, { "entropy": 6.290113019943237, "epoch": 0.9088286208886325, "grad_norm": 0.82421875, "learning_rate": 0.0004928859873855524, "loss": 6.0995, "mean_token_accuracy": 0.16852633357048036, "num_tokens": 19947945.0, "step": 7875 }, { "entropy": 6.3777001857757565, "epoch": 0.9094056549336411, "grad_norm": 0.82421875, "learning_rate": 0.0004928756894456723, "loss": 6.0505, "mean_token_accuracy": 0.1752867430448532, "num_tokens": 19961275.0, "step": 7880 }, { "entropy": 6.3458672046661375, "epoch": 0.9099826889786498, "grad_norm": 0.87109375, "learning_rate": 0.0004928653841776515, "loss": 6.1244, "mean_token_accuracy": 0.16841503977775574, "num_tokens": 19973634.0, "step": 7885 }, { "entropy": 6.317721605300903, "epoch": 0.9105597230236584, "grad_norm": 0.7734375, "learning_rate": 0.0004928550715818368, "loss": 6.1288, "mean_token_accuracy": 0.17065613716840744, "num_tokens": 19985920.0, "step": 7890 }, { "entropy": 6.338268184661866, "epoch": 0.911136757068667, "grad_norm": 0.87109375, "learning_rate": 0.0004928447516585749, "loss": 6.1363, "mean_token_accuracy": 0.16494126617908478, "num_tokens": 19999081.0, "step": 7895 }, { "entropy": 6.207415676116943, "epoch": 0.9117137911136757, "grad_norm": 0.82421875, "learning_rate": 0.000492834424408213, "loss": 6.0687, "mean_token_accuracy": 0.1764218255877495, "num_tokens": 20012801.0, "step": 7900 }, { "entropy": 6.397945928573608, "epoch": 0.9122908251586843, "grad_norm": 0.7734375, "learning_rate": 0.0004928240898310984, "loss": 6.1504, "mean_token_accuracy": 0.16762229204177856, "num_tokens": 20024618.0, "step": 7905 }, { "entropy": 6.352006244659424, "epoch": 0.9128678592036931, "grad_norm": 0.81640625, "learning_rate": 0.0004928137479275789, "loss": 6.1202, "mean_token_accuracy": 0.1704690560698509, "num_tokens": 20038587.0, "step": 7910 }, { "entropy": 6.303599882125854, "epoch": 0.9134448932487017, "grad_norm": 0.828125, "learning_rate": 0.000492803398698002, "loss": 6.1108, "mean_token_accuracy": 0.16644177809357644, "num_tokens": 20051811.0, "step": 7915 }, { "entropy": 6.360376930236816, "epoch": 0.9140219272937103, "grad_norm": 0.81640625, "learning_rate": 0.0004927930421427161, "loss": 6.1152, "mean_token_accuracy": 0.16769687086343765, "num_tokens": 20064463.0, "step": 7920 }, { "entropy": 6.255197620391845, "epoch": 0.914598961338719, "grad_norm": 0.87109375, "learning_rate": 0.0004927826782620694, "loss": 6.1075, "mean_token_accuracy": 0.16811060458421706, "num_tokens": 20076614.0, "step": 7925 }, { "entropy": 6.415706443786621, "epoch": 0.9151759953837276, "grad_norm": 1.0, "learning_rate": 0.0004927723070564104, "loss": 6.1995, "mean_token_accuracy": 0.16223038583993912, "num_tokens": 20090395.0, "step": 7930 }, { "entropy": 6.371805334091187, "epoch": 0.9157530294287363, "grad_norm": 0.84765625, "learning_rate": 0.0004927619285260881, "loss": 6.1335, "mean_token_accuracy": 0.16719916462898254, "num_tokens": 20102736.0, "step": 7935 }, { "entropy": 6.344775104522705, "epoch": 0.9163300634737449, "grad_norm": 0.89453125, "learning_rate": 0.0004927515426714515, "loss": 6.1302, "mean_token_accuracy": 0.1690652996301651, "num_tokens": 20116516.0, "step": 7940 }, { "entropy": 6.320330667495727, "epoch": 0.9169070975187537, "grad_norm": 0.8203125, "learning_rate": 0.00049274114949285, "loss": 6.1174, "mean_token_accuracy": 0.17018368244171142, "num_tokens": 20128742.0, "step": 7945 }, { "entropy": 6.328971815109253, "epoch": 0.9174841315637623, "grad_norm": 0.828125, "learning_rate": 0.000492730748990633, "loss": 6.078, "mean_token_accuracy": 0.16928218305110931, "num_tokens": 20140590.0, "step": 7950 }, { "entropy": 6.284335279464722, "epoch": 0.9180611656087709, "grad_norm": 0.78125, "learning_rate": 0.0004927203411651504, "loss": 6.0797, "mean_token_accuracy": 0.16228621900081636, "num_tokens": 20153748.0, "step": 7955 }, { "entropy": 6.353853940963745, "epoch": 0.9186381996537796, "grad_norm": 0.80078125, "learning_rate": 0.0004927099260167523, "loss": 6.0904, "mean_token_accuracy": 0.1736527130007744, "num_tokens": 20167094.0, "step": 7960 }, { "entropy": 6.308283567428589, "epoch": 0.9192152336987882, "grad_norm": 0.828125, "learning_rate": 0.0004926995035457889, "loss": 6.0619, "mean_token_accuracy": 0.16892513036727905, "num_tokens": 20180716.0, "step": 7965 }, { "entropy": 6.339779663085937, "epoch": 0.9197922677437969, "grad_norm": 0.87890625, "learning_rate": 0.000492689073752611, "loss": 6.1033, "mean_token_accuracy": 0.17131576538085938, "num_tokens": 20192214.0, "step": 7970 }, { "entropy": 6.226183223724365, "epoch": 0.9203693017888055, "grad_norm": 0.96484375, "learning_rate": 0.0004926786366375691, "loss": 5.991, "mean_token_accuracy": 0.17104701697826385, "num_tokens": 20204789.0, "step": 7975 }, { "entropy": 6.316816425323486, "epoch": 0.9209463358338142, "grad_norm": 0.8671875, "learning_rate": 0.0004926681922010145, "loss": 6.095, "mean_token_accuracy": 0.16920481026172637, "num_tokens": 20217318.0, "step": 7980 }, { "entropy": 6.4085766792297365, "epoch": 0.9215233698788229, "grad_norm": 0.859375, "learning_rate": 0.0004926577404432982, "loss": 6.0992, "mean_token_accuracy": 0.16753261983394624, "num_tokens": 20229757.0, "step": 7985 }, { "entropy": 6.276189374923706, "epoch": 0.9221004039238315, "grad_norm": 0.78125, "learning_rate": 0.0004926472813647721, "loss": 6.1228, "mean_token_accuracy": 0.1687633216381073, "num_tokens": 20242042.0, "step": 7990 }, { "entropy": 6.2141529560089115, "epoch": 0.9226774379688402, "grad_norm": 0.81640625, "learning_rate": 0.0004926368149657876, "loss": 6.0106, "mean_token_accuracy": 0.18093141317367553, "num_tokens": 20255188.0, "step": 7995 }, { "entropy": 6.415900802612304, "epoch": 0.9232544720138488, "grad_norm": 0.921875, "learning_rate": 0.0004926263412466972, "loss": 6.0902, "mean_token_accuracy": 0.17318245768547058, "num_tokens": 20267359.0, "step": 8000 }, { "entropy": 6.35699143409729, "epoch": 0.9238315060588574, "grad_norm": 0.79296875, "learning_rate": 0.0004926158602078527, "loss": 6.1837, "mean_token_accuracy": 0.16548164188861847, "num_tokens": 20280023.0, "step": 8005 }, { "entropy": 6.307455205917359, "epoch": 0.9244085401038661, "grad_norm": 0.8203125, "learning_rate": 0.0004926053718496069, "loss": 6.0779, "mean_token_accuracy": 0.17290998697280885, "num_tokens": 20293043.0, "step": 8010 }, { "entropy": 6.2883072853088375, "epoch": 0.9249855741488748, "grad_norm": 0.79296875, "learning_rate": 0.0004925948761723126, "loss": 6.0607, "mean_token_accuracy": 0.16693697571754457, "num_tokens": 20304929.0, "step": 8015 }, { "entropy": 6.302173900604248, "epoch": 0.9255626081938835, "grad_norm": 0.77734375, "learning_rate": 0.0004925843731763226, "loss": 6.067, "mean_token_accuracy": 0.16893115490674973, "num_tokens": 20317024.0, "step": 8020 }, { "entropy": 6.374800300598144, "epoch": 0.9261396422388921, "grad_norm": 0.8359375, "learning_rate": 0.0004925738628619904, "loss": 6.1205, "mean_token_accuracy": 0.1658678874373436, "num_tokens": 20329909.0, "step": 8025 }, { "entropy": 6.241035079956054, "epoch": 0.9267166762839008, "grad_norm": 0.7890625, "learning_rate": 0.0004925633452296693, "loss": 6.0841, "mean_token_accuracy": 0.16910781860351562, "num_tokens": 20344224.0, "step": 8030 }, { "entropy": 6.371493101119995, "epoch": 0.9272937103289094, "grad_norm": 0.85546875, "learning_rate": 0.0004925528202797131, "loss": 6.0854, "mean_token_accuracy": 0.16615129262208939, "num_tokens": 20357393.0, "step": 8035 }, { "entropy": 6.349489068984985, "epoch": 0.927870744373918, "grad_norm": 0.984375, "learning_rate": 0.0004925422880124761, "loss": 6.1113, "mean_token_accuracy": 0.16972048878669738, "num_tokens": 20369551.0, "step": 8040 }, { "entropy": 6.298521709442139, "epoch": 0.9284477784189267, "grad_norm": 0.890625, "learning_rate": 0.0004925317484283121, "loss": 6.2078, "mean_token_accuracy": 0.16394488960504533, "num_tokens": 20382639.0, "step": 8045 }, { "entropy": 6.349614477157592, "epoch": 0.9290248124639354, "grad_norm": 0.8671875, "learning_rate": 0.0004925212015275758, "loss": 6.0278, "mean_token_accuracy": 0.178650863468647, "num_tokens": 20394751.0, "step": 8050 }, { "entropy": 6.232526731491089, "epoch": 0.9296018465089441, "grad_norm": 0.78515625, "learning_rate": 0.000492510647310622, "loss": 6.0768, "mean_token_accuracy": 0.17546522319316865, "num_tokens": 20408235.0, "step": 8055 }, { "entropy": 6.31773829460144, "epoch": 0.9301788805539527, "grad_norm": 0.82421875, "learning_rate": 0.0004925000857778055, "loss": 6.1095, "mean_token_accuracy": 0.169540336728096, "num_tokens": 20423063.0, "step": 8060 }, { "entropy": 6.342768430709839, "epoch": 0.9307559145989613, "grad_norm": 0.87890625, "learning_rate": 0.0004924895169294818, "loss": 6.0142, "mean_token_accuracy": 0.17308391481637955, "num_tokens": 20436225.0, "step": 8065 }, { "entropy": 6.319842863082886, "epoch": 0.93133294864397, "grad_norm": 0.93359375, "learning_rate": 0.0004924789407660062, "loss": 6.1361, "mean_token_accuracy": 0.17381656765937806, "num_tokens": 20447957.0, "step": 8070 }, { "entropy": 6.298751926422119, "epoch": 0.9319099826889786, "grad_norm": 0.87890625, "learning_rate": 0.0004924683572877345, "loss": 6.0219, "mean_token_accuracy": 0.17717759013175965, "num_tokens": 20459836.0, "step": 8075 }, { "entropy": 6.402027034759522, "epoch": 0.9324870167339873, "grad_norm": 0.890625, "learning_rate": 0.0004924577664950225, "loss": 6.1794, "mean_token_accuracy": 0.16712668389081956, "num_tokens": 20471907.0, "step": 8080 }, { "entropy": 6.325817441940307, "epoch": 0.933064050778996, "grad_norm": 0.875, "learning_rate": 0.0004924471683882266, "loss": 6.1608, "mean_token_accuracy": 0.16859893202781678, "num_tokens": 20485166.0, "step": 8085 }, { "entropy": 6.3150599002838135, "epoch": 0.9336410848240047, "grad_norm": 0.828125, "learning_rate": 0.0004924365629677031, "loss": 6.0038, "mean_token_accuracy": 0.17864430248737334, "num_tokens": 20498973.0, "step": 8090 }, { "entropy": 6.290228700637817, "epoch": 0.9342181188690133, "grad_norm": 0.80859375, "learning_rate": 0.000492425950233809, "loss": 6.033, "mean_token_accuracy": 0.18096119910478592, "num_tokens": 20511615.0, "step": 8095 }, { "entropy": 6.306623554229736, "epoch": 0.9347951529140219, "grad_norm": 0.87890625, "learning_rate": 0.000492415330186901, "loss": 6.0824, "mean_token_accuracy": 0.1683804363012314, "num_tokens": 20523615.0, "step": 8100 }, { "entropy": 6.372899293899536, "epoch": 0.9353721869590306, "grad_norm": 0.93359375, "learning_rate": 0.0004924047028273364, "loss": 6.007, "mean_token_accuracy": 0.1787632629275322, "num_tokens": 20537048.0, "step": 8105 }, { "entropy": 6.285822963714599, "epoch": 0.9359492210040392, "grad_norm": 0.80078125, "learning_rate": 0.0004923940681554725, "loss": 6.0922, "mean_token_accuracy": 0.1766421005129814, "num_tokens": 20551041.0, "step": 8110 }, { "entropy": 6.348171663284302, "epoch": 0.9365262550490479, "grad_norm": 0.859375, "learning_rate": 0.0004923834261716672, "loss": 6.1496, "mean_token_accuracy": 0.1679307132959366, "num_tokens": 20563123.0, "step": 8115 }, { "entropy": 6.331095409393311, "epoch": 0.9371032890940566, "grad_norm": 0.81640625, "learning_rate": 0.0004923727768762782, "loss": 6.048, "mean_token_accuracy": 0.18366726487874985, "num_tokens": 20577487.0, "step": 8120 }, { "entropy": 6.275611782073975, "epoch": 0.9376803231390652, "grad_norm": 0.796875, "learning_rate": 0.000492362120269664, "loss": 6.0773, "mean_token_accuracy": 0.17474426031112672, "num_tokens": 20590125.0, "step": 8125 }, { "entropy": 6.328644275665283, "epoch": 0.9382573571840739, "grad_norm": 0.78515625, "learning_rate": 0.0004923514563521827, "loss": 6.1126, "mean_token_accuracy": 0.1696262091398239, "num_tokens": 20603035.0, "step": 8130 }, { "entropy": 6.3141919612884525, "epoch": 0.9388343912290825, "grad_norm": 0.87890625, "learning_rate": 0.0004923407851241933, "loss": 6.094, "mean_token_accuracy": 0.16628068536520005, "num_tokens": 20615280.0, "step": 8135 }, { "entropy": 6.332769775390625, "epoch": 0.9394114252740912, "grad_norm": 0.78515625, "learning_rate": 0.0004923301065860545, "loss": 6.0693, "mean_token_accuracy": 0.16870561093091965, "num_tokens": 20627800.0, "step": 8140 }, { "entropy": 6.297971963882446, "epoch": 0.9399884593190998, "grad_norm": 0.92578125, "learning_rate": 0.0004923194207381254, "loss": 6.0941, "mean_token_accuracy": 0.16942809224128724, "num_tokens": 20639264.0, "step": 8145 }, { "entropy": 6.198244857788086, "epoch": 0.9405654933641084, "grad_norm": 0.8203125, "learning_rate": 0.0004923087275807656, "loss": 6.0176, "mean_token_accuracy": 0.18265498876571656, "num_tokens": 20652155.0, "step": 8150 }, { "entropy": 6.3499046802520756, "epoch": 0.9411425274091172, "grad_norm": 0.86328125, "learning_rate": 0.0004922980271143347, "loss": 6.0793, "mean_token_accuracy": 0.1729395642876625, "num_tokens": 20665642.0, "step": 8155 }, { "entropy": 6.345331525802612, "epoch": 0.9417195614541258, "grad_norm": 0.796875, "learning_rate": 0.0004922873193391927, "loss": 6.0618, "mean_token_accuracy": 0.17080418467521669, "num_tokens": 20678685.0, "step": 8160 }, { "entropy": 6.239529323577881, "epoch": 0.9422965954991345, "grad_norm": 0.8515625, "learning_rate": 0.0004922766042556994, "loss": 6.0014, "mean_token_accuracy": 0.17112986594438553, "num_tokens": 20690714.0, "step": 8165 }, { "entropy": 6.3647966384887695, "epoch": 0.9428736295441431, "grad_norm": 1.1015625, "learning_rate": 0.0004922658818642156, "loss": 6.0995, "mean_token_accuracy": 0.16545148491859435, "num_tokens": 20703316.0, "step": 8170 }, { "entropy": 6.249971199035644, "epoch": 0.9434506635891518, "grad_norm": 0.80859375, "learning_rate": 0.0004922551521651018, "loss": 5.9891, "mean_token_accuracy": 0.18353118002414703, "num_tokens": 20716144.0, "step": 8175 }, { "entropy": 6.328268146514892, "epoch": 0.9440276976341604, "grad_norm": 0.9140625, "learning_rate": 0.0004922444151587189, "loss": 6.0374, "mean_token_accuracy": 0.1707102119922638, "num_tokens": 20728089.0, "step": 8180 }, { "entropy": 6.219746112823486, "epoch": 0.944604731679169, "grad_norm": 0.8359375, "learning_rate": 0.0004922336708454279, "loss": 6.0499, "mean_token_accuracy": 0.18127028048038482, "num_tokens": 20741684.0, "step": 8185 }, { "entropy": 6.337989234924317, "epoch": 0.9451817657241778, "grad_norm": 0.8203125, "learning_rate": 0.0004922229192255903, "loss": 6.1007, "mean_token_accuracy": 0.16950066089630128, "num_tokens": 20754840.0, "step": 8190 }, { "entropy": 6.272415828704834, "epoch": 0.9457587997691864, "grad_norm": 0.88671875, "learning_rate": 0.0004922121602995678, "loss": 5.9846, "mean_token_accuracy": 0.18377467840909958, "num_tokens": 20767528.0, "step": 8195 }, { "entropy": 6.244569110870361, "epoch": 0.9463358338141951, "grad_norm": 0.92578125, "learning_rate": 0.0004922013940677221, "loss": 6.0685, "mean_token_accuracy": 0.1787708282470703, "num_tokens": 20778886.0, "step": 8200 }, { "entropy": 6.314958715438843, "epoch": 0.9469128678592037, "grad_norm": 0.76171875, "learning_rate": 0.0004921906205304155, "loss": 6.0274, "mean_token_accuracy": 0.16707849353551865, "num_tokens": 20792928.0, "step": 8205 }, { "entropy": 6.276573610305786, "epoch": 0.9474899019042123, "grad_norm": 0.7890625, "learning_rate": 0.0004921798396880101, "loss": 6.0222, "mean_token_accuracy": 0.17047245651483536, "num_tokens": 20805766.0, "step": 8210 }, { "entropy": 6.332600259780884, "epoch": 0.948066935949221, "grad_norm": 0.8515625, "learning_rate": 0.0004921690515408688, "loss": 6.0799, "mean_token_accuracy": 0.17117798924446107, "num_tokens": 20819008.0, "step": 8215 }, { "entropy": 6.297818374633789, "epoch": 0.9486439699942296, "grad_norm": 0.83203125, "learning_rate": 0.0004921582560893543, "loss": 6.1285, "mean_token_accuracy": 0.1678549811244011, "num_tokens": 20832706.0, "step": 8220 }, { "entropy": 6.29673662185669, "epoch": 0.9492210040392384, "grad_norm": 0.828125, "learning_rate": 0.0004921474533338297, "loss": 6.0616, "mean_token_accuracy": 0.1708410307765007, "num_tokens": 20844568.0, "step": 8225 }, { "entropy": 6.305984210968018, "epoch": 0.949798038084247, "grad_norm": 0.80859375, "learning_rate": 0.0004921366432746585, "loss": 6.0623, "mean_token_accuracy": 0.17219894528388976, "num_tokens": 20856157.0, "step": 8230 }, { "entropy": 6.256311988830566, "epoch": 0.9503750721292556, "grad_norm": 0.87890625, "learning_rate": 0.000492125825912204, "loss": 6.0552, "mean_token_accuracy": 0.1725418046116829, "num_tokens": 20868039.0, "step": 8235 }, { "entropy": 6.362317228317261, "epoch": 0.9509521061742643, "grad_norm": 0.86328125, "learning_rate": 0.0004921150012468302, "loss": 6.0623, "mean_token_accuracy": 0.17292184233665467, "num_tokens": 20880190.0, "step": 8240 }, { "entropy": 6.240530061721802, "epoch": 0.9515291402192729, "grad_norm": 0.84765625, "learning_rate": 0.0004921041692789013, "loss": 6.0576, "mean_token_accuracy": 0.17715438902378083, "num_tokens": 20892996.0, "step": 8245 }, { "entropy": 6.327496719360352, "epoch": 0.9521061742642816, "grad_norm": 0.765625, "learning_rate": 0.0004920933300087813, "loss": 6.1245, "mean_token_accuracy": 0.170589879155159, "num_tokens": 20906080.0, "step": 8250 }, { "entropy": 6.35455002784729, "epoch": 0.9526832083092902, "grad_norm": 0.875, "learning_rate": 0.0004920824834368353, "loss": 6.1527, "mean_token_accuracy": 0.1672087237238884, "num_tokens": 20917944.0, "step": 8255 }, { "entropy": 6.2974732398986815, "epoch": 0.953260242354299, "grad_norm": 1.1875, "learning_rate": 0.0004920716295634275, "loss": 6.0226, "mean_token_accuracy": 0.18663843721151352, "num_tokens": 20929046.0, "step": 8260 }, { "entropy": 6.309549474716187, "epoch": 0.9538372763993076, "grad_norm": 0.9140625, "learning_rate": 0.0004920607683889235, "loss": 6.204, "mean_token_accuracy": 0.16842423677444457, "num_tokens": 20941643.0, "step": 8265 }, { "entropy": 6.374490642547608, "epoch": 0.9544143104443162, "grad_norm": 0.83203125, "learning_rate": 0.0004920498999136882, "loss": 6.12, "mean_token_accuracy": 0.17137401849031447, "num_tokens": 20954620.0, "step": 8270 }, { "entropy": 6.301665258407593, "epoch": 0.9549913444893249, "grad_norm": 0.87109375, "learning_rate": 0.0004920390241380874, "loss": 6.1383, "mean_token_accuracy": 0.16496547162532807, "num_tokens": 20968033.0, "step": 8275 }, { "entropy": 6.316059875488281, "epoch": 0.9555683785343335, "grad_norm": 0.8125, "learning_rate": 0.0004920281410624868, "loss": 6.0528, "mean_token_accuracy": 0.17812226861715316, "num_tokens": 20980586.0, "step": 8280 }, { "entropy": 6.237458086013794, "epoch": 0.9561454125793422, "grad_norm": 0.84375, "learning_rate": 0.0004920172506872525, "loss": 5.9906, "mean_token_accuracy": 0.17724904865026475, "num_tokens": 20992346.0, "step": 8285 }, { "entropy": 6.203985404968262, "epoch": 0.9567224466243508, "grad_norm": 0.87890625, "learning_rate": 0.0004920063530127508, "loss": 5.9545, "mean_token_accuracy": 0.18309845626354218, "num_tokens": 21004399.0, "step": 8290 }, { "entropy": 6.386181783676148, "epoch": 0.9572994806693594, "grad_norm": 0.859375, "learning_rate": 0.0004919954480393482, "loss": 6.1593, "mean_token_accuracy": 0.16094251722097397, "num_tokens": 21017066.0, "step": 8295 }, { "entropy": 6.379828882217407, "epoch": 0.9578765147143682, "grad_norm": 0.79296875, "learning_rate": 0.0004919845357674114, "loss": 6.2121, "mean_token_accuracy": 0.1594449073076248, "num_tokens": 21031664.0, "step": 8300 }, { "entropy": 6.345889616012573, "epoch": 0.9584535487593768, "grad_norm": 0.859375, "learning_rate": 0.0004919736161973076, "loss": 6.0684, "mean_token_accuracy": 0.18007687032222747, "num_tokens": 21043980.0, "step": 8305 }, { "entropy": 6.341425609588623, "epoch": 0.9590305828043855, "grad_norm": 0.79296875, "learning_rate": 0.000491962689329404, "loss": 6.0708, "mean_token_accuracy": 0.17116846591234208, "num_tokens": 21056916.0, "step": 8310 }, { "entropy": 6.38311505317688, "epoch": 0.9596076168493941, "grad_norm": 0.87109375, "learning_rate": 0.0004919517551640681, "loss": 6.1542, "mean_token_accuracy": 0.1650987982749939, "num_tokens": 21070027.0, "step": 8315 }, { "entropy": 6.336155128479004, "epoch": 0.9601846508944027, "grad_norm": 0.7890625, "learning_rate": 0.0004919408137016677, "loss": 6.12, "mean_token_accuracy": 0.1708296701312065, "num_tokens": 21082596.0, "step": 8320 }, { "entropy": 6.15516300201416, "epoch": 0.9607616849394114, "grad_norm": 0.9296875, "learning_rate": 0.0004919298649425708, "loss": 5.9459, "mean_token_accuracy": 0.17924613356590272, "num_tokens": 21098160.0, "step": 8325 }, { "entropy": 6.3055689334869385, "epoch": 0.96133871898442, "grad_norm": 0.84765625, "learning_rate": 0.0004919189088871456, "loss": 6.041, "mean_token_accuracy": 0.17082750350236892, "num_tokens": 21111562.0, "step": 8330 }, { "entropy": 6.309827613830566, "epoch": 0.9619157530294288, "grad_norm": 0.91015625, "learning_rate": 0.0004919079455357608, "loss": 6.051, "mean_token_accuracy": 0.1726277843117714, "num_tokens": 21123177.0, "step": 8335 }, { "entropy": 6.272983598709106, "epoch": 0.9624927870744374, "grad_norm": 0.84765625, "learning_rate": 0.0004918969748887847, "loss": 6.1106, "mean_token_accuracy": 0.1684108003973961, "num_tokens": 21135390.0, "step": 8340 }, { "entropy": 6.303555488586426, "epoch": 0.9630698211194461, "grad_norm": 0.8515625, "learning_rate": 0.0004918859969465868, "loss": 6.0524, "mean_token_accuracy": 0.1788319617509842, "num_tokens": 21148718.0, "step": 8345 }, { "entropy": 6.348038244247436, "epoch": 0.9636468551644547, "grad_norm": 0.7890625, "learning_rate": 0.0004918750117095361, "loss": 6.0769, "mean_token_accuracy": 0.16928021162748336, "num_tokens": 21161057.0, "step": 8350 }, { "entropy": 6.333800172805786, "epoch": 0.9642238892094633, "grad_norm": 0.78515625, "learning_rate": 0.0004918640191780021, "loss": 6.0314, "mean_token_accuracy": 0.1733250930905342, "num_tokens": 21175048.0, "step": 8355 }, { "entropy": 6.298459768295288, "epoch": 0.964800923254472, "grad_norm": 0.85546875, "learning_rate": 0.0004918530193523546, "loss": 6.0075, "mean_token_accuracy": 0.17219914495944977, "num_tokens": 21187995.0, "step": 8360 }, { "entropy": 6.2210142612457275, "epoch": 0.9653779572994806, "grad_norm": 0.82421875, "learning_rate": 0.0004918420122329634, "loss": 5.9762, "mean_token_accuracy": 0.17670271098613738, "num_tokens": 21200685.0, "step": 8365 }, { "entropy": 6.269420576095581, "epoch": 0.9659549913444894, "grad_norm": 0.859375, "learning_rate": 0.0004918309978201989, "loss": 6.0031, "mean_token_accuracy": 0.17940095961093902, "num_tokens": 21212709.0, "step": 8370 }, { "entropy": 6.3614483833312985, "epoch": 0.966532025389498, "grad_norm": 0.87890625, "learning_rate": 0.0004918199761144315, "loss": 6.1414, "mean_token_accuracy": 0.16158217340707778, "num_tokens": 21224846.0, "step": 8375 }, { "entropy": 6.342139053344726, "epoch": 0.9671090594345066, "grad_norm": 0.86328125, "learning_rate": 0.0004918089471160318, "loss": 6.1078, "mean_token_accuracy": 0.17495157569646835, "num_tokens": 21238490.0, "step": 8380 }, { "entropy": 6.297436285018921, "epoch": 0.9676860934795153, "grad_norm": 0.859375, "learning_rate": 0.0004917979108253709, "loss": 6.0186, "mean_token_accuracy": 0.17175852954387666, "num_tokens": 21250064.0, "step": 8385 }, { "entropy": 6.319163703918457, "epoch": 0.9682631275245239, "grad_norm": 0.86328125, "learning_rate": 0.00049178686724282, "loss": 5.9838, "mean_token_accuracy": 0.17822523713111876, "num_tokens": 21262777.0, "step": 8390 }, { "entropy": 6.2587940216064455, "epoch": 0.9688401615695326, "grad_norm": 0.9140625, "learning_rate": 0.0004917758163687506, "loss": 6.0596, "mean_token_accuracy": 0.18015512079000473, "num_tokens": 21274837.0, "step": 8395 }, { "entropy": 6.299158430099487, "epoch": 0.9694171956145412, "grad_norm": 1.3359375, "learning_rate": 0.0004917647582035341, "loss": 6.1477, "mean_token_accuracy": 0.16546362787485122, "num_tokens": 21287683.0, "step": 8400 }, { "entropy": 6.276169300079346, "epoch": 0.96999422965955, "grad_norm": 0.92578125, "learning_rate": 0.0004917536927475428, "loss": 5.9704, "mean_token_accuracy": 0.17683717012405395, "num_tokens": 21300053.0, "step": 8405 }, { "entropy": 6.322388982772827, "epoch": 0.9705712637045586, "grad_norm": 0.890625, "learning_rate": 0.0004917426200011486, "loss": 6.0606, "mean_token_accuracy": 0.17437842041254042, "num_tokens": 21312143.0, "step": 8410 }, { "entropy": 6.308571004867554, "epoch": 0.9711482977495672, "grad_norm": 0.78125, "learning_rate": 0.000491731539964724, "loss": 6.064, "mean_token_accuracy": 0.17512849271297454, "num_tokens": 21324530.0, "step": 8415 }, { "entropy": 6.308686065673828, "epoch": 0.9717253317945759, "grad_norm": 0.87890625, "learning_rate": 0.0004917204526386418, "loss": 6.1158, "mean_token_accuracy": 0.17519305050373077, "num_tokens": 21337766.0, "step": 8420 }, { "entropy": 6.3296489238739015, "epoch": 0.9723023658395845, "grad_norm": 0.91796875, "learning_rate": 0.0004917093580232748, "loss": 6.0457, "mean_token_accuracy": 0.17636967301368714, "num_tokens": 21350304.0, "step": 8425 }, { "entropy": 6.264460182189941, "epoch": 0.9728793998845932, "grad_norm": 0.94921875, "learning_rate": 0.0004916982561189962, "loss": 6.0781, "mean_token_accuracy": 0.17243474572896958, "num_tokens": 21362030.0, "step": 8430 }, { "entropy": 6.325700092315674, "epoch": 0.9734564339296018, "grad_norm": 0.859375, "learning_rate": 0.0004916871469261794, "loss": 6.088, "mean_token_accuracy": 0.1718950316309929, "num_tokens": 21374279.0, "step": 8435 }, { "entropy": 6.3129064559936525, "epoch": 0.9740334679746105, "grad_norm": 0.80078125, "learning_rate": 0.000491676030445198, "loss": 6.074, "mean_token_accuracy": 0.18431381583213807, "num_tokens": 21388220.0, "step": 8440 }, { "entropy": 6.319225549697876, "epoch": 0.9746105020196192, "grad_norm": 0.796875, "learning_rate": 0.0004916649066764259, "loss": 6.0279, "mean_token_accuracy": 0.17508506923913955, "num_tokens": 21400770.0, "step": 8445 }, { "entropy": 6.299949407577515, "epoch": 0.9751875360646278, "grad_norm": 0.8515625, "learning_rate": 0.0004916537756202375, "loss": 6.0692, "mean_token_accuracy": 0.1750455766916275, "num_tokens": 21413078.0, "step": 8450 }, { "entropy": 6.322778272628784, "epoch": 0.9757645701096365, "grad_norm": 0.9609375, "learning_rate": 0.0004916426372770069, "loss": 6.0912, "mean_token_accuracy": 0.16818054616451264, "num_tokens": 21427285.0, "step": 8455 }, { "entropy": 6.3555844783782955, "epoch": 0.9763416041546451, "grad_norm": 1.015625, "learning_rate": 0.0004916314916471087, "loss": 6.0548, "mean_token_accuracy": 0.17514651268720627, "num_tokens": 21440659.0, "step": 8460 }, { "entropy": 6.283309412002564, "epoch": 0.9769186381996537, "grad_norm": 0.890625, "learning_rate": 0.0004916203387309179, "loss": 6.0336, "mean_token_accuracy": 0.1689162462949753, "num_tokens": 21452301.0, "step": 8465 }, { "entropy": 6.186957979202271, "epoch": 0.9774956722446624, "grad_norm": 0.8671875, "learning_rate": 0.0004916091785288096, "loss": 5.9807, "mean_token_accuracy": 0.18105768263339997, "num_tokens": 21466716.0, "step": 8470 }, { "entropy": 6.330410099029541, "epoch": 0.9780727062896711, "grad_norm": 0.96484375, "learning_rate": 0.0004915980110411593, "loss": 6.0875, "mean_token_accuracy": 0.17375342547893524, "num_tokens": 21479314.0, "step": 8475 }, { "entropy": 6.277654647827148, "epoch": 0.9786497403346798, "grad_norm": 0.9296875, "learning_rate": 0.0004915868362683425, "loss": 5.9829, "mean_token_accuracy": 0.18661958277225493, "num_tokens": 21491968.0, "step": 8480 }, { "entropy": 6.172560930252075, "epoch": 0.9792267743796884, "grad_norm": 0.765625, "learning_rate": 0.0004915756542107349, "loss": 6.0973, "mean_token_accuracy": 0.1710505172610283, "num_tokens": 21505744.0, "step": 8485 }, { "entropy": 6.331524133682251, "epoch": 0.979803808424697, "grad_norm": 0.79296875, "learning_rate": 0.0004915644648687127, "loss": 6.1035, "mean_token_accuracy": 0.17333952337503433, "num_tokens": 21520981.0, "step": 8490 }, { "entropy": 6.351734685897827, "epoch": 0.9803808424697057, "grad_norm": 0.8515625, "learning_rate": 0.0004915532682426524, "loss": 6.067, "mean_token_accuracy": 0.17047810107469558, "num_tokens": 21533712.0, "step": 8495 }, { "entropy": 6.18950400352478, "epoch": 0.9809578765147143, "grad_norm": 0.76953125, "learning_rate": 0.0004915420643329306, "loss": 5.9703, "mean_token_accuracy": 0.1750311180949211, "num_tokens": 21546875.0, "step": 8500 }, { "entropy": 6.286129379272461, "epoch": 0.981534910559723, "grad_norm": 0.84375, "learning_rate": 0.000491530853139924, "loss": 6.0195, "mean_token_accuracy": 0.17821505516767502, "num_tokens": 21559154.0, "step": 8505 }, { "entropy": 6.3540106296539305, "epoch": 0.9821119446047317, "grad_norm": 0.87890625, "learning_rate": 0.0004915196346640095, "loss": 6.1033, "mean_token_accuracy": 0.16890120655298232, "num_tokens": 21573164.0, "step": 8510 }, { "entropy": 6.343676900863647, "epoch": 0.9826889786497404, "grad_norm": 0.80859375, "learning_rate": 0.0004915084089055648, "loss": 6.1093, "mean_token_accuracy": 0.16497408002614974, "num_tokens": 21585449.0, "step": 8515 }, { "entropy": 6.205972909927368, "epoch": 0.983266012694749, "grad_norm": 0.80859375, "learning_rate": 0.0004914971758649673, "loss": 6.0408, "mean_token_accuracy": 0.18363562375307083, "num_tokens": 21598120.0, "step": 8520 }, { "entropy": 6.2844775199890135, "epoch": 0.9838430467397576, "grad_norm": 0.8359375, "learning_rate": 0.0004914859355425948, "loss": 6.0986, "mean_token_accuracy": 0.17075739353895186, "num_tokens": 21609912.0, "step": 8525 }, { "entropy": 6.362640714645385, "epoch": 0.9844200807847663, "grad_norm": 0.8125, "learning_rate": 0.0004914746879388255, "loss": 6.0341, "mean_token_accuracy": 0.17460228204727174, "num_tokens": 21623242.0, "step": 8530 }, { "entropy": 6.252819156646728, "epoch": 0.9849971148297749, "grad_norm": 0.83203125, "learning_rate": 0.0004914634330540373, "loss": 6.0749, "mean_token_accuracy": 0.17560923844575882, "num_tokens": 21635527.0, "step": 8535 }, { "entropy": 6.27526888847351, "epoch": 0.9855741488747836, "grad_norm": 0.8515625, "learning_rate": 0.0004914521708886093, "loss": 6.0472, "mean_token_accuracy": 0.16989225745201111, "num_tokens": 21648994.0, "step": 8540 }, { "entropy": 6.324329948425293, "epoch": 0.9861511829197923, "grad_norm": 0.8359375, "learning_rate": 0.0004914409014429201, "loss": 6.0489, "mean_token_accuracy": 0.17544470131397247, "num_tokens": 21661512.0, "step": 8545 }, { "entropy": 6.28133864402771, "epoch": 0.986728216964801, "grad_norm": 0.81640625, "learning_rate": 0.0004914296247173486, "loss": 6.1108, "mean_token_accuracy": 0.16970574706792832, "num_tokens": 21674900.0, "step": 8550 }, { "entropy": 6.445541143417358, "epoch": 0.9873052510098096, "grad_norm": 0.859375, "learning_rate": 0.0004914183407122741, "loss": 6.2304, "mean_token_accuracy": 0.1670519694685936, "num_tokens": 21688451.0, "step": 8555 }, { "entropy": 6.338979005813599, "epoch": 0.9878822850548182, "grad_norm": 0.87109375, "learning_rate": 0.0004914070494280763, "loss": 6.0895, "mean_token_accuracy": 0.1686733365058899, "num_tokens": 21700350.0, "step": 8560 }, { "entropy": 6.2714245319366455, "epoch": 0.9884593190998269, "grad_norm": 0.83984375, "learning_rate": 0.0004913957508651349, "loss": 6.0558, "mean_token_accuracy": 0.17865381836891175, "num_tokens": 21713211.0, "step": 8565 }, { "entropy": 6.273990535736084, "epoch": 0.9890363531448355, "grad_norm": 1.6796875, "learning_rate": 0.0004913844450238299, "loss": 5.9724, "mean_token_accuracy": 0.1822005182504654, "num_tokens": 21726105.0, "step": 8570 }, { "entropy": 6.251226806640625, "epoch": 0.9896133871898442, "grad_norm": 0.85546875, "learning_rate": 0.0004913731319045416, "loss": 6.062, "mean_token_accuracy": 0.1773639664053917, "num_tokens": 21738075.0, "step": 8575 }, { "entropy": 6.292670202255249, "epoch": 0.9901904212348529, "grad_norm": 0.8671875, "learning_rate": 0.0004913618115076505, "loss": 6.0441, "mean_token_accuracy": 0.17401732057332991, "num_tokens": 21750614.0, "step": 8580 }, { "entropy": 6.221653270721435, "epoch": 0.9907674552798615, "grad_norm": 0.921875, "learning_rate": 0.0004913504838335372, "loss": 6.0495, "mean_token_accuracy": 0.17573998719453812, "num_tokens": 21763670.0, "step": 8585 }, { "entropy": 6.303406429290772, "epoch": 0.9913444893248702, "grad_norm": 0.875, "learning_rate": 0.0004913391488825829, "loss": 6.0334, "mean_token_accuracy": 0.1794967070221901, "num_tokens": 21776623.0, "step": 8590 }, { "entropy": 6.308801317214966, "epoch": 0.9919215233698788, "grad_norm": 0.828125, "learning_rate": 0.0004913278066551689, "loss": 6.0141, "mean_token_accuracy": 0.17606466710567475, "num_tokens": 21787903.0, "step": 8595 }, { "entropy": 6.230136156082153, "epoch": 0.9924985574148875, "grad_norm": 0.89453125, "learning_rate": 0.0004913164571516765, "loss": 5.9398, "mean_token_accuracy": 0.18365363031625748, "num_tokens": 21800409.0, "step": 8600 }, { "entropy": 6.320093202590942, "epoch": 0.9930755914598961, "grad_norm": 0.92578125, "learning_rate": 0.0004913051003724876, "loss": 6.1418, "mean_token_accuracy": 0.17018114328384398, "num_tokens": 21812741.0, "step": 8605 }, { "entropy": 6.295933103561401, "epoch": 0.9936526255049047, "grad_norm": 0.828125, "learning_rate": 0.0004912937363179839, "loss": 6.0716, "mean_token_accuracy": 0.17680844217538833, "num_tokens": 21826180.0, "step": 8610 }, { "entropy": 6.28583836555481, "epoch": 0.9942296595499135, "grad_norm": 0.92578125, "learning_rate": 0.000491282364988548, "loss": 6.1301, "mean_token_accuracy": 0.17232027649879456, "num_tokens": 21838961.0, "step": 8615 }, { "entropy": 6.3287606716156, "epoch": 0.9948066935949221, "grad_norm": 0.87109375, "learning_rate": 0.0004912709863845621, "loss": 6.0813, "mean_token_accuracy": 0.1688533142209053, "num_tokens": 21850942.0, "step": 8620 }, { "entropy": 6.358766841888428, "epoch": 0.9953837276399308, "grad_norm": 0.84765625, "learning_rate": 0.000491259600506409, "loss": 6.0008, "mean_token_accuracy": 0.18225180059671403, "num_tokens": 21862666.0, "step": 8625 }, { "entropy": 6.225011587142944, "epoch": 0.9959607616849394, "grad_norm": 0.8515625, "learning_rate": 0.0004912482073544716, "loss": 6.0263, "mean_token_accuracy": 0.181974658370018, "num_tokens": 21874866.0, "step": 8630 }, { "entropy": 6.300230407714844, "epoch": 0.996537795729948, "grad_norm": 0.91015625, "learning_rate": 0.0004912368069291333, "loss": 6.0987, "mean_token_accuracy": 0.17124349176883696, "num_tokens": 21887886.0, "step": 8635 }, { "entropy": 6.385247230529785, "epoch": 0.9971148297749567, "grad_norm": 0.828125, "learning_rate": 0.0004912253992307773, "loss": 6.0614, "mean_token_accuracy": 0.1666038528084755, "num_tokens": 21901096.0, "step": 8640 }, { "entropy": 6.307227563858032, "epoch": 0.9976918638199653, "grad_norm": 0.80859375, "learning_rate": 0.0004912139842597875, "loss": 6.1417, "mean_token_accuracy": 0.17292022854089736, "num_tokens": 21914018.0, "step": 8645 }, { "entropy": 6.3174644947052006, "epoch": 0.9982688978649741, "grad_norm": 0.890625, "learning_rate": 0.0004912025620165477, "loss": 6.0544, "mean_token_accuracy": 0.1787086993455887, "num_tokens": 21925488.0, "step": 8650 }, { "entropy": 6.379308795928955, "epoch": 0.9988459319099827, "grad_norm": 0.84375, "learning_rate": 0.0004911911325014421, "loss": 6.1228, "mean_token_accuracy": 0.1627660095691681, "num_tokens": 21938268.0, "step": 8655 }, { "entropy": 6.32840895652771, "epoch": 0.9994229659549914, "grad_norm": 0.8203125, "learning_rate": 0.0004911796957148552, "loss": 6.1073, "mean_token_accuracy": 0.17420676499605178, "num_tokens": 21951219.0, "step": 8660 }, { "entropy": 6.355043363571167, "epoch": 1.0, "grad_norm": 0.859375, "learning_rate": 0.0004911682516571715, "loss": 6.0847, "mean_token_accuracy": 0.1745709404349327, "num_tokens": 21963117.0, "step": 8665 }, { "entropy": 6.3443841457366945, "epoch": 1.0005770340450086, "grad_norm": 0.8671875, "learning_rate": 0.0004911568003287761, "loss": 6.0131, "mean_token_accuracy": 0.17631109207868575, "num_tokens": 21974187.0, "step": 8670 }, { "entropy": 6.301740312576294, "epoch": 1.0011540680900173, "grad_norm": 0.7734375, "learning_rate": 0.0004911453417300541, "loss": 6.0218, "mean_token_accuracy": 0.1745710179209709, "num_tokens": 21987393.0, "step": 8675 }, { "entropy": 6.29511661529541, "epoch": 1.001731102135026, "grad_norm": 0.8984375, "learning_rate": 0.0004911338758613909, "loss": 5.9168, "mean_token_accuracy": 0.18078290671110153, "num_tokens": 21998638.0, "step": 8680 }, { "entropy": 6.239432239532471, "epoch": 1.0023081361800346, "grad_norm": 0.8515625, "learning_rate": 0.0004911224027231722, "loss": 5.9525, "mean_token_accuracy": 0.17768344581127166, "num_tokens": 22012231.0, "step": 8685 }, { "entropy": 6.150865840911865, "epoch": 1.0028851702250432, "grad_norm": 0.83984375, "learning_rate": 0.0004911109223157838, "loss": 5.7963, "mean_token_accuracy": 0.19489599764347076, "num_tokens": 22024929.0, "step": 8690 }, { "entropy": 6.238634347915649, "epoch": 1.0034622042700518, "grad_norm": 0.8125, "learning_rate": 0.0004910994346396118, "loss": 5.9051, "mean_token_accuracy": 0.18360282331705094, "num_tokens": 22037873.0, "step": 8695 }, { "entropy": 6.286004877090454, "epoch": 1.0040392383150605, "grad_norm": 0.86328125, "learning_rate": 0.0004910879396950427, "loss": 5.8986, "mean_token_accuracy": 0.18249017894268035, "num_tokens": 22049572.0, "step": 8700 }, { "entropy": 6.319458055496216, "epoch": 1.0046162723600693, "grad_norm": 0.8125, "learning_rate": 0.000491076437482463, "loss": 5.9874, "mean_token_accuracy": 0.17467263340950012, "num_tokens": 22063290.0, "step": 8705 }, { "entropy": 6.137618780136108, "epoch": 1.005193306405078, "grad_norm": 0.8359375, "learning_rate": 0.0004910649280022599, "loss": 5.8664, "mean_token_accuracy": 0.18574946224689484, "num_tokens": 22076387.0, "step": 8710 }, { "entropy": 6.30208010673523, "epoch": 1.0057703404500866, "grad_norm": 0.8984375, "learning_rate": 0.0004910534112548201, "loss": 5.9577, "mean_token_accuracy": 0.17944232672452926, "num_tokens": 22088780.0, "step": 8715 }, { "entropy": 6.154451704025268, "epoch": 1.0063473744950953, "grad_norm": 0.80859375, "learning_rate": 0.0004910418872405312, "loss": 5.8374, "mean_token_accuracy": 0.1871345892548561, "num_tokens": 22102150.0, "step": 8720 }, { "entropy": 6.243637466430664, "epoch": 1.006924408540104, "grad_norm": 0.8671875, "learning_rate": 0.0004910303559597806, "loss": 5.9346, "mean_token_accuracy": 0.1791851580142975, "num_tokens": 22115250.0, "step": 8725 }, { "entropy": 6.302803611755371, "epoch": 1.0075014425851125, "grad_norm": 0.7890625, "learning_rate": 0.0004910188174129564, "loss": 5.9405, "mean_token_accuracy": 0.17347067594528198, "num_tokens": 22129015.0, "step": 8730 }, { "entropy": 6.2511063575744625, "epoch": 1.0080784766301212, "grad_norm": 0.82421875, "learning_rate": 0.0004910072716004466, "loss": 5.9659, "mean_token_accuracy": 0.17493045777082444, "num_tokens": 22141716.0, "step": 8735 }, { "entropy": 6.333795022964478, "epoch": 1.0086555106751298, "grad_norm": 0.87890625, "learning_rate": 0.0004909957185226394, "loss": 6.0124, "mean_token_accuracy": 0.16725752502679825, "num_tokens": 22153568.0, "step": 8740 }, { "entropy": 6.315547466278076, "epoch": 1.0092325447201385, "grad_norm": 0.8671875, "learning_rate": 0.0004909841581799236, "loss": 6.0358, "mean_token_accuracy": 0.17059850841760635, "num_tokens": 22165443.0, "step": 8745 }, { "entropy": 6.297538089752197, "epoch": 1.009809578765147, "grad_norm": 1.0546875, "learning_rate": 0.0004909725905726879, "loss": 5.9411, "mean_token_accuracy": 0.18054274767637252, "num_tokens": 22179068.0, "step": 8750 }, { "entropy": 6.290983438491821, "epoch": 1.0103866128101557, "grad_norm": 0.87109375, "learning_rate": 0.0004909610157013214, "loss": 6.0418, "mean_token_accuracy": 0.16726665794849396, "num_tokens": 22191597.0, "step": 8755 }, { "entropy": 6.272359132766724, "epoch": 1.0109636468551644, "grad_norm": 0.80859375, "learning_rate": 0.0004909494335662134, "loss": 5.9777, "mean_token_accuracy": 0.17593691051006316, "num_tokens": 22203724.0, "step": 8760 }, { "entropy": 6.268367767333984, "epoch": 1.011540680900173, "grad_norm": 0.84375, "learning_rate": 0.0004909378441677535, "loss": 5.9386, "mean_token_accuracy": 0.1802491694688797, "num_tokens": 22216100.0, "step": 8765 }, { "entropy": 6.311220264434814, "epoch": 1.0121177149451817, "grad_norm": 0.859375, "learning_rate": 0.0004909262475063314, "loss": 5.9342, "mean_token_accuracy": 0.17636322379112243, "num_tokens": 22228162.0, "step": 8770 }, { "entropy": 6.266244554519654, "epoch": 1.0126947489901905, "grad_norm": 0.85546875, "learning_rate": 0.0004909146435823373, "loss": 5.9254, "mean_token_accuracy": 0.1820003569126129, "num_tokens": 22239756.0, "step": 8775 }, { "entropy": 6.258756494522094, "epoch": 1.0132717830351992, "grad_norm": 0.76171875, "learning_rate": 0.0004909030323961613, "loss": 5.9261, "mean_token_accuracy": 0.1728573277592659, "num_tokens": 22252781.0, "step": 8780 }, { "entropy": 6.24869384765625, "epoch": 1.0138488170802078, "grad_norm": 0.82421875, "learning_rate": 0.0004908914139481942, "loss": 6.0004, "mean_token_accuracy": 0.17384298741817475, "num_tokens": 22265171.0, "step": 8785 }, { "entropy": 6.272542905807495, "epoch": 1.0144258511252164, "grad_norm": 0.8046875, "learning_rate": 0.0004908797882388265, "loss": 5.9308, "mean_token_accuracy": 0.1815079167485237, "num_tokens": 22278121.0, "step": 8790 }, { "entropy": 6.188515949249267, "epoch": 1.015002885170225, "grad_norm": 0.83984375, "learning_rate": 0.0004908681552684495, "loss": 5.8076, "mean_token_accuracy": 0.1845837727189064, "num_tokens": 22290074.0, "step": 8795 }, { "entropy": 6.237634563446045, "epoch": 1.0155799192152337, "grad_norm": 1.1484375, "learning_rate": 0.0004908565150374542, "loss": 5.9317, "mean_token_accuracy": 0.18133609592914582, "num_tokens": 22303088.0, "step": 8800 }, { "entropy": 6.322842741012574, "epoch": 1.0161569532602424, "grad_norm": 0.82421875, "learning_rate": 0.0004908448675462323, "loss": 5.9863, "mean_token_accuracy": 0.1694008842110634, "num_tokens": 22317693.0, "step": 8805 }, { "entropy": 6.229022693634033, "epoch": 1.016733987305251, "grad_norm": 0.80078125, "learning_rate": 0.0004908332127951756, "loss": 5.9442, "mean_token_accuracy": 0.17924002856016158, "num_tokens": 22330876.0, "step": 8810 }, { "entropy": 6.266847419738769, "epoch": 1.0173110213502596, "grad_norm": 0.90234375, "learning_rate": 0.0004908215507846757, "loss": 5.9253, "mean_token_accuracy": 0.17635516226291656, "num_tokens": 22342620.0, "step": 8815 }, { "entropy": 6.242235136032105, "epoch": 1.0178880553952683, "grad_norm": 0.84765625, "learning_rate": 0.0004908098815151254, "loss": 5.9486, "mean_token_accuracy": 0.1775849163532257, "num_tokens": 22353733.0, "step": 8820 }, { "entropy": 6.282942867279052, "epoch": 1.018465089440277, "grad_norm": 0.87890625, "learning_rate": 0.0004907982049869168, "loss": 5.9636, "mean_token_accuracy": 0.17333447337150573, "num_tokens": 22366857.0, "step": 8825 }, { "entropy": 6.205226278305053, "epoch": 1.0190421234852856, "grad_norm": 0.90625, "learning_rate": 0.0004907865212004428, "loss": 5.8306, "mean_token_accuracy": 0.18225234746932983, "num_tokens": 22377658.0, "step": 8830 }, { "entropy": 6.268972778320313, "epoch": 1.0196191575302942, "grad_norm": 0.87109375, "learning_rate": 0.0004907748301560963, "loss": 5.9864, "mean_token_accuracy": 0.17106507569551468, "num_tokens": 22390060.0, "step": 8835 }, { "entropy": 6.259017467498779, "epoch": 1.0201961915753028, "grad_norm": 0.796875, "learning_rate": 0.0004907631318542707, "loss": 5.9534, "mean_token_accuracy": 0.17372174561023712, "num_tokens": 22402903.0, "step": 8840 }, { "entropy": 6.163227939605713, "epoch": 1.0207732256203117, "grad_norm": 0.84765625, "learning_rate": 0.0004907514262953594, "loss": 5.8908, "mean_token_accuracy": 0.18323398977518082, "num_tokens": 22416036.0, "step": 8845 }, { "entropy": 6.34295973777771, "epoch": 1.0213502596653203, "grad_norm": 0.8984375, "learning_rate": 0.0004907397134797559, "loss": 5.9372, "mean_token_accuracy": 0.1771351918578148, "num_tokens": 22428000.0, "step": 8850 }, { "entropy": 6.236253643035889, "epoch": 1.021927293710329, "grad_norm": 0.8515625, "learning_rate": 0.0004907279934078543, "loss": 5.943, "mean_token_accuracy": 0.1795724704861641, "num_tokens": 22440029.0, "step": 8855 }, { "entropy": 6.244734859466552, "epoch": 1.0225043277553376, "grad_norm": 0.79296875, "learning_rate": 0.0004907162660800488, "loss": 5.9615, "mean_token_accuracy": 0.1742117166519165, "num_tokens": 22452906.0, "step": 8860 }, { "entropy": 6.252014303207398, "epoch": 1.0230813618003463, "grad_norm": 0.8125, "learning_rate": 0.0004907045314967338, "loss": 5.8512, "mean_token_accuracy": 0.18662992119789124, "num_tokens": 22465853.0, "step": 8865 }, { "entropy": 6.251199388504029, "epoch": 1.023658395845355, "grad_norm": 0.9140625, "learning_rate": 0.0004906927896583041, "loss": 5.9166, "mean_token_accuracy": 0.17843791097402573, "num_tokens": 22478583.0, "step": 8870 }, { "entropy": 6.2310069561004635, "epoch": 1.0242354298903635, "grad_norm": 0.8359375, "learning_rate": 0.0004906810405651546, "loss": 5.9514, "mean_token_accuracy": 0.1803251400589943, "num_tokens": 22491665.0, "step": 8875 }, { "entropy": 6.290026569366455, "epoch": 1.0248124639353722, "grad_norm": 0.8359375, "learning_rate": 0.0004906692842176803, "loss": 5.9343, "mean_token_accuracy": 0.1794249892234802, "num_tokens": 22504015.0, "step": 8880 }, { "entropy": 6.278184032440185, "epoch": 1.0253894979803808, "grad_norm": 0.875, "learning_rate": 0.0004906575206162769, "loss": 6.0169, "mean_token_accuracy": 0.1696304887533188, "num_tokens": 22516385.0, "step": 8885 }, { "entropy": 6.293035173416138, "epoch": 1.0259665320253895, "grad_norm": 0.85546875, "learning_rate": 0.0004906457497613399, "loss": 5.9412, "mean_token_accuracy": 0.17702967971563338, "num_tokens": 22527988.0, "step": 8890 }, { "entropy": 6.225295543670654, "epoch": 1.026543566070398, "grad_norm": 0.85546875, "learning_rate": 0.0004906339716532651, "loss": 5.9193, "mean_token_accuracy": 0.1842564597725868, "num_tokens": 22540613.0, "step": 8895 }, { "entropy": 6.214762258529663, "epoch": 1.0271206001154067, "grad_norm": 0.921875, "learning_rate": 0.0004906221862924488, "loss": 5.8908, "mean_token_accuracy": 0.18303754180669785, "num_tokens": 22552137.0, "step": 8900 }, { "entropy": 6.297317934036255, "epoch": 1.0276976341604154, "grad_norm": 0.8515625, "learning_rate": 0.0004906103936792875, "loss": 5.9925, "mean_token_accuracy": 0.16877427697181702, "num_tokens": 22564677.0, "step": 8905 }, { "entropy": 6.28624005317688, "epoch": 1.028274668205424, "grad_norm": 0.88671875, "learning_rate": 0.0004905985938141777, "loss": 5.9234, "mean_token_accuracy": 0.18351348042488097, "num_tokens": 22578236.0, "step": 8910 }, { "entropy": 6.232121229171753, "epoch": 1.0288517022504329, "grad_norm": 0.734375, "learning_rate": 0.0004905867866975163, "loss": 5.9395, "mean_token_accuracy": 0.18483252376317977, "num_tokens": 22592533.0, "step": 8915 }, { "entropy": 6.336761236190796, "epoch": 1.0294287362954415, "grad_norm": 0.859375, "learning_rate": 0.0004905749723297003, "loss": 5.9954, "mean_token_accuracy": 0.17142664939165114, "num_tokens": 22606062.0, "step": 8920 }, { "entropy": 6.330969190597534, "epoch": 1.0300057703404502, "grad_norm": 0.84765625, "learning_rate": 0.0004905631507111271, "loss": 6.0044, "mean_token_accuracy": 0.1759049713611603, "num_tokens": 22619342.0, "step": 8925 }, { "entropy": 6.278731107711792, "epoch": 1.0305828043854588, "grad_norm": 0.9765625, "learning_rate": 0.0004905513218421946, "loss": 5.9213, "mean_token_accuracy": 0.1838388368487358, "num_tokens": 22632003.0, "step": 8930 }, { "entropy": 6.2721892356872555, "epoch": 1.0311598384304674, "grad_norm": 0.9140625, "learning_rate": 0.0004905394857233004, "loss": 5.9619, "mean_token_accuracy": 0.18194596022367476, "num_tokens": 22644179.0, "step": 8935 }, { "entropy": 6.2627777576446535, "epoch": 1.031736872475476, "grad_norm": 1.0546875, "learning_rate": 0.0004905276423548426, "loss": 5.9137, "mean_token_accuracy": 0.18379924744367598, "num_tokens": 22657544.0, "step": 8940 }, { "entropy": 6.312189292907715, "epoch": 1.0323139065204847, "grad_norm": 0.88671875, "learning_rate": 0.0004905157917372197, "loss": 6.032, "mean_token_accuracy": 0.16942367404699327, "num_tokens": 22670789.0, "step": 8945 }, { "entropy": 6.268924760818481, "epoch": 1.0328909405654934, "grad_norm": 0.8515625, "learning_rate": 0.0004905039338708302, "loss": 5.9336, "mean_token_accuracy": 0.1744486227631569, "num_tokens": 22682491.0, "step": 8950 }, { "entropy": 6.331513929367065, "epoch": 1.033467974610502, "grad_norm": 0.83203125, "learning_rate": 0.0004904920687560728, "loss": 5.958, "mean_token_accuracy": 0.17775530517101287, "num_tokens": 22695235.0, "step": 8955 }, { "entropy": 6.240482997894287, "epoch": 1.0340450086555106, "grad_norm": 0.8984375, "learning_rate": 0.0004904801963933469, "loss": 5.9817, "mean_token_accuracy": 0.1754314720630646, "num_tokens": 22707222.0, "step": 8960 }, { "entropy": 6.281684684753418, "epoch": 1.0346220427005193, "grad_norm": 0.890625, "learning_rate": 0.0004904683167830515, "loss": 5.9881, "mean_token_accuracy": 0.17204625010490418, "num_tokens": 22718820.0, "step": 8965 }, { "entropy": 6.3858250141143795, "epoch": 1.035199076745528, "grad_norm": 0.890625, "learning_rate": 0.0004904564299255862, "loss": 5.9487, "mean_token_accuracy": 0.1777167558670044, "num_tokens": 22731265.0, "step": 8970 }, { "entropy": 6.2346197128295895, "epoch": 1.0357761107905366, "grad_norm": 0.80078125, "learning_rate": 0.0004904445358213511, "loss": 5.8784, "mean_token_accuracy": 0.18681784719228745, "num_tokens": 22744222.0, "step": 8975 }, { "entropy": 6.2135519027709964, "epoch": 1.0363531448355452, "grad_norm": 0.84765625, "learning_rate": 0.0004904326344707461, "loss": 5.9367, "mean_token_accuracy": 0.17929679304361343, "num_tokens": 22756190.0, "step": 8980 }, { "entropy": 6.2172692775726315, "epoch": 1.036930178880554, "grad_norm": 0.91796875, "learning_rate": 0.0004904207258741712, "loss": 5.8621, "mean_token_accuracy": 0.18134094625711442, "num_tokens": 22767943.0, "step": 8985 }, { "entropy": 6.245588541030884, "epoch": 1.0375072129255627, "grad_norm": 0.86328125, "learning_rate": 0.0004904088100320274, "loss": 5.926, "mean_token_accuracy": 0.18322079628705978, "num_tokens": 22780972.0, "step": 8990 }, { "entropy": 6.313575077056885, "epoch": 1.0380842469705713, "grad_norm": 0.91015625, "learning_rate": 0.0004903968869447151, "loss": 6.0264, "mean_token_accuracy": 0.17490241527557374, "num_tokens": 22792584.0, "step": 8995 }, { "entropy": 6.190945482254028, "epoch": 1.03866128101558, "grad_norm": 0.79296875, "learning_rate": 0.0004903849566126356, "loss": 5.9896, "mean_token_accuracy": 0.18099549263715745, "num_tokens": 22807385.0, "step": 9000 }, { "epoch": 1.03866128101558, "eval_entropy": 6.084721145014346, "eval_loss": 6.074094295501709, "eval_mean_token_accuracy": 0.17770804125441725, "eval_num_tokens": 22807385.0, "eval_runtime": 17.4178, "eval_samples_per_second": 1615.359, "eval_steps_per_second": 201.92, "step": 9000 }, { "entropy": 6.313442659378052, "epoch": 1.0392383150605886, "grad_norm": 0.76171875, "learning_rate": 0.0004903730190361902, "loss": 5.9632, "mean_token_accuracy": 0.17392656654119493, "num_tokens": 22820655.0, "step": 9005 }, { "entropy": 6.274996948242188, "epoch": 1.0398153491055973, "grad_norm": 0.89453125, "learning_rate": 0.00049036107421578, "loss": 5.875, "mean_token_accuracy": 0.185438571870327, "num_tokens": 22833043.0, "step": 9010 }, { "entropy": 6.250527429580688, "epoch": 1.040392383150606, "grad_norm": 0.95703125, "learning_rate": 0.0004903491221518073, "loss": 5.9999, "mean_token_accuracy": 0.17539497166872026, "num_tokens": 22844414.0, "step": 9015 }, { "entropy": 6.217691421508789, "epoch": 1.0409694171956145, "grad_norm": 0.87890625, "learning_rate": 0.0004903371628446737, "loss": 5.8996, "mean_token_accuracy": 0.17889068573713302, "num_tokens": 22855966.0, "step": 9020 }, { "entropy": 6.195151519775391, "epoch": 1.0415464512406232, "grad_norm": 0.83203125, "learning_rate": 0.0004903251962947817, "loss": 5.8646, "mean_token_accuracy": 0.1914926216006279, "num_tokens": 22869300.0, "step": 9025 }, { "entropy": 6.31218843460083, "epoch": 1.0421234852856318, "grad_norm": 0.859375, "learning_rate": 0.0004903132225025335, "loss": 5.9627, "mean_token_accuracy": 0.17988667339086534, "num_tokens": 22881040.0, "step": 9030 }, { "entropy": 6.275069904327393, "epoch": 1.0427005193306405, "grad_norm": 0.98828125, "learning_rate": 0.0004903012414683322, "loss": 5.8637, "mean_token_accuracy": 0.1878153622150421, "num_tokens": 22892367.0, "step": 9035 }, { "entropy": 6.274021911621094, "epoch": 1.043277553375649, "grad_norm": 0.88671875, "learning_rate": 0.0004902892531925805, "loss": 6.0153, "mean_token_accuracy": 0.17131800800561905, "num_tokens": 22904737.0, "step": 9040 }, { "entropy": 6.24939112663269, "epoch": 1.0438545874206577, "grad_norm": 0.87109375, "learning_rate": 0.0004902772576756818, "loss": 6.0132, "mean_token_accuracy": 0.17432661205530167, "num_tokens": 22917775.0, "step": 9045 }, { "entropy": 6.313559484481812, "epoch": 1.0444316214656664, "grad_norm": 0.765625, "learning_rate": 0.0004902652549180394, "loss": 6.0118, "mean_token_accuracy": 0.17096944749355317, "num_tokens": 22930496.0, "step": 9050 }, { "entropy": 6.278980875015259, "epoch": 1.0450086555106752, "grad_norm": 0.8828125, "learning_rate": 0.0004902532449200571, "loss": 5.9626, "mean_token_accuracy": 0.17596296668052674, "num_tokens": 22943787.0, "step": 9055 }, { "entropy": 6.249150037765503, "epoch": 1.0455856895556839, "grad_norm": 0.90234375, "learning_rate": 0.0004902412276821386, "loss": 5.9539, "mean_token_accuracy": 0.1785372719168663, "num_tokens": 22956399.0, "step": 9060 }, { "entropy": 6.36644868850708, "epoch": 1.0461627236006925, "grad_norm": 0.796875, "learning_rate": 0.0004902292032046887, "loss": 6.031, "mean_token_accuracy": 0.1718607723712921, "num_tokens": 22969993.0, "step": 9065 }, { "entropy": 6.401646375656128, "epoch": 1.0467397576457012, "grad_norm": 0.890625, "learning_rate": 0.0004902171714881112, "loss": 6.0586, "mean_token_accuracy": 0.1708688423037529, "num_tokens": 22983807.0, "step": 9070 }, { "entropy": 6.274668025970459, "epoch": 1.0473167916907098, "grad_norm": 0.86328125, "learning_rate": 0.0004902051325328112, "loss": 6.004, "mean_token_accuracy": 0.1766917884349823, "num_tokens": 22996238.0, "step": 9075 }, { "entropy": 6.275001811981201, "epoch": 1.0478938257357184, "grad_norm": 0.84765625, "learning_rate": 0.0004901930863391934, "loss": 6.0022, "mean_token_accuracy": 0.17750514149665833, "num_tokens": 23009084.0, "step": 9080 }, { "entropy": 6.3538471221923825, "epoch": 1.048470859780727, "grad_norm": 0.81640625, "learning_rate": 0.000490181032907663, "loss": 6.0333, "mean_token_accuracy": 0.1733698308467865, "num_tokens": 23022799.0, "step": 9085 }, { "entropy": 6.252536058425903, "epoch": 1.0490478938257357, "grad_norm": 0.81640625, "learning_rate": 0.0004901689722386255, "loss": 5.9922, "mean_token_accuracy": 0.17759983390569686, "num_tokens": 23035566.0, "step": 9090 }, { "entropy": 6.217030572891235, "epoch": 1.0496249278707444, "grad_norm": 0.75, "learning_rate": 0.0004901569043324864, "loss": 5.8551, "mean_token_accuracy": 0.18937528282403945, "num_tokens": 23050156.0, "step": 9095 }, { "entropy": 6.304140615463257, "epoch": 1.050201961915753, "grad_norm": 0.87890625, "learning_rate": 0.0004901448291896518, "loss": 5.964, "mean_token_accuracy": 0.17621853202581406, "num_tokens": 23063121.0, "step": 9100 }, { "entropy": 6.211063194274902, "epoch": 1.0507789959607616, "grad_norm": 0.8671875, "learning_rate": 0.0004901327468105277, "loss": 5.8365, "mean_token_accuracy": 0.18590471446514129, "num_tokens": 23075236.0, "step": 9105 }, { "entropy": 6.220917272567749, "epoch": 1.0513560300057703, "grad_norm": 0.83203125, "learning_rate": 0.0004901206571955205, "loss": 6.011, "mean_token_accuracy": 0.17641226947307587, "num_tokens": 23089091.0, "step": 9110 }, { "entropy": 6.319421052932739, "epoch": 1.051933064050779, "grad_norm": 0.78125, "learning_rate": 0.0004901085603450369, "loss": 5.9762, "mean_token_accuracy": 0.17164439111948013, "num_tokens": 23101642.0, "step": 9115 }, { "entropy": 6.340474700927734, "epoch": 1.0525100980957875, "grad_norm": 0.828125, "learning_rate": 0.0004900964562594838, "loss": 5.9078, "mean_token_accuracy": 0.1801260828971863, "num_tokens": 23113427.0, "step": 9120 }, { "entropy": 6.2288182258605955, "epoch": 1.0530871321407964, "grad_norm": 0.80859375, "learning_rate": 0.000490084344939268, "loss": 5.883, "mean_token_accuracy": 0.18409405052661895, "num_tokens": 23125857.0, "step": 9125 }, { "entropy": 6.2246747493743895, "epoch": 1.053664166185805, "grad_norm": 0.82421875, "learning_rate": 0.0004900722263847973, "loss": 5.9355, "mean_token_accuracy": 0.1781703308224678, "num_tokens": 23138541.0, "step": 9130 }, { "entropy": 6.216336917877197, "epoch": 1.0542412002308137, "grad_norm": 0.87890625, "learning_rate": 0.0004900601005964791, "loss": 5.9201, "mean_token_accuracy": 0.18445058017969132, "num_tokens": 23151155.0, "step": 9135 }, { "entropy": 6.2328308582305905, "epoch": 1.0548182342758223, "grad_norm": 0.82421875, "learning_rate": 0.0004900479675747212, "loss": 5.9428, "mean_token_accuracy": 0.1755356252193451, "num_tokens": 23165478.0, "step": 9140 }, { "entropy": 6.286372423171997, "epoch": 1.055395268320831, "grad_norm": 0.8515625, "learning_rate": 0.0004900358273199316, "loss": 5.9476, "mean_token_accuracy": 0.17133285999298095, "num_tokens": 23178120.0, "step": 9145 }, { "entropy": 6.308216190338134, "epoch": 1.0559723023658396, "grad_norm": 0.87109375, "learning_rate": 0.000490023679832519, "loss": 5.9634, "mean_token_accuracy": 0.17226850390434265, "num_tokens": 23191275.0, "step": 9150 }, { "entropy": 6.207145166397095, "epoch": 1.0565493364108482, "grad_norm": 0.78515625, "learning_rate": 0.0004900115251128916, "loss": 5.9664, "mean_token_accuracy": 0.17270159721374512, "num_tokens": 23204518.0, "step": 9155 }, { "entropy": 6.368451738357544, "epoch": 1.057126370455857, "grad_norm": 0.8984375, "learning_rate": 0.0004899993631614583, "loss": 6.0091, "mean_token_accuracy": 0.17063124030828475, "num_tokens": 23217488.0, "step": 9160 }, { "entropy": 6.297813034057617, "epoch": 1.0577034045008655, "grad_norm": 0.83984375, "learning_rate": 0.0004899871939786283, "loss": 5.9517, "mean_token_accuracy": 0.17866510897874832, "num_tokens": 23230101.0, "step": 9165 }, { "entropy": 6.250898981094361, "epoch": 1.0582804385458742, "grad_norm": 0.80078125, "learning_rate": 0.0004899750175648107, "loss": 6.1023, "mean_token_accuracy": 0.16902584880590438, "num_tokens": 23243747.0, "step": 9170 }, { "entropy": 6.296909427642822, "epoch": 1.0588574725908828, "grad_norm": 0.8359375, "learning_rate": 0.0004899628339204154, "loss": 5.8954, "mean_token_accuracy": 0.18030100166797638, "num_tokens": 23256593.0, "step": 9175 }, { "entropy": 6.293514776229858, "epoch": 1.0594345066358914, "grad_norm": 1.1015625, "learning_rate": 0.0004899506430458518, "loss": 6.0224, "mean_token_accuracy": 0.17253340929746627, "num_tokens": 23269359.0, "step": 9180 }, { "entropy": 6.199410676956177, "epoch": 1.0600115406809, "grad_norm": 0.80859375, "learning_rate": 0.0004899384449415302, "loss": 5.8559, "mean_token_accuracy": 0.1903077781200409, "num_tokens": 23283462.0, "step": 9185 }, { "entropy": 6.2551408290863035, "epoch": 1.0605885747259087, "grad_norm": 0.85546875, "learning_rate": 0.0004899262396078606, "loss": 5.96, "mean_token_accuracy": 0.17357292026281357, "num_tokens": 23295920.0, "step": 9190 }, { "entropy": 6.3527368068695065, "epoch": 1.0611656087709176, "grad_norm": 0.83984375, "learning_rate": 0.0004899140270452539, "loss": 5.9859, "mean_token_accuracy": 0.17623718380928038, "num_tokens": 23307433.0, "step": 9195 }, { "entropy": 6.2791832447052, "epoch": 1.0617426428159262, "grad_norm": 0.83984375, "learning_rate": 0.0004899018072541204, "loss": 5.9317, "mean_token_accuracy": 0.17714277356863023, "num_tokens": 23320265.0, "step": 9200 }, { "entropy": 6.240837335586548, "epoch": 1.0623196768609349, "grad_norm": 0.90234375, "learning_rate": 0.0004898895802348715, "loss": 5.8086, "mean_token_accuracy": 0.18867361545562744, "num_tokens": 23331951.0, "step": 9205 }, { "entropy": 6.241315603256226, "epoch": 1.0628967109059435, "grad_norm": 0.87109375, "learning_rate": 0.0004898773459879183, "loss": 5.9554, "mean_token_accuracy": 0.17665793150663375, "num_tokens": 23344862.0, "step": 9210 }, { "entropy": 6.263033628463745, "epoch": 1.0634737449509521, "grad_norm": 0.90234375, "learning_rate": 0.0004898651045136724, "loss": 5.9015, "mean_token_accuracy": 0.1770300403237343, "num_tokens": 23357212.0, "step": 9215 }, { "entropy": 6.239983558654785, "epoch": 1.0640507789959608, "grad_norm": 0.828125, "learning_rate": 0.0004898528558125453, "loss": 5.9122, "mean_token_accuracy": 0.1855781152844429, "num_tokens": 23370114.0, "step": 9220 }, { "entropy": 6.2795045375823975, "epoch": 1.0646278130409694, "grad_norm": 0.890625, "learning_rate": 0.0004898405998849492, "loss": 5.9202, "mean_token_accuracy": 0.17944572120904922, "num_tokens": 23382295.0, "step": 9225 }, { "entropy": 6.242071914672851, "epoch": 1.065204847085978, "grad_norm": 0.859375, "learning_rate": 0.0004898283367312962, "loss": 5.9646, "mean_token_accuracy": 0.18123720586299896, "num_tokens": 23395477.0, "step": 9230 }, { "entropy": 6.255929803848266, "epoch": 1.0657818811309867, "grad_norm": 0.875, "learning_rate": 0.0004898160663519988, "loss": 5.8941, "mean_token_accuracy": 0.18162889778614044, "num_tokens": 23407868.0, "step": 9235 }, { "entropy": 6.257204484939575, "epoch": 1.0663589151759953, "grad_norm": 1.1484375, "learning_rate": 0.0004898037887474697, "loss": 5.9754, "mean_token_accuracy": 0.17620085179805756, "num_tokens": 23422156.0, "step": 9240 }, { "entropy": 6.26265287399292, "epoch": 1.066935949221004, "grad_norm": 0.89453125, "learning_rate": 0.0004897915039181219, "loss": 5.9044, "mean_token_accuracy": 0.18346980959177017, "num_tokens": 23433951.0, "step": 9245 }, { "entropy": 6.230978536605835, "epoch": 1.0675129832660126, "grad_norm": 0.80078125, "learning_rate": 0.0004897792118643685, "loss": 5.9532, "mean_token_accuracy": 0.18462717086076735, "num_tokens": 23447174.0, "step": 9250 }, { "entropy": 6.2545677661895756, "epoch": 1.0680900173110213, "grad_norm": 0.859375, "learning_rate": 0.0004897669125866231, "loss": 5.9351, "mean_token_accuracy": 0.18284523487091064, "num_tokens": 23458502.0, "step": 9255 }, { "entropy": 6.270356178283691, "epoch": 1.06866705135603, "grad_norm": 0.80859375, "learning_rate": 0.0004897546060852993, "loss": 6.0253, "mean_token_accuracy": 0.17326220422983168, "num_tokens": 23471572.0, "step": 9260 }, { "entropy": 6.228240203857422, "epoch": 1.0692440854010385, "grad_norm": 0.89453125, "learning_rate": 0.0004897422923608108, "loss": 5.8997, "mean_token_accuracy": 0.1773914650082588, "num_tokens": 23484454.0, "step": 9265 }, { "entropy": 6.254168748855591, "epoch": 1.0698211194460474, "grad_norm": 0.90625, "learning_rate": 0.0004897299714135721, "loss": 5.9925, "mean_token_accuracy": 0.17173787504434584, "num_tokens": 23497022.0, "step": 9270 }, { "entropy": 6.310999917984009, "epoch": 1.070398153491056, "grad_norm": 0.90234375, "learning_rate": 0.0004897176432439974, "loss": 5.9631, "mean_token_accuracy": 0.18117151111364366, "num_tokens": 23510714.0, "step": 9275 }, { "entropy": 6.266863012313843, "epoch": 1.0709751875360647, "grad_norm": 0.91796875, "learning_rate": 0.0004897053078525016, "loss": 5.9645, "mean_token_accuracy": 0.17361937761306762, "num_tokens": 23522927.0, "step": 9280 }, { "entropy": 6.237617301940918, "epoch": 1.0715522215810733, "grad_norm": 0.875, "learning_rate": 0.0004896929652394993, "loss": 5.861, "mean_token_accuracy": 0.1824570968747139, "num_tokens": 23536042.0, "step": 9285 }, { "entropy": 6.3404463768005375, "epoch": 1.072129255626082, "grad_norm": 0.875, "learning_rate": 0.0004896806154054057, "loss": 5.9772, "mean_token_accuracy": 0.17799821645021438, "num_tokens": 23549002.0, "step": 9290 }, { "entropy": 6.2474583148956295, "epoch": 1.0727062896710906, "grad_norm": 0.8984375, "learning_rate": 0.0004896682583506363, "loss": 6.0185, "mean_token_accuracy": 0.17269163578748703, "num_tokens": 23563080.0, "step": 9295 }, { "entropy": 6.307273435592651, "epoch": 1.0732833237160992, "grad_norm": 0.86328125, "learning_rate": 0.0004896558940756067, "loss": 5.9423, "mean_token_accuracy": 0.176519912481308, "num_tokens": 23577431.0, "step": 9300 }, { "entropy": 6.2496092319488525, "epoch": 1.0738603577611079, "grad_norm": 0.9609375, "learning_rate": 0.0004896435225807327, "loss": 5.8596, "mean_token_accuracy": 0.1761957362294197, "num_tokens": 23591191.0, "step": 9305 }, { "entropy": 6.230933475494385, "epoch": 1.0744373918061165, "grad_norm": 0.875, "learning_rate": 0.0004896311438664304, "loss": 5.8573, "mean_token_accuracy": 0.18647629022598267, "num_tokens": 23603195.0, "step": 9310 }, { "entropy": 6.254529142379761, "epoch": 1.0750144258511252, "grad_norm": 0.8359375, "learning_rate": 0.0004896187579331163, "loss": 5.9028, "mean_token_accuracy": 0.1798198029398918, "num_tokens": 23615278.0, "step": 9315 }, { "entropy": 6.273842239379883, "epoch": 1.0755914598961338, "grad_norm": 0.84375, "learning_rate": 0.0004896063647812068, "loss": 5.9939, "mean_token_accuracy": 0.1774792715907097, "num_tokens": 23627311.0, "step": 9320 }, { "entropy": 6.239826726913452, "epoch": 1.0761684939411424, "grad_norm": 0.8828125, "learning_rate": 0.0004895939644111189, "loss": 5.9215, "mean_token_accuracy": 0.18126792460680008, "num_tokens": 23640338.0, "step": 9325 }, { "entropy": 6.3032557487487795, "epoch": 1.076745527986151, "grad_norm": 0.79296875, "learning_rate": 0.0004895815568232694, "loss": 6.0196, "mean_token_accuracy": 0.17663963586091996, "num_tokens": 23654541.0, "step": 9330 }, { "entropy": 6.281169319152832, "epoch": 1.07732256203116, "grad_norm": 0.86328125, "learning_rate": 0.0004895691420180759, "loss": 5.9846, "mean_token_accuracy": 0.1778423696756363, "num_tokens": 23666837.0, "step": 9335 }, { "entropy": 6.35228910446167, "epoch": 1.0778995960761686, "grad_norm": 0.87890625, "learning_rate": 0.000489556719995956, "loss": 5.97, "mean_token_accuracy": 0.1766431748867035, "num_tokens": 23679270.0, "step": 9340 }, { "entropy": 6.268666172027588, "epoch": 1.0784766301211772, "grad_norm": 0.859375, "learning_rate": 0.0004895442907573274, "loss": 5.9574, "mean_token_accuracy": 0.178663232922554, "num_tokens": 23691640.0, "step": 9345 }, { "entropy": 6.240317010879517, "epoch": 1.0790536641661859, "grad_norm": 0.796875, "learning_rate": 0.000489531854302608, "loss": 5.9613, "mean_token_accuracy": 0.17662242352962493, "num_tokens": 23704545.0, "step": 9350 }, { "entropy": 6.238865852355957, "epoch": 1.0796306982111945, "grad_norm": 0.875, "learning_rate": 0.0004895194106322164, "loss": 5.9033, "mean_token_accuracy": 0.1860482156276703, "num_tokens": 23716319.0, "step": 9355 }, { "entropy": 6.265583896636963, "epoch": 1.0802077322562031, "grad_norm": 0.90625, "learning_rate": 0.0004895069597465709, "loss": 5.9715, "mean_token_accuracy": 0.1786327689886093, "num_tokens": 23728633.0, "step": 9360 }, { "entropy": 6.3230654239654545, "epoch": 1.0807847663012118, "grad_norm": 0.83203125, "learning_rate": 0.0004894945016460904, "loss": 5.9901, "mean_token_accuracy": 0.1795554667711258, "num_tokens": 23741370.0, "step": 9365 }, { "entropy": 6.235442304611206, "epoch": 1.0813618003462204, "grad_norm": 0.90234375, "learning_rate": 0.0004894820363311938, "loss": 5.917, "mean_token_accuracy": 0.185208560526371, "num_tokens": 23754026.0, "step": 9370 }, { "entropy": 6.2940778732299805, "epoch": 1.081938834391229, "grad_norm": 0.828125, "learning_rate": 0.0004894695638023005, "loss": 6.017, "mean_token_accuracy": 0.16951347440481185, "num_tokens": 23766950.0, "step": 9375 }, { "entropy": 6.275958490371704, "epoch": 1.0825158684362377, "grad_norm": 0.859375, "learning_rate": 0.00048945708405983, "loss": 5.9975, "mean_token_accuracy": 0.17893885672092438, "num_tokens": 23780858.0, "step": 9380 }, { "entropy": 6.270656681060791, "epoch": 1.0830929024812463, "grad_norm": 0.79296875, "learning_rate": 0.0004894445971042019, "loss": 5.9415, "mean_token_accuracy": 0.17487251460552217, "num_tokens": 23793213.0, "step": 9385 }, { "entropy": 6.233089923858643, "epoch": 1.083669936526255, "grad_norm": 0.85546875, "learning_rate": 0.0004894321029358364, "loss": 5.9367, "mean_token_accuracy": 0.17659147530794145, "num_tokens": 23804754.0, "step": 9390 }, { "entropy": 6.246839284896851, "epoch": 1.0842469705712636, "grad_norm": 0.859375, "learning_rate": 0.0004894196015551536, "loss": 5.9952, "mean_token_accuracy": 0.17514082789421082, "num_tokens": 23817503.0, "step": 9395 }, { "entropy": 6.269915151596069, "epoch": 1.0848240046162723, "grad_norm": 0.83203125, "learning_rate": 0.000489407092962574, "loss": 5.9739, "mean_token_accuracy": 0.17312580794095994, "num_tokens": 23830263.0, "step": 9400 }, { "entropy": 6.2076012134552006, "epoch": 1.085401038661281, "grad_norm": 0.828125, "learning_rate": 0.0004893945771585183, "loss": 5.8892, "mean_token_accuracy": 0.18111756443977356, "num_tokens": 23843734.0, "step": 9405 }, { "entropy": 6.334919023513794, "epoch": 1.0859780727062898, "grad_norm": 0.84765625, "learning_rate": 0.0004893820541434075, "loss": 5.994, "mean_token_accuracy": 0.1769810661673546, "num_tokens": 23856857.0, "step": 9410 }, { "entropy": 6.277773189544678, "epoch": 1.0865551067512984, "grad_norm": 0.85546875, "learning_rate": 0.0004893695239176629, "loss": 5.8815, "mean_token_accuracy": 0.18349405825138093, "num_tokens": 23869961.0, "step": 9415 }, { "entropy": 6.309881114959717, "epoch": 1.087132140796307, "grad_norm": 0.87109375, "learning_rate": 0.0004893569864817057, "loss": 5.9669, "mean_token_accuracy": 0.17408453524112702, "num_tokens": 23884551.0, "step": 9420 }, { "entropy": 6.270121240615845, "epoch": 1.0877091748413157, "grad_norm": 0.82421875, "learning_rate": 0.0004893444418359579, "loss": 6.0336, "mean_token_accuracy": 0.17170625180006027, "num_tokens": 23897240.0, "step": 9425 }, { "entropy": 6.264082288742065, "epoch": 1.0882862088863243, "grad_norm": 0.7890625, "learning_rate": 0.000489331889980841, "loss": 5.9237, "mean_token_accuracy": 0.17865306586027146, "num_tokens": 23909677.0, "step": 9430 }, { "entropy": 6.2898622989654545, "epoch": 1.088863242931333, "grad_norm": 0.82421875, "learning_rate": 0.0004893193309167778, "loss": 5.9709, "mean_token_accuracy": 0.1740755632519722, "num_tokens": 23921552.0, "step": 9435 }, { "entropy": 6.293569660186767, "epoch": 1.0894402769763416, "grad_norm": 1.0859375, "learning_rate": 0.0004893067646441902, "loss": 5.9893, "mean_token_accuracy": 0.1750696122646332, "num_tokens": 23936315.0, "step": 9440 }, { "entropy": 6.2551616668701175, "epoch": 1.0900173110213502, "grad_norm": 0.8203125, "learning_rate": 0.000489294191163501, "loss": 5.989, "mean_token_accuracy": 0.1700183093547821, "num_tokens": 23948939.0, "step": 9445 }, { "entropy": 6.315537405014038, "epoch": 1.0905943450663589, "grad_norm": 0.84765625, "learning_rate": 0.0004892816104751331, "loss": 5.9714, "mean_token_accuracy": 0.17250317335128784, "num_tokens": 23961657.0, "step": 9450 }, { "entropy": 6.379075288772583, "epoch": 1.0911713791113675, "grad_norm": 0.87890625, "learning_rate": 0.0004892690225795096, "loss": 6.0779, "mean_token_accuracy": 0.16363574415445328, "num_tokens": 23974085.0, "step": 9455 }, { "entropy": 6.226323127746582, "epoch": 1.0917484131563762, "grad_norm": 0.8671875, "learning_rate": 0.0004892564274770542, "loss": 5.8984, "mean_token_accuracy": 0.18159161359071732, "num_tokens": 23987038.0, "step": 9460 }, { "entropy": 6.324076747894287, "epoch": 1.0923254472013848, "grad_norm": 0.87109375, "learning_rate": 0.0004892438251681901, "loss": 5.9539, "mean_token_accuracy": 0.1822775423526764, "num_tokens": 24001051.0, "step": 9465 }, { "entropy": 6.249374294281006, "epoch": 1.0929024812463934, "grad_norm": 0.9453125, "learning_rate": 0.0004892312156533413, "loss": 5.9418, "mean_token_accuracy": 0.17759458720684052, "num_tokens": 24013817.0, "step": 9470 }, { "entropy": 6.213703584671021, "epoch": 1.0934795152914023, "grad_norm": 0.8125, "learning_rate": 0.0004892185989329321, "loss": 5.9026, "mean_token_accuracy": 0.18459791988134383, "num_tokens": 24025810.0, "step": 9475 }, { "entropy": 6.205026483535766, "epoch": 1.094056549336411, "grad_norm": 0.8203125, "learning_rate": 0.0004892059750073868, "loss": 5.8696, "mean_token_accuracy": 0.18799868524074553, "num_tokens": 24039796.0, "step": 9480 }, { "entropy": 6.299359941482544, "epoch": 1.0946335833814196, "grad_norm": 0.90625, "learning_rate": 0.0004891933438771299, "loss": 5.9544, "mean_token_accuracy": 0.18001185804605485, "num_tokens": 24052721.0, "step": 9485 }, { "entropy": 6.223298168182373, "epoch": 1.0952106174264282, "grad_norm": 0.8671875, "learning_rate": 0.0004891807055425862, "loss": 5.8763, "mean_token_accuracy": 0.18155607432127, "num_tokens": 24064515.0, "step": 9490 }, { "entropy": 6.23270058631897, "epoch": 1.0957876514714369, "grad_norm": 0.91015625, "learning_rate": 0.0004891680600041809, "loss": 5.8902, "mean_token_accuracy": 0.18266638964414597, "num_tokens": 24078537.0, "step": 9495 }, { "entropy": 6.345634460449219, "epoch": 1.0963646855164455, "grad_norm": 0.87109375, "learning_rate": 0.0004891554072623392, "loss": 6.0158, "mean_token_accuracy": 0.17161341458559037, "num_tokens": 24092067.0, "step": 9500 }, { "entropy": 6.255663776397705, "epoch": 1.0969417195614541, "grad_norm": 0.765625, "learning_rate": 0.0004891427473174869, "loss": 5.9806, "mean_token_accuracy": 0.17526648789644242, "num_tokens": 24105625.0, "step": 9505 }, { "entropy": 6.310681390762329, "epoch": 1.0975187536064628, "grad_norm": 0.82421875, "learning_rate": 0.0004891300801700496, "loss": 5.9889, "mean_token_accuracy": 0.1670171231031418, "num_tokens": 24119714.0, "step": 9510 }, { "entropy": 6.2422620296478275, "epoch": 1.0980957876514714, "grad_norm": 0.81640625, "learning_rate": 0.0004891174058204534, "loss": 5.9128, "mean_token_accuracy": 0.17377041578292846, "num_tokens": 24132873.0, "step": 9515 }, { "entropy": 6.1889232158660885, "epoch": 1.09867282169648, "grad_norm": 0.86328125, "learning_rate": 0.0004891047242691246, "loss": 5.8912, "mean_token_accuracy": 0.17926355302333832, "num_tokens": 24145550.0, "step": 9520 }, { "entropy": 6.221427726745605, "epoch": 1.0992498557414887, "grad_norm": 0.93359375, "learning_rate": 0.0004890920355164897, "loss": 5.9078, "mean_token_accuracy": 0.17647993713617324, "num_tokens": 24158232.0, "step": 9525 }, { "entropy": 6.305940246582031, "epoch": 1.0998268897864973, "grad_norm": 0.8125, "learning_rate": 0.0004890793395629756, "loss": 6.049, "mean_token_accuracy": 0.16808070093393326, "num_tokens": 24170780.0, "step": 9530 }, { "entropy": 6.220670223236084, "epoch": 1.100403923831506, "grad_norm": 0.8828125, "learning_rate": 0.0004890666364090093, "loss": 5.9178, "mean_token_accuracy": 0.18042859733104705, "num_tokens": 24182347.0, "step": 9535 }, { "entropy": 6.292816114425659, "epoch": 1.1009809578765146, "grad_norm": 0.80859375, "learning_rate": 0.0004890539260550181, "loss": 6.0075, "mean_token_accuracy": 0.1743740364909172, "num_tokens": 24195215.0, "step": 9540 }, { "entropy": 6.28514461517334, "epoch": 1.1015579919215233, "grad_norm": 0.890625, "learning_rate": 0.0004890412085014292, "loss": 5.9182, "mean_token_accuracy": 0.18192071616649627, "num_tokens": 24208214.0, "step": 9545 }, { "entropy": 6.272170162200927, "epoch": 1.1021350259665321, "grad_norm": 0.8359375, "learning_rate": 0.0004890284837486706, "loss": 5.9363, "mean_token_accuracy": 0.17845190614461898, "num_tokens": 24220883.0, "step": 9550 }, { "entropy": 6.224795198440551, "epoch": 1.1027120600115408, "grad_norm": 0.8671875, "learning_rate": 0.0004890157517971704, "loss": 5.8637, "mean_token_accuracy": 0.18637510240077973, "num_tokens": 24233918.0, "step": 9555 }, { "entropy": 6.2827919006347654, "epoch": 1.1032890940565494, "grad_norm": 0.82421875, "learning_rate": 0.0004890030126473566, "loss": 6.0017, "mean_token_accuracy": 0.17295387089252473, "num_tokens": 24247307.0, "step": 9560 }, { "entropy": 6.262751674652099, "epoch": 1.103866128101558, "grad_norm": 1.1015625, "learning_rate": 0.0004889902662996578, "loss": 5.8885, "mean_token_accuracy": 0.18006763756275176, "num_tokens": 24260149.0, "step": 9565 }, { "entropy": 6.2460860252380375, "epoch": 1.1044431621465667, "grad_norm": 0.83984375, "learning_rate": 0.0004889775127545027, "loss": 5.9753, "mean_token_accuracy": 0.17819419503211975, "num_tokens": 24273675.0, "step": 9570 }, { "entropy": 6.273380994796753, "epoch": 1.1050201961915753, "grad_norm": 0.8828125, "learning_rate": 0.0004889647520123202, "loss": 5.8817, "mean_token_accuracy": 0.18066975921392442, "num_tokens": 24285575.0, "step": 9575 }, { "entropy": 6.266949462890625, "epoch": 1.105597230236584, "grad_norm": 1.984375, "learning_rate": 0.0004889519840735396, "loss": 5.9146, "mean_token_accuracy": 0.19424535930156708, "num_tokens": 24297908.0, "step": 9580 }, { "entropy": 6.182698535919189, "epoch": 1.1061742642815926, "grad_norm": 0.83203125, "learning_rate": 0.0004889392089385903, "loss": 5.8977, "mean_token_accuracy": 0.18063640892505645, "num_tokens": 24310714.0, "step": 9585 }, { "entropy": 6.233695125579834, "epoch": 1.1067512983266012, "grad_norm": 0.8984375, "learning_rate": 0.0004889264266079019, "loss": 5.9384, "mean_token_accuracy": 0.18608282655477523, "num_tokens": 24322367.0, "step": 9590 }, { "entropy": 6.27492094039917, "epoch": 1.1073283323716099, "grad_norm": 0.94140625, "learning_rate": 0.0004889136370819045, "loss": 5.9241, "mean_token_accuracy": 0.17917955815792083, "num_tokens": 24334256.0, "step": 9595 }, { "entropy": 6.238777923583984, "epoch": 1.1079053664166185, "grad_norm": 0.87109375, "learning_rate": 0.0004889008403610281, "loss": 5.9273, "mean_token_accuracy": 0.18196589946746827, "num_tokens": 24346968.0, "step": 9600 }, { "entropy": 6.318524122238159, "epoch": 1.1084824004616272, "grad_norm": 0.8828125, "learning_rate": 0.0004888880364457033, "loss": 5.9858, "mean_token_accuracy": 0.18197154253721237, "num_tokens": 24360468.0, "step": 9605 }, { "entropy": 6.250274705886841, "epoch": 1.1090594345066358, "grad_norm": 0.88671875, "learning_rate": 0.0004888752253363604, "loss": 5.9434, "mean_token_accuracy": 0.1844514176249504, "num_tokens": 24372330.0, "step": 9610 }, { "entropy": 6.191738557815552, "epoch": 1.1096364685516447, "grad_norm": 0.83203125, "learning_rate": 0.0004888624070334308, "loss": 5.9206, "mean_token_accuracy": 0.17861685305833816, "num_tokens": 24384864.0, "step": 9615 }, { "entropy": 6.206880760192871, "epoch": 1.1102135025966533, "grad_norm": 0.8359375, "learning_rate": 0.0004888495815373452, "loss": 5.8315, "mean_token_accuracy": 0.18677129745483398, "num_tokens": 24397408.0, "step": 9620 }, { "entropy": 6.244317722320557, "epoch": 1.110790536641662, "grad_norm": 0.921875, "learning_rate": 0.0004888367488485351, "loss": 5.8915, "mean_token_accuracy": 0.18083362877368928, "num_tokens": 24409113.0, "step": 9625 }, { "entropy": 6.221122789382934, "epoch": 1.1113675706866706, "grad_norm": 0.859375, "learning_rate": 0.0004888239089674323, "loss": 5.8999, "mean_token_accuracy": 0.17989745289087294, "num_tokens": 24420818.0, "step": 9630 }, { "entropy": 6.320473575592041, "epoch": 1.1119446047316792, "grad_norm": 0.8125, "learning_rate": 0.0004888110618944686, "loss": 6.0477, "mean_token_accuracy": 0.16832794100046158, "num_tokens": 24434452.0, "step": 9635 }, { "entropy": 6.317052507400513, "epoch": 1.1125216387766879, "grad_norm": 0.82421875, "learning_rate": 0.0004887982076300759, "loss": 6.018, "mean_token_accuracy": 0.17300770580768585, "num_tokens": 24448674.0, "step": 9640 }, { "entropy": 6.278442859649658, "epoch": 1.1130986728216965, "grad_norm": 0.828125, "learning_rate": 0.0004887853461746867, "loss": 5.9311, "mean_token_accuracy": 0.17755277156829835, "num_tokens": 24461388.0, "step": 9645 }, { "entropy": 6.260433673858643, "epoch": 1.1136757068667051, "grad_norm": 0.83203125, "learning_rate": 0.0004887724775287336, "loss": 5.8879, "mean_token_accuracy": 0.18106852620840072, "num_tokens": 24474304.0, "step": 9650 }, { "entropy": 6.193238162994385, "epoch": 1.1142527409117138, "grad_norm": 0.7890625, "learning_rate": 0.0004887596016926494, "loss": 5.8876, "mean_token_accuracy": 0.1843292832374573, "num_tokens": 24487175.0, "step": 9655 }, { "entropy": 6.247819232940674, "epoch": 1.1148297749567224, "grad_norm": 0.86328125, "learning_rate": 0.0004887467186668673, "loss": 5.9165, "mean_token_accuracy": 0.17582756131887436, "num_tokens": 24500160.0, "step": 9660 }, { "entropy": 6.303691053390503, "epoch": 1.115406809001731, "grad_norm": 0.94140625, "learning_rate": 0.0004887338284518204, "loss": 6.0161, "mean_token_accuracy": 0.17239674627780915, "num_tokens": 24513358.0, "step": 9665 }, { "entropy": 6.237333631515503, "epoch": 1.1159838430467397, "grad_norm": 0.91015625, "learning_rate": 0.0004887209310479423, "loss": 5.9054, "mean_token_accuracy": 0.18612945675849915, "num_tokens": 24526254.0, "step": 9670 }, { "entropy": 6.213815975189209, "epoch": 1.1165608770917483, "grad_norm": 0.8359375, "learning_rate": 0.0004887080264556668, "loss": 5.8248, "mean_token_accuracy": 0.18724657446146012, "num_tokens": 24540023.0, "step": 9675 }, { "entropy": 6.252214860916138, "epoch": 1.117137911136757, "grad_norm": 0.90234375, "learning_rate": 0.0004886951146754282, "loss": 5.9475, "mean_token_accuracy": 0.17748111933469773, "num_tokens": 24553270.0, "step": 9680 }, { "entropy": 6.2683617115020756, "epoch": 1.1177149451817656, "grad_norm": 0.8046875, "learning_rate": 0.0004886821957076603, "loss": 5.9217, "mean_token_accuracy": 0.181137290596962, "num_tokens": 24565576.0, "step": 9685 }, { "entropy": 6.23697943687439, "epoch": 1.1182919792267745, "grad_norm": 0.859375, "learning_rate": 0.000488669269552798, "loss": 6.0058, "mean_token_accuracy": 0.17781507223844528, "num_tokens": 24578825.0, "step": 9690 }, { "entropy": 6.2838945388793945, "epoch": 1.1188690132717831, "grad_norm": 0.84375, "learning_rate": 0.000488656336211276, "loss": 6.0018, "mean_token_accuracy": 0.17679450809955596, "num_tokens": 24592058.0, "step": 9695 }, { "entropy": 6.310996246337891, "epoch": 1.1194460473167918, "grad_norm": 0.83203125, "learning_rate": 0.0004886433956835292, "loss": 5.8804, "mean_token_accuracy": 0.18037169873714448, "num_tokens": 24605956.0, "step": 9700 }, { "entropy": 6.2612090587615965, "epoch": 1.1200230813618004, "grad_norm": 0.87890625, "learning_rate": 0.0004886304479699929, "loss": 5.9197, "mean_token_accuracy": 0.18407063484191893, "num_tokens": 24618904.0, "step": 9705 }, { "entropy": 6.2928119659423825, "epoch": 1.120600115406809, "grad_norm": 0.91796875, "learning_rate": 0.0004886174930711027, "loss": 6.0456, "mean_token_accuracy": 0.17686478793621063, "num_tokens": 24632720.0, "step": 9710 }, { "entropy": 6.260981178283691, "epoch": 1.1211771494518177, "grad_norm": 0.89453125, "learning_rate": 0.0004886045309872941, "loss": 5.9979, "mean_token_accuracy": 0.17472656220197677, "num_tokens": 24644863.0, "step": 9715 }, { "entropy": 6.306377601623535, "epoch": 1.1217541834968263, "grad_norm": 0.8984375, "learning_rate": 0.0004885915617190034, "loss": 5.9805, "mean_token_accuracy": 0.17594851553440094, "num_tokens": 24656884.0, "step": 9720 }, { "entropy": 6.281054592132568, "epoch": 1.122331217541835, "grad_norm": 0.95703125, "learning_rate": 0.0004885785852666664, "loss": 5.9456, "mean_token_accuracy": 0.17910037338733673, "num_tokens": 24671008.0, "step": 9725 }, { "entropy": 6.2424633502960205, "epoch": 1.1229082515868436, "grad_norm": 0.82421875, "learning_rate": 0.0004885656016307199, "loss": 5.9427, "mean_token_accuracy": 0.17576711028814315, "num_tokens": 24685787.0, "step": 9730 }, { "entropy": 6.344523096084595, "epoch": 1.1234852856318522, "grad_norm": 0.91796875, "learning_rate": 0.0004885526108116004, "loss": 6.0128, "mean_token_accuracy": 0.17457142174243928, "num_tokens": 24697233.0, "step": 9735 }, { "entropy": 6.26629490852356, "epoch": 1.1240623196768609, "grad_norm": 0.91015625, "learning_rate": 0.000488539612809745, "loss": 5.9203, "mean_token_accuracy": 0.18147749304771424, "num_tokens": 24709409.0, "step": 9740 }, { "entropy": 6.288652181625366, "epoch": 1.1246393537218695, "grad_norm": 0.8515625, "learning_rate": 0.0004885266076255907, "loss": 5.9991, "mean_token_accuracy": 0.17411095947027205, "num_tokens": 24722006.0, "step": 9745 }, { "entropy": 6.341065502166748, "epoch": 1.1252163877668782, "grad_norm": 0.90234375, "learning_rate": 0.000488513595259575, "loss": 5.9978, "mean_token_accuracy": 0.16869597434997557, "num_tokens": 24736060.0, "step": 9750 }, { "entropy": 6.306094789505005, "epoch": 1.125793421811887, "grad_norm": 0.84375, "learning_rate": 0.0004885005757121357, "loss": 5.9776, "mean_token_accuracy": 0.17298872172832488, "num_tokens": 24748008.0, "step": 9755 }, { "entropy": 6.277267408370972, "epoch": 1.1263704558568954, "grad_norm": 0.87109375, "learning_rate": 0.0004884875489837105, "loss": 5.9418, "mean_token_accuracy": 0.1754933163523674, "num_tokens": 24760631.0, "step": 9760 }, { "entropy": 6.109272480010986, "epoch": 1.1269474899019043, "grad_norm": 0.8515625, "learning_rate": 0.0004884745150747378, "loss": 5.8061, "mean_token_accuracy": 0.1959839642047882, "num_tokens": 24772646.0, "step": 9765 }, { "entropy": 6.2138436794281, "epoch": 1.127524523946913, "grad_norm": 0.91015625, "learning_rate": 0.0004884614739856556, "loss": 5.9671, "mean_token_accuracy": 0.17570037841796876, "num_tokens": 24784571.0, "step": 9770 }, { "entropy": 6.336449003219604, "epoch": 1.1281015579919216, "grad_norm": 0.86328125, "learning_rate": 0.0004884484257169028, "loss": 5.9631, "mean_token_accuracy": 0.17928054183721542, "num_tokens": 24797810.0, "step": 9775 }, { "entropy": 6.231250190734864, "epoch": 1.1286785920369302, "grad_norm": 0.8984375, "learning_rate": 0.0004884353702689183, "loss": 5.92, "mean_token_accuracy": 0.17948038578033448, "num_tokens": 24810677.0, "step": 9780 }, { "entropy": 6.246661615371704, "epoch": 1.1292556260819389, "grad_norm": 0.88671875, "learning_rate": 0.0004884223076421411, "loss": 5.8837, "mean_token_accuracy": 0.1834596186876297, "num_tokens": 24823138.0, "step": 9785 }, { "entropy": 6.161348485946656, "epoch": 1.1298326601269475, "grad_norm": 0.8203125, "learning_rate": 0.0004884092378370106, "loss": 5.8994, "mean_token_accuracy": 0.19012928754091263, "num_tokens": 24834548.0, "step": 9790 }, { "entropy": 6.260898113250732, "epoch": 1.1304096941719561, "grad_norm": 0.9296875, "learning_rate": 0.0004883961608539664, "loss": 5.9793, "mean_token_accuracy": 0.1769823431968689, "num_tokens": 24847326.0, "step": 9795 }, { "entropy": 6.243139791488647, "epoch": 1.1309867282169648, "grad_norm": 0.97265625, "learning_rate": 0.0004883830766934484, "loss": 5.7928, "mean_token_accuracy": 0.1948003813624382, "num_tokens": 24860417.0, "step": 9800 }, { "entropy": 6.203162908554077, "epoch": 1.1315637622619734, "grad_norm": 0.87109375, "learning_rate": 0.0004883699853558965, "loss": 5.9125, "mean_token_accuracy": 0.17804983854293824, "num_tokens": 24872759.0, "step": 9805 }, { "entropy": 6.2547111988067625, "epoch": 1.132140796306982, "grad_norm": 0.88671875, "learning_rate": 0.0004883568868417511, "loss": 5.8794, "mean_token_accuracy": 0.17914481908082963, "num_tokens": 24885278.0, "step": 9810 }, { "entropy": 6.285055685043335, "epoch": 1.1327178303519907, "grad_norm": 0.8125, "learning_rate": 0.0004883437811514528, "loss": 6.0068, "mean_token_accuracy": 0.1728021264076233, "num_tokens": 24898596.0, "step": 9815 }, { "entropy": 6.273211240768433, "epoch": 1.1332948643969993, "grad_norm": 0.76171875, "learning_rate": 0.0004883306682854424, "loss": 5.931, "mean_token_accuracy": 0.18046294897794724, "num_tokens": 24911755.0, "step": 9820 }, { "entropy": 6.307237911224365, "epoch": 1.133871898442008, "grad_norm": 0.87109375, "learning_rate": 0.0004883175482441611, "loss": 5.9945, "mean_token_accuracy": 0.17272798269987105, "num_tokens": 24925197.0, "step": 9825 }, { "entropy": 6.180803823471069, "epoch": 1.1344489324870168, "grad_norm": 0.85546875, "learning_rate": 0.0004883044210280499, "loss": 5.8241, "mean_token_accuracy": 0.18567555099725724, "num_tokens": 24938204.0, "step": 9830 }, { "entropy": 6.20053653717041, "epoch": 1.1350259665320255, "grad_norm": 0.9453125, "learning_rate": 0.0004882912866375505, "loss": 5.9601, "mean_token_accuracy": 0.18451820313930511, "num_tokens": 24949382.0, "step": 9835 }, { "entropy": 6.2447374820709225, "epoch": 1.1356030005770341, "grad_norm": 0.87109375, "learning_rate": 0.00048827814507310455, "loss": 5.9229, "mean_token_accuracy": 0.17463673502206803, "num_tokens": 24961685.0, "step": 9840 }, { "entropy": 6.234250545501709, "epoch": 1.1361800346220428, "grad_norm": 0.93359375, "learning_rate": 0.00048826499633515416, "loss": 5.9051, "mean_token_accuracy": 0.18329232782125474, "num_tokens": 24973619.0, "step": 9845 }, { "entropy": 6.21411657333374, "epoch": 1.1367570686670514, "grad_norm": 0.93359375, "learning_rate": 0.00048825184042414156, "loss": 5.9044, "mean_token_accuracy": 0.18802542388439178, "num_tokens": 24985156.0, "step": 9850 }, { "entropy": 6.160888385772705, "epoch": 1.13733410271206, "grad_norm": 0.90234375, "learning_rate": 0.0004882386773405092, "loss": 5.9201, "mean_token_accuracy": 0.1874276265501976, "num_tokens": 24997891.0, "step": 9855 }, { "entropy": 6.3374419689178465, "epoch": 1.1379111367570687, "grad_norm": 0.89453125, "learning_rate": 0.0004882255070846999, "loss": 5.9334, "mean_token_accuracy": 0.17814454138278962, "num_tokens": 25009824.0, "step": 9860 }, { "entropy": 6.28568754196167, "epoch": 1.1384881708020773, "grad_norm": 0.84765625, "learning_rate": 0.00048821232965715663, "loss": 5.9641, "mean_token_accuracy": 0.17603467255830765, "num_tokens": 25021574.0, "step": 9865 }, { "entropy": 6.247843408584595, "epoch": 1.139065204847086, "grad_norm": 0.8828125, "learning_rate": 0.0004881991450583225, "loss": 5.8774, "mean_token_accuracy": 0.18148830235004426, "num_tokens": 25033315.0, "step": 9870 }, { "entropy": 6.207533264160157, "epoch": 1.1396422388920946, "grad_norm": 0.9453125, "learning_rate": 0.000488185953288641, "loss": 5.9337, "mean_token_accuracy": 0.1857161581516266, "num_tokens": 25046284.0, "step": 9875 }, { "entropy": 6.271518850326538, "epoch": 1.1402192729371032, "grad_norm": 0.8203125, "learning_rate": 0.0004881727543485559, "loss": 5.9082, "mean_token_accuracy": 0.18233485966920854, "num_tokens": 25058484.0, "step": 9880 }, { "entropy": 6.22105860710144, "epoch": 1.1407963069821119, "grad_norm": 0.90234375, "learning_rate": 0.00048815954823851107, "loss": 5.8425, "mean_token_accuracy": 0.18622921258211136, "num_tokens": 25070555.0, "step": 9885 }, { "entropy": 6.322746706008911, "epoch": 1.1413733410271205, "grad_norm": 0.86328125, "learning_rate": 0.00048814633495895067, "loss": 6.0142, "mean_token_accuracy": 0.17440420240163804, "num_tokens": 25083492.0, "step": 9890 }, { "entropy": 6.308733797073364, "epoch": 1.1419503750721294, "grad_norm": 0.86328125, "learning_rate": 0.0004881331145103192, "loss": 5.9921, "mean_token_accuracy": 0.17199164181947707, "num_tokens": 25096332.0, "step": 9895 }, { "entropy": 6.276531744003296, "epoch": 1.1425274091171378, "grad_norm": 1.15625, "learning_rate": 0.0004881198868930614, "loss": 5.896, "mean_token_accuracy": 0.17704352885484695, "num_tokens": 25110447.0, "step": 9900 }, { "entropy": 6.309626197814941, "epoch": 1.1431044431621467, "grad_norm": 0.8828125, "learning_rate": 0.00048810665210762195, "loss": 5.9725, "mean_token_accuracy": 0.17967149913311004, "num_tokens": 25123852.0, "step": 9905 }, { "entropy": 6.262395286560059, "epoch": 1.1436814772071553, "grad_norm": 0.80078125, "learning_rate": 0.00048809341015444615, "loss": 5.9666, "mean_token_accuracy": 0.1768372818827629, "num_tokens": 25136151.0, "step": 9910 }, { "entropy": 6.243071460723877, "epoch": 1.144258511252164, "grad_norm": 0.90625, "learning_rate": 0.00048808016103397934, "loss": 5.9179, "mean_token_accuracy": 0.1830576628446579, "num_tokens": 25149642.0, "step": 9915 }, { "entropy": 6.218459749221802, "epoch": 1.1448355452971726, "grad_norm": 0.8359375, "learning_rate": 0.0004880669047466671, "loss": 5.8823, "mean_token_accuracy": 0.18505503088235856, "num_tokens": 25162022.0, "step": 9920 }, { "entropy": 6.280695390701294, "epoch": 1.1454125793421812, "grad_norm": 0.87890625, "learning_rate": 0.00048805364129295554, "loss": 6.0116, "mean_token_accuracy": 0.17475848346948625, "num_tokens": 25175404.0, "step": 9925 }, { "entropy": 6.253636407852173, "epoch": 1.1459896133871899, "grad_norm": 0.79296875, "learning_rate": 0.00048804037067329037, "loss": 5.8558, "mean_token_accuracy": 0.18484980762004852, "num_tokens": 25188148.0, "step": 9930 }, { "entropy": 6.230699157714843, "epoch": 1.1465666474321985, "grad_norm": 0.83984375, "learning_rate": 0.0004880270928881183, "loss": 5.9347, "mean_token_accuracy": 0.18091728538274765, "num_tokens": 25199960.0, "step": 9935 }, { "entropy": 6.191056203842163, "epoch": 1.1471436814772071, "grad_norm": 0.9609375, "learning_rate": 0.0004880138079378857, "loss": 5.8846, "mean_token_accuracy": 0.17917097955942154, "num_tokens": 25211054.0, "step": 9940 }, { "entropy": 6.249275350570679, "epoch": 1.1477207155222158, "grad_norm": 0.87890625, "learning_rate": 0.0004880005158230395, "loss": 5.8641, "mean_token_accuracy": 0.1871132269501686, "num_tokens": 25222553.0, "step": 9945 }, { "entropy": 6.205245733261108, "epoch": 1.1482977495672244, "grad_norm": 0.87109375, "learning_rate": 0.0004879872165440268, "loss": 5.9152, "mean_token_accuracy": 0.1780821532011032, "num_tokens": 25235472.0, "step": 9950 }, { "entropy": 6.222427892684936, "epoch": 1.148874783612233, "grad_norm": 0.76171875, "learning_rate": 0.0004879739101012948, "loss": 5.9795, "mean_token_accuracy": 0.17801414877176286, "num_tokens": 25250209.0, "step": 9955 }, { "entropy": 6.301009178161621, "epoch": 1.1494518176572417, "grad_norm": 0.90625, "learning_rate": 0.0004879605964952911, "loss": 6.0067, "mean_token_accuracy": 0.17522571235895157, "num_tokens": 25262064.0, "step": 9960 }, { "entropy": 6.322479486465454, "epoch": 1.1500288517022503, "grad_norm": 0.8515625, "learning_rate": 0.00048794727572646366, "loss": 5.9427, "mean_token_accuracy": 0.17829561233520508, "num_tokens": 25274833.0, "step": 9965 }, { "entropy": 6.252580785751343, "epoch": 1.1506058857472592, "grad_norm": 0.8984375, "learning_rate": 0.0004879339477952603, "loss": 5.9259, "mean_token_accuracy": 0.1844586282968521, "num_tokens": 25288397.0, "step": 9970 }, { "entropy": 6.206064081192016, "epoch": 1.1511829197922678, "grad_norm": 0.93359375, "learning_rate": 0.00048792061270212935, "loss": 5.8926, "mean_token_accuracy": 0.1864775836467743, "num_tokens": 25300887.0, "step": 9975 }, { "entropy": 6.300720739364624, "epoch": 1.1517599538372765, "grad_norm": 0.796875, "learning_rate": 0.0004879072704475193, "loss": 5.9774, "mean_token_accuracy": 0.1777906149625778, "num_tokens": 25314686.0, "step": 9980 }, { "entropy": 6.324214887619019, "epoch": 1.1523369878822851, "grad_norm": 0.88671875, "learning_rate": 0.00048789392103187906, "loss": 6.0028, "mean_token_accuracy": 0.17738907784223557, "num_tokens": 25328253.0, "step": 9985 }, { "entropy": 6.282991886138916, "epoch": 1.1529140219272938, "grad_norm": 0.859375, "learning_rate": 0.0004878805644556575, "loss": 5.9538, "mean_token_accuracy": 0.18188581615686417, "num_tokens": 25340583.0, "step": 9990 }, { "entropy": 6.180060386657715, "epoch": 1.1534910559723024, "grad_norm": 0.91015625, "learning_rate": 0.000487867200719304, "loss": 5.8756, "mean_token_accuracy": 0.18232353776693344, "num_tokens": 25352513.0, "step": 9995 }, { "entropy": 6.269026517868042, "epoch": 1.154068090017311, "grad_norm": 0.85546875, "learning_rate": 0.0004878538298232678, "loss": 5.9893, "mean_token_accuracy": 0.1770420104265213, "num_tokens": 25365044.0, "step": 10000 }, { "entropy": 6.310076713562012, "epoch": 1.1546451240623197, "grad_norm": 0.8671875, "learning_rate": 0.0004878404517679988, "loss": 5.9366, "mean_token_accuracy": 0.17858017683029176, "num_tokens": 25377381.0, "step": 10005 }, { "entropy": 6.238185453414917, "epoch": 1.1552221581073283, "grad_norm": 0.87109375, "learning_rate": 0.00048782706655394695, "loss": 5.938, "mean_token_accuracy": 0.1837088868021965, "num_tokens": 25390723.0, "step": 10010 }, { "entropy": 6.173210191726684, "epoch": 1.155799192152337, "grad_norm": 0.859375, "learning_rate": 0.0004878136741815624, "loss": 5.8564, "mean_token_accuracy": 0.1824432611465454, "num_tokens": 25403501.0, "step": 10015 }, { "entropy": 6.213417387008667, "epoch": 1.1563762261973456, "grad_norm": 0.9140625, "learning_rate": 0.0004878002746512956, "loss": 5.8816, "mean_token_accuracy": 0.18476981669664383, "num_tokens": 25415565.0, "step": 10020 }, { "entropy": 6.226587963104248, "epoch": 1.1569532602423542, "grad_norm": 0.88671875, "learning_rate": 0.0004877868679635974, "loss": 5.9289, "mean_token_accuracy": 0.18405697494745255, "num_tokens": 25428261.0, "step": 10025 }, { "entropy": 6.28510012626648, "epoch": 1.1575302942873629, "grad_norm": 0.95703125, "learning_rate": 0.0004877734541189185, "loss": 5.9355, "mean_token_accuracy": 0.17490267604589463, "num_tokens": 25439758.0, "step": 10030 }, { "entropy": 6.253132295608521, "epoch": 1.1581073283323717, "grad_norm": 0.8359375, "learning_rate": 0.00048776003311771013, "loss": 5.9766, "mean_token_accuracy": 0.1719038173556328, "num_tokens": 25452162.0, "step": 10035 }, { "entropy": 6.34536337852478, "epoch": 1.1586843623773802, "grad_norm": 0.8828125, "learning_rate": 0.0004877466049604238, "loss": 6.0224, "mean_token_accuracy": 0.17633402347564697, "num_tokens": 25463741.0, "step": 10040 }, { "entropy": 6.273688936233521, "epoch": 1.159261396422389, "grad_norm": 0.8125, "learning_rate": 0.00048773316964751106, "loss": 5.9607, "mean_token_accuracy": 0.17500015050172807, "num_tokens": 25476466.0, "step": 10045 }, { "entropy": 6.3328968524932865, "epoch": 1.1598384304673977, "grad_norm": 0.78125, "learning_rate": 0.0004877197271794239, "loss": 5.948, "mean_token_accuracy": 0.1761259838938713, "num_tokens": 25488453.0, "step": 10050 }, { "entropy": 6.298605442047119, "epoch": 1.1604154645124063, "grad_norm": 0.8359375, "learning_rate": 0.0004877062775566142, "loss": 5.9443, "mean_token_accuracy": 0.17435207664966584, "num_tokens": 25501803.0, "step": 10055 }, { "entropy": 6.273298692703247, "epoch": 1.160992498557415, "grad_norm": 0.78125, "learning_rate": 0.00048769282077953464, "loss": 6.0359, "mean_token_accuracy": 0.17547617107629776, "num_tokens": 25515844.0, "step": 10060 }, { "entropy": 6.312673854827881, "epoch": 1.1615695326024236, "grad_norm": 0.87890625, "learning_rate": 0.00048767935684863775, "loss": 5.9276, "mean_token_accuracy": 0.18142150789499284, "num_tokens": 25528529.0, "step": 10065 }, { "entropy": 6.302729988098145, "epoch": 1.1621465666474322, "grad_norm": 0.86328125, "learning_rate": 0.0004876658857643762, "loss": 5.9732, "mean_token_accuracy": 0.17344674915075303, "num_tokens": 25540110.0, "step": 10070 }, { "entropy": 6.254207420349121, "epoch": 1.1627236006924409, "grad_norm": 0.86328125, "learning_rate": 0.0004876524075272034, "loss": 5.9334, "mean_token_accuracy": 0.17588380724191666, "num_tokens": 25553332.0, "step": 10075 }, { "entropy": 6.286834716796875, "epoch": 1.1633006347374495, "grad_norm": 0.87890625, "learning_rate": 0.00048763892213757234, "loss": 5.9005, "mean_token_accuracy": 0.17941419333219527, "num_tokens": 25565852.0, "step": 10080 }, { "entropy": 6.242973041534424, "epoch": 1.1638776687824581, "grad_norm": 0.8046875, "learning_rate": 0.00048762542959593683, "loss": 5.9185, "mean_token_accuracy": 0.18208333104848862, "num_tokens": 25579642.0, "step": 10085 }, { "entropy": 6.223715496063233, "epoch": 1.1644547028274668, "grad_norm": 0.8984375, "learning_rate": 0.0004876119299027506, "loss": 5.9185, "mean_token_accuracy": 0.18511994779109955, "num_tokens": 25591452.0, "step": 10090 }, { "entropy": 6.221129322052002, "epoch": 1.1650317368724754, "grad_norm": 0.8359375, "learning_rate": 0.00048759842305846766, "loss": 5.8732, "mean_token_accuracy": 0.17986828535795213, "num_tokens": 25603426.0, "step": 10095 }, { "entropy": 6.264230966567993, "epoch": 1.165608770917484, "grad_norm": 0.875, "learning_rate": 0.0004875849090635425, "loss": 5.9774, "mean_token_accuracy": 0.17824428528547287, "num_tokens": 25617014.0, "step": 10100 }, { "entropy": 6.293786478042603, "epoch": 1.1661858049624927, "grad_norm": 0.921875, "learning_rate": 0.00048757138791842943, "loss": 5.9394, "mean_token_accuracy": 0.18343609422445298, "num_tokens": 25629916.0, "step": 10105 }, { "entropy": 6.2851982593536375, "epoch": 1.1667628390075016, "grad_norm": 0.84765625, "learning_rate": 0.0004875578596235832, "loss": 5.9229, "mean_token_accuracy": 0.18201591074466705, "num_tokens": 25642301.0, "step": 10110 }, { "entropy": 6.254937362670899, "epoch": 1.1673398730525102, "grad_norm": 0.83203125, "learning_rate": 0.0004875443241794591, "loss": 5.9005, "mean_token_accuracy": 0.18076282739639282, "num_tokens": 25653976.0, "step": 10115 }, { "entropy": 6.266515922546387, "epoch": 1.1679169070975188, "grad_norm": 0.83984375, "learning_rate": 0.00048753078158651227, "loss": 5.9433, "mean_token_accuracy": 0.17355138510465623, "num_tokens": 25666078.0, "step": 10120 }, { "entropy": 6.299070167541504, "epoch": 1.1684939411425275, "grad_norm": 0.90625, "learning_rate": 0.000487517231845198, "loss": 5.9608, "mean_token_accuracy": 0.17447977215051652, "num_tokens": 25679780.0, "step": 10125 }, { "entropy": 6.330364561080932, "epoch": 1.169070975187536, "grad_norm": 0.8125, "learning_rate": 0.0004875036749559724, "loss": 5.921, "mean_token_accuracy": 0.1767667144536972, "num_tokens": 25694179.0, "step": 10130 }, { "entropy": 6.173453760147095, "epoch": 1.1696480092325447, "grad_norm": 0.96484375, "learning_rate": 0.00048749011091929115, "loss": 5.9132, "mean_token_accuracy": 0.18746515810489656, "num_tokens": 25707281.0, "step": 10135 }, { "entropy": 6.262874364852905, "epoch": 1.1702250432775534, "grad_norm": 0.81640625, "learning_rate": 0.0004874765397356105, "loss": 5.9428, "mean_token_accuracy": 0.18233703523874284, "num_tokens": 25719901.0, "step": 10140 }, { "entropy": 6.302816724777221, "epoch": 1.170802077322562, "grad_norm": 0.90234375, "learning_rate": 0.0004874629614053871, "loss": 5.9542, "mean_token_accuracy": 0.18035022020339966, "num_tokens": 25732063.0, "step": 10145 }, { "entropy": 6.217515897750855, "epoch": 1.1713791113675707, "grad_norm": 0.90234375, "learning_rate": 0.0004874493759290775, "loss": 5.9195, "mean_token_accuracy": 0.17959170192480087, "num_tokens": 25743966.0, "step": 10150 }, { "entropy": 6.033494472503662, "epoch": 1.1719561454125793, "grad_norm": 1.1796875, "learning_rate": 0.00048743578330713854, "loss": 5.6624, "mean_token_accuracy": 0.20419865399599074, "num_tokens": 25757053.0, "step": 10155 }, { "entropy": 6.10223126411438, "epoch": 1.172533179457588, "grad_norm": 0.90234375, "learning_rate": 0.0004874221835400277, "loss": 5.7981, "mean_token_accuracy": 0.1875803977251053, "num_tokens": 25769430.0, "step": 10160 }, { "entropy": 6.264477682113648, "epoch": 1.1731102135025966, "grad_norm": 0.90234375, "learning_rate": 0.0004874085766282022, "loss": 5.894, "mean_token_accuracy": 0.18658676594495774, "num_tokens": 25781687.0, "step": 10165 }, { "entropy": 6.178972053527832, "epoch": 1.1736872475476052, "grad_norm": 0.890625, "learning_rate": 0.00048739496257211966, "loss": 5.9109, "mean_token_accuracy": 0.1858760565519333, "num_tokens": 25793646.0, "step": 10170 }, { "entropy": 6.226661348342896, "epoch": 1.1742642815926139, "grad_norm": 0.8671875, "learning_rate": 0.00048738134137223815, "loss": 5.9739, "mean_token_accuracy": 0.1752454936504364, "num_tokens": 25807757.0, "step": 10175 }, { "entropy": 6.282738161087036, "epoch": 1.1748413156376225, "grad_norm": 0.99609375, "learning_rate": 0.00048736771302901566, "loss": 5.9495, "mean_token_accuracy": 0.17936586141586303, "num_tokens": 25820063.0, "step": 10180 }, { "entropy": 6.234112787246704, "epoch": 1.1754183496826314, "grad_norm": 0.84375, "learning_rate": 0.00048735407754291063, "loss": 5.8828, "mean_token_accuracy": 0.18974555730819703, "num_tokens": 25832974.0, "step": 10185 }, { "entropy": 6.292014217376709, "epoch": 1.17599538372764, "grad_norm": 0.87890625, "learning_rate": 0.00048734043491438175, "loss": 5.9219, "mean_token_accuracy": 0.17494470328092576, "num_tokens": 25845939.0, "step": 10190 }, { "entropy": 6.2192240238189695, "epoch": 1.1765724177726486, "grad_norm": 0.87890625, "learning_rate": 0.00048732678514388773, "loss": 5.8873, "mean_token_accuracy": 0.17836469560861587, "num_tokens": 25857480.0, "step": 10195 }, { "entropy": 6.162649917602539, "epoch": 1.1771494518176573, "grad_norm": 0.8828125, "learning_rate": 0.0004873131282318878, "loss": 5.8513, "mean_token_accuracy": 0.18638965040445327, "num_tokens": 25869384.0, "step": 10200 }, { "entropy": 6.183882331848144, "epoch": 1.177726485862666, "grad_norm": 0.89453125, "learning_rate": 0.00048729946417884126, "loss": 5.9408, "mean_token_accuracy": 0.17680127024650574, "num_tokens": 25881705.0, "step": 10205 }, { "entropy": 6.290098524093628, "epoch": 1.1783035199076746, "grad_norm": 0.8671875, "learning_rate": 0.0004872857929852076, "loss": 5.9349, "mean_token_accuracy": 0.1714819997549057, "num_tokens": 25894072.0, "step": 10210 }, { "entropy": 6.232169818878174, "epoch": 1.1788805539526832, "grad_norm": 0.875, "learning_rate": 0.0004872721146514469, "loss": 5.803, "mean_token_accuracy": 0.1882660523056984, "num_tokens": 25907358.0, "step": 10215 }, { "entropy": 6.194604921340942, "epoch": 1.1794575879976918, "grad_norm": 0.8828125, "learning_rate": 0.000487258429178019, "loss": 5.9219, "mean_token_accuracy": 0.18903794139623642, "num_tokens": 25918746.0, "step": 10220 }, { "entropy": 6.2296899318695065, "epoch": 1.1800346220427005, "grad_norm": 0.93359375, "learning_rate": 0.00048724473656538427, "loss": 5.913, "mean_token_accuracy": 0.18672333359718324, "num_tokens": 25930759.0, "step": 10225 }, { "entropy": 6.188735485076904, "epoch": 1.1806116560877091, "grad_norm": 0.8125, "learning_rate": 0.0004872310368140032, "loss": 5.8568, "mean_token_accuracy": 0.18429872691631316, "num_tokens": 25942364.0, "step": 10230 }, { "entropy": 6.206774473190308, "epoch": 1.1811886901327178, "grad_norm": 0.89453125, "learning_rate": 0.0004872173299243368, "loss": 5.8708, "mean_token_accuracy": 0.19336009174585342, "num_tokens": 25954254.0, "step": 10235 }, { "entropy": 6.222011852264404, "epoch": 1.1817657241777264, "grad_norm": 1.3125, "learning_rate": 0.00048720361589684575, "loss": 5.9605, "mean_token_accuracy": 0.18331651240587235, "num_tokens": 25966708.0, "step": 10240 }, { "entropy": 6.236669921875, "epoch": 1.182342758222735, "grad_norm": 0.85546875, "learning_rate": 0.00048718989473199147, "loss": 5.9233, "mean_token_accuracy": 0.17969653010368347, "num_tokens": 25979301.0, "step": 10245 }, { "entropy": 6.237456798553467, "epoch": 1.182919792267744, "grad_norm": 0.890625, "learning_rate": 0.0004871761664302356, "loss": 5.9068, "mean_token_accuracy": 0.18412716388702394, "num_tokens": 25992195.0, "step": 10250 }, { "entropy": 6.177877140045166, "epoch": 1.1834968263127525, "grad_norm": 0.84375, "learning_rate": 0.0004871624309920397, "loss": 5.7765, "mean_token_accuracy": 0.19591953456401826, "num_tokens": 26005078.0, "step": 10255 }, { "entropy": 6.2200273990631105, "epoch": 1.1840738603577612, "grad_norm": 0.94921875, "learning_rate": 0.00048714868841786586, "loss": 5.9096, "mean_token_accuracy": 0.179879729449749, "num_tokens": 26017227.0, "step": 10260 }, { "entropy": 6.244432067871093, "epoch": 1.1846508944027698, "grad_norm": 0.8984375, "learning_rate": 0.00048713493870817626, "loss": 5.9489, "mean_token_accuracy": 0.18269521296024321, "num_tokens": 26030782.0, "step": 10265 }, { "entropy": 6.180662345886231, "epoch": 1.1852279284477785, "grad_norm": 0.86328125, "learning_rate": 0.00048712118186343336, "loss": 5.8563, "mean_token_accuracy": 0.18943388164043426, "num_tokens": 26042327.0, "step": 10270 }, { "entropy": 6.27462363243103, "epoch": 1.185804962492787, "grad_norm": 0.859375, "learning_rate": 0.00048710741788409985, "loss": 5.9541, "mean_token_accuracy": 0.17806721180677415, "num_tokens": 26055298.0, "step": 10275 }, { "entropy": 6.273777961730957, "epoch": 1.1863819965377957, "grad_norm": 0.84765625, "learning_rate": 0.0004870936467706387, "loss": 5.9837, "mean_token_accuracy": 0.17382072806358337, "num_tokens": 26067389.0, "step": 10280 }, { "entropy": 6.225218200683594, "epoch": 1.1869590305828044, "grad_norm": 0.82421875, "learning_rate": 0.0004870798685235131, "loss": 5.8962, "mean_token_accuracy": 0.18277426362037658, "num_tokens": 26080527.0, "step": 10285 }, { "entropy": 6.250852823257446, "epoch": 1.187536064627813, "grad_norm": 0.87890625, "learning_rate": 0.00048706608314318654, "loss": 5.9648, "mean_token_accuracy": 0.17581128627061843, "num_tokens": 26093684.0, "step": 10290 }, { "entropy": 6.270060634613037, "epoch": 1.1881130986728217, "grad_norm": 0.875, "learning_rate": 0.0004870522906301225, "loss": 5.9021, "mean_token_accuracy": 0.1825753018260002, "num_tokens": 26105235.0, "step": 10295 }, { "entropy": 6.226347017288208, "epoch": 1.1886901327178303, "grad_norm": 0.87890625, "learning_rate": 0.000487038490984785, "loss": 5.8919, "mean_token_accuracy": 0.18395963162183762, "num_tokens": 26117542.0, "step": 10300 }, { "entropy": 6.262145042419434, "epoch": 1.189267166762839, "grad_norm": 0.8984375, "learning_rate": 0.00048702468420763826, "loss": 6.0085, "mean_token_accuracy": 0.17625221163034438, "num_tokens": 26130722.0, "step": 10305 }, { "entropy": 6.264938068389893, "epoch": 1.1898442008078476, "grad_norm": 0.81640625, "learning_rate": 0.00048701087029914657, "loss": 5.8314, "mean_token_accuracy": 0.18314649015665055, "num_tokens": 26143420.0, "step": 10310 }, { "entropy": 6.301358938217163, "epoch": 1.1904212348528562, "grad_norm": 0.921875, "learning_rate": 0.0004869970492597745, "loss": 6.0332, "mean_token_accuracy": 0.16742831021547316, "num_tokens": 26156041.0, "step": 10315 }, { "entropy": 6.172136878967285, "epoch": 1.1909982688978649, "grad_norm": 0.9140625, "learning_rate": 0.0004869832210899871, "loss": 5.845, "mean_token_accuracy": 0.18829168230295182, "num_tokens": 26168075.0, "step": 10320 }, { "entropy": 6.214507341384888, "epoch": 1.1915753029428737, "grad_norm": 0.796875, "learning_rate": 0.00048696938579024927, "loss": 5.8632, "mean_token_accuracy": 0.18680178970098496, "num_tokens": 26180285.0, "step": 10325 }, { "entropy": 6.155381202697754, "epoch": 1.1921523369878824, "grad_norm": 0.76953125, "learning_rate": 0.00048695554336102644, "loss": 5.8601, "mean_token_accuracy": 0.18196229487657548, "num_tokens": 26193095.0, "step": 10330 }, { "entropy": 6.198613977432251, "epoch": 1.192729371032891, "grad_norm": 0.89453125, "learning_rate": 0.00048694169380278417, "loss": 5.9061, "mean_token_accuracy": 0.19160285741090774, "num_tokens": 26205477.0, "step": 10335 }, { "entropy": 6.220333862304687, "epoch": 1.1933064050778996, "grad_norm": 0.7890625, "learning_rate": 0.0004869278371159884, "loss": 5.8512, "mean_token_accuracy": 0.18946202248334884, "num_tokens": 26220057.0, "step": 10340 }, { "entropy": 6.298282432556152, "epoch": 1.1938834391229083, "grad_norm": 0.8671875, "learning_rate": 0.00048691397330110503, "loss": 5.9385, "mean_token_accuracy": 0.17706281840801238, "num_tokens": 26232327.0, "step": 10345 }, { "entropy": 6.19044942855835, "epoch": 1.194460473167917, "grad_norm": 0.859375, "learning_rate": 0.0004869001023586005, "loss": 5.8664, "mean_token_accuracy": 0.1862966775894165, "num_tokens": 26245087.0, "step": 10350 }, { "entropy": 6.27628083229065, "epoch": 1.1950375072129256, "grad_norm": 0.90234375, "learning_rate": 0.0004868862242889413, "loss": 5.9464, "mean_token_accuracy": 0.1738221064209938, "num_tokens": 26258041.0, "step": 10355 }, { "entropy": 6.253827428817749, "epoch": 1.1956145412579342, "grad_norm": 0.859375, "learning_rate": 0.000486872339092594, "loss": 5.9329, "mean_token_accuracy": 0.1788163736462593, "num_tokens": 26270443.0, "step": 10360 }, { "entropy": 6.221220397949219, "epoch": 1.1961915753029428, "grad_norm": 0.88671875, "learning_rate": 0.000486858446770026, "loss": 5.8764, "mean_token_accuracy": 0.1764179676771164, "num_tokens": 26282685.0, "step": 10365 }, { "entropy": 6.259880018234253, "epoch": 1.1967686093479515, "grad_norm": 0.80859375, "learning_rate": 0.0004868445473217043, "loss": 5.9615, "mean_token_accuracy": 0.17861454635858537, "num_tokens": 26296003.0, "step": 10370 }, { "entropy": 6.142031145095825, "epoch": 1.1973456433929601, "grad_norm": 0.8515625, "learning_rate": 0.0004868306407480965, "loss": 5.802, "mean_token_accuracy": 0.18455828428268434, "num_tokens": 26309102.0, "step": 10375 }, { "entropy": 6.2524937152862545, "epoch": 1.1979226774379688, "grad_norm": 0.87109375, "learning_rate": 0.00048681672704967036, "loss": 5.9077, "mean_token_accuracy": 0.1821337327361107, "num_tokens": 26321571.0, "step": 10380 }, { "entropy": 6.342026090621948, "epoch": 1.1984997114829774, "grad_norm": 0.8359375, "learning_rate": 0.0004868028062268938, "loss": 5.9821, "mean_token_accuracy": 0.17679037153720856, "num_tokens": 26334761.0, "step": 10385 }, { "entropy": 6.182615852355957, "epoch": 1.1990767455279863, "grad_norm": 0.8671875, "learning_rate": 0.00048678887828023504, "loss": 5.794, "mean_token_accuracy": 0.18676298409700393, "num_tokens": 26348815.0, "step": 10390 }, { "entropy": 6.205089139938354, "epoch": 1.1996537795729947, "grad_norm": 0.8359375, "learning_rate": 0.0004867749432101626, "loss": 5.915, "mean_token_accuracy": 0.17840406000614167, "num_tokens": 26361675.0, "step": 10395 }, { "entropy": 6.274042654037475, "epoch": 1.2002308136180035, "grad_norm": 0.83984375, "learning_rate": 0.0004867610010171451, "loss": 6.0051, "mean_token_accuracy": 0.17303507626056672, "num_tokens": 26375010.0, "step": 10400 }, { "entropy": 6.292940378189087, "epoch": 1.2008078476630122, "grad_norm": 0.9375, "learning_rate": 0.00048674705170165147, "loss": 5.9732, "mean_token_accuracy": 0.17850806564092636, "num_tokens": 26388217.0, "step": 10405 }, { "entropy": 6.195116758346558, "epoch": 1.2013848817080208, "grad_norm": 0.953125, "learning_rate": 0.000486733095264151, "loss": 5.9038, "mean_token_accuracy": 0.1861647993326187, "num_tokens": 26402088.0, "step": 10410 }, { "entropy": 6.1927567481994625, "epoch": 1.2019619157530295, "grad_norm": 0.87109375, "learning_rate": 0.00048671913170511306, "loss": 5.8926, "mean_token_accuracy": 0.1835414081811905, "num_tokens": 26414816.0, "step": 10415 }, { "entropy": 6.251120758056641, "epoch": 1.202538949798038, "grad_norm": 0.83984375, "learning_rate": 0.0004867051610250073, "loss": 5.8567, "mean_token_accuracy": 0.18279548734426498, "num_tokens": 26426345.0, "step": 10420 }, { "entropy": 6.1436532497406, "epoch": 1.2031159838430467, "grad_norm": 0.91015625, "learning_rate": 0.0004866911832243035, "loss": 5.6708, "mean_token_accuracy": 0.19303337335586548, "num_tokens": 26437982.0, "step": 10425 }, { "entropy": 6.1232579231262205, "epoch": 1.2036930178880554, "grad_norm": 0.93359375, "learning_rate": 0.00048667719830347203, "loss": 5.9154, "mean_token_accuracy": 0.17632388174533845, "num_tokens": 26449855.0, "step": 10430 }, { "entropy": 6.299041652679444, "epoch": 1.204270051933064, "grad_norm": 0.89453125, "learning_rate": 0.00048666320626298307, "loss": 5.92, "mean_token_accuracy": 0.18459949046373367, "num_tokens": 26462927.0, "step": 10435 }, { "entropy": 6.25364203453064, "epoch": 1.2048470859780727, "grad_norm": 0.90625, "learning_rate": 0.00048664920710330735, "loss": 5.9653, "mean_token_accuracy": 0.1775884971022606, "num_tokens": 26475022.0, "step": 10440 }, { "entropy": 6.214952230453491, "epoch": 1.2054241200230813, "grad_norm": 0.8828125, "learning_rate": 0.00048663520082491564, "loss": 5.8916, "mean_token_accuracy": 0.18937628716230392, "num_tokens": 26486959.0, "step": 10445 }, { "entropy": 6.240479230880737, "epoch": 1.20600115406809, "grad_norm": 0.8828125, "learning_rate": 0.0004866211874282791, "loss": 5.9576, "mean_token_accuracy": 0.1838987112045288, "num_tokens": 26500345.0, "step": 10450 }, { "entropy": 6.267888355255127, "epoch": 1.2065781881130986, "grad_norm": 0.921875, "learning_rate": 0.000486607166913869, "loss": 5.9311, "mean_token_accuracy": 0.18621276021003724, "num_tokens": 26511625.0, "step": 10455 }, { "entropy": 6.242213773727417, "epoch": 1.2071552221581072, "grad_norm": 0.94140625, "learning_rate": 0.00048659313928215705, "loss": 5.9358, "mean_token_accuracy": 0.1800112694501877, "num_tokens": 26523764.0, "step": 10460 }, { "entropy": 6.233942937850952, "epoch": 1.207732256203116, "grad_norm": 0.9296875, "learning_rate": 0.0004865791045336149, "loss": 5.9028, "mean_token_accuracy": 0.1811545193195343, "num_tokens": 26536925.0, "step": 10465 }, { "entropy": 6.169159698486328, "epoch": 1.2083092902481247, "grad_norm": 0.86328125, "learning_rate": 0.0004865650626687146, "loss": 5.7468, "mean_token_accuracy": 0.19598589539527894, "num_tokens": 26549201.0, "step": 10470 }, { "entropy": 6.203572702407837, "epoch": 1.2088863242931334, "grad_norm": 0.8515625, "learning_rate": 0.00048655101368792866, "loss": 5.9031, "mean_token_accuracy": 0.18499507009983063, "num_tokens": 26561495.0, "step": 10475 }, { "entropy": 6.237302017211914, "epoch": 1.209463358338142, "grad_norm": 0.83203125, "learning_rate": 0.0004865369575917293, "loss": 5.9454, "mean_token_accuracy": 0.17504747658967973, "num_tokens": 26573820.0, "step": 10480 }, { "entropy": 6.256232976913452, "epoch": 1.2100403923831506, "grad_norm": 0.875, "learning_rate": 0.00048652289438058953, "loss": 5.9242, "mean_token_accuracy": 0.18367512822151183, "num_tokens": 26587468.0, "step": 10485 }, { "entropy": 6.191364383697509, "epoch": 1.2106174264281593, "grad_norm": 0.86328125, "learning_rate": 0.00048650882405498226, "loss": 5.9536, "mean_token_accuracy": 0.17529995739459991, "num_tokens": 26599884.0, "step": 10490 }, { "entropy": 6.18445987701416, "epoch": 1.211194460473168, "grad_norm": 0.875, "learning_rate": 0.0004864947466153808, "loss": 5.8633, "mean_token_accuracy": 0.1881292626261711, "num_tokens": 26612501.0, "step": 10495 }, { "entropy": 6.330709075927734, "epoch": 1.2117714945181766, "grad_norm": 0.9375, "learning_rate": 0.0004864806620622585, "loss": 5.8942, "mean_token_accuracy": 0.18237232863903047, "num_tokens": 26624559.0, "step": 10500 }, { "entropy": 6.27984037399292, "epoch": 1.2123485285631852, "grad_norm": 0.89453125, "learning_rate": 0.0004864665703960892, "loss": 5.9248, "mean_token_accuracy": 0.1735801711678505, "num_tokens": 26636903.0, "step": 10505 }, { "entropy": 6.253863048553467, "epoch": 1.2129255626081938, "grad_norm": 0.9296875, "learning_rate": 0.0004864524716173469, "loss": 5.8581, "mean_token_accuracy": 0.18250663876533507, "num_tokens": 26649393.0, "step": 10510 }, { "entropy": 6.182285356521606, "epoch": 1.2135025966532025, "grad_norm": 0.92578125, "learning_rate": 0.0004864383657265058, "loss": 5.8711, "mean_token_accuracy": 0.18657347857952117, "num_tokens": 26661134.0, "step": 10515 }, { "entropy": 6.233286142349243, "epoch": 1.2140796306982111, "grad_norm": 0.8671875, "learning_rate": 0.00048642425272404016, "loss": 5.948, "mean_token_accuracy": 0.17871742993593215, "num_tokens": 26674451.0, "step": 10520 }, { "entropy": 6.293264722824096, "epoch": 1.2146566647432198, "grad_norm": 0.890625, "learning_rate": 0.0004864101326104248, "loss": 5.8934, "mean_token_accuracy": 0.18119763284921647, "num_tokens": 26686382.0, "step": 10525 }, { "entropy": 6.174519824981689, "epoch": 1.2152336987882286, "grad_norm": 0.890625, "learning_rate": 0.0004863960053861348, "loss": 5.8629, "mean_token_accuracy": 0.18694709986448288, "num_tokens": 26698491.0, "step": 10530 }, { "entropy": 6.153842973709106, "epoch": 1.215810732833237, "grad_norm": 0.8515625, "learning_rate": 0.00048638187105164507, "loss": 5.8853, "mean_token_accuracy": 0.18205370157957076, "num_tokens": 26710836.0, "step": 10535 }, { "entropy": 6.2186424255371096, "epoch": 1.216387766878246, "grad_norm": 0.87109375, "learning_rate": 0.0004863677296074311, "loss": 5.8716, "mean_token_accuracy": 0.1870691657066345, "num_tokens": 26723195.0, "step": 10540 }, { "entropy": 6.250338935852051, "epoch": 1.2169648009232545, "grad_norm": 0.94140625, "learning_rate": 0.0004863535810539686, "loss": 5.8641, "mean_token_accuracy": 0.19379239678382873, "num_tokens": 26736048.0, "step": 10545 }, { "entropy": 6.230413436889648, "epoch": 1.2175418349682632, "grad_norm": 0.86328125, "learning_rate": 0.00048633942539173325, "loss": 5.9696, "mean_token_accuracy": 0.1795030802488327, "num_tokens": 26748712.0, "step": 10550 }, { "entropy": 6.303004455566406, "epoch": 1.2181188690132718, "grad_norm": 0.8359375, "learning_rate": 0.00048632526262120144, "loss": 5.9658, "mean_token_accuracy": 0.17351969033479692, "num_tokens": 26760546.0, "step": 10555 }, { "entropy": 6.282928037643432, "epoch": 1.2186959030582805, "grad_norm": 0.82421875, "learning_rate": 0.0004863110927428493, "loss": 5.8626, "mean_token_accuracy": 0.18044263273477554, "num_tokens": 26772792.0, "step": 10560 }, { "entropy": 6.124064779281616, "epoch": 1.219272937103289, "grad_norm": 1.125, "learning_rate": 0.0004862969157571536, "loss": 5.7745, "mean_token_accuracy": 0.194984470307827, "num_tokens": 26785321.0, "step": 10565 }, { "entropy": 6.213613271713257, "epoch": 1.2198499711482977, "grad_norm": 0.875, "learning_rate": 0.00048628273166459105, "loss": 5.818, "mean_token_accuracy": 0.18542979061603546, "num_tokens": 26797481.0, "step": 10570 }, { "entropy": 6.285091686248779, "epoch": 1.2204270051933064, "grad_norm": 0.85546875, "learning_rate": 0.00048626854046563876, "loss": 5.9554, "mean_token_accuracy": 0.18456581830978394, "num_tokens": 26810644.0, "step": 10575 }, { "entropy": 6.297290182113647, "epoch": 1.221004039238315, "grad_norm": 0.8671875, "learning_rate": 0.00048625434216077404, "loss": 5.8977, "mean_token_accuracy": 0.18243593573570252, "num_tokens": 26822545.0, "step": 10580 }, { "entropy": 6.200481605529785, "epoch": 1.2215810732833237, "grad_norm": 0.90234375, "learning_rate": 0.00048624013675047453, "loss": 5.8957, "mean_token_accuracy": 0.18178013414144517, "num_tokens": 26836221.0, "step": 10585 }, { "entropy": 6.284975624084472, "epoch": 1.2221581073283323, "grad_norm": 0.85546875, "learning_rate": 0.00048622592423521783, "loss": 5.9676, "mean_token_accuracy": 0.1788189336657524, "num_tokens": 26848543.0, "step": 10590 }, { "entropy": 6.295896053314209, "epoch": 1.222735141373341, "grad_norm": 0.8984375, "learning_rate": 0.0004862117046154822, "loss": 5.9408, "mean_token_accuracy": 0.18014086037874222, "num_tokens": 26859833.0, "step": 10595 }, { "entropy": 6.240191459655762, "epoch": 1.2233121754183496, "grad_norm": 0.859375, "learning_rate": 0.00048619747789174577, "loss": 5.9005, "mean_token_accuracy": 0.18657582402229309, "num_tokens": 26873450.0, "step": 10600 }, { "entropy": 6.201486682891845, "epoch": 1.2238892094633584, "grad_norm": 0.890625, "learning_rate": 0.0004861832440644871, "loss": 5.8684, "mean_token_accuracy": 0.17937362045049668, "num_tokens": 26886545.0, "step": 10605 }, { "entropy": 6.2080159187316895, "epoch": 1.224466243508367, "grad_norm": 0.97265625, "learning_rate": 0.00048616900313418486, "loss": 5.8221, "mean_token_accuracy": 0.18913633227348328, "num_tokens": 26898394.0, "step": 10610 }, { "entropy": 6.235791397094727, "epoch": 1.2250432775533757, "grad_norm": 0.9296875, "learning_rate": 0.00048615475510131815, "loss": 5.8854, "mean_token_accuracy": 0.18782524019479752, "num_tokens": 26910172.0, "step": 10615 }, { "entropy": 6.1328874111175535, "epoch": 1.2256203115983844, "grad_norm": 0.8359375, "learning_rate": 0.00048614049996636614, "loss": 5.7541, "mean_token_accuracy": 0.19627405554056168, "num_tokens": 26922496.0, "step": 10620 }, { "entropy": 6.186247682571411, "epoch": 1.226197345643393, "grad_norm": 0.8671875, "learning_rate": 0.00048612623772980825, "loss": 5.8499, "mean_token_accuracy": 0.18871124386787413, "num_tokens": 26935264.0, "step": 10625 }, { "entropy": 6.2213846206665036, "epoch": 1.2267743796884016, "grad_norm": 0.875, "learning_rate": 0.00048611196839212426, "loss": 5.8391, "mean_token_accuracy": 0.1925579398870468, "num_tokens": 26949006.0, "step": 10630 }, { "entropy": 6.088655662536621, "epoch": 1.2273514137334103, "grad_norm": 0.9375, "learning_rate": 0.000486097691953794, "loss": 5.7191, "mean_token_accuracy": 0.18999349772930146, "num_tokens": 26961305.0, "step": 10635 }, { "entropy": 6.256745481491089, "epoch": 1.227928447778419, "grad_norm": 0.89453125, "learning_rate": 0.00048608340841529784, "loss": 5.9247, "mean_token_accuracy": 0.17799484431743623, "num_tokens": 26973445.0, "step": 10640 }, { "entropy": 6.2267831325531, "epoch": 1.2285054818234276, "grad_norm": 0.875, "learning_rate": 0.000486069117777116, "loss": 5.8593, "mean_token_accuracy": 0.18302432596683502, "num_tokens": 26986286.0, "step": 10645 }, { "entropy": 6.250400066375732, "epoch": 1.2290825158684362, "grad_norm": 0.8515625, "learning_rate": 0.0004860548200397293, "loss": 5.9002, "mean_token_accuracy": 0.18009741902351378, "num_tokens": 26999281.0, "step": 10650 }, { "entropy": 6.267655229568481, "epoch": 1.2296595499134448, "grad_norm": 0.8359375, "learning_rate": 0.00048604051520361846, "loss": 6.0407, "mean_token_accuracy": 0.17532236725091935, "num_tokens": 27011916.0, "step": 10655 }, { "entropy": 6.297758436203003, "epoch": 1.2302365839584535, "grad_norm": 0.8515625, "learning_rate": 0.00048602620326926484, "loss": 5.9231, "mean_token_accuracy": 0.18180691152811052, "num_tokens": 27024442.0, "step": 10660 }, { "entropy": 6.320510053634644, "epoch": 1.2308136180034621, "grad_norm": 0.8671875, "learning_rate": 0.00048601188423714965, "loss": 6.0015, "mean_token_accuracy": 0.17772735059261321, "num_tokens": 27037978.0, "step": 10665 }, { "entropy": 6.302739143371582, "epoch": 1.231390652048471, "grad_norm": 0.90234375, "learning_rate": 0.0004859975581077545, "loss": 6.0218, "mean_token_accuracy": 0.17019021958112718, "num_tokens": 27049447.0, "step": 10670 }, { "entropy": 6.216468811035156, "epoch": 1.2319676860934794, "grad_norm": 0.88671875, "learning_rate": 0.0004859832248815614, "loss": 5.8897, "mean_token_accuracy": 0.1882360503077507, "num_tokens": 27062961.0, "step": 10675 }, { "entropy": 6.275489568710327, "epoch": 1.2325447201384883, "grad_norm": 0.9140625, "learning_rate": 0.0004859688845590522, "loss": 5.9641, "mean_token_accuracy": 0.17728179842233657, "num_tokens": 27076297.0, "step": 10680 }, { "entropy": 6.293725633621216, "epoch": 1.233121754183497, "grad_norm": 0.92578125, "learning_rate": 0.00048595453714070944, "loss": 5.9957, "mean_token_accuracy": 0.17474785596132278, "num_tokens": 27088496.0, "step": 10685 }, { "entropy": 6.297595357894897, "epoch": 1.2336987882285055, "grad_norm": 0.8515625, "learning_rate": 0.0004859401826270156, "loss": 5.956, "mean_token_accuracy": 0.1806192636489868, "num_tokens": 27100695.0, "step": 10690 }, { "entropy": 6.236401987075806, "epoch": 1.2342758222735142, "grad_norm": 0.84765625, "learning_rate": 0.0004859258210184536, "loss": 5.958, "mean_token_accuracy": 0.18606834709644318, "num_tokens": 27113703.0, "step": 10695 }, { "entropy": 6.303116703033448, "epoch": 1.2348528563185228, "grad_norm": 0.80078125, "learning_rate": 0.00048591145231550623, "loss": 5.949, "mean_token_accuracy": 0.17845748662948607, "num_tokens": 27128669.0, "step": 10700 }, { "entropy": 6.2689940452575685, "epoch": 1.2354298903635315, "grad_norm": 0.90234375, "learning_rate": 0.00048589707651865697, "loss": 5.9483, "mean_token_accuracy": 0.17878946512937546, "num_tokens": 27141311.0, "step": 10705 }, { "entropy": 6.3080309391021725, "epoch": 1.23600692440854, "grad_norm": 0.87109375, "learning_rate": 0.0004858826936283893, "loss": 5.9311, "mean_token_accuracy": 0.18167731910943985, "num_tokens": 27152935.0, "step": 10710 }, { "entropy": 6.186159563064575, "epoch": 1.2365839584535487, "grad_norm": 0.82421875, "learning_rate": 0.000485868303645187, "loss": 5.7991, "mean_token_accuracy": 0.18926886171102525, "num_tokens": 27166775.0, "step": 10715 }, { "entropy": 6.144335985183716, "epoch": 1.2371609924985574, "grad_norm": 0.87109375, "learning_rate": 0.00048585390656953397, "loss": 5.8706, "mean_token_accuracy": 0.18486643135547637, "num_tokens": 27179406.0, "step": 10720 }, { "entropy": 6.277384281158447, "epoch": 1.237738026543566, "grad_norm": 0.8203125, "learning_rate": 0.0004858395024019147, "loss": 5.8926, "mean_token_accuracy": 0.1846141442656517, "num_tokens": 27191562.0, "step": 10725 }, { "entropy": 6.242267036437989, "epoch": 1.2383150605885747, "grad_norm": 0.96875, "learning_rate": 0.0004858250911428133, "loss": 5.9116, "mean_token_accuracy": 0.17939815521240235, "num_tokens": 27203827.0, "step": 10730 }, { "entropy": 6.236856460571289, "epoch": 1.2388920946335833, "grad_norm": 0.81640625, "learning_rate": 0.0004858106727927148, "loss": 5.8727, "mean_token_accuracy": 0.18083032816648484, "num_tokens": 27217645.0, "step": 10735 }, { "entropy": 6.257790279388428, "epoch": 1.239469128678592, "grad_norm": 0.8984375, "learning_rate": 0.000485796247352104, "loss": 5.9408, "mean_token_accuracy": 0.187166827917099, "num_tokens": 27230794.0, "step": 10740 }, { "entropy": 6.275010776519776, "epoch": 1.2400461627236008, "grad_norm": 0.83984375, "learning_rate": 0.0004857818148214662, "loss": 5.9672, "mean_token_accuracy": 0.17526779770851136, "num_tokens": 27243965.0, "step": 10745 }, { "entropy": 6.313845252990722, "epoch": 1.2406231967686094, "grad_norm": 0.8828125, "learning_rate": 0.0004857673752012866, "loss": 5.9307, "mean_token_accuracy": 0.17886531203985215, "num_tokens": 27256951.0, "step": 10750 }, { "entropy": 6.283997392654419, "epoch": 1.241200230813618, "grad_norm": 0.89453125, "learning_rate": 0.00048575292849205114, "loss": 5.9792, "mean_token_accuracy": 0.1764329567551613, "num_tokens": 27268556.0, "step": 10755 }, { "entropy": 6.223181200027466, "epoch": 1.2417772648586267, "grad_norm": 0.84765625, "learning_rate": 0.0004857384746942456, "loss": 5.8171, "mean_token_accuracy": 0.18010614514350892, "num_tokens": 27280367.0, "step": 10760 }, { "entropy": 6.2159076690673825, "epoch": 1.2423542989036354, "grad_norm": 0.9453125, "learning_rate": 0.0004857240138083562, "loss": 5.9008, "mean_token_accuracy": 0.18687991052865982, "num_tokens": 27293727.0, "step": 10765 }, { "entropy": 6.280245590209961, "epoch": 1.242931332948644, "grad_norm": 0.76953125, "learning_rate": 0.0004857095458348692, "loss": 5.964, "mean_token_accuracy": 0.1840096592903137, "num_tokens": 27306677.0, "step": 10770 }, { "entropy": 6.303292608261108, "epoch": 1.2435083669936526, "grad_norm": 0.84765625, "learning_rate": 0.00048569507077427134, "loss": 5.9332, "mean_token_accuracy": 0.1819072499871254, "num_tokens": 27319317.0, "step": 10775 }, { "entropy": 6.264583969116211, "epoch": 1.2440854010386613, "grad_norm": 0.8359375, "learning_rate": 0.0004856805886270494, "loss": 5.905, "mean_token_accuracy": 0.18524052053689957, "num_tokens": 27332021.0, "step": 10780 }, { "entropy": 6.156681680679322, "epoch": 1.24466243508367, "grad_norm": 0.92578125, "learning_rate": 0.0004856660993936905, "loss": 5.7563, "mean_token_accuracy": 0.201753930747509, "num_tokens": 27343972.0, "step": 10785 }, { "entropy": 6.273656749725342, "epoch": 1.2452394691286786, "grad_norm": 0.96484375, "learning_rate": 0.000485651603074682, "loss": 5.9718, "mean_token_accuracy": 0.1731579691171646, "num_tokens": 27356712.0, "step": 10790 }, { "entropy": 6.211948394775391, "epoch": 1.2458165031736872, "grad_norm": 0.8828125, "learning_rate": 0.0004856370996705115, "loss": 5.8361, "mean_token_accuracy": 0.18876608461141586, "num_tokens": 27369028.0, "step": 10795 }, { "entropy": 6.217354869842529, "epoch": 1.2463935372186958, "grad_norm": 0.91796875, "learning_rate": 0.0004856225891816667, "loss": 5.8618, "mean_token_accuracy": 0.18710222393274306, "num_tokens": 27380789.0, "step": 10800 }, { "entropy": 6.251491403579712, "epoch": 1.2469705712637045, "grad_norm": 0.87890625, "learning_rate": 0.0004856080716086358, "loss": 5.8166, "mean_token_accuracy": 0.1833536610007286, "num_tokens": 27394098.0, "step": 10805 }, { "entropy": 6.221289253234863, "epoch": 1.2475476053087133, "grad_norm": 0.8671875, "learning_rate": 0.000485593546951907, "loss": 5.9253, "mean_token_accuracy": 0.18810599744319917, "num_tokens": 27407270.0, "step": 10810 }, { "entropy": 6.242495155334472, "epoch": 1.2481246393537218, "grad_norm": 0.81640625, "learning_rate": 0.0004855790152119688, "loss": 5.8755, "mean_token_accuracy": 0.18733642101287842, "num_tokens": 27420397.0, "step": 10815 }, { "entropy": 6.273569202423095, "epoch": 1.2487016733987306, "grad_norm": 0.796875, "learning_rate": 0.0004855644763893102, "loss": 5.9575, "mean_token_accuracy": 0.1822887822985649, "num_tokens": 27433007.0, "step": 10820 }, { "entropy": 6.296523666381836, "epoch": 1.2492787074437393, "grad_norm": 0.8828125, "learning_rate": 0.00048554993048441987, "loss": 5.9286, "mean_token_accuracy": 0.17798348218202592, "num_tokens": 27446683.0, "step": 10825 }, { "entropy": 6.2345174789428714, "epoch": 1.249855741488748, "grad_norm": 0.85546875, "learning_rate": 0.0004855353774977873, "loss": 5.9498, "mean_token_accuracy": 0.1765942618250847, "num_tokens": 27459298.0, "step": 10830 }, { "entropy": 6.222336292266846, "epoch": 1.2504327755337565, "grad_norm": 0.8828125, "learning_rate": 0.00048552081742990184, "loss": 5.9103, "mean_token_accuracy": 0.18254689276218414, "num_tokens": 27472287.0, "step": 10835 }, { "entropy": 6.276287794113159, "epoch": 1.2510098095787652, "grad_norm": 0.875, "learning_rate": 0.00048550625028125327, "loss": 5.8996, "mean_token_accuracy": 0.18219816386699678, "num_tokens": 27484808.0, "step": 10840 }, { "entropy": 6.2211394786834715, "epoch": 1.2515868436237738, "grad_norm": 0.93359375, "learning_rate": 0.0004854916760523315, "loss": 5.8676, "mean_token_accuracy": 0.18489859700202943, "num_tokens": 27496980.0, "step": 10845 }, { "entropy": 6.2227785110473635, "epoch": 1.2521638776687825, "grad_norm": 0.96875, "learning_rate": 0.00048547709474362684, "loss": 5.9122, "mean_token_accuracy": 0.17859497368335725, "num_tokens": 27509969.0, "step": 10850 }, { "entropy": 6.25306191444397, "epoch": 1.252740911713791, "grad_norm": 0.8359375, "learning_rate": 0.0004854625063556296, "loss": 5.8834, "mean_token_accuracy": 0.1868899032473564, "num_tokens": 27523410.0, "step": 10855 }, { "entropy": 6.227614545822144, "epoch": 1.2533179457587997, "grad_norm": 0.82421875, "learning_rate": 0.0004854479108888305, "loss": 5.8827, "mean_token_accuracy": 0.18421921283006668, "num_tokens": 27535183.0, "step": 10860 }, { "entropy": 6.256004571914673, "epoch": 1.2538949798038084, "grad_norm": 0.84765625, "learning_rate": 0.00048543330834372047, "loss": 5.9298, "mean_token_accuracy": 0.17713305205106736, "num_tokens": 27548028.0, "step": 10865 }, { "entropy": 6.250798034667969, "epoch": 1.254472013848817, "grad_norm": 1.046875, "learning_rate": 0.00048541869872079064, "loss": 5.8519, "mean_token_accuracy": 0.18728440403938293, "num_tokens": 27561302.0, "step": 10870 }, { "entropy": 6.191199779510498, "epoch": 1.2550490478938257, "grad_norm": 1.0234375, "learning_rate": 0.0004854040820205324, "loss": 5.771, "mean_token_accuracy": 0.1891787514090538, "num_tokens": 27572933.0, "step": 10875 }, { "entropy": 6.267033433914184, "epoch": 1.2556260819388343, "grad_norm": 0.97265625, "learning_rate": 0.0004853894582434373, "loss": 5.9594, "mean_token_accuracy": 0.18094786554574965, "num_tokens": 27586373.0, "step": 10880 }, { "entropy": 6.212432479858398, "epoch": 1.2562031159838432, "grad_norm": 1.09375, "learning_rate": 0.0004853748273899974, "loss": 5.8121, "mean_token_accuracy": 0.1917188748717308, "num_tokens": 27599236.0, "step": 10885 }, { "entropy": 6.199079370498657, "epoch": 1.2567801500288516, "grad_norm": 0.91796875, "learning_rate": 0.0004853601894607046, "loss": 5.8198, "mean_token_accuracy": 0.1882639765739441, "num_tokens": 27611904.0, "step": 10890 }, { "entropy": 6.141427040100098, "epoch": 1.2573571840738604, "grad_norm": 0.8828125, "learning_rate": 0.0004853455444560514, "loss": 5.7666, "mean_token_accuracy": 0.1835411846637726, "num_tokens": 27625778.0, "step": 10895 }, { "entropy": 6.264633512496948, "epoch": 1.257934218118869, "grad_norm": 0.89453125, "learning_rate": 0.0004853308923765302, "loss": 5.9298, "mean_token_accuracy": 0.1849829599261284, "num_tokens": 27638359.0, "step": 10900 }, { "entropy": 6.22053279876709, "epoch": 1.2585112521638777, "grad_norm": 0.92578125, "learning_rate": 0.000485316233222634, "loss": 5.809, "mean_token_accuracy": 0.19588791131973265, "num_tokens": 27651107.0, "step": 10905 }, { "entropy": 6.263698863983154, "epoch": 1.2590882862088864, "grad_norm": 0.9140625, "learning_rate": 0.0004853015669948557, "loss": 5.9405, "mean_token_accuracy": 0.1806721031665802, "num_tokens": 27664060.0, "step": 10910 }, { "entropy": 6.198569345474243, "epoch": 1.259665320253895, "grad_norm": 0.91015625, "learning_rate": 0.00048528689369368863, "loss": 5.8714, "mean_token_accuracy": 0.18663408011198043, "num_tokens": 27676678.0, "step": 10915 }, { "entropy": 6.27892484664917, "epoch": 1.2602423542989036, "grad_norm": 0.9140625, "learning_rate": 0.0004852722133196264, "loss": 5.9284, "mean_token_accuracy": 0.17606211006641387, "num_tokens": 27689696.0, "step": 10920 }, { "entropy": 6.214528560638428, "epoch": 1.2608193883439123, "grad_norm": 0.921875, "learning_rate": 0.0004852575258731627, "loss": 5.8139, "mean_token_accuracy": 0.18999661058187484, "num_tokens": 27702144.0, "step": 10925 }, { "entropy": 6.267048263549805, "epoch": 1.261396422388921, "grad_norm": 0.9609375, "learning_rate": 0.0004852428313547916, "loss": 5.9585, "mean_token_accuracy": 0.17625246644020082, "num_tokens": 27714618.0, "step": 10930 }, { "entropy": 6.254409265518189, "epoch": 1.2619734564339296, "grad_norm": 0.90625, "learning_rate": 0.00048522812976500726, "loss": 5.8882, "mean_token_accuracy": 0.1819372683763504, "num_tokens": 27727002.0, "step": 10935 }, { "entropy": 6.285655307769775, "epoch": 1.2625504904789382, "grad_norm": 0.90234375, "learning_rate": 0.00048521342110430417, "loss": 5.9194, "mean_token_accuracy": 0.1847675174474716, "num_tokens": 27739506.0, "step": 10940 }, { "entropy": 6.199552774429321, "epoch": 1.2631275245239468, "grad_norm": 0.890625, "learning_rate": 0.00048519870537317713, "loss": 5.7879, "mean_token_accuracy": 0.18768482953310012, "num_tokens": 27751959.0, "step": 10945 }, { "entropy": 6.188604736328125, "epoch": 1.2637045585689557, "grad_norm": 0.875, "learning_rate": 0.00048518398257212103, "loss": 5.8612, "mean_token_accuracy": 0.18423410803079604, "num_tokens": 27762938.0, "step": 10950 }, { "entropy": 6.242674493789673, "epoch": 1.2642815926139641, "grad_norm": 0.890625, "learning_rate": 0.0004851692527016311, "loss": 5.9281, "mean_token_accuracy": 0.1746857702732086, "num_tokens": 27776288.0, "step": 10955 }, { "entropy": 6.300945043563843, "epoch": 1.264858626658973, "grad_norm": 0.8671875, "learning_rate": 0.0004851545157622027, "loss": 5.9403, "mean_token_accuracy": 0.16904095262289048, "num_tokens": 27788311.0, "step": 10960 }, { "entropy": 6.292170190811158, "epoch": 1.2654356607039816, "grad_norm": 0.8984375, "learning_rate": 0.0004851397717543316, "loss": 5.9153, "mean_token_accuracy": 0.1774510622024536, "num_tokens": 27799589.0, "step": 10965 }, { "entropy": 6.163033199310303, "epoch": 1.2660126947489903, "grad_norm": 0.9140625, "learning_rate": 0.0004851250206785137, "loss": 5.7982, "mean_token_accuracy": 0.18300086855888367, "num_tokens": 27813057.0, "step": 10970 }, { "entropy": 6.1811439990997314, "epoch": 1.266589728793999, "grad_norm": 0.86328125, "learning_rate": 0.00048511026253524503, "loss": 5.8343, "mean_token_accuracy": 0.1845756396651268, "num_tokens": 27826465.0, "step": 10975 }, { "entropy": 6.239641380310059, "epoch": 1.2671667628390075, "grad_norm": 0.9296875, "learning_rate": 0.0004850954973250221, "loss": 5.9186, "mean_token_accuracy": 0.183623206615448, "num_tokens": 27837157.0, "step": 10980 }, { "entropy": 6.2734949588775635, "epoch": 1.2677437968840162, "grad_norm": 0.86328125, "learning_rate": 0.00048508072504834144, "loss": 5.9733, "mean_token_accuracy": 0.18870452791452408, "num_tokens": 27850101.0, "step": 10985 }, { "entropy": 6.257879447937012, "epoch": 1.2683208309290248, "grad_norm": 0.828125, "learning_rate": 0.00048506594570569997, "loss": 5.9163, "mean_token_accuracy": 0.1761870115995407, "num_tokens": 27862786.0, "step": 10990 }, { "entropy": 6.310289525985718, "epoch": 1.2688978649740335, "grad_norm": 0.953125, "learning_rate": 0.0004850511592975947, "loss": 5.921, "mean_token_accuracy": 0.1836473450064659, "num_tokens": 27875196.0, "step": 10995 }, { "entropy": 6.256885623931884, "epoch": 1.269474899019042, "grad_norm": 0.8515625, "learning_rate": 0.0004850363658245231, "loss": 5.9931, "mean_token_accuracy": 0.17773234248161315, "num_tokens": 27888348.0, "step": 11000 }, { "entropy": 6.264603042602539, "epoch": 1.2700519330640507, "grad_norm": 0.8671875, "learning_rate": 0.0004850215652869826, "loss": 5.9415, "mean_token_accuracy": 0.18163408041000367, "num_tokens": 27901301.0, "step": 11005 }, { "entropy": 6.26677885055542, "epoch": 1.2706289671090594, "grad_norm": 0.90625, "learning_rate": 0.0004850067576854711, "loss": 5.9245, "mean_token_accuracy": 0.18035585135221482, "num_tokens": 27915665.0, "step": 11010 }, { "entropy": 6.204976367950439, "epoch": 1.271206001154068, "grad_norm": 0.8828125, "learning_rate": 0.0004849919430204867, "loss": 5.899, "mean_token_accuracy": 0.18384966850280762, "num_tokens": 27928333.0, "step": 11015 }, { "entropy": 6.2638813018798825, "epoch": 1.2717830351990767, "grad_norm": 1.1484375, "learning_rate": 0.0004849771212925275, "loss": 5.8452, "mean_token_accuracy": 0.18147977739572524, "num_tokens": 27940429.0, "step": 11020 }, { "entropy": 6.264388513565064, "epoch": 1.2723600692440855, "grad_norm": 0.8828125, "learning_rate": 0.00048496229250209223, "loss": 5.9614, "mean_token_accuracy": 0.18041146397590638, "num_tokens": 27953846.0, "step": 11025 }, { "entropy": 6.211956357955932, "epoch": 1.272937103289094, "grad_norm": 0.984375, "learning_rate": 0.0004849474566496795, "loss": 5.8087, "mean_token_accuracy": 0.19337970167398452, "num_tokens": 27966393.0, "step": 11030 }, { "entropy": 6.157489681243897, "epoch": 1.2735141373341028, "grad_norm": 0.84765625, "learning_rate": 0.0004849326137357883, "loss": 5.7524, "mean_token_accuracy": 0.20423612147569656, "num_tokens": 27979928.0, "step": 11035 }, { "entropy": 6.274266529083252, "epoch": 1.2740911713791114, "grad_norm": 0.953125, "learning_rate": 0.000484917763760918, "loss": 5.8724, "mean_token_accuracy": 0.17999066561460494, "num_tokens": 27991450.0, "step": 11040 }, { "entropy": 6.249115896224976, "epoch": 1.27466820542412, "grad_norm": 0.92578125, "learning_rate": 0.00048490290672556784, "loss": 5.9163, "mean_token_accuracy": 0.17860014736652374, "num_tokens": 28003696.0, "step": 11045 }, { "entropy": 6.121306085586548, "epoch": 1.2752452394691287, "grad_norm": 0.9140625, "learning_rate": 0.0004848880426302378, "loss": 5.8191, "mean_token_accuracy": 0.1887667015194893, "num_tokens": 28015886.0, "step": 11050 }, { "entropy": 6.220458936691284, "epoch": 1.2758222735141374, "grad_norm": 1.2109375, "learning_rate": 0.0004848731714754277, "loss": 5.87, "mean_token_accuracy": 0.18536427319049836, "num_tokens": 28029552.0, "step": 11055 }, { "entropy": 6.2172283172607425, "epoch": 1.276399307559146, "grad_norm": 0.8671875, "learning_rate": 0.0004848582932616377, "loss": 5.9559, "mean_token_accuracy": 0.17716862708330156, "num_tokens": 28042275.0, "step": 11060 }, { "entropy": 6.174749374389648, "epoch": 1.2769763416041546, "grad_norm": 1.0390625, "learning_rate": 0.0004848434079893682, "loss": 5.8283, "mean_token_accuracy": 0.19337797313928604, "num_tokens": 28054840.0, "step": 11065 }, { "entropy": 6.320803117752075, "epoch": 1.2775533756491633, "grad_norm": 1.0078125, "learning_rate": 0.0004848285156591201, "loss": 5.9848, "mean_token_accuracy": 0.17735466361045837, "num_tokens": 28068052.0, "step": 11070 }, { "entropy": 6.317575454711914, "epoch": 1.278130409694172, "grad_norm": 0.8828125, "learning_rate": 0.00048481361627139384, "loss": 5.9607, "mean_token_accuracy": 0.17917237877845765, "num_tokens": 28081157.0, "step": 11075 }, { "entropy": 6.264458179473877, "epoch": 1.2787074437391805, "grad_norm": 0.9921875, "learning_rate": 0.00048479870982669096, "loss": 5.9992, "mean_token_accuracy": 0.17882073372602464, "num_tokens": 28093842.0, "step": 11080 }, { "entropy": 6.269530010223389, "epoch": 1.2792844777841892, "grad_norm": 0.9296875, "learning_rate": 0.00048478379632551266, "loss": 5.8656, "mean_token_accuracy": 0.1861704871058464, "num_tokens": 28107529.0, "step": 11085 }, { "entropy": 6.3019171237945555, "epoch": 1.279861511829198, "grad_norm": 0.83203125, "learning_rate": 0.0004847688757683606, "loss": 5.9586, "mean_token_accuracy": 0.17826474457979202, "num_tokens": 28119650.0, "step": 11090 }, { "entropy": 6.197647523880005, "epoch": 1.2804385458742065, "grad_norm": 0.91796875, "learning_rate": 0.0004847539481557366, "loss": 5.8936, "mean_token_accuracy": 0.18941795378923415, "num_tokens": 28131209.0, "step": 11095 }, { "entropy": 6.21189546585083, "epoch": 1.2810155799192153, "grad_norm": 0.9375, "learning_rate": 0.00048473901348814277, "loss": 5.9072, "mean_token_accuracy": 0.18758580833673477, "num_tokens": 28143624.0, "step": 11100 }, { "entropy": 6.333727693557739, "epoch": 1.281592613964224, "grad_norm": 0.90625, "learning_rate": 0.0004847240717660814, "loss": 5.9187, "mean_token_accuracy": 0.18257874101400376, "num_tokens": 28156752.0, "step": 11105 }, { "entropy": 6.148864364624023, "epoch": 1.2821696480092326, "grad_norm": 0.83203125, "learning_rate": 0.00048470912299005493, "loss": 5.7846, "mean_token_accuracy": 0.1917967677116394, "num_tokens": 28169288.0, "step": 11110 }, { "entropy": 6.202798795700073, "epoch": 1.2827466820542412, "grad_norm": 0.99609375, "learning_rate": 0.00048469416716056635, "loss": 5.8863, "mean_token_accuracy": 0.18294143825769424, "num_tokens": 28181739.0, "step": 11115 }, { "entropy": 6.241795825958252, "epoch": 1.28332371609925, "grad_norm": 0.953125, "learning_rate": 0.0004846792042781187, "loss": 5.8472, "mean_token_accuracy": 0.18725763261318207, "num_tokens": 28193861.0, "step": 11120 }, { "entropy": 6.167054653167725, "epoch": 1.2839007501442585, "grad_norm": 0.87109375, "learning_rate": 0.00048466423434321513, "loss": 5.799, "mean_token_accuracy": 0.19221861511468888, "num_tokens": 28205453.0, "step": 11125 }, { "entropy": 6.213259506225586, "epoch": 1.2844777841892672, "grad_norm": 0.93359375, "learning_rate": 0.00048464925735635907, "loss": 5.866, "mean_token_accuracy": 0.18240144699811936, "num_tokens": 28217554.0, "step": 11130 }, { "entropy": 6.326313447952271, "epoch": 1.2850548182342758, "grad_norm": 0.8828125, "learning_rate": 0.00048463427331805445, "loss": 5.9837, "mean_token_accuracy": 0.17859313935041427, "num_tokens": 28230091.0, "step": 11135 }, { "entropy": 6.196951007843017, "epoch": 1.2856318522792844, "grad_norm": 0.85546875, "learning_rate": 0.0004846192822288052, "loss": 5.8606, "mean_token_accuracy": 0.19161761701107025, "num_tokens": 28243285.0, "step": 11140 }, { "entropy": 6.159520244598388, "epoch": 1.286208886324293, "grad_norm": 0.90234375, "learning_rate": 0.0004846042840891155, "loss": 5.7559, "mean_token_accuracy": 0.19518305808305741, "num_tokens": 28256210.0, "step": 11145 }, { "entropy": 6.202442598342896, "epoch": 1.2867859203693017, "grad_norm": 0.9921875, "learning_rate": 0.0004845892788994899, "loss": 5.8393, "mean_token_accuracy": 0.1925252139568329, "num_tokens": 28268291.0, "step": 11150 }, { "entropy": 6.127519702911377, "epoch": 1.2873629544143104, "grad_norm": 0.90234375, "learning_rate": 0.0004845742666604329, "loss": 5.802, "mean_token_accuracy": 0.19252759367227554, "num_tokens": 28281462.0, "step": 11155 }, { "entropy": 6.261201524734497, "epoch": 1.287939988459319, "grad_norm": 0.87109375, "learning_rate": 0.00048455924737244953, "loss": 5.9527, "mean_token_accuracy": 0.1794736549258232, "num_tokens": 28292766.0, "step": 11160 }, { "entropy": 6.165164470672607, "epoch": 1.2885170225043279, "grad_norm": 0.93359375, "learning_rate": 0.00048454422103604505, "loss": 5.8265, "mean_token_accuracy": 0.1932087242603302, "num_tokens": 28304500.0, "step": 11165 }, { "entropy": 6.250514936447144, "epoch": 1.2890940565493363, "grad_norm": 0.875, "learning_rate": 0.0004845291876517247, "loss": 5.9187, "mean_token_accuracy": 0.1889398217201233, "num_tokens": 28317262.0, "step": 11170 }, { "entropy": 6.167955780029297, "epoch": 1.2896710905943451, "grad_norm": 0.83984375, "learning_rate": 0.00048451414721999424, "loss": 5.79, "mean_token_accuracy": 0.1927010953426361, "num_tokens": 28330313.0, "step": 11175 }, { "entropy": 6.192044591903686, "epoch": 1.2902481246393538, "grad_norm": 0.83984375, "learning_rate": 0.00048449909974135954, "loss": 5.8116, "mean_token_accuracy": 0.18487345725297927, "num_tokens": 28344058.0, "step": 11180 }, { "entropy": 6.202538776397705, "epoch": 1.2908251586843624, "grad_norm": 0.91796875, "learning_rate": 0.0004844840452163267, "loss": 5.8816, "mean_token_accuracy": 0.18409787267446517, "num_tokens": 28356664.0, "step": 11185 }, { "entropy": 6.264059352874756, "epoch": 1.291402192729371, "grad_norm": 0.87109375, "learning_rate": 0.000484468983645402, "loss": 5.9159, "mean_token_accuracy": 0.1831672191619873, "num_tokens": 28369040.0, "step": 11190 }, { "entropy": 6.198862314224243, "epoch": 1.2919792267743797, "grad_norm": 0.9140625, "learning_rate": 0.00048445391502909213, "loss": 5.8845, "mean_token_accuracy": 0.17770082056522368, "num_tokens": 28381788.0, "step": 11195 }, { "entropy": 6.235758447647095, "epoch": 1.2925562608193883, "grad_norm": 0.87109375, "learning_rate": 0.00048443883936790386, "loss": 5.9364, "mean_token_accuracy": 0.18272285610437394, "num_tokens": 28394531.0, "step": 11200 }, { "entropy": 6.215797090530396, "epoch": 1.293133294864397, "grad_norm": 1.0234375, "learning_rate": 0.00048442375666234427, "loss": 5.8094, "mean_token_accuracy": 0.18736853450536728, "num_tokens": 28407766.0, "step": 11205 }, { "entropy": 6.2450777053833, "epoch": 1.2937103289094056, "grad_norm": 0.9296875, "learning_rate": 0.0004844086669129206, "loss": 5.9169, "mean_token_accuracy": 0.18248326927423478, "num_tokens": 28420185.0, "step": 11210 }, { "entropy": 6.302453470230103, "epoch": 1.2942873629544143, "grad_norm": 0.87109375, "learning_rate": 0.00048439357012014045, "loss": 5.875, "mean_token_accuracy": 0.1817401424050331, "num_tokens": 28432781.0, "step": 11215 }, { "entropy": 6.239097166061401, "epoch": 1.294864396999423, "grad_norm": 0.8046875, "learning_rate": 0.0004843784662845116, "loss": 5.8712, "mean_token_accuracy": 0.18863223046064376, "num_tokens": 28446181.0, "step": 11220 }, { "entropy": 6.22045316696167, "epoch": 1.2954414310444315, "grad_norm": 0.91015625, "learning_rate": 0.000484363355406542, "loss": 5.7876, "mean_token_accuracy": 0.1905339851975441, "num_tokens": 28457959.0, "step": 11225 }, { "entropy": 6.223681545257568, "epoch": 1.2960184650894404, "grad_norm": 0.88671875, "learning_rate": 0.00048434823748674, "loss": 5.9161, "mean_token_accuracy": 0.18176539540290831, "num_tokens": 28470656.0, "step": 11230 }, { "entropy": 6.253976678848266, "epoch": 1.2965954991344488, "grad_norm": 0.83203125, "learning_rate": 0.00048433311252561403, "loss": 5.9463, "mean_token_accuracy": 0.18163900822401047, "num_tokens": 28483359.0, "step": 11235 }, { "entropy": 6.231476640701294, "epoch": 1.2971725331794577, "grad_norm": 0.8828125, "learning_rate": 0.0004843179805236728, "loss": 5.8509, "mean_token_accuracy": 0.1812107414007187, "num_tokens": 28495984.0, "step": 11240 }, { "entropy": 6.214840412139893, "epoch": 1.297749567224466, "grad_norm": 0.90234375, "learning_rate": 0.00048430284148142516, "loss": 5.9283, "mean_token_accuracy": 0.18338681906461715, "num_tokens": 28508629.0, "step": 11245 }, { "entropy": 6.251529169082642, "epoch": 1.298326601269475, "grad_norm": 1.0546875, "learning_rate": 0.0004842876953993805, "loss": 5.9368, "mean_token_accuracy": 0.1814151406288147, "num_tokens": 28521952.0, "step": 11250 }, { "entropy": 6.235261106491089, "epoch": 1.2989036353144836, "grad_norm": 0.828125, "learning_rate": 0.0004842725422780482, "loss": 5.8472, "mean_token_accuracy": 0.1838516652584076, "num_tokens": 28535210.0, "step": 11255 }, { "entropy": 6.2960120677948, "epoch": 1.2994806693594922, "grad_norm": 0.8984375, "learning_rate": 0.0004842573821179378, "loss": 5.9481, "mean_token_accuracy": 0.17584086060523987, "num_tokens": 28547294.0, "step": 11260 }, { "entropy": 6.314822959899902, "epoch": 1.3000577034045009, "grad_norm": 0.96484375, "learning_rate": 0.0004842422149195593, "loss": 5.9818, "mean_token_accuracy": 0.1747643157839775, "num_tokens": 28558934.0, "step": 11265 }, { "entropy": 6.228778266906739, "epoch": 1.3006347374495095, "grad_norm": 1.0703125, "learning_rate": 0.00048422704068342294, "loss": 5.8457, "mean_token_accuracy": 0.18052484542131425, "num_tokens": 28571897.0, "step": 11270 }, { "entropy": 6.207079267501831, "epoch": 1.3012117714945182, "grad_norm": 0.88671875, "learning_rate": 0.0004842118594100389, "loss": 5.8526, "mean_token_accuracy": 0.18636152595281602, "num_tokens": 28584320.0, "step": 11275 }, { "entropy": 6.174588394165039, "epoch": 1.3017888055395268, "grad_norm": 0.91015625, "learning_rate": 0.00048419667109991793, "loss": 5.8066, "mean_token_accuracy": 0.1909553661942482, "num_tokens": 28597018.0, "step": 11280 }, { "entropy": 6.1673197746276855, "epoch": 1.3023658395845354, "grad_norm": 0.94140625, "learning_rate": 0.00048418147575357085, "loss": 5.82, "mean_token_accuracy": 0.1927016168832779, "num_tokens": 28609145.0, "step": 11285 }, { "entropy": 6.213823366165161, "epoch": 1.302942873629544, "grad_norm": 0.91015625, "learning_rate": 0.0004841662733715087, "loss": 5.8258, "mean_token_accuracy": 0.18956251591444015, "num_tokens": 28622208.0, "step": 11290 }, { "entropy": 6.168881797790528, "epoch": 1.3035199076745527, "grad_norm": 1.0078125, "learning_rate": 0.00048415106395424294, "loss": 5.8299, "mean_token_accuracy": 0.18110065758228303, "num_tokens": 28634719.0, "step": 11295 }, { "entropy": 6.242797899246216, "epoch": 1.3040969417195614, "grad_norm": 0.9140625, "learning_rate": 0.00048413584750228494, "loss": 5.9193, "mean_token_accuracy": 0.18366942554712296, "num_tokens": 28647138.0, "step": 11300 }, { "entropy": 6.160969686508179, "epoch": 1.3046739757645702, "grad_norm": 0.84765625, "learning_rate": 0.00048412062401614653, "loss": 5.8142, "mean_token_accuracy": 0.19241383224725722, "num_tokens": 28660898.0, "step": 11305 }, { "entropy": 6.281964683532715, "epoch": 1.3052510098095786, "grad_norm": 0.8515625, "learning_rate": 0.00048410539349634, "loss": 5.9567, "mean_token_accuracy": 0.18592915683984756, "num_tokens": 28672898.0, "step": 11310 }, { "entropy": 6.223157262802124, "epoch": 1.3058280438545875, "grad_norm": 0.9296875, "learning_rate": 0.00048409015594337725, "loss": 5.9526, "mean_token_accuracy": 0.1888653665781021, "num_tokens": 28684608.0, "step": 11315 }, { "entropy": 6.212820672988892, "epoch": 1.3064050778995961, "grad_norm": 0.89453125, "learning_rate": 0.000484074911357771, "loss": 5.8609, "mean_token_accuracy": 0.18949985653162002, "num_tokens": 28696867.0, "step": 11320 }, { "entropy": 6.2286797046661375, "epoch": 1.3069821119446048, "grad_norm": 0.9140625, "learning_rate": 0.00048405965974003404, "loss": 5.9359, "mean_token_accuracy": 0.17696356326341628, "num_tokens": 28709533.0, "step": 11325 }, { "entropy": 6.2534784317016605, "epoch": 1.3075591459896134, "grad_norm": 0.86328125, "learning_rate": 0.00048404440109067927, "loss": 5.8694, "mean_token_accuracy": 0.17698248773813247, "num_tokens": 28721647.0, "step": 11330 }, { "entropy": 6.255917501449585, "epoch": 1.308136180034622, "grad_norm": 0.94140625, "learning_rate": 0.0004840291354102198, "loss": 5.8925, "mean_token_accuracy": 0.18085959553718567, "num_tokens": 28735261.0, "step": 11335 }, { "entropy": 6.202675867080688, "epoch": 1.3087132140796307, "grad_norm": 1.1640625, "learning_rate": 0.0004840138626991693, "loss": 5.9353, "mean_token_accuracy": 0.18194161504507064, "num_tokens": 28747930.0, "step": 11340 }, { "entropy": 6.258759212493897, "epoch": 1.3092902481246393, "grad_norm": 0.8515625, "learning_rate": 0.0004839985829580413, "loss": 5.9106, "mean_token_accuracy": 0.18136637806892394, "num_tokens": 28760497.0, "step": 11345 }, { "entropy": 6.320033216476441, "epoch": 1.309867282169648, "grad_norm": 0.9453125, "learning_rate": 0.00048398329618734977, "loss": 5.9464, "mean_token_accuracy": 0.17641042470932006, "num_tokens": 28772787.0, "step": 11350 }, { "entropy": 6.200205707550049, "epoch": 1.3104443162146566, "grad_norm": 0.8046875, "learning_rate": 0.0004839680023876089, "loss": 5.8531, "mean_token_accuracy": 0.18295872509479522, "num_tokens": 28784901.0, "step": 11355 }, { "entropy": 6.262151050567627, "epoch": 1.3110213502596653, "grad_norm": 0.92578125, "learning_rate": 0.0004839527015593331, "loss": 5.9302, "mean_token_accuracy": 0.178282168507576, "num_tokens": 28797376.0, "step": 11360 }, { "entropy": 6.249820327758789, "epoch": 1.311598384304674, "grad_norm": 0.84765625, "learning_rate": 0.00048393739370303684, "loss": 5.8711, "mean_token_accuracy": 0.1843525782227516, "num_tokens": 28808805.0, "step": 11365 }, { "entropy": 6.219827556610108, "epoch": 1.3121754183496828, "grad_norm": 0.85546875, "learning_rate": 0.0004839220788192353, "loss": 5.9671, "mean_token_accuracy": 0.17647455185651778, "num_tokens": 28821734.0, "step": 11370 }, { "entropy": 6.2617974281311035, "epoch": 1.3127524523946912, "grad_norm": 0.92578125, "learning_rate": 0.00048390675690844335, "loss": 5.8399, "mean_token_accuracy": 0.1810166746377945, "num_tokens": 28834864.0, "step": 11375 }, { "entropy": 6.158445119857788, "epoch": 1.3133294864397, "grad_norm": 0.95703125, "learning_rate": 0.0004838914279711764, "loss": 5.8065, "mean_token_accuracy": 0.18591468781232834, "num_tokens": 28848154.0, "step": 11380 }, { "entropy": 6.175825357437134, "epoch": 1.3139065204847085, "grad_norm": 0.80859375, "learning_rate": 0.00048387609200795003, "loss": 5.8917, "mean_token_accuracy": 0.18650826215744018, "num_tokens": 28861562.0, "step": 11385 }, { "entropy": 6.272245788574219, "epoch": 1.3144835545297173, "grad_norm": 0.88671875, "learning_rate": 0.00048386074901928, "loss": 5.8496, "mean_token_accuracy": 0.18694826662540437, "num_tokens": 28873921.0, "step": 11390 }, { "entropy": 6.255329275131226, "epoch": 1.315060588574726, "grad_norm": 0.859375, "learning_rate": 0.0004838453990056825, "loss": 5.9349, "mean_token_accuracy": 0.1798590064048767, "num_tokens": 28886126.0, "step": 11395 }, { "entropy": 6.220553064346314, "epoch": 1.3156376226197346, "grad_norm": 0.875, "learning_rate": 0.00048383004196767373, "loss": 5.8019, "mean_token_accuracy": 0.1911833941936493, "num_tokens": 28897980.0, "step": 11400 }, { "entropy": 6.265301656723023, "epoch": 1.3162146566647432, "grad_norm": 0.890625, "learning_rate": 0.0004838146779057702, "loss": 5.8514, "mean_token_accuracy": 0.18370553553104402, "num_tokens": 28910105.0, "step": 11405 }, { "entropy": 6.238138055801391, "epoch": 1.3167916907097519, "grad_norm": 0.96484375, "learning_rate": 0.0004837993068204887, "loss": 5.9089, "mean_token_accuracy": 0.18176488429307938, "num_tokens": 28922004.0, "step": 11410 }, { "entropy": 6.176228141784668, "epoch": 1.3173687247547605, "grad_norm": 0.859375, "learning_rate": 0.00048378392871234634, "loss": 5.767, "mean_token_accuracy": 0.19638804495334625, "num_tokens": 28935990.0, "step": 11415 }, { "entropy": 6.256175231933594, "epoch": 1.3179457587997692, "grad_norm": 0.94921875, "learning_rate": 0.0004837685435818601, "loss": 5.8387, "mean_token_accuracy": 0.1891574367880821, "num_tokens": 28948274.0, "step": 11420 }, { "entropy": 6.233545589447021, "epoch": 1.3185227928447778, "grad_norm": 0.91796875, "learning_rate": 0.0004837531514295477, "loss": 5.9423, "mean_token_accuracy": 0.17450683414936066, "num_tokens": 28960101.0, "step": 11425 }, { "entropy": 6.260594320297241, "epoch": 1.3190998268897864, "grad_norm": 0.890625, "learning_rate": 0.0004837377522559267, "loss": 5.9553, "mean_token_accuracy": 0.18921227008104324, "num_tokens": 28972408.0, "step": 11430 }, { "entropy": 6.249463510513306, "epoch": 1.319676860934795, "grad_norm": 0.84375, "learning_rate": 0.00048372234606151507, "loss": 5.8905, "mean_token_accuracy": 0.18161126375198364, "num_tokens": 28985025.0, "step": 11435 }, { "entropy": 6.256546449661255, "epoch": 1.3202538949798037, "grad_norm": 0.8515625, "learning_rate": 0.00048370693284683106, "loss": 5.9632, "mean_token_accuracy": 0.18379874676465988, "num_tokens": 28997568.0, "step": 11440 }, { "entropy": 6.281197547912598, "epoch": 1.3208309290248126, "grad_norm": 0.91015625, "learning_rate": 0.00048369151261239303, "loss": 5.973, "mean_token_accuracy": 0.17523153275251388, "num_tokens": 29009567.0, "step": 11445 }, { "entropy": 6.239495086669922, "epoch": 1.321407963069821, "grad_norm": 0.91015625, "learning_rate": 0.0004836760853587196, "loss": 5.8738, "mean_token_accuracy": 0.17971327304840087, "num_tokens": 29021403.0, "step": 11450 }, { "entropy": 6.231962966918945, "epoch": 1.3219849971148299, "grad_norm": 0.90625, "learning_rate": 0.00048366065108632967, "loss": 5.8515, "mean_token_accuracy": 0.1861049070954323, "num_tokens": 29033430.0, "step": 11455 }, { "entropy": 6.187495756149292, "epoch": 1.3225620311598385, "grad_norm": 0.890625, "learning_rate": 0.00048364520979574246, "loss": 5.8723, "mean_token_accuracy": 0.18128441423177719, "num_tokens": 29045659.0, "step": 11460 }, { "entropy": 6.204320430755615, "epoch": 1.3231390652048471, "grad_norm": 0.90625, "learning_rate": 0.00048362976148747715, "loss": 5.8202, "mean_token_accuracy": 0.1851746380329132, "num_tokens": 29058962.0, "step": 11465 }, { "entropy": 6.236425065994263, "epoch": 1.3237160992498558, "grad_norm": 0.94921875, "learning_rate": 0.0004836143061620536, "loss": 5.7613, "mean_token_accuracy": 0.1951758399605751, "num_tokens": 29072009.0, "step": 11470 }, { "entropy": 6.150970411300659, "epoch": 1.3242931332948644, "grad_norm": 0.859375, "learning_rate": 0.0004835988438199914, "loss": 5.7753, "mean_token_accuracy": 0.19481099843978883, "num_tokens": 29084174.0, "step": 11475 }, { "entropy": 6.225009822845459, "epoch": 1.324870167339873, "grad_norm": 0.8984375, "learning_rate": 0.0004835833744618107, "loss": 5.8656, "mean_token_accuracy": 0.185127791762352, "num_tokens": 29096189.0, "step": 11480 }, { "entropy": 6.202565431594849, "epoch": 1.3254472013848817, "grad_norm": 0.8828125, "learning_rate": 0.0004835678980880318, "loss": 5.8374, "mean_token_accuracy": 0.18455548584461212, "num_tokens": 29108212.0, "step": 11485 }, { "entropy": 6.263130712509155, "epoch": 1.3260242354298903, "grad_norm": 1.3984375, "learning_rate": 0.0004835524146991753, "loss": 5.8032, "mean_token_accuracy": 0.19258994311094285, "num_tokens": 29121058.0, "step": 11490 }, { "entropy": 6.197894430160522, "epoch": 1.326601269474899, "grad_norm": 0.92578125, "learning_rate": 0.00048353692429576185, "loss": 5.9338, "mean_token_accuracy": 0.1838608577847481, "num_tokens": 29132981.0, "step": 11495 }, { "entropy": 6.250746345520019, "epoch": 1.3271783035199076, "grad_norm": 0.8828125, "learning_rate": 0.0004835214268783126, "loss": 5.8847, "mean_token_accuracy": 0.18033799827098845, "num_tokens": 29145143.0, "step": 11500 }, { "entropy": 6.2464357852935795, "epoch": 1.3277553375649163, "grad_norm": 0.88671875, "learning_rate": 0.00048350592244734866, "loss": 5.8415, "mean_token_accuracy": 0.18740762770175934, "num_tokens": 29157548.0, "step": 11505 }, { "entropy": 6.139885425567627, "epoch": 1.3283323716099251, "grad_norm": 0.9609375, "learning_rate": 0.0004834904110033917, "loss": 5.7547, "mean_token_accuracy": 0.195901720225811, "num_tokens": 29170243.0, "step": 11510 }, { "entropy": 6.218726301193238, "epoch": 1.3289094056549335, "grad_norm": 0.890625, "learning_rate": 0.00048347489254696327, "loss": 5.8636, "mean_token_accuracy": 0.18377334475517274, "num_tokens": 29181769.0, "step": 11515 }, { "entropy": 6.258484029769898, "epoch": 1.3294864396999424, "grad_norm": 0.94921875, "learning_rate": 0.0004834593670785854, "loss": 5.9648, "mean_token_accuracy": 0.17879902422428132, "num_tokens": 29194196.0, "step": 11520 }, { "entropy": 6.22721004486084, "epoch": 1.3300634737449508, "grad_norm": 0.90234375, "learning_rate": 0.00048344383459878024, "loss": 5.8595, "mean_token_accuracy": 0.18442352563142778, "num_tokens": 29206101.0, "step": 11525 }, { "entropy": 6.183701848983764, "epoch": 1.3306405077899597, "grad_norm": 0.8671875, "learning_rate": 0.00048342829510807024, "loss": 5.836, "mean_token_accuracy": 0.18734344989061355, "num_tokens": 29217851.0, "step": 11530 }, { "entropy": 6.154987382888794, "epoch": 1.3312175418349683, "grad_norm": 0.90234375, "learning_rate": 0.000483412748606978, "loss": 5.8028, "mean_token_accuracy": 0.19526472836732864, "num_tokens": 29231497.0, "step": 11535 }, { "entropy": 6.315514087677002, "epoch": 1.331794575879977, "grad_norm": 0.88671875, "learning_rate": 0.0004833971950960266, "loss": 5.9461, "mean_token_accuracy": 0.18248422145843507, "num_tokens": 29245227.0, "step": 11540 }, { "entropy": 6.224634885787964, "epoch": 1.3323716099249856, "grad_norm": 0.85546875, "learning_rate": 0.0004833816345757391, "loss": 5.8547, "mean_token_accuracy": 0.1854404926300049, "num_tokens": 29259403.0, "step": 11545 }, { "entropy": 6.249810361862183, "epoch": 1.3329486439699942, "grad_norm": 0.8828125, "learning_rate": 0.0004833660670466387, "loss": 5.8565, "mean_token_accuracy": 0.18590396046638488, "num_tokens": 29270938.0, "step": 11550 }, { "entropy": 6.258982610702515, "epoch": 1.3335256780150029, "grad_norm": 0.9296875, "learning_rate": 0.0004833504925092492, "loss": 5.8566, "mean_token_accuracy": 0.19000206291675567, "num_tokens": 29284078.0, "step": 11555 }, { "entropy": 6.223692846298218, "epoch": 1.3341027120600115, "grad_norm": 0.890625, "learning_rate": 0.0004833349109640944, "loss": 5.8385, "mean_token_accuracy": 0.1834432601928711, "num_tokens": 29295698.0, "step": 11560 }, { "entropy": 6.235724020004272, "epoch": 1.3346797461050202, "grad_norm": 0.89453125, "learning_rate": 0.0004833193224116983, "loss": 5.8652, "mean_token_accuracy": 0.1862700179219246, "num_tokens": 29307585.0, "step": 11565 }, { "entropy": 6.237357521057129, "epoch": 1.3352567801500288, "grad_norm": 0.87890625, "learning_rate": 0.00048330372685258526, "loss": 5.8703, "mean_token_accuracy": 0.18552322387695314, "num_tokens": 29321027.0, "step": 11570 }, { "entropy": 6.273429441452026, "epoch": 1.3358338141950374, "grad_norm": 0.86328125, "learning_rate": 0.0004832881242872799, "loss": 5.9237, "mean_token_accuracy": 0.1840517833828926, "num_tokens": 29333121.0, "step": 11575 }, { "entropy": 6.21780743598938, "epoch": 1.336410848240046, "grad_norm": 0.96484375, "learning_rate": 0.0004832725147163069, "loss": 5.894, "mean_token_accuracy": 0.1825244978070259, "num_tokens": 29346120.0, "step": 11580 }, { "entropy": 6.25745325088501, "epoch": 1.336987882285055, "grad_norm": 0.8984375, "learning_rate": 0.00048325689814019134, "loss": 5.8643, "mean_token_accuracy": 0.18377418518066407, "num_tokens": 29357872.0, "step": 11585 }, { "entropy": 6.281948804855347, "epoch": 1.3375649163300634, "grad_norm": 0.86328125, "learning_rate": 0.0004832412745594585, "loss": 5.9228, "mean_token_accuracy": 0.18576952517032624, "num_tokens": 29370657.0, "step": 11590 }, { "entropy": 6.170208215713501, "epoch": 1.3381419503750722, "grad_norm": 0.90625, "learning_rate": 0.00048322564397463376, "loss": 5.8472, "mean_token_accuracy": 0.19092058688402175, "num_tokens": 29384880.0, "step": 11595 }, { "entropy": 6.258925104141236, "epoch": 1.3387189844200809, "grad_norm": 0.9609375, "learning_rate": 0.00048321000638624296, "loss": 5.8543, "mean_token_accuracy": 0.18395190089941024, "num_tokens": 29397215.0, "step": 11600 }, { "entropy": 6.2219925880432125, "epoch": 1.3392960184650895, "grad_norm": 1.0390625, "learning_rate": 0.000483194361794812, "loss": 5.8089, "mean_token_accuracy": 0.19121019542217255, "num_tokens": 29409634.0, "step": 11605 }, { "entropy": 6.226755666732788, "epoch": 1.3398730525100981, "grad_norm": 0.84375, "learning_rate": 0.000483178710200867, "loss": 5.7865, "mean_token_accuracy": 0.19461841881275177, "num_tokens": 29422404.0, "step": 11610 }, { "entropy": 6.2323966979980465, "epoch": 1.3404500865551068, "grad_norm": 0.89453125, "learning_rate": 0.0004831630516049346, "loss": 5.9668, "mean_token_accuracy": 0.18530030250549318, "num_tokens": 29434727.0, "step": 11615 }, { "entropy": 6.253775358200073, "epoch": 1.3410271206001154, "grad_norm": 0.984375, "learning_rate": 0.0004831473860075414, "loss": 5.8695, "mean_token_accuracy": 0.18326867818832399, "num_tokens": 29447176.0, "step": 11620 }, { "entropy": 6.214875221252441, "epoch": 1.341604154645124, "grad_norm": 0.86328125, "learning_rate": 0.00048313171340921417, "loss": 5.8307, "mean_token_accuracy": 0.1961693212389946, "num_tokens": 29460080.0, "step": 11625 }, { "entropy": 6.183676052093506, "epoch": 1.3421811886901327, "grad_norm": 0.87109375, "learning_rate": 0.00048311603381048025, "loss": 5.8363, "mean_token_accuracy": 0.19140980392694473, "num_tokens": 29472503.0, "step": 11630 }, { "entropy": 6.234938287734986, "epoch": 1.3427582227351413, "grad_norm": 0.84765625, "learning_rate": 0.0004831003472118668, "loss": 5.8351, "mean_token_accuracy": 0.18842962384223938, "num_tokens": 29485139.0, "step": 11635 }, { "entropy": 6.310397815704346, "epoch": 1.34333525678015, "grad_norm": 0.96875, "learning_rate": 0.0004830846536139016, "loss": 5.9381, "mean_token_accuracy": 0.18417907506227493, "num_tokens": 29497455.0, "step": 11640 }, { "entropy": 6.260405540466309, "epoch": 1.3439122908251586, "grad_norm": 0.87109375, "learning_rate": 0.0004830689530171124, "loss": 5.8747, "mean_token_accuracy": 0.1892422318458557, "num_tokens": 29509859.0, "step": 11645 }, { "entropy": 6.264926242828369, "epoch": 1.3444893248701673, "grad_norm": 0.8359375, "learning_rate": 0.0004830532454220273, "loss": 5.9185, "mean_token_accuracy": 0.18690085262060166, "num_tokens": 29523117.0, "step": 11650 }, { "entropy": 6.162897396087646, "epoch": 1.345066358915176, "grad_norm": 0.82421875, "learning_rate": 0.00048303753082917474, "loss": 5.8265, "mean_token_accuracy": 0.19078432023525238, "num_tokens": 29535943.0, "step": 11655 }, { "entropy": 6.277468681335449, "epoch": 1.3456433929601848, "grad_norm": 0.87890625, "learning_rate": 0.00048302180923908306, "loss": 5.9204, "mean_token_accuracy": 0.18410737067461014, "num_tokens": 29549036.0, "step": 11660 }, { "entropy": 6.163658857345581, "epoch": 1.3462204270051932, "grad_norm": 0.8984375, "learning_rate": 0.00048300608065228126, "loss": 5.8297, "mean_token_accuracy": 0.1890963688492775, "num_tokens": 29563465.0, "step": 11665 }, { "entropy": 6.210170888900757, "epoch": 1.346797461050202, "grad_norm": 0.875, "learning_rate": 0.00048299034506929815, "loss": 5.7719, "mean_token_accuracy": 0.19281139075756074, "num_tokens": 29575891.0, "step": 11670 }, { "entropy": 6.244243478775024, "epoch": 1.3473744950952107, "grad_norm": 0.875, "learning_rate": 0.00048297460249066315, "loss": 5.9787, "mean_token_accuracy": 0.17319456934928895, "num_tokens": 29589162.0, "step": 11675 }, { "entropy": 6.291163921356201, "epoch": 1.3479515291402193, "grad_norm": 0.80859375, "learning_rate": 0.0004829588529169057, "loss": 5.8233, "mean_token_accuracy": 0.1888448789715767, "num_tokens": 29602735.0, "step": 11680 }, { "entropy": 6.167922639846802, "epoch": 1.348528563185228, "grad_norm": 0.9296875, "learning_rate": 0.0004829430963485555, "loss": 5.7813, "mean_token_accuracy": 0.19492802619934083, "num_tokens": 29615683.0, "step": 11685 }, { "entropy": 6.25222225189209, "epoch": 1.3491055972302366, "grad_norm": 0.9375, "learning_rate": 0.0004829273327861426, "loss": 5.8556, "mean_token_accuracy": 0.18927911818027496, "num_tokens": 29629606.0, "step": 11690 }, { "entropy": 6.201506853103638, "epoch": 1.3496826312752452, "grad_norm": 0.8828125, "learning_rate": 0.0004829115622301971, "loss": 5.838, "mean_token_accuracy": 0.19121850728988649, "num_tokens": 29642250.0, "step": 11695 }, { "entropy": 6.28028507232666, "epoch": 1.3502596653202539, "grad_norm": 0.82421875, "learning_rate": 0.00048289578468124956, "loss": 5.9316, "mean_token_accuracy": 0.1848507806658745, "num_tokens": 29655689.0, "step": 11700 }, { "entropy": 6.116147565841675, "epoch": 1.3508366993652625, "grad_norm": 0.92578125, "learning_rate": 0.00048288000013983046, "loss": 5.8409, "mean_token_accuracy": 0.182951357960701, "num_tokens": 29670084.0, "step": 11705 }, { "entropy": 6.25054349899292, "epoch": 1.3514137334102712, "grad_norm": 0.94140625, "learning_rate": 0.00048286420860647086, "loss": 5.8952, "mean_token_accuracy": 0.19066344499588012, "num_tokens": 29683453.0, "step": 11710 }, { "entropy": 6.269110584259034, "epoch": 1.3519907674552798, "grad_norm": 0.9375, "learning_rate": 0.00048284841008170185, "loss": 5.8098, "mean_token_accuracy": 0.18684105575084686, "num_tokens": 29695514.0, "step": 11715 }, { "entropy": 6.265933084487915, "epoch": 1.3525678015002884, "grad_norm": 0.828125, "learning_rate": 0.00048283260456605487, "loss": 5.8765, "mean_token_accuracy": 0.18586160689592363, "num_tokens": 29708544.0, "step": 11720 }, { "entropy": 6.3004742622375485, "epoch": 1.3531448355452973, "grad_norm": 0.859375, "learning_rate": 0.0004828167920600614, "loss": 5.8174, "mean_token_accuracy": 0.18437671512365342, "num_tokens": 29721310.0, "step": 11725 }, { "entropy": 6.225083684921264, "epoch": 1.3537218695903057, "grad_norm": 0.9453125, "learning_rate": 0.0004828009725642534, "loss": 5.8666, "mean_token_accuracy": 0.18544016480445863, "num_tokens": 29733995.0, "step": 11730 }, { "entropy": 6.239916563034058, "epoch": 1.3542989036353146, "grad_norm": 0.87890625, "learning_rate": 0.0004827851460791628, "loss": 5.9539, "mean_token_accuracy": 0.17822468280792236, "num_tokens": 29745896.0, "step": 11735 }, { "entropy": 6.290875339508057, "epoch": 1.3548759376803232, "grad_norm": 0.83984375, "learning_rate": 0.00048276931260532213, "loss": 5.8275, "mean_token_accuracy": 0.18893493413925172, "num_tokens": 29758967.0, "step": 11740 }, { "entropy": 6.263391494750977, "epoch": 1.3554529717253319, "grad_norm": 0.875, "learning_rate": 0.0004827534721432639, "loss": 5.8954, "mean_token_accuracy": 0.17974050343036652, "num_tokens": 29772167.0, "step": 11745 }, { "entropy": 6.1805259704589846, "epoch": 1.3560300057703405, "grad_norm": 0.84765625, "learning_rate": 0.0004827376246935207, "loss": 5.825, "mean_token_accuracy": 0.18858230412006377, "num_tokens": 29783841.0, "step": 11750 }, { "entropy": 6.261368370056152, "epoch": 1.3566070398153491, "grad_norm": 0.875, "learning_rate": 0.0004827217702566257, "loss": 5.9518, "mean_token_accuracy": 0.18142978847026825, "num_tokens": 29795993.0, "step": 11755 }, { "entropy": 6.229633855819702, "epoch": 1.3571840738603578, "grad_norm": 0.890625, "learning_rate": 0.00048270590883311217, "loss": 5.8547, "mean_token_accuracy": 0.19509654194116594, "num_tokens": 29807692.0, "step": 11760 }, { "entropy": 6.246022510528564, "epoch": 1.3577611079053664, "grad_norm": 0.83984375, "learning_rate": 0.00048269004042351363, "loss": 5.9361, "mean_token_accuracy": 0.18227415829896926, "num_tokens": 29820778.0, "step": 11765 }, { "entropy": 6.227572441101074, "epoch": 1.358338141950375, "grad_norm": 0.87109375, "learning_rate": 0.0004826741650283637, "loss": 5.8178, "mean_token_accuracy": 0.18706079721450805, "num_tokens": 29833976.0, "step": 11770 }, { "entropy": 6.193403339385986, "epoch": 1.3589151759953837, "grad_norm": 0.92578125, "learning_rate": 0.0004826582826481963, "loss": 5.8272, "mean_token_accuracy": 0.1925640806555748, "num_tokens": 29846226.0, "step": 11775 }, { "entropy": 6.178399324417114, "epoch": 1.3594922100403923, "grad_norm": 0.83984375, "learning_rate": 0.0004826423932835458, "loss": 5.8157, "mean_token_accuracy": 0.19034133553504945, "num_tokens": 29858483.0, "step": 11780 }, { "entropy": 6.2385763168334964, "epoch": 1.360069244085401, "grad_norm": 0.82421875, "learning_rate": 0.00048262649693494653, "loss": 5.8547, "mean_token_accuracy": 0.18518402725458144, "num_tokens": 29871178.0, "step": 11785 }, { "entropy": 6.2989908218383786, "epoch": 1.3606462781304096, "grad_norm": 0.91015625, "learning_rate": 0.0004826105936029332, "loss": 5.9334, "mean_token_accuracy": 0.17897191941738128, "num_tokens": 29885477.0, "step": 11790 }, { "entropy": 6.24438328742981, "epoch": 1.3612233121754183, "grad_norm": 0.83203125, "learning_rate": 0.0004825946832880406, "loss": 5.8913, "mean_token_accuracy": 0.17726410627365113, "num_tokens": 29897917.0, "step": 11795 }, { "entropy": 6.250182342529297, "epoch": 1.3618003462204271, "grad_norm": 0.84765625, "learning_rate": 0.00048257876599080404, "loss": 5.9065, "mean_token_accuracy": 0.1838986322283745, "num_tokens": 29911321.0, "step": 11800 }, { "entropy": 6.223178100585938, "epoch": 1.3623773802654355, "grad_norm": 0.9453125, "learning_rate": 0.00048256284171175874, "loss": 5.8162, "mean_token_accuracy": 0.1923563465476036, "num_tokens": 29924651.0, "step": 11805 }, { "entropy": 6.130005931854248, "epoch": 1.3629544143104444, "grad_norm": 0.859375, "learning_rate": 0.00048254691045144035, "loss": 5.7646, "mean_token_accuracy": 0.19032905250787735, "num_tokens": 29937334.0, "step": 11810 }, { "entropy": 6.1727530002594, "epoch": 1.363531448355453, "grad_norm": 0.875, "learning_rate": 0.0004825309722103848, "loss": 5.8041, "mean_token_accuracy": 0.1924701526761055, "num_tokens": 29949751.0, "step": 11815 }, { "entropy": 6.165993022918701, "epoch": 1.3641084824004617, "grad_norm": 0.85546875, "learning_rate": 0.000482515026989128, "loss": 5.8309, "mean_token_accuracy": 0.19365983903408052, "num_tokens": 29961675.0, "step": 11820 }, { "entropy": 6.295892810821533, "epoch": 1.3646855164454703, "grad_norm": 0.94921875, "learning_rate": 0.00048249907478820634, "loss": 5.9528, "mean_token_accuracy": 0.17994977831840514, "num_tokens": 29973222.0, "step": 11825 }, { "entropy": 6.31345272064209, "epoch": 1.365262550490479, "grad_norm": 0.84375, "learning_rate": 0.00048248311560815637, "loss": 5.959, "mean_token_accuracy": 0.17840566635131835, "num_tokens": 29985845.0, "step": 11830 }, { "entropy": 6.251032972335816, "epoch": 1.3658395845354876, "grad_norm": 0.890625, "learning_rate": 0.0004824671494495149, "loss": 5.895, "mean_token_accuracy": 0.18573582470417022, "num_tokens": 29998252.0, "step": 11835 }, { "entropy": 6.248889064788818, "epoch": 1.3664166185804962, "grad_norm": 0.94921875, "learning_rate": 0.0004824511763128189, "loss": 5.861, "mean_token_accuracy": 0.18926439434289932, "num_tokens": 30011150.0, "step": 11840 }, { "entropy": 6.287919282913208, "epoch": 1.3669936526255049, "grad_norm": 0.80078125, "learning_rate": 0.00048243519619860567, "loss": 5.9662, "mean_token_accuracy": 0.17687484472990037, "num_tokens": 30024750.0, "step": 11845 }, { "entropy": 6.197072124481201, "epoch": 1.3675706866705135, "grad_norm": 0.8515625, "learning_rate": 0.0004824192091074126, "loss": 5.7818, "mean_token_accuracy": 0.19744647443294525, "num_tokens": 30038317.0, "step": 11850 }, { "entropy": 6.201137447357178, "epoch": 1.3681477207155222, "grad_norm": 0.7890625, "learning_rate": 0.0004824032150397775, "loss": 5.9135, "mean_token_accuracy": 0.19055497795343398, "num_tokens": 30052156.0, "step": 11855 }, { "entropy": 6.2688305377960205, "epoch": 1.3687247547605308, "grad_norm": 0.91796875, "learning_rate": 0.00048238721399623824, "loss": 5.8899, "mean_token_accuracy": 0.1839185744524002, "num_tokens": 30063463.0, "step": 11860 }, { "entropy": 6.20152473449707, "epoch": 1.3693017888055397, "grad_norm": 0.90625, "learning_rate": 0.00048237120597733316, "loss": 5.8278, "mean_token_accuracy": 0.19133645594120025, "num_tokens": 30075090.0, "step": 11865 }, { "entropy": 6.1734706401824955, "epoch": 1.369878822850548, "grad_norm": 0.859375, "learning_rate": 0.0004823551909836005, "loss": 5.8125, "mean_token_accuracy": 0.18438569009304046, "num_tokens": 30087618.0, "step": 11870 }, { "entropy": 6.269489002227783, "epoch": 1.370455856895557, "grad_norm": 0.90625, "learning_rate": 0.00048233916901557896, "loss": 5.847, "mean_token_accuracy": 0.18638927936553956, "num_tokens": 30098781.0, "step": 11875 }, { "entropy": 6.193616151809692, "epoch": 1.3710328909405656, "grad_norm": 0.89453125, "learning_rate": 0.00048232314007380753, "loss": 5.8945, "mean_token_accuracy": 0.1961129903793335, "num_tokens": 30111163.0, "step": 11880 }, { "entropy": 6.20051646232605, "epoch": 1.3716099249855742, "grad_norm": 0.8515625, "learning_rate": 0.00048230710415882524, "loss": 5.8787, "mean_token_accuracy": 0.18906668871641158, "num_tokens": 30124609.0, "step": 11885 }, { "entropy": 6.268427467346191, "epoch": 1.3721869590305829, "grad_norm": 0.890625, "learning_rate": 0.00048229106127117144, "loss": 5.9442, "mean_token_accuracy": 0.18480219542980195, "num_tokens": 30137823.0, "step": 11890 }, { "entropy": 6.26952748298645, "epoch": 1.3727639930755915, "grad_norm": 0.89453125, "learning_rate": 0.0004822750114113858, "loss": 5.8328, "mean_token_accuracy": 0.18708803802728652, "num_tokens": 30150295.0, "step": 11895 }, { "entropy": 6.1457456111907955, "epoch": 1.3733410271206001, "grad_norm": 0.90625, "learning_rate": 0.0004822589545800081, "loss": 5.8049, "mean_token_accuracy": 0.18936679661273956, "num_tokens": 30163533.0, "step": 11900 }, { "entropy": 6.278868198394775, "epoch": 1.3739180611656088, "grad_norm": 0.87109375, "learning_rate": 0.0004822428907775784, "loss": 5.8765, "mean_token_accuracy": 0.18396926969289779, "num_tokens": 30176437.0, "step": 11905 }, { "entropy": 6.214042472839355, "epoch": 1.3744950952106174, "grad_norm": 0.875, "learning_rate": 0.00048222682000463704, "loss": 5.803, "mean_token_accuracy": 0.1939064934849739, "num_tokens": 30190181.0, "step": 11910 }, { "entropy": 6.17984972000122, "epoch": 1.375072129255626, "grad_norm": 0.94140625, "learning_rate": 0.0004822107422617245, "loss": 5.8492, "mean_token_accuracy": 0.1890665829181671, "num_tokens": 30202374.0, "step": 11915 }, { "entropy": 6.156255531311035, "epoch": 1.3756491633006347, "grad_norm": 0.90234375, "learning_rate": 0.00048219465754938156, "loss": 5.7737, "mean_token_accuracy": 0.18826987594366074, "num_tokens": 30215009.0, "step": 11920 }, { "entropy": 6.279652118682861, "epoch": 1.3762261973456433, "grad_norm": 0.8515625, "learning_rate": 0.00048217856586814926, "loss": 5.88, "mean_token_accuracy": 0.18167006224393845, "num_tokens": 30226688.0, "step": 11925 }, { "entropy": 6.277508211135864, "epoch": 1.376803231390652, "grad_norm": 0.8984375, "learning_rate": 0.00048216246721856875, "loss": 5.9408, "mean_token_accuracy": 0.18304099887609482, "num_tokens": 30238501.0, "step": 11930 }, { "entropy": 6.257796669006348, "epoch": 1.3773802654356606, "grad_norm": 1.7265625, "learning_rate": 0.00048214636160118164, "loss": 5.8067, "mean_token_accuracy": 0.19265892803668977, "num_tokens": 30250216.0, "step": 11935 }, { "entropy": 6.2177825450897215, "epoch": 1.3779572994806695, "grad_norm": 0.8671875, "learning_rate": 0.0004821302490165295, "loss": 5.8605, "mean_token_accuracy": 0.18837961107492446, "num_tokens": 30262555.0, "step": 11940 }, { "entropy": 6.170514822006226, "epoch": 1.378534333525678, "grad_norm": 0.8125, "learning_rate": 0.0004821141294651544, "loss": 5.7819, "mean_token_accuracy": 0.19309227615594865, "num_tokens": 30274593.0, "step": 11945 }, { "entropy": 6.200426197052002, "epoch": 1.3791113675706868, "grad_norm": 0.9140625, "learning_rate": 0.00048209800294759836, "loss": 5.7778, "mean_token_accuracy": 0.19841670393943786, "num_tokens": 30286579.0, "step": 11950 }, { "entropy": 6.261295652389526, "epoch": 1.3796884016156954, "grad_norm": 0.87109375, "learning_rate": 0.0004820818694644039, "loss": 5.8622, "mean_token_accuracy": 0.18498462438583374, "num_tokens": 30299186.0, "step": 11955 }, { "entropy": 6.345550584793091, "epoch": 1.380265435660704, "grad_norm": 0.875, "learning_rate": 0.00048206572901611364, "loss": 5.9244, "mean_token_accuracy": 0.18031724393367768, "num_tokens": 30311429.0, "step": 11960 }, { "entropy": 6.304241085052491, "epoch": 1.3808424697057127, "grad_norm": 0.84765625, "learning_rate": 0.00048204958160327034, "loss": 5.8993, "mean_token_accuracy": 0.18167479634284972, "num_tokens": 30323323.0, "step": 11965 }, { "entropy": 6.236213731765747, "epoch": 1.3814195037507213, "grad_norm": 0.8359375, "learning_rate": 0.00048203342722641726, "loss": 5.8821, "mean_token_accuracy": 0.18929619193077088, "num_tokens": 30335815.0, "step": 11970 }, { "entropy": 6.213303899765014, "epoch": 1.38199653779573, "grad_norm": 0.9609375, "learning_rate": 0.00048201726588609776, "loss": 5.786, "mean_token_accuracy": 0.18967500627040862, "num_tokens": 30347426.0, "step": 11975 }, { "entropy": 6.25053596496582, "epoch": 1.3825735718407386, "grad_norm": 0.82421875, "learning_rate": 0.00048200109758285534, "loss": 5.8717, "mean_token_accuracy": 0.18591604977846146, "num_tokens": 30359781.0, "step": 11980 }, { "entropy": 6.257670783996582, "epoch": 1.3831506058857472, "grad_norm": 0.7890625, "learning_rate": 0.0004819849223172337, "loss": 5.8721, "mean_token_accuracy": 0.18719411343336106, "num_tokens": 30373399.0, "step": 11985 }, { "entropy": 6.16593222618103, "epoch": 1.3837276399307559, "grad_norm": 0.91015625, "learning_rate": 0.00048196874008977716, "loss": 5.8336, "mean_token_accuracy": 0.1932594060897827, "num_tokens": 30386296.0, "step": 11990 }, { "entropy": 6.265296363830567, "epoch": 1.3843046739757645, "grad_norm": 0.93359375, "learning_rate": 0.0004819525509010298, "loss": 5.8941, "mean_token_accuracy": 0.190611732006073, "num_tokens": 30399496.0, "step": 11995 }, { "entropy": 6.225067758560181, "epoch": 1.3848817080207732, "grad_norm": 0.84375, "learning_rate": 0.0004819363547515361, "loss": 5.7934, "mean_token_accuracy": 0.188978311419487, "num_tokens": 30412491.0, "step": 12000 }, { "epoch": 1.3848817080207732, "eval_entropy": 6.072817668204352, "eval_loss": 5.934172630310059, "eval_mean_token_accuracy": 0.1899097032309053, "eval_num_tokens": 30412491.0, "eval_runtime": 17.6284, "eval_samples_per_second": 1596.06, "eval_steps_per_second": 199.508, "step": 12000 }, { "entropy": 6.301853895187378, "epoch": 1.385458742065782, "grad_norm": 0.80859375, "learning_rate": 0.000481920151641841, "loss": 5.9354, "mean_token_accuracy": 0.18052596896886824, "num_tokens": 30427600.0, "step": 12005 }, { "entropy": 6.260950231552124, "epoch": 1.3860357761107904, "grad_norm": 0.87890625, "learning_rate": 0.00048190394157248935, "loss": 5.8174, "mean_token_accuracy": 0.19201486110687255, "num_tokens": 30440534.0, "step": 12010 }, { "entropy": 6.197269535064697, "epoch": 1.3866128101557993, "grad_norm": 0.86328125, "learning_rate": 0.0004818877245440264, "loss": 5.8068, "mean_token_accuracy": 0.19823089689016343, "num_tokens": 30453996.0, "step": 12015 }, { "entropy": 6.251287364959717, "epoch": 1.3871898442008077, "grad_norm": 0.88671875, "learning_rate": 0.00048187150055699763, "loss": 5.8891, "mean_token_accuracy": 0.18284614086151124, "num_tokens": 30465667.0, "step": 12020 }, { "entropy": 6.2809501647949215, "epoch": 1.3877668782458166, "grad_norm": 0.86328125, "learning_rate": 0.0004818552696119487, "loss": 5.9209, "mean_token_accuracy": 0.18133794516324997, "num_tokens": 30478950.0, "step": 12025 }, { "entropy": 6.175559759140015, "epoch": 1.3883439122908252, "grad_norm": 0.9609375, "learning_rate": 0.0004818390317094255, "loss": 5.7649, "mean_token_accuracy": 0.19492525309324266, "num_tokens": 30490979.0, "step": 12030 }, { "entropy": 6.242245292663574, "epoch": 1.3889209463358339, "grad_norm": 0.87890625, "learning_rate": 0.0004818227868499742, "loss": 5.8052, "mean_token_accuracy": 0.19470774233341218, "num_tokens": 30504242.0, "step": 12035 }, { "entropy": 6.216363430023193, "epoch": 1.3894979803808425, "grad_norm": 0.921875, "learning_rate": 0.0004818065350341412, "loss": 5.9003, "mean_token_accuracy": 0.18019478619098664, "num_tokens": 30515739.0, "step": 12040 }, { "entropy": 6.287183237075806, "epoch": 1.3900750144258511, "grad_norm": 0.98046875, "learning_rate": 0.00048179027626247325, "loss": 5.8576, "mean_token_accuracy": 0.18424582928419114, "num_tokens": 30528338.0, "step": 12045 }, { "entropy": 6.294361686706543, "epoch": 1.3906520484708598, "grad_norm": 0.87890625, "learning_rate": 0.0004817740105355169, "loss": 5.9078, "mean_token_accuracy": 0.18659729063510894, "num_tokens": 30540572.0, "step": 12050 }, { "entropy": 6.259363889694214, "epoch": 1.3912290825158684, "grad_norm": 0.84765625, "learning_rate": 0.00048175773785381947, "loss": 5.9115, "mean_token_accuracy": 0.1899486929178238, "num_tokens": 30554317.0, "step": 12055 }, { "entropy": 6.24990553855896, "epoch": 1.391806116560877, "grad_norm": 0.95703125, "learning_rate": 0.00048174145821792833, "loss": 5.8755, "mean_token_accuracy": 0.1851966544985771, "num_tokens": 30567177.0, "step": 12060 }, { "entropy": 6.32722430229187, "epoch": 1.3923831506058857, "grad_norm": 0.97265625, "learning_rate": 0.0004817251716283908, "loss": 5.8673, "mean_token_accuracy": 0.18701709061861038, "num_tokens": 30577948.0, "step": 12065 }, { "entropy": 6.19557638168335, "epoch": 1.3929601846508943, "grad_norm": 0.91015625, "learning_rate": 0.0004817088780857548, "loss": 5.8476, "mean_token_accuracy": 0.18737161308526992, "num_tokens": 30590548.0, "step": 12070 }, { "entropy": 6.2240033626556395, "epoch": 1.393537218695903, "grad_norm": 0.8828125, "learning_rate": 0.00048169257759056845, "loss": 5.7913, "mean_token_accuracy": 0.19839557707309724, "num_tokens": 30602735.0, "step": 12075 }, { "entropy": 6.259526157379151, "epoch": 1.3941142527409118, "grad_norm": 0.87890625, "learning_rate": 0.00048167627014337994, "loss": 5.9117, "mean_token_accuracy": 0.18355602622032166, "num_tokens": 30615112.0, "step": 12080 }, { "entropy": 6.180841445922852, "epoch": 1.3946912867859202, "grad_norm": 0.953125, "learning_rate": 0.00048165995574473764, "loss": 5.835, "mean_token_accuracy": 0.1852560117840767, "num_tokens": 30627406.0, "step": 12085 }, { "entropy": 6.213917303085327, "epoch": 1.395268320830929, "grad_norm": 0.95703125, "learning_rate": 0.00048164363439519043, "loss": 5.8516, "mean_token_accuracy": 0.19082715213298798, "num_tokens": 30639764.0, "step": 12090 }, { "entropy": 6.253957509994507, "epoch": 1.3958453548759377, "grad_norm": 0.90234375, "learning_rate": 0.0004816273060952873, "loss": 5.8598, "mean_token_accuracy": 0.18492789268493653, "num_tokens": 30652181.0, "step": 12095 }, { "entropy": 6.233830738067627, "epoch": 1.3964223889209464, "grad_norm": 0.91015625, "learning_rate": 0.00048161097084557726, "loss": 5.8424, "mean_token_accuracy": 0.18780053853988649, "num_tokens": 30663586.0, "step": 12100 }, { "entropy": 6.323609018325806, "epoch": 1.396999422965955, "grad_norm": 0.92578125, "learning_rate": 0.00048159462864660993, "loss": 5.9321, "mean_token_accuracy": 0.18068586885929108, "num_tokens": 30676218.0, "step": 12105 }, { "entropy": 6.298351240158081, "epoch": 1.3975764570109637, "grad_norm": 0.84765625, "learning_rate": 0.0004815782794989348, "loss": 5.9088, "mean_token_accuracy": 0.1828354611992836, "num_tokens": 30688532.0, "step": 12110 }, { "entropy": 6.219765090942383, "epoch": 1.3981534910559723, "grad_norm": 0.984375, "learning_rate": 0.0004815619234031019, "loss": 5.8698, "mean_token_accuracy": 0.1810378611087799, "num_tokens": 30700698.0, "step": 12115 }, { "entropy": 6.214390087127685, "epoch": 1.398730525100981, "grad_norm": 0.84375, "learning_rate": 0.0004815455603596613, "loss": 5.8682, "mean_token_accuracy": 0.1863407924771309, "num_tokens": 30713032.0, "step": 12120 }, { "entropy": 6.20099720954895, "epoch": 1.3993075591459896, "grad_norm": 0.890625, "learning_rate": 0.0004815291903691634, "loss": 5.8065, "mean_token_accuracy": 0.19326940029859543, "num_tokens": 30726829.0, "step": 12125 }, { "entropy": 6.300219249725342, "epoch": 1.3998845931909982, "grad_norm": 0.890625, "learning_rate": 0.00048151281343215873, "loss": 5.9029, "mean_token_accuracy": 0.1824083521962166, "num_tokens": 30740280.0, "step": 12130 }, { "entropy": 6.16341199874878, "epoch": 1.4004616272360069, "grad_norm": 0.90625, "learning_rate": 0.0004814964295491982, "loss": 5.7467, "mean_token_accuracy": 0.19635725021362305, "num_tokens": 30753467.0, "step": 12135 }, { "entropy": 6.192393827438354, "epoch": 1.4010386612810155, "grad_norm": 0.890625, "learning_rate": 0.00048148003872083286, "loss": 5.8313, "mean_token_accuracy": 0.19740188717842103, "num_tokens": 30766958.0, "step": 12140 }, { "entropy": 6.251896476745605, "epoch": 1.4016156953260244, "grad_norm": 0.8984375, "learning_rate": 0.00048146364094761384, "loss": 5.9156, "mean_token_accuracy": 0.18174671679735183, "num_tokens": 30779114.0, "step": 12145 }, { "entropy": 6.271113157272339, "epoch": 1.4021927293710328, "grad_norm": 0.9765625, "learning_rate": 0.00048144723623009297, "loss": 5.813, "mean_token_accuracy": 0.1902441129088402, "num_tokens": 30792063.0, "step": 12150 }, { "entropy": 6.254286670684815, "epoch": 1.4027697634160416, "grad_norm": 0.8515625, "learning_rate": 0.0004814308245688218, "loss": 5.8958, "mean_token_accuracy": 0.18653863221406936, "num_tokens": 30804404.0, "step": 12155 }, { "entropy": 6.170608806610107, "epoch": 1.40334679746105, "grad_norm": 0.85546875, "learning_rate": 0.00048141440596435235, "loss": 5.8196, "mean_token_accuracy": 0.19177932739257814, "num_tokens": 30817607.0, "step": 12160 }, { "entropy": 6.21555871963501, "epoch": 1.403923831506059, "grad_norm": 0.8203125, "learning_rate": 0.0004813979804172369, "loss": 5.893, "mean_token_accuracy": 0.18380023390054703, "num_tokens": 30831077.0, "step": 12165 }, { "entropy": 6.276795530319214, "epoch": 1.4045008655510676, "grad_norm": 0.875, "learning_rate": 0.00048138154792802795, "loss": 5.983, "mean_token_accuracy": 0.18137128055095672, "num_tokens": 30844096.0, "step": 12170 }, { "entropy": 6.295123624801636, "epoch": 1.4050778995960762, "grad_norm": 0.91015625, "learning_rate": 0.0004813651084972781, "loss": 5.8887, "mean_token_accuracy": 0.18827279955148696, "num_tokens": 30856147.0, "step": 12175 }, { "entropy": 6.258724975585937, "epoch": 1.4056549336410848, "grad_norm": 0.8828125, "learning_rate": 0.00048134866212554036, "loss": 5.8853, "mean_token_accuracy": 0.17940700948238372, "num_tokens": 30869436.0, "step": 12180 }, { "entropy": 6.209239101409912, "epoch": 1.4062319676860935, "grad_norm": 0.84375, "learning_rate": 0.0004813322088133679, "loss": 5.8189, "mean_token_accuracy": 0.19204139113426208, "num_tokens": 30882313.0, "step": 12185 }, { "entropy": 6.2562541484832765, "epoch": 1.4068090017311021, "grad_norm": 0.89453125, "learning_rate": 0.00048131574856131407, "loss": 5.8396, "mean_token_accuracy": 0.1857314497232437, "num_tokens": 30895062.0, "step": 12190 }, { "entropy": 6.227566480636597, "epoch": 1.4073860357761108, "grad_norm": 0.91796875, "learning_rate": 0.0004812992813699324, "loss": 5.8386, "mean_token_accuracy": 0.18683320432901382, "num_tokens": 30907736.0, "step": 12195 }, { "entropy": 6.220577239990234, "epoch": 1.4079630698211194, "grad_norm": 0.875, "learning_rate": 0.000481282807239777, "loss": 5.8431, "mean_token_accuracy": 0.19073092341423034, "num_tokens": 30920462.0, "step": 12200 }, { "entropy": 6.217762279510498, "epoch": 1.408540103866128, "grad_norm": 0.87890625, "learning_rate": 0.0004812663261714019, "loss": 5.7836, "mean_token_accuracy": 0.19252836406230928, "num_tokens": 30933501.0, "step": 12205 }, { "entropy": 6.223458099365234, "epoch": 1.4091171379111367, "grad_norm": 0.9140625, "learning_rate": 0.0004812498381653613, "loss": 5.7691, "mean_token_accuracy": 0.19711357057094575, "num_tokens": 30944780.0, "step": 12210 }, { "entropy": 6.21431188583374, "epoch": 1.4096941719561453, "grad_norm": 0.89453125, "learning_rate": 0.0004812333432222098, "loss": 5.8125, "mean_token_accuracy": 0.19472504109144212, "num_tokens": 30957730.0, "step": 12215 }, { "entropy": 6.009715795516968, "epoch": 1.4102712060011542, "grad_norm": 0.91796875, "learning_rate": 0.0004812168413425023, "loss": 5.6882, "mean_token_accuracy": 0.20412740260362625, "num_tokens": 30969371.0, "step": 12220 }, { "entropy": 6.231176328659058, "epoch": 1.4108482400461626, "grad_norm": 0.8359375, "learning_rate": 0.00048120033252679374, "loss": 5.8924, "mean_token_accuracy": 0.18615046590566636, "num_tokens": 30983662.0, "step": 12225 }, { "entropy": 6.312102746963501, "epoch": 1.4114252740911715, "grad_norm": 0.8828125, "learning_rate": 0.00048118381677563946, "loss": 5.8878, "mean_token_accuracy": 0.18438036888837814, "num_tokens": 30995641.0, "step": 12230 }, { "entropy": 6.28008394241333, "epoch": 1.41200230813618, "grad_norm": 0.91796875, "learning_rate": 0.0004811672940895949, "loss": 5.9443, "mean_token_accuracy": 0.18446469008922578, "num_tokens": 31008508.0, "step": 12235 }, { "entropy": 6.293724393844604, "epoch": 1.4125793421811887, "grad_norm": 0.890625, "learning_rate": 0.0004811507644692158, "loss": 5.9187, "mean_token_accuracy": 0.18171917498111725, "num_tokens": 31020903.0, "step": 12240 }, { "entropy": 6.257511377334595, "epoch": 1.4131563762261974, "grad_norm": 0.80859375, "learning_rate": 0.0004811342279150581, "loss": 5.8593, "mean_token_accuracy": 0.190650050342083, "num_tokens": 31033668.0, "step": 12245 }, { "entropy": 6.258108806610108, "epoch": 1.413733410271206, "grad_norm": 0.87109375, "learning_rate": 0.0004811176844276781, "loss": 5.9092, "mean_token_accuracy": 0.1842113733291626, "num_tokens": 31046980.0, "step": 12250 }, { "entropy": 6.205495929718017, "epoch": 1.4143104443162147, "grad_norm": 0.8359375, "learning_rate": 0.0004811011340076322, "loss": 5.8128, "mean_token_accuracy": 0.186430487036705, "num_tokens": 31059023.0, "step": 12255 }, { "entropy": 6.267776298522949, "epoch": 1.4148874783612233, "grad_norm": 0.93359375, "learning_rate": 0.00048108457665547695, "loss": 5.8526, "mean_token_accuracy": 0.18937126398086548, "num_tokens": 31070449.0, "step": 12260 }, { "entropy": 6.198201084136963, "epoch": 1.415464512406232, "grad_norm": 0.9140625, "learning_rate": 0.0004810680123717694, "loss": 5.8053, "mean_token_accuracy": 0.19537163823843, "num_tokens": 31081974.0, "step": 12265 }, { "entropy": 6.23746509552002, "epoch": 1.4160415464512406, "grad_norm": 0.90625, "learning_rate": 0.0004810514411570666, "loss": 5.8773, "mean_token_accuracy": 0.18206487745046615, "num_tokens": 31094825.0, "step": 12270 }, { "entropy": 6.164452695846558, "epoch": 1.4166185804962492, "grad_norm": 0.9140625, "learning_rate": 0.0004810348630119259, "loss": 5.8424, "mean_token_accuracy": 0.18676037788391114, "num_tokens": 31106589.0, "step": 12275 }, { "entropy": 6.306876564025879, "epoch": 1.4171956145412579, "grad_norm": 0.88671875, "learning_rate": 0.00048101827793690493, "loss": 5.8616, "mean_token_accuracy": 0.17967692017555237, "num_tokens": 31118228.0, "step": 12280 }, { "entropy": 6.314551591873169, "epoch": 1.4177726485862667, "grad_norm": 0.93359375, "learning_rate": 0.0004810016859325615, "loss": 5.9554, "mean_token_accuracy": 0.18243657797574997, "num_tokens": 31131396.0, "step": 12285 }, { "entropy": 6.237841653823852, "epoch": 1.4183496826312751, "grad_norm": 0.87109375, "learning_rate": 0.0004809850869994537, "loss": 5.8619, "mean_token_accuracy": 0.1885082244873047, "num_tokens": 31145524.0, "step": 12290 }, { "entropy": 6.274528551101684, "epoch": 1.418926716676284, "grad_norm": 0.9296875, "learning_rate": 0.0004809684811381398, "loss": 5.8248, "mean_token_accuracy": 0.1977459728717804, "num_tokens": 31157866.0, "step": 12295 }, { "entropy": 6.155285167694092, "epoch": 1.4195037507212924, "grad_norm": 0.85546875, "learning_rate": 0.0004809518683491785, "loss": 5.7666, "mean_token_accuracy": 0.19823187589645386, "num_tokens": 31170634.0, "step": 12300 }, { "entropy": 6.192041683197021, "epoch": 1.4200807847663013, "grad_norm": 0.88671875, "learning_rate": 0.00048093524863312823, "loss": 5.8119, "mean_token_accuracy": 0.18903475552797316, "num_tokens": 31183585.0, "step": 12305 }, { "entropy": 6.261973333358765, "epoch": 1.42065781881131, "grad_norm": 0.90234375, "learning_rate": 0.0004809186219905482, "loss": 5.8426, "mean_token_accuracy": 0.18727468997240065, "num_tokens": 31196375.0, "step": 12310 }, { "entropy": 6.18221230506897, "epoch": 1.4212348528563186, "grad_norm": 0.87890625, "learning_rate": 0.0004809019884219976, "loss": 5.8249, "mean_token_accuracy": 0.19580861926078796, "num_tokens": 31209797.0, "step": 12315 }, { "entropy": 6.166803169250488, "epoch": 1.4218118869013272, "grad_norm": 0.94921875, "learning_rate": 0.00048088534792803595, "loss": 5.7396, "mean_token_accuracy": 0.19430786818265916, "num_tokens": 31221196.0, "step": 12320 }, { "entropy": 6.259878826141358, "epoch": 1.4223889209463358, "grad_norm": 0.96875, "learning_rate": 0.00048086870050922286, "loss": 5.8522, "mean_token_accuracy": 0.18935182839632034, "num_tokens": 31234126.0, "step": 12325 }, { "entropy": 6.252271556854248, "epoch": 1.4229659549913445, "grad_norm": 0.86328125, "learning_rate": 0.00048085204616611833, "loss": 5.873, "mean_token_accuracy": 0.18678005188703536, "num_tokens": 31245933.0, "step": 12330 }, { "entropy": 6.192243480682373, "epoch": 1.4235429890363531, "grad_norm": 0.87890625, "learning_rate": 0.00048083538489928246, "loss": 5.8689, "mean_token_accuracy": 0.18617866486310958, "num_tokens": 31258734.0, "step": 12335 }, { "entropy": 6.227387714385986, "epoch": 1.4241200230813618, "grad_norm": 0.9296875, "learning_rate": 0.0004808187167092757, "loss": 5.7521, "mean_token_accuracy": 0.18657746613025666, "num_tokens": 31272487.0, "step": 12340 }, { "entropy": 6.213850641250611, "epoch": 1.4246970571263704, "grad_norm": 0.87890625, "learning_rate": 0.0004808020415966586, "loss": 5.8346, "mean_token_accuracy": 0.18490028977394105, "num_tokens": 31285117.0, "step": 12345 }, { "entropy": 6.222880744934082, "epoch": 1.425274091171379, "grad_norm": 0.85546875, "learning_rate": 0.000480785359561992, "loss": 5.809, "mean_token_accuracy": 0.19161065220832824, "num_tokens": 31297772.0, "step": 12350 }, { "entropy": 6.2099446773529055, "epoch": 1.4258511252163877, "grad_norm": 0.9296875, "learning_rate": 0.00048076867060583704, "loss": 5.8379, "mean_token_accuracy": 0.1893964871764183, "num_tokens": 31310901.0, "step": 12355 }, { "entropy": 6.23720760345459, "epoch": 1.4264281592613965, "grad_norm": 0.99609375, "learning_rate": 0.0004807519747287551, "loss": 5.8364, "mean_token_accuracy": 0.18434469103813172, "num_tokens": 31323090.0, "step": 12360 }, { "entropy": 6.192369842529297, "epoch": 1.427005193306405, "grad_norm": 0.87890625, "learning_rate": 0.0004807352719313078, "loss": 5.7538, "mean_token_accuracy": 0.1981295555830002, "num_tokens": 31335883.0, "step": 12365 }, { "entropy": 6.29363317489624, "epoch": 1.4275822273514138, "grad_norm": 0.97265625, "learning_rate": 0.0004807185622140567, "loss": 5.9025, "mean_token_accuracy": 0.18681400418281555, "num_tokens": 31348237.0, "step": 12370 }, { "entropy": 6.159489631652832, "epoch": 1.4281592613964225, "grad_norm": 0.92578125, "learning_rate": 0.00048070184557756396, "loss": 5.7452, "mean_token_accuracy": 0.1910381242632866, "num_tokens": 31360414.0, "step": 12375 }, { "entropy": 6.228966617584229, "epoch": 1.428736295441431, "grad_norm": 0.94921875, "learning_rate": 0.00048068512202239177, "loss": 5.8706, "mean_token_accuracy": 0.18762275874614714, "num_tokens": 31372765.0, "step": 12380 }, { "entropy": 6.2343464374542235, "epoch": 1.4293133294864397, "grad_norm": 0.93359375, "learning_rate": 0.0004806683915491028, "loss": 5.8246, "mean_token_accuracy": 0.19126800447702408, "num_tokens": 31386176.0, "step": 12385 }, { "entropy": 6.275753688812256, "epoch": 1.4298903635314484, "grad_norm": 0.95703125, "learning_rate": 0.0004806516541582596, "loss": 5.9217, "mean_token_accuracy": 0.1823081776499748, "num_tokens": 31398385.0, "step": 12390 }, { "entropy": 6.1845824241638185, "epoch": 1.430467397576457, "grad_norm": 0.80078125, "learning_rate": 0.00048063490985042506, "loss": 5.768, "mean_token_accuracy": 0.1930743232369423, "num_tokens": 31410841.0, "step": 12395 }, { "entropy": 6.193290281295776, "epoch": 1.4310444316214657, "grad_norm": 0.92578125, "learning_rate": 0.0004806181586261626, "loss": 5.7982, "mean_token_accuracy": 0.19314497709274292, "num_tokens": 31425586.0, "step": 12400 }, { "entropy": 6.232039213180542, "epoch": 1.4316214656664743, "grad_norm": 0.8984375, "learning_rate": 0.00048060140048603544, "loss": 5.8241, "mean_token_accuracy": 0.19228676557540894, "num_tokens": 31438943.0, "step": 12405 }, { "entropy": 6.189572191238403, "epoch": 1.432198499711483, "grad_norm": 0.91796875, "learning_rate": 0.0004805846354306073, "loss": 5.7794, "mean_token_accuracy": 0.19570462852716447, "num_tokens": 31452284.0, "step": 12410 }, { "entropy": 6.265307140350342, "epoch": 1.4327755337564916, "grad_norm": 0.93359375, "learning_rate": 0.00048056786346044214, "loss": 5.9258, "mean_token_accuracy": 0.1752777561545372, "num_tokens": 31466311.0, "step": 12415 }, { "entropy": 6.276501178741455, "epoch": 1.4333525678015002, "grad_norm": 0.9140625, "learning_rate": 0.00048055108457610395, "loss": 5.7913, "mean_token_accuracy": 0.19310199171304704, "num_tokens": 31478916.0, "step": 12420 }, { "entropy": 6.2271256923675535, "epoch": 1.4339296018465089, "grad_norm": 0.8515625, "learning_rate": 0.0004805342987781571, "loss": 5.8388, "mean_token_accuracy": 0.18540789186954498, "num_tokens": 31490337.0, "step": 12425 }, { "entropy": 6.191142988204956, "epoch": 1.4345066358915175, "grad_norm": 0.93359375, "learning_rate": 0.0004805175060671663, "loss": 5.837, "mean_token_accuracy": 0.1861076056957245, "num_tokens": 31502625.0, "step": 12430 }, { "entropy": 6.269933652877808, "epoch": 1.4350836699365264, "grad_norm": 0.8671875, "learning_rate": 0.0004805007064436962, "loss": 5.8688, "mean_token_accuracy": 0.18913554698228835, "num_tokens": 31515440.0, "step": 12435 }, { "entropy": 6.261519908905029, "epoch": 1.4356607039815348, "grad_norm": 0.9375, "learning_rate": 0.0004804838999083119, "loss": 5.8387, "mean_token_accuracy": 0.18860826641321182, "num_tokens": 31527812.0, "step": 12440 }, { "entropy": 6.2459697246551515, "epoch": 1.4362377380265436, "grad_norm": 0.98828125, "learning_rate": 0.0004804670864615787, "loss": 5.8288, "mean_token_accuracy": 0.18852628469467164, "num_tokens": 31540249.0, "step": 12445 }, { "entropy": 6.170604562759399, "epoch": 1.4368147720715523, "grad_norm": 0.86328125, "learning_rate": 0.00048045026610406223, "loss": 5.7808, "mean_token_accuracy": 0.19519326835870743, "num_tokens": 31552312.0, "step": 12450 }, { "entropy": 6.271270418167115, "epoch": 1.437391806116561, "grad_norm": 0.890625, "learning_rate": 0.000480433438836328, "loss": 5.8401, "mean_token_accuracy": 0.1857555016875267, "num_tokens": 31564496.0, "step": 12455 }, { "entropy": 6.26390962600708, "epoch": 1.4379688401615696, "grad_norm": 0.87890625, "learning_rate": 0.00048041660465894206, "loss": 5.8391, "mean_token_accuracy": 0.18578193783760072, "num_tokens": 31577705.0, "step": 12460 }, { "entropy": 6.277010202407837, "epoch": 1.4385458742065782, "grad_norm": 0.8984375, "learning_rate": 0.0004803997635724707, "loss": 5.8735, "mean_token_accuracy": 0.1823616862297058, "num_tokens": 31589566.0, "step": 12465 }, { "entropy": 6.256769752502441, "epoch": 1.4391229082515868, "grad_norm": 0.8359375, "learning_rate": 0.0004803829155774804, "loss": 5.8826, "mean_token_accuracy": 0.1852583885192871, "num_tokens": 31602379.0, "step": 12470 }, { "entropy": 6.250380563735962, "epoch": 1.4396999422965955, "grad_norm": 0.85546875, "learning_rate": 0.0004803660606745377, "loss": 5.8274, "mean_token_accuracy": 0.19224091172218322, "num_tokens": 31615469.0, "step": 12475 }, { "entropy": 6.2556861400604244, "epoch": 1.4402769763416041, "grad_norm": 0.9140625, "learning_rate": 0.00048034919886420953, "loss": 5.932, "mean_token_accuracy": 0.18619346469640732, "num_tokens": 31627129.0, "step": 12480 }, { "entropy": 6.294282674789429, "epoch": 1.4408540103866128, "grad_norm": 0.859375, "learning_rate": 0.00048033233014706304, "loss": 5.8952, "mean_token_accuracy": 0.18746394217014312, "num_tokens": 31639564.0, "step": 12485 }, { "entropy": 6.1616355895996096, "epoch": 1.4414310444316214, "grad_norm": 0.875, "learning_rate": 0.00048031545452366565, "loss": 5.8522, "mean_token_accuracy": 0.18221624940633774, "num_tokens": 31651984.0, "step": 12490 }, { "entropy": 6.274483489990234, "epoch": 1.44200807847663, "grad_norm": 0.9140625, "learning_rate": 0.00048029857199458493, "loss": 5.8248, "mean_token_accuracy": 0.1933693617582321, "num_tokens": 31664850.0, "step": 12495 }, { "entropy": 6.172151279449463, "epoch": 1.442585112521639, "grad_norm": 0.93359375, "learning_rate": 0.00048028168256038873, "loss": 5.8083, "mean_token_accuracy": 0.19690240025520325, "num_tokens": 31676993.0, "step": 12500 }, { "entropy": 6.241194343566894, "epoch": 1.4431621465666473, "grad_norm": 0.9453125, "learning_rate": 0.00048026478622164513, "loss": 5.9103, "mean_token_accuracy": 0.19012573957443238, "num_tokens": 31689632.0, "step": 12505 }, { "entropy": 6.277917289733887, "epoch": 1.4437391806116562, "grad_norm": 0.92578125, "learning_rate": 0.00048024788297892234, "loss": 5.8514, "mean_token_accuracy": 0.18539552241563798, "num_tokens": 31701610.0, "step": 12510 }, { "entropy": 6.220233011245727, "epoch": 1.4443162146566648, "grad_norm": 0.90625, "learning_rate": 0.000480230972832789, "loss": 5.8238, "mean_token_accuracy": 0.18775998800992966, "num_tokens": 31713838.0, "step": 12515 }, { "entropy": 6.17543592453003, "epoch": 1.4448932487016735, "grad_norm": 0.9296875, "learning_rate": 0.00048021405578381384, "loss": 5.78, "mean_token_accuracy": 0.19356610178947448, "num_tokens": 31726097.0, "step": 12520 }, { "entropy": 6.206122636795044, "epoch": 1.445470282746682, "grad_norm": 0.8515625, "learning_rate": 0.0004801971318325659, "loss": 5.8184, "mean_token_accuracy": 0.1879914492368698, "num_tokens": 31739646.0, "step": 12525 }, { "entropy": 6.21998233795166, "epoch": 1.4460473167916907, "grad_norm": 0.87890625, "learning_rate": 0.0004801802009796142, "loss": 5.8003, "mean_token_accuracy": 0.19319549351930618, "num_tokens": 31752161.0, "step": 12530 }, { "entropy": 6.206159591674805, "epoch": 1.4466243508366994, "grad_norm": 0.83984375, "learning_rate": 0.0004801632632255285, "loss": 5.8059, "mean_token_accuracy": 0.18725275844335557, "num_tokens": 31764498.0, "step": 12535 }, { "entropy": 6.285904359817505, "epoch": 1.447201384881708, "grad_norm": 0.9453125, "learning_rate": 0.0004801463185708783, "loss": 5.8608, "mean_token_accuracy": 0.18627117872238158, "num_tokens": 31776453.0, "step": 12540 }, { "entropy": 6.210245609283447, "epoch": 1.4477784189267167, "grad_norm": 0.95703125, "learning_rate": 0.00048012936701623363, "loss": 5.9274, "mean_token_accuracy": 0.18175046145915985, "num_tokens": 31789761.0, "step": 12545 }, { "entropy": 6.2855147361755375, "epoch": 1.4483554529717253, "grad_norm": 0.8515625, "learning_rate": 0.00048011240856216456, "loss": 5.9142, "mean_token_accuracy": 0.18825961649417877, "num_tokens": 31802689.0, "step": 12550 }, { "entropy": 6.23141303062439, "epoch": 1.448932487016734, "grad_norm": 0.93359375, "learning_rate": 0.00048009544320924154, "loss": 5.8918, "mean_token_accuracy": 0.18411456793546677, "num_tokens": 31816768.0, "step": 12555 }, { "entropy": 6.213440322875977, "epoch": 1.4495095210617426, "grad_norm": 0.875, "learning_rate": 0.0004800784709580351, "loss": 5.8276, "mean_token_accuracy": 0.1924056515097618, "num_tokens": 31828920.0, "step": 12560 }, { "entropy": 6.235508108139038, "epoch": 1.4500865551067512, "grad_norm": 0.98828125, "learning_rate": 0.0004800614918091161, "loss": 5.8868, "mean_token_accuracy": 0.18438960909843444, "num_tokens": 31841467.0, "step": 12565 }, { "entropy": 6.269950532913208, "epoch": 1.4506635891517599, "grad_norm": 0.97265625, "learning_rate": 0.0004800445057630558, "loss": 5.8879, "mean_token_accuracy": 0.18824739307165145, "num_tokens": 31855254.0, "step": 12570 }, { "entropy": 6.227955436706543, "epoch": 1.4512406231967687, "grad_norm": 0.87890625, "learning_rate": 0.0004800275128204254, "loss": 5.823, "mean_token_accuracy": 0.1889019101858139, "num_tokens": 31868234.0, "step": 12575 }, { "entropy": 6.259027624130249, "epoch": 1.4518176572417771, "grad_norm": 0.83984375, "learning_rate": 0.00048001051298179637, "loss": 5.8882, "mean_token_accuracy": 0.19090647697448732, "num_tokens": 31880014.0, "step": 12580 }, { "entropy": 6.228473424911499, "epoch": 1.452394691286786, "grad_norm": 0.92578125, "learning_rate": 0.0004799935062477407, "loss": 5.8329, "mean_token_accuracy": 0.18438107669353485, "num_tokens": 31892019.0, "step": 12585 }, { "entropy": 6.267324924468994, "epoch": 1.4529717253317946, "grad_norm": 0.9140625, "learning_rate": 0.00047997649261883013, "loss": 5.8476, "mean_token_accuracy": 0.18466779142618178, "num_tokens": 31905837.0, "step": 12590 }, { "entropy": 6.244672107696533, "epoch": 1.4535487593768033, "grad_norm": 0.953125, "learning_rate": 0.0004799594720956371, "loss": 5.8252, "mean_token_accuracy": 0.18755768984556198, "num_tokens": 31917823.0, "step": 12595 }, { "entropy": 6.280782175064087, "epoch": 1.454125793421812, "grad_norm": 0.90234375, "learning_rate": 0.00047994244467873407, "loss": 5.8977, "mean_token_accuracy": 0.1816701665520668, "num_tokens": 31931221.0, "step": 12600 }, { "entropy": 6.224785327911377, "epoch": 1.4547028274668206, "grad_norm": 1.0, "learning_rate": 0.00047992541036869364, "loss": 5.8497, "mean_token_accuracy": 0.18835566192865372, "num_tokens": 31943739.0, "step": 12605 }, { "entropy": 6.2321693897247314, "epoch": 1.4552798615118292, "grad_norm": 0.85546875, "learning_rate": 0.0004799083691660889, "loss": 5.9111, "mean_token_accuracy": 0.1834364727139473, "num_tokens": 31957805.0, "step": 12610 }, { "entropy": 6.254454278945923, "epoch": 1.4558568955568378, "grad_norm": 0.92578125, "learning_rate": 0.0004798913210714929, "loss": 5.8623, "mean_token_accuracy": 0.19286692887544632, "num_tokens": 31970983.0, "step": 12615 }, { "entropy": 6.22641954421997, "epoch": 1.4564339296018465, "grad_norm": 0.9375, "learning_rate": 0.00047987426608547915, "loss": 5.8475, "mean_token_accuracy": 0.19006728231906891, "num_tokens": 31982985.0, "step": 12620 }, { "entropy": 6.202101469039917, "epoch": 1.4570109636468551, "grad_norm": 0.890625, "learning_rate": 0.0004798572042086212, "loss": 5.8051, "mean_token_accuracy": 0.18875966370105743, "num_tokens": 31994854.0, "step": 12625 }, { "entropy": 6.293975305557251, "epoch": 1.4575879976918638, "grad_norm": 0.8984375, "learning_rate": 0.00047984013544149286, "loss": 5.9473, "mean_token_accuracy": 0.178886578977108, "num_tokens": 32007476.0, "step": 12630 }, { "entropy": 6.299429178237915, "epoch": 1.4581650317368724, "grad_norm": 0.90625, "learning_rate": 0.00047982305978466836, "loss": 5.8671, "mean_token_accuracy": 0.19250797629356384, "num_tokens": 32021417.0, "step": 12635 }, { "entropy": 6.179995727539063, "epoch": 1.4587420657818813, "grad_norm": 0.9296875, "learning_rate": 0.00047980597723872205, "loss": 5.8372, "mean_token_accuracy": 0.18427969366312028, "num_tokens": 32033997.0, "step": 12640 }, { "entropy": 6.194073438644409, "epoch": 1.4593190998268897, "grad_norm": 0.90234375, "learning_rate": 0.0004797888878042283, "loss": 5.8245, "mean_token_accuracy": 0.1968119978904724, "num_tokens": 32046797.0, "step": 12645 }, { "entropy": 6.255892372131347, "epoch": 1.4598961338718985, "grad_norm": 0.89453125, "learning_rate": 0.00047977179148176217, "loss": 5.8042, "mean_token_accuracy": 0.19345609843730927, "num_tokens": 32060797.0, "step": 12650 }, { "entropy": 6.2575019836425785, "epoch": 1.4604731679169072, "grad_norm": 1.0546875, "learning_rate": 0.0004797546882718985, "loss": 5.913, "mean_token_accuracy": 0.18159203082323075, "num_tokens": 32073936.0, "step": 12655 }, { "entropy": 6.197871112823487, "epoch": 1.4610502019619158, "grad_norm": 0.8046875, "learning_rate": 0.00047973757817521256, "loss": 5.7969, "mean_token_accuracy": 0.1944518953561783, "num_tokens": 32086730.0, "step": 12660 }, { "entropy": 6.288273477554322, "epoch": 1.4616272360069245, "grad_norm": 0.87890625, "learning_rate": 0.0004797204611922799, "loss": 5.888, "mean_token_accuracy": 0.18709647357463838, "num_tokens": 32099201.0, "step": 12665 }, { "entropy": 6.1809022426605225, "epoch": 1.462204270051933, "grad_norm": 0.8984375, "learning_rate": 0.00047970333732367626, "loss": 5.8571, "mean_token_accuracy": 0.1861635446548462, "num_tokens": 32112475.0, "step": 12670 }, { "entropy": 6.263620090484619, "epoch": 1.4627813040969417, "grad_norm": 0.890625, "learning_rate": 0.00047968620656997754, "loss": 5.8877, "mean_token_accuracy": 0.1819758251309395, "num_tokens": 32124411.0, "step": 12675 }, { "entropy": 6.225598430633545, "epoch": 1.4633583381419504, "grad_norm": 0.8515625, "learning_rate": 0.00047966906893175994, "loss": 5.8729, "mean_token_accuracy": 0.19142432063817977, "num_tokens": 32136665.0, "step": 12680 }, { "entropy": 6.324308729171753, "epoch": 1.463935372186959, "grad_norm": 0.85546875, "learning_rate": 0.0004796519244095998, "loss": 5.8716, "mean_token_accuracy": 0.1902136892080307, "num_tokens": 32149546.0, "step": 12685 }, { "entropy": 6.188792324066162, "epoch": 1.4645124062319677, "grad_norm": 0.96875, "learning_rate": 0.00047963477300407394, "loss": 5.8044, "mean_token_accuracy": 0.18858650773763658, "num_tokens": 32161327.0, "step": 12690 }, { "entropy": 6.267832660675049, "epoch": 1.4650894402769763, "grad_norm": 0.89453125, "learning_rate": 0.00047961761471575903, "loss": 5.808, "mean_token_accuracy": 0.18862345516681672, "num_tokens": 32173678.0, "step": 12695 }, { "entropy": 6.154121351242066, "epoch": 1.465666474321985, "grad_norm": 0.85546875, "learning_rate": 0.00047960044954523237, "loss": 5.7554, "mean_token_accuracy": 0.1918697848916054, "num_tokens": 32186834.0, "step": 12700 }, { "entropy": 6.250173807144165, "epoch": 1.4662435083669936, "grad_norm": 0.8828125, "learning_rate": 0.00047958327749307117, "loss": 5.8994, "mean_token_accuracy": 0.18794130235910417, "num_tokens": 32198876.0, "step": 12705 }, { "entropy": 6.236554574966431, "epoch": 1.4668205424120022, "grad_norm": 1.078125, "learning_rate": 0.00047956609855985305, "loss": 5.7503, "mean_token_accuracy": 0.19117399752140046, "num_tokens": 32212190.0, "step": 12710 }, { "entropy": 6.200174570083618, "epoch": 1.467397576457011, "grad_norm": 0.89453125, "learning_rate": 0.0004795489127461559, "loss": 5.7932, "mean_token_accuracy": 0.19743801206350325, "num_tokens": 32226129.0, "step": 12715 }, { "entropy": 6.19217324256897, "epoch": 1.4679746105020195, "grad_norm": 0.87890625, "learning_rate": 0.00047953172005255756, "loss": 5.8725, "mean_token_accuracy": 0.1850110799074173, "num_tokens": 32240116.0, "step": 12720 }, { "entropy": 6.265895223617553, "epoch": 1.4685516445470284, "grad_norm": 0.90625, "learning_rate": 0.0004795145204796365, "loss": 5.7838, "mean_token_accuracy": 0.1934996247291565, "num_tokens": 32252781.0, "step": 12725 }, { "entropy": 6.201068782806397, "epoch": 1.469128678592037, "grad_norm": 0.91015625, "learning_rate": 0.0004794973140279711, "loss": 5.7902, "mean_token_accuracy": 0.192179936170578, "num_tokens": 32265625.0, "step": 12730 }, { "entropy": 6.210565710067749, "epoch": 1.4697057126370456, "grad_norm": 0.94140625, "learning_rate": 0.00047948010069814005, "loss": 5.8399, "mean_token_accuracy": 0.19595302790403366, "num_tokens": 32278942.0, "step": 12735 }, { "entropy": 6.247366428375244, "epoch": 1.4702827466820543, "grad_norm": 0.8984375, "learning_rate": 0.0004794628804907225, "loss": 5.8417, "mean_token_accuracy": 0.19263463318347931, "num_tokens": 32292085.0, "step": 12740 }, { "entropy": 6.258548021316528, "epoch": 1.470859780727063, "grad_norm": 0.94921875, "learning_rate": 0.00047944565340629755, "loss": 5.882, "mean_token_accuracy": 0.19039649814367293, "num_tokens": 32303880.0, "step": 12745 }, { "entropy": 6.15313949584961, "epoch": 1.4714368147720716, "grad_norm": 0.9609375, "learning_rate": 0.00047942841944544453, "loss": 5.7886, "mean_token_accuracy": 0.1929144263267517, "num_tokens": 32315711.0, "step": 12750 }, { "entropy": 6.289398336410523, "epoch": 1.4720138488170802, "grad_norm": 0.97265625, "learning_rate": 0.0004794111786087431, "loss": 5.8802, "mean_token_accuracy": 0.18687772899866104, "num_tokens": 32329344.0, "step": 12755 }, { "entropy": 6.329669618606568, "epoch": 1.4725908828620888, "grad_norm": 3.171875, "learning_rate": 0.0004793939308967733, "loss": 5.8453, "mean_token_accuracy": 0.18983658850193025, "num_tokens": 32343335.0, "step": 12760 }, { "entropy": 6.150098705291748, "epoch": 1.4731679169070975, "grad_norm": 0.86328125, "learning_rate": 0.0004793766763101152, "loss": 5.7208, "mean_token_accuracy": 0.19836216270923615, "num_tokens": 32357663.0, "step": 12765 }, { "entropy": 6.231173849105835, "epoch": 1.4737449509521061, "grad_norm": 0.91015625, "learning_rate": 0.00047935941484934905, "loss": 5.8432, "mean_token_accuracy": 0.1936136767268181, "num_tokens": 32369310.0, "step": 12770 }, { "entropy": 6.182768821716309, "epoch": 1.4743219849971148, "grad_norm": 0.94140625, "learning_rate": 0.00047934214651505547, "loss": 5.8167, "mean_token_accuracy": 0.19123019874095917, "num_tokens": 32381478.0, "step": 12775 }, { "entropy": 6.159084224700928, "epoch": 1.4748990190421236, "grad_norm": 0.93359375, "learning_rate": 0.00047932487130781533, "loss": 5.7626, "mean_token_accuracy": 0.20197259783744811, "num_tokens": 32394697.0, "step": 12780 }, { "entropy": 6.140364646911621, "epoch": 1.475476053087132, "grad_norm": 0.9296875, "learning_rate": 0.0004793075892282097, "loss": 5.7113, "mean_token_accuracy": 0.1971853882074356, "num_tokens": 32405456.0, "step": 12785 }, { "entropy": 6.184367847442627, "epoch": 1.476053087132141, "grad_norm": 0.90234375, "learning_rate": 0.0004792903002768197, "loss": 5.831, "mean_token_accuracy": 0.18514325618743896, "num_tokens": 32416772.0, "step": 12790 }, { "entropy": 6.148500156402588, "epoch": 1.4766301211771495, "grad_norm": 0.91015625, "learning_rate": 0.00047927300445422687, "loss": 5.7444, "mean_token_accuracy": 0.19996704906225204, "num_tokens": 32429319.0, "step": 12795 }, { "entropy": 6.150080442428589, "epoch": 1.4772071552221582, "grad_norm": 0.93359375, "learning_rate": 0.0004792557017610131, "loss": 5.7314, "mean_token_accuracy": 0.20687794983386992, "num_tokens": 32442017.0, "step": 12800 }, { "entropy": 6.148825454711914, "epoch": 1.4777841892671668, "grad_norm": 0.9140625, "learning_rate": 0.00047923839219776027, "loss": 5.7583, "mean_token_accuracy": 0.1933480203151703, "num_tokens": 32454255.0, "step": 12805 }, { "entropy": 6.160013580322266, "epoch": 1.4783612233121755, "grad_norm": 0.86328125, "learning_rate": 0.0004792210757650506, "loss": 5.7797, "mean_token_accuracy": 0.1943795472383499, "num_tokens": 32465471.0, "step": 12810 }, { "entropy": 6.197701454162598, "epoch": 1.478938257357184, "grad_norm": 0.9140625, "learning_rate": 0.00047920375246346636, "loss": 5.8182, "mean_token_accuracy": 0.187069371342659, "num_tokens": 32478271.0, "step": 12815 }, { "entropy": 6.247473955154419, "epoch": 1.4795152914021927, "grad_norm": 0.98046875, "learning_rate": 0.00047918642229359044, "loss": 5.8331, "mean_token_accuracy": 0.18895274102687837, "num_tokens": 32490239.0, "step": 12820 }, { "entropy": 6.2366992950439455, "epoch": 1.4800923254472014, "grad_norm": 0.99609375, "learning_rate": 0.0004791690852560056, "loss": 5.8719, "mean_token_accuracy": 0.18945563733577728, "num_tokens": 32503511.0, "step": 12825 }, { "entropy": 6.193121337890625, "epoch": 1.48066935949221, "grad_norm": 0.88671875, "learning_rate": 0.000479151741351295, "loss": 5.8729, "mean_token_accuracy": 0.1820230945944786, "num_tokens": 32515652.0, "step": 12830 }, { "entropy": 6.272677850723267, "epoch": 1.4812463935372187, "grad_norm": 0.9453125, "learning_rate": 0.000479134390580042, "loss": 5.8576, "mean_token_accuracy": 0.18222525715827942, "num_tokens": 32527620.0, "step": 12835 }, { "entropy": 6.333395481109619, "epoch": 1.4818234275822273, "grad_norm": 0.91015625, "learning_rate": 0.00047911703294283015, "loss": 5.8595, "mean_token_accuracy": 0.1895024448633194, "num_tokens": 32540948.0, "step": 12840 }, { "entropy": 6.189630079269409, "epoch": 1.482400461627236, "grad_norm": 0.859375, "learning_rate": 0.00047909966844024334, "loss": 5.8242, "mean_token_accuracy": 0.19464778155088425, "num_tokens": 32553311.0, "step": 12845 }, { "entropy": 6.1735701084136965, "epoch": 1.4829774956722446, "grad_norm": 0.9375, "learning_rate": 0.00047908229707286547, "loss": 5.7488, "mean_token_accuracy": 0.1950527086853981, "num_tokens": 32564639.0, "step": 12850 }, { "entropy": 6.22589693069458, "epoch": 1.4835545297172534, "grad_norm": 0.921875, "learning_rate": 0.000479064918841281, "loss": 5.8654, "mean_token_accuracy": 0.1862518757581711, "num_tokens": 32577255.0, "step": 12855 }, { "entropy": 6.181830739974975, "epoch": 1.4841315637622619, "grad_norm": 0.87109375, "learning_rate": 0.00047904753374607427, "loss": 5.8111, "mean_token_accuracy": 0.19516809582710265, "num_tokens": 32590201.0, "step": 12860 }, { "entropy": 6.255477809906006, "epoch": 1.4847085978072707, "grad_norm": 1.1328125, "learning_rate": 0.00047903014178783015, "loss": 5.7877, "mean_token_accuracy": 0.18771864622831344, "num_tokens": 32603010.0, "step": 12865 }, { "entropy": 6.286900043487549, "epoch": 1.4852856318522794, "grad_norm": 0.94140625, "learning_rate": 0.0004790127429671335, "loss": 5.8502, "mean_token_accuracy": 0.1860107198357582, "num_tokens": 32614579.0, "step": 12870 }, { "entropy": 6.219177675247193, "epoch": 1.485862665897288, "grad_norm": 1.015625, "learning_rate": 0.0004789953372845697, "loss": 5.7603, "mean_token_accuracy": 0.1955152302980423, "num_tokens": 32627696.0, "step": 12875 }, { "entropy": 6.239347314834594, "epoch": 1.4864396999422966, "grad_norm": 0.89453125, "learning_rate": 0.000478977924740724, "loss": 5.9017, "mean_token_accuracy": 0.18081731498241424, "num_tokens": 32640824.0, "step": 12880 }, { "entropy": 6.249517917633057, "epoch": 1.4870167339873053, "grad_norm": 0.890625, "learning_rate": 0.0004789605053361821, "loss": 5.789, "mean_token_accuracy": 0.19380044490098952, "num_tokens": 32654373.0, "step": 12885 }, { "entropy": 6.3021715641021725, "epoch": 1.487593768032314, "grad_norm": 0.85546875, "learning_rate": 0.0004789430790715299, "loss": 5.9189, "mean_token_accuracy": 0.182830311357975, "num_tokens": 32667717.0, "step": 12890 }, { "entropy": 6.217434310913086, "epoch": 1.4881708020773226, "grad_norm": 0.84765625, "learning_rate": 0.00047892564594735355, "loss": 5.8393, "mean_token_accuracy": 0.18886099755764008, "num_tokens": 32681529.0, "step": 12895 }, { "entropy": 6.300730133056641, "epoch": 1.4887478361223312, "grad_norm": 0.8828125, "learning_rate": 0.00047890820596423943, "loss": 5.9136, "mean_token_accuracy": 0.18771759420633316, "num_tokens": 32694883.0, "step": 12900 }, { "entropy": 6.236034631729126, "epoch": 1.4893248701673398, "grad_norm": 0.8984375, "learning_rate": 0.000478890759122774, "loss": 5.7976, "mean_token_accuracy": 0.19470180720090866, "num_tokens": 32706908.0, "step": 12905 }, { "entropy": 6.279126119613648, "epoch": 1.4899019042123485, "grad_norm": 1.0234375, "learning_rate": 0.0004788733054235443, "loss": 5.8185, "mean_token_accuracy": 0.18948618620634078, "num_tokens": 32720057.0, "step": 12910 }, { "entropy": 6.199473190307617, "epoch": 1.4904789382573571, "grad_norm": 0.94140625, "learning_rate": 0.00047885584486713717, "loss": 5.823, "mean_token_accuracy": 0.19341208040714264, "num_tokens": 32732200.0, "step": 12915 }, { "entropy": 6.187557029724121, "epoch": 1.491055972302366, "grad_norm": 0.88671875, "learning_rate": 0.0004788383774541399, "loss": 5.7755, "mean_token_accuracy": 0.20056941658258437, "num_tokens": 32745144.0, "step": 12920 }, { "entropy": 6.1955255508422855, "epoch": 1.4916330063473744, "grad_norm": 0.90234375, "learning_rate": 0.0004788209031851402, "loss": 5.8306, "mean_token_accuracy": 0.19000527113676072, "num_tokens": 32757495.0, "step": 12925 }, { "entropy": 6.109148597717285, "epoch": 1.4922100403923833, "grad_norm": 1.0390625, "learning_rate": 0.0004788034220607256, "loss": 5.7325, "mean_token_accuracy": 0.1950483053922653, "num_tokens": 32769562.0, "step": 12930 }, { "entropy": 6.2173021793365475, "epoch": 1.4927870744373917, "grad_norm": 0.92578125, "learning_rate": 0.00047878593408148405, "loss": 5.7953, "mean_token_accuracy": 0.19607421159744262, "num_tokens": 32782234.0, "step": 12935 }, { "entropy": 6.2127049446105955, "epoch": 1.4933641084824005, "grad_norm": 0.90234375, "learning_rate": 0.00047876843924800393, "loss": 5.8, "mean_token_accuracy": 0.18992753624916076, "num_tokens": 32795274.0, "step": 12940 }, { "entropy": 6.185367918014526, "epoch": 1.4939411425274092, "grad_norm": 0.96875, "learning_rate": 0.0004787509375608735, "loss": 5.7714, "mean_token_accuracy": 0.19010636657476426, "num_tokens": 32808338.0, "step": 12945 }, { "entropy": 6.238684892654419, "epoch": 1.4945181765724178, "grad_norm": 0.8828125, "learning_rate": 0.00047873342902068157, "loss": 5.8263, "mean_token_accuracy": 0.18555284589529036, "num_tokens": 32820204.0, "step": 12950 }, { "entropy": 6.266605186462402, "epoch": 1.4950952106174265, "grad_norm": 0.87890625, "learning_rate": 0.00047871591362801694, "loss": 5.8544, "mean_token_accuracy": 0.18671264350414277, "num_tokens": 32832998.0, "step": 12955 }, { "entropy": 6.13381404876709, "epoch": 1.495672244662435, "grad_norm": 0.9375, "learning_rate": 0.0004786983913834687, "loss": 5.8379, "mean_token_accuracy": 0.188638374209404, "num_tokens": 32845484.0, "step": 12960 }, { "entropy": 6.316340970993042, "epoch": 1.4962492787074437, "grad_norm": 0.83984375, "learning_rate": 0.00047868086228762633, "loss": 5.9324, "mean_token_accuracy": 0.18515325337648392, "num_tokens": 32857718.0, "step": 12965 }, { "entropy": 6.281667041778564, "epoch": 1.4968263127524524, "grad_norm": 0.87109375, "learning_rate": 0.00047866332634107926, "loss": 5.8123, "mean_token_accuracy": 0.19124829024076462, "num_tokens": 32869908.0, "step": 12970 }, { "entropy": 6.1783287525177, "epoch": 1.497403346797461, "grad_norm": 0.88671875, "learning_rate": 0.00047864578354441743, "loss": 5.8322, "mean_token_accuracy": 0.19004736691713334, "num_tokens": 32882549.0, "step": 12975 }, { "entropy": 6.186053657531739, "epoch": 1.4979803808424696, "grad_norm": 0.89453125, "learning_rate": 0.0004786282338982308, "loss": 5.773, "mean_token_accuracy": 0.1942482754588127, "num_tokens": 32894587.0, "step": 12980 }, { "entropy": 6.266414165496826, "epoch": 1.4985574148874783, "grad_norm": 0.9453125, "learning_rate": 0.0004786106774031096, "loss": 5.8358, "mean_token_accuracy": 0.1882964327931404, "num_tokens": 32907001.0, "step": 12985 }, { "entropy": 6.235092544555664, "epoch": 1.499134448932487, "grad_norm": 0.88671875, "learning_rate": 0.0004785931140596445, "loss": 5.8035, "mean_token_accuracy": 0.19003380984067916, "num_tokens": 32919498.0, "step": 12990 }, { "entropy": 6.293325567245484, "epoch": 1.4997114829774958, "grad_norm": 0.8984375, "learning_rate": 0.00047857554386842606, "loss": 5.9188, "mean_token_accuracy": 0.18067218661308287, "num_tokens": 32932611.0, "step": 12995 }, { "entropy": 6.19683198928833, "epoch": 1.5002885170225042, "grad_norm": 0.96875, "learning_rate": 0.00047855796683004534, "loss": 5.7998, "mean_token_accuracy": 0.18689163625240326, "num_tokens": 32944845.0, "step": 13000 }, { "entropy": 6.271070766448974, "epoch": 1.500865551067513, "grad_norm": 0.90234375, "learning_rate": 0.00047854038294509356, "loss": 5.8457, "mean_token_accuracy": 0.17760048061609268, "num_tokens": 32958076.0, "step": 13005 }, { "entropy": 6.289440774917603, "epoch": 1.5014425851125215, "grad_norm": 0.90625, "learning_rate": 0.0004785227922141621, "loss": 5.8597, "mean_token_accuracy": 0.19118052423000337, "num_tokens": 32968984.0, "step": 13010 }, { "entropy": 6.310905838012696, "epoch": 1.5020196191575304, "grad_norm": 0.875, "learning_rate": 0.00047850519463784263, "loss": 5.9457, "mean_token_accuracy": 0.1839376851916313, "num_tokens": 32981488.0, "step": 13015 }, { "entropy": 6.229884433746338, "epoch": 1.502596653202539, "grad_norm": 0.94921875, "learning_rate": 0.00047848759021672693, "loss": 5.8199, "mean_token_accuracy": 0.19131330102682115, "num_tokens": 32994156.0, "step": 13020 }, { "entropy": 6.235915327072144, "epoch": 1.5031736872475476, "grad_norm": 0.86328125, "learning_rate": 0.0004784699789514073, "loss": 5.8013, "mean_token_accuracy": 0.18914027214050294, "num_tokens": 33007135.0, "step": 13025 }, { "entropy": 6.28277621269226, "epoch": 1.5037507212925563, "grad_norm": 0.859375, "learning_rate": 0.000478452360842476, "loss": 5.9116, "mean_token_accuracy": 0.18403880894184113, "num_tokens": 33021259.0, "step": 13030 }, { "entropy": 6.236955165863037, "epoch": 1.504327755337565, "grad_norm": 0.87109375, "learning_rate": 0.00047843473589052557, "loss": 5.84, "mean_token_accuracy": 0.18680391758680343, "num_tokens": 33033690.0, "step": 13035 }, { "entropy": 6.26040506362915, "epoch": 1.5049047893825735, "grad_norm": 0.99609375, "learning_rate": 0.00047841710409614893, "loss": 5.823, "mean_token_accuracy": 0.1852077528834343, "num_tokens": 33045744.0, "step": 13040 }, { "entropy": 6.271863794326782, "epoch": 1.5054818234275822, "grad_norm": 0.9765625, "learning_rate": 0.0004783994654599389, "loss": 5.8906, "mean_token_accuracy": 0.17971572130918503, "num_tokens": 33058307.0, "step": 13045 }, { "entropy": 6.303907442092895, "epoch": 1.5060588574725908, "grad_norm": 0.8828125, "learning_rate": 0.00047838181998248897, "loss": 5.9115, "mean_token_accuracy": 0.181523796916008, "num_tokens": 33073622.0, "step": 13050 }, { "entropy": 6.216773843765258, "epoch": 1.5066358915175995, "grad_norm": 0.85546875, "learning_rate": 0.0004783641676643925, "loss": 5.7545, "mean_token_accuracy": 0.19235570430755616, "num_tokens": 33087286.0, "step": 13055 }, { "entropy": 6.204124641418457, "epoch": 1.5072129255626083, "grad_norm": 0.79296875, "learning_rate": 0.00047834650850624334, "loss": 5.8409, "mean_token_accuracy": 0.19425424188375473, "num_tokens": 33100333.0, "step": 13060 }, { "entropy": 6.163000631332397, "epoch": 1.5077899596076167, "grad_norm": 0.90625, "learning_rate": 0.0004783288425086353, "loss": 5.8379, "mean_token_accuracy": 0.18831825852394105, "num_tokens": 33111318.0, "step": 13065 }, { "entropy": 6.296581697463989, "epoch": 1.5083669936526256, "grad_norm": 1.3984375, "learning_rate": 0.0004783111696721627, "loss": 5.9124, "mean_token_accuracy": 0.1840219795703888, "num_tokens": 33123766.0, "step": 13070 }, { "entropy": 6.241482782363891, "epoch": 1.508944027697634, "grad_norm": 0.94140625, "learning_rate": 0.0004782934899974199, "loss": 5.7843, "mean_token_accuracy": 0.19748201221227646, "num_tokens": 33136042.0, "step": 13075 }, { "entropy": 6.191297292709351, "epoch": 1.5095210617426429, "grad_norm": 0.92578125, "learning_rate": 0.00047827580348500147, "loss": 5.7749, "mean_token_accuracy": 0.19063863754272461, "num_tokens": 33148451.0, "step": 13080 }, { "entropy": 6.206788158416748, "epoch": 1.5100980957876513, "grad_norm": 0.8515625, "learning_rate": 0.00047825811013550246, "loss": 5.8011, "mean_token_accuracy": 0.19754028767347337, "num_tokens": 33161886.0, "step": 13085 }, { "entropy": 6.217094087600708, "epoch": 1.5106751298326602, "grad_norm": 0.921875, "learning_rate": 0.00047824040994951786, "loss": 5.8841, "mean_token_accuracy": 0.19206815510988234, "num_tokens": 33174812.0, "step": 13090 }, { "entropy": 6.256129360198974, "epoch": 1.5112521638776688, "grad_norm": 0.90625, "learning_rate": 0.0004782227029276429, "loss": 5.8011, "mean_token_accuracy": 0.1992778956890106, "num_tokens": 33187389.0, "step": 13095 }, { "entropy": 6.154243993759155, "epoch": 1.5118291979226774, "grad_norm": 0.94140625, "learning_rate": 0.00047820498907047345, "loss": 5.7544, "mean_token_accuracy": 0.19293652325868607, "num_tokens": 33200106.0, "step": 13100 }, { "entropy": 6.208034801483154, "epoch": 1.512406231967686, "grad_norm": 1.4296875, "learning_rate": 0.000478187268378605, "loss": 5.7489, "mean_token_accuracy": 0.19893669188022614, "num_tokens": 33212929.0, "step": 13105 }, { "entropy": 6.18809814453125, "epoch": 1.5129832660126947, "grad_norm": 0.9375, "learning_rate": 0.00047816954085263375, "loss": 5.8521, "mean_token_accuracy": 0.19083169847726822, "num_tokens": 33226068.0, "step": 13110 }, { "entropy": 6.156454467773438, "epoch": 1.5135603000577034, "grad_norm": 0.90234375, "learning_rate": 0.0004781518064931559, "loss": 5.7753, "mean_token_accuracy": 0.19173873215913773, "num_tokens": 33237677.0, "step": 13115 }, { "entropy": 6.252213764190674, "epoch": 1.514137334102712, "grad_norm": 0.9140625, "learning_rate": 0.000478134065300768, "loss": 5.8582, "mean_token_accuracy": 0.1917392447590828, "num_tokens": 33250640.0, "step": 13120 }, { "entropy": 6.208042573928833, "epoch": 1.5147143681477209, "grad_norm": 0.8828125, "learning_rate": 0.0004781163172760667, "loss": 5.785, "mean_token_accuracy": 0.1916109725832939, "num_tokens": 33262899.0, "step": 13125 }, { "entropy": 6.271803617477417, "epoch": 1.5152914021927293, "grad_norm": 1.0, "learning_rate": 0.00047809856241964893, "loss": 5.8185, "mean_token_accuracy": 0.19186412245035173, "num_tokens": 33275073.0, "step": 13130 }, { "entropy": 6.194020318984985, "epoch": 1.5158684362377381, "grad_norm": 0.87890625, "learning_rate": 0.0004780808007321119, "loss": 5.8097, "mean_token_accuracy": 0.18588352501392363, "num_tokens": 33286285.0, "step": 13135 }, { "entropy": 6.280729103088379, "epoch": 1.5164454702827466, "grad_norm": 0.91796875, "learning_rate": 0.0004780630322140531, "loss": 5.8053, "mean_token_accuracy": 0.19529957920312882, "num_tokens": 33297745.0, "step": 13140 }, { "entropy": 6.28461332321167, "epoch": 1.5170225043277554, "grad_norm": 0.875, "learning_rate": 0.00047804525686607, "loss": 5.862, "mean_token_accuracy": 0.17993441820144654, "num_tokens": 33309463.0, "step": 13145 }, { "entropy": 6.230080080032349, "epoch": 1.5175995383727638, "grad_norm": 0.8984375, "learning_rate": 0.0004780274746887606, "loss": 5.8296, "mean_token_accuracy": 0.18709089905023574, "num_tokens": 33322352.0, "step": 13150 }, { "entropy": 6.254903411865234, "epoch": 1.5181765724177727, "grad_norm": 0.890625, "learning_rate": 0.00047800968568272284, "loss": 5.8897, "mean_token_accuracy": 0.1886549025774002, "num_tokens": 33336051.0, "step": 13155 }, { "entropy": 6.218223762512207, "epoch": 1.5187536064627813, "grad_norm": 0.86328125, "learning_rate": 0.0004779918898485551, "loss": 5.8053, "mean_token_accuracy": 0.18849124908447265, "num_tokens": 33350321.0, "step": 13160 }, { "entropy": 6.225475931167603, "epoch": 1.51933064050779, "grad_norm": 0.84375, "learning_rate": 0.00047797408718685614, "loss": 5.7767, "mean_token_accuracy": 0.19050310999155046, "num_tokens": 33363637.0, "step": 13165 }, { "entropy": 6.214481449127197, "epoch": 1.5199076745527986, "grad_norm": 0.91015625, "learning_rate": 0.00047795627769822447, "loss": 5.7798, "mean_token_accuracy": 0.19742291122674943, "num_tokens": 33376257.0, "step": 13170 }, { "entropy": 6.135192155838013, "epoch": 1.5204847085978073, "grad_norm": 0.84765625, "learning_rate": 0.00047793846138325925, "loss": 5.7453, "mean_token_accuracy": 0.1947900339961052, "num_tokens": 33388812.0, "step": 13175 }, { "entropy": 6.2147955894470215, "epoch": 1.521061742642816, "grad_norm": 0.89453125, "learning_rate": 0.0004779206382425598, "loss": 5.8117, "mean_token_accuracy": 0.1930110424757004, "num_tokens": 33401141.0, "step": 13180 }, { "entropy": 6.252952575683594, "epoch": 1.5216387766878245, "grad_norm": 0.9609375, "learning_rate": 0.0004779028082767253, "loss": 5.8197, "mean_token_accuracy": 0.19050996899604797, "num_tokens": 33412821.0, "step": 13185 }, { "entropy": 6.212389230728149, "epoch": 1.5222158107328332, "grad_norm": 0.95703125, "learning_rate": 0.0004778849714863557, "loss": 5.8589, "mean_token_accuracy": 0.183637772500515, "num_tokens": 33424709.0, "step": 13190 }, { "entropy": 6.235611343383789, "epoch": 1.5227928447778418, "grad_norm": 0.88671875, "learning_rate": 0.0004778671278720508, "loss": 5.8681, "mean_token_accuracy": 0.186078442633152, "num_tokens": 33437069.0, "step": 13195 }, { "entropy": 6.228446388244629, "epoch": 1.5233698788228507, "grad_norm": 0.94140625, "learning_rate": 0.0004778492774344109, "loss": 5.7122, "mean_token_accuracy": 0.19611677676439285, "num_tokens": 33449441.0, "step": 13200 }, { "entropy": 6.274533605575561, "epoch": 1.523946912867859, "grad_norm": 1.0078125, "learning_rate": 0.0004778314201740363, "loss": 5.8927, "mean_token_accuracy": 0.1851292923092842, "num_tokens": 33463184.0, "step": 13205 }, { "entropy": 6.205833292007446, "epoch": 1.524523946912868, "grad_norm": 0.87890625, "learning_rate": 0.00047781355609152764, "loss": 5.7542, "mean_token_accuracy": 0.19649343192577362, "num_tokens": 33476118.0, "step": 13210 }, { "entropy": 6.192588806152344, "epoch": 1.5251009809578764, "grad_norm": 0.91796875, "learning_rate": 0.0004777956851874858, "loss": 5.7489, "mean_token_accuracy": 0.1931898131966591, "num_tokens": 33487575.0, "step": 13215 }, { "entropy": 6.272642326354981, "epoch": 1.5256780150028852, "grad_norm": 0.96875, "learning_rate": 0.00047777780746251176, "loss": 5.8292, "mean_token_accuracy": 0.18742457628250123, "num_tokens": 33499507.0, "step": 13220 }, { "entropy": 6.195057535171509, "epoch": 1.5262550490478937, "grad_norm": 0.94140625, "learning_rate": 0.00047775992291720687, "loss": 5.8102, "mean_token_accuracy": 0.19332896620035173, "num_tokens": 33513818.0, "step": 13225 }, { "entropy": 6.250328063964844, "epoch": 1.5268320830929025, "grad_norm": 1.0, "learning_rate": 0.0004777420315521728, "loss": 5.8313, "mean_token_accuracy": 0.186712084710598, "num_tokens": 33525762.0, "step": 13230 }, { "entropy": 6.17367377281189, "epoch": 1.5274091171379112, "grad_norm": 1.2265625, "learning_rate": 0.0004777241333680111, "loss": 5.7218, "mean_token_accuracy": 0.198297181725502, "num_tokens": 33537469.0, "step": 13235 }, { "entropy": 6.186795091629028, "epoch": 1.5279861511829198, "grad_norm": 0.82421875, "learning_rate": 0.0004777062283653239, "loss": 5.8291, "mean_token_accuracy": 0.19145113229751587, "num_tokens": 33550226.0, "step": 13240 }, { "entropy": 6.280914831161499, "epoch": 1.5285631852279284, "grad_norm": 0.91015625, "learning_rate": 0.00047768831654471333, "loss": 5.8919, "mean_token_accuracy": 0.18494420349597931, "num_tokens": 33564164.0, "step": 13245 }, { "entropy": 6.200793647766114, "epoch": 1.529140219272937, "grad_norm": 0.89453125, "learning_rate": 0.00047767039790678204, "loss": 5.7056, "mean_token_accuracy": 0.19484343230724335, "num_tokens": 33576295.0, "step": 13250 }, { "entropy": 6.15148024559021, "epoch": 1.5297172533179457, "grad_norm": 0.9609375, "learning_rate": 0.00047765247245213255, "loss": 5.708, "mean_token_accuracy": 0.20231665521860123, "num_tokens": 33587950.0, "step": 13255 }, { "entropy": 6.191800355911255, "epoch": 1.5302942873629544, "grad_norm": 0.921875, "learning_rate": 0.0004776345401813678, "loss": 5.8057, "mean_token_accuracy": 0.19851236641407013, "num_tokens": 33600201.0, "step": 13260 }, { "entropy": 6.243471622467041, "epoch": 1.5308713214079632, "grad_norm": 0.87109375, "learning_rate": 0.00047761660109509095, "loss": 5.8596, "mean_token_accuracy": 0.19617122262716294, "num_tokens": 33612355.0, "step": 13265 }, { "entropy": 6.280506610870361, "epoch": 1.5314483554529716, "grad_norm": 0.921875, "learning_rate": 0.0004775986551939054, "loss": 5.8599, "mean_token_accuracy": 0.18742733150720597, "num_tokens": 33626322.0, "step": 13270 }, { "entropy": 6.191336297988892, "epoch": 1.5320253894979805, "grad_norm": 0.8828125, "learning_rate": 0.00047758070247841465, "loss": 5.7776, "mean_token_accuracy": 0.19153404384851455, "num_tokens": 33638433.0, "step": 13275 }, { "entropy": 6.221687507629395, "epoch": 1.532602423542989, "grad_norm": 0.84765625, "learning_rate": 0.00047756274294922266, "loss": 5.8007, "mean_token_accuracy": 0.1957632526755333, "num_tokens": 33651743.0, "step": 13280 }, { "entropy": 6.283531665802002, "epoch": 1.5331794575879978, "grad_norm": 0.95703125, "learning_rate": 0.0004775447766069334, "loss": 5.8932, "mean_token_accuracy": 0.1905313104391098, "num_tokens": 33663546.0, "step": 13285 }, { "entropy": 6.255209875106812, "epoch": 1.5337564916330062, "grad_norm": 0.87890625, "learning_rate": 0.00047752680345215115, "loss": 5.8374, "mean_token_accuracy": 0.18721415102481842, "num_tokens": 33675358.0, "step": 13290 }, { "entropy": 6.268837118148804, "epoch": 1.534333525678015, "grad_norm": 0.83984375, "learning_rate": 0.0004775088234854805, "loss": 5.7914, "mean_token_accuracy": 0.18973737806081772, "num_tokens": 33688066.0, "step": 13295 }, { "entropy": 6.1976690769195555, "epoch": 1.5349105597230237, "grad_norm": 1.0703125, "learning_rate": 0.0004774908367075262, "loss": 5.8236, "mean_token_accuracy": 0.19111677557229995, "num_tokens": 33700829.0, "step": 13300 }, { "entropy": 6.174250936508178, "epoch": 1.5354875937680323, "grad_norm": 0.85546875, "learning_rate": 0.0004774728431188931, "loss": 5.7823, "mean_token_accuracy": 0.18667507469654082, "num_tokens": 33714049.0, "step": 13305 }, { "entropy": 6.153797626495361, "epoch": 1.536064627813041, "grad_norm": 1.0, "learning_rate": 0.00047745484272018664, "loss": 5.7376, "mean_token_accuracy": 0.1966078385710716, "num_tokens": 33727026.0, "step": 13310 }, { "entropy": 6.212672233581543, "epoch": 1.5366416618580496, "grad_norm": 0.9140625, "learning_rate": 0.0004774368355120119, "loss": 5.7338, "mean_token_accuracy": 0.20255094915628433, "num_tokens": 33740400.0, "step": 13315 }, { "entropy": 6.047137498855591, "epoch": 1.5372186959030583, "grad_norm": 0.83984375, "learning_rate": 0.000477418821494975, "loss": 5.6107, "mean_token_accuracy": 0.20713855773210527, "num_tokens": 33753621.0, "step": 13320 }, { "entropy": 6.251862668991089, "epoch": 1.537795729948067, "grad_norm": 0.8984375, "learning_rate": 0.0004774008006696814, "loss": 5.8651, "mean_token_accuracy": 0.18378251641988755, "num_tokens": 33765458.0, "step": 13325 }, { "entropy": 6.323590993881226, "epoch": 1.5383727639930755, "grad_norm": 0.8984375, "learning_rate": 0.0004773827730367375, "loss": 5.8993, "mean_token_accuracy": 0.1841868206858635, "num_tokens": 33777264.0, "step": 13330 }, { "entropy": 6.242207384109497, "epoch": 1.5389497980380842, "grad_norm": 0.8984375, "learning_rate": 0.00047736473859674955, "loss": 5.8134, "mean_token_accuracy": 0.1927764505147934, "num_tokens": 33789837.0, "step": 13335 }, { "entropy": 6.089216327667236, "epoch": 1.539526832083093, "grad_norm": 0.9453125, "learning_rate": 0.00047734669735032404, "loss": 5.7171, "mean_token_accuracy": 0.19926753938198088, "num_tokens": 33801666.0, "step": 13340 }, { "entropy": 6.197734022140503, "epoch": 1.5401038661281015, "grad_norm": 0.94140625, "learning_rate": 0.00047732864929806796, "loss": 5.8392, "mean_token_accuracy": 0.1812909036874771, "num_tokens": 33813909.0, "step": 13345 }, { "entropy": 6.198130559921265, "epoch": 1.5406809001731103, "grad_norm": 0.87109375, "learning_rate": 0.0004773105944405883, "loss": 5.8364, "mean_token_accuracy": 0.19269849210977555, "num_tokens": 33827081.0, "step": 13350 }, { "entropy": 6.183778619766235, "epoch": 1.5412579342181187, "grad_norm": 0.95703125, "learning_rate": 0.00047729253277849226, "loss": 5.7523, "mean_token_accuracy": 0.1987853080034256, "num_tokens": 33838261.0, "step": 13355 }, { "entropy": 6.254490613937378, "epoch": 1.5418349682631276, "grad_norm": 1.0, "learning_rate": 0.00047727446431238734, "loss": 5.9129, "mean_token_accuracy": 0.18299975246191025, "num_tokens": 33850189.0, "step": 13360 }, { "entropy": 6.303029108047485, "epoch": 1.542412002308136, "grad_norm": 0.87109375, "learning_rate": 0.0004772563890428813, "loss": 5.8937, "mean_token_accuracy": 0.18921637237071992, "num_tokens": 33863570.0, "step": 13365 }, { "entropy": 6.217037868499756, "epoch": 1.5429890363531449, "grad_norm": 0.8203125, "learning_rate": 0.0004772383069705821, "loss": 5.8257, "mean_token_accuracy": 0.18908795416355134, "num_tokens": 33876583.0, "step": 13370 }, { "entropy": 6.289787244796753, "epoch": 1.5435660703981535, "grad_norm": 0.90234375, "learning_rate": 0.0004772202180960978, "loss": 5.8502, "mean_token_accuracy": 0.1855199694633484, "num_tokens": 33889744.0, "step": 13375 }, { "entropy": 6.285410022735595, "epoch": 1.5441431044431622, "grad_norm": 0.89453125, "learning_rate": 0.00047720212242003703, "loss": 5.8729, "mean_token_accuracy": 0.19419652074575425, "num_tokens": 33904129.0, "step": 13380 }, { "entropy": 6.162698411941529, "epoch": 1.5447201384881708, "grad_norm": 0.8984375, "learning_rate": 0.00047718401994300825, "loss": 5.7692, "mean_token_accuracy": 0.19252093583345414, "num_tokens": 33916277.0, "step": 13385 }, { "entropy": 6.2117432117462155, "epoch": 1.5452971725331794, "grad_norm": 0.921875, "learning_rate": 0.00047716591066562043, "loss": 5.8584, "mean_token_accuracy": 0.188547345995903, "num_tokens": 33929434.0, "step": 13390 }, { "entropy": 6.270015859603882, "epoch": 1.545874206578188, "grad_norm": 0.90234375, "learning_rate": 0.00047714779458848255, "loss": 5.8328, "mean_token_accuracy": 0.18586413711309432, "num_tokens": 33942376.0, "step": 13395 }, { "entropy": 6.264356374740601, "epoch": 1.5464512406231967, "grad_norm": 0.92578125, "learning_rate": 0.0004771296717122041, "loss": 5.8404, "mean_token_accuracy": 0.19098608046770096, "num_tokens": 33955013.0, "step": 13400 }, { "entropy": 6.240370368957519, "epoch": 1.5470282746682056, "grad_norm": 0.98828125, "learning_rate": 0.0004771115420373945, "loss": 5.8445, "mean_token_accuracy": 0.1863965794444084, "num_tokens": 33966673.0, "step": 13405 }, { "entropy": 6.177231168746948, "epoch": 1.547605308713214, "grad_norm": 0.96484375, "learning_rate": 0.00047709340556466366, "loss": 5.769, "mean_token_accuracy": 0.1987849310040474, "num_tokens": 33978400.0, "step": 13410 }, { "entropy": 6.298257875442505, "epoch": 1.5481823427582229, "grad_norm": 0.87890625, "learning_rate": 0.00047707526229462144, "loss": 5.9266, "mean_token_accuracy": 0.18126586228609085, "num_tokens": 33990690.0, "step": 13415 }, { "entropy": 6.25822606086731, "epoch": 1.5487593768032313, "grad_norm": 0.9375, "learning_rate": 0.00047705711222787816, "loss": 5.8267, "mean_token_accuracy": 0.1906663656234741, "num_tokens": 34003992.0, "step": 13420 }, { "entropy": 6.256418752670288, "epoch": 1.5493364108482401, "grad_norm": 0.9375, "learning_rate": 0.00047703895536504423, "loss": 5.8242, "mean_token_accuracy": 0.18806500285863875, "num_tokens": 34016075.0, "step": 13425 }, { "entropy": 6.231338977813721, "epoch": 1.5499134448932486, "grad_norm": 0.97265625, "learning_rate": 0.0004770207917067305, "loss": 5.7882, "mean_token_accuracy": 0.18892282098531724, "num_tokens": 34029143.0, "step": 13430 }, { "entropy": 6.201420450210572, "epoch": 1.5504904789382574, "grad_norm": 0.8984375, "learning_rate": 0.00047700262125354765, "loss": 5.8749, "mean_token_accuracy": 0.19344826638698578, "num_tokens": 34041269.0, "step": 13435 }, { "entropy": 6.238750314712524, "epoch": 1.551067512983266, "grad_norm": 0.91015625, "learning_rate": 0.00047698444400610707, "loss": 5.8859, "mean_token_accuracy": 0.18998730182647705, "num_tokens": 34054561.0, "step": 13440 }, { "entropy": 6.205687665939331, "epoch": 1.5516445470282747, "grad_norm": 0.91015625, "learning_rate": 0.00047696625996502, "loss": 5.7521, "mean_token_accuracy": 0.1924416869878769, "num_tokens": 34068009.0, "step": 13445 }, { "entropy": 6.221275329589844, "epoch": 1.5522215810732833, "grad_norm": 0.96875, "learning_rate": 0.00047694806913089815, "loss": 5.891, "mean_token_accuracy": 0.1905246526002884, "num_tokens": 34081217.0, "step": 13450 }, { "entropy": 6.277045774459839, "epoch": 1.552798615118292, "grad_norm": 0.921875, "learning_rate": 0.0004769298715043533, "loss": 5.8023, "mean_token_accuracy": 0.18520487993955612, "num_tokens": 34093903.0, "step": 13455 }, { "entropy": 6.28056845664978, "epoch": 1.5533756491633006, "grad_norm": 0.91796875, "learning_rate": 0.0004769116670859975, "loss": 5.8674, "mean_token_accuracy": 0.18978661596775054, "num_tokens": 34105891.0, "step": 13460 }, { "entropy": 6.244111442565918, "epoch": 1.5539526832083093, "grad_norm": 0.9609375, "learning_rate": 0.00047689345587644314, "loss": 5.8749, "mean_token_accuracy": 0.19215874820947648, "num_tokens": 34118438.0, "step": 13465 }, { "entropy": 6.191610431671142, "epoch": 1.554529717253318, "grad_norm": 0.93359375, "learning_rate": 0.00047687523787630256, "loss": 5.736, "mean_token_accuracy": 0.19659065455198288, "num_tokens": 34130383.0, "step": 13470 }, { "entropy": 6.189245986938476, "epoch": 1.5551067512983265, "grad_norm": 0.91796875, "learning_rate": 0.0004768570130861887, "loss": 5.8577, "mean_token_accuracy": 0.19298865050077438, "num_tokens": 34143805.0, "step": 13475 }, { "entropy": 6.23731164932251, "epoch": 1.5556837853433354, "grad_norm": 0.91796875, "learning_rate": 0.0004768387815067144, "loss": 5.7135, "mean_token_accuracy": 0.20021907836198807, "num_tokens": 34157053.0, "step": 13480 }, { "entropy": 6.2790198802948, "epoch": 1.5562608193883438, "grad_norm": 1.03125, "learning_rate": 0.00047682054313849304, "loss": 5.8953, "mean_token_accuracy": 0.1879524365067482, "num_tokens": 34168804.0, "step": 13485 }, { "entropy": 6.2272436141967775, "epoch": 1.5568378534333527, "grad_norm": 0.8828125, "learning_rate": 0.0004768022979821379, "loss": 5.9036, "mean_token_accuracy": 0.18060447722673417, "num_tokens": 34181201.0, "step": 13490 }, { "entropy": 6.2782214164733885, "epoch": 1.557414887478361, "grad_norm": 0.9609375, "learning_rate": 0.0004767840460382628, "loss": 5.8846, "mean_token_accuracy": 0.18991439938545226, "num_tokens": 34193906.0, "step": 13495 }, { "entropy": 6.245473003387451, "epoch": 1.55799192152337, "grad_norm": 0.84765625, "learning_rate": 0.0004767657873074815, "loss": 5.8902, "mean_token_accuracy": 0.18845838755369188, "num_tokens": 34207462.0, "step": 13500 }, { "entropy": 6.18796181678772, "epoch": 1.5585689555683784, "grad_norm": 0.83984375, "learning_rate": 0.0004767475217904081, "loss": 5.7363, "mean_token_accuracy": 0.19420798420906066, "num_tokens": 34219696.0, "step": 13505 }, { "entropy": 6.205419874191284, "epoch": 1.5591459896133872, "grad_norm": 0.9140625, "learning_rate": 0.00047672924948765705, "loss": 5.79, "mean_token_accuracy": 0.1927314206957817, "num_tokens": 34232413.0, "step": 13510 }, { "entropy": 6.259201574325561, "epoch": 1.5597230236583959, "grad_norm": 0.90234375, "learning_rate": 0.00047671097039984293, "loss": 5.8829, "mean_token_accuracy": 0.1864104762673378, "num_tokens": 34245150.0, "step": 13515 }, { "entropy": 6.23311071395874, "epoch": 1.5603000577034045, "grad_norm": 0.875, "learning_rate": 0.00047669268452758053, "loss": 5.7247, "mean_token_accuracy": 0.1986491337418556, "num_tokens": 34257416.0, "step": 13520 }, { "entropy": 6.192863082885742, "epoch": 1.5608770917484132, "grad_norm": 1.1015625, "learning_rate": 0.00047667439187148476, "loss": 5.7546, "mean_token_accuracy": 0.1986703172326088, "num_tokens": 34269518.0, "step": 13525 }, { "entropy": 6.2323802471160885, "epoch": 1.5614541257934218, "grad_norm": 1.0625, "learning_rate": 0.0004766560924321711, "loss": 5.7942, "mean_token_accuracy": 0.19780726730823517, "num_tokens": 34280965.0, "step": 13530 }, { "entropy": 6.22453088760376, "epoch": 1.5620311598384304, "grad_norm": 0.7890625, "learning_rate": 0.00047663778621025496, "loss": 5.8313, "mean_token_accuracy": 0.19148373305797578, "num_tokens": 34294051.0, "step": 13535 }, { "entropy": 6.268961334228516, "epoch": 1.562608193883439, "grad_norm": 0.859375, "learning_rate": 0.0004766194732063519, "loss": 5.863, "mean_token_accuracy": 0.18264816850423812, "num_tokens": 34308052.0, "step": 13540 }, { "entropy": 6.285745286941529, "epoch": 1.563185227928448, "grad_norm": 0.7578125, "learning_rate": 0.00047660115342107814, "loss": 5.7969, "mean_token_accuracy": 0.19112218767404557, "num_tokens": 34321802.0, "step": 13545 }, { "entropy": 6.193321275711059, "epoch": 1.5637622619734564, "grad_norm": 0.83203125, "learning_rate": 0.00047658282685504973, "loss": 5.7602, "mean_token_accuracy": 0.19718139320611955, "num_tokens": 34334789.0, "step": 13550 }, { "entropy": 6.235433149337768, "epoch": 1.5643392960184652, "grad_norm": 1.015625, "learning_rate": 0.000476564493508883, "loss": 5.7801, "mean_token_accuracy": 0.19197132885456086, "num_tokens": 34347167.0, "step": 13555 }, { "entropy": 6.285042762756348, "epoch": 1.5649163300634736, "grad_norm": 0.9140625, "learning_rate": 0.00047654615338319466, "loss": 5.9097, "mean_token_accuracy": 0.1878646969795227, "num_tokens": 34360468.0, "step": 13560 }, { "entropy": 6.280793809890747, "epoch": 1.5654933641084825, "grad_norm": 0.94140625, "learning_rate": 0.0004765278064786016, "loss": 5.8745, "mean_token_accuracy": 0.18344386219978331, "num_tokens": 34373835.0, "step": 13565 }, { "entropy": 6.2916289329528805, "epoch": 1.566070398153491, "grad_norm": 0.88671875, "learning_rate": 0.00047650945279572085, "loss": 5.8593, "mean_token_accuracy": 0.19200937896966935, "num_tokens": 34385591.0, "step": 13570 }, { "entropy": 6.280641365051269, "epoch": 1.5666474321984998, "grad_norm": 0.91015625, "learning_rate": 0.0004764910923351698, "loss": 5.8864, "mean_token_accuracy": 0.183075650036335, "num_tokens": 34398980.0, "step": 13575 }, { "entropy": 6.257032251358032, "epoch": 1.5672244662435084, "grad_norm": 0.87109375, "learning_rate": 0.00047647272509756584, "loss": 5.869, "mean_token_accuracy": 0.18773055970668792, "num_tokens": 34412274.0, "step": 13580 }, { "entropy": 6.243408870697022, "epoch": 1.567801500288517, "grad_norm": 0.8671875, "learning_rate": 0.0004764543510835269, "loss": 5.8246, "mean_token_accuracy": 0.19365275353193284, "num_tokens": 34425043.0, "step": 13585 }, { "entropy": 6.239257192611694, "epoch": 1.5683785343335257, "grad_norm": 0.91015625, "learning_rate": 0.000476435970293671, "loss": 5.8773, "mean_token_accuracy": 0.19190652072429656, "num_tokens": 34437022.0, "step": 13590 }, { "entropy": 6.168194198608399, "epoch": 1.5689555683785343, "grad_norm": 0.81640625, "learning_rate": 0.00047641758272861626, "loss": 5.6913, "mean_token_accuracy": 0.1997967079281807, "num_tokens": 34449668.0, "step": 13595 }, { "entropy": 6.230442905426026, "epoch": 1.569532602423543, "grad_norm": 0.984375, "learning_rate": 0.0004763991883889811, "loss": 5.7525, "mean_token_accuracy": 0.19202667623758315, "num_tokens": 34461588.0, "step": 13600 }, { "entropy": 6.194968223571777, "epoch": 1.5701096364685516, "grad_norm": 0.80859375, "learning_rate": 0.0004763807872753843, "loss": 5.7956, "mean_token_accuracy": 0.19065721333026886, "num_tokens": 34474696.0, "step": 13605 }, { "entropy": 6.2662159442901615, "epoch": 1.5706866705135603, "grad_norm": 0.9140625, "learning_rate": 0.00047636237938844484, "loss": 5.8088, "mean_token_accuracy": 0.19261950701475145, "num_tokens": 34488477.0, "step": 13610 }, { "entropy": 6.20445556640625, "epoch": 1.571263704558569, "grad_norm": 0.84765625, "learning_rate": 0.0004763439647287817, "loss": 5.7521, "mean_token_accuracy": 0.19336534291505814, "num_tokens": 34502159.0, "step": 13615 }, { "entropy": 6.188671398162842, "epoch": 1.5718407386035778, "grad_norm": 0.96484375, "learning_rate": 0.0004763255432970144, "loss": 5.788, "mean_token_accuracy": 0.1959633484482765, "num_tokens": 34516247.0, "step": 13620 }, { "entropy": 6.190359258651734, "epoch": 1.5724177726485862, "grad_norm": 0.953125, "learning_rate": 0.00047630711509376235, "loss": 5.6789, "mean_token_accuracy": 0.20005650967359542, "num_tokens": 34528599.0, "step": 13625 }, { "entropy": 6.272625064849853, "epoch": 1.572994806693595, "grad_norm": 0.92578125, "learning_rate": 0.0004762886801196455, "loss": 5.8926, "mean_token_accuracy": 0.17960608005523682, "num_tokens": 34541346.0, "step": 13630 }, { "entropy": 6.311180162429809, "epoch": 1.5735718407386035, "grad_norm": 0.90234375, "learning_rate": 0.00047627023837528386, "loss": 5.845, "mean_token_accuracy": 0.18619453758001328, "num_tokens": 34553934.0, "step": 13635 }, { "entropy": 6.243749475479126, "epoch": 1.5741488747836123, "grad_norm": 0.87890625, "learning_rate": 0.00047625178986129775, "loss": 5.8856, "mean_token_accuracy": 0.1931193843483925, "num_tokens": 34565739.0, "step": 13640 }, { "entropy": 6.188317966461182, "epoch": 1.5747259088286207, "grad_norm": 0.9453125, "learning_rate": 0.0004762333345783078, "loss": 5.8081, "mean_token_accuracy": 0.19340444803237916, "num_tokens": 34579062.0, "step": 13645 }, { "entropy": 6.227141380310059, "epoch": 1.5753029428736296, "grad_norm": 0.984375, "learning_rate": 0.00047621487252693436, "loss": 5.8652, "mean_token_accuracy": 0.18909793645143508, "num_tokens": 34592090.0, "step": 13650 }, { "entropy": 6.149709033966064, "epoch": 1.5758799769186382, "grad_norm": 0.984375, "learning_rate": 0.00047619640370779876, "loss": 5.7026, "mean_token_accuracy": 0.19682869613170623, "num_tokens": 34604626.0, "step": 13655 }, { "entropy": 6.2658247470855715, "epoch": 1.5764570109636469, "grad_norm": 0.91015625, "learning_rate": 0.00047617792812152207, "loss": 5.8458, "mean_token_accuracy": 0.18907229751348495, "num_tokens": 34617174.0, "step": 13660 }, { "entropy": 6.185346984863282, "epoch": 1.5770340450086555, "grad_norm": 0.85546875, "learning_rate": 0.0004761594457687256, "loss": 5.7213, "mean_token_accuracy": 0.19811177551746367, "num_tokens": 34629909.0, "step": 13665 }, { "entropy": 6.198504495620727, "epoch": 1.5776110790536642, "grad_norm": 0.93359375, "learning_rate": 0.0004761409566500313, "loss": 5.7826, "mean_token_accuracy": 0.1974416196346283, "num_tokens": 34643640.0, "step": 13670 }, { "entropy": 6.230290460586548, "epoch": 1.5781881130986728, "grad_norm": 1.0, "learning_rate": 0.00047612246076606066, "loss": 5.7578, "mean_token_accuracy": 0.1851365178823471, "num_tokens": 34655250.0, "step": 13675 }, { "entropy": 6.257380104064941, "epoch": 1.5787651471436814, "grad_norm": 0.81640625, "learning_rate": 0.00047610395811743594, "loss": 5.7802, "mean_token_accuracy": 0.1935951068997383, "num_tokens": 34669318.0, "step": 13680 }, { "entropy": 6.212140512466431, "epoch": 1.5793421811886903, "grad_norm": 0.8984375, "learning_rate": 0.00047608544870477956, "loss": 5.8145, "mean_token_accuracy": 0.1901389628648758, "num_tokens": 34680932.0, "step": 13685 }, { "entropy": 6.2297382831573485, "epoch": 1.5799192152336987, "grad_norm": 0.8515625, "learning_rate": 0.00047606693252871395, "loss": 5.9309, "mean_token_accuracy": 0.18365089148283004, "num_tokens": 34693091.0, "step": 13690 }, { "entropy": 6.239744043350219, "epoch": 1.5804962492787076, "grad_norm": 0.8984375, "learning_rate": 0.000476048409589862, "loss": 5.8484, "mean_token_accuracy": 0.19662028700113296, "num_tokens": 34706645.0, "step": 13695 }, { "entropy": 6.262181663513184, "epoch": 1.581073283323716, "grad_norm": 1.0078125, "learning_rate": 0.0004760298798888466, "loss": 5.9018, "mean_token_accuracy": 0.18771067559719085, "num_tokens": 34718974.0, "step": 13700 }, { "entropy": 6.192539691925049, "epoch": 1.5816503173687249, "grad_norm": 0.8828125, "learning_rate": 0.0004760113434262911, "loss": 5.8369, "mean_token_accuracy": 0.18986850529909133, "num_tokens": 34732424.0, "step": 13705 }, { "entropy": 6.183119106292724, "epoch": 1.5822273514137333, "grad_norm": 0.91015625, "learning_rate": 0.00047599280020281894, "loss": 5.7694, "mean_token_accuracy": 0.1920637682080269, "num_tokens": 34743865.0, "step": 13710 }, { "entropy": 6.195568656921386, "epoch": 1.5828043854587421, "grad_norm": 0.94921875, "learning_rate": 0.00047597425021905364, "loss": 5.714, "mean_token_accuracy": 0.1968247890472412, "num_tokens": 34756415.0, "step": 13715 }, { "entropy": 6.307136392593383, "epoch": 1.5833814195037508, "grad_norm": 0.8984375, "learning_rate": 0.0004759556934756194, "loss": 5.851, "mean_token_accuracy": 0.18275767266750337, "num_tokens": 34769666.0, "step": 13720 }, { "entropy": 6.103635835647583, "epoch": 1.5839584535487594, "grad_norm": 0.9375, "learning_rate": 0.00047593712997314017, "loss": 5.6843, "mean_token_accuracy": 0.20277404189109802, "num_tokens": 34781523.0, "step": 13725 }, { "entropy": 6.193688011169433, "epoch": 1.584535487593768, "grad_norm": 0.90625, "learning_rate": 0.00047591855971224035, "loss": 5.7348, "mean_token_accuracy": 0.20058793425559998, "num_tokens": 34794597.0, "step": 13730 }, { "entropy": 6.22872748374939, "epoch": 1.5851125216387767, "grad_norm": 0.875, "learning_rate": 0.0004758999826935446, "loss": 5.8807, "mean_token_accuracy": 0.18744026124477386, "num_tokens": 34807791.0, "step": 13735 }, { "entropy": 6.279449033737182, "epoch": 1.5856895556837853, "grad_norm": 1.109375, "learning_rate": 0.0004758813989176778, "loss": 5.8438, "mean_token_accuracy": 0.1967759609222412, "num_tokens": 34821456.0, "step": 13740 }, { "entropy": 6.221560335159301, "epoch": 1.586266589728794, "grad_norm": 0.90625, "learning_rate": 0.00047586280838526483, "loss": 5.7788, "mean_token_accuracy": 0.19918196201324462, "num_tokens": 34834786.0, "step": 13745 }, { "entropy": 6.23402967453003, "epoch": 1.5868436237738026, "grad_norm": 0.94921875, "learning_rate": 0.0004758442110969312, "loss": 5.8089, "mean_token_accuracy": 0.1831536501646042, "num_tokens": 34846125.0, "step": 13750 }, { "entropy": 6.30714054107666, "epoch": 1.5874206578188113, "grad_norm": 0.92578125, "learning_rate": 0.0004758256070533022, "loss": 5.8854, "mean_token_accuracy": 0.18437816053628922, "num_tokens": 34858438.0, "step": 13755 }, { "entropy": 6.2490949630737305, "epoch": 1.5879976918638201, "grad_norm": 0.86328125, "learning_rate": 0.0004758069962550037, "loss": 5.8674, "mean_token_accuracy": 0.18302336782217027, "num_tokens": 34871340.0, "step": 13760 }, { "entropy": 6.250127840042114, "epoch": 1.5885747259088285, "grad_norm": 0.92578125, "learning_rate": 0.00047578837870266156, "loss": 5.8296, "mean_token_accuracy": 0.18722266256809234, "num_tokens": 34882111.0, "step": 13765 }, { "entropy": 6.2264612197875975, "epoch": 1.5891517599538374, "grad_norm": 0.85546875, "learning_rate": 0.00047576975439690206, "loss": 5.8497, "mean_token_accuracy": 0.18753604739904403, "num_tokens": 34895539.0, "step": 13770 }, { "entropy": 6.245386600494385, "epoch": 1.5897287939988458, "grad_norm": 0.93359375, "learning_rate": 0.00047575112333835164, "loss": 5.7943, "mean_token_accuracy": 0.1940807059407234, "num_tokens": 34907860.0, "step": 13775 }, { "entropy": 6.318158340454102, "epoch": 1.5903058280438547, "grad_norm": 0.85546875, "learning_rate": 0.00047573248552763684, "loss": 5.9049, "mean_token_accuracy": 0.18691892623901368, "num_tokens": 34920595.0, "step": 13780 }, { "entropy": 6.237708854675293, "epoch": 1.590882862088863, "grad_norm": 0.87890625, "learning_rate": 0.00047571384096538474, "loss": 5.8353, "mean_token_accuracy": 0.19281982034444808, "num_tokens": 34933458.0, "step": 13785 }, { "entropy": 6.154352331161499, "epoch": 1.591459896133872, "grad_norm": 0.9609375, "learning_rate": 0.0004756951896522222, "loss": 5.7572, "mean_token_accuracy": 0.19540754407644273, "num_tokens": 34946872.0, "step": 13790 }, { "entropy": 6.236962699890137, "epoch": 1.5920369301788806, "grad_norm": 0.89453125, "learning_rate": 0.0004756765315887766, "loss": 5.8304, "mean_token_accuracy": 0.1889364406466484, "num_tokens": 34959384.0, "step": 13795 }, { "entropy": 6.282778406143189, "epoch": 1.5926139642238892, "grad_norm": 0.94921875, "learning_rate": 0.0004756578667756756, "loss": 5.8797, "mean_token_accuracy": 0.18420573323965073, "num_tokens": 34971571.0, "step": 13800 }, { "entropy": 6.234209203720093, "epoch": 1.5931909982688979, "grad_norm": 0.921875, "learning_rate": 0.0004756391952135469, "loss": 5.7703, "mean_token_accuracy": 0.20292106419801711, "num_tokens": 34984897.0, "step": 13805 }, { "entropy": 6.226548194885254, "epoch": 1.5937680323139065, "grad_norm": 0.95703125, "learning_rate": 0.00047562051690301855, "loss": 5.8317, "mean_token_accuracy": 0.19043446183204651, "num_tokens": 34998185.0, "step": 13810 }, { "entropy": 6.307507181167603, "epoch": 1.5943450663589152, "grad_norm": 1.015625, "learning_rate": 0.00047560183184471873, "loss": 5.8377, "mean_token_accuracy": 0.18937501907348633, "num_tokens": 35010985.0, "step": 13815 }, { "entropy": 6.25484938621521, "epoch": 1.5949221004039238, "grad_norm": 0.8671875, "learning_rate": 0.000475583140039276, "loss": 5.8375, "mean_token_accuracy": 0.19109233766794204, "num_tokens": 35023785.0, "step": 13820 }, { "entropy": 6.301526784896851, "epoch": 1.5954991344489324, "grad_norm": 0.87109375, "learning_rate": 0.00047556444148731897, "loss": 5.8994, "mean_token_accuracy": 0.17948832660913466, "num_tokens": 35035926.0, "step": 13825 }, { "entropy": 6.276957702636719, "epoch": 1.596076168493941, "grad_norm": 0.90625, "learning_rate": 0.0004755457361894766, "loss": 5.832, "mean_token_accuracy": 0.19143660515546798, "num_tokens": 35048290.0, "step": 13830 }, { "entropy": 6.166981220245361, "epoch": 1.59665320253895, "grad_norm": 0.953125, "learning_rate": 0.00047552702414637793, "loss": 5.7645, "mean_token_accuracy": 0.19035774618387222, "num_tokens": 35059883.0, "step": 13835 }, { "entropy": 6.277225303649902, "epoch": 1.5972302365839584, "grad_norm": 0.89453125, "learning_rate": 0.00047550830535865245, "loss": 5.8617, "mean_token_accuracy": 0.1807610049843788, "num_tokens": 35071747.0, "step": 13840 }, { "entropy": 6.190814876556397, "epoch": 1.5978072706289672, "grad_norm": 0.98046875, "learning_rate": 0.00047548957982692974, "loss": 5.8134, "mean_token_accuracy": 0.1871611699461937, "num_tokens": 35083774.0, "step": 13845 }, { "entropy": 6.200519466400147, "epoch": 1.5983843046739756, "grad_norm": 0.91015625, "learning_rate": 0.0004754708475518396, "loss": 5.811, "mean_token_accuracy": 0.19500787407159806, "num_tokens": 35095757.0, "step": 13850 }, { "entropy": 6.238155698776245, "epoch": 1.5989613387189845, "grad_norm": 0.828125, "learning_rate": 0.00047545210853401214, "loss": 5.7967, "mean_token_accuracy": 0.19086273461580278, "num_tokens": 35108788.0, "step": 13855 }, { "entropy": 6.29552264213562, "epoch": 1.599538372763993, "grad_norm": 0.85546875, "learning_rate": 0.00047543336277407753, "loss": 5.9095, "mean_token_accuracy": 0.18491909354925157, "num_tokens": 35121641.0, "step": 13860 }, { "entropy": 6.298146390914917, "epoch": 1.6001154068090018, "grad_norm": 0.8828125, "learning_rate": 0.00047541461027266624, "loss": 5.872, "mean_token_accuracy": 0.18402589708566666, "num_tokens": 35133960.0, "step": 13865 }, { "entropy": 6.290952396392822, "epoch": 1.6006924408540104, "grad_norm": 0.8984375, "learning_rate": 0.0004753958510304091, "loss": 5.8602, "mean_token_accuracy": 0.19193972200155257, "num_tokens": 35146027.0, "step": 13870 }, { "entropy": 6.268626737594604, "epoch": 1.601269474899019, "grad_norm": 0.9140625, "learning_rate": 0.00047537708504793714, "loss": 5.8229, "mean_token_accuracy": 0.19206952154636384, "num_tokens": 35158728.0, "step": 13875 }, { "entropy": 6.216690492630005, "epoch": 1.6018465089440277, "grad_norm": 0.96484375, "learning_rate": 0.00047535831232588146, "loss": 5.8518, "mean_token_accuracy": 0.18720198273658753, "num_tokens": 35171734.0, "step": 13880 }, { "entropy": 6.28776330947876, "epoch": 1.6024235429890363, "grad_norm": 0.83984375, "learning_rate": 0.00047533953286487345, "loss": 5.8469, "mean_token_accuracy": 0.1826049879193306, "num_tokens": 35185074.0, "step": 13885 }, { "entropy": 6.27451376914978, "epoch": 1.603000577034045, "grad_norm": 0.90625, "learning_rate": 0.0004753207466655447, "loss": 5.8782, "mean_token_accuracy": 0.19072716683149338, "num_tokens": 35197972.0, "step": 13890 }, { "entropy": 6.271556949615478, "epoch": 1.6035776110790536, "grad_norm": 0.86328125, "learning_rate": 0.0004753019537285273, "loss": 5.8383, "mean_token_accuracy": 0.19148626625537873, "num_tokens": 35210939.0, "step": 13895 }, { "entropy": 6.355197715759277, "epoch": 1.6041546451240625, "grad_norm": 0.90625, "learning_rate": 0.00047528315405445296, "loss": 5.8933, "mean_token_accuracy": 0.18523967564105986, "num_tokens": 35223521.0, "step": 13900 }, { "entropy": 6.283075332641602, "epoch": 1.604731679169071, "grad_norm": 0.921875, "learning_rate": 0.00047526434764395435, "loss": 5.8874, "mean_token_accuracy": 0.19085699915885926, "num_tokens": 35235713.0, "step": 13905 }, { "entropy": 6.227591133117675, "epoch": 1.6053087132140798, "grad_norm": 0.9296875, "learning_rate": 0.00047524553449766386, "loss": 5.8254, "mean_token_accuracy": 0.1942302703857422, "num_tokens": 35248938.0, "step": 13910 }, { "entropy": 6.268484354019165, "epoch": 1.6058857472590882, "grad_norm": 0.9140625, "learning_rate": 0.00047522671461621433, "loss": 5.8516, "mean_token_accuracy": 0.18590108901262284, "num_tokens": 35260916.0, "step": 13915 }, { "entropy": 6.279177951812744, "epoch": 1.606462781304097, "grad_norm": 0.94921875, "learning_rate": 0.0004752078880002386, "loss": 5.7918, "mean_token_accuracy": 0.19422025829553605, "num_tokens": 35273529.0, "step": 13920 }, { "entropy": 6.256890106201172, "epoch": 1.6070398153491054, "grad_norm": 0.9296875, "learning_rate": 0.00047518905465037005, "loss": 5.7895, "mean_token_accuracy": 0.1899741917848587, "num_tokens": 35285500.0, "step": 13925 }, { "entropy": 6.217769765853882, "epoch": 1.6076168493941143, "grad_norm": 0.921875, "learning_rate": 0.00047517021456724214, "loss": 5.8204, "mean_token_accuracy": 0.18706730306148528, "num_tokens": 35300039.0, "step": 13930 }, { "entropy": 6.256122732162476, "epoch": 1.608193883439123, "grad_norm": 0.9375, "learning_rate": 0.00047515136775148843, "loss": 5.9094, "mean_token_accuracy": 0.17840041369199752, "num_tokens": 35313091.0, "step": 13935 }, { "entropy": 6.28008508682251, "epoch": 1.6087709174841316, "grad_norm": 0.90234375, "learning_rate": 0.0004751325142037429, "loss": 5.8688, "mean_token_accuracy": 0.1876186579465866, "num_tokens": 35325890.0, "step": 13940 }, { "entropy": 6.198402643203735, "epoch": 1.6093479515291402, "grad_norm": 0.8125, "learning_rate": 0.00047511365392463974, "loss": 5.7532, "mean_token_accuracy": 0.1986751899123192, "num_tokens": 35339395.0, "step": 13945 }, { "entropy": 6.235682106018066, "epoch": 1.6099249855741489, "grad_norm": 0.93359375, "learning_rate": 0.00047509478691481317, "loss": 5.8111, "mean_token_accuracy": 0.19092074632644654, "num_tokens": 35351163.0, "step": 13950 }, { "entropy": 6.245539283752441, "epoch": 1.6105020196191575, "grad_norm": 0.91015625, "learning_rate": 0.00047507591317489783, "loss": 5.7374, "mean_token_accuracy": 0.20853773206472398, "num_tokens": 35364099.0, "step": 13955 }, { "entropy": 6.257050561904907, "epoch": 1.6110790536641661, "grad_norm": 0.875, "learning_rate": 0.0004750570327055286, "loss": 5.7902, "mean_token_accuracy": 0.19092931747436523, "num_tokens": 35376768.0, "step": 13960 }, { "entropy": 6.275674676895141, "epoch": 1.6116560877091748, "grad_norm": 0.93359375, "learning_rate": 0.00047503814550734034, "loss": 5.8654, "mean_token_accuracy": 0.18828979283571243, "num_tokens": 35388892.0, "step": 13965 }, { "entropy": 6.308603286743164, "epoch": 1.6122331217541834, "grad_norm": 0.984375, "learning_rate": 0.0004750192515809685, "loss": 5.9013, "mean_token_accuracy": 0.18381124287843703, "num_tokens": 35401573.0, "step": 13970 }, { "entropy": 6.255910587310791, "epoch": 1.6128101557991923, "grad_norm": 0.91015625, "learning_rate": 0.00047500035092704843, "loss": 5.7872, "mean_token_accuracy": 0.19008346199989318, "num_tokens": 35415073.0, "step": 13975 }, { "entropy": 6.209208059310913, "epoch": 1.6133871898442007, "grad_norm": 0.87109375, "learning_rate": 0.0004749814435462159, "loss": 5.7701, "mean_token_accuracy": 0.19700252562761306, "num_tokens": 35428756.0, "step": 13980 }, { "entropy": 6.309863519668579, "epoch": 1.6139642238892096, "grad_norm": 0.92578125, "learning_rate": 0.0004749625294391069, "loss": 5.775, "mean_token_accuracy": 0.19249810576438903, "num_tokens": 35440387.0, "step": 13985 }, { "entropy": 6.164202404022217, "epoch": 1.614541257934218, "grad_norm": 0.7734375, "learning_rate": 0.00047494360860635755, "loss": 5.7059, "mean_token_accuracy": 0.20623115003108977, "num_tokens": 35454105.0, "step": 13990 }, { "entropy": 6.217005205154419, "epoch": 1.6151182919792268, "grad_norm": 0.90234375, "learning_rate": 0.0004749246810486042, "loss": 5.859, "mean_token_accuracy": 0.19571419805288315, "num_tokens": 35467775.0, "step": 13995 }, { "entropy": 6.2699981212615965, "epoch": 1.6156953260242353, "grad_norm": 0.93359375, "learning_rate": 0.0004749057467664836, "loss": 5.8614, "mean_token_accuracy": 0.18756910860538484, "num_tokens": 35479217.0, "step": 14000 }, { "entropy": 6.258079528808594, "epoch": 1.6162723600692441, "grad_norm": 0.95703125, "learning_rate": 0.00047488680576063247, "loss": 5.8267, "mean_token_accuracy": 0.20054476708173752, "num_tokens": 35490676.0, "step": 14005 }, { "entropy": 6.22015151977539, "epoch": 1.6168493941142528, "grad_norm": 0.921875, "learning_rate": 0.0004748678580316878, "loss": 5.7543, "mean_token_accuracy": 0.19434951543807982, "num_tokens": 35503440.0, "step": 14010 }, { "entropy": 6.183001565933227, "epoch": 1.6174264281592614, "grad_norm": 0.9140625, "learning_rate": 0.00047484890358028714, "loss": 5.7756, "mean_token_accuracy": 0.19921866208314895, "num_tokens": 35515717.0, "step": 14015 }, { "entropy": 6.2771368503570555, "epoch": 1.61800346220427, "grad_norm": 1.0390625, "learning_rate": 0.0004748299424070678, "loss": 5.7939, "mean_token_accuracy": 0.1896692395210266, "num_tokens": 35528445.0, "step": 14020 }, { "entropy": 6.1768638610839846, "epoch": 1.6185804962492787, "grad_norm": 0.8203125, "learning_rate": 0.0004748109745126677, "loss": 5.7165, "mean_token_accuracy": 0.19463213682174682, "num_tokens": 35541652.0, "step": 14025 }, { "entropy": 6.125383138656616, "epoch": 1.6191575302942873, "grad_norm": 0.91015625, "learning_rate": 0.00047479199989772464, "loss": 5.7204, "mean_token_accuracy": 0.2015412136912346, "num_tokens": 35555310.0, "step": 14030 }, { "entropy": 6.320287895202637, "epoch": 1.619734564339296, "grad_norm": 0.90625, "learning_rate": 0.000474773018562877, "loss": 5.8361, "mean_token_accuracy": 0.18703369945287704, "num_tokens": 35567830.0, "step": 14035 }, { "entropy": 6.232371616363525, "epoch": 1.6203115983843048, "grad_norm": 0.98046875, "learning_rate": 0.00047475403050876297, "loss": 5.8173, "mean_token_accuracy": 0.19013205021619797, "num_tokens": 35579054.0, "step": 14040 }, { "entropy": 6.305903196334839, "epoch": 1.6208886324293132, "grad_norm": 0.96484375, "learning_rate": 0.0004747350357360214, "loss": 5.92, "mean_token_accuracy": 0.18613108694553376, "num_tokens": 35592463.0, "step": 14045 }, { "entropy": 6.2606062412261965, "epoch": 1.621465666474322, "grad_norm": 0.95703125, "learning_rate": 0.0004747160342452912, "loss": 5.8242, "mean_token_accuracy": 0.1944044604897499, "num_tokens": 35605127.0, "step": 14050 }, { "entropy": 6.210332012176513, "epoch": 1.6220427005193305, "grad_norm": 0.9296875, "learning_rate": 0.00047469702603721134, "loss": 5.7752, "mean_token_accuracy": 0.19872388392686843, "num_tokens": 35617509.0, "step": 14055 }, { "entropy": 6.21488995552063, "epoch": 1.6226197345643394, "grad_norm": 0.91796875, "learning_rate": 0.0004746780111124212, "loss": 5.796, "mean_token_accuracy": 0.19262754619121553, "num_tokens": 35630788.0, "step": 14060 }, { "entropy": 6.336267614364624, "epoch": 1.6231967686093478, "grad_norm": 0.92578125, "learning_rate": 0.00047465898947156033, "loss": 5.8856, "mean_token_accuracy": 0.1877436563372612, "num_tokens": 35643613.0, "step": 14065 }, { "entropy": 6.2986588954925535, "epoch": 1.6237738026543567, "grad_norm": 0.9375, "learning_rate": 0.00047463996111526854, "loss": 5.8275, "mean_token_accuracy": 0.189494089782238, "num_tokens": 35656495.0, "step": 14070 }, { "entropy": 6.242229413986206, "epoch": 1.6243508366993653, "grad_norm": 0.86328125, "learning_rate": 0.00047462092604418576, "loss": 5.9166, "mean_token_accuracy": 0.18053760081529618, "num_tokens": 35669661.0, "step": 14075 }, { "entropy": 6.240379905700683, "epoch": 1.624927870744374, "grad_norm": 0.87890625, "learning_rate": 0.00047460188425895236, "loss": 5.8252, "mean_token_accuracy": 0.18926533162593842, "num_tokens": 35682675.0, "step": 14080 }, { "entropy": 6.289512968063354, "epoch": 1.6255049047893826, "grad_norm": 0.921875, "learning_rate": 0.00047458283576020874, "loss": 5.8646, "mean_token_accuracy": 0.1920921802520752, "num_tokens": 35694571.0, "step": 14085 }, { "entropy": 6.22381739616394, "epoch": 1.6260819388343912, "grad_norm": 0.92578125, "learning_rate": 0.00047456378054859554, "loss": 5.7493, "mean_token_accuracy": 0.19590264409780503, "num_tokens": 35707196.0, "step": 14090 }, { "entropy": 6.2018373012542725, "epoch": 1.6266589728793999, "grad_norm": 0.9140625, "learning_rate": 0.00047454471862475375, "loss": 5.7632, "mean_token_accuracy": 0.195886792242527, "num_tokens": 35719682.0, "step": 14095 }, { "entropy": 6.229247808456421, "epoch": 1.6272360069244085, "grad_norm": 0.91015625, "learning_rate": 0.00047452564998932446, "loss": 5.8639, "mean_token_accuracy": 0.18924974799156188, "num_tokens": 35732595.0, "step": 14100 }, { "entropy": 6.275307750701904, "epoch": 1.6278130409694171, "grad_norm": 0.92578125, "learning_rate": 0.000474506574642949, "loss": 5.8004, "mean_token_accuracy": 0.19364307522773744, "num_tokens": 35744611.0, "step": 14105 }, { "entropy": 6.194735336303711, "epoch": 1.6283900750144258, "grad_norm": 0.97265625, "learning_rate": 0.000474487492586269, "loss": 5.8052, "mean_token_accuracy": 0.19076161533594133, "num_tokens": 35757288.0, "step": 14110 }, { "entropy": 6.270211219787598, "epoch": 1.6289671090594346, "grad_norm": 0.94140625, "learning_rate": 0.0004744684038199263, "loss": 5.8733, "mean_token_accuracy": 0.18648385405540466, "num_tokens": 35769747.0, "step": 14115 }, { "entropy": 6.315110445022583, "epoch": 1.629544143104443, "grad_norm": 0.953125, "learning_rate": 0.00047444930834456293, "loss": 5.8978, "mean_token_accuracy": 0.19017856419086457, "num_tokens": 35781656.0, "step": 14120 }, { "entropy": 6.277868747711182, "epoch": 1.630121177149452, "grad_norm": 0.90234375, "learning_rate": 0.0004744302061608212, "loss": 5.8544, "mean_token_accuracy": 0.19737848043441772, "num_tokens": 35794618.0, "step": 14125 }, { "entropy": 6.253666496276855, "epoch": 1.6306982111944603, "grad_norm": 0.8984375, "learning_rate": 0.00047441109726934345, "loss": 5.7741, "mean_token_accuracy": 0.19238534420728684, "num_tokens": 35807504.0, "step": 14130 }, { "entropy": 6.165348815917969, "epoch": 1.6312752452394692, "grad_norm": 1.0078125, "learning_rate": 0.00047439198167077256, "loss": 5.7917, "mean_token_accuracy": 0.19519294947385787, "num_tokens": 35819668.0, "step": 14135 }, { "entropy": 6.2695183753967285, "epoch": 1.6318522792844776, "grad_norm": 0.97265625, "learning_rate": 0.0004743728593657514, "loss": 5.8348, "mean_token_accuracy": 0.1945918545126915, "num_tokens": 35832078.0, "step": 14140 }, { "entropy": 6.178915405273438, "epoch": 1.6324293133294865, "grad_norm": 0.953125, "learning_rate": 0.0004743537303549231, "loss": 5.7189, "mean_token_accuracy": 0.19973592162132264, "num_tokens": 35843580.0, "step": 14145 }, { "entropy": 6.201517915725708, "epoch": 1.6330063473744951, "grad_norm": 0.90234375, "learning_rate": 0.0004743345946389311, "loss": 5.7507, "mean_token_accuracy": 0.2023004561662674, "num_tokens": 35857146.0, "step": 14150 }, { "entropy": 6.266290998458862, "epoch": 1.6335833814195038, "grad_norm": 0.90234375, "learning_rate": 0.00047431545221841907, "loss": 5.7991, "mean_token_accuracy": 0.1934083268046379, "num_tokens": 35869374.0, "step": 14155 }, { "entropy": 6.319689178466797, "epoch": 1.6341604154645124, "grad_norm": 0.93359375, "learning_rate": 0.00047429630309403086, "loss": 5.8254, "mean_token_accuracy": 0.1859660416841507, "num_tokens": 35881882.0, "step": 14160 }, { "entropy": 6.082709503173828, "epoch": 1.634737449509521, "grad_norm": 0.8359375, "learning_rate": 0.00047427714726641044, "loss": 5.6478, "mean_token_accuracy": 0.20330152064561843, "num_tokens": 35895512.0, "step": 14165 }, { "entropy": 6.1116431713104244, "epoch": 1.6353144835545297, "grad_norm": 0.81640625, "learning_rate": 0.00047425798473620215, "loss": 5.6909, "mean_token_accuracy": 0.19648269861936568, "num_tokens": 35908020.0, "step": 14170 }, { "entropy": 6.265104627609253, "epoch": 1.6358915175995383, "grad_norm": 0.88671875, "learning_rate": 0.0004742388155040505, "loss": 5.7543, "mean_token_accuracy": 0.19779868721961974, "num_tokens": 35920261.0, "step": 14175 }, { "entropy": 6.288595819473267, "epoch": 1.6364685516445472, "grad_norm": 0.8671875, "learning_rate": 0.00047421963957060026, "loss": 5.9132, "mean_token_accuracy": 0.18365271687507628, "num_tokens": 35932135.0, "step": 14180 }, { "entropy": 6.19545316696167, "epoch": 1.6370455856895556, "grad_norm": 0.8671875, "learning_rate": 0.0004742004569364964, "loss": 5.7862, "mean_token_accuracy": 0.19036284685134888, "num_tokens": 35944574.0, "step": 14185 }, { "entropy": 6.272937345504761, "epoch": 1.6376226197345645, "grad_norm": 0.796875, "learning_rate": 0.00047418126760238416, "loss": 5.7716, "mean_token_accuracy": 0.19476332664489746, "num_tokens": 35956877.0, "step": 14190 }, { "entropy": 6.306672048568726, "epoch": 1.6381996537795729, "grad_norm": 0.93359375, "learning_rate": 0.00047416207156890887, "loss": 5.8893, "mean_token_accuracy": 0.18866454511880876, "num_tokens": 35968616.0, "step": 14195 }, { "entropy": 6.216367101669311, "epoch": 1.6387766878245817, "grad_norm": 0.8984375, "learning_rate": 0.0004741428688367164, "loss": 5.8467, "mean_token_accuracy": 0.19205766469240187, "num_tokens": 35982401.0, "step": 14200 }, { "entropy": 6.269579744338989, "epoch": 1.6393537218695902, "grad_norm": 0.87109375, "learning_rate": 0.00047412365940645225, "loss": 5.7995, "mean_token_accuracy": 0.19650813192129135, "num_tokens": 35994907.0, "step": 14205 }, { "entropy": 6.257475233078003, "epoch": 1.639930755914599, "grad_norm": 1.0, "learning_rate": 0.00047410444327876286, "loss": 5.7485, "mean_token_accuracy": 0.19474590718746185, "num_tokens": 36007109.0, "step": 14210 }, { "entropy": 6.236335754394531, "epoch": 1.6405077899596077, "grad_norm": 0.94921875, "learning_rate": 0.00047408522045429426, "loss": 5.8324, "mean_token_accuracy": 0.1903609052300453, "num_tokens": 36018734.0, "step": 14215 }, { "entropy": 6.257100391387939, "epoch": 1.6410848240046163, "grad_norm": 1.015625, "learning_rate": 0.0004740659909336933, "loss": 5.7787, "mean_token_accuracy": 0.2008269727230072, "num_tokens": 36031427.0, "step": 14220 }, { "entropy": 6.285252904891967, "epoch": 1.641661858049625, "grad_norm": 0.92578125, "learning_rate": 0.00047404675471760655, "loss": 5.8026, "mean_token_accuracy": 0.1962312713265419, "num_tokens": 36044726.0, "step": 14225 }, { "entropy": 6.20171971321106, "epoch": 1.6422388920946336, "grad_norm": 0.89453125, "learning_rate": 0.0004740275118066811, "loss": 5.8143, "mean_token_accuracy": 0.18700166642665864, "num_tokens": 36056882.0, "step": 14230 }, { "entropy": 6.2923260688781735, "epoch": 1.6428159261396422, "grad_norm": 0.9765625, "learning_rate": 0.00047400826220156416, "loss": 5.8656, "mean_token_accuracy": 0.18483263552188872, "num_tokens": 36068548.0, "step": 14235 }, { "entropy": 6.342332458496093, "epoch": 1.6433929601846509, "grad_norm": 0.92578125, "learning_rate": 0.00047398900590290313, "loss": 5.7777, "mean_token_accuracy": 0.18994950652122497, "num_tokens": 36080652.0, "step": 14240 }, { "entropy": 6.206917762756348, "epoch": 1.6439699942296595, "grad_norm": 1.0234375, "learning_rate": 0.00047396974291134575, "loss": 5.8173, "mean_token_accuracy": 0.1934569150209427, "num_tokens": 36093372.0, "step": 14245 }, { "entropy": 6.2440855503082275, "epoch": 1.6445470282746681, "grad_norm": 0.875, "learning_rate": 0.00047395047322754, "loss": 5.8276, "mean_token_accuracy": 0.1925554320216179, "num_tokens": 36106023.0, "step": 14250 }, { "entropy": 6.222019481658935, "epoch": 1.645124062319677, "grad_norm": 0.9296875, "learning_rate": 0.00047393119685213374, "loss": 5.7587, "mean_token_accuracy": 0.20053549259901046, "num_tokens": 36119627.0, "step": 14255 }, { "entropy": 6.09753794670105, "epoch": 1.6457010963646854, "grad_norm": 0.91796875, "learning_rate": 0.0004739119137857756, "loss": 5.6112, "mean_token_accuracy": 0.20973964035511017, "num_tokens": 36132835.0, "step": 14260 }, { "entropy": 6.277415990829468, "epoch": 1.6462781304096943, "grad_norm": 0.96484375, "learning_rate": 0.00047389262402911404, "loss": 5.7902, "mean_token_accuracy": 0.19406622946262359, "num_tokens": 36144234.0, "step": 14265 }, { "entropy": 6.198006725311279, "epoch": 1.6468551644547027, "grad_norm": 0.85546875, "learning_rate": 0.00047387332758279784, "loss": 5.7493, "mean_token_accuracy": 0.19753192216157914, "num_tokens": 36158556.0, "step": 14270 }, { "entropy": 6.210707807540894, "epoch": 1.6474321984997116, "grad_norm": 0.875, "learning_rate": 0.00047385402444747606, "loss": 5.8218, "mean_token_accuracy": 0.1887941062450409, "num_tokens": 36171698.0, "step": 14275 }, { "entropy": 6.213572263717651, "epoch": 1.64800923254472, "grad_norm": 0.953125, "learning_rate": 0.00047383471462379803, "loss": 5.8067, "mean_token_accuracy": 0.19627797454595566, "num_tokens": 36184649.0, "step": 14280 }, { "entropy": 6.271010494232177, "epoch": 1.6485862665897288, "grad_norm": 0.859375, "learning_rate": 0.000473815398112413, "loss": 5.7599, "mean_token_accuracy": 0.19666724503040314, "num_tokens": 36197127.0, "step": 14285 }, { "entropy": 6.229652214050293, "epoch": 1.6491633006347375, "grad_norm": 0.90625, "learning_rate": 0.0004737960749139708, "loss": 5.7883, "mean_token_accuracy": 0.19295482188463212, "num_tokens": 36209471.0, "step": 14290 }, { "entropy": 6.301067876815796, "epoch": 1.6497403346797461, "grad_norm": 0.8828125, "learning_rate": 0.0004737767450291215, "loss": 5.8443, "mean_token_accuracy": 0.19018818587064742, "num_tokens": 36221798.0, "step": 14295 }, { "entropy": 6.232090139389038, "epoch": 1.6503173687247548, "grad_norm": 0.875, "learning_rate": 0.00047375740845851506, "loss": 5.7485, "mean_token_accuracy": 0.19451043158769607, "num_tokens": 36235758.0, "step": 14300 }, { "entropy": 6.224923515319825, "epoch": 1.6508944027697634, "grad_norm": 0.91796875, "learning_rate": 0.0004737380652028019, "loss": 5.8011, "mean_token_accuracy": 0.19222778230905532, "num_tokens": 36248484.0, "step": 14305 }, { "entropy": 6.099427223205566, "epoch": 1.651471436814772, "grad_norm": 0.9296875, "learning_rate": 0.00047371871526263263, "loss": 5.6429, "mean_token_accuracy": 0.2055506318807602, "num_tokens": 36260796.0, "step": 14310 }, { "entropy": 6.171128606796264, "epoch": 1.6520484708597807, "grad_norm": 0.92578125, "learning_rate": 0.0004736993586386581, "loss": 5.7813, "mean_token_accuracy": 0.19944193214178085, "num_tokens": 36273617.0, "step": 14315 }, { "entropy": 6.160193538665771, "epoch": 1.6526255049047895, "grad_norm": 0.96484375, "learning_rate": 0.00047367999533152934, "loss": 5.7129, "mean_token_accuracy": 0.2024203896522522, "num_tokens": 36286285.0, "step": 14320 }, { "entropy": 6.3143633842468265, "epoch": 1.653202538949798, "grad_norm": 1.9921875, "learning_rate": 0.00047366062534189756, "loss": 5.8611, "mean_token_accuracy": 0.18911528140306472, "num_tokens": 36298970.0, "step": 14325 }, { "entropy": 6.190754985809326, "epoch": 1.6537795729948068, "grad_norm": 0.8671875, "learning_rate": 0.00047364124867041446, "loss": 5.7636, "mean_token_accuracy": 0.19722063839435577, "num_tokens": 36312684.0, "step": 14330 }, { "entropy": 6.189275121688842, "epoch": 1.6543566070398152, "grad_norm": 0.89453125, "learning_rate": 0.00047362186531773156, "loss": 5.8586, "mean_token_accuracy": 0.18725836277008057, "num_tokens": 36326300.0, "step": 14335 }, { "entropy": 6.228783130645752, "epoch": 1.654933641084824, "grad_norm": 0.92578125, "learning_rate": 0.0004736024752845008, "loss": 5.7745, "mean_token_accuracy": 0.18818582445383072, "num_tokens": 36338234.0, "step": 14340 }, { "entropy": 6.295052719116211, "epoch": 1.6555106751298325, "grad_norm": 0.96484375, "learning_rate": 0.0004735830785713746, "loss": 5.839, "mean_token_accuracy": 0.18417955487966536, "num_tokens": 36351032.0, "step": 14345 }, { "entropy": 6.242326784133911, "epoch": 1.6560877091748414, "grad_norm": 0.90625, "learning_rate": 0.0004735636751790051, "loss": 5.7387, "mean_token_accuracy": 0.1901518702507019, "num_tokens": 36363267.0, "step": 14350 }, { "entropy": 6.219479417800903, "epoch": 1.65666474321985, "grad_norm": 1.046875, "learning_rate": 0.000473544265108045, "loss": 5.8147, "mean_token_accuracy": 0.19406894594430923, "num_tokens": 36375628.0, "step": 14355 }, { "entropy": 6.241999006271362, "epoch": 1.6572417772648587, "grad_norm": 0.94140625, "learning_rate": 0.00047352484835914716, "loss": 5.8367, "mean_token_accuracy": 0.18755433857440948, "num_tokens": 36388161.0, "step": 14360 }, { "entropy": 6.253871107101441, "epoch": 1.6578188113098673, "grad_norm": 0.9296875, "learning_rate": 0.0004735054249329647, "loss": 5.7901, "mean_token_accuracy": 0.19120151847600936, "num_tokens": 36400287.0, "step": 14365 }, { "entropy": 6.257974624633789, "epoch": 1.658395845354876, "grad_norm": 0.8515625, "learning_rate": 0.00047348599483015087, "loss": 5.8799, "mean_token_accuracy": 0.19049407839775084, "num_tokens": 36413896.0, "step": 14370 }, { "entropy": 6.253906106948852, "epoch": 1.6589728793998846, "grad_norm": 0.88671875, "learning_rate": 0.00047346655805135916, "loss": 5.7927, "mean_token_accuracy": 0.19061724245548248, "num_tokens": 36425812.0, "step": 14375 }, { "entropy": 6.214411783218384, "epoch": 1.6595499134448932, "grad_norm": 0.875, "learning_rate": 0.0004734471145972434, "loss": 5.7935, "mean_token_accuracy": 0.18819109499454498, "num_tokens": 36438977.0, "step": 14380 }, { "entropy": 6.262951374053955, "epoch": 1.6601269474899019, "grad_norm": 0.92578125, "learning_rate": 0.00047342766446845753, "loss": 5.8245, "mean_token_accuracy": 0.1869310572743416, "num_tokens": 36453173.0, "step": 14385 }, { "entropy": 6.281124496459961, "epoch": 1.6607039815349105, "grad_norm": 0.98046875, "learning_rate": 0.0004734082076656557, "loss": 5.7762, "mean_token_accuracy": 0.1942988872528076, "num_tokens": 36464977.0, "step": 14390 }, { "entropy": 6.250260543823242, "epoch": 1.6612810155799194, "grad_norm": 0.95703125, "learning_rate": 0.00047338874418949235, "loss": 5.896, "mean_token_accuracy": 0.18223095685243607, "num_tokens": 36476951.0, "step": 14395 }, { "entropy": 6.25014476776123, "epoch": 1.6618580496249278, "grad_norm": 0.8203125, "learning_rate": 0.00047336927404062213, "loss": 5.876, "mean_token_accuracy": 0.18608336001634598, "num_tokens": 36490387.0, "step": 14400 }, { "entropy": 6.303406810760498, "epoch": 1.6624350836699366, "grad_norm": 0.9453125, "learning_rate": 0.00047334979721969995, "loss": 5.8402, "mean_token_accuracy": 0.18937479555606843, "num_tokens": 36501958.0, "step": 14405 }, { "entropy": 6.3160100936889645, "epoch": 1.663012117714945, "grad_norm": 0.87890625, "learning_rate": 0.0004733303137273808, "loss": 5.8947, "mean_token_accuracy": 0.18646145313978196, "num_tokens": 36515355.0, "step": 14410 }, { "entropy": 6.299543190002441, "epoch": 1.663589151759954, "grad_norm": 0.91796875, "learning_rate": 0.00047331082356432015, "loss": 5.8883, "mean_token_accuracy": 0.18837940245866774, "num_tokens": 36528288.0, "step": 14415 }, { "entropy": 6.350749063491821, "epoch": 1.6641661858049623, "grad_norm": 0.97265625, "learning_rate": 0.0004732913267311734, "loss": 5.8876, "mean_token_accuracy": 0.18897933512926102, "num_tokens": 36541577.0, "step": 14420 }, { "entropy": 6.26870493888855, "epoch": 1.6647432198499712, "grad_norm": 0.953125, "learning_rate": 0.0004732718232285964, "loss": 5.8037, "mean_token_accuracy": 0.19384131133556365, "num_tokens": 36554802.0, "step": 14425 }, { "entropy": 6.243334054946899, "epoch": 1.6653202538949798, "grad_norm": 0.90625, "learning_rate": 0.00047325231305724507, "loss": 5.7683, "mean_token_accuracy": 0.19212243258953093, "num_tokens": 36567175.0, "step": 14430 }, { "entropy": 6.189241361618042, "epoch": 1.6658972879399885, "grad_norm": 0.88671875, "learning_rate": 0.0004732327962177757, "loss": 5.7606, "mean_token_accuracy": 0.20297178626060486, "num_tokens": 36579391.0, "step": 14435 }, { "entropy": 6.300449275970459, "epoch": 1.6664743219849971, "grad_norm": 0.9609375, "learning_rate": 0.0004732132727108447, "loss": 5.8576, "mean_token_accuracy": 0.18773895353078843, "num_tokens": 36592684.0, "step": 14440 }, { "entropy": 6.249213838577271, "epoch": 1.6670513560300058, "grad_norm": 0.94140625, "learning_rate": 0.00047319374253710874, "loss": 5.8894, "mean_token_accuracy": 0.1900160625576973, "num_tokens": 36604996.0, "step": 14445 }, { "entropy": 6.278888511657715, "epoch": 1.6676283900750144, "grad_norm": 0.90625, "learning_rate": 0.0004731742056972247, "loss": 5.7876, "mean_token_accuracy": 0.19654055088758468, "num_tokens": 36618914.0, "step": 14450 }, { "entropy": 6.2485129833221436, "epoch": 1.668205424120023, "grad_norm": 0.953125, "learning_rate": 0.0004731546621918497, "loss": 5.7587, "mean_token_accuracy": 0.19068465381860733, "num_tokens": 36630527.0, "step": 14455 }, { "entropy": 6.2103640079498295, "epoch": 1.668782458165032, "grad_norm": 0.89453125, "learning_rate": 0.000473135112021641, "loss": 5.8591, "mean_token_accuracy": 0.18707639425992967, "num_tokens": 36642605.0, "step": 14460 }, { "entropy": 6.25440354347229, "epoch": 1.6693594922100403, "grad_norm": 0.9140625, "learning_rate": 0.00047311555518725617, "loss": 5.7669, "mean_token_accuracy": 0.19207081943750381, "num_tokens": 36655075.0, "step": 14465 }, { "entropy": 6.2060243606567385, "epoch": 1.6699365262550492, "grad_norm": 0.91015625, "learning_rate": 0.00047309599168935323, "loss": 5.7996, "mean_token_accuracy": 0.19139713943004608, "num_tokens": 36667684.0, "step": 14470 }, { "entropy": 6.264299297332764, "epoch": 1.6705135603000576, "grad_norm": 0.8984375, "learning_rate": 0.00047307642152858993, "loss": 5.8135, "mean_token_accuracy": 0.19109832346439362, "num_tokens": 36679656.0, "step": 14475 }, { "entropy": 6.1772970199584964, "epoch": 1.6710905943450665, "grad_norm": 0.98046875, "learning_rate": 0.00047305684470562453, "loss": 5.755, "mean_token_accuracy": 0.19919458031654358, "num_tokens": 36691691.0, "step": 14480 }, { "entropy": 6.228798484802246, "epoch": 1.6716676283900749, "grad_norm": 0.8828125, "learning_rate": 0.0004730372612211156, "loss": 5.8375, "mean_token_accuracy": 0.19381739795207978, "num_tokens": 36703615.0, "step": 14485 }, { "entropy": 6.282718276977539, "epoch": 1.6722446624350837, "grad_norm": 0.88671875, "learning_rate": 0.00047301767107572174, "loss": 5.8186, "mean_token_accuracy": 0.1860135242342949, "num_tokens": 36716299.0, "step": 14490 }, { "entropy": 6.275322389602661, "epoch": 1.6728216964800924, "grad_norm": 1.015625, "learning_rate": 0.0004729980742701018, "loss": 5.8049, "mean_token_accuracy": 0.18858209103345872, "num_tokens": 36727723.0, "step": 14495 }, { "entropy": 6.198411750793457, "epoch": 1.673398730525101, "grad_norm": 0.953125, "learning_rate": 0.0004729784708049151, "loss": 5.6589, "mean_token_accuracy": 0.20318579077720642, "num_tokens": 36740497.0, "step": 14500 }, { "entropy": 6.123383331298828, "epoch": 1.6739757645701097, "grad_norm": 0.9140625, "learning_rate": 0.0004729588606808209, "loss": 5.7248, "mean_token_accuracy": 0.19112390279769897, "num_tokens": 36752862.0, "step": 14505 }, { "entropy": 6.287880277633667, "epoch": 1.6745527986151183, "grad_norm": 0.921875, "learning_rate": 0.00047293924389847864, "loss": 5.7944, "mean_token_accuracy": 0.19351442903280258, "num_tokens": 36765948.0, "step": 14510 }, { "entropy": 6.265487384796143, "epoch": 1.675129832660127, "grad_norm": 0.8359375, "learning_rate": 0.0004729196204585483, "loss": 5.8009, "mean_token_accuracy": 0.19770944267511367, "num_tokens": 36778768.0, "step": 14515 }, { "entropy": 6.250596046447754, "epoch": 1.6757068667051356, "grad_norm": 0.92578125, "learning_rate": 0.00047289999036168983, "loss": 5.8277, "mean_token_accuracy": 0.18962397873401643, "num_tokens": 36790941.0, "step": 14520 }, { "entropy": 6.276755619049072, "epoch": 1.6762839007501442, "grad_norm": 0.93359375, "learning_rate": 0.0004728803536085634, "loss": 5.8926, "mean_token_accuracy": 0.1894552379846573, "num_tokens": 36803984.0, "step": 14525 }, { "entropy": 6.22985348701477, "epoch": 1.6768609347951529, "grad_norm": 1.0703125, "learning_rate": 0.00047286071019982974, "loss": 5.7018, "mean_token_accuracy": 0.20174630880355834, "num_tokens": 36815079.0, "step": 14530 }, { "entropy": 6.265960168838501, "epoch": 1.6774379688401617, "grad_norm": 0.95703125, "learning_rate": 0.00047284106013614926, "loss": 5.8432, "mean_token_accuracy": 0.19024327546358108, "num_tokens": 36828007.0, "step": 14535 }, { "entropy": 6.286230373382568, "epoch": 1.6780150028851701, "grad_norm": 0.91015625, "learning_rate": 0.000472821403418183, "loss": 5.9272, "mean_token_accuracy": 0.18469211161136628, "num_tokens": 36841762.0, "step": 14540 }, { "entropy": 6.2628261089324955, "epoch": 1.678592036930179, "grad_norm": 0.8828125, "learning_rate": 0.0004728017400465921, "loss": 5.7975, "mean_token_accuracy": 0.1922488570213318, "num_tokens": 36854624.0, "step": 14545 }, { "entropy": 6.246957540512085, "epoch": 1.6791690709751874, "grad_norm": 0.890625, "learning_rate": 0.00047278207002203796, "loss": 5.7187, "mean_token_accuracy": 0.1921593114733696, "num_tokens": 36866266.0, "step": 14550 }, { "entropy": 6.253695058822632, "epoch": 1.6797461050201963, "grad_norm": 0.890625, "learning_rate": 0.00047276239334518216, "loss": 5.858, "mean_token_accuracy": 0.19074209034442902, "num_tokens": 36878813.0, "step": 14555 }, { "entropy": 6.23266019821167, "epoch": 1.6803231390652047, "grad_norm": 0.953125, "learning_rate": 0.00047274271001668646, "loss": 5.798, "mean_token_accuracy": 0.1866303414106369, "num_tokens": 36891848.0, "step": 14560 }, { "entropy": 6.179357194900513, "epoch": 1.6809001731102136, "grad_norm": 0.9609375, "learning_rate": 0.00047272302003721286, "loss": 5.799, "mean_token_accuracy": 0.190840882062912, "num_tokens": 36903861.0, "step": 14565 }, { "entropy": 6.256790113449097, "epoch": 1.6814772071552222, "grad_norm": 0.8828125, "learning_rate": 0.00047270332340742377, "loss": 5.8563, "mean_token_accuracy": 0.18791476786136627, "num_tokens": 36916849.0, "step": 14570 }, { "entropy": 6.325413751602173, "epoch": 1.6820542412002308, "grad_norm": 0.9453125, "learning_rate": 0.00047268362012798157, "loss": 5.8472, "mean_token_accuracy": 0.18315469324588776, "num_tokens": 36929559.0, "step": 14575 }, { "entropy": 6.102227115631104, "epoch": 1.6826312752452395, "grad_norm": 1.703125, "learning_rate": 0.0004726639101995491, "loss": 5.5979, "mean_token_accuracy": 0.20988662987947465, "num_tokens": 36943958.0, "step": 14580 }, { "entropy": 6.208522462844849, "epoch": 1.6832083092902481, "grad_norm": 0.94921875, "learning_rate": 0.00047264419362278906, "loss": 5.7652, "mean_token_accuracy": 0.19693288952112198, "num_tokens": 36956542.0, "step": 14585 }, { "entropy": 6.227226400375367, "epoch": 1.6837853433352568, "grad_norm": 0.93359375, "learning_rate": 0.00047262447039836484, "loss": 5.8169, "mean_token_accuracy": 0.19118765741586685, "num_tokens": 36968872.0, "step": 14590 }, { "entropy": 6.201617908477783, "epoch": 1.6843623773802654, "grad_norm": 0.8984375, "learning_rate": 0.00047260474052693963, "loss": 5.7863, "mean_token_accuracy": 0.1912344291806221, "num_tokens": 36982234.0, "step": 14595 }, { "entropy": 6.216722536087036, "epoch": 1.684939411425274, "grad_norm": 0.97265625, "learning_rate": 0.00047258500400917724, "loss": 5.7898, "mean_token_accuracy": 0.19123946577310563, "num_tokens": 36994407.0, "step": 14600 }, { "entropy": 6.290629053115845, "epoch": 1.6855164454702827, "grad_norm": 0.92578125, "learning_rate": 0.00047256526084574137, "loss": 5.831, "mean_token_accuracy": 0.1835671290755272, "num_tokens": 37006147.0, "step": 14605 }, { "entropy": 6.270266962051392, "epoch": 1.6860934795152915, "grad_norm": 0.97265625, "learning_rate": 0.00047254551103729597, "loss": 5.766, "mean_token_accuracy": 0.19732389599084854, "num_tokens": 37018206.0, "step": 14610 }, { "entropy": 6.258600664138794, "epoch": 1.6866705135603, "grad_norm": 0.91015625, "learning_rate": 0.0004725257545845055, "loss": 5.8646, "mean_token_accuracy": 0.18402135372161865, "num_tokens": 37030632.0, "step": 14615 }, { "entropy": 6.138081741333008, "epoch": 1.6872475476053088, "grad_norm": 0.90625, "learning_rate": 0.00047250599148803443, "loss": 5.6794, "mean_token_accuracy": 0.199339559674263, "num_tokens": 37041700.0, "step": 14620 }, { "entropy": 6.236639738082886, "epoch": 1.6878245816503172, "grad_norm": 0.8828125, "learning_rate": 0.00047248622174854746, "loss": 5.8093, "mean_token_accuracy": 0.1956299975514412, "num_tokens": 37054467.0, "step": 14625 }, { "entropy": 6.167034578323364, "epoch": 1.688401615695326, "grad_norm": 0.91796875, "learning_rate": 0.0004724664453667094, "loss": 5.7254, "mean_token_accuracy": 0.1935678869485855, "num_tokens": 37066596.0, "step": 14630 }, { "entropy": 6.227866506576538, "epoch": 1.6889786497403345, "grad_norm": 0.90625, "learning_rate": 0.0004724466623431857, "loss": 5.856, "mean_token_accuracy": 0.18633525371551513, "num_tokens": 37078812.0, "step": 14635 }, { "entropy": 6.278513717651367, "epoch": 1.6895556837853434, "grad_norm": 0.88671875, "learning_rate": 0.0004724268726786415, "loss": 5.8192, "mean_token_accuracy": 0.1916288822889328, "num_tokens": 37090916.0, "step": 14640 }, { "entropy": 6.161556243896484, "epoch": 1.690132717830352, "grad_norm": 0.90234375, "learning_rate": 0.0004724070763737424, "loss": 5.6629, "mean_token_accuracy": 0.20890249609947203, "num_tokens": 37104687.0, "step": 14645 }, { "entropy": 6.254812526702881, "epoch": 1.6907097518753607, "grad_norm": 0.9453125, "learning_rate": 0.0004723872734291545, "loss": 5.867, "mean_token_accuracy": 0.19037088453769685, "num_tokens": 37117763.0, "step": 14650 }, { "entropy": 6.245172071456909, "epoch": 1.6912867859203693, "grad_norm": 1.1875, "learning_rate": 0.00047236746384554364, "loss": 5.7302, "mean_token_accuracy": 0.19735212624073029, "num_tokens": 37130355.0, "step": 14655 }, { "entropy": 6.27752685546875, "epoch": 1.691863819965378, "grad_norm": 0.95703125, "learning_rate": 0.0004723476476235762, "loss": 5.7599, "mean_token_accuracy": 0.19666002839803695, "num_tokens": 37142116.0, "step": 14660 }, { "entropy": 6.163359785079956, "epoch": 1.6924408540103866, "grad_norm": 0.84375, "learning_rate": 0.0004723278247639186, "loss": 5.741, "mean_token_accuracy": 0.19864833503961563, "num_tokens": 37153841.0, "step": 14665 }, { "entropy": 6.198128128051758, "epoch": 1.6930178880553952, "grad_norm": 0.91796875, "learning_rate": 0.0004723079952672377, "loss": 5.7553, "mean_token_accuracy": 0.19592914432287217, "num_tokens": 37165119.0, "step": 14670 }, { "entropy": 6.284871768951416, "epoch": 1.693594922100404, "grad_norm": 0.99609375, "learning_rate": 0.00047228815913420035, "loss": 5.8468, "mean_token_accuracy": 0.19341864287853242, "num_tokens": 37178188.0, "step": 14675 }, { "entropy": 6.171255970001221, "epoch": 1.6941719561454125, "grad_norm": 0.9609375, "learning_rate": 0.0004722683163654738, "loss": 5.716, "mean_token_accuracy": 0.20382838249206542, "num_tokens": 37190211.0, "step": 14680 }, { "entropy": 6.188739013671875, "epoch": 1.6947489901904214, "grad_norm": 0.98046875, "learning_rate": 0.0004722484669617254, "loss": 5.7178, "mean_token_accuracy": 0.19711641371250152, "num_tokens": 37202408.0, "step": 14685 }, { "entropy": 6.259600734710693, "epoch": 1.6953260242354298, "grad_norm": 0.92578125, "learning_rate": 0.00047222861092362277, "loss": 5.8085, "mean_token_accuracy": 0.190089850127697, "num_tokens": 37214393.0, "step": 14690 }, { "entropy": 6.2397665023803714, "epoch": 1.6959030582804386, "grad_norm": 0.8984375, "learning_rate": 0.00047220874825183387, "loss": 5.7293, "mean_token_accuracy": 0.19584015309810637, "num_tokens": 37227212.0, "step": 14695 }, { "entropy": 6.1494776725769045, "epoch": 1.696480092325447, "grad_norm": 0.95703125, "learning_rate": 0.00047218887894702656, "loss": 5.7782, "mean_token_accuracy": 0.1920495629310608, "num_tokens": 37239742.0, "step": 14700 }, { "entropy": 6.268459510803223, "epoch": 1.697057126370456, "grad_norm": 0.89453125, "learning_rate": 0.0004721690030098693, "loss": 5.8354, "mean_token_accuracy": 0.1878738060593605, "num_tokens": 37254037.0, "step": 14705 }, { "entropy": 6.303516960144043, "epoch": 1.6976341604154646, "grad_norm": 0.921875, "learning_rate": 0.0004721491204410305, "loss": 5.8516, "mean_token_accuracy": 0.18976494073867797, "num_tokens": 37265221.0, "step": 14710 }, { "entropy": 6.296883869171142, "epoch": 1.6982111944604732, "grad_norm": 0.96484375, "learning_rate": 0.00047212923124117915, "loss": 5.8096, "mean_token_accuracy": 0.19008704870939255, "num_tokens": 37277992.0, "step": 14715 }, { "entropy": 6.190418481826782, "epoch": 1.6987882285054818, "grad_norm": 0.8984375, "learning_rate": 0.0004721093354109839, "loss": 5.7514, "mean_token_accuracy": 0.1978226602077484, "num_tokens": 37291608.0, "step": 14720 }, { "entropy": 6.243216705322266, "epoch": 1.6993652625504905, "grad_norm": 0.94140625, "learning_rate": 0.00047208943295111406, "loss": 5.805, "mean_token_accuracy": 0.18855539560317994, "num_tokens": 37303619.0, "step": 14725 }, { "entropy": 6.267891263961792, "epoch": 1.6999422965954991, "grad_norm": 0.8984375, "learning_rate": 0.00047206952386223905, "loss": 5.8398, "mean_token_accuracy": 0.1896793693304062, "num_tokens": 37316215.0, "step": 14730 }, { "entropy": 6.196926593780518, "epoch": 1.7005193306405078, "grad_norm": 0.92578125, "learning_rate": 0.0004720496081450285, "loss": 5.8059, "mean_token_accuracy": 0.19608232825994493, "num_tokens": 37328643.0, "step": 14735 }, { "entropy": 6.205492639541626, "epoch": 1.7010963646855164, "grad_norm": 0.984375, "learning_rate": 0.00047202968580015224, "loss": 5.7457, "mean_token_accuracy": 0.19729107320308686, "num_tokens": 37340792.0, "step": 14740 }, { "entropy": 6.328804779052734, "epoch": 1.701673398730525, "grad_norm": 0.95703125, "learning_rate": 0.00047200975682828045, "loss": 5.7846, "mean_token_accuracy": 0.18756407052278518, "num_tokens": 37353866.0, "step": 14745 }, { "entropy": 6.197791004180909, "epoch": 1.702250432775534, "grad_norm": 0.88671875, "learning_rate": 0.0004719898212300832, "loss": 5.7893, "mean_token_accuracy": 0.1926332965493202, "num_tokens": 37365403.0, "step": 14750 }, { "entropy": 6.213804912567139, "epoch": 1.7028274668205423, "grad_norm": 0.9296875, "learning_rate": 0.00047196987900623134, "loss": 5.7799, "mean_token_accuracy": 0.1956440106034279, "num_tokens": 37379487.0, "step": 14755 }, { "entropy": 6.288925409317017, "epoch": 1.7034045008655512, "grad_norm": 0.89453125, "learning_rate": 0.00047194993015739527, "loss": 5.7255, "mean_token_accuracy": 0.19549834579229355, "num_tokens": 37392497.0, "step": 14760 }, { "entropy": 6.151324367523193, "epoch": 1.7039815349105596, "grad_norm": 0.89453125, "learning_rate": 0.00047192997468424624, "loss": 5.6554, "mean_token_accuracy": 0.2037911593914032, "num_tokens": 37407126.0, "step": 14765 }, { "entropy": 6.107523441314697, "epoch": 1.7045585689555685, "grad_norm": 0.88671875, "learning_rate": 0.0004719100125874553, "loss": 5.7359, "mean_token_accuracy": 0.20345260202884674, "num_tokens": 37419768.0, "step": 14770 }, { "entropy": 6.216525936126709, "epoch": 1.7051356030005769, "grad_norm": 0.95703125, "learning_rate": 0.0004718900438676939, "loss": 5.7706, "mean_token_accuracy": 0.1966918244957924, "num_tokens": 37432512.0, "step": 14775 }, { "entropy": 6.280521440505981, "epoch": 1.7057126370455857, "grad_norm": 0.9921875, "learning_rate": 0.0004718700685256337, "loss": 5.8818, "mean_token_accuracy": 0.19116677343845367, "num_tokens": 37445006.0, "step": 14780 }, { "entropy": 6.279793214797974, "epoch": 1.7062896710905944, "grad_norm": 0.921875, "learning_rate": 0.0004718500865619465, "loss": 5.8623, "mean_token_accuracy": 0.18711167126893996, "num_tokens": 37457386.0, "step": 14785 }, { "entropy": 6.241596269607544, "epoch": 1.706866705135603, "grad_norm": 0.95703125, "learning_rate": 0.0004718300979773044, "loss": 5.7351, "mean_token_accuracy": 0.2007654130458832, "num_tokens": 37469773.0, "step": 14790 }, { "entropy": 6.293059015274048, "epoch": 1.7074437391806117, "grad_norm": 0.89453125, "learning_rate": 0.00047181010277237977, "loss": 5.7562, "mean_token_accuracy": 0.20070116072893143, "num_tokens": 37483301.0, "step": 14795 }, { "entropy": 6.245371294021607, "epoch": 1.7080207732256203, "grad_norm": 0.93359375, "learning_rate": 0.0004717901009478451, "loss": 5.821, "mean_token_accuracy": 0.19299632906913758, "num_tokens": 37495110.0, "step": 14800 }, { "entropy": 6.242628049850464, "epoch": 1.708597807270629, "grad_norm": 0.87109375, "learning_rate": 0.00047177009250437313, "loss": 5.7363, "mean_token_accuracy": 0.20338231921195984, "num_tokens": 37509281.0, "step": 14805 }, { "entropy": 6.195139837265015, "epoch": 1.7091748413156376, "grad_norm": 0.93359375, "learning_rate": 0.00047175007744263683, "loss": 5.7811, "mean_token_accuracy": 0.19870874732732774, "num_tokens": 37522690.0, "step": 14810 }, { "entropy": 6.209357118606567, "epoch": 1.7097518753606464, "grad_norm": 0.88671875, "learning_rate": 0.00047173005576330935, "loss": 5.7857, "mean_token_accuracy": 0.19668878614902496, "num_tokens": 37534737.0, "step": 14815 }, { "entropy": 6.265194892883301, "epoch": 1.7103289094056549, "grad_norm": 0.96484375, "learning_rate": 0.00047171002746706424, "loss": 5.8194, "mean_token_accuracy": 0.19461351931095122, "num_tokens": 37547486.0, "step": 14820 }, { "entropy": 6.374362993240356, "epoch": 1.7109059434506637, "grad_norm": 1.0, "learning_rate": 0.00047168999255457506, "loss": 5.8569, "mean_token_accuracy": 0.1927626445889473, "num_tokens": 37560083.0, "step": 14825 }, { "entropy": 6.199889993667602, "epoch": 1.7114829774956721, "grad_norm": 0.921875, "learning_rate": 0.00047166995102651565, "loss": 5.75, "mean_token_accuracy": 0.19805205762386321, "num_tokens": 37573260.0, "step": 14830 }, { "entropy": 6.248316097259521, "epoch": 1.712060011540681, "grad_norm": 0.953125, "learning_rate": 0.0004716499028835601, "loss": 5.8518, "mean_token_accuracy": 0.19746263325214386, "num_tokens": 37586403.0, "step": 14835 }, { "entropy": 6.225171422958374, "epoch": 1.7126370455856894, "grad_norm": 0.9453125, "learning_rate": 0.0004716298481263828, "loss": 5.7769, "mean_token_accuracy": 0.2004181981086731, "num_tokens": 37600771.0, "step": 14840 }, { "entropy": 6.297064113616943, "epoch": 1.7132140796306983, "grad_norm": 1.0, "learning_rate": 0.0004716097867556583, "loss": 5.7504, "mean_token_accuracy": 0.19541673809289933, "num_tokens": 37613623.0, "step": 14845 }, { "entropy": 6.210472059249878, "epoch": 1.713791113675707, "grad_norm": 1.0234375, "learning_rate": 0.00047158971877206114, "loss": 5.7217, "mean_token_accuracy": 0.19584263861179352, "num_tokens": 37624539.0, "step": 14850 }, { "entropy": 6.214003038406372, "epoch": 1.7143681477207156, "grad_norm": 0.984375, "learning_rate": 0.0004715696441762665, "loss": 5.8254, "mean_token_accuracy": 0.18597609251737596, "num_tokens": 37636556.0, "step": 14855 }, { "entropy": 6.274157619476318, "epoch": 1.7149451817657242, "grad_norm": 0.90625, "learning_rate": 0.00047154956296894954, "loss": 5.7861, "mean_token_accuracy": 0.1940763294696808, "num_tokens": 37648369.0, "step": 14860 }, { "entropy": 6.290304517745971, "epoch": 1.7155222158107328, "grad_norm": 0.99609375, "learning_rate": 0.0004715294751507856, "loss": 5.8648, "mean_token_accuracy": 0.18487513512372972, "num_tokens": 37661118.0, "step": 14865 }, { "entropy": 6.264235591888427, "epoch": 1.7160992498557415, "grad_norm": 0.921875, "learning_rate": 0.0004715093807224505, "loss": 5.7724, "mean_token_accuracy": 0.19355957508087157, "num_tokens": 37673915.0, "step": 14870 }, { "entropy": 6.220427656173706, "epoch": 1.71667628390075, "grad_norm": 0.796875, "learning_rate": 0.00047148927968462, "loss": 5.786, "mean_token_accuracy": 0.1952811747789383, "num_tokens": 37687359.0, "step": 14875 }, { "entropy": 6.213399982452392, "epoch": 1.7172533179457588, "grad_norm": 0.87109375, "learning_rate": 0.00047146917203797, "loss": 5.7825, "mean_token_accuracy": 0.19128514379262923, "num_tokens": 37700111.0, "step": 14880 }, { "entropy": 6.358771228790284, "epoch": 1.7178303519907674, "grad_norm": 0.921875, "learning_rate": 0.0004714490577831771, "loss": 5.932, "mean_token_accuracy": 0.18157403022050858, "num_tokens": 37712707.0, "step": 14885 }, { "entropy": 6.3575211524963375, "epoch": 1.7184073860357763, "grad_norm": 0.9296875, "learning_rate": 0.0004714289369209177, "loss": 5.8625, "mean_token_accuracy": 0.1848388597369194, "num_tokens": 37724242.0, "step": 14890 }, { "entropy": 6.273309421539307, "epoch": 1.7189844200807847, "grad_norm": 0.9453125, "learning_rate": 0.00047140880945186863, "loss": 5.7986, "mean_token_accuracy": 0.19703706353902817, "num_tokens": 37737451.0, "step": 14895 }, { "entropy": 6.281686735153198, "epoch": 1.7195614541257935, "grad_norm": 0.921875, "learning_rate": 0.00047138867537670676, "loss": 5.8386, "mean_token_accuracy": 0.18533087223768235, "num_tokens": 37749968.0, "step": 14900 }, { "entropy": 6.230262804031372, "epoch": 1.720138488170802, "grad_norm": 0.921875, "learning_rate": 0.00047136853469610933, "loss": 5.748, "mean_token_accuracy": 0.20007234215736389, "num_tokens": 37761961.0, "step": 14905 }, { "entropy": 6.231614208221435, "epoch": 1.7207155222158108, "grad_norm": 0.953125, "learning_rate": 0.00047134838741075383, "loss": 5.784, "mean_token_accuracy": 0.19633534252643586, "num_tokens": 37775089.0, "step": 14910 }, { "entropy": 6.256774854660034, "epoch": 1.7212925562608192, "grad_norm": 0.87890625, "learning_rate": 0.00047132823352131787, "loss": 5.8697, "mean_token_accuracy": 0.18893859386444092, "num_tokens": 37787072.0, "step": 14915 }, { "entropy": 6.238740253448486, "epoch": 1.721869590305828, "grad_norm": 0.96875, "learning_rate": 0.0004713080730284793, "loss": 5.7746, "mean_token_accuracy": 0.1915179818868637, "num_tokens": 37799162.0, "step": 14920 }, { "entropy": 6.227374458312989, "epoch": 1.7224466243508367, "grad_norm": 0.89453125, "learning_rate": 0.00047128790593291617, "loss": 5.8036, "mean_token_accuracy": 0.1961027055978775, "num_tokens": 37811560.0, "step": 14925 }, { "entropy": 6.2812048435211185, "epoch": 1.7230236583958454, "grad_norm": 0.9609375, "learning_rate": 0.00047126773223530677, "loss": 5.7289, "mean_token_accuracy": 0.1987067461013794, "num_tokens": 37823832.0, "step": 14930 }, { "entropy": 6.285789251327515, "epoch": 1.723600692440854, "grad_norm": 0.90234375, "learning_rate": 0.00047124755193632975, "loss": 5.8148, "mean_token_accuracy": 0.19008388817310334, "num_tokens": 37836718.0, "step": 14935 }, { "entropy": 6.151156234741211, "epoch": 1.7241777264858626, "grad_norm": 0.8671875, "learning_rate": 0.00047122736503666377, "loss": 5.7345, "mean_token_accuracy": 0.19504396617412567, "num_tokens": 37850001.0, "step": 14940 }, { "entropy": 6.159657716751099, "epoch": 1.7247547605308713, "grad_norm": 0.90625, "learning_rate": 0.0004712071715369878, "loss": 5.6801, "mean_token_accuracy": 0.2019476920366287, "num_tokens": 37862425.0, "step": 14945 }, { "entropy": 6.231092023849487, "epoch": 1.72533179457588, "grad_norm": 0.94140625, "learning_rate": 0.0004711869714379812, "loss": 5.7032, "mean_token_accuracy": 0.19919241815805436, "num_tokens": 37874429.0, "step": 14950 }, { "entropy": 6.18427791595459, "epoch": 1.7259088286208888, "grad_norm": 0.9765625, "learning_rate": 0.0004711667647403232, "loss": 5.7714, "mean_token_accuracy": 0.1992158979177475, "num_tokens": 37888317.0, "step": 14955 }, { "entropy": 6.216259098052978, "epoch": 1.7264858626658972, "grad_norm": 0.875, "learning_rate": 0.00047114655144469354, "loss": 5.7637, "mean_token_accuracy": 0.19563002586364747, "num_tokens": 37901101.0, "step": 14960 }, { "entropy": 6.275106811523438, "epoch": 1.727062896710906, "grad_norm": 1.1328125, "learning_rate": 0.00047112633155177203, "loss": 5.8041, "mean_token_accuracy": 0.19201582670211792, "num_tokens": 37914013.0, "step": 14965 }, { "entropy": 6.162282419204712, "epoch": 1.7276399307559145, "grad_norm": 0.88671875, "learning_rate": 0.0004711061050622388, "loss": 5.7177, "mean_token_accuracy": 0.20372351109981537, "num_tokens": 37926799.0, "step": 14970 }, { "entropy": 6.157208204269409, "epoch": 1.7282169648009233, "grad_norm": 0.97265625, "learning_rate": 0.00047108587197677404, "loss": 5.6915, "mean_token_accuracy": 0.20362317562103271, "num_tokens": 37939173.0, "step": 14975 }, { "entropy": 6.303074741363526, "epoch": 1.7287939988459318, "grad_norm": 0.90625, "learning_rate": 0.00047106563229605845, "loss": 5.8849, "mean_token_accuracy": 0.1878253310918808, "num_tokens": 37951030.0, "step": 14980 }, { "entropy": 6.284793043136597, "epoch": 1.7293710328909406, "grad_norm": 0.8828125, "learning_rate": 0.00047104538602077276, "loss": 5.8565, "mean_token_accuracy": 0.18910656869411469, "num_tokens": 37964005.0, "step": 14985 }, { "entropy": 6.2199421405792235, "epoch": 1.7299480669359493, "grad_norm": 0.8125, "learning_rate": 0.0004710251331515978, "loss": 5.8242, "mean_token_accuracy": 0.18915827125310897, "num_tokens": 37975851.0, "step": 14990 }, { "entropy": 6.276341295242309, "epoch": 1.730525100980958, "grad_norm": 0.98828125, "learning_rate": 0.00047100487368921485, "loss": 5.8071, "mean_token_accuracy": 0.1844043716788292, "num_tokens": 37988008.0, "step": 14995 }, { "entropy": 6.245677185058594, "epoch": 1.7311021350259665, "grad_norm": 0.96484375, "learning_rate": 0.0004709846076343055, "loss": 5.8426, "mean_token_accuracy": 0.19950297027826308, "num_tokens": 38000915.0, "step": 15000 }, { "epoch": 1.7311021350259665, "eval_entropy": 6.027668285749499, "eval_loss": 5.859091758728027, "eval_mean_token_accuracy": 0.198191051585094, "eval_num_tokens": 38000915.0, "eval_runtime": 17.5708, "eval_samples_per_second": 1601.292, "eval_steps_per_second": 200.162, "step": 15000 }, { "entropy": 6.1998467445373535, "epoch": 1.7316791690709752, "grad_norm": 0.921875, "learning_rate": 0.00047096433498755103, "loss": 5.7945, "mean_token_accuracy": 0.19635732620954513, "num_tokens": 38013109.0, "step": 15005 }, { "entropy": 6.225084114074707, "epoch": 1.7322562031159838, "grad_norm": 0.87109375, "learning_rate": 0.00047094405574963364, "loss": 5.7896, "mean_token_accuracy": 0.194148051738739, "num_tokens": 38025969.0, "step": 15010 }, { "entropy": 6.260206031799316, "epoch": 1.7328332371609925, "grad_norm": 0.953125, "learning_rate": 0.00047092376992123516, "loss": 5.7628, "mean_token_accuracy": 0.19929637908935546, "num_tokens": 38039104.0, "step": 15015 }, { "entropy": 6.228306007385254, "epoch": 1.733410271206001, "grad_norm": 0.88671875, "learning_rate": 0.00047090347750303803, "loss": 5.8441, "mean_token_accuracy": 0.1936349615454674, "num_tokens": 38053453.0, "step": 15020 }, { "entropy": 6.302817726135254, "epoch": 1.7339873052510097, "grad_norm": 0.9453125, "learning_rate": 0.0004708831784957247, "loss": 5.8718, "mean_token_accuracy": 0.18640264719724656, "num_tokens": 38064932.0, "step": 15025 }, { "entropy": 6.2317393779754635, "epoch": 1.7345643392960186, "grad_norm": 0.97265625, "learning_rate": 0.0004708628728999781, "loss": 5.7555, "mean_token_accuracy": 0.1919494777917862, "num_tokens": 38078904.0, "step": 15030 }, { "entropy": 6.292373132705689, "epoch": 1.735141373341027, "grad_norm": 0.859375, "learning_rate": 0.0004708425607164809, "loss": 5.8553, "mean_token_accuracy": 0.18859525322914122, "num_tokens": 38092605.0, "step": 15035 }, { "entropy": 6.221016931533813, "epoch": 1.7357184073860359, "grad_norm": 0.8671875, "learning_rate": 0.0004708222419459165, "loss": 5.7408, "mean_token_accuracy": 0.2024005964398384, "num_tokens": 38105953.0, "step": 15040 }, { "entropy": 6.250510501861572, "epoch": 1.7362954414310443, "grad_norm": 0.86328125, "learning_rate": 0.0004708019165889683, "loss": 5.9294, "mean_token_accuracy": 0.1820162132382393, "num_tokens": 38118485.0, "step": 15045 }, { "entropy": 6.306356477737427, "epoch": 1.7368724754760532, "grad_norm": 0.89453125, "learning_rate": 0.0004707815846463199, "loss": 5.8671, "mean_token_accuracy": 0.18989114910364152, "num_tokens": 38131220.0, "step": 15050 }, { "entropy": 6.206059408187866, "epoch": 1.7374495095210616, "grad_norm": 0.921875, "learning_rate": 0.0004707612461186552, "loss": 5.7749, "mean_token_accuracy": 0.1962239608168602, "num_tokens": 38143012.0, "step": 15055 }, { "entropy": 6.170250272750854, "epoch": 1.7380265435660704, "grad_norm": 1.1015625, "learning_rate": 0.00047074090100665805, "loss": 5.6875, "mean_token_accuracy": 0.20471351891756057, "num_tokens": 38155810.0, "step": 15060 }, { "entropy": 6.262243032455444, "epoch": 1.738603577611079, "grad_norm": 0.87890625, "learning_rate": 0.00047072054931101306, "loss": 5.8278, "mean_token_accuracy": 0.18701076209545137, "num_tokens": 38169183.0, "step": 15065 }, { "entropy": 6.228375577926636, "epoch": 1.7391806116560877, "grad_norm": 0.94140625, "learning_rate": 0.0004707001910324046, "loss": 5.8259, "mean_token_accuracy": 0.18984763771295549, "num_tokens": 38182098.0, "step": 15070 }, { "entropy": 6.3191286563873295, "epoch": 1.7397576457010964, "grad_norm": 0.8984375, "learning_rate": 0.00047067982617151737, "loss": 5.8301, "mean_token_accuracy": 0.18910346925258636, "num_tokens": 38194950.0, "step": 15075 }, { "entropy": 6.264245414733887, "epoch": 1.740334679746105, "grad_norm": 0.84375, "learning_rate": 0.0004706594547290365, "loss": 5.7909, "mean_token_accuracy": 0.19904323369264604, "num_tokens": 38207600.0, "step": 15080 }, { "entropy": 6.226841163635254, "epoch": 1.7409117137911136, "grad_norm": 1.0078125, "learning_rate": 0.00047063907670564695, "loss": 5.7119, "mean_token_accuracy": 0.2084239214658737, "num_tokens": 38219489.0, "step": 15085 }, { "entropy": 6.228709650039673, "epoch": 1.7414887478361223, "grad_norm": 0.82421875, "learning_rate": 0.0004706186921020342, "loss": 5.7838, "mean_token_accuracy": 0.19626915454864502, "num_tokens": 38233240.0, "step": 15090 }, { "entropy": 6.255122900009155, "epoch": 1.7420657818811311, "grad_norm": 0.94140625, "learning_rate": 0.00047059830091888407, "loss": 5.7584, "mean_token_accuracy": 0.19674482345581054, "num_tokens": 38245967.0, "step": 15095 }, { "entropy": 6.243045997619629, "epoch": 1.7426428159261396, "grad_norm": 0.88671875, "learning_rate": 0.0004705779031568821, "loss": 5.7768, "mean_token_accuracy": 0.18915130496025084, "num_tokens": 38258586.0, "step": 15100 }, { "entropy": 6.210542440414429, "epoch": 1.7432198499711484, "grad_norm": 0.94140625, "learning_rate": 0.00047055749881671463, "loss": 5.8401, "mean_token_accuracy": 0.19314245879650116, "num_tokens": 38270007.0, "step": 15105 }, { "entropy": 6.282091379165649, "epoch": 1.7437968840161568, "grad_norm": 0.90234375, "learning_rate": 0.0004705370878990677, "loss": 5.744, "mean_token_accuracy": 0.19978414922952653, "num_tokens": 38282580.0, "step": 15110 }, { "entropy": 6.2048032760620115, "epoch": 1.7443739180611657, "grad_norm": 1.0546875, "learning_rate": 0.00047051667040462806, "loss": 5.6943, "mean_token_accuracy": 0.20065076798200607, "num_tokens": 38295577.0, "step": 15115 }, { "entropy": 6.218212985992432, "epoch": 1.7449509521061741, "grad_norm": 0.96484375, "learning_rate": 0.00047049624633408224, "loss": 5.8663, "mean_token_accuracy": 0.18592003136873245, "num_tokens": 38307924.0, "step": 15120 }, { "entropy": 6.316382169723511, "epoch": 1.745527986151183, "grad_norm": 0.953125, "learning_rate": 0.00047047581568811724, "loss": 5.7687, "mean_token_accuracy": 0.1929919019341469, "num_tokens": 38321573.0, "step": 15125 }, { "entropy": 6.251517629623413, "epoch": 1.7461050201961916, "grad_norm": 0.8984375, "learning_rate": 0.00047045537846742043, "loss": 5.7673, "mean_token_accuracy": 0.19639647901058196, "num_tokens": 38333953.0, "step": 15130 }, { "entropy": 6.224976444244385, "epoch": 1.7466820542412003, "grad_norm": 0.98828125, "learning_rate": 0.000470434934672679, "loss": 5.8044, "mean_token_accuracy": 0.18785583078861237, "num_tokens": 38346028.0, "step": 15135 }, { "entropy": 6.290715026855469, "epoch": 1.747259088286209, "grad_norm": 1.0234375, "learning_rate": 0.00047041448430458054, "loss": 5.7369, "mean_token_accuracy": 0.19406510293483734, "num_tokens": 38358806.0, "step": 15140 }, { "entropy": 6.217677211761474, "epoch": 1.7478361223312175, "grad_norm": 0.93359375, "learning_rate": 0.00047039402736381305, "loss": 5.6909, "mean_token_accuracy": 0.19793135076761245, "num_tokens": 38370396.0, "step": 15145 }, { "entropy": 6.251976537704468, "epoch": 1.7484131563762262, "grad_norm": 0.80078125, "learning_rate": 0.0004703735638510645, "loss": 5.9143, "mean_token_accuracy": 0.19204719215631486, "num_tokens": 38383747.0, "step": 15150 }, { "entropy": 6.297483825683594, "epoch": 1.7489901904212348, "grad_norm": 0.88671875, "learning_rate": 0.0004703530937670232, "loss": 5.8218, "mean_token_accuracy": 0.18911525160074233, "num_tokens": 38396611.0, "step": 15155 }, { "entropy": 6.242986965179443, "epoch": 1.7495672244662435, "grad_norm": 0.93359375, "learning_rate": 0.0004703326171123776, "loss": 5.831, "mean_token_accuracy": 0.19013755023479462, "num_tokens": 38407627.0, "step": 15160 }, { "entropy": 6.129948234558105, "epoch": 1.750144258511252, "grad_norm": 0.9453125, "learning_rate": 0.0004703121338878164, "loss": 5.7308, "mean_token_accuracy": 0.1990264892578125, "num_tokens": 38420522.0, "step": 15165 }, { "entropy": 6.264822196960449, "epoch": 1.750721292556261, "grad_norm": 0.9765625, "learning_rate": 0.0004702916440940286, "loss": 5.8135, "mean_token_accuracy": 0.19269165843725206, "num_tokens": 38433968.0, "step": 15170 }, { "entropy": 6.245396900177002, "epoch": 1.7512983266012694, "grad_norm": 0.93359375, "learning_rate": 0.0004702711477317034, "loss": 5.8251, "mean_token_accuracy": 0.1896095395088196, "num_tokens": 38445819.0, "step": 15175 }, { "entropy": 6.314490032196045, "epoch": 1.7518753606462782, "grad_norm": 0.8984375, "learning_rate": 0.0004702506448015301, "loss": 5.8087, "mean_token_accuracy": 0.19271332770586014, "num_tokens": 38458823.0, "step": 15180 }, { "entropy": 6.226051235198975, "epoch": 1.7524523946912867, "grad_norm": 1.0078125, "learning_rate": 0.00047023013530419843, "loss": 5.7935, "mean_token_accuracy": 0.1927502915263176, "num_tokens": 38472553.0, "step": 15185 }, { "entropy": 6.272993087768555, "epoch": 1.7530294287362955, "grad_norm": 0.94921875, "learning_rate": 0.0004702096192403981, "loss": 5.764, "mean_token_accuracy": 0.19805403649806977, "num_tokens": 38484143.0, "step": 15190 }, { "entropy": 6.22825927734375, "epoch": 1.753606462781304, "grad_norm": 0.921875, "learning_rate": 0.0004701890966108192, "loss": 5.7884, "mean_token_accuracy": 0.18909399807453156, "num_tokens": 38496795.0, "step": 15195 }, { "entropy": 6.199388647079468, "epoch": 1.7541834968263128, "grad_norm": 0.90625, "learning_rate": 0.000470168567416152, "loss": 5.6885, "mean_token_accuracy": 0.20440283715724944, "num_tokens": 38509548.0, "step": 15200 }, { "entropy": 6.237175512313843, "epoch": 1.7547605308713214, "grad_norm": 0.92578125, "learning_rate": 0.0004701480316570869, "loss": 5.772, "mean_token_accuracy": 0.19347795844078064, "num_tokens": 38524011.0, "step": 15205 }, { "entropy": 6.263273048400879, "epoch": 1.75533756491633, "grad_norm": 0.890625, "learning_rate": 0.0004701274893343147, "loss": 5.7944, "mean_token_accuracy": 0.19191619306802749, "num_tokens": 38536913.0, "step": 15210 }, { "entropy": 6.1626180648803714, "epoch": 1.7559145989613387, "grad_norm": 0.96484375, "learning_rate": 0.00047010694044852643, "loss": 5.7562, "mean_token_accuracy": 0.1957879841327667, "num_tokens": 38548759.0, "step": 15215 }, { "entropy": 6.243113422393799, "epoch": 1.7564916330063474, "grad_norm": 0.90625, "learning_rate": 0.000470086385000413, "loss": 5.7656, "mean_token_accuracy": 0.19853851497173308, "num_tokens": 38562071.0, "step": 15220 }, { "entropy": 6.2278694152832035, "epoch": 1.757068667051356, "grad_norm": 0.9609375, "learning_rate": 0.0004700658229906661, "loss": 5.7928, "mean_token_accuracy": 0.18952999264001846, "num_tokens": 38573816.0, "step": 15225 }, { "entropy": 6.30017786026001, "epoch": 1.7576457010963646, "grad_norm": 0.88671875, "learning_rate": 0.00047004525441997694, "loss": 5.8938, "mean_token_accuracy": 0.1860449954867363, "num_tokens": 38586625.0, "step": 15230 }, { "entropy": 6.262595701217651, "epoch": 1.7582227351413735, "grad_norm": 0.9375, "learning_rate": 0.0004700246792890376, "loss": 5.8262, "mean_token_accuracy": 0.19520506411790847, "num_tokens": 38599391.0, "step": 15235 }, { "entropy": 6.215628337860108, "epoch": 1.758799769186382, "grad_norm": 0.98828125, "learning_rate": 0.0004700040975985401, "loss": 5.7351, "mean_token_accuracy": 0.20383531004190444, "num_tokens": 38610822.0, "step": 15240 }, { "entropy": 6.207050704956055, "epoch": 1.7593768032313908, "grad_norm": 0.98046875, "learning_rate": 0.00046998350934917654, "loss": 5.7472, "mean_token_accuracy": 0.19348314255475998, "num_tokens": 38623886.0, "step": 15245 }, { "entropy": 6.198969173431396, "epoch": 1.7599538372763992, "grad_norm": 0.8984375, "learning_rate": 0.00046996291454163956, "loss": 5.7118, "mean_token_accuracy": 0.20203371942043305, "num_tokens": 38636680.0, "step": 15250 }, { "entropy": 6.212174940109253, "epoch": 1.760530871321408, "grad_norm": 0.91796875, "learning_rate": 0.0004699423131766218, "loss": 5.7779, "mean_token_accuracy": 0.2040209636092186, "num_tokens": 38648841.0, "step": 15255 }, { "entropy": 6.171669149398804, "epoch": 1.7611079053664165, "grad_norm": 1.03125, "learning_rate": 0.0004699217052548161, "loss": 5.7539, "mean_token_accuracy": 0.2005374625325203, "num_tokens": 38660603.0, "step": 15260 }, { "entropy": 6.237819528579712, "epoch": 1.7616849394114253, "grad_norm": 0.9453125, "learning_rate": 0.00046990109077691577, "loss": 5.7766, "mean_token_accuracy": 0.19491585344076157, "num_tokens": 38674082.0, "step": 15265 }, { "entropy": 6.217108345031738, "epoch": 1.762261973456434, "grad_norm": 0.89453125, "learning_rate": 0.00046988046974361406, "loss": 5.7206, "mean_token_accuracy": 0.1978909581899643, "num_tokens": 38686274.0, "step": 15270 }, { "entropy": 6.280757188796997, "epoch": 1.7628390075014426, "grad_norm": 0.9921875, "learning_rate": 0.0004698598421556045, "loss": 5.7949, "mean_token_accuracy": 0.1977719321846962, "num_tokens": 38699260.0, "step": 15275 }, { "entropy": 6.249194383621216, "epoch": 1.7634160415464513, "grad_norm": 0.91796875, "learning_rate": 0.0004698392080135809, "loss": 5.7858, "mean_token_accuracy": 0.18940508514642715, "num_tokens": 38712054.0, "step": 15280 }, { "entropy": 6.188735914230347, "epoch": 1.76399307559146, "grad_norm": 0.9296875, "learning_rate": 0.0004698185673182374, "loss": 5.7338, "mean_token_accuracy": 0.20237622261047364, "num_tokens": 38724634.0, "step": 15285 }, { "entropy": 6.214454269409179, "epoch": 1.7645701096364685, "grad_norm": 0.89453125, "learning_rate": 0.00046979792007026817, "loss": 5.7185, "mean_token_accuracy": 0.19849735498428345, "num_tokens": 38737294.0, "step": 15290 }, { "entropy": 6.324564361572266, "epoch": 1.7651471436814772, "grad_norm": 0.890625, "learning_rate": 0.0004697772662703676, "loss": 5.8993, "mean_token_accuracy": 0.18402630239725112, "num_tokens": 38749578.0, "step": 15295 }, { "entropy": 6.2132916927337645, "epoch": 1.7657241777264858, "grad_norm": 0.91796875, "learning_rate": 0.00046975660591923047, "loss": 5.7805, "mean_token_accuracy": 0.1883055880665779, "num_tokens": 38762282.0, "step": 15300 }, { "entropy": 6.30076117515564, "epoch": 1.7663012117714945, "grad_norm": 0.8828125, "learning_rate": 0.0004697359390175516, "loss": 5.7676, "mean_token_accuracy": 0.1952459216117859, "num_tokens": 38773861.0, "step": 15305 }, { "entropy": 6.275486326217651, "epoch": 1.7668782458165033, "grad_norm": 0.94921875, "learning_rate": 0.00046971526556602625, "loss": 5.8716, "mean_token_accuracy": 0.18915152549743652, "num_tokens": 38786427.0, "step": 15310 }, { "entropy": 6.263535261154175, "epoch": 1.7674552798615117, "grad_norm": 0.8984375, "learning_rate": 0.0004696945855653495, "loss": 5.856, "mean_token_accuracy": 0.1845775306224823, "num_tokens": 38798496.0, "step": 15315 }, { "entropy": 6.221828889846802, "epoch": 1.7680323139065206, "grad_norm": 0.98046875, "learning_rate": 0.0004696738990162172, "loss": 5.8379, "mean_token_accuracy": 0.18447502553462983, "num_tokens": 38812069.0, "step": 15320 }, { "entropy": 6.265704488754272, "epoch": 1.768609347951529, "grad_norm": 0.921875, "learning_rate": 0.000469653205919325, "loss": 5.8781, "mean_token_accuracy": 0.19169940948486328, "num_tokens": 38824465.0, "step": 15325 }, { "entropy": 6.294767951965332, "epoch": 1.7691863819965379, "grad_norm": 0.9609375, "learning_rate": 0.00046963250627536884, "loss": 5.8166, "mean_token_accuracy": 0.1910833165049553, "num_tokens": 38837328.0, "step": 15330 }, { "entropy": 6.208098030090332, "epoch": 1.7697634160415463, "grad_norm": 0.96875, "learning_rate": 0.0004696118000850451, "loss": 5.7961, "mean_token_accuracy": 0.19421351402997972, "num_tokens": 38849238.0, "step": 15335 }, { "entropy": 6.192309045791626, "epoch": 1.7703404500865552, "grad_norm": 1.015625, "learning_rate": 0.00046959108734905003, "loss": 5.7641, "mean_token_accuracy": 0.1998672679066658, "num_tokens": 38861479.0, "step": 15340 }, { "entropy": 6.215923213958741, "epoch": 1.7709174841315638, "grad_norm": 1.171875, "learning_rate": 0.00046957036806808045, "loss": 5.7414, "mean_token_accuracy": 0.19977018386125564, "num_tokens": 38874342.0, "step": 15345 }, { "entropy": 6.221998167037964, "epoch": 1.7714945181765724, "grad_norm": 0.953125, "learning_rate": 0.0004695496422428332, "loss": 5.7593, "mean_token_accuracy": 0.19942527562379836, "num_tokens": 38886595.0, "step": 15350 }, { "entropy": 6.248060798645019, "epoch": 1.772071552221581, "grad_norm": 0.86328125, "learning_rate": 0.0004695289098740054, "loss": 5.7896, "mean_token_accuracy": 0.1939016655087471, "num_tokens": 38899338.0, "step": 15355 }, { "entropy": 6.270295238494873, "epoch": 1.7726485862665897, "grad_norm": 0.8984375, "learning_rate": 0.0004695081709622943, "loss": 5.7699, "mean_token_accuracy": 0.19445489048957826, "num_tokens": 38911765.0, "step": 15360 }, { "entropy": 6.197941398620605, "epoch": 1.7732256203115984, "grad_norm": 0.890625, "learning_rate": 0.00046948742550839744, "loss": 5.7401, "mean_token_accuracy": 0.2035606637597084, "num_tokens": 38924137.0, "step": 15365 }, { "entropy": 6.26130781173706, "epoch": 1.773802654356607, "grad_norm": 0.9609375, "learning_rate": 0.0004694666735130127, "loss": 5.7189, "mean_token_accuracy": 0.19911470264196396, "num_tokens": 38936401.0, "step": 15370 }, { "entropy": 6.235423421859741, "epoch": 1.7743796884016156, "grad_norm": 0.97265625, "learning_rate": 0.000469445914976838, "loss": 5.8188, "mean_token_accuracy": 0.19015101790428163, "num_tokens": 38948224.0, "step": 15375 }, { "entropy": 6.26864709854126, "epoch": 1.7749567224466243, "grad_norm": 0.9609375, "learning_rate": 0.0004694251499005715, "loss": 5.7659, "mean_token_accuracy": 0.19516605734825135, "num_tokens": 38959924.0, "step": 15380 }, { "entropy": 6.2285974502563475, "epoch": 1.7755337564916331, "grad_norm": 0.90234375, "learning_rate": 0.0004694043782849116, "loss": 5.8013, "mean_token_accuracy": 0.1916235476732254, "num_tokens": 38973018.0, "step": 15385 }, { "entropy": 6.259120655059815, "epoch": 1.7761107905366416, "grad_norm": 0.8984375, "learning_rate": 0.00046938360013055715, "loss": 5.8607, "mean_token_accuracy": 0.18584455102682113, "num_tokens": 38985634.0, "step": 15390 }, { "entropy": 6.284410619735718, "epoch": 1.7766878245816504, "grad_norm": 1.0, "learning_rate": 0.00046936281543820673, "loss": 5.8258, "mean_token_accuracy": 0.19096557646989823, "num_tokens": 38999446.0, "step": 15395 }, { "entropy": 6.295167303085327, "epoch": 1.7772648586266588, "grad_norm": 0.9140625, "learning_rate": 0.00046934202420855967, "loss": 5.8469, "mean_token_accuracy": 0.19223827719688416, "num_tokens": 39012974.0, "step": 15400 }, { "entropy": 6.223930025100708, "epoch": 1.7778418926716677, "grad_norm": 0.953125, "learning_rate": 0.00046932122644231507, "loss": 5.7461, "mean_token_accuracy": 0.1959339052438736, "num_tokens": 39025316.0, "step": 15405 }, { "entropy": 6.226829528808594, "epoch": 1.7784189267166761, "grad_norm": 0.9609375, "learning_rate": 0.00046930042214017256, "loss": 5.6983, "mean_token_accuracy": 0.20610239058732988, "num_tokens": 39038174.0, "step": 15410 }, { "entropy": 6.30842137336731, "epoch": 1.778995960761685, "grad_norm": 0.91796875, "learning_rate": 0.0004692796113028319, "loss": 5.8718, "mean_token_accuracy": 0.18104784041643143, "num_tokens": 39051943.0, "step": 15415 }, { "entropy": 6.2169633388519285, "epoch": 1.7795729948066936, "grad_norm": 0.96875, "learning_rate": 0.000469258793930993, "loss": 5.7505, "mean_token_accuracy": 0.19396419674158097, "num_tokens": 39064765.0, "step": 15420 }, { "entropy": 6.24879035949707, "epoch": 1.7801500288517023, "grad_norm": 0.95703125, "learning_rate": 0.00046923797002535605, "loss": 5.8594, "mean_token_accuracy": 0.18545962870121002, "num_tokens": 39077326.0, "step": 15425 }, { "entropy": 6.255417680740356, "epoch": 1.780727062896711, "grad_norm": 0.859375, "learning_rate": 0.0004692171395866214, "loss": 5.749, "mean_token_accuracy": 0.19588208943605423, "num_tokens": 39090049.0, "step": 15430 }, { "entropy": 6.237002658843994, "epoch": 1.7813040969417195, "grad_norm": 1.0, "learning_rate": 0.00046919630261548986, "loss": 5.7838, "mean_token_accuracy": 0.1968626856803894, "num_tokens": 39102805.0, "step": 15435 }, { "entropy": 6.096398401260376, "epoch": 1.7818811309867282, "grad_norm": 0.9140625, "learning_rate": 0.00046917545911266207, "loss": 5.688, "mean_token_accuracy": 0.2085106134414673, "num_tokens": 39115966.0, "step": 15440 }, { "entropy": 6.211426210403443, "epoch": 1.7824581650317368, "grad_norm": 0.91015625, "learning_rate": 0.00046915460907883923, "loss": 5.8036, "mean_token_accuracy": 0.1936090975999832, "num_tokens": 39128417.0, "step": 15445 }, { "entropy": 6.230034494400025, "epoch": 1.7830351990767457, "grad_norm": 0.90625, "learning_rate": 0.00046913375251472246, "loss": 5.7544, "mean_token_accuracy": 0.19787432253360748, "num_tokens": 39142338.0, "step": 15450 }, { "entropy": 6.252493810653687, "epoch": 1.783612233121754, "grad_norm": 0.94140625, "learning_rate": 0.00046911288942101345, "loss": 5.8178, "mean_token_accuracy": 0.19384605288505555, "num_tokens": 39155055.0, "step": 15455 }, { "entropy": 6.257091951370239, "epoch": 1.784189267166763, "grad_norm": 1.015625, "learning_rate": 0.0004690920197984138, "loss": 5.7942, "mean_token_accuracy": 0.19681064337491988, "num_tokens": 39167170.0, "step": 15460 }, { "entropy": 6.360779237747193, "epoch": 1.7847663012117714, "grad_norm": 0.9296875, "learning_rate": 0.0004690711436476254, "loss": 5.9037, "mean_token_accuracy": 0.18777545541524887, "num_tokens": 39181389.0, "step": 15465 }, { "entropy": 6.374752235412598, "epoch": 1.7853433352567802, "grad_norm": 1.03125, "learning_rate": 0.00046905026096935056, "loss": 5.8728, "mean_token_accuracy": 0.18601856380701065, "num_tokens": 39194728.0, "step": 15470 }, { "entropy": 6.148594760894776, "epoch": 1.7859203693017887, "grad_norm": 0.89453125, "learning_rate": 0.0004690293717642916, "loss": 5.7134, "mean_token_accuracy": 0.20158033221960067, "num_tokens": 39207945.0, "step": 15475 }, { "entropy": 6.253357934951782, "epoch": 1.7864974033467975, "grad_norm": 0.91015625, "learning_rate": 0.000469008476033151, "loss": 5.8538, "mean_token_accuracy": 0.1929816037416458, "num_tokens": 39221314.0, "step": 15480 }, { "entropy": 6.276904487609864, "epoch": 1.7870744373918062, "grad_norm": 0.91015625, "learning_rate": 0.00046898757377663176, "loss": 5.8024, "mean_token_accuracy": 0.1935829922556877, "num_tokens": 39233910.0, "step": 15485 }, { "entropy": 6.246221685409546, "epoch": 1.7876514714368148, "grad_norm": 0.9765625, "learning_rate": 0.00046896666499543683, "loss": 5.8003, "mean_token_accuracy": 0.19562088698148727, "num_tokens": 39246027.0, "step": 15490 }, { "entropy": 6.209698486328125, "epoch": 1.7882285054818234, "grad_norm": 0.9296875, "learning_rate": 0.00046894574969026946, "loss": 5.7485, "mean_token_accuracy": 0.1964795932173729, "num_tokens": 39258456.0, "step": 15495 }, { "entropy": 6.284151840209961, "epoch": 1.788805539526832, "grad_norm": 0.99609375, "learning_rate": 0.00046892482786183313, "loss": 5.8465, "mean_token_accuracy": 0.1841995060443878, "num_tokens": 39270624.0, "step": 15500 }, { "entropy": 6.2593241214752195, "epoch": 1.7893825735718407, "grad_norm": 0.92578125, "learning_rate": 0.00046890389951083155, "loss": 5.7329, "mean_token_accuracy": 0.19568620026111602, "num_tokens": 39283350.0, "step": 15505 }, { "entropy": 6.287080955505371, "epoch": 1.7899596076168494, "grad_norm": 0.921875, "learning_rate": 0.00046888296463796857, "loss": 5.8432, "mean_token_accuracy": 0.19254444241523744, "num_tokens": 39296321.0, "step": 15510 }, { "entropy": 6.232756280899048, "epoch": 1.790536641661858, "grad_norm": 0.8359375, "learning_rate": 0.0004688620232439485, "loss": 5.7017, "mean_token_accuracy": 0.20558897256851197, "num_tokens": 39309223.0, "step": 15515 }, { "entropy": 6.22496485710144, "epoch": 1.7911136757068666, "grad_norm": 0.83203125, "learning_rate": 0.00046884107532947547, "loss": 5.6886, "mean_token_accuracy": 0.19321909546852112, "num_tokens": 39322348.0, "step": 15520 }, { "entropy": 6.227154541015625, "epoch": 1.7916907097518755, "grad_norm": 0.8515625, "learning_rate": 0.00046882012089525415, "loss": 5.786, "mean_token_accuracy": 0.18817334324121476, "num_tokens": 39335375.0, "step": 15525 }, { "entropy": 6.265221357345581, "epoch": 1.792267743796884, "grad_norm": 0.89453125, "learning_rate": 0.0004687991599419895, "loss": 5.8031, "mean_token_accuracy": 0.19223275780677795, "num_tokens": 39347865.0, "step": 15530 }, { "entropy": 6.249596834182739, "epoch": 1.7928447778418928, "grad_norm": 0.89453125, "learning_rate": 0.00046877819247038624, "loss": 5.8487, "mean_token_accuracy": 0.19005428701639177, "num_tokens": 39361402.0, "step": 15535 }, { "entropy": 6.221106147766113, "epoch": 1.7934218118869012, "grad_norm": 0.91015625, "learning_rate": 0.0004687572184811497, "loss": 5.7079, "mean_token_accuracy": 0.19553205221891404, "num_tokens": 39372839.0, "step": 15540 }, { "entropy": 6.2046037197113035, "epoch": 1.79399884593191, "grad_norm": 1.0078125, "learning_rate": 0.00046873623797498545, "loss": 5.7399, "mean_token_accuracy": 0.19506264925003053, "num_tokens": 39385189.0, "step": 15545 }, { "entropy": 6.323671007156372, "epoch": 1.7945758799769185, "grad_norm": 0.8515625, "learning_rate": 0.000468715250952599, "loss": 5.8881, "mean_token_accuracy": 0.18917421698570253, "num_tokens": 39397871.0, "step": 15550 }, { "entropy": 6.302221441268921, "epoch": 1.7951529140219273, "grad_norm": 0.83984375, "learning_rate": 0.00046869425741469635, "loss": 5.8359, "mean_token_accuracy": 0.18804299235343933, "num_tokens": 39411222.0, "step": 15555 }, { "entropy": 6.259333372116089, "epoch": 1.795729948066936, "grad_norm": 0.90234375, "learning_rate": 0.0004686732573619835, "loss": 5.8319, "mean_token_accuracy": 0.19109850972890854, "num_tokens": 39423614.0, "step": 15560 }, { "entropy": 6.249478197097778, "epoch": 1.7963069821119446, "grad_norm": 0.859375, "learning_rate": 0.0004686522507951669, "loss": 5.7548, "mean_token_accuracy": 0.19278013855218887, "num_tokens": 39436299.0, "step": 15565 }, { "entropy": 6.260821914672851, "epoch": 1.7968840161569533, "grad_norm": 0.9453125, "learning_rate": 0.0004686312377149531, "loss": 5.8271, "mean_token_accuracy": 0.18958440274000168, "num_tokens": 39448994.0, "step": 15570 }, { "entropy": 6.273134469985962, "epoch": 1.797461050201962, "grad_norm": 0.9375, "learning_rate": 0.00046861021812204874, "loss": 5.8248, "mean_token_accuracy": 0.18644514679908752, "num_tokens": 39462387.0, "step": 15575 }, { "entropy": 6.307193422317505, "epoch": 1.7980380842469705, "grad_norm": 0.85546875, "learning_rate": 0.00046858919201716085, "loss": 5.8047, "mean_token_accuracy": 0.1928827852010727, "num_tokens": 39475082.0, "step": 15580 }, { "entropy": 6.258175945281982, "epoch": 1.7986151182919792, "grad_norm": 0.98046875, "learning_rate": 0.0004685681594009966, "loss": 5.7914, "mean_token_accuracy": 0.19656720608472825, "num_tokens": 39487272.0, "step": 15585 }, { "entropy": 6.236111068725586, "epoch": 1.799192152336988, "grad_norm": 0.8828125, "learning_rate": 0.00046854712027426357, "loss": 5.7724, "mean_token_accuracy": 0.19646389186382293, "num_tokens": 39502499.0, "step": 15590 }, { "entropy": 6.346733856201172, "epoch": 1.7997691863819965, "grad_norm": 0.9140625, "learning_rate": 0.00046852607463766923, "loss": 5.8429, "mean_token_accuracy": 0.1886493071913719, "num_tokens": 39514652.0, "step": 15595 }, { "entropy": 6.34684190750122, "epoch": 1.8003462204270053, "grad_norm": 0.93359375, "learning_rate": 0.0004685050224919215, "loss": 5.8995, "mean_token_accuracy": 0.1818003237247467, "num_tokens": 39527859.0, "step": 15600 }, { "entropy": 6.262502241134643, "epoch": 1.8009232544720137, "grad_norm": 0.8984375, "learning_rate": 0.00046848396383772844, "loss": 5.7547, "mean_token_accuracy": 0.18986964374780654, "num_tokens": 39541099.0, "step": 15605 }, { "entropy": 6.20468487739563, "epoch": 1.8015002885170226, "grad_norm": 0.96484375, "learning_rate": 0.0004684628986757984, "loss": 5.7604, "mean_token_accuracy": 0.19289609640836716, "num_tokens": 39553233.0, "step": 15610 }, { "entropy": 6.250316047668457, "epoch": 1.802077322562031, "grad_norm": 0.93359375, "learning_rate": 0.0004684418270068398, "loss": 5.7442, "mean_token_accuracy": 0.19790587574243546, "num_tokens": 39565379.0, "step": 15615 }, { "entropy": 6.201472282409668, "epoch": 1.8026543566070399, "grad_norm": 0.93359375, "learning_rate": 0.0004684207488315615, "loss": 5.7217, "mean_token_accuracy": 0.2005346715450287, "num_tokens": 39577509.0, "step": 15620 }, { "entropy": 6.294105386734008, "epoch": 1.8032313906520485, "grad_norm": 0.8984375, "learning_rate": 0.0004683996641506724, "loss": 5.8205, "mean_token_accuracy": 0.19148968160152435, "num_tokens": 39589960.0, "step": 15625 }, { "entropy": 6.219392347335815, "epoch": 1.8038084246970572, "grad_norm": 0.8828125, "learning_rate": 0.00046837857296488163, "loss": 5.7143, "mean_token_accuracy": 0.20224729776382447, "num_tokens": 39602231.0, "step": 15630 }, { "entropy": 6.256589317321778, "epoch": 1.8043854587420658, "grad_norm": 0.984375, "learning_rate": 0.00046835747527489857, "loss": 5.8016, "mean_token_accuracy": 0.20258677154779434, "num_tokens": 39615756.0, "step": 15635 }, { "entropy": 6.315097427368164, "epoch": 1.8049624927870744, "grad_norm": 1.015625, "learning_rate": 0.000468336371081433, "loss": 5.8292, "mean_token_accuracy": 0.18631367534399032, "num_tokens": 39627810.0, "step": 15640 }, { "entropy": 6.2539315700531, "epoch": 1.805539526832083, "grad_norm": 0.921875, "learning_rate": 0.00046831526038519444, "loss": 5.7982, "mean_token_accuracy": 0.19546411484479903, "num_tokens": 39640930.0, "step": 15645 }, { "entropy": 6.206079769134521, "epoch": 1.8061165608770917, "grad_norm": 0.890625, "learning_rate": 0.0004682941431868933, "loss": 5.7518, "mean_token_accuracy": 0.19276881515979766, "num_tokens": 39652146.0, "step": 15650 }, { "entropy": 6.151435089111328, "epoch": 1.8066935949221004, "grad_norm": 0.91015625, "learning_rate": 0.00046827301948723963, "loss": 5.6683, "mean_token_accuracy": 0.20766518861055375, "num_tokens": 39665156.0, "step": 15655 }, { "entropy": 6.266790294647217, "epoch": 1.807270628967109, "grad_norm": 0.91015625, "learning_rate": 0.00046825188928694393, "loss": 5.7792, "mean_token_accuracy": 0.19093467444181442, "num_tokens": 39677346.0, "step": 15660 }, { "entropy": 6.283413410186768, "epoch": 1.8078476630121179, "grad_norm": 0.93359375, "learning_rate": 0.0004682307525867169, "loss": 5.746, "mean_token_accuracy": 0.2032680407166481, "num_tokens": 39690613.0, "step": 15665 }, { "entropy": 6.268688201904297, "epoch": 1.8084246970571263, "grad_norm": 0.890625, "learning_rate": 0.0004682096093872695, "loss": 5.7572, "mean_token_accuracy": 0.1922956645488739, "num_tokens": 39703111.0, "step": 15670 }, { "entropy": 6.247060823440552, "epoch": 1.8090017311021351, "grad_norm": 0.94140625, "learning_rate": 0.00046818845968931284, "loss": 5.7806, "mean_token_accuracy": 0.19447221159934996, "num_tokens": 39715441.0, "step": 15675 }, { "entropy": 6.275709629058838, "epoch": 1.8095787651471436, "grad_norm": 0.90234375, "learning_rate": 0.00046816730349355843, "loss": 5.7405, "mean_token_accuracy": 0.19862063527107238, "num_tokens": 39728437.0, "step": 15680 }, { "entropy": 6.24822850227356, "epoch": 1.8101557991921524, "grad_norm": 0.8984375, "learning_rate": 0.00046814614080071756, "loss": 5.7679, "mean_token_accuracy": 0.1967908799648285, "num_tokens": 39740324.0, "step": 15685 }, { "entropy": 6.227537345886231, "epoch": 1.8107328332371608, "grad_norm": 0.95703125, "learning_rate": 0.00046812497161150224, "loss": 5.7457, "mean_token_accuracy": 0.1954813316464424, "num_tokens": 39752158.0, "step": 15690 }, { "entropy": 6.251756763458252, "epoch": 1.8113098672821697, "grad_norm": 0.85546875, "learning_rate": 0.00046810379592662445, "loss": 5.8004, "mean_token_accuracy": 0.1957491382956505, "num_tokens": 39766296.0, "step": 15695 }, { "entropy": 6.246879053115845, "epoch": 1.8118869013271783, "grad_norm": 0.8125, "learning_rate": 0.00046808261374679637, "loss": 5.8144, "mean_token_accuracy": 0.1933879092335701, "num_tokens": 39779690.0, "step": 15700 }, { "entropy": 6.275369453430176, "epoch": 1.812463935372187, "grad_norm": 0.91015625, "learning_rate": 0.0004680614250727305, "loss": 5.7709, "mean_token_accuracy": 0.19698434323072433, "num_tokens": 39790617.0, "step": 15705 }, { "entropy": 6.237313270568848, "epoch": 1.8130409694171956, "grad_norm": 0.90625, "learning_rate": 0.0004680402299051395, "loss": 5.7519, "mean_token_accuracy": 0.19757142066955566, "num_tokens": 39802994.0, "step": 15710 }, { "entropy": 6.248507452011109, "epoch": 1.8136180034622043, "grad_norm": 0.9296875, "learning_rate": 0.0004680190282447363, "loss": 5.7598, "mean_token_accuracy": 0.1952964574098587, "num_tokens": 39815618.0, "step": 15715 }, { "entropy": 6.251852369308471, "epoch": 1.814195037507213, "grad_norm": 0.90234375, "learning_rate": 0.0004679978200922339, "loss": 5.7412, "mean_token_accuracy": 0.20035985261201858, "num_tokens": 39827283.0, "step": 15720 }, { "entropy": 6.2605846405029295, "epoch": 1.8147720715522215, "grad_norm": 0.94921875, "learning_rate": 0.0004679766054483457, "loss": 5.725, "mean_token_accuracy": 0.20251115262508393, "num_tokens": 39840116.0, "step": 15725 }, { "entropy": 6.193558406829834, "epoch": 1.8153491055972304, "grad_norm": 0.94921875, "learning_rate": 0.0004679553843137852, "loss": 5.7173, "mean_token_accuracy": 0.20594813525676728, "num_tokens": 39851770.0, "step": 15730 }, { "entropy": 6.180267715454102, "epoch": 1.8159261396422388, "grad_norm": 0.98828125, "learning_rate": 0.00046793415668926625, "loss": 5.6866, "mean_token_accuracy": 0.19606250077486037, "num_tokens": 39863803.0, "step": 15735 }, { "entropy": 6.238861560821533, "epoch": 1.8165031736872477, "grad_norm": 1.0078125, "learning_rate": 0.0004679129225755028, "loss": 5.7202, "mean_token_accuracy": 0.20054381489753723, "num_tokens": 39875713.0, "step": 15740 }, { "entropy": 6.170565223693847, "epoch": 1.817080207732256, "grad_norm": 0.9296875, "learning_rate": 0.000467891681973209, "loss": 5.6841, "mean_token_accuracy": 0.20006590634584426, "num_tokens": 39888670.0, "step": 15745 }, { "entropy": 6.164975118637085, "epoch": 1.817657241777265, "grad_norm": 0.95703125, "learning_rate": 0.00046787043488309926, "loss": 5.7258, "mean_token_accuracy": 0.20983980894088744, "num_tokens": 39900845.0, "step": 15750 }, { "entropy": 6.346622896194458, "epoch": 1.8182342758222734, "grad_norm": 0.96484375, "learning_rate": 0.0004678491813058882, "loss": 5.8179, "mean_token_accuracy": 0.18947956562042237, "num_tokens": 39912268.0, "step": 15755 }, { "entropy": 6.255692625045777, "epoch": 1.8188113098672822, "grad_norm": 0.875, "learning_rate": 0.0004678279212422908, "loss": 5.7643, "mean_token_accuracy": 0.19456629902124406, "num_tokens": 39924213.0, "step": 15760 }, { "entropy": 6.241471672058106, "epoch": 1.8193883439122909, "grad_norm": 0.9296875, "learning_rate": 0.0004678066546930221, "loss": 5.7905, "mean_token_accuracy": 0.19173450469970704, "num_tokens": 39937069.0, "step": 15765 }, { "entropy": 6.219423055648804, "epoch": 1.8199653779572995, "grad_norm": 0.96484375, "learning_rate": 0.00046778538165879725, "loss": 5.7404, "mean_token_accuracy": 0.19059522300958634, "num_tokens": 39948988.0, "step": 15770 }, { "entropy": 6.256737899780274, "epoch": 1.8205424120023082, "grad_norm": 0.890625, "learning_rate": 0.00046776410214033185, "loss": 5.8356, "mean_token_accuracy": 0.19304797798395157, "num_tokens": 39962177.0, "step": 15775 }, { "entropy": 6.300885152816773, "epoch": 1.8211194460473168, "grad_norm": 0.97265625, "learning_rate": 0.0004677428161383417, "loss": 5.7657, "mean_token_accuracy": 0.19903772473335266, "num_tokens": 39975329.0, "step": 15780 }, { "entropy": 6.271979188919067, "epoch": 1.8216964800923254, "grad_norm": 1.0390625, "learning_rate": 0.0004677215236535426, "loss": 5.7524, "mean_token_accuracy": 0.19273924678564072, "num_tokens": 39987923.0, "step": 15785 }, { "entropy": 6.2564263343811035, "epoch": 1.822273514137334, "grad_norm": 0.953125, "learning_rate": 0.0004677002246866508, "loss": 5.8236, "mean_token_accuracy": 0.19519684463739395, "num_tokens": 40001596.0, "step": 15790 }, { "entropy": 6.253862953186035, "epoch": 1.8228505481823427, "grad_norm": 0.9296875, "learning_rate": 0.00046767891923838264, "loss": 5.7486, "mean_token_accuracy": 0.19953580796718598, "num_tokens": 40014207.0, "step": 15795 }, { "entropy": 6.338621330261231, "epoch": 1.8234275822273514, "grad_norm": 0.859375, "learning_rate": 0.0004676576073094548, "loss": 5.7948, "mean_token_accuracy": 0.19075928777456283, "num_tokens": 40027931.0, "step": 15800 }, { "entropy": 6.266003274917603, "epoch": 1.8240046162723602, "grad_norm": 0.94140625, "learning_rate": 0.00046763628890058396, "loss": 5.8163, "mean_token_accuracy": 0.19684889763593674, "num_tokens": 40040463.0, "step": 15805 }, { "entropy": 6.170436954498291, "epoch": 1.8245816503173686, "grad_norm": 0.82421875, "learning_rate": 0.00046761496401248734, "loss": 5.7001, "mean_token_accuracy": 0.20084349513053895, "num_tokens": 40053085.0, "step": 15810 }, { "entropy": 6.3198305606842045, "epoch": 1.8251586843623775, "grad_norm": 0.89453125, "learning_rate": 0.000467593632645882, "loss": 5.8855, "mean_token_accuracy": 0.19249660074710845, "num_tokens": 40065771.0, "step": 15815 }, { "entropy": 6.291195583343506, "epoch": 1.825735718407386, "grad_norm": 0.890625, "learning_rate": 0.0004675722948014855, "loss": 5.7948, "mean_token_accuracy": 0.19111389964818953, "num_tokens": 40078939.0, "step": 15820 }, { "entropy": 6.223949861526489, "epoch": 1.8263127524523948, "grad_norm": 0.91015625, "learning_rate": 0.00046755095048001556, "loss": 5.6987, "mean_token_accuracy": 0.20104024261236192, "num_tokens": 40091565.0, "step": 15825 }, { "entropy": 6.170585823059082, "epoch": 1.8268897864974032, "grad_norm": 1.015625, "learning_rate": 0.0004675295996821899, "loss": 5.7365, "mean_token_accuracy": 0.19630666822195053, "num_tokens": 40103619.0, "step": 15830 }, { "entropy": 6.311802721023559, "epoch": 1.827466820542412, "grad_norm": 0.9296875, "learning_rate": 0.000467508242408727, "loss": 5.8102, "mean_token_accuracy": 0.18986732810735701, "num_tokens": 40116370.0, "step": 15835 }, { "entropy": 6.246032047271728, "epoch": 1.8280438545874207, "grad_norm": 1.0078125, "learning_rate": 0.0004674868786603448, "loss": 5.6837, "mean_token_accuracy": 0.19883956760168076, "num_tokens": 40129015.0, "step": 15840 }, { "entropy": 6.241017913818359, "epoch": 1.8286208886324293, "grad_norm": 1.0, "learning_rate": 0.0004674655084377622, "loss": 5.717, "mean_token_accuracy": 0.19837751537561416, "num_tokens": 40141437.0, "step": 15845 }, { "entropy": 6.206828451156616, "epoch": 1.829197922677438, "grad_norm": 0.92578125, "learning_rate": 0.0004674441317416978, "loss": 5.7643, "mean_token_accuracy": 0.19043355137109758, "num_tokens": 40154516.0, "step": 15850 }, { "entropy": 6.179724311828613, "epoch": 1.8297749567224466, "grad_norm": 0.94921875, "learning_rate": 0.00046742274857287057, "loss": 5.6333, "mean_token_accuracy": 0.20223019868135453, "num_tokens": 40166598.0, "step": 15855 }, { "entropy": 6.229026031494141, "epoch": 1.8303519907674553, "grad_norm": 1.0546875, "learning_rate": 0.0004674013589319998, "loss": 5.7543, "mean_token_accuracy": 0.19870882034301757, "num_tokens": 40178905.0, "step": 15860 }, { "entropy": 6.321389770507812, "epoch": 1.830929024812464, "grad_norm": 0.95703125, "learning_rate": 0.0004673799628198049, "loss": 5.8371, "mean_token_accuracy": 0.19208986014127732, "num_tokens": 40191678.0, "step": 15865 }, { "entropy": 6.245724630355835, "epoch": 1.8315060588574728, "grad_norm": 0.9453125, "learning_rate": 0.00046735856023700546, "loss": 5.7539, "mean_token_accuracy": 0.19165848046541215, "num_tokens": 40204680.0, "step": 15870 }, { "entropy": 6.180008220672607, "epoch": 1.8320830929024812, "grad_norm": 1.0234375, "learning_rate": 0.0004673371511843215, "loss": 5.8064, "mean_token_accuracy": 0.20063277781009675, "num_tokens": 40217026.0, "step": 15875 }, { "entropy": 6.242175817489624, "epoch": 1.83266012694749, "grad_norm": 0.88671875, "learning_rate": 0.0004673157356624729, "loss": 5.7377, "mean_token_accuracy": 0.19302880316972731, "num_tokens": 40228950.0, "step": 15880 }, { "entropy": 6.2919378757476805, "epoch": 1.8332371609924984, "grad_norm": 0.91015625, "learning_rate": 0.0004672943136721801, "loss": 5.8163, "mean_token_accuracy": 0.1909077376127243, "num_tokens": 40241294.0, "step": 15885 }, { "entropy": 6.323341321945191, "epoch": 1.8338141950375073, "grad_norm": 0.890625, "learning_rate": 0.0004672728852141636, "loss": 5.8536, "mean_token_accuracy": 0.18982188850641252, "num_tokens": 40253331.0, "step": 15890 }, { "entropy": 6.28448715209961, "epoch": 1.8343912290825157, "grad_norm": 0.91015625, "learning_rate": 0.00046725145028914404, "loss": 5.8079, "mean_token_accuracy": 0.19301552474498748, "num_tokens": 40266059.0, "step": 15895 }, { "entropy": 6.252271842956543, "epoch": 1.8349682631275246, "grad_norm": 0.9140625, "learning_rate": 0.0004672300088978425, "loss": 5.7363, "mean_token_accuracy": 0.2031920611858368, "num_tokens": 40278732.0, "step": 15900 }, { "entropy": 6.182538175582886, "epoch": 1.8355452971725332, "grad_norm": 0.96875, "learning_rate": 0.0004672085610409801, "loss": 5.6966, "mean_token_accuracy": 0.20496753305196763, "num_tokens": 40290428.0, "step": 15905 }, { "entropy": 6.202089929580689, "epoch": 1.8361223312175419, "grad_norm": 0.91015625, "learning_rate": 0.00046718710671927815, "loss": 5.7778, "mean_token_accuracy": 0.19897102266550065, "num_tokens": 40302153.0, "step": 15910 }, { "entropy": 6.2814734935760494, "epoch": 1.8366993652625505, "grad_norm": 0.9609375, "learning_rate": 0.00046716564593345843, "loss": 5.743, "mean_token_accuracy": 0.1985234797000885, "num_tokens": 40315493.0, "step": 15915 }, { "entropy": 6.283923673629761, "epoch": 1.8372763993075591, "grad_norm": 0.9296875, "learning_rate": 0.00046714417868424265, "loss": 5.7986, "mean_token_accuracy": 0.1846300795674324, "num_tokens": 40328157.0, "step": 15920 }, { "entropy": 6.262593412399292, "epoch": 1.8378534333525678, "grad_norm": 0.84765625, "learning_rate": 0.00046712270497235284, "loss": 5.8082, "mean_token_accuracy": 0.1937829002737999, "num_tokens": 40341684.0, "step": 15925 }, { "entropy": 6.3377039432525635, "epoch": 1.8384304673975764, "grad_norm": 0.90625, "learning_rate": 0.0004671012247985112, "loss": 5.8578, "mean_token_accuracy": 0.18830958604812623, "num_tokens": 40354002.0, "step": 15930 }, { "entropy": 6.204885721206665, "epoch": 1.839007501442585, "grad_norm": 0.92578125, "learning_rate": 0.00046707973816344044, "loss": 5.7634, "mean_token_accuracy": 0.20010476559400558, "num_tokens": 40366211.0, "step": 15935 }, { "entropy": 6.284234189987183, "epoch": 1.8395845354875937, "grad_norm": 0.984375, "learning_rate": 0.00046705824506786304, "loss": 5.8542, "mean_token_accuracy": 0.19239040166139604, "num_tokens": 40377957.0, "step": 15940 }, { "entropy": 6.301759529113769, "epoch": 1.8401615695326026, "grad_norm": 0.890625, "learning_rate": 0.00046703674551250193, "loss": 5.802, "mean_token_accuracy": 0.19346368908882142, "num_tokens": 40391018.0, "step": 15945 }, { "entropy": 6.218786287307739, "epoch": 1.840738603577611, "grad_norm": 0.87890625, "learning_rate": 0.0004670152394980803, "loss": 5.7965, "mean_token_accuracy": 0.19256123006343842, "num_tokens": 40405134.0, "step": 15950 }, { "entropy": 6.305995988845825, "epoch": 1.8413156376226198, "grad_norm": 0.9375, "learning_rate": 0.0004669937270253214, "loss": 5.8067, "mean_token_accuracy": 0.19366917610168458, "num_tokens": 40418131.0, "step": 15955 }, { "entropy": 6.268421268463134, "epoch": 1.8418926716676283, "grad_norm": 0.9765625, "learning_rate": 0.000466972208094949, "loss": 5.7485, "mean_token_accuracy": 0.1956111580133438, "num_tokens": 40430614.0, "step": 15960 }, { "entropy": 6.332875061035156, "epoch": 1.8424697057126371, "grad_norm": 1.015625, "learning_rate": 0.00046695068270768665, "loss": 5.7761, "mean_token_accuracy": 0.19068144708871843, "num_tokens": 40443200.0, "step": 15965 }, { "entropy": 6.184208965301513, "epoch": 1.8430467397576455, "grad_norm": 1.078125, "learning_rate": 0.00046692915086425846, "loss": 5.735, "mean_token_accuracy": 0.19420334547758103, "num_tokens": 40455662.0, "step": 15970 }, { "entropy": 6.239500045776367, "epoch": 1.8436237738026544, "grad_norm": 0.98828125, "learning_rate": 0.00046690761256538857, "loss": 5.7007, "mean_token_accuracy": 0.20253938138484956, "num_tokens": 40468247.0, "step": 15975 }, { "entropy": 6.316354751586914, "epoch": 1.844200807847663, "grad_norm": 0.9453125, "learning_rate": 0.0004668860678118015, "loss": 5.8784, "mean_token_accuracy": 0.1913073852658272, "num_tokens": 40480607.0, "step": 15980 }, { "entropy": 6.30676498413086, "epoch": 1.8447778418926717, "grad_norm": 0.90234375, "learning_rate": 0.00046686451660422185, "loss": 5.7809, "mean_token_accuracy": 0.1933899149298668, "num_tokens": 40492140.0, "step": 15985 }, { "entropy": 6.29900894165039, "epoch": 1.8453548759376803, "grad_norm": 0.953125, "learning_rate": 0.00046684295894337455, "loss": 5.8328, "mean_token_accuracy": 0.19052439033985138, "num_tokens": 40504513.0, "step": 15990 }, { "entropy": 6.217627811431885, "epoch": 1.845931909982689, "grad_norm": 1.0, "learning_rate": 0.0004668213948299845, "loss": 5.7376, "mean_token_accuracy": 0.1955086499452591, "num_tokens": 40517258.0, "step": 15995 }, { "entropy": 6.232381010055542, "epoch": 1.8465089440276976, "grad_norm": 0.9296875, "learning_rate": 0.0004667998242647772, "loss": 5.7692, "mean_token_accuracy": 0.1925689846277237, "num_tokens": 40529092.0, "step": 16000 }, { "entropy": 6.237630987167359, "epoch": 1.8470859780727062, "grad_norm": 0.91796875, "learning_rate": 0.000466778247248478, "loss": 5.7287, "mean_token_accuracy": 0.1985825851559639, "num_tokens": 40543586.0, "step": 16005 }, { "entropy": 6.311019611358643, "epoch": 1.847663012117715, "grad_norm": 1.0078125, "learning_rate": 0.00046675666378181275, "loss": 5.794, "mean_token_accuracy": 0.19712699204683304, "num_tokens": 40555721.0, "step": 16010 }, { "entropy": 6.333885526657104, "epoch": 1.8482400461627235, "grad_norm": 0.86328125, "learning_rate": 0.0004667350738655074, "loss": 5.871, "mean_token_accuracy": 0.18650257140398024, "num_tokens": 40567547.0, "step": 16015 }, { "entropy": 6.246447324752808, "epoch": 1.8488170802077324, "grad_norm": 0.9921875, "learning_rate": 0.00046671347750028806, "loss": 5.712, "mean_token_accuracy": 0.1954139679670334, "num_tokens": 40579498.0, "step": 16020 }, { "entropy": 6.294281148910523, "epoch": 1.8493941142527408, "grad_norm": 0.875, "learning_rate": 0.0004666918746868811, "loss": 5.8376, "mean_token_accuracy": 0.18255259990692138, "num_tokens": 40593853.0, "step": 16025 }, { "entropy": 6.21675066947937, "epoch": 1.8499711482977497, "grad_norm": 1.0, "learning_rate": 0.0004666702654260133, "loss": 5.7154, "mean_token_accuracy": 0.1969263732433319, "num_tokens": 40605737.0, "step": 16030 }, { "entropy": 6.190192651748657, "epoch": 1.850548182342758, "grad_norm": 0.9296875, "learning_rate": 0.00046664864971841113, "loss": 5.697, "mean_token_accuracy": 0.2019049718976021, "num_tokens": 40617839.0, "step": 16035 }, { "entropy": 6.243142032623291, "epoch": 1.851125216387767, "grad_norm": 0.9140625, "learning_rate": 0.00046662702756480195, "loss": 5.769, "mean_token_accuracy": 0.196391262114048, "num_tokens": 40630247.0, "step": 16040 }, { "entropy": 6.155957269668579, "epoch": 1.8517022504327756, "grad_norm": 1.1484375, "learning_rate": 0.00046660539896591286, "loss": 5.6666, "mean_token_accuracy": 0.2063628390431404, "num_tokens": 40643869.0, "step": 16045 }, { "entropy": 6.268722629547119, "epoch": 1.8522792844777842, "grad_norm": 0.93359375, "learning_rate": 0.0004665837639224713, "loss": 5.7752, "mean_token_accuracy": 0.19113756120204925, "num_tokens": 40655389.0, "step": 16050 }, { "entropy": 6.285340595245361, "epoch": 1.8528563185227929, "grad_norm": 0.9140625, "learning_rate": 0.00046656212243520505, "loss": 5.7934, "mean_token_accuracy": 0.18825832307338713, "num_tokens": 40667663.0, "step": 16055 }, { "entropy": 6.273303270339966, "epoch": 1.8534333525678015, "grad_norm": 0.921875, "learning_rate": 0.00046654047450484193, "loss": 5.7277, "mean_token_accuracy": 0.19776127189397813, "num_tokens": 40680623.0, "step": 16060 }, { "entropy": 6.216945171356201, "epoch": 1.8540103866128101, "grad_norm": 0.90234375, "learning_rate": 0.0004665188201321102, "loss": 5.7082, "mean_token_accuracy": 0.19727377593517303, "num_tokens": 40692679.0, "step": 16065 }, { "entropy": 6.272071456909179, "epoch": 1.8545874206578188, "grad_norm": 0.921875, "learning_rate": 0.00046649715931773795, "loss": 5.8786, "mean_token_accuracy": 0.19242863059043885, "num_tokens": 40705187.0, "step": 16070 }, { "entropy": 6.28022871017456, "epoch": 1.8551644547028274, "grad_norm": 0.8984375, "learning_rate": 0.000466475492062454, "loss": 5.8193, "mean_token_accuracy": 0.19652820974588395, "num_tokens": 40717854.0, "step": 16075 }, { "entropy": 6.257518720626831, "epoch": 1.855741488747836, "grad_norm": 0.91796875, "learning_rate": 0.00046645381836698684, "loss": 5.8047, "mean_token_accuracy": 0.19478076994419097, "num_tokens": 40731039.0, "step": 16080 }, { "entropy": 6.252432584762573, "epoch": 1.856318522792845, "grad_norm": 0.9453125, "learning_rate": 0.0004664321382320657, "loss": 5.742, "mean_token_accuracy": 0.19954000115394593, "num_tokens": 40745065.0, "step": 16085 }, { "entropy": 6.2835486888885494, "epoch": 1.8568955568378533, "grad_norm": 0.91796875, "learning_rate": 0.00046641045165841965, "loss": 5.8538, "mean_token_accuracy": 0.18943217396736145, "num_tokens": 40758107.0, "step": 16090 }, { "entropy": 6.31345567703247, "epoch": 1.8574725908828622, "grad_norm": 0.95703125, "learning_rate": 0.00046638875864677814, "loss": 5.8626, "mean_token_accuracy": 0.18975879997015, "num_tokens": 40771082.0, "step": 16095 }, { "entropy": 6.294506025314331, "epoch": 1.8580496249278706, "grad_norm": 0.8984375, "learning_rate": 0.0004663670591978708, "loss": 5.7806, "mean_token_accuracy": 0.18993891030550003, "num_tokens": 40784165.0, "step": 16100 }, { "entropy": 6.175074863433838, "epoch": 1.8586266589728795, "grad_norm": 0.9375, "learning_rate": 0.0004663453533124275, "loss": 5.6254, "mean_token_accuracy": 0.21204764991998673, "num_tokens": 40796279.0, "step": 16105 }, { "entropy": 6.217782354354858, "epoch": 1.859203693017888, "grad_norm": 0.921875, "learning_rate": 0.0004663236409911783, "loss": 5.7205, "mean_token_accuracy": 0.19833692610263826, "num_tokens": 40809074.0, "step": 16110 }, { "entropy": 6.194740915298462, "epoch": 1.8597807270628968, "grad_norm": 0.95703125, "learning_rate": 0.00046630192223485345, "loss": 5.6586, "mean_token_accuracy": 0.20452403873205185, "num_tokens": 40821086.0, "step": 16115 }, { "entropy": 6.311218357086181, "epoch": 1.8603577611079054, "grad_norm": 0.96484375, "learning_rate": 0.00046628019704418345, "loss": 5.7747, "mean_token_accuracy": 0.19277962148189545, "num_tokens": 40832697.0, "step": 16120 }, { "entropy": 6.1826904773712155, "epoch": 1.860934795152914, "grad_norm": 0.91796875, "learning_rate": 0.000466258465419899, "loss": 5.7908, "mean_token_accuracy": 0.19389365762472152, "num_tokens": 40845268.0, "step": 16125 }, { "entropy": 6.3233559131622314, "epoch": 1.8615118291979227, "grad_norm": 0.8671875, "learning_rate": 0.0004662367273627312, "loss": 5.8121, "mean_token_accuracy": 0.1891919642686844, "num_tokens": 40858314.0, "step": 16130 }, { "entropy": 6.302750968933106, "epoch": 1.8620888632429313, "grad_norm": 0.98828125, "learning_rate": 0.000466214982873411, "loss": 5.7606, "mean_token_accuracy": 0.19642114788293838, "num_tokens": 40869982.0, "step": 16135 }, { "entropy": 6.234612894058228, "epoch": 1.86266589728794, "grad_norm": 0.890625, "learning_rate": 0.00046619323195266975, "loss": 5.7159, "mean_token_accuracy": 0.20078064352273942, "num_tokens": 40881831.0, "step": 16140 }, { "entropy": 6.17855396270752, "epoch": 1.8632429313329486, "grad_norm": 1.0625, "learning_rate": 0.0004661714746012392, "loss": 5.7297, "mean_token_accuracy": 0.19786572009325026, "num_tokens": 40894279.0, "step": 16145 }, { "entropy": 6.281162405014038, "epoch": 1.8638199653779572, "grad_norm": 0.98046875, "learning_rate": 0.000466149710819851, "loss": 5.7957, "mean_token_accuracy": 0.1955430254340172, "num_tokens": 40906960.0, "step": 16150 }, { "entropy": 6.305213737487793, "epoch": 1.8643969994229659, "grad_norm": 0.89453125, "learning_rate": 0.0004661279406092373, "loss": 5.8203, "mean_token_accuracy": 0.18938140720129013, "num_tokens": 40920688.0, "step": 16155 }, { "entropy": 6.323654222488403, "epoch": 1.8649740334679747, "grad_norm": 0.89453125, "learning_rate": 0.00046610616397013027, "loss": 5.826, "mean_token_accuracy": 0.19093446284532548, "num_tokens": 40933017.0, "step": 16160 }, { "entropy": 6.247139501571655, "epoch": 1.8655510675129832, "grad_norm": 0.8828125, "learning_rate": 0.0004660843809032623, "loss": 5.6878, "mean_token_accuracy": 0.20525743216276168, "num_tokens": 40947179.0, "step": 16165 }, { "entropy": 6.2831775665283205, "epoch": 1.866128101557992, "grad_norm": 0.91796875, "learning_rate": 0.0004660625914093661, "loss": 5.8344, "mean_token_accuracy": 0.18841950744390487, "num_tokens": 40958806.0, "step": 16170 }, { "entropy": 6.3006516456604, "epoch": 1.8667051356030004, "grad_norm": 1.0390625, "learning_rate": 0.0004660407954891745, "loss": 5.7546, "mean_token_accuracy": 0.19830986261367797, "num_tokens": 40970667.0, "step": 16175 }, { "entropy": 6.27160415649414, "epoch": 1.8672821696480093, "grad_norm": 0.93359375, "learning_rate": 0.0004660189931434207, "loss": 5.7809, "mean_token_accuracy": 0.1949162170290947, "num_tokens": 40982663.0, "step": 16180 }, { "entropy": 6.185522985458374, "epoch": 1.8678592036930177, "grad_norm": 0.984375, "learning_rate": 0.0004659971843728379, "loss": 5.7236, "mean_token_accuracy": 0.20043258517980575, "num_tokens": 40995168.0, "step": 16185 }, { "entropy": 6.284909343719482, "epoch": 1.8684362377380266, "grad_norm": 0.92578125, "learning_rate": 0.0004659753691781597, "loss": 5.8185, "mean_token_accuracy": 0.1912219762802124, "num_tokens": 41007159.0, "step": 16190 }, { "entropy": 6.213361740112305, "epoch": 1.8690132717830352, "grad_norm": 0.90234375, "learning_rate": 0.0004659535475601198, "loss": 5.683, "mean_token_accuracy": 0.19469626247882843, "num_tokens": 41019860.0, "step": 16195 }, { "entropy": 6.234416866302491, "epoch": 1.8695903058280439, "grad_norm": 1.0, "learning_rate": 0.00046593171951945226, "loss": 5.76, "mean_token_accuracy": 0.19812550395727158, "num_tokens": 41031635.0, "step": 16200 }, { "entropy": 6.286600160598755, "epoch": 1.8701673398730525, "grad_norm": 0.89453125, "learning_rate": 0.00046590988505689114, "loss": 5.8125, "mean_token_accuracy": 0.19126126021146775, "num_tokens": 41044678.0, "step": 16205 }, { "entropy": 6.305450344085694, "epoch": 1.8707443739180611, "grad_norm": 0.90234375, "learning_rate": 0.00046588804417317084, "loss": 5.857, "mean_token_accuracy": 0.19345226287841796, "num_tokens": 41056799.0, "step": 16210 }, { "entropy": 6.275042295455933, "epoch": 1.8713214079630698, "grad_norm": 1.015625, "learning_rate": 0.00046586619686902597, "loss": 5.814, "mean_token_accuracy": 0.1963962972164154, "num_tokens": 41069700.0, "step": 16215 }, { "entropy": 6.318129396438598, "epoch": 1.8718984420080784, "grad_norm": 1.015625, "learning_rate": 0.00046584434314519144, "loss": 5.7263, "mean_token_accuracy": 0.19932073950767518, "num_tokens": 41081427.0, "step": 16220 }, { "entropy": 6.261219692230225, "epoch": 1.8724754760530873, "grad_norm": 1.25, "learning_rate": 0.0004658224830024022, "loss": 5.7052, "mean_token_accuracy": 0.2031535804271698, "num_tokens": 41094770.0, "step": 16225 }, { "entropy": 6.250154447555542, "epoch": 1.8730525100980957, "grad_norm": 1.0234375, "learning_rate": 0.0004658006164413935, "loss": 5.7422, "mean_token_accuracy": 0.19554442614316941, "num_tokens": 41106802.0, "step": 16230 }, { "entropy": 6.230137729644776, "epoch": 1.8736295441431046, "grad_norm": 0.8984375, "learning_rate": 0.0004657787434629009, "loss": 5.8139, "mean_token_accuracy": 0.20067144930362701, "num_tokens": 41120125.0, "step": 16235 }, { "entropy": 6.221140146255493, "epoch": 1.874206578188113, "grad_norm": 1.59375, "learning_rate": 0.00046575686406765993, "loss": 5.7643, "mean_token_accuracy": 0.20250476002693177, "num_tokens": 41134267.0, "step": 16240 }, { "entropy": 6.312375211715699, "epoch": 1.8747836122331218, "grad_norm": 0.87890625, "learning_rate": 0.00046573497825640664, "loss": 5.7214, "mean_token_accuracy": 0.19941470474004747, "num_tokens": 41147266.0, "step": 16245 }, { "entropy": 6.245394372940064, "epoch": 1.8753606462781303, "grad_norm": 0.921875, "learning_rate": 0.0004657130860298771, "loss": 5.7564, "mean_token_accuracy": 0.19797106981277465, "num_tokens": 41159666.0, "step": 16250 }, { "entropy": 6.305567932128906, "epoch": 1.8759376803231391, "grad_norm": 0.94140625, "learning_rate": 0.0004656911873888077, "loss": 5.8111, "mean_token_accuracy": 0.194146266579628, "num_tokens": 41171947.0, "step": 16255 }, { "entropy": 6.2310679912567135, "epoch": 1.8765147143681478, "grad_norm": 0.8671875, "learning_rate": 0.0004656692823339349, "loss": 5.7744, "mean_token_accuracy": 0.20527701675891877, "num_tokens": 41186376.0, "step": 16260 }, { "entropy": 6.251262378692627, "epoch": 1.8770917484131564, "grad_norm": 0.921875, "learning_rate": 0.0004656473708659955, "loss": 5.8127, "mean_token_accuracy": 0.19876704216003419, "num_tokens": 41199730.0, "step": 16265 }, { "entropy": 6.275247240066529, "epoch": 1.877668782458165, "grad_norm": 0.890625, "learning_rate": 0.00046562545298572646, "loss": 5.7252, "mean_token_accuracy": 0.20782668739557267, "num_tokens": 41212502.0, "step": 16270 }, { "entropy": 6.231871271133423, "epoch": 1.8782458165031737, "grad_norm": 0.9765625, "learning_rate": 0.000465603528693865, "loss": 5.7218, "mean_token_accuracy": 0.1999581292271614, "num_tokens": 41226006.0, "step": 16275 }, { "entropy": 6.290467929840088, "epoch": 1.8788228505481823, "grad_norm": 0.91796875, "learning_rate": 0.00046558159799114853, "loss": 5.7759, "mean_token_accuracy": 0.19554868936538697, "num_tokens": 41239172.0, "step": 16280 }, { "entropy": 6.234803247451782, "epoch": 1.879399884593191, "grad_norm": 0.9296875, "learning_rate": 0.0004655596608783147, "loss": 5.6807, "mean_token_accuracy": 0.20324462056159973, "num_tokens": 41251307.0, "step": 16285 }, { "entropy": 6.256707239151001, "epoch": 1.8799769186381996, "grad_norm": 0.91015625, "learning_rate": 0.00046553771735610136, "loss": 5.7335, "mean_token_accuracy": 0.1982148304581642, "num_tokens": 41264634.0, "step": 16290 }, { "entropy": 6.3179339408874515, "epoch": 1.8805539526832082, "grad_norm": 1.09375, "learning_rate": 0.0004655157674252465, "loss": 5.7985, "mean_token_accuracy": 0.18980283737182618, "num_tokens": 41278205.0, "step": 16295 }, { "entropy": 6.348180198669434, "epoch": 1.881130986728217, "grad_norm": 0.93359375, "learning_rate": 0.00046549381108648843, "loss": 5.8224, "mean_token_accuracy": 0.19358165115118026, "num_tokens": 41290447.0, "step": 16300 }, { "entropy": 6.262139749526978, "epoch": 1.8817080207732255, "grad_norm": 0.953125, "learning_rate": 0.0004654718483405656, "loss": 5.7144, "mean_token_accuracy": 0.20273840427398682, "num_tokens": 41302948.0, "step": 16305 }, { "entropy": 6.263070011138916, "epoch": 1.8822850548182344, "grad_norm": 0.95703125, "learning_rate": 0.00046544987918821685, "loss": 5.8237, "mean_token_accuracy": 0.18879707604646684, "num_tokens": 41315237.0, "step": 16310 }, { "entropy": 6.133535957336425, "epoch": 1.8828620888632428, "grad_norm": 1.09375, "learning_rate": 0.000465427903630181, "loss": 5.5638, "mean_token_accuracy": 0.2196532055735588, "num_tokens": 41327426.0, "step": 16315 }, { "entropy": 6.307161808013916, "epoch": 1.8834391229082517, "grad_norm": 1.0078125, "learning_rate": 0.0004654059216671972, "loss": 5.8517, "mean_token_accuracy": 0.18843885362148285, "num_tokens": 41340517.0, "step": 16320 }, { "entropy": 6.236600637435913, "epoch": 1.88401615695326, "grad_norm": 0.953125, "learning_rate": 0.0004653839333000048, "loss": 5.7559, "mean_token_accuracy": 0.20001779347658158, "num_tokens": 41353520.0, "step": 16325 }, { "entropy": 6.285597038269043, "epoch": 1.884593190998269, "grad_norm": 0.92578125, "learning_rate": 0.00046536193852934334, "loss": 5.7969, "mean_token_accuracy": 0.19169134944677352, "num_tokens": 41366326.0, "step": 16330 }, { "entropy": 6.229726505279541, "epoch": 1.8851702250432776, "grad_norm": 1.046875, "learning_rate": 0.00046533993735595273, "loss": 5.7167, "mean_token_accuracy": 0.19942979216575624, "num_tokens": 41377405.0, "step": 16335 }, { "entropy": 6.325794410705567, "epoch": 1.8857472590882862, "grad_norm": 1.046875, "learning_rate": 0.00046531792978057277, "loss": 5.8318, "mean_token_accuracy": 0.19330891519784926, "num_tokens": 41391038.0, "step": 16340 }, { "entropy": 6.256032085418701, "epoch": 1.8863242931332949, "grad_norm": 0.96484375, "learning_rate": 0.0004652959158039438, "loss": 5.7934, "mean_token_accuracy": 0.19577520489692687, "num_tokens": 41404069.0, "step": 16345 }, { "entropy": 6.223421478271485, "epoch": 1.8869013271783035, "grad_norm": 0.89453125, "learning_rate": 0.0004652738954268062, "loss": 5.7639, "mean_token_accuracy": 0.19806374460458756, "num_tokens": 41416698.0, "step": 16350 }, { "entropy": 6.249164390563965, "epoch": 1.8874783612233121, "grad_norm": 0.9140625, "learning_rate": 0.00046525186864990073, "loss": 5.7403, "mean_token_accuracy": 0.20115036368370057, "num_tokens": 41429953.0, "step": 16355 }, { "entropy": 6.211552906036377, "epoch": 1.8880553952683208, "grad_norm": 0.91796875, "learning_rate": 0.00046522983547396806, "loss": 5.7539, "mean_token_accuracy": 0.1969211846590042, "num_tokens": 41442824.0, "step": 16360 }, { "entropy": 6.246453046798706, "epoch": 1.8886324293133296, "grad_norm": 0.94921875, "learning_rate": 0.0004652077958997494, "loss": 5.7936, "mean_token_accuracy": 0.19895950108766555, "num_tokens": 41455062.0, "step": 16365 }, { "entropy": 6.222312116622925, "epoch": 1.889209463358338, "grad_norm": 1.03125, "learning_rate": 0.00046518574992798604, "loss": 5.6555, "mean_token_accuracy": 0.2099636271595955, "num_tokens": 41468147.0, "step": 16370 }, { "entropy": 6.223028945922851, "epoch": 1.889786497403347, "grad_norm": 0.98046875, "learning_rate": 0.00046516369755941945, "loss": 5.7131, "mean_token_accuracy": 0.19650413542985917, "num_tokens": 41480664.0, "step": 16375 }, { "entropy": 6.2845159530639645, "epoch": 1.8903635314483553, "grad_norm": 0.87890625, "learning_rate": 0.0004651416387947914, "loss": 5.7874, "mean_token_accuracy": 0.19323295950889588, "num_tokens": 41494578.0, "step": 16380 }, { "entropy": 6.292543506622314, "epoch": 1.8909405654933642, "grad_norm": 0.859375, "learning_rate": 0.0004651195736348437, "loss": 5.8311, "mean_token_accuracy": 0.19104174971580506, "num_tokens": 41506528.0, "step": 16385 }, { "entropy": 6.3199584007263185, "epoch": 1.8915175995383726, "grad_norm": 0.91015625, "learning_rate": 0.0004650975020803186, "loss": 5.8854, "mean_token_accuracy": 0.18843409717082976, "num_tokens": 41520861.0, "step": 16390 }, { "entropy": 6.2749334335327145, "epoch": 1.8920946335833815, "grad_norm": 0.96484375, "learning_rate": 0.0004650754241319584, "loss": 5.7578, "mean_token_accuracy": 0.19465109407901765, "num_tokens": 41533811.0, "step": 16395 }, { "entropy": 6.295410919189453, "epoch": 1.8926716676283901, "grad_norm": 0.90625, "learning_rate": 0.00046505333979050573, "loss": 5.8309, "mean_token_accuracy": 0.18629831969738006, "num_tokens": 41546291.0, "step": 16400 }, { "entropy": 6.229169321060181, "epoch": 1.8932487016733988, "grad_norm": 0.9375, "learning_rate": 0.0004650312490567035, "loss": 5.6885, "mean_token_accuracy": 0.20371766537427902, "num_tokens": 41558157.0, "step": 16405 }, { "entropy": 6.260204553604126, "epoch": 1.8938257357184074, "grad_norm": 0.90625, "learning_rate": 0.0004650091519312945, "loss": 5.7904, "mean_token_accuracy": 0.19707432389259338, "num_tokens": 41571346.0, "step": 16410 }, { "entropy": 6.290263605117798, "epoch": 1.894402769763416, "grad_norm": 0.94140625, "learning_rate": 0.00046498704841502203, "loss": 5.8656, "mean_token_accuracy": 0.1875235214829445, "num_tokens": 41583973.0, "step": 16415 }, { "entropy": 6.2632382869720455, "epoch": 1.8949798038084247, "grad_norm": 0.85546875, "learning_rate": 0.0004649649385086296, "loss": 5.7809, "mean_token_accuracy": 0.1917982280254364, "num_tokens": 41596210.0, "step": 16420 }, { "entropy": 6.269391632080078, "epoch": 1.8955568378534333, "grad_norm": 0.921875, "learning_rate": 0.0004649428222128608, "loss": 5.8774, "mean_token_accuracy": 0.1920461028814316, "num_tokens": 41608297.0, "step": 16425 }, { "entropy": 6.2635517597198485, "epoch": 1.896133871898442, "grad_norm": 0.9609375, "learning_rate": 0.00046492069952845953, "loss": 5.8159, "mean_token_accuracy": 0.19155189394950867, "num_tokens": 41621319.0, "step": 16430 }, { "entropy": 6.256300735473633, "epoch": 1.8967109059434506, "grad_norm": 0.92578125, "learning_rate": 0.00046489857045617, "loss": 5.7019, "mean_token_accuracy": 0.1957299679517746, "num_tokens": 41633282.0, "step": 16435 }, { "entropy": 6.198005723953247, "epoch": 1.8972879399884595, "grad_norm": 0.91015625, "learning_rate": 0.00046487643499673625, "loss": 5.7409, "mean_token_accuracy": 0.19980133175849915, "num_tokens": 41646573.0, "step": 16440 }, { "entropy": 6.209664535522461, "epoch": 1.8978649740334679, "grad_norm": 0.84375, "learning_rate": 0.0004648542931509029, "loss": 5.7305, "mean_token_accuracy": 0.1976473018527031, "num_tokens": 41659596.0, "step": 16445 }, { "entropy": 6.271393918991089, "epoch": 1.8984420080784767, "grad_norm": 0.890625, "learning_rate": 0.0004648321449194148, "loss": 5.7343, "mean_token_accuracy": 0.19791839867830277, "num_tokens": 41673612.0, "step": 16450 }, { "entropy": 6.33080906867981, "epoch": 1.8990190421234852, "grad_norm": 0.88671875, "learning_rate": 0.00046480999030301673, "loss": 5.8707, "mean_token_accuracy": 0.19741834253072738, "num_tokens": 41686583.0, "step": 16455 }, { "entropy": 6.2306641101837155, "epoch": 1.899596076168494, "grad_norm": 0.8984375, "learning_rate": 0.00046478782930245395, "loss": 5.7818, "mean_token_accuracy": 0.19308353811502457, "num_tokens": 41698542.0, "step": 16460 }, { "entropy": 6.272447824478149, "epoch": 1.9001731102135024, "grad_norm": 0.92578125, "learning_rate": 0.00046476566191847176, "loss": 5.7652, "mean_token_accuracy": 0.19157506674528121, "num_tokens": 41712461.0, "step": 16465 }, { "entropy": 6.274053525924683, "epoch": 1.9007501442585113, "grad_norm": 0.94921875, "learning_rate": 0.0004647434881518159, "loss": 5.7936, "mean_token_accuracy": 0.19418258666992189, "num_tokens": 41725450.0, "step": 16470 }, { "entropy": 6.304055404663086, "epoch": 1.90132717830352, "grad_norm": 1.0234375, "learning_rate": 0.00046472130800323194, "loss": 5.7928, "mean_token_accuracy": 0.1953343480825424, "num_tokens": 41737255.0, "step": 16475 }, { "entropy": 6.237203598022461, "epoch": 1.9019042123485286, "grad_norm": 0.98828125, "learning_rate": 0.0004646991214734661, "loss": 5.8467, "mean_token_accuracy": 0.18810160607099533, "num_tokens": 41749459.0, "step": 16480 }, { "entropy": 6.266273927688599, "epoch": 1.9024812463935372, "grad_norm": 0.8828125, "learning_rate": 0.0004646769285632645, "loss": 5.7854, "mean_token_accuracy": 0.19517850428819655, "num_tokens": 41761603.0, "step": 16485 }, { "entropy": 6.29341402053833, "epoch": 1.9030582804385459, "grad_norm": 0.95703125, "learning_rate": 0.0004646547292733737, "loss": 5.866, "mean_token_accuracy": 0.19031329154968263, "num_tokens": 41774865.0, "step": 16490 }, { "entropy": 6.235404348373413, "epoch": 1.9036353144835545, "grad_norm": 0.95703125, "learning_rate": 0.0004646325236045402, "loss": 5.7926, "mean_token_accuracy": 0.19833193123340606, "num_tokens": 41787558.0, "step": 16495 }, { "entropy": 6.243685007095337, "epoch": 1.9042123485285631, "grad_norm": 0.921875, "learning_rate": 0.000464610311557511, "loss": 5.719, "mean_token_accuracy": 0.20007752627134323, "num_tokens": 41800754.0, "step": 16500 }, { "entropy": 6.226137685775757, "epoch": 1.904789382573572, "grad_norm": 0.87890625, "learning_rate": 0.0004645880931330331, "loss": 5.6967, "mean_token_accuracy": 0.20966541022062302, "num_tokens": 41813133.0, "step": 16505 }, { "entropy": 6.233737277984619, "epoch": 1.9053664166185804, "grad_norm": 0.9609375, "learning_rate": 0.0004645658683318539, "loss": 5.8035, "mean_token_accuracy": 0.18930404186248778, "num_tokens": 41825288.0, "step": 16510 }, { "entropy": 6.292668104171753, "epoch": 1.9059434506635893, "grad_norm": 0.9765625, "learning_rate": 0.0004645436371547209, "loss": 5.8451, "mean_token_accuracy": 0.19418457448482512, "num_tokens": 41837331.0, "step": 16515 }, { "entropy": 6.341061973571778, "epoch": 1.9065204847085977, "grad_norm": 0.93359375, "learning_rate": 0.00046452139960238186, "loss": 5.8377, "mean_token_accuracy": 0.19629154950380326, "num_tokens": 41850536.0, "step": 16520 }, { "entropy": 6.257677698135376, "epoch": 1.9070975187536066, "grad_norm": 0.9453125, "learning_rate": 0.00046449915567558467, "loss": 5.7741, "mean_token_accuracy": 0.20220681130886078, "num_tokens": 41862199.0, "step": 16525 }, { "entropy": 6.220550918579102, "epoch": 1.907674552798615, "grad_norm": 0.9765625, "learning_rate": 0.0004644769053750775, "loss": 5.7688, "mean_token_accuracy": 0.196894970536232, "num_tokens": 41872945.0, "step": 16530 }, { "entropy": 6.280444192886352, "epoch": 1.9082515868436238, "grad_norm": 0.96875, "learning_rate": 0.0004644546487016087, "loss": 5.7714, "mean_token_accuracy": 0.18869336992502211, "num_tokens": 41884223.0, "step": 16535 }, { "entropy": 6.260154581069946, "epoch": 1.9088286208886325, "grad_norm": 0.94140625, "learning_rate": 0.00046443238565592687, "loss": 5.7942, "mean_token_accuracy": 0.19114427119493485, "num_tokens": 41896997.0, "step": 16540 }, { "entropy": 6.2543297290802, "epoch": 1.9094056549336411, "grad_norm": 0.96875, "learning_rate": 0.00046441011623878087, "loss": 5.8051, "mean_token_accuracy": 0.1990337774157524, "num_tokens": 41910210.0, "step": 16545 }, { "entropy": 6.144182586669922, "epoch": 1.9099826889786498, "grad_norm": 0.98046875, "learning_rate": 0.0004643878404509197, "loss": 5.6173, "mean_token_accuracy": 0.20534706264734268, "num_tokens": 41922882.0, "step": 16550 }, { "entropy": 6.211149787902832, "epoch": 1.9105597230236584, "grad_norm": 0.921875, "learning_rate": 0.00046436555829309264, "loss": 5.6609, "mean_token_accuracy": 0.20721425265073776, "num_tokens": 41934655.0, "step": 16555 }, { "entropy": 6.271144676208496, "epoch": 1.911136757068667, "grad_norm": 0.984375, "learning_rate": 0.000464343269766049, "loss": 5.7733, "mean_token_accuracy": 0.19531577229499816, "num_tokens": 41947946.0, "step": 16560 }, { "entropy": 6.307552719116211, "epoch": 1.9117137911136757, "grad_norm": 0.96875, "learning_rate": 0.00046432097487053857, "loss": 5.8634, "mean_token_accuracy": 0.19490341544151307, "num_tokens": 41962316.0, "step": 16565 }, { "entropy": 6.244507789611816, "epoch": 1.9122908251586843, "grad_norm": 0.93359375, "learning_rate": 0.00046429867360731124, "loss": 5.7511, "mean_token_accuracy": 0.20181444138288498, "num_tokens": 41976076.0, "step": 16570 }, { "entropy": 6.296638822555542, "epoch": 1.912867859203693, "grad_norm": 0.92578125, "learning_rate": 0.00046427636597711695, "loss": 5.7693, "mean_token_accuracy": 0.19726170897483825, "num_tokens": 41988762.0, "step": 16575 }, { "entropy": 6.256453800201416, "epoch": 1.9134448932487018, "grad_norm": 0.875, "learning_rate": 0.00046425405198070624, "loss": 5.7026, "mean_token_accuracy": 0.19614930152893068, "num_tokens": 42000525.0, "step": 16580 }, { "entropy": 6.15288553237915, "epoch": 1.9140219272937102, "grad_norm": 0.921875, "learning_rate": 0.00046423173161882944, "loss": 5.6421, "mean_token_accuracy": 0.20159791260957718, "num_tokens": 42013716.0, "step": 16585 }, { "entropy": 6.256470537185669, "epoch": 1.914598961338719, "grad_norm": 1.03125, "learning_rate": 0.00046420940489223735, "loss": 5.7567, "mean_token_accuracy": 0.198087240755558, "num_tokens": 42026689.0, "step": 16590 }, { "entropy": 6.285912227630615, "epoch": 1.9151759953837275, "grad_norm": 0.89453125, "learning_rate": 0.0004641870718016809, "loss": 5.82, "mean_token_accuracy": 0.18809255659580232, "num_tokens": 42039907.0, "step": 16595 }, { "entropy": 6.284678554534912, "epoch": 1.9157530294287364, "grad_norm": 0.921875, "learning_rate": 0.0004641647323479113, "loss": 5.7782, "mean_token_accuracy": 0.20078144371509551, "num_tokens": 42052781.0, "step": 16600 }, { "entropy": 6.257567262649536, "epoch": 1.9163300634737448, "grad_norm": 1.015625, "learning_rate": 0.0004641423865316798, "loss": 5.7372, "mean_token_accuracy": 0.2022291049361229, "num_tokens": 42066695.0, "step": 16605 }, { "entropy": 6.1644511222839355, "epoch": 1.9169070975187537, "grad_norm": 0.953125, "learning_rate": 0.0004641200343537381, "loss": 5.6759, "mean_token_accuracy": 0.20373013019561767, "num_tokens": 42079315.0, "step": 16610 }, { "entropy": 6.284307432174683, "epoch": 1.9174841315637623, "grad_norm": 0.91015625, "learning_rate": 0.000464097675814838, "loss": 5.8274, "mean_token_accuracy": 0.18814072906970977, "num_tokens": 42091915.0, "step": 16615 }, { "entropy": 6.281247520446778, "epoch": 1.918061165608771, "grad_norm": 1.0078125, "learning_rate": 0.0004640753109157316, "loss": 5.8094, "mean_token_accuracy": 0.19566377103328705, "num_tokens": 42105316.0, "step": 16620 }, { "entropy": 6.255827951431274, "epoch": 1.9186381996537796, "grad_norm": 0.87109375, "learning_rate": 0.00046405293965717093, "loss": 5.719, "mean_token_accuracy": 0.19903454780578614, "num_tokens": 42118078.0, "step": 16625 }, { "entropy": 6.236255788803101, "epoch": 1.9192152336987882, "grad_norm": 0.94140625, "learning_rate": 0.0004640305620399086, "loss": 5.6829, "mean_token_accuracy": 0.20465412139892578, "num_tokens": 42130845.0, "step": 16630 }, { "entropy": 6.2283731460571286, "epoch": 1.9197922677437969, "grad_norm": 1.125, "learning_rate": 0.0004640081780646971, "loss": 5.7412, "mean_token_accuracy": 0.20514567643404008, "num_tokens": 42142487.0, "step": 16635 }, { "entropy": 6.188979005813598, "epoch": 1.9203693017888055, "grad_norm": 0.8984375, "learning_rate": 0.00046398578773228954, "loss": 5.7959, "mean_token_accuracy": 0.1916016846895218, "num_tokens": 42154747.0, "step": 16640 }, { "entropy": 6.3480628490447994, "epoch": 1.9209463358338144, "grad_norm": 1.109375, "learning_rate": 0.00046396339104343886, "loss": 5.7897, "mean_token_accuracy": 0.1906105950474739, "num_tokens": 42167697.0, "step": 16645 }, { "entropy": 6.264107656478882, "epoch": 1.9215233698788228, "grad_norm": 0.91796875, "learning_rate": 0.0004639409879988984, "loss": 5.7672, "mean_token_accuracy": 0.19499629139900207, "num_tokens": 42179874.0, "step": 16650 }, { "entropy": 6.344415950775146, "epoch": 1.9221004039238316, "grad_norm": 0.9921875, "learning_rate": 0.0004639185785994216, "loss": 5.8445, "mean_token_accuracy": 0.19568451046943663, "num_tokens": 42192747.0, "step": 16655 }, { "entropy": 6.209359455108642, "epoch": 1.92267743796884, "grad_norm": 0.94921875, "learning_rate": 0.00046389616284576226, "loss": 5.7244, "mean_token_accuracy": 0.20322487354278565, "num_tokens": 42205534.0, "step": 16660 }, { "entropy": 6.236516332626342, "epoch": 1.923254472013849, "grad_norm": 0.99609375, "learning_rate": 0.00046387374073867435, "loss": 5.7807, "mean_token_accuracy": 0.1965228259563446, "num_tokens": 42217825.0, "step": 16665 }, { "entropy": 6.307939052581787, "epoch": 1.9238315060588573, "grad_norm": 1.0078125, "learning_rate": 0.00046385131227891197, "loss": 5.7686, "mean_token_accuracy": 0.19342057555913925, "num_tokens": 42230162.0, "step": 16670 }, { "entropy": 6.219927167892456, "epoch": 1.9244085401038662, "grad_norm": 1.1171875, "learning_rate": 0.0004638288774672295, "loss": 5.7397, "mean_token_accuracy": 0.20268993824720383, "num_tokens": 42242458.0, "step": 16675 }, { "entropy": 6.157504272460938, "epoch": 1.9249855741488748, "grad_norm": 0.97265625, "learning_rate": 0.0004638064363043816, "loss": 5.7236, "mean_token_accuracy": 0.19436694234609603, "num_tokens": 42254389.0, "step": 16680 }, { "entropy": 6.249301719665527, "epoch": 1.9255626081938835, "grad_norm": 1.015625, "learning_rate": 0.00046378398879112293, "loss": 5.7496, "mean_token_accuracy": 0.20150014460086824, "num_tokens": 42266421.0, "step": 16685 }, { "entropy": 6.132052278518676, "epoch": 1.9261396422388921, "grad_norm": 0.95703125, "learning_rate": 0.0004637615349282086, "loss": 5.7148, "mean_token_accuracy": 0.19750168770551682, "num_tokens": 42279189.0, "step": 16690 }, { "entropy": 6.267314481735229, "epoch": 1.9267166762839008, "grad_norm": 0.96875, "learning_rate": 0.0004637390747163938, "loss": 5.7576, "mean_token_accuracy": 0.19890677481889724, "num_tokens": 42291970.0, "step": 16695 }, { "entropy": 6.314395475387573, "epoch": 1.9272937103289094, "grad_norm": 0.9375, "learning_rate": 0.0004637166081564339, "loss": 5.8416, "mean_token_accuracy": 0.19406890869140625, "num_tokens": 42305185.0, "step": 16700 }, { "entropy": 6.290263223648071, "epoch": 1.927870744373918, "grad_norm": 1.3046875, "learning_rate": 0.00046369413524908473, "loss": 5.7873, "mean_token_accuracy": 0.20269953310489655, "num_tokens": 42317823.0, "step": 16705 }, { "entropy": 6.241884231567383, "epoch": 1.9284477784189267, "grad_norm": 1.0, "learning_rate": 0.00046367165599510207, "loss": 5.8062, "mean_token_accuracy": 0.1951628655195236, "num_tokens": 42330540.0, "step": 16710 }, { "entropy": 6.224489212036133, "epoch": 1.9290248124639353, "grad_norm": 0.93359375, "learning_rate": 0.0004636491703952419, "loss": 5.6006, "mean_token_accuracy": 0.20743975341320037, "num_tokens": 42342347.0, "step": 16715 }, { "entropy": 6.207153224945069, "epoch": 1.9296018465089442, "grad_norm": 0.94921875, "learning_rate": 0.00046362667845026057, "loss": 5.7571, "mean_token_accuracy": 0.20456219017505645, "num_tokens": 42355004.0, "step": 16720 }, { "entropy": 6.225836229324341, "epoch": 1.9301788805539526, "grad_norm": 0.96484375, "learning_rate": 0.00046360418016091467, "loss": 5.7263, "mean_token_accuracy": 0.19706103801727295, "num_tokens": 42366700.0, "step": 16725 }, { "entropy": 6.230300235748291, "epoch": 1.9307559145989615, "grad_norm": 0.94921875, "learning_rate": 0.00046358167552796085, "loss": 5.7861, "mean_token_accuracy": 0.19526439011096955, "num_tokens": 42379723.0, "step": 16730 }, { "entropy": 6.215284585952759, "epoch": 1.9313329486439699, "grad_norm": 1.03125, "learning_rate": 0.00046355916455215597, "loss": 5.7475, "mean_token_accuracy": 0.20507837533950807, "num_tokens": 42393505.0, "step": 16735 }, { "entropy": 6.2595137596130375, "epoch": 1.9319099826889787, "grad_norm": 0.984375, "learning_rate": 0.0004635366472342573, "loss": 5.7536, "mean_token_accuracy": 0.1928567260503769, "num_tokens": 42406334.0, "step": 16740 }, { "entropy": 6.250863933563233, "epoch": 1.9324870167339872, "grad_norm": 0.91015625, "learning_rate": 0.0004635141235750222, "loss": 5.7826, "mean_token_accuracy": 0.19470173269510269, "num_tokens": 42418585.0, "step": 16745 }, { "entropy": 6.236263465881348, "epoch": 1.933064050778996, "grad_norm": 0.88671875, "learning_rate": 0.00046349159357520815, "loss": 5.6911, "mean_token_accuracy": 0.20743900984525682, "num_tokens": 42430741.0, "step": 16750 }, { "entropy": 6.18456621170044, "epoch": 1.9336410848240047, "grad_norm": 0.95703125, "learning_rate": 0.000463469057235573, "loss": 5.6973, "mean_token_accuracy": 0.21004330068826677, "num_tokens": 42443241.0, "step": 16755 }, { "entropy": 6.249989223480225, "epoch": 1.9342181188690133, "grad_norm": 0.92578125, "learning_rate": 0.00046344651455687476, "loss": 5.7941, "mean_token_accuracy": 0.19664210975170135, "num_tokens": 42456476.0, "step": 16760 }, { "entropy": 6.355844640731812, "epoch": 1.934795152914022, "grad_norm": 1.0859375, "learning_rate": 0.00046342396553987155, "loss": 5.7991, "mean_token_accuracy": 0.19460918456315995, "num_tokens": 42468875.0, "step": 16765 }, { "entropy": 6.318538808822632, "epoch": 1.9353721869590306, "grad_norm": 0.92578125, "learning_rate": 0.00046340141018532186, "loss": 5.7436, "mean_token_accuracy": 0.19695119559764862, "num_tokens": 42483300.0, "step": 16770 }, { "entropy": 6.241217947006225, "epoch": 1.9359492210040392, "grad_norm": 0.91015625, "learning_rate": 0.0004633788484939843, "loss": 5.8172, "mean_token_accuracy": 0.19264088720083236, "num_tokens": 42497748.0, "step": 16775 }, { "entropy": 6.202336645126342, "epoch": 1.9365262550490479, "grad_norm": 0.84375, "learning_rate": 0.00046335628046661776, "loss": 5.8135, "mean_token_accuracy": 0.1930590033531189, "num_tokens": 42510464.0, "step": 16780 }, { "entropy": 6.34554967880249, "epoch": 1.9371032890940567, "grad_norm": 0.9609375, "learning_rate": 0.00046333370610398135, "loss": 5.8634, "mean_token_accuracy": 0.18837577253580093, "num_tokens": 42522298.0, "step": 16785 }, { "entropy": 6.321823215484619, "epoch": 1.9376803231390651, "grad_norm": 0.8984375, "learning_rate": 0.0004633111254068342, "loss": 5.732, "mean_token_accuracy": 0.20026923716068268, "num_tokens": 42535094.0, "step": 16790 }, { "entropy": 6.171190404891968, "epoch": 1.938257357184074, "grad_norm": 0.921875, "learning_rate": 0.0004632885383759359, "loss": 5.7286, "mean_token_accuracy": 0.20176013112068175, "num_tokens": 42547272.0, "step": 16795 }, { "entropy": 6.122797870635987, "epoch": 1.9388343912290824, "grad_norm": 0.890625, "learning_rate": 0.00046326594501204624, "loss": 5.6462, "mean_token_accuracy": 0.20535439550876616, "num_tokens": 42559568.0, "step": 16800 }, { "entropy": 6.31897931098938, "epoch": 1.9394114252740913, "grad_norm": 0.92578125, "learning_rate": 0.000463243345315925, "loss": 5.7954, "mean_token_accuracy": 0.19426541924476623, "num_tokens": 42573177.0, "step": 16805 }, { "entropy": 6.238536357879639, "epoch": 1.9399884593190997, "grad_norm": 0.90625, "learning_rate": 0.00046322073928833224, "loss": 5.7324, "mean_token_accuracy": 0.19810742139816284, "num_tokens": 42585436.0, "step": 16810 }, { "entropy": 6.25981593132019, "epoch": 1.9405654933641086, "grad_norm": 0.890625, "learning_rate": 0.0004631981269300285, "loss": 5.7486, "mean_token_accuracy": 0.19752792567014693, "num_tokens": 42599826.0, "step": 16815 }, { "entropy": 6.23888201713562, "epoch": 1.9411425274091172, "grad_norm": 0.90625, "learning_rate": 0.0004631755082417742, "loss": 5.7861, "mean_token_accuracy": 0.19362489581108094, "num_tokens": 42613901.0, "step": 16820 }, { "entropy": 6.338619804382324, "epoch": 1.9417195614541258, "grad_norm": 0.92578125, "learning_rate": 0.0004631528832243302, "loss": 5.7823, "mean_token_accuracy": 0.193868550658226, "num_tokens": 42626592.0, "step": 16825 }, { "entropy": 6.2455222606658936, "epoch": 1.9422965954991345, "grad_norm": 0.96875, "learning_rate": 0.00046313025187845735, "loss": 5.7098, "mean_token_accuracy": 0.2027307316660881, "num_tokens": 42639754.0, "step": 16830 }, { "entropy": 6.237716293334961, "epoch": 1.942873629544143, "grad_norm": 0.97265625, "learning_rate": 0.00046310761420491705, "loss": 5.694, "mean_token_accuracy": 0.2055831789970398, "num_tokens": 42651321.0, "step": 16835 }, { "entropy": 6.281747102737427, "epoch": 1.9434506635891518, "grad_norm": 0.87109375, "learning_rate": 0.0004630849702044705, "loss": 5.7825, "mean_token_accuracy": 0.1963137060403824, "num_tokens": 42664188.0, "step": 16840 }, { "entropy": 6.190065813064575, "epoch": 1.9440276976341604, "grad_norm": 0.8984375, "learning_rate": 0.00046306231987787937, "loss": 5.7493, "mean_token_accuracy": 0.1937461093068123, "num_tokens": 42677882.0, "step": 16845 }, { "entropy": 6.177444744110107, "epoch": 1.944604731679169, "grad_norm": 1.015625, "learning_rate": 0.00046303966322590556, "loss": 5.6669, "mean_token_accuracy": 0.2031422659754753, "num_tokens": 42690595.0, "step": 16850 }, { "entropy": 6.147070264816284, "epoch": 1.9451817657241777, "grad_norm": 1.0625, "learning_rate": 0.0004630170002493111, "loss": 5.6277, "mean_token_accuracy": 0.205380442738533, "num_tokens": 42704784.0, "step": 16855 }, { "entropy": 6.207528877258301, "epoch": 1.9457587997691865, "grad_norm": 0.890625, "learning_rate": 0.00046299433094885826, "loss": 5.7333, "mean_token_accuracy": 0.1969046950340271, "num_tokens": 42717012.0, "step": 16860 }, { "entropy": 6.309299516677856, "epoch": 1.946335833814195, "grad_norm": 0.91015625, "learning_rate": 0.00046297165532530944, "loss": 5.7849, "mean_token_accuracy": 0.1904382139444351, "num_tokens": 42728879.0, "step": 16865 }, { "entropy": 6.261871433258056, "epoch": 1.9469128678592038, "grad_norm": 0.94140625, "learning_rate": 0.0004629489733794274, "loss": 5.793, "mean_token_accuracy": 0.19949239790439605, "num_tokens": 42742688.0, "step": 16870 }, { "entropy": 6.28302321434021, "epoch": 1.9474899019042122, "grad_norm": 0.96484375, "learning_rate": 0.000462926285111975, "loss": 5.744, "mean_token_accuracy": 0.19738974422216415, "num_tokens": 42754955.0, "step": 16875 }, { "entropy": 6.240672779083252, "epoch": 1.948066935949221, "grad_norm": 0.9609375, "learning_rate": 0.00046290359052371535, "loss": 5.8072, "mean_token_accuracy": 0.19272707402706146, "num_tokens": 42767760.0, "step": 16880 }, { "entropy": 6.249153757095337, "epoch": 1.9486439699942295, "grad_norm": 0.9375, "learning_rate": 0.0004628808896154117, "loss": 5.765, "mean_token_accuracy": 0.1935882583260536, "num_tokens": 42779683.0, "step": 16885 }, { "entropy": 6.273938417434692, "epoch": 1.9492210040392384, "grad_norm": 0.87109375, "learning_rate": 0.0004628581823878277, "loss": 5.7644, "mean_token_accuracy": 0.1917514681816101, "num_tokens": 42791289.0, "step": 16890 }, { "entropy": 6.281899070739746, "epoch": 1.949798038084247, "grad_norm": 1.0, "learning_rate": 0.000462835468841727, "loss": 5.8156, "mean_token_accuracy": 0.19286248087882996, "num_tokens": 42803318.0, "step": 16895 }, { "entropy": 6.225988864898682, "epoch": 1.9503750721292556, "grad_norm": 0.95703125, "learning_rate": 0.0004628127489778737, "loss": 5.7822, "mean_token_accuracy": 0.19895075708627702, "num_tokens": 42815935.0, "step": 16900 }, { "entropy": 6.2690986633300785, "epoch": 1.9509521061742643, "grad_norm": 1.0, "learning_rate": 0.0004627900227970318, "loss": 5.7592, "mean_token_accuracy": 0.2022063061594963, "num_tokens": 42827759.0, "step": 16905 }, { "entropy": 6.2387683391571045, "epoch": 1.951529140219273, "grad_norm": 0.921875, "learning_rate": 0.00046276729029996576, "loss": 5.7649, "mean_token_accuracy": 0.19421954751014708, "num_tokens": 42840479.0, "step": 16910 }, { "entropy": 6.255968284606934, "epoch": 1.9521061742642816, "grad_norm": 0.859375, "learning_rate": 0.00046274455148744025, "loss": 5.8335, "mean_token_accuracy": 0.1934561923146248, "num_tokens": 42853972.0, "step": 16915 }, { "entropy": 6.2588348388671875, "epoch": 1.9526832083092902, "grad_norm": 0.93359375, "learning_rate": 0.00046272180636022, "loss": 5.7313, "mean_token_accuracy": 0.2022838994860649, "num_tokens": 42866192.0, "step": 16920 }, { "entropy": 6.218838548660278, "epoch": 1.953260242354299, "grad_norm": 0.98046875, "learning_rate": 0.00046269905491907, "loss": 5.7531, "mean_token_accuracy": 0.20053910315036774, "num_tokens": 42878661.0, "step": 16925 }, { "entropy": 6.17126088142395, "epoch": 1.9538372763993075, "grad_norm": 0.921875, "learning_rate": 0.0004626762971647555, "loss": 5.7495, "mean_token_accuracy": 0.1976466402411461, "num_tokens": 42891498.0, "step": 16930 }, { "entropy": 6.24580078125, "epoch": 1.9544143104443163, "grad_norm": 0.94140625, "learning_rate": 0.00046265353309804205, "loss": 5.6829, "mean_token_accuracy": 0.20284637361764907, "num_tokens": 42904657.0, "step": 16935 }, { "entropy": 6.273250246047974, "epoch": 1.9549913444893248, "grad_norm": 0.921875, "learning_rate": 0.0004626307627196952, "loss": 5.7381, "mean_token_accuracy": 0.20008694678544997, "num_tokens": 42916824.0, "step": 16940 }, { "entropy": 6.279068374633789, "epoch": 1.9555683785343336, "grad_norm": 0.8828125, "learning_rate": 0.0004626079860304808, "loss": 5.8076, "mean_token_accuracy": 0.20154052823781968, "num_tokens": 42929366.0, "step": 16945 }, { "entropy": 6.146010112762451, "epoch": 1.956145412579342, "grad_norm": 0.8828125, "learning_rate": 0.00046258520303116496, "loss": 5.649, "mean_token_accuracy": 0.20451925396919252, "num_tokens": 42941955.0, "step": 16950 }, { "entropy": 6.277160882949829, "epoch": 1.956722446624351, "grad_norm": 0.97265625, "learning_rate": 0.0004625624137225141, "loss": 5.8494, "mean_token_accuracy": 0.18529517501592635, "num_tokens": 42954302.0, "step": 16955 }, { "entropy": 6.32279372215271, "epoch": 1.9572994806693593, "grad_norm": 0.93359375, "learning_rate": 0.0004625396181052945, "loss": 5.7328, "mean_token_accuracy": 0.19855155050754547, "num_tokens": 42967225.0, "step": 16960 }, { "entropy": 6.244097757339477, "epoch": 1.9578765147143682, "grad_norm": 0.9375, "learning_rate": 0.00046251681618027316, "loss": 5.7671, "mean_token_accuracy": 0.2019764319062233, "num_tokens": 42981388.0, "step": 16965 }, { "entropy": 6.2767432689666744, "epoch": 1.9584535487593768, "grad_norm": 0.97265625, "learning_rate": 0.0004624940079482167, "loss": 5.7902, "mean_token_accuracy": 0.1942693993449211, "num_tokens": 42993110.0, "step": 16970 }, { "entropy": 6.224786043167114, "epoch": 1.9590305828043855, "grad_norm": 0.94921875, "learning_rate": 0.00046247119340989254, "loss": 5.7964, "mean_token_accuracy": 0.18906237035989762, "num_tokens": 43007309.0, "step": 16975 }, { "entropy": 6.243825435638428, "epoch": 1.959607616849394, "grad_norm": 0.984375, "learning_rate": 0.0004624483725660678, "loss": 5.6601, "mean_token_accuracy": 0.21698321104049684, "num_tokens": 43020813.0, "step": 16980 }, { "entropy": 6.279694986343384, "epoch": 1.9601846508944027, "grad_norm": 0.91015625, "learning_rate": 0.0004624255454175102, "loss": 5.7775, "mean_token_accuracy": 0.19770735502243042, "num_tokens": 43033357.0, "step": 16985 }, { "entropy": 6.240402030944824, "epoch": 1.9607616849394114, "grad_norm": 0.953125, "learning_rate": 0.0004624027119649875, "loss": 5.8401, "mean_token_accuracy": 0.19352957457304001, "num_tokens": 43046685.0, "step": 16990 }, { "entropy": 6.277683067321777, "epoch": 1.96133871898442, "grad_norm": 0.90625, "learning_rate": 0.00046237987220926766, "loss": 5.8113, "mean_token_accuracy": 0.19058777391910553, "num_tokens": 43059670.0, "step": 16995 }, { "entropy": 6.229287195205688, "epoch": 1.9619157530294289, "grad_norm": 0.92578125, "learning_rate": 0.00046235702615111886, "loss": 5.6756, "mean_token_accuracy": 0.20468678921461106, "num_tokens": 43073515.0, "step": 17000 }, { "entropy": 6.26941409111023, "epoch": 1.9624927870744373, "grad_norm": 0.8671875, "learning_rate": 0.0004623341737913096, "loss": 5.7838, "mean_token_accuracy": 0.19650481641292572, "num_tokens": 43086046.0, "step": 17005 }, { "entropy": 6.222126197814942, "epoch": 1.9630698211194462, "grad_norm": 0.8671875, "learning_rate": 0.0004623113151306085, "loss": 5.6846, "mean_token_accuracy": 0.19888866394758226, "num_tokens": 43097703.0, "step": 17010 }, { "entropy": 6.213971853256226, "epoch": 1.9636468551644546, "grad_norm": 0.984375, "learning_rate": 0.00046228845016978425, "loss": 5.7542, "mean_token_accuracy": 0.19422128796577454, "num_tokens": 43110378.0, "step": 17015 }, { "entropy": 6.270879411697388, "epoch": 1.9642238892094634, "grad_norm": 0.95703125, "learning_rate": 0.0004622655789096061, "loss": 5.7468, "mean_token_accuracy": 0.19963121861219407, "num_tokens": 43122978.0, "step": 17020 }, { "entropy": 6.333521223068237, "epoch": 1.9648009232544719, "grad_norm": 0.96875, "learning_rate": 0.00046224270135084315, "loss": 5.8301, "mean_token_accuracy": 0.19587821811437606, "num_tokens": 43135371.0, "step": 17025 }, { "entropy": 6.176549243927002, "epoch": 1.9653779572994807, "grad_norm": 0.9296875, "learning_rate": 0.00046221981749426503, "loss": 5.7494, "mean_token_accuracy": 0.195055790245533, "num_tokens": 43147251.0, "step": 17030 }, { "entropy": 6.231923294067383, "epoch": 1.9659549913444894, "grad_norm": 0.9140625, "learning_rate": 0.00046219692734064124, "loss": 5.728, "mean_token_accuracy": 0.19381537437438964, "num_tokens": 43160276.0, "step": 17035 }, { "entropy": 6.3147297382354735, "epoch": 1.966532025389498, "grad_norm": 0.98046875, "learning_rate": 0.0004621740308907419, "loss": 5.7714, "mean_token_accuracy": 0.19927388578653335, "num_tokens": 43172443.0, "step": 17040 }, { "entropy": 6.29047212600708, "epoch": 1.9671090594345066, "grad_norm": 0.88671875, "learning_rate": 0.0004621511281453369, "loss": 5.8044, "mean_token_accuracy": 0.19463059306144714, "num_tokens": 43186350.0, "step": 17045 }, { "entropy": 6.209466171264649, "epoch": 1.9676860934795153, "grad_norm": 0.890625, "learning_rate": 0.0004621282191051967, "loss": 5.7387, "mean_token_accuracy": 0.2009575068950653, "num_tokens": 43198936.0, "step": 17050 }, { "entropy": 6.32681713104248, "epoch": 1.968263127524524, "grad_norm": 0.98046875, "learning_rate": 0.0004621053037710918, "loss": 5.7827, "mean_token_accuracy": 0.19598435312509538, "num_tokens": 43211793.0, "step": 17055 }, { "entropy": 6.263002681732178, "epoch": 1.9688401615695326, "grad_norm": 0.8984375, "learning_rate": 0.000462082382143793, "loss": 5.7579, "mean_token_accuracy": 0.19923101365566254, "num_tokens": 43223817.0, "step": 17060 }, { "entropy": 6.261463308334351, "epoch": 1.9694171956145412, "grad_norm": 0.953125, "learning_rate": 0.00046205945422407113, "loss": 5.7671, "mean_token_accuracy": 0.1999775692820549, "num_tokens": 43235769.0, "step": 17065 }, { "entropy": 6.275276851654053, "epoch": 1.9699942296595498, "grad_norm": 0.99609375, "learning_rate": 0.00046203652001269754, "loss": 5.7892, "mean_token_accuracy": 0.19710277765989304, "num_tokens": 43249309.0, "step": 17070 }, { "entropy": 6.237096548080444, "epoch": 1.9705712637045587, "grad_norm": 0.98046875, "learning_rate": 0.00046201357951044337, "loss": 5.7608, "mean_token_accuracy": 0.19623759686946868, "num_tokens": 43262814.0, "step": 17075 }, { "entropy": 6.283816623687744, "epoch": 1.9711482977495671, "grad_norm": 0.98828125, "learning_rate": 0.00046199063271808047, "loss": 5.8196, "mean_token_accuracy": 0.19353357702493668, "num_tokens": 43276898.0, "step": 17080 }, { "entropy": 6.243425130844116, "epoch": 1.971725331794576, "grad_norm": 0.9296875, "learning_rate": 0.0004619676796363804, "loss": 5.7573, "mean_token_accuracy": 0.2017611876130104, "num_tokens": 43288902.0, "step": 17085 }, { "entropy": 6.289148283004761, "epoch": 1.9723023658395844, "grad_norm": 0.99609375, "learning_rate": 0.00046194472026611546, "loss": 5.7532, "mean_token_accuracy": 0.1987377718091011, "num_tokens": 43301644.0, "step": 17090 }, { "entropy": 6.246998453140259, "epoch": 1.9728793998845933, "grad_norm": 0.98046875, "learning_rate": 0.0004619217546080576, "loss": 5.7426, "mean_token_accuracy": 0.19673261046409607, "num_tokens": 43315550.0, "step": 17095 }, { "entropy": 6.379453182220459, "epoch": 1.9734564339296017, "grad_norm": 0.90234375, "learning_rate": 0.0004618987826629794, "loss": 5.855, "mean_token_accuracy": 0.18522174060344695, "num_tokens": 43328095.0, "step": 17100 }, { "entropy": 6.251423120498657, "epoch": 1.9740334679746105, "grad_norm": 0.8828125, "learning_rate": 0.00046187580443165344, "loss": 5.7599, "mean_token_accuracy": 0.20047521889209746, "num_tokens": 43340461.0, "step": 17105 }, { "entropy": 6.297940587997436, "epoch": 1.9746105020196192, "grad_norm": 0.90234375, "learning_rate": 0.0004618528199148527, "loss": 5.7534, "mean_token_accuracy": 0.2036628544330597, "num_tokens": 43352322.0, "step": 17110 }, { "entropy": 6.291927099227905, "epoch": 1.9751875360646278, "grad_norm": 1.609375, "learning_rate": 0.00046182982911335016, "loss": 5.7743, "mean_token_accuracy": 0.19787712693214415, "num_tokens": 43366212.0, "step": 17115 }, { "entropy": 6.322417783737182, "epoch": 1.9757645701096365, "grad_norm": 0.92578125, "learning_rate": 0.00046180683202791905, "loss": 5.8686, "mean_token_accuracy": 0.19052491784095765, "num_tokens": 43379123.0, "step": 17120 }, { "entropy": 6.338251638412475, "epoch": 1.976341604154645, "grad_norm": 0.83203125, "learning_rate": 0.000461783828659333, "loss": 5.8762, "mean_token_accuracy": 0.18852563202381134, "num_tokens": 43393188.0, "step": 17125 }, { "entropy": 6.377630805969238, "epoch": 1.9769186381996537, "grad_norm": 0.9453125, "learning_rate": 0.00046176081900836565, "loss": 5.7829, "mean_token_accuracy": 0.19455361515283584, "num_tokens": 43407448.0, "step": 17130 }, { "entropy": 6.2423668384552, "epoch": 1.9774956722446624, "grad_norm": 0.9375, "learning_rate": 0.00046173780307579086, "loss": 5.7254, "mean_token_accuracy": 0.19675862044095993, "num_tokens": 43420202.0, "step": 17135 }, { "entropy": 6.218957424163818, "epoch": 1.9780727062896712, "grad_norm": 1.140625, "learning_rate": 0.0004617147808623829, "loss": 5.7939, "mean_token_accuracy": 0.18706247061491013, "num_tokens": 43433218.0, "step": 17140 }, { "entropy": 6.2471057891845705, "epoch": 1.9786497403346797, "grad_norm": 0.96484375, "learning_rate": 0.00046169175236891605, "loss": 5.7828, "mean_token_accuracy": 0.19302263110876083, "num_tokens": 43445721.0, "step": 17145 }, { "entropy": 6.32406005859375, "epoch": 1.9792267743796885, "grad_norm": 0.91015625, "learning_rate": 0.0004616687175961648, "loss": 5.7908, "mean_token_accuracy": 0.19397074580192566, "num_tokens": 43457470.0, "step": 17150 }, { "entropy": 6.276082611083984, "epoch": 1.979803808424697, "grad_norm": 0.89453125, "learning_rate": 0.0004616456765449039, "loss": 5.7838, "mean_token_accuracy": 0.20368654876947404, "num_tokens": 43470693.0, "step": 17155 }, { "entropy": 6.248766613006592, "epoch": 1.9803808424697058, "grad_norm": 0.99609375, "learning_rate": 0.00046162262921590845, "loss": 5.8039, "mean_token_accuracy": 0.19646263122558594, "num_tokens": 43482890.0, "step": 17160 }, { "entropy": 6.372063541412354, "epoch": 1.9809578765147142, "grad_norm": 0.8828125, "learning_rate": 0.0004615995756099535, "loss": 5.8375, "mean_token_accuracy": 0.18987953066825866, "num_tokens": 43495444.0, "step": 17165 }, { "entropy": 6.262853002548217, "epoch": 1.981534910559723, "grad_norm": 0.8984375, "learning_rate": 0.0004615765157278146, "loss": 5.7935, "mean_token_accuracy": 0.19052637368440628, "num_tokens": 43507415.0, "step": 17170 }, { "entropy": 6.274124622344971, "epoch": 1.9821119446047317, "grad_norm": 0.9375, "learning_rate": 0.00046155344957026726, "loss": 5.813, "mean_token_accuracy": 0.19190335720777513, "num_tokens": 43520832.0, "step": 17175 }, { "entropy": 6.275217294692993, "epoch": 1.9826889786497404, "grad_norm": 0.89453125, "learning_rate": 0.0004615303771380873, "loss": 5.7534, "mean_token_accuracy": 0.1979634016752243, "num_tokens": 43534459.0, "step": 17180 }, { "entropy": 6.1655778884887695, "epoch": 1.983266012694749, "grad_norm": 1.0234375, "learning_rate": 0.00046150729843205077, "loss": 5.5974, "mean_token_accuracy": 0.20756071358919143, "num_tokens": 43546466.0, "step": 17185 }, { "entropy": 6.217870903015137, "epoch": 1.9838430467397576, "grad_norm": 0.953125, "learning_rate": 0.00046148421345293384, "loss": 5.6775, "mean_token_accuracy": 0.2055698052048683, "num_tokens": 43558285.0, "step": 17190 }, { "entropy": 6.171381568908691, "epoch": 1.9844200807847663, "grad_norm": 0.87890625, "learning_rate": 0.0004614611222015131, "loss": 5.6587, "mean_token_accuracy": 0.20381601601839067, "num_tokens": 43572117.0, "step": 17195 }, { "entropy": 6.258411312103272, "epoch": 1.984997114829775, "grad_norm": 1.96875, "learning_rate": 0.00046143802467856507, "loss": 5.8139, "mean_token_accuracy": 0.1962540939450264, "num_tokens": 43586951.0, "step": 17200 }, { "entropy": 6.271241092681885, "epoch": 1.9855741488747836, "grad_norm": 0.91015625, "learning_rate": 0.00046141492088486673, "loss": 5.6846, "mean_token_accuracy": 0.2100219815969467, "num_tokens": 43600542.0, "step": 17205 }, { "entropy": 6.2649232864379885, "epoch": 1.9861511829197922, "grad_norm": 0.93359375, "learning_rate": 0.0004613918108211951, "loss": 5.78, "mean_token_accuracy": 0.19840521961450577, "num_tokens": 43612928.0, "step": 17210 }, { "entropy": 6.304554271697998, "epoch": 1.986728216964801, "grad_norm": 0.87109375, "learning_rate": 0.0004613686944883275, "loss": 5.7714, "mean_token_accuracy": 0.1991189256310463, "num_tokens": 43625362.0, "step": 17215 }, { "entropy": 6.205133724212646, "epoch": 1.9873052510098095, "grad_norm": 0.8359375, "learning_rate": 0.00046134557188704146, "loss": 5.7749, "mean_token_accuracy": 0.20026649087667464, "num_tokens": 43638165.0, "step": 17220 }, { "entropy": 6.192930030822754, "epoch": 1.9878822850548183, "grad_norm": 0.94140625, "learning_rate": 0.00046132244301811466, "loss": 5.7093, "mean_token_accuracy": 0.19966957122087478, "num_tokens": 43650688.0, "step": 17225 }, { "entropy": 6.329173803329468, "epoch": 1.9884593190998268, "grad_norm": 0.953125, "learning_rate": 0.00046129930788232497, "loss": 5.8168, "mean_token_accuracy": 0.19335910826921462, "num_tokens": 43663168.0, "step": 17230 }, { "entropy": 6.296715450286865, "epoch": 1.9890363531448356, "grad_norm": 0.90234375, "learning_rate": 0.00046127616648045073, "loss": 5.7725, "mean_token_accuracy": 0.1897001937031746, "num_tokens": 43676391.0, "step": 17235 }, { "entropy": 6.32203950881958, "epoch": 1.989613387189844, "grad_norm": 0.8984375, "learning_rate": 0.00046125301881327007, "loss": 5.7157, "mean_token_accuracy": 0.20050082802772523, "num_tokens": 43689631.0, "step": 17240 }, { "entropy": 6.231979131698608, "epoch": 1.990190421234853, "grad_norm": 1.1875, "learning_rate": 0.00046122986488156167, "loss": 5.7623, "mean_token_accuracy": 0.1993554025888443, "num_tokens": 43703176.0, "step": 17245 }, { "entropy": 6.319428777694702, "epoch": 1.9907674552798615, "grad_norm": 0.8828125, "learning_rate": 0.00046120670468610426, "loss": 5.8701, "mean_token_accuracy": 0.188443386554718, "num_tokens": 43717439.0, "step": 17250 }, { "entropy": 6.282275867462158, "epoch": 1.9913444893248702, "grad_norm": 0.93359375, "learning_rate": 0.00046118353822767683, "loss": 5.7261, "mean_token_accuracy": 0.1940552920103073, "num_tokens": 43730500.0, "step": 17255 }, { "entropy": 6.191128492355347, "epoch": 1.9919215233698788, "grad_norm": 0.9140625, "learning_rate": 0.0004611603655070586, "loss": 5.6687, "mean_token_accuracy": 0.20141230076551436, "num_tokens": 43744807.0, "step": 17260 }, { "entropy": 6.251776790618896, "epoch": 1.9924985574148875, "grad_norm": 0.96484375, "learning_rate": 0.00046113718652502896, "loss": 5.7171, "mean_token_accuracy": 0.20194613486528395, "num_tokens": 43756748.0, "step": 17265 }, { "entropy": 6.261544942855835, "epoch": 1.993075591459896, "grad_norm": 0.890625, "learning_rate": 0.0004611140012823675, "loss": 5.8213, "mean_token_accuracy": 0.1938079223036766, "num_tokens": 43769309.0, "step": 17270 }, { "entropy": 6.259779262542724, "epoch": 1.9936526255049047, "grad_norm": 0.91015625, "learning_rate": 0.00046109080977985395, "loss": 5.7859, "mean_token_accuracy": 0.19742500483989717, "num_tokens": 43781057.0, "step": 17275 }, { "entropy": 6.273036813735962, "epoch": 1.9942296595499136, "grad_norm": 0.84765625, "learning_rate": 0.00046106761201826854, "loss": 5.7762, "mean_token_accuracy": 0.1962513282895088, "num_tokens": 43794504.0, "step": 17280 }, { "entropy": 6.09191312789917, "epoch": 1.994806693594922, "grad_norm": 1.046875, "learning_rate": 0.00046104440799839145, "loss": 5.5921, "mean_token_accuracy": 0.21330432295799256, "num_tokens": 43810214.0, "step": 17285 }, { "entropy": 6.263599395751953, "epoch": 1.9953837276399309, "grad_norm": 1.0703125, "learning_rate": 0.000461021197721003, "loss": 5.7689, "mean_token_accuracy": 0.19516006261110305, "num_tokens": 43822197.0, "step": 17290 }, { "entropy": 6.319225835800171, "epoch": 1.9959607616849393, "grad_norm": 0.875, "learning_rate": 0.00046099798118688407, "loss": 5.7714, "mean_token_accuracy": 0.1970426231622696, "num_tokens": 43835585.0, "step": 17295 }, { "entropy": 6.279296588897705, "epoch": 1.9965377957299482, "grad_norm": 0.91796875, "learning_rate": 0.0004609747583968154, "loss": 5.7179, "mean_token_accuracy": 0.19605442583560945, "num_tokens": 43848542.0, "step": 17300 }, { "entropy": 6.251367807388306, "epoch": 1.9971148297749566, "grad_norm": 0.95703125, "learning_rate": 0.0004609515293515781, "loss": 5.7954, "mean_token_accuracy": 0.19522191137075423, "num_tokens": 43860717.0, "step": 17305 }, { "entropy": 6.326177597045898, "epoch": 1.9976918638199654, "grad_norm": 0.890625, "learning_rate": 0.0004609282940519535, "loss": 5.8277, "mean_token_accuracy": 0.19656899571418762, "num_tokens": 43873193.0, "step": 17310 }, { "entropy": 6.328842449188232, "epoch": 1.998268897864974, "grad_norm": 0.94140625, "learning_rate": 0.0004609050524987231, "loss": 5.8062, "mean_token_accuracy": 0.1906093955039978, "num_tokens": 43886241.0, "step": 17315 }, { "entropy": 6.262535762786865, "epoch": 1.9988459319099827, "grad_norm": 0.98828125, "learning_rate": 0.0004608818046926686, "loss": 5.7307, "mean_token_accuracy": 0.2026408925652504, "num_tokens": 43899429.0, "step": 17320 }, { "entropy": 6.2589469909667965, "epoch": 1.9994229659549914, "grad_norm": 0.91796875, "learning_rate": 0.0004608585506345719, "loss": 5.7517, "mean_token_accuracy": 0.19680778086185455, "num_tokens": 43913073.0, "step": 17325 }, { "entropy": 6.259429550170898, "epoch": 2.0, "grad_norm": 0.9140625, "learning_rate": 0.0004608352903252152, "loss": 5.7745, "mean_token_accuracy": 0.19805550575256348, "num_tokens": 43926234.0, "step": 17330 }, { "entropy": 6.2702301979064945, "epoch": 2.000577034045009, "grad_norm": 0.9453125, "learning_rate": 0.00046081202376538084, "loss": 5.7334, "mean_token_accuracy": 0.19711553305387497, "num_tokens": 43937787.0, "step": 17335 }, { "entropy": 6.249440240859985, "epoch": 2.0011540680900173, "grad_norm": 0.93359375, "learning_rate": 0.0004607887509558513, "loss": 5.7267, "mean_token_accuracy": 0.19739107191562652, "num_tokens": 43951429.0, "step": 17340 }, { "entropy": 6.297765922546387, "epoch": 2.001731102135026, "grad_norm": 0.9765625, "learning_rate": 0.0004607654718974094, "loss": 5.7265, "mean_token_accuracy": 0.20845312774181365, "num_tokens": 43964257.0, "step": 17345 }, { "entropy": 6.3072456359863285, "epoch": 2.0023081361800346, "grad_norm": 0.96484375, "learning_rate": 0.0004607421865908382, "loss": 5.6704, "mean_token_accuracy": 0.1962365910410881, "num_tokens": 43975995.0, "step": 17350 }, { "entropy": 6.21532130241394, "epoch": 2.0028851702250434, "grad_norm": 0.92578125, "learning_rate": 0.0004607188950369207, "loss": 5.6302, "mean_token_accuracy": 0.2015035480260849, "num_tokens": 43989191.0, "step": 17355 }, { "entropy": 6.310169506072998, "epoch": 2.003462204270052, "grad_norm": 0.98828125, "learning_rate": 0.0004606955972364405, "loss": 5.741, "mean_token_accuracy": 0.1927739202976227, "num_tokens": 44000583.0, "step": 17360 }, { "entropy": 6.1655200004577635, "epoch": 2.0040392383150607, "grad_norm": 0.9140625, "learning_rate": 0.0004606722931901812, "loss": 5.5746, "mean_token_accuracy": 0.213130159676075, "num_tokens": 44013894.0, "step": 17365 }, { "entropy": 6.234589576721191, "epoch": 2.004616272360069, "grad_norm": 0.90625, "learning_rate": 0.0004606489828989264, "loss": 5.6487, "mean_token_accuracy": 0.20046643614768983, "num_tokens": 44026701.0, "step": 17370 }, { "entropy": 6.233416175842285, "epoch": 2.005193306405078, "grad_norm": 2.890625, "learning_rate": 0.0004606256663634604, "loss": 5.7082, "mean_token_accuracy": 0.2018497332930565, "num_tokens": 44039775.0, "step": 17375 }, { "entropy": 6.285129690170288, "epoch": 2.0057703404500864, "grad_norm": 0.87890625, "learning_rate": 0.0004606023435845672, "loss": 5.7138, "mean_token_accuracy": 0.19541945606470107, "num_tokens": 44052352.0, "step": 17380 }, { "entropy": 6.250522422790527, "epoch": 2.0063473744950953, "grad_norm": 1.0, "learning_rate": 0.0004605790145630314, "loss": 5.6477, "mean_token_accuracy": 0.20282730013132094, "num_tokens": 44066147.0, "step": 17385 }, { "entropy": 6.255536270141602, "epoch": 2.0069244085401037, "grad_norm": 0.96484375, "learning_rate": 0.0004605556792996377, "loss": 5.6965, "mean_token_accuracy": 0.19819739013910292, "num_tokens": 44078692.0, "step": 17390 }, { "entropy": 6.340232467651367, "epoch": 2.0075014425851125, "grad_norm": 0.9453125, "learning_rate": 0.0004605323377951709, "loss": 5.7362, "mean_token_accuracy": 0.19044993668794633, "num_tokens": 44091511.0, "step": 17395 }, { "entropy": 6.270852994918823, "epoch": 2.008078476630121, "grad_norm": 0.90625, "learning_rate": 0.000460508990050416, "loss": 5.6915, "mean_token_accuracy": 0.195805923640728, "num_tokens": 44103423.0, "step": 17400 }, { "entropy": 6.149043035507202, "epoch": 2.00865551067513, "grad_norm": 0.91796875, "learning_rate": 0.0004604856360661584, "loss": 5.5513, "mean_token_accuracy": 0.2083790898323059, "num_tokens": 44116024.0, "step": 17405 }, { "entropy": 6.153539705276489, "epoch": 2.0092325447201387, "grad_norm": 0.875, "learning_rate": 0.0004604622758431835, "loss": 5.624, "mean_token_accuracy": 0.20394142121076583, "num_tokens": 44128595.0, "step": 17410 }, { "entropy": 6.3305881977081295, "epoch": 2.009809578765147, "grad_norm": 1.03125, "learning_rate": 0.00046043890938227724, "loss": 5.7351, "mean_token_accuracy": 0.19998015761375426, "num_tokens": 44140104.0, "step": 17415 }, { "entropy": 6.2825438499450685, "epoch": 2.010386612810156, "grad_norm": 1.0078125, "learning_rate": 0.00046041553668422526, "loss": 5.6918, "mean_token_accuracy": 0.2034749060869217, "num_tokens": 44152681.0, "step": 17420 }, { "entropy": 6.181905794143677, "epoch": 2.0109636468551644, "grad_norm": 0.91015625, "learning_rate": 0.00046039215774981376, "loss": 5.665, "mean_token_accuracy": 0.2073669031262398, "num_tokens": 44165728.0, "step": 17425 }, { "entropy": 6.301576805114746, "epoch": 2.0115406809001732, "grad_norm": 0.953125, "learning_rate": 0.00046036877257982917, "loss": 5.7453, "mean_token_accuracy": 0.19096045196056366, "num_tokens": 44178182.0, "step": 17430 }, { "entropy": 6.300556945800781, "epoch": 2.0121177149451817, "grad_norm": 0.94921875, "learning_rate": 0.000460345381175058, "loss": 5.6624, "mean_token_accuracy": 0.20269179046154023, "num_tokens": 44190954.0, "step": 17435 }, { "entropy": 6.262827301025391, "epoch": 2.0126947489901905, "grad_norm": 0.8828125, "learning_rate": 0.000460321983536287, "loss": 5.6572, "mean_token_accuracy": 0.20790137648582457, "num_tokens": 44204123.0, "step": 17440 }, { "entropy": 6.1826049327850345, "epoch": 2.013271783035199, "grad_norm": 1.21875, "learning_rate": 0.00046029857966430315, "loss": 5.6442, "mean_token_accuracy": 0.2049027442932129, "num_tokens": 44218656.0, "step": 17445 }, { "entropy": 6.227021884918213, "epoch": 2.013848817080208, "grad_norm": 0.984375, "learning_rate": 0.00046027516955989364, "loss": 5.6779, "mean_token_accuracy": 0.20515901893377303, "num_tokens": 44231191.0, "step": 17450 }, { "entropy": 6.304461097717285, "epoch": 2.014425851125216, "grad_norm": 0.90625, "learning_rate": 0.00046025175322384577, "loss": 5.695, "mean_token_accuracy": 0.2019312486052513, "num_tokens": 44244564.0, "step": 17455 }, { "entropy": 6.298606538772583, "epoch": 2.015002885170225, "grad_norm": 0.99609375, "learning_rate": 0.00046022833065694727, "loss": 5.7057, "mean_token_accuracy": 0.20222496688365937, "num_tokens": 44257545.0, "step": 17460 }, { "entropy": 6.224299478530884, "epoch": 2.0155799192152335, "grad_norm": 0.91015625, "learning_rate": 0.00046020490185998575, "loss": 5.6246, "mean_token_accuracy": 0.20759887993335724, "num_tokens": 44270416.0, "step": 17465 }, { "entropy": 6.2018883228302, "epoch": 2.0161569532602424, "grad_norm": 0.92578125, "learning_rate": 0.0004601814668337495, "loss": 5.6589, "mean_token_accuracy": 0.20551549792289733, "num_tokens": 44283366.0, "step": 17470 }, { "entropy": 6.226172876358032, "epoch": 2.016733987305251, "grad_norm": 0.921875, "learning_rate": 0.00046015802557902654, "loss": 5.7103, "mean_token_accuracy": 0.19451249092817308, "num_tokens": 44296079.0, "step": 17475 }, { "entropy": 6.285435914993286, "epoch": 2.0173110213502596, "grad_norm": 0.87890625, "learning_rate": 0.00046013457809660537, "loss": 5.6955, "mean_token_accuracy": 0.1941556990146637, "num_tokens": 44308409.0, "step": 17480 }, { "entropy": 6.292135524749756, "epoch": 2.0178880553952685, "grad_norm": 0.875, "learning_rate": 0.00046011112438727454, "loss": 5.7379, "mean_token_accuracy": 0.19877717196941375, "num_tokens": 44321826.0, "step": 17485 }, { "entropy": 6.256671524047851, "epoch": 2.018465089440277, "grad_norm": 0.9765625, "learning_rate": 0.0004600876644518231, "loss": 5.7023, "mean_token_accuracy": 0.198341403901577, "num_tokens": 44335630.0, "step": 17490 }, { "entropy": 6.040377807617188, "epoch": 2.0190421234852858, "grad_norm": 0.97265625, "learning_rate": 0.00046006419829104, "loss": 5.4867, "mean_token_accuracy": 0.2133197918534279, "num_tokens": 44349059.0, "step": 17495 }, { "entropy": 6.241903305053711, "epoch": 2.019619157530294, "grad_norm": 0.95703125, "learning_rate": 0.0004600407259057145, "loss": 5.5888, "mean_token_accuracy": 0.2037927582859993, "num_tokens": 44361908.0, "step": 17500 }, { "entropy": 6.257413721084594, "epoch": 2.020196191575303, "grad_norm": 0.87890625, "learning_rate": 0.0004600172472966361, "loss": 5.7417, "mean_token_accuracy": 0.18895848095417023, "num_tokens": 44375487.0, "step": 17505 }, { "entropy": 6.220084714889526, "epoch": 2.0207732256203115, "grad_norm": 1.0, "learning_rate": 0.00045999376246459446, "loss": 5.642, "mean_token_accuracy": 0.20260559767484665, "num_tokens": 44387881.0, "step": 17510 }, { "entropy": 6.247606992721558, "epoch": 2.0213502596653203, "grad_norm": 0.9375, "learning_rate": 0.0004599702714103795, "loss": 5.6491, "mean_token_accuracy": 0.1996355265378952, "num_tokens": 44400609.0, "step": 17515 }, { "entropy": 6.159318733215332, "epoch": 2.0219272937103288, "grad_norm": 0.99609375, "learning_rate": 0.0004599467741347814, "loss": 5.599, "mean_token_accuracy": 0.2111167222261429, "num_tokens": 44413341.0, "step": 17520 }, { "entropy": 6.272531366348266, "epoch": 2.0225043277553376, "grad_norm": 0.921875, "learning_rate": 0.0004599232706385904, "loss": 5.7392, "mean_token_accuracy": 0.20063333660364152, "num_tokens": 44425790.0, "step": 17525 }, { "entropy": 6.1971056938171385, "epoch": 2.023081361800346, "grad_norm": 0.9140625, "learning_rate": 0.000459899760922597, "loss": 5.6528, "mean_token_accuracy": 0.20446180999279023, "num_tokens": 44438204.0, "step": 17530 }, { "entropy": 6.2362587451934814, "epoch": 2.023658395845355, "grad_norm": 0.9140625, "learning_rate": 0.0004598762449875921, "loss": 5.6295, "mean_token_accuracy": 0.2001257747411728, "num_tokens": 44450717.0, "step": 17535 }, { "entropy": 6.257264757156372, "epoch": 2.0242354298903633, "grad_norm": 0.9140625, "learning_rate": 0.0004598527228343665, "loss": 5.6385, "mean_token_accuracy": 0.20419044196605682, "num_tokens": 44463391.0, "step": 17540 }, { "entropy": 6.196162414550781, "epoch": 2.024812463935372, "grad_norm": 0.9296875, "learning_rate": 0.0004598291944637112, "loss": 5.6029, "mean_token_accuracy": 0.2064843252301216, "num_tokens": 44477022.0, "step": 17545 }, { "entropy": 6.270995855331421, "epoch": 2.025389497980381, "grad_norm": 0.8359375, "learning_rate": 0.00045980565987641797, "loss": 5.7092, "mean_token_accuracy": 0.19913180619478227, "num_tokens": 44490616.0, "step": 17550 }, { "entropy": 6.2656354904174805, "epoch": 2.0259665320253895, "grad_norm": 0.93359375, "learning_rate": 0.00045978211907327804, "loss": 5.7152, "mean_token_accuracy": 0.19898659586906434, "num_tokens": 44503307.0, "step": 17555 }, { "entropy": 6.278667783737182, "epoch": 2.0265435660703983, "grad_norm": 0.9609375, "learning_rate": 0.0004597585720550834, "loss": 5.6925, "mean_token_accuracy": 0.20318609178066255, "num_tokens": 44516078.0, "step": 17560 }, { "entropy": 6.279894495010376, "epoch": 2.0271206001154067, "grad_norm": 0.93359375, "learning_rate": 0.000459735018822626, "loss": 5.6674, "mean_token_accuracy": 0.20145113617181779, "num_tokens": 44528485.0, "step": 17565 }, { "entropy": 6.2945067405700685, "epoch": 2.0276976341604156, "grad_norm": 1.015625, "learning_rate": 0.00045971145937669794, "loss": 5.6317, "mean_token_accuracy": 0.20258528739213943, "num_tokens": 44539946.0, "step": 17570 }, { "entropy": 6.19449815750122, "epoch": 2.028274668205424, "grad_norm": 0.98828125, "learning_rate": 0.0004596878937180917, "loss": 5.6912, "mean_token_accuracy": 0.19609050452709198, "num_tokens": 44552828.0, "step": 17575 }, { "entropy": 6.280514240264893, "epoch": 2.028851702250433, "grad_norm": 0.953125, "learning_rate": 0.0004596643218475999, "loss": 5.7072, "mean_token_accuracy": 0.20018178075551987, "num_tokens": 44564930.0, "step": 17580 }, { "entropy": 6.261544609069825, "epoch": 2.0294287362954413, "grad_norm": 0.91015625, "learning_rate": 0.00045964074376601534, "loss": 5.703, "mean_token_accuracy": 0.19716645330190657, "num_tokens": 44578226.0, "step": 17585 }, { "entropy": 6.227256774902344, "epoch": 2.03000577034045, "grad_norm": 0.94140625, "learning_rate": 0.00045961715947413106, "loss": 5.6875, "mean_token_accuracy": 0.20446657538414, "num_tokens": 44590704.0, "step": 17590 }, { "entropy": 6.264931344985962, "epoch": 2.0305828043854586, "grad_norm": 0.98046875, "learning_rate": 0.0004595935689727404, "loss": 5.6814, "mean_token_accuracy": 0.20432521104812623, "num_tokens": 44602758.0, "step": 17595 }, { "entropy": 6.119540214538574, "epoch": 2.0311598384304674, "grad_norm": 1.046875, "learning_rate": 0.0004595699722626367, "loss": 5.6584, "mean_token_accuracy": 0.20234377831220626, "num_tokens": 44614733.0, "step": 17600 }, { "entropy": 6.288922500610352, "epoch": 2.031736872475476, "grad_norm": 0.90625, "learning_rate": 0.00045954636934461367, "loss": 5.7345, "mean_token_accuracy": 0.19667449444532395, "num_tokens": 44628339.0, "step": 17605 }, { "entropy": 6.261105537414551, "epoch": 2.0323139065204847, "grad_norm": 0.984375, "learning_rate": 0.0004595227602194652, "loss": 5.6611, "mean_token_accuracy": 0.2022185817360878, "num_tokens": 44641382.0, "step": 17610 }, { "entropy": 6.185283756256103, "epoch": 2.0328909405654936, "grad_norm": 0.9609375, "learning_rate": 0.0004594991448879853, "loss": 5.6176, "mean_token_accuracy": 0.2082076221704483, "num_tokens": 44654618.0, "step": 17615 }, { "entropy": 6.333975410461425, "epoch": 2.033467974610502, "grad_norm": 0.99609375, "learning_rate": 0.0004594755233509683, "loss": 5.7901, "mean_token_accuracy": 0.18755829632282256, "num_tokens": 44667961.0, "step": 17620 }, { "entropy": 6.243668031692505, "epoch": 2.034045008655511, "grad_norm": 0.90625, "learning_rate": 0.00045945189560920875, "loss": 5.6792, "mean_token_accuracy": 0.19908062219619752, "num_tokens": 44682185.0, "step": 17625 }, { "entropy": 6.279232978820801, "epoch": 2.0346220427005193, "grad_norm": 0.9296875, "learning_rate": 0.0004594282616635013, "loss": 5.7007, "mean_token_accuracy": 0.20215352922677993, "num_tokens": 44695513.0, "step": 17630 }, { "entropy": 6.235209274291992, "epoch": 2.035199076745528, "grad_norm": 0.98828125, "learning_rate": 0.0004594046215146409, "loss": 5.7065, "mean_token_accuracy": 0.2029103457927704, "num_tokens": 44707051.0, "step": 17635 }, { "entropy": 6.230711984634399, "epoch": 2.0357761107905366, "grad_norm": 0.96875, "learning_rate": 0.00045938097516342257, "loss": 5.6739, "mean_token_accuracy": 0.2068231835961342, "num_tokens": 44719915.0, "step": 17640 }, { "entropy": 6.116800594329834, "epoch": 2.0363531448355454, "grad_norm": 0.9609375, "learning_rate": 0.00045935732261064184, "loss": 5.57, "mean_token_accuracy": 0.21224127411842347, "num_tokens": 44733115.0, "step": 17645 }, { "entropy": 6.2326884269714355, "epoch": 2.036930178880554, "grad_norm": 1.0078125, "learning_rate": 0.00045933366385709405, "loss": 5.7019, "mean_token_accuracy": 0.20067428946495056, "num_tokens": 44744480.0, "step": 17650 }, { "entropy": 6.285044431686401, "epoch": 2.0375072129255627, "grad_norm": 0.9609375, "learning_rate": 0.0004593099989035751, "loss": 5.7403, "mean_token_accuracy": 0.1993875503540039, "num_tokens": 44758200.0, "step": 17655 }, { "entropy": 6.3262560844421385, "epoch": 2.038084246970571, "grad_norm": 0.89453125, "learning_rate": 0.0004592863277508809, "loss": 5.7758, "mean_token_accuracy": 0.1939818263053894, "num_tokens": 44771407.0, "step": 17660 }, { "entropy": 6.25794620513916, "epoch": 2.03866128101558, "grad_norm": 0.98828125, "learning_rate": 0.0004592626503998076, "loss": 5.6232, "mean_token_accuracy": 0.20941001623868943, "num_tokens": 44783765.0, "step": 17665 }, { "entropy": 6.296916103363037, "epoch": 2.0392383150605884, "grad_norm": 0.97265625, "learning_rate": 0.0004592389668511515, "loss": 5.7197, "mean_token_accuracy": 0.20150339752435684, "num_tokens": 44796550.0, "step": 17670 }, { "entropy": 6.217992353439331, "epoch": 2.0398153491055973, "grad_norm": 0.9453125, "learning_rate": 0.0004592152771057093, "loss": 5.7022, "mean_token_accuracy": 0.2003367841243744, "num_tokens": 44808802.0, "step": 17675 }, { "entropy": 6.215272855758667, "epoch": 2.0403923831506057, "grad_norm": 0.9609375, "learning_rate": 0.00045919158116427785, "loss": 5.638, "mean_token_accuracy": 0.20298593789339064, "num_tokens": 44821023.0, "step": 17680 }, { "entropy": 6.254412078857422, "epoch": 2.0409694171956145, "grad_norm": 1.0, "learning_rate": 0.00045916787902765396, "loss": 5.6491, "mean_token_accuracy": 0.19988745003938674, "num_tokens": 44833822.0, "step": 17685 }, { "entropy": 6.23627610206604, "epoch": 2.0415464512406234, "grad_norm": 0.98046875, "learning_rate": 0.0004591441706966349, "loss": 5.6825, "mean_token_accuracy": 0.1998839184641838, "num_tokens": 44846440.0, "step": 17690 }, { "entropy": 6.276790714263916, "epoch": 2.042123485285632, "grad_norm": 0.94140625, "learning_rate": 0.0004591204561720183, "loss": 5.6926, "mean_token_accuracy": 0.19255058020353316, "num_tokens": 44858257.0, "step": 17695 }, { "entropy": 6.261844110488892, "epoch": 2.0427005193306407, "grad_norm": 0.875, "learning_rate": 0.0004590967354546015, "loss": 5.7283, "mean_token_accuracy": 0.1950898662209511, "num_tokens": 44871339.0, "step": 17700 }, { "entropy": 6.237417697906494, "epoch": 2.043277553375649, "grad_norm": 0.93359375, "learning_rate": 0.0004590730085451824, "loss": 5.6583, "mean_token_accuracy": 0.2076822802424431, "num_tokens": 44884190.0, "step": 17705 }, { "entropy": 6.1819751262664795, "epoch": 2.043854587420658, "grad_norm": 0.95703125, "learning_rate": 0.00045904927544455914, "loss": 5.5837, "mean_token_accuracy": 0.20263769328594208, "num_tokens": 44897530.0, "step": 17710 }, { "entropy": 6.191201496124267, "epoch": 2.0444316214656664, "grad_norm": 0.95703125, "learning_rate": 0.00045902553615353005, "loss": 5.564, "mean_token_accuracy": 0.21978026032447814, "num_tokens": 44910428.0, "step": 17715 }, { "entropy": 6.256063032150268, "epoch": 2.0450086555106752, "grad_norm": 0.8984375, "learning_rate": 0.0004590017906728933, "loss": 5.6913, "mean_token_accuracy": 0.19929961115121841, "num_tokens": 44922904.0, "step": 17720 }, { "entropy": 6.164769124984741, "epoch": 2.0455856895556837, "grad_norm": 0.9375, "learning_rate": 0.00045897803900344774, "loss": 5.5864, "mean_token_accuracy": 0.20878782421350478, "num_tokens": 44935541.0, "step": 17725 }, { "entropy": 6.212556028366089, "epoch": 2.0461627236006925, "grad_norm": 0.90625, "learning_rate": 0.0004589542811459923, "loss": 5.6593, "mean_token_accuracy": 0.2079017162322998, "num_tokens": 44948483.0, "step": 17730 }, { "entropy": 6.228823947906494, "epoch": 2.046739757645701, "grad_norm": 0.984375, "learning_rate": 0.0004589305171013259, "loss": 5.6415, "mean_token_accuracy": 0.2076267421245575, "num_tokens": 44961797.0, "step": 17735 }, { "entropy": 6.2405421257019045, "epoch": 2.04731679169071, "grad_norm": 0.9609375, "learning_rate": 0.000458906746870248, "loss": 5.6364, "mean_token_accuracy": 0.20770105421543122, "num_tokens": 44975426.0, "step": 17740 }, { "entropy": 6.236284351348877, "epoch": 2.047893825735718, "grad_norm": 0.984375, "learning_rate": 0.000458882970453558, "loss": 5.6621, "mean_token_accuracy": 0.20310534834861754, "num_tokens": 44988272.0, "step": 17745 }, { "entropy": 6.204120826721192, "epoch": 2.048470859780727, "grad_norm": 0.94921875, "learning_rate": 0.0004588591878520556, "loss": 5.6221, "mean_token_accuracy": 0.2064763769507408, "num_tokens": 45000609.0, "step": 17750 }, { "entropy": 6.364516687393189, "epoch": 2.049047893825736, "grad_norm": 1.0078125, "learning_rate": 0.0004588353990665407, "loss": 5.7849, "mean_token_accuracy": 0.1859120637178421, "num_tokens": 45012651.0, "step": 17755 }, { "entropy": 6.253702116012573, "epoch": 2.0496249278707444, "grad_norm": 1.0, "learning_rate": 0.0004588116040978136, "loss": 5.727, "mean_token_accuracy": 0.20087929517030717, "num_tokens": 45025237.0, "step": 17760 }, { "entropy": 6.250041151046753, "epoch": 2.050201961915753, "grad_norm": 0.87890625, "learning_rate": 0.00045878780294667437, "loss": 5.7408, "mean_token_accuracy": 0.1949314743280411, "num_tokens": 45038329.0, "step": 17765 }, { "entropy": 6.277400636672974, "epoch": 2.0507789959607616, "grad_norm": 0.953125, "learning_rate": 0.0004587639956139237, "loss": 5.6204, "mean_token_accuracy": 0.2077370211482048, "num_tokens": 45050251.0, "step": 17770 }, { "entropy": 6.254482460021973, "epoch": 2.0513560300057705, "grad_norm": 1.0, "learning_rate": 0.0004587401821003624, "loss": 5.7033, "mean_token_accuracy": 0.1997854605317116, "num_tokens": 45062701.0, "step": 17775 }, { "entropy": 6.180520868301391, "epoch": 2.051933064050779, "grad_norm": 0.8984375, "learning_rate": 0.00045871636240679133, "loss": 5.6361, "mean_token_accuracy": 0.21148186773061753, "num_tokens": 45077059.0, "step": 17780 }, { "entropy": 6.262282276153565, "epoch": 2.0525100980957878, "grad_norm": 0.94140625, "learning_rate": 0.0004586925365340117, "loss": 5.6733, "mean_token_accuracy": 0.1936696618795395, "num_tokens": 45089571.0, "step": 17785 }, { "entropy": 6.203660869598389, "epoch": 2.053087132140796, "grad_norm": 1.0234375, "learning_rate": 0.0004586687044828247, "loss": 5.6444, "mean_token_accuracy": 0.20130022913217543, "num_tokens": 45101085.0, "step": 17790 }, { "entropy": 6.230860996246338, "epoch": 2.053664166185805, "grad_norm": 0.95703125, "learning_rate": 0.0004586448662540322, "loss": 5.7041, "mean_token_accuracy": 0.19646845906972885, "num_tokens": 45113844.0, "step": 17795 }, { "entropy": 6.234907388687134, "epoch": 2.0542412002308135, "grad_norm": 0.921875, "learning_rate": 0.0004586210218484358, "loss": 5.7351, "mean_token_accuracy": 0.19803052842617036, "num_tokens": 45126297.0, "step": 17800 }, { "entropy": 6.268433570861816, "epoch": 2.0548182342758223, "grad_norm": 0.9921875, "learning_rate": 0.00045859717126683745, "loss": 5.5848, "mean_token_accuracy": 0.2124189928174019, "num_tokens": 45139337.0, "step": 17805 }, { "entropy": 6.254764461517334, "epoch": 2.0553952683208307, "grad_norm": 0.96484375, "learning_rate": 0.00045857331451003953, "loss": 5.7644, "mean_token_accuracy": 0.18940299451351167, "num_tokens": 45151698.0, "step": 17810 }, { "entropy": 6.168803453445435, "epoch": 2.0559723023658396, "grad_norm": 0.9296875, "learning_rate": 0.00045854945157884435, "loss": 5.6336, "mean_token_accuracy": 0.20379126965999603, "num_tokens": 45164615.0, "step": 17815 }, { "entropy": 6.227227401733399, "epoch": 2.056549336410848, "grad_norm": 0.9765625, "learning_rate": 0.00045852558247405455, "loss": 5.6802, "mean_token_accuracy": 0.2069242015480995, "num_tokens": 45176630.0, "step": 17820 }, { "entropy": 6.247831106185913, "epoch": 2.057126370455857, "grad_norm": 0.92578125, "learning_rate": 0.00045850170719647287, "loss": 5.6404, "mean_token_accuracy": 0.20814504474401474, "num_tokens": 45188879.0, "step": 17825 }, { "entropy": 6.256878614425659, "epoch": 2.0577034045008658, "grad_norm": 0.921875, "learning_rate": 0.00045847782574690254, "loss": 5.6535, "mean_token_accuracy": 0.20146367996931075, "num_tokens": 45201694.0, "step": 17830 }, { "entropy": 6.211376094818116, "epoch": 2.058280438545874, "grad_norm": 0.93359375, "learning_rate": 0.00045845393812614664, "loss": 5.6302, "mean_token_accuracy": 0.19902247041463852, "num_tokens": 45215873.0, "step": 17835 }, { "entropy": 6.303824377059937, "epoch": 2.058857472590883, "grad_norm": 0.9609375, "learning_rate": 0.0004584300443350086, "loss": 5.6714, "mean_token_accuracy": 0.20408975183963776, "num_tokens": 45229660.0, "step": 17840 }, { "entropy": 6.2332484245300295, "epoch": 2.0594345066358914, "grad_norm": 0.98046875, "learning_rate": 0.0004584061443742922, "loss": 5.6223, "mean_token_accuracy": 0.19964006692171096, "num_tokens": 45243257.0, "step": 17845 }, { "entropy": 6.192412042617798, "epoch": 2.0600115406809003, "grad_norm": 1.0078125, "learning_rate": 0.00045838223824480124, "loss": 5.6241, "mean_token_accuracy": 0.20478377789258956, "num_tokens": 45256212.0, "step": 17850 }, { "entropy": 6.274218940734864, "epoch": 2.0605885747259087, "grad_norm": 0.84375, "learning_rate": 0.0004583583259473397, "loss": 5.6856, "mean_token_accuracy": 0.2076691582798958, "num_tokens": 45268292.0, "step": 17855 }, { "entropy": 6.105169582366943, "epoch": 2.0611656087709176, "grad_norm": 0.96875, "learning_rate": 0.00045833440748271203, "loss": 5.5239, "mean_token_accuracy": 0.22912171930074693, "num_tokens": 45284112.0, "step": 17860 }, { "entropy": 6.246973180770874, "epoch": 2.061742642815926, "grad_norm": 0.921875, "learning_rate": 0.00045831048285172266, "loss": 5.6515, "mean_token_accuracy": 0.20367234200239182, "num_tokens": 45295839.0, "step": 17865 }, { "entropy": 6.171870565414428, "epoch": 2.062319676860935, "grad_norm": 0.89453125, "learning_rate": 0.0004582865520551762, "loss": 5.6701, "mean_token_accuracy": 0.19572561234235764, "num_tokens": 45309142.0, "step": 17870 }, { "entropy": 6.244421911239624, "epoch": 2.0628967109059433, "grad_norm": 0.95703125, "learning_rate": 0.00045826261509387755, "loss": 5.6564, "mean_token_accuracy": 0.21014538258314133, "num_tokens": 45322096.0, "step": 17875 }, { "entropy": 6.287837028503418, "epoch": 2.063473744950952, "grad_norm": 1.03125, "learning_rate": 0.00045823867196863197, "loss": 5.7293, "mean_token_accuracy": 0.20398633629083635, "num_tokens": 45333685.0, "step": 17880 }, { "entropy": 6.210242366790771, "epoch": 2.0640507789959606, "grad_norm": 0.953125, "learning_rate": 0.0004582147226802446, "loss": 5.6763, "mean_token_accuracy": 0.20469199120998383, "num_tokens": 45345417.0, "step": 17885 }, { "entropy": 6.220725202560425, "epoch": 2.0646278130409694, "grad_norm": 0.94140625, "learning_rate": 0.0004581907672295211, "loss": 5.7159, "mean_token_accuracy": 0.19976982325315476, "num_tokens": 45357156.0, "step": 17890 }, { "entropy": 6.291027307510376, "epoch": 2.065204847085978, "grad_norm": 0.9609375, "learning_rate": 0.00045816680561726716, "loss": 5.6847, "mean_token_accuracy": 0.1986474186182022, "num_tokens": 45369627.0, "step": 17895 }, { "entropy": 6.234702730178833, "epoch": 2.0657818811309867, "grad_norm": 0.98046875, "learning_rate": 0.0004581428378442886, "loss": 5.6624, "mean_token_accuracy": 0.19629377871751785, "num_tokens": 45380603.0, "step": 17900 }, { "entropy": 6.188916254043579, "epoch": 2.0663589151759956, "grad_norm": 0.83984375, "learning_rate": 0.00045811886391139173, "loss": 5.6211, "mean_token_accuracy": 0.21858908087015153, "num_tokens": 45394923.0, "step": 17905 }, { "entropy": 6.277084445953369, "epoch": 2.066935949221004, "grad_norm": 0.92578125, "learning_rate": 0.00045809488381938284, "loss": 5.6794, "mean_token_accuracy": 0.19687334448099136, "num_tokens": 45407351.0, "step": 17910 }, { "entropy": 6.161598968505859, "epoch": 2.067512983266013, "grad_norm": 0.921875, "learning_rate": 0.0004580708975690684, "loss": 5.6493, "mean_token_accuracy": 0.20021425932645798, "num_tokens": 45420783.0, "step": 17915 }, { "entropy": 6.197072887420655, "epoch": 2.0680900173110213, "grad_norm": 0.953125, "learning_rate": 0.0004580469051612554, "loss": 5.5548, "mean_token_accuracy": 0.2188750311732292, "num_tokens": 45433208.0, "step": 17920 }, { "entropy": 6.294715929031372, "epoch": 2.06866705135603, "grad_norm": 0.90625, "learning_rate": 0.00045802290659675057, "loss": 5.8009, "mean_token_accuracy": 0.18830355405807495, "num_tokens": 45445872.0, "step": 17925 }, { "entropy": 6.255209302902221, "epoch": 2.0692440854010385, "grad_norm": 0.98828125, "learning_rate": 0.00045799890187636123, "loss": 5.6859, "mean_token_accuracy": 0.20325401276350022, "num_tokens": 45458844.0, "step": 17930 }, { "entropy": 6.223239803314209, "epoch": 2.0698211194460474, "grad_norm": 0.91796875, "learning_rate": 0.00045797489100089464, "loss": 5.6922, "mean_token_accuracy": 0.2008743941783905, "num_tokens": 45471919.0, "step": 17935 }, { "entropy": 6.23684606552124, "epoch": 2.070398153491056, "grad_norm": 1.0, "learning_rate": 0.0004579508739711585, "loss": 5.6973, "mean_token_accuracy": 0.20341706275939941, "num_tokens": 45483769.0, "step": 17940 }, { "entropy": 6.298162937164307, "epoch": 2.0709751875360647, "grad_norm": 0.9765625, "learning_rate": 0.00045792685078796075, "loss": 5.7812, "mean_token_accuracy": 0.19754380136728286, "num_tokens": 45497077.0, "step": 17945 }, { "entropy": 6.258854103088379, "epoch": 2.071552221581073, "grad_norm": 1.015625, "learning_rate": 0.000457902821452109, "loss": 5.7308, "mean_token_accuracy": 0.20346533358097077, "num_tokens": 45509229.0, "step": 17950 }, { "entropy": 6.259493160247803, "epoch": 2.072129255626082, "grad_norm": 0.9140625, "learning_rate": 0.00045787878596441193, "loss": 5.6678, "mean_token_accuracy": 0.20220885127782823, "num_tokens": 45521654.0, "step": 17955 }, { "entropy": 6.260926580429077, "epoch": 2.0727062896710904, "grad_norm": 0.96484375, "learning_rate": 0.0004578547443256776, "loss": 5.7121, "mean_token_accuracy": 0.19537041634321212, "num_tokens": 45533488.0, "step": 17960 }, { "entropy": 6.268562984466553, "epoch": 2.0732833237160992, "grad_norm": 0.93359375, "learning_rate": 0.0004578306965367148, "loss": 5.6245, "mean_token_accuracy": 0.20668937861919404, "num_tokens": 45544938.0, "step": 17965 }, { "entropy": 6.247487020492554, "epoch": 2.073860357761108, "grad_norm": 0.96875, "learning_rate": 0.00045780664259833235, "loss": 5.6844, "mean_token_accuracy": 0.20103041976690292, "num_tokens": 45557085.0, "step": 17970 }, { "entropy": 6.240365791320801, "epoch": 2.0744373918061165, "grad_norm": 0.9453125, "learning_rate": 0.00045778258251133924, "loss": 5.6562, "mean_token_accuracy": 0.20293182879686356, "num_tokens": 45570174.0, "step": 17975 }, { "entropy": 6.269809722900391, "epoch": 2.0750144258511254, "grad_norm": 0.99609375, "learning_rate": 0.00045775851627654474, "loss": 5.6711, "mean_token_accuracy": 0.20361365973949433, "num_tokens": 45582174.0, "step": 17980 }, { "entropy": 6.240131282806397, "epoch": 2.075591459896134, "grad_norm": 0.90625, "learning_rate": 0.0004577344438947584, "loss": 5.7361, "mean_token_accuracy": 0.19098032414913177, "num_tokens": 45595732.0, "step": 17985 }, { "entropy": 6.214056825637817, "epoch": 2.0761684939411427, "grad_norm": 0.90234375, "learning_rate": 0.00045771036536678984, "loss": 5.6625, "mean_token_accuracy": 0.20121949464082717, "num_tokens": 45609675.0, "step": 17990 }, { "entropy": 6.315131139755249, "epoch": 2.076745527986151, "grad_norm": 0.8828125, "learning_rate": 0.00045768628069344885, "loss": 5.7055, "mean_token_accuracy": 0.19686917960643768, "num_tokens": 45622467.0, "step": 17995 }, { "entropy": 6.263897705078125, "epoch": 2.07732256203116, "grad_norm": 1.0078125, "learning_rate": 0.0004576621898755455, "loss": 5.739, "mean_token_accuracy": 0.19382344782352448, "num_tokens": 45636246.0, "step": 18000 }, { "epoch": 2.07732256203116, "eval_entropy": 6.069619185822167, "eval_loss": 5.804035663604736, "eval_mean_token_accuracy": 0.20375993807384635, "eval_num_tokens": 45636246.0, "eval_runtime": 17.5172, "eval_samples_per_second": 1606.191, "eval_steps_per_second": 200.774, "step": 18000 }, { "entropy": 6.246134519577026, "epoch": 2.0778995960761684, "grad_norm": 0.9765625, "learning_rate": 0.00045763809291389024, "loss": 5.6481, "mean_token_accuracy": 0.20348013937473297, "num_tokens": 45649127.0, "step": 18005 }, { "entropy": 6.264445734024048, "epoch": 2.0784766301211772, "grad_norm": 0.9453125, "learning_rate": 0.0004576139898092933, "loss": 5.6794, "mean_token_accuracy": 0.19997181594371796, "num_tokens": 45661633.0, "step": 18010 }, { "entropy": 6.222084331512451, "epoch": 2.0790536641661856, "grad_norm": 0.921875, "learning_rate": 0.0004575898805625657, "loss": 5.6185, "mean_token_accuracy": 0.20518322587013244, "num_tokens": 45673643.0, "step": 18015 }, { "entropy": 6.335010671615601, "epoch": 2.0796306982111945, "grad_norm": 0.92578125, "learning_rate": 0.00045756576517451804, "loss": 5.7725, "mean_token_accuracy": 0.19150546044111252, "num_tokens": 45686125.0, "step": 18020 }, { "entropy": 6.257683420181275, "epoch": 2.080207732256203, "grad_norm": 0.95703125, "learning_rate": 0.00045754164364596156, "loss": 5.6225, "mean_token_accuracy": 0.20368454307317735, "num_tokens": 45697919.0, "step": 18025 }, { "entropy": 6.219502353668213, "epoch": 2.080784766301212, "grad_norm": 0.94921875, "learning_rate": 0.0004575175159777076, "loss": 5.7023, "mean_token_accuracy": 0.19955314546823502, "num_tokens": 45709450.0, "step": 18030 }, { "entropy": 6.245679044723511, "epoch": 2.0813618003462206, "grad_norm": 0.97265625, "learning_rate": 0.0004574933821705676, "loss": 5.6477, "mean_token_accuracy": 0.20409499555826188, "num_tokens": 45721464.0, "step": 18035 }, { "entropy": 6.304778718948365, "epoch": 2.081938834391229, "grad_norm": 0.9921875, "learning_rate": 0.0004574692422253534, "loss": 5.7526, "mean_token_accuracy": 0.19708194881677626, "num_tokens": 45733397.0, "step": 18040 }, { "entropy": 6.216876220703125, "epoch": 2.082515868436238, "grad_norm": 0.91015625, "learning_rate": 0.00045744509614287687, "loss": 5.7058, "mean_token_accuracy": 0.19746667742729188, "num_tokens": 45744953.0, "step": 18045 }, { "entropy": 6.250694465637207, "epoch": 2.0830929024812463, "grad_norm": 0.9765625, "learning_rate": 0.0004574209439239501, "loss": 5.6636, "mean_token_accuracy": 0.20134249180555344, "num_tokens": 45756914.0, "step": 18050 }, { "entropy": 6.23657341003418, "epoch": 2.083669936526255, "grad_norm": 0.91015625, "learning_rate": 0.00045739678556938563, "loss": 5.6809, "mean_token_accuracy": 0.21226089149713517, "num_tokens": 45770888.0, "step": 18055 }, { "entropy": 6.235244607925415, "epoch": 2.0842469705712636, "grad_norm": 0.9375, "learning_rate": 0.00045737262107999575, "loss": 5.6767, "mean_token_accuracy": 0.2019466146826744, "num_tokens": 45783551.0, "step": 18060 }, { "entropy": 6.26384391784668, "epoch": 2.0848240046162725, "grad_norm": 0.984375, "learning_rate": 0.0004573484504565934, "loss": 5.6601, "mean_token_accuracy": 0.20924518406391143, "num_tokens": 45795700.0, "step": 18065 }, { "entropy": 6.19308066368103, "epoch": 2.085401038661281, "grad_norm": 0.87890625, "learning_rate": 0.0004573242736999915, "loss": 5.6641, "mean_token_accuracy": 0.20257942378520966, "num_tokens": 45808414.0, "step": 18070 }, { "entropy": 6.195266485214233, "epoch": 2.0859780727062898, "grad_norm": 0.9609375, "learning_rate": 0.00045730009081100314, "loss": 5.614, "mean_token_accuracy": 0.2057153984904289, "num_tokens": 45821710.0, "step": 18075 }, { "entropy": 6.121374559402466, "epoch": 2.086555106751298, "grad_norm": 0.96875, "learning_rate": 0.00045727590179044195, "loss": 5.6034, "mean_token_accuracy": 0.20624669641256332, "num_tokens": 45835812.0, "step": 18080 }, { "entropy": 6.274444627761841, "epoch": 2.087132140796307, "grad_norm": 1.015625, "learning_rate": 0.0004572517066391211, "loss": 5.6767, "mean_token_accuracy": 0.20413774400949478, "num_tokens": 45849076.0, "step": 18085 }, { "entropy": 6.242035007476806, "epoch": 2.0877091748413155, "grad_norm": 0.99609375, "learning_rate": 0.00045722750535785484, "loss": 5.6815, "mean_token_accuracy": 0.20116450935602187, "num_tokens": 45861375.0, "step": 18090 }, { "entropy": 6.2057653903961185, "epoch": 2.0882862088863243, "grad_norm": 1.0625, "learning_rate": 0.00045720329794745685, "loss": 5.6527, "mean_token_accuracy": 0.2060537040233612, "num_tokens": 45872096.0, "step": 18095 }, { "entropy": 6.1792665958404545, "epoch": 2.0888632429313327, "grad_norm": 0.9921875, "learning_rate": 0.0004571790844087415, "loss": 5.5907, "mean_token_accuracy": 0.21414544433355331, "num_tokens": 45884843.0, "step": 18100 }, { "entropy": 6.267030906677246, "epoch": 2.0894402769763416, "grad_norm": 0.9609375, "learning_rate": 0.0004571548647425231, "loss": 5.6587, "mean_token_accuracy": 0.19904158115386963, "num_tokens": 45896644.0, "step": 18105 }, { "entropy": 6.324420690536499, "epoch": 2.0900173110213505, "grad_norm": 0.93359375, "learning_rate": 0.0004571306389496164, "loss": 5.7546, "mean_token_accuracy": 0.19744710773229598, "num_tokens": 45910204.0, "step": 18110 }, { "entropy": 6.239924144744873, "epoch": 2.090594345066359, "grad_norm": 1.03125, "learning_rate": 0.00045710640703083594, "loss": 5.6235, "mean_token_accuracy": 0.20362144559621811, "num_tokens": 45923332.0, "step": 18115 }, { "entropy": 6.175708246231079, "epoch": 2.0911713791113677, "grad_norm": 1.0234375, "learning_rate": 0.00045708216898699707, "loss": 5.669, "mean_token_accuracy": 0.21027057766914367, "num_tokens": 45937322.0, "step": 18120 }, { "entropy": 6.245549440383911, "epoch": 2.091748413156376, "grad_norm": 0.984375, "learning_rate": 0.00045705792481891483, "loss": 5.661, "mean_token_accuracy": 0.19952643513679505, "num_tokens": 45950369.0, "step": 18125 }, { "entropy": 6.313686466217041, "epoch": 2.092325447201385, "grad_norm": 0.9609375, "learning_rate": 0.00045703367452740477, "loss": 5.8022, "mean_token_accuracy": 0.19890412092208862, "num_tokens": 45963402.0, "step": 18130 }, { "entropy": 6.282650661468506, "epoch": 2.0929024812463934, "grad_norm": 0.90625, "learning_rate": 0.00045700941811328247, "loss": 5.7317, "mean_token_accuracy": 0.1945398658514023, "num_tokens": 45976979.0, "step": 18135 }, { "entropy": 6.272404193878174, "epoch": 2.0934795152914023, "grad_norm": 0.87890625, "learning_rate": 0.00045698515557736374, "loss": 5.7198, "mean_token_accuracy": 0.19928032010793686, "num_tokens": 45990334.0, "step": 18140 }, { "entropy": 6.185986185073853, "epoch": 2.0940565493364107, "grad_norm": 1.0078125, "learning_rate": 0.00045696088692046477, "loss": 5.6245, "mean_token_accuracy": 0.20934058129787445, "num_tokens": 46002322.0, "step": 18145 }, { "entropy": 6.240342664718628, "epoch": 2.0946335833814196, "grad_norm": 0.96875, "learning_rate": 0.00045693661214340174, "loss": 5.722, "mean_token_accuracy": 0.19595017284154892, "num_tokens": 46014136.0, "step": 18150 }, { "entropy": 6.332130861282349, "epoch": 2.095210617426428, "grad_norm": 0.98046875, "learning_rate": 0.00045691233124699117, "loss": 5.7533, "mean_token_accuracy": 0.19440668374300002, "num_tokens": 46026686.0, "step": 18155 }, { "entropy": 6.238727474212647, "epoch": 2.095787651471437, "grad_norm": 0.99609375, "learning_rate": 0.0004568880442320497, "loss": 5.6499, "mean_token_accuracy": 0.2080206796526909, "num_tokens": 46038462.0, "step": 18160 }, { "entropy": 6.305221891403198, "epoch": 2.0963646855164453, "grad_norm": 0.9375, "learning_rate": 0.00045686375109939417, "loss": 5.7261, "mean_token_accuracy": 0.19346963614225388, "num_tokens": 46051549.0, "step": 18165 }, { "entropy": 6.252967166900635, "epoch": 2.096941719561454, "grad_norm": 1.0390625, "learning_rate": 0.0004568394518498417, "loss": 5.693, "mean_token_accuracy": 0.20137814581394195, "num_tokens": 46065282.0, "step": 18170 }, { "entropy": 6.2782073497772215, "epoch": 2.0975187536064626, "grad_norm": 0.9375, "learning_rate": 0.00045681514648420965, "loss": 5.7062, "mean_token_accuracy": 0.19837625026702882, "num_tokens": 46077238.0, "step": 18175 }, { "entropy": 6.325450277328491, "epoch": 2.0980957876514714, "grad_norm": 0.9765625, "learning_rate": 0.0004567908350033154, "loss": 5.6915, "mean_token_accuracy": 0.2042577013373375, "num_tokens": 46089044.0, "step": 18180 }, { "entropy": 6.248745012283325, "epoch": 2.0986728216964803, "grad_norm": 1.0078125, "learning_rate": 0.0004567665174079767, "loss": 5.7329, "mean_token_accuracy": 0.20117929577827454, "num_tokens": 46101246.0, "step": 18185 }, { "entropy": 6.282928800582885, "epoch": 2.0992498557414887, "grad_norm": 0.9453125, "learning_rate": 0.00045674219369901153, "loss": 5.7487, "mean_token_accuracy": 0.19632016271352767, "num_tokens": 46112735.0, "step": 18190 }, { "entropy": 6.255322742462158, "epoch": 2.0998268897864976, "grad_norm": 0.90625, "learning_rate": 0.0004567178638772379, "loss": 5.802, "mean_token_accuracy": 0.19112858474254607, "num_tokens": 46125547.0, "step": 18195 }, { "entropy": 6.31384596824646, "epoch": 2.100403923831506, "grad_norm": 0.984375, "learning_rate": 0.0004566935279434742, "loss": 5.7593, "mean_token_accuracy": 0.19314925372600555, "num_tokens": 46137356.0, "step": 18200 }, { "entropy": 6.22183141708374, "epoch": 2.100980957876515, "grad_norm": 0.9140625, "learning_rate": 0.00045666918589853895, "loss": 5.6608, "mean_token_accuracy": 0.20413845479488374, "num_tokens": 46149935.0, "step": 18205 }, { "entropy": 6.188861894607544, "epoch": 2.1015579919215233, "grad_norm": 0.953125, "learning_rate": 0.00045664483774325094, "loss": 5.5989, "mean_token_accuracy": 0.2077876254916191, "num_tokens": 46162186.0, "step": 18210 }, { "entropy": 6.222089576721191, "epoch": 2.102135025966532, "grad_norm": 1.609375, "learning_rate": 0.0004566204834784289, "loss": 5.6059, "mean_token_accuracy": 0.20326893627643586, "num_tokens": 46175221.0, "step": 18215 }, { "entropy": 6.195293712615967, "epoch": 2.1027120600115405, "grad_norm": 0.9609375, "learning_rate": 0.00045659612310489225, "loss": 5.762, "mean_token_accuracy": 0.19867088049650192, "num_tokens": 46187898.0, "step": 18220 }, { "entropy": 6.246435070037842, "epoch": 2.1032890940565494, "grad_norm": 0.9453125, "learning_rate": 0.00045657175662346014, "loss": 5.665, "mean_token_accuracy": 0.20157117545604705, "num_tokens": 46200792.0, "step": 18225 }, { "entropy": 6.260198020935059, "epoch": 2.103866128101558, "grad_norm": 0.921875, "learning_rate": 0.0004565473840349522, "loss": 5.6957, "mean_token_accuracy": 0.19887917637825012, "num_tokens": 46213791.0, "step": 18230 }, { "entropy": 6.264036750793457, "epoch": 2.1044431621465667, "grad_norm": 0.984375, "learning_rate": 0.00045652300534018816, "loss": 5.6782, "mean_token_accuracy": 0.2033469021320343, "num_tokens": 46226229.0, "step": 18235 }, { "entropy": 6.277313184738159, "epoch": 2.105020196191575, "grad_norm": 0.99609375, "learning_rate": 0.000456498620539988, "loss": 5.6742, "mean_token_accuracy": 0.20586120039224626, "num_tokens": 46239253.0, "step": 18240 }, { "entropy": 6.210960912704468, "epoch": 2.105597230236584, "grad_norm": 1.015625, "learning_rate": 0.0004564742296351719, "loss": 5.7082, "mean_token_accuracy": 0.20025913417339325, "num_tokens": 46251578.0, "step": 18245 }, { "entropy": 6.309379816055298, "epoch": 2.106174264281593, "grad_norm": 0.91796875, "learning_rate": 0.00045644983262656014, "loss": 5.7046, "mean_token_accuracy": 0.20009643882513045, "num_tokens": 46265421.0, "step": 18250 }, { "entropy": 6.279318809509277, "epoch": 2.1067512983266012, "grad_norm": 0.9609375, "learning_rate": 0.0004564254295149735, "loss": 5.7543, "mean_token_accuracy": 0.19517963677644729, "num_tokens": 46277480.0, "step": 18255 }, { "entropy": 6.281505012512207, "epoch": 2.10732833237161, "grad_norm": 1.0078125, "learning_rate": 0.00045640102030123264, "loss": 5.7272, "mean_token_accuracy": 0.1994670122861862, "num_tokens": 46289793.0, "step": 18260 }, { "entropy": 6.272510528564453, "epoch": 2.1079053664166185, "grad_norm": 1.15625, "learning_rate": 0.00045637660498615865, "loss": 5.6853, "mean_token_accuracy": 0.20521128475666045, "num_tokens": 46301653.0, "step": 18265 }, { "entropy": 6.129175043106079, "epoch": 2.1084824004616274, "grad_norm": 0.95703125, "learning_rate": 0.0004563521835705725, "loss": 5.578, "mean_token_accuracy": 0.21452680677175523, "num_tokens": 46314368.0, "step": 18270 }, { "entropy": 6.310157346725464, "epoch": 2.109059434506636, "grad_norm": 0.92578125, "learning_rate": 0.00045632775605529587, "loss": 5.7247, "mean_token_accuracy": 0.19462078511714936, "num_tokens": 46327446.0, "step": 18275 }, { "entropy": 6.319844436645508, "epoch": 2.1096364685516447, "grad_norm": 1.0, "learning_rate": 0.0004563033224411501, "loss": 5.728, "mean_token_accuracy": 0.1939805880188942, "num_tokens": 46340370.0, "step": 18280 }, { "entropy": 6.22706356048584, "epoch": 2.110213502596653, "grad_norm": 0.9296875, "learning_rate": 0.0004562788827289572, "loss": 5.7025, "mean_token_accuracy": 0.20296211242675782, "num_tokens": 46352675.0, "step": 18285 }, { "entropy": 6.148489570617675, "epoch": 2.110790536641662, "grad_norm": 0.890625, "learning_rate": 0.00045625443691953914, "loss": 5.5886, "mean_token_accuracy": 0.20904678702354432, "num_tokens": 46365404.0, "step": 18290 }, { "entropy": 6.284792232513428, "epoch": 2.1113675706866704, "grad_norm": 0.90625, "learning_rate": 0.0004562299850137181, "loss": 5.652, "mean_token_accuracy": 0.20398799926042557, "num_tokens": 46377544.0, "step": 18295 }, { "entropy": 6.247260618209839, "epoch": 2.111944604731679, "grad_norm": 0.93359375, "learning_rate": 0.0004562055270123166, "loss": 5.7487, "mean_token_accuracy": 0.2020320326089859, "num_tokens": 46390425.0, "step": 18300 }, { "entropy": 6.210721588134765, "epoch": 2.1125216387766876, "grad_norm": 1.3203125, "learning_rate": 0.00045618106291615715, "loss": 5.6716, "mean_token_accuracy": 0.2000151827931404, "num_tokens": 46403359.0, "step": 18305 }, { "entropy": 6.296349716186524, "epoch": 2.1130986728216965, "grad_norm": 0.9921875, "learning_rate": 0.0004561565927260627, "loss": 5.7571, "mean_token_accuracy": 0.2024470806121826, "num_tokens": 46414700.0, "step": 18310 }, { "entropy": 6.317724514007568, "epoch": 2.1136757068667054, "grad_norm": 0.9921875, "learning_rate": 0.0004561321164428561, "loss": 5.7405, "mean_token_accuracy": 0.19626646637916564, "num_tokens": 46427199.0, "step": 18315 }, { "entropy": 6.291296052932739, "epoch": 2.114252740911714, "grad_norm": 0.95703125, "learning_rate": 0.0004561076340673609, "loss": 5.6788, "mean_token_accuracy": 0.2070443406701088, "num_tokens": 46440143.0, "step": 18320 }, { "entropy": 6.296773862838745, "epoch": 2.1148297749567226, "grad_norm": 0.90234375, "learning_rate": 0.0004560831456004003, "loss": 5.6809, "mean_token_accuracy": 0.19323974549770356, "num_tokens": 46452868.0, "step": 18325 }, { "entropy": 6.2290812015533445, "epoch": 2.115406809001731, "grad_norm": 0.99609375, "learning_rate": 0.0004560586510427981, "loss": 5.5906, "mean_token_accuracy": 0.21004874557256697, "num_tokens": 46465648.0, "step": 18330 }, { "entropy": 6.190475177764893, "epoch": 2.11598384304674, "grad_norm": 0.97265625, "learning_rate": 0.0004560341503953781, "loss": 5.7048, "mean_token_accuracy": 0.20484923124313353, "num_tokens": 46478282.0, "step": 18335 }, { "entropy": 6.218627786636352, "epoch": 2.1165608770917483, "grad_norm": 1.0078125, "learning_rate": 0.0004560096436589643, "loss": 5.6113, "mean_token_accuracy": 0.2062837600708008, "num_tokens": 46490299.0, "step": 18340 }, { "entropy": 6.244489526748657, "epoch": 2.117137911136757, "grad_norm": 0.94921875, "learning_rate": 0.00045598513083438115, "loss": 5.6169, "mean_token_accuracy": 0.21169881969690324, "num_tokens": 46502165.0, "step": 18345 }, { "entropy": 6.214208650588989, "epoch": 2.1177149451817656, "grad_norm": 0.91796875, "learning_rate": 0.00045596061192245297, "loss": 5.7166, "mean_token_accuracy": 0.20201748758554458, "num_tokens": 46514954.0, "step": 18350 }, { "entropy": 6.290360975265503, "epoch": 2.1182919792267745, "grad_norm": 0.9609375, "learning_rate": 0.0004559360869240045, "loss": 5.7851, "mean_token_accuracy": 0.18993605077266693, "num_tokens": 46527088.0, "step": 18355 }, { "entropy": 6.313471698760987, "epoch": 2.118869013271783, "grad_norm": 0.9296875, "learning_rate": 0.0004559115558398606, "loss": 5.7399, "mean_token_accuracy": 0.19302885234355927, "num_tokens": 46538737.0, "step": 18360 }, { "entropy": 6.245953607559204, "epoch": 2.1194460473167918, "grad_norm": 0.88671875, "learning_rate": 0.0004558870186708465, "loss": 5.652, "mean_token_accuracy": 0.20305613279342652, "num_tokens": 46551963.0, "step": 18365 }, { "entropy": 6.245628738403321, "epoch": 2.1200230813618, "grad_norm": 0.91796875, "learning_rate": 0.00045586247541778724, "loss": 5.7255, "mean_token_accuracy": 0.20636988282203675, "num_tokens": 46564247.0, "step": 18370 }, { "entropy": 6.240551710128784, "epoch": 2.120600115406809, "grad_norm": 0.96875, "learning_rate": 0.0004558379260815085, "loss": 5.6995, "mean_token_accuracy": 0.20225383788347245, "num_tokens": 46578491.0, "step": 18375 }, { "entropy": 6.269914007186889, "epoch": 2.1211771494518175, "grad_norm": 0.9140625, "learning_rate": 0.0004558133706628359, "loss": 5.6906, "mean_token_accuracy": 0.20203321278095246, "num_tokens": 46591528.0, "step": 18380 }, { "entropy": 6.32675838470459, "epoch": 2.1217541834968263, "grad_norm": 0.9921875, "learning_rate": 0.00045578880916259554, "loss": 5.771, "mean_token_accuracy": 0.193904410302639, "num_tokens": 46605028.0, "step": 18385 }, { "entropy": 6.199621963500976, "epoch": 2.122331217541835, "grad_norm": 0.90625, "learning_rate": 0.0004557642415816132, "loss": 5.6377, "mean_token_accuracy": 0.2080541417002678, "num_tokens": 46617713.0, "step": 18390 }, { "entropy": 6.285545921325683, "epoch": 2.1229082515868436, "grad_norm": 0.91015625, "learning_rate": 0.0004557396679207155, "loss": 5.7865, "mean_token_accuracy": 0.19203791320323943, "num_tokens": 46631897.0, "step": 18395 }, { "entropy": 6.303127717971802, "epoch": 2.1234852856318525, "grad_norm": 0.97265625, "learning_rate": 0.00045571508818072887, "loss": 5.7481, "mean_token_accuracy": 0.19187881350517272, "num_tokens": 46645457.0, "step": 18400 }, { "entropy": 6.339938688278198, "epoch": 2.124062319676861, "grad_norm": 0.95703125, "learning_rate": 0.0004556905023624799, "loss": 5.7318, "mean_token_accuracy": 0.19835630059242249, "num_tokens": 46657779.0, "step": 18405 }, { "entropy": 6.2173059463500975, "epoch": 2.1246393537218697, "grad_norm": 0.91796875, "learning_rate": 0.00045566591046679577, "loss": 5.6775, "mean_token_accuracy": 0.2003285899758339, "num_tokens": 46670590.0, "step": 18410 }, { "entropy": 6.223220014572144, "epoch": 2.125216387766878, "grad_norm": 0.828125, "learning_rate": 0.00045564131249450343, "loss": 5.6518, "mean_token_accuracy": 0.20317054986953736, "num_tokens": 46683369.0, "step": 18415 }, { "entropy": 6.314276504516601, "epoch": 2.125793421811887, "grad_norm": 0.94140625, "learning_rate": 0.0004556167084464302, "loss": 5.6898, "mean_token_accuracy": 0.19398971945047377, "num_tokens": 46695371.0, "step": 18420 }, { "entropy": 6.185404968261719, "epoch": 2.1263704558568954, "grad_norm": 0.9609375, "learning_rate": 0.0004555920983234038, "loss": 5.6048, "mean_token_accuracy": 0.20488648414611815, "num_tokens": 46708422.0, "step": 18425 }, { "entropy": 6.131176233291626, "epoch": 2.1269474899019043, "grad_norm": 0.96484375, "learning_rate": 0.00045556748212625183, "loss": 5.5992, "mean_token_accuracy": 0.21085411310195923, "num_tokens": 46722236.0, "step": 18430 }, { "entropy": 6.335385847091675, "epoch": 2.1275245239469127, "grad_norm": 1.0390625, "learning_rate": 0.0004555428598558023, "loss": 5.6881, "mean_token_accuracy": 0.2015898957848549, "num_tokens": 46733084.0, "step": 18435 }, { "entropy": 6.235428047180176, "epoch": 2.1281015579919216, "grad_norm": 1.0390625, "learning_rate": 0.0004555182315128833, "loss": 5.6943, "mean_token_accuracy": 0.19690838754177092, "num_tokens": 46745174.0, "step": 18440 }, { "entropy": 6.291813564300537, "epoch": 2.12867859203693, "grad_norm": 0.95703125, "learning_rate": 0.0004554935970983234, "loss": 5.7371, "mean_token_accuracy": 0.20212126523256302, "num_tokens": 46758134.0, "step": 18445 }, { "entropy": 6.26134991645813, "epoch": 2.129255626081939, "grad_norm": 0.96484375, "learning_rate": 0.0004554689566129509, "loss": 5.6282, "mean_token_accuracy": 0.20178801715373992, "num_tokens": 46770941.0, "step": 18450 }, { "entropy": 6.253507900238037, "epoch": 2.1298326601269473, "grad_norm": 0.953125, "learning_rate": 0.00045544431005759467, "loss": 5.7037, "mean_token_accuracy": 0.20702736973762512, "num_tokens": 46782532.0, "step": 18455 }, { "entropy": 6.190967559814453, "epoch": 2.130409694171956, "grad_norm": 1.0234375, "learning_rate": 0.00045541965743308376, "loss": 5.6673, "mean_token_accuracy": 0.20353056937456132, "num_tokens": 46794636.0, "step": 18460 }, { "entropy": 6.23766188621521, "epoch": 2.130986728216965, "grad_norm": 0.84375, "learning_rate": 0.0004553949987402473, "loss": 5.7034, "mean_token_accuracy": 0.1964999184012413, "num_tokens": 46807797.0, "step": 18465 }, { "entropy": 6.3087376117706295, "epoch": 2.1315637622619734, "grad_norm": 0.9765625, "learning_rate": 0.0004553703339799146, "loss": 5.6631, "mean_token_accuracy": 0.1988433212041855, "num_tokens": 46819838.0, "step": 18470 }, { "entropy": 6.15626368522644, "epoch": 2.1321407963069823, "grad_norm": 0.9140625, "learning_rate": 0.0004553456631529154, "loss": 5.6281, "mean_token_accuracy": 0.20693209618330002, "num_tokens": 46832172.0, "step": 18475 }, { "entropy": 6.262816905975342, "epoch": 2.1327178303519907, "grad_norm": 0.953125, "learning_rate": 0.0004553209862600794, "loss": 5.7047, "mean_token_accuracy": 0.20258551687002183, "num_tokens": 46844457.0, "step": 18480 }, { "entropy": 6.217689561843872, "epoch": 2.1332948643969996, "grad_norm": 0.9609375, "learning_rate": 0.0004552963033022365, "loss": 5.6269, "mean_token_accuracy": 0.20258189141750335, "num_tokens": 46857256.0, "step": 18485 }, { "entropy": 6.245373678207398, "epoch": 2.133871898442008, "grad_norm": 0.98828125, "learning_rate": 0.00045527161428021706, "loss": 5.6878, "mean_token_accuracy": 0.2011040687561035, "num_tokens": 46870971.0, "step": 18490 }, { "entropy": 6.261890983581543, "epoch": 2.134448932487017, "grad_norm": 1.0390625, "learning_rate": 0.0004552469191948514, "loss": 5.6446, "mean_token_accuracy": 0.20959553867578506, "num_tokens": 46882911.0, "step": 18495 }, { "entropy": 6.253646564483643, "epoch": 2.1350259665320253, "grad_norm": 0.90625, "learning_rate": 0.0004552222180469702, "loss": 5.693, "mean_token_accuracy": 0.20216709077358247, "num_tokens": 46895927.0, "step": 18500 }, { "entropy": 6.187870836257934, "epoch": 2.135603000577034, "grad_norm": 0.96875, "learning_rate": 0.00045519751083740413, "loss": 5.6568, "mean_token_accuracy": 0.20425989031791686, "num_tokens": 46908210.0, "step": 18505 }, { "entropy": 6.299504232406616, "epoch": 2.1361800346220425, "grad_norm": 1.0, "learning_rate": 0.00045517279756698435, "loss": 5.7277, "mean_token_accuracy": 0.1984967589378357, "num_tokens": 46920197.0, "step": 18510 }, { "entropy": 6.272176742553711, "epoch": 2.1367570686670514, "grad_norm": 0.98828125, "learning_rate": 0.00045514807823654203, "loss": 5.6717, "mean_token_accuracy": 0.2022643879055977, "num_tokens": 46932628.0, "step": 18515 }, { "entropy": 6.2229221820831295, "epoch": 2.13733410271206, "grad_norm": 0.921875, "learning_rate": 0.0004551233528469086, "loss": 5.6484, "mean_token_accuracy": 0.20244522541761398, "num_tokens": 46945479.0, "step": 18520 }, { "entropy": 6.249539518356324, "epoch": 2.1379111367570687, "grad_norm": 0.91015625, "learning_rate": 0.00045509862139891553, "loss": 5.6598, "mean_token_accuracy": 0.20135302245616912, "num_tokens": 46958178.0, "step": 18525 }, { "entropy": 6.303174018859863, "epoch": 2.138488170802077, "grad_norm": 1.0078125, "learning_rate": 0.00045507388389339496, "loss": 5.7638, "mean_token_accuracy": 0.19554962664842607, "num_tokens": 46972959.0, "step": 18530 }, { "entropy": 6.301294231414795, "epoch": 2.139065204847086, "grad_norm": 0.9921875, "learning_rate": 0.00045504914033117866, "loss": 5.731, "mean_token_accuracy": 0.2034759998321533, "num_tokens": 46985506.0, "step": 18535 }, { "entropy": 6.185574340820312, "epoch": 2.139642238892095, "grad_norm": 0.94140625, "learning_rate": 0.00045502439071309897, "loss": 5.6738, "mean_token_accuracy": 0.2004707098007202, "num_tokens": 46997928.0, "step": 18540 }, { "entropy": 6.144084739685058, "epoch": 2.1402192729371032, "grad_norm": 0.984375, "learning_rate": 0.00045499963503998835, "loss": 5.5515, "mean_token_accuracy": 0.21737504452466966, "num_tokens": 47010097.0, "step": 18545 }, { "entropy": 6.288726758956909, "epoch": 2.140796306982112, "grad_norm": 1.0078125, "learning_rate": 0.0004549748733126794, "loss": 5.7374, "mean_token_accuracy": 0.1894450679421425, "num_tokens": 47021230.0, "step": 18550 }, { "entropy": 6.350382137298584, "epoch": 2.1413733410271205, "grad_norm": 0.9453125, "learning_rate": 0.000454950105532005, "loss": 5.7337, "mean_token_accuracy": 0.20369782149791718, "num_tokens": 47034433.0, "step": 18555 }, { "entropy": 6.285674619674682, "epoch": 2.1419503750721294, "grad_norm": 0.9375, "learning_rate": 0.00045492533169879816, "loss": 5.6853, "mean_token_accuracy": 0.2005313515663147, "num_tokens": 47046824.0, "step": 18560 }, { "entropy": 6.15918869972229, "epoch": 2.142527409117138, "grad_norm": 1.015625, "learning_rate": 0.00045490055181389216, "loss": 5.6169, "mean_token_accuracy": 0.21414333134889602, "num_tokens": 47058868.0, "step": 18565 }, { "entropy": 6.236881732940674, "epoch": 2.1431044431621467, "grad_norm": 0.97265625, "learning_rate": 0.00045487576587812046, "loss": 5.7218, "mean_token_accuracy": 0.1932273432612419, "num_tokens": 47070898.0, "step": 18570 }, { "entropy": 6.288231134414673, "epoch": 2.143681477207155, "grad_norm": 0.98828125, "learning_rate": 0.00045485097389231675, "loss": 5.7072, "mean_token_accuracy": 0.20229474306106568, "num_tokens": 47083739.0, "step": 18575 }, { "entropy": 6.256460046768188, "epoch": 2.144258511252164, "grad_norm": 0.9765625, "learning_rate": 0.0004548261758573149, "loss": 5.6604, "mean_token_accuracy": 0.19764898717403412, "num_tokens": 47095595.0, "step": 18580 }, { "entropy": 6.3134369373321535, "epoch": 2.1448355452971724, "grad_norm": 1.0234375, "learning_rate": 0.0004548013717739489, "loss": 5.7906, "mean_token_accuracy": 0.1963936612010002, "num_tokens": 47108326.0, "step": 18585 }, { "entropy": 6.267605018615723, "epoch": 2.145412579342181, "grad_norm": 0.984375, "learning_rate": 0.0004547765616430531, "loss": 5.6946, "mean_token_accuracy": 0.2020091712474823, "num_tokens": 47120494.0, "step": 18590 }, { "entropy": 6.253426933288575, "epoch": 2.14598961338719, "grad_norm": 0.96484375, "learning_rate": 0.0004547517454654619, "loss": 5.7123, "mean_token_accuracy": 0.19711664468050002, "num_tokens": 47133116.0, "step": 18595 }, { "entropy": 6.2377996921539305, "epoch": 2.1465666474321985, "grad_norm": 0.984375, "learning_rate": 0.00045472692324201005, "loss": 5.6745, "mean_token_accuracy": 0.20328953266143798, "num_tokens": 47145208.0, "step": 18600 }, { "entropy": 6.2594903945922855, "epoch": 2.1471436814772074, "grad_norm": 0.984375, "learning_rate": 0.00045470209497353243, "loss": 5.6525, "mean_token_accuracy": 0.20197178572416305, "num_tokens": 47159217.0, "step": 18605 }, { "entropy": 6.259916639328003, "epoch": 2.1477207155222158, "grad_norm": 0.8984375, "learning_rate": 0.0004546772606608641, "loss": 5.7191, "mean_token_accuracy": 0.19843529015779496, "num_tokens": 47171781.0, "step": 18610 }, { "entropy": 6.272399759292602, "epoch": 2.1482977495672246, "grad_norm": 1.078125, "learning_rate": 0.0004546524203048404, "loss": 5.7301, "mean_token_accuracy": 0.20068282037973403, "num_tokens": 47184045.0, "step": 18615 }, { "entropy": 6.256565856933594, "epoch": 2.148874783612233, "grad_norm": 0.9765625, "learning_rate": 0.0004546275739062967, "loss": 5.6422, "mean_token_accuracy": 0.20642626881599427, "num_tokens": 47195511.0, "step": 18620 }, { "entropy": 6.235472393035889, "epoch": 2.149451817657242, "grad_norm": 0.984375, "learning_rate": 0.0004546027214660688, "loss": 5.6918, "mean_token_accuracy": 0.2010675698518753, "num_tokens": 47206977.0, "step": 18625 }, { "entropy": 6.2369743347167965, "epoch": 2.1500288517022503, "grad_norm": 1.0234375, "learning_rate": 0.0004545778629849926, "loss": 5.6698, "mean_token_accuracy": 0.19845179915428163, "num_tokens": 47218748.0, "step": 18630 }, { "entropy": 6.347124624252319, "epoch": 2.150605885747259, "grad_norm": 0.9296875, "learning_rate": 0.0004545529984639042, "loss": 5.7865, "mean_token_accuracy": 0.1867247551679611, "num_tokens": 47230651.0, "step": 18635 }, { "entropy": 6.214054298400879, "epoch": 2.1511829197922676, "grad_norm": 0.96875, "learning_rate": 0.0004545281279036398, "loss": 5.6591, "mean_token_accuracy": 0.2055197224020958, "num_tokens": 47242959.0, "step": 18640 }, { "entropy": 6.25451807975769, "epoch": 2.1517599538372765, "grad_norm": 0.94921875, "learning_rate": 0.0004545032513050361, "loss": 5.6808, "mean_token_accuracy": 0.19695733934640886, "num_tokens": 47255113.0, "step": 18645 }, { "entropy": 6.290202808380127, "epoch": 2.152336987882285, "grad_norm": 0.94921875, "learning_rate": 0.0004544783686689296, "loss": 5.7893, "mean_token_accuracy": 0.19497634023427962, "num_tokens": 47266873.0, "step": 18650 }, { "entropy": 6.329517269134522, "epoch": 2.1529140219272938, "grad_norm": 1.0546875, "learning_rate": 0.00045445347999615736, "loss": 5.7372, "mean_token_accuracy": 0.20065853744745255, "num_tokens": 47278685.0, "step": 18655 }, { "entropy": 6.251347064971924, "epoch": 2.153491055972302, "grad_norm": 0.96484375, "learning_rate": 0.00045442858528755653, "loss": 5.7136, "mean_token_accuracy": 0.20842838436365127, "num_tokens": 47291553.0, "step": 18660 }, { "entropy": 6.250447130203247, "epoch": 2.154068090017311, "grad_norm": 0.96484375, "learning_rate": 0.00045440368454396435, "loss": 5.6378, "mean_token_accuracy": 0.20666613578796386, "num_tokens": 47303890.0, "step": 18665 }, { "entropy": 6.201526117324829, "epoch": 2.15464512406232, "grad_norm": 1.046875, "learning_rate": 0.0004543787777662183, "loss": 5.6181, "mean_token_accuracy": 0.21246950477361679, "num_tokens": 47316990.0, "step": 18670 }, { "entropy": 6.260347652435303, "epoch": 2.1552221581073283, "grad_norm": 0.90234375, "learning_rate": 0.00045435386495515617, "loss": 5.7288, "mean_token_accuracy": 0.2012850522994995, "num_tokens": 47330568.0, "step": 18675 }, { "entropy": 6.274090385437011, "epoch": 2.155799192152337, "grad_norm": 0.984375, "learning_rate": 0.0004543289461116159, "loss": 5.6548, "mean_token_accuracy": 0.20304317623376847, "num_tokens": 47343563.0, "step": 18680 }, { "entropy": 6.274822044372558, "epoch": 2.1563762261973456, "grad_norm": 0.91796875, "learning_rate": 0.0004543040212364356, "loss": 5.7077, "mean_token_accuracy": 0.19780379682779312, "num_tokens": 47356272.0, "step": 18685 }, { "entropy": 6.162377452850341, "epoch": 2.1569532602423545, "grad_norm": 1.03125, "learning_rate": 0.0004542790903304536, "loss": 5.6503, "mean_token_accuracy": 0.20433313250541688, "num_tokens": 47370244.0, "step": 18690 }, { "entropy": 6.270251655578614, "epoch": 2.157530294287363, "grad_norm": 0.875, "learning_rate": 0.0004542541533945085, "loss": 5.6845, "mean_token_accuracy": 0.20407705754041672, "num_tokens": 47383120.0, "step": 18695 }, { "entropy": 6.325912189483643, "epoch": 2.1581073283323717, "grad_norm": 0.94921875, "learning_rate": 0.00045422921042943885, "loss": 5.7731, "mean_token_accuracy": 0.19510978758335112, "num_tokens": 47397274.0, "step": 18700 }, { "entropy": 6.282104444503784, "epoch": 2.15868436237738, "grad_norm": 0.92578125, "learning_rate": 0.000454204261436084, "loss": 5.6718, "mean_token_accuracy": 0.19389674961566924, "num_tokens": 47409611.0, "step": 18705 }, { "entropy": 6.2637886047363285, "epoch": 2.159261396422389, "grad_norm": 0.98046875, "learning_rate": 0.00045417930641528255, "loss": 5.6857, "mean_token_accuracy": 0.19976329952478408, "num_tokens": 47421435.0, "step": 18710 }, { "entropy": 6.322576427459717, "epoch": 2.1598384304673974, "grad_norm": 0.90234375, "learning_rate": 0.00045415434536787424, "loss": 5.7587, "mean_token_accuracy": 0.19851334244012833, "num_tokens": 47434749.0, "step": 18715 }, { "entropy": 6.275216150283813, "epoch": 2.1604154645124063, "grad_norm": 0.8984375, "learning_rate": 0.0004541293782946985, "loss": 5.7258, "mean_token_accuracy": 0.19765596836805344, "num_tokens": 47446477.0, "step": 18720 }, { "entropy": 6.1962462902069095, "epoch": 2.1609924985574147, "grad_norm": 0.953125, "learning_rate": 0.0004541044051965952, "loss": 5.5981, "mean_token_accuracy": 0.2038559779524803, "num_tokens": 47459547.0, "step": 18725 }, { "entropy": 6.297658157348633, "epoch": 2.1615695326024236, "grad_norm": 0.98828125, "learning_rate": 0.0004540794260744041, "loss": 5.751, "mean_token_accuracy": 0.19317446351051332, "num_tokens": 47472294.0, "step": 18730 }, { "entropy": 6.24362964630127, "epoch": 2.162146566647432, "grad_norm": 0.92578125, "learning_rate": 0.0004540544409289655, "loss": 5.6429, "mean_token_accuracy": 0.20526028126478196, "num_tokens": 47484240.0, "step": 18735 }, { "entropy": 6.266336107254029, "epoch": 2.162723600692441, "grad_norm": 0.92578125, "learning_rate": 0.0004540294497611197, "loss": 5.7104, "mean_token_accuracy": 0.20812188535928727, "num_tokens": 47498179.0, "step": 18740 }, { "entropy": 6.240371036529541, "epoch": 2.1633006347374497, "grad_norm": 0.91015625, "learning_rate": 0.00045400445257170725, "loss": 5.6758, "mean_token_accuracy": 0.2001010537147522, "num_tokens": 47511354.0, "step": 18745 }, { "entropy": 6.279890441894532, "epoch": 2.163877668782458, "grad_norm": 0.921875, "learning_rate": 0.0004539794493615689, "loss": 5.7464, "mean_token_accuracy": 0.20213051587343217, "num_tokens": 47523589.0, "step": 18750 }, { "entropy": 6.195033931732178, "epoch": 2.164454702827467, "grad_norm": 0.98046875, "learning_rate": 0.0004539544401315458, "loss": 5.6927, "mean_token_accuracy": 0.20695994198322296, "num_tokens": 47536784.0, "step": 18755 }, { "entropy": 6.260665416717529, "epoch": 2.1650317368724754, "grad_norm": 1.0078125, "learning_rate": 0.000453929424882479, "loss": 5.633, "mean_token_accuracy": 0.20660437643527985, "num_tokens": 47550560.0, "step": 18760 }, { "entropy": 6.246667957305908, "epoch": 2.1656087709174843, "grad_norm": 0.9375, "learning_rate": 0.00045390440361520987, "loss": 5.5635, "mean_token_accuracy": 0.22506728023290634, "num_tokens": 47564069.0, "step": 18765 }, { "entropy": 6.2478800296783445, "epoch": 2.1661858049624927, "grad_norm": 0.9140625, "learning_rate": 0.0004538793763305799, "loss": 5.6714, "mean_token_accuracy": 0.19922966212034227, "num_tokens": 47577570.0, "step": 18770 }, { "entropy": 6.254863834381103, "epoch": 2.1667628390075016, "grad_norm": 1.015625, "learning_rate": 0.00045385434302943104, "loss": 5.7292, "mean_token_accuracy": 0.2031453251838684, "num_tokens": 47590199.0, "step": 18775 }, { "entropy": 6.285591554641724, "epoch": 2.16733987305251, "grad_norm": 0.9921875, "learning_rate": 0.0004538293037126052, "loss": 5.6744, "mean_token_accuracy": 0.20117084085941314, "num_tokens": 47601697.0, "step": 18780 }, { "entropy": 6.296120595932007, "epoch": 2.167916907097519, "grad_norm": 0.8828125, "learning_rate": 0.00045380425838094444, "loss": 5.7184, "mean_token_accuracy": 0.19993578642606735, "num_tokens": 47615331.0, "step": 18785 }, { "entropy": 6.217986249923706, "epoch": 2.1684939411425272, "grad_norm": 0.96875, "learning_rate": 0.00045377920703529133, "loss": 5.6688, "mean_token_accuracy": 0.20416014790534973, "num_tokens": 47628455.0, "step": 18790 }, { "entropy": 6.236662530899048, "epoch": 2.169070975187536, "grad_norm": 0.9453125, "learning_rate": 0.0004537541496764885, "loss": 5.632, "mean_token_accuracy": 0.20659274458885193, "num_tokens": 47642078.0, "step": 18795 }, { "entropy": 6.258144998550415, "epoch": 2.1696480092325445, "grad_norm": 1.015625, "learning_rate": 0.0004537290863053786, "loss": 5.6747, "mean_token_accuracy": 0.2031049832701683, "num_tokens": 47653672.0, "step": 18800 }, { "entropy": 6.120979070663452, "epoch": 2.1702250432775534, "grad_norm": 1.0234375, "learning_rate": 0.00045370401692280455, "loss": 5.5686, "mean_token_accuracy": 0.20843469351530075, "num_tokens": 47666085.0, "step": 18805 }, { "entropy": 6.304890823364258, "epoch": 2.170802077322562, "grad_norm": 0.9609375, "learning_rate": 0.00045367894152960976, "loss": 5.7797, "mean_token_accuracy": 0.19347210079431534, "num_tokens": 47678180.0, "step": 18810 }, { "entropy": 6.284006977081299, "epoch": 2.1713791113675707, "grad_norm": 0.984375, "learning_rate": 0.00045365386012663744, "loss": 5.7109, "mean_token_accuracy": 0.19503520876169206, "num_tokens": 47690631.0, "step": 18815 }, { "entropy": 6.259499502182007, "epoch": 2.1719561454125795, "grad_norm": 1.0234375, "learning_rate": 0.00045362877271473137, "loss": 5.6326, "mean_token_accuracy": 0.20334458649158477, "num_tokens": 47702577.0, "step": 18820 }, { "entropy": 6.2635283946990965, "epoch": 2.172533179457588, "grad_norm": 1.015625, "learning_rate": 0.00045360367929473517, "loss": 5.6859, "mean_token_accuracy": 0.20750661194324493, "num_tokens": 47714683.0, "step": 18825 }, { "entropy": 6.2828991413116455, "epoch": 2.173110213502597, "grad_norm": 0.96484375, "learning_rate": 0.000453578579867493, "loss": 5.6273, "mean_token_accuracy": 0.20380921959877013, "num_tokens": 47726202.0, "step": 18830 }, { "entropy": 6.223279047012329, "epoch": 2.1736872475476052, "grad_norm": 0.94140625, "learning_rate": 0.00045355347443384896, "loss": 5.6476, "mean_token_accuracy": 0.20528243482112885, "num_tokens": 47740178.0, "step": 18835 }, { "entropy": 6.244608068466187, "epoch": 2.174264281592614, "grad_norm": 0.984375, "learning_rate": 0.00045352836299464755, "loss": 5.6788, "mean_token_accuracy": 0.20205701440572738, "num_tokens": 47752710.0, "step": 18840 }, { "entropy": 6.250746059417724, "epoch": 2.1748413156376225, "grad_norm": 0.90234375, "learning_rate": 0.0004535032455507333, "loss": 5.6218, "mean_token_accuracy": 0.2027655079960823, "num_tokens": 47765292.0, "step": 18845 }, { "entropy": 6.254888486862183, "epoch": 2.1754183496826314, "grad_norm": 0.9921875, "learning_rate": 0.00045347812210295107, "loss": 5.6778, "mean_token_accuracy": 0.19805543571710588, "num_tokens": 47777799.0, "step": 18850 }, { "entropy": 6.272021627426147, "epoch": 2.17599538372764, "grad_norm": 0.9453125, "learning_rate": 0.00045345299265214583, "loss": 5.6492, "mean_token_accuracy": 0.20628771483898162, "num_tokens": 47790705.0, "step": 18855 }, { "entropy": 6.225584030151367, "epoch": 2.1765724177726486, "grad_norm": 0.90625, "learning_rate": 0.00045342785719916284, "loss": 5.5986, "mean_token_accuracy": 0.19875137656927108, "num_tokens": 47802169.0, "step": 18860 }, { "entropy": 6.155571317672729, "epoch": 2.177149451817657, "grad_norm": 1.0, "learning_rate": 0.00045340271574484755, "loss": 5.5336, "mean_token_accuracy": 0.20996356904506683, "num_tokens": 47815832.0, "step": 18865 }, { "entropy": 6.340555238723755, "epoch": 2.177726485862666, "grad_norm": 1.0703125, "learning_rate": 0.0004533775682900454, "loss": 5.7641, "mean_token_accuracy": 0.19792629182338714, "num_tokens": 47828967.0, "step": 18870 }, { "entropy": 6.216424942016602, "epoch": 2.1783035199076743, "grad_norm": 0.94921875, "learning_rate": 0.0004533524148356025, "loss": 5.6142, "mean_token_accuracy": 0.21056083738803863, "num_tokens": 47842114.0, "step": 18875 }, { "entropy": 6.117310237884522, "epoch": 2.178880553952683, "grad_norm": 0.9140625, "learning_rate": 0.0004533272553823646, "loss": 5.5741, "mean_token_accuracy": 0.20430090874433518, "num_tokens": 47855808.0, "step": 18880 }, { "entropy": 6.302039957046508, "epoch": 2.179457587997692, "grad_norm": 1.1015625, "learning_rate": 0.00045330208993117816, "loss": 5.7289, "mean_token_accuracy": 0.19179463237524033, "num_tokens": 47866866.0, "step": 18885 }, { "entropy": 6.286647701263428, "epoch": 2.1800346220427005, "grad_norm": 0.9375, "learning_rate": 0.0004532769184828894, "loss": 5.6727, "mean_token_accuracy": 0.2016996130347252, "num_tokens": 47878823.0, "step": 18890 }, { "entropy": 6.268312454223633, "epoch": 2.1806116560877093, "grad_norm": 0.94140625, "learning_rate": 0.0004532517410383451, "loss": 5.7583, "mean_token_accuracy": 0.1968337342143059, "num_tokens": 47890512.0, "step": 18895 }, { "entropy": 6.242161893844605, "epoch": 2.1811886901327178, "grad_norm": 1.28125, "learning_rate": 0.000453226557598392, "loss": 5.708, "mean_token_accuracy": 0.19775693565607072, "num_tokens": 47903728.0, "step": 18900 }, { "entropy": 6.29580249786377, "epoch": 2.1817657241777266, "grad_norm": 0.98046875, "learning_rate": 0.0004532013681638771, "loss": 5.7467, "mean_token_accuracy": 0.1998975858092308, "num_tokens": 47914742.0, "step": 18905 }, { "entropy": 6.32392201423645, "epoch": 2.182342758222735, "grad_norm": 0.99609375, "learning_rate": 0.0004531761727356478, "loss": 5.7328, "mean_token_accuracy": 0.19939059615135193, "num_tokens": 47926737.0, "step": 18910 }, { "entropy": 6.257878255844116, "epoch": 2.182919792267744, "grad_norm": 0.875, "learning_rate": 0.0004531509713145514, "loss": 5.6638, "mean_token_accuracy": 0.20171019285917283, "num_tokens": 47941207.0, "step": 18915 }, { "entropy": 6.257398414611816, "epoch": 2.1834968263127523, "grad_norm": 0.93359375, "learning_rate": 0.00045312576390143557, "loss": 5.7509, "mean_token_accuracy": 0.19138018190860748, "num_tokens": 47953640.0, "step": 18920 }, { "entropy": 6.2764183521270756, "epoch": 2.184073860357761, "grad_norm": 0.96875, "learning_rate": 0.00045310055049714815, "loss": 5.7342, "mean_token_accuracy": 0.20488953590393066, "num_tokens": 47966399.0, "step": 18925 }, { "entropy": 6.283313941955567, "epoch": 2.1846508944027696, "grad_norm": 0.98828125, "learning_rate": 0.00045307533110253726, "loss": 5.6533, "mean_token_accuracy": 0.20482224971055984, "num_tokens": 47979521.0, "step": 18930 }, { "entropy": 6.287374973297119, "epoch": 2.1852279284477785, "grad_norm": 0.9375, "learning_rate": 0.00045305010571845096, "loss": 5.7341, "mean_token_accuracy": 0.20170841217041016, "num_tokens": 47992780.0, "step": 18935 }, { "entropy": 6.314225530624389, "epoch": 2.185804962492787, "grad_norm": 1.09375, "learning_rate": 0.0004530248743457378, "loss": 5.7519, "mean_token_accuracy": 0.19808263331651688, "num_tokens": 48005548.0, "step": 18940 }, { "entropy": 6.2541357517242435, "epoch": 2.1863819965377957, "grad_norm": 0.96484375, "learning_rate": 0.0004529996369852465, "loss": 5.6555, "mean_token_accuracy": 0.2016634613275528, "num_tokens": 48017352.0, "step": 18945 }, { "entropy": 6.124024057388306, "epoch": 2.1869590305828046, "grad_norm": 0.99609375, "learning_rate": 0.00045297439363782576, "loss": 5.4849, "mean_token_accuracy": 0.21912779062986373, "num_tokens": 48029252.0, "step": 18950 }, { "entropy": 6.261006593704224, "epoch": 2.187536064627813, "grad_norm": 0.98046875, "learning_rate": 0.0004529491443043247, "loss": 5.7477, "mean_token_accuracy": 0.20232635885477065, "num_tokens": 48041534.0, "step": 18955 }, { "entropy": 6.252580547332764, "epoch": 2.188113098672822, "grad_norm": 0.9765625, "learning_rate": 0.0004529238889855926, "loss": 5.7354, "mean_token_accuracy": 0.19888463020324706, "num_tokens": 48054396.0, "step": 18960 }, { "entropy": 6.259010362625122, "epoch": 2.1886901327178303, "grad_norm": 0.89453125, "learning_rate": 0.0004528986276824789, "loss": 5.7195, "mean_token_accuracy": 0.1986936628818512, "num_tokens": 48066785.0, "step": 18965 }, { "entropy": 6.207064390182495, "epoch": 2.189267166762839, "grad_norm": 0.90625, "learning_rate": 0.0004528733603958331, "loss": 5.6582, "mean_token_accuracy": 0.20980920046567916, "num_tokens": 48079837.0, "step": 18970 }, { "entropy": 6.275537204742432, "epoch": 2.1898442008078476, "grad_norm": 1.1015625, "learning_rate": 0.0004528480871265053, "loss": 5.659, "mean_token_accuracy": 0.20257765352725982, "num_tokens": 48091670.0, "step": 18975 }, { "entropy": 6.2916429996490475, "epoch": 2.1904212348528564, "grad_norm": 0.9140625, "learning_rate": 0.00045282280787534537, "loss": 5.7575, "mean_token_accuracy": 0.19688573181629182, "num_tokens": 48105261.0, "step": 18980 }, { "entropy": 6.2920839309692385, "epoch": 2.190998268897865, "grad_norm": 0.90625, "learning_rate": 0.0004527975226432036, "loss": 5.6593, "mean_token_accuracy": 0.1986699342727661, "num_tokens": 48118272.0, "step": 18985 }, { "entropy": 6.237543535232544, "epoch": 2.1915753029428737, "grad_norm": 1.09375, "learning_rate": 0.00045277223143093057, "loss": 5.7048, "mean_token_accuracy": 0.199216428399086, "num_tokens": 48130413.0, "step": 18990 }, { "entropy": 6.267915391921997, "epoch": 2.192152336987882, "grad_norm": 0.96484375, "learning_rate": 0.00045274693423937674, "loss": 5.6509, "mean_token_accuracy": 0.2026078313589096, "num_tokens": 48143308.0, "step": 18995 }, { "entropy": 6.2021924495697025, "epoch": 2.192729371032891, "grad_norm": 0.98046875, "learning_rate": 0.00045272163106939314, "loss": 5.6053, "mean_token_accuracy": 0.21072281152009964, "num_tokens": 48155832.0, "step": 19000 }, { "entropy": 6.262426471710205, "epoch": 2.1933064050778994, "grad_norm": 0.98046875, "learning_rate": 0.00045269632192183076, "loss": 5.7341, "mean_token_accuracy": 0.1992826998233795, "num_tokens": 48168390.0, "step": 19005 }, { "entropy": 6.279296064376831, "epoch": 2.1938834391229083, "grad_norm": 0.9375, "learning_rate": 0.00045267100679754075, "loss": 5.7556, "mean_token_accuracy": 0.19007308334112166, "num_tokens": 48180918.0, "step": 19010 }, { "entropy": 6.300954580307007, "epoch": 2.1944604731679167, "grad_norm": 0.86328125, "learning_rate": 0.0004526456856973748, "loss": 5.702, "mean_token_accuracy": 0.2015950232744217, "num_tokens": 48194251.0, "step": 19015 }, { "entropy": 6.320611667633057, "epoch": 2.1950375072129256, "grad_norm": 0.98046875, "learning_rate": 0.0004526203586221844, "loss": 5.6978, "mean_token_accuracy": 0.19965052008628845, "num_tokens": 48206704.0, "step": 19020 }, { "entropy": 6.252124881744384, "epoch": 2.1956145412579344, "grad_norm": 0.98828125, "learning_rate": 0.00045259502557282145, "loss": 5.6983, "mean_token_accuracy": 0.20150818079710006, "num_tokens": 48219390.0, "step": 19025 }, { "entropy": 6.201693296432495, "epoch": 2.196191575302943, "grad_norm": 1.0234375, "learning_rate": 0.0004525696865501381, "loss": 5.6442, "mean_token_accuracy": 0.20039039254188537, "num_tokens": 48231555.0, "step": 19030 }, { "entropy": 6.316070938110352, "epoch": 2.1967686093479517, "grad_norm": 1.015625, "learning_rate": 0.0004525443415549865, "loss": 5.7185, "mean_token_accuracy": 0.1988256499171257, "num_tokens": 48243763.0, "step": 19035 }, { "entropy": 6.276049470901489, "epoch": 2.19734564339296, "grad_norm": 0.92578125, "learning_rate": 0.00045251899058821915, "loss": 5.7118, "mean_token_accuracy": 0.1995232343673706, "num_tokens": 48257567.0, "step": 19040 }, { "entropy": 6.211150360107422, "epoch": 2.197922677437969, "grad_norm": 1.0546875, "learning_rate": 0.0004524936336506887, "loss": 5.62, "mean_token_accuracy": 0.20634069442749023, "num_tokens": 48270313.0, "step": 19045 }, { "entropy": 6.260643768310547, "epoch": 2.1984997114829774, "grad_norm": 1.03125, "learning_rate": 0.0004524682707432482, "loss": 5.6012, "mean_token_accuracy": 0.20677340775728226, "num_tokens": 48282768.0, "step": 19050 }, { "entropy": 6.219102239608764, "epoch": 2.1990767455279863, "grad_norm": 1.0625, "learning_rate": 0.00045244290186675034, "loss": 5.6517, "mean_token_accuracy": 0.20461307764053344, "num_tokens": 48293861.0, "step": 19055 }, { "entropy": 6.2349823951721195, "epoch": 2.1996537795729947, "grad_norm": 0.9765625, "learning_rate": 0.0004524175270220489, "loss": 5.5988, "mean_token_accuracy": 0.21154738813638688, "num_tokens": 48306062.0, "step": 19060 }, { "entropy": 6.280507040023804, "epoch": 2.2002308136180035, "grad_norm": 0.9765625, "learning_rate": 0.00045239214620999683, "loss": 5.7174, "mean_token_accuracy": 0.1978029727935791, "num_tokens": 48318777.0, "step": 19065 }, { "entropy": 6.264151763916016, "epoch": 2.200807847663012, "grad_norm": 1.0625, "learning_rate": 0.0004523667594314481, "loss": 5.6984, "mean_token_accuracy": 0.1989084467291832, "num_tokens": 48330575.0, "step": 19070 }, { "entropy": 6.1020753383636475, "epoch": 2.201384881708021, "grad_norm": 0.9453125, "learning_rate": 0.00045234136668725655, "loss": 5.5308, "mean_token_accuracy": 0.21237103641033173, "num_tokens": 48343980.0, "step": 19075 }, { "entropy": 6.1847601413726805, "epoch": 2.2019619157530292, "grad_norm": 0.98828125, "learning_rate": 0.00045231596797827616, "loss": 5.6036, "mean_token_accuracy": 0.2041487902402878, "num_tokens": 48356140.0, "step": 19080 }, { "entropy": 6.245753765106201, "epoch": 2.202538949798038, "grad_norm": 0.88671875, "learning_rate": 0.00045229056330536134, "loss": 5.6988, "mean_token_accuracy": 0.20395198315382004, "num_tokens": 48367756.0, "step": 19085 }, { "entropy": 6.229965162277222, "epoch": 2.2031159838430465, "grad_norm": 0.91015625, "learning_rate": 0.00045226515266936644, "loss": 5.6839, "mean_token_accuracy": 0.19726950377225877, "num_tokens": 48381637.0, "step": 19090 }, { "entropy": 6.252473640441894, "epoch": 2.2036930178880554, "grad_norm": 0.94921875, "learning_rate": 0.0004522397360711462, "loss": 5.6362, "mean_token_accuracy": 0.20076129734516143, "num_tokens": 48394593.0, "step": 19095 }, { "entropy": 6.203752708435059, "epoch": 2.2042700519330642, "grad_norm": 0.8671875, "learning_rate": 0.0004522143135115555, "loss": 5.6111, "mean_token_accuracy": 0.20537707656621934, "num_tokens": 48408555.0, "step": 19100 }, { "entropy": 6.2377259731292725, "epoch": 2.2048470859780727, "grad_norm": 0.94140625, "learning_rate": 0.00045218888499144933, "loss": 5.6602, "mean_token_accuracy": 0.2072727635502815, "num_tokens": 48420359.0, "step": 19105 }, { "entropy": 6.29434232711792, "epoch": 2.2054241200230815, "grad_norm": 0.9453125, "learning_rate": 0.00045216345051168314, "loss": 5.7992, "mean_token_accuracy": 0.1885974407196045, "num_tokens": 48432516.0, "step": 19110 }, { "entropy": 6.259411954879761, "epoch": 2.20600115406809, "grad_norm": 1.015625, "learning_rate": 0.0004521380100731122, "loss": 5.6699, "mean_token_accuracy": 0.2050180107355118, "num_tokens": 48444355.0, "step": 19115 }, { "entropy": 6.1959943771362305, "epoch": 2.206578188113099, "grad_norm": 1.046875, "learning_rate": 0.00045211256367659234, "loss": 5.5727, "mean_token_accuracy": 0.21873999536037445, "num_tokens": 48458341.0, "step": 19120 }, { "entropy": 6.244530487060547, "epoch": 2.207155222158107, "grad_norm": 0.93359375, "learning_rate": 0.0004520871113229793, "loss": 5.6865, "mean_token_accuracy": 0.20000386238098145, "num_tokens": 48471473.0, "step": 19125 }, { "entropy": 6.241182041168213, "epoch": 2.207732256203116, "grad_norm": 1.0234375, "learning_rate": 0.00045206165301312927, "loss": 5.6741, "mean_token_accuracy": 0.20176537930965424, "num_tokens": 48483149.0, "step": 19130 }, { "entropy": 6.240596342086792, "epoch": 2.2083092902481245, "grad_norm": 0.93359375, "learning_rate": 0.0004520361887478985, "loss": 5.6755, "mean_token_accuracy": 0.20530891567468643, "num_tokens": 48495617.0, "step": 19135 }, { "entropy": 6.135921144485474, "epoch": 2.2088863242931334, "grad_norm": 1.03125, "learning_rate": 0.0004520107185281435, "loss": 5.632, "mean_token_accuracy": 0.20589762777090073, "num_tokens": 48509391.0, "step": 19140 }, { "entropy": 6.165386486053467, "epoch": 2.209463358338142, "grad_norm": 0.91796875, "learning_rate": 0.0004519852423547208, "loss": 5.5958, "mean_token_accuracy": 0.21079403162002563, "num_tokens": 48523127.0, "step": 19145 }, { "entropy": 6.156606769561767, "epoch": 2.2100403923831506, "grad_norm": 0.95703125, "learning_rate": 0.0004519597602284875, "loss": 5.569, "mean_token_accuracy": 0.21757976710796356, "num_tokens": 48536797.0, "step": 19150 }, { "entropy": 6.263695287704468, "epoch": 2.210617426428159, "grad_norm": 0.9609375, "learning_rate": 0.0004519342721503005, "loss": 5.6717, "mean_token_accuracy": 0.20158991515636443, "num_tokens": 48549088.0, "step": 19155 }, { "entropy": 6.259319400787353, "epoch": 2.211194460473168, "grad_norm": 0.98828125, "learning_rate": 0.0004519087781210171, "loss": 5.6259, "mean_token_accuracy": 0.20565885156393052, "num_tokens": 48560451.0, "step": 19160 }, { "entropy": 6.2218138694763185, "epoch": 2.2117714945181763, "grad_norm": 0.875, "learning_rate": 0.000451883278141495, "loss": 5.6, "mean_token_accuracy": 0.2046360641717911, "num_tokens": 48572870.0, "step": 19165 }, { "entropy": 6.205379390716553, "epoch": 2.212348528563185, "grad_norm": 0.890625, "learning_rate": 0.00045185777221259157, "loss": 5.6622, "mean_token_accuracy": 0.19950393736362457, "num_tokens": 48585909.0, "step": 19170 }, { "entropy": 6.264685201644897, "epoch": 2.212925562608194, "grad_norm": 0.9765625, "learning_rate": 0.0004518322603351648, "loss": 5.649, "mean_token_accuracy": 0.20917298644781113, "num_tokens": 48599157.0, "step": 19175 }, { "entropy": 6.264721012115478, "epoch": 2.2135025966532025, "grad_norm": 0.98828125, "learning_rate": 0.00045180674251007287, "loss": 5.6516, "mean_token_accuracy": 0.20502317547798157, "num_tokens": 48611740.0, "step": 19180 }, { "entropy": 6.279746770858765, "epoch": 2.2140796306982113, "grad_norm": 0.953125, "learning_rate": 0.00045178121873817395, "loss": 5.7617, "mean_token_accuracy": 0.19199493378400803, "num_tokens": 48624893.0, "step": 19185 }, { "entropy": 6.243294429779053, "epoch": 2.2146566647432198, "grad_norm": 1.03125, "learning_rate": 0.0004517556890203265, "loss": 5.6802, "mean_token_accuracy": 0.19957953989505767, "num_tokens": 48636414.0, "step": 19190 }, { "entropy": 6.1810681343078615, "epoch": 2.2152336987882286, "grad_norm": 1.0078125, "learning_rate": 0.00045173015335738925, "loss": 5.6405, "mean_token_accuracy": 0.2053627386689186, "num_tokens": 48649936.0, "step": 19195 }, { "entropy": 6.246352767944336, "epoch": 2.215810732833237, "grad_norm": 0.94921875, "learning_rate": 0.00045170461175022116, "loss": 5.6136, "mean_token_accuracy": 0.2143157973885536, "num_tokens": 48662857.0, "step": 19200 }, { "entropy": 6.24592604637146, "epoch": 2.216387766878246, "grad_norm": 1.046875, "learning_rate": 0.0004516790641996812, "loss": 5.6692, "mean_token_accuracy": 0.2003368243575096, "num_tokens": 48675087.0, "step": 19205 }, { "entropy": 6.176522159576416, "epoch": 2.2169648009232543, "grad_norm": 0.88671875, "learning_rate": 0.0004516535107066286, "loss": 5.5978, "mean_token_accuracy": 0.20065319836139678, "num_tokens": 48687575.0, "step": 19210 }, { "entropy": 6.234763860702515, "epoch": 2.217541834968263, "grad_norm": 0.95703125, "learning_rate": 0.00045162795127192296, "loss": 5.6368, "mean_token_accuracy": 0.19902375042438508, "num_tokens": 48701115.0, "step": 19215 }, { "entropy": 6.293993902206421, "epoch": 2.2181188690132716, "grad_norm": 0.99609375, "learning_rate": 0.000451602385896424, "loss": 5.7558, "mean_token_accuracy": 0.1977062702178955, "num_tokens": 48713738.0, "step": 19220 }, { "entropy": 6.202127361297608, "epoch": 2.2186959030582805, "grad_norm": 1.0234375, "learning_rate": 0.00045157681458099145, "loss": 5.5793, "mean_token_accuracy": 0.20735561102628708, "num_tokens": 48725282.0, "step": 19225 }, { "entropy": 6.219801712036133, "epoch": 2.2192729371032893, "grad_norm": 1.0625, "learning_rate": 0.0004515512373264854, "loss": 5.6486, "mean_token_accuracy": 0.2041847363114357, "num_tokens": 48738476.0, "step": 19230 }, { "entropy": 6.260962247848511, "epoch": 2.2198499711482977, "grad_norm": 0.9453125, "learning_rate": 0.00045152565413376623, "loss": 5.6571, "mean_token_accuracy": 0.2018562912940979, "num_tokens": 48751447.0, "step": 19235 }, { "entropy": 6.275470876693726, "epoch": 2.2204270051933066, "grad_norm": 1.0, "learning_rate": 0.0004515000650036944, "loss": 5.7167, "mean_token_accuracy": 0.19641314595937728, "num_tokens": 48764124.0, "step": 19240 }, { "entropy": 6.284907484054566, "epoch": 2.221004039238315, "grad_norm": 0.9609375, "learning_rate": 0.0004514744699371305, "loss": 5.7523, "mean_token_accuracy": 0.1944175183773041, "num_tokens": 48776414.0, "step": 19245 }, { "entropy": 6.267220830917358, "epoch": 2.221581073283324, "grad_norm": 1.03125, "learning_rate": 0.00045144886893493547, "loss": 5.6725, "mean_token_accuracy": 0.1995649054646492, "num_tokens": 48789318.0, "step": 19250 }, { "entropy": 6.132220125198364, "epoch": 2.2221581073283323, "grad_norm": 0.91015625, "learning_rate": 0.00045142326199797047, "loss": 5.6118, "mean_token_accuracy": 0.21107657998800278, "num_tokens": 48801773.0, "step": 19255 }, { "entropy": 6.277349853515625, "epoch": 2.222735141373341, "grad_norm": 1.046875, "learning_rate": 0.00045139764912709656, "loss": 5.6264, "mean_token_accuracy": 0.20283719897270203, "num_tokens": 48814137.0, "step": 19260 }, { "entropy": 6.262899732589721, "epoch": 2.2233121754183496, "grad_norm": 0.9296875, "learning_rate": 0.0004513720303231754, "loss": 5.6507, "mean_token_accuracy": 0.20469385832548143, "num_tokens": 48826129.0, "step": 19265 }, { "entropy": 6.253290843963623, "epoch": 2.2238892094633584, "grad_norm": 0.9375, "learning_rate": 0.00045134640558706864, "loss": 5.6963, "mean_token_accuracy": 0.20241008698940277, "num_tokens": 48838930.0, "step": 19270 }, { "entropy": 6.318625593185425, "epoch": 2.224466243508367, "grad_norm": 1.015625, "learning_rate": 0.000451320774919638, "loss": 5.6563, "mean_token_accuracy": 0.19929049760103226, "num_tokens": 48851506.0, "step": 19275 }, { "entropy": 6.214009761810303, "epoch": 2.2250432775533757, "grad_norm": 0.984375, "learning_rate": 0.00045129513832174587, "loss": 5.5768, "mean_token_accuracy": 0.21026210784912108, "num_tokens": 48865267.0, "step": 19280 }, { "entropy": 6.187762832641601, "epoch": 2.225620311598384, "grad_norm": 0.94921875, "learning_rate": 0.00045126949579425414, "loss": 5.6747, "mean_token_accuracy": 0.2047516793012619, "num_tokens": 48877642.0, "step": 19285 }, { "entropy": 6.310758638381958, "epoch": 2.226197345643393, "grad_norm": 0.9375, "learning_rate": 0.00045124384733802563, "loss": 5.7544, "mean_token_accuracy": 0.19669358879327775, "num_tokens": 48891135.0, "step": 19290 }, { "entropy": 6.310164165496826, "epoch": 2.2267743796884014, "grad_norm": 0.9765625, "learning_rate": 0.0004512181929539228, "loss": 5.7155, "mean_token_accuracy": 0.1991264522075653, "num_tokens": 48904361.0, "step": 19295 }, { "entropy": 6.211184453964234, "epoch": 2.2273514137334103, "grad_norm": 0.9609375, "learning_rate": 0.00045119253264280855, "loss": 5.7157, "mean_token_accuracy": 0.20109605193138122, "num_tokens": 48916497.0, "step": 19300 }, { "entropy": 6.246825551986694, "epoch": 2.227928447778419, "grad_norm": 0.9921875, "learning_rate": 0.00045116686640554607, "loss": 5.6756, "mean_token_accuracy": 0.2026742219924927, "num_tokens": 48928476.0, "step": 19305 }, { "entropy": 6.254496431350708, "epoch": 2.2285054818234276, "grad_norm": 0.92578125, "learning_rate": 0.00045114119424299843, "loss": 5.6985, "mean_token_accuracy": 0.20265805274248122, "num_tokens": 48942153.0, "step": 19310 }, { "entropy": 6.306353569030762, "epoch": 2.2290825158684364, "grad_norm": 0.92578125, "learning_rate": 0.0004511155161560293, "loss": 5.7238, "mean_token_accuracy": 0.20385703891515733, "num_tokens": 48955313.0, "step": 19315 }, { "entropy": 6.243967485427857, "epoch": 2.229659549913445, "grad_norm": 0.9921875, "learning_rate": 0.00045108983214550225, "loss": 5.6316, "mean_token_accuracy": 0.2051597759127617, "num_tokens": 48967875.0, "step": 19320 }, { "entropy": 6.336811971664429, "epoch": 2.2302365839584537, "grad_norm": 0.9296875, "learning_rate": 0.0004510641422122811, "loss": 5.7014, "mean_token_accuracy": 0.196072755753994, "num_tokens": 48979534.0, "step": 19325 }, { "entropy": 6.326515102386475, "epoch": 2.230813618003462, "grad_norm": 0.9375, "learning_rate": 0.00045103844635723005, "loss": 5.731, "mean_token_accuracy": 0.19862714260816575, "num_tokens": 48991425.0, "step": 19330 }, { "entropy": 6.201512050628662, "epoch": 2.231390652048471, "grad_norm": 0.96484375, "learning_rate": 0.00045101274458121335, "loss": 5.6194, "mean_token_accuracy": 0.20665293782949448, "num_tokens": 49003783.0, "step": 19335 }, { "entropy": 6.269555282592774, "epoch": 2.2319676860934794, "grad_norm": 0.96484375, "learning_rate": 0.00045098703688509537, "loss": 5.7233, "mean_token_accuracy": 0.1967211216688156, "num_tokens": 49017998.0, "step": 19340 }, { "entropy": 6.313391923904419, "epoch": 2.2325447201384883, "grad_norm": 0.96484375, "learning_rate": 0.0004509613232697408, "loss": 5.7499, "mean_token_accuracy": 0.19863232374191284, "num_tokens": 49030429.0, "step": 19345 }, { "entropy": 6.254202842712402, "epoch": 2.2331217541834967, "grad_norm": 0.984375, "learning_rate": 0.0004509356037360145, "loss": 5.6359, "mean_token_accuracy": 0.2076195076107979, "num_tokens": 49043619.0, "step": 19350 }, { "entropy": 6.298452854156494, "epoch": 2.2336987882285055, "grad_norm": 1.03125, "learning_rate": 0.0004509098782847816, "loss": 5.6961, "mean_token_accuracy": 0.19885571599006652, "num_tokens": 49056674.0, "step": 19355 }, { "entropy": 6.241327381134033, "epoch": 2.234275822273514, "grad_norm": 0.95703125, "learning_rate": 0.0004508841469169073, "loss": 5.7308, "mean_token_accuracy": 0.1998901277780533, "num_tokens": 49069616.0, "step": 19360 }, { "entropy": 6.208149719238281, "epoch": 2.234852856318523, "grad_norm": 0.953125, "learning_rate": 0.00045085840963325716, "loss": 5.6743, "mean_token_accuracy": 0.20631023645401, "num_tokens": 49082001.0, "step": 19365 }, { "entropy": 6.286288022994995, "epoch": 2.2354298903635312, "grad_norm": 1.109375, "learning_rate": 0.0004508326664346967, "loss": 5.6213, "mean_token_accuracy": 0.20303625017404556, "num_tokens": 49094433.0, "step": 19370 }, { "entropy": 6.2155601501464846, "epoch": 2.23600692440854, "grad_norm": 1.015625, "learning_rate": 0.00045080691732209176, "loss": 5.6239, "mean_token_accuracy": 0.20596866607666015, "num_tokens": 49106152.0, "step": 19375 }, { "entropy": 6.198886299133301, "epoch": 2.236583958453549, "grad_norm": 1.0, "learning_rate": 0.00045078116229630864, "loss": 5.7094, "mean_token_accuracy": 0.20838077068328859, "num_tokens": 49120402.0, "step": 19380 }, { "entropy": 6.408450603485107, "epoch": 2.2371609924985574, "grad_norm": 0.953125, "learning_rate": 0.00045075540135821343, "loss": 5.8063, "mean_token_accuracy": 0.19086912870407105, "num_tokens": 49133571.0, "step": 19385 }, { "entropy": 6.3284543514251705, "epoch": 2.2377380265435662, "grad_norm": 0.94140625, "learning_rate": 0.0004507296345086725, "loss": 5.7951, "mean_token_accuracy": 0.19179506003856658, "num_tokens": 49147268.0, "step": 19390 }, { "entropy": 6.211698198318482, "epoch": 2.2383150605885747, "grad_norm": 1.0078125, "learning_rate": 0.0004507038617485526, "loss": 5.5474, "mean_token_accuracy": 0.2093621775507927, "num_tokens": 49159043.0, "step": 19395 }, { "entropy": 6.28239483833313, "epoch": 2.2388920946335835, "grad_norm": 0.984375, "learning_rate": 0.00045067808307872064, "loss": 5.6941, "mean_token_accuracy": 0.20465970486402513, "num_tokens": 49172164.0, "step": 19400 }, { "entropy": 6.266603231430054, "epoch": 2.239469128678592, "grad_norm": 1.109375, "learning_rate": 0.00045065229850004365, "loss": 5.6229, "mean_token_accuracy": 0.20876996964216232, "num_tokens": 49185023.0, "step": 19405 }, { "entropy": 6.300706672668457, "epoch": 2.240046162723601, "grad_norm": 0.95703125, "learning_rate": 0.0004506265080133888, "loss": 5.6982, "mean_token_accuracy": 0.1954214468598366, "num_tokens": 49198411.0, "step": 19410 }, { "entropy": 6.233200168609619, "epoch": 2.240623196768609, "grad_norm": 0.9453125, "learning_rate": 0.00045060071161962364, "loss": 5.6973, "mean_token_accuracy": 0.20337700098752975, "num_tokens": 49211162.0, "step": 19415 }, { "entropy": 6.248962163925171, "epoch": 2.241200230813618, "grad_norm": 1.0703125, "learning_rate": 0.0004505749093196158, "loss": 5.7028, "mean_token_accuracy": 0.2015640914440155, "num_tokens": 49223808.0, "step": 19420 }, { "entropy": 6.173385334014893, "epoch": 2.2417772648586265, "grad_norm": 0.98046875, "learning_rate": 0.000450549101114233, "loss": 5.6418, "mean_token_accuracy": 0.20374636054039003, "num_tokens": 49236947.0, "step": 19425 }, { "entropy": 6.301487636566162, "epoch": 2.2423542989036354, "grad_norm": 0.91015625, "learning_rate": 0.0004505232870043434, "loss": 5.7153, "mean_token_accuracy": 0.19642379581928254, "num_tokens": 49249932.0, "step": 19430 }, { "entropy": 6.284289312362671, "epoch": 2.2429313329486438, "grad_norm": 0.96484375, "learning_rate": 0.0004504974669908152, "loss": 5.7306, "mean_token_accuracy": 0.1982482597231865, "num_tokens": 49261783.0, "step": 19435 }, { "entropy": 6.331235694885254, "epoch": 2.2435083669936526, "grad_norm": 0.96484375, "learning_rate": 0.00045047164107451696, "loss": 5.7267, "mean_token_accuracy": 0.19769036918878555, "num_tokens": 49274495.0, "step": 19440 }, { "entropy": 6.240282869338989, "epoch": 2.244085401038661, "grad_norm": 0.97265625, "learning_rate": 0.0004504458092563172, "loss": 5.6726, "mean_token_accuracy": 0.19854051172733306, "num_tokens": 49288450.0, "step": 19445 }, { "entropy": 6.273891544342041, "epoch": 2.24466243508367, "grad_norm": 1.0078125, "learning_rate": 0.00045041997153708475, "loss": 5.7222, "mean_token_accuracy": 0.1992565721273422, "num_tokens": 49300612.0, "step": 19450 }, { "entropy": 6.257104921340942, "epoch": 2.2452394691286788, "grad_norm": 0.91796875, "learning_rate": 0.00045039412791768877, "loss": 5.7277, "mean_token_accuracy": 0.19571390450000764, "num_tokens": 49313860.0, "step": 19455 }, { "entropy": 6.289849805831909, "epoch": 2.245816503173687, "grad_norm": 1.015625, "learning_rate": 0.00045036827839899833, "loss": 5.6777, "mean_token_accuracy": 0.20335286408662795, "num_tokens": 49326864.0, "step": 19460 }, { "entropy": 6.28691840171814, "epoch": 2.246393537218696, "grad_norm": 0.89453125, "learning_rate": 0.00045034242298188303, "loss": 5.7374, "mean_token_accuracy": 0.19382706582546233, "num_tokens": 49339444.0, "step": 19465 }, { "entropy": 6.206280183792114, "epoch": 2.2469705712637045, "grad_norm": 0.95703125, "learning_rate": 0.0004503165616672124, "loss": 5.6207, "mean_token_accuracy": 0.2063739761710167, "num_tokens": 49352999.0, "step": 19470 }, { "entropy": 6.250473546981811, "epoch": 2.2475476053087133, "grad_norm": 0.984375, "learning_rate": 0.0004502906944558563, "loss": 5.6508, "mean_token_accuracy": 0.20927198231220245, "num_tokens": 49365600.0, "step": 19475 }, { "entropy": 6.343959617614746, "epoch": 2.2481246393537218, "grad_norm": 1.0234375, "learning_rate": 0.0004502648213486848, "loss": 5.7295, "mean_token_accuracy": 0.20067790150642395, "num_tokens": 49378121.0, "step": 19480 }, { "entropy": 6.210190200805664, "epoch": 2.2487016733987306, "grad_norm": 1.0, "learning_rate": 0.00045023894234656807, "loss": 5.7057, "mean_token_accuracy": 0.20189868211746215, "num_tokens": 49390889.0, "step": 19485 }, { "entropy": 6.330983686447143, "epoch": 2.249278707443739, "grad_norm": 0.859375, "learning_rate": 0.0004502130574503766, "loss": 5.7592, "mean_token_accuracy": 0.20028941184282303, "num_tokens": 49404613.0, "step": 19490 }, { "entropy": 6.301862335205078, "epoch": 2.249855741488748, "grad_norm": 0.99609375, "learning_rate": 0.0004501871666609809, "loss": 5.7354, "mean_token_accuracy": 0.19650717377662658, "num_tokens": 49416142.0, "step": 19495 }, { "entropy": 6.2688291549682615, "epoch": 2.2504327755337563, "grad_norm": 1.1171875, "learning_rate": 0.0004501612699792519, "loss": 5.642, "mean_token_accuracy": 0.198591947555542, "num_tokens": 49427848.0, "step": 19500 }, { "entropy": 6.340646886825562, "epoch": 2.251009809578765, "grad_norm": 0.9375, "learning_rate": 0.0004501353674060606, "loss": 5.8278, "mean_token_accuracy": 0.1921554610133171, "num_tokens": 49442338.0, "step": 19505 }, { "entropy": 6.329627513885498, "epoch": 2.251586843623774, "grad_norm": 1.0625, "learning_rate": 0.0004501094589422782, "loss": 5.6851, "mean_token_accuracy": 0.20651307106018066, "num_tokens": 49455565.0, "step": 19510 }, { "entropy": 6.277817964553833, "epoch": 2.2521638776687825, "grad_norm": 0.9453125, "learning_rate": 0.00045008354458877614, "loss": 5.6897, "mean_token_accuracy": 0.20428113937377929, "num_tokens": 49468894.0, "step": 19515 }, { "entropy": 6.164229202270508, "epoch": 2.252740911713791, "grad_norm": 0.91015625, "learning_rate": 0.000450057624346426, "loss": 5.5589, "mean_token_accuracy": 0.21396252065896987, "num_tokens": 49480324.0, "step": 19520 }, { "entropy": 6.2618499279022215, "epoch": 2.2533179457587997, "grad_norm": 0.93359375, "learning_rate": 0.00045003169821609967, "loss": 5.6568, "mean_token_accuracy": 0.2036493256688118, "num_tokens": 49493823.0, "step": 19525 }, { "entropy": 6.278878498077392, "epoch": 2.2538949798038086, "grad_norm": 1.0, "learning_rate": 0.00045000576619866914, "loss": 5.6117, "mean_token_accuracy": 0.2137911170721054, "num_tokens": 49506512.0, "step": 19530 }, { "entropy": 6.312352418899536, "epoch": 2.254472013848817, "grad_norm": 0.99609375, "learning_rate": 0.00044997982829500657, "loss": 5.6839, "mean_token_accuracy": 0.19806260019540786, "num_tokens": 49518424.0, "step": 19535 }, { "entropy": 6.261477041244507, "epoch": 2.255049047893826, "grad_norm": 0.9140625, "learning_rate": 0.00044995388450598436, "loss": 5.7309, "mean_token_accuracy": 0.20388685017824174, "num_tokens": 49531828.0, "step": 19540 }, { "entropy": 6.279758405685425, "epoch": 2.2556260819388343, "grad_norm": 0.921875, "learning_rate": 0.0004499279348324751, "loss": 5.649, "mean_token_accuracy": 0.19457512497901916, "num_tokens": 49545502.0, "step": 19545 }, { "entropy": 6.206504154205322, "epoch": 2.256203115983843, "grad_norm": 0.8984375, "learning_rate": 0.00044990197927535173, "loss": 5.6958, "mean_token_accuracy": 0.19898426085710524, "num_tokens": 49557323.0, "step": 19550 }, { "entropy": 6.1493871212005615, "epoch": 2.2567801500288516, "grad_norm": 1.046875, "learning_rate": 0.00044987601783548703, "loss": 5.5645, "mean_token_accuracy": 0.21585829854011535, "num_tokens": 49570149.0, "step": 19555 }, { "entropy": 6.267534399032593, "epoch": 2.2573571840738604, "grad_norm": 0.9765625, "learning_rate": 0.0004498500505137545, "loss": 5.6328, "mean_token_accuracy": 0.20815033465623856, "num_tokens": 49581866.0, "step": 19560 }, { "entropy": 6.190386343002319, "epoch": 2.257934218118869, "grad_norm": 1.0, "learning_rate": 0.0004498240773110273, "loss": 5.6434, "mean_token_accuracy": 0.20312456637620926, "num_tokens": 49592785.0, "step": 19565 }, { "entropy": 6.30643949508667, "epoch": 2.2585112521638777, "grad_norm": 0.9765625, "learning_rate": 0.0004497980982281791, "loss": 5.7865, "mean_token_accuracy": 0.2009749099612236, "num_tokens": 49604925.0, "step": 19570 }, { "entropy": 6.350605583190918, "epoch": 2.259088286208886, "grad_norm": 0.9140625, "learning_rate": 0.0004497721132660837, "loss": 5.7244, "mean_token_accuracy": 0.19735192358493805, "num_tokens": 49618548.0, "step": 19575 }, { "entropy": 6.258015203475952, "epoch": 2.259665320253895, "grad_norm": 0.97265625, "learning_rate": 0.00044974612242561516, "loss": 5.6902, "mean_token_accuracy": 0.20283384919166564, "num_tokens": 49631968.0, "step": 19580 }, { "entropy": 6.256459474563599, "epoch": 2.260242354298904, "grad_norm": 0.953125, "learning_rate": 0.0004497201257076475, "loss": 5.7116, "mean_token_accuracy": 0.2024211421608925, "num_tokens": 49645269.0, "step": 19585 }, { "entropy": 6.270970821380615, "epoch": 2.2608193883439123, "grad_norm": 0.984375, "learning_rate": 0.0004496941231130552, "loss": 5.6926, "mean_token_accuracy": 0.20178208351135254, "num_tokens": 49655903.0, "step": 19590 }, { "entropy": 6.352920770645142, "epoch": 2.261396422388921, "grad_norm": 0.9921875, "learning_rate": 0.0004496681146427129, "loss": 5.7618, "mean_token_accuracy": 0.1929154336452484, "num_tokens": 49667982.0, "step": 19595 }, { "entropy": 6.259737825393676, "epoch": 2.2619734564339296, "grad_norm": 0.88671875, "learning_rate": 0.00044964210029749523, "loss": 5.6242, "mean_token_accuracy": 0.20513436794281006, "num_tokens": 49681441.0, "step": 19600 }, { "entropy": 6.19245285987854, "epoch": 2.2625504904789384, "grad_norm": 0.8984375, "learning_rate": 0.00044961608007827736, "loss": 5.6149, "mean_token_accuracy": 0.21164268255233765, "num_tokens": 49695805.0, "step": 19605 }, { "entropy": 6.3116106510162355, "epoch": 2.263127524523947, "grad_norm": 1.015625, "learning_rate": 0.0004495900539859344, "loss": 5.7453, "mean_token_accuracy": 0.2014342427253723, "num_tokens": 49708762.0, "step": 19610 }, { "entropy": 6.244855976104736, "epoch": 2.2637045585689557, "grad_norm": 0.92578125, "learning_rate": 0.00044956402202134157, "loss": 5.6769, "mean_token_accuracy": 0.21064395904541017, "num_tokens": 49724570.0, "step": 19615 }, { "entropy": 6.311522483825684, "epoch": 2.264281592613964, "grad_norm": 0.9375, "learning_rate": 0.00044953798418537465, "loss": 5.7421, "mean_token_accuracy": 0.19412882030010223, "num_tokens": 49736060.0, "step": 19620 }, { "entropy": 6.288136529922485, "epoch": 2.264858626658973, "grad_norm": 0.9609375, "learning_rate": 0.0004495119404789093, "loss": 5.6887, "mean_token_accuracy": 0.20001592338085175, "num_tokens": 49748520.0, "step": 19625 }, { "entropy": 6.259233474731445, "epoch": 2.2654356607039814, "grad_norm": 0.93359375, "learning_rate": 0.0004494858909028216, "loss": 5.7547, "mean_token_accuracy": 0.19457891583442688, "num_tokens": 49761097.0, "step": 19630 }, { "entropy": 6.243998432159424, "epoch": 2.2660126947489903, "grad_norm": 0.93359375, "learning_rate": 0.0004494598354579875, "loss": 5.6599, "mean_token_accuracy": 0.2039832279086113, "num_tokens": 49773430.0, "step": 19635 }, { "entropy": 6.283785581588745, "epoch": 2.2665897287939987, "grad_norm": 1.015625, "learning_rate": 0.0004494337741452836, "loss": 5.6964, "mean_token_accuracy": 0.20121050328016282, "num_tokens": 49785525.0, "step": 19640 }, { "entropy": 6.272574615478516, "epoch": 2.2671667628390075, "grad_norm": 1.0546875, "learning_rate": 0.0004494077069655863, "loss": 5.7104, "mean_token_accuracy": 0.20026218593120576, "num_tokens": 49796650.0, "step": 19645 }, { "entropy": 6.2548116683959964, "epoch": 2.267743796884016, "grad_norm": 1.0234375, "learning_rate": 0.0004493816339197724, "loss": 5.6775, "mean_token_accuracy": 0.20387378036975862, "num_tokens": 49808191.0, "step": 19650 }, { "entropy": 6.276640319824219, "epoch": 2.268320830929025, "grad_norm": 0.98046875, "learning_rate": 0.00044935555500871897, "loss": 5.7046, "mean_token_accuracy": 0.20125204026699067, "num_tokens": 49820051.0, "step": 19655 }, { "entropy": 6.295619058609009, "epoch": 2.2688978649740337, "grad_norm": 0.9375, "learning_rate": 0.000449329470233303, "loss": 5.7228, "mean_token_accuracy": 0.19812791794538498, "num_tokens": 49835392.0, "step": 19660 }, { "entropy": 6.222367143630981, "epoch": 2.269474899019042, "grad_norm": 1.0, "learning_rate": 0.00044930337959440183, "loss": 5.6577, "mean_token_accuracy": 0.20379606783390045, "num_tokens": 49847344.0, "step": 19665 }, { "entropy": 6.295651435852051, "epoch": 2.270051933064051, "grad_norm": 0.9375, "learning_rate": 0.0004492772830928931, "loss": 5.7302, "mean_token_accuracy": 0.19512915164232253, "num_tokens": 49859741.0, "step": 19670 }, { "entropy": 6.276036500930786, "epoch": 2.2706289671090594, "grad_norm": 0.95703125, "learning_rate": 0.00044925118072965456, "loss": 5.6989, "mean_token_accuracy": 0.20129497200250626, "num_tokens": 49871565.0, "step": 19675 }, { "entropy": 6.219705247879029, "epoch": 2.2712060011540682, "grad_norm": 0.99609375, "learning_rate": 0.000449225072505564, "loss": 5.645, "mean_token_accuracy": 0.20144531279802322, "num_tokens": 49883405.0, "step": 19680 }, { "entropy": 6.287055253982544, "epoch": 2.2717830351990767, "grad_norm": 0.9921875, "learning_rate": 0.00044919895842149976, "loss": 5.7471, "mean_token_accuracy": 0.19765210449695586, "num_tokens": 49895924.0, "step": 19685 }, { "entropy": 6.23684401512146, "epoch": 2.2723600692440855, "grad_norm": 0.94921875, "learning_rate": 0.00044917283847834005, "loss": 5.6523, "mean_token_accuracy": 0.19993764013051987, "num_tokens": 49908506.0, "step": 19690 }, { "entropy": 6.29704647064209, "epoch": 2.272937103289094, "grad_norm": 1.03125, "learning_rate": 0.0004491467126769635, "loss": 5.7223, "mean_token_accuracy": 0.1992749884724617, "num_tokens": 49919917.0, "step": 19695 }, { "entropy": 6.228441858291626, "epoch": 2.273514137334103, "grad_norm": 1.0078125, "learning_rate": 0.00044912058101824866, "loss": 5.6465, "mean_token_accuracy": 0.20652550756931304, "num_tokens": 49932508.0, "step": 19700 }, { "entropy": 6.2381360054016115, "epoch": 2.274091171379111, "grad_norm": 1.0, "learning_rate": 0.00044909444350307463, "loss": 5.7107, "mean_token_accuracy": 0.20327081233263017, "num_tokens": 49945065.0, "step": 19705 }, { "entropy": 6.2598044872283936, "epoch": 2.27466820542412, "grad_norm": 1.0, "learning_rate": 0.0004490683001323205, "loss": 5.6279, "mean_token_accuracy": 0.2084788978099823, "num_tokens": 49957530.0, "step": 19710 }, { "entropy": 6.201219892501831, "epoch": 2.2752452394691285, "grad_norm": 1.265625, "learning_rate": 0.00044904215090686554, "loss": 5.5949, "mean_token_accuracy": 0.20651741623878478, "num_tokens": 49969760.0, "step": 19715 }, { "entropy": 6.252209281921386, "epoch": 2.2758222735141374, "grad_norm": 0.9765625, "learning_rate": 0.00044901599582758926, "loss": 5.7175, "mean_token_accuracy": 0.20343547612428664, "num_tokens": 49983151.0, "step": 19720 }, { "entropy": 6.259750556945801, "epoch": 2.2763993075591458, "grad_norm": 0.8984375, "learning_rate": 0.00044898983489537143, "loss": 5.6256, "mean_token_accuracy": 0.2036111459136009, "num_tokens": 49995262.0, "step": 19725 }, { "entropy": 6.289621210098266, "epoch": 2.2769763416041546, "grad_norm": 1.09375, "learning_rate": 0.000448963668111092, "loss": 5.6857, "mean_token_accuracy": 0.19986894577741623, "num_tokens": 50007153.0, "step": 19730 }, { "entropy": 6.1917328357696535, "epoch": 2.2775533756491635, "grad_norm": 0.94140625, "learning_rate": 0.00044893749547563085, "loss": 5.6719, "mean_token_accuracy": 0.20763412564992906, "num_tokens": 50020145.0, "step": 19735 }, { "entropy": 6.243492603302002, "epoch": 2.278130409694172, "grad_norm": 1.046875, "learning_rate": 0.00044891131698986846, "loss": 5.6842, "mean_token_accuracy": 0.19811105132102966, "num_tokens": 50032741.0, "step": 19740 }, { "entropy": 6.239491748809814, "epoch": 2.2787074437391808, "grad_norm": 1.0, "learning_rate": 0.0004488851326546854, "loss": 5.7194, "mean_token_accuracy": 0.19922717809677123, "num_tokens": 50046112.0, "step": 19745 }, { "entropy": 6.275479888916015, "epoch": 2.279284477784189, "grad_norm": 0.984375, "learning_rate": 0.0004488589424709622, "loss": 5.6932, "mean_token_accuracy": 0.20576501041650772, "num_tokens": 50058718.0, "step": 19750 }, { "entropy": 6.196004152297974, "epoch": 2.279861511829198, "grad_norm": 1.0390625, "learning_rate": 0.0004488327464395799, "loss": 5.6223, "mean_token_accuracy": 0.20243488848209382, "num_tokens": 50071759.0, "step": 19755 }, { "entropy": 6.277880620956421, "epoch": 2.2804385458742065, "grad_norm": 0.96484375, "learning_rate": 0.0004488065445614195, "loss": 5.6598, "mean_token_accuracy": 0.2045716404914856, "num_tokens": 50083948.0, "step": 19760 }, { "entropy": 6.241612482070923, "epoch": 2.2810155799192153, "grad_norm": 1.0078125, "learning_rate": 0.0004487803368373623, "loss": 5.6438, "mean_token_accuracy": 0.20779716223478317, "num_tokens": 50097310.0, "step": 19765 }, { "entropy": 6.1986939907073975, "epoch": 2.2815926139642237, "grad_norm": 0.921875, "learning_rate": 0.0004487541232682898, "loss": 5.6918, "mean_token_accuracy": 0.20480042099952697, "num_tokens": 50109939.0, "step": 19770 }, { "entropy": 6.297293043136596, "epoch": 2.2821696480092326, "grad_norm": 0.953125, "learning_rate": 0.0004487279038550836, "loss": 5.7475, "mean_token_accuracy": 0.19697188287973405, "num_tokens": 50120651.0, "step": 19775 }, { "entropy": 6.284278392791748, "epoch": 2.282746682054241, "grad_norm": 0.96484375, "learning_rate": 0.0004487016785986258, "loss": 5.6821, "mean_token_accuracy": 0.20540768802165985, "num_tokens": 50133180.0, "step": 19780 }, { "entropy": 6.259939765930175, "epoch": 2.28332371609925, "grad_norm": 0.91796875, "learning_rate": 0.00044867544749979817, "loss": 5.6934, "mean_token_accuracy": 0.2011975407600403, "num_tokens": 50144808.0, "step": 19785 }, { "entropy": 6.242081022262573, "epoch": 2.2839007501442588, "grad_norm": 0.9765625, "learning_rate": 0.00044864921055948317, "loss": 5.648, "mean_token_accuracy": 0.20324725955724715, "num_tokens": 50157487.0, "step": 19790 }, { "entropy": 6.274213600158691, "epoch": 2.284477784189267, "grad_norm": 0.99609375, "learning_rate": 0.00044862296777856326, "loss": 5.7191, "mean_token_accuracy": 0.19910815358161926, "num_tokens": 50171837.0, "step": 19795 }, { "entropy": 6.262651777267456, "epoch": 2.2850548182342756, "grad_norm": 0.9296875, "learning_rate": 0.0004485967191579211, "loss": 5.6147, "mean_token_accuracy": 0.21335643529891968, "num_tokens": 50184802.0, "step": 19800 }, { "entropy": 6.248020982742309, "epoch": 2.2856318522792844, "grad_norm": 1.0234375, "learning_rate": 0.0004485704646984394, "loss": 5.6945, "mean_token_accuracy": 0.1977355048060417, "num_tokens": 50196433.0, "step": 19805 }, { "entropy": 6.22298641204834, "epoch": 2.2862088863242933, "grad_norm": 0.9375, "learning_rate": 0.0004485442044010015, "loss": 5.632, "mean_token_accuracy": 0.21534291952848433, "num_tokens": 50209549.0, "step": 19810 }, { "entropy": 6.359181070327759, "epoch": 2.2867859203693017, "grad_norm": 1.0, "learning_rate": 0.0004485179382664904, "loss": 5.7947, "mean_token_accuracy": 0.19366897642612457, "num_tokens": 50220691.0, "step": 19815 }, { "entropy": 6.368267250061035, "epoch": 2.2873629544143106, "grad_norm": 0.953125, "learning_rate": 0.0004484916662957896, "loss": 5.7792, "mean_token_accuracy": 0.19695059061050416, "num_tokens": 50233003.0, "step": 19820 }, { "entropy": 6.260522842407227, "epoch": 2.287939988459319, "grad_norm": 0.9921875, "learning_rate": 0.0004484653884897829, "loss": 5.6793, "mean_token_accuracy": 0.1978773593902588, "num_tokens": 50244742.0, "step": 19825 }, { "entropy": 6.151585578918457, "epoch": 2.288517022504328, "grad_norm": 1.09375, "learning_rate": 0.00044843910484935394, "loss": 5.5735, "mean_token_accuracy": 0.2117750972509384, "num_tokens": 50258188.0, "step": 19830 }, { "entropy": 6.287138366699219, "epoch": 2.2890940565493363, "grad_norm": 0.984375, "learning_rate": 0.0004484128153753868, "loss": 5.7306, "mean_token_accuracy": 0.20295771360397338, "num_tokens": 50271155.0, "step": 19835 }, { "entropy": 6.346404504776001, "epoch": 2.289671090594345, "grad_norm": 0.8828125, "learning_rate": 0.00044838652006876583, "loss": 5.7226, "mean_token_accuracy": 0.20089610815048217, "num_tokens": 50283518.0, "step": 19840 }, { "entropy": 6.179970598220825, "epoch": 2.2902481246393536, "grad_norm": 0.98828125, "learning_rate": 0.00044836021893037537, "loss": 5.6065, "mean_token_accuracy": 0.21166497617959976, "num_tokens": 50296208.0, "step": 19845 }, { "entropy": 6.183140087127685, "epoch": 2.2908251586843624, "grad_norm": 0.9296875, "learning_rate": 0.0004483339119611001, "loss": 5.62, "mean_token_accuracy": 0.21188974529504775, "num_tokens": 50309111.0, "step": 19850 }, { "entropy": 6.266731452941895, "epoch": 2.291402192729371, "grad_norm": 0.94140625, "learning_rate": 0.00044830759916182476, "loss": 5.7215, "mean_token_accuracy": 0.19990355223417283, "num_tokens": 50321895.0, "step": 19855 }, { "entropy": 6.300902700424194, "epoch": 2.2919792267743797, "grad_norm": 0.99609375, "learning_rate": 0.0004482812805334344, "loss": 5.7463, "mean_token_accuracy": 0.19138864129781724, "num_tokens": 50335769.0, "step": 19860 }, { "entropy": 6.308612489700318, "epoch": 2.2925562608193886, "grad_norm": 0.984375, "learning_rate": 0.0004482549560768142, "loss": 5.6856, "mean_token_accuracy": 0.20473549962043763, "num_tokens": 50348576.0, "step": 19865 }, { "entropy": 6.246194124221802, "epoch": 2.293133294864397, "grad_norm": 1.0, "learning_rate": 0.0004482286257928497, "loss": 5.7056, "mean_token_accuracy": 0.1999507576227188, "num_tokens": 50360652.0, "step": 19870 }, { "entropy": 6.179588699340821, "epoch": 2.293710328909406, "grad_norm": 1.0, "learning_rate": 0.0004482022896824263, "loss": 5.6761, "mean_token_accuracy": 0.19982111304998398, "num_tokens": 50373256.0, "step": 19875 }, { "entropy": 6.262630033493042, "epoch": 2.2942873629544143, "grad_norm": 0.9453125, "learning_rate": 0.00044817594774643004, "loss": 5.6015, "mean_token_accuracy": 0.20998111516237258, "num_tokens": 50385245.0, "step": 19880 }, { "entropy": 6.278105211257935, "epoch": 2.294864396999423, "grad_norm": 0.96875, "learning_rate": 0.00044814959998574675, "loss": 5.7173, "mean_token_accuracy": 0.19566212147474288, "num_tokens": 50397276.0, "step": 19885 }, { "entropy": 6.310760498046875, "epoch": 2.2954414310444315, "grad_norm": 0.95703125, "learning_rate": 0.00044812324640126265, "loss": 5.7995, "mean_token_accuracy": 0.19371946156024933, "num_tokens": 50409725.0, "step": 19890 }, { "entropy": 6.30986967086792, "epoch": 2.2960184650894404, "grad_norm": 1.046875, "learning_rate": 0.0004480968869938642, "loss": 5.7358, "mean_token_accuracy": 0.19498946964740754, "num_tokens": 50421987.0, "step": 19895 }, { "entropy": 6.255093336105347, "epoch": 2.296595499134449, "grad_norm": 0.86328125, "learning_rate": 0.00044807052176443793, "loss": 5.6393, "mean_token_accuracy": 0.21141475737094878, "num_tokens": 50436153.0, "step": 19900 }, { "entropy": 6.2507484436035154, "epoch": 2.2971725331794577, "grad_norm": 0.92578125, "learning_rate": 0.00044804415071387067, "loss": 5.7516, "mean_token_accuracy": 0.20144218802452088, "num_tokens": 50449683.0, "step": 19905 }, { "entropy": 6.172179746627807, "epoch": 2.297749567224466, "grad_norm": 0.98046875, "learning_rate": 0.0004480177738430492, "loss": 5.5576, "mean_token_accuracy": 0.21170271188020706, "num_tokens": 50461535.0, "step": 19910 }, { "entropy": 6.247416591644287, "epoch": 2.298326601269475, "grad_norm": 0.921875, "learning_rate": 0.00044799139115286104, "loss": 5.6759, "mean_token_accuracy": 0.1969045430421829, "num_tokens": 50476094.0, "step": 19915 }, { "entropy": 6.292913627624512, "epoch": 2.2989036353144834, "grad_norm": 1.015625, "learning_rate": 0.0004479650026441933, "loss": 5.6821, "mean_token_accuracy": 0.19706797301769258, "num_tokens": 50488751.0, "step": 19920 }, { "entropy": 6.302343368530273, "epoch": 2.2994806693594922, "grad_norm": 1.265625, "learning_rate": 0.00044793860831793356, "loss": 5.667, "mean_token_accuracy": 0.20249564349651336, "num_tokens": 50502272.0, "step": 19925 }, { "entropy": 6.268003511428833, "epoch": 2.3000577034045007, "grad_norm": 1.0078125, "learning_rate": 0.00044791220817496963, "loss": 5.6962, "mean_token_accuracy": 0.19340673238039016, "num_tokens": 50514792.0, "step": 19930 }, { "entropy": 6.189672327041626, "epoch": 2.3006347374495095, "grad_norm": 0.93359375, "learning_rate": 0.0004478858022161895, "loss": 5.6096, "mean_token_accuracy": 0.2113632693886757, "num_tokens": 50528484.0, "step": 19935 }, { "entropy": 6.3625153541564945, "epoch": 2.3012117714945184, "grad_norm": 0.98828125, "learning_rate": 0.0004478593904424813, "loss": 5.7847, "mean_token_accuracy": 0.1942471295595169, "num_tokens": 50540737.0, "step": 19940 }, { "entropy": 6.25290060043335, "epoch": 2.301788805539527, "grad_norm": 0.9453125, "learning_rate": 0.0004478329728547334, "loss": 5.6936, "mean_token_accuracy": 0.20512138158082963, "num_tokens": 50553819.0, "step": 19945 }, { "entropy": 6.2829841613769535, "epoch": 2.3023658395845357, "grad_norm": 0.9609375, "learning_rate": 0.00044780654945383424, "loss": 5.7354, "mean_token_accuracy": 0.2017420634627342, "num_tokens": 50566275.0, "step": 19950 }, { "entropy": 6.278318548202515, "epoch": 2.302942873629544, "grad_norm": 1.0546875, "learning_rate": 0.00044778012024067267, "loss": 5.681, "mean_token_accuracy": 0.20539594292640687, "num_tokens": 50577653.0, "step": 19955 }, { "entropy": 6.310393190383911, "epoch": 2.303519907674553, "grad_norm": 1.0234375, "learning_rate": 0.0004477536852161376, "loss": 5.7271, "mean_token_accuracy": 0.1932803899049759, "num_tokens": 50590237.0, "step": 19960 }, { "entropy": 6.186036014556885, "epoch": 2.3040969417195614, "grad_norm": 1.0390625, "learning_rate": 0.0004477272443811181, "loss": 5.6042, "mean_token_accuracy": 0.19824027866125107, "num_tokens": 50602333.0, "step": 19965 }, { "entropy": 6.335505819320678, "epoch": 2.3046739757645702, "grad_norm": 0.97265625, "learning_rate": 0.0004477007977365035, "loss": 5.7524, "mean_token_accuracy": 0.19401074647903443, "num_tokens": 50614232.0, "step": 19970 }, { "entropy": 6.3040093898773195, "epoch": 2.3052510098095786, "grad_norm": 0.98046875, "learning_rate": 0.0004476743452831834, "loss": 5.6889, "mean_token_accuracy": 0.2003216937184334, "num_tokens": 50627959.0, "step": 19975 }, { "entropy": 6.198862886428833, "epoch": 2.3058280438545875, "grad_norm": 1.0234375, "learning_rate": 0.00044764788702204747, "loss": 5.587, "mean_token_accuracy": 0.21014727056026458, "num_tokens": 50639962.0, "step": 19980 }, { "entropy": 6.264612627029419, "epoch": 2.306405077899596, "grad_norm": 0.91015625, "learning_rate": 0.0004476214229539856, "loss": 5.6996, "mean_token_accuracy": 0.20357227176427842, "num_tokens": 50652291.0, "step": 19985 }, { "entropy": 6.288990640640259, "epoch": 2.306982111944605, "grad_norm": 0.97265625, "learning_rate": 0.0004475949530798879, "loss": 5.6989, "mean_token_accuracy": 0.19868904054164888, "num_tokens": 50664993.0, "step": 19990 }, { "entropy": 6.187899351119995, "epoch": 2.307559145989613, "grad_norm": 1.03125, "learning_rate": 0.00044756847740064475, "loss": 5.5424, "mean_token_accuracy": 0.19761182218790055, "num_tokens": 50677846.0, "step": 19995 }, { "entropy": 6.221263217926025, "epoch": 2.308136180034622, "grad_norm": 0.9140625, "learning_rate": 0.0004475419959171465, "loss": 5.6128, "mean_token_accuracy": 0.21344971507787705, "num_tokens": 50691068.0, "step": 20000 }, { "entropy": 6.230750799179077, "epoch": 2.3087132140796305, "grad_norm": 0.953125, "learning_rate": 0.000447515508630284, "loss": 5.6977, "mean_token_accuracy": 0.20123774111270903, "num_tokens": 50703663.0, "step": 20005 }, { "entropy": 6.312432861328125, "epoch": 2.3092902481246393, "grad_norm": 0.95703125, "learning_rate": 0.00044748901554094806, "loss": 5.6947, "mean_token_accuracy": 0.20297775119543077, "num_tokens": 50715709.0, "step": 20010 }, { "entropy": 6.248737716674805, "epoch": 2.309867282169648, "grad_norm": 0.96875, "learning_rate": 0.0004474625166500297, "loss": 5.6769, "mean_token_accuracy": 0.2087046891450882, "num_tokens": 50727700.0, "step": 20015 }, { "entropy": 6.259288597106933, "epoch": 2.3104443162146566, "grad_norm": 1.015625, "learning_rate": 0.00044743601195842026, "loss": 5.6259, "mean_token_accuracy": 0.20704087764024734, "num_tokens": 50740604.0, "step": 20020 }, { "entropy": 6.351035213470459, "epoch": 2.3110213502596655, "grad_norm": 0.984375, "learning_rate": 0.00044740950146701127, "loss": 5.774, "mean_token_accuracy": 0.1978513553738594, "num_tokens": 50753666.0, "step": 20025 }, { "entropy": 6.229120397567749, "epoch": 2.311598384304674, "grad_norm": 0.92578125, "learning_rate": 0.0004473829851766943, "loss": 5.7331, "mean_token_accuracy": 0.1979401797056198, "num_tokens": 50766324.0, "step": 20030 }, { "entropy": 6.312212944030762, "epoch": 2.3121754183496828, "grad_norm": 1.0078125, "learning_rate": 0.0004473564630883612, "loss": 5.7301, "mean_token_accuracy": 0.2022898778319359, "num_tokens": 50779037.0, "step": 20035 }, { "entropy": 6.262638854980469, "epoch": 2.312752452394691, "grad_norm": 0.95703125, "learning_rate": 0.0004473299352029042, "loss": 5.6611, "mean_token_accuracy": 0.20583394020795823, "num_tokens": 50791089.0, "step": 20040 }, { "entropy": 6.221489095687867, "epoch": 2.3133294864397, "grad_norm": 0.97265625, "learning_rate": 0.0004473034015212154, "loss": 5.6526, "mean_token_accuracy": 0.1966189831495285, "num_tokens": 50803608.0, "step": 20045 }, { "entropy": 6.242483282089234, "epoch": 2.3139065204847085, "grad_norm": 0.9453125, "learning_rate": 0.0004472768620441872, "loss": 5.6904, "mean_token_accuracy": 0.19912586808204652, "num_tokens": 50815712.0, "step": 20050 }, { "entropy": 6.3092294216156, "epoch": 2.3144835545297173, "grad_norm": 0.97265625, "learning_rate": 0.00044725031677271234, "loss": 5.6188, "mean_token_accuracy": 0.2108631983399391, "num_tokens": 50827409.0, "step": 20055 }, { "entropy": 6.226622200012207, "epoch": 2.3150605885747257, "grad_norm": 0.94921875, "learning_rate": 0.0004472237657076837, "loss": 5.6465, "mean_token_accuracy": 0.20455507636070253, "num_tokens": 50840901.0, "step": 20060 }, { "entropy": 6.299163818359375, "epoch": 2.3156376226197346, "grad_norm": 0.96484375, "learning_rate": 0.0004471972088499942, "loss": 5.7315, "mean_token_accuracy": 0.1961276039481163, "num_tokens": 50854453.0, "step": 20065 }, { "entropy": 6.350008344650268, "epoch": 2.3162146566647435, "grad_norm": 0.96484375, "learning_rate": 0.0004471706462005371, "loss": 5.6954, "mean_token_accuracy": 0.19643843322992324, "num_tokens": 50866566.0, "step": 20070 }, { "entropy": 6.212463426589966, "epoch": 2.316791690709752, "grad_norm": 1.1484375, "learning_rate": 0.0004471440777602059, "loss": 5.6575, "mean_token_accuracy": 0.20321660935878755, "num_tokens": 50879695.0, "step": 20075 }, { "entropy": 6.194079113006592, "epoch": 2.3173687247547603, "grad_norm": 0.9765625, "learning_rate": 0.00044711750352989407, "loss": 5.5996, "mean_token_accuracy": 0.20679421722888947, "num_tokens": 50892350.0, "step": 20080 }, { "entropy": 6.2928242683410645, "epoch": 2.317945758799769, "grad_norm": 0.953125, "learning_rate": 0.0004470909235104956, "loss": 5.7393, "mean_token_accuracy": 0.2002371221780777, "num_tokens": 50905899.0, "step": 20085 }, { "entropy": 6.287396478652954, "epoch": 2.318522792844778, "grad_norm": 0.9140625, "learning_rate": 0.0004470643377029043, "loss": 5.6599, "mean_token_accuracy": 0.20983583927154542, "num_tokens": 50919698.0, "step": 20090 }, { "entropy": 6.309205389022827, "epoch": 2.3190998268897864, "grad_norm": 0.96875, "learning_rate": 0.0004470377461080145, "loss": 5.744, "mean_token_accuracy": 0.20514176189899444, "num_tokens": 50932236.0, "step": 20095 }, { "entropy": 6.264718341827392, "epoch": 2.3196768609347953, "grad_norm": 0.8984375, "learning_rate": 0.0004470111487267206, "loss": 5.6731, "mean_token_accuracy": 0.20396852046251296, "num_tokens": 50945403.0, "step": 20100 }, { "entropy": 6.269400930404663, "epoch": 2.3202538949798037, "grad_norm": 0.99609375, "learning_rate": 0.0004469845455599171, "loss": 5.6767, "mean_token_accuracy": 0.19957065880298613, "num_tokens": 50958854.0, "step": 20105 }, { "entropy": 6.345641183853149, "epoch": 2.3208309290248126, "grad_norm": 1.0234375, "learning_rate": 0.0004469579366084989, "loss": 5.7477, "mean_token_accuracy": 0.19639746844768524, "num_tokens": 50971545.0, "step": 20110 }, { "entropy": 6.304386758804322, "epoch": 2.321407963069821, "grad_norm": 0.9453125, "learning_rate": 0.00044693132187336094, "loss": 5.7429, "mean_token_accuracy": 0.19700338542461396, "num_tokens": 50985282.0, "step": 20115 }, { "entropy": 6.257296991348267, "epoch": 2.32198499711483, "grad_norm": 0.94140625, "learning_rate": 0.0004469047013553983, "loss": 5.6737, "mean_token_accuracy": 0.20432363003492354, "num_tokens": 50998063.0, "step": 20120 }, { "entropy": 6.239012908935547, "epoch": 2.3225620311598383, "grad_norm": 0.921875, "learning_rate": 0.00044687807505550646, "loss": 5.6595, "mean_token_accuracy": 0.20608614087104798, "num_tokens": 51011413.0, "step": 20125 }, { "entropy": 6.223509073257446, "epoch": 2.323139065204847, "grad_norm": 0.94140625, "learning_rate": 0.00044685144297458096, "loss": 5.6548, "mean_token_accuracy": 0.20884050726890563, "num_tokens": 51023861.0, "step": 20130 }, { "entropy": 6.280037975311279, "epoch": 2.3237160992498556, "grad_norm": 0.953125, "learning_rate": 0.00044682480511351754, "loss": 5.6432, "mean_token_accuracy": 0.20675942450761794, "num_tokens": 51035891.0, "step": 20135 }, { "entropy": 6.2503454208374025, "epoch": 2.3242931332948644, "grad_norm": 1.0078125, "learning_rate": 0.0004467981614732121, "loss": 5.6414, "mean_token_accuracy": 0.2052238777279854, "num_tokens": 51048115.0, "step": 20140 }, { "entropy": 6.263721990585327, "epoch": 2.3248701673398733, "grad_norm": 0.921875, "learning_rate": 0.00044677151205456086, "loss": 5.6669, "mean_token_accuracy": 0.19978864639997482, "num_tokens": 51061503.0, "step": 20145 }, { "entropy": 6.283975648880005, "epoch": 2.3254472013848817, "grad_norm": 0.97265625, "learning_rate": 0.0004467448568584601, "loss": 5.7173, "mean_token_accuracy": 0.2011381208896637, "num_tokens": 51074052.0, "step": 20150 }, { "entropy": 6.3093095302581785, "epoch": 2.32602423542989, "grad_norm": 0.875, "learning_rate": 0.0004467181958858064, "loss": 5.7431, "mean_token_accuracy": 0.20208009481430053, "num_tokens": 51089456.0, "step": 20155 }, { "entropy": 6.306753873825073, "epoch": 2.326601269474899, "grad_norm": 0.97265625, "learning_rate": 0.0004466915291374965, "loss": 5.7069, "mean_token_accuracy": 0.19960661828517914, "num_tokens": 51102835.0, "step": 20160 }, { "entropy": 6.306112909317017, "epoch": 2.327178303519908, "grad_norm": 0.92578125, "learning_rate": 0.0004466648566144273, "loss": 5.7314, "mean_token_accuracy": 0.19776588380336763, "num_tokens": 51115472.0, "step": 20165 }, { "entropy": 6.299116325378418, "epoch": 2.3277553375649163, "grad_norm": 1.078125, "learning_rate": 0.000446638178317496, "loss": 5.6569, "mean_token_accuracy": 0.2033730775117874, "num_tokens": 51129768.0, "step": 20170 }, { "entropy": 6.275330448150635, "epoch": 2.328332371609925, "grad_norm": 0.9375, "learning_rate": 0.00044661149424759974, "loss": 5.6706, "mean_token_accuracy": 0.20418451279401778, "num_tokens": 51143517.0, "step": 20175 }, { "entropy": 6.206835556030273, "epoch": 2.3289094056549335, "grad_norm": 1.21875, "learning_rate": 0.0004465848044056361, "loss": 5.5095, "mean_token_accuracy": 0.21552657186985016, "num_tokens": 51157235.0, "step": 20180 }, { "entropy": 6.281242322921753, "epoch": 2.3294864396999424, "grad_norm": 0.92578125, "learning_rate": 0.0004465581087925028, "loss": 5.6846, "mean_token_accuracy": 0.20341511964797973, "num_tokens": 51169061.0, "step": 20185 }, { "entropy": 6.2411112785339355, "epoch": 2.330063473744951, "grad_norm": 1.1171875, "learning_rate": 0.0004465314074090978, "loss": 5.6873, "mean_token_accuracy": 0.19719644337892533, "num_tokens": 51181063.0, "step": 20190 }, { "entropy": 6.25082573890686, "epoch": 2.3306405077899597, "grad_norm": 0.9609375, "learning_rate": 0.00044650470025631904, "loss": 5.6214, "mean_token_accuracy": 0.20618860125541688, "num_tokens": 51193536.0, "step": 20195 }, { "entropy": 6.234523773193359, "epoch": 2.331217541834968, "grad_norm": 0.96484375, "learning_rate": 0.0004464779873350649, "loss": 5.6142, "mean_token_accuracy": 0.21316068172454833, "num_tokens": 51205960.0, "step": 20200 }, { "entropy": 6.296325969696045, "epoch": 2.331794575879977, "grad_norm": 0.921875, "learning_rate": 0.0004464512686462339, "loss": 5.7834, "mean_token_accuracy": 0.20003315955400466, "num_tokens": 51219227.0, "step": 20205 }, { "entropy": 6.323716688156128, "epoch": 2.3323716099249854, "grad_norm": 0.9453125, "learning_rate": 0.00044642454419072455, "loss": 5.6514, "mean_token_accuracy": 0.2024744465947151, "num_tokens": 51232781.0, "step": 20210 }, { "entropy": 6.2382483959198, "epoch": 2.3329486439699942, "grad_norm": 0.97265625, "learning_rate": 0.0004463978139694358, "loss": 5.6744, "mean_token_accuracy": 0.20180849730968475, "num_tokens": 51245574.0, "step": 20215 }, { "entropy": 6.261038494110108, "epoch": 2.333525678015003, "grad_norm": 0.953125, "learning_rate": 0.00044637107798326675, "loss": 5.7009, "mean_token_accuracy": 0.1989492028951645, "num_tokens": 51258710.0, "step": 20220 }, { "entropy": 6.362938356399536, "epoch": 2.3341027120600115, "grad_norm": 0.95703125, "learning_rate": 0.0004463443362331166, "loss": 5.7797, "mean_token_accuracy": 0.20133419930934907, "num_tokens": 51270382.0, "step": 20225 }, { "entropy": 6.2769464492797855, "epoch": 2.3346797461050204, "grad_norm": 0.9296875, "learning_rate": 0.00044631758871988486, "loss": 5.7646, "mean_token_accuracy": 0.19585290253162385, "num_tokens": 51283923.0, "step": 20230 }, { "entropy": 6.329458999633789, "epoch": 2.335256780150029, "grad_norm": 1.171875, "learning_rate": 0.0004462908354444711, "loss": 5.7254, "mean_token_accuracy": 0.1990818738937378, "num_tokens": 51297671.0, "step": 20235 }, { "entropy": 6.3086357593536375, "epoch": 2.3358338141950377, "grad_norm": 0.91796875, "learning_rate": 0.0004462640764077751, "loss": 5.6835, "mean_token_accuracy": 0.2007381275296211, "num_tokens": 51309339.0, "step": 20240 }, { "entropy": 6.273665523529052, "epoch": 2.336410848240046, "grad_norm": 0.953125, "learning_rate": 0.0004462373116106971, "loss": 5.7941, "mean_token_accuracy": 0.1993747517466545, "num_tokens": 51321479.0, "step": 20245 }, { "entropy": 6.256979846954346, "epoch": 2.336987882285055, "grad_norm": 0.984375, "learning_rate": 0.00044621054105413704, "loss": 5.7192, "mean_token_accuracy": 0.19843647629022598, "num_tokens": 51335135.0, "step": 20250 }, { "entropy": 6.226361513137817, "epoch": 2.3375649163300634, "grad_norm": 1.0234375, "learning_rate": 0.00044618376473899555, "loss": 5.6681, "mean_token_accuracy": 0.20416603982448578, "num_tokens": 51346556.0, "step": 20255 }, { "entropy": 6.18687252998352, "epoch": 2.338141950375072, "grad_norm": 1.734375, "learning_rate": 0.0004461569826661732, "loss": 5.5636, "mean_token_accuracy": 0.21304285377264023, "num_tokens": 51359692.0, "step": 20260 }, { "entropy": 6.295094442367554, "epoch": 2.3387189844200806, "grad_norm": 0.98828125, "learning_rate": 0.0004461301948365707, "loss": 5.6772, "mean_token_accuracy": 0.19782449454069137, "num_tokens": 51371682.0, "step": 20265 }, { "entropy": 6.272954797744751, "epoch": 2.3392960184650895, "grad_norm": 1.0390625, "learning_rate": 0.0004461034012510891, "loss": 5.725, "mean_token_accuracy": 0.20265191793441772, "num_tokens": 51383533.0, "step": 20270 }, { "entropy": 6.267000722885132, "epoch": 2.339873052510098, "grad_norm": 0.94921875, "learning_rate": 0.00044607660191062963, "loss": 5.6615, "mean_token_accuracy": 0.20510787516832352, "num_tokens": 51395696.0, "step": 20275 }, { "entropy": 6.215906572341919, "epoch": 2.340450086555107, "grad_norm": 1.0, "learning_rate": 0.00044604979681609364, "loss": 5.6255, "mean_token_accuracy": 0.20820956826210021, "num_tokens": 51408460.0, "step": 20280 }, { "entropy": 6.187142848968506, "epoch": 2.341027120600115, "grad_norm": 0.93359375, "learning_rate": 0.00044602298596838264, "loss": 5.619, "mean_token_accuracy": 0.20651773512363433, "num_tokens": 51420768.0, "step": 20285 }, { "entropy": 6.261281728744507, "epoch": 2.341604154645124, "grad_norm": 0.88671875, "learning_rate": 0.00044599616936839853, "loss": 5.6743, "mean_token_accuracy": 0.20559660345315933, "num_tokens": 51434429.0, "step": 20290 }, { "entropy": 6.310505104064942, "epoch": 2.342181188690133, "grad_norm": 0.98828125, "learning_rate": 0.0004459693470170432, "loss": 5.7352, "mean_token_accuracy": 0.20220571756362915, "num_tokens": 51447146.0, "step": 20295 }, { "entropy": 6.275731611251831, "epoch": 2.3427582227351413, "grad_norm": 1.0078125, "learning_rate": 0.0004459425189152187, "loss": 5.6227, "mean_token_accuracy": 0.20923758745193483, "num_tokens": 51458656.0, "step": 20300 }, { "entropy": 6.15320463180542, "epoch": 2.34333525678015, "grad_norm": 0.90625, "learning_rate": 0.00044591568506382757, "loss": 5.5173, "mean_token_accuracy": 0.21781913489103316, "num_tokens": 51473350.0, "step": 20305 }, { "entropy": 6.280113744735718, "epoch": 2.3439122908251586, "grad_norm": 0.8984375, "learning_rate": 0.00044588884546377226, "loss": 5.6646, "mean_token_accuracy": 0.2047184869647026, "num_tokens": 51486801.0, "step": 20310 }, { "entropy": 6.246380805969238, "epoch": 2.3444893248701675, "grad_norm": 0.96875, "learning_rate": 0.0004458620001159555, "loss": 5.6899, "mean_token_accuracy": 0.2027744859457016, "num_tokens": 51499217.0, "step": 20315 }, { "entropy": 6.26472282409668, "epoch": 2.345066358915176, "grad_norm": 1.0546875, "learning_rate": 0.0004458351490212803, "loss": 5.7649, "mean_token_accuracy": 0.19978072494268417, "num_tokens": 51511714.0, "step": 20320 }, { "entropy": 6.229470682144165, "epoch": 2.3456433929601848, "grad_norm": 0.9765625, "learning_rate": 0.00044580829218064964, "loss": 5.6106, "mean_token_accuracy": 0.20698875188827515, "num_tokens": 51522725.0, "step": 20325 }, { "entropy": 6.3298228740692135, "epoch": 2.346220427005193, "grad_norm": 1.015625, "learning_rate": 0.000445781429594967, "loss": 5.6844, "mean_token_accuracy": 0.20495259165763854, "num_tokens": 51535178.0, "step": 20330 }, { "entropy": 6.310057067871094, "epoch": 2.346797461050202, "grad_norm": 1.078125, "learning_rate": 0.0004457545612651357, "loss": 5.7986, "mean_token_accuracy": 0.1921558916568756, "num_tokens": 51546859.0, "step": 20335 }, { "entropy": 6.307834815979004, "epoch": 2.3473744950952105, "grad_norm": 0.96875, "learning_rate": 0.00044572768719205964, "loss": 5.6828, "mean_token_accuracy": 0.20095667690038682, "num_tokens": 51558719.0, "step": 20340 }, { "entropy": 6.312375783920288, "epoch": 2.3479515291402193, "grad_norm": 0.953125, "learning_rate": 0.00044570080737664264, "loss": 5.7476, "mean_token_accuracy": 0.1949980840086937, "num_tokens": 51570630.0, "step": 20345 }, { "entropy": 6.309825801849366, "epoch": 2.3485285631852277, "grad_norm": 0.9921875, "learning_rate": 0.00044567392181978874, "loss": 5.6623, "mean_token_accuracy": 0.1984606221318245, "num_tokens": 51583463.0, "step": 20350 }, { "entropy": 6.279160451889038, "epoch": 2.3491055972302366, "grad_norm": 0.9296875, "learning_rate": 0.00044564703052240223, "loss": 5.7259, "mean_token_accuracy": 0.19899120777845383, "num_tokens": 51597090.0, "step": 20355 }, { "entropy": 6.219781351089478, "epoch": 2.349682631275245, "grad_norm": 0.9765625, "learning_rate": 0.0004456201334853876, "loss": 5.6265, "mean_token_accuracy": 0.20903219729661943, "num_tokens": 51609288.0, "step": 20360 }, { "entropy": 6.171813535690307, "epoch": 2.350259665320254, "grad_norm": 0.9375, "learning_rate": 0.00044559323070964956, "loss": 5.611, "mean_token_accuracy": 0.2132205694913864, "num_tokens": 51622269.0, "step": 20365 }, { "entropy": 6.281157636642456, "epoch": 2.3508366993652627, "grad_norm": 1.1171875, "learning_rate": 0.000445566322196093, "loss": 5.7412, "mean_token_accuracy": 0.19239043891429902, "num_tokens": 51634222.0, "step": 20370 }, { "entropy": 6.292509889602661, "epoch": 2.351413733410271, "grad_norm": 0.921875, "learning_rate": 0.0004455394079456228, "loss": 5.7057, "mean_token_accuracy": 0.19713842421770095, "num_tokens": 51646933.0, "step": 20375 }, { "entropy": 6.2920444965362545, "epoch": 2.35199076745528, "grad_norm": 1.0234375, "learning_rate": 0.00044551248795914446, "loss": 5.6773, "mean_token_accuracy": 0.20137425810098647, "num_tokens": 51658987.0, "step": 20380 }, { "entropy": 6.240331506729126, "epoch": 2.3525678015002884, "grad_norm": 1.0859375, "learning_rate": 0.0004454855622375632, "loss": 5.7234, "mean_token_accuracy": 0.20117460191249847, "num_tokens": 51669513.0, "step": 20385 }, { "entropy": 6.302077150344848, "epoch": 2.3531448355452973, "grad_norm": 0.9921875, "learning_rate": 0.0004454586307817848, "loss": 5.6721, "mean_token_accuracy": 0.20111125260591506, "num_tokens": 51682084.0, "step": 20390 }, { "entropy": 6.271924304962158, "epoch": 2.3537218695903057, "grad_norm": 0.95703125, "learning_rate": 0.000445431693592715, "loss": 5.7122, "mean_token_accuracy": 0.20097984075546266, "num_tokens": 51695335.0, "step": 20395 }, { "entropy": 6.301687812805175, "epoch": 2.3542989036353146, "grad_norm": 1.015625, "learning_rate": 0.0004454047506712598, "loss": 5.7827, "mean_token_accuracy": 0.19593358039855957, "num_tokens": 51707856.0, "step": 20400 }, { "entropy": 6.273509550094604, "epoch": 2.354875937680323, "grad_norm": 1.015625, "learning_rate": 0.00044537780201832545, "loss": 5.677, "mean_token_accuracy": 0.1995402529835701, "num_tokens": 51719716.0, "step": 20405 }, { "entropy": 6.19102635383606, "epoch": 2.355452971725332, "grad_norm": 0.9375, "learning_rate": 0.0004453508476348184, "loss": 5.6402, "mean_token_accuracy": 0.21555724292993544, "num_tokens": 51733263.0, "step": 20410 }, { "entropy": 6.248130130767822, "epoch": 2.3560300057703403, "grad_norm": 0.9765625, "learning_rate": 0.0004453238875216452, "loss": 5.6175, "mean_token_accuracy": 0.20646194070577623, "num_tokens": 51745143.0, "step": 20415 }, { "entropy": 6.306704330444336, "epoch": 2.356607039815349, "grad_norm": 0.96484375, "learning_rate": 0.0004452969216797127, "loss": 5.7435, "mean_token_accuracy": 0.19763799011707306, "num_tokens": 51757155.0, "step": 20420 }, { "entropy": 6.18883695602417, "epoch": 2.357184073860358, "grad_norm": 0.94921875, "learning_rate": 0.0004452699501099277, "loss": 5.6381, "mean_token_accuracy": 0.20822127610445024, "num_tokens": 51769170.0, "step": 20425 }, { "entropy": 6.280981349945068, "epoch": 2.3577611079053664, "grad_norm": 0.984375, "learning_rate": 0.00044524297281319766, "loss": 5.7259, "mean_token_accuracy": 0.1986905887722969, "num_tokens": 51781254.0, "step": 20430 }, { "entropy": 6.318002128601075, "epoch": 2.358338141950375, "grad_norm": 0.91015625, "learning_rate": 0.00044521598979042963, "loss": 5.7523, "mean_token_accuracy": 0.1985146164894104, "num_tokens": 51793425.0, "step": 20435 }, { "entropy": 6.250660800933838, "epoch": 2.3589151759953837, "grad_norm": 0.96875, "learning_rate": 0.00044518900104253154, "loss": 5.6707, "mean_token_accuracy": 0.20157449394464494, "num_tokens": 51806196.0, "step": 20440 }, { "entropy": 6.210059547424317, "epoch": 2.3594922100403926, "grad_norm": 0.96875, "learning_rate": 0.0004451620065704108, "loss": 5.6892, "mean_token_accuracy": 0.20226312130689622, "num_tokens": 51819137.0, "step": 20445 }, { "entropy": 6.339330101013184, "epoch": 2.360069244085401, "grad_norm": 0.9765625, "learning_rate": 0.00044513500637497546, "loss": 5.7755, "mean_token_accuracy": 0.19646340757608413, "num_tokens": 51830924.0, "step": 20450 }, { "entropy": 6.3239030838012695, "epoch": 2.36064627813041, "grad_norm": 1.0078125, "learning_rate": 0.00044510800045713373, "loss": 5.66, "mean_token_accuracy": 0.19947621822357178, "num_tokens": 51843503.0, "step": 20455 }, { "entropy": 6.277648830413819, "epoch": 2.3612233121754183, "grad_norm": 1.0078125, "learning_rate": 0.00044508098881779396, "loss": 5.7303, "mean_token_accuracy": 0.19973205924034118, "num_tokens": 51855818.0, "step": 20460 }, { "entropy": 6.27275915145874, "epoch": 2.361800346220427, "grad_norm": 1.03125, "learning_rate": 0.0004450539714578645, "loss": 5.6837, "mean_token_accuracy": 0.20204851776361465, "num_tokens": 51867033.0, "step": 20465 }, { "entropy": 6.309321117401123, "epoch": 2.3623773802654355, "grad_norm": 1.0078125, "learning_rate": 0.0004450269483782543, "loss": 5.6707, "mean_token_accuracy": 0.2012152075767517, "num_tokens": 51880845.0, "step": 20470 }, { "entropy": 6.276156616210938, "epoch": 2.3629544143104444, "grad_norm": 0.9765625, "learning_rate": 0.0004449999195798721, "loss": 5.7645, "mean_token_accuracy": 0.1931744247674942, "num_tokens": 51893761.0, "step": 20475 }, { "entropy": 6.266883802413941, "epoch": 2.363531448355453, "grad_norm": 0.8984375, "learning_rate": 0.00044497288506362706, "loss": 5.6604, "mean_token_accuracy": 0.20568044781684874, "num_tokens": 51907478.0, "step": 20480 }, { "entropy": 6.320327377319336, "epoch": 2.3641084824004617, "grad_norm": 1.0, "learning_rate": 0.0004449458448304284, "loss": 5.6667, "mean_token_accuracy": 0.21099235564470292, "num_tokens": 51919242.0, "step": 20485 }, { "entropy": 6.3270317077636715, "epoch": 2.36468551644547, "grad_norm": 1.0546875, "learning_rate": 0.00044491879888118574, "loss": 5.7595, "mean_token_accuracy": 0.19944236427545547, "num_tokens": 51930791.0, "step": 20490 }, { "entropy": 6.123858451843262, "epoch": 2.365262550490479, "grad_norm": 0.96875, "learning_rate": 0.0004448917472168087, "loss": 5.5088, "mean_token_accuracy": 0.21103607267141342, "num_tokens": 51943848.0, "step": 20495 }, { "entropy": 6.274829006195068, "epoch": 2.365839584535488, "grad_norm": 0.98828125, "learning_rate": 0.00044486468983820707, "loss": 5.7413, "mean_token_accuracy": 0.19155209511518478, "num_tokens": 51956648.0, "step": 20500 }, { "entropy": 6.305342388153076, "epoch": 2.3664166185804962, "grad_norm": 0.96875, "learning_rate": 0.000444837626746291, "loss": 5.6963, "mean_token_accuracy": 0.20333817601203918, "num_tokens": 51969068.0, "step": 20505 }, { "entropy": 6.26474609375, "epoch": 2.366993652625505, "grad_norm": 1.0, "learning_rate": 0.0004448105579419707, "loss": 5.6934, "mean_token_accuracy": 0.2022864505648613, "num_tokens": 51981856.0, "step": 20510 }, { "entropy": 6.335216236114502, "epoch": 2.3675706866705135, "grad_norm": 0.94140625, "learning_rate": 0.0004447834834261567, "loss": 5.7573, "mean_token_accuracy": 0.19250386953353882, "num_tokens": 51994428.0, "step": 20515 }, { "entropy": 6.23250002861023, "epoch": 2.3681477207155224, "grad_norm": 0.9453125, "learning_rate": 0.0004447564031997595, "loss": 5.5865, "mean_token_accuracy": 0.21269481927156447, "num_tokens": 52007875.0, "step": 20520 }, { "entropy": 6.257858562469482, "epoch": 2.368724754760531, "grad_norm": 1.0546875, "learning_rate": 0.00044472931726369, "loss": 5.5938, "mean_token_accuracy": 0.20823481380939485, "num_tokens": 52020876.0, "step": 20525 }, { "entropy": 6.346431732177734, "epoch": 2.3693017888055397, "grad_norm": 1.5859375, "learning_rate": 0.00044470222561885926, "loss": 5.7454, "mean_token_accuracy": 0.19151533842086793, "num_tokens": 52032056.0, "step": 20530 }, { "entropy": 6.249010372161865, "epoch": 2.369878822850548, "grad_norm": 1.0, "learning_rate": 0.00044467512826617845, "loss": 5.6792, "mean_token_accuracy": 0.19966776221990584, "num_tokens": 52044488.0, "step": 20535 }, { "entropy": 6.271060562133789, "epoch": 2.370455856895557, "grad_norm": 0.984375, "learning_rate": 0.00044464802520655897, "loss": 5.749, "mean_token_accuracy": 0.1937350869178772, "num_tokens": 52056186.0, "step": 20540 }, { "entropy": 6.317001819610596, "epoch": 2.3710328909405654, "grad_norm": 1.0078125, "learning_rate": 0.0004446209164409124, "loss": 5.6653, "mean_token_accuracy": 0.20406524538993837, "num_tokens": 52068218.0, "step": 20545 }, { "entropy": 6.200478410720825, "epoch": 2.371609924985574, "grad_norm": 0.8515625, "learning_rate": 0.0004445938019701506, "loss": 5.6092, "mean_token_accuracy": 0.21559022963047028, "num_tokens": 52081854.0, "step": 20550 }, { "entropy": 6.200952386856079, "epoch": 2.3721869590305826, "grad_norm": 0.96484375, "learning_rate": 0.0004445666817951855, "loss": 5.6137, "mean_token_accuracy": 0.20615407526493074, "num_tokens": 52094022.0, "step": 20555 }, { "entropy": 6.251945877075196, "epoch": 2.3727639930755915, "grad_norm": 1.015625, "learning_rate": 0.0004445395559169293, "loss": 5.6581, "mean_token_accuracy": 0.2025573045015335, "num_tokens": 52105677.0, "step": 20560 }, { "entropy": 6.342857313156128, "epoch": 2.3733410271206, "grad_norm": 1.0, "learning_rate": 0.0004445124243362943, "loss": 5.7209, "mean_token_accuracy": 0.19989970624446868, "num_tokens": 52118039.0, "step": 20565 }, { "entropy": 6.2887485980987545, "epoch": 2.3739180611656088, "grad_norm": 1.0078125, "learning_rate": 0.0004444852870541932, "loss": 5.6851, "mean_token_accuracy": 0.20365866869688035, "num_tokens": 52131519.0, "step": 20570 }, { "entropy": 6.292483949661255, "epoch": 2.3744950952106176, "grad_norm": 1.0078125, "learning_rate": 0.0004444581440715386, "loss": 5.7147, "mean_token_accuracy": 0.19802933037281037, "num_tokens": 52143240.0, "step": 20575 }, { "entropy": 6.233852577209473, "epoch": 2.375072129255626, "grad_norm": 0.99609375, "learning_rate": 0.00044443099538924347, "loss": 5.6081, "mean_token_accuracy": 0.20580997467041015, "num_tokens": 52155977.0, "step": 20580 }, { "entropy": 6.2496278285980225, "epoch": 2.375649163300635, "grad_norm": 0.98046875, "learning_rate": 0.0004444038410082211, "loss": 5.6534, "mean_token_accuracy": 0.2096467509865761, "num_tokens": 52169388.0, "step": 20585 }, { "entropy": 6.230743551254273, "epoch": 2.3762261973456433, "grad_norm": 0.9921875, "learning_rate": 0.0004443766809293846, "loss": 5.6276, "mean_token_accuracy": 0.20324479788541794, "num_tokens": 52181830.0, "step": 20590 }, { "entropy": 6.186213684082031, "epoch": 2.376803231390652, "grad_norm": 0.98046875, "learning_rate": 0.0004443495151536475, "loss": 5.6136, "mean_token_accuracy": 0.20966268330812454, "num_tokens": 52194255.0, "step": 20595 }, { "entropy": 6.273720645904541, "epoch": 2.3773802654356606, "grad_norm": 1.015625, "learning_rate": 0.0004443223436819237, "loss": 5.7053, "mean_token_accuracy": 0.19739032685756683, "num_tokens": 52205646.0, "step": 20600 }, { "entropy": 6.291301012039185, "epoch": 2.3779572994806695, "grad_norm": 0.9765625, "learning_rate": 0.00044429516651512687, "loss": 5.6598, "mean_token_accuracy": 0.20497027933597564, "num_tokens": 52217519.0, "step": 20605 }, { "entropy": 6.243464994430542, "epoch": 2.378534333525678, "grad_norm": 0.96875, "learning_rate": 0.00044426798365417133, "loss": 5.6906, "mean_token_accuracy": 0.20207190364599228, "num_tokens": 52230139.0, "step": 20610 }, { "entropy": 6.26615309715271, "epoch": 2.3791113675706868, "grad_norm": 1.8359375, "learning_rate": 0.00044424079509997104, "loss": 5.7295, "mean_token_accuracy": 0.20137403905391693, "num_tokens": 52244049.0, "step": 20615 }, { "entropy": 6.293638372421265, "epoch": 2.379688401615695, "grad_norm": 1.0390625, "learning_rate": 0.0004442136008534409, "loss": 5.6727, "mean_token_accuracy": 0.20594702959060668, "num_tokens": 52257180.0, "step": 20620 }, { "entropy": 6.24235258102417, "epoch": 2.380265435660704, "grad_norm": 0.9140625, "learning_rate": 0.00044418640091549525, "loss": 5.6548, "mean_token_accuracy": 0.20861252397298813, "num_tokens": 52270260.0, "step": 20625 }, { "entropy": 6.227157783508301, "epoch": 2.3808424697057124, "grad_norm": 1.0078125, "learning_rate": 0.000444159195287049, "loss": 5.6543, "mean_token_accuracy": 0.20346338003873826, "num_tokens": 52282335.0, "step": 20630 }, { "entropy": 6.2641314506530765, "epoch": 2.3814195037507213, "grad_norm": 0.94921875, "learning_rate": 0.0004441319839690173, "loss": 5.6318, "mean_token_accuracy": 0.20761382728815078, "num_tokens": 52296547.0, "step": 20635 }, { "entropy": 6.274429273605347, "epoch": 2.3819965377957297, "grad_norm": 0.96875, "learning_rate": 0.0004441047669623153, "loss": 5.7007, "mean_token_accuracy": 0.19969301372766496, "num_tokens": 52309523.0, "step": 20640 }, { "entropy": 6.261510848999023, "epoch": 2.3825735718407386, "grad_norm": 1.015625, "learning_rate": 0.00044407754426785845, "loss": 5.6465, "mean_token_accuracy": 0.21056678593158723, "num_tokens": 52322476.0, "step": 20645 }, { "entropy": 6.191774082183838, "epoch": 2.3831506058857475, "grad_norm": 1.109375, "learning_rate": 0.0004440503158865625, "loss": 5.6031, "mean_token_accuracy": 0.20663601756095887, "num_tokens": 52335919.0, "step": 20650 }, { "entropy": 6.260403728485107, "epoch": 2.383727639930756, "grad_norm": 0.95703125, "learning_rate": 0.00044402308181934295, "loss": 5.6911, "mean_token_accuracy": 0.2050690621137619, "num_tokens": 52347636.0, "step": 20655 }, { "entropy": 6.317034482955933, "epoch": 2.3843046739757647, "grad_norm": 0.8515625, "learning_rate": 0.0004439958420671162, "loss": 5.6786, "mean_token_accuracy": 0.20000161081552506, "num_tokens": 52360181.0, "step": 20660 }, { "entropy": 6.254880428314209, "epoch": 2.384881708020773, "grad_norm": 0.9765625, "learning_rate": 0.00044396859663079814, "loss": 5.6601, "mean_token_accuracy": 0.2131296619772911, "num_tokens": 52373525.0, "step": 20665 }, { "entropy": 6.20746111869812, "epoch": 2.385458742065782, "grad_norm": 1.03125, "learning_rate": 0.00044394134551130533, "loss": 5.6036, "mean_token_accuracy": 0.20687361806631088, "num_tokens": 52386252.0, "step": 20670 }, { "entropy": 6.233136701583862, "epoch": 2.3860357761107904, "grad_norm": 1.0625, "learning_rate": 0.0004439140887095542, "loss": 5.662, "mean_token_accuracy": 0.1992241472005844, "num_tokens": 52398056.0, "step": 20675 }, { "entropy": 6.248224925994873, "epoch": 2.3866128101557993, "grad_norm": 0.98828125, "learning_rate": 0.00044388682622646165, "loss": 5.6832, "mean_token_accuracy": 0.20441022962331773, "num_tokens": 52409861.0, "step": 20680 }, { "entropy": 6.205007266998291, "epoch": 2.3871898442008077, "grad_norm": 1.0703125, "learning_rate": 0.0004438595580629446, "loss": 5.6461, "mean_token_accuracy": 0.20737055987119674, "num_tokens": 52423252.0, "step": 20685 }, { "entropy": 6.254592943191528, "epoch": 2.3877668782458166, "grad_norm": 1.0234375, "learning_rate": 0.0004438322842199202, "loss": 5.6072, "mean_token_accuracy": 0.2115780532360077, "num_tokens": 52435950.0, "step": 20690 }, { "entropy": 6.291515111923218, "epoch": 2.388343912290825, "grad_norm": 0.9375, "learning_rate": 0.0004438050046983057, "loss": 5.6623, "mean_token_accuracy": 0.20793629735708236, "num_tokens": 52449257.0, "step": 20695 }, { "entropy": 6.258818960189819, "epoch": 2.388920946335834, "grad_norm": 1.0625, "learning_rate": 0.00044377771949901876, "loss": 5.6852, "mean_token_accuracy": 0.20355032831430436, "num_tokens": 52461543.0, "step": 20700 }, { "entropy": 6.125908517837525, "epoch": 2.3894979803808427, "grad_norm": 1.0078125, "learning_rate": 0.00044375042862297703, "loss": 5.6012, "mean_token_accuracy": 0.20494010001420976, "num_tokens": 52473752.0, "step": 20705 }, { "entropy": 6.346489143371582, "epoch": 2.390075014425851, "grad_norm": 0.9921875, "learning_rate": 0.00044372313207109856, "loss": 5.7409, "mean_token_accuracy": 0.1928962856531143, "num_tokens": 52485885.0, "step": 20710 }, { "entropy": 6.292835807800293, "epoch": 2.3906520484708595, "grad_norm": 0.9921875, "learning_rate": 0.00044369582984430127, "loss": 5.6892, "mean_token_accuracy": 0.20104454159736634, "num_tokens": 52498389.0, "step": 20715 }, { "entropy": 6.241178131103515, "epoch": 2.3912290825158684, "grad_norm": 0.9921875, "learning_rate": 0.00044366852194350354, "loss": 5.6892, "mean_token_accuracy": 0.20661631524562835, "num_tokens": 52511176.0, "step": 20720 }, { "entropy": 6.2766162872314455, "epoch": 2.3918061165608773, "grad_norm": 0.94921875, "learning_rate": 0.0004436412083696239, "loss": 5.6704, "mean_token_accuracy": 0.1999954655766487, "num_tokens": 52523173.0, "step": 20725 }, { "entropy": 6.2250009059906, "epoch": 2.3923831506058857, "grad_norm": 0.91796875, "learning_rate": 0.00044361388912358095, "loss": 5.6023, "mean_token_accuracy": 0.20575390607118607, "num_tokens": 52535776.0, "step": 20730 }, { "entropy": 6.0612109184265135, "epoch": 2.3929601846508946, "grad_norm": 0.984375, "learning_rate": 0.0004435865642062936, "loss": 5.4344, "mean_token_accuracy": 0.22326288521289825, "num_tokens": 52549416.0, "step": 20735 }, { "entropy": 6.210688829421997, "epoch": 2.393537218695903, "grad_norm": 0.9375, "learning_rate": 0.0004435592336186809, "loss": 5.6426, "mean_token_accuracy": 0.20971183031797408, "num_tokens": 52562300.0, "step": 20740 }, { "entropy": 6.315302419662475, "epoch": 2.394114252740912, "grad_norm": 1.0390625, "learning_rate": 0.0004435318973616622, "loss": 5.7355, "mean_token_accuracy": 0.1986914187669754, "num_tokens": 52573906.0, "step": 20745 }, { "entropy": 6.260455179214477, "epoch": 2.3946912867859202, "grad_norm": 0.97265625, "learning_rate": 0.00044350455543615665, "loss": 5.6618, "mean_token_accuracy": 0.20642436891794205, "num_tokens": 52586138.0, "step": 20750 }, { "entropy": 6.289743185043335, "epoch": 2.395268320830929, "grad_norm": 0.92578125, "learning_rate": 0.0004434772078430843, "loss": 5.7052, "mean_token_accuracy": 0.20260262489318848, "num_tokens": 52599705.0, "step": 20755 }, { "entropy": 6.261003541946411, "epoch": 2.3958453548759375, "grad_norm": 0.984375, "learning_rate": 0.0004434498545833646, "loss": 5.7523, "mean_token_accuracy": 0.19939430058002472, "num_tokens": 52612041.0, "step": 20760 }, { "entropy": 6.310602378845215, "epoch": 2.3964223889209464, "grad_norm": 0.99609375, "learning_rate": 0.0004434224956579177, "loss": 5.7021, "mean_token_accuracy": 0.20172154903411865, "num_tokens": 52625634.0, "step": 20765 }, { "entropy": 6.172333574295044, "epoch": 2.396999422965955, "grad_norm": 1.09375, "learning_rate": 0.0004433951310676639, "loss": 5.5445, "mean_token_accuracy": 0.21477589756250381, "num_tokens": 52638706.0, "step": 20770 }, { "entropy": 6.18256368637085, "epoch": 2.3975764570109637, "grad_norm": 0.99609375, "learning_rate": 0.00044336776081352347, "loss": 5.6921, "mean_token_accuracy": 0.2102103739976883, "num_tokens": 52650876.0, "step": 20775 }, { "entropy": 6.233721828460693, "epoch": 2.3981534910559725, "grad_norm": 0.9765625, "learning_rate": 0.00044334038489641706, "loss": 5.6333, "mean_token_accuracy": 0.20763159096240996, "num_tokens": 52663664.0, "step": 20780 }, { "entropy": 6.34328670501709, "epoch": 2.398730525100981, "grad_norm": 1.0546875, "learning_rate": 0.00044331300331726544, "loss": 5.7688, "mean_token_accuracy": 0.19594075679779052, "num_tokens": 52675870.0, "step": 20785 }, { "entropy": 6.2657371997833256, "epoch": 2.3993075591459894, "grad_norm": 1.046875, "learning_rate": 0.00044328561607698947, "loss": 5.6955, "mean_token_accuracy": 0.19709624648094176, "num_tokens": 52687029.0, "step": 20790 }, { "entropy": 6.190671730041504, "epoch": 2.3998845931909982, "grad_norm": 0.984375, "learning_rate": 0.0004432582231765105, "loss": 5.5523, "mean_token_accuracy": 0.20293704867362977, "num_tokens": 52700242.0, "step": 20795 }, { "entropy": 6.263112306594849, "epoch": 2.400461627236007, "grad_norm": 1.0078125, "learning_rate": 0.00044323082461674974, "loss": 5.6512, "mean_token_accuracy": 0.2004449725151062, "num_tokens": 52711561.0, "step": 20800 }, { "entropy": 6.163639688491822, "epoch": 2.4010386612810155, "grad_norm": 0.96484375, "learning_rate": 0.0004432034203986287, "loss": 5.5826, "mean_token_accuracy": 0.20719403624534607, "num_tokens": 52725101.0, "step": 20805 }, { "entropy": 6.299870204925537, "epoch": 2.4016156953260244, "grad_norm": 1.046875, "learning_rate": 0.0004431760105230693, "loss": 5.7036, "mean_token_accuracy": 0.19972139000892639, "num_tokens": 52738315.0, "step": 20810 }, { "entropy": 6.311771631240845, "epoch": 2.402192729371033, "grad_norm": 1.015625, "learning_rate": 0.00044314859499099325, "loss": 5.768, "mean_token_accuracy": 0.20132242143154144, "num_tokens": 52752547.0, "step": 20815 }, { "entropy": 6.3200325012207035, "epoch": 2.4027697634160416, "grad_norm": 0.98828125, "learning_rate": 0.00044312117380332274, "loss": 5.7677, "mean_token_accuracy": 0.19519882798194885, "num_tokens": 52765831.0, "step": 20820 }, { "entropy": 6.276677131652832, "epoch": 2.40334679746105, "grad_norm": 0.9921875, "learning_rate": 0.00044309374696098, "loss": 5.6135, "mean_token_accuracy": 0.2075101539492607, "num_tokens": 52779144.0, "step": 20825 }, { "entropy": 6.27869553565979, "epoch": 2.403923831506059, "grad_norm": 1.015625, "learning_rate": 0.0004430663144648876, "loss": 5.6549, "mean_token_accuracy": 0.21143777966499328, "num_tokens": 52790956.0, "step": 20830 }, { "entropy": 6.254818725585937, "epoch": 2.4045008655510673, "grad_norm": 0.94140625, "learning_rate": 0.00044303887631596823, "loss": 5.6933, "mean_token_accuracy": 0.2000236004590988, "num_tokens": 52804057.0, "step": 20835 }, { "entropy": 6.275049161911011, "epoch": 2.405077899596076, "grad_norm": 0.921875, "learning_rate": 0.0004430114325151447, "loss": 5.602, "mean_token_accuracy": 0.20146780759096145, "num_tokens": 52817197.0, "step": 20840 }, { "entropy": 6.312943840026856, "epoch": 2.4056549336410846, "grad_norm": 0.96875, "learning_rate": 0.0004429839830633401, "loss": 5.6878, "mean_token_accuracy": 0.20596786588430405, "num_tokens": 52830162.0, "step": 20845 }, { "entropy": 6.244770193099976, "epoch": 2.4062319676860935, "grad_norm": 0.96875, "learning_rate": 0.0004429565279614777, "loss": 5.6855, "mean_token_accuracy": 0.20993798077106476, "num_tokens": 52843681.0, "step": 20850 }, { "entropy": 6.273213005065918, "epoch": 2.4068090017311023, "grad_norm": 1.0078125, "learning_rate": 0.00044292906721048094, "loss": 5.6646, "mean_token_accuracy": 0.21043166220188142, "num_tokens": 52857297.0, "step": 20855 }, { "entropy": 6.102078199386597, "epoch": 2.4073860357761108, "grad_norm": 0.97265625, "learning_rate": 0.0004429016008112733, "loss": 5.453, "mean_token_accuracy": 0.21661452054977418, "num_tokens": 52870551.0, "step": 20860 }, { "entropy": 6.232694149017334, "epoch": 2.4079630698211196, "grad_norm": 1.0546875, "learning_rate": 0.0004428741287647788, "loss": 5.6018, "mean_token_accuracy": 0.21334003508090973, "num_tokens": 52884628.0, "step": 20865 }, { "entropy": 6.258617401123047, "epoch": 2.408540103866128, "grad_norm": 0.9765625, "learning_rate": 0.00044284665107192136, "loss": 5.6018, "mean_token_accuracy": 0.21635719537734985, "num_tokens": 52897079.0, "step": 20870 }, { "entropy": 6.207066011428833, "epoch": 2.409117137911137, "grad_norm": 1.0390625, "learning_rate": 0.0004428191677336251, "loss": 5.6794, "mean_token_accuracy": 0.205386246740818, "num_tokens": 52909990.0, "step": 20875 }, { "entropy": 6.230048990249633, "epoch": 2.4096941719561453, "grad_norm": 0.9921875, "learning_rate": 0.0004427916787508146, "loss": 5.685, "mean_token_accuracy": 0.20320132970809937, "num_tokens": 52922732.0, "step": 20880 }, { "entropy": 6.353757715225219, "epoch": 2.410271206001154, "grad_norm": 1.125, "learning_rate": 0.0004427641841244144, "loss": 5.7219, "mean_token_accuracy": 0.19882332533597946, "num_tokens": 52934648.0, "step": 20885 }, { "entropy": 6.306688976287842, "epoch": 2.4108482400461626, "grad_norm": 1.203125, "learning_rate": 0.000442736683855349, "loss": 5.7502, "mean_token_accuracy": 0.19999517798423766, "num_tokens": 52947913.0, "step": 20890 }, { "entropy": 6.265348243713379, "epoch": 2.4114252740911715, "grad_norm": 0.921875, "learning_rate": 0.0004427091779445437, "loss": 5.693, "mean_token_accuracy": 0.20397568345069886, "num_tokens": 52960491.0, "step": 20895 }, { "entropy": 6.3150794506073, "epoch": 2.41200230813618, "grad_norm": 0.9375, "learning_rate": 0.0004426816663929235, "loss": 5.6529, "mean_token_accuracy": 0.2066299334168434, "num_tokens": 52972813.0, "step": 20900 }, { "entropy": 6.30979208946228, "epoch": 2.4125793421811887, "grad_norm": 0.9921875, "learning_rate": 0.00044265414920141366, "loss": 5.7035, "mean_token_accuracy": 0.19975962191820146, "num_tokens": 52985548.0, "step": 20905 }, { "entropy": 6.237899971008301, "epoch": 2.413156376226197, "grad_norm": 1.046875, "learning_rate": 0.00044262662637093987, "loss": 5.5775, "mean_token_accuracy": 0.21558093875646592, "num_tokens": 52998911.0, "step": 20910 }, { "entropy": 6.182219457626343, "epoch": 2.413733410271206, "grad_norm": 1.0703125, "learning_rate": 0.00044259909790242776, "loss": 5.6054, "mean_token_accuracy": 0.2133312329649925, "num_tokens": 53011205.0, "step": 20915 }, { "entropy": 6.237178754806519, "epoch": 2.4143104443162144, "grad_norm": 0.9765625, "learning_rate": 0.0004425715637968032, "loss": 5.7037, "mean_token_accuracy": 0.2034172847867012, "num_tokens": 53023428.0, "step": 20920 }, { "entropy": 6.351958084106445, "epoch": 2.4148874783612233, "grad_norm": 0.94921875, "learning_rate": 0.0004425440240549923, "loss": 5.7983, "mean_token_accuracy": 0.19115305542945862, "num_tokens": 53035488.0, "step": 20925 }, { "entropy": 6.189400720596313, "epoch": 2.415464512406232, "grad_norm": 1.0703125, "learning_rate": 0.00044251647867792147, "loss": 5.5431, "mean_token_accuracy": 0.2178526610136032, "num_tokens": 53048416.0, "step": 20930 }, { "entropy": 6.261590957641602, "epoch": 2.4160415464512406, "grad_norm": 1.171875, "learning_rate": 0.00044248892766651706, "loss": 5.7911, "mean_token_accuracy": 0.19820116460323334, "num_tokens": 53061763.0, "step": 20935 }, { "entropy": 6.231258487701416, "epoch": 2.4166185804962494, "grad_norm": 1.0, "learning_rate": 0.0004424613710217057, "loss": 5.608, "mean_token_accuracy": 0.20854777544736863, "num_tokens": 53073666.0, "step": 20940 }, { "entropy": 6.165039777755737, "epoch": 2.417195614541258, "grad_norm": 1.0, "learning_rate": 0.00044243380874441437, "loss": 5.5893, "mean_token_accuracy": 0.2164393588900566, "num_tokens": 53087155.0, "step": 20945 }, { "entropy": 6.291706848144531, "epoch": 2.4177726485862667, "grad_norm": 0.9921875, "learning_rate": 0.00044240624083557, "loss": 5.7532, "mean_token_accuracy": 0.20198543518781661, "num_tokens": 53099199.0, "step": 20950 }, { "entropy": 6.27391939163208, "epoch": 2.418349682631275, "grad_norm": 0.90625, "learning_rate": 0.00044237866729609994, "loss": 5.7253, "mean_token_accuracy": 0.19764039665460587, "num_tokens": 53111997.0, "step": 20955 }, { "entropy": 6.1567870616912845, "epoch": 2.418926716676284, "grad_norm": 1.03125, "learning_rate": 0.0004423510881269315, "loss": 5.6611, "mean_token_accuracy": 0.20668234825134277, "num_tokens": 53123812.0, "step": 20960 }, { "entropy": 6.306679534912109, "epoch": 2.4195037507212924, "grad_norm": 0.98828125, "learning_rate": 0.0004423235033289924, "loss": 5.7441, "mean_token_accuracy": 0.19693725556135178, "num_tokens": 53137232.0, "step": 20965 }, { "entropy": 6.320231342315674, "epoch": 2.4200807847663013, "grad_norm": 1.0703125, "learning_rate": 0.0004422959129032103, "loss": 5.6684, "mean_token_accuracy": 0.20223398357629777, "num_tokens": 53149183.0, "step": 20970 }, { "entropy": 6.1804546356201175, "epoch": 2.4206578188113097, "grad_norm": 0.94140625, "learning_rate": 0.00044226831685051333, "loss": 5.5951, "mean_token_accuracy": 0.20293668061494827, "num_tokens": 53163187.0, "step": 20975 }, { "entropy": 6.322501182556152, "epoch": 2.4212348528563186, "grad_norm": 0.91796875, "learning_rate": 0.0004422407151718296, "loss": 5.6621, "mean_token_accuracy": 0.21300754696130753, "num_tokens": 53178441.0, "step": 20980 }, { "entropy": 6.309228181838989, "epoch": 2.4218118869013274, "grad_norm": 1.015625, "learning_rate": 0.00044221310786808746, "loss": 5.6753, "mean_token_accuracy": 0.20587997883558273, "num_tokens": 53190042.0, "step": 20985 }, { "entropy": 6.260992860794067, "epoch": 2.422388920946336, "grad_norm": 0.98828125, "learning_rate": 0.0004421854949402155, "loss": 5.6765, "mean_token_accuracy": 0.20409729927778245, "num_tokens": 53201724.0, "step": 20990 }, { "entropy": 6.2162477493286135, "epoch": 2.4229659549913443, "grad_norm": 0.953125, "learning_rate": 0.00044215787638914245, "loss": 5.6576, "mean_token_accuracy": 0.20342174768447877, "num_tokens": 53213415.0, "step": 20995 }, { "entropy": 6.2664031982421875, "epoch": 2.423542989036353, "grad_norm": 0.94140625, "learning_rate": 0.0004421302522157973, "loss": 5.6785, "mean_token_accuracy": 0.20658696591854095, "num_tokens": 53227324.0, "step": 21000 }, { "epoch": 2.423542989036353, "eval_entropy": 6.088870966742925, "eval_loss": 5.776307106018066, "eval_mean_token_accuracy": 0.20609371489316927, "eval_num_tokens": 53227324.0, "eval_runtime": 17.4445, "eval_samples_per_second": 1612.888, "eval_steps_per_second": 201.611, "step": 21000 }, { "entropy": 6.312483072280884, "epoch": 2.424120023081362, "grad_norm": 0.93359375, "learning_rate": 0.0004421026224211091, "loss": 5.7478, "mean_token_accuracy": 0.19414630234241487, "num_tokens": 53240325.0, "step": 21005 }, { "entropy": 6.237953758239746, "epoch": 2.4246970571263704, "grad_norm": 1.0, "learning_rate": 0.00044207498700600724, "loss": 5.5808, "mean_token_accuracy": 0.20765155255794526, "num_tokens": 53251857.0, "step": 21010 }, { "entropy": 6.281023216247559, "epoch": 2.4252740911713793, "grad_norm": 0.90625, "learning_rate": 0.00044204734597142115, "loss": 5.7391, "mean_token_accuracy": 0.20456330627202987, "num_tokens": 53266309.0, "step": 21015 }, { "entropy": 6.295359897613525, "epoch": 2.4258511252163877, "grad_norm": 1.0234375, "learning_rate": 0.00044201969931828057, "loss": 5.6374, "mean_token_accuracy": 0.20940370708703995, "num_tokens": 53278085.0, "step": 21020 }, { "entropy": 6.25317792892456, "epoch": 2.4264281592613965, "grad_norm": 0.96875, "learning_rate": 0.0004419920470475154, "loss": 5.65, "mean_token_accuracy": 0.20308011621236802, "num_tokens": 53291395.0, "step": 21025 }, { "entropy": 6.3041338443756105, "epoch": 2.427005193306405, "grad_norm": 0.97265625, "learning_rate": 0.0004419643891600556, "loss": 5.787, "mean_token_accuracy": 0.19857027977705002, "num_tokens": 53304735.0, "step": 21030 }, { "entropy": 6.322564315795899, "epoch": 2.427582227351414, "grad_norm": 1.0859375, "learning_rate": 0.00044193672565683153, "loss": 5.7251, "mean_token_accuracy": 0.2004969224333763, "num_tokens": 53316467.0, "step": 21035 }, { "entropy": 6.2362302303314205, "epoch": 2.4281592613964222, "grad_norm": 1.0078125, "learning_rate": 0.0004419090565387736, "loss": 5.67, "mean_token_accuracy": 0.19833118617534637, "num_tokens": 53328591.0, "step": 21040 }, { "entropy": 6.326643991470337, "epoch": 2.428736295441431, "grad_norm": 0.95703125, "learning_rate": 0.00044188138180681255, "loss": 5.74, "mean_token_accuracy": 0.19596015512943268, "num_tokens": 53340640.0, "step": 21045 }, { "entropy": 6.313967943191528, "epoch": 2.4293133294864395, "grad_norm": 1.0078125, "learning_rate": 0.000441853701461879, "loss": 5.7065, "mean_token_accuracy": 0.20161303281784057, "num_tokens": 53351798.0, "step": 21050 }, { "entropy": 6.278508710861206, "epoch": 2.4298903635314484, "grad_norm": 0.9609375, "learning_rate": 0.00044182601550490414, "loss": 5.7384, "mean_token_accuracy": 0.19922790080308914, "num_tokens": 53364994.0, "step": 21055 }, { "entropy": 6.394079732894897, "epoch": 2.4304673975764572, "grad_norm": 0.9609375, "learning_rate": 0.0004417983239368192, "loss": 5.7994, "mean_token_accuracy": 0.1930380120873451, "num_tokens": 53376729.0, "step": 21060 }, { "entropy": 6.298944997787475, "epoch": 2.4310444316214657, "grad_norm": 1.0078125, "learning_rate": 0.00044177062675855534, "loss": 5.7608, "mean_token_accuracy": 0.20192819237709045, "num_tokens": 53389723.0, "step": 21065 }, { "entropy": 6.321099185943604, "epoch": 2.431621465666474, "grad_norm": 1.0078125, "learning_rate": 0.0004417429239710444, "loss": 5.7503, "mean_token_accuracy": 0.19576003700494765, "num_tokens": 53402102.0, "step": 21070 }, { "entropy": 6.146487712860107, "epoch": 2.432198499711483, "grad_norm": 0.93359375, "learning_rate": 0.0004417152155752179, "loss": 5.5426, "mean_token_accuracy": 0.22309158444404603, "num_tokens": 53416246.0, "step": 21075 }, { "entropy": 6.2336893558502195, "epoch": 2.432775533756492, "grad_norm": 0.9453125, "learning_rate": 0.0004416875015720081, "loss": 5.6315, "mean_token_accuracy": 0.20447710603475572, "num_tokens": 53430666.0, "step": 21080 }, { "entropy": 6.256991147994995, "epoch": 2.4333525678015, "grad_norm": 0.96875, "learning_rate": 0.0004416597819623469, "loss": 5.6194, "mean_token_accuracy": 0.2086898386478424, "num_tokens": 53442302.0, "step": 21085 }, { "entropy": 6.219863796234131, "epoch": 2.433929601846509, "grad_norm": 0.94921875, "learning_rate": 0.00044163205674716666, "loss": 5.702, "mean_token_accuracy": 0.1993287980556488, "num_tokens": 53454288.0, "step": 21090 }, { "entropy": 6.31003966331482, "epoch": 2.4345066358915175, "grad_norm": 1.0390625, "learning_rate": 0.00044160432592740015, "loss": 5.7713, "mean_token_accuracy": 0.1933869868516922, "num_tokens": 53465307.0, "step": 21095 }, { "entropy": 6.230881261825561, "epoch": 2.4350836699365264, "grad_norm": 1.0078125, "learning_rate": 0.00044157658950397965, "loss": 5.6166, "mean_token_accuracy": 0.20931355357170106, "num_tokens": 53478465.0, "step": 21100 }, { "entropy": 6.316826391220093, "epoch": 2.435660703981535, "grad_norm": 1.046875, "learning_rate": 0.00044154884747783844, "loss": 5.6958, "mean_token_accuracy": 0.20883227735757828, "num_tokens": 53490783.0, "step": 21105 }, { "entropy": 6.258099603652954, "epoch": 2.4362377380265436, "grad_norm": 1.0, "learning_rate": 0.00044152109984990954, "loss": 5.6167, "mean_token_accuracy": 0.20857996642589569, "num_tokens": 53502716.0, "step": 21110 }, { "entropy": 6.269389581680298, "epoch": 2.436814772071552, "grad_norm": 0.96484375, "learning_rate": 0.000441493346621126, "loss": 5.7566, "mean_token_accuracy": 0.1978018254041672, "num_tokens": 53514962.0, "step": 21115 }, { "entropy": 6.368846464157104, "epoch": 2.437391806116561, "grad_norm": 0.9296875, "learning_rate": 0.00044146558779242155, "loss": 5.7622, "mean_token_accuracy": 0.19363797903060914, "num_tokens": 53527741.0, "step": 21120 }, { "entropy": 6.2502247333526615, "epoch": 2.4379688401615693, "grad_norm": 0.953125, "learning_rate": 0.0004414378233647298, "loss": 5.7138, "mean_token_accuracy": 0.20151958912611007, "num_tokens": 53539705.0, "step": 21125 }, { "entropy": 6.230468797683716, "epoch": 2.438545874206578, "grad_norm": 0.94140625, "learning_rate": 0.00044141005333898437, "loss": 5.6503, "mean_token_accuracy": 0.20231813043355942, "num_tokens": 53552310.0, "step": 21130 }, { "entropy": 6.26423978805542, "epoch": 2.439122908251587, "grad_norm": 0.86328125, "learning_rate": 0.0004413822777161196, "loss": 5.6362, "mean_token_accuracy": 0.2111567258834839, "num_tokens": 53565553.0, "step": 21135 }, { "entropy": 6.291376638412475, "epoch": 2.4396999422965955, "grad_norm": 0.96875, "learning_rate": 0.0004413544964970695, "loss": 5.7161, "mean_token_accuracy": 0.1995744913816452, "num_tokens": 53578837.0, "step": 21140 }, { "entropy": 6.291012954711914, "epoch": 2.4402769763416043, "grad_norm": 0.98828125, "learning_rate": 0.0004413267096827686, "loss": 5.6662, "mean_token_accuracy": 0.20103991776704788, "num_tokens": 53591286.0, "step": 21145 }, { "entropy": 6.2648297309875485, "epoch": 2.4408540103866128, "grad_norm": 0.96875, "learning_rate": 0.0004412989172741514, "loss": 5.7057, "mean_token_accuracy": 0.20178893357515335, "num_tokens": 53603395.0, "step": 21150 }, { "entropy": 6.227371597290039, "epoch": 2.4414310444316216, "grad_norm": 0.96484375, "learning_rate": 0.00044127111927215267, "loss": 5.6808, "mean_token_accuracy": 0.200730362534523, "num_tokens": 53616134.0, "step": 21155 }, { "entropy": 6.237963628768921, "epoch": 2.44200807847663, "grad_norm": 1.078125, "learning_rate": 0.00044124331567770746, "loss": 5.6208, "mean_token_accuracy": 0.2077662467956543, "num_tokens": 53628736.0, "step": 21160 }, { "entropy": 6.270305013656616, "epoch": 2.442585112521639, "grad_norm": 0.93359375, "learning_rate": 0.0004412155064917509, "loss": 5.6535, "mean_token_accuracy": 0.21042108088731765, "num_tokens": 53640921.0, "step": 21165 }, { "entropy": 6.2315953254699705, "epoch": 2.4431621465666473, "grad_norm": 0.98046875, "learning_rate": 0.00044118769171521836, "loss": 5.6457, "mean_token_accuracy": 0.20233218371868134, "num_tokens": 53653483.0, "step": 21170 }, { "entropy": 6.296618032455444, "epoch": 2.443739180611656, "grad_norm": 1.171875, "learning_rate": 0.00044115987134904543, "loss": 5.6322, "mean_token_accuracy": 0.20625920444726945, "num_tokens": 53666175.0, "step": 21175 }, { "entropy": 6.184669017791748, "epoch": 2.4443162146566646, "grad_norm": 0.9296875, "learning_rate": 0.00044113204539416776, "loss": 5.6012, "mean_token_accuracy": 0.2075907915830612, "num_tokens": 53678509.0, "step": 21180 }, { "entropy": 6.267242860794068, "epoch": 2.4448932487016735, "grad_norm": 0.9609375, "learning_rate": 0.0004411042138515212, "loss": 5.7051, "mean_token_accuracy": 0.2035290628671646, "num_tokens": 53690825.0, "step": 21185 }, { "entropy": 6.222609138488769, "epoch": 2.445470282746682, "grad_norm": 0.96875, "learning_rate": 0.0004410763767220419, "loss": 5.6547, "mean_token_accuracy": 0.20375724583864213, "num_tokens": 53703730.0, "step": 21190 }, { "entropy": 6.290456485748291, "epoch": 2.4460473167916907, "grad_norm": 1.015625, "learning_rate": 0.0004410485340066662, "loss": 5.7173, "mean_token_accuracy": 0.20021379441022874, "num_tokens": 53715467.0, "step": 21195 }, { "entropy": 6.29947681427002, "epoch": 2.446624350836699, "grad_norm": 0.93359375, "learning_rate": 0.0004410206857063305, "loss": 5.6739, "mean_token_accuracy": 0.1997717872262001, "num_tokens": 53728559.0, "step": 21200 }, { "entropy": 6.301295328140259, "epoch": 2.447201384881708, "grad_norm": 0.97265625, "learning_rate": 0.0004409928318219715, "loss": 5.7095, "mean_token_accuracy": 0.19815954715013503, "num_tokens": 53740862.0, "step": 21205 }, { "entropy": 6.203379106521607, "epoch": 2.447778418926717, "grad_norm": 1.03125, "learning_rate": 0.0004409649723545262, "loss": 5.6662, "mean_token_accuracy": 0.20121219009160995, "num_tokens": 53753026.0, "step": 21210 }, { "entropy": 6.337033319473266, "epoch": 2.4483554529717253, "grad_norm": 0.9375, "learning_rate": 0.0004409371073049313, "loss": 5.723, "mean_token_accuracy": 0.19286224544048308, "num_tokens": 53765318.0, "step": 21215 }, { "entropy": 6.32131028175354, "epoch": 2.448932487016734, "grad_norm": 0.9765625, "learning_rate": 0.0004409092366741243, "loss": 5.704, "mean_token_accuracy": 0.2025526612997055, "num_tokens": 53777199.0, "step": 21220 }, { "entropy": 6.197504281997681, "epoch": 2.4495095210617426, "grad_norm": 0.98828125, "learning_rate": 0.0004408813604630425, "loss": 5.6356, "mean_token_accuracy": 0.2067818224430084, "num_tokens": 53790229.0, "step": 21225 }, { "entropy": 6.187977647781372, "epoch": 2.4500865551067514, "grad_norm": 1.0078125, "learning_rate": 0.0004408534786726236, "loss": 5.5821, "mean_token_accuracy": 0.2129516839981079, "num_tokens": 53803194.0, "step": 21230 }, { "entropy": 6.229814291000366, "epoch": 2.45066358915176, "grad_norm": 0.99609375, "learning_rate": 0.0004408255913038053, "loss": 5.6338, "mean_token_accuracy": 0.20349528044462203, "num_tokens": 53815710.0, "step": 21235 }, { "entropy": 6.326226615905762, "epoch": 2.4512406231967687, "grad_norm": 0.90234375, "learning_rate": 0.0004407976983575256, "loss": 5.771, "mean_token_accuracy": 0.20141251534223556, "num_tokens": 53829427.0, "step": 21240 }, { "entropy": 6.2482832908630375, "epoch": 2.451817657241777, "grad_norm": 0.9765625, "learning_rate": 0.0004407697998347227, "loss": 5.6381, "mean_token_accuracy": 0.20633713901042938, "num_tokens": 53842515.0, "step": 21245 }, { "entropy": 6.303839778900146, "epoch": 2.452394691286786, "grad_norm": 0.97265625, "learning_rate": 0.0004407418957363349, "loss": 5.7108, "mean_token_accuracy": 0.197301509976387, "num_tokens": 53855913.0, "step": 21250 }, { "entropy": 6.237850475311279, "epoch": 2.4529717253317944, "grad_norm": 0.8828125, "learning_rate": 0.00044071398606330075, "loss": 5.6464, "mean_token_accuracy": 0.20977152436971663, "num_tokens": 53869354.0, "step": 21255 }, { "entropy": 6.22046389579773, "epoch": 2.4535487593768033, "grad_norm": 0.9765625, "learning_rate": 0.000440686070816559, "loss": 5.6568, "mean_token_accuracy": 0.20675353854894638, "num_tokens": 53881149.0, "step": 21260 }, { "entropy": 6.239455699920654, "epoch": 2.4541257934218117, "grad_norm": 1.0390625, "learning_rate": 0.0004406581499970486, "loss": 5.7009, "mean_token_accuracy": 0.2066504493355751, "num_tokens": 53893930.0, "step": 21265 }, { "entropy": 6.248563194274903, "epoch": 2.4547028274668206, "grad_norm": 1.0703125, "learning_rate": 0.0004406302236057086, "loss": 5.6105, "mean_token_accuracy": 0.2089455634355545, "num_tokens": 53905306.0, "step": 21270 }, { "entropy": 6.2968238353729244, "epoch": 2.455279861511829, "grad_norm": 0.98046875, "learning_rate": 0.00044060229164347826, "loss": 5.766, "mean_token_accuracy": 0.2041410818696022, "num_tokens": 53918405.0, "step": 21275 }, { "entropy": 6.232977771759034, "epoch": 2.455856895556838, "grad_norm": 0.9140625, "learning_rate": 0.00044057435411129714, "loss": 5.6028, "mean_token_accuracy": 0.2104605257511139, "num_tokens": 53932931.0, "step": 21280 }, { "entropy": 6.3614284038543705, "epoch": 2.4564339296018467, "grad_norm": 0.9921875, "learning_rate": 0.00044054641101010485, "loss": 5.7377, "mean_token_accuracy": 0.19399367719888688, "num_tokens": 53945438.0, "step": 21285 }, { "entropy": 6.278663492202758, "epoch": 2.457010963646855, "grad_norm": 1.0078125, "learning_rate": 0.00044051846234084127, "loss": 5.7098, "mean_token_accuracy": 0.1993136301636696, "num_tokens": 53958552.0, "step": 21290 }, { "entropy": 6.271420240402222, "epoch": 2.457587997691864, "grad_norm": 1.0, "learning_rate": 0.0004404905081044464, "loss": 5.6425, "mean_token_accuracy": 0.2112942561507225, "num_tokens": 53970776.0, "step": 21295 }, { "entropy": 6.264316415786743, "epoch": 2.4581650317368724, "grad_norm": 0.91796875, "learning_rate": 0.0004404625483018605, "loss": 5.8199, "mean_token_accuracy": 0.19840810298919678, "num_tokens": 53982667.0, "step": 21300 }, { "entropy": 6.283908653259277, "epoch": 2.4587420657818813, "grad_norm": 1.0078125, "learning_rate": 0.000440434582934024, "loss": 5.6904, "mean_token_accuracy": 0.20617727637290956, "num_tokens": 53994603.0, "step": 21305 }, { "entropy": 6.293340635299683, "epoch": 2.4593190998268897, "grad_norm": 0.9375, "learning_rate": 0.00044040661200187746, "loss": 5.6937, "mean_token_accuracy": 0.2004096567630768, "num_tokens": 54007499.0, "step": 21310 }, { "entropy": 6.275390863418579, "epoch": 2.4598961338718985, "grad_norm": 0.99609375, "learning_rate": 0.00044037863550636173, "loss": 5.7046, "mean_token_accuracy": 0.20319158285856248, "num_tokens": 54019471.0, "step": 21315 }, { "entropy": 6.252910089492798, "epoch": 2.460473167916907, "grad_norm": 1.0078125, "learning_rate": 0.00044035065344841766, "loss": 5.6701, "mean_token_accuracy": 0.20786895602941513, "num_tokens": 54032352.0, "step": 21320 }, { "entropy": 6.218403291702271, "epoch": 2.461050201961916, "grad_norm": 1.1875, "learning_rate": 0.00044032266582898655, "loss": 5.6843, "mean_token_accuracy": 0.20879226177930832, "num_tokens": 54046284.0, "step": 21325 }, { "entropy": 6.221643924713135, "epoch": 2.4616272360069242, "grad_norm": 0.984375, "learning_rate": 0.0004402946726490097, "loss": 5.6287, "mean_token_accuracy": 0.20637412667274474, "num_tokens": 54058867.0, "step": 21330 }, { "entropy": 6.259546375274658, "epoch": 2.462204270051933, "grad_norm": 0.93359375, "learning_rate": 0.00044026667390942867, "loss": 5.6165, "mean_token_accuracy": 0.19865330457687377, "num_tokens": 54070587.0, "step": 21335 }, { "entropy": 6.210058164596558, "epoch": 2.462781304096942, "grad_norm": 0.88671875, "learning_rate": 0.0004402386696111851, "loss": 5.5813, "mean_token_accuracy": 0.20929396599531175, "num_tokens": 54083707.0, "step": 21340 }, { "entropy": 6.24297685623169, "epoch": 2.4633583381419504, "grad_norm": 0.9765625, "learning_rate": 0.00044021065975522096, "loss": 5.634, "mean_token_accuracy": 0.20413876473903655, "num_tokens": 54095166.0, "step": 21345 }, { "entropy": 6.241056060791015, "epoch": 2.463935372186959, "grad_norm": 0.94140625, "learning_rate": 0.0004401826443424784, "loss": 5.6951, "mean_token_accuracy": 0.2041725903749466, "num_tokens": 54108329.0, "step": 21350 }, { "entropy": 6.32603964805603, "epoch": 2.4645124062319677, "grad_norm": 0.9453125, "learning_rate": 0.00044015462337389954, "loss": 5.7056, "mean_token_accuracy": 0.20443324446678163, "num_tokens": 54120799.0, "step": 21355 }, { "entropy": 6.294125080108643, "epoch": 2.4650894402769765, "grad_norm": 0.94921875, "learning_rate": 0.00044012659685042704, "loss": 5.7189, "mean_token_accuracy": 0.19507095217704773, "num_tokens": 54133346.0, "step": 21360 }, { "entropy": 6.238120603561401, "epoch": 2.465666474321985, "grad_norm": 0.9453125, "learning_rate": 0.0004400985647730034, "loss": 5.656, "mean_token_accuracy": 0.20855870246887206, "num_tokens": 54146633.0, "step": 21365 }, { "entropy": 6.2709743022918705, "epoch": 2.466243508366994, "grad_norm": 0.953125, "learning_rate": 0.00044007052714257165, "loss": 5.6035, "mean_token_accuracy": 0.21423779875040055, "num_tokens": 54158708.0, "step": 21370 }, { "entropy": 6.165133333206176, "epoch": 2.466820542412002, "grad_norm": 1.0234375, "learning_rate": 0.0004400424839600747, "loss": 5.6051, "mean_token_accuracy": 0.20930253118276596, "num_tokens": 54171707.0, "step": 21375 }, { "entropy": 6.268130159378051, "epoch": 2.467397576457011, "grad_norm": 1.0859375, "learning_rate": 0.00044001443522645575, "loss": 5.6419, "mean_token_accuracy": 0.20065221935510635, "num_tokens": 54184778.0, "step": 21380 }, { "entropy": 6.248182010650635, "epoch": 2.4679746105020195, "grad_norm": 0.9609375, "learning_rate": 0.0004399863809426582, "loss": 5.7037, "mean_token_accuracy": 0.20327770411968232, "num_tokens": 54197199.0, "step": 21385 }, { "entropy": 6.23556170463562, "epoch": 2.4685516445470284, "grad_norm": 0.88671875, "learning_rate": 0.00043995832110962576, "loss": 5.6574, "mean_token_accuracy": 0.20107316821813584, "num_tokens": 54211277.0, "step": 21390 }, { "entropy": 6.311593770980835, "epoch": 2.4691286785920368, "grad_norm": 0.97265625, "learning_rate": 0.00043993025572830203, "loss": 5.6853, "mean_token_accuracy": 0.19876616299152375, "num_tokens": 54224342.0, "step": 21395 }, { "entropy": 6.282620668411255, "epoch": 2.4697057126370456, "grad_norm": 1.0078125, "learning_rate": 0.00043990218479963115, "loss": 5.6545, "mean_token_accuracy": 0.20636463463306426, "num_tokens": 54236115.0, "step": 21400 }, { "entropy": 6.19582896232605, "epoch": 2.470282746682054, "grad_norm": 0.9609375, "learning_rate": 0.00043987410832455715, "loss": 5.5492, "mean_token_accuracy": 0.21263561248779297, "num_tokens": 54248665.0, "step": 21405 }, { "entropy": 6.241684436798096, "epoch": 2.470859780727063, "grad_norm": 1.0625, "learning_rate": 0.00043984602630402447, "loss": 5.6487, "mean_token_accuracy": 0.20438491851091384, "num_tokens": 54260280.0, "step": 21410 }, { "entropy": 6.288365221023559, "epoch": 2.4714368147720718, "grad_norm": 1.0234375, "learning_rate": 0.00043981793873897756, "loss": 5.6513, "mean_token_accuracy": 0.20701223611831665, "num_tokens": 54271057.0, "step": 21415 }, { "entropy": 6.173783445358277, "epoch": 2.47201384881708, "grad_norm": 1.09375, "learning_rate": 0.0004397898456303612, "loss": 5.5435, "mean_token_accuracy": 0.20986566841602325, "num_tokens": 54284568.0, "step": 21420 }, { "entropy": 6.103800201416016, "epoch": 2.472590882862089, "grad_norm": 1.0703125, "learning_rate": 0.00043976174697912015, "loss": 5.5207, "mean_token_accuracy": 0.21506765633821487, "num_tokens": 54297722.0, "step": 21425 }, { "entropy": 6.244740390777588, "epoch": 2.4731679169070975, "grad_norm": 0.8984375, "learning_rate": 0.0004397336427861996, "loss": 5.6819, "mean_token_accuracy": 0.2026373028755188, "num_tokens": 54310992.0, "step": 21430 }, { "entropy": 6.342148685455323, "epoch": 2.4737449509521063, "grad_norm": 1.0, "learning_rate": 0.0004397055330525448, "loss": 5.7462, "mean_token_accuracy": 0.20157698839902877, "num_tokens": 54323540.0, "step": 21435 }, { "entropy": 6.247800493240357, "epoch": 2.4743219849971148, "grad_norm": 0.96875, "learning_rate": 0.0004396774177791012, "loss": 5.676, "mean_token_accuracy": 0.19401325434446334, "num_tokens": 54335522.0, "step": 21440 }, { "entropy": 6.293228483200073, "epoch": 2.4748990190421236, "grad_norm": 0.98046875, "learning_rate": 0.00043964929696681444, "loss": 5.6632, "mean_token_accuracy": 0.20479120314121246, "num_tokens": 54347216.0, "step": 21445 }, { "entropy": 6.268267822265625, "epoch": 2.475476053087132, "grad_norm": 0.98828125, "learning_rate": 0.0004396211706166305, "loss": 5.6559, "mean_token_accuracy": 0.20086243599653245, "num_tokens": 54360261.0, "step": 21450 }, { "entropy": 6.210558652877808, "epoch": 2.476053087132141, "grad_norm": 0.97265625, "learning_rate": 0.0004395930387294951, "loss": 5.6239, "mean_token_accuracy": 0.20676281154155732, "num_tokens": 54373279.0, "step": 21455 }, { "entropy": 6.266401481628418, "epoch": 2.4766301211771493, "grad_norm": 0.91015625, "learning_rate": 0.0004395649013063546, "loss": 5.655, "mean_token_accuracy": 0.20939665138721467, "num_tokens": 54386266.0, "step": 21460 }, { "entropy": 6.2839456558227536, "epoch": 2.477207155222158, "grad_norm": 1.0546875, "learning_rate": 0.0004395367583481554, "loss": 5.6755, "mean_token_accuracy": 0.2034483477473259, "num_tokens": 54398839.0, "step": 21465 }, { "entropy": 6.203616285324097, "epoch": 2.4777841892671666, "grad_norm": 1.0546875, "learning_rate": 0.00043950860985584423, "loss": 5.5436, "mean_token_accuracy": 0.20790673643350602, "num_tokens": 54409879.0, "step": 21470 }, { "entropy": 6.144044399261475, "epoch": 2.4783612233121755, "grad_norm": 1.046875, "learning_rate": 0.0004394804558303675, "loss": 5.6325, "mean_token_accuracy": 0.19502133280038833, "num_tokens": 54421641.0, "step": 21475 }, { "entropy": 6.348276662826538, "epoch": 2.478938257357184, "grad_norm": 1.0078125, "learning_rate": 0.0004394522962726724, "loss": 5.7115, "mean_token_accuracy": 0.19986581355333327, "num_tokens": 54434169.0, "step": 21480 }, { "entropy": 6.310571575164795, "epoch": 2.4795152914021927, "grad_norm": 0.97265625, "learning_rate": 0.00043942413118370604, "loss": 5.6587, "mean_token_accuracy": 0.20168741345405578, "num_tokens": 54447814.0, "step": 21485 }, { "entropy": 6.220139122009277, "epoch": 2.4800923254472016, "grad_norm": 0.98828125, "learning_rate": 0.0004393959605644157, "loss": 5.7196, "mean_token_accuracy": 0.20173066705465317, "num_tokens": 54460589.0, "step": 21490 }, { "entropy": 6.287173557281494, "epoch": 2.48066935949221, "grad_norm": 0.96484375, "learning_rate": 0.0004393677844157488, "loss": 5.6398, "mean_token_accuracy": 0.20987317860126495, "num_tokens": 54473328.0, "step": 21495 }, { "entropy": 6.273700904846192, "epoch": 2.481246393537219, "grad_norm": 0.97265625, "learning_rate": 0.0004393396027386532, "loss": 5.7089, "mean_token_accuracy": 0.20238712877035142, "num_tokens": 54486763.0, "step": 21500 }, { "entropy": 6.198573303222656, "epoch": 2.4818234275822273, "grad_norm": 0.86328125, "learning_rate": 0.00043931141553407667, "loss": 5.6154, "mean_token_accuracy": 0.2096557453274727, "num_tokens": 54499081.0, "step": 21505 }, { "entropy": 6.21187744140625, "epoch": 2.482400461627236, "grad_norm": 0.96484375, "learning_rate": 0.0004392832228029672, "loss": 5.6042, "mean_token_accuracy": 0.20737080723047258, "num_tokens": 54511776.0, "step": 21510 }, { "entropy": 6.20880446434021, "epoch": 2.4829774956722446, "grad_norm": 0.984375, "learning_rate": 0.00043925502454627327, "loss": 5.6387, "mean_token_accuracy": 0.2091591477394104, "num_tokens": 54524784.0, "step": 21515 }, { "entropy": 6.267707586288452, "epoch": 2.4835545297172534, "grad_norm": 1.0625, "learning_rate": 0.0004392268207649431, "loss": 5.6897, "mean_token_accuracy": 0.20304359644651412, "num_tokens": 54537028.0, "step": 21520 }, { "entropy": 6.349531173706055, "epoch": 2.484131563762262, "grad_norm": 3.28125, "learning_rate": 0.00043919861145992546, "loss": 5.8255, "mean_token_accuracy": 0.19426349252462388, "num_tokens": 54550889.0, "step": 21525 }, { "entropy": 6.262312555313111, "epoch": 2.4847085978072707, "grad_norm": 1.0390625, "learning_rate": 0.000439170396632169, "loss": 5.7531, "mean_token_accuracy": 0.19775451868772506, "num_tokens": 54565218.0, "step": 21530 }, { "entropy": 6.275810718536377, "epoch": 2.485285631852279, "grad_norm": 0.99609375, "learning_rate": 0.0004391421762826229, "loss": 5.6717, "mean_token_accuracy": 0.20421192646026612, "num_tokens": 54577622.0, "step": 21535 }, { "entropy": 6.255017280578613, "epoch": 2.485862665897288, "grad_norm": 0.99609375, "learning_rate": 0.0004391139504122362, "loss": 5.6674, "mean_token_accuracy": 0.2107362762093544, "num_tokens": 54590213.0, "step": 21540 }, { "entropy": 6.198934412002563, "epoch": 2.4864396999422964, "grad_norm": 0.85546875, "learning_rate": 0.00043908571902195827, "loss": 5.6707, "mean_token_accuracy": 0.20420194268226624, "num_tokens": 54603615.0, "step": 21545 }, { "entropy": 6.271377468109131, "epoch": 2.4870167339873053, "grad_norm": 0.93359375, "learning_rate": 0.00043905748211273864, "loss": 5.6319, "mean_token_accuracy": 0.20598290711641312, "num_tokens": 54615924.0, "step": 21550 }, { "entropy": 6.283806180953979, "epoch": 2.4875937680323137, "grad_norm": 0.953125, "learning_rate": 0.00043902923968552714, "loss": 5.6355, "mean_token_accuracy": 0.20139225870370864, "num_tokens": 54629184.0, "step": 21555 }, { "entropy": 6.251756906509399, "epoch": 2.4881708020773226, "grad_norm": 0.875, "learning_rate": 0.0004390009917412737, "loss": 5.7187, "mean_token_accuracy": 0.20357324182987213, "num_tokens": 54642669.0, "step": 21560 }, { "entropy": 6.2144698143005375, "epoch": 2.4887478361223314, "grad_norm": 1.0078125, "learning_rate": 0.00043897273828092824, "loss": 5.6449, "mean_token_accuracy": 0.20835326462984086, "num_tokens": 54655229.0, "step": 21565 }, { "entropy": 6.266665077209472, "epoch": 2.48932487016734, "grad_norm": 0.9921875, "learning_rate": 0.0004389444793054413, "loss": 5.7187, "mean_token_accuracy": 0.20160499662160875, "num_tokens": 54667516.0, "step": 21570 }, { "entropy": 6.256263494491577, "epoch": 2.4899019042123487, "grad_norm": 0.94140625, "learning_rate": 0.00043891621481576324, "loss": 5.604, "mean_token_accuracy": 0.20716971307992935, "num_tokens": 54679832.0, "step": 21575 }, { "entropy": 6.15153546333313, "epoch": 2.490478938257357, "grad_norm": 1.4375, "learning_rate": 0.0004388879448128446, "loss": 5.4434, "mean_token_accuracy": 0.22404341250658036, "num_tokens": 54693943.0, "step": 21580 }, { "entropy": 6.214800024032593, "epoch": 2.491055972302366, "grad_norm": 0.98046875, "learning_rate": 0.00043885966929763635, "loss": 5.6085, "mean_token_accuracy": 0.2090763807296753, "num_tokens": 54706404.0, "step": 21585 }, { "entropy": 6.24335823059082, "epoch": 2.4916330063473744, "grad_norm": 0.96484375, "learning_rate": 0.00043883138827108964, "loss": 5.6839, "mean_token_accuracy": 0.20451874285936356, "num_tokens": 54718323.0, "step": 21590 }, { "entropy": 6.280545473098755, "epoch": 2.4922100403923833, "grad_norm": 1.0078125, "learning_rate": 0.0004388031017341555, "loss": 5.7459, "mean_token_accuracy": 0.1975752130150795, "num_tokens": 54730128.0, "step": 21595 }, { "entropy": 6.210818719863892, "epoch": 2.4927870744373917, "grad_norm": 1.046875, "learning_rate": 0.00043877480968778536, "loss": 5.6288, "mean_token_accuracy": 0.21254943758249284, "num_tokens": 54743437.0, "step": 21600 }, { "entropy": 6.246246719360352, "epoch": 2.4933641084824005, "grad_norm": 0.96875, "learning_rate": 0.0004387465121329309, "loss": 5.6872, "mean_token_accuracy": 0.2016007959842682, "num_tokens": 54755573.0, "step": 21605 }, { "entropy": 6.30978045463562, "epoch": 2.493941142527409, "grad_norm": 0.94140625, "learning_rate": 0.00043871820907054375, "loss": 5.7158, "mean_token_accuracy": 0.1985887572169304, "num_tokens": 54768071.0, "step": 21610 }, { "entropy": 6.356828069686889, "epoch": 2.494518176572418, "grad_norm": 0.91796875, "learning_rate": 0.00043868990050157617, "loss": 5.6958, "mean_token_accuracy": 0.19723668396472932, "num_tokens": 54782245.0, "step": 21615 }, { "entropy": 6.221127367019653, "epoch": 2.4950952106174267, "grad_norm": 1.015625, "learning_rate": 0.0004386615864269799, "loss": 5.59, "mean_token_accuracy": 0.2138514205813408, "num_tokens": 54794335.0, "step": 21620 }, { "entropy": 6.173128604888916, "epoch": 2.495672244662435, "grad_norm": 0.9609375, "learning_rate": 0.00043863326684770746, "loss": 5.6865, "mean_token_accuracy": 0.19914306104183196, "num_tokens": 54807015.0, "step": 21625 }, { "entropy": 6.269874620437622, "epoch": 2.4962492787074435, "grad_norm": 0.9375, "learning_rate": 0.0004386049417647115, "loss": 5.6012, "mean_token_accuracy": 0.19981160759925842, "num_tokens": 54821278.0, "step": 21630 }, { "entropy": 6.30454535484314, "epoch": 2.4968263127524524, "grad_norm": 0.96875, "learning_rate": 0.0004385766111789445, "loss": 5.718, "mean_token_accuracy": 0.20572731792926788, "num_tokens": 54834905.0, "step": 21635 }, { "entropy": 6.178166723251342, "epoch": 2.4974033467974612, "grad_norm": 0.98046875, "learning_rate": 0.0004385482750913595, "loss": 5.639, "mean_token_accuracy": 0.20674082785844802, "num_tokens": 54847597.0, "step": 21640 }, { "entropy": 6.216948652267456, "epoch": 2.4979803808424696, "grad_norm": 0.96875, "learning_rate": 0.0004385199335029094, "loss": 5.5596, "mean_token_accuracy": 0.2129942297935486, "num_tokens": 54859747.0, "step": 21645 }, { "entropy": 6.232190179824829, "epoch": 2.4985574148874785, "grad_norm": 0.93359375, "learning_rate": 0.00043849158641454767, "loss": 5.6783, "mean_token_accuracy": 0.2044348508119583, "num_tokens": 54873025.0, "step": 21650 }, { "entropy": 6.259733438491821, "epoch": 2.499134448932487, "grad_norm": 1.0234375, "learning_rate": 0.00043846323382722765, "loss": 5.6256, "mean_token_accuracy": 0.20907966494560243, "num_tokens": 54884718.0, "step": 21655 }, { "entropy": 6.214492225646973, "epoch": 2.499711482977496, "grad_norm": 0.9921875, "learning_rate": 0.00043843487574190285, "loss": 5.5752, "mean_token_accuracy": 0.20774000585079194, "num_tokens": 54896557.0, "step": 21660 }, { "entropy": 6.324304914474487, "epoch": 2.500288517022504, "grad_norm": 1.015625, "learning_rate": 0.00043840651215952726, "loss": 5.7751, "mean_token_accuracy": 0.19258875250816346, "num_tokens": 54909608.0, "step": 21665 }, { "entropy": 6.266649770736694, "epoch": 2.500865551067513, "grad_norm": 0.9296875, "learning_rate": 0.00043837814308105477, "loss": 5.6315, "mean_token_accuracy": 0.20246251821517944, "num_tokens": 54921794.0, "step": 21670 }, { "entropy": 6.2931750297546385, "epoch": 2.5014425851125215, "grad_norm": 0.875, "learning_rate": 0.00043834976850743964, "loss": 5.7481, "mean_token_accuracy": 0.1991678699851036, "num_tokens": 54934527.0, "step": 21675 }, { "entropy": 6.220940685272216, "epoch": 2.5020196191575304, "grad_norm": 0.9609375, "learning_rate": 0.0004383213884396361, "loss": 5.6211, "mean_token_accuracy": 0.21188863217830659, "num_tokens": 54947074.0, "step": 21680 }, { "entropy": 6.255278253555298, "epoch": 2.5025966532025388, "grad_norm": 0.9921875, "learning_rate": 0.0004382930028785989, "loss": 5.6925, "mean_token_accuracy": 0.200669726729393, "num_tokens": 54958677.0, "step": 21685 }, { "entropy": 6.225498390197754, "epoch": 2.5031736872475476, "grad_norm": 0.96484375, "learning_rate": 0.0004382646118252826, "loss": 5.6129, "mean_token_accuracy": 0.21261499375104903, "num_tokens": 54972067.0, "step": 21690 }, { "entropy": 6.2196948528289795, "epoch": 2.5037507212925565, "grad_norm": 0.95703125, "learning_rate": 0.00043823621528064216, "loss": 5.6831, "mean_token_accuracy": 0.20225461721420288, "num_tokens": 54985010.0, "step": 21695 }, { "entropy": 6.319216060638428, "epoch": 2.504327755337565, "grad_norm": 1.0, "learning_rate": 0.00043820781324563276, "loss": 5.7134, "mean_token_accuracy": 0.2030886098742485, "num_tokens": 54998731.0, "step": 21700 }, { "entropy": 6.222128963470459, "epoch": 2.5049047893825733, "grad_norm": 1.0390625, "learning_rate": 0.00043817940572120963, "loss": 5.578, "mean_token_accuracy": 0.20969972908496856, "num_tokens": 55011288.0, "step": 21705 }, { "entropy": 6.185530328750611, "epoch": 2.505481823427582, "grad_norm": 1.03125, "learning_rate": 0.00043815099270832814, "loss": 5.6708, "mean_token_accuracy": 0.20557806491851807, "num_tokens": 55023718.0, "step": 21710 }, { "entropy": 6.189114046096802, "epoch": 2.506058857472591, "grad_norm": 0.91015625, "learning_rate": 0.00043812257420794415, "loss": 5.6052, "mean_token_accuracy": 0.20728044211864471, "num_tokens": 55036628.0, "step": 21715 }, { "entropy": 6.283075141906738, "epoch": 2.5066358915175995, "grad_norm": 1.015625, "learning_rate": 0.00043809415022101335, "loss": 5.7177, "mean_token_accuracy": 0.19747090339660645, "num_tokens": 55049765.0, "step": 21720 }, { "entropy": 6.187809133529663, "epoch": 2.5072129255626083, "grad_norm": 0.92578125, "learning_rate": 0.0004380657207484919, "loss": 5.6208, "mean_token_accuracy": 0.20721892565488814, "num_tokens": 55061852.0, "step": 21725 }, { "entropy": 6.2997811794281, "epoch": 2.5077899596076167, "grad_norm": 0.8828125, "learning_rate": 0.00043803728579133586, "loss": 5.8328, "mean_token_accuracy": 0.19276068806648256, "num_tokens": 55074560.0, "step": 21730 }, { "entropy": 6.263022184371948, "epoch": 2.5083669936526256, "grad_norm": 1.03125, "learning_rate": 0.0004380088453505017, "loss": 5.6204, "mean_token_accuracy": 0.20828365981578828, "num_tokens": 55086886.0, "step": 21735 }, { "entropy": 6.230650949478149, "epoch": 2.508944027697634, "grad_norm": 0.96875, "learning_rate": 0.00043798039942694603, "loss": 5.6362, "mean_token_accuracy": 0.20490192621946335, "num_tokens": 55100503.0, "step": 21740 }, { "entropy": 6.236802244186402, "epoch": 2.509521061742643, "grad_norm": 0.9375, "learning_rate": 0.00043795194802162557, "loss": 5.5986, "mean_token_accuracy": 0.2043326035141945, "num_tokens": 55113212.0, "step": 21745 }, { "entropy": 6.345450305938721, "epoch": 2.5100980957876513, "grad_norm": 1.078125, "learning_rate": 0.0004379234911354973, "loss": 5.8065, "mean_token_accuracy": 0.19290619790554048, "num_tokens": 55127391.0, "step": 21750 }, { "entropy": 6.275871086120605, "epoch": 2.51067512983266, "grad_norm": 0.98046875, "learning_rate": 0.00043789502876951834, "loss": 5.6751, "mean_token_accuracy": 0.20199310332536696, "num_tokens": 55139990.0, "step": 21755 }, { "entropy": 6.179691314697266, "epoch": 2.5112521638776686, "grad_norm": 1.015625, "learning_rate": 0.0004378665609246459, "loss": 5.5643, "mean_token_accuracy": 0.20908699184656143, "num_tokens": 55152472.0, "step": 21760 }, { "entropy": 6.307994270324707, "epoch": 2.5118291979226774, "grad_norm": 0.91015625, "learning_rate": 0.00043783808760183764, "loss": 5.6479, "mean_token_accuracy": 0.20827796757221223, "num_tokens": 55166342.0, "step": 21765 }, { "entropy": 6.3008218765258786, "epoch": 2.5124062319676863, "grad_norm": 0.9609375, "learning_rate": 0.00043780960880205125, "loss": 5.6837, "mean_token_accuracy": 0.20346897542476655, "num_tokens": 55177925.0, "step": 21770 }, { "entropy": 6.254274559020996, "epoch": 2.5129832660126947, "grad_norm": 0.99609375, "learning_rate": 0.00043778112452624445, "loss": 5.6753, "mean_token_accuracy": 0.20544296503067017, "num_tokens": 55189179.0, "step": 21775 }, { "entropy": 6.2946208953857425, "epoch": 2.513560300057703, "grad_norm": 1.03125, "learning_rate": 0.00043775263477537546, "loss": 5.7016, "mean_token_accuracy": 0.20156548619270326, "num_tokens": 55202244.0, "step": 21780 }, { "entropy": 6.274223327636719, "epoch": 2.514137334102712, "grad_norm": 0.921875, "learning_rate": 0.0004377241395504024, "loss": 5.6769, "mean_token_accuracy": 0.19610415995121003, "num_tokens": 55214545.0, "step": 21785 }, { "entropy": 6.219307136535645, "epoch": 2.514714368147721, "grad_norm": 0.93359375, "learning_rate": 0.0004376956388522837, "loss": 5.5756, "mean_token_accuracy": 0.20902545005083084, "num_tokens": 55227766.0, "step": 21790 }, { "entropy": 6.286997318267822, "epoch": 2.5152914021927293, "grad_norm": 1.0, "learning_rate": 0.0004376671326819781, "loss": 5.7425, "mean_token_accuracy": 0.20105674713850022, "num_tokens": 55239841.0, "step": 21795 }, { "entropy": 6.1693737506866455, "epoch": 2.515868436237738, "grad_norm": 1.0859375, "learning_rate": 0.00043763862104044424, "loss": 5.5362, "mean_token_accuracy": 0.2162746459245682, "num_tokens": 55253440.0, "step": 21800 }, { "entropy": 6.296313810348511, "epoch": 2.5164454702827466, "grad_norm": 1.0234375, "learning_rate": 0.00043761010392864114, "loss": 5.6761, "mean_token_accuracy": 0.2012680545449257, "num_tokens": 55264698.0, "step": 21805 }, { "entropy": 6.271151304244995, "epoch": 2.5170225043277554, "grad_norm": 1.015625, "learning_rate": 0.00043758158134752793, "loss": 5.6467, "mean_token_accuracy": 0.2005464479327202, "num_tokens": 55276923.0, "step": 21810 }, { "entropy": 6.255463409423828, "epoch": 2.517599538372764, "grad_norm": 1.015625, "learning_rate": 0.0004375530532980642, "loss": 5.7302, "mean_token_accuracy": 0.1985969439148903, "num_tokens": 55289774.0, "step": 21815 }, { "entropy": 6.2912153720855715, "epoch": 2.5181765724177727, "grad_norm": 0.984375, "learning_rate": 0.000437524519781209, "loss": 5.7077, "mean_token_accuracy": 0.20262335389852523, "num_tokens": 55301877.0, "step": 21820 }, { "entropy": 6.237303686141968, "epoch": 2.5187536064627816, "grad_norm": 0.99609375, "learning_rate": 0.0004374959807979224, "loss": 5.6419, "mean_token_accuracy": 0.2098629280924797, "num_tokens": 55314680.0, "step": 21825 }, { "entropy": 6.290822076797485, "epoch": 2.51933064050779, "grad_norm": 1.015625, "learning_rate": 0.0004374674363491642, "loss": 5.7023, "mean_token_accuracy": 0.1993727758526802, "num_tokens": 55326874.0, "step": 21830 }, { "entropy": 6.204987907409668, "epoch": 2.5199076745527984, "grad_norm": 0.98828125, "learning_rate": 0.00043743888643589453, "loss": 5.6069, "mean_token_accuracy": 0.216358046233654, "num_tokens": 55339281.0, "step": 21835 }, { "entropy": 6.270220756530762, "epoch": 2.5204847085978073, "grad_norm": 0.96484375, "learning_rate": 0.00043741033105907355, "loss": 5.6715, "mean_token_accuracy": 0.20801110714673995, "num_tokens": 55351187.0, "step": 21840 }, { "entropy": 6.280450439453125, "epoch": 2.521061742642816, "grad_norm": 0.91796875, "learning_rate": 0.0004373817702196618, "loss": 5.6109, "mean_token_accuracy": 0.21126186698675156, "num_tokens": 55365122.0, "step": 21845 }, { "entropy": 6.200860071182251, "epoch": 2.5216387766878245, "grad_norm": 1.0078125, "learning_rate": 0.00043735320391861986, "loss": 5.6885, "mean_token_accuracy": 0.1996615156531334, "num_tokens": 55376494.0, "step": 21850 }, { "entropy": 6.321745252609253, "epoch": 2.522215810732833, "grad_norm": 1.046875, "learning_rate": 0.0004373246321569085, "loss": 5.7292, "mean_token_accuracy": 0.19809221029281615, "num_tokens": 55388037.0, "step": 21855 }, { "entropy": 6.215386056900025, "epoch": 2.522792844777842, "grad_norm": 1.03125, "learning_rate": 0.0004372960549354888, "loss": 5.6028, "mean_token_accuracy": 0.2100651130080223, "num_tokens": 55401356.0, "step": 21860 }, { "entropy": 6.036681222915649, "epoch": 2.5233698788228507, "grad_norm": 0.984375, "learning_rate": 0.00043726747225532195, "loss": 5.4782, "mean_token_accuracy": 0.21606544107198716, "num_tokens": 55414332.0, "step": 21865 }, { "entropy": 6.244798469543457, "epoch": 2.523946912867859, "grad_norm": 0.91796875, "learning_rate": 0.0004372388841173692, "loss": 5.6783, "mean_token_accuracy": 0.20633822977542876, "num_tokens": 55426886.0, "step": 21870 }, { "entropy": 6.310350322723389, "epoch": 2.524523946912868, "grad_norm": 0.91796875, "learning_rate": 0.0004372102905225922, "loss": 5.6655, "mean_token_accuracy": 0.20246700048446656, "num_tokens": 55439688.0, "step": 21875 }, { "entropy": 6.225999355316162, "epoch": 2.5251009809578764, "grad_norm": 1.0625, "learning_rate": 0.00043718169147195275, "loss": 5.6463, "mean_token_accuracy": 0.20482247471809387, "num_tokens": 55451597.0, "step": 21880 }, { "entropy": 6.198139810562134, "epoch": 2.5256780150028852, "grad_norm": 0.98828125, "learning_rate": 0.00043715308696641255, "loss": 5.6717, "mean_token_accuracy": 0.19832488298416137, "num_tokens": 55463627.0, "step": 21885 }, { "entropy": 6.3617720127105715, "epoch": 2.5262550490478937, "grad_norm": 0.96484375, "learning_rate": 0.0004371244770069338, "loss": 5.7348, "mean_token_accuracy": 0.1924797773361206, "num_tokens": 55477071.0, "step": 21890 }, { "entropy": 6.242027854919433, "epoch": 2.5268320830929025, "grad_norm": 1.0390625, "learning_rate": 0.00043709586159447884, "loss": 5.6197, "mean_token_accuracy": 0.20154710710048676, "num_tokens": 55489338.0, "step": 21895 }, { "entropy": 6.254389476776123, "epoch": 2.5274091171379114, "grad_norm": 0.89453125, "learning_rate": 0.00043706724073001017, "loss": 5.6602, "mean_token_accuracy": 0.20467365980148317, "num_tokens": 55503770.0, "step": 21900 }, { "entropy": 6.238600206375122, "epoch": 2.52798615118292, "grad_norm": 0.9609375, "learning_rate": 0.0004370386144144902, "loss": 5.6742, "mean_token_accuracy": 0.19940884560346603, "num_tokens": 55516832.0, "step": 21905 }, { "entropy": 6.331838369369507, "epoch": 2.5285631852279282, "grad_norm": 1.0078125, "learning_rate": 0.0004370099826488821, "loss": 5.7105, "mean_token_accuracy": 0.19989215433597565, "num_tokens": 55530280.0, "step": 21910 }, { "entropy": 6.152864646911621, "epoch": 2.529140219272937, "grad_norm": 0.984375, "learning_rate": 0.0004369813454341486, "loss": 5.6147, "mean_token_accuracy": 0.20575493723154067, "num_tokens": 55542688.0, "step": 21915 }, { "entropy": 6.173724412918091, "epoch": 2.529717253317946, "grad_norm": 0.97265625, "learning_rate": 0.00043695270277125303, "loss": 5.5892, "mean_token_accuracy": 0.21401990056037903, "num_tokens": 55555921.0, "step": 21920 }, { "entropy": 6.242677402496338, "epoch": 2.5302942873629544, "grad_norm": 0.93359375, "learning_rate": 0.0004369240546611587, "loss": 5.6478, "mean_token_accuracy": 0.2048686310648918, "num_tokens": 55569667.0, "step": 21925 }, { "entropy": 6.283534240722656, "epoch": 2.5308713214079632, "grad_norm": 0.95703125, "learning_rate": 0.00043689540110482933, "loss": 5.7008, "mean_token_accuracy": 0.20173778980970383, "num_tokens": 55582170.0, "step": 21930 }, { "entropy": 6.283069610595703, "epoch": 2.5314483554529716, "grad_norm": 0.94140625, "learning_rate": 0.0004368667421032285, "loss": 5.7133, "mean_token_accuracy": 0.20289769768714905, "num_tokens": 55595170.0, "step": 21935 }, { "entropy": 6.278153276443481, "epoch": 2.5320253894979805, "grad_norm": 0.9453125, "learning_rate": 0.00043683807765732013, "loss": 5.6695, "mean_token_accuracy": 0.2047768324613571, "num_tokens": 55606794.0, "step": 21940 }, { "entropy": 6.257738065719605, "epoch": 2.532602423542989, "grad_norm": 0.9453125, "learning_rate": 0.00043680940776806847, "loss": 5.6518, "mean_token_accuracy": 0.2036538690328598, "num_tokens": 55619423.0, "step": 21945 }, { "entropy": 6.2475591659545895, "epoch": 2.533179457587998, "grad_norm": 1.0625, "learning_rate": 0.0004367807324364378, "loss": 5.6697, "mean_token_accuracy": 0.2001153528690338, "num_tokens": 55630934.0, "step": 21950 }, { "entropy": 6.267770147323608, "epoch": 2.533756491633006, "grad_norm": 1.015625, "learning_rate": 0.00043675205166339247, "loss": 5.7134, "mean_token_accuracy": 0.1972763642668724, "num_tokens": 55643781.0, "step": 21955 }, { "entropy": 6.320543956756592, "epoch": 2.534333525678015, "grad_norm": 1.0078125, "learning_rate": 0.0004367233654498973, "loss": 5.8011, "mean_token_accuracy": 0.19383646547794342, "num_tokens": 55655564.0, "step": 21960 }, { "entropy": 6.28122034072876, "epoch": 2.5349105597230235, "grad_norm": 0.96875, "learning_rate": 0.0004366946737969171, "loss": 5.7218, "mean_token_accuracy": 0.20238550156354904, "num_tokens": 55667408.0, "step": 21965 }, { "entropy": 6.2371869564056395, "epoch": 2.5354875937680323, "grad_norm": 1.078125, "learning_rate": 0.0004366659767054168, "loss": 5.5596, "mean_token_accuracy": 0.20951034128665924, "num_tokens": 55680876.0, "step": 21970 }, { "entropy": 6.239698314666748, "epoch": 2.536064627813041, "grad_norm": 1.0078125, "learning_rate": 0.00043663727417636166, "loss": 5.6025, "mean_token_accuracy": 0.2063738688826561, "num_tokens": 55694639.0, "step": 21975 }, { "entropy": 6.179608869552612, "epoch": 2.5366416618580496, "grad_norm": 1.0078125, "learning_rate": 0.0004366085662107171, "loss": 5.6228, "mean_token_accuracy": 0.20993367284536363, "num_tokens": 55707221.0, "step": 21980 }, { "entropy": 6.304040718078613, "epoch": 2.537218695903058, "grad_norm": 0.8828125, "learning_rate": 0.00043657985280944875, "loss": 5.6145, "mean_token_accuracy": 0.2112744152545929, "num_tokens": 55720750.0, "step": 21985 }, { "entropy": 6.270797348022461, "epoch": 2.537795729948067, "grad_norm": 0.97265625, "learning_rate": 0.0004365511339735223, "loss": 5.6923, "mean_token_accuracy": 0.2032615840435028, "num_tokens": 55732550.0, "step": 21990 }, { "entropy": 6.2165101051330565, "epoch": 2.5383727639930758, "grad_norm": 0.97265625, "learning_rate": 0.0004365224097039036, "loss": 5.6489, "mean_token_accuracy": 0.20692258179187775, "num_tokens": 55745468.0, "step": 21995 }, { "entropy": 6.198334550857544, "epoch": 2.538949798038084, "grad_norm": 1.015625, "learning_rate": 0.000436493680001559, "loss": 5.6648, "mean_token_accuracy": 0.20468035489320754, "num_tokens": 55757193.0, "step": 22000 }, { "entropy": 6.244527673721313, "epoch": 2.539526832083093, "grad_norm": 0.96484375, "learning_rate": 0.00043646494486745464, "loss": 5.6595, "mean_token_accuracy": 0.2026069477200508, "num_tokens": 55770185.0, "step": 22005 }, { "entropy": 6.272916173934936, "epoch": 2.5401038661281015, "grad_norm": 0.9765625, "learning_rate": 0.0004364362043025571, "loss": 5.6532, "mean_token_accuracy": 0.2028561934828758, "num_tokens": 55782204.0, "step": 22010 }, { "entropy": 6.178328990936279, "epoch": 2.5406809001731103, "grad_norm": 0.9375, "learning_rate": 0.00043640745830783297, "loss": 5.5757, "mean_token_accuracy": 0.20987578332424164, "num_tokens": 55795077.0, "step": 22015 }, { "entropy": 6.270701599121094, "epoch": 2.5412579342181187, "grad_norm": 0.98046875, "learning_rate": 0.0004363787068842491, "loss": 5.6363, "mean_token_accuracy": 0.21340528428554534, "num_tokens": 55808876.0, "step": 22020 }, { "entropy": 6.327560901641846, "epoch": 2.5418349682631276, "grad_norm": 0.90625, "learning_rate": 0.0004363499500327727, "loss": 5.7614, "mean_token_accuracy": 0.19813940078020095, "num_tokens": 55822861.0, "step": 22025 }, { "entropy": 6.256553268432617, "epoch": 2.542412002308136, "grad_norm": 0.9921875, "learning_rate": 0.00043632118775437085, "loss": 5.6651, "mean_token_accuracy": 0.20089796036481858, "num_tokens": 55835523.0, "step": 22030 }, { "entropy": 6.266847419738769, "epoch": 2.542989036353145, "grad_norm": 0.984375, "learning_rate": 0.00043629242005001096, "loss": 5.7063, "mean_token_accuracy": 0.19951148480176925, "num_tokens": 55848377.0, "step": 22035 }, { "entropy": 6.341313457489013, "epoch": 2.5435660703981533, "grad_norm": 0.97265625, "learning_rate": 0.0004362636469206607, "loss": 5.7602, "mean_token_accuracy": 0.19608056247234346, "num_tokens": 55862074.0, "step": 22040 }, { "entropy": 6.232118225097656, "epoch": 2.544143104443162, "grad_norm": 1.015625, "learning_rate": 0.0004362348683672877, "loss": 5.6627, "mean_token_accuracy": 0.19688585698604583, "num_tokens": 55874816.0, "step": 22045 }, { "entropy": 6.312012147903443, "epoch": 2.544720138488171, "grad_norm": 0.9921875, "learning_rate": 0.0004362060843908601, "loss": 5.7316, "mean_token_accuracy": 0.200949464738369, "num_tokens": 55887424.0, "step": 22050 }, { "entropy": 6.265195035934449, "epoch": 2.5452971725331794, "grad_norm": 0.94921875, "learning_rate": 0.0004361772949923458, "loss": 5.6968, "mean_token_accuracy": 0.20014529079198837, "num_tokens": 55900532.0, "step": 22055 }, { "entropy": 6.273292350769043, "epoch": 2.545874206578188, "grad_norm": 1.046875, "learning_rate": 0.0004361485001727132, "loss": 5.6842, "mean_token_accuracy": 0.20204830914735794, "num_tokens": 55912599.0, "step": 22060 }, { "entropy": 6.291330242156983, "epoch": 2.5464512406231967, "grad_norm": 0.9375, "learning_rate": 0.000436119699932931, "loss": 5.7034, "mean_token_accuracy": 0.20001255422830583, "num_tokens": 55925012.0, "step": 22065 }, { "entropy": 6.226291131973267, "epoch": 2.5470282746682056, "grad_norm": 0.91015625, "learning_rate": 0.00043609089427396763, "loss": 5.6404, "mean_token_accuracy": 0.21029446870088578, "num_tokens": 55938058.0, "step": 22070 }, { "entropy": 6.282356548309326, "epoch": 2.547605308713214, "grad_norm": 1.078125, "learning_rate": 0.00043606208319679215, "loss": 5.7489, "mean_token_accuracy": 0.1997848466038704, "num_tokens": 55951439.0, "step": 22075 }, { "entropy": 6.219042015075684, "epoch": 2.548182342758223, "grad_norm": 1.1015625, "learning_rate": 0.0004360332667023734, "loss": 5.5914, "mean_token_accuracy": 0.21249673515558243, "num_tokens": 55964583.0, "step": 22080 }, { "entropy": 6.158158445358277, "epoch": 2.5487593768032313, "grad_norm": 1.0, "learning_rate": 0.00043600444479168084, "loss": 5.5608, "mean_token_accuracy": 0.21451905071735383, "num_tokens": 55978072.0, "step": 22085 }, { "entropy": 6.228409147262573, "epoch": 2.54933641084824, "grad_norm": 1.015625, "learning_rate": 0.0004359756174656836, "loss": 5.6167, "mean_token_accuracy": 0.21293352097272872, "num_tokens": 55990278.0, "step": 22090 }, { "entropy": 6.220971727371216, "epoch": 2.5499134448932486, "grad_norm": 1.0234375, "learning_rate": 0.00043594678472535153, "loss": 5.6669, "mean_token_accuracy": 0.1993907481431961, "num_tokens": 56003303.0, "step": 22095 }, { "entropy": 6.256470966339111, "epoch": 2.5504904789382574, "grad_norm": 0.9921875, "learning_rate": 0.00043591794657165425, "loss": 5.6397, "mean_token_accuracy": 0.2146317794919014, "num_tokens": 56015131.0, "step": 22100 }, { "entropy": 6.207059574127197, "epoch": 2.5510675129832663, "grad_norm": 1.0078125, "learning_rate": 0.0004358891030055617, "loss": 5.6164, "mean_token_accuracy": 0.20772802382707595, "num_tokens": 56027804.0, "step": 22105 }, { "entropy": 6.328710889816284, "epoch": 2.5516445470282747, "grad_norm": 1.0390625, "learning_rate": 0.0004358602540280443, "loss": 5.7683, "mean_token_accuracy": 0.19766588211059571, "num_tokens": 56040485.0, "step": 22110 }, { "entropy": 6.345161628723145, "epoch": 2.552221581073283, "grad_norm": 1.0, "learning_rate": 0.00043583139964007203, "loss": 5.7004, "mean_token_accuracy": 0.19818729907274246, "num_tokens": 56052091.0, "step": 22115 }, { "entropy": 6.230707883834839, "epoch": 2.552798615118292, "grad_norm": 1.015625, "learning_rate": 0.00043580253984261554, "loss": 5.616, "mean_token_accuracy": 0.21017952263355255, "num_tokens": 56063291.0, "step": 22120 }, { "entropy": 6.209798955917359, "epoch": 2.553375649163301, "grad_norm": 0.953125, "learning_rate": 0.00043577367463664546, "loss": 5.6857, "mean_token_accuracy": 0.19613204300403594, "num_tokens": 56074219.0, "step": 22125 }, { "entropy": 6.210433530807495, "epoch": 2.5539526832083093, "grad_norm": 0.94140625, "learning_rate": 0.0004357448040231327, "loss": 5.6115, "mean_token_accuracy": 0.20355152934789658, "num_tokens": 56088126.0, "step": 22130 }, { "entropy": 6.378800106048584, "epoch": 2.5545297172533177, "grad_norm": 0.9609375, "learning_rate": 0.0004357159280030483, "loss": 5.7079, "mean_token_accuracy": 0.2006726622581482, "num_tokens": 56101686.0, "step": 22135 }, { "entropy": 6.2526123046875, "epoch": 2.5551067512983265, "grad_norm": 1.0078125, "learning_rate": 0.0004356870465773635, "loss": 5.7186, "mean_token_accuracy": 0.20398495048284532, "num_tokens": 56114605.0, "step": 22140 }, { "entropy": 6.168740701675415, "epoch": 2.5556837853433354, "grad_norm": 1.0546875, "learning_rate": 0.00043565815974704974, "loss": 5.573, "mean_token_accuracy": 0.2081254780292511, "num_tokens": 56127955.0, "step": 22145 }, { "entropy": 6.382021141052246, "epoch": 2.556260819388344, "grad_norm": 0.9609375, "learning_rate": 0.00043562926751307857, "loss": 5.8001, "mean_token_accuracy": 0.19422426521778108, "num_tokens": 56140691.0, "step": 22150 }, { "entropy": 6.26363320350647, "epoch": 2.5568378534333527, "grad_norm": 0.98046875, "learning_rate": 0.00043560036987642177, "loss": 5.6568, "mean_token_accuracy": 0.20106588900089264, "num_tokens": 56153815.0, "step": 22155 }, { "entropy": 6.287132501602173, "epoch": 2.557414887478361, "grad_norm": 0.9296875, "learning_rate": 0.00043557146683805134, "loss": 5.6756, "mean_token_accuracy": 0.20819469094276427, "num_tokens": 56167186.0, "step": 22160 }, { "entropy": 6.265668487548828, "epoch": 2.55799192152337, "grad_norm": 0.94921875, "learning_rate": 0.0004355425583989393, "loss": 5.683, "mean_token_accuracy": 0.20115176886320113, "num_tokens": 56179307.0, "step": 22165 }, { "entropy": 6.318639707565308, "epoch": 2.5585689555683784, "grad_norm": 0.92578125, "learning_rate": 0.00043551364456005816, "loss": 5.7153, "mean_token_accuracy": 0.19732150733470916, "num_tokens": 56191398.0, "step": 22170 }, { "entropy": 6.215137052536011, "epoch": 2.5591459896133872, "grad_norm": 0.94921875, "learning_rate": 0.00043548472532238015, "loss": 5.6051, "mean_token_accuracy": 0.2094906821846962, "num_tokens": 56203871.0, "step": 22175 }, { "entropy": 6.178353118896484, "epoch": 2.559723023658396, "grad_norm": 0.984375, "learning_rate": 0.00043545580068687836, "loss": 5.6493, "mean_token_accuracy": 0.2003050848841667, "num_tokens": 56215262.0, "step": 22180 }, { "entropy": 6.236694097518921, "epoch": 2.5603000577034045, "grad_norm": 0.953125, "learning_rate": 0.0004354268706545252, "loss": 5.6292, "mean_token_accuracy": 0.2125608891248703, "num_tokens": 56230190.0, "step": 22185 }, { "entropy": 6.2028497695922855, "epoch": 2.560877091748413, "grad_norm": 0.984375, "learning_rate": 0.00043539793522629405, "loss": 5.5752, "mean_token_accuracy": 0.21496107280254365, "num_tokens": 56243841.0, "step": 22190 }, { "entropy": 6.262893390655518, "epoch": 2.561454125793422, "grad_norm": 0.97265625, "learning_rate": 0.00043536899440315796, "loss": 5.6524, "mean_token_accuracy": 0.20673952549695968, "num_tokens": 56257500.0, "step": 22195 }, { "entropy": 6.274878883361817, "epoch": 2.5620311598384307, "grad_norm": 0.91796875, "learning_rate": 0.0004353400481860904, "loss": 5.6407, "mean_token_accuracy": 0.20147757828235627, "num_tokens": 56269732.0, "step": 22200 }, { "entropy": 6.292238998413086, "epoch": 2.562608193883439, "grad_norm": 0.90234375, "learning_rate": 0.00043531109657606504, "loss": 5.7121, "mean_token_accuracy": 0.1995270237326622, "num_tokens": 56283192.0, "step": 22205 }, { "entropy": 6.2072947978973385, "epoch": 2.563185227928448, "grad_norm": 0.953125, "learning_rate": 0.0004352821395740555, "loss": 5.6509, "mean_token_accuracy": 0.20001816153526306, "num_tokens": 56296312.0, "step": 22210 }, { "entropy": 6.310428857803345, "epoch": 2.5637622619734564, "grad_norm": 0.96484375, "learning_rate": 0.0004352531771810359, "loss": 5.6707, "mean_token_accuracy": 0.20241052210330962, "num_tokens": 56309964.0, "step": 22215 }, { "entropy": 6.230297374725342, "epoch": 2.564339296018465, "grad_norm": 0.95703125, "learning_rate": 0.0004352242093979802, "loss": 5.6745, "mean_token_accuracy": 0.20699879378080369, "num_tokens": 56324002.0, "step": 22220 }, { "entropy": 6.283534288406372, "epoch": 2.5649163300634736, "grad_norm": 0.9296875, "learning_rate": 0.0004351952362258628, "loss": 5.6904, "mean_token_accuracy": 0.1992029994726181, "num_tokens": 56336339.0, "step": 22225 }, { "entropy": 6.271181678771972, "epoch": 2.5654933641084825, "grad_norm": 1.0078125, "learning_rate": 0.00043516625766565825, "loss": 5.6853, "mean_token_accuracy": 0.20188935101032257, "num_tokens": 56347819.0, "step": 22230 }, { "entropy": 6.3224749088287355, "epoch": 2.566070398153491, "grad_norm": 0.9296875, "learning_rate": 0.0004351372737183412, "loss": 5.6653, "mean_token_accuracy": 0.19866761267185212, "num_tokens": 56360764.0, "step": 22235 }, { "entropy": 6.262296724319458, "epoch": 2.5666474321985, "grad_norm": 1.0546875, "learning_rate": 0.0004351082843848865, "loss": 5.6915, "mean_token_accuracy": 0.19294437319040297, "num_tokens": 56372731.0, "step": 22240 }, { "entropy": 6.226365852355957, "epoch": 2.567224466243508, "grad_norm": 0.96484375, "learning_rate": 0.00043507928966626916, "loss": 5.6529, "mean_token_accuracy": 0.19948222488164902, "num_tokens": 56385650.0, "step": 22245 }, { "entropy": 6.267301321029663, "epoch": 2.567801500288517, "grad_norm": 1.3203125, "learning_rate": 0.0004350502895634644, "loss": 5.6468, "mean_token_accuracy": 0.20801960527896882, "num_tokens": 56397076.0, "step": 22250 }, { "entropy": 6.253646421432495, "epoch": 2.568378534333526, "grad_norm": 0.9609375, "learning_rate": 0.0004350212840774476, "loss": 5.6116, "mean_token_accuracy": 0.20903352200984954, "num_tokens": 56409779.0, "step": 22255 }, { "entropy": 6.3054948329925535, "epoch": 2.5689555683785343, "grad_norm": 1.0625, "learning_rate": 0.00043499227320919456, "loss": 5.7234, "mean_token_accuracy": 0.1943468287587166, "num_tokens": 56423204.0, "step": 22260 }, { "entropy": 6.291591644287109, "epoch": 2.5695326024235428, "grad_norm": 1.0, "learning_rate": 0.00043496325695968076, "loss": 5.7115, "mean_token_accuracy": 0.2068028509616852, "num_tokens": 56436379.0, "step": 22265 }, { "entropy": 6.275308132171631, "epoch": 2.5701096364685516, "grad_norm": 0.94921875, "learning_rate": 0.0004349342353298823, "loss": 5.6661, "mean_token_accuracy": 0.20189398825168609, "num_tokens": 56449558.0, "step": 22270 }, { "entropy": 6.256720972061157, "epoch": 2.5706866705135605, "grad_norm": 0.84765625, "learning_rate": 0.0004349052083207753, "loss": 5.6755, "mean_token_accuracy": 0.20200487673282624, "num_tokens": 56463541.0, "step": 22275 }, { "entropy": 6.403251314163208, "epoch": 2.571263704558569, "grad_norm": 0.8984375, "learning_rate": 0.000434876175933336, "loss": 5.8167, "mean_token_accuracy": 0.19026020169258118, "num_tokens": 56476849.0, "step": 22280 }, { "entropy": 6.254389524459839, "epoch": 2.5718407386035778, "grad_norm": 0.93359375, "learning_rate": 0.00043484713816854093, "loss": 5.6296, "mean_token_accuracy": 0.2059500753879547, "num_tokens": 56490089.0, "step": 22285 }, { "entropy": 6.2421732425689695, "epoch": 2.572417772648586, "grad_norm": 0.99609375, "learning_rate": 0.0004348180950273668, "loss": 5.6231, "mean_token_accuracy": 0.20976163148880006, "num_tokens": 56501392.0, "step": 22290 }, { "entropy": 6.219451189041138, "epoch": 2.572994806693595, "grad_norm": 1.3046875, "learning_rate": 0.0004347890465107905, "loss": 5.5656, "mean_token_accuracy": 0.21205515861511232, "num_tokens": 56513573.0, "step": 22295 }, { "entropy": 6.270431661605835, "epoch": 2.5735718407386035, "grad_norm": 0.953125, "learning_rate": 0.00043475999261978894, "loss": 5.6635, "mean_token_accuracy": 0.20469413846731185, "num_tokens": 56526762.0, "step": 22300 }, { "entropy": 6.231783866882324, "epoch": 2.5741488747836123, "grad_norm": 0.93359375, "learning_rate": 0.0004347309333553393, "loss": 5.6629, "mean_token_accuracy": 0.20476937890052796, "num_tokens": 56538264.0, "step": 22305 }, { "entropy": 6.313006258010864, "epoch": 2.5747259088286207, "grad_norm": 1.046875, "learning_rate": 0.00043470186871841915, "loss": 5.7382, "mean_token_accuracy": 0.19123051762580873, "num_tokens": 56550296.0, "step": 22310 }, { "entropy": 6.272767353057861, "epoch": 2.5753029428736296, "grad_norm": 1.03125, "learning_rate": 0.000434672798710006, "loss": 5.6627, "mean_token_accuracy": 0.20164896100759505, "num_tokens": 56563542.0, "step": 22315 }, { "entropy": 6.180900287628174, "epoch": 2.575879976918638, "grad_norm": 1.015625, "learning_rate": 0.00043464372333107756, "loss": 5.6222, "mean_token_accuracy": 0.21378878206014634, "num_tokens": 56576992.0, "step": 22320 }, { "entropy": 6.305271196365356, "epoch": 2.576457010963647, "grad_norm": 0.9765625, "learning_rate": 0.00043461464258261174, "loss": 5.6436, "mean_token_accuracy": 0.2100139304995537, "num_tokens": 56589271.0, "step": 22325 }, { "entropy": 6.096579265594483, "epoch": 2.5770340450086557, "grad_norm": 1.0703125, "learning_rate": 0.0004345855564655867, "loss": 5.3381, "mean_token_accuracy": 0.23082049638032914, "num_tokens": 56600796.0, "step": 22330 }, { "entropy": 6.154261302947998, "epoch": 2.577611079053664, "grad_norm": 1.6015625, "learning_rate": 0.00043455646498098075, "loss": 5.5601, "mean_token_accuracy": 0.22364532202482224, "num_tokens": 56613327.0, "step": 22335 }, { "entropy": 6.216110801696777, "epoch": 2.5781881130986726, "grad_norm": 0.9453125, "learning_rate": 0.00043452736812977236, "loss": 5.6268, "mean_token_accuracy": 0.20740117281675338, "num_tokens": 56626554.0, "step": 22340 }, { "entropy": 6.301758813858032, "epoch": 2.5787651471436814, "grad_norm": 0.98046875, "learning_rate": 0.0004344982659129402, "loss": 5.6516, "mean_token_accuracy": 0.20795178562402725, "num_tokens": 56639960.0, "step": 22345 }, { "entropy": 6.220022344589234, "epoch": 2.5793421811886903, "grad_norm": 1.015625, "learning_rate": 0.0004344691583314631, "loss": 5.6642, "mean_token_accuracy": 0.20658115595579146, "num_tokens": 56651330.0, "step": 22350 }, { "entropy": 6.320055055618286, "epoch": 2.5799192152336987, "grad_norm": 1.03125, "learning_rate": 0.00043444004538632005, "loss": 5.7811, "mean_token_accuracy": 0.19568791687488557, "num_tokens": 56664359.0, "step": 22355 }, { "entropy": 6.260113191604614, "epoch": 2.5804962492787076, "grad_norm": 0.9765625, "learning_rate": 0.00043441092707849024, "loss": 5.6809, "mean_token_accuracy": 0.19256843030452728, "num_tokens": 56676095.0, "step": 22360 }, { "entropy": 6.245993804931641, "epoch": 2.581073283323716, "grad_norm": 0.94921875, "learning_rate": 0.00043438180340895315, "loss": 5.7382, "mean_token_accuracy": 0.20092551559209823, "num_tokens": 56689918.0, "step": 22365 }, { "entropy": 6.314111948013306, "epoch": 2.581650317368725, "grad_norm": 1.0625, "learning_rate": 0.00043435267437868825, "loss": 5.7167, "mean_token_accuracy": 0.19776170402765275, "num_tokens": 56702308.0, "step": 22370 }, { "entropy": 6.279919195175171, "epoch": 2.5822273514137333, "grad_norm": 1.015625, "learning_rate": 0.0004343235399886753, "loss": 5.6808, "mean_token_accuracy": 0.2025884211063385, "num_tokens": 56713928.0, "step": 22375 }, { "entropy": 6.313197612762451, "epoch": 2.582804385458742, "grad_norm": 0.94921875, "learning_rate": 0.0004342944002398942, "loss": 5.7338, "mean_token_accuracy": 0.20102918148040771, "num_tokens": 56727065.0, "step": 22380 }, { "entropy": 6.219231986999512, "epoch": 2.583381419503751, "grad_norm": 1.046875, "learning_rate": 0.0004342652551333251, "loss": 5.6926, "mean_token_accuracy": 0.2002527579665184, "num_tokens": 56739517.0, "step": 22385 }, { "entropy": 6.218995571136475, "epoch": 2.5839584535487594, "grad_norm": 0.9765625, "learning_rate": 0.0004342361046699482, "loss": 5.6592, "mean_token_accuracy": 0.20271196961402893, "num_tokens": 56753044.0, "step": 22390 }, { "entropy": 6.279383802413941, "epoch": 2.584535487593768, "grad_norm": 1.0625, "learning_rate": 0.0004342069488507441, "loss": 5.6647, "mean_token_accuracy": 0.2001708671450615, "num_tokens": 56765500.0, "step": 22395 }, { "entropy": 6.3404487609863285, "epoch": 2.5851125216387767, "grad_norm": 0.9765625, "learning_rate": 0.0004341777876766933, "loss": 5.7543, "mean_token_accuracy": 0.19143348187208176, "num_tokens": 56777895.0, "step": 22400 }, { "entropy": 6.305113029479981, "epoch": 2.5856895556837856, "grad_norm": 0.89453125, "learning_rate": 0.0004341486211487767, "loss": 5.6089, "mean_token_accuracy": 0.2092020481824875, "num_tokens": 56791523.0, "step": 22405 }, { "entropy": 6.248012638092041, "epoch": 2.586266589728794, "grad_norm": 0.953125, "learning_rate": 0.0004341194492679753, "loss": 5.6925, "mean_token_accuracy": 0.20056382268667222, "num_tokens": 56803490.0, "step": 22410 }, { "entropy": 6.2818280220031735, "epoch": 2.5868436237738024, "grad_norm": 1.0234375, "learning_rate": 0.00043409027203527016, "loss": 5.6988, "mean_token_accuracy": 0.20019769668579102, "num_tokens": 56814398.0, "step": 22415 }, { "entropy": 6.171245193481445, "epoch": 2.5874206578188113, "grad_norm": 0.984375, "learning_rate": 0.00043406108945164283, "loss": 5.6304, "mean_token_accuracy": 0.21150241196155548, "num_tokens": 56826591.0, "step": 22420 }, { "entropy": 6.223255968093872, "epoch": 2.58799769186382, "grad_norm": 1.078125, "learning_rate": 0.00043403190151807474, "loss": 5.6583, "mean_token_accuracy": 0.1956866815686226, "num_tokens": 56839208.0, "step": 22425 }, { "entropy": 6.3081676959991455, "epoch": 2.5885747259088285, "grad_norm": 0.97265625, "learning_rate": 0.0004340027082355477, "loss": 5.6619, "mean_token_accuracy": 0.19987513720989228, "num_tokens": 56852211.0, "step": 22430 }, { "entropy": 6.222271680831909, "epoch": 2.5891517599538374, "grad_norm": 0.98828125, "learning_rate": 0.0004339735096050434, "loss": 5.6073, "mean_token_accuracy": 0.202955661714077, "num_tokens": 56864691.0, "step": 22435 }, { "entropy": 6.230732583999634, "epoch": 2.589728793998846, "grad_norm": 1.03125, "learning_rate": 0.0004339443056275443, "loss": 5.586, "mean_token_accuracy": 0.2181745320558548, "num_tokens": 56877473.0, "step": 22440 }, { "entropy": 6.302584171295166, "epoch": 2.5903058280438547, "grad_norm": 1.0078125, "learning_rate": 0.00043391509630403224, "loss": 5.7247, "mean_token_accuracy": 0.20378457903862, "num_tokens": 56889852.0, "step": 22445 }, { "entropy": 6.319608592987061, "epoch": 2.590882862088863, "grad_norm": 0.99609375, "learning_rate": 0.00043388588163549, "loss": 5.7673, "mean_token_accuracy": 0.19541571885347367, "num_tokens": 56901882.0, "step": 22450 }, { "entropy": 6.304369354248047, "epoch": 2.591459896133872, "grad_norm": 0.9296875, "learning_rate": 0.00043385666162289995, "loss": 5.6942, "mean_token_accuracy": 0.2035412758588791, "num_tokens": 56913212.0, "step": 22455 }, { "entropy": 6.28717679977417, "epoch": 2.592036930178881, "grad_norm": 0.99609375, "learning_rate": 0.00043382743626724506, "loss": 5.7174, "mean_token_accuracy": 0.19611125141382219, "num_tokens": 56924490.0, "step": 22460 }, { "entropy": 6.302191925048828, "epoch": 2.5926139642238892, "grad_norm": 0.94921875, "learning_rate": 0.0004337982055695082, "loss": 5.795, "mean_token_accuracy": 0.19198362976312638, "num_tokens": 56937558.0, "step": 22465 }, { "entropy": 6.243434572219849, "epoch": 2.5931909982688977, "grad_norm": 0.92578125, "learning_rate": 0.0004337689695306726, "loss": 5.69, "mean_token_accuracy": 0.20614712983369826, "num_tokens": 56950544.0, "step": 22470 }, { "entropy": 6.339292383193969, "epoch": 2.5937680323139065, "grad_norm": 1.0390625, "learning_rate": 0.0004337397281517215, "loss": 5.6716, "mean_token_accuracy": 0.2014582559466362, "num_tokens": 56962972.0, "step": 22475 }, { "entropy": 6.2792774677276615, "epoch": 2.5943450663589154, "grad_norm": 1.0546875, "learning_rate": 0.0004337104814336386, "loss": 5.6624, "mean_token_accuracy": 0.2001517191529274, "num_tokens": 56975972.0, "step": 22480 }, { "entropy": 6.303111886978149, "epoch": 2.594922100403924, "grad_norm": 1.03125, "learning_rate": 0.0004336812293774075, "loss": 5.7709, "mean_token_accuracy": 0.19594867676496505, "num_tokens": 56989106.0, "step": 22485 }, { "entropy": 6.286650085449219, "epoch": 2.595499134448932, "grad_norm": 1.0078125, "learning_rate": 0.00043365197198401195, "loss": 5.6554, "mean_token_accuracy": 0.2046741396188736, "num_tokens": 57002544.0, "step": 22490 }, { "entropy": 6.355883836746216, "epoch": 2.596076168493941, "grad_norm": 0.9375, "learning_rate": 0.0004336227092544362, "loss": 5.7445, "mean_token_accuracy": 0.19667317122220992, "num_tokens": 57016526.0, "step": 22495 }, { "entropy": 6.32221302986145, "epoch": 2.59665320253895, "grad_norm": 1.0390625, "learning_rate": 0.0004335934411896644, "loss": 5.6869, "mean_token_accuracy": 0.2055511876940727, "num_tokens": 57029817.0, "step": 22500 }, { "entropy": 6.2109943389892575, "epoch": 2.5972302365839584, "grad_norm": 0.94140625, "learning_rate": 0.000433564167790681, "loss": 5.6698, "mean_token_accuracy": 0.2063784584403038, "num_tokens": 57042189.0, "step": 22505 }, { "entropy": 6.24761929512024, "epoch": 2.597807270628967, "grad_norm": 1.03125, "learning_rate": 0.0004335348890584706, "loss": 5.6843, "mean_token_accuracy": 0.19666637927293779, "num_tokens": 57054297.0, "step": 22510 }, { "entropy": 6.288054037094116, "epoch": 2.5983843046739756, "grad_norm": 0.96484375, "learning_rate": 0.00043350560499401793, "loss": 5.66, "mean_token_accuracy": 0.20568008124828338, "num_tokens": 57067530.0, "step": 22515 }, { "entropy": 6.31848177909851, "epoch": 2.5989613387189845, "grad_norm": 0.98046875, "learning_rate": 0.0004334763155983079, "loss": 5.7608, "mean_token_accuracy": 0.19461397528648378, "num_tokens": 57080877.0, "step": 22520 }, { "entropy": 6.29225344657898, "epoch": 2.599538372763993, "grad_norm": 1.0546875, "learning_rate": 0.00043344702087232584, "loss": 5.6792, "mean_token_accuracy": 0.20767224729061126, "num_tokens": 57092716.0, "step": 22525 }, { "entropy": 6.193208980560303, "epoch": 2.6001154068090018, "grad_norm": 0.9765625, "learning_rate": 0.0004334177208170569, "loss": 5.6159, "mean_token_accuracy": 0.20914204120635987, "num_tokens": 57107335.0, "step": 22530 }, { "entropy": 6.280509567260742, "epoch": 2.6006924408540106, "grad_norm": 0.97265625, "learning_rate": 0.00043338841543348654, "loss": 5.6465, "mean_token_accuracy": 0.2092574030160904, "num_tokens": 57121691.0, "step": 22535 }, { "entropy": 6.325465726852417, "epoch": 2.601269474899019, "grad_norm": 1.0234375, "learning_rate": 0.00043335910472260057, "loss": 5.7343, "mean_token_accuracy": 0.19246442764997482, "num_tokens": 57134536.0, "step": 22540 }, { "entropy": 6.290104150772095, "epoch": 2.6018465089440275, "grad_norm": 0.94140625, "learning_rate": 0.00043332978868538483, "loss": 5.6518, "mean_token_accuracy": 0.20202865302562714, "num_tokens": 57147141.0, "step": 22545 }, { "entropy": 6.205418395996094, "epoch": 2.6024235429890363, "grad_norm": 0.96484375, "learning_rate": 0.00043330046732282515, "loss": 5.6241, "mean_token_accuracy": 0.21425416469573974, "num_tokens": 57160097.0, "step": 22550 }, { "entropy": 6.144654846191406, "epoch": 2.603000577034045, "grad_norm": 0.96875, "learning_rate": 0.00043327114063590797, "loss": 5.5539, "mean_token_accuracy": 0.2236112490296364, "num_tokens": 57173378.0, "step": 22555 }, { "entropy": 6.259184217453003, "epoch": 2.6035776110790536, "grad_norm": 0.99609375, "learning_rate": 0.0004332418086256196, "loss": 5.6346, "mean_token_accuracy": 0.21564380526542665, "num_tokens": 57187957.0, "step": 22560 }, { "entropy": 6.26995882987976, "epoch": 2.6041546451240625, "grad_norm": 0.96484375, "learning_rate": 0.0004332124712929466, "loss": 5.69, "mean_token_accuracy": 0.20136985182762146, "num_tokens": 57202186.0, "step": 22565 }, { "entropy": 6.347912549972534, "epoch": 2.604731679169071, "grad_norm": 1.09375, "learning_rate": 0.00043318312863887566, "loss": 5.6956, "mean_token_accuracy": 0.19911793023347854, "num_tokens": 57213841.0, "step": 22570 }, { "entropy": 6.273216676712036, "epoch": 2.6053087132140798, "grad_norm": 1.0390625, "learning_rate": 0.00043315378066439384, "loss": 5.6397, "mean_token_accuracy": 0.21021705567836763, "num_tokens": 57226445.0, "step": 22575 }, { "entropy": 6.241339874267578, "epoch": 2.605885747259088, "grad_norm": 1.0234375, "learning_rate": 0.0004331244273704881, "loss": 5.6547, "mean_token_accuracy": 0.20707382261753082, "num_tokens": 57238913.0, "step": 22580 }, { "entropy": 6.246391677856446, "epoch": 2.606462781304097, "grad_norm": 0.9375, "learning_rate": 0.0004330950687581458, "loss": 5.6589, "mean_token_accuracy": 0.2090754434466362, "num_tokens": 57251082.0, "step": 22585 }, { "entropy": 6.262573862075806, "epoch": 2.6070398153491054, "grad_norm": 1.0078125, "learning_rate": 0.00043306570482835443, "loss": 5.6858, "mean_token_accuracy": 0.20205187648534775, "num_tokens": 57263267.0, "step": 22590 }, { "entropy": 6.275821495056152, "epoch": 2.6076168493941143, "grad_norm": 0.96484375, "learning_rate": 0.0004330363355821016, "loss": 5.678, "mean_token_accuracy": 0.2027643546462059, "num_tokens": 57277053.0, "step": 22595 }, { "entropy": 6.257179307937622, "epoch": 2.6081938834391227, "grad_norm": 0.92578125, "learning_rate": 0.0004330069610203751, "loss": 5.6088, "mean_token_accuracy": 0.20768820494413376, "num_tokens": 57289962.0, "step": 22600 }, { "entropy": 6.271624517440796, "epoch": 2.6087709174841316, "grad_norm": 1.0703125, "learning_rate": 0.0004329775811441629, "loss": 5.7195, "mean_token_accuracy": 0.19985413551330566, "num_tokens": 57302397.0, "step": 22605 }, { "entropy": 6.269496059417724, "epoch": 2.6093479515291405, "grad_norm": 0.8671875, "learning_rate": 0.00043294819595445324, "loss": 5.5804, "mean_token_accuracy": 0.210008142888546, "num_tokens": 57316645.0, "step": 22610 }, { "entropy": 6.249709272384644, "epoch": 2.609924985574149, "grad_norm": 0.99609375, "learning_rate": 0.0004329188054522345, "loss": 5.6394, "mean_token_accuracy": 0.20307956784963607, "num_tokens": 57329714.0, "step": 22615 }, { "entropy": 6.286224317550659, "epoch": 2.6105020196191573, "grad_norm": 0.9921875, "learning_rate": 0.0004328894096384952, "loss": 5.7385, "mean_token_accuracy": 0.19608159065246583, "num_tokens": 57342940.0, "step": 22620 }, { "entropy": 6.2166234970092775, "epoch": 2.611079053664166, "grad_norm": 0.9296875, "learning_rate": 0.000432860008514224, "loss": 5.5537, "mean_token_accuracy": 0.20784184634685515, "num_tokens": 57354729.0, "step": 22625 }, { "entropy": 6.323954248428345, "epoch": 2.611656087709175, "grad_norm": 1.109375, "learning_rate": 0.0004328306020804099, "loss": 5.701, "mean_token_accuracy": 0.19504350870847703, "num_tokens": 57368778.0, "step": 22630 }, { "entropy": 6.238502120971679, "epoch": 2.6122331217541834, "grad_norm": 0.98828125, "learning_rate": 0.00043280119033804184, "loss": 5.6654, "mean_token_accuracy": 0.2013169050216675, "num_tokens": 57382266.0, "step": 22635 }, { "entropy": 6.250040483474732, "epoch": 2.6128101557991923, "grad_norm": 1.0078125, "learning_rate": 0.00043277177328810914, "loss": 5.6643, "mean_token_accuracy": 0.1974584236741066, "num_tokens": 57394127.0, "step": 22640 }, { "entropy": 6.332312345504761, "epoch": 2.6133871898442007, "grad_norm": 0.98046875, "learning_rate": 0.0004327423509316012, "loss": 5.6688, "mean_token_accuracy": 0.1991739809513092, "num_tokens": 57405711.0, "step": 22645 }, { "entropy": 6.264088773727417, "epoch": 2.6139642238892096, "grad_norm": 0.96484375, "learning_rate": 0.00043271292326950764, "loss": 5.7613, "mean_token_accuracy": 0.19248290807008744, "num_tokens": 57418603.0, "step": 22650 }, { "entropy": 6.272280979156494, "epoch": 2.614541257934218, "grad_norm": 0.93359375, "learning_rate": 0.0004326834903028182, "loss": 5.5502, "mean_token_accuracy": 0.20965935289859772, "num_tokens": 57430582.0, "step": 22655 }, { "entropy": 6.2619311809539795, "epoch": 2.615118291979227, "grad_norm": 1.015625, "learning_rate": 0.000432654052032523, "loss": 5.6241, "mean_token_accuracy": 0.207902193069458, "num_tokens": 57442592.0, "step": 22660 }, { "entropy": 6.202816152572632, "epoch": 2.6156953260242353, "grad_norm": 0.96875, "learning_rate": 0.000432624608459612, "loss": 5.6863, "mean_token_accuracy": 0.20486091822385788, "num_tokens": 57455016.0, "step": 22665 }, { "entropy": 6.267038154602051, "epoch": 2.616272360069244, "grad_norm": 1.0546875, "learning_rate": 0.0004325951595850756, "loss": 5.6036, "mean_token_accuracy": 0.20657484531402587, "num_tokens": 57467228.0, "step": 22670 }, { "entropy": 6.221673488616943, "epoch": 2.6168493941142525, "grad_norm": 0.97265625, "learning_rate": 0.00043256570540990425, "loss": 5.6217, "mean_token_accuracy": 0.20301116406917571, "num_tokens": 57479654.0, "step": 22675 }, { "entropy": 6.31744351387024, "epoch": 2.6174264281592614, "grad_norm": 0.96484375, "learning_rate": 0.0004325362459350888, "loss": 5.7184, "mean_token_accuracy": 0.19860568791627883, "num_tokens": 57492695.0, "step": 22680 }, { "entropy": 6.299160766601562, "epoch": 2.6180034622042703, "grad_norm": 0.98046875, "learning_rate": 0.00043250678116161985, "loss": 5.7515, "mean_token_accuracy": 0.19840242266654967, "num_tokens": 57504619.0, "step": 22685 }, { "entropy": 6.343087005615234, "epoch": 2.6185804962492787, "grad_norm": 1.0390625, "learning_rate": 0.00043247731109048856, "loss": 5.7129, "mean_token_accuracy": 0.2044762924313545, "num_tokens": 57517141.0, "step": 22690 }, { "entropy": 6.233465623855591, "epoch": 2.619157530294287, "grad_norm": 0.9921875, "learning_rate": 0.0004324478357226861, "loss": 5.6561, "mean_token_accuracy": 0.21039279997348787, "num_tokens": 57529759.0, "step": 22695 }, { "entropy": 6.254852676391602, "epoch": 2.619734564339296, "grad_norm": 1.0234375, "learning_rate": 0.00043241835505920405, "loss": 5.6131, "mean_token_accuracy": 0.20840972810983657, "num_tokens": 57542587.0, "step": 22700 }, { "entropy": 6.295852327346802, "epoch": 2.620311598384305, "grad_norm": 1.015625, "learning_rate": 0.0004323888691010337, "loss": 5.6756, "mean_token_accuracy": 0.20226601958274842, "num_tokens": 57554539.0, "step": 22705 }, { "entropy": 6.336152648925781, "epoch": 2.6208886324293132, "grad_norm": 1.03125, "learning_rate": 0.00043235937784916694, "loss": 5.6335, "mean_token_accuracy": 0.21046138554811478, "num_tokens": 57567436.0, "step": 22710 }, { "entropy": 6.150939273834228, "epoch": 2.621465666474322, "grad_norm": 1.078125, "learning_rate": 0.00043232988130459567, "loss": 5.575, "mean_token_accuracy": 0.21034395843744277, "num_tokens": 57579656.0, "step": 22715 }, { "entropy": 6.16340184211731, "epoch": 2.6220427005193305, "grad_norm": 1.046875, "learning_rate": 0.000432300379468312, "loss": 5.5711, "mean_token_accuracy": 0.21272343397140503, "num_tokens": 57591794.0, "step": 22720 }, { "entropy": 6.247255039215088, "epoch": 2.6226197345643394, "grad_norm": 0.9296875, "learning_rate": 0.0004322708723413082, "loss": 5.6292, "mean_token_accuracy": 0.20397938042879105, "num_tokens": 57603982.0, "step": 22725 }, { "entropy": 6.327027750015259, "epoch": 2.623196768609348, "grad_norm": 1.0234375, "learning_rate": 0.00043224135992457667, "loss": 5.7316, "mean_token_accuracy": 0.20336923599243165, "num_tokens": 57616769.0, "step": 22730 }, { "entropy": 6.211414194107055, "epoch": 2.6237738026543567, "grad_norm": 0.97265625, "learning_rate": 0.0004322118422191102, "loss": 5.5889, "mean_token_accuracy": 0.21541313976049423, "num_tokens": 57628995.0, "step": 22735 }, { "entropy": 6.293388414382934, "epoch": 2.6243508366993655, "grad_norm": 0.89453125, "learning_rate": 0.00043218231922590144, "loss": 5.67, "mean_token_accuracy": 0.21189197301864623, "num_tokens": 57642417.0, "step": 22740 }, { "entropy": 6.17652907371521, "epoch": 2.624927870744374, "grad_norm": 1.03125, "learning_rate": 0.0004321527909459435, "loss": 5.4995, "mean_token_accuracy": 0.20457690209150314, "num_tokens": 57654395.0, "step": 22745 }, { "entropy": 6.278538560867309, "epoch": 2.6255049047893824, "grad_norm": 0.94921875, "learning_rate": 0.00043212325738022946, "loss": 5.6971, "mean_token_accuracy": 0.20291548520326613, "num_tokens": 57667010.0, "step": 22750 }, { "entropy": 6.1786078929901125, "epoch": 2.6260819388343912, "grad_norm": 1.046875, "learning_rate": 0.0004320937185297527, "loss": 5.6521, "mean_token_accuracy": 0.2073186531662941, "num_tokens": 57678726.0, "step": 22755 }, { "entropy": 6.251133775711059, "epoch": 2.6266589728794, "grad_norm": 1.4140625, "learning_rate": 0.00043206417439550684, "loss": 5.6846, "mean_token_accuracy": 0.21055704951286316, "num_tokens": 57692386.0, "step": 22760 }, { "entropy": 6.283049011230469, "epoch": 2.6272360069244085, "grad_norm": 1.0078125, "learning_rate": 0.00043203462497848534, "loss": 5.644, "mean_token_accuracy": 0.20648513734340668, "num_tokens": 57704647.0, "step": 22765 }, { "entropy": 6.207054328918457, "epoch": 2.627813040969417, "grad_norm": 0.99609375, "learning_rate": 0.00043200507027968236, "loss": 5.5495, "mean_token_accuracy": 0.217336106300354, "num_tokens": 57717652.0, "step": 22770 }, { "entropy": 6.298383712768555, "epoch": 2.628390075014426, "grad_norm": 1.0078125, "learning_rate": 0.0004319755103000918, "loss": 5.6754, "mean_token_accuracy": 0.212310691177845, "num_tokens": 57730531.0, "step": 22775 }, { "entropy": 6.1505271911621096, "epoch": 2.6289671090594346, "grad_norm": 1.3125, "learning_rate": 0.0004319459450407079, "loss": 5.4999, "mean_token_accuracy": 0.21630412936210633, "num_tokens": 57742627.0, "step": 22780 }, { "entropy": 6.236985588073731, "epoch": 2.629544143104443, "grad_norm": 0.9921875, "learning_rate": 0.00043191637450252514, "loss": 5.6695, "mean_token_accuracy": 0.20145389437675476, "num_tokens": 57755894.0, "step": 22785 }, { "entropy": 6.262485504150391, "epoch": 2.630121177149452, "grad_norm": 1.0, "learning_rate": 0.000431886798686538, "loss": 5.6909, "mean_token_accuracy": 0.2014373555779457, "num_tokens": 57769003.0, "step": 22790 }, { "entropy": 6.245550298690796, "epoch": 2.6306982111944603, "grad_norm": 0.96875, "learning_rate": 0.0004318572175937414, "loss": 5.6747, "mean_token_accuracy": 0.2051383748650551, "num_tokens": 57781230.0, "step": 22795 }, { "entropy": 6.323966646194458, "epoch": 2.631275245239469, "grad_norm": 0.9765625, "learning_rate": 0.0004318276312251301, "loss": 5.6328, "mean_token_accuracy": 0.20099893659353257, "num_tokens": 57793167.0, "step": 22800 }, { "entropy": 6.2881913661956785, "epoch": 2.6318522792844776, "grad_norm": 0.9765625, "learning_rate": 0.0004317980395816994, "loss": 5.6258, "mean_token_accuracy": 0.20426172763109207, "num_tokens": 57805306.0, "step": 22805 }, { "entropy": 6.1830394744873045, "epoch": 2.6324293133294865, "grad_norm": 0.98828125, "learning_rate": 0.0004317684426644445, "loss": 5.5704, "mean_token_accuracy": 0.21088261306285858, "num_tokens": 57818844.0, "step": 22810 }, { "entropy": 6.304635906219483, "epoch": 2.6330063473744953, "grad_norm": 0.98046875, "learning_rate": 0.00043173884047436093, "loss": 5.7599, "mean_token_accuracy": 0.19517519026994706, "num_tokens": 57832017.0, "step": 22815 }, { "entropy": 6.328797817230225, "epoch": 2.6335833814195038, "grad_norm": 1.0546875, "learning_rate": 0.0004317092330124443, "loss": 5.6917, "mean_token_accuracy": 0.2012387380003929, "num_tokens": 57844900.0, "step": 22820 }, { "entropy": 6.268989944458008, "epoch": 2.634160415464512, "grad_norm": 1.0390625, "learning_rate": 0.00043167962027969043, "loss": 5.6506, "mean_token_accuracy": 0.20048178732395172, "num_tokens": 57858297.0, "step": 22825 }, { "entropy": 6.284164094924927, "epoch": 2.634737449509521, "grad_norm": 0.98828125, "learning_rate": 0.0004316500022770954, "loss": 5.6704, "mean_token_accuracy": 0.20351176112890243, "num_tokens": 57870613.0, "step": 22830 }, { "entropy": 6.301393985748291, "epoch": 2.63531448355453, "grad_norm": 1.3125, "learning_rate": 0.00043162037900565533, "loss": 5.7056, "mean_token_accuracy": 0.19776366353034974, "num_tokens": 57883991.0, "step": 22835 }, { "entropy": 6.355542469024658, "epoch": 2.6358915175995383, "grad_norm": 0.98046875, "learning_rate": 0.00043159075046636666, "loss": 5.7299, "mean_token_accuracy": 0.2018307089805603, "num_tokens": 57896400.0, "step": 22840 }, { "entropy": 6.214745759963989, "epoch": 2.636468551644547, "grad_norm": 0.97265625, "learning_rate": 0.0004315611166602258, "loss": 5.6003, "mean_token_accuracy": 0.21431663930416106, "num_tokens": 57908558.0, "step": 22845 }, { "entropy": 6.154470062255859, "epoch": 2.6370455856895556, "grad_norm": 0.99609375, "learning_rate": 0.00043153147758822957, "loss": 5.5719, "mean_token_accuracy": 0.20363485664129258, "num_tokens": 57922312.0, "step": 22850 }, { "entropy": 6.278415203094482, "epoch": 2.6376226197345645, "grad_norm": 1.015625, "learning_rate": 0.0004315018332513749, "loss": 5.5829, "mean_token_accuracy": 0.21154605448246003, "num_tokens": 57934406.0, "step": 22855 }, { "entropy": 6.30584683418274, "epoch": 2.638199653779573, "grad_norm": 1.03125, "learning_rate": 0.0004314721836506587, "loss": 5.71, "mean_token_accuracy": 0.2009185791015625, "num_tokens": 57946854.0, "step": 22860 }, { "entropy": 6.282307863235474, "epoch": 2.6387766878245817, "grad_norm": 1.0546875, "learning_rate": 0.00043144252878707845, "loss": 5.7605, "mean_token_accuracy": 0.1999088540673256, "num_tokens": 57959075.0, "step": 22865 }, { "entropy": 6.193558835983277, "epoch": 2.63935372186959, "grad_norm": 1.03125, "learning_rate": 0.0004314128686616314, "loss": 5.5549, "mean_token_accuracy": 0.21254508793354035, "num_tokens": 57970501.0, "step": 22870 }, { "entropy": 6.232211923599243, "epoch": 2.639930755914599, "grad_norm": 1.0078125, "learning_rate": 0.0004313832032753152, "loss": 5.5784, "mean_token_accuracy": 0.21439823657274246, "num_tokens": 57983683.0, "step": 22875 }, { "entropy": 6.302011585235595, "epoch": 2.6405077899596074, "grad_norm": 0.9609375, "learning_rate": 0.00043135353262912764, "loss": 5.6673, "mean_token_accuracy": 0.20713330209255218, "num_tokens": 57997603.0, "step": 22880 }, { "entropy": 6.353400325775146, "epoch": 2.6410848240046163, "grad_norm": 0.96484375, "learning_rate": 0.00043132385672406664, "loss": 5.7894, "mean_token_accuracy": 0.19122136980295182, "num_tokens": 58010225.0, "step": 22885 }, { "entropy": 6.2074424743652346, "epoch": 2.641661858049625, "grad_norm": 0.9140625, "learning_rate": 0.0004312941755611305, "loss": 5.5631, "mean_token_accuracy": 0.21678799986839295, "num_tokens": 58023581.0, "step": 22890 }, { "entropy": 6.299075794219971, "epoch": 2.6422388920946336, "grad_norm": 1.140625, "learning_rate": 0.00043126448914131724, "loss": 5.7034, "mean_token_accuracy": 0.19979101568460464, "num_tokens": 58035508.0, "step": 22895 }, { "entropy": 6.314969825744629, "epoch": 2.642815926139642, "grad_norm": 1.0234375, "learning_rate": 0.0004312347974656256, "loss": 5.6694, "mean_token_accuracy": 0.20162132978439332, "num_tokens": 58046762.0, "step": 22900 }, { "entropy": 6.291796875, "epoch": 2.643392960184651, "grad_norm": 0.96875, "learning_rate": 0.0004312051005350541, "loss": 5.739, "mean_token_accuracy": 0.20134472101926804, "num_tokens": 58059626.0, "step": 22905 }, { "entropy": 6.242621660232544, "epoch": 2.6439699942296597, "grad_norm": 1.0625, "learning_rate": 0.00043117539835060164, "loss": 5.6098, "mean_token_accuracy": 0.21246901154518127, "num_tokens": 58073482.0, "step": 22910 }, { "entropy": 6.248900032043457, "epoch": 2.644547028274668, "grad_norm": 0.9453125, "learning_rate": 0.0004311456909132673, "loss": 5.66, "mean_token_accuracy": 0.20471634864807128, "num_tokens": 58086375.0, "step": 22915 }, { "entropy": 6.377197265625, "epoch": 2.645124062319677, "grad_norm": 0.9921875, "learning_rate": 0.0004311159782240502, "loss": 5.7129, "mean_token_accuracy": 0.19768913239240646, "num_tokens": 58097953.0, "step": 22920 }, { "entropy": 6.271704053878784, "epoch": 2.6457010963646854, "grad_norm": 1.015625, "learning_rate": 0.0004310862602839496, "loss": 5.6685, "mean_token_accuracy": 0.21075234413146973, "num_tokens": 58109602.0, "step": 22925 }, { "entropy": 6.12292594909668, "epoch": 2.6462781304096943, "grad_norm": 0.96875, "learning_rate": 0.0004310565370939653, "loss": 5.5783, "mean_token_accuracy": 0.21067596077919007, "num_tokens": 58123033.0, "step": 22930 }, { "entropy": 6.271344995498657, "epoch": 2.6468551644547027, "grad_norm": 1.03125, "learning_rate": 0.00043102680865509687, "loss": 5.7176, "mean_token_accuracy": 0.1978677123785019, "num_tokens": 58135629.0, "step": 22935 }, { "entropy": 6.319137811660767, "epoch": 2.6474321984997116, "grad_norm": 0.96484375, "learning_rate": 0.0004309970749683442, "loss": 5.6748, "mean_token_accuracy": 0.19844325482845307, "num_tokens": 58149178.0, "step": 22940 }, { "entropy": 6.237157869338989, "epoch": 2.64800923254472, "grad_norm": 0.953125, "learning_rate": 0.00043096733603470737, "loss": 5.5979, "mean_token_accuracy": 0.20821484178304672, "num_tokens": 58160752.0, "step": 22945 }, { "entropy": 6.297159481048584, "epoch": 2.648586266589729, "grad_norm": 0.98828125, "learning_rate": 0.00043093759185518677, "loss": 5.7428, "mean_token_accuracy": 0.19882768392562866, "num_tokens": 58174680.0, "step": 22950 }, { "entropy": 6.314711475372315, "epoch": 2.6491633006347373, "grad_norm": 1.0390625, "learning_rate": 0.00043090784243078264, "loss": 5.7161, "mean_token_accuracy": 0.2027699589729309, "num_tokens": 58186945.0, "step": 22955 }, { "entropy": 6.330440807342529, "epoch": 2.649740334679746, "grad_norm": 1.015625, "learning_rate": 0.0004308780877624957, "loss": 5.6728, "mean_token_accuracy": 0.2026678666472435, "num_tokens": 58198940.0, "step": 22960 }, { "entropy": 6.291716527938843, "epoch": 2.650317368724755, "grad_norm": 0.92578125, "learning_rate": 0.0004308483278513267, "loss": 5.7107, "mean_token_accuracy": 0.2002701297402382, "num_tokens": 58212778.0, "step": 22965 }, { "entropy": 6.258058977127075, "epoch": 2.6508944027697634, "grad_norm": 1.015625, "learning_rate": 0.00043081856269827656, "loss": 5.665, "mean_token_accuracy": 0.20611117035150528, "num_tokens": 58225378.0, "step": 22970 }, { "entropy": 6.27512264251709, "epoch": 2.651471436814772, "grad_norm": 0.97265625, "learning_rate": 0.0004307887923043465, "loss": 5.6337, "mean_token_accuracy": 0.21207512319087982, "num_tokens": 58238012.0, "step": 22975 }, { "entropy": 6.353584337234497, "epoch": 2.6520484708597807, "grad_norm": 1.03125, "learning_rate": 0.0004307590166705379, "loss": 5.784, "mean_token_accuracy": 0.1949862241744995, "num_tokens": 58250527.0, "step": 22980 }, { "entropy": 6.275035572052002, "epoch": 2.6526255049047895, "grad_norm": 1.1328125, "learning_rate": 0.00043072923579785203, "loss": 5.62, "mean_token_accuracy": 0.2094905972480774, "num_tokens": 58262805.0, "step": 22985 }, { "entropy": 6.314037179946899, "epoch": 2.653202538949798, "grad_norm": 0.88671875, "learning_rate": 0.0004306994496872907, "loss": 5.7358, "mean_token_accuracy": 0.2017763674259186, "num_tokens": 58275622.0, "step": 22990 }, { "entropy": 6.248733568191528, "epoch": 2.653779572994807, "grad_norm": 0.98046875, "learning_rate": 0.00043066965833985567, "loss": 5.7132, "mean_token_accuracy": 0.20611511319875717, "num_tokens": 58288505.0, "step": 22995 }, { "entropy": 6.28912672996521, "epoch": 2.6543566070398152, "grad_norm": 1.0078125, "learning_rate": 0.00043063986175654906, "loss": 5.6163, "mean_token_accuracy": 0.20809512436389924, "num_tokens": 58301083.0, "step": 23000 }, { "entropy": 6.267097139358521, "epoch": 2.654933641084824, "grad_norm": 0.95703125, "learning_rate": 0.00043061005993837306, "loss": 5.5804, "mean_token_accuracy": 0.21096228212118148, "num_tokens": 58313494.0, "step": 23005 }, { "entropy": 6.218910360336304, "epoch": 2.6555106751298325, "grad_norm": 0.9375, "learning_rate": 0.00043058025288632995, "loss": 5.6464, "mean_token_accuracy": 0.2139564037322998, "num_tokens": 58327350.0, "step": 23010 }, { "entropy": 6.296138858795166, "epoch": 2.6560877091748414, "grad_norm": 0.90625, "learning_rate": 0.00043055044060142224, "loss": 5.7018, "mean_token_accuracy": 0.20362894833087922, "num_tokens": 58340664.0, "step": 23015 }, { "entropy": 6.2510560035705565, "epoch": 2.6566647432198502, "grad_norm": 0.9453125, "learning_rate": 0.00043052062308465277, "loss": 5.6334, "mean_token_accuracy": 0.20036092549562454, "num_tokens": 58353461.0, "step": 23020 }, { "entropy": 6.2866783618927, "epoch": 2.6572417772648587, "grad_norm": 1.0078125, "learning_rate": 0.0004304908003370244, "loss": 5.678, "mean_token_accuracy": 0.20230236947536467, "num_tokens": 58366872.0, "step": 23025 }, { "entropy": 6.293186187744141, "epoch": 2.657818811309867, "grad_norm": 1.0390625, "learning_rate": 0.00043046097235954024, "loss": 5.6571, "mean_token_accuracy": 0.2049702823162079, "num_tokens": 58378587.0, "step": 23030 }, { "entropy": 6.235872220993042, "epoch": 2.658395845354876, "grad_norm": 0.921875, "learning_rate": 0.00043043113915320345, "loss": 5.6077, "mean_token_accuracy": 0.2042545422911644, "num_tokens": 58390368.0, "step": 23035 }, { "entropy": 6.259229373931885, "epoch": 2.658972879399885, "grad_norm": 0.99609375, "learning_rate": 0.00043040130071901747, "loss": 5.6922, "mean_token_accuracy": 0.2030926451086998, "num_tokens": 58403803.0, "step": 23040 }, { "entropy": 6.328202247619629, "epoch": 2.659549913444893, "grad_norm": 0.9609375, "learning_rate": 0.00043037145705798605, "loss": 5.7047, "mean_token_accuracy": 0.20516854673624038, "num_tokens": 58416819.0, "step": 23045 }, { "entropy": 6.274123859405518, "epoch": 2.6601269474899016, "grad_norm": 1.03125, "learning_rate": 0.00043034160817111275, "loss": 5.6676, "mean_token_accuracy": 0.20921874344348906, "num_tokens": 58428681.0, "step": 23050 }, { "entropy": 6.275136852264405, "epoch": 2.6607039815349105, "grad_norm": 0.94921875, "learning_rate": 0.00043031175405940157, "loss": 5.6858, "mean_token_accuracy": 0.20518484711647034, "num_tokens": 58440235.0, "step": 23055 }, { "entropy": 6.312169122695923, "epoch": 2.6612810155799194, "grad_norm": 1.015625, "learning_rate": 0.0004302818947238568, "loss": 5.6967, "mean_token_accuracy": 0.2041396901011467, "num_tokens": 58452547.0, "step": 23060 }, { "entropy": 6.220282793045044, "epoch": 2.661858049624928, "grad_norm": 1.046875, "learning_rate": 0.00043025203016548263, "loss": 5.5714, "mean_token_accuracy": 0.2108326017856598, "num_tokens": 58466683.0, "step": 23065 }, { "entropy": 6.225747060775757, "epoch": 2.6624350836699366, "grad_norm": 0.92578125, "learning_rate": 0.00043022216038528347, "loss": 5.6824, "mean_token_accuracy": 0.20147724449634552, "num_tokens": 58480353.0, "step": 23070 }, { "entropy": 6.287279987335205, "epoch": 2.663012117714945, "grad_norm": 0.921875, "learning_rate": 0.00043019228538426416, "loss": 5.6474, "mean_token_accuracy": 0.21137156337499619, "num_tokens": 58493213.0, "step": 23075 }, { "entropy": 6.279957628250122, "epoch": 2.663589151759954, "grad_norm": 0.9765625, "learning_rate": 0.00043016240516342933, "loss": 5.7345, "mean_token_accuracy": 0.19688349962234497, "num_tokens": 58505386.0, "step": 23080 }, { "entropy": 6.256546258926392, "epoch": 2.6641661858049623, "grad_norm": 1.0078125, "learning_rate": 0.00043013251972378404, "loss": 5.6466, "mean_token_accuracy": 0.2033926010131836, "num_tokens": 58518067.0, "step": 23085 }, { "entropy": 6.247279357910156, "epoch": 2.664743219849971, "grad_norm": 0.8671875, "learning_rate": 0.00043010262906633355, "loss": 5.7076, "mean_token_accuracy": 0.20013732314109803, "num_tokens": 58532138.0, "step": 23090 }, { "entropy": 6.298268747329712, "epoch": 2.66532025389498, "grad_norm": 1.03125, "learning_rate": 0.00043007273319208326, "loss": 5.6962, "mean_token_accuracy": 0.20593311488628388, "num_tokens": 58546464.0, "step": 23095 }, { "entropy": 6.349994087219239, "epoch": 2.6658972879399885, "grad_norm": 1.0390625, "learning_rate": 0.0004300428321020385, "loss": 5.7186, "mean_token_accuracy": 0.19804898053407669, "num_tokens": 58559463.0, "step": 23100 }, { "entropy": 6.356606721878052, "epoch": 2.666474321984997, "grad_norm": 0.9609375, "learning_rate": 0.00043001292579720514, "loss": 5.7467, "mean_token_accuracy": 0.2000097006559372, "num_tokens": 58572125.0, "step": 23105 }, { "entropy": 6.19702000617981, "epoch": 2.6670513560300058, "grad_norm": 0.9453125, "learning_rate": 0.000429983014278589, "loss": 5.5854, "mean_token_accuracy": 0.21476079374551774, "num_tokens": 58585312.0, "step": 23110 }, { "entropy": 6.254775333404541, "epoch": 2.6676283900750146, "grad_norm": 1.015625, "learning_rate": 0.0004299530975471962, "loss": 5.6161, "mean_token_accuracy": 0.20645468682050705, "num_tokens": 58598006.0, "step": 23115 }, { "entropy": 6.220469188690186, "epoch": 2.668205424120023, "grad_norm": 0.97265625, "learning_rate": 0.0004299231756040329, "loss": 5.6383, "mean_token_accuracy": 0.2015657216310501, "num_tokens": 58609741.0, "step": 23120 }, { "entropy": 6.251720333099366, "epoch": 2.668782458165032, "grad_norm": 0.9765625, "learning_rate": 0.0004298932484501055, "loss": 5.6401, "mean_token_accuracy": 0.20331525802612305, "num_tokens": 58623076.0, "step": 23125 }, { "entropy": 6.292484331130981, "epoch": 2.6693594922100403, "grad_norm": 0.9921875, "learning_rate": 0.00042986331608642076, "loss": 5.6964, "mean_token_accuracy": 0.20706587731838227, "num_tokens": 58634558.0, "step": 23130 }, { "entropy": 6.139598417282104, "epoch": 2.669936526255049, "grad_norm": 1.0703125, "learning_rate": 0.00042983337851398525, "loss": 5.6088, "mean_token_accuracy": 0.21362140476703645, "num_tokens": 58647305.0, "step": 23135 }, { "entropy": 6.308789682388306, "epoch": 2.6705135603000576, "grad_norm": 0.92578125, "learning_rate": 0.00042980343573380595, "loss": 5.6655, "mean_token_accuracy": 0.20182024091482162, "num_tokens": 58659723.0, "step": 23140 }, { "entropy": 6.26707820892334, "epoch": 2.6710905943450665, "grad_norm": 1.015625, "learning_rate": 0.00042977348774688996, "loss": 5.7175, "mean_token_accuracy": 0.2077040433883667, "num_tokens": 58670932.0, "step": 23145 }, { "entropy": 6.307320547103882, "epoch": 2.671667628390075, "grad_norm": 1.0, "learning_rate": 0.0004297435345542445, "loss": 5.6992, "mean_token_accuracy": 0.19667290151119232, "num_tokens": 58682337.0, "step": 23150 }, { "entropy": 6.30943489074707, "epoch": 2.6722446624350837, "grad_norm": 1.0546875, "learning_rate": 0.0004297135761568773, "loss": 5.6671, "mean_token_accuracy": 0.2028686672449112, "num_tokens": 58694667.0, "step": 23155 }, { "entropy": 6.235695505142212, "epoch": 2.672821696480092, "grad_norm": 1.0703125, "learning_rate": 0.00042968361255579573, "loss": 5.6743, "mean_token_accuracy": 0.20561211854219436, "num_tokens": 58707478.0, "step": 23160 }, { "entropy": 6.275328350067139, "epoch": 2.673398730525101, "grad_norm": 0.9375, "learning_rate": 0.00042965364375200765, "loss": 5.6357, "mean_token_accuracy": 0.20758238285779954, "num_tokens": 58720660.0, "step": 23165 }, { "entropy": 6.274713230133057, "epoch": 2.67397576457011, "grad_norm": 1.0625, "learning_rate": 0.0004296236697465212, "loss": 5.6245, "mean_token_accuracy": 0.20462825149297714, "num_tokens": 58732835.0, "step": 23170 }, { "entropy": 6.254044485092163, "epoch": 2.6745527986151183, "grad_norm": 0.94921875, "learning_rate": 0.0004295936905403444, "loss": 5.6496, "mean_token_accuracy": 0.2025674521923065, "num_tokens": 58745432.0, "step": 23175 }, { "entropy": 6.217653846740722, "epoch": 2.6751298326601267, "grad_norm": 1.0, "learning_rate": 0.0004295637061344855, "loss": 5.6051, "mean_token_accuracy": 0.21028079241514205, "num_tokens": 58758837.0, "step": 23180 }, { "entropy": 6.229355716705323, "epoch": 2.6757068667051356, "grad_norm": 1.015625, "learning_rate": 0.0004295337165299532, "loss": 5.5746, "mean_token_accuracy": 0.20917143821716308, "num_tokens": 58772347.0, "step": 23185 }, { "entropy": 6.266680431365967, "epoch": 2.6762839007501444, "grad_norm": 0.9765625, "learning_rate": 0.00042950372172775614, "loss": 5.6672, "mean_token_accuracy": 0.19717866480350493, "num_tokens": 58784278.0, "step": 23190 }, { "entropy": 6.246124410629273, "epoch": 2.676860934795153, "grad_norm": 0.96875, "learning_rate": 0.000429473721728903, "loss": 5.6171, "mean_token_accuracy": 0.20709141939878464, "num_tokens": 58795788.0, "step": 23195 }, { "entropy": 6.312361192703247, "epoch": 2.6774379688401617, "grad_norm": 0.96875, "learning_rate": 0.0004294437165344031, "loss": 5.6419, "mean_token_accuracy": 0.20924709588289261, "num_tokens": 58808394.0, "step": 23200 }, { "entropy": 6.264779949188233, "epoch": 2.67801500288517, "grad_norm": 1.03125, "learning_rate": 0.00042941370614526554, "loss": 5.6509, "mean_token_accuracy": 0.20569271296262742, "num_tokens": 58819570.0, "step": 23205 }, { "entropy": 6.244002771377564, "epoch": 2.678592036930179, "grad_norm": 1.0859375, "learning_rate": 0.0004293836905624996, "loss": 5.6884, "mean_token_accuracy": 0.20581271946430207, "num_tokens": 58831049.0, "step": 23210 }, { "entropy": 6.363770866394043, "epoch": 2.6791690709751874, "grad_norm": 0.9296875, "learning_rate": 0.00042935366978711487, "loss": 5.781, "mean_token_accuracy": 0.19009294360876083, "num_tokens": 58844753.0, "step": 23215 }, { "entropy": 6.262354230880737, "epoch": 2.6797461050201963, "grad_norm": 1.0390625, "learning_rate": 0.00042932364382012125, "loss": 5.6575, "mean_token_accuracy": 0.20529476851224898, "num_tokens": 58856796.0, "step": 23220 }, { "entropy": 6.3362815380096436, "epoch": 2.6803231390652047, "grad_norm": 1.125, "learning_rate": 0.00042929361266252843, "loss": 5.7056, "mean_token_accuracy": 0.20687489211559296, "num_tokens": 58869046.0, "step": 23225 }, { "entropy": 6.28935055732727, "epoch": 2.6809001731102136, "grad_norm": 1.0390625, "learning_rate": 0.0004292635763153466, "loss": 5.697, "mean_token_accuracy": 0.19666288197040557, "num_tokens": 58880993.0, "step": 23230 }, { "entropy": 6.31868257522583, "epoch": 2.681477207155222, "grad_norm": 0.97265625, "learning_rate": 0.00042923353477958607, "loss": 5.6548, "mean_token_accuracy": 0.2014218583703041, "num_tokens": 58893519.0, "step": 23235 }, { "entropy": 6.271314239501953, "epoch": 2.682054241200231, "grad_norm": 0.9453125, "learning_rate": 0.00042920348805625716, "loss": 5.6468, "mean_token_accuracy": 0.2041264072060585, "num_tokens": 58905904.0, "step": 23240 }, { "entropy": 6.26501202583313, "epoch": 2.6826312752452397, "grad_norm": 1.0703125, "learning_rate": 0.00042917343614637057, "loss": 5.6673, "mean_token_accuracy": 0.21047159135341645, "num_tokens": 58918271.0, "step": 23245 }, { "entropy": 6.323797702789307, "epoch": 2.683208309290248, "grad_norm": 0.96484375, "learning_rate": 0.00042914337905093695, "loss": 5.6914, "mean_token_accuracy": 0.19798275977373123, "num_tokens": 58930381.0, "step": 23250 }, { "entropy": 6.304523134231568, "epoch": 2.6837853433352565, "grad_norm": 0.96875, "learning_rate": 0.0004291133167709674, "loss": 5.563, "mean_token_accuracy": 0.20906126499176025, "num_tokens": 58942506.0, "step": 23255 }, { "entropy": 6.238390254974365, "epoch": 2.6843623773802654, "grad_norm": 1.0, "learning_rate": 0.00042908324930747297, "loss": 5.7296, "mean_token_accuracy": 0.19948620647192, "num_tokens": 58954383.0, "step": 23260 }, { "entropy": 6.302935314178467, "epoch": 2.6849394114252743, "grad_norm": 0.9921875, "learning_rate": 0.00042905317666146496, "loss": 5.7804, "mean_token_accuracy": 0.19750493615865708, "num_tokens": 58967110.0, "step": 23265 }, { "entropy": 6.325434780120849, "epoch": 2.6855164454702827, "grad_norm": 1.0546875, "learning_rate": 0.00042902309883395497, "loss": 5.6191, "mean_token_accuracy": 0.20996397882699966, "num_tokens": 58980314.0, "step": 23270 }, { "entropy": 6.29250955581665, "epoch": 2.6860934795152915, "grad_norm": 1.0078125, "learning_rate": 0.0004289930158259545, "loss": 5.7363, "mean_token_accuracy": 0.1980000615119934, "num_tokens": 58993544.0, "step": 23275 }, { "entropy": 6.293111515045166, "epoch": 2.6866705135603, "grad_norm": 1.21875, "learning_rate": 0.00042896292763847544, "loss": 5.6871, "mean_token_accuracy": 0.21700167059898376, "num_tokens": 59006043.0, "step": 23280 }, { "entropy": 6.326320219039917, "epoch": 2.687247547605309, "grad_norm": 1.0390625, "learning_rate": 0.00042893283427252984, "loss": 5.7065, "mean_token_accuracy": 0.20482681542634965, "num_tokens": 59018691.0, "step": 23285 }, { "entropy": 6.257688999176025, "epoch": 2.6878245816503172, "grad_norm": 1.046875, "learning_rate": 0.0004289027357291297, "loss": 5.6764, "mean_token_accuracy": 0.20068340748548508, "num_tokens": 59031493.0, "step": 23290 }, { "entropy": 6.149775600433349, "epoch": 2.688401615695326, "grad_norm": 1.0234375, "learning_rate": 0.0004288726320092876, "loss": 5.5325, "mean_token_accuracy": 0.21733584702014924, "num_tokens": 59045464.0, "step": 23295 }, { "entropy": 6.340857601165771, "epoch": 2.6889786497403345, "grad_norm": 1.0546875, "learning_rate": 0.0004288425231140159, "loss": 5.6418, "mean_token_accuracy": 0.2090865731239319, "num_tokens": 59057391.0, "step": 23300 }, { "entropy": 6.16346697807312, "epoch": 2.6895556837853434, "grad_norm": 0.95703125, "learning_rate": 0.00042881240904432737, "loss": 5.485, "mean_token_accuracy": 0.22404691725969314, "num_tokens": 59070175.0, "step": 23305 }, { "entropy": 6.243716669082642, "epoch": 2.690132717830352, "grad_norm": 1.0078125, "learning_rate": 0.0004287822898012348, "loss": 5.6631, "mean_token_accuracy": 0.2095588833093643, "num_tokens": 59083605.0, "step": 23310 }, { "entropy": 6.2253077030181885, "epoch": 2.6907097518753607, "grad_norm": 1.0, "learning_rate": 0.0004287521653857514, "loss": 5.6054, "mean_token_accuracy": 0.21301105469465256, "num_tokens": 59095799.0, "step": 23315 }, { "entropy": 6.264061689376831, "epoch": 2.6912867859203695, "grad_norm": 0.9140625, "learning_rate": 0.00042872203579889025, "loss": 5.6543, "mean_token_accuracy": 0.20737292021512985, "num_tokens": 59109982.0, "step": 23320 }, { "entropy": 6.3398514747619625, "epoch": 2.691863819965378, "grad_norm": 0.984375, "learning_rate": 0.00042869190104166476, "loss": 5.7354, "mean_token_accuracy": 0.19639517962932587, "num_tokens": 59122478.0, "step": 23325 }, { "entropy": 6.295503187179565, "epoch": 2.6924408540103864, "grad_norm": 1.03125, "learning_rate": 0.0004286617611150886, "loss": 5.6999, "mean_token_accuracy": 0.20524403899908067, "num_tokens": 59134342.0, "step": 23330 }, { "entropy": 6.33144474029541, "epoch": 2.693017888055395, "grad_norm": 0.9921875, "learning_rate": 0.00042863161602017536, "loss": 5.7349, "mean_token_accuracy": 0.19833346754312514, "num_tokens": 59146628.0, "step": 23335 }, { "entropy": 6.211947345733643, "epoch": 2.693594922100404, "grad_norm": 0.94140625, "learning_rate": 0.0004286014657579391, "loss": 5.5898, "mean_token_accuracy": 0.21698537915945054, "num_tokens": 59160043.0, "step": 23340 }, { "entropy": 6.291817855834961, "epoch": 2.6941719561454125, "grad_norm": 0.95703125, "learning_rate": 0.0004285713103293938, "loss": 5.7023, "mean_token_accuracy": 0.19340800791978835, "num_tokens": 59173710.0, "step": 23345 }, { "entropy": 6.266803407669068, "epoch": 2.6947489901904214, "grad_norm": 1.125, "learning_rate": 0.0004285411497355537, "loss": 5.6119, "mean_token_accuracy": 0.20450152307748795, "num_tokens": 59186069.0, "step": 23350 }, { "entropy": 6.28459939956665, "epoch": 2.6953260242354298, "grad_norm": 0.95703125, "learning_rate": 0.00042851098397743334, "loss": 5.702, "mean_token_accuracy": 0.20162524729967118, "num_tokens": 59199305.0, "step": 23355 }, { "entropy": 6.2840124607086185, "epoch": 2.6959030582804386, "grad_norm": 1.0078125, "learning_rate": 0.0004284808130560473, "loss": 5.6151, "mean_token_accuracy": 0.20331996381282808, "num_tokens": 59212135.0, "step": 23360 }, { "entropy": 6.260687160491943, "epoch": 2.696480092325447, "grad_norm": 0.875, "learning_rate": 0.00042845063697241034, "loss": 5.6328, "mean_token_accuracy": 0.21078159511089326, "num_tokens": 59226651.0, "step": 23365 }, { "entropy": 6.266849708557129, "epoch": 2.697057126370456, "grad_norm": 0.9296875, "learning_rate": 0.0004284204557275374, "loss": 5.6909, "mean_token_accuracy": 0.1944417104125023, "num_tokens": 59238630.0, "step": 23370 }, { "entropy": 6.279628562927246, "epoch": 2.6976341604154648, "grad_norm": 0.9765625, "learning_rate": 0.0004283902693224437, "loss": 5.6558, "mean_token_accuracy": 0.2056453973054886, "num_tokens": 59251465.0, "step": 23375 }, { "entropy": 6.245777320861817, "epoch": 2.698211194460473, "grad_norm": 0.9609375, "learning_rate": 0.00042836007775814446, "loss": 5.6277, "mean_token_accuracy": 0.2122541829943657, "num_tokens": 59264058.0, "step": 23380 }, { "entropy": 6.208443832397461, "epoch": 2.6987882285054816, "grad_norm": 1.1171875, "learning_rate": 0.0004283298810356551, "loss": 5.5731, "mean_token_accuracy": 0.20889013707637788, "num_tokens": 59276937.0, "step": 23385 }, { "entropy": 6.251581239700317, "epoch": 2.6993652625504905, "grad_norm": 1.0546875, "learning_rate": 0.0004282996791559914, "loss": 5.6631, "mean_token_accuracy": 0.20480236262083054, "num_tokens": 59288747.0, "step": 23390 }, { "entropy": 6.272038221359253, "epoch": 2.6999422965954993, "grad_norm": 0.91015625, "learning_rate": 0.00042826947212016924, "loss": 5.6577, "mean_token_accuracy": 0.20462431609630585, "num_tokens": 59301690.0, "step": 23395 }, { "entropy": 6.247110033035279, "epoch": 2.7005193306405078, "grad_norm": 1.0390625, "learning_rate": 0.0004282392599292045, "loss": 5.6028, "mean_token_accuracy": 0.20915947556495668, "num_tokens": 59312964.0, "step": 23400 }, { "entropy": 6.298863124847412, "epoch": 2.701096364685516, "grad_norm": 1.0078125, "learning_rate": 0.0004282090425841133, "loss": 5.7446, "mean_token_accuracy": 0.19965172708034515, "num_tokens": 59325242.0, "step": 23405 }, { "entropy": 6.264981603622436, "epoch": 2.701673398730525, "grad_norm": 0.98046875, "learning_rate": 0.0004281788200859121, "loss": 5.6687, "mean_token_accuracy": 0.20080586522817612, "num_tokens": 59337877.0, "step": 23410 }, { "entropy": 6.311196041107178, "epoch": 2.702250432775534, "grad_norm": 1.0546875, "learning_rate": 0.00042814859243561727, "loss": 5.6762, "mean_token_accuracy": 0.20247143059968947, "num_tokens": 59349757.0, "step": 23415 }, { "entropy": 6.231512641906738, "epoch": 2.7028274668205423, "grad_norm": 0.95703125, "learning_rate": 0.00042811835963424573, "loss": 5.6043, "mean_token_accuracy": 0.20845805406570433, "num_tokens": 59364268.0, "step": 23420 }, { "entropy": 6.310456562042236, "epoch": 2.703404500865551, "grad_norm": 1.0234375, "learning_rate": 0.00042808812168281413, "loss": 5.7325, "mean_token_accuracy": 0.19985125064849854, "num_tokens": 59376896.0, "step": 23425 }, { "entropy": 6.317259025573731, "epoch": 2.7039815349105596, "grad_norm": 1.0234375, "learning_rate": 0.00042805787858233966, "loss": 5.6996, "mean_token_accuracy": 0.20080113261938096, "num_tokens": 59390905.0, "step": 23430 }, { "entropy": 6.236316204071045, "epoch": 2.7045585689555685, "grad_norm": 0.98046875, "learning_rate": 0.0004280276303338395, "loss": 5.6251, "mean_token_accuracy": 0.2090424567461014, "num_tokens": 59403896.0, "step": 23435 }, { "entropy": 6.261244630813598, "epoch": 2.705135603000577, "grad_norm": 0.953125, "learning_rate": 0.000427997376938331, "loss": 5.6078, "mean_token_accuracy": 0.20800320357084273, "num_tokens": 59416050.0, "step": 23440 }, { "entropy": 6.230799293518066, "epoch": 2.7057126370455857, "grad_norm": 0.98828125, "learning_rate": 0.0004279671183968317, "loss": 5.6468, "mean_token_accuracy": 0.2083706632256508, "num_tokens": 59428127.0, "step": 23445 }, { "entropy": 6.22346715927124, "epoch": 2.7062896710905946, "grad_norm": 1.0, "learning_rate": 0.0004279368547103593, "loss": 5.6133, "mean_token_accuracy": 0.21240148842334747, "num_tokens": 59442708.0, "step": 23450 }, { "entropy": 6.260948991775512, "epoch": 2.706866705135603, "grad_norm": 1.0078125, "learning_rate": 0.0004279065858799318, "loss": 5.6911, "mean_token_accuracy": 0.2062714472413063, "num_tokens": 59456126.0, "step": 23455 }, { "entropy": 6.211365652084351, "epoch": 2.7074437391806114, "grad_norm": 0.8984375, "learning_rate": 0.00042787631190656725, "loss": 5.6634, "mean_token_accuracy": 0.2032617747783661, "num_tokens": 59469331.0, "step": 23460 }, { "entropy": 6.160763549804687, "epoch": 2.7080207732256203, "grad_norm": 0.96484375, "learning_rate": 0.00042784603279128386, "loss": 5.5741, "mean_token_accuracy": 0.2161744087934494, "num_tokens": 59483084.0, "step": 23465 }, { "entropy": 6.318073701858521, "epoch": 2.708597807270629, "grad_norm": 0.99609375, "learning_rate": 0.0004278157485351001, "loss": 5.7092, "mean_token_accuracy": 0.19910414069890975, "num_tokens": 59494746.0, "step": 23470 }, { "entropy": 6.335538387298584, "epoch": 2.7091748413156376, "grad_norm": 0.9921875, "learning_rate": 0.00042778545913903454, "loss": 5.7004, "mean_token_accuracy": 0.20272629708051682, "num_tokens": 59507266.0, "step": 23475 }, { "entropy": 6.320228576660156, "epoch": 2.7097518753606464, "grad_norm": 1.015625, "learning_rate": 0.00042775516460410594, "loss": 5.7136, "mean_token_accuracy": 0.20056245774030684, "num_tokens": 59521876.0, "step": 23480 }, { "entropy": 6.268406105041504, "epoch": 2.710328909405655, "grad_norm": 0.91015625, "learning_rate": 0.0004277248649313333, "loss": 5.681, "mean_token_accuracy": 0.2026807874441147, "num_tokens": 59535512.0, "step": 23485 }, { "entropy": 6.318011522293091, "epoch": 2.7109059434506637, "grad_norm": 0.9765625, "learning_rate": 0.0004276945601217357, "loss": 5.8201, "mean_token_accuracy": 0.18915471136569978, "num_tokens": 59549596.0, "step": 23490 }, { "entropy": 6.338709878921509, "epoch": 2.711482977495672, "grad_norm": 0.92578125, "learning_rate": 0.00042766425017633236, "loss": 5.7194, "mean_token_accuracy": 0.20283689945936204, "num_tokens": 59562455.0, "step": 23495 }, { "entropy": 6.193594741821289, "epoch": 2.712060011540681, "grad_norm": 1.0, "learning_rate": 0.00042763393509614284, "loss": 5.6052, "mean_token_accuracy": 0.20570549070835115, "num_tokens": 59574897.0, "step": 23500 }, { "entropy": 6.288909292221069, "epoch": 2.7126370455856894, "grad_norm": 0.9609375, "learning_rate": 0.0004276036148821867, "loss": 5.6515, "mean_token_accuracy": 0.2052280440926552, "num_tokens": 59586472.0, "step": 23505 }, { "entropy": 6.272292280197144, "epoch": 2.7132140796306983, "grad_norm": 1.046875, "learning_rate": 0.00042757328953548385, "loss": 5.6611, "mean_token_accuracy": 0.2009549006819725, "num_tokens": 59597788.0, "step": 23510 }, { "entropy": 6.198528718948364, "epoch": 2.7137911136757067, "grad_norm": 1.0859375, "learning_rate": 0.0004275429590570541, "loss": 5.6376, "mean_token_accuracy": 0.20184379070997238, "num_tokens": 59611045.0, "step": 23515 }, { "entropy": 6.126999616622925, "epoch": 2.7143681477207156, "grad_norm": 0.82421875, "learning_rate": 0.00042751262344791776, "loss": 5.4657, "mean_token_accuracy": 0.2194235935807228, "num_tokens": 59624251.0, "step": 23520 }, { "entropy": 6.278477668762207, "epoch": 2.7149451817657244, "grad_norm": 1.015625, "learning_rate": 0.000427482282709095, "loss": 5.639, "mean_token_accuracy": 0.2047446921467781, "num_tokens": 59635604.0, "step": 23525 }, { "entropy": 6.282340574264526, "epoch": 2.715522215810733, "grad_norm": 0.94140625, "learning_rate": 0.0004274519368416065, "loss": 5.5885, "mean_token_accuracy": 0.20595853626728058, "num_tokens": 59647591.0, "step": 23530 }, { "entropy": 6.327120304107666, "epoch": 2.7160992498557412, "grad_norm": 1.0078125, "learning_rate": 0.0004274215858464727, "loss": 5.7324, "mean_token_accuracy": 0.19737906903028488, "num_tokens": 59660693.0, "step": 23535 }, { "entropy": 6.2593787670135494, "epoch": 2.71667628390075, "grad_norm": 0.98046875, "learning_rate": 0.00042739122972471473, "loss": 5.6372, "mean_token_accuracy": 0.20199968963861464, "num_tokens": 59673792.0, "step": 23540 }, { "entropy": 6.048742198944092, "epoch": 2.717253317945759, "grad_norm": 1.046875, "learning_rate": 0.0004273608684773534, "loss": 5.4494, "mean_token_accuracy": 0.23110448867082595, "num_tokens": 59687415.0, "step": 23545 }, { "entropy": 6.2260983943939205, "epoch": 2.7178303519907674, "grad_norm": 1.015625, "learning_rate": 0.00042733050210540984, "loss": 5.6217, "mean_token_accuracy": 0.20999803394079208, "num_tokens": 59699721.0, "step": 23550 }, { "entropy": 6.2923996925354, "epoch": 2.7184073860357763, "grad_norm": 1.0078125, "learning_rate": 0.0004273001306099056, "loss": 5.6548, "mean_token_accuracy": 0.20920408815145491, "num_tokens": 59712517.0, "step": 23555 }, { "entropy": 6.178339099884033, "epoch": 2.7189844200807847, "grad_norm": 1.0390625, "learning_rate": 0.0004272697539918621, "loss": 5.6173, "mean_token_accuracy": 0.21732170283794403, "num_tokens": 59725132.0, "step": 23560 }, { "entropy": 6.204169654846192, "epoch": 2.7195614541257935, "grad_norm": 0.96875, "learning_rate": 0.0004272393722523011, "loss": 5.6254, "mean_token_accuracy": 0.21480109989643098, "num_tokens": 59738515.0, "step": 23565 }, { "entropy": 6.259692049026489, "epoch": 2.720138488170802, "grad_norm": 1.0625, "learning_rate": 0.00042720898539224436, "loss": 5.5806, "mean_token_accuracy": 0.21188097447156906, "num_tokens": 59750141.0, "step": 23570 }, { "entropy": 6.360567188262939, "epoch": 2.720715522215811, "grad_norm": 0.95703125, "learning_rate": 0.0004271785934127141, "loss": 5.8596, "mean_token_accuracy": 0.19407681226730347, "num_tokens": 59762580.0, "step": 23575 }, { "entropy": 6.319754648208618, "epoch": 2.7212925562608192, "grad_norm": 0.97265625, "learning_rate": 0.00042714819631473234, "loss": 5.6993, "mean_token_accuracy": 0.2017399176955223, "num_tokens": 59776039.0, "step": 23580 }, { "entropy": 6.29428071975708, "epoch": 2.721869590305828, "grad_norm": 0.95703125, "learning_rate": 0.00042711779409932164, "loss": 5.6888, "mean_token_accuracy": 0.2055966556072235, "num_tokens": 59789305.0, "step": 23585 }, { "entropy": 6.199136638641358, "epoch": 2.7224466243508365, "grad_norm": 0.97265625, "learning_rate": 0.00042708738676750446, "loss": 5.6016, "mean_token_accuracy": 0.21147399842739106, "num_tokens": 59801771.0, "step": 23590 }, { "entropy": 6.264022970199585, "epoch": 2.7230236583958454, "grad_norm": 0.9921875, "learning_rate": 0.0004270569743203036, "loss": 5.6445, "mean_token_accuracy": 0.2004895731806755, "num_tokens": 59815281.0, "step": 23595 }, { "entropy": 6.299907112121582, "epoch": 2.7236006924408542, "grad_norm": 0.94140625, "learning_rate": 0.0004270265567587419, "loss": 5.6484, "mean_token_accuracy": 0.2042030870914459, "num_tokens": 59827292.0, "step": 23600 }, { "entropy": 6.239239597320557, "epoch": 2.7241777264858626, "grad_norm": 0.984375, "learning_rate": 0.00042699613408384246, "loss": 5.5868, "mean_token_accuracy": 0.21466063112020492, "num_tokens": 59840024.0, "step": 23605 }, { "entropy": 6.30584602355957, "epoch": 2.724754760530871, "grad_norm": 1.0390625, "learning_rate": 0.0004269657062966286, "loss": 5.7265, "mean_token_accuracy": 0.1973255068063736, "num_tokens": 59851499.0, "step": 23610 }, { "entropy": 6.228437662124634, "epoch": 2.72533179457588, "grad_norm": 0.96875, "learning_rate": 0.0004269352733981238, "loss": 5.6423, "mean_token_accuracy": 0.2052161753177643, "num_tokens": 59863057.0, "step": 23615 }, { "entropy": 6.2251458168029785, "epoch": 2.725908828620889, "grad_norm": 0.92578125, "learning_rate": 0.00042690483538935137, "loss": 5.632, "mean_token_accuracy": 0.20314138233661652, "num_tokens": 59876132.0, "step": 23620 }, { "entropy": 6.241136646270752, "epoch": 2.726485862665897, "grad_norm": 0.89453125, "learning_rate": 0.0004268743922713354, "loss": 5.6921, "mean_token_accuracy": 0.20126574635505676, "num_tokens": 59888543.0, "step": 23625 }, { "entropy": 6.3047160625457765, "epoch": 2.727062896710906, "grad_norm": 0.984375, "learning_rate": 0.00042684394404509957, "loss": 5.6401, "mean_token_accuracy": 0.20428135395050048, "num_tokens": 59900508.0, "step": 23630 }, { "entropy": 6.227706384658814, "epoch": 2.7276399307559145, "grad_norm": 0.96484375, "learning_rate": 0.00042681349071166814, "loss": 5.6787, "mean_token_accuracy": 0.20204531401395798, "num_tokens": 59913065.0, "step": 23635 }, { "entropy": 6.274850463867187, "epoch": 2.7282169648009233, "grad_norm": 1.0078125, "learning_rate": 0.00042678303227206536, "loss": 5.7177, "mean_token_accuracy": 0.19515222012996675, "num_tokens": 59926173.0, "step": 23640 }, { "entropy": 6.327705192565918, "epoch": 2.7287939988459318, "grad_norm": 1.03125, "learning_rate": 0.0004267525687273157, "loss": 5.7154, "mean_token_accuracy": 0.20294611006975175, "num_tokens": 59939206.0, "step": 23645 }, { "entropy": 6.346580505371094, "epoch": 2.7293710328909406, "grad_norm": 1.0390625, "learning_rate": 0.00042672210007844383, "loss": 5.7268, "mean_token_accuracy": 0.20070762783288956, "num_tokens": 59951093.0, "step": 23650 }, { "entropy": 6.236078214645386, "epoch": 2.7299480669359495, "grad_norm": 0.93359375, "learning_rate": 0.00042669162632647434, "loss": 5.6824, "mean_token_accuracy": 0.19879934340715408, "num_tokens": 59962804.0, "step": 23655 }, { "entropy": 6.2937720775604244, "epoch": 2.730525100980958, "grad_norm": 1.0, "learning_rate": 0.00042666114747243243, "loss": 5.7043, "mean_token_accuracy": 0.20073767602443696, "num_tokens": 59975649.0, "step": 23660 }, { "entropy": 6.272326326370239, "epoch": 2.7311021350259663, "grad_norm": 1.015625, "learning_rate": 0.0004266306635173432, "loss": 5.6308, "mean_token_accuracy": 0.20969946533441544, "num_tokens": 59989496.0, "step": 23665 }, { "entropy": 6.3147646427154545, "epoch": 2.731679169070975, "grad_norm": 1.0625, "learning_rate": 0.0004266001744622319, "loss": 5.7649, "mean_token_accuracy": 0.19873626083135604, "num_tokens": 60002125.0, "step": 23670 }, { "entropy": 6.32417893409729, "epoch": 2.732256203115984, "grad_norm": 1.0234375, "learning_rate": 0.000426569680308124, "loss": 5.6956, "mean_token_accuracy": 0.200134214758873, "num_tokens": 60013395.0, "step": 23675 }, { "entropy": 6.288641023635864, "epoch": 2.7328332371609925, "grad_norm": 0.953125, "learning_rate": 0.00042653918105604524, "loss": 5.6454, "mean_token_accuracy": 0.20771630555391313, "num_tokens": 60026527.0, "step": 23680 }, { "entropy": 6.301353025436401, "epoch": 2.733410271206001, "grad_norm": 0.9765625, "learning_rate": 0.00042650867670702123, "loss": 5.7366, "mean_token_accuracy": 0.2027778595685959, "num_tokens": 60039671.0, "step": 23685 }, { "entropy": 6.2609710693359375, "epoch": 2.7339873052510097, "grad_norm": 0.93359375, "learning_rate": 0.0004264781672620783, "loss": 5.6496, "mean_token_accuracy": 0.21786354780197142, "num_tokens": 60051908.0, "step": 23690 }, { "entropy": 6.298049688339233, "epoch": 2.7345643392960186, "grad_norm": 0.9609375, "learning_rate": 0.0004264476527222425, "loss": 5.6988, "mean_token_accuracy": 0.20431626886129378, "num_tokens": 60065295.0, "step": 23695 }, { "entropy": 6.262032985687256, "epoch": 2.735141373341027, "grad_norm": 1.015625, "learning_rate": 0.0004264171330885401, "loss": 5.6079, "mean_token_accuracy": 0.21089257746934892, "num_tokens": 60076903.0, "step": 23700 }, { "entropy": 6.259629154205323, "epoch": 2.735718407386036, "grad_norm": 1.0, "learning_rate": 0.00042638660836199756, "loss": 5.6487, "mean_token_accuracy": 0.19859280288219452, "num_tokens": 60089091.0, "step": 23705 }, { "entropy": 6.2708330154418945, "epoch": 2.7362954414310443, "grad_norm": 1.2265625, "learning_rate": 0.00042635607854364166, "loss": 5.5625, "mean_token_accuracy": 0.21616168171167374, "num_tokens": 60100986.0, "step": 23710 }, { "entropy": 6.202017736434937, "epoch": 2.736872475476053, "grad_norm": 1.0546875, "learning_rate": 0.00042632554363449926, "loss": 5.5887, "mean_token_accuracy": 0.21216881573200225, "num_tokens": 60113806.0, "step": 23715 }, { "entropy": 6.262396669387817, "epoch": 2.7374495095210616, "grad_norm": 0.9765625, "learning_rate": 0.00042629500363559734, "loss": 5.6377, "mean_token_accuracy": 0.21196930706501008, "num_tokens": 60126076.0, "step": 23720 }, { "entropy": 6.272845602035522, "epoch": 2.7380265435660704, "grad_norm": 0.953125, "learning_rate": 0.00042626445854796326, "loss": 5.6889, "mean_token_accuracy": 0.20665962845087052, "num_tokens": 60139435.0, "step": 23725 }, { "entropy": 6.284993743896484, "epoch": 2.7386035776110793, "grad_norm": 1.0703125, "learning_rate": 0.0004262339083726241, "loss": 5.6964, "mean_token_accuracy": 0.2010929748415947, "num_tokens": 60152252.0, "step": 23730 }, { "entropy": 6.211569738388062, "epoch": 2.7391806116560877, "grad_norm": 1.0234375, "learning_rate": 0.0004262033531106076, "loss": 5.5155, "mean_token_accuracy": 0.21815283000469207, "num_tokens": 60164575.0, "step": 23735 }, { "entropy": 6.308486747741699, "epoch": 2.739757645701096, "grad_norm": 1.09375, "learning_rate": 0.00042617279276294145, "loss": 5.7031, "mean_token_accuracy": 0.19314163327217101, "num_tokens": 60177085.0, "step": 23740 }, { "entropy": 6.280835056304932, "epoch": 2.740334679746105, "grad_norm": 1.046875, "learning_rate": 0.0004261422273306535, "loss": 5.6404, "mean_token_accuracy": 0.2063989207148552, "num_tokens": 60188923.0, "step": 23745 }, { "entropy": 6.253396987915039, "epoch": 2.740911713791114, "grad_norm": 1.03125, "learning_rate": 0.0004261116568147718, "loss": 5.6644, "mean_token_accuracy": 0.21163987666368483, "num_tokens": 60200439.0, "step": 23750 }, { "entropy": 6.20761342048645, "epoch": 2.7414887478361223, "grad_norm": 1.0390625, "learning_rate": 0.0004260810812163246, "loss": 5.5886, "mean_token_accuracy": 0.21744026094675065, "num_tokens": 60213618.0, "step": 23755 }, { "entropy": 6.335954999923706, "epoch": 2.742065781881131, "grad_norm": 1.046875, "learning_rate": 0.00042605050053634027, "loss": 5.7175, "mean_token_accuracy": 0.2039960116147995, "num_tokens": 60225617.0, "step": 23760 }, { "entropy": 6.281629753112793, "epoch": 2.7426428159261396, "grad_norm": 1.0625, "learning_rate": 0.0004260199147758474, "loss": 5.6602, "mean_token_accuracy": 0.1970086544752121, "num_tokens": 60238406.0, "step": 23765 }, { "entropy": 6.280141830444336, "epoch": 2.7432198499711484, "grad_norm": 0.9765625, "learning_rate": 0.0004259893239358747, "loss": 5.7339, "mean_token_accuracy": 0.19506382048130036, "num_tokens": 60250733.0, "step": 23770 }, { "entropy": 6.276529216766358, "epoch": 2.743796884016157, "grad_norm": 0.94140625, "learning_rate": 0.00042595872801745106, "loss": 5.6441, "mean_token_accuracy": 0.20533547550439835, "num_tokens": 60262625.0, "step": 23775 }, { "entropy": 6.3179021835327145, "epoch": 2.7443739180611657, "grad_norm": 0.96875, "learning_rate": 0.0004259281270216056, "loss": 5.7471, "mean_token_accuracy": 0.20365326702594758, "num_tokens": 60274428.0, "step": 23780 }, { "entropy": 6.310861539840698, "epoch": 2.744950952106174, "grad_norm": 1.03125, "learning_rate": 0.00042589752094936763, "loss": 5.7721, "mean_token_accuracy": 0.19572871178388596, "num_tokens": 60286131.0, "step": 23785 }, { "entropy": 6.233788299560547, "epoch": 2.745527986151183, "grad_norm": 0.921875, "learning_rate": 0.0004258669098017664, "loss": 5.6389, "mean_token_accuracy": 0.20572750866413117, "num_tokens": 60299151.0, "step": 23790 }, { "entropy": 6.191610383987427, "epoch": 2.7461050201961914, "grad_norm": 0.97265625, "learning_rate": 0.00042583629357983164, "loss": 5.5379, "mean_token_accuracy": 0.20696640610694886, "num_tokens": 60311557.0, "step": 23795 }, { "entropy": 6.29091215133667, "epoch": 2.7466820542412003, "grad_norm": 0.97265625, "learning_rate": 0.00042580567228459303, "loss": 5.7033, "mean_token_accuracy": 0.20055586993694305, "num_tokens": 60324364.0, "step": 23800 }, { "entropy": 6.30074143409729, "epoch": 2.747259088286209, "grad_norm": 1.046875, "learning_rate": 0.0004257750459170806, "loss": 5.7023, "mean_token_accuracy": 0.2062767282128334, "num_tokens": 60336141.0, "step": 23805 }, { "entropy": 6.339053010940551, "epoch": 2.7478361223312175, "grad_norm": 0.98828125, "learning_rate": 0.00042574441447832436, "loss": 5.7202, "mean_token_accuracy": 0.1978342816233635, "num_tokens": 60349006.0, "step": 23810 }, { "entropy": 6.3109832286834715, "epoch": 2.748413156376226, "grad_norm": 1.0, "learning_rate": 0.0004257137779693546, "loss": 5.703, "mean_token_accuracy": 0.20051915794610978, "num_tokens": 60361361.0, "step": 23815 }, { "entropy": 6.207128381729126, "epoch": 2.748990190421235, "grad_norm": 0.828125, "learning_rate": 0.0004256831363912018, "loss": 5.6403, "mean_token_accuracy": 0.20841150134801864, "num_tokens": 60375261.0, "step": 23820 }, { "entropy": 6.271187877655029, "epoch": 2.7495672244662437, "grad_norm": 1.0234375, "learning_rate": 0.00042565248974489654, "loss": 5.574, "mean_token_accuracy": 0.216634601354599, "num_tokens": 60387129.0, "step": 23825 }, { "entropy": 6.272358846664429, "epoch": 2.750144258511252, "grad_norm": 0.96484375, "learning_rate": 0.0004256218380314697, "loss": 5.6216, "mean_token_accuracy": 0.2099366381764412, "num_tokens": 60398581.0, "step": 23830 }, { "entropy": 6.247166442871094, "epoch": 2.750721292556261, "grad_norm": 1.0703125, "learning_rate": 0.0004255911812519521, "loss": 5.7058, "mean_token_accuracy": 0.19849096536636351, "num_tokens": 60412105.0, "step": 23835 }, { "entropy": 6.341522312164306, "epoch": 2.7512983266012694, "grad_norm": 0.9296875, "learning_rate": 0.0004255605194073749, "loss": 5.6501, "mean_token_accuracy": 0.20663839280605317, "num_tokens": 60423880.0, "step": 23840 }, { "entropy": 6.335871458053589, "epoch": 2.7518753606462782, "grad_norm": 0.98046875, "learning_rate": 0.0004255298524987695, "loss": 5.7219, "mean_token_accuracy": 0.1964716672897339, "num_tokens": 60435968.0, "step": 23845 }, { "entropy": 6.231741857528687, "epoch": 2.7524523946912867, "grad_norm": 0.9453125, "learning_rate": 0.0004254991805271672, "loss": 5.7028, "mean_token_accuracy": 0.1948447659611702, "num_tokens": 60449003.0, "step": 23850 }, { "entropy": 6.324371814727783, "epoch": 2.7530294287362955, "grad_norm": 1.015625, "learning_rate": 0.00042546850349359976, "loss": 5.6727, "mean_token_accuracy": 0.20406218469142914, "num_tokens": 60462083.0, "step": 23855 }, { "entropy": 6.326699686050415, "epoch": 2.753606462781304, "grad_norm": 1.015625, "learning_rate": 0.00042543782139909894, "loss": 5.6505, "mean_token_accuracy": 0.20653390437364577, "num_tokens": 60473804.0, "step": 23860 }, { "entropy": 6.321713638305664, "epoch": 2.754183496826313, "grad_norm": 0.94921875, "learning_rate": 0.00042540713424469667, "loss": 5.7184, "mean_token_accuracy": 0.20550071597099304, "num_tokens": 60486361.0, "step": 23865 }, { "entropy": 6.243905878067016, "epoch": 2.7547605308713212, "grad_norm": 0.984375, "learning_rate": 0.00042537644203142523, "loss": 5.6029, "mean_token_accuracy": 0.20950179547071457, "num_tokens": 60498522.0, "step": 23870 }, { "entropy": 6.289014625549316, "epoch": 2.75533756491633, "grad_norm": 0.9609375, "learning_rate": 0.00042534574476031683, "loss": 5.7649, "mean_token_accuracy": 0.19460297524929046, "num_tokens": 60510974.0, "step": 23875 }, { "entropy": 6.361392211914063, "epoch": 2.755914598961339, "grad_norm": 1.046875, "learning_rate": 0.000425315042432404, "loss": 5.7034, "mean_token_accuracy": 0.20635935068130493, "num_tokens": 60524756.0, "step": 23880 }, { "entropy": 6.182318925857544, "epoch": 2.7564916330063474, "grad_norm": 0.9375, "learning_rate": 0.00042528433504871935, "loss": 5.5843, "mean_token_accuracy": 0.21223890632390977, "num_tokens": 60536286.0, "step": 23885 }, { "entropy": 6.316730642318726, "epoch": 2.757068667051356, "grad_norm": 1.015625, "learning_rate": 0.0004252536226102958, "loss": 5.6981, "mean_token_accuracy": 0.20179191827774048, "num_tokens": 60548971.0, "step": 23890 }, { "entropy": 6.328762531280518, "epoch": 2.7576457010963646, "grad_norm": 0.96875, "learning_rate": 0.0004252229051181662, "loss": 5.6994, "mean_token_accuracy": 0.20119510889053344, "num_tokens": 60562078.0, "step": 23895 }, { "entropy": 6.300843286514282, "epoch": 2.7582227351413735, "grad_norm": 0.98046875, "learning_rate": 0.00042519218257336383, "loss": 5.6442, "mean_token_accuracy": 0.20707331448793412, "num_tokens": 60575378.0, "step": 23900 }, { "entropy": 6.179822492599487, "epoch": 2.758799769186382, "grad_norm": 0.96484375, "learning_rate": 0.00042516145497692204, "loss": 5.6434, "mean_token_accuracy": 0.20570089668035507, "num_tokens": 60588958.0, "step": 23905 }, { "entropy": 6.214246940612793, "epoch": 2.759376803231391, "grad_norm": 1.0078125, "learning_rate": 0.00042513072232987426, "loss": 5.6052, "mean_token_accuracy": 0.21524664312601088, "num_tokens": 60600904.0, "step": 23910 }, { "entropy": 6.33005723953247, "epoch": 2.759953837276399, "grad_norm": 0.99609375, "learning_rate": 0.0004250999846332543, "loss": 5.665, "mean_token_accuracy": 0.20459192544221877, "num_tokens": 60612655.0, "step": 23915 }, { "entropy": 6.312617826461792, "epoch": 2.760530871321408, "grad_norm": 0.9609375, "learning_rate": 0.00042506924188809574, "loss": 5.7153, "mean_token_accuracy": 0.19724390357732774, "num_tokens": 60625491.0, "step": 23920 }, { "entropy": 6.249608325958252, "epoch": 2.7611079053664165, "grad_norm": 1.0234375, "learning_rate": 0.000425038494095433, "loss": 5.6777, "mean_token_accuracy": 0.20205020159482956, "num_tokens": 60637814.0, "step": 23925 }, { "entropy": 6.292912578582763, "epoch": 2.7616849394114253, "grad_norm": 1.0625, "learning_rate": 0.00042500774125629986, "loss": 5.6434, "mean_token_accuracy": 0.20771353244781493, "num_tokens": 60650031.0, "step": 23930 }, { "entropy": 6.306258964538574, "epoch": 2.762261973456434, "grad_norm": 1.0, "learning_rate": 0.0004249769833717309, "loss": 5.7137, "mean_token_accuracy": 0.19796977788209916, "num_tokens": 60662257.0, "step": 23935 }, { "entropy": 6.316214609146118, "epoch": 2.7628390075014426, "grad_norm": 0.984375, "learning_rate": 0.00042494622044276066, "loss": 5.6888, "mean_token_accuracy": 0.20688740015029908, "num_tokens": 60675557.0, "step": 23940 }, { "entropy": 6.277747631072998, "epoch": 2.763416041546451, "grad_norm": 1.0234375, "learning_rate": 0.0004249154524704237, "loss": 5.6658, "mean_token_accuracy": 0.19813719540834426, "num_tokens": 60686984.0, "step": 23945 }, { "entropy": 6.320740032196045, "epoch": 2.76399307559146, "grad_norm": 1.046875, "learning_rate": 0.000424884679455755, "loss": 5.7406, "mean_token_accuracy": 0.19347584545612334, "num_tokens": 60698904.0, "step": 23950 }, { "entropy": 6.268014812469483, "epoch": 2.7645701096364688, "grad_norm": 0.95703125, "learning_rate": 0.00042485390139978955, "loss": 5.6473, "mean_token_accuracy": 0.20635816901922227, "num_tokens": 60710972.0, "step": 23955 }, { "entropy": 6.30289306640625, "epoch": 2.765147143681477, "grad_norm": 0.94921875, "learning_rate": 0.0004248231183035626, "loss": 5.7619, "mean_token_accuracy": 0.198407444357872, "num_tokens": 60723780.0, "step": 23960 }, { "entropy": 6.287156391143799, "epoch": 2.7657241777264856, "grad_norm": 1.03125, "learning_rate": 0.0004247923301681095, "loss": 5.6551, "mean_token_accuracy": 0.20431240499019623, "num_tokens": 60735381.0, "step": 23965 }, { "entropy": 6.203852224349975, "epoch": 2.7663012117714945, "grad_norm": 0.9609375, "learning_rate": 0.00042476153699446567, "loss": 5.6283, "mean_token_accuracy": 0.21327733844518662, "num_tokens": 60748495.0, "step": 23970 }, { "entropy": 6.330010414123535, "epoch": 2.7668782458165033, "grad_norm": 0.99609375, "learning_rate": 0.00042473073878366695, "loss": 5.7307, "mean_token_accuracy": 0.1915600687265396, "num_tokens": 60761984.0, "step": 23975 }, { "entropy": 6.345406007766724, "epoch": 2.7674552798615117, "grad_norm": 1.015625, "learning_rate": 0.0004246999355367493, "loss": 5.7353, "mean_token_accuracy": 0.19715495705604552, "num_tokens": 60774590.0, "step": 23980 }, { "entropy": 6.315189361572266, "epoch": 2.7680323139065206, "grad_norm": 0.86328125, "learning_rate": 0.00042466912725474865, "loss": 5.7136, "mean_token_accuracy": 0.19998075664043427, "num_tokens": 60788647.0, "step": 23985 }, { "entropy": 6.30523271560669, "epoch": 2.768609347951529, "grad_norm": 1.1171875, "learning_rate": 0.00042463831393870123, "loss": 5.6892, "mean_token_accuracy": 0.2055213987827301, "num_tokens": 60799913.0, "step": 23990 }, { "entropy": 6.2970543384552, "epoch": 2.769186381996538, "grad_norm": 0.98046875, "learning_rate": 0.00042460749558964346, "loss": 5.7672, "mean_token_accuracy": 0.19577331990003585, "num_tokens": 60812343.0, "step": 23995 }, { "entropy": 6.337021923065185, "epoch": 2.7697634160415463, "grad_norm": 1.0625, "learning_rate": 0.0004245766722086118, "loss": 5.6738, "mean_token_accuracy": 0.20110151767730713, "num_tokens": 60824677.0, "step": 24000 }, { "epoch": 2.7697634160415463, "eval_entropy": 6.110137078922717, "eval_loss": 5.747303485870361, "eval_mean_token_accuracy": 0.20855002860038974, "eval_num_tokens": 60824677.0, "eval_runtime": 17.6486, "eval_samples_per_second": 1594.23, "eval_steps_per_second": 199.279, "step": 24000 }, { "entropy": 6.284476852416992, "epoch": 2.770340450086555, "grad_norm": 0.9921875, "learning_rate": 0.00042454584379664326, "loss": 5.6663, "mean_token_accuracy": 0.20679705291986467, "num_tokens": 60837453.0, "step": 24005 }, { "entropy": 6.259833097457886, "epoch": 2.770917484131564, "grad_norm": 1.0078125, "learning_rate": 0.0004245150103547744, "loss": 5.6373, "mean_token_accuracy": 0.2060678169131279, "num_tokens": 60850229.0, "step": 24010 }, { "entropy": 6.309430360794067, "epoch": 2.7714945181765724, "grad_norm": 0.99609375, "learning_rate": 0.00042448417188404246, "loss": 5.6543, "mean_token_accuracy": 0.20605955719947816, "num_tokens": 60862108.0, "step": 24015 }, { "entropy": 6.277496576309204, "epoch": 2.772071552221581, "grad_norm": 1.0390625, "learning_rate": 0.0004244533283854847, "loss": 5.668, "mean_token_accuracy": 0.2087453633546829, "num_tokens": 60875339.0, "step": 24020 }, { "entropy": 6.264426898956299, "epoch": 2.7726485862665897, "grad_norm": 1.0078125, "learning_rate": 0.0004244224798601385, "loss": 5.6427, "mean_token_accuracy": 0.2064829498529434, "num_tokens": 60888869.0, "step": 24025 }, { "entropy": 6.299762201309204, "epoch": 2.7732256203115986, "grad_norm": 1.0390625, "learning_rate": 0.00042439162630904134, "loss": 5.7245, "mean_token_accuracy": 0.19883949011564256, "num_tokens": 60902344.0, "step": 24030 }, { "entropy": 6.338087320327759, "epoch": 2.773802654356607, "grad_norm": 1.0, "learning_rate": 0.0004243607677332311, "loss": 5.6958, "mean_token_accuracy": 0.20551479160785674, "num_tokens": 60915114.0, "step": 24035 }, { "entropy": 6.297605419158936, "epoch": 2.7743796884016154, "grad_norm": 1.171875, "learning_rate": 0.00042432990413374556, "loss": 5.6204, "mean_token_accuracy": 0.2090611755847931, "num_tokens": 60928228.0, "step": 24040 }, { "entropy": 6.22783317565918, "epoch": 2.7749567224466243, "grad_norm": 1.0390625, "learning_rate": 0.00042429903551162283, "loss": 5.5906, "mean_token_accuracy": 0.21181854158639907, "num_tokens": 60941923.0, "step": 24045 }, { "entropy": 6.270639657974243, "epoch": 2.775533756491633, "grad_norm": 1.015625, "learning_rate": 0.0004242681618679013, "loss": 5.6272, "mean_token_accuracy": 0.20153675526380538, "num_tokens": 60955537.0, "step": 24050 }, { "entropy": 6.2936859130859375, "epoch": 2.7761107905366416, "grad_norm": 0.94921875, "learning_rate": 0.00042423728320361924, "loss": 5.699, "mean_token_accuracy": 0.2062570795416832, "num_tokens": 60968121.0, "step": 24055 }, { "entropy": 6.27194995880127, "epoch": 2.7766878245816504, "grad_norm": 1.0, "learning_rate": 0.00042420639951981534, "loss": 5.6683, "mean_token_accuracy": 0.20090533196926116, "num_tokens": 60980256.0, "step": 24060 }, { "entropy": 6.348288202285767, "epoch": 2.777264858626659, "grad_norm": 1.0234375, "learning_rate": 0.00042417551081752825, "loss": 5.7514, "mean_token_accuracy": 0.1990349069237709, "num_tokens": 60992989.0, "step": 24065 }, { "entropy": 6.305077838897705, "epoch": 2.7778418926716677, "grad_norm": 1.0390625, "learning_rate": 0.00042414461709779696, "loss": 5.6905, "mean_token_accuracy": 0.20279713571071625, "num_tokens": 61005792.0, "step": 24070 }, { "entropy": 6.2336523056030275, "epoch": 2.778418926716676, "grad_norm": 0.86328125, "learning_rate": 0.0004241137183616606, "loss": 5.7335, "mean_token_accuracy": 0.20249888598918914, "num_tokens": 61019448.0, "step": 24075 }, { "entropy": 6.267611646652222, "epoch": 2.778995960761685, "grad_norm": 0.91796875, "learning_rate": 0.0004240828146101584, "loss": 5.605, "mean_token_accuracy": 0.2151130497455597, "num_tokens": 61033449.0, "step": 24080 }, { "entropy": 6.348956489562989, "epoch": 2.779572994806694, "grad_norm": 0.99609375, "learning_rate": 0.00042405190584432966, "loss": 5.7031, "mean_token_accuracy": 0.20749318450689316, "num_tokens": 61044912.0, "step": 24085 }, { "entropy": 6.268578290939331, "epoch": 2.7801500288517023, "grad_norm": 1.046875, "learning_rate": 0.0004240209920652142, "loss": 5.6348, "mean_token_accuracy": 0.20811071544885634, "num_tokens": 61057003.0, "step": 24090 }, { "entropy": 6.250166559219361, "epoch": 2.7807270628967107, "grad_norm": 0.9609375, "learning_rate": 0.00042399007327385173, "loss": 5.6576, "mean_token_accuracy": 0.20405267179012299, "num_tokens": 61068721.0, "step": 24095 }, { "entropy": 6.294403982162476, "epoch": 2.7813040969417195, "grad_norm": 0.9453125, "learning_rate": 0.0004239591494712821, "loss": 5.6385, "mean_token_accuracy": 0.20323246717453003, "num_tokens": 61081938.0, "step": 24100 }, { "entropy": 6.304669809341431, "epoch": 2.7818811309867284, "grad_norm": 1.015625, "learning_rate": 0.0004239282206585455, "loss": 5.7135, "mean_token_accuracy": 0.20087448507547379, "num_tokens": 61094918.0, "step": 24105 }, { "entropy": 6.21914119720459, "epoch": 2.782458165031737, "grad_norm": 1.03125, "learning_rate": 0.0004238972868366822, "loss": 5.6173, "mean_token_accuracy": 0.2061501756310463, "num_tokens": 61107201.0, "step": 24110 }, { "entropy": 6.22398419380188, "epoch": 2.7830351990767457, "grad_norm": 0.98046875, "learning_rate": 0.00042386634800673255, "loss": 5.5526, "mean_token_accuracy": 0.22002862095832826, "num_tokens": 61121092.0, "step": 24115 }, { "entropy": 6.282371902465821, "epoch": 2.783612233121754, "grad_norm": 1.0234375, "learning_rate": 0.0004238354041697372, "loss": 5.7345, "mean_token_accuracy": 0.202226223051548, "num_tokens": 61133819.0, "step": 24120 }, { "entropy": 6.358414554595948, "epoch": 2.784189267166763, "grad_norm": 1.0234375, "learning_rate": 0.00042380445532673705, "loss": 5.7812, "mean_token_accuracy": 0.19016314148902894, "num_tokens": 61147182.0, "step": 24125 }, { "entropy": 6.3676787376403805, "epoch": 2.7847663012117714, "grad_norm": 0.9453125, "learning_rate": 0.0004237735014787729, "loss": 5.7575, "mean_token_accuracy": 0.1920229971408844, "num_tokens": 61159729.0, "step": 24130 }, { "entropy": 6.327588510513306, "epoch": 2.7853433352567802, "grad_norm": 1.015625, "learning_rate": 0.000423742542626886, "loss": 5.6802, "mean_token_accuracy": 0.19857446253299713, "num_tokens": 61172528.0, "step": 24135 }, { "entropy": 6.345280122756958, "epoch": 2.7859203693017887, "grad_norm": 0.89453125, "learning_rate": 0.0004237115787721176, "loss": 5.7884, "mean_token_accuracy": 0.19298231601715088, "num_tokens": 61186874.0, "step": 24140 }, { "entropy": 6.297798490524292, "epoch": 2.7864974033467975, "grad_norm": 1.078125, "learning_rate": 0.00042368060991550895, "loss": 5.6613, "mean_token_accuracy": 0.20616599619388581, "num_tokens": 61199353.0, "step": 24145 }, { "entropy": 6.23702039718628, "epoch": 2.787074437391806, "grad_norm": 0.921875, "learning_rate": 0.0004236496360581019, "loss": 5.6345, "mean_token_accuracy": 0.2091902107000351, "num_tokens": 61211799.0, "step": 24150 }, { "entropy": 6.307335996627808, "epoch": 2.787651471436815, "grad_norm": 1.078125, "learning_rate": 0.00042361865720093826, "loss": 5.7135, "mean_token_accuracy": 0.1990026205778122, "num_tokens": 61225029.0, "step": 24155 }, { "entropy": 6.220220851898193, "epoch": 2.7882285054818237, "grad_norm": 1.0, "learning_rate": 0.00042358767334505984, "loss": 5.5554, "mean_token_accuracy": 0.21232929229736328, "num_tokens": 61238415.0, "step": 24160 }, { "entropy": 6.230034112930298, "epoch": 2.788805539526832, "grad_norm": 1.109375, "learning_rate": 0.00042355668449150884, "loss": 5.6989, "mean_token_accuracy": 0.20503691583871841, "num_tokens": 61251193.0, "step": 24165 }, { "entropy": 6.296474838256836, "epoch": 2.7893825735718405, "grad_norm": 0.92578125, "learning_rate": 0.00042352569064132756, "loss": 5.6618, "mean_token_accuracy": 0.20571379959583283, "num_tokens": 61264752.0, "step": 24170 }, { "entropy": 6.247052478790283, "epoch": 2.7899596076168494, "grad_norm": 1.015625, "learning_rate": 0.00042349469179555845, "loss": 5.6284, "mean_token_accuracy": 0.21326312869787217, "num_tokens": 61277409.0, "step": 24175 }, { "entropy": 6.2341193675994875, "epoch": 2.790536641661858, "grad_norm": 1.0625, "learning_rate": 0.00042346368795524416, "loss": 5.6303, "mean_token_accuracy": 0.20684327483177184, "num_tokens": 61288810.0, "step": 24180 }, { "entropy": 6.302008771896363, "epoch": 2.7911136757068666, "grad_norm": 1.046875, "learning_rate": 0.0004234326791214274, "loss": 5.6144, "mean_token_accuracy": 0.2089575007557869, "num_tokens": 61301080.0, "step": 24185 }, { "entropy": 6.2551158428192135, "epoch": 2.7916907097518755, "grad_norm": 1.0625, "learning_rate": 0.0004234016652951513, "loss": 5.7156, "mean_token_accuracy": 0.1981436714529991, "num_tokens": 61313202.0, "step": 24190 }, { "entropy": 6.194552946090698, "epoch": 2.792267743796884, "grad_norm": 1.15625, "learning_rate": 0.00042337064647745887, "loss": 5.6274, "mean_token_accuracy": 0.2018851786851883, "num_tokens": 61326090.0, "step": 24195 }, { "entropy": 6.362614488601684, "epoch": 2.792844777841893, "grad_norm": 0.9765625, "learning_rate": 0.00042333962266939343, "loss": 5.6812, "mean_token_accuracy": 0.20519627928733825, "num_tokens": 61338640.0, "step": 24200 }, { "entropy": 6.285013437271118, "epoch": 2.793421811886901, "grad_norm": 0.94140625, "learning_rate": 0.00042330859387199846, "loss": 5.6404, "mean_token_accuracy": 0.20869287550449372, "num_tokens": 61351324.0, "step": 24205 }, { "entropy": 6.235303783416748, "epoch": 2.79399884593191, "grad_norm": 0.94140625, "learning_rate": 0.0004232775600863176, "loss": 5.6128, "mean_token_accuracy": 0.2099598154425621, "num_tokens": 61362547.0, "step": 24210 }, { "entropy": 6.08439793586731, "epoch": 2.7945758799769185, "grad_norm": 0.9453125, "learning_rate": 0.00042324652131339475, "loss": 5.4899, "mean_token_accuracy": 0.2195163905620575, "num_tokens": 61376084.0, "step": 24215 }, { "entropy": 6.283570337295532, "epoch": 2.7951529140219273, "grad_norm": 1.03125, "learning_rate": 0.0004232154775542737, "loss": 5.6718, "mean_token_accuracy": 0.2047012820839882, "num_tokens": 61388440.0, "step": 24220 }, { "entropy": 6.361893844604492, "epoch": 2.7957299480669358, "grad_norm": 1.0390625, "learning_rate": 0.0004231844288099987, "loss": 5.6906, "mean_token_accuracy": 0.20226762741804122, "num_tokens": 61402255.0, "step": 24225 }, { "entropy": 6.254204273223877, "epoch": 2.7963069821119446, "grad_norm": 0.98828125, "learning_rate": 0.00042315337508161405, "loss": 5.618, "mean_token_accuracy": 0.20347914099693298, "num_tokens": 61414871.0, "step": 24230 }, { "entropy": 6.256125640869141, "epoch": 2.7968840161569535, "grad_norm": 1.03125, "learning_rate": 0.00042312231637016423, "loss": 5.6558, "mean_token_accuracy": 0.20951410830020906, "num_tokens": 61427127.0, "step": 24235 }, { "entropy": 6.295227813720703, "epoch": 2.797461050201962, "grad_norm": 0.98046875, "learning_rate": 0.00042309125267669386, "loss": 5.6366, "mean_token_accuracy": 0.20522981137037277, "num_tokens": 61439191.0, "step": 24240 }, { "entropy": 6.260116291046143, "epoch": 2.7980380842469703, "grad_norm": 1.09375, "learning_rate": 0.0004230601840022478, "loss": 5.598, "mean_token_accuracy": 0.20718367993831635, "num_tokens": 61452508.0, "step": 24245 }, { "entropy": 6.2847388744354244, "epoch": 2.798615118291979, "grad_norm": 0.953125, "learning_rate": 0.000423029110347871, "loss": 5.69, "mean_token_accuracy": 0.19786419868469238, "num_tokens": 61466475.0, "step": 24250 }, { "entropy": 6.280850267410278, "epoch": 2.799192152336988, "grad_norm": 1.015625, "learning_rate": 0.00042299803171460854, "loss": 5.6152, "mean_token_accuracy": 0.20788534432649614, "num_tokens": 61478523.0, "step": 24255 }, { "entropy": 6.298039436340332, "epoch": 2.7997691863819965, "grad_norm": 0.93359375, "learning_rate": 0.00042296694810350585, "loss": 5.6654, "mean_token_accuracy": 0.20121956020593643, "num_tokens": 61490591.0, "step": 24260 }, { "entropy": 6.282038068771362, "epoch": 2.8003462204270053, "grad_norm": 1.1640625, "learning_rate": 0.0004229358595156083, "loss": 5.6791, "mean_token_accuracy": 0.20370960831642151, "num_tokens": 61503414.0, "step": 24265 }, { "entropy": 6.2678296089172365, "epoch": 2.8009232544720137, "grad_norm": 0.93359375, "learning_rate": 0.0004229047659519617, "loss": 5.6124, "mean_token_accuracy": 0.21066644191741943, "num_tokens": 61516655.0, "step": 24270 }, { "entropy": 6.343933391571045, "epoch": 2.8015002885170226, "grad_norm": 0.95703125, "learning_rate": 0.0004228736674136117, "loss": 5.7567, "mean_token_accuracy": 0.2028947114944458, "num_tokens": 61529589.0, "step": 24275 }, { "entropy": 6.292514181137085, "epoch": 2.802077322562031, "grad_norm": 1.0234375, "learning_rate": 0.0004228425639016044, "loss": 5.642, "mean_token_accuracy": 0.20794799029827118, "num_tokens": 61541648.0, "step": 24280 }, { "entropy": 6.330664873123169, "epoch": 2.80265435660704, "grad_norm": 1.2578125, "learning_rate": 0.0004228114554169858, "loss": 5.7039, "mean_token_accuracy": 0.20170037001371383, "num_tokens": 61552864.0, "step": 24285 }, { "entropy": 6.269150066375732, "epoch": 2.8032313906520487, "grad_norm": 0.97265625, "learning_rate": 0.0004227803419608024, "loss": 5.7633, "mean_token_accuracy": 0.19741745740175248, "num_tokens": 61565179.0, "step": 24290 }, { "entropy": 6.345161008834839, "epoch": 2.803808424697057, "grad_norm": 1.0078125, "learning_rate": 0.00042274922353410056, "loss": 5.7193, "mean_token_accuracy": 0.20393816977739335, "num_tokens": 61577386.0, "step": 24295 }, { "entropy": 6.29252290725708, "epoch": 2.8043854587420656, "grad_norm": 1.0078125, "learning_rate": 0.00042271810013792696, "loss": 5.6661, "mean_token_accuracy": 0.2079485058784485, "num_tokens": 61590519.0, "step": 24300 }, { "entropy": 6.251400947570801, "epoch": 2.8049624927870744, "grad_norm": 0.953125, "learning_rate": 0.0004226869717733285, "loss": 5.6936, "mean_token_accuracy": 0.2089969366788864, "num_tokens": 61603323.0, "step": 24305 }, { "entropy": 6.306489896774292, "epoch": 2.8055395268320833, "grad_norm": 1.0078125, "learning_rate": 0.00042265583844135207, "loss": 5.6193, "mean_token_accuracy": 0.2089267373085022, "num_tokens": 61615637.0, "step": 24310 }, { "entropy": 6.2073057174682615, "epoch": 2.8061165608770917, "grad_norm": 1.03125, "learning_rate": 0.00042262470014304486, "loss": 5.6268, "mean_token_accuracy": 0.21037256121635436, "num_tokens": 61628004.0, "step": 24315 }, { "entropy": 6.236581945419312, "epoch": 2.8066935949221, "grad_norm": 1.0546875, "learning_rate": 0.0004225935568794542, "loss": 5.5705, "mean_token_accuracy": 0.2150061771273613, "num_tokens": 61641274.0, "step": 24320 }, { "entropy": 6.332412910461426, "epoch": 2.807270628967109, "grad_norm": 1.0625, "learning_rate": 0.00042256240865162764, "loss": 5.7743, "mean_token_accuracy": 0.19612537920475007, "num_tokens": 61654398.0, "step": 24325 }, { "entropy": 6.316621160507202, "epoch": 2.807847663012118, "grad_norm": 1.03125, "learning_rate": 0.00042253125546061265, "loss": 5.7339, "mean_token_accuracy": 0.19748370349407196, "num_tokens": 61667261.0, "step": 24330 }, { "entropy": 6.342468929290772, "epoch": 2.8084246970571263, "grad_norm": 1.0, "learning_rate": 0.0004225000973074572, "loss": 5.75, "mean_token_accuracy": 0.2020742267370224, "num_tokens": 61678871.0, "step": 24335 }, { "entropy": 6.234073162078857, "epoch": 2.809001731102135, "grad_norm": 0.94921875, "learning_rate": 0.00042246893419320923, "loss": 5.6711, "mean_token_accuracy": 0.20948117077350617, "num_tokens": 61692124.0, "step": 24340 }, { "entropy": 6.29853925704956, "epoch": 2.8095787651471436, "grad_norm": 0.99609375, "learning_rate": 0.000422437766118917, "loss": 5.7242, "mean_token_accuracy": 0.20716237127780915, "num_tokens": 61704164.0, "step": 24345 }, { "entropy": 6.2400322437286375, "epoch": 2.8101557991921524, "grad_norm": 1.0, "learning_rate": 0.0004224065930856286, "loss": 5.6403, "mean_token_accuracy": 0.20508529245853424, "num_tokens": 61716031.0, "step": 24350 }, { "entropy": 6.344346237182617, "epoch": 2.810732833237161, "grad_norm": 1.1640625, "learning_rate": 0.0004223754150943927, "loss": 5.6539, "mean_token_accuracy": 0.20611535310745238, "num_tokens": 61728663.0, "step": 24355 }, { "entropy": 6.263796091079712, "epoch": 2.8113098672821697, "grad_norm": 0.98046875, "learning_rate": 0.000422344232146258, "loss": 5.6412, "mean_token_accuracy": 0.20716868191957474, "num_tokens": 61740998.0, "step": 24360 }, { "entropy": 6.237046337127685, "epoch": 2.8118869013271786, "grad_norm": 0.9140625, "learning_rate": 0.00042231304424227315, "loss": 5.6886, "mean_token_accuracy": 0.2063811257481575, "num_tokens": 61753231.0, "step": 24365 }, { "entropy": 6.324074983596802, "epoch": 2.812463935372187, "grad_norm": 1.015625, "learning_rate": 0.00042228185138348736, "loss": 5.7336, "mean_token_accuracy": 0.1959283396601677, "num_tokens": 61765046.0, "step": 24370 }, { "entropy": 6.2668980121612545, "epoch": 2.8130409694171954, "grad_norm": 1.0625, "learning_rate": 0.0004222506535709496, "loss": 5.6143, "mean_token_accuracy": 0.20766304880380632, "num_tokens": 61776705.0, "step": 24375 }, { "entropy": 6.307502126693725, "epoch": 2.8136180034622043, "grad_norm": 1.0, "learning_rate": 0.0004222194508057092, "loss": 5.6314, "mean_token_accuracy": 0.2077794000506401, "num_tokens": 61790682.0, "step": 24380 }, { "entropy": 6.258563995361328, "epoch": 2.814195037507213, "grad_norm": 1.015625, "learning_rate": 0.0004221882430888157, "loss": 5.6172, "mean_token_accuracy": 0.20497007369995118, "num_tokens": 61803329.0, "step": 24385 }, { "entropy": 6.252021741867066, "epoch": 2.8147720715522215, "grad_norm": 0.98828125, "learning_rate": 0.00042215703042131883, "loss": 5.6648, "mean_token_accuracy": 0.20551086813211442, "num_tokens": 61815996.0, "step": 24390 }, { "entropy": 6.202037620544433, "epoch": 2.8153491055972304, "grad_norm": 1.078125, "learning_rate": 0.0004221258128042682, "loss": 5.6426, "mean_token_accuracy": 0.20972182750701904, "num_tokens": 61828281.0, "step": 24395 }, { "entropy": 6.340979957580567, "epoch": 2.815926139642239, "grad_norm": 1.0, "learning_rate": 0.00042209459023871405, "loss": 5.7422, "mean_token_accuracy": 0.19639548361301423, "num_tokens": 61840894.0, "step": 24400 }, { "entropy": 6.357145166397094, "epoch": 2.8165031736872477, "grad_norm": 0.96484375, "learning_rate": 0.00042206336272570643, "loss": 5.7013, "mean_token_accuracy": 0.19916598945856095, "num_tokens": 61852767.0, "step": 24405 }, { "entropy": 6.318993282318115, "epoch": 2.817080207732256, "grad_norm": 1.03125, "learning_rate": 0.00042203213026629566, "loss": 5.5828, "mean_token_accuracy": 0.21256356686353683, "num_tokens": 61866497.0, "step": 24410 }, { "entropy": 6.289728450775146, "epoch": 2.817657241777265, "grad_norm": 1.015625, "learning_rate": 0.00042200089286153217, "loss": 5.7335, "mean_token_accuracy": 0.19933657944202424, "num_tokens": 61879024.0, "step": 24415 }, { "entropy": 6.253601789474487, "epoch": 2.8182342758222734, "grad_norm": 1.0234375, "learning_rate": 0.0004219696505124667, "loss": 5.6089, "mean_token_accuracy": 0.20932333767414094, "num_tokens": 61890582.0, "step": 24420 }, { "entropy": 6.246962022781372, "epoch": 2.8188113098672822, "grad_norm": 0.97265625, "learning_rate": 0.00042193840322015, "loss": 5.6266, "mean_token_accuracy": 0.21130513697862624, "num_tokens": 61903140.0, "step": 24425 }, { "entropy": 6.233370590209961, "epoch": 2.8193883439122907, "grad_norm": 0.953125, "learning_rate": 0.00042190715098563313, "loss": 5.5819, "mean_token_accuracy": 0.20736135691404342, "num_tokens": 61915953.0, "step": 24430 }, { "entropy": 6.262146759033203, "epoch": 2.8199653779572995, "grad_norm": 1.0625, "learning_rate": 0.0004218758938099672, "loss": 5.7307, "mean_token_accuracy": 0.20075396001338958, "num_tokens": 61928120.0, "step": 24435 }, { "entropy": 6.330214595794677, "epoch": 2.8205424120023084, "grad_norm": 0.96484375, "learning_rate": 0.0004218446316942035, "loss": 5.6734, "mean_token_accuracy": 0.20727865844964982, "num_tokens": 61941164.0, "step": 24440 }, { "entropy": 6.265660810470581, "epoch": 2.821119446047317, "grad_norm": 0.9609375, "learning_rate": 0.0004218133646393937, "loss": 5.6247, "mean_token_accuracy": 0.21138952672481537, "num_tokens": 61954310.0, "step": 24445 }, { "entropy": 6.284226608276367, "epoch": 2.821696480092325, "grad_norm": 1.015625, "learning_rate": 0.0004217820926465892, "loss": 5.7095, "mean_token_accuracy": 0.1988588824868202, "num_tokens": 61966952.0, "step": 24450 }, { "entropy": 6.279386186599732, "epoch": 2.822273514137334, "grad_norm": 0.96484375, "learning_rate": 0.0004217508157168418, "loss": 5.6556, "mean_token_accuracy": 0.20097137987613678, "num_tokens": 61979547.0, "step": 24455 }, { "entropy": 6.272848749160767, "epoch": 2.822850548182343, "grad_norm": 1.0390625, "learning_rate": 0.00042171953385120384, "loss": 5.6802, "mean_token_accuracy": 0.20549411624670028, "num_tokens": 61992188.0, "step": 24460 }, { "entropy": 6.369096899032593, "epoch": 2.8234275822273514, "grad_norm": 1.0078125, "learning_rate": 0.00042168824705072713, "loss": 5.6707, "mean_token_accuracy": 0.21178066730499268, "num_tokens": 62005426.0, "step": 24465 }, { "entropy": 6.2482623100280765, "epoch": 2.82400461627236, "grad_norm": 0.9453125, "learning_rate": 0.0004216569553164641, "loss": 5.6037, "mean_token_accuracy": 0.20939172506332399, "num_tokens": 62018247.0, "step": 24470 }, { "entropy": 6.184626674652099, "epoch": 2.8245816503173686, "grad_norm": 1.0234375, "learning_rate": 0.00042162565864946723, "loss": 5.6698, "mean_token_accuracy": 0.20358436554670334, "num_tokens": 62030503.0, "step": 24475 }, { "entropy": 6.364025545120239, "epoch": 2.8251586843623775, "grad_norm": 1.0234375, "learning_rate": 0.0004215943570507891, "loss": 5.7156, "mean_token_accuracy": 0.2002929612994194, "num_tokens": 62043453.0, "step": 24480 }, { "entropy": 6.253956508636475, "epoch": 2.825735718407386, "grad_norm": 1.0, "learning_rate": 0.00042156305052148263, "loss": 5.5994, "mean_token_accuracy": 0.21289331018924712, "num_tokens": 62057317.0, "step": 24485 }, { "entropy": 6.284417963027954, "epoch": 2.8263127524523948, "grad_norm": 1.0234375, "learning_rate": 0.00042153173906260083, "loss": 5.6658, "mean_token_accuracy": 0.20268275886774062, "num_tokens": 62069360.0, "step": 24490 }, { "entropy": 6.23651156425476, "epoch": 2.826889786497403, "grad_norm": 1.109375, "learning_rate": 0.00042150042267519665, "loss": 5.6499, "mean_token_accuracy": 0.2069375067949295, "num_tokens": 62082157.0, "step": 24495 }, { "entropy": 6.277358722686768, "epoch": 2.827466820542412, "grad_norm": 1.09375, "learning_rate": 0.00042146910136032367, "loss": 5.6122, "mean_token_accuracy": 0.21059834212064743, "num_tokens": 62094268.0, "step": 24500 }, { "entropy": 6.333056020736694, "epoch": 2.8280438545874205, "grad_norm": 0.97265625, "learning_rate": 0.00042143777511903513, "loss": 5.643, "mean_token_accuracy": 0.2073887199163437, "num_tokens": 62107610.0, "step": 24505 }, { "entropy": 6.268117427825928, "epoch": 2.8286208886324293, "grad_norm": 1.0546875, "learning_rate": 0.00042140644395238477, "loss": 5.6479, "mean_token_accuracy": 0.2062526151537895, "num_tokens": 62120279.0, "step": 24510 }, { "entropy": 6.152829599380493, "epoch": 2.829197922677438, "grad_norm": 1.0, "learning_rate": 0.0004213751078614264, "loss": 5.5002, "mean_token_accuracy": 0.22233829498291016, "num_tokens": 62134204.0, "step": 24515 }, { "entropy": 6.2259644031524655, "epoch": 2.8297749567224466, "grad_norm": 1.03125, "learning_rate": 0.000421343766847214, "loss": 5.5897, "mean_token_accuracy": 0.21484220623970032, "num_tokens": 62147241.0, "step": 24520 }, { "entropy": 6.293903541564942, "epoch": 2.830351990767455, "grad_norm": 1.046875, "learning_rate": 0.0004213124209108016, "loss": 5.5868, "mean_token_accuracy": 0.21121748834848403, "num_tokens": 62159935.0, "step": 24525 }, { "entropy": 6.21681432723999, "epoch": 2.830929024812464, "grad_norm": 0.953125, "learning_rate": 0.0004212810700532437, "loss": 5.6291, "mean_token_accuracy": 0.20893940329551697, "num_tokens": 62172498.0, "step": 24530 }, { "entropy": 6.242179489135742, "epoch": 2.8315060588574728, "grad_norm": 0.9296875, "learning_rate": 0.0004212497142755947, "loss": 5.6528, "mean_token_accuracy": 0.19786501675844193, "num_tokens": 62186150.0, "step": 24535 }, { "entropy": 6.378966569900513, "epoch": 2.832083092902481, "grad_norm": 0.97265625, "learning_rate": 0.00042121835357890916, "loss": 5.7332, "mean_token_accuracy": 0.2044931173324585, "num_tokens": 62199455.0, "step": 24540 }, { "entropy": 6.354912233352661, "epoch": 2.83266012694749, "grad_norm": 0.96875, "learning_rate": 0.0004211869879642419, "loss": 5.6594, "mean_token_accuracy": 0.19967105239629745, "num_tokens": 62213459.0, "step": 24545 }, { "entropy": 6.321961402893066, "epoch": 2.8332371609924984, "grad_norm": 1.0, "learning_rate": 0.00042115561743264797, "loss": 5.6446, "mean_token_accuracy": 0.20219760835170747, "num_tokens": 62225250.0, "step": 24550 }, { "entropy": 6.22512674331665, "epoch": 2.8338141950375073, "grad_norm": 1.015625, "learning_rate": 0.0004211242419851824, "loss": 5.624, "mean_token_accuracy": 0.21420508474111558, "num_tokens": 62238334.0, "step": 24555 }, { "entropy": 6.309490633010864, "epoch": 2.8343912290825157, "grad_norm": 0.9765625, "learning_rate": 0.00042109286162290055, "loss": 5.6877, "mean_token_accuracy": 0.20504627972841263, "num_tokens": 62251498.0, "step": 24560 }, { "entropy": 6.325494813919067, "epoch": 2.8349682631275246, "grad_norm": 1.0390625, "learning_rate": 0.0004210614763468579, "loss": 5.726, "mean_token_accuracy": 0.20420906692743301, "num_tokens": 62264423.0, "step": 24565 }, { "entropy": 6.269174289703369, "epoch": 2.8355452971725335, "grad_norm": 1.03125, "learning_rate": 0.00042103008615811, "loss": 5.593, "mean_token_accuracy": 0.20907282531261445, "num_tokens": 62276889.0, "step": 24570 }, { "entropy": 6.279245376586914, "epoch": 2.836122331217542, "grad_norm": 0.91015625, "learning_rate": 0.0004209986910577127, "loss": 5.706, "mean_token_accuracy": 0.20422278642654418, "num_tokens": 62289043.0, "step": 24575 }, { "entropy": 6.275703096389771, "epoch": 2.8366993652625503, "grad_norm": 1.046875, "learning_rate": 0.00042096729104672194, "loss": 5.6908, "mean_token_accuracy": 0.2076078861951828, "num_tokens": 62301445.0, "step": 24580 }, { "entropy": 6.3255805492401125, "epoch": 2.837276399307559, "grad_norm": 1.0, "learning_rate": 0.00042093588612619385, "loss": 5.7215, "mean_token_accuracy": 0.1976776137948036, "num_tokens": 62314263.0, "step": 24585 }, { "entropy": 6.34928183555603, "epoch": 2.837853433352568, "grad_norm": 1.1328125, "learning_rate": 0.0004209044762971847, "loss": 5.6373, "mean_token_accuracy": 0.20834840536117555, "num_tokens": 62327873.0, "step": 24590 }, { "entropy": 6.314883995056152, "epoch": 2.8384304673975764, "grad_norm": 1.0390625, "learning_rate": 0.000420873061560751, "loss": 5.6626, "mean_token_accuracy": 0.20366329252719878, "num_tokens": 62340827.0, "step": 24595 }, { "entropy": 6.3202063083648685, "epoch": 2.839007501442585, "grad_norm": 1.0078125, "learning_rate": 0.0004208416419179494, "loss": 5.7832, "mean_token_accuracy": 0.1992715761065483, "num_tokens": 62352995.0, "step": 24600 }, { "entropy": 6.302844524383545, "epoch": 2.8395845354875937, "grad_norm": 1.0, "learning_rate": 0.00042081021736983657, "loss": 5.7126, "mean_token_accuracy": 0.19662009328603744, "num_tokens": 62365647.0, "step": 24605 }, { "entropy": 6.300964212417602, "epoch": 2.8401615695326026, "grad_norm": 1.0625, "learning_rate": 0.0004207787879174695, "loss": 5.6523, "mean_token_accuracy": 0.2037101209163666, "num_tokens": 62377277.0, "step": 24610 }, { "entropy": 6.243743419647217, "epoch": 2.840738603577611, "grad_norm": 1.0234375, "learning_rate": 0.00042074735356190525, "loss": 5.6541, "mean_token_accuracy": 0.20436837524175644, "num_tokens": 62389338.0, "step": 24615 }, { "entropy": 6.3411744117736815, "epoch": 2.84131563762262, "grad_norm": 1.0234375, "learning_rate": 0.0004207159143042012, "loss": 5.7048, "mean_token_accuracy": 0.1987220361828804, "num_tokens": 62401933.0, "step": 24620 }, { "entropy": 6.2420275688171385, "epoch": 2.8418926716676283, "grad_norm": 1.015625, "learning_rate": 0.0004206844701454148, "loss": 5.5858, "mean_token_accuracy": 0.219431734085083, "num_tokens": 62414738.0, "step": 24625 }, { "entropy": 6.373111343383789, "epoch": 2.842469705712637, "grad_norm": 1.0625, "learning_rate": 0.00042065302108660355, "loss": 5.759, "mean_token_accuracy": 0.1910221442580223, "num_tokens": 62426565.0, "step": 24630 }, { "entropy": 6.204355192184448, "epoch": 2.8430467397576455, "grad_norm": 1.078125, "learning_rate": 0.0004206215671288253, "loss": 5.6209, "mean_token_accuracy": 0.2179600015282631, "num_tokens": 62438992.0, "step": 24635 }, { "entropy": 6.239711618423462, "epoch": 2.8436237738026544, "grad_norm": 0.91015625, "learning_rate": 0.00042059010827313794, "loss": 5.6451, "mean_token_accuracy": 0.2075016126036644, "num_tokens": 62453004.0, "step": 24640 }, { "entropy": 6.3646704196929935, "epoch": 2.8442008078476633, "grad_norm": 0.9921875, "learning_rate": 0.00042055864452059967, "loss": 5.7463, "mean_token_accuracy": 0.20036121755838393, "num_tokens": 62466367.0, "step": 24645 }, { "entropy": 6.276161336898804, "epoch": 2.8447778418926717, "grad_norm": 0.9140625, "learning_rate": 0.0004205271758722687, "loss": 5.5291, "mean_token_accuracy": 0.2173529088497162, "num_tokens": 62479881.0, "step": 24650 }, { "entropy": 6.3450093269348145, "epoch": 2.84535487593768, "grad_norm": 0.96875, "learning_rate": 0.0004204957023292034, "loss": 5.8201, "mean_token_accuracy": 0.19415062218904494, "num_tokens": 62493634.0, "step": 24655 }, { "entropy": 6.288174247741699, "epoch": 2.845931909982689, "grad_norm": 1.0625, "learning_rate": 0.00042046422389246246, "loss": 5.5844, "mean_token_accuracy": 0.21541155278682708, "num_tokens": 62505045.0, "step": 24660 }, { "entropy": 6.310085296630859, "epoch": 2.846508944027698, "grad_norm": 1.0078125, "learning_rate": 0.00042043274056310454, "loss": 5.6949, "mean_token_accuracy": 0.19860265105962754, "num_tokens": 62517403.0, "step": 24665 }, { "entropy": 6.257347440719604, "epoch": 2.8470859780727062, "grad_norm": 1.015625, "learning_rate": 0.0004204012523421888, "loss": 5.6304, "mean_token_accuracy": 0.20549745559692384, "num_tokens": 62529276.0, "step": 24670 }, { "entropy": 6.18459005355835, "epoch": 2.847663012117715, "grad_norm": 0.93359375, "learning_rate": 0.000420369759230774, "loss": 5.5296, "mean_token_accuracy": 0.21557887345552446, "num_tokens": 62542705.0, "step": 24675 }, { "entropy": 6.266983890533448, "epoch": 2.8482400461627235, "grad_norm": 0.91015625, "learning_rate": 0.00042033826122991956, "loss": 5.6478, "mean_token_accuracy": 0.20268526524305344, "num_tokens": 62555547.0, "step": 24680 }, { "entropy": 6.182284307479859, "epoch": 2.8488170802077324, "grad_norm": 0.9921875, "learning_rate": 0.000420306758340685, "loss": 5.5529, "mean_token_accuracy": 0.2156699165701866, "num_tokens": 62569118.0, "step": 24685 }, { "entropy": 6.212188291549682, "epoch": 2.849394114252741, "grad_norm": 1.0078125, "learning_rate": 0.00042027525056412973, "loss": 5.5834, "mean_token_accuracy": 0.20967470556497575, "num_tokens": 62580632.0, "step": 24690 }, { "entropy": 6.215041160583496, "epoch": 2.8499711482977497, "grad_norm": 1.015625, "learning_rate": 0.0004202437379013136, "loss": 5.4767, "mean_token_accuracy": 0.22377861440181732, "num_tokens": 62593554.0, "step": 24695 }, { "entropy": 6.26546721458435, "epoch": 2.850548182342758, "grad_norm": 0.96484375, "learning_rate": 0.0004202122203532965, "loss": 5.6695, "mean_token_accuracy": 0.20374905169010163, "num_tokens": 62606454.0, "step": 24700 }, { "entropy": 6.267917537689209, "epoch": 2.851125216387767, "grad_norm": 0.9375, "learning_rate": 0.00042018069792113845, "loss": 5.6619, "mean_token_accuracy": 0.2080647259950638, "num_tokens": 62620665.0, "step": 24705 }, { "entropy": 6.220990753173828, "epoch": 2.8517022504327754, "grad_norm": 0.953125, "learning_rate": 0.0004201491706058998, "loss": 5.6061, "mean_token_accuracy": 0.21244151890277863, "num_tokens": 62632849.0, "step": 24710 }, { "entropy": 6.270468616485596, "epoch": 2.8522792844777842, "grad_norm": 1.0546875, "learning_rate": 0.0004201176384086408, "loss": 5.6692, "mean_token_accuracy": 0.20357554852962495, "num_tokens": 62644355.0, "step": 24715 }, { "entropy": 6.273852300643921, "epoch": 2.852856318522793, "grad_norm": 1.03125, "learning_rate": 0.0004200861013304222, "loss": 5.6589, "mean_token_accuracy": 0.2070357844233513, "num_tokens": 62656642.0, "step": 24720 }, { "entropy": 6.284038448333741, "epoch": 2.8534333525678015, "grad_norm": 1.0546875, "learning_rate": 0.00042005455937230466, "loss": 5.5908, "mean_token_accuracy": 0.21206920742988586, "num_tokens": 62669993.0, "step": 24725 }, { "entropy": 6.2940301418304445, "epoch": 2.85401038661281, "grad_norm": 1.0078125, "learning_rate": 0.000420023012535349, "loss": 5.693, "mean_token_accuracy": 0.20228539407253265, "num_tokens": 62682336.0, "step": 24730 }, { "entropy": 6.356509494781494, "epoch": 2.854587420657819, "grad_norm": 0.96875, "learning_rate": 0.0004199914608206164, "loss": 5.7358, "mean_token_accuracy": 0.2026624709367752, "num_tokens": 62694893.0, "step": 24735 }, { "entropy": 6.345118188858033, "epoch": 2.8551644547028276, "grad_norm": 0.9453125, "learning_rate": 0.000419959904229168, "loss": 5.6528, "mean_token_accuracy": 0.2035708174109459, "num_tokens": 62707486.0, "step": 24740 }, { "entropy": 6.3470494747161865, "epoch": 2.855741488747836, "grad_norm": 0.94140625, "learning_rate": 0.0004199283427620653, "loss": 5.7498, "mean_token_accuracy": 0.2006876677274704, "num_tokens": 62721350.0, "step": 24745 }, { "entropy": 6.197284698486328, "epoch": 2.856318522792845, "grad_norm": 1.078125, "learning_rate": 0.00041989677642036973, "loss": 5.5509, "mean_token_accuracy": 0.2134019762277603, "num_tokens": 62734133.0, "step": 24750 }, { "entropy": 6.275422620773315, "epoch": 2.8568955568378533, "grad_norm": 1.046875, "learning_rate": 0.00041986520520514303, "loss": 5.5844, "mean_token_accuracy": 0.21036942452192306, "num_tokens": 62746218.0, "step": 24755 }, { "entropy": 6.307258892059326, "epoch": 2.857472590882862, "grad_norm": 0.9765625, "learning_rate": 0.00041983362911744715, "loss": 5.7225, "mean_token_accuracy": 0.20028795301914215, "num_tokens": 62759137.0, "step": 24760 }, { "entropy": 6.290567445755005, "epoch": 2.8580496249278706, "grad_norm": 1.1875, "learning_rate": 0.0004198020481583441, "loss": 5.659, "mean_token_accuracy": 0.20359014421701432, "num_tokens": 62772287.0, "step": 24765 }, { "entropy": 6.3574377536773685, "epoch": 2.8586266589728795, "grad_norm": 0.94921875, "learning_rate": 0.00041977046232889606, "loss": 5.6756, "mean_token_accuracy": 0.20389679819345474, "num_tokens": 62785354.0, "step": 24770 }, { "entropy": 6.278729104995728, "epoch": 2.859203693017888, "grad_norm": 1.46875, "learning_rate": 0.00041973887163016546, "loss": 5.6538, "mean_token_accuracy": 0.2123601943254471, "num_tokens": 62798356.0, "step": 24775 }, { "entropy": 6.250250339508057, "epoch": 2.8597807270628968, "grad_norm": 1.1015625, "learning_rate": 0.0004197072760632147, "loss": 5.5915, "mean_token_accuracy": 0.21125935167074203, "num_tokens": 62809966.0, "step": 24780 }, { "entropy": 6.272337818145752, "epoch": 2.860357761107905, "grad_norm": 1.015625, "learning_rate": 0.00041967567562910675, "loss": 5.6177, "mean_token_accuracy": 0.20405017733573913, "num_tokens": 62821833.0, "step": 24785 }, { "entropy": 6.259753942489624, "epoch": 2.860934795152914, "grad_norm": 0.98046875, "learning_rate": 0.00041964407032890426, "loss": 5.6199, "mean_token_accuracy": 0.21314382702112197, "num_tokens": 62833619.0, "step": 24790 }, { "entropy": 6.236772203445435, "epoch": 2.861511829197923, "grad_norm": 1.0546875, "learning_rate": 0.00041961246016367033, "loss": 5.6469, "mean_token_accuracy": 0.20206320583820342, "num_tokens": 62846373.0, "step": 24795 }, { "entropy": 6.320559930801392, "epoch": 2.8620888632429313, "grad_norm": 1.0234375, "learning_rate": 0.00041958084513446807, "loss": 5.7146, "mean_token_accuracy": 0.2090005874633789, "num_tokens": 62859311.0, "step": 24800 }, { "entropy": 6.312822151184082, "epoch": 2.8626658972879397, "grad_norm": 0.93359375, "learning_rate": 0.000419549225242361, "loss": 5.7147, "mean_token_accuracy": 0.20246246010065078, "num_tokens": 62871824.0, "step": 24805 }, { "entropy": 6.253323793411255, "epoch": 2.8632429313329486, "grad_norm": 1.0234375, "learning_rate": 0.0004195176004884124, "loss": 5.6527, "mean_token_accuracy": 0.20027650147676468, "num_tokens": 62883795.0, "step": 24810 }, { "entropy": 6.299838066101074, "epoch": 2.8638199653779575, "grad_norm": 1.046875, "learning_rate": 0.0004194859708736863, "loss": 5.7037, "mean_token_accuracy": 0.20411465167999268, "num_tokens": 62896331.0, "step": 24815 }, { "entropy": 6.359110164642334, "epoch": 2.864396999422966, "grad_norm": 1.109375, "learning_rate": 0.00041945433639924617, "loss": 5.7471, "mean_token_accuracy": 0.19504598826169967, "num_tokens": 62907656.0, "step": 24820 }, { "entropy": 6.23306794166565, "epoch": 2.8649740334679747, "grad_norm": 0.953125, "learning_rate": 0.00041942269706615623, "loss": 5.5512, "mean_token_accuracy": 0.20998361557722092, "num_tokens": 62921132.0, "step": 24825 }, { "entropy": 6.258009910583496, "epoch": 2.865551067512983, "grad_norm": 1.0625, "learning_rate": 0.00041939105287548055, "loss": 5.6305, "mean_token_accuracy": 0.20799764841794968, "num_tokens": 62933989.0, "step": 24830 }, { "entropy": 6.282893800735474, "epoch": 2.866128101557992, "grad_norm": 1.0234375, "learning_rate": 0.00041935940382828365, "loss": 5.7253, "mean_token_accuracy": 0.19343871176242827, "num_tokens": 62946284.0, "step": 24835 }, { "entropy": 6.266582918167114, "epoch": 2.8667051356030004, "grad_norm": 1.140625, "learning_rate": 0.0004193277499256299, "loss": 5.6599, "mean_token_accuracy": 0.20717596411705017, "num_tokens": 62958690.0, "step": 24840 }, { "entropy": 6.308058261871338, "epoch": 2.8672821696480093, "grad_norm": 1.046875, "learning_rate": 0.00041929609116858385, "loss": 5.6963, "mean_token_accuracy": 0.20280860513448715, "num_tokens": 62970374.0, "step": 24845 }, { "entropy": 6.2022570133209225, "epoch": 2.8678592036930177, "grad_norm": 1.046875, "learning_rate": 0.00041926442755821055, "loss": 5.6103, "mean_token_accuracy": 0.20930901616811753, "num_tokens": 62982245.0, "step": 24850 }, { "entropy": 6.2994811058044435, "epoch": 2.8684362377380266, "grad_norm": 1.0546875, "learning_rate": 0.0004192327590955748, "loss": 5.6147, "mean_token_accuracy": 0.2089069440960884, "num_tokens": 62995546.0, "step": 24855 }, { "entropy": 6.340536451339721, "epoch": 2.869013271783035, "grad_norm": 0.9765625, "learning_rate": 0.00041920108578174197, "loss": 5.7206, "mean_token_accuracy": 0.20035638958215712, "num_tokens": 63006937.0, "step": 24860 }, { "entropy": 6.307915115356446, "epoch": 2.869590305828044, "grad_norm": 0.96484375, "learning_rate": 0.0004191694076177772, "loss": 5.6292, "mean_token_accuracy": 0.20403328388929368, "num_tokens": 63019722.0, "step": 24865 }, { "entropy": 6.307921838760376, "epoch": 2.8701673398730527, "grad_norm": 1.0625, "learning_rate": 0.00041913772460474603, "loss": 5.73, "mean_token_accuracy": 0.20368449240922928, "num_tokens": 63031627.0, "step": 24870 }, { "entropy": 6.309134531021118, "epoch": 2.870744373918061, "grad_norm": 1.0, "learning_rate": 0.00041910603674371406, "loss": 5.7545, "mean_token_accuracy": 0.19816228598356248, "num_tokens": 63043781.0, "step": 24875 }, { "entropy": 6.291825199127198, "epoch": 2.8713214079630696, "grad_norm": 1.0078125, "learning_rate": 0.0004190743440357471, "loss": 5.617, "mean_token_accuracy": 0.21208431869745253, "num_tokens": 63057196.0, "step": 24880 }, { "entropy": 6.294701671600341, "epoch": 2.8718984420080784, "grad_norm": 1.0859375, "learning_rate": 0.0004190426464819112, "loss": 5.6079, "mean_token_accuracy": 0.20768255591392518, "num_tokens": 63070013.0, "step": 24885 }, { "entropy": 6.311951398849487, "epoch": 2.8724754760530873, "grad_norm": 0.94921875, "learning_rate": 0.0004190109440832724, "loss": 5.6923, "mean_token_accuracy": 0.20715832859277725, "num_tokens": 63082733.0, "step": 24890 }, { "entropy": 6.309356737136841, "epoch": 2.8730525100980957, "grad_norm": 0.984375, "learning_rate": 0.00041897923684089714, "loss": 5.72, "mean_token_accuracy": 0.20285115540027618, "num_tokens": 63095275.0, "step": 24895 }, { "entropy": 6.279475688934326, "epoch": 2.8736295441431046, "grad_norm": 1.09375, "learning_rate": 0.0004189475247558516, "loss": 5.6876, "mean_token_accuracy": 0.20379520654678346, "num_tokens": 63108184.0, "step": 24900 }, { "entropy": 6.276606702804566, "epoch": 2.874206578188113, "grad_norm": 1.2265625, "learning_rate": 0.00041891580782920263, "loss": 5.5598, "mean_token_accuracy": 0.20674587935209274, "num_tokens": 63120157.0, "step": 24905 }, { "entropy": 6.277227163314819, "epoch": 2.874783612233122, "grad_norm": 1.0, "learning_rate": 0.00041888408606201695, "loss": 5.6688, "mean_token_accuracy": 0.2045833110809326, "num_tokens": 63132390.0, "step": 24910 }, { "entropy": 6.23179259300232, "epoch": 2.8753606462781303, "grad_norm": 0.98828125, "learning_rate": 0.0004188523594553615, "loss": 5.675, "mean_token_accuracy": 0.20663324296474456, "num_tokens": 63145567.0, "step": 24915 }, { "entropy": 6.268257427215576, "epoch": 2.875937680323139, "grad_norm": 0.953125, "learning_rate": 0.0004188206280103034, "loss": 5.7025, "mean_token_accuracy": 0.20715190321207047, "num_tokens": 63157921.0, "step": 24920 }, { "entropy": 6.3320948600769045, "epoch": 2.876514714368148, "grad_norm": 0.94140625, "learning_rate": 0.00041878889172790995, "loss": 5.6404, "mean_token_accuracy": 0.2083456799387932, "num_tokens": 63169848.0, "step": 24925 }, { "entropy": 6.342430162429809, "epoch": 2.8770917484131564, "grad_norm": 0.9296875, "learning_rate": 0.0004187571506092485, "loss": 5.7672, "mean_token_accuracy": 0.20046480745077133, "num_tokens": 63182827.0, "step": 24930 }, { "entropy": 6.308949422836304, "epoch": 2.877668782458165, "grad_norm": 0.94140625, "learning_rate": 0.0004187254046553867, "loss": 5.6689, "mean_token_accuracy": 0.2035600498318672, "num_tokens": 63195636.0, "step": 24935 }, { "entropy": 6.350260829925537, "epoch": 2.8782458165031737, "grad_norm": 1.1171875, "learning_rate": 0.00041869365386739234, "loss": 5.6717, "mean_token_accuracy": 0.20271206945180892, "num_tokens": 63210045.0, "step": 24940 }, { "entropy": 6.2679845809936525, "epoch": 2.8788228505481825, "grad_norm": 1.03125, "learning_rate": 0.00041866189824633335, "loss": 5.5876, "mean_token_accuracy": 0.2063237264752388, "num_tokens": 63223696.0, "step": 24945 }, { "entropy": 6.26953272819519, "epoch": 2.879399884593191, "grad_norm": 1.03125, "learning_rate": 0.0004186301377932777, "loss": 5.6568, "mean_token_accuracy": 0.20177958458662032, "num_tokens": 63236325.0, "step": 24950 }, { "entropy": 6.3240350723266605, "epoch": 2.8799769186381994, "grad_norm": 1.0234375, "learning_rate": 0.0004185983725092937, "loss": 5.7185, "mean_token_accuracy": 0.19612749069929122, "num_tokens": 63249099.0, "step": 24955 }, { "entropy": 6.3994958877563475, "epoch": 2.8805539526832082, "grad_norm": 0.94140625, "learning_rate": 0.0004185666023954498, "loss": 5.7666, "mean_token_accuracy": 0.19652038663625718, "num_tokens": 63261346.0, "step": 24960 }, { "entropy": 6.262199020385742, "epoch": 2.881130986728217, "grad_norm": 1.0, "learning_rate": 0.0004185348274528146, "loss": 5.5768, "mean_token_accuracy": 0.2146102100610733, "num_tokens": 63274574.0, "step": 24965 }, { "entropy": 6.219927263259888, "epoch": 2.8817080207732255, "grad_norm": 1.0078125, "learning_rate": 0.00041850304768245675, "loss": 5.5797, "mean_token_accuracy": 0.21395696699619293, "num_tokens": 63286708.0, "step": 24970 }, { "entropy": 6.306724119186401, "epoch": 2.8822850548182344, "grad_norm": 0.9921875, "learning_rate": 0.0004184712630854451, "loss": 5.6186, "mean_token_accuracy": 0.2058671236038208, "num_tokens": 63298769.0, "step": 24975 }, { "entropy": 6.302718639373779, "epoch": 2.882862088863243, "grad_norm": 0.9609375, "learning_rate": 0.0004184394736628488, "loss": 5.6893, "mean_token_accuracy": 0.20315046459436417, "num_tokens": 63311228.0, "step": 24980 }, { "entropy": 6.334771203994751, "epoch": 2.8834391229082517, "grad_norm": 1.5078125, "learning_rate": 0.0004184076794157371, "loss": 5.7165, "mean_token_accuracy": 0.20398392379283906, "num_tokens": 63323450.0, "step": 24985 }, { "entropy": 6.252768898010254, "epoch": 2.88401615695326, "grad_norm": 1.015625, "learning_rate": 0.0004183758803451793, "loss": 5.5926, "mean_token_accuracy": 0.21564585566520691, "num_tokens": 63336948.0, "step": 24990 }, { "entropy": 6.296437835693359, "epoch": 2.884593190998269, "grad_norm": 0.97265625, "learning_rate": 0.00041834407645224505, "loss": 5.6923, "mean_token_accuracy": 0.20159712433815002, "num_tokens": 63348328.0, "step": 24995 }, { "entropy": 6.278706169128418, "epoch": 2.885170225043278, "grad_norm": 1.0703125, "learning_rate": 0.0004183122677380039, "loss": 5.6423, "mean_token_accuracy": 0.20447832196950913, "num_tokens": 63359761.0, "step": 25000 }, { "entropy": 6.290283679962158, "epoch": 2.885747259088286, "grad_norm": 1.0546875, "learning_rate": 0.00041828045420352585, "loss": 5.6413, "mean_token_accuracy": 0.20627966821193694, "num_tokens": 63371949.0, "step": 25005 }, { "entropy": 6.267902565002442, "epoch": 2.8863242931332946, "grad_norm": 1.0, "learning_rate": 0.00041824863584988086, "loss": 5.6944, "mean_token_accuracy": 0.1980934739112854, "num_tokens": 63385021.0, "step": 25010 }, { "entropy": 6.250814914703369, "epoch": 2.8869013271783035, "grad_norm": 1.0234375, "learning_rate": 0.0004182168126781392, "loss": 5.6008, "mean_token_accuracy": 0.20583415329456328, "num_tokens": 63398391.0, "step": 25015 }, { "entropy": 6.383827161788941, "epoch": 2.8874783612233124, "grad_norm": 0.98046875, "learning_rate": 0.0004181849846893712, "loss": 5.7315, "mean_token_accuracy": 0.19851785153150558, "num_tokens": 63411161.0, "step": 25020 }, { "entropy": 6.233171463012695, "epoch": 2.888055395268321, "grad_norm": 1.03125, "learning_rate": 0.0004181531518846474, "loss": 5.6527, "mean_token_accuracy": 0.2105906769633293, "num_tokens": 63424686.0, "step": 25025 }, { "entropy": 6.2565630912780765, "epoch": 2.8886324293133296, "grad_norm": 1.015625, "learning_rate": 0.00041812131426503834, "loss": 5.696, "mean_token_accuracy": 0.20227278023958206, "num_tokens": 63437424.0, "step": 25030 }, { "entropy": 6.321119737625122, "epoch": 2.889209463358338, "grad_norm": 0.953125, "learning_rate": 0.0004180894718316151, "loss": 5.7472, "mean_token_accuracy": 0.19942276179790497, "num_tokens": 63452194.0, "step": 25035 }, { "entropy": 6.320767450332641, "epoch": 2.889786497403347, "grad_norm": 1.015625, "learning_rate": 0.00041805762458544846, "loss": 5.6174, "mean_token_accuracy": 0.21162911653518676, "num_tokens": 63465113.0, "step": 25040 }, { "entropy": 6.323999691009521, "epoch": 2.8903635314483553, "grad_norm": 0.9765625, "learning_rate": 0.00041802577252760963, "loss": 5.7113, "mean_token_accuracy": 0.2057264119386673, "num_tokens": 63477791.0, "step": 25045 }, { "entropy": 6.314538049697876, "epoch": 2.890940565493364, "grad_norm": 1.0078125, "learning_rate": 0.00041799391565917, "loss": 5.6595, "mean_token_accuracy": 0.202808278799057, "num_tokens": 63490280.0, "step": 25050 }, { "entropy": 6.342606496810913, "epoch": 2.8915175995383726, "grad_norm": 1.078125, "learning_rate": 0.00041796205398120115, "loss": 5.7064, "mean_token_accuracy": 0.19900117665529252, "num_tokens": 63502617.0, "step": 25055 }, { "entropy": 6.23744478225708, "epoch": 2.8920946335833815, "grad_norm": 1.0390625, "learning_rate": 0.00041793018749477454, "loss": 5.5131, "mean_token_accuracy": 0.2126069873571396, "num_tokens": 63515209.0, "step": 25060 }, { "entropy": 6.281412935256958, "epoch": 2.89267166762839, "grad_norm": 0.97265625, "learning_rate": 0.0004178983162009621, "loss": 5.7413, "mean_token_accuracy": 0.20017960220575332, "num_tokens": 63527870.0, "step": 25065 }, { "entropy": 6.291341400146484, "epoch": 2.8932487016733988, "grad_norm": 0.9609375, "learning_rate": 0.0004178664401008358, "loss": 5.6286, "mean_token_accuracy": 0.20657579898834227, "num_tokens": 63541187.0, "step": 25070 }, { "entropy": 6.305284452438355, "epoch": 2.8938257357184076, "grad_norm": 0.94140625, "learning_rate": 0.00041783455919546767, "loss": 5.6671, "mean_token_accuracy": 0.20378590226173401, "num_tokens": 63553892.0, "step": 25075 }, { "entropy": 6.229226446151733, "epoch": 2.894402769763416, "grad_norm": 1.0234375, "learning_rate": 0.00041780267348593016, "loss": 5.58, "mean_token_accuracy": 0.21682365089654923, "num_tokens": 63565149.0, "step": 25080 }, { "entropy": 6.2576981544494625, "epoch": 2.8949798038084245, "grad_norm": 1.0625, "learning_rate": 0.0004177707829732956, "loss": 5.6572, "mean_token_accuracy": 0.20821669995784758, "num_tokens": 63577114.0, "step": 25085 }, { "entropy": 6.257887601852417, "epoch": 2.8955568378534333, "grad_norm": 0.984375, "learning_rate": 0.00041773888765863677, "loss": 5.5964, "mean_token_accuracy": 0.20918401032686235, "num_tokens": 63589689.0, "step": 25090 }, { "entropy": 6.353279685974121, "epoch": 2.896133871898442, "grad_norm": 0.9609375, "learning_rate": 0.0004177069875430263, "loss": 5.7044, "mean_token_accuracy": 0.1995902866125107, "num_tokens": 63601888.0, "step": 25095 }, { "entropy": 6.284457778930664, "epoch": 2.8967109059434506, "grad_norm": 1.0078125, "learning_rate": 0.0004176750826275372, "loss": 5.7, "mean_token_accuracy": 0.20063745975494385, "num_tokens": 63614663.0, "step": 25100 }, { "entropy": 6.247959566116333, "epoch": 2.8972879399884595, "grad_norm": 1.1875, "learning_rate": 0.0004176431729132426, "loss": 5.6406, "mean_token_accuracy": 0.20677649974822998, "num_tokens": 63626191.0, "step": 25105 }, { "entropy": 6.322126960754394, "epoch": 2.897864974033468, "grad_norm": 1.0, "learning_rate": 0.00041761125840121565, "loss": 5.6353, "mean_token_accuracy": 0.20748212635517121, "num_tokens": 63638778.0, "step": 25110 }, { "entropy": 6.267091894149781, "epoch": 2.8984420080784767, "grad_norm": 0.984375, "learning_rate": 0.0004175793390925299, "loss": 5.5495, "mean_token_accuracy": 0.21032895594835282, "num_tokens": 63653369.0, "step": 25115 }, { "entropy": 6.270925760269165, "epoch": 2.899019042123485, "grad_norm": 1.0, "learning_rate": 0.0004175474149882589, "loss": 5.6505, "mean_token_accuracy": 0.20176509916782379, "num_tokens": 63665442.0, "step": 25120 }, { "entropy": 6.214730930328369, "epoch": 2.899596076168494, "grad_norm": 0.9609375, "learning_rate": 0.0004175154860894765, "loss": 5.6018, "mean_token_accuracy": 0.2154811978340149, "num_tokens": 63678221.0, "step": 25125 }, { "entropy": 6.254687404632568, "epoch": 2.9001731102135024, "grad_norm": 0.96484375, "learning_rate": 0.0004174835523972563, "loss": 5.5894, "mean_token_accuracy": 0.2155776649713516, "num_tokens": 63690619.0, "step": 25130 }, { "entropy": 6.290982675552368, "epoch": 2.9007501442585113, "grad_norm": 0.94921875, "learning_rate": 0.00041745161391267276, "loss": 5.667, "mean_token_accuracy": 0.20212687999010087, "num_tokens": 63703742.0, "step": 25135 }, { "entropy": 6.295825242996216, "epoch": 2.9013271783035197, "grad_norm": 1.0234375, "learning_rate": 0.00041741967063679993, "loss": 5.6507, "mean_token_accuracy": 0.2055546075105667, "num_tokens": 63716929.0, "step": 25140 }, { "entropy": 6.243985223770141, "epoch": 2.9019042123485286, "grad_norm": 0.97265625, "learning_rate": 0.00041738772257071216, "loss": 5.608, "mean_token_accuracy": 0.20904375463724137, "num_tokens": 63730301.0, "step": 25145 }, { "entropy": 6.203047370910644, "epoch": 2.9024812463935374, "grad_norm": 1.0625, "learning_rate": 0.0004173557697154841, "loss": 5.5069, "mean_token_accuracy": 0.21487298756837844, "num_tokens": 63744294.0, "step": 25150 }, { "entropy": 6.284126710891724, "epoch": 2.903058280438546, "grad_norm": 1.0546875, "learning_rate": 0.00041732381207219046, "loss": 5.6966, "mean_token_accuracy": 0.19748999327421188, "num_tokens": 63756634.0, "step": 25155 }, { "entropy": 6.298375034332276, "epoch": 2.9036353144835543, "grad_norm": 0.98828125, "learning_rate": 0.00041729184964190607, "loss": 5.6317, "mean_token_accuracy": 0.20705596804618837, "num_tokens": 63768920.0, "step": 25160 }, { "entropy": 6.236512804031372, "epoch": 2.904212348528563, "grad_norm": 1.0234375, "learning_rate": 0.00041725988242570603, "loss": 5.5932, "mean_token_accuracy": 0.2102369487285614, "num_tokens": 63781315.0, "step": 25165 }, { "entropy": 6.294569826126098, "epoch": 2.904789382573572, "grad_norm": 0.953125, "learning_rate": 0.00041722791042466545, "loss": 5.7104, "mean_token_accuracy": 0.19871323555707932, "num_tokens": 63793453.0, "step": 25170 }, { "entropy": 6.421709585189819, "epoch": 2.9053664166185804, "grad_norm": 0.97265625, "learning_rate": 0.0004171959336398598, "loss": 5.706, "mean_token_accuracy": 0.20061707198619844, "num_tokens": 63806929.0, "step": 25175 }, { "entropy": 6.258252239227295, "epoch": 2.9059434506635893, "grad_norm": 0.984375, "learning_rate": 0.0004171639520723646, "loss": 5.6061, "mean_token_accuracy": 0.20822567492723465, "num_tokens": 63819794.0, "step": 25180 }, { "entropy": 6.231323909759522, "epoch": 2.9065204847085977, "grad_norm": 1.046875, "learning_rate": 0.0004171319657232554, "loss": 5.5822, "mean_token_accuracy": 0.21523085236549377, "num_tokens": 63831494.0, "step": 25185 }, { "entropy": 6.296552467346191, "epoch": 2.9070975187536066, "grad_norm": 1.015625, "learning_rate": 0.0004170999745936082, "loss": 5.6534, "mean_token_accuracy": 0.1993444100022316, "num_tokens": 63844472.0, "step": 25190 }, { "entropy": 6.312586736679077, "epoch": 2.907674552798615, "grad_norm": 1.0, "learning_rate": 0.0004170679786844989, "loss": 5.6671, "mean_token_accuracy": 0.19803964495658874, "num_tokens": 63856028.0, "step": 25195 }, { "entropy": 6.2204302787780765, "epoch": 2.908251586843624, "grad_norm": 1.0390625, "learning_rate": 0.0004170359779970037, "loss": 5.6369, "mean_token_accuracy": 0.19928001016378402, "num_tokens": 63870137.0, "step": 25200 }, { "entropy": 6.349273538589477, "epoch": 2.9088286208886327, "grad_norm": 1.0234375, "learning_rate": 0.0004170039725321989, "loss": 5.7079, "mean_token_accuracy": 0.20070801079273223, "num_tokens": 63882152.0, "step": 25205 }, { "entropy": 6.2704503536224365, "epoch": 2.909405654933641, "grad_norm": 1.0703125, "learning_rate": 0.00041697196229116106, "loss": 5.6066, "mean_token_accuracy": 0.2054191052913666, "num_tokens": 63894624.0, "step": 25210 }, { "entropy": 6.150464868545532, "epoch": 2.9099826889786495, "grad_norm": 1.0234375, "learning_rate": 0.0004169399472749668, "loss": 5.4453, "mean_token_accuracy": 0.22304238826036454, "num_tokens": 63907439.0, "step": 25215 }, { "entropy": 6.3068078517913815, "epoch": 2.9105597230236584, "grad_norm": 1.1328125, "learning_rate": 0.000416907927484693, "loss": 5.7186, "mean_token_accuracy": 0.20052140653133393, "num_tokens": 63920432.0, "step": 25220 }, { "entropy": 6.310074043273926, "epoch": 2.9111367570686673, "grad_norm": 0.9765625, "learning_rate": 0.00041687590292141644, "loss": 5.6325, "mean_token_accuracy": 0.21428772509098054, "num_tokens": 63935682.0, "step": 25225 }, { "entropy": 6.214284944534302, "epoch": 2.9117137911136757, "grad_norm": 0.984375, "learning_rate": 0.00041684387358621435, "loss": 5.6399, "mean_token_accuracy": 0.21525498926639558, "num_tokens": 63949109.0, "step": 25230 }, { "entropy": 6.316666793823242, "epoch": 2.912290825158684, "grad_norm": 0.9140625, "learning_rate": 0.00041681183948016404, "loss": 5.6169, "mean_token_accuracy": 0.20855890363454818, "num_tokens": 63962859.0, "step": 25235 }, { "entropy": 6.368614053726196, "epoch": 2.912867859203693, "grad_norm": 0.9609375, "learning_rate": 0.000416779800604343, "loss": 5.7406, "mean_token_accuracy": 0.19653613567352296, "num_tokens": 63975641.0, "step": 25240 }, { "entropy": 6.332232809066772, "epoch": 2.913444893248702, "grad_norm": 0.9375, "learning_rate": 0.00041674775695982883, "loss": 5.6948, "mean_token_accuracy": 0.2006824254989624, "num_tokens": 63988419.0, "step": 25245 }, { "entropy": 6.245564317703247, "epoch": 2.9140219272937102, "grad_norm": 1.078125, "learning_rate": 0.0004167157085476992, "loss": 5.6549, "mean_token_accuracy": 0.20331034064292908, "num_tokens": 64000217.0, "step": 25250 }, { "entropy": 6.298387670516968, "epoch": 2.914598961338719, "grad_norm": 0.984375, "learning_rate": 0.0004166836553690321, "loss": 5.6973, "mean_token_accuracy": 0.205794295668602, "num_tokens": 64013083.0, "step": 25255 }, { "entropy": 6.235529375076294, "epoch": 2.9151759953837275, "grad_norm": 1.0, "learning_rate": 0.0004166515974249056, "loss": 5.6077, "mean_token_accuracy": 0.2072654575109482, "num_tokens": 64025769.0, "step": 25260 }, { "entropy": 6.291547393798828, "epoch": 2.9157530294287364, "grad_norm": 1.0390625, "learning_rate": 0.00041661953471639797, "loss": 5.6649, "mean_token_accuracy": 0.2001086875796318, "num_tokens": 64037526.0, "step": 25265 }, { "entropy": 6.226619243621826, "epoch": 2.916330063473745, "grad_norm": 1.078125, "learning_rate": 0.00041658746724458775, "loss": 5.6182, "mean_token_accuracy": 0.21015765219926835, "num_tokens": 64050542.0, "step": 25270 }, { "entropy": 6.261485433578491, "epoch": 2.9169070975187537, "grad_norm": 1.1171875, "learning_rate": 0.00041655539501055333, "loss": 5.5603, "mean_token_accuracy": 0.21315181851387024, "num_tokens": 64063097.0, "step": 25275 }, { "entropy": 6.29876217842102, "epoch": 2.9174841315637625, "grad_norm": 0.98828125, "learning_rate": 0.0004165233180153735, "loss": 5.683, "mean_token_accuracy": 0.20762786865234376, "num_tokens": 64076104.0, "step": 25280 }, { "entropy": 6.311828708648681, "epoch": 2.918061165608771, "grad_norm": 0.98046875, "learning_rate": 0.0004164912362601272, "loss": 5.6517, "mean_token_accuracy": 0.20843846797943116, "num_tokens": 64090351.0, "step": 25285 }, { "entropy": 6.193958377838134, "epoch": 2.9186381996537794, "grad_norm": 0.99609375, "learning_rate": 0.00041645914974589347, "loss": 5.5268, "mean_token_accuracy": 0.2083866134285927, "num_tokens": 64103408.0, "step": 25290 }, { "entropy": 6.161638975143433, "epoch": 2.919215233698788, "grad_norm": 1.015625, "learning_rate": 0.00041642705847375137, "loss": 5.55, "mean_token_accuracy": 0.2145008385181427, "num_tokens": 64116733.0, "step": 25295 }, { "entropy": 6.28320426940918, "epoch": 2.919792267743797, "grad_norm": 1.0234375, "learning_rate": 0.0004163949624447806, "loss": 5.6113, "mean_token_accuracy": 0.21087300330400466, "num_tokens": 64129040.0, "step": 25300 }, { "entropy": 6.266964054107666, "epoch": 2.9203693017888055, "grad_norm": 1.0390625, "learning_rate": 0.00041636286166006045, "loss": 5.6651, "mean_token_accuracy": 0.19479360282421113, "num_tokens": 64140437.0, "step": 25305 }, { "entropy": 6.207163143157959, "epoch": 2.9209463358338144, "grad_norm": 1.0078125, "learning_rate": 0.0004163307561206706, "loss": 5.5464, "mean_token_accuracy": 0.22069514393806458, "num_tokens": 64153771.0, "step": 25310 }, { "entropy": 6.305130672454834, "epoch": 2.9215233698788228, "grad_norm": 1.0234375, "learning_rate": 0.000416298645827691, "loss": 5.6568, "mean_token_accuracy": 0.20214859396219254, "num_tokens": 64165492.0, "step": 25315 }, { "entropy": 6.280672073364258, "epoch": 2.9221004039238316, "grad_norm": 0.93359375, "learning_rate": 0.0004162665307822016, "loss": 5.6495, "mean_token_accuracy": 0.204375259578228, "num_tokens": 64178898.0, "step": 25320 }, { "entropy": 6.369881057739258, "epoch": 2.92267743796884, "grad_norm": 0.98046875, "learning_rate": 0.00041623441098528267, "loss": 5.6825, "mean_token_accuracy": 0.20088574439287185, "num_tokens": 64190529.0, "step": 25325 }, { "entropy": 6.341379117965698, "epoch": 2.923254472013849, "grad_norm": 1.1171875, "learning_rate": 0.00041620228643801443, "loss": 5.559, "mean_token_accuracy": 0.21933011561632157, "num_tokens": 64203073.0, "step": 25330 }, { "entropy": 6.30789999961853, "epoch": 2.9238315060588573, "grad_norm": 0.99609375, "learning_rate": 0.0004161701571414775, "loss": 5.7238, "mean_token_accuracy": 0.2001798763871193, "num_tokens": 64216103.0, "step": 25335 }, { "entropy": 6.322685050964355, "epoch": 2.924408540103866, "grad_norm": 1.015625, "learning_rate": 0.00041613802309675235, "loss": 5.728, "mean_token_accuracy": 0.20137911289930344, "num_tokens": 64228451.0, "step": 25340 }, { "entropy": 6.256172609329224, "epoch": 2.9249855741488746, "grad_norm": 1.0546875, "learning_rate": 0.00041610588430492, "loss": 5.5963, "mean_token_accuracy": 0.20898182839155197, "num_tokens": 64239858.0, "step": 25345 }, { "entropy": 6.244179439544678, "epoch": 2.9255626081938835, "grad_norm": 1.0, "learning_rate": 0.00041607374076706123, "loss": 5.576, "mean_token_accuracy": 0.2131747007369995, "num_tokens": 64252150.0, "step": 25350 }, { "entropy": 6.35038423538208, "epoch": 2.9261396422388923, "grad_norm": 1.09375, "learning_rate": 0.00041604159248425737, "loss": 5.7922, "mean_token_accuracy": 0.20044759660959244, "num_tokens": 64264600.0, "step": 25355 }, { "entropy": 6.3089861392974855, "epoch": 2.9267166762839008, "grad_norm": 1.0703125, "learning_rate": 0.0004160094394575896, "loss": 5.6529, "mean_token_accuracy": 0.2060518443584442, "num_tokens": 64276533.0, "step": 25360 }, { "entropy": 6.287888813018799, "epoch": 2.927293710328909, "grad_norm": 1.015625, "learning_rate": 0.0004159772816881393, "loss": 5.6338, "mean_token_accuracy": 0.21313919872045517, "num_tokens": 64288628.0, "step": 25365 }, { "entropy": 6.270704889297486, "epoch": 2.927870744373918, "grad_norm": 0.9609375, "learning_rate": 0.00041594511917698813, "loss": 5.658, "mean_token_accuracy": 0.2082279995083809, "num_tokens": 64301584.0, "step": 25370 }, { "entropy": 6.308985233306885, "epoch": 2.928447778418927, "grad_norm": 1.0234375, "learning_rate": 0.00041591295192521796, "loss": 5.6972, "mean_token_accuracy": 0.20279430896043776, "num_tokens": 64313363.0, "step": 25375 }, { "entropy": 6.257787036895752, "epoch": 2.9290248124639353, "grad_norm": 1.03125, "learning_rate": 0.0004158807799339107, "loss": 5.6222, "mean_token_accuracy": 0.21045085191726684, "num_tokens": 64325284.0, "step": 25380 }, { "entropy": 6.334829711914063, "epoch": 2.929601846508944, "grad_norm": 1.0390625, "learning_rate": 0.00041584860320414827, "loss": 5.6845, "mean_token_accuracy": 0.20261002331972122, "num_tokens": 64336886.0, "step": 25385 }, { "entropy": 6.28106427192688, "epoch": 2.9301788805539526, "grad_norm": 1.015625, "learning_rate": 0.00041581642173701305, "loss": 5.6076, "mean_token_accuracy": 0.20906456261873246, "num_tokens": 64349299.0, "step": 25390 }, { "entropy": 6.20555567741394, "epoch": 2.9307559145989615, "grad_norm": 1.0703125, "learning_rate": 0.00041578423553358747, "loss": 5.6507, "mean_token_accuracy": 0.2086244523525238, "num_tokens": 64360997.0, "step": 25395 }, { "entropy": 6.328874254226685, "epoch": 2.93133294864397, "grad_norm": 1.0234375, "learning_rate": 0.00041575204459495406, "loss": 5.6697, "mean_token_accuracy": 0.21014914363622667, "num_tokens": 64375083.0, "step": 25400 }, { "entropy": 6.319454526901245, "epoch": 2.9319099826889787, "grad_norm": 1.0, "learning_rate": 0.00041571984892219556, "loss": 5.7403, "mean_token_accuracy": 0.19645586162805556, "num_tokens": 64387882.0, "step": 25405 }, { "entropy": 6.180776166915893, "epoch": 2.932487016733987, "grad_norm": 1.0234375, "learning_rate": 0.0004156876485163948, "loss": 5.5577, "mean_token_accuracy": 0.21098477095365525, "num_tokens": 64399876.0, "step": 25410 }, { "entropy": 6.2463685989379885, "epoch": 2.933064050778996, "grad_norm": 1.0078125, "learning_rate": 0.00041565544337863493, "loss": 5.6152, "mean_token_accuracy": 0.21049430817365647, "num_tokens": 64411479.0, "step": 25415 }, { "entropy": 6.22052264213562, "epoch": 2.9336410848240044, "grad_norm": 0.9140625, "learning_rate": 0.000415623233509999, "loss": 5.5956, "mean_token_accuracy": 0.20906442403793335, "num_tokens": 64425009.0, "step": 25420 }, { "entropy": 6.243103075027466, "epoch": 2.9342181188690133, "grad_norm": 1.1953125, "learning_rate": 0.0004155910189115705, "loss": 5.611, "mean_token_accuracy": 0.20894427597522736, "num_tokens": 64436635.0, "step": 25425 }, { "entropy": 6.1785839080810545, "epoch": 2.934795152914022, "grad_norm": 1.0546875, "learning_rate": 0.00041555879958443296, "loss": 5.5635, "mean_token_accuracy": 0.20670849233865737, "num_tokens": 64449338.0, "step": 25430 }, { "entropy": 6.327011680603027, "epoch": 2.9353721869590306, "grad_norm": 1.1171875, "learning_rate": 0.00041552657552967, "loss": 5.7647, "mean_token_accuracy": 0.1948007568717003, "num_tokens": 64461124.0, "step": 25435 }, { "entropy": 6.31681456565857, "epoch": 2.935949221004039, "grad_norm": 1.078125, "learning_rate": 0.0004154943467483654, "loss": 5.6932, "mean_token_accuracy": 0.21050745993852615, "num_tokens": 64474093.0, "step": 25440 }, { "entropy": 6.303525590896607, "epoch": 2.936526255049048, "grad_norm": 1.1015625, "learning_rate": 0.0004154621132416033, "loss": 5.634, "mean_token_accuracy": 0.19663692861795426, "num_tokens": 64486408.0, "step": 25445 }, { "entropy": 6.21959547996521, "epoch": 2.9371032890940567, "grad_norm": 1.0234375, "learning_rate": 0.00041542987501046777, "loss": 5.6172, "mean_token_accuracy": 0.2132948637008667, "num_tokens": 64499390.0, "step": 25450 }, { "entropy": 6.2744190216064455, "epoch": 2.937680323139065, "grad_norm": 1.0390625, "learning_rate": 0.00041539763205604316, "loss": 5.61, "mean_token_accuracy": 0.20902493596076965, "num_tokens": 64511307.0, "step": 25455 }, { "entropy": 6.253611993789673, "epoch": 2.938257357184074, "grad_norm": 1.1484375, "learning_rate": 0.0004153653843794139, "loss": 5.6043, "mean_token_accuracy": 0.2056280106306076, "num_tokens": 64523027.0, "step": 25460 }, { "entropy": 6.324916362762451, "epoch": 2.9388343912290824, "grad_norm": 1.015625, "learning_rate": 0.0004153331319816647, "loss": 5.7842, "mean_token_accuracy": 0.19520133435726167, "num_tokens": 64535472.0, "step": 25465 }, { "entropy": 6.283449745178222, "epoch": 2.9394114252740913, "grad_norm": 0.9921875, "learning_rate": 0.0004153008748638803, "loss": 5.6359, "mean_token_accuracy": 0.20759779512882232, "num_tokens": 64547935.0, "step": 25470 }, { "entropy": 6.344536066055298, "epoch": 2.9399884593190997, "grad_norm": 0.953125, "learning_rate": 0.0004152686130271457, "loss": 5.7483, "mean_token_accuracy": 0.19507116228342056, "num_tokens": 64561773.0, "step": 25475 }, { "entropy": 6.301615428924561, "epoch": 2.9405654933641086, "grad_norm": 1.0234375, "learning_rate": 0.00041523634647254595, "loss": 5.5888, "mean_token_accuracy": 0.2167532831430435, "num_tokens": 64576465.0, "step": 25480 }, { "entropy": 6.284997415542603, "epoch": 2.9411425274091174, "grad_norm": 1.078125, "learning_rate": 0.00041520407520116633, "loss": 5.6407, "mean_token_accuracy": 0.2057218983769417, "num_tokens": 64589890.0, "step": 25485 }, { "entropy": 6.243203163146973, "epoch": 2.941719561454126, "grad_norm": 1.125, "learning_rate": 0.0004151717992140923, "loss": 5.6131, "mean_token_accuracy": 0.2093499183654785, "num_tokens": 64601423.0, "step": 25490 }, { "entropy": 6.301845121383667, "epoch": 2.9422965954991342, "grad_norm": 1.046875, "learning_rate": 0.00041513951851240947, "loss": 5.6969, "mean_token_accuracy": 0.20259795039892198, "num_tokens": 64614532.0, "step": 25495 }, { "entropy": 6.263013124465942, "epoch": 2.942873629544143, "grad_norm": 1.0078125, "learning_rate": 0.00041510723309720344, "loss": 5.6491, "mean_token_accuracy": 0.2088204249739647, "num_tokens": 64628260.0, "step": 25500 }, { "entropy": 6.295760536193848, "epoch": 2.943450663589152, "grad_norm": 0.92578125, "learning_rate": 0.0004150749429695603, "loss": 5.6274, "mean_token_accuracy": 0.2134072333574295, "num_tokens": 64640913.0, "step": 25505 }, { "entropy": 6.203280401229859, "epoch": 2.9440276976341604, "grad_norm": 1.0078125, "learning_rate": 0.00041504264813056605, "loss": 5.5821, "mean_token_accuracy": 0.21433833688497544, "num_tokens": 64653438.0, "step": 25510 }, { "entropy": 6.237936210632324, "epoch": 2.944604731679169, "grad_norm": 1.03125, "learning_rate": 0.00041501034858130683, "loss": 5.5674, "mean_token_accuracy": 0.20707983374595643, "num_tokens": 64665753.0, "step": 25515 }, { "entropy": 6.354833269119263, "epoch": 2.9451817657241777, "grad_norm": 1.0078125, "learning_rate": 0.00041497804432286914, "loss": 5.7698, "mean_token_accuracy": 0.1939437985420227, "num_tokens": 64676872.0, "step": 25520 }, { "entropy": 6.238164663314819, "epoch": 2.9457587997691865, "grad_norm": 0.9921875, "learning_rate": 0.0004149457353563394, "loss": 5.575, "mean_token_accuracy": 0.214619280397892, "num_tokens": 64690216.0, "step": 25525 }, { "entropy": 6.273436498641968, "epoch": 2.946335833814195, "grad_norm": 0.91015625, "learning_rate": 0.00041491342168280444, "loss": 5.6442, "mean_token_accuracy": 0.2059035509824753, "num_tokens": 64704210.0, "step": 25530 }, { "entropy": 6.357722043991089, "epoch": 2.946912867859204, "grad_norm": 1.1171875, "learning_rate": 0.00041488110330335093, "loss": 5.6623, "mean_token_accuracy": 0.206794635951519, "num_tokens": 64717142.0, "step": 25535 }, { "entropy": 6.195057678222656, "epoch": 2.9474899019042122, "grad_norm": 1.0859375, "learning_rate": 0.00041484878021906605, "loss": 5.5168, "mean_token_accuracy": 0.21917226314544677, "num_tokens": 64729783.0, "step": 25540 }, { "entropy": 6.257410621643066, "epoch": 2.948066935949221, "grad_norm": 1.078125, "learning_rate": 0.00041481645243103695, "loss": 5.7009, "mean_token_accuracy": 0.19696040451526642, "num_tokens": 64742179.0, "step": 25545 }, { "entropy": 6.354957199096679, "epoch": 2.9486439699942295, "grad_norm": 1.0078125, "learning_rate": 0.00041478411994035086, "loss": 5.6867, "mean_token_accuracy": 0.20391977578401566, "num_tokens": 64754925.0, "step": 25550 }, { "entropy": 6.212768602371216, "epoch": 2.9492210040392384, "grad_norm": 0.95703125, "learning_rate": 0.00041475178274809544, "loss": 5.62, "mean_token_accuracy": 0.21312485188245772, "num_tokens": 64768341.0, "step": 25555 }, { "entropy": 6.271695184707641, "epoch": 2.9497980380842472, "grad_norm": 1.03125, "learning_rate": 0.00041471944085535805, "loss": 5.7087, "mean_token_accuracy": 0.2032159000635147, "num_tokens": 64780780.0, "step": 25560 }, { "entropy": 6.327548217773438, "epoch": 2.9503750721292556, "grad_norm": 1.0390625, "learning_rate": 0.0004146870942632268, "loss": 5.7243, "mean_token_accuracy": 0.19584056437015535, "num_tokens": 64792495.0, "step": 25565 }, { "entropy": 6.352340650558472, "epoch": 2.950952106174264, "grad_norm": 0.99609375, "learning_rate": 0.00041465474297278955, "loss": 5.6543, "mean_token_accuracy": 0.20511318296194075, "num_tokens": 64804696.0, "step": 25570 }, { "entropy": 6.26220121383667, "epoch": 2.951529140219273, "grad_norm": 1.0625, "learning_rate": 0.0004146223869851343, "loss": 5.6101, "mean_token_accuracy": 0.2076292708516121, "num_tokens": 64817146.0, "step": 25575 }, { "entropy": 6.244441318511963, "epoch": 2.952106174264282, "grad_norm": 0.9453125, "learning_rate": 0.0004145900263013494, "loss": 5.6828, "mean_token_accuracy": 0.19858550876379014, "num_tokens": 64828833.0, "step": 25580 }, { "entropy": 6.269702816009522, "epoch": 2.95268320830929, "grad_norm": 1.03125, "learning_rate": 0.0004145576609225234, "loss": 5.6128, "mean_token_accuracy": 0.210699462890625, "num_tokens": 64843811.0, "step": 25585 }, { "entropy": 6.235076093673706, "epoch": 2.953260242354299, "grad_norm": 1.046875, "learning_rate": 0.0004145252908497448, "loss": 5.5635, "mean_token_accuracy": 0.21662232279777527, "num_tokens": 64856829.0, "step": 25590 }, { "entropy": 6.172655820846558, "epoch": 2.9538372763993075, "grad_norm": 0.984375, "learning_rate": 0.00041449291608410227, "loss": 5.518, "mean_token_accuracy": 0.21411291807889937, "num_tokens": 64869044.0, "step": 25595 }, { "entropy": 6.286331462860107, "epoch": 2.9544143104443163, "grad_norm": 1.109375, "learning_rate": 0.00041446053662668483, "loss": 5.6676, "mean_token_accuracy": 0.2148498073220253, "num_tokens": 64882330.0, "step": 25600 }, { "entropy": 6.321403741836548, "epoch": 2.9549913444893248, "grad_norm": 1.046875, "learning_rate": 0.0004144281524785815, "loss": 5.685, "mean_token_accuracy": 0.20126740038394927, "num_tokens": 64894609.0, "step": 25605 }, { "entropy": 6.238070821762085, "epoch": 2.9555683785343336, "grad_norm": 1.0234375, "learning_rate": 0.0004143957636408815, "loss": 5.6441, "mean_token_accuracy": 0.20944760888814926, "num_tokens": 64907251.0, "step": 25610 }, { "entropy": 6.30707483291626, "epoch": 2.956145412579342, "grad_norm": 1.0859375, "learning_rate": 0.00041436337011467426, "loss": 5.6714, "mean_token_accuracy": 0.20430303514003753, "num_tokens": 64919114.0, "step": 25615 }, { "entropy": 6.326687479019165, "epoch": 2.956722446624351, "grad_norm": 0.984375, "learning_rate": 0.00041433097190104936, "loss": 5.7068, "mean_token_accuracy": 0.19574066251516342, "num_tokens": 64933064.0, "step": 25620 }, { "entropy": 6.323204088211059, "epoch": 2.9572994806693593, "grad_norm": 1.0390625, "learning_rate": 0.00041429856900109636, "loss": 5.6509, "mean_token_accuracy": 0.21202523857355118, "num_tokens": 64946625.0, "step": 25625 }, { "entropy": 6.2345046043396, "epoch": 2.957876514714368, "grad_norm": 1.0390625, "learning_rate": 0.0004142661614159051, "loss": 5.5543, "mean_token_accuracy": 0.2094992905855179, "num_tokens": 64958577.0, "step": 25630 }, { "entropy": 6.293367576599121, "epoch": 2.958453548759377, "grad_norm": 0.95703125, "learning_rate": 0.00041423374914656587, "loss": 5.7551, "mean_token_accuracy": 0.19674378186464309, "num_tokens": 64971588.0, "step": 25635 }, { "entropy": 6.334738874435425, "epoch": 2.9590305828043855, "grad_norm": 0.99609375, "learning_rate": 0.0004142013321941685, "loss": 5.7271, "mean_token_accuracy": 0.1985373690724373, "num_tokens": 64984448.0, "step": 25640 }, { "entropy": 6.271935701370239, "epoch": 2.959607616849394, "grad_norm": 1.046875, "learning_rate": 0.00041416891055980347, "loss": 5.6657, "mean_token_accuracy": 0.2038862705230713, "num_tokens": 64996759.0, "step": 25645 }, { "entropy": 6.312621402740478, "epoch": 2.9601846508944027, "grad_norm": 1.0078125, "learning_rate": 0.00041413648424456134, "loss": 5.7138, "mean_token_accuracy": 0.20117763578891754, "num_tokens": 65009732.0, "step": 25650 }, { "entropy": 6.3216746807098385, "epoch": 2.9607616849394116, "grad_norm": 1.0546875, "learning_rate": 0.00041410405324953265, "loss": 5.731, "mean_token_accuracy": 0.19510290920734405, "num_tokens": 65021479.0, "step": 25655 }, { "entropy": 6.3738302230834964, "epoch": 2.96133871898442, "grad_norm": 0.98828125, "learning_rate": 0.0004140716175758082, "loss": 5.7174, "mean_token_accuracy": 0.20308305621147155, "num_tokens": 65034782.0, "step": 25660 }, { "entropy": 6.302497673034668, "epoch": 2.961915753029429, "grad_norm": 0.93359375, "learning_rate": 0.00041403917722447896, "loss": 5.7015, "mean_token_accuracy": 0.2005263790488243, "num_tokens": 65047427.0, "step": 25665 }, { "entropy": 6.295998573303223, "epoch": 2.9624927870744373, "grad_norm": 1.0078125, "learning_rate": 0.0004140067321966361, "loss": 5.6478, "mean_token_accuracy": 0.20671470314264298, "num_tokens": 65060867.0, "step": 25670 }, { "entropy": 6.283916234970093, "epoch": 2.963069821119446, "grad_norm": 1.0625, "learning_rate": 0.0004139742824933709, "loss": 5.5742, "mean_token_accuracy": 0.21723517775535583, "num_tokens": 65074394.0, "step": 25675 }, { "entropy": 6.178877544403076, "epoch": 2.9636468551644546, "grad_norm": 1.015625, "learning_rate": 0.0004139418281157747, "loss": 5.5702, "mean_token_accuracy": 0.2180158719420433, "num_tokens": 65088352.0, "step": 25680 }, { "entropy": 6.30589804649353, "epoch": 2.9642238892094634, "grad_norm": 0.97265625, "learning_rate": 0.0004139093690649391, "loss": 5.6499, "mean_token_accuracy": 0.20713800936937332, "num_tokens": 65101113.0, "step": 25685 }, { "entropy": 6.342813348770141, "epoch": 2.964800923254472, "grad_norm": 0.95703125, "learning_rate": 0.00041387690534195584, "loss": 5.6695, "mean_token_accuracy": 0.19723428189754486, "num_tokens": 65112894.0, "step": 25690 }, { "entropy": 6.289703464508056, "epoch": 2.9653779572994807, "grad_norm": 0.953125, "learning_rate": 0.0004138444369479169, "loss": 5.6817, "mean_token_accuracy": 0.19636846631765364, "num_tokens": 65125087.0, "step": 25695 }, { "entropy": 6.251219797134399, "epoch": 2.965954991344489, "grad_norm": 0.94140625, "learning_rate": 0.0004138119638839143, "loss": 5.6019, "mean_token_accuracy": 0.21457798779010773, "num_tokens": 65138345.0, "step": 25700 }, { "entropy": 6.319249820709229, "epoch": 2.966532025389498, "grad_norm": 1.015625, "learning_rate": 0.00041377948615104024, "loss": 5.6596, "mean_token_accuracy": 0.20217411518096923, "num_tokens": 65151337.0, "step": 25705 }, { "entropy": 6.196638488769532, "epoch": 2.967109059434507, "grad_norm": 1.09375, "learning_rate": 0.0004137470037503871, "loss": 5.5192, "mean_token_accuracy": 0.21449989527463914, "num_tokens": 65163061.0, "step": 25710 }, { "entropy": 6.283056449890137, "epoch": 2.9676860934795153, "grad_norm": 1.0, "learning_rate": 0.0004137145166830474, "loss": 5.6466, "mean_token_accuracy": 0.20333010107278823, "num_tokens": 65176358.0, "step": 25715 }, { "entropy": 6.308832359313965, "epoch": 2.9682631275245237, "grad_norm": 1.015625, "learning_rate": 0.0004136820249501139, "loss": 5.6641, "mean_token_accuracy": 0.20226604342460633, "num_tokens": 65188189.0, "step": 25720 }, { "entropy": 6.323771142959595, "epoch": 2.9688401615695326, "grad_norm": 1.078125, "learning_rate": 0.0004136495285526792, "loss": 5.6671, "mean_token_accuracy": 0.200624980032444, "num_tokens": 65200748.0, "step": 25725 }, { "entropy": 6.258511638641357, "epoch": 2.9694171956145414, "grad_norm": 0.9609375, "learning_rate": 0.00041361702749183663, "loss": 5.6335, "mean_token_accuracy": 0.21438468098640442, "num_tokens": 65212871.0, "step": 25730 }, { "entropy": 6.214915657043457, "epoch": 2.96999422965955, "grad_norm": 1.078125, "learning_rate": 0.0004135845217686791, "loss": 5.5867, "mean_token_accuracy": 0.2147510290145874, "num_tokens": 65224604.0, "step": 25735 }, { "entropy": 6.263328313827515, "epoch": 2.9705712637045587, "grad_norm": 1.0234375, "learning_rate": 0.0004135520113843001, "loss": 5.6254, "mean_token_accuracy": 0.207444928586483, "num_tokens": 65236757.0, "step": 25740 }, { "entropy": 6.29366135597229, "epoch": 2.971148297749567, "grad_norm": 1.0078125, "learning_rate": 0.000413519496339793, "loss": 5.616, "mean_token_accuracy": 0.20270009934902192, "num_tokens": 65250735.0, "step": 25745 }, { "entropy": 6.1594696044921875, "epoch": 2.971725331794576, "grad_norm": 0.9375, "learning_rate": 0.00041348697663625144, "loss": 5.5477, "mean_token_accuracy": 0.21594086289405823, "num_tokens": 65263543.0, "step": 25750 }, { "entropy": 6.2606017112731935, "epoch": 2.9723023658395844, "grad_norm": 1.0078125, "learning_rate": 0.0004134544522747692, "loss": 5.7098, "mean_token_accuracy": 0.20271752327680587, "num_tokens": 65275637.0, "step": 25755 }, { "entropy": 6.249564170837402, "epoch": 2.9728793998845933, "grad_norm": 1.046875, "learning_rate": 0.00041342192325644024, "loss": 5.5608, "mean_token_accuracy": 0.2182687610387802, "num_tokens": 65287564.0, "step": 25760 }, { "entropy": 6.243921279907227, "epoch": 2.9734564339296017, "grad_norm": 1.0390625, "learning_rate": 0.0004133893895823586, "loss": 5.6974, "mean_token_accuracy": 0.20399138182401658, "num_tokens": 65299255.0, "step": 25765 }, { "entropy": 6.371900606155395, "epoch": 2.9740334679746105, "grad_norm": 0.9765625, "learning_rate": 0.0004133568512536187, "loss": 5.6831, "mean_token_accuracy": 0.19976160824298858, "num_tokens": 65311749.0, "step": 25770 }, { "entropy": 6.259573650360108, "epoch": 2.974610502019619, "grad_norm": 1.0234375, "learning_rate": 0.00041332430827131474, "loss": 5.5949, "mean_token_accuracy": 0.21548307687044144, "num_tokens": 65325391.0, "step": 25775 }, { "entropy": 6.271563100814819, "epoch": 2.975187536064628, "grad_norm": 0.98828125, "learning_rate": 0.00041329176063654137, "loss": 5.7084, "mean_token_accuracy": 0.19745705425739288, "num_tokens": 65338640.0, "step": 25780 }, { "entropy": 6.2037018775939945, "epoch": 2.9757645701096367, "grad_norm": 1.0234375, "learning_rate": 0.00041325920835039344, "loss": 5.5242, "mean_token_accuracy": 0.2089156210422516, "num_tokens": 65351378.0, "step": 25785 }, { "entropy": 6.3744340419769285, "epoch": 2.976341604154645, "grad_norm": 0.92578125, "learning_rate": 0.0004132266514139656, "loss": 5.7382, "mean_token_accuracy": 0.19670574516057968, "num_tokens": 65364072.0, "step": 25790 }, { "entropy": 6.277193927764893, "epoch": 2.9769186381996535, "grad_norm": 1.0234375, "learning_rate": 0.00041319408982835306, "loss": 5.5956, "mean_token_accuracy": 0.21373799443244934, "num_tokens": 65377019.0, "step": 25795 }, { "entropy": 6.261798095703125, "epoch": 2.9774956722446624, "grad_norm": 0.9921875, "learning_rate": 0.00041316152359465087, "loss": 5.6108, "mean_token_accuracy": 0.20962859243154525, "num_tokens": 65390465.0, "step": 25800 }, { "entropy": 6.326480770111084, "epoch": 2.9780727062896712, "grad_norm": 1.0546875, "learning_rate": 0.00041312895271395457, "loss": 5.6323, "mean_token_accuracy": 0.2056095376610756, "num_tokens": 65402947.0, "step": 25805 }, { "entropy": 6.33512806892395, "epoch": 2.9786497403346797, "grad_norm": 0.99609375, "learning_rate": 0.0004130963771873595, "loss": 5.727, "mean_token_accuracy": 0.19411673098802568, "num_tokens": 65414725.0, "step": 25810 }, { "entropy": 6.308678102493286, "epoch": 2.9792267743796885, "grad_norm": 1.0703125, "learning_rate": 0.00041306379701596134, "loss": 5.5769, "mean_token_accuracy": 0.2155775710940361, "num_tokens": 65427417.0, "step": 25815 }, { "entropy": 6.197731161117554, "epoch": 2.979803808424697, "grad_norm": 1.0859375, "learning_rate": 0.00041303121220085607, "loss": 5.6034, "mean_token_accuracy": 0.21742600947618484, "num_tokens": 65440151.0, "step": 25820 }, { "entropy": 6.309122371673584, "epoch": 2.980380842469706, "grad_norm": 0.97265625, "learning_rate": 0.0004129986227431394, "loss": 5.6473, "mean_token_accuracy": 0.21159778088331221, "num_tokens": 65453774.0, "step": 25825 }, { "entropy": 6.33005108833313, "epoch": 2.9809578765147142, "grad_norm": 0.9140625, "learning_rate": 0.0004129660286439077, "loss": 5.7137, "mean_token_accuracy": 0.20314548164606094, "num_tokens": 65466523.0, "step": 25830 }, { "entropy": 6.357762384414673, "epoch": 2.981534910559723, "grad_norm": 1.1875, "learning_rate": 0.00041293342990425714, "loss": 5.7724, "mean_token_accuracy": 0.19125755578279496, "num_tokens": 65480728.0, "step": 25835 }, { "entropy": 6.277348613739013, "epoch": 2.982111944604732, "grad_norm": 0.953125, "learning_rate": 0.00041290082652528415, "loss": 5.7036, "mean_token_accuracy": 0.2025367572903633, "num_tokens": 65494086.0, "step": 25840 }, { "entropy": 6.253962755203247, "epoch": 2.9826889786497404, "grad_norm": 1.0078125, "learning_rate": 0.0004128682185080854, "loss": 5.5619, "mean_token_accuracy": 0.21577923148870468, "num_tokens": 65508079.0, "step": 25845 }, { "entropy": 6.286971712112427, "epoch": 2.983266012694749, "grad_norm": 0.875, "learning_rate": 0.0004128356058537576, "loss": 5.5966, "mean_token_accuracy": 0.21383341550827026, "num_tokens": 65523511.0, "step": 25850 }, { "entropy": 6.2471840381622314, "epoch": 2.9838430467397576, "grad_norm": 1.078125, "learning_rate": 0.00041280298856339763, "loss": 5.5598, "mean_token_accuracy": 0.20990967899560928, "num_tokens": 65535968.0, "step": 25855 }, { "entropy": 6.306111860275268, "epoch": 2.9844200807847665, "grad_norm": 1.09375, "learning_rate": 0.00041277036663810266, "loss": 5.6623, "mean_token_accuracy": 0.20458658933639526, "num_tokens": 65548009.0, "step": 25860 }, { "entropy": 6.325979709625244, "epoch": 2.984997114829775, "grad_norm": 1.0078125, "learning_rate": 0.00041273774007896983, "loss": 5.6071, "mean_token_accuracy": 0.2063138112425804, "num_tokens": 65561076.0, "step": 25865 }, { "entropy": 6.230418300628662, "epoch": 2.9855741488747833, "grad_norm": 0.97265625, "learning_rate": 0.0004127051088870964, "loss": 5.5067, "mean_token_accuracy": 0.22357941865921022, "num_tokens": 65573982.0, "step": 25870 }, { "entropy": 6.285738325119018, "epoch": 2.986151182919792, "grad_norm": 1.046875, "learning_rate": 0.0004126724730635801, "loss": 5.7223, "mean_token_accuracy": 0.20286625921726226, "num_tokens": 65585923.0, "step": 25875 }, { "entropy": 6.229119300842285, "epoch": 2.986728216964801, "grad_norm": 1.0625, "learning_rate": 0.00041263983260951857, "loss": 5.613, "mean_token_accuracy": 0.20859452039003373, "num_tokens": 65597366.0, "step": 25880 }, { "entropy": 6.340452051162719, "epoch": 2.9873052510098095, "grad_norm": 1.0703125, "learning_rate": 0.0004126071875260097, "loss": 5.7447, "mean_token_accuracy": 0.20515882223844528, "num_tokens": 65610200.0, "step": 25885 }, { "entropy": 6.298042058944702, "epoch": 2.9878822850548183, "grad_norm": 1.015625, "learning_rate": 0.0004125745378141513, "loss": 5.6547, "mean_token_accuracy": 0.20677776783704757, "num_tokens": 65623270.0, "step": 25890 }, { "entropy": 6.225648260116577, "epoch": 2.9884593190998268, "grad_norm": 1.015625, "learning_rate": 0.0004125418834750418, "loss": 5.5337, "mean_token_accuracy": 0.21896230131387712, "num_tokens": 65637443.0, "step": 25895 }, { "entropy": 6.337515020370484, "epoch": 2.9890363531448356, "grad_norm": 1.1875, "learning_rate": 0.0004125092245097793, "loss": 5.7285, "mean_token_accuracy": 0.19507541358470917, "num_tokens": 65650004.0, "step": 25900 }, { "entropy": 6.271553802490234, "epoch": 2.989613387189844, "grad_norm": 1.0234375, "learning_rate": 0.00041247656091946235, "loss": 5.6071, "mean_token_accuracy": 0.20877954214811326, "num_tokens": 65662832.0, "step": 25905 }, { "entropy": 6.280275058746338, "epoch": 2.990190421234853, "grad_norm": 0.95703125, "learning_rate": 0.0004124438927051895, "loss": 5.6657, "mean_token_accuracy": 0.20590980648994445, "num_tokens": 65675545.0, "step": 25910 }, { "entropy": 6.358057975769043, "epoch": 2.9907674552798618, "grad_norm": 1.0234375, "learning_rate": 0.0004124112198680597, "loss": 5.696, "mean_token_accuracy": 0.20087795704603195, "num_tokens": 65688194.0, "step": 25915 }, { "entropy": 6.3559104919433596, "epoch": 2.99134448932487, "grad_norm": 0.93359375, "learning_rate": 0.0004123785424091717, "loss": 5.7451, "mean_token_accuracy": 0.2025293454527855, "num_tokens": 65701410.0, "step": 25920 }, { "entropy": 6.331898546218872, "epoch": 2.9919215233698786, "grad_norm": 0.9609375, "learning_rate": 0.0004123458603296247, "loss": 5.7145, "mean_token_accuracy": 0.20038911402225495, "num_tokens": 65714540.0, "step": 25925 }, { "entropy": 6.301794004440308, "epoch": 2.9924985574148875, "grad_norm": 0.95703125, "learning_rate": 0.0004123131736305178, "loss": 5.7115, "mean_token_accuracy": 0.20683306753635405, "num_tokens": 65727774.0, "step": 25930 }, { "entropy": 6.301877212524414, "epoch": 2.9930755914598963, "grad_norm": 1.0625, "learning_rate": 0.0004122804823129507, "loss": 5.7429, "mean_token_accuracy": 0.19962307214736938, "num_tokens": 65740040.0, "step": 25935 }, { "entropy": 6.346859502792358, "epoch": 2.9936526255049047, "grad_norm": 1.1171875, "learning_rate": 0.0004122477863780227, "loss": 5.7342, "mean_token_accuracy": 0.1995064437389374, "num_tokens": 65751188.0, "step": 25940 }, { "entropy": 6.332697916030884, "epoch": 2.9942296595499136, "grad_norm": 1.0234375, "learning_rate": 0.0004122150858268335, "loss": 5.6977, "mean_token_accuracy": 0.2011364296078682, "num_tokens": 65762960.0, "step": 25945 }, { "entropy": 6.383401489257812, "epoch": 2.994806693594922, "grad_norm": 1.0390625, "learning_rate": 0.00041218238066048315, "loss": 5.7226, "mean_token_accuracy": 0.20306685119867324, "num_tokens": 65775069.0, "step": 25950 }, { "entropy": 6.3422754287719725, "epoch": 2.995383727639931, "grad_norm": 1.0, "learning_rate": 0.0004121496708800715, "loss": 5.7434, "mean_token_accuracy": 0.19918805807828904, "num_tokens": 65788181.0, "step": 25955 }, { "entropy": 6.243724536895752, "epoch": 2.9959607616849393, "grad_norm": 0.94140625, "learning_rate": 0.00041211695648669884, "loss": 5.5917, "mean_token_accuracy": 0.22524938136339187, "num_tokens": 65801038.0, "step": 25960 }, { "entropy": 6.262827444076538, "epoch": 2.996537795729948, "grad_norm": 0.97265625, "learning_rate": 0.0004120842374814654, "loss": 5.5981, "mean_token_accuracy": 0.21240645796060562, "num_tokens": 65813631.0, "step": 25965 }, { "entropy": 6.334351873397827, "epoch": 2.9971148297749566, "grad_norm": 1.0234375, "learning_rate": 0.00041205151386547174, "loss": 5.6898, "mean_token_accuracy": 0.20400844365358353, "num_tokens": 65825345.0, "step": 25970 }, { "entropy": 6.307204008102417, "epoch": 2.9976918638199654, "grad_norm": 1.078125, "learning_rate": 0.00041201878563981855, "loss": 5.6407, "mean_token_accuracy": 0.21226872205734254, "num_tokens": 65837144.0, "step": 25975 }, { "entropy": 6.175499200820923, "epoch": 2.998268897864974, "grad_norm": 1.0546875, "learning_rate": 0.00041198605280560655, "loss": 5.604, "mean_token_accuracy": 0.21598082184791564, "num_tokens": 65850458.0, "step": 25980 }, { "entropy": 6.375832653045654, "epoch": 2.9988459319099827, "grad_norm": 0.95703125, "learning_rate": 0.0004119533153639367, "loss": 5.7134, "mean_token_accuracy": 0.20451305508613588, "num_tokens": 65863659.0, "step": 25985 }, { "entropy": 6.256896257400513, "epoch": 2.9994229659549916, "grad_norm": 1.03125, "learning_rate": 0.00041192057331591, "loss": 5.6304, "mean_token_accuracy": 0.20684415698051453, "num_tokens": 65877129.0, "step": 25990 }, { "entropy": 6.334898900985718, "epoch": 3.0, "grad_norm": 1.0625, "learning_rate": 0.000411887826662628, "loss": 5.7223, "mean_token_accuracy": 0.20037208050489425, "num_tokens": 65889351.0, "step": 25995 }, { "entropy": 6.271771049499511, "epoch": 3.000577034045009, "grad_norm": 0.95703125, "learning_rate": 0.0004118550754051919, "loss": 5.6075, "mean_token_accuracy": 0.21018291264772415, "num_tokens": 65901967.0, "step": 26000 }, { "entropy": 6.188441038131714, "epoch": 3.0011540680900173, "grad_norm": 0.953125, "learning_rate": 0.0004118223195447033, "loss": 5.464, "mean_token_accuracy": 0.2211235821247101, "num_tokens": 65915259.0, "step": 26005 }, { "entropy": 6.269023323059082, "epoch": 3.001731102135026, "grad_norm": 1.015625, "learning_rate": 0.00041178955908226396, "loss": 5.6069, "mean_token_accuracy": 0.20748948007822038, "num_tokens": 65928236.0, "step": 26010 }, { "entropy": 6.28645429611206, "epoch": 3.0023081361800346, "grad_norm": 1.09375, "learning_rate": 0.0004117567940189757, "loss": 5.6014, "mean_token_accuracy": 0.2083831548690796, "num_tokens": 65941290.0, "step": 26015 }, { "entropy": 6.303457403182984, "epoch": 3.0028851702250434, "grad_norm": 0.94140625, "learning_rate": 0.0004117240243559406, "loss": 5.6672, "mean_token_accuracy": 0.19726393669843673, "num_tokens": 65954301.0, "step": 26020 }, { "entropy": 6.314698886871338, "epoch": 3.003462204270052, "grad_norm": 0.9765625, "learning_rate": 0.0004116912500942609, "loss": 5.6589, "mean_token_accuracy": 0.20999360233545303, "num_tokens": 65966406.0, "step": 26025 }, { "entropy": 6.204772567749023, "epoch": 3.0040392383150607, "grad_norm": 1.1015625, "learning_rate": 0.0004116584712350389, "loss": 5.5635, "mean_token_accuracy": 0.2126577839255333, "num_tokens": 65979177.0, "step": 26030 }, { "entropy": 6.220018148422241, "epoch": 3.004616272360069, "grad_norm": 0.96875, "learning_rate": 0.0004116256877793771, "loss": 5.5343, "mean_token_accuracy": 0.21496824771165848, "num_tokens": 65992326.0, "step": 26035 }, { "entropy": 6.352341747283935, "epoch": 3.005193306405078, "grad_norm": 1.0546875, "learning_rate": 0.00041159289972837813, "loss": 5.6209, "mean_token_accuracy": 0.20606656223535538, "num_tokens": 66003481.0, "step": 26040 }, { "entropy": 6.354292726516723, "epoch": 3.0057703404500864, "grad_norm": 0.96875, "learning_rate": 0.00041156010708314487, "loss": 5.6809, "mean_token_accuracy": 0.19980886876583098, "num_tokens": 66015552.0, "step": 26045 }, { "entropy": 6.340355634689331, "epoch": 3.0063473744950953, "grad_norm": 1.0390625, "learning_rate": 0.0004115273098447802, "loss": 5.6062, "mean_token_accuracy": 0.210785011947155, "num_tokens": 66028506.0, "step": 26050 }, { "entropy": 6.2917341709136965, "epoch": 3.0069244085401037, "grad_norm": 1.046875, "learning_rate": 0.00041149450801438727, "loss": 5.5796, "mean_token_accuracy": 0.20746909976005554, "num_tokens": 66040938.0, "step": 26055 }, { "entropy": 6.222816085815429, "epoch": 3.0075014425851125, "grad_norm": 1.015625, "learning_rate": 0.00041146170159306946, "loss": 5.5247, "mean_token_accuracy": 0.20411389768123628, "num_tokens": 66052838.0, "step": 26060 }, { "entropy": 6.2691624641418455, "epoch": 3.008078476630121, "grad_norm": 1.03125, "learning_rate": 0.00041142889058193, "loss": 5.586, "mean_token_accuracy": 0.21158916205167771, "num_tokens": 66065286.0, "step": 26065 }, { "entropy": 6.31137113571167, "epoch": 3.00865551067513, "grad_norm": 1.0078125, "learning_rate": 0.00041139607498207265, "loss": 5.6282, "mean_token_accuracy": 0.20725145787000657, "num_tokens": 66077174.0, "step": 26070 }, { "entropy": 6.289990091323853, "epoch": 3.0092325447201387, "grad_norm": 1.0078125, "learning_rate": 0.000411363254794601, "loss": 5.6711, "mean_token_accuracy": 0.21055749356746672, "num_tokens": 66092510.0, "step": 26075 }, { "entropy": 6.314852380752564, "epoch": 3.009809578765147, "grad_norm": 1.0078125, "learning_rate": 0.000411330430020619, "loss": 5.6052, "mean_token_accuracy": 0.21417870968580247, "num_tokens": 66105001.0, "step": 26080 }, { "entropy": 6.306997489929199, "epoch": 3.010386612810156, "grad_norm": 1.0703125, "learning_rate": 0.0004112976006612308, "loss": 5.6054, "mean_token_accuracy": 0.21196512877941132, "num_tokens": 66117264.0, "step": 26085 }, { "entropy": 6.278022289276123, "epoch": 3.0109636468551644, "grad_norm": 0.94921875, "learning_rate": 0.00041126476671754037, "loss": 5.6256, "mean_token_accuracy": 0.2071828290820122, "num_tokens": 66130954.0, "step": 26090 }, { "entropy": 6.288168048858642, "epoch": 3.0115406809001732, "grad_norm": 1.0703125, "learning_rate": 0.00041123192819065234, "loss": 5.627, "mean_token_accuracy": 0.20207304805517196, "num_tokens": 66143560.0, "step": 26095 }, { "entropy": 6.335284614562989, "epoch": 3.0121177149451817, "grad_norm": 0.97265625, "learning_rate": 0.000411199085081671, "loss": 5.656, "mean_token_accuracy": 0.20828541815280915, "num_tokens": 66157169.0, "step": 26100 }, { "entropy": 6.280328464508057, "epoch": 3.0126947489901905, "grad_norm": 0.95703125, "learning_rate": 0.00041116623739170105, "loss": 5.6095, "mean_token_accuracy": 0.205639611184597, "num_tokens": 66171331.0, "step": 26105 }, { "entropy": 6.316393756866455, "epoch": 3.013271783035199, "grad_norm": 1.0, "learning_rate": 0.0004111333851218474, "loss": 5.6404, "mean_token_accuracy": 0.21143314093351365, "num_tokens": 66184428.0, "step": 26110 }, { "entropy": 6.345386552810669, "epoch": 3.013848817080208, "grad_norm": 1.078125, "learning_rate": 0.00041110052827321496, "loss": 5.6107, "mean_token_accuracy": 0.21014196425676346, "num_tokens": 66196602.0, "step": 26115 }, { "entropy": 6.215306949615479, "epoch": 3.014425851125216, "grad_norm": 1.0859375, "learning_rate": 0.00041106766684690884, "loss": 5.5403, "mean_token_accuracy": 0.21772221177816392, "num_tokens": 66209603.0, "step": 26120 }, { "entropy": 6.288187837600708, "epoch": 3.015002885170225, "grad_norm": 1.09375, "learning_rate": 0.0004110348008440344, "loss": 5.6307, "mean_token_accuracy": 0.20573665350675582, "num_tokens": 66221587.0, "step": 26125 }, { "entropy": 6.375280523300171, "epoch": 3.0155799192152335, "grad_norm": 1.0625, "learning_rate": 0.00041100193026569686, "loss": 5.6975, "mean_token_accuracy": 0.1963917374610901, "num_tokens": 66233243.0, "step": 26130 }, { "entropy": 6.293908357620239, "epoch": 3.0161569532602424, "grad_norm": 0.9921875, "learning_rate": 0.00041096905511300207, "loss": 5.6049, "mean_token_accuracy": 0.21014516949653625, "num_tokens": 66245831.0, "step": 26135 }, { "entropy": 6.352449607849121, "epoch": 3.016733987305251, "grad_norm": 0.95703125, "learning_rate": 0.0004109361753870556, "loss": 5.6453, "mean_token_accuracy": 0.2042999804019928, "num_tokens": 66259113.0, "step": 26140 }, { "entropy": 6.218417072296143, "epoch": 3.0173110213502596, "grad_norm": 1.03125, "learning_rate": 0.0004109032910889635, "loss": 5.5424, "mean_token_accuracy": 0.21769150197505951, "num_tokens": 66272633.0, "step": 26145 }, { "entropy": 6.342810106277466, "epoch": 3.0178880553952685, "grad_norm": 1.0078125, "learning_rate": 0.0004108704022198316, "loss": 5.5805, "mean_token_accuracy": 0.21097620725631713, "num_tokens": 66286100.0, "step": 26150 }, { "entropy": 6.256284618377686, "epoch": 3.018465089440277, "grad_norm": 1.0859375, "learning_rate": 0.00041083750878076627, "loss": 5.5414, "mean_token_accuracy": 0.20592065453529357, "num_tokens": 66297623.0, "step": 26155 }, { "entropy": 6.229187631607056, "epoch": 3.0190421234852858, "grad_norm": 1.015625, "learning_rate": 0.0004108046107728737, "loss": 5.5722, "mean_token_accuracy": 0.21466021686792375, "num_tokens": 66311688.0, "step": 26160 }, { "entropy": 6.313253021240234, "epoch": 3.019619157530294, "grad_norm": 1.015625, "learning_rate": 0.00041077170819726064, "loss": 5.6218, "mean_token_accuracy": 0.20113654881715776, "num_tokens": 66324317.0, "step": 26165 }, { "entropy": 6.279792308807373, "epoch": 3.020196191575303, "grad_norm": 1.015625, "learning_rate": 0.00041073880105503346, "loss": 5.5815, "mean_token_accuracy": 0.20794297754764557, "num_tokens": 66337152.0, "step": 26170 }, { "entropy": 6.423946714401245, "epoch": 3.0207732256203115, "grad_norm": 1.015625, "learning_rate": 0.00041070588934729923, "loss": 5.7063, "mean_token_accuracy": 0.20094469487667083, "num_tokens": 66349043.0, "step": 26175 }, { "entropy": 6.203110790252685, "epoch": 3.0213502596653203, "grad_norm": 1.0078125, "learning_rate": 0.0004106729730751649, "loss": 5.505, "mean_token_accuracy": 0.22535888403654097, "num_tokens": 66362283.0, "step": 26180 }, { "entropy": 6.199810600280761, "epoch": 3.0219272937103288, "grad_norm": 0.91796875, "learning_rate": 0.00041064005223973737, "loss": 5.4623, "mean_token_accuracy": 0.22339493036270142, "num_tokens": 66376919.0, "step": 26185 }, { "entropy": 6.195854759216308, "epoch": 3.0225043277553376, "grad_norm": 1.0234375, "learning_rate": 0.0004106071268421241, "loss": 5.5036, "mean_token_accuracy": 0.22148491740226744, "num_tokens": 66389285.0, "step": 26190 }, { "entropy": 6.286485004425049, "epoch": 3.023081361800346, "grad_norm": 1.046875, "learning_rate": 0.00041057419688343255, "loss": 5.6512, "mean_token_accuracy": 0.21040226370096207, "num_tokens": 66402196.0, "step": 26195 }, { "entropy": 6.196857213973999, "epoch": 3.023658395845355, "grad_norm": 1.0703125, "learning_rate": 0.0004105412623647702, "loss": 5.5168, "mean_token_accuracy": 0.21355133205652238, "num_tokens": 66414334.0, "step": 26200 }, { "entropy": 6.311949443817139, "epoch": 3.0242354298903633, "grad_norm": 1.1015625, "learning_rate": 0.00041050832328724476, "loss": 5.6612, "mean_token_accuracy": 0.2038459986448288, "num_tokens": 66425975.0, "step": 26205 }, { "entropy": 6.208622121810913, "epoch": 3.024812463935372, "grad_norm": 1.1796875, "learning_rate": 0.0004104753796519642, "loss": 5.5072, "mean_token_accuracy": 0.21797531247138976, "num_tokens": 66438841.0, "step": 26210 }, { "entropy": 6.357542991638184, "epoch": 3.025389497980381, "grad_norm": 0.96484375, "learning_rate": 0.0004104424314600365, "loss": 5.6308, "mean_token_accuracy": 0.20647292733192443, "num_tokens": 66451100.0, "step": 26215 }, { "entropy": 6.294093465805053, "epoch": 3.0259665320253895, "grad_norm": 1.0625, "learning_rate": 0.00041040947871257, "loss": 5.5965, "mean_token_accuracy": 0.21580876111984254, "num_tokens": 66463613.0, "step": 26220 }, { "entropy": 6.261159944534302, "epoch": 3.0265435660703983, "grad_norm": 1.015625, "learning_rate": 0.00041037652141067294, "loss": 5.5677, "mean_token_accuracy": 0.21328930258750917, "num_tokens": 66476676.0, "step": 26225 }, { "entropy": 6.365573835372925, "epoch": 3.0271206001154067, "grad_norm": 1.0234375, "learning_rate": 0.00041034355955545375, "loss": 5.6351, "mean_token_accuracy": 0.20695917308330536, "num_tokens": 66489577.0, "step": 26230 }, { "entropy": 6.325640869140625, "epoch": 3.0276976341604156, "grad_norm": 1.0234375, "learning_rate": 0.00041031059314802114, "loss": 5.6073, "mean_token_accuracy": 0.20309820920228958, "num_tokens": 66500732.0, "step": 26235 }, { "entropy": 6.200937271118164, "epoch": 3.028274668205424, "grad_norm": 1.078125, "learning_rate": 0.00041027762218948403, "loss": 5.5563, "mean_token_accuracy": 0.22017048746347428, "num_tokens": 66512342.0, "step": 26240 }, { "entropy": 6.231833362579346, "epoch": 3.028851702250433, "grad_norm": 0.99609375, "learning_rate": 0.00041024464668095123, "loss": 5.614, "mean_token_accuracy": 0.20844051688909532, "num_tokens": 66526042.0, "step": 26245 }, { "entropy": 6.313551187515259, "epoch": 3.0294287362954413, "grad_norm": 1.0625, "learning_rate": 0.000410211666623532, "loss": 5.5879, "mean_token_accuracy": 0.20504943877458573, "num_tokens": 66537995.0, "step": 26250 }, { "entropy": 6.3144855976104735, "epoch": 3.03000577034045, "grad_norm": 1.0078125, "learning_rate": 0.00041017868201833545, "loss": 5.6817, "mean_token_accuracy": 0.20526231080293655, "num_tokens": 66550684.0, "step": 26255 }, { "entropy": 6.275561714172364, "epoch": 3.0305828043854586, "grad_norm": 1.0625, "learning_rate": 0.0004101456928664711, "loss": 5.5671, "mean_token_accuracy": 0.2107621967792511, "num_tokens": 66563940.0, "step": 26260 }, { "entropy": 6.23382248878479, "epoch": 3.0311598384304674, "grad_norm": 1.0703125, "learning_rate": 0.0004101126991690485, "loss": 5.554, "mean_token_accuracy": 0.21120525449514388, "num_tokens": 66577411.0, "step": 26265 }, { "entropy": 6.281537055969238, "epoch": 3.031736872475476, "grad_norm": 0.99609375, "learning_rate": 0.0004100797009271774, "loss": 5.6648, "mean_token_accuracy": 0.20595156401395798, "num_tokens": 66589520.0, "step": 26270 }, { "entropy": 6.294972276687622, "epoch": 3.0323139065204847, "grad_norm": 0.99609375, "learning_rate": 0.0004100466981419676, "loss": 5.6161, "mean_token_accuracy": 0.20933601260185242, "num_tokens": 66602573.0, "step": 26275 }, { "entropy": 6.2128125667572025, "epoch": 3.0328909405654936, "grad_norm": 1.0, "learning_rate": 0.00041001369081452926, "loss": 5.4939, "mean_token_accuracy": 0.2178487792611122, "num_tokens": 66614739.0, "step": 26280 }, { "entropy": 6.293660640716553, "epoch": 3.033467974610502, "grad_norm": 0.9453125, "learning_rate": 0.00040998067894597247, "loss": 5.6798, "mean_token_accuracy": 0.20268747359514236, "num_tokens": 66628635.0, "step": 26285 }, { "entropy": 6.37081732749939, "epoch": 3.034045008655511, "grad_norm": 1.015625, "learning_rate": 0.00040994766253740756, "loss": 5.6974, "mean_token_accuracy": 0.20565842539072038, "num_tokens": 66640911.0, "step": 26290 }, { "entropy": 6.231580066680908, "epoch": 3.0346220427005193, "grad_norm": 0.86328125, "learning_rate": 0.00040991464158994506, "loss": 5.4611, "mean_token_accuracy": 0.2243095114827156, "num_tokens": 66654150.0, "step": 26295 }, { "entropy": 6.268218088150024, "epoch": 3.035199076745528, "grad_norm": 1.0546875, "learning_rate": 0.0004098816161046956, "loss": 5.6428, "mean_token_accuracy": 0.20836785584688186, "num_tokens": 66666026.0, "step": 26300 }, { "entropy": 6.2532610416412355, "epoch": 3.0357761107905366, "grad_norm": 1.09375, "learning_rate": 0.00040984858608277, "loss": 5.5198, "mean_token_accuracy": 0.2120579108595848, "num_tokens": 66679446.0, "step": 26305 }, { "entropy": 6.339039707183838, "epoch": 3.0363531448355454, "grad_norm": 1.015625, "learning_rate": 0.0004098155515252793, "loss": 5.6883, "mean_token_accuracy": 0.20390957444906235, "num_tokens": 66692689.0, "step": 26310 }, { "entropy": 6.286600780487061, "epoch": 3.036930178880554, "grad_norm": 1.015625, "learning_rate": 0.0004097825124333343, "loss": 5.5079, "mean_token_accuracy": 0.21896414160728456, "num_tokens": 66705765.0, "step": 26315 }, { "entropy": 6.240317153930664, "epoch": 3.0375072129255627, "grad_norm": 1.1171875, "learning_rate": 0.0004097494688080466, "loss": 5.5589, "mean_token_accuracy": 0.21114757806062698, "num_tokens": 66718856.0, "step": 26320 }, { "entropy": 6.284965229034424, "epoch": 3.038084246970571, "grad_norm": 1.0, "learning_rate": 0.00040971642065052734, "loss": 5.6203, "mean_token_accuracy": 0.2039854884147644, "num_tokens": 66731330.0, "step": 26325 }, { "entropy": 6.29327278137207, "epoch": 3.03866128101558, "grad_norm": 0.96875, "learning_rate": 0.0004096833679618882, "loss": 5.632, "mean_token_accuracy": 0.20642514377832413, "num_tokens": 66743676.0, "step": 26330 }, { "entropy": 6.262419843673706, "epoch": 3.0392383150605884, "grad_norm": 1.046875, "learning_rate": 0.00040965031074324094, "loss": 5.5404, "mean_token_accuracy": 0.2147010639309883, "num_tokens": 66757663.0, "step": 26335 }, { "entropy": 6.248820018768311, "epoch": 3.0398153491055973, "grad_norm": 1.0234375, "learning_rate": 0.0004096172489956973, "loss": 5.5863, "mean_token_accuracy": 0.2091632679104805, "num_tokens": 66770149.0, "step": 26340 }, { "entropy": 6.297977876663208, "epoch": 3.0403923831506057, "grad_norm": 0.99609375, "learning_rate": 0.0004095841827203694, "loss": 5.5757, "mean_token_accuracy": 0.20999882072210313, "num_tokens": 66781754.0, "step": 26345 }, { "entropy": 6.172789239883423, "epoch": 3.0409694171956145, "grad_norm": 1.109375, "learning_rate": 0.0004095511119183693, "loss": 5.4202, "mean_token_accuracy": 0.22781498581171036, "num_tokens": 66795213.0, "step": 26350 }, { "entropy": 6.293553447723388, "epoch": 3.0415464512406234, "grad_norm": 0.96484375, "learning_rate": 0.0004095180365908094, "loss": 5.6169, "mean_token_accuracy": 0.20672335475683212, "num_tokens": 66808514.0, "step": 26355 }, { "entropy": 6.148056077957153, "epoch": 3.042123485285632, "grad_norm": 1.0390625, "learning_rate": 0.0004094849567388022, "loss": 5.4267, "mean_token_accuracy": 0.22933701276779175, "num_tokens": 66821665.0, "step": 26360 }, { "entropy": 6.275964403152466, "epoch": 3.0427005193306407, "grad_norm": 0.98046875, "learning_rate": 0.0004094518723634603, "loss": 5.6099, "mean_token_accuracy": 0.2027961641550064, "num_tokens": 66834447.0, "step": 26365 }, { "entropy": 6.287026834487915, "epoch": 3.043277553375649, "grad_norm": 1.015625, "learning_rate": 0.0004094187834658964, "loss": 5.6531, "mean_token_accuracy": 0.20614831596612931, "num_tokens": 66846199.0, "step": 26370 }, { "entropy": 6.291844654083252, "epoch": 3.043854587420658, "grad_norm": 0.98046875, "learning_rate": 0.0004093856900472236, "loss": 5.6191, "mean_token_accuracy": 0.20398256033658982, "num_tokens": 66858055.0, "step": 26375 }, { "entropy": 6.345899248123169, "epoch": 3.0444316214656664, "grad_norm": 0.9609375, "learning_rate": 0.00040935259210855477, "loss": 5.5941, "mean_token_accuracy": 0.20623804926872252, "num_tokens": 66870779.0, "step": 26380 }, { "entropy": 6.267033910751342, "epoch": 3.0450086555106752, "grad_norm": 0.90625, "learning_rate": 0.0004093194896510033, "loss": 5.5972, "mean_token_accuracy": 0.21205492466688156, "num_tokens": 66883212.0, "step": 26385 }, { "entropy": 6.217557621002197, "epoch": 3.0455856895556837, "grad_norm": 0.98046875, "learning_rate": 0.00040928638267568245, "loss": 5.5152, "mean_token_accuracy": 0.22204977720975877, "num_tokens": 66897019.0, "step": 26390 }, { "entropy": 6.2959636688232425, "epoch": 3.0461627236006925, "grad_norm": 1.078125, "learning_rate": 0.00040925327118370586, "loss": 5.6428, "mean_token_accuracy": 0.20535663962364198, "num_tokens": 66909415.0, "step": 26395 }, { "entropy": 6.288059043884277, "epoch": 3.046739757645701, "grad_norm": 1.0625, "learning_rate": 0.00040922015517618724, "loss": 5.6221, "mean_token_accuracy": 0.2076485812664032, "num_tokens": 66921459.0, "step": 26400 }, { "entropy": 6.290098094940186, "epoch": 3.04731679169071, "grad_norm": 1.015625, "learning_rate": 0.0004091870346542403, "loss": 5.5152, "mean_token_accuracy": 0.2207404688000679, "num_tokens": 66933558.0, "step": 26405 }, { "entropy": 6.257703018188477, "epoch": 3.047893825735718, "grad_norm": 0.9609375, "learning_rate": 0.0004091539096189791, "loss": 5.6355, "mean_token_accuracy": 0.21042755246162415, "num_tokens": 66945950.0, "step": 26410 }, { "entropy": 6.250019454956055, "epoch": 3.048470859780727, "grad_norm": 1.03125, "learning_rate": 0.00040912078007151776, "loss": 5.561, "mean_token_accuracy": 0.21184205114841462, "num_tokens": 66958848.0, "step": 26415 }, { "entropy": 6.262427711486817, "epoch": 3.049047893825736, "grad_norm": 1.0546875, "learning_rate": 0.00040908764601297064, "loss": 5.5064, "mean_token_accuracy": 0.21647935807704927, "num_tokens": 66970302.0, "step": 26420 }, { "entropy": 6.299281120300293, "epoch": 3.0496249278707444, "grad_norm": 1.078125, "learning_rate": 0.0004090545074444522, "loss": 5.6113, "mean_token_accuracy": 0.20946595668792725, "num_tokens": 66984465.0, "step": 26425 }, { "entropy": 6.260265302658081, "epoch": 3.050201961915753, "grad_norm": 1.0546875, "learning_rate": 0.00040902136436707696, "loss": 5.5605, "mean_token_accuracy": 0.21218328326940536, "num_tokens": 66995555.0, "step": 26430 }, { "entropy": 6.292082214355469, "epoch": 3.0507789959607616, "grad_norm": 1.0546875, "learning_rate": 0.0004089882167819596, "loss": 5.6152, "mean_token_accuracy": 0.20912145376205443, "num_tokens": 67007823.0, "step": 26435 }, { "entropy": 6.278995847702026, "epoch": 3.0513560300057705, "grad_norm": 1.2109375, "learning_rate": 0.0004089550646902153, "loss": 5.5621, "mean_token_accuracy": 0.21164837777614592, "num_tokens": 67019963.0, "step": 26440 }, { "entropy": 6.138621997833252, "epoch": 3.051933064050779, "grad_norm": 1.046875, "learning_rate": 0.00040892190809295876, "loss": 5.4154, "mean_token_accuracy": 0.22769575715065002, "num_tokens": 67032721.0, "step": 26445 }, { "entropy": 6.309451580047607, "epoch": 3.0525100980957878, "grad_norm": 0.9765625, "learning_rate": 0.0004088887469913055, "loss": 5.5475, "mean_token_accuracy": 0.2151325225830078, "num_tokens": 67046713.0, "step": 26450 }, { "entropy": 6.318570518493653, "epoch": 3.053087132140796, "grad_norm": 1.0390625, "learning_rate": 0.0004088555813863707, "loss": 5.6684, "mean_token_accuracy": 0.19995037466287613, "num_tokens": 67059874.0, "step": 26455 }, { "entropy": 6.310893869400024, "epoch": 3.053664166185805, "grad_norm": 1.0390625, "learning_rate": 0.0004088224112792699, "loss": 5.6293, "mean_token_accuracy": 0.20947664827108384, "num_tokens": 67071897.0, "step": 26460 }, { "entropy": 6.197533702850341, "epoch": 3.0542412002308135, "grad_norm": 1.0, "learning_rate": 0.00040878923667111874, "loss": 5.5167, "mean_token_accuracy": 0.21583057790994645, "num_tokens": 67084489.0, "step": 26465 }, { "entropy": 6.289182519912719, "epoch": 3.0548182342758223, "grad_norm": 1.046875, "learning_rate": 0.00040875605756303314, "loss": 5.6302, "mean_token_accuracy": 0.2038386955857277, "num_tokens": 67095812.0, "step": 26470 }, { "entropy": 6.270604801177979, "epoch": 3.0553952683208307, "grad_norm": 1.0234375, "learning_rate": 0.0004087228739561289, "loss": 5.5218, "mean_token_accuracy": 0.21248275339603423, "num_tokens": 67108551.0, "step": 26475 }, { "entropy": 6.2919573307037355, "epoch": 3.0559723023658396, "grad_norm": 0.984375, "learning_rate": 0.0004086896858515223, "loss": 5.5931, "mean_token_accuracy": 0.20523792058229445, "num_tokens": 67120887.0, "step": 26480 }, { "entropy": 6.257938718795776, "epoch": 3.056549336410848, "grad_norm": 1.0234375, "learning_rate": 0.0004086564932503294, "loss": 5.56, "mean_token_accuracy": 0.21586377322673797, "num_tokens": 67133758.0, "step": 26485 }, { "entropy": 6.247624731063842, "epoch": 3.057126370455857, "grad_norm": 1.015625, "learning_rate": 0.0004086232961536669, "loss": 5.5366, "mean_token_accuracy": 0.21546427309513091, "num_tokens": 67145880.0, "step": 26490 }, { "entropy": 6.314199209213257, "epoch": 3.0577034045008658, "grad_norm": 1.0703125, "learning_rate": 0.00040859009456265113, "loss": 5.5745, "mean_token_accuracy": 0.21231828331947328, "num_tokens": 67158104.0, "step": 26495 }, { "entropy": 6.342816638946533, "epoch": 3.058280438545874, "grad_norm": 1.0625, "learning_rate": 0.00040855688847839884, "loss": 5.6298, "mean_token_accuracy": 0.20446190536022185, "num_tokens": 67170179.0, "step": 26500 }, { "entropy": 6.318542051315307, "epoch": 3.058857472590883, "grad_norm": 1.0078125, "learning_rate": 0.00040852367790202693, "loss": 5.691, "mean_token_accuracy": 0.20332907289266586, "num_tokens": 67182318.0, "step": 26505 }, { "entropy": 6.346238660812378, "epoch": 3.0594345066358914, "grad_norm": 1.0703125, "learning_rate": 0.0004084904628346525, "loss": 5.6676, "mean_token_accuracy": 0.20278288275003434, "num_tokens": 67195302.0, "step": 26510 }, { "entropy": 6.3941949844360355, "epoch": 3.0600115406809003, "grad_norm": 1.1171875, "learning_rate": 0.00040845724327739273, "loss": 5.6493, "mean_token_accuracy": 0.20670333951711656, "num_tokens": 67208191.0, "step": 26515 }, { "entropy": 6.22595796585083, "epoch": 3.0605885747259087, "grad_norm": 1.03125, "learning_rate": 0.00040842401923136477, "loss": 5.5638, "mean_token_accuracy": 0.21933917701244354, "num_tokens": 67221410.0, "step": 26520 }, { "entropy": 6.236261510848999, "epoch": 3.0611656087709176, "grad_norm": 1.0234375, "learning_rate": 0.00040839079069768627, "loss": 5.6017, "mean_token_accuracy": 0.2151765674352646, "num_tokens": 67233958.0, "step": 26525 }, { "entropy": 6.229293346405029, "epoch": 3.061742642815926, "grad_norm": 1.015625, "learning_rate": 0.0004083575576774747, "loss": 5.5625, "mean_token_accuracy": 0.21519405394792557, "num_tokens": 67246622.0, "step": 26530 }, { "entropy": 6.298185157775879, "epoch": 3.062319676860935, "grad_norm": 1.2265625, "learning_rate": 0.00040832432017184797, "loss": 5.61, "mean_token_accuracy": 0.2117377355694771, "num_tokens": 67258942.0, "step": 26535 }, { "entropy": 6.313986682891846, "epoch": 3.0628967109059433, "grad_norm": 1.03125, "learning_rate": 0.000408291078181924, "loss": 5.6135, "mean_token_accuracy": 0.20603590309619904, "num_tokens": 67271094.0, "step": 26540 }, { "entropy": 6.258365535736084, "epoch": 3.063473744950952, "grad_norm": 1.046875, "learning_rate": 0.00040825783170882077, "loss": 5.5953, "mean_token_accuracy": 0.20930705666542054, "num_tokens": 67284715.0, "step": 26545 }, { "entropy": 6.335294961929321, "epoch": 3.0640507789959606, "grad_norm": 1.0546875, "learning_rate": 0.00040822458075365654, "loss": 5.5996, "mean_token_accuracy": 0.20791435539722442, "num_tokens": 67298096.0, "step": 26550 }, { "entropy": 6.255341958999634, "epoch": 3.0646278130409694, "grad_norm": 1.03125, "learning_rate": 0.0004081913253175498, "loss": 5.5707, "mean_token_accuracy": 0.20443811863660813, "num_tokens": 67310548.0, "step": 26555 }, { "entropy": 6.287162160873413, "epoch": 3.065204847085978, "grad_norm": 1.0546875, "learning_rate": 0.00040815806540161895, "loss": 5.5859, "mean_token_accuracy": 0.20791420638561248, "num_tokens": 67322771.0, "step": 26560 }, { "entropy": 6.215455961227417, "epoch": 3.0657818811309867, "grad_norm": 0.99609375, "learning_rate": 0.0004081248010069827, "loss": 5.4892, "mean_token_accuracy": 0.22401677966117858, "num_tokens": 67336565.0, "step": 26565 }, { "entropy": 6.234211397171021, "epoch": 3.0663589151759956, "grad_norm": 1.0546875, "learning_rate": 0.00040809153213475983, "loss": 5.6015, "mean_token_accuracy": 0.21106755137443542, "num_tokens": 67348390.0, "step": 26570 }, { "entropy": 6.296108770370483, "epoch": 3.066935949221004, "grad_norm": 1.0390625, "learning_rate": 0.00040805825878606944, "loss": 5.5503, "mean_token_accuracy": 0.21435806155204773, "num_tokens": 67360686.0, "step": 26575 }, { "entropy": 6.271973609924316, "epoch": 3.067512983266013, "grad_norm": 1.078125, "learning_rate": 0.0004080249809620307, "loss": 5.6313, "mean_token_accuracy": 0.20743607729673386, "num_tokens": 67372092.0, "step": 26580 }, { "entropy": 6.2365264892578125, "epoch": 3.0680900173110213, "grad_norm": 1.0, "learning_rate": 0.00040799169866376266, "loss": 5.5287, "mean_token_accuracy": 0.20823565274477004, "num_tokens": 67386017.0, "step": 26585 }, { "entropy": 6.307186079025269, "epoch": 3.06866705135603, "grad_norm": 1.0703125, "learning_rate": 0.00040795841189238504, "loss": 5.6645, "mean_token_accuracy": 0.2065518781542778, "num_tokens": 67397987.0, "step": 26590 }, { "entropy": 6.3421399116516115, "epoch": 3.0692440854010385, "grad_norm": 1.03125, "learning_rate": 0.00040792512064901715, "loss": 5.6887, "mean_token_accuracy": 0.20427913069725037, "num_tokens": 67410756.0, "step": 26595 }, { "entropy": 6.381599283218383, "epoch": 3.0698211194460474, "grad_norm": 1.0, "learning_rate": 0.00040789182493477887, "loss": 5.6933, "mean_token_accuracy": 0.20366443544626237, "num_tokens": 67423528.0, "step": 26600 }, { "entropy": 6.284521007537842, "epoch": 3.070398153491056, "grad_norm": 1.015625, "learning_rate": 0.00040785852475079017, "loss": 5.6301, "mean_token_accuracy": 0.2137070819735527, "num_tokens": 67436131.0, "step": 26605 }, { "entropy": 6.201169872283936, "epoch": 3.0709751875360647, "grad_norm": 1.046875, "learning_rate": 0.0004078252200981709, "loss": 5.5822, "mean_token_accuracy": 0.21634653210639954, "num_tokens": 67449422.0, "step": 26610 }, { "entropy": 6.336655712127685, "epoch": 3.071552221581073, "grad_norm": 0.9609375, "learning_rate": 0.00040779191097804133, "loss": 5.6333, "mean_token_accuracy": 0.20627949833869935, "num_tokens": 67461997.0, "step": 26615 }, { "entropy": 6.388158845901489, "epoch": 3.072129255626082, "grad_norm": 1.03125, "learning_rate": 0.00040775859739152187, "loss": 5.7183, "mean_token_accuracy": 0.19750173836946489, "num_tokens": 67474758.0, "step": 26620 }, { "entropy": 6.166131782531738, "epoch": 3.0727062896710904, "grad_norm": 1.1015625, "learning_rate": 0.0004077252793397329, "loss": 5.5186, "mean_token_accuracy": 0.21558744609355926, "num_tokens": 67487437.0, "step": 26625 }, { "entropy": 6.255899381637573, "epoch": 3.0732833237160992, "grad_norm": 1.1328125, "learning_rate": 0.000407691956823795, "loss": 5.5671, "mean_token_accuracy": 0.20595701932907104, "num_tokens": 67500850.0, "step": 26630 }, { "entropy": 6.261994981765747, "epoch": 3.073860357761108, "grad_norm": 1.0625, "learning_rate": 0.00040765862984482916, "loss": 5.5322, "mean_token_accuracy": 0.2156509444117546, "num_tokens": 67512303.0, "step": 26635 }, { "entropy": 6.2904016971588135, "epoch": 3.0744373918061165, "grad_norm": 1.0703125, "learning_rate": 0.0004076252984039561, "loss": 5.6758, "mean_token_accuracy": 0.20718962103128433, "num_tokens": 67524561.0, "step": 26640 }, { "entropy": 6.270637369155883, "epoch": 3.0750144258511254, "grad_norm": 1.0234375, "learning_rate": 0.00040759196250229706, "loss": 5.6387, "mean_token_accuracy": 0.20272543728351594, "num_tokens": 67536859.0, "step": 26645 }, { "entropy": 6.366744041442871, "epoch": 3.075591459896134, "grad_norm": 1.109375, "learning_rate": 0.00040755862214097326, "loss": 5.669, "mean_token_accuracy": 0.19989955723285674, "num_tokens": 67549265.0, "step": 26650 }, { "entropy": 6.241109037399292, "epoch": 3.0761684939411427, "grad_norm": 0.93359375, "learning_rate": 0.000407525277321106, "loss": 5.6078, "mean_token_accuracy": 0.20316141843795776, "num_tokens": 67562630.0, "step": 26655 }, { "entropy": 6.346157169342041, "epoch": 3.076745527986151, "grad_norm": 1.1484375, "learning_rate": 0.0004074919280438169, "loss": 5.6247, "mean_token_accuracy": 0.21059015095233918, "num_tokens": 67574358.0, "step": 26660 }, { "entropy": 6.334058618545532, "epoch": 3.07732256203116, "grad_norm": 1.125, "learning_rate": 0.00040745857431022755, "loss": 5.7274, "mean_token_accuracy": 0.193741874396801, "num_tokens": 67587514.0, "step": 26665 }, { "entropy": 6.362461090087891, "epoch": 3.0778995960761684, "grad_norm": 1.015625, "learning_rate": 0.00040742521612145986, "loss": 5.7422, "mean_token_accuracy": 0.19783520102500915, "num_tokens": 67600406.0, "step": 26670 }, { "entropy": 6.242453098297119, "epoch": 3.0784766301211772, "grad_norm": 1.0, "learning_rate": 0.00040739185347863586, "loss": 5.5621, "mean_token_accuracy": 0.21015131026506423, "num_tokens": 67612988.0, "step": 26675 }, { "entropy": 6.21263427734375, "epoch": 3.0790536641661856, "grad_norm": 1.03125, "learning_rate": 0.0004073584863828776, "loss": 5.5984, "mean_token_accuracy": 0.21391842663288116, "num_tokens": 67625949.0, "step": 26680 }, { "entropy": 6.308975744247436, "epoch": 3.0796306982111945, "grad_norm": 0.98828125, "learning_rate": 0.0004073251148353074, "loss": 5.6118, "mean_token_accuracy": 0.2122059568762779, "num_tokens": 67637971.0, "step": 26685 }, { "entropy": 6.306326818466187, "epoch": 3.080207732256203, "grad_norm": 1.109375, "learning_rate": 0.0004072917388370477, "loss": 5.5911, "mean_token_accuracy": 0.20893189460039138, "num_tokens": 67650311.0, "step": 26690 }, { "entropy": 6.2741917133331295, "epoch": 3.080784766301212, "grad_norm": 0.91796875, "learning_rate": 0.00040725835838922105, "loss": 5.6391, "mean_token_accuracy": 0.20775288641452788, "num_tokens": 67662812.0, "step": 26695 }, { "entropy": 6.31061372756958, "epoch": 3.0813618003462206, "grad_norm": 1.0390625, "learning_rate": 0.0004072249734929502, "loss": 5.6693, "mean_token_accuracy": 0.2010042130947113, "num_tokens": 67674878.0, "step": 26700 }, { "entropy": 6.33792085647583, "epoch": 3.081938834391229, "grad_norm": 1.0078125, "learning_rate": 0.00040719158414935806, "loss": 5.6254, "mean_token_accuracy": 0.21054066121578216, "num_tokens": 67687562.0, "step": 26705 }, { "entropy": 6.403550624847412, "epoch": 3.082515868436238, "grad_norm": 1.0859375, "learning_rate": 0.0004071581903595677, "loss": 5.735, "mean_token_accuracy": 0.19697750061750413, "num_tokens": 67699546.0, "step": 26710 }, { "entropy": 6.225512599945068, "epoch": 3.0830929024812463, "grad_norm": 1.1484375, "learning_rate": 0.00040712479212470223, "loss": 5.4766, "mean_token_accuracy": 0.21983350217342376, "num_tokens": 67711247.0, "step": 26715 }, { "entropy": 6.2588818073272705, "epoch": 3.083669936526255, "grad_norm": 0.9921875, "learning_rate": 0.000407091389445885, "loss": 5.6276, "mean_token_accuracy": 0.2034992754459381, "num_tokens": 67724305.0, "step": 26720 }, { "entropy": 6.288345861434936, "epoch": 3.0842469705712636, "grad_norm": 1.015625, "learning_rate": 0.0004070579823242395, "loss": 5.6149, "mean_token_accuracy": 0.2088824287056923, "num_tokens": 67737015.0, "step": 26725 }, { "entropy": 6.320836973190308, "epoch": 3.0848240046162725, "grad_norm": 1.0390625, "learning_rate": 0.00040702457076088937, "loss": 5.6597, "mean_token_accuracy": 0.2043188765645027, "num_tokens": 67748883.0, "step": 26730 }, { "entropy": 6.286766862869262, "epoch": 3.085401038661281, "grad_norm": 1.0703125, "learning_rate": 0.0004069911547569584, "loss": 5.5883, "mean_token_accuracy": 0.21148181706666946, "num_tokens": 67761278.0, "step": 26735 }, { "entropy": 6.301794528961182, "epoch": 3.0859780727062898, "grad_norm": 1.015625, "learning_rate": 0.00040695773431357034, "loss": 5.6446, "mean_token_accuracy": 0.20632142275571824, "num_tokens": 67772823.0, "step": 26740 }, { "entropy": 6.3208190441131595, "epoch": 3.086555106751298, "grad_norm": 1.078125, "learning_rate": 0.0004069243094318496, "loss": 5.6531, "mean_token_accuracy": 0.20843892991542817, "num_tokens": 67786490.0, "step": 26745 }, { "entropy": 6.269235992431641, "epoch": 3.087132140796307, "grad_norm": 1.015625, "learning_rate": 0.00040689088011292024, "loss": 5.5917, "mean_token_accuracy": 0.21143887490034102, "num_tokens": 67799123.0, "step": 26750 }, { "entropy": 6.215679550170899, "epoch": 3.0877091748413155, "grad_norm": 1.078125, "learning_rate": 0.0004068574463579066, "loss": 5.5017, "mean_token_accuracy": 0.2142403930425644, "num_tokens": 67811860.0, "step": 26755 }, { "entropy": 6.2468273639678955, "epoch": 3.0882862088863243, "grad_norm": 1.0546875, "learning_rate": 0.00040682400816793326, "loss": 5.6421, "mean_token_accuracy": 0.20616656690835952, "num_tokens": 67824251.0, "step": 26760 }, { "entropy": 6.42441086769104, "epoch": 3.0888632429313327, "grad_norm": 1.046875, "learning_rate": 0.00040679056554412485, "loss": 5.7213, "mean_token_accuracy": 0.19424006193876267, "num_tokens": 67837316.0, "step": 26765 }, { "entropy": 6.404419660568237, "epoch": 3.0894402769763416, "grad_norm": 1.0546875, "learning_rate": 0.0004067571184876063, "loss": 5.6994, "mean_token_accuracy": 0.2053467094898224, "num_tokens": 67850257.0, "step": 26770 }, { "entropy": 6.319451093673706, "epoch": 3.0900173110213505, "grad_norm": 1.0703125, "learning_rate": 0.00040672366699950245, "loss": 5.647, "mean_token_accuracy": 0.207024285197258, "num_tokens": 67862715.0, "step": 26775 }, { "entropy": 6.322743654251099, "epoch": 3.090594345066359, "grad_norm": 1.046875, "learning_rate": 0.00040669021108093856, "loss": 5.6136, "mean_token_accuracy": 0.2107048138976097, "num_tokens": 67875282.0, "step": 26780 }, { "entropy": 6.268998336791992, "epoch": 3.0911713791113677, "grad_norm": 1.046875, "learning_rate": 0.0004066567507330398, "loss": 5.5868, "mean_token_accuracy": 0.20780618041753768, "num_tokens": 67886797.0, "step": 26785 }, { "entropy": 6.194073963165283, "epoch": 3.091748413156376, "grad_norm": 0.984375, "learning_rate": 0.0004066232859569316, "loss": 5.5679, "mean_token_accuracy": 0.21105572134256362, "num_tokens": 67899581.0, "step": 26790 }, { "entropy": 6.253467845916748, "epoch": 3.092325447201385, "grad_norm": 1.03125, "learning_rate": 0.0004065898167537396, "loss": 5.59, "mean_token_accuracy": 0.2104534313082695, "num_tokens": 67911640.0, "step": 26795 }, { "entropy": 6.316712427139282, "epoch": 3.0929024812463934, "grad_norm": 0.97265625, "learning_rate": 0.0004065563431245895, "loss": 5.6276, "mean_token_accuracy": 0.2063811480998993, "num_tokens": 67925094.0, "step": 26800 }, { "entropy": 6.223725509643555, "epoch": 3.0934795152914023, "grad_norm": 1.046875, "learning_rate": 0.0004065228650706071, "loss": 5.5569, "mean_token_accuracy": 0.21724656075239182, "num_tokens": 67937774.0, "step": 26805 }, { "entropy": 6.316356611251831, "epoch": 3.0940565493364107, "grad_norm": 0.99609375, "learning_rate": 0.00040648938259291845, "loss": 5.5845, "mean_token_accuracy": 0.20829292088747026, "num_tokens": 67950240.0, "step": 26810 }, { "entropy": 6.3174293518066404, "epoch": 3.0946335833814196, "grad_norm": 1.0234375, "learning_rate": 0.0004064558956926497, "loss": 5.5696, "mean_token_accuracy": 0.21278978884220123, "num_tokens": 67963503.0, "step": 26815 }, { "entropy": 6.278504800796509, "epoch": 3.095210617426428, "grad_norm": 1.078125, "learning_rate": 0.0004064224043709273, "loss": 5.64, "mean_token_accuracy": 0.20538755208253862, "num_tokens": 67974610.0, "step": 26820 }, { "entropy": 6.256296539306641, "epoch": 3.095787651471437, "grad_norm": 1.0703125, "learning_rate": 0.0004063889086288776, "loss": 5.5452, "mean_token_accuracy": 0.21689425259828568, "num_tokens": 67988172.0, "step": 26825 }, { "entropy": 6.221217346191406, "epoch": 3.0963646855164453, "grad_norm": 0.9765625, "learning_rate": 0.00040635540846762713, "loss": 5.5981, "mean_token_accuracy": 0.21151813119649887, "num_tokens": 68001489.0, "step": 26830 }, { "entropy": 6.257963991165161, "epoch": 3.096941719561454, "grad_norm": 1.0625, "learning_rate": 0.0004063219038883028, "loss": 5.6441, "mean_token_accuracy": 0.2055899903178215, "num_tokens": 68014291.0, "step": 26835 }, { "entropy": 6.312999582290649, "epoch": 3.0975187536064626, "grad_norm": 0.9765625, "learning_rate": 0.00040628839489203144, "loss": 5.6224, "mean_token_accuracy": 0.20165366679430008, "num_tokens": 68026735.0, "step": 26840 }, { "entropy": 6.395564174652099, "epoch": 3.0980957876514714, "grad_norm": 0.97265625, "learning_rate": 0.00040625488147994025, "loss": 5.7203, "mean_token_accuracy": 0.20286059230566025, "num_tokens": 68039943.0, "step": 26845 }, { "entropy": 6.242623996734619, "epoch": 3.0986728216964803, "grad_norm": 1.1015625, "learning_rate": 0.00040622136365315616, "loss": 5.5723, "mean_token_accuracy": 0.20576858520507812, "num_tokens": 68053358.0, "step": 26850 }, { "entropy": 6.281509256362915, "epoch": 3.0992498557414887, "grad_norm": 1.1953125, "learning_rate": 0.00040618784141280674, "loss": 5.5501, "mean_token_accuracy": 0.2129257708787918, "num_tokens": 68066002.0, "step": 26855 }, { "entropy": 6.269101333618164, "epoch": 3.0998268897864976, "grad_norm": 1.0859375, "learning_rate": 0.00040615431476001947, "loss": 5.5464, "mean_token_accuracy": 0.2171017050743103, "num_tokens": 68079221.0, "step": 26860 }, { "entropy": 6.297637557983398, "epoch": 3.100403923831506, "grad_norm": 0.98828125, "learning_rate": 0.0004061207836959219, "loss": 5.6611, "mean_token_accuracy": 0.20073664635419847, "num_tokens": 68091388.0, "step": 26865 }, { "entropy": 6.322658920288086, "epoch": 3.100980957876515, "grad_norm": 1.046875, "learning_rate": 0.00040608724822164193, "loss": 5.6885, "mean_token_accuracy": 0.20526121109724044, "num_tokens": 68104016.0, "step": 26870 }, { "entropy": 6.3422407627105715, "epoch": 3.1015579919215233, "grad_norm": 1.0703125, "learning_rate": 0.0004060537083383076, "loss": 5.5402, "mean_token_accuracy": 0.220103819668293, "num_tokens": 68117762.0, "step": 26875 }, { "entropy": 6.277603197097778, "epoch": 3.102135025966532, "grad_norm": 1.0625, "learning_rate": 0.00040602016404704666, "loss": 5.5711, "mean_token_accuracy": 0.216977059841156, "num_tokens": 68129913.0, "step": 26880 }, { "entropy": 6.286070489883423, "epoch": 3.1027120600115405, "grad_norm": 1.0390625, "learning_rate": 0.0004059866153489878, "loss": 5.6288, "mean_token_accuracy": 0.2114587515592575, "num_tokens": 68142582.0, "step": 26885 }, { "entropy": 6.320161962509156, "epoch": 3.1032890940565494, "grad_norm": 0.99609375, "learning_rate": 0.00040595306224525904, "loss": 5.6212, "mean_token_accuracy": 0.20695806592702864, "num_tokens": 68156233.0, "step": 26890 }, { "entropy": 6.293744659423828, "epoch": 3.103866128101558, "grad_norm": 1.0234375, "learning_rate": 0.0004059195047369892, "loss": 5.6006, "mean_token_accuracy": 0.2089747115969658, "num_tokens": 68168672.0, "step": 26895 }, { "entropy": 6.263481998443604, "epoch": 3.1044431621465667, "grad_norm": 1.0078125, "learning_rate": 0.0004058859428253068, "loss": 5.6813, "mean_token_accuracy": 0.20044244974851608, "num_tokens": 68180934.0, "step": 26900 }, { "entropy": 6.312734699249267, "epoch": 3.105020196191575, "grad_norm": 0.9921875, "learning_rate": 0.0004058523765113407, "loss": 5.6401, "mean_token_accuracy": 0.20222071856260299, "num_tokens": 68193788.0, "step": 26905 }, { "entropy": 6.3454853057861325, "epoch": 3.105597230236584, "grad_norm": 1.0546875, "learning_rate": 0.00040581880579621996, "loss": 5.6096, "mean_token_accuracy": 0.21167981922626494, "num_tokens": 68204908.0, "step": 26910 }, { "entropy": 6.287997817993164, "epoch": 3.106174264281593, "grad_norm": 0.9609375, "learning_rate": 0.00040578523068107367, "loss": 5.6049, "mean_token_accuracy": 0.2047601029276848, "num_tokens": 68217956.0, "step": 26915 }, { "entropy": 6.251047515869141, "epoch": 3.1067512983266012, "grad_norm": 1.109375, "learning_rate": 0.00040575165116703103, "loss": 5.5547, "mean_token_accuracy": 0.21678354144096373, "num_tokens": 68229755.0, "step": 26920 }, { "entropy": 6.366534852981568, "epoch": 3.10732833237161, "grad_norm": 1.1171875, "learning_rate": 0.00040571806725522164, "loss": 5.6726, "mean_token_accuracy": 0.19861685782670974, "num_tokens": 68242620.0, "step": 26925 }, { "entropy": 6.205610275268555, "epoch": 3.1079053664166185, "grad_norm": 1.03125, "learning_rate": 0.00040568447894677494, "loss": 5.5295, "mean_token_accuracy": 0.21443583071231842, "num_tokens": 68256045.0, "step": 26930 }, { "entropy": 6.230793380737305, "epoch": 3.1084824004616274, "grad_norm": 1.1015625, "learning_rate": 0.00040565088624282074, "loss": 5.5463, "mean_token_accuracy": 0.22139399796724318, "num_tokens": 68269378.0, "step": 26935 }, { "entropy": 6.297155570983887, "epoch": 3.109059434506636, "grad_norm": 1.09375, "learning_rate": 0.0004056172891444889, "loss": 5.6032, "mean_token_accuracy": 0.21124844998121262, "num_tokens": 68281575.0, "step": 26940 }, { "entropy": 6.2774590969085695, "epoch": 3.1096364685516447, "grad_norm": 1.0, "learning_rate": 0.00040558368765290933, "loss": 5.5628, "mean_token_accuracy": 0.2149987816810608, "num_tokens": 68293690.0, "step": 26945 }, { "entropy": 6.312121057510376, "epoch": 3.110213502596653, "grad_norm": 1.046875, "learning_rate": 0.00040555008176921235, "loss": 5.6832, "mean_token_accuracy": 0.198262020945549, "num_tokens": 68305200.0, "step": 26950 }, { "entropy": 6.27874345779419, "epoch": 3.110790536641662, "grad_norm": 0.9609375, "learning_rate": 0.0004055164714945282, "loss": 5.58, "mean_token_accuracy": 0.20776597410440445, "num_tokens": 68317259.0, "step": 26955 }, { "entropy": 6.221082973480224, "epoch": 3.1113675706866704, "grad_norm": 1.0703125, "learning_rate": 0.00040548285682998736, "loss": 5.5965, "mean_token_accuracy": 0.21113041192293167, "num_tokens": 68330101.0, "step": 26960 }, { "entropy": 6.268272924423218, "epoch": 3.111944604731679, "grad_norm": 1.0234375, "learning_rate": 0.00040544923777672046, "loss": 5.6255, "mean_token_accuracy": 0.20694927275180816, "num_tokens": 68342438.0, "step": 26965 }, { "entropy": 6.254476547241211, "epoch": 3.1125216387766876, "grad_norm": 1.1328125, "learning_rate": 0.0004054156143358583, "loss": 5.5652, "mean_token_accuracy": 0.21165869385004044, "num_tokens": 68355202.0, "step": 26970 }, { "entropy": 6.256032466888428, "epoch": 3.1130986728216965, "grad_norm": 1.15625, "learning_rate": 0.00040538198650853156, "loss": 5.5237, "mean_token_accuracy": 0.2181511029601097, "num_tokens": 68366586.0, "step": 26975 }, { "entropy": 6.278728389739991, "epoch": 3.1136757068667054, "grad_norm": 1.125, "learning_rate": 0.0004053483542958717, "loss": 5.6075, "mean_token_accuracy": 0.21161859333515168, "num_tokens": 68381132.0, "step": 26980 }, { "entropy": 6.2968181610107425, "epoch": 3.114252740911714, "grad_norm": 1.109375, "learning_rate": 0.00040531471769900953, "loss": 5.6488, "mean_token_accuracy": 0.20676520466804504, "num_tokens": 68392691.0, "step": 26985 }, { "entropy": 6.323524904251099, "epoch": 3.1148297749567226, "grad_norm": 1.1015625, "learning_rate": 0.0004052810767190766, "loss": 5.6334, "mean_token_accuracy": 0.20840916633605958, "num_tokens": 68405499.0, "step": 26990 }, { "entropy": 6.269959115982056, "epoch": 3.115406809001731, "grad_norm": 0.984375, "learning_rate": 0.00040524743135720437, "loss": 5.6687, "mean_token_accuracy": 0.20600219815969467, "num_tokens": 68418485.0, "step": 26995 }, { "entropy": 6.303348588943481, "epoch": 3.11598384304674, "grad_norm": 0.9765625, "learning_rate": 0.0004052137816145245, "loss": 5.6196, "mean_token_accuracy": 0.21286799609661103, "num_tokens": 68432409.0, "step": 27000 }, { "epoch": 3.11598384304674, "eval_entropy": 6.111329440674661, "eval_loss": 5.734144687652588, "eval_mean_token_accuracy": 0.2103794835187984, "eval_num_tokens": 68432409.0, "eval_runtime": 17.6048, "eval_samples_per_second": 1598.202, "eval_steps_per_second": 199.775, "step": 27000 }, { "entropy": 6.280648279190063, "epoch": 3.1165608770917483, "grad_norm": 1.03125, "learning_rate": 0.0004051801274921688, "loss": 5.5451, "mean_token_accuracy": 0.2142835646867752, "num_tokens": 68444516.0, "step": 27005 }, { "entropy": 6.30614652633667, "epoch": 3.117137911136757, "grad_norm": 0.9921875, "learning_rate": 0.00040514646899126905, "loss": 5.6206, "mean_token_accuracy": 0.21314135789871216, "num_tokens": 68458326.0, "step": 27010 }, { "entropy": 6.315762376785278, "epoch": 3.1177149451817656, "grad_norm": 1.0859375, "learning_rate": 0.0004051128061129576, "loss": 5.6058, "mean_token_accuracy": 0.20220823884010314, "num_tokens": 68472500.0, "step": 27015 }, { "entropy": 6.326185512542724, "epoch": 3.1182919792267745, "grad_norm": 1.09375, "learning_rate": 0.00040507913885836646, "loss": 5.6628, "mean_token_accuracy": 0.20913977324962615, "num_tokens": 68485280.0, "step": 27020 }, { "entropy": 6.285567951202393, "epoch": 3.118869013271783, "grad_norm": 1.1171875, "learning_rate": 0.0004050454672286281, "loss": 5.6055, "mean_token_accuracy": 0.20629969984292984, "num_tokens": 68497792.0, "step": 27025 }, { "entropy": 6.25209608078003, "epoch": 3.1194460473167918, "grad_norm": 1.0078125, "learning_rate": 0.0004050117912248751, "loss": 5.5523, "mean_token_accuracy": 0.2163981691002846, "num_tokens": 68510444.0, "step": 27030 }, { "entropy": 6.301897144317627, "epoch": 3.1200230813618, "grad_norm": 1.0625, "learning_rate": 0.00040497811084824005, "loss": 5.5838, "mean_token_accuracy": 0.21023460626602172, "num_tokens": 68522414.0, "step": 27035 }, { "entropy": 6.297055292129516, "epoch": 3.120600115406809, "grad_norm": 1.0859375, "learning_rate": 0.0004049444260998558, "loss": 5.5945, "mean_token_accuracy": 0.21373381614685058, "num_tokens": 68534389.0, "step": 27040 }, { "entropy": 6.256057167053223, "epoch": 3.1211771494518175, "grad_norm": 1.0390625, "learning_rate": 0.0004049107369808553, "loss": 5.5951, "mean_token_accuracy": 0.2072221338748932, "num_tokens": 68545881.0, "step": 27045 }, { "entropy": 6.377020168304443, "epoch": 3.1217541834968263, "grad_norm": 1.0546875, "learning_rate": 0.00040487704349237175, "loss": 5.6331, "mean_token_accuracy": 0.20621429085731507, "num_tokens": 68558758.0, "step": 27050 }, { "entropy": 6.280807542800903, "epoch": 3.122331217541835, "grad_norm": 1.0546875, "learning_rate": 0.00040484334563553836, "loss": 5.5778, "mean_token_accuracy": 0.21310425251722337, "num_tokens": 68570551.0, "step": 27055 }, { "entropy": 6.282730054855347, "epoch": 3.1229082515868436, "grad_norm": 0.98046875, "learning_rate": 0.0004048096434114885, "loss": 5.6846, "mean_token_accuracy": 0.20090981274843217, "num_tokens": 68583012.0, "step": 27060 }, { "entropy": 6.2662280082702635, "epoch": 3.1234852856318525, "grad_norm": 0.9921875, "learning_rate": 0.00040477593682135575, "loss": 5.6107, "mean_token_accuracy": 0.20896279960870742, "num_tokens": 68594235.0, "step": 27065 }, { "entropy": 6.322656631469727, "epoch": 3.124062319676861, "grad_norm": 1.0546875, "learning_rate": 0.0004047422258662739, "loss": 5.6175, "mean_token_accuracy": 0.20987924039363862, "num_tokens": 68605978.0, "step": 27070 }, { "entropy": 6.2886497497558596, "epoch": 3.1246393537218697, "grad_norm": 0.96875, "learning_rate": 0.00040470851054737666, "loss": 5.6292, "mean_token_accuracy": 0.20789242088794707, "num_tokens": 68619385.0, "step": 27075 }, { "entropy": 6.237132835388183, "epoch": 3.125216387766878, "grad_norm": 1.0859375, "learning_rate": 0.0004046747908657982, "loss": 5.5813, "mean_token_accuracy": 0.21472299993038177, "num_tokens": 68631986.0, "step": 27080 }, { "entropy": 6.287612104415894, "epoch": 3.125793421811887, "grad_norm": 1.03125, "learning_rate": 0.00040464106682267236, "loss": 5.5862, "mean_token_accuracy": 0.2068384975194931, "num_tokens": 68644262.0, "step": 27085 }, { "entropy": 6.306993055343628, "epoch": 3.1263704558568954, "grad_norm": 1.0078125, "learning_rate": 0.0004046073384191338, "loss": 5.6298, "mean_token_accuracy": 0.20488440245389938, "num_tokens": 68656941.0, "step": 27090 }, { "entropy": 6.323420238494873, "epoch": 3.1269474899019043, "grad_norm": 1.015625, "learning_rate": 0.00040457360565631674, "loss": 5.719, "mean_token_accuracy": 0.19765298217535018, "num_tokens": 68669231.0, "step": 27095 }, { "entropy": 6.328269195556641, "epoch": 3.1275245239469127, "grad_norm": 1.03125, "learning_rate": 0.00040453986853535587, "loss": 5.6179, "mean_token_accuracy": 0.20387021601200103, "num_tokens": 68681882.0, "step": 27100 }, { "entropy": 6.246067857742309, "epoch": 3.1281015579919216, "grad_norm": 1.0859375, "learning_rate": 0.0004045061270573858, "loss": 5.4575, "mean_token_accuracy": 0.2327384665608406, "num_tokens": 68693970.0, "step": 27105 }, { "entropy": 6.185442352294922, "epoch": 3.12867859203693, "grad_norm": 1.0234375, "learning_rate": 0.00040447238122354146, "loss": 5.5217, "mean_token_accuracy": 0.21264556050300598, "num_tokens": 68706367.0, "step": 27110 }, { "entropy": 6.35885705947876, "epoch": 3.129255626081939, "grad_norm": 1.03125, "learning_rate": 0.0004044386310349579, "loss": 5.705, "mean_token_accuracy": 0.19846862852573394, "num_tokens": 68718644.0, "step": 27115 }, { "entropy": 6.287991571426391, "epoch": 3.1298326601269473, "grad_norm": 1.0234375, "learning_rate": 0.00040440487649277037, "loss": 5.5664, "mean_token_accuracy": 0.20847989916801452, "num_tokens": 68730545.0, "step": 27120 }, { "entropy": 6.325038433074951, "epoch": 3.130409694171956, "grad_norm": 1.0234375, "learning_rate": 0.00040437111759811397, "loss": 5.6503, "mean_token_accuracy": 0.20560305565595627, "num_tokens": 68743093.0, "step": 27125 }, { "entropy": 6.284808731079101, "epoch": 3.130986728216965, "grad_norm": 0.953125, "learning_rate": 0.00040433735435212436, "loss": 5.6422, "mean_token_accuracy": 0.20637041032314302, "num_tokens": 68756437.0, "step": 27130 }, { "entropy": 6.25931339263916, "epoch": 3.1315637622619734, "grad_norm": 1.0625, "learning_rate": 0.0004043035867559371, "loss": 5.5998, "mean_token_accuracy": 0.20996748358011247, "num_tokens": 68769380.0, "step": 27135 }, { "entropy": 6.315062427520752, "epoch": 3.1321407963069823, "grad_norm": 0.98828125, "learning_rate": 0.00040426981481068785, "loss": 5.604, "mean_token_accuracy": 0.21612405329942702, "num_tokens": 68782390.0, "step": 27140 }, { "entropy": 6.234471654891967, "epoch": 3.1327178303519907, "grad_norm": 1.0703125, "learning_rate": 0.00040423603851751273, "loss": 5.4933, "mean_token_accuracy": 0.21778270304203035, "num_tokens": 68793931.0, "step": 27145 }, { "entropy": 6.275991010665893, "epoch": 3.1332948643969996, "grad_norm": 1.1171875, "learning_rate": 0.00040420225787754754, "loss": 5.6477, "mean_token_accuracy": 0.21105570048093797, "num_tokens": 68806020.0, "step": 27150 }, { "entropy": 6.364288234710694, "epoch": 3.133871898442008, "grad_norm": 1.0078125, "learning_rate": 0.0004041684728919286, "loss": 5.6954, "mean_token_accuracy": 0.20201407819986344, "num_tokens": 68818616.0, "step": 27155 }, { "entropy": 6.313132047653198, "epoch": 3.134448932487017, "grad_norm": 1.0390625, "learning_rate": 0.00040413468356179224, "loss": 5.6306, "mean_token_accuracy": 0.20861747562885286, "num_tokens": 68831549.0, "step": 27160 }, { "entropy": 6.322439289093017, "epoch": 3.1350259665320253, "grad_norm": 1.03125, "learning_rate": 0.000404100889888275, "loss": 5.6161, "mean_token_accuracy": 0.21228354126214982, "num_tokens": 68842551.0, "step": 27165 }, { "entropy": 6.309630107879639, "epoch": 3.135603000577034, "grad_norm": 0.99609375, "learning_rate": 0.0004040670918725133, "loss": 5.6659, "mean_token_accuracy": 0.20545456558465958, "num_tokens": 68855525.0, "step": 27170 }, { "entropy": 6.260705471038818, "epoch": 3.1361800346220425, "grad_norm": 0.96484375, "learning_rate": 0.0004040332895156443, "loss": 5.6306, "mean_token_accuracy": 0.2126890242099762, "num_tokens": 68869570.0, "step": 27175 }, { "entropy": 6.3734245777130125, "epoch": 3.1367570686670514, "grad_norm": 1.171875, "learning_rate": 0.0004039994828188045, "loss": 5.5997, "mean_token_accuracy": 0.21026987731456756, "num_tokens": 68881392.0, "step": 27180 }, { "entropy": 6.2442690372467045, "epoch": 3.13733410271206, "grad_norm": 1.015625, "learning_rate": 0.00040396567178313124, "loss": 5.6076, "mean_token_accuracy": 0.2057003930211067, "num_tokens": 68894107.0, "step": 27185 }, { "entropy": 6.3343194961547855, "epoch": 3.1379111367570687, "grad_norm": 1.0546875, "learning_rate": 0.00040393185640976174, "loss": 5.682, "mean_token_accuracy": 0.2076703578233719, "num_tokens": 68905734.0, "step": 27190 }, { "entropy": 6.378166532516479, "epoch": 3.138488170802077, "grad_norm": 1.0234375, "learning_rate": 0.0004038980366998332, "loss": 5.6769, "mean_token_accuracy": 0.2014593482017517, "num_tokens": 68918996.0, "step": 27195 }, { "entropy": 6.24856595993042, "epoch": 3.139065204847086, "grad_norm": 0.98828125, "learning_rate": 0.0004038642126544833, "loss": 5.5731, "mean_token_accuracy": 0.2124515637755394, "num_tokens": 68931381.0, "step": 27200 }, { "entropy": 6.327910089492798, "epoch": 3.139642238892095, "grad_norm": 1.0234375, "learning_rate": 0.0004038303842748496, "loss": 5.6765, "mean_token_accuracy": 0.2026467964053154, "num_tokens": 68943615.0, "step": 27205 }, { "entropy": 6.26311993598938, "epoch": 3.1402192729371032, "grad_norm": 1.09375, "learning_rate": 0.00040379655156206983, "loss": 5.5374, "mean_token_accuracy": 0.21101761609315872, "num_tokens": 68955115.0, "step": 27210 }, { "entropy": 6.240866613388062, "epoch": 3.140796306982112, "grad_norm": 1.0703125, "learning_rate": 0.0004037627145172822, "loss": 5.5374, "mean_token_accuracy": 0.215702523291111, "num_tokens": 68968042.0, "step": 27215 }, { "entropy": 6.255788373947143, "epoch": 3.1413733410271205, "grad_norm": 1.0078125, "learning_rate": 0.0004037288731416245, "loss": 5.5534, "mean_token_accuracy": 0.22251269370317459, "num_tokens": 68982178.0, "step": 27220 }, { "entropy": 6.20533504486084, "epoch": 3.1419503750721294, "grad_norm": 1.0703125, "learning_rate": 0.0004036950274362351, "loss": 5.65, "mean_token_accuracy": 0.20214638411998748, "num_tokens": 68994546.0, "step": 27225 }, { "entropy": 6.292791414260864, "epoch": 3.142527409117138, "grad_norm": 1.140625, "learning_rate": 0.0004036611774022524, "loss": 5.5935, "mean_token_accuracy": 0.21236942410469056, "num_tokens": 69007134.0, "step": 27230 }, { "entropy": 6.287568378448486, "epoch": 3.1431044431621467, "grad_norm": 1.0703125, "learning_rate": 0.0004036273230408149, "loss": 5.5923, "mean_token_accuracy": 0.21577005237340927, "num_tokens": 69019668.0, "step": 27235 }, { "entropy": 6.362149858474732, "epoch": 3.143681477207155, "grad_norm": 1.015625, "learning_rate": 0.0004035934643530613, "loss": 5.6395, "mean_token_accuracy": 0.20839455872774124, "num_tokens": 69032127.0, "step": 27240 }, { "entropy": 6.29371223449707, "epoch": 3.144258511252164, "grad_norm": 1.0859375, "learning_rate": 0.00040355960134013036, "loss": 5.6232, "mean_token_accuracy": 0.2055112600326538, "num_tokens": 69044926.0, "step": 27245 }, { "entropy": 6.2748801708221436, "epoch": 3.1448355452971724, "grad_norm": 1.078125, "learning_rate": 0.0004035257340031611, "loss": 5.5724, "mean_token_accuracy": 0.20583218187093735, "num_tokens": 69056326.0, "step": 27250 }, { "entropy": 6.312306118011475, "epoch": 3.145412579342181, "grad_norm": 1.0625, "learning_rate": 0.0004034918623432926, "loss": 5.646, "mean_token_accuracy": 0.2112944945693016, "num_tokens": 69069696.0, "step": 27255 }, { "entropy": 6.334290647506714, "epoch": 3.14598961338719, "grad_norm": 0.984375, "learning_rate": 0.00040345798636166424, "loss": 5.6318, "mean_token_accuracy": 0.2068129673600197, "num_tokens": 69082517.0, "step": 27260 }, { "entropy": 6.2480260848999025, "epoch": 3.1465666474321985, "grad_norm": 1.0, "learning_rate": 0.00040342410605941526, "loss": 5.5472, "mean_token_accuracy": 0.2148619621992111, "num_tokens": 69095774.0, "step": 27265 }, { "entropy": 6.298188066482544, "epoch": 3.1471436814772074, "grad_norm": 1.0234375, "learning_rate": 0.00040339022143768524, "loss": 5.5898, "mean_token_accuracy": 0.21208614110946655, "num_tokens": 69109575.0, "step": 27270 }, { "entropy": 6.243906927108765, "epoch": 3.1477207155222158, "grad_norm": 0.921875, "learning_rate": 0.00040335633249761387, "loss": 5.5799, "mean_token_accuracy": 0.21195167005062104, "num_tokens": 69123365.0, "step": 27275 }, { "entropy": 6.338882541656494, "epoch": 3.1482977495672246, "grad_norm": 0.96875, "learning_rate": 0.00040332243924034105, "loss": 5.6604, "mean_token_accuracy": 0.2088367983698845, "num_tokens": 69136187.0, "step": 27280 }, { "entropy": 6.282512283325195, "epoch": 3.148874783612233, "grad_norm": 1.0390625, "learning_rate": 0.0004032885416670068, "loss": 5.5935, "mean_token_accuracy": 0.22153957486152648, "num_tokens": 69150271.0, "step": 27285 }, { "entropy": 6.333517932891846, "epoch": 3.149451817657242, "grad_norm": 1.1484375, "learning_rate": 0.0004032546397787511, "loss": 5.6389, "mean_token_accuracy": 0.20589299947023393, "num_tokens": 69161906.0, "step": 27290 }, { "entropy": 6.280667018890381, "epoch": 3.1500288517022503, "grad_norm": 1.1875, "learning_rate": 0.0004032207335767142, "loss": 5.5795, "mean_token_accuracy": 0.21173085421323776, "num_tokens": 69174367.0, "step": 27295 }, { "entropy": 6.243854427337647, "epoch": 3.150605885747259, "grad_norm": 1.0703125, "learning_rate": 0.0004031868230620368, "loss": 5.6477, "mean_token_accuracy": 0.20793964266777037, "num_tokens": 69186970.0, "step": 27300 }, { "entropy": 6.281678962707519, "epoch": 3.1511829197922676, "grad_norm": 1.0078125, "learning_rate": 0.0004031529082358592, "loss": 5.6472, "mean_token_accuracy": 0.20949608385562896, "num_tokens": 69199347.0, "step": 27305 }, { "entropy": 6.241601276397705, "epoch": 3.1517599538372765, "grad_norm": 0.92578125, "learning_rate": 0.0004031189890993222, "loss": 5.5751, "mean_token_accuracy": 0.20498041808605194, "num_tokens": 69211710.0, "step": 27310 }, { "entropy": 6.297597169876099, "epoch": 3.152336987882285, "grad_norm": 1.0390625, "learning_rate": 0.00040308506565356664, "loss": 5.5975, "mean_token_accuracy": 0.21405226439237596, "num_tokens": 69224153.0, "step": 27315 }, { "entropy": 6.34023232460022, "epoch": 3.1529140219272938, "grad_norm": 1.109375, "learning_rate": 0.00040305113789973354, "loss": 5.645, "mean_token_accuracy": 0.20358144491910934, "num_tokens": 69236046.0, "step": 27320 }, { "entropy": 6.246219491958618, "epoch": 3.153491055972302, "grad_norm": 1.0546875, "learning_rate": 0.0004030172058389639, "loss": 5.5723, "mean_token_accuracy": 0.2068645492196083, "num_tokens": 69247997.0, "step": 27325 }, { "entropy": 6.273966836929321, "epoch": 3.154068090017311, "grad_norm": 1.0, "learning_rate": 0.00040298326947239935, "loss": 5.5728, "mean_token_accuracy": 0.21226352006196975, "num_tokens": 69261189.0, "step": 27330 }, { "entropy": 6.333410930633545, "epoch": 3.15464512406232, "grad_norm": 1.046875, "learning_rate": 0.0004029493288011809, "loss": 5.6356, "mean_token_accuracy": 0.21208658814430237, "num_tokens": 69274039.0, "step": 27335 }, { "entropy": 6.183732175827027, "epoch": 3.1552221581073283, "grad_norm": 1.015625, "learning_rate": 0.0004029153838264504, "loss": 5.6122, "mean_token_accuracy": 0.2141499936580658, "num_tokens": 69286759.0, "step": 27340 }, { "entropy": 6.285881471633911, "epoch": 3.155799192152337, "grad_norm": 1.078125, "learning_rate": 0.0004028814345493496, "loss": 5.6168, "mean_token_accuracy": 0.20552818775177, "num_tokens": 69299619.0, "step": 27345 }, { "entropy": 6.2541381359100345, "epoch": 3.1563762261973456, "grad_norm": 1.0703125, "learning_rate": 0.00040284748097102013, "loss": 5.491, "mean_token_accuracy": 0.2218945398926735, "num_tokens": 69311593.0, "step": 27350 }, { "entropy": 6.320835304260254, "epoch": 3.1569532602423545, "grad_norm": 1.046875, "learning_rate": 0.00040281352309260414, "loss": 5.6198, "mean_token_accuracy": 0.2023709625005722, "num_tokens": 69324686.0, "step": 27355 }, { "entropy": 6.303699207305908, "epoch": 3.157530294287363, "grad_norm": 1.1484375, "learning_rate": 0.0004027795609152439, "loss": 5.5737, "mean_token_accuracy": 0.21024078875780106, "num_tokens": 69337042.0, "step": 27360 }, { "entropy": 6.222508955001831, "epoch": 3.1581073283323717, "grad_norm": 0.99609375, "learning_rate": 0.0004027455944400815, "loss": 5.511, "mean_token_accuracy": 0.2153483435511589, "num_tokens": 69350244.0, "step": 27365 }, { "entropy": 6.307140731811524, "epoch": 3.15868436237738, "grad_norm": 1.0078125, "learning_rate": 0.0004027116236682596, "loss": 5.6919, "mean_token_accuracy": 0.19986989647150039, "num_tokens": 69362813.0, "step": 27370 }, { "entropy": 6.389883422851563, "epoch": 3.159261396422389, "grad_norm": 1.09375, "learning_rate": 0.0004026776486009206, "loss": 5.7189, "mean_token_accuracy": 0.20044562071561814, "num_tokens": 69375397.0, "step": 27375 }, { "entropy": 6.325269365310669, "epoch": 3.1598384304673974, "grad_norm": 0.9375, "learning_rate": 0.00040264366923920735, "loss": 5.6805, "mean_token_accuracy": 0.19771179258823396, "num_tokens": 69388107.0, "step": 27380 }, { "entropy": 6.2651458263397215, "epoch": 3.1604154645124063, "grad_norm": 1.015625, "learning_rate": 0.00040260968558426265, "loss": 5.5942, "mean_token_accuracy": 0.2146643355488777, "num_tokens": 69401894.0, "step": 27385 }, { "entropy": 6.25369029045105, "epoch": 3.1609924985574147, "grad_norm": 1.0703125, "learning_rate": 0.0004025756976372296, "loss": 5.5708, "mean_token_accuracy": 0.21594186127185822, "num_tokens": 69414581.0, "step": 27390 }, { "entropy": 6.283107089996338, "epoch": 3.1615695326024236, "grad_norm": 0.953125, "learning_rate": 0.0004025417053992513, "loss": 5.6035, "mean_token_accuracy": 0.21063990145921707, "num_tokens": 69428943.0, "step": 27395 }, { "entropy": 6.342917823791504, "epoch": 3.162146566647432, "grad_norm": 0.96484375, "learning_rate": 0.0004025077088714711, "loss": 5.6683, "mean_token_accuracy": 0.20282259434461594, "num_tokens": 69442670.0, "step": 27400 }, { "entropy": 6.319306087493897, "epoch": 3.162723600692441, "grad_norm": 1.0859375, "learning_rate": 0.0004024737080550324, "loss": 5.6156, "mean_token_accuracy": 0.20407814383506775, "num_tokens": 69454784.0, "step": 27405 }, { "entropy": 6.283424520492554, "epoch": 3.1633006347374497, "grad_norm": 1.0234375, "learning_rate": 0.0004024397029510789, "loss": 5.5761, "mean_token_accuracy": 0.21451566219329835, "num_tokens": 69467683.0, "step": 27410 }, { "entropy": 6.2876091480255125, "epoch": 3.163877668782458, "grad_norm": 1.03125, "learning_rate": 0.0004024056935607543, "loss": 5.5655, "mean_token_accuracy": 0.2107386812567711, "num_tokens": 69480741.0, "step": 27415 }, { "entropy": 6.334782838821411, "epoch": 3.164454702827467, "grad_norm": 1.0390625, "learning_rate": 0.00040237167988520245, "loss": 5.6334, "mean_token_accuracy": 0.2045477345585823, "num_tokens": 69493130.0, "step": 27420 }, { "entropy": 6.264880704879761, "epoch": 3.1650317368724754, "grad_norm": 1.0703125, "learning_rate": 0.0004023376619255674, "loss": 5.6278, "mean_token_accuracy": 0.209275920689106, "num_tokens": 69504962.0, "step": 27425 }, { "entropy": 6.2241119861602785, "epoch": 3.1656087709174843, "grad_norm": 1.0703125, "learning_rate": 0.00040230363968299344, "loss": 5.5925, "mean_token_accuracy": 0.2078658312559128, "num_tokens": 69517295.0, "step": 27430 }, { "entropy": 6.340341234207154, "epoch": 3.1661858049624927, "grad_norm": 0.99609375, "learning_rate": 0.0004022696131586247, "loss": 5.6574, "mean_token_accuracy": 0.2020434707403183, "num_tokens": 69529768.0, "step": 27435 }, { "entropy": 6.27340874671936, "epoch": 3.1667628390075016, "grad_norm": 1.0078125, "learning_rate": 0.0004022355823536058, "loss": 5.6221, "mean_token_accuracy": 0.21082742512226105, "num_tokens": 69541746.0, "step": 27440 }, { "entropy": 6.336371278762817, "epoch": 3.16733987305251, "grad_norm": 1.0703125, "learning_rate": 0.00040220154726908127, "loss": 5.6364, "mean_token_accuracy": 0.20949186533689498, "num_tokens": 69553778.0, "step": 27445 }, { "entropy": 6.347769927978516, "epoch": 3.167916907097519, "grad_norm": 0.98046875, "learning_rate": 0.0004021675079061959, "loss": 5.616, "mean_token_accuracy": 0.20534560680389405, "num_tokens": 69566317.0, "step": 27450 }, { "entropy": 6.252782678604126, "epoch": 3.1684939411425272, "grad_norm": 0.98046875, "learning_rate": 0.00040213346426609453, "loss": 5.5741, "mean_token_accuracy": 0.21533328890800477, "num_tokens": 69577656.0, "step": 27455 }, { "entropy": 6.247058582305908, "epoch": 3.169070975187536, "grad_norm": 1.0859375, "learning_rate": 0.00040209941634992226, "loss": 5.636, "mean_token_accuracy": 0.20528533160686493, "num_tokens": 69589020.0, "step": 27460 }, { "entropy": 6.313159418106079, "epoch": 3.1696480092325445, "grad_norm": 1.0234375, "learning_rate": 0.0004020653641588242, "loss": 5.5357, "mean_token_accuracy": 0.20915761291980745, "num_tokens": 69602003.0, "step": 27465 }, { "entropy": 6.373856019973755, "epoch": 3.1702250432775534, "grad_norm": 1.1015625, "learning_rate": 0.0004020313076939458, "loss": 5.6616, "mean_token_accuracy": 0.20044861137866973, "num_tokens": 69614123.0, "step": 27470 }, { "entropy": 6.242585468292236, "epoch": 3.170802077322562, "grad_norm": 1.140625, "learning_rate": 0.0004019972469564325, "loss": 5.4299, "mean_token_accuracy": 0.23054350465536116, "num_tokens": 69628490.0, "step": 27475 }, { "entropy": 6.280749320983887, "epoch": 3.1713791113675707, "grad_norm": 1.09375, "learning_rate": 0.00040196318194742975, "loss": 5.6037, "mean_token_accuracy": 0.20541918128728867, "num_tokens": 69641313.0, "step": 27480 }, { "entropy": 6.206954908370972, "epoch": 3.1719561454125795, "grad_norm": 1.0078125, "learning_rate": 0.00040192911266808356, "loss": 5.4818, "mean_token_accuracy": 0.21847744137048722, "num_tokens": 69652849.0, "step": 27485 }, { "entropy": 6.232199478149414, "epoch": 3.172533179457588, "grad_norm": 1.078125, "learning_rate": 0.0004018950391195397, "loss": 5.6218, "mean_token_accuracy": 0.20890334695577623, "num_tokens": 69664396.0, "step": 27490 }, { "entropy": 6.285357141494751, "epoch": 3.173110213502597, "grad_norm": 1.09375, "learning_rate": 0.0004018609613029442, "loss": 5.5782, "mean_token_accuracy": 0.20930920541286469, "num_tokens": 69677022.0, "step": 27495 }, { "entropy": 6.323891353607178, "epoch": 3.1736872475476052, "grad_norm": 1.03125, "learning_rate": 0.0004018268792194433, "loss": 5.6336, "mean_token_accuracy": 0.20908631831407548, "num_tokens": 69689132.0, "step": 27500 }, { "entropy": 6.304812049865722, "epoch": 3.174264281592614, "grad_norm": 1.0390625, "learning_rate": 0.00040179279287018334, "loss": 5.6298, "mean_token_accuracy": 0.21073980033397674, "num_tokens": 69701704.0, "step": 27505 }, { "entropy": 6.332776212692261, "epoch": 3.1748413156376225, "grad_norm": 1.0078125, "learning_rate": 0.00040175870225631066, "loss": 5.6905, "mean_token_accuracy": 0.20020752251148224, "num_tokens": 69715362.0, "step": 27510 }, { "entropy": 6.301869249343872, "epoch": 3.1754183496826314, "grad_norm": 1.1875, "learning_rate": 0.0004017246073789721, "loss": 5.5674, "mean_token_accuracy": 0.21162350177764894, "num_tokens": 69726745.0, "step": 27515 }, { "entropy": 6.2439533233642575, "epoch": 3.17599538372764, "grad_norm": 1.0546875, "learning_rate": 0.0004016905082393143, "loss": 5.5599, "mean_token_accuracy": 0.2112882673740387, "num_tokens": 69740074.0, "step": 27520 }, { "entropy": 6.263936328887939, "epoch": 3.1765724177726486, "grad_norm": 1.0546875, "learning_rate": 0.00040165640483848415, "loss": 5.6397, "mean_token_accuracy": 0.20963733941316604, "num_tokens": 69751220.0, "step": 27525 }, { "entropy": 6.283355474472046, "epoch": 3.177149451817657, "grad_norm": 1.015625, "learning_rate": 0.00040162229717762883, "loss": 5.671, "mean_token_accuracy": 0.20413481444120407, "num_tokens": 69764532.0, "step": 27530 }, { "entropy": 6.324439239501953, "epoch": 3.177726485862666, "grad_norm": 0.99609375, "learning_rate": 0.0004015881852578953, "loss": 5.6126, "mean_token_accuracy": 0.21073076426982879, "num_tokens": 69776862.0, "step": 27535 }, { "entropy": 6.224767017364502, "epoch": 3.1783035199076743, "grad_norm": 1.1015625, "learning_rate": 0.00040155406908043114, "loss": 5.5527, "mean_token_accuracy": 0.21479014605283736, "num_tokens": 69789667.0, "step": 27540 }, { "entropy": 6.252235460281372, "epoch": 3.178880553952683, "grad_norm": 1.015625, "learning_rate": 0.0004015199486463837, "loss": 5.5906, "mean_token_accuracy": 0.20748069733381272, "num_tokens": 69802112.0, "step": 27545 }, { "entropy": 6.264982891082764, "epoch": 3.179457587997692, "grad_norm": 1.0625, "learning_rate": 0.0004014858239569006, "loss": 5.6207, "mean_token_accuracy": 0.20792896747589112, "num_tokens": 69813908.0, "step": 27550 }, { "entropy": 6.266288805007934, "epoch": 3.1800346220427005, "grad_norm": 1.125, "learning_rate": 0.00040145169501312966, "loss": 5.5262, "mean_token_accuracy": 0.2130235105752945, "num_tokens": 69825920.0, "step": 27555 }, { "entropy": 6.2486350536346436, "epoch": 3.1806116560877093, "grad_norm": 1.03125, "learning_rate": 0.0004014175618162188, "loss": 5.5743, "mean_token_accuracy": 0.21307513862848282, "num_tokens": 69839657.0, "step": 27560 }, { "entropy": 6.318980026245117, "epoch": 3.1811886901327178, "grad_norm": 1.015625, "learning_rate": 0.00040138342436731603, "loss": 5.6132, "mean_token_accuracy": 0.21092232167720795, "num_tokens": 69851778.0, "step": 27565 }, { "entropy": 6.321287345886231, "epoch": 3.1817657241777266, "grad_norm": 1.046875, "learning_rate": 0.00040134928266756954, "loss": 5.6269, "mean_token_accuracy": 0.21056060791015624, "num_tokens": 69865011.0, "step": 27570 }, { "entropy": 6.273618221282959, "epoch": 3.182342758222735, "grad_norm": 1.0234375, "learning_rate": 0.0004013151367181277, "loss": 5.6523, "mean_token_accuracy": 0.19915929585695266, "num_tokens": 69877740.0, "step": 27575 }, { "entropy": 6.346502494812012, "epoch": 3.182919792267744, "grad_norm": 1.03125, "learning_rate": 0.0004012809865201391, "loss": 5.636, "mean_token_accuracy": 0.20563179701566697, "num_tokens": 69890102.0, "step": 27580 }, { "entropy": 6.264924144744873, "epoch": 3.1834968263127523, "grad_norm": 1.1171875, "learning_rate": 0.00040124683207475205, "loss": 5.5374, "mean_token_accuracy": 0.20749433487653732, "num_tokens": 69902500.0, "step": 27585 }, { "entropy": 6.2506874084472654, "epoch": 3.184073860357761, "grad_norm": 1.03125, "learning_rate": 0.00040121267338311556, "loss": 5.6448, "mean_token_accuracy": 0.20517605543136597, "num_tokens": 69915013.0, "step": 27590 }, { "entropy": 6.2499970436096195, "epoch": 3.1846508944027696, "grad_norm": 1.0546875, "learning_rate": 0.00040117851044637855, "loss": 5.4712, "mean_token_accuracy": 0.23161206990480424, "num_tokens": 69927149.0, "step": 27595 }, { "entropy": 6.360048389434814, "epoch": 3.1852279284477785, "grad_norm": 1.109375, "learning_rate": 0.00040114434326569005, "loss": 5.5944, "mean_token_accuracy": 0.210802061855793, "num_tokens": 69939924.0, "step": 27600 }, { "entropy": 6.280166292190552, "epoch": 3.185804962492787, "grad_norm": 1.0625, "learning_rate": 0.00040111017184219915, "loss": 5.5985, "mean_token_accuracy": 0.2071852743625641, "num_tokens": 69952068.0, "step": 27605 }, { "entropy": 6.2078742504119875, "epoch": 3.1863819965377957, "grad_norm": 1.09375, "learning_rate": 0.00040107599617705527, "loss": 5.5557, "mean_token_accuracy": 0.2157674178481102, "num_tokens": 69965270.0, "step": 27610 }, { "entropy": 6.338355827331543, "epoch": 3.1869590305828046, "grad_norm": 1.015625, "learning_rate": 0.000401041816271408, "loss": 5.6781, "mean_token_accuracy": 0.2052323579788208, "num_tokens": 69977138.0, "step": 27615 }, { "entropy": 6.320180177688599, "epoch": 3.187536064627813, "grad_norm": 1.015625, "learning_rate": 0.00040100763212640666, "loss": 5.6616, "mean_token_accuracy": 0.19994750171899794, "num_tokens": 69989599.0, "step": 27620 }, { "entropy": 6.358773803710937, "epoch": 3.188113098672822, "grad_norm": 1.0546875, "learning_rate": 0.0004009734437432013, "loss": 5.6823, "mean_token_accuracy": 0.20146895945072174, "num_tokens": 70000887.0, "step": 27625 }, { "entropy": 6.226112937927246, "epoch": 3.1886901327178303, "grad_norm": 0.99609375, "learning_rate": 0.00040093925112294173, "loss": 5.5712, "mean_token_accuracy": 0.21095245629549025, "num_tokens": 70013868.0, "step": 27630 }, { "entropy": 6.331230592727661, "epoch": 3.189267166762839, "grad_norm": 1.0, "learning_rate": 0.000400905054266778, "loss": 5.5941, "mean_token_accuracy": 0.20924849212169647, "num_tokens": 70026307.0, "step": 27635 }, { "entropy": 6.142955780029297, "epoch": 3.1898442008078476, "grad_norm": 1.0859375, "learning_rate": 0.0004008708531758603, "loss": 5.4904, "mean_token_accuracy": 0.22738755792379378, "num_tokens": 70040481.0, "step": 27640 }, { "entropy": 6.222723340988159, "epoch": 3.1904212348528564, "grad_norm": 1.1484375, "learning_rate": 0.000400836647851339, "loss": 5.5182, "mean_token_accuracy": 0.21491173952817916, "num_tokens": 70052067.0, "step": 27645 }, { "entropy": 6.338092613220215, "epoch": 3.190998268897865, "grad_norm": 0.98046875, "learning_rate": 0.0004008024382943645, "loss": 5.7041, "mean_token_accuracy": 0.19662541896104813, "num_tokens": 70064513.0, "step": 27650 }, { "entropy": 6.270896959304809, "epoch": 3.1915753029428737, "grad_norm": 0.9609375, "learning_rate": 0.00040076822450608757, "loss": 5.5628, "mean_token_accuracy": 0.2107571467757225, "num_tokens": 70077496.0, "step": 27655 }, { "entropy": 6.271143531799316, "epoch": 3.192152336987882, "grad_norm": 0.9296875, "learning_rate": 0.0004007340064876588, "loss": 5.65, "mean_token_accuracy": 0.20753124058246614, "num_tokens": 70091035.0, "step": 27660 }, { "entropy": 6.325913524627685, "epoch": 3.192729371032891, "grad_norm": 0.97265625, "learning_rate": 0.0004006997842402292, "loss": 5.6868, "mean_token_accuracy": 0.21040206849575044, "num_tokens": 70104773.0, "step": 27665 }, { "entropy": 6.315602350234985, "epoch": 3.1933064050778994, "grad_norm": 1.0546875, "learning_rate": 0.0004006655577649498, "loss": 5.6489, "mean_token_accuracy": 0.20770303755998612, "num_tokens": 70118019.0, "step": 27670 }, { "entropy": 6.219042682647705, "epoch": 3.1938834391229083, "grad_norm": 1.125, "learning_rate": 0.0004006313270629718, "loss": 5.6185, "mean_token_accuracy": 0.20558024644851686, "num_tokens": 70130642.0, "step": 27675 }, { "entropy": 6.247573614120483, "epoch": 3.1944604731679167, "grad_norm": 1.0390625, "learning_rate": 0.00040059709213544656, "loss": 5.4989, "mean_token_accuracy": 0.21556481420993806, "num_tokens": 70144053.0, "step": 27680 }, { "entropy": 6.30216064453125, "epoch": 3.1950375072129256, "grad_norm": 1.046875, "learning_rate": 0.0004005628529835255, "loss": 5.5967, "mean_token_accuracy": 0.21224593371152878, "num_tokens": 70156765.0, "step": 27685 }, { "entropy": 6.253412389755249, "epoch": 3.1956145412579344, "grad_norm": 1.0234375, "learning_rate": 0.0004005286096083602, "loss": 5.5677, "mean_token_accuracy": 0.2115750342607498, "num_tokens": 70169515.0, "step": 27690 }, { "entropy": 6.2662559986114506, "epoch": 3.196191575302943, "grad_norm": 1.015625, "learning_rate": 0.00040049436201110246, "loss": 5.6026, "mean_token_accuracy": 0.2084380328655243, "num_tokens": 70183958.0, "step": 27695 }, { "entropy": 6.354892635345459, "epoch": 3.1967686093479517, "grad_norm": 1.0625, "learning_rate": 0.00040046011019290417, "loss": 5.6594, "mean_token_accuracy": 0.20018485486507415, "num_tokens": 70196381.0, "step": 27700 }, { "entropy": 6.2231262683868405, "epoch": 3.19734564339296, "grad_norm": 0.96484375, "learning_rate": 0.00040042585415491747, "loss": 5.6192, "mean_token_accuracy": 0.20663388222455978, "num_tokens": 70208685.0, "step": 27705 }, { "entropy": 6.333509063720703, "epoch": 3.197922677437969, "grad_norm": 1.078125, "learning_rate": 0.0004003915938982944, "loss": 5.6745, "mean_token_accuracy": 0.19874417632818223, "num_tokens": 70220651.0, "step": 27710 }, { "entropy": 6.340093517303467, "epoch": 3.1984997114829774, "grad_norm": 0.98046875, "learning_rate": 0.0004003573294241875, "loss": 5.6571, "mean_token_accuracy": 0.20003794878721237, "num_tokens": 70233315.0, "step": 27715 }, { "entropy": 6.289077997207642, "epoch": 3.1990767455279863, "grad_norm": 1.0703125, "learning_rate": 0.00040032306073374893, "loss": 5.576, "mean_token_accuracy": 0.2127383291721344, "num_tokens": 70244845.0, "step": 27720 }, { "entropy": 6.2947831630706785, "epoch": 3.1996537795729947, "grad_norm": 1.0, "learning_rate": 0.0004002887878281315, "loss": 5.646, "mean_token_accuracy": 0.20544152855873107, "num_tokens": 70258242.0, "step": 27725 }, { "entropy": 6.349194049835205, "epoch": 3.2002308136180035, "grad_norm": 1.046875, "learning_rate": 0.00040025451070848793, "loss": 5.6876, "mean_token_accuracy": 0.1993110626935959, "num_tokens": 70270568.0, "step": 27730 }, { "entropy": 6.300068759918213, "epoch": 3.200807847663012, "grad_norm": 1.046875, "learning_rate": 0.00040022022937597114, "loss": 5.5714, "mean_token_accuracy": 0.2096689373254776, "num_tokens": 70284180.0, "step": 27735 }, { "entropy": 6.359479761123657, "epoch": 3.201384881708021, "grad_norm": 1.1328125, "learning_rate": 0.00040018594383173407, "loss": 5.69, "mean_token_accuracy": 0.20331769734621047, "num_tokens": 70296970.0, "step": 27740 }, { "entropy": 6.3019129753112795, "epoch": 3.2019619157530292, "grad_norm": 1.015625, "learning_rate": 0.00040015165407693005, "loss": 5.5914, "mean_token_accuracy": 0.20650949329137802, "num_tokens": 70308814.0, "step": 27745 }, { "entropy": 6.270701169967651, "epoch": 3.202538949798038, "grad_norm": 1.078125, "learning_rate": 0.0004001173601127123, "loss": 5.6116, "mean_token_accuracy": 0.2111584186553955, "num_tokens": 70320608.0, "step": 27750 }, { "entropy": 6.176051235198974, "epoch": 3.2031159838430465, "grad_norm": 1.0234375, "learning_rate": 0.00040008306194023427, "loss": 5.565, "mean_token_accuracy": 0.21348786652088164, "num_tokens": 70333550.0, "step": 27755 }, { "entropy": 6.268049192428589, "epoch": 3.2036930178880554, "grad_norm": 1.03125, "learning_rate": 0.0004000487595606496, "loss": 5.5364, "mean_token_accuracy": 0.21447824239730834, "num_tokens": 70346417.0, "step": 27760 }, { "entropy": 6.297869777679443, "epoch": 3.2042700519330642, "grad_norm": 1.046875, "learning_rate": 0.0004000144529751119, "loss": 5.5939, "mean_token_accuracy": 0.20830464810132981, "num_tokens": 70359820.0, "step": 27765 }, { "entropy": 6.267748165130615, "epoch": 3.2048470859780727, "grad_norm": 1.015625, "learning_rate": 0.0003999801421847753, "loss": 5.6366, "mean_token_accuracy": 0.21027962416410445, "num_tokens": 70373835.0, "step": 27770 }, { "entropy": 6.256307220458984, "epoch": 3.2054241200230815, "grad_norm": 1.046875, "learning_rate": 0.00039994582719079364, "loss": 5.5618, "mean_token_accuracy": 0.213333335518837, "num_tokens": 70387162.0, "step": 27775 }, { "entropy": 6.318533182144165, "epoch": 3.20600115406809, "grad_norm": 1.03125, "learning_rate": 0.00039991150799432117, "loss": 5.6341, "mean_token_accuracy": 0.20636617988348008, "num_tokens": 70399443.0, "step": 27780 }, { "entropy": 6.282486343383789, "epoch": 3.206578188113099, "grad_norm": 1.0546875, "learning_rate": 0.0003998771845965122, "loss": 5.5634, "mean_token_accuracy": 0.21318477839231492, "num_tokens": 70411256.0, "step": 27785 }, { "entropy": 6.239754247665405, "epoch": 3.207155222158107, "grad_norm": 1.0234375, "learning_rate": 0.00039984285699852116, "loss": 5.5767, "mean_token_accuracy": 0.21819828897714616, "num_tokens": 70424327.0, "step": 27790 }, { "entropy": 6.26032509803772, "epoch": 3.207732256203116, "grad_norm": 1.1015625, "learning_rate": 0.00039980852520150255, "loss": 5.5725, "mean_token_accuracy": 0.21529716551303862, "num_tokens": 70436869.0, "step": 27795 }, { "entropy": 6.261692047119141, "epoch": 3.2083092902481245, "grad_norm": 1.0703125, "learning_rate": 0.0003997741892066113, "loss": 5.6179, "mean_token_accuracy": 0.2112206056714058, "num_tokens": 70449803.0, "step": 27800 }, { "entropy": 6.292197179794312, "epoch": 3.2088863242931334, "grad_norm": 1.0859375, "learning_rate": 0.0003997398490150021, "loss": 5.6243, "mean_token_accuracy": 0.20314894914627074, "num_tokens": 70461822.0, "step": 27805 }, { "entropy": 6.2733073234558105, "epoch": 3.209463358338142, "grad_norm": 1.0625, "learning_rate": 0.0003997055046278301, "loss": 5.5934, "mean_token_accuracy": 0.20994288921356202, "num_tokens": 70473906.0, "step": 27810 }, { "entropy": 6.158846473693847, "epoch": 3.2100403923831506, "grad_norm": 1.015625, "learning_rate": 0.0003996711560462503, "loss": 5.5009, "mean_token_accuracy": 0.22262994050979615, "num_tokens": 70486915.0, "step": 27815 }, { "entropy": 6.341830444335938, "epoch": 3.210617426428159, "grad_norm": 1.046875, "learning_rate": 0.0003996368032714182, "loss": 5.6136, "mean_token_accuracy": 0.21167494505643844, "num_tokens": 70500180.0, "step": 27820 }, { "entropy": 6.248844385147095, "epoch": 3.211194460473168, "grad_norm": 1.0, "learning_rate": 0.0003996024463044891, "loss": 5.5626, "mean_token_accuracy": 0.2101464420557022, "num_tokens": 70512785.0, "step": 27825 }, { "entropy": 6.281163167953491, "epoch": 3.2117714945181763, "grad_norm": 1.1015625, "learning_rate": 0.0003995680851466186, "loss": 5.6491, "mean_token_accuracy": 0.20411243438720703, "num_tokens": 70525187.0, "step": 27830 }, { "entropy": 6.297643566131592, "epoch": 3.212348528563185, "grad_norm": 1.0625, "learning_rate": 0.0003995337197989624, "loss": 5.6097, "mean_token_accuracy": 0.20550436079502105, "num_tokens": 70538252.0, "step": 27835 }, { "entropy": 6.200496339797974, "epoch": 3.212925562608194, "grad_norm": 1.0390625, "learning_rate": 0.00039949935026267644, "loss": 5.6193, "mean_token_accuracy": 0.208396115899086, "num_tokens": 70549826.0, "step": 27840 }, { "entropy": 6.328450870513916, "epoch": 3.2135025966532025, "grad_norm": 1.1015625, "learning_rate": 0.00039946497653891666, "loss": 5.5831, "mean_token_accuracy": 0.21371688395738603, "num_tokens": 70561580.0, "step": 27845 }, { "entropy": 6.355673456192017, "epoch": 3.2140796306982113, "grad_norm": 1.0390625, "learning_rate": 0.00039943059862883925, "loss": 5.7416, "mean_token_accuracy": 0.1989153578877449, "num_tokens": 70575246.0, "step": 27850 }, { "entropy": 6.368279218673706, "epoch": 3.2146566647432198, "grad_norm": 1.0234375, "learning_rate": 0.00039939621653360045, "loss": 5.7283, "mean_token_accuracy": 0.20136324614286422, "num_tokens": 70588457.0, "step": 27855 }, { "entropy": 6.3300799369812015, "epoch": 3.2152336987882286, "grad_norm": 1.0625, "learning_rate": 0.0003993618302543566, "loss": 5.6379, "mean_token_accuracy": 0.20687256753444672, "num_tokens": 70599772.0, "step": 27860 }, { "entropy": 6.266088533401489, "epoch": 3.215810732833237, "grad_norm": 1.125, "learning_rate": 0.0003993274397922645, "loss": 5.5567, "mean_token_accuracy": 0.21045310646295548, "num_tokens": 70611901.0, "step": 27865 }, { "entropy": 6.253934097290039, "epoch": 3.216387766878246, "grad_norm": 0.953125, "learning_rate": 0.0003992930451484807, "loss": 5.58, "mean_token_accuracy": 0.21429014801979065, "num_tokens": 70625613.0, "step": 27870 }, { "entropy": 6.341644430160523, "epoch": 3.2169648009232543, "grad_norm": 1.0625, "learning_rate": 0.000399258646324162, "loss": 5.7207, "mean_token_accuracy": 0.204912930727005, "num_tokens": 70639286.0, "step": 27875 }, { "entropy": 6.345269680023193, "epoch": 3.217541834968263, "grad_norm": 1.0703125, "learning_rate": 0.0003992242433204655, "loss": 5.6471, "mean_token_accuracy": 0.20461164116859437, "num_tokens": 70651021.0, "step": 27880 }, { "entropy": 6.308106279373169, "epoch": 3.2181188690132716, "grad_norm": 1.0390625, "learning_rate": 0.00039918983613854825, "loss": 5.5943, "mean_token_accuracy": 0.21146236062049867, "num_tokens": 70664417.0, "step": 27885 }, { "entropy": 6.263552618026734, "epoch": 3.2186959030582805, "grad_norm": 1.1171875, "learning_rate": 0.0003991554247795676, "loss": 5.5909, "mean_token_accuracy": 0.20829192996025087, "num_tokens": 70677517.0, "step": 27890 }, { "entropy": 6.308443307876587, "epoch": 3.2192729371032893, "grad_norm": 1.0546875, "learning_rate": 0.0003991210092446808, "loss": 5.624, "mean_token_accuracy": 0.2079137921333313, "num_tokens": 70689746.0, "step": 27895 }, { "entropy": 6.295773315429687, "epoch": 3.2198499711482977, "grad_norm": 1.1171875, "learning_rate": 0.00039908658953504567, "loss": 5.6715, "mean_token_accuracy": 0.2030926451086998, "num_tokens": 70702356.0, "step": 27900 }, { "entropy": 6.12532901763916, "epoch": 3.2204270051933066, "grad_norm": 1.015625, "learning_rate": 0.00039905216565181963, "loss": 5.4842, "mean_token_accuracy": 0.22245388329029084, "num_tokens": 70715147.0, "step": 27905 }, { "entropy": 6.380943965911865, "epoch": 3.221004039238315, "grad_norm": 1.0859375, "learning_rate": 0.0003990177375961607, "loss": 5.7468, "mean_token_accuracy": 0.20233649611473084, "num_tokens": 70727951.0, "step": 27910 }, { "entropy": 6.2903014659881595, "epoch": 3.221581073283324, "grad_norm": 1.0859375, "learning_rate": 0.00039898330536922665, "loss": 5.5551, "mean_token_accuracy": 0.20987427979707718, "num_tokens": 70740823.0, "step": 27915 }, { "entropy": 6.329444456100464, "epoch": 3.2221581073283323, "grad_norm": 1.0546875, "learning_rate": 0.0003989488689721758, "loss": 5.5988, "mean_token_accuracy": 0.20744044780731202, "num_tokens": 70753323.0, "step": 27920 }, { "entropy": 6.2619959831237795, "epoch": 3.222735141373341, "grad_norm": 1.0703125, "learning_rate": 0.0003989144284061662, "loss": 5.5746, "mean_token_accuracy": 0.2115836262702942, "num_tokens": 70765546.0, "step": 27925 }, { "entropy": 6.2213132858276365, "epoch": 3.2233121754183496, "grad_norm": 1.0234375, "learning_rate": 0.0003988799836723565, "loss": 5.5977, "mean_token_accuracy": 0.2093339666724205, "num_tokens": 70778869.0, "step": 27930 }, { "entropy": 6.262832975387573, "epoch": 3.2238892094633584, "grad_norm": 1.0390625, "learning_rate": 0.000398845534771905, "loss": 5.5693, "mean_token_accuracy": 0.21546707451343536, "num_tokens": 70792227.0, "step": 27935 }, { "entropy": 6.37469630241394, "epoch": 3.224466243508367, "grad_norm": 1.1328125, "learning_rate": 0.0003988110817059705, "loss": 5.6839, "mean_token_accuracy": 0.20589757710695267, "num_tokens": 70804979.0, "step": 27940 }, { "entropy": 6.250352668762207, "epoch": 3.2250432775533757, "grad_norm": 1.0625, "learning_rate": 0.0003987766244757117, "loss": 5.6006, "mean_token_accuracy": 0.2121186524629593, "num_tokens": 70817538.0, "step": 27945 }, { "entropy": 6.312923622131348, "epoch": 3.225620311598384, "grad_norm": 1.09375, "learning_rate": 0.00039874216308228764, "loss": 5.6607, "mean_token_accuracy": 0.2053826630115509, "num_tokens": 70830186.0, "step": 27950 }, { "entropy": 6.2706263065338135, "epoch": 3.226197345643393, "grad_norm": 1.0546875, "learning_rate": 0.00039870769752685744, "loss": 5.6436, "mean_token_accuracy": 0.20785950124263763, "num_tokens": 70841367.0, "step": 27955 }, { "entropy": 6.311527585983276, "epoch": 3.2267743796884014, "grad_norm": 1.1015625, "learning_rate": 0.00039867322781058024, "loss": 5.5655, "mean_token_accuracy": 0.21646139323711394, "num_tokens": 70853630.0, "step": 27960 }, { "entropy": 6.343416309356689, "epoch": 3.2273514137334103, "grad_norm": 1.0, "learning_rate": 0.00039863875393461546, "loss": 5.7074, "mean_token_accuracy": 0.20554562658071518, "num_tokens": 70866966.0, "step": 27965 }, { "entropy": 6.289302349090576, "epoch": 3.227928447778419, "grad_norm": 1.2109375, "learning_rate": 0.0003986042759001226, "loss": 5.6117, "mean_token_accuracy": 0.20529442876577378, "num_tokens": 70879287.0, "step": 27970 }, { "entropy": 6.241036605834961, "epoch": 3.2285054818234276, "grad_norm": 1.03125, "learning_rate": 0.0003985697937082613, "loss": 5.5459, "mean_token_accuracy": 0.21563542932271956, "num_tokens": 70892749.0, "step": 27975 }, { "entropy": 6.311645650863648, "epoch": 3.2290825158684364, "grad_norm": 0.98828125, "learning_rate": 0.00039853530736019143, "loss": 5.5984, "mean_token_accuracy": 0.21169278621673585, "num_tokens": 70905463.0, "step": 27980 }, { "entropy": 6.3477307796478275, "epoch": 3.229659549913445, "grad_norm": 1.015625, "learning_rate": 0.0003985008168570728, "loss": 5.5974, "mean_token_accuracy": 0.2101701855659485, "num_tokens": 70919630.0, "step": 27985 }, { "entropy": 6.27520055770874, "epoch": 3.2302365839584537, "grad_norm": 1.046875, "learning_rate": 0.0003984663222000656, "loss": 5.5627, "mean_token_accuracy": 0.21044061034917833, "num_tokens": 70931810.0, "step": 27990 }, { "entropy": 6.233928871154785, "epoch": 3.230813618003462, "grad_norm": 1.0390625, "learning_rate": 0.00039843182339032997, "loss": 5.604, "mean_token_accuracy": 0.20826649367809297, "num_tokens": 70945003.0, "step": 27995 }, { "entropy": 6.278956174850464, "epoch": 3.231390652048471, "grad_norm": 1.015625, "learning_rate": 0.0003983973204290263, "loss": 5.5805, "mean_token_accuracy": 0.22130182087421418, "num_tokens": 70958889.0, "step": 28000 }, { "entropy": 6.269268035888672, "epoch": 3.2319676860934794, "grad_norm": 1.046875, "learning_rate": 0.00039836281331731495, "loss": 5.5308, "mean_token_accuracy": 0.21276628226041794, "num_tokens": 70972003.0, "step": 28005 }, { "entropy": 6.324998950958252, "epoch": 3.2325447201384883, "grad_norm": 1.0625, "learning_rate": 0.00039832830205635675, "loss": 5.662, "mean_token_accuracy": 0.1976704940199852, "num_tokens": 70984269.0, "step": 28010 }, { "entropy": 6.238791275024414, "epoch": 3.2331217541834967, "grad_norm": 0.96875, "learning_rate": 0.00039829378664731226, "loss": 5.5839, "mean_token_accuracy": 0.20920709371566773, "num_tokens": 70998602.0, "step": 28015 }, { "entropy": 6.357817316055298, "epoch": 3.2336987882285055, "grad_norm": 1.0234375, "learning_rate": 0.00039825926709134257, "loss": 5.6212, "mean_token_accuracy": 0.21046290844678878, "num_tokens": 71011095.0, "step": 28020 }, { "entropy": 6.33611650466919, "epoch": 3.234275822273514, "grad_norm": 1.0625, "learning_rate": 0.0003982247433896087, "loss": 5.6622, "mean_token_accuracy": 0.2019645854830742, "num_tokens": 71022610.0, "step": 28025 }, { "entropy": 6.31957311630249, "epoch": 3.234852856318523, "grad_norm": 0.953125, "learning_rate": 0.00039819021554327174, "loss": 5.6771, "mean_token_accuracy": 0.20578875839710237, "num_tokens": 71035896.0, "step": 28030 }, { "entropy": 6.3138000011444095, "epoch": 3.2354298903635312, "grad_norm": 1.0703125, "learning_rate": 0.0003981556835534931, "loss": 5.6395, "mean_token_accuracy": 0.20976679176092147, "num_tokens": 71047793.0, "step": 28035 }, { "entropy": 6.342609310150147, "epoch": 3.23600692440854, "grad_norm": 1.046875, "learning_rate": 0.0003981211474214342, "loss": 5.6558, "mean_token_accuracy": 0.20807725340127944, "num_tokens": 71060481.0, "step": 28040 }, { "entropy": 6.3144979000091555, "epoch": 3.236583958453549, "grad_norm": 0.9296875, "learning_rate": 0.0003980866071482566, "loss": 5.6154, "mean_token_accuracy": 0.21544622182846068, "num_tokens": 71073757.0, "step": 28045 }, { "entropy": 6.278196096420288, "epoch": 3.2371609924985574, "grad_norm": 1.0078125, "learning_rate": 0.0003980520627351222, "loss": 5.6371, "mean_token_accuracy": 0.2110177367925644, "num_tokens": 71087158.0, "step": 28050 }, { "entropy": 6.293360805511474, "epoch": 3.2377380265435662, "grad_norm": 1.046875, "learning_rate": 0.0003980175141831928, "loss": 5.6586, "mean_token_accuracy": 0.20277148783206939, "num_tokens": 71099242.0, "step": 28055 }, { "entropy": 6.3236627101898195, "epoch": 3.2383150605885747, "grad_norm": 1.203125, "learning_rate": 0.00039798296149363033, "loss": 5.5717, "mean_token_accuracy": 0.21038787364959716, "num_tokens": 71110971.0, "step": 28060 }, { "entropy": 6.296569919586181, "epoch": 3.2388920946335835, "grad_norm": 0.9765625, "learning_rate": 0.00039794840466759714, "loss": 5.6877, "mean_token_accuracy": 0.20707605481147767, "num_tokens": 71125024.0, "step": 28065 }, { "entropy": 6.233076190948486, "epoch": 3.239469128678592, "grad_norm": 1.1328125, "learning_rate": 0.00039791384370625537, "loss": 5.5003, "mean_token_accuracy": 0.21342584788799285, "num_tokens": 71138030.0, "step": 28070 }, { "entropy": 6.321987152099609, "epoch": 3.240046162723601, "grad_norm": 1.0, "learning_rate": 0.0003978792786107675, "loss": 5.675, "mean_token_accuracy": 0.20538391321897506, "num_tokens": 71150763.0, "step": 28075 }, { "entropy": 6.2939611911773685, "epoch": 3.240623196768609, "grad_norm": 1.0234375, "learning_rate": 0.00039784470938229624, "loss": 5.5428, "mean_token_accuracy": 0.21491851210594176, "num_tokens": 71163235.0, "step": 28080 }, { "entropy": 6.229140186309815, "epoch": 3.241200230813618, "grad_norm": 1.0859375, "learning_rate": 0.00039781013602200406, "loss": 5.5898, "mean_token_accuracy": 0.2084824711084366, "num_tokens": 71176119.0, "step": 28085 }, { "entropy": 6.285769939422607, "epoch": 3.2417772648586265, "grad_norm": 0.98046875, "learning_rate": 0.0003977755585310541, "loss": 5.5387, "mean_token_accuracy": 0.21307590901851653, "num_tokens": 71190919.0, "step": 28090 }, { "entropy": 6.356187438964843, "epoch": 3.2423542989036354, "grad_norm": 1.0703125, "learning_rate": 0.0003977409769106091, "loss": 5.6566, "mean_token_accuracy": 0.20235351622104644, "num_tokens": 71202589.0, "step": 28095 }, { "entropy": 6.2381542205810545, "epoch": 3.2429313329486438, "grad_norm": 1.1640625, "learning_rate": 0.0003977063911618323, "loss": 5.593, "mean_token_accuracy": 0.21057060956954957, "num_tokens": 71214632.0, "step": 28100 }, { "entropy": 6.2058404922485355, "epoch": 3.2435083669936526, "grad_norm": 1.0625, "learning_rate": 0.0003976718012858871, "loss": 5.5624, "mean_token_accuracy": 0.21571868062019348, "num_tokens": 71226864.0, "step": 28105 }, { "entropy": 6.311150979995728, "epoch": 3.244085401038661, "grad_norm": 1.1484375, "learning_rate": 0.0003976372072839367, "loss": 5.5871, "mean_token_accuracy": 0.2063691273331642, "num_tokens": 71239254.0, "step": 28110 }, { "entropy": 6.275713491439819, "epoch": 3.24466243508367, "grad_norm": 1.1328125, "learning_rate": 0.0003976026091571448, "loss": 5.6598, "mean_token_accuracy": 0.2048112466931343, "num_tokens": 71252215.0, "step": 28115 }, { "entropy": 6.249961233139038, "epoch": 3.2452394691286788, "grad_norm": 1.0859375, "learning_rate": 0.00039756800690667505, "loss": 5.6184, "mean_token_accuracy": 0.21261906772851943, "num_tokens": 71263733.0, "step": 28120 }, { "entropy": 6.299106931686401, "epoch": 3.245816503173687, "grad_norm": 1.1953125, "learning_rate": 0.00039753340053369116, "loss": 5.6331, "mean_token_accuracy": 0.2125547230243683, "num_tokens": 71277556.0, "step": 28125 }, { "entropy": 6.373852252960205, "epoch": 3.246393537218696, "grad_norm": 1.03125, "learning_rate": 0.00039749879003935743, "loss": 5.6853, "mean_token_accuracy": 0.20810510367155075, "num_tokens": 71289942.0, "step": 28130 }, { "entropy": 6.4134961605072025, "epoch": 3.2469705712637045, "grad_norm": 1.0625, "learning_rate": 0.0003974641754248375, "loss": 5.7578, "mean_token_accuracy": 0.19679180830717086, "num_tokens": 71302517.0, "step": 28135 }, { "entropy": 6.2775185108184814, "epoch": 3.2475476053087133, "grad_norm": 0.98828125, "learning_rate": 0.00039742955669129607, "loss": 5.6319, "mean_token_accuracy": 0.20732229799032212, "num_tokens": 71315022.0, "step": 28140 }, { "entropy": 6.203256368637085, "epoch": 3.2481246393537218, "grad_norm": 1.03125, "learning_rate": 0.00039739493383989714, "loss": 5.4919, "mean_token_accuracy": 0.21541567146778107, "num_tokens": 71329335.0, "step": 28145 }, { "entropy": 6.2658182144165036, "epoch": 3.2487016733987306, "grad_norm": 0.921875, "learning_rate": 0.0003973603068718055, "loss": 5.6549, "mean_token_accuracy": 0.20978374183177947, "num_tokens": 71342739.0, "step": 28150 }, { "entropy": 6.2376518726348875, "epoch": 3.249278707443739, "grad_norm": 1.125, "learning_rate": 0.00039732567578818574, "loss": 5.5415, "mean_token_accuracy": 0.2126510486006737, "num_tokens": 71355367.0, "step": 28155 }, { "entropy": 6.30504207611084, "epoch": 3.249855741488748, "grad_norm": 1.1796875, "learning_rate": 0.0003972910405902026, "loss": 5.5888, "mean_token_accuracy": 0.21027828454971315, "num_tokens": 71367163.0, "step": 28160 }, { "entropy": 6.241604042053223, "epoch": 3.2504327755337563, "grad_norm": 1.1171875, "learning_rate": 0.0003972564012790211, "loss": 5.6166, "mean_token_accuracy": 0.21602712273597718, "num_tokens": 71379424.0, "step": 28165 }, { "entropy": 6.386188888549805, "epoch": 3.251009809578765, "grad_norm": 1.03125, "learning_rate": 0.00039722175785580617, "loss": 5.695, "mean_token_accuracy": 0.2048676922917366, "num_tokens": 71392115.0, "step": 28170 }, { "entropy": 6.262509059906006, "epoch": 3.251586843623774, "grad_norm": 0.98046875, "learning_rate": 0.0003971871103217232, "loss": 5.6078, "mean_token_accuracy": 0.21166991591453552, "num_tokens": 71404339.0, "step": 28175 }, { "entropy": 6.269883871078491, "epoch": 3.2521638776687825, "grad_norm": 1.0859375, "learning_rate": 0.00039715245867793744, "loss": 5.6025, "mean_token_accuracy": 0.20796633809804915, "num_tokens": 71416331.0, "step": 28180 }, { "entropy": 6.26036958694458, "epoch": 3.252740911713791, "grad_norm": 1.109375, "learning_rate": 0.0003971178029256144, "loss": 5.5712, "mean_token_accuracy": 0.2210211470723152, "num_tokens": 71428511.0, "step": 28185 }, { "entropy": 6.354671812057495, "epoch": 3.2533179457587997, "grad_norm": 1.125, "learning_rate": 0.00039708314306591974, "loss": 5.617, "mean_token_accuracy": 0.21025803238153457, "num_tokens": 71440708.0, "step": 28190 }, { "entropy": 6.301226568222046, "epoch": 3.2538949798038086, "grad_norm": 1.046875, "learning_rate": 0.00039704847910001926, "loss": 5.5897, "mean_token_accuracy": 0.20650502443313598, "num_tokens": 71453363.0, "step": 28195 }, { "entropy": 6.2294361114501955, "epoch": 3.254472013848817, "grad_norm": 1.0390625, "learning_rate": 0.0003970138110290787, "loss": 5.5215, "mean_token_accuracy": 0.21542776972055436, "num_tokens": 71465390.0, "step": 28200 }, { "entropy": 6.371427297592163, "epoch": 3.255049047893826, "grad_norm": 0.9921875, "learning_rate": 0.00039697913885426424, "loss": 5.7302, "mean_token_accuracy": 0.19866631031036378, "num_tokens": 71478148.0, "step": 28205 }, { "entropy": 6.30023946762085, "epoch": 3.2556260819388343, "grad_norm": 1.0, "learning_rate": 0.00039694446257674203, "loss": 5.5723, "mean_token_accuracy": 0.213987797498703, "num_tokens": 71490604.0, "step": 28210 }, { "entropy": 6.262583780288696, "epoch": 3.256203115983843, "grad_norm": 1.0703125, "learning_rate": 0.00039690978219767846, "loss": 5.7053, "mean_token_accuracy": 0.2008213445544243, "num_tokens": 71503379.0, "step": 28215 }, { "entropy": 6.402316427230835, "epoch": 3.2567801500288516, "grad_norm": 1.0390625, "learning_rate": 0.0003968750977182399, "loss": 5.62, "mean_token_accuracy": 0.20850620418787003, "num_tokens": 71516350.0, "step": 28220 }, { "entropy": 6.365092945098877, "epoch": 3.2573571840738604, "grad_norm": 1.125, "learning_rate": 0.00039684040913959295, "loss": 5.589, "mean_token_accuracy": 0.2070809483528137, "num_tokens": 71528314.0, "step": 28225 }, { "entropy": 6.276582288742065, "epoch": 3.257934218118869, "grad_norm": 0.98046875, "learning_rate": 0.0003968057164629043, "loss": 5.5833, "mean_token_accuracy": 0.21616800129413605, "num_tokens": 71540987.0, "step": 28230 }, { "entropy": 6.217281007766724, "epoch": 3.2585112521638777, "grad_norm": 1.0078125, "learning_rate": 0.000396771019689341, "loss": 5.5284, "mean_token_accuracy": 0.21362587809562683, "num_tokens": 71553605.0, "step": 28235 }, { "entropy": 6.310392999649048, "epoch": 3.259088286208886, "grad_norm": 1.0859375, "learning_rate": 0.00039673631882006986, "loss": 5.6373, "mean_token_accuracy": 0.20066867768764496, "num_tokens": 71565744.0, "step": 28240 }, { "entropy": 6.402947950363159, "epoch": 3.259665320253895, "grad_norm": 1.078125, "learning_rate": 0.00039670161385625815, "loss": 5.6934, "mean_token_accuracy": 0.20391651690006257, "num_tokens": 71577756.0, "step": 28245 }, { "entropy": 6.296461915969848, "epoch": 3.260242354298904, "grad_norm": 1.078125, "learning_rate": 0.00039666690479907307, "loss": 5.6156, "mean_token_accuracy": 0.20750511139631272, "num_tokens": 71590814.0, "step": 28250 }, { "entropy": 6.323584318161011, "epoch": 3.2608193883439123, "grad_norm": 1.1171875, "learning_rate": 0.00039663219164968213, "loss": 5.6439, "mean_token_accuracy": 0.2042109489440918, "num_tokens": 71602960.0, "step": 28255 }, { "entropy": 6.382558441162109, "epoch": 3.261396422388921, "grad_norm": 1.09375, "learning_rate": 0.00039659747440925277, "loss": 5.7449, "mean_token_accuracy": 0.2041376531124115, "num_tokens": 71614568.0, "step": 28260 }, { "entropy": 6.349368572235107, "epoch": 3.2619734564339296, "grad_norm": 1.0234375, "learning_rate": 0.00039656275307895286, "loss": 5.6593, "mean_token_accuracy": 0.2042471721768379, "num_tokens": 71628103.0, "step": 28265 }, { "entropy": 6.226234436035156, "epoch": 3.2625504904789384, "grad_norm": 1.0625, "learning_rate": 0.00039652802765995006, "loss": 5.5222, "mean_token_accuracy": 0.22037243247032165, "num_tokens": 71640343.0, "step": 28270 }, { "entropy": 6.284339237213135, "epoch": 3.263127524523947, "grad_norm": 1.0625, "learning_rate": 0.00039649329815341243, "loss": 5.5367, "mean_token_accuracy": 0.2122778132557869, "num_tokens": 71653430.0, "step": 28275 }, { "entropy": 6.251771783828735, "epoch": 3.2637045585689557, "grad_norm": 1.015625, "learning_rate": 0.00039645856456050813, "loss": 5.5544, "mean_token_accuracy": 0.21104687750339507, "num_tokens": 71665635.0, "step": 28280 }, { "entropy": 6.115922975540161, "epoch": 3.264281592613964, "grad_norm": 1.0390625, "learning_rate": 0.0003964238268824052, "loss": 5.4733, "mean_token_accuracy": 0.2292627215385437, "num_tokens": 71679190.0, "step": 28285 }, { "entropy": 6.281512355804443, "epoch": 3.264858626658973, "grad_norm": 0.9296875, "learning_rate": 0.0003963890851202723, "loss": 5.5939, "mean_token_accuracy": 0.20890509635210036, "num_tokens": 71693938.0, "step": 28290 }, { "entropy": 6.298290634155274, "epoch": 3.2654356607039814, "grad_norm": 1.0, "learning_rate": 0.00039635433927527776, "loss": 5.5475, "mean_token_accuracy": 0.2174872040748596, "num_tokens": 71706682.0, "step": 28295 }, { "entropy": 6.353816890716553, "epoch": 3.2660126947489903, "grad_norm": 1.0625, "learning_rate": 0.00039631958934859023, "loss": 5.6395, "mean_token_accuracy": 0.20739321559667587, "num_tokens": 71718454.0, "step": 28300 }, { "entropy": 6.301565790176392, "epoch": 3.2665897287939987, "grad_norm": 1.0703125, "learning_rate": 0.00039628483534137865, "loss": 5.6563, "mean_token_accuracy": 0.20906370431184768, "num_tokens": 71731270.0, "step": 28305 }, { "entropy": 6.321493816375733, "epoch": 3.2671667628390075, "grad_norm": 1.0546875, "learning_rate": 0.00039625007725481193, "loss": 5.6601, "mean_token_accuracy": 0.20504939258098603, "num_tokens": 71744086.0, "step": 28310 }, { "entropy": 6.3168529033660885, "epoch": 3.267743796884016, "grad_norm": 1.0625, "learning_rate": 0.000396215315090059, "loss": 5.6191, "mean_token_accuracy": 0.20653242766857147, "num_tokens": 71756496.0, "step": 28315 }, { "entropy": 6.298025798797608, "epoch": 3.268320830929025, "grad_norm": 1.1171875, "learning_rate": 0.00039618054884828924, "loss": 5.594, "mean_token_accuracy": 0.21338528543710708, "num_tokens": 71768939.0, "step": 28320 }, { "entropy": 6.266501379013062, "epoch": 3.2688978649740337, "grad_norm": 1.046875, "learning_rate": 0.0003961457785306719, "loss": 5.5855, "mean_token_accuracy": 0.20346922129392625, "num_tokens": 71780555.0, "step": 28325 }, { "entropy": 6.305908346176148, "epoch": 3.269474899019042, "grad_norm": 1.109375, "learning_rate": 0.0003961110041383764, "loss": 5.6928, "mean_token_accuracy": 0.20813469141721724, "num_tokens": 71795705.0, "step": 28330 }, { "entropy": 6.321779251098633, "epoch": 3.270051933064051, "grad_norm": 1.140625, "learning_rate": 0.0003960762256725725, "loss": 5.6055, "mean_token_accuracy": 0.21335887610912324, "num_tokens": 71807582.0, "step": 28335 }, { "entropy": 6.317763423919677, "epoch": 3.2706289671090594, "grad_norm": 1.0703125, "learning_rate": 0.00039604144313442984, "loss": 5.6862, "mean_token_accuracy": 0.20522436499595642, "num_tokens": 71819349.0, "step": 28340 }, { "entropy": 6.3391406536102295, "epoch": 3.2712060011540682, "grad_norm": 1.046875, "learning_rate": 0.00039600665652511836, "loss": 5.609, "mean_token_accuracy": 0.2161785677075386, "num_tokens": 71832443.0, "step": 28345 }, { "entropy": 6.266803836822509, "epoch": 3.2717830351990767, "grad_norm": 1.0, "learning_rate": 0.00039597186584580814, "loss": 5.6412, "mean_token_accuracy": 0.20091271549463272, "num_tokens": 71844961.0, "step": 28350 }, { "entropy": 6.302772092819214, "epoch": 3.2723600692440855, "grad_norm": 0.95703125, "learning_rate": 0.0003959370710976693, "loss": 5.6517, "mean_token_accuracy": 0.21341511160135268, "num_tokens": 71858158.0, "step": 28355 }, { "entropy": 6.321320819854736, "epoch": 3.272937103289094, "grad_norm": 1.015625, "learning_rate": 0.00039590227228187213, "loss": 5.6196, "mean_token_accuracy": 0.21146986484527588, "num_tokens": 71870985.0, "step": 28360 }, { "entropy": 6.334778118133545, "epoch": 3.273514137334103, "grad_norm": 1.0703125, "learning_rate": 0.0003958674693995871, "loss": 5.6444, "mean_token_accuracy": 0.20949940234422684, "num_tokens": 71883687.0, "step": 28365 }, { "entropy": 6.31767053604126, "epoch": 3.274091171379111, "grad_norm": 1.03125, "learning_rate": 0.0003958326624519848, "loss": 5.689, "mean_token_accuracy": 0.19600140750408174, "num_tokens": 71896678.0, "step": 28370 }, { "entropy": 6.3334630012512205, "epoch": 3.27466820542412, "grad_norm": 1.109375, "learning_rate": 0.00039579785144023595, "loss": 5.5967, "mean_token_accuracy": 0.21396450698375702, "num_tokens": 71910722.0, "step": 28375 }, { "entropy": 6.2932604312896725, "epoch": 3.2752452394691285, "grad_norm": 1.03125, "learning_rate": 0.0003957630363655113, "loss": 5.5878, "mean_token_accuracy": 0.21288826912641526, "num_tokens": 71922849.0, "step": 28380 }, { "entropy": 6.221535110473633, "epoch": 3.2758222735141374, "grad_norm": 1.03125, "learning_rate": 0.00039572821722898185, "loss": 5.5486, "mean_token_accuracy": 0.2145315259695053, "num_tokens": 71937106.0, "step": 28385 }, { "entropy": 6.326622486114502, "epoch": 3.2763993075591458, "grad_norm": 1.046875, "learning_rate": 0.0003956933940318189, "loss": 5.6437, "mean_token_accuracy": 0.2034468799829483, "num_tokens": 71949384.0, "step": 28390 }, { "entropy": 6.321100330352783, "epoch": 3.2769763416041546, "grad_norm": 1.046875, "learning_rate": 0.0003956585667751935, "loss": 5.5822, "mean_token_accuracy": 0.20939769297838212, "num_tokens": 71961906.0, "step": 28395 }, { "entropy": 6.267369508743286, "epoch": 3.2775533756491635, "grad_norm": 1.1015625, "learning_rate": 0.00039562373546027726, "loss": 5.5635, "mean_token_accuracy": 0.21035708487033844, "num_tokens": 71974684.0, "step": 28400 }, { "entropy": 6.311018276214599, "epoch": 3.278130409694172, "grad_norm": 1.03125, "learning_rate": 0.0003955889000882415, "loss": 5.6123, "mean_token_accuracy": 0.20001862496137618, "num_tokens": 71987410.0, "step": 28405 }, { "entropy": 6.2740397453308105, "epoch": 3.2787074437391808, "grad_norm": 1.0234375, "learning_rate": 0.00039555406066025796, "loss": 5.5943, "mean_token_accuracy": 0.21315019875764846, "num_tokens": 72000155.0, "step": 28410 }, { "entropy": 6.311759328842163, "epoch": 3.279284477784189, "grad_norm": 1.0625, "learning_rate": 0.0003955192171774986, "loss": 5.6447, "mean_token_accuracy": 0.20422276705503464, "num_tokens": 72013057.0, "step": 28415 }, { "entropy": 6.305330419540406, "epoch": 3.279861511829198, "grad_norm": 1.0703125, "learning_rate": 0.0003954843696411351, "loss": 5.5944, "mean_token_accuracy": 0.19949475824832916, "num_tokens": 72024875.0, "step": 28420 }, { "entropy": 6.347391080856323, "epoch": 3.2804385458742065, "grad_norm": 1.0234375, "learning_rate": 0.0003954495180523397, "loss": 5.5981, "mean_token_accuracy": 0.21122613549232483, "num_tokens": 72036932.0, "step": 28425 }, { "entropy": 6.330396604537964, "epoch": 3.2810155799192153, "grad_norm": 1.0703125, "learning_rate": 0.00039541466241228466, "loss": 5.6304, "mean_token_accuracy": 0.2088005691766739, "num_tokens": 72049081.0, "step": 28430 }, { "entropy": 6.296348190307617, "epoch": 3.2815926139642237, "grad_norm": 1.1015625, "learning_rate": 0.00039537980272214224, "loss": 5.5489, "mean_token_accuracy": 0.21346697509288787, "num_tokens": 72061334.0, "step": 28435 }, { "entropy": 6.257789039611817, "epoch": 3.2821696480092326, "grad_norm": 1.03125, "learning_rate": 0.0003953449389830849, "loss": 5.5764, "mean_token_accuracy": 0.20823515057563782, "num_tokens": 72073446.0, "step": 28440 }, { "entropy": 6.271277856826782, "epoch": 3.282746682054241, "grad_norm": 1.0234375, "learning_rate": 0.0003953100711962853, "loss": 5.5721, "mean_token_accuracy": 0.21907315403223038, "num_tokens": 72086219.0, "step": 28445 }, { "entropy": 6.343201446533203, "epoch": 3.28332371609925, "grad_norm": 1.015625, "learning_rate": 0.00039527519936291626, "loss": 5.6411, "mean_token_accuracy": 0.20770083367824554, "num_tokens": 72098442.0, "step": 28450 }, { "entropy": 6.3261542320251465, "epoch": 3.2839007501442588, "grad_norm": 1.046875, "learning_rate": 0.00039524032348415075, "loss": 5.6325, "mean_token_accuracy": 0.20712635964155196, "num_tokens": 72111416.0, "step": 28455 }, { "entropy": 6.254213809967041, "epoch": 3.284477784189267, "grad_norm": 0.98828125, "learning_rate": 0.0003952054435611615, "loss": 5.5763, "mean_token_accuracy": 0.2146853193640709, "num_tokens": 72124077.0, "step": 28460 }, { "entropy": 6.353698968887329, "epoch": 3.2850548182342756, "grad_norm": 1.03125, "learning_rate": 0.00039517055959512195, "loss": 5.6646, "mean_token_accuracy": 0.21170907318592072, "num_tokens": 72136170.0, "step": 28465 }, { "entropy": 6.211856555938721, "epoch": 3.2856318522792844, "grad_norm": 1.015625, "learning_rate": 0.0003951356715872053, "loss": 5.5862, "mean_token_accuracy": 0.21495466977357863, "num_tokens": 72148868.0, "step": 28470 }, { "entropy": 6.290690898895264, "epoch": 3.2862088863242933, "grad_norm": 0.98046875, "learning_rate": 0.000395100779538585, "loss": 5.5978, "mean_token_accuracy": 0.2139120116829872, "num_tokens": 72162225.0, "step": 28475 }, { "entropy": 6.304388809204101, "epoch": 3.2867859203693017, "grad_norm": 0.98046875, "learning_rate": 0.0003950658834504347, "loss": 5.6722, "mean_token_accuracy": 0.21038593649864196, "num_tokens": 72174424.0, "step": 28480 }, { "entropy": 6.3301740169525145, "epoch": 3.2873629544143106, "grad_norm": 0.96875, "learning_rate": 0.000395030983323928, "loss": 5.6076, "mean_token_accuracy": 0.2123726263642311, "num_tokens": 72187672.0, "step": 28485 }, { "entropy": 6.2454267024993895, "epoch": 3.287939988459319, "grad_norm": 1.015625, "learning_rate": 0.00039499607916023885, "loss": 5.4726, "mean_token_accuracy": 0.2202191784977913, "num_tokens": 72201575.0, "step": 28490 }, { "entropy": 6.173577785491943, "epoch": 3.288517022504328, "grad_norm": 1.046875, "learning_rate": 0.0003949611709605411, "loss": 5.4764, "mean_token_accuracy": 0.21634161323308945, "num_tokens": 72215035.0, "step": 28495 }, { "entropy": 6.324765253067016, "epoch": 3.2890940565493363, "grad_norm": 1.0703125, "learning_rate": 0.000394926258726009, "loss": 5.6657, "mean_token_accuracy": 0.2094937264919281, "num_tokens": 72227152.0, "step": 28500 }, { "entropy": 6.287936162948609, "epoch": 3.289671090594345, "grad_norm": 0.99609375, "learning_rate": 0.0003948913424578168, "loss": 5.57, "mean_token_accuracy": 0.20812568068504333, "num_tokens": 72240770.0, "step": 28505 }, { "entropy": 6.300960063934326, "epoch": 3.2902481246393536, "grad_norm": 1.0234375, "learning_rate": 0.0003948564221571388, "loss": 5.5923, "mean_token_accuracy": 0.2148391678929329, "num_tokens": 72253254.0, "step": 28510 }, { "entropy": 6.233442401885986, "epoch": 3.2908251586843624, "grad_norm": 1.1640625, "learning_rate": 0.00039482149782514955, "loss": 5.5526, "mean_token_accuracy": 0.2195778876543045, "num_tokens": 72267863.0, "step": 28515 }, { "entropy": 6.288657808303833, "epoch": 3.291402192729371, "grad_norm": 1.0625, "learning_rate": 0.0003947865694630238, "loss": 5.5872, "mean_token_accuracy": 0.20951843559741973, "num_tokens": 72279867.0, "step": 28520 }, { "entropy": 6.121821498870849, "epoch": 3.2919792267743797, "grad_norm": 1.109375, "learning_rate": 0.0003947516370719362, "loss": 5.4292, "mean_token_accuracy": 0.23044759631156922, "num_tokens": 72293347.0, "step": 28525 }, { "entropy": 6.306554985046387, "epoch": 3.2925562608193886, "grad_norm": 0.98828125, "learning_rate": 0.0003947167006530618, "loss": 5.6513, "mean_token_accuracy": 0.20109457820653914, "num_tokens": 72306216.0, "step": 28530 }, { "entropy": 6.319903612136841, "epoch": 3.293133294864397, "grad_norm": 1.09375, "learning_rate": 0.00039468176020757573, "loss": 5.6551, "mean_token_accuracy": 0.20395729839801788, "num_tokens": 72318253.0, "step": 28535 }, { "entropy": 6.246758031845093, "epoch": 3.293710328909406, "grad_norm": 1.0078125, "learning_rate": 0.000394646815736653, "loss": 5.61, "mean_token_accuracy": 0.2142129048705101, "num_tokens": 72331451.0, "step": 28540 }, { "entropy": 6.304188871383667, "epoch": 3.2942873629544143, "grad_norm": 1.078125, "learning_rate": 0.0003946118672414692, "loss": 5.6661, "mean_token_accuracy": 0.20401847809553147, "num_tokens": 72343532.0, "step": 28545 }, { "entropy": 6.3445291996002195, "epoch": 3.294864396999423, "grad_norm": 1.046875, "learning_rate": 0.00039457691472319953, "loss": 5.6631, "mean_token_accuracy": 0.20179695039987564, "num_tokens": 72355803.0, "step": 28550 }, { "entropy": 6.27111029624939, "epoch": 3.2954414310444315, "grad_norm": 1.015625, "learning_rate": 0.0003945419581830197, "loss": 5.5426, "mean_token_accuracy": 0.20842572599649428, "num_tokens": 72370056.0, "step": 28555 }, { "entropy": 6.202527236938477, "epoch": 3.2960184650894404, "grad_norm": 1.0625, "learning_rate": 0.00039450699762210556, "loss": 5.496, "mean_token_accuracy": 0.2111549496650696, "num_tokens": 72382444.0, "step": 28560 }, { "entropy": 6.231189775466919, "epoch": 3.296595499134449, "grad_norm": 1.015625, "learning_rate": 0.00039447203304163295, "loss": 5.553, "mean_token_accuracy": 0.21933628171682357, "num_tokens": 72396773.0, "step": 28565 }, { "entropy": 6.241081380844117, "epoch": 3.2971725331794577, "grad_norm": 1.0546875, "learning_rate": 0.0003944370644427777, "loss": 5.4939, "mean_token_accuracy": 0.2228922963142395, "num_tokens": 72409922.0, "step": 28570 }, { "entropy": 6.38632640838623, "epoch": 3.297749567224466, "grad_norm": 1.0546875, "learning_rate": 0.0003944020918267163, "loss": 5.6128, "mean_token_accuracy": 0.2153082400560379, "num_tokens": 72423011.0, "step": 28575 }, { "entropy": 6.243960905075073, "epoch": 3.298326601269475, "grad_norm": 1.09375, "learning_rate": 0.00039436711519462474, "loss": 5.5743, "mean_token_accuracy": 0.2115711137652397, "num_tokens": 72434888.0, "step": 28580 }, { "entropy": 6.231947946548462, "epoch": 3.2989036353144834, "grad_norm": 1.0625, "learning_rate": 0.0003943321345476796, "loss": 5.5585, "mean_token_accuracy": 0.2197302371263504, "num_tokens": 72447202.0, "step": 28585 }, { "entropy": 6.1306623935699465, "epoch": 3.2994806693594922, "grad_norm": 1.125, "learning_rate": 0.00039429714988705735, "loss": 5.5184, "mean_token_accuracy": 0.2186478778719902, "num_tokens": 72460232.0, "step": 28590 }, { "entropy": 6.314109134674072, "epoch": 3.3000577034045007, "grad_norm": 1.046875, "learning_rate": 0.00039426216121393477, "loss": 5.6066, "mean_token_accuracy": 0.2105715125799179, "num_tokens": 72472665.0, "step": 28595 }, { "entropy": 6.2340672492980955, "epoch": 3.3006347374495095, "grad_norm": 1.09375, "learning_rate": 0.0003942271685294886, "loss": 5.6259, "mean_token_accuracy": 0.2148941531777382, "num_tokens": 72484766.0, "step": 28600 }, { "entropy": 6.334250164031983, "epoch": 3.3012117714945184, "grad_norm": 0.96875, "learning_rate": 0.00039419217183489594, "loss": 5.6571, "mean_token_accuracy": 0.20254969745874404, "num_tokens": 72497352.0, "step": 28605 }, { "entropy": 6.396239566802978, "epoch": 3.301788805539527, "grad_norm": 1.1015625, "learning_rate": 0.00039415717113133356, "loss": 5.7095, "mean_token_accuracy": 0.2039184495806694, "num_tokens": 72509057.0, "step": 28610 }, { "entropy": 6.33972954750061, "epoch": 3.3023658395845357, "grad_norm": 1.0546875, "learning_rate": 0.0003941221664199791, "loss": 5.6589, "mean_token_accuracy": 0.20284920781850815, "num_tokens": 72521624.0, "step": 28615 }, { "entropy": 6.291444396972656, "epoch": 3.302942873629544, "grad_norm": 1.0703125, "learning_rate": 0.00039408715770200976, "loss": 5.5941, "mean_token_accuracy": 0.2105130597949028, "num_tokens": 72534078.0, "step": 28620 }, { "entropy": 6.296972131729126, "epoch": 3.303519907674553, "grad_norm": 1.09375, "learning_rate": 0.00039405214497860295, "loss": 5.5726, "mean_token_accuracy": 0.21531585305929185, "num_tokens": 72547310.0, "step": 28625 }, { "entropy": 6.33482174873352, "epoch": 3.3040969417195614, "grad_norm": 1.046875, "learning_rate": 0.0003940171282509363, "loss": 5.6194, "mean_token_accuracy": 0.20922723412513733, "num_tokens": 72559758.0, "step": 28630 }, { "entropy": 6.283375835418701, "epoch": 3.3046739757645702, "grad_norm": 1.078125, "learning_rate": 0.0003939821075201878, "loss": 5.6565, "mean_token_accuracy": 0.2039285272359848, "num_tokens": 72571365.0, "step": 28635 }, { "entropy": 6.3861391067504885, "epoch": 3.3052510098095786, "grad_norm": 1.0078125, "learning_rate": 0.0003939470827875352, "loss": 5.679, "mean_token_accuracy": 0.20217571407556534, "num_tokens": 72583425.0, "step": 28640 }, { "entropy": 6.304543113708496, "epoch": 3.3058280438545875, "grad_norm": 1.0625, "learning_rate": 0.0003939120540541565, "loss": 5.5548, "mean_token_accuracy": 0.21870865672826767, "num_tokens": 72595743.0, "step": 28645 }, { "entropy": 6.311944198608399, "epoch": 3.306405077899596, "grad_norm": 1.1328125, "learning_rate": 0.00039387702132122993, "loss": 5.6586, "mean_token_accuracy": 0.21095039695501328, "num_tokens": 72608510.0, "step": 28650 }, { "entropy": 6.247580528259277, "epoch": 3.306982111944605, "grad_norm": 1.0546875, "learning_rate": 0.00039384198458993386, "loss": 5.5274, "mean_token_accuracy": 0.21772662103176116, "num_tokens": 72620681.0, "step": 28655 }, { "entropy": 6.3383677959442135, "epoch": 3.307559145989613, "grad_norm": 1.078125, "learning_rate": 0.00039380694386144665, "loss": 5.6358, "mean_token_accuracy": 0.20355518609285356, "num_tokens": 72632970.0, "step": 28660 }, { "entropy": 6.286139631271363, "epoch": 3.308136180034622, "grad_norm": 0.98046875, "learning_rate": 0.00039377189913694687, "loss": 5.6588, "mean_token_accuracy": 0.2043263331055641, "num_tokens": 72647953.0, "step": 28665 }, { "entropy": 6.423627948760986, "epoch": 3.3087132140796305, "grad_norm": 1.109375, "learning_rate": 0.00039373685041761323, "loss": 5.6223, "mean_token_accuracy": 0.20799154341220855, "num_tokens": 72660333.0, "step": 28670 }, { "entropy": 6.305422258377075, "epoch": 3.3092902481246393, "grad_norm": 1.015625, "learning_rate": 0.0003937017977046247, "loss": 5.5582, "mean_token_accuracy": 0.21382996439933777, "num_tokens": 72673620.0, "step": 28675 }, { "entropy": 6.316384983062744, "epoch": 3.309867282169648, "grad_norm": 1.1015625, "learning_rate": 0.00039366674099916007, "loss": 5.71, "mean_token_accuracy": 0.19985205084085464, "num_tokens": 72686285.0, "step": 28680 }, { "entropy": 6.201228284835816, "epoch": 3.3104443162146566, "grad_norm": 1.0546875, "learning_rate": 0.0003936316803023986, "loss": 5.4412, "mean_token_accuracy": 0.217347614467144, "num_tokens": 72699209.0, "step": 28685 }, { "entropy": 6.315252780914307, "epoch": 3.3110213502596655, "grad_norm": 1.078125, "learning_rate": 0.00039359661561551946, "loss": 5.6236, "mean_token_accuracy": 0.20603403747081755, "num_tokens": 72711825.0, "step": 28690 }, { "entropy": 6.250441837310791, "epoch": 3.311598384304674, "grad_norm": 1.0859375, "learning_rate": 0.00039356154693970214, "loss": 5.5352, "mean_token_accuracy": 0.21349995732307434, "num_tokens": 72724908.0, "step": 28695 }, { "entropy": 6.301689529418946, "epoch": 3.3121754183496828, "grad_norm": 1.0703125, "learning_rate": 0.00039352647427612597, "loss": 5.608, "mean_token_accuracy": 0.21204435974359512, "num_tokens": 72738431.0, "step": 28700 }, { "entropy": 6.301755142211914, "epoch": 3.312752452394691, "grad_norm": 0.96875, "learning_rate": 0.0003934913976259709, "loss": 5.6144, "mean_token_accuracy": 0.20495393723249436, "num_tokens": 72750800.0, "step": 28705 }, { "entropy": 6.272404670715332, "epoch": 3.3133294864397, "grad_norm": 1.078125, "learning_rate": 0.0003934563169904164, "loss": 5.559, "mean_token_accuracy": 0.21818749606609344, "num_tokens": 72763343.0, "step": 28710 }, { "entropy": 6.266006422042847, "epoch": 3.3139065204847085, "grad_norm": 1.1328125, "learning_rate": 0.0003934212323706425, "loss": 5.5614, "mean_token_accuracy": 0.21694438010454178, "num_tokens": 72775865.0, "step": 28715 }, { "entropy": 6.256735754013062, "epoch": 3.3144835545297173, "grad_norm": 1.015625, "learning_rate": 0.0003933861437678292, "loss": 5.6031, "mean_token_accuracy": 0.2109078049659729, "num_tokens": 72789579.0, "step": 28720 }, { "entropy": 6.228157711029053, "epoch": 3.3150605885747257, "grad_norm": 0.96484375, "learning_rate": 0.0003933510511831569, "loss": 5.5452, "mean_token_accuracy": 0.2175717368721962, "num_tokens": 72802952.0, "step": 28725 }, { "entropy": 6.265851402282715, "epoch": 3.3156376226197346, "grad_norm": 1.0703125, "learning_rate": 0.00039331595461780574, "loss": 5.5828, "mean_token_accuracy": 0.20740180909633638, "num_tokens": 72816571.0, "step": 28730 }, { "entropy": 6.280122232437134, "epoch": 3.3162146566647435, "grad_norm": 1.1015625, "learning_rate": 0.00039328085407295616, "loss": 5.5308, "mean_token_accuracy": 0.21138013154268265, "num_tokens": 72829077.0, "step": 28735 }, { "entropy": 6.267831516265869, "epoch": 3.316791690709752, "grad_norm": 1.0625, "learning_rate": 0.00039324574954978885, "loss": 5.5794, "mean_token_accuracy": 0.20756455957889558, "num_tokens": 72842530.0, "step": 28740 }, { "entropy": 6.369338464736939, "epoch": 3.3173687247547603, "grad_norm": 0.99609375, "learning_rate": 0.00039321064104948456, "loss": 5.6666, "mean_token_accuracy": 0.20300383269786834, "num_tokens": 72854534.0, "step": 28745 }, { "entropy": 6.2939684867858885, "epoch": 3.317945758799769, "grad_norm": 1.03125, "learning_rate": 0.00039317552857322404, "loss": 5.6751, "mean_token_accuracy": 0.20655760020017624, "num_tokens": 72866860.0, "step": 28750 }, { "entropy": 6.354185485839844, "epoch": 3.318522792844778, "grad_norm": 1.1015625, "learning_rate": 0.00039314041212218826, "loss": 5.6651, "mean_token_accuracy": 0.2040335550904274, "num_tokens": 72879074.0, "step": 28755 }, { "entropy": 6.288358592987061, "epoch": 3.3190998268897864, "grad_norm": 1.0625, "learning_rate": 0.0003931052916975584, "loss": 5.5308, "mean_token_accuracy": 0.21582938134670257, "num_tokens": 72890981.0, "step": 28760 }, { "entropy": 6.314363431930542, "epoch": 3.3196768609347953, "grad_norm": 1.125, "learning_rate": 0.00039307016730051576, "loss": 5.5984, "mean_token_accuracy": 0.21466825604438783, "num_tokens": 72903068.0, "step": 28765 }, { "entropy": 6.21572265625, "epoch": 3.3202538949798037, "grad_norm": 1.03125, "learning_rate": 0.0003930350389322417, "loss": 5.6058, "mean_token_accuracy": 0.2111571878194809, "num_tokens": 72917805.0, "step": 28770 }, { "entropy": 6.226862192153931, "epoch": 3.3208309290248126, "grad_norm": 1.1640625, "learning_rate": 0.0003929999065939177, "loss": 5.5403, "mean_token_accuracy": 0.2209217965602875, "num_tokens": 72930665.0, "step": 28775 }, { "entropy": 6.338307046890259, "epoch": 3.321407963069821, "grad_norm": 0.97265625, "learning_rate": 0.00039296477028672545, "loss": 5.5974, "mean_token_accuracy": 0.20715759545564652, "num_tokens": 72943841.0, "step": 28780 }, { "entropy": 6.307508039474487, "epoch": 3.32198499711483, "grad_norm": 1.0625, "learning_rate": 0.00039292963001184676, "loss": 5.6364, "mean_token_accuracy": 0.20984548181295395, "num_tokens": 72957886.0, "step": 28785 }, { "entropy": 6.26527099609375, "epoch": 3.3225620311598383, "grad_norm": 1.140625, "learning_rate": 0.0003928944857704636, "loss": 5.578, "mean_token_accuracy": 0.21370171308517455, "num_tokens": 72969698.0, "step": 28790 }, { "entropy": 6.197018384933472, "epoch": 3.323139065204847, "grad_norm": 1.1171875, "learning_rate": 0.00039285933756375794, "loss": 5.4694, "mean_token_accuracy": 0.22086730897426604, "num_tokens": 72983356.0, "step": 28795 }, { "entropy": 6.281574630737305, "epoch": 3.3237160992498556, "grad_norm": 1.0078125, "learning_rate": 0.0003928241853929119, "loss": 5.6184, "mean_token_accuracy": 0.21011638194322585, "num_tokens": 72995839.0, "step": 28800 }, { "entropy": 6.251098680496216, "epoch": 3.3242931332948644, "grad_norm": 1.046875, "learning_rate": 0.00039278902925910815, "loss": 5.592, "mean_token_accuracy": 0.21045335233211518, "num_tokens": 73008337.0, "step": 28805 }, { "entropy": 6.3050446033477785, "epoch": 3.3248701673398733, "grad_norm": 1.0859375, "learning_rate": 0.00039275386916352866, "loss": 5.6491, "mean_token_accuracy": 0.2042829543352127, "num_tokens": 73020262.0, "step": 28810 }, { "entropy": 6.3645820140838625, "epoch": 3.3254472013848817, "grad_norm": 0.96875, "learning_rate": 0.0003927187051073564, "loss": 5.7083, "mean_token_accuracy": 0.19844236224889755, "num_tokens": 73034142.0, "step": 28815 }, { "entropy": 6.365460300445557, "epoch": 3.32602423542989, "grad_norm": 1.0078125, "learning_rate": 0.00039268353709177395, "loss": 5.6254, "mean_token_accuracy": 0.20819768756628038, "num_tokens": 73046973.0, "step": 28820 }, { "entropy": 6.267800617218017, "epoch": 3.326601269474899, "grad_norm": 1.15625, "learning_rate": 0.0003926483651179642, "loss": 5.5941, "mean_token_accuracy": 0.20798975676298143, "num_tokens": 73060036.0, "step": 28825 }, { "entropy": 6.2191040992736815, "epoch": 3.327178303519908, "grad_norm": 1.0390625, "learning_rate": 0.0003926131891871101, "loss": 5.5461, "mean_token_accuracy": 0.2155445083975792, "num_tokens": 73072017.0, "step": 28830 }, { "entropy": 6.269107151031494, "epoch": 3.3277553375649163, "grad_norm": 0.9921875, "learning_rate": 0.00039257800930039485, "loss": 5.5088, "mean_token_accuracy": 0.21526906341314317, "num_tokens": 73083937.0, "step": 28835 }, { "entropy": 6.269366598129272, "epoch": 3.328332371609925, "grad_norm": 1.0078125, "learning_rate": 0.0003925428254590016, "loss": 5.6474, "mean_token_accuracy": 0.20849194526672363, "num_tokens": 73096084.0, "step": 28840 }, { "entropy": 6.333763122558594, "epoch": 3.3289094056549335, "grad_norm": 1.0546875, "learning_rate": 0.00039250763766411384, "loss": 5.6942, "mean_token_accuracy": 0.20730239450931548, "num_tokens": 73109109.0, "step": 28845 }, { "entropy": 6.2818211078643795, "epoch": 3.3294864396999424, "grad_norm": 1.046875, "learning_rate": 0.00039247244591691504, "loss": 5.5469, "mean_token_accuracy": 0.21710605770349503, "num_tokens": 73121843.0, "step": 28850 }, { "entropy": 6.315488624572754, "epoch": 3.330063473744951, "grad_norm": 1.140625, "learning_rate": 0.00039243725021858894, "loss": 5.669, "mean_token_accuracy": 0.19905203878879546, "num_tokens": 73135102.0, "step": 28855 }, { "entropy": 6.2173418521881105, "epoch": 3.3306405077899597, "grad_norm": 1.0703125, "learning_rate": 0.0003924020505703191, "loss": 5.5253, "mean_token_accuracy": 0.21410955488681793, "num_tokens": 73148575.0, "step": 28860 }, { "entropy": 6.348320531845093, "epoch": 3.331217541834968, "grad_norm": 1.1171875, "learning_rate": 0.00039236684697328974, "loss": 5.6996, "mean_token_accuracy": 0.20049867033958435, "num_tokens": 73160795.0, "step": 28865 }, { "entropy": 6.277620077133179, "epoch": 3.331794575879977, "grad_norm": 1.0625, "learning_rate": 0.00039233163942868475, "loss": 5.5648, "mean_token_accuracy": 0.2185143306851387, "num_tokens": 73173407.0, "step": 28870 }, { "entropy": 6.239258527755737, "epoch": 3.3323716099249854, "grad_norm": 1.0546875, "learning_rate": 0.0003922964279376883, "loss": 5.5398, "mean_token_accuracy": 0.22159578949213027, "num_tokens": 73187781.0, "step": 28875 }, { "entropy": 6.352889060974121, "epoch": 3.3329486439699942, "grad_norm": 0.9921875, "learning_rate": 0.0003922612125014848, "loss": 5.671, "mean_token_accuracy": 0.20447573512792588, "num_tokens": 73201701.0, "step": 28880 }, { "entropy": 6.290695428848267, "epoch": 3.333525678015003, "grad_norm": 1.03125, "learning_rate": 0.00039222599312125874, "loss": 5.6585, "mean_token_accuracy": 0.20172215700149537, "num_tokens": 73214144.0, "step": 28885 }, { "entropy": 6.236335515975952, "epoch": 3.3341027120600115, "grad_norm": 1.0625, "learning_rate": 0.0003921907697981946, "loss": 5.486, "mean_token_accuracy": 0.21916661113500596, "num_tokens": 73227314.0, "step": 28890 }, { "entropy": 6.329765510559082, "epoch": 3.3346797461050204, "grad_norm": 0.95703125, "learning_rate": 0.00039215554253347706, "loss": 5.6259, "mean_token_accuracy": 0.2066568061709404, "num_tokens": 73240285.0, "step": 28895 }, { "entropy": 6.335150289535522, "epoch": 3.335256780150029, "grad_norm": 1.015625, "learning_rate": 0.0003921203113282911, "loss": 5.6678, "mean_token_accuracy": 0.2058093160390854, "num_tokens": 73252839.0, "step": 28900 }, { "entropy": 6.238126277923584, "epoch": 3.3358338141950377, "grad_norm": 0.99609375, "learning_rate": 0.0003920850761838216, "loss": 5.5637, "mean_token_accuracy": 0.21956949681043625, "num_tokens": 73266894.0, "step": 28905 }, { "entropy": 6.315386867523193, "epoch": 3.336410848240046, "grad_norm": 1.1015625, "learning_rate": 0.00039204983710125377, "loss": 5.6431, "mean_token_accuracy": 0.21124201714992524, "num_tokens": 73279867.0, "step": 28910 }, { "entropy": 6.315626192092895, "epoch": 3.336987882285055, "grad_norm": 1.0, "learning_rate": 0.00039201459408177275, "loss": 5.6362, "mean_token_accuracy": 0.20166702568531036, "num_tokens": 73292080.0, "step": 28915 }, { "entropy": 6.266161108016968, "epoch": 3.3375649163300634, "grad_norm": 1.1015625, "learning_rate": 0.0003919793471265641, "loss": 5.5673, "mean_token_accuracy": 0.20920253694057464, "num_tokens": 73303502.0, "step": 28920 }, { "entropy": 6.204082059860229, "epoch": 3.338141950375072, "grad_norm": 1.03125, "learning_rate": 0.00039194409623681303, "loss": 5.5279, "mean_token_accuracy": 0.21414923667907715, "num_tokens": 73316169.0, "step": 28925 }, { "entropy": 6.3536553382873535, "epoch": 3.3387189844200806, "grad_norm": 1.09375, "learning_rate": 0.00039190884141370553, "loss": 5.6224, "mean_token_accuracy": 0.21155633628368378, "num_tokens": 73327929.0, "step": 28930 }, { "entropy": 6.236387729644775, "epoch": 3.3392960184650895, "grad_norm": 1.0703125, "learning_rate": 0.00039187358265842714, "loss": 5.5578, "mean_token_accuracy": 0.21335231959819795, "num_tokens": 73339951.0, "step": 28935 }, { "entropy": 6.267559289932251, "epoch": 3.339873052510098, "grad_norm": 1.1953125, "learning_rate": 0.00039183831997216393, "loss": 5.5054, "mean_token_accuracy": 0.21591550707817078, "num_tokens": 73351959.0, "step": 28940 }, { "entropy": 6.166514873504639, "epoch": 3.340450086555107, "grad_norm": 1.0078125, "learning_rate": 0.0003918030533561018, "loss": 5.5017, "mean_token_accuracy": 0.21913562268018721, "num_tokens": 73366727.0, "step": 28945 }, { "entropy": 6.295221138000488, "epoch": 3.341027120600115, "grad_norm": 1.0859375, "learning_rate": 0.00039176778281142696, "loss": 5.5545, "mean_token_accuracy": 0.2120455339550972, "num_tokens": 73378429.0, "step": 28950 }, { "entropy": 6.261827564239502, "epoch": 3.341604154645124, "grad_norm": 0.97265625, "learning_rate": 0.00039173250833932576, "loss": 5.5199, "mean_token_accuracy": 0.21612753421068193, "num_tokens": 73391901.0, "step": 28955 }, { "entropy": 6.233904266357422, "epoch": 3.342181188690133, "grad_norm": 0.9296875, "learning_rate": 0.00039169722994098464, "loss": 5.5898, "mean_token_accuracy": 0.2087406948208809, "num_tokens": 73404827.0, "step": 28960 }, { "entropy": 6.317486238479614, "epoch": 3.3427582227351413, "grad_norm": 1.03125, "learning_rate": 0.00039166194761759015, "loss": 5.6282, "mean_token_accuracy": 0.21186717301607133, "num_tokens": 73417941.0, "step": 28965 }, { "entropy": 6.332821369171143, "epoch": 3.34333525678015, "grad_norm": 1.0390625, "learning_rate": 0.00039162666137032906, "loss": 5.6344, "mean_token_accuracy": 0.20793080925941468, "num_tokens": 73429838.0, "step": 28970 }, { "entropy": 6.388521528244018, "epoch": 3.3439122908251586, "grad_norm": 1.0390625, "learning_rate": 0.0003915913712003882, "loss": 5.6481, "mean_token_accuracy": 0.20011728554964064, "num_tokens": 73441559.0, "step": 28975 }, { "entropy": 6.366645193099975, "epoch": 3.3444893248701675, "grad_norm": 1.125, "learning_rate": 0.0003915560771089543, "loss": 5.6669, "mean_token_accuracy": 0.19910821914672852, "num_tokens": 73454665.0, "step": 28980 }, { "entropy": 6.266955423355102, "epoch": 3.345066358915176, "grad_norm": 1.0546875, "learning_rate": 0.0003915207790972147, "loss": 5.5731, "mean_token_accuracy": 0.21302271485328675, "num_tokens": 73466969.0, "step": 28985 }, { "entropy": 6.312905740737915, "epoch": 3.3456433929601848, "grad_norm": 0.98046875, "learning_rate": 0.0003914854771663567, "loss": 5.6313, "mean_token_accuracy": 0.20756600201129913, "num_tokens": 73481939.0, "step": 28990 }, { "entropy": 6.339122533798218, "epoch": 3.346220427005193, "grad_norm": 0.90625, "learning_rate": 0.00039145017131756745, "loss": 5.6146, "mean_token_accuracy": 0.20963889211416245, "num_tokens": 73496650.0, "step": 28995 }, { "entropy": 6.264911556243897, "epoch": 3.346797461050202, "grad_norm": 1.0625, "learning_rate": 0.0003914148615520345, "loss": 5.5765, "mean_token_accuracy": 0.2172787755727768, "num_tokens": 73508363.0, "step": 29000 }, { "entropy": 6.251505756378174, "epoch": 3.3473744950952105, "grad_norm": 0.99609375, "learning_rate": 0.00039137954787094546, "loss": 5.5461, "mean_token_accuracy": 0.21059478223323821, "num_tokens": 73522530.0, "step": 29005 }, { "entropy": 6.231379795074463, "epoch": 3.3479515291402193, "grad_norm": 1.03125, "learning_rate": 0.00039134423027548825, "loss": 5.5389, "mean_token_accuracy": 0.21510165929794312, "num_tokens": 73535204.0, "step": 29010 }, { "entropy": 6.315020036697388, "epoch": 3.3485285631852277, "grad_norm": 1.015625, "learning_rate": 0.00039130890876685066, "loss": 5.6274, "mean_token_accuracy": 0.2129904106259346, "num_tokens": 73547783.0, "step": 29015 }, { "entropy": 6.311100053787231, "epoch": 3.3491055972302366, "grad_norm": 1.046875, "learning_rate": 0.0003912735833462206, "loss": 5.727, "mean_token_accuracy": 0.20269781798124314, "num_tokens": 73559707.0, "step": 29020 }, { "entropy": 6.310127544403076, "epoch": 3.349682631275245, "grad_norm": 1.0546875, "learning_rate": 0.00039123825401478633, "loss": 5.6341, "mean_token_accuracy": 0.21402271836996078, "num_tokens": 73571749.0, "step": 29025 }, { "entropy": 6.221773624420166, "epoch": 3.350259665320254, "grad_norm": 1.0234375, "learning_rate": 0.0003912029207737363, "loss": 5.584, "mean_token_accuracy": 0.21729437708854676, "num_tokens": 73583876.0, "step": 29030 }, { "entropy": 6.2178009986877445, "epoch": 3.3508366993652627, "grad_norm": 1.1953125, "learning_rate": 0.00039116758362425856, "loss": 5.5013, "mean_token_accuracy": 0.21648983359336854, "num_tokens": 73596899.0, "step": 29035 }, { "entropy": 6.309064960479736, "epoch": 3.351413733410271, "grad_norm": 1.078125, "learning_rate": 0.0003911322425675419, "loss": 5.5464, "mean_token_accuracy": 0.2164706915616989, "num_tokens": 73609190.0, "step": 29040 }, { "entropy": 6.304746150970459, "epoch": 3.35199076745528, "grad_norm": 1.0, "learning_rate": 0.0003910968976047749, "loss": 5.624, "mean_token_accuracy": 0.20457190573215484, "num_tokens": 73622410.0, "step": 29045 }, { "entropy": 6.124352550506591, "epoch": 3.3525678015002884, "grad_norm": 1.09375, "learning_rate": 0.0003910615487371465, "loss": 5.4342, "mean_token_accuracy": 0.2284320190548897, "num_tokens": 73634540.0, "step": 29050 }, { "entropy": 6.237605285644531, "epoch": 3.3531448355452973, "grad_norm": 1.046875, "learning_rate": 0.0003910261959658455, "loss": 5.5898, "mean_token_accuracy": 0.21332017034292222, "num_tokens": 73646392.0, "step": 29055 }, { "entropy": 6.291895580291748, "epoch": 3.3537218695903057, "grad_norm": 1.09375, "learning_rate": 0.0003909908392920611, "loss": 5.621, "mean_token_accuracy": 0.21053441017866134, "num_tokens": 73657929.0, "step": 29060 }, { "entropy": 6.241759777069092, "epoch": 3.3542989036353146, "grad_norm": 0.99609375, "learning_rate": 0.00039095547871698236, "loss": 5.6305, "mean_token_accuracy": 0.21316324323415756, "num_tokens": 73670190.0, "step": 29065 }, { "entropy": 6.207334184646607, "epoch": 3.354875937680323, "grad_norm": 1.03125, "learning_rate": 0.00039092011424179875, "loss": 5.5684, "mean_token_accuracy": 0.2182879403233528, "num_tokens": 73682634.0, "step": 29070 }, { "entropy": 6.327158451080322, "epoch": 3.355452971725332, "grad_norm": 1.046875, "learning_rate": 0.0003908847458676996, "loss": 5.551, "mean_token_accuracy": 0.21544651687145233, "num_tokens": 73694627.0, "step": 29075 }, { "entropy": 6.374857568740845, "epoch": 3.3560300057703403, "grad_norm": 0.9609375, "learning_rate": 0.0003908493735958747, "loss": 5.7531, "mean_token_accuracy": 0.1976550430059433, "num_tokens": 73707618.0, "step": 29080 }, { "entropy": 6.226210451126098, "epoch": 3.356607039815349, "grad_norm": 1.15625, "learning_rate": 0.00039081399742751363, "loss": 5.4982, "mean_token_accuracy": 0.2130536124110222, "num_tokens": 73719354.0, "step": 29085 }, { "entropy": 6.291107034683227, "epoch": 3.357184073860358, "grad_norm": 1.078125, "learning_rate": 0.00039077861736380617, "loss": 5.5644, "mean_token_accuracy": 0.2162878096103668, "num_tokens": 73731586.0, "step": 29090 }, { "entropy": 6.328617763519287, "epoch": 3.3577611079053664, "grad_norm": 1.03125, "learning_rate": 0.00039074323340594256, "loss": 5.6655, "mean_token_accuracy": 0.20485673397779464, "num_tokens": 73745907.0, "step": 29095 }, { "entropy": 6.1780870914459225, "epoch": 3.358338141950375, "grad_norm": 1.109375, "learning_rate": 0.00039070784555511276, "loss": 5.4009, "mean_token_accuracy": 0.23351363241672515, "num_tokens": 73759458.0, "step": 29100 }, { "entropy": 6.293235921859742, "epoch": 3.3589151759953837, "grad_norm": 1.125, "learning_rate": 0.000390672453812507, "loss": 5.6002, "mean_token_accuracy": 0.2132267564535141, "num_tokens": 73771116.0, "step": 29105 }, { "entropy": 6.258170795440674, "epoch": 3.3594922100403926, "grad_norm": 1.0703125, "learning_rate": 0.00039063705817931574, "loss": 5.644, "mean_token_accuracy": 0.20458761602640152, "num_tokens": 73784573.0, "step": 29110 }, { "entropy": 6.317970895767212, "epoch": 3.360069244085401, "grad_norm": 1.0625, "learning_rate": 0.0003906016586567295, "loss": 5.5966, "mean_token_accuracy": 0.21305181533098222, "num_tokens": 73797402.0, "step": 29115 }, { "entropy": 6.387864828109741, "epoch": 3.36064627813041, "grad_norm": 0.92578125, "learning_rate": 0.0003905662552459389, "loss": 5.6948, "mean_token_accuracy": 0.20252969413995742, "num_tokens": 73810924.0, "step": 29120 }, { "entropy": 6.302251100540161, "epoch": 3.3612233121754183, "grad_norm": 0.953125, "learning_rate": 0.00039053084794813466, "loss": 5.6035, "mean_token_accuracy": 0.2099481776356697, "num_tokens": 73824439.0, "step": 29125 }, { "entropy": 6.284896755218506, "epoch": 3.361800346220427, "grad_norm": 0.953125, "learning_rate": 0.00039049543676450773, "loss": 5.6332, "mean_token_accuracy": 0.20873839408159256, "num_tokens": 73838322.0, "step": 29130 }, { "entropy": 6.344274425506592, "epoch": 3.3623773802654355, "grad_norm": 1.0234375, "learning_rate": 0.0003904600216962491, "loss": 5.6234, "mean_token_accuracy": 0.20376986116170884, "num_tokens": 73850598.0, "step": 29135 }, { "entropy": 6.305895709991455, "epoch": 3.3629544143104444, "grad_norm": 1.09375, "learning_rate": 0.0003904246027445501, "loss": 5.592, "mean_token_accuracy": 0.21357525289058685, "num_tokens": 73863335.0, "step": 29140 }, { "entropy": 6.3073609352111815, "epoch": 3.363531448355453, "grad_norm": 1.0546875, "learning_rate": 0.00039038917991060187, "loss": 5.6708, "mean_token_accuracy": 0.20324818640947342, "num_tokens": 73876638.0, "step": 29145 }, { "entropy": 6.313017749786377, "epoch": 3.3641084824004617, "grad_norm": 1.046875, "learning_rate": 0.0003903537531955959, "loss": 5.67, "mean_token_accuracy": 0.20317320078611373, "num_tokens": 73889640.0, "step": 29150 }, { "entropy": 6.2704041481018065, "epoch": 3.36468551644547, "grad_norm": 1.078125, "learning_rate": 0.0003903183226007237, "loss": 5.6395, "mean_token_accuracy": 0.21060781478881835, "num_tokens": 73901883.0, "step": 29155 }, { "entropy": 6.273696184158325, "epoch": 3.365262550490479, "grad_norm": 1.109375, "learning_rate": 0.00039028288812717715, "loss": 5.5562, "mean_token_accuracy": 0.2176042005419731, "num_tokens": 73913717.0, "step": 29160 }, { "entropy": 6.253102350234985, "epoch": 3.365839584535488, "grad_norm": 1.0546875, "learning_rate": 0.0003902474497761478, "loss": 5.5406, "mean_token_accuracy": 0.2185870036482811, "num_tokens": 73928057.0, "step": 29165 }, { "entropy": 6.316777992248535, "epoch": 3.3664166185804962, "grad_norm": 1.0, "learning_rate": 0.00039021200754882774, "loss": 5.6718, "mean_token_accuracy": 0.20434031784534454, "num_tokens": 73941184.0, "step": 29170 }, { "entropy": 6.373852920532227, "epoch": 3.366993652625505, "grad_norm": 0.9765625, "learning_rate": 0.000390176561446409, "loss": 5.7058, "mean_token_accuracy": 0.19581802636384965, "num_tokens": 73953607.0, "step": 29175 }, { "entropy": 6.34294171333313, "epoch": 3.3675706866705135, "grad_norm": 1.03125, "learning_rate": 0.0003901411114700839, "loss": 5.5525, "mean_token_accuracy": 0.2188389390707016, "num_tokens": 73965238.0, "step": 29180 }, { "entropy": 6.253246164321899, "epoch": 3.3681477207155224, "grad_norm": 1.078125, "learning_rate": 0.0003901056576210447, "loss": 5.5534, "mean_token_accuracy": 0.21227256804704667, "num_tokens": 73979213.0, "step": 29185 }, { "entropy": 6.292891979217529, "epoch": 3.368724754760531, "grad_norm": 1.015625, "learning_rate": 0.00039007019990048387, "loss": 5.6074, "mean_token_accuracy": 0.2082306757569313, "num_tokens": 73991852.0, "step": 29190 }, { "entropy": 6.355215454101563, "epoch": 3.3693017888055397, "grad_norm": 1.015625, "learning_rate": 0.00039003473830959395, "loss": 5.7018, "mean_token_accuracy": 0.20693040788173675, "num_tokens": 74005244.0, "step": 29195 }, { "entropy": 6.163452577590943, "epoch": 3.369878822850548, "grad_norm": 1.09375, "learning_rate": 0.00038999927284956784, "loss": 5.3986, "mean_token_accuracy": 0.22728914320468901, "num_tokens": 74018163.0, "step": 29200 }, { "entropy": 6.3070777416229244, "epoch": 3.370455856895557, "grad_norm": 1.0546875, "learning_rate": 0.00038996380352159833, "loss": 5.6454, "mean_token_accuracy": 0.20188517421483992, "num_tokens": 74030857.0, "step": 29205 }, { "entropy": 6.245661926269531, "epoch": 3.3710328909405654, "grad_norm": 1.015625, "learning_rate": 0.00038992833032687837, "loss": 5.5407, "mean_token_accuracy": 0.21168410927057266, "num_tokens": 74042659.0, "step": 29210 }, { "entropy": 6.368112468719483, "epoch": 3.371609924985574, "grad_norm": 1.0078125, "learning_rate": 0.000389892853266601, "loss": 5.6554, "mean_token_accuracy": 0.20354679375886917, "num_tokens": 74055412.0, "step": 29215 }, { "entropy": 6.305950927734375, "epoch": 3.3721869590305826, "grad_norm": 1.03125, "learning_rate": 0.00038985737234195975, "loss": 5.6232, "mean_token_accuracy": 0.20782013535499572, "num_tokens": 74068160.0, "step": 29220 }, { "entropy": 6.305010604858398, "epoch": 3.3727639930755915, "grad_norm": 1.1171875, "learning_rate": 0.00038982188755414774, "loss": 5.5695, "mean_token_accuracy": 0.21423800736665727, "num_tokens": 74080119.0, "step": 29225 }, { "entropy": 6.3191142082214355, "epoch": 3.3733410271206, "grad_norm": 1.0625, "learning_rate": 0.00038978639890435853, "loss": 5.6688, "mean_token_accuracy": 0.20283762663602828, "num_tokens": 74091768.0, "step": 29230 }, { "entropy": 6.344225311279297, "epoch": 3.3739180611656088, "grad_norm": 1.0546875, "learning_rate": 0.0003897509063937859, "loss": 5.6332, "mean_token_accuracy": 0.20785654336214066, "num_tokens": 74104265.0, "step": 29235 }, { "entropy": 6.45944652557373, "epoch": 3.3744950952106176, "grad_norm": 1.078125, "learning_rate": 0.0003897154100236235, "loss": 5.7061, "mean_token_accuracy": 0.2042423352599144, "num_tokens": 74116322.0, "step": 29240 }, { "entropy": 6.380822086334229, "epoch": 3.375072129255626, "grad_norm": 1.0, "learning_rate": 0.0003896799097950653, "loss": 5.7077, "mean_token_accuracy": 0.19910952299833298, "num_tokens": 74127665.0, "step": 29245 }, { "entropy": 6.285206890106201, "epoch": 3.375649163300635, "grad_norm": 1.1015625, "learning_rate": 0.0003896444057093052, "loss": 5.6139, "mean_token_accuracy": 0.2076934590935707, "num_tokens": 74140860.0, "step": 29250 }, { "entropy": 6.3377604484558105, "epoch": 3.3762261973456433, "grad_norm": 1.1015625, "learning_rate": 0.00038960889776753756, "loss": 5.6929, "mean_token_accuracy": 0.19695894718170165, "num_tokens": 74153049.0, "step": 29255 }, { "entropy": 6.382846069335938, "epoch": 3.376803231390652, "grad_norm": 0.98828125, "learning_rate": 0.0003895733859709565, "loss": 5.7235, "mean_token_accuracy": 0.20099511742591858, "num_tokens": 74166701.0, "step": 29260 }, { "entropy": 6.321712636947632, "epoch": 3.3773802654356606, "grad_norm": 1.0, "learning_rate": 0.0003895378703207566, "loss": 5.5985, "mean_token_accuracy": 0.2049229100346565, "num_tokens": 74178995.0, "step": 29265 }, { "entropy": 6.277365446090698, "epoch": 3.3779572994806695, "grad_norm": 1.078125, "learning_rate": 0.0003895023508181323, "loss": 5.5512, "mean_token_accuracy": 0.21110071390867233, "num_tokens": 74191579.0, "step": 29270 }, { "entropy": 6.257118463516235, "epoch": 3.378534333525678, "grad_norm": 1.015625, "learning_rate": 0.00038946682746427824, "loss": 5.5664, "mean_token_accuracy": 0.21131363064050673, "num_tokens": 74206241.0, "step": 29275 }, { "entropy": 6.352369785308838, "epoch": 3.3791113675706868, "grad_norm": 0.96875, "learning_rate": 0.00038943130026038934, "loss": 5.6726, "mean_token_accuracy": 0.20147279351949693, "num_tokens": 74218380.0, "step": 29280 }, { "entropy": 6.309469175338745, "epoch": 3.379688401615695, "grad_norm": 1.046875, "learning_rate": 0.0003893957692076605, "loss": 5.5261, "mean_token_accuracy": 0.21474277824163437, "num_tokens": 74230352.0, "step": 29285 }, { "entropy": 6.182438516616822, "epoch": 3.380265435660704, "grad_norm": 0.91015625, "learning_rate": 0.00038936023430728684, "loss": 5.4973, "mean_token_accuracy": 0.2120675638318062, "num_tokens": 74242817.0, "step": 29290 }, { "entropy": 6.257054948806763, "epoch": 3.3808424697057124, "grad_norm": 1.046875, "learning_rate": 0.0003893246955604635, "loss": 5.5765, "mean_token_accuracy": 0.21418164372444154, "num_tokens": 74255937.0, "step": 29295 }, { "entropy": 6.229521226882935, "epoch": 3.3814195037507213, "grad_norm": 1.0625, "learning_rate": 0.0003892891529683857, "loss": 5.5407, "mean_token_accuracy": 0.21864060312509537, "num_tokens": 74269179.0, "step": 29300 }, { "entropy": 6.189294242858887, "epoch": 3.3819965377957297, "grad_norm": 1.0703125, "learning_rate": 0.00038925360653224906, "loss": 5.5841, "mean_token_accuracy": 0.21910252571105956, "num_tokens": 74281623.0, "step": 29305 }, { "entropy": 6.245767068862915, "epoch": 3.3825735718407386, "grad_norm": 1.0546875, "learning_rate": 0.0003892180562532491, "loss": 5.5496, "mean_token_accuracy": 0.21509899646043779, "num_tokens": 74293079.0, "step": 29310 }, { "entropy": 6.337989568710327, "epoch": 3.3831506058857475, "grad_norm": 1.0859375, "learning_rate": 0.0003891825021325817, "loss": 5.6571, "mean_token_accuracy": 0.2040598288178444, "num_tokens": 74306034.0, "step": 29315 }, { "entropy": 6.235533857345581, "epoch": 3.383727639930756, "grad_norm": 1.09375, "learning_rate": 0.00038914694417144235, "loss": 5.5737, "mean_token_accuracy": 0.21559108793735504, "num_tokens": 74318576.0, "step": 29320 }, { "entropy": 6.281343412399292, "epoch": 3.3843046739757647, "grad_norm": 1.1015625, "learning_rate": 0.00038911138237102735, "loss": 5.61, "mean_token_accuracy": 0.20341164916753768, "num_tokens": 74330856.0, "step": 29325 }, { "entropy": 6.326974201202392, "epoch": 3.384881708020773, "grad_norm": 1.0078125, "learning_rate": 0.0003890758167325327, "loss": 5.6328, "mean_token_accuracy": 0.20842041671276093, "num_tokens": 74343488.0, "step": 29330 }, { "entropy": 6.330953454971313, "epoch": 3.385458742065782, "grad_norm": 1.0625, "learning_rate": 0.00038904024725715453, "loss": 5.7245, "mean_token_accuracy": 0.20046576112508774, "num_tokens": 74356592.0, "step": 29335 }, { "entropy": 6.339637804031372, "epoch": 3.3860357761107904, "grad_norm": 1.0390625, "learning_rate": 0.00038900467394608934, "loss": 5.6044, "mean_token_accuracy": 0.21115469187498093, "num_tokens": 74369987.0, "step": 29340 }, { "entropy": 6.357370090484619, "epoch": 3.3866128101557993, "grad_norm": 1.0078125, "learning_rate": 0.0003889690968005336, "loss": 5.6077, "mean_token_accuracy": 0.2118179455399513, "num_tokens": 74382186.0, "step": 29345 }, { "entropy": 6.2282380104064945, "epoch": 3.3871898442008077, "grad_norm": 1.0625, "learning_rate": 0.00038893351582168387, "loss": 5.5482, "mean_token_accuracy": 0.2183238998055458, "num_tokens": 74395486.0, "step": 29350 }, { "entropy": 6.247542905807495, "epoch": 3.3877668782458166, "grad_norm": 1.0390625, "learning_rate": 0.00038889793101073696, "loss": 5.6093, "mean_token_accuracy": 0.20752064734697342, "num_tokens": 74407641.0, "step": 29355 }, { "entropy": 6.304482173919678, "epoch": 3.388343912290825, "grad_norm": 1.03125, "learning_rate": 0.00038886234236888966, "loss": 5.6331, "mean_token_accuracy": 0.21097840070724488, "num_tokens": 74420036.0, "step": 29360 }, { "entropy": 6.192506265640259, "epoch": 3.388920946335834, "grad_norm": 1.0625, "learning_rate": 0.0003888267498973391, "loss": 5.4903, "mean_token_accuracy": 0.22967896163463591, "num_tokens": 74433682.0, "step": 29365 }, { "entropy": 6.313870143890381, "epoch": 3.3894979803808427, "grad_norm": 1.015625, "learning_rate": 0.0003887911535972823, "loss": 5.7228, "mean_token_accuracy": 0.19508129060268403, "num_tokens": 74445127.0, "step": 29370 }, { "entropy": 6.252066802978516, "epoch": 3.390075014425851, "grad_norm": 1.015625, "learning_rate": 0.0003887555534699166, "loss": 5.5199, "mean_token_accuracy": 0.22077775299549102, "num_tokens": 74458445.0, "step": 29375 }, { "entropy": 6.292688179016113, "epoch": 3.3906520484708595, "grad_norm": 0.8984375, "learning_rate": 0.0003887199495164393, "loss": 5.5921, "mean_token_accuracy": 0.21258362531661987, "num_tokens": 74472025.0, "step": 29380 }, { "entropy": 6.355944061279297, "epoch": 3.3912290825158684, "grad_norm": 1.0625, "learning_rate": 0.000388684341738048, "loss": 5.6391, "mean_token_accuracy": 0.20603423267602922, "num_tokens": 74485016.0, "step": 29385 }, { "entropy": 6.360045957565307, "epoch": 3.3918061165608773, "grad_norm": 0.99609375, "learning_rate": 0.00038864873013594043, "loss": 5.6788, "mean_token_accuracy": 0.20285647809505464, "num_tokens": 74498762.0, "step": 29390 }, { "entropy": 6.339653730392456, "epoch": 3.3923831506058857, "grad_norm": 1.078125, "learning_rate": 0.0003886131147113143, "loss": 5.7165, "mean_token_accuracy": 0.19749857783317565, "num_tokens": 74511864.0, "step": 29395 }, { "entropy": 6.327062940597534, "epoch": 3.3929601846508946, "grad_norm": 1.0078125, "learning_rate": 0.0003885774954653673, "loss": 5.626, "mean_token_accuracy": 0.20828536450862883, "num_tokens": 74524887.0, "step": 29400 }, { "entropy": 6.33983211517334, "epoch": 3.393537218695903, "grad_norm": 1.03125, "learning_rate": 0.0003885418723992977, "loss": 5.5351, "mean_token_accuracy": 0.21684535443782807, "num_tokens": 74537490.0, "step": 29405 }, { "entropy": 6.209836053848266, "epoch": 3.394114252740912, "grad_norm": 1.03125, "learning_rate": 0.0003885062455143038, "loss": 5.4681, "mean_token_accuracy": 0.22164985537528992, "num_tokens": 74550027.0, "step": 29410 }, { "entropy": 6.181258821487427, "epoch": 3.3946912867859202, "grad_norm": 1.1015625, "learning_rate": 0.00038847061481158356, "loss": 5.5538, "mean_token_accuracy": 0.22363968640565873, "num_tokens": 74562318.0, "step": 29415 }, { "entropy": 6.3764732837677, "epoch": 3.395268320830929, "grad_norm": 1.046875, "learning_rate": 0.00038843498029233553, "loss": 5.6746, "mean_token_accuracy": 0.19934020489454268, "num_tokens": 74575316.0, "step": 29420 }, { "entropy": 6.325499582290649, "epoch": 3.3958453548759375, "grad_norm": 1.109375, "learning_rate": 0.0003883993419577584, "loss": 5.602, "mean_token_accuracy": 0.21570999324321746, "num_tokens": 74589043.0, "step": 29425 }, { "entropy": 6.146814489364624, "epoch": 3.3964223889209464, "grad_norm": 1.0390625, "learning_rate": 0.0003883636998090507, "loss": 5.4613, "mean_token_accuracy": 0.22435485273599626, "num_tokens": 74602796.0, "step": 29430 }, { "entropy": 6.28871636390686, "epoch": 3.396999422965955, "grad_norm": 1.03125, "learning_rate": 0.00038832805384741124, "loss": 5.6011, "mean_token_accuracy": 0.2117253214120865, "num_tokens": 74615987.0, "step": 29435 }, { "entropy": 6.409949016571045, "epoch": 3.3975764570109637, "grad_norm": 0.99609375, "learning_rate": 0.0003882924040740389, "loss": 5.7041, "mean_token_accuracy": 0.194938026368618, "num_tokens": 74627940.0, "step": 29440 }, { "entropy": 6.381073713302612, "epoch": 3.3981534910559725, "grad_norm": 0.97265625, "learning_rate": 0.000388256750490133, "loss": 5.6366, "mean_token_accuracy": 0.19963338524103164, "num_tokens": 74641977.0, "step": 29445 }, { "entropy": 6.32768440246582, "epoch": 3.398730525100981, "grad_norm": 1.0, "learning_rate": 0.0003882210930968924, "loss": 5.6012, "mean_token_accuracy": 0.21206954568624498, "num_tokens": 74655119.0, "step": 29450 }, { "entropy": 6.321794843673706, "epoch": 3.3993075591459894, "grad_norm": 1.09375, "learning_rate": 0.0003881854318955167, "loss": 5.6695, "mean_token_accuracy": 0.2061930701136589, "num_tokens": 74667548.0, "step": 29455 }, { "entropy": 6.2855182647705075, "epoch": 3.3998845931909982, "grad_norm": 1.0625, "learning_rate": 0.00038814976688720523, "loss": 5.5898, "mean_token_accuracy": 0.2132022961974144, "num_tokens": 74679365.0, "step": 29460 }, { "entropy": 6.30374321937561, "epoch": 3.400461627236007, "grad_norm": 1.0546875, "learning_rate": 0.00038811409807315746, "loss": 5.6332, "mean_token_accuracy": 0.2022397294640541, "num_tokens": 74690713.0, "step": 29465 }, { "entropy": 6.272971820831299, "epoch": 3.4010386612810155, "grad_norm": 1.03125, "learning_rate": 0.0003880784254545732, "loss": 5.5458, "mean_token_accuracy": 0.21517499685287475, "num_tokens": 74703106.0, "step": 29470 }, { "entropy": 6.360751104354859, "epoch": 3.4016156953260244, "grad_norm": 0.98046875, "learning_rate": 0.00038804274903265226, "loss": 5.6711, "mean_token_accuracy": 0.20268727838993073, "num_tokens": 74715602.0, "step": 29475 }, { "entropy": 6.2980457782745365, "epoch": 3.402192729371033, "grad_norm": 0.98828125, "learning_rate": 0.0003880070688085947, "loss": 5.5957, "mean_token_accuracy": 0.20691435635089875, "num_tokens": 74727842.0, "step": 29480 }, { "entropy": 6.2922975540161135, "epoch": 3.4027697634160416, "grad_norm": 1.109375, "learning_rate": 0.0003879713847836004, "loss": 5.6019, "mean_token_accuracy": 0.20711803287267685, "num_tokens": 74740480.0, "step": 29485 }, { "entropy": 6.217147350311279, "epoch": 3.40334679746105, "grad_norm": 1.0, "learning_rate": 0.00038793569695886964, "loss": 5.4724, "mean_token_accuracy": 0.21813528537750243, "num_tokens": 74753939.0, "step": 29490 }, { "entropy": 6.196096611022949, "epoch": 3.403923831506059, "grad_norm": 1.078125, "learning_rate": 0.000387900005335603, "loss": 5.4674, "mean_token_accuracy": 0.21555966585874559, "num_tokens": 74767055.0, "step": 29495 }, { "entropy": 6.229111671447754, "epoch": 3.4045008655510673, "grad_norm": 0.95703125, "learning_rate": 0.00038786430991500064, "loss": 5.4951, "mean_token_accuracy": 0.22055580019950866, "num_tokens": 74779927.0, "step": 29500 }, { "entropy": 6.29156985282898, "epoch": 3.405077899596076, "grad_norm": 1.09375, "learning_rate": 0.00038782861069826323, "loss": 5.6585, "mean_token_accuracy": 0.20177193284034728, "num_tokens": 74792845.0, "step": 29505 }, { "entropy": 6.257110595703125, "epoch": 3.4056549336410846, "grad_norm": 1.0, "learning_rate": 0.0003877929076865917, "loss": 5.537, "mean_token_accuracy": 0.21649485528469087, "num_tokens": 74807288.0, "step": 29510 }, { "entropy": 6.393070030212402, "epoch": 3.4062319676860935, "grad_norm": 1.015625, "learning_rate": 0.00038775720088118665, "loss": 5.6739, "mean_token_accuracy": 0.205543415248394, "num_tokens": 74819537.0, "step": 29515 }, { "entropy": 6.389664363861084, "epoch": 3.4068090017311023, "grad_norm": 1.140625, "learning_rate": 0.00038772149028324916, "loss": 5.6992, "mean_token_accuracy": 0.20014040172100067, "num_tokens": 74830890.0, "step": 29520 }, { "entropy": 6.347593021392822, "epoch": 3.4073860357761108, "grad_norm": 1.0390625, "learning_rate": 0.00038768577589398033, "loss": 5.6379, "mean_token_accuracy": 0.21419069170951843, "num_tokens": 74843286.0, "step": 29525 }, { "entropy": 6.305737638473511, "epoch": 3.4079630698211196, "grad_norm": 1.1171875, "learning_rate": 0.00038765005771458145, "loss": 5.582, "mean_token_accuracy": 0.21106716692447663, "num_tokens": 74854743.0, "step": 29530 }, { "entropy": 6.25415449142456, "epoch": 3.408540103866128, "grad_norm": 1.0234375, "learning_rate": 0.0003876143357462538, "loss": 5.612, "mean_token_accuracy": 0.2041926935315132, "num_tokens": 74867031.0, "step": 29535 }, { "entropy": 6.266235494613648, "epoch": 3.409117137911137, "grad_norm": 1.0703125, "learning_rate": 0.0003875786099901989, "loss": 5.5281, "mean_token_accuracy": 0.21584420055150985, "num_tokens": 74880045.0, "step": 29540 }, { "entropy": 6.326585865020752, "epoch": 3.4096941719561453, "grad_norm": 1.0703125, "learning_rate": 0.00038754288044761835, "loss": 5.6547, "mean_token_accuracy": 0.19908049404621125, "num_tokens": 74893671.0, "step": 29545 }, { "entropy": 6.384521341323852, "epoch": 3.410271206001154, "grad_norm": 1.09375, "learning_rate": 0.00038750714711971397, "loss": 5.6807, "mean_token_accuracy": 0.20197383761405946, "num_tokens": 74906580.0, "step": 29550 }, { "entropy": 6.338169574737549, "epoch": 3.4108482400461626, "grad_norm": 0.97265625, "learning_rate": 0.00038747141000768754, "loss": 5.6643, "mean_token_accuracy": 0.20538965463638306, "num_tokens": 74919540.0, "step": 29555 }, { "entropy": 6.299989700317383, "epoch": 3.4114252740911715, "grad_norm": 1.109375, "learning_rate": 0.00038743566911274117, "loss": 5.5633, "mean_token_accuracy": 0.20932378768920898, "num_tokens": 74930931.0, "step": 29560 }, { "entropy": 6.259969234466553, "epoch": 3.41200230813618, "grad_norm": 0.9921875, "learning_rate": 0.00038739992443607686, "loss": 5.5544, "mean_token_accuracy": 0.2169748529791832, "num_tokens": 74943531.0, "step": 29565 }, { "entropy": 6.285850095748901, "epoch": 3.4125793421811887, "grad_norm": 1.03125, "learning_rate": 0.00038736417597889694, "loss": 5.654, "mean_token_accuracy": 0.20867855548858644, "num_tokens": 74955808.0, "step": 29570 }, { "entropy": 6.324159574508667, "epoch": 3.413156376226197, "grad_norm": 1.109375, "learning_rate": 0.0003873284237424038, "loss": 5.6081, "mean_token_accuracy": 0.21392519325017928, "num_tokens": 74967412.0, "step": 29575 }, { "entropy": 6.305287456512451, "epoch": 3.413733410271206, "grad_norm": 1.1796875, "learning_rate": 0.00038729266772779994, "loss": 5.5997, "mean_token_accuracy": 0.20736124664545058, "num_tokens": 74979889.0, "step": 29580 }, { "entropy": 6.27784276008606, "epoch": 3.4143104443162144, "grad_norm": 0.98828125, "learning_rate": 0.00038725690793628794, "loss": 5.5634, "mean_token_accuracy": 0.21148323714733125, "num_tokens": 74992550.0, "step": 29585 }, { "entropy": 6.25721173286438, "epoch": 3.4148874783612233, "grad_norm": 1.0625, "learning_rate": 0.00038722114436907056, "loss": 5.5935, "mean_token_accuracy": 0.2108869358897209, "num_tokens": 75005940.0, "step": 29590 }, { "entropy": 6.240416812896728, "epoch": 3.415464512406232, "grad_norm": 1.078125, "learning_rate": 0.0003871853770273508, "loss": 5.5303, "mean_token_accuracy": 0.21673659086227418, "num_tokens": 75018102.0, "step": 29595 }, { "entropy": 6.335780286788941, "epoch": 3.4160415464512406, "grad_norm": 1.1015625, "learning_rate": 0.0003871496059123316, "loss": 5.5938, "mean_token_accuracy": 0.21495284736156464, "num_tokens": 75031192.0, "step": 29600 }, { "entropy": 6.339282655715943, "epoch": 3.4166185804962494, "grad_norm": 1.125, "learning_rate": 0.0003871138310252161, "loss": 5.6708, "mean_token_accuracy": 0.2129219025373459, "num_tokens": 75042791.0, "step": 29605 }, { "entropy": 6.33289213180542, "epoch": 3.417195614541258, "grad_norm": 1.0234375, "learning_rate": 0.0003870780523672075, "loss": 5.6398, "mean_token_accuracy": 0.20587825030088425, "num_tokens": 75055649.0, "step": 29610 }, { "entropy": 6.24309663772583, "epoch": 3.4177726485862667, "grad_norm": 1.0234375, "learning_rate": 0.0003870422699395094, "loss": 5.5502, "mean_token_accuracy": 0.21617501080036164, "num_tokens": 75068209.0, "step": 29615 }, { "entropy": 6.298670101165771, "epoch": 3.418349682631275, "grad_norm": 1.0703125, "learning_rate": 0.00038700648374332514, "loss": 5.5738, "mean_token_accuracy": 0.2167545586824417, "num_tokens": 75080606.0, "step": 29620 }, { "entropy": 6.348202323913574, "epoch": 3.418926716676284, "grad_norm": 0.984375, "learning_rate": 0.0003869706937798585, "loss": 5.6634, "mean_token_accuracy": 0.20921919494867325, "num_tokens": 75094585.0, "step": 29625 }, { "entropy": 6.346184730529785, "epoch": 3.4195037507212924, "grad_norm": 1.0234375, "learning_rate": 0.00038693490005031316, "loss": 5.7287, "mean_token_accuracy": 0.2047036036849022, "num_tokens": 75106953.0, "step": 29630 }, { "entropy": 6.314962339401245, "epoch": 3.4200807847663013, "grad_norm": 0.9921875, "learning_rate": 0.00038689910255589304, "loss": 5.671, "mean_token_accuracy": 0.2018256515264511, "num_tokens": 75119506.0, "step": 29635 }, { "entropy": 6.284228801727295, "epoch": 3.4206578188113097, "grad_norm": 1.109375, "learning_rate": 0.00038686330129780223, "loss": 5.5172, "mean_token_accuracy": 0.21206527948379517, "num_tokens": 75132219.0, "step": 29640 }, { "entropy": 6.320038986206055, "epoch": 3.4212348528563186, "grad_norm": 0.984375, "learning_rate": 0.00038682749627724485, "loss": 5.6747, "mean_token_accuracy": 0.20254862904548646, "num_tokens": 75143880.0, "step": 29645 }, { "entropy": 6.242632293701172, "epoch": 3.4218118869013274, "grad_norm": 1.078125, "learning_rate": 0.0003867916874954251, "loss": 5.5538, "mean_token_accuracy": 0.2164613664150238, "num_tokens": 75156673.0, "step": 29650 }, { "entropy": 6.285417270660401, "epoch": 3.422388920946336, "grad_norm": 1.0, "learning_rate": 0.0003867558749535475, "loss": 5.5404, "mean_token_accuracy": 0.21470536440610885, "num_tokens": 75168846.0, "step": 29655 }, { "entropy": 6.305616283416748, "epoch": 3.4229659549913443, "grad_norm": 1.0546875, "learning_rate": 0.0003867200586528166, "loss": 5.6283, "mean_token_accuracy": 0.21201475709676743, "num_tokens": 75181046.0, "step": 29660 }, { "entropy": 6.250073099136353, "epoch": 3.423542989036353, "grad_norm": 1.046875, "learning_rate": 0.00038668423859443705, "loss": 5.5899, "mean_token_accuracy": 0.21246559470891951, "num_tokens": 75193266.0, "step": 29665 }, { "entropy": 6.225381755828858, "epoch": 3.424120023081362, "grad_norm": 1.0859375, "learning_rate": 0.0003866484147796136, "loss": 5.478, "mean_token_accuracy": 0.2194352462887764, "num_tokens": 75204267.0, "step": 29670 }, { "entropy": 6.2832659721374515, "epoch": 3.4246970571263704, "grad_norm": 1.0234375, "learning_rate": 0.00038661258720955105, "loss": 5.6402, "mean_token_accuracy": 0.21196531355381013, "num_tokens": 75216932.0, "step": 29675 }, { "entropy": 6.261052036285401, "epoch": 3.4252740911713793, "grad_norm": 1.0078125, "learning_rate": 0.00038657675588545467, "loss": 5.5414, "mean_token_accuracy": 0.21436585038900374, "num_tokens": 75229084.0, "step": 29680 }, { "entropy": 6.255423307418823, "epoch": 3.4258511252163877, "grad_norm": 1.125, "learning_rate": 0.0003865409208085295, "loss": 5.627, "mean_token_accuracy": 0.20741465836763381, "num_tokens": 75241356.0, "step": 29685 }, { "entropy": 6.254886054992676, "epoch": 3.4264281592613965, "grad_norm": 1.0703125, "learning_rate": 0.00038650508197998095, "loss": 5.5736, "mean_token_accuracy": 0.21291148960590361, "num_tokens": 75252768.0, "step": 29690 }, { "entropy": 6.2614960193634035, "epoch": 3.427005193306405, "grad_norm": 1.1171875, "learning_rate": 0.0003864692394010143, "loss": 5.5819, "mean_token_accuracy": 0.21272424906492232, "num_tokens": 75265517.0, "step": 29695 }, { "entropy": 6.375015211105347, "epoch": 3.427582227351414, "grad_norm": 1.0546875, "learning_rate": 0.00038643339307283507, "loss": 5.7599, "mean_token_accuracy": 0.19434330016374587, "num_tokens": 75278191.0, "step": 29700 }, { "entropy": 6.273368644714355, "epoch": 3.4281592613964222, "grad_norm": 1.1171875, "learning_rate": 0.00038639754299664913, "loss": 5.5163, "mean_token_accuracy": 0.21345360279083253, "num_tokens": 75290794.0, "step": 29705 }, { "entropy": 6.284481382369995, "epoch": 3.428736295441431, "grad_norm": 1.015625, "learning_rate": 0.00038636168917366214, "loss": 5.6454, "mean_token_accuracy": 0.20390833616256715, "num_tokens": 75303438.0, "step": 29710 }, { "entropy": 6.250480604171753, "epoch": 3.4293133294864395, "grad_norm": 1.0390625, "learning_rate": 0.00038632583160508, "loss": 5.5653, "mean_token_accuracy": 0.21113053411245347, "num_tokens": 75317336.0, "step": 29715 }, { "entropy": 6.305090618133545, "epoch": 3.4298903635314484, "grad_norm": 1.078125, "learning_rate": 0.00038628997029210887, "loss": 5.6129, "mean_token_accuracy": 0.20843510776758195, "num_tokens": 75328952.0, "step": 29720 }, { "entropy": 6.371630573272705, "epoch": 3.4304673975764572, "grad_norm": 1.0625, "learning_rate": 0.00038625410523595487, "loss": 5.7006, "mean_token_accuracy": 0.20116952210664749, "num_tokens": 75341116.0, "step": 29725 }, { "entropy": 6.358349990844727, "epoch": 3.4310444316214657, "grad_norm": 0.984375, "learning_rate": 0.00038621823643782426, "loss": 5.6605, "mean_token_accuracy": 0.20419360250234603, "num_tokens": 75354150.0, "step": 29730 }, { "entropy": 6.345208692550659, "epoch": 3.431621465666474, "grad_norm": 1.09375, "learning_rate": 0.0003861823638989235, "loss": 5.5843, "mean_token_accuracy": 0.21923115253448486, "num_tokens": 75367809.0, "step": 29735 }, { "entropy": 6.126128005981445, "epoch": 3.432198499711483, "grad_norm": 1.0625, "learning_rate": 0.00038614648762045923, "loss": 5.4591, "mean_token_accuracy": 0.22471146434545516, "num_tokens": 75380536.0, "step": 29740 }, { "entropy": 6.193651533126831, "epoch": 3.432775533756492, "grad_norm": 1.0390625, "learning_rate": 0.000386110607603638, "loss": 5.5073, "mean_token_accuracy": 0.2140814945101738, "num_tokens": 75392994.0, "step": 29745 }, { "entropy": 6.3105395317077635, "epoch": 3.4333525678015, "grad_norm": 1.0859375, "learning_rate": 0.0003860747238496667, "loss": 5.5952, "mean_token_accuracy": 0.20901768654584885, "num_tokens": 75405344.0, "step": 29750 }, { "entropy": 6.379081201553345, "epoch": 3.433929601846509, "grad_norm": 1.1171875, "learning_rate": 0.00038603883635975224, "loss": 5.6961, "mean_token_accuracy": 0.20255425572395325, "num_tokens": 75418059.0, "step": 29755 }, { "entropy": 6.312580347061157, "epoch": 3.4345066358915175, "grad_norm": 1.03125, "learning_rate": 0.0003860029451351016, "loss": 5.6511, "mean_token_accuracy": 0.2055727183818817, "num_tokens": 75431316.0, "step": 29760 }, { "entropy": 6.288564014434814, "epoch": 3.4350836699365264, "grad_norm": 1.078125, "learning_rate": 0.00038596705017692216, "loss": 5.5918, "mean_token_accuracy": 0.205415803194046, "num_tokens": 75443542.0, "step": 29765 }, { "entropy": 6.295324802398682, "epoch": 3.435660703981535, "grad_norm": 1.0078125, "learning_rate": 0.00038593115148642107, "loss": 5.6561, "mean_token_accuracy": 0.20467182248830795, "num_tokens": 75455422.0, "step": 29770 }, { "entropy": 6.263564157485962, "epoch": 3.4362377380265436, "grad_norm": 1.046875, "learning_rate": 0.00038589524906480576, "loss": 5.5884, "mean_token_accuracy": 0.2191532015800476, "num_tokens": 75468702.0, "step": 29775 }, { "entropy": 6.2329939842224125, "epoch": 3.436814772071552, "grad_norm": 1.0546875, "learning_rate": 0.0003858593429132838, "loss": 5.5074, "mean_token_accuracy": 0.21822710931301117, "num_tokens": 75480217.0, "step": 29780 }, { "entropy": 6.314549779891967, "epoch": 3.437391806116561, "grad_norm": 1.0234375, "learning_rate": 0.00038582343303306306, "loss": 5.6449, "mean_token_accuracy": 0.20735921561717988, "num_tokens": 75492826.0, "step": 29785 }, { "entropy": 6.335971117019653, "epoch": 3.4379688401615693, "grad_norm": 1.0234375, "learning_rate": 0.0003857875194253511, "loss": 5.6719, "mean_token_accuracy": 0.20562490820884705, "num_tokens": 75504398.0, "step": 29790 }, { "entropy": 6.301286411285401, "epoch": 3.438545874206578, "grad_norm": 1.015625, "learning_rate": 0.0003857516020913559, "loss": 5.6096, "mean_token_accuracy": 0.20939625799655914, "num_tokens": 75516028.0, "step": 29795 }, { "entropy": 6.356657791137695, "epoch": 3.439122908251587, "grad_norm": 1.0078125, "learning_rate": 0.00038571568103228565, "loss": 5.6362, "mean_token_accuracy": 0.2080766960978508, "num_tokens": 75528811.0, "step": 29800 }, { "entropy": 6.262935161590576, "epoch": 3.4396999422965955, "grad_norm": 1.0625, "learning_rate": 0.0003856797562493485, "loss": 5.4981, "mean_token_accuracy": 0.2227972701191902, "num_tokens": 75542784.0, "step": 29805 }, { "entropy": 6.331818962097168, "epoch": 3.4402769763416043, "grad_norm": 1.078125, "learning_rate": 0.0003856438277437527, "loss": 5.6531, "mean_token_accuracy": 0.20507561415433884, "num_tokens": 75555295.0, "step": 29810 }, { "entropy": 6.315788984298706, "epoch": 3.4408540103866128, "grad_norm": 1.1015625, "learning_rate": 0.00038560789551670663, "loss": 5.663, "mean_token_accuracy": 0.2064618617296219, "num_tokens": 75568234.0, "step": 29815 }, { "entropy": 6.329085111618042, "epoch": 3.4414310444316216, "grad_norm": 1.0703125, "learning_rate": 0.00038557195956941896, "loss": 5.6242, "mean_token_accuracy": 0.2060800760984421, "num_tokens": 75580865.0, "step": 29820 }, { "entropy": 6.348110628128052, "epoch": 3.44200807847663, "grad_norm": 1.0703125, "learning_rate": 0.00038553601990309845, "loss": 5.6714, "mean_token_accuracy": 0.202749402821064, "num_tokens": 75593679.0, "step": 29825 }, { "entropy": 6.402059602737427, "epoch": 3.442585112521639, "grad_norm": 1.0, "learning_rate": 0.00038550007651895376, "loss": 5.7096, "mean_token_accuracy": 0.20487726628780364, "num_tokens": 75607061.0, "step": 29830 }, { "entropy": 6.36814603805542, "epoch": 3.4431621465666473, "grad_norm": 1.046875, "learning_rate": 0.00038546412941819385, "loss": 5.6144, "mean_token_accuracy": 0.20971840471029282, "num_tokens": 75619729.0, "step": 29835 }, { "entropy": 6.399398851394653, "epoch": 3.443739180611656, "grad_norm": 1.1484375, "learning_rate": 0.0003854281786020279, "loss": 5.7028, "mean_token_accuracy": 0.1975073590874672, "num_tokens": 75631942.0, "step": 29840 }, { "entropy": 6.295283699035645, "epoch": 3.4443162146566646, "grad_norm": 0.9375, "learning_rate": 0.00038539222407166495, "loss": 5.6169, "mean_token_accuracy": 0.21209257692098618, "num_tokens": 75646181.0, "step": 29845 }, { "entropy": 6.254492378234863, "epoch": 3.4448932487016735, "grad_norm": 1.1640625, "learning_rate": 0.0003853562658283144, "loss": 5.5081, "mean_token_accuracy": 0.21548499912023544, "num_tokens": 75657808.0, "step": 29850 }, { "entropy": 6.264165353775025, "epoch": 3.445470282746682, "grad_norm": 1.0, "learning_rate": 0.00038532030387318565, "loss": 5.5936, "mean_token_accuracy": 0.2183812826871872, "num_tokens": 75670166.0, "step": 29855 }, { "entropy": 6.330345010757446, "epoch": 3.4460473167916907, "grad_norm": 0.98046875, "learning_rate": 0.00038528433820748833, "loss": 5.7231, "mean_token_accuracy": 0.2001278281211853, "num_tokens": 75682511.0, "step": 29860 }, { "entropy": 6.417759704589844, "epoch": 3.446624350836699, "grad_norm": 1.1015625, "learning_rate": 0.00038524836883243197, "loss": 5.6952, "mean_token_accuracy": 0.20468641966581344, "num_tokens": 75694785.0, "step": 29865 }, { "entropy": 6.36159200668335, "epoch": 3.447201384881708, "grad_norm": 1.078125, "learning_rate": 0.00038521239574922664, "loss": 5.6774, "mean_token_accuracy": 0.2047070547938347, "num_tokens": 75707908.0, "step": 29870 }, { "entropy": 6.293680858612061, "epoch": 3.447778418926717, "grad_norm": 1.078125, "learning_rate": 0.000385176418959082, "loss": 5.5882, "mean_token_accuracy": 0.2066198170185089, "num_tokens": 75720733.0, "step": 29875 }, { "entropy": 6.2677295207977295, "epoch": 3.4483554529717253, "grad_norm": 1.0625, "learning_rate": 0.00038514043846320825, "loss": 5.5091, "mean_token_accuracy": 0.21238078325986862, "num_tokens": 75732511.0, "step": 29880 }, { "entropy": 6.29506287574768, "epoch": 3.448932487016734, "grad_norm": 1.03125, "learning_rate": 0.00038510445426281556, "loss": 5.5981, "mean_token_accuracy": 0.21783992946147918, "num_tokens": 75744949.0, "step": 29885 }, { "entropy": 6.230957317352295, "epoch": 3.4495095210617426, "grad_norm": 1.0546875, "learning_rate": 0.0003850684663591143, "loss": 5.6077, "mean_token_accuracy": 0.20808719098567963, "num_tokens": 75758049.0, "step": 29890 }, { "entropy": 6.276919937133789, "epoch": 3.4500865551067514, "grad_norm": 1.0546875, "learning_rate": 0.0003850324747533148, "loss": 5.53, "mean_token_accuracy": 0.21354656666517258, "num_tokens": 75772242.0, "step": 29895 }, { "entropy": 6.276070690155029, "epoch": 3.45066358915176, "grad_norm": 1.0859375, "learning_rate": 0.0003849964794466277, "loss": 5.5506, "mean_token_accuracy": 0.21536167860031127, "num_tokens": 75784711.0, "step": 29900 }, { "entropy": 6.395268726348877, "epoch": 3.4512406231967687, "grad_norm": 1.0, "learning_rate": 0.0003849604804402636, "loss": 5.7082, "mean_token_accuracy": 0.1957272246479988, "num_tokens": 75796757.0, "step": 29905 }, { "entropy": 6.316126155853271, "epoch": 3.451817657241777, "grad_norm": 1.0859375, "learning_rate": 0.00038492447773543344, "loss": 5.6576, "mean_token_accuracy": 0.20480319410562514, "num_tokens": 75810195.0, "step": 29910 }, { "entropy": 6.31956467628479, "epoch": 3.452394691286786, "grad_norm": 1.0546875, "learning_rate": 0.000384888471333348, "loss": 5.6286, "mean_token_accuracy": 0.21470877677202224, "num_tokens": 75822645.0, "step": 29915 }, { "entropy": 6.280429458618164, "epoch": 3.4529717253317944, "grad_norm": 1.0546875, "learning_rate": 0.0003848524612352184, "loss": 5.6554, "mean_token_accuracy": 0.2015328586101532, "num_tokens": 75834277.0, "step": 29920 }, { "entropy": 6.344773292541504, "epoch": 3.4535487593768033, "grad_norm": 1.0234375, "learning_rate": 0.0003848164474422559, "loss": 5.6418, "mean_token_accuracy": 0.2047449991106987, "num_tokens": 75846111.0, "step": 29925 }, { "entropy": 6.395335388183594, "epoch": 3.4541257934218117, "grad_norm": 1.046875, "learning_rate": 0.00038478042995567175, "loss": 5.661, "mean_token_accuracy": 0.20329206585884094, "num_tokens": 75858453.0, "step": 29930 }, { "entropy": 6.306465101242066, "epoch": 3.4547028274668206, "grad_norm": 1.015625, "learning_rate": 0.0003847444087766773, "loss": 5.6715, "mean_token_accuracy": 0.20226105749607087, "num_tokens": 75870127.0, "step": 29935 }, { "entropy": 6.2155303955078125, "epoch": 3.455279861511829, "grad_norm": 1.1171875, "learning_rate": 0.00038470838390648423, "loss": 5.4805, "mean_token_accuracy": 0.21685548573732377, "num_tokens": 75883320.0, "step": 29940 }, { "entropy": 6.2545592308044435, "epoch": 3.455856895556838, "grad_norm": 1.0234375, "learning_rate": 0.00038467235534630405, "loss": 5.6003, "mean_token_accuracy": 0.20251470059156418, "num_tokens": 75897433.0, "step": 29945 }, { "entropy": 6.314982748031616, "epoch": 3.4564339296018467, "grad_norm": 1.078125, "learning_rate": 0.0003846363230973488, "loss": 5.5994, "mean_token_accuracy": 0.21036150753498079, "num_tokens": 75909919.0, "step": 29950 }, { "entropy": 6.345373725891113, "epoch": 3.457010963646855, "grad_norm": 1.03125, "learning_rate": 0.00038460028716083024, "loss": 5.6588, "mean_token_accuracy": 0.2088895246386528, "num_tokens": 75923101.0, "step": 29955 }, { "entropy": 6.235252046585083, "epoch": 3.457587997691864, "grad_norm": 0.984375, "learning_rate": 0.0003845642475379605, "loss": 5.567, "mean_token_accuracy": 0.2051964893937111, "num_tokens": 75936331.0, "step": 29960 }, { "entropy": 6.280921506881714, "epoch": 3.4581650317368724, "grad_norm": 1.0859375, "learning_rate": 0.0003845282042299516, "loss": 5.5579, "mean_token_accuracy": 0.21245438307523729, "num_tokens": 75947921.0, "step": 29965 }, { "entropy": 6.3211565017700195, "epoch": 3.4587420657818813, "grad_norm": 1.0859375, "learning_rate": 0.0003844921572380161, "loss": 5.5818, "mean_token_accuracy": 0.20676211565732955, "num_tokens": 75960454.0, "step": 29970 }, { "entropy": 6.284748172760009, "epoch": 3.4593190998268897, "grad_norm": 1.1640625, "learning_rate": 0.0003844561065633662, "loss": 5.6675, "mean_token_accuracy": 0.19994053095579148, "num_tokens": 75972909.0, "step": 29975 }, { "entropy": 6.305700969696045, "epoch": 3.4598961338718985, "grad_norm": 1.0, "learning_rate": 0.0003844200522072145, "loss": 5.5809, "mean_token_accuracy": 0.20914534330368043, "num_tokens": 75985360.0, "step": 29980 }, { "entropy": 6.333784914016723, "epoch": 3.460473167916907, "grad_norm": 1.1015625, "learning_rate": 0.0003843839941707738, "loss": 5.5613, "mean_token_accuracy": 0.2130906105041504, "num_tokens": 75996434.0, "step": 29985 }, { "entropy": 6.3065221309661865, "epoch": 3.461050201961916, "grad_norm": 1.015625, "learning_rate": 0.0003843479324552567, "loss": 5.5781, "mean_token_accuracy": 0.20661005079746247, "num_tokens": 76008721.0, "step": 29990 }, { "entropy": 6.31390962600708, "epoch": 3.4616272360069242, "grad_norm": 1.109375, "learning_rate": 0.00038431186706187626, "loss": 5.6427, "mean_token_accuracy": 0.20778784155845642, "num_tokens": 76021775.0, "step": 29995 }, { "entropy": 6.303632926940918, "epoch": 3.462204270051933, "grad_norm": 1.046875, "learning_rate": 0.00038427579799184546, "loss": 5.5825, "mean_token_accuracy": 0.2140277534723282, "num_tokens": 76034607.0, "step": 30000 }, { "epoch": 3.462204270051933, "eval_entropy": 6.1142602748480375, "eval_loss": 5.721312999725342, "eval_mean_token_accuracy": 0.21227686378743657, "eval_num_tokens": 76034607.0, "eval_runtime": 17.4567, "eval_samples_per_second": 1611.759, "eval_steps_per_second": 201.47, "step": 30000 } ], "logging_steps": 5, "max_steps": 86650, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.662910440505344e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }