{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2520478890989288, "eval_steps": 3000, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.897539186477661, "epoch": 0.0004200798151648813, "grad_norm": 14.0, "learning_rate": 2e-06, "loss": 14.0815, "mean_token_accuracy": 0.0, "num_tokens": 8348.0, "step": 5 }, { "entropy": 4.873638677597046, "epoch": 0.0008401596303297626, "grad_norm": 13.625, "learning_rate": 4.5e-06, "loss": 14.0885, "mean_token_accuracy": 0.0, "num_tokens": 17465.0, "step": 10 }, { "entropy": 4.912403154373169, "epoch": 0.001260239445494644, "grad_norm": 15.4375, "learning_rate": 7e-06, "loss": 14.0641, "mean_token_accuracy": 0.0, "num_tokens": 26627.0, "step": 15 }, { "entropy": 4.9623668670654295, "epoch": 0.0016803192606595252, "grad_norm": 17.875, "learning_rate": 9.5e-06, "loss": 13.8986, "mean_token_accuracy": 0.0, "num_tokens": 36069.0, "step": 20 }, { "entropy": 5.122641944885254, "epoch": 0.002100399075824407, "grad_norm": 21.0, "learning_rate": 1.2e-05, "loss": 13.4962, "mean_token_accuracy": 0.00036849312018603084, "num_tokens": 44967.0, "step": 25 }, { "entropy": 5.440350961685181, "epoch": 0.002520478890989288, "grad_norm": 25.875, "learning_rate": 1.4500000000000002e-05, "loss": 13.0078, "mean_token_accuracy": 0.00010752688394859433, "num_tokens": 55132.0, "step": 30 }, { "entropy": 7.052726125717163, "epoch": 0.0029405587061541692, "grad_norm": 21.25, "learning_rate": 1.7000000000000003e-05, "loss": 11.9064, "mean_token_accuracy": 0.0, "num_tokens": 65141.0, "step": 35 }, { "entropy": 10.193820476531982, "epoch": 0.0033606385213190504, "grad_norm": 3.171875, "learning_rate": 1.95e-05, "loss": 10.8374, "mean_token_accuracy": 0.0, "num_tokens": 74007.0, "step": 40 }, { "entropy": 10.727454471588135, "epoch": 0.003780718336483932, "grad_norm": 2.984375, "learning_rate": 2.2e-05, "loss": 10.6658, "mean_token_accuracy": 0.004875225311843678, "num_tokens": 83736.0, "step": 45 }, { "entropy": 10.743746089935303, "epoch": 0.004200798151648814, "grad_norm": 2.5625, "learning_rate": 2.4500000000000003e-05, "loss": 10.4916, "mean_token_accuracy": 0.01765382578596473, "num_tokens": 92525.0, "step": 50 }, { "entropy": 10.714706707000733, "epoch": 0.004620877966813695, "grad_norm": 2.234375, "learning_rate": 2.7e-05, "loss": 10.3094, "mean_token_accuracy": 0.01746684079989791, "num_tokens": 102015.0, "step": 55 }, { "entropy": 10.654456615447998, "epoch": 0.005040957781978576, "grad_norm": 1.7578125, "learning_rate": 2.95e-05, "loss": 10.1455, "mean_token_accuracy": 0.019217501021921636, "num_tokens": 110887.0, "step": 60 }, { "entropy": 10.696210289001465, "epoch": 0.005461037597143457, "grad_norm": 1.9140625, "learning_rate": 3.2e-05, "loss": 10.0256, "mean_token_accuracy": 0.018034272640943528, "num_tokens": 120442.0, "step": 65 }, { "entropy": 10.72099323272705, "epoch": 0.0058811174123083385, "grad_norm": 1.90625, "learning_rate": 3.4500000000000005e-05, "loss": 9.8848, "mean_token_accuracy": 0.029999475181102752, "num_tokens": 129297.0, "step": 70 }, { "entropy": 10.713169956207276, "epoch": 0.00630119722747322, "grad_norm": 1.7890625, "learning_rate": 3.7e-05, "loss": 9.8186, "mean_token_accuracy": 0.03141374848783016, "num_tokens": 138305.0, "step": 75 }, { "entropy": 10.702960300445557, "epoch": 0.006721277042638101, "grad_norm": 1.9140625, "learning_rate": 3.95e-05, "loss": 9.7553, "mean_token_accuracy": 0.023225654661655427, "num_tokens": 147640.0, "step": 80 }, { "entropy": 10.704542255401611, "epoch": 0.007141356857802983, "grad_norm": 1.78125, "learning_rate": 4.2000000000000004e-05, "loss": 9.6696, "mean_token_accuracy": 0.02769038388505578, "num_tokens": 157633.0, "step": 85 }, { "entropy": 10.70653486251831, "epoch": 0.007561436672967864, "grad_norm": 1.59375, "learning_rate": 4.45e-05, "loss": 9.607, "mean_token_accuracy": 0.04190691113471985, "num_tokens": 167984.0, "step": 90 }, { "entropy": 10.694128608703613, "epoch": 0.007981516488132745, "grad_norm": 1.65625, "learning_rate": 4.7000000000000004e-05, "loss": 9.4789, "mean_token_accuracy": 0.05244061499834061, "num_tokens": 176984.0, "step": 95 }, { "entropy": 10.663659858703614, "epoch": 0.008401596303297627, "grad_norm": 1.7890625, "learning_rate": 4.9500000000000004e-05, "loss": 9.3453, "mean_token_accuracy": 0.043341046944260594, "num_tokens": 185931.0, "step": 100 }, { "entropy": 10.635926151275635, "epoch": 0.008821676118462508, "grad_norm": 1.7734375, "learning_rate": 5.2e-05, "loss": 9.2908, "mean_token_accuracy": 0.04105062447488308, "num_tokens": 195065.0, "step": 105 }, { "entropy": 10.617516040802002, "epoch": 0.00924175593362739, "grad_norm": 1.5859375, "learning_rate": 5.45e-05, "loss": 9.1462, "mean_token_accuracy": 0.05056820251047611, "num_tokens": 203687.0, "step": 110 }, { "entropy": 10.578640842437744, "epoch": 0.00966183574879227, "grad_norm": 1.5390625, "learning_rate": 5.7e-05, "loss": 9.0627, "mean_token_accuracy": 0.05324659980833531, "num_tokens": 212847.0, "step": 115 }, { "entropy": 10.534226608276366, "epoch": 0.010081915563957152, "grad_norm": 1.7265625, "learning_rate": 5.9499999999999996e-05, "loss": 8.9326, "mean_token_accuracy": 0.05340988412499428, "num_tokens": 222593.0, "step": 120 }, { "entropy": 10.47627763748169, "epoch": 0.010501995379122032, "grad_norm": 1.59375, "learning_rate": 6.2e-05, "loss": 8.7909, "mean_token_accuracy": 0.05306763276457786, "num_tokens": 231174.0, "step": 125 }, { "entropy": 10.402797031402589, "epoch": 0.010922075194286915, "grad_norm": 1.515625, "learning_rate": 6.450000000000001e-05, "loss": 8.6666, "mean_token_accuracy": 0.0565425343811512, "num_tokens": 239833.0, "step": 130 }, { "entropy": 10.321593379974365, "epoch": 0.011342155009451797, "grad_norm": 1.5078125, "learning_rate": 6.7e-05, "loss": 8.6377, "mean_token_accuracy": 0.05593148916959763, "num_tokens": 248794.0, "step": 135 }, { "entropy": 10.22030849456787, "epoch": 0.011762234824616677, "grad_norm": 1.3515625, "learning_rate": 6.950000000000001e-05, "loss": 8.5488, "mean_token_accuracy": 0.05581129565834999, "num_tokens": 257123.0, "step": 140 }, { "entropy": 10.1541109085083, "epoch": 0.012182314639781559, "grad_norm": 1.359375, "learning_rate": 7.2e-05, "loss": 8.309, "mean_token_accuracy": 0.05627111345529556, "num_tokens": 266088.0, "step": 145 }, { "entropy": 10.05057725906372, "epoch": 0.01260239445494644, "grad_norm": 1.15625, "learning_rate": 7.45e-05, "loss": 8.3916, "mean_token_accuracy": 0.05131003558635712, "num_tokens": 276074.0, "step": 150 }, { "entropy": 9.931949615478516, "epoch": 0.013022474270111321, "grad_norm": 1.1484375, "learning_rate": 7.7e-05, "loss": 8.2337, "mean_token_accuracy": 0.05355307124555111, "num_tokens": 285280.0, "step": 155 }, { "entropy": 9.78201379776001, "epoch": 0.013442554085276202, "grad_norm": 1.125, "learning_rate": 7.950000000000001e-05, "loss": 8.1889, "mean_token_accuracy": 0.05086107552051544, "num_tokens": 296115.0, "step": 160 }, { "entropy": 9.592757034301759, "epoch": 0.013862633900441084, "grad_norm": 0.9296875, "learning_rate": 8.2e-05, "loss": 8.0092, "mean_token_accuracy": 0.05353938601911068, "num_tokens": 305483.0, "step": 165 }, { "entropy": 9.374695110321046, "epoch": 0.014282713715605966, "grad_norm": 0.875, "learning_rate": 8.450000000000001e-05, "loss": 7.9652, "mean_token_accuracy": 0.05161282308399677, "num_tokens": 314000.0, "step": 170 }, { "entropy": 9.172936820983887, "epoch": 0.014702793530770846, "grad_norm": 0.93359375, "learning_rate": 8.7e-05, "loss": 7.9024, "mean_token_accuracy": 0.0552643246948719, "num_tokens": 323667.0, "step": 175 }, { "entropy": 8.918990325927734, "epoch": 0.015122873345935728, "grad_norm": 0.76953125, "learning_rate": 8.95e-05, "loss": 7.858, "mean_token_accuracy": 0.052525343000888826, "num_tokens": 332695.0, "step": 180 }, { "entropy": 8.721237659454346, "epoch": 0.015542953161100609, "grad_norm": 0.8046875, "learning_rate": 9.2e-05, "loss": 7.7042, "mean_token_accuracy": 0.050673872232437134, "num_tokens": 342428.0, "step": 185 }, { "entropy": 8.52247200012207, "epoch": 0.01596303297626549, "grad_norm": 0.61328125, "learning_rate": 9.45e-05, "loss": 7.7799, "mean_token_accuracy": 0.051399941369891164, "num_tokens": 353587.0, "step": 190 }, { "entropy": 8.398729610443116, "epoch": 0.01638311279143037, "grad_norm": 0.77734375, "learning_rate": 9.7e-05, "loss": 7.7173, "mean_token_accuracy": 0.05443600341677666, "num_tokens": 362997.0, "step": 195 }, { "entropy": 8.274804973602295, "epoch": 0.016803192606595255, "grad_norm": 0.71484375, "learning_rate": 9.95e-05, "loss": 7.7333, "mean_token_accuracy": 0.06009506583213806, "num_tokens": 372346.0, "step": 200 }, { "entropy": 8.316196537017822, "epoch": 0.017223272421760135, "grad_norm": 0.95703125, "learning_rate": 0.000102, "loss": 7.621, "mean_token_accuracy": 0.054996570199728013, "num_tokens": 381575.0, "step": 205 }, { "entropy": 8.224405288696289, "epoch": 0.017643352236925015, "grad_norm": 0.71484375, "learning_rate": 0.00010449999999999999, "loss": 7.6806, "mean_token_accuracy": 0.05832334831357002, "num_tokens": 390706.0, "step": 210 }, { "entropy": 8.178961277008057, "epoch": 0.018063432052089896, "grad_norm": 0.77734375, "learning_rate": 0.000107, "loss": 7.6844, "mean_token_accuracy": 0.056866029649972914, "num_tokens": 400000.0, "step": 215 }, { "entropy": 8.118294048309327, "epoch": 0.01848351186725478, "grad_norm": 0.765625, "learning_rate": 0.0001095, "loss": 7.6249, "mean_token_accuracy": 0.06287443153560161, "num_tokens": 409447.0, "step": 220 }, { "entropy": 8.128210067749023, "epoch": 0.01890359168241966, "grad_norm": 0.84375, "learning_rate": 0.000112, "loss": 7.6104, "mean_token_accuracy": 0.06484438478946686, "num_tokens": 418417.0, "step": 225 }, { "entropy": 8.050536060333252, "epoch": 0.01932367149758454, "grad_norm": 0.90625, "learning_rate": 0.0001145, "loss": 7.5732, "mean_token_accuracy": 0.06463442519307136, "num_tokens": 427619.0, "step": 230 }, { "entropy": 8.079150295257568, "epoch": 0.019743751312749424, "grad_norm": 0.72265625, "learning_rate": 0.00011700000000000001, "loss": 7.616, "mean_token_accuracy": 0.061473137512803075, "num_tokens": 437931.0, "step": 235 }, { "entropy": 8.002902173995972, "epoch": 0.020163831127914304, "grad_norm": 0.73828125, "learning_rate": 0.00011949999999999999, "loss": 7.6568, "mean_token_accuracy": 0.06506373398005963, "num_tokens": 447595.0, "step": 240 }, { "entropy": 8.058529567718505, "epoch": 0.020583910943079185, "grad_norm": 0.796875, "learning_rate": 0.000122, "loss": 7.5257, "mean_token_accuracy": 0.058850279077887535, "num_tokens": 457062.0, "step": 245 }, { "entropy": 8.02257719039917, "epoch": 0.021003990758244065, "grad_norm": 0.76171875, "learning_rate": 0.0001245, "loss": 7.624, "mean_token_accuracy": 0.06412565596401691, "num_tokens": 466191.0, "step": 250 }, { "entropy": 8.05047812461853, "epoch": 0.02142407057340895, "grad_norm": 1.0625, "learning_rate": 0.000127, "loss": 7.5647, "mean_token_accuracy": 0.06097288727760315, "num_tokens": 475693.0, "step": 255 }, { "entropy": 8.019621276855469, "epoch": 0.02184415038857383, "grad_norm": 0.7109375, "learning_rate": 0.0001295, "loss": 7.589, "mean_token_accuracy": 0.06407038681209087, "num_tokens": 485173.0, "step": 260 }, { "entropy": 7.99587049484253, "epoch": 0.02226423020373871, "grad_norm": 0.68359375, "learning_rate": 0.000132, "loss": 7.5069, "mean_token_accuracy": 0.06533381156623363, "num_tokens": 493985.0, "step": 265 }, { "entropy": 7.972505903244018, "epoch": 0.022684310018903593, "grad_norm": 0.85546875, "learning_rate": 0.00013450000000000002, "loss": 7.519, "mean_token_accuracy": 0.0665605653077364, "num_tokens": 502837.0, "step": 270 }, { "entropy": 7.982478952407837, "epoch": 0.023104389834068473, "grad_norm": 0.78515625, "learning_rate": 0.00013700000000000002, "loss": 7.4828, "mean_token_accuracy": 0.06852602958679199, "num_tokens": 511503.0, "step": 275 }, { "entropy": 7.961443471908569, "epoch": 0.023524469649233354, "grad_norm": 0.76171875, "learning_rate": 0.0001395, "loss": 7.6587, "mean_token_accuracy": 0.0616368904709816, "num_tokens": 521499.0, "step": 280 }, { "entropy": 7.966269254684448, "epoch": 0.023944549464398234, "grad_norm": 0.90234375, "learning_rate": 0.00014199999999999998, "loss": 7.426, "mean_token_accuracy": 0.06728804372251034, "num_tokens": 530067.0, "step": 285 }, { "entropy": 7.91850700378418, "epoch": 0.024364629279563118, "grad_norm": 0.796875, "learning_rate": 0.0001445, "loss": 7.4148, "mean_token_accuracy": 0.07034274153411388, "num_tokens": 538559.0, "step": 290 }, { "entropy": 7.979486131668091, "epoch": 0.024784709094728, "grad_norm": 0.81640625, "learning_rate": 0.000147, "loss": 7.6056, "mean_token_accuracy": 0.06503808572888374, "num_tokens": 547288.0, "step": 295 }, { "entropy": 7.885135698318481, "epoch": 0.02520478890989288, "grad_norm": 0.8203125, "learning_rate": 0.0001495, "loss": 7.4924, "mean_token_accuracy": 0.06286945752799511, "num_tokens": 557269.0, "step": 300 }, { "entropy": 8.007584619522095, "epoch": 0.025624868725057762, "grad_norm": 0.8515625, "learning_rate": 0.000152, "loss": 7.5193, "mean_token_accuracy": 0.06448328271508216, "num_tokens": 567280.0, "step": 305 }, { "entropy": 7.853135585784912, "epoch": 0.026044948540222643, "grad_norm": 0.71875, "learning_rate": 0.00015450000000000001, "loss": 7.382, "mean_token_accuracy": 0.06435618139803409, "num_tokens": 576609.0, "step": 310 }, { "entropy": 7.831946516036988, "epoch": 0.026465028355387523, "grad_norm": 0.79296875, "learning_rate": 0.000157, "loss": 7.267, "mean_token_accuracy": 0.07741407230496407, "num_tokens": 586053.0, "step": 315 }, { "entropy": 7.793692779541016, "epoch": 0.026885108170552403, "grad_norm": 0.921875, "learning_rate": 0.0001595, "loss": 7.4583, "mean_token_accuracy": 0.0726725548505783, "num_tokens": 594649.0, "step": 320 }, { "entropy": 7.9273755073547365, "epoch": 0.027305187985717287, "grad_norm": 1.3515625, "learning_rate": 0.000162, "loss": 7.4408, "mean_token_accuracy": 0.06625295169651509, "num_tokens": 603445.0, "step": 325 }, { "entropy": 7.88362865447998, "epoch": 0.027725267800882167, "grad_norm": 0.89453125, "learning_rate": 0.00016450000000000001, "loss": 7.4937, "mean_token_accuracy": 0.06676559969782829, "num_tokens": 613611.0, "step": 330 }, { "entropy": 7.917990875244141, "epoch": 0.028145347616047048, "grad_norm": 1.1875, "learning_rate": 0.00016700000000000002, "loss": 7.6535, "mean_token_accuracy": 0.06991421952843666, "num_tokens": 623024.0, "step": 335 }, { "entropy": 7.84550929069519, "epoch": 0.02856542743121193, "grad_norm": 0.92578125, "learning_rate": 0.00016950000000000003, "loss": 7.37, "mean_token_accuracy": 0.07066045552492142, "num_tokens": 631624.0, "step": 340 }, { "entropy": 7.743204069137573, "epoch": 0.028985507246376812, "grad_norm": 1.0, "learning_rate": 0.00017199999999999998, "loss": 7.3544, "mean_token_accuracy": 0.07467443272471427, "num_tokens": 640473.0, "step": 345 }, { "entropy": 7.89313235282898, "epoch": 0.029405587061541692, "grad_norm": 1.546875, "learning_rate": 0.00017449999999999999, "loss": 7.483, "mean_token_accuracy": 0.07056561335921288, "num_tokens": 649692.0, "step": 350 }, { "entropy": 7.855760765075684, "epoch": 0.029825666876706573, "grad_norm": 0.88671875, "learning_rate": 0.000177, "loss": 7.4521, "mean_token_accuracy": 0.07088366113603115, "num_tokens": 658236.0, "step": 355 }, { "entropy": 7.798476648330689, "epoch": 0.030245746691871456, "grad_norm": 1.265625, "learning_rate": 0.0001795, "loss": 7.2377, "mean_token_accuracy": 0.07707448154687882, "num_tokens": 667175.0, "step": 360 }, { "entropy": 7.8225892066955565, "epoch": 0.030665826507036337, "grad_norm": 0.91015625, "learning_rate": 0.000182, "loss": 7.5145, "mean_token_accuracy": 0.07331682369112968, "num_tokens": 676456.0, "step": 365 }, { "entropy": 7.92411093711853, "epoch": 0.031085906322201217, "grad_norm": 0.90234375, "learning_rate": 0.0001845, "loss": 7.4959, "mean_token_accuracy": 0.07029573023319244, "num_tokens": 686881.0, "step": 370 }, { "entropy": 7.741179084777832, "epoch": 0.0315059861373661, "grad_norm": 1.046875, "learning_rate": 0.000187, "loss": 7.2754, "mean_token_accuracy": 0.0755814753472805, "num_tokens": 696045.0, "step": 375 }, { "entropy": 7.724820518493653, "epoch": 0.03192606595253098, "grad_norm": 1.15625, "learning_rate": 0.0001895, "loss": 7.2387, "mean_token_accuracy": 0.08382209464907646, "num_tokens": 704729.0, "step": 380 }, { "entropy": 7.6020232200622555, "epoch": 0.032346145767695865, "grad_norm": 0.73046875, "learning_rate": 0.000192, "loss": 7.2979, "mean_token_accuracy": 0.07353318221867085, "num_tokens": 714331.0, "step": 385 }, { "entropy": 7.746062755584717, "epoch": 0.03276622558286074, "grad_norm": 1.0390625, "learning_rate": 0.0001945, "loss": 7.26, "mean_token_accuracy": 0.07669057212769985, "num_tokens": 722788.0, "step": 390 }, { "entropy": 7.785710859298706, "epoch": 0.033186305398025626, "grad_norm": 1.25, "learning_rate": 0.00019700000000000002, "loss": 7.3239, "mean_token_accuracy": 0.07846143767237664, "num_tokens": 731417.0, "step": 395 }, { "entropy": 7.662443017959594, "epoch": 0.03360638521319051, "grad_norm": 0.83203125, "learning_rate": 0.00019950000000000002, "loss": 7.2961, "mean_token_accuracy": 0.07676250785589218, "num_tokens": 741034.0, "step": 400 }, { "entropy": 7.704835367202759, "epoch": 0.034026465028355386, "grad_norm": 0.99609375, "learning_rate": 0.000202, "loss": 7.2982, "mean_token_accuracy": 0.07422473579645157, "num_tokens": 749596.0, "step": 405 }, { "entropy": 7.664615345001221, "epoch": 0.03444654484352027, "grad_norm": 0.953125, "learning_rate": 0.00020449999999999998, "loss": 7.2586, "mean_token_accuracy": 0.07927079945802688, "num_tokens": 758931.0, "step": 410 }, { "entropy": 7.600234937667847, "epoch": 0.03486662465868515, "grad_norm": 0.90234375, "learning_rate": 0.000207, "loss": 7.1556, "mean_token_accuracy": 0.08096722960472107, "num_tokens": 767534.0, "step": 415 }, { "entropy": 7.68730993270874, "epoch": 0.03528670447385003, "grad_norm": 1.1640625, "learning_rate": 0.0002095, "loss": 7.2278, "mean_token_accuracy": 0.07768219709396362, "num_tokens": 776456.0, "step": 420 }, { "entropy": 7.634504795074463, "epoch": 0.035706784289014915, "grad_norm": 1.1640625, "learning_rate": 0.000212, "loss": 7.2673, "mean_token_accuracy": 0.07659058347344398, "num_tokens": 786172.0, "step": 425 }, { "entropy": 7.6300970077514645, "epoch": 0.03612686410417979, "grad_norm": 0.91015625, "learning_rate": 0.0002145, "loss": 7.1534, "mean_token_accuracy": 0.08167968951165676, "num_tokens": 795081.0, "step": 430 }, { "entropy": 7.709903621673584, "epoch": 0.036546943919344675, "grad_norm": 1.2890625, "learning_rate": 0.00021700000000000002, "loss": 7.2139, "mean_token_accuracy": 0.07590967863798141, "num_tokens": 804259.0, "step": 435 }, { "entropy": 7.642217683792114, "epoch": 0.03696702373450956, "grad_norm": 1.15625, "learning_rate": 0.0002195, "loss": 7.2158, "mean_token_accuracy": 0.07940593808889389, "num_tokens": 813463.0, "step": 440 }, { "entropy": 7.5950026512146, "epoch": 0.037387103549674436, "grad_norm": 1.1796875, "learning_rate": 0.000222, "loss": 7.1477, "mean_token_accuracy": 0.08674231953918934, "num_tokens": 823029.0, "step": 445 }, { "entropy": 7.576770305633545, "epoch": 0.03780718336483932, "grad_norm": 1.078125, "learning_rate": 0.0002245, "loss": 7.2023, "mean_token_accuracy": 0.07635540775954723, "num_tokens": 832902.0, "step": 450 }, { "entropy": 7.584611654281616, "epoch": 0.0382272631800042, "grad_norm": 0.8203125, "learning_rate": 0.00022700000000000002, "loss": 7.1523, "mean_token_accuracy": 0.07883834913372993, "num_tokens": 842162.0, "step": 455 }, { "entropy": 7.626716089248657, "epoch": 0.03864734299516908, "grad_norm": 0.9453125, "learning_rate": 0.00022950000000000002, "loss": 7.1831, "mean_token_accuracy": 0.08037797883152961, "num_tokens": 852328.0, "step": 460 }, { "entropy": 7.5449056148529055, "epoch": 0.039067422810333964, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 7.139, "mean_token_accuracy": 0.08323637843132019, "num_tokens": 860929.0, "step": 465 }, { "entropy": 7.549172639846802, "epoch": 0.03948750262549885, "grad_norm": 1.15625, "learning_rate": 0.00023449999999999998, "loss": 7.222, "mean_token_accuracy": 0.07719254568219185, "num_tokens": 869144.0, "step": 470 }, { "entropy": 7.640847682952881, "epoch": 0.039907582440663725, "grad_norm": 1.1484375, "learning_rate": 0.000237, "loss": 7.1591, "mean_token_accuracy": 0.08463784530758858, "num_tokens": 877447.0, "step": 475 }, { "entropy": 7.579086351394653, "epoch": 0.04032766225582861, "grad_norm": 1.0859375, "learning_rate": 0.0002395, "loss": 7.1205, "mean_token_accuracy": 0.08219385743141175, "num_tokens": 887020.0, "step": 480 }, { "entropy": 7.4508629322052, "epoch": 0.040747742070993485, "grad_norm": 1.140625, "learning_rate": 0.000242, "loss": 7.1602, "mean_token_accuracy": 0.08283634409308434, "num_tokens": 895937.0, "step": 485 }, { "entropy": 7.572605180740356, "epoch": 0.04116782188615837, "grad_norm": 1.0703125, "learning_rate": 0.0002445, "loss": 7.1651, "mean_token_accuracy": 0.07650997936725616, "num_tokens": 905446.0, "step": 490 }, { "entropy": 7.551622104644776, "epoch": 0.04158790170132325, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 7.0659, "mean_token_accuracy": 0.0878485307097435, "num_tokens": 914547.0, "step": 495 }, { "entropy": 7.495913028717041, "epoch": 0.04200798151648813, "grad_norm": 1.0625, "learning_rate": 0.0002495, "loss": 7.0595, "mean_token_accuracy": 0.08502571135759354, "num_tokens": 922900.0, "step": 500 }, { "entropy": 7.497592973709106, "epoch": 0.042428061331653014, "grad_norm": 1.15625, "learning_rate": 0.000252, "loss": 7.0901, "mean_token_accuracy": 0.08809811025857925, "num_tokens": 930876.0, "step": 505 }, { "entropy": 7.464612245559692, "epoch": 0.0428481411468179, "grad_norm": 0.9609375, "learning_rate": 0.0002545, "loss": 7.1198, "mean_token_accuracy": 0.08516570031642914, "num_tokens": 939871.0, "step": 510 }, { "entropy": 7.487181520462036, "epoch": 0.043268220961982774, "grad_norm": 1.1875, "learning_rate": 0.000257, "loss": 7.1032, "mean_token_accuracy": 0.0852330669760704, "num_tokens": 948673.0, "step": 515 }, { "entropy": 7.419178056716919, "epoch": 0.04368830077714766, "grad_norm": 1.0625, "learning_rate": 0.0002595, "loss": 7.0589, "mean_token_accuracy": 0.08271693587303161, "num_tokens": 957603.0, "step": 520 }, { "entropy": 7.483588600158692, "epoch": 0.04410838059231254, "grad_norm": 0.97265625, "learning_rate": 0.000262, "loss": 7.1144, "mean_token_accuracy": 0.08177880719304084, "num_tokens": 967731.0, "step": 525 }, { "entropy": 7.489073705673218, "epoch": 0.04452846040747742, "grad_norm": 1.2421875, "learning_rate": 0.00026450000000000003, "loss": 7.1329, "mean_token_accuracy": 0.08377009257674217, "num_tokens": 977427.0, "step": 530 }, { "entropy": 7.537723684310913, "epoch": 0.0449485402226423, "grad_norm": 1.5859375, "learning_rate": 0.00026700000000000004, "loss": 7.1087, "mean_token_accuracy": 0.08038406819105148, "num_tokens": 986758.0, "step": 535 }, { "entropy": 7.401149797439575, "epoch": 0.045368620037807186, "grad_norm": 1.3828125, "learning_rate": 0.00026950000000000005, "loss": 7.1028, "mean_token_accuracy": 0.0900042973458767, "num_tokens": 996377.0, "step": 540 }, { "entropy": 7.488600254058838, "epoch": 0.04578869985297206, "grad_norm": 1.1171875, "learning_rate": 0.00027200000000000005, "loss": 7.1394, "mean_token_accuracy": 0.07542204968631268, "num_tokens": 1006483.0, "step": 545 }, { "entropy": 7.352685880661011, "epoch": 0.04620877966813695, "grad_norm": 0.875, "learning_rate": 0.0002745, "loss": 7.0338, "mean_token_accuracy": 0.08245834931731225, "num_tokens": 1016132.0, "step": 550 }, { "entropy": 7.383127737045288, "epoch": 0.04662885948330183, "grad_norm": 1.25, "learning_rate": 0.000277, "loss": 6.9969, "mean_token_accuracy": 0.08636636063456535, "num_tokens": 1024970.0, "step": 555 }, { "entropy": 7.470243072509765, "epoch": 0.04704893929846671, "grad_norm": 0.85546875, "learning_rate": 0.0002795, "loss": 7.0674, "mean_token_accuracy": 0.08481250628829003, "num_tokens": 1034335.0, "step": 560 }, { "entropy": 7.4651130676269535, "epoch": 0.04746901911363159, "grad_norm": 1.15625, "learning_rate": 0.00028199999999999997, "loss": 7.1153, "mean_token_accuracy": 0.08971841484308243, "num_tokens": 1043954.0, "step": 565 }, { "entropy": 7.4326441287994385, "epoch": 0.04788909892879647, "grad_norm": 1.015625, "learning_rate": 0.0002845, "loss": 7.0593, "mean_token_accuracy": 0.08415772840380668, "num_tokens": 1053554.0, "step": 570 }, { "entropy": 7.493321180343628, "epoch": 0.04830917874396135, "grad_norm": 1.0703125, "learning_rate": 0.000287, "loss": 7.0111, "mean_token_accuracy": 0.08667988702654839, "num_tokens": 1062008.0, "step": 575 }, { "entropy": 7.334539842605591, "epoch": 0.048729258559126236, "grad_norm": 1.1484375, "learning_rate": 0.0002895, "loss": 7.0738, "mean_token_accuracy": 0.08698670640587806, "num_tokens": 1070740.0, "step": 580 }, { "entropy": 7.407914113998413, "epoch": 0.04914933837429111, "grad_norm": 1.1796875, "learning_rate": 0.000292, "loss": 7.0599, "mean_token_accuracy": 0.0839300949126482, "num_tokens": 1079681.0, "step": 585 }, { "entropy": 7.3771099090576175, "epoch": 0.049569418189456, "grad_norm": 1.203125, "learning_rate": 0.0002945, "loss": 6.9475, "mean_token_accuracy": 0.09122345820069314, "num_tokens": 1088979.0, "step": 590 }, { "entropy": 7.326050329208374, "epoch": 0.04998949800462088, "grad_norm": 1.25, "learning_rate": 0.000297, "loss": 6.9449, "mean_token_accuracy": 0.08771323934197425, "num_tokens": 1097870.0, "step": 595 }, { "entropy": 7.320249271392822, "epoch": 0.05040957781978576, "grad_norm": 1.3046875, "learning_rate": 0.0002995, "loss": 7.0421, "mean_token_accuracy": 0.08429603464901447, "num_tokens": 1107948.0, "step": 600 }, { "entropy": 7.399919700622559, "epoch": 0.05082965763495064, "grad_norm": 1.078125, "learning_rate": 0.000302, "loss": 6.9732, "mean_token_accuracy": 0.09062434881925582, "num_tokens": 1117032.0, "step": 605 }, { "entropy": 7.228488159179688, "epoch": 0.051249737450115525, "grad_norm": 1.34375, "learning_rate": 0.0003045, "loss": 6.9617, "mean_token_accuracy": 0.08655689135193825, "num_tokens": 1127834.0, "step": 610 }, { "entropy": 7.388462066650391, "epoch": 0.0516698172652804, "grad_norm": 1.3671875, "learning_rate": 0.000307, "loss": 7.0412, "mean_token_accuracy": 0.09550752639770507, "num_tokens": 1137382.0, "step": 615 }, { "entropy": 7.257171297073365, "epoch": 0.052089897080445285, "grad_norm": 1.0078125, "learning_rate": 0.0003095, "loss": 6.8769, "mean_token_accuracy": 0.09444506764411927, "num_tokens": 1146095.0, "step": 620 }, { "entropy": 7.268283557891846, "epoch": 0.05250997689561017, "grad_norm": 1.125, "learning_rate": 0.000312, "loss": 6.9168, "mean_token_accuracy": 0.09104742333292962, "num_tokens": 1154981.0, "step": 625 }, { "entropy": 7.231864309310913, "epoch": 0.052930056710775046, "grad_norm": 1.2109375, "learning_rate": 0.0003145, "loss": 6.9162, "mean_token_accuracy": 0.09456853494048119, "num_tokens": 1164939.0, "step": 630 }, { "entropy": 7.3547971725463865, "epoch": 0.05335013652593993, "grad_norm": 1.0390625, "learning_rate": 0.000317, "loss": 7.0466, "mean_token_accuracy": 0.08202817216515541, "num_tokens": 1174991.0, "step": 635 }, { "entropy": 7.341550350189209, "epoch": 0.05377021634110481, "grad_norm": 1.0859375, "learning_rate": 0.0003195, "loss": 7.0772, "mean_token_accuracy": 0.08350706696510315, "num_tokens": 1184885.0, "step": 640 }, { "entropy": 7.257875394821167, "epoch": 0.05419029615626969, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 6.9751, "mean_token_accuracy": 0.08547877669334411, "num_tokens": 1193637.0, "step": 645 }, { "entropy": 7.223678970336914, "epoch": 0.054610375971434574, "grad_norm": 1.2734375, "learning_rate": 0.00032450000000000003, "loss": 6.778, "mean_token_accuracy": 0.09493321552872658, "num_tokens": 1202188.0, "step": 650 }, { "entropy": 7.3337372779846195, "epoch": 0.05503045578659945, "grad_norm": 0.9921875, "learning_rate": 0.00032700000000000003, "loss": 6.8974, "mean_token_accuracy": 0.0872666135430336, "num_tokens": 1210768.0, "step": 655 }, { "entropy": 7.218266105651855, "epoch": 0.055450535601764335, "grad_norm": 1.28125, "learning_rate": 0.00032950000000000004, "loss": 6.903, "mean_token_accuracy": 0.09044937118887901, "num_tokens": 1219819.0, "step": 660 }, { "entropy": 7.269051265716553, "epoch": 0.05587061541692922, "grad_norm": 1.0078125, "learning_rate": 0.00033200000000000005, "loss": 6.9561, "mean_token_accuracy": 0.08509430065751075, "num_tokens": 1229703.0, "step": 665 }, { "entropy": 7.323557806015015, "epoch": 0.056290695232094096, "grad_norm": 1.1484375, "learning_rate": 0.00033450000000000005, "loss": 6.9868, "mean_token_accuracy": 0.08851987943053245, "num_tokens": 1238942.0, "step": 670 }, { "entropy": 7.31135516166687, "epoch": 0.05671077504725898, "grad_norm": 0.8984375, "learning_rate": 0.000337, "loss": 7.0196, "mean_token_accuracy": 0.090158711373806, "num_tokens": 1248943.0, "step": 675 }, { "entropy": 7.238338661193848, "epoch": 0.05713085486242386, "grad_norm": 0.9765625, "learning_rate": 0.0003395, "loss": 6.9121, "mean_token_accuracy": 0.09068251103162765, "num_tokens": 1257761.0, "step": 680 }, { "entropy": 7.152073860168457, "epoch": 0.05755093467758874, "grad_norm": 1.140625, "learning_rate": 0.000342, "loss": 6.8534, "mean_token_accuracy": 0.0885312557220459, "num_tokens": 1267216.0, "step": 685 }, { "entropy": 7.265845727920532, "epoch": 0.057971014492753624, "grad_norm": 1.28125, "learning_rate": 0.00034449999999999997, "loss": 6.952, "mean_token_accuracy": 0.08522271737456322, "num_tokens": 1277210.0, "step": 690 }, { "entropy": 7.267448425292969, "epoch": 0.05839109430791851, "grad_norm": 0.94921875, "learning_rate": 0.000347, "loss": 6.8775, "mean_token_accuracy": 0.08550659716129302, "num_tokens": 1285310.0, "step": 695 }, { "entropy": 7.189469480514527, "epoch": 0.058811174123083385, "grad_norm": 0.96875, "learning_rate": 0.0003495, "loss": 6.8822, "mean_token_accuracy": 0.09172830283641815, "num_tokens": 1294421.0, "step": 700 }, { "entropy": 7.136290740966797, "epoch": 0.05923125393824827, "grad_norm": 1.1015625, "learning_rate": 0.000352, "loss": 6.7116, "mean_token_accuracy": 0.10014490857720375, "num_tokens": 1303281.0, "step": 705 }, { "entropy": 7.132218694686889, "epoch": 0.059651333753413145, "grad_norm": 1.1953125, "learning_rate": 0.0003545, "loss": 6.8789, "mean_token_accuracy": 0.09660332053899764, "num_tokens": 1312280.0, "step": 710 }, { "entropy": 7.105095958709716, "epoch": 0.06007141356857803, "grad_norm": 0.97265625, "learning_rate": 0.000357, "loss": 6.8389, "mean_token_accuracy": 0.08850333318114281, "num_tokens": 1321243.0, "step": 715 }, { "entropy": 7.180677127838135, "epoch": 0.06049149338374291, "grad_norm": 0.93359375, "learning_rate": 0.0003595, "loss": 6.9284, "mean_token_accuracy": 0.09514749199151992, "num_tokens": 1330324.0, "step": 720 }, { "entropy": 7.1717592716217045, "epoch": 0.06091157319890779, "grad_norm": 1.0703125, "learning_rate": 0.000362, "loss": 6.7842, "mean_token_accuracy": 0.09439062774181366, "num_tokens": 1339485.0, "step": 725 }, { "entropy": 7.2169701099395756, "epoch": 0.06133165301407267, "grad_norm": 1.3203125, "learning_rate": 0.0003645, "loss": 6.915, "mean_token_accuracy": 0.08555234894156456, "num_tokens": 1348640.0, "step": 730 }, { "entropy": 7.130293321609497, "epoch": 0.06175173282923756, "grad_norm": 1.171875, "learning_rate": 0.000367, "loss": 6.8099, "mean_token_accuracy": 0.09767363145947457, "num_tokens": 1357581.0, "step": 735 }, { "entropy": 7.150859022140503, "epoch": 0.062171812644402434, "grad_norm": 1.1328125, "learning_rate": 0.0003695, "loss": 6.8829, "mean_token_accuracy": 0.0921759732067585, "num_tokens": 1367883.0, "step": 740 }, { "entropy": 7.128716611862183, "epoch": 0.06259189245956731, "grad_norm": 0.98046875, "learning_rate": 0.000372, "loss": 6.8294, "mean_token_accuracy": 0.08952599465847015, "num_tokens": 1376936.0, "step": 745 }, { "entropy": 7.0383734703063965, "epoch": 0.0630119722747322, "grad_norm": 1.09375, "learning_rate": 0.0003745, "loss": 6.7534, "mean_token_accuracy": 0.09515918046236038, "num_tokens": 1386359.0, "step": 750 }, { "entropy": 7.0808555603027346, "epoch": 0.06343205208989708, "grad_norm": 1.1875, "learning_rate": 0.000377, "loss": 6.8181, "mean_token_accuracy": 0.09296313449740409, "num_tokens": 1395223.0, "step": 755 }, { "entropy": 7.2832927227020265, "epoch": 0.06385213190506196, "grad_norm": 1.1171875, "learning_rate": 0.0003795, "loss": 6.9661, "mean_token_accuracy": 0.08833524622023106, "num_tokens": 1404917.0, "step": 760 }, { "entropy": 7.180255651473999, "epoch": 0.06427221172022685, "grad_norm": 1.2421875, "learning_rate": 0.000382, "loss": 6.857, "mean_token_accuracy": 0.10177302286028862, "num_tokens": 1413348.0, "step": 765 }, { "entropy": 7.025369262695312, "epoch": 0.06469229153539173, "grad_norm": 1.078125, "learning_rate": 0.0003845, "loss": 6.8209, "mean_token_accuracy": 0.09210879877209663, "num_tokens": 1421726.0, "step": 770 }, { "entropy": 7.136773920059204, "epoch": 0.0651123713505566, "grad_norm": 1.0859375, "learning_rate": 0.00038700000000000003, "loss": 6.8481, "mean_token_accuracy": 0.09178127273917198, "num_tokens": 1430686.0, "step": 775 }, { "entropy": 7.201752138137818, "epoch": 0.06553245116572148, "grad_norm": 1.03125, "learning_rate": 0.00038950000000000003, "loss": 6.8283, "mean_token_accuracy": 0.0948453463613987, "num_tokens": 1439499.0, "step": 780 }, { "entropy": 7.1434326171875, "epoch": 0.06595253098088637, "grad_norm": 1.2578125, "learning_rate": 0.00039200000000000004, "loss": 6.8035, "mean_token_accuracy": 0.09644952267408372, "num_tokens": 1448220.0, "step": 785 }, { "entropy": 6.982330989837647, "epoch": 0.06637261079605125, "grad_norm": 0.99609375, "learning_rate": 0.00039450000000000005, "loss": 6.8485, "mean_token_accuracy": 0.09032012075185776, "num_tokens": 1458217.0, "step": 790 }, { "entropy": 7.011542701721192, "epoch": 0.06679269061121614, "grad_norm": 1.125, "learning_rate": 0.00039700000000000005, "loss": 6.7437, "mean_token_accuracy": 0.09031623676419258, "num_tokens": 1467422.0, "step": 795 }, { "entropy": 7.083204460144043, "epoch": 0.06721277042638102, "grad_norm": 1.078125, "learning_rate": 0.0003995, "loss": 6.7143, "mean_token_accuracy": 0.09781065881252289, "num_tokens": 1476152.0, "step": 800 }, { "entropy": 7.017691135406494, "epoch": 0.06763285024154589, "grad_norm": 1.3046875, "learning_rate": 0.000402, "loss": 6.8197, "mean_token_accuracy": 0.09335827901959419, "num_tokens": 1485248.0, "step": 805 }, { "entropy": 7.028779029846191, "epoch": 0.06805293005671077, "grad_norm": 1.0859375, "learning_rate": 0.0004045, "loss": 6.7816, "mean_token_accuracy": 0.0929147683084011, "num_tokens": 1494248.0, "step": 810 }, { "entropy": 7.107398557662964, "epoch": 0.06847300987187566, "grad_norm": 1.078125, "learning_rate": 0.00040699999999999997, "loss": 6.8809, "mean_token_accuracy": 0.09237429052591324, "num_tokens": 1503565.0, "step": 815 }, { "entropy": 7.178503799438476, "epoch": 0.06889308968704054, "grad_norm": 0.9921875, "learning_rate": 0.0004095, "loss": 6.9674, "mean_token_accuracy": 0.08681917861104012, "num_tokens": 1513227.0, "step": 820 }, { "entropy": 7.083085680007935, "epoch": 0.06931316950220542, "grad_norm": 1.1328125, "learning_rate": 0.000412, "loss": 6.7482, "mean_token_accuracy": 0.09896269217133521, "num_tokens": 1522312.0, "step": 825 }, { "entropy": 7.000125169754028, "epoch": 0.0697332493173703, "grad_norm": 0.98046875, "learning_rate": 0.0004145, "loss": 6.7224, "mean_token_accuracy": 0.09859632030129432, "num_tokens": 1531720.0, "step": 830 }, { "entropy": 7.015534973144531, "epoch": 0.07015332913253518, "grad_norm": 1.1171875, "learning_rate": 0.000417, "loss": 6.7888, "mean_token_accuracy": 0.09380378648638725, "num_tokens": 1541238.0, "step": 835 }, { "entropy": 7.136422204971313, "epoch": 0.07057340894770006, "grad_norm": 1.109375, "learning_rate": 0.0004195, "loss": 6.8785, "mean_token_accuracy": 0.09427597969770432, "num_tokens": 1550875.0, "step": 840 }, { "entropy": 6.93135290145874, "epoch": 0.07099348876286495, "grad_norm": 1.0390625, "learning_rate": 0.000422, "loss": 6.8248, "mean_token_accuracy": 0.09056826308369637, "num_tokens": 1560287.0, "step": 845 }, { "entropy": 7.053813314437866, "epoch": 0.07141356857802983, "grad_norm": 1.0703125, "learning_rate": 0.0004245, "loss": 6.7055, "mean_token_accuracy": 0.10149886757135392, "num_tokens": 1569043.0, "step": 850 }, { "entropy": 6.978960704803467, "epoch": 0.07183364839319471, "grad_norm": 1.0546875, "learning_rate": 0.000427, "loss": 6.726, "mean_token_accuracy": 0.09670688211917877, "num_tokens": 1578112.0, "step": 855 }, { "entropy": 6.866673278808594, "epoch": 0.07225372820835958, "grad_norm": 1.078125, "learning_rate": 0.0004295, "loss": 6.6514, "mean_token_accuracy": 0.10521448627114297, "num_tokens": 1586587.0, "step": 860 }, { "entropy": 7.09016604423523, "epoch": 0.07267380802352447, "grad_norm": 0.95703125, "learning_rate": 0.000432, "loss": 6.8069, "mean_token_accuracy": 0.09529538303613663, "num_tokens": 1595585.0, "step": 865 }, { "entropy": 6.990141916275024, "epoch": 0.07309388783868935, "grad_norm": 1.0859375, "learning_rate": 0.0004345, "loss": 6.7599, "mean_token_accuracy": 0.09652992263436318, "num_tokens": 1605355.0, "step": 870 }, { "entropy": 7.018218660354615, "epoch": 0.07351396765385423, "grad_norm": 1.0703125, "learning_rate": 0.000437, "loss": 6.7838, "mean_token_accuracy": 0.0944277286529541, "num_tokens": 1613637.0, "step": 875 }, { "entropy": 6.990546417236328, "epoch": 0.07393404746901912, "grad_norm": 1.0859375, "learning_rate": 0.0004395, "loss": 6.7417, "mean_token_accuracy": 0.09869495183229446, "num_tokens": 1622731.0, "step": 880 }, { "entropy": 7.067089796066284, "epoch": 0.074354127284184, "grad_norm": 0.9765625, "learning_rate": 0.000442, "loss": 6.7144, "mean_token_accuracy": 0.09230813458561897, "num_tokens": 1632098.0, "step": 885 }, { "entropy": 6.908722448348999, "epoch": 0.07477420709934887, "grad_norm": 0.90625, "learning_rate": 0.0004445, "loss": 6.7079, "mean_token_accuracy": 0.09467918276786805, "num_tokens": 1641259.0, "step": 890 }, { "entropy": 6.984257411956787, "epoch": 0.07519428691451376, "grad_norm": 1.1015625, "learning_rate": 0.000447, "loss": 6.7835, "mean_token_accuracy": 0.09350861608982086, "num_tokens": 1651362.0, "step": 895 }, { "entropy": 6.942133188247681, "epoch": 0.07561436672967864, "grad_norm": 1.1015625, "learning_rate": 0.00044950000000000003, "loss": 6.698, "mean_token_accuracy": 0.09561712741851806, "num_tokens": 1660190.0, "step": 900 }, { "entropy": 6.949711561203003, "epoch": 0.07603444654484352, "grad_norm": 1.1171875, "learning_rate": 0.00045200000000000004, "loss": 6.7202, "mean_token_accuracy": 0.09667671620845794, "num_tokens": 1669020.0, "step": 905 }, { "entropy": 7.059488010406494, "epoch": 0.0764545263600084, "grad_norm": 1.1171875, "learning_rate": 0.00045450000000000004, "loss": 6.7692, "mean_token_accuracy": 0.10004925951361657, "num_tokens": 1678158.0, "step": 910 }, { "entropy": 6.941928768157959, "epoch": 0.07687460617517328, "grad_norm": 1.1171875, "learning_rate": 0.00045700000000000005, "loss": 6.7751, "mean_token_accuracy": 0.08887208923697472, "num_tokens": 1687481.0, "step": 915 }, { "entropy": 6.903632497787475, "epoch": 0.07729468599033816, "grad_norm": 1.0, "learning_rate": 0.00045950000000000006, "loss": 6.7248, "mean_token_accuracy": 0.10260720252990722, "num_tokens": 1696782.0, "step": 920 }, { "entropy": 6.950085973739624, "epoch": 0.07771476580550304, "grad_norm": 1.0, "learning_rate": 0.000462, "loss": 6.7327, "mean_token_accuracy": 0.10223789662122726, "num_tokens": 1706153.0, "step": 925 }, { "entropy": 6.981480550765991, "epoch": 0.07813484562066793, "grad_norm": 1.0390625, "learning_rate": 0.0004645, "loss": 6.7583, "mean_token_accuracy": 0.09635938182473183, "num_tokens": 1715585.0, "step": 930 }, { "entropy": 7.110754156112671, "epoch": 0.07855492543583281, "grad_norm": 1.3046875, "learning_rate": 0.000467, "loss": 6.8789, "mean_token_accuracy": 0.09635257050395012, "num_tokens": 1724857.0, "step": 935 }, { "entropy": 6.890129041671753, "epoch": 0.0789750052509977, "grad_norm": 1.1484375, "learning_rate": 0.0004695, "loss": 6.6811, "mean_token_accuracy": 0.10242518037557602, "num_tokens": 1733528.0, "step": 940 }, { "entropy": 7.000388526916504, "epoch": 0.07939508506616257, "grad_norm": 0.875, "learning_rate": 0.000472, "loss": 6.8096, "mean_token_accuracy": 0.09821859821677208, "num_tokens": 1742953.0, "step": 945 }, { "entropy": 6.962129068374634, "epoch": 0.07981516488132745, "grad_norm": 1.1171875, "learning_rate": 0.0004745, "loss": 6.757, "mean_token_accuracy": 0.10171304419636726, "num_tokens": 1752155.0, "step": 950 }, { "entropy": 6.876726579666138, "epoch": 0.08023524469649233, "grad_norm": 1.1171875, "learning_rate": 0.000477, "loss": 6.6364, "mean_token_accuracy": 0.09934233203530311, "num_tokens": 1760562.0, "step": 955 }, { "entropy": 6.884459018707275, "epoch": 0.08065532451165722, "grad_norm": 1.109375, "learning_rate": 0.0004795, "loss": 6.6462, "mean_token_accuracy": 0.1006347469985485, "num_tokens": 1769631.0, "step": 960 }, { "entropy": 6.902465105056763, "epoch": 0.0810754043268221, "grad_norm": 1.2734375, "learning_rate": 0.000482, "loss": 6.7043, "mean_token_accuracy": 0.10013237074017525, "num_tokens": 1779080.0, "step": 965 }, { "entropy": 6.916742420196533, "epoch": 0.08149548414198697, "grad_norm": 1.265625, "learning_rate": 0.0004845, "loss": 6.6819, "mean_token_accuracy": 0.10164752677083015, "num_tokens": 1787830.0, "step": 970 }, { "entropy": 6.823171949386596, "epoch": 0.08191556395715185, "grad_norm": 0.9375, "learning_rate": 0.000487, "loss": 6.6048, "mean_token_accuracy": 0.10189055874943734, "num_tokens": 1796998.0, "step": 975 }, { "entropy": 6.977118110656738, "epoch": 0.08233564377231674, "grad_norm": 1.0234375, "learning_rate": 0.0004895, "loss": 6.6814, "mean_token_accuracy": 0.10083219707012177, "num_tokens": 1806194.0, "step": 980 }, { "entropy": 6.672053623199463, "epoch": 0.08275572358748162, "grad_norm": 1.046875, "learning_rate": 0.000492, "loss": 6.5647, "mean_token_accuracy": 0.10488267168402672, "num_tokens": 1815751.0, "step": 985 }, { "entropy": 6.7590797424316404, "epoch": 0.0831758034026465, "grad_norm": 1.0, "learning_rate": 0.0004945, "loss": 6.6428, "mean_token_accuracy": 0.10192798376083374, "num_tokens": 1825379.0, "step": 990 }, { "entropy": 6.884732866287232, "epoch": 0.08359588321781139, "grad_norm": 1.0234375, "learning_rate": 0.000497, "loss": 6.6025, "mean_token_accuracy": 0.10135274231433869, "num_tokens": 1834158.0, "step": 995 }, { "entropy": 6.860666513442993, "epoch": 0.08401596303297626, "grad_norm": 1.03125, "learning_rate": 0.0004995, "loss": 6.5689, "mean_token_accuracy": 0.10223893150687217, "num_tokens": 1842724.0, "step": 1000 }, { "entropy": 6.812324571609497, "epoch": 0.08443604284814114, "grad_norm": 0.96484375, "learning_rate": 0.000499999998724557, "loss": 6.5774, "mean_token_accuracy": 0.10202668011188507, "num_tokens": 1852485.0, "step": 1005 }, { "entropy": 6.779099035263061, "epoch": 0.08485612266330603, "grad_norm": 1.0078125, "learning_rate": 0.0004999999935430703, "loss": 6.6115, "mean_token_accuracy": 0.10559484660625458, "num_tokens": 1861303.0, "step": 1010 }, { "entropy": 6.770784664154053, "epoch": 0.08527620247847091, "grad_norm": 1.0703125, "learning_rate": 0.0004999999843758243, "loss": 6.5927, "mean_token_accuracy": 0.1131505697965622, "num_tokens": 1870859.0, "step": 1015 }, { "entropy": 6.940572690963745, "epoch": 0.0856962822936358, "grad_norm": 0.98046875, "learning_rate": 0.0004999999712228196, "loss": 6.7566, "mean_token_accuracy": 0.09317019283771515, "num_tokens": 1880295.0, "step": 1020 }, { "entropy": 6.93710470199585, "epoch": 0.08611636210880068, "grad_norm": 0.984375, "learning_rate": 0.0004999999540840562, "loss": 6.6611, "mean_token_accuracy": 0.10422083139419555, "num_tokens": 1889193.0, "step": 1025 }, { "entropy": 6.811184549331665, "epoch": 0.08653644192396555, "grad_norm": 0.9609375, "learning_rate": 0.0004999999329595345, "loss": 6.7584, "mean_token_accuracy": 0.09407720491290092, "num_tokens": 1899437.0, "step": 1030 }, { "entropy": 6.87418532371521, "epoch": 0.08695652173913043, "grad_norm": 0.96484375, "learning_rate": 0.0004999999078492548, "loss": 6.6473, "mean_token_accuracy": 0.1043108843266964, "num_tokens": 1907882.0, "step": 1035 }, { "entropy": 6.7778688907623295, "epoch": 0.08737660155429532, "grad_norm": 0.94921875, "learning_rate": 0.0004999998787532176, "loss": 6.5571, "mean_token_accuracy": 0.10416635349392891, "num_tokens": 1916872.0, "step": 1040 }, { "entropy": 6.838136434555054, "epoch": 0.0877966813694602, "grad_norm": 0.984375, "learning_rate": 0.0004999998456714234, "loss": 6.7226, "mean_token_accuracy": 0.10190053880214692, "num_tokens": 1926636.0, "step": 1045 }, { "entropy": 6.815088891983033, "epoch": 0.08821676118462508, "grad_norm": 1.03125, "learning_rate": 0.0004999998086038729, "loss": 6.6294, "mean_token_accuracy": 0.1084713064134121, "num_tokens": 1935962.0, "step": 1050 }, { "entropy": 6.798814964294434, "epoch": 0.08863684099978995, "grad_norm": 1.0546875, "learning_rate": 0.0004999997675505665, "loss": 6.5955, "mean_token_accuracy": 0.10102920681238174, "num_tokens": 1944600.0, "step": 1055 }, { "entropy": 6.8712811946868895, "epoch": 0.08905692081495484, "grad_norm": 0.984375, "learning_rate": 0.0004999997225115052, "loss": 6.7682, "mean_token_accuracy": 0.09951933771371842, "num_tokens": 1954234.0, "step": 1060 }, { "entropy": 6.951000690460205, "epoch": 0.08947700063011972, "grad_norm": 1.0078125, "learning_rate": 0.0004999996734866896, "loss": 6.7171, "mean_token_accuracy": 0.09834984764456749, "num_tokens": 1964499.0, "step": 1065 }, { "entropy": 6.700433588027954, "epoch": 0.0898970804452846, "grad_norm": 1.046875, "learning_rate": 0.0004999996204761206, "loss": 6.4396, "mean_token_accuracy": 0.11416423171758652, "num_tokens": 1973635.0, "step": 1070 }, { "entropy": 6.754154396057129, "epoch": 0.09031716026044949, "grad_norm": 0.93359375, "learning_rate": 0.0004999995634797993, "loss": 6.5931, "mean_token_accuracy": 0.10663349330425262, "num_tokens": 1983509.0, "step": 1075 }, { "entropy": 6.815823554992676, "epoch": 0.09073724007561437, "grad_norm": 1.0625, "learning_rate": 0.0004999995024977265, "loss": 6.5793, "mean_token_accuracy": 0.10800760760903358, "num_tokens": 1992336.0, "step": 1080 }, { "entropy": 6.820423316955567, "epoch": 0.09115731989077924, "grad_norm": 0.90625, "learning_rate": 0.0004999994375299034, "loss": 6.5959, "mean_token_accuracy": 0.10795153826475143, "num_tokens": 2001931.0, "step": 1085 }, { "entropy": 6.72901930809021, "epoch": 0.09157739970594413, "grad_norm": 0.98046875, "learning_rate": 0.000499999368576331, "loss": 6.4682, "mean_token_accuracy": 0.11168377995491027, "num_tokens": 2010935.0, "step": 1090 }, { "entropy": 6.699783134460449, "epoch": 0.09199747952110901, "grad_norm": 1.0234375, "learning_rate": 0.0004999992956370109, "loss": 6.5304, "mean_token_accuracy": 0.10683032646775245, "num_tokens": 2020587.0, "step": 1095 }, { "entropy": 6.677279663085938, "epoch": 0.0924175593362739, "grad_norm": 0.953125, "learning_rate": 0.000499999218711944, "loss": 6.5573, "mean_token_accuracy": 0.1078680157661438, "num_tokens": 2029743.0, "step": 1100 }, { "entropy": 6.796489238739014, "epoch": 0.09283763915143878, "grad_norm": 1.046875, "learning_rate": 0.0004999991378011317, "loss": 6.5775, "mean_token_accuracy": 0.1102212406694889, "num_tokens": 2038468.0, "step": 1105 }, { "entropy": 6.65820722579956, "epoch": 0.09325771896660366, "grad_norm": 0.97265625, "learning_rate": 0.0004999990529045757, "loss": 6.4917, "mean_token_accuracy": 0.10695874094963073, "num_tokens": 2047456.0, "step": 1110 }, { "entropy": 6.895982646942139, "epoch": 0.09367779878176853, "grad_norm": 0.9296875, "learning_rate": 0.0004999989640222771, "loss": 6.8041, "mean_token_accuracy": 0.09525922834873199, "num_tokens": 2056691.0, "step": 1115 }, { "entropy": 6.853526449203491, "epoch": 0.09409787859693342, "grad_norm": 0.96484375, "learning_rate": 0.000499998871154238, "loss": 6.5875, "mean_token_accuracy": 0.10508395135402679, "num_tokens": 2066068.0, "step": 1120 }, { "entropy": 6.754317712783814, "epoch": 0.0945179584120983, "grad_norm": 0.921875, "learning_rate": 0.0004999987743004597, "loss": 6.5313, "mean_token_accuracy": 0.11206126511096955, "num_tokens": 2075113.0, "step": 1125 }, { "entropy": 6.816254997253418, "epoch": 0.09493803822726318, "grad_norm": 1.0234375, "learning_rate": 0.0004999986734609438, "loss": 6.6612, "mean_token_accuracy": 0.1047824963927269, "num_tokens": 2084557.0, "step": 1130 }, { "entropy": 6.785951089859009, "epoch": 0.09535811804242807, "grad_norm": 1.0546875, "learning_rate": 0.0004999985686356923, "loss": 6.5497, "mean_token_accuracy": 0.10589791536331176, "num_tokens": 2093424.0, "step": 1135 }, { "entropy": 6.7812634944915775, "epoch": 0.09577819785759294, "grad_norm": 0.9921875, "learning_rate": 0.000499998459824707, "loss": 6.6748, "mean_token_accuracy": 0.10217821151018143, "num_tokens": 2103066.0, "step": 1140 }, { "entropy": 6.756265497207641, "epoch": 0.09619827767275782, "grad_norm": 0.97265625, "learning_rate": 0.00049999834702799, "loss": 6.5477, "mean_token_accuracy": 0.11097522377967835, "num_tokens": 2112447.0, "step": 1145 }, { "entropy": 6.820600318908691, "epoch": 0.0966183574879227, "grad_norm": 0.90234375, "learning_rate": 0.0004999982302455431, "loss": 6.5692, "mean_token_accuracy": 0.11053408607840538, "num_tokens": 2121949.0, "step": 1150 }, { "entropy": 6.731539011001587, "epoch": 0.09703843730308759, "grad_norm": 1.0390625, "learning_rate": 0.0004999981094773683, "loss": 6.4735, "mean_token_accuracy": 0.11045165956020356, "num_tokens": 2130464.0, "step": 1155 }, { "entropy": 6.791986989974975, "epoch": 0.09745851711825247, "grad_norm": 1.0390625, "learning_rate": 0.000499997984723468, "loss": 6.627, "mean_token_accuracy": 0.10332545191049576, "num_tokens": 2139577.0, "step": 1160 }, { "entropy": 6.555002975463867, "epoch": 0.09787859693341736, "grad_norm": 0.8984375, "learning_rate": 0.0004999978559838441, "loss": 6.3652, "mean_token_accuracy": 0.10894591435790062, "num_tokens": 2147919.0, "step": 1165 }, { "entropy": 6.623918771743774, "epoch": 0.09829867674858223, "grad_norm": 0.96875, "learning_rate": 0.0004999977232584991, "loss": 6.5152, "mean_token_accuracy": 0.1095739871263504, "num_tokens": 2156936.0, "step": 1170 }, { "entropy": 6.789136934280395, "epoch": 0.09871875656374711, "grad_norm": 0.99609375, "learning_rate": 0.0004999975865474354, "loss": 6.5864, "mean_token_accuracy": 0.10703087151050568, "num_tokens": 2165362.0, "step": 1175 }, { "entropy": 6.65335168838501, "epoch": 0.099138836378912, "grad_norm": 1.0703125, "learning_rate": 0.0004999974458506551, "loss": 6.5154, "mean_token_accuracy": 0.10435130968689918, "num_tokens": 2173665.0, "step": 1180 }, { "entropy": 6.8575843334197994, "epoch": 0.09955891619407688, "grad_norm": 1.1015625, "learning_rate": 0.000499997301168161, "loss": 6.4988, "mean_token_accuracy": 0.11348986551165581, "num_tokens": 2182222.0, "step": 1185 }, { "entropy": 6.672175312042237, "epoch": 0.09997899600924176, "grad_norm": 0.984375, "learning_rate": 0.0004999971524999556, "loss": 6.5809, "mean_token_accuracy": 0.11042713969945908, "num_tokens": 2192358.0, "step": 1190 }, { "entropy": 6.7970047950744625, "epoch": 0.10039907582440663, "grad_norm": 0.94921875, "learning_rate": 0.0004999969998460414, "loss": 6.5411, "mean_token_accuracy": 0.10771783664822579, "num_tokens": 2201889.0, "step": 1195 }, { "entropy": 6.672988796234131, "epoch": 0.10081915563957151, "grad_norm": 1.1328125, "learning_rate": 0.0004999968432064213, "loss": 6.54, "mean_token_accuracy": 0.12040728628635407, "num_tokens": 2211810.0, "step": 1200 }, { "entropy": 6.662283229827881, "epoch": 0.1012392354547364, "grad_norm": 0.92578125, "learning_rate": 0.0004999966825810979, "loss": 6.4935, "mean_token_accuracy": 0.10729209631681443, "num_tokens": 2221123.0, "step": 1205 }, { "entropy": 6.682981157302857, "epoch": 0.10165931526990128, "grad_norm": 0.99609375, "learning_rate": 0.0004999965179700742, "loss": 6.4347, "mean_token_accuracy": 0.11437768638134002, "num_tokens": 2230129.0, "step": 1210 }, { "entropy": 6.584838199615478, "epoch": 0.10207939508506617, "grad_norm": 0.8984375, "learning_rate": 0.000499996349373353, "loss": 6.5049, "mean_token_accuracy": 0.11030597984790802, "num_tokens": 2239929.0, "step": 1215 }, { "entropy": 6.768577909469604, "epoch": 0.10249947490023105, "grad_norm": 0.953125, "learning_rate": 0.0004999961767909374, "loss": 6.478, "mean_token_accuracy": 0.11449568048119545, "num_tokens": 2248078.0, "step": 1220 }, { "entropy": 6.615856742858886, "epoch": 0.10291955471539592, "grad_norm": 1.015625, "learning_rate": 0.0004999960002228303, "loss": 6.5666, "mean_token_accuracy": 0.11093122437596321, "num_tokens": 2256975.0, "step": 1225 }, { "entropy": 6.733388185501099, "epoch": 0.1033396345305608, "grad_norm": 1.0703125, "learning_rate": 0.0004999958196690349, "loss": 6.4212, "mean_token_accuracy": 0.11245058998465537, "num_tokens": 2265797.0, "step": 1230 }, { "entropy": 6.668054151535034, "epoch": 0.10375971434572569, "grad_norm": 0.96875, "learning_rate": 0.0004999956351295545, "loss": 6.5197, "mean_token_accuracy": 0.1140691690146923, "num_tokens": 2274099.0, "step": 1235 }, { "entropy": 6.614612483978272, "epoch": 0.10417979416089057, "grad_norm": 0.98828125, "learning_rate": 0.0004999954466043922, "loss": 6.4309, "mean_token_accuracy": 0.11669434607028961, "num_tokens": 2282360.0, "step": 1240 }, { "entropy": 6.6785484790802006, "epoch": 0.10459987397605545, "grad_norm": 0.8828125, "learning_rate": 0.0004999952540935514, "loss": 6.5283, "mean_token_accuracy": 0.10534609332680703, "num_tokens": 2292714.0, "step": 1245 }, { "entropy": 6.669230937957764, "epoch": 0.10501995379122034, "grad_norm": 0.9921875, "learning_rate": 0.0004999950575970356, "loss": 6.4759, "mean_token_accuracy": 0.11022288277745247, "num_tokens": 2301633.0, "step": 1250 }, { "entropy": 6.690946578979492, "epoch": 0.10544003360638521, "grad_norm": 0.97265625, "learning_rate": 0.0004999948571148482, "loss": 6.4607, "mean_token_accuracy": 0.11288312897086143, "num_tokens": 2310067.0, "step": 1255 }, { "entropy": 6.663266944885254, "epoch": 0.10586011342155009, "grad_norm": 0.94140625, "learning_rate": 0.0004999946526469927, "loss": 6.5329, "mean_token_accuracy": 0.11119069010019303, "num_tokens": 2320090.0, "step": 1260 }, { "entropy": 6.619077062606811, "epoch": 0.10628019323671498, "grad_norm": 0.98046875, "learning_rate": 0.0004999944441934728, "loss": 6.4811, "mean_token_accuracy": 0.11513725593686104, "num_tokens": 2329255.0, "step": 1265 }, { "entropy": 6.743935060501099, "epoch": 0.10670027305187986, "grad_norm": 1.046875, "learning_rate": 0.0004999942317542922, "loss": 6.5708, "mean_token_accuracy": 0.10842081904411316, "num_tokens": 2339535.0, "step": 1270 }, { "entropy": 6.647988319396973, "epoch": 0.10712035286704474, "grad_norm": 0.99609375, "learning_rate": 0.0004999940153294546, "loss": 6.4584, "mean_token_accuracy": 0.11369285136461257, "num_tokens": 2348948.0, "step": 1275 }, { "entropy": 6.573079681396484, "epoch": 0.10754043268220961, "grad_norm": 1.0234375, "learning_rate": 0.000499993794918964, "loss": 6.4903, "mean_token_accuracy": 0.11098795756697655, "num_tokens": 2359141.0, "step": 1280 }, { "entropy": 6.623832654953003, "epoch": 0.1079605124973745, "grad_norm": 1.1171875, "learning_rate": 0.0004999935705228241, "loss": 6.5296, "mean_token_accuracy": 0.10813465043902397, "num_tokens": 2368906.0, "step": 1285 }, { "entropy": 6.781174278259277, "epoch": 0.10838059231253938, "grad_norm": 1.09375, "learning_rate": 0.0004999933421410389, "loss": 6.5156, "mean_token_accuracy": 0.11340161636471749, "num_tokens": 2377029.0, "step": 1290 }, { "entropy": 6.664435195922851, "epoch": 0.10880067212770426, "grad_norm": 0.78515625, "learning_rate": 0.0004999931097736125, "loss": 6.5678, "mean_token_accuracy": 0.10811809226870536, "num_tokens": 2387088.0, "step": 1295 }, { "entropy": 6.711423254013061, "epoch": 0.10922075194286915, "grad_norm": 0.9609375, "learning_rate": 0.0004999928734205492, "loss": 6.4748, "mean_token_accuracy": 0.11095682382583619, "num_tokens": 2395596.0, "step": 1300 }, { "entropy": 6.609859323501587, "epoch": 0.10964083175803403, "grad_norm": 1.046875, "learning_rate": 0.0004999926330818528, "loss": 6.4489, "mean_token_accuracy": 0.11987485438585281, "num_tokens": 2404506.0, "step": 1305 }, { "entropy": 6.6314843654632565, "epoch": 0.1100609115731989, "grad_norm": 1.0, "learning_rate": 0.0004999923887575278, "loss": 6.4954, "mean_token_accuracy": 0.11150062307715417, "num_tokens": 2414342.0, "step": 1310 }, { "entropy": 6.703009176254272, "epoch": 0.11048099138836379, "grad_norm": 0.984375, "learning_rate": 0.0004999921404475785, "loss": 6.4686, "mean_token_accuracy": 0.11657750681042671, "num_tokens": 2423076.0, "step": 1315 }, { "entropy": 6.580958127975464, "epoch": 0.11090107120352867, "grad_norm": 0.828125, "learning_rate": 0.0004999918881520093, "loss": 6.4108, "mean_token_accuracy": 0.11714263036847114, "num_tokens": 2432492.0, "step": 1320 }, { "entropy": 6.586594104766846, "epoch": 0.11132115101869355, "grad_norm": 0.94921875, "learning_rate": 0.0004999916318708246, "loss": 6.377, "mean_token_accuracy": 0.11821310296654701, "num_tokens": 2441916.0, "step": 1325 }, { "entropy": 6.610158824920655, "epoch": 0.11174123083385844, "grad_norm": 1.0625, "learning_rate": 0.0004999913716040291, "loss": 6.4429, "mean_token_accuracy": 0.11613110527396202, "num_tokens": 2450932.0, "step": 1330 }, { "entropy": 6.58526463508606, "epoch": 0.11216131064902331, "grad_norm": 1.0546875, "learning_rate": 0.0004999911073516272, "loss": 6.4417, "mean_token_accuracy": 0.11660609394311905, "num_tokens": 2460058.0, "step": 1335 }, { "entropy": 6.543748760223389, "epoch": 0.11258139046418819, "grad_norm": 0.9609375, "learning_rate": 0.0004999908391136237, "loss": 6.3882, "mean_token_accuracy": 0.12162717878818512, "num_tokens": 2469607.0, "step": 1340 }, { "entropy": 6.594651317596435, "epoch": 0.11300147027935308, "grad_norm": 1.015625, "learning_rate": 0.0004999905668900234, "loss": 6.4404, "mean_token_accuracy": 0.11361290663480758, "num_tokens": 2478345.0, "step": 1345 }, { "entropy": 6.574893379211426, "epoch": 0.11342155009451796, "grad_norm": 1.0859375, "learning_rate": 0.000499990290680831, "loss": 6.3587, "mean_token_accuracy": 0.11955868676304818, "num_tokens": 2486662.0, "step": 1350 }, { "entropy": 6.634180545806885, "epoch": 0.11384162990968284, "grad_norm": 1.0234375, "learning_rate": 0.0004999900104860516, "loss": 6.4884, "mean_token_accuracy": 0.11496279463171959, "num_tokens": 2495392.0, "step": 1355 }, { "entropy": 6.6078431606292725, "epoch": 0.11426170972484773, "grad_norm": 0.9921875, "learning_rate": 0.0004999897263056898, "loss": 6.5187, "mean_token_accuracy": 0.11110892221331596, "num_tokens": 2505254.0, "step": 1360 }, { "entropy": 6.676256227493286, "epoch": 0.1146817895400126, "grad_norm": 0.98828125, "learning_rate": 0.000499989438139751, "loss": 6.3391, "mean_token_accuracy": 0.11575900986790658, "num_tokens": 2514096.0, "step": 1365 }, { "entropy": 6.550286197662354, "epoch": 0.11510186935517748, "grad_norm": 0.875, "learning_rate": 0.0004999891459882401, "loss": 6.3458, "mean_token_accuracy": 0.11746028289198876, "num_tokens": 2523635.0, "step": 1370 }, { "entropy": 6.538182258605957, "epoch": 0.11552194917034236, "grad_norm": 1.0078125, "learning_rate": 0.0004999888498511624, "loss": 6.4382, "mean_token_accuracy": 0.1144244447350502, "num_tokens": 2532528.0, "step": 1375 }, { "entropy": 6.527873754501343, "epoch": 0.11594202898550725, "grad_norm": 1.0, "learning_rate": 0.0004999885497285229, "loss": 6.3289, "mean_token_accuracy": 0.11667455583810807, "num_tokens": 2541893.0, "step": 1380 }, { "entropy": 6.541602611541748, "epoch": 0.11636210880067213, "grad_norm": 0.92578125, "learning_rate": 0.0004999882456203273, "loss": 6.3923, "mean_token_accuracy": 0.1184983029961586, "num_tokens": 2551551.0, "step": 1385 }, { "entropy": 6.588447904586792, "epoch": 0.11678218861583702, "grad_norm": 1.0390625, "learning_rate": 0.0004999879375265806, "loss": 6.347, "mean_token_accuracy": 0.11739155948162079, "num_tokens": 2560183.0, "step": 1390 }, { "entropy": 6.454002952575683, "epoch": 0.11720226843100189, "grad_norm": 1.03125, "learning_rate": 0.0004999876254472886, "loss": 6.2601, "mean_token_accuracy": 0.12417450621724128, "num_tokens": 2568697.0, "step": 1395 }, { "entropy": 6.591037464141846, "epoch": 0.11762234824616677, "grad_norm": 0.87890625, "learning_rate": 0.0004999873093824565, "loss": 6.4467, "mean_token_accuracy": 0.11451651230454445, "num_tokens": 2578151.0, "step": 1400 }, { "entropy": 6.704318237304688, "epoch": 0.11804242806133165, "grad_norm": 1.0390625, "learning_rate": 0.0004999869893320902, "loss": 6.5716, "mean_token_accuracy": 0.11275385171175004, "num_tokens": 2585901.0, "step": 1405 }, { "entropy": 6.5783727169036865, "epoch": 0.11846250787649654, "grad_norm": 0.98046875, "learning_rate": 0.0004999866652961952, "loss": 6.3901, "mean_token_accuracy": 0.11096679419279099, "num_tokens": 2595655.0, "step": 1410 }, { "entropy": 6.604079818725586, "epoch": 0.11888258769166142, "grad_norm": 0.9296875, "learning_rate": 0.0004999863372747773, "loss": 6.3632, "mean_token_accuracy": 0.11101334393024445, "num_tokens": 2604949.0, "step": 1415 }, { "entropy": 6.592713022232056, "epoch": 0.11930266750682629, "grad_norm": 1.0859375, "learning_rate": 0.0004999860052678423, "loss": 6.4367, "mean_token_accuracy": 0.11833727061748504, "num_tokens": 2614260.0, "step": 1420 }, { "entropy": 6.529619216918945, "epoch": 0.11972274732199117, "grad_norm": 1.1328125, "learning_rate": 0.0004999856692753959, "loss": 6.4205, "mean_token_accuracy": 0.11050314903259277, "num_tokens": 2623740.0, "step": 1425 }, { "entropy": 6.583321142196655, "epoch": 0.12014282713715606, "grad_norm": 0.97265625, "learning_rate": 0.0004999853292974444, "loss": 6.3153, "mean_token_accuracy": 0.12103430330753326, "num_tokens": 2631998.0, "step": 1430 }, { "entropy": 6.522999906539917, "epoch": 0.12056290695232094, "grad_norm": 0.8515625, "learning_rate": 0.0004999849853339936, "loss": 6.4682, "mean_token_accuracy": 0.12008080482482911, "num_tokens": 2641169.0, "step": 1435 }, { "entropy": 6.666995334625244, "epoch": 0.12098298676748583, "grad_norm": 0.828125, "learning_rate": 0.0004999846373850497, "loss": 6.3232, "mean_token_accuracy": 0.11853480413556099, "num_tokens": 2650576.0, "step": 1440 }, { "entropy": 6.456968832015991, "epoch": 0.12140306658265071, "grad_norm": 0.94921875, "learning_rate": 0.0004999842854506186, "loss": 6.4062, "mean_token_accuracy": 0.11563461422920226, "num_tokens": 2660817.0, "step": 1445 }, { "entropy": 6.559107828140259, "epoch": 0.12182314639781558, "grad_norm": 1.0078125, "learning_rate": 0.0004999839295307069, "loss": 6.3481, "mean_token_accuracy": 0.11764338314533233, "num_tokens": 2669338.0, "step": 1450 }, { "entropy": 6.621726083755493, "epoch": 0.12224322621298046, "grad_norm": 1.015625, "learning_rate": 0.0004999835696253206, "loss": 6.4021, "mean_token_accuracy": 0.11631894037127495, "num_tokens": 2679108.0, "step": 1455 }, { "entropy": 6.533853530883789, "epoch": 0.12266330602814535, "grad_norm": 0.91015625, "learning_rate": 0.0004999832057344664, "loss": 6.37, "mean_token_accuracy": 0.11607012003660203, "num_tokens": 2688126.0, "step": 1460 }, { "entropy": 6.420909214019775, "epoch": 0.12308338584331023, "grad_norm": 1.09375, "learning_rate": 0.0004999828378581504, "loss": 6.3282, "mean_token_accuracy": 0.12565367370843888, "num_tokens": 2697245.0, "step": 1465 }, { "entropy": 6.610960960388184, "epoch": 0.12350346565847511, "grad_norm": 0.92578125, "learning_rate": 0.0004999824659963793, "loss": 6.3873, "mean_token_accuracy": 0.11763433516025543, "num_tokens": 2705934.0, "step": 1470 }, { "entropy": 6.490250873565674, "epoch": 0.12392354547364, "grad_norm": 1.078125, "learning_rate": 0.0004999820901491598, "loss": 6.314, "mean_token_accuracy": 0.12268458679318428, "num_tokens": 2714367.0, "step": 1475 }, { "entropy": 6.484623718261719, "epoch": 0.12434362528880487, "grad_norm": 0.98046875, "learning_rate": 0.0004999817103164983, "loss": 6.3522, "mean_token_accuracy": 0.12056686282157898, "num_tokens": 2724366.0, "step": 1480 }, { "entropy": 6.5408772945404055, "epoch": 0.12476370510396975, "grad_norm": 0.96484375, "learning_rate": 0.0004999813264984017, "loss": 6.3547, "mean_token_accuracy": 0.11844174638390541, "num_tokens": 2733980.0, "step": 1485 }, { "entropy": 6.583751821517945, "epoch": 0.12518378491913462, "grad_norm": 0.9375, "learning_rate": 0.0004999809386948767, "loss": 6.3494, "mean_token_accuracy": 0.12221027910709381, "num_tokens": 2744013.0, "step": 1490 }, { "entropy": 6.452259206771851, "epoch": 0.12560386473429952, "grad_norm": 1.03125, "learning_rate": 0.0004999805469059302, "loss": 6.4272, "mean_token_accuracy": 0.11441577672958374, "num_tokens": 2753385.0, "step": 1495 }, { "entropy": 6.51189775466919, "epoch": 0.1260239445494644, "grad_norm": 1.046875, "learning_rate": 0.0004999801511315693, "loss": 6.2651, "mean_token_accuracy": 0.12032239362597466, "num_tokens": 2762875.0, "step": 1500 }, { "entropy": 6.593140554428101, "epoch": 0.1264440243646293, "grad_norm": 0.98046875, "learning_rate": 0.0004999797513718007, "loss": 6.345, "mean_token_accuracy": 0.12291451320052146, "num_tokens": 2772182.0, "step": 1505 }, { "entropy": 6.4095139503479, "epoch": 0.12686410417979416, "grad_norm": 0.95703125, "learning_rate": 0.0004999793476266317, "loss": 6.2994, "mean_token_accuracy": 0.12340676560997962, "num_tokens": 2780814.0, "step": 1510 }, { "entropy": 6.818328523635865, "epoch": 0.12728418399495905, "grad_norm": 0.9609375, "learning_rate": 0.0004999789398960695, "loss": 6.5676, "mean_token_accuracy": 0.1171888455748558, "num_tokens": 2791104.0, "step": 1515 }, { "entropy": 6.400639343261719, "epoch": 0.12770426381012392, "grad_norm": 1.0078125, "learning_rate": 0.0004999785281801212, "loss": 6.2622, "mean_token_accuracy": 0.12264100611209869, "num_tokens": 2800081.0, "step": 1520 }, { "entropy": 6.553307294845581, "epoch": 0.1281243436252888, "grad_norm": 1.046875, "learning_rate": 0.000499978112478794, "loss": 6.3896, "mean_token_accuracy": 0.11860985979437828, "num_tokens": 2809096.0, "step": 1525 }, { "entropy": 6.57843770980835, "epoch": 0.1285444234404537, "grad_norm": 0.953125, "learning_rate": 0.0004999776927920955, "loss": 6.365, "mean_token_accuracy": 0.12388472035527229, "num_tokens": 2818857.0, "step": 1530 }, { "entropy": 6.497845268249511, "epoch": 0.12896450325561856, "grad_norm": 1.015625, "learning_rate": 0.000499977269120033, "loss": 6.4425, "mean_token_accuracy": 0.11523956879973411, "num_tokens": 2829332.0, "step": 1535 }, { "entropy": 6.516994428634644, "epoch": 0.12938458307078346, "grad_norm": 0.875, "learning_rate": 0.000499976841462614, "loss": 6.3434, "mean_token_accuracy": 0.11322477459907532, "num_tokens": 2839193.0, "step": 1540 }, { "entropy": 6.506987857818603, "epoch": 0.12980466288594833, "grad_norm": 0.85546875, "learning_rate": 0.000499976409819846, "loss": 6.352, "mean_token_accuracy": 0.11825493946671486, "num_tokens": 2848535.0, "step": 1545 }, { "entropy": 6.395366477966308, "epoch": 0.1302247427011132, "grad_norm": 0.90625, "learning_rate": 0.0004999759741917369, "loss": 6.2444, "mean_token_accuracy": 0.12733460888266562, "num_tokens": 2858090.0, "step": 1550 }, { "entropy": 6.548688650131226, "epoch": 0.1306448225162781, "grad_norm": 1.046875, "learning_rate": 0.0004999755345782941, "loss": 6.3894, "mean_token_accuracy": 0.11661416217684746, "num_tokens": 2866984.0, "step": 1555 }, { "entropy": 6.389467811584472, "epoch": 0.13106490233144297, "grad_norm": 0.875, "learning_rate": 0.0004999750909795256, "loss": 6.2012, "mean_token_accuracy": 0.12793270647525787, "num_tokens": 2876550.0, "step": 1560 }, { "entropy": 6.517248106002808, "epoch": 0.13148498214660786, "grad_norm": 0.91796875, "learning_rate": 0.0004999746433954394, "loss": 6.3019, "mean_token_accuracy": 0.12286014333367348, "num_tokens": 2885782.0, "step": 1565 }, { "entropy": 6.436316442489624, "epoch": 0.13190506196177273, "grad_norm": 0.9609375, "learning_rate": 0.000499974191826043, "loss": 6.2806, "mean_token_accuracy": 0.13175936564803123, "num_tokens": 2894807.0, "step": 1570 }, { "entropy": 6.556414270401001, "epoch": 0.1323251417769376, "grad_norm": 1.125, "learning_rate": 0.0004999737362713448, "loss": 6.3319, "mean_token_accuracy": 0.12141326144337654, "num_tokens": 2904076.0, "step": 1575 }, { "entropy": 6.438077783584594, "epoch": 0.1327452215921025, "grad_norm": 0.984375, "learning_rate": 0.0004999732767313527, "loss": 6.2301, "mean_token_accuracy": 0.12145909070968627, "num_tokens": 2913761.0, "step": 1580 }, { "entropy": 6.605003738403321, "epoch": 0.13316530140726737, "grad_norm": 1.046875, "learning_rate": 0.0004999728132060746, "loss": 6.4615, "mean_token_accuracy": 0.11997142881155014, "num_tokens": 2922848.0, "step": 1585 }, { "entropy": 6.545976686477661, "epoch": 0.13358538122243227, "grad_norm": 0.890625, "learning_rate": 0.0004999723456955192, "loss": 6.3361, "mean_token_accuracy": 0.11663061752915382, "num_tokens": 2932718.0, "step": 1590 }, { "entropy": 6.370933151245117, "epoch": 0.13400546103759714, "grad_norm": 0.90234375, "learning_rate": 0.0004999718741996945, "loss": 6.2878, "mean_token_accuracy": 0.12183845415711403, "num_tokens": 2942686.0, "step": 1595 }, { "entropy": 6.422312498092651, "epoch": 0.13442554085276204, "grad_norm": 0.96875, "learning_rate": 0.000499971398718609, "loss": 6.2711, "mean_token_accuracy": 0.11760244071483612, "num_tokens": 2952096.0, "step": 1600 }, { "entropy": 6.4970005512237545, "epoch": 0.1348456206679269, "grad_norm": 0.9296875, "learning_rate": 0.0004999709192522708, "loss": 6.3449, "mean_token_accuracy": 0.12237487882375717, "num_tokens": 2960660.0, "step": 1605 }, { "entropy": 6.604963493347168, "epoch": 0.13526570048309178, "grad_norm": 0.85546875, "learning_rate": 0.0004999704358006887, "loss": 6.3497, "mean_token_accuracy": 0.11823863610625267, "num_tokens": 2969834.0, "step": 1610 }, { "entropy": 6.454269361495972, "epoch": 0.13568578029825668, "grad_norm": 1.046875, "learning_rate": 0.0004999699483638712, "loss": 6.3256, "mean_token_accuracy": 0.12492895498871803, "num_tokens": 2979023.0, "step": 1615 }, { "entropy": 6.496698570251465, "epoch": 0.13610586011342155, "grad_norm": 0.97265625, "learning_rate": 0.0004999694569418269, "loss": 6.3222, "mean_token_accuracy": 0.12362956255674362, "num_tokens": 2988083.0, "step": 1620 }, { "entropy": 6.424844694137573, "epoch": 0.13652593992858644, "grad_norm": 0.9609375, "learning_rate": 0.0004999689615345645, "loss": 6.2399, "mean_token_accuracy": 0.12576239481568335, "num_tokens": 2997240.0, "step": 1625 }, { "entropy": 6.554689359664917, "epoch": 0.1369460197437513, "grad_norm": 0.984375, "learning_rate": 0.0004999684621420928, "loss": 6.3191, "mean_token_accuracy": 0.12176118865609169, "num_tokens": 3007077.0, "step": 1630 }, { "entropy": 6.500646114349365, "epoch": 0.13736609955891618, "grad_norm": 0.98046875, "learning_rate": 0.0004999679587644205, "loss": 6.3628, "mean_token_accuracy": 0.11905800476670265, "num_tokens": 3015821.0, "step": 1635 }, { "entropy": 6.445851802825928, "epoch": 0.13778617937408108, "grad_norm": 0.9921875, "learning_rate": 0.0004999674514015568, "loss": 6.2803, "mean_token_accuracy": 0.12496163100004196, "num_tokens": 3025858.0, "step": 1640 }, { "entropy": 6.520554733276367, "epoch": 0.13820625918924595, "grad_norm": 0.94140625, "learning_rate": 0.0004999669400535105, "loss": 6.2466, "mean_token_accuracy": 0.12024016380310058, "num_tokens": 3035537.0, "step": 1645 }, { "entropy": 6.2957807064056395, "epoch": 0.13862633900441085, "grad_norm": 1.109375, "learning_rate": 0.0004999664247202907, "loss": 6.1784, "mean_token_accuracy": 0.12314105778932571, "num_tokens": 3044204.0, "step": 1650 }, { "entropy": 6.51614408493042, "epoch": 0.13904641881957572, "grad_norm": 1.015625, "learning_rate": 0.0004999659054019066, "loss": 6.3301, "mean_token_accuracy": 0.1245350755751133, "num_tokens": 3053111.0, "step": 1655 }, { "entropy": 6.3797486305236815, "epoch": 0.1394664986347406, "grad_norm": 0.9921875, "learning_rate": 0.0004999653820983673, "loss": 6.2542, "mean_token_accuracy": 0.12539379447698593, "num_tokens": 3062456.0, "step": 1660 }, { "entropy": 6.448072814941407, "epoch": 0.13988657844990549, "grad_norm": 0.953125, "learning_rate": 0.000499964854809682, "loss": 6.2791, "mean_token_accuracy": 0.1257368341088295, "num_tokens": 3071132.0, "step": 1665 }, { "entropy": 6.44848141670227, "epoch": 0.14030665826507036, "grad_norm": 0.890625, "learning_rate": 0.0004999643235358602, "loss": 6.2275, "mean_token_accuracy": 0.13099895641207696, "num_tokens": 3080892.0, "step": 1670 }, { "entropy": 6.366451406478882, "epoch": 0.14072673808023525, "grad_norm": 0.9921875, "learning_rate": 0.0004999637882769112, "loss": 6.1829, "mean_token_accuracy": 0.12473593726754188, "num_tokens": 3089874.0, "step": 1675 }, { "entropy": 6.438631200790406, "epoch": 0.14114681789540012, "grad_norm": 0.859375, "learning_rate": 0.0004999632490328447, "loss": 6.3097, "mean_token_accuracy": 0.12419775351881981, "num_tokens": 3099535.0, "step": 1680 }, { "entropy": 6.457270622253418, "epoch": 0.14156689771056502, "grad_norm": 0.9140625, "learning_rate": 0.0004999627058036699, "loss": 6.2762, "mean_token_accuracy": 0.12024275660514831, "num_tokens": 3108772.0, "step": 1685 }, { "entropy": 6.486367511749267, "epoch": 0.1419869775257299, "grad_norm": 0.94140625, "learning_rate": 0.0004999621585893966, "loss": 6.2888, "mean_token_accuracy": 0.11725226789712906, "num_tokens": 3118333.0, "step": 1690 }, { "entropy": 6.429450368881225, "epoch": 0.14240705734089476, "grad_norm": 1.0078125, "learning_rate": 0.0004999616073900346, "loss": 6.3284, "mean_token_accuracy": 0.12171539664268494, "num_tokens": 3127356.0, "step": 1695 }, { "entropy": 6.498106622695923, "epoch": 0.14282713715605966, "grad_norm": 1.0390625, "learning_rate": 0.0004999610522055935, "loss": 6.2912, "mean_token_accuracy": 0.11646916791796684, "num_tokens": 3136859.0, "step": 1700 }, { "entropy": 6.471587181091309, "epoch": 0.14324721697122453, "grad_norm": 0.953125, "learning_rate": 0.0004999604930360832, "loss": 6.33, "mean_token_accuracy": 0.11686689779162407, "num_tokens": 3146607.0, "step": 1705 }, { "entropy": 6.408087730407715, "epoch": 0.14366729678638943, "grad_norm": 0.90234375, "learning_rate": 0.0004999599298815136, "loss": 6.2621, "mean_token_accuracy": 0.1279582552611828, "num_tokens": 3156327.0, "step": 1710 }, { "entropy": 6.365849542617798, "epoch": 0.1440873766015543, "grad_norm": 1.4296875, "learning_rate": 0.0004999593627418947, "loss": 6.1983, "mean_token_accuracy": 0.13225716799497605, "num_tokens": 3165559.0, "step": 1715 }, { "entropy": 6.51579737663269, "epoch": 0.14450745641671917, "grad_norm": 1.0, "learning_rate": 0.0004999587916172365, "loss": 6.2988, "mean_token_accuracy": 0.11835923567414283, "num_tokens": 3173850.0, "step": 1720 }, { "entropy": 6.430272150039673, "epoch": 0.14492753623188406, "grad_norm": 0.94921875, "learning_rate": 0.0004999582165075492, "loss": 6.2413, "mean_token_accuracy": 0.12055112421512604, "num_tokens": 3182838.0, "step": 1725 }, { "entropy": 6.354161643981934, "epoch": 0.14534761604704893, "grad_norm": 1.0078125, "learning_rate": 0.0004999576374128429, "loss": 6.2389, "mean_token_accuracy": 0.1231518879532814, "num_tokens": 3191692.0, "step": 1730 }, { "entropy": 6.491216516494751, "epoch": 0.14576769586221383, "grad_norm": 1.03125, "learning_rate": 0.0004999570543331279, "loss": 6.2699, "mean_token_accuracy": 0.1253180719912052, "num_tokens": 3200069.0, "step": 1735 }, { "entropy": 6.4589770317077635, "epoch": 0.1461877756773787, "grad_norm": 1.0234375, "learning_rate": 0.0004999564672684145, "loss": 6.3418, "mean_token_accuracy": 0.11855114102363587, "num_tokens": 3209653.0, "step": 1740 }, { "entropy": 6.512481784820556, "epoch": 0.14660785549254357, "grad_norm": 0.953125, "learning_rate": 0.0004999558762187131, "loss": 6.2232, "mean_token_accuracy": 0.13238132372498512, "num_tokens": 3218313.0, "step": 1745 }, { "entropy": 6.309611749649048, "epoch": 0.14702793530770847, "grad_norm": 0.94921875, "learning_rate": 0.0004999552811840342, "loss": 6.1676, "mean_token_accuracy": 0.12678530514240266, "num_tokens": 3227525.0, "step": 1750 }, { "entropy": 6.419345808029175, "epoch": 0.14744801512287334, "grad_norm": 0.8984375, "learning_rate": 0.0004999546821643884, "loss": 6.2824, "mean_token_accuracy": 0.12407411858439446, "num_tokens": 3237022.0, "step": 1755 }, { "entropy": 6.376602506637573, "epoch": 0.14786809493803824, "grad_norm": 0.9296875, "learning_rate": 0.0004999540791597861, "loss": 6.1608, "mean_token_accuracy": 0.1266619324684143, "num_tokens": 3246605.0, "step": 1760 }, { "entropy": 6.292014646530151, "epoch": 0.1482881747532031, "grad_norm": 0.94921875, "learning_rate": 0.0004999534721702383, "loss": 6.139, "mean_token_accuracy": 0.13051704913377762, "num_tokens": 3255587.0, "step": 1765 }, { "entropy": 6.414491844177246, "epoch": 0.148708254568368, "grad_norm": 0.97265625, "learning_rate": 0.0004999528611957553, "loss": 6.2196, "mean_token_accuracy": 0.1258571393787861, "num_tokens": 3265669.0, "step": 1770 }, { "entropy": 6.458701848983765, "epoch": 0.14912833438353287, "grad_norm": 1.03125, "learning_rate": 0.0004999522462363485, "loss": 6.2058, "mean_token_accuracy": 0.12836851552128792, "num_tokens": 3275013.0, "step": 1775 }, { "entropy": 6.390926885604858, "epoch": 0.14954841419869774, "grad_norm": 0.8828125, "learning_rate": 0.0004999516272920283, "loss": 6.3077, "mean_token_accuracy": 0.12579302862286568, "num_tokens": 3284723.0, "step": 1780 }, { "entropy": 6.3027690887451175, "epoch": 0.14996849401386264, "grad_norm": 0.95703125, "learning_rate": 0.000499951004362806, "loss": 6.1375, "mean_token_accuracy": 0.13238742649555207, "num_tokens": 3293860.0, "step": 1785 }, { "entropy": 6.337384557723999, "epoch": 0.1503885738290275, "grad_norm": 0.953125, "learning_rate": 0.0004999503774486924, "loss": 6.1876, "mean_token_accuracy": 0.1245276965200901, "num_tokens": 3303158.0, "step": 1790 }, { "entropy": 6.296294498443603, "epoch": 0.1508086536441924, "grad_norm": 0.92578125, "learning_rate": 0.0004999497465496987, "loss": 6.1254, "mean_token_accuracy": 0.12188991010189057, "num_tokens": 3313068.0, "step": 1795 }, { "entropy": 6.346179628372193, "epoch": 0.15122873345935728, "grad_norm": 1.015625, "learning_rate": 0.000499949111665836, "loss": 6.21, "mean_token_accuracy": 0.12482204511761666, "num_tokens": 3321885.0, "step": 1800 }, { "entropy": 6.417145109176635, "epoch": 0.15164881327452215, "grad_norm": 0.921875, "learning_rate": 0.0004999484727971158, "loss": 6.2049, "mean_token_accuracy": 0.12663445696234704, "num_tokens": 3330924.0, "step": 1805 }, { "entropy": 6.3640861988067625, "epoch": 0.15206889308968705, "grad_norm": 0.96484375, "learning_rate": 0.000499947829943549, "loss": 6.2421, "mean_token_accuracy": 0.12180857658386231, "num_tokens": 3340070.0, "step": 1810 }, { "entropy": 6.42901873588562, "epoch": 0.15248897290485192, "grad_norm": 0.94140625, "learning_rate": 0.0004999471831051474, "loss": 6.2161, "mean_token_accuracy": 0.13666835352778434, "num_tokens": 3349870.0, "step": 1815 }, { "entropy": 6.384167289733886, "epoch": 0.1529090527200168, "grad_norm": 0.94921875, "learning_rate": 0.0004999465322819222, "loss": 6.2561, "mean_token_accuracy": 0.1196154922246933, "num_tokens": 3359573.0, "step": 1820 }, { "entropy": 6.420805263519287, "epoch": 0.15332913253518168, "grad_norm": 0.984375, "learning_rate": 0.0004999458774738851, "loss": 6.2022, "mean_token_accuracy": 0.1329035244882107, "num_tokens": 3368577.0, "step": 1825 }, { "entropy": 6.3645374298095705, "epoch": 0.15374921235034655, "grad_norm": 0.96484375, "learning_rate": 0.0004999452186810476, "loss": 6.1723, "mean_token_accuracy": 0.13094222992658616, "num_tokens": 3377801.0, "step": 1830 }, { "entropy": 6.414077711105347, "epoch": 0.15416929216551145, "grad_norm": 1.0, "learning_rate": 0.0004999445559034214, "loss": 6.2325, "mean_token_accuracy": 0.12632885575294495, "num_tokens": 3386666.0, "step": 1835 }, { "entropy": 6.492283153533935, "epoch": 0.15458937198067632, "grad_norm": 0.97265625, "learning_rate": 0.0004999438891410181, "loss": 6.3646, "mean_token_accuracy": 0.12365243062376977, "num_tokens": 3396086.0, "step": 1840 }, { "entropy": 6.3361475467681885, "epoch": 0.15500945179584122, "grad_norm": 0.96484375, "learning_rate": 0.0004999432183938496, "loss": 6.2714, "mean_token_accuracy": 0.12596381455659866, "num_tokens": 3404894.0, "step": 1845 }, { "entropy": 6.407006740570068, "epoch": 0.1554295316110061, "grad_norm": 0.9609375, "learning_rate": 0.0004999425436619279, "loss": 6.2544, "mean_token_accuracy": 0.12557967007160187, "num_tokens": 3414172.0, "step": 1850 }, { "entropy": 6.476001453399658, "epoch": 0.15584961142617096, "grad_norm": 0.89453125, "learning_rate": 0.000499941864945265, "loss": 6.2327, "mean_token_accuracy": 0.12348362207412719, "num_tokens": 3423409.0, "step": 1855 }, { "entropy": 6.296181011199951, "epoch": 0.15626969124133586, "grad_norm": 0.93359375, "learning_rate": 0.0004999411822438726, "loss": 6.1767, "mean_token_accuracy": 0.12874680012464523, "num_tokens": 3433047.0, "step": 1860 }, { "entropy": 6.446085119247437, "epoch": 0.15668977105650073, "grad_norm": 1.015625, "learning_rate": 0.000499940495557763, "loss": 6.1762, "mean_token_accuracy": 0.12680488154292108, "num_tokens": 3442490.0, "step": 1865 }, { "entropy": 6.367494440078735, "epoch": 0.15710985087166562, "grad_norm": 0.97265625, "learning_rate": 0.0004999398048869485, "loss": 6.2463, "mean_token_accuracy": 0.1263427644968033, "num_tokens": 3451804.0, "step": 1870 }, { "entropy": 6.448274326324463, "epoch": 0.1575299306868305, "grad_norm": 0.96875, "learning_rate": 0.000499939110231441, "loss": 6.225, "mean_token_accuracy": 0.12612806633114815, "num_tokens": 3461481.0, "step": 1875 }, { "entropy": 6.3886480808258055, "epoch": 0.1579500105019954, "grad_norm": 0.97265625, "learning_rate": 0.0004999384115912531, "loss": 6.2713, "mean_token_accuracy": 0.12860373705625533, "num_tokens": 3471798.0, "step": 1880 }, { "entropy": 6.294258403778076, "epoch": 0.15837009031716026, "grad_norm": 0.9140625, "learning_rate": 0.000499937708966397, "loss": 6.1694, "mean_token_accuracy": 0.1269647814333439, "num_tokens": 3481386.0, "step": 1885 }, { "entropy": 6.380875062942505, "epoch": 0.15879017013232513, "grad_norm": 0.95703125, "learning_rate": 0.0004999370023568853, "loss": 6.1648, "mean_token_accuracy": 0.1258099302649498, "num_tokens": 3489981.0, "step": 1890 }, { "entropy": 6.298674488067627, "epoch": 0.15921024994749003, "grad_norm": 0.984375, "learning_rate": 0.0004999362917627304, "loss": 6.1603, "mean_token_accuracy": 0.1279548816382885, "num_tokens": 3498551.0, "step": 1895 }, { "entropy": 6.364571666717529, "epoch": 0.1596303297626549, "grad_norm": 0.99609375, "learning_rate": 0.0004999355771839448, "loss": 6.1198, "mean_token_accuracy": 0.12712288051843643, "num_tokens": 3507921.0, "step": 1900 }, { "entropy": 6.472431182861328, "epoch": 0.1600504095778198, "grad_norm": 0.98828125, "learning_rate": 0.0004999348586205414, "loss": 6.3119, "mean_token_accuracy": 0.12473546266555786, "num_tokens": 3517570.0, "step": 1905 }, { "entropy": 6.44771819114685, "epoch": 0.16047048939298467, "grad_norm": 1.0, "learning_rate": 0.0004999341360725327, "loss": 6.2778, "mean_token_accuracy": 0.12144239619374275, "num_tokens": 3526774.0, "step": 1910 }, { "entropy": 6.367665719985962, "epoch": 0.16089056920814954, "grad_norm": 0.99609375, "learning_rate": 0.0004999334095399317, "loss": 6.2164, "mean_token_accuracy": 0.13476391285657882, "num_tokens": 3535319.0, "step": 1915 }, { "entropy": 6.29778151512146, "epoch": 0.16131064902331443, "grad_norm": 0.9375, "learning_rate": 0.0004999326790227512, "loss": 6.1759, "mean_token_accuracy": 0.12915017306804658, "num_tokens": 3544468.0, "step": 1920 }, { "entropy": 6.263013315200806, "epoch": 0.1617307288384793, "grad_norm": 0.91015625, "learning_rate": 0.0004999319445210041, "loss": 6.074, "mean_token_accuracy": 0.13183464705944062, "num_tokens": 3553529.0, "step": 1925 }, { "entropy": 6.341449880599976, "epoch": 0.1621508086536442, "grad_norm": 0.921875, "learning_rate": 0.0004999312060347034, "loss": 6.1214, "mean_token_accuracy": 0.1265263617038727, "num_tokens": 3563053.0, "step": 1930 }, { "entropy": 6.272969150543213, "epoch": 0.16257088846880907, "grad_norm": 0.92578125, "learning_rate": 0.0004999304635638621, "loss": 6.0616, "mean_token_accuracy": 0.13436255902051925, "num_tokens": 3571877.0, "step": 1935 }, { "entropy": 6.305766344070435, "epoch": 0.16299096828397394, "grad_norm": 0.86328125, "learning_rate": 0.0004999297171084935, "loss": 6.1234, "mean_token_accuracy": 0.1326524868607521, "num_tokens": 3581496.0, "step": 1940 }, { "entropy": 6.313105726242066, "epoch": 0.16341104809913884, "grad_norm": 0.94921875, "learning_rate": 0.0004999289666686109, "loss": 6.1344, "mean_token_accuracy": 0.1272105999290943, "num_tokens": 3590752.0, "step": 1945 }, { "entropy": 6.1983654499053955, "epoch": 0.1638311279143037, "grad_norm": 0.9375, "learning_rate": 0.0004999282122442274, "loss": 6.1416, "mean_token_accuracy": 0.13213918060064317, "num_tokens": 3599885.0, "step": 1950 }, { "entropy": 6.440747499465942, "epoch": 0.1642512077294686, "grad_norm": 0.890625, "learning_rate": 0.0004999274538353564, "loss": 6.2106, "mean_token_accuracy": 0.12646706998348237, "num_tokens": 3610039.0, "step": 1955 }, { "entropy": 6.272910118103027, "epoch": 0.16467128754463348, "grad_norm": 1.015625, "learning_rate": 0.0004999266914420114, "loss": 6.1332, "mean_token_accuracy": 0.12781383618712425, "num_tokens": 3619954.0, "step": 1960 }, { "entropy": 6.3279284000396725, "epoch": 0.16509136735979837, "grad_norm": 0.9453125, "learning_rate": 0.000499925925064206, "loss": 6.1033, "mean_token_accuracy": 0.13286505788564681, "num_tokens": 3628164.0, "step": 1965 }, { "entropy": 6.360192775726318, "epoch": 0.16551144717496324, "grad_norm": 0.96484375, "learning_rate": 0.0004999251547019535, "loss": 6.2577, "mean_token_accuracy": 0.12934610545635222, "num_tokens": 3636778.0, "step": 1970 }, { "entropy": 6.414323568344116, "epoch": 0.16593152699012811, "grad_norm": 0.91015625, "learning_rate": 0.0004999243803552678, "loss": 6.197, "mean_token_accuracy": 0.1297714054584503, "num_tokens": 3647046.0, "step": 1975 }, { "entropy": 6.239211511611939, "epoch": 0.166351606805293, "grad_norm": 1.0546875, "learning_rate": 0.0004999236020241625, "loss": 6.1263, "mean_token_accuracy": 0.12911003157496453, "num_tokens": 3656130.0, "step": 1980 }, { "entropy": 6.400930309295655, "epoch": 0.16677168662045788, "grad_norm": 0.96484375, "learning_rate": 0.0004999228197086514, "loss": 6.2075, "mean_token_accuracy": 0.12356689870357514, "num_tokens": 3666145.0, "step": 1985 }, { "entropy": 6.2993443489074705, "epoch": 0.16719176643562278, "grad_norm": 0.89453125, "learning_rate": 0.0004999220334087484, "loss": 6.2466, "mean_token_accuracy": 0.12334830835461616, "num_tokens": 3676722.0, "step": 1990 }, { "entropy": 6.383305788040161, "epoch": 0.16761184625078765, "grad_norm": 0.921875, "learning_rate": 0.0004999212431244673, "loss": 6.2353, "mean_token_accuracy": 0.12262691259384155, "num_tokens": 3685880.0, "step": 1995 }, { "entropy": 6.260931539535522, "epoch": 0.16803192606595252, "grad_norm": 0.9453125, "learning_rate": 0.0004999204488558222, "loss": 6.064, "mean_token_accuracy": 0.13560437187552452, "num_tokens": 3695167.0, "step": 2000 }, { "entropy": 6.341617202758789, "epoch": 0.16845200588111742, "grad_norm": 0.9375, "learning_rate": 0.0004999196506028273, "loss": 6.1714, "mean_token_accuracy": 0.13033221215009688, "num_tokens": 3703700.0, "step": 2005 }, { "entropy": 6.330134630203247, "epoch": 0.1688720856962823, "grad_norm": 0.99609375, "learning_rate": 0.0004999188483654965, "loss": 6.1229, "mean_token_accuracy": 0.1314982570707798, "num_tokens": 3712825.0, "step": 2010 }, { "entropy": 6.2663736820220945, "epoch": 0.16929216551144718, "grad_norm": 0.89453125, "learning_rate": 0.0004999180421438442, "loss": 6.0855, "mean_token_accuracy": 0.13337414115667343, "num_tokens": 3721807.0, "step": 2015 }, { "entropy": 6.426154756546021, "epoch": 0.16971224532661205, "grad_norm": 1.0234375, "learning_rate": 0.0004999172319378846, "loss": 6.2558, "mean_token_accuracy": 0.12170653715729714, "num_tokens": 3730502.0, "step": 2020 }, { "entropy": 6.357564783096313, "epoch": 0.17013232514177692, "grad_norm": 0.9296875, "learning_rate": 0.0004999164177476319, "loss": 6.1304, "mean_token_accuracy": 0.13129208087921143, "num_tokens": 3739696.0, "step": 2025 }, { "entropy": 6.183953857421875, "epoch": 0.17055240495694182, "grad_norm": 0.97265625, "learning_rate": 0.0004999155995731009, "loss": 6.1493, "mean_token_accuracy": 0.1318361982703209, "num_tokens": 3748675.0, "step": 2030 }, { "entropy": 6.50171127319336, "epoch": 0.1709724847721067, "grad_norm": 0.97265625, "learning_rate": 0.0004999147774143057, "loss": 6.2267, "mean_token_accuracy": 0.12189607992768288, "num_tokens": 3757714.0, "step": 2035 }, { "entropy": 6.228915214538574, "epoch": 0.1713925645872716, "grad_norm": 0.984375, "learning_rate": 0.000499913951271261, "loss": 6.0545, "mean_token_accuracy": 0.13067708387970925, "num_tokens": 3767589.0, "step": 2040 }, { "entropy": 6.328529357910156, "epoch": 0.17181264440243646, "grad_norm": 1.0625, "learning_rate": 0.0004999131211439816, "loss": 6.1523, "mean_token_accuracy": 0.13088449314236641, "num_tokens": 3777261.0, "step": 2045 }, { "entropy": 6.358458805084228, "epoch": 0.17223272421760136, "grad_norm": 0.9765625, "learning_rate": 0.000499912287032482, "loss": 6.105, "mean_token_accuracy": 0.13954608961939813, "num_tokens": 3786658.0, "step": 2050 }, { "entropy": 6.194888353347778, "epoch": 0.17265280403276623, "grad_norm": 1.0078125, "learning_rate": 0.000499911448936777, "loss": 6.1021, "mean_token_accuracy": 0.1387820027768612, "num_tokens": 3794977.0, "step": 2055 }, { "entropy": 6.274205017089844, "epoch": 0.1730728838479311, "grad_norm": 0.8984375, "learning_rate": 0.0004999106068568816, "loss": 6.1767, "mean_token_accuracy": 0.1296847067773342, "num_tokens": 3805138.0, "step": 2060 }, { "entropy": 6.353550148010254, "epoch": 0.173492963663096, "grad_norm": 0.96875, "learning_rate": 0.0004999097607928106, "loss": 6.1193, "mean_token_accuracy": 0.13772593289613724, "num_tokens": 3814444.0, "step": 2065 }, { "entropy": 6.28287091255188, "epoch": 0.17391304347826086, "grad_norm": 0.98046875, "learning_rate": 0.0004999089107445788, "loss": 6.081, "mean_token_accuracy": 0.1331343598663807, "num_tokens": 3822859.0, "step": 2070 }, { "entropy": 6.187959289550781, "epoch": 0.17433312329342576, "grad_norm": 0.875, "learning_rate": 0.0004999080567122016, "loss": 6.0928, "mean_token_accuracy": 0.13325781002640724, "num_tokens": 3833159.0, "step": 2075 }, { "entropy": 6.2891417980194095, "epoch": 0.17475320310859063, "grad_norm": 0.9921875, "learning_rate": 0.0004999071986956941, "loss": 6.1081, "mean_token_accuracy": 0.13443495854735374, "num_tokens": 3842136.0, "step": 2080 }, { "entropy": 6.291293048858643, "epoch": 0.1751732829237555, "grad_norm": 0.95703125, "learning_rate": 0.0004999063366950713, "loss": 6.1855, "mean_token_accuracy": 0.1292753279209137, "num_tokens": 3851406.0, "step": 2085 }, { "entropy": 6.308997011184692, "epoch": 0.1755933627389204, "grad_norm": 0.9609375, "learning_rate": 0.0004999054707103486, "loss": 6.0941, "mean_token_accuracy": 0.1310033306479454, "num_tokens": 3861061.0, "step": 2090 }, { "entropy": 6.280231618881226, "epoch": 0.17601344255408527, "grad_norm": 0.953125, "learning_rate": 0.0004999046007415412, "loss": 6.0761, "mean_token_accuracy": 0.1290605030953884, "num_tokens": 3870357.0, "step": 2095 }, { "entropy": 6.3239013671875, "epoch": 0.17643352236925017, "grad_norm": 0.93359375, "learning_rate": 0.0004999037267886646, "loss": 6.1119, "mean_token_accuracy": 0.1301138088107109, "num_tokens": 3879393.0, "step": 2100 }, { "entropy": 6.217884635925293, "epoch": 0.17685360218441504, "grad_norm": 0.96484375, "learning_rate": 0.0004999028488517343, "loss": 6.1106, "mean_token_accuracy": 0.13041476532816887, "num_tokens": 3888030.0, "step": 2105 }, { "entropy": 6.330727005004883, "epoch": 0.1772736819995799, "grad_norm": 1.0, "learning_rate": 0.0004999019669307659, "loss": 6.1128, "mean_token_accuracy": 0.14087287336587906, "num_tokens": 3897430.0, "step": 2110 }, { "entropy": 6.268360662460327, "epoch": 0.1776937618147448, "grad_norm": 0.875, "learning_rate": 0.0004999010810257749, "loss": 6.1294, "mean_token_accuracy": 0.12782176434993744, "num_tokens": 3907711.0, "step": 2115 }, { "entropy": 6.222604417800904, "epoch": 0.17811384162990967, "grad_norm": 0.94140625, "learning_rate": 0.0004999001911367771, "loss": 6.0703, "mean_token_accuracy": 0.13519175425171853, "num_tokens": 3915816.0, "step": 2120 }, { "entropy": 6.279330682754517, "epoch": 0.17853392144507457, "grad_norm": 0.9140625, "learning_rate": 0.0004998992972637883, "loss": 6.1784, "mean_token_accuracy": 0.12573839649558066, "num_tokens": 3925162.0, "step": 2125 }, { "entropy": 6.312918043136596, "epoch": 0.17895400126023944, "grad_norm": 0.97265625, "learning_rate": 0.0004998983994068242, "loss": 6.0804, "mean_token_accuracy": 0.12800241634249687, "num_tokens": 3934476.0, "step": 2130 }, { "entropy": 6.257489347457886, "epoch": 0.17937408107540434, "grad_norm": 0.89453125, "learning_rate": 0.0004998974975659006, "loss": 6.117, "mean_token_accuracy": 0.13179219737648964, "num_tokens": 3943501.0, "step": 2135 }, { "entropy": 6.269851350784302, "epoch": 0.1797941608905692, "grad_norm": 0.921875, "learning_rate": 0.0004998965917410338, "loss": 6.105, "mean_token_accuracy": 0.12811433225870134, "num_tokens": 3953663.0, "step": 2140 }, { "entropy": 6.263305425643921, "epoch": 0.18021424070573408, "grad_norm": 0.93359375, "learning_rate": 0.0004998956819322397, "loss": 6.0649, "mean_token_accuracy": 0.1344923309981823, "num_tokens": 3962634.0, "step": 2145 }, { "entropy": 6.2131294250488285, "epoch": 0.18063432052089898, "grad_norm": 0.9375, "learning_rate": 0.0004998947681395343, "loss": 6.0787, "mean_token_accuracy": 0.1363943800330162, "num_tokens": 3972496.0, "step": 2150 }, { "entropy": 6.464788103103638, "epoch": 0.18105440033606385, "grad_norm": 0.98046875, "learning_rate": 0.000499893850362934, "loss": 6.3219, "mean_token_accuracy": 0.12087765410542488, "num_tokens": 3980724.0, "step": 2155 }, { "entropy": 6.291199588775635, "epoch": 0.18147448015122875, "grad_norm": 0.9609375, "learning_rate": 0.0004998929286024548, "loss": 6.1445, "mean_token_accuracy": 0.12979334518313407, "num_tokens": 3989842.0, "step": 2160 }, { "entropy": 6.278742074966431, "epoch": 0.18189455996639362, "grad_norm": 1.1015625, "learning_rate": 0.0004998920028581133, "loss": 6.0687, "mean_token_accuracy": 0.14321179836988449, "num_tokens": 3998534.0, "step": 2165 }, { "entropy": 6.2926966667175295, "epoch": 0.18231463978155849, "grad_norm": 0.91796875, "learning_rate": 0.0004998910731299258, "loss": 6.0834, "mean_token_accuracy": 0.12944981455802917, "num_tokens": 4007677.0, "step": 2170 }, { "entropy": 6.248470973968506, "epoch": 0.18273471959672338, "grad_norm": 0.98046875, "learning_rate": 0.0004998901394179085, "loss": 6.1367, "mean_token_accuracy": 0.12592731565237045, "num_tokens": 4016347.0, "step": 2175 }, { "entropy": 6.264119005203247, "epoch": 0.18315479941188825, "grad_norm": 1.046875, "learning_rate": 0.0004998892017220784, "loss": 6.0249, "mean_token_accuracy": 0.13742422610521315, "num_tokens": 4025199.0, "step": 2180 }, { "entropy": 6.263695335388183, "epoch": 0.18357487922705315, "grad_norm": 1.0390625, "learning_rate": 0.0004998882600424519, "loss": 6.0944, "mean_token_accuracy": 0.12306004837155342, "num_tokens": 4033933.0, "step": 2185 }, { "entropy": 6.230836820602417, "epoch": 0.18399495904221802, "grad_norm": 0.9453125, "learning_rate": 0.0004998873143790455, "loss": 6.0121, "mean_token_accuracy": 0.13827981501817704, "num_tokens": 4042891.0, "step": 2190 }, { "entropy": 6.326285457611084, "epoch": 0.1844150388573829, "grad_norm": 0.953125, "learning_rate": 0.0004998863647318763, "loss": 6.1254, "mean_token_accuracy": 0.13076284304261207, "num_tokens": 4051123.0, "step": 2195 }, { "entropy": 6.218794679641723, "epoch": 0.1848351186725478, "grad_norm": 1.0078125, "learning_rate": 0.0004998854111009608, "loss": 6.1018, "mean_token_accuracy": 0.12811416238546372, "num_tokens": 4060025.0, "step": 2200 }, { "entropy": 6.201221132278443, "epoch": 0.18525519848771266, "grad_norm": 0.88671875, "learning_rate": 0.0004998844534863161, "loss": 6.0147, "mean_token_accuracy": 0.12775525376200675, "num_tokens": 4069363.0, "step": 2205 }, { "entropy": 6.318734121322632, "epoch": 0.18567527830287756, "grad_norm": 0.9296875, "learning_rate": 0.0004998834918879592, "loss": 6.1746, "mean_token_accuracy": 0.13352699503302573, "num_tokens": 4078855.0, "step": 2210 }, { "entropy": 6.284113597869873, "epoch": 0.18609535811804243, "grad_norm": 0.87890625, "learning_rate": 0.000499882526305907, "loss": 6.1205, "mean_token_accuracy": 0.13283827975392343, "num_tokens": 4087801.0, "step": 2215 }, { "entropy": 6.278976345062256, "epoch": 0.18651543793320732, "grad_norm": 0.91015625, "learning_rate": 0.0004998815567401765, "loss": 6.1183, "mean_token_accuracy": 0.13487844318151473, "num_tokens": 4096949.0, "step": 2220 }, { "entropy": 6.322417879104615, "epoch": 0.1869355177483722, "grad_norm": 0.9765625, "learning_rate": 0.0004998805831907851, "loss": 6.092, "mean_token_accuracy": 0.12811465859413146, "num_tokens": 4105399.0, "step": 2225 }, { "entropy": 6.261762046813965, "epoch": 0.18735559756353706, "grad_norm": 0.96484375, "learning_rate": 0.0004998796056577501, "loss": 6.0294, "mean_token_accuracy": 0.12984329760074614, "num_tokens": 4113873.0, "step": 2230 }, { "entropy": 6.17222752571106, "epoch": 0.18777567737870196, "grad_norm": 0.8984375, "learning_rate": 0.0004998786241410886, "loss": 6.0911, "mean_token_accuracy": 0.13395953848958014, "num_tokens": 4123528.0, "step": 2235 }, { "entropy": 6.337759065628052, "epoch": 0.18819575719386683, "grad_norm": 0.8671875, "learning_rate": 0.000499877638640818, "loss": 6.1045, "mean_token_accuracy": 0.12952830642461777, "num_tokens": 4133370.0, "step": 2240 }, { "entropy": 6.218608713150024, "epoch": 0.18861583700903173, "grad_norm": 0.91015625, "learning_rate": 0.000499876649156956, "loss": 6.027, "mean_token_accuracy": 0.13578148186206818, "num_tokens": 4142370.0, "step": 2245 }, { "entropy": 6.224829864501953, "epoch": 0.1890359168241966, "grad_norm": 0.93359375, "learning_rate": 0.0004998756556895196, "loss": 6.1118, "mean_token_accuracy": 0.13433386385440826, "num_tokens": 4152367.0, "step": 2250 }, { "entropy": 6.281910085678101, "epoch": 0.18945599663936147, "grad_norm": 0.96875, "learning_rate": 0.000499874658238527, "loss": 6.0938, "mean_token_accuracy": 0.134437657892704, "num_tokens": 4161126.0, "step": 2255 }, { "entropy": 6.240273094177246, "epoch": 0.18987607645452637, "grad_norm": 0.98046875, "learning_rate": 0.0004998736568039957, "loss": 5.9943, "mean_token_accuracy": 0.13461074903607367, "num_tokens": 4169910.0, "step": 2260 }, { "entropy": 6.2365155696868895, "epoch": 0.19029615626969124, "grad_norm": 0.96484375, "learning_rate": 0.0004998726513859432, "loss": 6.1408, "mean_token_accuracy": 0.1260552354156971, "num_tokens": 4179893.0, "step": 2265 }, { "entropy": 6.301045608520508, "epoch": 0.19071623608485613, "grad_norm": 0.890625, "learning_rate": 0.0004998716419843875, "loss": 6.1429, "mean_token_accuracy": 0.13841021955013275, "num_tokens": 4190065.0, "step": 2270 }, { "entropy": 6.13691897392273, "epoch": 0.191136315900021, "grad_norm": 1.0625, "learning_rate": 0.0004998706285993465, "loss": 6.0687, "mean_token_accuracy": 0.13612305223941804, "num_tokens": 4198395.0, "step": 2275 }, { "entropy": 6.308142518997192, "epoch": 0.19155639571518587, "grad_norm": 0.91015625, "learning_rate": 0.0004998696112308381, "loss": 6.069, "mean_token_accuracy": 0.13221055194735526, "num_tokens": 4207555.0, "step": 2280 }, { "entropy": 6.1573583602905275, "epoch": 0.19197647553035077, "grad_norm": 0.90625, "learning_rate": 0.0004998685898788803, "loss": 6.0272, "mean_token_accuracy": 0.13469478338956833, "num_tokens": 4216533.0, "step": 2285 }, { "entropy": 6.334969472885132, "epoch": 0.19239655534551564, "grad_norm": 1.0, "learning_rate": 0.0004998675645434914, "loss": 6.1333, "mean_token_accuracy": 0.134019573032856, "num_tokens": 4225575.0, "step": 2290 }, { "entropy": 6.167663669586181, "epoch": 0.19281663516068054, "grad_norm": 0.9765625, "learning_rate": 0.0004998665352246891, "loss": 5.9307, "mean_token_accuracy": 0.14072284027934073, "num_tokens": 4234306.0, "step": 2295 }, { "entropy": 6.1863524436950685, "epoch": 0.1932367149758454, "grad_norm": 0.91015625, "learning_rate": 0.0004998655019224921, "loss": 6.1102, "mean_token_accuracy": 0.13416126370429993, "num_tokens": 4243998.0, "step": 2300 }, { "entropy": 6.274348163604737, "epoch": 0.19365679479101028, "grad_norm": 0.91796875, "learning_rate": 0.0004998644646369185, "loss": 6.0024, "mean_token_accuracy": 0.13099471628665924, "num_tokens": 4253653.0, "step": 2305 }, { "entropy": 6.157945919036865, "epoch": 0.19407687460617518, "grad_norm": 0.953125, "learning_rate": 0.0004998634233679865, "loss": 6.0922, "mean_token_accuracy": 0.12541876286268233, "num_tokens": 4263305.0, "step": 2310 }, { "entropy": 6.220145130157471, "epoch": 0.19449695442134005, "grad_norm": 0.9765625, "learning_rate": 0.000499862378115715, "loss": 5.9623, "mean_token_accuracy": 0.13993363454937935, "num_tokens": 4272212.0, "step": 2315 }, { "entropy": 6.2961366176605225, "epoch": 0.19491703423650494, "grad_norm": 1.0078125, "learning_rate": 0.0004998613288801221, "loss": 6.1759, "mean_token_accuracy": 0.12927026972174643, "num_tokens": 4281445.0, "step": 2320 }, { "entropy": 6.306110906600952, "epoch": 0.1953371140516698, "grad_norm": 0.9375, "learning_rate": 0.0004998602756612267, "loss": 6.0867, "mean_token_accuracy": 0.13294345438480376, "num_tokens": 4290938.0, "step": 2325 }, { "entropy": 6.204567623138428, "epoch": 0.1957571938668347, "grad_norm": 0.9453125, "learning_rate": 0.0004998592184590471, "loss": 6.1218, "mean_token_accuracy": 0.13037385493516923, "num_tokens": 4300022.0, "step": 2330 }, { "entropy": 6.182180976867675, "epoch": 0.19617727368199958, "grad_norm": 0.9765625, "learning_rate": 0.0004998581572736024, "loss": 6.0055, "mean_token_accuracy": 0.13552708327770233, "num_tokens": 4308910.0, "step": 2335 }, { "entropy": 6.136313104629517, "epoch": 0.19659735349716445, "grad_norm": 0.94140625, "learning_rate": 0.0004998570921049112, "loss": 5.982, "mean_token_accuracy": 0.1380659468472004, "num_tokens": 4317136.0, "step": 2340 }, { "entropy": 6.223579549789429, "epoch": 0.19701743331232935, "grad_norm": 0.98828125, "learning_rate": 0.0004998560229529924, "loss": 6.0392, "mean_token_accuracy": 0.1369388960301876, "num_tokens": 4326163.0, "step": 2345 }, { "entropy": 6.337650966644287, "epoch": 0.19743751312749422, "grad_norm": 0.93359375, "learning_rate": 0.0004998549498178649, "loss": 6.1756, "mean_token_accuracy": 0.1331799015402794, "num_tokens": 4335837.0, "step": 2350 }, { "entropy": 6.207294178009033, "epoch": 0.19785759294265912, "grad_norm": 1.078125, "learning_rate": 0.0004998538726995477, "loss": 6.096, "mean_token_accuracy": 0.13218674436211586, "num_tokens": 4345108.0, "step": 2355 }, { "entropy": 6.251865100860596, "epoch": 0.198277672757824, "grad_norm": 0.93359375, "learning_rate": 0.00049985279159806, "loss": 6.1203, "mean_token_accuracy": 0.13030959963798522, "num_tokens": 4353761.0, "step": 2360 }, { "entropy": 6.238997983932495, "epoch": 0.19869775257298886, "grad_norm": 0.95703125, "learning_rate": 0.0004998517065134208, "loss": 6.0679, "mean_token_accuracy": 0.1309155412018299, "num_tokens": 4363244.0, "step": 2365 }, { "entropy": 6.240653324127197, "epoch": 0.19911783238815375, "grad_norm": 0.87890625, "learning_rate": 0.0004998506174456494, "loss": 6.0563, "mean_token_accuracy": 0.13212330862879754, "num_tokens": 4373034.0, "step": 2370 }, { "entropy": 6.222096681594849, "epoch": 0.19953791220331862, "grad_norm": 0.875, "learning_rate": 0.0004998495243947653, "loss": 6.0012, "mean_token_accuracy": 0.12821247354149817, "num_tokens": 4382554.0, "step": 2375 }, { "entropy": 6.245941638946533, "epoch": 0.19995799201848352, "grad_norm": 1.03125, "learning_rate": 0.0004998484273607875, "loss": 6.0093, "mean_token_accuracy": 0.1390307828783989, "num_tokens": 4391001.0, "step": 2380 }, { "entropy": 6.051425838470459, "epoch": 0.2003780718336484, "grad_norm": 0.87890625, "learning_rate": 0.0004998473263437356, "loss": 5.9437, "mean_token_accuracy": 0.13520744293928147, "num_tokens": 4400632.0, "step": 2385 }, { "entropy": 6.14297890663147, "epoch": 0.20079815164881326, "grad_norm": 0.921875, "learning_rate": 0.000499846221343629, "loss": 6.0297, "mean_token_accuracy": 0.13219423592090607, "num_tokens": 4409565.0, "step": 2390 }, { "entropy": 6.155060577392578, "epoch": 0.20121823146397816, "grad_norm": 0.96484375, "learning_rate": 0.0004998451123604875, "loss": 5.9866, "mean_token_accuracy": 0.14023150131106377, "num_tokens": 4418384.0, "step": 2395 }, { "entropy": 6.256305456161499, "epoch": 0.20163831127914303, "grad_norm": 0.98828125, "learning_rate": 0.0004998439993943306, "loss": 6.1021, "mean_token_accuracy": 0.1406387820839882, "num_tokens": 4427581.0, "step": 2400 }, { "entropy": 6.275782299041748, "epoch": 0.20205839109430793, "grad_norm": 0.96484375, "learning_rate": 0.0004998428824451779, "loss": 6.0884, "mean_token_accuracy": 0.12875301465392114, "num_tokens": 4436572.0, "step": 2405 }, { "entropy": 6.213010787963867, "epoch": 0.2024784709094728, "grad_norm": 0.97265625, "learning_rate": 0.0004998417615130495, "loss": 6.0989, "mean_token_accuracy": 0.12865509316325188, "num_tokens": 4445230.0, "step": 2410 }, { "entropy": 6.289054584503174, "epoch": 0.2028985507246377, "grad_norm": 0.99609375, "learning_rate": 0.0004998406365979649, "loss": 6.166, "mean_token_accuracy": 0.13029074743390084, "num_tokens": 4454251.0, "step": 2415 }, { "entropy": 6.1775250911712645, "epoch": 0.20331863053980256, "grad_norm": 0.9296875, "learning_rate": 0.0004998395076999443, "loss": 5.9922, "mean_token_accuracy": 0.13723801597952842, "num_tokens": 4463949.0, "step": 2420 }, { "entropy": 6.2511374950408936, "epoch": 0.20373871035496743, "grad_norm": 0.9609375, "learning_rate": 0.0004998383748190076, "loss": 6.2021, "mean_token_accuracy": 0.1281643107533455, "num_tokens": 4473373.0, "step": 2425 }, { "entropy": 6.318125200271607, "epoch": 0.20415879017013233, "grad_norm": 0.9921875, "learning_rate": 0.0004998372379551748, "loss": 6.0174, "mean_token_accuracy": 0.13771012797951698, "num_tokens": 4482303.0, "step": 2430 }, { "entropy": 6.15513801574707, "epoch": 0.2045788699852972, "grad_norm": 0.94140625, "learning_rate": 0.0004998360971084663, "loss": 5.9882, "mean_token_accuracy": 0.1334059588611126, "num_tokens": 4491214.0, "step": 2435 }, { "entropy": 6.118799161911011, "epoch": 0.2049989498004621, "grad_norm": 0.9453125, "learning_rate": 0.0004998349522789019, "loss": 5.9164, "mean_token_accuracy": 0.14181319028139114, "num_tokens": 4500099.0, "step": 2440 }, { "entropy": 6.1538893699646, "epoch": 0.20541902961562697, "grad_norm": 0.94140625, "learning_rate": 0.0004998338034665021, "loss": 5.9967, "mean_token_accuracy": 0.13947194814682007, "num_tokens": 4509893.0, "step": 2445 }, { "entropy": 6.1470013618469235, "epoch": 0.20583910943079184, "grad_norm": 0.96875, "learning_rate": 0.0004998326506712872, "loss": 5.9665, "mean_token_accuracy": 0.1369723781943321, "num_tokens": 4518606.0, "step": 2450 }, { "entropy": 6.206533908843994, "epoch": 0.20625918924595674, "grad_norm": 0.97265625, "learning_rate": 0.0004998314938932778, "loss": 6.0509, "mean_token_accuracy": 0.1360008053481579, "num_tokens": 4528392.0, "step": 2455 }, { "entropy": 6.256601238250733, "epoch": 0.2066792690611216, "grad_norm": 0.98046875, "learning_rate": 0.0004998303331324943, "loss": 6.0235, "mean_token_accuracy": 0.13803394809365271, "num_tokens": 4536983.0, "step": 2460 }, { "entropy": 6.104164505004883, "epoch": 0.2070993488762865, "grad_norm": 0.94921875, "learning_rate": 0.0004998291683889571, "loss": 5.9373, "mean_token_accuracy": 0.14096372500061988, "num_tokens": 4544967.0, "step": 2465 }, { "entropy": 6.204864883422852, "epoch": 0.20751942869145137, "grad_norm": 1.0, "learning_rate": 0.000499827999662687, "loss": 6.001, "mean_token_accuracy": 0.13221748918294907, "num_tokens": 4554646.0, "step": 2470 }, { "entropy": 6.243742561340332, "epoch": 0.20793950850661624, "grad_norm": 0.90234375, "learning_rate": 0.0004998268269537046, "loss": 6.0222, "mean_token_accuracy": 0.13807824179530143, "num_tokens": 4564040.0, "step": 2475 }, { "entropy": 6.120432043075562, "epoch": 0.20835958832178114, "grad_norm": 0.953125, "learning_rate": 0.0004998256502620308, "loss": 6.0382, "mean_token_accuracy": 0.14363139793276786, "num_tokens": 4573758.0, "step": 2480 }, { "entropy": 6.265066432952881, "epoch": 0.208779668136946, "grad_norm": 0.9296875, "learning_rate": 0.0004998244695876864, "loss": 6.0777, "mean_token_accuracy": 0.1315403826534748, "num_tokens": 4582097.0, "step": 2485 }, { "entropy": 6.097950839996338, "epoch": 0.2091997479521109, "grad_norm": 0.9921875, "learning_rate": 0.0004998232849306921, "loss": 6.0435, "mean_token_accuracy": 0.1351850524544716, "num_tokens": 4590687.0, "step": 2490 }, { "entropy": 6.293486022949219, "epoch": 0.20961982776727578, "grad_norm": 0.94921875, "learning_rate": 0.0004998220962910693, "loss": 6.0235, "mean_token_accuracy": 0.13292664289474487, "num_tokens": 4599497.0, "step": 2495 }, { "entropy": 6.173567104339599, "epoch": 0.21003990758244068, "grad_norm": 1.0234375, "learning_rate": 0.0004998209036688386, "loss": 5.9939, "mean_token_accuracy": 0.13765107467770576, "num_tokens": 4607958.0, "step": 2500 }, { "entropy": 6.268425703048706, "epoch": 0.21045998739760555, "grad_norm": 0.94140625, "learning_rate": 0.0004998197070640216, "loss": 6.1098, "mean_token_accuracy": 0.129291183501482, "num_tokens": 4617515.0, "step": 2505 }, { "entropy": 6.28843879699707, "epoch": 0.21088006721277042, "grad_norm": 0.9609375, "learning_rate": 0.0004998185064766391, "loss": 6.0059, "mean_token_accuracy": 0.1318512476980686, "num_tokens": 4627037.0, "step": 2510 }, { "entropy": 6.095378351211548, "epoch": 0.21130014702793531, "grad_norm": 0.94140625, "learning_rate": 0.0004998173019067127, "loss": 6.0089, "mean_token_accuracy": 0.1362810969352722, "num_tokens": 4637393.0, "step": 2515 }, { "entropy": 6.151039409637451, "epoch": 0.21172022684310018, "grad_norm": 0.95703125, "learning_rate": 0.0004998160933542633, "loss": 6.0518, "mean_token_accuracy": 0.12635309770703315, "num_tokens": 4646832.0, "step": 2520 }, { "entropy": 6.288768529891968, "epoch": 0.21214030665826508, "grad_norm": 1.046875, "learning_rate": 0.0004998148808193128, "loss": 6.0821, "mean_token_accuracy": 0.13684087693691255, "num_tokens": 4655719.0, "step": 2525 }, { "entropy": 6.185772228240967, "epoch": 0.21256038647342995, "grad_norm": 0.9296875, "learning_rate": 0.0004998136643018823, "loss": 6.0231, "mean_token_accuracy": 0.13462624847888946, "num_tokens": 4665364.0, "step": 2530 }, { "entropy": 6.2163975715637205, "epoch": 0.21298046628859482, "grad_norm": 1.015625, "learning_rate": 0.0004998124438019935, "loss": 6.0079, "mean_token_accuracy": 0.13166589960455893, "num_tokens": 4674760.0, "step": 2535 }, { "entropy": 6.0905904293060305, "epoch": 0.21340054610375972, "grad_norm": 0.9140625, "learning_rate": 0.0004998112193196681, "loss": 5.9166, "mean_token_accuracy": 0.13693561255931855, "num_tokens": 4683900.0, "step": 2540 }, { "entropy": 6.067295026779175, "epoch": 0.2138206259189246, "grad_norm": 0.96875, "learning_rate": 0.0004998099908549277, "loss": 5.9706, "mean_token_accuracy": 0.13006317764520645, "num_tokens": 4693915.0, "step": 2545 }, { "entropy": 6.123124837875366, "epoch": 0.2142407057340895, "grad_norm": 0.93359375, "learning_rate": 0.000499808758407794, "loss": 5.8413, "mean_token_accuracy": 0.1404764860868454, "num_tokens": 4703102.0, "step": 2550 }, { "entropy": 6.155497789382935, "epoch": 0.21466078554925436, "grad_norm": 0.90625, "learning_rate": 0.0004998075219782889, "loss": 6.0483, "mean_token_accuracy": 0.13892892748117447, "num_tokens": 4712925.0, "step": 2555 }, { "entropy": 6.1989946365356445, "epoch": 0.21508086536441923, "grad_norm": 1.0, "learning_rate": 0.0004998062815664344, "loss": 5.9819, "mean_token_accuracy": 0.13216783180832864, "num_tokens": 4722641.0, "step": 2560 }, { "entropy": 6.098575496673584, "epoch": 0.21550094517958412, "grad_norm": 0.9296875, "learning_rate": 0.0004998050371722524, "loss": 6.0475, "mean_token_accuracy": 0.13535310626029967, "num_tokens": 4732603.0, "step": 2565 }, { "entropy": 6.0733263969421385, "epoch": 0.215921024994749, "grad_norm": 0.859375, "learning_rate": 0.0004998037887957649, "loss": 5.8768, "mean_token_accuracy": 0.1405107393860817, "num_tokens": 4742644.0, "step": 2570 }, { "entropy": 6.274937391281128, "epoch": 0.2163411048099139, "grad_norm": 0.94921875, "learning_rate": 0.0004998025364369939, "loss": 6.2137, "mean_token_accuracy": 0.13099505975842476, "num_tokens": 4751482.0, "step": 2575 }, { "entropy": 6.293144750595093, "epoch": 0.21676118462507876, "grad_norm": 1.0, "learning_rate": 0.0004998012800959619, "loss": 6.0839, "mean_token_accuracy": 0.13207904621958733, "num_tokens": 4760593.0, "step": 2580 }, { "entropy": 6.261121511459351, "epoch": 0.21718126444024366, "grad_norm": 0.98046875, "learning_rate": 0.0004998000197726909, "loss": 6.0643, "mean_token_accuracy": 0.13794807344675064, "num_tokens": 4769294.0, "step": 2585 }, { "entropy": 6.1975377082824705, "epoch": 0.21760134425540853, "grad_norm": 0.83984375, "learning_rate": 0.0004997987554672033, "loss": 5.9825, "mean_token_accuracy": 0.13557377234101295, "num_tokens": 4779239.0, "step": 2590 }, { "entropy": 6.179704809188843, "epoch": 0.2180214240705734, "grad_norm": 0.89453125, "learning_rate": 0.0004997974871795215, "loss": 6.0438, "mean_token_accuracy": 0.13279528692364692, "num_tokens": 4788211.0, "step": 2595 }, { "entropy": 6.169263744354248, "epoch": 0.2184415038857383, "grad_norm": 0.8828125, "learning_rate": 0.000499796214909668, "loss": 6.0046, "mean_token_accuracy": 0.14151790514588355, "num_tokens": 4797921.0, "step": 2600 }, { "entropy": 6.179717254638672, "epoch": 0.21886158370090317, "grad_norm": 0.9453125, "learning_rate": 0.0004997949386576653, "loss": 6.021, "mean_token_accuracy": 0.13185311183333398, "num_tokens": 4807772.0, "step": 2605 }, { "entropy": 6.09913649559021, "epoch": 0.21928166351606806, "grad_norm": 0.89453125, "learning_rate": 0.000499793658423536, "loss": 6.0302, "mean_token_accuracy": 0.1336025021970272, "num_tokens": 4817999.0, "step": 2610 }, { "entropy": 6.236963701248169, "epoch": 0.21970174333123293, "grad_norm": 1.0078125, "learning_rate": 0.0004997923742073028, "loss": 5.9808, "mean_token_accuracy": 0.14284878820180893, "num_tokens": 4826679.0, "step": 2615 }, { "entropy": 6.087517356872558, "epoch": 0.2201218231463978, "grad_norm": 0.98828125, "learning_rate": 0.0004997910860089884, "loss": 5.9814, "mean_token_accuracy": 0.13721209689974784, "num_tokens": 4834998.0, "step": 2620 }, { "entropy": 6.181451654434204, "epoch": 0.2205419029615627, "grad_norm": 0.9609375, "learning_rate": 0.0004997897938286156, "loss": 5.9418, "mean_token_accuracy": 0.140488101541996, "num_tokens": 4843635.0, "step": 2625 }, { "entropy": 6.164580821990967, "epoch": 0.22096198277672757, "grad_norm": 1.0390625, "learning_rate": 0.0004997884976662075, "loss": 6.0616, "mean_token_accuracy": 0.13446614518761635, "num_tokens": 4852027.0, "step": 2630 }, { "entropy": 6.231269407272339, "epoch": 0.22138206259189247, "grad_norm": 0.98828125, "learning_rate": 0.0004997871975217868, "loss": 5.9769, "mean_token_accuracy": 0.14198934510350228, "num_tokens": 4861244.0, "step": 2635 }, { "entropy": 6.045923233032227, "epoch": 0.22180214240705734, "grad_norm": 0.92578125, "learning_rate": 0.0004997858933953768, "loss": 5.8995, "mean_token_accuracy": 0.14127301722764968, "num_tokens": 4869902.0, "step": 2640 }, { "entropy": 6.087070560455322, "epoch": 0.2222222222222222, "grad_norm": 0.91796875, "learning_rate": 0.0004997845852870004, "loss": 5.879, "mean_token_accuracy": 0.14420521035790443, "num_tokens": 4878502.0, "step": 2645 }, { "entropy": 6.088281726837158, "epoch": 0.2226423020373871, "grad_norm": 0.9609375, "learning_rate": 0.0004997832731966806, "loss": 5.9405, "mean_token_accuracy": 0.14226024821400643, "num_tokens": 4888348.0, "step": 2650 }, { "entropy": 6.156372451782227, "epoch": 0.22306238185255198, "grad_norm": 1.0078125, "learning_rate": 0.0004997819571244411, "loss": 5.9976, "mean_token_accuracy": 0.14085667207837105, "num_tokens": 4897302.0, "step": 2655 }, { "entropy": 6.102771759033203, "epoch": 0.22348246166771688, "grad_norm": 0.9296875, "learning_rate": 0.0004997806370703049, "loss": 6.0167, "mean_token_accuracy": 0.1412481315433979, "num_tokens": 4907078.0, "step": 2660 }, { "entropy": 6.086454391479492, "epoch": 0.22390254148288175, "grad_norm": 0.84765625, "learning_rate": 0.0004997793130342954, "loss": 5.8462, "mean_token_accuracy": 0.14060726314783095, "num_tokens": 4917489.0, "step": 2665 }, { "entropy": 6.059194183349609, "epoch": 0.22432262129804661, "grad_norm": 0.9453125, "learning_rate": 0.0004997779850164363, "loss": 5.9408, "mean_token_accuracy": 0.13854166269302368, "num_tokens": 4927073.0, "step": 2670 }, { "entropy": 6.217087936401367, "epoch": 0.2247427011132115, "grad_norm": 0.97265625, "learning_rate": 0.0004997766530167508, "loss": 6.0634, "mean_token_accuracy": 0.13044301494956018, "num_tokens": 4935464.0, "step": 2675 }, { "entropy": 6.28878345489502, "epoch": 0.22516278092837638, "grad_norm": 0.984375, "learning_rate": 0.0004997753170352627, "loss": 6.1414, "mean_token_accuracy": 0.13435352668166162, "num_tokens": 4944718.0, "step": 2680 }, { "entropy": 6.156159353256226, "epoch": 0.22558286074354128, "grad_norm": 0.98046875, "learning_rate": 0.0004997739770719955, "loss": 6.0181, "mean_token_accuracy": 0.13306965455412864, "num_tokens": 4954223.0, "step": 2685 }, { "entropy": 6.152837419509888, "epoch": 0.22600294055870615, "grad_norm": 0.921875, "learning_rate": 0.000499772633126973, "loss": 6.0448, "mean_token_accuracy": 0.13488989993929862, "num_tokens": 4963371.0, "step": 2690 }, { "entropy": 6.077383518218994, "epoch": 0.22642302037387105, "grad_norm": 0.97265625, "learning_rate": 0.0004997712852002192, "loss": 5.8942, "mean_token_accuracy": 0.14509259015321732, "num_tokens": 4972973.0, "step": 2695 }, { "entropy": 6.145831155776977, "epoch": 0.22684310018903592, "grad_norm": 1.0234375, "learning_rate": 0.0004997699332917578, "loss": 6.1551, "mean_token_accuracy": 0.12881803661584854, "num_tokens": 4982808.0, "step": 2700 }, { "entropy": 6.264477157592774, "epoch": 0.2272631800042008, "grad_norm": 0.90234375, "learning_rate": 0.0004997685774016127, "loss": 6.0218, "mean_token_accuracy": 0.13483983278274536, "num_tokens": 4992427.0, "step": 2705 }, { "entropy": 6.240380764007568, "epoch": 0.22768325981936569, "grad_norm": 0.87109375, "learning_rate": 0.000499767217529808, "loss": 6.1836, "mean_token_accuracy": 0.1287289910018444, "num_tokens": 5003562.0, "step": 2710 }, { "entropy": 6.103500318527222, "epoch": 0.22810333963453056, "grad_norm": 0.87109375, "learning_rate": 0.0004997658536763678, "loss": 5.9025, "mean_token_accuracy": 0.13835748061537742, "num_tokens": 5013429.0, "step": 2715 }, { "entropy": 6.204726886749268, "epoch": 0.22852341944969545, "grad_norm": 0.9140625, "learning_rate": 0.0004997644858413163, "loss": 6.0337, "mean_token_accuracy": 0.13989441394805907, "num_tokens": 5022045.0, "step": 2720 }, { "entropy": 6.083020782470703, "epoch": 0.22894349926486032, "grad_norm": 0.85546875, "learning_rate": 0.0004997631140246775, "loss": 5.8567, "mean_token_accuracy": 0.14418582767248153, "num_tokens": 5032260.0, "step": 2725 }, { "entropy": 6.0916870594024655, "epoch": 0.2293635790800252, "grad_norm": 0.9609375, "learning_rate": 0.000499761738226476, "loss": 5.9035, "mean_token_accuracy": 0.1432834282517433, "num_tokens": 5041688.0, "step": 2730 }, { "entropy": 6.093435859680175, "epoch": 0.2297836588951901, "grad_norm": 0.99609375, "learning_rate": 0.000499760358446736, "loss": 6.0111, "mean_token_accuracy": 0.13241263329982758, "num_tokens": 5051005.0, "step": 2735 }, { "entropy": 6.205419874191284, "epoch": 0.23020373871035496, "grad_norm": 0.9296875, "learning_rate": 0.000499758974685482, "loss": 5.9348, "mean_token_accuracy": 0.13710809499025345, "num_tokens": 5060084.0, "step": 2740 }, { "entropy": 6.123983669281006, "epoch": 0.23062381852551986, "grad_norm": 1.015625, "learning_rate": 0.0004997575869427385, "loss": 5.948, "mean_token_accuracy": 0.14109890162944794, "num_tokens": 5069081.0, "step": 2745 }, { "entropy": 6.1220703125, "epoch": 0.23104389834068473, "grad_norm": 0.921875, "learning_rate": 0.00049975619521853, "loss": 5.9356, "mean_token_accuracy": 0.13786115869879723, "num_tokens": 5078597.0, "step": 2750 }, { "entropy": 6.122048711776733, "epoch": 0.2314639781558496, "grad_norm": 0.96484375, "learning_rate": 0.0004997547995128814, "loss": 5.9968, "mean_token_accuracy": 0.14226307570934296, "num_tokens": 5087607.0, "step": 2755 }, { "entropy": 6.144302225112915, "epoch": 0.2318840579710145, "grad_norm": 0.984375, "learning_rate": 0.0004997533998258171, "loss": 5.9821, "mean_token_accuracy": 0.14107478111982347, "num_tokens": 5097412.0, "step": 2760 }, { "entropy": 6.224723386764526, "epoch": 0.23230413778617937, "grad_norm": 0.9921875, "learning_rate": 0.0004997519961573622, "loss": 6.053, "mean_token_accuracy": 0.13255186080932618, "num_tokens": 5105817.0, "step": 2765 }, { "entropy": 6.279865074157715, "epoch": 0.23272421760134426, "grad_norm": 1.0390625, "learning_rate": 0.0004997505885075414, "loss": 6.0941, "mean_token_accuracy": 0.13345747739076613, "num_tokens": 5114958.0, "step": 2770 }, { "entropy": 6.129254007339478, "epoch": 0.23314429741650913, "grad_norm": 0.9453125, "learning_rate": 0.0004997491768763795, "loss": 6.0302, "mean_token_accuracy": 0.13575156703591346, "num_tokens": 5123728.0, "step": 2775 }, { "entropy": 6.134473133087158, "epoch": 0.23356437723167403, "grad_norm": 0.97265625, "learning_rate": 0.0004997477612639018, "loss": 6.0582, "mean_token_accuracy": 0.13159941956400872, "num_tokens": 5134099.0, "step": 2780 }, { "entropy": 6.231441497802734, "epoch": 0.2339844570468389, "grad_norm": 1.0, "learning_rate": 0.0004997463416701332, "loss": 6.0689, "mean_token_accuracy": 0.1301489420235157, "num_tokens": 5142934.0, "step": 2785 }, { "entropy": 6.0879510879516605, "epoch": 0.23440453686200377, "grad_norm": 0.9921875, "learning_rate": 0.0004997449180950989, "loss": 5.8957, "mean_token_accuracy": 0.15564696341753007, "num_tokens": 5151835.0, "step": 2790 }, { "entropy": 6.114243698120117, "epoch": 0.23482461667716867, "grad_norm": 0.89453125, "learning_rate": 0.0004997434905388241, "loss": 5.9528, "mean_token_accuracy": 0.14443679004907609, "num_tokens": 5161136.0, "step": 2795 }, { "entropy": 6.104035425186157, "epoch": 0.23524469649233354, "grad_norm": 0.90234375, "learning_rate": 0.000499742059001334, "loss": 5.8911, "mean_token_accuracy": 0.14185608699917793, "num_tokens": 5170741.0, "step": 2800 }, { "entropy": 6.075469923019409, "epoch": 0.23566477630749844, "grad_norm": 0.95703125, "learning_rate": 0.0004997406234826541, "loss": 5.9262, "mean_token_accuracy": 0.14401806518435478, "num_tokens": 5180549.0, "step": 2805 }, { "entropy": 6.064437532424927, "epoch": 0.2360848561226633, "grad_norm": 0.84765625, "learning_rate": 0.0004997391839828098, "loss": 5.8936, "mean_token_accuracy": 0.14641853421926498, "num_tokens": 5189486.0, "step": 2810 }, { "entropy": 6.1467596054077145, "epoch": 0.23650493593782818, "grad_norm": 0.93359375, "learning_rate": 0.0004997377405018266, "loss": 5.9515, "mean_token_accuracy": 0.1352544255554676, "num_tokens": 5198525.0, "step": 2815 }, { "entropy": 6.114045858383179, "epoch": 0.23692501575299307, "grad_norm": 0.94921875, "learning_rate": 0.00049973629303973, "loss": 6.0104, "mean_token_accuracy": 0.13799095004796982, "num_tokens": 5207124.0, "step": 2820 }, { "entropy": 6.020995473861694, "epoch": 0.23734509556815794, "grad_norm": 0.859375, "learning_rate": 0.0004997348415965457, "loss": 5.8289, "mean_token_accuracy": 0.14437564313411713, "num_tokens": 5216529.0, "step": 2825 }, { "entropy": 6.182903099060058, "epoch": 0.23776517538332284, "grad_norm": 0.984375, "learning_rate": 0.0004997333861722995, "loss": 5.9792, "mean_token_accuracy": 0.14223513826727868, "num_tokens": 5225796.0, "step": 2830 }, { "entropy": 6.194612598419189, "epoch": 0.2381852551984877, "grad_norm": 1.03125, "learning_rate": 0.000499731926767017, "loss": 5.9941, "mean_token_accuracy": 0.14215042740106582, "num_tokens": 5233876.0, "step": 2835 }, { "entropy": 6.092140197753906, "epoch": 0.23860533501365258, "grad_norm": 0.88671875, "learning_rate": 0.0004997304633807242, "loss": 5.9958, "mean_token_accuracy": 0.13835923075675965, "num_tokens": 5244782.0, "step": 2840 }, { "entropy": 6.103197765350342, "epoch": 0.23902541482881748, "grad_norm": 0.98046875, "learning_rate": 0.0004997289960134468, "loss": 5.9434, "mean_token_accuracy": 0.14274498224258422, "num_tokens": 5253453.0, "step": 2845 }, { "entropy": 6.109802532196045, "epoch": 0.23944549464398235, "grad_norm": 1.0078125, "learning_rate": 0.0004997275246652111, "loss": 5.9697, "mean_token_accuracy": 0.1414198510348797, "num_tokens": 5262355.0, "step": 2850 }, { "entropy": 6.074161100387573, "epoch": 0.23986557445914725, "grad_norm": 0.98046875, "learning_rate": 0.000499726049336043, "loss": 5.884, "mean_token_accuracy": 0.14384180679917336, "num_tokens": 5271959.0, "step": 2855 }, { "entropy": 6.123191499710083, "epoch": 0.24028565427431212, "grad_norm": 1.0, "learning_rate": 0.0004997245700259686, "loss": 5.9216, "mean_token_accuracy": 0.14565154165029526, "num_tokens": 5281393.0, "step": 2860 }, { "entropy": 6.1445637226104735, "epoch": 0.240705734089477, "grad_norm": 0.90234375, "learning_rate": 0.0004997230867350141, "loss": 6.0674, "mean_token_accuracy": 0.13226635977625847, "num_tokens": 5290979.0, "step": 2865 }, { "entropy": 6.2341917037963865, "epoch": 0.24112581390464188, "grad_norm": 0.921875, "learning_rate": 0.0004997215994632059, "loss": 6.0149, "mean_token_accuracy": 0.14298992082476616, "num_tokens": 5300263.0, "step": 2870 }, { "entropy": 6.114161205291748, "epoch": 0.24154589371980675, "grad_norm": 0.91015625, "learning_rate": 0.0004997201082105704, "loss": 6.0298, "mean_token_accuracy": 0.13639863729476928, "num_tokens": 5309522.0, "step": 2875 }, { "entropy": 6.144821310043335, "epoch": 0.24196597353497165, "grad_norm": 0.9375, "learning_rate": 0.0004997186129771338, "loss": 6.0256, "mean_token_accuracy": 0.1396084174513817, "num_tokens": 5319770.0, "step": 2880 }, { "entropy": 6.21076397895813, "epoch": 0.24238605335013652, "grad_norm": 0.98046875, "learning_rate": 0.0004997171137629226, "loss": 6.0217, "mean_token_accuracy": 0.1428602673113346, "num_tokens": 5328400.0, "step": 2885 }, { "entropy": 6.059879302978516, "epoch": 0.24280613316530142, "grad_norm": 1.0078125, "learning_rate": 0.0004997156105679636, "loss": 5.8456, "mean_token_accuracy": 0.1514780417084694, "num_tokens": 5336338.0, "step": 2890 }, { "entropy": 6.016794109344483, "epoch": 0.2432262129804663, "grad_norm": 0.953125, "learning_rate": 0.0004997141033922832, "loss": 5.927, "mean_token_accuracy": 0.13949262946844102, "num_tokens": 5345391.0, "step": 2895 }, { "entropy": 6.142647981643677, "epoch": 0.24364629279563116, "grad_norm": 0.9765625, "learning_rate": 0.0004997125922359081, "loss": 5.9624, "mean_token_accuracy": 0.13398301377892494, "num_tokens": 5354709.0, "step": 2900 }, { "entropy": 6.111950016021728, "epoch": 0.24406637261079606, "grad_norm": 0.97265625, "learning_rate": 0.0004997110770988652, "loss": 5.8818, "mean_token_accuracy": 0.14174696654081345, "num_tokens": 5363738.0, "step": 2905 }, { "entropy": 6.079838371276855, "epoch": 0.24448645242596093, "grad_norm": 1.078125, "learning_rate": 0.0004997095579811813, "loss": 6.0081, "mean_token_accuracy": 0.13893039748072625, "num_tokens": 5373583.0, "step": 2910 }, { "entropy": 6.187237548828125, "epoch": 0.24490653224112582, "grad_norm": 0.859375, "learning_rate": 0.0004997080348828833, "loss": 6.0554, "mean_token_accuracy": 0.13840119615197183, "num_tokens": 5383486.0, "step": 2915 }, { "entropy": 6.126826524734497, "epoch": 0.2453266120562907, "grad_norm": 1.015625, "learning_rate": 0.0004997065078039981, "loss": 5.9624, "mean_token_accuracy": 0.1391638047993183, "num_tokens": 5391974.0, "step": 2920 }, { "entropy": 6.164314794540405, "epoch": 0.24574669187145556, "grad_norm": 1.0078125, "learning_rate": 0.0004997049767445529, "loss": 5.999, "mean_token_accuracy": 0.1359800137579441, "num_tokens": 5400882.0, "step": 2925 }, { "entropy": 6.199448156356811, "epoch": 0.24616677168662046, "grad_norm": 0.96484375, "learning_rate": 0.0004997034417045746, "loss": 5.9647, "mean_token_accuracy": 0.13757251799106598, "num_tokens": 5410538.0, "step": 2930 }, { "entropy": 6.0790434837341305, "epoch": 0.24658685150178533, "grad_norm": 0.98828125, "learning_rate": 0.0004997019026840907, "loss": 5.846, "mean_token_accuracy": 0.14040058851242065, "num_tokens": 5419406.0, "step": 2935 }, { "entropy": 5.975088357925415, "epoch": 0.24700693131695023, "grad_norm": 0.96875, "learning_rate": 0.0004997003596831282, "loss": 5.9572, "mean_token_accuracy": 0.1371507503092289, "num_tokens": 5428817.0, "step": 2940 }, { "entropy": 6.196776390075684, "epoch": 0.2474270111321151, "grad_norm": 0.94140625, "learning_rate": 0.0004996988127017145, "loss": 5.9872, "mean_token_accuracy": 0.13953725397586822, "num_tokens": 5438277.0, "step": 2945 }, { "entropy": 6.091228246688843, "epoch": 0.24784709094728, "grad_norm": 1.0078125, "learning_rate": 0.0004996972617398772, "loss": 6.0034, "mean_token_accuracy": 0.13882646411657334, "num_tokens": 5447440.0, "step": 2950 }, { "entropy": 6.129848289489746, "epoch": 0.24826717076244487, "grad_norm": 0.95703125, "learning_rate": 0.0004996957067976435, "loss": 5.9254, "mean_token_accuracy": 0.13761287704110145, "num_tokens": 5455988.0, "step": 2955 }, { "entropy": 6.139088869094849, "epoch": 0.24868725057760974, "grad_norm": 0.97265625, "learning_rate": 0.0004996941478750411, "loss": 5.9357, "mean_token_accuracy": 0.14046952053904532, "num_tokens": 5464996.0, "step": 2960 }, { "entropy": 6.173188400268555, "epoch": 0.24910733039277463, "grad_norm": 0.87890625, "learning_rate": 0.0004996925849720975, "loss": 6.0717, "mean_token_accuracy": 0.13539182469248773, "num_tokens": 5474174.0, "step": 2965 }, { "entropy": 6.202445459365845, "epoch": 0.2495274102079395, "grad_norm": 1.015625, "learning_rate": 0.0004996910180888405, "loss": 5.9624, "mean_token_accuracy": 0.14169209375977515, "num_tokens": 5482838.0, "step": 2970 }, { "entropy": 6.113552713394165, "epoch": 0.2499474900231044, "grad_norm": 0.9140625, "learning_rate": 0.0004996894472252977, "loss": 5.9734, "mean_token_accuracy": 0.13861241191625595, "num_tokens": 5491616.0, "step": 2975 }, { "entropy": 6.091303777694702, "epoch": 0.25036756983826924, "grad_norm": 0.94921875, "learning_rate": 0.0004996878723814973, "loss": 5.9555, "mean_token_accuracy": 0.13805645182728768, "num_tokens": 5500942.0, "step": 2980 }, { "entropy": 6.159912872314453, "epoch": 0.25078764965343414, "grad_norm": 0.9296875, "learning_rate": 0.0004996862935574667, "loss": 5.8989, "mean_token_accuracy": 0.13720250651240348, "num_tokens": 5510078.0, "step": 2985 }, { "entropy": 6.035575675964355, "epoch": 0.25120772946859904, "grad_norm": 0.90625, "learning_rate": 0.0004996847107532342, "loss": 5.953, "mean_token_accuracy": 0.13990190252661705, "num_tokens": 5518924.0, "step": 2990 }, { "entropy": 6.1541543960571286, "epoch": 0.25162780928376394, "grad_norm": 0.89453125, "learning_rate": 0.0004996831239688277, "loss": 5.9479, "mean_token_accuracy": 0.135651333630085, "num_tokens": 5527385.0, "step": 2995 }, { "entropy": 5.980669641494751, "epoch": 0.2520478890989288, "grad_norm": 0.9453125, "learning_rate": 0.0004996815332042754, "loss": 5.8093, "mean_token_accuracy": 0.14832203537225724, "num_tokens": 5536781.0, "step": 3000 }, { "epoch": 0.2520478890989288, "eval_entropy": 5.811351248549843, "eval_loss": 5.969449043273926, "eval_mean_token_accuracy": 0.14523225678583587, "eval_num_tokens": 5536781.0, "eval_runtime": 20.9301, "eval_samples_per_second": 1785.275, "eval_steps_per_second": 223.171, "step": 3000 } ], "logging_steps": 5, "max_steps": 119020, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1203541354414080.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }