{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2045706937868958, "eval_steps": 500, "global_step": 3500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742551231384278, "epoch": 0.000292243848266994, "grad_norm": 4.9375, "learning_rate": 2e-06, "loss": 10.7723, "mean_token_accuracy": 9.259259095415474e-05, "num_tokens": 11114.0, "step": 5 }, { "entropy": 10.742591094970702, "epoch": 0.000584487696533988, "grad_norm": 5.4375, "learning_rate": 4.5e-06, "loss": 10.7466, "mean_token_accuracy": 0.0, "num_tokens": 20935.0, "step": 10 }, { "entropy": 10.742585849761962, "epoch": 0.000876731544800982, "grad_norm": 5.09375, "learning_rate": 7e-06, "loss": 10.7483, "mean_token_accuracy": 0.0, "num_tokens": 31930.0, "step": 15 }, { "entropy": 10.742614936828613, "epoch": 0.001168975393067976, "grad_norm": 5.125, "learning_rate": 9.5e-06, "loss": 10.6676, "mean_token_accuracy": 0.0005568421445786953, "num_tokens": 41672.0, "step": 20 }, { "entropy": 10.742519950866699, "epoch": 0.00146121924133497, "grad_norm": 4.9375, "learning_rate": 1.2e-05, "loss": 10.5834, "mean_token_accuracy": 0.013186294632032514, "num_tokens": 52510.0, "step": 25 }, { "entropy": 10.742103958129883, "epoch": 0.001753463089601964, "grad_norm": 4.3125, "learning_rate": 1.4500000000000002e-05, "loss": 10.4654, "mean_token_accuracy": 0.04129958841949701, "num_tokens": 63214.0, "step": 30 }, { "entropy": 10.740110874176025, "epoch": 0.002045706937868958, "grad_norm": 3.203125, "learning_rate": 1.7000000000000003e-05, "loss": 10.305, "mean_token_accuracy": 0.05048500820994377, "num_tokens": 73942.0, "step": 35 }, { "entropy": 10.733905601501466, "epoch": 0.002337950786135952, "grad_norm": 2.4375, "learning_rate": 1.95e-05, "loss": 10.1895, "mean_token_accuracy": 0.051587145403027536, "num_tokens": 84526.0, "step": 40 }, { "entropy": 10.72324333190918, "epoch": 0.0026301946344029457, "grad_norm": 2.125, "learning_rate": 2.2e-05, "loss": 10.1139, "mean_token_accuracy": 0.04853160977363587, "num_tokens": 95178.0, "step": 45 }, { "entropy": 10.714754772186279, "epoch": 0.00292243848266994, "grad_norm": 2.140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.0146, "mean_token_accuracy": 0.05312369242310524, "num_tokens": 106653.0, "step": 50 }, { "entropy": 10.708310794830322, "epoch": 0.0032146823309369336, "grad_norm": 1.96875, "learning_rate": 2.7e-05, "loss": 9.9113, "mean_token_accuracy": 0.050825309753417966, "num_tokens": 115969.0, "step": 55 }, { "entropy": 10.704185581207275, "epoch": 0.003506926179203928, "grad_norm": 1.7734375, "learning_rate": 2.95e-05, "loss": 9.8939, "mean_token_accuracy": 0.048680877685546874, "num_tokens": 125826.0, "step": 60 }, { "entropy": 10.701387882232666, "epoch": 0.0037991700274709215, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.872, "mean_token_accuracy": 0.04808175079524517, "num_tokens": 136677.0, "step": 65 }, { "entropy": 10.697122478485108, "epoch": 0.004091413875737916, "grad_norm": 1.8125, "learning_rate": 3.4500000000000005e-05, "loss": 9.8236, "mean_token_accuracy": 0.04725121222436428, "num_tokens": 147535.0, "step": 70 }, { "entropy": 10.691372871398926, "epoch": 0.00438365772400491, "grad_norm": 1.8046875, "learning_rate": 3.7e-05, "loss": 9.722, "mean_token_accuracy": 0.04985377714037895, "num_tokens": 157524.0, "step": 75 }, { "entropy": 10.681602478027344, "epoch": 0.004675901572271904, "grad_norm": 1.6875, "learning_rate": 3.95e-05, "loss": 9.6896, "mean_token_accuracy": 0.05114552080631256, "num_tokens": 168344.0, "step": 80 }, { "entropy": 10.67192096710205, "epoch": 0.004968145420538897, "grad_norm": 1.7109375, "learning_rate": 4.2000000000000004e-05, "loss": 9.6618, "mean_token_accuracy": 0.04409446604549885, "num_tokens": 178976.0, "step": 85 }, { "entropy": 10.664519691467286, "epoch": 0.0052603892688058915, "grad_norm": 1.8671875, "learning_rate": 4.45e-05, "loss": 9.5639, "mean_token_accuracy": 0.05372482612729072, "num_tokens": 190567.0, "step": 90 }, { "entropy": 10.647130489349365, "epoch": 0.005552633117072886, "grad_norm": 1.75, "learning_rate": 4.7000000000000004e-05, "loss": 9.4984, "mean_token_accuracy": 0.05118483640253544, "num_tokens": 201587.0, "step": 95 }, { "entropy": 10.62646837234497, "epoch": 0.00584487696533988, "grad_norm": 1.671875, "learning_rate": 4.9500000000000004e-05, "loss": 9.4193, "mean_token_accuracy": 0.04868996068835259, "num_tokens": 211913.0, "step": 100 }, { "entropy": 10.610049438476562, "epoch": 0.006137120813606874, "grad_norm": 1.8125, "learning_rate": 5.2e-05, "loss": 9.3409, "mean_token_accuracy": 0.05402343980967998, "num_tokens": 222247.0, "step": 105 }, { "entropy": 10.584276962280274, "epoch": 0.006429364661873867, "grad_norm": 1.625, "learning_rate": 5.45e-05, "loss": 9.2142, "mean_token_accuracy": 0.06452971324324608, "num_tokens": 232361.0, "step": 110 }, { "entropy": 10.533616924285889, "epoch": 0.006721608510140861, "grad_norm": 1.671875, "learning_rate": 5.7e-05, "loss": 9.1281, "mean_token_accuracy": 0.0630628488957882, "num_tokens": 242885.0, "step": 115 }, { "entropy": 10.462300109863282, "epoch": 0.007013852358407856, "grad_norm": 1.6015625, "learning_rate": 5.9499999999999996e-05, "loss": 9.0436, "mean_token_accuracy": 0.060920076444745064, "num_tokens": 254482.0, "step": 120 }, { "entropy": 10.408651351928711, "epoch": 0.00730609620667485, "grad_norm": 1.6171875, "learning_rate": 6.2e-05, "loss": 8.93, "mean_token_accuracy": 0.059300025925040245, "num_tokens": 265744.0, "step": 125 }, { "entropy": 10.367331790924073, "epoch": 0.007598340054941843, "grad_norm": 1.421875, "learning_rate": 6.450000000000001e-05, "loss": 8.8327, "mean_token_accuracy": 0.058924198523163794, "num_tokens": 276924.0, "step": 130 }, { "entropy": 10.272025775909423, "epoch": 0.007890583903208837, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.7304, "mean_token_accuracy": 0.0622296292334795, "num_tokens": 287779.0, "step": 135 }, { "entropy": 10.183625984191895, "epoch": 0.008182827751475831, "grad_norm": 1.3984375, "learning_rate": 6.950000000000001e-05, "loss": 8.6335, "mean_token_accuracy": 0.06356315091252326, "num_tokens": 298807.0, "step": 140 }, { "entropy": 10.097103500366211, "epoch": 0.008475071599742826, "grad_norm": 1.2109375, "learning_rate": 7.2e-05, "loss": 8.5907, "mean_token_accuracy": 0.0559815414249897, "num_tokens": 309760.0, "step": 145 }, { "entropy": 10.004411506652833, "epoch": 0.00876731544800982, "grad_norm": 1.1796875, "learning_rate": 7.45e-05, "loss": 8.397, "mean_token_accuracy": 0.06126284077763557, "num_tokens": 319750.0, "step": 150 }, { "entropy": 9.832055950164795, "epoch": 0.009059559296276814, "grad_norm": 1.1484375, "learning_rate": 7.7e-05, "loss": 8.2924, "mean_token_accuracy": 0.0603407833725214, "num_tokens": 329931.0, "step": 155 }, { "entropy": 9.66302547454834, "epoch": 0.009351803144543808, "grad_norm": 1.0078125, "learning_rate": 7.950000000000001e-05, "loss": 8.2478, "mean_token_accuracy": 0.06180734224617481, "num_tokens": 340457.0, "step": 160 }, { "entropy": 9.49033498764038, "epoch": 0.009644046992810802, "grad_norm": 0.9296875, "learning_rate": 8.2e-05, "loss": 8.1199, "mean_token_accuracy": 0.06424234174191952, "num_tokens": 352450.0, "step": 165 }, { "entropy": 9.311860942840577, "epoch": 0.009936290841077795, "grad_norm": 0.85546875, "learning_rate": 8.450000000000001e-05, "loss": 8.1159, "mean_token_accuracy": 0.06317566409707069, "num_tokens": 363204.0, "step": 170 }, { "entropy": 9.153958892822265, "epoch": 0.010228534689344789, "grad_norm": 0.80078125, "learning_rate": 8.7e-05, "loss": 8.0882, "mean_token_accuracy": 0.062278729677200315, "num_tokens": 373577.0, "step": 175 }, { "entropy": 8.929795932769775, "epoch": 0.010520778537611783, "grad_norm": 0.76171875, "learning_rate": 8.95e-05, "loss": 7.9663, "mean_token_accuracy": 0.07208616435527801, "num_tokens": 384267.0, "step": 180 }, { "entropy": 8.768066787719727, "epoch": 0.010813022385878777, "grad_norm": 0.75390625, "learning_rate": 9.2e-05, "loss": 7.9324, "mean_token_accuracy": 0.06511378176510334, "num_tokens": 394767.0, "step": 185 }, { "entropy": 8.666393280029297, "epoch": 0.011105266234145771, "grad_norm": 0.94140625, "learning_rate": 9.45e-05, "loss": 7.9172, "mean_token_accuracy": 0.07024285569787025, "num_tokens": 405807.0, "step": 190 }, { "entropy": 8.585619068145752, "epoch": 0.011397510082412765, "grad_norm": 0.68359375, "learning_rate": 9.7e-05, "loss": 7.869, "mean_token_accuracy": 0.0643521461635828, "num_tokens": 416381.0, "step": 195 }, { "entropy": 8.565132427215577, "epoch": 0.01168975393067976, "grad_norm": 0.75390625, "learning_rate": 9.95e-05, "loss": 7.9632, "mean_token_accuracy": 0.06446416340768338, "num_tokens": 427262.0, "step": 200 }, { "entropy": 8.418638515472413, "epoch": 0.011981997778946754, "grad_norm": 0.78515625, "learning_rate": 0.000102, "loss": 7.8962, "mean_token_accuracy": 0.06822493113577366, "num_tokens": 438504.0, "step": 205 }, { "entropy": 8.47780933380127, "epoch": 0.012274241627213748, "grad_norm": 0.765625, "learning_rate": 0.00010449999999999999, "loss": 7.8873, "mean_token_accuracy": 0.06689661256968975, "num_tokens": 449923.0, "step": 210 }, { "entropy": 8.430081558227538, "epoch": 0.01256648547548074, "grad_norm": 0.80078125, "learning_rate": 0.000107, "loss": 7.8463, "mean_token_accuracy": 0.0716497365385294, "num_tokens": 460736.0, "step": 215 }, { "entropy": 8.367777156829835, "epoch": 0.012858729323747735, "grad_norm": 0.80078125, "learning_rate": 0.0001095, "loss": 7.9365, "mean_token_accuracy": 0.0605232123285532, "num_tokens": 471513.0, "step": 220 }, { "entropy": 8.417449378967286, "epoch": 0.013150973172014729, "grad_norm": 0.73828125, "learning_rate": 0.000112, "loss": 7.7879, "mean_token_accuracy": 0.07277968265116215, "num_tokens": 482115.0, "step": 225 }, { "entropy": 8.359326553344726, "epoch": 0.013443217020281723, "grad_norm": 0.7890625, "learning_rate": 0.0001145, "loss": 7.8079, "mean_token_accuracy": 0.07002997919917106, "num_tokens": 493273.0, "step": 230 }, { "entropy": 8.321810531616212, "epoch": 0.013735460868548717, "grad_norm": 0.7578125, "learning_rate": 0.00011700000000000001, "loss": 7.8188, "mean_token_accuracy": 0.07201721332967281, "num_tokens": 503939.0, "step": 235 }, { "entropy": 8.311158466339112, "epoch": 0.014027704716815711, "grad_norm": 0.81640625, "learning_rate": 0.00011949999999999999, "loss": 7.7369, "mean_token_accuracy": 0.06772977598011494, "num_tokens": 515215.0, "step": 240 }, { "entropy": 8.281570434570312, "epoch": 0.014319948565082705, "grad_norm": 0.77734375, "learning_rate": 0.000122, "loss": 7.8223, "mean_token_accuracy": 0.07254013754427432, "num_tokens": 526485.0, "step": 245 }, { "entropy": 8.277181148529053, "epoch": 0.0146121924133497, "grad_norm": 0.77734375, "learning_rate": 0.0001245, "loss": 7.7672, "mean_token_accuracy": 0.06958542391657829, "num_tokens": 536735.0, "step": 250 }, { "entropy": 8.277847576141358, "epoch": 0.014904436261616694, "grad_norm": 0.82421875, "learning_rate": 0.000127, "loss": 7.8541, "mean_token_accuracy": 0.06499786637723445, "num_tokens": 547326.0, "step": 255 }, { "entropy": 8.180327033996582, "epoch": 0.015196680109883686, "grad_norm": 0.9375, "learning_rate": 0.0001295, "loss": 7.7502, "mean_token_accuracy": 0.06869623251259327, "num_tokens": 558275.0, "step": 260 }, { "entropy": 8.257558250427246, "epoch": 0.01548892395815068, "grad_norm": 0.74609375, "learning_rate": 0.000132, "loss": 7.7096, "mean_token_accuracy": 0.07516702339053154, "num_tokens": 569711.0, "step": 265 }, { "entropy": 8.150344276428223, "epoch": 0.015781167806417674, "grad_norm": 0.7421875, "learning_rate": 0.00013450000000000002, "loss": 7.6881, "mean_token_accuracy": 0.07785917520523071, "num_tokens": 579602.0, "step": 270 }, { "entropy": 8.24105463027954, "epoch": 0.01607341165468467, "grad_norm": 0.75, "learning_rate": 0.00013700000000000002, "loss": 7.7286, "mean_token_accuracy": 0.07401030212640762, "num_tokens": 590899.0, "step": 275 }, { "entropy": 8.173699569702148, "epoch": 0.016365655502951663, "grad_norm": 0.87890625, "learning_rate": 0.0001395, "loss": 7.726, "mean_token_accuracy": 0.06962668001651764, "num_tokens": 602080.0, "step": 280 }, { "entropy": 8.16687994003296, "epoch": 0.016657899351218655, "grad_norm": 0.765625, "learning_rate": 0.00014199999999999998, "loss": 7.7605, "mean_token_accuracy": 0.07070777006447315, "num_tokens": 613692.0, "step": 285 }, { "entropy": 8.145956993103027, "epoch": 0.01695014319948565, "grad_norm": 0.88671875, "learning_rate": 0.0001445, "loss": 7.7305, "mean_token_accuracy": 0.07069781571626663, "num_tokens": 625019.0, "step": 290 }, { "entropy": 8.123618793487548, "epoch": 0.017242387047752643, "grad_norm": 0.80078125, "learning_rate": 0.000147, "loss": 7.6456, "mean_token_accuracy": 0.07288045659661294, "num_tokens": 636453.0, "step": 295 }, { "entropy": 8.108728456497193, "epoch": 0.01753463089601964, "grad_norm": 0.89453125, "learning_rate": 0.0001495, "loss": 7.6918, "mean_token_accuracy": 0.07240097671747207, "num_tokens": 647272.0, "step": 300 }, { "entropy": 8.040448427200317, "epoch": 0.017826874744286632, "grad_norm": 1.0859375, "learning_rate": 0.000152, "loss": 7.701, "mean_token_accuracy": 0.07080473527312278, "num_tokens": 657724.0, "step": 305 }, { "entropy": 8.166200351715087, "epoch": 0.018119118592553628, "grad_norm": 0.78125, "learning_rate": 0.00015450000000000001, "loss": 7.7053, "mean_token_accuracy": 0.07137923240661621, "num_tokens": 669183.0, "step": 310 }, { "entropy": 8.084780406951904, "epoch": 0.01841136244082062, "grad_norm": 1.0703125, "learning_rate": 0.000157, "loss": 7.6679, "mean_token_accuracy": 0.06901021562516689, "num_tokens": 680439.0, "step": 315 }, { "entropy": 8.157064056396484, "epoch": 0.018703606289087616, "grad_norm": 0.9765625, "learning_rate": 0.0001595, "loss": 7.712, "mean_token_accuracy": 0.0706634670495987, "num_tokens": 690789.0, "step": 320 }, { "entropy": 8.046548128128052, "epoch": 0.01899585013735461, "grad_norm": 0.8671875, "learning_rate": 0.000162, "loss": 7.6831, "mean_token_accuracy": 0.07187991701066494, "num_tokens": 701818.0, "step": 325 }, { "entropy": 8.062455224990845, "epoch": 0.019288093985621604, "grad_norm": 0.71484375, "learning_rate": 0.00016450000000000001, "loss": 7.6316, "mean_token_accuracy": 0.07437365353107453, "num_tokens": 713344.0, "step": 330 }, { "entropy": 8.084509325027465, "epoch": 0.019580337833888597, "grad_norm": 1.0390625, "learning_rate": 0.00016700000000000002, "loss": 7.6384, "mean_token_accuracy": 0.07300028279423713, "num_tokens": 723279.0, "step": 335 }, { "entropy": 8.018547964096069, "epoch": 0.01987258168215559, "grad_norm": 0.73046875, "learning_rate": 0.00016950000000000003, "loss": 7.625, "mean_token_accuracy": 0.07260205298662185, "num_tokens": 733875.0, "step": 340 }, { "entropy": 8.072830390930175, "epoch": 0.020164825530422585, "grad_norm": 0.94140625, "learning_rate": 0.00017199999999999998, "loss": 7.6669, "mean_token_accuracy": 0.0713542215526104, "num_tokens": 745449.0, "step": 345 }, { "entropy": 8.05644793510437, "epoch": 0.020457069378689578, "grad_norm": 0.7734375, "learning_rate": 0.00017449999999999999, "loss": 7.6741, "mean_token_accuracy": 0.0740118071436882, "num_tokens": 757570.0, "step": 350 }, { "entropy": 8.017089939117431, "epoch": 0.020749313226956573, "grad_norm": 0.8671875, "learning_rate": 0.000177, "loss": 7.5737, "mean_token_accuracy": 0.08025477081537247, "num_tokens": 767601.0, "step": 355 }, { "entropy": 8.00361680984497, "epoch": 0.021041557075223566, "grad_norm": 0.95703125, "learning_rate": 0.0001795, "loss": 7.6323, "mean_token_accuracy": 0.0752041395753622, "num_tokens": 777852.0, "step": 360 }, { "entropy": 8.018228721618652, "epoch": 0.021333800923490562, "grad_norm": 0.890625, "learning_rate": 0.000182, "loss": 7.5859, "mean_token_accuracy": 0.0751498755067587, "num_tokens": 788339.0, "step": 365 }, { "entropy": 7.970228672027588, "epoch": 0.021626044771757554, "grad_norm": 0.984375, "learning_rate": 0.0001845, "loss": 7.6588, "mean_token_accuracy": 0.07353257052600384, "num_tokens": 799791.0, "step": 370 }, { "entropy": 8.015653133392334, "epoch": 0.02191828862002455, "grad_norm": 0.96875, "learning_rate": 0.000187, "loss": 7.5746, "mean_token_accuracy": 0.07374845892190933, "num_tokens": 810141.0, "step": 375 }, { "entropy": 8.040093088150025, "epoch": 0.022210532468291543, "grad_norm": 0.8046875, "learning_rate": 0.0001895, "loss": 7.6182, "mean_token_accuracy": 0.07429262697696686, "num_tokens": 820929.0, "step": 380 }, { "entropy": 7.9526266098022464, "epoch": 0.022502776316558535, "grad_norm": 1.265625, "learning_rate": 0.000192, "loss": 7.5519, "mean_token_accuracy": 0.07891798727214336, "num_tokens": 831340.0, "step": 385 }, { "entropy": 7.935062026977539, "epoch": 0.02279502016482553, "grad_norm": 0.8984375, "learning_rate": 0.0001945, "loss": 7.5636, "mean_token_accuracy": 0.0735638827085495, "num_tokens": 841846.0, "step": 390 }, { "entropy": 8.029356002807617, "epoch": 0.023087264013092523, "grad_norm": 0.90234375, "learning_rate": 0.00019700000000000002, "loss": 7.5434, "mean_token_accuracy": 0.07343484573066235, "num_tokens": 852089.0, "step": 395 }, { "entropy": 7.838059997558593, "epoch": 0.02337950786135952, "grad_norm": 0.97265625, "learning_rate": 0.00019950000000000002, "loss": 7.5241, "mean_token_accuracy": 0.07688843682408333, "num_tokens": 862568.0, "step": 400 }, { "entropy": 8.034818124771117, "epoch": 0.02367175170962651, "grad_norm": 0.8046875, "learning_rate": 0.000202, "loss": 7.5905, "mean_token_accuracy": 0.07528307065367698, "num_tokens": 874676.0, "step": 405 }, { "entropy": 7.867450904846192, "epoch": 0.023963995557893508, "grad_norm": 0.8515625, "learning_rate": 0.00020449999999999998, "loss": 7.5115, "mean_token_accuracy": 0.08100188933312893, "num_tokens": 886338.0, "step": 410 }, { "entropy": 7.946144676208496, "epoch": 0.0242562394061605, "grad_norm": 0.8671875, "learning_rate": 0.000207, "loss": 7.5287, "mean_token_accuracy": 0.07384060397744178, "num_tokens": 896671.0, "step": 415 }, { "entropy": 7.923208522796631, "epoch": 0.024548483254427496, "grad_norm": 0.90625, "learning_rate": 0.0002095, "loss": 7.5025, "mean_token_accuracy": 0.07231347896158695, "num_tokens": 908265.0, "step": 420 }, { "entropy": 7.851961994171143, "epoch": 0.02484072710269449, "grad_norm": 0.8828125, "learning_rate": 0.000212, "loss": 7.4692, "mean_token_accuracy": 0.07885380312800408, "num_tokens": 919024.0, "step": 425 }, { "entropy": 7.894201850891113, "epoch": 0.02513297095096148, "grad_norm": 0.9296875, "learning_rate": 0.0002145, "loss": 7.4639, "mean_token_accuracy": 0.08095669150352477, "num_tokens": 930837.0, "step": 430 }, { "entropy": 7.845162343978882, "epoch": 0.025425214799228477, "grad_norm": 1.0390625, "learning_rate": 0.00021700000000000002, "loss": 7.4312, "mean_token_accuracy": 0.076503673940897, "num_tokens": 941374.0, "step": 435 }, { "entropy": 7.838292598724365, "epoch": 0.02571745864749547, "grad_norm": 0.859375, "learning_rate": 0.0002195, "loss": 7.3796, "mean_token_accuracy": 0.0836145281791687, "num_tokens": 953273.0, "step": 440 }, { "entropy": 7.836203670501709, "epoch": 0.026009702495762465, "grad_norm": 1.6015625, "learning_rate": 0.000222, "loss": 7.3659, "mean_token_accuracy": 0.09230264946818352, "num_tokens": 964882.0, "step": 445 }, { "entropy": 7.860473203659057, "epoch": 0.026301946344029457, "grad_norm": 1.203125, "learning_rate": 0.0002245, "loss": 7.5208, "mean_token_accuracy": 0.08153782263398171, "num_tokens": 974732.0, "step": 450 }, { "entropy": 7.774071216583252, "epoch": 0.026594190192296453, "grad_norm": 0.94140625, "learning_rate": 0.00022700000000000002, "loss": 7.4513, "mean_token_accuracy": 0.07568450495600701, "num_tokens": 985709.0, "step": 455 }, { "entropy": 7.999471426010132, "epoch": 0.026886434040563446, "grad_norm": 0.8046875, "learning_rate": 0.00022950000000000002, "loss": 7.4197, "mean_token_accuracy": 0.07974797300994396, "num_tokens": 998177.0, "step": 460 }, { "entropy": 7.711365842819214, "epoch": 0.02717867788883044, "grad_norm": 0.8671875, "learning_rate": 0.00023200000000000003, "loss": 7.3536, "mean_token_accuracy": 0.08135458827018738, "num_tokens": 1008676.0, "step": 465 }, { "entropy": 7.800386238098144, "epoch": 0.027470921737097434, "grad_norm": 0.875, "learning_rate": 0.00023449999999999998, "loss": 7.4651, "mean_token_accuracy": 0.07976322658360005, "num_tokens": 1019951.0, "step": 470 }, { "entropy": 7.785122346878052, "epoch": 0.027763165585364426, "grad_norm": 0.9453125, "learning_rate": 0.000237, "loss": 7.3981, "mean_token_accuracy": 0.0761278249323368, "num_tokens": 1030219.0, "step": 475 }, { "entropy": 7.781033182144165, "epoch": 0.028055409433631422, "grad_norm": 0.9296875, "learning_rate": 0.0002395, "loss": 7.4141, "mean_token_accuracy": 0.07795999571681023, "num_tokens": 1041911.0, "step": 480 }, { "entropy": 7.891617631912231, "epoch": 0.028347653281898415, "grad_norm": 0.94140625, "learning_rate": 0.000242, "loss": 7.4312, "mean_token_accuracy": 0.08173990175127983, "num_tokens": 1052638.0, "step": 485 }, { "entropy": 7.774001789093018, "epoch": 0.02863989713016541, "grad_norm": 0.94140625, "learning_rate": 0.0002445, "loss": 7.3755, "mean_token_accuracy": 0.08225451484322548, "num_tokens": 1063465.0, "step": 490 }, { "entropy": 7.861321496963501, "epoch": 0.028932140978432403, "grad_norm": 1.1796875, "learning_rate": 0.000247, "loss": 7.3888, "mean_token_accuracy": 0.08350497037172318, "num_tokens": 1073583.0, "step": 495 }, { "entropy": 7.868850564956665, "epoch": 0.0292243848266994, "grad_norm": 1.3515625, "learning_rate": 0.0002495, "loss": 7.4377, "mean_token_accuracy": 0.08040728494524955, "num_tokens": 1083961.0, "step": 500 }, { "entropy": 7.663293409347534, "epoch": 0.02951662867496639, "grad_norm": 0.80859375, "learning_rate": 0.000252, "loss": 7.3053, "mean_token_accuracy": 0.08032148070633412, "num_tokens": 1095339.0, "step": 505 }, { "entropy": 7.742640733718872, "epoch": 0.029808872523233387, "grad_norm": 0.90625, "learning_rate": 0.0002545, "loss": 7.3746, "mean_token_accuracy": 0.07911042794585228, "num_tokens": 1105518.0, "step": 510 }, { "entropy": 7.822371339797973, "epoch": 0.03010111637150038, "grad_norm": 0.8515625, "learning_rate": 0.000257, "loss": 7.2683, "mean_token_accuracy": 0.08846351876854897, "num_tokens": 1115666.0, "step": 515 }, { "entropy": 7.7058703899383545, "epoch": 0.030393360219767372, "grad_norm": 1.171875, "learning_rate": 0.0002595, "loss": 7.3901, "mean_token_accuracy": 0.08510988727211952, "num_tokens": 1125827.0, "step": 520 }, { "entropy": 7.762892246246338, "epoch": 0.030685604068034368, "grad_norm": 0.93359375, "learning_rate": 0.000262, "loss": 7.3453, "mean_token_accuracy": 0.08135025277733803, "num_tokens": 1136154.0, "step": 525 }, { "entropy": 7.712664318084717, "epoch": 0.03097784791630136, "grad_norm": 1.09375, "learning_rate": 0.00026450000000000003, "loss": 7.3361, "mean_token_accuracy": 0.08622926697134972, "num_tokens": 1146392.0, "step": 530 }, { "entropy": 7.7614504337310795, "epoch": 0.03127009176456835, "grad_norm": 1.0625, "learning_rate": 0.00026700000000000004, "loss": 7.3515, "mean_token_accuracy": 0.08140693604946136, "num_tokens": 1157566.0, "step": 535 }, { "entropy": 7.6518913269042965, "epoch": 0.03156233561283535, "grad_norm": 0.94921875, "learning_rate": 0.00026950000000000005, "loss": 7.3194, "mean_token_accuracy": 0.0838658906519413, "num_tokens": 1167795.0, "step": 540 }, { "entropy": 7.775746774673462, "epoch": 0.031854579461102345, "grad_norm": 1.5625, "learning_rate": 0.00027200000000000005, "loss": 7.2691, "mean_token_accuracy": 0.09419989511370659, "num_tokens": 1178894.0, "step": 545 }, { "entropy": 7.634786605834961, "epoch": 0.03214682330936934, "grad_norm": 0.96484375, "learning_rate": 0.0002745, "loss": 7.2696, "mean_token_accuracy": 0.08667804896831513, "num_tokens": 1189361.0, "step": 550 }, { "entropy": 7.752673006057739, "epoch": 0.03243906715763633, "grad_norm": 1.109375, "learning_rate": 0.000277, "loss": 7.3135, "mean_token_accuracy": 0.08304268047213555, "num_tokens": 1198992.0, "step": 555 }, { "entropy": 7.692470407485962, "epoch": 0.032731311005903325, "grad_norm": 1.0546875, "learning_rate": 0.0002795, "loss": 7.294, "mean_token_accuracy": 0.07943044230341911, "num_tokens": 1208732.0, "step": 560 }, { "entropy": 7.655223751068116, "epoch": 0.03302355485417032, "grad_norm": 1.078125, "learning_rate": 0.00028199999999999997, "loss": 7.2954, "mean_token_accuracy": 0.08259731158614159, "num_tokens": 1219015.0, "step": 565 }, { "entropy": 7.612499952316284, "epoch": 0.03331579870243731, "grad_norm": 1.046875, "learning_rate": 0.0002845, "loss": 7.1795, "mean_token_accuracy": 0.1000419594347477, "num_tokens": 1229227.0, "step": 570 }, { "entropy": 7.750643157958985, "epoch": 0.033608042550704306, "grad_norm": 1.0234375, "learning_rate": 0.000287, "loss": 7.3098, "mean_token_accuracy": 0.08021004945039749, "num_tokens": 1239654.0, "step": 575 }, { "entropy": 7.618366050720215, "epoch": 0.0339002863989713, "grad_norm": 0.87890625, "learning_rate": 0.0002895, "loss": 7.3005, "mean_token_accuracy": 0.08035954535007477, "num_tokens": 1250955.0, "step": 580 }, { "entropy": 7.729614543914795, "epoch": 0.0341925302472383, "grad_norm": 1.0234375, "learning_rate": 0.000292, "loss": 7.2497, "mean_token_accuracy": 0.08898582234978676, "num_tokens": 1262574.0, "step": 585 }, { "entropy": 7.672766494750976, "epoch": 0.03448477409550529, "grad_norm": 0.9140625, "learning_rate": 0.0002945, "loss": 7.2059, "mean_token_accuracy": 0.08972268775105477, "num_tokens": 1273272.0, "step": 590 }, { "entropy": 7.505560779571534, "epoch": 0.03477701794377228, "grad_norm": 0.91796875, "learning_rate": 0.000297, "loss": 7.1898, "mean_token_accuracy": 0.09178911671042442, "num_tokens": 1284001.0, "step": 595 }, { "entropy": 7.633696794509888, "epoch": 0.03506926179203928, "grad_norm": 1.0546875, "learning_rate": 0.0002995, "loss": 7.2354, "mean_token_accuracy": 0.08889753520488738, "num_tokens": 1294671.0, "step": 600 }, { "entropy": 7.695655345916748, "epoch": 0.035361505640306275, "grad_norm": 1.0390625, "learning_rate": 0.000302, "loss": 7.2349, "mean_token_accuracy": 0.09624799937009812, "num_tokens": 1305397.0, "step": 605 }, { "entropy": 7.568394422531128, "epoch": 0.035653749488573264, "grad_norm": 1.2890625, "learning_rate": 0.0003045, "loss": 7.2377, "mean_token_accuracy": 0.08420243933796882, "num_tokens": 1317449.0, "step": 610 }, { "entropy": 7.562969303131103, "epoch": 0.03594599333684026, "grad_norm": 1.1484375, "learning_rate": 0.000307, "loss": 7.176, "mean_token_accuracy": 0.08269712552428246, "num_tokens": 1328645.0, "step": 615 }, { "entropy": 7.559274625778198, "epoch": 0.036238237185107255, "grad_norm": 0.9609375, "learning_rate": 0.0003095, "loss": 7.1652, "mean_token_accuracy": 0.09311013892292977, "num_tokens": 1339815.0, "step": 620 }, { "entropy": 7.583710241317749, "epoch": 0.036530481033374244, "grad_norm": 1.03125, "learning_rate": 0.000312, "loss": 7.1795, "mean_token_accuracy": 0.08754727616906166, "num_tokens": 1350301.0, "step": 625 }, { "entropy": 7.535983610153198, "epoch": 0.03682272488164124, "grad_norm": 1.0078125, "learning_rate": 0.0003145, "loss": 7.1724, "mean_token_accuracy": 0.08950133547186852, "num_tokens": 1360928.0, "step": 630 }, { "entropy": 7.625943231582641, "epoch": 0.037114968729908236, "grad_norm": 1.2109375, "learning_rate": 0.000317, "loss": 7.1957, "mean_token_accuracy": 0.08902273774147033, "num_tokens": 1371618.0, "step": 635 }, { "entropy": 7.511281824111938, "epoch": 0.03740721257817523, "grad_norm": 0.95703125, "learning_rate": 0.0003195, "loss": 7.1562, "mean_token_accuracy": 0.08582355380058289, "num_tokens": 1382824.0, "step": 640 }, { "entropy": 7.470151281356811, "epoch": 0.03769945642644222, "grad_norm": 0.953125, "learning_rate": 0.000322, "loss": 7.1191, "mean_token_accuracy": 0.09281812384724616, "num_tokens": 1393244.0, "step": 645 }, { "entropy": 7.475745964050293, "epoch": 0.03799170027470922, "grad_norm": 1.046875, "learning_rate": 0.00032450000000000003, "loss": 7.0909, "mean_token_accuracy": 0.09678038656711578, "num_tokens": 1403469.0, "step": 650 }, { "entropy": 7.615570402145385, "epoch": 0.03828394412297621, "grad_norm": 0.87890625, "learning_rate": 0.00032700000000000003, "loss": 7.1651, "mean_token_accuracy": 0.09157615751028061, "num_tokens": 1413860.0, "step": 655 }, { "entropy": 7.553770732879639, "epoch": 0.03857618797124321, "grad_norm": 1.0390625, "learning_rate": 0.00032950000000000004, "loss": 7.2248, "mean_token_accuracy": 0.08392854556441307, "num_tokens": 1423985.0, "step": 660 }, { "entropy": 7.531700229644775, "epoch": 0.0388684318195102, "grad_norm": 1.078125, "learning_rate": 0.00033200000000000005, "loss": 7.1654, "mean_token_accuracy": 0.09291392266750335, "num_tokens": 1434838.0, "step": 665 }, { "entropy": 7.482819223403931, "epoch": 0.039160675667777194, "grad_norm": 1.1015625, "learning_rate": 0.00033450000000000005, "loss": 7.0905, "mean_token_accuracy": 0.09290852397680283, "num_tokens": 1446429.0, "step": 670 }, { "entropy": 7.611834764480591, "epoch": 0.03945291951604419, "grad_norm": 1.046875, "learning_rate": 0.000337, "loss": 7.1879, "mean_token_accuracy": 0.08893333822488785, "num_tokens": 1456726.0, "step": 675 }, { "entropy": 7.5248387336730955, "epoch": 0.03974516336431118, "grad_norm": 1.109375, "learning_rate": 0.0003395, "loss": 7.0781, "mean_token_accuracy": 0.09758968204259873, "num_tokens": 1466378.0, "step": 680 }, { "entropy": 7.323547267913819, "epoch": 0.040037407212578174, "grad_norm": 1.28125, "learning_rate": 0.000342, "loss": 7.0345, "mean_token_accuracy": 0.09719507321715355, "num_tokens": 1477755.0, "step": 685 }, { "entropy": 7.507241344451904, "epoch": 0.04032965106084517, "grad_norm": 1.0625, "learning_rate": 0.00034449999999999997, "loss": 7.1006, "mean_token_accuracy": 0.09118306115269662, "num_tokens": 1488209.0, "step": 690 }, { "entropy": 7.419371461868286, "epoch": 0.040621894909112166, "grad_norm": 1.078125, "learning_rate": 0.000347, "loss": 7.1465, "mean_token_accuracy": 0.08755657598376274, "num_tokens": 1498658.0, "step": 695 }, { "entropy": 7.546753549575806, "epoch": 0.040914138757379155, "grad_norm": 1.09375, "learning_rate": 0.0003495, "loss": 7.1576, "mean_token_accuracy": 0.08506937101483344, "num_tokens": 1509766.0, "step": 700 }, { "entropy": 7.439605093002319, "epoch": 0.04120638260564615, "grad_norm": 1.40625, "learning_rate": 0.000352, "loss": 7.036, "mean_token_accuracy": 0.0939096562564373, "num_tokens": 1521139.0, "step": 705 }, { "entropy": 7.4743701934814455, "epoch": 0.04149862645391315, "grad_norm": 1.1171875, "learning_rate": 0.0003545, "loss": 7.1115, "mean_token_accuracy": 0.08748833164572715, "num_tokens": 1531875.0, "step": 710 }, { "entropy": 7.395281553268433, "epoch": 0.041790870302180136, "grad_norm": 1.1328125, "learning_rate": 0.000357, "loss": 7.0801, "mean_token_accuracy": 0.08955910429358482, "num_tokens": 1542678.0, "step": 715 }, { "entropy": 7.462686967849732, "epoch": 0.04208311415044713, "grad_norm": 1.1171875, "learning_rate": 0.0003595, "loss": 7.0268, "mean_token_accuracy": 0.09358467385172844, "num_tokens": 1553882.0, "step": 720 }, { "entropy": 7.43300313949585, "epoch": 0.04237535799871413, "grad_norm": 0.9375, "learning_rate": 0.000362, "loss": 7.1176, "mean_token_accuracy": 0.08562448695302009, "num_tokens": 1564854.0, "step": 725 }, { "entropy": 7.425636720657349, "epoch": 0.042667601846981124, "grad_norm": 0.92578125, "learning_rate": 0.0003645, "loss": 7.0026, "mean_token_accuracy": 0.09751182347536087, "num_tokens": 1576112.0, "step": 730 }, { "entropy": 7.374439096450805, "epoch": 0.04295984569524811, "grad_norm": 1.0390625, "learning_rate": 0.000367, "loss": 7.0378, "mean_token_accuracy": 0.09424405097961426, "num_tokens": 1586235.0, "step": 735 }, { "entropy": 7.347483777999878, "epoch": 0.04325208954351511, "grad_norm": 1.859375, "learning_rate": 0.0003695, "loss": 7.0347, "mean_token_accuracy": 0.0911446213722229, "num_tokens": 1596727.0, "step": 740 }, { "entropy": 7.407256555557251, "epoch": 0.043544333391782104, "grad_norm": 1.0234375, "learning_rate": 0.000372, "loss": 6.9573, "mean_token_accuracy": 0.09358611106872558, "num_tokens": 1607008.0, "step": 745 }, { "entropy": 7.389186716079712, "epoch": 0.0438365772400491, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 7.0579, "mean_token_accuracy": 0.0928824670612812, "num_tokens": 1618081.0, "step": 750 }, { "entropy": 7.385285234451294, "epoch": 0.04412882108831609, "grad_norm": 1.0078125, "learning_rate": 0.000377, "loss": 7.0165, "mean_token_accuracy": 0.08930294588208199, "num_tokens": 1629095.0, "step": 755 }, { "entropy": 7.394097995758057, "epoch": 0.044421064936583085, "grad_norm": 0.9609375, "learning_rate": 0.0003795, "loss": 7.0118, "mean_token_accuracy": 0.093733761459589, "num_tokens": 1639861.0, "step": 760 }, { "entropy": 7.372588682174682, "epoch": 0.04471330878485008, "grad_norm": 1.0859375, "learning_rate": 0.000382, "loss": 7.0534, "mean_token_accuracy": 0.09636619538068772, "num_tokens": 1649169.0, "step": 765 }, { "entropy": 7.278450775146484, "epoch": 0.04500555263311707, "grad_norm": 0.94921875, "learning_rate": 0.0003845, "loss": 6.9357, "mean_token_accuracy": 0.1010350152850151, "num_tokens": 1658528.0, "step": 770 }, { "entropy": 7.303726387023926, "epoch": 0.045297796481384066, "grad_norm": 1.0625, "learning_rate": 0.00038700000000000003, "loss": 7.0068, "mean_token_accuracy": 0.09450188651680946, "num_tokens": 1669231.0, "step": 775 }, { "entropy": 7.309107494354248, "epoch": 0.04559004032965106, "grad_norm": 1.0078125, "learning_rate": 0.00038950000000000003, "loss": 6.9475, "mean_token_accuracy": 0.09322728961706161, "num_tokens": 1680503.0, "step": 780 }, { "entropy": 7.336097192764282, "epoch": 0.04588228417791806, "grad_norm": 0.91796875, "learning_rate": 0.00039200000000000004, "loss": 6.9766, "mean_token_accuracy": 0.09063231274485588, "num_tokens": 1690827.0, "step": 785 }, { "entropy": 7.370522546768188, "epoch": 0.04617452802618505, "grad_norm": 1.03125, "learning_rate": 0.00039450000000000005, "loss": 7.0418, "mean_token_accuracy": 0.09461386948823929, "num_tokens": 1702931.0, "step": 790 }, { "entropy": 7.289389944076538, "epoch": 0.04646677187445204, "grad_norm": 1.0, "learning_rate": 0.00039700000000000005, "loss": 6.9307, "mean_token_accuracy": 0.09922353029251099, "num_tokens": 1712834.0, "step": 795 }, { "entropy": 7.3177947998046875, "epoch": 0.04675901572271904, "grad_norm": 1.0390625, "learning_rate": 0.0003995, "loss": 7.0006, "mean_token_accuracy": 0.0919931598007679, "num_tokens": 1723289.0, "step": 800 }, { "entropy": 7.245712804794311, "epoch": 0.04705125957098603, "grad_norm": 1.1875, "learning_rate": 0.000402, "loss": 6.9702, "mean_token_accuracy": 0.09567693397402763, "num_tokens": 1734477.0, "step": 805 }, { "entropy": 7.306273651123047, "epoch": 0.04734350341925302, "grad_norm": 0.96875, "learning_rate": 0.0004045, "loss": 6.9762, "mean_token_accuracy": 0.09110540002584458, "num_tokens": 1745187.0, "step": 810 }, { "entropy": 7.276857900619507, "epoch": 0.04763574726752002, "grad_norm": 1.1328125, "learning_rate": 0.00040699999999999997, "loss": 6.9011, "mean_token_accuracy": 0.10115249156951904, "num_tokens": 1756687.0, "step": 815 }, { "entropy": 7.304260778427124, "epoch": 0.047927991115787015, "grad_norm": 0.9765625, "learning_rate": 0.0004095, "loss": 7.024, "mean_token_accuracy": 0.09978155121207237, "num_tokens": 1767928.0, "step": 820 }, { "entropy": 7.309319734573364, "epoch": 0.048220234964054004, "grad_norm": 1.046875, "learning_rate": 0.000412, "loss": 6.9585, "mean_token_accuracy": 0.09580064937472343, "num_tokens": 1777951.0, "step": 825 }, { "entropy": 7.194837522506714, "epoch": 0.048512478812321, "grad_norm": 1.015625, "learning_rate": 0.0004145, "loss": 6.9514, "mean_token_accuracy": 0.09750414118170739, "num_tokens": 1788598.0, "step": 830 }, { "entropy": 7.25841178894043, "epoch": 0.048804722660587996, "grad_norm": 1.078125, "learning_rate": 0.000417, "loss": 6.9107, "mean_token_accuracy": 0.10313281938433647, "num_tokens": 1799446.0, "step": 835 }, { "entropy": 7.308444929122925, "epoch": 0.04909696650885499, "grad_norm": 0.94140625, "learning_rate": 0.0004195, "loss": 6.93, "mean_token_accuracy": 0.09639307036995888, "num_tokens": 1809687.0, "step": 840 }, { "entropy": 7.247332191467285, "epoch": 0.04938921035712198, "grad_norm": 1.1953125, "learning_rate": 0.000422, "loss": 6.9496, "mean_token_accuracy": 0.10043755695223808, "num_tokens": 1820535.0, "step": 845 }, { "entropy": 7.192328262329101, "epoch": 0.04968145420538898, "grad_norm": 1.3984375, "learning_rate": 0.0004245, "loss": 6.8901, "mean_token_accuracy": 0.09903936088085175, "num_tokens": 1830834.0, "step": 850 }, { "entropy": 7.244427633285523, "epoch": 0.04997369805365597, "grad_norm": 0.953125, "learning_rate": 0.000427, "loss": 6.8568, "mean_token_accuracy": 0.10095973312854767, "num_tokens": 1842615.0, "step": 855 }, { "entropy": 7.1798933982849125, "epoch": 0.05026594190192296, "grad_norm": 0.99609375, "learning_rate": 0.0004295, "loss": 6.8778, "mean_token_accuracy": 0.10051687061786652, "num_tokens": 1852844.0, "step": 860 }, { "entropy": 7.210625696182251, "epoch": 0.05055818575018996, "grad_norm": 0.984375, "learning_rate": 0.000432, "loss": 6.9139, "mean_token_accuracy": 0.09776052087545395, "num_tokens": 1862528.0, "step": 865 }, { "entropy": 7.177963972091675, "epoch": 0.05085042959845695, "grad_norm": 0.9375, "learning_rate": 0.0004345, "loss": 6.8757, "mean_token_accuracy": 0.1031526930630207, "num_tokens": 1873275.0, "step": 870 }, { "entropy": 7.275309658050537, "epoch": 0.05114267344672395, "grad_norm": 0.9921875, "learning_rate": 0.000437, "loss": 6.9153, "mean_token_accuracy": 0.10134659111499786, "num_tokens": 1884724.0, "step": 875 }, { "entropy": 7.248415899276734, "epoch": 0.05143491729499094, "grad_norm": 1.1171875, "learning_rate": 0.0004395, "loss": 6.8861, "mean_token_accuracy": 0.09837430268526078, "num_tokens": 1894705.0, "step": 880 }, { "entropy": 7.133459377288818, "epoch": 0.051727161143257934, "grad_norm": 0.953125, "learning_rate": 0.000442, "loss": 6.9485, "mean_token_accuracy": 0.09655695110559463, "num_tokens": 1906553.0, "step": 885 }, { "entropy": 7.257501792907715, "epoch": 0.05201940499152493, "grad_norm": 1.0, "learning_rate": 0.0004445, "loss": 6.8849, "mean_token_accuracy": 0.1023280717432499, "num_tokens": 1916628.0, "step": 890 }, { "entropy": 7.0709809303283695, "epoch": 0.052311648839791926, "grad_norm": 1.2421875, "learning_rate": 0.000447, "loss": 6.725, "mean_token_accuracy": 0.11589453369379044, "num_tokens": 1926686.0, "step": 895 }, { "entropy": 7.150864934921264, "epoch": 0.052603892688058915, "grad_norm": 2.25, "learning_rate": 0.00044950000000000003, "loss": 6.9068, "mean_token_accuracy": 0.101015555113554, "num_tokens": 1938150.0, "step": 900 }, { "entropy": 7.1812304019927975, "epoch": 0.05289613653632591, "grad_norm": 1.0078125, "learning_rate": 0.00045200000000000004, "loss": 6.8918, "mean_token_accuracy": 0.097091793268919, "num_tokens": 1948617.0, "step": 905 }, { "entropy": 7.160140323638916, "epoch": 0.053188380384592907, "grad_norm": 1.0234375, "learning_rate": 0.00045450000000000004, "loss": 6.8934, "mean_token_accuracy": 0.10218235999345779, "num_tokens": 1958943.0, "step": 910 }, { "entropy": 7.165960168838501, "epoch": 0.053480624232859895, "grad_norm": 0.9609375, "learning_rate": 0.00045700000000000005, "loss": 6.8192, "mean_token_accuracy": 0.10898060277104378, "num_tokens": 1968988.0, "step": 915 }, { "entropy": 7.051486253738403, "epoch": 0.05377286808112689, "grad_norm": 1.0546875, "learning_rate": 0.00045950000000000006, "loss": 6.7949, "mean_token_accuracy": 0.10556035414338112, "num_tokens": 1979490.0, "step": 920 }, { "entropy": 7.28261432647705, "epoch": 0.05406511192939389, "grad_norm": 1.0546875, "learning_rate": 0.000462, "loss": 6.8574, "mean_token_accuracy": 0.10469735637307168, "num_tokens": 1990377.0, "step": 925 }, { "entropy": 7.070431137084961, "epoch": 0.05435735577766088, "grad_norm": 1.0703125, "learning_rate": 0.0004645, "loss": 6.8361, "mean_token_accuracy": 0.10013288781046867, "num_tokens": 2001678.0, "step": 930 }, { "entropy": 7.103927278518677, "epoch": 0.05464959962592787, "grad_norm": 1.03125, "learning_rate": 0.000467, "loss": 6.8266, "mean_token_accuracy": 0.10559705421328544, "num_tokens": 2011550.0, "step": 935 }, { "entropy": 7.146097993850708, "epoch": 0.05494184347419487, "grad_norm": 1.0546875, "learning_rate": 0.0004695, "loss": 6.8591, "mean_token_accuracy": 0.10166500806808472, "num_tokens": 2021607.0, "step": 940 }, { "entropy": 7.074561977386475, "epoch": 0.055234087322461864, "grad_norm": 1.0546875, "learning_rate": 0.000472, "loss": 6.831, "mean_token_accuracy": 0.10222307071089745, "num_tokens": 2030975.0, "step": 945 }, { "entropy": 7.097246503829956, "epoch": 0.05552633117072885, "grad_norm": 1.0546875, "learning_rate": 0.0004745, "loss": 6.9034, "mean_token_accuracy": 0.09934694394469261, "num_tokens": 2041799.0, "step": 950 }, { "entropy": 7.116580200195313, "epoch": 0.05581857501899585, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 6.8168, "mean_token_accuracy": 0.10345752537250519, "num_tokens": 2052960.0, "step": 955 }, { "entropy": 7.11494288444519, "epoch": 0.056110818867262845, "grad_norm": 0.99609375, "learning_rate": 0.0004795, "loss": 6.8662, "mean_token_accuracy": 0.09989891946315765, "num_tokens": 2064156.0, "step": 960 }, { "entropy": 7.182250165939331, "epoch": 0.05640306271552984, "grad_norm": 0.984375, "learning_rate": 0.000482, "loss": 6.8254, "mean_token_accuracy": 0.10051817372441292, "num_tokens": 2074774.0, "step": 965 }, { "entropy": 7.077956199645996, "epoch": 0.05669530656379683, "grad_norm": 1.03125, "learning_rate": 0.0004845, "loss": 6.8527, "mean_token_accuracy": 0.10035398751497268, "num_tokens": 2086164.0, "step": 970 }, { "entropy": 6.885358047485352, "epoch": 0.056987550412063825, "grad_norm": 1.171875, "learning_rate": 0.000487, "loss": 6.672, "mean_token_accuracy": 0.127625822275877, "num_tokens": 2096268.0, "step": 975 }, { "entropy": 7.233099365234375, "epoch": 0.05727979426033082, "grad_norm": 1.0390625, "learning_rate": 0.0004895, "loss": 6.8813, "mean_token_accuracy": 0.09680663272738457, "num_tokens": 2108511.0, "step": 980 }, { "entropy": 7.136028242111206, "epoch": 0.05757203810859782, "grad_norm": 0.96484375, "learning_rate": 0.000492, "loss": 6.8085, "mean_token_accuracy": 0.0988966628909111, "num_tokens": 2119622.0, "step": 985 }, { "entropy": 6.998387289047241, "epoch": 0.057864281956864806, "grad_norm": 0.88671875, "learning_rate": 0.0004945, "loss": 6.8613, "mean_token_accuracy": 0.10771243944764138, "num_tokens": 2131021.0, "step": 990 }, { "entropy": 7.106973361968994, "epoch": 0.0581565258051318, "grad_norm": 1.0625, "learning_rate": 0.000497, "loss": 6.8496, "mean_token_accuracy": 0.10358692184090615, "num_tokens": 2141797.0, "step": 995 }, { "entropy": 7.108656787872315, "epoch": 0.0584487696533988, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.7338, "mean_token_accuracy": 0.10600685104727745, "num_tokens": 2153609.0, "step": 1000 }, { "entropy": 7.041635751724243, "epoch": 0.05874101350166579, "grad_norm": 0.95703125, "learning_rate": 0.000499998026082006, "loss": 6.8544, "mean_token_accuracy": 0.10038745403289795, "num_tokens": 2164237.0, "step": 1005 }, { "entropy": 7.159450626373291, "epoch": 0.05903325734993278, "grad_norm": 1.125, "learning_rate": 0.0004999900070995136, "loss": 6.8092, "mean_token_accuracy": 0.09949537962675095, "num_tokens": 2175035.0, "step": 1010 }, { "entropy": 6.941095781326294, "epoch": 0.05932550119819978, "grad_norm": 1.03125, "learning_rate": 0.0004999758199023239, "loss": 6.7273, "mean_token_accuracy": 0.10634237006306649, "num_tokens": 2186217.0, "step": 1015 }, { "entropy": 7.0672167301177975, "epoch": 0.059617745046466775, "grad_norm": 1.109375, "learning_rate": 0.0004999554648793858, "loss": 6.777, "mean_token_accuracy": 0.10704884603619576, "num_tokens": 2197290.0, "step": 1020 }, { "entropy": 6.999376821517944, "epoch": 0.059909988894733764, "grad_norm": 1.125, "learning_rate": 0.0004999289425887425, "loss": 6.8155, "mean_token_accuracy": 0.0990687295794487, "num_tokens": 2208835.0, "step": 1025 }, { "entropy": 7.138485765457153, "epoch": 0.06020223274300076, "grad_norm": 1.0859375, "learning_rate": 0.0004998962537575161, "loss": 6.7249, "mean_token_accuracy": 0.10986540690064431, "num_tokens": 2219153.0, "step": 1030 }, { "entropy": 6.9783261775970455, "epoch": 0.060494476591267755, "grad_norm": 1.15625, "learning_rate": 0.0004998573992818874, "loss": 6.7549, "mean_token_accuracy": 0.10616105198860168, "num_tokens": 2230289.0, "step": 1035 }, { "entropy": 6.989655160903931, "epoch": 0.060786720439534744, "grad_norm": 0.90625, "learning_rate": 0.0004998123802270715, "loss": 6.8395, "mean_token_accuracy": 0.10555440336465835, "num_tokens": 2241768.0, "step": 1040 }, { "entropy": 7.044928169250488, "epoch": 0.06107896428780174, "grad_norm": 1.03125, "learning_rate": 0.0004997611978272886, "loss": 6.7114, "mean_token_accuracy": 0.11182207837700844, "num_tokens": 2253249.0, "step": 1045 }, { "entropy": 6.989438867568969, "epoch": 0.061371208136068736, "grad_norm": 1.1015625, "learning_rate": 0.0004997038534857298, "loss": 6.7792, "mean_token_accuracy": 0.09858244881033898, "num_tokens": 2263961.0, "step": 1050 }, { "entropy": 6.941675472259521, "epoch": 0.06166345198433573, "grad_norm": 1.109375, "learning_rate": 0.0004996403487745194, "loss": 6.6945, "mean_token_accuracy": 0.11112689971923828, "num_tokens": 2274016.0, "step": 1055 }, { "entropy": 6.96781735420227, "epoch": 0.06195569583260272, "grad_norm": 0.9375, "learning_rate": 0.000499570685434671, "loss": 6.7391, "mean_token_accuracy": 0.10291829779744148, "num_tokens": 2285164.0, "step": 1060 }, { "entropy": 7.105303335189819, "epoch": 0.06224793968086972, "grad_norm": 1.15625, "learning_rate": 0.0004994948653760405, "loss": 6.7238, "mean_token_accuracy": 0.10441325902938843, "num_tokens": 2294887.0, "step": 1065 }, { "entropy": 6.961658096313476, "epoch": 0.0625401835291367, "grad_norm": 0.9453125, "learning_rate": 0.0004994128906772729, "loss": 6.7424, "mean_token_accuracy": 0.10544760972261429, "num_tokens": 2305787.0, "step": 1070 }, { "entropy": 7.00815224647522, "epoch": 0.0628324273774037, "grad_norm": 0.99609375, "learning_rate": 0.000499324763585746, "loss": 6.7683, "mean_token_accuracy": 0.10668534934520721, "num_tokens": 2316756.0, "step": 1075 }, { "entropy": 7.019680690765381, "epoch": 0.0631246712256707, "grad_norm": 1.0703125, "learning_rate": 0.0004992304865175085, "loss": 6.783, "mean_token_accuracy": 0.10868853554129601, "num_tokens": 2327335.0, "step": 1080 }, { "entropy": 7.018626260757446, "epoch": 0.0634169150739377, "grad_norm": 1.0703125, "learning_rate": 0.0004991300620572138, "loss": 6.7444, "mean_token_accuracy": 0.1080512523651123, "num_tokens": 2337182.0, "step": 1085 }, { "entropy": 7.036516618728638, "epoch": 0.06370915892220469, "grad_norm": 1.015625, "learning_rate": 0.0004990234929580494, "loss": 6.7131, "mean_token_accuracy": 0.10611762776970864, "num_tokens": 2347843.0, "step": 1090 }, { "entropy": 6.903224134445191, "epoch": 0.06400140277047169, "grad_norm": 1.125, "learning_rate": 0.0004989107821416609, "loss": 6.7136, "mean_token_accuracy": 0.10907531604170799, "num_tokens": 2358159.0, "step": 1095 }, { "entropy": 6.897138977050782, "epoch": 0.06429364661873868, "grad_norm": 1.0546875, "learning_rate": 0.0004987919326980723, "loss": 6.6937, "mean_token_accuracy": 0.10973558053374291, "num_tokens": 2368191.0, "step": 1100 }, { "entropy": 6.996454906463623, "epoch": 0.06458589046700566, "grad_norm": 1.0625, "learning_rate": 0.0004986669478856011, "loss": 6.6386, "mean_token_accuracy": 0.11236895397305488, "num_tokens": 2377672.0, "step": 1105 }, { "entropy": 6.894516134262085, "epoch": 0.06487813431527266, "grad_norm": 1.0234375, "learning_rate": 0.0004985358311307688, "loss": 6.7148, "mean_token_accuracy": 0.11475707441568375, "num_tokens": 2387612.0, "step": 1110 }, { "entropy": 6.9777552604675295, "epoch": 0.06517037816353966, "grad_norm": 1.1015625, "learning_rate": 0.0004983985860282081, "loss": 6.6564, "mean_token_accuracy": 0.11448713690042496, "num_tokens": 2397198.0, "step": 1115 }, { "entropy": 6.946916341781616, "epoch": 0.06546262201180665, "grad_norm": 1.0703125, "learning_rate": 0.0004982552163405623, "loss": 6.6935, "mean_token_accuracy": 0.11213591918349267, "num_tokens": 2407816.0, "step": 1120 }, { "entropy": 6.891662502288819, "epoch": 0.06575486586007365, "grad_norm": 1.0703125, "learning_rate": 0.0004981057259983839, "loss": 6.6816, "mean_token_accuracy": 0.10039346590638161, "num_tokens": 2419537.0, "step": 1125 }, { "entropy": 6.98465371131897, "epoch": 0.06604710970834064, "grad_norm": 1.140625, "learning_rate": 0.0004979501191000262, "loss": 6.6259, "mean_token_accuracy": 0.10811248049139977, "num_tokens": 2429043.0, "step": 1130 }, { "entropy": 6.832172632217407, "epoch": 0.06633935355660764, "grad_norm": 0.953125, "learning_rate": 0.0004977883999115311, "loss": 6.6566, "mean_token_accuracy": 0.11272674351930619, "num_tokens": 2439469.0, "step": 1135 }, { "entropy": 6.94088830947876, "epoch": 0.06663159740487462, "grad_norm": 1.140625, "learning_rate": 0.0004976205728665113, "loss": 6.6637, "mean_token_accuracy": 0.1104379877448082, "num_tokens": 2449831.0, "step": 1140 }, { "entropy": 6.871842384338379, "epoch": 0.06692384125314162, "grad_norm": 0.9296875, "learning_rate": 0.0004974466425660307, "loss": 6.6029, "mean_token_accuracy": 0.1185630053281784, "num_tokens": 2460709.0, "step": 1145 }, { "entropy": 6.824612331390381, "epoch": 0.06721608510140861, "grad_norm": 0.9375, "learning_rate": 0.0004972666137784759, "loss": 6.6444, "mean_token_accuracy": 0.11218708977103234, "num_tokens": 2472246.0, "step": 1150 }, { "entropy": 6.884087419509887, "epoch": 0.06750832894967561, "grad_norm": 1.0390625, "learning_rate": 0.0004970804914394271, "loss": 6.6262, "mean_token_accuracy": 0.11107529774308204, "num_tokens": 2482793.0, "step": 1155 }, { "entropy": 6.801684379577637, "epoch": 0.0678005727979426, "grad_norm": 1.0390625, "learning_rate": 0.0004968882806515225, "loss": 6.6194, "mean_token_accuracy": 0.117616818100214, "num_tokens": 2493186.0, "step": 1160 }, { "entropy": 6.965762662887573, "epoch": 0.0680928166462096, "grad_norm": 0.953125, "learning_rate": 0.0004966899866843177, "loss": 6.6642, "mean_token_accuracy": 0.1107054591178894, "num_tokens": 2505100.0, "step": 1165 }, { "entropy": 6.8852849960327145, "epoch": 0.0683850604944766, "grad_norm": 0.98046875, "learning_rate": 0.000496485614974142, "loss": 6.6706, "mean_token_accuracy": 0.10744462683796882, "num_tokens": 2515373.0, "step": 1170 }, { "entropy": 6.896916151046753, "epoch": 0.06867730434274359, "grad_norm": 1.078125, "learning_rate": 0.0004962751711239492, "loss": 6.6578, "mean_token_accuracy": 0.11280061826109886, "num_tokens": 2526645.0, "step": 1175 }, { "entropy": 6.876949310302734, "epoch": 0.06896954819101057, "grad_norm": 0.984375, "learning_rate": 0.0004960586609031636, "loss": 6.6726, "mean_token_accuracy": 0.10913796946406365, "num_tokens": 2537109.0, "step": 1180 }, { "entropy": 6.938536024093628, "epoch": 0.06926179203927757, "grad_norm": 0.890625, "learning_rate": 0.0004958360902475224, "loss": 6.6137, "mean_token_accuracy": 0.11598925217986107, "num_tokens": 2548709.0, "step": 1185 }, { "entropy": 6.8740095615386965, "epoch": 0.06955403588754457, "grad_norm": 1.0, "learning_rate": 0.0004956074652589125, "loss": 6.6629, "mean_token_accuracy": 0.1084805577993393, "num_tokens": 2559802.0, "step": 1190 }, { "entropy": 6.837321758270264, "epoch": 0.06984627973581156, "grad_norm": 1.1640625, "learning_rate": 0.0004953727922052035, "loss": 6.6605, "mean_token_accuracy": 0.10946222245693207, "num_tokens": 2570343.0, "step": 1195 }, { "entropy": 6.8656223773956295, "epoch": 0.07013852358407856, "grad_norm": 1.1328125, "learning_rate": 0.0004951320775200756, "loss": 6.6447, "mean_token_accuracy": 0.10875394120812416, "num_tokens": 2580772.0, "step": 1200 }, { "entropy": 6.828289127349853, "epoch": 0.07043076743234555, "grad_norm": 1.0390625, "learning_rate": 0.0004948853278028436, "loss": 6.6375, "mean_token_accuracy": 0.11186778992414474, "num_tokens": 2592383.0, "step": 1205 }, { "entropy": 6.913778018951416, "epoch": 0.07072301128061255, "grad_norm": 1.046875, "learning_rate": 0.0004946325498182755, "loss": 6.6364, "mean_token_accuracy": 0.10910762697458268, "num_tokens": 2602807.0, "step": 1210 }, { "entropy": 6.835033416748047, "epoch": 0.07101525512887953, "grad_norm": 1.0546875, "learning_rate": 0.0004943737504964076, "loss": 6.629, "mean_token_accuracy": 0.11060894504189492, "num_tokens": 2613978.0, "step": 1215 }, { "entropy": 6.906363582611084, "epoch": 0.07130749897714653, "grad_norm": 1.0, "learning_rate": 0.000494108936932354, "loss": 6.6075, "mean_token_accuracy": 0.11025396510958671, "num_tokens": 2624044.0, "step": 1220 }, { "entropy": 6.882346868515015, "epoch": 0.07159974282541352, "grad_norm": 1.015625, "learning_rate": 0.0004938381163861124, "loss": 6.6085, "mean_token_accuracy": 0.11288385465741158, "num_tokens": 2635550.0, "step": 1225 }, { "entropy": 6.821655368804931, "epoch": 0.07189198667368052, "grad_norm": 0.9453125, "learning_rate": 0.0004935612962823645, "loss": 6.5774, "mean_token_accuracy": 0.11880745887756347, "num_tokens": 2645343.0, "step": 1230 }, { "entropy": 6.8402406692504885, "epoch": 0.07218423052194751, "grad_norm": 1.0546875, "learning_rate": 0.0004932784842102739, "loss": 6.6189, "mean_token_accuracy": 0.11299417838454247, "num_tokens": 2655366.0, "step": 1235 }, { "entropy": 6.900226879119873, "epoch": 0.07247647437021451, "grad_norm": 1.1171875, "learning_rate": 0.0004929896879232758, "loss": 6.6044, "mean_token_accuracy": 0.11406284347176551, "num_tokens": 2666438.0, "step": 1240 }, { "entropy": 6.799708652496338, "epoch": 0.0727687182184815, "grad_norm": 0.94921875, "learning_rate": 0.0004926949153388668, "loss": 6.5675, "mean_token_accuracy": 0.1110381007194519, "num_tokens": 2677800.0, "step": 1245 }, { "entropy": 6.799835634231568, "epoch": 0.07306096206674849, "grad_norm": 0.91796875, "learning_rate": 0.0004923941745383859, "loss": 6.5575, "mean_token_accuracy": 0.1164891928434372, "num_tokens": 2688876.0, "step": 1250 }, { "entropy": 6.823706436157226, "epoch": 0.07335320591501548, "grad_norm": 0.9765625, "learning_rate": 0.000492087473766794, "loss": 6.5231, "mean_token_accuracy": 0.12699810415506363, "num_tokens": 2700265.0, "step": 1255 }, { "entropy": 6.76237301826477, "epoch": 0.07364544976328248, "grad_norm": 1.0625, "learning_rate": 0.000491774821432448, "loss": 6.555, "mean_token_accuracy": 0.12002863585948945, "num_tokens": 2711336.0, "step": 1260 }, { "entropy": 6.826159906387329, "epoch": 0.07393769361154948, "grad_norm": 1.0859375, "learning_rate": 0.0004914562261068693, "loss": 6.6281, "mean_token_accuracy": 0.11225389763712883, "num_tokens": 2722138.0, "step": 1265 }, { "entropy": 6.837359285354614, "epoch": 0.07422993745981647, "grad_norm": 0.94140625, "learning_rate": 0.0004911316965245098, "loss": 6.5622, "mean_token_accuracy": 0.11845961436629296, "num_tokens": 2733016.0, "step": 1270 }, { "entropy": 6.825304698944092, "epoch": 0.07452218130808347, "grad_norm": 0.99609375, "learning_rate": 0.000490801241582512, "loss": 6.5785, "mean_token_accuracy": 0.11900259032845498, "num_tokens": 2743424.0, "step": 1275 }, { "entropy": 6.865557479858398, "epoch": 0.07481442515635046, "grad_norm": 1.015625, "learning_rate": 0.000490464870340465, "loss": 6.616, "mean_token_accuracy": 0.11359821557998658, "num_tokens": 2753867.0, "step": 1280 }, { "entropy": 6.791312026977539, "epoch": 0.07510666900461745, "grad_norm": 1.0390625, "learning_rate": 0.0004901225920201563, "loss": 6.5132, "mean_token_accuracy": 0.11576777994632721, "num_tokens": 2764602.0, "step": 1285 }, { "entropy": 6.750291347503662, "epoch": 0.07539891285288444, "grad_norm": 0.93359375, "learning_rate": 0.000489774416005319, "loss": 6.627, "mean_token_accuracy": 0.11037226766347885, "num_tokens": 2775907.0, "step": 1290 }, { "entropy": 6.848241567611694, "epoch": 0.07569115670115144, "grad_norm": 1.1015625, "learning_rate": 0.0004894203518413742, "loss": 6.5906, "mean_token_accuracy": 0.11550377830862998, "num_tokens": 2787455.0, "step": 1295 }, { "entropy": 6.756697750091552, "epoch": 0.07598340054941843, "grad_norm": 0.9296875, "learning_rate": 0.0004890604092351701, "loss": 6.5252, "mean_token_accuracy": 0.12691028639674187, "num_tokens": 2797600.0, "step": 1300 }, { "entropy": 6.748210525512695, "epoch": 0.07627564439768543, "grad_norm": 1.0625, "learning_rate": 0.000488694598054715, "loss": 6.4557, "mean_token_accuracy": 0.12226552590727806, "num_tokens": 2808056.0, "step": 1305 }, { "entropy": 6.778938245773316, "epoch": 0.07656788824595243, "grad_norm": 0.99609375, "learning_rate": 0.0004883229283289071, "loss": 6.511, "mean_token_accuracy": 0.11900310069322587, "num_tokens": 2817962.0, "step": 1310 }, { "entropy": 6.7642310619354244, "epoch": 0.07686013209421942, "grad_norm": 0.90625, "learning_rate": 0.00048794541024725993, "loss": 6.5278, "mean_token_accuracy": 0.12055002972483635, "num_tokens": 2828769.0, "step": 1315 }, { "entropy": 6.761574554443359, "epoch": 0.07715237594248642, "grad_norm": 1.0703125, "learning_rate": 0.0004875620541596221, "loss": 6.4627, "mean_token_accuracy": 0.12216627746820449, "num_tokens": 2838983.0, "step": 1320 }, { "entropy": 6.7704860210418705, "epoch": 0.0774446197907534, "grad_norm": 1.109375, "learning_rate": 0.00048717287057589454, "loss": 6.5237, "mean_token_accuracy": 0.10742606818675995, "num_tokens": 2848892.0, "step": 1325 }, { "entropy": 6.73878755569458, "epoch": 0.0777368636390204, "grad_norm": 1.03125, "learning_rate": 0.0004867778701657417, "loss": 6.471, "mean_token_accuracy": 0.12039833962917328, "num_tokens": 2859303.0, "step": 1330 }, { "entropy": 6.816798734664917, "epoch": 0.07802910748728739, "grad_norm": 0.9609375, "learning_rate": 0.00048637706375829955, "loss": 6.696, "mean_token_accuracy": 0.10775517970323563, "num_tokens": 2871318.0, "step": 1335 }, { "entropy": 6.841889810562134, "epoch": 0.07832135133555439, "grad_norm": 0.91015625, "learning_rate": 0.000485970462341878, "loss": 6.516, "mean_token_accuracy": 0.11806261539459229, "num_tokens": 2882150.0, "step": 1340 }, { "entropy": 6.674707317352295, "epoch": 0.07861359518382138, "grad_norm": 1.0546875, "learning_rate": 0.00048555807706366044, "loss": 6.4974, "mean_token_accuracy": 0.1205772653222084, "num_tokens": 2892657.0, "step": 1345 }, { "entropy": 6.792233276367187, "epoch": 0.07890583903208838, "grad_norm": 1.0859375, "learning_rate": 0.00048513991922939756, "loss": 6.4611, "mean_token_accuracy": 0.12206808105111122, "num_tokens": 2903298.0, "step": 1350 }, { "entropy": 6.646578741073609, "epoch": 0.07919808288035537, "grad_norm": 1.03125, "learning_rate": 0.00048471600030309744, "loss": 6.5163, "mean_token_accuracy": 0.11933484375476837, "num_tokens": 2914684.0, "step": 1355 }, { "entropy": 6.808360195159912, "epoch": 0.07949032672862236, "grad_norm": 1.0078125, "learning_rate": 0.00048428633190671186, "loss": 6.4423, "mean_token_accuracy": 0.12348946481943131, "num_tokens": 2925191.0, "step": 1360 }, { "entropy": 6.701859855651856, "epoch": 0.07978257057688935, "grad_norm": 1.0234375, "learning_rate": 0.0004838509258198167, "loss": 6.5226, "mean_token_accuracy": 0.12045117989182472, "num_tokens": 2935498.0, "step": 1365 }, { "entropy": 6.793068552017212, "epoch": 0.08007481442515635, "grad_norm": 1.0859375, "learning_rate": 0.00048340979397929, "loss": 6.4408, "mean_token_accuracy": 0.12177050709724427, "num_tokens": 2945590.0, "step": 1370 }, { "entropy": 6.6989601135253904, "epoch": 0.08036705827342334, "grad_norm": 1.0234375, "learning_rate": 0.00048296294847898386, "loss": 6.415, "mean_token_accuracy": 0.1295503109693527, "num_tokens": 2954959.0, "step": 1375 }, { "entropy": 6.739167213439941, "epoch": 0.08065930212169034, "grad_norm": 1.015625, "learning_rate": 0.0004825104015693934, "loss": 6.4962, "mean_token_accuracy": 0.12157377004623413, "num_tokens": 2964808.0, "step": 1380 }, { "entropy": 6.74145622253418, "epoch": 0.08095154596995734, "grad_norm": 1.125, "learning_rate": 0.0004820521656573208, "loss": 6.4832, "mean_token_accuracy": 0.12358191087841988, "num_tokens": 2975032.0, "step": 1385 }, { "entropy": 6.724349927902222, "epoch": 0.08124378981822433, "grad_norm": 1.1171875, "learning_rate": 0.00048158825330553505, "loss": 6.4382, "mean_token_accuracy": 0.12445014715194702, "num_tokens": 2984426.0, "step": 1390 }, { "entropy": 6.618544483184815, "epoch": 0.08153603366649131, "grad_norm": 0.9765625, "learning_rate": 0.00048111867723242763, "loss": 6.5059, "mean_token_accuracy": 0.11675598993897437, "num_tokens": 2994871.0, "step": 1395 }, { "entropy": 6.759203100204468, "epoch": 0.08182827751475831, "grad_norm": 1.0, "learning_rate": 0.0004806434503116637, "loss": 6.4283, "mean_token_accuracy": 0.1238317184150219, "num_tokens": 3004800.0, "step": 1400 }, { "entropy": 6.709669494628907, "epoch": 0.0821205213630253, "grad_norm": 1.03125, "learning_rate": 0.0004801625855718296, "loss": 6.5211, "mean_token_accuracy": 0.11378786638379097, "num_tokens": 3015561.0, "step": 1405 }, { "entropy": 6.706784200668335, "epoch": 0.0824127652112923, "grad_norm": 0.97265625, "learning_rate": 0.00047967609619607477, "loss": 6.4702, "mean_token_accuracy": 0.11403566598892212, "num_tokens": 3025885.0, "step": 1410 }, { "entropy": 6.691977500915527, "epoch": 0.0827050090595593, "grad_norm": 0.97265625, "learning_rate": 0.0004791839955217513, "loss": 6.4026, "mean_token_accuracy": 0.12606138437986375, "num_tokens": 3035524.0, "step": 1415 }, { "entropy": 6.703480625152588, "epoch": 0.0829972529078263, "grad_norm": 0.984375, "learning_rate": 0.00047868629704004786, "loss": 6.5224, "mean_token_accuracy": 0.11795256957411766, "num_tokens": 3046957.0, "step": 1420 }, { "entropy": 6.78633394241333, "epoch": 0.08328949675609329, "grad_norm": 1.078125, "learning_rate": 0.00047818301439561965, "loss": 6.4441, "mean_token_accuracy": 0.11978953778743744, "num_tokens": 3056713.0, "step": 1425 }, { "entropy": 6.641093826293945, "epoch": 0.08358174060436027, "grad_norm": 0.890625, "learning_rate": 0.00047767416138621454, "loss": 6.432, "mean_token_accuracy": 0.12080147936940193, "num_tokens": 3068369.0, "step": 1430 }, { "entropy": 6.655155420303345, "epoch": 0.08387398445262727, "grad_norm": 0.93359375, "learning_rate": 0.000477159751962295, "loss": 6.4762, "mean_token_accuracy": 0.12348118275403977, "num_tokens": 3079083.0, "step": 1435 }, { "entropy": 6.710379791259766, "epoch": 0.08416622830089426, "grad_norm": 1.0546875, "learning_rate": 0.00047663980022665507, "loss": 6.5061, "mean_token_accuracy": 0.11596815660595894, "num_tokens": 3089150.0, "step": 1440 }, { "entropy": 6.672757816314697, "epoch": 0.08445847214916126, "grad_norm": 1.0078125, "learning_rate": 0.00047611432043403437, "loss": 6.416, "mean_token_accuracy": 0.12834767252206802, "num_tokens": 3098696.0, "step": 1445 }, { "entropy": 6.736963558197021, "epoch": 0.08475071599742826, "grad_norm": 1.03125, "learning_rate": 0.0004755833269907267, "loss": 6.4355, "mean_token_accuracy": 0.120185237377882, "num_tokens": 3108879.0, "step": 1450 }, { "entropy": 6.7161966323852536, "epoch": 0.08504295984569525, "grad_norm": 1.0546875, "learning_rate": 0.0004750468344541857, "loss": 6.3953, "mean_token_accuracy": 0.12836327031254768, "num_tokens": 3118756.0, "step": 1455 }, { "entropy": 6.680994129180908, "epoch": 0.08533520369396225, "grad_norm": 1.015625, "learning_rate": 0.00047450485753262525, "loss": 6.4487, "mean_token_accuracy": 0.1232797771692276, "num_tokens": 3129130.0, "step": 1460 }, { "entropy": 6.678233671188354, "epoch": 0.08562744754222923, "grad_norm": 0.9296875, "learning_rate": 0.00047395741108461633, "loss": 6.4116, "mean_token_accuracy": 0.12097690925002098, "num_tokens": 3139528.0, "step": 1465 }, { "entropy": 6.644343137741089, "epoch": 0.08591969139049623, "grad_norm": 1.015625, "learning_rate": 0.00047340451011867985, "loss": 6.4864, "mean_token_accuracy": 0.12138932570815086, "num_tokens": 3149456.0, "step": 1470 }, { "entropy": 6.659511518478394, "epoch": 0.08621193523876322, "grad_norm": 0.98828125, "learning_rate": 0.00047284616979287515, "loss": 6.4144, "mean_token_accuracy": 0.12389760985970497, "num_tokens": 3159851.0, "step": 1475 }, { "entropy": 6.634909582138062, "epoch": 0.08650417908703022, "grad_norm": 1.0625, "learning_rate": 0.00047228240541438433, "loss": 6.3856, "mean_token_accuracy": 0.13249688521027564, "num_tokens": 3169897.0, "step": 1480 }, { "entropy": 6.706868124008179, "epoch": 0.08679642293529721, "grad_norm": 0.99609375, "learning_rate": 0.00047171323243909257, "loss": 6.4994, "mean_token_accuracy": 0.122072122246027, "num_tokens": 3180696.0, "step": 1485 }, { "entropy": 6.659936094284058, "epoch": 0.08708866678356421, "grad_norm": 0.9375, "learning_rate": 0.00047113866647116457, "loss": 6.4162, "mean_token_accuracy": 0.12308593988418579, "num_tokens": 3191836.0, "step": 1490 }, { "entropy": 6.62534909248352, "epoch": 0.0873809106318312, "grad_norm": 1.1171875, "learning_rate": 0.0004705587232626164, "loss": 6.3726, "mean_token_accuracy": 0.12648854553699493, "num_tokens": 3202009.0, "step": 1495 }, { "entropy": 6.55533013343811, "epoch": 0.0876731544800982, "grad_norm": 0.9375, "learning_rate": 0.00046997341871288424, "loss": 6.3333, "mean_token_accuracy": 0.13207703083753586, "num_tokens": 3212707.0, "step": 1500 }, { "entropy": 6.573125410079956, "epoch": 0.08796539832836518, "grad_norm": 0.97265625, "learning_rate": 0.0004693827688683879, "loss": 6.3864, "mean_token_accuracy": 0.12348204627633094, "num_tokens": 3223007.0, "step": 1505 }, { "entropy": 6.721341896057129, "epoch": 0.08825764217663218, "grad_norm": 1.171875, "learning_rate": 0.0004687867899220914, "loss": 6.4061, "mean_token_accuracy": 0.12432565912604332, "num_tokens": 3234634.0, "step": 1510 }, { "entropy": 6.620856046676636, "epoch": 0.08854988602489917, "grad_norm": 1.1015625, "learning_rate": 0.00046818549821305846, "loss": 6.3851, "mean_token_accuracy": 0.12274984940886498, "num_tokens": 3245338.0, "step": 1515 }, { "entropy": 6.665502977371216, "epoch": 0.08884212987316617, "grad_norm": 1.1171875, "learning_rate": 0.00046757891022600494, "loss": 6.4692, "mean_token_accuracy": 0.12268238142132759, "num_tokens": 3255776.0, "step": 1520 }, { "entropy": 6.649141645431518, "epoch": 0.08913437372143317, "grad_norm": 0.96875, "learning_rate": 0.0004669670425908471, "loss": 6.3653, "mean_token_accuracy": 0.13077931180596353, "num_tokens": 3265908.0, "step": 1525 }, { "entropy": 6.644438076019287, "epoch": 0.08942661756970016, "grad_norm": 1.0078125, "learning_rate": 0.0004663499120822451, "loss": 6.4581, "mean_token_accuracy": 0.12222805321216583, "num_tokens": 3277623.0, "step": 1530 }, { "entropy": 6.597890853881836, "epoch": 0.08971886141796716, "grad_norm": 1.0078125, "learning_rate": 0.0004657275356191437, "loss": 6.3924, "mean_token_accuracy": 0.1266896143555641, "num_tokens": 3288804.0, "step": 1535 }, { "entropy": 6.572530078887939, "epoch": 0.09001110526623414, "grad_norm": 0.96875, "learning_rate": 0.00046509993026430804, "loss": 6.4006, "mean_token_accuracy": 0.1275424525141716, "num_tokens": 3299162.0, "step": 1540 }, { "entropy": 6.724449968338012, "epoch": 0.09030334911450114, "grad_norm": 0.98828125, "learning_rate": 0.0004644671132238558, "loss": 6.4128, "mean_token_accuracy": 0.12625961378216743, "num_tokens": 3311425.0, "step": 1545 }, { "entropy": 6.537902307510376, "epoch": 0.09059559296276813, "grad_norm": 0.9765625, "learning_rate": 0.00046382910184678585, "loss": 6.3823, "mean_token_accuracy": 0.12513037025928497, "num_tokens": 3322623.0, "step": 1550 }, { "entropy": 6.771864175796509, "epoch": 0.09088783681103513, "grad_norm": 1.0, "learning_rate": 0.0004631859136245025, "loss": 6.3973, "mean_token_accuracy": 0.12243670225143433, "num_tokens": 3333234.0, "step": 1555 }, { "entropy": 6.626861143112182, "epoch": 0.09118008065930212, "grad_norm": 1.03125, "learning_rate": 0.0004625375661903357, "loss": 6.3902, "mean_token_accuracy": 0.12339795604348183, "num_tokens": 3343302.0, "step": 1560 }, { "entropy": 6.566328763961792, "epoch": 0.09147232450756912, "grad_norm": 1.0546875, "learning_rate": 0.00046188407731905787, "loss": 6.3709, "mean_token_accuracy": 0.11957384571433068, "num_tokens": 3355107.0, "step": 1565 }, { "entropy": 6.633986139297486, "epoch": 0.09176456835583612, "grad_norm": 1.0625, "learning_rate": 0.00046122546492639643, "loss": 6.3414, "mean_token_accuracy": 0.13049424216151237, "num_tokens": 3366459.0, "step": 1570 }, { "entropy": 6.5118812084197994, "epoch": 0.0920568122041031, "grad_norm": 0.94921875, "learning_rate": 0.000460561747068543, "loss": 6.319, "mean_token_accuracy": 0.13351040184497834, "num_tokens": 3377050.0, "step": 1575 }, { "entropy": 6.558924579620362, "epoch": 0.0923490560523701, "grad_norm": 1.0703125, "learning_rate": 0.0004598929419416578, "loss": 6.3246, "mean_token_accuracy": 0.1303851567208767, "num_tokens": 3387810.0, "step": 1580 }, { "entropy": 6.566503572463989, "epoch": 0.09264129990063709, "grad_norm": 1.046875, "learning_rate": 0.00045921906788137123, "loss": 6.2929, "mean_token_accuracy": 0.13062896132469176, "num_tokens": 3398038.0, "step": 1585 }, { "entropy": 6.659072780609131, "epoch": 0.09293354374890408, "grad_norm": 1.125, "learning_rate": 0.00045854014336228115, "loss": 6.3714, "mean_token_accuracy": 0.1278992585837841, "num_tokens": 3408426.0, "step": 1590 }, { "entropy": 6.563223266601563, "epoch": 0.09322578759717108, "grad_norm": 0.9921875, "learning_rate": 0.00045785618699744615, "loss": 6.3084, "mean_token_accuracy": 0.13401768282055854, "num_tokens": 3419268.0, "step": 1595 }, { "entropy": 6.621515703201294, "epoch": 0.09351803144543808, "grad_norm": 0.91796875, "learning_rate": 0.00045716721753787543, "loss": 6.3067, "mean_token_accuracy": 0.13638126030564307, "num_tokens": 3429813.0, "step": 1600 }, { "entropy": 6.482415342330933, "epoch": 0.09381027529370507, "grad_norm": 1.046875, "learning_rate": 0.0004564732538720148, "loss": 6.2883, "mean_token_accuracy": 0.13472536355257034, "num_tokens": 3440062.0, "step": 1605 }, { "entropy": 6.672563982009888, "epoch": 0.09410251914197205, "grad_norm": 0.96484375, "learning_rate": 0.00045577431502522877, "loss": 6.2849, "mean_token_accuracy": 0.1270398922264576, "num_tokens": 3450204.0, "step": 1610 }, { "entropy": 6.488152503967285, "epoch": 0.09439476299023905, "grad_norm": 0.91796875, "learning_rate": 0.0004550704201592787, "loss": 6.3027, "mean_token_accuracy": 0.12851924523711206, "num_tokens": 3460593.0, "step": 1615 }, { "entropy": 6.628467226028443, "epoch": 0.09468700683850605, "grad_norm": 0.91796875, "learning_rate": 0.0004543615885717981, "loss": 6.3229, "mean_token_accuracy": 0.1320893421769142, "num_tokens": 3471617.0, "step": 1620 }, { "entropy": 6.452277565002442, "epoch": 0.09497925068677304, "grad_norm": 1.15625, "learning_rate": 0.00045364783969576296, "loss": 6.3045, "mean_token_accuracy": 0.12825360149145126, "num_tokens": 3481701.0, "step": 1625 }, { "entropy": 6.581420993804931, "epoch": 0.09527149453504004, "grad_norm": 1.109375, "learning_rate": 0.0004529291930989592, "loss": 6.3309, "mean_token_accuracy": 0.12806977778673173, "num_tokens": 3491148.0, "step": 1630 }, { "entropy": 6.6200621128082275, "epoch": 0.09556373838330703, "grad_norm": 1.0, "learning_rate": 0.0004522056684834464, "loss": 6.3644, "mean_token_accuracy": 0.12346012219786644, "num_tokens": 3501675.0, "step": 1635 }, { "entropy": 6.554399871826172, "epoch": 0.09585598223157403, "grad_norm": 1.03125, "learning_rate": 0.0004514772856850173, "loss": 6.3077, "mean_token_accuracy": 0.13186056092381476, "num_tokens": 3512988.0, "step": 1640 }, { "entropy": 6.5387852668762205, "epoch": 0.09614822607984103, "grad_norm": 0.96875, "learning_rate": 0.0004507440646726542, "loss": 6.3082, "mean_token_accuracy": 0.12828391939401626, "num_tokens": 3524004.0, "step": 1645 }, { "entropy": 6.525148534774781, "epoch": 0.09644046992810801, "grad_norm": 0.96484375, "learning_rate": 0.0004500060255479818, "loss": 6.313, "mean_token_accuracy": 0.12847139537334443, "num_tokens": 3533627.0, "step": 1650 }, { "entropy": 6.571453475952149, "epoch": 0.096732713776375, "grad_norm": 0.94140625, "learning_rate": 0.0004492631885447151, "loss": 6.301, "mean_token_accuracy": 0.127740541100502, "num_tokens": 3544798.0, "step": 1655 }, { "entropy": 6.584779834747314, "epoch": 0.097024957624642, "grad_norm": 0.97265625, "learning_rate": 0.00044851557402810616, "loss": 6.404, "mean_token_accuracy": 0.12892045825719833, "num_tokens": 3556379.0, "step": 1660 }, { "entropy": 6.601266098022461, "epoch": 0.097317201472909, "grad_norm": 1.0, "learning_rate": 0.00044776320249438444, "loss": 6.2909, "mean_token_accuracy": 0.1332499749958515, "num_tokens": 3567032.0, "step": 1665 }, { "entropy": 6.583350610733032, "epoch": 0.09760944532117599, "grad_norm": 0.96875, "learning_rate": 0.00044700609457019565, "loss": 6.3648, "mean_token_accuracy": 0.12196323797106742, "num_tokens": 3578419.0, "step": 1670 }, { "entropy": 6.524851226806641, "epoch": 0.09790168916944299, "grad_norm": 1.0703125, "learning_rate": 0.0004462442710120359, "loss": 6.2726, "mean_token_accuracy": 0.13355116918683052, "num_tokens": 3589501.0, "step": 1675 }, { "entropy": 6.51496729850769, "epoch": 0.09819393301770998, "grad_norm": 1.0390625, "learning_rate": 0.000445477752705683, "loss": 6.2603, "mean_token_accuracy": 0.13476647436618805, "num_tokens": 3600162.0, "step": 1680 }, { "entropy": 6.532532167434693, "epoch": 0.09848617686597697, "grad_norm": 1.0234375, "learning_rate": 0.00044470656066562336, "loss": 6.3614, "mean_token_accuracy": 0.1309310808777809, "num_tokens": 3610860.0, "step": 1685 }, { "entropy": 6.55736231803894, "epoch": 0.09877842071424396, "grad_norm": 0.97265625, "learning_rate": 0.0004439307160344765, "loss": 6.3372, "mean_token_accuracy": 0.1256033793091774, "num_tokens": 3620989.0, "step": 1690 }, { "entropy": 6.520544958114624, "epoch": 0.09907066456251096, "grad_norm": 0.91796875, "learning_rate": 0.00044315024008241473, "loss": 6.2777, "mean_token_accuracy": 0.1307544231414795, "num_tokens": 3631602.0, "step": 1695 }, { "entropy": 6.575679063796997, "epoch": 0.09936290841077795, "grad_norm": 1.0625, "learning_rate": 0.0004423651542065806, "loss": 6.3269, "mean_token_accuracy": 0.1257415808737278, "num_tokens": 3642326.0, "step": 1700 }, { "entropy": 6.539660263061523, "epoch": 0.09965515225904495, "grad_norm": 1.0703125, "learning_rate": 0.00044157547993050006, "loss": 6.2822, "mean_token_accuracy": 0.1356342352926731, "num_tokens": 3652036.0, "step": 1705 }, { "entropy": 6.561394262313843, "epoch": 0.09994739610731194, "grad_norm": 1.046875, "learning_rate": 0.00044078123890349227, "loss": 6.3283, "mean_token_accuracy": 0.13123508021235467, "num_tokens": 3661557.0, "step": 1710 }, { "entropy": 6.59216947555542, "epoch": 0.10023963995557894, "grad_norm": 0.91796875, "learning_rate": 0.00043998245290007606, "loss": 6.3135, "mean_token_accuracy": 0.13179217875003815, "num_tokens": 3671487.0, "step": 1715 }, { "entropy": 6.4940907001495365, "epoch": 0.10053188380384592, "grad_norm": 0.98828125, "learning_rate": 0.00043917914381937323, "loss": 6.3445, "mean_token_accuracy": 0.1277608558535576, "num_tokens": 3682873.0, "step": 1720 }, { "entropy": 6.547703456878662, "epoch": 0.10082412765211292, "grad_norm": 0.94921875, "learning_rate": 0.00043837133368450815, "loss": 6.2517, "mean_token_accuracy": 0.1312596969306469, "num_tokens": 3693635.0, "step": 1725 }, { "entropy": 6.48290376663208, "epoch": 0.10111637150037991, "grad_norm": 0.98828125, "learning_rate": 0.0004375590446420037, "loss": 6.2628, "mean_token_accuracy": 0.1380753017961979, "num_tokens": 3703777.0, "step": 1730 }, { "entropy": 6.5642343044281, "epoch": 0.10140861534864691, "grad_norm": 1.0078125, "learning_rate": 0.0004367422989611743, "loss": 6.2828, "mean_token_accuracy": 0.13648706600069999, "num_tokens": 3716370.0, "step": 1735 }, { "entropy": 6.527584552764893, "epoch": 0.1017008591969139, "grad_norm": 0.9609375, "learning_rate": 0.0004359211190335153, "loss": 6.3367, "mean_token_accuracy": 0.13259412199258805, "num_tokens": 3726473.0, "step": 1740 }, { "entropy": 6.588420152664185, "epoch": 0.1019931030451809, "grad_norm": 1.1640625, "learning_rate": 0.00043509552737208923, "loss": 6.3462, "mean_token_accuracy": 0.12390820607542992, "num_tokens": 3737645.0, "step": 1745 }, { "entropy": 6.521403980255127, "epoch": 0.1022853468934479, "grad_norm": 0.9453125, "learning_rate": 0.00043426554661090853, "loss": 6.3338, "mean_token_accuracy": 0.13016941174864768, "num_tokens": 3749347.0, "step": 1750 }, { "entropy": 6.540117597579956, "epoch": 0.10257759074171488, "grad_norm": 1.0234375, "learning_rate": 0.00043343119950431516, "loss": 6.3035, "mean_token_accuracy": 0.13260690197348596, "num_tokens": 3760131.0, "step": 1755 }, { "entropy": 6.532932329177856, "epoch": 0.10286983458998188, "grad_norm": 1.125, "learning_rate": 0.00043259250892635644, "loss": 6.2826, "mean_token_accuracy": 0.12948739156126976, "num_tokens": 3770722.0, "step": 1760 }, { "entropy": 6.5060454368591305, "epoch": 0.10316207843824887, "grad_norm": 1.015625, "learning_rate": 0.0004317494978701582, "loss": 6.2532, "mean_token_accuracy": 0.14073092937469484, "num_tokens": 3781562.0, "step": 1765 }, { "entropy": 6.506136131286621, "epoch": 0.10345432228651587, "grad_norm": 0.94921875, "learning_rate": 0.0004309021894472943, "loss": 6.2594, "mean_token_accuracy": 0.13220234960317612, "num_tokens": 3791029.0, "step": 1770 }, { "entropy": 6.534422826766968, "epoch": 0.10374656613478286, "grad_norm": 0.94921875, "learning_rate": 0.0004300506068871534, "loss": 6.2559, "mean_token_accuracy": 0.13380615487694741, "num_tokens": 3802526.0, "step": 1775 }, { "entropy": 6.4779705047607425, "epoch": 0.10403880998304986, "grad_norm": 1.09375, "learning_rate": 0.00042919477353630135, "loss": 6.2275, "mean_token_accuracy": 0.13506562113761902, "num_tokens": 3813394.0, "step": 1780 }, { "entropy": 6.496424818038941, "epoch": 0.10433105383131686, "grad_norm": 0.9921875, "learning_rate": 0.000428334712857842, "loss": 6.2403, "mean_token_accuracy": 0.1317013218998909, "num_tokens": 3824852.0, "step": 1785 }, { "entropy": 6.487008571624756, "epoch": 0.10462329767958385, "grad_norm": 0.9140625, "learning_rate": 0.00042747044843077304, "loss": 6.2393, "mean_token_accuracy": 0.13541778847575187, "num_tokens": 3835743.0, "step": 1790 }, { "entropy": 6.498304033279419, "epoch": 0.10491554152785083, "grad_norm": 1.0234375, "learning_rate": 0.00042660200394934047, "loss": 6.2294, "mean_token_accuracy": 0.13833673521876336, "num_tokens": 3846897.0, "step": 1795 }, { "entropy": 6.46450982093811, "epoch": 0.10520778537611783, "grad_norm": 0.984375, "learning_rate": 0.00042572940322238844, "loss": 6.2409, "mean_token_accuracy": 0.13357219472527504, "num_tokens": 3857351.0, "step": 1800 }, { "entropy": 6.4254958152771, "epoch": 0.10550002922438483, "grad_norm": 1.078125, "learning_rate": 0.00042485267017270664, "loss": 6.2055, "mean_token_accuracy": 0.13916457816958427, "num_tokens": 3867696.0, "step": 1805 }, { "entropy": 6.512742614746093, "epoch": 0.10579227307265182, "grad_norm": 1.140625, "learning_rate": 0.0004239718288363745, "loss": 6.3049, "mean_token_accuracy": 0.13644790649414062, "num_tokens": 3878473.0, "step": 1810 }, { "entropy": 6.476879119873047, "epoch": 0.10608451692091882, "grad_norm": 0.9765625, "learning_rate": 0.0004230869033621023, "loss": 6.2803, "mean_token_accuracy": 0.1361045390367508, "num_tokens": 3888750.0, "step": 1815 }, { "entropy": 6.549038934707641, "epoch": 0.10637676076918581, "grad_norm": 0.984375, "learning_rate": 0.0004221979180105688, "loss": 6.2918, "mean_token_accuracy": 0.13268638402223587, "num_tokens": 3898867.0, "step": 1820 }, { "entropy": 6.439270830154419, "epoch": 0.10666900461745281, "grad_norm": 1.046875, "learning_rate": 0.00042130489715375645, "loss": 6.2231, "mean_token_accuracy": 0.13936343863606454, "num_tokens": 3909103.0, "step": 1825 }, { "entropy": 6.49756350517273, "epoch": 0.10696124846571979, "grad_norm": 1.125, "learning_rate": 0.00042040786527428335, "loss": 6.1534, "mean_token_accuracy": 0.13987711891531945, "num_tokens": 3919592.0, "step": 1830 }, { "entropy": 6.52377724647522, "epoch": 0.10725349231398679, "grad_norm": 0.94140625, "learning_rate": 0.0004195068469647315, "loss": 6.2452, "mean_token_accuracy": 0.13477420955896377, "num_tokens": 3930730.0, "step": 1835 }, { "entropy": 6.382622146606446, "epoch": 0.10754573616225378, "grad_norm": 1.015625, "learning_rate": 0.00041860186692697297, "loss": 6.2535, "mean_token_accuracy": 0.130735794454813, "num_tokens": 3942535.0, "step": 1840 }, { "entropy": 6.54898157119751, "epoch": 0.10783798001052078, "grad_norm": 0.953125, "learning_rate": 0.00041769294997149264, "loss": 6.2364, "mean_token_accuracy": 0.1324638806283474, "num_tokens": 3953651.0, "step": 1845 }, { "entropy": 6.497935390472412, "epoch": 0.10813022385878777, "grad_norm": 1.0, "learning_rate": 0.0004167801210167081, "loss": 6.2087, "mean_token_accuracy": 0.13810430020093917, "num_tokens": 3963501.0, "step": 1850 }, { "entropy": 6.502410459518432, "epoch": 0.10842246770705477, "grad_norm": 1.0703125, "learning_rate": 0.0004158634050882861, "loss": 6.2066, "mean_token_accuracy": 0.1336246259510517, "num_tokens": 3973617.0, "step": 1855 }, { "entropy": 6.448571395874024, "epoch": 0.10871471155532177, "grad_norm": 1.0, "learning_rate": 0.0004149428273184569, "loss": 6.2734, "mean_token_accuracy": 0.12727659419178963, "num_tokens": 3985313.0, "step": 1860 }, { "entropy": 6.5132608890533445, "epoch": 0.10900695540358875, "grad_norm": 1.125, "learning_rate": 0.0004140184129453253, "loss": 6.2132, "mean_token_accuracy": 0.1299443393945694, "num_tokens": 3995136.0, "step": 1865 }, { "entropy": 6.359571886062622, "epoch": 0.10929919925185574, "grad_norm": 1.09375, "learning_rate": 0.000413090187312178, "loss": 6.1079, "mean_token_accuracy": 0.15453708469867705, "num_tokens": 4004633.0, "step": 1870 }, { "entropy": 6.430087947845459, "epoch": 0.10959144310012274, "grad_norm": 1.0234375, "learning_rate": 0.0004121581758667898, "loss": 6.215, "mean_token_accuracy": 0.13473245427012442, "num_tokens": 4013949.0, "step": 1875 }, { "entropy": 6.497232055664062, "epoch": 0.10988368694838974, "grad_norm": 0.97265625, "learning_rate": 0.00041122240416072533, "loss": 6.1965, "mean_token_accuracy": 0.13759151250123977, "num_tokens": 4024456.0, "step": 1880 }, { "entropy": 6.374862003326416, "epoch": 0.11017593079665673, "grad_norm": 0.94921875, "learning_rate": 0.0004102828978486385, "loss": 6.1864, "mean_token_accuracy": 0.14066949412226676, "num_tokens": 4035271.0, "step": 1885 }, { "entropy": 6.514592981338501, "epoch": 0.11046817464492373, "grad_norm": 0.921875, "learning_rate": 0.0004093396826875695, "loss": 6.2668, "mean_token_accuracy": 0.1375574715435505, "num_tokens": 4045861.0, "step": 1890 }, { "entropy": 6.489775943756103, "epoch": 0.11076041849319072, "grad_norm": 1.0234375, "learning_rate": 0.00040839278453623837, "loss": 6.1744, "mean_token_accuracy": 0.13124485611915587, "num_tokens": 4056060.0, "step": 1895 }, { "entropy": 6.384185409545898, "epoch": 0.1110526623414577, "grad_norm": 0.86328125, "learning_rate": 0.0004074422293543363, "loss": 6.2402, "mean_token_accuracy": 0.13457444533705712, "num_tokens": 4068098.0, "step": 1900 }, { "entropy": 6.451984453201294, "epoch": 0.1113449061897247, "grad_norm": 1.0, "learning_rate": 0.0004064880432018137, "loss": 6.154, "mean_token_accuracy": 0.15216126739978791, "num_tokens": 4079186.0, "step": 1905 }, { "entropy": 6.405668115615844, "epoch": 0.1116371500379917, "grad_norm": 1.09375, "learning_rate": 0.00040553025223816615, "loss": 6.1575, "mean_token_accuracy": 0.14098218828439713, "num_tokens": 4089430.0, "step": 1910 }, { "entropy": 6.461432552337646, "epoch": 0.1119293938862587, "grad_norm": 0.98828125, "learning_rate": 0.00040456888272171653, "loss": 6.1631, "mean_token_accuracy": 0.14054136276245116, "num_tokens": 4099702.0, "step": 1915 }, { "entropy": 6.486164999008179, "epoch": 0.11222163773452569, "grad_norm": 1.03125, "learning_rate": 0.00040360396100889577, "loss": 6.2735, "mean_token_accuracy": 0.127665276825428, "num_tokens": 4111108.0, "step": 1920 }, { "entropy": 6.47590913772583, "epoch": 0.11251388158279269, "grad_norm": 1.0625, "learning_rate": 0.0004026355135535202, "loss": 6.2286, "mean_token_accuracy": 0.13972759246826172, "num_tokens": 4122470.0, "step": 1925 }, { "entropy": 6.409267807006836, "epoch": 0.11280612543105968, "grad_norm": 1.0703125, "learning_rate": 0.000401663566906066, "loss": 6.1722, "mean_token_accuracy": 0.13970772325992584, "num_tokens": 4132652.0, "step": 1930 }, { "entropy": 6.41186146736145, "epoch": 0.11309836927932668, "grad_norm": 1.046875, "learning_rate": 0.00040068814771294134, "loss": 6.253, "mean_token_accuracy": 0.1293734610080719, "num_tokens": 4143449.0, "step": 1935 }, { "entropy": 6.475877523422241, "epoch": 0.11339061312759366, "grad_norm": 1.078125, "learning_rate": 0.0003997092827157562, "loss": 6.1805, "mean_token_accuracy": 0.14184334874153137, "num_tokens": 4153536.0, "step": 1940 }, { "entropy": 6.463614416122437, "epoch": 0.11368285697586065, "grad_norm": 0.96875, "learning_rate": 0.000398726998750589, "loss": 6.2478, "mean_token_accuracy": 0.1280618853867054, "num_tokens": 4165339.0, "step": 1945 }, { "entropy": 6.478766345977784, "epoch": 0.11397510082412765, "grad_norm": 1.0, "learning_rate": 0.00039774132274725076, "loss": 6.2953, "mean_token_accuracy": 0.13131710588932038, "num_tokens": 4177171.0, "step": 1950 }, { "entropy": 6.531812000274658, "epoch": 0.11426734467239465, "grad_norm": 1.0859375, "learning_rate": 0.00039675228172854707, "loss": 6.1826, "mean_token_accuracy": 0.14128784090280533, "num_tokens": 4186577.0, "step": 1955 }, { "entropy": 6.3304266929626465, "epoch": 0.11455958852066164, "grad_norm": 0.91796875, "learning_rate": 0.0003957599028095371, "loss": 6.2077, "mean_token_accuracy": 0.13591980412602425, "num_tokens": 4196962.0, "step": 1960 }, { "entropy": 6.440403938293457, "epoch": 0.11485183236892864, "grad_norm": 0.89453125, "learning_rate": 0.00039476421319679017, "loss": 6.202, "mean_token_accuracy": 0.139873356372118, "num_tokens": 4207544.0, "step": 1965 }, { "entropy": 6.491571664810181, "epoch": 0.11514407621719563, "grad_norm": 0.9375, "learning_rate": 0.00039376524018764, "loss": 6.1867, "mean_token_accuracy": 0.138301333039999, "num_tokens": 4217359.0, "step": 1970 }, { "entropy": 6.42297248840332, "epoch": 0.11543632006546262, "grad_norm": 0.953125, "learning_rate": 0.00039276301116943616, "loss": 6.1981, "mean_token_accuracy": 0.13637675866484641, "num_tokens": 4227826.0, "step": 1975 }, { "entropy": 6.479195499420166, "epoch": 0.11572856391372961, "grad_norm": 0.95703125, "learning_rate": 0.0003917575536187936, "loss": 6.1559, "mean_token_accuracy": 0.13742526918649672, "num_tokens": 4238591.0, "step": 1980 }, { "entropy": 6.44315733909607, "epoch": 0.11602080776199661, "grad_norm": 1.0, "learning_rate": 0.00039074889510083894, "loss": 6.1963, "mean_token_accuracy": 0.13515803813934327, "num_tokens": 4248771.0, "step": 1985 }, { "entropy": 6.484133291244507, "epoch": 0.1163130516102636, "grad_norm": 1.0, "learning_rate": 0.00038973706326845495, "loss": 6.254, "mean_token_accuracy": 0.13710065484046935, "num_tokens": 4259234.0, "step": 1990 }, { "entropy": 6.458966588973999, "epoch": 0.1166052954585306, "grad_norm": 0.9140625, "learning_rate": 0.0003887220858615225, "loss": 6.2597, "mean_token_accuracy": 0.1325739674270153, "num_tokens": 4270891.0, "step": 1995 }, { "entropy": 6.502737188339234, "epoch": 0.1168975393067976, "grad_norm": 1.0234375, "learning_rate": 0.0003877039907061597, "loss": 6.271, "mean_token_accuracy": 0.1323829747736454, "num_tokens": 4282893.0, "step": 2000 }, { "entropy": 6.417344093322754, "epoch": 0.11718978315506459, "grad_norm": 1.1015625, "learning_rate": 0.0003866828057139598, "loss": 6.1572, "mean_token_accuracy": 0.13396240249276162, "num_tokens": 4292630.0, "step": 2005 }, { "entropy": 6.377220344543457, "epoch": 0.11748202700333157, "grad_norm": 0.94921875, "learning_rate": 0.00038565855888122503, "loss": 6.1991, "mean_token_accuracy": 0.13958619087934493, "num_tokens": 4302849.0, "step": 2010 }, { "entropy": 6.4756178855896, "epoch": 0.11777427085159857, "grad_norm": 0.9375, "learning_rate": 0.00038463127828819975, "loss": 6.2179, "mean_token_accuracy": 0.13426078259944915, "num_tokens": 4313178.0, "step": 2015 }, { "entropy": 6.52903003692627, "epoch": 0.11806651469986557, "grad_norm": 1.09375, "learning_rate": 0.00038360099209830043, "loss": 6.2464, "mean_token_accuracy": 0.13791208043694497, "num_tokens": 4323205.0, "step": 2020 }, { "entropy": 6.386642026901245, "epoch": 0.11835875854813256, "grad_norm": 0.921875, "learning_rate": 0.0003825677285573433, "loss": 6.1849, "mean_token_accuracy": 0.1381428360939026, "num_tokens": 4333840.0, "step": 2025 }, { "entropy": 6.479530143737793, "epoch": 0.11865100239639956, "grad_norm": 1.0, "learning_rate": 0.00038153151599277027, "loss": 6.1773, "mean_token_accuracy": 0.14190752506256105, "num_tokens": 4344489.0, "step": 2030 }, { "entropy": 6.454029750823975, "epoch": 0.11894324624466655, "grad_norm": 0.9765625, "learning_rate": 0.0003804923828128723, "loss": 6.1564, "mean_token_accuracy": 0.13591767027974128, "num_tokens": 4355008.0, "step": 2035 }, { "entropy": 6.409417295455933, "epoch": 0.11923549009293355, "grad_norm": 1.0078125, "learning_rate": 0.0003794503575060104, "loss": 6.1939, "mean_token_accuracy": 0.14090473279356958, "num_tokens": 4365944.0, "step": 2040 }, { "entropy": 6.4883616924285885, "epoch": 0.11952773394120053, "grad_norm": 0.98046875, "learning_rate": 0.00037840546863983484, "loss": 6.1953, "mean_token_accuracy": 0.13460226878523826, "num_tokens": 4376448.0, "step": 2045 }, { "entropy": 6.437252426147461, "epoch": 0.11981997778946753, "grad_norm": 0.96484375, "learning_rate": 0.0003773577448605015, "loss": 6.131, "mean_token_accuracy": 0.14052277579903602, "num_tokens": 4386748.0, "step": 2050 }, { "entropy": 6.414979887008667, "epoch": 0.12011222163773452, "grad_norm": 0.9609375, "learning_rate": 0.0003763072148918872, "loss": 6.1115, "mean_token_accuracy": 0.14440772235393523, "num_tokens": 4396956.0, "step": 2055 }, { "entropy": 6.390393924713135, "epoch": 0.12040446548600152, "grad_norm": 1.1484375, "learning_rate": 0.0003752539075348017, "loss": 6.1607, "mean_token_accuracy": 0.1384737014770508, "num_tokens": 4406551.0, "step": 2060 }, { "entropy": 6.506589317321778, "epoch": 0.12069670933426851, "grad_norm": 1.1328125, "learning_rate": 0.00037419785166619817, "loss": 6.1342, "mean_token_accuracy": 0.13821437284350396, "num_tokens": 4416847.0, "step": 2065 }, { "entropy": 6.371277284622193, "epoch": 0.12098895318253551, "grad_norm": 1.0625, "learning_rate": 0.0003731390762383818, "loss": 6.1307, "mean_token_accuracy": 0.14046358093619346, "num_tokens": 4427579.0, "step": 2070 }, { "entropy": 6.357118844985962, "epoch": 0.1212811970308025, "grad_norm": 1.0234375, "learning_rate": 0.0003720776102782158, "loss": 6.1174, "mean_token_accuracy": 0.14415650218725204, "num_tokens": 4438473.0, "step": 2075 }, { "entropy": 6.391526699066162, "epoch": 0.12157344087906949, "grad_norm": 1.015625, "learning_rate": 0.00037101348288632555, "loss": 6.1079, "mean_token_accuracy": 0.1449679099023342, "num_tokens": 4448851.0, "step": 2080 }, { "entropy": 6.311391687393188, "epoch": 0.12186568472733648, "grad_norm": 0.98828125, "learning_rate": 0.0003699467232363012, "loss": 6.1264, "mean_token_accuracy": 0.14008628129959105, "num_tokens": 4459612.0, "step": 2085 }, { "entropy": 6.388618898391724, "epoch": 0.12215792857560348, "grad_norm": 0.98046875, "learning_rate": 0.0003688773605738973, "loss": 6.107, "mean_token_accuracy": 0.14008531495928764, "num_tokens": 4470365.0, "step": 2090 }, { "entropy": 6.348719549179077, "epoch": 0.12245017242387048, "grad_norm": 1.0390625, "learning_rate": 0.00036780542421623134, "loss": 6.1548, "mean_token_accuracy": 0.14530792385339736, "num_tokens": 4481329.0, "step": 2095 }, { "entropy": 6.451541805267334, "epoch": 0.12274241627213747, "grad_norm": 1.0703125, "learning_rate": 0.0003667309435509802, "loss": 6.1099, "mean_token_accuracy": 0.1375292494893074, "num_tokens": 4491904.0, "step": 2100 }, { "entropy": 6.369375848770142, "epoch": 0.12303466012040447, "grad_norm": 1.140625, "learning_rate": 0.0003656539480355741, "loss": 6.0846, "mean_token_accuracy": 0.14959308356046677, "num_tokens": 4501432.0, "step": 2105 }, { "entropy": 6.393247985839844, "epoch": 0.12332690396867146, "grad_norm": 0.9765625, "learning_rate": 0.0003645744671963891, "loss": 6.0733, "mean_token_accuracy": 0.14439773932099342, "num_tokens": 4511512.0, "step": 2110 }, { "entropy": 6.381515789031982, "epoch": 0.12361914781693846, "grad_norm": 0.96875, "learning_rate": 0.0003634925306279376, "loss": 6.177, "mean_token_accuracy": 0.14277450367808342, "num_tokens": 4521701.0, "step": 2115 }, { "entropy": 6.400973653793335, "epoch": 0.12391139166520544, "grad_norm": 1.0546875, "learning_rate": 0.0003624081679920574, "loss": 6.1464, "mean_token_accuracy": 0.1424795500934124, "num_tokens": 4531512.0, "step": 2120 }, { "entropy": 6.378998327255249, "epoch": 0.12420363551347244, "grad_norm": 1.0234375, "learning_rate": 0.0003613214090170977, "loss": 6.1222, "mean_token_accuracy": 0.1437835432589054, "num_tokens": 4542083.0, "step": 2125 }, { "entropy": 6.3635622501373295, "epoch": 0.12449587936173943, "grad_norm": 0.94921875, "learning_rate": 0.0003602322834971048, "loss": 6.1267, "mean_token_accuracy": 0.1413314886391163, "num_tokens": 4553207.0, "step": 2130 }, { "entropy": 6.4260810852050785, "epoch": 0.12478812321000643, "grad_norm": 0.94140625, "learning_rate": 0.0003591408212910051, "loss": 6.1772, "mean_token_accuracy": 0.13948365449905395, "num_tokens": 4564349.0, "step": 2135 }, { "entropy": 6.413608407974243, "epoch": 0.1250803670582734, "grad_norm": 1.15625, "learning_rate": 0.0003580470523217863, "loss": 6.0712, "mean_token_accuracy": 0.14198292568325996, "num_tokens": 4574935.0, "step": 2140 }, { "entropy": 6.339417600631714, "epoch": 0.12537261090654042, "grad_norm": 1.09375, "learning_rate": 0.0003569510065756771, "loss": 6.1782, "mean_token_accuracy": 0.13700612559914588, "num_tokens": 4586439.0, "step": 2145 }, { "entropy": 6.337814044952393, "epoch": 0.1256648547548074, "grad_norm": 0.9453125, "learning_rate": 0.0003558527141013254, "loss": 6.0303, "mean_token_accuracy": 0.151566082239151, "num_tokens": 4596439.0, "step": 2150 }, { "entropy": 6.288027906417847, "epoch": 0.1259570986030744, "grad_norm": 1.0390625, "learning_rate": 0.0003547522050089742, "loss": 6.1032, "mean_token_accuracy": 0.14451807215809823, "num_tokens": 4606920.0, "step": 2155 }, { "entropy": 6.478337049484253, "epoch": 0.1262493424513414, "grad_norm": 0.98046875, "learning_rate": 0.00035364950946963606, "loss": 6.1458, "mean_token_accuracy": 0.14522892534732817, "num_tokens": 4618234.0, "step": 2160 }, { "entropy": 6.32128791809082, "epoch": 0.1265415862996084, "grad_norm": 1.0234375, "learning_rate": 0.0003525446577142663, "loss": 5.9731, "mean_token_accuracy": 0.15805664658546448, "num_tokens": 4629201.0, "step": 2165 }, { "entropy": 6.391382646560669, "epoch": 0.1268338301478754, "grad_norm": 0.93359375, "learning_rate": 0.00035143768003293395, "loss": 6.2195, "mean_token_accuracy": 0.1382079988718033, "num_tokens": 4641008.0, "step": 2170 }, { "entropy": 6.356924915313721, "epoch": 0.12712607399614237, "grad_norm": 0.95703125, "learning_rate": 0.0003503286067739913, "loss": 6.1099, "mean_token_accuracy": 0.14097246378660203, "num_tokens": 4651969.0, "step": 2175 }, { "entropy": 6.472826147079468, "epoch": 0.12741831784440938, "grad_norm": 0.99609375, "learning_rate": 0.00034921746834324193, "loss": 6.1656, "mean_token_accuracy": 0.13588185235857964, "num_tokens": 4663081.0, "step": 2180 }, { "entropy": 6.306978511810303, "epoch": 0.12771056169267636, "grad_norm": 0.96875, "learning_rate": 0.0003481042952031072, "loss": 5.9404, "mean_token_accuracy": 0.15880992263555527, "num_tokens": 4673147.0, "step": 2185 }, { "entropy": 6.293196773529052, "epoch": 0.12800280554094337, "grad_norm": 1.0625, "learning_rate": 0.0003469891178717911, "loss": 6.0981, "mean_token_accuracy": 0.14433757364749908, "num_tokens": 4683237.0, "step": 2190 }, { "entropy": 6.412969493865967, "epoch": 0.12829504938921035, "grad_norm": 0.9609375, "learning_rate": 0.0003458719669224436, "loss": 6.0681, "mean_token_accuracy": 0.14517636150121688, "num_tokens": 4694541.0, "step": 2195 }, { "entropy": 6.4162555694580075, "epoch": 0.12858729323747736, "grad_norm": 0.9609375, "learning_rate": 0.0003447528729823221, "loss": 6.1, "mean_token_accuracy": 0.14119071885943413, "num_tokens": 4704583.0, "step": 2200 }, { "entropy": 6.2811743259429935, "epoch": 0.12887953708574434, "grad_norm": 1.0625, "learning_rate": 0.0003436318667319525, "loss": 6.0803, "mean_token_accuracy": 0.14858463555574417, "num_tokens": 4715880.0, "step": 2205 }, { "entropy": 6.407436227798462, "epoch": 0.12917178093401133, "grad_norm": 1.0625, "learning_rate": 0.00034250897890428716, "loss": 6.0807, "mean_token_accuracy": 0.14115795344114304, "num_tokens": 4726428.0, "step": 2210 }, { "entropy": 6.3981640338897705, "epoch": 0.12946402478227834, "grad_norm": 1.109375, "learning_rate": 0.0003413842402838633, "loss": 6.0702, "mean_token_accuracy": 0.14687135368585585, "num_tokens": 4736782.0, "step": 2215 }, { "entropy": 6.329130554199219, "epoch": 0.12975626863054532, "grad_norm": 0.9453125, "learning_rate": 0.00034025768170595834, "loss": 6.1513, "mean_token_accuracy": 0.14326717853546142, "num_tokens": 4747084.0, "step": 2220 }, { "entropy": 6.4172278881073, "epoch": 0.13004851247881233, "grad_norm": 0.96484375, "learning_rate": 0.0003391293340557446, "loss": 6.1026, "mean_token_accuracy": 0.13796553611755372, "num_tokens": 4758499.0, "step": 2225 }, { "entropy": 6.3779843807220455, "epoch": 0.1303407563270793, "grad_norm": 0.96875, "learning_rate": 0.0003379992282674431, "loss": 6.0984, "mean_token_accuracy": 0.14021950736641883, "num_tokens": 4768553.0, "step": 2230 }, { "entropy": 6.3388991355896, "epoch": 0.13063300017534632, "grad_norm": 0.96875, "learning_rate": 0.0003368673953234749, "loss": 6.0441, "mean_token_accuracy": 0.14745086207985877, "num_tokens": 4778214.0, "step": 2235 }, { "entropy": 6.334152126312256, "epoch": 0.1309252440236133, "grad_norm": 0.9453125, "learning_rate": 0.00033573386625361176, "loss": 6.1084, "mean_token_accuracy": 0.13899068757891656, "num_tokens": 4789870.0, "step": 2240 }, { "entropy": 6.202721500396729, "epoch": 0.13121748787188028, "grad_norm": 0.95703125, "learning_rate": 0.00033459867213412567, "loss": 5.8645, "mean_token_accuracy": 0.16954285800457, "num_tokens": 4801320.0, "step": 2245 }, { "entropy": 6.27685284614563, "epoch": 0.1315097317201473, "grad_norm": 0.9140625, "learning_rate": 0.000333461844086937, "loss": 6.1168, "mean_token_accuracy": 0.14532479792833328, "num_tokens": 4812170.0, "step": 2250 }, { "entropy": 6.427320957183838, "epoch": 0.13180197556841428, "grad_norm": 1.1640625, "learning_rate": 0.00033232341327876097, "loss": 6.1355, "mean_token_accuracy": 0.1392444886267185, "num_tokens": 4823279.0, "step": 2255 }, { "entropy": 6.399251985549927, "epoch": 0.13209421941668129, "grad_norm": 0.953125, "learning_rate": 0.0003311834109202531, "loss": 5.9841, "mean_token_accuracy": 0.15361466854810715, "num_tokens": 4833590.0, "step": 2260 }, { "entropy": 6.250917291641235, "epoch": 0.13238646326494827, "grad_norm": 1.0546875, "learning_rate": 0.00033004186826515416, "loss": 6.0554, "mean_token_accuracy": 0.1447410002350807, "num_tokens": 4844364.0, "step": 2265 }, { "entropy": 6.405690717697143, "epoch": 0.13267870711321528, "grad_norm": 1.1796875, "learning_rate": 0.0003288988166094324, "loss": 6.0467, "mean_token_accuracy": 0.14364370033144952, "num_tokens": 4854375.0, "step": 2270 }, { "entropy": 6.3763069152832035, "epoch": 0.13297095096148226, "grad_norm": 1.0078125, "learning_rate": 0.00032775428729042656, "loss": 6.0646, "mean_token_accuracy": 0.14396966099739075, "num_tokens": 4864704.0, "step": 2275 }, { "entropy": 6.3314014911651615, "epoch": 0.13326319480974924, "grad_norm": 1.125, "learning_rate": 0.000326608311685986, "loss": 6.0507, "mean_token_accuracy": 0.15053208023309708, "num_tokens": 4874774.0, "step": 2280 }, { "entropy": 6.303547191619873, "epoch": 0.13355543865801625, "grad_norm": 0.9765625, "learning_rate": 0.0003254609212136108, "loss": 6.0658, "mean_token_accuracy": 0.14474221244454383, "num_tokens": 4886263.0, "step": 2285 }, { "entropy": 6.270662403106689, "epoch": 0.13384768250628323, "grad_norm": 0.9375, "learning_rate": 0.00032431214732959036, "loss": 6.1063, "mean_token_accuracy": 0.14200906977057456, "num_tokens": 4897416.0, "step": 2290 }, { "entropy": 6.426070737838745, "epoch": 0.13413992635455024, "grad_norm": 1.1015625, "learning_rate": 0.000323162021528141, "loss": 6.0629, "mean_token_accuracy": 0.14902425408363343, "num_tokens": 4907710.0, "step": 2295 }, { "entropy": 6.361135005950928, "epoch": 0.13443217020281722, "grad_norm": 1.015625, "learning_rate": 0.00032201057534054264, "loss": 6.1144, "mean_token_accuracy": 0.1474320709705353, "num_tokens": 4919190.0, "step": 2300 }, { "entropy": 6.297651672363282, "epoch": 0.13472441405108423, "grad_norm": 0.9453125, "learning_rate": 0.00032085784033427414, "loss": 6.0906, "mean_token_accuracy": 0.14951519295573235, "num_tokens": 4929892.0, "step": 2305 }, { "entropy": 6.35400619506836, "epoch": 0.13501665789935122, "grad_norm": 0.94921875, "learning_rate": 0.0003197038481121478, "loss": 6.1102, "mean_token_accuracy": 0.14383033886551858, "num_tokens": 4940649.0, "step": 2310 }, { "entropy": 6.300059413909912, "epoch": 0.1353089017476182, "grad_norm": 1.0546875, "learning_rate": 0.0003185486303114436, "loss": 6.1523, "mean_token_accuracy": 0.1469470590353012, "num_tokens": 4950952.0, "step": 2315 }, { "entropy": 6.400362157821656, "epoch": 0.1356011455958852, "grad_norm": 0.96875, "learning_rate": 0.0003173922186030409, "loss": 6.0551, "mean_token_accuracy": 0.14830568730831145, "num_tokens": 4961473.0, "step": 2320 }, { "entropy": 6.3428558826446535, "epoch": 0.1358933894441522, "grad_norm": 1.015625, "learning_rate": 0.000316234644690551, "loss": 6.1208, "mean_token_accuracy": 0.14066094309091567, "num_tokens": 4972702.0, "step": 2325 }, { "entropy": 6.3625664710998535, "epoch": 0.1361856332924192, "grad_norm": 0.9375, "learning_rate": 0.0003150759403094473, "loss": 6.1168, "mean_token_accuracy": 0.13751328289508818, "num_tokens": 4983003.0, "step": 2330 }, { "entropy": 6.311033821105957, "epoch": 0.13647787714068618, "grad_norm": 1.046875, "learning_rate": 0.00031391613722619587, "loss": 6.0712, "mean_token_accuracy": 0.14670585095882416, "num_tokens": 4993378.0, "step": 2335 }, { "entropy": 6.347900104522705, "epoch": 0.1367701209889532, "grad_norm": 1.0390625, "learning_rate": 0.000312755267237384, "loss": 6.1411, "mean_token_accuracy": 0.13584877029061318, "num_tokens": 5004076.0, "step": 2340 }, { "entropy": 6.4429466247558596, "epoch": 0.13706236483722017, "grad_norm": 1.0078125, "learning_rate": 0.0003115933621688488, "loss": 6.1122, "mean_token_accuracy": 0.14021623879671097, "num_tokens": 5014718.0, "step": 2345 }, { "entropy": 6.398041105270385, "epoch": 0.13735460868548718, "grad_norm": 0.921875, "learning_rate": 0.00031043045387480487, "loss": 6.0959, "mean_token_accuracy": 0.14150511622428893, "num_tokens": 5026102.0, "step": 2350 }, { "entropy": 6.31099681854248, "epoch": 0.13764685253375417, "grad_norm": 1.0390625, "learning_rate": 0.0003092665742369703, "loss": 6.0418, "mean_token_accuracy": 0.14680029153823854, "num_tokens": 5036847.0, "step": 2355 }, { "entropy": 6.337398195266724, "epoch": 0.13793909638202115, "grad_norm": 1.0546875, "learning_rate": 0.00030810175516369343, "loss": 5.9778, "mean_token_accuracy": 0.15376632735133172, "num_tokens": 5047751.0, "step": 2360 }, { "entropy": 6.33739070892334, "epoch": 0.13823134023028816, "grad_norm": 0.96875, "learning_rate": 0.0003069360285890775, "loss": 6.0329, "mean_token_accuracy": 0.144328011572361, "num_tokens": 5057914.0, "step": 2365 }, { "entropy": 6.319474363327027, "epoch": 0.13852358407855514, "grad_norm": 0.984375, "learning_rate": 0.00030576942647210547, "loss": 6.0952, "mean_token_accuracy": 0.14145840853452682, "num_tokens": 5068465.0, "step": 2370 }, { "entropy": 6.360443639755249, "epoch": 0.13881582792682215, "grad_norm": 1.1015625, "learning_rate": 0.00030460198079576355, "loss": 6.0397, "mean_token_accuracy": 0.14447517544031144, "num_tokens": 5079162.0, "step": 2375 }, { "entropy": 6.3138045310974125, "epoch": 0.13910807177508913, "grad_norm": 1.0703125, "learning_rate": 0.0003034337235661648, "loss": 6.0627, "mean_token_accuracy": 0.14073965400457383, "num_tokens": 5089409.0, "step": 2380 }, { "entropy": 6.346354389190674, "epoch": 0.13940031562335614, "grad_norm": 0.9609375, "learning_rate": 0.0003022646868116714, "loss": 6.0073, "mean_token_accuracy": 0.15402419716119767, "num_tokens": 5100150.0, "step": 2385 }, { "entropy": 6.2642158508300785, "epoch": 0.13969255947162312, "grad_norm": 1.0859375, "learning_rate": 0.0003010949025820163, "loss": 5.9723, "mean_token_accuracy": 0.15449547916650772, "num_tokens": 5110601.0, "step": 2390 }, { "entropy": 6.297504043579101, "epoch": 0.1399848033198901, "grad_norm": 1.1328125, "learning_rate": 0.0002999244029474252, "loss": 6.0562, "mean_token_accuracy": 0.1438538871705532, "num_tokens": 5119665.0, "step": 2395 }, { "entropy": 6.35467758178711, "epoch": 0.14027704716815712, "grad_norm": 0.97265625, "learning_rate": 0.00029875321999773684, "loss": 5.9881, "mean_token_accuracy": 0.15138252228498458, "num_tokens": 5129712.0, "step": 2400 }, { "entropy": 6.329247283935547, "epoch": 0.1405692910164241, "grad_norm": 0.9453125, "learning_rate": 0.00029758138584152333, "loss": 6.0695, "mean_token_accuracy": 0.14784711748361587, "num_tokens": 5139858.0, "step": 2405 }, { "entropy": 6.434852170944214, "epoch": 0.1408615348646911, "grad_norm": 1.171875, "learning_rate": 0.0002964089326052102, "loss": 6.0511, "mean_token_accuracy": 0.14410493820905684, "num_tokens": 5149330.0, "step": 2410 }, { "entropy": 6.296307039260864, "epoch": 0.1411537787129581, "grad_norm": 1.140625, "learning_rate": 0.0002952358924321949, "loss": 6.0336, "mean_token_accuracy": 0.15123162269592286, "num_tokens": 5159458.0, "step": 2415 }, { "entropy": 6.350845432281494, "epoch": 0.1414460225612251, "grad_norm": 0.9609375, "learning_rate": 0.00029406229748196657, "loss": 6.0538, "mean_token_accuracy": 0.14705884456634521, "num_tokens": 5170439.0, "step": 2420 }, { "entropy": 6.268113899230957, "epoch": 0.14173826640949208, "grad_norm": 0.984375, "learning_rate": 0.0002928881799292235, "loss": 5.9838, "mean_token_accuracy": 0.1529225915670395, "num_tokens": 5181345.0, "step": 2425 }, { "entropy": 6.332951450347901, "epoch": 0.14203051025775906, "grad_norm": 0.98828125, "learning_rate": 0.00029171357196299154, "loss": 6.0038, "mean_token_accuracy": 0.1513151541352272, "num_tokens": 5191271.0, "step": 2430 }, { "entropy": 6.287766170501709, "epoch": 0.14232275410602607, "grad_norm": 0.91015625, "learning_rate": 0.0002905385057857414, "loss": 6.0306, "mean_token_accuracy": 0.14540833234786987, "num_tokens": 5201868.0, "step": 2435 }, { "entropy": 6.353308391571045, "epoch": 0.14261499795429305, "grad_norm": 1.1796875, "learning_rate": 0.0002893630136125058, "loss": 6.0348, "mean_token_accuracy": 0.14496010169386864, "num_tokens": 5212463.0, "step": 2440 }, { "entropy": 6.313853979110718, "epoch": 0.14290724180256006, "grad_norm": 1.015625, "learning_rate": 0.0002881871276699967, "loss": 6.0288, "mean_token_accuracy": 0.1504661425948143, "num_tokens": 5223485.0, "step": 2445 }, { "entropy": 6.290103721618652, "epoch": 0.14319948565082705, "grad_norm": 0.97265625, "learning_rate": 0.00028701088019572114, "loss": 5.9775, "mean_token_accuracy": 0.15286858677864074, "num_tokens": 5233818.0, "step": 2450 }, { "entropy": 6.268964719772339, "epoch": 0.14349172949909406, "grad_norm": 0.9765625, "learning_rate": 0.0002858343034370977, "loss": 6.0192, "mean_token_accuracy": 0.1612694352865219, "num_tokens": 5244008.0, "step": 2455 }, { "entropy": 6.223029232025146, "epoch": 0.14378397334736104, "grad_norm": 1.03125, "learning_rate": 0.00028465742965057267, "loss": 5.9605, "mean_token_accuracy": 0.15433412343263625, "num_tokens": 5254263.0, "step": 2460 }, { "entropy": 6.358925867080688, "epoch": 0.14407621719562802, "grad_norm": 1.0078125, "learning_rate": 0.00028348029110073533, "loss": 6.0514, "mean_token_accuracy": 0.14305417686700822, "num_tokens": 5264635.0, "step": 2465 }, { "entropy": 6.2891651630401615, "epoch": 0.14436846104389503, "grad_norm": 1.015625, "learning_rate": 0.00028230292005943365, "loss": 6.0385, "mean_token_accuracy": 0.15182356610894204, "num_tokens": 5275795.0, "step": 2470 }, { "entropy": 6.264105224609375, "epoch": 0.144660704892162, "grad_norm": 1.109375, "learning_rate": 0.00028112534880488945, "loss": 5.9957, "mean_token_accuracy": 0.1517108455300331, "num_tokens": 5286188.0, "step": 2475 }, { "entropy": 6.31910662651062, "epoch": 0.14495294874042902, "grad_norm": 1.125, "learning_rate": 0.0002799476096208137, "loss": 6.0043, "mean_token_accuracy": 0.14954675287008284, "num_tokens": 5296224.0, "step": 2480 }, { "entropy": 6.275746059417725, "epoch": 0.145245192588696, "grad_norm": 0.92578125, "learning_rate": 0.00027876973479552087, "loss": 6.0083, "mean_token_accuracy": 0.15013067051768303, "num_tokens": 5308199.0, "step": 2485 }, { "entropy": 6.341499519348145, "epoch": 0.145537436436963, "grad_norm": 1.0078125, "learning_rate": 0.00027759175662104424, "loss": 6.0034, "mean_token_accuracy": 0.15202850550413133, "num_tokens": 5319141.0, "step": 2490 }, { "entropy": 6.36463737487793, "epoch": 0.14582968028523, "grad_norm": 0.9140625, "learning_rate": 0.0002764137073922508, "loss": 6.0876, "mean_token_accuracy": 0.14759052470326423, "num_tokens": 5331387.0, "step": 2495 }, { "entropy": 6.340337610244751, "epoch": 0.14612192413349698, "grad_norm": 1.203125, "learning_rate": 0.00027523561940595505, "loss": 5.9975, "mean_token_accuracy": 0.1468089461326599, "num_tokens": 5341374.0, "step": 2500 }, { "entropy": 6.3170370101928714, "epoch": 0.146414167981764, "grad_norm": 1.0078125, "learning_rate": 0.0002740575249600342, "loss": 6.0161, "mean_token_accuracy": 0.1478159546852112, "num_tokens": 5351728.0, "step": 2505 }, { "entropy": 6.317452669143677, "epoch": 0.14670641183003097, "grad_norm": 0.91796875, "learning_rate": 0.00027287945635254263, "loss": 5.9839, "mean_token_accuracy": 0.15488136261701585, "num_tokens": 5361365.0, "step": 2510 }, { "entropy": 6.265701580047607, "epoch": 0.14699865567829798, "grad_norm": 1.0546875, "learning_rate": 0.00027170144588082635, "loss": 6.0273, "mean_token_accuracy": 0.1483263149857521, "num_tokens": 5372932.0, "step": 2515 }, { "entropy": 6.352311897277832, "epoch": 0.14729089952656496, "grad_norm": 1.0625, "learning_rate": 0.00027052352584063763, "loss": 6.033, "mean_token_accuracy": 0.15657648146152497, "num_tokens": 5384409.0, "step": 2520 }, { "entropy": 6.288667631149292, "epoch": 0.14758314337483197, "grad_norm": 0.9453125, "learning_rate": 0.00026934572852524907, "loss": 5.9337, "mean_token_accuracy": 0.15720220953226088, "num_tokens": 5394068.0, "step": 2525 }, { "entropy": 6.312388324737549, "epoch": 0.14787538722309895, "grad_norm": 1.046875, "learning_rate": 0.00026816808622456937, "loss": 6.0587, "mean_token_accuracy": 0.1438172474503517, "num_tokens": 5403908.0, "step": 2530 }, { "entropy": 6.334784841537475, "epoch": 0.14816763107136594, "grad_norm": 0.9375, "learning_rate": 0.0002669906312242569, "loss": 5.9684, "mean_token_accuracy": 0.15703339204192163, "num_tokens": 5414845.0, "step": 2535 }, { "entropy": 6.273650789260865, "epoch": 0.14845987491963294, "grad_norm": 0.9765625, "learning_rate": 0.00026581339580483525, "loss": 5.9692, "mean_token_accuracy": 0.14930712282657624, "num_tokens": 5424608.0, "step": 2540 }, { "entropy": 6.320654630661011, "epoch": 0.14875211876789993, "grad_norm": 0.9609375, "learning_rate": 0.0002646364122408082, "loss": 5.978, "mean_token_accuracy": 0.14491919204592704, "num_tokens": 5436316.0, "step": 2545 }, { "entropy": 6.355360698699951, "epoch": 0.14904436261616694, "grad_norm": 1.0234375, "learning_rate": 0.0002634597127997749, "loss": 6.0151, "mean_token_accuracy": 0.15137199610471724, "num_tokens": 5446112.0, "step": 2550 }, { "entropy": 6.348347330093384, "epoch": 0.14933660646443392, "grad_norm": 0.96484375, "learning_rate": 0.0002622833297415445, "loss": 6.0197, "mean_token_accuracy": 0.14264217540621757, "num_tokens": 5456688.0, "step": 2555 }, { "entropy": 6.227771425247193, "epoch": 0.14962885031270093, "grad_norm": 1.015625, "learning_rate": 0.0002611072953172531, "loss": 5.9556, "mean_token_accuracy": 0.15220817178487778, "num_tokens": 5467590.0, "step": 2560 }, { "entropy": 6.286277532577515, "epoch": 0.1499210941609679, "grad_norm": 0.9140625, "learning_rate": 0.00025993164176847845, "loss": 6.0663, "mean_token_accuracy": 0.1468990609049797, "num_tokens": 5478868.0, "step": 2565 }, { "entropy": 6.387682151794434, "epoch": 0.1502133380092349, "grad_norm": 1.140625, "learning_rate": 0.0002587564013263564, "loss": 5.9887, "mean_token_accuracy": 0.1580376297235489, "num_tokens": 5490024.0, "step": 2570 }, { "entropy": 6.289829730987549, "epoch": 0.1505055818575019, "grad_norm": 1.03125, "learning_rate": 0.0002575816062106974, "loss": 6.0214, "mean_token_accuracy": 0.15528702437877656, "num_tokens": 5500974.0, "step": 2575 }, { "entropy": 6.2699133396148685, "epoch": 0.15079782570576888, "grad_norm": 1.1015625, "learning_rate": 0.00025640728862910293, "loss": 5.9653, "mean_token_accuracy": 0.1449893519282341, "num_tokens": 5511892.0, "step": 2580 }, { "entropy": 6.368878936767578, "epoch": 0.1510900695540359, "grad_norm": 1.015625, "learning_rate": 0.00025523348077608285, "loss": 6.1226, "mean_token_accuracy": 0.14047732800245286, "num_tokens": 5523913.0, "step": 2585 }, { "entropy": 6.363551235198974, "epoch": 0.15138231340230288, "grad_norm": 0.953125, "learning_rate": 0.00025406021483217225, "loss": 5.9772, "mean_token_accuracy": 0.1532949447631836, "num_tokens": 5535885.0, "step": 2590 }, { "entropy": 6.308110284805298, "epoch": 0.15167455725056989, "grad_norm": 1.2109375, "learning_rate": 0.00025288752296304963, "loss": 6.085, "mean_token_accuracy": 0.13639543280005456, "num_tokens": 5546087.0, "step": 2595 }, { "entropy": 6.302505922317505, "epoch": 0.15196680109883687, "grad_norm": 0.98828125, "learning_rate": 0.000251715437318655, "loss": 6.091, "mean_token_accuracy": 0.1428159460425377, "num_tokens": 5558295.0, "step": 2600 }, { "entropy": 6.287006664276123, "epoch": 0.15225904494710385, "grad_norm": 1.0078125, "learning_rate": 0.0002505439900323084, "loss": 5.9298, "mean_token_accuracy": 0.15107120499014853, "num_tokens": 5568669.0, "step": 2605 }, { "entropy": 6.304688453674316, "epoch": 0.15255128879537086, "grad_norm": 0.96875, "learning_rate": 0.00024937321321982894, "loss": 6.0246, "mean_token_accuracy": 0.1511759489774704, "num_tokens": 5580134.0, "step": 2610 }, { "entropy": 6.299784326553345, "epoch": 0.15284353264363784, "grad_norm": 1.1328125, "learning_rate": 0.00024820313897865433, "loss": 5.961, "mean_token_accuracy": 0.15625140368938445, "num_tokens": 5589562.0, "step": 2615 }, { "entropy": 6.319279575347901, "epoch": 0.15313577649190485, "grad_norm": 1.03125, "learning_rate": 0.00024703379938696105, "loss": 6.0068, "mean_token_accuracy": 0.1511688709259033, "num_tokens": 5599944.0, "step": 2620 }, { "entropy": 6.250988578796386, "epoch": 0.15342802034017183, "grad_norm": 1.0625, "learning_rate": 0.00024586522650278447, "loss": 5.9167, "mean_token_accuracy": 0.15715879648923875, "num_tokens": 5610006.0, "step": 2625 }, { "entropy": 6.250146770477295, "epoch": 0.15372026418843884, "grad_norm": 0.953125, "learning_rate": 0.00024469745236314064, "loss": 5.9862, "mean_token_accuracy": 0.15374237895011902, "num_tokens": 5620287.0, "step": 2630 }, { "entropy": 6.299891185760498, "epoch": 0.15401250803670583, "grad_norm": 1.1171875, "learning_rate": 0.00024353050898314767, "loss": 5.9865, "mean_token_accuracy": 0.1511371836066246, "num_tokens": 5630614.0, "step": 2635 }, { "entropy": 6.294261789321899, "epoch": 0.15430475188497284, "grad_norm": 0.9765625, "learning_rate": 0.00024236442835514743, "loss": 6.0313, "mean_token_accuracy": 0.14918752163648605, "num_tokens": 5642097.0, "step": 2640 }, { "entropy": 6.2733110904693605, "epoch": 0.15459699573323982, "grad_norm": 1.1015625, "learning_rate": 0.00024119924244782965, "loss": 6.0239, "mean_token_accuracy": 0.14698346257209777, "num_tokens": 5653175.0, "step": 2645 }, { "entropy": 6.312636423110962, "epoch": 0.1548892395815068, "grad_norm": 0.9453125, "learning_rate": 0.00024003498320535462, "loss": 5.9992, "mean_token_accuracy": 0.15541867315769195, "num_tokens": 5663618.0, "step": 2650 }, { "entropy": 6.310853004455566, "epoch": 0.1551814834297738, "grad_norm": 0.94921875, "learning_rate": 0.00023887168254647727, "loss": 5.8461, "mean_token_accuracy": 0.16287131309509278, "num_tokens": 5673460.0, "step": 2655 }, { "entropy": 6.28970890045166, "epoch": 0.1554737272780408, "grad_norm": 0.9453125, "learning_rate": 0.00023770937236367308, "loss": 5.9348, "mean_token_accuracy": 0.14952913597226142, "num_tokens": 5684224.0, "step": 2660 }, { "entropy": 6.310828685760498, "epoch": 0.1557659711263078, "grad_norm": 0.96875, "learning_rate": 0.00023654808452226278, "loss": 5.9855, "mean_token_accuracy": 0.15043364316225052, "num_tokens": 5694440.0, "step": 2665 }, { "entropy": 6.355057096481323, "epoch": 0.15605821497457478, "grad_norm": 1.03125, "learning_rate": 0.00023538785085953912, "loss": 5.9417, "mean_token_accuracy": 0.15679079294204712, "num_tokens": 5705510.0, "step": 2670 }, { "entropy": 6.292229461669922, "epoch": 0.1563504588228418, "grad_norm": 1.0, "learning_rate": 0.00023422870318389404, "loss": 6.0486, "mean_token_accuracy": 0.14631869941949843, "num_tokens": 5715837.0, "step": 2675 }, { "entropy": 6.294525766372681, "epoch": 0.15664270267110877, "grad_norm": 1.0390625, "learning_rate": 0.0002330706732739468, "loss": 5.9862, "mean_token_accuracy": 0.14949700236320496, "num_tokens": 5726252.0, "step": 2680 }, { "entropy": 6.3139581203460695, "epoch": 0.15693494651937576, "grad_norm": 0.9765625, "learning_rate": 0.00023191379287767211, "loss": 6.0559, "mean_token_accuracy": 0.15128493905067444, "num_tokens": 5737877.0, "step": 2685 }, { "entropy": 6.257204580307007, "epoch": 0.15722719036764277, "grad_norm": 1.0234375, "learning_rate": 0.0002307580937115305, "loss": 5.9708, "mean_token_accuracy": 0.14995031505823136, "num_tokens": 5748651.0, "step": 2690 }, { "entropy": 6.214744758605957, "epoch": 0.15751943421590975, "grad_norm": 1.0390625, "learning_rate": 0.00022960360745959846, "loss": 5.9326, "mean_token_accuracy": 0.15505573153495789, "num_tokens": 5759505.0, "step": 2695 }, { "entropy": 6.290683221817017, "epoch": 0.15781167806417676, "grad_norm": 1.0390625, "learning_rate": 0.00022845036577269972, "loss": 5.9183, "mean_token_accuracy": 0.15150227397680283, "num_tokens": 5769950.0, "step": 2700 }, { "entropy": 6.317072534561158, "epoch": 0.15810392191244374, "grad_norm": 0.98828125, "learning_rate": 0.00022729840026753777, "loss": 5.9447, "mean_token_accuracy": 0.15681618750095366, "num_tokens": 5780446.0, "step": 2705 }, { "entropy": 6.262074375152588, "epoch": 0.15839616576071075, "grad_norm": 1.015625, "learning_rate": 0.0002261477425258287, "loss": 5.9049, "mean_token_accuracy": 0.15653743147850036, "num_tokens": 5790690.0, "step": 2710 }, { "entropy": 6.276272583007812, "epoch": 0.15868840960897773, "grad_norm": 1.0234375, "learning_rate": 0.0002249984240934358, "loss": 6.0049, "mean_token_accuracy": 0.15046160370111467, "num_tokens": 5801718.0, "step": 2715 }, { "entropy": 6.261381149291992, "epoch": 0.1589806534572447, "grad_norm": 1.1015625, "learning_rate": 0.00022385047647950464, "loss": 5.9795, "mean_token_accuracy": 0.15426528006792067, "num_tokens": 5812497.0, "step": 2720 }, { "entropy": 6.295159435272216, "epoch": 0.15927289730551172, "grad_norm": 1.0546875, "learning_rate": 0.0002227039311555986, "loss": 5.9623, "mean_token_accuracy": 0.15989028364419938, "num_tokens": 5822931.0, "step": 2725 }, { "entropy": 6.30918321609497, "epoch": 0.1595651411537787, "grad_norm": 1.0390625, "learning_rate": 0.0002215588195548372, "loss": 5.9153, "mean_token_accuracy": 0.15595535635948182, "num_tokens": 5832942.0, "step": 2730 }, { "entropy": 6.281555843353272, "epoch": 0.15985738500204572, "grad_norm": 1.0859375, "learning_rate": 0.00022041517307103337, "loss": 5.9554, "mean_token_accuracy": 0.14854271337389946, "num_tokens": 5842830.0, "step": 2735 }, { "entropy": 6.257166862487793, "epoch": 0.1601496288503127, "grad_norm": 0.94140625, "learning_rate": 0.0002192730230578331, "loss": 5.9631, "mean_token_accuracy": 0.14914022982120514, "num_tokens": 5854392.0, "step": 2740 }, { "entropy": 6.352614259719848, "epoch": 0.1604418726985797, "grad_norm": 1.046875, "learning_rate": 0.0002181324008278559, "loss": 5.973, "mean_token_accuracy": 0.1517603389918804, "num_tokens": 5865582.0, "step": 2745 }, { "entropy": 6.298333597183228, "epoch": 0.1607341165468467, "grad_norm": 1.0625, "learning_rate": 0.00021699333765183655, "loss": 5.9648, "mean_token_accuracy": 0.1535767138004303, "num_tokens": 5875669.0, "step": 2750 }, { "entropy": 6.270532560348511, "epoch": 0.16102636039511367, "grad_norm": 1.0234375, "learning_rate": 0.0002158558647577673, "loss": 5.9193, "mean_token_accuracy": 0.1563738539814949, "num_tokens": 5886287.0, "step": 2755 }, { "entropy": 6.26015796661377, "epoch": 0.16131860424338068, "grad_norm": 1.015625, "learning_rate": 0.00021472001333004215, "loss": 5.954, "mean_token_accuracy": 0.15786738842725753, "num_tokens": 5896884.0, "step": 2760 }, { "entropy": 6.220677423477173, "epoch": 0.16161084809164766, "grad_norm": 1.015625, "learning_rate": 0.00021358581450860186, "loss": 6.0411, "mean_token_accuracy": 0.14786829352378844, "num_tokens": 5907741.0, "step": 2765 }, { "entropy": 6.383463573455811, "epoch": 0.16190309193991467, "grad_norm": 0.92578125, "learning_rate": 0.0002124532993880799, "loss": 6.0218, "mean_token_accuracy": 0.15272231251001359, "num_tokens": 5918316.0, "step": 2770 }, { "entropy": 6.325487995147705, "epoch": 0.16219533578818165, "grad_norm": 0.9140625, "learning_rate": 0.00021132249901695044, "loss": 6.0119, "mean_token_accuracy": 0.15464432835578917, "num_tokens": 5929209.0, "step": 2775 }, { "entropy": 6.295078992843628, "epoch": 0.16248757963644866, "grad_norm": 0.95703125, "learning_rate": 0.00021019344439667705, "loss": 5.9468, "mean_token_accuracy": 0.15779951959848404, "num_tokens": 5939716.0, "step": 2780 }, { "entropy": 6.254607343673706, "epoch": 0.16277982348471565, "grad_norm": 0.96875, "learning_rate": 0.00020906616648086213, "loss": 5.9041, "mean_token_accuracy": 0.1592554844915867, "num_tokens": 5950677.0, "step": 2785 }, { "entropy": 6.295980501174927, "epoch": 0.16307206733298263, "grad_norm": 1.046875, "learning_rate": 0.00020794069617439942, "loss": 5.9352, "mean_token_accuracy": 0.15921037048101425, "num_tokens": 5961458.0, "step": 2790 }, { "entropy": 6.256237316131592, "epoch": 0.16336431118124964, "grad_norm": 1.0234375, "learning_rate": 0.00020681706433262593, "loss": 5.9022, "mean_token_accuracy": 0.15727142244577408, "num_tokens": 5971713.0, "step": 2795 }, { "entropy": 6.305441045761109, "epoch": 0.16365655502951662, "grad_norm": 1.0078125, "learning_rate": 0.00020569530176047602, "loss": 6.0447, "mean_token_accuracy": 0.14972822219133378, "num_tokens": 5983418.0, "step": 2800 }, { "entropy": 6.34089150428772, "epoch": 0.16394879887778363, "grad_norm": 0.97265625, "learning_rate": 0.0002045754392116374, "loss": 5.869, "mean_token_accuracy": 0.16185261458158492, "num_tokens": 5993207.0, "step": 2805 }, { "entropy": 6.237485265731811, "epoch": 0.1642410427260506, "grad_norm": 1.03125, "learning_rate": 0.00020345750738770757, "loss": 5.9724, "mean_token_accuracy": 0.14559953808784484, "num_tokens": 6003545.0, "step": 2810 }, { "entropy": 6.2489461421966555, "epoch": 0.16453328657431762, "grad_norm": 1.0, "learning_rate": 0.00020234153693735214, "loss": 5.9876, "mean_token_accuracy": 0.14853048473596572, "num_tokens": 6014315.0, "step": 2815 }, { "entropy": 6.331522417068482, "epoch": 0.1648255304225846, "grad_norm": 0.9453125, "learning_rate": 0.0002012275584554647, "loss": 5.879, "mean_token_accuracy": 0.15474118292331696, "num_tokens": 6025650.0, "step": 2820 }, { "entropy": 6.312690925598145, "epoch": 0.16511777427085159, "grad_norm": 0.953125, "learning_rate": 0.00020011560248232803, "loss": 5.9071, "mean_token_accuracy": 0.15482232123613357, "num_tokens": 6036497.0, "step": 2825 }, { "entropy": 6.223179769515991, "epoch": 0.1654100181191186, "grad_norm": 1.0625, "learning_rate": 0.00019900569950277692, "loss": 5.8929, "mean_token_accuracy": 0.15263683944940568, "num_tokens": 6046448.0, "step": 2830 }, { "entropy": 6.252099275588989, "epoch": 0.16570226196738558, "grad_norm": 0.98046875, "learning_rate": 0.00019789787994536228, "loss": 5.88, "mean_token_accuracy": 0.15355804860591887, "num_tokens": 6056630.0, "step": 2835 }, { "entropy": 6.260057497024536, "epoch": 0.1659945058156526, "grad_norm": 1.03125, "learning_rate": 0.00019679217418151667, "loss": 5.937, "mean_token_accuracy": 0.15121540874242784, "num_tokens": 6067795.0, "step": 2840 }, { "entropy": 6.27913122177124, "epoch": 0.16628674966391957, "grad_norm": 1.2734375, "learning_rate": 0.00019568861252472236, "loss": 5.9489, "mean_token_accuracy": 0.16291055530309678, "num_tokens": 6079218.0, "step": 2845 }, { "entropy": 6.242688941955566, "epoch": 0.16657899351218658, "grad_norm": 0.96875, "learning_rate": 0.00019458722522967952, "loss": 5.9344, "mean_token_accuracy": 0.15513963103294373, "num_tokens": 6089707.0, "step": 2850 }, { "entropy": 6.2319025039672855, "epoch": 0.16687123736045356, "grad_norm": 0.98828125, "learning_rate": 0.00019348804249147723, "loss": 5.9286, "mean_token_accuracy": 0.15406835228204727, "num_tokens": 6100978.0, "step": 2855 }, { "entropy": 6.288013601303101, "epoch": 0.16716348120872054, "grad_norm": 1.1875, "learning_rate": 0.0001923910944447655, "loss": 5.8506, "mean_token_accuracy": 0.1609133541584015, "num_tokens": 6110188.0, "step": 2860 }, { "entropy": 6.294746685028076, "epoch": 0.16745572505698755, "grad_norm": 1.0546875, "learning_rate": 0.00019129641116292928, "loss": 5.9571, "mean_token_accuracy": 0.15872167944908142, "num_tokens": 6121229.0, "step": 2865 }, { "entropy": 6.239352464675903, "epoch": 0.16774796890525454, "grad_norm": 1.0859375, "learning_rate": 0.00019020402265726343, "loss": 5.9593, "mean_token_accuracy": 0.15123945772647857, "num_tokens": 6131022.0, "step": 2870 }, { "entropy": 6.177235221862793, "epoch": 0.16804021275352155, "grad_norm": 1.03125, "learning_rate": 0.0001891139588761509, "loss": 5.8541, "mean_token_accuracy": 0.16396355330944062, "num_tokens": 6141042.0, "step": 2875 }, { "entropy": 6.314100122451782, "epoch": 0.16833245660178853, "grad_norm": 1.0625, "learning_rate": 0.00018802624970424076, "loss": 5.9393, "mean_token_accuracy": 0.15475943088531494, "num_tokens": 6151612.0, "step": 2880 }, { "entropy": 6.2800627708435055, "epoch": 0.16862470045005554, "grad_norm": 0.9921875, "learning_rate": 0.00018694092496162945, "loss": 5.937, "mean_token_accuracy": 0.1557922825217247, "num_tokens": 6162217.0, "step": 2885 }, { "entropy": 6.312515592575073, "epoch": 0.16891694429832252, "grad_norm": 0.98828125, "learning_rate": 0.00018585801440304306, "loss": 5.9766, "mean_token_accuracy": 0.1531226873397827, "num_tokens": 6173309.0, "step": 2890 }, { "entropy": 6.311217832565307, "epoch": 0.1692091881465895, "grad_norm": 1.046875, "learning_rate": 0.00018477754771702165, "loss": 5.9567, "mean_token_accuracy": 0.1584221139550209, "num_tokens": 6184063.0, "step": 2895 }, { "entropy": 6.245030498504638, "epoch": 0.1695014319948565, "grad_norm": 0.97265625, "learning_rate": 0.00018369955452510506, "loss": 5.9231, "mean_token_accuracy": 0.1564079113304615, "num_tokens": 6196158.0, "step": 2900 }, { "entropy": 6.233873271942139, "epoch": 0.1697936758431235, "grad_norm": 1.0703125, "learning_rate": 0.0001826240643810212, "loss": 5.9005, "mean_token_accuracy": 0.15264101922512055, "num_tokens": 6206801.0, "step": 2905 }, { "entropy": 6.284539604187012, "epoch": 0.1700859196913905, "grad_norm": 1.140625, "learning_rate": 0.0001815511067698758, "loss": 5.9452, "mean_token_accuracy": 0.15421261191368102, "num_tokens": 6217060.0, "step": 2910 }, { "entropy": 6.290277528762817, "epoch": 0.17037816353965748, "grad_norm": 1.0390625, "learning_rate": 0.0001804807111073436, "loss": 5.9119, "mean_token_accuracy": 0.15774459540843963, "num_tokens": 6228311.0, "step": 2915 }, { "entropy": 6.276092576980591, "epoch": 0.1706704073879245, "grad_norm": 1.0546875, "learning_rate": 0.0001794129067388625, "loss": 5.9323, "mean_token_accuracy": 0.15433253049850465, "num_tokens": 6238059.0, "step": 2920 }, { "entropy": 6.230207300186157, "epoch": 0.17096265123619148, "grad_norm": 0.9375, "learning_rate": 0.00017834772293882868, "loss": 5.9629, "mean_token_accuracy": 0.15217517614364623, "num_tokens": 6248462.0, "step": 2925 }, { "entropy": 6.255596065521241, "epoch": 0.17125489508445846, "grad_norm": 1.0078125, "learning_rate": 0.000177285188909794, "loss": 5.872, "mean_token_accuracy": 0.16722603738307953, "num_tokens": 6257974.0, "step": 2930 }, { "entropy": 6.335262107849121, "epoch": 0.17154713893272547, "grad_norm": 0.9921875, "learning_rate": 0.0001762253337816656, "loss": 5.9814, "mean_token_accuracy": 0.1485115647315979, "num_tokens": 6269296.0, "step": 2935 }, { "entropy": 6.358278417587281, "epoch": 0.17183938278099245, "grad_norm": 1.0234375, "learning_rate": 0.00017516818661090738, "loss": 5.9916, "mean_token_accuracy": 0.15062511041760446, "num_tokens": 6280104.0, "step": 2940 }, { "entropy": 6.311861419677735, "epoch": 0.17213162662925946, "grad_norm": 1.046875, "learning_rate": 0.0001741137763797428, "loss": 5.9015, "mean_token_accuracy": 0.1671626940369606, "num_tokens": 6290477.0, "step": 2945 }, { "entropy": 6.258217287063599, "epoch": 0.17242387047752644, "grad_norm": 0.9765625, "learning_rate": 0.00017306213199536115, "loss": 5.8602, "mean_token_accuracy": 0.16427712887525558, "num_tokens": 6300927.0, "step": 2950 }, { "entropy": 6.236834526062012, "epoch": 0.17271611432579345, "grad_norm": 0.9921875, "learning_rate": 0.0001720132822891243, "loss": 5.9459, "mean_token_accuracy": 0.15635040700435637, "num_tokens": 6311153.0, "step": 2955 }, { "entropy": 6.292562246322632, "epoch": 0.17300835817406043, "grad_norm": 1.046875, "learning_rate": 0.0001709672560157769, "loss": 5.8447, "mean_token_accuracy": 0.16232619136571885, "num_tokens": 6320716.0, "step": 2960 }, { "entropy": 6.313056468963623, "epoch": 0.17330060202232744, "grad_norm": 0.96875, "learning_rate": 0.00016992408185265758, "loss": 6.0058, "mean_token_accuracy": 0.14952416867017745, "num_tokens": 6332432.0, "step": 2965 }, { "entropy": 6.296169853210449, "epoch": 0.17359284587059443, "grad_norm": 1.0859375, "learning_rate": 0.00016888378839891298, "loss": 5.9592, "mean_token_accuracy": 0.14839272052049637, "num_tokens": 6343577.0, "step": 2970 }, { "entropy": 6.259261178970337, "epoch": 0.1738850897188614, "grad_norm": 0.9921875, "learning_rate": 0.0001678464041747137, "loss": 5.9651, "mean_token_accuracy": 0.15139905959367753, "num_tokens": 6353689.0, "step": 2975 }, { "entropy": 6.2840352058410645, "epoch": 0.17417733356712842, "grad_norm": 0.9453125, "learning_rate": 0.00016681195762047223, "loss": 5.9491, "mean_token_accuracy": 0.15322353988885878, "num_tokens": 6365075.0, "step": 2980 }, { "entropy": 6.284506511688233, "epoch": 0.1744695774153954, "grad_norm": 1.0703125, "learning_rate": 0.00016578047709606337, "loss": 5.9137, "mean_token_accuracy": 0.16487067937850952, "num_tokens": 6375189.0, "step": 2985 }, { "entropy": 6.261584281921387, "epoch": 0.1747618212636624, "grad_norm": 1.109375, "learning_rate": 0.00016475199088004678, "loss": 5.9027, "mean_token_accuracy": 0.15671227872371674, "num_tokens": 6385028.0, "step": 2990 }, { "entropy": 6.270907258987426, "epoch": 0.1750540651119294, "grad_norm": 1.0390625, "learning_rate": 0.00016372652716889163, "loss": 5.9415, "mean_token_accuracy": 0.14871460497379302, "num_tokens": 6395912.0, "step": 2995 }, { "entropy": 6.318777847290039, "epoch": 0.1753463089601964, "grad_norm": 1.03125, "learning_rate": 0.0001627041140762035, "loss": 5.8682, "mean_token_accuracy": 0.15546663701534272, "num_tokens": 6405993.0, "step": 3000 }, { "entropy": 6.283399152755737, "epoch": 0.17563855280846338, "grad_norm": 1.0390625, "learning_rate": 0.00016168477963195382, "loss": 5.9756, "mean_token_accuracy": 0.1521611973643303, "num_tokens": 6417085.0, "step": 3005 }, { "entropy": 6.2866161346435545, "epoch": 0.17593079665673036, "grad_norm": 1.0390625, "learning_rate": 0.0001606685517817114, "loss": 5.8998, "mean_token_accuracy": 0.15176964104175567, "num_tokens": 6426768.0, "step": 3010 }, { "entropy": 6.262517881393433, "epoch": 0.17622304050499737, "grad_norm": 1.0, "learning_rate": 0.00015965545838587592, "loss": 5.9442, "mean_token_accuracy": 0.16012927442789077, "num_tokens": 6437068.0, "step": 3015 }, { "entropy": 6.298662185668945, "epoch": 0.17651528435326436, "grad_norm": 1.140625, "learning_rate": 0.00015864552721891467, "loss": 5.9239, "mean_token_accuracy": 0.1625131204724312, "num_tokens": 6447480.0, "step": 3020 }, { "entropy": 6.237483263015747, "epoch": 0.17680752820153137, "grad_norm": 1.1484375, "learning_rate": 0.00015763878596860076, "loss": 5.9547, "mean_token_accuracy": 0.15520766079425813, "num_tokens": 6458014.0, "step": 3025 }, { "entropy": 6.32170672416687, "epoch": 0.17709977204979835, "grad_norm": 1.0859375, "learning_rate": 0.00015663526223525412, "loss": 5.9367, "mean_token_accuracy": 0.15889369696378708, "num_tokens": 6467899.0, "step": 3030 }, { "entropy": 6.276149654388428, "epoch": 0.17739201589806536, "grad_norm": 0.96875, "learning_rate": 0.0001556349835309848, "loss": 5.9776, "mean_token_accuracy": 0.14879269748926163, "num_tokens": 6480192.0, "step": 3035 }, { "entropy": 6.2329589366912845, "epoch": 0.17768425974633234, "grad_norm": 0.9375, "learning_rate": 0.0001546379772789389, "loss": 5.9551, "mean_token_accuracy": 0.15424026623368264, "num_tokens": 6492019.0, "step": 3040 }, { "entropy": 6.322043323516846, "epoch": 0.17797650359459932, "grad_norm": 0.91015625, "learning_rate": 0.00015364427081254622, "loss": 5.8893, "mean_token_accuracy": 0.16130917072296141, "num_tokens": 6503478.0, "step": 3045 }, { "entropy": 6.256545495986939, "epoch": 0.17826874744286633, "grad_norm": 0.984375, "learning_rate": 0.00015265389137477165, "loss": 5.8816, "mean_token_accuracy": 0.15927795171737671, "num_tokens": 6513982.0, "step": 3050 }, { "entropy": 6.287691116333008, "epoch": 0.17856099129113331, "grad_norm": 0.95703125, "learning_rate": 0.00015166686611736786, "loss": 5.8846, "mean_token_accuracy": 0.1545673280954361, "num_tokens": 6524798.0, "step": 3055 }, { "entropy": 6.238642454147339, "epoch": 0.17885323513940032, "grad_norm": 0.96484375, "learning_rate": 0.00015068322210013064, "loss": 5.8386, "mean_token_accuracy": 0.1584905982017517, "num_tokens": 6536105.0, "step": 3060 }, { "entropy": 6.26782922744751, "epoch": 0.1791454789876673, "grad_norm": 0.98046875, "learning_rate": 0.0001497029862901578, "loss": 5.9609, "mean_token_accuracy": 0.15500572472810745, "num_tokens": 6547250.0, "step": 3065 }, { "entropy": 6.257089996337891, "epoch": 0.17943772283593432, "grad_norm": 0.98828125, "learning_rate": 0.00014872618556110905, "loss": 5.8859, "mean_token_accuracy": 0.1602465182542801, "num_tokens": 6556990.0, "step": 3070 }, { "entropy": 6.1768107414245605, "epoch": 0.1797299666842013, "grad_norm": 1.0234375, "learning_rate": 0.00014775284669246992, "loss": 5.8949, "mean_token_accuracy": 0.15843170285224914, "num_tokens": 6567916.0, "step": 3075 }, { "entropy": 6.210200643539428, "epoch": 0.18002221053246828, "grad_norm": 1.0546875, "learning_rate": 0.00014678299636881716, "loss": 5.8162, "mean_token_accuracy": 0.16867512762546538, "num_tokens": 6578775.0, "step": 3080 }, { "entropy": 6.217078065872192, "epoch": 0.1803144543807353, "grad_norm": 1.078125, "learning_rate": 0.0001458166611790873, "loss": 5.8867, "mean_token_accuracy": 0.16877478063106538, "num_tokens": 6588779.0, "step": 3085 }, { "entropy": 6.325368118286133, "epoch": 0.18060669822900227, "grad_norm": 1.046875, "learning_rate": 0.00014485386761584773, "loss": 5.9561, "mean_token_accuracy": 0.15594409108161927, "num_tokens": 6599315.0, "step": 3090 }, { "entropy": 6.343292951583862, "epoch": 0.18089894207726928, "grad_norm": 0.9609375, "learning_rate": 0.00014389464207457042, "loss": 5.977, "mean_token_accuracy": 0.1541369929909706, "num_tokens": 6610900.0, "step": 3095 }, { "entropy": 6.318844509124756, "epoch": 0.18119118592553626, "grad_norm": 0.984375, "learning_rate": 0.00014293901085290795, "loss": 5.9314, "mean_token_accuracy": 0.1589741140604019, "num_tokens": 6621888.0, "step": 3100 }, { "entropy": 6.229228878021241, "epoch": 0.18148342977380327, "grad_norm": 0.99609375, "learning_rate": 0.00014198700014997307, "loss": 5.9603, "mean_token_accuracy": 0.1509167268872261, "num_tokens": 6632228.0, "step": 3105 }, { "entropy": 6.231994199752807, "epoch": 0.18177567362207026, "grad_norm": 1.1796875, "learning_rate": 0.00014103863606562016, "loss": 5.8834, "mean_token_accuracy": 0.16131148487329483, "num_tokens": 6642354.0, "step": 3110 }, { "entropy": 6.221903371810913, "epoch": 0.18206791747033724, "grad_norm": 1.1171875, "learning_rate": 0.00014009394459972964, "loss": 5.8589, "mean_token_accuracy": 0.16473948806524277, "num_tokens": 6653025.0, "step": 3115 }, { "entropy": 6.255872964859009, "epoch": 0.18236016131860425, "grad_norm": 0.99609375, "learning_rate": 0.00013915295165149513, "loss": 5.8858, "mean_token_accuracy": 0.1564686566591263, "num_tokens": 6663326.0, "step": 3120 }, { "entropy": 6.3000284194946286, "epoch": 0.18265240516687123, "grad_norm": 1.0078125, "learning_rate": 0.00013821568301871384, "loss": 5.9204, "mean_token_accuracy": 0.15571961998939515, "num_tokens": 6674104.0, "step": 3125 }, { "entropy": 6.257794427871704, "epoch": 0.18294464901513824, "grad_norm": 1.0859375, "learning_rate": 0.00013728216439707862, "loss": 5.8444, "mean_token_accuracy": 0.16243265718221664, "num_tokens": 6684442.0, "step": 3130 }, { "entropy": 6.297143602371216, "epoch": 0.18323689286340522, "grad_norm": 1.0234375, "learning_rate": 0.00013635242137947419, "loss": 5.9649, "mean_token_accuracy": 0.15052273720502854, "num_tokens": 6695683.0, "step": 3135 }, { "entropy": 6.2341681003570555, "epoch": 0.18352913671167223, "grad_norm": 1.078125, "learning_rate": 0.00013542647945527498, "loss": 5.8073, "mean_token_accuracy": 0.16549235731363296, "num_tokens": 6705252.0, "step": 3140 }, { "entropy": 6.2586750984191895, "epoch": 0.1838213805599392, "grad_norm": 1.0625, "learning_rate": 0.0001345043640096465, "loss": 5.8929, "mean_token_accuracy": 0.1568222850561142, "num_tokens": 6715800.0, "step": 3145 }, { "entropy": 6.275263833999634, "epoch": 0.1841136244082062, "grad_norm": 1.1796875, "learning_rate": 0.00013358610032284957, "loss": 5.827, "mean_token_accuracy": 0.15784039795398713, "num_tokens": 6726027.0, "step": 3150 }, { "entropy": 6.254611206054688, "epoch": 0.1844058682564732, "grad_norm": 1.0546875, "learning_rate": 0.000132671713569547, "loss": 5.8536, "mean_token_accuracy": 0.15593142211437225, "num_tokens": 6736023.0, "step": 3155 }, { "entropy": 6.220268058776855, "epoch": 0.1846981121047402, "grad_norm": 1.0390625, "learning_rate": 0.0001317612288181136, "loss": 5.9378, "mean_token_accuracy": 0.15204131305217744, "num_tokens": 6747433.0, "step": 3160 }, { "entropy": 6.2448375701904295, "epoch": 0.1849903559530072, "grad_norm": 1.078125, "learning_rate": 0.00013085467102994864, "loss": 5.8586, "mean_token_accuracy": 0.15780818611383438, "num_tokens": 6758207.0, "step": 3165 }, { "entropy": 6.2656317234039305, "epoch": 0.18528259980127418, "grad_norm": 1.0546875, "learning_rate": 0.00012995206505879198, "loss": 5.8944, "mean_token_accuracy": 0.16099692285060882, "num_tokens": 6768640.0, "step": 3170 }, { "entropy": 6.305795383453369, "epoch": 0.1855748436495412, "grad_norm": 1.0234375, "learning_rate": 0.0001290534356500421, "loss": 5.878, "mean_token_accuracy": 0.1598610058426857, "num_tokens": 6780244.0, "step": 3175 }, { "entropy": 6.227605533599854, "epoch": 0.18586708749780817, "grad_norm": 1.03125, "learning_rate": 0.00012815880744007827, "loss": 5.9234, "mean_token_accuracy": 0.15409687906503677, "num_tokens": 6790334.0, "step": 3180 }, { "entropy": 6.286476898193359, "epoch": 0.18615933134607515, "grad_norm": 1.109375, "learning_rate": 0.00012726820495558483, "loss": 5.9309, "mean_token_accuracy": 0.15614654123783112, "num_tokens": 6800624.0, "step": 3185 }, { "entropy": 6.283801078796387, "epoch": 0.18645157519434216, "grad_norm": 1.1015625, "learning_rate": 0.00012638165261287868, "loss": 5.9173, "mean_token_accuracy": 0.15313496440649033, "num_tokens": 6812309.0, "step": 3190 }, { "entropy": 6.247753429412842, "epoch": 0.18674381904260914, "grad_norm": 1.046875, "learning_rate": 0.0001254991747172402, "loss": 5.8264, "mean_token_accuracy": 0.16600472778081893, "num_tokens": 6822699.0, "step": 3195 }, { "entropy": 6.194558906555176, "epoch": 0.18703606289087615, "grad_norm": 1.0703125, "learning_rate": 0.00012462079546224662, "loss": 5.8231, "mean_token_accuracy": 0.16591012626886367, "num_tokens": 6832901.0, "step": 3200 }, { "entropy": 6.248186922073364, "epoch": 0.18732830673914314, "grad_norm": 1.171875, "learning_rate": 0.00012374653892910896, "loss": 5.9326, "mean_token_accuracy": 0.15820514261722565, "num_tokens": 6843547.0, "step": 3205 }, { "entropy": 6.250892066955567, "epoch": 0.18762055058741015, "grad_norm": 1.078125, "learning_rate": 0.00012287642908601166, "loss": 5.8263, "mean_token_accuracy": 0.16346440464258194, "num_tokens": 6853779.0, "step": 3210 }, { "entropy": 6.2538402557373045, "epoch": 0.18791279443567713, "grad_norm": 1.0, "learning_rate": 0.00012201048978745569, "loss": 5.8144, "mean_token_accuracy": 0.1630478873848915, "num_tokens": 6864417.0, "step": 3215 }, { "entropy": 6.2370952606201175, "epoch": 0.1882050382839441, "grad_norm": 0.953125, "learning_rate": 0.00012114874477360427, "loss": 5.8815, "mean_token_accuracy": 0.15915295779705046, "num_tokens": 6875310.0, "step": 3220 }, { "entropy": 6.269949960708618, "epoch": 0.18849728213221112, "grad_norm": 1.0859375, "learning_rate": 0.00012029121766963236, "loss": 5.9562, "mean_token_accuracy": 0.14962919652462006, "num_tokens": 6886732.0, "step": 3225 }, { "entropy": 6.281165885925293, "epoch": 0.1887895259804781, "grad_norm": 0.984375, "learning_rate": 0.00011943793198507858, "loss": 5.8957, "mean_token_accuracy": 0.15709118247032167, "num_tokens": 6897254.0, "step": 3230 }, { "entropy": 6.316904973983765, "epoch": 0.1890817698287451, "grad_norm": 1.09375, "learning_rate": 0.00011858891111320104, "loss": 5.9125, "mean_token_accuracy": 0.1573660343885422, "num_tokens": 6907382.0, "step": 3235 }, { "entropy": 6.245898056030273, "epoch": 0.1893740136770121, "grad_norm": 1.125, "learning_rate": 0.0001177441783303359, "loss": 5.9008, "mean_token_accuracy": 0.15485315173864364, "num_tokens": 6917189.0, "step": 3240 }, { "entropy": 6.22566294670105, "epoch": 0.1896662575252791, "grad_norm": 1.0546875, "learning_rate": 0.00011690375679525896, "loss": 5.8544, "mean_token_accuracy": 0.15707467794418334, "num_tokens": 6927523.0, "step": 3245 }, { "entropy": 6.285468244552613, "epoch": 0.18995850137354608, "grad_norm": 0.94921875, "learning_rate": 0.00011606766954855124, "loss": 5.8779, "mean_token_accuracy": 0.1606733500957489, "num_tokens": 6939475.0, "step": 3250 }, { "entropy": 6.271123743057251, "epoch": 0.1902507452218131, "grad_norm": 1.046875, "learning_rate": 0.00011523593951196702, "loss": 5.8547, "mean_token_accuracy": 0.15778176635503768, "num_tokens": 6948928.0, "step": 3255 }, { "entropy": 6.2798747539520265, "epoch": 0.19054298907008008, "grad_norm": 0.9609375, "learning_rate": 0.00011440858948780523, "loss": 5.9219, "mean_token_accuracy": 0.1565907746553421, "num_tokens": 6959917.0, "step": 3260 }, { "entropy": 6.232462787628174, "epoch": 0.19083523291834706, "grad_norm": 1.0703125, "learning_rate": 0.00011358564215828484, "loss": 5.8712, "mean_token_accuracy": 0.15686557441949844, "num_tokens": 6970426.0, "step": 3265 }, { "entropy": 6.255841636657715, "epoch": 0.19112747676661407, "grad_norm": 1.109375, "learning_rate": 0.00011276712008492254, "loss": 5.8603, "mean_token_accuracy": 0.15819348394870758, "num_tokens": 6981412.0, "step": 3270 }, { "entropy": 6.236334943771363, "epoch": 0.19141972061488105, "grad_norm": 1.046875, "learning_rate": 0.00011195304570791451, "loss": 5.8288, "mean_token_accuracy": 0.16009365618228913, "num_tokens": 6992384.0, "step": 3275 }, { "entropy": 6.254592370986939, "epoch": 0.19171196446314806, "grad_norm": 0.94921875, "learning_rate": 0.00011114344134552094, "loss": 5.8869, "mean_token_accuracy": 0.15505520552396773, "num_tokens": 7004033.0, "step": 3280 }, { "entropy": 6.225855112075806, "epoch": 0.19200420831141504, "grad_norm": 1.125, "learning_rate": 0.0001103383291934545, "loss": 5.8348, "mean_token_accuracy": 0.16033557802438736, "num_tokens": 7014473.0, "step": 3285 }, { "entropy": 6.279972171783447, "epoch": 0.19229645215968205, "grad_norm": 1.0390625, "learning_rate": 0.00010953773132427141, "loss": 5.8444, "mean_token_accuracy": 0.1567966401576996, "num_tokens": 7024933.0, "step": 3290 }, { "entropy": 6.281522560119629, "epoch": 0.19258869600794903, "grad_norm": 1.0703125, "learning_rate": 0.00010874166968676677, "loss": 5.8781, "mean_token_accuracy": 0.1557956889271736, "num_tokens": 7035709.0, "step": 3295 }, { "entropy": 6.24364743232727, "epoch": 0.19288093985621602, "grad_norm": 0.9921875, "learning_rate": 0.00010795016610537251, "loss": 5.9007, "mean_token_accuracy": 0.15638068467378616, "num_tokens": 7046090.0, "step": 3300 }, { "entropy": 6.247688102722168, "epoch": 0.19317318370448303, "grad_norm": 0.96484375, "learning_rate": 0.00010716324227955904, "loss": 5.9125, "mean_token_accuracy": 0.15485986471176147, "num_tokens": 7057984.0, "step": 3305 }, { "entropy": 6.260491275787354, "epoch": 0.19346542755275, "grad_norm": 1.015625, "learning_rate": 0.0001063809197832406, "loss": 5.839, "mean_token_accuracy": 0.16005982756614684, "num_tokens": 7069717.0, "step": 3310 }, { "entropy": 6.289077711105347, "epoch": 0.19375767140101702, "grad_norm": 1.078125, "learning_rate": 0.00010560322006418368, "loss": 5.9414, "mean_token_accuracy": 0.1482711210846901, "num_tokens": 7080763.0, "step": 3315 }, { "entropy": 6.228817510604858, "epoch": 0.194049915249284, "grad_norm": 1.1015625, "learning_rate": 0.00010483016444341887, "loss": 5.8543, "mean_token_accuracy": 0.16758138090372085, "num_tokens": 7090765.0, "step": 3320 }, { "entropy": 6.282393932342529, "epoch": 0.194342159097551, "grad_norm": 1.0625, "learning_rate": 0.00010406177411465654, "loss": 5.9164, "mean_token_accuracy": 0.16024034470319748, "num_tokens": 7101056.0, "step": 3325 }, { "entropy": 6.282049322128296, "epoch": 0.194634402945818, "grad_norm": 1.015625, "learning_rate": 0.00010329807014370562, "loss": 5.8344, "mean_token_accuracy": 0.16477701663970948, "num_tokens": 7112077.0, "step": 3330 }, { "entropy": 6.23296799659729, "epoch": 0.19492664679408497, "grad_norm": 1.0078125, "learning_rate": 0.00010253907346789632, "loss": 5.7806, "mean_token_accuracy": 0.16275889575481414, "num_tokens": 7122760.0, "step": 3335 }, { "entropy": 6.233717155456543, "epoch": 0.19521889064235198, "grad_norm": 1.03125, "learning_rate": 0.00010178480489550596, "loss": 5.9269, "mean_token_accuracy": 0.16597806364297868, "num_tokens": 7133883.0, "step": 3340 }, { "entropy": 6.250077867507935, "epoch": 0.19551113449061897, "grad_norm": 1.0078125, "learning_rate": 0.00010103528510518836, "loss": 5.8742, "mean_token_accuracy": 0.15735647082328796, "num_tokens": 7143890.0, "step": 3345 }, { "entropy": 6.238697147369384, "epoch": 0.19580337833888597, "grad_norm": 1.0390625, "learning_rate": 0.0001002905346454073, "loss": 5.82, "mean_token_accuracy": 0.16303645372390746, "num_tokens": 7154256.0, "step": 3350 }, { "entropy": 6.26402530670166, "epoch": 0.19609562218715296, "grad_norm": 1.0, "learning_rate": 9.955057393387285e-05, "loss": 5.873, "mean_token_accuracy": 0.16090958714485168, "num_tokens": 7165126.0, "step": 3355 }, { "entropy": 6.276232147216797, "epoch": 0.19638786603541997, "grad_norm": 1.109375, "learning_rate": 9.88154232569816e-05, "loss": 5.7926, "mean_token_accuracy": 0.16471965312957765, "num_tokens": 7176532.0, "step": 3360 }, { "entropy": 6.237003183364868, "epoch": 0.19668010988368695, "grad_norm": 0.953125, "learning_rate": 9.808510276926075e-05, "loss": 5.8243, "mean_token_accuracy": 0.16415449380874633, "num_tokens": 7188181.0, "step": 3365 }, { "entropy": 6.213815784454345, "epoch": 0.19697235373195393, "grad_norm": 0.92578125, "learning_rate": 9.735963249281549e-05, "loss": 5.7948, "mean_token_accuracy": 0.16533007472753525, "num_tokens": 7199081.0, "step": 3370 }, { "entropy": 6.21927318572998, "epoch": 0.19726459758022094, "grad_norm": 1.1484375, "learning_rate": 9.663903231677974e-05, "loss": 5.7777, "mean_token_accuracy": 0.16500383913516997, "num_tokens": 7209165.0, "step": 3375 }, { "entropy": 6.218824005126953, "epoch": 0.19755684142848792, "grad_norm": 1.0078125, "learning_rate": 9.592332199677145e-05, "loss": 5.8774, "mean_token_accuracy": 0.1631125494837761, "num_tokens": 7219973.0, "step": 3380 }, { "entropy": 6.241815805435181, "epoch": 0.19784908527675493, "grad_norm": 1.140625, "learning_rate": 9.521252115435061e-05, "loss": 5.8447, "mean_token_accuracy": 0.16132166087627411, "num_tokens": 7230846.0, "step": 3385 }, { "entropy": 6.213486671447754, "epoch": 0.19814132912502191, "grad_norm": 0.96875, "learning_rate": 9.450664927648126e-05, "loss": 5.8499, "mean_token_accuracy": 0.1634298399090767, "num_tokens": 7241874.0, "step": 3390 }, { "entropy": 6.246858358383179, "epoch": 0.19843357297328892, "grad_norm": 0.921875, "learning_rate": 9.380572571499758e-05, "loss": 5.8527, "mean_token_accuracy": 0.16297064274549483, "num_tokens": 7252468.0, "step": 3395 }, { "entropy": 6.28117094039917, "epoch": 0.1987258168215559, "grad_norm": 0.91796875, "learning_rate": 9.310976968607307e-05, "loss": 5.9974, "mean_token_accuracy": 0.15045272409915925, "num_tokens": 7264221.0, "step": 3400 }, { "entropy": 6.245209884643555, "epoch": 0.1990180606698229, "grad_norm": 1.03125, "learning_rate": 9.241880026969381e-05, "loss": 5.8651, "mean_token_accuracy": 0.1604456678032875, "num_tokens": 7275063.0, "step": 3405 }, { "entropy": 6.268118858337402, "epoch": 0.1993103045180899, "grad_norm": 1.03125, "learning_rate": 9.173283640913537e-05, "loss": 5.8696, "mean_token_accuracy": 0.15584716200828552, "num_tokens": 7285343.0, "step": 3410 }, { "entropy": 6.275067472457886, "epoch": 0.19960254836635688, "grad_norm": 1.0234375, "learning_rate": 9.10518969104436e-05, "loss": 5.9048, "mean_token_accuracy": 0.1594344735145569, "num_tokens": 7297296.0, "step": 3415 }, { "entropy": 6.2276551723480225, "epoch": 0.1998947922146239, "grad_norm": 1.15625, "learning_rate": 9.037600044191868e-05, "loss": 5.889, "mean_token_accuracy": 0.15555773824453353, "num_tokens": 7308216.0, "step": 3420 }, { "entropy": 6.2653766632080075, "epoch": 0.20018703606289087, "grad_norm": 1.0625, "learning_rate": 8.970516553360383e-05, "loss": 5.8122, "mean_token_accuracy": 0.16367650181055068, "num_tokens": 7318708.0, "step": 3425 }, { "entropy": 6.279593753814697, "epoch": 0.20047927991115788, "grad_norm": 1.0703125, "learning_rate": 8.903941057677692e-05, "loss": 5.887, "mean_token_accuracy": 0.15948577970266342, "num_tokens": 7328989.0, "step": 3430 }, { "entropy": 6.302930688858032, "epoch": 0.20077152375942486, "grad_norm": 1.28125, "learning_rate": 8.837875382344635e-05, "loss": 5.9699, "mean_token_accuracy": 0.159020034968853, "num_tokens": 7340188.0, "step": 3435 }, { "entropy": 6.257382011413574, "epoch": 0.20106376760769185, "grad_norm": 1.015625, "learning_rate": 8.772321338585076e-05, "loss": 5.8884, "mean_token_accuracy": 0.15751360058784486, "num_tokens": 7350847.0, "step": 3440 }, { "entropy": 6.2526270866394045, "epoch": 0.20135601145595886, "grad_norm": 1.0703125, "learning_rate": 8.707280723596242e-05, "loss": 5.8704, "mean_token_accuracy": 0.16057247072458267, "num_tokens": 7361499.0, "step": 3445 }, { "entropy": 6.221743869781494, "epoch": 0.20164825530422584, "grad_norm": 1.03125, "learning_rate": 8.64275532049944e-05, "loss": 5.8203, "mean_token_accuracy": 0.168203441798687, "num_tokens": 7372395.0, "step": 3450 }, { "entropy": 6.2632581233978275, "epoch": 0.20194049915249285, "grad_norm": 1.109375, "learning_rate": 8.578746898291198e-05, "loss": 5.8997, "mean_token_accuracy": 0.15661046504974366, "num_tokens": 7382462.0, "step": 3455 }, { "entropy": 6.325605487823486, "epoch": 0.20223274300075983, "grad_norm": 1.125, "learning_rate": 8.515257211794742e-05, "loss": 5.8138, "mean_token_accuracy": 0.16082889437675477, "num_tokens": 7392000.0, "step": 3460 }, { "entropy": 6.280700826644898, "epoch": 0.20252498684902684, "grad_norm": 1.046875, "learning_rate": 8.452288001611896e-05, "loss": 5.8843, "mean_token_accuracy": 0.1621067613363266, "num_tokens": 7403286.0, "step": 3465 }, { "entropy": 6.2394922256469725, "epoch": 0.20281723069729382, "grad_norm": 1.015625, "learning_rate": 8.389840994075379e-05, "loss": 5.8736, "mean_token_accuracy": 0.15633028000593185, "num_tokens": 7414412.0, "step": 3470 }, { "entropy": 6.266023111343384, "epoch": 0.2031094745455608, "grad_norm": 1.1796875, "learning_rate": 8.327917901201435e-05, "loss": 5.8402, "mean_token_accuracy": 0.15468731224536897, "num_tokens": 7425218.0, "step": 3475 }, { "entropy": 6.302168655395508, "epoch": 0.2034017183938278, "grad_norm": 1.09375, "learning_rate": 8.266520420642931e-05, "loss": 5.8598, "mean_token_accuracy": 0.16676196753978728, "num_tokens": 7435899.0, "step": 3480 }, { "entropy": 6.301884126663208, "epoch": 0.2036939622420948, "grad_norm": 1.015625, "learning_rate": 8.205650235642828e-05, "loss": 5.9184, "mean_token_accuracy": 0.15453746318817138, "num_tokens": 7446812.0, "step": 3485 }, { "entropy": 6.283580780029297, "epoch": 0.2039862060903618, "grad_norm": 1.09375, "learning_rate": 8.145309014987978e-05, "loss": 5.9471, "mean_token_accuracy": 0.15718840509653093, "num_tokens": 7457468.0, "step": 3490 }, { "entropy": 6.2381792068481445, "epoch": 0.2042784499386288, "grad_norm": 1.0, "learning_rate": 8.085498412963437e-05, "loss": 5.8541, "mean_token_accuracy": 0.16251549422740935, "num_tokens": 7468604.0, "step": 3495 }, { "entropy": 6.2204193592071535, "epoch": 0.2045706937868958, "grad_norm": 1.109375, "learning_rate": 8.026220069307078e-05, "loss": 5.8658, "mean_token_accuracy": 0.15938508212566377, "num_tokens": 7479548.0, "step": 3500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1647496421867520.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }