{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0584487696533988, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742551231384278, "epoch": 0.000292243848266994, "grad_norm": 4.9375, "learning_rate": 2e-06, "loss": 10.7723, "mean_token_accuracy": 9.259259095415474e-05, "num_tokens": 11114.0, "step": 5 }, { "entropy": 10.742591094970702, "epoch": 0.000584487696533988, "grad_norm": 5.4375, "learning_rate": 4.5e-06, "loss": 10.7466, "mean_token_accuracy": 0.0, "num_tokens": 20935.0, "step": 10 }, { "entropy": 10.742585849761962, "epoch": 0.000876731544800982, "grad_norm": 5.09375, "learning_rate": 7e-06, "loss": 10.7483, "mean_token_accuracy": 0.0, "num_tokens": 31930.0, "step": 15 }, { "entropy": 10.742614936828613, "epoch": 0.001168975393067976, "grad_norm": 5.125, "learning_rate": 9.5e-06, "loss": 10.6676, "mean_token_accuracy": 0.0005568421445786953, "num_tokens": 41672.0, "step": 20 }, { "entropy": 10.742519950866699, "epoch": 0.00146121924133497, "grad_norm": 4.9375, "learning_rate": 1.2e-05, "loss": 10.5834, "mean_token_accuracy": 0.013186294632032514, "num_tokens": 52510.0, "step": 25 }, { "entropy": 10.742103958129883, "epoch": 0.001753463089601964, "grad_norm": 4.3125, "learning_rate": 1.4500000000000002e-05, "loss": 10.4654, "mean_token_accuracy": 0.04129958841949701, "num_tokens": 63214.0, "step": 30 }, { "entropy": 10.740110874176025, "epoch": 0.002045706937868958, "grad_norm": 3.203125, "learning_rate": 1.7000000000000003e-05, "loss": 10.305, "mean_token_accuracy": 0.05048500820994377, "num_tokens": 73942.0, "step": 35 }, { "entropy": 10.733905601501466, "epoch": 0.002337950786135952, "grad_norm": 2.4375, "learning_rate": 1.95e-05, "loss": 10.1895, "mean_token_accuracy": 0.051587145403027536, "num_tokens": 84526.0, "step": 40 }, { "entropy": 10.72324333190918, "epoch": 0.0026301946344029457, "grad_norm": 2.125, "learning_rate": 2.2e-05, "loss": 10.1139, "mean_token_accuracy": 0.04853160977363587, "num_tokens": 95178.0, "step": 45 }, { "entropy": 10.714754772186279, "epoch": 0.00292243848266994, "grad_norm": 2.140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.0146, "mean_token_accuracy": 0.05312369242310524, "num_tokens": 106653.0, "step": 50 }, { "entropy": 10.708310794830322, "epoch": 0.0032146823309369336, "grad_norm": 1.96875, "learning_rate": 2.7e-05, "loss": 9.9113, "mean_token_accuracy": 0.050825309753417966, "num_tokens": 115969.0, "step": 55 }, { "entropy": 10.704185581207275, "epoch": 0.003506926179203928, "grad_norm": 1.7734375, "learning_rate": 2.95e-05, "loss": 9.8939, "mean_token_accuracy": 0.048680877685546874, "num_tokens": 125826.0, "step": 60 }, { "entropy": 10.701387882232666, "epoch": 0.0037991700274709215, "grad_norm": 1.890625, "learning_rate": 3.2e-05, "loss": 9.872, "mean_token_accuracy": 0.04808175079524517, "num_tokens": 136677.0, "step": 65 }, { "entropy": 10.697122478485108, "epoch": 0.004091413875737916, "grad_norm": 1.8125, "learning_rate": 3.4500000000000005e-05, "loss": 9.8236, "mean_token_accuracy": 0.04725121222436428, "num_tokens": 147535.0, "step": 70 }, { "entropy": 10.691372871398926, "epoch": 0.00438365772400491, "grad_norm": 1.8046875, "learning_rate": 3.7e-05, "loss": 9.722, "mean_token_accuracy": 0.04985377714037895, "num_tokens": 157524.0, "step": 75 }, { "entropy": 10.681602478027344, "epoch": 0.004675901572271904, "grad_norm": 1.6875, "learning_rate": 3.95e-05, "loss": 9.6896, "mean_token_accuracy": 0.05114552080631256, "num_tokens": 168344.0, "step": 80 }, { "entropy": 10.67192096710205, "epoch": 0.004968145420538897, "grad_norm": 1.7109375, "learning_rate": 4.2000000000000004e-05, "loss": 9.6618, "mean_token_accuracy": 0.04409446604549885, "num_tokens": 178976.0, "step": 85 }, { "entropy": 10.664519691467286, "epoch": 0.0052603892688058915, "grad_norm": 1.8671875, "learning_rate": 4.45e-05, "loss": 9.5639, "mean_token_accuracy": 0.05372482612729072, "num_tokens": 190567.0, "step": 90 }, { "entropy": 10.647130489349365, "epoch": 0.005552633117072886, "grad_norm": 1.75, "learning_rate": 4.7000000000000004e-05, "loss": 9.4984, "mean_token_accuracy": 0.05118483640253544, "num_tokens": 201587.0, "step": 95 }, { "entropy": 10.62646837234497, "epoch": 0.00584487696533988, "grad_norm": 1.671875, "learning_rate": 4.9500000000000004e-05, "loss": 9.4193, "mean_token_accuracy": 0.04868996068835259, "num_tokens": 211913.0, "step": 100 }, { "entropy": 10.610049438476562, "epoch": 0.006137120813606874, "grad_norm": 1.8125, "learning_rate": 5.2e-05, "loss": 9.3409, "mean_token_accuracy": 0.05402343980967998, "num_tokens": 222247.0, "step": 105 }, { "entropy": 10.584276962280274, "epoch": 0.006429364661873867, "grad_norm": 1.625, "learning_rate": 5.45e-05, "loss": 9.2142, "mean_token_accuracy": 0.06452971324324608, "num_tokens": 232361.0, "step": 110 }, { "entropy": 10.533616924285889, "epoch": 0.006721608510140861, "grad_norm": 1.671875, "learning_rate": 5.7e-05, "loss": 9.1281, "mean_token_accuracy": 0.0630628488957882, "num_tokens": 242885.0, "step": 115 }, { "entropy": 10.462300109863282, "epoch": 0.007013852358407856, "grad_norm": 1.6015625, "learning_rate": 5.9499999999999996e-05, "loss": 9.0436, "mean_token_accuracy": 0.060920076444745064, "num_tokens": 254482.0, "step": 120 }, { "entropy": 10.408651351928711, "epoch": 0.00730609620667485, "grad_norm": 1.6171875, "learning_rate": 6.2e-05, "loss": 8.93, "mean_token_accuracy": 0.059300025925040245, "num_tokens": 265744.0, "step": 125 }, { "entropy": 10.367331790924073, "epoch": 0.007598340054941843, "grad_norm": 1.421875, "learning_rate": 6.450000000000001e-05, "loss": 8.8327, "mean_token_accuracy": 0.058924198523163794, "num_tokens": 276924.0, "step": 130 }, { "entropy": 10.272025775909423, "epoch": 0.007890583903208837, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.7304, "mean_token_accuracy": 0.0622296292334795, "num_tokens": 287779.0, "step": 135 }, { "entropy": 10.183625984191895, "epoch": 0.008182827751475831, "grad_norm": 1.3984375, "learning_rate": 6.950000000000001e-05, "loss": 8.6335, "mean_token_accuracy": 0.06356315091252326, "num_tokens": 298807.0, "step": 140 }, { "entropy": 10.097103500366211, "epoch": 0.008475071599742826, "grad_norm": 1.2109375, "learning_rate": 7.2e-05, "loss": 8.5907, "mean_token_accuracy": 0.0559815414249897, "num_tokens": 309760.0, "step": 145 }, { "entropy": 10.004411506652833, "epoch": 0.00876731544800982, "grad_norm": 1.1796875, "learning_rate": 7.45e-05, "loss": 8.397, "mean_token_accuracy": 0.06126284077763557, "num_tokens": 319750.0, "step": 150 }, { "entropy": 9.832055950164795, "epoch": 0.009059559296276814, "grad_norm": 1.1484375, "learning_rate": 7.7e-05, "loss": 8.2924, "mean_token_accuracy": 0.0603407833725214, "num_tokens": 329931.0, "step": 155 }, { "entropy": 9.66302547454834, "epoch": 0.009351803144543808, "grad_norm": 1.0078125, "learning_rate": 7.950000000000001e-05, "loss": 8.2478, "mean_token_accuracy": 0.06180734224617481, "num_tokens": 340457.0, "step": 160 }, { "entropy": 9.49033498764038, "epoch": 0.009644046992810802, "grad_norm": 0.9296875, "learning_rate": 8.2e-05, "loss": 8.1199, "mean_token_accuracy": 0.06424234174191952, "num_tokens": 352450.0, "step": 165 }, { "entropy": 9.311860942840577, "epoch": 0.009936290841077795, "grad_norm": 0.85546875, "learning_rate": 8.450000000000001e-05, "loss": 8.1159, "mean_token_accuracy": 0.06317566409707069, "num_tokens": 363204.0, "step": 170 }, { "entropy": 9.153958892822265, "epoch": 0.010228534689344789, "grad_norm": 0.80078125, "learning_rate": 8.7e-05, "loss": 8.0882, "mean_token_accuracy": 0.062278729677200315, "num_tokens": 373577.0, "step": 175 }, { "entropy": 8.929795932769775, "epoch": 0.010520778537611783, "grad_norm": 0.76171875, "learning_rate": 8.95e-05, "loss": 7.9663, "mean_token_accuracy": 0.07208616435527801, "num_tokens": 384267.0, "step": 180 }, { "entropy": 8.768066787719727, "epoch": 0.010813022385878777, "grad_norm": 0.75390625, "learning_rate": 9.2e-05, "loss": 7.9324, "mean_token_accuracy": 0.06511378176510334, "num_tokens": 394767.0, "step": 185 }, { "entropy": 8.666393280029297, "epoch": 0.011105266234145771, "grad_norm": 0.94140625, "learning_rate": 9.45e-05, "loss": 7.9172, "mean_token_accuracy": 0.07024285569787025, "num_tokens": 405807.0, "step": 190 }, { "entropy": 8.585619068145752, "epoch": 0.011397510082412765, "grad_norm": 0.68359375, "learning_rate": 9.7e-05, "loss": 7.869, "mean_token_accuracy": 0.0643521461635828, "num_tokens": 416381.0, "step": 195 }, { "entropy": 8.565132427215577, "epoch": 0.01168975393067976, "grad_norm": 0.75390625, "learning_rate": 9.95e-05, "loss": 7.9632, "mean_token_accuracy": 0.06446416340768338, "num_tokens": 427262.0, "step": 200 }, { "entropy": 8.418638515472413, "epoch": 0.011981997778946754, "grad_norm": 0.78515625, "learning_rate": 0.000102, "loss": 7.8962, "mean_token_accuracy": 0.06822493113577366, "num_tokens": 438504.0, "step": 205 }, { "entropy": 8.47780933380127, "epoch": 0.012274241627213748, "grad_norm": 0.765625, "learning_rate": 0.00010449999999999999, "loss": 7.8873, "mean_token_accuracy": 0.06689661256968975, "num_tokens": 449923.0, "step": 210 }, { "entropy": 8.430081558227538, "epoch": 0.01256648547548074, "grad_norm": 0.80078125, "learning_rate": 0.000107, "loss": 7.8463, "mean_token_accuracy": 0.0716497365385294, "num_tokens": 460736.0, "step": 215 }, { "entropy": 8.367777156829835, "epoch": 0.012858729323747735, "grad_norm": 0.80078125, "learning_rate": 0.0001095, "loss": 7.9365, "mean_token_accuracy": 0.0605232123285532, "num_tokens": 471513.0, "step": 220 }, { "entropy": 8.417449378967286, "epoch": 0.013150973172014729, "grad_norm": 0.73828125, "learning_rate": 0.000112, "loss": 7.7879, "mean_token_accuracy": 0.07277968265116215, "num_tokens": 482115.0, "step": 225 }, { "entropy": 8.359326553344726, "epoch": 0.013443217020281723, "grad_norm": 0.7890625, "learning_rate": 0.0001145, "loss": 7.8079, "mean_token_accuracy": 0.07002997919917106, "num_tokens": 493273.0, "step": 230 }, { "entropy": 8.321810531616212, "epoch": 0.013735460868548717, "grad_norm": 0.7578125, "learning_rate": 0.00011700000000000001, "loss": 7.8188, "mean_token_accuracy": 0.07201721332967281, "num_tokens": 503939.0, "step": 235 }, { "entropy": 8.311158466339112, "epoch": 0.014027704716815711, "grad_norm": 0.81640625, "learning_rate": 0.00011949999999999999, "loss": 7.7369, "mean_token_accuracy": 0.06772977598011494, "num_tokens": 515215.0, "step": 240 }, { "entropy": 8.281570434570312, "epoch": 0.014319948565082705, "grad_norm": 0.77734375, "learning_rate": 0.000122, "loss": 7.8223, "mean_token_accuracy": 0.07254013754427432, "num_tokens": 526485.0, "step": 245 }, { "entropy": 8.277181148529053, "epoch": 0.0146121924133497, "grad_norm": 0.77734375, "learning_rate": 0.0001245, "loss": 7.7672, "mean_token_accuracy": 0.06958542391657829, "num_tokens": 536735.0, "step": 250 }, { "entropy": 8.277847576141358, "epoch": 0.014904436261616694, "grad_norm": 0.82421875, "learning_rate": 0.000127, "loss": 7.8541, "mean_token_accuracy": 0.06499786637723445, "num_tokens": 547326.0, "step": 255 }, { "entropy": 8.180327033996582, "epoch": 0.015196680109883686, "grad_norm": 0.9375, "learning_rate": 0.0001295, "loss": 7.7502, "mean_token_accuracy": 0.06869623251259327, "num_tokens": 558275.0, "step": 260 }, { "entropy": 8.257558250427246, "epoch": 0.01548892395815068, "grad_norm": 0.74609375, "learning_rate": 0.000132, "loss": 7.7096, "mean_token_accuracy": 0.07516702339053154, "num_tokens": 569711.0, "step": 265 }, { "entropy": 8.150344276428223, "epoch": 0.015781167806417674, "grad_norm": 0.7421875, "learning_rate": 0.00013450000000000002, "loss": 7.6881, "mean_token_accuracy": 0.07785917520523071, "num_tokens": 579602.0, "step": 270 }, { "entropy": 8.24105463027954, "epoch": 0.01607341165468467, "grad_norm": 0.75, "learning_rate": 0.00013700000000000002, "loss": 7.7286, "mean_token_accuracy": 0.07401030212640762, "num_tokens": 590899.0, "step": 275 }, { "entropy": 8.173699569702148, "epoch": 0.016365655502951663, "grad_norm": 0.87890625, "learning_rate": 0.0001395, "loss": 7.726, "mean_token_accuracy": 0.06962668001651764, "num_tokens": 602080.0, "step": 280 }, { "entropy": 8.16687994003296, "epoch": 0.016657899351218655, "grad_norm": 0.765625, "learning_rate": 0.00014199999999999998, "loss": 7.7605, "mean_token_accuracy": 0.07070777006447315, "num_tokens": 613692.0, "step": 285 }, { "entropy": 8.145956993103027, "epoch": 0.01695014319948565, "grad_norm": 0.88671875, "learning_rate": 0.0001445, "loss": 7.7305, "mean_token_accuracy": 0.07069781571626663, "num_tokens": 625019.0, "step": 290 }, { "entropy": 8.123618793487548, "epoch": 0.017242387047752643, "grad_norm": 0.80078125, "learning_rate": 0.000147, "loss": 7.6456, "mean_token_accuracy": 0.07288045659661294, "num_tokens": 636453.0, "step": 295 }, { "entropy": 8.108728456497193, "epoch": 0.01753463089601964, "grad_norm": 0.89453125, "learning_rate": 0.0001495, "loss": 7.6918, "mean_token_accuracy": 0.07240097671747207, "num_tokens": 647272.0, "step": 300 }, { "entropy": 8.040448427200317, "epoch": 0.017826874744286632, "grad_norm": 1.0859375, "learning_rate": 0.000152, "loss": 7.701, "mean_token_accuracy": 0.07080473527312278, "num_tokens": 657724.0, "step": 305 }, { "entropy": 8.166200351715087, "epoch": 0.018119118592553628, "grad_norm": 0.78125, "learning_rate": 0.00015450000000000001, "loss": 7.7053, "mean_token_accuracy": 0.07137923240661621, "num_tokens": 669183.0, "step": 310 }, { "entropy": 8.084780406951904, "epoch": 0.01841136244082062, "grad_norm": 1.0703125, "learning_rate": 0.000157, "loss": 7.6679, "mean_token_accuracy": 0.06901021562516689, "num_tokens": 680439.0, "step": 315 }, { "entropy": 8.157064056396484, "epoch": 0.018703606289087616, "grad_norm": 0.9765625, "learning_rate": 0.0001595, "loss": 7.712, "mean_token_accuracy": 0.0706634670495987, "num_tokens": 690789.0, "step": 320 }, { "entropy": 8.046548128128052, "epoch": 0.01899585013735461, "grad_norm": 0.8671875, "learning_rate": 0.000162, "loss": 7.6831, "mean_token_accuracy": 0.07187991701066494, "num_tokens": 701818.0, "step": 325 }, { "entropy": 8.062455224990845, "epoch": 0.019288093985621604, "grad_norm": 0.71484375, "learning_rate": 0.00016450000000000001, "loss": 7.6316, "mean_token_accuracy": 0.07437365353107453, "num_tokens": 713344.0, "step": 330 }, { "entropy": 8.084509325027465, "epoch": 0.019580337833888597, "grad_norm": 1.0390625, "learning_rate": 0.00016700000000000002, "loss": 7.6384, "mean_token_accuracy": 0.07300028279423713, "num_tokens": 723279.0, "step": 335 }, { "entropy": 8.018547964096069, "epoch": 0.01987258168215559, "grad_norm": 0.73046875, "learning_rate": 0.00016950000000000003, "loss": 7.625, "mean_token_accuracy": 0.07260205298662185, "num_tokens": 733875.0, "step": 340 }, { "entropy": 8.072830390930175, "epoch": 0.020164825530422585, "grad_norm": 0.94140625, "learning_rate": 0.00017199999999999998, "loss": 7.6669, "mean_token_accuracy": 0.0713542215526104, "num_tokens": 745449.0, "step": 345 }, { "entropy": 8.05644793510437, "epoch": 0.020457069378689578, "grad_norm": 0.7734375, "learning_rate": 0.00017449999999999999, "loss": 7.6741, "mean_token_accuracy": 0.0740118071436882, "num_tokens": 757570.0, "step": 350 }, { "entropy": 8.017089939117431, "epoch": 0.020749313226956573, "grad_norm": 0.8671875, "learning_rate": 0.000177, "loss": 7.5737, "mean_token_accuracy": 0.08025477081537247, "num_tokens": 767601.0, "step": 355 }, { "entropy": 8.00361680984497, "epoch": 0.021041557075223566, "grad_norm": 0.95703125, "learning_rate": 0.0001795, "loss": 7.6323, "mean_token_accuracy": 0.0752041395753622, "num_tokens": 777852.0, "step": 360 }, { "entropy": 8.018228721618652, "epoch": 0.021333800923490562, "grad_norm": 0.890625, "learning_rate": 0.000182, "loss": 7.5859, "mean_token_accuracy": 0.0751498755067587, "num_tokens": 788339.0, "step": 365 }, { "entropy": 7.970228672027588, "epoch": 0.021626044771757554, "grad_norm": 0.984375, "learning_rate": 0.0001845, "loss": 7.6588, "mean_token_accuracy": 0.07353257052600384, "num_tokens": 799791.0, "step": 370 }, { "entropy": 8.015653133392334, "epoch": 0.02191828862002455, "grad_norm": 0.96875, "learning_rate": 0.000187, "loss": 7.5746, "mean_token_accuracy": 0.07374845892190933, "num_tokens": 810141.0, "step": 375 }, { "entropy": 8.040093088150025, "epoch": 0.022210532468291543, "grad_norm": 0.8046875, "learning_rate": 0.0001895, "loss": 7.6182, "mean_token_accuracy": 0.07429262697696686, "num_tokens": 820929.0, "step": 380 }, { "entropy": 7.9526266098022464, "epoch": 0.022502776316558535, "grad_norm": 1.265625, "learning_rate": 0.000192, "loss": 7.5519, "mean_token_accuracy": 0.07891798727214336, "num_tokens": 831340.0, "step": 385 }, { "entropy": 7.935062026977539, "epoch": 0.02279502016482553, "grad_norm": 0.8984375, "learning_rate": 0.0001945, "loss": 7.5636, "mean_token_accuracy": 0.0735638827085495, "num_tokens": 841846.0, "step": 390 }, { "entropy": 8.029356002807617, "epoch": 0.023087264013092523, "grad_norm": 0.90234375, "learning_rate": 0.00019700000000000002, "loss": 7.5434, "mean_token_accuracy": 0.07343484573066235, "num_tokens": 852089.0, "step": 395 }, { "entropy": 7.838059997558593, "epoch": 0.02337950786135952, "grad_norm": 0.97265625, "learning_rate": 0.00019950000000000002, "loss": 7.5241, "mean_token_accuracy": 0.07688843682408333, "num_tokens": 862568.0, "step": 400 }, { "entropy": 8.034818124771117, "epoch": 0.02367175170962651, "grad_norm": 0.8046875, "learning_rate": 0.000202, "loss": 7.5905, "mean_token_accuracy": 0.07528307065367698, "num_tokens": 874676.0, "step": 405 }, { "entropy": 7.867450904846192, "epoch": 0.023963995557893508, "grad_norm": 0.8515625, "learning_rate": 0.00020449999999999998, "loss": 7.5115, "mean_token_accuracy": 0.08100188933312893, "num_tokens": 886338.0, "step": 410 }, { "entropy": 7.946144676208496, "epoch": 0.0242562394061605, "grad_norm": 0.8671875, "learning_rate": 0.000207, "loss": 7.5287, "mean_token_accuracy": 0.07384060397744178, "num_tokens": 896671.0, "step": 415 }, { "entropy": 7.923208522796631, "epoch": 0.024548483254427496, "grad_norm": 0.90625, "learning_rate": 0.0002095, "loss": 7.5025, "mean_token_accuracy": 0.07231347896158695, "num_tokens": 908265.0, "step": 420 }, { "entropy": 7.851961994171143, "epoch": 0.02484072710269449, "grad_norm": 0.8828125, "learning_rate": 0.000212, "loss": 7.4692, "mean_token_accuracy": 0.07885380312800408, "num_tokens": 919024.0, "step": 425 }, { "entropy": 7.894201850891113, "epoch": 0.02513297095096148, "grad_norm": 0.9296875, "learning_rate": 0.0002145, "loss": 7.4639, "mean_token_accuracy": 0.08095669150352477, "num_tokens": 930837.0, "step": 430 }, { "entropy": 7.845162343978882, "epoch": 0.025425214799228477, "grad_norm": 1.0390625, "learning_rate": 0.00021700000000000002, "loss": 7.4312, "mean_token_accuracy": 0.076503673940897, "num_tokens": 941374.0, "step": 435 }, { "entropy": 7.838292598724365, "epoch": 0.02571745864749547, "grad_norm": 0.859375, "learning_rate": 0.0002195, "loss": 7.3796, "mean_token_accuracy": 0.0836145281791687, "num_tokens": 953273.0, "step": 440 }, { "entropy": 7.836203670501709, "epoch": 0.026009702495762465, "grad_norm": 1.6015625, "learning_rate": 0.000222, "loss": 7.3659, "mean_token_accuracy": 0.09230264946818352, "num_tokens": 964882.0, "step": 445 }, { "entropy": 7.860473203659057, "epoch": 0.026301946344029457, "grad_norm": 1.203125, "learning_rate": 0.0002245, "loss": 7.5208, "mean_token_accuracy": 0.08153782263398171, "num_tokens": 974732.0, "step": 450 }, { "entropy": 7.774071216583252, "epoch": 0.026594190192296453, "grad_norm": 0.94140625, "learning_rate": 0.00022700000000000002, "loss": 7.4513, "mean_token_accuracy": 0.07568450495600701, "num_tokens": 985709.0, "step": 455 }, { "entropy": 7.999471426010132, "epoch": 0.026886434040563446, "grad_norm": 0.8046875, "learning_rate": 0.00022950000000000002, "loss": 7.4197, "mean_token_accuracy": 0.07974797300994396, "num_tokens": 998177.0, "step": 460 }, { "entropy": 7.711365842819214, "epoch": 0.02717867788883044, "grad_norm": 0.8671875, "learning_rate": 0.00023200000000000003, "loss": 7.3536, "mean_token_accuracy": 0.08135458827018738, "num_tokens": 1008676.0, "step": 465 }, { "entropy": 7.800386238098144, "epoch": 0.027470921737097434, "grad_norm": 0.875, "learning_rate": 0.00023449999999999998, "loss": 7.4651, "mean_token_accuracy": 0.07976322658360005, "num_tokens": 1019951.0, "step": 470 }, { "entropy": 7.785122346878052, "epoch": 0.027763165585364426, "grad_norm": 0.9453125, "learning_rate": 0.000237, "loss": 7.3981, "mean_token_accuracy": 0.0761278249323368, "num_tokens": 1030219.0, "step": 475 }, { "entropy": 7.781033182144165, "epoch": 0.028055409433631422, "grad_norm": 0.9296875, "learning_rate": 0.0002395, "loss": 7.4141, "mean_token_accuracy": 0.07795999571681023, "num_tokens": 1041911.0, "step": 480 }, { "entropy": 7.891617631912231, "epoch": 0.028347653281898415, "grad_norm": 0.94140625, "learning_rate": 0.000242, "loss": 7.4312, "mean_token_accuracy": 0.08173990175127983, "num_tokens": 1052638.0, "step": 485 }, { "entropy": 7.774001789093018, "epoch": 0.02863989713016541, "grad_norm": 0.94140625, "learning_rate": 0.0002445, "loss": 7.3755, "mean_token_accuracy": 0.08225451484322548, "num_tokens": 1063465.0, "step": 490 }, { "entropy": 7.861321496963501, "epoch": 0.028932140978432403, "grad_norm": 1.1796875, "learning_rate": 0.000247, "loss": 7.3888, "mean_token_accuracy": 0.08350497037172318, "num_tokens": 1073583.0, "step": 495 }, { "entropy": 7.868850564956665, "epoch": 0.0292243848266994, "grad_norm": 1.3515625, "learning_rate": 0.0002495, "loss": 7.4377, "mean_token_accuracy": 0.08040728494524955, "num_tokens": 1083961.0, "step": 500 }, { "entropy": 7.663293409347534, "epoch": 0.02951662867496639, "grad_norm": 0.80859375, "learning_rate": 0.000252, "loss": 7.3053, "mean_token_accuracy": 0.08032148070633412, "num_tokens": 1095339.0, "step": 505 }, { "entropy": 7.742640733718872, "epoch": 0.029808872523233387, "grad_norm": 0.90625, "learning_rate": 0.0002545, "loss": 7.3746, "mean_token_accuracy": 0.07911042794585228, "num_tokens": 1105518.0, "step": 510 }, { "entropy": 7.822371339797973, "epoch": 0.03010111637150038, "grad_norm": 0.8515625, "learning_rate": 0.000257, "loss": 7.2683, "mean_token_accuracy": 0.08846351876854897, "num_tokens": 1115666.0, "step": 515 }, { "entropy": 7.7058703899383545, "epoch": 0.030393360219767372, "grad_norm": 1.171875, "learning_rate": 0.0002595, "loss": 7.3901, "mean_token_accuracy": 0.08510988727211952, "num_tokens": 1125827.0, "step": 520 }, { "entropy": 7.762892246246338, "epoch": 0.030685604068034368, "grad_norm": 0.93359375, "learning_rate": 0.000262, "loss": 7.3453, "mean_token_accuracy": 0.08135025277733803, "num_tokens": 1136154.0, "step": 525 }, { "entropy": 7.712664318084717, "epoch": 0.03097784791630136, "grad_norm": 1.09375, "learning_rate": 0.00026450000000000003, "loss": 7.3361, "mean_token_accuracy": 0.08622926697134972, "num_tokens": 1146392.0, "step": 530 }, { "entropy": 7.7614504337310795, "epoch": 0.03127009176456835, "grad_norm": 1.0625, "learning_rate": 0.00026700000000000004, "loss": 7.3515, "mean_token_accuracy": 0.08140693604946136, "num_tokens": 1157566.0, "step": 535 }, { "entropy": 7.6518913269042965, "epoch": 0.03156233561283535, "grad_norm": 0.94921875, "learning_rate": 0.00026950000000000005, "loss": 7.3194, "mean_token_accuracy": 0.0838658906519413, "num_tokens": 1167795.0, "step": 540 }, { "entropy": 7.775746774673462, "epoch": 0.031854579461102345, "grad_norm": 1.5625, "learning_rate": 0.00027200000000000005, "loss": 7.2691, "mean_token_accuracy": 0.09419989511370659, "num_tokens": 1178894.0, "step": 545 }, { "entropy": 7.634786605834961, "epoch": 0.03214682330936934, "grad_norm": 0.96484375, "learning_rate": 0.0002745, "loss": 7.2696, "mean_token_accuracy": 0.08667804896831513, "num_tokens": 1189361.0, "step": 550 }, { "entropy": 7.752673006057739, "epoch": 0.03243906715763633, "grad_norm": 1.109375, "learning_rate": 0.000277, "loss": 7.3135, "mean_token_accuracy": 0.08304268047213555, "num_tokens": 1198992.0, "step": 555 }, { "entropy": 7.692470407485962, "epoch": 0.032731311005903325, "grad_norm": 1.0546875, "learning_rate": 0.0002795, "loss": 7.294, "mean_token_accuracy": 0.07943044230341911, "num_tokens": 1208732.0, "step": 560 }, { "entropy": 7.655223751068116, "epoch": 0.03302355485417032, "grad_norm": 1.078125, "learning_rate": 0.00028199999999999997, "loss": 7.2954, "mean_token_accuracy": 0.08259731158614159, "num_tokens": 1219015.0, "step": 565 }, { "entropy": 7.612499952316284, "epoch": 0.03331579870243731, "grad_norm": 1.046875, "learning_rate": 0.0002845, "loss": 7.1795, "mean_token_accuracy": 0.1000419594347477, "num_tokens": 1229227.0, "step": 570 }, { "entropy": 7.750643157958985, "epoch": 0.033608042550704306, "grad_norm": 1.0234375, "learning_rate": 0.000287, "loss": 7.3098, "mean_token_accuracy": 0.08021004945039749, "num_tokens": 1239654.0, "step": 575 }, { "entropy": 7.618366050720215, "epoch": 0.0339002863989713, "grad_norm": 0.87890625, "learning_rate": 0.0002895, "loss": 7.3005, "mean_token_accuracy": 0.08035954535007477, "num_tokens": 1250955.0, "step": 580 }, { "entropy": 7.729614543914795, "epoch": 0.0341925302472383, "grad_norm": 1.0234375, "learning_rate": 0.000292, "loss": 7.2497, "mean_token_accuracy": 0.08898582234978676, "num_tokens": 1262574.0, "step": 585 }, { "entropy": 7.672766494750976, "epoch": 0.03448477409550529, "grad_norm": 0.9140625, "learning_rate": 0.0002945, "loss": 7.2059, "mean_token_accuracy": 0.08972268775105477, "num_tokens": 1273272.0, "step": 590 }, { "entropy": 7.505560779571534, "epoch": 0.03477701794377228, "grad_norm": 0.91796875, "learning_rate": 0.000297, "loss": 7.1898, "mean_token_accuracy": 0.09178911671042442, "num_tokens": 1284001.0, "step": 595 }, { "entropy": 7.633696794509888, "epoch": 0.03506926179203928, "grad_norm": 1.0546875, "learning_rate": 0.0002995, "loss": 7.2354, "mean_token_accuracy": 0.08889753520488738, "num_tokens": 1294671.0, "step": 600 }, { "entropy": 7.695655345916748, "epoch": 0.035361505640306275, "grad_norm": 1.0390625, "learning_rate": 0.000302, "loss": 7.2349, "mean_token_accuracy": 0.09624799937009812, "num_tokens": 1305397.0, "step": 605 }, { "entropy": 7.568394422531128, "epoch": 0.035653749488573264, "grad_norm": 1.2890625, "learning_rate": 0.0003045, "loss": 7.2377, "mean_token_accuracy": 0.08420243933796882, "num_tokens": 1317449.0, "step": 610 }, { "entropy": 7.562969303131103, "epoch": 0.03594599333684026, "grad_norm": 1.1484375, "learning_rate": 0.000307, "loss": 7.176, "mean_token_accuracy": 0.08269712552428246, "num_tokens": 1328645.0, "step": 615 }, { "entropy": 7.559274625778198, "epoch": 0.036238237185107255, "grad_norm": 0.9609375, "learning_rate": 0.0003095, "loss": 7.1652, "mean_token_accuracy": 0.09311013892292977, "num_tokens": 1339815.0, "step": 620 }, { "entropy": 7.583710241317749, "epoch": 0.036530481033374244, "grad_norm": 1.03125, "learning_rate": 0.000312, "loss": 7.1795, "mean_token_accuracy": 0.08754727616906166, "num_tokens": 1350301.0, "step": 625 }, { "entropy": 7.535983610153198, "epoch": 0.03682272488164124, "grad_norm": 1.0078125, "learning_rate": 0.0003145, "loss": 7.1724, "mean_token_accuracy": 0.08950133547186852, "num_tokens": 1360928.0, "step": 630 }, { "entropy": 7.625943231582641, "epoch": 0.037114968729908236, "grad_norm": 1.2109375, "learning_rate": 0.000317, "loss": 7.1957, "mean_token_accuracy": 0.08902273774147033, "num_tokens": 1371618.0, "step": 635 }, { "entropy": 7.511281824111938, "epoch": 0.03740721257817523, "grad_norm": 0.95703125, "learning_rate": 0.0003195, "loss": 7.1562, "mean_token_accuracy": 0.08582355380058289, "num_tokens": 1382824.0, "step": 640 }, { "entropy": 7.470151281356811, "epoch": 0.03769945642644222, "grad_norm": 0.953125, "learning_rate": 0.000322, "loss": 7.1191, "mean_token_accuracy": 0.09281812384724616, "num_tokens": 1393244.0, "step": 645 }, { "entropy": 7.475745964050293, "epoch": 0.03799170027470922, "grad_norm": 1.046875, "learning_rate": 0.00032450000000000003, "loss": 7.0909, "mean_token_accuracy": 0.09678038656711578, "num_tokens": 1403469.0, "step": 650 }, { "entropy": 7.615570402145385, "epoch": 0.03828394412297621, "grad_norm": 0.87890625, "learning_rate": 0.00032700000000000003, "loss": 7.1651, "mean_token_accuracy": 0.09157615751028061, "num_tokens": 1413860.0, "step": 655 }, { "entropy": 7.553770732879639, "epoch": 0.03857618797124321, "grad_norm": 1.0390625, "learning_rate": 0.00032950000000000004, "loss": 7.2248, "mean_token_accuracy": 0.08392854556441307, "num_tokens": 1423985.0, "step": 660 }, { "entropy": 7.531700229644775, "epoch": 0.0388684318195102, "grad_norm": 1.078125, "learning_rate": 0.00033200000000000005, "loss": 7.1654, "mean_token_accuracy": 0.09291392266750335, "num_tokens": 1434838.0, "step": 665 }, { "entropy": 7.482819223403931, "epoch": 0.039160675667777194, "grad_norm": 1.1015625, "learning_rate": 0.00033450000000000005, "loss": 7.0905, "mean_token_accuracy": 0.09290852397680283, "num_tokens": 1446429.0, "step": 670 }, { "entropy": 7.611834764480591, "epoch": 0.03945291951604419, "grad_norm": 1.046875, "learning_rate": 0.000337, "loss": 7.1879, "mean_token_accuracy": 0.08893333822488785, "num_tokens": 1456726.0, "step": 675 }, { "entropy": 7.5248387336730955, "epoch": 0.03974516336431118, "grad_norm": 1.109375, "learning_rate": 0.0003395, "loss": 7.0781, "mean_token_accuracy": 0.09758968204259873, "num_tokens": 1466378.0, "step": 680 }, { "entropy": 7.323547267913819, "epoch": 0.040037407212578174, "grad_norm": 1.28125, "learning_rate": 0.000342, "loss": 7.0345, "mean_token_accuracy": 0.09719507321715355, "num_tokens": 1477755.0, "step": 685 }, { "entropy": 7.507241344451904, "epoch": 0.04032965106084517, "grad_norm": 1.0625, "learning_rate": 0.00034449999999999997, "loss": 7.1006, "mean_token_accuracy": 0.09118306115269662, "num_tokens": 1488209.0, "step": 690 }, { "entropy": 7.419371461868286, "epoch": 0.040621894909112166, "grad_norm": 1.078125, "learning_rate": 0.000347, "loss": 7.1465, "mean_token_accuracy": 0.08755657598376274, "num_tokens": 1498658.0, "step": 695 }, { "entropy": 7.546753549575806, "epoch": 0.040914138757379155, "grad_norm": 1.09375, "learning_rate": 0.0003495, "loss": 7.1576, "mean_token_accuracy": 0.08506937101483344, "num_tokens": 1509766.0, "step": 700 }, { "entropy": 7.439605093002319, "epoch": 0.04120638260564615, "grad_norm": 1.40625, "learning_rate": 0.000352, "loss": 7.036, "mean_token_accuracy": 0.0939096562564373, "num_tokens": 1521139.0, "step": 705 }, { "entropy": 7.4743701934814455, "epoch": 0.04149862645391315, "grad_norm": 1.1171875, "learning_rate": 0.0003545, "loss": 7.1115, "mean_token_accuracy": 0.08748833164572715, "num_tokens": 1531875.0, "step": 710 }, { "entropy": 7.395281553268433, "epoch": 0.041790870302180136, "grad_norm": 1.1328125, "learning_rate": 0.000357, "loss": 7.0801, "mean_token_accuracy": 0.08955910429358482, "num_tokens": 1542678.0, "step": 715 }, { "entropy": 7.462686967849732, "epoch": 0.04208311415044713, "grad_norm": 1.1171875, "learning_rate": 0.0003595, "loss": 7.0268, "mean_token_accuracy": 0.09358467385172844, "num_tokens": 1553882.0, "step": 720 }, { "entropy": 7.43300313949585, "epoch": 0.04237535799871413, "grad_norm": 0.9375, "learning_rate": 0.000362, "loss": 7.1176, "mean_token_accuracy": 0.08562448695302009, "num_tokens": 1564854.0, "step": 725 }, { "entropy": 7.425636720657349, "epoch": 0.042667601846981124, "grad_norm": 0.92578125, "learning_rate": 0.0003645, "loss": 7.0026, "mean_token_accuracy": 0.09751182347536087, "num_tokens": 1576112.0, "step": 730 }, { "entropy": 7.374439096450805, "epoch": 0.04295984569524811, "grad_norm": 1.0390625, "learning_rate": 0.000367, "loss": 7.0378, "mean_token_accuracy": 0.09424405097961426, "num_tokens": 1586235.0, "step": 735 }, { "entropy": 7.347483777999878, "epoch": 0.04325208954351511, "grad_norm": 1.859375, "learning_rate": 0.0003695, "loss": 7.0347, "mean_token_accuracy": 0.0911446213722229, "num_tokens": 1596727.0, "step": 740 }, { "entropy": 7.407256555557251, "epoch": 0.043544333391782104, "grad_norm": 1.0234375, "learning_rate": 0.000372, "loss": 6.9573, "mean_token_accuracy": 0.09358611106872558, "num_tokens": 1607008.0, "step": 745 }, { "entropy": 7.389186716079712, "epoch": 0.0438365772400491, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 7.0579, "mean_token_accuracy": 0.0928824670612812, "num_tokens": 1618081.0, "step": 750 }, { "entropy": 7.385285234451294, "epoch": 0.04412882108831609, "grad_norm": 1.0078125, "learning_rate": 0.000377, "loss": 7.0165, "mean_token_accuracy": 0.08930294588208199, "num_tokens": 1629095.0, "step": 755 }, { "entropy": 7.394097995758057, "epoch": 0.044421064936583085, "grad_norm": 0.9609375, "learning_rate": 0.0003795, "loss": 7.0118, "mean_token_accuracy": 0.093733761459589, "num_tokens": 1639861.0, "step": 760 }, { "entropy": 7.372588682174682, "epoch": 0.04471330878485008, "grad_norm": 1.0859375, "learning_rate": 0.000382, "loss": 7.0534, "mean_token_accuracy": 0.09636619538068772, "num_tokens": 1649169.0, "step": 765 }, { "entropy": 7.278450775146484, "epoch": 0.04500555263311707, "grad_norm": 0.94921875, "learning_rate": 0.0003845, "loss": 6.9357, "mean_token_accuracy": 0.1010350152850151, "num_tokens": 1658528.0, "step": 770 }, { "entropy": 7.303726387023926, "epoch": 0.045297796481384066, "grad_norm": 1.0625, "learning_rate": 0.00038700000000000003, "loss": 7.0068, "mean_token_accuracy": 0.09450188651680946, "num_tokens": 1669231.0, "step": 775 }, { "entropy": 7.309107494354248, "epoch": 0.04559004032965106, "grad_norm": 1.0078125, "learning_rate": 0.00038950000000000003, "loss": 6.9475, "mean_token_accuracy": 0.09322728961706161, "num_tokens": 1680503.0, "step": 780 }, { "entropy": 7.336097192764282, "epoch": 0.04588228417791806, "grad_norm": 0.91796875, "learning_rate": 0.00039200000000000004, "loss": 6.9766, "mean_token_accuracy": 0.09063231274485588, "num_tokens": 1690827.0, "step": 785 }, { "entropy": 7.370522546768188, "epoch": 0.04617452802618505, "grad_norm": 1.03125, "learning_rate": 0.00039450000000000005, "loss": 7.0418, "mean_token_accuracy": 0.09461386948823929, "num_tokens": 1702931.0, "step": 790 }, { "entropy": 7.289389944076538, "epoch": 0.04646677187445204, "grad_norm": 1.0, "learning_rate": 0.00039700000000000005, "loss": 6.9307, "mean_token_accuracy": 0.09922353029251099, "num_tokens": 1712834.0, "step": 795 }, { "entropy": 7.3177947998046875, "epoch": 0.04675901572271904, "grad_norm": 1.0390625, "learning_rate": 0.0003995, "loss": 7.0006, "mean_token_accuracy": 0.0919931598007679, "num_tokens": 1723289.0, "step": 800 }, { "entropy": 7.245712804794311, "epoch": 0.04705125957098603, "grad_norm": 1.1875, "learning_rate": 0.000402, "loss": 6.9702, "mean_token_accuracy": 0.09567693397402763, "num_tokens": 1734477.0, "step": 805 }, { "entropy": 7.306273651123047, "epoch": 0.04734350341925302, "grad_norm": 0.96875, "learning_rate": 0.0004045, "loss": 6.9762, "mean_token_accuracy": 0.09110540002584458, "num_tokens": 1745187.0, "step": 810 }, { "entropy": 7.276857900619507, "epoch": 0.04763574726752002, "grad_norm": 1.1328125, "learning_rate": 0.00040699999999999997, "loss": 6.9011, "mean_token_accuracy": 0.10115249156951904, "num_tokens": 1756687.0, "step": 815 }, { "entropy": 7.304260778427124, "epoch": 0.047927991115787015, "grad_norm": 0.9765625, "learning_rate": 0.0004095, "loss": 7.024, "mean_token_accuracy": 0.09978155121207237, "num_tokens": 1767928.0, "step": 820 }, { "entropy": 7.309319734573364, "epoch": 0.048220234964054004, "grad_norm": 1.046875, "learning_rate": 0.000412, "loss": 6.9585, "mean_token_accuracy": 0.09580064937472343, "num_tokens": 1777951.0, "step": 825 }, { "entropy": 7.194837522506714, "epoch": 0.048512478812321, "grad_norm": 1.015625, "learning_rate": 0.0004145, "loss": 6.9514, "mean_token_accuracy": 0.09750414118170739, "num_tokens": 1788598.0, "step": 830 }, { "entropy": 7.25841178894043, "epoch": 0.048804722660587996, "grad_norm": 1.078125, "learning_rate": 0.000417, "loss": 6.9107, "mean_token_accuracy": 0.10313281938433647, "num_tokens": 1799446.0, "step": 835 }, { "entropy": 7.308444929122925, "epoch": 0.04909696650885499, "grad_norm": 0.94140625, "learning_rate": 0.0004195, "loss": 6.93, "mean_token_accuracy": 0.09639307036995888, "num_tokens": 1809687.0, "step": 840 }, { "entropy": 7.247332191467285, "epoch": 0.04938921035712198, "grad_norm": 1.1953125, "learning_rate": 0.000422, "loss": 6.9496, "mean_token_accuracy": 0.10043755695223808, "num_tokens": 1820535.0, "step": 845 }, { "entropy": 7.192328262329101, "epoch": 0.04968145420538898, "grad_norm": 1.3984375, "learning_rate": 0.0004245, "loss": 6.8901, "mean_token_accuracy": 0.09903936088085175, "num_tokens": 1830834.0, "step": 850 }, { "entropy": 7.244427633285523, "epoch": 0.04997369805365597, "grad_norm": 0.953125, "learning_rate": 0.000427, "loss": 6.8568, "mean_token_accuracy": 0.10095973312854767, "num_tokens": 1842615.0, "step": 855 }, { "entropy": 7.1798933982849125, "epoch": 0.05026594190192296, "grad_norm": 0.99609375, "learning_rate": 0.0004295, "loss": 6.8778, "mean_token_accuracy": 0.10051687061786652, "num_tokens": 1852844.0, "step": 860 }, { "entropy": 7.210625696182251, "epoch": 0.05055818575018996, "grad_norm": 0.984375, "learning_rate": 0.000432, "loss": 6.9139, "mean_token_accuracy": 0.09776052087545395, "num_tokens": 1862528.0, "step": 865 }, { "entropy": 7.177963972091675, "epoch": 0.05085042959845695, "grad_norm": 0.9375, "learning_rate": 0.0004345, "loss": 6.8757, "mean_token_accuracy": 0.1031526930630207, "num_tokens": 1873275.0, "step": 870 }, { "entropy": 7.275309658050537, "epoch": 0.05114267344672395, "grad_norm": 0.9921875, "learning_rate": 0.000437, "loss": 6.9153, "mean_token_accuracy": 0.10134659111499786, "num_tokens": 1884724.0, "step": 875 }, { "entropy": 7.248415899276734, "epoch": 0.05143491729499094, "grad_norm": 1.1171875, "learning_rate": 0.0004395, "loss": 6.8861, "mean_token_accuracy": 0.09837430268526078, "num_tokens": 1894705.0, "step": 880 }, { "entropy": 7.133459377288818, "epoch": 0.051727161143257934, "grad_norm": 0.953125, "learning_rate": 0.000442, "loss": 6.9485, "mean_token_accuracy": 0.09655695110559463, "num_tokens": 1906553.0, "step": 885 }, { "entropy": 7.257501792907715, "epoch": 0.05201940499152493, "grad_norm": 1.0, "learning_rate": 0.0004445, "loss": 6.8849, "mean_token_accuracy": 0.1023280717432499, "num_tokens": 1916628.0, "step": 890 }, { "entropy": 7.0709809303283695, "epoch": 0.052311648839791926, "grad_norm": 1.2421875, "learning_rate": 0.000447, "loss": 6.725, "mean_token_accuracy": 0.11589453369379044, "num_tokens": 1926686.0, "step": 895 }, { "entropy": 7.150864934921264, "epoch": 0.052603892688058915, "grad_norm": 2.25, "learning_rate": 0.00044950000000000003, "loss": 6.9068, "mean_token_accuracy": 0.101015555113554, "num_tokens": 1938150.0, "step": 900 }, { "entropy": 7.1812304019927975, "epoch": 0.05289613653632591, "grad_norm": 1.0078125, "learning_rate": 0.00045200000000000004, "loss": 6.8918, "mean_token_accuracy": 0.097091793268919, "num_tokens": 1948617.0, "step": 905 }, { "entropy": 7.160140323638916, "epoch": 0.053188380384592907, "grad_norm": 1.0234375, "learning_rate": 0.00045450000000000004, "loss": 6.8934, "mean_token_accuracy": 0.10218235999345779, "num_tokens": 1958943.0, "step": 910 }, { "entropy": 7.165960168838501, "epoch": 0.053480624232859895, "grad_norm": 0.9609375, "learning_rate": 0.00045700000000000005, "loss": 6.8192, "mean_token_accuracy": 0.10898060277104378, "num_tokens": 1968988.0, "step": 915 }, { "entropy": 7.051486253738403, "epoch": 0.05377286808112689, "grad_norm": 1.0546875, "learning_rate": 0.00045950000000000006, "loss": 6.7949, "mean_token_accuracy": 0.10556035414338112, "num_tokens": 1979490.0, "step": 920 }, { "entropy": 7.28261432647705, "epoch": 0.05406511192939389, "grad_norm": 1.0546875, "learning_rate": 0.000462, "loss": 6.8574, "mean_token_accuracy": 0.10469735637307168, "num_tokens": 1990377.0, "step": 925 }, { "entropy": 7.070431137084961, "epoch": 0.05435735577766088, "grad_norm": 1.0703125, "learning_rate": 0.0004645, "loss": 6.8361, "mean_token_accuracy": 0.10013288781046867, "num_tokens": 2001678.0, "step": 930 }, { "entropy": 7.103927278518677, "epoch": 0.05464959962592787, "grad_norm": 1.03125, "learning_rate": 0.000467, "loss": 6.8266, "mean_token_accuracy": 0.10559705421328544, "num_tokens": 2011550.0, "step": 935 }, { "entropy": 7.146097993850708, "epoch": 0.05494184347419487, "grad_norm": 1.0546875, "learning_rate": 0.0004695, "loss": 6.8591, "mean_token_accuracy": 0.10166500806808472, "num_tokens": 2021607.0, "step": 940 }, { "entropy": 7.074561977386475, "epoch": 0.055234087322461864, "grad_norm": 1.0546875, "learning_rate": 0.000472, "loss": 6.831, "mean_token_accuracy": 0.10222307071089745, "num_tokens": 2030975.0, "step": 945 }, { "entropy": 7.097246503829956, "epoch": 0.05552633117072885, "grad_norm": 1.0546875, "learning_rate": 0.0004745, "loss": 6.9034, "mean_token_accuracy": 0.09934694394469261, "num_tokens": 2041799.0, "step": 950 }, { "entropy": 7.116580200195313, "epoch": 0.05581857501899585, "grad_norm": 1.0703125, "learning_rate": 0.000477, "loss": 6.8168, "mean_token_accuracy": 0.10345752537250519, "num_tokens": 2052960.0, "step": 955 }, { "entropy": 7.11494288444519, "epoch": 0.056110818867262845, "grad_norm": 0.99609375, "learning_rate": 0.0004795, "loss": 6.8662, "mean_token_accuracy": 0.09989891946315765, "num_tokens": 2064156.0, "step": 960 }, { "entropy": 7.182250165939331, "epoch": 0.05640306271552984, "grad_norm": 0.984375, "learning_rate": 0.000482, "loss": 6.8254, "mean_token_accuracy": 0.10051817372441292, "num_tokens": 2074774.0, "step": 965 }, { "entropy": 7.077956199645996, "epoch": 0.05669530656379683, "grad_norm": 1.03125, "learning_rate": 0.0004845, "loss": 6.8527, "mean_token_accuracy": 0.10035398751497268, "num_tokens": 2086164.0, "step": 970 }, { "entropy": 6.885358047485352, "epoch": 0.056987550412063825, "grad_norm": 1.171875, "learning_rate": 0.000487, "loss": 6.672, "mean_token_accuracy": 0.127625822275877, "num_tokens": 2096268.0, "step": 975 }, { "entropy": 7.233099365234375, "epoch": 0.05727979426033082, "grad_norm": 1.0390625, "learning_rate": 0.0004895, "loss": 6.8813, "mean_token_accuracy": 0.09680663272738457, "num_tokens": 2108511.0, "step": 980 }, { "entropy": 7.136028242111206, "epoch": 0.05757203810859782, "grad_norm": 0.96484375, "learning_rate": 0.000492, "loss": 6.8085, "mean_token_accuracy": 0.0988966628909111, "num_tokens": 2119622.0, "step": 985 }, { "entropy": 6.998387289047241, "epoch": 0.057864281956864806, "grad_norm": 0.88671875, "learning_rate": 0.0004945, "loss": 6.8613, "mean_token_accuracy": 0.10771243944764138, "num_tokens": 2131021.0, "step": 990 }, { "entropy": 7.106973361968994, "epoch": 0.0581565258051318, "grad_norm": 1.0625, "learning_rate": 0.000497, "loss": 6.8496, "mean_token_accuracy": 0.10358692184090615, "num_tokens": 2141797.0, "step": 995 }, { "entropy": 7.108656787872315, "epoch": 0.0584487696533988, "grad_norm": 1.078125, "learning_rate": 0.0004995, "loss": 6.7338, "mean_token_accuracy": 0.10600685104727745, "num_tokens": 2153609.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 476358355353600.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }