{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.997333333333333, "eval_steps": 500, "global_step": 5620, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.3199639558792113, "epoch": 0.010666666666666666, "grad_norm": 13.384757041931152, "learning_rate": 5.7000000000000005e-06, "loss": 3.7517059326171873, "mean_token_accuracy": 0.5159296914935112, "num_tokens": 20385.0, "step": 20 }, { "entropy": 2.2831633567810057, "epoch": 0.021333333333333333, "grad_norm": 6.131666660308838, "learning_rate": 1.1700000000000001e-05, "loss": 2.7274402618408202, "mean_token_accuracy": 0.6040167711675167, "num_tokens": 41653.0, "step": 40 }, { "entropy": 1.6687136992812157, "epoch": 0.032, "grad_norm": 3.8555829524993896, "learning_rate": 1.77e-05, "loss": 1.590993309020996, "mean_token_accuracy": 0.7407817155122757, "num_tokens": 64225.0, "step": 60 }, { "entropy": 0.8817660577595234, "epoch": 0.042666666666666665, "grad_norm": 1.0237234830856323, "learning_rate": 2.37e-05, "loss": 0.7373588562011719, "mean_token_accuracy": 0.8729878857731819, "num_tokens": 86424.0, "step": 80 }, { "entropy": 0.33704922115430236, "epoch": 0.05333333333333334, "grad_norm": 1.290586233139038, "learning_rate": 2.97e-05, "loss": 0.2778470993041992, "mean_token_accuracy": 0.9500011757016182, "num_tokens": 109633.0, "step": 100 }, { "entropy": 0.18128704172559082, "epoch": 0.064, "grad_norm": 1.3026446104049683, "learning_rate": 2.999912461435259e-05, "loss": 0.15202982425689698, "mean_token_accuracy": 0.9685896590352059, "num_tokens": 131798.0, "step": 120 }, { "entropy": 0.11775432089343667, "epoch": 0.07466666666666667, "grad_norm": 0.6625315546989441, "learning_rate": 2.999631185607745e-05, "loss": 0.09883086681365967, "mean_token_accuracy": 0.9783779725432395, "num_tokens": 153213.0, "step": 140 }, { "entropy": 0.10737935788929462, "epoch": 0.08533333333333333, "grad_norm": 0.6038058996200562, "learning_rate": 2.9991559664026723e-05, "loss": 0.09105062484741211, "mean_token_accuracy": 0.9772884234786033, "num_tokens": 175096.0, "step": 160 }, { "entropy": 0.09613236370496452, "epoch": 0.096, "grad_norm": 0.48909515142440796, "learning_rate": 2.998486865278898e-05, "loss": 0.08481158018112182, "mean_token_accuracy": 0.9782793119549751, "num_tokens": 196997.0, "step": 180 }, { "entropy": 0.08185080708935857, "epoch": 0.10666666666666667, "grad_norm": 0.6273307800292969, "learning_rate": 2.9976239687695204e-05, "loss": 0.07777262926101684, "mean_token_accuracy": 0.9786890134215355, "num_tokens": 218874.0, "step": 200 }, { "entropy": 0.09334154520183802, "epoch": 0.11733333333333333, "grad_norm": 0.4166223406791687, "learning_rate": 2.9965673884706868e-05, "loss": 0.08573432564735413, "mean_token_accuracy": 0.9767304107546806, "num_tokens": 241605.0, "step": 220 }, { "entropy": 0.08369456762447954, "epoch": 0.128, "grad_norm": 0.40699025988578796, "learning_rate": 2.9953172610271622e-05, "loss": 0.07644501924514771, "mean_token_accuracy": 0.9783323392271995, "num_tokens": 263296.0, "step": 240 }, { "entropy": 0.070164034049958, "epoch": 0.13866666666666666, "grad_norm": 0.48113104701042175, "learning_rate": 2.9938737481146593e-05, "loss": 0.06861301660537719, "mean_token_accuracy": 0.9820019453763962, "num_tokens": 283202.0, "step": 260 }, { "entropy": 0.07659044032916426, "epoch": 0.14933333333333335, "grad_norm": 0.40626060962677, "learning_rate": 2.9922370364189247e-05, "loss": 0.07213873863220215, "mean_token_accuracy": 0.9799231603741646, "num_tokens": 303974.0, "step": 280 }, { "entropy": 0.07639030702412128, "epoch": 0.16, "grad_norm": 0.43795546889305115, "learning_rate": 2.990407337611601e-05, "loss": 0.07973278760910034, "mean_token_accuracy": 0.9775013774633408, "num_tokens": 326032.0, "step": 300 }, { "entropy": 0.07721547149121762, "epoch": 0.17066666666666666, "grad_norm": 0.3847689926624298, "learning_rate": 2.988384888322847e-05, "loss": 0.07336270809173584, "mean_token_accuracy": 0.9787119507789612, "num_tokens": 348471.0, "step": 320 }, { "entropy": 0.07721726167947054, "epoch": 0.18133333333333335, "grad_norm": 0.27838024497032166, "learning_rate": 2.9861699501107378e-05, "loss": 0.07494103908538818, "mean_token_accuracy": 0.9785683915019036, "num_tokens": 369782.0, "step": 340 }, { "entropy": 0.07658242103643716, "epoch": 0.192, "grad_norm": 0.31607189774513245, "learning_rate": 2.983762809427437e-05, "loss": 0.07525045275688172, "mean_token_accuracy": 0.9776499375700951, "num_tokens": 392696.0, "step": 360 }, { "entropy": 0.075563720241189, "epoch": 0.20266666666666666, "grad_norm": 0.3598628640174866, "learning_rate": 2.981163777582151e-05, "loss": 0.07243417501449585, "mean_token_accuracy": 0.9788009360432625, "num_tokens": 414821.0, "step": 380 }, { "entropy": 0.07607982028275728, "epoch": 0.21333333333333335, "grad_norm": 0.40936508774757385, "learning_rate": 2.9783731907008686e-05, "loss": 0.07915560007095337, "mean_token_accuracy": 0.9773870885372162, "num_tokens": 438146.0, "step": 400 }, { "entropy": 0.07262871153652668, "epoch": 0.224, "grad_norm": 0.381472647190094, "learning_rate": 2.9753914096828898e-05, "loss": 0.06799554228782653, "mean_token_accuracy": 0.9803747221827507, "num_tokens": 458624.0, "step": 420 }, { "entropy": 0.08185875937342643, "epoch": 0.23466666666666666, "grad_norm": 0.5101166367530823, "learning_rate": 2.9722188201541517e-05, "loss": 0.08290064930915833, "mean_token_accuracy": 0.9758498474955559, "num_tokens": 481486.0, "step": 440 }, { "entropy": 0.0798154235817492, "epoch": 0.24533333333333332, "grad_norm": 0.46328306198120117, "learning_rate": 2.968855832417357e-05, "loss": 0.07726043462753296, "mean_token_accuracy": 0.9774591788649559, "num_tokens": 504517.0, "step": 460 }, { "entropy": 0.0712804809678346, "epoch": 0.256, "grad_norm": 0.34927302598953247, "learning_rate": 2.965302881398911e-05, "loss": 0.0709686040878296, "mean_token_accuracy": 0.9796265155076981, "num_tokens": 525475.0, "step": 480 }, { "entropy": 0.06547207403928042, "epoch": 0.26666666666666666, "grad_norm": 0.6727742552757263, "learning_rate": 2.9615604265926728e-05, "loss": 0.0662114143371582, "mean_token_accuracy": 0.9803611278533936, "num_tokens": 545600.0, "step": 500 }, { "entropy": 0.06710066087543964, "epoch": 0.2773333333333333, "grad_norm": 0.45624563097953796, "learning_rate": 2.957628952000531e-05, "loss": 0.06518577337265015, "mean_token_accuracy": 0.9814524441957474, "num_tokens": 565706.0, "step": 520 }, { "entropy": 0.0751929541118443, "epoch": 0.288, "grad_norm": 0.3284471929073334, "learning_rate": 2.9535089660698077e-05, "loss": 0.07515062689781189, "mean_token_accuracy": 0.9783789336681366, "num_tokens": 587393.0, "step": 540 }, { "entropy": 0.07246321747079491, "epoch": 0.2986666666666667, "grad_norm": 0.3948511779308319, "learning_rate": 2.9492010016275036e-05, "loss": 0.07291712760925292, "mean_token_accuracy": 0.9785362645983696, "num_tokens": 609171.0, "step": 560 }, { "entropy": 0.06350514343939721, "epoch": 0.30933333333333335, "grad_norm": 0.314139723777771, "learning_rate": 2.944705615811389e-05, "loss": 0.06677749156951904, "mean_token_accuracy": 0.9803237706422806, "num_tokens": 630239.0, "step": 580 }, { "entropy": 0.06738578667864203, "epoch": 0.32, "grad_norm": 0.36207115650177, "learning_rate": 2.9400233899979493e-05, "loss": 0.06742758750915527, "mean_token_accuracy": 0.9798387750983238, "num_tokens": 651094.0, "step": 600 }, { "entropy": 0.07454993184655904, "epoch": 0.33066666666666666, "grad_norm": 0.3180656433105469, "learning_rate": 2.9351549297271985e-05, "loss": 0.07321251630783081, "mean_token_accuracy": 0.9780681982636452, "num_tokens": 673562.0, "step": 620 }, { "entropy": 0.07280182931572199, "epoch": 0.3413333333333333, "grad_norm": 0.32510796189308167, "learning_rate": 2.9301008646243653e-05, "loss": 0.07445473074913025, "mean_token_accuracy": 0.9777527928352356, "num_tokens": 695144.0, "step": 640 }, { "entropy": 0.06629417887888849, "epoch": 0.352, "grad_norm": 0.3238341808319092, "learning_rate": 2.9248618483184658e-05, "loss": 0.06477652788162232, "mean_token_accuracy": 0.9803259864449501, "num_tokens": 715736.0, "step": 660 }, { "entropy": 0.07434157487004996, "epoch": 0.3626666666666667, "grad_norm": 0.4881466329097748, "learning_rate": 2.9194385583577713e-05, "loss": 0.074578857421875, "mean_token_accuracy": 0.978272306919098, "num_tokens": 738223.0, "step": 680 }, { "entropy": 0.06839693682268262, "epoch": 0.37333333333333335, "grad_norm": 0.28420260548591614, "learning_rate": 2.913831696122183e-05, "loss": 0.07069446444511414, "mean_token_accuracy": 0.9783747613430023, "num_tokens": 759757.0, "step": 700 }, { "entropy": 0.0676080210134387, "epoch": 0.384, "grad_norm": 0.39809709787368774, "learning_rate": 2.9080419867325237e-05, "loss": 0.06743242740631103, "mean_token_accuracy": 0.9805570602416992, "num_tokens": 780468.0, "step": 720 }, { "entropy": 0.07527220472693444, "epoch": 0.39466666666666667, "grad_norm": 0.35423487424850464, "learning_rate": 2.9020701789567604e-05, "loss": 0.0771526575088501, "mean_token_accuracy": 0.9762488156557083, "num_tokens": 802965.0, "step": 740 }, { "entropy": 0.0742669789120555, "epoch": 0.4053333333333333, "grad_norm": 0.3001997172832489, "learning_rate": 2.895917045113168e-05, "loss": 0.07353838682174682, "mean_token_accuracy": 0.9768529623746872, "num_tokens": 824952.0, "step": 760 }, { "entropy": 0.07476197639480234, "epoch": 0.416, "grad_norm": 0.477760374546051, "learning_rate": 2.8895833809704472e-05, "loss": 0.075287127494812, "mean_token_accuracy": 0.9776960402727127, "num_tokens": 847335.0, "step": 780 }, { "entropy": 0.07617697194218635, "epoch": 0.4266666666666667, "grad_norm": 0.257163941860199, "learning_rate": 2.88307000564481e-05, "loss": 0.07502832412719726, "mean_token_accuracy": 0.977412973344326, "num_tokens": 869694.0, "step": 800 }, { "entropy": 0.06724974531680346, "epoch": 0.43733333333333335, "grad_norm": 0.2475440800189972, "learning_rate": 2.8763777614940456e-05, "loss": 0.06770724058151245, "mean_token_accuracy": 0.9807002753019333, "num_tokens": 890247.0, "step": 820 }, { "entropy": 0.07065033931285143, "epoch": 0.448, "grad_norm": 0.28949040174484253, "learning_rate": 2.8695075140085806e-05, "loss": 0.0740054190158844, "mean_token_accuracy": 0.9777054205536843, "num_tokens": 912437.0, "step": 840 }, { "entropy": 0.07398124393075704, "epoch": 0.45866666666666667, "grad_norm": 0.2573949694633484, "learning_rate": 2.862460151699546e-05, "loss": 0.07121715545654297, "mean_token_accuracy": 0.9787738516926765, "num_tokens": 933823.0, "step": 860 }, { "entropy": 0.06237205946817994, "epoch": 0.4693333333333333, "grad_norm": 0.2926589250564575, "learning_rate": 2.8552365859838705e-05, "loss": 0.06375741958618164, "mean_token_accuracy": 0.981339943408966, "num_tokens": 954214.0, "step": 880 }, { "entropy": 0.06579331294633448, "epoch": 0.48, "grad_norm": 0.2862912714481354, "learning_rate": 2.8478377510664084e-05, "loss": 0.06657766103744507, "mean_token_accuracy": 0.9801932483911514, "num_tokens": 975338.0, "step": 900 }, { "entropy": 0.06900884290225803, "epoch": 0.49066666666666664, "grad_norm": 0.2465200126171112, "learning_rate": 2.8402646038191212e-05, "loss": 0.07071024179458618, "mean_token_accuracy": 0.9791238903999329, "num_tokens": 996945.0, "step": 920 }, { "entropy": 0.07488874141126871, "epoch": 0.5013333333333333, "grad_norm": 0.3744136393070221, "learning_rate": 2.832518123657328e-05, "loss": 0.07590996623039245, "mean_token_accuracy": 0.9782673969864846, "num_tokens": 1019406.0, "step": 940 }, { "entropy": 0.06512500997632742, "epoch": 0.512, "grad_norm": 0.354690819978714, "learning_rate": 2.824599312413039e-05, "loss": 0.06666624546051025, "mean_token_accuracy": 0.9810455769300461, "num_tokens": 1040080.0, "step": 960 }, { "entropy": 0.07058156430721282, "epoch": 0.5226666666666666, "grad_norm": 0.2862028181552887, "learning_rate": 2.816509194205394e-05, "loss": 0.07034226655960082, "mean_token_accuracy": 0.9796382382512092, "num_tokens": 1061056.0, "step": 980 }, { "entropy": 0.06635954724624753, "epoch": 0.5333333333333333, "grad_norm": 0.3258682191371918, "learning_rate": 2.808248815308214e-05, "loss": 0.06933177709579467, "mean_token_accuracy": 0.979850122332573, "num_tokens": 1082431.0, "step": 1000 }, { "entropy": 0.07130869440734386, "epoch": 0.544, "grad_norm": 0.4001695215702057, "learning_rate": 2.7998192440146885e-05, "loss": 0.07018501758575439, "mean_token_accuracy": 0.9788232401013375, "num_tokens": 1103056.0, "step": 1020 }, { "entropy": 0.06629347717389464, "epoch": 0.5546666666666666, "grad_norm": 0.3068975806236267, "learning_rate": 2.7912215704992178e-05, "loss": 0.06562011241912842, "mean_token_accuracy": 0.9801233530044555, "num_tokens": 1123629.0, "step": 1040 }, { "entropy": 0.0669340806081891, "epoch": 0.5653333333333334, "grad_norm": 0.291361927986145, "learning_rate": 2.7824569066764228e-05, "loss": 0.06813285946846008, "mean_token_accuracy": 0.9795377850532532, "num_tokens": 1145205.0, "step": 1060 }, { "entropy": 0.06657159719616175, "epoch": 0.576, "grad_norm": 0.4103650748729706, "learning_rate": 2.7735263860573427e-05, "loss": 0.0706522822380066, "mean_token_accuracy": 0.9789624258875846, "num_tokens": 1166152.0, "step": 1080 }, { "entropy": 0.06565243299119175, "epoch": 0.5866666666666667, "grad_norm": 0.19713713228702545, "learning_rate": 2.7644311636028443e-05, "loss": 0.0657187283039093, "mean_token_accuracy": 0.9809520095586777, "num_tokens": 1186408.0, "step": 1100 }, { "entropy": 0.06613961681723594, "epoch": 0.5973333333333334, "grad_norm": 0.38389384746551514, "learning_rate": 2.7551724155742496e-05, "loss": 0.06793384552001953, "mean_token_accuracy": 0.9800930395722389, "num_tokens": 1207073.0, "step": 1120 }, { "entropy": 0.06301267836242914, "epoch": 0.608, "grad_norm": 0.28483763337135315, "learning_rate": 2.7457513393812165e-05, "loss": 0.06698591113090516, "mean_token_accuracy": 0.9796709790825844, "num_tokens": 1227985.0, "step": 1140 }, { "entropy": 0.06924524456262589, "epoch": 0.6186666666666667, "grad_norm": 0.3032520115375519, "learning_rate": 2.7361691534268794e-05, "loss": 0.0688162088394165, "mean_token_accuracy": 0.9792484521865845, "num_tokens": 1249420.0, "step": 1160 }, { "entropy": 0.06591361574828625, "epoch": 0.6293333333333333, "grad_norm": 0.2796316146850586, "learning_rate": 2.726427096950277e-05, "loss": 0.06471214890480041, "mean_token_accuracy": 0.9802895054221153, "num_tokens": 1269803.0, "step": 1180 }, { "entropy": 0.06655512368306518, "epoch": 0.64, "grad_norm": 0.334458589553833, "learning_rate": 2.7165264298660843e-05, "loss": 0.0680499792098999, "mean_token_accuracy": 0.9798945024609566, "num_tokens": 1290820.0, "step": 1200 }, { "entropy": 0.07104279901832342, "epoch": 0.6506666666666666, "grad_norm": 0.2985312044620514, "learning_rate": 2.7064684326016705e-05, "loss": 0.07158678770065308, "mean_token_accuracy": 0.9790138527750969, "num_tokens": 1312256.0, "step": 1220 }, { "entropy": 0.07178505323827267, "epoch": 0.6613333333333333, "grad_norm": 0.2647643983364105, "learning_rate": 2.696254405931506e-05, "loss": 0.07087129950523377, "mean_token_accuracy": 0.9788700684905052, "num_tokens": 1333659.0, "step": 1240 }, { "entropy": 0.07248318092897535, "epoch": 0.672, "grad_norm": 0.33957013487815857, "learning_rate": 2.685885670808935e-05, "loss": 0.07625460624694824, "mean_token_accuracy": 0.9776020765304565, "num_tokens": 1356166.0, "step": 1260 }, { "entropy": 0.06933322567492724, "epoch": 0.6826666666666666, "grad_norm": 0.3401638865470886, "learning_rate": 2.6753635681953432e-05, "loss": 0.07209213972091674, "mean_token_accuracy": 0.979287999868393, "num_tokens": 1377248.0, "step": 1280 }, { "entropy": 0.07241465076804161, "epoch": 0.6933333333333334, "grad_norm": 0.3512662351131439, "learning_rate": 2.66468945888673e-05, "loss": 0.07179180383682252, "mean_token_accuracy": 0.9785149216651916, "num_tokens": 1399215.0, "step": 1300 }, { "entropy": 0.06668442655354738, "epoch": 0.704, "grad_norm": 0.31074854731559753, "learning_rate": 2.653864723337725e-05, "loss": 0.06842232942581176, "mean_token_accuracy": 0.9793056011199951, "num_tokens": 1421156.0, "step": 1320 }, { "entropy": 0.07508801557123661, "epoch": 0.7146666666666667, "grad_norm": 0.23781085014343262, "learning_rate": 2.6428907614830547e-05, "loss": 0.07381449937820435, "mean_token_accuracy": 0.9774842232465744, "num_tokens": 1444107.0, "step": 1340 }, { "entropy": 0.07022066600620747, "epoch": 0.7253333333333334, "grad_norm": 0.2902912497520447, "learning_rate": 2.631768992556493e-05, "loss": 0.07421112656593323, "mean_token_accuracy": 0.9773566707968712, "num_tokens": 1466646.0, "step": 1360 }, { "entropy": 0.07529082838445902, "epoch": 0.736, "grad_norm": 0.29716333746910095, "learning_rate": 2.6205008549073156e-05, "loss": 0.07513617277145386, "mean_token_accuracy": 0.9776451155543328, "num_tokens": 1489236.0, "step": 1380 }, { "entropy": 0.07013567788526416, "epoch": 0.7466666666666667, "grad_norm": 0.32034385204315186, "learning_rate": 2.6090878058142826e-05, "loss": 0.07192614078521728, "mean_token_accuracy": 0.9784543365240097, "num_tokens": 1511165.0, "step": 1400 }, { "entropy": 0.06659635296091437, "epoch": 0.7573333333333333, "grad_norm": 0.21232427656650543, "learning_rate": 2.5975313212971717e-05, "loss": 0.06635284423828125, "mean_token_accuracy": 0.9803870663046836, "num_tokens": 1532360.0, "step": 1420 }, { "entropy": 0.07205540081486106, "epoch": 0.768, "grad_norm": 0.24671520292758942, "learning_rate": 2.585832895925889e-05, "loss": 0.07270323038101197, "mean_token_accuracy": 0.9785439759492874, "num_tokens": 1554448.0, "step": 1440 }, { "entropy": 0.06918675852939486, "epoch": 0.7786666666666666, "grad_norm": 0.2514943480491638, "learning_rate": 2.5739940426271794e-05, "loss": 0.06965571045875549, "mean_token_accuracy": 0.9788892433047295, "num_tokens": 1576245.0, "step": 1460 }, { "entropy": 0.06469840593636036, "epoch": 0.7893333333333333, "grad_norm": 0.3494434952735901, "learning_rate": 2.562016292488965e-05, "loss": 0.06652198433876037, "mean_token_accuracy": 0.9809101298451424, "num_tokens": 1596485.0, "step": 1480 }, { "entropy": 0.07068701386451721, "epoch": 0.8, "grad_norm": 0.281946063041687, "learning_rate": 2.5499011945623314e-05, "loss": 0.07348206043243408, "mean_token_accuracy": 0.9781546071171761, "num_tokens": 1618200.0, "step": 1500 }, { "entropy": 0.06995291169732809, "epoch": 0.8106666666666666, "grad_norm": 0.23206466436386108, "learning_rate": 2.537650315661196e-05, "loss": 0.06693890690803528, "mean_token_accuracy": 0.9801010102033615, "num_tokens": 1639174.0, "step": 1520 }, { "entropy": 0.06840123003348708, "epoch": 0.8213333333333334, "grad_norm": 0.3676995635032654, "learning_rate": 2.5252652401596733e-05, "loss": 0.07000104188919068, "mean_token_accuracy": 0.9784165650606156, "num_tokens": 1661359.0, "step": 1540 }, { "entropy": 0.0646398707292974, "epoch": 0.832, "grad_norm": 0.22217804193496704, "learning_rate": 2.512747569787173e-05, "loss": 0.06517070531845093, "mean_token_accuracy": 0.9804639294743538, "num_tokens": 1682342.0, "step": 1560 }, { "entropy": 0.07203069580718875, "epoch": 0.8426666666666667, "grad_norm": 0.33636361360549927, "learning_rate": 2.5000989234212538e-05, "loss": 0.0767048716545105, "mean_token_accuracy": 0.9769723698496818, "num_tokens": 1705410.0, "step": 1580 }, { "entropy": 0.07144555728882551, "epoch": 0.8533333333333334, "grad_norm": 0.41735950112342834, "learning_rate": 2.4873209368782542e-05, "loss": 0.07214229702949523, "mean_token_accuracy": 0.9783873930573463, "num_tokens": 1727533.0, "step": 1600 }, { "entropy": 0.07258805707097053, "epoch": 0.864, "grad_norm": 0.2509184777736664, "learning_rate": 2.474415262701742e-05, "loss": 0.07374660968780518, "mean_token_accuracy": 0.9784314125776291, "num_tokens": 1749324.0, "step": 1620 }, { "entropy": 0.06801199689507484, "epoch": 0.8746666666666667, "grad_norm": 0.2840649485588074, "learning_rate": 2.4613835699487926e-05, "loss": 0.06742731928825378, "mean_token_accuracy": 0.9799756482243538, "num_tokens": 1770154.0, "step": 1640 }, { "entropy": 0.06611601263284683, "epoch": 0.8853333333333333, "grad_norm": 0.32055601477622986, "learning_rate": 2.4482275439741318e-05, "loss": 0.06912029981613159, "mean_token_accuracy": 0.9791274040937423, "num_tokens": 1791563.0, "step": 1660 }, { "entropy": 0.07015209766104817, "epoch": 0.896, "grad_norm": 0.322442889213562, "learning_rate": 2.4349488862121777e-05, "loss": 0.0710118293762207, "mean_token_accuracy": 0.9784337431192398, "num_tokens": 1814153.0, "step": 1680 }, { "entropy": 0.07105656629428267, "epoch": 0.9066666666666666, "grad_norm": 0.33281370997428894, "learning_rate": 2.421549313956996e-05, "loss": 0.07393972873687744, "mean_token_accuracy": 0.9770426079630852, "num_tokens": 1836011.0, "step": 1700 }, { "entropy": 0.06153039713390172, "epoch": 0.9173333333333333, "grad_norm": 0.34345221519470215, "learning_rate": 2.4080305601402077e-05, "loss": 0.06438595056533813, "mean_token_accuracy": 0.9811754852533341, "num_tokens": 1856327.0, "step": 1720 }, { "entropy": 0.06947178347036242, "epoch": 0.928, "grad_norm": 0.23315641283988953, "learning_rate": 2.3943943731068726e-05, "loss": 0.06981109380722046, "mean_token_accuracy": 0.9784324377775192, "num_tokens": 1878263.0, "step": 1740 }, { "entropy": 0.06802130006253719, "epoch": 0.9386666666666666, "grad_norm": 0.2618308365345001, "learning_rate": 2.3806425163893823e-05, "loss": 0.06859763860702514, "mean_token_accuracy": 0.9791776061058044, "num_tokens": 1899636.0, "step": 1760 }, { "entropy": 0.06973028304055333, "epoch": 0.9493333333333334, "grad_norm": 0.24618478119373322, "learning_rate": 2.366776768479384e-05, "loss": 0.07086095809936524, "mean_token_accuracy": 0.9786002859473228, "num_tokens": 1921047.0, "step": 1780 }, { "entropy": 0.06561295241117478, "epoch": 0.96, "grad_norm": 0.2758350670337677, "learning_rate": 2.352798922597778e-05, "loss": 0.06786344051361085, "mean_token_accuracy": 0.9793999254703522, "num_tokens": 1942332.0, "step": 1800 }, { "entropy": 0.064028827752918, "epoch": 0.9706666666666667, "grad_norm": 0.39498090744018555, "learning_rate": 2.3387107864627988e-05, "loss": 0.06252858638763428, "mean_token_accuracy": 0.9808908835053444, "num_tokens": 1962893.0, "step": 1820 }, { "entropy": 0.05734303398057818, "epoch": 0.9813333333333333, "grad_norm": 0.39145660400390625, "learning_rate": 2.324514182056233e-05, "loss": 0.06022765040397644, "mean_token_accuracy": 0.9816997528076172, "num_tokens": 1982973.0, "step": 1840 }, { "entropy": 0.0701704291626811, "epoch": 0.992, "grad_norm": 0.23364675045013428, "learning_rate": 2.310210945387783e-05, "loss": 0.07281829714775086, "mean_token_accuracy": 0.9779222890734672, "num_tokens": 2005088.0, "step": 1860 }, { "entropy": 0.06261860271915794, "epoch": 1.0026666666666666, "grad_norm": 0.24298612773418427, "learning_rate": 2.2958029262576248e-05, "loss": 0.06308226585388184, "mean_token_accuracy": 0.9821192339062691, "num_tokens": 2025522.0, "step": 1880 }, { "entropy": 0.0643264465034008, "epoch": 1.0133333333333334, "grad_norm": 0.2755739688873291, "learning_rate": 2.2812919880171748e-05, "loss": 0.06683170795440674, "mean_token_accuracy": 0.9803125351667404, "num_tokens": 2046060.0, "step": 1900 }, { "entropy": 0.07090397626161575, "epoch": 1.024, "grad_norm": 0.3217398524284363, "learning_rate": 2.266680007328108e-05, "loss": 0.07337687611579895, "mean_token_accuracy": 0.9777734145522118, "num_tokens": 2067635.0, "step": 1920 }, { "entropy": 0.06721528638154269, "epoch": 1.0346666666666666, "grad_norm": 0.40361738204956055, "learning_rate": 2.2519688739196567e-05, "loss": 0.07007733583450318, "mean_token_accuracy": 0.9789602175354958, "num_tokens": 2089082.0, "step": 1940 }, { "entropy": 0.07042132476344705, "epoch": 1.0453333333333332, "grad_norm": 0.2519868314266205, "learning_rate": 2.237160490344214e-05, "loss": 0.0704314112663269, "mean_token_accuracy": 0.9786124229431152, "num_tokens": 2111237.0, "step": 1960 }, { "entropy": 0.06644694982096552, "epoch": 1.056, "grad_norm": 0.2761074900627136, "learning_rate": 2.2222567717312815e-05, "loss": 0.06676498651504517, "mean_token_accuracy": 0.9803151816129685, "num_tokens": 2133157.0, "step": 1980 }, { "entropy": 0.0724240118637681, "epoch": 1.0666666666666667, "grad_norm": 0.31547167897224426, "learning_rate": 2.207259645539794e-05, "loss": 0.07529684901237488, "mean_token_accuracy": 0.977134644985199, "num_tokens": 2156288.0, "step": 2000 }, { "entropy": 0.0705711885355413, "epoch": 1.0773333333333333, "grad_norm": 0.22879832983016968, "learning_rate": 2.192171051308843e-05, "loss": 0.07181910276412964, "mean_token_accuracy": 0.9787937015295028, "num_tokens": 2178459.0, "step": 2020 }, { "entropy": 0.06547352969646454, "epoch": 1.088, "grad_norm": 0.23372837901115417, "learning_rate": 2.176992940406841e-05, "loss": 0.06680878400802612, "mean_token_accuracy": 0.9798174753785134, "num_tokens": 2199053.0, "step": 2040 }, { "entropy": 0.06814751494675875, "epoch": 1.0986666666666667, "grad_norm": 0.3134348690509796, "learning_rate": 2.1617272757791596e-05, "loss": 0.06907396912574768, "mean_token_accuracy": 0.9791154950857163, "num_tokens": 2220356.0, "step": 2060 }, { "entropy": 0.06495830481871963, "epoch": 1.1093333333333333, "grad_norm": 0.29500001668930054, "learning_rate": 2.146376031694264e-05, "loss": 0.06694967150688172, "mean_token_accuracy": 0.9795457676053048, "num_tokens": 2241687.0, "step": 2080 }, { "entropy": 0.0655874202027917, "epoch": 1.12, "grad_norm": 0.22515356540679932, "learning_rate": 2.130941193488385e-05, "loss": 0.06550711393356323, "mean_token_accuracy": 0.979499951004982, "num_tokens": 2263024.0, "step": 2100 }, { "entropy": 0.0692840131931007, "epoch": 1.1306666666666667, "grad_norm": 0.21720077097415924, "learning_rate": 2.115424757308764e-05, "loss": 0.07195895910263062, "mean_token_accuracy": 0.9781101942062378, "num_tokens": 2285202.0, "step": 2120 }, { "entropy": 0.07025102246552706, "epoch": 1.1413333333333333, "grad_norm": 0.2687491476535797, "learning_rate": 2.0998287298554953e-05, "loss": 0.07001820206642151, "mean_token_accuracy": 0.9790668547153473, "num_tokens": 2307135.0, "step": 2140 }, { "entropy": 0.06896473728120327, "epoch": 1.152, "grad_norm": 0.33234819769859314, "learning_rate": 2.0841551281220024e-05, "loss": 0.07067601680755616, "mean_token_accuracy": 0.9789680764079094, "num_tokens": 2329136.0, "step": 2160 }, { "entropy": 0.0697830050252378, "epoch": 1.1626666666666667, "grad_norm": 0.23710612952709198, "learning_rate": 2.068405979134189e-05, "loss": 0.07100222706794738, "mean_token_accuracy": 0.97775998711586, "num_tokens": 2352008.0, "step": 2180 }, { "entropy": 0.0642639453522861, "epoch": 1.1733333333333333, "grad_norm": 0.42563989758491516, "learning_rate": 2.052583319688288e-05, "loss": 0.06657282710075378, "mean_token_accuracy": 0.9803543120622635, "num_tokens": 2372502.0, "step": 2200 }, { "entropy": 0.07466318933293223, "epoch": 1.184, "grad_norm": 0.2777847647666931, "learning_rate": 2.0366891960874455e-05, "loss": 0.07471616864204407, "mean_token_accuracy": 0.9775146871805191, "num_tokens": 2395472.0, "step": 2220 }, { "entropy": 0.06853743204846978, "epoch": 1.1946666666666665, "grad_norm": 0.2928735911846161, "learning_rate": 2.020725663877082e-05, "loss": 0.06982612609863281, "mean_token_accuracy": 0.9785092636942864, "num_tokens": 2417456.0, "step": 2240 }, { "entropy": 0.06352933412417769, "epoch": 1.2053333333333334, "grad_norm": 0.2748047411441803, "learning_rate": 2.0046947875790507e-05, "loss": 0.06415975093841553, "mean_token_accuracy": 0.9810280442237854, "num_tokens": 2437782.0, "step": 2260 }, { "entropy": 0.06905667120590805, "epoch": 1.216, "grad_norm": 0.4259282052516937, "learning_rate": 1.9885986404246387e-05, "loss": 0.07213917970657349, "mean_token_accuracy": 0.9776696145534516, "num_tokens": 2460043.0, "step": 2280 }, { "entropy": 0.07057028766721488, "epoch": 1.2266666666666666, "grad_norm": 0.22553683817386627, "learning_rate": 1.9724393040864435e-05, "loss": 0.06978555917739868, "mean_token_accuracy": 0.9783964306116104, "num_tokens": 2481541.0, "step": 2300 }, { "entropy": 0.06282441029325128, "epoch": 1.2373333333333334, "grad_norm": 0.2527618706226349, "learning_rate": 1.9562188684091544e-05, "loss": 0.06330822110176086, "mean_token_accuracy": 0.9808567300438881, "num_tokens": 2501805.0, "step": 2320 }, { "entropy": 0.06984690874814987, "epoch": 1.248, "grad_norm": 0.22297634184360504, "learning_rate": 1.9399394311392777e-05, "loss": 0.07097877264022827, "mean_token_accuracy": 0.9779043823480607, "num_tokens": 2524242.0, "step": 2340 }, { "entropy": 0.060862915217876436, "epoch": 1.2586666666666666, "grad_norm": 0.18649785220623016, "learning_rate": 1.9236030976538415e-05, "loss": 0.06111966371536255, "mean_token_accuracy": 0.981529700756073, "num_tokens": 2544070.0, "step": 2360 }, { "entropy": 0.0701494576409459, "epoch": 1.2693333333333334, "grad_norm": 0.43911799788475037, "learning_rate": 1.907211980688112e-05, "loss": 0.07214288115501404, "mean_token_accuracy": 0.9776056706905365, "num_tokens": 2566753.0, "step": 2380 }, { "entropy": 0.06710393568500876, "epoch": 1.28, "grad_norm": 0.2369464486837387, "learning_rate": 1.8907682000623615e-05, "loss": 0.06771854162216187, "mean_token_accuracy": 0.9792038664221764, "num_tokens": 2588334.0, "step": 2400 }, { "entropy": 0.06779517000541091, "epoch": 1.2906666666666666, "grad_norm": 0.2957499921321869, "learning_rate": 1.8742738824077135e-05, "loss": 0.06764324307441712, "mean_token_accuracy": 0.9794522881507873, "num_tokens": 2609672.0, "step": 2420 }, { "entropy": 0.06741884406656026, "epoch": 1.3013333333333335, "grad_norm": 0.19155755639076233, "learning_rate": 1.8577311608911148e-05, "loss": 0.07110410928726196, "mean_token_accuracy": 0.979012542963028, "num_tokens": 2631790.0, "step": 2440 }, { "entropy": 0.06480904156342149, "epoch": 1.312, "grad_norm": 0.24207216501235962, "learning_rate": 1.8411421749394553e-05, "loss": 0.06625967025756836, "mean_token_accuracy": 0.9789305970072746, "num_tokens": 2653196.0, "step": 2460 }, { "entropy": 0.07047648271545767, "epoch": 1.3226666666666667, "grad_norm": 0.22696281969547272, "learning_rate": 1.8245090699628847e-05, "loss": 0.07121983766555787, "mean_token_accuracy": 0.9779788121581078, "num_tokens": 2675588.0, "step": 2480 }, { "entropy": 0.06328712170943618, "epoch": 1.3333333333333333, "grad_norm": 0.37556302547454834, "learning_rate": 1.8078339970773503e-05, "loss": 0.06369008421897888, "mean_token_accuracy": 0.9798499271273613, "num_tokens": 2696544.0, "step": 2500 }, { "entropy": 0.05966705903410911, "epoch": 1.3439999999999999, "grad_norm": 0.4442780911922455, "learning_rate": 1.7911191128263998e-05, "loss": 0.061522841453552246, "mean_token_accuracy": 0.9818950071930885, "num_tokens": 2716857.0, "step": 2520 }, { "entropy": 0.062313361838459966, "epoch": 1.3546666666666667, "grad_norm": 0.24720695614814758, "learning_rate": 1.7743665789022793e-05, "loss": 0.06486648917198182, "mean_token_accuracy": 0.9798543632030488, "num_tokens": 2737538.0, "step": 2540 }, { "entropy": 0.06682068817317485, "epoch": 1.3653333333333333, "grad_norm": 0.3359099328517914, "learning_rate": 1.7575785618663694e-05, "loss": 0.06577321290969848, "mean_token_accuracy": 0.9804640114307404, "num_tokens": 2758530.0, "step": 2560 }, { "entropy": 0.06843016855418682, "epoch": 1.376, "grad_norm": 0.29373666644096375, "learning_rate": 1.7407572328689894e-05, "loss": 0.07291231155395508, "mean_token_accuracy": 0.9776088848710061, "num_tokens": 2781109.0, "step": 2580 }, { "entropy": 0.06162329772487283, "epoch": 1.3866666666666667, "grad_norm": 0.3116828203201294, "learning_rate": 1.7239047673686063e-05, "loss": 0.06326555609703063, "mean_token_accuracy": 0.9805142045021057, "num_tokens": 2801942.0, "step": 2600 }, { "entropy": 0.07026779251173139, "epoch": 1.3973333333333333, "grad_norm": 0.2655540406703949, "learning_rate": 1.70702334485049e-05, "loss": 0.06906303167343139, "mean_token_accuracy": 0.9795295283198356, "num_tokens": 2823119.0, "step": 2620 }, { "entropy": 0.06296397158876062, "epoch": 1.408, "grad_norm": 0.22108644247055054, "learning_rate": 1.690115148544846e-05, "loss": 0.0667952299118042, "mean_token_accuracy": 0.9797157511115074, "num_tokens": 2843803.0, "step": 2640 }, { "entropy": 0.0670015354640782, "epoch": 1.4186666666666667, "grad_norm": 0.2712651789188385, "learning_rate": 1.673182365144463e-05, "loss": 0.06649012565612793, "mean_token_accuracy": 0.9791848674416542, "num_tokens": 2865230.0, "step": 2660 }, { "entropy": 0.0670851232483983, "epoch": 1.4293333333333333, "grad_norm": 0.24662579596042633, "learning_rate": 1.656227184521915e-05, "loss": 0.06703668236732482, "mean_token_accuracy": 0.9795497417449951, "num_tokens": 2886358.0, "step": 2680 }, { "entropy": 0.062353554228320715, "epoch": 1.44, "grad_norm": 0.3106047809123993, "learning_rate": 1.6392517994463503e-05, "loss": 0.06736364364624023, "mean_token_accuracy": 0.9799954712390899, "num_tokens": 2907066.0, "step": 2700 }, { "entropy": 0.07080234689638018, "epoch": 1.4506666666666668, "grad_norm": 0.26504889130592346, "learning_rate": 1.622258405299905e-05, "loss": 0.0705980658531189, "mean_token_accuracy": 0.9781270638108254, "num_tokens": 2928955.0, "step": 2720 }, { "entropy": 0.06422470416873693, "epoch": 1.4613333333333334, "grad_norm": 0.2791357934474945, "learning_rate": 1.6052491997937828e-05, "loss": 0.06357557773590088, "mean_token_accuracy": 0.9806081086397171, "num_tokens": 2949978.0, "step": 2740 }, { "entropy": 0.0685284486040473, "epoch": 1.472, "grad_norm": 0.229026198387146, "learning_rate": 1.5882263826840286e-05, "loss": 0.06834735870361328, "mean_token_accuracy": 0.9792908281087875, "num_tokens": 2971296.0, "step": 2760 }, { "entropy": 0.06865171985700727, "epoch": 1.4826666666666668, "grad_norm": 0.2075856328010559, "learning_rate": 1.5711921554870394e-05, "loss": 0.07082886695861816, "mean_token_accuracy": 0.9781916663050652, "num_tokens": 2993694.0, "step": 2780 }, { "entropy": 0.06149051366373896, "epoch": 1.4933333333333334, "grad_norm": 0.24510766565799713, "learning_rate": 1.55414872119485e-05, "loss": 0.06140315532684326, "mean_token_accuracy": 0.981805543601513, "num_tokens": 3013485.0, "step": 2800 }, { "entropy": 0.06283597350120544, "epoch": 1.504, "grad_norm": 0.3660076856613159, "learning_rate": 1.5370982839902248e-05, "loss": 0.06664196252822877, "mean_token_accuracy": 0.9799850210547447, "num_tokens": 3034373.0, "step": 2820 }, { "entropy": 0.06986485011875629, "epoch": 1.5146666666666668, "grad_norm": 0.28147414326667786, "learning_rate": 1.5200430489615963e-05, "loss": 0.0729372501373291, "mean_token_accuracy": 0.97689548432827, "num_tokens": 3056657.0, "step": 2840 }, { "entropy": 0.06884724954143166, "epoch": 1.5253333333333332, "grad_norm": 0.23151597380638123, "learning_rate": 1.5029852218178867e-05, "loss": 0.06714131832122802, "mean_token_accuracy": 0.9793031871318817, "num_tokens": 3077669.0, "step": 2860 }, { "entropy": 0.0727352373301983, "epoch": 1.536, "grad_norm": 0.2120618373155594, "learning_rate": 1.48592700860325e-05, "loss": 0.07464810013771057, "mean_token_accuracy": 0.9764216035604477, "num_tokens": 3100875.0, "step": 2880 }, { "entropy": 0.06410896023735405, "epoch": 1.5466666666666666, "grad_norm": 0.27255088090896606, "learning_rate": 1.4688706154117696e-05, "loss": 0.06503221988677979, "mean_token_accuracy": 0.979265221953392, "num_tokens": 3122384.0, "step": 2900 }, { "entropy": 0.06694338582456112, "epoch": 1.5573333333333332, "grad_norm": 0.24979744851589203, "learning_rate": 1.4518182481021502e-05, "loss": 0.07112652659416199, "mean_token_accuracy": 0.9789192631840706, "num_tokens": 3144087.0, "step": 2920 }, { "entropy": 0.07254285905510187, "epoch": 1.568, "grad_norm": 0.28004226088523865, "learning_rate": 1.4347721120124397e-05, "loss": 0.07123505473136901, "mean_token_accuracy": 0.978886678814888, "num_tokens": 3166175.0, "step": 2940 }, { "entropy": 0.07109334822744132, "epoch": 1.5786666666666667, "grad_norm": 0.2444435954093933, "learning_rate": 1.417734411674819e-05, "loss": 0.07034714221954345, "mean_token_accuracy": 0.9788279756903648, "num_tokens": 3188135.0, "step": 2960 }, { "entropy": 0.06219260273501277, "epoch": 1.5893333333333333, "grad_norm": 0.2968960404396057, "learning_rate": 1.4007073505304941e-05, "loss": 0.06635067462921143, "mean_token_accuracy": 0.9803951069712639, "num_tokens": 3210125.0, "step": 2980 }, { "entropy": 0.06454241126775742, "epoch": 1.6, "grad_norm": 0.31802278757095337, "learning_rate": 1.383693130644733e-05, "loss": 0.06557859778404236, "mean_token_accuracy": 0.9794120013713836, "num_tokens": 3231328.0, "step": 3000 }, { "entropy": 0.06623651813715696, "epoch": 1.6106666666666667, "grad_norm": 0.2680739164352417, "learning_rate": 1.3666939524220767e-05, "loss": 0.06552712917327881, "mean_token_accuracy": 0.981256639957428, "num_tokens": 3252076.0, "step": 3020 }, { "entropy": 0.0598441306501627, "epoch": 1.6213333333333333, "grad_norm": 0.33669978380203247, "learning_rate": 1.3497120143217684e-05, "loss": 0.06124056577682495, "mean_token_accuracy": 0.9811162427067757, "num_tokens": 3272386.0, "step": 3040 }, { "entropy": 0.05869143349118531, "epoch": 1.6320000000000001, "grad_norm": 0.43568432331085205, "learning_rate": 1.3327495125734301e-05, "loss": 0.06237072944641113, "mean_token_accuracy": 0.9805628210306168, "num_tokens": 3293231.0, "step": 3060 }, { "entropy": 0.06979248141869902, "epoch": 1.6426666666666667, "grad_norm": 0.19376863539218903, "learning_rate": 1.3158086408930324e-05, "loss": 0.07059879302978515, "mean_token_accuracy": 0.9788637235760689, "num_tokens": 3314754.0, "step": 3080 }, { "entropy": 0.06580152967944741, "epoch": 1.6533333333333333, "grad_norm": 0.25558850169181824, "learning_rate": 1.2988915901991841e-05, "loss": 0.06825007200241089, "mean_token_accuracy": 0.9793827921152115, "num_tokens": 3336111.0, "step": 3100 }, { "entropy": 0.06895913444459438, "epoch": 1.6640000000000001, "grad_norm": 0.21350796520709991, "learning_rate": 1.28200054832979e-05, "loss": 0.07058674097061157, "mean_token_accuracy": 0.9781552821397781, "num_tokens": 3358444.0, "step": 3120 }, { "entropy": 0.0663242308422923, "epoch": 1.6746666666666665, "grad_norm": 0.222551628947258, "learning_rate": 1.2651376997591005e-05, "loss": 0.06854333281517029, "mean_token_accuracy": 0.9788196787238121, "num_tokens": 3379744.0, "step": 3140 }, { "entropy": 0.07216014033183456, "epoch": 1.6853333333333333, "grad_norm": 0.3092426359653473, "learning_rate": 1.248305225315201e-05, "loss": 0.07203421592712403, "mean_token_accuracy": 0.978464289009571, "num_tokens": 3402040.0, "step": 3160 }, { "entropy": 0.06513830767944455, "epoch": 1.696, "grad_norm": 0.23164676129817963, "learning_rate": 1.2315053018979699e-05, "loss": 0.06423503160476685, "mean_token_accuracy": 0.9801443338394165, "num_tokens": 3423245.0, "step": 3180 }, { "entropy": 0.061648647487163546, "epoch": 1.7066666666666666, "grad_norm": 0.2687373161315918, "learning_rate": 1.2147401021975471e-05, "loss": 0.06325778961181641, "mean_token_accuracy": 0.9801615089178085, "num_tokens": 3444668.0, "step": 3200 }, { "entropy": 0.06408334821462632, "epoch": 1.7173333333333334, "grad_norm": 0.266205757856369, "learning_rate": 1.1980117944133456e-05, "loss": 0.06507928371429443, "mean_token_accuracy": 0.9799869328737258, "num_tokens": 3465960.0, "step": 3220 }, { "entropy": 0.06640919763594866, "epoch": 1.728, "grad_norm": 0.33705103397369385, "learning_rate": 1.1813225419736424e-05, "loss": 0.06713052988052368, "mean_token_accuracy": 0.9789028987288475, "num_tokens": 3487326.0, "step": 3240 }, { "entropy": 0.07378814425319433, "epoch": 1.7386666666666666, "grad_norm": 0.31500980257987976, "learning_rate": 1.1646745032557895e-05, "loss": 0.07433319091796875, "mean_token_accuracy": 0.9771664574742317, "num_tokens": 3510466.0, "step": 3260 }, { "entropy": 0.0691059660166502, "epoch": 1.7493333333333334, "grad_norm": 0.33240073919296265, "learning_rate": 1.148069831307075e-05, "loss": 0.07068810462951661, "mean_token_accuracy": 0.9787816539406776, "num_tokens": 3531979.0, "step": 3280 }, { "entropy": 0.06790078049525619, "epoch": 1.76, "grad_norm": 0.2651180922985077, "learning_rate": 1.1315106735662778e-05, "loss": 0.07065703868865966, "mean_token_accuracy": 0.9792906358838082, "num_tokens": 3553906.0, "step": 3300 }, { "entropy": 0.0658861649222672, "epoch": 1.7706666666666666, "grad_norm": 0.23769696056842804, "learning_rate": 1.1149991715859428e-05, "loss": 0.06460118293762207, "mean_token_accuracy": 0.980093178153038, "num_tokens": 3575064.0, "step": 3320 }, { "entropy": 0.06296280124224722, "epoch": 1.7813333333333334, "grad_norm": 0.313032329082489, "learning_rate": 1.0985374607554197e-05, "loss": 0.0678341567516327, "mean_token_accuracy": 0.9797580793499947, "num_tokens": 3596537.0, "step": 3340 }, { "entropy": 0.06739533795043826, "epoch": 1.792, "grad_norm": 0.2906402349472046, "learning_rate": 1.0821276700246993e-05, "loss": 0.06724486351013184, "mean_token_accuracy": 0.9797164380550385, "num_tokens": 3617501.0, "step": 3360 }, { "entropy": 0.06835585637018085, "epoch": 1.8026666666666666, "grad_norm": 0.4202954173088074, "learning_rate": 1.0657719216290813e-05, "loss": 0.06997250318527222, "mean_token_accuracy": 0.9782811865210533, "num_tokens": 3639900.0, "step": 3380 }, { "entropy": 0.07121322192251682, "epoch": 1.8133333333333335, "grad_norm": 0.2250560075044632, "learning_rate": 1.0494723308147131e-05, "loss": 0.07189694046974182, "mean_token_accuracy": 0.9778885126113892, "num_tokens": 3661521.0, "step": 3400 }, { "entropy": 0.06754076760262251, "epoch": 1.8239999999999998, "grad_norm": 0.29606980085372925, "learning_rate": 1.0332310055650275e-05, "loss": 0.06917176246643067, "mean_token_accuracy": 0.979434996843338, "num_tokens": 3682643.0, "step": 3420 }, { "entropy": 0.07379511212930083, "epoch": 1.8346666666666667, "grad_norm": 0.25708991289138794, "learning_rate": 1.0170500463281247e-05, "loss": 0.07167908549308777, "mean_token_accuracy": 0.9780497521162033, "num_tokens": 3704737.0, "step": 3440 }, { "entropy": 0.06362721435725689, "epoch": 1.8453333333333335, "grad_norm": 0.23008571565151215, "learning_rate": 1.0009315457451272e-05, "loss": 0.06768688559532166, "mean_token_accuracy": 0.9787532314658165, "num_tokens": 3726432.0, "step": 3460 }, { "entropy": 0.06857527056708931, "epoch": 1.8559999999999999, "grad_norm": 0.229081392288208, "learning_rate": 9.848775883795413e-06, "loss": 0.06961520314216614, "mean_token_accuracy": 0.9785497590899468, "num_tokens": 3747724.0, "step": 3480 }, { "entropy": 0.0680385141633451, "epoch": 1.8666666666666667, "grad_norm": 0.25065746903419495, "learning_rate": 9.688902504476698e-06, "loss": 0.06657001376152039, "mean_token_accuracy": 0.9794670984148979, "num_tokens": 3769338.0, "step": 3500 }, { "entropy": 0.06824945779517293, "epoch": 1.8773333333333333, "grad_norm": 0.24879534542560577, "learning_rate": 9.529715995500974e-06, "loss": 0.0720153272151947, "mean_token_accuracy": 0.9776617914438248, "num_tokens": 3791756.0, "step": 3520 }, { "entropy": 0.06479481738060713, "epoch": 1.888, "grad_norm": 0.254541277885437, "learning_rate": 9.371236944042949e-06, "loss": 0.06658366322517395, "mean_token_accuracy": 0.9801236733794212, "num_tokens": 3812980.0, "step": 3540 }, { "entropy": 0.06725719030946493, "epoch": 1.8986666666666667, "grad_norm": 0.20114503800868988, "learning_rate": 9.213485845783699e-06, "loss": 0.06695624589920043, "mean_token_accuracy": 0.9790028914809227, "num_tokens": 3834204.0, "step": 3560 }, { "entropy": 0.06467321151867508, "epoch": 1.9093333333333333, "grad_norm": 0.3090938329696655, "learning_rate": 9.056483102260023e-06, "loss": 0.06516823768615723, "mean_token_accuracy": 0.9797172531485557, "num_tokens": 3855431.0, "step": 3580 }, { "entropy": 0.0704337134025991, "epoch": 1.92, "grad_norm": 0.29103463888168335, "learning_rate": 8.900249018225946e-06, "loss": 0.07074209451675414, "mean_token_accuracy": 0.9780181258916855, "num_tokens": 3878649.0, "step": 3600 }, { "entropy": 0.0582809004932642, "epoch": 1.9306666666666668, "grad_norm": 0.20316410064697266, "learning_rate": 8.744803799026782e-06, "loss": 0.057930976152420044, "mean_token_accuracy": 0.9826426327228546, "num_tokens": 3897996.0, "step": 3620 }, { "entropy": 0.06718643885105849, "epoch": 1.9413333333333334, "grad_norm": 0.22466565668582916, "learning_rate": 8.590167547986025e-06, "loss": 0.07398964166641235, "mean_token_accuracy": 0.9769044548273087, "num_tokens": 3920518.0, "step": 3640 }, { "entropy": 0.07131849471479654, "epoch": 1.952, "grad_norm": 0.2662692070007324, "learning_rate": 8.436360263805418e-06, "loss": 0.068779855966568, "mean_token_accuracy": 0.9793604537844658, "num_tokens": 3941875.0, "step": 3660 }, { "entropy": 0.06605563079938293, "epoch": 1.9626666666666668, "grad_norm": 0.24313360452651978, "learning_rate": 8.283401837978608e-06, "loss": 0.06911961436271667, "mean_token_accuracy": 0.9782892510294914, "num_tokens": 3963512.0, "step": 3680 }, { "entropy": 0.07288907114416361, "epoch": 1.9733333333333334, "grad_norm": 0.32028618454933167, "learning_rate": 8.1313120522186e-06, "loss": 0.07294363975524902, "mean_token_accuracy": 0.9774829164147377, "num_tokens": 3986539.0, "step": 3700 }, { "entropy": 0.06866402635350824, "epoch": 1.984, "grad_norm": 0.24489836394786835, "learning_rate": 7.980110575899445e-06, "loss": 0.06828091144561768, "mean_token_accuracy": 0.978564715385437, "num_tokens": 4008632.0, "step": 3720 }, { "entropy": 0.06863453919067979, "epoch": 1.9946666666666668, "grad_norm": 0.3105578124523163, "learning_rate": 7.829816963512476e-06, "loss": 0.07050868272781372, "mean_token_accuracy": 0.9785391628742218, "num_tokens": 4031130.0, "step": 3740 }, { "entropy": 0.06835599634796381, "epoch": 2.005333333333333, "grad_norm": 0.298072874546051, "learning_rate": 7.680450652137355e-06, "loss": 0.0701375961303711, "mean_token_accuracy": 0.9787931978702545, "num_tokens": 4053091.0, "step": 3760 }, { "entropy": 0.061244970094412564, "epoch": 2.016, "grad_norm": 0.39287611842155457, "learning_rate": 7.532030958928316e-06, "loss": 0.05947454571723938, "mean_token_accuracy": 0.9816959872841835, "num_tokens": 4073488.0, "step": 3780 }, { "entropy": 0.06386837903410196, "epoch": 2.026666666666667, "grad_norm": 0.33378368616104126, "learning_rate": 7.384577078615963e-06, "loss": 0.06699413061141968, "mean_token_accuracy": 0.9805058524012565, "num_tokens": 4094669.0, "step": 3800 }, { "entropy": 0.07299464298412203, "epoch": 2.037333333333333, "grad_norm": 0.48464930057525635, "learning_rate": 7.2381080810248276e-06, "loss": 0.07230452299118043, "mean_token_accuracy": 0.9781083762645721, "num_tokens": 4117086.0, "step": 3820 }, { "entropy": 0.06801890805363656, "epoch": 2.048, "grad_norm": 0.23026078939437866, "learning_rate": 7.092642908607138e-06, "loss": 0.06711475253105163, "mean_token_accuracy": 0.9793458193540573, "num_tokens": 4138872.0, "step": 3840 }, { "entropy": 0.06590869640931488, "epoch": 2.058666666666667, "grad_norm": 0.3303634524345398, "learning_rate": 6.948200373993056e-06, "loss": 0.0715693175792694, "mean_token_accuracy": 0.9784951597452164, "num_tokens": 4160263.0, "step": 3860 }, { "entropy": 0.06702440548688174, "epoch": 2.0693333333333332, "grad_norm": 0.21795713901519775, "learning_rate": 6.804799157557653e-06, "loss": 0.06775381565093994, "mean_token_accuracy": 0.9790131956338882, "num_tokens": 4181574.0, "step": 3880 }, { "entropy": 0.06911803474649787, "epoch": 2.08, "grad_norm": 0.2393951117992401, "learning_rate": 6.662457805005041e-06, "loss": 0.06864354610443116, "mean_token_accuracy": 0.9798421457409858, "num_tokens": 4202497.0, "step": 3900 }, { "entropy": 0.07464540144428611, "epoch": 2.0906666666666665, "grad_norm": 0.24819724261760712, "learning_rate": 6.52119472496994e-06, "loss": 0.07682948112487793, "mean_token_accuracy": 0.9767722800374031, "num_tokens": 4226275.0, "step": 3920 }, { "entropy": 0.06835727458819747, "epoch": 2.1013333333333333, "grad_norm": 0.2139078825712204, "learning_rate": 6.38102818663688e-06, "loss": 0.06501986980438232, "mean_token_accuracy": 0.9806719914078712, "num_tokens": 4247336.0, "step": 3940 }, { "entropy": 0.06610159985721112, "epoch": 2.112, "grad_norm": 0.28183573484420776, "learning_rate": 6.241976317377518e-06, "loss": 0.0680277943611145, "mean_token_accuracy": 0.9787659183144569, "num_tokens": 4269389.0, "step": 3960 }, { "entropy": 0.06353378687053919, "epoch": 2.1226666666666665, "grad_norm": 0.29995930194854736, "learning_rate": 6.1040571004062975e-06, "loss": 0.06427581310272217, "mean_token_accuracy": 0.9798787072300911, "num_tokens": 4290712.0, "step": 3980 }, { "entropy": 0.06582737127318979, "epoch": 2.1333333333333333, "grad_norm": 0.3384758532047272, "learning_rate": 5.967288372454691e-06, "loss": 0.06841517686843872, "mean_token_accuracy": 0.9793238922953605, "num_tokens": 4311731.0, "step": 4000 }, { "entropy": 0.06381206568330526, "epoch": 2.144, "grad_norm": 0.3370026648044586, "learning_rate": 5.83168782146443e-06, "loss": 0.06559972763061524, "mean_token_accuracy": 0.9806227684020996, "num_tokens": 4332416.0, "step": 4020 }, { "entropy": 0.0634533517062664, "epoch": 2.1546666666666665, "grad_norm": 0.20744706690311432, "learning_rate": 5.6972729843e-06, "loss": 0.06608573198318482, "mean_token_accuracy": 0.9805106148123741, "num_tokens": 4353670.0, "step": 4040 }, { "entropy": 0.07064798045903445, "epoch": 2.1653333333333333, "grad_norm": 0.2510891556739807, "learning_rate": 5.564061244480591e-06, "loss": 0.07231830358505249, "mean_token_accuracy": 0.977633598446846, "num_tokens": 4376258.0, "step": 4060 }, { "entropy": 0.07347904201596975, "epoch": 2.176, "grad_norm": 0.25644832849502563, "learning_rate": 5.43206982993198e-06, "loss": 0.07207185626029969, "mean_token_accuracy": 0.9770923808217049, "num_tokens": 4399063.0, "step": 4080 }, { "entropy": 0.07256816513836384, "epoch": 2.1866666666666665, "grad_norm": 0.4217114746570587, "learning_rate": 5.301315810758472e-06, "loss": 0.0714795470237732, "mean_token_accuracy": 0.9770988509058952, "num_tokens": 4422086.0, "step": 4100 }, { "entropy": 0.0676334222778678, "epoch": 2.1973333333333334, "grad_norm": 0.250229150056839, "learning_rate": 5.171816097035251e-06, "loss": 0.06939680576324463, "mean_token_accuracy": 0.9786039367318153, "num_tokens": 4443688.0, "step": 4120 }, { "entropy": 0.06949442513287067, "epoch": 2.208, "grad_norm": 0.3249078392982483, "learning_rate": 5.043587436621462e-06, "loss": 0.06934006810188294, "mean_token_accuracy": 0.978336064517498, "num_tokens": 4466186.0, "step": 4140 }, { "entropy": 0.0705328544601798, "epoch": 2.2186666666666666, "grad_norm": 0.22043611109256744, "learning_rate": 4.916646412994267e-06, "loss": 0.07034485340118408, "mean_token_accuracy": 0.9777373462915421, "num_tokens": 4489519.0, "step": 4160 }, { "entropy": 0.06607724539935589, "epoch": 2.2293333333333334, "grad_norm": 0.29305610060691833, "learning_rate": 4.791009443104112e-06, "loss": 0.06469966173171997, "mean_token_accuracy": 0.981091833114624, "num_tokens": 4510105.0, "step": 4180 }, { "entropy": 0.062390463519841434, "epoch": 2.24, "grad_norm": 0.21871982514858246, "learning_rate": 4.666692775251589e-06, "loss": 0.06328600645065308, "mean_token_accuracy": 0.9811810821294784, "num_tokens": 4530430.0, "step": 4200 }, { "entropy": 0.06391511335968972, "epoch": 2.2506666666666666, "grad_norm": 0.2238311767578125, "learning_rate": 4.543712486986095e-06, "loss": 0.06514235734939575, "mean_token_accuracy": 0.9797263771295548, "num_tokens": 4551438.0, "step": 4220 }, { "entropy": 0.06428639143705368, "epoch": 2.2613333333333334, "grad_norm": 0.34120672941207886, "learning_rate": 4.422084483026534e-06, "loss": 0.06663946509361267, "mean_token_accuracy": 0.9795652627944946, "num_tokens": 4572907.0, "step": 4240 }, { "entropy": 0.06766332956030965, "epoch": 2.2720000000000002, "grad_norm": 0.24613726139068604, "learning_rate": 4.301824493204431e-06, "loss": 0.06992720365524292, "mean_token_accuracy": 0.9785493031144142, "num_tokens": 4595427.0, "step": 4260 }, { "entropy": 0.0695193137973547, "epoch": 2.2826666666666666, "grad_norm": 0.2597343325614929, "learning_rate": 4.182948070429622e-06, "loss": 0.06983534693717956, "mean_token_accuracy": 0.9781228736042976, "num_tokens": 4618066.0, "step": 4280 }, { "entropy": 0.0699890716932714, "epoch": 2.2933333333333334, "grad_norm": 0.24136057496070862, "learning_rate": 4.06547058867883e-06, "loss": 0.07176908254623413, "mean_token_accuracy": 0.9779310017824173, "num_tokens": 4640538.0, "step": 4300 }, { "entropy": 0.06974478457123041, "epoch": 2.304, "grad_norm": 0.2972959578037262, "learning_rate": 3.949407241007393e-06, "loss": 0.06903537511825561, "mean_token_accuracy": 0.9787017688155174, "num_tokens": 4662281.0, "step": 4320 }, { "entropy": 0.06801187871024013, "epoch": 2.3146666666666667, "grad_norm": 0.32835492491722107, "learning_rate": 3.834773037584402e-06, "loss": 0.06735379695892334, "mean_token_accuracy": 0.9794113785028458, "num_tokens": 4683454.0, "step": 4340 }, { "entropy": 0.06790872057899833, "epoch": 2.3253333333333335, "grad_norm": 0.2797514498233795, "learning_rate": 3.7215828037514487e-06, "loss": 0.06811803579330444, "mean_token_accuracy": 0.9787567868828774, "num_tokens": 4705275.0, "step": 4360 }, { "entropy": 0.06285285465419292, "epoch": 2.336, "grad_norm": 0.25980862975120544, "learning_rate": 3.6098511781053244e-06, "loss": 0.0630250632762909, "mean_token_accuracy": 0.9810120955109596, "num_tokens": 4726063.0, "step": 4380 }, { "entropy": 0.06258888244628906, "epoch": 2.3466666666666667, "grad_norm": 0.27584534883499146, "learning_rate": 3.4995926106048345e-06, "loss": 0.0658095121383667, "mean_token_accuracy": 0.9793830320239068, "num_tokens": 4747694.0, "step": 4400 }, { "entropy": 0.06438704924657941, "epoch": 2.3573333333333335, "grad_norm": 0.2829785943031311, "learning_rate": 3.3908213607020253e-06, "loss": 0.06506861448287964, "mean_token_accuracy": 0.9803233638405799, "num_tokens": 4769134.0, "step": 4420 }, { "entropy": 0.06386989299207926, "epoch": 2.368, "grad_norm": 0.2539486885070801, "learning_rate": 3.283551495498059e-06, "loss": 0.06367477774620056, "mean_token_accuracy": 0.9801046311855316, "num_tokens": 4789772.0, "step": 4440 }, { "entropy": 0.06729276357218623, "epoch": 2.3786666666666667, "grad_norm": 0.2120504379272461, "learning_rate": 3.1777968879239432e-06, "loss": 0.06938108205795288, "mean_token_accuracy": 0.9789153173565864, "num_tokens": 4811522.0, "step": 4460 }, { "entropy": 0.06604850795120001, "epoch": 2.389333333333333, "grad_norm": 0.2501501441001892, "learning_rate": 3.0735712149463663e-06, "loss": 0.06410098671913148, "mean_token_accuracy": 0.9799213841557503, "num_tokens": 4831995.0, "step": 4480 }, { "entropy": 0.06737142587080598, "epoch": 2.4, "grad_norm": 0.2193731665611267, "learning_rate": 2.9708879557989272e-06, "loss": 0.06801332831382752, "mean_token_accuracy": 0.9788430154323577, "num_tokens": 4853511.0, "step": 4500 }, { "entropy": 0.06548255272209644, "epoch": 2.4106666666666667, "grad_norm": 0.26090550422668457, "learning_rate": 2.8697603902388596e-06, "loss": 0.06384705305099488, "mean_token_accuracy": 0.9796822845935822, "num_tokens": 4874331.0, "step": 4520 }, { "entropy": 0.06249658772721887, "epoch": 2.421333333333333, "grad_norm": 0.2120533138513565, "learning_rate": 2.770201596829623e-06, "loss": 0.060959136486053465, "mean_token_accuracy": 0.9812754124403, "num_tokens": 4894384.0, "step": 4540 }, { "entropy": 0.06758719896897673, "epoch": 2.432, "grad_norm": 0.2482796013355255, "learning_rate": 2.6722244512494888e-06, "loss": 0.07017409801483154, "mean_token_accuracy": 0.9777197048068047, "num_tokens": 4916199.0, "step": 4560 }, { "entropy": 0.06625777473673225, "epoch": 2.4426666666666668, "grad_norm": 0.2898966372013092, "learning_rate": 2.5758416246263357e-06, "loss": 0.06673334240913391, "mean_token_accuracy": 0.9788759082555771, "num_tokens": 4938235.0, "step": 4580 }, { "entropy": 0.0688164765946567, "epoch": 2.453333333333333, "grad_norm": 0.25803565979003906, "learning_rate": 2.4810655818989563e-06, "loss": 0.07112188339233398, "mean_token_accuracy": 0.9775520697236061, "num_tokens": 4961512.0, "step": 4600 }, { "entropy": 0.06736230682581663, "epoch": 2.464, "grad_norm": 0.3040409982204437, "learning_rate": 2.387908580204986e-06, "loss": 0.06320847868919373, "mean_token_accuracy": 0.9807012856006623, "num_tokens": 4982173.0, "step": 4620 }, { "entropy": 0.0662422583438456, "epoch": 2.474666666666667, "grad_norm": 0.24963408708572388, "learning_rate": 2.296382667295713e-06, "loss": 0.07101342678070069, "mean_token_accuracy": 0.9781320869922638, "num_tokens": 5004438.0, "step": 4640 }, { "entropy": 0.07070345636457205, "epoch": 2.485333333333333, "grad_norm": 0.25193750858306885, "learning_rate": 2.2064996799779764e-06, "loss": 0.07217344641685486, "mean_token_accuracy": 0.9768879726529122, "num_tokens": 5027839.0, "step": 4660 }, { "entropy": 0.0711888742633164, "epoch": 2.496, "grad_norm": 0.28611400723457336, "learning_rate": 2.1182712425833624e-06, "loss": 0.07044810056686401, "mean_token_accuracy": 0.9788151904940605, "num_tokens": 5050202.0, "step": 4680 }, { "entropy": 0.0676958936266601, "epoch": 2.506666666666667, "grad_norm": 0.23146404325962067, "learning_rate": 2.0317087654648312e-06, "loss": 0.06667524576187134, "mean_token_accuracy": 0.9787666156888009, "num_tokens": 5071998.0, "step": 4700 }, { "entropy": 0.07002988457679749, "epoch": 2.517333333333333, "grad_norm": 0.2925092279911041, "learning_rate": 1.946823443521062e-06, "loss": 0.07027275562286377, "mean_token_accuracy": 0.9777396753430366, "num_tokens": 5094139.0, "step": 4720 }, { "entropy": 0.06402101377025246, "epoch": 2.528, "grad_norm": 0.30446258187294006, "learning_rate": 1.8636262547486522e-06, "loss": 0.06188323497772217, "mean_token_accuracy": 0.980588148534298, "num_tokens": 5114657.0, "step": 4740 }, { "entropy": 0.0640190165489912, "epoch": 2.538666666666667, "grad_norm": 0.27199557423591614, "learning_rate": 1.7821279588223399e-06, "loss": 0.06351304054260254, "mean_token_accuracy": 0.9809172645211219, "num_tokens": 5135559.0, "step": 4760 }, { "entropy": 0.06178912734612822, "epoch": 2.5493333333333332, "grad_norm": 0.2936437726020813, "learning_rate": 1.7023390957035056e-06, "loss": 0.06231012344360352, "mean_token_accuracy": 0.9810473620891571, "num_tokens": 5156122.0, "step": 4780 }, { "entropy": 0.06739961085841059, "epoch": 2.56, "grad_norm": 0.29408252239227295, "learning_rate": 1.6242699842770558e-06, "loss": 0.0716172993183136, "mean_token_accuracy": 0.9772106230258941, "num_tokens": 5178867.0, "step": 4800 }, { "entropy": 0.07000719318166375, "epoch": 2.570666666666667, "grad_norm": 0.2808171212673187, "learning_rate": 1.547930721016909e-06, "loss": 0.07183417081832885, "mean_token_accuracy": 0.9768716543912888, "num_tokens": 5202411.0, "step": 4820 }, { "entropy": 0.06676273150369524, "epoch": 2.5813333333333333, "grad_norm": 0.29104703664779663, "learning_rate": 1.4733311786802439e-06, "loss": 0.06565375328063965, "mean_token_accuracy": 0.9793911650776863, "num_tokens": 5223589.0, "step": 4840 }, { "entropy": 0.06493867076933384, "epoch": 2.592, "grad_norm": 0.24625852704048157, "learning_rate": 1.40048100503069e-06, "loss": 0.0669145941734314, "mean_token_accuracy": 0.9792442545294762, "num_tokens": 5245281.0, "step": 4860 }, { "entropy": 0.06505903964862228, "epoch": 2.602666666666667, "grad_norm": 0.25980353355407715, "learning_rate": 1.3293896215905942e-06, "loss": 0.06756677031517029, "mean_token_accuracy": 0.979070121049881, "num_tokens": 5266278.0, "step": 4880 }, { "entropy": 0.06472506942227482, "epoch": 2.6133333333333333, "grad_norm": 0.39341655373573303, "learning_rate": 1.2600662224225734e-06, "loss": 0.06350111961364746, "mean_token_accuracy": 0.9806848973035812, "num_tokens": 5287527.0, "step": 4900 }, { "entropy": 0.0649796743877232, "epoch": 2.624, "grad_norm": 0.22596676647663116, "learning_rate": 1.1925197729404602e-06, "loss": 0.06618022918701172, "mean_token_accuracy": 0.9799415796995163, "num_tokens": 5308641.0, "step": 4920 }, { "entropy": 0.06528121028095484, "epoch": 2.634666666666667, "grad_norm": 0.20817522704601288, "learning_rate": 1.126759008749842e-06, "loss": 0.0666232168674469, "mean_token_accuracy": 0.979514765739441, "num_tokens": 5330297.0, "step": 4940 }, { "entropy": 0.06870688563212753, "epoch": 2.6453333333333333, "grad_norm": 0.27720537781715393, "learning_rate": 1.0627924345182854e-06, "loss": 0.07012331485748291, "mean_token_accuracy": 0.9781979978084564, "num_tokens": 5352281.0, "step": 4960 }, { "entropy": 0.06342040533199907, "epoch": 2.656, "grad_norm": 0.267355352640152, "learning_rate": 1.0006283228754787e-06, "loss": 0.061806786060333255, "mean_token_accuracy": 0.9821794584393502, "num_tokens": 5372463.0, "step": 4980 }, { "entropy": 0.06996868448331953, "epoch": 2.6666666666666665, "grad_norm": 0.25216931104660034, "learning_rate": 9.402747133433299e-07, "loss": 0.07108966112136841, "mean_token_accuracy": 0.977506385743618, "num_tokens": 5395009.0, "step": 5000 }, { "entropy": 0.061977448593825105, "epoch": 2.6773333333333333, "grad_norm": 0.2592537999153137, "learning_rate": 8.817394112962457e-07, "loss": 0.06004307270050049, "mean_token_accuracy": 0.9814708828926086, "num_tokens": 5415204.0, "step": 5020 }, { "entropy": 0.06544211199507118, "epoch": 2.6879999999999997, "grad_norm": 0.27698102593421936, "learning_rate": 8.250299869516908e-07, "loss": 0.06892814636230468, "mean_token_accuracy": 0.9790427267551423, "num_tokens": 5437588.0, "step": 5040 }, { "entropy": 0.06467498484998942, "epoch": 2.6986666666666665, "grad_norm": 0.26750609278678894, "learning_rate": 7.701537743911375e-07, "loss": 0.0653802752494812, "mean_token_accuracy": 0.9803359940648079, "num_tokens": 5458783.0, "step": 5060 }, { "entropy": 0.06604810692369938, "epoch": 2.7093333333333334, "grad_norm": 0.2512940466403961, "learning_rate": 7.171178706115789e-07, "loss": 0.06406107544898987, "mean_token_accuracy": 0.9804125308990479, "num_tokens": 5479810.0, "step": 5080 }, { "entropy": 0.06774483285844327, "epoch": 2.7199999999999998, "grad_norm": 0.2911634147167206, "learning_rate": 6.659291346076824e-07, "loss": 0.07083733677864075, "mean_token_accuracy": 0.9774568140506744, "num_tokens": 5503033.0, "step": 5100 }, { "entropy": 0.06132667139172554, "epoch": 2.7306666666666666, "grad_norm": 0.25360938906669617, "learning_rate": 6.165941864847468e-07, "loss": 0.0613398015499115, "mean_token_accuracy": 0.981691287457943, "num_tokens": 5523046.0, "step": 5120 }, { "entropy": 0.06512014325708151, "epoch": 2.7413333333333334, "grad_norm": 0.2063353806734085, "learning_rate": 5.691194066025295e-07, "loss": 0.06509124636650085, "mean_token_accuracy": 0.9808336913585662, "num_tokens": 5544090.0, "step": 5140 }, { "entropy": 0.06322276135906577, "epoch": 2.752, "grad_norm": 0.22989638149738312, "learning_rate": 5.235109347501027e-07, "loss": 0.062446653842926025, "mean_token_accuracy": 0.9809010848402977, "num_tokens": 5564404.0, "step": 5160 }, { "entropy": 0.0656422447413206, "epoch": 2.7626666666666666, "grad_norm": 0.22744940221309662, "learning_rate": 4.797746693517952e-07, "loss": 0.06802717447280884, "mean_token_accuracy": 0.9793394491076469, "num_tokens": 5585814.0, "step": 5180 }, { "entropy": 0.06916419817134738, "epoch": 2.7733333333333334, "grad_norm": 0.29483240842819214, "learning_rate": 4.379162667043779e-07, "loss": 0.07332996129989625, "mean_token_accuracy": 0.9775100320577621, "num_tokens": 5608497.0, "step": 5200 }, { "entropy": 0.06638877158984542, "epoch": 2.784, "grad_norm": 0.3650195598602295, "learning_rate": 3.9794114024554906e-07, "loss": 0.06668092608451844, "mean_token_accuracy": 0.980099868774414, "num_tokens": 5629582.0, "step": 5220 }, { "entropy": 0.06656348751857877, "epoch": 2.7946666666666666, "grad_norm": 0.31520113348960876, "learning_rate": 3.5985445985381727e-07, "loss": 0.06691439151763916, "mean_token_accuracy": 0.9794167369604111, "num_tokens": 5650897.0, "step": 5240 }, { "entropy": 0.06590501200407743, "epoch": 2.8053333333333335, "grad_norm": 0.3223532736301422, "learning_rate": 3.2366115117991146e-07, "loss": 0.06653072834014892, "mean_token_accuracy": 0.9792607888579369, "num_tokens": 5673009.0, "step": 5260 }, { "entropy": 0.06469663931056857, "epoch": 2.816, "grad_norm": 0.27690476179122925, "learning_rate": 2.893658950097422e-07, "loss": 0.06444936990737915, "mean_token_accuracy": 0.9817123860120773, "num_tokens": 5693845.0, "step": 5280 }, { "entropy": 0.06907640630379319, "epoch": 2.8266666666666667, "grad_norm": 0.2766023576259613, "learning_rate": 2.569731266590608e-07, "loss": 0.07101809978485107, "mean_token_accuracy": 0.9769211024045944, "num_tokens": 5716621.0, "step": 5300 }, { "entropy": 0.06807576529681683, "epoch": 2.8373333333333335, "grad_norm": 0.214943990111351, "learning_rate": 2.2648703539984161e-07, "loss": 0.06807198524475097, "mean_token_accuracy": 0.9792288944125176, "num_tokens": 5737713.0, "step": 5320 }, { "entropy": 0.06559845563024283, "epoch": 2.848, "grad_norm": 0.24327735602855682, "learning_rate": 1.9791156391850695e-07, "loss": 0.06800661087036133, "mean_token_accuracy": 0.9790630683302879, "num_tokens": 5759702.0, "step": 5340 }, { "entropy": 0.06611165096983314, "epoch": 2.8586666666666667, "grad_norm": 0.23079447448253632, "learning_rate": 1.7125040780601175e-07, "loss": 0.06424795985221862, "mean_token_accuracy": 0.9802783578634262, "num_tokens": 5780385.0, "step": 5360 }, { "entropy": 0.06495644729584456, "epoch": 2.8693333333333335, "grad_norm": 0.23585422337055206, "learning_rate": 1.4650701507992582e-07, "loss": 0.06308045387268066, "mean_token_accuracy": 0.9818204194307327, "num_tokens": 5800602.0, "step": 5380 }, { "entropy": 0.06460589049383998, "epoch": 2.88, "grad_norm": 0.27924907207489014, "learning_rate": 1.2368458573848717e-07, "loss": 0.06371138095855713, "mean_token_accuracy": 0.9809283286333084, "num_tokens": 5821016.0, "step": 5400 }, { "entropy": 0.0652251210063696, "epoch": 2.8906666666666667, "grad_norm": 0.21342748403549194, "learning_rate": 1.0278607134676987e-07, "loss": 0.06635769009590149, "mean_token_accuracy": 0.979735954105854, "num_tokens": 5841929.0, "step": 5420 }, { "entropy": 0.0619895207695663, "epoch": 2.9013333333333335, "grad_norm": 0.23523399233818054, "learning_rate": 8.381417465495922e-08, "loss": 0.06180503368377686, "mean_token_accuracy": 0.9817696720361709, "num_tokens": 5862268.0, "step": 5440 }, { "entropy": 0.06805047616362572, "epoch": 2.912, "grad_norm": 0.3232709765434265, "learning_rate": 6.677134924881978e-08, "loss": 0.06934788227081298, "mean_token_accuracy": 0.9782540738582611, "num_tokens": 5883972.0, "step": 5460 }, { "entropy": 0.07081099823117257, "epoch": 2.9226666666666667, "grad_norm": 0.24873663485050201, "learning_rate": 5.165979923236752e-08, "loss": 0.07326069474220276, "mean_token_accuracy": 0.977522186934948, "num_tokens": 5906392.0, "step": 5480 }, { "entropy": 0.06697621447965503, "epoch": 2.9333333333333336, "grad_norm": 0.2500160336494446, "learning_rate": 3.848147894282783e-08, "loss": 0.06656785011291504, "mean_token_accuracy": 0.9801760748028755, "num_tokens": 5927809.0, "step": 5500 }, { "entropy": 0.06844843151047826, "epoch": 2.944, "grad_norm": 0.2815072536468506, "learning_rate": 2.7238092697884353e-08, "loss": 0.0686243712902069, "mean_token_accuracy": 0.9783571302890778, "num_tokens": 5950680.0, "step": 5520 }, { "entropy": 0.06373694511130452, "epoch": 2.9546666666666668, "grad_norm": 0.25896361470222473, "learning_rate": 1.7931094575260322e-08, "loss": 0.06541070938110352, "mean_token_accuracy": 0.9797068655490875, "num_tokens": 5972323.0, "step": 5540 }, { "entropy": 0.06856830064207316, "epoch": 2.9653333333333336, "grad_norm": 0.30956923961639404, "learning_rate": 1.056168822467396e-08, "loss": 0.06829805374145508, "mean_token_accuracy": 0.9796166166663169, "num_tokens": 5993505.0, "step": 5560 }, { "entropy": 0.06814236659556627, "epoch": 2.976, "grad_norm": 0.22563952207565308, "learning_rate": 5.1308267121680244e-09, "loss": 0.06708756685256959, "mean_token_accuracy": 0.979302079975605, "num_tokens": 6015143.0, "step": 5580 }, { "entropy": 0.06459062686190009, "epoch": 2.986666666666667, "grad_norm": 0.2697313725948334, "learning_rate": 1.639212396850054e-09, "loss": 0.0641595482826233, "mean_token_accuracy": 0.980322690308094, "num_tokens": 6036421.0, "step": 5600 }, { "entropy": 0.06587992180138827, "epoch": 2.997333333333333, "grad_norm": 0.25788185000419617, "learning_rate": 8.729684006669735e-11, "loss": 0.06761438250541688, "mean_token_accuracy": 0.9793855547904968, "num_tokens": 6057835.0, "step": 5620 } ], "logging_steps": 20, "max_steps": 5625, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.016631644913664e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }