Files
SmolLM-135M-Tarot-Zodiac-Re…/last-checkpoint/trainer_state.json

2845 lines
83 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.997333333333333,
"eval_steps": 500,
"global_step": 5620,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.3199639558792113,
"epoch": 0.010666666666666666,
"grad_norm": 13.384757041931152,
"learning_rate": 5.7000000000000005e-06,
"loss": 3.7517059326171873,
"mean_token_accuracy": 0.5159296914935112,
"num_tokens": 20385.0,
"step": 20
},
{
"entropy": 2.2831633567810057,
"epoch": 0.021333333333333333,
"grad_norm": 6.131666660308838,
"learning_rate": 1.1700000000000001e-05,
"loss": 2.7274402618408202,
"mean_token_accuracy": 0.6040167711675167,
"num_tokens": 41653.0,
"step": 40
},
{
"entropy": 1.6687136992812157,
"epoch": 0.032,
"grad_norm": 3.8555829524993896,
"learning_rate": 1.77e-05,
"loss": 1.590993309020996,
"mean_token_accuracy": 0.7407817155122757,
"num_tokens": 64225.0,
"step": 60
},
{
"entropy": 0.8817660577595234,
"epoch": 0.042666666666666665,
"grad_norm": 1.0237234830856323,
"learning_rate": 2.37e-05,
"loss": 0.7373588562011719,
"mean_token_accuracy": 0.8729878857731819,
"num_tokens": 86424.0,
"step": 80
},
{
"entropy": 0.33704922115430236,
"epoch": 0.05333333333333334,
"grad_norm": 1.290586233139038,
"learning_rate": 2.97e-05,
"loss": 0.2778470993041992,
"mean_token_accuracy": 0.9500011757016182,
"num_tokens": 109633.0,
"step": 100
},
{
"entropy": 0.18128704172559082,
"epoch": 0.064,
"grad_norm": 1.3026446104049683,
"learning_rate": 2.999912461435259e-05,
"loss": 0.15202982425689698,
"mean_token_accuracy": 0.9685896590352059,
"num_tokens": 131798.0,
"step": 120
},
{
"entropy": 0.11775432089343667,
"epoch": 0.07466666666666667,
"grad_norm": 0.6625315546989441,
"learning_rate": 2.999631185607745e-05,
"loss": 0.09883086681365967,
"mean_token_accuracy": 0.9783779725432395,
"num_tokens": 153213.0,
"step": 140
},
{
"entropy": 0.10737935788929462,
"epoch": 0.08533333333333333,
"grad_norm": 0.6038058996200562,
"learning_rate": 2.9991559664026723e-05,
"loss": 0.09105062484741211,
"mean_token_accuracy": 0.9772884234786033,
"num_tokens": 175096.0,
"step": 160
},
{
"entropy": 0.09613236370496452,
"epoch": 0.096,
"grad_norm": 0.48909515142440796,
"learning_rate": 2.998486865278898e-05,
"loss": 0.08481158018112182,
"mean_token_accuracy": 0.9782793119549751,
"num_tokens": 196997.0,
"step": 180
},
{
"entropy": 0.08185080708935857,
"epoch": 0.10666666666666667,
"grad_norm": 0.6273307800292969,
"learning_rate": 2.9976239687695204e-05,
"loss": 0.07777262926101684,
"mean_token_accuracy": 0.9786890134215355,
"num_tokens": 218874.0,
"step": 200
},
{
"entropy": 0.09334154520183802,
"epoch": 0.11733333333333333,
"grad_norm": 0.4166223406791687,
"learning_rate": 2.9965673884706868e-05,
"loss": 0.08573432564735413,
"mean_token_accuracy": 0.9767304107546806,
"num_tokens": 241605.0,
"step": 220
},
{
"entropy": 0.08369456762447954,
"epoch": 0.128,
"grad_norm": 0.40699025988578796,
"learning_rate": 2.9953172610271622e-05,
"loss": 0.07644501924514771,
"mean_token_accuracy": 0.9783323392271995,
"num_tokens": 263296.0,
"step": 240
},
{
"entropy": 0.070164034049958,
"epoch": 0.13866666666666666,
"grad_norm": 0.48113104701042175,
"learning_rate": 2.9938737481146593e-05,
"loss": 0.06861301660537719,
"mean_token_accuracy": 0.9820019453763962,
"num_tokens": 283202.0,
"step": 260
},
{
"entropy": 0.07659044032916426,
"epoch": 0.14933333333333335,
"grad_norm": 0.40626060962677,
"learning_rate": 2.9922370364189247e-05,
"loss": 0.07213873863220215,
"mean_token_accuracy": 0.9799231603741646,
"num_tokens": 303974.0,
"step": 280
},
{
"entropy": 0.07639030702412128,
"epoch": 0.16,
"grad_norm": 0.43795546889305115,
"learning_rate": 2.990407337611601e-05,
"loss": 0.07973278760910034,
"mean_token_accuracy": 0.9775013774633408,
"num_tokens": 326032.0,
"step": 300
},
{
"entropy": 0.07721547149121762,
"epoch": 0.17066666666666666,
"grad_norm": 0.3847689926624298,
"learning_rate": 2.988384888322847e-05,
"loss": 0.07336270809173584,
"mean_token_accuracy": 0.9787119507789612,
"num_tokens": 348471.0,
"step": 320
},
{
"entropy": 0.07721726167947054,
"epoch": 0.18133333333333335,
"grad_norm": 0.27838024497032166,
"learning_rate": 2.9861699501107378e-05,
"loss": 0.07494103908538818,
"mean_token_accuracy": 0.9785683915019036,
"num_tokens": 369782.0,
"step": 340
},
{
"entropy": 0.07658242103643716,
"epoch": 0.192,
"grad_norm": 0.31607189774513245,
"learning_rate": 2.983762809427437e-05,
"loss": 0.07525045275688172,
"mean_token_accuracy": 0.9776499375700951,
"num_tokens": 392696.0,
"step": 360
},
{
"entropy": 0.075563720241189,
"epoch": 0.20266666666666666,
"grad_norm": 0.3598628640174866,
"learning_rate": 2.981163777582151e-05,
"loss": 0.07243417501449585,
"mean_token_accuracy": 0.9788009360432625,
"num_tokens": 414821.0,
"step": 380
},
{
"entropy": 0.07607982028275728,
"epoch": 0.21333333333333335,
"grad_norm": 0.40936508774757385,
"learning_rate": 2.9783731907008686e-05,
"loss": 0.07915560007095337,
"mean_token_accuracy": 0.9773870885372162,
"num_tokens": 438146.0,
"step": 400
},
{
"entropy": 0.07262871153652668,
"epoch": 0.224,
"grad_norm": 0.381472647190094,
"learning_rate": 2.9753914096828898e-05,
"loss": 0.06799554228782653,
"mean_token_accuracy": 0.9803747221827507,
"num_tokens": 458624.0,
"step": 420
},
{
"entropy": 0.08185875937342643,
"epoch": 0.23466666666666666,
"grad_norm": 0.5101166367530823,
"learning_rate": 2.9722188201541517e-05,
"loss": 0.08290064930915833,
"mean_token_accuracy": 0.9758498474955559,
"num_tokens": 481486.0,
"step": 440
},
{
"entropy": 0.0798154235817492,
"epoch": 0.24533333333333332,
"grad_norm": 0.46328306198120117,
"learning_rate": 2.968855832417357e-05,
"loss": 0.07726043462753296,
"mean_token_accuracy": 0.9774591788649559,
"num_tokens": 504517.0,
"step": 460
},
{
"entropy": 0.0712804809678346,
"epoch": 0.256,
"grad_norm": 0.34927302598953247,
"learning_rate": 2.965302881398911e-05,
"loss": 0.0709686040878296,
"mean_token_accuracy": 0.9796265155076981,
"num_tokens": 525475.0,
"step": 480
},
{
"entropy": 0.06547207403928042,
"epoch": 0.26666666666666666,
"grad_norm": 0.6727742552757263,
"learning_rate": 2.9615604265926728e-05,
"loss": 0.0662114143371582,
"mean_token_accuracy": 0.9803611278533936,
"num_tokens": 545600.0,
"step": 500
},
{
"entropy": 0.06710066087543964,
"epoch": 0.2773333333333333,
"grad_norm": 0.45624563097953796,
"learning_rate": 2.957628952000531e-05,
"loss": 0.06518577337265015,
"mean_token_accuracy": 0.9814524441957474,
"num_tokens": 565706.0,
"step": 520
},
{
"entropy": 0.0751929541118443,
"epoch": 0.288,
"grad_norm": 0.3284471929073334,
"learning_rate": 2.9535089660698077e-05,
"loss": 0.07515062689781189,
"mean_token_accuracy": 0.9783789336681366,
"num_tokens": 587393.0,
"step": 540
},
{
"entropy": 0.07246321747079491,
"epoch": 0.2986666666666667,
"grad_norm": 0.3948511779308319,
"learning_rate": 2.9492010016275036e-05,
"loss": 0.07291712760925292,
"mean_token_accuracy": 0.9785362645983696,
"num_tokens": 609171.0,
"step": 560
},
{
"entropy": 0.06350514343939721,
"epoch": 0.30933333333333335,
"grad_norm": 0.314139723777771,
"learning_rate": 2.944705615811389e-05,
"loss": 0.06677749156951904,
"mean_token_accuracy": 0.9803237706422806,
"num_tokens": 630239.0,
"step": 580
},
{
"entropy": 0.06738578667864203,
"epoch": 0.32,
"grad_norm": 0.36207115650177,
"learning_rate": 2.9400233899979493e-05,
"loss": 0.06742758750915527,
"mean_token_accuracy": 0.9798387750983238,
"num_tokens": 651094.0,
"step": 600
},
{
"entropy": 0.07454993184655904,
"epoch": 0.33066666666666666,
"grad_norm": 0.3180656433105469,
"learning_rate": 2.9351549297271985e-05,
"loss": 0.07321251630783081,
"mean_token_accuracy": 0.9780681982636452,
"num_tokens": 673562.0,
"step": 620
},
{
"entropy": 0.07280182931572199,
"epoch": 0.3413333333333333,
"grad_norm": 0.32510796189308167,
"learning_rate": 2.9301008646243653e-05,
"loss": 0.07445473074913025,
"mean_token_accuracy": 0.9777527928352356,
"num_tokens": 695144.0,
"step": 640
},
{
"entropy": 0.06629417887888849,
"epoch": 0.352,
"grad_norm": 0.3238341808319092,
"learning_rate": 2.9248618483184658e-05,
"loss": 0.06477652788162232,
"mean_token_accuracy": 0.9803259864449501,
"num_tokens": 715736.0,
"step": 660
},
{
"entropy": 0.07434157487004996,
"epoch": 0.3626666666666667,
"grad_norm": 0.4881466329097748,
"learning_rate": 2.9194385583577713e-05,
"loss": 0.074578857421875,
"mean_token_accuracy": 0.978272306919098,
"num_tokens": 738223.0,
"step": 680
},
{
"entropy": 0.06839693682268262,
"epoch": 0.37333333333333335,
"grad_norm": 0.28420260548591614,
"learning_rate": 2.913831696122183e-05,
"loss": 0.07069446444511414,
"mean_token_accuracy": 0.9783747613430023,
"num_tokens": 759757.0,
"step": 700
},
{
"entropy": 0.0676080210134387,
"epoch": 0.384,
"grad_norm": 0.39809709787368774,
"learning_rate": 2.9080419867325237e-05,
"loss": 0.06743242740631103,
"mean_token_accuracy": 0.9805570602416992,
"num_tokens": 780468.0,
"step": 720
},
{
"entropy": 0.07527220472693444,
"epoch": 0.39466666666666667,
"grad_norm": 0.35423487424850464,
"learning_rate": 2.9020701789567604e-05,
"loss": 0.0771526575088501,
"mean_token_accuracy": 0.9762488156557083,
"num_tokens": 802965.0,
"step": 740
},
{
"entropy": 0.0742669789120555,
"epoch": 0.4053333333333333,
"grad_norm": 0.3001997172832489,
"learning_rate": 2.895917045113168e-05,
"loss": 0.07353838682174682,
"mean_token_accuracy": 0.9768529623746872,
"num_tokens": 824952.0,
"step": 760
},
{
"entropy": 0.07476197639480234,
"epoch": 0.416,
"grad_norm": 0.477760374546051,
"learning_rate": 2.8895833809704472e-05,
"loss": 0.075287127494812,
"mean_token_accuracy": 0.9776960402727127,
"num_tokens": 847335.0,
"step": 780
},
{
"entropy": 0.07617697194218635,
"epoch": 0.4266666666666667,
"grad_norm": 0.257163941860199,
"learning_rate": 2.88307000564481e-05,
"loss": 0.07502832412719726,
"mean_token_accuracy": 0.977412973344326,
"num_tokens": 869694.0,
"step": 800
},
{
"entropy": 0.06724974531680346,
"epoch": 0.43733333333333335,
"grad_norm": 0.2475440800189972,
"learning_rate": 2.8763777614940456e-05,
"loss": 0.06770724058151245,
"mean_token_accuracy": 0.9807002753019333,
"num_tokens": 890247.0,
"step": 820
},
{
"entropy": 0.07065033931285143,
"epoch": 0.448,
"grad_norm": 0.28949040174484253,
"learning_rate": 2.8695075140085806e-05,
"loss": 0.0740054190158844,
"mean_token_accuracy": 0.9777054205536843,
"num_tokens": 912437.0,
"step": 840
},
{
"entropy": 0.07398124393075704,
"epoch": 0.45866666666666667,
"grad_norm": 0.2573949694633484,
"learning_rate": 2.862460151699546e-05,
"loss": 0.07121715545654297,
"mean_token_accuracy": 0.9787738516926765,
"num_tokens": 933823.0,
"step": 860
},
{
"entropy": 0.06237205946817994,
"epoch": 0.4693333333333333,
"grad_norm": 0.2926589250564575,
"learning_rate": 2.8552365859838705e-05,
"loss": 0.06375741958618164,
"mean_token_accuracy": 0.981339943408966,
"num_tokens": 954214.0,
"step": 880
},
{
"entropy": 0.06579331294633448,
"epoch": 0.48,
"grad_norm": 0.2862912714481354,
"learning_rate": 2.8478377510664084e-05,
"loss": 0.06657766103744507,
"mean_token_accuracy": 0.9801932483911514,
"num_tokens": 975338.0,
"step": 900
},
{
"entropy": 0.06900884290225803,
"epoch": 0.49066666666666664,
"grad_norm": 0.2465200126171112,
"learning_rate": 2.8402646038191212e-05,
"loss": 0.07071024179458618,
"mean_token_accuracy": 0.9791238903999329,
"num_tokens": 996945.0,
"step": 920
},
{
"entropy": 0.07488874141126871,
"epoch": 0.5013333333333333,
"grad_norm": 0.3744136393070221,
"learning_rate": 2.832518123657328e-05,
"loss": 0.07590996623039245,
"mean_token_accuracy": 0.9782673969864846,
"num_tokens": 1019406.0,
"step": 940
},
{
"entropy": 0.06512500997632742,
"epoch": 0.512,
"grad_norm": 0.354690819978714,
"learning_rate": 2.824599312413039e-05,
"loss": 0.06666624546051025,
"mean_token_accuracy": 0.9810455769300461,
"num_tokens": 1040080.0,
"step": 960
},
{
"entropy": 0.07058156430721282,
"epoch": 0.5226666666666666,
"grad_norm": 0.2862028181552887,
"learning_rate": 2.816509194205394e-05,
"loss": 0.07034226655960082,
"mean_token_accuracy": 0.9796382382512092,
"num_tokens": 1061056.0,
"step": 980
},
{
"entropy": 0.06635954724624753,
"epoch": 0.5333333333333333,
"grad_norm": 0.3258682191371918,
"learning_rate": 2.808248815308214e-05,
"loss": 0.06933177709579467,
"mean_token_accuracy": 0.979850122332573,
"num_tokens": 1082431.0,
"step": 1000
},
{
"entropy": 0.07130869440734386,
"epoch": 0.544,
"grad_norm": 0.4001695215702057,
"learning_rate": 2.7998192440146885e-05,
"loss": 0.07018501758575439,
"mean_token_accuracy": 0.9788232401013375,
"num_tokens": 1103056.0,
"step": 1020
},
{
"entropy": 0.06629347717389464,
"epoch": 0.5546666666666666,
"grad_norm": 0.3068975806236267,
"learning_rate": 2.7912215704992178e-05,
"loss": 0.06562011241912842,
"mean_token_accuracy": 0.9801233530044555,
"num_tokens": 1123629.0,
"step": 1040
},
{
"entropy": 0.0669340806081891,
"epoch": 0.5653333333333334,
"grad_norm": 0.291361927986145,
"learning_rate": 2.7824569066764228e-05,
"loss": 0.06813285946846008,
"mean_token_accuracy": 0.9795377850532532,
"num_tokens": 1145205.0,
"step": 1060
},
{
"entropy": 0.06657159719616175,
"epoch": 0.576,
"grad_norm": 0.4103650748729706,
"learning_rate": 2.7735263860573427e-05,
"loss": 0.0706522822380066,
"mean_token_accuracy": 0.9789624258875846,
"num_tokens": 1166152.0,
"step": 1080
},
{
"entropy": 0.06565243299119175,
"epoch": 0.5866666666666667,
"grad_norm": 0.19713713228702545,
"learning_rate": 2.7644311636028443e-05,
"loss": 0.0657187283039093,
"mean_token_accuracy": 0.9809520095586777,
"num_tokens": 1186408.0,
"step": 1100
},
{
"entropy": 0.06613961681723594,
"epoch": 0.5973333333333334,
"grad_norm": 0.38389384746551514,
"learning_rate": 2.7551724155742496e-05,
"loss": 0.06793384552001953,
"mean_token_accuracy": 0.9800930395722389,
"num_tokens": 1207073.0,
"step": 1120
},
{
"entropy": 0.06301267836242914,
"epoch": 0.608,
"grad_norm": 0.28483763337135315,
"learning_rate": 2.7457513393812165e-05,
"loss": 0.06698591113090516,
"mean_token_accuracy": 0.9796709790825844,
"num_tokens": 1227985.0,
"step": 1140
},
{
"entropy": 0.06924524456262589,
"epoch": 0.6186666666666667,
"grad_norm": 0.3032520115375519,
"learning_rate": 2.7361691534268794e-05,
"loss": 0.0688162088394165,
"mean_token_accuracy": 0.9792484521865845,
"num_tokens": 1249420.0,
"step": 1160
},
{
"entropy": 0.06591361574828625,
"epoch": 0.6293333333333333,
"grad_norm": 0.2796316146850586,
"learning_rate": 2.726427096950277e-05,
"loss": 0.06471214890480041,
"mean_token_accuracy": 0.9802895054221153,
"num_tokens": 1269803.0,
"step": 1180
},
{
"entropy": 0.06655512368306518,
"epoch": 0.64,
"grad_norm": 0.334458589553833,
"learning_rate": 2.7165264298660843e-05,
"loss": 0.0680499792098999,
"mean_token_accuracy": 0.9798945024609566,
"num_tokens": 1290820.0,
"step": 1200
},
{
"entropy": 0.07104279901832342,
"epoch": 0.6506666666666666,
"grad_norm": 0.2985312044620514,
"learning_rate": 2.7064684326016705e-05,
"loss": 0.07158678770065308,
"mean_token_accuracy": 0.9790138527750969,
"num_tokens": 1312256.0,
"step": 1220
},
{
"entropy": 0.07178505323827267,
"epoch": 0.6613333333333333,
"grad_norm": 0.2647643983364105,
"learning_rate": 2.696254405931506e-05,
"loss": 0.07087129950523377,
"mean_token_accuracy": 0.9788700684905052,
"num_tokens": 1333659.0,
"step": 1240
},
{
"entropy": 0.07248318092897535,
"epoch": 0.672,
"grad_norm": 0.33957013487815857,
"learning_rate": 2.685885670808935e-05,
"loss": 0.07625460624694824,
"mean_token_accuracy": 0.9776020765304565,
"num_tokens": 1356166.0,
"step": 1260
},
{
"entropy": 0.06933322567492724,
"epoch": 0.6826666666666666,
"grad_norm": 0.3401638865470886,
"learning_rate": 2.6753635681953432e-05,
"loss": 0.07209213972091674,
"mean_token_accuracy": 0.979287999868393,
"num_tokens": 1377248.0,
"step": 1280
},
{
"entropy": 0.07241465076804161,
"epoch": 0.6933333333333334,
"grad_norm": 0.3512662351131439,
"learning_rate": 2.66468945888673e-05,
"loss": 0.07179180383682252,
"mean_token_accuracy": 0.9785149216651916,
"num_tokens": 1399215.0,
"step": 1300
},
{
"entropy": 0.06668442655354738,
"epoch": 0.704,
"grad_norm": 0.31074854731559753,
"learning_rate": 2.653864723337725e-05,
"loss": 0.06842232942581176,
"mean_token_accuracy": 0.9793056011199951,
"num_tokens": 1421156.0,
"step": 1320
},
{
"entropy": 0.07508801557123661,
"epoch": 0.7146666666666667,
"grad_norm": 0.23781085014343262,
"learning_rate": 2.6428907614830547e-05,
"loss": 0.07381449937820435,
"mean_token_accuracy": 0.9774842232465744,
"num_tokens": 1444107.0,
"step": 1340
},
{
"entropy": 0.07022066600620747,
"epoch": 0.7253333333333334,
"grad_norm": 0.2902912497520447,
"learning_rate": 2.631768992556493e-05,
"loss": 0.07421112656593323,
"mean_token_accuracy": 0.9773566707968712,
"num_tokens": 1466646.0,
"step": 1360
},
{
"entropy": 0.07529082838445902,
"epoch": 0.736,
"grad_norm": 0.29716333746910095,
"learning_rate": 2.6205008549073156e-05,
"loss": 0.07513617277145386,
"mean_token_accuracy": 0.9776451155543328,
"num_tokens": 1489236.0,
"step": 1380
},
{
"entropy": 0.07013567788526416,
"epoch": 0.7466666666666667,
"grad_norm": 0.32034385204315186,
"learning_rate": 2.6090878058142826e-05,
"loss": 0.07192614078521728,
"mean_token_accuracy": 0.9784543365240097,
"num_tokens": 1511165.0,
"step": 1400
},
{
"entropy": 0.06659635296091437,
"epoch": 0.7573333333333333,
"grad_norm": 0.21232427656650543,
"learning_rate": 2.5975313212971717e-05,
"loss": 0.06635284423828125,
"mean_token_accuracy": 0.9803870663046836,
"num_tokens": 1532360.0,
"step": 1420
},
{
"entropy": 0.07205540081486106,
"epoch": 0.768,
"grad_norm": 0.24671520292758942,
"learning_rate": 2.585832895925889e-05,
"loss": 0.07270323038101197,
"mean_token_accuracy": 0.9785439759492874,
"num_tokens": 1554448.0,
"step": 1440
},
{
"entropy": 0.06918675852939486,
"epoch": 0.7786666666666666,
"grad_norm": 0.2514943480491638,
"learning_rate": 2.5739940426271794e-05,
"loss": 0.06965571045875549,
"mean_token_accuracy": 0.9788892433047295,
"num_tokens": 1576245.0,
"step": 1460
},
{
"entropy": 0.06469840593636036,
"epoch": 0.7893333333333333,
"grad_norm": 0.3494434952735901,
"learning_rate": 2.562016292488965e-05,
"loss": 0.06652198433876037,
"mean_token_accuracy": 0.9809101298451424,
"num_tokens": 1596485.0,
"step": 1480
},
{
"entropy": 0.07068701386451721,
"epoch": 0.8,
"grad_norm": 0.281946063041687,
"learning_rate": 2.5499011945623314e-05,
"loss": 0.07348206043243408,
"mean_token_accuracy": 0.9781546071171761,
"num_tokens": 1618200.0,
"step": 1500
},
{
"entropy": 0.06995291169732809,
"epoch": 0.8106666666666666,
"grad_norm": 0.23206466436386108,
"learning_rate": 2.537650315661196e-05,
"loss": 0.06693890690803528,
"mean_token_accuracy": 0.9801010102033615,
"num_tokens": 1639174.0,
"step": 1520
},
{
"entropy": 0.06840123003348708,
"epoch": 0.8213333333333334,
"grad_norm": 0.3676995635032654,
"learning_rate": 2.5252652401596733e-05,
"loss": 0.07000104188919068,
"mean_token_accuracy": 0.9784165650606156,
"num_tokens": 1661359.0,
"step": 1540
},
{
"entropy": 0.0646398707292974,
"epoch": 0.832,
"grad_norm": 0.22217804193496704,
"learning_rate": 2.512747569787173e-05,
"loss": 0.06517070531845093,
"mean_token_accuracy": 0.9804639294743538,
"num_tokens": 1682342.0,
"step": 1560
},
{
"entropy": 0.07203069580718875,
"epoch": 0.8426666666666667,
"grad_norm": 0.33636361360549927,
"learning_rate": 2.5000989234212538e-05,
"loss": 0.0767048716545105,
"mean_token_accuracy": 0.9769723698496818,
"num_tokens": 1705410.0,
"step": 1580
},
{
"entropy": 0.07144555728882551,
"epoch": 0.8533333333333334,
"grad_norm": 0.41735950112342834,
"learning_rate": 2.4873209368782542e-05,
"loss": 0.07214229702949523,
"mean_token_accuracy": 0.9783873930573463,
"num_tokens": 1727533.0,
"step": 1600
},
{
"entropy": 0.07258805707097053,
"epoch": 0.864,
"grad_norm": 0.2509184777736664,
"learning_rate": 2.474415262701742e-05,
"loss": 0.07374660968780518,
"mean_token_accuracy": 0.9784314125776291,
"num_tokens": 1749324.0,
"step": 1620
},
{
"entropy": 0.06801199689507484,
"epoch": 0.8746666666666667,
"grad_norm": 0.2840649485588074,
"learning_rate": 2.4613835699487926e-05,
"loss": 0.06742731928825378,
"mean_token_accuracy": 0.9799756482243538,
"num_tokens": 1770154.0,
"step": 1640
},
{
"entropy": 0.06611601263284683,
"epoch": 0.8853333333333333,
"grad_norm": 0.32055601477622986,
"learning_rate": 2.4482275439741318e-05,
"loss": 0.06912029981613159,
"mean_token_accuracy": 0.9791274040937423,
"num_tokens": 1791563.0,
"step": 1660
},
{
"entropy": 0.07015209766104817,
"epoch": 0.896,
"grad_norm": 0.322442889213562,
"learning_rate": 2.4349488862121777e-05,
"loss": 0.0710118293762207,
"mean_token_accuracy": 0.9784337431192398,
"num_tokens": 1814153.0,
"step": 1680
},
{
"entropy": 0.07105656629428267,
"epoch": 0.9066666666666666,
"grad_norm": 0.33281370997428894,
"learning_rate": 2.421549313956996e-05,
"loss": 0.07393972873687744,
"mean_token_accuracy": 0.9770426079630852,
"num_tokens": 1836011.0,
"step": 1700
},
{
"entropy": 0.06153039713390172,
"epoch": 0.9173333333333333,
"grad_norm": 0.34345221519470215,
"learning_rate": 2.4080305601402077e-05,
"loss": 0.06438595056533813,
"mean_token_accuracy": 0.9811754852533341,
"num_tokens": 1856327.0,
"step": 1720
},
{
"entropy": 0.06947178347036242,
"epoch": 0.928,
"grad_norm": 0.23315641283988953,
"learning_rate": 2.3943943731068726e-05,
"loss": 0.06981109380722046,
"mean_token_accuracy": 0.9784324377775192,
"num_tokens": 1878263.0,
"step": 1740
},
{
"entropy": 0.06802130006253719,
"epoch": 0.9386666666666666,
"grad_norm": 0.2618308365345001,
"learning_rate": 2.3806425163893823e-05,
"loss": 0.06859763860702514,
"mean_token_accuracy": 0.9791776061058044,
"num_tokens": 1899636.0,
"step": 1760
},
{
"entropy": 0.06973028304055333,
"epoch": 0.9493333333333334,
"grad_norm": 0.24618478119373322,
"learning_rate": 2.366776768479384e-05,
"loss": 0.07086095809936524,
"mean_token_accuracy": 0.9786002859473228,
"num_tokens": 1921047.0,
"step": 1780
},
{
"entropy": 0.06561295241117478,
"epoch": 0.96,
"grad_norm": 0.2758350670337677,
"learning_rate": 2.352798922597778e-05,
"loss": 0.06786344051361085,
"mean_token_accuracy": 0.9793999254703522,
"num_tokens": 1942332.0,
"step": 1800
},
{
"entropy": 0.064028827752918,
"epoch": 0.9706666666666667,
"grad_norm": 0.39498090744018555,
"learning_rate": 2.3387107864627988e-05,
"loss": 0.06252858638763428,
"mean_token_accuracy": 0.9808908835053444,
"num_tokens": 1962893.0,
"step": 1820
},
{
"entropy": 0.05734303398057818,
"epoch": 0.9813333333333333,
"grad_norm": 0.39145660400390625,
"learning_rate": 2.324514182056233e-05,
"loss": 0.06022765040397644,
"mean_token_accuracy": 0.9816997528076172,
"num_tokens": 1982973.0,
"step": 1840
},
{
"entropy": 0.0701704291626811,
"epoch": 0.992,
"grad_norm": 0.23364675045013428,
"learning_rate": 2.310210945387783e-05,
"loss": 0.07281829714775086,
"mean_token_accuracy": 0.9779222890734672,
"num_tokens": 2005088.0,
"step": 1860
},
{
"entropy": 0.06261860271915794,
"epoch": 1.0026666666666666,
"grad_norm": 0.24298612773418427,
"learning_rate": 2.2958029262576248e-05,
"loss": 0.06308226585388184,
"mean_token_accuracy": 0.9821192339062691,
"num_tokens": 2025522.0,
"step": 1880
},
{
"entropy": 0.0643264465034008,
"epoch": 1.0133333333333334,
"grad_norm": 0.2755739688873291,
"learning_rate": 2.2812919880171748e-05,
"loss": 0.06683170795440674,
"mean_token_accuracy": 0.9803125351667404,
"num_tokens": 2046060.0,
"step": 1900
},
{
"entropy": 0.07090397626161575,
"epoch": 1.024,
"grad_norm": 0.3217398524284363,
"learning_rate": 2.266680007328108e-05,
"loss": 0.07337687611579895,
"mean_token_accuracy": 0.9777734145522118,
"num_tokens": 2067635.0,
"step": 1920
},
{
"entropy": 0.06721528638154269,
"epoch": 1.0346666666666666,
"grad_norm": 0.40361738204956055,
"learning_rate": 2.2519688739196567e-05,
"loss": 0.07007733583450318,
"mean_token_accuracy": 0.9789602175354958,
"num_tokens": 2089082.0,
"step": 1940
},
{
"entropy": 0.07042132476344705,
"epoch": 1.0453333333333332,
"grad_norm": 0.2519868314266205,
"learning_rate": 2.237160490344214e-05,
"loss": 0.0704314112663269,
"mean_token_accuracy": 0.9786124229431152,
"num_tokens": 2111237.0,
"step": 1960
},
{
"entropy": 0.06644694982096552,
"epoch": 1.056,
"grad_norm": 0.2761074900627136,
"learning_rate": 2.2222567717312815e-05,
"loss": 0.06676498651504517,
"mean_token_accuracy": 0.9803151816129685,
"num_tokens": 2133157.0,
"step": 1980
},
{
"entropy": 0.0724240118637681,
"epoch": 1.0666666666666667,
"grad_norm": 0.31547167897224426,
"learning_rate": 2.207259645539794e-05,
"loss": 0.07529684901237488,
"mean_token_accuracy": 0.977134644985199,
"num_tokens": 2156288.0,
"step": 2000
},
{
"entropy": 0.0705711885355413,
"epoch": 1.0773333333333333,
"grad_norm": 0.22879832983016968,
"learning_rate": 2.192171051308843e-05,
"loss": 0.07181910276412964,
"mean_token_accuracy": 0.9787937015295028,
"num_tokens": 2178459.0,
"step": 2020
},
{
"entropy": 0.06547352969646454,
"epoch": 1.088,
"grad_norm": 0.23372837901115417,
"learning_rate": 2.176992940406841e-05,
"loss": 0.06680878400802612,
"mean_token_accuracy": 0.9798174753785134,
"num_tokens": 2199053.0,
"step": 2040
},
{
"entropy": 0.06814751494675875,
"epoch": 1.0986666666666667,
"grad_norm": 0.3134348690509796,
"learning_rate": 2.1617272757791596e-05,
"loss": 0.06907396912574768,
"mean_token_accuracy": 0.9791154950857163,
"num_tokens": 2220356.0,
"step": 2060
},
{
"entropy": 0.06495830481871963,
"epoch": 1.1093333333333333,
"grad_norm": 0.29500001668930054,
"learning_rate": 2.146376031694264e-05,
"loss": 0.06694967150688172,
"mean_token_accuracy": 0.9795457676053048,
"num_tokens": 2241687.0,
"step": 2080
},
{
"entropy": 0.0655874202027917,
"epoch": 1.12,
"grad_norm": 0.22515356540679932,
"learning_rate": 2.130941193488385e-05,
"loss": 0.06550711393356323,
"mean_token_accuracy": 0.979499951004982,
"num_tokens": 2263024.0,
"step": 2100
},
{
"entropy": 0.0692840131931007,
"epoch": 1.1306666666666667,
"grad_norm": 0.21720077097415924,
"learning_rate": 2.115424757308764e-05,
"loss": 0.07195895910263062,
"mean_token_accuracy": 0.9781101942062378,
"num_tokens": 2285202.0,
"step": 2120
},
{
"entropy": 0.07025102246552706,
"epoch": 1.1413333333333333,
"grad_norm": 0.2687491476535797,
"learning_rate": 2.0998287298554953e-05,
"loss": 0.07001820206642151,
"mean_token_accuracy": 0.9790668547153473,
"num_tokens": 2307135.0,
"step": 2140
},
{
"entropy": 0.06896473728120327,
"epoch": 1.152,
"grad_norm": 0.33234819769859314,
"learning_rate": 2.0841551281220024e-05,
"loss": 0.07067601680755616,
"mean_token_accuracy": 0.9789680764079094,
"num_tokens": 2329136.0,
"step": 2160
},
{
"entropy": 0.0697830050252378,
"epoch": 1.1626666666666667,
"grad_norm": 0.23710612952709198,
"learning_rate": 2.068405979134189e-05,
"loss": 0.07100222706794738,
"mean_token_accuracy": 0.97775998711586,
"num_tokens": 2352008.0,
"step": 2180
},
{
"entropy": 0.0642639453522861,
"epoch": 1.1733333333333333,
"grad_norm": 0.42563989758491516,
"learning_rate": 2.052583319688288e-05,
"loss": 0.06657282710075378,
"mean_token_accuracy": 0.9803543120622635,
"num_tokens": 2372502.0,
"step": 2200
},
{
"entropy": 0.07466318933293223,
"epoch": 1.184,
"grad_norm": 0.2777847647666931,
"learning_rate": 2.0366891960874455e-05,
"loss": 0.07471616864204407,
"mean_token_accuracy": 0.9775146871805191,
"num_tokens": 2395472.0,
"step": 2220
},
{
"entropy": 0.06853743204846978,
"epoch": 1.1946666666666665,
"grad_norm": 0.2928735911846161,
"learning_rate": 2.020725663877082e-05,
"loss": 0.06982612609863281,
"mean_token_accuracy": 0.9785092636942864,
"num_tokens": 2417456.0,
"step": 2240
},
{
"entropy": 0.06352933412417769,
"epoch": 1.2053333333333334,
"grad_norm": 0.2748047411441803,
"learning_rate": 2.0046947875790507e-05,
"loss": 0.06415975093841553,
"mean_token_accuracy": 0.9810280442237854,
"num_tokens": 2437782.0,
"step": 2260
},
{
"entropy": 0.06905667120590805,
"epoch": 1.216,
"grad_norm": 0.4259282052516937,
"learning_rate": 1.9885986404246387e-05,
"loss": 0.07213917970657349,
"mean_token_accuracy": 0.9776696145534516,
"num_tokens": 2460043.0,
"step": 2280
},
{
"entropy": 0.07057028766721488,
"epoch": 1.2266666666666666,
"grad_norm": 0.22553683817386627,
"learning_rate": 1.9724393040864435e-05,
"loss": 0.06978555917739868,
"mean_token_accuracy": 0.9783964306116104,
"num_tokens": 2481541.0,
"step": 2300
},
{
"entropy": 0.06282441029325128,
"epoch": 1.2373333333333334,
"grad_norm": 0.2527618706226349,
"learning_rate": 1.9562188684091544e-05,
"loss": 0.06330822110176086,
"mean_token_accuracy": 0.9808567300438881,
"num_tokens": 2501805.0,
"step": 2320
},
{
"entropy": 0.06984690874814987,
"epoch": 1.248,
"grad_norm": 0.22297634184360504,
"learning_rate": 1.9399394311392777e-05,
"loss": 0.07097877264022827,
"mean_token_accuracy": 0.9779043823480607,
"num_tokens": 2524242.0,
"step": 2340
},
{
"entropy": 0.060862915217876436,
"epoch": 1.2586666666666666,
"grad_norm": 0.18649785220623016,
"learning_rate": 1.9236030976538415e-05,
"loss": 0.06111966371536255,
"mean_token_accuracy": 0.981529700756073,
"num_tokens": 2544070.0,
"step": 2360
},
{
"entropy": 0.0701494576409459,
"epoch": 1.2693333333333334,
"grad_norm": 0.43911799788475037,
"learning_rate": 1.907211980688112e-05,
"loss": 0.07214288115501404,
"mean_token_accuracy": 0.9776056706905365,
"num_tokens": 2566753.0,
"step": 2380
},
{
"entropy": 0.06710393568500876,
"epoch": 1.28,
"grad_norm": 0.2369464486837387,
"learning_rate": 1.8907682000623615e-05,
"loss": 0.06771854162216187,
"mean_token_accuracy": 0.9792038664221764,
"num_tokens": 2588334.0,
"step": 2400
},
{
"entropy": 0.06779517000541091,
"epoch": 1.2906666666666666,
"grad_norm": 0.2957499921321869,
"learning_rate": 1.8742738824077135e-05,
"loss": 0.06764324307441712,
"mean_token_accuracy": 0.9794522881507873,
"num_tokens": 2609672.0,
"step": 2420
},
{
"entropy": 0.06741884406656026,
"epoch": 1.3013333333333335,
"grad_norm": 0.19155755639076233,
"learning_rate": 1.8577311608911148e-05,
"loss": 0.07110410928726196,
"mean_token_accuracy": 0.979012542963028,
"num_tokens": 2631790.0,
"step": 2440
},
{
"entropy": 0.06480904156342149,
"epoch": 1.312,
"grad_norm": 0.24207216501235962,
"learning_rate": 1.8411421749394553e-05,
"loss": 0.06625967025756836,
"mean_token_accuracy": 0.9789305970072746,
"num_tokens": 2653196.0,
"step": 2460
},
{
"entropy": 0.07047648271545767,
"epoch": 1.3226666666666667,
"grad_norm": 0.22696281969547272,
"learning_rate": 1.8245090699628847e-05,
"loss": 0.07121983766555787,
"mean_token_accuracy": 0.9779788121581078,
"num_tokens": 2675588.0,
"step": 2480
},
{
"entropy": 0.06328712170943618,
"epoch": 1.3333333333333333,
"grad_norm": 0.37556302547454834,
"learning_rate": 1.8078339970773503e-05,
"loss": 0.06369008421897888,
"mean_token_accuracy": 0.9798499271273613,
"num_tokens": 2696544.0,
"step": 2500
},
{
"entropy": 0.05966705903410911,
"epoch": 1.3439999999999999,
"grad_norm": 0.4442780911922455,
"learning_rate": 1.7911191128263998e-05,
"loss": 0.061522841453552246,
"mean_token_accuracy": 0.9818950071930885,
"num_tokens": 2716857.0,
"step": 2520
},
{
"entropy": 0.062313361838459966,
"epoch": 1.3546666666666667,
"grad_norm": 0.24720695614814758,
"learning_rate": 1.7743665789022793e-05,
"loss": 0.06486648917198182,
"mean_token_accuracy": 0.9798543632030488,
"num_tokens": 2737538.0,
"step": 2540
},
{
"entropy": 0.06682068817317485,
"epoch": 1.3653333333333333,
"grad_norm": 0.3359099328517914,
"learning_rate": 1.7575785618663694e-05,
"loss": 0.06577321290969848,
"mean_token_accuracy": 0.9804640114307404,
"num_tokens": 2758530.0,
"step": 2560
},
{
"entropy": 0.06843016855418682,
"epoch": 1.376,
"grad_norm": 0.29373666644096375,
"learning_rate": 1.7407572328689894e-05,
"loss": 0.07291231155395508,
"mean_token_accuracy": 0.9776088848710061,
"num_tokens": 2781109.0,
"step": 2580
},
{
"entropy": 0.06162329772487283,
"epoch": 1.3866666666666667,
"grad_norm": 0.3116828203201294,
"learning_rate": 1.7239047673686063e-05,
"loss": 0.06326555609703063,
"mean_token_accuracy": 0.9805142045021057,
"num_tokens": 2801942.0,
"step": 2600
},
{
"entropy": 0.07026779251173139,
"epoch": 1.3973333333333333,
"grad_norm": 0.2655540406703949,
"learning_rate": 1.70702334485049e-05,
"loss": 0.06906303167343139,
"mean_token_accuracy": 0.9795295283198356,
"num_tokens": 2823119.0,
"step": 2620
},
{
"entropy": 0.06296397158876062,
"epoch": 1.408,
"grad_norm": 0.22108644247055054,
"learning_rate": 1.690115148544846e-05,
"loss": 0.0667952299118042,
"mean_token_accuracy": 0.9797157511115074,
"num_tokens": 2843803.0,
"step": 2640
},
{
"entropy": 0.0670015354640782,
"epoch": 1.4186666666666667,
"grad_norm": 0.2712651789188385,
"learning_rate": 1.673182365144463e-05,
"loss": 0.06649012565612793,
"mean_token_accuracy": 0.9791848674416542,
"num_tokens": 2865230.0,
"step": 2660
},
{
"entropy": 0.0670851232483983,
"epoch": 1.4293333333333333,
"grad_norm": 0.24662579596042633,
"learning_rate": 1.656227184521915e-05,
"loss": 0.06703668236732482,
"mean_token_accuracy": 0.9795497417449951,
"num_tokens": 2886358.0,
"step": 2680
},
{
"entropy": 0.062353554228320715,
"epoch": 1.44,
"grad_norm": 0.3106047809123993,
"learning_rate": 1.6392517994463503e-05,
"loss": 0.06736364364624023,
"mean_token_accuracy": 0.9799954712390899,
"num_tokens": 2907066.0,
"step": 2700
},
{
"entropy": 0.07080234689638018,
"epoch": 1.4506666666666668,
"grad_norm": 0.26504889130592346,
"learning_rate": 1.622258405299905e-05,
"loss": 0.0705980658531189,
"mean_token_accuracy": 0.9781270638108254,
"num_tokens": 2928955.0,
"step": 2720
},
{
"entropy": 0.06422470416873693,
"epoch": 1.4613333333333334,
"grad_norm": 0.2791357934474945,
"learning_rate": 1.6052491997937828e-05,
"loss": 0.06357557773590088,
"mean_token_accuracy": 0.9806081086397171,
"num_tokens": 2949978.0,
"step": 2740
},
{
"entropy": 0.0685284486040473,
"epoch": 1.472,
"grad_norm": 0.229026198387146,
"learning_rate": 1.5882263826840286e-05,
"loss": 0.06834735870361328,
"mean_token_accuracy": 0.9792908281087875,
"num_tokens": 2971296.0,
"step": 2760
},
{
"entropy": 0.06865171985700727,
"epoch": 1.4826666666666668,
"grad_norm": 0.2075856328010559,
"learning_rate": 1.5711921554870394e-05,
"loss": 0.07082886695861816,
"mean_token_accuracy": 0.9781916663050652,
"num_tokens": 2993694.0,
"step": 2780
},
{
"entropy": 0.06149051366373896,
"epoch": 1.4933333333333334,
"grad_norm": 0.24510766565799713,
"learning_rate": 1.55414872119485e-05,
"loss": 0.06140315532684326,
"mean_token_accuracy": 0.981805543601513,
"num_tokens": 3013485.0,
"step": 2800
},
{
"entropy": 0.06283597350120544,
"epoch": 1.504,
"grad_norm": 0.3660076856613159,
"learning_rate": 1.5370982839902248e-05,
"loss": 0.06664196252822877,
"mean_token_accuracy": 0.9799850210547447,
"num_tokens": 3034373.0,
"step": 2820
},
{
"entropy": 0.06986485011875629,
"epoch": 1.5146666666666668,
"grad_norm": 0.28147414326667786,
"learning_rate": 1.5200430489615963e-05,
"loss": 0.0729372501373291,
"mean_token_accuracy": 0.97689548432827,
"num_tokens": 3056657.0,
"step": 2840
},
{
"entropy": 0.06884724954143166,
"epoch": 1.5253333333333332,
"grad_norm": 0.23151597380638123,
"learning_rate": 1.5029852218178867e-05,
"loss": 0.06714131832122802,
"mean_token_accuracy": 0.9793031871318817,
"num_tokens": 3077669.0,
"step": 2860
},
{
"entropy": 0.0727352373301983,
"epoch": 1.536,
"grad_norm": 0.2120618373155594,
"learning_rate": 1.48592700860325e-05,
"loss": 0.07464810013771057,
"mean_token_accuracy": 0.9764216035604477,
"num_tokens": 3100875.0,
"step": 2880
},
{
"entropy": 0.06410896023735405,
"epoch": 1.5466666666666666,
"grad_norm": 0.27255088090896606,
"learning_rate": 1.4688706154117696e-05,
"loss": 0.06503221988677979,
"mean_token_accuracy": 0.979265221953392,
"num_tokens": 3122384.0,
"step": 2900
},
{
"entropy": 0.06694338582456112,
"epoch": 1.5573333333333332,
"grad_norm": 0.24979744851589203,
"learning_rate": 1.4518182481021502e-05,
"loss": 0.07112652659416199,
"mean_token_accuracy": 0.9789192631840706,
"num_tokens": 3144087.0,
"step": 2920
},
{
"entropy": 0.07254285905510187,
"epoch": 1.568,
"grad_norm": 0.28004226088523865,
"learning_rate": 1.4347721120124397e-05,
"loss": 0.07123505473136901,
"mean_token_accuracy": 0.978886678814888,
"num_tokens": 3166175.0,
"step": 2940
},
{
"entropy": 0.07109334822744132,
"epoch": 1.5786666666666667,
"grad_norm": 0.2444435954093933,
"learning_rate": 1.417734411674819e-05,
"loss": 0.07034714221954345,
"mean_token_accuracy": 0.9788279756903648,
"num_tokens": 3188135.0,
"step": 2960
},
{
"entropy": 0.06219260273501277,
"epoch": 1.5893333333333333,
"grad_norm": 0.2968960404396057,
"learning_rate": 1.4007073505304941e-05,
"loss": 0.06635067462921143,
"mean_token_accuracy": 0.9803951069712639,
"num_tokens": 3210125.0,
"step": 2980
},
{
"entropy": 0.06454241126775742,
"epoch": 1.6,
"grad_norm": 0.31802278757095337,
"learning_rate": 1.383693130644733e-05,
"loss": 0.06557859778404236,
"mean_token_accuracy": 0.9794120013713836,
"num_tokens": 3231328.0,
"step": 3000
},
{
"entropy": 0.06623651813715696,
"epoch": 1.6106666666666667,
"grad_norm": 0.2680739164352417,
"learning_rate": 1.3666939524220767e-05,
"loss": 0.06552712917327881,
"mean_token_accuracy": 0.981256639957428,
"num_tokens": 3252076.0,
"step": 3020
},
{
"entropy": 0.0598441306501627,
"epoch": 1.6213333333333333,
"grad_norm": 0.33669978380203247,
"learning_rate": 1.3497120143217684e-05,
"loss": 0.06124056577682495,
"mean_token_accuracy": 0.9811162427067757,
"num_tokens": 3272386.0,
"step": 3040
},
{
"entropy": 0.05869143349118531,
"epoch": 1.6320000000000001,
"grad_norm": 0.43568432331085205,
"learning_rate": 1.3327495125734301e-05,
"loss": 0.06237072944641113,
"mean_token_accuracy": 0.9805628210306168,
"num_tokens": 3293231.0,
"step": 3060
},
{
"entropy": 0.06979248141869902,
"epoch": 1.6426666666666667,
"grad_norm": 0.19376863539218903,
"learning_rate": 1.3158086408930324e-05,
"loss": 0.07059879302978515,
"mean_token_accuracy": 0.9788637235760689,
"num_tokens": 3314754.0,
"step": 3080
},
{
"entropy": 0.06580152967944741,
"epoch": 1.6533333333333333,
"grad_norm": 0.25558850169181824,
"learning_rate": 1.2988915901991841e-05,
"loss": 0.06825007200241089,
"mean_token_accuracy": 0.9793827921152115,
"num_tokens": 3336111.0,
"step": 3100
},
{
"entropy": 0.06895913444459438,
"epoch": 1.6640000000000001,
"grad_norm": 0.21350796520709991,
"learning_rate": 1.28200054832979e-05,
"loss": 0.07058674097061157,
"mean_token_accuracy": 0.9781552821397781,
"num_tokens": 3358444.0,
"step": 3120
},
{
"entropy": 0.0663242308422923,
"epoch": 1.6746666666666665,
"grad_norm": 0.222551628947258,
"learning_rate": 1.2651376997591005e-05,
"loss": 0.06854333281517029,
"mean_token_accuracy": 0.9788196787238121,
"num_tokens": 3379744.0,
"step": 3140
},
{
"entropy": 0.07216014033183456,
"epoch": 1.6853333333333333,
"grad_norm": 0.3092426359653473,
"learning_rate": 1.248305225315201e-05,
"loss": 0.07203421592712403,
"mean_token_accuracy": 0.978464289009571,
"num_tokens": 3402040.0,
"step": 3160
},
{
"entropy": 0.06513830767944455,
"epoch": 1.696,
"grad_norm": 0.23164676129817963,
"learning_rate": 1.2315053018979699e-05,
"loss": 0.06423503160476685,
"mean_token_accuracy": 0.9801443338394165,
"num_tokens": 3423245.0,
"step": 3180
},
{
"entropy": 0.061648647487163546,
"epoch": 1.7066666666666666,
"grad_norm": 0.2687373161315918,
"learning_rate": 1.2147401021975471e-05,
"loss": 0.06325778961181641,
"mean_token_accuracy": 0.9801615089178085,
"num_tokens": 3444668.0,
"step": 3200
},
{
"entropy": 0.06408334821462632,
"epoch": 1.7173333333333334,
"grad_norm": 0.266205757856369,
"learning_rate": 1.1980117944133456e-05,
"loss": 0.06507928371429443,
"mean_token_accuracy": 0.9799869328737258,
"num_tokens": 3465960.0,
"step": 3220
},
{
"entropy": 0.06640919763594866,
"epoch": 1.728,
"grad_norm": 0.33705103397369385,
"learning_rate": 1.1813225419736424e-05,
"loss": 0.06713052988052368,
"mean_token_accuracy": 0.9789028987288475,
"num_tokens": 3487326.0,
"step": 3240
},
{
"entropy": 0.07378814425319433,
"epoch": 1.7386666666666666,
"grad_norm": 0.31500980257987976,
"learning_rate": 1.1646745032557895e-05,
"loss": 0.07433319091796875,
"mean_token_accuracy": 0.9771664574742317,
"num_tokens": 3510466.0,
"step": 3260
},
{
"entropy": 0.0691059660166502,
"epoch": 1.7493333333333334,
"grad_norm": 0.33240073919296265,
"learning_rate": 1.148069831307075e-05,
"loss": 0.07068810462951661,
"mean_token_accuracy": 0.9787816539406776,
"num_tokens": 3531979.0,
"step": 3280
},
{
"entropy": 0.06790078049525619,
"epoch": 1.76,
"grad_norm": 0.2651180922985077,
"learning_rate": 1.1315106735662778e-05,
"loss": 0.07065703868865966,
"mean_token_accuracy": 0.9792906358838082,
"num_tokens": 3553906.0,
"step": 3300
},
{
"entropy": 0.0658861649222672,
"epoch": 1.7706666666666666,
"grad_norm": 0.23769696056842804,
"learning_rate": 1.1149991715859428e-05,
"loss": 0.06460118293762207,
"mean_token_accuracy": 0.980093178153038,
"num_tokens": 3575064.0,
"step": 3320
},
{
"entropy": 0.06296280124224722,
"epoch": 1.7813333333333334,
"grad_norm": 0.313032329082489,
"learning_rate": 1.0985374607554197e-05,
"loss": 0.0678341567516327,
"mean_token_accuracy": 0.9797580793499947,
"num_tokens": 3596537.0,
"step": 3340
},
{
"entropy": 0.06739533795043826,
"epoch": 1.792,
"grad_norm": 0.2906402349472046,
"learning_rate": 1.0821276700246993e-05,
"loss": 0.06724486351013184,
"mean_token_accuracy": 0.9797164380550385,
"num_tokens": 3617501.0,
"step": 3360
},
{
"entropy": 0.06835585637018085,
"epoch": 1.8026666666666666,
"grad_norm": 0.4202954173088074,
"learning_rate": 1.0657719216290813e-05,
"loss": 0.06997250318527222,
"mean_token_accuracy": 0.9782811865210533,
"num_tokens": 3639900.0,
"step": 3380
},
{
"entropy": 0.07121322192251682,
"epoch": 1.8133333333333335,
"grad_norm": 0.2250560075044632,
"learning_rate": 1.0494723308147131e-05,
"loss": 0.07189694046974182,
"mean_token_accuracy": 0.9778885126113892,
"num_tokens": 3661521.0,
"step": 3400
},
{
"entropy": 0.06754076760262251,
"epoch": 1.8239999999999998,
"grad_norm": 0.29606980085372925,
"learning_rate": 1.0332310055650275e-05,
"loss": 0.06917176246643067,
"mean_token_accuracy": 0.979434996843338,
"num_tokens": 3682643.0,
"step": 3420
},
{
"entropy": 0.07379511212930083,
"epoch": 1.8346666666666667,
"grad_norm": 0.25708991289138794,
"learning_rate": 1.0170500463281247e-05,
"loss": 0.07167908549308777,
"mean_token_accuracy": 0.9780497521162033,
"num_tokens": 3704737.0,
"step": 3440
},
{
"entropy": 0.06362721435725689,
"epoch": 1.8453333333333335,
"grad_norm": 0.23008571565151215,
"learning_rate": 1.0009315457451272e-05,
"loss": 0.06768688559532166,
"mean_token_accuracy": 0.9787532314658165,
"num_tokens": 3726432.0,
"step": 3460
},
{
"entropy": 0.06857527056708931,
"epoch": 1.8559999999999999,
"grad_norm": 0.229081392288208,
"learning_rate": 9.848775883795413e-06,
"loss": 0.06961520314216614,
"mean_token_accuracy": 0.9785497590899468,
"num_tokens": 3747724.0,
"step": 3480
},
{
"entropy": 0.0680385141633451,
"epoch": 1.8666666666666667,
"grad_norm": 0.25065746903419495,
"learning_rate": 9.688902504476698e-06,
"loss": 0.06657001376152039,
"mean_token_accuracy": 0.9794670984148979,
"num_tokens": 3769338.0,
"step": 3500
},
{
"entropy": 0.06824945779517293,
"epoch": 1.8773333333333333,
"grad_norm": 0.24879534542560577,
"learning_rate": 9.529715995500974e-06,
"loss": 0.0720153272151947,
"mean_token_accuracy": 0.9776617914438248,
"num_tokens": 3791756.0,
"step": 3520
},
{
"entropy": 0.06479481738060713,
"epoch": 1.888,
"grad_norm": 0.254541277885437,
"learning_rate": 9.371236944042949e-06,
"loss": 0.06658366322517395,
"mean_token_accuracy": 0.9801236733794212,
"num_tokens": 3812980.0,
"step": 3540
},
{
"entropy": 0.06725719030946493,
"epoch": 1.8986666666666667,
"grad_norm": 0.20114503800868988,
"learning_rate": 9.213485845783699e-06,
"loss": 0.06695624589920043,
"mean_token_accuracy": 0.9790028914809227,
"num_tokens": 3834204.0,
"step": 3560
},
{
"entropy": 0.06467321151867508,
"epoch": 1.9093333333333333,
"grad_norm": 0.3090938329696655,
"learning_rate": 9.056483102260023e-06,
"loss": 0.06516823768615723,
"mean_token_accuracy": 0.9797172531485557,
"num_tokens": 3855431.0,
"step": 3580
},
{
"entropy": 0.0704337134025991,
"epoch": 1.92,
"grad_norm": 0.29103463888168335,
"learning_rate": 8.900249018225946e-06,
"loss": 0.07074209451675414,
"mean_token_accuracy": 0.9780181258916855,
"num_tokens": 3878649.0,
"step": 3600
},
{
"entropy": 0.0582809004932642,
"epoch": 1.9306666666666668,
"grad_norm": 0.20316410064697266,
"learning_rate": 8.744803799026782e-06,
"loss": 0.057930976152420044,
"mean_token_accuracy": 0.9826426327228546,
"num_tokens": 3897996.0,
"step": 3620
},
{
"entropy": 0.06718643885105849,
"epoch": 1.9413333333333334,
"grad_norm": 0.22466565668582916,
"learning_rate": 8.590167547986025e-06,
"loss": 0.07398964166641235,
"mean_token_accuracy": 0.9769044548273087,
"num_tokens": 3920518.0,
"step": 3640
},
{
"entropy": 0.07131849471479654,
"epoch": 1.952,
"grad_norm": 0.2662692070007324,
"learning_rate": 8.436360263805418e-06,
"loss": 0.068779855966568,
"mean_token_accuracy": 0.9793604537844658,
"num_tokens": 3941875.0,
"step": 3660
},
{
"entropy": 0.06605563079938293,
"epoch": 1.9626666666666668,
"grad_norm": 0.24313360452651978,
"learning_rate": 8.283401837978608e-06,
"loss": 0.06911961436271667,
"mean_token_accuracy": 0.9782892510294914,
"num_tokens": 3963512.0,
"step": 3680
},
{
"entropy": 0.07288907114416361,
"epoch": 1.9733333333333334,
"grad_norm": 0.32028618454933167,
"learning_rate": 8.1313120522186e-06,
"loss": 0.07294363975524902,
"mean_token_accuracy": 0.9774829164147377,
"num_tokens": 3986539.0,
"step": 3700
},
{
"entropy": 0.06866402635350824,
"epoch": 1.984,
"grad_norm": 0.24489836394786835,
"learning_rate": 7.980110575899445e-06,
"loss": 0.06828091144561768,
"mean_token_accuracy": 0.978564715385437,
"num_tokens": 4008632.0,
"step": 3720
},
{
"entropy": 0.06863453919067979,
"epoch": 1.9946666666666668,
"grad_norm": 0.3105578124523163,
"learning_rate": 7.829816963512476e-06,
"loss": 0.07050868272781372,
"mean_token_accuracy": 0.9785391628742218,
"num_tokens": 4031130.0,
"step": 3740
},
{
"entropy": 0.06835599634796381,
"epoch": 2.005333333333333,
"grad_norm": 0.298072874546051,
"learning_rate": 7.680450652137355e-06,
"loss": 0.0701375961303711,
"mean_token_accuracy": 0.9787931978702545,
"num_tokens": 4053091.0,
"step": 3760
},
{
"entropy": 0.061244970094412564,
"epoch": 2.016,
"grad_norm": 0.39287611842155457,
"learning_rate": 7.532030958928316e-06,
"loss": 0.05947454571723938,
"mean_token_accuracy": 0.9816959872841835,
"num_tokens": 4073488.0,
"step": 3780
},
{
"entropy": 0.06386837903410196,
"epoch": 2.026666666666667,
"grad_norm": 0.33378368616104126,
"learning_rate": 7.384577078615963e-06,
"loss": 0.06699413061141968,
"mean_token_accuracy": 0.9805058524012565,
"num_tokens": 4094669.0,
"step": 3800
},
{
"entropy": 0.07299464298412203,
"epoch": 2.037333333333333,
"grad_norm": 0.48464930057525635,
"learning_rate": 7.2381080810248276e-06,
"loss": 0.07230452299118043,
"mean_token_accuracy": 0.9781083762645721,
"num_tokens": 4117086.0,
"step": 3820
},
{
"entropy": 0.06801890805363656,
"epoch": 2.048,
"grad_norm": 0.23026078939437866,
"learning_rate": 7.092642908607138e-06,
"loss": 0.06711475253105163,
"mean_token_accuracy": 0.9793458193540573,
"num_tokens": 4138872.0,
"step": 3840
},
{
"entropy": 0.06590869640931488,
"epoch": 2.058666666666667,
"grad_norm": 0.3303634524345398,
"learning_rate": 6.948200373993056e-06,
"loss": 0.0715693175792694,
"mean_token_accuracy": 0.9784951597452164,
"num_tokens": 4160263.0,
"step": 3860
},
{
"entropy": 0.06702440548688174,
"epoch": 2.0693333333333332,
"grad_norm": 0.21795713901519775,
"learning_rate": 6.804799157557653e-06,
"loss": 0.06775381565093994,
"mean_token_accuracy": 0.9790131956338882,
"num_tokens": 4181574.0,
"step": 3880
},
{
"entropy": 0.06911803474649787,
"epoch": 2.08,
"grad_norm": 0.2393951117992401,
"learning_rate": 6.662457805005041e-06,
"loss": 0.06864354610443116,
"mean_token_accuracy": 0.9798421457409858,
"num_tokens": 4202497.0,
"step": 3900
},
{
"entropy": 0.07464540144428611,
"epoch": 2.0906666666666665,
"grad_norm": 0.24819724261760712,
"learning_rate": 6.52119472496994e-06,
"loss": 0.07682948112487793,
"mean_token_accuracy": 0.9767722800374031,
"num_tokens": 4226275.0,
"step": 3920
},
{
"entropy": 0.06835727458819747,
"epoch": 2.1013333333333333,
"grad_norm": 0.2139078825712204,
"learning_rate": 6.38102818663688e-06,
"loss": 0.06501986980438232,
"mean_token_accuracy": 0.9806719914078712,
"num_tokens": 4247336.0,
"step": 3940
},
{
"entropy": 0.06610159985721112,
"epoch": 2.112,
"grad_norm": 0.28183573484420776,
"learning_rate": 6.241976317377518e-06,
"loss": 0.0680277943611145,
"mean_token_accuracy": 0.9787659183144569,
"num_tokens": 4269389.0,
"step": 3960
},
{
"entropy": 0.06353378687053919,
"epoch": 2.1226666666666665,
"grad_norm": 0.29995930194854736,
"learning_rate": 6.1040571004062975e-06,
"loss": 0.06427581310272217,
"mean_token_accuracy": 0.9798787072300911,
"num_tokens": 4290712.0,
"step": 3980
},
{
"entropy": 0.06582737127318979,
"epoch": 2.1333333333333333,
"grad_norm": 0.3384758532047272,
"learning_rate": 5.967288372454691e-06,
"loss": 0.06841517686843872,
"mean_token_accuracy": 0.9793238922953605,
"num_tokens": 4311731.0,
"step": 4000
},
{
"entropy": 0.06381206568330526,
"epoch": 2.144,
"grad_norm": 0.3370026648044586,
"learning_rate": 5.83168782146443e-06,
"loss": 0.06559972763061524,
"mean_token_accuracy": 0.9806227684020996,
"num_tokens": 4332416.0,
"step": 4020
},
{
"entropy": 0.0634533517062664,
"epoch": 2.1546666666666665,
"grad_norm": 0.20744706690311432,
"learning_rate": 5.6972729843e-06,
"loss": 0.06608573198318482,
"mean_token_accuracy": 0.9805106148123741,
"num_tokens": 4353670.0,
"step": 4040
},
{
"entropy": 0.07064798045903445,
"epoch": 2.1653333333333333,
"grad_norm": 0.2510891556739807,
"learning_rate": 5.564061244480591e-06,
"loss": 0.07231830358505249,
"mean_token_accuracy": 0.977633598446846,
"num_tokens": 4376258.0,
"step": 4060
},
{
"entropy": 0.07347904201596975,
"epoch": 2.176,
"grad_norm": 0.25644832849502563,
"learning_rate": 5.43206982993198e-06,
"loss": 0.07207185626029969,
"mean_token_accuracy": 0.9770923808217049,
"num_tokens": 4399063.0,
"step": 4080
},
{
"entropy": 0.07256816513836384,
"epoch": 2.1866666666666665,
"grad_norm": 0.4217114746570587,
"learning_rate": 5.301315810758472e-06,
"loss": 0.0714795470237732,
"mean_token_accuracy": 0.9770988509058952,
"num_tokens": 4422086.0,
"step": 4100
},
{
"entropy": 0.0676334222778678,
"epoch": 2.1973333333333334,
"grad_norm": 0.250229150056839,
"learning_rate": 5.171816097035251e-06,
"loss": 0.06939680576324463,
"mean_token_accuracy": 0.9786039367318153,
"num_tokens": 4443688.0,
"step": 4120
},
{
"entropy": 0.06949442513287067,
"epoch": 2.208,
"grad_norm": 0.3249078392982483,
"learning_rate": 5.043587436621462e-06,
"loss": 0.06934006810188294,
"mean_token_accuracy": 0.978336064517498,
"num_tokens": 4466186.0,
"step": 4140
},
{
"entropy": 0.0705328544601798,
"epoch": 2.2186666666666666,
"grad_norm": 0.22043611109256744,
"learning_rate": 4.916646412994267e-06,
"loss": 0.07034485340118408,
"mean_token_accuracy": 0.9777373462915421,
"num_tokens": 4489519.0,
"step": 4160
},
{
"entropy": 0.06607724539935589,
"epoch": 2.2293333333333334,
"grad_norm": 0.29305610060691833,
"learning_rate": 4.791009443104112e-06,
"loss": 0.06469966173171997,
"mean_token_accuracy": 0.981091833114624,
"num_tokens": 4510105.0,
"step": 4180
},
{
"entropy": 0.062390463519841434,
"epoch": 2.24,
"grad_norm": 0.21871982514858246,
"learning_rate": 4.666692775251589e-06,
"loss": 0.06328600645065308,
"mean_token_accuracy": 0.9811810821294784,
"num_tokens": 4530430.0,
"step": 4200
},
{
"entropy": 0.06391511335968972,
"epoch": 2.2506666666666666,
"grad_norm": 0.2238311767578125,
"learning_rate": 4.543712486986095e-06,
"loss": 0.06514235734939575,
"mean_token_accuracy": 0.9797263771295548,
"num_tokens": 4551438.0,
"step": 4220
},
{
"entropy": 0.06428639143705368,
"epoch": 2.2613333333333334,
"grad_norm": 0.34120672941207886,
"learning_rate": 4.422084483026534e-06,
"loss": 0.06663946509361267,
"mean_token_accuracy": 0.9795652627944946,
"num_tokens": 4572907.0,
"step": 4240
},
{
"entropy": 0.06766332956030965,
"epoch": 2.2720000000000002,
"grad_norm": 0.24613726139068604,
"learning_rate": 4.301824493204431e-06,
"loss": 0.06992720365524292,
"mean_token_accuracy": 0.9785493031144142,
"num_tokens": 4595427.0,
"step": 4260
},
{
"entropy": 0.0695193137973547,
"epoch": 2.2826666666666666,
"grad_norm": 0.2597343325614929,
"learning_rate": 4.182948070429622e-06,
"loss": 0.06983534693717956,
"mean_token_accuracy": 0.9781228736042976,
"num_tokens": 4618066.0,
"step": 4280
},
{
"entropy": 0.0699890716932714,
"epoch": 2.2933333333333334,
"grad_norm": 0.24136057496070862,
"learning_rate": 4.06547058867883e-06,
"loss": 0.07176908254623413,
"mean_token_accuracy": 0.9779310017824173,
"num_tokens": 4640538.0,
"step": 4300
},
{
"entropy": 0.06974478457123041,
"epoch": 2.304,
"grad_norm": 0.2972959578037262,
"learning_rate": 3.949407241007393e-06,
"loss": 0.06903537511825561,
"mean_token_accuracy": 0.9787017688155174,
"num_tokens": 4662281.0,
"step": 4320
},
{
"entropy": 0.06801187871024013,
"epoch": 2.3146666666666667,
"grad_norm": 0.32835492491722107,
"learning_rate": 3.834773037584402e-06,
"loss": 0.06735379695892334,
"mean_token_accuracy": 0.9794113785028458,
"num_tokens": 4683454.0,
"step": 4340
},
{
"entropy": 0.06790872057899833,
"epoch": 2.3253333333333335,
"grad_norm": 0.2797514498233795,
"learning_rate": 3.7215828037514487e-06,
"loss": 0.06811803579330444,
"mean_token_accuracy": 0.9787567868828774,
"num_tokens": 4705275.0,
"step": 4360
},
{
"entropy": 0.06285285465419292,
"epoch": 2.336,
"grad_norm": 0.25980862975120544,
"learning_rate": 3.6098511781053244e-06,
"loss": 0.0630250632762909,
"mean_token_accuracy": 0.9810120955109596,
"num_tokens": 4726063.0,
"step": 4380
},
{
"entropy": 0.06258888244628906,
"epoch": 2.3466666666666667,
"grad_norm": 0.27584534883499146,
"learning_rate": 3.4995926106048345e-06,
"loss": 0.0658095121383667,
"mean_token_accuracy": 0.9793830320239068,
"num_tokens": 4747694.0,
"step": 4400
},
{
"entropy": 0.06438704924657941,
"epoch": 2.3573333333333335,
"grad_norm": 0.2829785943031311,
"learning_rate": 3.3908213607020253e-06,
"loss": 0.06506861448287964,
"mean_token_accuracy": 0.9803233638405799,
"num_tokens": 4769134.0,
"step": 4420
},
{
"entropy": 0.06386989299207926,
"epoch": 2.368,
"grad_norm": 0.2539486885070801,
"learning_rate": 3.283551495498059e-06,
"loss": 0.06367477774620056,
"mean_token_accuracy": 0.9801046311855316,
"num_tokens": 4789772.0,
"step": 4440
},
{
"entropy": 0.06729276357218623,
"epoch": 2.3786666666666667,
"grad_norm": 0.2120504379272461,
"learning_rate": 3.1777968879239432e-06,
"loss": 0.06938108205795288,
"mean_token_accuracy": 0.9789153173565864,
"num_tokens": 4811522.0,
"step": 4460
},
{
"entropy": 0.06604850795120001,
"epoch": 2.389333333333333,
"grad_norm": 0.2501501441001892,
"learning_rate": 3.0735712149463663e-06,
"loss": 0.06410098671913148,
"mean_token_accuracy": 0.9799213841557503,
"num_tokens": 4831995.0,
"step": 4480
},
{
"entropy": 0.06737142587080598,
"epoch": 2.4,
"grad_norm": 0.2193731665611267,
"learning_rate": 2.9708879557989272e-06,
"loss": 0.06801332831382752,
"mean_token_accuracy": 0.9788430154323577,
"num_tokens": 4853511.0,
"step": 4500
},
{
"entropy": 0.06548255272209644,
"epoch": 2.4106666666666667,
"grad_norm": 0.26090550422668457,
"learning_rate": 2.8697603902388596e-06,
"loss": 0.06384705305099488,
"mean_token_accuracy": 0.9796822845935822,
"num_tokens": 4874331.0,
"step": 4520
},
{
"entropy": 0.06249658772721887,
"epoch": 2.421333333333333,
"grad_norm": 0.2120533138513565,
"learning_rate": 2.770201596829623e-06,
"loss": 0.060959136486053465,
"mean_token_accuracy": 0.9812754124403,
"num_tokens": 4894384.0,
"step": 4540
},
{
"entropy": 0.06758719896897673,
"epoch": 2.432,
"grad_norm": 0.2482796013355255,
"learning_rate": 2.6722244512494888e-06,
"loss": 0.07017409801483154,
"mean_token_accuracy": 0.9777197048068047,
"num_tokens": 4916199.0,
"step": 4560
},
{
"entropy": 0.06625777473673225,
"epoch": 2.4426666666666668,
"grad_norm": 0.2898966372013092,
"learning_rate": 2.5758416246263357e-06,
"loss": 0.06673334240913391,
"mean_token_accuracy": 0.9788759082555771,
"num_tokens": 4938235.0,
"step": 4580
},
{
"entropy": 0.0688164765946567,
"epoch": 2.453333333333333,
"grad_norm": 0.25803565979003906,
"learning_rate": 2.4810655818989563e-06,
"loss": 0.07112188339233398,
"mean_token_accuracy": 0.9775520697236061,
"num_tokens": 4961512.0,
"step": 4600
},
{
"entropy": 0.06736230682581663,
"epoch": 2.464,
"grad_norm": 0.3040409982204437,
"learning_rate": 2.387908580204986e-06,
"loss": 0.06320847868919373,
"mean_token_accuracy": 0.9807012856006623,
"num_tokens": 4982173.0,
"step": 4620
},
{
"entropy": 0.0662422583438456,
"epoch": 2.474666666666667,
"grad_norm": 0.24963408708572388,
"learning_rate": 2.296382667295713e-06,
"loss": 0.07101342678070069,
"mean_token_accuracy": 0.9781320869922638,
"num_tokens": 5004438.0,
"step": 4640
},
{
"entropy": 0.07070345636457205,
"epoch": 2.485333333333333,
"grad_norm": 0.25193750858306885,
"learning_rate": 2.2064996799779764e-06,
"loss": 0.07217344641685486,
"mean_token_accuracy": 0.9768879726529122,
"num_tokens": 5027839.0,
"step": 4660
},
{
"entropy": 0.0711888742633164,
"epoch": 2.496,
"grad_norm": 0.28611400723457336,
"learning_rate": 2.1182712425833624e-06,
"loss": 0.07044810056686401,
"mean_token_accuracy": 0.9788151904940605,
"num_tokens": 5050202.0,
"step": 4680
},
{
"entropy": 0.0676958936266601,
"epoch": 2.506666666666667,
"grad_norm": 0.23146404325962067,
"learning_rate": 2.0317087654648312e-06,
"loss": 0.06667524576187134,
"mean_token_accuracy": 0.9787666156888009,
"num_tokens": 5071998.0,
"step": 4700
},
{
"entropy": 0.07002988457679749,
"epoch": 2.517333333333333,
"grad_norm": 0.2925092279911041,
"learning_rate": 1.946823443521062e-06,
"loss": 0.07027275562286377,
"mean_token_accuracy": 0.9777396753430366,
"num_tokens": 5094139.0,
"step": 4720
},
{
"entropy": 0.06402101377025246,
"epoch": 2.528,
"grad_norm": 0.30446258187294006,
"learning_rate": 1.8636262547486522e-06,
"loss": 0.06188323497772217,
"mean_token_accuracy": 0.980588148534298,
"num_tokens": 5114657.0,
"step": 4740
},
{
"entropy": 0.0640190165489912,
"epoch": 2.538666666666667,
"grad_norm": 0.27199557423591614,
"learning_rate": 1.7821279588223399e-06,
"loss": 0.06351304054260254,
"mean_token_accuracy": 0.9809172645211219,
"num_tokens": 5135559.0,
"step": 4760
},
{
"entropy": 0.06178912734612822,
"epoch": 2.5493333333333332,
"grad_norm": 0.2936437726020813,
"learning_rate": 1.7023390957035056e-06,
"loss": 0.06231012344360352,
"mean_token_accuracy": 0.9810473620891571,
"num_tokens": 5156122.0,
"step": 4780
},
{
"entropy": 0.06739961085841059,
"epoch": 2.56,
"grad_norm": 0.29408252239227295,
"learning_rate": 1.6242699842770558e-06,
"loss": 0.0716172993183136,
"mean_token_accuracy": 0.9772106230258941,
"num_tokens": 5178867.0,
"step": 4800
},
{
"entropy": 0.07000719318166375,
"epoch": 2.570666666666667,
"grad_norm": 0.2808171212673187,
"learning_rate": 1.547930721016909e-06,
"loss": 0.07183417081832885,
"mean_token_accuracy": 0.9768716543912888,
"num_tokens": 5202411.0,
"step": 4820
},
{
"entropy": 0.06676273150369524,
"epoch": 2.5813333333333333,
"grad_norm": 0.29104703664779663,
"learning_rate": 1.4733311786802439e-06,
"loss": 0.06565375328063965,
"mean_token_accuracy": 0.9793911650776863,
"num_tokens": 5223589.0,
"step": 4840
},
{
"entropy": 0.06493867076933384,
"epoch": 2.592,
"grad_norm": 0.24625852704048157,
"learning_rate": 1.40048100503069e-06,
"loss": 0.0669145941734314,
"mean_token_accuracy": 0.9792442545294762,
"num_tokens": 5245281.0,
"step": 4860
},
{
"entropy": 0.06505903964862228,
"epoch": 2.602666666666667,
"grad_norm": 0.25980353355407715,
"learning_rate": 1.3293896215905942e-06,
"loss": 0.06756677031517029,
"mean_token_accuracy": 0.979070121049881,
"num_tokens": 5266278.0,
"step": 4880
},
{
"entropy": 0.06472506942227482,
"epoch": 2.6133333333333333,
"grad_norm": 0.39341655373573303,
"learning_rate": 1.2600662224225734e-06,
"loss": 0.06350111961364746,
"mean_token_accuracy": 0.9806848973035812,
"num_tokens": 5287527.0,
"step": 4900
},
{
"entropy": 0.0649796743877232,
"epoch": 2.624,
"grad_norm": 0.22596676647663116,
"learning_rate": 1.1925197729404602e-06,
"loss": 0.06618022918701172,
"mean_token_accuracy": 0.9799415796995163,
"num_tokens": 5308641.0,
"step": 4920
},
{
"entropy": 0.06528121028095484,
"epoch": 2.634666666666667,
"grad_norm": 0.20817522704601288,
"learning_rate": 1.126759008749842e-06,
"loss": 0.0666232168674469,
"mean_token_accuracy": 0.979514765739441,
"num_tokens": 5330297.0,
"step": 4940
},
{
"entropy": 0.06870688563212753,
"epoch": 2.6453333333333333,
"grad_norm": 0.27720537781715393,
"learning_rate": 1.0627924345182854e-06,
"loss": 0.07012331485748291,
"mean_token_accuracy": 0.9781979978084564,
"num_tokens": 5352281.0,
"step": 4960
},
{
"entropy": 0.06342040533199907,
"epoch": 2.656,
"grad_norm": 0.267355352640152,
"learning_rate": 1.0006283228754787e-06,
"loss": 0.061806786060333255,
"mean_token_accuracy": 0.9821794584393502,
"num_tokens": 5372463.0,
"step": 4980
},
{
"entropy": 0.06996868448331953,
"epoch": 2.6666666666666665,
"grad_norm": 0.25216931104660034,
"learning_rate": 9.402747133433299e-07,
"loss": 0.07108966112136841,
"mean_token_accuracy": 0.977506385743618,
"num_tokens": 5395009.0,
"step": 5000
},
{
"entropy": 0.061977448593825105,
"epoch": 2.6773333333333333,
"grad_norm": 0.2592537999153137,
"learning_rate": 8.817394112962457e-07,
"loss": 0.06004307270050049,
"mean_token_accuracy": 0.9814708828926086,
"num_tokens": 5415204.0,
"step": 5020
},
{
"entropy": 0.06544211199507118,
"epoch": 2.6879999999999997,
"grad_norm": 0.27698102593421936,
"learning_rate": 8.250299869516908e-07,
"loss": 0.06892814636230468,
"mean_token_accuracy": 0.9790427267551423,
"num_tokens": 5437588.0,
"step": 5040
},
{
"entropy": 0.06467498484998942,
"epoch": 2.6986666666666665,
"grad_norm": 0.26750609278678894,
"learning_rate": 7.701537743911375e-07,
"loss": 0.0653802752494812,
"mean_token_accuracy": 0.9803359940648079,
"num_tokens": 5458783.0,
"step": 5060
},
{
"entropy": 0.06604810692369938,
"epoch": 2.7093333333333334,
"grad_norm": 0.2512940466403961,
"learning_rate": 7.171178706115789e-07,
"loss": 0.06406107544898987,
"mean_token_accuracy": 0.9804125308990479,
"num_tokens": 5479810.0,
"step": 5080
},
{
"entropy": 0.06774483285844327,
"epoch": 2.7199999999999998,
"grad_norm": 0.2911634147167206,
"learning_rate": 6.659291346076824e-07,
"loss": 0.07083733677864075,
"mean_token_accuracy": 0.9774568140506744,
"num_tokens": 5503033.0,
"step": 5100
},
{
"entropy": 0.06132667139172554,
"epoch": 2.7306666666666666,
"grad_norm": 0.25360938906669617,
"learning_rate": 6.165941864847468e-07,
"loss": 0.0613398015499115,
"mean_token_accuracy": 0.981691287457943,
"num_tokens": 5523046.0,
"step": 5120
},
{
"entropy": 0.06512014325708151,
"epoch": 2.7413333333333334,
"grad_norm": 0.2063353806734085,
"learning_rate": 5.691194066025295e-07,
"loss": 0.06509124636650085,
"mean_token_accuracy": 0.9808336913585662,
"num_tokens": 5544090.0,
"step": 5140
},
{
"entropy": 0.06322276135906577,
"epoch": 2.752,
"grad_norm": 0.22989638149738312,
"learning_rate": 5.235109347501027e-07,
"loss": 0.062446653842926025,
"mean_token_accuracy": 0.9809010848402977,
"num_tokens": 5564404.0,
"step": 5160
},
{
"entropy": 0.0656422447413206,
"epoch": 2.7626666666666666,
"grad_norm": 0.22744940221309662,
"learning_rate": 4.797746693517952e-07,
"loss": 0.06802717447280884,
"mean_token_accuracy": 0.9793394491076469,
"num_tokens": 5585814.0,
"step": 5180
},
{
"entropy": 0.06916419817134738,
"epoch": 2.7733333333333334,
"grad_norm": 0.29483240842819214,
"learning_rate": 4.379162667043779e-07,
"loss": 0.07332996129989625,
"mean_token_accuracy": 0.9775100320577621,
"num_tokens": 5608497.0,
"step": 5200
},
{
"entropy": 0.06638877158984542,
"epoch": 2.784,
"grad_norm": 0.3650195598602295,
"learning_rate": 3.9794114024554906e-07,
"loss": 0.06668092608451844,
"mean_token_accuracy": 0.980099868774414,
"num_tokens": 5629582.0,
"step": 5220
},
{
"entropy": 0.06656348751857877,
"epoch": 2.7946666666666666,
"grad_norm": 0.31520113348960876,
"learning_rate": 3.5985445985381727e-07,
"loss": 0.06691439151763916,
"mean_token_accuracy": 0.9794167369604111,
"num_tokens": 5650897.0,
"step": 5240
},
{
"entropy": 0.06590501200407743,
"epoch": 2.8053333333333335,
"grad_norm": 0.3223532736301422,
"learning_rate": 3.2366115117991146e-07,
"loss": 0.06653072834014892,
"mean_token_accuracy": 0.9792607888579369,
"num_tokens": 5673009.0,
"step": 5260
},
{
"entropy": 0.06469663931056857,
"epoch": 2.816,
"grad_norm": 0.27690476179122925,
"learning_rate": 2.893658950097422e-07,
"loss": 0.06444936990737915,
"mean_token_accuracy": 0.9817123860120773,
"num_tokens": 5693845.0,
"step": 5280
},
{
"entropy": 0.06907640630379319,
"epoch": 2.8266666666666667,
"grad_norm": 0.2766023576259613,
"learning_rate": 2.569731266590608e-07,
"loss": 0.07101809978485107,
"mean_token_accuracy": 0.9769211024045944,
"num_tokens": 5716621.0,
"step": 5300
},
{
"entropy": 0.06807576529681683,
"epoch": 2.8373333333333335,
"grad_norm": 0.214943990111351,
"learning_rate": 2.2648703539984161e-07,
"loss": 0.06807198524475097,
"mean_token_accuracy": 0.9792288944125176,
"num_tokens": 5737713.0,
"step": 5320
},
{
"entropy": 0.06559845563024283,
"epoch": 2.848,
"grad_norm": 0.24327735602855682,
"learning_rate": 1.9791156391850695e-07,
"loss": 0.06800661087036133,
"mean_token_accuracy": 0.9790630683302879,
"num_tokens": 5759702.0,
"step": 5340
},
{
"entropy": 0.06611165096983314,
"epoch": 2.8586666666666667,
"grad_norm": 0.23079447448253632,
"learning_rate": 1.7125040780601175e-07,
"loss": 0.06424795985221862,
"mean_token_accuracy": 0.9802783578634262,
"num_tokens": 5780385.0,
"step": 5360
},
{
"entropy": 0.06495644729584456,
"epoch": 2.8693333333333335,
"grad_norm": 0.23585422337055206,
"learning_rate": 1.4650701507992582e-07,
"loss": 0.06308045387268066,
"mean_token_accuracy": 0.9818204194307327,
"num_tokens": 5800602.0,
"step": 5380
},
{
"entropy": 0.06460589049383998,
"epoch": 2.88,
"grad_norm": 0.27924907207489014,
"learning_rate": 1.2368458573848717e-07,
"loss": 0.06371138095855713,
"mean_token_accuracy": 0.9809283286333084,
"num_tokens": 5821016.0,
"step": 5400
},
{
"entropy": 0.0652251210063696,
"epoch": 2.8906666666666667,
"grad_norm": 0.21342748403549194,
"learning_rate": 1.0278607134676987e-07,
"loss": 0.06635769009590149,
"mean_token_accuracy": 0.979735954105854,
"num_tokens": 5841929.0,
"step": 5420
},
{
"entropy": 0.0619895207695663,
"epoch": 2.9013333333333335,
"grad_norm": 0.23523399233818054,
"learning_rate": 8.381417465495922e-08,
"loss": 0.06180503368377686,
"mean_token_accuracy": 0.9817696720361709,
"num_tokens": 5862268.0,
"step": 5440
},
{
"entropy": 0.06805047616362572,
"epoch": 2.912,
"grad_norm": 0.3232709765434265,
"learning_rate": 6.677134924881978e-08,
"loss": 0.06934788227081298,
"mean_token_accuracy": 0.9782540738582611,
"num_tokens": 5883972.0,
"step": 5460
},
{
"entropy": 0.07081099823117257,
"epoch": 2.9226666666666667,
"grad_norm": 0.24873663485050201,
"learning_rate": 5.165979923236752e-08,
"loss": 0.07326069474220276,
"mean_token_accuracy": 0.977522186934948,
"num_tokens": 5906392.0,
"step": 5480
},
{
"entropy": 0.06697621447965503,
"epoch": 2.9333333333333336,
"grad_norm": 0.2500160336494446,
"learning_rate": 3.848147894282783e-08,
"loss": 0.06656785011291504,
"mean_token_accuracy": 0.9801760748028755,
"num_tokens": 5927809.0,
"step": 5500
},
{
"entropy": 0.06844843151047826,
"epoch": 2.944,
"grad_norm": 0.2815072536468506,
"learning_rate": 2.7238092697884353e-08,
"loss": 0.0686243712902069,
"mean_token_accuracy": 0.9783571302890778,
"num_tokens": 5950680.0,
"step": 5520
},
{
"entropy": 0.06373694511130452,
"epoch": 2.9546666666666668,
"grad_norm": 0.25896361470222473,
"learning_rate": 1.7931094575260322e-08,
"loss": 0.06541070938110352,
"mean_token_accuracy": 0.9797068655490875,
"num_tokens": 5972323.0,
"step": 5540
},
{
"entropy": 0.06856830064207316,
"epoch": 2.9653333333333336,
"grad_norm": 0.30956923961639404,
"learning_rate": 1.056168822467396e-08,
"loss": 0.06829805374145508,
"mean_token_accuracy": 0.9796166166663169,
"num_tokens": 5993505.0,
"step": 5560
},
{
"entropy": 0.06814236659556627,
"epoch": 2.976,
"grad_norm": 0.22563952207565308,
"learning_rate": 5.1308267121680244e-09,
"loss": 0.06708756685256959,
"mean_token_accuracy": 0.979302079975605,
"num_tokens": 6015143.0,
"step": 5580
},
{
"entropy": 0.06459062686190009,
"epoch": 2.986666666666667,
"grad_norm": 0.2697313725948334,
"learning_rate": 1.639212396850054e-09,
"loss": 0.0641595482826233,
"mean_token_accuracy": 0.980322690308094,
"num_tokens": 6036421.0,
"step": 5600
},
{
"entropy": 0.06587992180138827,
"epoch": 2.997333333333333,
"grad_norm": 0.25788185000419617,
"learning_rate": 8.729684006669735e-11,
"loss": 0.06761438250541688,
"mean_token_accuracy": 0.9793855547904968,
"num_tokens": 6057835.0,
"step": 5620
}
],
"logging_steps": 20,
"max_steps": 5625,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.016631644913664e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}