2845 lines
83 KiB
JSON
2845 lines
83 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 2.997333333333333,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 5620,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 2.3199639558792113,
|
||
|
|
"epoch": 0.010666666666666666,
|
||
|
|
"grad_norm": 13.384757041931152,
|
||
|
|
"learning_rate": 5.7000000000000005e-06,
|
||
|
|
"loss": 3.7517059326171873,
|
||
|
|
"mean_token_accuracy": 0.5159296914935112,
|
||
|
|
"num_tokens": 20385.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 2.2831633567810057,
|
||
|
|
"epoch": 0.021333333333333333,
|
||
|
|
"grad_norm": 6.131666660308838,
|
||
|
|
"learning_rate": 1.1700000000000001e-05,
|
||
|
|
"loss": 2.7274402618408202,
|
||
|
|
"mean_token_accuracy": 0.6040167711675167,
|
||
|
|
"num_tokens": 41653.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 1.6687136992812157,
|
||
|
|
"epoch": 0.032,
|
||
|
|
"grad_norm": 3.8555829524993896,
|
||
|
|
"learning_rate": 1.77e-05,
|
||
|
|
"loss": 1.590993309020996,
|
||
|
|
"mean_token_accuracy": 0.7407817155122757,
|
||
|
|
"num_tokens": 64225.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.8817660577595234,
|
||
|
|
"epoch": 0.042666666666666665,
|
||
|
|
"grad_norm": 1.0237234830856323,
|
||
|
|
"learning_rate": 2.37e-05,
|
||
|
|
"loss": 0.7373588562011719,
|
||
|
|
"mean_token_accuracy": 0.8729878857731819,
|
||
|
|
"num_tokens": 86424.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.33704922115430236,
|
||
|
|
"epoch": 0.05333333333333334,
|
||
|
|
"grad_norm": 1.290586233139038,
|
||
|
|
"learning_rate": 2.97e-05,
|
||
|
|
"loss": 0.2778470993041992,
|
||
|
|
"mean_token_accuracy": 0.9500011757016182,
|
||
|
|
"num_tokens": 109633.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.18128704172559082,
|
||
|
|
"epoch": 0.064,
|
||
|
|
"grad_norm": 1.3026446104049683,
|
||
|
|
"learning_rate": 2.999912461435259e-05,
|
||
|
|
"loss": 0.15202982425689698,
|
||
|
|
"mean_token_accuracy": 0.9685896590352059,
|
||
|
|
"num_tokens": 131798.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.11775432089343667,
|
||
|
|
"epoch": 0.07466666666666667,
|
||
|
|
"grad_norm": 0.6625315546989441,
|
||
|
|
"learning_rate": 2.999631185607745e-05,
|
||
|
|
"loss": 0.09883086681365967,
|
||
|
|
"mean_token_accuracy": 0.9783779725432395,
|
||
|
|
"num_tokens": 153213.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.10737935788929462,
|
||
|
|
"epoch": 0.08533333333333333,
|
||
|
|
"grad_norm": 0.6038058996200562,
|
||
|
|
"learning_rate": 2.9991559664026723e-05,
|
||
|
|
"loss": 0.09105062484741211,
|
||
|
|
"mean_token_accuracy": 0.9772884234786033,
|
||
|
|
"num_tokens": 175096.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.09613236370496452,
|
||
|
|
"epoch": 0.096,
|
||
|
|
"grad_norm": 0.48909515142440796,
|
||
|
|
"learning_rate": 2.998486865278898e-05,
|
||
|
|
"loss": 0.08481158018112182,
|
||
|
|
"mean_token_accuracy": 0.9782793119549751,
|
||
|
|
"num_tokens": 196997.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.08185080708935857,
|
||
|
|
"epoch": 0.10666666666666667,
|
||
|
|
"grad_norm": 0.6273307800292969,
|
||
|
|
"learning_rate": 2.9976239687695204e-05,
|
||
|
|
"loss": 0.07777262926101684,
|
||
|
|
"mean_token_accuracy": 0.9786890134215355,
|
||
|
|
"num_tokens": 218874.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.09334154520183802,
|
||
|
|
"epoch": 0.11733333333333333,
|
||
|
|
"grad_norm": 0.4166223406791687,
|
||
|
|
"learning_rate": 2.9965673884706868e-05,
|
||
|
|
"loss": 0.08573432564735413,
|
||
|
|
"mean_token_accuracy": 0.9767304107546806,
|
||
|
|
"num_tokens": 241605.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.08369456762447954,
|
||
|
|
"epoch": 0.128,
|
||
|
|
"grad_norm": 0.40699025988578796,
|
||
|
|
"learning_rate": 2.9953172610271622e-05,
|
||
|
|
"loss": 0.07644501924514771,
|
||
|
|
"mean_token_accuracy": 0.9783323392271995,
|
||
|
|
"num_tokens": 263296.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.070164034049958,
|
||
|
|
"epoch": 0.13866666666666666,
|
||
|
|
"grad_norm": 0.48113104701042175,
|
||
|
|
"learning_rate": 2.9938737481146593e-05,
|
||
|
|
"loss": 0.06861301660537719,
|
||
|
|
"mean_token_accuracy": 0.9820019453763962,
|
||
|
|
"num_tokens": 283202.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07659044032916426,
|
||
|
|
"epoch": 0.14933333333333335,
|
||
|
|
"grad_norm": 0.40626060962677,
|
||
|
|
"learning_rate": 2.9922370364189247e-05,
|
||
|
|
"loss": 0.07213873863220215,
|
||
|
|
"mean_token_accuracy": 0.9799231603741646,
|
||
|
|
"num_tokens": 303974.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07639030702412128,
|
||
|
|
"epoch": 0.16,
|
||
|
|
"grad_norm": 0.43795546889305115,
|
||
|
|
"learning_rate": 2.990407337611601e-05,
|
||
|
|
"loss": 0.07973278760910034,
|
||
|
|
"mean_token_accuracy": 0.9775013774633408,
|
||
|
|
"num_tokens": 326032.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07721547149121762,
|
||
|
|
"epoch": 0.17066666666666666,
|
||
|
|
"grad_norm": 0.3847689926624298,
|
||
|
|
"learning_rate": 2.988384888322847e-05,
|
||
|
|
"loss": 0.07336270809173584,
|
||
|
|
"mean_token_accuracy": 0.9787119507789612,
|
||
|
|
"num_tokens": 348471.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07721726167947054,
|
||
|
|
"epoch": 0.18133333333333335,
|
||
|
|
"grad_norm": 0.27838024497032166,
|
||
|
|
"learning_rate": 2.9861699501107378e-05,
|
||
|
|
"loss": 0.07494103908538818,
|
||
|
|
"mean_token_accuracy": 0.9785683915019036,
|
||
|
|
"num_tokens": 369782.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07658242103643716,
|
||
|
|
"epoch": 0.192,
|
||
|
|
"grad_norm": 0.31607189774513245,
|
||
|
|
"learning_rate": 2.983762809427437e-05,
|
||
|
|
"loss": 0.07525045275688172,
|
||
|
|
"mean_token_accuracy": 0.9776499375700951,
|
||
|
|
"num_tokens": 392696.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.075563720241189,
|
||
|
|
"epoch": 0.20266666666666666,
|
||
|
|
"grad_norm": 0.3598628640174866,
|
||
|
|
"learning_rate": 2.981163777582151e-05,
|
||
|
|
"loss": 0.07243417501449585,
|
||
|
|
"mean_token_accuracy": 0.9788009360432625,
|
||
|
|
"num_tokens": 414821.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07607982028275728,
|
||
|
|
"epoch": 0.21333333333333335,
|
||
|
|
"grad_norm": 0.40936508774757385,
|
||
|
|
"learning_rate": 2.9783731907008686e-05,
|
||
|
|
"loss": 0.07915560007095337,
|
||
|
|
"mean_token_accuracy": 0.9773870885372162,
|
||
|
|
"num_tokens": 438146.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07262871153652668,
|
||
|
|
"epoch": 0.224,
|
||
|
|
"grad_norm": 0.381472647190094,
|
||
|
|
"learning_rate": 2.9753914096828898e-05,
|
||
|
|
"loss": 0.06799554228782653,
|
||
|
|
"mean_token_accuracy": 0.9803747221827507,
|
||
|
|
"num_tokens": 458624.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.08185875937342643,
|
||
|
|
"epoch": 0.23466666666666666,
|
||
|
|
"grad_norm": 0.5101166367530823,
|
||
|
|
"learning_rate": 2.9722188201541517e-05,
|
||
|
|
"loss": 0.08290064930915833,
|
||
|
|
"mean_token_accuracy": 0.9758498474955559,
|
||
|
|
"num_tokens": 481486.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0798154235817492,
|
||
|
|
"epoch": 0.24533333333333332,
|
||
|
|
"grad_norm": 0.46328306198120117,
|
||
|
|
"learning_rate": 2.968855832417357e-05,
|
||
|
|
"loss": 0.07726043462753296,
|
||
|
|
"mean_token_accuracy": 0.9774591788649559,
|
||
|
|
"num_tokens": 504517.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0712804809678346,
|
||
|
|
"epoch": 0.256,
|
||
|
|
"grad_norm": 0.34927302598953247,
|
||
|
|
"learning_rate": 2.965302881398911e-05,
|
||
|
|
"loss": 0.0709686040878296,
|
||
|
|
"mean_token_accuracy": 0.9796265155076981,
|
||
|
|
"num_tokens": 525475.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06547207403928042,
|
||
|
|
"epoch": 0.26666666666666666,
|
||
|
|
"grad_norm": 0.6727742552757263,
|
||
|
|
"learning_rate": 2.9615604265926728e-05,
|
||
|
|
"loss": 0.0662114143371582,
|
||
|
|
"mean_token_accuracy": 0.9803611278533936,
|
||
|
|
"num_tokens": 545600.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06710066087543964,
|
||
|
|
"epoch": 0.2773333333333333,
|
||
|
|
"grad_norm": 0.45624563097953796,
|
||
|
|
"learning_rate": 2.957628952000531e-05,
|
||
|
|
"loss": 0.06518577337265015,
|
||
|
|
"mean_token_accuracy": 0.9814524441957474,
|
||
|
|
"num_tokens": 565706.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0751929541118443,
|
||
|
|
"epoch": 0.288,
|
||
|
|
"grad_norm": 0.3284471929073334,
|
||
|
|
"learning_rate": 2.9535089660698077e-05,
|
||
|
|
"loss": 0.07515062689781189,
|
||
|
|
"mean_token_accuracy": 0.9783789336681366,
|
||
|
|
"num_tokens": 587393.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07246321747079491,
|
||
|
|
"epoch": 0.2986666666666667,
|
||
|
|
"grad_norm": 0.3948511779308319,
|
||
|
|
"learning_rate": 2.9492010016275036e-05,
|
||
|
|
"loss": 0.07291712760925292,
|
||
|
|
"mean_token_accuracy": 0.9785362645983696,
|
||
|
|
"num_tokens": 609171.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06350514343939721,
|
||
|
|
"epoch": 0.30933333333333335,
|
||
|
|
"grad_norm": 0.314139723777771,
|
||
|
|
"learning_rate": 2.944705615811389e-05,
|
||
|
|
"loss": 0.06677749156951904,
|
||
|
|
"mean_token_accuracy": 0.9803237706422806,
|
||
|
|
"num_tokens": 630239.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06738578667864203,
|
||
|
|
"epoch": 0.32,
|
||
|
|
"grad_norm": 0.36207115650177,
|
||
|
|
"learning_rate": 2.9400233899979493e-05,
|
||
|
|
"loss": 0.06742758750915527,
|
||
|
|
"mean_token_accuracy": 0.9798387750983238,
|
||
|
|
"num_tokens": 651094.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07454993184655904,
|
||
|
|
"epoch": 0.33066666666666666,
|
||
|
|
"grad_norm": 0.3180656433105469,
|
||
|
|
"learning_rate": 2.9351549297271985e-05,
|
||
|
|
"loss": 0.07321251630783081,
|
||
|
|
"mean_token_accuracy": 0.9780681982636452,
|
||
|
|
"num_tokens": 673562.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07280182931572199,
|
||
|
|
"epoch": 0.3413333333333333,
|
||
|
|
"grad_norm": 0.32510796189308167,
|
||
|
|
"learning_rate": 2.9301008646243653e-05,
|
||
|
|
"loss": 0.07445473074913025,
|
||
|
|
"mean_token_accuracy": 0.9777527928352356,
|
||
|
|
"num_tokens": 695144.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06629417887888849,
|
||
|
|
"epoch": 0.352,
|
||
|
|
"grad_norm": 0.3238341808319092,
|
||
|
|
"learning_rate": 2.9248618483184658e-05,
|
||
|
|
"loss": 0.06477652788162232,
|
||
|
|
"mean_token_accuracy": 0.9803259864449501,
|
||
|
|
"num_tokens": 715736.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07434157487004996,
|
||
|
|
"epoch": 0.3626666666666667,
|
||
|
|
"grad_norm": 0.4881466329097748,
|
||
|
|
"learning_rate": 2.9194385583577713e-05,
|
||
|
|
"loss": 0.074578857421875,
|
||
|
|
"mean_token_accuracy": 0.978272306919098,
|
||
|
|
"num_tokens": 738223.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06839693682268262,
|
||
|
|
"epoch": 0.37333333333333335,
|
||
|
|
"grad_norm": 0.28420260548591614,
|
||
|
|
"learning_rate": 2.913831696122183e-05,
|
||
|
|
"loss": 0.07069446444511414,
|
||
|
|
"mean_token_accuracy": 0.9783747613430023,
|
||
|
|
"num_tokens": 759757.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0676080210134387,
|
||
|
|
"epoch": 0.384,
|
||
|
|
"grad_norm": 0.39809709787368774,
|
||
|
|
"learning_rate": 2.9080419867325237e-05,
|
||
|
|
"loss": 0.06743242740631103,
|
||
|
|
"mean_token_accuracy": 0.9805570602416992,
|
||
|
|
"num_tokens": 780468.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07527220472693444,
|
||
|
|
"epoch": 0.39466666666666667,
|
||
|
|
"grad_norm": 0.35423487424850464,
|
||
|
|
"learning_rate": 2.9020701789567604e-05,
|
||
|
|
"loss": 0.0771526575088501,
|
||
|
|
"mean_token_accuracy": 0.9762488156557083,
|
||
|
|
"num_tokens": 802965.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0742669789120555,
|
||
|
|
"epoch": 0.4053333333333333,
|
||
|
|
"grad_norm": 0.3001997172832489,
|
||
|
|
"learning_rate": 2.895917045113168e-05,
|
||
|
|
"loss": 0.07353838682174682,
|
||
|
|
"mean_token_accuracy": 0.9768529623746872,
|
||
|
|
"num_tokens": 824952.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07476197639480234,
|
||
|
|
"epoch": 0.416,
|
||
|
|
"grad_norm": 0.477760374546051,
|
||
|
|
"learning_rate": 2.8895833809704472e-05,
|
||
|
|
"loss": 0.075287127494812,
|
||
|
|
"mean_token_accuracy": 0.9776960402727127,
|
||
|
|
"num_tokens": 847335.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07617697194218635,
|
||
|
|
"epoch": 0.4266666666666667,
|
||
|
|
"grad_norm": 0.257163941860199,
|
||
|
|
"learning_rate": 2.88307000564481e-05,
|
||
|
|
"loss": 0.07502832412719726,
|
||
|
|
"mean_token_accuracy": 0.977412973344326,
|
||
|
|
"num_tokens": 869694.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06724974531680346,
|
||
|
|
"epoch": 0.43733333333333335,
|
||
|
|
"grad_norm": 0.2475440800189972,
|
||
|
|
"learning_rate": 2.8763777614940456e-05,
|
||
|
|
"loss": 0.06770724058151245,
|
||
|
|
"mean_token_accuracy": 0.9807002753019333,
|
||
|
|
"num_tokens": 890247.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07065033931285143,
|
||
|
|
"epoch": 0.448,
|
||
|
|
"grad_norm": 0.28949040174484253,
|
||
|
|
"learning_rate": 2.8695075140085806e-05,
|
||
|
|
"loss": 0.0740054190158844,
|
||
|
|
"mean_token_accuracy": 0.9777054205536843,
|
||
|
|
"num_tokens": 912437.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07398124393075704,
|
||
|
|
"epoch": 0.45866666666666667,
|
||
|
|
"grad_norm": 0.2573949694633484,
|
||
|
|
"learning_rate": 2.862460151699546e-05,
|
||
|
|
"loss": 0.07121715545654297,
|
||
|
|
"mean_token_accuracy": 0.9787738516926765,
|
||
|
|
"num_tokens": 933823.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06237205946817994,
|
||
|
|
"epoch": 0.4693333333333333,
|
||
|
|
"grad_norm": 0.2926589250564575,
|
||
|
|
"learning_rate": 2.8552365859838705e-05,
|
||
|
|
"loss": 0.06375741958618164,
|
||
|
|
"mean_token_accuracy": 0.981339943408966,
|
||
|
|
"num_tokens": 954214.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06579331294633448,
|
||
|
|
"epoch": 0.48,
|
||
|
|
"grad_norm": 0.2862912714481354,
|
||
|
|
"learning_rate": 2.8478377510664084e-05,
|
||
|
|
"loss": 0.06657766103744507,
|
||
|
|
"mean_token_accuracy": 0.9801932483911514,
|
||
|
|
"num_tokens": 975338.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06900884290225803,
|
||
|
|
"epoch": 0.49066666666666664,
|
||
|
|
"grad_norm": 0.2465200126171112,
|
||
|
|
"learning_rate": 2.8402646038191212e-05,
|
||
|
|
"loss": 0.07071024179458618,
|
||
|
|
"mean_token_accuracy": 0.9791238903999329,
|
||
|
|
"num_tokens": 996945.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07488874141126871,
|
||
|
|
"epoch": 0.5013333333333333,
|
||
|
|
"grad_norm": 0.3744136393070221,
|
||
|
|
"learning_rate": 2.832518123657328e-05,
|
||
|
|
"loss": 0.07590996623039245,
|
||
|
|
"mean_token_accuracy": 0.9782673969864846,
|
||
|
|
"num_tokens": 1019406.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06512500997632742,
|
||
|
|
"epoch": 0.512,
|
||
|
|
"grad_norm": 0.354690819978714,
|
||
|
|
"learning_rate": 2.824599312413039e-05,
|
||
|
|
"loss": 0.06666624546051025,
|
||
|
|
"mean_token_accuracy": 0.9810455769300461,
|
||
|
|
"num_tokens": 1040080.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07058156430721282,
|
||
|
|
"epoch": 0.5226666666666666,
|
||
|
|
"grad_norm": 0.2862028181552887,
|
||
|
|
"learning_rate": 2.816509194205394e-05,
|
||
|
|
"loss": 0.07034226655960082,
|
||
|
|
"mean_token_accuracy": 0.9796382382512092,
|
||
|
|
"num_tokens": 1061056.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06635954724624753,
|
||
|
|
"epoch": 0.5333333333333333,
|
||
|
|
"grad_norm": 0.3258682191371918,
|
||
|
|
"learning_rate": 2.808248815308214e-05,
|
||
|
|
"loss": 0.06933177709579467,
|
||
|
|
"mean_token_accuracy": 0.979850122332573,
|
||
|
|
"num_tokens": 1082431.0,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07130869440734386,
|
||
|
|
"epoch": 0.544,
|
||
|
|
"grad_norm": 0.4001695215702057,
|
||
|
|
"learning_rate": 2.7998192440146885e-05,
|
||
|
|
"loss": 0.07018501758575439,
|
||
|
|
"mean_token_accuracy": 0.9788232401013375,
|
||
|
|
"num_tokens": 1103056.0,
|
||
|
|
"step": 1020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06629347717389464,
|
||
|
|
"epoch": 0.5546666666666666,
|
||
|
|
"grad_norm": 0.3068975806236267,
|
||
|
|
"learning_rate": 2.7912215704992178e-05,
|
||
|
|
"loss": 0.06562011241912842,
|
||
|
|
"mean_token_accuracy": 0.9801233530044555,
|
||
|
|
"num_tokens": 1123629.0,
|
||
|
|
"step": 1040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0669340806081891,
|
||
|
|
"epoch": 0.5653333333333334,
|
||
|
|
"grad_norm": 0.291361927986145,
|
||
|
|
"learning_rate": 2.7824569066764228e-05,
|
||
|
|
"loss": 0.06813285946846008,
|
||
|
|
"mean_token_accuracy": 0.9795377850532532,
|
||
|
|
"num_tokens": 1145205.0,
|
||
|
|
"step": 1060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06657159719616175,
|
||
|
|
"epoch": 0.576,
|
||
|
|
"grad_norm": 0.4103650748729706,
|
||
|
|
"learning_rate": 2.7735263860573427e-05,
|
||
|
|
"loss": 0.0706522822380066,
|
||
|
|
"mean_token_accuracy": 0.9789624258875846,
|
||
|
|
"num_tokens": 1166152.0,
|
||
|
|
"step": 1080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06565243299119175,
|
||
|
|
"epoch": 0.5866666666666667,
|
||
|
|
"grad_norm": 0.19713713228702545,
|
||
|
|
"learning_rate": 2.7644311636028443e-05,
|
||
|
|
"loss": 0.0657187283039093,
|
||
|
|
"mean_token_accuracy": 0.9809520095586777,
|
||
|
|
"num_tokens": 1186408.0,
|
||
|
|
"step": 1100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06613961681723594,
|
||
|
|
"epoch": 0.5973333333333334,
|
||
|
|
"grad_norm": 0.38389384746551514,
|
||
|
|
"learning_rate": 2.7551724155742496e-05,
|
||
|
|
"loss": 0.06793384552001953,
|
||
|
|
"mean_token_accuracy": 0.9800930395722389,
|
||
|
|
"num_tokens": 1207073.0,
|
||
|
|
"step": 1120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06301267836242914,
|
||
|
|
"epoch": 0.608,
|
||
|
|
"grad_norm": 0.28483763337135315,
|
||
|
|
"learning_rate": 2.7457513393812165e-05,
|
||
|
|
"loss": 0.06698591113090516,
|
||
|
|
"mean_token_accuracy": 0.9796709790825844,
|
||
|
|
"num_tokens": 1227985.0,
|
||
|
|
"step": 1140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06924524456262589,
|
||
|
|
"epoch": 0.6186666666666667,
|
||
|
|
"grad_norm": 0.3032520115375519,
|
||
|
|
"learning_rate": 2.7361691534268794e-05,
|
||
|
|
"loss": 0.0688162088394165,
|
||
|
|
"mean_token_accuracy": 0.9792484521865845,
|
||
|
|
"num_tokens": 1249420.0,
|
||
|
|
"step": 1160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06591361574828625,
|
||
|
|
"epoch": 0.6293333333333333,
|
||
|
|
"grad_norm": 0.2796316146850586,
|
||
|
|
"learning_rate": 2.726427096950277e-05,
|
||
|
|
"loss": 0.06471214890480041,
|
||
|
|
"mean_token_accuracy": 0.9802895054221153,
|
||
|
|
"num_tokens": 1269803.0,
|
||
|
|
"step": 1180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06655512368306518,
|
||
|
|
"epoch": 0.64,
|
||
|
|
"grad_norm": 0.334458589553833,
|
||
|
|
"learning_rate": 2.7165264298660843e-05,
|
||
|
|
"loss": 0.0680499792098999,
|
||
|
|
"mean_token_accuracy": 0.9798945024609566,
|
||
|
|
"num_tokens": 1290820.0,
|
||
|
|
"step": 1200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07104279901832342,
|
||
|
|
"epoch": 0.6506666666666666,
|
||
|
|
"grad_norm": 0.2985312044620514,
|
||
|
|
"learning_rate": 2.7064684326016705e-05,
|
||
|
|
"loss": 0.07158678770065308,
|
||
|
|
"mean_token_accuracy": 0.9790138527750969,
|
||
|
|
"num_tokens": 1312256.0,
|
||
|
|
"step": 1220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07178505323827267,
|
||
|
|
"epoch": 0.6613333333333333,
|
||
|
|
"grad_norm": 0.2647643983364105,
|
||
|
|
"learning_rate": 2.696254405931506e-05,
|
||
|
|
"loss": 0.07087129950523377,
|
||
|
|
"mean_token_accuracy": 0.9788700684905052,
|
||
|
|
"num_tokens": 1333659.0,
|
||
|
|
"step": 1240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07248318092897535,
|
||
|
|
"epoch": 0.672,
|
||
|
|
"grad_norm": 0.33957013487815857,
|
||
|
|
"learning_rate": 2.685885670808935e-05,
|
||
|
|
"loss": 0.07625460624694824,
|
||
|
|
"mean_token_accuracy": 0.9776020765304565,
|
||
|
|
"num_tokens": 1356166.0,
|
||
|
|
"step": 1260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06933322567492724,
|
||
|
|
"epoch": 0.6826666666666666,
|
||
|
|
"grad_norm": 0.3401638865470886,
|
||
|
|
"learning_rate": 2.6753635681953432e-05,
|
||
|
|
"loss": 0.07209213972091674,
|
||
|
|
"mean_token_accuracy": 0.979287999868393,
|
||
|
|
"num_tokens": 1377248.0,
|
||
|
|
"step": 1280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07241465076804161,
|
||
|
|
"epoch": 0.6933333333333334,
|
||
|
|
"grad_norm": 0.3512662351131439,
|
||
|
|
"learning_rate": 2.66468945888673e-05,
|
||
|
|
"loss": 0.07179180383682252,
|
||
|
|
"mean_token_accuracy": 0.9785149216651916,
|
||
|
|
"num_tokens": 1399215.0,
|
||
|
|
"step": 1300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06668442655354738,
|
||
|
|
"epoch": 0.704,
|
||
|
|
"grad_norm": 0.31074854731559753,
|
||
|
|
"learning_rate": 2.653864723337725e-05,
|
||
|
|
"loss": 0.06842232942581176,
|
||
|
|
"mean_token_accuracy": 0.9793056011199951,
|
||
|
|
"num_tokens": 1421156.0,
|
||
|
|
"step": 1320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07508801557123661,
|
||
|
|
"epoch": 0.7146666666666667,
|
||
|
|
"grad_norm": 0.23781085014343262,
|
||
|
|
"learning_rate": 2.6428907614830547e-05,
|
||
|
|
"loss": 0.07381449937820435,
|
||
|
|
"mean_token_accuracy": 0.9774842232465744,
|
||
|
|
"num_tokens": 1444107.0,
|
||
|
|
"step": 1340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07022066600620747,
|
||
|
|
"epoch": 0.7253333333333334,
|
||
|
|
"grad_norm": 0.2902912497520447,
|
||
|
|
"learning_rate": 2.631768992556493e-05,
|
||
|
|
"loss": 0.07421112656593323,
|
||
|
|
"mean_token_accuracy": 0.9773566707968712,
|
||
|
|
"num_tokens": 1466646.0,
|
||
|
|
"step": 1360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07529082838445902,
|
||
|
|
"epoch": 0.736,
|
||
|
|
"grad_norm": 0.29716333746910095,
|
||
|
|
"learning_rate": 2.6205008549073156e-05,
|
||
|
|
"loss": 0.07513617277145386,
|
||
|
|
"mean_token_accuracy": 0.9776451155543328,
|
||
|
|
"num_tokens": 1489236.0,
|
||
|
|
"step": 1380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07013567788526416,
|
||
|
|
"epoch": 0.7466666666666667,
|
||
|
|
"grad_norm": 0.32034385204315186,
|
||
|
|
"learning_rate": 2.6090878058142826e-05,
|
||
|
|
"loss": 0.07192614078521728,
|
||
|
|
"mean_token_accuracy": 0.9784543365240097,
|
||
|
|
"num_tokens": 1511165.0,
|
||
|
|
"step": 1400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06659635296091437,
|
||
|
|
"epoch": 0.7573333333333333,
|
||
|
|
"grad_norm": 0.21232427656650543,
|
||
|
|
"learning_rate": 2.5975313212971717e-05,
|
||
|
|
"loss": 0.06635284423828125,
|
||
|
|
"mean_token_accuracy": 0.9803870663046836,
|
||
|
|
"num_tokens": 1532360.0,
|
||
|
|
"step": 1420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07205540081486106,
|
||
|
|
"epoch": 0.768,
|
||
|
|
"grad_norm": 0.24671520292758942,
|
||
|
|
"learning_rate": 2.585832895925889e-05,
|
||
|
|
"loss": 0.07270323038101197,
|
||
|
|
"mean_token_accuracy": 0.9785439759492874,
|
||
|
|
"num_tokens": 1554448.0,
|
||
|
|
"step": 1440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06918675852939486,
|
||
|
|
"epoch": 0.7786666666666666,
|
||
|
|
"grad_norm": 0.2514943480491638,
|
||
|
|
"learning_rate": 2.5739940426271794e-05,
|
||
|
|
"loss": 0.06965571045875549,
|
||
|
|
"mean_token_accuracy": 0.9788892433047295,
|
||
|
|
"num_tokens": 1576245.0,
|
||
|
|
"step": 1460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06469840593636036,
|
||
|
|
"epoch": 0.7893333333333333,
|
||
|
|
"grad_norm": 0.3494434952735901,
|
||
|
|
"learning_rate": 2.562016292488965e-05,
|
||
|
|
"loss": 0.06652198433876037,
|
||
|
|
"mean_token_accuracy": 0.9809101298451424,
|
||
|
|
"num_tokens": 1596485.0,
|
||
|
|
"step": 1480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07068701386451721,
|
||
|
|
"epoch": 0.8,
|
||
|
|
"grad_norm": 0.281946063041687,
|
||
|
|
"learning_rate": 2.5499011945623314e-05,
|
||
|
|
"loss": 0.07348206043243408,
|
||
|
|
"mean_token_accuracy": 0.9781546071171761,
|
||
|
|
"num_tokens": 1618200.0,
|
||
|
|
"step": 1500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06995291169732809,
|
||
|
|
"epoch": 0.8106666666666666,
|
||
|
|
"grad_norm": 0.23206466436386108,
|
||
|
|
"learning_rate": 2.537650315661196e-05,
|
||
|
|
"loss": 0.06693890690803528,
|
||
|
|
"mean_token_accuracy": 0.9801010102033615,
|
||
|
|
"num_tokens": 1639174.0,
|
||
|
|
"step": 1520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06840123003348708,
|
||
|
|
"epoch": 0.8213333333333334,
|
||
|
|
"grad_norm": 0.3676995635032654,
|
||
|
|
"learning_rate": 2.5252652401596733e-05,
|
||
|
|
"loss": 0.07000104188919068,
|
||
|
|
"mean_token_accuracy": 0.9784165650606156,
|
||
|
|
"num_tokens": 1661359.0,
|
||
|
|
"step": 1540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0646398707292974,
|
||
|
|
"epoch": 0.832,
|
||
|
|
"grad_norm": 0.22217804193496704,
|
||
|
|
"learning_rate": 2.512747569787173e-05,
|
||
|
|
"loss": 0.06517070531845093,
|
||
|
|
"mean_token_accuracy": 0.9804639294743538,
|
||
|
|
"num_tokens": 1682342.0,
|
||
|
|
"step": 1560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07203069580718875,
|
||
|
|
"epoch": 0.8426666666666667,
|
||
|
|
"grad_norm": 0.33636361360549927,
|
||
|
|
"learning_rate": 2.5000989234212538e-05,
|
||
|
|
"loss": 0.0767048716545105,
|
||
|
|
"mean_token_accuracy": 0.9769723698496818,
|
||
|
|
"num_tokens": 1705410.0,
|
||
|
|
"step": 1580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07144555728882551,
|
||
|
|
"epoch": 0.8533333333333334,
|
||
|
|
"grad_norm": 0.41735950112342834,
|
||
|
|
"learning_rate": 2.4873209368782542e-05,
|
||
|
|
"loss": 0.07214229702949523,
|
||
|
|
"mean_token_accuracy": 0.9783873930573463,
|
||
|
|
"num_tokens": 1727533.0,
|
||
|
|
"step": 1600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07258805707097053,
|
||
|
|
"epoch": 0.864,
|
||
|
|
"grad_norm": 0.2509184777736664,
|
||
|
|
"learning_rate": 2.474415262701742e-05,
|
||
|
|
"loss": 0.07374660968780518,
|
||
|
|
"mean_token_accuracy": 0.9784314125776291,
|
||
|
|
"num_tokens": 1749324.0,
|
||
|
|
"step": 1620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06801199689507484,
|
||
|
|
"epoch": 0.8746666666666667,
|
||
|
|
"grad_norm": 0.2840649485588074,
|
||
|
|
"learning_rate": 2.4613835699487926e-05,
|
||
|
|
"loss": 0.06742731928825378,
|
||
|
|
"mean_token_accuracy": 0.9799756482243538,
|
||
|
|
"num_tokens": 1770154.0,
|
||
|
|
"step": 1640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06611601263284683,
|
||
|
|
"epoch": 0.8853333333333333,
|
||
|
|
"grad_norm": 0.32055601477622986,
|
||
|
|
"learning_rate": 2.4482275439741318e-05,
|
||
|
|
"loss": 0.06912029981613159,
|
||
|
|
"mean_token_accuracy": 0.9791274040937423,
|
||
|
|
"num_tokens": 1791563.0,
|
||
|
|
"step": 1660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07015209766104817,
|
||
|
|
"epoch": 0.896,
|
||
|
|
"grad_norm": 0.322442889213562,
|
||
|
|
"learning_rate": 2.4349488862121777e-05,
|
||
|
|
"loss": 0.0710118293762207,
|
||
|
|
"mean_token_accuracy": 0.9784337431192398,
|
||
|
|
"num_tokens": 1814153.0,
|
||
|
|
"step": 1680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07105656629428267,
|
||
|
|
"epoch": 0.9066666666666666,
|
||
|
|
"grad_norm": 0.33281370997428894,
|
||
|
|
"learning_rate": 2.421549313956996e-05,
|
||
|
|
"loss": 0.07393972873687744,
|
||
|
|
"mean_token_accuracy": 0.9770426079630852,
|
||
|
|
"num_tokens": 1836011.0,
|
||
|
|
"step": 1700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06153039713390172,
|
||
|
|
"epoch": 0.9173333333333333,
|
||
|
|
"grad_norm": 0.34345221519470215,
|
||
|
|
"learning_rate": 2.4080305601402077e-05,
|
||
|
|
"loss": 0.06438595056533813,
|
||
|
|
"mean_token_accuracy": 0.9811754852533341,
|
||
|
|
"num_tokens": 1856327.0,
|
||
|
|
"step": 1720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06947178347036242,
|
||
|
|
"epoch": 0.928,
|
||
|
|
"grad_norm": 0.23315641283988953,
|
||
|
|
"learning_rate": 2.3943943731068726e-05,
|
||
|
|
"loss": 0.06981109380722046,
|
||
|
|
"mean_token_accuracy": 0.9784324377775192,
|
||
|
|
"num_tokens": 1878263.0,
|
||
|
|
"step": 1740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06802130006253719,
|
||
|
|
"epoch": 0.9386666666666666,
|
||
|
|
"grad_norm": 0.2618308365345001,
|
||
|
|
"learning_rate": 2.3806425163893823e-05,
|
||
|
|
"loss": 0.06859763860702514,
|
||
|
|
"mean_token_accuracy": 0.9791776061058044,
|
||
|
|
"num_tokens": 1899636.0,
|
||
|
|
"step": 1760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06973028304055333,
|
||
|
|
"epoch": 0.9493333333333334,
|
||
|
|
"grad_norm": 0.24618478119373322,
|
||
|
|
"learning_rate": 2.366776768479384e-05,
|
||
|
|
"loss": 0.07086095809936524,
|
||
|
|
"mean_token_accuracy": 0.9786002859473228,
|
||
|
|
"num_tokens": 1921047.0,
|
||
|
|
"step": 1780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06561295241117478,
|
||
|
|
"epoch": 0.96,
|
||
|
|
"grad_norm": 0.2758350670337677,
|
||
|
|
"learning_rate": 2.352798922597778e-05,
|
||
|
|
"loss": 0.06786344051361085,
|
||
|
|
"mean_token_accuracy": 0.9793999254703522,
|
||
|
|
"num_tokens": 1942332.0,
|
||
|
|
"step": 1800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.064028827752918,
|
||
|
|
"epoch": 0.9706666666666667,
|
||
|
|
"grad_norm": 0.39498090744018555,
|
||
|
|
"learning_rate": 2.3387107864627988e-05,
|
||
|
|
"loss": 0.06252858638763428,
|
||
|
|
"mean_token_accuracy": 0.9808908835053444,
|
||
|
|
"num_tokens": 1962893.0,
|
||
|
|
"step": 1820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.05734303398057818,
|
||
|
|
"epoch": 0.9813333333333333,
|
||
|
|
"grad_norm": 0.39145660400390625,
|
||
|
|
"learning_rate": 2.324514182056233e-05,
|
||
|
|
"loss": 0.06022765040397644,
|
||
|
|
"mean_token_accuracy": 0.9816997528076172,
|
||
|
|
"num_tokens": 1982973.0,
|
||
|
|
"step": 1840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0701704291626811,
|
||
|
|
"epoch": 0.992,
|
||
|
|
"grad_norm": 0.23364675045013428,
|
||
|
|
"learning_rate": 2.310210945387783e-05,
|
||
|
|
"loss": 0.07281829714775086,
|
||
|
|
"mean_token_accuracy": 0.9779222890734672,
|
||
|
|
"num_tokens": 2005088.0,
|
||
|
|
"step": 1860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06261860271915794,
|
||
|
|
"epoch": 1.0026666666666666,
|
||
|
|
"grad_norm": 0.24298612773418427,
|
||
|
|
"learning_rate": 2.2958029262576248e-05,
|
||
|
|
"loss": 0.06308226585388184,
|
||
|
|
"mean_token_accuracy": 0.9821192339062691,
|
||
|
|
"num_tokens": 2025522.0,
|
||
|
|
"step": 1880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0643264465034008,
|
||
|
|
"epoch": 1.0133333333333334,
|
||
|
|
"grad_norm": 0.2755739688873291,
|
||
|
|
"learning_rate": 2.2812919880171748e-05,
|
||
|
|
"loss": 0.06683170795440674,
|
||
|
|
"mean_token_accuracy": 0.9803125351667404,
|
||
|
|
"num_tokens": 2046060.0,
|
||
|
|
"step": 1900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07090397626161575,
|
||
|
|
"epoch": 1.024,
|
||
|
|
"grad_norm": 0.3217398524284363,
|
||
|
|
"learning_rate": 2.266680007328108e-05,
|
||
|
|
"loss": 0.07337687611579895,
|
||
|
|
"mean_token_accuracy": 0.9777734145522118,
|
||
|
|
"num_tokens": 2067635.0,
|
||
|
|
"step": 1920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06721528638154269,
|
||
|
|
"epoch": 1.0346666666666666,
|
||
|
|
"grad_norm": 0.40361738204956055,
|
||
|
|
"learning_rate": 2.2519688739196567e-05,
|
||
|
|
"loss": 0.07007733583450318,
|
||
|
|
"mean_token_accuracy": 0.9789602175354958,
|
||
|
|
"num_tokens": 2089082.0,
|
||
|
|
"step": 1940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07042132476344705,
|
||
|
|
"epoch": 1.0453333333333332,
|
||
|
|
"grad_norm": 0.2519868314266205,
|
||
|
|
"learning_rate": 2.237160490344214e-05,
|
||
|
|
"loss": 0.0704314112663269,
|
||
|
|
"mean_token_accuracy": 0.9786124229431152,
|
||
|
|
"num_tokens": 2111237.0,
|
||
|
|
"step": 1960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06644694982096552,
|
||
|
|
"epoch": 1.056,
|
||
|
|
"grad_norm": 0.2761074900627136,
|
||
|
|
"learning_rate": 2.2222567717312815e-05,
|
||
|
|
"loss": 0.06676498651504517,
|
||
|
|
"mean_token_accuracy": 0.9803151816129685,
|
||
|
|
"num_tokens": 2133157.0,
|
||
|
|
"step": 1980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0724240118637681,
|
||
|
|
"epoch": 1.0666666666666667,
|
||
|
|
"grad_norm": 0.31547167897224426,
|
||
|
|
"learning_rate": 2.207259645539794e-05,
|
||
|
|
"loss": 0.07529684901237488,
|
||
|
|
"mean_token_accuracy": 0.977134644985199,
|
||
|
|
"num_tokens": 2156288.0,
|
||
|
|
"step": 2000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0705711885355413,
|
||
|
|
"epoch": 1.0773333333333333,
|
||
|
|
"grad_norm": 0.22879832983016968,
|
||
|
|
"learning_rate": 2.192171051308843e-05,
|
||
|
|
"loss": 0.07181910276412964,
|
||
|
|
"mean_token_accuracy": 0.9787937015295028,
|
||
|
|
"num_tokens": 2178459.0,
|
||
|
|
"step": 2020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06547352969646454,
|
||
|
|
"epoch": 1.088,
|
||
|
|
"grad_norm": 0.23372837901115417,
|
||
|
|
"learning_rate": 2.176992940406841e-05,
|
||
|
|
"loss": 0.06680878400802612,
|
||
|
|
"mean_token_accuracy": 0.9798174753785134,
|
||
|
|
"num_tokens": 2199053.0,
|
||
|
|
"step": 2040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06814751494675875,
|
||
|
|
"epoch": 1.0986666666666667,
|
||
|
|
"grad_norm": 0.3134348690509796,
|
||
|
|
"learning_rate": 2.1617272757791596e-05,
|
||
|
|
"loss": 0.06907396912574768,
|
||
|
|
"mean_token_accuracy": 0.9791154950857163,
|
||
|
|
"num_tokens": 2220356.0,
|
||
|
|
"step": 2060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06495830481871963,
|
||
|
|
"epoch": 1.1093333333333333,
|
||
|
|
"grad_norm": 0.29500001668930054,
|
||
|
|
"learning_rate": 2.146376031694264e-05,
|
||
|
|
"loss": 0.06694967150688172,
|
||
|
|
"mean_token_accuracy": 0.9795457676053048,
|
||
|
|
"num_tokens": 2241687.0,
|
||
|
|
"step": 2080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0655874202027917,
|
||
|
|
"epoch": 1.12,
|
||
|
|
"grad_norm": 0.22515356540679932,
|
||
|
|
"learning_rate": 2.130941193488385e-05,
|
||
|
|
"loss": 0.06550711393356323,
|
||
|
|
"mean_token_accuracy": 0.979499951004982,
|
||
|
|
"num_tokens": 2263024.0,
|
||
|
|
"step": 2100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0692840131931007,
|
||
|
|
"epoch": 1.1306666666666667,
|
||
|
|
"grad_norm": 0.21720077097415924,
|
||
|
|
"learning_rate": 2.115424757308764e-05,
|
||
|
|
"loss": 0.07195895910263062,
|
||
|
|
"mean_token_accuracy": 0.9781101942062378,
|
||
|
|
"num_tokens": 2285202.0,
|
||
|
|
"step": 2120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07025102246552706,
|
||
|
|
"epoch": 1.1413333333333333,
|
||
|
|
"grad_norm": 0.2687491476535797,
|
||
|
|
"learning_rate": 2.0998287298554953e-05,
|
||
|
|
"loss": 0.07001820206642151,
|
||
|
|
"mean_token_accuracy": 0.9790668547153473,
|
||
|
|
"num_tokens": 2307135.0,
|
||
|
|
"step": 2140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06896473728120327,
|
||
|
|
"epoch": 1.152,
|
||
|
|
"grad_norm": 0.33234819769859314,
|
||
|
|
"learning_rate": 2.0841551281220024e-05,
|
||
|
|
"loss": 0.07067601680755616,
|
||
|
|
"mean_token_accuracy": 0.9789680764079094,
|
||
|
|
"num_tokens": 2329136.0,
|
||
|
|
"step": 2160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0697830050252378,
|
||
|
|
"epoch": 1.1626666666666667,
|
||
|
|
"grad_norm": 0.23710612952709198,
|
||
|
|
"learning_rate": 2.068405979134189e-05,
|
||
|
|
"loss": 0.07100222706794738,
|
||
|
|
"mean_token_accuracy": 0.97775998711586,
|
||
|
|
"num_tokens": 2352008.0,
|
||
|
|
"step": 2180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0642639453522861,
|
||
|
|
"epoch": 1.1733333333333333,
|
||
|
|
"grad_norm": 0.42563989758491516,
|
||
|
|
"learning_rate": 2.052583319688288e-05,
|
||
|
|
"loss": 0.06657282710075378,
|
||
|
|
"mean_token_accuracy": 0.9803543120622635,
|
||
|
|
"num_tokens": 2372502.0,
|
||
|
|
"step": 2200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07466318933293223,
|
||
|
|
"epoch": 1.184,
|
||
|
|
"grad_norm": 0.2777847647666931,
|
||
|
|
"learning_rate": 2.0366891960874455e-05,
|
||
|
|
"loss": 0.07471616864204407,
|
||
|
|
"mean_token_accuracy": 0.9775146871805191,
|
||
|
|
"num_tokens": 2395472.0,
|
||
|
|
"step": 2220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06853743204846978,
|
||
|
|
"epoch": 1.1946666666666665,
|
||
|
|
"grad_norm": 0.2928735911846161,
|
||
|
|
"learning_rate": 2.020725663877082e-05,
|
||
|
|
"loss": 0.06982612609863281,
|
||
|
|
"mean_token_accuracy": 0.9785092636942864,
|
||
|
|
"num_tokens": 2417456.0,
|
||
|
|
"step": 2240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06352933412417769,
|
||
|
|
"epoch": 1.2053333333333334,
|
||
|
|
"grad_norm": 0.2748047411441803,
|
||
|
|
"learning_rate": 2.0046947875790507e-05,
|
||
|
|
"loss": 0.06415975093841553,
|
||
|
|
"mean_token_accuracy": 0.9810280442237854,
|
||
|
|
"num_tokens": 2437782.0,
|
||
|
|
"step": 2260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06905667120590805,
|
||
|
|
"epoch": 1.216,
|
||
|
|
"grad_norm": 0.4259282052516937,
|
||
|
|
"learning_rate": 1.9885986404246387e-05,
|
||
|
|
"loss": 0.07213917970657349,
|
||
|
|
"mean_token_accuracy": 0.9776696145534516,
|
||
|
|
"num_tokens": 2460043.0,
|
||
|
|
"step": 2280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07057028766721488,
|
||
|
|
"epoch": 1.2266666666666666,
|
||
|
|
"grad_norm": 0.22553683817386627,
|
||
|
|
"learning_rate": 1.9724393040864435e-05,
|
||
|
|
"loss": 0.06978555917739868,
|
||
|
|
"mean_token_accuracy": 0.9783964306116104,
|
||
|
|
"num_tokens": 2481541.0,
|
||
|
|
"step": 2300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06282441029325128,
|
||
|
|
"epoch": 1.2373333333333334,
|
||
|
|
"grad_norm": 0.2527618706226349,
|
||
|
|
"learning_rate": 1.9562188684091544e-05,
|
||
|
|
"loss": 0.06330822110176086,
|
||
|
|
"mean_token_accuracy": 0.9808567300438881,
|
||
|
|
"num_tokens": 2501805.0,
|
||
|
|
"step": 2320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06984690874814987,
|
||
|
|
"epoch": 1.248,
|
||
|
|
"grad_norm": 0.22297634184360504,
|
||
|
|
"learning_rate": 1.9399394311392777e-05,
|
||
|
|
"loss": 0.07097877264022827,
|
||
|
|
"mean_token_accuracy": 0.9779043823480607,
|
||
|
|
"num_tokens": 2524242.0,
|
||
|
|
"step": 2340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.060862915217876436,
|
||
|
|
"epoch": 1.2586666666666666,
|
||
|
|
"grad_norm": 0.18649785220623016,
|
||
|
|
"learning_rate": 1.9236030976538415e-05,
|
||
|
|
"loss": 0.06111966371536255,
|
||
|
|
"mean_token_accuracy": 0.981529700756073,
|
||
|
|
"num_tokens": 2544070.0,
|
||
|
|
"step": 2360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0701494576409459,
|
||
|
|
"epoch": 1.2693333333333334,
|
||
|
|
"grad_norm": 0.43911799788475037,
|
||
|
|
"learning_rate": 1.907211980688112e-05,
|
||
|
|
"loss": 0.07214288115501404,
|
||
|
|
"mean_token_accuracy": 0.9776056706905365,
|
||
|
|
"num_tokens": 2566753.0,
|
||
|
|
"step": 2380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06710393568500876,
|
||
|
|
"epoch": 1.28,
|
||
|
|
"grad_norm": 0.2369464486837387,
|
||
|
|
"learning_rate": 1.8907682000623615e-05,
|
||
|
|
"loss": 0.06771854162216187,
|
||
|
|
"mean_token_accuracy": 0.9792038664221764,
|
||
|
|
"num_tokens": 2588334.0,
|
||
|
|
"step": 2400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06779517000541091,
|
||
|
|
"epoch": 1.2906666666666666,
|
||
|
|
"grad_norm": 0.2957499921321869,
|
||
|
|
"learning_rate": 1.8742738824077135e-05,
|
||
|
|
"loss": 0.06764324307441712,
|
||
|
|
"mean_token_accuracy": 0.9794522881507873,
|
||
|
|
"num_tokens": 2609672.0,
|
||
|
|
"step": 2420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06741884406656026,
|
||
|
|
"epoch": 1.3013333333333335,
|
||
|
|
"grad_norm": 0.19155755639076233,
|
||
|
|
"learning_rate": 1.8577311608911148e-05,
|
||
|
|
"loss": 0.07110410928726196,
|
||
|
|
"mean_token_accuracy": 0.979012542963028,
|
||
|
|
"num_tokens": 2631790.0,
|
||
|
|
"step": 2440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06480904156342149,
|
||
|
|
"epoch": 1.312,
|
||
|
|
"grad_norm": 0.24207216501235962,
|
||
|
|
"learning_rate": 1.8411421749394553e-05,
|
||
|
|
"loss": 0.06625967025756836,
|
||
|
|
"mean_token_accuracy": 0.9789305970072746,
|
||
|
|
"num_tokens": 2653196.0,
|
||
|
|
"step": 2460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07047648271545767,
|
||
|
|
"epoch": 1.3226666666666667,
|
||
|
|
"grad_norm": 0.22696281969547272,
|
||
|
|
"learning_rate": 1.8245090699628847e-05,
|
||
|
|
"loss": 0.07121983766555787,
|
||
|
|
"mean_token_accuracy": 0.9779788121581078,
|
||
|
|
"num_tokens": 2675588.0,
|
||
|
|
"step": 2480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06328712170943618,
|
||
|
|
"epoch": 1.3333333333333333,
|
||
|
|
"grad_norm": 0.37556302547454834,
|
||
|
|
"learning_rate": 1.8078339970773503e-05,
|
||
|
|
"loss": 0.06369008421897888,
|
||
|
|
"mean_token_accuracy": 0.9798499271273613,
|
||
|
|
"num_tokens": 2696544.0,
|
||
|
|
"step": 2500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.05966705903410911,
|
||
|
|
"epoch": 1.3439999999999999,
|
||
|
|
"grad_norm": 0.4442780911922455,
|
||
|
|
"learning_rate": 1.7911191128263998e-05,
|
||
|
|
"loss": 0.061522841453552246,
|
||
|
|
"mean_token_accuracy": 0.9818950071930885,
|
||
|
|
"num_tokens": 2716857.0,
|
||
|
|
"step": 2520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.062313361838459966,
|
||
|
|
"epoch": 1.3546666666666667,
|
||
|
|
"grad_norm": 0.24720695614814758,
|
||
|
|
"learning_rate": 1.7743665789022793e-05,
|
||
|
|
"loss": 0.06486648917198182,
|
||
|
|
"mean_token_accuracy": 0.9798543632030488,
|
||
|
|
"num_tokens": 2737538.0,
|
||
|
|
"step": 2540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06682068817317485,
|
||
|
|
"epoch": 1.3653333333333333,
|
||
|
|
"grad_norm": 0.3359099328517914,
|
||
|
|
"learning_rate": 1.7575785618663694e-05,
|
||
|
|
"loss": 0.06577321290969848,
|
||
|
|
"mean_token_accuracy": 0.9804640114307404,
|
||
|
|
"num_tokens": 2758530.0,
|
||
|
|
"step": 2560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06843016855418682,
|
||
|
|
"epoch": 1.376,
|
||
|
|
"grad_norm": 0.29373666644096375,
|
||
|
|
"learning_rate": 1.7407572328689894e-05,
|
||
|
|
"loss": 0.07291231155395508,
|
||
|
|
"mean_token_accuracy": 0.9776088848710061,
|
||
|
|
"num_tokens": 2781109.0,
|
||
|
|
"step": 2580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06162329772487283,
|
||
|
|
"epoch": 1.3866666666666667,
|
||
|
|
"grad_norm": 0.3116828203201294,
|
||
|
|
"learning_rate": 1.7239047673686063e-05,
|
||
|
|
"loss": 0.06326555609703063,
|
||
|
|
"mean_token_accuracy": 0.9805142045021057,
|
||
|
|
"num_tokens": 2801942.0,
|
||
|
|
"step": 2600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07026779251173139,
|
||
|
|
"epoch": 1.3973333333333333,
|
||
|
|
"grad_norm": 0.2655540406703949,
|
||
|
|
"learning_rate": 1.70702334485049e-05,
|
||
|
|
"loss": 0.06906303167343139,
|
||
|
|
"mean_token_accuracy": 0.9795295283198356,
|
||
|
|
"num_tokens": 2823119.0,
|
||
|
|
"step": 2620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06296397158876062,
|
||
|
|
"epoch": 1.408,
|
||
|
|
"grad_norm": 0.22108644247055054,
|
||
|
|
"learning_rate": 1.690115148544846e-05,
|
||
|
|
"loss": 0.0667952299118042,
|
||
|
|
"mean_token_accuracy": 0.9797157511115074,
|
||
|
|
"num_tokens": 2843803.0,
|
||
|
|
"step": 2640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0670015354640782,
|
||
|
|
"epoch": 1.4186666666666667,
|
||
|
|
"grad_norm": 0.2712651789188385,
|
||
|
|
"learning_rate": 1.673182365144463e-05,
|
||
|
|
"loss": 0.06649012565612793,
|
||
|
|
"mean_token_accuracy": 0.9791848674416542,
|
||
|
|
"num_tokens": 2865230.0,
|
||
|
|
"step": 2660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0670851232483983,
|
||
|
|
"epoch": 1.4293333333333333,
|
||
|
|
"grad_norm": 0.24662579596042633,
|
||
|
|
"learning_rate": 1.656227184521915e-05,
|
||
|
|
"loss": 0.06703668236732482,
|
||
|
|
"mean_token_accuracy": 0.9795497417449951,
|
||
|
|
"num_tokens": 2886358.0,
|
||
|
|
"step": 2680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.062353554228320715,
|
||
|
|
"epoch": 1.44,
|
||
|
|
"grad_norm": 0.3106047809123993,
|
||
|
|
"learning_rate": 1.6392517994463503e-05,
|
||
|
|
"loss": 0.06736364364624023,
|
||
|
|
"mean_token_accuracy": 0.9799954712390899,
|
||
|
|
"num_tokens": 2907066.0,
|
||
|
|
"step": 2700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07080234689638018,
|
||
|
|
"epoch": 1.4506666666666668,
|
||
|
|
"grad_norm": 0.26504889130592346,
|
||
|
|
"learning_rate": 1.622258405299905e-05,
|
||
|
|
"loss": 0.0705980658531189,
|
||
|
|
"mean_token_accuracy": 0.9781270638108254,
|
||
|
|
"num_tokens": 2928955.0,
|
||
|
|
"step": 2720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06422470416873693,
|
||
|
|
"epoch": 1.4613333333333334,
|
||
|
|
"grad_norm": 0.2791357934474945,
|
||
|
|
"learning_rate": 1.6052491997937828e-05,
|
||
|
|
"loss": 0.06357557773590088,
|
||
|
|
"mean_token_accuracy": 0.9806081086397171,
|
||
|
|
"num_tokens": 2949978.0,
|
||
|
|
"step": 2740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0685284486040473,
|
||
|
|
"epoch": 1.472,
|
||
|
|
"grad_norm": 0.229026198387146,
|
||
|
|
"learning_rate": 1.5882263826840286e-05,
|
||
|
|
"loss": 0.06834735870361328,
|
||
|
|
"mean_token_accuracy": 0.9792908281087875,
|
||
|
|
"num_tokens": 2971296.0,
|
||
|
|
"step": 2760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06865171985700727,
|
||
|
|
"epoch": 1.4826666666666668,
|
||
|
|
"grad_norm": 0.2075856328010559,
|
||
|
|
"learning_rate": 1.5711921554870394e-05,
|
||
|
|
"loss": 0.07082886695861816,
|
||
|
|
"mean_token_accuracy": 0.9781916663050652,
|
||
|
|
"num_tokens": 2993694.0,
|
||
|
|
"step": 2780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06149051366373896,
|
||
|
|
"epoch": 1.4933333333333334,
|
||
|
|
"grad_norm": 0.24510766565799713,
|
||
|
|
"learning_rate": 1.55414872119485e-05,
|
||
|
|
"loss": 0.06140315532684326,
|
||
|
|
"mean_token_accuracy": 0.981805543601513,
|
||
|
|
"num_tokens": 3013485.0,
|
||
|
|
"step": 2800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06283597350120544,
|
||
|
|
"epoch": 1.504,
|
||
|
|
"grad_norm": 0.3660076856613159,
|
||
|
|
"learning_rate": 1.5370982839902248e-05,
|
||
|
|
"loss": 0.06664196252822877,
|
||
|
|
"mean_token_accuracy": 0.9799850210547447,
|
||
|
|
"num_tokens": 3034373.0,
|
||
|
|
"step": 2820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06986485011875629,
|
||
|
|
"epoch": 1.5146666666666668,
|
||
|
|
"grad_norm": 0.28147414326667786,
|
||
|
|
"learning_rate": 1.5200430489615963e-05,
|
||
|
|
"loss": 0.0729372501373291,
|
||
|
|
"mean_token_accuracy": 0.97689548432827,
|
||
|
|
"num_tokens": 3056657.0,
|
||
|
|
"step": 2840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06884724954143166,
|
||
|
|
"epoch": 1.5253333333333332,
|
||
|
|
"grad_norm": 0.23151597380638123,
|
||
|
|
"learning_rate": 1.5029852218178867e-05,
|
||
|
|
"loss": 0.06714131832122802,
|
||
|
|
"mean_token_accuracy": 0.9793031871318817,
|
||
|
|
"num_tokens": 3077669.0,
|
||
|
|
"step": 2860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0727352373301983,
|
||
|
|
"epoch": 1.536,
|
||
|
|
"grad_norm": 0.2120618373155594,
|
||
|
|
"learning_rate": 1.48592700860325e-05,
|
||
|
|
"loss": 0.07464810013771057,
|
||
|
|
"mean_token_accuracy": 0.9764216035604477,
|
||
|
|
"num_tokens": 3100875.0,
|
||
|
|
"step": 2880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06410896023735405,
|
||
|
|
"epoch": 1.5466666666666666,
|
||
|
|
"grad_norm": 0.27255088090896606,
|
||
|
|
"learning_rate": 1.4688706154117696e-05,
|
||
|
|
"loss": 0.06503221988677979,
|
||
|
|
"mean_token_accuracy": 0.979265221953392,
|
||
|
|
"num_tokens": 3122384.0,
|
||
|
|
"step": 2900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06694338582456112,
|
||
|
|
"epoch": 1.5573333333333332,
|
||
|
|
"grad_norm": 0.24979744851589203,
|
||
|
|
"learning_rate": 1.4518182481021502e-05,
|
||
|
|
"loss": 0.07112652659416199,
|
||
|
|
"mean_token_accuracy": 0.9789192631840706,
|
||
|
|
"num_tokens": 3144087.0,
|
||
|
|
"step": 2920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07254285905510187,
|
||
|
|
"epoch": 1.568,
|
||
|
|
"grad_norm": 0.28004226088523865,
|
||
|
|
"learning_rate": 1.4347721120124397e-05,
|
||
|
|
"loss": 0.07123505473136901,
|
||
|
|
"mean_token_accuracy": 0.978886678814888,
|
||
|
|
"num_tokens": 3166175.0,
|
||
|
|
"step": 2940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07109334822744132,
|
||
|
|
"epoch": 1.5786666666666667,
|
||
|
|
"grad_norm": 0.2444435954093933,
|
||
|
|
"learning_rate": 1.417734411674819e-05,
|
||
|
|
"loss": 0.07034714221954345,
|
||
|
|
"mean_token_accuracy": 0.9788279756903648,
|
||
|
|
"num_tokens": 3188135.0,
|
||
|
|
"step": 2960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06219260273501277,
|
||
|
|
"epoch": 1.5893333333333333,
|
||
|
|
"grad_norm": 0.2968960404396057,
|
||
|
|
"learning_rate": 1.4007073505304941e-05,
|
||
|
|
"loss": 0.06635067462921143,
|
||
|
|
"mean_token_accuracy": 0.9803951069712639,
|
||
|
|
"num_tokens": 3210125.0,
|
||
|
|
"step": 2980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06454241126775742,
|
||
|
|
"epoch": 1.6,
|
||
|
|
"grad_norm": 0.31802278757095337,
|
||
|
|
"learning_rate": 1.383693130644733e-05,
|
||
|
|
"loss": 0.06557859778404236,
|
||
|
|
"mean_token_accuracy": 0.9794120013713836,
|
||
|
|
"num_tokens": 3231328.0,
|
||
|
|
"step": 3000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06623651813715696,
|
||
|
|
"epoch": 1.6106666666666667,
|
||
|
|
"grad_norm": 0.2680739164352417,
|
||
|
|
"learning_rate": 1.3666939524220767e-05,
|
||
|
|
"loss": 0.06552712917327881,
|
||
|
|
"mean_token_accuracy": 0.981256639957428,
|
||
|
|
"num_tokens": 3252076.0,
|
||
|
|
"step": 3020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0598441306501627,
|
||
|
|
"epoch": 1.6213333333333333,
|
||
|
|
"grad_norm": 0.33669978380203247,
|
||
|
|
"learning_rate": 1.3497120143217684e-05,
|
||
|
|
"loss": 0.06124056577682495,
|
||
|
|
"mean_token_accuracy": 0.9811162427067757,
|
||
|
|
"num_tokens": 3272386.0,
|
||
|
|
"step": 3040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.05869143349118531,
|
||
|
|
"epoch": 1.6320000000000001,
|
||
|
|
"grad_norm": 0.43568432331085205,
|
||
|
|
"learning_rate": 1.3327495125734301e-05,
|
||
|
|
"loss": 0.06237072944641113,
|
||
|
|
"mean_token_accuracy": 0.9805628210306168,
|
||
|
|
"num_tokens": 3293231.0,
|
||
|
|
"step": 3060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06979248141869902,
|
||
|
|
"epoch": 1.6426666666666667,
|
||
|
|
"grad_norm": 0.19376863539218903,
|
||
|
|
"learning_rate": 1.3158086408930324e-05,
|
||
|
|
"loss": 0.07059879302978515,
|
||
|
|
"mean_token_accuracy": 0.9788637235760689,
|
||
|
|
"num_tokens": 3314754.0,
|
||
|
|
"step": 3080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06580152967944741,
|
||
|
|
"epoch": 1.6533333333333333,
|
||
|
|
"grad_norm": 0.25558850169181824,
|
||
|
|
"learning_rate": 1.2988915901991841e-05,
|
||
|
|
"loss": 0.06825007200241089,
|
||
|
|
"mean_token_accuracy": 0.9793827921152115,
|
||
|
|
"num_tokens": 3336111.0,
|
||
|
|
"step": 3100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06895913444459438,
|
||
|
|
"epoch": 1.6640000000000001,
|
||
|
|
"grad_norm": 0.21350796520709991,
|
||
|
|
"learning_rate": 1.28200054832979e-05,
|
||
|
|
"loss": 0.07058674097061157,
|
||
|
|
"mean_token_accuracy": 0.9781552821397781,
|
||
|
|
"num_tokens": 3358444.0,
|
||
|
|
"step": 3120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0663242308422923,
|
||
|
|
"epoch": 1.6746666666666665,
|
||
|
|
"grad_norm": 0.222551628947258,
|
||
|
|
"learning_rate": 1.2651376997591005e-05,
|
||
|
|
"loss": 0.06854333281517029,
|
||
|
|
"mean_token_accuracy": 0.9788196787238121,
|
||
|
|
"num_tokens": 3379744.0,
|
||
|
|
"step": 3140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07216014033183456,
|
||
|
|
"epoch": 1.6853333333333333,
|
||
|
|
"grad_norm": 0.3092426359653473,
|
||
|
|
"learning_rate": 1.248305225315201e-05,
|
||
|
|
"loss": 0.07203421592712403,
|
||
|
|
"mean_token_accuracy": 0.978464289009571,
|
||
|
|
"num_tokens": 3402040.0,
|
||
|
|
"step": 3160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06513830767944455,
|
||
|
|
"epoch": 1.696,
|
||
|
|
"grad_norm": 0.23164676129817963,
|
||
|
|
"learning_rate": 1.2315053018979699e-05,
|
||
|
|
"loss": 0.06423503160476685,
|
||
|
|
"mean_token_accuracy": 0.9801443338394165,
|
||
|
|
"num_tokens": 3423245.0,
|
||
|
|
"step": 3180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.061648647487163546,
|
||
|
|
"epoch": 1.7066666666666666,
|
||
|
|
"grad_norm": 0.2687373161315918,
|
||
|
|
"learning_rate": 1.2147401021975471e-05,
|
||
|
|
"loss": 0.06325778961181641,
|
||
|
|
"mean_token_accuracy": 0.9801615089178085,
|
||
|
|
"num_tokens": 3444668.0,
|
||
|
|
"step": 3200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06408334821462632,
|
||
|
|
"epoch": 1.7173333333333334,
|
||
|
|
"grad_norm": 0.266205757856369,
|
||
|
|
"learning_rate": 1.1980117944133456e-05,
|
||
|
|
"loss": 0.06507928371429443,
|
||
|
|
"mean_token_accuracy": 0.9799869328737258,
|
||
|
|
"num_tokens": 3465960.0,
|
||
|
|
"step": 3220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06640919763594866,
|
||
|
|
"epoch": 1.728,
|
||
|
|
"grad_norm": 0.33705103397369385,
|
||
|
|
"learning_rate": 1.1813225419736424e-05,
|
||
|
|
"loss": 0.06713052988052368,
|
||
|
|
"mean_token_accuracy": 0.9789028987288475,
|
||
|
|
"num_tokens": 3487326.0,
|
||
|
|
"step": 3240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07378814425319433,
|
||
|
|
"epoch": 1.7386666666666666,
|
||
|
|
"grad_norm": 0.31500980257987976,
|
||
|
|
"learning_rate": 1.1646745032557895e-05,
|
||
|
|
"loss": 0.07433319091796875,
|
||
|
|
"mean_token_accuracy": 0.9771664574742317,
|
||
|
|
"num_tokens": 3510466.0,
|
||
|
|
"step": 3260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0691059660166502,
|
||
|
|
"epoch": 1.7493333333333334,
|
||
|
|
"grad_norm": 0.33240073919296265,
|
||
|
|
"learning_rate": 1.148069831307075e-05,
|
||
|
|
"loss": 0.07068810462951661,
|
||
|
|
"mean_token_accuracy": 0.9787816539406776,
|
||
|
|
"num_tokens": 3531979.0,
|
||
|
|
"step": 3280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06790078049525619,
|
||
|
|
"epoch": 1.76,
|
||
|
|
"grad_norm": 0.2651180922985077,
|
||
|
|
"learning_rate": 1.1315106735662778e-05,
|
||
|
|
"loss": 0.07065703868865966,
|
||
|
|
"mean_token_accuracy": 0.9792906358838082,
|
||
|
|
"num_tokens": 3553906.0,
|
||
|
|
"step": 3300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0658861649222672,
|
||
|
|
"epoch": 1.7706666666666666,
|
||
|
|
"grad_norm": 0.23769696056842804,
|
||
|
|
"learning_rate": 1.1149991715859428e-05,
|
||
|
|
"loss": 0.06460118293762207,
|
||
|
|
"mean_token_accuracy": 0.980093178153038,
|
||
|
|
"num_tokens": 3575064.0,
|
||
|
|
"step": 3320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06296280124224722,
|
||
|
|
"epoch": 1.7813333333333334,
|
||
|
|
"grad_norm": 0.313032329082489,
|
||
|
|
"learning_rate": 1.0985374607554197e-05,
|
||
|
|
"loss": 0.0678341567516327,
|
||
|
|
"mean_token_accuracy": 0.9797580793499947,
|
||
|
|
"num_tokens": 3596537.0,
|
||
|
|
"step": 3340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06739533795043826,
|
||
|
|
"epoch": 1.792,
|
||
|
|
"grad_norm": 0.2906402349472046,
|
||
|
|
"learning_rate": 1.0821276700246993e-05,
|
||
|
|
"loss": 0.06724486351013184,
|
||
|
|
"mean_token_accuracy": 0.9797164380550385,
|
||
|
|
"num_tokens": 3617501.0,
|
||
|
|
"step": 3360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06835585637018085,
|
||
|
|
"epoch": 1.8026666666666666,
|
||
|
|
"grad_norm": 0.4202954173088074,
|
||
|
|
"learning_rate": 1.0657719216290813e-05,
|
||
|
|
"loss": 0.06997250318527222,
|
||
|
|
"mean_token_accuracy": 0.9782811865210533,
|
||
|
|
"num_tokens": 3639900.0,
|
||
|
|
"step": 3380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07121322192251682,
|
||
|
|
"epoch": 1.8133333333333335,
|
||
|
|
"grad_norm": 0.2250560075044632,
|
||
|
|
"learning_rate": 1.0494723308147131e-05,
|
||
|
|
"loss": 0.07189694046974182,
|
||
|
|
"mean_token_accuracy": 0.9778885126113892,
|
||
|
|
"num_tokens": 3661521.0,
|
||
|
|
"step": 3400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06754076760262251,
|
||
|
|
"epoch": 1.8239999999999998,
|
||
|
|
"grad_norm": 0.29606980085372925,
|
||
|
|
"learning_rate": 1.0332310055650275e-05,
|
||
|
|
"loss": 0.06917176246643067,
|
||
|
|
"mean_token_accuracy": 0.979434996843338,
|
||
|
|
"num_tokens": 3682643.0,
|
||
|
|
"step": 3420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07379511212930083,
|
||
|
|
"epoch": 1.8346666666666667,
|
||
|
|
"grad_norm": 0.25708991289138794,
|
||
|
|
"learning_rate": 1.0170500463281247e-05,
|
||
|
|
"loss": 0.07167908549308777,
|
||
|
|
"mean_token_accuracy": 0.9780497521162033,
|
||
|
|
"num_tokens": 3704737.0,
|
||
|
|
"step": 3440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06362721435725689,
|
||
|
|
"epoch": 1.8453333333333335,
|
||
|
|
"grad_norm": 0.23008571565151215,
|
||
|
|
"learning_rate": 1.0009315457451272e-05,
|
||
|
|
"loss": 0.06768688559532166,
|
||
|
|
"mean_token_accuracy": 0.9787532314658165,
|
||
|
|
"num_tokens": 3726432.0,
|
||
|
|
"step": 3460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06857527056708931,
|
||
|
|
"epoch": 1.8559999999999999,
|
||
|
|
"grad_norm": 0.229081392288208,
|
||
|
|
"learning_rate": 9.848775883795413e-06,
|
||
|
|
"loss": 0.06961520314216614,
|
||
|
|
"mean_token_accuracy": 0.9785497590899468,
|
||
|
|
"num_tokens": 3747724.0,
|
||
|
|
"step": 3480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0680385141633451,
|
||
|
|
"epoch": 1.8666666666666667,
|
||
|
|
"grad_norm": 0.25065746903419495,
|
||
|
|
"learning_rate": 9.688902504476698e-06,
|
||
|
|
"loss": 0.06657001376152039,
|
||
|
|
"mean_token_accuracy": 0.9794670984148979,
|
||
|
|
"num_tokens": 3769338.0,
|
||
|
|
"step": 3500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06824945779517293,
|
||
|
|
"epoch": 1.8773333333333333,
|
||
|
|
"grad_norm": 0.24879534542560577,
|
||
|
|
"learning_rate": 9.529715995500974e-06,
|
||
|
|
"loss": 0.0720153272151947,
|
||
|
|
"mean_token_accuracy": 0.9776617914438248,
|
||
|
|
"num_tokens": 3791756.0,
|
||
|
|
"step": 3520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06479481738060713,
|
||
|
|
"epoch": 1.888,
|
||
|
|
"grad_norm": 0.254541277885437,
|
||
|
|
"learning_rate": 9.371236944042949e-06,
|
||
|
|
"loss": 0.06658366322517395,
|
||
|
|
"mean_token_accuracy": 0.9801236733794212,
|
||
|
|
"num_tokens": 3812980.0,
|
||
|
|
"step": 3540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06725719030946493,
|
||
|
|
"epoch": 1.8986666666666667,
|
||
|
|
"grad_norm": 0.20114503800868988,
|
||
|
|
"learning_rate": 9.213485845783699e-06,
|
||
|
|
"loss": 0.06695624589920043,
|
||
|
|
"mean_token_accuracy": 0.9790028914809227,
|
||
|
|
"num_tokens": 3834204.0,
|
||
|
|
"step": 3560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06467321151867508,
|
||
|
|
"epoch": 1.9093333333333333,
|
||
|
|
"grad_norm": 0.3090938329696655,
|
||
|
|
"learning_rate": 9.056483102260023e-06,
|
||
|
|
"loss": 0.06516823768615723,
|
||
|
|
"mean_token_accuracy": 0.9797172531485557,
|
||
|
|
"num_tokens": 3855431.0,
|
||
|
|
"step": 3580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0704337134025991,
|
||
|
|
"epoch": 1.92,
|
||
|
|
"grad_norm": 0.29103463888168335,
|
||
|
|
"learning_rate": 8.900249018225946e-06,
|
||
|
|
"loss": 0.07074209451675414,
|
||
|
|
"mean_token_accuracy": 0.9780181258916855,
|
||
|
|
"num_tokens": 3878649.0,
|
||
|
|
"step": 3600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0582809004932642,
|
||
|
|
"epoch": 1.9306666666666668,
|
||
|
|
"grad_norm": 0.20316410064697266,
|
||
|
|
"learning_rate": 8.744803799026782e-06,
|
||
|
|
"loss": 0.057930976152420044,
|
||
|
|
"mean_token_accuracy": 0.9826426327228546,
|
||
|
|
"num_tokens": 3897996.0,
|
||
|
|
"step": 3620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06718643885105849,
|
||
|
|
"epoch": 1.9413333333333334,
|
||
|
|
"grad_norm": 0.22466565668582916,
|
||
|
|
"learning_rate": 8.590167547986025e-06,
|
||
|
|
"loss": 0.07398964166641235,
|
||
|
|
"mean_token_accuracy": 0.9769044548273087,
|
||
|
|
"num_tokens": 3920518.0,
|
||
|
|
"step": 3640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07131849471479654,
|
||
|
|
"epoch": 1.952,
|
||
|
|
"grad_norm": 0.2662692070007324,
|
||
|
|
"learning_rate": 8.436360263805418e-06,
|
||
|
|
"loss": 0.068779855966568,
|
||
|
|
"mean_token_accuracy": 0.9793604537844658,
|
||
|
|
"num_tokens": 3941875.0,
|
||
|
|
"step": 3660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06605563079938293,
|
||
|
|
"epoch": 1.9626666666666668,
|
||
|
|
"grad_norm": 0.24313360452651978,
|
||
|
|
"learning_rate": 8.283401837978608e-06,
|
||
|
|
"loss": 0.06911961436271667,
|
||
|
|
"mean_token_accuracy": 0.9782892510294914,
|
||
|
|
"num_tokens": 3963512.0,
|
||
|
|
"step": 3680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07288907114416361,
|
||
|
|
"epoch": 1.9733333333333334,
|
||
|
|
"grad_norm": 0.32028618454933167,
|
||
|
|
"learning_rate": 8.1313120522186e-06,
|
||
|
|
"loss": 0.07294363975524902,
|
||
|
|
"mean_token_accuracy": 0.9774829164147377,
|
||
|
|
"num_tokens": 3986539.0,
|
||
|
|
"step": 3700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06866402635350824,
|
||
|
|
"epoch": 1.984,
|
||
|
|
"grad_norm": 0.24489836394786835,
|
||
|
|
"learning_rate": 7.980110575899445e-06,
|
||
|
|
"loss": 0.06828091144561768,
|
||
|
|
"mean_token_accuracy": 0.978564715385437,
|
||
|
|
"num_tokens": 4008632.0,
|
||
|
|
"step": 3720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06863453919067979,
|
||
|
|
"epoch": 1.9946666666666668,
|
||
|
|
"grad_norm": 0.3105578124523163,
|
||
|
|
"learning_rate": 7.829816963512476e-06,
|
||
|
|
"loss": 0.07050868272781372,
|
||
|
|
"mean_token_accuracy": 0.9785391628742218,
|
||
|
|
"num_tokens": 4031130.0,
|
||
|
|
"step": 3740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06835599634796381,
|
||
|
|
"epoch": 2.005333333333333,
|
||
|
|
"grad_norm": 0.298072874546051,
|
||
|
|
"learning_rate": 7.680450652137355e-06,
|
||
|
|
"loss": 0.0701375961303711,
|
||
|
|
"mean_token_accuracy": 0.9787931978702545,
|
||
|
|
"num_tokens": 4053091.0,
|
||
|
|
"step": 3760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.061244970094412564,
|
||
|
|
"epoch": 2.016,
|
||
|
|
"grad_norm": 0.39287611842155457,
|
||
|
|
"learning_rate": 7.532030958928316e-06,
|
||
|
|
"loss": 0.05947454571723938,
|
||
|
|
"mean_token_accuracy": 0.9816959872841835,
|
||
|
|
"num_tokens": 4073488.0,
|
||
|
|
"step": 3780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06386837903410196,
|
||
|
|
"epoch": 2.026666666666667,
|
||
|
|
"grad_norm": 0.33378368616104126,
|
||
|
|
"learning_rate": 7.384577078615963e-06,
|
||
|
|
"loss": 0.06699413061141968,
|
||
|
|
"mean_token_accuracy": 0.9805058524012565,
|
||
|
|
"num_tokens": 4094669.0,
|
||
|
|
"step": 3800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07299464298412203,
|
||
|
|
"epoch": 2.037333333333333,
|
||
|
|
"grad_norm": 0.48464930057525635,
|
||
|
|
"learning_rate": 7.2381080810248276e-06,
|
||
|
|
"loss": 0.07230452299118043,
|
||
|
|
"mean_token_accuracy": 0.9781083762645721,
|
||
|
|
"num_tokens": 4117086.0,
|
||
|
|
"step": 3820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06801890805363656,
|
||
|
|
"epoch": 2.048,
|
||
|
|
"grad_norm": 0.23026078939437866,
|
||
|
|
"learning_rate": 7.092642908607138e-06,
|
||
|
|
"loss": 0.06711475253105163,
|
||
|
|
"mean_token_accuracy": 0.9793458193540573,
|
||
|
|
"num_tokens": 4138872.0,
|
||
|
|
"step": 3840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06590869640931488,
|
||
|
|
"epoch": 2.058666666666667,
|
||
|
|
"grad_norm": 0.3303634524345398,
|
||
|
|
"learning_rate": 6.948200373993056e-06,
|
||
|
|
"loss": 0.0715693175792694,
|
||
|
|
"mean_token_accuracy": 0.9784951597452164,
|
||
|
|
"num_tokens": 4160263.0,
|
||
|
|
"step": 3860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06702440548688174,
|
||
|
|
"epoch": 2.0693333333333332,
|
||
|
|
"grad_norm": 0.21795713901519775,
|
||
|
|
"learning_rate": 6.804799157557653e-06,
|
||
|
|
"loss": 0.06775381565093994,
|
||
|
|
"mean_token_accuracy": 0.9790131956338882,
|
||
|
|
"num_tokens": 4181574.0,
|
||
|
|
"step": 3880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06911803474649787,
|
||
|
|
"epoch": 2.08,
|
||
|
|
"grad_norm": 0.2393951117992401,
|
||
|
|
"learning_rate": 6.662457805005041e-06,
|
||
|
|
"loss": 0.06864354610443116,
|
||
|
|
"mean_token_accuracy": 0.9798421457409858,
|
||
|
|
"num_tokens": 4202497.0,
|
||
|
|
"step": 3900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07464540144428611,
|
||
|
|
"epoch": 2.0906666666666665,
|
||
|
|
"grad_norm": 0.24819724261760712,
|
||
|
|
"learning_rate": 6.52119472496994e-06,
|
||
|
|
"loss": 0.07682948112487793,
|
||
|
|
"mean_token_accuracy": 0.9767722800374031,
|
||
|
|
"num_tokens": 4226275.0,
|
||
|
|
"step": 3920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06835727458819747,
|
||
|
|
"epoch": 2.1013333333333333,
|
||
|
|
"grad_norm": 0.2139078825712204,
|
||
|
|
"learning_rate": 6.38102818663688e-06,
|
||
|
|
"loss": 0.06501986980438232,
|
||
|
|
"mean_token_accuracy": 0.9806719914078712,
|
||
|
|
"num_tokens": 4247336.0,
|
||
|
|
"step": 3940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06610159985721112,
|
||
|
|
"epoch": 2.112,
|
||
|
|
"grad_norm": 0.28183573484420776,
|
||
|
|
"learning_rate": 6.241976317377518e-06,
|
||
|
|
"loss": 0.0680277943611145,
|
||
|
|
"mean_token_accuracy": 0.9787659183144569,
|
||
|
|
"num_tokens": 4269389.0,
|
||
|
|
"step": 3960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06353378687053919,
|
||
|
|
"epoch": 2.1226666666666665,
|
||
|
|
"grad_norm": 0.29995930194854736,
|
||
|
|
"learning_rate": 6.1040571004062975e-06,
|
||
|
|
"loss": 0.06427581310272217,
|
||
|
|
"mean_token_accuracy": 0.9798787072300911,
|
||
|
|
"num_tokens": 4290712.0,
|
||
|
|
"step": 3980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06582737127318979,
|
||
|
|
"epoch": 2.1333333333333333,
|
||
|
|
"grad_norm": 0.3384758532047272,
|
||
|
|
"learning_rate": 5.967288372454691e-06,
|
||
|
|
"loss": 0.06841517686843872,
|
||
|
|
"mean_token_accuracy": 0.9793238922953605,
|
||
|
|
"num_tokens": 4311731.0,
|
||
|
|
"step": 4000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06381206568330526,
|
||
|
|
"epoch": 2.144,
|
||
|
|
"grad_norm": 0.3370026648044586,
|
||
|
|
"learning_rate": 5.83168782146443e-06,
|
||
|
|
"loss": 0.06559972763061524,
|
||
|
|
"mean_token_accuracy": 0.9806227684020996,
|
||
|
|
"num_tokens": 4332416.0,
|
||
|
|
"step": 4020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0634533517062664,
|
||
|
|
"epoch": 2.1546666666666665,
|
||
|
|
"grad_norm": 0.20744706690311432,
|
||
|
|
"learning_rate": 5.6972729843e-06,
|
||
|
|
"loss": 0.06608573198318482,
|
||
|
|
"mean_token_accuracy": 0.9805106148123741,
|
||
|
|
"num_tokens": 4353670.0,
|
||
|
|
"step": 4040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07064798045903445,
|
||
|
|
"epoch": 2.1653333333333333,
|
||
|
|
"grad_norm": 0.2510891556739807,
|
||
|
|
"learning_rate": 5.564061244480591e-06,
|
||
|
|
"loss": 0.07231830358505249,
|
||
|
|
"mean_token_accuracy": 0.977633598446846,
|
||
|
|
"num_tokens": 4376258.0,
|
||
|
|
"step": 4060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07347904201596975,
|
||
|
|
"epoch": 2.176,
|
||
|
|
"grad_norm": 0.25644832849502563,
|
||
|
|
"learning_rate": 5.43206982993198e-06,
|
||
|
|
"loss": 0.07207185626029969,
|
||
|
|
"mean_token_accuracy": 0.9770923808217049,
|
||
|
|
"num_tokens": 4399063.0,
|
||
|
|
"step": 4080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07256816513836384,
|
||
|
|
"epoch": 2.1866666666666665,
|
||
|
|
"grad_norm": 0.4217114746570587,
|
||
|
|
"learning_rate": 5.301315810758472e-06,
|
||
|
|
"loss": 0.0714795470237732,
|
||
|
|
"mean_token_accuracy": 0.9770988509058952,
|
||
|
|
"num_tokens": 4422086.0,
|
||
|
|
"step": 4100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0676334222778678,
|
||
|
|
"epoch": 2.1973333333333334,
|
||
|
|
"grad_norm": 0.250229150056839,
|
||
|
|
"learning_rate": 5.171816097035251e-06,
|
||
|
|
"loss": 0.06939680576324463,
|
||
|
|
"mean_token_accuracy": 0.9786039367318153,
|
||
|
|
"num_tokens": 4443688.0,
|
||
|
|
"step": 4120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06949442513287067,
|
||
|
|
"epoch": 2.208,
|
||
|
|
"grad_norm": 0.3249078392982483,
|
||
|
|
"learning_rate": 5.043587436621462e-06,
|
||
|
|
"loss": 0.06934006810188294,
|
||
|
|
"mean_token_accuracy": 0.978336064517498,
|
||
|
|
"num_tokens": 4466186.0,
|
||
|
|
"step": 4140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0705328544601798,
|
||
|
|
"epoch": 2.2186666666666666,
|
||
|
|
"grad_norm": 0.22043611109256744,
|
||
|
|
"learning_rate": 4.916646412994267e-06,
|
||
|
|
"loss": 0.07034485340118408,
|
||
|
|
"mean_token_accuracy": 0.9777373462915421,
|
||
|
|
"num_tokens": 4489519.0,
|
||
|
|
"step": 4160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06607724539935589,
|
||
|
|
"epoch": 2.2293333333333334,
|
||
|
|
"grad_norm": 0.29305610060691833,
|
||
|
|
"learning_rate": 4.791009443104112e-06,
|
||
|
|
"loss": 0.06469966173171997,
|
||
|
|
"mean_token_accuracy": 0.981091833114624,
|
||
|
|
"num_tokens": 4510105.0,
|
||
|
|
"step": 4180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.062390463519841434,
|
||
|
|
"epoch": 2.24,
|
||
|
|
"grad_norm": 0.21871982514858246,
|
||
|
|
"learning_rate": 4.666692775251589e-06,
|
||
|
|
"loss": 0.06328600645065308,
|
||
|
|
"mean_token_accuracy": 0.9811810821294784,
|
||
|
|
"num_tokens": 4530430.0,
|
||
|
|
"step": 4200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06391511335968972,
|
||
|
|
"epoch": 2.2506666666666666,
|
||
|
|
"grad_norm": 0.2238311767578125,
|
||
|
|
"learning_rate": 4.543712486986095e-06,
|
||
|
|
"loss": 0.06514235734939575,
|
||
|
|
"mean_token_accuracy": 0.9797263771295548,
|
||
|
|
"num_tokens": 4551438.0,
|
||
|
|
"step": 4220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06428639143705368,
|
||
|
|
"epoch": 2.2613333333333334,
|
||
|
|
"grad_norm": 0.34120672941207886,
|
||
|
|
"learning_rate": 4.422084483026534e-06,
|
||
|
|
"loss": 0.06663946509361267,
|
||
|
|
"mean_token_accuracy": 0.9795652627944946,
|
||
|
|
"num_tokens": 4572907.0,
|
||
|
|
"step": 4240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06766332956030965,
|
||
|
|
"epoch": 2.2720000000000002,
|
||
|
|
"grad_norm": 0.24613726139068604,
|
||
|
|
"learning_rate": 4.301824493204431e-06,
|
||
|
|
"loss": 0.06992720365524292,
|
||
|
|
"mean_token_accuracy": 0.9785493031144142,
|
||
|
|
"num_tokens": 4595427.0,
|
||
|
|
"step": 4260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0695193137973547,
|
||
|
|
"epoch": 2.2826666666666666,
|
||
|
|
"grad_norm": 0.2597343325614929,
|
||
|
|
"learning_rate": 4.182948070429622e-06,
|
||
|
|
"loss": 0.06983534693717956,
|
||
|
|
"mean_token_accuracy": 0.9781228736042976,
|
||
|
|
"num_tokens": 4618066.0,
|
||
|
|
"step": 4280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0699890716932714,
|
||
|
|
"epoch": 2.2933333333333334,
|
||
|
|
"grad_norm": 0.24136057496070862,
|
||
|
|
"learning_rate": 4.06547058867883e-06,
|
||
|
|
"loss": 0.07176908254623413,
|
||
|
|
"mean_token_accuracy": 0.9779310017824173,
|
||
|
|
"num_tokens": 4640538.0,
|
||
|
|
"step": 4300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06974478457123041,
|
||
|
|
"epoch": 2.304,
|
||
|
|
"grad_norm": 0.2972959578037262,
|
||
|
|
"learning_rate": 3.949407241007393e-06,
|
||
|
|
"loss": 0.06903537511825561,
|
||
|
|
"mean_token_accuracy": 0.9787017688155174,
|
||
|
|
"num_tokens": 4662281.0,
|
||
|
|
"step": 4320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06801187871024013,
|
||
|
|
"epoch": 2.3146666666666667,
|
||
|
|
"grad_norm": 0.32835492491722107,
|
||
|
|
"learning_rate": 3.834773037584402e-06,
|
||
|
|
"loss": 0.06735379695892334,
|
||
|
|
"mean_token_accuracy": 0.9794113785028458,
|
||
|
|
"num_tokens": 4683454.0,
|
||
|
|
"step": 4340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06790872057899833,
|
||
|
|
"epoch": 2.3253333333333335,
|
||
|
|
"grad_norm": 0.2797514498233795,
|
||
|
|
"learning_rate": 3.7215828037514487e-06,
|
||
|
|
"loss": 0.06811803579330444,
|
||
|
|
"mean_token_accuracy": 0.9787567868828774,
|
||
|
|
"num_tokens": 4705275.0,
|
||
|
|
"step": 4360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06285285465419292,
|
||
|
|
"epoch": 2.336,
|
||
|
|
"grad_norm": 0.25980862975120544,
|
||
|
|
"learning_rate": 3.6098511781053244e-06,
|
||
|
|
"loss": 0.0630250632762909,
|
||
|
|
"mean_token_accuracy": 0.9810120955109596,
|
||
|
|
"num_tokens": 4726063.0,
|
||
|
|
"step": 4380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06258888244628906,
|
||
|
|
"epoch": 2.3466666666666667,
|
||
|
|
"grad_norm": 0.27584534883499146,
|
||
|
|
"learning_rate": 3.4995926106048345e-06,
|
||
|
|
"loss": 0.0658095121383667,
|
||
|
|
"mean_token_accuracy": 0.9793830320239068,
|
||
|
|
"num_tokens": 4747694.0,
|
||
|
|
"step": 4400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06438704924657941,
|
||
|
|
"epoch": 2.3573333333333335,
|
||
|
|
"grad_norm": 0.2829785943031311,
|
||
|
|
"learning_rate": 3.3908213607020253e-06,
|
||
|
|
"loss": 0.06506861448287964,
|
||
|
|
"mean_token_accuracy": 0.9803233638405799,
|
||
|
|
"num_tokens": 4769134.0,
|
||
|
|
"step": 4420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06386989299207926,
|
||
|
|
"epoch": 2.368,
|
||
|
|
"grad_norm": 0.2539486885070801,
|
||
|
|
"learning_rate": 3.283551495498059e-06,
|
||
|
|
"loss": 0.06367477774620056,
|
||
|
|
"mean_token_accuracy": 0.9801046311855316,
|
||
|
|
"num_tokens": 4789772.0,
|
||
|
|
"step": 4440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06729276357218623,
|
||
|
|
"epoch": 2.3786666666666667,
|
||
|
|
"grad_norm": 0.2120504379272461,
|
||
|
|
"learning_rate": 3.1777968879239432e-06,
|
||
|
|
"loss": 0.06938108205795288,
|
||
|
|
"mean_token_accuracy": 0.9789153173565864,
|
||
|
|
"num_tokens": 4811522.0,
|
||
|
|
"step": 4460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06604850795120001,
|
||
|
|
"epoch": 2.389333333333333,
|
||
|
|
"grad_norm": 0.2501501441001892,
|
||
|
|
"learning_rate": 3.0735712149463663e-06,
|
||
|
|
"loss": 0.06410098671913148,
|
||
|
|
"mean_token_accuracy": 0.9799213841557503,
|
||
|
|
"num_tokens": 4831995.0,
|
||
|
|
"step": 4480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06737142587080598,
|
||
|
|
"epoch": 2.4,
|
||
|
|
"grad_norm": 0.2193731665611267,
|
||
|
|
"learning_rate": 2.9708879557989272e-06,
|
||
|
|
"loss": 0.06801332831382752,
|
||
|
|
"mean_token_accuracy": 0.9788430154323577,
|
||
|
|
"num_tokens": 4853511.0,
|
||
|
|
"step": 4500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06548255272209644,
|
||
|
|
"epoch": 2.4106666666666667,
|
||
|
|
"grad_norm": 0.26090550422668457,
|
||
|
|
"learning_rate": 2.8697603902388596e-06,
|
||
|
|
"loss": 0.06384705305099488,
|
||
|
|
"mean_token_accuracy": 0.9796822845935822,
|
||
|
|
"num_tokens": 4874331.0,
|
||
|
|
"step": 4520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06249658772721887,
|
||
|
|
"epoch": 2.421333333333333,
|
||
|
|
"grad_norm": 0.2120533138513565,
|
||
|
|
"learning_rate": 2.770201596829623e-06,
|
||
|
|
"loss": 0.060959136486053465,
|
||
|
|
"mean_token_accuracy": 0.9812754124403,
|
||
|
|
"num_tokens": 4894384.0,
|
||
|
|
"step": 4540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06758719896897673,
|
||
|
|
"epoch": 2.432,
|
||
|
|
"grad_norm": 0.2482796013355255,
|
||
|
|
"learning_rate": 2.6722244512494888e-06,
|
||
|
|
"loss": 0.07017409801483154,
|
||
|
|
"mean_token_accuracy": 0.9777197048068047,
|
||
|
|
"num_tokens": 4916199.0,
|
||
|
|
"step": 4560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06625777473673225,
|
||
|
|
"epoch": 2.4426666666666668,
|
||
|
|
"grad_norm": 0.2898966372013092,
|
||
|
|
"learning_rate": 2.5758416246263357e-06,
|
||
|
|
"loss": 0.06673334240913391,
|
||
|
|
"mean_token_accuracy": 0.9788759082555771,
|
||
|
|
"num_tokens": 4938235.0,
|
||
|
|
"step": 4580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0688164765946567,
|
||
|
|
"epoch": 2.453333333333333,
|
||
|
|
"grad_norm": 0.25803565979003906,
|
||
|
|
"learning_rate": 2.4810655818989563e-06,
|
||
|
|
"loss": 0.07112188339233398,
|
||
|
|
"mean_token_accuracy": 0.9775520697236061,
|
||
|
|
"num_tokens": 4961512.0,
|
||
|
|
"step": 4600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06736230682581663,
|
||
|
|
"epoch": 2.464,
|
||
|
|
"grad_norm": 0.3040409982204437,
|
||
|
|
"learning_rate": 2.387908580204986e-06,
|
||
|
|
"loss": 0.06320847868919373,
|
||
|
|
"mean_token_accuracy": 0.9807012856006623,
|
||
|
|
"num_tokens": 4982173.0,
|
||
|
|
"step": 4620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0662422583438456,
|
||
|
|
"epoch": 2.474666666666667,
|
||
|
|
"grad_norm": 0.24963408708572388,
|
||
|
|
"learning_rate": 2.296382667295713e-06,
|
||
|
|
"loss": 0.07101342678070069,
|
||
|
|
"mean_token_accuracy": 0.9781320869922638,
|
||
|
|
"num_tokens": 5004438.0,
|
||
|
|
"step": 4640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07070345636457205,
|
||
|
|
"epoch": 2.485333333333333,
|
||
|
|
"grad_norm": 0.25193750858306885,
|
||
|
|
"learning_rate": 2.2064996799779764e-06,
|
||
|
|
"loss": 0.07217344641685486,
|
||
|
|
"mean_token_accuracy": 0.9768879726529122,
|
||
|
|
"num_tokens": 5027839.0,
|
||
|
|
"step": 4660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0711888742633164,
|
||
|
|
"epoch": 2.496,
|
||
|
|
"grad_norm": 0.28611400723457336,
|
||
|
|
"learning_rate": 2.1182712425833624e-06,
|
||
|
|
"loss": 0.07044810056686401,
|
||
|
|
"mean_token_accuracy": 0.9788151904940605,
|
||
|
|
"num_tokens": 5050202.0,
|
||
|
|
"step": 4680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0676958936266601,
|
||
|
|
"epoch": 2.506666666666667,
|
||
|
|
"grad_norm": 0.23146404325962067,
|
||
|
|
"learning_rate": 2.0317087654648312e-06,
|
||
|
|
"loss": 0.06667524576187134,
|
||
|
|
"mean_token_accuracy": 0.9787666156888009,
|
||
|
|
"num_tokens": 5071998.0,
|
||
|
|
"step": 4700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07002988457679749,
|
||
|
|
"epoch": 2.517333333333333,
|
||
|
|
"grad_norm": 0.2925092279911041,
|
||
|
|
"learning_rate": 1.946823443521062e-06,
|
||
|
|
"loss": 0.07027275562286377,
|
||
|
|
"mean_token_accuracy": 0.9777396753430366,
|
||
|
|
"num_tokens": 5094139.0,
|
||
|
|
"step": 4720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06402101377025246,
|
||
|
|
"epoch": 2.528,
|
||
|
|
"grad_norm": 0.30446258187294006,
|
||
|
|
"learning_rate": 1.8636262547486522e-06,
|
||
|
|
"loss": 0.06188323497772217,
|
||
|
|
"mean_token_accuracy": 0.980588148534298,
|
||
|
|
"num_tokens": 5114657.0,
|
||
|
|
"step": 4740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0640190165489912,
|
||
|
|
"epoch": 2.538666666666667,
|
||
|
|
"grad_norm": 0.27199557423591614,
|
||
|
|
"learning_rate": 1.7821279588223399e-06,
|
||
|
|
"loss": 0.06351304054260254,
|
||
|
|
"mean_token_accuracy": 0.9809172645211219,
|
||
|
|
"num_tokens": 5135559.0,
|
||
|
|
"step": 4760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06178912734612822,
|
||
|
|
"epoch": 2.5493333333333332,
|
||
|
|
"grad_norm": 0.2936437726020813,
|
||
|
|
"learning_rate": 1.7023390957035056e-06,
|
||
|
|
"loss": 0.06231012344360352,
|
||
|
|
"mean_token_accuracy": 0.9810473620891571,
|
||
|
|
"num_tokens": 5156122.0,
|
||
|
|
"step": 4780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06739961085841059,
|
||
|
|
"epoch": 2.56,
|
||
|
|
"grad_norm": 0.29408252239227295,
|
||
|
|
"learning_rate": 1.6242699842770558e-06,
|
||
|
|
"loss": 0.0716172993183136,
|
||
|
|
"mean_token_accuracy": 0.9772106230258941,
|
||
|
|
"num_tokens": 5178867.0,
|
||
|
|
"step": 4800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07000719318166375,
|
||
|
|
"epoch": 2.570666666666667,
|
||
|
|
"grad_norm": 0.2808171212673187,
|
||
|
|
"learning_rate": 1.547930721016909e-06,
|
||
|
|
"loss": 0.07183417081832885,
|
||
|
|
"mean_token_accuracy": 0.9768716543912888,
|
||
|
|
"num_tokens": 5202411.0,
|
||
|
|
"step": 4820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06676273150369524,
|
||
|
|
"epoch": 2.5813333333333333,
|
||
|
|
"grad_norm": 0.29104703664779663,
|
||
|
|
"learning_rate": 1.4733311786802439e-06,
|
||
|
|
"loss": 0.06565375328063965,
|
||
|
|
"mean_token_accuracy": 0.9793911650776863,
|
||
|
|
"num_tokens": 5223589.0,
|
||
|
|
"step": 4840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06493867076933384,
|
||
|
|
"epoch": 2.592,
|
||
|
|
"grad_norm": 0.24625852704048157,
|
||
|
|
"learning_rate": 1.40048100503069e-06,
|
||
|
|
"loss": 0.0669145941734314,
|
||
|
|
"mean_token_accuracy": 0.9792442545294762,
|
||
|
|
"num_tokens": 5245281.0,
|
||
|
|
"step": 4860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06505903964862228,
|
||
|
|
"epoch": 2.602666666666667,
|
||
|
|
"grad_norm": 0.25980353355407715,
|
||
|
|
"learning_rate": 1.3293896215905942e-06,
|
||
|
|
"loss": 0.06756677031517029,
|
||
|
|
"mean_token_accuracy": 0.979070121049881,
|
||
|
|
"num_tokens": 5266278.0,
|
||
|
|
"step": 4880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06472506942227482,
|
||
|
|
"epoch": 2.6133333333333333,
|
||
|
|
"grad_norm": 0.39341655373573303,
|
||
|
|
"learning_rate": 1.2600662224225734e-06,
|
||
|
|
"loss": 0.06350111961364746,
|
||
|
|
"mean_token_accuracy": 0.9806848973035812,
|
||
|
|
"num_tokens": 5287527.0,
|
||
|
|
"step": 4900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0649796743877232,
|
||
|
|
"epoch": 2.624,
|
||
|
|
"grad_norm": 0.22596676647663116,
|
||
|
|
"learning_rate": 1.1925197729404602e-06,
|
||
|
|
"loss": 0.06618022918701172,
|
||
|
|
"mean_token_accuracy": 0.9799415796995163,
|
||
|
|
"num_tokens": 5308641.0,
|
||
|
|
"step": 4920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06528121028095484,
|
||
|
|
"epoch": 2.634666666666667,
|
||
|
|
"grad_norm": 0.20817522704601288,
|
||
|
|
"learning_rate": 1.126759008749842e-06,
|
||
|
|
"loss": 0.0666232168674469,
|
||
|
|
"mean_token_accuracy": 0.979514765739441,
|
||
|
|
"num_tokens": 5330297.0,
|
||
|
|
"step": 4940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06870688563212753,
|
||
|
|
"epoch": 2.6453333333333333,
|
||
|
|
"grad_norm": 0.27720537781715393,
|
||
|
|
"learning_rate": 1.0627924345182854e-06,
|
||
|
|
"loss": 0.07012331485748291,
|
||
|
|
"mean_token_accuracy": 0.9781979978084564,
|
||
|
|
"num_tokens": 5352281.0,
|
||
|
|
"step": 4960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06342040533199907,
|
||
|
|
"epoch": 2.656,
|
||
|
|
"grad_norm": 0.267355352640152,
|
||
|
|
"learning_rate": 1.0006283228754787e-06,
|
||
|
|
"loss": 0.061806786060333255,
|
||
|
|
"mean_token_accuracy": 0.9821794584393502,
|
||
|
|
"num_tokens": 5372463.0,
|
||
|
|
"step": 4980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06996868448331953,
|
||
|
|
"epoch": 2.6666666666666665,
|
||
|
|
"grad_norm": 0.25216931104660034,
|
||
|
|
"learning_rate": 9.402747133433299e-07,
|
||
|
|
"loss": 0.07108966112136841,
|
||
|
|
"mean_token_accuracy": 0.977506385743618,
|
||
|
|
"num_tokens": 5395009.0,
|
||
|
|
"step": 5000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.061977448593825105,
|
||
|
|
"epoch": 2.6773333333333333,
|
||
|
|
"grad_norm": 0.2592537999153137,
|
||
|
|
"learning_rate": 8.817394112962457e-07,
|
||
|
|
"loss": 0.06004307270050049,
|
||
|
|
"mean_token_accuracy": 0.9814708828926086,
|
||
|
|
"num_tokens": 5415204.0,
|
||
|
|
"step": 5020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06544211199507118,
|
||
|
|
"epoch": 2.6879999999999997,
|
||
|
|
"grad_norm": 0.27698102593421936,
|
||
|
|
"learning_rate": 8.250299869516908e-07,
|
||
|
|
"loss": 0.06892814636230468,
|
||
|
|
"mean_token_accuracy": 0.9790427267551423,
|
||
|
|
"num_tokens": 5437588.0,
|
||
|
|
"step": 5040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06467498484998942,
|
||
|
|
"epoch": 2.6986666666666665,
|
||
|
|
"grad_norm": 0.26750609278678894,
|
||
|
|
"learning_rate": 7.701537743911375e-07,
|
||
|
|
"loss": 0.0653802752494812,
|
||
|
|
"mean_token_accuracy": 0.9803359940648079,
|
||
|
|
"num_tokens": 5458783.0,
|
||
|
|
"step": 5060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06604810692369938,
|
||
|
|
"epoch": 2.7093333333333334,
|
||
|
|
"grad_norm": 0.2512940466403961,
|
||
|
|
"learning_rate": 7.171178706115789e-07,
|
||
|
|
"loss": 0.06406107544898987,
|
||
|
|
"mean_token_accuracy": 0.9804125308990479,
|
||
|
|
"num_tokens": 5479810.0,
|
||
|
|
"step": 5080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06774483285844327,
|
||
|
|
"epoch": 2.7199999999999998,
|
||
|
|
"grad_norm": 0.2911634147167206,
|
||
|
|
"learning_rate": 6.659291346076824e-07,
|
||
|
|
"loss": 0.07083733677864075,
|
||
|
|
"mean_token_accuracy": 0.9774568140506744,
|
||
|
|
"num_tokens": 5503033.0,
|
||
|
|
"step": 5100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06132667139172554,
|
||
|
|
"epoch": 2.7306666666666666,
|
||
|
|
"grad_norm": 0.25360938906669617,
|
||
|
|
"learning_rate": 6.165941864847468e-07,
|
||
|
|
"loss": 0.0613398015499115,
|
||
|
|
"mean_token_accuracy": 0.981691287457943,
|
||
|
|
"num_tokens": 5523046.0,
|
||
|
|
"step": 5120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06512014325708151,
|
||
|
|
"epoch": 2.7413333333333334,
|
||
|
|
"grad_norm": 0.2063353806734085,
|
||
|
|
"learning_rate": 5.691194066025295e-07,
|
||
|
|
"loss": 0.06509124636650085,
|
||
|
|
"mean_token_accuracy": 0.9808336913585662,
|
||
|
|
"num_tokens": 5544090.0,
|
||
|
|
"step": 5140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06322276135906577,
|
||
|
|
"epoch": 2.752,
|
||
|
|
"grad_norm": 0.22989638149738312,
|
||
|
|
"learning_rate": 5.235109347501027e-07,
|
||
|
|
"loss": 0.062446653842926025,
|
||
|
|
"mean_token_accuracy": 0.9809010848402977,
|
||
|
|
"num_tokens": 5564404.0,
|
||
|
|
"step": 5160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0656422447413206,
|
||
|
|
"epoch": 2.7626666666666666,
|
||
|
|
"grad_norm": 0.22744940221309662,
|
||
|
|
"learning_rate": 4.797746693517952e-07,
|
||
|
|
"loss": 0.06802717447280884,
|
||
|
|
"mean_token_accuracy": 0.9793394491076469,
|
||
|
|
"num_tokens": 5585814.0,
|
||
|
|
"step": 5180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06916419817134738,
|
||
|
|
"epoch": 2.7733333333333334,
|
||
|
|
"grad_norm": 0.29483240842819214,
|
||
|
|
"learning_rate": 4.379162667043779e-07,
|
||
|
|
"loss": 0.07332996129989625,
|
||
|
|
"mean_token_accuracy": 0.9775100320577621,
|
||
|
|
"num_tokens": 5608497.0,
|
||
|
|
"step": 5200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06638877158984542,
|
||
|
|
"epoch": 2.784,
|
||
|
|
"grad_norm": 0.3650195598602295,
|
||
|
|
"learning_rate": 3.9794114024554906e-07,
|
||
|
|
"loss": 0.06668092608451844,
|
||
|
|
"mean_token_accuracy": 0.980099868774414,
|
||
|
|
"num_tokens": 5629582.0,
|
||
|
|
"step": 5220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06656348751857877,
|
||
|
|
"epoch": 2.7946666666666666,
|
||
|
|
"grad_norm": 0.31520113348960876,
|
||
|
|
"learning_rate": 3.5985445985381727e-07,
|
||
|
|
"loss": 0.06691439151763916,
|
||
|
|
"mean_token_accuracy": 0.9794167369604111,
|
||
|
|
"num_tokens": 5650897.0,
|
||
|
|
"step": 5240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06590501200407743,
|
||
|
|
"epoch": 2.8053333333333335,
|
||
|
|
"grad_norm": 0.3223532736301422,
|
||
|
|
"learning_rate": 3.2366115117991146e-07,
|
||
|
|
"loss": 0.06653072834014892,
|
||
|
|
"mean_token_accuracy": 0.9792607888579369,
|
||
|
|
"num_tokens": 5673009.0,
|
||
|
|
"step": 5260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06469663931056857,
|
||
|
|
"epoch": 2.816,
|
||
|
|
"grad_norm": 0.27690476179122925,
|
||
|
|
"learning_rate": 2.893658950097422e-07,
|
||
|
|
"loss": 0.06444936990737915,
|
||
|
|
"mean_token_accuracy": 0.9817123860120773,
|
||
|
|
"num_tokens": 5693845.0,
|
||
|
|
"step": 5280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06907640630379319,
|
||
|
|
"epoch": 2.8266666666666667,
|
||
|
|
"grad_norm": 0.2766023576259613,
|
||
|
|
"learning_rate": 2.569731266590608e-07,
|
||
|
|
"loss": 0.07101809978485107,
|
||
|
|
"mean_token_accuracy": 0.9769211024045944,
|
||
|
|
"num_tokens": 5716621.0,
|
||
|
|
"step": 5300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06807576529681683,
|
||
|
|
"epoch": 2.8373333333333335,
|
||
|
|
"grad_norm": 0.214943990111351,
|
||
|
|
"learning_rate": 2.2648703539984161e-07,
|
||
|
|
"loss": 0.06807198524475097,
|
||
|
|
"mean_token_accuracy": 0.9792288944125176,
|
||
|
|
"num_tokens": 5737713.0,
|
||
|
|
"step": 5320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06559845563024283,
|
||
|
|
"epoch": 2.848,
|
||
|
|
"grad_norm": 0.24327735602855682,
|
||
|
|
"learning_rate": 1.9791156391850695e-07,
|
||
|
|
"loss": 0.06800661087036133,
|
||
|
|
"mean_token_accuracy": 0.9790630683302879,
|
||
|
|
"num_tokens": 5759702.0,
|
||
|
|
"step": 5340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06611165096983314,
|
||
|
|
"epoch": 2.8586666666666667,
|
||
|
|
"grad_norm": 0.23079447448253632,
|
||
|
|
"learning_rate": 1.7125040780601175e-07,
|
||
|
|
"loss": 0.06424795985221862,
|
||
|
|
"mean_token_accuracy": 0.9802783578634262,
|
||
|
|
"num_tokens": 5780385.0,
|
||
|
|
"step": 5360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06495644729584456,
|
||
|
|
"epoch": 2.8693333333333335,
|
||
|
|
"grad_norm": 0.23585422337055206,
|
||
|
|
"learning_rate": 1.4650701507992582e-07,
|
||
|
|
"loss": 0.06308045387268066,
|
||
|
|
"mean_token_accuracy": 0.9818204194307327,
|
||
|
|
"num_tokens": 5800602.0,
|
||
|
|
"step": 5380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06460589049383998,
|
||
|
|
"epoch": 2.88,
|
||
|
|
"grad_norm": 0.27924907207489014,
|
||
|
|
"learning_rate": 1.2368458573848717e-07,
|
||
|
|
"loss": 0.06371138095855713,
|
||
|
|
"mean_token_accuracy": 0.9809283286333084,
|
||
|
|
"num_tokens": 5821016.0,
|
||
|
|
"step": 5400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0652251210063696,
|
||
|
|
"epoch": 2.8906666666666667,
|
||
|
|
"grad_norm": 0.21342748403549194,
|
||
|
|
"learning_rate": 1.0278607134676987e-07,
|
||
|
|
"loss": 0.06635769009590149,
|
||
|
|
"mean_token_accuracy": 0.979735954105854,
|
||
|
|
"num_tokens": 5841929.0,
|
||
|
|
"step": 5420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.0619895207695663,
|
||
|
|
"epoch": 2.9013333333333335,
|
||
|
|
"grad_norm": 0.23523399233818054,
|
||
|
|
"learning_rate": 8.381417465495922e-08,
|
||
|
|
"loss": 0.06180503368377686,
|
||
|
|
"mean_token_accuracy": 0.9817696720361709,
|
||
|
|
"num_tokens": 5862268.0,
|
||
|
|
"step": 5440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06805047616362572,
|
||
|
|
"epoch": 2.912,
|
||
|
|
"grad_norm": 0.3232709765434265,
|
||
|
|
"learning_rate": 6.677134924881978e-08,
|
||
|
|
"loss": 0.06934788227081298,
|
||
|
|
"mean_token_accuracy": 0.9782540738582611,
|
||
|
|
"num_tokens": 5883972.0,
|
||
|
|
"step": 5460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.07081099823117257,
|
||
|
|
"epoch": 2.9226666666666667,
|
||
|
|
"grad_norm": 0.24873663485050201,
|
||
|
|
"learning_rate": 5.165979923236752e-08,
|
||
|
|
"loss": 0.07326069474220276,
|
||
|
|
"mean_token_accuracy": 0.977522186934948,
|
||
|
|
"num_tokens": 5906392.0,
|
||
|
|
"step": 5480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06697621447965503,
|
||
|
|
"epoch": 2.9333333333333336,
|
||
|
|
"grad_norm": 0.2500160336494446,
|
||
|
|
"learning_rate": 3.848147894282783e-08,
|
||
|
|
"loss": 0.06656785011291504,
|
||
|
|
"mean_token_accuracy": 0.9801760748028755,
|
||
|
|
"num_tokens": 5927809.0,
|
||
|
|
"step": 5500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06844843151047826,
|
||
|
|
"epoch": 2.944,
|
||
|
|
"grad_norm": 0.2815072536468506,
|
||
|
|
"learning_rate": 2.7238092697884353e-08,
|
||
|
|
"loss": 0.0686243712902069,
|
||
|
|
"mean_token_accuracy": 0.9783571302890778,
|
||
|
|
"num_tokens": 5950680.0,
|
||
|
|
"step": 5520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06373694511130452,
|
||
|
|
"epoch": 2.9546666666666668,
|
||
|
|
"grad_norm": 0.25896361470222473,
|
||
|
|
"learning_rate": 1.7931094575260322e-08,
|
||
|
|
"loss": 0.06541070938110352,
|
||
|
|
"mean_token_accuracy": 0.9797068655490875,
|
||
|
|
"num_tokens": 5972323.0,
|
||
|
|
"step": 5540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06856830064207316,
|
||
|
|
"epoch": 2.9653333333333336,
|
||
|
|
"grad_norm": 0.30956923961639404,
|
||
|
|
"learning_rate": 1.056168822467396e-08,
|
||
|
|
"loss": 0.06829805374145508,
|
||
|
|
"mean_token_accuracy": 0.9796166166663169,
|
||
|
|
"num_tokens": 5993505.0,
|
||
|
|
"step": 5560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06814236659556627,
|
||
|
|
"epoch": 2.976,
|
||
|
|
"grad_norm": 0.22563952207565308,
|
||
|
|
"learning_rate": 5.1308267121680244e-09,
|
||
|
|
"loss": 0.06708756685256959,
|
||
|
|
"mean_token_accuracy": 0.979302079975605,
|
||
|
|
"num_tokens": 6015143.0,
|
||
|
|
"step": 5580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06459062686190009,
|
||
|
|
"epoch": 2.986666666666667,
|
||
|
|
"grad_norm": 0.2697313725948334,
|
||
|
|
"learning_rate": 1.639212396850054e-09,
|
||
|
|
"loss": 0.0641595482826233,
|
||
|
|
"mean_token_accuracy": 0.980322690308094,
|
||
|
|
"num_tokens": 6036421.0,
|
||
|
|
"step": 5600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 0.06587992180138827,
|
||
|
|
"epoch": 2.997333333333333,
|
||
|
|
"grad_norm": 0.25788185000419617,
|
||
|
|
"learning_rate": 8.729684006669735e-11,
|
||
|
|
"loss": 0.06761438250541688,
|
||
|
|
"mean_token_accuracy": 0.9793855547904968,
|
||
|
|
"num_tokens": 6057835.0,
|
||
|
|
"step": 5620
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 20,
|
||
|
|
"max_steps": 5625,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 3,
|
||
|
|
"save_steps": 20,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 1.016631644913664e+16,
|
||
|
|
"train_batch_size": 8,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|