Files
Qwen1.5-MOE-aux-free-sft-ma…/trainer_state.json
ModelHub XC 7b1d7cbb2c 初始化项目,由ModelHub XC社区提供模型
Model: xd2010/Qwen1.5-MOE-aux-free-sft-math7k-1e-3-gamma-part2
Source: Original Platform
2026-07-15 11:41:12 +08:00

1764 lines
47 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 215,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.004651162790697674,
"grad_norm": 2.2114248275756836,
"learning_rate": 0.0,
"loss": 0.2196,
"mean_token_accuracy": 0.9224496483802795,
"step": 1
},
{
"epoch": 0.009302325581395349,
"grad_norm": 2.0723774433135986,
"learning_rate": 4.5454545454545457e-07,
"loss": 0.2166,
"mean_token_accuracy": 0.9229403138160706,
"step": 2
},
{
"epoch": 0.013953488372093023,
"grad_norm": 2.1615424156188965,
"learning_rate": 9.090909090909091e-07,
"loss": 0.2323,
"mean_token_accuracy": 0.9166936278343201,
"step": 3
},
{
"epoch": 0.018604651162790697,
"grad_norm": 2.037424087524414,
"learning_rate": 1.3636363636363636e-06,
"loss": 0.2193,
"mean_token_accuracy": 0.9216513633728027,
"step": 4
},
{
"epoch": 0.023255813953488372,
"grad_norm": 2.3600544929504395,
"learning_rate": 1.8181818181818183e-06,
"loss": 0.2343,
"mean_token_accuracy": 0.9143187999725342,
"step": 5
},
{
"epoch": 0.027906976744186046,
"grad_norm": 2.287809133529663,
"learning_rate": 2.2727272727272728e-06,
"loss": 0.2202,
"mean_token_accuracy": 0.9239357709884644,
"step": 6
},
{
"epoch": 0.03255813953488372,
"grad_norm": 2.221831798553467,
"learning_rate": 2.7272727272727272e-06,
"loss": 0.2183,
"mean_token_accuracy": 0.9212613105773926,
"step": 7
},
{
"epoch": 0.037209302325581395,
"grad_norm": 2.532069683074951,
"learning_rate": 3.181818181818182e-06,
"loss": 0.2046,
"mean_token_accuracy": 0.927347719669342,
"step": 8
},
{
"epoch": 0.04186046511627907,
"grad_norm": 2.511592388153076,
"learning_rate": 3.6363636363636366e-06,
"loss": 0.1895,
"mean_token_accuracy": 0.932911217212677,
"step": 9
},
{
"epoch": 0.046511627906976744,
"grad_norm": 1.9913058280944824,
"learning_rate": 4.0909090909090915e-06,
"loss": 0.18,
"mean_token_accuracy": 0.934699296951294,
"step": 10
},
{
"epoch": 0.05116279069767442,
"grad_norm": 1.8915150165557861,
"learning_rate": 4.5454545454545455e-06,
"loss": 0.1647,
"mean_token_accuracy": 0.937118649482727,
"step": 11
},
{
"epoch": 0.05581395348837209,
"grad_norm": 2.0039026737213135,
"learning_rate": 5e-06,
"loss": 0.1711,
"mean_token_accuracy": 0.938572108745575,
"step": 12
},
{
"epoch": 0.06046511627906977,
"grad_norm": 1.9259536266326904,
"learning_rate": 5.4545454545454545e-06,
"loss": 0.1563,
"mean_token_accuracy": 0.9456785917282104,
"step": 13
},
{
"epoch": 0.06511627906976744,
"grad_norm": 1.9658490419387817,
"learning_rate": 5.90909090909091e-06,
"loss": 0.1225,
"mean_token_accuracy": 0.9512993097305298,
"step": 14
},
{
"epoch": 0.06976744186046512,
"grad_norm": 1.7610844373703003,
"learning_rate": 6.363636363636364e-06,
"loss": 0.0932,
"mean_token_accuracy": 0.9662150740623474,
"step": 15
},
{
"epoch": 0.07441860465116279,
"grad_norm": 2.5610358715057373,
"learning_rate": 6.818181818181818e-06,
"loss": 0.1276,
"mean_token_accuracy": 0.9545891880989075,
"step": 16
},
{
"epoch": 0.07906976744186046,
"grad_norm": 2.491724729537964,
"learning_rate": 7.272727272727273e-06,
"loss": 0.1044,
"mean_token_accuracy": 0.9636728763580322,
"step": 17
},
{
"epoch": 0.08372093023255814,
"grad_norm": 2.765408754348755,
"learning_rate": 7.727272727272727e-06,
"loss": 0.1275,
"mean_token_accuracy": 0.954607367515564,
"step": 18
},
{
"epoch": 0.08837209302325581,
"grad_norm": 3.64901065826416,
"learning_rate": 8.181818181818183e-06,
"loss": 0.1334,
"mean_token_accuracy": 0.9575119614601135,
"step": 19
},
{
"epoch": 0.09302325581395349,
"grad_norm": 2.4553587436676025,
"learning_rate": 8.636363636363637e-06,
"loss": 0.1105,
"mean_token_accuracy": 0.9608086943626404,
"step": 20
},
{
"epoch": 0.09767441860465116,
"grad_norm": 2.5622127056121826,
"learning_rate": 9.090909090909091e-06,
"loss": 0.1251,
"mean_token_accuracy": 0.9549927115440369,
"step": 21
},
{
"epoch": 0.10232558139534884,
"grad_norm": 2.823493003845215,
"learning_rate": 9.545454545454547e-06,
"loss": 0.1344,
"mean_token_accuracy": 0.9475542306900024,
"step": 22
},
{
"epoch": 0.10697674418604651,
"grad_norm": 2.254096269607544,
"learning_rate": 1e-05,
"loss": 0.1168,
"mean_token_accuracy": 0.9586217999458313,
"step": 23
},
{
"epoch": 0.11162790697674418,
"grad_norm": 2.321820020675659,
"learning_rate": 9.999403846557509e-06,
"loss": 0.1247,
"mean_token_accuracy": 0.9542049765586853,
"step": 24
},
{
"epoch": 0.11627906976744186,
"grad_norm": 2.1490819454193115,
"learning_rate": 9.99761554418511e-06,
"loss": 0.1092,
"mean_token_accuracy": 0.95828777551651,
"step": 25
},
{
"epoch": 0.12093023255813953,
"grad_norm": 2.0249152183532715,
"learning_rate": 9.99463556670619e-06,
"loss": 0.1064,
"mean_token_accuracy": 0.9618995189666748,
"step": 26
},
{
"epoch": 0.12558139534883722,
"grad_norm": 2.186185359954834,
"learning_rate": 9.990464703686895e-06,
"loss": 0.1303,
"mean_token_accuracy": 0.9548563361167908,
"step": 27
},
{
"epoch": 0.13023255813953488,
"grad_norm": 2.2221741676330566,
"learning_rate": 9.985104060226937e-06,
"loss": 0.1226,
"mean_token_accuracy": 0.9575985074043274,
"step": 28
},
{
"epoch": 0.13488372093023257,
"grad_norm": 2.503443956375122,
"learning_rate": 9.978555056666784e-06,
"loss": 0.1491,
"mean_token_accuracy": 0.9494796991348267,
"step": 29
},
{
"epoch": 0.13953488372093023,
"grad_norm": 2.190901041030884,
"learning_rate": 9.97081942821133e-06,
"loss": 0.1413,
"mean_token_accuracy": 0.9503697752952576,
"step": 30
},
{
"epoch": 0.14418604651162792,
"grad_norm": 2.317234754562378,
"learning_rate": 9.961899224470146e-06,
"loss": 0.1459,
"mean_token_accuracy": 0.9485085010528564,
"step": 31
},
{
"epoch": 0.14883720930232558,
"grad_norm": 2.1371970176696777,
"learning_rate": 9.95179680891442e-06,
"loss": 0.1196,
"mean_token_accuracy": 0.9573848247528076,
"step": 32
},
{
"epoch": 0.15348837209302327,
"grad_norm": 2.4324705600738525,
"learning_rate": 9.940514858250736e-06,
"loss": 0.1206,
"mean_token_accuracy": 0.9569304585456848,
"step": 33
},
{
"epoch": 0.15813953488372093,
"grad_norm": 2.2409706115722656,
"learning_rate": 9.928056361711854e-06,
"loss": 0.1194,
"mean_token_accuracy": 0.9581000804901123,
"step": 34
},
{
"epoch": 0.16279069767441862,
"grad_norm": 2.1415605545043945,
"learning_rate": 9.914424620264714e-06,
"loss": 0.1333,
"mean_token_accuracy": 0.9521136283874512,
"step": 35
},
{
"epoch": 0.16744186046511628,
"grad_norm": 2.266721487045288,
"learning_rate": 9.899623245735798e-06,
"loss": 0.1215,
"mean_token_accuracy": 0.9567227959632874,
"step": 36
},
{
"epoch": 0.17209302325581396,
"grad_norm": 2.1232471466064453,
"learning_rate": 9.883656159854166e-06,
"loss": 0.1173,
"mean_token_accuracy": 0.9587419033050537,
"step": 37
},
{
"epoch": 0.17674418604651163,
"grad_norm": 2.2392640113830566,
"learning_rate": 9.866527593212355e-06,
"loss": 0.1178,
"mean_token_accuracy": 0.9596466422080994,
"step": 38
},
{
"epoch": 0.1813953488372093,
"grad_norm": 1.9644360542297363,
"learning_rate": 9.848242084145462e-06,
"loss": 0.1146,
"mean_token_accuracy": 0.9602649211883545,
"step": 39
},
{
"epoch": 0.18604651162790697,
"grad_norm": 2.2388856410980225,
"learning_rate": 9.82880447752868e-06,
"loss": 0.1288,
"mean_token_accuracy": 0.953513503074646,
"step": 40
},
{
"epoch": 0.19069767441860466,
"grad_norm": 2.158182382583618,
"learning_rate": 9.808219923493606e-06,
"loss": 0.1189,
"mean_token_accuracy": 0.9582207798957825,
"step": 41
},
{
"epoch": 0.19534883720930232,
"grad_norm": 2.314441204071045,
"learning_rate": 9.786493876063685e-06,
"loss": 0.1278,
"mean_token_accuracy": 0.9543681740760803,
"step": 42
},
{
"epoch": 0.2,
"grad_norm": 2.0895299911499023,
"learning_rate": 9.763632091709125e-06,
"loss": 0.1096,
"mean_token_accuracy": 0.9583253860473633,
"step": 43
},
{
"epoch": 0.20465116279069767,
"grad_norm": 2.2945597171783447,
"learning_rate": 9.739640627821678e-06,
"loss": 0.1323,
"mean_token_accuracy": 0.9572258591651917,
"step": 44
},
{
"epoch": 0.20930232558139536,
"grad_norm": 2.4532723426818848,
"learning_rate": 9.714525841109697e-06,
"loss": 0.1357,
"mean_token_accuracy": 0.9541955590248108,
"step": 45
},
{
"epoch": 0.21395348837209302,
"grad_norm": 2.2597134113311768,
"learning_rate": 9.68829438591387e-06,
"loss": 0.1356,
"mean_token_accuracy": 0.9518094062805176,
"step": 46
},
{
"epoch": 0.2186046511627907,
"grad_norm": 2.282038927078247,
"learning_rate": 9.660953212444116e-06,
"loss": 0.1361,
"mean_token_accuracy": 0.9526952505111694,
"step": 47
},
{
"epoch": 0.22325581395348837,
"grad_norm": 2.733839750289917,
"learning_rate": 9.632509564938073e-06,
"loss": 0.1379,
"mean_token_accuracy": 0.9518115520477295,
"step": 48
},
{
"epoch": 0.22790697674418606,
"grad_norm": 2.017904281616211,
"learning_rate": 9.60297097974169e-06,
"loss": 0.1272,
"mean_token_accuracy": 0.9559664130210876,
"step": 49
},
{
"epoch": 0.23255813953488372,
"grad_norm": 1.9581328630447388,
"learning_rate": 9.572345283312407e-06,
"loss": 0.1124,
"mean_token_accuracy": 0.9602742195129395,
"step": 50
},
{
"epoch": 0.2372093023255814,
"grad_norm": 2.120893955230713,
"learning_rate": 9.540640590145496e-06,
"loss": 0.1378,
"mean_token_accuracy": 0.9456697106361389,
"step": 51
},
{
"epoch": 0.24186046511627907,
"grad_norm": 2.001924991607666,
"learning_rate": 9.507865300624057e-06,
"loss": 0.134,
"mean_token_accuracy": 0.9449650645256042,
"step": 52
},
{
"epoch": 0.24651162790697675,
"grad_norm": 2.139742851257324,
"learning_rate": 9.474028098793277e-06,
"loss": 0.1113,
"mean_token_accuracy": 0.9595959782600403,
"step": 53
},
{
"epoch": 0.25116279069767444,
"grad_norm": 2.0597422122955322,
"learning_rate": 9.439137950059539e-06,
"loss": 0.132,
"mean_token_accuracy": 0.9540942907333374,
"step": 54
},
{
"epoch": 0.2558139534883721,
"grad_norm": 2.0951530933380127,
"learning_rate": 9.403204098814965e-06,
"loss": 0.1414,
"mean_token_accuracy": 0.9491157531738281,
"step": 55
},
{
"epoch": 0.26046511627906976,
"grad_norm": 2.0508220195770264,
"learning_rate": 9.366236065988053e-06,
"loss": 0.1258,
"mean_token_accuracy": 0.9535974860191345,
"step": 56
},
{
"epoch": 0.2651162790697674,
"grad_norm": 2.0452070236206055,
"learning_rate": 9.32824364652104e-06,
"loss": 0.1213,
"mean_token_accuracy": 0.9569804072380066,
"step": 57
},
{
"epoch": 0.26976744186046514,
"grad_norm": 2.181885004043579,
"learning_rate": 9.289236906774663e-06,
"loss": 0.1246,
"mean_token_accuracy": 0.9535802602767944,
"step": 58
},
{
"epoch": 0.2744186046511628,
"grad_norm": 2.502920389175415,
"learning_rate": 9.249226181861e-06,
"loss": 0.1388,
"mean_token_accuracy": 0.9509103894233704,
"step": 59
},
{
"epoch": 0.27906976744186046,
"grad_norm": 2.1321425437927246,
"learning_rate": 9.208222072905113e-06,
"loss": 0.1231,
"mean_token_accuracy": 0.9544691443443298,
"step": 60
},
{
"epoch": 0.2837209302325581,
"grad_norm": 2.4787492752075195,
"learning_rate": 9.166235444236209e-06,
"loss": 0.1473,
"mean_token_accuracy": 0.9451818466186523,
"step": 61
},
{
"epoch": 0.28837209302325584,
"grad_norm": 2.26334810256958,
"learning_rate": 9.123277420509053e-06,
"loss": 0.1472,
"mean_token_accuracy": 0.9477797746658325,
"step": 62
},
{
"epoch": 0.2930232558139535,
"grad_norm": 2.1905953884124756,
"learning_rate": 9.079359383756411e-06,
"loss": 0.1371,
"mean_token_accuracy": 0.9492079615592957,
"step": 63
},
{
"epoch": 0.29767441860465116,
"grad_norm": 2.2891685962677,
"learning_rate": 9.034492970373305e-06,
"loss": 0.1289,
"mean_token_accuracy": 0.9549328088760376,
"step": 64
},
{
"epoch": 0.3023255813953488,
"grad_norm": 2.014946699142456,
"learning_rate": 8.988690068033864e-06,
"loss": 0.1317,
"mean_token_accuracy": 0.952854573726654,
"step": 65
},
{
"epoch": 0.30697674418604654,
"grad_norm": 2.2927684783935547,
"learning_rate": 8.941962812541604e-06,
"loss": 0.1299,
"mean_token_accuracy": 0.952826976776123,
"step": 66
},
{
"epoch": 0.3116279069767442,
"grad_norm": 1.8622946739196777,
"learning_rate": 8.894323584613951e-06,
"loss": 0.1313,
"mean_token_accuracy": 0.9536823630332947,
"step": 67
},
{
"epoch": 0.31627906976744186,
"grad_norm": 1.9800999164581299,
"learning_rate": 8.845785006601898e-06,
"loss": 0.116,
"mean_token_accuracy": 0.958354651927948,
"step": 68
},
{
"epoch": 0.3209302325581395,
"grad_norm": 2.2661781311035156,
"learning_rate": 8.796359939145614e-06,
"loss": 0.1284,
"mean_token_accuracy": 0.9528335332870483,
"step": 69
},
{
"epoch": 0.32558139534883723,
"grad_norm": 2.448075532913208,
"learning_rate": 8.74606147776692e-06,
"loss": 0.14,
"mean_token_accuracy": 0.9489418864250183,
"step": 70
},
{
"epoch": 0.3302325581395349,
"grad_norm": 2.2173235416412354,
"learning_rate": 8.694902949399555e-06,
"loss": 0.1365,
"mean_token_accuracy": 0.9519818425178528,
"step": 71
},
{
"epoch": 0.33488372093023255,
"grad_norm": 2.2065324783325195,
"learning_rate": 8.642897908858096e-06,
"loss": 0.128,
"mean_token_accuracy": 0.9549423456192017,
"step": 72
},
{
"epoch": 0.3395348837209302,
"grad_norm": 2.3709309101104736,
"learning_rate": 8.590060135246516e-06,
"loss": 0.1508,
"mean_token_accuracy": 0.9460594058036804,
"step": 73
},
{
"epoch": 0.34418604651162793,
"grad_norm": 2.10296630859375,
"learning_rate": 8.53640362830732e-06,
"loss": 0.1139,
"mean_token_accuracy": 0.9574284553527832,
"step": 74
},
{
"epoch": 0.3488372093023256,
"grad_norm": 2.3740813732147217,
"learning_rate": 8.481942604712209e-06,
"loss": 0.1374,
"mean_token_accuracy": 0.9532406330108643,
"step": 75
},
{
"epoch": 0.35348837209302325,
"grad_norm": 2.1128122806549072,
"learning_rate": 8.426691494295269e-06,
"loss": 0.1322,
"mean_token_accuracy": 0.9526184797286987,
"step": 76
},
{
"epoch": 0.3581395348837209,
"grad_norm": 2.0713388919830322,
"learning_rate": 8.370664936229688e-06,
"loss": 0.1372,
"mean_token_accuracy": 0.9511680603027344,
"step": 77
},
{
"epoch": 0.3627906976744186,
"grad_norm": 2.127915859222412,
"learning_rate": 8.313877775149009e-06,
"loss": 0.1219,
"mean_token_accuracy": 0.9576807618141174,
"step": 78
},
{
"epoch": 0.3674418604651163,
"grad_norm": 2.3170533180236816,
"learning_rate": 8.256345057213925e-06,
"loss": 0.1443,
"mean_token_accuracy": 0.9483892917633057,
"step": 79
},
{
"epoch": 0.37209302325581395,
"grad_norm": 2.0527758598327637,
"learning_rate": 8.198082026125707e-06,
"loss": 0.1255,
"mean_token_accuracy": 0.9523978233337402,
"step": 80
},
{
"epoch": 0.3767441860465116,
"grad_norm": 2.05676007270813,
"learning_rate": 8.139104119087265e-06,
"loss": 0.1249,
"mean_token_accuracy": 0.9549195766448975,
"step": 81
},
{
"epoch": 0.3813953488372093,
"grad_norm": 2.002903699874878,
"learning_rate": 8.07942696271296e-06,
"loss": 0.118,
"mean_token_accuracy": 0.957054078578949,
"step": 82
},
{
"epoch": 0.386046511627907,
"grad_norm": 2.263026475906372,
"learning_rate": 8.019066368888222e-06,
"loss": 0.1376,
"mean_token_accuracy": 0.9531168341636658,
"step": 83
},
{
"epoch": 0.39069767441860465,
"grad_norm": 2.1725878715515137,
"learning_rate": 7.958038330580067e-06,
"loss": 0.1487,
"mean_token_accuracy": 0.9452034831047058,
"step": 84
},
{
"epoch": 0.3953488372093023,
"grad_norm": 1.900057315826416,
"learning_rate": 7.89635901759967e-06,
"loss": 0.138,
"mean_token_accuracy": 0.9475666284561157,
"step": 85
},
{
"epoch": 0.4,
"grad_norm": 2.298158645629883,
"learning_rate": 7.834044772318033e-06,
"loss": 0.1654,
"mean_token_accuracy": 0.9408732056617737,
"step": 86
},
{
"epoch": 0.4046511627906977,
"grad_norm": 2.2092435359954834,
"learning_rate": 7.77111210533597e-06,
"loss": 0.132,
"mean_token_accuracy": 0.955048143863678,
"step": 87
},
{
"epoch": 0.40930232558139534,
"grad_norm": 2.544060468673706,
"learning_rate": 7.707577691109519e-06,
"loss": 0.182,
"mean_token_accuracy": 0.9341899752616882,
"step": 88
},
{
"epoch": 0.413953488372093,
"grad_norm": 2.0176243782043457,
"learning_rate": 7.6434583635319e-06,
"loss": 0.1392,
"mean_token_accuracy": 0.9515554904937744,
"step": 89
},
{
"epoch": 0.4186046511627907,
"grad_norm": 1.986615777015686,
"learning_rate": 7.578771111473276e-06,
"loss": 0.1096,
"mean_token_accuracy": 0.9597609639167786,
"step": 90
},
{
"epoch": 0.4232558139534884,
"grad_norm": 1.9400761127471924,
"learning_rate": 7.513533074279427e-06,
"loss": 0.1166,
"mean_token_accuracy": 0.9585210084915161,
"step": 91
},
{
"epoch": 0.42790697674418604,
"grad_norm": 2.2367358207702637,
"learning_rate": 7.4477615372305545e-06,
"loss": 0.1372,
"mean_token_accuracy": 0.9512780904769897,
"step": 92
},
{
"epoch": 0.4325581395348837,
"grad_norm": 2.0760915279388428,
"learning_rate": 7.3814739269614265e-06,
"loss": 0.1268,
"mean_token_accuracy": 0.9533308744430542,
"step": 93
},
{
"epoch": 0.4372093023255814,
"grad_norm": 2.039663314819336,
"learning_rate": 7.314687806844067e-06,
"loss": 0.1419,
"mean_token_accuracy": 0.945841372013092,
"step": 94
},
{
"epoch": 0.4418604651162791,
"grad_norm": 2.1886751651763916,
"learning_rate": 7.247420872334221e-06,
"loss": 0.1326,
"mean_token_accuracy": 0.952744722366333,
"step": 95
},
{
"epoch": 0.44651162790697674,
"grad_norm": 1.9584012031555176,
"learning_rate": 7.179690946282808e-06,
"loss": 0.1162,
"mean_token_accuracy": 0.9587628841400146,
"step": 96
},
{
"epoch": 0.4511627906976744,
"grad_norm": 2.104785203933716,
"learning_rate": 7.111515974213639e-06,
"loss": 0.1164,
"mean_token_accuracy": 0.9576154351234436,
"step": 97
},
{
"epoch": 0.4558139534883721,
"grad_norm": 2.0664682388305664,
"learning_rate": 7.042914019568621e-06,
"loss": 0.1293,
"mean_token_accuracy": 0.9517142176628113,
"step": 98
},
{
"epoch": 0.4604651162790698,
"grad_norm": 1.845027208328247,
"learning_rate": 6.973903258921719e-06,
"loss": 0.1165,
"mean_token_accuracy": 0.9597806334495544,
"step": 99
},
{
"epoch": 0.46511627906976744,
"grad_norm": 2.4039275646209717,
"learning_rate": 6.904501977162949e-06,
"loss": 0.1445,
"mean_token_accuracy": 0.9478161334991455,
"step": 100
},
{
"epoch": 0.4697674418604651,
"grad_norm": 2.081846237182617,
"learning_rate": 6.834728562653659e-06,
"loss": 0.1397,
"mean_token_accuracy": 0.9507532715797424,
"step": 101
},
{
"epoch": 0.4744186046511628,
"grad_norm": 2.234560012817383,
"learning_rate": 6.764601502354403e-06,
"loss": 0.1398,
"mean_token_accuracy": 0.9514716267585754,
"step": 102
},
{
"epoch": 0.4790697674418605,
"grad_norm": 2.183743953704834,
"learning_rate": 6.6941393769266995e-06,
"loss": 0.1485,
"mean_token_accuracy": 0.945875883102417,
"step": 103
},
{
"epoch": 0.48372093023255813,
"grad_norm": 2.0833141803741455,
"learning_rate": 6.6233608558099405e-06,
"loss": 0.129,
"mean_token_accuracy": 0.9532462954521179,
"step": 104
},
{
"epoch": 0.4883720930232558,
"grad_norm": 2.300926446914673,
"learning_rate": 6.552284692274803e-06,
"loss": 0.1572,
"mean_token_accuracy": 0.939317524433136,
"step": 105
},
{
"epoch": 0.4930232558139535,
"grad_norm": 2.2976064682006836,
"learning_rate": 6.48092971845443e-06,
"loss": 0.1543,
"mean_token_accuracy": 0.9445100426673889,
"step": 106
},
{
"epoch": 0.49767441860465117,
"grad_norm": 2.7567296028137207,
"learning_rate": 6.409314840354724e-06,
"loss": 0.1757,
"mean_token_accuracy": 0.9392008185386658,
"step": 107
},
{
"epoch": 0.5023255813953489,
"grad_norm": 2.7493550777435303,
"learning_rate": 6.337459032845068e-06,
"loss": 0.1778,
"mean_token_accuracy": 0.9281901121139526,
"step": 108
},
{
"epoch": 0.5069767441860465,
"grad_norm": 4.160806179046631,
"learning_rate": 6.2653813346308e-06,
"loss": 0.1504,
"mean_token_accuracy": 0.9514563083648682,
"step": 109
},
{
"epoch": 0.5116279069767442,
"grad_norm": 6.210575103759766,
"learning_rate": 6.193100843208772e-06,
"loss": 0.1501,
"mean_token_accuracy": 0.9448494911193848,
"step": 110
},
{
"epoch": 0.5162790697674419,
"grad_norm": 2.7258520126342773,
"learning_rate": 6.120636709807334e-06,
"loss": 0.162,
"mean_token_accuracy": 0.9411876797676086,
"step": 111
},
{
"epoch": 0.5209302325581395,
"grad_norm": 2.7637786865234375,
"learning_rate": 6.048008134312078e-06,
"loss": 0.1566,
"mean_token_accuracy": 0.9405099153518677,
"step": 112
},
{
"epoch": 0.5255813953488372,
"grad_norm": 2.351895332336426,
"learning_rate": 5.975234360178698e-06,
"loss": 0.1913,
"mean_token_accuracy": 0.9291128516197205,
"step": 113
},
{
"epoch": 0.5302325581395348,
"grad_norm": 2.0898733139038086,
"learning_rate": 5.902334669334287e-06,
"loss": 0.1581,
"mean_token_accuracy": 0.9421935081481934,
"step": 114
},
{
"epoch": 0.5348837209302325,
"grad_norm": 2.2015750408172607,
"learning_rate": 5.829328377068476e-06,
"loss": 0.1639,
"mean_token_accuracy": 0.9378551840782166,
"step": 115
},
{
"epoch": 0.5395348837209303,
"grad_norm": 2.1996021270751953,
"learning_rate": 5.756234826915686e-06,
"loss": 0.1804,
"mean_token_accuracy": 0.9348623752593994,
"step": 116
},
{
"epoch": 0.5441860465116279,
"grad_norm": 2.413963556289673,
"learning_rate": 5.683073385529938e-06,
"loss": 0.1673,
"mean_token_accuracy": 0.938205361366272,
"step": 117
},
{
"epoch": 0.5488372093023256,
"grad_norm": 2.0604939460754395,
"learning_rate": 5.60986343755352e-06,
"loss": 0.1454,
"mean_token_accuracy": 0.948581874370575,
"step": 118
},
{
"epoch": 0.5534883720930233,
"grad_norm": 2.032255172729492,
"learning_rate": 5.536624380480878e-06,
"loss": 0.1385,
"mean_token_accuracy": 0.9510709643363953,
"step": 119
},
{
"epoch": 0.5581395348837209,
"grad_norm": 2.024848461151123,
"learning_rate": 5.4633756195191235e-06,
"loss": 0.1455,
"mean_token_accuracy": 0.9449432492256165,
"step": 120
},
{
"epoch": 0.5627906976744186,
"grad_norm": 1.7776316404342651,
"learning_rate": 5.390136562446482e-06,
"loss": 0.1283,
"mean_token_accuracy": 0.954091489315033,
"step": 121
},
{
"epoch": 0.5674418604651162,
"grad_norm": 2.231447458267212,
"learning_rate": 5.316926614470063e-06,
"loss": 0.165,
"mean_token_accuracy": 0.9395132660865784,
"step": 122
},
{
"epoch": 0.5720930232558139,
"grad_norm": 2.4725592136383057,
"learning_rate": 5.2437651730843165e-06,
"loss": 0.2085,
"mean_token_accuracy": 0.9223983287811279,
"step": 123
},
{
"epoch": 0.5767441860465117,
"grad_norm": 2.5066394805908203,
"learning_rate": 5.170671622931527e-06,
"loss": 0.2028,
"mean_token_accuracy": 0.9242201447486877,
"step": 124
},
{
"epoch": 0.5813953488372093,
"grad_norm": 2.0127978324890137,
"learning_rate": 5.097665330665714e-06,
"loss": 0.124,
"mean_token_accuracy": 0.9552622437477112,
"step": 125
},
{
"epoch": 0.586046511627907,
"grad_norm": 2.4899189472198486,
"learning_rate": 5.024765639821305e-06,
"loss": 0.1729,
"mean_token_accuracy": 0.9365900158882141,
"step": 126
},
{
"epoch": 0.5906976744186047,
"grad_norm": 1.94431471824646,
"learning_rate": 4.951991865687923e-06,
"loss": 0.1386,
"mean_token_accuracy": 0.9501959681510925,
"step": 127
},
{
"epoch": 0.5953488372093023,
"grad_norm": 2.4740915298461914,
"learning_rate": 4.879363290192667e-06,
"loss": 0.1812,
"mean_token_accuracy": 0.9385085701942444,
"step": 128
},
{
"epoch": 0.6,
"grad_norm": 2.570204973220825,
"learning_rate": 4.806899156791231e-06,
"loss": 0.2069,
"mean_token_accuracy": 0.9259189963340759,
"step": 129
},
{
"epoch": 0.6046511627906976,
"grad_norm": 2.5832550525665283,
"learning_rate": 4.734618665369202e-06,
"loss": 0.1748,
"mean_token_accuracy": 0.9329256415367126,
"step": 130
},
{
"epoch": 0.6093023255813953,
"grad_norm": 2.2135725021362305,
"learning_rate": 4.662540967154934e-06,
"loss": 0.1584,
"mean_token_accuracy": 0.9435682892799377,
"step": 131
},
{
"epoch": 0.6139534883720931,
"grad_norm": 2.243936777114868,
"learning_rate": 4.5906851596452765e-06,
"loss": 0.1607,
"mean_token_accuracy": 0.941770076751709,
"step": 132
},
{
"epoch": 0.6186046511627907,
"grad_norm": 2.4644687175750732,
"learning_rate": 4.519070281545571e-06,
"loss": 0.1855,
"mean_token_accuracy": 0.9312141537666321,
"step": 133
},
{
"epoch": 0.6232558139534884,
"grad_norm": 2.4231929779052734,
"learning_rate": 4.447715307725197e-06,
"loss": 0.1822,
"mean_token_accuracy": 0.9323040246963501,
"step": 134
},
{
"epoch": 0.627906976744186,
"grad_norm": 2.3582451343536377,
"learning_rate": 4.376639144190061e-06,
"loss": 0.1982,
"mean_token_accuracy": 0.9292059540748596,
"step": 135
},
{
"epoch": 0.6325581395348837,
"grad_norm": 2.3659980297088623,
"learning_rate": 4.305860623073304e-06,
"loss": 0.1886,
"mean_token_accuracy": 0.9302771687507629,
"step": 136
},
{
"epoch": 0.6372093023255814,
"grad_norm": 2.134996175765991,
"learning_rate": 4.2353984976456e-06,
"loss": 0.1635,
"mean_token_accuracy": 0.945655882358551,
"step": 137
},
{
"epoch": 0.641860465116279,
"grad_norm": 2.228179931640625,
"learning_rate": 4.1652714373463435e-06,
"loss": 0.1744,
"mean_token_accuracy": 0.9358843564987183,
"step": 138
},
{
"epoch": 0.6465116279069767,
"grad_norm": 2.138805627822876,
"learning_rate": 4.095498022837051e-06,
"loss": 0.1709,
"mean_token_accuracy": 0.9394161701202393,
"step": 139
},
{
"epoch": 0.6511627906976745,
"grad_norm": 2.4134600162506104,
"learning_rate": 4.026096741078281e-06,
"loss": 0.2073,
"mean_token_accuracy": 0.9247809052467346,
"step": 140
},
{
"epoch": 0.6558139534883721,
"grad_norm": 2.3286097049713135,
"learning_rate": 3.957085980431382e-06,
"loss": 0.2015,
"mean_token_accuracy": 0.9283841252326965,
"step": 141
},
{
"epoch": 0.6604651162790698,
"grad_norm": 2.3675103187561035,
"learning_rate": 3.888484025786364e-06,
"loss": 0.1873,
"mean_token_accuracy": 0.935422420501709,
"step": 142
},
{
"epoch": 0.6651162790697674,
"grad_norm": 2.2542030811309814,
"learning_rate": 3.820309053717195e-06,
"loss": 0.1732,
"mean_token_accuracy": 0.9398706555366516,
"step": 143
},
{
"epoch": 0.6697674418604651,
"grad_norm": 2.5563859939575195,
"learning_rate": 3.75257912766578e-06,
"loss": 0.2337,
"mean_token_accuracy": 0.919076144695282,
"step": 144
},
{
"epoch": 0.6744186046511628,
"grad_norm": 2.740525007247925,
"learning_rate": 3.6853121931559334e-06,
"loss": 0.2133,
"mean_token_accuracy": 0.9239462018013,
"step": 145
},
{
"epoch": 0.6790697674418604,
"grad_norm": 2.380431890487671,
"learning_rate": 3.618526073038574e-06,
"loss": 0.2423,
"mean_token_accuracy": 0.9069680571556091,
"step": 146
},
{
"epoch": 0.6837209302325581,
"grad_norm": 2.2644641399383545,
"learning_rate": 3.552238462769446e-06,
"loss": 0.1825,
"mean_token_accuracy": 0.9340601563453674,
"step": 147
},
{
"epoch": 0.6883720930232559,
"grad_norm": 2.2253427505493164,
"learning_rate": 3.4864669257205745e-06,
"loss": 0.1827,
"mean_token_accuracy": 0.9364906549453735,
"step": 148
},
{
"epoch": 0.6930232558139535,
"grad_norm": 2.305551290512085,
"learning_rate": 3.4212288885267246e-06,
"loss": 0.211,
"mean_token_accuracy": 0.9235766530036926,
"step": 149
},
{
"epoch": 0.6976744186046512,
"grad_norm": 2.4366819858551025,
"learning_rate": 3.3565416364681016e-06,
"loss": 0.1933,
"mean_token_accuracy": 0.934188187122345,
"step": 150
},
{
"epoch": 0.7023255813953488,
"grad_norm": 2.120678663253784,
"learning_rate": 3.2924223088904816e-06,
"loss": 0.1829,
"mean_token_accuracy": 0.9341450929641724,
"step": 151
},
{
"epoch": 0.7069767441860465,
"grad_norm": 2.765115976333618,
"learning_rate": 3.228887894664029e-06,
"loss": 0.2416,
"mean_token_accuracy": 0.9131013751029968,
"step": 152
},
{
"epoch": 0.7116279069767442,
"grad_norm": 2.6073999404907227,
"learning_rate": 3.1659552276819693e-06,
"loss": 0.2286,
"mean_token_accuracy": 0.9195277094841003,
"step": 153
},
{
"epoch": 0.7162790697674418,
"grad_norm": 2.3940727710723877,
"learning_rate": 3.1036409824003324e-06,
"loss": 0.1999,
"mean_token_accuracy": 0.9278870224952698,
"step": 154
},
{
"epoch": 0.7209302325581395,
"grad_norm": 2.1819043159484863,
"learning_rate": 3.0419616694199327e-06,
"loss": 0.1865,
"mean_token_accuracy": 0.9324924349784851,
"step": 155
},
{
"epoch": 0.7255813953488373,
"grad_norm": 2.1513233184814453,
"learning_rate": 2.98093363111178e-06,
"loss": 0.1609,
"mean_token_accuracy": 0.9402922987937927,
"step": 156
},
{
"epoch": 0.7302325581395349,
"grad_norm": 2.487457275390625,
"learning_rate": 2.92057303728704e-06,
"loss": 0.2108,
"mean_token_accuracy": 0.9236377477645874,
"step": 157
},
{
"epoch": 0.7348837209302326,
"grad_norm": 2.2723348140716553,
"learning_rate": 2.860895880912735e-06,
"loss": 0.1984,
"mean_token_accuracy": 0.9300382733345032,
"step": 158
},
{
"epoch": 0.7395348837209302,
"grad_norm": 2.418523073196411,
"learning_rate": 2.801917973874294e-06,
"loss": 0.2253,
"mean_token_accuracy": 0.9189647436141968,
"step": 159
},
{
"epoch": 0.7441860465116279,
"grad_norm": 2.488349199295044,
"learning_rate": 2.7436549427860766e-06,
"loss": 0.2423,
"mean_token_accuracy": 0.9125044345855713,
"step": 160
},
{
"epoch": 0.7488372093023256,
"grad_norm": 2.1933088302612305,
"learning_rate": 2.6861222248509926e-06,
"loss": 0.1774,
"mean_token_accuracy": 0.9362761974334717,
"step": 161
},
{
"epoch": 0.7534883720930232,
"grad_norm": 2.2860469818115234,
"learning_rate": 2.6293350637703123e-06,
"loss": 0.2091,
"mean_token_accuracy": 0.9287545084953308,
"step": 162
},
{
"epoch": 0.7581395348837209,
"grad_norm": 2.4092366695404053,
"learning_rate": 2.5733085057047325e-06,
"loss": 0.212,
"mean_token_accuracy": 0.9241366982460022,
"step": 163
},
{
"epoch": 0.7627906976744186,
"grad_norm": 2.3280487060546875,
"learning_rate": 2.518057395287792e-06,
"loss": 0.2286,
"mean_token_accuracy": 0.9198589324951172,
"step": 164
},
{
"epoch": 0.7674418604651163,
"grad_norm": 2.6434130668640137,
"learning_rate": 2.463596371692681e-06,
"loss": 0.225,
"mean_token_accuracy": 0.9186698198318481,
"step": 165
},
{
"epoch": 0.772093023255814,
"grad_norm": 2.556109666824341,
"learning_rate": 2.409939864753487e-06,
"loss": 0.2401,
"mean_token_accuracy": 0.9132218956947327,
"step": 166
},
{
"epoch": 0.7767441860465116,
"grad_norm": 2.3139853477478027,
"learning_rate": 2.3571020911419067e-06,
"loss": 0.2286,
"mean_token_accuracy": 0.9233333468437195,
"step": 167
},
{
"epoch": 0.7813953488372093,
"grad_norm": 2.5117015838623047,
"learning_rate": 2.3050970506004463e-06,
"loss": 0.2471,
"mean_token_accuracy": 0.9140174388885498,
"step": 168
},
{
"epoch": 0.786046511627907,
"grad_norm": 2.4503190517425537,
"learning_rate": 2.2539385222330797e-06,
"loss": 0.1955,
"mean_token_accuracy": 0.9298080801963806,
"step": 169
},
{
"epoch": 0.7906976744186046,
"grad_norm": 2.3140320777893066,
"learning_rate": 2.203640060854387e-06,
"loss": 0.218,
"mean_token_accuracy": 0.9179913401603699,
"step": 170
},
{
"epoch": 0.7953488372093023,
"grad_norm": 2.408388137817383,
"learning_rate": 2.1542149933981014e-06,
"loss": 0.2425,
"mean_token_accuracy": 0.9116607904434204,
"step": 171
},
{
"epoch": 0.8,
"grad_norm": 2.384368896484375,
"learning_rate": 2.10567641538605e-06,
"loss": 0.2188,
"mean_token_accuracy": 0.9222338199615479,
"step": 172
},
{
"epoch": 0.8046511627906977,
"grad_norm": 2.3330466747283936,
"learning_rate": 2.058037187458398e-06,
"loss": 0.2325,
"mean_token_accuracy": 0.9224246740341187,
"step": 173
},
{
"epoch": 0.8093023255813954,
"grad_norm": 2.600876808166504,
"learning_rate": 2.011309931966136e-06,
"loss": 0.2417,
"mean_token_accuracy": 0.9175111055374146,
"step": 174
},
{
"epoch": 0.813953488372093,
"grad_norm": 2.507101535797119,
"learning_rate": 1.965507029626695e-06,
"loss": 0.2517,
"mean_token_accuracy": 0.8993148803710938,
"step": 175
},
{
"epoch": 0.8186046511627907,
"grad_norm": 2.2688119411468506,
"learning_rate": 1.920640616243589e-06,
"loss": 0.2153,
"mean_token_accuracy": 0.9220555424690247,
"step": 176
},
{
"epoch": 0.8232558139534883,
"grad_norm": 4.1214494705200195,
"learning_rate": 1.8767225794909484e-06,
"loss": 0.2774,
"mean_token_accuracy": 0.9062712788581848,
"step": 177
},
{
"epoch": 0.827906976744186,
"grad_norm": 2.3480753898620605,
"learning_rate": 1.8337645557637929e-06,
"loss": 0.2295,
"mean_token_accuracy": 0.9167379140853882,
"step": 178
},
{
"epoch": 0.8325581395348837,
"grad_norm": 2.3482840061187744,
"learning_rate": 1.7917779270948887e-06,
"loss": 0.2519,
"mean_token_accuracy": 0.9129787087440491,
"step": 179
},
{
"epoch": 0.8372093023255814,
"grad_norm": 2.479236125946045,
"learning_rate": 1.7507738181390027e-06,
"loss": 0.244,
"mean_token_accuracy": 0.9129143953323364,
"step": 180
},
{
"epoch": 0.8418604651162791,
"grad_norm": 2.4547929763793945,
"learning_rate": 1.7107630932253383e-06,
"loss": 0.243,
"mean_token_accuracy": 0.9154614210128784,
"step": 181
},
{
"epoch": 0.8465116279069768,
"grad_norm": 2.454256534576416,
"learning_rate": 1.6717563534789594e-06,
"loss": 0.2485,
"mean_token_accuracy": 0.9120760560035706,
"step": 182
},
{
"epoch": 0.8511627906976744,
"grad_norm": 2.3698337078094482,
"learning_rate": 1.6337639340119476e-06,
"loss": 0.2614,
"mean_token_accuracy": 0.9047479629516602,
"step": 183
},
{
"epoch": 0.8558139534883721,
"grad_norm": 2.5768139362335205,
"learning_rate": 1.596795901185037e-06,
"loss": 0.2628,
"mean_token_accuracy": 0.9081894755363464,
"step": 184
},
{
"epoch": 0.8604651162790697,
"grad_norm": 2.263308048248291,
"learning_rate": 1.5608620499404628e-06,
"loss": 0.2385,
"mean_token_accuracy": 0.9143803119659424,
"step": 185
},
{
"epoch": 0.8651162790697674,
"grad_norm": 2.4882397651672363,
"learning_rate": 1.5259719012067249e-06,
"loss": 0.264,
"mean_token_accuracy": 0.9070680737495422,
"step": 186
},
{
"epoch": 0.8697674418604651,
"grad_norm": 2.3694071769714355,
"learning_rate": 1.4921346993759453e-06,
"loss": 0.2408,
"mean_token_accuracy": 0.9149217009544373,
"step": 187
},
{
"epoch": 0.8744186046511628,
"grad_norm": 2.268460750579834,
"learning_rate": 1.459359409854505e-06,
"loss": 0.2459,
"mean_token_accuracy": 0.9153771996498108,
"step": 188
},
{
"epoch": 0.8790697674418605,
"grad_norm": 2.374162197113037,
"learning_rate": 1.4276547166875946e-06,
"loss": 0.2368,
"mean_token_accuracy": 0.9183270335197449,
"step": 189
},
{
"epoch": 0.8837209302325582,
"grad_norm": 2.644139289855957,
"learning_rate": 1.397029020258313e-06,
"loss": 0.2587,
"mean_token_accuracy": 0.9041792154312134,
"step": 190
},
{
"epoch": 0.8883720930232558,
"grad_norm": 2.5180320739746094,
"learning_rate": 1.367490435061928e-06,
"loss": 0.2964,
"mean_token_accuracy": 0.8934999108314514,
"step": 191
},
{
"epoch": 0.8930232558139535,
"grad_norm": 2.3106071949005127,
"learning_rate": 1.3390467875558855e-06,
"loss": 0.2203,
"mean_token_accuracy": 0.9222996234893799,
"step": 192
},
{
"epoch": 0.8976744186046511,
"grad_norm": 2.4028420448303223,
"learning_rate": 1.3117056140861317e-06,
"loss": 0.2658,
"mean_token_accuracy": 0.9091193675994873,
"step": 193
},
{
"epoch": 0.9023255813953488,
"grad_norm": 2.2988791465759277,
"learning_rate": 1.285474158890304e-06,
"loss": 0.2301,
"mean_token_accuracy": 0.9231553673744202,
"step": 194
},
{
"epoch": 0.9069767441860465,
"grad_norm": 2.339529275894165,
"learning_rate": 1.2603593721783219e-06,
"loss": 0.2412,
"mean_token_accuracy": 0.916804850101471,
"step": 195
},
{
"epoch": 0.9116279069767442,
"grad_norm": 2.4153685569763184,
"learning_rate": 1.2363679082908766e-06,
"loss": 0.2721,
"mean_token_accuracy": 0.9069840312004089,
"step": 196
},
{
"epoch": 0.9162790697674419,
"grad_norm": 2.350682020187378,
"learning_rate": 1.2135061239363161e-06,
"loss": 0.2276,
"mean_token_accuracy": 0.9226073026657104,
"step": 197
},
{
"epoch": 0.9209302325581395,
"grad_norm": 2.346771240234375,
"learning_rate": 1.1917800765063954e-06,
"loss": 0.2428,
"mean_token_accuracy": 0.9177227020263672,
"step": 198
},
{
"epoch": 0.9255813953488372,
"grad_norm": 2.713217258453369,
"learning_rate": 1.1711955224713209e-06,
"loss": 0.2778,
"mean_token_accuracy": 0.9031657576560974,
"step": 199
},
{
"epoch": 0.9302325581395349,
"grad_norm": 2.412393808364868,
"learning_rate": 1.1517579158545386e-06,
"loss": 0.249,
"mean_token_accuracy": 0.9133549332618713,
"step": 200
},
{
"epoch": 0.9348837209302325,
"grad_norm": 2.6090810298919678,
"learning_rate": 1.1334724067876463e-06,
"loss": 0.2814,
"mean_token_accuracy": 0.9063026905059814,
"step": 201
},
{
"epoch": 0.9395348837209302,
"grad_norm": 2.371859312057495,
"learning_rate": 1.1163438401458358e-06,
"loss": 0.2453,
"mean_token_accuracy": 0.9117291569709778,
"step": 202
},
{
"epoch": 0.9441860465116279,
"grad_norm": 2.4962286949157715,
"learning_rate": 1.1003767542642021e-06,
"loss": 0.2583,
"mean_token_accuracy": 0.906204879283905,
"step": 203
},
{
"epoch": 0.9488372093023256,
"grad_norm": 2.4880053997039795,
"learning_rate": 1.0855753797352868e-06,
"loss": 0.242,
"mean_token_accuracy": 0.9087080955505371,
"step": 204
},
{
"epoch": 0.9534883720930233,
"grad_norm": 2.3382506370544434,
"learning_rate": 1.0719436382881466e-06,
"loss": 0.2467,
"mean_token_accuracy": 0.9127236008644104,
"step": 205
},
{
"epoch": 0.958139534883721,
"grad_norm": 2.634141206741333,
"learning_rate": 1.0594851417492665e-06,
"loss": 0.2767,
"mean_token_accuracy": 0.9043785929679871,
"step": 206
},
{
"epoch": 0.9627906976744186,
"grad_norm": 2.8148128986358643,
"learning_rate": 1.0482031910855804e-06,
"loss": 0.2905,
"mean_token_accuracy": 0.8955498337745667,
"step": 207
},
{
"epoch": 0.9674418604651163,
"grad_norm": 2.6318628787994385,
"learning_rate": 1.0381007755298547e-06,
"loss": 0.2683,
"mean_token_accuracy": 0.906453549861908,
"step": 208
},
{
"epoch": 0.9720930232558139,
"grad_norm": 2.455003261566162,
"learning_rate": 1.029180571788672e-06,
"loss": 0.2494,
"mean_token_accuracy": 0.9166101813316345,
"step": 209
},
{
"epoch": 0.9767441860465116,
"grad_norm": 2.3794572353363037,
"learning_rate": 1.021444943333218e-06,
"loss": 0.2612,
"mean_token_accuracy": 0.9109402298927307,
"step": 210
},
{
"epoch": 0.9813953488372092,
"grad_norm": 2.5821595191955566,
"learning_rate": 1.0148959397730637e-06,
"loss": 0.2616,
"mean_token_accuracy": 0.9100193977355957,
"step": 211
},
{
"epoch": 0.986046511627907,
"grad_norm": 2.591616630554199,
"learning_rate": 1.0095352963131057e-06,
"loss": 0.2854,
"mean_token_accuracy": 0.9019818902015686,
"step": 212
},
{
"epoch": 0.9906976744186047,
"grad_norm": 2.5021920204162598,
"learning_rate": 1.0053644332938118e-06,
"loss": 0.256,
"mean_token_accuracy": 0.9106945991516113,
"step": 213
},
{
"epoch": 0.9953488372093023,
"grad_norm": 2.7386319637298584,
"learning_rate": 1.0023844558148912e-06,
"loss": 0.3062,
"mean_token_accuracy": 0.8975652456283569,
"step": 214
},
{
"epoch": 1.0,
"grad_norm": 2.470038414001465,
"learning_rate": 1.0005961534424925e-06,
"loss": 0.1514,
"mean_token_accuracy": 0.9383242726325989,
"step": 215
},
{
"epoch": 1.0,
"step": 215,
"total_flos": 2.0144468407196058e+17,
"train_loss": 0.17702196160721223,
"train_runtime": 1262.7548,
"train_samples_per_second": 5.425,
"train_steps_per_second": 0.17
}
],
"logging_steps": 1,
"max_steps": 215,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.0144468407196058e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}