{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 215, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004651162790697674, "grad_norm": 2.2114248275756836, "learning_rate": 0.0, "loss": 0.2196, "mean_token_accuracy": 0.9224496483802795, "step": 1 }, { "epoch": 0.009302325581395349, "grad_norm": 2.0723774433135986, "learning_rate": 4.5454545454545457e-07, "loss": 0.2166, "mean_token_accuracy": 0.9229403138160706, "step": 2 }, { "epoch": 0.013953488372093023, "grad_norm": 2.1615424156188965, "learning_rate": 9.090909090909091e-07, "loss": 0.2323, "mean_token_accuracy": 0.9166936278343201, "step": 3 }, { "epoch": 0.018604651162790697, "grad_norm": 2.037424087524414, "learning_rate": 1.3636363636363636e-06, "loss": 0.2193, "mean_token_accuracy": 0.9216513633728027, "step": 4 }, { "epoch": 0.023255813953488372, "grad_norm": 2.3600544929504395, "learning_rate": 1.8181818181818183e-06, "loss": 0.2343, "mean_token_accuracy": 0.9143187999725342, "step": 5 }, { "epoch": 0.027906976744186046, "grad_norm": 2.287809133529663, "learning_rate": 2.2727272727272728e-06, "loss": 0.2202, "mean_token_accuracy": 0.9239357709884644, "step": 6 }, { "epoch": 0.03255813953488372, "grad_norm": 2.221831798553467, "learning_rate": 2.7272727272727272e-06, "loss": 0.2183, "mean_token_accuracy": 0.9212613105773926, "step": 7 }, { "epoch": 0.037209302325581395, "grad_norm": 2.532069683074951, "learning_rate": 3.181818181818182e-06, "loss": 0.2046, "mean_token_accuracy": 0.927347719669342, "step": 8 }, { "epoch": 0.04186046511627907, "grad_norm": 2.511592388153076, "learning_rate": 3.6363636363636366e-06, "loss": 0.1895, "mean_token_accuracy": 0.932911217212677, "step": 9 }, { "epoch": 0.046511627906976744, "grad_norm": 1.9913058280944824, "learning_rate": 4.0909090909090915e-06, "loss": 0.18, "mean_token_accuracy": 0.934699296951294, "step": 10 }, { "epoch": 0.05116279069767442, "grad_norm": 1.8915150165557861, "learning_rate": 4.5454545454545455e-06, "loss": 0.1647, "mean_token_accuracy": 0.937118649482727, "step": 11 }, { "epoch": 0.05581395348837209, "grad_norm": 2.0039026737213135, "learning_rate": 5e-06, "loss": 0.1711, "mean_token_accuracy": 0.938572108745575, "step": 12 }, { "epoch": 0.06046511627906977, "grad_norm": 1.9259536266326904, "learning_rate": 5.4545454545454545e-06, "loss": 0.1563, "mean_token_accuracy": 0.9456785917282104, "step": 13 }, { "epoch": 0.06511627906976744, "grad_norm": 1.9658490419387817, "learning_rate": 5.90909090909091e-06, "loss": 0.1225, "mean_token_accuracy": 0.9512993097305298, "step": 14 }, { "epoch": 0.06976744186046512, "grad_norm": 1.7610844373703003, "learning_rate": 6.363636363636364e-06, "loss": 0.0932, "mean_token_accuracy": 0.9662150740623474, "step": 15 }, { "epoch": 0.07441860465116279, "grad_norm": 2.5610358715057373, "learning_rate": 6.818181818181818e-06, "loss": 0.1276, "mean_token_accuracy": 0.9545891880989075, "step": 16 }, { "epoch": 0.07906976744186046, "grad_norm": 2.491724729537964, "learning_rate": 7.272727272727273e-06, "loss": 0.1044, "mean_token_accuracy": 0.9636728763580322, "step": 17 }, { "epoch": 0.08372093023255814, "grad_norm": 2.765408754348755, "learning_rate": 7.727272727272727e-06, "loss": 0.1275, "mean_token_accuracy": 0.954607367515564, "step": 18 }, { "epoch": 0.08837209302325581, "grad_norm": 3.64901065826416, "learning_rate": 8.181818181818183e-06, "loss": 0.1334, "mean_token_accuracy": 0.9575119614601135, "step": 19 }, { "epoch": 0.09302325581395349, "grad_norm": 2.4553587436676025, "learning_rate": 8.636363636363637e-06, "loss": 0.1105, "mean_token_accuracy": 0.9608086943626404, "step": 20 }, { "epoch": 0.09767441860465116, "grad_norm": 2.5622127056121826, "learning_rate": 9.090909090909091e-06, "loss": 0.1251, "mean_token_accuracy": 0.9549927115440369, "step": 21 }, { "epoch": 0.10232558139534884, "grad_norm": 2.823493003845215, "learning_rate": 9.545454545454547e-06, "loss": 0.1344, "mean_token_accuracy": 0.9475542306900024, "step": 22 }, { "epoch": 0.10697674418604651, "grad_norm": 2.254096269607544, "learning_rate": 1e-05, "loss": 0.1168, "mean_token_accuracy": 0.9586217999458313, "step": 23 }, { "epoch": 0.11162790697674418, "grad_norm": 2.321820020675659, "learning_rate": 9.999403846557509e-06, "loss": 0.1247, "mean_token_accuracy": 0.9542049765586853, "step": 24 }, { "epoch": 0.11627906976744186, "grad_norm": 2.1490819454193115, "learning_rate": 9.99761554418511e-06, "loss": 0.1092, "mean_token_accuracy": 0.95828777551651, "step": 25 }, { "epoch": 0.12093023255813953, "grad_norm": 2.0249152183532715, "learning_rate": 9.99463556670619e-06, "loss": 0.1064, "mean_token_accuracy": 0.9618995189666748, "step": 26 }, { "epoch": 0.12558139534883722, "grad_norm": 2.186185359954834, "learning_rate": 9.990464703686895e-06, "loss": 0.1303, "mean_token_accuracy": 0.9548563361167908, "step": 27 }, { "epoch": 0.13023255813953488, "grad_norm": 2.2221741676330566, "learning_rate": 9.985104060226937e-06, "loss": 0.1226, "mean_token_accuracy": 0.9575985074043274, "step": 28 }, { "epoch": 0.13488372093023257, "grad_norm": 2.503443956375122, "learning_rate": 9.978555056666784e-06, "loss": 0.1491, "mean_token_accuracy": 0.9494796991348267, "step": 29 }, { "epoch": 0.13953488372093023, "grad_norm": 2.190901041030884, "learning_rate": 9.97081942821133e-06, "loss": 0.1413, "mean_token_accuracy": 0.9503697752952576, "step": 30 }, { "epoch": 0.14418604651162792, "grad_norm": 2.317234754562378, "learning_rate": 9.961899224470146e-06, "loss": 0.1459, "mean_token_accuracy": 0.9485085010528564, "step": 31 }, { "epoch": 0.14883720930232558, "grad_norm": 2.1371970176696777, "learning_rate": 9.95179680891442e-06, "loss": 0.1196, "mean_token_accuracy": 0.9573848247528076, "step": 32 }, { "epoch": 0.15348837209302327, "grad_norm": 2.4324705600738525, "learning_rate": 9.940514858250736e-06, "loss": 0.1206, "mean_token_accuracy": 0.9569304585456848, "step": 33 }, { "epoch": 0.15813953488372093, "grad_norm": 2.2409706115722656, "learning_rate": 9.928056361711854e-06, "loss": 0.1194, "mean_token_accuracy": 0.9581000804901123, "step": 34 }, { "epoch": 0.16279069767441862, "grad_norm": 2.1415605545043945, "learning_rate": 9.914424620264714e-06, "loss": 0.1333, "mean_token_accuracy": 0.9521136283874512, "step": 35 }, { "epoch": 0.16744186046511628, "grad_norm": 2.266721487045288, "learning_rate": 9.899623245735798e-06, "loss": 0.1215, "mean_token_accuracy": 0.9567227959632874, "step": 36 }, { "epoch": 0.17209302325581396, "grad_norm": 2.1232471466064453, "learning_rate": 9.883656159854166e-06, "loss": 0.1173, "mean_token_accuracy": 0.9587419033050537, "step": 37 }, { "epoch": 0.17674418604651163, "grad_norm": 2.2392640113830566, "learning_rate": 9.866527593212355e-06, "loss": 0.1178, "mean_token_accuracy": 0.9596466422080994, "step": 38 }, { "epoch": 0.1813953488372093, "grad_norm": 1.9644360542297363, "learning_rate": 9.848242084145462e-06, "loss": 0.1146, "mean_token_accuracy": 0.9602649211883545, "step": 39 }, { "epoch": 0.18604651162790697, "grad_norm": 2.2388856410980225, "learning_rate": 9.82880447752868e-06, "loss": 0.1288, "mean_token_accuracy": 0.953513503074646, "step": 40 }, { "epoch": 0.19069767441860466, "grad_norm": 2.158182382583618, "learning_rate": 9.808219923493606e-06, "loss": 0.1189, "mean_token_accuracy": 0.9582207798957825, "step": 41 }, { "epoch": 0.19534883720930232, "grad_norm": 2.314441204071045, "learning_rate": 9.786493876063685e-06, "loss": 0.1278, "mean_token_accuracy": 0.9543681740760803, "step": 42 }, { "epoch": 0.2, "grad_norm": 2.0895299911499023, "learning_rate": 9.763632091709125e-06, "loss": 0.1096, "mean_token_accuracy": 0.9583253860473633, "step": 43 }, { "epoch": 0.20465116279069767, "grad_norm": 2.2945597171783447, "learning_rate": 9.739640627821678e-06, "loss": 0.1323, "mean_token_accuracy": 0.9572258591651917, "step": 44 }, { "epoch": 0.20930232558139536, "grad_norm": 2.4532723426818848, "learning_rate": 9.714525841109697e-06, "loss": 0.1357, "mean_token_accuracy": 0.9541955590248108, "step": 45 }, { "epoch": 0.21395348837209302, "grad_norm": 2.2597134113311768, "learning_rate": 9.68829438591387e-06, "loss": 0.1356, "mean_token_accuracy": 0.9518094062805176, "step": 46 }, { "epoch": 0.2186046511627907, "grad_norm": 2.282038927078247, "learning_rate": 9.660953212444116e-06, "loss": 0.1361, "mean_token_accuracy": 0.9526952505111694, "step": 47 }, { "epoch": 0.22325581395348837, "grad_norm": 2.733839750289917, "learning_rate": 9.632509564938073e-06, "loss": 0.1379, "mean_token_accuracy": 0.9518115520477295, "step": 48 }, { "epoch": 0.22790697674418606, "grad_norm": 2.017904281616211, "learning_rate": 9.60297097974169e-06, "loss": 0.1272, "mean_token_accuracy": 0.9559664130210876, "step": 49 }, { "epoch": 0.23255813953488372, "grad_norm": 1.9581328630447388, "learning_rate": 9.572345283312407e-06, "loss": 0.1124, "mean_token_accuracy": 0.9602742195129395, "step": 50 }, { "epoch": 0.2372093023255814, "grad_norm": 2.120893955230713, "learning_rate": 9.540640590145496e-06, "loss": 0.1378, "mean_token_accuracy": 0.9456697106361389, "step": 51 }, { "epoch": 0.24186046511627907, "grad_norm": 2.001924991607666, "learning_rate": 9.507865300624057e-06, "loss": 0.134, "mean_token_accuracy": 0.9449650645256042, "step": 52 }, { "epoch": 0.24651162790697675, "grad_norm": 2.139742851257324, "learning_rate": 9.474028098793277e-06, "loss": 0.1113, "mean_token_accuracy": 0.9595959782600403, "step": 53 }, { "epoch": 0.25116279069767444, "grad_norm": 2.0597422122955322, "learning_rate": 9.439137950059539e-06, "loss": 0.132, "mean_token_accuracy": 0.9540942907333374, "step": 54 }, { "epoch": 0.2558139534883721, "grad_norm": 2.0951530933380127, "learning_rate": 9.403204098814965e-06, "loss": 0.1414, "mean_token_accuracy": 0.9491157531738281, "step": 55 }, { "epoch": 0.26046511627906976, "grad_norm": 2.0508220195770264, "learning_rate": 9.366236065988053e-06, "loss": 0.1258, "mean_token_accuracy": 0.9535974860191345, "step": 56 }, { "epoch": 0.2651162790697674, "grad_norm": 2.0452070236206055, "learning_rate": 9.32824364652104e-06, "loss": 0.1213, "mean_token_accuracy": 0.9569804072380066, "step": 57 }, { "epoch": 0.26976744186046514, "grad_norm": 2.181885004043579, "learning_rate": 9.289236906774663e-06, "loss": 0.1246, "mean_token_accuracy": 0.9535802602767944, "step": 58 }, { "epoch": 0.2744186046511628, "grad_norm": 2.502920389175415, "learning_rate": 9.249226181861e-06, "loss": 0.1388, "mean_token_accuracy": 0.9509103894233704, "step": 59 }, { "epoch": 0.27906976744186046, "grad_norm": 2.1321425437927246, "learning_rate": 9.208222072905113e-06, "loss": 0.1231, "mean_token_accuracy": 0.9544691443443298, "step": 60 }, { "epoch": 0.2837209302325581, "grad_norm": 2.4787492752075195, "learning_rate": 9.166235444236209e-06, "loss": 0.1473, "mean_token_accuracy": 0.9451818466186523, "step": 61 }, { "epoch": 0.28837209302325584, "grad_norm": 2.26334810256958, "learning_rate": 9.123277420509053e-06, "loss": 0.1472, "mean_token_accuracy": 0.9477797746658325, "step": 62 }, { "epoch": 0.2930232558139535, "grad_norm": 2.1905953884124756, "learning_rate": 9.079359383756411e-06, "loss": 0.1371, "mean_token_accuracy": 0.9492079615592957, "step": 63 }, { "epoch": 0.29767441860465116, "grad_norm": 2.2891685962677, "learning_rate": 9.034492970373305e-06, "loss": 0.1289, "mean_token_accuracy": 0.9549328088760376, "step": 64 }, { "epoch": 0.3023255813953488, "grad_norm": 2.014946699142456, "learning_rate": 8.988690068033864e-06, "loss": 0.1317, "mean_token_accuracy": 0.952854573726654, "step": 65 }, { "epoch": 0.30697674418604654, "grad_norm": 2.2927684783935547, "learning_rate": 8.941962812541604e-06, "loss": 0.1299, "mean_token_accuracy": 0.952826976776123, "step": 66 }, { "epoch": 0.3116279069767442, "grad_norm": 1.8622946739196777, "learning_rate": 8.894323584613951e-06, "loss": 0.1313, "mean_token_accuracy": 0.9536823630332947, "step": 67 }, { "epoch": 0.31627906976744186, "grad_norm": 1.9800999164581299, "learning_rate": 8.845785006601898e-06, "loss": 0.116, "mean_token_accuracy": 0.958354651927948, "step": 68 }, { "epoch": 0.3209302325581395, "grad_norm": 2.2661781311035156, "learning_rate": 8.796359939145614e-06, "loss": 0.1284, "mean_token_accuracy": 0.9528335332870483, "step": 69 }, { "epoch": 0.32558139534883723, "grad_norm": 2.448075532913208, "learning_rate": 8.74606147776692e-06, "loss": 0.14, "mean_token_accuracy": 0.9489418864250183, "step": 70 }, { "epoch": 0.3302325581395349, "grad_norm": 2.2173235416412354, "learning_rate": 8.694902949399555e-06, "loss": 0.1365, "mean_token_accuracy": 0.9519818425178528, "step": 71 }, { "epoch": 0.33488372093023255, "grad_norm": 2.2065324783325195, "learning_rate": 8.642897908858096e-06, "loss": 0.128, "mean_token_accuracy": 0.9549423456192017, "step": 72 }, { "epoch": 0.3395348837209302, "grad_norm": 2.3709309101104736, "learning_rate": 8.590060135246516e-06, "loss": 0.1508, "mean_token_accuracy": 0.9460594058036804, "step": 73 }, { "epoch": 0.34418604651162793, "grad_norm": 2.10296630859375, "learning_rate": 8.53640362830732e-06, "loss": 0.1139, "mean_token_accuracy": 0.9574284553527832, "step": 74 }, { "epoch": 0.3488372093023256, "grad_norm": 2.3740813732147217, "learning_rate": 8.481942604712209e-06, "loss": 0.1374, "mean_token_accuracy": 0.9532406330108643, "step": 75 }, { "epoch": 0.35348837209302325, "grad_norm": 2.1128122806549072, "learning_rate": 8.426691494295269e-06, "loss": 0.1322, "mean_token_accuracy": 0.9526184797286987, "step": 76 }, { "epoch": 0.3581395348837209, "grad_norm": 2.0713388919830322, "learning_rate": 8.370664936229688e-06, "loss": 0.1372, "mean_token_accuracy": 0.9511680603027344, "step": 77 }, { "epoch": 0.3627906976744186, "grad_norm": 2.127915859222412, "learning_rate": 8.313877775149009e-06, "loss": 0.1219, "mean_token_accuracy": 0.9576807618141174, "step": 78 }, { "epoch": 0.3674418604651163, "grad_norm": 2.3170533180236816, "learning_rate": 8.256345057213925e-06, "loss": 0.1443, "mean_token_accuracy": 0.9483892917633057, "step": 79 }, { "epoch": 0.37209302325581395, "grad_norm": 2.0527758598327637, "learning_rate": 8.198082026125707e-06, "loss": 0.1255, "mean_token_accuracy": 0.9523978233337402, "step": 80 }, { "epoch": 0.3767441860465116, "grad_norm": 2.05676007270813, "learning_rate": 8.139104119087265e-06, "loss": 0.1249, "mean_token_accuracy": 0.9549195766448975, "step": 81 }, { "epoch": 0.3813953488372093, "grad_norm": 2.002903699874878, "learning_rate": 8.07942696271296e-06, "loss": 0.118, "mean_token_accuracy": 0.957054078578949, "step": 82 }, { "epoch": 0.386046511627907, "grad_norm": 2.263026475906372, "learning_rate": 8.019066368888222e-06, "loss": 0.1376, "mean_token_accuracy": 0.9531168341636658, "step": 83 }, { "epoch": 0.39069767441860465, "grad_norm": 2.1725878715515137, "learning_rate": 7.958038330580067e-06, "loss": 0.1487, "mean_token_accuracy": 0.9452034831047058, "step": 84 }, { "epoch": 0.3953488372093023, "grad_norm": 1.900057315826416, "learning_rate": 7.89635901759967e-06, "loss": 0.138, "mean_token_accuracy": 0.9475666284561157, "step": 85 }, { "epoch": 0.4, "grad_norm": 2.298158645629883, "learning_rate": 7.834044772318033e-06, "loss": 0.1654, "mean_token_accuracy": 0.9408732056617737, "step": 86 }, { "epoch": 0.4046511627906977, "grad_norm": 2.2092435359954834, "learning_rate": 7.77111210533597e-06, "loss": 0.132, "mean_token_accuracy": 0.955048143863678, "step": 87 }, { "epoch": 0.40930232558139534, "grad_norm": 2.544060468673706, "learning_rate": 7.707577691109519e-06, "loss": 0.182, "mean_token_accuracy": 0.9341899752616882, "step": 88 }, { "epoch": 0.413953488372093, "grad_norm": 2.0176243782043457, "learning_rate": 7.6434583635319e-06, "loss": 0.1392, "mean_token_accuracy": 0.9515554904937744, "step": 89 }, { "epoch": 0.4186046511627907, "grad_norm": 1.986615777015686, "learning_rate": 7.578771111473276e-06, "loss": 0.1096, "mean_token_accuracy": 0.9597609639167786, "step": 90 }, { "epoch": 0.4232558139534884, "grad_norm": 1.9400761127471924, "learning_rate": 7.513533074279427e-06, "loss": 0.1166, "mean_token_accuracy": 0.9585210084915161, "step": 91 }, { "epoch": 0.42790697674418604, "grad_norm": 2.2367358207702637, "learning_rate": 7.4477615372305545e-06, "loss": 0.1372, "mean_token_accuracy": 0.9512780904769897, "step": 92 }, { "epoch": 0.4325581395348837, "grad_norm": 2.0760915279388428, "learning_rate": 7.3814739269614265e-06, "loss": 0.1268, "mean_token_accuracy": 0.9533308744430542, "step": 93 }, { "epoch": 0.4372093023255814, "grad_norm": 2.039663314819336, "learning_rate": 7.314687806844067e-06, "loss": 0.1419, "mean_token_accuracy": 0.945841372013092, "step": 94 }, { "epoch": 0.4418604651162791, "grad_norm": 2.1886751651763916, "learning_rate": 7.247420872334221e-06, "loss": 0.1326, "mean_token_accuracy": 0.952744722366333, "step": 95 }, { "epoch": 0.44651162790697674, "grad_norm": 1.9584012031555176, "learning_rate": 7.179690946282808e-06, "loss": 0.1162, "mean_token_accuracy": 0.9587628841400146, "step": 96 }, { "epoch": 0.4511627906976744, "grad_norm": 2.104785203933716, "learning_rate": 7.111515974213639e-06, "loss": 0.1164, "mean_token_accuracy": 0.9576154351234436, "step": 97 }, { "epoch": 0.4558139534883721, "grad_norm": 2.0664682388305664, "learning_rate": 7.042914019568621e-06, "loss": 0.1293, "mean_token_accuracy": 0.9517142176628113, "step": 98 }, { "epoch": 0.4604651162790698, "grad_norm": 1.845027208328247, "learning_rate": 6.973903258921719e-06, "loss": 0.1165, "mean_token_accuracy": 0.9597806334495544, "step": 99 }, { "epoch": 0.46511627906976744, "grad_norm": 2.4039275646209717, "learning_rate": 6.904501977162949e-06, "loss": 0.1445, "mean_token_accuracy": 0.9478161334991455, "step": 100 }, { "epoch": 0.4697674418604651, "grad_norm": 2.081846237182617, "learning_rate": 6.834728562653659e-06, "loss": 0.1397, "mean_token_accuracy": 0.9507532715797424, "step": 101 }, { "epoch": 0.4744186046511628, "grad_norm": 2.234560012817383, "learning_rate": 6.764601502354403e-06, "loss": 0.1398, "mean_token_accuracy": 0.9514716267585754, "step": 102 }, { "epoch": 0.4790697674418605, "grad_norm": 2.183743953704834, "learning_rate": 6.6941393769266995e-06, "loss": 0.1485, "mean_token_accuracy": 0.945875883102417, "step": 103 }, { "epoch": 0.48372093023255813, "grad_norm": 2.0833141803741455, "learning_rate": 6.6233608558099405e-06, "loss": 0.129, "mean_token_accuracy": 0.9532462954521179, "step": 104 }, { "epoch": 0.4883720930232558, "grad_norm": 2.300926446914673, "learning_rate": 6.552284692274803e-06, "loss": 0.1572, "mean_token_accuracy": 0.939317524433136, "step": 105 }, { "epoch": 0.4930232558139535, "grad_norm": 2.2976064682006836, "learning_rate": 6.48092971845443e-06, "loss": 0.1543, "mean_token_accuracy": 0.9445100426673889, "step": 106 }, { "epoch": 0.49767441860465117, "grad_norm": 2.7567296028137207, "learning_rate": 6.409314840354724e-06, "loss": 0.1757, "mean_token_accuracy": 0.9392008185386658, "step": 107 }, { "epoch": 0.5023255813953489, "grad_norm": 2.7493550777435303, "learning_rate": 6.337459032845068e-06, "loss": 0.1778, "mean_token_accuracy": 0.9281901121139526, "step": 108 }, { "epoch": 0.5069767441860465, "grad_norm": 4.160806179046631, "learning_rate": 6.2653813346308e-06, "loss": 0.1504, "mean_token_accuracy": 0.9514563083648682, "step": 109 }, { "epoch": 0.5116279069767442, "grad_norm": 6.210575103759766, "learning_rate": 6.193100843208772e-06, "loss": 0.1501, "mean_token_accuracy": 0.9448494911193848, "step": 110 }, { "epoch": 0.5162790697674419, "grad_norm": 2.7258520126342773, "learning_rate": 6.120636709807334e-06, "loss": 0.162, "mean_token_accuracy": 0.9411876797676086, "step": 111 }, { "epoch": 0.5209302325581395, "grad_norm": 2.7637786865234375, "learning_rate": 6.048008134312078e-06, "loss": 0.1566, "mean_token_accuracy": 0.9405099153518677, "step": 112 }, { "epoch": 0.5255813953488372, "grad_norm": 2.351895332336426, "learning_rate": 5.975234360178698e-06, "loss": 0.1913, "mean_token_accuracy": 0.9291128516197205, "step": 113 }, { "epoch": 0.5302325581395348, "grad_norm": 2.0898733139038086, "learning_rate": 5.902334669334287e-06, "loss": 0.1581, "mean_token_accuracy": 0.9421935081481934, "step": 114 }, { "epoch": 0.5348837209302325, "grad_norm": 2.2015750408172607, "learning_rate": 5.829328377068476e-06, "loss": 0.1639, "mean_token_accuracy": 0.9378551840782166, "step": 115 }, { "epoch": 0.5395348837209303, "grad_norm": 2.1996021270751953, "learning_rate": 5.756234826915686e-06, "loss": 0.1804, "mean_token_accuracy": 0.9348623752593994, "step": 116 }, { "epoch": 0.5441860465116279, "grad_norm": 2.413963556289673, "learning_rate": 5.683073385529938e-06, "loss": 0.1673, "mean_token_accuracy": 0.938205361366272, "step": 117 }, { "epoch": 0.5488372093023256, "grad_norm": 2.0604939460754395, "learning_rate": 5.60986343755352e-06, "loss": 0.1454, "mean_token_accuracy": 0.948581874370575, "step": 118 }, { "epoch": 0.5534883720930233, "grad_norm": 2.032255172729492, "learning_rate": 5.536624380480878e-06, "loss": 0.1385, "mean_token_accuracy": 0.9510709643363953, "step": 119 }, { "epoch": 0.5581395348837209, "grad_norm": 2.024848461151123, "learning_rate": 5.4633756195191235e-06, "loss": 0.1455, "mean_token_accuracy": 0.9449432492256165, "step": 120 }, { "epoch": 0.5627906976744186, "grad_norm": 1.7776316404342651, "learning_rate": 5.390136562446482e-06, "loss": 0.1283, "mean_token_accuracy": 0.954091489315033, "step": 121 }, { "epoch": 0.5674418604651162, "grad_norm": 2.231447458267212, "learning_rate": 5.316926614470063e-06, "loss": 0.165, "mean_token_accuracy": 0.9395132660865784, "step": 122 }, { "epoch": 0.5720930232558139, "grad_norm": 2.4725592136383057, "learning_rate": 5.2437651730843165e-06, "loss": 0.2085, "mean_token_accuracy": 0.9223983287811279, "step": 123 }, { "epoch": 0.5767441860465117, "grad_norm": 2.5066394805908203, "learning_rate": 5.170671622931527e-06, "loss": 0.2028, "mean_token_accuracy": 0.9242201447486877, "step": 124 }, { "epoch": 0.5813953488372093, "grad_norm": 2.0127978324890137, "learning_rate": 5.097665330665714e-06, "loss": 0.124, "mean_token_accuracy": 0.9552622437477112, "step": 125 }, { "epoch": 0.586046511627907, "grad_norm": 2.4899189472198486, "learning_rate": 5.024765639821305e-06, "loss": 0.1729, "mean_token_accuracy": 0.9365900158882141, "step": 126 }, { "epoch": 0.5906976744186047, "grad_norm": 1.94431471824646, "learning_rate": 4.951991865687923e-06, "loss": 0.1386, "mean_token_accuracy": 0.9501959681510925, "step": 127 }, { "epoch": 0.5953488372093023, "grad_norm": 2.4740915298461914, "learning_rate": 4.879363290192667e-06, "loss": 0.1812, "mean_token_accuracy": 0.9385085701942444, "step": 128 }, { "epoch": 0.6, "grad_norm": 2.570204973220825, "learning_rate": 4.806899156791231e-06, "loss": 0.2069, "mean_token_accuracy": 0.9259189963340759, "step": 129 }, { "epoch": 0.6046511627906976, "grad_norm": 2.5832550525665283, "learning_rate": 4.734618665369202e-06, "loss": 0.1748, "mean_token_accuracy": 0.9329256415367126, "step": 130 }, { "epoch": 0.6093023255813953, "grad_norm": 2.2135725021362305, "learning_rate": 4.662540967154934e-06, "loss": 0.1584, "mean_token_accuracy": 0.9435682892799377, "step": 131 }, { "epoch": 0.6139534883720931, "grad_norm": 2.243936777114868, "learning_rate": 4.5906851596452765e-06, "loss": 0.1607, "mean_token_accuracy": 0.941770076751709, "step": 132 }, { "epoch": 0.6186046511627907, "grad_norm": 2.4644687175750732, "learning_rate": 4.519070281545571e-06, "loss": 0.1855, "mean_token_accuracy": 0.9312141537666321, "step": 133 }, { "epoch": 0.6232558139534884, "grad_norm": 2.4231929779052734, "learning_rate": 4.447715307725197e-06, "loss": 0.1822, "mean_token_accuracy": 0.9323040246963501, "step": 134 }, { "epoch": 0.627906976744186, "grad_norm": 2.3582451343536377, "learning_rate": 4.376639144190061e-06, "loss": 0.1982, "mean_token_accuracy": 0.9292059540748596, "step": 135 }, { "epoch": 0.6325581395348837, "grad_norm": 2.3659980297088623, "learning_rate": 4.305860623073304e-06, "loss": 0.1886, "mean_token_accuracy": 0.9302771687507629, "step": 136 }, { "epoch": 0.6372093023255814, "grad_norm": 2.134996175765991, "learning_rate": 4.2353984976456e-06, "loss": 0.1635, "mean_token_accuracy": 0.945655882358551, "step": 137 }, { "epoch": 0.641860465116279, "grad_norm": 2.228179931640625, "learning_rate": 4.1652714373463435e-06, "loss": 0.1744, "mean_token_accuracy": 0.9358843564987183, "step": 138 }, { "epoch": 0.6465116279069767, "grad_norm": 2.138805627822876, "learning_rate": 4.095498022837051e-06, "loss": 0.1709, "mean_token_accuracy": 0.9394161701202393, "step": 139 }, { "epoch": 0.6511627906976745, "grad_norm": 2.4134600162506104, "learning_rate": 4.026096741078281e-06, "loss": 0.2073, "mean_token_accuracy": 0.9247809052467346, "step": 140 }, { "epoch": 0.6558139534883721, "grad_norm": 2.3286097049713135, "learning_rate": 3.957085980431382e-06, "loss": 0.2015, "mean_token_accuracy": 0.9283841252326965, "step": 141 }, { "epoch": 0.6604651162790698, "grad_norm": 2.3675103187561035, "learning_rate": 3.888484025786364e-06, "loss": 0.1873, "mean_token_accuracy": 0.935422420501709, "step": 142 }, { "epoch": 0.6651162790697674, "grad_norm": 2.2542030811309814, "learning_rate": 3.820309053717195e-06, "loss": 0.1732, "mean_token_accuracy": 0.9398706555366516, "step": 143 }, { "epoch": 0.6697674418604651, "grad_norm": 2.5563859939575195, "learning_rate": 3.75257912766578e-06, "loss": 0.2337, "mean_token_accuracy": 0.919076144695282, "step": 144 }, { "epoch": 0.6744186046511628, "grad_norm": 2.740525007247925, "learning_rate": 3.6853121931559334e-06, "loss": 0.2133, "mean_token_accuracy": 0.9239462018013, "step": 145 }, { "epoch": 0.6790697674418604, "grad_norm": 2.380431890487671, "learning_rate": 3.618526073038574e-06, "loss": 0.2423, "mean_token_accuracy": 0.9069680571556091, "step": 146 }, { "epoch": 0.6837209302325581, "grad_norm": 2.2644641399383545, "learning_rate": 3.552238462769446e-06, "loss": 0.1825, "mean_token_accuracy": 0.9340601563453674, "step": 147 }, { "epoch": 0.6883720930232559, "grad_norm": 2.2253427505493164, "learning_rate": 3.4864669257205745e-06, "loss": 0.1827, "mean_token_accuracy": 0.9364906549453735, "step": 148 }, { "epoch": 0.6930232558139535, "grad_norm": 2.305551290512085, "learning_rate": 3.4212288885267246e-06, "loss": 0.211, "mean_token_accuracy": 0.9235766530036926, "step": 149 }, { "epoch": 0.6976744186046512, "grad_norm": 2.4366819858551025, "learning_rate": 3.3565416364681016e-06, "loss": 0.1933, "mean_token_accuracy": 0.934188187122345, "step": 150 }, { "epoch": 0.7023255813953488, "grad_norm": 2.120678663253784, "learning_rate": 3.2924223088904816e-06, "loss": 0.1829, "mean_token_accuracy": 0.9341450929641724, "step": 151 }, { "epoch": 0.7069767441860465, "grad_norm": 2.765115976333618, "learning_rate": 3.228887894664029e-06, "loss": 0.2416, "mean_token_accuracy": 0.9131013751029968, "step": 152 }, { "epoch": 0.7116279069767442, "grad_norm": 2.6073999404907227, "learning_rate": 3.1659552276819693e-06, "loss": 0.2286, "mean_token_accuracy": 0.9195277094841003, "step": 153 }, { "epoch": 0.7162790697674418, "grad_norm": 2.3940727710723877, "learning_rate": 3.1036409824003324e-06, "loss": 0.1999, "mean_token_accuracy": 0.9278870224952698, "step": 154 }, { "epoch": 0.7209302325581395, "grad_norm": 2.1819043159484863, "learning_rate": 3.0419616694199327e-06, "loss": 0.1865, "mean_token_accuracy": 0.9324924349784851, "step": 155 }, { "epoch": 0.7255813953488373, "grad_norm": 2.1513233184814453, "learning_rate": 2.98093363111178e-06, "loss": 0.1609, "mean_token_accuracy": 0.9402922987937927, "step": 156 }, { "epoch": 0.7302325581395349, "grad_norm": 2.487457275390625, "learning_rate": 2.92057303728704e-06, "loss": 0.2108, "mean_token_accuracy": 0.9236377477645874, "step": 157 }, { "epoch": 0.7348837209302326, "grad_norm": 2.2723348140716553, "learning_rate": 2.860895880912735e-06, "loss": 0.1984, "mean_token_accuracy": 0.9300382733345032, "step": 158 }, { "epoch": 0.7395348837209302, "grad_norm": 2.418523073196411, "learning_rate": 2.801917973874294e-06, "loss": 0.2253, "mean_token_accuracy": 0.9189647436141968, "step": 159 }, { "epoch": 0.7441860465116279, "grad_norm": 2.488349199295044, "learning_rate": 2.7436549427860766e-06, "loss": 0.2423, "mean_token_accuracy": 0.9125044345855713, "step": 160 }, { "epoch": 0.7488372093023256, "grad_norm": 2.1933088302612305, "learning_rate": 2.6861222248509926e-06, "loss": 0.1774, "mean_token_accuracy": 0.9362761974334717, "step": 161 }, { "epoch": 0.7534883720930232, "grad_norm": 2.2860469818115234, "learning_rate": 2.6293350637703123e-06, "loss": 0.2091, "mean_token_accuracy": 0.9287545084953308, "step": 162 }, { "epoch": 0.7581395348837209, "grad_norm": 2.4092366695404053, "learning_rate": 2.5733085057047325e-06, "loss": 0.212, "mean_token_accuracy": 0.9241366982460022, "step": 163 }, { "epoch": 0.7627906976744186, "grad_norm": 2.3280487060546875, "learning_rate": 2.518057395287792e-06, "loss": 0.2286, "mean_token_accuracy": 0.9198589324951172, "step": 164 }, { "epoch": 0.7674418604651163, "grad_norm": 2.6434130668640137, "learning_rate": 2.463596371692681e-06, "loss": 0.225, "mean_token_accuracy": 0.9186698198318481, "step": 165 }, { "epoch": 0.772093023255814, "grad_norm": 2.556109666824341, "learning_rate": 2.409939864753487e-06, "loss": 0.2401, "mean_token_accuracy": 0.9132218956947327, "step": 166 }, { "epoch": 0.7767441860465116, "grad_norm": 2.3139853477478027, "learning_rate": 2.3571020911419067e-06, "loss": 0.2286, "mean_token_accuracy": 0.9233333468437195, "step": 167 }, { "epoch": 0.7813953488372093, "grad_norm": 2.5117015838623047, "learning_rate": 2.3050970506004463e-06, "loss": 0.2471, "mean_token_accuracy": 0.9140174388885498, "step": 168 }, { "epoch": 0.786046511627907, "grad_norm": 2.4503190517425537, "learning_rate": 2.2539385222330797e-06, "loss": 0.1955, "mean_token_accuracy": 0.9298080801963806, "step": 169 }, { "epoch": 0.7906976744186046, "grad_norm": 2.3140320777893066, "learning_rate": 2.203640060854387e-06, "loss": 0.218, "mean_token_accuracy": 0.9179913401603699, "step": 170 }, { "epoch": 0.7953488372093023, "grad_norm": 2.408388137817383, "learning_rate": 2.1542149933981014e-06, "loss": 0.2425, "mean_token_accuracy": 0.9116607904434204, "step": 171 }, { "epoch": 0.8, "grad_norm": 2.384368896484375, "learning_rate": 2.10567641538605e-06, "loss": 0.2188, "mean_token_accuracy": 0.9222338199615479, "step": 172 }, { "epoch": 0.8046511627906977, "grad_norm": 2.3330466747283936, "learning_rate": 2.058037187458398e-06, "loss": 0.2325, "mean_token_accuracy": 0.9224246740341187, "step": 173 }, { "epoch": 0.8093023255813954, "grad_norm": 2.600876808166504, "learning_rate": 2.011309931966136e-06, "loss": 0.2417, "mean_token_accuracy": 0.9175111055374146, "step": 174 }, { "epoch": 0.813953488372093, "grad_norm": 2.507101535797119, "learning_rate": 1.965507029626695e-06, "loss": 0.2517, "mean_token_accuracy": 0.8993148803710938, "step": 175 }, { "epoch": 0.8186046511627907, "grad_norm": 2.2688119411468506, "learning_rate": 1.920640616243589e-06, "loss": 0.2153, "mean_token_accuracy": 0.9220555424690247, "step": 176 }, { "epoch": 0.8232558139534883, "grad_norm": 4.1214494705200195, "learning_rate": 1.8767225794909484e-06, "loss": 0.2774, "mean_token_accuracy": 0.9062712788581848, "step": 177 }, { "epoch": 0.827906976744186, "grad_norm": 2.3480753898620605, "learning_rate": 1.8337645557637929e-06, "loss": 0.2295, "mean_token_accuracy": 0.9167379140853882, "step": 178 }, { "epoch": 0.8325581395348837, "grad_norm": 2.3482840061187744, "learning_rate": 1.7917779270948887e-06, "loss": 0.2519, "mean_token_accuracy": 0.9129787087440491, "step": 179 }, { "epoch": 0.8372093023255814, "grad_norm": 2.479236125946045, "learning_rate": 1.7507738181390027e-06, "loss": 0.244, "mean_token_accuracy": 0.9129143953323364, "step": 180 }, { "epoch": 0.8418604651162791, "grad_norm": 2.4547929763793945, "learning_rate": 1.7107630932253383e-06, "loss": 0.243, "mean_token_accuracy": 0.9154614210128784, "step": 181 }, { "epoch": 0.8465116279069768, "grad_norm": 2.454256534576416, "learning_rate": 1.6717563534789594e-06, "loss": 0.2485, "mean_token_accuracy": 0.9120760560035706, "step": 182 }, { "epoch": 0.8511627906976744, "grad_norm": 2.3698337078094482, "learning_rate": 1.6337639340119476e-06, "loss": 0.2614, "mean_token_accuracy": 0.9047479629516602, "step": 183 }, { "epoch": 0.8558139534883721, "grad_norm": 2.5768139362335205, "learning_rate": 1.596795901185037e-06, "loss": 0.2628, "mean_token_accuracy": 0.9081894755363464, "step": 184 }, { "epoch": 0.8604651162790697, "grad_norm": 2.263308048248291, "learning_rate": 1.5608620499404628e-06, "loss": 0.2385, "mean_token_accuracy": 0.9143803119659424, "step": 185 }, { "epoch": 0.8651162790697674, "grad_norm": 2.4882397651672363, "learning_rate": 1.5259719012067249e-06, "loss": 0.264, "mean_token_accuracy": 0.9070680737495422, "step": 186 }, { "epoch": 0.8697674418604651, "grad_norm": 2.3694071769714355, "learning_rate": 1.4921346993759453e-06, "loss": 0.2408, "mean_token_accuracy": 0.9149217009544373, "step": 187 }, { "epoch": 0.8744186046511628, "grad_norm": 2.268460750579834, "learning_rate": 1.459359409854505e-06, "loss": 0.2459, "mean_token_accuracy": 0.9153771996498108, "step": 188 }, { "epoch": 0.8790697674418605, "grad_norm": 2.374162197113037, "learning_rate": 1.4276547166875946e-06, "loss": 0.2368, "mean_token_accuracy": 0.9183270335197449, "step": 189 }, { "epoch": 0.8837209302325582, "grad_norm": 2.644139289855957, "learning_rate": 1.397029020258313e-06, "loss": 0.2587, "mean_token_accuracy": 0.9041792154312134, "step": 190 }, { "epoch": 0.8883720930232558, "grad_norm": 2.5180320739746094, "learning_rate": 1.367490435061928e-06, "loss": 0.2964, "mean_token_accuracy": 0.8934999108314514, "step": 191 }, { "epoch": 0.8930232558139535, "grad_norm": 2.3106071949005127, "learning_rate": 1.3390467875558855e-06, "loss": 0.2203, "mean_token_accuracy": 0.9222996234893799, "step": 192 }, { "epoch": 0.8976744186046511, "grad_norm": 2.4028420448303223, "learning_rate": 1.3117056140861317e-06, "loss": 0.2658, "mean_token_accuracy": 0.9091193675994873, "step": 193 }, { "epoch": 0.9023255813953488, "grad_norm": 2.2988791465759277, "learning_rate": 1.285474158890304e-06, "loss": 0.2301, "mean_token_accuracy": 0.9231553673744202, "step": 194 }, { "epoch": 0.9069767441860465, "grad_norm": 2.339529275894165, "learning_rate": 1.2603593721783219e-06, "loss": 0.2412, "mean_token_accuracy": 0.916804850101471, "step": 195 }, { "epoch": 0.9116279069767442, "grad_norm": 2.4153685569763184, "learning_rate": 1.2363679082908766e-06, "loss": 0.2721, "mean_token_accuracy": 0.9069840312004089, "step": 196 }, { "epoch": 0.9162790697674419, "grad_norm": 2.350682020187378, "learning_rate": 1.2135061239363161e-06, "loss": 0.2276, "mean_token_accuracy": 0.9226073026657104, "step": 197 }, { "epoch": 0.9209302325581395, "grad_norm": 2.346771240234375, "learning_rate": 1.1917800765063954e-06, "loss": 0.2428, "mean_token_accuracy": 0.9177227020263672, "step": 198 }, { "epoch": 0.9255813953488372, "grad_norm": 2.713217258453369, "learning_rate": 1.1711955224713209e-06, "loss": 0.2778, "mean_token_accuracy": 0.9031657576560974, "step": 199 }, { "epoch": 0.9302325581395349, "grad_norm": 2.412393808364868, "learning_rate": 1.1517579158545386e-06, "loss": 0.249, "mean_token_accuracy": 0.9133549332618713, "step": 200 }, { "epoch": 0.9348837209302325, "grad_norm": 2.6090810298919678, "learning_rate": 1.1334724067876463e-06, "loss": 0.2814, "mean_token_accuracy": 0.9063026905059814, "step": 201 }, { "epoch": 0.9395348837209302, "grad_norm": 2.371859312057495, "learning_rate": 1.1163438401458358e-06, "loss": 0.2453, "mean_token_accuracy": 0.9117291569709778, "step": 202 }, { "epoch": 0.9441860465116279, "grad_norm": 2.4962286949157715, "learning_rate": 1.1003767542642021e-06, "loss": 0.2583, "mean_token_accuracy": 0.906204879283905, "step": 203 }, { "epoch": 0.9488372093023256, "grad_norm": 2.4880053997039795, "learning_rate": 1.0855753797352868e-06, "loss": 0.242, "mean_token_accuracy": 0.9087080955505371, "step": 204 }, { "epoch": 0.9534883720930233, "grad_norm": 2.3382506370544434, "learning_rate": 1.0719436382881466e-06, "loss": 0.2467, "mean_token_accuracy": 0.9127236008644104, "step": 205 }, { "epoch": 0.958139534883721, "grad_norm": 2.634141206741333, "learning_rate": 1.0594851417492665e-06, "loss": 0.2767, "mean_token_accuracy": 0.9043785929679871, "step": 206 }, { "epoch": 0.9627906976744186, "grad_norm": 2.8148128986358643, "learning_rate": 1.0482031910855804e-06, "loss": 0.2905, "mean_token_accuracy": 0.8955498337745667, "step": 207 }, { "epoch": 0.9674418604651163, "grad_norm": 2.6318628787994385, "learning_rate": 1.0381007755298547e-06, "loss": 0.2683, "mean_token_accuracy": 0.906453549861908, "step": 208 }, { "epoch": 0.9720930232558139, "grad_norm": 2.455003261566162, "learning_rate": 1.029180571788672e-06, "loss": 0.2494, "mean_token_accuracy": 0.9166101813316345, "step": 209 }, { "epoch": 0.9767441860465116, "grad_norm": 2.3794572353363037, "learning_rate": 1.021444943333218e-06, "loss": 0.2612, "mean_token_accuracy": 0.9109402298927307, "step": 210 }, { "epoch": 0.9813953488372092, "grad_norm": 2.5821595191955566, "learning_rate": 1.0148959397730637e-06, "loss": 0.2616, "mean_token_accuracy": 0.9100193977355957, "step": 211 }, { "epoch": 0.986046511627907, "grad_norm": 2.591616630554199, "learning_rate": 1.0095352963131057e-06, "loss": 0.2854, "mean_token_accuracy": 0.9019818902015686, "step": 212 }, { "epoch": 0.9906976744186047, "grad_norm": 2.5021920204162598, "learning_rate": 1.0053644332938118e-06, "loss": 0.256, "mean_token_accuracy": 0.9106945991516113, "step": 213 }, { "epoch": 0.9953488372093023, "grad_norm": 2.7386319637298584, "learning_rate": 1.0023844558148912e-06, "loss": 0.3062, "mean_token_accuracy": 0.8975652456283569, "step": 214 }, { "epoch": 1.0, "grad_norm": 2.470038414001465, "learning_rate": 1.0005961534424925e-06, "loss": 0.1514, "mean_token_accuracy": 0.9383242726325989, "step": 215 }, { "epoch": 1.0, "step": 215, "total_flos": 2.0144468407196058e+17, "train_loss": 0.17702196160721223, "train_runtime": 1262.7548, "train_samples_per_second": 5.425, "train_steps_per_second": 0.17 } ], "logging_steps": 1, "max_steps": 215, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.0144468407196058e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }