{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 4125, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0007272727272727272, "grad_norm": 22.59613609313965, "learning_rate": 8.064516129032259e-08, "loss": 2.312417507171631, "memory(GiB)": 64.44, "step": 1, "token_acc": 0.4763092269326683, "train_speed(iter/s)": 0.040402 }, { "epoch": 0.0036363636363636364, "grad_norm": 16.399948120117188, "learning_rate": 4.032258064516129e-07, "loss": 2.0219309329986572, "memory(GiB)": 64.44, "step": 5, "token_acc": 0.5876224213377788, "train_speed(iter/s)": 0.148345 }, { "epoch": 0.007272727272727273, "grad_norm": 25.756488800048828, "learning_rate": 8.064516129032258e-07, "loss": 2.0684181213378907, "memory(GiB)": 64.44, "step": 10, "token_acc": 0.5817155756207675, "train_speed(iter/s)": 0.226534 }, { "epoch": 0.01090909090909091, "grad_norm": 14.12072467803955, "learning_rate": 1.2096774193548388e-06, "loss": 1.9113319396972657, "memory(GiB)": 64.44, "step": 15, "token_acc": 0.5714888232813159, "train_speed(iter/s)": 0.275262 }, { "epoch": 0.014545454545454545, "grad_norm": 9.777295112609863, "learning_rate": 1.6129032258064516e-06, "loss": 1.6752943038940429, "memory(GiB)": 64.44, "step": 20, "token_acc": 0.6, "train_speed(iter/s)": 0.308005 }, { "epoch": 0.01818181818181818, "grad_norm": 5.061804294586182, "learning_rate": 2.0161290322580646e-06, "loss": 1.5955514907836914, "memory(GiB)": 64.44, "step": 25, "token_acc": 0.6175671083927965, "train_speed(iter/s)": 0.328805 }, { "epoch": 0.02181818181818182, "grad_norm": 5.698326110839844, "learning_rate": 2.4193548387096776e-06, "loss": 1.599413776397705, "memory(GiB)": 64.44, "step": 30, "token_acc": 0.6125984251968504, "train_speed(iter/s)": 0.349264 }, { "epoch": 0.025454545454545455, "grad_norm": 4.843620777130127, "learning_rate": 2.822580645161291e-06, "loss": 1.6385580062866212, "memory(GiB)": 64.44, "step": 35, "token_acc": 0.6209428129829985, "train_speed(iter/s)": 0.363951 }, { "epoch": 0.02909090909090909, "grad_norm": 5.110261917114258, "learning_rate": 3.225806451612903e-06, "loss": 1.573188877105713, "memory(GiB)": 64.44, "step": 40, "token_acc": 0.6010611419909045, "train_speed(iter/s)": 0.376755 }, { "epoch": 0.03272727272727273, "grad_norm": 5.215554237365723, "learning_rate": 3.6290322580645166e-06, "loss": 1.5826381683349608, "memory(GiB)": 64.44, "step": 45, "token_acc": 0.6275129884797831, "train_speed(iter/s)": 0.387234 }, { "epoch": 0.03636363636363636, "grad_norm": 5.08247709274292, "learning_rate": 4.032258064516129e-06, "loss": 1.5879148483276366, "memory(GiB)": 64.44, "step": 50, "token_acc": 0.6302843966179862, "train_speed(iter/s)": 0.394999 }, { "epoch": 0.04, "grad_norm": 5.114762306213379, "learning_rate": 4.435483870967742e-06, "loss": 1.5051856994628907, "memory(GiB)": 64.44, "step": 55, "token_acc": 0.6086616227498043, "train_speed(iter/s)": 0.401855 }, { "epoch": 0.04363636363636364, "grad_norm": 4.984416961669922, "learning_rate": 4.838709677419355e-06, "loss": 1.565500259399414, "memory(GiB)": 64.44, "step": 60, "token_acc": 0.6135120350109409, "train_speed(iter/s)": 0.408094 }, { "epoch": 0.04727272727272727, "grad_norm": 4.8500075340271, "learning_rate": 5.241935483870968e-06, "loss": 1.4776456832885743, "memory(GiB)": 64.44, "step": 65, "token_acc": 0.6234521101844832, "train_speed(iter/s)": 0.412103 }, { "epoch": 0.05090909090909091, "grad_norm": 4.941230297088623, "learning_rate": 5.645161290322582e-06, "loss": 1.5210559844970704, "memory(GiB)": 64.44, "step": 70, "token_acc": 0.6208510638297873, "train_speed(iter/s)": 0.41635 }, { "epoch": 0.05454545454545454, "grad_norm": 4.713766098022461, "learning_rate": 6.048387096774194e-06, "loss": 1.5052054405212403, "memory(GiB)": 64.44, "step": 75, "token_acc": 0.646598030438675, "train_speed(iter/s)": 0.420387 }, { "epoch": 0.05818181818181818, "grad_norm": 4.036681175231934, "learning_rate": 6.451612903225806e-06, "loss": 1.4002185821533204, "memory(GiB)": 64.44, "step": 80, "token_acc": 0.67150771073514, "train_speed(iter/s)": 0.41958 }, { "epoch": 0.06181818181818182, "grad_norm": 4.7215728759765625, "learning_rate": 6.854838709677419e-06, "loss": 1.549690341949463, "memory(GiB)": 64.44, "step": 85, "token_acc": 0.6353428916911383, "train_speed(iter/s)": 0.421693 }, { "epoch": 0.06545454545454546, "grad_norm": 4.367216110229492, "learning_rate": 7.258064516129033e-06, "loss": 1.485302448272705, "memory(GiB)": 64.44, "step": 90, "token_acc": 0.6345565749235474, "train_speed(iter/s)": 0.424745 }, { "epoch": 0.06909090909090909, "grad_norm": 4.972701072692871, "learning_rate": 7.661290322580646e-06, "loss": 1.5724483489990235, "memory(GiB)": 64.44, "step": 95, "token_acc": 0.6130210571551353, "train_speed(iter/s)": 0.42788 }, { "epoch": 0.07272727272727272, "grad_norm": 4.559494972229004, "learning_rate": 8.064516129032258e-06, "loss": 1.581673526763916, "memory(GiB)": 64.44, "step": 100, "token_acc": 0.6047289761320545, "train_speed(iter/s)": 0.430426 }, { "epoch": 0.07636363636363637, "grad_norm": 4.930873394012451, "learning_rate": 8.467741935483872e-06, "loss": 1.4878676414489747, "memory(GiB)": 64.44, "step": 105, "token_acc": 0.5901130569718466, "train_speed(iter/s)": 0.430305 }, { "epoch": 0.08, "grad_norm": 5.295114994049072, "learning_rate": 8.870967741935484e-06, "loss": 1.541814422607422, "memory(GiB)": 64.44, "step": 110, "token_acc": 0.6382845188284518, "train_speed(iter/s)": 0.432117 }, { "epoch": 0.08363636363636363, "grad_norm": 5.135087013244629, "learning_rate": 9.274193548387097e-06, "loss": 1.5753223419189453, "memory(GiB)": 64.44, "step": 115, "token_acc": 0.6122940940136601, "train_speed(iter/s)": 0.434155 }, { "epoch": 0.08727272727272728, "grad_norm": 4.172939300537109, "learning_rate": 9.67741935483871e-06, "loss": 1.552765464782715, "memory(GiB)": 64.44, "step": 120, "token_acc": 0.6434352517985612, "train_speed(iter/s)": 0.435597 }, { "epoch": 0.09090909090909091, "grad_norm": 4.920270919799805, "learning_rate": 9.999998458645166e-06, "loss": 1.5966070175170899, "memory(GiB)": 64.44, "step": 125, "token_acc": 0.6312905844155844, "train_speed(iter/s)": 0.437896 }, { "epoch": 0.09454545454545454, "grad_norm": 5.000640869140625, "learning_rate": 9.999944511325734e-06, "loss": 1.4817375183105468, "memory(GiB)": 64.44, "step": 130, "token_acc": 0.6199952617863066, "train_speed(iter/s)": 0.439898 }, { "epoch": 0.09818181818181818, "grad_norm": 4.871465682983398, "learning_rate": 9.999813497214877e-06, "loss": 1.46666259765625, "memory(GiB)": 64.44, "step": 135, "token_acc": 0.644193127446716, "train_speed(iter/s)": 0.440049 }, { "epoch": 0.10181818181818182, "grad_norm": 4.193850517272949, "learning_rate": 9.99960541833198e-06, "loss": 1.5098167419433595, "memory(GiB)": 64.44, "step": 140, "token_acc": 0.6258551545175749, "train_speed(iter/s)": 0.440616 }, { "epoch": 0.10545454545454545, "grad_norm": 4.325166702270508, "learning_rate": 9.999320277884277e-06, "loss": 1.4981783866882323, "memory(GiB)": 64.44, "step": 145, "token_acc": 0.6175044091710759, "train_speed(iter/s)": 0.442088 }, { "epoch": 0.10909090909090909, "grad_norm": 4.8125410079956055, "learning_rate": 9.998958080266787e-06, "loss": 1.407313346862793, "memory(GiB)": 64.44, "step": 150, "token_acc": 0.6471645367412141, "train_speed(iter/s)": 0.442736 }, { "epoch": 0.11272727272727273, "grad_norm": 4.802966117858887, "learning_rate": 9.998518831062255e-06, "loss": 1.5133844375610352, "memory(GiB)": 64.44, "step": 155, "token_acc": 0.6264990328820116, "train_speed(iter/s)": 0.443566 }, { "epoch": 0.11636363636363636, "grad_norm": 4.249505043029785, "learning_rate": 9.99800253704106e-06, "loss": 1.5245509147644043, "memory(GiB)": 64.44, "step": 160, "token_acc": 0.6210456942003515, "train_speed(iter/s)": 0.444249 }, { "epoch": 0.12, "grad_norm": 4.372662544250488, "learning_rate": 9.997409206161116e-06, "loss": 1.422879409790039, "memory(GiB)": 64.44, "step": 165, "token_acc": 0.6574539363484088, "train_speed(iter/s)": 0.445374 }, { "epoch": 0.12363636363636364, "grad_norm": 5.232819557189941, "learning_rate": 9.996738847567745e-06, "loss": 1.6023344039916991, "memory(GiB)": 64.44, "step": 170, "token_acc": 0.6377105743860362, "train_speed(iter/s)": 0.446738 }, { "epoch": 0.12727272727272726, "grad_norm": 4.823113918304443, "learning_rate": 9.995991471593538e-06, "loss": 1.5789835929870606, "memory(GiB)": 64.44, "step": 175, "token_acc": 0.6327939590075512, "train_speed(iter/s)": 0.447515 }, { "epoch": 0.13090909090909092, "grad_norm": 4.816397666931152, "learning_rate": 9.9951670897582e-06, "loss": 1.4952729225158692, "memory(GiB)": 64.44, "step": 180, "token_acc": 0.622705212070057, "train_speed(iter/s)": 0.448454 }, { "epoch": 0.13454545454545455, "grad_norm": 4.636293411254883, "learning_rate": 9.99426571476836e-06, "loss": 1.6462493896484376, "memory(GiB)": 64.44, "step": 185, "token_acc": 0.6159734626180148, "train_speed(iter/s)": 0.449812 }, { "epoch": 0.13818181818181818, "grad_norm": 4.711672782897949, "learning_rate": 9.993287360517394e-06, "loss": 1.5444934844970704, "memory(GiB)": 64.44, "step": 190, "token_acc": 0.6438658428949691, "train_speed(iter/s)": 0.450862 }, { "epoch": 0.14181818181818182, "grad_norm": 4.75740385055542, "learning_rate": 9.992232042085188e-06, "loss": 1.5141837120056152, "memory(GiB)": 64.44, "step": 195, "token_acc": 0.6383887135697048, "train_speed(iter/s)": 0.451385 }, { "epoch": 0.14545454545454545, "grad_norm": 4.457281589508057, "learning_rate": 9.991099775737925e-06, "loss": 1.5545944213867187, "memory(GiB)": 64.44, "step": 200, "token_acc": 0.6363013698630137, "train_speed(iter/s)": 0.452181 }, { "epoch": 0.14909090909090908, "grad_norm": 4.13571310043335, "learning_rate": 9.989890578927827e-06, "loss": 1.5171931266784668, "memory(GiB)": 64.44, "step": 205, "token_acc": 0.6591174021648626, "train_speed(iter/s)": 0.452587 }, { "epoch": 0.15272727272727274, "grad_norm": 4.348774433135986, "learning_rate": 9.988604470292886e-06, "loss": 1.4988608360290527, "memory(GiB)": 64.44, "step": 210, "token_acc": 0.6556742815033162, "train_speed(iter/s)": 0.452838 }, { "epoch": 0.15636363636363637, "grad_norm": 4.25404167175293, "learning_rate": 9.987241469656573e-06, "loss": 1.5212635040283202, "memory(GiB)": 64.44, "step": 215, "token_acc": 0.6363988383349467, "train_speed(iter/s)": 0.453261 }, { "epoch": 0.16, "grad_norm": 4.63402795791626, "learning_rate": 9.985801598027536e-06, "loss": 1.5325578689575194, "memory(GiB)": 64.44, "step": 220, "token_acc": 0.6563048383053397, "train_speed(iter/s)": 0.453851 }, { "epoch": 0.16363636363636364, "grad_norm": 4.500482559204102, "learning_rate": 9.984284877599281e-06, "loss": 1.6204137802124023, "memory(GiB)": 64.44, "step": 225, "token_acc": 0.60273095796885, "train_speed(iter/s)": 0.45439 }, { "epoch": 0.16727272727272727, "grad_norm": 4.2809929847717285, "learning_rate": 9.982691331749826e-06, "loss": 1.5170854568481444, "memory(GiB)": 64.44, "step": 230, "token_acc": 0.6392360292383872, "train_speed(iter/s)": 0.45458 }, { "epoch": 0.1709090909090909, "grad_norm": 5.02462911605835, "learning_rate": 9.98102098504133e-06, "loss": 1.591007900238037, "memory(GiB)": 64.44, "step": 235, "token_acc": 0.6016401590457257, "train_speed(iter/s)": 0.455408 }, { "epoch": 0.17454545454545456, "grad_norm": 5.187936782836914, "learning_rate": 9.979273863219736e-06, "loss": 1.5465394973754882, "memory(GiB)": 64.44, "step": 240, "token_acc": 0.596551724137931, "train_speed(iter/s)": 0.455611 }, { "epoch": 0.1781818181818182, "grad_norm": 4.898781776428223, "learning_rate": 9.977449993214357e-06, "loss": 1.604863739013672, "memory(GiB)": 64.44, "step": 245, "token_acc": 0.6101733063245555, "train_speed(iter/s)": 0.456036 }, { "epoch": 0.18181818181818182, "grad_norm": 4.115358829498291, "learning_rate": 9.975549403137464e-06, "loss": 1.4797225952148438, "memory(GiB)": 64.44, "step": 250, "token_acc": 0.6420706973150473, "train_speed(iter/s)": 0.456135 }, { "epoch": 0.18545454545454546, "grad_norm": 4.969156742095947, "learning_rate": 9.973572122283862e-06, "loss": 1.5260903358459472, "memory(GiB)": 64.44, "step": 255, "token_acc": 0.632973944294699, "train_speed(iter/s)": 0.456308 }, { "epoch": 0.1890909090909091, "grad_norm": 4.20519495010376, "learning_rate": 9.971518181130424e-06, "loss": 1.470450210571289, "memory(GiB)": 64.44, "step": 260, "token_acc": 0.6416337285902504, "train_speed(iter/s)": 0.456191 }, { "epoch": 0.19272727272727272, "grad_norm": 4.706243991851807, "learning_rate": 9.969387611335632e-06, "loss": 1.5608243942260742, "memory(GiB)": 64.44, "step": 265, "token_acc": 0.589919545669664, "train_speed(iter/s)": 0.456389 }, { "epoch": 0.19636363636363635, "grad_norm": 4.728813648223877, "learning_rate": 9.96718044573909e-06, "loss": 1.5417936325073243, "memory(GiB)": 64.44, "step": 270, "token_acc": 0.6227795193312434, "train_speed(iter/s)": 0.457028 }, { "epoch": 0.2, "grad_norm": 4.621528148651123, "learning_rate": 9.964896718361007e-06, "loss": 1.589951229095459, "memory(GiB)": 64.44, "step": 275, "token_acc": 0.6673909107369184, "train_speed(iter/s)": 0.457304 }, { "epoch": 0.20363636363636364, "grad_norm": 4.198657989501953, "learning_rate": 9.96253646440168e-06, "loss": 1.494888687133789, "memory(GiB)": 64.44, "step": 280, "token_acc": 0.6309142318567389, "train_speed(iter/s)": 0.457335 }, { "epoch": 0.20727272727272728, "grad_norm": 4.37053108215332, "learning_rate": 9.960099720240957e-06, "loss": 1.4807355880737305, "memory(GiB)": 64.44, "step": 285, "token_acc": 0.6721584984358707, "train_speed(iter/s)": 0.457916 }, { "epoch": 0.2109090909090909, "grad_norm": 4.357964992523193, "learning_rate": 9.957586523437662e-06, "loss": 1.5848698616027832, "memory(GiB)": 64.44, "step": 290, "token_acc": 0.6120053020261315, "train_speed(iter/s)": 0.458254 }, { "epoch": 0.21454545454545454, "grad_norm": 3.9031291007995605, "learning_rate": 9.954996912729029e-06, "loss": 1.5905929565429688, "memory(GiB)": 64.44, "step": 295, "token_acc": 0.6347525394424033, "train_speed(iter/s)": 0.458959 }, { "epoch": 0.21818181818181817, "grad_norm": 4.532529830932617, "learning_rate": 9.9523309280301e-06, "loss": 1.4738840103149413, "memory(GiB)": 64.44, "step": 300, "token_acc": 0.636405109489051, "train_speed(iter/s)": 0.458664 }, { "epoch": 0.22181818181818183, "grad_norm": 4.186645030975342, "learning_rate": 9.949588610433105e-06, "loss": 1.5529683113098145, "memory(GiB)": 64.44, "step": 305, "token_acc": 0.584009009009009, "train_speed(iter/s)": 0.458812 }, { "epoch": 0.22545454545454546, "grad_norm": 4.240685939788818, "learning_rate": 9.94677000220684e-06, "loss": 1.5312615394592286, "memory(GiB)": 64.44, "step": 310, "token_acc": 0.6109083100708611, "train_speed(iter/s)": 0.45898 }, { "epoch": 0.2290909090909091, "grad_norm": 4.726016521453857, "learning_rate": 9.943875146796005e-06, "loss": 1.5821155548095702, "memory(GiB)": 64.44, "step": 315, "token_acc": 0.6087295401402962, "train_speed(iter/s)": 0.459411 }, { "epoch": 0.23272727272727273, "grad_norm": 3.997502088546753, "learning_rate": 9.940904088820538e-06, "loss": 1.4851863861083985, "memory(GiB)": 64.44, "step": 320, "token_acc": 0.6362646930779278, "train_speed(iter/s)": 0.459939 }, { "epoch": 0.23636363636363636, "grad_norm": 4.03656530380249, "learning_rate": 9.93785687407493e-06, "loss": 1.5195300102233886, "memory(GiB)": 64.44, "step": 325, "token_acc": 0.6184857423795477, "train_speed(iter/s)": 0.459636 }, { "epoch": 0.24, "grad_norm": 4.356072425842285, "learning_rate": 9.93473354952751e-06, "loss": 1.471431827545166, "memory(GiB)": 64.44, "step": 330, "token_acc": 0.6255809254394827, "train_speed(iter/s)": 0.459145 }, { "epoch": 0.24363636363636362, "grad_norm": 4.420890808105469, "learning_rate": 9.931534163319739e-06, "loss": 1.6016006469726562, "memory(GiB)": 64.44, "step": 335, "token_acc": 0.6178384050367262, "train_speed(iter/s)": 0.45933 }, { "epoch": 0.24727272727272728, "grad_norm": 4.427598476409912, "learning_rate": 9.928258764765446e-06, "loss": 1.5727561950683593, "memory(GiB)": 64.44, "step": 340, "token_acc": 0.6156725729972548, "train_speed(iter/s)": 0.459915 }, { "epoch": 0.2509090909090909, "grad_norm": 4.281289577484131, "learning_rate": 9.924907404350084e-06, "loss": 1.4837968826293946, "memory(GiB)": 64.44, "step": 345, "token_acc": 0.6198141011108592, "train_speed(iter/s)": 0.460137 }, { "epoch": 0.2545454545454545, "grad_norm": 4.332330226898193, "learning_rate": 9.921480133729943e-06, "loss": 1.4289453506469727, "memory(GiB)": 64.44, "step": 350, "token_acc": 0.6394877267876201, "train_speed(iter/s)": 0.460435 }, { "epoch": 0.2581818181818182, "grad_norm": 4.192288875579834, "learning_rate": 9.917977005731365e-06, "loss": 1.4650839805603026, "memory(GiB)": 64.44, "step": 355, "token_acc": 0.6584795321637427, "train_speed(iter/s)": 0.460398 }, { "epoch": 0.26181818181818184, "grad_norm": 4.511104583740234, "learning_rate": 9.914398074349908e-06, "loss": 1.5645034790039063, "memory(GiB)": 64.44, "step": 360, "token_acc": 0.6630366492146597, "train_speed(iter/s)": 0.460742 }, { "epoch": 0.26545454545454544, "grad_norm": 4.1415510177612305, "learning_rate": 9.910743394749545e-06, "loss": 1.5121275901794433, "memory(GiB)": 64.44, "step": 365, "token_acc": 0.6393345216874629, "train_speed(iter/s)": 0.460505 }, { "epoch": 0.2690909090909091, "grad_norm": 4.683187007904053, "learning_rate": 9.90701302326178e-06, "loss": 1.5751832962036132, "memory(GiB)": 64.44, "step": 370, "token_acc": 0.6360116166505324, "train_speed(iter/s)": 0.460985 }, { "epoch": 0.2727272727272727, "grad_norm": 4.6351470947265625, "learning_rate": 9.903207017384805e-06, "loss": 1.5309032440185546, "memory(GiB)": 64.44, "step": 375, "token_acc": 0.5923818946326985, "train_speed(iter/s)": 0.461128 }, { "epoch": 0.27636363636363637, "grad_norm": 4.136954307556152, "learning_rate": 9.899325435782605e-06, "loss": 1.5937362670898438, "memory(GiB)": 64.44, "step": 380, "token_acc": 0.6055309734513274, "train_speed(iter/s)": 0.461166 }, { "epoch": 0.28, "grad_norm": 5.078017711639404, "learning_rate": 9.895368338284052e-06, "loss": 1.465833854675293, "memory(GiB)": 64.44, "step": 385, "token_acc": 0.639680262348842, "train_speed(iter/s)": 0.461334 }, { "epoch": 0.28363636363636363, "grad_norm": 4.52872371673584, "learning_rate": 9.891335785881983e-06, "loss": 1.5299781799316405, "memory(GiB)": 64.44, "step": 390, "token_acc": 0.628995633187773, "train_speed(iter/s)": 0.461287 }, { "epoch": 0.2872727272727273, "grad_norm": 4.213586807250977, "learning_rate": 9.887227840732264e-06, "loss": 1.509080696105957, "memory(GiB)": 64.44, "step": 395, "token_acc": 0.637125748502994, "train_speed(iter/s)": 0.461288 }, { "epoch": 0.2909090909090909, "grad_norm": 7.419249534606934, "learning_rate": 9.883044566152824e-06, "loss": 1.566788387298584, "memory(GiB)": 64.44, "step": 400, "token_acc": 0.6288452964779313, "train_speed(iter/s)": 0.461127 }, { "epoch": 0.29454545454545455, "grad_norm": 4.467213153839111, "learning_rate": 9.878786026622696e-06, "loss": 1.5006021499633788, "memory(GiB)": 64.44, "step": 405, "token_acc": 0.6567649106521235, "train_speed(iter/s)": 0.461494 }, { "epoch": 0.29818181818181816, "grad_norm": 5.979769706726074, "learning_rate": 9.874452287780998e-06, "loss": 1.5232136726379395, "memory(GiB)": 64.44, "step": 410, "token_acc": 0.6336889751050759, "train_speed(iter/s)": 0.460984 }, { "epoch": 0.3018181818181818, "grad_norm": 4.591410160064697, "learning_rate": 9.870043416425942e-06, "loss": 1.4568933486938476, "memory(GiB)": 64.44, "step": 415, "token_acc": 0.6160337552742616, "train_speed(iter/s)": 0.461261 }, { "epoch": 0.3054545454545455, "grad_norm": 4.580557346343994, "learning_rate": 9.865559480513797e-06, "loss": 1.594901180267334, "memory(GiB)": 64.44, "step": 420, "token_acc": 0.6259556218534402, "train_speed(iter/s)": 0.461368 }, { "epoch": 0.3090909090909091, "grad_norm": 4.55140495300293, "learning_rate": 9.861000549157839e-06, "loss": 1.4992039680480957, "memory(GiB)": 64.44, "step": 425, "token_acc": 0.63933626159102, "train_speed(iter/s)": 0.461652 }, { "epoch": 0.31272727272727274, "grad_norm": 4.030912399291992, "learning_rate": 9.856366692627296e-06, "loss": 1.5157204627990724, "memory(GiB)": 64.44, "step": 430, "token_acc": 0.6167369901547117, "train_speed(iter/s)": 0.461884 }, { "epoch": 0.31636363636363635, "grad_norm": 4.710945129394531, "learning_rate": 9.851657982346244e-06, "loss": 1.524489402770996, "memory(GiB)": 64.44, "step": 435, "token_acc": 0.6184729635646322, "train_speed(iter/s)": 0.461909 }, { "epoch": 0.32, "grad_norm": 4.01018762588501, "learning_rate": 9.846874490892528e-06, "loss": 1.5859844207763671, "memory(GiB)": 64.44, "step": 440, "token_acc": 0.630187144019528, "train_speed(iter/s)": 0.462173 }, { "epoch": 0.3236363636363636, "grad_norm": 4.102193832397461, "learning_rate": 9.842016291996638e-06, "loss": 1.6166738510131835, "memory(GiB)": 64.44, "step": 445, "token_acc": 0.6040579710144928, "train_speed(iter/s)": 0.462381 }, { "epoch": 0.32727272727272727, "grad_norm": 4.053755760192871, "learning_rate": 9.837083460540565e-06, "loss": 1.5673515319824218, "memory(GiB)": 64.44, "step": 450, "token_acc": 0.6129250168880883, "train_speed(iter/s)": 0.462643 }, { "epoch": 0.33090909090909093, "grad_norm": 4.424112796783447, "learning_rate": 9.832076072556649e-06, "loss": 1.4549053192138672, "memory(GiB)": 64.44, "step": 455, "token_acc": 0.6802023121387283, "train_speed(iter/s)": 0.462184 }, { "epoch": 0.33454545454545453, "grad_norm": 4.756387710571289, "learning_rate": 9.82699420522641e-06, "loss": 1.5000262260437012, "memory(GiB)": 64.44, "step": 460, "token_acc": 0.6323158136332339, "train_speed(iter/s)": 0.462438 }, { "epoch": 0.3381818181818182, "grad_norm": 4.306171894073486, "learning_rate": 9.821837936879364e-06, "loss": 1.4740945816040039, "memory(GiB)": 64.44, "step": 465, "token_acc": 0.6459806231997905, "train_speed(iter/s)": 0.462268 }, { "epoch": 0.3418181818181818, "grad_norm": 3.8091623783111572, "learning_rate": 9.816607346991801e-06, "loss": 1.4778839111328126, "memory(GiB)": 64.44, "step": 470, "token_acc": 0.6258960573476703, "train_speed(iter/s)": 0.46241 }, { "epoch": 0.34545454545454546, "grad_norm": 4.151661396026611, "learning_rate": 9.811302516185572e-06, "loss": 1.5408092498779298, "memory(GiB)": 64.44, "step": 475, "token_acc": 0.6218589899975604, "train_speed(iter/s)": 0.462383 }, { "epoch": 0.3490909090909091, "grad_norm": 4.382880210876465, "learning_rate": 9.805923526226843e-06, "loss": 1.5352145195007325, "memory(GiB)": 64.44, "step": 480, "token_acc": 0.6172420674516065, "train_speed(iter/s)": 0.462555 }, { "epoch": 0.3527272727272727, "grad_norm": 4.075268745422363, "learning_rate": 9.800470460024835e-06, "loss": 1.4970654487609862, "memory(GiB)": 64.44, "step": 485, "token_acc": 0.6273666092943201, "train_speed(iter/s)": 0.462386 }, { "epoch": 0.3563636363636364, "grad_norm": 4.728382110595703, "learning_rate": 9.794943401630543e-06, "loss": 1.4647459030151366, "memory(GiB)": 64.44, "step": 490, "token_acc": 0.6437184827888621, "train_speed(iter/s)": 0.462727 }, { "epoch": 0.36, "grad_norm": 3.9103758335113525, "learning_rate": 9.78934243623544e-06, "loss": 1.5026863098144532, "memory(GiB)": 64.44, "step": 495, "token_acc": 0.641298958849777, "train_speed(iter/s)": 0.462645 }, { "epoch": 0.36363636363636365, "grad_norm": 4.6131086349487305, "learning_rate": 9.783667650170177e-06, "loss": 1.5507336616516114, "memory(GiB)": 64.44, "step": 500, "token_acc": 0.5890446521287642, "train_speed(iter/s)": 0.462845 }, { "epoch": 0.36727272727272725, "grad_norm": 4.001507759094238, "learning_rate": 9.777919130903228e-06, "loss": 1.5329437255859375, "memory(GiB)": 64.44, "step": 505, "token_acc": 0.5871156661786238, "train_speed(iter/s)": 0.462924 }, { "epoch": 0.3709090909090909, "grad_norm": 4.340017318725586, "learning_rate": 9.77209696703957e-06, "loss": 1.4759044647216797, "memory(GiB)": 64.44, "step": 510, "token_acc": 0.6089973142345568, "train_speed(iter/s)": 0.463076 }, { "epoch": 0.37454545454545457, "grad_norm": 4.634973049163818, "learning_rate": 9.766201248319295e-06, "loss": 1.5061256408691406, "memory(GiB)": 64.44, "step": 515, "token_acc": 0.603759207518415, "train_speed(iter/s)": 0.462996 }, { "epoch": 0.3781818181818182, "grad_norm": 3.9917287826538086, "learning_rate": 9.760232065616233e-06, "loss": 1.4734699249267578, "memory(GiB)": 64.44, "step": 520, "token_acc": 0.6146010186757216, "train_speed(iter/s)": 0.462922 }, { "epoch": 0.38181818181818183, "grad_norm": 4.241364479064941, "learning_rate": 9.754189510936561e-06, "loss": 1.5880233764648437, "memory(GiB)": 64.44, "step": 525, "token_acc": 0.5949421345906558, "train_speed(iter/s)": 0.463191 }, { "epoch": 0.38545454545454544, "grad_norm": 4.494994163513184, "learning_rate": 9.748073677417371e-06, "loss": 1.4729201316833496, "memory(GiB)": 64.44, "step": 530, "token_acc": 0.6479982498359221, "train_speed(iter/s)": 0.463331 }, { "epoch": 0.3890909090909091, "grad_norm": 4.426039218902588, "learning_rate": 9.741884659325242e-06, "loss": 1.5634471893310546, "memory(GiB)": 64.44, "step": 535, "token_acc": 0.6027777777777777, "train_speed(iter/s)": 0.463485 }, { "epoch": 0.3927272727272727, "grad_norm": 4.643458366394043, "learning_rate": 9.735622552054786e-06, "loss": 1.549774742126465, "memory(GiB)": 64.44, "step": 540, "token_acc": 0.6494584005531229, "train_speed(iter/s)": 0.463578 }, { "epoch": 0.39636363636363636, "grad_norm": 4.178001880645752, "learning_rate": 9.729287452127178e-06, "loss": 1.5748735427856446, "memory(GiB)": 64.44, "step": 545, "token_acc": 0.5911589008363202, "train_speed(iter/s)": 0.463746 }, { "epoch": 0.4, "grad_norm": 3.9572534561157227, "learning_rate": 9.722879457188666e-06, "loss": 1.5722023010253907, "memory(GiB)": 64.44, "step": 550, "token_acc": 0.6157480314960629, "train_speed(iter/s)": 0.46385 }, { "epoch": 0.4036363636363636, "grad_norm": 3.675825834274292, "learning_rate": 9.716398666009067e-06, "loss": 1.5456720352172852, "memory(GiB)": 64.44, "step": 555, "token_acc": 0.6297201243891604, "train_speed(iter/s)": 0.463989 }, { "epoch": 0.4072727272727273, "grad_norm": 3.31160306930542, "learning_rate": 9.70984517848025e-06, "loss": 1.6060224533081056, "memory(GiB)": 64.44, "step": 560, "token_acc": 0.6269613259668508, "train_speed(iter/s)": 0.46403 }, { "epoch": 0.4109090909090909, "grad_norm": 4.05873441696167, "learning_rate": 9.703219095614583e-06, "loss": 1.5519798278808594, "memory(GiB)": 64.44, "step": 565, "token_acc": 0.6137970571373973, "train_speed(iter/s)": 0.463591 }, { "epoch": 0.41454545454545455, "grad_norm": 4.47987699508667, "learning_rate": 9.69652051954339e-06, "loss": 1.5114023208618164, "memory(GiB)": 64.44, "step": 570, "token_acc": 0.6189915174363808, "train_speed(iter/s)": 0.463785 }, { "epoch": 0.41818181818181815, "grad_norm": 3.981717586517334, "learning_rate": 9.68974955351537e-06, "loss": 1.4660893440246583, "memory(GiB)": 64.44, "step": 575, "token_acc": 0.6405854716299241, "train_speed(iter/s)": 0.463635 }, { "epoch": 0.4218181818181818, "grad_norm": 4.990572452545166, "learning_rate": 9.682906301895007e-06, "loss": 1.4636313438415527, "memory(GiB)": 64.44, "step": 580, "token_acc": 0.6241696474195196, "train_speed(iter/s)": 0.463595 }, { "epoch": 0.4254545454545455, "grad_norm": 4.313155651092529, "learning_rate": 9.675990870160958e-06, "loss": 1.5075316429138184, "memory(GiB)": 64.44, "step": 585, "token_acc": 0.597252882021094, "train_speed(iter/s)": 0.463552 }, { "epoch": 0.4290909090909091, "grad_norm": 3.7366018295288086, "learning_rate": 9.669003364904438e-06, "loss": 1.5338315963745117, "memory(GiB)": 64.44, "step": 590, "token_acc": 0.6448745802883665, "train_speed(iter/s)": 0.46378 }, { "epoch": 0.43272727272727274, "grad_norm": 3.7582857608795166, "learning_rate": 9.66194389382756e-06, "loss": 1.5849173545837403, "memory(GiB)": 64.44, "step": 595, "token_acc": 0.6113561190738699, "train_speed(iter/s)": 0.4639 }, { "epoch": 0.43636363636363634, "grad_norm": 3.267991065979004, "learning_rate": 9.65481256574169e-06, "loss": 1.4916378021240235, "memory(GiB)": 64.44, "step": 600, "token_acc": 0.6791225416036308, "train_speed(iter/s)": 0.463656 }, { "epoch": 0.44, "grad_norm": 3.9313509464263916, "learning_rate": 9.647609490565762e-06, "loss": 1.486070442199707, "memory(GiB)": 64.44, "step": 605, "token_acc": 0.6800168634064081, "train_speed(iter/s)": 0.463546 }, { "epoch": 0.44363636363636366, "grad_norm": 4.258699417114258, "learning_rate": 9.640334779324589e-06, "loss": 1.5047850608825684, "memory(GiB)": 64.44, "step": 610, "token_acc": 0.6266666666666667, "train_speed(iter/s)": 0.463839 }, { "epoch": 0.44727272727272727, "grad_norm": 4.216398239135742, "learning_rate": 9.632988544147143e-06, "loss": 1.4978628158569336, "memory(GiB)": 64.44, "step": 615, "token_acc": 0.6422018348623854, "train_speed(iter/s)": 0.463915 }, { "epoch": 0.4509090909090909, "grad_norm": 4.547543048858643, "learning_rate": 9.625570898264837e-06, "loss": 1.4514757156372071, "memory(GiB)": 64.44, "step": 620, "token_acc": 0.643418013856813, "train_speed(iter/s)": 0.464248 }, { "epoch": 0.45454545454545453, "grad_norm": 4.483821392059326, "learning_rate": 9.618081956009772e-06, "loss": 1.6247974395751954, "memory(GiB)": 64.44, "step": 625, "token_acc": 0.6099777822662088, "train_speed(iter/s)": 0.464408 }, { "epoch": 0.4581818181818182, "grad_norm": 4.023407936096191, "learning_rate": 9.610521832812982e-06, "loss": 1.5059638977050782, "memory(GiB)": 64.44, "step": 630, "token_acc": 0.6152820968458463, "train_speed(iter/s)": 0.464375 }, { "epoch": 0.4618181818181818, "grad_norm": 3.8227059841156006, "learning_rate": 9.602890645202647e-06, "loss": 1.5907604217529296, "memory(GiB)": 64.44, "step": 635, "token_acc": 0.6613013698630137, "train_speed(iter/s)": 0.46445 }, { "epoch": 0.46545454545454545, "grad_norm": 4.068626403808594, "learning_rate": 9.595188510802299e-06, "loss": 1.5536697387695313, "memory(GiB)": 64.44, "step": 640, "token_acc": 0.6237579042457091, "train_speed(iter/s)": 0.464352 }, { "epoch": 0.4690909090909091, "grad_norm": 4.049459934234619, "learning_rate": 9.587415548329013e-06, "loss": 1.4787757873535157, "memory(GiB)": 64.44, "step": 645, "token_acc": 0.6037911168927709, "train_speed(iter/s)": 0.464418 }, { "epoch": 0.4727272727272727, "grad_norm": 3.7583351135253906, "learning_rate": 9.579571877591576e-06, "loss": 1.5354381561279298, "memory(GiB)": 64.44, "step": 650, "token_acc": 0.6248664815210425, "train_speed(iter/s)": 0.464484 }, { "epoch": 0.4763636363636364, "grad_norm": 4.056765079498291, "learning_rate": 9.571657619488635e-06, "loss": 1.472429370880127, "memory(GiB)": 64.44, "step": 655, "token_acc": 0.6824114356743319, "train_speed(iter/s)": 0.464459 }, { "epoch": 0.48, "grad_norm": 3.8453173637390137, "learning_rate": 9.563672896006842e-06, "loss": 1.5348154067993165, "memory(GiB)": 64.44, "step": 660, "token_acc": 0.6112652016215063, "train_speed(iter/s)": 0.464415 }, { "epoch": 0.48363636363636364, "grad_norm": 4.265034198760986, "learning_rate": 9.555617830218964e-06, "loss": 1.5670215606689453, "memory(GiB)": 64.44, "step": 665, "token_acc": 0.6162583518930957, "train_speed(iter/s)": 0.464479 }, { "epoch": 0.48727272727272725, "grad_norm": 4.171985149383545, "learning_rate": 9.547492546281996e-06, "loss": 1.5287425994873047, "memory(GiB)": 64.44, "step": 670, "token_acc": 0.6656884875846502, "train_speed(iter/s)": 0.464691 }, { "epoch": 0.4909090909090909, "grad_norm": 3.559645414352417, "learning_rate": 9.539297169435238e-06, "loss": 1.5655836105346679, "memory(GiB)": 64.44, "step": 675, "token_acc": 0.6459044368600683, "train_speed(iter/s)": 0.464634 }, { "epoch": 0.49454545454545457, "grad_norm": 3.3797030448913574, "learning_rate": 9.531031825998374e-06, "loss": 1.4685256004333496, "memory(GiB)": 64.44, "step": 680, "token_acc": 0.6592842240410849, "train_speed(iter/s)": 0.464582 }, { "epoch": 0.49818181818181817, "grad_norm": 4.35471248626709, "learning_rate": 9.522696643369515e-06, "loss": 1.6089235305786134, "memory(GiB)": 64.44, "step": 685, "token_acc": 0.6074537540805223, "train_speed(iter/s)": 0.464786 }, { "epoch": 0.5018181818181818, "grad_norm": 4.220783233642578, "learning_rate": 9.514291750023248e-06, "loss": 1.4950236320495605, "memory(GiB)": 64.44, "step": 690, "token_acc": 0.6523521795425119, "train_speed(iter/s)": 0.46478 }, { "epoch": 0.5054545454545455, "grad_norm": 3.488475799560547, "learning_rate": 9.505817275508636e-06, "loss": 1.484272575378418, "memory(GiB)": 64.44, "step": 695, "token_acc": 0.6576594090202177, "train_speed(iter/s)": 0.464879 }, { "epoch": 0.509090909090909, "grad_norm": 3.5033652782440186, "learning_rate": 9.497273350447247e-06, "loss": 1.4467235565185548, "memory(GiB)": 64.44, "step": 700, "token_acc": 0.6930147058823529, "train_speed(iter/s)": 0.464836 }, { "epoch": 0.5127272727272727, "grad_norm": 3.9645371437072754, "learning_rate": 9.488660106531115e-06, "loss": 1.613375473022461, "memory(GiB)": 64.44, "step": 705, "token_acc": 0.5843076123668486, "train_speed(iter/s)": 0.465038 }, { "epoch": 0.5163636363636364, "grad_norm": 3.6118175983428955, "learning_rate": 9.479977676520734e-06, "loss": 1.4993645668029785, "memory(GiB)": 64.44, "step": 710, "token_acc": 0.595, "train_speed(iter/s)": 0.464939 }, { "epoch": 0.52, "grad_norm": 3.7442569732666016, "learning_rate": 9.471226194242987e-06, "loss": 1.5396413803100586, "memory(GiB)": 64.44, "step": 715, "token_acc": 0.6280975981700343, "train_speed(iter/s)": 0.464999 }, { "epoch": 0.5236363636363637, "grad_norm": 4.1397576332092285, "learning_rate": 9.462405794589109e-06, "loss": 1.5331635475158691, "memory(GiB)": 64.44, "step": 720, "token_acc": 0.6184054885261415, "train_speed(iter/s)": 0.465084 }, { "epoch": 0.5272727272727272, "grad_norm": 3.7472028732299805, "learning_rate": 9.453516613512585e-06, "loss": 1.5267699241638184, "memory(GiB)": 64.44, "step": 725, "token_acc": 0.6468453940737755, "train_speed(iter/s)": 0.465192 }, { "epoch": 0.5309090909090909, "grad_norm": 3.989107131958008, "learning_rate": 9.44455878802707e-06, "loss": 1.585801124572754, "memory(GiB)": 64.44, "step": 730, "token_acc": 0.6121025641025641, "train_speed(iter/s)": 0.465308 }, { "epoch": 0.5345454545454545, "grad_norm": 3.7448976039886475, "learning_rate": 9.435532456204268e-06, "loss": 1.5152654647827148, "memory(GiB)": 64.44, "step": 735, "token_acc": 0.6513828238719068, "train_speed(iter/s)": 0.465448 }, { "epoch": 0.5381818181818182, "grad_norm": 4.547407150268555, "learning_rate": 9.426437757171811e-06, "loss": 1.5738471031188965, "memory(GiB)": 64.44, "step": 740, "token_acc": 0.6231003039513677, "train_speed(iter/s)": 0.46574 }, { "epoch": 0.5418181818181819, "grad_norm": 3.8383874893188477, "learning_rate": 9.417274831111109e-06, "loss": 1.4214591979980469, "memory(GiB)": 64.44, "step": 745, "token_acc": 0.676269621421976, "train_speed(iter/s)": 0.465722 }, { "epoch": 0.5454545454545454, "grad_norm": 3.543907880783081, "learning_rate": 9.408043819255194e-06, "loss": 1.430149745941162, "memory(GiB)": 64.44, "step": 750, "token_acc": 0.6681834091704585, "train_speed(iter/s)": 0.465558 }, { "epoch": 0.5490909090909091, "grad_norm": 3.295700788497925, "learning_rate": 9.398744863886534e-06, "loss": 1.4326640129089356, "memory(GiB)": 64.44, "step": 755, "token_acc": 0.6369306369306369, "train_speed(iter/s)": 0.46536 }, { "epoch": 0.5527272727272727, "grad_norm": 3.635788917541504, "learning_rate": 9.389378108334852e-06, "loss": 1.523570442199707, "memory(GiB)": 64.44, "step": 760, "token_acc": 0.6374558303886926, "train_speed(iter/s)": 0.465517 }, { "epoch": 0.5563636363636364, "grad_norm": 4.037724494934082, "learning_rate": 9.379943696974912e-06, "loss": 1.4817398071289063, "memory(GiB)": 64.44, "step": 765, "token_acc": 0.6240034475328593, "train_speed(iter/s)": 0.465524 }, { "epoch": 0.56, "grad_norm": 3.898163318634033, "learning_rate": 9.370441775224287e-06, "loss": 1.4279541015625, "memory(GiB)": 64.44, "step": 770, "token_acc": 0.6828789958815454, "train_speed(iter/s)": 0.465562 }, { "epoch": 0.5636363636363636, "grad_norm": 4.19639253616333, "learning_rate": 9.360872489541129e-06, "loss": 1.5240070343017578, "memory(GiB)": 64.44, "step": 775, "token_acc": 0.615297833935018, "train_speed(iter/s)": 0.465613 }, { "epoch": 0.5672727272727273, "grad_norm": 3.475050449371338, "learning_rate": 9.351235987421901e-06, "loss": 1.4884565353393555, "memory(GiB)": 64.44, "step": 780, "token_acc": 0.6517972350230414, "train_speed(iter/s)": 0.465728 }, { "epoch": 0.5709090909090909, "grad_norm": 4.0276265144348145, "learning_rate": 9.341532417399113e-06, "loss": 1.5572041511535644, "memory(GiB)": 64.44, "step": 785, "token_acc": 0.6271844660194175, "train_speed(iter/s)": 0.465581 }, { "epoch": 0.5745454545454546, "grad_norm": 3.860581398010254, "learning_rate": 9.331761929039024e-06, "loss": 1.4943767547607423, "memory(GiB)": 64.44, "step": 790, "token_acc": 0.6216508210890234, "train_speed(iter/s)": 0.465606 }, { "epoch": 0.5781818181818181, "grad_norm": 3.591012477874756, "learning_rate": 9.321924672939349e-06, "loss": 1.4894336700439452, "memory(GiB)": 64.44, "step": 795, "token_acc": 0.599320882852292, "train_speed(iter/s)": 0.465616 }, { "epoch": 0.5818181818181818, "grad_norm": 3.522542953491211, "learning_rate": 9.312020800726918e-06, "loss": 1.5618131637573243, "memory(GiB)": 64.44, "step": 800, "token_acc": 0.6190360272638754, "train_speed(iter/s)": 0.465756 }, { "epoch": 0.5854545454545454, "grad_norm": 3.7886240482330322, "learning_rate": 9.302050465055357e-06, "loss": 1.5633182525634766, "memory(GiB)": 64.44, "step": 805, "token_acc": 0.6189818014282423, "train_speed(iter/s)": 0.46599 }, { "epoch": 0.5890909090909091, "grad_norm": 3.3036091327667236, "learning_rate": 9.292013819602726e-06, "loss": 1.5002209663391113, "memory(GiB)": 64.44, "step": 810, "token_acc": 0.607620320855615, "train_speed(iter/s)": 0.465952 }, { "epoch": 0.5927272727272728, "grad_norm": 3.9183084964752197, "learning_rate": 9.281911019069158e-06, "loss": 1.5537723541259765, "memory(GiB)": 64.44, "step": 815, "token_acc": 0.6308488126028685, "train_speed(iter/s)": 0.466075 }, { "epoch": 0.5963636363636363, "grad_norm": 3.89871883392334, "learning_rate": 9.271742219174464e-06, "loss": 1.4676464080810547, "memory(GiB)": 64.44, "step": 820, "token_acc": 0.6469534050179212, "train_speed(iter/s)": 0.4662 }, { "epoch": 0.6, "grad_norm": 3.631673574447632, "learning_rate": 9.261507576655738e-06, "loss": 1.498595905303955, "memory(GiB)": 64.44, "step": 825, "token_acc": 0.6465152098575279, "train_speed(iter/s)": 0.466232 }, { "epoch": 0.6036363636363636, "grad_norm": 4.689718723297119, "learning_rate": 9.251207249264943e-06, "loss": 1.5046562194824218, "memory(GiB)": 64.44, "step": 830, "token_acc": 0.6152659984579799, "train_speed(iter/s)": 0.466249 }, { "epoch": 0.6072727272727273, "grad_norm": 4.173959255218506, "learning_rate": 9.24084139576648e-06, "loss": 1.5240567207336426, "memory(GiB)": 64.44, "step": 835, "token_acc": 0.5942028985507246, "train_speed(iter/s)": 0.466409 }, { "epoch": 0.610909090909091, "grad_norm": 3.9074172973632812, "learning_rate": 9.230410175934733e-06, "loss": 1.6020416259765624, "memory(GiB)": 64.44, "step": 840, "token_acc": 0.6180246913580247, "train_speed(iter/s)": 0.466524 }, { "epoch": 0.6145454545454545, "grad_norm": 3.913738489151001, "learning_rate": 9.219913750551617e-06, "loss": 1.395237636566162, "memory(GiB)": 64.44, "step": 845, "token_acc": 0.665514261019879, "train_speed(iter/s)": 0.466525 }, { "epoch": 0.6181818181818182, "grad_norm": 3.6115214824676514, "learning_rate": 9.20935228140409e-06, "loss": 1.5188591957092286, "memory(GiB)": 64.44, "step": 850, "token_acc": 0.635885447106955, "train_speed(iter/s)": 0.466588 }, { "epoch": 0.6218181818181818, "grad_norm": 4.478565692901611, "learning_rate": 9.19872593128167e-06, "loss": 1.522629451751709, "memory(GiB)": 64.44, "step": 855, "token_acc": 0.6044009779951101, "train_speed(iter/s)": 0.466658 }, { "epoch": 0.6254545454545455, "grad_norm": 3.820162296295166, "learning_rate": 9.188034863973913e-06, "loss": 1.4850282669067383, "memory(GiB)": 64.44, "step": 860, "token_acc": 0.5907387580299786, "train_speed(iter/s)": 0.466569 }, { "epoch": 0.6290909090909091, "grad_norm": 3.6879067420959473, "learning_rate": 9.177279244267902e-06, "loss": 1.5320751190185546, "memory(GiB)": 64.44, "step": 865, "token_acc": 0.6051044083526682, "train_speed(iter/s)": 0.466644 }, { "epoch": 0.6327272727272727, "grad_norm": 4.055009365081787, "learning_rate": 9.166459237945696e-06, "loss": 1.5284514427185059, "memory(GiB)": 64.44, "step": 870, "token_acc": 0.6201756177251379, "train_speed(iter/s)": 0.46667 }, { "epoch": 0.6363636363636364, "grad_norm": 4.183087348937988, "learning_rate": 9.155575011781779e-06, "loss": 1.554479217529297, "memory(GiB)": 64.44, "step": 875, "token_acc": 0.6525652565256526, "train_speed(iter/s)": 0.466644 }, { "epoch": 0.64, "grad_norm": 3.3368186950683594, "learning_rate": 9.14462673354049e-06, "loss": 1.497207260131836, "memory(GiB)": 64.44, "step": 880, "token_acc": 0.5918765866041789, "train_speed(iter/s)": 0.466658 }, { "epoch": 0.6436363636363637, "grad_norm": 3.610478401184082, "learning_rate": 9.133614571973436e-06, "loss": 1.5291955947875977, "memory(GiB)": 64.44, "step": 885, "token_acc": 0.628099173553719, "train_speed(iter/s)": 0.466633 }, { "epoch": 0.6472727272727272, "grad_norm": 3.1254570484161377, "learning_rate": 9.122538696816896e-06, "loss": 1.5357439041137695, "memory(GiB)": 64.44, "step": 890, "token_acc": 0.6493339063171465, "train_speed(iter/s)": 0.466674 }, { "epoch": 0.6509090909090909, "grad_norm": 3.9878220558166504, "learning_rate": 9.111399278789193e-06, "loss": 1.4707233428955078, "memory(GiB)": 64.44, "step": 895, "token_acc": 0.6466725043782837, "train_speed(iter/s)": 0.466691 }, { "epoch": 0.6545454545454545, "grad_norm": 4.023503303527832, "learning_rate": 9.100196489588076e-06, "loss": 1.5020041465759277, "memory(GiB)": 64.44, "step": 900, "token_acc": 0.6528338136407301, "train_speed(iter/s)": 0.466756 }, { "epoch": 0.6581818181818182, "grad_norm": 3.8978965282440186, "learning_rate": 9.088930501888064e-06, "loss": 1.533686637878418, "memory(GiB)": 64.44, "step": 905, "token_acc": 0.6118152524167562, "train_speed(iter/s)": 0.466876 }, { "epoch": 0.6618181818181819, "grad_norm": 3.952993154525757, "learning_rate": 9.077601489337788e-06, "loss": 1.5572603225708008, "memory(GiB)": 64.44, "step": 910, "token_acc": 0.6244158878504673, "train_speed(iter/s)": 0.466842 }, { "epoch": 0.6654545454545454, "grad_norm": 3.9382662773132324, "learning_rate": 9.066209626557318e-06, "loss": 1.5762770652770997, "memory(GiB)": 64.44, "step": 915, "token_acc": 0.5991866244916403, "train_speed(iter/s)": 0.466835 }, { "epoch": 0.6690909090909091, "grad_norm": 4.0595808029174805, "learning_rate": 9.054755089135463e-06, "loss": 1.486503791809082, "memory(GiB)": 64.44, "step": 920, "token_acc": 0.6291459369817579, "train_speed(iter/s)": 0.466902 }, { "epoch": 0.6727272727272727, "grad_norm": 3.5437912940979004, "learning_rate": 9.043238053627073e-06, "loss": 1.4707436561584473, "memory(GiB)": 64.44, "step": 925, "token_acc": 0.6164813919768004, "train_speed(iter/s)": 0.466968 }, { "epoch": 0.6763636363636364, "grad_norm": 3.699765920639038, "learning_rate": 9.031658697550311e-06, "loss": 1.5214021682739258, "memory(GiB)": 64.44, "step": 930, "token_acc": 0.6087981146897093, "train_speed(iter/s)": 0.467078 }, { "epoch": 0.68, "grad_norm": 3.693669557571411, "learning_rate": 9.020017199383926e-06, "loss": 1.4087844848632813, "memory(GiB)": 64.44, "step": 935, "token_acc": 0.6391267123287672, "train_speed(iter/s)": 0.467101 }, { "epoch": 0.6836363636363636, "grad_norm": 3.6385085582733154, "learning_rate": 9.008313738564485e-06, "loss": 1.3953245162963868, "memory(GiB)": 64.44, "step": 940, "token_acc": 0.6613488034807832, "train_speed(iter/s)": 0.46707 }, { "epoch": 0.6872727272727273, "grad_norm": 3.7062394618988037, "learning_rate": 8.996548495483627e-06, "loss": 1.57774019241333, "memory(GiB)": 64.44, "step": 945, "token_acc": 0.6061627347135291, "train_speed(iter/s)": 0.466985 }, { "epoch": 0.6909090909090909, "grad_norm": 4.307070732116699, "learning_rate": 8.984721651485276e-06, "loss": 1.5156424522399903, "memory(GiB)": 64.44, "step": 950, "token_acc": 0.6389528795811519, "train_speed(iter/s)": 0.467075 }, { "epoch": 0.6945454545454546, "grad_norm": 4.296825408935547, "learning_rate": 8.972833388862835e-06, "loss": 1.465583324432373, "memory(GiB)": 64.44, "step": 955, "token_acc": 0.6539109912339852, "train_speed(iter/s)": 0.467103 }, { "epoch": 0.6981818181818182, "grad_norm": 3.43802809715271, "learning_rate": 8.960883890856387e-06, "loss": 1.4816664695739745, "memory(GiB)": 64.44, "step": 960, "token_acc": 0.625, "train_speed(iter/s)": 0.467064 }, { "epoch": 0.7018181818181818, "grad_norm": 3.5750675201416016, "learning_rate": 8.948873341649873e-06, "loss": 1.4105497360229493, "memory(GiB)": 64.44, "step": 965, "token_acc": 0.6611288604898828, "train_speed(iter/s)": 0.466926 }, { "epoch": 0.7054545454545454, "grad_norm": 3.355591058731079, "learning_rate": 8.936801926368245e-06, "loss": 1.4713809013366699, "memory(GiB)": 64.44, "step": 970, "token_acc": 0.6177150192554557, "train_speed(iter/s)": 0.466928 }, { "epoch": 0.7090909090909091, "grad_norm": 3.269821882247925, "learning_rate": 8.924669831074617e-06, "loss": 1.5545562744140624, "memory(GiB)": 64.44, "step": 975, "token_acc": 0.6235870384325546, "train_speed(iter/s)": 0.466981 }, { "epoch": 0.7127272727272728, "grad_norm": 3.8328733444213867, "learning_rate": 8.912477242767395e-06, "loss": 1.4566053390502929, "memory(GiB)": 64.44, "step": 980, "token_acc": 0.6365413860525744, "train_speed(iter/s)": 0.466921 }, { "epoch": 0.7163636363636363, "grad_norm": 3.6056768894195557, "learning_rate": 8.900224349377396e-06, "loss": 1.5423126220703125, "memory(GiB)": 64.44, "step": 985, "token_acc": 0.6146384479717814, "train_speed(iter/s)": 0.466988 }, { "epoch": 0.72, "grad_norm": 3.902472972869873, "learning_rate": 8.887911339764954e-06, "loss": 1.5114011764526367, "memory(GiB)": 64.44, "step": 990, "token_acc": 0.623652942801879, "train_speed(iter/s)": 0.467217 }, { "epoch": 0.7236363636363636, "grad_norm": 3.429377794265747, "learning_rate": 8.875538403717003e-06, "loss": 1.498643398284912, "memory(GiB)": 64.44, "step": 995, "token_acc": 0.6255022203425671, "train_speed(iter/s)": 0.467293 }, { "epoch": 0.7272727272727273, "grad_norm": 4.113056659698486, "learning_rate": 8.863105731944153e-06, "loss": 1.5103962898254395, "memory(GiB)": 64.44, "step": 1000, "token_acc": 0.6358121770388677, "train_speed(iter/s)": 0.467345 }, { "epoch": 0.730909090909091, "grad_norm": 3.749250888824463, "learning_rate": 8.85061351607776e-06, "loss": 1.4655189514160156, "memory(GiB)": 64.44, "step": 1005, "token_acc": 0.6587071876507478, "train_speed(iter/s)": 0.467499 }, { "epoch": 0.7345454545454545, "grad_norm": 3.5996060371398926, "learning_rate": 8.838061948666956e-06, "loss": 1.523210334777832, "memory(GiB)": 64.44, "step": 1010, "token_acc": 0.6319569120287253, "train_speed(iter/s)": 0.467546 }, { "epoch": 0.7381818181818182, "grad_norm": 3.7059760093688965, "learning_rate": 8.825451223175697e-06, "loss": 1.4700775146484375, "memory(GiB)": 64.44, "step": 1015, "token_acc": 0.6333166583291646, "train_speed(iter/s)": 0.467627 }, { "epoch": 0.7418181818181818, "grad_norm": 4.267899990081787, "learning_rate": 8.812781533979766e-06, "loss": 1.494734764099121, "memory(GiB)": 64.44, "step": 1020, "token_acc": 0.6311154598825832, "train_speed(iter/s)": 0.467767 }, { "epoch": 0.7454545454545455, "grad_norm": 3.691187620162964, "learning_rate": 8.800053076363792e-06, "loss": 1.4671652793884278, "memory(GiB)": 64.44, "step": 1025, "token_acc": 0.6183923110528615, "train_speed(iter/s)": 0.467891 }, { "epoch": 0.7490909090909091, "grad_norm": 3.3653814792633057, "learning_rate": 8.78726604651823e-06, "loss": 1.4787571907043457, "memory(GiB)": 64.44, "step": 1030, "token_acc": 0.6354618722876627, "train_speed(iter/s)": 0.467916 }, { "epoch": 0.7527272727272727, "grad_norm": 3.4715375900268555, "learning_rate": 8.774420641536337e-06, "loss": 1.4089265823364259, "memory(GiB)": 64.44, "step": 1035, "token_acc": 0.6256326825741142, "train_speed(iter/s)": 0.467973 }, { "epoch": 0.7563636363636363, "grad_norm": 3.5086214542388916, "learning_rate": 8.761517059411144e-06, "loss": 1.4492218017578125, "memory(GiB)": 64.44, "step": 1040, "token_acc": 0.6436498150431565, "train_speed(iter/s)": 0.467852 }, { "epoch": 0.76, "grad_norm": 3.7965283393859863, "learning_rate": 8.74855549903239e-06, "loss": 1.4732137680053712, "memory(GiB)": 64.44, "step": 1045, "token_acc": 0.6451612903225806, "train_speed(iter/s)": 0.467928 }, { "epoch": 0.7636363636363637, "grad_norm": 4.0382232666015625, "learning_rate": 8.735536160183464e-06, "loss": 1.5476658821105957, "memory(GiB)": 64.44, "step": 1050, "token_acc": 0.6137471146447807, "train_speed(iter/s)": 0.468098 }, { "epoch": 0.7672727272727272, "grad_norm": 3.921508312225342, "learning_rate": 8.722459243538333e-06, "loss": 1.4485240936279298, "memory(GiB)": 64.44, "step": 1055, "token_acc": 0.6001534919416731, "train_speed(iter/s)": 0.468144 }, { "epoch": 0.7709090909090909, "grad_norm": 3.7814698219299316, "learning_rate": 8.709324950658432e-06, "loss": 1.545788288116455, "memory(GiB)": 64.44, "step": 1060, "token_acc": 0.6441542542338299, "train_speed(iter/s)": 0.468211 }, { "epoch": 0.7745454545454545, "grad_norm": 3.402313232421875, "learning_rate": 8.69613348398957e-06, "loss": 1.428826904296875, "memory(GiB)": 64.44, "step": 1065, "token_acc": 0.6991242702251876, "train_speed(iter/s)": 0.468195 }, { "epoch": 0.7781818181818182, "grad_norm": 3.5627617835998535, "learning_rate": 8.682885046858803e-06, "loss": 1.4530531883239746, "memory(GiB)": 64.44, "step": 1070, "token_acc": 0.6563146997929606, "train_speed(iter/s)": 0.468226 }, { "epoch": 0.7818181818181819, "grad_norm": 3.311058521270752, "learning_rate": 8.66957984347131e-06, "loss": 1.5207694053649903, "memory(GiB)": 64.44, "step": 1075, "token_acc": 0.666245487364621, "train_speed(iter/s)": 0.46826 }, { "epoch": 0.7854545454545454, "grad_norm": 3.9101316928863525, "learning_rate": 8.65621807890723e-06, "loss": 1.4987771034240722, "memory(GiB)": 64.44, "step": 1080, "token_acc": 0.6131436314363143, "train_speed(iter/s)": 0.468199 }, { "epoch": 0.7890909090909091, "grad_norm": 4.084334850311279, "learning_rate": 8.642799959118517e-06, "loss": 1.4973735809326172, "memory(GiB)": 64.44, "step": 1085, "token_acc": 0.6244131455399061, "train_speed(iter/s)": 0.468307 }, { "epoch": 0.7927272727272727, "grad_norm": 3.905789852142334, "learning_rate": 8.62932569092575e-06, "loss": 1.5306825637817383, "memory(GiB)": 64.44, "step": 1090, "token_acc": 0.6427216047709406, "train_speed(iter/s)": 0.468383 }, { "epoch": 0.7963636363636364, "grad_norm": 3.959667682647705, "learning_rate": 8.61579548201496e-06, "loss": 1.5060791969299316, "memory(GiB)": 64.44, "step": 1095, "token_acc": 0.6090833678971381, "train_speed(iter/s)": 0.468461 }, { "epoch": 0.8, "grad_norm": 3.306290626525879, "learning_rate": 8.602209540934419e-06, "loss": 1.4021387100219727, "memory(GiB)": 64.44, "step": 1100, "token_acc": 0.6274509803921569, "train_speed(iter/s)": 0.468377 }, { "epoch": 0.8036363636363636, "grad_norm": 3.746054172515869, "learning_rate": 8.588568077091427e-06, "loss": 1.468693733215332, "memory(GiB)": 64.44, "step": 1105, "token_acc": 0.6555926872419894, "train_speed(iter/s)": 0.468391 }, { "epoch": 0.8072727272727273, "grad_norm": 3.7214505672454834, "learning_rate": 8.574871300749087e-06, "loss": 1.4309005737304688, "memory(GiB)": 64.44, "step": 1110, "token_acc": 0.65995670995671, "train_speed(iter/s)": 0.468396 }, { "epoch": 0.8109090909090909, "grad_norm": 3.7076361179351807, "learning_rate": 8.561119423023064e-06, "loss": 1.505380344390869, "memory(GiB)": 64.44, "step": 1115, "token_acc": 0.6441098317094774, "train_speed(iter/s)": 0.468426 }, { "epoch": 0.8145454545454546, "grad_norm": 3.645853042602539, "learning_rate": 8.547312655878328e-06, "loss": 1.491251277923584, "memory(GiB)": 64.44, "step": 1120, "token_acc": 0.6742215632281297, "train_speed(iter/s)": 0.468413 }, { "epoch": 0.8181818181818182, "grad_norm": 3.672046661376953, "learning_rate": 8.533451212125891e-06, "loss": 1.489974594116211, "memory(GiB)": 64.44, "step": 1125, "token_acc": 0.6065996390822377, "train_speed(iter/s)": 0.468418 }, { "epoch": 0.8218181818181818, "grad_norm": 3.495356321334839, "learning_rate": 8.519535305419523e-06, "loss": 1.3926969528198243, "memory(GiB)": 64.44, "step": 1130, "token_acc": 0.6418237615081105, "train_speed(iter/s)": 0.468431 }, { "epoch": 0.8254545454545454, "grad_norm": 3.9424312114715576, "learning_rate": 8.505565150252457e-06, "loss": 1.4863405227661133, "memory(GiB)": 64.44, "step": 1135, "token_acc": 0.6287078934137758, "train_speed(iter/s)": 0.468529 }, { "epoch": 0.8290909090909091, "grad_norm": 3.981257438659668, "learning_rate": 8.491540961954094e-06, "loss": 1.5392318725585938, "memory(GiB)": 64.44, "step": 1140, "token_acc": 0.6313190688925464, "train_speed(iter/s)": 0.468624 }, { "epoch": 0.8327272727272728, "grad_norm": 3.6310641765594482, "learning_rate": 8.477462956686669e-06, "loss": 1.413975715637207, "memory(GiB)": 64.44, "step": 1145, "token_acc": 0.6229952093313893, "train_speed(iter/s)": 0.468526 }, { "epoch": 0.8363636363636363, "grad_norm": 3.8132894039154053, "learning_rate": 8.46333135144193e-06, "loss": 1.5765387535095214, "memory(GiB)": 64.44, "step": 1150, "token_acc": 0.6065617497999467, "train_speed(iter/s)": 0.468666 }, { "epoch": 0.84, "grad_norm": 3.9573326110839844, "learning_rate": 8.44914636403779e-06, "loss": 1.4768566131591796, "memory(GiB)": 64.44, "step": 1155, "token_acc": 0.6754981388219838, "train_speed(iter/s)": 0.468646 }, { "epoch": 0.8436363636363636, "grad_norm": 3.644594669342041, "learning_rate": 8.434908213114968e-06, "loss": 1.5181507110595702, "memory(GiB)": 64.44, "step": 1160, "token_acc": 0.6126656848306333, "train_speed(iter/s)": 0.468718 }, { "epoch": 0.8472727272727273, "grad_norm": 3.4235942363739014, "learning_rate": 8.420617118133619e-06, "loss": 1.4143997192382813, "memory(GiB)": 64.44, "step": 1165, "token_acc": 0.6732447817836812, "train_speed(iter/s)": 0.468727 }, { "epoch": 0.850909090909091, "grad_norm": 3.506685256958008, "learning_rate": 8.406273299369955e-06, "loss": 1.5011482238769531, "memory(GiB)": 64.44, "step": 1170, "token_acc": 0.5982627578718784, "train_speed(iter/s)": 0.468796 }, { "epoch": 0.8545454545454545, "grad_norm": 3.982557773590088, "learning_rate": 8.391876977912852e-06, "loss": 1.5165749549865724, "memory(GiB)": 64.44, "step": 1175, "token_acc": 0.6035743298131601, "train_speed(iter/s)": 0.468896 }, { "epoch": 0.8581818181818182, "grad_norm": 3.354018211364746, "learning_rate": 8.377428375660429e-06, "loss": 1.415550136566162, "memory(GiB)": 64.44, "step": 1180, "token_acc": 0.6934698673829108, "train_speed(iter/s)": 0.468771 }, { "epoch": 0.8618181818181818, "grad_norm": 3.8999528884887695, "learning_rate": 8.36292771531664e-06, "loss": 1.4483419418334962, "memory(GiB)": 64.44, "step": 1185, "token_acc": 0.6305418719211823, "train_speed(iter/s)": 0.468762 }, { "epoch": 0.8654545454545455, "grad_norm": 3.604797840118408, "learning_rate": 8.348375220387844e-06, "loss": 1.5333918571472167, "memory(GiB)": 64.44, "step": 1190, "token_acc": 0.638868919242751, "train_speed(iter/s)": 0.468837 }, { "epoch": 0.8690909090909091, "grad_norm": 4.271510601043701, "learning_rate": 8.33377111517934e-06, "loss": 1.5774791717529297, "memory(GiB)": 64.44, "step": 1195, "token_acc": 0.6245067952652346, "train_speed(iter/s)": 0.468963 }, { "epoch": 0.8727272727272727, "grad_norm": 3.8670032024383545, "learning_rate": 8.319115624791942e-06, "loss": 1.5047279357910157, "memory(GiB)": 64.44, "step": 1200, "token_acc": 0.6603565231109008, "train_speed(iter/s)": 0.468686 }, { "epoch": 0.8763636363636363, "grad_norm": 3.6218271255493164, "learning_rate": 8.304408975118474e-06, "loss": 1.5120525360107422, "memory(GiB)": 64.44, "step": 1205, "token_acc": 0.6243169398907104, "train_speed(iter/s)": 0.468828 }, { "epoch": 0.88, "grad_norm": 3.629819631576538, "learning_rate": 8.289651392840314e-06, "loss": 1.516437816619873, "memory(GiB)": 64.44, "step": 1210, "token_acc": 0.6489115331171839, "train_speed(iter/s)": 0.468904 }, { "epoch": 0.8836363636363637, "grad_norm": 3.4970250129699707, "learning_rate": 8.27484310542389e-06, "loss": 1.4951990127563477, "memory(GiB)": 64.44, "step": 1215, "token_acc": 0.622252435984591, "train_speed(iter/s)": 0.46888 }, { "epoch": 0.8872727272727273, "grad_norm": 3.804673910140991, "learning_rate": 8.259984341117175e-06, "loss": 1.4283718109130858, "memory(GiB)": 64.44, "step": 1220, "token_acc": 0.6575117370892019, "train_speed(iter/s)": 0.468919 }, { "epoch": 0.8909090909090909, "grad_norm": 3.604832172393799, "learning_rate": 8.245075328946168e-06, "loss": 1.4775312423706055, "memory(GiB)": 64.44, "step": 1225, "token_acc": 0.6120430107526882, "train_speed(iter/s)": 0.469006 }, { "epoch": 0.8945454545454545, "grad_norm": 3.676591157913208, "learning_rate": 8.230116298711368e-06, "loss": 1.5129100799560546, "memory(GiB)": 64.44, "step": 1230, "token_acc": 0.6314168377823408, "train_speed(iter/s)": 0.469052 }, { "epoch": 0.8981818181818182, "grad_norm": 3.6111202239990234, "learning_rate": 8.21510748098422e-06, "loss": 1.4718162536621093, "memory(GiB)": 64.44, "step": 1235, "token_acc": 0.6146128680479825, "train_speed(iter/s)": 0.469126 }, { "epoch": 0.9018181818181819, "grad_norm": 3.0030624866485596, "learning_rate": 8.200049107103583e-06, "loss": 1.3085548400878906, "memory(GiB)": 64.44, "step": 1240, "token_acc": 0.6549242424242424, "train_speed(iter/s)": 0.469076 }, { "epoch": 0.9054545454545454, "grad_norm": 3.4156432151794434, "learning_rate": 8.18494140917214e-06, "loss": 1.479377555847168, "memory(GiB)": 64.44, "step": 1245, "token_acc": 0.6434093161546085, "train_speed(iter/s)": 0.469066 }, { "epoch": 0.9090909090909091, "grad_norm": 3.6555395126342773, "learning_rate": 8.16978462005284e-06, "loss": 1.4368497848510742, "memory(GiB)": 64.44, "step": 1250, "token_acc": 0.634508348794063, "train_speed(iter/s)": 0.469134 }, { "epoch": 0.9127272727272727, "grad_norm": 3.6969878673553467, "learning_rate": 8.154578973365295e-06, "loss": 1.5231738090515137, "memory(GiB)": 64.44, "step": 1255, "token_acc": 0.6483041693670339, "train_speed(iter/s)": 0.4692 }, { "epoch": 0.9163636363636364, "grad_norm": 4.165112018585205, "learning_rate": 8.139324703482185e-06, "loss": 1.381281852722168, "memory(GiB)": 64.44, "step": 1260, "token_acc": 0.721323395746228, "train_speed(iter/s)": 0.469217 }, { "epoch": 0.92, "grad_norm": 3.383225440979004, "learning_rate": 8.12402204552565e-06, "loss": 1.4503177642822265, "memory(GiB)": 64.44, "step": 1265, "token_acc": 0.6532917802882743, "train_speed(iter/s)": 0.469129 }, { "epoch": 0.9236363636363636, "grad_norm": 3.8582053184509277, "learning_rate": 8.108671235363654e-06, "loss": 1.4586336135864257, "memory(GiB)": 64.44, "step": 1270, "token_acc": 0.6378548895899053, "train_speed(iter/s)": 0.469026 }, { "epoch": 0.9272727272727272, "grad_norm": 3.600813865661621, "learning_rate": 8.093272509606362e-06, "loss": 1.3761531829833984, "memory(GiB)": 64.44, "step": 1275, "token_acc": 0.6523583728475169, "train_speed(iter/s)": 0.468929 }, { "epoch": 0.9309090909090909, "grad_norm": 3.1909162998199463, "learning_rate": 8.077826105602484e-06, "loss": 1.4242467880249023, "memory(GiB)": 64.44, "step": 1280, "token_acc": 0.6917508096780339, "train_speed(iter/s)": 0.468915 }, { "epoch": 0.9345454545454546, "grad_norm": 3.405683755874634, "learning_rate": 8.062332261435623e-06, "loss": 1.5797532081604004, "memory(GiB)": 64.44, "step": 1285, "token_acc": 0.5903821382567626, "train_speed(iter/s)": 0.468972 }, { "epoch": 0.9381818181818182, "grad_norm": 3.5222887992858887, "learning_rate": 8.046791215920598e-06, "loss": 1.4545100212097168, "memory(GiB)": 64.44, "step": 1290, "token_acc": 0.6477043673012318, "train_speed(iter/s)": 0.46901 }, { "epoch": 0.9418181818181818, "grad_norm": 3.5817978382110596, "learning_rate": 8.031203208599773e-06, "loss": 1.534127426147461, "memory(GiB)": 64.44, "step": 1295, "token_acc": 0.6471281792150918, "train_speed(iter/s)": 0.469015 }, { "epoch": 0.9454545454545454, "grad_norm": 3.8275201320648193, "learning_rate": 8.015568479739354e-06, "loss": 1.5303773880004883, "memory(GiB)": 64.44, "step": 1300, "token_acc": 0.6103666245259166, "train_speed(iter/s)": 0.469087 }, { "epoch": 0.9490909090909091, "grad_norm": 3.656036376953125, "learning_rate": 7.999887270325694e-06, "loss": 1.4996587753295898, "memory(GiB)": 64.44, "step": 1305, "token_acc": 0.6306327340649078, "train_speed(iter/s)": 0.469097 }, { "epoch": 0.9527272727272728, "grad_norm": 3.534893035888672, "learning_rate": 7.984159822061572e-06, "loss": 1.3629323959350585, "memory(GiB)": 64.44, "step": 1310, "token_acc": 0.6900225363654989, "train_speed(iter/s)": 0.469074 }, { "epoch": 0.9563636363636364, "grad_norm": 3.609980583190918, "learning_rate": 7.968386377362478e-06, "loss": 1.430015754699707, "memory(GiB)": 64.44, "step": 1315, "token_acc": 0.6487435828154553, "train_speed(iter/s)": 0.469086 }, { "epoch": 0.96, "grad_norm": 3.791590452194214, "learning_rate": 7.95256717935286e-06, "loss": 1.461299514770508, "memory(GiB)": 64.44, "step": 1320, "token_acc": 0.6620127981384526, "train_speed(iter/s)": 0.469157 }, { "epoch": 0.9636363636363636, "grad_norm": 3.705054998397827, "learning_rate": 7.936702471862396e-06, "loss": 1.4849932670593262, "memory(GiB)": 64.44, "step": 1325, "token_acc": 0.6486560614371915, "train_speed(iter/s)": 0.469233 }, { "epoch": 0.9672727272727273, "grad_norm": 3.7390530109405518, "learning_rate": 7.920792499422213e-06, "loss": 1.525192642211914, "memory(GiB)": 64.44, "step": 1330, "token_acc": 0.6327765674170903, "train_speed(iter/s)": 0.469275 }, { "epoch": 0.9709090909090909, "grad_norm": 3.7763898372650146, "learning_rate": 7.904837507261144e-06, "loss": 1.5329397201538086, "memory(GiB)": 64.44, "step": 1335, "token_acc": 0.6480872069107363, "train_speed(iter/s)": 0.469341 }, { "epoch": 0.9745454545454545, "grad_norm": 3.635175943374634, "learning_rate": 7.888837741301928e-06, "loss": 1.4299137115478515, "memory(GiB)": 64.44, "step": 1340, "token_acc": 0.6698178464376296, "train_speed(iter/s)": 0.469276 }, { "epoch": 0.9781818181818182, "grad_norm": 3.436739206314087, "learning_rate": 7.872793448157426e-06, "loss": 1.4139694213867187, "memory(GiB)": 64.44, "step": 1345, "token_acc": 0.6410256410256411, "train_speed(iter/s)": 0.469339 }, { "epoch": 0.9818181818181818, "grad_norm": 3.4722468852996826, "learning_rate": 7.856704875126819e-06, "loss": 1.458078384399414, "memory(GiB)": 64.44, "step": 1350, "token_acc": 0.6286181139122315, "train_speed(iter/s)": 0.469383 }, { "epoch": 0.9854545454545455, "grad_norm": 3.40093994140625, "learning_rate": 7.840572270191803e-06, "loss": 1.4649463653564454, "memory(GiB)": 64.44, "step": 1355, "token_acc": 0.6814643383126446, "train_speed(iter/s)": 0.469484 }, { "epoch": 0.9890909090909091, "grad_norm": 3.787477493286133, "learning_rate": 7.824395882012756e-06, "loss": 1.3931927680969238, "memory(GiB)": 64.44, "step": 1360, "token_acc": 0.6691426146010186, "train_speed(iter/s)": 0.469454 }, { "epoch": 0.9927272727272727, "grad_norm": 3.734520435333252, "learning_rate": 7.808175959924913e-06, "loss": 1.4553655624389648, "memory(GiB)": 64.44, "step": 1365, "token_acc": 0.6351840034035312, "train_speed(iter/s)": 0.469387 }, { "epoch": 0.9963636363636363, "grad_norm": 3.851562023162842, "learning_rate": 7.791912753934516e-06, "loss": 1.4150389671325683, "memory(GiB)": 64.44, "step": 1370, "token_acc": 0.7106060606060606, "train_speed(iter/s)": 0.469419 }, { "epoch": 1.0, "grad_norm": 3.3316128253936768, "learning_rate": 7.775606514714971e-06, "loss": 1.5171707153320313, "memory(GiB)": 64.44, "step": 1375, "token_acc": 0.6147117296222664, "train_speed(iter/s)": 0.469455 }, { "epoch": 1.0036363636363637, "grad_norm": 3.1916940212249756, "learning_rate": 7.759257493602974e-06, "loss": 1.0122819900512696, "memory(GiB)": 64.44, "step": 1380, "token_acc": 0.7368881118881119, "train_speed(iter/s)": 0.45697 }, { "epoch": 1.0072727272727273, "grad_norm": 3.803614854812622, "learning_rate": 7.74286594259464e-06, "loss": 0.9860285758972168, "memory(GiB)": 64.44, "step": 1385, "token_acc": 0.7332010909992561, "train_speed(iter/s)": 0.457105 }, { "epoch": 1.010909090909091, "grad_norm": 3.667937755584717, "learning_rate": 7.726432114341622e-06, "loss": 1.0007999420166016, "memory(GiB)": 64.44, "step": 1390, "token_acc": 0.7341772151898734, "train_speed(iter/s)": 0.457171 }, { "epoch": 1.0145454545454546, "grad_norm": 4.310483455657959, "learning_rate": 7.709956262147212e-06, "loss": 1.0946765899658204, "memory(GiB)": 64.44, "step": 1395, "token_acc": 0.7179426404361223, "train_speed(iter/s)": 0.457209 }, { "epoch": 1.018181818181818, "grad_norm": 3.2957613468170166, "learning_rate": 7.693438639962447e-06, "loss": 1.0460298538208008, "memory(GiB)": 64.44, "step": 1400, "token_acc": 0.7339094837389128, "train_speed(iter/s)": 0.45725 }, { "epoch": 1.0218181818181817, "grad_norm": 4.106925964355469, "learning_rate": 7.676879502382177e-06, "loss": 1.0074480056762696, "memory(GiB)": 64.44, "step": 1405, "token_acc": 0.7509936871638999, "train_speed(iter/s)": 0.457319 }, { "epoch": 1.0254545454545454, "grad_norm": 3.797349452972412, "learning_rate": 7.660279104641154e-06, "loss": 0.9518960952758789, "memory(GiB)": 64.44, "step": 1410, "token_acc": 0.7552194290583724, "train_speed(iter/s)": 0.457307 }, { "epoch": 1.029090909090909, "grad_norm": 3.7703957557678223, "learning_rate": 7.643637702610098e-06, "loss": 1.0913700103759765, "memory(GiB)": 64.44, "step": 1415, "token_acc": 0.7454581752844879, "train_speed(iter/s)": 0.457406 }, { "epoch": 1.0327272727272727, "grad_norm": 3.6022231578826904, "learning_rate": 7.6269555527917485e-06, "loss": 1.0375457763671876, "memory(GiB)": 64.44, "step": 1420, "token_acc": 0.742365352581899, "train_speed(iter/s)": 0.457452 }, { "epoch": 1.0363636363636364, "grad_norm": 4.11036491394043, "learning_rate": 7.610232912316906e-06, "loss": 1.0097059249877929, "memory(GiB)": 64.44, "step": 1425, "token_acc": 0.7417205169628432, "train_speed(iter/s)": 0.457507 }, { "epoch": 1.04, "grad_norm": 3.9686105251312256, "learning_rate": 7.593470038940487e-06, "loss": 1.0012422561645509, "memory(GiB)": 64.44, "step": 1430, "token_acc": 0.7476245654692931, "train_speed(iter/s)": 0.457603 }, { "epoch": 1.0436363636363637, "grad_norm": 3.909630298614502, "learning_rate": 7.576667191037525e-06, "loss": 0.9417753219604492, "memory(GiB)": 64.44, "step": 1435, "token_acc": 0.7406999779881136, "train_speed(iter/s)": 0.457645 }, { "epoch": 1.0472727272727274, "grad_norm": 3.4653851985931396, "learning_rate": 7.5598246275992145e-06, "loss": 1.0239160537719727, "memory(GiB)": 64.44, "step": 1440, "token_acc": 0.7312540055543687, "train_speed(iter/s)": 0.457633 }, { "epoch": 1.050909090909091, "grad_norm": 3.6743690967559814, "learning_rate": 7.5429426082289e-06, "loss": 0.9335263252258301, "memory(GiB)": 64.44, "step": 1445, "token_acc": 0.7262321144674085, "train_speed(iter/s)": 0.45757 }, { "epoch": 1.0545454545454545, "grad_norm": 3.187088966369629, "learning_rate": 7.526021393138081e-06, "loss": 0.9450448036193848, "memory(GiB)": 64.44, "step": 1450, "token_acc": 0.756238399670035, "train_speed(iter/s)": 0.457549 }, { "epoch": 1.0581818181818181, "grad_norm": 3.3623409271240234, "learning_rate": 7.509061243142406e-06, "loss": 0.9245813369750977, "memory(GiB)": 64.44, "step": 1455, "token_acc": 0.7525731584258325, "train_speed(iter/s)": 0.457493 }, { "epoch": 1.0618181818181818, "grad_norm": 3.6314806938171387, "learning_rate": 7.49206241965764e-06, "loss": 1.0117255210876466, "memory(GiB)": 64.44, "step": 1460, "token_acc": 0.7401989467524869, "train_speed(iter/s)": 0.457535 }, { "epoch": 1.0654545454545454, "grad_norm": 3.7548723220825195, "learning_rate": 7.47502518469565e-06, "loss": 1.0736151695251466, "memory(GiB)": 64.44, "step": 1465, "token_acc": 0.72635998539613, "train_speed(iter/s)": 0.457658 }, { "epoch": 1.069090909090909, "grad_norm": 3.9179763793945312, "learning_rate": 7.457949800860358e-06, "loss": 1.0174610137939453, "memory(GiB)": 64.44, "step": 1470, "token_acc": 0.7323055360896986, "train_speed(iter/s)": 0.457707 }, { "epoch": 1.0727272727272728, "grad_norm": 3.4640631675720215, "learning_rate": 7.440836531343692e-06, "loss": 0.9873522758483887, "memory(GiB)": 64.44, "step": 1475, "token_acc": 0.7806191117092867, "train_speed(iter/s)": 0.4577 }, { "epoch": 1.0763636363636364, "grad_norm": 3.791652202606201, "learning_rate": 7.4236856399215344e-06, "loss": 0.911875057220459, "memory(GiB)": 64.44, "step": 1480, "token_acc": 0.7158859470468432, "train_speed(iter/s)": 0.457776 }, { "epoch": 1.08, "grad_norm": 3.838895082473755, "learning_rate": 7.406497390949652e-06, "loss": 1.0216828346252442, "memory(GiB)": 64.44, "step": 1485, "token_acc": 0.7165523156089194, "train_speed(iter/s)": 0.457843 }, { "epoch": 1.0836363636363637, "grad_norm": 4.171408176422119, "learning_rate": 7.3892720493596284e-06, "loss": 0.974361801147461, "memory(GiB)": 64.44, "step": 1490, "token_acc": 0.7775261324041812, "train_speed(iter/s)": 0.457853 }, { "epoch": 1.0872727272727274, "grad_norm": 3.92596697807312, "learning_rate": 7.372009880654767e-06, "loss": 0.9939946174621582, "memory(GiB)": 64.44, "step": 1495, "token_acc": 0.7887160436498724, "train_speed(iter/s)": 0.457899 }, { "epoch": 1.0909090909090908, "grad_norm": 3.189763069152832, "learning_rate": 7.3547111509060145e-06, "loss": 1.0516817092895507, "memory(GiB)": 64.44, "step": 1500, "token_acc": 0.7391479911164951, "train_speed(iter/s)": 0.45792 }, { "epoch": 1.0945454545454545, "grad_norm": 3.6382617950439453, "learning_rate": 7.337376126747849e-06, "loss": 0.994780158996582, "memory(GiB)": 64.44, "step": 1505, "token_acc": 0.7239606616003577, "train_speed(iter/s)": 0.45794 }, { "epoch": 1.0981818181818181, "grad_norm": 3.5191988945007324, "learning_rate": 7.320005075374173e-06, "loss": 0.9538056373596191, "memory(GiB)": 64.44, "step": 1510, "token_acc": 0.7650323774283071, "train_speed(iter/s)": 0.457938 }, { "epoch": 1.1018181818181818, "grad_norm": 3.722946882247925, "learning_rate": 7.302598264534197e-06, "loss": 0.9156055450439453, "memory(GiB)": 64.44, "step": 1515, "token_acc": 0.7966154323862754, "train_speed(iter/s)": 0.457866 }, { "epoch": 1.1054545454545455, "grad_norm": 4.167759418487549, "learning_rate": 7.285155962528312e-06, "loss": 1.0325860977172852, "memory(GiB)": 64.44, "step": 1520, "token_acc": 0.7377584330794341, "train_speed(iter/s)": 0.457908 }, { "epoch": 1.1090909090909091, "grad_norm": 3.5554070472717285, "learning_rate": 7.267678438203949e-06, "loss": 0.9901115417480468, "memory(GiB)": 64.44, "step": 1525, "token_acc": 0.7337373737373737, "train_speed(iter/s)": 0.457998 }, { "epoch": 1.1127272727272728, "grad_norm": 3.368116855621338, "learning_rate": 7.250165960951445e-06, "loss": 1.0267613410949707, "memory(GiB)": 64.44, "step": 1530, "token_acc": 0.7259731691224983, "train_speed(iter/s)": 0.457928 }, { "epoch": 1.1163636363636364, "grad_norm": 3.9949262142181396, "learning_rate": 7.23261880069988e-06, "loss": 0.9667708396911621, "memory(GiB)": 64.44, "step": 1535, "token_acc": 0.7625673249551167, "train_speed(iter/s)": 0.457977 }, { "epoch": 1.12, "grad_norm": 3.527697801589966, "learning_rate": 7.2150372279129245e-06, "loss": 1.0338319778442382, "memory(GiB)": 64.44, "step": 1540, "token_acc": 0.7121308689186319, "train_speed(iter/s)": 0.458058 }, { "epoch": 1.1236363636363635, "grad_norm": 3.553553342819214, "learning_rate": 7.197421513584666e-06, "loss": 0.9568606376647949, "memory(GiB)": 64.44, "step": 1545, "token_acc": 0.761969904240766, "train_speed(iter/s)": 0.458148 }, { "epoch": 1.1272727272727272, "grad_norm": 3.8653059005737305, "learning_rate": 7.179771929235433e-06, "loss": 1.0294866561889648, "memory(GiB)": 64.44, "step": 1550, "token_acc": 0.702284064058808, "train_speed(iter/s)": 0.458233 }, { "epoch": 1.1309090909090909, "grad_norm": 3.653136730194092, "learning_rate": 7.162088746907613e-06, "loss": 1.0458011627197266, "memory(GiB)": 64.44, "step": 1555, "token_acc": 0.7369407982855612, "train_speed(iter/s)": 0.458366 }, { "epoch": 1.1345454545454545, "grad_norm": 3.158511161804199, "learning_rate": 7.144372239161454e-06, "loss": 1.0241386413574218, "memory(GiB)": 64.44, "step": 1560, "token_acc": 0.7366296670030272, "train_speed(iter/s)": 0.458393 }, { "epoch": 1.1381818181818182, "grad_norm": 3.6491730213165283, "learning_rate": 7.126622679070872e-06, "loss": 0.9555923461914062, "memory(GiB)": 64.44, "step": 1565, "token_acc": 0.739185110663984, "train_speed(iter/s)": 0.458359 }, { "epoch": 1.1418181818181818, "grad_norm": 3.801968812942505, "learning_rate": 7.10884034021923e-06, "loss": 1.0447402000427246, "memory(GiB)": 64.44, "step": 1570, "token_acc": 0.7483831851253031, "train_speed(iter/s)": 0.458391 }, { "epoch": 1.1454545454545455, "grad_norm": 3.7026801109313965, "learning_rate": 7.091025496695127e-06, "loss": 0.9554638862609863, "memory(GiB)": 64.44, "step": 1575, "token_acc": 0.737876254180602, "train_speed(iter/s)": 0.458447 }, { "epoch": 1.1490909090909092, "grad_norm": 4.218850135803223, "learning_rate": 7.073178423088178e-06, "loss": 0.9791478157043457, "memory(GiB)": 64.44, "step": 1580, "token_acc": 0.7147259520140876, "train_speed(iter/s)": 0.458542 }, { "epoch": 1.1527272727272728, "grad_norm": 3.852479934692383, "learning_rate": 7.055299394484778e-06, "loss": 1.109478759765625, "memory(GiB)": 64.44, "step": 1585, "token_acc": 0.7238214434710054, "train_speed(iter/s)": 0.458621 }, { "epoch": 1.1563636363636363, "grad_norm": 3.196315288543701, "learning_rate": 7.037388686463856e-06, "loss": 0.9640076637268067, "memory(GiB)": 64.44, "step": 1590, "token_acc": 0.7785083213478529, "train_speed(iter/s)": 0.458629 }, { "epoch": 1.16, "grad_norm": 3.4316623210906982, "learning_rate": 7.0194465750926385e-06, "loss": 1.0183427810668946, "memory(GiB)": 64.44, "step": 1595, "token_acc": 0.7284430410493078, "train_speed(iter/s)": 0.458714 }, { "epoch": 1.1636363636363636, "grad_norm": 3.760284423828125, "learning_rate": 7.001473336922382e-06, "loss": 0.9476146697998047, "memory(GiB)": 64.44, "step": 1600, "token_acc": 0.7497454693545103, "train_speed(iter/s)": 0.458727 }, { "epoch": 1.1672727272727272, "grad_norm": 3.6320013999938965, "learning_rate": 6.983469248984125e-06, "loss": 0.9717130661010742, "memory(GiB)": 64.44, "step": 1605, "token_acc": 0.7795737122557727, "train_speed(iter/s)": 0.458757 }, { "epoch": 1.170909090909091, "grad_norm": 3.9939889907836914, "learning_rate": 6.965434588784401e-06, "loss": 1.0135496139526368, "memory(GiB)": 64.44, "step": 1610, "token_acc": 0.716100659662839, "train_speed(iter/s)": 0.458863 }, { "epoch": 1.1745454545454546, "grad_norm": 3.6845226287841797, "learning_rate": 6.947369634300974e-06, "loss": 1.0554584503173827, "memory(GiB)": 64.44, "step": 1615, "token_acc": 0.7110694183864915, "train_speed(iter/s)": 0.458836 }, { "epoch": 1.1781818181818182, "grad_norm": 3.7763588428497314, "learning_rate": 6.9292746639785534e-06, "loss": 0.9863467216491699, "memory(GiB)": 64.44, "step": 1620, "token_acc": 0.7300349556332347, "train_speed(iter/s)": 0.458949 }, { "epoch": 1.1818181818181819, "grad_norm": 3.6125032901763916, "learning_rate": 6.911149956724494e-06, "loss": 1.057917594909668, "memory(GiB)": 64.44, "step": 1625, "token_acc": 0.6973138239790347, "train_speed(iter/s)": 0.459007 }, { "epoch": 1.1854545454545455, "grad_norm": 3.32602858543396, "learning_rate": 6.8929957919044995e-06, "loss": 1.1337769508361817, "memory(GiB)": 64.44, "step": 1630, "token_acc": 0.7133373566686784, "train_speed(iter/s)": 0.459083 }, { "epoch": 1.189090909090909, "grad_norm": 3.699726104736328, "learning_rate": 6.874812449338328e-06, "loss": 0.9991239547729492, "memory(GiB)": 64.44, "step": 1635, "token_acc": 0.7829614604462475, "train_speed(iter/s)": 0.459088 }, { "epoch": 1.1927272727272726, "grad_norm": 3.956362724304199, "learning_rate": 6.856600209295459e-06, "loss": 0.9848535537719727, "memory(GiB)": 64.44, "step": 1640, "token_acc": 0.7056864144658577, "train_speed(iter/s)": 0.459203 }, { "epoch": 1.1963636363636363, "grad_norm": 4.043876647949219, "learning_rate": 6.838359352490789e-06, "loss": 1.076396656036377, "memory(GiB)": 64.44, "step": 1645, "token_acc": 0.7244575521381925, "train_speed(iter/s)": 0.45924 }, { "epoch": 1.2, "grad_norm": 3.5813117027282715, "learning_rate": 6.820090160080301e-06, "loss": 1.1189224243164062, "memory(GiB)": 64.44, "step": 1650, "token_acc": 0.6809587217043941, "train_speed(iter/s)": 0.459232 }, { "epoch": 1.2036363636363636, "grad_norm": 3.6248674392700195, "learning_rate": 6.80179291365673e-06, "loss": 1.0456843376159668, "memory(GiB)": 64.44, "step": 1655, "token_acc": 0.7274615704196095, "train_speed(iter/s)": 0.459302 }, { "epoch": 1.2072727272727273, "grad_norm": 4.285236835479736, "learning_rate": 6.783467895245216e-06, "loss": 1.062920093536377, "memory(GiB)": 64.44, "step": 1660, "token_acc": 0.76859151928404, "train_speed(iter/s)": 0.459361 }, { "epoch": 1.210909090909091, "grad_norm": 4.260605335235596, "learning_rate": 6.76511538729897e-06, "loss": 1.0169434547424316, "memory(GiB)": 64.44, "step": 1665, "token_acc": 0.7671654929577465, "train_speed(iter/s)": 0.459392 }, { "epoch": 1.2145454545454546, "grad_norm": 3.5965423583984375, "learning_rate": 6.746735672694915e-06, "loss": 1.0033367156982422, "memory(GiB)": 64.44, "step": 1670, "token_acc": 0.7534195240771969, "train_speed(iter/s)": 0.459393 }, { "epoch": 1.2181818181818183, "grad_norm": 3.6282148361206055, "learning_rate": 6.728329034729316e-06, "loss": 1.0619688034057617, "memory(GiB)": 64.44, "step": 1675, "token_acc": 0.7052186177715092, "train_speed(iter/s)": 0.459452 }, { "epoch": 1.221818181818182, "grad_norm": 3.6731245517730713, "learning_rate": 6.709895757113432e-06, "loss": 0.9825057983398438, "memory(GiB)": 64.44, "step": 1680, "token_acc": 0.7467287646928366, "train_speed(iter/s)": 0.459543 }, { "epoch": 1.2254545454545456, "grad_norm": 3.2094638347625732, "learning_rate": 6.691436123969126e-06, "loss": 1.0286219596862793, "memory(GiB)": 64.44, "step": 1685, "token_acc": 0.706904435299497, "train_speed(iter/s)": 0.459495 }, { "epoch": 1.229090909090909, "grad_norm": 3.4451398849487305, "learning_rate": 6.6729504198244935e-06, "loss": 1.028489589691162, "memory(GiB)": 64.44, "step": 1690, "token_acc": 0.7215537259869116, "train_speed(iter/s)": 0.459581 }, { "epoch": 1.2327272727272727, "grad_norm": 3.6798651218414307, "learning_rate": 6.654438929609481e-06, "loss": 1.0026846885681153, "memory(GiB)": 64.44, "step": 1695, "token_acc": 0.7153620761825031, "train_speed(iter/s)": 0.459647 }, { "epoch": 1.2363636363636363, "grad_norm": 3.6463124752044678, "learning_rate": 6.635901938651485e-06, "loss": 1.0815553665161133, "memory(GiB)": 64.44, "step": 1700, "token_acc": 0.7078901805589909, "train_speed(iter/s)": 0.459704 }, { "epoch": 1.24, "grad_norm": 3.657982110977173, "learning_rate": 6.6173397326709575e-06, "loss": 1.0929712295532226, "memory(GiB)": 64.44, "step": 1705, "token_acc": 0.7036560247167868, "train_speed(iter/s)": 0.459738 }, { "epoch": 1.2436363636363637, "grad_norm": 3.6304128170013428, "learning_rate": 6.59875259777701e-06, "loss": 1.0496492385864258, "memory(GiB)": 64.44, "step": 1710, "token_acc": 0.7248382057576434, "train_speed(iter/s)": 0.459763 }, { "epoch": 1.2472727272727273, "grad_norm": 3.586535930633545, "learning_rate": 6.580140820462983e-06, "loss": 1.0112442016601562, "memory(GiB)": 64.44, "step": 1715, "token_acc": 0.7460452457901003, "train_speed(iter/s)": 0.459713 }, { "epoch": 1.250909090909091, "grad_norm": 3.4018948078155518, "learning_rate": 6.561504687602061e-06, "loss": 1.006149959564209, "memory(GiB)": 64.44, "step": 1720, "token_acc": 0.7438073394495412, "train_speed(iter/s)": 0.4598 }, { "epoch": 1.2545454545454544, "grad_norm": 3.9034860134124756, "learning_rate": 6.542844486442821e-06, "loss": 1.0216346740722657, "memory(GiB)": 64.44, "step": 1725, "token_acc": 0.7470520231213873, "train_speed(iter/s)": 0.459865 }, { "epoch": 1.2581818181818183, "grad_norm": 3.6191561222076416, "learning_rate": 6.52416050460482e-06, "loss": 1.0998344421386719, "memory(GiB)": 64.44, "step": 1730, "token_acc": 0.678407350689127, "train_speed(iter/s)": 0.459933 }, { "epoch": 1.2618181818181817, "grad_norm": 3.7334041595458984, "learning_rate": 6.505453030074161e-06, "loss": 1.0943750381469726, "memory(GiB)": 64.44, "step": 1735, "token_acc": 0.7359395168725797, "train_speed(iter/s)": 0.45994 }, { "epoch": 1.2654545454545454, "grad_norm": 3.683525562286377, "learning_rate": 6.486722351199053e-06, "loss": 0.999393081665039, "memory(GiB)": 64.44, "step": 1740, "token_acc": 0.7622227008399741, "train_speed(iter/s)": 0.459977 }, { "epoch": 1.269090909090909, "grad_norm": 3.8208823204040527, "learning_rate": 6.4679687566853635e-06, "loss": 0.9925840377807618, "memory(GiB)": 64.44, "step": 1745, "token_acc": 0.7400342906129447, "train_speed(iter/s)": 0.459979 }, { "epoch": 1.2727272727272727, "grad_norm": 3.513150691986084, "learning_rate": 6.449192535592171e-06, "loss": 1.0545754432678223, "memory(GiB)": 64.44, "step": 1750, "token_acc": 0.7310440651052005, "train_speed(iter/s)": 0.46002 }, { "epoch": 1.2763636363636364, "grad_norm": 3.7287533283233643, "learning_rate": 6.43039397732731e-06, "loss": 1.0397346496582032, "memory(GiB)": 64.44, "step": 1755, "token_acc": 0.7179717298631366, "train_speed(iter/s)": 0.460084 }, { "epoch": 1.28, "grad_norm": 3.5868330001831055, "learning_rate": 6.411573371642913e-06, "loss": 0.9834535598754883, "memory(GiB)": 64.44, "step": 1760, "token_acc": 0.7371490280777537, "train_speed(iter/s)": 0.460105 }, { "epoch": 1.2836363636363637, "grad_norm": 4.112300395965576, "learning_rate": 6.392731008630933e-06, "loss": 1.0012317657470704, "memory(GiB)": 64.44, "step": 1765, "token_acc": 0.7569250590508911, "train_speed(iter/s)": 0.460219 }, { "epoch": 1.2872727272727273, "grad_norm": 3.2801835536956787, "learning_rate": 6.373867178718692e-06, "loss": 1.0033071517944336, "memory(GiB)": 64.44, "step": 1770, "token_acc": 0.7949538693278102, "train_speed(iter/s)": 0.460253 }, { "epoch": 1.290909090909091, "grad_norm": 3.687485694885254, "learning_rate": 6.3549821726643765e-06, "loss": 0.9472185134887695, "memory(GiB)": 64.44, "step": 1775, "token_acc": 0.7774779636625292, "train_speed(iter/s)": 0.460162 }, { "epoch": 1.2945454545454544, "grad_norm": 3.748479127883911, "learning_rate": 6.33607628155259e-06, "loss": 0.9887983322143554, "memory(GiB)": 64.44, "step": 1780, "token_acc": 0.7205817540766858, "train_speed(iter/s)": 0.460233 }, { "epoch": 1.298181818181818, "grad_norm": 3.500528335571289, "learning_rate": 6.317149796789835e-06, "loss": 1.0536639213562011, "memory(GiB)": 64.44, "step": 1785, "token_acc": 0.7099773242630385, "train_speed(iter/s)": 0.460317 }, { "epoch": 1.3018181818181818, "grad_norm": 3.8819491863250732, "learning_rate": 6.298203010100041e-06, "loss": 1.042212677001953, "memory(GiB)": 64.44, "step": 1790, "token_acc": 0.7374644186555726, "train_speed(iter/s)": 0.460343 }, { "epoch": 1.3054545454545454, "grad_norm": 3.779406785964966, "learning_rate": 6.279236213520062e-06, "loss": 1.0398897171020507, "memory(GiB)": 64.44, "step": 1795, "token_acc": 0.7061352090660414, "train_speed(iter/s)": 0.460419 }, { "epoch": 1.309090909090909, "grad_norm": 3.7476646900177, "learning_rate": 6.260249699395172e-06, "loss": 0.9859634399414062, "memory(GiB)": 64.44, "step": 1800, "token_acc": 0.7423469387755102, "train_speed(iter/s)": 0.460492 }, { "epoch": 1.3127272727272727, "grad_norm": 3.867429494857788, "learning_rate": 6.241243760374562e-06, "loss": 0.9892477035522461, "memory(GiB)": 64.44, "step": 1805, "token_acc": 0.7313289927230946, "train_speed(iter/s)": 0.460545 }, { "epoch": 1.3163636363636364, "grad_norm": 3.5159947872161865, "learning_rate": 6.222218689406834e-06, "loss": 1.0133953094482422, "memory(GiB)": 64.44, "step": 1810, "token_acc": 0.7424869037772264, "train_speed(iter/s)": 0.460663 }, { "epoch": 1.32, "grad_norm": 4.202282905578613, "learning_rate": 6.203174779735476e-06, "loss": 1.1178067207336426, "memory(GiB)": 64.44, "step": 1815, "token_acc": 0.7210046786505787, "train_speed(iter/s)": 0.460744 }, { "epoch": 1.3236363636363637, "grad_norm": 3.0678062438964844, "learning_rate": 6.184112324894348e-06, "loss": 0.9732847213745117, "memory(GiB)": 64.44, "step": 1820, "token_acc": 0.7407130856822849, "train_speed(iter/s)": 0.46078 }, { "epoch": 1.3272727272727272, "grad_norm": 3.376113176345825, "learning_rate": 6.165031618703159e-06, "loss": 0.9729133605957031, "memory(GiB)": 64.44, "step": 1825, "token_acc": 0.797998366013072, "train_speed(iter/s)": 0.460756 }, { "epoch": 1.330909090909091, "grad_norm": 3.703918695449829, "learning_rate": 6.145932955262931e-06, "loss": 0.8784601211547851, "memory(GiB)": 64.44, "step": 1830, "token_acc": 0.751122754491018, "train_speed(iter/s)": 0.46079 }, { "epoch": 1.3345454545454545, "grad_norm": 3.489109516143799, "learning_rate": 6.126816628951476e-06, "loss": 1.028179931640625, "memory(GiB)": 64.44, "step": 1835, "token_acc": 0.7180817936474985, "train_speed(iter/s)": 0.460839 }, { "epoch": 1.3381818181818181, "grad_norm": 3.857232093811035, "learning_rate": 6.107682934418847e-06, "loss": 0.9387928009033203, "memory(GiB)": 64.44, "step": 1840, "token_acc": 0.7655922181956895, "train_speed(iter/s)": 0.46081 }, { "epoch": 1.3418181818181818, "grad_norm": 3.459693193435669, "learning_rate": 6.088532166582809e-06, "loss": 1.0774751663208009, "memory(GiB)": 64.44, "step": 1845, "token_acc": 0.7526041666666666, "train_speed(iter/s)": 0.46086 }, { "epoch": 1.3454545454545455, "grad_norm": 3.9030678272247314, "learning_rate": 6.069364620624284e-06, "loss": 1.0519866943359375, "memory(GiB)": 64.44, "step": 1850, "token_acc": 0.7056686046511628, "train_speed(iter/s)": 0.460949 }, { "epoch": 1.3490909090909091, "grad_norm": 3.601980686187744, "learning_rate": 6.050180591982802e-06, "loss": 0.9877336502075196, "memory(GiB)": 64.44, "step": 1855, "token_acc": 0.7090541451359245, "train_speed(iter/s)": 0.461034 }, { "epoch": 1.3527272727272728, "grad_norm": 3.5950915813446045, "learning_rate": 6.0309803763519535e-06, "loss": 0.9389093399047852, "memory(GiB)": 64.44, "step": 1860, "token_acc": 0.7330003841721091, "train_speed(iter/s)": 0.460922 }, { "epoch": 1.3563636363636364, "grad_norm": 3.591996908187866, "learning_rate": 6.011764269674823e-06, "loss": 0.9682686805725098, "memory(GiB)": 64.44, "step": 1865, "token_acc": 0.7354409317803661, "train_speed(iter/s)": 0.460944 }, { "epoch": 1.3599999999999999, "grad_norm": 3.609264850616455, "learning_rate": 5.992532568139438e-06, "loss": 1.024522590637207, "memory(GiB)": 64.44, "step": 1870, "token_acc": 0.7284263959390863, "train_speed(iter/s)": 0.461044 }, { "epoch": 1.3636363636363638, "grad_norm": 3.9778711795806885, "learning_rate": 5.973285568174192e-06, "loss": 1.0148784637451171, "memory(GiB)": 64.44, "step": 1875, "token_acc": 0.7046184243022968, "train_speed(iter/s)": 0.461087 }, { "epoch": 1.3672727272727272, "grad_norm": 3.59853196144104, "learning_rate": 5.954023566443283e-06, "loss": 0.9733685493469239, "memory(GiB)": 64.44, "step": 1880, "token_acc": 0.766418046207022, "train_speed(iter/s)": 0.461114 }, { "epoch": 1.3709090909090909, "grad_norm": 3.281967878341675, "learning_rate": 5.934746859842141e-06, "loss": 1.0568039894104004, "memory(GiB)": 64.44, "step": 1885, "token_acc": 0.7198658512527125, "train_speed(iter/s)": 0.461138 }, { "epoch": 1.3745454545454545, "grad_norm": 3.522768974304199, "learning_rate": 5.915455745492849e-06, "loss": 1.0536276817321777, "memory(GiB)": 64.44, "step": 1890, "token_acc": 0.7116860337645253, "train_speed(iter/s)": 0.461185 }, { "epoch": 1.3781818181818182, "grad_norm": 3.975327730178833, "learning_rate": 5.896150520739563e-06, "loss": 0.8941743850708008, "memory(GiB)": 64.44, "step": 1895, "token_acc": 0.7662427745664739, "train_speed(iter/s)": 0.461165 }, { "epoch": 1.3818181818181818, "grad_norm": 3.616748332977295, "learning_rate": 5.876831483143933e-06, "loss": 0.9861072540283203, "memory(GiB)": 64.44, "step": 1900, "token_acc": 0.7113821138211383, "train_speed(iter/s)": 0.461216 }, { "epoch": 1.3854545454545455, "grad_norm": 3.880399703979492, "learning_rate": 5.857498930480511e-06, "loss": 0.9869282722473145, "memory(GiB)": 64.44, "step": 1905, "token_acc": 0.7427873945849978, "train_speed(iter/s)": 0.461175 }, { "epoch": 1.3890909090909092, "grad_norm": 4.036713600158691, "learning_rate": 5.838153160732164e-06, "loss": 1.035546875, "memory(GiB)": 64.44, "step": 1910, "token_acc": 0.7298916801106246, "train_speed(iter/s)": 0.461216 }, { "epoch": 1.3927272727272726, "grad_norm": 3.1300320625305176, "learning_rate": 5.818794472085481e-06, "loss": 0.9794349670410156, "memory(GiB)": 64.44, "step": 1915, "token_acc": 0.7693474962063733, "train_speed(iter/s)": 0.461234 }, { "epoch": 1.3963636363636365, "grad_norm": 3.984023094177246, "learning_rate": 5.799423162926181e-06, "loss": 1.0017403602600097, "memory(GiB)": 64.44, "step": 1920, "token_acc": 0.71779679613781, "train_speed(iter/s)": 0.461278 }, { "epoch": 1.4, "grad_norm": 4.028362274169922, "learning_rate": 5.780039531834503e-06, "loss": 0.9450706481933594, "memory(GiB)": 64.44, "step": 1925, "token_acc": 0.7490964428381206, "train_speed(iter/s)": 0.461318 }, { "epoch": 1.4036363636363636, "grad_norm": 4.613126277923584, "learning_rate": 5.760643877580612e-06, "loss": 1.0643499374389649, "memory(GiB)": 64.44, "step": 1930, "token_acc": 0.711301283664737, "train_speed(iter/s)": 0.461372 }, { "epoch": 1.4072727272727272, "grad_norm": 4.1977949142456055, "learning_rate": 5.741236499119997e-06, "loss": 1.0503165245056152, "memory(GiB)": 64.44, "step": 1935, "token_acc": 0.7509952229299363, "train_speed(iter/s)": 0.461437 }, { "epoch": 1.410909090909091, "grad_norm": 3.390101909637451, "learning_rate": 5.721817695588856e-06, "loss": 0.9490262985229492, "memory(GiB)": 64.44, "step": 1940, "token_acc": 0.716691431401684, "train_speed(iter/s)": 0.46149 }, { "epoch": 1.4145454545454546, "grad_norm": 3.2861225605010986, "learning_rate": 5.702387766299484e-06, "loss": 0.9019038200378418, "memory(GiB)": 64.44, "step": 1945, "token_acc": 0.7688659793814433, "train_speed(iter/s)": 0.461429 }, { "epoch": 1.4181818181818182, "grad_norm": 3.669062376022339, "learning_rate": 5.682947010735669e-06, "loss": 1.0124034881591797, "memory(GiB)": 64.44, "step": 1950, "token_acc": 0.7542513479883866, "train_speed(iter/s)": 0.461492 }, { "epoch": 1.4218181818181819, "grad_norm": 3.639533519744873, "learning_rate": 5.663495728548064e-06, "loss": 1.0447866439819335, "memory(GiB)": 64.44, "step": 1955, "token_acc": 0.7088954950834667, "train_speed(iter/s)": 0.461568 }, { "epoch": 1.4254545454545455, "grad_norm": 3.64686918258667, "learning_rate": 5.64403421954958e-06, "loss": 0.9409385681152344, "memory(GiB)": 64.44, "step": 1960, "token_acc": 0.7370488583353794, "train_speed(iter/s)": 0.461624 }, { "epoch": 1.4290909090909092, "grad_norm": 3.4092624187469482, "learning_rate": 5.624562783710756e-06, "loss": 0.9381342887878418, "memory(GiB)": 64.44, "step": 1965, "token_acc": 0.7217558167426241, "train_speed(iter/s)": 0.461614 }, { "epoch": 1.4327272727272726, "grad_norm": 4.09271240234375, "learning_rate": 5.6050817211551426e-06, "loss": 1.0289035797119142, "memory(GiB)": 64.44, "step": 1970, "token_acc": 0.7752707581227437, "train_speed(iter/s)": 0.461635 }, { "epoch": 1.4363636363636363, "grad_norm": 3.552288055419922, "learning_rate": 5.5855913321546655e-06, "loss": 0.9234642028808594, "memory(GiB)": 64.44, "step": 1975, "token_acc": 0.722303973092285, "train_speed(iter/s)": 0.461673 }, { "epoch": 1.44, "grad_norm": 3.510248899459839, "learning_rate": 5.566091917125007e-06, "loss": 0.9744023323059082, "memory(GiB)": 64.44, "step": 1980, "token_acc": 0.7038145100972326, "train_speed(iter/s)": 0.461799 }, { "epoch": 1.4436363636363636, "grad_norm": 4.241003513336182, "learning_rate": 5.546583776620978e-06, "loss": 0.9870964050292969, "memory(GiB)": 64.44, "step": 1985, "token_acc": 0.722917158366769, "train_speed(iter/s)": 0.461849 }, { "epoch": 1.4472727272727273, "grad_norm": 4.006800174713135, "learning_rate": 5.527067211331868e-06, "loss": 1.1195402145385742, "memory(GiB)": 64.44, "step": 1990, "token_acc": 0.6974145486415425, "train_speed(iter/s)": 0.461926 }, { "epoch": 1.450909090909091, "grad_norm": 3.797157049179077, "learning_rate": 5.507542522076832e-06, "loss": 1.0271331787109375, "memory(GiB)": 64.44, "step": 1995, "token_acc": 0.7195024077046549, "train_speed(iter/s)": 0.461974 }, { "epoch": 1.4545454545454546, "grad_norm": 3.211519241333008, "learning_rate": 5.488010009800241e-06, "loss": 0.9283449172973632, "memory(GiB)": 64.44, "step": 2000, "token_acc": 0.7473524962178517, "train_speed(iter/s)": 0.462008 }, { "epoch": 1.4581818181818182, "grad_norm": 3.639495849609375, "learning_rate": 5.468469975567045e-06, "loss": 1.0161470413208007, "memory(GiB)": 64.44, "step": 2005, "token_acc": 0.7487437185929648, "train_speed(iter/s)": 0.46202 }, { "epoch": 1.461818181818182, "grad_norm": 3.784331798553467, "learning_rate": 5.448922720558135e-06, "loss": 1.0102046966552733, "memory(GiB)": 64.44, "step": 2010, "token_acc": 0.7574331550802139, "train_speed(iter/s)": 0.462075 }, { "epoch": 1.4654545454545453, "grad_norm": 3.8442893028259277, "learning_rate": 5.429368546065702e-06, "loss": 1.0593183517456055, "memory(GiB)": 64.44, "step": 2015, "token_acc": 0.7385492000876617, "train_speed(iter/s)": 0.462128 }, { "epoch": 1.4690909090909092, "grad_norm": 3.8028147220611572, "learning_rate": 5.409807753488584e-06, "loss": 0.9948017120361328, "memory(GiB)": 64.44, "step": 2020, "token_acc": 0.7277379733879222, "train_speed(iter/s)": 0.462169 }, { "epoch": 1.4727272727272727, "grad_norm": 3.7433605194091797, "learning_rate": 5.390240644327633e-06, "loss": 1.015998649597168, "memory(GiB)": 64.44, "step": 2025, "token_acc": 0.7299979744784282, "train_speed(iter/s)": 0.462178 }, { "epoch": 1.4763636363636363, "grad_norm": 3.3795201778411865, "learning_rate": 5.3706675201810635e-06, "loss": 0.9729107856750489, "memory(GiB)": 64.44, "step": 2030, "token_acc": 0.7344326318073334, "train_speed(iter/s)": 0.462188 }, { "epoch": 1.48, "grad_norm": 4.034217834472656, "learning_rate": 5.351088682739793e-06, "loss": 0.9540383338928222, "memory(GiB)": 64.44, "step": 2035, "token_acc": 0.7512517068730087, "train_speed(iter/s)": 0.462252 }, { "epoch": 1.4836363636363636, "grad_norm": 4.032739639282227, "learning_rate": 5.331504433782813e-06, "loss": 1.0312958717346192, "memory(GiB)": 64.44, "step": 2040, "token_acc": 0.7813462384513858, "train_speed(iter/s)": 0.462294 }, { "epoch": 1.4872727272727273, "grad_norm": 3.369480848312378, "learning_rate": 5.311915075172513e-06, "loss": 0.9297122955322266, "memory(GiB)": 64.44, "step": 2045, "token_acc": 0.7658692785835374, "train_speed(iter/s)": 0.462269 }, { "epoch": 1.490909090909091, "grad_norm": 3.4090447425842285, "learning_rate": 5.292320908850053e-06, "loss": 0.984104061126709, "memory(GiB)": 64.44, "step": 2050, "token_acc": 0.7230137647911132, "train_speed(iter/s)": 0.462301 }, { "epoch": 1.4945454545454546, "grad_norm": 3.4420931339263916, "learning_rate": 5.272722236830685e-06, "loss": 1.0333056449890137, "memory(GiB)": 64.44, "step": 2055, "token_acc": 0.7212076941806671, "train_speed(iter/s)": 0.462332 }, { "epoch": 1.498181818181818, "grad_norm": 3.902665615081787, "learning_rate": 5.2531193611991205e-06, "loss": 0.9698718070983887, "memory(GiB)": 64.44, "step": 2060, "token_acc": 0.7210183042289081, "train_speed(iter/s)": 0.462353 }, { "epoch": 1.501818181818182, "grad_norm": 4.051348686218262, "learning_rate": 5.233512584104854e-06, "loss": 0.9682827949523926, "memory(GiB)": 64.44, "step": 2065, "token_acc": 0.7305626897034788, "train_speed(iter/s)": 0.462433 }, { "epoch": 1.5054545454545454, "grad_norm": 3.7025203704833984, "learning_rate": 5.2139022077575204e-06, "loss": 0.9961311340332031, "memory(GiB)": 64.44, "step": 2070, "token_acc": 0.7380658798661265, "train_speed(iter/s)": 0.462478 }, { "epoch": 1.509090909090909, "grad_norm": 3.5820093154907227, "learning_rate": 5.194288534422233e-06, "loss": 0.9701545715332032, "memory(GiB)": 64.44, "step": 2075, "token_acc": 0.7684444444444445, "train_speed(iter/s)": 0.46251 }, { "epoch": 1.5127272727272727, "grad_norm": 3.9114859104156494, "learning_rate": 5.174671866414917e-06, "loss": 1.0580403327941894, "memory(GiB)": 64.44, "step": 2080, "token_acc": 0.7120789530143746, "train_speed(iter/s)": 0.462532 }, { "epoch": 1.5163636363636364, "grad_norm": 3.454298734664917, "learning_rate": 5.155052506097667e-06, "loss": 0.9580793380737305, "memory(GiB)": 64.44, "step": 2085, "token_acc": 0.779483828814113, "train_speed(iter/s)": 0.462514 }, { "epoch": 1.52, "grad_norm": 3.2281603813171387, "learning_rate": 5.1354307558740625e-06, "loss": 0.9244537353515625, "memory(GiB)": 64.44, "step": 2090, "token_acc": 0.7337402652073248, "train_speed(iter/s)": 0.462538 }, { "epoch": 1.5236363636363637, "grad_norm": 4.469293594360352, "learning_rate": 5.115806918184528e-06, "loss": 0.966168212890625, "memory(GiB)": 64.44, "step": 2095, "token_acc": 0.7608447488584474, "train_speed(iter/s)": 0.462543 }, { "epoch": 1.5272727272727273, "grad_norm": 3.593106508255005, "learning_rate": 5.096181295501663e-06, "loss": 1.0489200592041015, "memory(GiB)": 64.44, "step": 2100, "token_acc": 0.7567863397548161, "train_speed(iter/s)": 0.46258 }, { "epoch": 1.5309090909090908, "grad_norm": 3.4803240299224854, "learning_rate": 5.076554190325579e-06, "loss": 0.953731918334961, "memory(GiB)": 64.44, "step": 2105, "token_acc": 0.7805164319248826, "train_speed(iter/s)": 0.462557 }, { "epoch": 1.5345454545454547, "grad_norm": 3.9683210849761963, "learning_rate": 5.056925905179234e-06, "loss": 1.0079194068908692, "memory(GiB)": 64.44, "step": 2110, "token_acc": 0.7628815628815628, "train_speed(iter/s)": 0.462599 }, { "epoch": 1.538181818181818, "grad_norm": 3.7638962268829346, "learning_rate": 5.0372967426037815e-06, "loss": 0.9692018508911133, "memory(GiB)": 64.44, "step": 2115, "token_acc": 0.7856516400631468, "train_speed(iter/s)": 0.462596 }, { "epoch": 1.541818181818182, "grad_norm": 3.9223406314849854, "learning_rate": 5.017667005153891e-06, "loss": 0.9786901473999023, "memory(GiB)": 64.44, "step": 2120, "token_acc": 0.7256913470115968, "train_speed(iter/s)": 0.462545 }, { "epoch": 1.5454545454545454, "grad_norm": 3.5813755989074707, "learning_rate": 4.998036995393099e-06, "loss": 0.9308863639831543, "memory(GiB)": 64.44, "step": 2125, "token_acc": 0.7481103552532123, "train_speed(iter/s)": 0.462501 }, { "epoch": 1.549090909090909, "grad_norm": 3.1303036212921143, "learning_rate": 4.978407015889136e-06, "loss": 0.9750682830810546, "memory(GiB)": 64.44, "step": 2130, "token_acc": 0.7527090409186479, "train_speed(iter/s)": 0.462434 }, { "epoch": 1.5527272727272727, "grad_norm": 3.235821008682251, "learning_rate": 4.958777369209268e-06, "loss": 0.9330739974975586, "memory(GiB)": 64.44, "step": 2135, "token_acc": 0.7765167148163433, "train_speed(iter/s)": 0.462449 }, { "epoch": 1.5563636363636364, "grad_norm": 3.6677234172821045, "learning_rate": 4.939148357915628e-06, "loss": 1.0006421089172364, "memory(GiB)": 64.44, "step": 2140, "token_acc": 0.7976786527082385, "train_speed(iter/s)": 0.46251 }, { "epoch": 1.56, "grad_norm": 3.8058927059173584, "learning_rate": 4.919520284560558e-06, "loss": 0.9706598281860351, "memory(GiB)": 64.44, "step": 2145, "token_acc": 0.8033300128077415, "train_speed(iter/s)": 0.462417 }, { "epoch": 1.5636363636363635, "grad_norm": 3.2341036796569824, "learning_rate": 4.899893451681944e-06, "loss": 0.9487602233886718, "memory(GiB)": 64.44, "step": 2150, "token_acc": 0.7283561951877671, "train_speed(iter/s)": 0.462497 }, { "epoch": 1.5672727272727274, "grad_norm": 3.6466586589813232, "learning_rate": 4.880268161798552e-06, "loss": 1.0922494888305665, "memory(GiB)": 64.44, "step": 2155, "token_acc": 0.7327859675312558, "train_speed(iter/s)": 0.462473 }, { "epoch": 1.5709090909090908, "grad_norm": 3.687445640563965, "learning_rate": 4.860644717405358e-06, "loss": 1.0499517440795898, "memory(GiB)": 64.44, "step": 2160, "token_acc": 0.7352428393524284, "train_speed(iter/s)": 0.462559 }, { "epoch": 1.5745454545454547, "grad_norm": 3.905825614929199, "learning_rate": 4.841023420968901e-06, "loss": 0.9939208984375, "memory(GiB)": 64.44, "step": 2165, "token_acc": 0.7321428571428571, "train_speed(iter/s)": 0.462625 }, { "epoch": 1.5781818181818181, "grad_norm": 3.7845633029937744, "learning_rate": 4.821404574922611e-06, "loss": 0.9922620773315429, "memory(GiB)": 64.44, "step": 2170, "token_acc": 0.7227589305773984, "train_speed(iter/s)": 0.462659 }, { "epoch": 1.5818181818181818, "grad_norm": 2.901113271713257, "learning_rate": 4.801788481662145e-06, "loss": 0.94874267578125, "memory(GiB)": 64.44, "step": 2175, "token_acc": 0.8261739799846035, "train_speed(iter/s)": 0.462611 }, { "epoch": 1.5854545454545454, "grad_norm": 3.699376106262207, "learning_rate": 4.782175443540733e-06, "loss": 0.981483268737793, "memory(GiB)": 64.44, "step": 2180, "token_acc": 0.7473048727899957, "train_speed(iter/s)": 0.462622 }, { "epoch": 1.589090909090909, "grad_norm": 4.233500957489014, "learning_rate": 4.762565762864513e-06, "loss": 1.017900562286377, "memory(GiB)": 64.44, "step": 2185, "token_acc": 0.7384370015948963, "train_speed(iter/s)": 0.462701 }, { "epoch": 1.5927272727272728, "grad_norm": 4.156431674957275, "learning_rate": 4.742959741887872e-06, "loss": 0.9760846138000489, "memory(GiB)": 64.44, "step": 2190, "token_acc": 0.7447447447447447, "train_speed(iter/s)": 0.462745 }, { "epoch": 1.5963636363636362, "grad_norm": 3.670698881149292, "learning_rate": 4.723357682808793e-06, "loss": 1.0618730545043946, "memory(GiB)": 64.44, "step": 2195, "token_acc": 0.7577669902912622, "train_speed(iter/s)": 0.462832 }, { "epoch": 1.6, "grad_norm": 4.159302711486816, "learning_rate": 4.703759887764185e-06, "loss": 0.9977631568908691, "memory(GiB)": 64.44, "step": 2200, "token_acc": 0.7650755902836759, "train_speed(iter/s)": 0.462839 }, { "epoch": 1.6036363636363635, "grad_norm": 3.6215317249298096, "learning_rate": 4.684166658825242e-06, "loss": 1.054893684387207, "memory(GiB)": 64.44, "step": 2205, "token_acc": 0.7607733519683205, "train_speed(iter/s)": 0.462843 }, { "epoch": 1.6072727272727274, "grad_norm": 3.5773353576660156, "learning_rate": 4.664578297992767e-06, "loss": 0.9340826034545898, "memory(GiB)": 64.44, "step": 2210, "token_acc": 0.7217975445911513, "train_speed(iter/s)": 0.462864 }, { "epoch": 1.6109090909090908, "grad_norm": 3.176886558532715, "learning_rate": 4.644995107192538e-06, "loss": 0.9768821716308593, "memory(GiB)": 64.44, "step": 2215, "token_acc": 0.7468906829587606, "train_speed(iter/s)": 0.462857 }, { "epoch": 1.6145454545454545, "grad_norm": 3.9905526638031006, "learning_rate": 4.625417388270643e-06, "loss": 1.0507758140563965, "memory(GiB)": 64.44, "step": 2220, "token_acc": 0.6920529801324503, "train_speed(iter/s)": 0.462889 }, { "epoch": 1.6181818181818182, "grad_norm": 3.2976949214935303, "learning_rate": 4.6058454429888215e-06, "loss": 0.995277214050293, "memory(GiB)": 64.44, "step": 2225, "token_acc": 0.7551693796744391, "train_speed(iter/s)": 0.462954 }, { "epoch": 1.6218181818181818, "grad_norm": 4.139730930328369, "learning_rate": 4.586279573019829e-06, "loss": 1.0577568054199218, "memory(GiB)": 64.44, "step": 2230, "token_acc": 0.704527402700556, "train_speed(iter/s)": 0.463008 }, { "epoch": 1.6254545454545455, "grad_norm": 3.9827053546905518, "learning_rate": 4.566720079942779e-06, "loss": 0.8773839950561524, "memory(GiB)": 64.44, "step": 2235, "token_acc": 0.7590271281571562, "train_speed(iter/s)": 0.462998 }, { "epoch": 1.6290909090909091, "grad_norm": 3.42809796333313, "learning_rate": 4.547167265238488e-06, "loss": 0.9219103813171386, "memory(GiB)": 64.44, "step": 2240, "token_acc": 0.7726116123062688, "train_speed(iter/s)": 0.463011 }, { "epoch": 1.6327272727272728, "grad_norm": 3.682155132293701, "learning_rate": 4.52762143028484e-06, "loss": 0.9474153518676758, "memory(GiB)": 64.44, "step": 2245, "token_acc": 0.7516981132075472, "train_speed(iter/s)": 0.463065 }, { "epoch": 1.6363636363636362, "grad_norm": 4.005671977996826, "learning_rate": 4.508082876352136e-06, "loss": 1.0329013824462892, "memory(GiB)": 64.44, "step": 2250, "token_acc": 0.7462128296240883, "train_speed(iter/s)": 0.463106 }, { "epoch": 1.6400000000000001, "grad_norm": 3.734011650085449, "learning_rate": 4.488551904598452e-06, "loss": 0.9806623458862305, "memory(GiB)": 64.44, "step": 2255, "token_acc": 0.7730970891339721, "train_speed(iter/s)": 0.463046 }, { "epoch": 1.6436363636363636, "grad_norm": 3.6952412128448486, "learning_rate": 4.469028816064992e-06, "loss": 1.0010573387145996, "memory(GiB)": 64.44, "step": 2260, "token_acc": 0.7182100132919805, "train_speed(iter/s)": 0.463111 }, { "epoch": 1.6472727272727272, "grad_norm": 4.075192451477051, "learning_rate": 4.4495139116714545e-06, "loss": 0.878773307800293, "memory(GiB)": 64.44, "step": 2265, "token_acc": 0.75185508511567, "train_speed(iter/s)": 0.463138 }, { "epoch": 1.6509090909090909, "grad_norm": 3.910977840423584, "learning_rate": 4.430007492211392e-06, "loss": 0.9923901557922363, "memory(GiB)": 64.44, "step": 2270, "token_acc": 0.7322286263208453, "train_speed(iter/s)": 0.463156 }, { "epoch": 1.6545454545454545, "grad_norm": 4.175351619720459, "learning_rate": 4.410509858347571e-06, "loss": 1.054445457458496, "memory(GiB)": 64.44, "step": 2275, "token_acc": 0.7337883959044369, "train_speed(iter/s)": 0.463189 }, { "epoch": 1.6581818181818182, "grad_norm": 3.577937602996826, "learning_rate": 4.391021310607345e-06, "loss": 0.9427365303039551, "memory(GiB)": 64.44, "step": 2280, "token_acc": 0.7608598298253471, "train_speed(iter/s)": 0.463206 }, { "epoch": 1.6618181818181819, "grad_norm": 3.752776861190796, "learning_rate": 4.371542149378017e-06, "loss": 1.076515007019043, "memory(GiB)": 64.44, "step": 2285, "token_acc": 0.7492560999801626, "train_speed(iter/s)": 0.463236 }, { "epoch": 1.6654545454545455, "grad_norm": 3.7193381786346436, "learning_rate": 4.352072674902208e-06, "loss": 0.9631393432617188, "memory(GiB)": 64.44, "step": 2290, "token_acc": 0.7573891625615764, "train_speed(iter/s)": 0.463228 }, { "epoch": 1.669090909090909, "grad_norm": 3.5725324153900146, "learning_rate": 4.332613187273234e-06, "loss": 0.9510932922363281, "memory(GiB)": 64.44, "step": 2295, "token_acc": 0.7744831906452286, "train_speed(iter/s)": 0.463264 }, { "epoch": 1.6727272727272728, "grad_norm": 3.7124252319335938, "learning_rate": 4.313163986430482e-06, "loss": 0.9919276237487793, "memory(GiB)": 64.44, "step": 2300, "token_acc": 0.7588126159554731, "train_speed(iter/s)": 0.463335 }, { "epoch": 1.6763636363636363, "grad_norm": 3.576068878173828, "learning_rate": 4.293725372154775e-06, "loss": 1.0437440872192383, "memory(GiB)": 64.44, "step": 2305, "token_acc": 0.7543238993710691, "train_speed(iter/s)": 0.463326 }, { "epoch": 1.6800000000000002, "grad_norm": 3.792983055114746, "learning_rate": 4.2742976440637666e-06, "loss": 1.03680477142334, "memory(GiB)": 64.44, "step": 2310, "token_acc": 0.7257747171667487, "train_speed(iter/s)": 0.463336 }, { "epoch": 1.6836363636363636, "grad_norm": 3.860466241836548, "learning_rate": 4.254881101607315e-06, "loss": 0.9429449081420899, "memory(GiB)": 64.44, "step": 2315, "token_acc": 0.7263529411764705, "train_speed(iter/s)": 0.463353 }, { "epoch": 1.6872727272727273, "grad_norm": 4.08974027633667, "learning_rate": 4.235476044062866e-06, "loss": 0.9691776275634766, "memory(GiB)": 64.44, "step": 2320, "token_acc": 0.7541046200840015, "train_speed(iter/s)": 0.463384 }, { "epoch": 1.690909090909091, "grad_norm": 3.7761855125427246, "learning_rate": 4.216082770530843e-06, "loss": 0.9898856163024903, "memory(GiB)": 64.44, "step": 2325, "token_acc": 0.7277238890142116, "train_speed(iter/s)": 0.463395 }, { "epoch": 1.6945454545454546, "grad_norm": 3.6072325706481934, "learning_rate": 4.196701579930038e-06, "loss": 1.007903480529785, "memory(GiB)": 64.44, "step": 2330, "token_acc": 0.7275, "train_speed(iter/s)": 0.463335 }, { "epoch": 1.6981818181818182, "grad_norm": 4.309933662414551, "learning_rate": 4.177332770993e-06, "loss": 0.9898582458496094, "memory(GiB)": 64.44, "step": 2335, "token_acc": 0.7726732673267327, "train_speed(iter/s)": 0.463339 }, { "epoch": 1.7018181818181817, "grad_norm": 3.4883134365081787, "learning_rate": 4.157976642261434e-06, "loss": 0.9960001945495606, "memory(GiB)": 64.44, "step": 2340, "token_acc": 0.764170228582048, "train_speed(iter/s)": 0.46331 }, { "epoch": 1.7054545454545456, "grad_norm": 3.0042526721954346, "learning_rate": 4.138633492081597e-06, "loss": 0.9730648994445801, "memory(GiB)": 64.44, "step": 2345, "token_acc": 0.7559236254888428, "train_speed(iter/s)": 0.463311 }, { "epoch": 1.709090909090909, "grad_norm": 3.365316152572632, "learning_rate": 4.119303618599705e-06, "loss": 0.97021484375, "memory(GiB)": 64.44, "step": 2350, "token_acc": 0.7311364912937652, "train_speed(iter/s)": 0.463306 }, { "epoch": 1.7127272727272729, "grad_norm": 3.245842456817627, "learning_rate": 4.099987319757326e-06, "loss": 0.9768846511840821, "memory(GiB)": 64.44, "step": 2355, "token_acc": 0.7251812953238309, "train_speed(iter/s)": 0.463285 }, { "epoch": 1.7163636363636363, "grad_norm": 3.2012290954589844, "learning_rate": 4.0806848932868e-06, "loss": 0.9911705017089844, "memory(GiB)": 64.44, "step": 2360, "token_acc": 0.7289512555391433, "train_speed(iter/s)": 0.463339 }, { "epoch": 1.72, "grad_norm": 3.820871353149414, "learning_rate": 4.0613966367066456e-06, "loss": 1.0202957153320313, "memory(GiB)": 64.44, "step": 2365, "token_acc": 0.7401774397972116, "train_speed(iter/s)": 0.463404 }, { "epoch": 1.7236363636363636, "grad_norm": 4.134464740753174, "learning_rate": 4.042122847316973e-06, "loss": 0.9151566505432129, "memory(GiB)": 64.44, "step": 2370, "token_acc": 0.7081224391419619, "train_speed(iter/s)": 0.463391 }, { "epoch": 1.7272727272727273, "grad_norm": 3.890723705291748, "learning_rate": 4.022863822194895e-06, "loss": 1.0222078323364259, "memory(GiB)": 64.44, "step": 2375, "token_acc": 0.7584531281635959, "train_speed(iter/s)": 0.463429 }, { "epoch": 1.730909090909091, "grad_norm": 3.866518497467041, "learning_rate": 4.003619858189964e-06, "loss": 0.9343522071838379, "memory(GiB)": 64.44, "step": 2380, "token_acc": 0.7731607629427792, "train_speed(iter/s)": 0.463458 }, { "epoch": 1.7345454545454544, "grad_norm": 3.6248366832733154, "learning_rate": 3.984391251919586e-06, "loss": 0.9574322700500488, "memory(GiB)": 64.44, "step": 2385, "token_acc": 0.7667273094804933, "train_speed(iter/s)": 0.463492 }, { "epoch": 1.7381818181818183, "grad_norm": 3.5135788917541504, "learning_rate": 3.965178299764442e-06, "loss": 0.9733609199523926, "memory(GiB)": 64.44, "step": 2390, "token_acc": 0.7768259693417493, "train_speed(iter/s)": 0.463541 }, { "epoch": 1.7418181818181817, "grad_norm": 3.7573583126068115, "learning_rate": 3.9459812978639366e-06, "loss": 0.9856127738952637, "memory(GiB)": 64.44, "step": 2395, "token_acc": 0.6941059437950758, "train_speed(iter/s)": 0.463547 }, { "epoch": 1.7454545454545456, "grad_norm": 3.8713910579681396, "learning_rate": 3.926800542111624e-06, "loss": 1.0458408355712892, "memory(GiB)": 64.44, "step": 2400, "token_acc": 0.7367864693446089, "train_speed(iter/s)": 0.463544 }, { "epoch": 1.749090909090909, "grad_norm": 4.335873603820801, "learning_rate": 3.907636328150643e-06, "loss": 1.0263343811035157, "memory(GiB)": 64.44, "step": 2405, "token_acc": 0.7440373739857389, "train_speed(iter/s)": 0.463594 }, { "epoch": 1.7527272727272727, "grad_norm": 3.356822967529297, "learning_rate": 3.888488951369168e-06, "loss": 0.9377895355224609, "memory(GiB)": 64.44, "step": 2410, "token_acc": 0.773037542662116, "train_speed(iter/s)": 0.463587 }, { "epoch": 1.7563636363636363, "grad_norm": 3.5357346534729004, "learning_rate": 3.869358706895855e-06, "loss": 0.977473258972168, "memory(GiB)": 64.44, "step": 2415, "token_acc": 0.7483623221142987, "train_speed(iter/s)": 0.46363 }, { "epoch": 1.76, "grad_norm": 3.981171131134033, "learning_rate": 3.850245889595288e-06, "loss": 1.0373311042785645, "memory(GiB)": 64.44, "step": 2420, "token_acc": 0.7319004524886877, "train_speed(iter/s)": 0.463625 }, { "epoch": 1.7636363636363637, "grad_norm": 3.7682418823242188, "learning_rate": 3.831150794063434e-06, "loss": 1.030501365661621, "memory(GiB)": 64.44, "step": 2425, "token_acc": 0.6902185444515171, "train_speed(iter/s)": 0.463685 }, { "epoch": 1.767272727272727, "grad_norm": 4.16378116607666, "learning_rate": 3.8120737146231114e-06, "loss": 0.9865205764770508, "memory(GiB)": 64.44, "step": 2430, "token_acc": 0.7317015768416097, "train_speed(iter/s)": 0.463737 }, { "epoch": 1.770909090909091, "grad_norm": 3.2445712089538574, "learning_rate": 3.7930149453194443e-06, "loss": 1.0164010047912597, "memory(GiB)": 64.44, "step": 2435, "token_acc": 0.7629260182876143, "train_speed(iter/s)": 0.463707 }, { "epoch": 1.7745454545454544, "grad_norm": 4.097912788391113, "learning_rate": 3.773974779915329e-06, "loss": 1.02340087890625, "memory(GiB)": 64.44, "step": 2440, "token_acc": 0.7449856733524355, "train_speed(iter/s)": 0.46375 }, { "epoch": 1.7781818181818183, "grad_norm": 3.395263195037842, "learning_rate": 3.754953511886917e-06, "loss": 1.0150327682495117, "memory(GiB)": 64.44, "step": 2445, "token_acc": 0.7850148999574287, "train_speed(iter/s)": 0.463806 }, { "epoch": 1.7818181818181817, "grad_norm": 4.005068302154541, "learning_rate": 3.7359514344190815e-06, "loss": 0.9756942749023437, "memory(GiB)": 64.44, "step": 2450, "token_acc": 0.7594743858312702, "train_speed(iter/s)": 0.463838 }, { "epoch": 1.7854545454545454, "grad_norm": 4.276913642883301, "learning_rate": 3.7169688404008975e-06, "loss": 1.0148825645446777, "memory(GiB)": 64.44, "step": 2455, "token_acc": 0.7754668930390493, "train_speed(iter/s)": 0.463893 }, { "epoch": 1.789090909090909, "grad_norm": 3.7833950519561768, "learning_rate": 3.6980060224211368e-06, "loss": 1.0185523986816407, "memory(GiB)": 64.44, "step": 2460, "token_acc": 0.7297499066815976, "train_speed(iter/s)": 0.463928 }, { "epoch": 1.7927272727272727, "grad_norm": 3.901315212249756, "learning_rate": 3.679063272763752e-06, "loss": 1.0209418296813966, "memory(GiB)": 64.44, "step": 2465, "token_acc": 0.6788369042413642, "train_speed(iter/s)": 0.463978 }, { "epoch": 1.7963636363636364, "grad_norm": 4.074141979217529, "learning_rate": 3.660140883403369e-06, "loss": 0.9935298919677734, "memory(GiB)": 64.44, "step": 2470, "token_acc": 0.723399355135882, "train_speed(iter/s)": 0.46403 }, { "epoch": 1.8, "grad_norm": 3.7663679122924805, "learning_rate": 3.641239146000792e-06, "loss": 0.9881417274475097, "memory(GiB)": 64.44, "step": 2475, "token_acc": 0.7416889568207872, "train_speed(iter/s)": 0.464076 }, { "epoch": 1.8036363636363637, "grad_norm": 3.5808398723602295, "learning_rate": 3.6223583518985055e-06, "loss": 0.9529662132263184, "memory(GiB)": 64.44, "step": 2480, "token_acc": 0.7698131062219068, "train_speed(iter/s)": 0.464133 }, { "epoch": 1.8072727272727271, "grad_norm": 3.6277318000793457, "learning_rate": 3.6034987921161834e-06, "loss": 0.9884878158569336, "memory(GiB)": 64.44, "step": 2485, "token_acc": 0.740924092409241, "train_speed(iter/s)": 0.464191 }, { "epoch": 1.810909090909091, "grad_norm": 4.147091388702393, "learning_rate": 3.5846607573462023e-06, "loss": 1.0621925354003907, "memory(GiB)": 64.44, "step": 2490, "token_acc": 0.6963470319634704, "train_speed(iter/s)": 0.464255 }, { "epoch": 1.8145454545454545, "grad_norm": 3.680851697921753, "learning_rate": 3.5658445379491647e-06, "loss": 0.9677799224853516, "memory(GiB)": 64.44, "step": 2495, "token_acc": 0.781350977073396, "train_speed(iter/s)": 0.464275 }, { "epoch": 1.8181818181818183, "grad_norm": 3.780642032623291, "learning_rate": 3.5470504239494224e-06, "loss": 1.0042539596557618, "memory(GiB)": 64.44, "step": 2500, "token_acc": 0.7281123014407093, "train_speed(iter/s)": 0.464297 }, { "epoch": 1.8218181818181818, "grad_norm": 4.483243942260742, "learning_rate": 3.528278705030599e-06, "loss": 1.005680465698242, "memory(GiB)": 64.44, "step": 2505, "token_acc": 0.7122031507171408, "train_speed(iter/s)": 0.46437 }, { "epoch": 1.8254545454545454, "grad_norm": 3.688572883605957, "learning_rate": 3.509529670531138e-06, "loss": 1.040778923034668, "memory(GiB)": 64.44, "step": 2510, "token_acc": 0.7308886301901436, "train_speed(iter/s)": 0.464352 }, { "epoch": 1.829090909090909, "grad_norm": 3.509716033935547, "learning_rate": 3.4908036094398324e-06, "loss": 1.0052711486816406, "memory(GiB)": 64.44, "step": 2515, "token_acc": 0.7249230769230769, "train_speed(iter/s)": 0.464382 }, { "epoch": 1.8327272727272728, "grad_norm": 3.991241693496704, "learning_rate": 3.4721008103913715e-06, "loss": 1.0515169143676757, "memory(GiB)": 64.44, "step": 2520, "token_acc": 0.6967725794345759, "train_speed(iter/s)": 0.464478 }, { "epoch": 1.8363636363636364, "grad_norm": 3.670917510986328, "learning_rate": 3.4534215616619e-06, "loss": 1.023714828491211, "memory(GiB)": 64.44, "step": 2525, "token_acc": 0.7610474631751227, "train_speed(iter/s)": 0.464493 }, { "epoch": 1.8399999999999999, "grad_norm": 4.095003604888916, "learning_rate": 3.434766151164565e-06, "loss": 1.0314668655395507, "memory(GiB)": 64.44, "step": 2530, "token_acc": 0.7246666666666667, "train_speed(iter/s)": 0.464568 }, { "epoch": 1.8436363636363637, "grad_norm": 3.6983370780944824, "learning_rate": 3.416134866445086e-06, "loss": 1.0155969619750977, "memory(GiB)": 64.44, "step": 2535, "token_acc": 0.720302596606011, "train_speed(iter/s)": 0.464616 }, { "epoch": 1.8472727272727272, "grad_norm": 3.8502554893493652, "learning_rate": 3.397527994677313e-06, "loss": 0.9803200721740722, "memory(GiB)": 64.44, "step": 2540, "token_acc": 0.7569339384770549, "train_speed(iter/s)": 0.464657 }, { "epoch": 1.850909090909091, "grad_norm": 3.3400015830993652, "learning_rate": 3.378945822658811e-06, "loss": 0.9980621337890625, "memory(GiB)": 64.44, "step": 2545, "token_acc": 0.7765086941697921, "train_speed(iter/s)": 0.464654 }, { "epoch": 1.8545454545454545, "grad_norm": 3.298196315765381, "learning_rate": 3.3603886368064363e-06, "loss": 1.0117303848266601, "memory(GiB)": 64.44, "step": 2550, "token_acc": 0.7541046938381302, "train_speed(iter/s)": 0.464707 }, { "epoch": 1.8581818181818182, "grad_norm": 3.4078967571258545, "learning_rate": 3.341856723151914e-06, "loss": 1.0041580200195312, "memory(GiB)": 64.44, "step": 2555, "token_acc": 0.7841938405797102, "train_speed(iter/s)": 0.464743 }, { "epoch": 1.8618181818181818, "grad_norm": 4.263998031616211, "learning_rate": 3.32335036733744e-06, "loss": 0.9891136169433594, "memory(GiB)": 64.44, "step": 2560, "token_acc": 0.7680060652009097, "train_speed(iter/s)": 0.464712 }, { "epoch": 1.8654545454545455, "grad_norm": 3.5387911796569824, "learning_rate": 3.3048698546112758e-06, "loss": 0.9509899139404296, "memory(GiB)": 64.44, "step": 2565, "token_acc": 0.7269250382457929, "train_speed(iter/s)": 0.464716 }, { "epoch": 1.8690909090909091, "grad_norm": 3.82328200340271, "learning_rate": 3.2864154698233415e-06, "loss": 0.9231161117553711, "memory(GiB)": 64.44, "step": 2570, "token_acc": 0.7634560906515581, "train_speed(iter/s)": 0.464755 }, { "epoch": 1.8727272727272726, "grad_norm": 3.4116268157958984, "learning_rate": 3.2679874974208404e-06, "loss": 0.9480420112609863, "memory(GiB)": 64.44, "step": 2575, "token_acc": 0.7342569269521411, "train_speed(iter/s)": 0.464772 }, { "epoch": 1.8763636363636365, "grad_norm": 3.618499517440796, "learning_rate": 3.2495862214438665e-06, "loss": 0.9754660606384278, "memory(GiB)": 64.44, "step": 2580, "token_acc": 0.7174500270124257, "train_speed(iter/s)": 0.464804 }, { "epoch": 1.88, "grad_norm": 3.999831199645996, "learning_rate": 3.2312119255210295e-06, "loss": 0.9918521881103516, "memory(GiB)": 64.44, "step": 2585, "token_acc": 0.7208473154362416, "train_speed(iter/s)": 0.464847 }, { "epoch": 1.8836363636363638, "grad_norm": 3.6423439979553223, "learning_rate": 3.212864892865073e-06, "loss": 0.9359735488891602, "memory(GiB)": 64.44, "step": 2590, "token_acc": 0.7750716332378224, "train_speed(iter/s)": 0.464839 }, { "epoch": 1.8872727272727272, "grad_norm": 3.45302677154541, "learning_rate": 3.1945454062685262e-06, "loss": 0.980652904510498, "memory(GiB)": 64.44, "step": 2595, "token_acc": 0.7254253308128544, "train_speed(iter/s)": 0.464846 }, { "epoch": 1.8909090909090909, "grad_norm": 3.5030007362365723, "learning_rate": 3.176253748099335e-06, "loss": 0.9258022308349609, "memory(GiB)": 64.44, "step": 2600, "token_acc": 0.7362502555714577, "train_speed(iter/s)": 0.464837 }, { "epoch": 1.8945454545454545, "grad_norm": 3.8884432315826416, "learning_rate": 3.1579902002965057e-06, "loss": 1.0826837539672851, "memory(GiB)": 64.44, "step": 2605, "token_acc": 0.7276667923105918, "train_speed(iter/s)": 0.464868 }, { "epoch": 1.8981818181818182, "grad_norm": 4.530186176300049, "learning_rate": 3.13975504436577e-06, "loss": 1.0418546676635743, "memory(GiB)": 64.44, "step": 2610, "token_acc": 0.760082304526749, "train_speed(iter/s)": 0.464853 }, { "epoch": 1.9018181818181819, "grad_norm": 3.1030256748199463, "learning_rate": 3.1215485613752394e-06, "loss": 0.9568429946899414, "memory(GiB)": 64.44, "step": 2615, "token_acc": 0.7639067376537544, "train_speed(iter/s)": 0.464815 }, { "epoch": 1.9054545454545453, "grad_norm": 3.6175343990325928, "learning_rate": 3.103371031951072e-06, "loss": 0.8990876197814941, "memory(GiB)": 64.44, "step": 2620, "token_acc": 0.7014793552660632, "train_speed(iter/s)": 0.464751 }, { "epoch": 1.9090909090909092, "grad_norm": 3.7534470558166504, "learning_rate": 3.0852227362731525e-06, "loss": 1.0102110862731934, "memory(GiB)": 64.44, "step": 2625, "token_acc": 0.7285464098073555, "train_speed(iter/s)": 0.464805 }, { "epoch": 1.9127272727272726, "grad_norm": 4.0336785316467285, "learning_rate": 3.0671039540707704e-06, "loss": 0.9847513198852539, "memory(GiB)": 64.44, "step": 2630, "token_acc": 0.7320584443489472, "train_speed(iter/s)": 0.464847 }, { "epoch": 1.9163636363636365, "grad_norm": 3.6290838718414307, "learning_rate": 3.049014964618302e-06, "loss": 1.0085186958312988, "memory(GiB)": 64.44, "step": 2635, "token_acc": 0.7455083491862186, "train_speed(iter/s)": 0.464907 }, { "epoch": 1.92, "grad_norm": 3.8827333450317383, "learning_rate": 3.0309560467309203e-06, "loss": 0.971209716796875, "memory(GiB)": 64.44, "step": 2640, "token_acc": 0.7537816657554219, "train_speed(iter/s)": 0.464862 }, { "epoch": 1.9236363636363636, "grad_norm": 3.2638890743255615, "learning_rate": 3.012927478760285e-06, "loss": 0.9603887557983398, "memory(GiB)": 64.44, "step": 2645, "token_acc": 0.7753898019384745, "train_speed(iter/s)": 0.464866 }, { "epoch": 1.9272727272727272, "grad_norm": 3.629682779312134, "learning_rate": 2.99492953859026e-06, "loss": 0.9840577125549317, "memory(GiB)": 64.44, "step": 2650, "token_acc": 0.6956521739130435, "train_speed(iter/s)": 0.464902 }, { "epoch": 1.930909090909091, "grad_norm": 4.383025646209717, "learning_rate": 2.9769625036326198e-06, "loss": 1.034652328491211, "memory(GiB)": 64.44, "step": 2655, "token_acc": 0.7468574743763295, "train_speed(iter/s)": 0.4649 }, { "epoch": 1.9345454545454546, "grad_norm": 3.8552260398864746, "learning_rate": 2.9590266508227878e-06, "loss": 1.0464018821716308, "memory(GiB)": 64.44, "step": 2660, "token_acc": 0.7078343313373253, "train_speed(iter/s)": 0.46497 }, { "epoch": 1.9381818181818182, "grad_norm": 3.4079573154449463, "learning_rate": 2.9411222566155583e-06, "loss": 0.9897180557250976, "memory(GiB)": 64.44, "step": 2665, "token_acc": 0.7533512064343163, "train_speed(iter/s)": 0.464956 }, { "epoch": 1.9418181818181819, "grad_norm": 3.910155773162842, "learning_rate": 2.9232495969808334e-06, "loss": 0.8761829376220703, "memory(GiB)": 64.44, "step": 2670, "token_acc": 0.7727180732645214, "train_speed(iter/s)": 0.464948 }, { "epoch": 1.9454545454545453, "grad_norm": 3.8864212036132812, "learning_rate": 2.9054089473993787e-06, "loss": 0.9600641250610351, "memory(GiB)": 64.44, "step": 2675, "token_acc": 0.7343532684283728, "train_speed(iter/s)": 0.464956 }, { "epoch": 1.9490909090909092, "grad_norm": 4.038954257965088, "learning_rate": 2.887600582858572e-06, "loss": 0.9259279251098633, "memory(GiB)": 64.44, "step": 2680, "token_acc": 0.7577170775038863, "train_speed(iter/s)": 0.464916 }, { "epoch": 1.9527272727272726, "grad_norm": 4.611103534698486, "learning_rate": 2.869824777848159e-06, "loss": 0.9913465499877929, "memory(GiB)": 64.44, "step": 2685, "token_acc": 0.7248833210513388, "train_speed(iter/s)": 0.464943 }, { "epoch": 1.9563636363636365, "grad_norm": 3.434164047241211, "learning_rate": 2.852081806356033e-06, "loss": 0.9562204360961915, "memory(GiB)": 64.44, "step": 2690, "token_acc": 0.7549668874172185, "train_speed(iter/s)": 0.464941 }, { "epoch": 1.96, "grad_norm": 4.066905498504639, "learning_rate": 2.834371941864006e-06, "loss": 0.9627280235290527, "memory(GiB)": 64.44, "step": 2695, "token_acc": 0.7466131460110387, "train_speed(iter/s)": 0.465 }, { "epoch": 1.9636363636363636, "grad_norm": 4.238523006439209, "learning_rate": 2.8166954573435964e-06, "loss": 0.9915515899658203, "memory(GiB)": 64.44, "step": 2700, "token_acc": 0.727447216890595, "train_speed(iter/s)": 0.465016 }, { "epoch": 1.9672727272727273, "grad_norm": 3.670944929122925, "learning_rate": 2.7990526252518123e-06, "loss": 0.9599745750427247, "memory(GiB)": 64.44, "step": 2705, "token_acc": 0.7029633113828786, "train_speed(iter/s)": 0.465006 }, { "epoch": 1.970909090909091, "grad_norm": 3.1716055870056152, "learning_rate": 2.781443717526966e-06, "loss": 0.9637611389160157, "memory(GiB)": 64.44, "step": 2710, "token_acc": 0.8069548261293468, "train_speed(iter/s)": 0.464986 }, { "epoch": 1.9745454545454546, "grad_norm": 3.7300829887390137, "learning_rate": 2.7638690055844765e-06, "loss": 0.925160026550293, "memory(GiB)": 64.44, "step": 2715, "token_acc": 0.7350575961747446, "train_speed(iter/s)": 0.46499 }, { "epoch": 1.978181818181818, "grad_norm": 3.949653148651123, "learning_rate": 2.7463287603126763e-06, "loss": 0.9642942428588868, "memory(GiB)": 64.44, "step": 2720, "token_acc": 0.789059706828745, "train_speed(iter/s)": 0.464998 }, { "epoch": 1.981818181818182, "grad_norm": 3.9616222381591797, "learning_rate": 2.728823252068653e-06, "loss": 0.8890161514282227, "memory(GiB)": 64.44, "step": 2725, "token_acc": 0.7694375119984642, "train_speed(iter/s)": 0.465007 }, { "epoch": 1.9854545454545454, "grad_norm": 3.559417724609375, "learning_rate": 2.711352750674072e-06, "loss": 0.9697627067565918, "memory(GiB)": 64.44, "step": 2730, "token_acc": 0.7073286052009456, "train_speed(iter/s)": 0.465034 }, { "epoch": 1.9890909090909092, "grad_norm": 3.9709830284118652, "learning_rate": 2.6939175254110194e-06, "loss": 0.990437126159668, "memory(GiB)": 64.44, "step": 2735, "token_acc": 0.6944444444444444, "train_speed(iter/s)": 0.46505 }, { "epoch": 1.9927272727272727, "grad_norm": 4.004317760467529, "learning_rate": 2.6765178450178503e-06, "loss": 0.9779638290405274, "memory(GiB)": 64.44, "step": 2740, "token_acc": 0.7541723049165538, "train_speed(iter/s)": 0.46506 }, { "epoch": 1.9963636363636363, "grad_norm": 4.03814172744751, "learning_rate": 2.6591539776850494e-06, "loss": 0.9912105560302734, "memory(GiB)": 64.44, "step": 2745, "token_acc": 0.7429111531190926, "train_speed(iter/s)": 0.465063 }, { "epoch": 2.0, "grad_norm": 3.923563241958618, "learning_rate": 2.6418261910510978e-06, "loss": 1.0082598686218263, "memory(GiB)": 64.44, "step": 2750, "token_acc": 0.7344060389352404, "train_speed(iter/s)": 0.465082 }, { "epoch": 2.0036363636363634, "grad_norm": 3.0618035793304443, "learning_rate": 2.6245347521983394e-06, "loss": 0.6273193359375, "memory(GiB)": 64.44, "step": 2755, "token_acc": 0.8602760446209113, "train_speed(iter/s)": 0.45798 }, { "epoch": 2.0072727272727273, "grad_norm": 3.0331130027770996, "learning_rate": 2.607279927648875e-06, "loss": 0.5837445259094238, "memory(GiB)": 64.44, "step": 2760, "token_acc": 0.8547550432276657, "train_speed(iter/s)": 0.458002 }, { "epoch": 2.0109090909090908, "grad_norm": 4.053404808044434, "learning_rate": 2.590061983360452e-06, "loss": 0.6628801822662354, "memory(GiB)": 64.44, "step": 2765, "token_acc": 0.860643821391485, "train_speed(iter/s)": 0.458016 }, { "epoch": 2.0145454545454546, "grad_norm": 3.389713764190674, "learning_rate": 2.5728811847223555e-06, "loss": 0.5978437423706054, "memory(GiB)": 64.44, "step": 2770, "token_acc": 0.8469597754911132, "train_speed(iter/s)": 0.458034 }, { "epoch": 2.018181818181818, "grad_norm": 4.968929290771484, "learning_rate": 2.555737796551332e-06, "loss": 0.5556485176086425, "memory(GiB)": 64.44, "step": 2775, "token_acc": 0.8376184032476319, "train_speed(iter/s)": 0.458085 }, { "epoch": 2.021818181818182, "grad_norm": 4.230146408081055, "learning_rate": 2.5386320830874995e-06, "loss": 0.5672976493835449, "memory(GiB)": 64.44, "step": 2780, "token_acc": 0.8402439024390244, "train_speed(iter/s)": 0.458105 }, { "epoch": 2.0254545454545454, "grad_norm": 3.9281728267669678, "learning_rate": 2.5215643079902704e-06, "loss": 0.6257860660552979, "memory(GiB)": 64.44, "step": 2785, "token_acc": 0.8389728821694264, "train_speed(iter/s)": 0.458146 }, { "epoch": 2.0290909090909093, "grad_norm": 4.398049831390381, "learning_rate": 2.5045347343342984e-06, "loss": 0.530487060546875, "memory(GiB)": 64.44, "step": 2790, "token_acc": 0.865845192641444, "train_speed(iter/s)": 0.458119 }, { "epoch": 2.0327272727272727, "grad_norm": 4.044005870819092, "learning_rate": 2.4875436246054187e-06, "loss": 0.5579940795898437, "memory(GiB)": 64.44, "step": 2795, "token_acc": 0.8288086156607584, "train_speed(iter/s)": 0.458164 }, { "epoch": 2.036363636363636, "grad_norm": 3.480076789855957, "learning_rate": 2.470591240696599e-06, "loss": 0.5503246307373046, "memory(GiB)": 64.44, "step": 2800, "token_acc": 0.8433308494783904, "train_speed(iter/s)": 0.458125 }, { "epoch": 2.04, "grad_norm": 3.8780994415283203, "learning_rate": 2.4536778439039045e-06, "loss": 0.569395637512207, "memory(GiB)": 64.44, "step": 2805, "token_acc": 0.8455534531693472, "train_speed(iter/s)": 0.458151 }, { "epoch": 2.0436363636363635, "grad_norm": 3.4846231937408447, "learning_rate": 2.4368036949224733e-06, "loss": 0.5532159328460693, "memory(GiB)": 64.44, "step": 2810, "token_acc": 0.8399535423925668, "train_speed(iter/s)": 0.458204 }, { "epoch": 2.0472727272727274, "grad_norm": 4.17202615737915, "learning_rate": 2.419969053842498e-06, "loss": 0.5738080978393555, "memory(GiB)": 64.44, "step": 2815, "token_acc": 0.8741489581184237, "train_speed(iter/s)": 0.458185 }, { "epoch": 2.050909090909091, "grad_norm": 3.1433913707733154, "learning_rate": 2.4031741801452095e-06, "loss": 0.5935293197631836, "memory(GiB)": 64.44, "step": 2820, "token_acc": 0.8103585657370518, "train_speed(iter/s)": 0.458209 }, { "epoch": 2.0545454545454547, "grad_norm": 4.294399738311768, "learning_rate": 2.386419332698888e-06, "loss": 0.5968852043151855, "memory(GiB)": 64.44, "step": 2825, "token_acc": 0.8341388400702988, "train_speed(iter/s)": 0.458263 }, { "epoch": 2.058181818181818, "grad_norm": 3.853757619857788, "learning_rate": 2.369704769754868e-06, "loss": 0.5755794048309326, "memory(GiB)": 64.44, "step": 2830, "token_acc": 0.8497652582159625, "train_speed(iter/s)": 0.458303 }, { "epoch": 2.061818181818182, "grad_norm": 3.72324275970459, "learning_rate": 2.3530307489435523e-06, "loss": 0.5538017272949218, "memory(GiB)": 64.44, "step": 2835, "token_acc": 0.834593572778828, "train_speed(iter/s)": 0.458371 }, { "epoch": 2.0654545454545454, "grad_norm": 3.630908250808716, "learning_rate": 2.3363975272704515e-06, "loss": 0.5382684707641602, "memory(GiB)": 64.44, "step": 2840, "token_acc": 0.8325254483761513, "train_speed(iter/s)": 0.458392 }, { "epoch": 2.0690909090909093, "grad_norm": 4.250785827636719, "learning_rate": 2.319805361112217e-06, "loss": 0.5941808700561524, "memory(GiB)": 64.44, "step": 2845, "token_acc": 0.8257705479452054, "train_speed(iter/s)": 0.458415 }, { "epoch": 2.0727272727272728, "grad_norm": 3.9917092323303223, "learning_rate": 2.303254506212687e-06, "loss": 0.5847339153289794, "memory(GiB)": 64.44, "step": 2850, "token_acc": 0.8336499321573948, "train_speed(iter/s)": 0.458488 }, { "epoch": 2.076363636363636, "grad_norm": 4.361266613006592, "learning_rate": 2.2867452176789495e-06, "loss": 0.5764480590820312, "memory(GiB)": 64.44, "step": 2855, "token_acc": 0.8504418762746431, "train_speed(iter/s)": 0.458449 }, { "epoch": 2.08, "grad_norm": 3.822355270385742, "learning_rate": 2.270277749977408e-06, "loss": 0.5814784049987793, "memory(GiB)": 64.44, "step": 2860, "token_acc": 0.8517949702438088, "train_speed(iter/s)": 0.458441 }, { "epoch": 2.0836363636363635, "grad_norm": 4.25092077255249, "learning_rate": 2.253852356929861e-06, "loss": 0.5927882671356202, "memory(GiB)": 64.44, "step": 2865, "token_acc": 0.8643165946125707, "train_speed(iter/s)": 0.458426 }, { "epoch": 2.0872727272727274, "grad_norm": 3.814818859100342, "learning_rate": 2.237469291709582e-06, "loss": 0.5530673027038574, "memory(GiB)": 64.44, "step": 2870, "token_acc": 0.8843641114982579, "train_speed(iter/s)": 0.458492 }, { "epoch": 2.090909090909091, "grad_norm": 3.3128604888916016, "learning_rate": 2.2211288068374304e-06, "loss": 0.5221426010131835, "memory(GiB)": 64.44, "step": 2875, "token_acc": 0.8021608643457383, "train_speed(iter/s)": 0.458514 }, { "epoch": 2.0945454545454547, "grad_norm": 3.841860055923462, "learning_rate": 2.2048311541779483e-06, "loss": 0.5207252025604248, "memory(GiB)": 64.44, "step": 2880, "token_acc": 0.8762656946132037, "train_speed(iter/s)": 0.458498 }, { "epoch": 2.098181818181818, "grad_norm": 4.4180145263671875, "learning_rate": 2.188576584935483e-06, "loss": 0.5573165893554688, "memory(GiB)": 64.44, "step": 2885, "token_acc": 0.8565947242206235, "train_speed(iter/s)": 0.458576 }, { "epoch": 2.101818181818182, "grad_norm": 3.850353956222534, "learning_rate": 2.1723653496503156e-06, "loss": 0.5557028770446777, "memory(GiB)": 64.44, "step": 2890, "token_acc": 0.8416609628108601, "train_speed(iter/s)": 0.4586 }, { "epoch": 2.1054545454545455, "grad_norm": 4.130335807800293, "learning_rate": 2.1561976981947974e-06, "loss": 0.5635205268859863, "memory(GiB)": 64.44, "step": 2895, "token_acc": 0.8624701195219123, "train_speed(iter/s)": 0.458599 }, { "epoch": 2.109090909090909, "grad_norm": 3.935039520263672, "learning_rate": 2.1400738797694954e-06, "loss": 0.5272860527038574, "memory(GiB)": 64.44, "step": 2900, "token_acc": 0.8585553419390277, "train_speed(iter/s)": 0.458627 }, { "epoch": 2.112727272727273, "grad_norm": 3.9505932331085205, "learning_rate": 2.1239941428993593e-06, "loss": 0.5397134780883789, "memory(GiB)": 64.44, "step": 2905, "token_acc": 0.8265644955300128, "train_speed(iter/s)": 0.458668 }, { "epoch": 2.1163636363636362, "grad_norm": 3.789020299911499, "learning_rate": 2.1079587354298865e-06, "loss": 0.5284680366516114, "memory(GiB)": 64.44, "step": 2910, "token_acc": 0.8370165745856354, "train_speed(iter/s)": 0.458724 }, { "epoch": 2.12, "grad_norm": 4.089132785797119, "learning_rate": 2.0919679045233004e-06, "loss": 0.5436430454254151, "memory(GiB)": 64.44, "step": 2915, "token_acc": 0.8373091603053435, "train_speed(iter/s)": 0.458761 }, { "epoch": 2.1236363636363635, "grad_norm": 4.195389270782471, "learning_rate": 2.0760218966547403e-06, "loss": 0.49860348701477053, "memory(GiB)": 64.44, "step": 2920, "token_acc": 0.8677836092046831, "train_speed(iter/s)": 0.458759 }, { "epoch": 2.1272727272727274, "grad_norm": 4.3651862144470215, "learning_rate": 2.0601209576084675e-06, "loss": 0.5386879444122314, "memory(GiB)": 64.44, "step": 2925, "token_acc": 0.8342798141455859, "train_speed(iter/s)": 0.458777 }, { "epoch": 2.130909090909091, "grad_norm": 4.288598537445068, "learning_rate": 2.0442653324740747e-06, "loss": 0.5425639629364014, "memory(GiB)": 64.44, "step": 2930, "token_acc": 0.8665203511572227, "train_speed(iter/s)": 0.4588 }, { "epoch": 2.1345454545454547, "grad_norm": 3.187136650085449, "learning_rate": 2.028455265642701e-06, "loss": 0.5388356208801269, "memory(GiB)": 64.44, "step": 2935, "token_acc": 0.8361738389433319, "train_speed(iter/s)": 0.458812 }, { "epoch": 2.138181818181818, "grad_norm": 3.3392493724823, "learning_rate": 2.0126910008032775e-06, "loss": 0.49450435638427737, "memory(GiB)": 64.44, "step": 2940, "token_acc": 0.8647859922178989, "train_speed(iter/s)": 0.458795 }, { "epoch": 2.1418181818181816, "grad_norm": 3.969228506088257, "learning_rate": 1.9969727809387645e-06, "loss": 0.5926756858825684, "memory(GiB)": 64.44, "step": 2945, "token_acc": 0.8393939393939394, "train_speed(iter/s)": 0.45886 }, { "epoch": 2.1454545454545455, "grad_norm": 3.8145792484283447, "learning_rate": 1.981300848322401e-06, "loss": 0.5568334102630615, "memory(GiB)": 64.44, "step": 2950, "token_acc": 0.8597499155119973, "train_speed(iter/s)": 0.458896 }, { "epoch": 2.149090909090909, "grad_norm": 3.3614907264709473, "learning_rate": 1.9656754445139838e-06, "loss": 0.5743967056274414, "memory(GiB)": 64.44, "step": 2955, "token_acc": 0.8292061179898034, "train_speed(iter/s)": 0.458934 }, { "epoch": 2.152727272727273, "grad_norm": 3.790090322494507, "learning_rate": 1.9500968103561306e-06, "loss": 0.5191942691802979, "memory(GiB)": 64.44, "step": 2960, "token_acc": 0.8744884038199181, "train_speed(iter/s)": 0.458944 }, { "epoch": 2.1563636363636363, "grad_norm": 3.9427294731140137, "learning_rate": 1.9345651859705794e-06, "loss": 0.5102787971496582, "memory(GiB)": 64.44, "step": 2965, "token_acc": 0.8653482011361245, "train_speed(iter/s)": 0.458942 }, { "epoch": 2.16, "grad_norm": 3.465834140777588, "learning_rate": 1.9190808107544743e-06, "loss": 0.5655551433563233, "memory(GiB)": 64.44, "step": 2970, "token_acc": 0.8827075439200827, "train_speed(iter/s)": 0.458901 }, { "epoch": 2.1636363636363636, "grad_norm": 4.011518478393555, "learning_rate": 1.903643923376689e-06, "loss": 0.5846277236938476, "memory(GiB)": 64.44, "step": 2975, "token_acc": 0.8455261676983681, "train_speed(iter/s)": 0.458965 }, { "epoch": 2.1672727272727275, "grad_norm": 4.44923734664917, "learning_rate": 1.8882547617741414e-06, "loss": 0.5695096969604492, "memory(GiB)": 64.44, "step": 2980, "token_acc": 0.8611372180451128, "train_speed(iter/s)": 0.459009 }, { "epoch": 2.170909090909091, "grad_norm": 4.384074687957764, "learning_rate": 1.8729135631481222e-06, "loss": 0.5614648818969726, "memory(GiB)": 64.44, "step": 2985, "token_acc": 0.8193957968476357, "train_speed(iter/s)": 0.459036 }, { "epoch": 2.174545454545455, "grad_norm": 3.7020986080169678, "learning_rate": 1.8576205639606482e-06, "loss": 0.5832395553588867, "memory(GiB)": 64.44, "step": 2990, "token_acc": 0.8895298024820836, "train_speed(iter/s)": 0.459045 }, { "epoch": 2.178181818181818, "grad_norm": 3.8569514751434326, "learning_rate": 1.8423759999308132e-06, "loss": 0.5824544906616211, "memory(GiB)": 64.44, "step": 2995, "token_acc": 0.8710670314637483, "train_speed(iter/s)": 0.459023 }, { "epoch": 2.1818181818181817, "grad_norm": 3.4723124504089355, "learning_rate": 1.8271801060311485e-06, "loss": 0.5585835456848145, "memory(GiB)": 64.44, "step": 3000, "token_acc": 0.8206177132337902, "train_speed(iter/s)": 0.459065 }, { "epoch": 2.1854545454545455, "grad_norm": 3.9203343391418457, "learning_rate": 1.8120331164840116e-06, "loss": 0.5572877883911133, "memory(GiB)": 64.44, "step": 3005, "token_acc": 0.8126218323586745, "train_speed(iter/s)": 0.459105 }, { "epoch": 2.189090909090909, "grad_norm": 3.1291725635528564, "learning_rate": 1.7969352647579707e-06, "loss": 0.4823342800140381, "memory(GiB)": 64.44, "step": 3010, "token_acc": 0.8701427438540841, "train_speed(iter/s)": 0.459041 }, { "epoch": 2.192727272727273, "grad_norm": 4.418652057647705, "learning_rate": 1.781886783564209e-06, "loss": 0.5473741054534912, "memory(GiB)": 64.44, "step": 3015, "token_acc": 0.8813121272365805, "train_speed(iter/s)": 0.459057 }, { "epoch": 2.1963636363636363, "grad_norm": 4.301779747009277, "learning_rate": 1.766887904852928e-06, "loss": 0.5795573234558106, "memory(GiB)": 64.44, "step": 3020, "token_acc": 0.8556416881998278, "train_speed(iter/s)": 0.459081 }, { "epoch": 2.2, "grad_norm": 3.995138168334961, "learning_rate": 1.7519388598097876e-06, "loss": 0.5912516593933106, "memory(GiB)": 64.44, "step": 3025, "token_acc": 0.8219990871748061, "train_speed(iter/s)": 0.459103 }, { "epoch": 2.2036363636363636, "grad_norm": 4.0938262939453125, "learning_rate": 1.7370398788523319e-06, "loss": 0.52225341796875, "memory(GiB)": 64.44, "step": 3030, "token_acc": 0.8836140888208269, "train_speed(iter/s)": 0.45914 }, { "epoch": 2.207272727272727, "grad_norm": 4.07735538482666, "learning_rate": 1.7221911916264405e-06, "loss": 0.5614495754241944, "memory(GiB)": 64.44, "step": 3035, "token_acc": 0.8265093684941013, "train_speed(iter/s)": 0.459167 }, { "epoch": 2.210909090909091, "grad_norm": 4.394158840179443, "learning_rate": 1.7073930270027905e-06, "loss": 0.5650532722473145, "memory(GiB)": 64.44, "step": 3040, "token_acc": 0.8541278708876474, "train_speed(iter/s)": 0.459208 }, { "epoch": 2.2145454545454544, "grad_norm": 3.5056724548339844, "learning_rate": 1.6926456130733277e-06, "loss": 0.5250924110412598, "memory(GiB)": 64.44, "step": 3045, "token_acc": 0.8541409147095179, "train_speed(iter/s)": 0.459263 }, { "epoch": 2.2181818181818183, "grad_norm": 3.697410821914673, "learning_rate": 1.6779491771477457e-06, "loss": 0.5638864517211915, "memory(GiB)": 64.44, "step": 3050, "token_acc": 0.8667886550777676, "train_speed(iter/s)": 0.459288 }, { "epoch": 2.2218181818181817, "grad_norm": 4.366413116455078, "learning_rate": 1.6633039457499933e-06, "loss": 0.527287483215332, "memory(GiB)": 64.44, "step": 3055, "token_acc": 0.8699014111734004, "train_speed(iter/s)": 0.459302 }, { "epoch": 2.2254545454545456, "grad_norm": 4.17656946182251, "learning_rate": 1.6487101446147758e-06, "loss": 0.5217004776000976, "memory(GiB)": 64.44, "step": 3060, "token_acc": 0.8625788643533123, "train_speed(iter/s)": 0.459271 }, { "epoch": 2.229090909090909, "grad_norm": 4.382239818572998, "learning_rate": 1.634167998684072e-06, "loss": 0.5332613945007324, "memory(GiB)": 64.44, "step": 3065, "token_acc": 0.8863858961802155, "train_speed(iter/s)": 0.459241 }, { "epoch": 2.232727272727273, "grad_norm": 3.959284782409668, "learning_rate": 1.6196777321036756e-06, "loss": 0.6081136226654053, "memory(GiB)": 64.44, "step": 3070, "token_acc": 0.8399458972046889, "train_speed(iter/s)": 0.459281 }, { "epoch": 2.2363636363636363, "grad_norm": 3.482314348220825, "learning_rate": 1.6052395682197363e-06, "loss": 0.5248013019561768, "memory(GiB)": 64.44, "step": 3075, "token_acc": 0.8643042350907519, "train_speed(iter/s)": 0.459336 }, { "epoch": 2.24, "grad_norm": 4.430671691894531, "learning_rate": 1.590853729575319e-06, "loss": 0.6185288429260254, "memory(GiB)": 64.44, "step": 3080, "token_acc": 0.8582693085321472, "train_speed(iter/s)": 0.459367 }, { "epoch": 2.2436363636363637, "grad_norm": 4.537671089172363, "learning_rate": 1.5765204379069654e-06, "loss": 0.6154137134552002, "memory(GiB)": 64.44, "step": 3085, "token_acc": 0.8374798639699302, "train_speed(iter/s)": 0.459393 }, { "epoch": 2.247272727272727, "grad_norm": 3.5833494663238525, "learning_rate": 1.5622399141412898e-06, "loss": 0.5241693019866943, "memory(GiB)": 64.44, "step": 3090, "token_acc": 0.8457924836601307, "train_speed(iter/s)": 0.459391 }, { "epoch": 2.250909090909091, "grad_norm": 4.317352294921875, "learning_rate": 1.5480123783915645e-06, "loss": 0.5752131462097168, "memory(GiB)": 64.44, "step": 3095, "token_acc": 0.8522615535889873, "train_speed(iter/s)": 0.459459 }, { "epoch": 2.2545454545454544, "grad_norm": 3.6059021949768066, "learning_rate": 1.5338380499543276e-06, "loss": 0.5613752365112304, "memory(GiB)": 64.44, "step": 3100, "token_acc": 0.8562077241981235, "train_speed(iter/s)": 0.459508 }, { "epoch": 2.2581818181818183, "grad_norm": 5.299020290374756, "learning_rate": 1.5197171473060075e-06, "loss": 0.5874448299407959, "memory(GiB)": 64.44, "step": 3105, "token_acc": 0.8576022048690859, "train_speed(iter/s)": 0.459539 }, { "epoch": 2.2618181818181817, "grad_norm": 4.414374351501465, "learning_rate": 1.5056498880995524e-06, "loss": 0.571533203125, "memory(GiB)": 64.44, "step": 3110, "token_acc": 0.839841010053776, "train_speed(iter/s)": 0.459539 }, { "epoch": 2.2654545454545456, "grad_norm": 3.932117223739624, "learning_rate": 1.491636489161072e-06, "loss": 0.516119384765625, "memory(GiB)": 64.44, "step": 3115, "token_acc": 0.8690719732192672, "train_speed(iter/s)": 0.45957 }, { "epoch": 2.269090909090909, "grad_norm": 3.662917137145996, "learning_rate": 1.4776771664865036e-06, "loss": 0.5404162883758545, "memory(GiB)": 64.44, "step": 3120, "token_acc": 0.8421052631578947, "train_speed(iter/s)": 0.459592 }, { "epoch": 2.2727272727272725, "grad_norm": 4.036909103393555, "learning_rate": 1.4637721352382772e-06, "loss": 0.5555058479309082, "memory(GiB)": 64.44, "step": 3125, "token_acc": 0.8584229390681004, "train_speed(iter/s)": 0.459626 }, { "epoch": 2.2763636363636364, "grad_norm": 3.80786395072937, "learning_rate": 1.449921609742001e-06, "loss": 0.5728797912597656, "memory(GiB)": 64.44, "step": 3130, "token_acc": 0.8645363654185454, "train_speed(iter/s)": 0.459659 }, { "epoch": 2.2800000000000002, "grad_norm": 3.886758327484131, "learning_rate": 1.4361258034831533e-06, "loss": 0.5380870819091796, "memory(GiB)": 64.44, "step": 3135, "token_acc": 0.8600067957866123, "train_speed(iter/s)": 0.459649 }, { "epoch": 2.2836363636363637, "grad_norm": 3.8579964637756348, "learning_rate": 1.4223849291038e-06, "loss": 0.5628611087799072, "memory(GiB)": 64.44, "step": 3140, "token_acc": 0.8469529085872576, "train_speed(iter/s)": 0.459697 }, { "epoch": 2.287272727272727, "grad_norm": 4.657957553863525, "learning_rate": 1.4086991983993132e-06, "loss": 0.5323144912719726, "memory(GiB)": 64.44, "step": 3145, "token_acc": 0.865530303030303, "train_speed(iter/s)": 0.459743 }, { "epoch": 2.290909090909091, "grad_norm": 4.06402063369751, "learning_rate": 1.3950688223151009e-06, "loss": 0.5702249526977539, "memory(GiB)": 64.44, "step": 3150, "token_acc": 0.8512775715221664, "train_speed(iter/s)": 0.459758 }, { "epoch": 2.2945454545454544, "grad_norm": 3.851614475250244, "learning_rate": 1.3814940109433678e-06, "loss": 0.5616402626037598, "memory(GiB)": 64.44, "step": 3155, "token_acc": 0.8460471567267683, "train_speed(iter/s)": 0.459824 }, { "epoch": 2.2981818181818183, "grad_norm": 4.075229644775391, "learning_rate": 1.367974973519866e-06, "loss": 0.6098086357116699, "memory(GiB)": 64.44, "step": 3160, "token_acc": 0.8224387924887093, "train_speed(iter/s)": 0.459885 }, { "epoch": 2.3018181818181818, "grad_norm": 4.408036708831787, "learning_rate": 1.3545119184206778e-06, "loss": 0.584037971496582, "memory(GiB)": 64.44, "step": 3165, "token_acc": 0.8570526315789474, "train_speed(iter/s)": 0.459931 }, { "epoch": 2.3054545454545456, "grad_norm": 3.7412238121032715, "learning_rate": 1.3411050531589942e-06, "loss": 0.5043732643127441, "memory(GiB)": 64.44, "step": 3170, "token_acc": 0.8607445008460237, "train_speed(iter/s)": 0.459923 }, { "epoch": 2.309090909090909, "grad_norm": 4.605288028717041, "learning_rate": 1.3277545843819278e-06, "loss": 0.5658152103424072, "memory(GiB)": 64.44, "step": 3175, "token_acc": 0.8707877705869226, "train_speed(iter/s)": 0.459985 }, { "epoch": 2.3127272727272725, "grad_norm": 3.898077964782715, "learning_rate": 1.314460717867322e-06, "loss": 0.5670787334442139, "memory(GiB)": 64.44, "step": 3180, "token_acc": 0.8559006211180125, "train_speed(iter/s)": 0.459978 }, { "epoch": 2.3163636363636364, "grad_norm": 3.6667439937591553, "learning_rate": 1.3012236585205773e-06, "loss": 0.6092076301574707, "memory(GiB)": 64.44, "step": 3185, "token_acc": 0.81068524970964, "train_speed(iter/s)": 0.460006 }, { "epoch": 2.32, "grad_norm": 3.862675905227661, "learning_rate": 1.2880436103714962e-06, "loss": 0.503480339050293, "memory(GiB)": 64.44, "step": 3190, "token_acc": 0.8837376891664664, "train_speed(iter/s)": 0.460016 }, { "epoch": 2.3236363636363637, "grad_norm": 3.480212926864624, "learning_rate": 1.2749207765711398e-06, "loss": 0.4982267379760742, "memory(GiB)": 64.44, "step": 3195, "token_acc": 0.8575321136629038, "train_speed(iter/s)": 0.46002 }, { "epoch": 2.327272727272727, "grad_norm": 4.333157539367676, "learning_rate": 1.2618553593886885e-06, "loss": 0.52719144821167, "memory(GiB)": 64.44, "step": 3200, "token_acc": 0.8505338078291815, "train_speed(iter/s)": 0.46006 }, { "epoch": 2.330909090909091, "grad_norm": 3.873192071914673, "learning_rate": 1.2488475602083345e-06, "loss": 0.5189596176147461, "memory(GiB)": 64.44, "step": 3205, "token_acc": 0.8571148569188554, "train_speed(iter/s)": 0.460068 }, { "epoch": 2.3345454545454545, "grad_norm": 3.650998115539551, "learning_rate": 1.2358975795261746e-06, "loss": 0.5396578788757325, "memory(GiB)": 64.44, "step": 3210, "token_acc": 0.8491717523975588, "train_speed(iter/s)": 0.460102 }, { "epoch": 2.3381818181818184, "grad_norm": 4.723164081573486, "learning_rate": 1.2230056169471122e-06, "loss": 0.5817994117736817, "memory(GiB)": 64.44, "step": 3215, "token_acc": 0.844311377245509, "train_speed(iter/s)": 0.460144 }, { "epoch": 2.341818181818182, "grad_norm": 4.452855110168457, "learning_rate": 1.2101718711817928e-06, "loss": 0.5918424606323243, "memory(GiB)": 64.44, "step": 3220, "token_acc": 0.8243565932608119, "train_speed(iter/s)": 0.460201 }, { "epoch": 2.3454545454545457, "grad_norm": 4.132510185241699, "learning_rate": 1.1973965400435344e-06, "loss": 0.5174155712127686, "memory(GiB)": 64.44, "step": 3225, "token_acc": 0.8721298495645289, "train_speed(iter/s)": 0.460229 }, { "epoch": 2.349090909090909, "grad_norm": 4.476179599761963, "learning_rate": 1.1846798204452754e-06, "loss": 0.5070356845855712, "memory(GiB)": 64.44, "step": 3230, "token_acc": 0.8643922509857707, "train_speed(iter/s)": 0.460216 }, { "epoch": 2.3527272727272726, "grad_norm": 4.049841403961182, "learning_rate": 1.1720219083965478e-06, "loss": 0.5351714134216309, "memory(GiB)": 64.44, "step": 3235, "token_acc": 0.8564006650041562, "train_speed(iter/s)": 0.460236 }, { "epoch": 2.3563636363636364, "grad_norm": 4.259440898895264, "learning_rate": 1.1594229990004508e-06, "loss": 0.5463751792907715, "memory(GiB)": 64.44, "step": 3240, "token_acc": 0.8500355366027008, "train_speed(iter/s)": 0.460272 }, { "epoch": 2.36, "grad_norm": 3.7025094032287598, "learning_rate": 1.1468832864506458e-06, "loss": 0.5029178619384765, "memory(GiB)": 64.44, "step": 3245, "token_acc": 0.875223271242664, "train_speed(iter/s)": 0.460289 }, { "epoch": 2.3636363636363638, "grad_norm": 4.097626686096191, "learning_rate": 1.134402964028356e-06, "loss": 0.5285816192626953, "memory(GiB)": 64.44, "step": 3250, "token_acc": 0.8633448445979279, "train_speed(iter/s)": 0.460296 }, { "epoch": 2.367272727272727, "grad_norm": 4.1264801025390625, "learning_rate": 1.1219822240993994e-06, "loss": 0.5510709762573243, "memory(GiB)": 64.44, "step": 3255, "token_acc": 0.8759833410458121, "train_speed(iter/s)": 0.4603 }, { "epoch": 2.370909090909091, "grad_norm": 4.0943379402160645, "learning_rate": 1.109621258111217e-06, "loss": 0.5874659538269043, "memory(GiB)": 64.44, "step": 3260, "token_acc": 0.8329943043124491, "train_speed(iter/s)": 0.460293 }, { "epoch": 2.3745454545454545, "grad_norm": 3.5104446411132812, "learning_rate": 1.0973202565899172e-06, "loss": 0.5906445503234863, "memory(GiB)": 64.44, "step": 3265, "token_acc": 0.8552338530066815, "train_speed(iter/s)": 0.460302 }, { "epoch": 2.378181818181818, "grad_norm": 4.113192081451416, "learning_rate": 1.0850794091373502e-06, "loss": 0.5461389541625976, "memory(GiB)": 64.44, "step": 3270, "token_acc": 0.8535174472849412, "train_speed(iter/s)": 0.460292 }, { "epoch": 2.381818181818182, "grad_norm": 3.782274007797241, "learning_rate": 1.0728989044281779e-06, "loss": 0.5787214279174805, "memory(GiB)": 64.44, "step": 3275, "token_acc": 0.8531020177258156, "train_speed(iter/s)": 0.460331 }, { "epoch": 2.3854545454545453, "grad_norm": 3.9185631275177, "learning_rate": 1.060778930206965e-06, "loss": 0.5424469470977783, "memory(GiB)": 64.44, "step": 3280, "token_acc": 0.863598844407759, "train_speed(iter/s)": 0.460373 }, { "epoch": 2.389090909090909, "grad_norm": 3.632422924041748, "learning_rate": 1.04871967328529e-06, "loss": 0.5419508457183838, "memory(GiB)": 64.44, "step": 3285, "token_acc": 0.8583182821593418, "train_speed(iter/s)": 0.460396 }, { "epoch": 2.3927272727272726, "grad_norm": 3.406076192855835, "learning_rate": 1.0367213195388649e-06, "loss": 0.5859408378601074, "memory(GiB)": 64.44, "step": 3290, "token_acc": 0.8361921097770154, "train_speed(iter/s)": 0.460399 }, { "epoch": 2.3963636363636365, "grad_norm": 4.544106960296631, "learning_rate": 1.0247840539046672e-06, "loss": 0.5752851486206054, "memory(GiB)": 64.44, "step": 3295, "token_acc": 0.8585009949148795, "train_speed(iter/s)": 0.460426 }, { "epoch": 2.4, "grad_norm": 4.9750142097473145, "learning_rate": 1.012908060378089e-06, "loss": 0.532856035232544, "memory(GiB)": 64.44, "step": 3300, "token_acc": 0.8393331722638319, "train_speed(iter/s)": 0.460466 }, { "epoch": 2.403636363636364, "grad_norm": 3.526374101638794, "learning_rate": 1.001093522010106e-06, "loss": 0.5794241905212403, "memory(GiB)": 64.44, "step": 3305, "token_acc": 0.8321299638989169, "train_speed(iter/s)": 0.460506 }, { "epoch": 2.4072727272727272, "grad_norm": 4.099818706512451, "learning_rate": 9.89340620904452e-07, "loss": 0.5658499240875244, "memory(GiB)": 64.44, "step": 3310, "token_acc": 0.85, "train_speed(iter/s)": 0.46052 }, { "epoch": 2.410909090909091, "grad_norm": 3.6997690200805664, "learning_rate": 9.776495382148132e-07, "loss": 0.5323297500610351, "memory(GiB)": 64.44, "step": 3315, "token_acc": 0.8670710133939853, "train_speed(iter/s)": 0.460555 }, { "epoch": 2.4145454545454546, "grad_norm": 4.329352855682373, "learning_rate": 9.66020454142037e-07, "loss": 0.6215848922729492, "memory(GiB)": 64.44, "step": 3320, "token_acc": 0.8559788144224894, "train_speed(iter/s)": 0.460585 }, { "epoch": 2.418181818181818, "grad_norm": 4.3700361251831055, "learning_rate": 9.544535479313494e-07, "loss": 0.5541114330291748, "memory(GiB)": 64.44, "step": 3325, "token_acc": 0.8365769128232471, "train_speed(iter/s)": 0.460599 }, { "epoch": 2.421818181818182, "grad_norm": 3.6950056552886963, "learning_rate": 9.429489978695994e-07, "loss": 0.5436219215393067, "memory(GiB)": 64.44, "step": 3330, "token_acc": 0.8593533487297922, "train_speed(iter/s)": 0.460639 }, { "epoch": 2.4254545454545453, "grad_norm": 3.716181755065918, "learning_rate": 9.315069812825073e-07, "loss": 0.6107286930084228, "memory(GiB)": 64.44, "step": 3335, "token_acc": 0.855609756097561, "train_speed(iter/s)": 0.460656 }, { "epoch": 2.429090909090909, "grad_norm": 4.002308368682861, "learning_rate": 9.20127674531932e-07, "loss": 0.5892920970916748, "memory(GiB)": 64.44, "step": 3340, "token_acc": 0.8453924110299317, "train_speed(iter/s)": 0.4607 }, { "epoch": 2.4327272727272726, "grad_norm": 3.5489273071289062, "learning_rate": 9.088112530131527e-07, "loss": 0.5960803508758545, "memory(GiB)": 64.44, "step": 3345, "token_acc": 0.8484493856056173, "train_speed(iter/s)": 0.46075 }, { "epoch": 2.4363636363636365, "grad_norm": 3.402630090713501, "learning_rate": 8.975578911521616e-07, "loss": 0.5366581439971924, "memory(GiB)": 64.44, "step": 3350, "token_acc": 0.8674698795180723, "train_speed(iter/s)": 0.460789 }, { "epoch": 2.44, "grad_norm": 4.412635803222656, "learning_rate": 8.863677624029837e-07, "loss": 0.6205951690673828, "memory(GiB)": 64.44, "step": 3355, "token_acc": 0.8476459890887048, "train_speed(iter/s)": 0.460848 }, { "epoch": 2.443636363636364, "grad_norm": 3.683108329772949, "learning_rate": 8.752410392449984e-07, "loss": 0.5838453769683838, "memory(GiB)": 64.44, "step": 3360, "token_acc": 0.853091684434968, "train_speed(iter/s)": 0.460866 }, { "epoch": 2.4472727272727273, "grad_norm": 5.493093967437744, "learning_rate": 8.641778931802763e-07, "loss": 0.5790290832519531, "memory(GiB)": 64.44, "step": 3365, "token_acc": 0.8514484861685907, "train_speed(iter/s)": 0.46087 }, { "epoch": 2.450909090909091, "grad_norm": 4.477910995483398, "learning_rate": 8.531784947309458e-07, "loss": 0.5288788795471191, "memory(GiB)": 64.44, "step": 3370, "token_acc": 0.8701589889930698, "train_speed(iter/s)": 0.460883 }, { "epoch": 2.4545454545454546, "grad_norm": 3.794621706008911, "learning_rate": 8.422430134365584e-07, "loss": 0.5916152000427246, "memory(GiB)": 64.44, "step": 3375, "token_acc": 0.8327744243237201, "train_speed(iter/s)": 0.460914 }, { "epoch": 2.458181818181818, "grad_norm": 3.1803672313690186, "learning_rate": 8.31371617851473e-07, "loss": 0.5673966407775879, "memory(GiB)": 64.44, "step": 3380, "token_acc": 0.8521260841971652, "train_speed(iter/s)": 0.460936 }, { "epoch": 2.461818181818182, "grad_norm": 3.857543706893921, "learning_rate": 8.20564475542267e-07, "loss": 0.5137066841125488, "memory(GiB)": 64.44, "step": 3385, "token_acc": 0.8740687334775294, "train_speed(iter/s)": 0.460965 }, { "epoch": 2.4654545454545453, "grad_norm": 4.353023052215576, "learning_rate": 8.098217530851454e-07, "loss": 0.513277816772461, "memory(GiB)": 64.44, "step": 3390, "token_acc": 0.8848245180425112, "train_speed(iter/s)": 0.46101 }, { "epoch": 2.4690909090909092, "grad_norm": 3.8349452018737793, "learning_rate": 7.991436160633742e-07, "loss": 0.534281873703003, "memory(GiB)": 64.44, "step": 3395, "token_acc": 0.8546059933407325, "train_speed(iter/s)": 0.461028 }, { "epoch": 2.4727272727272727, "grad_norm": 3.646422863006592, "learning_rate": 7.885302290647328e-07, "loss": 0.47332277297973635, "memory(GiB)": 64.44, "step": 3400, "token_acc": 0.8866328257191202, "train_speed(iter/s)": 0.461025 }, { "epoch": 2.4763636363636365, "grad_norm": 4.512187480926514, "learning_rate": 7.779817556789731e-07, "loss": 0.5604523658752442, "memory(GiB)": 64.44, "step": 3405, "token_acc": 0.8550799381124291, "train_speed(iter/s)": 0.461041 }, { "epoch": 2.48, "grad_norm": 3.4519810676574707, "learning_rate": 7.674983584953e-07, "loss": 0.548017930984497, "memory(GiB)": 64.44, "step": 3410, "token_acc": 0.8271052631578948, "train_speed(iter/s)": 0.461029 }, { "epoch": 2.4836363636363634, "grad_norm": 4.231698989868164, "learning_rate": 7.570801990998617e-07, "loss": 0.5751005649566651, "memory(GiB)": 64.44, "step": 3415, "token_acc": 0.8549730524252818, "train_speed(iter/s)": 0.461082 }, { "epoch": 2.4872727272727273, "grad_norm": 3.640695810317993, "learning_rate": 7.467274380732647e-07, "loss": 0.4948701858520508, "memory(GiB)": 64.44, "step": 3420, "token_acc": 0.8915375446960667, "train_speed(iter/s)": 0.461057 }, { "epoch": 2.4909090909090907, "grad_norm": 4.212837219238281, "learning_rate": 7.364402349880961e-07, "loss": 0.6127988815307617, "memory(GiB)": 64.44, "step": 3425, "token_acc": 0.8273244781783681, "train_speed(iter/s)": 0.461077 }, { "epoch": 2.4945454545454546, "grad_norm": 4.170472621917725, "learning_rate": 7.262187484064598e-07, "loss": 0.5763627052307129, "memory(GiB)": 64.44, "step": 3430, "token_acc": 0.8165927471954083, "train_speed(iter/s)": 0.461074 }, { "epoch": 2.498181818181818, "grad_norm": 4.051548004150391, "learning_rate": 7.160631358775411e-07, "loss": 0.5574194431304932, "memory(GiB)": 64.44, "step": 3435, "token_acc": 0.8442812982998454, "train_speed(iter/s)": 0.461084 }, { "epoch": 2.501818181818182, "grad_norm": 3.917257070541382, "learning_rate": 7.059735539351714e-07, "loss": 0.5000098705291748, "memory(GiB)": 64.44, "step": 3440, "token_acc": 0.8565266742338252, "train_speed(iter/s)": 0.461092 }, { "epoch": 2.5054545454545454, "grad_norm": 3.361421823501587, "learning_rate": 6.95950158095417e-07, "loss": 0.564305305480957, "memory(GiB)": 64.44, "step": 3445, "token_acc": 0.8359232175502742, "train_speed(iter/s)": 0.461116 }, { "epoch": 2.509090909090909, "grad_norm": 3.9124817848205566, "learning_rate": 6.859931028541849e-07, "loss": 0.5879053592681884, "memory(GiB)": 64.44, "step": 3450, "token_acc": 0.8065608465608466, "train_speed(iter/s)": 0.46113 }, { "epoch": 2.5127272727272727, "grad_norm": 4.365234851837158, "learning_rate": 6.761025416848377e-07, "loss": 0.5042540550231933, "memory(GiB)": 64.44, "step": 3455, "token_acc": 0.8511663286004056, "train_speed(iter/s)": 0.461186 }, { "epoch": 2.5163636363636366, "grad_norm": 3.8373539447784424, "learning_rate": 6.662786270358296e-07, "loss": 0.5439183235168457, "memory(GiB)": 64.44, "step": 3460, "token_acc": 0.85625, "train_speed(iter/s)": 0.461196 }, { "epoch": 2.52, "grad_norm": 4.121663570404053, "learning_rate": 6.565215103283584e-07, "loss": 0.5968369960784912, "memory(GiB)": 64.44, "step": 3465, "token_acc": 0.867917155138726, "train_speed(iter/s)": 0.461253 }, { "epoch": 2.5236363636363635, "grad_norm": 4.577036380767822, "learning_rate": 6.468313419540295e-07, "loss": 0.6250477790832519, "memory(GiB)": 64.44, "step": 3470, "token_acc": 0.7919896640826873, "train_speed(iter/s)": 0.461277 }, { "epoch": 2.5272727272727273, "grad_norm": 3.807965040206909, "learning_rate": 6.372082712725352e-07, "loss": 0.518894100189209, "memory(GiB)": 64.44, "step": 3475, "token_acc": 0.8521634615384616, "train_speed(iter/s)": 0.461252 }, { "epoch": 2.5309090909090908, "grad_norm": 3.836399555206299, "learning_rate": 6.276524466093592e-07, "loss": 0.5360546112060547, "memory(GiB)": 64.44, "step": 3480, "token_acc": 0.8698093689966011, "train_speed(iter/s)": 0.461221 }, { "epoch": 2.5345454545454547, "grad_norm": 3.81571102142334, "learning_rate": 6.181640152534845e-07, "loss": 0.5474881649017334, "memory(GiB)": 64.44, "step": 3485, "token_acc": 0.8732005521593375, "train_speed(iter/s)": 0.461203 }, { "epoch": 2.538181818181818, "grad_norm": 3.869523286819458, "learning_rate": 6.087431234551278e-07, "loss": 0.5763465881347656, "memory(GiB)": 64.44, "step": 3490, "token_acc": 0.8603756505996832, "train_speed(iter/s)": 0.461205 }, { "epoch": 2.541818181818182, "grad_norm": 4.300631999969482, "learning_rate": 5.993899164234795e-07, "loss": 0.5737009048461914, "memory(GiB)": 64.44, "step": 3495, "token_acc": 0.853713260040386, "train_speed(iter/s)": 0.461229 }, { "epoch": 2.5454545454545454, "grad_norm": 4.0556416511535645, "learning_rate": 5.901045383244708e-07, "loss": 0.558495044708252, "memory(GiB)": 64.44, "step": 3500, "token_acc": 0.8296205630354957, "train_speed(iter/s)": 0.461267 }, { "epoch": 2.549090909090909, "grad_norm": 4.591411590576172, "learning_rate": 5.808871322785503e-07, "loss": 0.537141990661621, "memory(GiB)": 64.44, "step": 3505, "token_acc": 0.8630566122174983, "train_speed(iter/s)": 0.461298 }, { "epoch": 2.5527272727272727, "grad_norm": 3.8997533321380615, "learning_rate": 5.717378403584766e-07, "loss": 0.5735316753387452, "memory(GiB)": 64.44, "step": 3510, "token_acc": 0.8538715769593956, "train_speed(iter/s)": 0.461339 }, { "epoch": 2.5563636363636366, "grad_norm": 4.364303112030029, "learning_rate": 5.626568035871282e-07, "loss": 0.610892391204834, "memory(GiB)": 64.44, "step": 3515, "token_acc": 0.8688324377137274, "train_speed(iter/s)": 0.461371 }, { "epoch": 2.56, "grad_norm": 4.005393028259277, "learning_rate": 5.536441619353322e-07, "loss": 0.5376082420349121, "memory(GiB)": 64.44, "step": 3520, "token_acc": 0.8538071065989847, "train_speed(iter/s)": 0.461379 }, { "epoch": 2.5636363636363635, "grad_norm": 3.683354616165161, "learning_rate": 5.447000543197067e-07, "loss": 0.47856903076171875, "memory(GiB)": 64.44, "step": 3525, "token_acc": 0.8590619307832422, "train_speed(iter/s)": 0.461392 }, { "epoch": 2.5672727272727274, "grad_norm": 3.6826767921447754, "learning_rate": 5.358246186005139e-07, "loss": 0.5937067031860351, "memory(GiB)": 64.44, "step": 3530, "token_acc": 0.8394269831088305, "train_speed(iter/s)": 0.461397 }, { "epoch": 2.570909090909091, "grad_norm": 3.76254940032959, "learning_rate": 5.270179915795442e-07, "loss": 0.5464666366577149, "memory(GiB)": 64.44, "step": 3535, "token_acc": 0.8444878048780488, "train_speed(iter/s)": 0.461425 }, { "epoch": 2.5745454545454547, "grad_norm": 4.266871452331543, "learning_rate": 5.182803089980032e-07, "loss": 0.5382218837738038, "memory(GiB)": 64.44, "step": 3540, "token_acc": 0.8665244191559981, "train_speed(iter/s)": 0.461445 }, { "epoch": 2.578181818181818, "grad_norm": 4.570847988128662, "learning_rate": 5.096117055344146e-07, "loss": 0.5921483039855957, "memory(GiB)": 64.44, "step": 3545, "token_acc": 0.849323753169907, "train_speed(iter/s)": 0.461488 }, { "epoch": 2.581818181818182, "grad_norm": 3.771512985229492, "learning_rate": 5.010123148025536e-07, "loss": 0.5578415870666504, "memory(GiB)": 64.44, "step": 3550, "token_acc": 0.8299770583736936, "train_speed(iter/s)": 0.461505 }, { "epoch": 2.5854545454545454, "grad_norm": 3.8370325565338135, "learning_rate": 4.924822693493819e-07, "loss": 0.5817060470581055, "memory(GiB)": 64.44, "step": 3555, "token_acc": 0.8504863153132776, "train_speed(iter/s)": 0.461528 }, { "epoch": 2.589090909090909, "grad_norm": 4.462881565093994, "learning_rate": 4.840217006530063e-07, "loss": 0.5203249454498291, "memory(GiB)": 64.44, "step": 3560, "token_acc": 0.8685489470030086, "train_speed(iter/s)": 0.461554 }, { "epoch": 2.5927272727272728, "grad_norm": 3.998481035232544, "learning_rate": 4.7563073912064826e-07, "loss": 0.5419306278228759, "memory(GiB)": 64.44, "step": 3565, "token_acc": 0.8826725699335882, "train_speed(iter/s)": 0.461575 }, { "epoch": 2.596363636363636, "grad_norm": 3.884657859802246, "learning_rate": 4.6730951408664126e-07, "loss": 0.6358286380767822, "memory(GiB)": 64.44, "step": 3570, "token_acc": 0.8244274809160306, "train_speed(iter/s)": 0.461616 }, { "epoch": 2.6, "grad_norm": 4.17387056350708, "learning_rate": 4.590581538104316e-07, "loss": 0.5894208431243897, "memory(GiB)": 64.44, "step": 3575, "token_acc": 0.8605391636595203, "train_speed(iter/s)": 0.461646 }, { "epoch": 2.6036363636363635, "grad_norm": 3.776859998703003, "learning_rate": 4.5087678547460157e-07, "loss": 0.5507136344909668, "memory(GiB)": 64.44, "step": 3580, "token_acc": 0.8549187725631769, "train_speed(iter/s)": 0.461652 }, { "epoch": 2.6072727272727274, "grad_norm": 3.787224769592285, "learning_rate": 4.42765535182913e-07, "loss": 0.5116243362426758, "memory(GiB)": 64.44, "step": 3585, "token_acc": 0.8763873775843308, "train_speed(iter/s)": 0.461668 }, { "epoch": 2.610909090909091, "grad_norm": 3.734219551086426, "learning_rate": 4.3472452795836116e-07, "loss": 0.5455838203430176, "memory(GiB)": 64.44, "step": 3590, "token_acc": 0.8290505815526102, "train_speed(iter/s)": 0.461668 }, { "epoch": 2.6145454545454543, "grad_norm": 3.9400975704193115, "learning_rate": 4.2675388774124525e-07, "loss": 0.507750129699707, "memory(GiB)": 64.44, "step": 3595, "token_acc": 0.8634268956849602, "train_speed(iter/s)": 0.461716 }, { "epoch": 2.618181818181818, "grad_norm": 4.625056743621826, "learning_rate": 4.1885373738726254e-07, "loss": 0.5847376346588135, "memory(GiB)": 64.44, "step": 3600, "token_acc": 0.8611609814482346, "train_speed(iter/s)": 0.461741 }, { "epoch": 2.621818181818182, "grad_norm": 3.855128765106201, "learning_rate": 4.1102419866561217e-07, "loss": 0.4857977867126465, "memory(GiB)": 64.44, "step": 3605, "token_acc": 0.8603732950466619, "train_speed(iter/s)": 0.461714 }, { "epoch": 2.6254545454545455, "grad_norm": 3.6857378482818604, "learning_rate": 4.0326539225712e-07, "loss": 0.5717270374298096, "memory(GiB)": 64.44, "step": 3610, "token_acc": 0.868129841386942, "train_speed(iter/s)": 0.461706 }, { "epoch": 2.629090909090909, "grad_norm": 3.903055191040039, "learning_rate": 3.9557743775237523e-07, "loss": 0.5993773937225342, "memory(GiB)": 64.44, "step": 3615, "token_acc": 0.8062308236960113, "train_speed(iter/s)": 0.461738 }, { "epoch": 2.632727272727273, "grad_norm": 3.270725727081299, "learning_rate": 3.87960453649891e-07, "loss": 0.5760551929473877, "memory(GiB)": 64.44, "step": 3620, "token_acc": 0.8619246861924686, "train_speed(iter/s)": 0.461774 }, { "epoch": 2.6363636363636362, "grad_norm": 4.472327709197998, "learning_rate": 3.8041455735427446e-07, "loss": 0.5789799690246582, "memory(GiB)": 64.44, "step": 3625, "token_acc": 0.8526070492280804, "train_speed(iter/s)": 0.461738 }, { "epoch": 2.64, "grad_norm": 4.271474838256836, "learning_rate": 3.7293986517441927e-07, "loss": 0.5459742069244384, "memory(GiB)": 64.44, "step": 3630, "token_acc": 0.862533692722372, "train_speed(iter/s)": 0.461757 }, { "epoch": 2.6436363636363636, "grad_norm": 4.120786190032959, "learning_rate": 3.655364923217136e-07, "loss": 0.5433560371398926, "memory(GiB)": 64.44, "step": 3635, "token_acc": 0.8354055654233274, "train_speed(iter/s)": 0.461783 }, { "epoch": 2.6472727272727274, "grad_norm": 4.382391929626465, "learning_rate": 3.5820455290826285e-07, "loss": 0.582338285446167, "memory(GiB)": 64.44, "step": 3640, "token_acc": 0.8313772455089821, "train_speed(iter/s)": 0.461828 }, { "epoch": 2.650909090909091, "grad_norm": 3.799560785293579, "learning_rate": 3.509441599451285e-07, "loss": 0.5547786712646484, "memory(GiB)": 64.44, "step": 3645, "token_acc": 0.8674388674388674, "train_speed(iter/s)": 0.461851 }, { "epoch": 2.6545454545454543, "grad_norm": 3.852847099304199, "learning_rate": 3.437554253405906e-07, "loss": 0.5601497650146484, "memory(GiB)": 64.44, "step": 3650, "token_acc": 0.8693735498839907, "train_speed(iter/s)": 0.461886 }, { "epoch": 2.658181818181818, "grad_norm": 4.284626483917236, "learning_rate": 3.366384598984229e-07, "loss": 0.5693297386169434, "memory(GiB)": 64.44, "step": 3655, "token_acc": 0.8661684782608695, "train_speed(iter/s)": 0.461922 }, { "epoch": 2.661818181818182, "grad_norm": 4.123050212860107, "learning_rate": 3.295933733161788e-07, "loss": 0.5483355045318603, "memory(GiB)": 64.44, "step": 3660, "token_acc": 0.8760154738878143, "train_speed(iter/s)": 0.461945 }, { "epoch": 2.6654545454545455, "grad_norm": 3.7868292331695557, "learning_rate": 3.2262027418350773e-07, "loss": 0.5330245971679688, "memory(GiB)": 64.44, "step": 3665, "token_acc": 0.859638673813778, "train_speed(iter/s)": 0.461908 }, { "epoch": 2.669090909090909, "grad_norm": 3.9128313064575195, "learning_rate": 3.157192699804784e-07, "loss": 0.5247835636138916, "memory(GiB)": 64.44, "step": 3670, "token_acc": 0.8648218196297034, "train_speed(iter/s)": 0.461888 }, { "epoch": 2.672727272727273, "grad_norm": 3.6926794052124023, "learning_rate": 3.0889046707592185e-07, "loss": 0.5355826854705811, "memory(GiB)": 64.44, "step": 3675, "token_acc": 0.8548972188633616, "train_speed(iter/s)": 0.461913 }, { "epoch": 2.6763636363636363, "grad_norm": 3.795276641845703, "learning_rate": 3.021339707257903e-07, "loss": 0.5026448249816895, "memory(GiB)": 64.44, "step": 3680, "token_acc": 0.8815384615384615, "train_speed(iter/s)": 0.461933 }, { "epoch": 2.68, "grad_norm": 3.9286348819732666, "learning_rate": 2.9544988507153984e-07, "loss": 0.5500066757202149, "memory(GiB)": 64.44, "step": 3685, "token_acc": 0.8544303797468354, "train_speed(iter/s)": 0.46193 }, { "epoch": 2.6836363636363636, "grad_norm": 3.818805694580078, "learning_rate": 2.8883831313852086e-07, "loss": 0.5495880126953125, "memory(GiB)": 64.44, "step": 3690, "token_acc": 0.8208686712927268, "train_speed(iter/s)": 0.461966 }, { "epoch": 2.6872727272727275, "grad_norm": 3.5088865756988525, "learning_rate": 2.822993568343907e-07, "loss": 0.5506268978118897, "memory(GiB)": 64.44, "step": 3695, "token_acc": 0.8467027559055118, "train_speed(iter/s)": 0.461986 }, { "epoch": 2.690909090909091, "grad_norm": 4.072029113769531, "learning_rate": 2.7583311694754424e-07, "loss": 0.5637264251708984, "memory(GiB)": 64.44, "step": 3700, "token_acc": 0.826214405360134, "train_speed(iter/s)": 0.462012 }, { "epoch": 2.6945454545454544, "grad_norm": 3.523855447769165, "learning_rate": 2.694396931455606e-07, "loss": 0.5251345634460449, "memory(GiB)": 64.44, "step": 3705, "token_acc": 0.8783808313668542, "train_speed(iter/s)": 0.462002 }, { "epoch": 2.6981818181818182, "grad_norm": 4.599588871002197, "learning_rate": 2.631191839736635e-07, "loss": 0.5488700866699219, "memory(GiB)": 64.44, "step": 3710, "token_acc": 0.8507853403141361, "train_speed(iter/s)": 0.462039 }, { "epoch": 2.7018181818181817, "grad_norm": 3.0808658599853516, "learning_rate": 2.5687168685320784e-07, "loss": 0.5053971767425537, "memory(GiB)": 64.44, "step": 3715, "token_acc": 0.8607594936708861, "train_speed(iter/s)": 0.462017 }, { "epoch": 2.7054545454545456, "grad_norm": 3.8653998374938965, "learning_rate": 2.506972980801731e-07, "loss": 0.5484971523284912, "memory(GiB)": 64.44, "step": 3720, "token_acc": 0.8357475426797724, "train_speed(iter/s)": 0.462026 }, { "epoch": 2.709090909090909, "grad_norm": 3.6488606929779053, "learning_rate": 2.4459611282368346e-07, "loss": 0.513886833190918, "memory(GiB)": 64.44, "step": 3725, "token_acc": 0.8707535121328225, "train_speed(iter/s)": 0.462036 }, { "epoch": 2.712727272727273, "grad_norm": 3.738938808441162, "learning_rate": 2.3856822512453414e-07, "loss": 0.5665274620056152, "memory(GiB)": 64.44, "step": 3730, "token_acc": 0.8454545454545455, "train_speed(iter/s)": 0.462015 }, { "epoch": 2.7163636363636363, "grad_norm": 3.5817694664001465, "learning_rate": 2.3261372789375124e-07, "loss": 0.5293080806732178, "memory(GiB)": 64.44, "step": 3735, "token_acc": 0.83125, "train_speed(iter/s)": 0.462051 }, { "epoch": 2.7199999999999998, "grad_norm": 4.456275463104248, "learning_rate": 2.2673271291115184e-07, "loss": 0.5739312171936035, "memory(GiB)": 64.44, "step": 3740, "token_acc": 0.8260763804427147, "train_speed(iter/s)": 0.462047 }, { "epoch": 2.7236363636363636, "grad_norm": 3.6416001319885254, "learning_rate": 2.2092527082393235e-07, "loss": 0.5760965347290039, "memory(GiB)": 64.44, "step": 3745, "token_acc": 0.846979530703944, "train_speed(iter/s)": 0.462087 }, { "epoch": 2.7272727272727275, "grad_norm": 4.468888282775879, "learning_rate": 2.151914911452724e-07, "loss": 0.5503689765930175, "memory(GiB)": 64.44, "step": 3750, "token_acc": 0.8618996798292423, "train_speed(iter/s)": 0.462101 }, { "epoch": 2.730909090909091, "grad_norm": 4.282381534576416, "learning_rate": 2.0953146225295263e-07, "loss": 0.5355560779571533, "memory(GiB)": 64.44, "step": 3755, "token_acc": 0.8769058295964126, "train_speed(iter/s)": 0.462125 }, { "epoch": 2.7345454545454544, "grad_norm": 3.994455099105835, "learning_rate": 2.039452713879958e-07, "loss": 0.5964118003845215, "memory(GiB)": 64.44, "step": 3760, "token_acc": 0.8107826810990841, "train_speed(iter/s)": 0.462116 }, { "epoch": 2.7381818181818183, "grad_norm": 3.3923728466033936, "learning_rate": 1.9843300465331728e-07, "loss": 0.4777844429016113, "memory(GiB)": 64.44, "step": 3765, "token_acc": 0.8853016142735769, "train_speed(iter/s)": 0.462119 }, { "epoch": 2.7418181818181817, "grad_norm": 4.135165691375732, "learning_rate": 1.9299474701240384e-07, "loss": 0.5326554298400878, "memory(GiB)": 64.44, "step": 3770, "token_acc": 0.8466922555881689, "train_speed(iter/s)": 0.462148 }, { "epoch": 2.7454545454545456, "grad_norm": 4.381650924682617, "learning_rate": 1.87630582287997e-07, "loss": 0.5507936477661133, "memory(GiB)": 64.44, "step": 3775, "token_acc": 0.8197317572175494, "train_speed(iter/s)": 0.462168 }, { "epoch": 2.749090909090909, "grad_norm": 3.7157084941864014, "learning_rate": 1.8234059316080855e-07, "loss": 0.5473185539245605, "memory(GiB)": 64.44, "step": 3780, "token_acc": 0.8370760769935839, "train_speed(iter/s)": 0.462175 }, { "epoch": 2.752727272727273, "grad_norm": 3.659472942352295, "learning_rate": 1.771248611682408e-07, "loss": 0.596890640258789, "memory(GiB)": 64.44, "step": 3785, "token_acc": 0.8329901624342255, "train_speed(iter/s)": 0.462191 }, { "epoch": 2.7563636363636363, "grad_norm": 3.8994619846343994, "learning_rate": 1.7198346670313228e-07, "loss": 0.5438637256622314, "memory(GiB)": 64.44, "step": 3790, "token_acc": 0.8527472527472527, "train_speed(iter/s)": 0.462186 }, { "epoch": 2.76, "grad_norm": 3.3449583053588867, "learning_rate": 1.6691648901251633e-07, "loss": 0.5252495288848877, "memory(GiB)": 64.44, "step": 3795, "token_acc": 0.8635451505016722, "train_speed(iter/s)": 0.462206 }, { "epoch": 2.7636363636363637, "grad_norm": 3.654770612716675, "learning_rate": 1.619240061964028e-07, "loss": 0.5614541053771973, "memory(GiB)": 64.44, "step": 3800, "token_acc": 0.8361153262518968, "train_speed(iter/s)": 0.462186 }, { "epoch": 2.767272727272727, "grad_norm": 4.122347831726074, "learning_rate": 1.5700609520657328e-07, "loss": 0.5514491081237793, "memory(GiB)": 64.44, "step": 3805, "token_acc": 0.8334858188472095, "train_speed(iter/s)": 0.462199 }, { "epoch": 2.770909090909091, "grad_norm": 3.933711290359497, "learning_rate": 1.5216283184539103e-07, "loss": 0.5302469253540039, "memory(GiB)": 64.44, "step": 3810, "token_acc": 0.8600960534558363, "train_speed(iter/s)": 0.462167 }, { "epoch": 2.7745454545454544, "grad_norm": 3.4784810543060303, "learning_rate": 1.4739429076463863e-07, "loss": 0.5577369213104248, "memory(GiB)": 64.44, "step": 3815, "token_acc": 0.8665246028671058, "train_speed(iter/s)": 0.462204 }, { "epoch": 2.7781818181818183, "grad_norm": 3.944777488708496, "learning_rate": 1.427005454643654e-07, "loss": 0.5139852523803711, "memory(GiB)": 64.44, "step": 3820, "token_acc": 0.8726895119418484, "train_speed(iter/s)": 0.462202 }, { "epoch": 2.7818181818181817, "grad_norm": 3.965413808822632, "learning_rate": 1.380816682917502e-07, "loss": 0.5491145133972168, "memory(GiB)": 64.44, "step": 3825, "token_acc": 0.839851024208566, "train_speed(iter/s)": 0.462205 }, { "epoch": 2.785454545454545, "grad_norm": 4.084675312042236, "learning_rate": 1.3353773043999263e-07, "loss": 0.5206490516662597, "memory(GiB)": 64.44, "step": 3830, "token_acc": 0.8489866534849234, "train_speed(iter/s)": 0.462216 }, { "epoch": 2.789090909090909, "grad_norm": 4.1376142501831055, "learning_rate": 1.290688019472125e-07, "loss": 0.621760082244873, "memory(GiB)": 64.44, "step": 3835, "token_acc": 0.8129857107044371, "train_speed(iter/s)": 0.462244 }, { "epoch": 2.792727272727273, "grad_norm": 4.061305522918701, "learning_rate": 1.2467495169536993e-07, "loss": 0.548912763595581, "memory(GiB)": 64.44, "step": 3840, "token_acc": 0.8436461794019934, "train_speed(iter/s)": 0.462284 }, { "epoch": 2.7963636363636364, "grad_norm": 4.353764057159424, "learning_rate": 1.203562474092046e-07, "loss": 0.5282083988189697, "memory(GiB)": 64.44, "step": 3845, "token_acc": 0.8687521251275077, "train_speed(iter/s)": 0.462265 }, { "epoch": 2.8, "grad_norm": 4.023250579833984, "learning_rate": 1.161127556551922e-07, "loss": 0.5132468223571778, "memory(GiB)": 64.44, "step": 3850, "token_acc": 0.8647706422018349, "train_speed(iter/s)": 0.462302 }, { "epoch": 2.8036363636363637, "grad_norm": 3.5195140838623047, "learning_rate": 1.1194454184051685e-07, "loss": 0.5616849899291992, "memory(GiB)": 64.44, "step": 3855, "token_acc": 0.8549200087661626, "train_speed(iter/s)": 0.462312 }, { "epoch": 2.807272727272727, "grad_norm": 3.75972580909729, "learning_rate": 1.0785167021206466e-07, "loss": 0.5320147037506103, "memory(GiB)": 64.44, "step": 3860, "token_acc": 0.861925477586533, "train_speed(iter/s)": 0.462331 }, { "epoch": 2.810909090909091, "grad_norm": 4.204853534698486, "learning_rate": 1.0383420385543241e-07, "loss": 0.44639225006103517, "memory(GiB)": 64.44, "step": 3865, "token_acc": 0.870872908186341, "train_speed(iter/s)": 0.462335 }, { "epoch": 2.8145454545454545, "grad_norm": 3.4746897220611572, "learning_rate": 9.989220469395599e-08, "loss": 0.5511418342590332, "memory(GiB)": 64.44, "step": 3870, "token_acc": 0.8400713436385255, "train_speed(iter/s)": 0.46236 }, { "epoch": 2.8181818181818183, "grad_norm": 3.238222122192383, "learning_rate": 9.602573348775512e-08, "loss": 0.4952839851379395, "memory(GiB)": 64.44, "step": 3875, "token_acc": 0.8549369290996085, "train_speed(iter/s)": 0.462351 }, { "epoch": 2.821818181818182, "grad_norm": 4.106288433074951, "learning_rate": 9.223484983279685e-08, "loss": 0.5499021530151367, "memory(GiB)": 64.44, "step": 3880, "token_acc": 0.853290676416819, "train_speed(iter/s)": 0.462371 }, { "epoch": 2.825454545454545, "grad_norm": 3.5807745456695557, "learning_rate": 8.85196121599774e-08, "loss": 0.5587635517120362, "memory(GiB)": 64.44, "step": 3885, "token_acc": 0.8456197672044109, "train_speed(iter/s)": 0.462358 }, { "epoch": 2.829090909090909, "grad_norm": 4.102653980255127, "learning_rate": 8.488007773422291e-08, "loss": 0.5749258041381836, "memory(GiB)": 64.44, "step": 3890, "token_acc": 0.8238822246455835, "train_speed(iter/s)": 0.462379 }, { "epoch": 2.832727272727273, "grad_norm": 3.7965023517608643, "learning_rate": 8.131630265360235e-08, "loss": 0.5211573123931885, "memory(GiB)": 64.44, "step": 3895, "token_acc": 0.8566985114419018, "train_speed(iter/s)": 0.462397 }, { "epoch": 2.8363636363636364, "grad_norm": 4.140139102935791, "learning_rate": 7.782834184846877e-08, "loss": 0.5460617065429687, "memory(GiB)": 64.44, "step": 3900, "token_acc": 0.8294644909216272, "train_speed(iter/s)": 0.462449 }, { "epoch": 2.84, "grad_norm": 4.100113868713379, "learning_rate": 7.441624908060774e-08, "loss": 0.65106201171875, "memory(GiB)": 64.44, "step": 3905, "token_acc": 0.8127829560585885, "train_speed(iter/s)": 0.462479 }, { "epoch": 2.8436363636363637, "grad_norm": 4.006384372711182, "learning_rate": 7.108007694241137e-08, "loss": 0.6106512069702148, "memory(GiB)": 64.44, "step": 3910, "token_acc": 0.8437872644884331, "train_speed(iter/s)": 0.462509 }, { "epoch": 2.847272727272727, "grad_norm": 4.023671627044678, "learning_rate": 6.781987685606672e-08, "loss": 0.5270663738250733, "memory(GiB)": 64.44, "step": 3915, "token_acc": 0.8609300304215558, "train_speed(iter/s)": 0.46252 }, { "epoch": 2.850909090909091, "grad_norm": 3.586935043334961, "learning_rate": 6.463569907276424e-08, "loss": 0.5477522850036621, "memory(GiB)": 64.44, "step": 3920, "token_acc": 0.870264247055078, "train_speed(iter/s)": 0.462498 }, { "epoch": 2.8545454545454545, "grad_norm": 3.2990100383758545, "learning_rate": 6.15275926719211e-08, "loss": 0.4375779151916504, "memory(GiB)": 64.44, "step": 3925, "token_acc": 0.8727871552079045, "train_speed(iter/s)": 0.462446 }, { "epoch": 2.8581818181818184, "grad_norm": 4.358846664428711, "learning_rate": 5.849560556042577e-08, "loss": 0.5151421070098877, "memory(GiB)": 64.44, "step": 3930, "token_acc": 0.8831139355424421, "train_speed(iter/s)": 0.462481 }, { "epoch": 2.861818181818182, "grad_norm": 4.679753303527832, "learning_rate": 5.5539784471901335e-08, "loss": 0.5724036693572998, "memory(GiB)": 64.47, "step": 3935, "token_acc": 0.8513093652907234, "train_speed(iter/s)": 0.462487 }, { "epoch": 2.8654545454545453, "grad_norm": 3.894798755645752, "learning_rate": 5.2660174965983305e-08, "loss": 0.5823453903198242, "memory(GiB)": 64.47, "step": 3940, "token_acc": 0.8236692015209125, "train_speed(iter/s)": 0.462532 }, { "epoch": 2.869090909090909, "grad_norm": 3.816575288772583, "learning_rate": 4.985682142761572e-08, "loss": 0.5283288955688477, "memory(GiB)": 64.47, "step": 3945, "token_acc": 0.8284527972027972, "train_speed(iter/s)": 0.46255 }, { "epoch": 2.8727272727272726, "grad_norm": 4.2328901290893555, "learning_rate": 4.712976706637229e-08, "loss": 0.5628486156463623, "memory(GiB)": 64.47, "step": 3950, "token_acc": 0.8680026138096275, "train_speed(iter/s)": 0.462573 }, { "epoch": 2.8763636363636365, "grad_norm": 3.2980473041534424, "learning_rate": 4.4479053915784664e-08, "loss": 0.5245370864868164, "memory(GiB)": 64.47, "step": 3955, "token_acc": 0.8287955699123212, "train_speed(iter/s)": 0.462531 }, { "epoch": 2.88, "grad_norm": 4.490112781524658, "learning_rate": 4.190472283269742e-08, "loss": 0.6101532936096191, "memory(GiB)": 64.47, "step": 3960, "token_acc": 0.8576118178087813, "train_speed(iter/s)": 0.462573 }, { "epoch": 2.8836363636363638, "grad_norm": 3.7872161865234375, "learning_rate": 3.940681349663911e-08, "loss": 0.532585334777832, "memory(GiB)": 64.47, "step": 3965, "token_acc": 0.8381294964028777, "train_speed(iter/s)": 0.46259 }, { "epoch": 2.887272727272727, "grad_norm": 3.914175033569336, "learning_rate": 3.69853644092083e-08, "loss": 0.5524998664855957, "memory(GiB)": 64.47, "step": 3970, "token_acc": 0.8546465448768864, "train_speed(iter/s)": 0.462616 }, { "epoch": 2.8909090909090907, "grad_norm": 3.7957468032836914, "learning_rate": 3.4640412893480744e-08, "loss": 0.5505013465881348, "memory(GiB)": 64.47, "step": 3975, "token_acc": 0.8538713195201745, "train_speed(iter/s)": 0.462637 }, { "epoch": 2.8945454545454545, "grad_norm": 4.858002662658691, "learning_rate": 3.2371995093435915e-08, "loss": 0.5586944580078125, "memory(GiB)": 64.47, "step": 3980, "token_acc": 0.8747870528109029, "train_speed(iter/s)": 0.462665 }, { "epoch": 2.8981818181818184, "grad_norm": 3.603170871734619, "learning_rate": 3.018014597339913e-08, "loss": 0.538426685333252, "memory(GiB)": 64.47, "step": 3985, "token_acc": 0.8521528998242531, "train_speed(iter/s)": 0.462638 }, { "epoch": 2.901818181818182, "grad_norm": 4.4803853034973145, "learning_rate": 2.8064899317499227e-08, "loss": 0.5476878643035888, "memory(GiB)": 64.47, "step": 3990, "token_acc": 0.8301707779886148, "train_speed(iter/s)": 0.462675 }, { "epoch": 2.9054545454545453, "grad_norm": 3.489401340484619, "learning_rate": 2.6026287729153943e-08, "loss": 0.5317276954650879, "memory(GiB)": 64.47, "step": 3995, "token_acc": 0.8414748268762867, "train_speed(iter/s)": 0.462658 }, { "epoch": 2.909090909090909, "grad_norm": 4.480035781860352, "learning_rate": 2.4064342630562566e-08, "loss": 0.5574604988098144, "memory(GiB)": 64.47, "step": 4000, "token_acc": 0.8581411600279525, "train_speed(iter/s)": 0.462665 }, { "epoch": 2.9127272727272726, "grad_norm": 3.872577428817749, "learning_rate": 2.2179094262223533e-08, "loss": 0.6005492210388184, "memory(GiB)": 64.47, "step": 4005, "token_acc": 0.8393406593406594, "train_speed(iter/s)": 0.462673 }, { "epoch": 2.9163636363636365, "grad_norm": 3.6794826984405518, "learning_rate": 2.0370571682467588e-08, "loss": 0.565433120727539, "memory(GiB)": 64.47, "step": 4010, "token_acc": 0.8388540734109221, "train_speed(iter/s)": 0.462676 }, { "epoch": 2.92, "grad_norm": 3.7139086723327637, "learning_rate": 1.863880276701091e-08, "loss": 0.471858549118042, "memory(GiB)": 64.47, "step": 4015, "token_acc": 0.8674345958609918, "train_speed(iter/s)": 0.462673 }, { "epoch": 2.923636363636364, "grad_norm": 3.3604671955108643, "learning_rate": 1.6983814208523797e-08, "loss": 0.54185791015625, "memory(GiB)": 64.47, "step": 4020, "token_acc": 0.8667071197411004, "train_speed(iter/s)": 0.462647 }, { "epoch": 2.9272727272727272, "grad_norm": 3.7538976669311523, "learning_rate": 1.540563151622154e-08, "loss": 0.51304030418396, "memory(GiB)": 64.47, "step": 4025, "token_acc": 0.8918128654970761, "train_speed(iter/s)": 0.462672 }, { "epoch": 2.9309090909090907, "grad_norm": 4.008846282958984, "learning_rate": 1.3904279015469202e-08, "loss": 0.5321861743927002, "memory(GiB)": 64.47, "step": 4030, "token_acc": 0.87595850248083, "train_speed(iter/s)": 0.462678 }, { "epoch": 2.9345454545454546, "grad_norm": 4.978183269500732, "learning_rate": 1.2479779847408001e-08, "loss": 0.5494882583618164, "memory(GiB)": 64.47, "step": 4035, "token_acc": 0.8528012684989429, "train_speed(iter/s)": 0.462721 }, { "epoch": 2.9381818181818184, "grad_norm": 4.310401439666748, "learning_rate": 1.1132155968597291e-08, "loss": 0.550199031829834, "memory(GiB)": 64.47, "step": 4040, "token_acc": 0.8362573099415205, "train_speed(iter/s)": 0.462766 }, { "epoch": 2.941818181818182, "grad_norm": 3.632244348526001, "learning_rate": 9.861428150677032e-09, "loss": 0.5241313934326172, "memory(GiB)": 64.47, "step": 4045, "token_acc": 0.8391878172588833, "train_speed(iter/s)": 0.462773 }, { "epoch": 2.9454545454545453, "grad_norm": 4.239510536193848, "learning_rate": 8.667615980048061e-09, "loss": 0.5985838890075683, "memory(GiB)": 64.47, "step": 4050, "token_acc": 0.8517462580185318, "train_speed(iter/s)": 0.462769 }, { "epoch": 2.949090909090909, "grad_norm": 3.496842622756958, "learning_rate": 7.55073785756899e-09, "loss": 0.5512666702270508, "memory(GiB)": 64.47, "step": 4055, "token_acc": 0.8383963628848936, "train_speed(iter/s)": 0.462776 }, { "epoch": 2.9527272727272726, "grad_norm": 3.777428150177002, "learning_rate": 6.51081099827422e-09, "loss": 0.5256683349609375, "memory(GiB)": 64.47, "step": 4060, "token_acc": 0.837874659400545, "train_speed(iter/s)": 0.462788 }, { "epoch": 2.9563636363636365, "grad_norm": 4.25238037109375, "learning_rate": 5.547851431105811e-09, "loss": 0.5643882751464844, "memory(GiB)": 64.47, "step": 4065, "token_acc": 0.8642220019821606, "train_speed(iter/s)": 0.462802 }, { "epoch": 2.96, "grad_norm": 4.666615962982178, "learning_rate": 4.661873998670907e-09, "loss": 0.5404569625854492, "memory(GiB)": 64.47, "step": 4070, "token_acc": 0.908675799086758, "train_speed(iter/s)": 0.462793 }, { "epoch": 2.963636363636364, "grad_norm": 3.5408148765563965, "learning_rate": 3.852892357006921e-09, "loss": 0.5230738639831543, "memory(GiB)": 64.47, "step": 4075, "token_acc": 0.8577827547592385, "train_speed(iter/s)": 0.46281 }, { "epoch": 2.9672727272727273, "grad_norm": 4.09399938583374, "learning_rate": 3.120918975377252e-09, "loss": 0.5126709938049316, "memory(GiB)": 64.47, "step": 4080, "token_acc": 0.8629802805448262, "train_speed(iter/s)": 0.462828 }, { "epoch": 2.9709090909090907, "grad_norm": 4.4036149978637695, "learning_rate": 2.465965136074222e-09, "loss": 0.5580806732177734, "memory(GiB)": 64.47, "step": 4085, "token_acc": 0.8440065681444991, "train_speed(iter/s)": 0.462857 }, { "epoch": 2.9745454545454546, "grad_norm": 4.547696113586426, "learning_rate": 1.8880409342492134e-09, "loss": 0.5888032913208008, "memory(GiB)": 64.47, "step": 4090, "token_acc": 0.8312101910828026, "train_speed(iter/s)": 0.462889 }, { "epoch": 2.978181818181818, "grad_norm": 3.8731865882873535, "learning_rate": 1.3871552777527941e-09, "loss": 0.5509771823883056, "memory(GiB)": 64.47, "step": 4095, "token_acc": 0.8560301507537689, "train_speed(iter/s)": 0.462928 }, { "epoch": 2.981818181818182, "grad_norm": 4.096609115600586, "learning_rate": 9.633158870014924e-10, "loss": 0.5540934085845948, "memory(GiB)": 64.47, "step": 4100, "token_acc": 0.8637532133676092, "train_speed(iter/s)": 0.462962 }, { "epoch": 2.9854545454545454, "grad_norm": 3.3930113315582275, "learning_rate": 6.165292948556723e-10, "loss": 0.5454161643981934, "memory(GiB)": 64.47, "step": 4105, "token_acc": 0.8733822260569456, "train_speed(iter/s)": 0.462982 }, { "epoch": 2.9890909090909092, "grad_norm": 4.123258113861084, "learning_rate": 3.468008465207229e-10, "loss": 0.5773702621459961, "memory(GiB)": 64.47, "step": 4110, "token_acc": 0.8334710743801653, "train_speed(iter/s)": 0.462997 }, { "epoch": 2.9927272727272727, "grad_norm": 4.4657416343688965, "learning_rate": 1.5413469946434778e-10, "loss": 0.5174553871154786, "memory(GiB)": 64.47, "step": 4115, "token_acc": 0.8584444444444445, "train_speed(iter/s)": 0.462982 }, { "epoch": 2.996363636363636, "grad_norm": 4.009359836578369, "learning_rate": 3.8533823351616376e-11, "loss": 0.5238511085510253, "memory(GiB)": 64.47, "step": 4120, "token_acc": 0.8342233009708738, "train_speed(iter/s)": 0.463014 }, { "epoch": 3.0, "grad_norm": 3.5021286010742188, "learning_rate": 0.0, "loss": 0.5140440940856934, "memory(GiB)": 64.47, "step": 4125, "token_acc": 0.8927929726492314, "train_speed(iter/s)": 0.46301 } ], "logging_steps": 5, "max_steps": 4125, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.4148570216262533e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }