8340 lines
222 KiB
JSON
8340 lines
222 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0,
|
|
"eval_steps": 500,
|
|
"global_step": 6911,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"ce_loss": 2.031,
|
|
"epoch": 0.0014469947727313835,
|
|
"grad_norm": 29.5,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.298076923076923e-06,
|
|
"loss": 2.031,
|
|
"mean_token_accuracy": 0.7030675932765007,
|
|
"num_tokens": 741730.0,
|
|
"step": 10,
|
|
"train_ppl": 7.621345
|
|
},
|
|
{
|
|
"ce_loss": 2.091,
|
|
"epoch": 0.002893989545462767,
|
|
"grad_norm": 27.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7403846153846155e-06,
|
|
"loss": 2.091,
|
|
"mean_token_accuracy": 0.6888238519430161,
|
|
"num_tokens": 1459999.0,
|
|
"step": 20,
|
|
"train_ppl": 8.093004
|
|
},
|
|
{
|
|
"ce_loss": 1.9679,
|
|
"epoch": 0.004340984318194151,
|
|
"grad_norm": 25.75,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.182692307692308e-06,
|
|
"loss": 1.9679,
|
|
"mean_token_accuracy": 0.6994533620774745,
|
|
"num_tokens": 2205386.0,
|
|
"step": 30,
|
|
"train_ppl": 7.155398
|
|
},
|
|
{
|
|
"ce_loss": 1.6513,
|
|
"epoch": 0.005787979090925534,
|
|
"grad_norm": 12.4375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.625e-06,
|
|
"loss": 1.6513,
|
|
"mean_token_accuracy": 0.7152167946100235,
|
|
"num_tokens": 2952129.0,
|
|
"step": 40,
|
|
"train_ppl": 5.21397
|
|
},
|
|
{
|
|
"ce_loss": 1.5017,
|
|
"epoch": 0.007234973863656917,
|
|
"grad_norm": 8.3125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.067307692307692e-06,
|
|
"loss": 1.5017,
|
|
"mean_token_accuracy": 0.7155109643936157,
|
|
"num_tokens": 3667912.0,
|
|
"step": 50,
|
|
"train_ppl": 4.489093
|
|
},
|
|
{
|
|
"ce_loss": 1.3397,
|
|
"epoch": 0.008681968636388301,
|
|
"grad_norm": 3.328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.509615384615384e-06,
|
|
"loss": 1.3397,
|
|
"mean_token_accuracy": 0.7240443922579288,
|
|
"num_tokens": 4427526.0,
|
|
"step": 60,
|
|
"train_ppl": 3.817909
|
|
},
|
|
{
|
|
"ce_loss": 1.2534,
|
|
"epoch": 0.010128963409119684,
|
|
"grad_norm": 3.609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.951923076923077e-06,
|
|
"loss": 1.2534,
|
|
"mean_token_accuracy": 0.7320300832390785,
|
|
"num_tokens": 5160176.0,
|
|
"step": 70,
|
|
"train_ppl": 3.502394
|
|
},
|
|
{
|
|
"ce_loss": 1.1852,
|
|
"epoch": 0.011575958181851068,
|
|
"grad_norm": 4.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.139423076923077e-05,
|
|
"loss": 1.1852,
|
|
"mean_token_accuracy": 0.7428010664880276,
|
|
"num_tokens": 5911569.0,
|
|
"step": 80,
|
|
"train_ppl": 3.27122
|
|
},
|
|
{
|
|
"ce_loss": 1.131,
|
|
"epoch": 0.013022952954582452,
|
|
"grad_norm": 1.296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2836538461538462e-05,
|
|
"loss": 1.131,
|
|
"mean_token_accuracy": 0.7550130240619183,
|
|
"num_tokens": 6689615.0,
|
|
"step": 90,
|
|
"train_ppl": 3.098752
|
|
},
|
|
{
|
|
"ce_loss": 1.1475,
|
|
"epoch": 0.014469947727313835,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4278846153846154e-05,
|
|
"loss": 1.1475,
|
|
"mean_token_accuracy": 0.7511672869324684,
|
|
"num_tokens": 7426028.0,
|
|
"step": 100,
|
|
"train_ppl": 3.150303
|
|
},
|
|
{
|
|
"ce_loss": 1.107,
|
|
"epoch": 0.015916942500045217,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5721153846153848e-05,
|
|
"loss": 1.107,
|
|
"mean_token_accuracy": 0.761037639528513,
|
|
"num_tokens": 8168535.0,
|
|
"step": 110,
|
|
"train_ppl": 3.025315
|
|
},
|
|
{
|
|
"ce_loss": 1.155,
|
|
"epoch": 0.017363937272776603,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7163461538461537e-05,
|
|
"loss": 1.155,
|
|
"mean_token_accuracy": 0.7489694423973561,
|
|
"num_tokens": 8913465.0,
|
|
"step": 120,
|
|
"train_ppl": 3.174086
|
|
},
|
|
{
|
|
"ce_loss": 1.1527,
|
|
"epoch": 0.018810932045507985,
|
|
"grad_norm": 1.203125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8605769230769233e-05,
|
|
"loss": 1.1527,
|
|
"mean_token_accuracy": 0.7528368845582009,
|
|
"num_tokens": 9631331.0,
|
|
"step": 130,
|
|
"train_ppl": 3.166877
|
|
},
|
|
{
|
|
"ce_loss": 1.0897,
|
|
"epoch": 0.020257926818239368,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0048076923076922e-05,
|
|
"loss": 1.0897,
|
|
"mean_token_accuracy": 0.7576698914170266,
|
|
"num_tokens": 10387986.0,
|
|
"step": 140,
|
|
"train_ppl": 2.973338
|
|
},
|
|
{
|
|
"ce_loss": 1.0838,
|
|
"epoch": 0.021704921590970754,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1490384615384615e-05,
|
|
"loss": 1.0838,
|
|
"mean_token_accuracy": 0.7615541353821754,
|
|
"num_tokens": 11156736.0,
|
|
"step": 150,
|
|
"train_ppl": 2.955747
|
|
},
|
|
{
|
|
"ce_loss": 1.1045,
|
|
"epoch": 0.023151916363702136,
|
|
"grad_norm": 1.25,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2932692307692307e-05,
|
|
"loss": 1.1045,
|
|
"mean_token_accuracy": 0.7566463962197304,
|
|
"num_tokens": 11873395.0,
|
|
"step": 160,
|
|
"train_ppl": 3.017859
|
|
},
|
|
{
|
|
"ce_loss": 1.0972,
|
|
"epoch": 0.02459891113643352,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4375e-05,
|
|
"loss": 1.0972,
|
|
"mean_token_accuracy": 0.7590832710266113,
|
|
"num_tokens": 12608710.0,
|
|
"step": 170,
|
|
"train_ppl": 2.995746
|
|
},
|
|
{
|
|
"ce_loss": 1.0663,
|
|
"epoch": 0.026045905909164904,
|
|
"grad_norm": 1.2734375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5817307692307695e-05,
|
|
"loss": 1.0663,
|
|
"mean_token_accuracy": 0.7631561934947968,
|
|
"num_tokens": 13355138.0,
|
|
"step": 180,
|
|
"train_ppl": 2.904723
|
|
},
|
|
{
|
|
"ce_loss": 1.0532,
|
|
"epoch": 0.027492900681896287,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7259615384615384e-05,
|
|
"loss": 1.0532,
|
|
"mean_token_accuracy": 0.7637556858360768,
|
|
"num_tokens": 14107781.0,
|
|
"step": 190,
|
|
"train_ppl": 2.866803
|
|
},
|
|
{
|
|
"ce_loss": 1.0673,
|
|
"epoch": 0.02893989545462767,
|
|
"grad_norm": 1.2421875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.870192307692308e-05,
|
|
"loss": 1.0673,
|
|
"mean_token_accuracy": 0.7635537907481194,
|
|
"num_tokens": 14852277.0,
|
|
"step": 200,
|
|
"train_ppl": 2.90758
|
|
},
|
|
{
|
|
"ce_loss": 1.0755,
|
|
"epoch": 0.030386890227359055,
|
|
"grad_norm": 1.2421875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9995524392063257e-05,
|
|
"loss": 1.0755,
|
|
"mean_token_accuracy": 0.7621265381574631,
|
|
"num_tokens": 15546431.0,
|
|
"step": 210,
|
|
"train_ppl": 2.93156
|
|
},
|
|
{
|
|
"ce_loss": 1.125,
|
|
"epoch": 0.031833885000090434,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9950768312695806e-05,
|
|
"loss": 1.125,
|
|
"mean_token_accuracy": 0.7530753210186958,
|
|
"num_tokens": 16272344.0,
|
|
"step": 220,
|
|
"train_ppl": 3.080183
|
|
},
|
|
{
|
|
"ce_loss": 1.0847,
|
|
"epoch": 0.03328087977282182,
|
|
"grad_norm": 1.375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9906012233328362e-05,
|
|
"loss": 1.0847,
|
|
"mean_token_accuracy": 0.7561856605112552,
|
|
"num_tokens": 17017303.0,
|
|
"step": 230,
|
|
"train_ppl": 2.958519
|
|
},
|
|
{
|
|
"ce_loss": 1.0307,
|
|
"epoch": 0.034727874545553206,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9861256153960914e-05,
|
|
"loss": 1.0307,
|
|
"mean_token_accuracy": 0.7656997129321098,
|
|
"num_tokens": 17774573.0,
|
|
"step": 240,
|
|
"train_ppl": 2.803042
|
|
},
|
|
{
|
|
"ce_loss": 1.0565,
|
|
"epoch": 0.036174869318284585,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9816500074593467e-05,
|
|
"loss": 1.0565,
|
|
"mean_token_accuracy": 0.7623364008963108,
|
|
"num_tokens": 18506619.0,
|
|
"step": 250,
|
|
"train_ppl": 2.876351
|
|
},
|
|
{
|
|
"ce_loss": 1.047,
|
|
"epoch": 0.03762186409101597,
|
|
"grad_norm": 1.3828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.977174399522602e-05,
|
|
"loss": 1.047,
|
|
"mean_token_accuracy": 0.7634409129619598,
|
|
"num_tokens": 19281733.0,
|
|
"step": 260,
|
|
"train_ppl": 2.84913
|
|
},
|
|
{
|
|
"ce_loss": 1.0546,
|
|
"epoch": 0.039068858863747356,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9726987915858572e-05,
|
|
"loss": 1.0546,
|
|
"mean_token_accuracy": 0.7609510987997055,
|
|
"num_tokens": 19987179.0,
|
|
"step": 270,
|
|
"train_ppl": 2.870774
|
|
},
|
|
{
|
|
"ce_loss": 1.0431,
|
|
"epoch": 0.040515853636478735,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9682231836491124e-05,
|
|
"loss": 1.0431,
|
|
"mean_token_accuracy": 0.7634642273187637,
|
|
"num_tokens": 20745404.0,
|
|
"step": 280,
|
|
"train_ppl": 2.838059
|
|
},
|
|
{
|
|
"ce_loss": 1.0446,
|
|
"epoch": 0.04196284840921012,
|
|
"grad_norm": 1.203125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9637475757123677e-05,
|
|
"loss": 1.0446,
|
|
"mean_token_accuracy": 0.7675992861390114,
|
|
"num_tokens": 21490797.0,
|
|
"step": 290,
|
|
"train_ppl": 2.842357
|
|
},
|
|
{
|
|
"ce_loss": 1.0772,
|
|
"epoch": 0.04340984318194151,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.959271967775623e-05,
|
|
"loss": 1.0772,
|
|
"mean_token_accuracy": 0.7634236924350262,
|
|
"num_tokens": 22209441.0,
|
|
"step": 300,
|
|
"train_ppl": 2.936523
|
|
},
|
|
{
|
|
"ce_loss": 1.0581,
|
|
"epoch": 0.044856837954672886,
|
|
"grad_norm": 1.203125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.954796359838878e-05,
|
|
"loss": 1.0581,
|
|
"mean_token_accuracy": 0.7604357182979584,
|
|
"num_tokens": 22924851.0,
|
|
"step": 310,
|
|
"train_ppl": 2.880844
|
|
},
|
|
{
|
|
"ce_loss": 1.0396,
|
|
"epoch": 0.04630383272740427,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9503207519021337e-05,
|
|
"loss": 1.0396,
|
|
"mean_token_accuracy": 0.7631719268858432,
|
|
"num_tokens": 23660815.0,
|
|
"step": 320,
|
|
"train_ppl": 2.828141
|
|
},
|
|
{
|
|
"ce_loss": 1.0448,
|
|
"epoch": 0.04775082750013566,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9458451439653886e-05,
|
|
"loss": 1.0448,
|
|
"mean_token_accuracy": 0.7706776842474937,
|
|
"num_tokens": 24378060.0,
|
|
"step": 330,
|
|
"train_ppl": 2.842827
|
|
},
|
|
{
|
|
"ce_loss": 1.0389,
|
|
"epoch": 0.04919782227286704,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.941369536028644e-05,
|
|
"loss": 1.0389,
|
|
"mean_token_accuracy": 0.7651800148189067,
|
|
"num_tokens": 25130726.0,
|
|
"step": 340,
|
|
"train_ppl": 2.826159
|
|
},
|
|
{
|
|
"ce_loss": 1.0548,
|
|
"epoch": 0.05064481704559842,
|
|
"grad_norm": 0.96484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9368939280918995e-05,
|
|
"loss": 1.0548,
|
|
"mean_token_accuracy": 0.7646659754216671,
|
|
"num_tokens": 25862673.0,
|
|
"step": 350,
|
|
"train_ppl": 2.871468
|
|
},
|
|
{
|
|
"ce_loss": 1.0698,
|
|
"epoch": 0.05209181181832981,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9324183201551544e-05,
|
|
"loss": 1.0698,
|
|
"mean_token_accuracy": 0.763071033358574,
|
|
"num_tokens": 26609121.0,
|
|
"step": 360,
|
|
"train_ppl": 2.914941
|
|
},
|
|
{
|
|
"ce_loss": 1.0739,
|
|
"epoch": 0.05353880659106119,
|
|
"grad_norm": 1.3125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.92794271221841e-05,
|
|
"loss": 1.0739,
|
|
"mean_token_accuracy": 0.759658782184124,
|
|
"num_tokens": 27343011.0,
|
|
"step": 370,
|
|
"train_ppl": 2.926805
|
|
},
|
|
{
|
|
"ce_loss": 1.0897,
|
|
"epoch": 0.05498580136379257,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.923467104281665e-05,
|
|
"loss": 1.0897,
|
|
"mean_token_accuracy": 0.7550988748669625,
|
|
"num_tokens": 28067081.0,
|
|
"step": 380,
|
|
"train_ppl": 2.973326
|
|
},
|
|
{
|
|
"ce_loss": 1.0626,
|
|
"epoch": 0.05643279613652396,
|
|
"grad_norm": 1.203125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.91899149634492e-05,
|
|
"loss": 1.0626,
|
|
"mean_token_accuracy": 0.757635698467493,
|
|
"num_tokens": 28798187.0,
|
|
"step": 390,
|
|
"train_ppl": 2.893869
|
|
},
|
|
{
|
|
"ce_loss": 1.036,
|
|
"epoch": 0.05787979090925534,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9145158884081757e-05,
|
|
"loss": 1.036,
|
|
"mean_token_accuracy": 0.7649780534207821,
|
|
"num_tokens": 29531903.0,
|
|
"step": 400,
|
|
"train_ppl": 2.817834
|
|
},
|
|
{
|
|
"ce_loss": 1.0533,
|
|
"epoch": 0.059326785681986724,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9100402804714306e-05,
|
|
"loss": 1.0533,
|
|
"mean_token_accuracy": 0.760666860640049,
|
|
"num_tokens": 30241613.0,
|
|
"step": 410,
|
|
"train_ppl": 2.867077
|
|
},
|
|
{
|
|
"ce_loss": 0.9798,
|
|
"epoch": 0.06077378045471811,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9055646725346862e-05,
|
|
"loss": 0.9798,
|
|
"mean_token_accuracy": 0.7770380131900311,
|
|
"num_tokens": 31009377.0,
|
|
"step": 420,
|
|
"train_ppl": 2.663858
|
|
},
|
|
{
|
|
"ce_loss": 1.0212,
|
|
"epoch": 0.06222077522744949,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9010890645979414e-05,
|
|
"loss": 1.0212,
|
|
"mean_token_accuracy": 0.7705600343644619,
|
|
"num_tokens": 31733086.0,
|
|
"step": 430,
|
|
"train_ppl": 2.77655
|
|
},
|
|
{
|
|
"ce_loss": 1.0513,
|
|
"epoch": 0.06366777000018087,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8966134566611963e-05,
|
|
"loss": 1.0513,
|
|
"mean_token_accuracy": 0.7623658269643784,
|
|
"num_tokens": 32494212.0,
|
|
"step": 440,
|
|
"train_ppl": 2.861398
|
|
},
|
|
{
|
|
"ce_loss": 1.0261,
|
|
"epoch": 0.06511476477291225,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.892137848724452e-05,
|
|
"loss": 1.0261,
|
|
"mean_token_accuracy": 0.766685140132904,
|
|
"num_tokens": 33249862.0,
|
|
"step": 450,
|
|
"train_ppl": 2.790203
|
|
},
|
|
{
|
|
"ce_loss": 1.0145,
|
|
"epoch": 0.06656175954564364,
|
|
"grad_norm": 1.28125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8876622407877068e-05,
|
|
"loss": 1.0145,
|
|
"mean_token_accuracy": 0.7710323743522167,
|
|
"num_tokens": 33978600.0,
|
|
"step": 460,
|
|
"train_ppl": 2.757857
|
|
},
|
|
{
|
|
"ce_loss": 1.0187,
|
|
"epoch": 0.06800875431837503,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8831866328509624e-05,
|
|
"loss": 1.0187,
|
|
"mean_token_accuracy": 0.7671968981623649,
|
|
"num_tokens": 34723642.0,
|
|
"step": 470,
|
|
"train_ppl": 2.76952
|
|
},
|
|
{
|
|
"ce_loss": 1.0289,
|
|
"epoch": 0.06945574909110641,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8787110249142176e-05,
|
|
"loss": 1.0289,
|
|
"mean_token_accuracy": 0.7625186502933502,
|
|
"num_tokens": 35439133.0,
|
|
"step": 480,
|
|
"train_ppl": 2.797885
|
|
},
|
|
{
|
|
"ce_loss": 1.0018,
|
|
"epoch": 0.0709027438638378,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8742354169774726e-05,
|
|
"loss": 1.0018,
|
|
"mean_token_accuracy": 0.7706348761916161,
|
|
"num_tokens": 36184470.0,
|
|
"step": 490,
|
|
"train_ppl": 2.723119
|
|
},
|
|
{
|
|
"ce_loss": 1.023,
|
|
"epoch": 0.07234973863656917,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.869759809040728e-05,
|
|
"loss": 1.023,
|
|
"mean_token_accuracy": 0.7653927527368068,
|
|
"num_tokens": 36919930.0,
|
|
"step": 500,
|
|
"train_ppl": 2.781612
|
|
},
|
|
{
|
|
"ce_loss": 1.0274,
|
|
"epoch": 0.07379673340930056,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8652842011039834e-05,
|
|
"loss": 1.0274,
|
|
"mean_token_accuracy": 0.7650810860097408,
|
|
"num_tokens": 37645758.0,
|
|
"step": 510,
|
|
"train_ppl": 2.793777
|
|
},
|
|
{
|
|
"ce_loss": 1.0478,
|
|
"epoch": 0.07524372818203194,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8608085931672386e-05,
|
|
"loss": 1.0478,
|
|
"mean_token_accuracy": 0.7612765856087208,
|
|
"num_tokens": 38363698.0,
|
|
"step": 520,
|
|
"train_ppl": 2.85138
|
|
},
|
|
{
|
|
"ce_loss": 1.0149,
|
|
"epoch": 0.07669072295476333,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.856332985230494e-05,
|
|
"loss": 1.0149,
|
|
"mean_token_accuracy": 0.7682214416563511,
|
|
"num_tokens": 39095412.0,
|
|
"step": 530,
|
|
"train_ppl": 2.759008
|
|
},
|
|
{
|
|
"ce_loss": 1.0218,
|
|
"epoch": 0.07813771772749471,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8518573772937495e-05,
|
|
"loss": 1.0218,
|
|
"mean_token_accuracy": 0.7704101949930191,
|
|
"num_tokens": 39877031.0,
|
|
"step": 540,
|
|
"train_ppl": 2.778117
|
|
},
|
|
{
|
|
"ce_loss": 1.0751,
|
|
"epoch": 0.0795847125002261,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8473817693570044e-05,
|
|
"loss": 1.0751,
|
|
"mean_token_accuracy": 0.7600487649440766,
|
|
"num_tokens": 40593628.0,
|
|
"step": 550,
|
|
"train_ppl": 2.930418
|
|
},
|
|
{
|
|
"ce_loss": 0.9919,
|
|
"epoch": 0.08103170727295747,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8429061614202596e-05,
|
|
"loss": 0.9919,
|
|
"mean_token_accuracy": 0.7756079971790314,
|
|
"num_tokens": 41350737.0,
|
|
"step": 560,
|
|
"train_ppl": 2.696299
|
|
},
|
|
{
|
|
"ce_loss": 1.0013,
|
|
"epoch": 0.08247870204568886,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.838430553483515e-05,
|
|
"loss": 1.0013,
|
|
"mean_token_accuracy": 0.768417052924633,
|
|
"num_tokens": 42091923.0,
|
|
"step": 570,
|
|
"train_ppl": 2.721766
|
|
},
|
|
{
|
|
"ce_loss": 1.0212,
|
|
"epoch": 0.08392569681842024,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.83395494554677e-05,
|
|
"loss": 1.0212,
|
|
"mean_token_accuracy": 0.7705964192748069,
|
|
"num_tokens": 42843505.0,
|
|
"step": 580,
|
|
"train_ppl": 2.776561
|
|
},
|
|
{
|
|
"ce_loss": 0.9852,
|
|
"epoch": 0.08537269159115163,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8294793376100257e-05,
|
|
"loss": 0.9852,
|
|
"mean_token_accuracy": 0.7744002252817154,
|
|
"num_tokens": 43582786.0,
|
|
"step": 590,
|
|
"train_ppl": 2.678277
|
|
},
|
|
{
|
|
"ce_loss": 1.0398,
|
|
"epoch": 0.08681968636388301,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8250037296732806e-05,
|
|
"loss": 1.0398,
|
|
"mean_token_accuracy": 0.7641379170119762,
|
|
"num_tokens": 44305457.0,
|
|
"step": 600,
|
|
"train_ppl": 2.828777
|
|
},
|
|
{
|
|
"ce_loss": 1.0506,
|
|
"epoch": 0.0882666811366144,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8205281217365358e-05,
|
|
"loss": 1.0506,
|
|
"mean_token_accuracy": 0.7625304482877254,
|
|
"num_tokens": 45041194.0,
|
|
"step": 610,
|
|
"train_ppl": 2.859436
|
|
},
|
|
{
|
|
"ce_loss": 1.0399,
|
|
"epoch": 0.08971367590934577,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8160525137997914e-05,
|
|
"loss": 1.0399,
|
|
"mean_token_accuracy": 0.7632023870944977,
|
|
"num_tokens": 45759428.0,
|
|
"step": 620,
|
|
"train_ppl": 2.828851
|
|
},
|
|
{
|
|
"ce_loss": 0.9818,
|
|
"epoch": 0.09116067068207716,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8115769058630463e-05,
|
|
"loss": 0.9818,
|
|
"mean_token_accuracy": 0.7739991441369056,
|
|
"num_tokens": 46539074.0,
|
|
"step": 630,
|
|
"train_ppl": 2.669149
|
|
},
|
|
{
|
|
"ce_loss": 1.0629,
|
|
"epoch": 0.09260766545480854,
|
|
"grad_norm": 1.3671875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.807101297926302e-05,
|
|
"loss": 1.0629,
|
|
"mean_token_accuracy": 0.7601286731660366,
|
|
"num_tokens": 47260819.0,
|
|
"step": 640,
|
|
"train_ppl": 2.894784
|
|
},
|
|
{
|
|
"ce_loss": 1.0038,
|
|
"epoch": 0.09405466022753993,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.802625689989557e-05,
|
|
"loss": 1.0038,
|
|
"mean_token_accuracy": 0.77047905549407,
|
|
"num_tokens": 48047185.0,
|
|
"step": 650,
|
|
"train_ppl": 2.728604
|
|
},
|
|
{
|
|
"ce_loss": 0.9987,
|
|
"epoch": 0.09550165500027132,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.798150082052812e-05,
|
|
"loss": 0.9987,
|
|
"mean_token_accuracy": 0.7709697797894478,
|
|
"num_tokens": 48790335.0,
|
|
"step": 660,
|
|
"train_ppl": 2.714848
|
|
},
|
|
{
|
|
"ce_loss": 1.0216,
|
|
"epoch": 0.0969486497730027,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7936744741160676e-05,
|
|
"loss": 1.0216,
|
|
"mean_token_accuracy": 0.7681831575930118,
|
|
"num_tokens": 49512949.0,
|
|
"step": 670,
|
|
"train_ppl": 2.777644
|
|
},
|
|
{
|
|
"ce_loss": 1.0012,
|
|
"epoch": 0.09839564454573407,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7891988661793225e-05,
|
|
"loss": 1.0012,
|
|
"mean_token_accuracy": 0.7718318410217762,
|
|
"num_tokens": 50255708.0,
|
|
"step": 680,
|
|
"train_ppl": 2.721635
|
|
},
|
|
{
|
|
"ce_loss": 1.0218,
|
|
"epoch": 0.09984263931846546,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.784723258242578e-05,
|
|
"loss": 1.0218,
|
|
"mean_token_accuracy": 0.7731546863913537,
|
|
"num_tokens": 51030898.0,
|
|
"step": 690,
|
|
"train_ppl": 2.778237
|
|
},
|
|
{
|
|
"ce_loss": 1.0546,
|
|
"epoch": 0.10128963409119685,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7802476503058334e-05,
|
|
"loss": 1.0546,
|
|
"mean_token_accuracy": 0.7618527382612228,
|
|
"num_tokens": 51766323.0,
|
|
"step": 700,
|
|
"train_ppl": 2.870824
|
|
},
|
|
{
|
|
"ce_loss": 1.0146,
|
|
"epoch": 0.10273662886392823,
|
|
"grad_norm": 1.2109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7757720423690883e-05,
|
|
"loss": 1.0146,
|
|
"mean_token_accuracy": 0.7683967478573323,
|
|
"num_tokens": 52478018.0,
|
|
"step": 710,
|
|
"train_ppl": 2.758134
|
|
},
|
|
{
|
|
"ce_loss": 0.9898,
|
|
"epoch": 0.10418362363665962,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.771296434432344e-05,
|
|
"loss": 0.9898,
|
|
"mean_token_accuracy": 0.7749556273221969,
|
|
"num_tokens": 53197381.0,
|
|
"step": 720,
|
|
"train_ppl": 2.690634
|
|
},
|
|
{
|
|
"ce_loss": 1.0148,
|
|
"epoch": 0.105630618409391,
|
|
"grad_norm": 1.3828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.766820826495599e-05,
|
|
"loss": 1.0148,
|
|
"mean_token_accuracy": 0.7660286217927933,
|
|
"num_tokens": 53959271.0,
|
|
"step": 730,
|
|
"train_ppl": 2.758879
|
|
},
|
|
{
|
|
"ce_loss": 0.9988,
|
|
"epoch": 0.10707761318212237,
|
|
"grad_norm": 1.2890625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7623452185588543e-05,
|
|
"loss": 0.9988,
|
|
"mean_token_accuracy": 0.7756357662379741,
|
|
"num_tokens": 54734873.0,
|
|
"step": 740,
|
|
"train_ppl": 2.715152
|
|
},
|
|
{
|
|
"ce_loss": 0.9886,
|
|
"epoch": 0.10852460795485376,
|
|
"grad_norm": 1.25,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7578696106221096e-05,
|
|
"loss": 0.9886,
|
|
"mean_token_accuracy": 0.7769335299730301,
|
|
"num_tokens": 55488727.0,
|
|
"step": 750,
|
|
"train_ppl": 2.687502
|
|
},
|
|
{
|
|
"ce_loss": 1.0076,
|
|
"epoch": 0.10997160272758515,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.753394002685365e-05,
|
|
"loss": 1.0076,
|
|
"mean_token_accuracy": 0.7681085780262947,
|
|
"num_tokens": 56208627.0,
|
|
"step": 760,
|
|
"train_ppl": 2.739055
|
|
},
|
|
{
|
|
"ce_loss": 0.9727,
|
|
"epoch": 0.11141859750031653,
|
|
"grad_norm": 1.375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.74891839474862e-05,
|
|
"loss": 0.9727,
|
|
"mean_token_accuracy": 0.7748353876173496,
|
|
"num_tokens": 56980088.0,
|
|
"step": 770,
|
|
"train_ppl": 2.645072
|
|
},
|
|
{
|
|
"ce_loss": 0.9921,
|
|
"epoch": 0.11286559227304792,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7444427868118753e-05,
|
|
"loss": 0.9921,
|
|
"mean_token_accuracy": 0.7719174005091191,
|
|
"num_tokens": 57698460.0,
|
|
"step": 780,
|
|
"train_ppl": 2.697013
|
|
},
|
|
{
|
|
"ce_loss": 1.0101,
|
|
"epoch": 0.11431258704577929,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7399671788751306e-05,
|
|
"loss": 1.0101,
|
|
"mean_token_accuracy": 0.7697246864438057,
|
|
"num_tokens": 58420421.0,
|
|
"step": 790,
|
|
"train_ppl": 2.74584
|
|
},
|
|
{
|
|
"ce_loss": 1.0296,
|
|
"epoch": 0.11575958181851068,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7354915709383858e-05,
|
|
"loss": 1.0296,
|
|
"mean_token_accuracy": 0.7663743153214455,
|
|
"num_tokens": 59148535.0,
|
|
"step": 800,
|
|
"train_ppl": 2.80003
|
|
},
|
|
{
|
|
"ce_loss": 0.9826,
|
|
"epoch": 0.11720657659124206,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7310159630016414e-05,
|
|
"loss": 0.9826,
|
|
"mean_token_accuracy": 0.7738265834748745,
|
|
"num_tokens": 59886300.0,
|
|
"step": 810,
|
|
"train_ppl": 2.67137
|
|
},
|
|
{
|
|
"ce_loss": 0.9979,
|
|
"epoch": 0.11865357136397345,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7265403550648963e-05,
|
|
"loss": 0.9979,
|
|
"mean_token_accuracy": 0.7731278233230114,
|
|
"num_tokens": 60616165.0,
|
|
"step": 820,
|
|
"train_ppl": 2.712621
|
|
},
|
|
{
|
|
"ce_loss": 1.001,
|
|
"epoch": 0.12010056613670483,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7220647471281515e-05,
|
|
"loss": 1.001,
|
|
"mean_token_accuracy": 0.7734205923974514,
|
|
"num_tokens": 61333780.0,
|
|
"step": 830,
|
|
"train_ppl": 2.720872
|
|
},
|
|
{
|
|
"ce_loss": 0.9622,
|
|
"epoch": 0.12154756090943622,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.717589139191407e-05,
|
|
"loss": 0.9622,
|
|
"mean_token_accuracy": 0.7805940173566341,
|
|
"num_tokens": 62084399.0,
|
|
"step": 840,
|
|
"train_ppl": 2.617573
|
|
},
|
|
{
|
|
"ce_loss": 1.0292,
|
|
"epoch": 0.12299455568216759,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.713113531254662e-05,
|
|
"loss": 1.0292,
|
|
"mean_token_accuracy": 0.7698862083256245,
|
|
"num_tokens": 62786252.0,
|
|
"step": 850,
|
|
"train_ppl": 2.798803
|
|
},
|
|
{
|
|
"ce_loss": 0.9863,
|
|
"epoch": 0.12444155045489898,
|
|
"grad_norm": 0.94921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7086379233179176e-05,
|
|
"loss": 0.9863,
|
|
"mean_token_accuracy": 0.7744859166443347,
|
|
"num_tokens": 63552303.0,
|
|
"step": 860,
|
|
"train_ppl": 2.681383
|
|
},
|
|
{
|
|
"ce_loss": 1.0463,
|
|
"epoch": 0.12588854522763038,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7041623153811725e-05,
|
|
"loss": 1.0463,
|
|
"mean_token_accuracy": 0.7598242215812206,
|
|
"num_tokens": 64291902.0,
|
|
"step": 870,
|
|
"train_ppl": 2.846986
|
|
},
|
|
{
|
|
"ce_loss": 1.0143,
|
|
"epoch": 0.12733554000036174,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6996867074444278e-05,
|
|
"loss": 1.0143,
|
|
"mean_token_accuracy": 0.7722109064459801,
|
|
"num_tokens": 65062010.0,
|
|
"step": 880,
|
|
"train_ppl": 2.757514
|
|
},
|
|
{
|
|
"ce_loss": 0.9824,
|
|
"epoch": 0.12878253477309312,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6952110995076834e-05,
|
|
"loss": 0.9824,
|
|
"mean_token_accuracy": 0.7738293096423149,
|
|
"num_tokens": 65801609.0,
|
|
"step": 890,
|
|
"train_ppl": 2.67092
|
|
},
|
|
{
|
|
"ce_loss": 1.0333,
|
|
"epoch": 0.1302295295458245,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6907354915709383e-05,
|
|
"loss": 1.0333,
|
|
"mean_token_accuracy": 0.7661075979471207,
|
|
"num_tokens": 66511678.0,
|
|
"step": 900,
|
|
"train_ppl": 2.810267
|
|
},
|
|
{
|
|
"ce_loss": 1.0035,
|
|
"epoch": 0.1316765243185559,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.686259883634194e-05,
|
|
"loss": 1.0035,
|
|
"mean_token_accuracy": 0.7725445240736007,
|
|
"num_tokens": 67237118.0,
|
|
"step": 910,
|
|
"train_ppl": 2.727891
|
|
},
|
|
{
|
|
"ce_loss": 1.0143,
|
|
"epoch": 0.13312351909128728,
|
|
"grad_norm": 0.95703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.681784275697449e-05,
|
|
"loss": 1.0143,
|
|
"mean_token_accuracy": 0.770337475836277,
|
|
"num_tokens": 67960278.0,
|
|
"step": 920,
|
|
"train_ppl": 2.757525
|
|
},
|
|
{
|
|
"ce_loss": 1.0292,
|
|
"epoch": 0.13457051386401866,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.677308667760704e-05,
|
|
"loss": 1.0292,
|
|
"mean_token_accuracy": 0.7616572365164757,
|
|
"num_tokens": 68667137.0,
|
|
"step": 930,
|
|
"train_ppl": 2.798916
|
|
},
|
|
{
|
|
"ce_loss": 0.9922,
|
|
"epoch": 0.13601750863675005,
|
|
"grad_norm": 0.88671875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6728330598239596e-05,
|
|
"loss": 0.9922,
|
|
"mean_token_accuracy": 0.7753356233239174,
|
|
"num_tokens": 69397579.0,
|
|
"step": 940,
|
|
"train_ppl": 2.697085
|
|
},
|
|
{
|
|
"ce_loss": 1.0193,
|
|
"epoch": 0.13746450340948144,
|
|
"grad_norm": 1.21875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6683574518872145e-05,
|
|
"loss": 1.0193,
|
|
"mean_token_accuracy": 0.7674314551055431,
|
|
"num_tokens": 70138483.0,
|
|
"step": 950,
|
|
"train_ppl": 2.771351
|
|
},
|
|
{
|
|
"ce_loss": 1.0101,
|
|
"epoch": 0.13891149818221282,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.66388184395047e-05,
|
|
"loss": 1.0101,
|
|
"mean_token_accuracy": 0.7684113517403602,
|
|
"num_tokens": 70893702.0,
|
|
"step": 960,
|
|
"train_ppl": 2.745858
|
|
},
|
|
{
|
|
"ce_loss": 0.9906,
|
|
"epoch": 0.1403584929549442,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6594062360137253e-05,
|
|
"loss": 0.9906,
|
|
"mean_token_accuracy": 0.7723499283194541,
|
|
"num_tokens": 71651876.0,
|
|
"step": 970,
|
|
"train_ppl": 2.692868
|
|
},
|
|
{
|
|
"ce_loss": 1.0207,
|
|
"epoch": 0.1418054877276756,
|
|
"grad_norm": 1.328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6549306280769806e-05,
|
|
"loss": 1.0207,
|
|
"mean_token_accuracy": 0.7665747530758381,
|
|
"num_tokens": 72377679.0,
|
|
"step": 980,
|
|
"train_ppl": 2.775166
|
|
},
|
|
{
|
|
"ce_loss": 0.9936,
|
|
"epoch": 0.14325248250040698,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6504550201402358e-05,
|
|
"loss": 0.9936,
|
|
"mean_token_accuracy": 0.7710120238363742,
|
|
"num_tokens": 73103927.0,
|
|
"step": 990,
|
|
"train_ppl": 2.700822
|
|
},
|
|
{
|
|
"ce_loss": 0.9695,
|
|
"epoch": 0.14469947727313834,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.645979412203491e-05,
|
|
"loss": 0.9695,
|
|
"mean_token_accuracy": 0.7770053826272487,
|
|
"num_tokens": 73844957.0,
|
|
"step": 1000,
|
|
"train_ppl": 2.636754
|
|
},
|
|
{
|
|
"ce_loss": 1.0049,
|
|
"epoch": 0.14614647204586972,
|
|
"grad_norm": 0.96484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6415038042667463e-05,
|
|
"loss": 1.0049,
|
|
"mean_token_accuracy": 0.7748589895665645,
|
|
"num_tokens": 74603514.0,
|
|
"step": 1010,
|
|
"train_ppl": 2.731605
|
|
},
|
|
{
|
|
"ce_loss": 1.0422,
|
|
"epoch": 0.1475934668186011,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6370281963300015e-05,
|
|
"loss": 1.0422,
|
|
"mean_token_accuracy": 0.7634790919721126,
|
|
"num_tokens": 75341775.0,
|
|
"step": 1020,
|
|
"train_ppl": 2.835447
|
|
},
|
|
{
|
|
"ce_loss": 0.9876,
|
|
"epoch": 0.1490404615913325,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.632552588393257e-05,
|
|
"loss": 0.9876,
|
|
"mean_token_accuracy": 0.7736144475638866,
|
|
"num_tokens": 76068700.0,
|
|
"step": 1030,
|
|
"train_ppl": 2.684756
|
|
},
|
|
{
|
|
"ce_loss": 0.9743,
|
|
"epoch": 0.15048745636406388,
|
|
"grad_norm": 1.328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.628076980456512e-05,
|
|
"loss": 0.9743,
|
|
"mean_token_accuracy": 0.7698041521012783,
|
|
"num_tokens": 76790471.0,
|
|
"step": 1040,
|
|
"train_ppl": 2.649441
|
|
},
|
|
{
|
|
"ce_loss": 1.0106,
|
|
"epoch": 0.15193445113679527,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6236013725197673e-05,
|
|
"loss": 1.0106,
|
|
"mean_token_accuracy": 0.7718939520418644,
|
|
"num_tokens": 77528424.0,
|
|
"step": 1050,
|
|
"train_ppl": 2.747122
|
|
},
|
|
{
|
|
"ce_loss": 0.9585,
|
|
"epoch": 0.15338144590952665,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6191257645830225e-05,
|
|
"loss": 0.9585,
|
|
"mean_token_accuracy": 0.7821242325007915,
|
|
"num_tokens": 78282846.0,
|
|
"step": 1060,
|
|
"train_ppl": 2.607741
|
|
},
|
|
{
|
|
"ce_loss": 1.0218,
|
|
"epoch": 0.15482844068225804,
|
|
"grad_norm": 0.95703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6146501566462778e-05,
|
|
"loss": 1.0218,
|
|
"mean_token_accuracy": 0.766200902312994,
|
|
"num_tokens": 79027597.0,
|
|
"step": 1070,
|
|
"train_ppl": 2.778107
|
|
},
|
|
{
|
|
"ce_loss": 0.9949,
|
|
"epoch": 0.15627543545498943,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6101745487095333e-05,
|
|
"loss": 0.9949,
|
|
"mean_token_accuracy": 0.7705755203962326,
|
|
"num_tokens": 79743637.0,
|
|
"step": 1080,
|
|
"train_ppl": 2.70455
|
|
},
|
|
{
|
|
"ce_loss": 1.0277,
|
|
"epoch": 0.1577224302277208,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6056989407727882e-05,
|
|
"loss": 1.0277,
|
|
"mean_token_accuracy": 0.7647506572306156,
|
|
"num_tokens": 80473185.0,
|
|
"step": 1090,
|
|
"train_ppl": 2.794623
|
|
},
|
|
{
|
|
"ce_loss": 0.965,
|
|
"epoch": 0.1591694250004522,
|
|
"grad_norm": 0.97265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6012233328360435e-05,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.7723382718861103,
|
|
"num_tokens": 81206214.0,
|
|
"step": 1100,
|
|
"train_ppl": 2.624738
|
|
},
|
|
{
|
|
"ce_loss": 0.988,
|
|
"epoch": 0.16061641977318358,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.596747724899299e-05,
|
|
"loss": 0.988,
|
|
"mean_token_accuracy": 0.7725288093090057,
|
|
"num_tokens": 81957112.0,
|
|
"step": 1110,
|
|
"train_ppl": 2.685843
|
|
},
|
|
{
|
|
"ce_loss": 0.9953,
|
|
"epoch": 0.16206341454591494,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.592272116962554e-05,
|
|
"loss": 0.9953,
|
|
"mean_token_accuracy": 0.771150516718626,
|
|
"num_tokens": 82713929.0,
|
|
"step": 1120,
|
|
"train_ppl": 2.705614
|
|
},
|
|
{
|
|
"ce_loss": 1.0077,
|
|
"epoch": 0.16351040931864633,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5877965090258096e-05,
|
|
"loss": 1.0077,
|
|
"mean_token_accuracy": 0.7694192692637444,
|
|
"num_tokens": 83463522.0,
|
|
"step": 1130,
|
|
"train_ppl": 2.739307
|
|
},
|
|
{
|
|
"ce_loss": 1.0273,
|
|
"epoch": 0.1649574040913777,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5833209010890648e-05,
|
|
"loss": 1.0273,
|
|
"mean_token_accuracy": 0.769251874089241,
|
|
"num_tokens": 84188031.0,
|
|
"step": 1140,
|
|
"train_ppl": 2.793589
|
|
},
|
|
{
|
|
"ce_loss": 1.0097,
|
|
"epoch": 0.1664043988641091,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5788452931523197e-05,
|
|
"loss": 1.0097,
|
|
"mean_token_accuracy": 0.7688002400100231,
|
|
"num_tokens": 84918572.0,
|
|
"step": 1150,
|
|
"train_ppl": 2.74465
|
|
},
|
|
{
|
|
"ce_loss": 0.9846,
|
|
"epoch": 0.16785139363684048,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5743696852155753e-05,
|
|
"loss": 0.9846,
|
|
"mean_token_accuracy": 0.7792325161397458,
|
|
"num_tokens": 85637924.0,
|
|
"step": 1160,
|
|
"train_ppl": 2.676852
|
|
},
|
|
{
|
|
"ce_loss": 0.971,
|
|
"epoch": 0.16929838840957187,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5698940772788302e-05,
|
|
"loss": 0.971,
|
|
"mean_token_accuracy": 0.7782729744911194,
|
|
"num_tokens": 86375295.0,
|
|
"step": 1170,
|
|
"train_ppl": 2.640504
|
|
},
|
|
{
|
|
"ce_loss": 1.0133,
|
|
"epoch": 0.17074538318230326,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5654184693420858e-05,
|
|
"loss": 1.0133,
|
|
"mean_token_accuracy": 0.7730432473123073,
|
|
"num_tokens": 87109044.0,
|
|
"step": 1180,
|
|
"train_ppl": 2.754625
|
|
},
|
|
{
|
|
"ce_loss": 0.9703,
|
|
"epoch": 0.17219237795503464,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.560942861405341e-05,
|
|
"loss": 0.9703,
|
|
"mean_token_accuracy": 0.7804669737815857,
|
|
"num_tokens": 87823377.0,
|
|
"step": 1190,
|
|
"train_ppl": 2.638814
|
|
},
|
|
{
|
|
"ce_loss": 0.9692,
|
|
"epoch": 0.17363937272776603,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5564672534685963e-05,
|
|
"loss": 0.9692,
|
|
"mean_token_accuracy": 0.7746523730456829,
|
|
"num_tokens": 88551984.0,
|
|
"step": 1200,
|
|
"train_ppl": 2.635899
|
|
},
|
|
{
|
|
"ce_loss": 0.9945,
|
|
"epoch": 0.17508636750049741,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5519916455318515e-05,
|
|
"loss": 0.9945,
|
|
"mean_token_accuracy": 0.7793050222098827,
|
|
"num_tokens": 89293732.0,
|
|
"step": 1210,
|
|
"train_ppl": 2.703368
|
|
},
|
|
{
|
|
"ce_loss": 0.9821,
|
|
"epoch": 0.1765333622732288,
|
|
"grad_norm": 1.234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5475160375951068e-05,
|
|
"loss": 0.9821,
|
|
"mean_token_accuracy": 0.7767940178513527,
|
|
"num_tokens": 90009099.0,
|
|
"step": 1220,
|
|
"train_ppl": 2.670185
|
|
},
|
|
{
|
|
"ce_loss": 0.9914,
|
|
"epoch": 0.17798035704596016,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.543040429658362e-05,
|
|
"loss": 0.9914,
|
|
"mean_token_accuracy": 0.7680940054357052,
|
|
"num_tokens": 90713440.0,
|
|
"step": 1230,
|
|
"train_ppl": 2.69505
|
|
},
|
|
{
|
|
"ce_loss": 0.9752,
|
|
"epoch": 0.17942735181869154,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5385648217216173e-05,
|
|
"loss": 0.9752,
|
|
"mean_token_accuracy": 0.7775831647217274,
|
|
"num_tokens": 91458197.0,
|
|
"step": 1240,
|
|
"train_ppl": 2.651746
|
|
},
|
|
{
|
|
"ce_loss": 0.972,
|
|
"epoch": 0.18087434659142293,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5340892137848725e-05,
|
|
"loss": 0.972,
|
|
"mean_token_accuracy": 0.7771682500839233,
|
|
"num_tokens": 92204785.0,
|
|
"step": 1250,
|
|
"train_ppl": 2.64311
|
|
},
|
|
{
|
|
"ce_loss": 0.9545,
|
|
"epoch": 0.18232134136415432,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5296136058481277e-05,
|
|
"loss": 0.9545,
|
|
"mean_token_accuracy": 0.7803010269999504,
|
|
"num_tokens": 92965785.0,
|
|
"step": 1260,
|
|
"train_ppl": 2.597424
|
|
},
|
|
{
|
|
"ce_loss": 0.9658,
|
|
"epoch": 0.1837683361368857,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.525137997911383e-05,
|
|
"loss": 0.9658,
|
|
"mean_token_accuracy": 0.7732729889452458,
|
|
"num_tokens": 93749479.0,
|
|
"step": 1270,
|
|
"train_ppl": 2.626844
|
|
},
|
|
{
|
|
"ce_loss": 0.9175,
|
|
"epoch": 0.1852153309096171,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5206623899746382e-05,
|
|
"loss": 0.9175,
|
|
"mean_token_accuracy": 0.7875691160559655,
|
|
"num_tokens": 94490987.0,
|
|
"step": 1280,
|
|
"train_ppl": 2.50292
|
|
},
|
|
{
|
|
"ce_loss": 1.0091,
|
|
"epoch": 0.18666232568234847,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5161867820378935e-05,
|
|
"loss": 1.0091,
|
|
"mean_token_accuracy": 0.7689063064754009,
|
|
"num_tokens": 95239798.0,
|
|
"step": 1290,
|
|
"train_ppl": 2.74315
|
|
},
|
|
{
|
|
"ce_loss": 0.9981,
|
|
"epoch": 0.18810932045507986,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.511711174101149e-05,
|
|
"loss": 0.9981,
|
|
"mean_token_accuracy": 0.7733910351991653,
|
|
"num_tokens": 95971638.0,
|
|
"step": 1300,
|
|
"train_ppl": 2.713218
|
|
},
|
|
{
|
|
"ce_loss": 0.973,
|
|
"epoch": 0.18955631522781125,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.507235566164404e-05,
|
|
"loss": 0.973,
|
|
"mean_token_accuracy": 0.7790097333490849,
|
|
"num_tokens": 96708517.0,
|
|
"step": 1310,
|
|
"train_ppl": 2.645934
|
|
},
|
|
{
|
|
"ce_loss": 0.994,
|
|
"epoch": 0.19100331000054263,
|
|
"grad_norm": 0.90625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5027599582276592e-05,
|
|
"loss": 0.994,
|
|
"mean_token_accuracy": 0.7691507421433925,
|
|
"num_tokens": 97438831.0,
|
|
"step": 1320,
|
|
"train_ppl": 2.701936
|
|
},
|
|
{
|
|
"ce_loss": 0.9829,
|
|
"epoch": 0.19245030477327402,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4982843502909148e-05,
|
|
"loss": 0.9829,
|
|
"mean_token_accuracy": 0.7720185928046703,
|
|
"num_tokens": 98167703.0,
|
|
"step": 1330,
|
|
"train_ppl": 2.672221
|
|
},
|
|
{
|
|
"ce_loss": 1.0042,
|
|
"epoch": 0.1938972995460054,
|
|
"grad_norm": 1.203125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4938087423541697e-05,
|
|
"loss": 1.0042,
|
|
"mean_token_accuracy": 0.773903863132,
|
|
"num_tokens": 98916022.0,
|
|
"step": 1340,
|
|
"train_ppl": 2.72972
|
|
},
|
|
{
|
|
"ce_loss": 1.0223,
|
|
"epoch": 0.19534429431873676,
|
|
"grad_norm": 1.28125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4893331344174253e-05,
|
|
"loss": 1.0223,
|
|
"mean_token_accuracy": 0.7680788926780224,
|
|
"num_tokens": 99656326.0,
|
|
"step": 1350,
|
|
"train_ppl": 2.779674
|
|
},
|
|
{
|
|
"ce_loss": 1.0159,
|
|
"epoch": 0.19679128909146815,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4848575264806802e-05,
|
|
"loss": 1.0159,
|
|
"mean_token_accuracy": 0.7670142784714699,
|
|
"num_tokens": 100366830.0,
|
|
"step": 1360,
|
|
"train_ppl": 2.761858
|
|
},
|
|
{
|
|
"ce_loss": 0.9412,
|
|
"epoch": 0.19823828386419953,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4803819185439354e-05,
|
|
"loss": 0.9412,
|
|
"mean_token_accuracy": 0.7805588349699975,
|
|
"num_tokens": 101103405.0,
|
|
"step": 1370,
|
|
"train_ppl": 2.562954
|
|
},
|
|
{
|
|
"ce_loss": 1.0126,
|
|
"epoch": 0.19968527863693092,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.475906310607191e-05,
|
|
"loss": 1.0126,
|
|
"mean_token_accuracy": 0.769621242582798,
|
|
"num_tokens": 101841805.0,
|
|
"step": 1380,
|
|
"train_ppl": 2.752685
|
|
},
|
|
{
|
|
"ce_loss": 0.9851,
|
|
"epoch": 0.2011322734096623,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.471430702670446e-05,
|
|
"loss": 0.9851,
|
|
"mean_token_accuracy": 0.7694549061357975,
|
|
"num_tokens": 102587079.0,
|
|
"step": 1390,
|
|
"train_ppl": 2.67799
|
|
},
|
|
{
|
|
"ce_loss": 1.0044,
|
|
"epoch": 0.2025792681823937,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4669550947337015e-05,
|
|
"loss": 1.0044,
|
|
"mean_token_accuracy": 0.7683346226811409,
|
|
"num_tokens": 103349174.0,
|
|
"step": 1400,
|
|
"train_ppl": 2.730359
|
|
},
|
|
{
|
|
"ce_loss": 0.9611,
|
|
"epoch": 0.20402626295512508,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4624794867969568e-05,
|
|
"loss": 0.9611,
|
|
"mean_token_accuracy": 0.7769466623663902,
|
|
"num_tokens": 104090462.0,
|
|
"step": 1410,
|
|
"train_ppl": 2.614475
|
|
},
|
|
{
|
|
"ce_loss": 0.9999,
|
|
"epoch": 0.20547325772785646,
|
|
"grad_norm": 1.5625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.458003878860212e-05,
|
|
"loss": 0.9999,
|
|
"mean_token_accuracy": 0.7739646673202515,
|
|
"num_tokens": 104807032.0,
|
|
"step": 1420,
|
|
"train_ppl": 2.718026
|
|
},
|
|
{
|
|
"ce_loss": 0.992,
|
|
"epoch": 0.20692025250058785,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4535282709234672e-05,
|
|
"loss": 0.992,
|
|
"mean_token_accuracy": 0.7719819858670235,
|
|
"num_tokens": 105536067.0,
|
|
"step": 1430,
|
|
"train_ppl": 2.696496
|
|
},
|
|
{
|
|
"ce_loss": 0.965,
|
|
"epoch": 0.20836724727331923,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4490526629867225e-05,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.782091249525547,
|
|
"num_tokens": 106292581.0,
|
|
"step": 1440,
|
|
"train_ppl": 2.624887
|
|
},
|
|
{
|
|
"ce_loss": 1.0016,
|
|
"epoch": 0.20981424204605062,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4445770550499777e-05,
|
|
"loss": 1.0016,
|
|
"mean_token_accuracy": 0.7689143389463424,
|
|
"num_tokens": 107002756.0,
|
|
"step": 1450,
|
|
"train_ppl": 2.722517
|
|
},
|
|
{
|
|
"ce_loss": 0.9808,
|
|
"epoch": 0.211261236818782,
|
|
"grad_norm": 0.8984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.440101447113233e-05,
|
|
"loss": 0.9808,
|
|
"mean_token_accuracy": 0.7709385193884373,
|
|
"num_tokens": 107735109.0,
|
|
"step": 1460,
|
|
"train_ppl": 2.666501
|
|
},
|
|
{
|
|
"ce_loss": 0.965,
|
|
"epoch": 0.21270823159151336,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4356258391764882e-05,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.7816490411758423,
|
|
"num_tokens": 108488189.0,
|
|
"step": 1470,
|
|
"train_ppl": 2.624826
|
|
},
|
|
{
|
|
"ce_loss": 0.984,
|
|
"epoch": 0.21415522636424475,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4311502312397435e-05,
|
|
"loss": 0.984,
|
|
"mean_token_accuracy": 0.7733917005360127,
|
|
"num_tokens": 109227381.0,
|
|
"step": 1480,
|
|
"train_ppl": 2.675031
|
|
},
|
|
{
|
|
"ce_loss": 1.0325,
|
|
"epoch": 0.21560222113697614,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4266746233029987e-05,
|
|
"loss": 1.0325,
|
|
"mean_token_accuracy": 0.7697164453566074,
|
|
"num_tokens": 109967419.0,
|
|
"step": 1490,
|
|
"train_ppl": 2.808141
|
|
},
|
|
{
|
|
"ce_loss": 0.9488,
|
|
"epoch": 0.21704921590970752,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.422199015366254e-05,
|
|
"loss": 0.9488,
|
|
"mean_token_accuracy": 0.779134713858366,
|
|
"num_tokens": 110728249.0,
|
|
"step": 1500,
|
|
"train_ppl": 2.582697
|
|
},
|
|
{
|
|
"ce_loss": 1.0317,
|
|
"epoch": 0.2184962106824389,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4177234074295092e-05,
|
|
"loss": 1.0317,
|
|
"mean_token_accuracy": 0.7620711497962475,
|
|
"num_tokens": 111457904.0,
|
|
"step": 1510,
|
|
"train_ppl": 2.805772
|
|
},
|
|
{
|
|
"ce_loss": 0.9886,
|
|
"epoch": 0.2199432054551703,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4132477994927648e-05,
|
|
"loss": 0.9886,
|
|
"mean_token_accuracy": 0.7727661252021789,
|
|
"num_tokens": 112189931.0,
|
|
"step": 1520,
|
|
"train_ppl": 2.687597
|
|
},
|
|
{
|
|
"ce_loss": 1.0147,
|
|
"epoch": 0.22139020022790168,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.4087721915560197e-05,
|
|
"loss": 1.0147,
|
|
"mean_token_accuracy": 0.7641719624400138,
|
|
"num_tokens": 112953522.0,
|
|
"step": 1530,
|
|
"train_ppl": 2.758408
|
|
},
|
|
{
|
|
"ce_loss": 0.9716,
|
|
"epoch": 0.22283719500063306,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.404296583619275e-05,
|
|
"loss": 0.9716,
|
|
"mean_token_accuracy": 0.7772294074296952,
|
|
"num_tokens": 113698414.0,
|
|
"step": 1540,
|
|
"train_ppl": 2.642101
|
|
},
|
|
{
|
|
"ce_loss": 0.9623,
|
|
"epoch": 0.22428418977336445,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3998209756825302e-05,
|
|
"loss": 0.9623,
|
|
"mean_token_accuracy": 0.7757225722074509,
|
|
"num_tokens": 114430630.0,
|
|
"step": 1550,
|
|
"train_ppl": 2.617647
|
|
},
|
|
{
|
|
"ce_loss": 0.997,
|
|
"epoch": 0.22573118454609584,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3953453677457854e-05,
|
|
"loss": 0.997,
|
|
"mean_token_accuracy": 0.7703205697238446,
|
|
"num_tokens": 115166141.0,
|
|
"step": 1560,
|
|
"train_ppl": 2.710057
|
|
},
|
|
{
|
|
"ce_loss": 0.9953,
|
|
"epoch": 0.22717817931882722,
|
|
"grad_norm": 1.4609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.390869759809041e-05,
|
|
"loss": 0.9953,
|
|
"mean_token_accuracy": 0.771430192887783,
|
|
"num_tokens": 115889580.0,
|
|
"step": 1570,
|
|
"train_ppl": 2.705503
|
|
},
|
|
{
|
|
"ce_loss": 0.9531,
|
|
"epoch": 0.22862517409155858,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.386394151872296e-05,
|
|
"loss": 0.9531,
|
|
"mean_token_accuracy": 0.781104639172554,
|
|
"num_tokens": 116629845.0,
|
|
"step": 1580,
|
|
"train_ppl": 2.593619
|
|
},
|
|
{
|
|
"ce_loss": 0.9679,
|
|
"epoch": 0.23007216886428997,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.381918543935551e-05,
|
|
"loss": 0.9679,
|
|
"mean_token_accuracy": 0.7786240108311177,
|
|
"num_tokens": 117372885.0,
|
|
"step": 1590,
|
|
"train_ppl": 2.632371
|
|
},
|
|
{
|
|
"ce_loss": 0.9785,
|
|
"epoch": 0.23151916363702135,
|
|
"grad_norm": 1.4296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3774429359988067e-05,
|
|
"loss": 0.9785,
|
|
"mean_token_accuracy": 0.7776103042066097,
|
|
"num_tokens": 118132367.0,
|
|
"step": 1600,
|
|
"train_ppl": 2.66055
|
|
},
|
|
{
|
|
"ce_loss": 0.9715,
|
|
"epoch": 0.23296615840975274,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3729673280620616e-05,
|
|
"loss": 0.9715,
|
|
"mean_token_accuracy": 0.7777374930679798,
|
|
"num_tokens": 118846692.0,
|
|
"step": 1610,
|
|
"train_ppl": 2.641897
|
|
},
|
|
{
|
|
"ce_loss": 0.9917,
|
|
"epoch": 0.23441315318248412,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3684917201253172e-05,
|
|
"loss": 0.9917,
|
|
"mean_token_accuracy": 0.7717310026288032,
|
|
"num_tokens": 119577822.0,
|
|
"step": 1620,
|
|
"train_ppl": 2.695707
|
|
},
|
|
{
|
|
"ce_loss": 1.0171,
|
|
"epoch": 0.2358601479552155,
|
|
"grad_norm": 1.3125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3640161121885725e-05,
|
|
"loss": 1.0171,
|
|
"mean_token_accuracy": 0.7664790794253349,
|
|
"num_tokens": 120308082.0,
|
|
"step": 1630,
|
|
"train_ppl": 2.765049
|
|
},
|
|
{
|
|
"ce_loss": 0.9736,
|
|
"epoch": 0.2373071427279469,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3595405042518274e-05,
|
|
"loss": 0.9736,
|
|
"mean_token_accuracy": 0.7768724001944065,
|
|
"num_tokens": 121049818.0,
|
|
"step": 1640,
|
|
"train_ppl": 2.647552
|
|
},
|
|
{
|
|
"ce_loss": 0.9504,
|
|
"epoch": 0.23875413750067828,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.355064896315083e-05,
|
|
"loss": 0.9504,
|
|
"mean_token_accuracy": 0.783089691400528,
|
|
"num_tokens": 121788637.0,
|
|
"step": 1650,
|
|
"train_ppl": 2.586798
|
|
},
|
|
{
|
|
"ce_loss": 0.9677,
|
|
"epoch": 0.24020113227340967,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.350589288378338e-05,
|
|
"loss": 0.9677,
|
|
"mean_token_accuracy": 0.7775506429374218,
|
|
"num_tokens": 122522757.0,
|
|
"step": 1660,
|
|
"train_ppl": 2.63188
|
|
},
|
|
{
|
|
"ce_loss": 0.9579,
|
|
"epoch": 0.24164812704614105,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3461136804415935e-05,
|
|
"loss": 0.9579,
|
|
"mean_token_accuracy": 0.7754926040768624,
|
|
"num_tokens": 123241955.0,
|
|
"step": 1670,
|
|
"train_ppl": 2.606329
|
|
},
|
|
{
|
|
"ce_loss": 0.9865,
|
|
"epoch": 0.24309512181887244,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3416380725048487e-05,
|
|
"loss": 0.9865,
|
|
"mean_token_accuracy": 0.7741681657731533,
|
|
"num_tokens": 123980600.0,
|
|
"step": 1680,
|
|
"train_ppl": 2.681846
|
|
},
|
|
{
|
|
"ce_loss": 1.0253,
|
|
"epoch": 0.24454211659160383,
|
|
"grad_norm": 0.93359375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.337162464568104e-05,
|
|
"loss": 1.0253,
|
|
"mean_token_accuracy": 0.7667008370161057,
|
|
"num_tokens": 124695571.0,
|
|
"step": 1690,
|
|
"train_ppl": 2.787846
|
|
},
|
|
{
|
|
"ce_loss": 0.9638,
|
|
"epoch": 0.24598911136433518,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3326868566313592e-05,
|
|
"loss": 0.9638,
|
|
"mean_token_accuracy": 0.7810881577432156,
|
|
"num_tokens": 125462307.0,
|
|
"step": 1700,
|
|
"train_ppl": 2.621706
|
|
},
|
|
{
|
|
"ce_loss": 1.0031,
|
|
"epoch": 0.24743610613706657,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3282112486946144e-05,
|
|
"loss": 1.0031,
|
|
"mean_token_accuracy": 0.7722915470600128,
|
|
"num_tokens": 126188660.0,
|
|
"step": 1710,
|
|
"train_ppl": 2.726587
|
|
},
|
|
{
|
|
"ce_loss": 0.9951,
|
|
"epoch": 0.24888310090979796,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3237356407578697e-05,
|
|
"loss": 0.9951,
|
|
"mean_token_accuracy": 0.7689005501568318,
|
|
"num_tokens": 126922149.0,
|
|
"step": 1720,
|
|
"train_ppl": 2.704929
|
|
},
|
|
{
|
|
"ce_loss": 0.968,
|
|
"epoch": 0.25033009568252934,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.319260032821125e-05,
|
|
"loss": 0.968,
|
|
"mean_token_accuracy": 0.7733873896300792,
|
|
"num_tokens": 127665260.0,
|
|
"step": 1730,
|
|
"train_ppl": 2.632612
|
|
},
|
|
{
|
|
"ce_loss": 0.951,
|
|
"epoch": 0.25177709045526075,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.31478442488438e-05,
|
|
"loss": 0.951,
|
|
"mean_token_accuracy": 0.7792448908090591,
|
|
"num_tokens": 128389924.0,
|
|
"step": 1740,
|
|
"train_ppl": 2.58818
|
|
},
|
|
{
|
|
"ce_loss": 0.9992,
|
|
"epoch": 0.2532240852279921,
|
|
"grad_norm": 1.1640625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3103088169476354e-05,
|
|
"loss": 0.9992,
|
|
"mean_token_accuracy": 0.7671849623322486,
|
|
"num_tokens": 129141013.0,
|
|
"step": 1750,
|
|
"train_ppl": 2.716049
|
|
},
|
|
{
|
|
"ce_loss": 0.9825,
|
|
"epoch": 0.25467108000072347,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3058332090108907e-05,
|
|
"loss": 0.9825,
|
|
"mean_token_accuracy": 0.7744820192456245,
|
|
"num_tokens": 129895565.0,
|
|
"step": 1760,
|
|
"train_ppl": 2.671033
|
|
},
|
|
{
|
|
"ce_loss": 1.0052,
|
|
"epoch": 0.2561180747734549,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.301357601074146e-05,
|
|
"loss": 1.0052,
|
|
"mean_token_accuracy": 0.7750261440873146,
|
|
"num_tokens": 130621739.0,
|
|
"step": 1770,
|
|
"train_ppl": 2.73239
|
|
},
|
|
{
|
|
"ce_loss": 0.9681,
|
|
"epoch": 0.25756506954618624,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.296881993137401e-05,
|
|
"loss": 0.9681,
|
|
"mean_token_accuracy": 0.7767448596656322,
|
|
"num_tokens": 131345170.0,
|
|
"step": 1780,
|
|
"train_ppl": 2.633028
|
|
},
|
|
{
|
|
"ce_loss": 0.9402,
|
|
"epoch": 0.25901206431891766,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2924063852006567e-05,
|
|
"loss": 0.9402,
|
|
"mean_token_accuracy": 0.7856816701591015,
|
|
"num_tokens": 132065199.0,
|
|
"step": 1790,
|
|
"train_ppl": 2.560536
|
|
},
|
|
{
|
|
"ce_loss": 0.9967,
|
|
"epoch": 0.260459059091649,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2879307772639116e-05,
|
|
"loss": 0.9967,
|
|
"mean_token_accuracy": 0.7735986836254597,
|
|
"num_tokens": 132781605.0,
|
|
"step": 1800,
|
|
"train_ppl": 2.709426
|
|
},
|
|
{
|
|
"ce_loss": 0.9958,
|
|
"epoch": 0.26190605386438043,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.283455169327167e-05,
|
|
"loss": 0.9958,
|
|
"mean_token_accuracy": 0.7739541471004486,
|
|
"num_tokens": 133519634.0,
|
|
"step": 1810,
|
|
"train_ppl": 2.706818
|
|
},
|
|
{
|
|
"ce_loss": 0.9826,
|
|
"epoch": 0.2633530486371118,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2789795613904225e-05,
|
|
"loss": 0.9826,
|
|
"mean_token_accuracy": 0.7771935254335404,
|
|
"num_tokens": 134253497.0,
|
|
"step": 1820,
|
|
"train_ppl": 2.671278
|
|
},
|
|
{
|
|
"ce_loss": 0.9624,
|
|
"epoch": 0.2648000434098432,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2745039534536774e-05,
|
|
"loss": 0.9624,
|
|
"mean_token_accuracy": 0.7789321012794972,
|
|
"num_tokens": 135020505.0,
|
|
"step": 1830,
|
|
"train_ppl": 2.618061
|
|
},
|
|
{
|
|
"ce_loss": 0.9873,
|
|
"epoch": 0.26624703818257456,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.270028345516933e-05,
|
|
"loss": 0.9873,
|
|
"mean_token_accuracy": 0.7744618967175484,
|
|
"num_tokens": 135773285.0,
|
|
"step": 1840,
|
|
"train_ppl": 2.683909
|
|
},
|
|
{
|
|
"ce_loss": 0.9925,
|
|
"epoch": 0.26769403295530597,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.265552737580188e-05,
|
|
"loss": 0.9925,
|
|
"mean_token_accuracy": 0.7759519070386887,
|
|
"num_tokens": 136497732.0,
|
|
"step": 1850,
|
|
"train_ppl": 2.697987
|
|
},
|
|
{
|
|
"ce_loss": 0.9889,
|
|
"epoch": 0.26914102772803733,
|
|
"grad_norm": 1.25,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.261077129643443e-05,
|
|
"loss": 0.9889,
|
|
"mean_token_accuracy": 0.772041554749012,
|
|
"num_tokens": 137175891.0,
|
|
"step": 1860,
|
|
"train_ppl": 2.688219
|
|
},
|
|
{
|
|
"ce_loss": 0.9832,
|
|
"epoch": 0.27058802250076874,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2566015217066987e-05,
|
|
"loss": 0.9832,
|
|
"mean_token_accuracy": 0.770769814401865,
|
|
"num_tokens": 137910825.0,
|
|
"step": 1870,
|
|
"train_ppl": 2.672975
|
|
},
|
|
{
|
|
"ce_loss": 0.9957,
|
|
"epoch": 0.2720350172735001,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2521259137699536e-05,
|
|
"loss": 0.9957,
|
|
"mean_token_accuracy": 0.7698277346789837,
|
|
"num_tokens": 138609576.0,
|
|
"step": 1880,
|
|
"train_ppl": 2.7066
|
|
},
|
|
{
|
|
"ce_loss": 0.9988,
|
|
"epoch": 0.27348201204623146,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2476503058332092e-05,
|
|
"loss": 0.9988,
|
|
"mean_token_accuracy": 0.771542327105999,
|
|
"num_tokens": 139318503.0,
|
|
"step": 1890,
|
|
"train_ppl": 2.714913
|
|
},
|
|
{
|
|
"ce_loss": 1.0168,
|
|
"epoch": 0.2749290068189629,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2431746978964644e-05,
|
|
"loss": 1.0168,
|
|
"mean_token_accuracy": 0.7615082763135433,
|
|
"num_tokens": 140054302.0,
|
|
"step": 1900,
|
|
"train_ppl": 2.764403
|
|
},
|
|
{
|
|
"ce_loss": 0.983,
|
|
"epoch": 0.27637600159169423,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2386990899597197e-05,
|
|
"loss": 0.983,
|
|
"mean_token_accuracy": 0.7786808654665947,
|
|
"num_tokens": 140797270.0,
|
|
"step": 1910,
|
|
"train_ppl": 2.67259
|
|
},
|
|
{
|
|
"ce_loss": 1.0197,
|
|
"epoch": 0.27782299636442565,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.234223482022975e-05,
|
|
"loss": 1.0197,
|
|
"mean_token_accuracy": 0.7617739595472812,
|
|
"num_tokens": 141527803.0,
|
|
"step": 1920,
|
|
"train_ppl": 2.772385
|
|
},
|
|
{
|
|
"ce_loss": 0.9801,
|
|
"epoch": 0.279269991137157,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.22974787408623e-05,
|
|
"loss": 0.9801,
|
|
"mean_token_accuracy": 0.7726086884737015,
|
|
"num_tokens": 142259241.0,
|
|
"step": 1930,
|
|
"train_ppl": 2.664847
|
|
},
|
|
{
|
|
"ce_loss": 0.9964,
|
|
"epoch": 0.2807169859098884,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2252722661494854e-05,
|
|
"loss": 0.9964,
|
|
"mean_token_accuracy": 0.7709591925144196,
|
|
"num_tokens": 143023815.0,
|
|
"step": 1940,
|
|
"train_ppl": 2.70848
|
|
},
|
|
{
|
|
"ce_loss": 1.002,
|
|
"epoch": 0.2821639806826198,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2207966582127406e-05,
|
|
"loss": 1.002,
|
|
"mean_token_accuracy": 0.7686372242867947,
|
|
"num_tokens": 143780140.0,
|
|
"step": 1950,
|
|
"train_ppl": 2.723817
|
|
},
|
|
{
|
|
"ce_loss": 1.0256,
|
|
"epoch": 0.2836109754553512,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.216321050275996e-05,
|
|
"loss": 1.0256,
|
|
"mean_token_accuracy": 0.7672031052410603,
|
|
"num_tokens": 144495655.0,
|
|
"step": 1960,
|
|
"train_ppl": 2.788658
|
|
},
|
|
{
|
|
"ce_loss": 1.014,
|
|
"epoch": 0.28505797022808255,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.211845442339251e-05,
|
|
"loss": 1.014,
|
|
"mean_token_accuracy": 0.7690494567155838,
|
|
"num_tokens": 145192447.0,
|
|
"step": 1970,
|
|
"train_ppl": 2.756653
|
|
},
|
|
{
|
|
"ce_loss": 0.9811,
|
|
"epoch": 0.28650496500081396,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2073698344025064e-05,
|
|
"loss": 0.9811,
|
|
"mean_token_accuracy": 0.7795913711190223,
|
|
"num_tokens": 145925116.0,
|
|
"step": 1980,
|
|
"train_ppl": 2.667272
|
|
},
|
|
{
|
|
"ce_loss": 1.0033,
|
|
"epoch": 0.2879519597735453,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2028942264657616e-05,
|
|
"loss": 1.0033,
|
|
"mean_token_accuracy": 0.771687439084053,
|
|
"num_tokens": 146651269.0,
|
|
"step": 1990,
|
|
"train_ppl": 2.727271
|
|
},
|
|
{
|
|
"ce_loss": 0.9813,
|
|
"epoch": 0.2893989545462767,
|
|
"grad_norm": 1.3984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.198418618529017e-05,
|
|
"loss": 0.9813,
|
|
"mean_token_accuracy": 0.7775134235620499,
|
|
"num_tokens": 147381768.0,
|
|
"step": 2000,
|
|
"train_ppl": 2.66782
|
|
},
|
|
{
|
|
"ce_loss": 0.9635,
|
|
"epoch": 0.2908459493190081,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1939430105922724e-05,
|
|
"loss": 0.9635,
|
|
"mean_token_accuracy": 0.77833351790905,
|
|
"num_tokens": 148133098.0,
|
|
"step": 2010,
|
|
"train_ppl": 2.620909
|
|
},
|
|
{
|
|
"ce_loss": 0.9986,
|
|
"epoch": 0.29229294409173945,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1894674026555274e-05,
|
|
"loss": 0.9986,
|
|
"mean_token_accuracy": 0.768501528352499,
|
|
"num_tokens": 148873416.0,
|
|
"step": 2020,
|
|
"train_ppl": 2.714389
|
|
},
|
|
{
|
|
"ce_loss": 0.982,
|
|
"epoch": 0.29373993886447086,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1849917947187826e-05,
|
|
"loss": 0.982,
|
|
"mean_token_accuracy": 0.7724484153091907,
|
|
"num_tokens": 149593131.0,
|
|
"step": 2030,
|
|
"train_ppl": 2.66977
|
|
},
|
|
{
|
|
"ce_loss": 0.9759,
|
|
"epoch": 0.2951869336372022,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.180516186782038e-05,
|
|
"loss": 0.9759,
|
|
"mean_token_accuracy": 0.775026997178793,
|
|
"num_tokens": 150341769.0,
|
|
"step": 2040,
|
|
"train_ppl": 2.653647
|
|
},
|
|
{
|
|
"ce_loss": 0.9829,
|
|
"epoch": 0.29663392840993363,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.176040578845293e-05,
|
|
"loss": 0.9829,
|
|
"mean_token_accuracy": 0.7747074596583843,
|
|
"num_tokens": 151082730.0,
|
|
"step": 2050,
|
|
"train_ppl": 2.672224
|
|
},
|
|
{
|
|
"ce_loss": 0.9525,
|
|
"epoch": 0.298080923182665,
|
|
"grad_norm": 0.90625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1715649709085487e-05,
|
|
"loss": 0.9525,
|
|
"mean_token_accuracy": 0.7772355630993844,
|
|
"num_tokens": 151831662.0,
|
|
"step": 2060,
|
|
"train_ppl": 2.592082
|
|
},
|
|
{
|
|
"ce_loss": 0.9725,
|
|
"epoch": 0.2995279179553964,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1670893629718036e-05,
|
|
"loss": 0.9725,
|
|
"mean_token_accuracy": 0.778071166574955,
|
|
"num_tokens": 152542559.0,
|
|
"step": 2070,
|
|
"train_ppl": 2.644496
|
|
},
|
|
{
|
|
"ce_loss": 0.9505,
|
|
"epoch": 0.30097491272812776,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1626137550350588e-05,
|
|
"loss": 0.9505,
|
|
"mean_token_accuracy": 0.780910176038742,
|
|
"num_tokens": 153266179.0,
|
|
"step": 2080,
|
|
"train_ppl": 2.586885
|
|
},
|
|
{
|
|
"ce_loss": 1.0026,
|
|
"epoch": 0.3024219075008592,
|
|
"grad_norm": 0.97265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1581381470983144e-05,
|
|
"loss": 1.0026,
|
|
"mean_token_accuracy": 0.7699606984853744,
|
|
"num_tokens": 153970933.0,
|
|
"step": 2090,
|
|
"train_ppl": 2.725251
|
|
},
|
|
{
|
|
"ce_loss": 0.9648,
|
|
"epoch": 0.30386890227359054,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1536625391615693e-05,
|
|
"loss": 0.9648,
|
|
"mean_token_accuracy": 0.7735878027975559,
|
|
"num_tokens": 154711094.0,
|
|
"step": 2100,
|
|
"train_ppl": 2.624383
|
|
},
|
|
{
|
|
"ce_loss": 0.9964,
|
|
"epoch": 0.3053158970463219,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.149186931224825e-05,
|
|
"loss": 0.9964,
|
|
"mean_token_accuracy": 0.7693284347653389,
|
|
"num_tokens": 155440558.0,
|
|
"step": 2110,
|
|
"train_ppl": 2.70838
|
|
},
|
|
{
|
|
"ce_loss": 0.9726,
|
|
"epoch": 0.3067628918190533,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.14471132328808e-05,
|
|
"loss": 0.9726,
|
|
"mean_token_accuracy": 0.7746382050216198,
|
|
"num_tokens": 156165366.0,
|
|
"step": 2120,
|
|
"train_ppl": 2.644842
|
|
},
|
|
{
|
|
"ce_loss": 0.9639,
|
|
"epoch": 0.30820988659178467,
|
|
"grad_norm": 0.8984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1402357153513354e-05,
|
|
"loss": 0.9639,
|
|
"mean_token_accuracy": 0.7744808107614517,
|
|
"num_tokens": 156890899.0,
|
|
"step": 2130,
|
|
"train_ppl": 2.622018
|
|
},
|
|
{
|
|
"ce_loss": 0.9989,
|
|
"epoch": 0.3096568813645161,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1357601074145906e-05,
|
|
"loss": 0.9989,
|
|
"mean_token_accuracy": 0.767997769266367,
|
|
"num_tokens": 157604658.0,
|
|
"step": 2140,
|
|
"train_ppl": 2.715335
|
|
},
|
|
{
|
|
"ce_loss": 0.9718,
|
|
"epoch": 0.31110387613724744,
|
|
"grad_norm": 1.234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1312844994778455e-05,
|
|
"loss": 0.9718,
|
|
"mean_token_accuracy": 0.78013886064291,
|
|
"num_tokens": 158336316.0,
|
|
"step": 2150,
|
|
"train_ppl": 2.642823
|
|
},
|
|
{
|
|
"ce_loss": 0.9457,
|
|
"epoch": 0.31255087090997885,
|
|
"grad_norm": 1.4609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.126808891541101e-05,
|
|
"loss": 0.9457,
|
|
"mean_token_accuracy": 0.7810127899050713,
|
|
"num_tokens": 159052431.0,
|
|
"step": 2160,
|
|
"train_ppl": 2.57449
|
|
},
|
|
{
|
|
"ce_loss": 0.9374,
|
|
"epoch": 0.3139978656827102,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1223332836043564e-05,
|
|
"loss": 0.9374,
|
|
"mean_token_accuracy": 0.7826711490750313,
|
|
"num_tokens": 159747771.0,
|
|
"step": 2170,
|
|
"train_ppl": 2.553444
|
|
},
|
|
{
|
|
"ce_loss": 1.0028,
|
|
"epoch": 0.3154448604554416,
|
|
"grad_norm": 1.1640625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1178576756676116e-05,
|
|
"loss": 1.0028,
|
|
"mean_token_accuracy": 0.7743060775101185,
|
|
"num_tokens": 160475032.0,
|
|
"step": 2180,
|
|
"train_ppl": 2.725815
|
|
},
|
|
{
|
|
"ce_loss": 0.9964,
|
|
"epoch": 0.316891855228173,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.113382067730867e-05,
|
|
"loss": 0.9964,
|
|
"mean_token_accuracy": 0.7711601614952087,
|
|
"num_tokens": 161204515.0,
|
|
"step": 2190,
|
|
"train_ppl": 2.708637
|
|
},
|
|
{
|
|
"ce_loss": 1.0099,
|
|
"epoch": 0.3183388500009044,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.108906459794122e-05,
|
|
"loss": 1.0099,
|
|
"mean_token_accuracy": 0.7715992897748947,
|
|
"num_tokens": 161961019.0,
|
|
"step": 2200,
|
|
"train_ppl": 2.745375
|
|
},
|
|
{
|
|
"ce_loss": 0.9498,
|
|
"epoch": 0.31978584477363575,
|
|
"grad_norm": 0.90234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.1044308518573773e-05,
|
|
"loss": 0.9498,
|
|
"mean_token_accuracy": 0.7826919294893742,
|
|
"num_tokens": 162710799.0,
|
|
"step": 2210,
|
|
"train_ppl": 2.58529
|
|
},
|
|
{
|
|
"ce_loss": 0.9621,
|
|
"epoch": 0.32123283954636717,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0999552439206326e-05,
|
|
"loss": 0.9621,
|
|
"mean_token_accuracy": 0.775107191503048,
|
|
"num_tokens": 163439737.0,
|
|
"step": 2220,
|
|
"train_ppl": 2.61714
|
|
},
|
|
{
|
|
"ce_loss": 0.9943,
|
|
"epoch": 0.3226798343190985,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0954796359838878e-05,
|
|
"loss": 0.9943,
|
|
"mean_token_accuracy": 0.7698855645954609,
|
|
"num_tokens": 164145582.0,
|
|
"step": 2230,
|
|
"train_ppl": 2.702918
|
|
},
|
|
{
|
|
"ce_loss": 0.9771,
|
|
"epoch": 0.3241268290918299,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.091004028047143e-05,
|
|
"loss": 0.9771,
|
|
"mean_token_accuracy": 0.7765941433608532,
|
|
"num_tokens": 164896393.0,
|
|
"step": 2240,
|
|
"train_ppl": 2.656623
|
|
},
|
|
{
|
|
"ce_loss": 1.0023,
|
|
"epoch": 0.3255738238645613,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0865284201103983e-05,
|
|
"loss": 1.0023,
|
|
"mean_token_accuracy": 0.7708912000060082,
|
|
"num_tokens": 165627341.0,
|
|
"step": 2250,
|
|
"train_ppl": 2.724545
|
|
},
|
|
{
|
|
"ce_loss": 0.9689,
|
|
"epoch": 0.32702081863729265,
|
|
"grad_norm": 1.3125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0820528121736536e-05,
|
|
"loss": 0.9689,
|
|
"mean_token_accuracy": 0.7807579897344112,
|
|
"num_tokens": 166354943.0,
|
|
"step": 2260,
|
|
"train_ppl": 2.635139
|
|
},
|
|
{
|
|
"ce_loss": 1.0493,
|
|
"epoch": 0.32846781341002407,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0775772042369088e-05,
|
|
"loss": 1.0493,
|
|
"mean_token_accuracy": 0.7613647289574146,
|
|
"num_tokens": 167066270.0,
|
|
"step": 2270,
|
|
"train_ppl": 2.855513
|
|
},
|
|
{
|
|
"ce_loss": 0.9991,
|
|
"epoch": 0.3299148081827554,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0731015963001644e-05,
|
|
"loss": 0.9991,
|
|
"mean_token_accuracy": 0.7712046861648559,
|
|
"num_tokens": 167801986.0,
|
|
"step": 2280,
|
|
"train_ppl": 2.715823
|
|
},
|
|
{
|
|
"ce_loss": 0.9657,
|
|
"epoch": 0.33136180295548684,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0686259883634193e-05,
|
|
"loss": 0.9657,
|
|
"mean_token_accuracy": 0.7770779870450497,
|
|
"num_tokens": 168554289.0,
|
|
"step": 2290,
|
|
"train_ppl": 2.626717
|
|
},
|
|
{
|
|
"ce_loss": 0.9849,
|
|
"epoch": 0.3328087977282182,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0641503804266745e-05,
|
|
"loss": 0.9849,
|
|
"mean_token_accuracy": 0.7736143194139004,
|
|
"num_tokens": 169286476.0,
|
|
"step": 2300,
|
|
"train_ppl": 2.677655
|
|
},
|
|
{
|
|
"ce_loss": 0.9921,
|
|
"epoch": 0.3342557925009496,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.05967477248993e-05,
|
|
"loss": 0.9921,
|
|
"mean_token_accuracy": 0.7730519793927669,
|
|
"num_tokens": 170017128.0,
|
|
"step": 2310,
|
|
"train_ppl": 2.696846
|
|
},
|
|
{
|
|
"ce_loss": 0.9767,
|
|
"epoch": 0.33570278727368097,
|
|
"grad_norm": 0.97265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.055199164553185e-05,
|
|
"loss": 0.9767,
|
|
"mean_token_accuracy": 0.7729025609791279,
|
|
"num_tokens": 170740098.0,
|
|
"step": 2320,
|
|
"train_ppl": 2.655607
|
|
},
|
|
{
|
|
"ce_loss": 0.9937,
|
|
"epoch": 0.3371497820464124,
|
|
"grad_norm": 0.91796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0507235566164406e-05,
|
|
"loss": 0.9937,
|
|
"mean_token_accuracy": 0.7697398900985718,
|
|
"num_tokens": 171468647.0,
|
|
"step": 2330,
|
|
"train_ppl": 2.701241
|
|
},
|
|
{
|
|
"ce_loss": 0.9793,
|
|
"epoch": 0.33859677681914374,
|
|
"grad_norm": 0.85546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0462479486796955e-05,
|
|
"loss": 0.9793,
|
|
"mean_token_accuracy": 0.7745302498340607,
|
|
"num_tokens": 172205055.0,
|
|
"step": 2340,
|
|
"train_ppl": 2.662539
|
|
},
|
|
{
|
|
"ce_loss": 0.9681,
|
|
"epoch": 0.3400437715918751,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.041772340742951e-05,
|
|
"loss": 0.9681,
|
|
"mean_token_accuracy": 0.7831182412803173,
|
|
"num_tokens": 172927359.0,
|
|
"step": 2350,
|
|
"train_ppl": 2.633018
|
|
},
|
|
{
|
|
"ce_loss": 0.9964,
|
|
"epoch": 0.3414907663646065,
|
|
"grad_norm": 1.3515625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0372967328062063e-05,
|
|
"loss": 0.9964,
|
|
"mean_token_accuracy": 0.7754109688103199,
|
|
"num_tokens": 173673857.0,
|
|
"step": 2360,
|
|
"train_ppl": 2.708586
|
|
},
|
|
{
|
|
"ce_loss": 0.9587,
|
|
"epoch": 0.34293776113733787,
|
|
"grad_norm": 0.83203125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0328211248694613e-05,
|
|
"loss": 0.9587,
|
|
"mean_token_accuracy": 0.779682033509016,
|
|
"num_tokens": 174453403.0,
|
|
"step": 2370,
|
|
"train_ppl": 2.608364
|
|
},
|
|
{
|
|
"ce_loss": 0.9886,
|
|
"epoch": 0.3443847559100693,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.028345516932717e-05,
|
|
"loss": 0.9886,
|
|
"mean_token_accuracy": 0.7737836137413978,
|
|
"num_tokens": 175185041.0,
|
|
"step": 2380,
|
|
"train_ppl": 2.687588
|
|
},
|
|
{
|
|
"ce_loss": 1.0085,
|
|
"epoch": 0.34583175068280064,
|
|
"grad_norm": 1.4765625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.023869908995972e-05,
|
|
"loss": 1.0085,
|
|
"mean_token_accuracy": 0.7715661711990833,
|
|
"num_tokens": 175943212.0,
|
|
"step": 2390,
|
|
"train_ppl": 2.741487
|
|
},
|
|
{
|
|
"ce_loss": 0.9599,
|
|
"epoch": 0.34727874545553206,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0193943010592273e-05,
|
|
"loss": 0.9599,
|
|
"mean_token_accuracy": 0.7831589214503765,
|
|
"num_tokens": 176663659.0,
|
|
"step": 2400,
|
|
"train_ppl": 2.611419
|
|
},
|
|
{
|
|
"ce_loss": 0.9629,
|
|
"epoch": 0.3487257402282634,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0149186931224826e-05,
|
|
"loss": 0.9629,
|
|
"mean_token_accuracy": 0.7757728450000286,
|
|
"num_tokens": 177369018.0,
|
|
"step": 2410,
|
|
"train_ppl": 2.61941
|
|
},
|
|
{
|
|
"ce_loss": 1.0039,
|
|
"epoch": 0.35017273500099483,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0104430851857378e-05,
|
|
"loss": 1.0039,
|
|
"mean_token_accuracy": 0.7666012078523636,
|
|
"num_tokens": 178089918.0,
|
|
"step": 2420,
|
|
"train_ppl": 2.728987
|
|
},
|
|
{
|
|
"ce_loss": 0.9237,
|
|
"epoch": 0.3516197297737262,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.005967477248993e-05,
|
|
"loss": 0.9237,
|
|
"mean_token_accuracy": 0.7838417246937752,
|
|
"num_tokens": 178829829.0,
|
|
"step": 2430,
|
|
"train_ppl": 2.518548
|
|
},
|
|
{
|
|
"ce_loss": 0.9632,
|
|
"epoch": 0.3530667245464576,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0014918693122483e-05,
|
|
"loss": 0.9632,
|
|
"mean_token_accuracy": 0.7799612589180469,
|
|
"num_tokens": 179584153.0,
|
|
"step": 2440,
|
|
"train_ppl": 2.620184
|
|
},
|
|
{
|
|
"ce_loss": 0.9362,
|
|
"epoch": 0.35451371931918896,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9970162613755035e-05,
|
|
"loss": 0.9362,
|
|
"mean_token_accuracy": 0.7820769309997558,
|
|
"num_tokens": 180331127.0,
|
|
"step": 2450,
|
|
"train_ppl": 2.550154
|
|
},
|
|
{
|
|
"ce_loss": 1.0117,
|
|
"epoch": 0.3559607140919203,
|
|
"grad_norm": 0.8828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9925406534387588e-05,
|
|
"loss": 1.0117,
|
|
"mean_token_accuracy": 0.771592228859663,
|
|
"num_tokens": 181067782.0,
|
|
"step": 2460,
|
|
"train_ppl": 2.750146
|
|
},
|
|
{
|
|
"ce_loss": 0.9859,
|
|
"epoch": 0.35740770886465173,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.988065045502014e-05,
|
|
"loss": 0.9859,
|
|
"mean_token_accuracy": 0.7738970972597599,
|
|
"num_tokens": 181793714.0,
|
|
"step": 2470,
|
|
"train_ppl": 2.680159
|
|
},
|
|
{
|
|
"ce_loss": 0.962,
|
|
"epoch": 0.3588547036373831,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9835894375652693e-05,
|
|
"loss": 0.962,
|
|
"mean_token_accuracy": 0.7789099134504796,
|
|
"num_tokens": 182531886.0,
|
|
"step": 2480,
|
|
"train_ppl": 2.616999
|
|
},
|
|
{
|
|
"ce_loss": 0.9957,
|
|
"epoch": 0.3603016984101145,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9791138296285245e-05,
|
|
"loss": 0.9957,
|
|
"mean_token_accuracy": 0.7706431902945041,
|
|
"num_tokens": 183300557.0,
|
|
"step": 2490,
|
|
"train_ppl": 2.706542
|
|
},
|
|
{
|
|
"ce_loss": 0.96,
|
|
"epoch": 0.36174869318284586,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.97463822169178e-05,
|
|
"loss": 0.96,
|
|
"mean_token_accuracy": 0.7810012176632881,
|
|
"num_tokens": 184029451.0,
|
|
"step": 2500,
|
|
"train_ppl": 2.611579
|
|
},
|
|
{
|
|
"ce_loss": 0.9386,
|
|
"epoch": 0.3631956879555773,
|
|
"grad_norm": 1.296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.970162613755035e-05,
|
|
"loss": 0.9386,
|
|
"mean_token_accuracy": 0.7798774808645248,
|
|
"num_tokens": 184746003.0,
|
|
"step": 2510,
|
|
"train_ppl": 2.556315
|
|
},
|
|
{
|
|
"ce_loss": 0.9735,
|
|
"epoch": 0.36464268272830863,
|
|
"grad_norm": 0.92578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9656870058182903e-05,
|
|
"loss": 0.9735,
|
|
"mean_token_accuracy": 0.7773295849561691,
|
|
"num_tokens": 185472125.0,
|
|
"step": 2520,
|
|
"train_ppl": 2.647223
|
|
},
|
|
{
|
|
"ce_loss": 0.9715,
|
|
"epoch": 0.36608967750104005,
|
|
"grad_norm": 0.859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9612113978815455e-05,
|
|
"loss": 0.9715,
|
|
"mean_token_accuracy": 0.7736013270914555,
|
|
"num_tokens": 186174697.0,
|
|
"step": 2530,
|
|
"train_ppl": 2.641837
|
|
},
|
|
{
|
|
"ce_loss": 0.9793,
|
|
"epoch": 0.3675366722737714,
|
|
"grad_norm": 0.85546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9567357899448007e-05,
|
|
"loss": 0.9793,
|
|
"mean_token_accuracy": 0.7726230010390281,
|
|
"num_tokens": 186899192.0,
|
|
"step": 2540,
|
|
"train_ppl": 2.662494
|
|
},
|
|
{
|
|
"ce_loss": 0.9658,
|
|
"epoch": 0.3689836670465028,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9522601820080563e-05,
|
|
"loss": 0.9658,
|
|
"mean_token_accuracy": 0.7793243020772934,
|
|
"num_tokens": 187634580.0,
|
|
"step": 2550,
|
|
"train_ppl": 2.626758
|
|
},
|
|
{
|
|
"ce_loss": 0.965,
|
|
"epoch": 0.3704306618192342,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9477845740713112e-05,
|
|
"loss": 0.965,
|
|
"mean_token_accuracy": 0.7768558643758297,
|
|
"num_tokens": 188388282.0,
|
|
"step": 2560,
|
|
"train_ppl": 2.62484
|
|
},
|
|
{
|
|
"ce_loss": 0.994,
|
|
"epoch": 0.3718776565919656,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9433089661345668e-05,
|
|
"loss": 0.994,
|
|
"mean_token_accuracy": 0.7724675111472606,
|
|
"num_tokens": 189139246.0,
|
|
"step": 2570,
|
|
"train_ppl": 2.701906
|
|
},
|
|
{
|
|
"ce_loss": 0.9555,
|
|
"epoch": 0.37332465136469695,
|
|
"grad_norm": 0.9765625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.938833358197822e-05,
|
|
"loss": 0.9555,
|
|
"mean_token_accuracy": 0.7806055322289467,
|
|
"num_tokens": 189883875.0,
|
|
"step": 2580,
|
|
"train_ppl": 2.599917
|
|
},
|
|
{
|
|
"ce_loss": 0.9659,
|
|
"epoch": 0.3747716461374283,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.934357750261077e-05,
|
|
"loss": 0.9659,
|
|
"mean_token_accuracy": 0.7724411226809025,
|
|
"num_tokens": 190614990.0,
|
|
"step": 2590,
|
|
"train_ppl": 2.627258
|
|
},
|
|
{
|
|
"ce_loss": 0.989,
|
|
"epoch": 0.3762186409101597,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9298821423243326e-05,
|
|
"loss": 0.989,
|
|
"mean_token_accuracy": 0.7706497214734555,
|
|
"num_tokens": 191328905.0,
|
|
"step": 2600,
|
|
"train_ppl": 2.688509
|
|
},
|
|
{
|
|
"ce_loss": 0.9799,
|
|
"epoch": 0.3776656356828911,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9254065343875878e-05,
|
|
"loss": 0.9799,
|
|
"mean_token_accuracy": 0.7754726015031338,
|
|
"num_tokens": 192110447.0,
|
|
"step": 2610,
|
|
"train_ppl": 2.664275
|
|
},
|
|
{
|
|
"ce_loss": 0.9918,
|
|
"epoch": 0.3791126304556225,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.920930926450843e-05,
|
|
"loss": 0.9918,
|
|
"mean_token_accuracy": 0.7714382395148277,
|
|
"num_tokens": 192833107.0,
|
|
"step": 2620,
|
|
"train_ppl": 2.696216
|
|
},
|
|
{
|
|
"ce_loss": 0.9743,
|
|
"epoch": 0.38055962522835385,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9164553185140983e-05,
|
|
"loss": 0.9743,
|
|
"mean_token_accuracy": 0.7756662987172603,
|
|
"num_tokens": 193562730.0,
|
|
"step": 2630,
|
|
"train_ppl": 2.649196
|
|
},
|
|
{
|
|
"ce_loss": 0.9543,
|
|
"epoch": 0.38200662000108526,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9119797105773532e-05,
|
|
"loss": 0.9543,
|
|
"mean_token_accuracy": 0.7818400040268898,
|
|
"num_tokens": 194291195.0,
|
|
"step": 2640,
|
|
"train_ppl": 2.596973
|
|
},
|
|
{
|
|
"ce_loss": 0.9645,
|
|
"epoch": 0.3834536147738166,
|
|
"grad_norm": 0.84375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9075041026406088e-05,
|
|
"loss": 0.9645,
|
|
"mean_token_accuracy": 0.778757381439209,
|
|
"num_tokens": 195035036.0,
|
|
"step": 2650,
|
|
"train_ppl": 2.623353
|
|
},
|
|
{
|
|
"ce_loss": 0.9554,
|
|
"epoch": 0.38490060954654803,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.903028494703864e-05,
|
|
"loss": 0.9554,
|
|
"mean_token_accuracy": 0.7815173707902432,
|
|
"num_tokens": 195753802.0,
|
|
"step": 2660,
|
|
"train_ppl": 2.599595
|
|
},
|
|
{
|
|
"ce_loss": 0.9807,
|
|
"epoch": 0.3863476043192794,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8985528867671193e-05,
|
|
"loss": 0.9807,
|
|
"mean_token_accuracy": 0.7753617249429225,
|
|
"num_tokens": 196473205.0,
|
|
"step": 2670,
|
|
"train_ppl": 2.666363
|
|
},
|
|
{
|
|
"ce_loss": 1.0086,
|
|
"epoch": 0.3877945990920108,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8940772788303745e-05,
|
|
"loss": 1.0086,
|
|
"mean_token_accuracy": 0.7668839745223522,
|
|
"num_tokens": 197209393.0,
|
|
"step": 2680,
|
|
"train_ppl": 2.741868
|
|
},
|
|
{
|
|
"ce_loss": 0.9412,
|
|
"epoch": 0.38924159386474216,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8896016708936298e-05,
|
|
"loss": 0.9412,
|
|
"mean_token_accuracy": 0.7830228976905346,
|
|
"num_tokens": 197950507.0,
|
|
"step": 2690,
|
|
"train_ppl": 2.56312
|
|
},
|
|
{
|
|
"ce_loss": 0.9285,
|
|
"epoch": 0.3906885886374735,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.885126062956885e-05,
|
|
"loss": 0.9285,
|
|
"mean_token_accuracy": 0.7872582785785198,
|
|
"num_tokens": 198707373.0,
|
|
"step": 2700,
|
|
"train_ppl": 2.530723
|
|
},
|
|
{
|
|
"ce_loss": 1.004,
|
|
"epoch": 0.39213558341020494,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8806504550201402e-05,
|
|
"loss": 1.004,
|
|
"mean_token_accuracy": 0.7696459926664829,
|
|
"num_tokens": 199432253.0,
|
|
"step": 2710,
|
|
"train_ppl": 2.729275
|
|
},
|
|
{
|
|
"ce_loss": 0.9438,
|
|
"epoch": 0.3935825781829363,
|
|
"grad_norm": 0.8984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8761748470833958e-05,
|
|
"loss": 0.9438,
|
|
"mean_token_accuracy": 0.7834368832409382,
|
|
"num_tokens": 200205289.0,
|
|
"step": 2720,
|
|
"train_ppl": 2.569663
|
|
},
|
|
{
|
|
"ce_loss": 0.9668,
|
|
"epoch": 0.3950295729556677,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8716992391466507e-05,
|
|
"loss": 0.9668,
|
|
"mean_token_accuracy": 0.7788598984479904,
|
|
"num_tokens": 200948293.0,
|
|
"step": 2730,
|
|
"train_ppl": 2.629388
|
|
},
|
|
{
|
|
"ce_loss": 0.9844,
|
|
"epoch": 0.39647656772839907,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.867223631209906e-05,
|
|
"loss": 0.9844,
|
|
"mean_token_accuracy": 0.7698593437671661,
|
|
"num_tokens": 201693594.0,
|
|
"step": 2740,
|
|
"train_ppl": 2.676329
|
|
},
|
|
{
|
|
"ce_loss": 0.9749,
|
|
"epoch": 0.3979235625011305,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8627480232731612e-05,
|
|
"loss": 0.9749,
|
|
"mean_token_accuracy": 0.7773583248257637,
|
|
"num_tokens": 202425022.0,
|
|
"step": 2750,
|
|
"train_ppl": 2.650845
|
|
},
|
|
{
|
|
"ce_loss": 0.969,
|
|
"epoch": 0.39937055727386184,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8582724153364165e-05,
|
|
"loss": 0.969,
|
|
"mean_token_accuracy": 0.7747991502285003,
|
|
"num_tokens": 203166750.0,
|
|
"step": 2760,
|
|
"train_ppl": 2.635431
|
|
},
|
|
{
|
|
"ce_loss": 0.9665,
|
|
"epoch": 0.40081755204659325,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.853796807399672e-05,
|
|
"loss": 0.9665,
|
|
"mean_token_accuracy": 0.773398594558239,
|
|
"num_tokens": 203882390.0,
|
|
"step": 2770,
|
|
"train_ppl": 2.628676
|
|
},
|
|
{
|
|
"ce_loss": 0.9587,
|
|
"epoch": 0.4022645468193246,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.849321199462927e-05,
|
|
"loss": 0.9587,
|
|
"mean_token_accuracy": 0.7789006575942039,
|
|
"num_tokens": 204626671.0,
|
|
"step": 2780,
|
|
"train_ppl": 2.608222
|
|
},
|
|
{
|
|
"ce_loss": 0.9712,
|
|
"epoch": 0.403711541592056,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8448455915261825e-05,
|
|
"loss": 0.9712,
|
|
"mean_token_accuracy": 0.7756584413349629,
|
|
"num_tokens": 205353873.0,
|
|
"step": 2790,
|
|
"train_ppl": 2.641169
|
|
},
|
|
{
|
|
"ce_loss": 0.9684,
|
|
"epoch": 0.4051585363647874,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8403699835894378e-05,
|
|
"loss": 0.9684,
|
|
"mean_token_accuracy": 0.7775221608579159,
|
|
"num_tokens": 206089475.0,
|
|
"step": 2800,
|
|
"train_ppl": 2.63379
|
|
},
|
|
{
|
|
"ce_loss": 1.0109,
|
|
"epoch": 0.40660553113751874,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8358943756526927e-05,
|
|
"loss": 1.0109,
|
|
"mean_token_accuracy": 0.7700402162969112,
|
|
"num_tokens": 206830670.0,
|
|
"step": 2810,
|
|
"train_ppl": 2.747938
|
|
},
|
|
{
|
|
"ce_loss": 0.945,
|
|
"epoch": 0.40805252591025015,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8314187677159483e-05,
|
|
"loss": 0.945,
|
|
"mean_token_accuracy": 0.7814373821020126,
|
|
"num_tokens": 207591527.0,
|
|
"step": 2820,
|
|
"train_ppl": 2.572862
|
|
},
|
|
{
|
|
"ce_loss": 0.9544,
|
|
"epoch": 0.4094995206829815,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8269431597792032e-05,
|
|
"loss": 0.9544,
|
|
"mean_token_accuracy": 0.7797525011003017,
|
|
"num_tokens": 208339441.0,
|
|
"step": 2830,
|
|
"train_ppl": 2.597219
|
|
},
|
|
{
|
|
"ce_loss": 0.9706,
|
|
"epoch": 0.4109465154557129,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8224675518424588e-05,
|
|
"loss": 0.9706,
|
|
"mean_token_accuracy": 0.7762934103608131,
|
|
"num_tokens": 209078453.0,
|
|
"step": 2840,
|
|
"train_ppl": 2.639582
|
|
},
|
|
{
|
|
"ce_loss": 0.9529,
|
|
"epoch": 0.4123935102284443,
|
|
"grad_norm": 1.359375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.817991943905714e-05,
|
|
"loss": 0.9529,
|
|
"mean_token_accuracy": 0.7769104249775409,
|
|
"num_tokens": 209817755.0,
|
|
"step": 2850,
|
|
"train_ppl": 2.593285
|
|
},
|
|
{
|
|
"ce_loss": 0.9647,
|
|
"epoch": 0.4138405050011757,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.813516335968969e-05,
|
|
"loss": 0.9647,
|
|
"mean_token_accuracy": 0.7746372953057289,
|
|
"num_tokens": 210572147.0,
|
|
"step": 2860,
|
|
"train_ppl": 2.624049
|
|
},
|
|
{
|
|
"ce_loss": 0.9791,
|
|
"epoch": 0.41528749977390705,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8090407280322245e-05,
|
|
"loss": 0.9791,
|
|
"mean_token_accuracy": 0.7739841856062413,
|
|
"num_tokens": 211317422.0,
|
|
"step": 2870,
|
|
"train_ppl": 2.662128
|
|
},
|
|
{
|
|
"ce_loss": 0.9535,
|
|
"epoch": 0.41673449454663847,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8045651200954797e-05,
|
|
"loss": 0.9535,
|
|
"mean_token_accuracy": 0.7812499180436134,
|
|
"num_tokens": 212076246.0,
|
|
"step": 2880,
|
|
"train_ppl": 2.594664
|
|
},
|
|
{
|
|
"ce_loss": 0.989,
|
|
"epoch": 0.4181814893193698,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.800089512158735e-05,
|
|
"loss": 0.989,
|
|
"mean_token_accuracy": 0.7691139645874501,
|
|
"num_tokens": 212763964.0,
|
|
"step": 2890,
|
|
"train_ppl": 2.688652
|
|
},
|
|
{
|
|
"ce_loss": 0.952,
|
|
"epoch": 0.41962848409210124,
|
|
"grad_norm": 0.95703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7956139042219902e-05,
|
|
"loss": 0.952,
|
|
"mean_token_accuracy": 0.777950644493103,
|
|
"num_tokens": 213512388.0,
|
|
"step": 2900,
|
|
"train_ppl": 2.590762
|
|
},
|
|
{
|
|
"ce_loss": 0.9988,
|
|
"epoch": 0.4210754788648326,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7911382962852455e-05,
|
|
"loss": 0.9988,
|
|
"mean_token_accuracy": 0.7697994232177734,
|
|
"num_tokens": 214220646.0,
|
|
"step": 2910,
|
|
"train_ppl": 2.715134
|
|
},
|
|
{
|
|
"ce_loss": 0.9738,
|
|
"epoch": 0.422522473637564,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7866626883485007e-05,
|
|
"loss": 0.9738,
|
|
"mean_token_accuracy": 0.7759139001369476,
|
|
"num_tokens": 214925657.0,
|
|
"step": 2920,
|
|
"train_ppl": 2.647943
|
|
},
|
|
{
|
|
"ce_loss": 0.9857,
|
|
"epoch": 0.42396946841029537,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.782187080411756e-05,
|
|
"loss": 0.9857,
|
|
"mean_token_accuracy": 0.7746396206319333,
|
|
"num_tokens": 215622023.0,
|
|
"step": 2930,
|
|
"train_ppl": 2.679806
|
|
},
|
|
{
|
|
"ce_loss": 0.9942,
|
|
"epoch": 0.4254164631830267,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7777114724750112e-05,
|
|
"loss": 0.9942,
|
|
"mean_token_accuracy": 0.7746829591691494,
|
|
"num_tokens": 216363572.0,
|
|
"step": 2940,
|
|
"train_ppl": 2.702513
|
|
},
|
|
{
|
|
"ce_loss": 0.9358,
|
|
"epoch": 0.42686345795575814,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7732358645382665e-05,
|
|
"loss": 0.9358,
|
|
"mean_token_accuracy": 0.7809817381203175,
|
|
"num_tokens": 217117940.0,
|
|
"step": 2950,
|
|
"train_ppl": 2.549177
|
|
},
|
|
{
|
|
"ce_loss": 0.9511,
|
|
"epoch": 0.4283104527284895,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7687602566015217e-05,
|
|
"loss": 0.9511,
|
|
"mean_token_accuracy": 0.774829763174057,
|
|
"num_tokens": 217882702.0,
|
|
"step": 2960,
|
|
"train_ppl": 2.588437
|
|
},
|
|
{
|
|
"ce_loss": 0.9726,
|
|
"epoch": 0.4297574475012209,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.764284648664777e-05,
|
|
"loss": 0.9726,
|
|
"mean_token_accuracy": 0.7748524136841297,
|
|
"num_tokens": 218610599.0,
|
|
"step": 2970,
|
|
"train_ppl": 2.64482
|
|
},
|
|
{
|
|
"ce_loss": 0.9812,
|
|
"epoch": 0.43120444227395227,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7598090407280322e-05,
|
|
"loss": 0.9812,
|
|
"mean_token_accuracy": 0.7769106313586235,
|
|
"num_tokens": 219344239.0,
|
|
"step": 2980,
|
|
"train_ppl": 2.667774
|
|
},
|
|
{
|
|
"ce_loss": 0.9636,
|
|
"epoch": 0.4326514370466837,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7553334327912878e-05,
|
|
"loss": 0.9636,
|
|
"mean_token_accuracy": 0.7774206228554249,
|
|
"num_tokens": 220070330.0,
|
|
"step": 2990,
|
|
"train_ppl": 2.621097
|
|
},
|
|
{
|
|
"ce_loss": 0.9503,
|
|
"epoch": 0.43409843181941504,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7508578248545427e-05,
|
|
"loss": 0.9503,
|
|
"mean_token_accuracy": 0.7805333323776722,
|
|
"num_tokens": 220786645.0,
|
|
"step": 3000,
|
|
"train_ppl": 2.586443
|
|
},
|
|
{
|
|
"ce_loss": 0.9727,
|
|
"epoch": 0.43554542659214646,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.746382216917798e-05,
|
|
"loss": 0.9727,
|
|
"mean_token_accuracy": 0.7798659265041351,
|
|
"num_tokens": 221501835.0,
|
|
"step": 3010,
|
|
"train_ppl": 2.644989
|
|
},
|
|
{
|
|
"ce_loss": 0.976,
|
|
"epoch": 0.4369924213648778,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.741906608981053e-05,
|
|
"loss": 0.976,
|
|
"mean_token_accuracy": 0.7753879025578498,
|
|
"num_tokens": 222228551.0,
|
|
"step": 3020,
|
|
"train_ppl": 2.65379
|
|
},
|
|
{
|
|
"ce_loss": 0.9761,
|
|
"epoch": 0.43843941613760923,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7374310010443084e-05,
|
|
"loss": 0.9761,
|
|
"mean_token_accuracy": 0.7760777927935123,
|
|
"num_tokens": 222946933.0,
|
|
"step": 3030,
|
|
"train_ppl": 2.654151
|
|
},
|
|
{
|
|
"ce_loss": 0.9944,
|
|
"epoch": 0.4398864109103406,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.732955393107564e-05,
|
|
"loss": 0.9944,
|
|
"mean_token_accuracy": 0.7701233983039856,
|
|
"num_tokens": 223687091.0,
|
|
"step": 3040,
|
|
"train_ppl": 2.703226
|
|
},
|
|
{
|
|
"ce_loss": 0.9391,
|
|
"epoch": 0.44133340568307194,
|
|
"grad_norm": 0.97265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.728479785170819e-05,
|
|
"loss": 0.9391,
|
|
"mean_token_accuracy": 0.7819373540580272,
|
|
"num_tokens": 224415889.0,
|
|
"step": 3050,
|
|
"train_ppl": 2.557619
|
|
},
|
|
{
|
|
"ce_loss": 0.9311,
|
|
"epoch": 0.44278040045580336,
|
|
"grad_norm": 0.8828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7240041772340745e-05,
|
|
"loss": 0.9311,
|
|
"mean_token_accuracy": 0.7835486814379692,
|
|
"num_tokens": 225175613.0,
|
|
"step": 3060,
|
|
"train_ppl": 2.537334
|
|
},
|
|
{
|
|
"ce_loss": 0.9712,
|
|
"epoch": 0.4442273952285347,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7195285692973297e-05,
|
|
"loss": 0.9712,
|
|
"mean_token_accuracy": 0.7758528731763363,
|
|
"num_tokens": 225931362.0,
|
|
"step": 3070,
|
|
"train_ppl": 2.641217
|
|
},
|
|
{
|
|
"ce_loss": 0.9468,
|
|
"epoch": 0.44567439000126613,
|
|
"grad_norm": 0.9140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7150529613605846e-05,
|
|
"loss": 0.9468,
|
|
"mean_token_accuracy": 0.7813886523246765,
|
|
"num_tokens": 226658710.0,
|
|
"step": 3080,
|
|
"train_ppl": 2.577371
|
|
},
|
|
{
|
|
"ce_loss": 0.9776,
|
|
"epoch": 0.4471213847739975,
|
|
"grad_norm": 1.2265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7105773534238402e-05,
|
|
"loss": 0.9776,
|
|
"mean_token_accuracy": 0.7746784225106239,
|
|
"num_tokens": 227404471.0,
|
|
"step": 3090,
|
|
"train_ppl": 2.658194
|
|
},
|
|
{
|
|
"ce_loss": 0.9739,
|
|
"epoch": 0.4485683795467289,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7061017454870955e-05,
|
|
"loss": 0.9739,
|
|
"mean_token_accuracy": 0.7733561553061008,
|
|
"num_tokens": 228132005.0,
|
|
"step": 3100,
|
|
"train_ppl": 2.648246
|
|
},
|
|
{
|
|
"ce_loss": 0.9602,
|
|
"epoch": 0.45001537431946026,
|
|
"grad_norm": 0.88671875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7016261375503507e-05,
|
|
"loss": 0.9602,
|
|
"mean_token_accuracy": 0.7756247140467167,
|
|
"num_tokens": 228859507.0,
|
|
"step": 3110,
|
|
"train_ppl": 2.612151
|
|
},
|
|
{
|
|
"ce_loss": 0.979,
|
|
"epoch": 0.4514623690921917,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.697150529613606e-05,
|
|
"loss": 0.979,
|
|
"mean_token_accuracy": 0.7758997343480587,
|
|
"num_tokens": 229580037.0,
|
|
"step": 3120,
|
|
"train_ppl": 2.661712
|
|
},
|
|
{
|
|
"ce_loss": 0.9772,
|
|
"epoch": 0.45290936386492303,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.692674921676861e-05,
|
|
"loss": 0.9772,
|
|
"mean_token_accuracy": 0.7744156174361706,
|
|
"num_tokens": 230322304.0,
|
|
"step": 3130,
|
|
"train_ppl": 2.657003
|
|
},
|
|
{
|
|
"ce_loss": 0.9562,
|
|
"epoch": 0.45435635863765444,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6881993137401164e-05,
|
|
"loss": 0.9562,
|
|
"mean_token_accuracy": 0.7790285974740982,
|
|
"num_tokens": 231059980.0,
|
|
"step": 3140,
|
|
"train_ppl": 2.601828
|
|
},
|
|
{
|
|
"ce_loss": 0.9527,
|
|
"epoch": 0.4558033534103858,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6837237058033717e-05,
|
|
"loss": 0.9527,
|
|
"mean_token_accuracy": 0.7776475623250008,
|
|
"num_tokens": 231819587.0,
|
|
"step": 3150,
|
|
"train_ppl": 2.592802
|
|
},
|
|
{
|
|
"ce_loss": 0.9886,
|
|
"epoch": 0.45725034818311716,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.679248097866627e-05,
|
|
"loss": 0.9886,
|
|
"mean_token_accuracy": 0.7710159003734589,
|
|
"num_tokens": 232549725.0,
|
|
"step": 3160,
|
|
"train_ppl": 2.687503
|
|
},
|
|
{
|
|
"ce_loss": 0.9606,
|
|
"epoch": 0.4586973429558486,
|
|
"grad_norm": 0.9765625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6747724899298822e-05,
|
|
"loss": 0.9606,
|
|
"mean_token_accuracy": 0.7811665050685406,
|
|
"num_tokens": 233291132.0,
|
|
"step": 3170,
|
|
"train_ppl": 2.613236
|
|
},
|
|
{
|
|
"ce_loss": 0.9511,
|
|
"epoch": 0.46014433772857993,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6702968819931374e-05,
|
|
"loss": 0.9511,
|
|
"mean_token_accuracy": 0.7800517350435257,
|
|
"num_tokens": 234041516.0,
|
|
"step": 3180,
|
|
"train_ppl": 2.588567
|
|
},
|
|
{
|
|
"ce_loss": 0.924,
|
|
"epoch": 0.46159133250131135,
|
|
"grad_norm": 0.91796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6658212740563927e-05,
|
|
"loss": 0.924,
|
|
"mean_token_accuracy": 0.7832289874553681,
|
|
"num_tokens": 234793582.0,
|
|
"step": 3190,
|
|
"train_ppl": 2.519274
|
|
},
|
|
{
|
|
"ce_loss": 1.01,
|
|
"epoch": 0.4630383272740427,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.661345666119648e-05,
|
|
"loss": 1.01,
|
|
"mean_token_accuracy": 0.7669910915195942,
|
|
"num_tokens": 235509780.0,
|
|
"step": 3200,
|
|
"train_ppl": 2.745611
|
|
},
|
|
{
|
|
"ce_loss": 0.988,
|
|
"epoch": 0.4644853220467741,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6568700581829035e-05,
|
|
"loss": 0.988,
|
|
"mean_token_accuracy": 0.7717112138867378,
|
|
"num_tokens": 236219024.0,
|
|
"step": 3210,
|
|
"train_ppl": 2.685961
|
|
},
|
|
{
|
|
"ce_loss": 0.9403,
|
|
"epoch": 0.4659323168195055,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6523944502461584e-05,
|
|
"loss": 0.9403,
|
|
"mean_token_accuracy": 0.7790117606520652,
|
|
"num_tokens": 236975108.0,
|
|
"step": 3220,
|
|
"train_ppl": 2.560643
|
|
},
|
|
{
|
|
"ce_loss": 0.9728,
|
|
"epoch": 0.4673793115922369,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6479188423094136e-05,
|
|
"loss": 0.9728,
|
|
"mean_token_accuracy": 0.7795041255652905,
|
|
"num_tokens": 237724462.0,
|
|
"step": 3230,
|
|
"train_ppl": 2.645343
|
|
},
|
|
{
|
|
"ce_loss": 0.9416,
|
|
"epoch": 0.46882630636496825,
|
|
"grad_norm": 0.921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.643443234372669e-05,
|
|
"loss": 0.9416,
|
|
"mean_token_accuracy": 0.7821677893400192,
|
|
"num_tokens": 238490711.0,
|
|
"step": 3240,
|
|
"train_ppl": 2.564148
|
|
},
|
|
{
|
|
"ce_loss": 0.9657,
|
|
"epoch": 0.47027330113769966,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.638967626435924e-05,
|
|
"loss": 0.9657,
|
|
"mean_token_accuracy": 0.7754031218588352,
|
|
"num_tokens": 239227350.0,
|
|
"step": 3250,
|
|
"train_ppl": 2.626516
|
|
},
|
|
{
|
|
"ce_loss": 0.9453,
|
|
"epoch": 0.471720295910431,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6344920184991797e-05,
|
|
"loss": 0.9453,
|
|
"mean_token_accuracy": 0.7826674081385135,
|
|
"num_tokens": 239948015.0,
|
|
"step": 3260,
|
|
"train_ppl": 2.57358
|
|
},
|
|
{
|
|
"ce_loss": 0.9745,
|
|
"epoch": 0.47316729068316243,
|
|
"grad_norm": 0.90625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6300164105624346e-05,
|
|
"loss": 0.9745,
|
|
"mean_token_accuracy": 0.7750352688133717,
|
|
"num_tokens": 240720149.0,
|
|
"step": 3270,
|
|
"train_ppl": 2.649788
|
|
},
|
|
{
|
|
"ce_loss": 0.9767,
|
|
"epoch": 0.4746142854558938,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6255408026256902e-05,
|
|
"loss": 0.9767,
|
|
"mean_token_accuracy": 0.7757932528853416,
|
|
"num_tokens": 241430604.0,
|
|
"step": 3280,
|
|
"train_ppl": 2.655572
|
|
},
|
|
{
|
|
"ce_loss": 0.9825,
|
|
"epoch": 0.47606128022862515,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6210651946889455e-05,
|
|
"loss": 0.9825,
|
|
"mean_token_accuracy": 0.7717338934540748,
|
|
"num_tokens": 242181967.0,
|
|
"step": 3290,
|
|
"train_ppl": 2.671143
|
|
},
|
|
{
|
|
"ce_loss": 0.9452,
|
|
"epoch": 0.47750827500135656,
|
|
"grad_norm": 0.96484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6165895867522004e-05,
|
|
"loss": 0.9452,
|
|
"mean_token_accuracy": 0.7806530050933361,
|
|
"num_tokens": 242920132.0,
|
|
"step": 3300,
|
|
"train_ppl": 2.57345
|
|
},
|
|
{
|
|
"ce_loss": 0.9595,
|
|
"epoch": 0.4789552697740879,
|
|
"grad_norm": 1.265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.612113978815456e-05,
|
|
"loss": 0.9595,
|
|
"mean_token_accuracy": 0.7763951353728771,
|
|
"num_tokens": 243640350.0,
|
|
"step": 3310,
|
|
"train_ppl": 2.610434
|
|
},
|
|
{
|
|
"ce_loss": 0.9676,
|
|
"epoch": 0.48040226454681934,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.607638370878711e-05,
|
|
"loss": 0.9676,
|
|
"mean_token_accuracy": 0.774853790551424,
|
|
"num_tokens": 244365334.0,
|
|
"step": 3320,
|
|
"train_ppl": 2.631576
|
|
},
|
|
{
|
|
"ce_loss": 0.9558,
|
|
"epoch": 0.4818492593195507,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6031627629419664e-05,
|
|
"loss": 0.9558,
|
|
"mean_token_accuracy": 0.7763160079717636,
|
|
"num_tokens": 245108674.0,
|
|
"step": 3330,
|
|
"train_ppl": 2.600818
|
|
},
|
|
{
|
|
"ce_loss": 0.9885,
|
|
"epoch": 0.4832962540922821,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5986871550052217e-05,
|
|
"loss": 0.9885,
|
|
"mean_token_accuracy": 0.7731200739741325,
|
|
"num_tokens": 245851700.0,
|
|
"step": 3340,
|
|
"train_ppl": 2.687179
|
|
},
|
|
{
|
|
"ce_loss": 0.9778,
|
|
"epoch": 0.48474324886501347,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5942115470684766e-05,
|
|
"loss": 0.9778,
|
|
"mean_token_accuracy": 0.7771647915244102,
|
|
"num_tokens": 246580552.0,
|
|
"step": 3350,
|
|
"train_ppl": 2.658483
|
|
},
|
|
{
|
|
"ce_loss": 0.969,
|
|
"epoch": 0.4861902436377449,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.589735939131732e-05,
|
|
"loss": 0.969,
|
|
"mean_token_accuracy": 0.7781485505402088,
|
|
"num_tokens": 247303795.0,
|
|
"step": 3360,
|
|
"train_ppl": 2.635424
|
|
},
|
|
{
|
|
"ce_loss": 0.9672,
|
|
"epoch": 0.48763723841047624,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5852603311949874e-05,
|
|
"loss": 0.9672,
|
|
"mean_token_accuracy": 0.7760098949074745,
|
|
"num_tokens": 248058038.0,
|
|
"step": 3370,
|
|
"train_ppl": 2.630652
|
|
},
|
|
{
|
|
"ce_loss": 0.9829,
|
|
"epoch": 0.48908423318320765,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5807847232582427e-05,
|
|
"loss": 0.9829,
|
|
"mean_token_accuracy": 0.774996928870678,
|
|
"num_tokens": 248796994.0,
|
|
"step": 3380,
|
|
"train_ppl": 2.672328
|
|
},
|
|
{
|
|
"ce_loss": 0.9999,
|
|
"epoch": 0.490531227955939,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.576309115321498e-05,
|
|
"loss": 0.9999,
|
|
"mean_token_accuracy": 0.769992358237505,
|
|
"num_tokens": 249528539.0,
|
|
"step": 3390,
|
|
"train_ppl": 2.717897
|
|
},
|
|
{
|
|
"ce_loss": 0.9744,
|
|
"epoch": 0.49197822272867037,
|
|
"grad_norm": 1.25,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.571833507384753e-05,
|
|
"loss": 0.9744,
|
|
"mean_token_accuracy": 0.7775142967700959,
|
|
"num_tokens": 250271300.0,
|
|
"step": 3400,
|
|
"train_ppl": 2.649573
|
|
},
|
|
{
|
|
"ce_loss": 0.9612,
|
|
"epoch": 0.4934252175014018,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5673578994480084e-05,
|
|
"loss": 0.9612,
|
|
"mean_token_accuracy": 0.7808264754712582,
|
|
"num_tokens": 251018244.0,
|
|
"step": 3410,
|
|
"train_ppl": 2.614842
|
|
},
|
|
{
|
|
"ce_loss": 0.9807,
|
|
"epoch": 0.49487221227413314,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5628822915112636e-05,
|
|
"loss": 0.9807,
|
|
"mean_token_accuracy": 0.7724880896508693,
|
|
"num_tokens": 251737409.0,
|
|
"step": 3420,
|
|
"train_ppl": 2.666417
|
|
},
|
|
{
|
|
"ce_loss": 0.9971,
|
|
"epoch": 0.49631920704686455,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.558406683574519e-05,
|
|
"loss": 0.9971,
|
|
"mean_token_accuracy": 0.7721994496881962,
|
|
"num_tokens": 252452177.0,
|
|
"step": 3430,
|
|
"train_ppl": 2.7103
|
|
},
|
|
{
|
|
"ce_loss": 0.9659,
|
|
"epoch": 0.4977662018195959,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.553931075637774e-05,
|
|
"loss": 0.9659,
|
|
"mean_token_accuracy": 0.7731683790683747,
|
|
"num_tokens": 253164867.0,
|
|
"step": 3440,
|
|
"train_ppl": 2.62711
|
|
},
|
|
{
|
|
"ce_loss": 0.9876,
|
|
"epoch": 0.4992131965923273,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5494554677010294e-05,
|
|
"loss": 0.9876,
|
|
"mean_token_accuracy": 0.7709869779646397,
|
|
"num_tokens": 253890732.0,
|
|
"step": 3450,
|
|
"train_ppl": 2.684681
|
|
},
|
|
{
|
|
"ce_loss": 0.9918,
|
|
"epoch": 0.5006601913650587,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5449798597642846e-05,
|
|
"loss": 0.9918,
|
|
"mean_token_accuracy": 0.7687140062451363,
|
|
"num_tokens": 254619763.0,
|
|
"step": 3460,
|
|
"train_ppl": 2.696074
|
|
},
|
|
{
|
|
"ce_loss": 0.9504,
|
|
"epoch": 0.50210718613779,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.54050425182754e-05,
|
|
"loss": 0.9504,
|
|
"mean_token_accuracy": 0.7793492712080479,
|
|
"num_tokens": 255363436.0,
|
|
"step": 3470,
|
|
"train_ppl": 2.586716
|
|
},
|
|
{
|
|
"ce_loss": 0.9599,
|
|
"epoch": 0.5035541809105215,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5360286438907954e-05,
|
|
"loss": 0.9599,
|
|
"mean_token_accuracy": 0.7774735637009144,
|
|
"num_tokens": 256115802.0,
|
|
"step": 3480,
|
|
"train_ppl": 2.61146
|
|
},
|
|
{
|
|
"ce_loss": 0.9649,
|
|
"epoch": 0.5050011756832529,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5315530359540503e-05,
|
|
"loss": 0.9649,
|
|
"mean_token_accuracy": 0.7754439219832421,
|
|
"num_tokens": 256842141.0,
|
|
"step": 3490,
|
|
"train_ppl": 2.62447
|
|
},
|
|
{
|
|
"ce_loss": 0.9671,
|
|
"epoch": 0.5064481704559842,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.527077428017306e-05,
|
|
"loss": 0.9671,
|
|
"mean_token_accuracy": 0.7746169321238995,
|
|
"num_tokens": 257574760.0,
|
|
"step": 3500,
|
|
"train_ppl": 2.630219
|
|
},
|
|
{
|
|
"ce_loss": 0.9834,
|
|
"epoch": 0.5078951652287156,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5226018200805612e-05,
|
|
"loss": 0.9834,
|
|
"mean_token_accuracy": 0.7728622667491436,
|
|
"num_tokens": 258285032.0,
|
|
"step": 3510,
|
|
"train_ppl": 2.673492
|
|
},
|
|
{
|
|
"ce_loss": 0.9703,
|
|
"epoch": 0.5093421600014469,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5181262121438162e-05,
|
|
"loss": 0.9703,
|
|
"mean_token_accuracy": 0.7742777064442634,
|
|
"num_tokens": 258999939.0,
|
|
"step": 3520,
|
|
"train_ppl": 2.638679
|
|
},
|
|
{
|
|
"ce_loss": 0.9218,
|
|
"epoch": 0.5107891547741784,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5136506042070715e-05,
|
|
"loss": 0.9218,
|
|
"mean_token_accuracy": 0.7861278541386127,
|
|
"num_tokens": 259763192.0,
|
|
"step": 3530,
|
|
"train_ppl": 2.513912
|
|
},
|
|
{
|
|
"ce_loss": 0.9292,
|
|
"epoch": 0.5122361495469098,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5091749962703266e-05,
|
|
"loss": 0.9292,
|
|
"mean_token_accuracy": 0.7805077292025089,
|
|
"num_tokens": 260499543.0,
|
|
"step": 3540,
|
|
"train_ppl": 2.532375
|
|
},
|
|
{
|
|
"ce_loss": 0.9898,
|
|
"epoch": 0.5136831443196411,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.504699388333582e-05,
|
|
"loss": 0.9898,
|
|
"mean_token_accuracy": 0.7731637723743916,
|
|
"num_tokens": 261254442.0,
|
|
"step": 3550,
|
|
"train_ppl": 2.690609
|
|
},
|
|
{
|
|
"ce_loss": 0.9634,
|
|
"epoch": 0.5151301390923725,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5002237803968374e-05,
|
|
"loss": 0.9634,
|
|
"mean_token_accuracy": 0.779674281924963,
|
|
"num_tokens": 262015435.0,
|
|
"step": 3560,
|
|
"train_ppl": 2.620479
|
|
},
|
|
{
|
|
"ce_loss": 0.9716,
|
|
"epoch": 0.516577133865104,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4957481724600926e-05,
|
|
"loss": 0.9716,
|
|
"mean_token_accuracy": 0.776695205271244,
|
|
"num_tokens": 262693267.0,
|
|
"step": 3570,
|
|
"train_ppl": 2.642217
|
|
},
|
|
{
|
|
"ce_loss": 1.0025,
|
|
"epoch": 0.5180241286378353,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4912725645233479e-05,
|
|
"loss": 1.0025,
|
|
"mean_token_accuracy": 0.7727914996445179,
|
|
"num_tokens": 263442598.0,
|
|
"step": 3580,
|
|
"train_ppl": 2.725135
|
|
},
|
|
{
|
|
"ce_loss": 0.9628,
|
|
"epoch": 0.5194711234105667,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.486796956586603e-05,
|
|
"loss": 0.9628,
|
|
"mean_token_accuracy": 0.7818873479962349,
|
|
"num_tokens": 264210381.0,
|
|
"step": 3590,
|
|
"train_ppl": 2.618999
|
|
},
|
|
{
|
|
"ce_loss": 0.9571,
|
|
"epoch": 0.520918118183298,
|
|
"grad_norm": 0.921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4823213486498582e-05,
|
|
"loss": 0.9571,
|
|
"mean_token_accuracy": 0.7811072282493114,
|
|
"num_tokens": 264954557.0,
|
|
"step": 3600,
|
|
"train_ppl": 2.60412
|
|
},
|
|
{
|
|
"ce_loss": 0.9555,
|
|
"epoch": 0.5223651129560295,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4778457407131136e-05,
|
|
"loss": 0.9555,
|
|
"mean_token_accuracy": 0.7785631224513054,
|
|
"num_tokens": 265708667.0,
|
|
"step": 3610,
|
|
"train_ppl": 2.600049
|
|
},
|
|
{
|
|
"ce_loss": 0.9794,
|
|
"epoch": 0.5238121077287609,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4733701327763689e-05,
|
|
"loss": 0.9794,
|
|
"mean_token_accuracy": 0.7781493321061135,
|
|
"num_tokens": 266443298.0,
|
|
"step": 3620,
|
|
"train_ppl": 2.662788
|
|
},
|
|
{
|
|
"ce_loss": 0.9757,
|
|
"epoch": 0.5252591025014922,
|
|
"grad_norm": 0.96484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4688945248396241e-05,
|
|
"loss": 0.9757,
|
|
"mean_token_accuracy": 0.7720276661217212,
|
|
"num_tokens": 267173324.0,
|
|
"step": 3630,
|
|
"train_ppl": 2.653105
|
|
},
|
|
{
|
|
"ce_loss": 1.0308,
|
|
"epoch": 0.5267060972742236,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4644189169028794e-05,
|
|
"loss": 1.0308,
|
|
"mean_token_accuracy": 0.7638523608446122,
|
|
"num_tokens": 267915944.0,
|
|
"step": 3640,
|
|
"train_ppl": 2.803437
|
|
},
|
|
{
|
|
"ce_loss": 0.9602,
|
|
"epoch": 0.5281530920469549,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4599433089661346e-05,
|
|
"loss": 0.9602,
|
|
"mean_token_accuracy": 0.7759406618773937,
|
|
"num_tokens": 268643319.0,
|
|
"step": 3650,
|
|
"train_ppl": 2.612157
|
|
},
|
|
{
|
|
"ce_loss": 0.9652,
|
|
"epoch": 0.5296000868196864,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4554677010293898e-05,
|
|
"loss": 0.9652,
|
|
"mean_token_accuracy": 0.779689010232687,
|
|
"num_tokens": 269367307.0,
|
|
"step": 3660,
|
|
"train_ppl": 2.625382
|
|
},
|
|
{
|
|
"ce_loss": 0.9504,
|
|
"epoch": 0.5310470815924178,
|
|
"grad_norm": 0.8828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4509920930926451e-05,
|
|
"loss": 0.9504,
|
|
"mean_token_accuracy": 0.7774218022823334,
|
|
"num_tokens": 270092592.0,
|
|
"step": 3670,
|
|
"train_ppl": 2.586776
|
|
},
|
|
{
|
|
"ce_loss": 0.9583,
|
|
"epoch": 0.5324940763651491,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4465164851559005e-05,
|
|
"loss": 0.9583,
|
|
"mean_token_accuracy": 0.7736941121518612,
|
|
"num_tokens": 270860558.0,
|
|
"step": 3680,
|
|
"train_ppl": 2.60739
|
|
},
|
|
{
|
|
"ce_loss": 0.9978,
|
|
"epoch": 0.5339410711378805,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4420408772191557e-05,
|
|
"loss": 0.9978,
|
|
"mean_token_accuracy": 0.7728485822677612,
|
|
"num_tokens": 271584192.0,
|
|
"step": 3690,
|
|
"train_ppl": 2.712288
|
|
},
|
|
{
|
|
"ce_loss": 1.0123,
|
|
"epoch": 0.5353880659106119,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4375652692824108e-05,
|
|
"loss": 1.0123,
|
|
"mean_token_accuracy": 0.767830940335989,
|
|
"num_tokens": 272333891.0,
|
|
"step": 3700,
|
|
"train_ppl": 2.751963
|
|
},
|
|
{
|
|
"ce_loss": 0.9239,
|
|
"epoch": 0.5368350606833433,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.433089661345666e-05,
|
|
"loss": 0.9239,
|
|
"mean_token_accuracy": 0.7862473480403424,
|
|
"num_tokens": 273099133.0,
|
|
"step": 3710,
|
|
"train_ppl": 2.51917
|
|
},
|
|
{
|
|
"ce_loss": 0.958,
|
|
"epoch": 0.5382820554560747,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4286140534089215e-05,
|
|
"loss": 0.958,
|
|
"mean_token_accuracy": 0.7815881177783013,
|
|
"num_tokens": 273852553.0,
|
|
"step": 3720,
|
|
"train_ppl": 2.606516
|
|
},
|
|
{
|
|
"ce_loss": 0.9936,
|
|
"epoch": 0.539729050228806,
|
|
"grad_norm": 0.91015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4241384454721767e-05,
|
|
"loss": 0.9936,
|
|
"mean_token_accuracy": 0.7692437112331391,
|
|
"num_tokens": 274580358.0,
|
|
"step": 3730,
|
|
"train_ppl": 2.700827
|
|
},
|
|
{
|
|
"ce_loss": 0.9692,
|
|
"epoch": 0.5411760450015375,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.419662837535432e-05,
|
|
"loss": 0.9692,
|
|
"mean_token_accuracy": 0.7750534601509571,
|
|
"num_tokens": 275333561.0,
|
|
"step": 3740,
|
|
"train_ppl": 2.635919
|
|
},
|
|
{
|
|
"ce_loss": 0.9531,
|
|
"epoch": 0.5426230397742688,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.415187229598687e-05,
|
|
"loss": 0.9531,
|
|
"mean_token_accuracy": 0.7767747581005097,
|
|
"num_tokens": 276083858.0,
|
|
"step": 3750,
|
|
"train_ppl": 2.593638
|
|
},
|
|
{
|
|
"ce_loss": 0.9443,
|
|
"epoch": 0.5440700345470002,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4107116216619425e-05,
|
|
"loss": 0.9443,
|
|
"mean_token_accuracy": 0.7835570797324181,
|
|
"num_tokens": 276851059.0,
|
|
"step": 3760,
|
|
"train_ppl": 2.570927
|
|
},
|
|
{
|
|
"ce_loss": 0.9737,
|
|
"epoch": 0.5455170293197316,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4062360137251977e-05,
|
|
"loss": 0.9737,
|
|
"mean_token_accuracy": 0.776416502147913,
|
|
"num_tokens": 277581787.0,
|
|
"step": 3770,
|
|
"train_ppl": 2.647673
|
|
},
|
|
{
|
|
"ce_loss": 0.9387,
|
|
"epoch": 0.5469640240924629,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.401760405788453e-05,
|
|
"loss": 0.9387,
|
|
"mean_token_accuracy": 0.7881631642580033,
|
|
"num_tokens": 278297127.0,
|
|
"step": 3780,
|
|
"train_ppl": 2.5567
|
|
},
|
|
{
|
|
"ce_loss": 0.9493,
|
|
"epoch": 0.5484110188651944,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3972847978517082e-05,
|
|
"loss": 0.9493,
|
|
"mean_token_accuracy": 0.7784359693527222,
|
|
"num_tokens": 279053770.0,
|
|
"step": 3790,
|
|
"train_ppl": 2.583983
|
|
},
|
|
{
|
|
"ce_loss": 0.9715,
|
|
"epoch": 0.5498580136379257,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3928091899149636e-05,
|
|
"loss": 0.9715,
|
|
"mean_token_accuracy": 0.7738523662090302,
|
|
"num_tokens": 279793403.0,
|
|
"step": 3800,
|
|
"train_ppl": 2.641912
|
|
},
|
|
{
|
|
"ce_loss": 0.9772,
|
|
"epoch": 0.5513050084106571,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3883335819782187e-05,
|
|
"loss": 0.9772,
|
|
"mean_token_accuracy": 0.776868187636137,
|
|
"num_tokens": 280525655.0,
|
|
"step": 3810,
|
|
"train_ppl": 2.657016
|
|
},
|
|
{
|
|
"ce_loss": 0.926,
|
|
"epoch": 0.5527520031833885,
|
|
"grad_norm": 1.1640625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.383857974041474e-05,
|
|
"loss": 0.926,
|
|
"mean_token_accuracy": 0.7910705611109734,
|
|
"num_tokens": 281261170.0,
|
|
"step": 3820,
|
|
"train_ppl": 2.524335
|
|
},
|
|
{
|
|
"ce_loss": 0.9649,
|
|
"epoch": 0.5541989979561199,
|
|
"grad_norm": 1.28125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3793823661047293e-05,
|
|
"loss": 0.9649,
|
|
"mean_token_accuracy": 0.7791670545935631,
|
|
"num_tokens": 281985897.0,
|
|
"step": 3830,
|
|
"train_ppl": 2.624451
|
|
},
|
|
{
|
|
"ce_loss": 0.9677,
|
|
"epoch": 0.5556459927288513,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3749067581679846e-05,
|
|
"loss": 0.9677,
|
|
"mean_token_accuracy": 0.7748836219310761,
|
|
"num_tokens": 282721456.0,
|
|
"step": 3840,
|
|
"train_ppl": 2.631954
|
|
},
|
|
{
|
|
"ce_loss": 1.0129,
|
|
"epoch": 0.5570929875015826,
|
|
"grad_norm": 0.921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3704311502312398e-05,
|
|
"loss": 1.0129,
|
|
"mean_token_accuracy": 0.7665625207126141,
|
|
"num_tokens": 283434742.0,
|
|
"step": 3850,
|
|
"train_ppl": 2.753628
|
|
},
|
|
{
|
|
"ce_loss": 0.9751,
|
|
"epoch": 0.558539982274314,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3659555422944949e-05,
|
|
"loss": 0.9751,
|
|
"mean_token_accuracy": 0.7772414043545723,
|
|
"num_tokens": 284159932.0,
|
|
"step": 3860,
|
|
"train_ppl": 2.651563
|
|
},
|
|
{
|
|
"ce_loss": 0.96,
|
|
"epoch": 0.5599869770470454,
|
|
"grad_norm": 0.91015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3614799343577503e-05,
|
|
"loss": 0.96,
|
|
"mean_token_accuracy": 0.7742170818150044,
|
|
"num_tokens": 284892821.0,
|
|
"step": 3870,
|
|
"train_ppl": 2.611629
|
|
},
|
|
{
|
|
"ce_loss": 0.9735,
|
|
"epoch": 0.5614339718197768,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3570043264210056e-05,
|
|
"loss": 0.9735,
|
|
"mean_token_accuracy": 0.7700681336224079,
|
|
"num_tokens": 285587737.0,
|
|
"step": 3880,
|
|
"train_ppl": 2.647213
|
|
},
|
|
{
|
|
"ce_loss": 0.9218,
|
|
"epoch": 0.5628809665925082,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3525287184842608e-05,
|
|
"loss": 0.9218,
|
|
"mean_token_accuracy": 0.7871894739568234,
|
|
"num_tokens": 286313582.0,
|
|
"step": 3890,
|
|
"train_ppl": 2.51389
|
|
},
|
|
{
|
|
"ce_loss": 0.941,
|
|
"epoch": 0.5643279613652395,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.348053110547516e-05,
|
|
"loss": 0.941,
|
|
"mean_token_accuracy": 0.7820699147880077,
|
|
"num_tokens": 287064151.0,
|
|
"step": 3900,
|
|
"train_ppl": 2.562492
|
|
},
|
|
{
|
|
"ce_loss": 0.9296,
|
|
"epoch": 0.5657749561379709,
|
|
"grad_norm": 0.91796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3435775026107715e-05,
|
|
"loss": 0.9296,
|
|
"mean_token_accuracy": 0.7859035260975361,
|
|
"num_tokens": 287813874.0,
|
|
"step": 3910,
|
|
"train_ppl": 2.53357
|
|
},
|
|
{
|
|
"ce_loss": 0.9445,
|
|
"epoch": 0.5672219509107024,
|
|
"grad_norm": 0.859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3391018946740265e-05,
|
|
"loss": 0.9445,
|
|
"mean_token_accuracy": 0.782135433703661,
|
|
"num_tokens": 288570496.0,
|
|
"step": 3920,
|
|
"train_ppl": 2.571643
|
|
},
|
|
{
|
|
"ce_loss": 0.9839,
|
|
"epoch": 0.5686689456834337,
|
|
"grad_norm": 2.546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3346262867372818e-05,
|
|
"loss": 0.9839,
|
|
"mean_token_accuracy": 0.7735799729824067,
|
|
"num_tokens": 289350278.0,
|
|
"step": 3930,
|
|
"train_ppl": 2.674829
|
|
},
|
|
{
|
|
"ce_loss": 0.971,
|
|
"epoch": 0.5701159404561651,
|
|
"grad_norm": 0.92578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.330150678800537e-05,
|
|
"loss": 0.971,
|
|
"mean_token_accuracy": 0.7777773514389992,
|
|
"num_tokens": 290079342.0,
|
|
"step": 3940,
|
|
"train_ppl": 2.640477
|
|
},
|
|
{
|
|
"ce_loss": 0.9539,
|
|
"epoch": 0.5715629352288965,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3256750708637924e-05,
|
|
"loss": 0.9539,
|
|
"mean_token_accuracy": 0.7781407319009304,
|
|
"num_tokens": 290832879.0,
|
|
"step": 3950,
|
|
"train_ppl": 2.595897
|
|
},
|
|
{
|
|
"ce_loss": 0.9775,
|
|
"epoch": 0.5730099300016279,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3211994629270477e-05,
|
|
"loss": 0.9775,
|
|
"mean_token_accuracy": 0.7747543424367904,
|
|
"num_tokens": 291565544.0,
|
|
"step": 3960,
|
|
"train_ppl": 2.6577
|
|
},
|
|
{
|
|
"ce_loss": 0.9625,
|
|
"epoch": 0.5744569247743593,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3167238549903028e-05,
|
|
"loss": 0.9625,
|
|
"mean_token_accuracy": 0.778536244481802,
|
|
"num_tokens": 292316435.0,
|
|
"step": 3970,
|
|
"train_ppl": 2.618189
|
|
},
|
|
{
|
|
"ce_loss": 0.94,
|
|
"epoch": 0.5759039195470906,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.312248247053558e-05,
|
|
"loss": 0.94,
|
|
"mean_token_accuracy": 0.7783068805932999,
|
|
"num_tokens": 293058454.0,
|
|
"step": 3980,
|
|
"train_ppl": 2.560027
|
|
},
|
|
{
|
|
"ce_loss": 1.0024,
|
|
"epoch": 0.577350914319822,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3077726391168134e-05,
|
|
"loss": 1.0024,
|
|
"mean_token_accuracy": 0.7662229061126709,
|
|
"num_tokens": 293783644.0,
|
|
"step": 3990,
|
|
"train_ppl": 2.724925
|
|
},
|
|
{
|
|
"ce_loss": 0.9491,
|
|
"epoch": 0.5787979090925534,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3032970311800687e-05,
|
|
"loss": 0.9491,
|
|
"mean_token_accuracy": 0.781515534222126,
|
|
"num_tokens": 294511489.0,
|
|
"step": 4000,
|
|
"train_ppl": 2.583289
|
|
},
|
|
{
|
|
"ce_loss": 0.9735,
|
|
"epoch": 0.5802449038652848,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2988214232433239e-05,
|
|
"loss": 0.9735,
|
|
"mean_token_accuracy": 0.7806210406124592,
|
|
"num_tokens": 295248215.0,
|
|
"step": 4010,
|
|
"train_ppl": 2.647139
|
|
},
|
|
{
|
|
"ce_loss": 0.9393,
|
|
"epoch": 0.5816918986380162,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2943458153065793e-05,
|
|
"loss": 0.9393,
|
|
"mean_token_accuracy": 0.7846732117235661,
|
|
"num_tokens": 295989738.0,
|
|
"step": 4020,
|
|
"train_ppl": 2.558143
|
|
},
|
|
{
|
|
"ce_loss": 0.9621,
|
|
"epoch": 0.5831388934107475,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2898702073698344e-05,
|
|
"loss": 0.9621,
|
|
"mean_token_accuracy": 0.7784810028970242,
|
|
"num_tokens": 296702866.0,
|
|
"step": 4030,
|
|
"train_ppl": 2.617144
|
|
},
|
|
{
|
|
"ce_loss": 0.9765,
|
|
"epoch": 0.5845858881834789,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2853945994330896e-05,
|
|
"loss": 0.9765,
|
|
"mean_token_accuracy": 0.7725668139755726,
|
|
"num_tokens": 297439737.0,
|
|
"step": 4040,
|
|
"train_ppl": 2.655217
|
|
},
|
|
{
|
|
"ce_loss": 0.9885,
|
|
"epoch": 0.5860328829562104,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2809189914963449e-05,
|
|
"loss": 0.9885,
|
|
"mean_token_accuracy": 0.774877705425024,
|
|
"num_tokens": 298188647.0,
|
|
"step": 4050,
|
|
"train_ppl": 2.687219
|
|
},
|
|
{
|
|
"ce_loss": 0.9545,
|
|
"epoch": 0.5874798777289417,
|
|
"grad_norm": 0.91796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2764433835596003e-05,
|
|
"loss": 0.9545,
|
|
"mean_token_accuracy": 0.7752919748425484,
|
|
"num_tokens": 298937830.0,
|
|
"step": 4060,
|
|
"train_ppl": 2.597323
|
|
},
|
|
{
|
|
"ce_loss": 0.9608,
|
|
"epoch": 0.5889268725016731,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2719677756228555e-05,
|
|
"loss": 0.9608,
|
|
"mean_token_accuracy": 0.7775414235889911,
|
|
"num_tokens": 299669340.0,
|
|
"step": 4070,
|
|
"train_ppl": 2.613706
|
|
},
|
|
{
|
|
"ce_loss": 0.9499,
|
|
"epoch": 0.5903738672744044,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2674921676861106e-05,
|
|
"loss": 0.9499,
|
|
"mean_token_accuracy": 0.7804868087172508,
|
|
"num_tokens": 300386836.0,
|
|
"step": 4080,
|
|
"train_ppl": 2.585417
|
|
},
|
|
{
|
|
"ce_loss": 0.9535,
|
|
"epoch": 0.5918208620471359,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2630165597493659e-05,
|
|
"loss": 0.9535,
|
|
"mean_token_accuracy": 0.7813090972602368,
|
|
"num_tokens": 301161416.0,
|
|
"step": 4090,
|
|
"train_ppl": 2.594834
|
|
},
|
|
{
|
|
"ce_loss": 0.9412,
|
|
"epoch": 0.5932678568198673,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2585409518126213e-05,
|
|
"loss": 0.9412,
|
|
"mean_token_accuracy": 0.777237968891859,
|
|
"num_tokens": 301895700.0,
|
|
"step": 4100,
|
|
"train_ppl": 2.562928
|
|
},
|
|
{
|
|
"ce_loss": 0.9596,
|
|
"epoch": 0.5947148515925986,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2540653438758765e-05,
|
|
"loss": 0.9596,
|
|
"mean_token_accuracy": 0.775063581764698,
|
|
"num_tokens": 302652783.0,
|
|
"step": 4110,
|
|
"train_ppl": 2.610559
|
|
},
|
|
{
|
|
"ce_loss": 0.938,
|
|
"epoch": 0.59616184636533,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2495897359391318e-05,
|
|
"loss": 0.938,
|
|
"mean_token_accuracy": 0.7807605281472206,
|
|
"num_tokens": 303377816.0,
|
|
"step": 4120,
|
|
"train_ppl": 2.554922
|
|
},
|
|
{
|
|
"ce_loss": 0.9801,
|
|
"epoch": 0.5976088411380613,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.245114128002387e-05,
|
|
"loss": 0.9801,
|
|
"mean_token_accuracy": 0.7739221796393394,
|
|
"num_tokens": 304113074.0,
|
|
"step": 4130,
|
|
"train_ppl": 2.664789
|
|
},
|
|
{
|
|
"ce_loss": 0.9596,
|
|
"epoch": 0.5990558359107928,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2406385200656423e-05,
|
|
"loss": 0.9596,
|
|
"mean_token_accuracy": 0.7742515958845615,
|
|
"num_tokens": 304844350.0,
|
|
"step": 4140,
|
|
"train_ppl": 2.610675
|
|
},
|
|
{
|
|
"ce_loss": 0.964,
|
|
"epoch": 0.6005028306835242,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2361629121288975e-05,
|
|
"loss": 0.964,
|
|
"mean_token_accuracy": 0.7800977975130081,
|
|
"num_tokens": 305579813.0,
|
|
"step": 4150,
|
|
"train_ppl": 2.622038
|
|
},
|
|
{
|
|
"ce_loss": 0.9532,
|
|
"epoch": 0.6019498254562555,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2316873041921527e-05,
|
|
"loss": 0.9532,
|
|
"mean_token_accuracy": 0.7812970593571663,
|
|
"num_tokens": 306304960.0,
|
|
"step": 4160,
|
|
"train_ppl": 2.594026
|
|
},
|
|
{
|
|
"ce_loss": 0.9601,
|
|
"epoch": 0.6033968202289869,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2272116962554082e-05,
|
|
"loss": 0.9601,
|
|
"mean_token_accuracy": 0.7800398364663124,
|
|
"num_tokens": 307042663.0,
|
|
"step": 4170,
|
|
"train_ppl": 2.611905
|
|
},
|
|
{
|
|
"ce_loss": 0.9685,
|
|
"epoch": 0.6048438150017184,
|
|
"grad_norm": 0.8984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2227360883186634e-05,
|
|
"loss": 0.9685,
|
|
"mean_token_accuracy": 0.776139622181654,
|
|
"num_tokens": 307757206.0,
|
|
"step": 4180,
|
|
"train_ppl": 2.63396
|
|
},
|
|
{
|
|
"ce_loss": 0.9863,
|
|
"epoch": 0.6062908097744497,
|
|
"grad_norm": 0.88671875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2182604803819185e-05,
|
|
"loss": 0.9863,
|
|
"mean_token_accuracy": 0.7687765277922154,
|
|
"num_tokens": 308492203.0,
|
|
"step": 4190,
|
|
"train_ppl": 2.681368
|
|
},
|
|
{
|
|
"ce_loss": 0.9499,
|
|
"epoch": 0.6077378045471811,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2137848724451737e-05,
|
|
"loss": 0.9499,
|
|
"mean_token_accuracy": 0.7795483432710171,
|
|
"num_tokens": 309220000.0,
|
|
"step": 4200,
|
|
"train_ppl": 2.585347
|
|
},
|
|
{
|
|
"ce_loss": 0.9506,
|
|
"epoch": 0.6091847993199124,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2093092645084291e-05,
|
|
"loss": 0.9506,
|
|
"mean_token_accuracy": 0.7806940786540508,
|
|
"num_tokens": 309954206.0,
|
|
"step": 4210,
|
|
"train_ppl": 2.587363
|
|
},
|
|
{
|
|
"ce_loss": 0.9777,
|
|
"epoch": 0.6106317940926438,
|
|
"grad_norm": 1.234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2048336565716844e-05,
|
|
"loss": 0.9777,
|
|
"mean_token_accuracy": 0.7771054945886136,
|
|
"num_tokens": 310673874.0,
|
|
"step": 4220,
|
|
"train_ppl": 2.658411
|
|
},
|
|
{
|
|
"ce_loss": 0.9427,
|
|
"epoch": 0.6120787888653753,
|
|
"grad_norm": 0.97265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2003580486349396e-05,
|
|
"loss": 0.9427,
|
|
"mean_token_accuracy": 0.7819586515426635,
|
|
"num_tokens": 311425629.0,
|
|
"step": 4230,
|
|
"train_ppl": 2.567005
|
|
},
|
|
{
|
|
"ce_loss": 0.9469,
|
|
"epoch": 0.6135257836381066,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1958824406981949e-05,
|
|
"loss": 0.9469,
|
|
"mean_token_accuracy": 0.7801039353013038,
|
|
"num_tokens": 312149916.0,
|
|
"step": 4240,
|
|
"train_ppl": 2.577795
|
|
},
|
|
{
|
|
"ce_loss": 0.9829,
|
|
"epoch": 0.614972778410838,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1914068327614501e-05,
|
|
"loss": 0.9829,
|
|
"mean_token_accuracy": 0.7737744726240635,
|
|
"num_tokens": 312871666.0,
|
|
"step": 4250,
|
|
"train_ppl": 2.672162
|
|
},
|
|
{
|
|
"ce_loss": 0.9819,
|
|
"epoch": 0.6164197731835693,
|
|
"grad_norm": 1.21875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1869312248247054e-05,
|
|
"loss": 0.9819,
|
|
"mean_token_accuracy": 0.7720717005431652,
|
|
"num_tokens": 313601563.0,
|
|
"step": 4260,
|
|
"train_ppl": 2.669572
|
|
},
|
|
{
|
|
"ce_loss": 0.9503,
|
|
"epoch": 0.6178667679563008,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1824556168879606e-05,
|
|
"loss": 0.9503,
|
|
"mean_token_accuracy": 0.7818848460912704,
|
|
"num_tokens": 314353822.0,
|
|
"step": 4270,
|
|
"train_ppl": 2.58643
|
|
},
|
|
{
|
|
"ce_loss": 0.945,
|
|
"epoch": 0.6193137627290322,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1779800089512159e-05,
|
|
"loss": 0.945,
|
|
"mean_token_accuracy": 0.7822961673140526,
|
|
"num_tokens": 315066430.0,
|
|
"step": 4280,
|
|
"train_ppl": 2.57272
|
|
},
|
|
{
|
|
"ce_loss": 0.9851,
|
|
"epoch": 0.6207607575017635,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1735044010144713e-05,
|
|
"loss": 0.9851,
|
|
"mean_token_accuracy": 0.7730609364807606,
|
|
"num_tokens": 315802006.0,
|
|
"step": 4290,
|
|
"train_ppl": 2.678082
|
|
},
|
|
{
|
|
"ce_loss": 0.9502,
|
|
"epoch": 0.6222077522744949,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1690287930777263e-05,
|
|
"loss": 0.9502,
|
|
"mean_token_accuracy": 0.7806099034845829,
|
|
"num_tokens": 316597439.0,
|
|
"step": 4300,
|
|
"train_ppl": 2.586201
|
|
},
|
|
{
|
|
"ce_loss": 0.9809,
|
|
"epoch": 0.6236547470472263,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1645531851409816e-05,
|
|
"loss": 0.9809,
|
|
"mean_token_accuracy": 0.773340854048729,
|
|
"num_tokens": 317357015.0,
|
|
"step": 4310,
|
|
"train_ppl": 2.666982
|
|
},
|
|
{
|
|
"ce_loss": 0.9792,
|
|
"epoch": 0.6251017418199577,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.160077577204237e-05,
|
|
"loss": 0.9792,
|
|
"mean_token_accuracy": 0.7763313055038452,
|
|
"num_tokens": 318074229.0,
|
|
"step": 4320,
|
|
"train_ppl": 2.662203
|
|
},
|
|
{
|
|
"ce_loss": 0.9621,
|
|
"epoch": 0.6265487365926891,
|
|
"grad_norm": 1.1640625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1556019692674922e-05,
|
|
"loss": 0.9621,
|
|
"mean_token_accuracy": 0.775955218076706,
|
|
"num_tokens": 318793337.0,
|
|
"step": 4330,
|
|
"train_ppl": 2.617267
|
|
},
|
|
{
|
|
"ce_loss": 0.9433,
|
|
"epoch": 0.6279957313654204,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1511263613307475e-05,
|
|
"loss": 0.9433,
|
|
"mean_token_accuracy": 0.7845971286296844,
|
|
"num_tokens": 319523789.0,
|
|
"step": 4340,
|
|
"train_ppl": 2.568444
|
|
},
|
|
{
|
|
"ce_loss": 0.9728,
|
|
"epoch": 0.6294427261381518,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1466507533940027e-05,
|
|
"loss": 0.9728,
|
|
"mean_token_accuracy": 0.7732916258275508,
|
|
"num_tokens": 320236607.0,
|
|
"step": 4350,
|
|
"train_ppl": 2.645373
|
|
},
|
|
{
|
|
"ce_loss": 0.9608,
|
|
"epoch": 0.6308897209108832,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.142175145457258e-05,
|
|
"loss": 0.9608,
|
|
"mean_token_accuracy": 0.7798072099685669,
|
|
"num_tokens": 320964949.0,
|
|
"step": 4360,
|
|
"train_ppl": 2.613791
|
|
},
|
|
{
|
|
"ce_loss": 0.9866,
|
|
"epoch": 0.6323367156836146,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1376995375205132e-05,
|
|
"loss": 0.9866,
|
|
"mean_token_accuracy": 0.7727800719439983,
|
|
"num_tokens": 321671284.0,
|
|
"step": 4370,
|
|
"train_ppl": 2.682008
|
|
},
|
|
{
|
|
"ce_loss": 0.9446,
|
|
"epoch": 0.633783710456346,
|
|
"grad_norm": 0.90625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1332239295837685e-05,
|
|
"loss": 0.9446,
|
|
"mean_token_accuracy": 0.7807809986174107,
|
|
"num_tokens": 322413391.0,
|
|
"step": 4380,
|
|
"train_ppl": 2.571716
|
|
},
|
|
{
|
|
"ce_loss": 0.9443,
|
|
"epoch": 0.6352307052290773,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1287483216470237e-05,
|
|
"loss": 0.9443,
|
|
"mean_token_accuracy": 0.7804166525602341,
|
|
"num_tokens": 323139704.0,
|
|
"step": 4390,
|
|
"train_ppl": 2.570885
|
|
},
|
|
{
|
|
"ce_loss": 0.9331,
|
|
"epoch": 0.6366777000018088,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1242727137102791e-05,
|
|
"loss": 0.9331,
|
|
"mean_token_accuracy": 0.7856282263994216,
|
|
"num_tokens": 323894610.0,
|
|
"step": 4400,
|
|
"train_ppl": 2.54235
|
|
},
|
|
{
|
|
"ce_loss": 1.0027,
|
|
"epoch": 0.6381246947745401,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1197971057735342e-05,
|
|
"loss": 1.0027,
|
|
"mean_token_accuracy": 0.7679429657757282,
|
|
"num_tokens": 324636289.0,
|
|
"step": 4410,
|
|
"train_ppl": 2.725621
|
|
},
|
|
{
|
|
"ce_loss": 0.981,
|
|
"epoch": 0.6395716895472715,
|
|
"grad_norm": 0.8828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1153214978367894e-05,
|
|
"loss": 0.981,
|
|
"mean_token_accuracy": 0.7753245957195759,
|
|
"num_tokens": 325386589.0,
|
|
"step": 4420,
|
|
"train_ppl": 2.667189
|
|
},
|
|
{
|
|
"ce_loss": 0.9547,
|
|
"epoch": 0.6410186843200029,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1108458899000447e-05,
|
|
"loss": 0.9547,
|
|
"mean_token_accuracy": 0.778544618934393,
|
|
"num_tokens": 326155177.0,
|
|
"step": 4430,
|
|
"train_ppl": 2.597782
|
|
},
|
|
{
|
|
"ce_loss": 0.9627,
|
|
"epoch": 0.6424656790927343,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1063702819633001e-05,
|
|
"loss": 0.9627,
|
|
"mean_token_accuracy": 0.7790204137563705,
|
|
"num_tokens": 326889827.0,
|
|
"step": 4440,
|
|
"train_ppl": 2.618685
|
|
},
|
|
{
|
|
"ce_loss": 0.9919,
|
|
"epoch": 0.6439126738654657,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1018946740265554e-05,
|
|
"loss": 0.9919,
|
|
"mean_token_accuracy": 0.7769460953772068,
|
|
"num_tokens": 327593189.0,
|
|
"step": 4450,
|
|
"train_ppl": 2.69623
|
|
},
|
|
{
|
|
"ce_loss": 0.9627,
|
|
"epoch": 0.645359668638197,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0974190660898106e-05,
|
|
"loss": 0.9627,
|
|
"mean_token_accuracy": 0.7764194391667842,
|
|
"num_tokens": 328366781.0,
|
|
"step": 4460,
|
|
"train_ppl": 2.618665
|
|
},
|
|
{
|
|
"ce_loss": 0.9249,
|
|
"epoch": 0.6468066634109284,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0929434581530658e-05,
|
|
"loss": 0.9249,
|
|
"mean_token_accuracy": 0.779874175786972,
|
|
"num_tokens": 329095559.0,
|
|
"step": 4470,
|
|
"train_ppl": 2.521557
|
|
},
|
|
{
|
|
"ce_loss": 0.9713,
|
|
"epoch": 0.6482536581836598,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0884678502163211e-05,
|
|
"loss": 0.9713,
|
|
"mean_token_accuracy": 0.7740052983164787,
|
|
"num_tokens": 329811677.0,
|
|
"step": 4480,
|
|
"train_ppl": 2.641304
|
|
},
|
|
{
|
|
"ce_loss": 0.9528,
|
|
"epoch": 0.6497006529563912,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0839922422795763e-05,
|
|
"loss": 0.9528,
|
|
"mean_token_accuracy": 0.7821832969784737,
|
|
"num_tokens": 330551710.0,
|
|
"step": 4490,
|
|
"train_ppl": 2.592979
|
|
},
|
|
{
|
|
"ce_loss": 0.9515,
|
|
"epoch": 0.6511476477291226,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0795166343428316e-05,
|
|
"loss": 0.9515,
|
|
"mean_token_accuracy": 0.7812347248196602,
|
|
"num_tokens": 331296938.0,
|
|
"step": 4500,
|
|
"train_ppl": 2.589622
|
|
},
|
|
{
|
|
"ce_loss": 0.9432,
|
|
"epoch": 0.652594642501854,
|
|
"grad_norm": 0.91796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.075041026406087e-05,
|
|
"loss": 0.9432,
|
|
"mean_token_accuracy": 0.7813379496335984,
|
|
"num_tokens": 332025952.0,
|
|
"step": 4510,
|
|
"train_ppl": 2.568238
|
|
},
|
|
{
|
|
"ce_loss": 1.0099,
|
|
"epoch": 0.6540416372745853,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.070565418469342e-05,
|
|
"loss": 1.0099,
|
|
"mean_token_accuracy": 0.7635823853313923,
|
|
"num_tokens": 332771616.0,
|
|
"step": 4520,
|
|
"train_ppl": 2.745205
|
|
},
|
|
{
|
|
"ce_loss": 0.9694,
|
|
"epoch": 0.6554886320473168,
|
|
"grad_norm": 0.87890625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0660898105325973e-05,
|
|
"loss": 0.9694,
|
|
"mean_token_accuracy": 0.7710436776280403,
|
|
"num_tokens": 333522538.0,
|
|
"step": 4530,
|
|
"train_ppl": 2.636479
|
|
},
|
|
{
|
|
"ce_loss": 0.9682,
|
|
"epoch": 0.6569356268200481,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0616142025958526e-05,
|
|
"loss": 0.9682,
|
|
"mean_token_accuracy": 0.7808797568082809,
|
|
"num_tokens": 334235618.0,
|
|
"step": 4540,
|
|
"train_ppl": 2.633224
|
|
},
|
|
{
|
|
"ce_loss": 0.9577,
|
|
"epoch": 0.6583826215927795,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.057138594659108e-05,
|
|
"loss": 0.9577,
|
|
"mean_token_accuracy": 0.7794765748083592,
|
|
"num_tokens": 334986466.0,
|
|
"step": 4550,
|
|
"train_ppl": 2.605761
|
|
},
|
|
{
|
|
"ce_loss": 0.9243,
|
|
"epoch": 0.6598296163655109,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0526629867223632e-05,
|
|
"loss": 0.9243,
|
|
"mean_token_accuracy": 0.788041090220213,
|
|
"num_tokens": 335711214.0,
|
|
"step": 4560,
|
|
"train_ppl": 2.520199
|
|
},
|
|
{
|
|
"ce_loss": 0.9528,
|
|
"epoch": 0.6612766111382422,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0481873787856185e-05,
|
|
"loss": 0.9528,
|
|
"mean_token_accuracy": 0.7787193424999714,
|
|
"num_tokens": 336437137.0,
|
|
"step": 4570,
|
|
"train_ppl": 2.592964
|
|
},
|
|
{
|
|
"ce_loss": 0.9448,
|
|
"epoch": 0.6627236059109737,
|
|
"grad_norm": 0.8828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0437117708488735e-05,
|
|
"loss": 0.9448,
|
|
"mean_token_accuracy": 0.7806118883192539,
|
|
"num_tokens": 337180631.0,
|
|
"step": 4580,
|
|
"train_ppl": 2.572427
|
|
},
|
|
{
|
|
"ce_loss": 0.954,
|
|
"epoch": 0.664170600683705,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.039236162912129e-05,
|
|
"loss": 0.954,
|
|
"mean_token_accuracy": 0.7802353672683239,
|
|
"num_tokens": 337939742.0,
|
|
"step": 4590,
|
|
"train_ppl": 2.596065
|
|
},
|
|
{
|
|
"ce_loss": 0.9637,
|
|
"epoch": 0.6656175954564364,
|
|
"grad_norm": 0.94921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0347605549753842e-05,
|
|
"loss": 0.9637,
|
|
"mean_token_accuracy": 0.7783378548920155,
|
|
"num_tokens": 338675720.0,
|
|
"step": 4600,
|
|
"train_ppl": 2.621249
|
|
},
|
|
{
|
|
"ce_loss": 0.9487,
|
|
"epoch": 0.6670645902291678,
|
|
"grad_norm": 1.2109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0302849470386394e-05,
|
|
"loss": 0.9487,
|
|
"mean_token_accuracy": 0.7817958757281304,
|
|
"num_tokens": 339387696.0,
|
|
"step": 4610,
|
|
"train_ppl": 2.582235
|
|
},
|
|
{
|
|
"ce_loss": 0.9513,
|
|
"epoch": 0.6685115850018992,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0258093391018948e-05,
|
|
"loss": 0.9513,
|
|
"mean_token_accuracy": 0.7807927936315536,
|
|
"num_tokens": 340133225.0,
|
|
"step": 4620,
|
|
"train_ppl": 2.58913
|
|
},
|
|
{
|
|
"ce_loss": 1.0216,
|
|
"epoch": 0.6699585797746306,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.02133373116515e-05,
|
|
"loss": 1.0216,
|
|
"mean_token_accuracy": 0.7636558651924134,
|
|
"num_tokens": 340874723.0,
|
|
"step": 4630,
|
|
"train_ppl": 2.777752
|
|
},
|
|
{
|
|
"ce_loss": 1.0065,
|
|
"epoch": 0.6714055745473619,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0168581232284052e-05,
|
|
"loss": 1.0065,
|
|
"mean_token_accuracy": 0.7711653731763363,
|
|
"num_tokens": 341581981.0,
|
|
"step": 4640,
|
|
"train_ppl": 2.736106
|
|
},
|
|
{
|
|
"ce_loss": 0.9494,
|
|
"epoch": 0.6728525693200933,
|
|
"grad_norm": 0.94921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0123825152916604e-05,
|
|
"loss": 0.9494,
|
|
"mean_token_accuracy": 0.7801486007869244,
|
|
"num_tokens": 342305325.0,
|
|
"step": 4650,
|
|
"train_ppl": 2.584225
|
|
},
|
|
{
|
|
"ce_loss": 1.0076,
|
|
"epoch": 0.6742995640928248,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0079069073549158e-05,
|
|
"loss": 1.0076,
|
|
"mean_token_accuracy": 0.7673116207122803,
|
|
"num_tokens": 343028770.0,
|
|
"step": 4660,
|
|
"train_ppl": 2.739132
|
|
},
|
|
{
|
|
"ce_loss": 0.9494,
|
|
"epoch": 0.6757465588655561,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.003431299418171e-05,
|
|
"loss": 0.9494,
|
|
"mean_token_accuracy": 0.7784094549715519,
|
|
"num_tokens": 343727815.0,
|
|
"step": 4670,
|
|
"train_ppl": 2.58426
|
|
},
|
|
{
|
|
"ce_loss": 0.9739,
|
|
"epoch": 0.6771935536382875,
|
|
"grad_norm": 0.86328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.989556914814263e-06,
|
|
"loss": 0.9739,
|
|
"mean_token_accuracy": 0.7748332381248474,
|
|
"num_tokens": 344496287.0,
|
|
"step": 4680,
|
|
"train_ppl": 2.648136
|
|
},
|
|
{
|
|
"ce_loss": 0.9277,
|
|
"epoch": 0.6786405484110188,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.944800835446814e-06,
|
|
"loss": 0.9277,
|
|
"mean_token_accuracy": 0.7852459564805031,
|
|
"num_tokens": 345252142.0,
|
|
"step": 4690,
|
|
"train_ppl": 2.528671
|
|
},
|
|
{
|
|
"ce_loss": 0.9513,
|
|
"epoch": 0.6800875431837502,
|
|
"grad_norm": 0.8984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.900044756079368e-06,
|
|
"loss": 0.9513,
|
|
"mean_token_accuracy": 0.7755139887332916,
|
|
"num_tokens": 345968711.0,
|
|
"step": 4700,
|
|
"train_ppl": 2.588961
|
|
},
|
|
{
|
|
"ce_loss": 0.9771,
|
|
"epoch": 0.6815345379564817,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.85528867671192e-06,
|
|
"loss": 0.9771,
|
|
"mean_token_accuracy": 0.7777153819799423,
|
|
"num_tokens": 346713582.0,
|
|
"step": 4710,
|
|
"train_ppl": 2.656647
|
|
},
|
|
{
|
|
"ce_loss": 0.9743,
|
|
"epoch": 0.682981532729213,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.810532597344473e-06,
|
|
"loss": 0.9743,
|
|
"mean_token_accuracy": 0.7767357155680656,
|
|
"num_tokens": 347439699.0,
|
|
"step": 4720,
|
|
"train_ppl": 2.64929
|
|
},
|
|
{
|
|
"ce_loss": 0.9481,
|
|
"epoch": 0.6844285275019444,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.765776517977025e-06,
|
|
"loss": 0.9481,
|
|
"mean_token_accuracy": 0.7791095830500125,
|
|
"num_tokens": 348184084.0,
|
|
"step": 4730,
|
|
"train_ppl": 2.580792
|
|
},
|
|
{
|
|
"ce_loss": 0.9604,
|
|
"epoch": 0.6858755222746757,
|
|
"grad_norm": 0.89453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.721020438609578e-06,
|
|
"loss": 0.9604,
|
|
"mean_token_accuracy": 0.7775398962199688,
|
|
"num_tokens": 348919169.0,
|
|
"step": 4740,
|
|
"train_ppl": 2.612626
|
|
},
|
|
{
|
|
"ce_loss": 0.8995,
|
|
"epoch": 0.6873225170474072,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.67626435924213e-06,
|
|
"loss": 0.8995,
|
|
"mean_token_accuracy": 0.7857723847031594,
|
|
"num_tokens": 349661624.0,
|
|
"step": 4750,
|
|
"train_ppl": 2.458453
|
|
},
|
|
{
|
|
"ce_loss": 0.9861,
|
|
"epoch": 0.6887695118201386,
|
|
"grad_norm": 1.25,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.631508279874683e-06,
|
|
"loss": 0.9861,
|
|
"mean_token_accuracy": 0.7729386761784554,
|
|
"num_tokens": 350399970.0,
|
|
"step": 4760,
|
|
"train_ppl": 2.680691
|
|
},
|
|
{
|
|
"ce_loss": 0.9508,
|
|
"epoch": 0.6902165065928699,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.586752200507235e-06,
|
|
"loss": 0.9508,
|
|
"mean_token_accuracy": 0.778910332173109,
|
|
"num_tokens": 351129477.0,
|
|
"step": 4770,
|
|
"train_ppl": 2.587908
|
|
},
|
|
{
|
|
"ce_loss": 0.948,
|
|
"epoch": 0.6916635013656013,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.54199612113979e-06,
|
|
"loss": 0.948,
|
|
"mean_token_accuracy": 0.7814707688987255,
|
|
"num_tokens": 351858724.0,
|
|
"step": 4780,
|
|
"train_ppl": 2.580426
|
|
},
|
|
{
|
|
"ce_loss": 0.9298,
|
|
"epoch": 0.6931104961383328,
|
|
"grad_norm": 0.8203125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.497240041772342e-06,
|
|
"loss": 0.9298,
|
|
"mean_token_accuracy": 0.7840299472212792,
|
|
"num_tokens": 352600340.0,
|
|
"step": 4790,
|
|
"train_ppl": 2.533983
|
|
},
|
|
{
|
|
"ce_loss": 0.9513,
|
|
"epoch": 0.6945574909110641,
|
|
"grad_norm": 1.2421875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.452483962404893e-06,
|
|
"loss": 0.9513,
|
|
"mean_token_accuracy": 0.7826124854385853,
|
|
"num_tokens": 353357441.0,
|
|
"step": 4800,
|
|
"train_ppl": 2.589095
|
|
},
|
|
{
|
|
"ce_loss": 0.9323,
|
|
"epoch": 0.6960044856837955,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.407727883037447e-06,
|
|
"loss": 0.9323,
|
|
"mean_token_accuracy": 0.787242216616869,
|
|
"num_tokens": 354113021.0,
|
|
"step": 4810,
|
|
"train_ppl": 2.540341
|
|
},
|
|
{
|
|
"ce_loss": 0.9677,
|
|
"epoch": 0.6974514804565268,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.362971803669999e-06,
|
|
"loss": 0.9677,
|
|
"mean_token_accuracy": 0.7780552484095097,
|
|
"num_tokens": 354852637.0,
|
|
"step": 4820,
|
|
"train_ppl": 2.631944
|
|
},
|
|
{
|
|
"ce_loss": 0.9494,
|
|
"epoch": 0.6988984752292582,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.318215724302552e-06,
|
|
"loss": 0.9494,
|
|
"mean_token_accuracy": 0.7799071431159973,
|
|
"num_tokens": 355576304.0,
|
|
"step": 4830,
|
|
"train_ppl": 2.584123
|
|
},
|
|
{
|
|
"ce_loss": 0.9728,
|
|
"epoch": 0.7003454700019897,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.273459644935104e-06,
|
|
"loss": 0.9728,
|
|
"mean_token_accuracy": 0.7771174512803555,
|
|
"num_tokens": 356285418.0,
|
|
"step": 4840,
|
|
"train_ppl": 2.645322
|
|
},
|
|
{
|
|
"ce_loss": 0.9722,
|
|
"epoch": 0.701792464774721,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.228703565567656e-06,
|
|
"loss": 0.9722,
|
|
"mean_token_accuracy": 0.7724181763827801,
|
|
"num_tokens": 357011227.0,
|
|
"step": 4850,
|
|
"train_ppl": 2.643664
|
|
},
|
|
{
|
|
"ce_loss": 0.9436,
|
|
"epoch": 0.7032394595474524,
|
|
"grad_norm": 1.5078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.183947486200209e-06,
|
|
"loss": 0.9436,
|
|
"mean_token_accuracy": 0.7861829474568367,
|
|
"num_tokens": 357765044.0,
|
|
"step": 4860,
|
|
"train_ppl": 2.569213
|
|
},
|
|
{
|
|
"ce_loss": 0.9813,
|
|
"epoch": 0.7046864543201837,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.139191406832761e-06,
|
|
"loss": 0.9813,
|
|
"mean_token_accuracy": 0.7709318250417709,
|
|
"num_tokens": 358480087.0,
|
|
"step": 4870,
|
|
"train_ppl": 2.667803
|
|
},
|
|
{
|
|
"ce_loss": 0.9635,
|
|
"epoch": 0.7061334490929152,
|
|
"grad_norm": 0.91015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.094435327465314e-06,
|
|
"loss": 0.9635,
|
|
"mean_token_accuracy": 0.7794269703328609,
|
|
"num_tokens": 359225911.0,
|
|
"step": 4880,
|
|
"train_ppl": 2.620869
|
|
},
|
|
{
|
|
"ce_loss": 0.97,
|
|
"epoch": 0.7075804438656466,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.049679248097868e-06,
|
|
"loss": 0.97,
|
|
"mean_token_accuracy": 0.777967818826437,
|
|
"num_tokens": 359966433.0,
|
|
"step": 4890,
|
|
"train_ppl": 2.637852
|
|
},
|
|
{
|
|
"ce_loss": 0.9711,
|
|
"epoch": 0.7090274386383779,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.00492316873042e-06,
|
|
"loss": 0.9711,
|
|
"mean_token_accuracy": 0.7772382542490959,
|
|
"num_tokens": 360710714.0,
|
|
"step": 4900,
|
|
"train_ppl": 2.640824
|
|
},
|
|
{
|
|
"ce_loss": 0.9834,
|
|
"epoch": 0.7104744334111093,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.960167089362971e-06,
|
|
"loss": 0.9834,
|
|
"mean_token_accuracy": 0.7759847708046437,
|
|
"num_tokens": 361431042.0,
|
|
"step": 4910,
|
|
"train_ppl": 2.673438
|
|
},
|
|
{
|
|
"ce_loss": 0.9929,
|
|
"epoch": 0.7119214281838406,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.915411009995524e-06,
|
|
"loss": 0.9929,
|
|
"mean_token_accuracy": 0.7740428909659386,
|
|
"num_tokens": 362150095.0,
|
|
"step": 4920,
|
|
"train_ppl": 2.699036
|
|
},
|
|
{
|
|
"ce_loss": 0.8871,
|
|
"epoch": 0.7133684229565721,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.870654930628078e-06,
|
|
"loss": 0.8871,
|
|
"mean_token_accuracy": 0.7937179610133172,
|
|
"num_tokens": 362916644.0,
|
|
"step": 4930,
|
|
"train_ppl": 2.428081
|
|
},
|
|
{
|
|
"ce_loss": 0.9567,
|
|
"epoch": 0.7148154177293035,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.82589885126063e-06,
|
|
"loss": 0.9567,
|
|
"mean_token_accuracy": 0.7758529260754585,
|
|
"num_tokens": 363661364.0,
|
|
"step": 4940,
|
|
"train_ppl": 2.603105
|
|
},
|
|
{
|
|
"ce_loss": 0.9611,
|
|
"epoch": 0.7162624125020348,
|
|
"grad_norm": 0.94921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.781142771893183e-06,
|
|
"loss": 0.9611,
|
|
"mean_token_accuracy": 0.7716841556131839,
|
|
"num_tokens": 364395584.0,
|
|
"step": 4950,
|
|
"train_ppl": 2.614648
|
|
},
|
|
{
|
|
"ce_loss": 0.9578,
|
|
"epoch": 0.7177094072747662,
|
|
"grad_norm": 1.2265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.736386692525735e-06,
|
|
"loss": 0.9578,
|
|
"mean_token_accuracy": 0.7815270647406578,
|
|
"num_tokens": 365122476.0,
|
|
"step": 4960,
|
|
"train_ppl": 2.605926
|
|
},
|
|
{
|
|
"ce_loss": 0.9854,
|
|
"epoch": 0.7191564020474976,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.691630613158287e-06,
|
|
"loss": 0.9854,
|
|
"mean_token_accuracy": 0.7658473886549473,
|
|
"num_tokens": 365839126.0,
|
|
"step": 4970,
|
|
"train_ppl": 2.678892
|
|
},
|
|
{
|
|
"ce_loss": 0.9621,
|
|
"epoch": 0.720603396820229,
|
|
"grad_norm": 0.9453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.64687453379084e-06,
|
|
"loss": 0.9621,
|
|
"mean_token_accuracy": 0.7814343258738518,
|
|
"num_tokens": 366576655.0,
|
|
"step": 4980,
|
|
"train_ppl": 2.617123
|
|
},
|
|
{
|
|
"ce_loss": 1.0258,
|
|
"epoch": 0.7220503915929604,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.602118454423392e-06,
|
|
"loss": 1.0258,
|
|
"mean_token_accuracy": 0.763127225637436,
|
|
"num_tokens": 367298471.0,
|
|
"step": 4990,
|
|
"train_ppl": 2.789273
|
|
},
|
|
{
|
|
"ce_loss": 0.9444,
|
|
"epoch": 0.7234973863656917,
|
|
"grad_norm": 1.2890625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.557362375055947e-06,
|
|
"loss": 0.9444,
|
|
"mean_token_accuracy": 0.780534103512764,
|
|
"num_tokens": 368033809.0,
|
|
"step": 5000,
|
|
"train_ppl": 2.571163
|
|
},
|
|
{
|
|
"ce_loss": 0.9551,
|
|
"epoch": 0.7249443811384232,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.512606295688499e-06,
|
|
"loss": 0.9551,
|
|
"mean_token_accuracy": 0.7752326272428036,
|
|
"num_tokens": 368778901.0,
|
|
"step": 5010,
|
|
"train_ppl": 2.599014
|
|
},
|
|
{
|
|
"ce_loss": 0.9666,
|
|
"epoch": 0.7263913759111545,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.46785021632105e-06,
|
|
"loss": 0.9666,
|
|
"mean_token_accuracy": 0.7790293991565704,
|
|
"num_tokens": 369523679.0,
|
|
"step": 5020,
|
|
"train_ppl": 2.629102
|
|
},
|
|
{
|
|
"ce_loss": 0.9558,
|
|
"epoch": 0.7278383706838859,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.423094136953602e-06,
|
|
"loss": 0.9558,
|
|
"mean_token_accuracy": 0.7781360924243927,
|
|
"num_tokens": 370232105.0,
|
|
"step": 5030,
|
|
"train_ppl": 2.60069
|
|
},
|
|
{
|
|
"ce_loss": 0.9697,
|
|
"epoch": 0.7292853654566173,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.378338057586156e-06,
|
|
"loss": 0.9697,
|
|
"mean_token_accuracy": 0.7776457980275154,
|
|
"num_tokens": 370983473.0,
|
|
"step": 5040,
|
|
"train_ppl": 2.637224
|
|
},
|
|
{
|
|
"ce_loss": 0.9737,
|
|
"epoch": 0.7307323602293486,
|
|
"grad_norm": 0.89453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.333581978218709e-06,
|
|
"loss": 0.9737,
|
|
"mean_token_accuracy": 0.7714293286204338,
|
|
"num_tokens": 371688241.0,
|
|
"step": 5050,
|
|
"train_ppl": 2.647609
|
|
},
|
|
{
|
|
"ce_loss": 0.9645,
|
|
"epoch": 0.7321793550020801,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.288825898851261e-06,
|
|
"loss": 0.9645,
|
|
"mean_token_accuracy": 0.7733834199607372,
|
|
"num_tokens": 372423026.0,
|
|
"step": 5060,
|
|
"train_ppl": 2.623403
|
|
},
|
|
{
|
|
"ce_loss": 0.9878,
|
|
"epoch": 0.7336263497748114,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.244069819483812e-06,
|
|
"loss": 0.9878,
|
|
"mean_token_accuracy": 0.7733451426029205,
|
|
"num_tokens": 373159103.0,
|
|
"step": 5070,
|
|
"train_ppl": 2.685398
|
|
},
|
|
{
|
|
"ce_loss": 0.9405,
|
|
"epoch": 0.7350733445475428,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.199313740116366e-06,
|
|
"loss": 0.9405,
|
|
"mean_token_accuracy": 0.7828592106699943,
|
|
"num_tokens": 373883566.0,
|
|
"step": 5080,
|
|
"train_ppl": 2.561212
|
|
},
|
|
{
|
|
"ce_loss": 0.9523,
|
|
"epoch": 0.7365203393202742,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.154557660748919e-06,
|
|
"loss": 0.9523,
|
|
"mean_token_accuracy": 0.7811919517815114,
|
|
"num_tokens": 374630857.0,
|
|
"step": 5090,
|
|
"train_ppl": 2.59161
|
|
},
|
|
{
|
|
"ce_loss": 0.9657,
|
|
"epoch": 0.7379673340930056,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.109801581381471e-06,
|
|
"loss": 0.9657,
|
|
"mean_token_accuracy": 0.7764380730688571,
|
|
"num_tokens": 375369612.0,
|
|
"step": 5100,
|
|
"train_ppl": 2.626685
|
|
},
|
|
{
|
|
"ce_loss": 0.9604,
|
|
"epoch": 0.739414328865737,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.065045502014025e-06,
|
|
"loss": 0.9604,
|
|
"mean_token_accuracy": 0.7770444475114345,
|
|
"num_tokens": 376090335.0,
|
|
"step": 5110,
|
|
"train_ppl": 2.61263
|
|
},
|
|
{
|
|
"ce_loss": 1.002,
|
|
"epoch": 0.7408613236384683,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.020289422646576e-06,
|
|
"loss": 1.002,
|
|
"mean_token_accuracy": 0.7697369538247585,
|
|
"num_tokens": 376821458.0,
|
|
"step": 5120,
|
|
"train_ppl": 2.72377
|
|
},
|
|
{
|
|
"ce_loss": 0.9565,
|
|
"epoch": 0.7423083184111997,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.975533343279128e-06,
|
|
"loss": 0.9565,
|
|
"mean_token_accuracy": 0.7750547006726265,
|
|
"num_tokens": 377545855.0,
|
|
"step": 5130,
|
|
"train_ppl": 2.602465
|
|
},
|
|
{
|
|
"ce_loss": 0.9469,
|
|
"epoch": 0.7437553131839312,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.93077726391168e-06,
|
|
"loss": 0.9469,
|
|
"mean_token_accuracy": 0.7794501177966595,
|
|
"num_tokens": 378284520.0,
|
|
"step": 5140,
|
|
"train_ppl": 2.577716
|
|
},
|
|
{
|
|
"ce_loss": 0.9937,
|
|
"epoch": 0.7452023079566625,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.886021184544235e-06,
|
|
"loss": 0.9937,
|
|
"mean_token_accuracy": 0.7733355782926082,
|
|
"num_tokens": 379035001.0,
|
|
"step": 5150,
|
|
"train_ppl": 2.701191
|
|
},
|
|
{
|
|
"ce_loss": 0.97,
|
|
"epoch": 0.7466493027293939,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.841265105176787e-06,
|
|
"loss": 0.97,
|
|
"mean_token_accuracy": 0.7776248715817928,
|
|
"num_tokens": 379752153.0,
|
|
"step": 5160,
|
|
"train_ppl": 2.638073
|
|
},
|
|
{
|
|
"ce_loss": 0.9501,
|
|
"epoch": 0.7480962975021253,
|
|
"grad_norm": 0.8515625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.79650902580934e-06,
|
|
"loss": 0.9501,
|
|
"mean_token_accuracy": 0.7786346770823002,
|
|
"num_tokens": 380519482.0,
|
|
"step": 5170,
|
|
"train_ppl": 2.586042
|
|
},
|
|
{
|
|
"ce_loss": 0.9668,
|
|
"epoch": 0.7495432922748566,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.75175294644189e-06,
|
|
"loss": 0.9668,
|
|
"mean_token_accuracy": 0.7759903006255626,
|
|
"num_tokens": 381261662.0,
|
|
"step": 5180,
|
|
"train_ppl": 2.629544
|
|
},
|
|
{
|
|
"ce_loss": 0.9573,
|
|
"epoch": 0.7509902870475881,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.706996867074445e-06,
|
|
"loss": 0.9573,
|
|
"mean_token_accuracy": 0.7775361500680447,
|
|
"num_tokens": 382020074.0,
|
|
"step": 5190,
|
|
"train_ppl": 2.604706
|
|
},
|
|
{
|
|
"ce_loss": 0.9541,
|
|
"epoch": 0.7524372818203194,
|
|
"grad_norm": 0.9765625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.662240787706997e-06,
|
|
"loss": 0.9541,
|
|
"mean_token_accuracy": 0.7822102926671505,
|
|
"num_tokens": 382778555.0,
|
|
"step": 5200,
|
|
"train_ppl": 2.596456
|
|
},
|
|
{
|
|
"ce_loss": 1.0105,
|
|
"epoch": 0.7538842765930508,
|
|
"grad_norm": 0.9453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.61748470833955e-06,
|
|
"loss": 1.0105,
|
|
"mean_token_accuracy": 0.7733402147889137,
|
|
"num_tokens": 383501391.0,
|
|
"step": 5210,
|
|
"train_ppl": 2.746933
|
|
},
|
|
{
|
|
"ce_loss": 0.9784,
|
|
"epoch": 0.7553312713657822,
|
|
"grad_norm": 0.9375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.572728628972101e-06,
|
|
"loss": 0.9784,
|
|
"mean_token_accuracy": 0.7757657401263713,
|
|
"num_tokens": 384255141.0,
|
|
"step": 5220,
|
|
"train_ppl": 2.660156
|
|
},
|
|
{
|
|
"ce_loss": 0.984,
|
|
"epoch": 0.7567782661385136,
|
|
"grad_norm": 0.93359375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.527972549604655e-06,
|
|
"loss": 0.984,
|
|
"mean_token_accuracy": 0.7741045750677585,
|
|
"num_tokens": 385007740.0,
|
|
"step": 5230,
|
|
"train_ppl": 2.675041
|
|
},
|
|
{
|
|
"ce_loss": 0.9386,
|
|
"epoch": 0.758225260911245,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.483216470237208e-06,
|
|
"loss": 0.9386,
|
|
"mean_token_accuracy": 0.778788211196661,
|
|
"num_tokens": 385746131.0,
|
|
"step": 5240,
|
|
"train_ppl": 2.556274
|
|
},
|
|
{
|
|
"ce_loss": 0.9838,
|
|
"epoch": 0.7596722556839763,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.438460390869759e-06,
|
|
"loss": 0.9838,
|
|
"mean_token_accuracy": 0.7773367874324322,
|
|
"num_tokens": 386477070.0,
|
|
"step": 5250,
|
|
"train_ppl": 2.674711
|
|
},
|
|
{
|
|
"ce_loss": 0.919,
|
|
"epoch": 0.7611192504567077,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.393704311502313e-06,
|
|
"loss": 0.919,
|
|
"mean_token_accuracy": 0.7863423444330693,
|
|
"num_tokens": 387230161.0,
|
|
"step": 5260,
|
|
"train_ppl": 2.506717
|
|
},
|
|
{
|
|
"ce_loss": 0.9727,
|
|
"epoch": 0.762566245229439,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.348948232134866e-06,
|
|
"loss": 0.9727,
|
|
"mean_token_accuracy": 0.7754369527101517,
|
|
"num_tokens": 387918499.0,
|
|
"step": 5270,
|
|
"train_ppl": 2.645059
|
|
},
|
|
{
|
|
"ce_loss": 0.9702,
|
|
"epoch": 0.7640132400021705,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.3041921527674176e-06,
|
|
"loss": 0.9702,
|
|
"mean_token_accuracy": 0.7701122313737869,
|
|
"num_tokens": 388648572.0,
|
|
"step": 5280,
|
|
"train_ppl": 2.638576
|
|
},
|
|
{
|
|
"ce_loss": 0.9647,
|
|
"epoch": 0.7654602347749019,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.259436073399971e-06,
|
|
"loss": 0.9647,
|
|
"mean_token_accuracy": 0.7734049685299397,
|
|
"num_tokens": 389377954.0,
|
|
"step": 5290,
|
|
"train_ppl": 2.623948
|
|
},
|
|
{
|
|
"ce_loss": 0.9537,
|
|
"epoch": 0.7669072295476332,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.2146799940325225e-06,
|
|
"loss": 0.9537,
|
|
"mean_token_accuracy": 0.7833194971084595,
|
|
"num_tokens": 390123270.0,
|
|
"step": 5300,
|
|
"train_ppl": 2.595421
|
|
},
|
|
{
|
|
"ce_loss": 0.9901,
|
|
"epoch": 0.7683542243203646,
|
|
"grad_norm": 0.9140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.169923914665076e-06,
|
|
"loss": 0.9901,
|
|
"mean_token_accuracy": 0.7688067726790905,
|
|
"num_tokens": 390821555.0,
|
|
"step": 5310,
|
|
"train_ppl": 2.691614
|
|
},
|
|
{
|
|
"ce_loss": 0.9358,
|
|
"epoch": 0.7698012190930961,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.125167835297628e-06,
|
|
"loss": 0.9358,
|
|
"mean_token_accuracy": 0.7849721722304821,
|
|
"num_tokens": 391571244.0,
|
|
"step": 5320,
|
|
"train_ppl": 2.549222
|
|
},
|
|
{
|
|
"ce_loss": 0.9291,
|
|
"epoch": 0.7712482138658274,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.080411755930181e-06,
|
|
"loss": 0.9291,
|
|
"mean_token_accuracy": 0.7855656445026398,
|
|
"num_tokens": 392336959.0,
|
|
"step": 5330,
|
|
"train_ppl": 2.532116
|
|
},
|
|
{
|
|
"ce_loss": 0.9654,
|
|
"epoch": 0.7726952086385588,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.035655676562733e-06,
|
|
"loss": 0.9654,
|
|
"mean_token_accuracy": 0.7771142728626728,
|
|
"num_tokens": 393084871.0,
|
|
"step": 5340,
|
|
"train_ppl": 2.625794
|
|
},
|
|
{
|
|
"ce_loss": 0.9783,
|
|
"epoch": 0.7741422034112901,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.990899597195286e-06,
|
|
"loss": 0.9783,
|
|
"mean_token_accuracy": 0.7791860036551952,
|
|
"num_tokens": 393816389.0,
|
|
"step": 5350,
|
|
"train_ppl": 2.65986
|
|
},
|
|
{
|
|
"ce_loss": 0.9563,
|
|
"epoch": 0.7755891981840216,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.946143517827838e-06,
|
|
"loss": 0.9563,
|
|
"mean_token_accuracy": 0.7763482123613358,
|
|
"num_tokens": 394555157.0,
|
|
"step": 5360,
|
|
"train_ppl": 2.601922
|
|
},
|
|
{
|
|
"ce_loss": 0.9661,
|
|
"epoch": 0.777036192956753,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.901387438460391e-06,
|
|
"loss": 0.9661,
|
|
"mean_token_accuracy": 0.7747901313006877,
|
|
"num_tokens": 395279049.0,
|
|
"step": 5370,
|
|
"train_ppl": 2.627785
|
|
},
|
|
{
|
|
"ce_loss": 0.9884,
|
|
"epoch": 0.7784831877294843,
|
|
"grad_norm": 1.2265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.856631359092944e-06,
|
|
"loss": 0.9884,
|
|
"mean_token_accuracy": 0.7725025109946728,
|
|
"num_tokens": 396001112.0,
|
|
"step": 5380,
|
|
"train_ppl": 2.687061
|
|
},
|
|
{
|
|
"ce_loss": 0.9704,
|
|
"epoch": 0.7799301825022157,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.811875279725496e-06,
|
|
"loss": 0.9704,
|
|
"mean_token_accuracy": 0.7769171021878719,
|
|
"num_tokens": 396728173.0,
|
|
"step": 5390,
|
|
"train_ppl": 2.638889
|
|
},
|
|
{
|
|
"ce_loss": 0.993,
|
|
"epoch": 0.781377177274947,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.767119200358049e-06,
|
|
"loss": 0.993,
|
|
"mean_token_accuracy": 0.7736337415874004,
|
|
"num_tokens": 397449602.0,
|
|
"step": 5400,
|
|
"train_ppl": 2.69944
|
|
},
|
|
{
|
|
"ce_loss": 0.9458,
|
|
"epoch": 0.7828241720476785,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.722363120990601e-06,
|
|
"loss": 0.9458,
|
|
"mean_token_accuracy": 0.7815995380282402,
|
|
"num_tokens": 398215793.0,
|
|
"step": 5410,
|
|
"train_ppl": 2.57481
|
|
},
|
|
{
|
|
"ce_loss": 0.9971,
|
|
"epoch": 0.7842711668204099,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.677607041623154e-06,
|
|
"loss": 0.9971,
|
|
"mean_token_accuracy": 0.7720453962683678,
|
|
"num_tokens": 398935756.0,
|
|
"step": 5420,
|
|
"train_ppl": 2.710507
|
|
},
|
|
{
|
|
"ce_loss": 0.9424,
|
|
"epoch": 0.7857181615931412,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.632850962255707e-06,
|
|
"loss": 0.9424,
|
|
"mean_token_accuracy": 0.7884068295359612,
|
|
"num_tokens": 399665412.0,
|
|
"step": 5430,
|
|
"train_ppl": 2.566172
|
|
},
|
|
{
|
|
"ce_loss": 0.9487,
|
|
"epoch": 0.7871651563658726,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.588094882888259e-06,
|
|
"loss": 0.9487,
|
|
"mean_token_accuracy": 0.7788920432329178,
|
|
"num_tokens": 400397909.0,
|
|
"step": 5440,
|
|
"train_ppl": 2.582247
|
|
},
|
|
{
|
|
"ce_loss": 0.9804,
|
|
"epoch": 0.7886121511386041,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.543338803520812e-06,
|
|
"loss": 0.9804,
|
|
"mean_token_accuracy": 0.7754887655377388,
|
|
"num_tokens": 401128916.0,
|
|
"step": 5450,
|
|
"train_ppl": 2.665399
|
|
},
|
|
{
|
|
"ce_loss": 0.9368,
|
|
"epoch": 0.7900591459113354,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.498582724153365e-06,
|
|
"loss": 0.9368,
|
|
"mean_token_accuracy": 0.7829912155866623,
|
|
"num_tokens": 401864725.0,
|
|
"step": 5460,
|
|
"train_ppl": 2.551742
|
|
},
|
|
{
|
|
"ce_loss": 0.914,
|
|
"epoch": 0.7915061406840668,
|
|
"grad_norm": 0.8984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.453826644785917e-06,
|
|
"loss": 0.914,
|
|
"mean_token_accuracy": 0.7870276011526585,
|
|
"num_tokens": 402619013.0,
|
|
"step": 5470,
|
|
"train_ppl": 2.49429
|
|
},
|
|
{
|
|
"ce_loss": 0.9494,
|
|
"epoch": 0.7929531354567981,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.40907056541847e-06,
|
|
"loss": 0.9494,
|
|
"mean_token_accuracy": 0.7810823060572147,
|
|
"num_tokens": 403360148.0,
|
|
"step": 5480,
|
|
"train_ppl": 2.584185
|
|
},
|
|
{
|
|
"ce_loss": 0.9483,
|
|
"epoch": 0.7944001302295296,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.3643144860510215e-06,
|
|
"loss": 0.9483,
|
|
"mean_token_accuracy": 0.7813143357634544,
|
|
"num_tokens": 404097450.0,
|
|
"step": 5490,
|
|
"train_ppl": 2.581417
|
|
},
|
|
{
|
|
"ce_loss": 0.9487,
|
|
"epoch": 0.795847125002261,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.319558406683575e-06,
|
|
"loss": 0.9487,
|
|
"mean_token_accuracy": 0.7773936979472638,
|
|
"num_tokens": 404828623.0,
|
|
"step": 5500,
|
|
"train_ppl": 2.582243
|
|
},
|
|
{
|
|
"ce_loss": 0.9635,
|
|
"epoch": 0.7972941197749923,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.274802327316127e-06,
|
|
"loss": 0.9635,
|
|
"mean_token_accuracy": 0.7771599672734737,
|
|
"num_tokens": 405544900.0,
|
|
"step": 5510,
|
|
"train_ppl": 2.620934
|
|
},
|
|
{
|
|
"ce_loss": 0.9981,
|
|
"epoch": 0.7987411145477237,
|
|
"grad_norm": 0.96484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.23004624794868e-06,
|
|
"loss": 0.9981,
|
|
"mean_token_accuracy": 0.7708815522491932,
|
|
"num_tokens": 406250286.0,
|
|
"step": 5520,
|
|
"train_ppl": 2.713164
|
|
},
|
|
{
|
|
"ce_loss": 0.933,
|
|
"epoch": 0.800188109320455,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.185290168581232e-06,
|
|
"loss": 0.933,
|
|
"mean_token_accuracy": 0.7810772813856601,
|
|
"num_tokens": 407002048.0,
|
|
"step": 5530,
|
|
"train_ppl": 2.542244
|
|
},
|
|
{
|
|
"ce_loss": 0.9519,
|
|
"epoch": 0.8016351040931865,
|
|
"grad_norm": 0.9453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.140534089213785e-06,
|
|
"loss": 0.9519,
|
|
"mean_token_accuracy": 0.7769171491265296,
|
|
"num_tokens": 407721865.0,
|
|
"step": 5540,
|
|
"train_ppl": 2.590526
|
|
},
|
|
{
|
|
"ce_loss": 0.9631,
|
|
"epoch": 0.8030820988659179,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.095778009846337e-06,
|
|
"loss": 0.9631,
|
|
"mean_token_accuracy": 0.7787568613886833,
|
|
"num_tokens": 408443748.0,
|
|
"step": 5550,
|
|
"train_ppl": 2.619744
|
|
},
|
|
{
|
|
"ce_loss": 0.9813,
|
|
"epoch": 0.8045290936386492,
|
|
"grad_norm": 1.1484375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.05102193047889e-06,
|
|
"loss": 0.9813,
|
|
"mean_token_accuracy": 0.7767161875963211,
|
|
"num_tokens": 409181659.0,
|
|
"step": 5560,
|
|
"train_ppl": 2.667798
|
|
},
|
|
{
|
|
"ce_loss": 0.9693,
|
|
"epoch": 0.8059760884113806,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.006265851111443e-06,
|
|
"loss": 0.9693,
|
|
"mean_token_accuracy": 0.7756986141204834,
|
|
"num_tokens": 409915769.0,
|
|
"step": 5570,
|
|
"train_ppl": 2.636003
|
|
},
|
|
{
|
|
"ce_loss": 0.949,
|
|
"epoch": 0.807423083184112,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.961509771743995e-06,
|
|
"loss": 0.949,
|
|
"mean_token_accuracy": 0.7831607341766358,
|
|
"num_tokens": 410630144.0,
|
|
"step": 5580,
|
|
"train_ppl": 2.58318
|
|
},
|
|
{
|
|
"ce_loss": 0.9709,
|
|
"epoch": 0.8088700779568434,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.9167536923765485e-06,
|
|
"loss": 0.9709,
|
|
"mean_token_accuracy": 0.7774527162313462,
|
|
"num_tokens": 411368980.0,
|
|
"step": 5590,
|
|
"train_ppl": 2.640323
|
|
},
|
|
{
|
|
"ce_loss": 0.9781,
|
|
"epoch": 0.8103170727295748,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.8719976130091e-06,
|
|
"loss": 0.9781,
|
|
"mean_token_accuracy": 0.7690740667283535,
|
|
"num_tokens": 412088296.0,
|
|
"step": 5600,
|
|
"train_ppl": 2.659381
|
|
},
|
|
{
|
|
"ce_loss": 0.9521,
|
|
"epoch": 0.8117640675023061,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.827241533641653e-06,
|
|
"loss": 0.9521,
|
|
"mean_token_accuracy": 0.7769833728671074,
|
|
"num_tokens": 412841228.0,
|
|
"step": 5610,
|
|
"train_ppl": 2.591169
|
|
},
|
|
{
|
|
"ce_loss": 0.9835,
|
|
"epoch": 0.8132110622750375,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.782485454274206e-06,
|
|
"loss": 0.9835,
|
|
"mean_token_accuracy": 0.7742873176932334,
|
|
"num_tokens": 413566071.0,
|
|
"step": 5620,
|
|
"train_ppl": 2.673852
|
|
},
|
|
{
|
|
"ce_loss": 0.9541,
|
|
"epoch": 0.814658057047769,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.737729374906758e-06,
|
|
"loss": 0.9541,
|
|
"mean_token_accuracy": 0.7803828045725822,
|
|
"num_tokens": 414300956.0,
|
|
"step": 5630,
|
|
"train_ppl": 2.596387
|
|
},
|
|
{
|
|
"ce_loss": 0.9433,
|
|
"epoch": 0.8161050518205003,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.692973295539311e-06,
|
|
"loss": 0.9433,
|
|
"mean_token_accuracy": 0.7835976503789425,
|
|
"num_tokens": 415039032.0,
|
|
"step": 5640,
|
|
"train_ppl": 2.568448
|
|
},
|
|
{
|
|
"ce_loss": 0.9447,
|
|
"epoch": 0.8175520465932317,
|
|
"grad_norm": 1.359375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.648217216171864e-06,
|
|
"loss": 0.9447,
|
|
"mean_token_accuracy": 0.7802014254033566,
|
|
"num_tokens": 415767715.0,
|
|
"step": 5650,
|
|
"train_ppl": 2.572132
|
|
},
|
|
{
|
|
"ce_loss": 0.9441,
|
|
"epoch": 0.818999041365963,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.603461136804416e-06,
|
|
"loss": 0.9441,
|
|
"mean_token_accuracy": 0.7781417928636074,
|
|
"num_tokens": 416488092.0,
|
|
"step": 5660,
|
|
"train_ppl": 2.57039
|
|
},
|
|
{
|
|
"ce_loss": 0.9421,
|
|
"epoch": 0.8204460361386945,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.558705057436969e-06,
|
|
"loss": 0.9421,
|
|
"mean_token_accuracy": 0.7813565135002136,
|
|
"num_tokens": 417257450.0,
|
|
"step": 5670,
|
|
"train_ppl": 2.565343
|
|
},
|
|
{
|
|
"ce_loss": 0.9452,
|
|
"epoch": 0.8218930309114258,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.513948978069521e-06,
|
|
"loss": 0.9452,
|
|
"mean_token_accuracy": 0.7794762089848518,
|
|
"num_tokens": 417990179.0,
|
|
"step": 5680,
|
|
"train_ppl": 2.573453
|
|
},
|
|
{
|
|
"ce_loss": 0.9678,
|
|
"epoch": 0.8233400256841572,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.469192898702074e-06,
|
|
"loss": 0.9678,
|
|
"mean_token_accuracy": 0.774018281698227,
|
|
"num_tokens": 418715129.0,
|
|
"step": 5690,
|
|
"train_ppl": 2.632052
|
|
},
|
|
{
|
|
"ce_loss": 0.9779,
|
|
"epoch": 0.8247870204568886,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.424436819334626e-06,
|
|
"loss": 0.9779,
|
|
"mean_token_accuracy": 0.7748581573367119,
|
|
"num_tokens": 419427338.0,
|
|
"step": 5700,
|
|
"train_ppl": 2.658952
|
|
},
|
|
{
|
|
"ce_loss": 0.9699,
|
|
"epoch": 0.82623401522962,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.379680739967179e-06,
|
|
"loss": 0.9699,
|
|
"mean_token_accuracy": 0.7738823585212231,
|
|
"num_tokens": 420154243.0,
|
|
"step": 5710,
|
|
"train_ppl": 2.63778
|
|
},
|
|
{
|
|
"ce_loss": 0.9736,
|
|
"epoch": 0.8276810100023514,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.334924660599731e-06,
|
|
"loss": 0.9736,
|
|
"mean_token_accuracy": 0.7746640965342522,
|
|
"num_tokens": 420886232.0,
|
|
"step": 5720,
|
|
"train_ppl": 2.64758
|
|
},
|
|
{
|
|
"ce_loss": 0.9375,
|
|
"epoch": 0.8291280047750827,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.290168581232284e-06,
|
|
"loss": 0.9375,
|
|
"mean_token_accuracy": 0.7802526973187923,
|
|
"num_tokens": 421614581.0,
|
|
"step": 5730,
|
|
"train_ppl": 2.553698
|
|
},
|
|
{
|
|
"ce_loss": 0.9554,
|
|
"epoch": 0.8305749995478141,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.245412501864837e-06,
|
|
"loss": 0.9554,
|
|
"mean_token_accuracy": 0.7804835855960846,
|
|
"num_tokens": 422341792.0,
|
|
"step": 5740,
|
|
"train_ppl": 2.599622
|
|
},
|
|
{
|
|
"ce_loss": 0.9732,
|
|
"epoch": 0.8320219943205455,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.200656422497389e-06,
|
|
"loss": 0.9732,
|
|
"mean_token_accuracy": 0.7791908659040928,
|
|
"num_tokens": 423060466.0,
|
|
"step": 5750,
|
|
"train_ppl": 2.64629
|
|
},
|
|
{
|
|
"ce_loss": 0.9559,
|
|
"epoch": 0.8334689890932769,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.155900343129943e-06,
|
|
"loss": 0.9559,
|
|
"mean_token_accuracy": 0.7781409621238708,
|
|
"num_tokens": 423782605.0,
|
|
"step": 5760,
|
|
"train_ppl": 2.601
|
|
},
|
|
{
|
|
"ce_loss": 0.9811,
|
|
"epoch": 0.8349159838660083,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.111144263762494e-06,
|
|
"loss": 0.9811,
|
|
"mean_token_accuracy": 0.7751675873994828,
|
|
"num_tokens": 424502076.0,
|
|
"step": 5770,
|
|
"train_ppl": 2.667354
|
|
},
|
|
{
|
|
"ce_loss": 1.0067,
|
|
"epoch": 0.8363629786387397,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.0663881843950475e-06,
|
|
"loss": 1.0067,
|
|
"mean_token_accuracy": 0.7735206983983517,
|
|
"num_tokens": 425218196.0,
|
|
"step": 5780,
|
|
"train_ppl": 2.73669
|
|
},
|
|
{
|
|
"ce_loss": 0.9582,
|
|
"epoch": 0.837809973411471,
|
|
"grad_norm": 0.859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.0216321050276e-06,
|
|
"loss": 0.9582,
|
|
"mean_token_accuracy": 0.7766490906476975,
|
|
"num_tokens": 425984680.0,
|
|
"step": 5790,
|
|
"train_ppl": 2.607062
|
|
},
|
|
{
|
|
"ce_loss": 0.9832,
|
|
"epoch": 0.8392569681842025,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.976876025660152e-06,
|
|
"loss": 0.9832,
|
|
"mean_token_accuracy": 0.7742396548390389,
|
|
"num_tokens": 426712707.0,
|
|
"step": 5800,
|
|
"train_ppl": 2.673103
|
|
},
|
|
{
|
|
"ce_loss": 1.0091,
|
|
"epoch": 0.8407039629569338,
|
|
"grad_norm": 1.078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.932119946292705e-06,
|
|
"loss": 1.0091,
|
|
"mean_token_accuracy": 0.7674178771674633,
|
|
"num_tokens": 427433528.0,
|
|
"step": 5810,
|
|
"train_ppl": 2.743111
|
|
},
|
|
{
|
|
"ce_loss": 0.937,
|
|
"epoch": 0.8421509577296652,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.887363866925257e-06,
|
|
"loss": 0.937,
|
|
"mean_token_accuracy": 0.7804404981434345,
|
|
"num_tokens": 428172138.0,
|
|
"step": 5820,
|
|
"train_ppl": 2.55243
|
|
},
|
|
{
|
|
"ce_loss": 0.9125,
|
|
"epoch": 0.8435979525023966,
|
|
"grad_norm": 1.1875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.84260778755781e-06,
|
|
"loss": 0.9125,
|
|
"mean_token_accuracy": 0.7849298395216465,
|
|
"num_tokens": 428911668.0,
|
|
"step": 5830,
|
|
"train_ppl": 2.490453
|
|
},
|
|
{
|
|
"ce_loss": 0.9878,
|
|
"epoch": 0.845044947275128,
|
|
"grad_norm": 0.97265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.797851708190363e-06,
|
|
"loss": 0.9878,
|
|
"mean_token_accuracy": 0.7694531783461571,
|
|
"num_tokens": 429645052.0,
|
|
"step": 5840,
|
|
"train_ppl": 2.685387
|
|
},
|
|
{
|
|
"ce_loss": 0.9736,
|
|
"epoch": 0.8464919420478594,
|
|
"grad_norm": 1.1953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.753095628822915e-06,
|
|
"loss": 0.9736,
|
|
"mean_token_accuracy": 0.7751254610717296,
|
|
"num_tokens": 430378612.0,
|
|
"step": 5850,
|
|
"train_ppl": 2.64755
|
|
},
|
|
{
|
|
"ce_loss": 0.9663,
|
|
"epoch": 0.8479389368205907,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.708339549455468e-06,
|
|
"loss": 0.9663,
|
|
"mean_token_accuracy": 0.7708243384957314,
|
|
"num_tokens": 431064544.0,
|
|
"step": 5860,
|
|
"train_ppl": 2.628303
|
|
},
|
|
{
|
|
"ce_loss": 0.9792,
|
|
"epoch": 0.8493859315933221,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.66358347008802e-06,
|
|
"loss": 0.9792,
|
|
"mean_token_accuracy": 0.7783576816320419,
|
|
"num_tokens": 431809385.0,
|
|
"step": 5870,
|
|
"train_ppl": 2.662384
|
|
},
|
|
{
|
|
"ce_loss": 0.9809,
|
|
"epoch": 0.8508329263660535,
|
|
"grad_norm": 1.15625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.618827390720573e-06,
|
|
"loss": 0.9809,
|
|
"mean_token_accuracy": 0.7732638500630855,
|
|
"num_tokens": 432564699.0,
|
|
"step": 5880,
|
|
"train_ppl": 2.666948
|
|
},
|
|
{
|
|
"ce_loss": 0.9614,
|
|
"epoch": 0.8522799211387849,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.574071311353125e-06,
|
|
"loss": 0.9614,
|
|
"mean_token_accuracy": 0.7784347735345364,
|
|
"num_tokens": 433285549.0,
|
|
"step": 5890,
|
|
"train_ppl": 2.615387
|
|
},
|
|
{
|
|
"ce_loss": 0.9669,
|
|
"epoch": 0.8537269159115163,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.5293152319856785e-06,
|
|
"loss": 0.9669,
|
|
"mean_token_accuracy": 0.7765318714082241,
|
|
"num_tokens": 434017224.0,
|
|
"step": 5900,
|
|
"train_ppl": 2.62971
|
|
},
|
|
{
|
|
"ce_loss": 0.9632,
|
|
"epoch": 0.8551739106842476,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.484559152618231e-06,
|
|
"loss": 0.9632,
|
|
"mean_token_accuracy": 0.7763010829687118,
|
|
"num_tokens": 434766145.0,
|
|
"step": 5910,
|
|
"train_ppl": 2.620017
|
|
},
|
|
{
|
|
"ce_loss": 0.9542,
|
|
"epoch": 0.856620905456979,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.4398030732507834e-06,
|
|
"loss": 0.9542,
|
|
"mean_token_accuracy": 0.780161052197218,
|
|
"num_tokens": 435503031.0,
|
|
"step": 5920,
|
|
"train_ppl": 2.596702
|
|
},
|
|
{
|
|
"ce_loss": 0.9372,
|
|
"epoch": 0.8580679002297105,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.395046993883336e-06,
|
|
"loss": 0.9372,
|
|
"mean_token_accuracy": 0.7774905152618885,
|
|
"num_tokens": 436240735.0,
|
|
"step": 5930,
|
|
"train_ppl": 2.552895
|
|
},
|
|
{
|
|
"ce_loss": 0.9657,
|
|
"epoch": 0.8595148950024418,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.350290914515888e-06,
|
|
"loss": 0.9657,
|
|
"mean_token_accuracy": 0.776423779129982,
|
|
"num_tokens": 436981949.0,
|
|
"step": 5940,
|
|
"train_ppl": 2.62665
|
|
},
|
|
{
|
|
"ce_loss": 0.9574,
|
|
"epoch": 0.8609618897751732,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.305534835148442e-06,
|
|
"loss": 0.9574,
|
|
"mean_token_accuracy": 0.7750987179577351,
|
|
"num_tokens": 437750102.0,
|
|
"step": 5950,
|
|
"train_ppl": 2.605002
|
|
},
|
|
{
|
|
"ce_loss": 0.9409,
|
|
"epoch": 0.8624088845479045,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.260778755780993e-06,
|
|
"loss": 0.9409,
|
|
"mean_token_accuracy": 0.7818285569548606,
|
|
"num_tokens": 438508119.0,
|
|
"step": 5960,
|
|
"train_ppl": 2.562181
|
|
},
|
|
{
|
|
"ce_loss": 1.0036,
|
|
"epoch": 0.8638558793206359,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.2160226764135465e-06,
|
|
"loss": 1.0036,
|
|
"mean_token_accuracy": 0.767191369086504,
|
|
"num_tokens": 439276410.0,
|
|
"step": 5970,
|
|
"train_ppl": 2.727961
|
|
},
|
|
{
|
|
"ce_loss": 0.9487,
|
|
"epoch": 0.8653028740933674,
|
|
"grad_norm": 0.89453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.171266597046099e-06,
|
|
"loss": 0.9487,
|
|
"mean_token_accuracy": 0.7764919579029084,
|
|
"num_tokens": 440026754.0,
|
|
"step": 5980,
|
|
"train_ppl": 2.582388
|
|
},
|
|
{
|
|
"ce_loss": 0.971,
|
|
"epoch": 0.8667498688660987,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.126510517678651e-06,
|
|
"loss": 0.971,
|
|
"mean_token_accuracy": 0.7749002501368523,
|
|
"num_tokens": 440761601.0,
|
|
"step": 5990,
|
|
"train_ppl": 2.640495
|
|
},
|
|
{
|
|
"ce_loss": 0.9995,
|
|
"epoch": 0.8681968636388301,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.081754438311204e-06,
|
|
"loss": 0.9995,
|
|
"mean_token_accuracy": 0.7680262356996537,
|
|
"num_tokens": 441480022.0,
|
|
"step": 6000,
|
|
"train_ppl": 2.716909
|
|
},
|
|
{
|
|
"ce_loss": 0.9768,
|
|
"epoch": 0.8696438584115614,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.036998358943757e-06,
|
|
"loss": 0.9768,
|
|
"mean_token_accuracy": 0.7749585300683975,
|
|
"num_tokens": 442223925.0,
|
|
"step": 6010,
|
|
"train_ppl": 2.65607
|
|
},
|
|
{
|
|
"ce_loss": 0.9682,
|
|
"epoch": 0.8710908531842929,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.992242279576309e-06,
|
|
"loss": 0.9682,
|
|
"mean_token_accuracy": 0.7721332833170891,
|
|
"num_tokens": 442962668.0,
|
|
"step": 6020,
|
|
"train_ppl": 2.63316
|
|
},
|
|
{
|
|
"ce_loss": 0.983,
|
|
"epoch": 0.8725378479570243,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.947486200208862e-06,
|
|
"loss": 0.983,
|
|
"mean_token_accuracy": 0.7761274553835392,
|
|
"num_tokens": 443689137.0,
|
|
"step": 6030,
|
|
"train_ppl": 2.672528
|
|
},
|
|
{
|
|
"ce_loss": 0.9732,
|
|
"epoch": 0.8739848427297556,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.902730120841414e-06,
|
|
"loss": 0.9732,
|
|
"mean_token_accuracy": 0.7740906737744808,
|
|
"num_tokens": 444401316.0,
|
|
"step": 6040,
|
|
"train_ppl": 2.646453
|
|
},
|
|
{
|
|
"ce_loss": 0.9723,
|
|
"epoch": 0.875431837502487,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.857974041473967e-06,
|
|
"loss": 0.9723,
|
|
"mean_token_accuracy": 0.7794286720454693,
|
|
"num_tokens": 445116577.0,
|
|
"step": 6050,
|
|
"train_ppl": 2.643935
|
|
},
|
|
{
|
|
"ce_loss": 0.9684,
|
|
"epoch": 0.8768788322752185,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.81321796210652e-06,
|
|
"loss": 0.9684,
|
|
"mean_token_accuracy": 0.7808907024562359,
|
|
"num_tokens": 445876002.0,
|
|
"step": 6060,
|
|
"train_ppl": 2.633708
|
|
},
|
|
{
|
|
"ce_loss": 0.9711,
|
|
"epoch": 0.8783258270479498,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.7684618827390723e-06,
|
|
"loss": 0.9711,
|
|
"mean_token_accuracy": 0.7762280680239201,
|
|
"num_tokens": 446605260.0,
|
|
"step": 6070,
|
|
"train_ppl": 2.640865
|
|
},
|
|
{
|
|
"ce_loss": 0.95,
|
|
"epoch": 0.8797728218206812,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.7237058033716247e-06,
|
|
"loss": 0.95,
|
|
"mean_token_accuracy": 0.7792424105107785,
|
|
"num_tokens": 447358325.0,
|
|
"step": 6080,
|
|
"train_ppl": 2.585616
|
|
},
|
|
{
|
|
"ce_loss": 0.959,
|
|
"epoch": 0.8812198165934125,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.678949724004177e-06,
|
|
"loss": 0.959,
|
|
"mean_token_accuracy": 0.7746827162802219,
|
|
"num_tokens": 448100945.0,
|
|
"step": 6090,
|
|
"train_ppl": 2.609138
|
|
},
|
|
{
|
|
"ce_loss": 0.9417,
|
|
"epoch": 0.8826668113661439,
|
|
"grad_norm": 0.8671875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.6341936446367296e-06,
|
|
"loss": 0.9417,
|
|
"mean_token_accuracy": 0.7761165231466294,
|
|
"num_tokens": 448857359.0,
|
|
"step": 6100,
|
|
"train_ppl": 2.564342
|
|
},
|
|
{
|
|
"ce_loss": 0.9845,
|
|
"epoch": 0.8841138061388754,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.5894375652692825e-06,
|
|
"loss": 0.9845,
|
|
"mean_token_accuracy": 0.7675826340913773,
|
|
"num_tokens": 449575975.0,
|
|
"step": 6110,
|
|
"train_ppl": 2.67659
|
|
},
|
|
{
|
|
"ce_loss": 0.964,
|
|
"epoch": 0.8855608009116067,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.544681485901835e-06,
|
|
"loss": 0.964,
|
|
"mean_token_accuracy": 0.7789463967084884,
|
|
"num_tokens": 450301560.0,
|
|
"step": 6120,
|
|
"train_ppl": 2.622228
|
|
},
|
|
{
|
|
"ce_loss": 0.9757,
|
|
"epoch": 0.8870077956843381,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.4999254065343874e-06,
|
|
"loss": 0.9757,
|
|
"mean_token_accuracy": 0.7748393803834915,
|
|
"num_tokens": 451046846.0,
|
|
"step": 6130,
|
|
"train_ppl": 2.652971
|
|
},
|
|
{
|
|
"ce_loss": 0.9732,
|
|
"epoch": 0.8884547904570694,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.4551693271669406e-06,
|
|
"loss": 0.9732,
|
|
"mean_token_accuracy": 0.7820017896592617,
|
|
"num_tokens": 451811972.0,
|
|
"step": 6140,
|
|
"train_ppl": 2.646348
|
|
},
|
|
{
|
|
"ce_loss": 0.9461,
|
|
"epoch": 0.8899017852298009,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.410413247799493e-06,
|
|
"loss": 0.9461,
|
|
"mean_token_accuracy": 0.7822142690420151,
|
|
"num_tokens": 452565156.0,
|
|
"step": 6150,
|
|
"train_ppl": 2.575566
|
|
},
|
|
{
|
|
"ce_loss": 1.0128,
|
|
"epoch": 0.8913487800025323,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.3656571684320455e-06,
|
|
"loss": 1.0128,
|
|
"mean_token_accuracy": 0.7665348842740058,
|
|
"num_tokens": 453300539.0,
|
|
"step": 6160,
|
|
"train_ppl": 2.753163
|
|
},
|
|
{
|
|
"ce_loss": 0.9794,
|
|
"epoch": 0.8927957747752636,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.320901089064598e-06,
|
|
"loss": 0.9794,
|
|
"mean_token_accuracy": 0.7745142556726933,
|
|
"num_tokens": 454032470.0,
|
|
"step": 6170,
|
|
"train_ppl": 2.66287
|
|
},
|
|
{
|
|
"ce_loss": 0.9568,
|
|
"epoch": 0.894242769547995,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.276145009697151e-06,
|
|
"loss": 0.9568,
|
|
"mean_token_accuracy": 0.7779201343655586,
|
|
"num_tokens": 454766140.0,
|
|
"step": 6180,
|
|
"train_ppl": 2.603474
|
|
},
|
|
{
|
|
"ce_loss": 0.9672,
|
|
"epoch": 0.8956897643207264,
|
|
"grad_norm": 0.9921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.2313889303297033e-06,
|
|
"loss": 0.9672,
|
|
"mean_token_accuracy": 0.7766256541013717,
|
|
"num_tokens": 455497600.0,
|
|
"step": 6190,
|
|
"train_ppl": 2.630683
|
|
},
|
|
{
|
|
"ce_loss": 0.9608,
|
|
"epoch": 0.8971367590934578,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.1866328509622557e-06,
|
|
"loss": 0.9608,
|
|
"mean_token_accuracy": 0.7783399567008018,
|
|
"num_tokens": 456213968.0,
|
|
"step": 6200,
|
|
"train_ppl": 2.613881
|
|
},
|
|
{
|
|
"ce_loss": 0.989,
|
|
"epoch": 0.8985837538661892,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.141876771594808e-06,
|
|
"loss": 0.989,
|
|
"mean_token_accuracy": 0.7722627222537994,
|
|
"num_tokens": 456980565.0,
|
|
"step": 6210,
|
|
"train_ppl": 2.688524
|
|
},
|
|
{
|
|
"ce_loss": 0.9211,
|
|
"epoch": 0.9000307486389205,
|
|
"grad_norm": 0.90625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.097120692227361e-06,
|
|
"loss": 0.9211,
|
|
"mean_token_accuracy": 0.785981647670269,
|
|
"num_tokens": 457749115.0,
|
|
"step": 6220,
|
|
"train_ppl": 2.511994
|
|
},
|
|
{
|
|
"ce_loss": 0.9593,
|
|
"epoch": 0.9014777434116519,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.0523646128599135e-06,
|
|
"loss": 0.9593,
|
|
"mean_token_accuracy": 0.7805201202630997,
|
|
"num_tokens": 458489401.0,
|
|
"step": 6230,
|
|
"train_ppl": 2.609812
|
|
},
|
|
{
|
|
"ce_loss": 0.9827,
|
|
"epoch": 0.9029247381843833,
|
|
"grad_norm": 0.953125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.007608533492466e-06,
|
|
"loss": 0.9827,
|
|
"mean_token_accuracy": 0.7736832290887833,
|
|
"num_tokens": 459226574.0,
|
|
"step": 6240,
|
|
"train_ppl": 2.671592
|
|
},
|
|
{
|
|
"ce_loss": 0.9776,
|
|
"epoch": 0.9043717329571147,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.962852454125019e-06,
|
|
"loss": 0.9776,
|
|
"mean_token_accuracy": 0.776441466808319,
|
|
"num_tokens": 459960745.0,
|
|
"step": 6250,
|
|
"train_ppl": 2.658195
|
|
},
|
|
{
|
|
"ce_loss": 0.9535,
|
|
"epoch": 0.9058187277298461,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.9180963747575713e-06,
|
|
"loss": 0.9535,
|
|
"mean_token_accuracy": 0.7777935616672039,
|
|
"num_tokens": 460692141.0,
|
|
"step": 6260,
|
|
"train_ppl": 2.594836
|
|
},
|
|
{
|
|
"ce_loss": 0.9883,
|
|
"epoch": 0.9072657225025774,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.8733402953901237e-06,
|
|
"loss": 0.9883,
|
|
"mean_token_accuracy": 0.7695657543838024,
|
|
"num_tokens": 461408471.0,
|
|
"step": 6270,
|
|
"train_ppl": 2.686754
|
|
},
|
|
{
|
|
"ce_loss": 0.9433,
|
|
"epoch": 0.9087127172753089,
|
|
"grad_norm": 0.921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.828584216022676e-06,
|
|
"loss": 0.9433,
|
|
"mean_token_accuracy": 0.780649583786726,
|
|
"num_tokens": 462170112.0,
|
|
"step": 6280,
|
|
"train_ppl": 2.568511
|
|
},
|
|
{
|
|
"ce_loss": 0.9745,
|
|
"epoch": 0.9101597120480402,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.783828136655229e-06,
|
|
"loss": 0.9745,
|
|
"mean_token_accuracy": 0.7758511275053024,
|
|
"num_tokens": 462877827.0,
|
|
"step": 6290,
|
|
"train_ppl": 2.64988
|
|
},
|
|
{
|
|
"ce_loss": 0.9634,
|
|
"epoch": 0.9116067068207716,
|
|
"grad_norm": 0.984375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.739072057287782e-06,
|
|
"loss": 0.9634,
|
|
"mean_token_accuracy": 0.7743300221860409,
|
|
"num_tokens": 463601430.0,
|
|
"step": 6300,
|
|
"train_ppl": 2.620472
|
|
},
|
|
{
|
|
"ce_loss": 0.9451,
|
|
"epoch": 0.913053701593503,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6943159779203344e-06,
|
|
"loss": 0.9451,
|
|
"mean_token_accuracy": 0.7799232237040996,
|
|
"num_tokens": 464318344.0,
|
|
"step": 6310,
|
|
"train_ppl": 2.572968
|
|
},
|
|
{
|
|
"ce_loss": 0.9682,
|
|
"epoch": 0.9145006963662343,
|
|
"grad_norm": 0.94921875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.649559898552887e-06,
|
|
"loss": 0.9682,
|
|
"mean_token_accuracy": 0.7786154381930828,
|
|
"num_tokens": 465051370.0,
|
|
"step": 6320,
|
|
"train_ppl": 2.633079
|
|
},
|
|
{
|
|
"ce_loss": 0.9604,
|
|
"epoch": 0.9159476911389658,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.6048038191854397e-06,
|
|
"loss": 0.9604,
|
|
"mean_token_accuracy": 0.7759640254080296,
|
|
"num_tokens": 465801154.0,
|
|
"step": 6330,
|
|
"train_ppl": 2.612643
|
|
},
|
|
{
|
|
"ce_loss": 0.9521,
|
|
"epoch": 0.9173946859116971,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.560047739817992e-06,
|
|
"loss": 0.9521,
|
|
"mean_token_accuracy": 0.7819162972271443,
|
|
"num_tokens": 466570155.0,
|
|
"step": 6340,
|
|
"train_ppl": 2.591263
|
|
},
|
|
{
|
|
"ce_loss": 0.9604,
|
|
"epoch": 0.9188416806844285,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.5152916604505446e-06,
|
|
"loss": 0.9604,
|
|
"mean_token_accuracy": 0.7824667453765869,
|
|
"num_tokens": 467322541.0,
|
|
"step": 6350,
|
|
"train_ppl": 2.612788
|
|
},
|
|
{
|
|
"ce_loss": 0.9365,
|
|
"epoch": 0.9202886754571599,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.470535581083097e-06,
|
|
"loss": 0.9365,
|
|
"mean_token_accuracy": 0.7835808910429478,
|
|
"num_tokens": 468075229.0,
|
|
"step": 6360,
|
|
"train_ppl": 2.550947
|
|
},
|
|
{
|
|
"ce_loss": 0.9473,
|
|
"epoch": 0.9217356702298913,
|
|
"grad_norm": 0.9609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.42577950171565e-06,
|
|
"loss": 0.9473,
|
|
"mean_token_accuracy": 0.77774076461792,
|
|
"num_tokens": 468820005.0,
|
|
"step": 6370,
|
|
"train_ppl": 2.578614
|
|
},
|
|
{
|
|
"ce_loss": 0.9618,
|
|
"epoch": 0.9231826650026227,
|
|
"grad_norm": 1.0390625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3810234223482023e-06,
|
|
"loss": 0.9618,
|
|
"mean_token_accuracy": 0.7733399920165539,
|
|
"num_tokens": 469537339.0,
|
|
"step": 6380,
|
|
"train_ppl": 2.616365
|
|
},
|
|
{
|
|
"ce_loss": 0.9568,
|
|
"epoch": 0.924629659775354,
|
|
"grad_norm": 0.95703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3362673429807548e-06,
|
|
"loss": 0.9568,
|
|
"mean_token_accuracy": 0.7792744718492031,
|
|
"num_tokens": 470264281.0,
|
|
"step": 6390,
|
|
"train_ppl": 2.603469
|
|
},
|
|
{
|
|
"ce_loss": 0.9704,
|
|
"epoch": 0.9260766545480854,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2915112636133076e-06,
|
|
"loss": 0.9704,
|
|
"mean_token_accuracy": 0.7776748731732368,
|
|
"num_tokens": 470997935.0,
|
|
"step": 6400,
|
|
"train_ppl": 2.639119
|
|
},
|
|
{
|
|
"ce_loss": 0.9537,
|
|
"epoch": 0.9275236493208169,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.24675518424586e-06,
|
|
"loss": 0.9537,
|
|
"mean_token_accuracy": 0.7739205956459045,
|
|
"num_tokens": 471749710.0,
|
|
"step": 6410,
|
|
"train_ppl": 2.595221
|
|
},
|
|
{
|
|
"ce_loss": 0.9648,
|
|
"epoch": 0.9289706440935482,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.2019991048784125e-06,
|
|
"loss": 0.9648,
|
|
"mean_token_accuracy": 0.7769439205527305,
|
|
"num_tokens": 472473330.0,
|
|
"step": 6420,
|
|
"train_ppl": 2.624186
|
|
},
|
|
{
|
|
"ce_loss": 0.9727,
|
|
"epoch": 0.9304176388662796,
|
|
"grad_norm": 0.96875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.157243025510965e-06,
|
|
"loss": 0.9727,
|
|
"mean_token_accuracy": 0.771061759442091,
|
|
"num_tokens": 473203701.0,
|
|
"step": 6430,
|
|
"train_ppl": 2.645201
|
|
},
|
|
{
|
|
"ce_loss": 0.9369,
|
|
"epoch": 0.931864633639011,
|
|
"grad_norm": 1.1796875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.112486946143518e-06,
|
|
"loss": 0.9369,
|
|
"mean_token_accuracy": 0.7875291585922242,
|
|
"num_tokens": 473951304.0,
|
|
"step": 6440,
|
|
"train_ppl": 2.551984
|
|
},
|
|
{
|
|
"ce_loss": 0.963,
|
|
"epoch": 0.9333116284117423,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.0677308667760703e-06,
|
|
"loss": 0.963,
|
|
"mean_token_accuracy": 0.7799215823411941,
|
|
"num_tokens": 474681697.0,
|
|
"step": 6450,
|
|
"train_ppl": 2.619448
|
|
},
|
|
{
|
|
"ce_loss": 0.9581,
|
|
"epoch": 0.9347586231844738,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.022974787408623e-06,
|
|
"loss": 0.9581,
|
|
"mean_token_accuracy": 0.7823777303099633,
|
|
"num_tokens": 475396883.0,
|
|
"step": 6460,
|
|
"train_ppl": 2.606745
|
|
},
|
|
{
|
|
"ce_loss": 0.9942,
|
|
"epoch": 0.9362056179572051,
|
|
"grad_norm": 1.1015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9782187080411756e-06,
|
|
"loss": 0.9942,
|
|
"mean_token_accuracy": 0.7746273078024387,
|
|
"num_tokens": 476110094.0,
|
|
"step": 6470,
|
|
"train_ppl": 2.702625
|
|
},
|
|
{
|
|
"ce_loss": 0.954,
|
|
"epoch": 0.9376526127299365,
|
|
"grad_norm": 1.0546875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.9334626286737285e-06,
|
|
"loss": 0.954,
|
|
"mean_token_accuracy": 0.7780710026621819,
|
|
"num_tokens": 476856061.0,
|
|
"step": 6480,
|
|
"train_ppl": 2.59616
|
|
},
|
|
{
|
|
"ce_loss": 0.9533,
|
|
"epoch": 0.9390996075026679,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.888706549306281e-06,
|
|
"loss": 0.9533,
|
|
"mean_token_accuracy": 0.7776739954948425,
|
|
"num_tokens": 477582700.0,
|
|
"step": 6490,
|
|
"train_ppl": 2.594139
|
|
},
|
|
{
|
|
"ce_loss": 0.9816,
|
|
"epoch": 0.9405466022753993,
|
|
"grad_norm": 1.046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8439504699388336e-06,
|
|
"loss": 0.9816,
|
|
"mean_token_accuracy": 0.774020179361105,
|
|
"num_tokens": 478295644.0,
|
|
"step": 6500,
|
|
"train_ppl": 2.66881
|
|
},
|
|
{
|
|
"ce_loss": 0.9186,
|
|
"epoch": 0.9419935970481307,
|
|
"grad_norm": 0.98046875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.799194390571386e-06,
|
|
"loss": 0.9186,
|
|
"mean_token_accuracy": 0.7841186247766018,
|
|
"num_tokens": 479045896.0,
|
|
"step": 6510,
|
|
"train_ppl": 2.505872
|
|
},
|
|
{
|
|
"ce_loss": 0.956,
|
|
"epoch": 0.943440591820862,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7544383112039387e-06,
|
|
"loss": 0.956,
|
|
"mean_token_accuracy": 0.7821230754256249,
|
|
"num_tokens": 479771982.0,
|
|
"step": 6520,
|
|
"train_ppl": 2.601145
|
|
},
|
|
{
|
|
"ce_loss": 0.962,
|
|
"epoch": 0.9448875865935934,
|
|
"grad_norm": 1.1171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.7096822318364911e-06,
|
|
"loss": 0.962,
|
|
"mean_token_accuracy": 0.7803165823221206,
|
|
"num_tokens": 480534412.0,
|
|
"step": 6530,
|
|
"train_ppl": 2.616837
|
|
},
|
|
{
|
|
"ce_loss": 0.9292,
|
|
"epoch": 0.9463345813663249,
|
|
"grad_norm": 1.09375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6649261524690438e-06,
|
|
"loss": 0.9292,
|
|
"mean_token_accuracy": 0.7858192339539528,
|
|
"num_tokens": 481283576.0,
|
|
"step": 6540,
|
|
"train_ppl": 2.53254
|
|
},
|
|
{
|
|
"ce_loss": 0.9411,
|
|
"epoch": 0.9477815761390562,
|
|
"grad_norm": 1.1640625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.6201700731015962e-06,
|
|
"loss": 0.9411,
|
|
"mean_token_accuracy": 0.7775696411728859,
|
|
"num_tokens": 482029882.0,
|
|
"step": 6550,
|
|
"train_ppl": 2.562835
|
|
},
|
|
{
|
|
"ce_loss": 0.9532,
|
|
"epoch": 0.9492285709117876,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.575413993734149e-06,
|
|
"loss": 0.9532,
|
|
"mean_token_accuracy": 0.7774538859724999,
|
|
"num_tokens": 482773749.0,
|
|
"step": 6560,
|
|
"train_ppl": 2.594032
|
|
},
|
|
{
|
|
"ce_loss": 1.0142,
|
|
"epoch": 0.9506755656845189,
|
|
"grad_norm": 1.0859375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.5306579143667016e-06,
|
|
"loss": 1.0142,
|
|
"mean_token_accuracy": 0.7689271204173564,
|
|
"num_tokens": 483502307.0,
|
|
"step": 6570,
|
|
"train_ppl": 2.757271
|
|
},
|
|
{
|
|
"ce_loss": 0.9734,
|
|
"epoch": 0.9521225604572503,
|
|
"grad_norm": 0.92578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4859018349992542e-06,
|
|
"loss": 0.9734,
|
|
"mean_token_accuracy": 0.7774414747953415,
|
|
"num_tokens": 484237741.0,
|
|
"step": 6580,
|
|
"train_ppl": 2.646816
|
|
},
|
|
{
|
|
"ce_loss": 0.9492,
|
|
"epoch": 0.9535695552299818,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4411457556318067e-06,
|
|
"loss": 0.9492,
|
|
"mean_token_accuracy": 0.7777016542851924,
|
|
"num_tokens": 484965896.0,
|
|
"step": 6590,
|
|
"train_ppl": 2.583514
|
|
},
|
|
{
|
|
"ce_loss": 0.9268,
|
|
"epoch": 0.9550165500027131,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3963896762643593e-06,
|
|
"loss": 0.9268,
|
|
"mean_token_accuracy": 0.783556516468525,
|
|
"num_tokens": 485698087.0,
|
|
"step": 6600,
|
|
"train_ppl": 2.526361
|
|
},
|
|
{
|
|
"ce_loss": 0.9347,
|
|
"epoch": 0.9564635447754445,
|
|
"grad_norm": 0.89453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3516335968969118e-06,
|
|
"loss": 0.9347,
|
|
"mean_token_accuracy": 0.780432254821062,
|
|
"num_tokens": 486457104.0,
|
|
"step": 6610,
|
|
"train_ppl": 2.546429
|
|
},
|
|
{
|
|
"ce_loss": 1.0135,
|
|
"epoch": 0.9579105395481758,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.3068775175294644e-06,
|
|
"loss": 1.0135,
|
|
"mean_token_accuracy": 0.7681482747197151,
|
|
"num_tokens": 487180072.0,
|
|
"step": 6620,
|
|
"train_ppl": 2.75519
|
|
},
|
|
{
|
|
"ce_loss": 0.9701,
|
|
"epoch": 0.9593575343209073,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.262121438162017e-06,
|
|
"loss": 0.9701,
|
|
"mean_token_accuracy": 0.7749063238501549,
|
|
"num_tokens": 487910962.0,
|
|
"step": 6630,
|
|
"train_ppl": 2.638147
|
|
},
|
|
{
|
|
"ce_loss": 0.9673,
|
|
"epoch": 0.9608045290936387,
|
|
"grad_norm": 1.140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.2173653587945695e-06,
|
|
"loss": 0.9673,
|
|
"mean_token_accuracy": 0.7772574447095394,
|
|
"num_tokens": 488651402.0,
|
|
"step": 6640,
|
|
"train_ppl": 2.630719
|
|
},
|
|
{
|
|
"ce_loss": 0.9763,
|
|
"epoch": 0.96225152386637,
|
|
"grad_norm": 0.90625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1726092794271224e-06,
|
|
"loss": 0.9763,
|
|
"mean_token_accuracy": 0.7743536755442619,
|
|
"num_tokens": 489384716.0,
|
|
"step": 6650,
|
|
"train_ppl": 2.654588
|
|
},
|
|
{
|
|
"ce_loss": 0.9938,
|
|
"epoch": 0.9636985186391014,
|
|
"grad_norm": 1.2578125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.1278532000596748e-06,
|
|
"loss": 0.9938,
|
|
"mean_token_accuracy": 0.7713238671422005,
|
|
"num_tokens": 490102736.0,
|
|
"step": 6660,
|
|
"train_ppl": 2.701489
|
|
},
|
|
{
|
|
"ce_loss": 0.9418,
|
|
"epoch": 0.9651455134118327,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.0830971206922275e-06,
|
|
"loss": 0.9418,
|
|
"mean_token_accuracy": 0.7814336843788624,
|
|
"num_tokens": 490846680.0,
|
|
"step": 6670,
|
|
"train_ppl": 2.564615
|
|
},
|
|
{
|
|
"ce_loss": 0.9167,
|
|
"epoch": 0.9665925081845642,
|
|
"grad_norm": 1.125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.03834104132478e-06,
|
|
"loss": 0.9167,
|
|
"mean_token_accuracy": 0.7847115240991116,
|
|
"num_tokens": 491610969.0,
|
|
"step": 6680,
|
|
"train_ppl": 2.500937
|
|
},
|
|
{
|
|
"ce_loss": 0.935,
|
|
"epoch": 0.9680395029572956,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.935849619573326e-07,
|
|
"loss": 0.935,
|
|
"mean_token_accuracy": 0.7818123020231724,
|
|
"num_tokens": 492324309.0,
|
|
"step": 6690,
|
|
"train_ppl": 2.547313
|
|
},
|
|
{
|
|
"ce_loss": 0.9192,
|
|
"epoch": 0.9694864977300269,
|
|
"grad_norm": 0.9453125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.488288825898852e-07,
|
|
"loss": 0.9192,
|
|
"mean_token_accuracy": 0.785324689000845,
|
|
"num_tokens": 493060014.0,
|
|
"step": 6700,
|
|
"train_ppl": 2.507398
|
|
},
|
|
{
|
|
"ce_loss": 0.942,
|
|
"epoch": 0.9709334925027583,
|
|
"grad_norm": 0.90234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.040728032224378e-07,
|
|
"loss": 0.942,
|
|
"mean_token_accuracy": 0.7809490516781807,
|
|
"num_tokens": 493814561.0,
|
|
"step": 6710,
|
|
"train_ppl": 2.5651
|
|
},
|
|
{
|
|
"ce_loss": 0.9721,
|
|
"epoch": 0.9723804872754898,
|
|
"grad_norm": 0.98828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.593167238549904e-07,
|
|
"loss": 0.9721,
|
|
"mean_token_accuracy": 0.7768593326210975,
|
|
"num_tokens": 494565870.0,
|
|
"step": 6720,
|
|
"train_ppl": 2.643587
|
|
},
|
|
{
|
|
"ce_loss": 0.9211,
|
|
"epoch": 0.9738274820482211,
|
|
"grad_norm": 0.9296875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.145606444875429e-07,
|
|
"loss": 0.9211,
|
|
"mean_token_accuracy": 0.7829136967658996,
|
|
"num_tokens": 495296800.0,
|
|
"step": 6730,
|
|
"train_ppl": 2.511992
|
|
},
|
|
{
|
|
"ce_loss": 0.939,
|
|
"epoch": 0.9752744768209525,
|
|
"grad_norm": 1.0,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.698045651200955e-07,
|
|
"loss": 0.939,
|
|
"mean_token_accuracy": 0.7814122512936592,
|
|
"num_tokens": 496031622.0,
|
|
"step": 6740,
|
|
"train_ppl": 2.557372
|
|
},
|
|
{
|
|
"ce_loss": 0.9804,
|
|
"epoch": 0.9767214715936838,
|
|
"grad_norm": 1.109375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 7.250484857526481e-07,
|
|
"loss": 0.9804,
|
|
"mean_token_accuracy": 0.7736301675438881,
|
|
"num_tokens": 496761090.0,
|
|
"step": 6750,
|
|
"train_ppl": 2.665465
|
|
},
|
|
{
|
|
"ce_loss": 0.9504,
|
|
"epoch": 0.9781684663664153,
|
|
"grad_norm": 1.171875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.802924063852007e-07,
|
|
"loss": 0.9504,
|
|
"mean_token_accuracy": 0.7740707725286484,
|
|
"num_tokens": 497494104.0,
|
|
"step": 6760,
|
|
"train_ppl": 2.586672
|
|
},
|
|
{
|
|
"ce_loss": 0.9557,
|
|
"epoch": 0.9796154611391467,
|
|
"grad_norm": 1.0078125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 6.355363270177532e-07,
|
|
"loss": 0.9557,
|
|
"mean_token_accuracy": 0.7776445716619491,
|
|
"num_tokens": 498236331.0,
|
|
"step": 6770,
|
|
"train_ppl": 2.600574
|
|
},
|
|
{
|
|
"ce_loss": 0.9616,
|
|
"epoch": 0.981062455911878,
|
|
"grad_norm": 0.99609375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.907802476503058e-07,
|
|
"loss": 0.9616,
|
|
"mean_token_accuracy": 0.779218465089798,
|
|
"num_tokens": 498972935.0,
|
|
"step": 6780,
|
|
"train_ppl": 2.615954
|
|
},
|
|
{
|
|
"ce_loss": 0.9659,
|
|
"epoch": 0.9825094506846094,
|
|
"grad_norm": 0.9140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.460241682828584e-07,
|
|
"loss": 0.9659,
|
|
"mean_token_accuracy": 0.7770897686481476,
|
|
"num_tokens": 499702836.0,
|
|
"step": 6790,
|
|
"train_ppl": 2.627128
|
|
},
|
|
{
|
|
"ce_loss": 0.963,
|
|
"epoch": 0.9839564454573407,
|
|
"grad_norm": 0.86328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.01268088915411e-07,
|
|
"loss": 0.963,
|
|
"mean_token_accuracy": 0.7763608016073704,
|
|
"num_tokens": 500426876.0,
|
|
"step": 6800,
|
|
"train_ppl": 2.61959
|
|
},
|
|
{
|
|
"ce_loss": 0.9661,
|
|
"epoch": 0.9854034402300722,
|
|
"grad_norm": 1.03125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.565120095479636e-07,
|
|
"loss": 0.9661,
|
|
"mean_token_accuracy": 0.7763193972408772,
|
|
"num_tokens": 501156440.0,
|
|
"step": 6810,
|
|
"train_ppl": 2.627785
|
|
},
|
|
{
|
|
"ce_loss": 0.9835,
|
|
"epoch": 0.9868504350028036,
|
|
"grad_norm": 1.1328125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 4.117559301805162e-07,
|
|
"loss": 0.9835,
|
|
"mean_token_accuracy": 0.7768892168998718,
|
|
"num_tokens": 501903400.0,
|
|
"step": 6820,
|
|
"train_ppl": 2.673742
|
|
},
|
|
{
|
|
"ce_loss": 0.9503,
|
|
"epoch": 0.9882974297755349,
|
|
"grad_norm": 0.8828125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.6699985081306876e-07,
|
|
"loss": 0.9503,
|
|
"mean_token_accuracy": 0.7742002509534359,
|
|
"num_tokens": 502621668.0,
|
|
"step": 6830,
|
|
"train_ppl": 2.586448
|
|
},
|
|
{
|
|
"ce_loss": 0.9498,
|
|
"epoch": 0.9897444245482663,
|
|
"grad_norm": 1.0625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 3.222437714456214e-07,
|
|
"loss": 0.9498,
|
|
"mean_token_accuracy": 0.7802133716642856,
|
|
"num_tokens": 503362803.0,
|
|
"step": 6840,
|
|
"train_ppl": 2.585163
|
|
},
|
|
{
|
|
"ce_loss": 0.9616,
|
|
"epoch": 0.9911914193209977,
|
|
"grad_norm": 0.94140625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.7748769207817397e-07,
|
|
"loss": 0.9616,
|
|
"mean_token_accuracy": 0.7740616850554943,
|
|
"num_tokens": 504081933.0,
|
|
"step": 6850,
|
|
"train_ppl": 2.61597
|
|
},
|
|
{
|
|
"ce_loss": 0.9839,
|
|
"epoch": 0.9926384140937291,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 2.3273161271072654e-07,
|
|
"loss": 0.9839,
|
|
"mean_token_accuracy": 0.7735910393297672,
|
|
"num_tokens": 504825189.0,
|
|
"step": 6860,
|
|
"train_ppl": 2.674826
|
|
},
|
|
{
|
|
"ce_loss": 0.9994,
|
|
"epoch": 0.9940854088664605,
|
|
"grad_norm": 1.015625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.8797553334327912e-07,
|
|
"loss": 0.9994,
|
|
"mean_token_accuracy": 0.7692562341690063,
|
|
"num_tokens": 505545177.0,
|
|
"step": 6870,
|
|
"train_ppl": 2.716574
|
|
},
|
|
{
|
|
"ce_loss": 0.9407,
|
|
"epoch": 0.9955324036391918,
|
|
"grad_norm": 0.97265625,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 1.4321945397583173e-07,
|
|
"loss": 0.9407,
|
|
"mean_token_accuracy": 0.7753926180303097,
|
|
"num_tokens": 506272927.0,
|
|
"step": 6880,
|
|
"train_ppl": 2.561663
|
|
},
|
|
{
|
|
"ce_loss": 0.939,
|
|
"epoch": 0.9969793984119233,
|
|
"grad_norm": 1.0234375,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 9.84633746083843e-08,
|
|
"loss": 0.939,
|
|
"mean_token_accuracy": 0.7804414540529251,
|
|
"num_tokens": 507019095.0,
|
|
"step": 6890,
|
|
"train_ppl": 2.557452
|
|
},
|
|
{
|
|
"ce_loss": 0.9604,
|
|
"epoch": 0.9984263931846546,
|
|
"grad_norm": 0.875,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 5.37072952409369e-08,
|
|
"loss": 0.9604,
|
|
"mean_token_accuracy": 0.7800676345825195,
|
|
"num_tokens": 507751520.0,
|
|
"step": 6900,
|
|
"train_ppl": 2.612688
|
|
},
|
|
{
|
|
"ce_loss": 0.9879,
|
|
"epoch": 0.999873387957386,
|
|
"grad_norm": 1.0703125,
|
|
"hf_loss_ratio": 1.0,
|
|
"learning_rate": 8.951215873489483e-09,
|
|
"loss": 0.9879,
|
|
"mean_token_accuracy": 0.7773638620972634,
|
|
"num_tokens": 508477238.0,
|
|
"step": 6910,
|
|
"train_ppl": 2.685598
|
|
},
|
|
{
|
|
"ce_loss": 0.8887,
|
|
"epoch": 1.0,
|
|
"mean_token_accuracy": 0.8112924013819013,
|
|
"num_tokens": 508537895.0,
|
|
"step": 6911,
|
|
"total_flos": 6.189458802853544e+18,
|
|
"train_loss": 0.9857371548739723,
|
|
"train_ppl": 2.431889,
|
|
"train_runtime": 23521.9665,
|
|
"train_samples_per_second": 37.607,
|
|
"train_steps_per_second": 0.294
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 6911,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": false,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 6.189458802853544e+18,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|