2405 lines
68 KiB
JSON
2405 lines
68 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0,
|
|
"eval_steps": 500,
|
|
"global_step": 2375,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 0.4990599287673831,
|
|
"epoch": 0.004210526315789474,
|
|
"grad_norm": 69.0,
|
|
"learning_rate": 6.338028169014085e-07,
|
|
"loss": 1.671738624572754,
|
|
"mean_token_accuracy": 0.7763976119458675,
|
|
"num_tokens": 31553.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 0.4624864859506488,
|
|
"epoch": 0.008421052631578947,
|
|
"grad_norm": 65.0,
|
|
"learning_rate": 1.3380281690140844e-06,
|
|
"loss": 1.5600993156433105,
|
|
"mean_token_accuracy": 0.7901717454195023,
|
|
"num_tokens": 63579.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 0.5733067244291306,
|
|
"epoch": 0.01263157894736842,
|
|
"grad_norm": 54.5,
|
|
"learning_rate": 2.0422535211267608e-06,
|
|
"loss": 1.6138050079345703,
|
|
"mean_token_accuracy": 0.7659219928085804,
|
|
"num_tokens": 92495.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 0.576881331205368,
|
|
"epoch": 0.016842105263157894,
|
|
"grad_norm": 30.75,
|
|
"learning_rate": 2.746478873239437e-06,
|
|
"loss": 1.3854169845581055,
|
|
"mean_token_accuracy": 0.7819479435682297,
|
|
"num_tokens": 122375.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 0.6074449960142374,
|
|
"epoch": 0.021052631578947368,
|
|
"grad_norm": 21.375,
|
|
"learning_rate": 3.4507042253521127e-06,
|
|
"loss": 1.1678359985351563,
|
|
"mean_token_accuracy": 0.788398090749979,
|
|
"num_tokens": 152668.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 0.7060422364622354,
|
|
"epoch": 0.02526315789473684,
|
|
"grad_norm": 12.1875,
|
|
"learning_rate": 4.154929577464789e-06,
|
|
"loss": 0.9693965911865234,
|
|
"mean_token_accuracy": 0.798081835359335,
|
|
"num_tokens": 183863.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 0.741611959785223,
|
|
"epoch": 0.029473684210526315,
|
|
"grad_norm": 12.0,
|
|
"learning_rate": 4.859154929577465e-06,
|
|
"loss": 0.7716450214385986,
|
|
"mean_token_accuracy": 0.8399579018354416,
|
|
"num_tokens": 212992.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 0.6091062590479851,
|
|
"epoch": 0.03368421052631579,
|
|
"grad_norm": 15.0,
|
|
"learning_rate": 4.982638888888889e-06,
|
|
"loss": 0.5984757900238037,
|
|
"mean_token_accuracy": 0.8683908067643642,
|
|
"num_tokens": 242894.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 0.4648941744118929,
|
|
"epoch": 0.037894736842105266,
|
|
"grad_norm": 9.25,
|
|
"learning_rate": 4.9609375e-06,
|
|
"loss": 0.45642986297607424,
|
|
"mean_token_accuracy": 0.8944785602390766,
|
|
"num_tokens": 273459.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 0.3587808248586953,
|
|
"epoch": 0.042105263157894736,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 4.9392361111111115e-06,
|
|
"loss": 0.38718841075897215,
|
|
"mean_token_accuracy": 0.9098845317959785,
|
|
"num_tokens": 305452.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 0.31363106137141583,
|
|
"epoch": 0.04631578947368421,
|
|
"grad_norm": 7.71875,
|
|
"learning_rate": 4.917534722222223e-06,
|
|
"loss": 0.35190615653991697,
|
|
"mean_token_accuracy": 0.9152749516069889,
|
|
"num_tokens": 336691.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 0.30077689900062976,
|
|
"epoch": 0.05052631578947368,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 4.895833333333333e-06,
|
|
"loss": 0.3593594551086426,
|
|
"mean_token_accuracy": 0.9169687710702419,
|
|
"num_tokens": 368879.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 0.2662435117177665,
|
|
"epoch": 0.05473684210526316,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 4.8741319444444444e-06,
|
|
"loss": 0.316438627243042,
|
|
"mean_token_accuracy": 0.9221884422004223,
|
|
"num_tokens": 399165.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 0.26467454619705677,
|
|
"epoch": 0.05894736842105263,
|
|
"grad_norm": 8.8125,
|
|
"learning_rate": 4.8524305555555565e-06,
|
|
"loss": 0.27219557762145996,
|
|
"mean_token_accuracy": 0.9298946231603622,
|
|
"num_tokens": 428931.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 0.2657210439443588,
|
|
"epoch": 0.06315789473684211,
|
|
"grad_norm": 16.875,
|
|
"learning_rate": 4.830729166666667e-06,
|
|
"loss": 0.3098090171813965,
|
|
"mean_token_accuracy": 0.9222414299845696,
|
|
"num_tokens": 458794.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 0.23787126671522857,
|
|
"epoch": 0.06736842105263158,
|
|
"grad_norm": 10.0,
|
|
"learning_rate": 4.809027777777778e-06,
|
|
"loss": 0.2524611711502075,
|
|
"mean_token_accuracy": 0.9230330072343349,
|
|
"num_tokens": 489763.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 0.2247232544235885,
|
|
"epoch": 0.07157894736842105,
|
|
"grad_norm": 10.75,
|
|
"learning_rate": 4.787326388888889e-06,
|
|
"loss": 0.2346771240234375,
|
|
"mean_token_accuracy": 0.93573377430439,
|
|
"num_tokens": 520029.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 0.22070267596282064,
|
|
"epoch": 0.07578947368421053,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 4.765625000000001e-06,
|
|
"loss": 0.21888349056243897,
|
|
"mean_token_accuracy": 0.9352433510124684,
|
|
"num_tokens": 550742.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 0.21396164572797716,
|
|
"epoch": 0.08,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 4.743923611111111e-06,
|
|
"loss": 0.21159236431121825,
|
|
"mean_token_accuracy": 0.9358419619500637,
|
|
"num_tokens": 580071.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 0.20088617503643036,
|
|
"epoch": 0.08421052631578947,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 4.722222222222222e-06,
|
|
"loss": 0.210105037689209,
|
|
"mean_token_accuracy": 0.9405015103518963,
|
|
"num_tokens": 610346.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 0.2197779224254191,
|
|
"epoch": 0.08842105263157894,
|
|
"grad_norm": 6.25,
|
|
"learning_rate": 4.7005208333333335e-06,
|
|
"loss": 0.24622466564178466,
|
|
"mean_token_accuracy": 0.9350829392671585,
|
|
"num_tokens": 640068.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 0.22689010314643382,
|
|
"epoch": 0.09263157894736843,
|
|
"grad_norm": 12.25,
|
|
"learning_rate": 4.678819444444445e-06,
|
|
"loss": 0.25157005786895753,
|
|
"mean_token_accuracy": 0.9245235815644264,
|
|
"num_tokens": 668586.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 0.2026051654946059,
|
|
"epoch": 0.0968421052631579,
|
|
"grad_norm": 11.625,
|
|
"learning_rate": 4.657118055555556e-06,
|
|
"loss": 0.22865614891052247,
|
|
"mean_token_accuracy": 0.9291222095489502,
|
|
"num_tokens": 700113.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 0.20945081664249302,
|
|
"epoch": 0.10105263157894737,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 4.635416666666667e-06,
|
|
"loss": 0.20557198524475098,
|
|
"mean_token_accuracy": 0.9318756103515625,
|
|
"num_tokens": 730359.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 0.1935979576781392,
|
|
"epoch": 0.10526315789473684,
|
|
"grad_norm": 9.75,
|
|
"learning_rate": 4.6137152777777785e-06,
|
|
"loss": 0.20995285511016845,
|
|
"mean_token_accuracy": 0.9389079615473748,
|
|
"num_tokens": 761042.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 0.21530479132197797,
|
|
"epoch": 0.10947368421052632,
|
|
"grad_norm": 10.25,
|
|
"learning_rate": 4.59201388888889e-06,
|
|
"loss": 0.21937789916992187,
|
|
"mean_token_accuracy": 0.9335255794227123,
|
|
"num_tokens": 792117.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 0.24162108548916877,
|
|
"epoch": 0.11368421052631579,
|
|
"grad_norm": 10.5,
|
|
"learning_rate": 4.5703125e-06,
|
|
"loss": 0.2889341115951538,
|
|
"mean_token_accuracy": 0.9264158695936203,
|
|
"num_tokens": 822509.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 0.22190025104209782,
|
|
"epoch": 0.11789473684210526,
|
|
"grad_norm": 9.4375,
|
|
"learning_rate": 4.548611111111111e-06,
|
|
"loss": 0.22677860260009766,
|
|
"mean_token_accuracy": 0.9339636966586113,
|
|
"num_tokens": 852474.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 0.21453084875829517,
|
|
"epoch": 0.12210526315789473,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 4.526909722222223e-06,
|
|
"loss": 0.20040695667266845,
|
|
"mean_token_accuracy": 0.9411987900733948,
|
|
"num_tokens": 882821.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 0.2034795220475644,
|
|
"epoch": 0.12631578947368421,
|
|
"grad_norm": 12.6875,
|
|
"learning_rate": 4.505208333333334e-06,
|
|
"loss": 0.24240901470184326,
|
|
"mean_token_accuracy": 0.9343540959060193,
|
|
"num_tokens": 913298.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 0.20725304959341884,
|
|
"epoch": 0.13052631578947368,
|
|
"grad_norm": 10.25,
|
|
"learning_rate": 4.483506944444444e-06,
|
|
"loss": 0.22464065551757811,
|
|
"mean_token_accuracy": 0.9300798162817955,
|
|
"num_tokens": 944669.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 0.18791212746873498,
|
|
"epoch": 0.13473684210526315,
|
|
"grad_norm": 8.0,
|
|
"learning_rate": 4.461805555555556e-06,
|
|
"loss": 0.17531607151031495,
|
|
"mean_token_accuracy": 0.9410846054553985,
|
|
"num_tokens": 973038.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 0.1887997885234654,
|
|
"epoch": 0.13894736842105262,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 4.440104166666668e-06,
|
|
"loss": 0.20259859561920165,
|
|
"mean_token_accuracy": 0.9379140719771385,
|
|
"num_tokens": 1003504.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 0.21206430648453534,
|
|
"epoch": 0.1431578947368421,
|
|
"grad_norm": 8.625,
|
|
"learning_rate": 4.418402777777778e-06,
|
|
"loss": 0.24106347560882568,
|
|
"mean_token_accuracy": 0.9289649538695812,
|
|
"num_tokens": 1032582.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 0.1938377027399838,
|
|
"epoch": 0.14736842105263157,
|
|
"grad_norm": 9.5,
|
|
"learning_rate": 4.396701388888889e-06,
|
|
"loss": 0.19278082847595215,
|
|
"mean_token_accuracy": 0.9380026146769523,
|
|
"num_tokens": 1064109.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 0.1793072429485619,
|
|
"epoch": 0.15157894736842106,
|
|
"grad_norm": 7.65625,
|
|
"learning_rate": 4.3750000000000005e-06,
|
|
"loss": 0.18131839036941527,
|
|
"mean_token_accuracy": 0.9433922998607158,
|
|
"num_tokens": 1094818.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 0.19749868060462178,
|
|
"epoch": 0.15578947368421053,
|
|
"grad_norm": 4.75,
|
|
"learning_rate": 4.353298611111112e-06,
|
|
"loss": 0.18917640447616577,
|
|
"mean_token_accuracy": 0.9424469873309136,
|
|
"num_tokens": 1123344.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 0.1859517907258123,
|
|
"epoch": 0.16,
|
|
"grad_norm": 10.375,
|
|
"learning_rate": 4.331597222222222e-06,
|
|
"loss": 0.19585838317871093,
|
|
"mean_token_accuracy": 0.9397093847393989,
|
|
"num_tokens": 1154149.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 0.17284040013328195,
|
|
"epoch": 0.16421052631578947,
|
|
"grad_norm": 14.3125,
|
|
"learning_rate": 4.309895833333333e-06,
|
|
"loss": 0.16065752506256104,
|
|
"mean_token_accuracy": 0.9468757703900337,
|
|
"num_tokens": 1185496.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 0.2033068159595132,
|
|
"epoch": 0.16842105263157894,
|
|
"grad_norm": 9.0,
|
|
"learning_rate": 4.288194444444445e-06,
|
|
"loss": 0.22716670036315917,
|
|
"mean_token_accuracy": 0.9365929305553437,
|
|
"num_tokens": 1215776.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 0.20319096064195036,
|
|
"epoch": 0.1726315789473684,
|
|
"grad_norm": 9.3125,
|
|
"learning_rate": 4.266493055555556e-06,
|
|
"loss": 0.2225698471069336,
|
|
"mean_token_accuracy": 0.9277164503931999,
|
|
"num_tokens": 1245574.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 0.1901295615825802,
|
|
"epoch": 0.17684210526315788,
|
|
"grad_norm": 10.375,
|
|
"learning_rate": 4.244791666666667e-06,
|
|
"loss": 0.22110774517059326,
|
|
"mean_token_accuracy": 0.9325532615184784,
|
|
"num_tokens": 1274979.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 0.19151646881364287,
|
|
"epoch": 0.18105263157894738,
|
|
"grad_norm": 6.9375,
|
|
"learning_rate": 4.223090277777778e-06,
|
|
"loss": 0.1919734835624695,
|
|
"mean_token_accuracy": 0.9378305852413178,
|
|
"num_tokens": 1306036.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 0.2085381604731083,
|
|
"epoch": 0.18526315789473685,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 4.2013888888888896e-06,
|
|
"loss": 0.21823127269744874,
|
|
"mean_token_accuracy": 0.9345854863524437,
|
|
"num_tokens": 1335047.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 0.2007679786067456,
|
|
"epoch": 0.18947368421052632,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 4.1796875e-06,
|
|
"loss": 0.21735711097717286,
|
|
"mean_token_accuracy": 0.9340473741292954,
|
|
"num_tokens": 1366790.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 0.17802681485190988,
|
|
"epoch": 0.1936842105263158,
|
|
"grad_norm": 5.34375,
|
|
"learning_rate": 4.157986111111111e-06,
|
|
"loss": 0.19400970935821532,
|
|
"mean_token_accuracy": 0.9380262985825538,
|
|
"num_tokens": 1394887.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 0.21595997624099256,
|
|
"epoch": 0.19789473684210526,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 4.1362847222222224e-06,
|
|
"loss": 0.22792208194732666,
|
|
"mean_token_accuracy": 0.9314667269587517,
|
|
"num_tokens": 1425391.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 0.18051641024649143,
|
|
"epoch": 0.20210526315789473,
|
|
"grad_norm": 4.9375,
|
|
"learning_rate": 4.114583333333334e-06,
|
|
"loss": 0.19123028516769408,
|
|
"mean_token_accuracy": 0.9385565176606179,
|
|
"num_tokens": 1453952.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 0.2041733751539141,
|
|
"epoch": 0.2063157894736842,
|
|
"grad_norm": 11.1875,
|
|
"learning_rate": 4.092881944444445e-06,
|
|
"loss": 0.21048731803894044,
|
|
"mean_token_accuracy": 0.9365776918828488,
|
|
"num_tokens": 1487071.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 0.17413038527593017,
|
|
"epoch": 0.21052631578947367,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 4.071180555555556e-06,
|
|
"loss": 0.1920235872268677,
|
|
"mean_token_accuracy": 0.9346710205078125,
|
|
"num_tokens": 1518557.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 0.1804610774386674,
|
|
"epoch": 0.21473684210526317,
|
|
"grad_norm": 6.71875,
|
|
"learning_rate": 4.049479166666667e-06,
|
|
"loss": 0.18783496618270873,
|
|
"mean_token_accuracy": 0.9396589122712612,
|
|
"num_tokens": 1548878.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 0.19870298462919891,
|
|
"epoch": 0.21894736842105264,
|
|
"grad_norm": 10.5,
|
|
"learning_rate": 4.027777777777779e-06,
|
|
"loss": 0.20456252098083497,
|
|
"mean_token_accuracy": 0.93275361135602,
|
|
"num_tokens": 1581157.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 0.18834507754072546,
|
|
"epoch": 0.2231578947368421,
|
|
"grad_norm": 9.5,
|
|
"learning_rate": 4.006076388888889e-06,
|
|
"loss": 0.1853790521621704,
|
|
"mean_token_accuracy": 0.9434393145143986,
|
|
"num_tokens": 1612111.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 0.18060610676184297,
|
|
"epoch": 0.22736842105263158,
|
|
"grad_norm": 10.875,
|
|
"learning_rate": 3.984375e-06,
|
|
"loss": 0.18703898191452026,
|
|
"mean_token_accuracy": 0.940553817898035,
|
|
"num_tokens": 1643714.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 0.2124157869257033,
|
|
"epoch": 0.23157894736842105,
|
|
"grad_norm": 16.375,
|
|
"learning_rate": 3.9626736111111115e-06,
|
|
"loss": 0.23256590366363525,
|
|
"mean_token_accuracy": 0.931666910648346,
|
|
"num_tokens": 1674981.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 0.18916954104788603,
|
|
"epoch": 0.23578947368421052,
|
|
"grad_norm": 8.625,
|
|
"learning_rate": 3.940972222222223e-06,
|
|
"loss": 0.20892608165740967,
|
|
"mean_token_accuracy": 0.9369244277477264,
|
|
"num_tokens": 1704650.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 0.18540409342385827,
|
|
"epoch": 0.24,
|
|
"grad_norm": 10.75,
|
|
"learning_rate": 3.919270833333333e-06,
|
|
"loss": 0.1709328293800354,
|
|
"mean_token_accuracy": 0.9410766020417214,
|
|
"num_tokens": 1736731.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 0.1986150752287358,
|
|
"epoch": 0.24421052631578946,
|
|
"grad_norm": 12.3125,
|
|
"learning_rate": 3.897569444444444e-06,
|
|
"loss": 0.22206108570098876,
|
|
"mean_token_accuracy": 0.9357864424586296,
|
|
"num_tokens": 1768488.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 0.1802667098119855,
|
|
"epoch": 0.24842105263157896,
|
|
"grad_norm": 6.375,
|
|
"learning_rate": 3.8758680555555565e-06,
|
|
"loss": 0.18710933923721312,
|
|
"mean_token_accuracy": 0.9412250213325024,
|
|
"num_tokens": 1799166.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 0.17089016041718424,
|
|
"epoch": 0.25263157894736843,
|
|
"grad_norm": 12.0,
|
|
"learning_rate": 3.854166666666667e-06,
|
|
"loss": 0.18744715452194213,
|
|
"mean_token_accuracy": 0.9394571520388126,
|
|
"num_tokens": 1830122.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 0.20793215851299465,
|
|
"epoch": 0.25684210526315787,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 3.832465277777778e-06,
|
|
"loss": 0.234443998336792,
|
|
"mean_token_accuracy": 0.9333168506622315,
|
|
"num_tokens": 1862016.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 0.20435764044523239,
|
|
"epoch": 0.26105263157894737,
|
|
"grad_norm": 5.78125,
|
|
"learning_rate": 3.8107638888888894e-06,
|
|
"loss": 0.23094916343688965,
|
|
"mean_token_accuracy": 0.9356762997806072,
|
|
"num_tokens": 1893262.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 0.16803635912947357,
|
|
"epoch": 0.26526315789473687,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 3.7890625e-06,
|
|
"loss": 0.17021799087524414,
|
|
"mean_token_accuracy": 0.9433802559971809,
|
|
"num_tokens": 1926661.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 0.1832001986913383,
|
|
"epoch": 0.2694736842105263,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 3.7673611111111114e-06,
|
|
"loss": 0.19909589290618895,
|
|
"mean_token_accuracy": 0.9378570787608623,
|
|
"num_tokens": 1957342.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 0.1613461917731911,
|
|
"epoch": 0.2736842105263158,
|
|
"grad_norm": 6.0,
|
|
"learning_rate": 3.7456597222222223e-06,
|
|
"loss": 0.16491103172302246,
|
|
"mean_token_accuracy": 0.9445122793316841,
|
|
"num_tokens": 1988112.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 0.19069023090414702,
|
|
"epoch": 0.27789473684210525,
|
|
"grad_norm": 10.8125,
|
|
"learning_rate": 3.7239583333333335e-06,
|
|
"loss": 0.19739652872085572,
|
|
"mean_token_accuracy": 0.9412198103964329,
|
|
"num_tokens": 2018814.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 0.19063587812706828,
|
|
"epoch": 0.28210526315789475,
|
|
"grad_norm": 6.0,
|
|
"learning_rate": 3.7022569444444443e-06,
|
|
"loss": 0.19181153774261475,
|
|
"mean_token_accuracy": 0.9380034580826759,
|
|
"num_tokens": 2049341.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 0.19904036330990493,
|
|
"epoch": 0.2863157894736842,
|
|
"grad_norm": 12.5625,
|
|
"learning_rate": 3.680555555555556e-06,
|
|
"loss": 0.20599710941314697,
|
|
"mean_token_accuracy": 0.9368999592959881,
|
|
"num_tokens": 2079296.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 0.19427463631145656,
|
|
"epoch": 0.2905263157894737,
|
|
"grad_norm": 5.71875,
|
|
"learning_rate": 3.6588541666666672e-06,
|
|
"loss": 0.18761125802993775,
|
|
"mean_token_accuracy": 0.9367304682731629,
|
|
"num_tokens": 2109208.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 0.16103245173580943,
|
|
"epoch": 0.29473684210526313,
|
|
"grad_norm": 4.03125,
|
|
"learning_rate": 3.637152777777778e-06,
|
|
"loss": 0.14467405080795287,
|
|
"mean_token_accuracy": 0.9430748097598552,
|
|
"num_tokens": 2140169.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 0.18653456503525376,
|
|
"epoch": 0.29894736842105263,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 3.6154513888888893e-06,
|
|
"loss": 0.19110026359558105,
|
|
"mean_token_accuracy": 0.9356968715786934,
|
|
"num_tokens": 2169188.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 0.1778560657054186,
|
|
"epoch": 0.3031578947368421,
|
|
"grad_norm": 5.84375,
|
|
"learning_rate": 3.59375e-06,
|
|
"loss": 0.19346174001693725,
|
|
"mean_token_accuracy": 0.9388452127575875,
|
|
"num_tokens": 2201132.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 0.1761186286341399,
|
|
"epoch": 0.30736842105263157,
|
|
"grad_norm": 6.1875,
|
|
"learning_rate": 3.5720486111111114e-06,
|
|
"loss": 0.17763736248016357,
|
|
"mean_token_accuracy": 0.9394733160734177,
|
|
"num_tokens": 2231368.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 0.2061962445732206,
|
|
"epoch": 0.31157894736842107,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 3.5503472222222226e-06,
|
|
"loss": 0.21218445301055908,
|
|
"mean_token_accuracy": 0.9361796006560326,
|
|
"num_tokens": 2260621.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 0.18782778745517134,
|
|
"epoch": 0.3157894736842105,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 3.5286458333333334e-06,
|
|
"loss": 0.21144359111785888,
|
|
"mean_token_accuracy": 0.9322924494743348,
|
|
"num_tokens": 2292074.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 0.16837490680627526,
|
|
"epoch": 0.32,
|
|
"grad_norm": 8.9375,
|
|
"learning_rate": 3.5069444444444447e-06,
|
|
"loss": 0.17376952171325682,
|
|
"mean_token_accuracy": 0.9448926664888859,
|
|
"num_tokens": 2321255.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 0.1900732083246112,
|
|
"epoch": 0.32421052631578945,
|
|
"grad_norm": 9.75,
|
|
"learning_rate": 3.485243055555556e-06,
|
|
"loss": 0.21094374656677245,
|
|
"mean_token_accuracy": 0.9347058288753033,
|
|
"num_tokens": 2352817.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 0.19717438989318908,
|
|
"epoch": 0.32842105263157895,
|
|
"grad_norm": 9.125,
|
|
"learning_rate": 3.463541666666667e-06,
|
|
"loss": 0.19277981519699097,
|
|
"mean_token_accuracy": 0.9365353070199489,
|
|
"num_tokens": 2382010.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 0.18062740950845182,
|
|
"epoch": 0.33263157894736844,
|
|
"grad_norm": 7.21875,
|
|
"learning_rate": 3.4418402777777784e-06,
|
|
"loss": 0.1980929493904114,
|
|
"mean_token_accuracy": 0.9367008984088898,
|
|
"num_tokens": 2413871.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 0.18262718091718852,
|
|
"epoch": 0.3368421052631579,
|
|
"grad_norm": 11.375,
|
|
"learning_rate": 3.420138888888889e-06,
|
|
"loss": 0.21326255798339844,
|
|
"mean_token_accuracy": 0.939043466001749,
|
|
"num_tokens": 2443556.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 0.1931037397123873,
|
|
"epoch": 0.3410526315789474,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 3.3984375000000004e-06,
|
|
"loss": 0.2050724744796753,
|
|
"mean_token_accuracy": 0.9386087417602539,
|
|
"num_tokens": 2472709.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 0.17652380443178117,
|
|
"epoch": 0.3452631578947368,
|
|
"grad_norm": 9.8125,
|
|
"learning_rate": 3.3767361111111113e-06,
|
|
"loss": 0.18632233142852783,
|
|
"mean_token_accuracy": 0.9410148099064827,
|
|
"num_tokens": 2502787.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 0.18900102768093346,
|
|
"epoch": 0.3494736842105263,
|
|
"grad_norm": 20.75,
|
|
"learning_rate": 3.3550347222222225e-06,
|
|
"loss": 0.20314161777496337,
|
|
"mean_token_accuracy": 0.9356084302067756,
|
|
"num_tokens": 2534024.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 0.1738276852760464,
|
|
"epoch": 0.35368421052631577,
|
|
"grad_norm": 10.1875,
|
|
"learning_rate": 3.3333333333333333e-06,
|
|
"loss": 0.19026525020599366,
|
|
"mean_token_accuracy": 0.9386918649077416,
|
|
"num_tokens": 2565340.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 0.17577651813626288,
|
|
"epoch": 0.35789473684210527,
|
|
"grad_norm": 18.375,
|
|
"learning_rate": 3.3116319444444446e-06,
|
|
"loss": 0.1828848600387573,
|
|
"mean_token_accuracy": 0.9417739301919937,
|
|
"num_tokens": 2594835.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 0.19011623142287135,
|
|
"epoch": 0.36210526315789476,
|
|
"grad_norm": 10.25,
|
|
"learning_rate": 3.2899305555555562e-06,
|
|
"loss": 0.20780632495880128,
|
|
"mean_token_accuracy": 0.9356612503528595,
|
|
"num_tokens": 2625348.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 0.17401062482967972,
|
|
"epoch": 0.3663157894736842,
|
|
"grad_norm": 9.5,
|
|
"learning_rate": 3.268229166666667e-06,
|
|
"loss": 0.19232455492019654,
|
|
"mean_token_accuracy": 0.9413411311805249,
|
|
"num_tokens": 2656663.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 0.2042026157025248,
|
|
"epoch": 0.3705263157894737,
|
|
"grad_norm": 5.625,
|
|
"learning_rate": 3.2465277777777783e-06,
|
|
"loss": 0.21286656856536865,
|
|
"mean_token_accuracy": 0.9318742267787457,
|
|
"num_tokens": 2686890.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 0.18489634501747787,
|
|
"epoch": 0.37473684210526315,
|
|
"grad_norm": 5.875,
|
|
"learning_rate": 3.224826388888889e-06,
|
|
"loss": 0.1951343297958374,
|
|
"mean_token_accuracy": 0.9396946728229523,
|
|
"num_tokens": 2716021.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 0.1702876826748252,
|
|
"epoch": 0.37894736842105264,
|
|
"grad_norm": 4.5,
|
|
"learning_rate": 3.2031250000000004e-06,
|
|
"loss": 0.20316264629364014,
|
|
"mean_token_accuracy": 0.9405752472579479,
|
|
"num_tokens": 2746087.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 0.17025947191286833,
|
|
"epoch": 0.3831578947368421,
|
|
"grad_norm": 5.40625,
|
|
"learning_rate": 3.181423611111111e-06,
|
|
"loss": 0.1797630548477173,
|
|
"mean_token_accuracy": 0.9427746705710888,
|
|
"num_tokens": 2775880.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 0.2002503348980099,
|
|
"epoch": 0.3873684210526316,
|
|
"grad_norm": 8.6875,
|
|
"learning_rate": 3.1597222222222224e-06,
|
|
"loss": 0.19509780406951904,
|
|
"mean_token_accuracy": 0.9372896805405617,
|
|
"num_tokens": 2806354.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 0.18012529672123492,
|
|
"epoch": 0.391578947368421,
|
|
"grad_norm": 4.40625,
|
|
"learning_rate": 3.1380208333333332e-06,
|
|
"loss": 0.1744396448135376,
|
|
"mean_token_accuracy": 0.9429976627230644,
|
|
"num_tokens": 2838779.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 0.1940267413854599,
|
|
"epoch": 0.3957894736842105,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 3.1163194444444445e-06,
|
|
"loss": 0.19945181608200074,
|
|
"mean_token_accuracy": 0.9355903774499893,
|
|
"num_tokens": 2870567.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 0.1718983714701608,
|
|
"epoch": 0.4,
|
|
"grad_norm": 11.0,
|
|
"learning_rate": 3.094618055555556e-06,
|
|
"loss": 0.16918015480041504,
|
|
"mean_token_accuracy": 0.9435592129826545,
|
|
"num_tokens": 2900643.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 0.17784137637354433,
|
|
"epoch": 0.40421052631578946,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 3.072916666666667e-06,
|
|
"loss": 0.18423346281051636,
|
|
"mean_token_accuracy": 0.9385634325444698,
|
|
"num_tokens": 2931200.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 0.21101772908587008,
|
|
"epoch": 0.40842105263157896,
|
|
"grad_norm": 11.6875,
|
|
"learning_rate": 3.051215277777778e-06,
|
|
"loss": 0.2702996253967285,
|
|
"mean_token_accuracy": 0.9345157586038113,
|
|
"num_tokens": 2962480.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 0.17290567103773355,
|
|
"epoch": 0.4126315789473684,
|
|
"grad_norm": 10.8125,
|
|
"learning_rate": 3.029513888888889e-06,
|
|
"loss": 0.17511870861053466,
|
|
"mean_token_accuracy": 0.942404218018055,
|
|
"num_tokens": 2993860.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 0.16266593500040472,
|
|
"epoch": 0.4168421052631579,
|
|
"grad_norm": 8.3125,
|
|
"learning_rate": 3.0078125000000003e-06,
|
|
"loss": 0.1581684708595276,
|
|
"mean_token_accuracy": 0.9443985551595688,
|
|
"num_tokens": 3025733.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 0.1775346302194521,
|
|
"epoch": 0.42105263157894735,
|
|
"grad_norm": 4.4375,
|
|
"learning_rate": 2.986111111111111e-06,
|
|
"loss": 0.18650579452514648,
|
|
"mean_token_accuracy": 0.938476724177599,
|
|
"num_tokens": 3055975.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 0.1736095615196973,
|
|
"epoch": 0.42526315789473684,
|
|
"grad_norm": 9.125,
|
|
"learning_rate": 2.9644097222222223e-06,
|
|
"loss": 0.18074491024017333,
|
|
"mean_token_accuracy": 0.9398947678506374,
|
|
"num_tokens": 3086913.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 0.1699895558413118,
|
|
"epoch": 0.42947368421052634,
|
|
"grad_norm": 8.6875,
|
|
"learning_rate": 2.9427083333333336e-06,
|
|
"loss": 0.19113610982894896,
|
|
"mean_token_accuracy": 0.9418164797127246,
|
|
"num_tokens": 3121488.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 0.16524689896032213,
|
|
"epoch": 0.4336842105263158,
|
|
"grad_norm": 8.75,
|
|
"learning_rate": 2.9210069444444444e-06,
|
|
"loss": 0.185565721988678,
|
|
"mean_token_accuracy": 0.9433472394943238,
|
|
"num_tokens": 3151445.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 0.14927028636448086,
|
|
"epoch": 0.4378947368421053,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 2.899305555555556e-06,
|
|
"loss": 0.15171147584915162,
|
|
"mean_token_accuracy": 0.9442741066217423,
|
|
"num_tokens": 3181370.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 0.18830096670426427,
|
|
"epoch": 0.4421052631578947,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 2.8776041666666673e-06,
|
|
"loss": 0.19921324253082276,
|
|
"mean_token_accuracy": 0.9361335694789886,
|
|
"num_tokens": 3212914.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 0.19236768442206084,
|
|
"epoch": 0.4463157894736842,
|
|
"grad_norm": 6.3125,
|
|
"learning_rate": 2.855902777777778e-06,
|
|
"loss": 0.20824000835418702,
|
|
"mean_token_accuracy": 0.9332416817545891,
|
|
"num_tokens": 3243370.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 0.19136800640262663,
|
|
"epoch": 0.45052631578947366,
|
|
"grad_norm": 6.5625,
|
|
"learning_rate": 2.8342013888888894e-06,
|
|
"loss": 0.1997889280319214,
|
|
"mean_token_accuracy": 0.9408642463386059,
|
|
"num_tokens": 3273424.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 0.17793954727239908,
|
|
"epoch": 0.45473684210526316,
|
|
"grad_norm": 10.625,
|
|
"learning_rate": 2.8125e-06,
|
|
"loss": 0.20664634704589843,
|
|
"mean_token_accuracy": 0.9388046510517597,
|
|
"num_tokens": 3303150.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 0.18900100397877395,
|
|
"epoch": 0.4589473684210526,
|
|
"grad_norm": 8.875,
|
|
"learning_rate": 2.7907986111111114e-06,
|
|
"loss": 0.2337502956390381,
|
|
"mean_token_accuracy": 0.9378764137625695,
|
|
"num_tokens": 3332125.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 0.2013873849529773,
|
|
"epoch": 0.4631578947368421,
|
|
"grad_norm": 4.90625,
|
|
"learning_rate": 2.7690972222222222e-06,
|
|
"loss": 0.2129305362701416,
|
|
"mean_token_accuracy": 0.9356573522090912,
|
|
"num_tokens": 3360726.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 0.16724729198031127,
|
|
"epoch": 0.4673684210526316,
|
|
"grad_norm": 6.78125,
|
|
"learning_rate": 2.7473958333333335e-06,
|
|
"loss": 0.17267029285430907,
|
|
"mean_token_accuracy": 0.9430627137422561,
|
|
"num_tokens": 3392537.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 0.1968531704682391,
|
|
"epoch": 0.47157894736842104,
|
|
"grad_norm": 6.40625,
|
|
"learning_rate": 2.7256944444444443e-06,
|
|
"loss": 0.2131186008453369,
|
|
"mean_token_accuracy": 0.9392065338790416,
|
|
"num_tokens": 3421034.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 0.18952712146565318,
|
|
"epoch": 0.47578947368421054,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 2.703993055555556e-06,
|
|
"loss": 0.1882106900215149,
|
|
"mean_token_accuracy": 0.9399594850838184,
|
|
"num_tokens": 3451236.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 0.16791359800845385,
|
|
"epoch": 0.48,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 2.682291666666667e-06,
|
|
"loss": 0.19798815250396729,
|
|
"mean_token_accuracy": 0.9428666599094868,
|
|
"num_tokens": 3483037.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 0.18943570028059184,
|
|
"epoch": 0.4842105263157895,
|
|
"grad_norm": 7.0625,
|
|
"learning_rate": 2.660590277777778e-06,
|
|
"loss": 0.18464272022247313,
|
|
"mean_token_accuracy": 0.938535039126873,
|
|
"num_tokens": 3512682.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 0.18527938476763667,
|
|
"epoch": 0.4884210526315789,
|
|
"grad_norm": 7.1875,
|
|
"learning_rate": 2.6388888888888893e-06,
|
|
"loss": 0.21876392364501954,
|
|
"mean_token_accuracy": 0.9350791074335575,
|
|
"num_tokens": 3542555.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 0.17846323440317063,
|
|
"epoch": 0.4926315789473684,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 2.6171875e-06,
|
|
"loss": 0.18390936851501466,
|
|
"mean_token_accuracy": 0.9420042358338833,
|
|
"num_tokens": 3574058.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 0.19397271373309194,
|
|
"epoch": 0.4968421052631579,
|
|
"grad_norm": 6.0625,
|
|
"learning_rate": 2.5954861111111113e-06,
|
|
"loss": 0.1811495304107666,
|
|
"mean_token_accuracy": 0.9370748721063137,
|
|
"num_tokens": 3606475.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 0.15141290938481688,
|
|
"epoch": 0.5010526315789474,
|
|
"grad_norm": 6.5,
|
|
"learning_rate": 2.573784722222222e-06,
|
|
"loss": 0.15798022747039794,
|
|
"mean_token_accuracy": 0.9513927109539508,
|
|
"num_tokens": 3638662.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 0.18826927775517105,
|
|
"epoch": 0.5052631578947369,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 2.5520833333333334e-06,
|
|
"loss": 0.18200069665908813,
|
|
"mean_token_accuracy": 0.9414383672177792,
|
|
"num_tokens": 3669896.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 0.20096497626509519,
|
|
"epoch": 0.5094736842105263,
|
|
"grad_norm": 13.4375,
|
|
"learning_rate": 2.530381944444444e-06,
|
|
"loss": 0.22587316036224364,
|
|
"mean_token_accuracy": 0.9326581291854381,
|
|
"num_tokens": 3698316.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 0.19803793909959494,
|
|
"epoch": 0.5136842105263157,
|
|
"grad_norm": 8.625,
|
|
"learning_rate": 2.508680555555556e-06,
|
|
"loss": 0.21513104438781738,
|
|
"mean_token_accuracy": 0.9399372972548008,
|
|
"num_tokens": 3728552.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 0.16103445165790617,
|
|
"epoch": 0.5178947368421053,
|
|
"grad_norm": 9.6875,
|
|
"learning_rate": 2.4869791666666667e-06,
|
|
"loss": 0.17716561555862426,
|
|
"mean_token_accuracy": 0.9383736155927181,
|
|
"num_tokens": 3761109.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 0.17295233584009112,
|
|
"epoch": 0.5221052631578947,
|
|
"grad_norm": 7.3125,
|
|
"learning_rate": 2.465277777777778e-06,
|
|
"loss": 0.1894593596458435,
|
|
"mean_token_accuracy": 0.9400911360979081,
|
|
"num_tokens": 3790881.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 0.1784422152210027,
|
|
"epoch": 0.5263157894736842,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 2.443576388888889e-06,
|
|
"loss": 0.1849764585494995,
|
|
"mean_token_accuracy": 0.94148775562644,
|
|
"num_tokens": 3820940.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 0.2000632504466921,
|
|
"epoch": 0.5305263157894737,
|
|
"grad_norm": 9.375,
|
|
"learning_rate": 2.421875e-06,
|
|
"loss": 0.20038533210754395,
|
|
"mean_token_accuracy": 0.9400728508830071,
|
|
"num_tokens": 3849110.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 0.1836847463157028,
|
|
"epoch": 0.5347368421052632,
|
|
"grad_norm": 13.8125,
|
|
"learning_rate": 2.4001736111111112e-06,
|
|
"loss": 0.1924800157546997,
|
|
"mean_token_accuracy": 0.941128908097744,
|
|
"num_tokens": 3879147.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 0.16738553042523563,
|
|
"epoch": 0.5389473684210526,
|
|
"grad_norm": 8.9375,
|
|
"learning_rate": 2.3784722222222225e-06,
|
|
"loss": 0.16631866693496705,
|
|
"mean_token_accuracy": 0.9407841734588146,
|
|
"num_tokens": 3912281.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 0.18249022141098975,
|
|
"epoch": 0.5431578947368421,
|
|
"grad_norm": 7.5625,
|
|
"learning_rate": 2.3567708333333337e-06,
|
|
"loss": 0.20991320610046388,
|
|
"mean_token_accuracy": 0.9392150454223156,
|
|
"num_tokens": 3942679.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 0.19449416091665625,
|
|
"epoch": 0.5473684210526316,
|
|
"grad_norm": 5.96875,
|
|
"learning_rate": 2.3350694444444445e-06,
|
|
"loss": 0.20127761363983154,
|
|
"mean_token_accuracy": 0.9419910401105881,
|
|
"num_tokens": 3973714.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 0.18408903060480952,
|
|
"epoch": 0.5515789473684211,
|
|
"grad_norm": 6.5,
|
|
"learning_rate": 2.3133680555555558e-06,
|
|
"loss": 0.18167479038238527,
|
|
"mean_token_accuracy": 0.940599375218153,
|
|
"num_tokens": 4003672.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 0.17429547207430005,
|
|
"epoch": 0.5557894736842105,
|
|
"grad_norm": 6.0,
|
|
"learning_rate": 2.2916666666666666e-06,
|
|
"loss": 0.17235063314437865,
|
|
"mean_token_accuracy": 0.9425551310181618,
|
|
"num_tokens": 4033615.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 0.19979104902595282,
|
|
"epoch": 0.56,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 2.2699652777777783e-06,
|
|
"loss": 0.19923921823501586,
|
|
"mean_token_accuracy": 0.9354177258908749,
|
|
"num_tokens": 4063157.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 0.172834698157385,
|
|
"epoch": 0.5642105263157895,
|
|
"grad_norm": 9.0625,
|
|
"learning_rate": 2.248263888888889e-06,
|
|
"loss": 0.16350815296173096,
|
|
"mean_token_accuracy": 0.9458058536052704,
|
|
"num_tokens": 4096030.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 0.16383765279315413,
|
|
"epoch": 0.5684210526315789,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 2.2265625000000003e-06,
|
|
"loss": 0.16651760339736937,
|
|
"mean_token_accuracy": 0.9458472564816475,
|
|
"num_tokens": 4128179.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 0.17017353922128678,
|
|
"epoch": 0.5726315789473684,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 2.204861111111111e-06,
|
|
"loss": 0.19026347398757934,
|
|
"mean_token_accuracy": 0.9381780102849007,
|
|
"num_tokens": 4155994.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 0.1771279716398567,
|
|
"epoch": 0.5768421052631579,
|
|
"grad_norm": 5.71875,
|
|
"learning_rate": 2.1831597222222224e-06,
|
|
"loss": 0.19147398471832275,
|
|
"mean_token_accuracy": 0.9430553078651428,
|
|
"num_tokens": 4186351.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 0.19348430414684117,
|
|
"epoch": 0.5810526315789474,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 2.1614583333333336e-06,
|
|
"loss": 0.1967188000679016,
|
|
"mean_token_accuracy": 0.9417100548744202,
|
|
"num_tokens": 4217267.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 0.1781235427595675,
|
|
"epoch": 0.5852631578947368,
|
|
"grad_norm": 9.6875,
|
|
"learning_rate": 2.1397569444444445e-06,
|
|
"loss": 0.1788840651512146,
|
|
"mean_token_accuracy": 0.9439761303365231,
|
|
"num_tokens": 4245898.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 0.18975053504109382,
|
|
"epoch": 0.5894736842105263,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 2.1180555555555557e-06,
|
|
"loss": 0.20416486263275146,
|
|
"mean_token_accuracy": 0.9330022357404232,
|
|
"num_tokens": 4276408.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 0.15169767290353775,
|
|
"epoch": 0.5936842105263158,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 2.096354166666667e-06,
|
|
"loss": 0.1466461420059204,
|
|
"mean_token_accuracy": 0.9468090102076531,
|
|
"num_tokens": 4306229.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 0.17125667606014758,
|
|
"epoch": 0.5978947368421053,
|
|
"grad_norm": 11.5625,
|
|
"learning_rate": 2.074652777777778e-06,
|
|
"loss": 0.17265563011169432,
|
|
"mean_token_accuracy": 0.9404310546815395,
|
|
"num_tokens": 4336858.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 0.18555003069341183,
|
|
"epoch": 0.6021052631578947,
|
|
"grad_norm": 10.4375,
|
|
"learning_rate": 2.052951388888889e-06,
|
|
"loss": 0.21136150360107422,
|
|
"mean_token_accuracy": 0.9409567311406135,
|
|
"num_tokens": 4369258.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 0.1963237697724253,
|
|
"epoch": 0.6063157894736843,
|
|
"grad_norm": 7.78125,
|
|
"learning_rate": 2.0312500000000002e-06,
|
|
"loss": 0.20975203514099122,
|
|
"mean_token_accuracy": 0.9345369815826416,
|
|
"num_tokens": 4397776.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 0.17916312967427075,
|
|
"epoch": 0.6105263157894737,
|
|
"grad_norm": 9.375,
|
|
"learning_rate": 2.009548611111111e-06,
|
|
"loss": 0.18616671562194825,
|
|
"mean_token_accuracy": 0.9408248156309128,
|
|
"num_tokens": 4427110.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 0.16703516799025236,
|
|
"epoch": 0.6147368421052631,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 1.9878472222222223e-06,
|
|
"loss": 0.16765722036361694,
|
|
"mean_token_accuracy": 0.9442552007734776,
|
|
"num_tokens": 4457255.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 0.15452561462298037,
|
|
"epoch": 0.6189473684210526,
|
|
"grad_norm": 11.875,
|
|
"learning_rate": 1.9661458333333335e-06,
|
|
"loss": 0.17154412269592284,
|
|
"mean_token_accuracy": 0.9427635096013546,
|
|
"num_tokens": 4489436.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 0.15665105115622283,
|
|
"epoch": 0.6231578947368421,
|
|
"grad_norm": 11.0625,
|
|
"learning_rate": 1.944444444444445e-06,
|
|
"loss": 0.14704623222351074,
|
|
"mean_token_accuracy": 0.9460532791912556,
|
|
"num_tokens": 4519132.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 0.16253583596553653,
|
|
"epoch": 0.6273684210526316,
|
|
"grad_norm": 6.21875,
|
|
"learning_rate": 1.9227430555555556e-06,
|
|
"loss": 0.1866912603378296,
|
|
"mean_token_accuracy": 0.9407590955495835,
|
|
"num_tokens": 4550041.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 0.16826875344850123,
|
|
"epoch": 0.631578947368421,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 1.9010416666666666e-06,
|
|
"loss": 0.1752256989479065,
|
|
"mean_token_accuracy": 0.9387107148766518,
|
|
"num_tokens": 4578389.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 0.19358136910013854,
|
|
"epoch": 0.6357894736842106,
|
|
"grad_norm": 5.625,
|
|
"learning_rate": 1.879340277777778e-06,
|
|
"loss": 0.21114234924316405,
|
|
"mean_token_accuracy": 0.9343519538640976,
|
|
"num_tokens": 4607459.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 0.17116468152962624,
|
|
"epoch": 0.64,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 1.8576388888888891e-06,
|
|
"loss": 0.17217620611190795,
|
|
"mean_token_accuracy": 0.9416831895709038,
|
|
"num_tokens": 4638613.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 0.2053681869059801,
|
|
"epoch": 0.6442105263157895,
|
|
"grad_norm": 6.9375,
|
|
"learning_rate": 1.8359375000000002e-06,
|
|
"loss": 0.22673625946044923,
|
|
"mean_token_accuracy": 0.9339988075196743,
|
|
"num_tokens": 4666917.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 0.1771626771427691,
|
|
"epoch": 0.6484210526315789,
|
|
"grad_norm": 6.875,
|
|
"learning_rate": 1.8142361111111112e-06,
|
|
"loss": 0.17564224004745482,
|
|
"mean_token_accuracy": 0.9413302429020405,
|
|
"num_tokens": 4696949.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 0.16223793958779426,
|
|
"epoch": 0.6526315789473685,
|
|
"grad_norm": 7.4375,
|
|
"learning_rate": 1.7925347222222222e-06,
|
|
"loss": 0.1730146288871765,
|
|
"mean_token_accuracy": 0.9461438663303852,
|
|
"num_tokens": 4726446.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 0.1785475114127621,
|
|
"epoch": 0.6568421052631579,
|
|
"grad_norm": 9.4375,
|
|
"learning_rate": 1.7708333333333337e-06,
|
|
"loss": 0.17630915641784667,
|
|
"mean_token_accuracy": 0.941747710108757,
|
|
"num_tokens": 4757299.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 0.1837959503289312,
|
|
"epoch": 0.6610526315789473,
|
|
"grad_norm": 6.9375,
|
|
"learning_rate": 1.7491319444444447e-06,
|
|
"loss": 0.21238627433776855,
|
|
"mean_token_accuracy": 0.9363793157041073,
|
|
"num_tokens": 4786004.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 0.17369262645952405,
|
|
"epoch": 0.6652631578947369,
|
|
"grad_norm": 8.3125,
|
|
"learning_rate": 1.7274305555555557e-06,
|
|
"loss": 0.17695680856704712,
|
|
"mean_token_accuracy": 0.9470903754234314,
|
|
"num_tokens": 4817544.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 0.20245264389086515,
|
|
"epoch": 0.6694736842105263,
|
|
"grad_norm": 7.125,
|
|
"learning_rate": 1.7057291666666668e-06,
|
|
"loss": 0.2123798370361328,
|
|
"mean_token_accuracy": 0.9319963820278645,
|
|
"num_tokens": 4847565.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 0.16917385840788485,
|
|
"epoch": 0.6736842105263158,
|
|
"grad_norm": 7.15625,
|
|
"learning_rate": 1.684027777777778e-06,
|
|
"loss": 0.15817831754684447,
|
|
"mean_token_accuracy": 0.9451489493250846,
|
|
"num_tokens": 4879212.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 0.18626669934019446,
|
|
"epoch": 0.6778947368421052,
|
|
"grad_norm": 9.25,
|
|
"learning_rate": 1.662326388888889e-06,
|
|
"loss": 0.1963236451148987,
|
|
"mean_token_accuracy": 0.9376043990254402,
|
|
"num_tokens": 4911216.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 0.1777785701211542,
|
|
"epoch": 0.6821052631578948,
|
|
"grad_norm": 6.375,
|
|
"learning_rate": 1.640625e-06,
|
|
"loss": 0.186847722530365,
|
|
"mean_token_accuracy": 0.9369994647800922,
|
|
"num_tokens": 4943694.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 0.19736593994311988,
|
|
"epoch": 0.6863157894736842,
|
|
"grad_norm": 12.5625,
|
|
"learning_rate": 1.618923611111111e-06,
|
|
"loss": 0.22199268341064454,
|
|
"mean_token_accuracy": 0.9357027292251587,
|
|
"num_tokens": 4972032.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 0.1932901387102902,
|
|
"epoch": 0.6905263157894737,
|
|
"grad_norm": 9.9375,
|
|
"learning_rate": 1.5972222222222221e-06,
|
|
"loss": 0.19801300764083862,
|
|
"mean_token_accuracy": 0.9328659147024154,
|
|
"num_tokens": 5001985.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 0.18727553612552583,
|
|
"epoch": 0.6947368421052632,
|
|
"grad_norm": 7.25,
|
|
"learning_rate": 1.5755208333333336e-06,
|
|
"loss": 0.200944185256958,
|
|
"mean_token_accuracy": 0.9315911903977394,
|
|
"num_tokens": 5031619.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 0.18988265902735293,
|
|
"epoch": 0.6989473684210527,
|
|
"grad_norm": 7.375,
|
|
"learning_rate": 1.5538194444444446e-06,
|
|
"loss": 0.18995364904403686,
|
|
"mean_token_accuracy": 0.9380945399403572,
|
|
"num_tokens": 5061525.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 0.1723124712705612,
|
|
"epoch": 0.7031578947368421,
|
|
"grad_norm": 10.0625,
|
|
"learning_rate": 1.5321180555555556e-06,
|
|
"loss": 0.18223432302474976,
|
|
"mean_token_accuracy": 0.936246433109045,
|
|
"num_tokens": 5092491.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 0.1763459252426401,
|
|
"epoch": 0.7073684210526315,
|
|
"grad_norm": 12.625,
|
|
"learning_rate": 1.5104166666666667e-06,
|
|
"loss": 0.19533677101135255,
|
|
"mean_token_accuracy": 0.9401971742510795,
|
|
"num_tokens": 5123692.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 0.17391538694500924,
|
|
"epoch": 0.7115789473684211,
|
|
"grad_norm": 5.34375,
|
|
"learning_rate": 1.488715277777778e-06,
|
|
"loss": 0.1833168625831604,
|
|
"mean_token_accuracy": 0.9375192701816559,
|
|
"num_tokens": 5154327.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 0.19447861842345446,
|
|
"epoch": 0.7157894736842105,
|
|
"grad_norm": 6.34375,
|
|
"learning_rate": 1.4670138888888892e-06,
|
|
"loss": 0.2035297393798828,
|
|
"mean_token_accuracy": 0.9407950587570667,
|
|
"num_tokens": 5185441.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 0.17104214280843735,
|
|
"epoch": 0.72,
|
|
"grad_norm": 10.125,
|
|
"learning_rate": 1.4453125000000002e-06,
|
|
"loss": 0.19187886714935304,
|
|
"mean_token_accuracy": 0.9413264997303485,
|
|
"num_tokens": 5214618.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 0.164881079364568,
|
|
"epoch": 0.7242105263157895,
|
|
"grad_norm": 10.625,
|
|
"learning_rate": 1.4236111111111112e-06,
|
|
"loss": 0.17205849885940552,
|
|
"mean_token_accuracy": 0.9436387285590172,
|
|
"num_tokens": 5244872.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 0.18138507837429643,
|
|
"epoch": 0.728421052631579,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 1.4019097222222223e-06,
|
|
"loss": 0.18944886922836304,
|
|
"mean_token_accuracy": 0.9419176429510117,
|
|
"num_tokens": 5274811.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 0.15619251895695924,
|
|
"epoch": 0.7326315789473684,
|
|
"grad_norm": 6.25,
|
|
"learning_rate": 1.3802083333333335e-06,
|
|
"loss": 0.15303416252136232,
|
|
"mean_token_accuracy": 0.9456774339079856,
|
|
"num_tokens": 5305936.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 0.17621302837505937,
|
|
"epoch": 0.7368421052631579,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 1.3585069444444445e-06,
|
|
"loss": 0.16394418478012085,
|
|
"mean_token_accuracy": 0.9439542882144452,
|
|
"num_tokens": 5336619.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 0.1895997554762289,
|
|
"epoch": 0.7410526315789474,
|
|
"grad_norm": 9.0,
|
|
"learning_rate": 1.3368055555555556e-06,
|
|
"loss": 0.20419509410858155,
|
|
"mean_token_accuracy": 0.9383566424250602,
|
|
"num_tokens": 5366166.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 0.15430729234358295,
|
|
"epoch": 0.7452631578947368,
|
|
"grad_norm": 7.96875,
|
|
"learning_rate": 1.3151041666666666e-06,
|
|
"loss": 0.14866267442703246,
|
|
"mean_token_accuracy": 0.9463915720582008,
|
|
"num_tokens": 5395903.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 0.1961900666821748,
|
|
"epoch": 0.7494736842105263,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 1.293402777777778e-06,
|
|
"loss": 0.20117769241333008,
|
|
"mean_token_accuracy": 0.9342163056135178,
|
|
"num_tokens": 5427462.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 0.180325382668525,
|
|
"epoch": 0.7536842105263157,
|
|
"grad_norm": 10.875,
|
|
"learning_rate": 1.271701388888889e-06,
|
|
"loss": 0.19998364448547362,
|
|
"mean_token_accuracy": 0.9385084345936775,
|
|
"num_tokens": 5456165.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 0.18382872603833675,
|
|
"epoch": 0.7578947368421053,
|
|
"grad_norm": 6.96875,
|
|
"learning_rate": 1.25e-06,
|
|
"loss": 0.18795562982559205,
|
|
"mean_token_accuracy": 0.9401052162051201,
|
|
"num_tokens": 5484297.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 0.1735987264662981,
|
|
"epoch": 0.7621052631578947,
|
|
"grad_norm": 6.75,
|
|
"learning_rate": 1.2282986111111111e-06,
|
|
"loss": 0.18496283292770385,
|
|
"mean_token_accuracy": 0.9364599175751209,
|
|
"num_tokens": 5512121.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 0.15811273446306587,
|
|
"epoch": 0.7663157894736842,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 1.2065972222222224e-06,
|
|
"loss": 0.17440826892852784,
|
|
"mean_token_accuracy": 0.9474552102386952,
|
|
"num_tokens": 5540912.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 0.19428172940388322,
|
|
"epoch": 0.7705263157894737,
|
|
"grad_norm": 7.09375,
|
|
"learning_rate": 1.1848958333333334e-06,
|
|
"loss": 0.2328346014022827,
|
|
"mean_token_accuracy": 0.9367604151368141,
|
|
"num_tokens": 5570904.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 0.19383207242935896,
|
|
"epoch": 0.7747368421052632,
|
|
"grad_norm": 10.125,
|
|
"learning_rate": 1.1631944444444446e-06,
|
|
"loss": 0.20834689140319823,
|
|
"mean_token_accuracy": 0.9364984571933747,
|
|
"num_tokens": 5601902.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 0.1639871869701892,
|
|
"epoch": 0.7789473684210526,
|
|
"grad_norm": 7.21875,
|
|
"learning_rate": 1.1414930555555557e-06,
|
|
"loss": 0.15975459814071655,
|
|
"mean_token_accuracy": 0.9448182679712772,
|
|
"num_tokens": 5633013.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 0.17671056441031396,
|
|
"epoch": 0.783157894736842,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 1.1197916666666667e-06,
|
|
"loss": 0.19243409633636474,
|
|
"mean_token_accuracy": 0.9421222470700741,
|
|
"num_tokens": 5665644.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 0.20545928478240966,
|
|
"epoch": 0.7873684210526316,
|
|
"grad_norm": 10.875,
|
|
"learning_rate": 1.098090277777778e-06,
|
|
"loss": 0.22782745361328124,
|
|
"mean_token_accuracy": 0.9283310487866402,
|
|
"num_tokens": 5696733.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 0.1771316953469068,
|
|
"epoch": 0.791578947368421,
|
|
"grad_norm": 12.0,
|
|
"learning_rate": 1.076388888888889e-06,
|
|
"loss": 0.20005078315734864,
|
|
"mean_token_accuracy": 0.9354067780077457,
|
|
"num_tokens": 5726809.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 0.1829876006115228,
|
|
"epoch": 0.7957894736842105,
|
|
"grad_norm": 4.375,
|
|
"learning_rate": 1.0546875e-06,
|
|
"loss": 0.17984312772750854,
|
|
"mean_token_accuracy": 0.9406855225563049,
|
|
"num_tokens": 5757443.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 0.17131042117252945,
|
|
"epoch": 0.8,
|
|
"grad_norm": 5.5625,
|
|
"learning_rate": 1.032986111111111e-06,
|
|
"loss": 0.187677800655365,
|
|
"mean_token_accuracy": 0.9410165570676327,
|
|
"num_tokens": 5787336.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 0.15520585421472788,
|
|
"epoch": 0.8042105263157895,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 1.0112847222222223e-06,
|
|
"loss": 0.15040594339370728,
|
|
"mean_token_accuracy": 0.949649342149496,
|
|
"num_tokens": 5818737.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 0.19390389914624392,
|
|
"epoch": 0.8084210526315789,
|
|
"grad_norm": 7.875,
|
|
"learning_rate": 9.895833333333333e-07,
|
|
"loss": 0.19968183040618898,
|
|
"mean_token_accuracy": 0.9386158093810082,
|
|
"num_tokens": 5848788.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 0.16451029586605728,
|
|
"epoch": 0.8126315789473684,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 9.678819444444446e-07,
|
|
"loss": 0.17298288345336915,
|
|
"mean_token_accuracy": 0.9406896255910396,
|
|
"num_tokens": 5878423.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 0.17370661203749477,
|
|
"epoch": 0.8168421052631579,
|
|
"grad_norm": 5.59375,
|
|
"learning_rate": 9.461805555555556e-07,
|
|
"loss": 0.17794467210769654,
|
|
"mean_token_accuracy": 0.9431041710078716,
|
|
"num_tokens": 5908453.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 0.1777374588418752,
|
|
"epoch": 0.8210526315789474,
|
|
"grad_norm": 11.875,
|
|
"learning_rate": 9.244791666666668e-07,
|
|
"loss": 0.20215635299682616,
|
|
"mean_token_accuracy": 0.9381940357387066,
|
|
"num_tokens": 5940889.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 0.18253268958069385,
|
|
"epoch": 0.8252631578947368,
|
|
"grad_norm": 5.5,
|
|
"learning_rate": 9.027777777777779e-07,
|
|
"loss": 0.17334474325180055,
|
|
"mean_token_accuracy": 0.9461725540459156,
|
|
"num_tokens": 5971947.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 0.1783546233084053,
|
|
"epoch": 0.8294736842105264,
|
|
"grad_norm": 6.65625,
|
|
"learning_rate": 8.81076388888889e-07,
|
|
"loss": 0.2018296718597412,
|
|
"mean_token_accuracy": 0.9374721601605416,
|
|
"num_tokens": 6004716.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 0.17445771326310933,
|
|
"epoch": 0.8336842105263158,
|
|
"grad_norm": 7.0,
|
|
"learning_rate": 8.59375e-07,
|
|
"loss": 0.16818779706954956,
|
|
"mean_token_accuracy": 0.9427588351070881,
|
|
"num_tokens": 6036766.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 0.18418881273828447,
|
|
"epoch": 0.8378947368421052,
|
|
"grad_norm": 8.375,
|
|
"learning_rate": 8.376736111111112e-07,
|
|
"loss": 0.21462113857269288,
|
|
"mean_token_accuracy": 0.937469869852066,
|
|
"num_tokens": 6065012.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 0.16037586382590235,
|
|
"epoch": 0.8421052631578947,
|
|
"grad_norm": 5.3125,
|
|
"learning_rate": 8.159722222222223e-07,
|
|
"loss": 0.17553248405456542,
|
|
"mean_token_accuracy": 0.9418002314865589,
|
|
"num_tokens": 6095994.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 0.18084662132896484,
|
|
"epoch": 0.8463157894736842,
|
|
"grad_norm": 5.34375,
|
|
"learning_rate": 7.942708333333333e-07,
|
|
"loss": 0.17438472509384156,
|
|
"mean_token_accuracy": 0.9446314513683319,
|
|
"num_tokens": 6126311.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 0.17917919345200062,
|
|
"epoch": 0.8505263157894737,
|
|
"grad_norm": 8.1875,
|
|
"learning_rate": 7.725694444444446e-07,
|
|
"loss": 0.18416545391082764,
|
|
"mean_token_accuracy": 0.9393374055624009,
|
|
"num_tokens": 6155779.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 0.17618270772509276,
|
|
"epoch": 0.8547368421052631,
|
|
"grad_norm": 11.6875,
|
|
"learning_rate": 7.508680555555556e-07,
|
|
"loss": 0.18657455444335938,
|
|
"mean_token_accuracy": 0.9405391819775104,
|
|
"num_tokens": 6185940.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 0.1900980792939663,
|
|
"epoch": 0.8589473684210527,
|
|
"grad_norm": 6.34375,
|
|
"learning_rate": 7.291666666666667e-07,
|
|
"loss": 0.22004635334014894,
|
|
"mean_token_accuracy": 0.9368100091814995,
|
|
"num_tokens": 6216119.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 0.1798396656755358,
|
|
"epoch": 0.8631578947368421,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 7.074652777777778e-07,
|
|
"loss": 0.17679187059402465,
|
|
"mean_token_accuracy": 0.9427471734583378,
|
|
"num_tokens": 6248190.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 0.1862468993291259,
|
|
"epoch": 0.8673684210526316,
|
|
"grad_norm": 8.25,
|
|
"learning_rate": 6.85763888888889e-07,
|
|
"loss": 0.19130966663360596,
|
|
"mean_token_accuracy": 0.9378809235990048,
|
|
"num_tokens": 6282715.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 0.18561029192060233,
|
|
"epoch": 0.871578947368421,
|
|
"grad_norm": 11.25,
|
|
"learning_rate": 6.640625e-07,
|
|
"loss": 0.18389569520950316,
|
|
"mean_token_accuracy": 0.9425614275038242,
|
|
"num_tokens": 6312639.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 0.17955731307156383,
|
|
"epoch": 0.8757894736842106,
|
|
"grad_norm": 5.75,
|
|
"learning_rate": 6.423611111111111e-07,
|
|
"loss": 0.18569419384002686,
|
|
"mean_token_accuracy": 0.9404567658901215,
|
|
"num_tokens": 6342390.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 0.16996940840035676,
|
|
"epoch": 0.88,
|
|
"grad_norm": 7.53125,
|
|
"learning_rate": 6.206597222222223e-07,
|
|
"loss": 0.18246359825134278,
|
|
"mean_token_accuracy": 0.9428071282804013,
|
|
"num_tokens": 6374191.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 0.19498055870644748,
|
|
"epoch": 0.8842105263157894,
|
|
"grad_norm": 7.0625,
|
|
"learning_rate": 5.989583333333335e-07,
|
|
"loss": 0.20460844039916992,
|
|
"mean_token_accuracy": 0.9390896797180176,
|
|
"num_tokens": 6403082.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 0.15782833809498698,
|
|
"epoch": 0.888421052631579,
|
|
"grad_norm": 8.8125,
|
|
"learning_rate": 5.772569444444445e-07,
|
|
"loss": 0.17403767108917237,
|
|
"mean_token_accuracy": 0.9430192783474922,
|
|
"num_tokens": 6434824.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 0.16636770479381086,
|
|
"epoch": 0.8926315789473684,
|
|
"grad_norm": 4.90625,
|
|
"learning_rate": 5.555555555555555e-07,
|
|
"loss": 0.16270433664321898,
|
|
"mean_token_accuracy": 0.9464202426373959,
|
|
"num_tokens": 6464051.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 0.18715114260558038,
|
|
"epoch": 0.8968421052631579,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 5.338541666666667e-07,
|
|
"loss": 0.22732558250427246,
|
|
"mean_token_accuracy": 0.9373150266706943,
|
|
"num_tokens": 6493853.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 0.17378719956614078,
|
|
"epoch": 0.9010526315789473,
|
|
"grad_norm": 7.28125,
|
|
"learning_rate": 5.121527777777778e-07,
|
|
"loss": 0.1807337999343872,
|
|
"mean_token_accuracy": 0.9400206096470356,
|
|
"num_tokens": 6527705.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 0.18033494814299048,
|
|
"epoch": 0.9052631578947369,
|
|
"grad_norm": 5.875,
|
|
"learning_rate": 4.904513888888889e-07,
|
|
"loss": 0.19068191051483155,
|
|
"mean_token_accuracy": 0.937873587757349,
|
|
"num_tokens": 6555761.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 0.175303529528901,
|
|
"epoch": 0.9094736842105263,
|
|
"grad_norm": 8.125,
|
|
"learning_rate": 4.6875000000000006e-07,
|
|
"loss": 0.183641254901886,
|
|
"mean_token_accuracy": 0.9391517236828804,
|
|
"num_tokens": 6585723.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 0.17232977109961212,
|
|
"epoch": 0.9136842105263158,
|
|
"grad_norm": 3.890625,
|
|
"learning_rate": 4.4704861111111115e-07,
|
|
"loss": 0.18852951526641845,
|
|
"mean_token_accuracy": 0.940208625793457,
|
|
"num_tokens": 6615288.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 0.16042230552993714,
|
|
"epoch": 0.9178947368421052,
|
|
"grad_norm": 8.625,
|
|
"learning_rate": 4.253472222222223e-07,
|
|
"loss": 0.16894659996032715,
|
|
"mean_token_accuracy": 0.9419491074979305,
|
|
"num_tokens": 6644603.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 0.18052552677690983,
|
|
"epoch": 0.9221052631578948,
|
|
"grad_norm": 9.1875,
|
|
"learning_rate": 4.0364583333333337e-07,
|
|
"loss": 0.18952767848968505,
|
|
"mean_token_accuracy": 0.9380584709346295,
|
|
"num_tokens": 6673545.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 0.19028411931358277,
|
|
"epoch": 0.9263157894736842,
|
|
"grad_norm": 10.5625,
|
|
"learning_rate": 3.819444444444445e-07,
|
|
"loss": 0.18890902996063233,
|
|
"mean_token_accuracy": 0.9400756865739822,
|
|
"num_tokens": 6703299.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 0.16922345554921775,
|
|
"epoch": 0.9305263157894736,
|
|
"grad_norm": 6.84375,
|
|
"learning_rate": 3.6024305555555554e-07,
|
|
"loss": 0.17599536180496217,
|
|
"mean_token_accuracy": 0.9455938622355461,
|
|
"num_tokens": 6732719.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 0.15744123989716172,
|
|
"epoch": 0.9347368421052632,
|
|
"grad_norm": 6.5,
|
|
"learning_rate": 3.3854166666666667e-07,
|
|
"loss": 0.17910586595535277,
|
|
"mean_token_accuracy": 0.9452849693596364,
|
|
"num_tokens": 6765329.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 0.15953006697818636,
|
|
"epoch": 0.9389473684210526,
|
|
"grad_norm": 10.5,
|
|
"learning_rate": 3.168402777777778e-07,
|
|
"loss": 0.16083180904388428,
|
|
"mean_token_accuracy": 0.9451860629022122,
|
|
"num_tokens": 6796269.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 0.19982436632271855,
|
|
"epoch": 0.9431578947368421,
|
|
"grad_norm": 4.03125,
|
|
"learning_rate": 2.951388888888889e-07,
|
|
"loss": 0.1909162998199463,
|
|
"mean_token_accuracy": 0.9365056939423084,
|
|
"num_tokens": 6826464.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 0.1634247657377273,
|
|
"epoch": 0.9473684210526315,
|
|
"grad_norm": 7.75,
|
|
"learning_rate": 2.7343750000000003e-07,
|
|
"loss": 0.1653286933898926,
|
|
"mean_token_accuracy": 0.9445300824940205,
|
|
"num_tokens": 6857440.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 0.19435078646056353,
|
|
"epoch": 0.9515789473684211,
|
|
"grad_norm": 6.90625,
|
|
"learning_rate": 2.5173611111111117e-07,
|
|
"loss": 0.20611786842346191,
|
|
"mean_token_accuracy": 0.9351051561534405,
|
|
"num_tokens": 6887333.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 0.19693100345321,
|
|
"epoch": 0.9557894736842105,
|
|
"grad_norm": 8.6875,
|
|
"learning_rate": 2.3003472222222225e-07,
|
|
"loss": 0.1984722852706909,
|
|
"mean_token_accuracy": 0.937918345630169,
|
|
"num_tokens": 6917794.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 0.1728912627324462,
|
|
"epoch": 0.96,
|
|
"grad_norm": 4.875,
|
|
"learning_rate": 2.0833333333333333e-07,
|
|
"loss": 0.16558315753936767,
|
|
"mean_token_accuracy": 0.9425304509699345,
|
|
"num_tokens": 6947614.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 0.17391241467557847,
|
|
"epoch": 0.9642105263157895,
|
|
"grad_norm": 8.0625,
|
|
"learning_rate": 1.8663194444444444e-07,
|
|
"loss": 0.1844017267227173,
|
|
"mean_token_accuracy": 0.9372891336679459,
|
|
"num_tokens": 6978068.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 0.17354375659488142,
|
|
"epoch": 0.968421052631579,
|
|
"grad_norm": 7.5,
|
|
"learning_rate": 1.6493055555555558e-07,
|
|
"loss": 0.17987858057022094,
|
|
"mean_token_accuracy": 0.938211838901043,
|
|
"num_tokens": 7010536.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 0.2068662981968373,
|
|
"epoch": 0.9726315789473684,
|
|
"grad_norm": 10.0,
|
|
"learning_rate": 1.4322916666666666e-07,
|
|
"loss": 0.23096110820770263,
|
|
"mean_token_accuracy": 0.9326581478118896,
|
|
"num_tokens": 7042095.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 0.16978850068990142,
|
|
"epoch": 0.9768421052631578,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 1.215277777777778e-07,
|
|
"loss": 0.17138477563858032,
|
|
"mean_token_accuracy": 0.9445147432386876,
|
|
"num_tokens": 7072071.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 0.17203839742578567,
|
|
"epoch": 0.9810526315789474,
|
|
"grad_norm": 8.5625,
|
|
"learning_rate": 9.982638888888888e-08,
|
|
"loss": 0.17553606033325195,
|
|
"mean_token_accuracy": 0.9403647750616073,
|
|
"num_tokens": 7102822.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 0.2015716886613518,
|
|
"epoch": 0.9852631578947368,
|
|
"grad_norm": 6.46875,
|
|
"learning_rate": 7.8125e-08,
|
|
"loss": 0.2199774980545044,
|
|
"mean_token_accuracy": 0.9335592687129974,
|
|
"num_tokens": 7132670.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 0.17184048132039606,
|
|
"epoch": 0.9894736842105263,
|
|
"grad_norm": 10.25,
|
|
"learning_rate": 5.6423611111111116e-08,
|
|
"loss": 0.19170069694519043,
|
|
"mean_token_accuracy": 0.9456814132630825,
|
|
"num_tokens": 7163095.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 0.18851842815056444,
|
|
"epoch": 0.9936842105263158,
|
|
"grad_norm": 7.40625,
|
|
"learning_rate": 3.472222222222222e-08,
|
|
"loss": 0.18714648485183716,
|
|
"mean_token_accuracy": 0.9426751539111138,
|
|
"num_tokens": 7191956.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 0.17078252806095406,
|
|
"epoch": 0.9978947368421053,
|
|
"grad_norm": 9.5,
|
|
"learning_rate": 1.3020833333333333e-08,
|
|
"loss": 0.16565700769424438,
|
|
"mean_token_accuracy": 0.9381283052265644,
|
|
"num_tokens": 7221933.0,
|
|
"step": 2370
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 2375,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 7.608549619134874e+16,
|
|
"train_batch_size": 2,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|