Files
general_knowledge_model/checkpoint-2375/trainer_state.json

2405 lines
68 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 2375,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.4990599287673831,
"epoch": 0.004210526315789474,
"grad_norm": 69.0,
"learning_rate": 6.338028169014085e-07,
"loss": 1.671738624572754,
"mean_token_accuracy": 0.7763976119458675,
"num_tokens": 31553.0,
"step": 10
},
{
"entropy": 0.4624864859506488,
"epoch": 0.008421052631578947,
"grad_norm": 65.0,
"learning_rate": 1.3380281690140844e-06,
"loss": 1.5600993156433105,
"mean_token_accuracy": 0.7901717454195023,
"num_tokens": 63579.0,
"step": 20
},
{
"entropy": 0.5733067244291306,
"epoch": 0.01263157894736842,
"grad_norm": 54.5,
"learning_rate": 2.0422535211267608e-06,
"loss": 1.6138050079345703,
"mean_token_accuracy": 0.7659219928085804,
"num_tokens": 92495.0,
"step": 30
},
{
"entropy": 0.576881331205368,
"epoch": 0.016842105263157894,
"grad_norm": 30.75,
"learning_rate": 2.746478873239437e-06,
"loss": 1.3854169845581055,
"mean_token_accuracy": 0.7819479435682297,
"num_tokens": 122375.0,
"step": 40
},
{
"entropy": 0.6074449960142374,
"epoch": 0.021052631578947368,
"grad_norm": 21.375,
"learning_rate": 3.4507042253521127e-06,
"loss": 1.1678359985351563,
"mean_token_accuracy": 0.788398090749979,
"num_tokens": 152668.0,
"step": 50
},
{
"entropy": 0.7060422364622354,
"epoch": 0.02526315789473684,
"grad_norm": 12.1875,
"learning_rate": 4.154929577464789e-06,
"loss": 0.9693965911865234,
"mean_token_accuracy": 0.798081835359335,
"num_tokens": 183863.0,
"step": 60
},
{
"entropy": 0.741611959785223,
"epoch": 0.029473684210526315,
"grad_norm": 12.0,
"learning_rate": 4.859154929577465e-06,
"loss": 0.7716450214385986,
"mean_token_accuracy": 0.8399579018354416,
"num_tokens": 212992.0,
"step": 70
},
{
"entropy": 0.6091062590479851,
"epoch": 0.03368421052631579,
"grad_norm": 15.0,
"learning_rate": 4.982638888888889e-06,
"loss": 0.5984757900238037,
"mean_token_accuracy": 0.8683908067643642,
"num_tokens": 242894.0,
"step": 80
},
{
"entropy": 0.4648941744118929,
"epoch": 0.037894736842105266,
"grad_norm": 9.25,
"learning_rate": 4.9609375e-06,
"loss": 0.45642986297607424,
"mean_token_accuracy": 0.8944785602390766,
"num_tokens": 273459.0,
"step": 90
},
{
"entropy": 0.3587808248586953,
"epoch": 0.042105263157894736,
"grad_norm": 8.375,
"learning_rate": 4.9392361111111115e-06,
"loss": 0.38718841075897215,
"mean_token_accuracy": 0.9098845317959785,
"num_tokens": 305452.0,
"step": 100
},
{
"entropy": 0.31363106137141583,
"epoch": 0.04631578947368421,
"grad_norm": 7.71875,
"learning_rate": 4.917534722222223e-06,
"loss": 0.35190615653991697,
"mean_token_accuracy": 0.9152749516069889,
"num_tokens": 336691.0,
"step": 110
},
{
"entropy": 0.30077689900062976,
"epoch": 0.05052631578947368,
"grad_norm": 7.5625,
"learning_rate": 4.895833333333333e-06,
"loss": 0.3593594551086426,
"mean_token_accuracy": 0.9169687710702419,
"num_tokens": 368879.0,
"step": 120
},
{
"entropy": 0.2662435117177665,
"epoch": 0.05473684210526316,
"grad_norm": 8.1875,
"learning_rate": 4.8741319444444444e-06,
"loss": 0.316438627243042,
"mean_token_accuracy": 0.9221884422004223,
"num_tokens": 399165.0,
"step": 130
},
{
"entropy": 0.26467454619705677,
"epoch": 0.05894736842105263,
"grad_norm": 8.8125,
"learning_rate": 4.8524305555555565e-06,
"loss": 0.27219557762145996,
"mean_token_accuracy": 0.9298946231603622,
"num_tokens": 428931.0,
"step": 140
},
{
"entropy": 0.2657210439443588,
"epoch": 0.06315789473684211,
"grad_norm": 16.875,
"learning_rate": 4.830729166666667e-06,
"loss": 0.3098090171813965,
"mean_token_accuracy": 0.9222414299845696,
"num_tokens": 458794.0,
"step": 150
},
{
"entropy": 0.23787126671522857,
"epoch": 0.06736842105263158,
"grad_norm": 10.0,
"learning_rate": 4.809027777777778e-06,
"loss": 0.2524611711502075,
"mean_token_accuracy": 0.9230330072343349,
"num_tokens": 489763.0,
"step": 160
},
{
"entropy": 0.2247232544235885,
"epoch": 0.07157894736842105,
"grad_norm": 10.75,
"learning_rate": 4.787326388888889e-06,
"loss": 0.2346771240234375,
"mean_token_accuracy": 0.93573377430439,
"num_tokens": 520029.0,
"step": 170
},
{
"entropy": 0.22070267596282064,
"epoch": 0.07578947368421053,
"grad_norm": 7.75,
"learning_rate": 4.765625000000001e-06,
"loss": 0.21888349056243897,
"mean_token_accuracy": 0.9352433510124684,
"num_tokens": 550742.0,
"step": 180
},
{
"entropy": 0.21396164572797716,
"epoch": 0.08,
"grad_norm": 7.65625,
"learning_rate": 4.743923611111111e-06,
"loss": 0.21159236431121825,
"mean_token_accuracy": 0.9358419619500637,
"num_tokens": 580071.0,
"step": 190
},
{
"entropy": 0.20088617503643036,
"epoch": 0.08421052631578947,
"grad_norm": 9.0625,
"learning_rate": 4.722222222222222e-06,
"loss": 0.210105037689209,
"mean_token_accuracy": 0.9405015103518963,
"num_tokens": 610346.0,
"step": 200
},
{
"entropy": 0.2197779224254191,
"epoch": 0.08842105263157894,
"grad_norm": 6.25,
"learning_rate": 4.7005208333333335e-06,
"loss": 0.24622466564178466,
"mean_token_accuracy": 0.9350829392671585,
"num_tokens": 640068.0,
"step": 210
},
{
"entropy": 0.22689010314643382,
"epoch": 0.09263157894736843,
"grad_norm": 12.25,
"learning_rate": 4.678819444444445e-06,
"loss": 0.25157005786895753,
"mean_token_accuracy": 0.9245235815644264,
"num_tokens": 668586.0,
"step": 220
},
{
"entropy": 0.2026051654946059,
"epoch": 0.0968421052631579,
"grad_norm": 11.625,
"learning_rate": 4.657118055555556e-06,
"loss": 0.22865614891052247,
"mean_token_accuracy": 0.9291222095489502,
"num_tokens": 700113.0,
"step": 230
},
{
"entropy": 0.20945081664249302,
"epoch": 0.10105263157894737,
"grad_norm": 8.4375,
"learning_rate": 4.635416666666667e-06,
"loss": 0.20557198524475098,
"mean_token_accuracy": 0.9318756103515625,
"num_tokens": 730359.0,
"step": 240
},
{
"entropy": 0.1935979576781392,
"epoch": 0.10526315789473684,
"grad_norm": 9.75,
"learning_rate": 4.6137152777777785e-06,
"loss": 0.20995285511016845,
"mean_token_accuracy": 0.9389079615473748,
"num_tokens": 761042.0,
"step": 250
},
{
"entropy": 0.21530479132197797,
"epoch": 0.10947368421052632,
"grad_norm": 10.25,
"learning_rate": 4.59201388888889e-06,
"loss": 0.21937789916992187,
"mean_token_accuracy": 0.9335255794227123,
"num_tokens": 792117.0,
"step": 260
},
{
"entropy": 0.24162108548916877,
"epoch": 0.11368421052631579,
"grad_norm": 10.5,
"learning_rate": 4.5703125e-06,
"loss": 0.2889341115951538,
"mean_token_accuracy": 0.9264158695936203,
"num_tokens": 822509.0,
"step": 270
},
{
"entropy": 0.22190025104209782,
"epoch": 0.11789473684210526,
"grad_norm": 9.4375,
"learning_rate": 4.548611111111111e-06,
"loss": 0.22677860260009766,
"mean_token_accuracy": 0.9339636966586113,
"num_tokens": 852474.0,
"step": 280
},
{
"entropy": 0.21453084875829517,
"epoch": 0.12210526315789473,
"grad_norm": 7.65625,
"learning_rate": 4.526909722222223e-06,
"loss": 0.20040695667266845,
"mean_token_accuracy": 0.9411987900733948,
"num_tokens": 882821.0,
"step": 290
},
{
"entropy": 0.2034795220475644,
"epoch": 0.12631578947368421,
"grad_norm": 12.6875,
"learning_rate": 4.505208333333334e-06,
"loss": 0.24240901470184326,
"mean_token_accuracy": 0.9343540959060193,
"num_tokens": 913298.0,
"step": 300
},
{
"entropy": 0.20725304959341884,
"epoch": 0.13052631578947368,
"grad_norm": 10.25,
"learning_rate": 4.483506944444444e-06,
"loss": 0.22464065551757811,
"mean_token_accuracy": 0.9300798162817955,
"num_tokens": 944669.0,
"step": 310
},
{
"entropy": 0.18791212746873498,
"epoch": 0.13473684210526315,
"grad_norm": 8.0,
"learning_rate": 4.461805555555556e-06,
"loss": 0.17531607151031495,
"mean_token_accuracy": 0.9410846054553985,
"num_tokens": 973038.0,
"step": 320
},
{
"entropy": 0.1887997885234654,
"epoch": 0.13894736842105262,
"grad_norm": 8.25,
"learning_rate": 4.440104166666668e-06,
"loss": 0.20259859561920165,
"mean_token_accuracy": 0.9379140719771385,
"num_tokens": 1003504.0,
"step": 330
},
{
"entropy": 0.21206430648453534,
"epoch": 0.1431578947368421,
"grad_norm": 8.625,
"learning_rate": 4.418402777777778e-06,
"loss": 0.24106347560882568,
"mean_token_accuracy": 0.9289649538695812,
"num_tokens": 1032582.0,
"step": 340
},
{
"entropy": 0.1938377027399838,
"epoch": 0.14736842105263157,
"grad_norm": 9.5,
"learning_rate": 4.396701388888889e-06,
"loss": 0.19278082847595215,
"mean_token_accuracy": 0.9380026146769523,
"num_tokens": 1064109.0,
"step": 350
},
{
"entropy": 0.1793072429485619,
"epoch": 0.15157894736842106,
"grad_norm": 7.65625,
"learning_rate": 4.3750000000000005e-06,
"loss": 0.18131839036941527,
"mean_token_accuracy": 0.9433922998607158,
"num_tokens": 1094818.0,
"step": 360
},
{
"entropy": 0.19749868060462178,
"epoch": 0.15578947368421053,
"grad_norm": 4.75,
"learning_rate": 4.353298611111112e-06,
"loss": 0.18917640447616577,
"mean_token_accuracy": 0.9424469873309136,
"num_tokens": 1123344.0,
"step": 370
},
{
"entropy": 0.1859517907258123,
"epoch": 0.16,
"grad_norm": 10.375,
"learning_rate": 4.331597222222222e-06,
"loss": 0.19585838317871093,
"mean_token_accuracy": 0.9397093847393989,
"num_tokens": 1154149.0,
"step": 380
},
{
"entropy": 0.17284040013328195,
"epoch": 0.16421052631578947,
"grad_norm": 14.3125,
"learning_rate": 4.309895833333333e-06,
"loss": 0.16065752506256104,
"mean_token_accuracy": 0.9468757703900337,
"num_tokens": 1185496.0,
"step": 390
},
{
"entropy": 0.2033068159595132,
"epoch": 0.16842105263157894,
"grad_norm": 9.0,
"learning_rate": 4.288194444444445e-06,
"loss": 0.22716670036315917,
"mean_token_accuracy": 0.9365929305553437,
"num_tokens": 1215776.0,
"step": 400
},
{
"entropy": 0.20319096064195036,
"epoch": 0.1726315789473684,
"grad_norm": 9.3125,
"learning_rate": 4.266493055555556e-06,
"loss": 0.2225698471069336,
"mean_token_accuracy": 0.9277164503931999,
"num_tokens": 1245574.0,
"step": 410
},
{
"entropy": 0.1901295615825802,
"epoch": 0.17684210526315788,
"grad_norm": 10.375,
"learning_rate": 4.244791666666667e-06,
"loss": 0.22110774517059326,
"mean_token_accuracy": 0.9325532615184784,
"num_tokens": 1274979.0,
"step": 420
},
{
"entropy": 0.19151646881364287,
"epoch": 0.18105263157894738,
"grad_norm": 6.9375,
"learning_rate": 4.223090277777778e-06,
"loss": 0.1919734835624695,
"mean_token_accuracy": 0.9378305852413178,
"num_tokens": 1306036.0,
"step": 430
},
{
"entropy": 0.2085381604731083,
"epoch": 0.18526315789473685,
"grad_norm": 7.53125,
"learning_rate": 4.2013888888888896e-06,
"loss": 0.21823127269744874,
"mean_token_accuracy": 0.9345854863524437,
"num_tokens": 1335047.0,
"step": 440
},
{
"entropy": 0.2007679786067456,
"epoch": 0.18947368421052632,
"grad_norm": 8.75,
"learning_rate": 4.1796875e-06,
"loss": 0.21735711097717286,
"mean_token_accuracy": 0.9340473741292954,
"num_tokens": 1366790.0,
"step": 450
},
{
"entropy": 0.17802681485190988,
"epoch": 0.1936842105263158,
"grad_norm": 5.34375,
"learning_rate": 4.157986111111111e-06,
"loss": 0.19400970935821532,
"mean_token_accuracy": 0.9380262985825538,
"num_tokens": 1394887.0,
"step": 460
},
{
"entropy": 0.21595997624099256,
"epoch": 0.19789473684210526,
"grad_norm": 7.1875,
"learning_rate": 4.1362847222222224e-06,
"loss": 0.22792208194732666,
"mean_token_accuracy": 0.9314667269587517,
"num_tokens": 1425391.0,
"step": 470
},
{
"entropy": 0.18051641024649143,
"epoch": 0.20210526315789473,
"grad_norm": 4.9375,
"learning_rate": 4.114583333333334e-06,
"loss": 0.19123028516769408,
"mean_token_accuracy": 0.9385565176606179,
"num_tokens": 1453952.0,
"step": 480
},
{
"entropy": 0.2041733751539141,
"epoch": 0.2063157894736842,
"grad_norm": 11.1875,
"learning_rate": 4.092881944444445e-06,
"loss": 0.21048731803894044,
"mean_token_accuracy": 0.9365776918828488,
"num_tokens": 1487071.0,
"step": 490
},
{
"entropy": 0.17413038527593017,
"epoch": 0.21052631578947367,
"grad_norm": 8.4375,
"learning_rate": 4.071180555555556e-06,
"loss": 0.1920235872268677,
"mean_token_accuracy": 0.9346710205078125,
"num_tokens": 1518557.0,
"step": 500
},
{
"entropy": 0.1804610774386674,
"epoch": 0.21473684210526317,
"grad_norm": 6.71875,
"learning_rate": 4.049479166666667e-06,
"loss": 0.18783496618270873,
"mean_token_accuracy": 0.9396589122712612,
"num_tokens": 1548878.0,
"step": 510
},
{
"entropy": 0.19870298462919891,
"epoch": 0.21894736842105264,
"grad_norm": 10.5,
"learning_rate": 4.027777777777779e-06,
"loss": 0.20456252098083497,
"mean_token_accuracy": 0.93275361135602,
"num_tokens": 1581157.0,
"step": 520
},
{
"entropy": 0.18834507754072546,
"epoch": 0.2231578947368421,
"grad_norm": 9.5,
"learning_rate": 4.006076388888889e-06,
"loss": 0.1853790521621704,
"mean_token_accuracy": 0.9434393145143986,
"num_tokens": 1612111.0,
"step": 530
},
{
"entropy": 0.18060610676184297,
"epoch": 0.22736842105263158,
"grad_norm": 10.875,
"learning_rate": 3.984375e-06,
"loss": 0.18703898191452026,
"mean_token_accuracy": 0.940553817898035,
"num_tokens": 1643714.0,
"step": 540
},
{
"entropy": 0.2124157869257033,
"epoch": 0.23157894736842105,
"grad_norm": 16.375,
"learning_rate": 3.9626736111111115e-06,
"loss": 0.23256590366363525,
"mean_token_accuracy": 0.931666910648346,
"num_tokens": 1674981.0,
"step": 550
},
{
"entropy": 0.18916954104788603,
"epoch": 0.23578947368421052,
"grad_norm": 8.625,
"learning_rate": 3.940972222222223e-06,
"loss": 0.20892608165740967,
"mean_token_accuracy": 0.9369244277477264,
"num_tokens": 1704650.0,
"step": 560
},
{
"entropy": 0.18540409342385827,
"epoch": 0.24,
"grad_norm": 10.75,
"learning_rate": 3.919270833333333e-06,
"loss": 0.1709328293800354,
"mean_token_accuracy": 0.9410766020417214,
"num_tokens": 1736731.0,
"step": 570
},
{
"entropy": 0.1986150752287358,
"epoch": 0.24421052631578946,
"grad_norm": 12.3125,
"learning_rate": 3.897569444444444e-06,
"loss": 0.22206108570098876,
"mean_token_accuracy": 0.9357864424586296,
"num_tokens": 1768488.0,
"step": 580
},
{
"entropy": 0.1802667098119855,
"epoch": 0.24842105263157896,
"grad_norm": 6.375,
"learning_rate": 3.8758680555555565e-06,
"loss": 0.18710933923721312,
"mean_token_accuracy": 0.9412250213325024,
"num_tokens": 1799166.0,
"step": 590
},
{
"entropy": 0.17089016041718424,
"epoch": 0.25263157894736843,
"grad_norm": 12.0,
"learning_rate": 3.854166666666667e-06,
"loss": 0.18744715452194213,
"mean_token_accuracy": 0.9394571520388126,
"num_tokens": 1830122.0,
"step": 600
},
{
"entropy": 0.20793215851299465,
"epoch": 0.25684210526315787,
"grad_norm": 7.78125,
"learning_rate": 3.832465277777778e-06,
"loss": 0.234443998336792,
"mean_token_accuracy": 0.9333168506622315,
"num_tokens": 1862016.0,
"step": 610
},
{
"entropy": 0.20435764044523239,
"epoch": 0.26105263157894737,
"grad_norm": 5.78125,
"learning_rate": 3.8107638888888894e-06,
"loss": 0.23094916343688965,
"mean_token_accuracy": 0.9356762997806072,
"num_tokens": 1893262.0,
"step": 620
},
{
"entropy": 0.16803635912947357,
"epoch": 0.26526315789473687,
"grad_norm": 7.53125,
"learning_rate": 3.7890625e-06,
"loss": 0.17021799087524414,
"mean_token_accuracy": 0.9433802559971809,
"num_tokens": 1926661.0,
"step": 630
},
{
"entropy": 0.1832001986913383,
"epoch": 0.2694736842105263,
"grad_norm": 8.5625,
"learning_rate": 3.7673611111111114e-06,
"loss": 0.19909589290618895,
"mean_token_accuracy": 0.9378570787608623,
"num_tokens": 1957342.0,
"step": 640
},
{
"entropy": 0.1613461917731911,
"epoch": 0.2736842105263158,
"grad_norm": 6.0,
"learning_rate": 3.7456597222222223e-06,
"loss": 0.16491103172302246,
"mean_token_accuracy": 0.9445122793316841,
"num_tokens": 1988112.0,
"step": 650
},
{
"entropy": 0.19069023090414702,
"epoch": 0.27789473684210525,
"grad_norm": 10.8125,
"learning_rate": 3.7239583333333335e-06,
"loss": 0.19739652872085572,
"mean_token_accuracy": 0.9412198103964329,
"num_tokens": 2018814.0,
"step": 660
},
{
"entropy": 0.19063587812706828,
"epoch": 0.28210526315789475,
"grad_norm": 6.0,
"learning_rate": 3.7022569444444443e-06,
"loss": 0.19181153774261475,
"mean_token_accuracy": 0.9380034580826759,
"num_tokens": 2049341.0,
"step": 670
},
{
"entropy": 0.19904036330990493,
"epoch": 0.2863157894736842,
"grad_norm": 12.5625,
"learning_rate": 3.680555555555556e-06,
"loss": 0.20599710941314697,
"mean_token_accuracy": 0.9368999592959881,
"num_tokens": 2079296.0,
"step": 680
},
{
"entropy": 0.19427463631145656,
"epoch": 0.2905263157894737,
"grad_norm": 5.71875,
"learning_rate": 3.6588541666666672e-06,
"loss": 0.18761125802993775,
"mean_token_accuracy": 0.9367304682731629,
"num_tokens": 2109208.0,
"step": 690
},
{
"entropy": 0.16103245173580943,
"epoch": 0.29473684210526313,
"grad_norm": 4.03125,
"learning_rate": 3.637152777777778e-06,
"loss": 0.14467405080795287,
"mean_token_accuracy": 0.9430748097598552,
"num_tokens": 2140169.0,
"step": 700
},
{
"entropy": 0.18653456503525376,
"epoch": 0.29894736842105263,
"grad_norm": 8.5625,
"learning_rate": 3.6154513888888893e-06,
"loss": 0.19110026359558105,
"mean_token_accuracy": 0.9356968715786934,
"num_tokens": 2169188.0,
"step": 710
},
{
"entropy": 0.1778560657054186,
"epoch": 0.3031578947368421,
"grad_norm": 5.84375,
"learning_rate": 3.59375e-06,
"loss": 0.19346174001693725,
"mean_token_accuracy": 0.9388452127575875,
"num_tokens": 2201132.0,
"step": 720
},
{
"entropy": 0.1761186286341399,
"epoch": 0.30736842105263157,
"grad_norm": 6.1875,
"learning_rate": 3.5720486111111114e-06,
"loss": 0.17763736248016357,
"mean_token_accuracy": 0.9394733160734177,
"num_tokens": 2231368.0,
"step": 730
},
{
"entropy": 0.2061962445732206,
"epoch": 0.31157894736842107,
"grad_norm": 7.28125,
"learning_rate": 3.5503472222222226e-06,
"loss": 0.21218445301055908,
"mean_token_accuracy": 0.9361796006560326,
"num_tokens": 2260621.0,
"step": 740
},
{
"entropy": 0.18782778745517134,
"epoch": 0.3157894736842105,
"grad_norm": 8.375,
"learning_rate": 3.5286458333333334e-06,
"loss": 0.21144359111785888,
"mean_token_accuracy": 0.9322924494743348,
"num_tokens": 2292074.0,
"step": 750
},
{
"entropy": 0.16837490680627526,
"epoch": 0.32,
"grad_norm": 8.9375,
"learning_rate": 3.5069444444444447e-06,
"loss": 0.17376952171325682,
"mean_token_accuracy": 0.9448926664888859,
"num_tokens": 2321255.0,
"step": 760
},
{
"entropy": 0.1900732083246112,
"epoch": 0.32421052631578945,
"grad_norm": 9.75,
"learning_rate": 3.485243055555556e-06,
"loss": 0.21094374656677245,
"mean_token_accuracy": 0.9347058288753033,
"num_tokens": 2352817.0,
"step": 770
},
{
"entropy": 0.19717438989318908,
"epoch": 0.32842105263157895,
"grad_norm": 9.125,
"learning_rate": 3.463541666666667e-06,
"loss": 0.19277981519699097,
"mean_token_accuracy": 0.9365353070199489,
"num_tokens": 2382010.0,
"step": 780
},
{
"entropy": 0.18062740950845182,
"epoch": 0.33263157894736844,
"grad_norm": 7.21875,
"learning_rate": 3.4418402777777784e-06,
"loss": 0.1980929493904114,
"mean_token_accuracy": 0.9367008984088898,
"num_tokens": 2413871.0,
"step": 790
},
{
"entropy": 0.18262718091718852,
"epoch": 0.3368421052631579,
"grad_norm": 11.375,
"learning_rate": 3.420138888888889e-06,
"loss": 0.21326255798339844,
"mean_token_accuracy": 0.939043466001749,
"num_tokens": 2443556.0,
"step": 800
},
{
"entropy": 0.1931037397123873,
"epoch": 0.3410526315789474,
"grad_norm": 8.25,
"learning_rate": 3.3984375000000004e-06,
"loss": 0.2050724744796753,
"mean_token_accuracy": 0.9386087417602539,
"num_tokens": 2472709.0,
"step": 810
},
{
"entropy": 0.17652380443178117,
"epoch": 0.3452631578947368,
"grad_norm": 9.8125,
"learning_rate": 3.3767361111111113e-06,
"loss": 0.18632233142852783,
"mean_token_accuracy": 0.9410148099064827,
"num_tokens": 2502787.0,
"step": 820
},
{
"entropy": 0.18900102768093346,
"epoch": 0.3494736842105263,
"grad_norm": 20.75,
"learning_rate": 3.3550347222222225e-06,
"loss": 0.20314161777496337,
"mean_token_accuracy": 0.9356084302067756,
"num_tokens": 2534024.0,
"step": 830
},
{
"entropy": 0.1738276852760464,
"epoch": 0.35368421052631577,
"grad_norm": 10.1875,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.19026525020599366,
"mean_token_accuracy": 0.9386918649077416,
"num_tokens": 2565340.0,
"step": 840
},
{
"entropy": 0.17577651813626288,
"epoch": 0.35789473684210527,
"grad_norm": 18.375,
"learning_rate": 3.3116319444444446e-06,
"loss": 0.1828848600387573,
"mean_token_accuracy": 0.9417739301919937,
"num_tokens": 2594835.0,
"step": 850
},
{
"entropy": 0.19011623142287135,
"epoch": 0.36210526315789476,
"grad_norm": 10.25,
"learning_rate": 3.2899305555555562e-06,
"loss": 0.20780632495880128,
"mean_token_accuracy": 0.9356612503528595,
"num_tokens": 2625348.0,
"step": 860
},
{
"entropy": 0.17401062482967972,
"epoch": 0.3663157894736842,
"grad_norm": 9.5,
"learning_rate": 3.268229166666667e-06,
"loss": 0.19232455492019654,
"mean_token_accuracy": 0.9413411311805249,
"num_tokens": 2656663.0,
"step": 870
},
{
"entropy": 0.2042026157025248,
"epoch": 0.3705263157894737,
"grad_norm": 5.625,
"learning_rate": 3.2465277777777783e-06,
"loss": 0.21286656856536865,
"mean_token_accuracy": 0.9318742267787457,
"num_tokens": 2686890.0,
"step": 880
},
{
"entropy": 0.18489634501747787,
"epoch": 0.37473684210526315,
"grad_norm": 5.875,
"learning_rate": 3.224826388888889e-06,
"loss": 0.1951343297958374,
"mean_token_accuracy": 0.9396946728229523,
"num_tokens": 2716021.0,
"step": 890
},
{
"entropy": 0.1702876826748252,
"epoch": 0.37894736842105264,
"grad_norm": 4.5,
"learning_rate": 3.2031250000000004e-06,
"loss": 0.20316264629364014,
"mean_token_accuracy": 0.9405752472579479,
"num_tokens": 2746087.0,
"step": 900
},
{
"entropy": 0.17025947191286833,
"epoch": 0.3831578947368421,
"grad_norm": 5.40625,
"learning_rate": 3.181423611111111e-06,
"loss": 0.1797630548477173,
"mean_token_accuracy": 0.9427746705710888,
"num_tokens": 2775880.0,
"step": 910
},
{
"entropy": 0.2002503348980099,
"epoch": 0.3873684210526316,
"grad_norm": 8.6875,
"learning_rate": 3.1597222222222224e-06,
"loss": 0.19509780406951904,
"mean_token_accuracy": 0.9372896805405617,
"num_tokens": 2806354.0,
"step": 920
},
{
"entropy": 0.18012529672123492,
"epoch": 0.391578947368421,
"grad_norm": 4.40625,
"learning_rate": 3.1380208333333332e-06,
"loss": 0.1744396448135376,
"mean_token_accuracy": 0.9429976627230644,
"num_tokens": 2838779.0,
"step": 930
},
{
"entropy": 0.1940267413854599,
"epoch": 0.3957894736842105,
"grad_norm": 7.25,
"learning_rate": 3.1163194444444445e-06,
"loss": 0.19945181608200074,
"mean_token_accuracy": 0.9355903774499893,
"num_tokens": 2870567.0,
"step": 940
},
{
"entropy": 0.1718983714701608,
"epoch": 0.4,
"grad_norm": 11.0,
"learning_rate": 3.094618055555556e-06,
"loss": 0.16918015480041504,
"mean_token_accuracy": 0.9435592129826545,
"num_tokens": 2900643.0,
"step": 950
},
{
"entropy": 0.17784137637354433,
"epoch": 0.40421052631578946,
"grad_norm": 7.75,
"learning_rate": 3.072916666666667e-06,
"loss": 0.18423346281051636,
"mean_token_accuracy": 0.9385634325444698,
"num_tokens": 2931200.0,
"step": 960
},
{
"entropy": 0.21101772908587008,
"epoch": 0.40842105263157896,
"grad_norm": 11.6875,
"learning_rate": 3.051215277777778e-06,
"loss": 0.2702996253967285,
"mean_token_accuracy": 0.9345157586038113,
"num_tokens": 2962480.0,
"step": 970
},
{
"entropy": 0.17290567103773355,
"epoch": 0.4126315789473684,
"grad_norm": 10.8125,
"learning_rate": 3.029513888888889e-06,
"loss": 0.17511870861053466,
"mean_token_accuracy": 0.942404218018055,
"num_tokens": 2993860.0,
"step": 980
},
{
"entropy": 0.16266593500040472,
"epoch": 0.4168421052631579,
"grad_norm": 8.3125,
"learning_rate": 3.0078125000000003e-06,
"loss": 0.1581684708595276,
"mean_token_accuracy": 0.9443985551595688,
"num_tokens": 3025733.0,
"step": 990
},
{
"entropy": 0.1775346302194521,
"epoch": 0.42105263157894735,
"grad_norm": 4.4375,
"learning_rate": 2.986111111111111e-06,
"loss": 0.18650579452514648,
"mean_token_accuracy": 0.938476724177599,
"num_tokens": 3055975.0,
"step": 1000
},
{
"entropy": 0.1736095615196973,
"epoch": 0.42526315789473684,
"grad_norm": 9.125,
"learning_rate": 2.9644097222222223e-06,
"loss": 0.18074491024017333,
"mean_token_accuracy": 0.9398947678506374,
"num_tokens": 3086913.0,
"step": 1010
},
{
"entropy": 0.1699895558413118,
"epoch": 0.42947368421052634,
"grad_norm": 8.6875,
"learning_rate": 2.9427083333333336e-06,
"loss": 0.19113610982894896,
"mean_token_accuracy": 0.9418164797127246,
"num_tokens": 3121488.0,
"step": 1020
},
{
"entropy": 0.16524689896032213,
"epoch": 0.4336842105263158,
"grad_norm": 8.75,
"learning_rate": 2.9210069444444444e-06,
"loss": 0.185565721988678,
"mean_token_accuracy": 0.9433472394943238,
"num_tokens": 3151445.0,
"step": 1030
},
{
"entropy": 0.14927028636448086,
"epoch": 0.4378947368421053,
"grad_norm": 8.1875,
"learning_rate": 2.899305555555556e-06,
"loss": 0.15171147584915162,
"mean_token_accuracy": 0.9442741066217423,
"num_tokens": 3181370.0,
"step": 1040
},
{
"entropy": 0.18830096670426427,
"epoch": 0.4421052631578947,
"grad_norm": 8.4375,
"learning_rate": 2.8776041666666673e-06,
"loss": 0.19921324253082276,
"mean_token_accuracy": 0.9361335694789886,
"num_tokens": 3212914.0,
"step": 1050
},
{
"entropy": 0.19236768442206084,
"epoch": 0.4463157894736842,
"grad_norm": 6.3125,
"learning_rate": 2.855902777777778e-06,
"loss": 0.20824000835418702,
"mean_token_accuracy": 0.9332416817545891,
"num_tokens": 3243370.0,
"step": 1060
},
{
"entropy": 0.19136800640262663,
"epoch": 0.45052631578947366,
"grad_norm": 6.5625,
"learning_rate": 2.8342013888888894e-06,
"loss": 0.1997889280319214,
"mean_token_accuracy": 0.9408642463386059,
"num_tokens": 3273424.0,
"step": 1070
},
{
"entropy": 0.17793954727239908,
"epoch": 0.45473684210526316,
"grad_norm": 10.625,
"learning_rate": 2.8125e-06,
"loss": 0.20664634704589843,
"mean_token_accuracy": 0.9388046510517597,
"num_tokens": 3303150.0,
"step": 1080
},
{
"entropy": 0.18900100397877395,
"epoch": 0.4589473684210526,
"grad_norm": 8.875,
"learning_rate": 2.7907986111111114e-06,
"loss": 0.2337502956390381,
"mean_token_accuracy": 0.9378764137625695,
"num_tokens": 3332125.0,
"step": 1090
},
{
"entropy": 0.2013873849529773,
"epoch": 0.4631578947368421,
"grad_norm": 4.90625,
"learning_rate": 2.7690972222222222e-06,
"loss": 0.2129305362701416,
"mean_token_accuracy": 0.9356573522090912,
"num_tokens": 3360726.0,
"step": 1100
},
{
"entropy": 0.16724729198031127,
"epoch": 0.4673684210526316,
"grad_norm": 6.78125,
"learning_rate": 2.7473958333333335e-06,
"loss": 0.17267029285430907,
"mean_token_accuracy": 0.9430627137422561,
"num_tokens": 3392537.0,
"step": 1110
},
{
"entropy": 0.1968531704682391,
"epoch": 0.47157894736842104,
"grad_norm": 6.40625,
"learning_rate": 2.7256944444444443e-06,
"loss": 0.2131186008453369,
"mean_token_accuracy": 0.9392065338790416,
"num_tokens": 3421034.0,
"step": 1120
},
{
"entropy": 0.18952712146565318,
"epoch": 0.47578947368421054,
"grad_norm": 8.1875,
"learning_rate": 2.703993055555556e-06,
"loss": 0.1882106900215149,
"mean_token_accuracy": 0.9399594850838184,
"num_tokens": 3451236.0,
"step": 1130
},
{
"entropy": 0.16791359800845385,
"epoch": 0.48,
"grad_norm": 6.90625,
"learning_rate": 2.682291666666667e-06,
"loss": 0.19798815250396729,
"mean_token_accuracy": 0.9428666599094868,
"num_tokens": 3483037.0,
"step": 1140
},
{
"entropy": 0.18943570028059184,
"epoch": 0.4842105263157895,
"grad_norm": 7.0625,
"learning_rate": 2.660590277777778e-06,
"loss": 0.18464272022247313,
"mean_token_accuracy": 0.938535039126873,
"num_tokens": 3512682.0,
"step": 1150
},
{
"entropy": 0.18527938476763667,
"epoch": 0.4884210526315789,
"grad_norm": 7.1875,
"learning_rate": 2.6388888888888893e-06,
"loss": 0.21876392364501954,
"mean_token_accuracy": 0.9350791074335575,
"num_tokens": 3542555.0,
"step": 1160
},
{
"entropy": 0.17846323440317063,
"epoch": 0.4926315789473684,
"grad_norm": 7.125,
"learning_rate": 2.6171875e-06,
"loss": 0.18390936851501466,
"mean_token_accuracy": 0.9420042358338833,
"num_tokens": 3574058.0,
"step": 1170
},
{
"entropy": 0.19397271373309194,
"epoch": 0.4968421052631579,
"grad_norm": 6.0625,
"learning_rate": 2.5954861111111113e-06,
"loss": 0.1811495304107666,
"mean_token_accuracy": 0.9370748721063137,
"num_tokens": 3606475.0,
"step": 1180
},
{
"entropy": 0.15141290938481688,
"epoch": 0.5010526315789474,
"grad_norm": 6.5,
"learning_rate": 2.573784722222222e-06,
"loss": 0.15798022747039794,
"mean_token_accuracy": 0.9513927109539508,
"num_tokens": 3638662.0,
"step": 1190
},
{
"entropy": 0.18826927775517105,
"epoch": 0.5052631578947369,
"grad_norm": 9.0625,
"learning_rate": 2.5520833333333334e-06,
"loss": 0.18200069665908813,
"mean_token_accuracy": 0.9414383672177792,
"num_tokens": 3669896.0,
"step": 1200
},
{
"entropy": 0.20096497626509519,
"epoch": 0.5094736842105263,
"grad_norm": 13.4375,
"learning_rate": 2.530381944444444e-06,
"loss": 0.22587316036224364,
"mean_token_accuracy": 0.9326581291854381,
"num_tokens": 3698316.0,
"step": 1210
},
{
"entropy": 0.19803793909959494,
"epoch": 0.5136842105263157,
"grad_norm": 8.625,
"learning_rate": 2.508680555555556e-06,
"loss": 0.21513104438781738,
"mean_token_accuracy": 0.9399372972548008,
"num_tokens": 3728552.0,
"step": 1220
},
{
"entropy": 0.16103445165790617,
"epoch": 0.5178947368421053,
"grad_norm": 9.6875,
"learning_rate": 2.4869791666666667e-06,
"loss": 0.17716561555862426,
"mean_token_accuracy": 0.9383736155927181,
"num_tokens": 3761109.0,
"step": 1230
},
{
"entropy": 0.17295233584009112,
"epoch": 0.5221052631578947,
"grad_norm": 7.3125,
"learning_rate": 2.465277777777778e-06,
"loss": 0.1894593596458435,
"mean_token_accuracy": 0.9400911360979081,
"num_tokens": 3790881.0,
"step": 1240
},
{
"entropy": 0.1784422152210027,
"epoch": 0.5263157894736842,
"grad_norm": 7.15625,
"learning_rate": 2.443576388888889e-06,
"loss": 0.1849764585494995,
"mean_token_accuracy": 0.94148775562644,
"num_tokens": 3820940.0,
"step": 1250
},
{
"entropy": 0.2000632504466921,
"epoch": 0.5305263157894737,
"grad_norm": 9.375,
"learning_rate": 2.421875e-06,
"loss": 0.20038533210754395,
"mean_token_accuracy": 0.9400728508830071,
"num_tokens": 3849110.0,
"step": 1260
},
{
"entropy": 0.1836847463157028,
"epoch": 0.5347368421052632,
"grad_norm": 13.8125,
"learning_rate": 2.4001736111111112e-06,
"loss": 0.1924800157546997,
"mean_token_accuracy": 0.941128908097744,
"num_tokens": 3879147.0,
"step": 1270
},
{
"entropy": 0.16738553042523563,
"epoch": 0.5389473684210526,
"grad_norm": 8.9375,
"learning_rate": 2.3784722222222225e-06,
"loss": 0.16631866693496705,
"mean_token_accuracy": 0.9407841734588146,
"num_tokens": 3912281.0,
"step": 1280
},
{
"entropy": 0.18249022141098975,
"epoch": 0.5431578947368421,
"grad_norm": 7.5625,
"learning_rate": 2.3567708333333337e-06,
"loss": 0.20991320610046388,
"mean_token_accuracy": 0.9392150454223156,
"num_tokens": 3942679.0,
"step": 1290
},
{
"entropy": 0.19449416091665625,
"epoch": 0.5473684210526316,
"grad_norm": 5.96875,
"learning_rate": 2.3350694444444445e-06,
"loss": 0.20127761363983154,
"mean_token_accuracy": 0.9419910401105881,
"num_tokens": 3973714.0,
"step": 1300
},
{
"entropy": 0.18408903060480952,
"epoch": 0.5515789473684211,
"grad_norm": 6.5,
"learning_rate": 2.3133680555555558e-06,
"loss": 0.18167479038238527,
"mean_token_accuracy": 0.940599375218153,
"num_tokens": 4003672.0,
"step": 1310
},
{
"entropy": 0.17429547207430005,
"epoch": 0.5557894736842105,
"grad_norm": 6.0,
"learning_rate": 2.2916666666666666e-06,
"loss": 0.17235063314437865,
"mean_token_accuracy": 0.9425551310181618,
"num_tokens": 4033615.0,
"step": 1320
},
{
"entropy": 0.19979104902595282,
"epoch": 0.56,
"grad_norm": 7.28125,
"learning_rate": 2.2699652777777783e-06,
"loss": 0.19923921823501586,
"mean_token_accuracy": 0.9354177258908749,
"num_tokens": 4063157.0,
"step": 1330
},
{
"entropy": 0.172834698157385,
"epoch": 0.5642105263157895,
"grad_norm": 9.0625,
"learning_rate": 2.248263888888889e-06,
"loss": 0.16350815296173096,
"mean_token_accuracy": 0.9458058536052704,
"num_tokens": 4096030.0,
"step": 1340
},
{
"entropy": 0.16383765279315413,
"epoch": 0.5684210526315789,
"grad_norm": 8.5625,
"learning_rate": 2.2265625000000003e-06,
"loss": 0.16651760339736937,
"mean_token_accuracy": 0.9458472564816475,
"num_tokens": 4128179.0,
"step": 1350
},
{
"entropy": 0.17017353922128678,
"epoch": 0.5726315789473684,
"grad_norm": 7.40625,
"learning_rate": 2.204861111111111e-06,
"loss": 0.19026347398757934,
"mean_token_accuracy": 0.9381780102849007,
"num_tokens": 4155994.0,
"step": 1360
},
{
"entropy": 0.1771279716398567,
"epoch": 0.5768421052631579,
"grad_norm": 5.71875,
"learning_rate": 2.1831597222222224e-06,
"loss": 0.19147398471832275,
"mean_token_accuracy": 0.9430553078651428,
"num_tokens": 4186351.0,
"step": 1370
},
{
"entropy": 0.19348430414684117,
"epoch": 0.5810526315789474,
"grad_norm": 7.125,
"learning_rate": 2.1614583333333336e-06,
"loss": 0.1967188000679016,
"mean_token_accuracy": 0.9417100548744202,
"num_tokens": 4217267.0,
"step": 1380
},
{
"entropy": 0.1781235427595675,
"epoch": 0.5852631578947368,
"grad_norm": 9.6875,
"learning_rate": 2.1397569444444445e-06,
"loss": 0.1788840651512146,
"mean_token_accuracy": 0.9439761303365231,
"num_tokens": 4245898.0,
"step": 1390
},
{
"entropy": 0.18975053504109382,
"epoch": 0.5894736842105263,
"grad_norm": 6.90625,
"learning_rate": 2.1180555555555557e-06,
"loss": 0.20416486263275146,
"mean_token_accuracy": 0.9330022357404232,
"num_tokens": 4276408.0,
"step": 1400
},
{
"entropy": 0.15169767290353775,
"epoch": 0.5936842105263158,
"grad_norm": 8.125,
"learning_rate": 2.096354166666667e-06,
"loss": 0.1466461420059204,
"mean_token_accuracy": 0.9468090102076531,
"num_tokens": 4306229.0,
"step": 1410
},
{
"entropy": 0.17125667606014758,
"epoch": 0.5978947368421053,
"grad_norm": 11.5625,
"learning_rate": 2.074652777777778e-06,
"loss": 0.17265563011169432,
"mean_token_accuracy": 0.9404310546815395,
"num_tokens": 4336858.0,
"step": 1420
},
{
"entropy": 0.18555003069341183,
"epoch": 0.6021052631578947,
"grad_norm": 10.4375,
"learning_rate": 2.052951388888889e-06,
"loss": 0.21136150360107422,
"mean_token_accuracy": 0.9409567311406135,
"num_tokens": 4369258.0,
"step": 1430
},
{
"entropy": 0.1963237697724253,
"epoch": 0.6063157894736843,
"grad_norm": 7.78125,
"learning_rate": 2.0312500000000002e-06,
"loss": 0.20975203514099122,
"mean_token_accuracy": 0.9345369815826416,
"num_tokens": 4397776.0,
"step": 1440
},
{
"entropy": 0.17916312967427075,
"epoch": 0.6105263157894737,
"grad_norm": 9.375,
"learning_rate": 2.009548611111111e-06,
"loss": 0.18616671562194825,
"mean_token_accuracy": 0.9408248156309128,
"num_tokens": 4427110.0,
"step": 1450
},
{
"entropy": 0.16703516799025236,
"epoch": 0.6147368421052631,
"grad_norm": 8.125,
"learning_rate": 1.9878472222222223e-06,
"loss": 0.16765722036361694,
"mean_token_accuracy": 0.9442552007734776,
"num_tokens": 4457255.0,
"step": 1460
},
{
"entropy": 0.15452561462298037,
"epoch": 0.6189473684210526,
"grad_norm": 11.875,
"learning_rate": 1.9661458333333335e-06,
"loss": 0.17154412269592284,
"mean_token_accuracy": 0.9427635096013546,
"num_tokens": 4489436.0,
"step": 1470
},
{
"entropy": 0.15665105115622283,
"epoch": 0.6231578947368421,
"grad_norm": 11.0625,
"learning_rate": 1.944444444444445e-06,
"loss": 0.14704623222351074,
"mean_token_accuracy": 0.9460532791912556,
"num_tokens": 4519132.0,
"step": 1480
},
{
"entropy": 0.16253583596553653,
"epoch": 0.6273684210526316,
"grad_norm": 6.21875,
"learning_rate": 1.9227430555555556e-06,
"loss": 0.1866912603378296,
"mean_token_accuracy": 0.9407590955495835,
"num_tokens": 4550041.0,
"step": 1490
},
{
"entropy": 0.16826875344850123,
"epoch": 0.631578947368421,
"grad_norm": 7.40625,
"learning_rate": 1.9010416666666666e-06,
"loss": 0.1752256989479065,
"mean_token_accuracy": 0.9387107148766518,
"num_tokens": 4578389.0,
"step": 1500
},
{
"entropy": 0.19358136910013854,
"epoch": 0.6357894736842106,
"grad_norm": 5.625,
"learning_rate": 1.879340277777778e-06,
"loss": 0.21114234924316405,
"mean_token_accuracy": 0.9343519538640976,
"num_tokens": 4607459.0,
"step": 1510
},
{
"entropy": 0.17116468152962624,
"epoch": 0.64,
"grad_norm": 7.75,
"learning_rate": 1.8576388888888891e-06,
"loss": 0.17217620611190795,
"mean_token_accuracy": 0.9416831895709038,
"num_tokens": 4638613.0,
"step": 1520
},
{
"entropy": 0.2053681869059801,
"epoch": 0.6442105263157895,
"grad_norm": 6.9375,
"learning_rate": 1.8359375000000002e-06,
"loss": 0.22673625946044923,
"mean_token_accuracy": 0.9339988075196743,
"num_tokens": 4666917.0,
"step": 1530
},
{
"entropy": 0.1771626771427691,
"epoch": 0.6484210526315789,
"grad_norm": 6.875,
"learning_rate": 1.8142361111111112e-06,
"loss": 0.17564224004745482,
"mean_token_accuracy": 0.9413302429020405,
"num_tokens": 4696949.0,
"step": 1540
},
{
"entropy": 0.16223793958779426,
"epoch": 0.6526315789473685,
"grad_norm": 7.4375,
"learning_rate": 1.7925347222222222e-06,
"loss": 0.1730146288871765,
"mean_token_accuracy": 0.9461438663303852,
"num_tokens": 4726446.0,
"step": 1550
},
{
"entropy": 0.1785475114127621,
"epoch": 0.6568421052631579,
"grad_norm": 9.4375,
"learning_rate": 1.7708333333333337e-06,
"loss": 0.17630915641784667,
"mean_token_accuracy": 0.941747710108757,
"num_tokens": 4757299.0,
"step": 1560
},
{
"entropy": 0.1837959503289312,
"epoch": 0.6610526315789473,
"grad_norm": 6.9375,
"learning_rate": 1.7491319444444447e-06,
"loss": 0.21238627433776855,
"mean_token_accuracy": 0.9363793157041073,
"num_tokens": 4786004.0,
"step": 1570
},
{
"entropy": 0.17369262645952405,
"epoch": 0.6652631578947369,
"grad_norm": 8.3125,
"learning_rate": 1.7274305555555557e-06,
"loss": 0.17695680856704712,
"mean_token_accuracy": 0.9470903754234314,
"num_tokens": 4817544.0,
"step": 1580
},
{
"entropy": 0.20245264389086515,
"epoch": 0.6694736842105263,
"grad_norm": 7.125,
"learning_rate": 1.7057291666666668e-06,
"loss": 0.2123798370361328,
"mean_token_accuracy": 0.9319963820278645,
"num_tokens": 4847565.0,
"step": 1590
},
{
"entropy": 0.16917385840788485,
"epoch": 0.6736842105263158,
"grad_norm": 7.15625,
"learning_rate": 1.684027777777778e-06,
"loss": 0.15817831754684447,
"mean_token_accuracy": 0.9451489493250846,
"num_tokens": 4879212.0,
"step": 1600
},
{
"entropy": 0.18626669934019446,
"epoch": 0.6778947368421052,
"grad_norm": 9.25,
"learning_rate": 1.662326388888889e-06,
"loss": 0.1963236451148987,
"mean_token_accuracy": 0.9376043990254402,
"num_tokens": 4911216.0,
"step": 1610
},
{
"entropy": 0.1777785701211542,
"epoch": 0.6821052631578948,
"grad_norm": 6.375,
"learning_rate": 1.640625e-06,
"loss": 0.186847722530365,
"mean_token_accuracy": 0.9369994647800922,
"num_tokens": 4943694.0,
"step": 1620
},
{
"entropy": 0.19736593994311988,
"epoch": 0.6863157894736842,
"grad_norm": 12.5625,
"learning_rate": 1.618923611111111e-06,
"loss": 0.22199268341064454,
"mean_token_accuracy": 0.9357027292251587,
"num_tokens": 4972032.0,
"step": 1630
},
{
"entropy": 0.1932901387102902,
"epoch": 0.6905263157894737,
"grad_norm": 9.9375,
"learning_rate": 1.5972222222222221e-06,
"loss": 0.19801300764083862,
"mean_token_accuracy": 0.9328659147024154,
"num_tokens": 5001985.0,
"step": 1640
},
{
"entropy": 0.18727553612552583,
"epoch": 0.6947368421052632,
"grad_norm": 7.25,
"learning_rate": 1.5755208333333336e-06,
"loss": 0.200944185256958,
"mean_token_accuracy": 0.9315911903977394,
"num_tokens": 5031619.0,
"step": 1650
},
{
"entropy": 0.18988265902735293,
"epoch": 0.6989473684210527,
"grad_norm": 7.375,
"learning_rate": 1.5538194444444446e-06,
"loss": 0.18995364904403686,
"mean_token_accuracy": 0.9380945399403572,
"num_tokens": 5061525.0,
"step": 1660
},
{
"entropy": 0.1723124712705612,
"epoch": 0.7031578947368421,
"grad_norm": 10.0625,
"learning_rate": 1.5321180555555556e-06,
"loss": 0.18223432302474976,
"mean_token_accuracy": 0.936246433109045,
"num_tokens": 5092491.0,
"step": 1670
},
{
"entropy": 0.1763459252426401,
"epoch": 0.7073684210526315,
"grad_norm": 12.625,
"learning_rate": 1.5104166666666667e-06,
"loss": 0.19533677101135255,
"mean_token_accuracy": 0.9401971742510795,
"num_tokens": 5123692.0,
"step": 1680
},
{
"entropy": 0.17391538694500924,
"epoch": 0.7115789473684211,
"grad_norm": 5.34375,
"learning_rate": 1.488715277777778e-06,
"loss": 0.1833168625831604,
"mean_token_accuracy": 0.9375192701816559,
"num_tokens": 5154327.0,
"step": 1690
},
{
"entropy": 0.19447861842345446,
"epoch": 0.7157894736842105,
"grad_norm": 6.34375,
"learning_rate": 1.4670138888888892e-06,
"loss": 0.2035297393798828,
"mean_token_accuracy": 0.9407950587570667,
"num_tokens": 5185441.0,
"step": 1700
},
{
"entropy": 0.17104214280843735,
"epoch": 0.72,
"grad_norm": 10.125,
"learning_rate": 1.4453125000000002e-06,
"loss": 0.19187886714935304,
"mean_token_accuracy": 0.9413264997303485,
"num_tokens": 5214618.0,
"step": 1710
},
{
"entropy": 0.164881079364568,
"epoch": 0.7242105263157895,
"grad_norm": 10.625,
"learning_rate": 1.4236111111111112e-06,
"loss": 0.17205849885940552,
"mean_token_accuracy": 0.9436387285590172,
"num_tokens": 5244872.0,
"step": 1720
},
{
"entropy": 0.18138507837429643,
"epoch": 0.728421052631579,
"grad_norm": 8.4375,
"learning_rate": 1.4019097222222223e-06,
"loss": 0.18944886922836304,
"mean_token_accuracy": 0.9419176429510117,
"num_tokens": 5274811.0,
"step": 1730
},
{
"entropy": 0.15619251895695924,
"epoch": 0.7326315789473684,
"grad_norm": 6.25,
"learning_rate": 1.3802083333333335e-06,
"loss": 0.15303416252136232,
"mean_token_accuracy": 0.9456774339079856,
"num_tokens": 5305936.0,
"step": 1740
},
{
"entropy": 0.17621302837505937,
"epoch": 0.7368421052631579,
"grad_norm": 8.125,
"learning_rate": 1.3585069444444445e-06,
"loss": 0.16394418478012085,
"mean_token_accuracy": 0.9439542882144452,
"num_tokens": 5336619.0,
"step": 1750
},
{
"entropy": 0.1895997554762289,
"epoch": 0.7410526315789474,
"grad_norm": 9.0,
"learning_rate": 1.3368055555555556e-06,
"loss": 0.20419509410858155,
"mean_token_accuracy": 0.9383566424250602,
"num_tokens": 5366166.0,
"step": 1760
},
{
"entropy": 0.15430729234358295,
"epoch": 0.7452631578947368,
"grad_norm": 7.96875,
"learning_rate": 1.3151041666666666e-06,
"loss": 0.14866267442703246,
"mean_token_accuracy": 0.9463915720582008,
"num_tokens": 5395903.0,
"step": 1770
},
{
"entropy": 0.1961900666821748,
"epoch": 0.7494736842105263,
"grad_norm": 7.53125,
"learning_rate": 1.293402777777778e-06,
"loss": 0.20117769241333008,
"mean_token_accuracy": 0.9342163056135178,
"num_tokens": 5427462.0,
"step": 1780
},
{
"entropy": 0.180325382668525,
"epoch": 0.7536842105263157,
"grad_norm": 10.875,
"learning_rate": 1.271701388888889e-06,
"loss": 0.19998364448547362,
"mean_token_accuracy": 0.9385084345936775,
"num_tokens": 5456165.0,
"step": 1790
},
{
"entropy": 0.18382872603833675,
"epoch": 0.7578947368421053,
"grad_norm": 6.96875,
"learning_rate": 1.25e-06,
"loss": 0.18795562982559205,
"mean_token_accuracy": 0.9401052162051201,
"num_tokens": 5484297.0,
"step": 1800
},
{
"entropy": 0.1735987264662981,
"epoch": 0.7621052631578947,
"grad_norm": 6.75,
"learning_rate": 1.2282986111111111e-06,
"loss": 0.18496283292770385,
"mean_token_accuracy": 0.9364599175751209,
"num_tokens": 5512121.0,
"step": 1810
},
{
"entropy": 0.15811273446306587,
"epoch": 0.7663157894736842,
"grad_norm": 8.375,
"learning_rate": 1.2065972222222224e-06,
"loss": 0.17440826892852784,
"mean_token_accuracy": 0.9474552102386952,
"num_tokens": 5540912.0,
"step": 1820
},
{
"entropy": 0.19428172940388322,
"epoch": 0.7705263157894737,
"grad_norm": 7.09375,
"learning_rate": 1.1848958333333334e-06,
"loss": 0.2328346014022827,
"mean_token_accuracy": 0.9367604151368141,
"num_tokens": 5570904.0,
"step": 1830
},
{
"entropy": 0.19383207242935896,
"epoch": 0.7747368421052632,
"grad_norm": 10.125,
"learning_rate": 1.1631944444444446e-06,
"loss": 0.20834689140319823,
"mean_token_accuracy": 0.9364984571933747,
"num_tokens": 5601902.0,
"step": 1840
},
{
"entropy": 0.1639871869701892,
"epoch": 0.7789473684210526,
"grad_norm": 7.21875,
"learning_rate": 1.1414930555555557e-06,
"loss": 0.15975459814071655,
"mean_token_accuracy": 0.9448182679712772,
"num_tokens": 5633013.0,
"step": 1850
},
{
"entropy": 0.17671056441031396,
"epoch": 0.783157894736842,
"grad_norm": 6.90625,
"learning_rate": 1.1197916666666667e-06,
"loss": 0.19243409633636474,
"mean_token_accuracy": 0.9421222470700741,
"num_tokens": 5665644.0,
"step": 1860
},
{
"entropy": 0.20545928478240966,
"epoch": 0.7873684210526316,
"grad_norm": 10.875,
"learning_rate": 1.098090277777778e-06,
"loss": 0.22782745361328124,
"mean_token_accuracy": 0.9283310487866402,
"num_tokens": 5696733.0,
"step": 1870
},
{
"entropy": 0.1771316953469068,
"epoch": 0.791578947368421,
"grad_norm": 12.0,
"learning_rate": 1.076388888888889e-06,
"loss": 0.20005078315734864,
"mean_token_accuracy": 0.9354067780077457,
"num_tokens": 5726809.0,
"step": 1880
},
{
"entropy": 0.1829876006115228,
"epoch": 0.7957894736842105,
"grad_norm": 4.375,
"learning_rate": 1.0546875e-06,
"loss": 0.17984312772750854,
"mean_token_accuracy": 0.9406855225563049,
"num_tokens": 5757443.0,
"step": 1890
},
{
"entropy": 0.17131042117252945,
"epoch": 0.8,
"grad_norm": 5.5625,
"learning_rate": 1.032986111111111e-06,
"loss": 0.187677800655365,
"mean_token_accuracy": 0.9410165570676327,
"num_tokens": 5787336.0,
"step": 1900
},
{
"entropy": 0.15520585421472788,
"epoch": 0.8042105263157895,
"grad_norm": 8.0625,
"learning_rate": 1.0112847222222223e-06,
"loss": 0.15040594339370728,
"mean_token_accuracy": 0.949649342149496,
"num_tokens": 5818737.0,
"step": 1910
},
{
"entropy": 0.19390389914624392,
"epoch": 0.8084210526315789,
"grad_norm": 7.875,
"learning_rate": 9.895833333333333e-07,
"loss": 0.19968183040618898,
"mean_token_accuracy": 0.9386158093810082,
"num_tokens": 5848788.0,
"step": 1920
},
{
"entropy": 0.16451029586605728,
"epoch": 0.8126315789473684,
"grad_norm": 8.4375,
"learning_rate": 9.678819444444446e-07,
"loss": 0.17298288345336915,
"mean_token_accuracy": 0.9406896255910396,
"num_tokens": 5878423.0,
"step": 1930
},
{
"entropy": 0.17370661203749477,
"epoch": 0.8168421052631579,
"grad_norm": 5.59375,
"learning_rate": 9.461805555555556e-07,
"loss": 0.17794467210769654,
"mean_token_accuracy": 0.9431041710078716,
"num_tokens": 5908453.0,
"step": 1940
},
{
"entropy": 0.1777374588418752,
"epoch": 0.8210526315789474,
"grad_norm": 11.875,
"learning_rate": 9.244791666666668e-07,
"loss": 0.20215635299682616,
"mean_token_accuracy": 0.9381940357387066,
"num_tokens": 5940889.0,
"step": 1950
},
{
"entropy": 0.18253268958069385,
"epoch": 0.8252631578947368,
"grad_norm": 5.5,
"learning_rate": 9.027777777777779e-07,
"loss": 0.17334474325180055,
"mean_token_accuracy": 0.9461725540459156,
"num_tokens": 5971947.0,
"step": 1960
},
{
"entropy": 0.1783546233084053,
"epoch": 0.8294736842105264,
"grad_norm": 6.65625,
"learning_rate": 8.81076388888889e-07,
"loss": 0.2018296718597412,
"mean_token_accuracy": 0.9374721601605416,
"num_tokens": 6004716.0,
"step": 1970
},
{
"entropy": 0.17445771326310933,
"epoch": 0.8336842105263158,
"grad_norm": 7.0,
"learning_rate": 8.59375e-07,
"loss": 0.16818779706954956,
"mean_token_accuracy": 0.9427588351070881,
"num_tokens": 6036766.0,
"step": 1980
},
{
"entropy": 0.18418881273828447,
"epoch": 0.8378947368421052,
"grad_norm": 8.375,
"learning_rate": 8.376736111111112e-07,
"loss": 0.21462113857269288,
"mean_token_accuracy": 0.937469869852066,
"num_tokens": 6065012.0,
"step": 1990
},
{
"entropy": 0.16037586382590235,
"epoch": 0.8421052631578947,
"grad_norm": 5.3125,
"learning_rate": 8.159722222222223e-07,
"loss": 0.17553248405456542,
"mean_token_accuracy": 0.9418002314865589,
"num_tokens": 6095994.0,
"step": 2000
},
{
"entropy": 0.18084662132896484,
"epoch": 0.8463157894736842,
"grad_norm": 5.34375,
"learning_rate": 7.942708333333333e-07,
"loss": 0.17438472509384156,
"mean_token_accuracy": 0.9446314513683319,
"num_tokens": 6126311.0,
"step": 2010
},
{
"entropy": 0.17917919345200062,
"epoch": 0.8505263157894737,
"grad_norm": 8.1875,
"learning_rate": 7.725694444444446e-07,
"loss": 0.18416545391082764,
"mean_token_accuracy": 0.9393374055624009,
"num_tokens": 6155779.0,
"step": 2020
},
{
"entropy": 0.17618270772509276,
"epoch": 0.8547368421052631,
"grad_norm": 11.6875,
"learning_rate": 7.508680555555556e-07,
"loss": 0.18657455444335938,
"mean_token_accuracy": 0.9405391819775104,
"num_tokens": 6185940.0,
"step": 2030
},
{
"entropy": 0.1900980792939663,
"epoch": 0.8589473684210527,
"grad_norm": 6.34375,
"learning_rate": 7.291666666666667e-07,
"loss": 0.22004635334014894,
"mean_token_accuracy": 0.9368100091814995,
"num_tokens": 6216119.0,
"step": 2040
},
{
"entropy": 0.1798396656755358,
"epoch": 0.8631578947368421,
"grad_norm": 7.75,
"learning_rate": 7.074652777777778e-07,
"loss": 0.17679187059402465,
"mean_token_accuracy": 0.9427471734583378,
"num_tokens": 6248190.0,
"step": 2050
},
{
"entropy": 0.1862468993291259,
"epoch": 0.8673684210526316,
"grad_norm": 8.25,
"learning_rate": 6.85763888888889e-07,
"loss": 0.19130966663360596,
"mean_token_accuracy": 0.9378809235990048,
"num_tokens": 6282715.0,
"step": 2060
},
{
"entropy": 0.18561029192060233,
"epoch": 0.871578947368421,
"grad_norm": 11.25,
"learning_rate": 6.640625e-07,
"loss": 0.18389569520950316,
"mean_token_accuracy": 0.9425614275038242,
"num_tokens": 6312639.0,
"step": 2070
},
{
"entropy": 0.17955731307156383,
"epoch": 0.8757894736842106,
"grad_norm": 5.75,
"learning_rate": 6.423611111111111e-07,
"loss": 0.18569419384002686,
"mean_token_accuracy": 0.9404567658901215,
"num_tokens": 6342390.0,
"step": 2080
},
{
"entropy": 0.16996940840035676,
"epoch": 0.88,
"grad_norm": 7.53125,
"learning_rate": 6.206597222222223e-07,
"loss": 0.18246359825134278,
"mean_token_accuracy": 0.9428071282804013,
"num_tokens": 6374191.0,
"step": 2090
},
{
"entropy": 0.19498055870644748,
"epoch": 0.8842105263157894,
"grad_norm": 7.0625,
"learning_rate": 5.989583333333335e-07,
"loss": 0.20460844039916992,
"mean_token_accuracy": 0.9390896797180176,
"num_tokens": 6403082.0,
"step": 2100
},
{
"entropy": 0.15782833809498698,
"epoch": 0.888421052631579,
"grad_norm": 8.8125,
"learning_rate": 5.772569444444445e-07,
"loss": 0.17403767108917237,
"mean_token_accuracy": 0.9430192783474922,
"num_tokens": 6434824.0,
"step": 2110
},
{
"entropy": 0.16636770479381086,
"epoch": 0.8926315789473684,
"grad_norm": 4.90625,
"learning_rate": 5.555555555555555e-07,
"loss": 0.16270433664321898,
"mean_token_accuracy": 0.9464202426373959,
"num_tokens": 6464051.0,
"step": 2120
},
{
"entropy": 0.18715114260558038,
"epoch": 0.8968421052631579,
"grad_norm": 8.5625,
"learning_rate": 5.338541666666667e-07,
"loss": 0.22732558250427246,
"mean_token_accuracy": 0.9373150266706943,
"num_tokens": 6493853.0,
"step": 2130
},
{
"entropy": 0.17378719956614078,
"epoch": 0.9010526315789473,
"grad_norm": 7.28125,
"learning_rate": 5.121527777777778e-07,
"loss": 0.1807337999343872,
"mean_token_accuracy": 0.9400206096470356,
"num_tokens": 6527705.0,
"step": 2140
},
{
"entropy": 0.18033494814299048,
"epoch": 0.9052631578947369,
"grad_norm": 5.875,
"learning_rate": 4.904513888888889e-07,
"loss": 0.19068191051483155,
"mean_token_accuracy": 0.937873587757349,
"num_tokens": 6555761.0,
"step": 2150
},
{
"entropy": 0.175303529528901,
"epoch": 0.9094736842105263,
"grad_norm": 8.125,
"learning_rate": 4.6875000000000006e-07,
"loss": 0.183641254901886,
"mean_token_accuracy": 0.9391517236828804,
"num_tokens": 6585723.0,
"step": 2160
},
{
"entropy": 0.17232977109961212,
"epoch": 0.9136842105263158,
"grad_norm": 3.890625,
"learning_rate": 4.4704861111111115e-07,
"loss": 0.18852951526641845,
"mean_token_accuracy": 0.940208625793457,
"num_tokens": 6615288.0,
"step": 2170
},
{
"entropy": 0.16042230552993714,
"epoch": 0.9178947368421052,
"grad_norm": 8.625,
"learning_rate": 4.253472222222223e-07,
"loss": 0.16894659996032715,
"mean_token_accuracy": 0.9419491074979305,
"num_tokens": 6644603.0,
"step": 2180
},
{
"entropy": 0.18052552677690983,
"epoch": 0.9221052631578948,
"grad_norm": 9.1875,
"learning_rate": 4.0364583333333337e-07,
"loss": 0.18952767848968505,
"mean_token_accuracy": 0.9380584709346295,
"num_tokens": 6673545.0,
"step": 2190
},
{
"entropy": 0.19028411931358277,
"epoch": 0.9263157894736842,
"grad_norm": 10.5625,
"learning_rate": 3.819444444444445e-07,
"loss": 0.18890902996063233,
"mean_token_accuracy": 0.9400756865739822,
"num_tokens": 6703299.0,
"step": 2200
},
{
"entropy": 0.16922345554921775,
"epoch": 0.9305263157894736,
"grad_norm": 6.84375,
"learning_rate": 3.6024305555555554e-07,
"loss": 0.17599536180496217,
"mean_token_accuracy": 0.9455938622355461,
"num_tokens": 6732719.0,
"step": 2210
},
{
"entropy": 0.15744123989716172,
"epoch": 0.9347368421052632,
"grad_norm": 6.5,
"learning_rate": 3.3854166666666667e-07,
"loss": 0.17910586595535277,
"mean_token_accuracy": 0.9452849693596364,
"num_tokens": 6765329.0,
"step": 2220
},
{
"entropy": 0.15953006697818636,
"epoch": 0.9389473684210526,
"grad_norm": 10.5,
"learning_rate": 3.168402777777778e-07,
"loss": 0.16083180904388428,
"mean_token_accuracy": 0.9451860629022122,
"num_tokens": 6796269.0,
"step": 2230
},
{
"entropy": 0.19982436632271855,
"epoch": 0.9431578947368421,
"grad_norm": 4.03125,
"learning_rate": 2.951388888888889e-07,
"loss": 0.1909162998199463,
"mean_token_accuracy": 0.9365056939423084,
"num_tokens": 6826464.0,
"step": 2240
},
{
"entropy": 0.1634247657377273,
"epoch": 0.9473684210526315,
"grad_norm": 7.75,
"learning_rate": 2.7343750000000003e-07,
"loss": 0.1653286933898926,
"mean_token_accuracy": 0.9445300824940205,
"num_tokens": 6857440.0,
"step": 2250
},
{
"entropy": 0.19435078646056353,
"epoch": 0.9515789473684211,
"grad_norm": 6.90625,
"learning_rate": 2.5173611111111117e-07,
"loss": 0.20611786842346191,
"mean_token_accuracy": 0.9351051561534405,
"num_tokens": 6887333.0,
"step": 2260
},
{
"entropy": 0.19693100345321,
"epoch": 0.9557894736842105,
"grad_norm": 8.6875,
"learning_rate": 2.3003472222222225e-07,
"loss": 0.1984722852706909,
"mean_token_accuracy": 0.937918345630169,
"num_tokens": 6917794.0,
"step": 2270
},
{
"entropy": 0.1728912627324462,
"epoch": 0.96,
"grad_norm": 4.875,
"learning_rate": 2.0833333333333333e-07,
"loss": 0.16558315753936767,
"mean_token_accuracy": 0.9425304509699345,
"num_tokens": 6947614.0,
"step": 2280
},
{
"entropy": 0.17391241467557847,
"epoch": 0.9642105263157895,
"grad_norm": 8.0625,
"learning_rate": 1.8663194444444444e-07,
"loss": 0.1844017267227173,
"mean_token_accuracy": 0.9372891336679459,
"num_tokens": 6978068.0,
"step": 2290
},
{
"entropy": 0.17354375659488142,
"epoch": 0.968421052631579,
"grad_norm": 7.5,
"learning_rate": 1.6493055555555558e-07,
"loss": 0.17987858057022094,
"mean_token_accuracy": 0.938211838901043,
"num_tokens": 7010536.0,
"step": 2300
},
{
"entropy": 0.2068662981968373,
"epoch": 0.9726315789473684,
"grad_norm": 10.0,
"learning_rate": 1.4322916666666666e-07,
"loss": 0.23096110820770263,
"mean_token_accuracy": 0.9326581478118896,
"num_tokens": 7042095.0,
"step": 2310
},
{
"entropy": 0.16978850068990142,
"epoch": 0.9768421052631578,
"grad_norm": 8.4375,
"learning_rate": 1.215277777777778e-07,
"loss": 0.17138477563858032,
"mean_token_accuracy": 0.9445147432386876,
"num_tokens": 7072071.0,
"step": 2320
},
{
"entropy": 0.17203839742578567,
"epoch": 0.9810526315789474,
"grad_norm": 8.5625,
"learning_rate": 9.982638888888888e-08,
"loss": 0.17553606033325195,
"mean_token_accuracy": 0.9403647750616073,
"num_tokens": 7102822.0,
"step": 2330
},
{
"entropy": 0.2015716886613518,
"epoch": 0.9852631578947368,
"grad_norm": 6.46875,
"learning_rate": 7.8125e-08,
"loss": 0.2199774980545044,
"mean_token_accuracy": 0.9335592687129974,
"num_tokens": 7132670.0,
"step": 2340
},
{
"entropy": 0.17184048132039606,
"epoch": 0.9894736842105263,
"grad_norm": 10.25,
"learning_rate": 5.6423611111111116e-08,
"loss": 0.19170069694519043,
"mean_token_accuracy": 0.9456814132630825,
"num_tokens": 7163095.0,
"step": 2350
},
{
"entropy": 0.18851842815056444,
"epoch": 0.9936842105263158,
"grad_norm": 7.40625,
"learning_rate": 3.472222222222222e-08,
"loss": 0.18714648485183716,
"mean_token_accuracy": 0.9426751539111138,
"num_tokens": 7191956.0,
"step": 2360
},
{
"entropy": 0.17078252806095406,
"epoch": 0.9978947368421053,
"grad_norm": 9.5,
"learning_rate": 1.3020833333333333e-08,
"loss": 0.16565700769424438,
"mean_token_accuracy": 0.9381283052265644,
"num_tokens": 7221933.0,
"step": 2370
}
],
"logging_steps": 10,
"max_steps": 2375,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.608549619134874e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}