1035 lines
27 KiB
JSON
1035 lines
27 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.03214813862277374,
|
|
"eval_steps": 500,
|
|
"global_step": 500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.742568206787109,
|
|
"epoch": 0.00032148138622773744,
|
|
"grad_norm": 4.65625,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8036,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 12742.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.742579936981201,
|
|
"epoch": 0.0006429627724554749,
|
|
"grad_norm": 4.53125,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7869,
|
|
"mean_token_accuracy": 0.0002144496247638017,
|
|
"num_tokens": 24140.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.742603588104249,
|
|
"epoch": 0.0009644441586832123,
|
|
"grad_norm": 4.90625,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.7587,
|
|
"mean_token_accuracy": 0.00010395010467618704,
|
|
"num_tokens": 35301.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.742618370056153,
|
|
"epoch": 0.0012859255449109497,
|
|
"grad_norm": 4.84375,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.7259,
|
|
"mean_token_accuracy": 8.291873964481056e-05,
|
|
"num_tokens": 47594.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.742617893218995,
|
|
"epoch": 0.001607406931138687,
|
|
"grad_norm": 4.5,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 10.6444,
|
|
"mean_token_accuracy": 0.0009544001193717122,
|
|
"num_tokens": 60157.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.742464923858643,
|
|
"epoch": 0.0019288883173664245,
|
|
"grad_norm": 3.90625,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 10.5219,
|
|
"mean_token_accuracy": 0.008633292093873025,
|
|
"num_tokens": 71681.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.741884708404541,
|
|
"epoch": 0.002250369703594162,
|
|
"grad_norm": 3.015625,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 10.4068,
|
|
"mean_token_accuracy": 0.022283684648573398,
|
|
"num_tokens": 84059.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.740736961364746,
|
|
"epoch": 0.0025718510898218995,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 10.2636,
|
|
"mean_token_accuracy": 0.029509490355849266,
|
|
"num_tokens": 95765.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.739063930511474,
|
|
"epoch": 0.0028933324760496365,
|
|
"grad_norm": 2.140625,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 10.1737,
|
|
"mean_token_accuracy": 0.033080863580107686,
|
|
"num_tokens": 108095.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.738058280944824,
|
|
"epoch": 0.003214813862277374,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 10.0966,
|
|
"mean_token_accuracy": 0.03380006831139326,
|
|
"num_tokens": 120722.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.73799819946289,
|
|
"epoch": 0.0035362952485051115,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 10.006,
|
|
"mean_token_accuracy": 0.03798699378967285,
|
|
"num_tokens": 132684.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.73742036819458,
|
|
"epoch": 0.003857776634732849,
|
|
"grad_norm": 1.90625,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.9558,
|
|
"mean_token_accuracy": 0.03450928349047899,
|
|
"num_tokens": 143940.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.736388874053954,
|
|
"epoch": 0.0041792580209605865,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.9101,
|
|
"mean_token_accuracy": 0.04125991053879261,
|
|
"num_tokens": 156206.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.73477258682251,
|
|
"epoch": 0.004500739407188324,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.7902,
|
|
"mean_token_accuracy": 0.03981789126992226,
|
|
"num_tokens": 167417.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.732693958282471,
|
|
"epoch": 0.0048222207934160615,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.7708,
|
|
"mean_token_accuracy": 0.04258622564375401,
|
|
"num_tokens": 180372.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.729571533203124,
|
|
"epoch": 0.005143702179643799,
|
|
"grad_norm": 1.90625,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.6547,
|
|
"mean_token_accuracy": 0.045089634135365486,
|
|
"num_tokens": 191614.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.72476511001587,
|
|
"epoch": 0.0054651835658715365,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 9.6147,
|
|
"mean_token_accuracy": 0.040345224365592,
|
|
"num_tokens": 202885.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.71826524734497,
|
|
"epoch": 0.005786664952099273,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 9.5588,
|
|
"mean_token_accuracy": 0.0393321730196476,
|
|
"num_tokens": 215099.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.710640907287598,
|
|
"epoch": 0.0061081463383270106,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 9.4198,
|
|
"mean_token_accuracy": 0.042821163311600685,
|
|
"num_tokens": 227257.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.7003662109375,
|
|
"epoch": 0.006429627724554748,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 9.3598,
|
|
"mean_token_accuracy": 0.046982531622052195,
|
|
"num_tokens": 240338.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.68521671295166,
|
|
"epoch": 0.0067511091107824855,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 9.2122,
|
|
"mean_token_accuracy": 0.0441419318318367,
|
|
"num_tokens": 251438.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.664322471618652,
|
|
"epoch": 0.007072590497010223,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 9.1438,
|
|
"mean_token_accuracy": 0.050481327995657924,
|
|
"num_tokens": 264614.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 10.634937763214111,
|
|
"epoch": 0.0073940718832379605,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 9.0251,
|
|
"mean_token_accuracy": 0.049148940667510035,
|
|
"num_tokens": 278360.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 10.593732261657715,
|
|
"epoch": 0.007715553269465698,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.9153,
|
|
"mean_token_accuracy": 0.05156457796692848,
|
|
"num_tokens": 290884.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 10.54275369644165,
|
|
"epoch": 0.008037034655693436,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 8.8351,
|
|
"mean_token_accuracy": 0.052396486327052114,
|
|
"num_tokens": 304431.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 10.474855613708495,
|
|
"epoch": 0.008358516041921173,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 8.6397,
|
|
"mean_token_accuracy": 0.05697291418910026,
|
|
"num_tokens": 317555.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 10.39169454574585,
|
|
"epoch": 0.00867999742814891,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 8.4698,
|
|
"mean_token_accuracy": 0.058742289617657664,
|
|
"num_tokens": 329754.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 10.3007230758667,
|
|
"epoch": 0.009001478814376648,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 8.3392,
|
|
"mean_token_accuracy": 0.07013382948935032,
|
|
"num_tokens": 341808.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 10.171103858947754,
|
|
"epoch": 0.009322960200604385,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 8.1587,
|
|
"mean_token_accuracy": 0.06642449870705605,
|
|
"num_tokens": 353209.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 10.069665241241456,
|
|
"epoch": 0.009644441586832123,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 8.1634,
|
|
"mean_token_accuracy": 0.06020556911826134,
|
|
"num_tokens": 365744.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 9.936939144134522,
|
|
"epoch": 0.00996592297305986,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 8.0462,
|
|
"mean_token_accuracy": 0.06147486455738545,
|
|
"num_tokens": 379133.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 9.757997035980225,
|
|
"epoch": 0.010287404359287598,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.9266,
|
|
"mean_token_accuracy": 0.06376843340694904,
|
|
"num_tokens": 390921.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 9.523485374450683,
|
|
"epoch": 0.010608885745515335,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.8396,
|
|
"mean_token_accuracy": 0.07127328738570213,
|
|
"num_tokens": 404468.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 9.345615196228028,
|
|
"epoch": 0.010930367131743073,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.6793,
|
|
"mean_token_accuracy": 0.07266218103468418,
|
|
"num_tokens": 414790.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 9.119754123687745,
|
|
"epoch": 0.011251848517970809,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.6479,
|
|
"mean_token_accuracy": 0.06817427426576614,
|
|
"num_tokens": 427720.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 8.906557750701904,
|
|
"epoch": 0.011573329904198546,
|
|
"grad_norm": 0.91015625,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.5546,
|
|
"mean_token_accuracy": 0.07729550525546074,
|
|
"num_tokens": 438501.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.68680248260498,
|
|
"epoch": 0.011894811290426284,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.5063,
|
|
"mean_token_accuracy": 0.07282244712114334,
|
|
"num_tokens": 450035.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 8.589659690856934,
|
|
"epoch": 0.012216292676654021,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.4857,
|
|
"mean_token_accuracy": 0.0773538451641798,
|
|
"num_tokens": 461665.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 8.466110229492188,
|
|
"epoch": 0.012537774062881759,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.407,
|
|
"mean_token_accuracy": 0.07190582565963269,
|
|
"num_tokens": 472514.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 8.35852632522583,
|
|
"epoch": 0.012859255449109496,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.469,
|
|
"mean_token_accuracy": 0.07612953037023544,
|
|
"num_tokens": 484057.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.286659240722656,
|
|
"epoch": 0.013180736835337234,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.2817,
|
|
"mean_token_accuracy": 0.07883379608392715,
|
|
"num_tokens": 496374.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 8.222426700592042,
|
|
"epoch": 0.013502218221564971,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.4006,
|
|
"mean_token_accuracy": 0.08155124634504318,
|
|
"num_tokens": 508816.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 8.164955520629883,
|
|
"epoch": 0.013823699607792709,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.2353,
|
|
"mean_token_accuracy": 0.08206439130008221,
|
|
"num_tokens": 520738.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 8.113754081726075,
|
|
"epoch": 0.014145180994020446,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.1869,
|
|
"mean_token_accuracy": 0.08583443649113179,
|
|
"num_tokens": 531924.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 8.066366481781007,
|
|
"epoch": 0.014466662380248184,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.2385,
|
|
"mean_token_accuracy": 0.09169937074184417,
|
|
"num_tokens": 543924.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 8.05418610572815,
|
|
"epoch": 0.014788143766475921,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.3141,
|
|
"mean_token_accuracy": 0.0864493004977703,
|
|
"num_tokens": 555669.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 8.044883394241333,
|
|
"epoch": 0.015109625152703659,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.2002,
|
|
"mean_token_accuracy": 0.09331929311156273,
|
|
"num_tokens": 567187.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.921926689147949,
|
|
"epoch": 0.015431106538931396,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.1648,
|
|
"mean_token_accuracy": 0.08909451588988304,
|
|
"num_tokens": 579812.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.9616796493530275,
|
|
"epoch": 0.015752587925159132,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.2286,
|
|
"mean_token_accuracy": 0.0948996253311634,
|
|
"num_tokens": 592539.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.915118932723999,
|
|
"epoch": 0.01607406931138687,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.1744,
|
|
"mean_token_accuracy": 0.09123623445630073,
|
|
"num_tokens": 603561.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.95502872467041,
|
|
"epoch": 0.016395550697614607,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.1403,
|
|
"mean_token_accuracy": 0.09563293382525444,
|
|
"num_tokens": 615309.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.883571195602417,
|
|
"epoch": 0.016717032083842346,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.2078,
|
|
"mean_token_accuracy": 0.09283049032092094,
|
|
"num_tokens": 628213.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.916977882385254,
|
|
"epoch": 0.017038513470070082,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.1712,
|
|
"mean_token_accuracy": 0.09053821936249733,
|
|
"num_tokens": 640786.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.736500692367554,
|
|
"epoch": 0.01735999485629782,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 6.9442,
|
|
"mean_token_accuracy": 0.09789396971464157,
|
|
"num_tokens": 653298.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.796767520904541,
|
|
"epoch": 0.017681476242525557,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.1179,
|
|
"mean_token_accuracy": 0.09451311975717544,
|
|
"num_tokens": 667729.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.758620405197144,
|
|
"epoch": 0.018002957628753296,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.9965,
|
|
"mean_token_accuracy": 0.10174397602677346,
|
|
"num_tokens": 678289.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.761229801177978,
|
|
"epoch": 0.01832443901498103,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 7.1014,
|
|
"mean_token_accuracy": 0.09417134001851082,
|
|
"num_tokens": 689595.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.707542467117309,
|
|
"epoch": 0.01864592040120877,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.9575,
|
|
"mean_token_accuracy": 0.10247044488787652,
|
|
"num_tokens": 701044.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.664159297943115,
|
|
"epoch": 0.018967401787436507,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.0154,
|
|
"mean_token_accuracy": 0.09950036033988,
|
|
"num_tokens": 713616.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.647959280014038,
|
|
"epoch": 0.019288883173664246,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.9233,
|
|
"mean_token_accuracy": 0.1026333898305893,
|
|
"num_tokens": 725328.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.647801685333252,
|
|
"epoch": 0.01961036455989198,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.9827,
|
|
"mean_token_accuracy": 0.10479021072387695,
|
|
"num_tokens": 738135.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.666160726547242,
|
|
"epoch": 0.01993184594611972,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.0659,
|
|
"mean_token_accuracy": 0.09956069737672806,
|
|
"num_tokens": 750746.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.654135274887085,
|
|
"epoch": 0.020253327332347457,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.8949,
|
|
"mean_token_accuracy": 0.10135210454463958,
|
|
"num_tokens": 763983.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.494717454910278,
|
|
"epoch": 0.020574808718575196,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.8483,
|
|
"mean_token_accuracy": 0.1055855043232441,
|
|
"num_tokens": 776047.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.538181352615356,
|
|
"epoch": 0.02089629010480293,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.8979,
|
|
"mean_token_accuracy": 0.10393242165446281,
|
|
"num_tokens": 789551.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.569456100463867,
|
|
"epoch": 0.02121777149103067,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.8266,
|
|
"mean_token_accuracy": 0.1120136708021164,
|
|
"num_tokens": 801870.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.441139793395996,
|
|
"epoch": 0.021539252877258407,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.8251,
|
|
"mean_token_accuracy": 0.10700582489371299,
|
|
"num_tokens": 813782.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.5361223220825195,
|
|
"epoch": 0.021860734263486146,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.886,
|
|
"mean_token_accuracy": 0.11066097766160965,
|
|
"num_tokens": 826179.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.415356826782227,
|
|
"epoch": 0.02218221564971388,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.8989,
|
|
"mean_token_accuracy": 0.10546407401561737,
|
|
"num_tokens": 838827.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.442149639129639,
|
|
"epoch": 0.022503697035941617,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.8217,
|
|
"mean_token_accuracy": 0.11060597971081734,
|
|
"num_tokens": 851543.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.508502197265625,
|
|
"epoch": 0.022825178422169357,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.8139,
|
|
"mean_token_accuracy": 0.112100800126791,
|
|
"num_tokens": 863557.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.371269845962525,
|
|
"epoch": 0.023146659808397092,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.8226,
|
|
"mean_token_accuracy": 0.11001520678400993,
|
|
"num_tokens": 877640.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.435138940811157,
|
|
"epoch": 0.02346814119462483,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.9016,
|
|
"mean_token_accuracy": 0.11292736753821372,
|
|
"num_tokens": 889521.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.44185962677002,
|
|
"epoch": 0.023789622580852567,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.7138,
|
|
"mean_token_accuracy": 0.11192596107721328,
|
|
"num_tokens": 899886.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.424141836166382,
|
|
"epoch": 0.024111103967080307,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.835,
|
|
"mean_token_accuracy": 0.10648501366376877,
|
|
"num_tokens": 911448.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.346240711212158,
|
|
"epoch": 0.024432585353308042,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.8403,
|
|
"mean_token_accuracy": 0.10451060682535171,
|
|
"num_tokens": 922938.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.440135097503662,
|
|
"epoch": 0.02475406673953578,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.816,
|
|
"mean_token_accuracy": 0.10817886143922806,
|
|
"num_tokens": 935037.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.338301467895508,
|
|
"epoch": 0.025075548125763517,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.7998,
|
|
"mean_token_accuracy": 0.10885120332241058,
|
|
"num_tokens": 946395.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.387865447998047,
|
|
"epoch": 0.025397029511991256,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.7903,
|
|
"mean_token_accuracy": 0.11720103770494461,
|
|
"num_tokens": 957963.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.322666645050049,
|
|
"epoch": 0.025718510898218992,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.7715,
|
|
"mean_token_accuracy": 0.10996255949139595,
|
|
"num_tokens": 970474.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.304989814758301,
|
|
"epoch": 0.02603999228444673,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.7076,
|
|
"mean_token_accuracy": 0.1160525843501091,
|
|
"num_tokens": 984090.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.233718299865723,
|
|
"epoch": 0.026361473670674467,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.6529,
|
|
"mean_token_accuracy": 0.1177474744617939,
|
|
"num_tokens": 997159.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.222785997390747,
|
|
"epoch": 0.026682955056902206,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.654,
|
|
"mean_token_accuracy": 0.11934740170836448,
|
|
"num_tokens": 1009350.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.325893259048462,
|
|
"epoch": 0.027004436443129942,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.7141,
|
|
"mean_token_accuracy": 0.11572676599025726,
|
|
"num_tokens": 1021170.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.200784921646118,
|
|
"epoch": 0.02732591782935768,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.7053,
|
|
"mean_token_accuracy": 0.11510597914457321,
|
|
"num_tokens": 1033173.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.3387078762054445,
|
|
"epoch": 0.027647399215585417,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.6451,
|
|
"mean_token_accuracy": 0.11399412080645561,
|
|
"num_tokens": 1045811.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.223242235183716,
|
|
"epoch": 0.027968880601813156,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.6814,
|
|
"mean_token_accuracy": 0.11766811162233352,
|
|
"num_tokens": 1058519.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.186439037322998,
|
|
"epoch": 0.028290361988040892,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.661,
|
|
"mean_token_accuracy": 0.11952715441584587,
|
|
"num_tokens": 1069977.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.247150611877442,
|
|
"epoch": 0.02861184337426863,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.7042,
|
|
"mean_token_accuracy": 0.12207212299108505,
|
|
"num_tokens": 1081368.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.224388504028321,
|
|
"epoch": 0.028933324760496367,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.7154,
|
|
"mean_token_accuracy": 0.11299246326088905,
|
|
"num_tokens": 1093936.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.168924283981323,
|
|
"epoch": 0.029254806146724106,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.6693,
|
|
"mean_token_accuracy": 0.1225433073937893,
|
|
"num_tokens": 1106217.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.140732955932617,
|
|
"epoch": 0.029576287532951842,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.6131,
|
|
"mean_token_accuracy": 0.1190965436398983,
|
|
"num_tokens": 1120108.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.190146207809448,
|
|
"epoch": 0.029897768919179578,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.691,
|
|
"mean_token_accuracy": 0.1148249328136444,
|
|
"num_tokens": 1132390.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.1808641910552975,
|
|
"epoch": 0.030219250305407317,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.6407,
|
|
"mean_token_accuracy": 0.1223123162984848,
|
|
"num_tokens": 1144612.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 7.130864477157592,
|
|
"epoch": 0.030540731691635053,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.5913,
|
|
"mean_token_accuracy": 0.1303763821721077,
|
|
"num_tokens": 1156151.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.050965404510498,
|
|
"epoch": 0.030862213077862792,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.5653,
|
|
"mean_token_accuracy": 0.1250072978436947,
|
|
"num_tokens": 1168777.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.13370532989502,
|
|
"epoch": 0.031183694464090528,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.6091,
|
|
"mean_token_accuracy": 0.1207241289317608,
|
|
"num_tokens": 1181233.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 7.062533330917359,
|
|
"epoch": 0.031505175850318264,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.4888,
|
|
"mean_token_accuracy": 0.12689791172742843,
|
|
"num_tokens": 1192315.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.057355880737305,
|
|
"epoch": 0.031826657236546006,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.5874,
|
|
"mean_token_accuracy": 0.12290141731500626,
|
|
"num_tokens": 1203452.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 7.104999351501465,
|
|
"epoch": 0.03214813862277374,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.4607,
|
|
"mean_token_accuracy": 0.12253987565636634,
|
|
"num_tokens": 1215024.0,
|
|
"step": 500
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 273515177410560.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|