2035 lines
54 KiB
JSON
2035 lines
54 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 0.06429627724554748,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 1000,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 10.691962623596192,
|
||
|
|
"epoch": 0.00032148138622773744,
|
||
|
|
"grad_norm": 11.75,
|
||
|
|
"learning_rate": 2e-06,
|
||
|
|
"loss": 10.8513,
|
||
|
|
"mean_token_accuracy": 0.0002252335427328944,
|
||
|
|
"num_tokens": 12742.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.691972923278808,
|
||
|
|
"epoch": 0.0006429627724554749,
|
||
|
|
"grad_norm": 11.3125,
|
||
|
|
"learning_rate": 4.5e-06,
|
||
|
|
"loss": 10.7797,
|
||
|
|
"mean_token_accuracy": 0.00016763927997089922,
|
||
|
|
"num_tokens": 24140.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.6913818359375,
|
||
|
|
"epoch": 0.0009644441586832123,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 7e-06,
|
||
|
|
"loss": 10.5596,
|
||
|
|
"mean_token_accuracy": 0.009554457850754261,
|
||
|
|
"num_tokens": 35301.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.68741807937622,
|
||
|
|
"epoch": 0.0012859255449109497,
|
||
|
|
"grad_norm": 7.1875,
|
||
|
|
"learning_rate": 9.5e-06,
|
||
|
|
"loss": 10.279,
|
||
|
|
"mean_token_accuracy": 0.031060078553855418,
|
||
|
|
"num_tokens": 47594.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.6698899269104,
|
||
|
|
"epoch": 0.001607406931138687,
|
||
|
|
"grad_norm": 4.21875,
|
||
|
|
"learning_rate": 1.2e-05,
|
||
|
|
"loss": 10.018,
|
||
|
|
"mean_token_accuracy": 0.02761343717575073,
|
||
|
|
"num_tokens": 60157.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.65185718536377,
|
||
|
|
"epoch": 0.0019288883173664245,
|
||
|
|
"grad_norm": 3.21875,
|
||
|
|
"learning_rate": 1.4500000000000002e-05,
|
||
|
|
"loss": 9.8686,
|
||
|
|
"mean_token_accuracy": 0.030902387760579585,
|
||
|
|
"num_tokens": 71681.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.64528455734253,
|
||
|
|
"epoch": 0.002250369703594162,
|
||
|
|
"grad_norm": 2.734375,
|
||
|
|
"learning_rate": 1.7000000000000003e-05,
|
||
|
|
"loss": 9.7976,
|
||
|
|
"mean_token_accuracy": 0.028960460610687733,
|
||
|
|
"num_tokens": 84059.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.643793773651122,
|
||
|
|
"epoch": 0.0025718510898218995,
|
||
|
|
"grad_norm": 2.578125,
|
||
|
|
"learning_rate": 1.95e-05,
|
||
|
|
"loss": 9.7566,
|
||
|
|
"mean_token_accuracy": 0.03402260970324278,
|
||
|
|
"num_tokens": 95765.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.633929347991943,
|
||
|
|
"epoch": 0.0028933324760496365,
|
||
|
|
"grad_norm": 2.5,
|
||
|
|
"learning_rate": 2.2e-05,
|
||
|
|
"loss": 9.7195,
|
||
|
|
"mean_token_accuracy": 0.037856101803481576,
|
||
|
|
"num_tokens": 108095.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.626009464263916,
|
||
|
|
"epoch": 0.003214813862277374,
|
||
|
|
"grad_norm": 2.421875,
|
||
|
|
"learning_rate": 2.4500000000000003e-05,
|
||
|
|
"loss": 9.6663,
|
||
|
|
"mean_token_accuracy": 0.04004088416695595,
|
||
|
|
"num_tokens": 120722.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.62456464767456,
|
||
|
|
"epoch": 0.0035362952485051115,
|
||
|
|
"grad_norm": 2.453125,
|
||
|
|
"learning_rate": 2.7e-05,
|
||
|
|
"loss": 9.579,
|
||
|
|
"mean_token_accuracy": 0.04333267491310835,
|
||
|
|
"num_tokens": 132684.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.60206480026245,
|
||
|
|
"epoch": 0.003857776634732849,
|
||
|
|
"grad_norm": 2.4375,
|
||
|
|
"learning_rate": 2.95e-05,
|
||
|
|
"loss": 9.5155,
|
||
|
|
"mean_token_accuracy": 0.041969917714595795,
|
||
|
|
"num_tokens": 143940.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.526144027709961,
|
||
|
|
"epoch": 0.0041792580209605865,
|
||
|
|
"grad_norm": 2.65625,
|
||
|
|
"learning_rate": 3.2e-05,
|
||
|
|
"loss": 9.4139,
|
||
|
|
"mean_token_accuracy": 0.0514595627784729,
|
||
|
|
"num_tokens": 156206.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.384619331359863,
|
||
|
|
"epoch": 0.004500739407188324,
|
||
|
|
"grad_norm": 2.515625,
|
||
|
|
"learning_rate": 3.4500000000000005e-05,
|
||
|
|
"loss": 9.2565,
|
||
|
|
"mean_token_accuracy": 0.053492728248238565,
|
||
|
|
"num_tokens": 167417.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.46249942779541,
|
||
|
|
"epoch": 0.0048222207934160615,
|
||
|
|
"grad_norm": 2.640625,
|
||
|
|
"learning_rate": 3.7e-05,
|
||
|
|
"loss": 9.1818,
|
||
|
|
"mean_token_accuracy": 0.05699222944676876,
|
||
|
|
"num_tokens": 180372.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.435306167602539,
|
||
|
|
"epoch": 0.005143702179643799,
|
||
|
|
"grad_norm": 2.578125,
|
||
|
|
"learning_rate": 3.95e-05,
|
||
|
|
"loss": 9.0202,
|
||
|
|
"mean_token_accuracy": 0.06815617680549621,
|
||
|
|
"num_tokens": 191614.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.381722354888916,
|
||
|
|
"epoch": 0.0054651835658715365,
|
||
|
|
"grad_norm": 2.21875,
|
||
|
|
"learning_rate": 4.2000000000000004e-05,
|
||
|
|
"loss": 8.9883,
|
||
|
|
"mean_token_accuracy": 0.0625459872186184,
|
||
|
|
"num_tokens": 202885.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.344064044952393,
|
||
|
|
"epoch": 0.005786664952099273,
|
||
|
|
"grad_norm": 2.0625,
|
||
|
|
"learning_rate": 4.45e-05,
|
||
|
|
"loss": 8.8777,
|
||
|
|
"mean_token_accuracy": 0.06927761398255824,
|
||
|
|
"num_tokens": 215099.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.285068035125732,
|
||
|
|
"epoch": 0.0061081463383270106,
|
||
|
|
"grad_norm": 2.328125,
|
||
|
|
"learning_rate": 4.7000000000000004e-05,
|
||
|
|
"loss": 8.7178,
|
||
|
|
"mean_token_accuracy": 0.07229750752449035,
|
||
|
|
"num_tokens": 227257.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.250009727478027,
|
||
|
|
"epoch": 0.006429627724554748,
|
||
|
|
"grad_norm": 2.46875,
|
||
|
|
"learning_rate": 4.9500000000000004e-05,
|
||
|
|
"loss": 8.6465,
|
||
|
|
"mean_token_accuracy": 0.07430845759809017,
|
||
|
|
"num_tokens": 240338.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.134335803985596,
|
||
|
|
"epoch": 0.0067511091107824855,
|
||
|
|
"grad_norm": 2.484375,
|
||
|
|
"learning_rate": 5.2e-05,
|
||
|
|
"loss": 8.49,
|
||
|
|
"mean_token_accuracy": 0.07340316958725453,
|
||
|
|
"num_tokens": 251438.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.063454627990723,
|
||
|
|
"epoch": 0.007072590497010223,
|
||
|
|
"grad_norm": 2.28125,
|
||
|
|
"learning_rate": 5.45e-05,
|
||
|
|
"loss": 8.4147,
|
||
|
|
"mean_token_accuracy": 0.07746305204927921,
|
||
|
|
"num_tokens": 264614.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.039491367340087,
|
||
|
|
"epoch": 0.0073940718832379605,
|
||
|
|
"grad_norm": 2.28125,
|
||
|
|
"learning_rate": 5.7e-05,
|
||
|
|
"loss": 8.3115,
|
||
|
|
"mean_token_accuracy": 0.07388029359281063,
|
||
|
|
"num_tokens": 278360.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.967554664611816,
|
||
|
|
"epoch": 0.007715553269465698,
|
||
|
|
"grad_norm": 2.0,
|
||
|
|
"learning_rate": 5.9499999999999996e-05,
|
||
|
|
"loss": 8.2266,
|
||
|
|
"mean_token_accuracy": 0.07311215251684189,
|
||
|
|
"num_tokens": 290884.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.837087726593017,
|
||
|
|
"epoch": 0.008037034655693436,
|
||
|
|
"grad_norm": 2.0625,
|
||
|
|
"learning_rate": 6.2e-05,
|
||
|
|
"loss": 8.1761,
|
||
|
|
"mean_token_accuracy": 0.07603085115551948,
|
||
|
|
"num_tokens": 304431.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.656188583374023,
|
||
|
|
"epoch": 0.008358516041921173,
|
||
|
|
"grad_norm": 2.03125,
|
||
|
|
"learning_rate": 6.450000000000001e-05,
|
||
|
|
"loss": 7.9808,
|
||
|
|
"mean_token_accuracy": 0.07899082973599433,
|
||
|
|
"num_tokens": 317555.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.52431879043579,
|
||
|
|
"epoch": 0.00867999742814891,
|
||
|
|
"grad_norm": 1.921875,
|
||
|
|
"learning_rate": 6.7e-05,
|
||
|
|
"loss": 7.7967,
|
||
|
|
"mean_token_accuracy": 0.08144079595804214,
|
||
|
|
"num_tokens": 329754.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.300153827667236,
|
||
|
|
"epoch": 0.009001478814376648,
|
||
|
|
"grad_norm": 1.640625,
|
||
|
|
"learning_rate": 6.950000000000001e-05,
|
||
|
|
"loss": 7.6916,
|
||
|
|
"mean_token_accuracy": 0.0898093469440937,
|
||
|
|
"num_tokens": 341808.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.123427486419677,
|
||
|
|
"epoch": 0.009322960200604385,
|
||
|
|
"grad_norm": 1.5625,
|
||
|
|
"learning_rate": 7.2e-05,
|
||
|
|
"loss": 7.5127,
|
||
|
|
"mean_token_accuracy": 0.09076863974332809,
|
||
|
|
"num_tokens": 353209.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.99952049255371,
|
||
|
|
"epoch": 0.009644441586832123,
|
||
|
|
"grad_norm": 1.4609375,
|
||
|
|
"learning_rate": 7.45e-05,
|
||
|
|
"loss": 7.5718,
|
||
|
|
"mean_token_accuracy": 0.0799163393676281,
|
||
|
|
"num_tokens": 365744.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.78609037399292,
|
||
|
|
"epoch": 0.00996592297305986,
|
||
|
|
"grad_norm": 1.71875,
|
||
|
|
"learning_rate": 7.7e-05,
|
||
|
|
"loss": 7.4871,
|
||
|
|
"mean_token_accuracy": 0.08622552379965782,
|
||
|
|
"num_tokens": 379133.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.53131160736084,
|
||
|
|
"epoch": 0.010287404359287598,
|
||
|
|
"grad_norm": 1.515625,
|
||
|
|
"learning_rate": 7.950000000000001e-05,
|
||
|
|
"loss": 7.4339,
|
||
|
|
"mean_token_accuracy": 0.0928072139620781,
|
||
|
|
"num_tokens": 390921.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.407974147796631,
|
||
|
|
"epoch": 0.010608885745515335,
|
||
|
|
"grad_norm": 1.6953125,
|
||
|
|
"learning_rate": 8.2e-05,
|
||
|
|
"loss": 7.4005,
|
||
|
|
"mean_token_accuracy": 0.09085078835487366,
|
||
|
|
"num_tokens": 404468.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.33922872543335,
|
||
|
|
"epoch": 0.010930367131743073,
|
||
|
|
"grad_norm": 1.671875,
|
||
|
|
"learning_rate": 8.450000000000001e-05,
|
||
|
|
"loss": 7.2555,
|
||
|
|
"mean_token_accuracy": 0.08985946327447891,
|
||
|
|
"num_tokens": 414790.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.20672607421875,
|
||
|
|
"epoch": 0.011251848517970809,
|
||
|
|
"grad_norm": 1.671875,
|
||
|
|
"learning_rate": 8.7e-05,
|
||
|
|
"loss": 7.2876,
|
||
|
|
"mean_token_accuracy": 0.0886640053242445,
|
||
|
|
"num_tokens": 427720.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.09479341506958,
|
||
|
|
"epoch": 0.011573329904198546,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 8.95e-05,
|
||
|
|
"loss": 7.2213,
|
||
|
|
"mean_token_accuracy": 0.09638915956020355,
|
||
|
|
"num_tokens": 438501.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.054841995239258,
|
||
|
|
"epoch": 0.011894811290426284,
|
||
|
|
"grad_norm": 1.4921875,
|
||
|
|
"learning_rate": 9.2e-05,
|
||
|
|
"loss": 7.1887,
|
||
|
|
"mean_token_accuracy": 0.09422452822327614,
|
||
|
|
"num_tokens": 450035.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.978442239761352,
|
||
|
|
"epoch": 0.012216292676654021,
|
||
|
|
"grad_norm": 1.5546875,
|
||
|
|
"learning_rate": 9.45e-05,
|
||
|
|
"loss": 7.1804,
|
||
|
|
"mean_token_accuracy": 0.09522246792912484,
|
||
|
|
"num_tokens": 461665.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.953486919403076,
|
||
|
|
"epoch": 0.012537774062881759,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 9.7e-05,
|
||
|
|
"loss": 7.1284,
|
||
|
|
"mean_token_accuracy": 0.09261216446757317,
|
||
|
|
"num_tokens": 472514.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.86272406578064,
|
||
|
|
"epoch": 0.012859255449109496,
|
||
|
|
"grad_norm": 1.625,
|
||
|
|
"learning_rate": 9.95e-05,
|
||
|
|
"loss": 7.2167,
|
||
|
|
"mean_token_accuracy": 0.09284883812069893,
|
||
|
|
"num_tokens": 484057.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.859376621246338,
|
||
|
|
"epoch": 0.013180736835337234,
|
||
|
|
"grad_norm": 1.6171875,
|
||
|
|
"learning_rate": 0.000102,
|
||
|
|
"loss": 7.0232,
|
||
|
|
"mean_token_accuracy": 0.10182850286364556,
|
||
|
|
"num_tokens": 496374.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.836434459686279,
|
||
|
|
"epoch": 0.013502218221564971,
|
||
|
|
"grad_norm": 1.6328125,
|
||
|
|
"learning_rate": 0.00010449999999999999,
|
||
|
|
"loss": 7.1543,
|
||
|
|
"mean_token_accuracy": 0.09297729805111885,
|
||
|
|
"num_tokens": 508816.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.725788021087647,
|
||
|
|
"epoch": 0.013823699607792709,
|
||
|
|
"grad_norm": 1.6328125,
|
||
|
|
"learning_rate": 0.000107,
|
||
|
|
"loss": 6.9889,
|
||
|
|
"mean_token_accuracy": 0.09677340798079967,
|
||
|
|
"num_tokens": 520738.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.688320064544678,
|
||
|
|
"epoch": 0.014145180994020446,
|
||
|
|
"grad_norm": 1.4453125,
|
||
|
|
"learning_rate": 0.0001095,
|
||
|
|
"loss": 6.9658,
|
||
|
|
"mean_token_accuracy": 0.09948733299970627,
|
||
|
|
"num_tokens": 531924.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.670648431777954,
|
||
|
|
"epoch": 0.014466662380248184,
|
||
|
|
"grad_norm": 1.609375,
|
||
|
|
"learning_rate": 0.000112,
|
||
|
|
"loss": 7.0118,
|
||
|
|
"mean_token_accuracy": 0.10900615230202675,
|
||
|
|
"num_tokens": 543924.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.686954212188721,
|
||
|
|
"epoch": 0.014788143766475921,
|
||
|
|
"grad_norm": 1.8515625,
|
||
|
|
"learning_rate": 0.0001145,
|
||
|
|
"loss": 7.1106,
|
||
|
|
"mean_token_accuracy": 0.09593017026782036,
|
||
|
|
"num_tokens": 555669.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.638793182373047,
|
||
|
|
"epoch": 0.015109625152703659,
|
||
|
|
"grad_norm": 1.8359375,
|
||
|
|
"learning_rate": 0.00011700000000000001,
|
||
|
|
"loss": 6.985,
|
||
|
|
"mean_token_accuracy": 0.10193387344479561,
|
||
|
|
"num_tokens": 567187.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.547295236587525,
|
||
|
|
"epoch": 0.015431106538931396,
|
||
|
|
"grad_norm": 1.5859375,
|
||
|
|
"learning_rate": 0.00011949999999999999,
|
||
|
|
"loss": 6.9604,
|
||
|
|
"mean_token_accuracy": 0.10019129663705825,
|
||
|
|
"num_tokens": 579812.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.638609123229981,
|
||
|
|
"epoch": 0.015752587925159132,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.000122,
|
||
|
|
"loss": 7.0269,
|
||
|
|
"mean_token_accuracy": 0.10339270010590554,
|
||
|
|
"num_tokens": 592539.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.532276964187622,
|
||
|
|
"epoch": 0.01607406931138687,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.0001245,
|
||
|
|
"loss": 6.9864,
|
||
|
|
"mean_token_accuracy": 0.09921617358922959,
|
||
|
|
"num_tokens": 603561.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.575937652587891,
|
||
|
|
"epoch": 0.016395550697614607,
|
||
|
|
"grad_norm": 1.40625,
|
||
|
|
"learning_rate": 0.000127,
|
||
|
|
"loss": 6.9515,
|
||
|
|
"mean_token_accuracy": 0.10559275299310684,
|
||
|
|
"num_tokens": 615309.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.502751398086548,
|
||
|
|
"epoch": 0.016717032083842346,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.0001295,
|
||
|
|
"loss": 7.0296,
|
||
|
|
"mean_token_accuracy": 0.10198334977030754,
|
||
|
|
"num_tokens": 628213.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.497059392929077,
|
||
|
|
"epoch": 0.017038513470070082,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000132,
|
||
|
|
"loss": 6.9923,
|
||
|
|
"mean_token_accuracy": 0.10004970207810401,
|
||
|
|
"num_tokens": 640786.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.384635734558105,
|
||
|
|
"epoch": 0.01735999485629782,
|
||
|
|
"grad_norm": 1.5703125,
|
||
|
|
"learning_rate": 0.00013450000000000002,
|
||
|
|
"loss": 6.7652,
|
||
|
|
"mean_token_accuracy": 0.10689441561698913,
|
||
|
|
"num_tokens": 653298.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.442841482162476,
|
||
|
|
"epoch": 0.017681476242525557,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.00013700000000000002,
|
||
|
|
"loss": 6.9593,
|
||
|
|
"mean_token_accuracy": 0.10141257345676422,
|
||
|
|
"num_tokens": 667729.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.377757835388183,
|
||
|
|
"epoch": 0.018002957628753296,
|
||
|
|
"grad_norm": 1.4765625,
|
||
|
|
"learning_rate": 0.0001395,
|
||
|
|
"loss": 6.8218,
|
||
|
|
"mean_token_accuracy": 0.109464630484581,
|
||
|
|
"num_tokens": 678289.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.392750930786133,
|
||
|
|
"epoch": 0.01832443901498103,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.00014199999999999998,
|
||
|
|
"loss": 6.9482,
|
||
|
|
"mean_token_accuracy": 0.10103233233094215,
|
||
|
|
"num_tokens": 689595.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.349066972732544,
|
||
|
|
"epoch": 0.01864592040120877,
|
||
|
|
"grad_norm": 1.6015625,
|
||
|
|
"learning_rate": 0.0001445,
|
||
|
|
"loss": 6.7929,
|
||
|
|
"mean_token_accuracy": 0.10910078138113022,
|
||
|
|
"num_tokens": 701044.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.2998779773712155,
|
||
|
|
"epoch": 0.018967401787436507,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 0.000147,
|
||
|
|
"loss": 6.8552,
|
||
|
|
"mean_token_accuracy": 0.10353608876466751,
|
||
|
|
"num_tokens": 713616.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3296403884887695,
|
||
|
|
"epoch": 0.019288883173664246,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.0001495,
|
||
|
|
"loss": 6.7575,
|
||
|
|
"mean_token_accuracy": 0.10954333394765854,
|
||
|
|
"num_tokens": 725328.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.328500699996948,
|
||
|
|
"epoch": 0.01961036455989198,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000152,
|
||
|
|
"loss": 6.8157,
|
||
|
|
"mean_token_accuracy": 0.11377528384327888,
|
||
|
|
"num_tokens": 738135.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.282759141921997,
|
||
|
|
"epoch": 0.01993184594611972,
|
||
|
|
"grad_norm": 1.7890625,
|
||
|
|
"learning_rate": 0.00015450000000000001,
|
||
|
|
"loss": 6.9205,
|
||
|
|
"mean_token_accuracy": 0.10520246997475624,
|
||
|
|
"num_tokens": 750746.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.259783411026001,
|
||
|
|
"epoch": 0.020253327332347457,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.000157,
|
||
|
|
"loss": 6.7411,
|
||
|
|
"mean_token_accuracy": 0.10833622887730598,
|
||
|
|
"num_tokens": 763983.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.18600115776062,
|
||
|
|
"epoch": 0.020574808718575196,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0001595,
|
||
|
|
"loss": 6.6981,
|
||
|
|
"mean_token_accuracy": 0.11062882989645004,
|
||
|
|
"num_tokens": 776047.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.202081680297852,
|
||
|
|
"epoch": 0.02089629010480293,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.000162,
|
||
|
|
"loss": 6.7449,
|
||
|
|
"mean_token_accuracy": 0.11173393949866295,
|
||
|
|
"num_tokens": 789551.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.191899156570434,
|
||
|
|
"epoch": 0.02121777149103067,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.00016450000000000001,
|
||
|
|
"loss": 6.6717,
|
||
|
|
"mean_token_accuracy": 0.116755510866642,
|
||
|
|
"num_tokens": 801870.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0472588539123535,
|
||
|
|
"epoch": 0.021539252877258407,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.00016700000000000002,
|
||
|
|
"loss": 6.6745,
|
||
|
|
"mean_token_accuracy": 0.11330420076847077,
|
||
|
|
"num_tokens": 813782.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.256284284591675,
|
||
|
|
"epoch": 0.021860734263486146,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00016950000000000003,
|
||
|
|
"loss": 6.7471,
|
||
|
|
"mean_token_accuracy": 0.11353514790534973,
|
||
|
|
"num_tokens": 826179.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.08664984703064,
|
||
|
|
"epoch": 0.02218221564971388,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.00017199999999999998,
|
||
|
|
"loss": 6.7564,
|
||
|
|
"mean_token_accuracy": 0.11025232151150703,
|
||
|
|
"num_tokens": 838827.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.074565649032593,
|
||
|
|
"epoch": 0.022503697035941617,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.00017449999999999999,
|
||
|
|
"loss": 6.6814,
|
||
|
|
"mean_token_accuracy": 0.11574955135583878,
|
||
|
|
"num_tokens": 851543.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.184527492523193,
|
||
|
|
"epoch": 0.022825178422169357,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.000177,
|
||
|
|
"loss": 6.6767,
|
||
|
|
"mean_token_accuracy": 0.11738619655370712,
|
||
|
|
"num_tokens": 863557.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.040078735351562,
|
||
|
|
"epoch": 0.023146659808397092,
|
||
|
|
"grad_norm": 1.4296875,
|
||
|
|
"learning_rate": 0.0001795,
|
||
|
|
"loss": 6.6815,
|
||
|
|
"mean_token_accuracy": 0.11558268815279008,
|
||
|
|
"num_tokens": 877640.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.095375967025757,
|
||
|
|
"epoch": 0.02346814119462483,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000182,
|
||
|
|
"loss": 6.7741,
|
||
|
|
"mean_token_accuracy": 0.11316436678171157,
|
||
|
|
"num_tokens": 889521.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.112909460067749,
|
||
|
|
"epoch": 0.023789622580852567,
|
||
|
|
"grad_norm": 1.8203125,
|
||
|
|
"learning_rate": 0.0001845,
|
||
|
|
"loss": 6.5878,
|
||
|
|
"mean_token_accuracy": 0.11447165459394455,
|
||
|
|
"num_tokens": 899886.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.061623859405517,
|
||
|
|
"epoch": 0.024111103967080307,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.000187,
|
||
|
|
"loss": 6.7105,
|
||
|
|
"mean_token_accuracy": 0.11387978419661522,
|
||
|
|
"num_tokens": 911448.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.076057815551758,
|
||
|
|
"epoch": 0.024432585353308042,
|
||
|
|
"grad_norm": 1.34375,
|
||
|
|
"learning_rate": 0.0001895,
|
||
|
|
"loss": 6.7226,
|
||
|
|
"mean_token_accuracy": 0.10502426400780678,
|
||
|
|
"num_tokens": 922938.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.091100549697876,
|
||
|
|
"epoch": 0.02475406673953578,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000192,
|
||
|
|
"loss": 6.684,
|
||
|
|
"mean_token_accuracy": 0.11112537905573845,
|
||
|
|
"num_tokens": 935037.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.033271551132202,
|
||
|
|
"epoch": 0.025075548125763517,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.0001945,
|
||
|
|
"loss": 6.6903,
|
||
|
|
"mean_token_accuracy": 0.11486706212162971,
|
||
|
|
"num_tokens": 946395.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.067003679275513,
|
||
|
|
"epoch": 0.025397029511991256,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.00019700000000000002,
|
||
|
|
"loss": 6.6824,
|
||
|
|
"mean_token_accuracy": 0.11959373131394387,
|
||
|
|
"num_tokens": 957963.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.964381456375122,
|
||
|
|
"epoch": 0.025718510898218992,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.00019950000000000002,
|
||
|
|
"loss": 6.6614,
|
||
|
|
"mean_token_accuracy": 0.11519286185503005,
|
||
|
|
"num_tokens": 970474.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.985042428970337,
|
||
|
|
"epoch": 0.02603999228444673,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.000202,
|
||
|
|
"loss": 6.5889,
|
||
|
|
"mean_token_accuracy": 0.11821843534708024,
|
||
|
|
"num_tokens": 984090.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.921429443359375,
|
||
|
|
"epoch": 0.026361473670674467,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.00020449999999999998,
|
||
|
|
"loss": 6.5338,
|
||
|
|
"mean_token_accuracy": 0.11909934431314469,
|
||
|
|
"num_tokens": 997159.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.919507074356079,
|
||
|
|
"epoch": 0.026682955056902206,
|
||
|
|
"grad_norm": 1.4140625,
|
||
|
|
"learning_rate": 0.000207,
|
||
|
|
"loss": 6.5426,
|
||
|
|
"mean_token_accuracy": 0.1263238213956356,
|
||
|
|
"num_tokens": 1009350.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0176619529724125,
|
||
|
|
"epoch": 0.027004436443129942,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.0002095,
|
||
|
|
"loss": 6.6044,
|
||
|
|
"mean_token_accuracy": 0.11384878158569336,
|
||
|
|
"num_tokens": 1021170.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.921230745315552,
|
||
|
|
"epoch": 0.02732591782935768,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.000212,
|
||
|
|
"loss": 6.5882,
|
||
|
|
"mean_token_accuracy": 0.12209255397319793,
|
||
|
|
"num_tokens": 1033173.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.975595331192016,
|
||
|
|
"epoch": 0.027647399215585417,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.0002145,
|
||
|
|
"loss": 6.5325,
|
||
|
|
"mean_token_accuracy": 0.11612072736024856,
|
||
|
|
"num_tokens": 1045811.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.848187065124511,
|
||
|
|
"epoch": 0.027968880601813156,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00021700000000000002,
|
||
|
|
"loss": 6.5805,
|
||
|
|
"mean_token_accuracy": 0.12089723646640778,
|
||
|
|
"num_tokens": 1058519.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8529754161834715,
|
||
|
|
"epoch": 0.028290361988040892,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.0002195,
|
||
|
|
"loss": 6.5754,
|
||
|
|
"mean_token_accuracy": 0.12128934264183044,
|
||
|
|
"num_tokens": 1069977.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.9785984516143795,
|
||
|
|
"epoch": 0.02861184337426863,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.000222,
|
||
|
|
"loss": 6.5915,
|
||
|
|
"mean_token_accuracy": 0.12578077092766762,
|
||
|
|
"num_tokens": 1081368.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.93993067741394,
|
||
|
|
"epoch": 0.028933324760496367,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0002245,
|
||
|
|
"loss": 6.6061,
|
||
|
|
"mean_token_accuracy": 0.11534389182925224,
|
||
|
|
"num_tokens": 1093936.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.885406398773194,
|
||
|
|
"epoch": 0.029254806146724106,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00022700000000000002,
|
||
|
|
"loss": 6.5679,
|
||
|
|
"mean_token_accuracy": 0.1253852665424347,
|
||
|
|
"num_tokens": 1106217.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.779489421844483,
|
||
|
|
"epoch": 0.029576287532951842,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.00022950000000000002,
|
||
|
|
"loss": 6.5047,
|
||
|
|
"mean_token_accuracy": 0.12335176095366478,
|
||
|
|
"num_tokens": 1120108.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.876409864425659,
|
||
|
|
"epoch": 0.029897768919179578,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00023200000000000003,
|
||
|
|
"loss": 6.5903,
|
||
|
|
"mean_token_accuracy": 0.11788614392280579,
|
||
|
|
"num_tokens": 1132390.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.85081033706665,
|
||
|
|
"epoch": 0.030219250305407317,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.00023449999999999998,
|
||
|
|
"loss": 6.5371,
|
||
|
|
"mean_token_accuracy": 0.11927784159779549,
|
||
|
|
"num_tokens": 1144612.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.844128942489624,
|
||
|
|
"epoch": 0.030540731691635053,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.000237,
|
||
|
|
"loss": 6.5156,
|
||
|
|
"mean_token_accuracy": 0.13191793039441108,
|
||
|
|
"num_tokens": 1156151.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.760525751113891,
|
||
|
|
"epoch": 0.030862213077862792,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.0002395,
|
||
|
|
"loss": 6.4768,
|
||
|
|
"mean_token_accuracy": 0.12189689576625824,
|
||
|
|
"num_tokens": 1168777.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.826892137527466,
|
||
|
|
"epoch": 0.031183694464090528,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.000242,
|
||
|
|
"loss": 6.5164,
|
||
|
|
"mean_token_accuracy": 0.12134948447346687,
|
||
|
|
"num_tokens": 1181233.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.723635196685791,
|
||
|
|
"epoch": 0.031505175850318264,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0002445,
|
||
|
|
"loss": 6.3929,
|
||
|
|
"mean_token_accuracy": 0.12829372882843018,
|
||
|
|
"num_tokens": 1192315.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.789328145980835,
|
||
|
|
"epoch": 0.031826657236546006,
|
||
|
|
"grad_norm": 1.4609375,
|
||
|
|
"learning_rate": 0.000247,
|
||
|
|
"loss": 6.502,
|
||
|
|
"mean_token_accuracy": 0.12471335381269455,
|
||
|
|
"num_tokens": 1203452.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.792221593856811,
|
||
|
|
"epoch": 0.03214813862277374,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0002495,
|
||
|
|
"loss": 6.3686,
|
||
|
|
"mean_token_accuracy": 0.12460671365261078,
|
||
|
|
"num_tokens": 1215024.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.623924732208252,
|
||
|
|
"epoch": 0.03246962000900148,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000252,
|
||
|
|
"loss": 6.4445,
|
||
|
|
"mean_token_accuracy": 0.12416145205497742,
|
||
|
|
"num_tokens": 1227389.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.81721773147583,
|
||
|
|
"epoch": 0.032791101395229214,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0002545,
|
||
|
|
"loss": 6.5061,
|
||
|
|
"mean_token_accuracy": 0.1271965205669403,
|
||
|
|
"num_tokens": 1239580.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.701832008361817,
|
||
|
|
"epoch": 0.033112582781456956,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 0.000257,
|
||
|
|
"loss": 6.4046,
|
||
|
|
"mean_token_accuracy": 0.13063657358288766,
|
||
|
|
"num_tokens": 1251057.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.754337787628174,
|
||
|
|
"epoch": 0.03343406416768469,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.0002595,
|
||
|
|
"loss": 6.4282,
|
||
|
|
"mean_token_accuracy": 0.12938353642821313,
|
||
|
|
"num_tokens": 1261979.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.789865493774414,
|
||
|
|
"epoch": 0.03375554555391243,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.000262,
|
||
|
|
"loss": 6.4547,
|
||
|
|
"mean_token_accuracy": 0.12837205678224564,
|
||
|
|
"num_tokens": 1274862.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.647943687438965,
|
||
|
|
"epoch": 0.034077026940140163,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.00026450000000000003,
|
||
|
|
"loss": 6.4247,
|
||
|
|
"mean_token_accuracy": 0.12305119037628173,
|
||
|
|
"num_tokens": 1286798.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.70164942741394,
|
||
|
|
"epoch": 0.034398508326367906,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00026700000000000004,
|
||
|
|
"loss": 6.359,
|
||
|
|
"mean_token_accuracy": 0.134645427018404,
|
||
|
|
"num_tokens": 1298709.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6900327682495115,
|
||
|
|
"epoch": 0.03471998971259564,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00026950000000000005,
|
||
|
|
"loss": 6.4432,
|
||
|
|
"mean_token_accuracy": 0.12945917919278144,
|
||
|
|
"num_tokens": 1310597.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.656204462051392,
|
||
|
|
"epoch": 0.03504147109882338,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00027200000000000005,
|
||
|
|
"loss": 6.4467,
|
||
|
|
"mean_token_accuracy": 0.12529431134462357,
|
||
|
|
"num_tokens": 1321986.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.700818395614624,
|
||
|
|
"epoch": 0.03536295248505111,
|
||
|
|
"grad_norm": 1.4140625,
|
||
|
|
"learning_rate": 0.0002745,
|
||
|
|
"loss": 6.3911,
|
||
|
|
"mean_token_accuracy": 0.12837553173303604,
|
||
|
|
"num_tokens": 1334042.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.671852493286133,
|
||
|
|
"epoch": 0.035684433871278856,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.000277,
|
||
|
|
"loss": 6.3353,
|
||
|
|
"mean_token_accuracy": 0.13774956315755843,
|
||
|
|
"num_tokens": 1345544.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.626994228363037,
|
||
|
|
"epoch": 0.03600591525750659,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0002795,
|
||
|
|
"loss": 6.375,
|
||
|
|
"mean_token_accuracy": 0.1317882977426052,
|
||
|
|
"num_tokens": 1356390.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.696563816070556,
|
||
|
|
"epoch": 0.03632739664373433,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.00028199999999999997,
|
||
|
|
"loss": 6.3611,
|
||
|
|
"mean_token_accuracy": 0.12848201990127564,
|
||
|
|
"num_tokens": 1367673.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.669189405441284,
|
||
|
|
"epoch": 0.03664887802996206,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0002845,
|
||
|
|
"loss": 6.482,
|
||
|
|
"mean_token_accuracy": 0.1228255197405815,
|
||
|
|
"num_tokens": 1378831.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6176934242248535,
|
||
|
|
"epoch": 0.0369703594161898,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000287,
|
||
|
|
"loss": 6.3744,
|
||
|
|
"mean_token_accuracy": 0.1277584746479988,
|
||
|
|
"num_tokens": 1390664.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.654650640487671,
|
||
|
|
"epoch": 0.03729184080241754,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.0002895,
|
||
|
|
"loss": 6.3602,
|
||
|
|
"mean_token_accuracy": 0.12970560193061828,
|
||
|
|
"num_tokens": 1402452.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5951752185821535,
|
||
|
|
"epoch": 0.03761332218864528,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.000292,
|
||
|
|
"loss": 6.3472,
|
||
|
|
"mean_token_accuracy": 0.13487544283270836,
|
||
|
|
"num_tokens": 1414961.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.669209098815918,
|
||
|
|
"epoch": 0.03793480357487301,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.0002945,
|
||
|
|
"loss": 6.4936,
|
||
|
|
"mean_token_accuracy": 0.12541896998882293,
|
||
|
|
"num_tokens": 1427130.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.672261810302734,
|
||
|
|
"epoch": 0.03825628496110075,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000297,
|
||
|
|
"loss": 6.451,
|
||
|
|
"mean_token_accuracy": 0.1286468543112278,
|
||
|
|
"num_tokens": 1439670.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.482851505279541,
|
||
|
|
"epoch": 0.03857776634732849,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0002995,
|
||
|
|
"loss": 6.3289,
|
||
|
|
"mean_token_accuracy": 0.1370462618768215,
|
||
|
|
"num_tokens": 1451083.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.703476619720459,
|
||
|
|
"epoch": 0.03889924773355623,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.000302,
|
||
|
|
"loss": 6.4183,
|
||
|
|
"mean_token_accuracy": 0.12950239554047585,
|
||
|
|
"num_tokens": 1461668.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.574382019042969,
|
||
|
|
"epoch": 0.03922072911978396,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0003045,
|
||
|
|
"loss": 6.3479,
|
||
|
|
"mean_token_accuracy": 0.1261135794222355,
|
||
|
|
"num_tokens": 1474610.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.642938756942749,
|
||
|
|
"epoch": 0.0395422105060117,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000307,
|
||
|
|
"loss": 6.361,
|
||
|
|
"mean_token_accuracy": 0.13150764107704163,
|
||
|
|
"num_tokens": 1486322.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.51555118560791,
|
||
|
|
"epoch": 0.03986369189223944,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.0003095,
|
||
|
|
"loss": 6.3021,
|
||
|
|
"mean_token_accuracy": 0.1357271581888199,
|
||
|
|
"num_tokens": 1498463.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.575559139251709,
|
||
|
|
"epoch": 0.04018517327846718,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000312,
|
||
|
|
"loss": 6.3484,
|
||
|
|
"mean_token_accuracy": 0.13323022946715354,
|
||
|
|
"num_tokens": 1509636.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5351167678833,
|
||
|
|
"epoch": 0.04050665466469491,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.0003145,
|
||
|
|
"loss": 6.275,
|
||
|
|
"mean_token_accuracy": 0.1357012614607811,
|
||
|
|
"num_tokens": 1523039.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.681251955032349,
|
||
|
|
"epoch": 0.04082813605092265,
|
||
|
|
"grad_norm": 1.5390625,
|
||
|
|
"learning_rate": 0.000317,
|
||
|
|
"loss": 6.462,
|
||
|
|
"mean_token_accuracy": 0.1307701699435711,
|
||
|
|
"num_tokens": 1535491.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.573398780822754,
|
||
|
|
"epoch": 0.04114961743715039,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0003195,
|
||
|
|
"loss": 6.3801,
|
||
|
|
"mean_token_accuracy": 0.1338098555803299,
|
||
|
|
"num_tokens": 1547246.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.517386150360108,
|
||
|
|
"epoch": 0.04147109882337813,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000322,
|
||
|
|
"loss": 6.3681,
|
||
|
|
"mean_token_accuracy": 0.13089857250452042,
|
||
|
|
"num_tokens": 1558948.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.385404205322265,
|
||
|
|
"epoch": 0.04179258020960586,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00032450000000000003,
|
||
|
|
"loss": 6.1454,
|
||
|
|
"mean_token_accuracy": 0.14710128009319307,
|
||
|
|
"num_tokens": 1571590.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.57061071395874,
|
||
|
|
"epoch": 0.0421140615958336,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.00032700000000000003,
|
||
|
|
"loss": 6.3653,
|
||
|
|
"mean_token_accuracy": 0.13029702976346016,
|
||
|
|
"num_tokens": 1582646.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.511111783981323,
|
||
|
|
"epoch": 0.04243554298206134,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00032950000000000004,
|
||
|
|
"loss": 6.3366,
|
||
|
|
"mean_token_accuracy": 0.1331264428794384,
|
||
|
|
"num_tokens": 1595393.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.534172296524048,
|
||
|
|
"epoch": 0.04275702436828908,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.00033200000000000005,
|
||
|
|
"loss": 6.2452,
|
||
|
|
"mean_token_accuracy": 0.1425113245844841,
|
||
|
|
"num_tokens": 1607048.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.477965927124023,
|
||
|
|
"epoch": 0.04307850575451681,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00033450000000000005,
|
||
|
|
"loss": 6.3561,
|
||
|
|
"mean_token_accuracy": 0.1270718276500702,
|
||
|
|
"num_tokens": 1619572.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.498306322097778,
|
||
|
|
"epoch": 0.04339998714074455,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000337,
|
||
|
|
"loss": 6.2793,
|
||
|
|
"mean_token_accuracy": 0.13934960663318635,
|
||
|
|
"num_tokens": 1631342.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.433896446228028,
|
||
|
|
"epoch": 0.04372146852697229,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0003395,
|
||
|
|
"loss": 6.1508,
|
||
|
|
"mean_token_accuracy": 0.13693220615386964,
|
||
|
|
"num_tokens": 1644192.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.489602184295654,
|
||
|
|
"epoch": 0.04404294991320003,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.000342,
|
||
|
|
"loss": 6.2703,
|
||
|
|
"mean_token_accuracy": 0.13389810174703598,
|
||
|
|
"num_tokens": 1656080.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.489486837387085,
|
||
|
|
"epoch": 0.04436443129942776,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00034449999999999997,
|
||
|
|
"loss": 6.3579,
|
||
|
|
"mean_token_accuracy": 0.12244990542531013,
|
||
|
|
"num_tokens": 1669649.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.511112546920776,
|
||
|
|
"epoch": 0.0446859126856555,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.000347,
|
||
|
|
"loss": 6.2022,
|
||
|
|
"mean_token_accuracy": 0.14107420817017555,
|
||
|
|
"num_tokens": 1680722.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.397607707977295,
|
||
|
|
"epoch": 0.045007394071883235,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0003495,
|
||
|
|
"loss": 6.2983,
|
||
|
|
"mean_token_accuracy": 0.13322234600782396,
|
||
|
|
"num_tokens": 1693477.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.38734073638916,
|
||
|
|
"epoch": 0.04532887545811098,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000352,
|
||
|
|
"loss": 6.171,
|
||
|
|
"mean_token_accuracy": 0.1422523781657219,
|
||
|
|
"num_tokens": 1705823.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.481168746948242,
|
||
|
|
"epoch": 0.04565035684433871,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0003545,
|
||
|
|
"loss": 6.2632,
|
||
|
|
"mean_token_accuracy": 0.1387391321361065,
|
||
|
|
"num_tokens": 1717339.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.444924449920654,
|
||
|
|
"epoch": 0.04597183823056645,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000357,
|
||
|
|
"loss": 6.2882,
|
||
|
|
"mean_token_accuracy": 0.13487135022878646,
|
||
|
|
"num_tokens": 1729407.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.4324631690979,
|
||
|
|
"epoch": 0.046293319616794185,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0003595,
|
||
|
|
"loss": 6.23,
|
||
|
|
"mean_token_accuracy": 0.13380146771669388,
|
||
|
|
"num_tokens": 1741876.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5164624691009525,
|
||
|
|
"epoch": 0.04661480100302193,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000362,
|
||
|
|
"loss": 6.3743,
|
||
|
|
"mean_token_accuracy": 0.13089932277798652,
|
||
|
|
"num_tokens": 1755751.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.316082906723023,
|
||
|
|
"epoch": 0.04693628238924966,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0003645,
|
||
|
|
"loss": 6.1251,
|
||
|
|
"mean_token_accuracy": 0.1419507682323456,
|
||
|
|
"num_tokens": 1766711.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.389323043823242,
|
||
|
|
"epoch": 0.0472577637754774,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000367,
|
||
|
|
"loss": 6.2938,
|
||
|
|
"mean_token_accuracy": 0.1291450999677181,
|
||
|
|
"num_tokens": 1781099.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.442297554016113,
|
||
|
|
"epoch": 0.047579245161705135,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0003695,
|
||
|
|
"loss": 6.2682,
|
||
|
|
"mean_token_accuracy": 0.13379616662859917,
|
||
|
|
"num_tokens": 1793964.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.397593879699707,
|
||
|
|
"epoch": 0.04790072654793288,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000372,
|
||
|
|
"loss": 6.2867,
|
||
|
|
"mean_token_accuracy": 0.1336559273302555,
|
||
|
|
"num_tokens": 1806013.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.446059608459473,
|
||
|
|
"epoch": 0.04822220793416061,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0003745,
|
||
|
|
"loss": 6.2542,
|
||
|
|
"mean_token_accuracy": 0.13310810253024102,
|
||
|
|
"num_tokens": 1819486.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.396366977691651,
|
||
|
|
"epoch": 0.04854368932038835,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000377,
|
||
|
|
"loss": 6.157,
|
||
|
|
"mean_token_accuracy": 0.14047788679599763,
|
||
|
|
"num_tokens": 1830707.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.503454113006592,
|
||
|
|
"epoch": 0.048865170706616085,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0003795,
|
||
|
|
"loss": 6.3697,
|
||
|
|
"mean_token_accuracy": 0.13691184893250466,
|
||
|
|
"num_tokens": 1842601.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.312630748748779,
|
||
|
|
"epoch": 0.04918665209284383,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000382,
|
||
|
|
"loss": 6.1828,
|
||
|
|
"mean_token_accuracy": 0.14070570841431618,
|
||
|
|
"num_tokens": 1854989.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.414206504821777,
|
||
|
|
"epoch": 0.04950813347907156,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0003845,
|
||
|
|
"loss": 6.3074,
|
||
|
|
"mean_token_accuracy": 0.13653882518410682,
|
||
|
|
"num_tokens": 1867613.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.276795244216919,
|
||
|
|
"epoch": 0.0498296148652993,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00038700000000000003,
|
||
|
|
"loss": 6.1191,
|
||
|
|
"mean_token_accuracy": 0.13717029318213464,
|
||
|
|
"num_tokens": 1879203.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.476358842849732,
|
||
|
|
"epoch": 0.050151096251527034,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00038950000000000003,
|
||
|
|
"loss": 6.2908,
|
||
|
|
"mean_token_accuracy": 0.13173450976610185,
|
||
|
|
"num_tokens": 1892402.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.431379938125611,
|
||
|
|
"epoch": 0.05047257763775478,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00039200000000000004,
|
||
|
|
"loss": 6.2817,
|
||
|
|
"mean_token_accuracy": 0.1349482476711273,
|
||
|
|
"num_tokens": 1904777.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.474689769744873,
|
||
|
|
"epoch": 0.05079405902398251,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00039450000000000005,
|
||
|
|
"loss": 6.298,
|
||
|
|
"mean_token_accuracy": 0.1384157918393612,
|
||
|
|
"num_tokens": 1915303.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.269231557846069,
|
||
|
|
"epoch": 0.05111554041021025,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.00039700000000000005,
|
||
|
|
"loss": 6.1327,
|
||
|
|
"mean_token_accuracy": 0.14020086377859114,
|
||
|
|
"num_tokens": 1927440.0,
|
||
|
|
"step": 795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.362684345245361,
|
||
|
|
"epoch": 0.051437021796437984,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0003995,
|
||
|
|
"loss": 6.2415,
|
||
|
|
"mean_token_accuracy": 0.1398440882563591,
|
||
|
|
"num_tokens": 1939028.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.280197715759277,
|
||
|
|
"epoch": 0.05175850318266572,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000402,
|
||
|
|
"loss": 6.0433,
|
||
|
|
"mean_token_accuracy": 0.14686343744397162,
|
||
|
|
"num_tokens": 1949002.0,
|
||
|
|
"step": 805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.271064138412475,
|
||
|
|
"epoch": 0.05207998456889346,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004045,
|
||
|
|
"loss": 6.1302,
|
||
|
|
"mean_token_accuracy": 0.14056000709533692,
|
||
|
|
"num_tokens": 1960724.0,
|
||
|
|
"step": 810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.333314228057861,
|
||
|
|
"epoch": 0.0524014659551212,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.00040699999999999997,
|
||
|
|
"loss": 6.1935,
|
||
|
|
"mean_token_accuracy": 0.14521595910191537,
|
||
|
|
"num_tokens": 1972874.0,
|
||
|
|
"step": 815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.234599685668945,
|
||
|
|
"epoch": 0.052722947341348934,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004095,
|
||
|
|
"loss": 6.1707,
|
||
|
|
"mean_token_accuracy": 0.14037029147148133,
|
||
|
|
"num_tokens": 1985303.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.37439193725586,
|
||
|
|
"epoch": 0.05304442872757667,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.000412,
|
||
|
|
"loss": 6.1889,
|
||
|
|
"mean_token_accuracy": 0.13971048817038537,
|
||
|
|
"num_tokens": 1996460.0,
|
||
|
|
"step": 825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.274216079711914,
|
||
|
|
"epoch": 0.05336591011380441,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004145,
|
||
|
|
"loss": 6.1947,
|
||
|
|
"mean_token_accuracy": 0.1401621311903,
|
||
|
|
"num_tokens": 2008237.0,
|
||
|
|
"step": 830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.357626676559448,
|
||
|
|
"epoch": 0.05368739150003215,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000417,
|
||
|
|
"loss": 6.2056,
|
||
|
|
"mean_token_accuracy": 0.14124378859996795,
|
||
|
|
"num_tokens": 2020207.0,
|
||
|
|
"step": 835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.399210500717163,
|
||
|
|
"epoch": 0.054008872886259884,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.0004195,
|
||
|
|
"loss": 6.2052,
|
||
|
|
"mean_token_accuracy": 0.13477759659290314,
|
||
|
|
"num_tokens": 2031521.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.193907642364502,
|
||
|
|
"epoch": 0.05433035427248762,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000422,
|
||
|
|
"loss": 6.1833,
|
||
|
|
"mean_token_accuracy": 0.14332185834646224,
|
||
|
|
"num_tokens": 2043455.0,
|
||
|
|
"step": 845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.290856456756591,
|
||
|
|
"epoch": 0.05465183565871536,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004245,
|
||
|
|
"loss": 6.0968,
|
||
|
|
"mean_token_accuracy": 0.1420198529958725,
|
||
|
|
"num_tokens": 2055173.0,
|
||
|
|
"step": 850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.214458036422729,
|
||
|
|
"epoch": 0.0549733170449431,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000427,
|
||
|
|
"loss": 6.0947,
|
||
|
|
"mean_token_accuracy": 0.14887833148241042,
|
||
|
|
"num_tokens": 2066734.0,
|
||
|
|
"step": 855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.393264627456665,
|
||
|
|
"epoch": 0.055294798431170834,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004295,
|
||
|
|
"loss": 6.2541,
|
||
|
|
"mean_token_accuracy": 0.14005839601159095,
|
||
|
|
"num_tokens": 2078000.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.217451190948486,
|
||
|
|
"epoch": 0.05561627981739857,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000432,
|
||
|
|
"loss": 6.2153,
|
||
|
|
"mean_token_accuracy": 0.13525466695427896,
|
||
|
|
"num_tokens": 2090853.0,
|
||
|
|
"step": 865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.310794544219971,
|
||
|
|
"epoch": 0.05593776120362631,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0004345,
|
||
|
|
"loss": 6.1726,
|
||
|
|
"mean_token_accuracy": 0.14037225544452667,
|
||
|
|
"num_tokens": 2102077.0,
|
||
|
|
"step": 870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.211489582061768,
|
||
|
|
"epoch": 0.05625924258985405,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.000437,
|
||
|
|
"loss": 6.1747,
|
||
|
|
"mean_token_accuracy": 0.1440899945795536,
|
||
|
|
"num_tokens": 2114102.0,
|
||
|
|
"step": 875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.246618223190308,
|
||
|
|
"epoch": 0.056580723976081784,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004395,
|
||
|
|
"loss": 6.0766,
|
||
|
|
"mean_token_accuracy": 0.14916536808013917,
|
||
|
|
"num_tokens": 2125155.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.187794494628906,
|
||
|
|
"epoch": 0.05690220536230952,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000442,
|
||
|
|
"loss": 6.0123,
|
||
|
|
"mean_token_accuracy": 0.14380064085125924,
|
||
|
|
"num_tokens": 2136501.0,
|
||
|
|
"step": 885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.287271547317505,
|
||
|
|
"epoch": 0.05722368674853726,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004445,
|
||
|
|
"loss": 6.123,
|
||
|
|
"mean_token_accuracy": 0.14168170243501663,
|
||
|
|
"num_tokens": 2149142.0,
|
||
|
|
"step": 890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.151324510574341,
|
||
|
|
"epoch": 0.057545168134765,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.000447,
|
||
|
|
"loss": 6.0491,
|
||
|
|
"mean_token_accuracy": 0.1520587220788002,
|
||
|
|
"num_tokens": 2161548.0,
|
||
|
|
"step": 895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.17026720046997,
|
||
|
|
"epoch": 0.057866649520992734,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.00044950000000000003,
|
||
|
|
"loss": 6.0992,
|
||
|
|
"mean_token_accuracy": 0.14536573886871337,
|
||
|
|
"num_tokens": 2174109.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.23137092590332,
|
||
|
|
"epoch": 0.05818813090722047,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00045200000000000004,
|
||
|
|
"loss": 6.0609,
|
||
|
|
"mean_token_accuracy": 0.148177433013916,
|
||
|
|
"num_tokens": 2186559.0,
|
||
|
|
"step": 905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.133806419372559,
|
||
|
|
"epoch": 0.05850961229344821,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00045450000000000004,
|
||
|
|
"loss": 6.0904,
|
||
|
|
"mean_token_accuracy": 0.1488359734416008,
|
||
|
|
"num_tokens": 2199397.0,
|
||
|
|
"step": 910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.120911741256714,
|
||
|
|
"epoch": 0.05883109367967595,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00045700000000000005,
|
||
|
|
"loss": 6.0926,
|
||
|
|
"mean_token_accuracy": 0.14603182077407836,
|
||
|
|
"num_tokens": 2211176.0,
|
||
|
|
"step": 915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.178542375564575,
|
||
|
|
"epoch": 0.059152575065903684,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00045950000000000006,
|
||
|
|
"loss": 6.0374,
|
||
|
|
"mean_token_accuracy": 0.14843914732337,
|
||
|
|
"num_tokens": 2223661.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.141402244567871,
|
||
|
|
"epoch": 0.05947405645213142,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.000462,
|
||
|
|
"loss": 5.9833,
|
||
|
|
"mean_token_accuracy": 0.1485615387558937,
|
||
|
|
"num_tokens": 2233609.0,
|
||
|
|
"step": 925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1305849075317385,
|
||
|
|
"epoch": 0.059795537838359156,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.0004645,
|
||
|
|
"loss": 6.0887,
|
||
|
|
"mean_token_accuracy": 0.14092008024454117,
|
||
|
|
"num_tokens": 2245791.0,
|
||
|
|
"step": 930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.160067701339722,
|
||
|
|
"epoch": 0.0601170192245869,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000467,
|
||
|
|
"loss": 5.985,
|
||
|
|
"mean_token_accuracy": 0.14546338021755217,
|
||
|
|
"num_tokens": 2258640.0,
|
||
|
|
"step": 935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0953703880310055,
|
||
|
|
"epoch": 0.060438500610814634,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0004695,
|
||
|
|
"loss": 6.1128,
|
||
|
|
"mean_token_accuracy": 0.1390805184841156,
|
||
|
|
"num_tokens": 2270487.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.220357513427734,
|
||
|
|
"epoch": 0.06075998199704237,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000472,
|
||
|
|
"loss": 6.1361,
|
||
|
|
"mean_token_accuracy": 0.14055786430835723,
|
||
|
|
"num_tokens": 2283852.0,
|
||
|
|
"step": 945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.184080171585083,
|
||
|
|
"epoch": 0.061081463383270106,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004745,
|
||
|
|
"loss": 6.1019,
|
||
|
|
"mean_token_accuracy": 0.14241984188556672,
|
||
|
|
"num_tokens": 2295351.0,
|
||
|
|
"step": 950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.220605707168579,
|
||
|
|
"epoch": 0.06140294476949785,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.000477,
|
||
|
|
"loss": 6.1138,
|
||
|
|
"mean_token_accuracy": 0.14031047970056534,
|
||
|
|
"num_tokens": 2307723.0,
|
||
|
|
"step": 955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.107544422149658,
|
||
|
|
"epoch": 0.061724426155725584,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004795,
|
||
|
|
"loss": 6.0061,
|
||
|
|
"mean_token_accuracy": 0.15316852182149887,
|
||
|
|
"num_tokens": 2320273.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.061391162872314,
|
||
|
|
"epoch": 0.06204590754195332,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000482,
|
||
|
|
"loss": 6.0488,
|
||
|
|
"mean_token_accuracy": 0.1479623332619667,
|
||
|
|
"num_tokens": 2332142.0,
|
||
|
|
"step": 965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.121192121505738,
|
||
|
|
"epoch": 0.062367388928181056,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004845,
|
||
|
|
"loss": 6.1216,
|
||
|
|
"mean_token_accuracy": 0.14394108653068544,
|
||
|
|
"num_tokens": 2346027.0,
|
||
|
|
"step": 970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.268273067474365,
|
||
|
|
"epoch": 0.0626888703144088,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000487,
|
||
|
|
"loss": 6.1047,
|
||
|
|
"mean_token_accuracy": 0.14543917924165725,
|
||
|
|
"num_tokens": 2357606.0,
|
||
|
|
"step": 975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.144370889663696,
|
||
|
|
"epoch": 0.06301035170063653,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004895,
|
||
|
|
"loss": 6.0691,
|
||
|
|
"mean_token_accuracy": 0.15553061664104462,
|
||
|
|
"num_tokens": 2369122.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0663927555084225,
|
||
|
|
"epoch": 0.06333183308686427,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000492,
|
||
|
|
"loss": 5.9741,
|
||
|
|
"mean_token_accuracy": 0.14964642524719238,
|
||
|
|
"num_tokens": 2380313.0,
|
||
|
|
"step": 985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.227567052841186,
|
||
|
|
"epoch": 0.06365331447309201,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004945,
|
||
|
|
"loss": 6.1716,
|
||
|
|
"mean_token_accuracy": 0.14222114831209182,
|
||
|
|
"num_tokens": 2392535.0,
|
||
|
|
"step": 990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.186703300476074,
|
||
|
|
"epoch": 0.06397479585931974,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000497,
|
||
|
|
"loss": 6.1004,
|
||
|
|
"mean_token_accuracy": 0.14114162400364877,
|
||
|
|
"num_tokens": 2404878.0,
|
||
|
|
"step": 995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.979404878616333,
|
||
|
|
"epoch": 0.06429627724554748,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0004995,
|
||
|
|
"loss": 5.9674,
|
||
|
|
"mean_token_accuracy": 0.15570546686649323,
|
||
|
|
"num_tokens": 2416656.0,
|
||
|
|
"step": 1000
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 5,
|
||
|
|
"max_steps": 4000,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 1,
|
||
|
|
"save_steps": 500,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 3680763697152000.0,
|
||
|
|
"train_batch_size": 16,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|