7035 lines
192 KiB
JSON
7035 lines
192 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 0.2250369703594162,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 3500,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 10.691962623596192,
|
||
|
|
"epoch": 0.00032148138622773744,
|
||
|
|
"grad_norm": 11.75,
|
||
|
|
"learning_rate": 2e-06,
|
||
|
|
"loss": 10.8513,
|
||
|
|
"mean_token_accuracy": 0.0002252335427328944,
|
||
|
|
"num_tokens": 12742.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.691972923278808,
|
||
|
|
"epoch": 0.0006429627724554749,
|
||
|
|
"grad_norm": 11.3125,
|
||
|
|
"learning_rate": 4.5e-06,
|
||
|
|
"loss": 10.7797,
|
||
|
|
"mean_token_accuracy": 0.00016763927997089922,
|
||
|
|
"num_tokens": 24140.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.6913818359375,
|
||
|
|
"epoch": 0.0009644441586832123,
|
||
|
|
"grad_norm": 9.375,
|
||
|
|
"learning_rate": 7e-06,
|
||
|
|
"loss": 10.5596,
|
||
|
|
"mean_token_accuracy": 0.009554457850754261,
|
||
|
|
"num_tokens": 35301.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.68741807937622,
|
||
|
|
"epoch": 0.0012859255449109497,
|
||
|
|
"grad_norm": 7.1875,
|
||
|
|
"learning_rate": 9.5e-06,
|
||
|
|
"loss": 10.279,
|
||
|
|
"mean_token_accuracy": 0.031060078553855418,
|
||
|
|
"num_tokens": 47594.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.6698899269104,
|
||
|
|
"epoch": 0.001607406931138687,
|
||
|
|
"grad_norm": 4.21875,
|
||
|
|
"learning_rate": 1.2e-05,
|
||
|
|
"loss": 10.018,
|
||
|
|
"mean_token_accuracy": 0.02761343717575073,
|
||
|
|
"num_tokens": 60157.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.65185718536377,
|
||
|
|
"epoch": 0.0019288883173664245,
|
||
|
|
"grad_norm": 3.21875,
|
||
|
|
"learning_rate": 1.4500000000000002e-05,
|
||
|
|
"loss": 9.8686,
|
||
|
|
"mean_token_accuracy": 0.030902387760579585,
|
||
|
|
"num_tokens": 71681.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.64528455734253,
|
||
|
|
"epoch": 0.002250369703594162,
|
||
|
|
"grad_norm": 2.734375,
|
||
|
|
"learning_rate": 1.7000000000000003e-05,
|
||
|
|
"loss": 9.7976,
|
||
|
|
"mean_token_accuracy": 0.028960460610687733,
|
||
|
|
"num_tokens": 84059.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.643793773651122,
|
||
|
|
"epoch": 0.0025718510898218995,
|
||
|
|
"grad_norm": 2.578125,
|
||
|
|
"learning_rate": 1.95e-05,
|
||
|
|
"loss": 9.7566,
|
||
|
|
"mean_token_accuracy": 0.03402260970324278,
|
||
|
|
"num_tokens": 95765.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.633929347991943,
|
||
|
|
"epoch": 0.0028933324760496365,
|
||
|
|
"grad_norm": 2.5,
|
||
|
|
"learning_rate": 2.2e-05,
|
||
|
|
"loss": 9.7195,
|
||
|
|
"mean_token_accuracy": 0.037856101803481576,
|
||
|
|
"num_tokens": 108095.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.626009464263916,
|
||
|
|
"epoch": 0.003214813862277374,
|
||
|
|
"grad_norm": 2.421875,
|
||
|
|
"learning_rate": 2.4500000000000003e-05,
|
||
|
|
"loss": 9.6663,
|
||
|
|
"mean_token_accuracy": 0.04004088416695595,
|
||
|
|
"num_tokens": 120722.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.62456464767456,
|
||
|
|
"epoch": 0.0035362952485051115,
|
||
|
|
"grad_norm": 2.453125,
|
||
|
|
"learning_rate": 2.7e-05,
|
||
|
|
"loss": 9.579,
|
||
|
|
"mean_token_accuracy": 0.04333267491310835,
|
||
|
|
"num_tokens": 132684.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.60206480026245,
|
||
|
|
"epoch": 0.003857776634732849,
|
||
|
|
"grad_norm": 2.4375,
|
||
|
|
"learning_rate": 2.95e-05,
|
||
|
|
"loss": 9.5155,
|
||
|
|
"mean_token_accuracy": 0.041969917714595795,
|
||
|
|
"num_tokens": 143940.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.526144027709961,
|
||
|
|
"epoch": 0.0041792580209605865,
|
||
|
|
"grad_norm": 2.65625,
|
||
|
|
"learning_rate": 3.2e-05,
|
||
|
|
"loss": 9.4139,
|
||
|
|
"mean_token_accuracy": 0.0514595627784729,
|
||
|
|
"num_tokens": 156206.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.384619331359863,
|
||
|
|
"epoch": 0.004500739407188324,
|
||
|
|
"grad_norm": 2.515625,
|
||
|
|
"learning_rate": 3.4500000000000005e-05,
|
||
|
|
"loss": 9.2565,
|
||
|
|
"mean_token_accuracy": 0.053492728248238565,
|
||
|
|
"num_tokens": 167417.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.46249942779541,
|
||
|
|
"epoch": 0.0048222207934160615,
|
||
|
|
"grad_norm": 2.640625,
|
||
|
|
"learning_rate": 3.7e-05,
|
||
|
|
"loss": 9.1818,
|
||
|
|
"mean_token_accuracy": 0.05699222944676876,
|
||
|
|
"num_tokens": 180372.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.435306167602539,
|
||
|
|
"epoch": 0.005143702179643799,
|
||
|
|
"grad_norm": 2.578125,
|
||
|
|
"learning_rate": 3.95e-05,
|
||
|
|
"loss": 9.0202,
|
||
|
|
"mean_token_accuracy": 0.06815617680549621,
|
||
|
|
"num_tokens": 191614.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.381722354888916,
|
||
|
|
"epoch": 0.0054651835658715365,
|
||
|
|
"grad_norm": 2.21875,
|
||
|
|
"learning_rate": 4.2000000000000004e-05,
|
||
|
|
"loss": 8.9883,
|
||
|
|
"mean_token_accuracy": 0.0625459872186184,
|
||
|
|
"num_tokens": 202885.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.344064044952393,
|
||
|
|
"epoch": 0.005786664952099273,
|
||
|
|
"grad_norm": 2.0625,
|
||
|
|
"learning_rate": 4.45e-05,
|
||
|
|
"loss": 8.8777,
|
||
|
|
"mean_token_accuracy": 0.06927761398255824,
|
||
|
|
"num_tokens": 215099.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.285068035125732,
|
||
|
|
"epoch": 0.0061081463383270106,
|
||
|
|
"grad_norm": 2.328125,
|
||
|
|
"learning_rate": 4.7000000000000004e-05,
|
||
|
|
"loss": 8.7178,
|
||
|
|
"mean_token_accuracy": 0.07229750752449035,
|
||
|
|
"num_tokens": 227257.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.250009727478027,
|
||
|
|
"epoch": 0.006429627724554748,
|
||
|
|
"grad_norm": 2.46875,
|
||
|
|
"learning_rate": 4.9500000000000004e-05,
|
||
|
|
"loss": 8.6465,
|
||
|
|
"mean_token_accuracy": 0.07430845759809017,
|
||
|
|
"num_tokens": 240338.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.134335803985596,
|
||
|
|
"epoch": 0.0067511091107824855,
|
||
|
|
"grad_norm": 2.484375,
|
||
|
|
"learning_rate": 5.2e-05,
|
||
|
|
"loss": 8.49,
|
||
|
|
"mean_token_accuracy": 0.07340316958725453,
|
||
|
|
"num_tokens": 251438.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.063454627990723,
|
||
|
|
"epoch": 0.007072590497010223,
|
||
|
|
"grad_norm": 2.28125,
|
||
|
|
"learning_rate": 5.45e-05,
|
||
|
|
"loss": 8.4147,
|
||
|
|
"mean_token_accuracy": 0.07746305204927921,
|
||
|
|
"num_tokens": 264614.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.039491367340087,
|
||
|
|
"epoch": 0.0073940718832379605,
|
||
|
|
"grad_norm": 2.28125,
|
||
|
|
"learning_rate": 5.7e-05,
|
||
|
|
"loss": 8.3115,
|
||
|
|
"mean_token_accuracy": 0.07388029359281063,
|
||
|
|
"num_tokens": 278360.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.967554664611816,
|
||
|
|
"epoch": 0.007715553269465698,
|
||
|
|
"grad_norm": 2.0,
|
||
|
|
"learning_rate": 5.9499999999999996e-05,
|
||
|
|
"loss": 8.2266,
|
||
|
|
"mean_token_accuracy": 0.07311215251684189,
|
||
|
|
"num_tokens": 290884.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.837087726593017,
|
||
|
|
"epoch": 0.008037034655693436,
|
||
|
|
"grad_norm": 2.0625,
|
||
|
|
"learning_rate": 6.2e-05,
|
||
|
|
"loss": 8.1761,
|
||
|
|
"mean_token_accuracy": 0.07603085115551948,
|
||
|
|
"num_tokens": 304431.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.656188583374023,
|
||
|
|
"epoch": 0.008358516041921173,
|
||
|
|
"grad_norm": 2.03125,
|
||
|
|
"learning_rate": 6.450000000000001e-05,
|
||
|
|
"loss": 7.9808,
|
||
|
|
"mean_token_accuracy": 0.07899082973599433,
|
||
|
|
"num_tokens": 317555.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.52431879043579,
|
||
|
|
"epoch": 0.00867999742814891,
|
||
|
|
"grad_norm": 1.921875,
|
||
|
|
"learning_rate": 6.7e-05,
|
||
|
|
"loss": 7.7967,
|
||
|
|
"mean_token_accuracy": 0.08144079595804214,
|
||
|
|
"num_tokens": 329754.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.300153827667236,
|
||
|
|
"epoch": 0.009001478814376648,
|
||
|
|
"grad_norm": 1.640625,
|
||
|
|
"learning_rate": 6.950000000000001e-05,
|
||
|
|
"loss": 7.6916,
|
||
|
|
"mean_token_accuracy": 0.0898093469440937,
|
||
|
|
"num_tokens": 341808.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.123427486419677,
|
||
|
|
"epoch": 0.009322960200604385,
|
||
|
|
"grad_norm": 1.5625,
|
||
|
|
"learning_rate": 7.2e-05,
|
||
|
|
"loss": 7.5127,
|
||
|
|
"mean_token_accuracy": 0.09076863974332809,
|
||
|
|
"num_tokens": 353209.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.99952049255371,
|
||
|
|
"epoch": 0.009644441586832123,
|
||
|
|
"grad_norm": 1.4609375,
|
||
|
|
"learning_rate": 7.45e-05,
|
||
|
|
"loss": 7.5718,
|
||
|
|
"mean_token_accuracy": 0.0799163393676281,
|
||
|
|
"num_tokens": 365744.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.78609037399292,
|
||
|
|
"epoch": 0.00996592297305986,
|
||
|
|
"grad_norm": 1.71875,
|
||
|
|
"learning_rate": 7.7e-05,
|
||
|
|
"loss": 7.4871,
|
||
|
|
"mean_token_accuracy": 0.08622552379965782,
|
||
|
|
"num_tokens": 379133.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.53131160736084,
|
||
|
|
"epoch": 0.010287404359287598,
|
||
|
|
"grad_norm": 1.515625,
|
||
|
|
"learning_rate": 7.950000000000001e-05,
|
||
|
|
"loss": 7.4339,
|
||
|
|
"mean_token_accuracy": 0.0928072139620781,
|
||
|
|
"num_tokens": 390921.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.407974147796631,
|
||
|
|
"epoch": 0.010608885745515335,
|
||
|
|
"grad_norm": 1.6953125,
|
||
|
|
"learning_rate": 8.2e-05,
|
||
|
|
"loss": 7.4005,
|
||
|
|
"mean_token_accuracy": 0.09085078835487366,
|
||
|
|
"num_tokens": 404468.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.33922872543335,
|
||
|
|
"epoch": 0.010930367131743073,
|
||
|
|
"grad_norm": 1.671875,
|
||
|
|
"learning_rate": 8.450000000000001e-05,
|
||
|
|
"loss": 7.2555,
|
||
|
|
"mean_token_accuracy": 0.08985946327447891,
|
||
|
|
"num_tokens": 414790.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.20672607421875,
|
||
|
|
"epoch": 0.011251848517970809,
|
||
|
|
"grad_norm": 1.671875,
|
||
|
|
"learning_rate": 8.7e-05,
|
||
|
|
"loss": 7.2876,
|
||
|
|
"mean_token_accuracy": 0.0886640053242445,
|
||
|
|
"num_tokens": 427720.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.09479341506958,
|
||
|
|
"epoch": 0.011573329904198546,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 8.95e-05,
|
||
|
|
"loss": 7.2213,
|
||
|
|
"mean_token_accuracy": 0.09638915956020355,
|
||
|
|
"num_tokens": 438501.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.054841995239258,
|
||
|
|
"epoch": 0.011894811290426284,
|
||
|
|
"grad_norm": 1.4921875,
|
||
|
|
"learning_rate": 9.2e-05,
|
||
|
|
"loss": 7.1887,
|
||
|
|
"mean_token_accuracy": 0.09422452822327614,
|
||
|
|
"num_tokens": 450035.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.978442239761352,
|
||
|
|
"epoch": 0.012216292676654021,
|
||
|
|
"grad_norm": 1.5546875,
|
||
|
|
"learning_rate": 9.45e-05,
|
||
|
|
"loss": 7.1804,
|
||
|
|
"mean_token_accuracy": 0.09522246792912484,
|
||
|
|
"num_tokens": 461665.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.953486919403076,
|
||
|
|
"epoch": 0.012537774062881759,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 9.7e-05,
|
||
|
|
"loss": 7.1284,
|
||
|
|
"mean_token_accuracy": 0.09261216446757317,
|
||
|
|
"num_tokens": 472514.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.86272406578064,
|
||
|
|
"epoch": 0.012859255449109496,
|
||
|
|
"grad_norm": 1.625,
|
||
|
|
"learning_rate": 9.95e-05,
|
||
|
|
"loss": 7.2167,
|
||
|
|
"mean_token_accuracy": 0.09284883812069893,
|
||
|
|
"num_tokens": 484057.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.859376621246338,
|
||
|
|
"epoch": 0.013180736835337234,
|
||
|
|
"grad_norm": 1.6171875,
|
||
|
|
"learning_rate": 0.000102,
|
||
|
|
"loss": 7.0232,
|
||
|
|
"mean_token_accuracy": 0.10182850286364556,
|
||
|
|
"num_tokens": 496374.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.836434459686279,
|
||
|
|
"epoch": 0.013502218221564971,
|
||
|
|
"grad_norm": 1.6328125,
|
||
|
|
"learning_rate": 0.00010449999999999999,
|
||
|
|
"loss": 7.1543,
|
||
|
|
"mean_token_accuracy": 0.09297729805111885,
|
||
|
|
"num_tokens": 508816.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.725788021087647,
|
||
|
|
"epoch": 0.013823699607792709,
|
||
|
|
"grad_norm": 1.6328125,
|
||
|
|
"learning_rate": 0.000107,
|
||
|
|
"loss": 6.9889,
|
||
|
|
"mean_token_accuracy": 0.09677340798079967,
|
||
|
|
"num_tokens": 520738.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.688320064544678,
|
||
|
|
"epoch": 0.014145180994020446,
|
||
|
|
"grad_norm": 1.4453125,
|
||
|
|
"learning_rate": 0.0001095,
|
||
|
|
"loss": 6.9658,
|
||
|
|
"mean_token_accuracy": 0.09948733299970627,
|
||
|
|
"num_tokens": 531924.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.670648431777954,
|
||
|
|
"epoch": 0.014466662380248184,
|
||
|
|
"grad_norm": 1.609375,
|
||
|
|
"learning_rate": 0.000112,
|
||
|
|
"loss": 7.0118,
|
||
|
|
"mean_token_accuracy": 0.10900615230202675,
|
||
|
|
"num_tokens": 543924.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.686954212188721,
|
||
|
|
"epoch": 0.014788143766475921,
|
||
|
|
"grad_norm": 1.8515625,
|
||
|
|
"learning_rate": 0.0001145,
|
||
|
|
"loss": 7.1106,
|
||
|
|
"mean_token_accuracy": 0.09593017026782036,
|
||
|
|
"num_tokens": 555669.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.638793182373047,
|
||
|
|
"epoch": 0.015109625152703659,
|
||
|
|
"grad_norm": 1.8359375,
|
||
|
|
"learning_rate": 0.00011700000000000001,
|
||
|
|
"loss": 6.985,
|
||
|
|
"mean_token_accuracy": 0.10193387344479561,
|
||
|
|
"num_tokens": 567187.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.547295236587525,
|
||
|
|
"epoch": 0.015431106538931396,
|
||
|
|
"grad_norm": 1.5859375,
|
||
|
|
"learning_rate": 0.00011949999999999999,
|
||
|
|
"loss": 6.9604,
|
||
|
|
"mean_token_accuracy": 0.10019129663705825,
|
||
|
|
"num_tokens": 579812.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.638609123229981,
|
||
|
|
"epoch": 0.015752587925159132,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.000122,
|
||
|
|
"loss": 7.0269,
|
||
|
|
"mean_token_accuracy": 0.10339270010590554,
|
||
|
|
"num_tokens": 592539.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.532276964187622,
|
||
|
|
"epoch": 0.01607406931138687,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.0001245,
|
||
|
|
"loss": 6.9864,
|
||
|
|
"mean_token_accuracy": 0.09921617358922959,
|
||
|
|
"num_tokens": 603561.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.575937652587891,
|
||
|
|
"epoch": 0.016395550697614607,
|
||
|
|
"grad_norm": 1.40625,
|
||
|
|
"learning_rate": 0.000127,
|
||
|
|
"loss": 6.9515,
|
||
|
|
"mean_token_accuracy": 0.10559275299310684,
|
||
|
|
"num_tokens": 615309.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.502751398086548,
|
||
|
|
"epoch": 0.016717032083842346,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.0001295,
|
||
|
|
"loss": 7.0296,
|
||
|
|
"mean_token_accuracy": 0.10198334977030754,
|
||
|
|
"num_tokens": 628213.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.497059392929077,
|
||
|
|
"epoch": 0.017038513470070082,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000132,
|
||
|
|
"loss": 6.9923,
|
||
|
|
"mean_token_accuracy": 0.10004970207810401,
|
||
|
|
"num_tokens": 640786.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.384635734558105,
|
||
|
|
"epoch": 0.01735999485629782,
|
||
|
|
"grad_norm": 1.5703125,
|
||
|
|
"learning_rate": 0.00013450000000000002,
|
||
|
|
"loss": 6.7652,
|
||
|
|
"mean_token_accuracy": 0.10689441561698913,
|
||
|
|
"num_tokens": 653298.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.442841482162476,
|
||
|
|
"epoch": 0.017681476242525557,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.00013700000000000002,
|
||
|
|
"loss": 6.9593,
|
||
|
|
"mean_token_accuracy": 0.10141257345676422,
|
||
|
|
"num_tokens": 667729.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.377757835388183,
|
||
|
|
"epoch": 0.018002957628753296,
|
||
|
|
"grad_norm": 1.4765625,
|
||
|
|
"learning_rate": 0.0001395,
|
||
|
|
"loss": 6.8218,
|
||
|
|
"mean_token_accuracy": 0.109464630484581,
|
||
|
|
"num_tokens": 678289.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.392750930786133,
|
||
|
|
"epoch": 0.01832443901498103,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.00014199999999999998,
|
||
|
|
"loss": 6.9482,
|
||
|
|
"mean_token_accuracy": 0.10103233233094215,
|
||
|
|
"num_tokens": 689595.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.349066972732544,
|
||
|
|
"epoch": 0.01864592040120877,
|
||
|
|
"grad_norm": 1.6015625,
|
||
|
|
"learning_rate": 0.0001445,
|
||
|
|
"loss": 6.7929,
|
||
|
|
"mean_token_accuracy": 0.10910078138113022,
|
||
|
|
"num_tokens": 701044.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.2998779773712155,
|
||
|
|
"epoch": 0.018967401787436507,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 0.000147,
|
||
|
|
"loss": 6.8552,
|
||
|
|
"mean_token_accuracy": 0.10353608876466751,
|
||
|
|
"num_tokens": 713616.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3296403884887695,
|
||
|
|
"epoch": 0.019288883173664246,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.0001495,
|
||
|
|
"loss": 6.7575,
|
||
|
|
"mean_token_accuracy": 0.10954333394765854,
|
||
|
|
"num_tokens": 725328.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.328500699996948,
|
||
|
|
"epoch": 0.01961036455989198,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000152,
|
||
|
|
"loss": 6.8157,
|
||
|
|
"mean_token_accuracy": 0.11377528384327888,
|
||
|
|
"num_tokens": 738135.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.282759141921997,
|
||
|
|
"epoch": 0.01993184594611972,
|
||
|
|
"grad_norm": 1.7890625,
|
||
|
|
"learning_rate": 0.00015450000000000001,
|
||
|
|
"loss": 6.9205,
|
||
|
|
"mean_token_accuracy": 0.10520246997475624,
|
||
|
|
"num_tokens": 750746.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.259783411026001,
|
||
|
|
"epoch": 0.020253327332347457,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.000157,
|
||
|
|
"loss": 6.7411,
|
||
|
|
"mean_token_accuracy": 0.10833622887730598,
|
||
|
|
"num_tokens": 763983.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.18600115776062,
|
||
|
|
"epoch": 0.020574808718575196,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0001595,
|
||
|
|
"loss": 6.6981,
|
||
|
|
"mean_token_accuracy": 0.11062882989645004,
|
||
|
|
"num_tokens": 776047.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.202081680297852,
|
||
|
|
"epoch": 0.02089629010480293,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.000162,
|
||
|
|
"loss": 6.7449,
|
||
|
|
"mean_token_accuracy": 0.11173393949866295,
|
||
|
|
"num_tokens": 789551.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.191899156570434,
|
||
|
|
"epoch": 0.02121777149103067,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.00016450000000000001,
|
||
|
|
"loss": 6.6717,
|
||
|
|
"mean_token_accuracy": 0.116755510866642,
|
||
|
|
"num_tokens": 801870.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0472588539123535,
|
||
|
|
"epoch": 0.021539252877258407,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.00016700000000000002,
|
||
|
|
"loss": 6.6745,
|
||
|
|
"mean_token_accuracy": 0.11330420076847077,
|
||
|
|
"num_tokens": 813782.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.256284284591675,
|
||
|
|
"epoch": 0.021860734263486146,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00016950000000000003,
|
||
|
|
"loss": 6.7471,
|
||
|
|
"mean_token_accuracy": 0.11353514790534973,
|
||
|
|
"num_tokens": 826179.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.08664984703064,
|
||
|
|
"epoch": 0.02218221564971388,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.00017199999999999998,
|
||
|
|
"loss": 6.7564,
|
||
|
|
"mean_token_accuracy": 0.11025232151150703,
|
||
|
|
"num_tokens": 838827.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.074565649032593,
|
||
|
|
"epoch": 0.022503697035941617,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.00017449999999999999,
|
||
|
|
"loss": 6.6814,
|
||
|
|
"mean_token_accuracy": 0.11574955135583878,
|
||
|
|
"num_tokens": 851543.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.184527492523193,
|
||
|
|
"epoch": 0.022825178422169357,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.000177,
|
||
|
|
"loss": 6.6767,
|
||
|
|
"mean_token_accuracy": 0.11738619655370712,
|
||
|
|
"num_tokens": 863557.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.040078735351562,
|
||
|
|
"epoch": 0.023146659808397092,
|
||
|
|
"grad_norm": 1.4296875,
|
||
|
|
"learning_rate": 0.0001795,
|
||
|
|
"loss": 6.6815,
|
||
|
|
"mean_token_accuracy": 0.11558268815279008,
|
||
|
|
"num_tokens": 877640.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.095375967025757,
|
||
|
|
"epoch": 0.02346814119462483,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000182,
|
||
|
|
"loss": 6.7741,
|
||
|
|
"mean_token_accuracy": 0.11316436678171157,
|
||
|
|
"num_tokens": 889521.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.112909460067749,
|
||
|
|
"epoch": 0.023789622580852567,
|
||
|
|
"grad_norm": 1.8203125,
|
||
|
|
"learning_rate": 0.0001845,
|
||
|
|
"loss": 6.5878,
|
||
|
|
"mean_token_accuracy": 0.11447165459394455,
|
||
|
|
"num_tokens": 899886.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.061623859405517,
|
||
|
|
"epoch": 0.024111103967080307,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.000187,
|
||
|
|
"loss": 6.7105,
|
||
|
|
"mean_token_accuracy": 0.11387978419661522,
|
||
|
|
"num_tokens": 911448.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.076057815551758,
|
||
|
|
"epoch": 0.024432585353308042,
|
||
|
|
"grad_norm": 1.34375,
|
||
|
|
"learning_rate": 0.0001895,
|
||
|
|
"loss": 6.7226,
|
||
|
|
"mean_token_accuracy": 0.10502426400780678,
|
||
|
|
"num_tokens": 922938.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.091100549697876,
|
||
|
|
"epoch": 0.02475406673953578,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000192,
|
||
|
|
"loss": 6.684,
|
||
|
|
"mean_token_accuracy": 0.11112537905573845,
|
||
|
|
"num_tokens": 935037.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.033271551132202,
|
||
|
|
"epoch": 0.025075548125763517,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.0001945,
|
||
|
|
"loss": 6.6903,
|
||
|
|
"mean_token_accuracy": 0.11486706212162971,
|
||
|
|
"num_tokens": 946395.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.067003679275513,
|
||
|
|
"epoch": 0.025397029511991256,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.00019700000000000002,
|
||
|
|
"loss": 6.6824,
|
||
|
|
"mean_token_accuracy": 0.11959373131394387,
|
||
|
|
"num_tokens": 957963.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.964381456375122,
|
||
|
|
"epoch": 0.025718510898218992,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.00019950000000000002,
|
||
|
|
"loss": 6.6614,
|
||
|
|
"mean_token_accuracy": 0.11519286185503005,
|
||
|
|
"num_tokens": 970474.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.985042428970337,
|
||
|
|
"epoch": 0.02603999228444673,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.000202,
|
||
|
|
"loss": 6.5889,
|
||
|
|
"mean_token_accuracy": 0.11821843534708024,
|
||
|
|
"num_tokens": 984090.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.921429443359375,
|
||
|
|
"epoch": 0.026361473670674467,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.00020449999999999998,
|
||
|
|
"loss": 6.5338,
|
||
|
|
"mean_token_accuracy": 0.11909934431314469,
|
||
|
|
"num_tokens": 997159.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.919507074356079,
|
||
|
|
"epoch": 0.026682955056902206,
|
||
|
|
"grad_norm": 1.4140625,
|
||
|
|
"learning_rate": 0.000207,
|
||
|
|
"loss": 6.5426,
|
||
|
|
"mean_token_accuracy": 0.1263238213956356,
|
||
|
|
"num_tokens": 1009350.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.0176619529724125,
|
||
|
|
"epoch": 0.027004436443129942,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.0002095,
|
||
|
|
"loss": 6.6044,
|
||
|
|
"mean_token_accuracy": 0.11384878158569336,
|
||
|
|
"num_tokens": 1021170.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.921230745315552,
|
||
|
|
"epoch": 0.02732591782935768,
|
||
|
|
"grad_norm": 1.46875,
|
||
|
|
"learning_rate": 0.000212,
|
||
|
|
"loss": 6.5882,
|
||
|
|
"mean_token_accuracy": 0.12209255397319793,
|
||
|
|
"num_tokens": 1033173.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.975595331192016,
|
||
|
|
"epoch": 0.027647399215585417,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.0002145,
|
||
|
|
"loss": 6.5325,
|
||
|
|
"mean_token_accuracy": 0.11612072736024856,
|
||
|
|
"num_tokens": 1045811.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.848187065124511,
|
||
|
|
"epoch": 0.027968880601813156,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00021700000000000002,
|
||
|
|
"loss": 6.5805,
|
||
|
|
"mean_token_accuracy": 0.12089723646640778,
|
||
|
|
"num_tokens": 1058519.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8529754161834715,
|
||
|
|
"epoch": 0.028290361988040892,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.0002195,
|
||
|
|
"loss": 6.5754,
|
||
|
|
"mean_token_accuracy": 0.12128934264183044,
|
||
|
|
"num_tokens": 1069977.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.9785984516143795,
|
||
|
|
"epoch": 0.02861184337426863,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.000222,
|
||
|
|
"loss": 6.5915,
|
||
|
|
"mean_token_accuracy": 0.12578077092766762,
|
||
|
|
"num_tokens": 1081368.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.93993067741394,
|
||
|
|
"epoch": 0.028933324760496367,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0002245,
|
||
|
|
"loss": 6.6061,
|
||
|
|
"mean_token_accuracy": 0.11534389182925224,
|
||
|
|
"num_tokens": 1093936.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.885406398773194,
|
||
|
|
"epoch": 0.029254806146724106,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00022700000000000002,
|
||
|
|
"loss": 6.5679,
|
||
|
|
"mean_token_accuracy": 0.1253852665424347,
|
||
|
|
"num_tokens": 1106217.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.779489421844483,
|
||
|
|
"epoch": 0.029576287532951842,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.00022950000000000002,
|
||
|
|
"loss": 6.5047,
|
||
|
|
"mean_token_accuracy": 0.12335176095366478,
|
||
|
|
"num_tokens": 1120108.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.876409864425659,
|
||
|
|
"epoch": 0.029897768919179578,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00023200000000000003,
|
||
|
|
"loss": 6.5903,
|
||
|
|
"mean_token_accuracy": 0.11788614392280579,
|
||
|
|
"num_tokens": 1132390.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.85081033706665,
|
||
|
|
"epoch": 0.030219250305407317,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.00023449999999999998,
|
||
|
|
"loss": 6.5371,
|
||
|
|
"mean_token_accuracy": 0.11927784159779549,
|
||
|
|
"num_tokens": 1144612.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.844128942489624,
|
||
|
|
"epoch": 0.030540731691635053,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.000237,
|
||
|
|
"loss": 6.5156,
|
||
|
|
"mean_token_accuracy": 0.13191793039441108,
|
||
|
|
"num_tokens": 1156151.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.760525751113891,
|
||
|
|
"epoch": 0.030862213077862792,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.0002395,
|
||
|
|
"loss": 6.4768,
|
||
|
|
"mean_token_accuracy": 0.12189689576625824,
|
||
|
|
"num_tokens": 1168777.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.826892137527466,
|
||
|
|
"epoch": 0.031183694464090528,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.000242,
|
||
|
|
"loss": 6.5164,
|
||
|
|
"mean_token_accuracy": 0.12134948447346687,
|
||
|
|
"num_tokens": 1181233.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.723635196685791,
|
||
|
|
"epoch": 0.031505175850318264,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0002445,
|
||
|
|
"loss": 6.3929,
|
||
|
|
"mean_token_accuracy": 0.12829372882843018,
|
||
|
|
"num_tokens": 1192315.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.789328145980835,
|
||
|
|
"epoch": 0.031826657236546006,
|
||
|
|
"grad_norm": 1.4609375,
|
||
|
|
"learning_rate": 0.000247,
|
||
|
|
"loss": 6.502,
|
||
|
|
"mean_token_accuracy": 0.12471335381269455,
|
||
|
|
"num_tokens": 1203452.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.792221593856811,
|
||
|
|
"epoch": 0.03214813862277374,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0002495,
|
||
|
|
"loss": 6.3686,
|
||
|
|
"mean_token_accuracy": 0.12460671365261078,
|
||
|
|
"num_tokens": 1215024.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.623924732208252,
|
||
|
|
"epoch": 0.03246962000900148,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000252,
|
||
|
|
"loss": 6.4445,
|
||
|
|
"mean_token_accuracy": 0.12416145205497742,
|
||
|
|
"num_tokens": 1227389.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.81721773147583,
|
||
|
|
"epoch": 0.032791101395229214,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0002545,
|
||
|
|
"loss": 6.5061,
|
||
|
|
"mean_token_accuracy": 0.1271965205669403,
|
||
|
|
"num_tokens": 1239580.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.701832008361817,
|
||
|
|
"epoch": 0.033112582781456956,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 0.000257,
|
||
|
|
"loss": 6.4046,
|
||
|
|
"mean_token_accuracy": 0.13063657358288766,
|
||
|
|
"num_tokens": 1251057.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.754337787628174,
|
||
|
|
"epoch": 0.03343406416768469,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.0002595,
|
||
|
|
"loss": 6.4282,
|
||
|
|
"mean_token_accuracy": 0.12938353642821313,
|
||
|
|
"num_tokens": 1261979.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.789865493774414,
|
||
|
|
"epoch": 0.03375554555391243,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.000262,
|
||
|
|
"loss": 6.4547,
|
||
|
|
"mean_token_accuracy": 0.12837205678224564,
|
||
|
|
"num_tokens": 1274862.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.647943687438965,
|
||
|
|
"epoch": 0.034077026940140163,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.00026450000000000003,
|
||
|
|
"loss": 6.4247,
|
||
|
|
"mean_token_accuracy": 0.12305119037628173,
|
||
|
|
"num_tokens": 1286798.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.70164942741394,
|
||
|
|
"epoch": 0.034398508326367906,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00026700000000000004,
|
||
|
|
"loss": 6.359,
|
||
|
|
"mean_token_accuracy": 0.134645427018404,
|
||
|
|
"num_tokens": 1298709.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6900327682495115,
|
||
|
|
"epoch": 0.03471998971259564,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00026950000000000005,
|
||
|
|
"loss": 6.4432,
|
||
|
|
"mean_token_accuracy": 0.12945917919278144,
|
||
|
|
"num_tokens": 1310597.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.656204462051392,
|
||
|
|
"epoch": 0.03504147109882338,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00027200000000000005,
|
||
|
|
"loss": 6.4467,
|
||
|
|
"mean_token_accuracy": 0.12529431134462357,
|
||
|
|
"num_tokens": 1321986.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.700818395614624,
|
||
|
|
"epoch": 0.03536295248505111,
|
||
|
|
"grad_norm": 1.4140625,
|
||
|
|
"learning_rate": 0.0002745,
|
||
|
|
"loss": 6.3911,
|
||
|
|
"mean_token_accuracy": 0.12837553173303604,
|
||
|
|
"num_tokens": 1334042.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.671852493286133,
|
||
|
|
"epoch": 0.035684433871278856,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.000277,
|
||
|
|
"loss": 6.3353,
|
||
|
|
"mean_token_accuracy": 0.13774956315755843,
|
||
|
|
"num_tokens": 1345544.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.626994228363037,
|
||
|
|
"epoch": 0.03600591525750659,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0002795,
|
||
|
|
"loss": 6.375,
|
||
|
|
"mean_token_accuracy": 0.1317882977426052,
|
||
|
|
"num_tokens": 1356390.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.696563816070556,
|
||
|
|
"epoch": 0.03632739664373433,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.00028199999999999997,
|
||
|
|
"loss": 6.3611,
|
||
|
|
"mean_token_accuracy": 0.12848201990127564,
|
||
|
|
"num_tokens": 1367673.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.669189405441284,
|
||
|
|
"epoch": 0.03664887802996206,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0002845,
|
||
|
|
"loss": 6.482,
|
||
|
|
"mean_token_accuracy": 0.1228255197405815,
|
||
|
|
"num_tokens": 1378831.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6176934242248535,
|
||
|
|
"epoch": 0.0369703594161898,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000287,
|
||
|
|
"loss": 6.3744,
|
||
|
|
"mean_token_accuracy": 0.1277584746479988,
|
||
|
|
"num_tokens": 1390664.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.654650640487671,
|
||
|
|
"epoch": 0.03729184080241754,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.0002895,
|
||
|
|
"loss": 6.3602,
|
||
|
|
"mean_token_accuracy": 0.12970560193061828,
|
||
|
|
"num_tokens": 1402452.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5951752185821535,
|
||
|
|
"epoch": 0.03761332218864528,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.000292,
|
||
|
|
"loss": 6.3472,
|
||
|
|
"mean_token_accuracy": 0.13487544283270836,
|
||
|
|
"num_tokens": 1414961.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.669209098815918,
|
||
|
|
"epoch": 0.03793480357487301,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.0002945,
|
||
|
|
"loss": 6.4936,
|
||
|
|
"mean_token_accuracy": 0.12541896998882293,
|
||
|
|
"num_tokens": 1427130.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.672261810302734,
|
||
|
|
"epoch": 0.03825628496110075,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000297,
|
||
|
|
"loss": 6.451,
|
||
|
|
"mean_token_accuracy": 0.1286468543112278,
|
||
|
|
"num_tokens": 1439670.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.482851505279541,
|
||
|
|
"epoch": 0.03857776634732849,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0002995,
|
||
|
|
"loss": 6.3289,
|
||
|
|
"mean_token_accuracy": 0.1370462618768215,
|
||
|
|
"num_tokens": 1451083.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.703476619720459,
|
||
|
|
"epoch": 0.03889924773355623,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.000302,
|
||
|
|
"loss": 6.4183,
|
||
|
|
"mean_token_accuracy": 0.12950239554047585,
|
||
|
|
"num_tokens": 1461668.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.574382019042969,
|
||
|
|
"epoch": 0.03922072911978396,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0003045,
|
||
|
|
"loss": 6.3479,
|
||
|
|
"mean_token_accuracy": 0.1261135794222355,
|
||
|
|
"num_tokens": 1474610.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.642938756942749,
|
||
|
|
"epoch": 0.0395422105060117,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000307,
|
||
|
|
"loss": 6.361,
|
||
|
|
"mean_token_accuracy": 0.13150764107704163,
|
||
|
|
"num_tokens": 1486322.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.51555118560791,
|
||
|
|
"epoch": 0.03986369189223944,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.0003095,
|
||
|
|
"loss": 6.3021,
|
||
|
|
"mean_token_accuracy": 0.1357271581888199,
|
||
|
|
"num_tokens": 1498463.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.575559139251709,
|
||
|
|
"epoch": 0.04018517327846718,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000312,
|
||
|
|
"loss": 6.3484,
|
||
|
|
"mean_token_accuracy": 0.13323022946715354,
|
||
|
|
"num_tokens": 1509636.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5351167678833,
|
||
|
|
"epoch": 0.04050665466469491,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.0003145,
|
||
|
|
"loss": 6.275,
|
||
|
|
"mean_token_accuracy": 0.1357012614607811,
|
||
|
|
"num_tokens": 1523039.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.681251955032349,
|
||
|
|
"epoch": 0.04082813605092265,
|
||
|
|
"grad_norm": 1.5390625,
|
||
|
|
"learning_rate": 0.000317,
|
||
|
|
"loss": 6.462,
|
||
|
|
"mean_token_accuracy": 0.1307701699435711,
|
||
|
|
"num_tokens": 1535491.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.573398780822754,
|
||
|
|
"epoch": 0.04114961743715039,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0003195,
|
||
|
|
"loss": 6.3801,
|
||
|
|
"mean_token_accuracy": 0.1338098555803299,
|
||
|
|
"num_tokens": 1547246.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.517386150360108,
|
||
|
|
"epoch": 0.04147109882337813,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000322,
|
||
|
|
"loss": 6.3681,
|
||
|
|
"mean_token_accuracy": 0.13089857250452042,
|
||
|
|
"num_tokens": 1558948.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.385404205322265,
|
||
|
|
"epoch": 0.04179258020960586,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00032450000000000003,
|
||
|
|
"loss": 6.1454,
|
||
|
|
"mean_token_accuracy": 0.14710128009319307,
|
||
|
|
"num_tokens": 1571590.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.57061071395874,
|
||
|
|
"epoch": 0.0421140615958336,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.00032700000000000003,
|
||
|
|
"loss": 6.3653,
|
||
|
|
"mean_token_accuracy": 0.13029702976346016,
|
||
|
|
"num_tokens": 1582646.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.511111783981323,
|
||
|
|
"epoch": 0.04243554298206134,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00032950000000000004,
|
||
|
|
"loss": 6.3366,
|
||
|
|
"mean_token_accuracy": 0.1331264428794384,
|
||
|
|
"num_tokens": 1595393.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.534172296524048,
|
||
|
|
"epoch": 0.04275702436828908,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.00033200000000000005,
|
||
|
|
"loss": 6.2452,
|
||
|
|
"mean_token_accuracy": 0.1425113245844841,
|
||
|
|
"num_tokens": 1607048.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.477965927124023,
|
||
|
|
"epoch": 0.04307850575451681,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00033450000000000005,
|
||
|
|
"loss": 6.3561,
|
||
|
|
"mean_token_accuracy": 0.1270718276500702,
|
||
|
|
"num_tokens": 1619572.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.498306322097778,
|
||
|
|
"epoch": 0.04339998714074455,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000337,
|
||
|
|
"loss": 6.2793,
|
||
|
|
"mean_token_accuracy": 0.13934960663318635,
|
||
|
|
"num_tokens": 1631342.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.433896446228028,
|
||
|
|
"epoch": 0.04372146852697229,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0003395,
|
||
|
|
"loss": 6.1508,
|
||
|
|
"mean_token_accuracy": 0.13693220615386964,
|
||
|
|
"num_tokens": 1644192.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.489602184295654,
|
||
|
|
"epoch": 0.04404294991320003,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.000342,
|
||
|
|
"loss": 6.2703,
|
||
|
|
"mean_token_accuracy": 0.13389810174703598,
|
||
|
|
"num_tokens": 1656080.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.489486837387085,
|
||
|
|
"epoch": 0.04436443129942776,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00034449999999999997,
|
||
|
|
"loss": 6.3579,
|
||
|
|
"mean_token_accuracy": 0.12244990542531013,
|
||
|
|
"num_tokens": 1669649.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.511112546920776,
|
||
|
|
"epoch": 0.0446859126856555,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.000347,
|
||
|
|
"loss": 6.2022,
|
||
|
|
"mean_token_accuracy": 0.14107420817017555,
|
||
|
|
"num_tokens": 1680722.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.397607707977295,
|
||
|
|
"epoch": 0.045007394071883235,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0003495,
|
||
|
|
"loss": 6.2983,
|
||
|
|
"mean_token_accuracy": 0.13322234600782396,
|
||
|
|
"num_tokens": 1693477.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.38734073638916,
|
||
|
|
"epoch": 0.04532887545811098,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000352,
|
||
|
|
"loss": 6.171,
|
||
|
|
"mean_token_accuracy": 0.1422523781657219,
|
||
|
|
"num_tokens": 1705823.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.481168746948242,
|
||
|
|
"epoch": 0.04565035684433871,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0003545,
|
||
|
|
"loss": 6.2632,
|
||
|
|
"mean_token_accuracy": 0.1387391321361065,
|
||
|
|
"num_tokens": 1717339.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.444924449920654,
|
||
|
|
"epoch": 0.04597183823056645,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000357,
|
||
|
|
"loss": 6.2882,
|
||
|
|
"mean_token_accuracy": 0.13487135022878646,
|
||
|
|
"num_tokens": 1729407.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.4324631690979,
|
||
|
|
"epoch": 0.046293319616794185,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0003595,
|
||
|
|
"loss": 6.23,
|
||
|
|
"mean_token_accuracy": 0.13380146771669388,
|
||
|
|
"num_tokens": 1741876.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.5164624691009525,
|
||
|
|
"epoch": 0.04661480100302193,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000362,
|
||
|
|
"loss": 6.3743,
|
||
|
|
"mean_token_accuracy": 0.13089932277798652,
|
||
|
|
"num_tokens": 1755751.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.316082906723023,
|
||
|
|
"epoch": 0.04693628238924966,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0003645,
|
||
|
|
"loss": 6.1251,
|
||
|
|
"mean_token_accuracy": 0.1419507682323456,
|
||
|
|
"num_tokens": 1766711.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.389323043823242,
|
||
|
|
"epoch": 0.0472577637754774,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000367,
|
||
|
|
"loss": 6.2938,
|
||
|
|
"mean_token_accuracy": 0.1291450999677181,
|
||
|
|
"num_tokens": 1781099.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.442297554016113,
|
||
|
|
"epoch": 0.047579245161705135,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0003695,
|
||
|
|
"loss": 6.2682,
|
||
|
|
"mean_token_accuracy": 0.13379616662859917,
|
||
|
|
"num_tokens": 1793964.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.397593879699707,
|
||
|
|
"epoch": 0.04790072654793288,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000372,
|
||
|
|
"loss": 6.2867,
|
||
|
|
"mean_token_accuracy": 0.1336559273302555,
|
||
|
|
"num_tokens": 1806013.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.446059608459473,
|
||
|
|
"epoch": 0.04822220793416061,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0003745,
|
||
|
|
"loss": 6.2542,
|
||
|
|
"mean_token_accuracy": 0.13310810253024102,
|
||
|
|
"num_tokens": 1819486.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.396366977691651,
|
||
|
|
"epoch": 0.04854368932038835,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000377,
|
||
|
|
"loss": 6.157,
|
||
|
|
"mean_token_accuracy": 0.14047788679599763,
|
||
|
|
"num_tokens": 1830707.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.503454113006592,
|
||
|
|
"epoch": 0.048865170706616085,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0003795,
|
||
|
|
"loss": 6.3697,
|
||
|
|
"mean_token_accuracy": 0.13691184893250466,
|
||
|
|
"num_tokens": 1842601.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.312630748748779,
|
||
|
|
"epoch": 0.04918665209284383,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000382,
|
||
|
|
"loss": 6.1828,
|
||
|
|
"mean_token_accuracy": 0.14070570841431618,
|
||
|
|
"num_tokens": 1854989.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.414206504821777,
|
||
|
|
"epoch": 0.04950813347907156,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0003845,
|
||
|
|
"loss": 6.3074,
|
||
|
|
"mean_token_accuracy": 0.13653882518410682,
|
||
|
|
"num_tokens": 1867613.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.276795244216919,
|
||
|
|
"epoch": 0.0498296148652993,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00038700000000000003,
|
||
|
|
"loss": 6.1191,
|
||
|
|
"mean_token_accuracy": 0.13717029318213464,
|
||
|
|
"num_tokens": 1879203.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.476358842849732,
|
||
|
|
"epoch": 0.050151096251527034,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00038950000000000003,
|
||
|
|
"loss": 6.2908,
|
||
|
|
"mean_token_accuracy": 0.13173450976610185,
|
||
|
|
"num_tokens": 1892402.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.431379938125611,
|
||
|
|
"epoch": 0.05047257763775478,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00039200000000000004,
|
||
|
|
"loss": 6.2817,
|
||
|
|
"mean_token_accuracy": 0.1349482476711273,
|
||
|
|
"num_tokens": 1904777.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.474689769744873,
|
||
|
|
"epoch": 0.05079405902398251,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00039450000000000005,
|
||
|
|
"loss": 6.298,
|
||
|
|
"mean_token_accuracy": 0.1384157918393612,
|
||
|
|
"num_tokens": 1915303.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.269231557846069,
|
||
|
|
"epoch": 0.05111554041021025,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.00039700000000000005,
|
||
|
|
"loss": 6.1327,
|
||
|
|
"mean_token_accuracy": 0.14020086377859114,
|
||
|
|
"num_tokens": 1927440.0,
|
||
|
|
"step": 795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.362684345245361,
|
||
|
|
"epoch": 0.051437021796437984,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0003995,
|
||
|
|
"loss": 6.2415,
|
||
|
|
"mean_token_accuracy": 0.1398440882563591,
|
||
|
|
"num_tokens": 1939028.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.280197715759277,
|
||
|
|
"epoch": 0.05175850318266572,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000402,
|
||
|
|
"loss": 6.0433,
|
||
|
|
"mean_token_accuracy": 0.14686343744397162,
|
||
|
|
"num_tokens": 1949002.0,
|
||
|
|
"step": 805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.271064138412475,
|
||
|
|
"epoch": 0.05207998456889346,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004045,
|
||
|
|
"loss": 6.1302,
|
||
|
|
"mean_token_accuracy": 0.14056000709533692,
|
||
|
|
"num_tokens": 1960724.0,
|
||
|
|
"step": 810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.333314228057861,
|
||
|
|
"epoch": 0.0524014659551212,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.00040699999999999997,
|
||
|
|
"loss": 6.1935,
|
||
|
|
"mean_token_accuracy": 0.14521595910191537,
|
||
|
|
"num_tokens": 1972874.0,
|
||
|
|
"step": 815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.234599685668945,
|
||
|
|
"epoch": 0.052722947341348934,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004095,
|
||
|
|
"loss": 6.1707,
|
||
|
|
"mean_token_accuracy": 0.14037029147148133,
|
||
|
|
"num_tokens": 1985303.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.37439193725586,
|
||
|
|
"epoch": 0.05304442872757667,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.000412,
|
||
|
|
"loss": 6.1889,
|
||
|
|
"mean_token_accuracy": 0.13971048817038537,
|
||
|
|
"num_tokens": 1996460.0,
|
||
|
|
"step": 825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.274216079711914,
|
||
|
|
"epoch": 0.05336591011380441,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004145,
|
||
|
|
"loss": 6.1947,
|
||
|
|
"mean_token_accuracy": 0.1401621311903,
|
||
|
|
"num_tokens": 2008237.0,
|
||
|
|
"step": 830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.357626676559448,
|
||
|
|
"epoch": 0.05368739150003215,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000417,
|
||
|
|
"loss": 6.2056,
|
||
|
|
"mean_token_accuracy": 0.14124378859996795,
|
||
|
|
"num_tokens": 2020207.0,
|
||
|
|
"step": 835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.399210500717163,
|
||
|
|
"epoch": 0.054008872886259884,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.0004195,
|
||
|
|
"loss": 6.2052,
|
||
|
|
"mean_token_accuracy": 0.13477759659290314,
|
||
|
|
"num_tokens": 2031521.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.193907642364502,
|
||
|
|
"epoch": 0.05433035427248762,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000422,
|
||
|
|
"loss": 6.1833,
|
||
|
|
"mean_token_accuracy": 0.14332185834646224,
|
||
|
|
"num_tokens": 2043455.0,
|
||
|
|
"step": 845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.290856456756591,
|
||
|
|
"epoch": 0.05465183565871536,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004245,
|
||
|
|
"loss": 6.0968,
|
||
|
|
"mean_token_accuracy": 0.1420198529958725,
|
||
|
|
"num_tokens": 2055173.0,
|
||
|
|
"step": 850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.214458036422729,
|
||
|
|
"epoch": 0.0549733170449431,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000427,
|
||
|
|
"loss": 6.0947,
|
||
|
|
"mean_token_accuracy": 0.14887833148241042,
|
||
|
|
"num_tokens": 2066734.0,
|
||
|
|
"step": 855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.393264627456665,
|
||
|
|
"epoch": 0.055294798431170834,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004295,
|
||
|
|
"loss": 6.2541,
|
||
|
|
"mean_token_accuracy": 0.14005839601159095,
|
||
|
|
"num_tokens": 2078000.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.217451190948486,
|
||
|
|
"epoch": 0.05561627981739857,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000432,
|
||
|
|
"loss": 6.2153,
|
||
|
|
"mean_token_accuracy": 0.13525466695427896,
|
||
|
|
"num_tokens": 2090853.0,
|
||
|
|
"step": 865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.310794544219971,
|
||
|
|
"epoch": 0.05593776120362631,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0004345,
|
||
|
|
"loss": 6.1726,
|
||
|
|
"mean_token_accuracy": 0.14037225544452667,
|
||
|
|
"num_tokens": 2102077.0,
|
||
|
|
"step": 870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.211489582061768,
|
||
|
|
"epoch": 0.05625924258985405,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.000437,
|
||
|
|
"loss": 6.1747,
|
||
|
|
"mean_token_accuracy": 0.1440899945795536,
|
||
|
|
"num_tokens": 2114102.0,
|
||
|
|
"step": 875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.246618223190308,
|
||
|
|
"epoch": 0.056580723976081784,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004395,
|
||
|
|
"loss": 6.0766,
|
||
|
|
"mean_token_accuracy": 0.14916536808013917,
|
||
|
|
"num_tokens": 2125155.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.187794494628906,
|
||
|
|
"epoch": 0.05690220536230952,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.000442,
|
||
|
|
"loss": 6.0123,
|
||
|
|
"mean_token_accuracy": 0.14380064085125924,
|
||
|
|
"num_tokens": 2136501.0,
|
||
|
|
"step": 885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.287271547317505,
|
||
|
|
"epoch": 0.05722368674853726,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004445,
|
||
|
|
"loss": 6.123,
|
||
|
|
"mean_token_accuracy": 0.14168170243501663,
|
||
|
|
"num_tokens": 2149142.0,
|
||
|
|
"step": 890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.151324510574341,
|
||
|
|
"epoch": 0.057545168134765,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.000447,
|
||
|
|
"loss": 6.0491,
|
||
|
|
"mean_token_accuracy": 0.1520587220788002,
|
||
|
|
"num_tokens": 2161548.0,
|
||
|
|
"step": 895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.17026720046997,
|
||
|
|
"epoch": 0.057866649520992734,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.00044950000000000003,
|
||
|
|
"loss": 6.0992,
|
||
|
|
"mean_token_accuracy": 0.14536573886871337,
|
||
|
|
"num_tokens": 2174109.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.23137092590332,
|
||
|
|
"epoch": 0.05818813090722047,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00045200000000000004,
|
||
|
|
"loss": 6.0609,
|
||
|
|
"mean_token_accuracy": 0.148177433013916,
|
||
|
|
"num_tokens": 2186559.0,
|
||
|
|
"step": 905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.133806419372559,
|
||
|
|
"epoch": 0.05850961229344821,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00045450000000000004,
|
||
|
|
"loss": 6.0904,
|
||
|
|
"mean_token_accuracy": 0.1488359734416008,
|
||
|
|
"num_tokens": 2199397.0,
|
||
|
|
"step": 910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.120911741256714,
|
||
|
|
"epoch": 0.05883109367967595,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00045700000000000005,
|
||
|
|
"loss": 6.0926,
|
||
|
|
"mean_token_accuracy": 0.14603182077407836,
|
||
|
|
"num_tokens": 2211176.0,
|
||
|
|
"step": 915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.178542375564575,
|
||
|
|
"epoch": 0.059152575065903684,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00045950000000000006,
|
||
|
|
"loss": 6.0374,
|
||
|
|
"mean_token_accuracy": 0.14843914732337,
|
||
|
|
"num_tokens": 2223661.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.141402244567871,
|
||
|
|
"epoch": 0.05947405645213142,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.000462,
|
||
|
|
"loss": 5.9833,
|
||
|
|
"mean_token_accuracy": 0.1485615387558937,
|
||
|
|
"num_tokens": 2233609.0,
|
||
|
|
"step": 925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1305849075317385,
|
||
|
|
"epoch": 0.059795537838359156,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.0004645,
|
||
|
|
"loss": 6.0887,
|
||
|
|
"mean_token_accuracy": 0.14092008024454117,
|
||
|
|
"num_tokens": 2245791.0,
|
||
|
|
"step": 930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.160067701339722,
|
||
|
|
"epoch": 0.0601170192245869,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.000467,
|
||
|
|
"loss": 5.985,
|
||
|
|
"mean_token_accuracy": 0.14546338021755217,
|
||
|
|
"num_tokens": 2258640.0,
|
||
|
|
"step": 935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0953703880310055,
|
||
|
|
"epoch": 0.060438500610814634,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0004695,
|
||
|
|
"loss": 6.1128,
|
||
|
|
"mean_token_accuracy": 0.1390805184841156,
|
||
|
|
"num_tokens": 2270487.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.220357513427734,
|
||
|
|
"epoch": 0.06075998199704237,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000472,
|
||
|
|
"loss": 6.1361,
|
||
|
|
"mean_token_accuracy": 0.14055786430835723,
|
||
|
|
"num_tokens": 2283852.0,
|
||
|
|
"step": 945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.184080171585083,
|
||
|
|
"epoch": 0.061081463383270106,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004745,
|
||
|
|
"loss": 6.1019,
|
||
|
|
"mean_token_accuracy": 0.14241984188556672,
|
||
|
|
"num_tokens": 2295351.0,
|
||
|
|
"step": 950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.220605707168579,
|
||
|
|
"epoch": 0.06140294476949785,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.000477,
|
||
|
|
"loss": 6.1138,
|
||
|
|
"mean_token_accuracy": 0.14031047970056534,
|
||
|
|
"num_tokens": 2307723.0,
|
||
|
|
"step": 955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.107544422149658,
|
||
|
|
"epoch": 0.061724426155725584,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004795,
|
||
|
|
"loss": 6.0061,
|
||
|
|
"mean_token_accuracy": 0.15316852182149887,
|
||
|
|
"num_tokens": 2320273.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.061391162872314,
|
||
|
|
"epoch": 0.06204590754195332,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000482,
|
||
|
|
"loss": 6.0488,
|
||
|
|
"mean_token_accuracy": 0.1479623332619667,
|
||
|
|
"num_tokens": 2332142.0,
|
||
|
|
"step": 965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.121192121505738,
|
||
|
|
"epoch": 0.062367388928181056,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004845,
|
||
|
|
"loss": 6.1216,
|
||
|
|
"mean_token_accuracy": 0.14394108653068544,
|
||
|
|
"num_tokens": 2346027.0,
|
||
|
|
"step": 970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.268273067474365,
|
||
|
|
"epoch": 0.0626888703144088,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000487,
|
||
|
|
"loss": 6.1047,
|
||
|
|
"mean_token_accuracy": 0.14543917924165725,
|
||
|
|
"num_tokens": 2357606.0,
|
||
|
|
"step": 975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.144370889663696,
|
||
|
|
"epoch": 0.06301035170063653,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004895,
|
||
|
|
"loss": 6.0691,
|
||
|
|
"mean_token_accuracy": 0.15553061664104462,
|
||
|
|
"num_tokens": 2369122.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0663927555084225,
|
||
|
|
"epoch": 0.06333183308686427,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000492,
|
||
|
|
"loss": 5.9741,
|
||
|
|
"mean_token_accuracy": 0.14964642524719238,
|
||
|
|
"num_tokens": 2380313.0,
|
||
|
|
"step": 985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.227567052841186,
|
||
|
|
"epoch": 0.06365331447309201,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004945,
|
||
|
|
"loss": 6.1716,
|
||
|
|
"mean_token_accuracy": 0.14222114831209182,
|
||
|
|
"num_tokens": 2392535.0,
|
||
|
|
"step": 990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.186703300476074,
|
||
|
|
"epoch": 0.06397479585931974,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000497,
|
||
|
|
"loss": 6.1004,
|
||
|
|
"mean_token_accuracy": 0.14114162400364877,
|
||
|
|
"num_tokens": 2404878.0,
|
||
|
|
"step": 995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.979404878616333,
|
||
|
|
"epoch": 0.06429627724554748,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0004995,
|
||
|
|
"loss": 5.9674,
|
||
|
|
"mean_token_accuracy": 0.15570546686649323,
|
||
|
|
"num_tokens": 2416656.0,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.131570148468017,
|
||
|
|
"epoch": 0.06461775863177523,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.000499998026082006,
|
||
|
|
"loss": 6.0697,
|
||
|
|
"mean_token_accuracy": 0.14331030026078223,
|
||
|
|
"num_tokens": 2428666.0,
|
||
|
|
"step": 1005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.082760858535766,
|
||
|
|
"epoch": 0.06493924001800296,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004999900070995136,
|
||
|
|
"loss": 5.9821,
|
||
|
|
"mean_token_accuracy": 0.14666880816221237,
|
||
|
|
"num_tokens": 2440183.0,
|
||
|
|
"step": 1010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.047522735595703,
|
||
|
|
"epoch": 0.0652607214042307,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0004999758199023239,
|
||
|
|
"loss": 5.9758,
|
||
|
|
"mean_token_accuracy": 0.1448635384440422,
|
||
|
|
"num_tokens": 2452380.0,
|
||
|
|
"step": 1015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1754053115844725,
|
||
|
|
"epoch": 0.06558220279045843,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004999554648793858,
|
||
|
|
"loss": 6.1724,
|
||
|
|
"mean_token_accuracy": 0.13734461218118668,
|
||
|
|
"num_tokens": 2466418.0,
|
||
|
|
"step": 1020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.04567289352417,
|
||
|
|
"epoch": 0.06590368417668617,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004999289425887425,
|
||
|
|
"loss": 5.9287,
|
||
|
|
"mean_token_accuracy": 0.15203241556882857,
|
||
|
|
"num_tokens": 2478900.0,
|
||
|
|
"step": 1025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.053248310089112,
|
||
|
|
"epoch": 0.06622516556291391,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004998962537575161,
|
||
|
|
"loss": 6.045,
|
||
|
|
"mean_token_accuracy": 0.148047599196434,
|
||
|
|
"num_tokens": 2491059.0,
|
||
|
|
"step": 1030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.017193412780761,
|
||
|
|
"epoch": 0.06654664694914164,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004998573992818874,
|
||
|
|
"loss": 5.9798,
|
||
|
|
"mean_token_accuracy": 0.14830705970525743,
|
||
|
|
"num_tokens": 2503090.0,
|
||
|
|
"step": 1035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.13506236076355,
|
||
|
|
"epoch": 0.06686812833536938,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004998123802270715,
|
||
|
|
"loss": 6.0624,
|
||
|
|
"mean_token_accuracy": 0.14565887302160263,
|
||
|
|
"num_tokens": 2513716.0,
|
||
|
|
"step": 1040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0360674381256105,
|
||
|
|
"epoch": 0.06718960972159711,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004997611978272886,
|
||
|
|
"loss": 5.993,
|
||
|
|
"mean_token_accuracy": 0.14915986061096193,
|
||
|
|
"num_tokens": 2526295.0,
|
||
|
|
"step": 1045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.198660039901734,
|
||
|
|
"epoch": 0.06751109110782486,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004997038534857298,
|
||
|
|
"loss": 6.0814,
|
||
|
|
"mean_token_accuracy": 0.15200572162866594,
|
||
|
|
"num_tokens": 2538026.0,
|
||
|
|
"step": 1050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9910167217254635,
|
||
|
|
"epoch": 0.0678325724940526,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0004996403487745194,
|
||
|
|
"loss": 6.0296,
|
||
|
|
"mean_token_accuracy": 0.15086221992969512,
|
||
|
|
"num_tokens": 2549041.0,
|
||
|
|
"step": 1055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.046800327301026,
|
||
|
|
"epoch": 0.06815405388028033,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000499570685434671,
|
||
|
|
"loss": 5.9684,
|
||
|
|
"mean_token_accuracy": 0.1474734902381897,
|
||
|
|
"num_tokens": 2561843.0,
|
||
|
|
"step": 1060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.205523538589477,
|
||
|
|
"epoch": 0.06847553526650807,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0004994948653760405,
|
||
|
|
"loss": 6.0398,
|
||
|
|
"mean_token_accuracy": 0.14417608752846717,
|
||
|
|
"num_tokens": 2573834.0,
|
||
|
|
"step": 1065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.971171236038208,
|
||
|
|
"epoch": 0.06879701665273581,
|
||
|
|
"grad_norm": 1.2265625,
|
||
|
|
"learning_rate": 0.0004994128906772729,
|
||
|
|
"loss": 6.0599,
|
||
|
|
"mean_token_accuracy": 0.14551517516374587,
|
||
|
|
"num_tokens": 2584577.0,
|
||
|
|
"step": 1070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.047037506103516,
|
||
|
|
"epoch": 0.06911849803896354,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000499324763585746,
|
||
|
|
"loss": 5.8624,
|
||
|
|
"mean_token_accuracy": 0.15329598784446716,
|
||
|
|
"num_tokens": 2596511.0,
|
||
|
|
"step": 1075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0283167362213135,
|
||
|
|
"epoch": 0.06943997942519128,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0004992304865175085,
|
||
|
|
"loss": 6.1011,
|
||
|
|
"mean_token_accuracy": 0.13929441571235657,
|
||
|
|
"num_tokens": 2608338.0,
|
||
|
|
"step": 1080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.150647974014282,
|
||
|
|
"epoch": 0.06976146081141901,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004991300620572138,
|
||
|
|
"loss": 6.0309,
|
||
|
|
"mean_token_accuracy": 0.14640165865421295,
|
||
|
|
"num_tokens": 2620081.0,
|
||
|
|
"step": 1085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.081988954544068,
|
||
|
|
"epoch": 0.07008294219764676,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0004990234929580494,
|
||
|
|
"loss": 6.0573,
|
||
|
|
"mean_token_accuracy": 0.1486335054039955,
|
||
|
|
"num_tokens": 2633153.0,
|
||
|
|
"step": 1090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.000927066802978,
|
||
|
|
"epoch": 0.0704044235838745,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0004989107821416609,
|
||
|
|
"loss": 5.9712,
|
||
|
|
"mean_token_accuracy": 0.15533942133188247,
|
||
|
|
"num_tokens": 2645055.0,
|
||
|
|
"step": 1095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.027195119857788,
|
||
|
|
"epoch": 0.07072590497010223,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.0004987919326980723,
|
||
|
|
"loss": 5.9591,
|
||
|
|
"mean_token_accuracy": 0.15612911731004714,
|
||
|
|
"num_tokens": 2657798.0,
|
||
|
|
"step": 1100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.064033794403076,
|
||
|
|
"epoch": 0.07104738635632997,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004986669478856011,
|
||
|
|
"loss": 6.0374,
|
||
|
|
"mean_token_accuracy": 0.1481868341565132,
|
||
|
|
"num_tokens": 2669095.0,
|
||
|
|
"step": 1105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.00915265083313,
|
||
|
|
"epoch": 0.07136886774255771,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004985358311307688,
|
||
|
|
"loss": 5.9295,
|
||
|
|
"mean_token_accuracy": 0.15585425943136216,
|
||
|
|
"num_tokens": 2680533.0,
|
||
|
|
"step": 1110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.918936729431152,
|
||
|
|
"epoch": 0.07169034912878544,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004983985860282081,
|
||
|
|
"loss": 5.9625,
|
||
|
|
"mean_token_accuracy": 0.15213698893785477,
|
||
|
|
"num_tokens": 2694164.0,
|
||
|
|
"step": 1115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.044512939453125,
|
||
|
|
"epoch": 0.07201183051501318,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0004982552163405623,
|
||
|
|
"loss": 5.9524,
|
||
|
|
"mean_token_accuracy": 0.15045837461948394,
|
||
|
|
"num_tokens": 2705709.0,
|
||
|
|
"step": 1120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.989704370498657,
|
||
|
|
"epoch": 0.07233331190124091,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004981057259983839,
|
||
|
|
"loss": 5.9315,
|
||
|
|
"mean_token_accuracy": 0.15283386409282684,
|
||
|
|
"num_tokens": 2716682.0,
|
||
|
|
"step": 1125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.015498065948487,
|
||
|
|
"epoch": 0.07265479328746866,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004979501191000262,
|
||
|
|
"loss": 5.9614,
|
||
|
|
"mean_token_accuracy": 0.14785169959068298,
|
||
|
|
"num_tokens": 2728336.0,
|
||
|
|
"step": 1130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.004105854034424,
|
||
|
|
"epoch": 0.0729762746736964,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004977883999115311,
|
||
|
|
"loss": 5.87,
|
||
|
|
"mean_token_accuracy": 0.15776137113571168,
|
||
|
|
"num_tokens": 2740588.0,
|
||
|
|
"step": 1135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9899965763092045,
|
||
|
|
"epoch": 0.07329775605992413,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004976205728665113,
|
||
|
|
"loss": 5.8805,
|
||
|
|
"mean_token_accuracy": 0.15943353474140168,
|
||
|
|
"num_tokens": 2751202.0,
|
||
|
|
"step": 1140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.944920206069947,
|
||
|
|
"epoch": 0.07361923744615187,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004974466425660307,
|
||
|
|
"loss": 5.9115,
|
||
|
|
"mean_token_accuracy": 0.1539611354470253,
|
||
|
|
"num_tokens": 2763200.0,
|
||
|
|
"step": 1145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.040285301208496,
|
||
|
|
"epoch": 0.0739407188323796,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004972666137784759,
|
||
|
|
"loss": 5.974,
|
||
|
|
"mean_token_accuracy": 0.15454887896776198,
|
||
|
|
"num_tokens": 2774775.0,
|
||
|
|
"step": 1150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.945583248138428,
|
||
|
|
"epoch": 0.07426220021860734,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004970804914394271,
|
||
|
|
"loss": 6.0287,
|
||
|
|
"mean_token_accuracy": 0.14280334562063218,
|
||
|
|
"num_tokens": 2787502.0,
|
||
|
|
"step": 1155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.00298547744751,
|
||
|
|
"epoch": 0.07458368160483508,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004968882806515225,
|
||
|
|
"loss": 5.9359,
|
||
|
|
"mean_token_accuracy": 0.15349582582712173,
|
||
|
|
"num_tokens": 2799054.0,
|
||
|
|
"step": 1160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0210652351379395,
|
||
|
|
"epoch": 0.07490516299106281,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0004966899866843177,
|
||
|
|
"loss": 6.058,
|
||
|
|
"mean_token_accuracy": 0.1467377468943596,
|
||
|
|
"num_tokens": 2813068.0,
|
||
|
|
"step": 1165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.088579320907593,
|
||
|
|
"epoch": 0.07522664437729056,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.000496485614974142,
|
||
|
|
"loss": 5.9565,
|
||
|
|
"mean_token_accuracy": 0.15020860433578492,
|
||
|
|
"num_tokens": 2826341.0,
|
||
|
|
"step": 1170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9464997291564945,
|
||
|
|
"epoch": 0.0755481257635183,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.0004962751711239492,
|
||
|
|
"loss": 5.9512,
|
||
|
|
"mean_token_accuracy": 0.15311693847179414,
|
||
|
|
"num_tokens": 2838963.0,
|
||
|
|
"step": 1175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.974170589447022,
|
||
|
|
"epoch": 0.07586960714974603,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0004960586609031636,
|
||
|
|
"loss": 5.889,
|
||
|
|
"mean_token_accuracy": 0.15449528396129608,
|
||
|
|
"num_tokens": 2851092.0,
|
||
|
|
"step": 1180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.957883977890015,
|
||
|
|
"epoch": 0.07619108853597377,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004958360902475224,
|
||
|
|
"loss": 5.9172,
|
||
|
|
"mean_token_accuracy": 0.15734134763479232,
|
||
|
|
"num_tokens": 2863779.0,
|
||
|
|
"step": 1185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.981568813323975,
|
||
|
|
"epoch": 0.0765125699222015,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004956074652589125,
|
||
|
|
"loss": 5.9832,
|
||
|
|
"mean_token_accuracy": 0.14990866780281067,
|
||
|
|
"num_tokens": 2875827.0,
|
||
|
|
"step": 1190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.0756574153900145,
|
||
|
|
"epoch": 0.07683405130842924,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004953727922052035,
|
||
|
|
"loss": 5.9535,
|
||
|
|
"mean_token_accuracy": 0.15205546617507934,
|
||
|
|
"num_tokens": 2887881.0,
|
||
|
|
"step": 1195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.79099817276001,
|
||
|
|
"epoch": 0.07715553269465698,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0004951320775200756,
|
||
|
|
"loss": 5.7883,
|
||
|
|
"mean_token_accuracy": 0.16018587499856948,
|
||
|
|
"num_tokens": 2899607.0,
|
||
|
|
"step": 1200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.921677541732788,
|
||
|
|
"epoch": 0.07747701408088471,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0004948853278028436,
|
||
|
|
"loss": 5.8504,
|
||
|
|
"mean_token_accuracy": 0.16271332800388336,
|
||
|
|
"num_tokens": 2911423.0,
|
||
|
|
"step": 1205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.973179960250855,
|
||
|
|
"epoch": 0.07779849546711246,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004946325498182755,
|
||
|
|
"loss": 5.9826,
|
||
|
|
"mean_token_accuracy": 0.1474372811615467,
|
||
|
|
"num_tokens": 2925360.0,
|
||
|
|
"step": 1210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.986533498764038,
|
||
|
|
"epoch": 0.0781199768533402,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004943737504964076,
|
||
|
|
"loss": 5.9135,
|
||
|
|
"mean_token_accuracy": 0.15541508048772812,
|
||
|
|
"num_tokens": 2937760.0,
|
||
|
|
"step": 1215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.93227252960205,
|
||
|
|
"epoch": 0.07844145823956793,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000494108936932354,
|
||
|
|
"loss": 5.8858,
|
||
|
|
"mean_token_accuracy": 0.1571711130440235,
|
||
|
|
"num_tokens": 2950439.0,
|
||
|
|
"step": 1220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.980891752243042,
|
||
|
|
"epoch": 0.07876293962579567,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004938381163861124,
|
||
|
|
"loss": 6.0019,
|
||
|
|
"mean_token_accuracy": 0.14415771514177322,
|
||
|
|
"num_tokens": 2962664.0,
|
||
|
|
"step": 1225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.912642574310302,
|
||
|
|
"epoch": 0.0790844210120234,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0004935612962823645,
|
||
|
|
"loss": 5.8901,
|
||
|
|
"mean_token_accuracy": 0.14896751940250397,
|
||
|
|
"num_tokens": 2974490.0,
|
||
|
|
"step": 1230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9863615989685055,
|
||
|
|
"epoch": 0.07940590239825114,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0004932784842102739,
|
||
|
|
"loss": 5.8578,
|
||
|
|
"mean_token_accuracy": 0.15844571143388747,
|
||
|
|
"num_tokens": 2987204.0,
|
||
|
|
"step": 1235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.931177091598511,
|
||
|
|
"epoch": 0.07972738378447888,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004929896879232758,
|
||
|
|
"loss": 5.9587,
|
||
|
|
"mean_token_accuracy": 0.15941362082958221,
|
||
|
|
"num_tokens": 2998803.0,
|
||
|
|
"step": 1240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.034020185470581,
|
||
|
|
"epoch": 0.08004886517070661,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004926949153388668,
|
||
|
|
"loss": 5.9113,
|
||
|
|
"mean_token_accuracy": 0.16112966537475587,
|
||
|
|
"num_tokens": 3009699.0,
|
||
|
|
"step": 1245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.827797842025757,
|
||
|
|
"epoch": 0.08037034655693436,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0004923941745383859,
|
||
|
|
"loss": 5.8776,
|
||
|
|
"mean_token_accuracy": 0.15954455733299255,
|
||
|
|
"num_tokens": 3020917.0,
|
||
|
|
"step": 1250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.888133430480957,
|
||
|
|
"epoch": 0.0806918279431621,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.000492087473766794,
|
||
|
|
"loss": 5.822,
|
||
|
|
"mean_token_accuracy": 0.1551064595580101,
|
||
|
|
"num_tokens": 3033456.0,
|
||
|
|
"step": 1255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.953010511398316,
|
||
|
|
"epoch": 0.08101330932938983,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.000491774821432448,
|
||
|
|
"loss": 6.0025,
|
||
|
|
"mean_token_accuracy": 0.1459315836429596,
|
||
|
|
"num_tokens": 3046176.0,
|
||
|
|
"step": 1260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.070719385147095,
|
||
|
|
"epoch": 0.08133479071561757,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004914562261068693,
|
||
|
|
"loss": 6.0235,
|
||
|
|
"mean_token_accuracy": 0.14801203310489655,
|
||
|
|
"num_tokens": 3057842.0,
|
||
|
|
"step": 1265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.827595949172974,
|
||
|
|
"epoch": 0.0816562721018453,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004911316965245098,
|
||
|
|
"loss": 5.8042,
|
||
|
|
"mean_token_accuracy": 0.15811493024230003,
|
||
|
|
"num_tokens": 3068571.0,
|
||
|
|
"step": 1270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.937068367004395,
|
||
|
|
"epoch": 0.08197775348807304,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.000490801241582512,
|
||
|
|
"loss": 5.8381,
|
||
|
|
"mean_token_accuracy": 0.15550213009119035,
|
||
|
|
"num_tokens": 3081008.0,
|
||
|
|
"step": 1275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.899820041656494,
|
||
|
|
"epoch": 0.08229923487430078,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000490464870340465,
|
||
|
|
"loss": 5.8374,
|
||
|
|
"mean_token_accuracy": 0.15941650569438934,
|
||
|
|
"num_tokens": 3092520.0,
|
||
|
|
"step": 1280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.013044977188111,
|
||
|
|
"epoch": 0.08262071626052851,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004901225920201563,
|
||
|
|
"loss": 6.0298,
|
||
|
|
"mean_token_accuracy": 0.14632659628987313,
|
||
|
|
"num_tokens": 3104994.0,
|
||
|
|
"step": 1285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8788024425506595,
|
||
|
|
"epoch": 0.08294219764675625,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.000489774416005319,
|
||
|
|
"loss": 5.8462,
|
||
|
|
"mean_token_accuracy": 0.16421037614345552,
|
||
|
|
"num_tokens": 3116630.0,
|
||
|
|
"step": 1290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.873007440567017,
|
||
|
|
"epoch": 0.08326367903298398,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.0004894203518413742,
|
||
|
|
"loss": 5.9303,
|
||
|
|
"mean_token_accuracy": 0.151447893679142,
|
||
|
|
"num_tokens": 3130901.0,
|
||
|
|
"step": 1295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.82794222831726,
|
||
|
|
"epoch": 0.08358516041921173,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.0004890604092351701,
|
||
|
|
"loss": 5.8033,
|
||
|
|
"mean_token_accuracy": 0.16235794723033906,
|
||
|
|
"num_tokens": 3142889.0,
|
||
|
|
"step": 1300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.9552830219268795,
|
||
|
|
"epoch": 0.08390664180543947,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000488694598054715,
|
||
|
|
"loss": 5.8747,
|
||
|
|
"mean_token_accuracy": 0.15637295246124266,
|
||
|
|
"num_tokens": 3155480.0,
|
||
|
|
"step": 1305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.897818994522095,
|
||
|
|
"epoch": 0.0842281231916672,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004883229283289071,
|
||
|
|
"loss": 5.8615,
|
||
|
|
"mean_token_accuracy": 0.15762287378311157,
|
||
|
|
"num_tokens": 3166741.0,
|
||
|
|
"step": 1310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.923405933380127,
|
||
|
|
"epoch": 0.08454960457789494,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00048794541024725993,
|
||
|
|
"loss": 5.8306,
|
||
|
|
"mean_token_accuracy": 0.15558245852589608,
|
||
|
|
"num_tokens": 3179642.0,
|
||
|
|
"step": 1315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.980076599121094,
|
||
|
|
"epoch": 0.08487108596412268,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004875620541596221,
|
||
|
|
"loss": 5.9576,
|
||
|
|
"mean_token_accuracy": 0.1603875309228897,
|
||
|
|
"num_tokens": 3191737.0,
|
||
|
|
"step": 1320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.860922861099243,
|
||
|
|
"epoch": 0.08519256735035041,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00048717287057589454,
|
||
|
|
"loss": 5.7578,
|
||
|
|
"mean_token_accuracy": 0.16732925772666932,
|
||
|
|
"num_tokens": 3204712.0,
|
||
|
|
"step": 1325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.753567361831665,
|
||
|
|
"epoch": 0.08551404873657815,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0004867778701657417,
|
||
|
|
"loss": 5.75,
|
||
|
|
"mean_token_accuracy": 0.16282168924808502,
|
||
|
|
"num_tokens": 3217394.0,
|
||
|
|
"step": 1330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.947368383407593,
|
||
|
|
"epoch": 0.08583553012280588,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00048637706375829955,
|
||
|
|
"loss": 5.7708,
|
||
|
|
"mean_token_accuracy": 0.16397789418697356,
|
||
|
|
"num_tokens": 3228550.0,
|
||
|
|
"step": 1335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.695276260375977,
|
||
|
|
"epoch": 0.08615701150903363,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.000485970462341878,
|
||
|
|
"loss": 5.7533,
|
||
|
|
"mean_token_accuracy": 0.1722976952791214,
|
||
|
|
"num_tokens": 3240535.0,
|
||
|
|
"step": 1340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.889514780044555,
|
||
|
|
"epoch": 0.08647849289526137,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00048555807706366044,
|
||
|
|
"loss": 5.7479,
|
||
|
|
"mean_token_accuracy": 0.16328693181276321,
|
||
|
|
"num_tokens": 3251876.0,
|
||
|
|
"step": 1345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.94691743850708,
|
||
|
|
"epoch": 0.0867999742814891,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00048513991922939756,
|
||
|
|
"loss": 5.9076,
|
||
|
|
"mean_token_accuracy": 0.15992892757058144,
|
||
|
|
"num_tokens": 3264834.0,
|
||
|
|
"step": 1350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.818387079238891,
|
||
|
|
"epoch": 0.08712145566771684,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00048471600030309744,
|
||
|
|
"loss": 5.8792,
|
||
|
|
"mean_token_accuracy": 0.15660524219274521,
|
||
|
|
"num_tokens": 3276556.0,
|
||
|
|
"step": 1355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.969724893569946,
|
||
|
|
"epoch": 0.08744293705394458,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00048428633190671186,
|
||
|
|
"loss": 5.8032,
|
||
|
|
"mean_token_accuracy": 0.15722499340772628,
|
||
|
|
"num_tokens": 3288321.0,
|
||
|
|
"step": 1360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.850950717926025,
|
||
|
|
"epoch": 0.08776441844017231,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004838509258198167,
|
||
|
|
"loss": 5.8833,
|
||
|
|
"mean_token_accuracy": 0.15696700513362885,
|
||
|
|
"num_tokens": 3301141.0,
|
||
|
|
"step": 1365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.88807635307312,
|
||
|
|
"epoch": 0.08808589982640005,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00048340979397929,
|
||
|
|
"loss": 5.8803,
|
||
|
|
"mean_token_accuracy": 0.1575479254126549,
|
||
|
|
"num_tokens": 3313508.0,
|
||
|
|
"step": 1370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.93755407333374,
|
||
|
|
"epoch": 0.08840738121262778,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00048296294847898386,
|
||
|
|
"loss": 5.8802,
|
||
|
|
"mean_token_accuracy": 0.15642834603786468,
|
||
|
|
"num_tokens": 3325548.0,
|
||
|
|
"step": 1375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.744391632080078,
|
||
|
|
"epoch": 0.08872886259885553,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0004825104015693934,
|
||
|
|
"loss": 5.7361,
|
||
|
|
"mean_token_accuracy": 0.16557512432336807,
|
||
|
|
"num_tokens": 3337409.0,
|
||
|
|
"step": 1380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.877873468399048,
|
||
|
|
"epoch": 0.08905034398508327,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004820521656573208,
|
||
|
|
"loss": 5.821,
|
||
|
|
"mean_token_accuracy": 0.1637149229645729,
|
||
|
|
"num_tokens": 3349083.0,
|
||
|
|
"step": 1385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.855838871002197,
|
||
|
|
"epoch": 0.089371825371311,
|
||
|
|
"grad_norm": 0.8984375,
|
||
|
|
"learning_rate": 0.00048158825330553505,
|
||
|
|
"loss": 5.8303,
|
||
|
|
"mean_token_accuracy": 0.15407798439264297,
|
||
|
|
"num_tokens": 3362145.0,
|
||
|
|
"step": 1390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.855030107498169,
|
||
|
|
"epoch": 0.08969330675753874,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00048111867723242763,
|
||
|
|
"loss": 5.7394,
|
||
|
|
"mean_token_accuracy": 0.16374233812093736,
|
||
|
|
"num_tokens": 3374472.0,
|
||
|
|
"step": 1395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.829806470870972,
|
||
|
|
"epoch": 0.09001478814376647,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004806434503116637,
|
||
|
|
"loss": 5.7859,
|
||
|
|
"mean_token_accuracy": 0.16609720289707183,
|
||
|
|
"num_tokens": 3386431.0,
|
||
|
|
"step": 1400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.832973909378052,
|
||
|
|
"epoch": 0.09033626952999421,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004801625855718296,
|
||
|
|
"loss": 5.8267,
|
||
|
|
"mean_token_accuracy": 0.15961860567331315,
|
||
|
|
"num_tokens": 3398456.0,
|
||
|
|
"step": 1405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.853139019012451,
|
||
|
|
"epoch": 0.09065775091622195,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00047967609619607477,
|
||
|
|
"loss": 5.7703,
|
||
|
|
"mean_token_accuracy": 0.1606106087565422,
|
||
|
|
"num_tokens": 3409982.0,
|
||
|
|
"step": 1410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.769105768203735,
|
||
|
|
"epoch": 0.09097923230244968,
|
||
|
|
"grad_norm": 0.91015625,
|
||
|
|
"learning_rate": 0.0004791839955217513,
|
||
|
|
"loss": 5.8455,
|
||
|
|
"mean_token_accuracy": 0.16647536754608155,
|
||
|
|
"num_tokens": 3423098.0,
|
||
|
|
"step": 1415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.803284931182861,
|
||
|
|
"epoch": 0.09130071368867743,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.00047868629704004786,
|
||
|
|
"loss": 5.7682,
|
||
|
|
"mean_token_accuracy": 0.16257543712854386,
|
||
|
|
"num_tokens": 3435572.0,
|
||
|
|
"step": 1420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.834441041946411,
|
||
|
|
"epoch": 0.09162219507490517,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00047818301439561965,
|
||
|
|
"loss": 5.8178,
|
||
|
|
"mean_token_accuracy": 0.15468621701002122,
|
||
|
|
"num_tokens": 3448468.0,
|
||
|
|
"step": 1425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.865490579605103,
|
||
|
|
"epoch": 0.0919436764611329,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.00047767416138621454,
|
||
|
|
"loss": 5.8036,
|
||
|
|
"mean_token_accuracy": 0.15958377569913865,
|
||
|
|
"num_tokens": 3460450.0,
|
||
|
|
"step": 1430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.843794155120849,
|
||
|
|
"epoch": 0.09226515784736064,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.000477159751962295,
|
||
|
|
"loss": 5.8152,
|
||
|
|
"mean_token_accuracy": 0.15784975588321687,
|
||
|
|
"num_tokens": 3473091.0,
|
||
|
|
"step": 1435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.822282075881958,
|
||
|
|
"epoch": 0.09258663923358837,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00047663980022665507,
|
||
|
|
"loss": 5.8186,
|
||
|
|
"mean_token_accuracy": 0.16628101468086243,
|
||
|
|
"num_tokens": 3484727.0,
|
||
|
|
"step": 1440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.733294820785522,
|
||
|
|
"epoch": 0.09290812061981611,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00047611432043403437,
|
||
|
|
"loss": 5.6566,
|
||
|
|
"mean_token_accuracy": 0.16515012532472612,
|
||
|
|
"num_tokens": 3497349.0,
|
||
|
|
"step": 1445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.864885044097901,
|
||
|
|
"epoch": 0.09322960200604385,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004755833269907267,
|
||
|
|
"loss": 5.9018,
|
||
|
|
"mean_token_accuracy": 0.15037262290716172,
|
||
|
|
"num_tokens": 3508879.0,
|
||
|
|
"step": 1450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.790483570098877,
|
||
|
|
"epoch": 0.09355108339227158,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0004750468344541857,
|
||
|
|
"loss": 5.6399,
|
||
|
|
"mean_token_accuracy": 0.17022294253110887,
|
||
|
|
"num_tokens": 3520524.0,
|
||
|
|
"step": 1455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.758346796035767,
|
||
|
|
"epoch": 0.09387256477849933,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00047450485753262525,
|
||
|
|
"loss": 5.7605,
|
||
|
|
"mean_token_accuracy": 0.16318226158618926,
|
||
|
|
"num_tokens": 3533929.0,
|
||
|
|
"step": 1460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.881605577468872,
|
||
|
|
"epoch": 0.09419404616472707,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00047395741108461633,
|
||
|
|
"loss": 5.7621,
|
||
|
|
"mean_token_accuracy": 0.15927200317382811,
|
||
|
|
"num_tokens": 3545203.0,
|
||
|
|
"step": 1465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.767260646820068,
|
||
|
|
"epoch": 0.0945155275509548,
|
||
|
|
"grad_norm": 0.8828125,
|
||
|
|
"learning_rate": 0.00047340451011867985,
|
||
|
|
"loss": 5.766,
|
||
|
|
"mean_token_accuracy": 0.1577385514974594,
|
||
|
|
"num_tokens": 3557203.0,
|
||
|
|
"step": 1470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.910404062271118,
|
||
|
|
"epoch": 0.09483700893718254,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00047284616979287515,
|
||
|
|
"loss": 5.7883,
|
||
|
|
"mean_token_accuracy": 0.16305567175149918,
|
||
|
|
"num_tokens": 3568844.0,
|
||
|
|
"step": 1475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.790946578979492,
|
||
|
|
"epoch": 0.09515849032341027,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00047228240541438433,
|
||
|
|
"loss": 5.7821,
|
||
|
|
"mean_token_accuracy": 0.16187248080968858,
|
||
|
|
"num_tokens": 3581186.0,
|
||
|
|
"step": 1480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.703059148788452,
|
||
|
|
"epoch": 0.09547997170963801,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00047171323243909257,
|
||
|
|
"loss": 5.7117,
|
||
|
|
"mean_token_accuracy": 0.1652946338057518,
|
||
|
|
"num_tokens": 3592679.0,
|
||
|
|
"step": 1485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.940963315963745,
|
||
|
|
"epoch": 0.09580145309586575,
|
||
|
|
"grad_norm": 0.91015625,
|
||
|
|
"learning_rate": 0.00047113866647116457,
|
||
|
|
"loss": 5.8795,
|
||
|
|
"mean_token_accuracy": 0.1530936285853386,
|
||
|
|
"num_tokens": 3605414.0,
|
||
|
|
"step": 1490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.716215991973877,
|
||
|
|
"epoch": 0.09612293448209348,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0004705587232626164,
|
||
|
|
"loss": 5.7608,
|
||
|
|
"mean_token_accuracy": 0.16268940567970275,
|
||
|
|
"num_tokens": 3618662.0,
|
||
|
|
"step": 1495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.727747964859009,
|
||
|
|
"epoch": 0.09644441586832123,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00046997341871288424,
|
||
|
|
"loss": 5.6715,
|
||
|
|
"mean_token_accuracy": 0.17156911194324492,
|
||
|
|
"num_tokens": 3629721.0,
|
||
|
|
"step": 1500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.780001974105835,
|
||
|
|
"epoch": 0.09676589725454895,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.0004693827688683879,
|
||
|
|
"loss": 5.6672,
|
||
|
|
"mean_token_accuracy": 0.17101866900920867,
|
||
|
|
"num_tokens": 3643031.0,
|
||
|
|
"step": 1505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.712687873840332,
|
||
|
|
"epoch": 0.0970873786407767,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0004687867899220914,
|
||
|
|
"loss": 5.7331,
|
||
|
|
"mean_token_accuracy": 0.15988976061344146,
|
||
|
|
"num_tokens": 3654260.0,
|
||
|
|
"step": 1510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.906288766860962,
|
||
|
|
"epoch": 0.09740886002700444,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00046818549821305846,
|
||
|
|
"loss": 5.8194,
|
||
|
|
"mean_token_accuracy": 0.16215839236974716,
|
||
|
|
"num_tokens": 3665672.0,
|
||
|
|
"step": 1515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.792873954772949,
|
||
|
|
"epoch": 0.09773034141323217,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00046757891022600494,
|
||
|
|
"loss": 5.7814,
|
||
|
|
"mean_token_accuracy": 0.165705868601799,
|
||
|
|
"num_tokens": 3678633.0,
|
||
|
|
"step": 1520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.779871034622192,
|
||
|
|
"epoch": 0.09805182279945991,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0004669670425908471,
|
||
|
|
"loss": 5.7366,
|
||
|
|
"mean_token_accuracy": 0.16899515688419342,
|
||
|
|
"num_tokens": 3691500.0,
|
||
|
|
"step": 1525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.766210222244263,
|
||
|
|
"epoch": 0.09837330418568765,
|
||
|
|
"grad_norm": 0.9140625,
|
||
|
|
"learning_rate": 0.0004663499120822451,
|
||
|
|
"loss": 5.6702,
|
||
|
|
"mean_token_accuracy": 0.1694064512848854,
|
||
|
|
"num_tokens": 3704601.0,
|
||
|
|
"step": 1530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.776804971694946,
|
||
|
|
"epoch": 0.09869478557191538,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004657275356191437,
|
||
|
|
"loss": 5.6912,
|
||
|
|
"mean_token_accuracy": 0.16398537307977676,
|
||
|
|
"num_tokens": 3715838.0,
|
||
|
|
"step": 1535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.722019386291504,
|
||
|
|
"epoch": 0.09901626695814313,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00046509993026430804,
|
||
|
|
"loss": 5.6361,
|
||
|
|
"mean_token_accuracy": 0.1705024093389511,
|
||
|
|
"num_tokens": 3727605.0,
|
||
|
|
"step": 1540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.843518829345703,
|
||
|
|
"epoch": 0.09933774834437085,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004644671132238558,
|
||
|
|
"loss": 5.7154,
|
||
|
|
"mean_token_accuracy": 0.16381162106990815,
|
||
|
|
"num_tokens": 3739991.0,
|
||
|
|
"step": 1545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.797346353530884,
|
||
|
|
"epoch": 0.0996592297305986,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00046382910184678585,
|
||
|
|
"loss": 5.7961,
|
||
|
|
"mean_token_accuracy": 0.1649666041135788,
|
||
|
|
"num_tokens": 3752175.0,
|
||
|
|
"step": 1550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.697546339035034,
|
||
|
|
"epoch": 0.09998071111682634,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004631859136245025,
|
||
|
|
"loss": 5.6774,
|
||
|
|
"mean_token_accuracy": 0.1714138999581337,
|
||
|
|
"num_tokens": 3763505.0,
|
||
|
|
"step": 1555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.799102115631103,
|
||
|
|
"epoch": 0.10030219250305407,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0004625375661903357,
|
||
|
|
"loss": 5.6971,
|
||
|
|
"mean_token_accuracy": 0.1689435437321663,
|
||
|
|
"num_tokens": 3775278.0,
|
||
|
|
"step": 1560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.695648574829102,
|
||
|
|
"epoch": 0.10062367388928181,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00046188407731905787,
|
||
|
|
"loss": 5.686,
|
||
|
|
"mean_token_accuracy": 0.16402057260274888,
|
||
|
|
"num_tokens": 3787100.0,
|
||
|
|
"step": 1565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.654272794723511,
|
||
|
|
"epoch": 0.10094515527550955,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00046122546492639643,
|
||
|
|
"loss": 5.6513,
|
||
|
|
"mean_token_accuracy": 0.17235873639583588,
|
||
|
|
"num_tokens": 3798020.0,
|
||
|
|
"step": 1570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.726153182983398,
|
||
|
|
"epoch": 0.10126663666173728,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.000460561747068543,
|
||
|
|
"loss": 5.6128,
|
||
|
|
"mean_token_accuracy": 0.1701953873038292,
|
||
|
|
"num_tokens": 3809114.0,
|
||
|
|
"step": 1575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.792324829101562,
|
||
|
|
"epoch": 0.10158811804796503,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004598929419416578,
|
||
|
|
"loss": 5.7049,
|
||
|
|
"mean_token_accuracy": 0.16184937059879304,
|
||
|
|
"num_tokens": 3821065.0,
|
||
|
|
"step": 1580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.742010974884034,
|
||
|
|
"epoch": 0.10190959943419275,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00045921906788137123,
|
||
|
|
"loss": 5.6868,
|
||
|
|
"mean_token_accuracy": 0.16641553789377211,
|
||
|
|
"num_tokens": 3832784.0,
|
||
|
|
"step": 1585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.703555250167847,
|
||
|
|
"epoch": 0.1022310808204205,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00045854014336228115,
|
||
|
|
"loss": 5.6154,
|
||
|
|
"mean_token_accuracy": 0.17373695820569993,
|
||
|
|
"num_tokens": 3843746.0,
|
||
|
|
"step": 1590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.696565437316894,
|
||
|
|
"epoch": 0.10255256220664824,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00045785618699744615,
|
||
|
|
"loss": 5.6489,
|
||
|
|
"mean_token_accuracy": 0.17145852744579315,
|
||
|
|
"num_tokens": 3855570.0,
|
||
|
|
"step": 1595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.718201398849487,
|
||
|
|
"epoch": 0.10287404359287597,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00045716721753787543,
|
||
|
|
"loss": 5.632,
|
||
|
|
"mean_token_accuracy": 0.17195014506578446,
|
||
|
|
"num_tokens": 3866744.0,
|
||
|
|
"step": 1600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.699806022644043,
|
||
|
|
"epoch": 0.10319552497910371,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.0004564732538720148,
|
||
|
|
"loss": 5.7101,
|
||
|
|
"mean_token_accuracy": 0.16463226675987244,
|
||
|
|
"num_tokens": 3879019.0,
|
||
|
|
"step": 1605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7670111656188965,
|
||
|
|
"epoch": 0.10351700636533144,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00045577431502522877,
|
||
|
|
"loss": 5.7529,
|
||
|
|
"mean_token_accuracy": 0.16531552225351334,
|
||
|
|
"num_tokens": 3892836.0,
|
||
|
|
"step": 1610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.775672435760498,
|
||
|
|
"epoch": 0.10383848775155918,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0004550704201592787,
|
||
|
|
"loss": 5.6607,
|
||
|
|
"mean_token_accuracy": 0.16667238771915435,
|
||
|
|
"num_tokens": 3905099.0,
|
||
|
|
"step": 1615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.700249719619751,
|
||
|
|
"epoch": 0.10415996913778693,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0004543615885717981,
|
||
|
|
"loss": 5.6589,
|
||
|
|
"mean_token_accuracy": 0.16846144646406175,
|
||
|
|
"num_tokens": 3917044.0,
|
||
|
|
"step": 1620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.689974164962768,
|
||
|
|
"epoch": 0.10448145052401465,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00045364783969576296,
|
||
|
|
"loss": 5.6145,
|
||
|
|
"mean_token_accuracy": 0.17616157829761506,
|
||
|
|
"num_tokens": 3928066.0,
|
||
|
|
"step": 1625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.698445129394531,
|
||
|
|
"epoch": 0.1048029319102424,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004529291930989592,
|
||
|
|
"loss": 5.8191,
|
||
|
|
"mean_token_accuracy": 0.16055160164833068,
|
||
|
|
"num_tokens": 3939969.0,
|
||
|
|
"step": 1630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.78976526260376,
|
||
|
|
"epoch": 0.10512441329647014,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004522056684834464,
|
||
|
|
"loss": 5.6955,
|
||
|
|
"mean_token_accuracy": 0.1663420632481575,
|
||
|
|
"num_tokens": 3951193.0,
|
||
|
|
"step": 1635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.661512565612793,
|
||
|
|
"epoch": 0.10544589468269787,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0004514772856850173,
|
||
|
|
"loss": 5.7083,
|
||
|
|
"mean_token_accuracy": 0.16959593147039415,
|
||
|
|
"num_tokens": 3963628.0,
|
||
|
|
"step": 1640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.838634443283081,
|
||
|
|
"epoch": 0.10576737606892561,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004507440646726542,
|
||
|
|
"loss": 5.7138,
|
||
|
|
"mean_token_accuracy": 0.16414729058742522,
|
||
|
|
"num_tokens": 3975692.0,
|
||
|
|
"step": 1645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.671707248687744,
|
||
|
|
"epoch": 0.10608885745515334,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0004500060255479818,
|
||
|
|
"loss": 5.6797,
|
||
|
|
"mean_token_accuracy": 0.16974256932735443,
|
||
|
|
"num_tokens": 3987551.0,
|
||
|
|
"step": 1650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.788669109344482,
|
||
|
|
"epoch": 0.10641033884138108,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004492631885447151,
|
||
|
|
"loss": 5.7158,
|
||
|
|
"mean_token_accuracy": 0.16899288594722747,
|
||
|
|
"num_tokens": 3998810.0,
|
||
|
|
"step": 1655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.8097230911254885,
|
||
|
|
"epoch": 0.10673182022760883,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00044851557402810616,
|
||
|
|
"loss": 5.694,
|
||
|
|
"mean_token_accuracy": 0.16655667126178741,
|
||
|
|
"num_tokens": 4009208.0,
|
||
|
|
"step": 1660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.588238048553467,
|
||
|
|
"epoch": 0.10705330161383655,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00044776320249438444,
|
||
|
|
"loss": 5.7239,
|
||
|
|
"mean_token_accuracy": 0.1632433593273163,
|
||
|
|
"num_tokens": 4020156.0,
|
||
|
|
"step": 1665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.844387435913086,
|
||
|
|
"epoch": 0.1073747830000643,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 0.00044700609457019565,
|
||
|
|
"loss": 5.6785,
|
||
|
|
"mean_token_accuracy": 0.17183288633823396,
|
||
|
|
"num_tokens": 4032530.0,
|
||
|
|
"step": 1670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.738357639312744,
|
||
|
|
"epoch": 0.10769626438629204,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004462442710120359,
|
||
|
|
"loss": 5.6851,
|
||
|
|
"mean_token_accuracy": 0.16740162968635558,
|
||
|
|
"num_tokens": 4045009.0,
|
||
|
|
"step": 1675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.657018756866455,
|
||
|
|
"epoch": 0.10801774577251977,
|
||
|
|
"grad_norm": 0.87109375,
|
||
|
|
"learning_rate": 0.000445477752705683,
|
||
|
|
"loss": 5.6672,
|
||
|
|
"mean_token_accuracy": 0.1798107862472534,
|
||
|
|
"num_tokens": 4058719.0,
|
||
|
|
"step": 1680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7615515232086185,
|
||
|
|
"epoch": 0.10833922715874751,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00044470656066562336,
|
||
|
|
"loss": 5.6048,
|
||
|
|
"mean_token_accuracy": 0.17893991321325303,
|
||
|
|
"num_tokens": 4070163.0,
|
||
|
|
"step": 1685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.705093288421631,
|
||
|
|
"epoch": 0.10866070854497524,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0004439307160344765,
|
||
|
|
"loss": 5.6656,
|
||
|
|
"mean_token_accuracy": 0.16881540715694426,
|
||
|
|
"num_tokens": 4083975.0,
|
||
|
|
"step": 1690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7015985488891605,
|
||
|
|
"epoch": 0.10898218993120298,
|
||
|
|
"grad_norm": 0.92578125,
|
||
|
|
"learning_rate": 0.00044315024008241473,
|
||
|
|
"loss": 5.678,
|
||
|
|
"mean_token_accuracy": 0.16305509954690933,
|
||
|
|
"num_tokens": 4096969.0,
|
||
|
|
"step": 1695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.60942063331604,
|
||
|
|
"epoch": 0.10930367131743073,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004423651542065806,
|
||
|
|
"loss": 5.6168,
|
||
|
|
"mean_token_accuracy": 0.16846575886011123,
|
||
|
|
"num_tokens": 4108540.0,
|
||
|
|
"step": 1700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.798748874664307,
|
||
|
|
"epoch": 0.10962515270365845,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00044157547993050006,
|
||
|
|
"loss": 5.7184,
|
||
|
|
"mean_token_accuracy": 0.16809891164302826,
|
||
|
|
"num_tokens": 4121037.0,
|
||
|
|
"step": 1705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.695119142532349,
|
||
|
|
"epoch": 0.1099466340898862,
|
||
|
|
"grad_norm": 0.89453125,
|
||
|
|
"learning_rate": 0.00044078123890349227,
|
||
|
|
"loss": 5.6519,
|
||
|
|
"mean_token_accuracy": 0.16664336770772933,
|
||
|
|
"num_tokens": 4133950.0,
|
||
|
|
"step": 1710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.635366773605346,
|
||
|
|
"epoch": 0.11026811547611394,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00043998245290007606,
|
||
|
|
"loss": 5.5568,
|
||
|
|
"mean_token_accuracy": 0.1682206466794014,
|
||
|
|
"num_tokens": 4147371.0,
|
||
|
|
"step": 1715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.786446285247803,
|
||
|
|
"epoch": 0.11058959686234167,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00043917914381937323,
|
||
|
|
"loss": 5.78,
|
||
|
|
"mean_token_accuracy": 0.16307178437709807,
|
||
|
|
"num_tokens": 4159431.0,
|
||
|
|
"step": 1720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6970727920532225,
|
||
|
|
"epoch": 0.11091107824856941,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00043837133368450815,
|
||
|
|
"loss": 5.598,
|
||
|
|
"mean_token_accuracy": 0.1744249701499939,
|
||
|
|
"num_tokens": 4170225.0,
|
||
|
|
"step": 1725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.678901529312133,
|
||
|
|
"epoch": 0.11123255963479714,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004375590446420037,
|
||
|
|
"loss": 5.6229,
|
||
|
|
"mean_token_accuracy": 0.16805195510387422,
|
||
|
|
"num_tokens": 4182230.0,
|
||
|
|
"step": 1730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.724699401855469,
|
||
|
|
"epoch": 0.11155404102102488,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.0004367422989611743,
|
||
|
|
"loss": 5.7117,
|
||
|
|
"mean_token_accuracy": 0.1657267063856125,
|
||
|
|
"num_tokens": 4193268.0,
|
||
|
|
"step": 1735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7468232154846195,
|
||
|
|
"epoch": 0.11187552240725263,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.0004359211190335153,
|
||
|
|
"loss": 5.7201,
|
||
|
|
"mean_token_accuracy": 0.16650488674640657,
|
||
|
|
"num_tokens": 4205916.0,
|
||
|
|
"step": 1740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.699482345581055,
|
||
|
|
"epoch": 0.11219700379348035,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.00043509552737208923,
|
||
|
|
"loss": 5.6605,
|
||
|
|
"mean_token_accuracy": 0.16603336930274964,
|
||
|
|
"num_tokens": 4217447.0,
|
||
|
|
"step": 1745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.773339128494262,
|
||
|
|
"epoch": 0.1125184851797081,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00043426554661090853,
|
||
|
|
"loss": 5.6494,
|
||
|
|
"mean_token_accuracy": 0.17133234888315202,
|
||
|
|
"num_tokens": 4230561.0,
|
||
|
|
"step": 1750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.767842245101929,
|
||
|
|
"epoch": 0.11283996656593583,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00043343119950431516,
|
||
|
|
"loss": 5.84,
|
||
|
|
"mean_token_accuracy": 0.16217250749468803,
|
||
|
|
"num_tokens": 4244640.0,
|
||
|
|
"step": 1755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.791492938995361,
|
||
|
|
"epoch": 0.11316144795216357,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00043259250892635644,
|
||
|
|
"loss": 5.6325,
|
||
|
|
"mean_token_accuracy": 0.17441739290952682,
|
||
|
|
"num_tokens": 4256940.0,
|
||
|
|
"step": 1760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.655259418487549,
|
||
|
|
"epoch": 0.11348292933839131,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.0004317494978701582,
|
||
|
|
"loss": 5.7106,
|
||
|
|
"mean_token_accuracy": 0.1615593209862709,
|
||
|
|
"num_tokens": 4269972.0,
|
||
|
|
"step": 1765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.76239275932312,
|
||
|
|
"epoch": 0.11380441072461904,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004309021894472943,
|
||
|
|
"loss": 5.6474,
|
||
|
|
"mean_token_accuracy": 0.17114351093769073,
|
||
|
|
"num_tokens": 4281938.0,
|
||
|
|
"step": 1770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.766588020324707,
|
||
|
|
"epoch": 0.11412589211084678,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.0004300506068871534,
|
||
|
|
"loss": 5.7242,
|
||
|
|
"mean_token_accuracy": 0.16376839578151703,
|
||
|
|
"num_tokens": 4294164.0,
|
||
|
|
"step": 1775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.600467586517334,
|
||
|
|
"epoch": 0.11444737349707453,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00042919477353630135,
|
||
|
|
"loss": 5.5556,
|
||
|
|
"mean_token_accuracy": 0.169616436958313,
|
||
|
|
"num_tokens": 4305542.0,
|
||
|
|
"step": 1780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.675921535491943,
|
||
|
|
"epoch": 0.11476885488330225,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000428334712857842,
|
||
|
|
"loss": 5.5345,
|
||
|
|
"mean_token_accuracy": 0.17775821387767793,
|
||
|
|
"num_tokens": 4315814.0,
|
||
|
|
"step": 1785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.759734058380127,
|
||
|
|
"epoch": 0.11509033626953,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00042747044843077304,
|
||
|
|
"loss": 5.7354,
|
||
|
|
"mean_token_accuracy": 0.16524382680654526,
|
||
|
|
"num_tokens": 4327308.0,
|
||
|
|
"step": 1790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.862537431716919,
|
||
|
|
"epoch": 0.11541181765575773,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00042660200394934047,
|
||
|
|
"loss": 5.8234,
|
||
|
|
"mean_token_accuracy": 0.1627979815006256,
|
||
|
|
"num_tokens": 4340719.0,
|
||
|
|
"step": 1795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.628550338745117,
|
||
|
|
"epoch": 0.11573329904198547,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00042572940322238844,
|
||
|
|
"loss": 5.602,
|
||
|
|
"mean_token_accuracy": 0.17606015652418136,
|
||
|
|
"num_tokens": 4352529.0,
|
||
|
|
"step": 1800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6467187881469725,
|
||
|
|
"epoch": 0.11605478042821321,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00042485267017270664,
|
||
|
|
"loss": 5.6098,
|
||
|
|
"mean_token_accuracy": 0.16990425139665605,
|
||
|
|
"num_tokens": 4363859.0,
|
||
|
|
"step": 1805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.68060941696167,
|
||
|
|
"epoch": 0.11637626181444094,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004239718288363745,
|
||
|
|
"loss": 5.5863,
|
||
|
|
"mean_token_accuracy": 0.17501892000436783,
|
||
|
|
"num_tokens": 4375297.0,
|
||
|
|
"step": 1810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.597053050994873,
|
||
|
|
"epoch": 0.11669774320066868,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0004230869033621023,
|
||
|
|
"loss": 5.5512,
|
||
|
|
"mean_token_accuracy": 0.17396211326122285,
|
||
|
|
"num_tokens": 4387204.0,
|
||
|
|
"step": 1815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.719973182678222,
|
||
|
|
"epoch": 0.11701922458689643,
|
||
|
|
"grad_norm": 0.94921875,
|
||
|
|
"learning_rate": 0.0004221979180105688,
|
||
|
|
"loss": 5.6973,
|
||
|
|
"mean_token_accuracy": 0.16626998484134675,
|
||
|
|
"num_tokens": 4400461.0,
|
||
|
|
"step": 1820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.692662906646729,
|
||
|
|
"epoch": 0.11734070597312415,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00042130489715375645,
|
||
|
|
"loss": 5.6098,
|
||
|
|
"mean_token_accuracy": 0.1783299759030342,
|
||
|
|
"num_tokens": 4413150.0,
|
||
|
|
"step": 1825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6415482521057125,
|
||
|
|
"epoch": 0.1176621873593519,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00042040786527428335,
|
||
|
|
"loss": 5.6376,
|
||
|
|
"mean_token_accuracy": 0.17496613711118697,
|
||
|
|
"num_tokens": 4424919.0,
|
||
|
|
"step": 1830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.693935489654541,
|
||
|
|
"epoch": 0.11798366874557963,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004195068469647315,
|
||
|
|
"loss": 5.5817,
|
||
|
|
"mean_token_accuracy": 0.16795676946640015,
|
||
|
|
"num_tokens": 4437305.0,
|
||
|
|
"step": 1835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.711897563934326,
|
||
|
|
"epoch": 0.11830515013180737,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00041860186692697297,
|
||
|
|
"loss": 5.6908,
|
||
|
|
"mean_token_accuracy": 0.1624923139810562,
|
||
|
|
"num_tokens": 4449121.0,
|
||
|
|
"step": 1840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.70607361793518,
|
||
|
|
"epoch": 0.11862663151803511,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00041769294997149264,
|
||
|
|
"loss": 5.5692,
|
||
|
|
"mean_token_accuracy": 0.17660931199789048,
|
||
|
|
"num_tokens": 4460526.0,
|
||
|
|
"step": 1845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.721433687210083,
|
||
|
|
"epoch": 0.11894811290426284,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004167801210167081,
|
||
|
|
"loss": 5.7179,
|
||
|
|
"mean_token_accuracy": 0.16671427339315414,
|
||
|
|
"num_tokens": 4472852.0,
|
||
|
|
"step": 1850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.729478454589843,
|
||
|
|
"epoch": 0.11926959429049058,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004158634050882861,
|
||
|
|
"loss": 5.5932,
|
||
|
|
"mean_token_accuracy": 0.1713337242603302,
|
||
|
|
"num_tokens": 4485226.0,
|
||
|
|
"step": 1855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.595520973205566,
|
||
|
|
"epoch": 0.11959107567671831,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.0004149428273184569,
|
||
|
|
"loss": 5.639,
|
||
|
|
"mean_token_accuracy": 0.17289858758449556,
|
||
|
|
"num_tokens": 4497441.0,
|
||
|
|
"step": 1860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.674116516113282,
|
||
|
|
"epoch": 0.11991255706294605,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0004140184129453253,
|
||
|
|
"loss": 5.5965,
|
||
|
|
"mean_token_accuracy": 0.17782175689935684,
|
||
|
|
"num_tokens": 4509699.0,
|
||
|
|
"step": 1865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.756423282623291,
|
||
|
|
"epoch": 0.1202340384491738,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.000413090187312178,
|
||
|
|
"loss": 5.6149,
|
||
|
|
"mean_token_accuracy": 0.1704213485121727,
|
||
|
|
"num_tokens": 4521556.0,
|
||
|
|
"step": 1870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6083571434021,
|
||
|
|
"epoch": 0.12055551983540153,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0004121581758667898,
|
||
|
|
"loss": 5.4917,
|
||
|
|
"mean_token_accuracy": 0.18068952411413192,
|
||
|
|
"num_tokens": 4532734.0,
|
||
|
|
"step": 1875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.642936754226684,
|
||
|
|
"epoch": 0.12087700122162927,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00041122240416072533,
|
||
|
|
"loss": 5.6104,
|
||
|
|
"mean_token_accuracy": 0.1740383982658386,
|
||
|
|
"num_tokens": 4544614.0,
|
||
|
|
"step": 1880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.65142855644226,
|
||
|
|
"epoch": 0.12119848260785701,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004102828978486385,
|
||
|
|
"loss": 5.4759,
|
||
|
|
"mean_token_accuracy": 0.1830442562699318,
|
||
|
|
"num_tokens": 4555152.0,
|
||
|
|
"step": 1885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.629227638244629,
|
||
|
|
"epoch": 0.12151996399408474,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0004093396826875695,
|
||
|
|
"loss": 5.6047,
|
||
|
|
"mean_token_accuracy": 0.1778774917125702,
|
||
|
|
"num_tokens": 4568535.0,
|
||
|
|
"step": 1890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.726151180267334,
|
||
|
|
"epoch": 0.12184144538031248,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00040839278453623837,
|
||
|
|
"loss": 5.6625,
|
||
|
|
"mean_token_accuracy": 0.17062658369541167,
|
||
|
|
"num_tokens": 4580741.0,
|
||
|
|
"step": 1895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6973350048065186,
|
||
|
|
"epoch": 0.12216292676654021,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0004074422293543363,
|
||
|
|
"loss": 5.6466,
|
||
|
|
"mean_token_accuracy": 0.1717591777443886,
|
||
|
|
"num_tokens": 4592765.0,
|
||
|
|
"step": 1900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.70516357421875,
|
||
|
|
"epoch": 0.12248440815276795,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.0004064880432018137,
|
||
|
|
"loss": 5.6784,
|
||
|
|
"mean_token_accuracy": 0.16222974210977553,
|
||
|
|
"num_tokens": 4606140.0,
|
||
|
|
"step": 1905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.653184175491333,
|
||
|
|
"epoch": 0.1228058895389957,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00040553025223816615,
|
||
|
|
"loss": 5.5121,
|
||
|
|
"mean_token_accuracy": 0.1771766349673271,
|
||
|
|
"num_tokens": 4618330.0,
|
||
|
|
"step": 1910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.624524068832398,
|
||
|
|
"epoch": 0.12312737092522343,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00040456888272171653,
|
||
|
|
"loss": 5.621,
|
||
|
|
"mean_token_accuracy": 0.1697457328438759,
|
||
|
|
"num_tokens": 4632054.0,
|
||
|
|
"step": 1915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.711583852767944,
|
||
|
|
"epoch": 0.12344885231145117,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00040360396100889577,
|
||
|
|
"loss": 5.5279,
|
||
|
|
"mean_token_accuracy": 0.17866547554731368,
|
||
|
|
"num_tokens": 4643455.0,
|
||
|
|
"step": 1920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5774181365966795,
|
||
|
|
"epoch": 0.12377033369767891,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0004026355135535202,
|
||
|
|
"loss": 5.5315,
|
||
|
|
"mean_token_accuracy": 0.18000049889087677,
|
||
|
|
"num_tokens": 4654847.0,
|
||
|
|
"step": 1925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.532724809646607,
|
||
|
|
"epoch": 0.12409181508390664,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.000401663566906066,
|
||
|
|
"loss": 5.508,
|
||
|
|
"mean_token_accuracy": 0.1751505821943283,
|
||
|
|
"num_tokens": 4666470.0,
|
||
|
|
"step": 1930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.646271467208862,
|
||
|
|
"epoch": 0.12441329647013438,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00040068814771294134,
|
||
|
|
"loss": 5.6044,
|
||
|
|
"mean_token_accuracy": 0.16390730440616608,
|
||
|
|
"num_tokens": 4678170.0,
|
||
|
|
"step": 1935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.634231901168823,
|
||
|
|
"epoch": 0.12473477785636211,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0003997092827157562,
|
||
|
|
"loss": 5.5693,
|
||
|
|
"mean_token_accuracy": 0.1736877128481865,
|
||
|
|
"num_tokens": 4689566.0,
|
||
|
|
"step": 1940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.684836483001709,
|
||
|
|
"epoch": 0.12505625924258987,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000398726998750589,
|
||
|
|
"loss": 5.6182,
|
||
|
|
"mean_token_accuracy": 0.1731961190700531,
|
||
|
|
"num_tokens": 4701435.0,
|
||
|
|
"step": 1945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.638038396835327,
|
||
|
|
"epoch": 0.1253777406288176,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00039774132274725076,
|
||
|
|
"loss": 5.6099,
|
||
|
|
"mean_token_accuracy": 0.16854255944490432,
|
||
|
|
"num_tokens": 4712967.0,
|
||
|
|
"step": 1950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.59591383934021,
|
||
|
|
"epoch": 0.12569922201504533,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00039675228172854707,
|
||
|
|
"loss": 5.518,
|
||
|
|
"mean_token_accuracy": 0.17237532138824463,
|
||
|
|
"num_tokens": 4726069.0,
|
||
|
|
"step": 1955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.686928701400757,
|
||
|
|
"epoch": 0.12602070340127305,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0003957599028095371,
|
||
|
|
"loss": 5.6561,
|
||
|
|
"mean_token_accuracy": 0.17211754471063614,
|
||
|
|
"num_tokens": 4738152.0,
|
||
|
|
"step": 1960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.626712799072266,
|
||
|
|
"epoch": 0.1263421847875008,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00039476421319679017,
|
||
|
|
"loss": 5.5386,
|
||
|
|
"mean_token_accuracy": 0.18029731065034865,
|
||
|
|
"num_tokens": 4749534.0,
|
||
|
|
"step": 1965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.604871416091919,
|
||
|
|
"epoch": 0.12666366617372854,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.00039376524018764,
|
||
|
|
"loss": 5.6482,
|
||
|
|
"mean_token_accuracy": 0.16829675287008286,
|
||
|
|
"num_tokens": 4762366.0,
|
||
|
|
"step": 1970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.595232152938843,
|
||
|
|
"epoch": 0.12698514755995627,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00039276301116943616,
|
||
|
|
"loss": 5.4416,
|
||
|
|
"mean_token_accuracy": 0.1899142324924469,
|
||
|
|
"num_tokens": 4773179.0,
|
||
|
|
"step": 1975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.627636337280274,
|
||
|
|
"epoch": 0.12730662894618403,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.0003917575536187936,
|
||
|
|
"loss": 5.5794,
|
||
|
|
"mean_token_accuracy": 0.18243405669927598,
|
||
|
|
"num_tokens": 4785558.0,
|
||
|
|
"step": 1980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.589993095397949,
|
||
|
|
"epoch": 0.12762811033241175,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00039074889510083894,
|
||
|
|
"loss": 5.4491,
|
||
|
|
"mean_token_accuracy": 0.18214071840047835,
|
||
|
|
"num_tokens": 4797091.0,
|
||
|
|
"step": 1985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.576621246337891,
|
||
|
|
"epoch": 0.12794959171863948,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.00038973706326845495,
|
||
|
|
"loss": 5.5112,
|
||
|
|
"mean_token_accuracy": 0.1779040664434433,
|
||
|
|
"num_tokens": 4808797.0,
|
||
|
|
"step": 1990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7170006275177006,
|
||
|
|
"epoch": 0.12827107310486724,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003887220858615225,
|
||
|
|
"loss": 5.5959,
|
||
|
|
"mean_token_accuracy": 0.1773738831281662,
|
||
|
|
"num_tokens": 4820478.0,
|
||
|
|
"step": 1995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.554650163650512,
|
||
|
|
"epoch": 0.12859255449109497,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0003877039907061597,
|
||
|
|
"loss": 5.5991,
|
||
|
|
"mean_token_accuracy": 0.1684095099568367,
|
||
|
|
"num_tokens": 4831844.0,
|
||
|
|
"step": 2000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.690355825424194,
|
||
|
|
"epoch": 0.1289140358773227,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0003866828057139598,
|
||
|
|
"loss": 5.5785,
|
||
|
|
"mean_token_accuracy": 0.17744503319263458,
|
||
|
|
"num_tokens": 4842288.0,
|
||
|
|
"step": 2005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.702692604064941,
|
||
|
|
"epoch": 0.12923551726355045,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00038565855888122503,
|
||
|
|
"loss": 5.7428,
|
||
|
|
"mean_token_accuracy": 0.1676201790571213,
|
||
|
|
"num_tokens": 4853948.0,
|
||
|
|
"step": 2010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.668079900741577,
|
||
|
|
"epoch": 0.12955699864977818,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00038463127828819975,
|
||
|
|
"loss": 5.5989,
|
||
|
|
"mean_token_accuracy": 0.16663582175970076,
|
||
|
|
"num_tokens": 4866362.0,
|
||
|
|
"step": 2015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.663040018081665,
|
||
|
|
"epoch": 0.1298784800360059,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00038360099209830043,
|
||
|
|
"loss": 5.5774,
|
||
|
|
"mean_token_accuracy": 0.16927094459533693,
|
||
|
|
"num_tokens": 4879210.0,
|
||
|
|
"step": 2020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.617607641220093,
|
||
|
|
"epoch": 0.13019996142223364,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0003825677285573433,
|
||
|
|
"loss": 5.5478,
|
||
|
|
"mean_token_accuracy": 0.17572104185819626,
|
||
|
|
"num_tokens": 4889902.0,
|
||
|
|
"step": 2025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.519731283187866,
|
||
|
|
"epoch": 0.1305214428084614,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00038153151599277027,
|
||
|
|
"loss": 5.4063,
|
||
|
|
"mean_token_accuracy": 0.18402182161808014,
|
||
|
|
"num_tokens": 4901397.0,
|
||
|
|
"step": 2030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.552304697036743,
|
||
|
|
"epoch": 0.13084292419468913,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0003804923828128723,
|
||
|
|
"loss": 5.4816,
|
||
|
|
"mean_token_accuracy": 0.17936088591814042,
|
||
|
|
"num_tokens": 4913696.0,
|
||
|
|
"step": 2035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.700035238265992,
|
||
|
|
"epoch": 0.13116440558091685,
|
||
|
|
"grad_norm": 0.92578125,
|
||
|
|
"learning_rate": 0.0003794503575060104,
|
||
|
|
"loss": 5.638,
|
||
|
|
"mean_token_accuracy": 0.16989797055721284,
|
||
|
|
"num_tokens": 4926791.0,
|
||
|
|
"step": 2040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.455661153793335,
|
||
|
|
"epoch": 0.1314858869671446,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00037840546863983484,
|
||
|
|
"loss": 5.4657,
|
||
|
|
"mean_token_accuracy": 0.1802852064371109,
|
||
|
|
"num_tokens": 4939351.0,
|
||
|
|
"step": 2045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.645840454101562,
|
||
|
|
"epoch": 0.13180736835337234,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0003773577448605015,
|
||
|
|
"loss": 5.5699,
|
||
|
|
"mean_token_accuracy": 0.17547970861196518,
|
||
|
|
"num_tokens": 4950917.0,
|
||
|
|
"step": 2050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.642328834533691,
|
||
|
|
"epoch": 0.13212884973960007,
|
||
|
|
"grad_norm": 0.94921875,
|
||
|
|
"learning_rate": 0.0003763072148918872,
|
||
|
|
"loss": 5.4162,
|
||
|
|
"mean_token_accuracy": 0.18664058297872543,
|
||
|
|
"num_tokens": 4961893.0,
|
||
|
|
"step": 2055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.570167398452758,
|
||
|
|
"epoch": 0.13245033112582782,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0003752539075348017,
|
||
|
|
"loss": 5.6608,
|
||
|
|
"mean_token_accuracy": 0.171598619222641,
|
||
|
|
"num_tokens": 4973444.0,
|
||
|
|
"step": 2060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.577313566207886,
|
||
|
|
"epoch": 0.13277181251205555,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00037419785166619817,
|
||
|
|
"loss": 5.4272,
|
||
|
|
"mean_token_accuracy": 0.1807885378599167,
|
||
|
|
"num_tokens": 4985747.0,
|
||
|
|
"step": 2065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.631009864807129,
|
||
|
|
"epoch": 0.13309329389828328,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0003731390762383818,
|
||
|
|
"loss": 5.4987,
|
||
|
|
"mean_token_accuracy": 0.18178496807813643,
|
||
|
|
"num_tokens": 4996913.0,
|
||
|
|
"step": 2070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.641736745834351,
|
||
|
|
"epoch": 0.13341477528451104,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.0003720776102782158,
|
||
|
|
"loss": 5.6216,
|
||
|
|
"mean_token_accuracy": 0.17642544209957123,
|
||
|
|
"num_tokens": 5009047.0,
|
||
|
|
"step": 2075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.652716493606567,
|
||
|
|
"epoch": 0.13373625667073877,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00037101348288632555,
|
||
|
|
"loss": 5.5947,
|
||
|
|
"mean_token_accuracy": 0.1771834149956703,
|
||
|
|
"num_tokens": 5022510.0,
|
||
|
|
"step": 2080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.638058423995972,
|
||
|
|
"epoch": 0.1340577380569665,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0003699467232363012,
|
||
|
|
"loss": 5.5107,
|
||
|
|
"mean_token_accuracy": 0.17550236880779266,
|
||
|
|
"num_tokens": 5032764.0,
|
||
|
|
"step": 2085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.588368701934814,
|
||
|
|
"epoch": 0.13437921944319423,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0003688773605738973,
|
||
|
|
"loss": 5.5406,
|
||
|
|
"mean_token_accuracy": 0.17518276125192642,
|
||
|
|
"num_tokens": 5045527.0,
|
||
|
|
"step": 2090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.667303133010864,
|
||
|
|
"epoch": 0.13470070082942198,
|
||
|
|
"grad_norm": 0.94921875,
|
||
|
|
"learning_rate": 0.00036780542421623134,
|
||
|
|
"loss": 5.5873,
|
||
|
|
"mean_token_accuracy": 0.1716512233018875,
|
||
|
|
"num_tokens": 5058521.0,
|
||
|
|
"step": 2095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.52188549041748,
|
||
|
|
"epoch": 0.1350221822156497,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0003667309435509802,
|
||
|
|
"loss": 5.4568,
|
||
|
|
"mean_token_accuracy": 0.18124112337827683,
|
||
|
|
"num_tokens": 5071261.0,
|
||
|
|
"step": 2100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.628132438659668,
|
||
|
|
"epoch": 0.13534366360187744,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0003656539480355741,
|
||
|
|
"loss": 5.5208,
|
||
|
|
"mean_token_accuracy": 0.18021970838308335,
|
||
|
|
"num_tokens": 5084214.0,
|
||
|
|
"step": 2105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.537697649002075,
|
||
|
|
"epoch": 0.1356651449881052,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0003645744671963891,
|
||
|
|
"loss": 5.4123,
|
||
|
|
"mean_token_accuracy": 0.18940539509058,
|
||
|
|
"num_tokens": 5095124.0,
|
||
|
|
"step": 2110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.545998811721802,
|
||
|
|
"epoch": 0.13598662637433293,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0003634925306279376,
|
||
|
|
"loss": 5.4727,
|
||
|
|
"mean_token_accuracy": 0.18396630734205247,
|
||
|
|
"num_tokens": 5107563.0,
|
||
|
|
"step": 2115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.728504419326782,
|
||
|
|
"epoch": 0.13630810776056065,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0003624081679920574,
|
||
|
|
"loss": 5.6334,
|
||
|
|
"mean_token_accuracy": 0.1710283264517784,
|
||
|
|
"num_tokens": 5120170.0,
|
||
|
|
"step": 2120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.681310033798217,
|
||
|
|
"epoch": 0.1366295891467884,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0003613214090170977,
|
||
|
|
"loss": 5.5637,
|
||
|
|
"mean_token_accuracy": 0.17580068856477737,
|
||
|
|
"num_tokens": 5133273.0,
|
||
|
|
"step": 2125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.524133491516113,
|
||
|
|
"epoch": 0.13695107053301614,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0003602322834971048,
|
||
|
|
"loss": 5.506,
|
||
|
|
"mean_token_accuracy": 0.17734147608280182,
|
||
|
|
"num_tokens": 5143975.0,
|
||
|
|
"step": 2130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.606957483291626,
|
||
|
|
"epoch": 0.13727255191924387,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0003591408212910051,
|
||
|
|
"loss": 5.5535,
|
||
|
|
"mean_token_accuracy": 0.17553338259458542,
|
||
|
|
"num_tokens": 5156924.0,
|
||
|
|
"step": 2135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.71117639541626,
|
||
|
|
"epoch": 0.13759403330547162,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0003580470523217863,
|
||
|
|
"loss": 5.5744,
|
||
|
|
"mean_token_accuracy": 0.17741536647081374,
|
||
|
|
"num_tokens": 5168639.0,
|
||
|
|
"step": 2140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.619367408752441,
|
||
|
|
"epoch": 0.13791551469169935,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0003569510065756771,
|
||
|
|
"loss": 5.5621,
|
||
|
|
"mean_token_accuracy": 0.17203796654939651,
|
||
|
|
"num_tokens": 5180657.0,
|
||
|
|
"step": 2145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.550686407089233,
|
||
|
|
"epoch": 0.13823699607792708,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0003558527141013254,
|
||
|
|
"loss": 5.4056,
|
||
|
|
"mean_token_accuracy": 0.18654266893863677,
|
||
|
|
"num_tokens": 5193228.0,
|
||
|
|
"step": 2150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5506675243377686,
|
||
|
|
"epoch": 0.13855847746415484,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0003547522050089742,
|
||
|
|
"loss": 5.4315,
|
||
|
|
"mean_token_accuracy": 0.18155017495155334,
|
||
|
|
"num_tokens": 5204033.0,
|
||
|
|
"step": 2155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.572748804092408,
|
||
|
|
"epoch": 0.13887995885038257,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00035364950946963606,
|
||
|
|
"loss": 5.4823,
|
||
|
|
"mean_token_accuracy": 0.17860636562108995,
|
||
|
|
"num_tokens": 5215648.0,
|
||
|
|
"step": 2160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.521397733688355,
|
||
|
|
"epoch": 0.1392014402366103,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.0003525446577142663,
|
||
|
|
"loss": 5.4152,
|
||
|
|
"mean_token_accuracy": 0.18968603909015655,
|
||
|
|
"num_tokens": 5227222.0,
|
||
|
|
"step": 2165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.563259840011597,
|
||
|
|
"epoch": 0.13952292162283803,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00035143768003293395,
|
||
|
|
"loss": 5.5263,
|
||
|
|
"mean_token_accuracy": 0.17536101639270782,
|
||
|
|
"num_tokens": 5239471.0,
|
||
|
|
"step": 2170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.604966545104981,
|
||
|
|
"epoch": 0.13984440300906578,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0003503286067739913,
|
||
|
|
"loss": 5.5813,
|
||
|
|
"mean_token_accuracy": 0.18099805116653442,
|
||
|
|
"num_tokens": 5251824.0,
|
||
|
|
"step": 2175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.771280336380005,
|
||
|
|
"epoch": 0.1401658843952935,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00034921746834324193,
|
||
|
|
"loss": 5.6083,
|
||
|
|
"mean_token_accuracy": 0.16844966858625413,
|
||
|
|
"num_tokens": 5263868.0,
|
||
|
|
"step": 2180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.633769750595093,
|
||
|
|
"epoch": 0.14048736578152124,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0003481042952031072,
|
||
|
|
"loss": 5.4921,
|
||
|
|
"mean_token_accuracy": 0.1846514493227005,
|
||
|
|
"num_tokens": 5275850.0,
|
||
|
|
"step": 2185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5404026985168455,
|
||
|
|
"epoch": 0.140808847167749,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0003469891178717911,
|
||
|
|
"loss": 5.5228,
|
||
|
|
"mean_token_accuracy": 0.18659351617097855,
|
||
|
|
"num_tokens": 5287802.0,
|
||
|
|
"step": 2190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.742951917648315,
|
||
|
|
"epoch": 0.14113032855397672,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0003458719669224436,
|
||
|
|
"loss": 5.5869,
|
||
|
|
"mean_token_accuracy": 0.17587295025587082,
|
||
|
|
"num_tokens": 5299175.0,
|
||
|
|
"step": 2195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5779965877532955,
|
||
|
|
"epoch": 0.14145180994020445,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0003447528729823221,
|
||
|
|
"loss": 5.5084,
|
||
|
|
"mean_token_accuracy": 0.17872756868600845,
|
||
|
|
"num_tokens": 5312817.0,
|
||
|
|
"step": 2200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.582625102996826,
|
||
|
|
"epoch": 0.1417732913264322,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.0003436318667319525,
|
||
|
|
"loss": 5.5161,
|
||
|
|
"mean_token_accuracy": 0.17962834537029265,
|
||
|
|
"num_tokens": 5324342.0,
|
||
|
|
"step": 2205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.581976509094238,
|
||
|
|
"epoch": 0.14209477271265994,
|
||
|
|
"grad_norm": 0.90625,
|
||
|
|
"learning_rate": 0.00034250897890428716,
|
||
|
|
"loss": 5.5681,
|
||
|
|
"mean_token_accuracy": 0.17845509797334672,
|
||
|
|
"num_tokens": 5338285.0,
|
||
|
|
"step": 2210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.609170913696289,
|
||
|
|
"epoch": 0.14241625409888767,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0003413842402838633,
|
||
|
|
"loss": 5.4461,
|
||
|
|
"mean_token_accuracy": 0.183383609354496,
|
||
|
|
"num_tokens": 5349366.0,
|
||
|
|
"step": 2215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.630384731292724,
|
||
|
|
"epoch": 0.14273773548511542,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00034025768170595834,
|
||
|
|
"loss": 5.5151,
|
||
|
|
"mean_token_accuracy": 0.17469578981399536,
|
||
|
|
"num_tokens": 5361625.0,
|
||
|
|
"step": 2220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5576146125793455,
|
||
|
|
"epoch": 0.14305921687134315,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.0003391293340557446,
|
||
|
|
"loss": 5.4706,
|
||
|
|
"mean_token_accuracy": 0.19247612953186036,
|
||
|
|
"num_tokens": 5373546.0,
|
||
|
|
"step": 2225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6234513282775875,
|
||
|
|
"epoch": 0.14338069825757088,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0003379992282674431,
|
||
|
|
"loss": 5.4782,
|
||
|
|
"mean_token_accuracy": 0.1830992132425308,
|
||
|
|
"num_tokens": 5384949.0,
|
||
|
|
"step": 2230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5891295909881595,
|
||
|
|
"epoch": 0.1437021796437986,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0003368673953234749,
|
||
|
|
"loss": 5.5034,
|
||
|
|
"mean_token_accuracy": 0.17738640308380127,
|
||
|
|
"num_tokens": 5398436.0,
|
||
|
|
"step": 2235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.551361131668091,
|
||
|
|
"epoch": 0.14402366103002637,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00033573386625361176,
|
||
|
|
"loss": 5.4995,
|
||
|
|
"mean_token_accuracy": 0.1813459426164627,
|
||
|
|
"num_tokens": 5410382.0,
|
||
|
|
"step": 2240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5967944145202635,
|
||
|
|
"epoch": 0.1443451424162541,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.00033459867213412567,
|
||
|
|
"loss": 5.4712,
|
||
|
|
"mean_token_accuracy": 0.18766194730997085,
|
||
|
|
"num_tokens": 5422964.0,
|
||
|
|
"step": 2245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.602425909042358,
|
||
|
|
"epoch": 0.14466662380248183,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.000333461844086937,
|
||
|
|
"loss": 5.504,
|
||
|
|
"mean_token_accuracy": 0.17647187113761903,
|
||
|
|
"num_tokens": 5434071.0,
|
||
|
|
"step": 2250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6212677478790285,
|
||
|
|
"epoch": 0.14498810518870958,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.00033232341327876097,
|
||
|
|
"loss": 5.4556,
|
||
|
|
"mean_token_accuracy": 0.18970796316862107,
|
||
|
|
"num_tokens": 5444868.0,
|
||
|
|
"step": 2255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5139528751373295,
|
||
|
|
"epoch": 0.1453095865749373,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0003311834109202531,
|
||
|
|
"loss": 5.4557,
|
||
|
|
"mean_token_accuracy": 0.17798506021499633,
|
||
|
|
"num_tokens": 5457110.0,
|
||
|
|
"step": 2260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.502182674407959,
|
||
|
|
"epoch": 0.14563106796116504,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00033004186826515416,
|
||
|
|
"loss": 5.3689,
|
||
|
|
"mean_token_accuracy": 0.1904307261109352,
|
||
|
|
"num_tokens": 5467699.0,
|
||
|
|
"step": 2265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.663538789749145,
|
||
|
|
"epoch": 0.1459525493473928,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0003288988166094324,
|
||
|
|
"loss": 5.5579,
|
||
|
|
"mean_token_accuracy": 0.18344883918762206,
|
||
|
|
"num_tokens": 5479224.0,
|
||
|
|
"step": 2270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5878653049469,
|
||
|
|
"epoch": 0.14627403073362052,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00032775428729042656,
|
||
|
|
"loss": 5.4196,
|
||
|
|
"mean_token_accuracy": 0.1777511090040207,
|
||
|
|
"num_tokens": 5491108.0,
|
||
|
|
"step": 2275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.541255235671997,
|
||
|
|
"epoch": 0.14659551211984825,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.000326608311685986,
|
||
|
|
"loss": 5.4572,
|
||
|
|
"mean_token_accuracy": 0.17894090116024017,
|
||
|
|
"num_tokens": 5503794.0,
|
||
|
|
"step": 2280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.569844198226929,
|
||
|
|
"epoch": 0.146916993506076,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0003254609212136108,
|
||
|
|
"loss": 5.506,
|
||
|
|
"mean_token_accuracy": 0.17573664486408233,
|
||
|
|
"num_tokens": 5515307.0,
|
||
|
|
"step": 2285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.535937356948852,
|
||
|
|
"epoch": 0.14723847489230374,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00032431214732959036,
|
||
|
|
"loss": 5.4382,
|
||
|
|
"mean_token_accuracy": 0.18453752547502517,
|
||
|
|
"num_tokens": 5527279.0,
|
||
|
|
"step": 2290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.668543195724487,
|
||
|
|
"epoch": 0.14755995627853147,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000323162021528141,
|
||
|
|
"loss": 5.4596,
|
||
|
|
"mean_token_accuracy": 0.18529481440782547,
|
||
|
|
"num_tokens": 5537732.0,
|
||
|
|
"step": 2295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.537689065933227,
|
||
|
|
"epoch": 0.1478814376647592,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00032201057534054264,
|
||
|
|
"loss": 5.5162,
|
||
|
|
"mean_token_accuracy": 0.1804665893316269,
|
||
|
|
"num_tokens": 5549770.0,
|
||
|
|
"step": 2300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5451979637146,
|
||
|
|
"epoch": 0.14820291905098695,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00032085784033427414,
|
||
|
|
"loss": 5.4591,
|
||
|
|
"mean_token_accuracy": 0.18171441704034805,
|
||
|
|
"num_tokens": 5561295.0,
|
||
|
|
"step": 2305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5494309425354,
|
||
|
|
"epoch": 0.14852440043721468,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0003197038481121478,
|
||
|
|
"loss": 5.4087,
|
||
|
|
"mean_token_accuracy": 0.18777988404035567,
|
||
|
|
"num_tokens": 5573560.0,
|
||
|
|
"step": 2310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.52156925201416,
|
||
|
|
"epoch": 0.1488458818234424,
|
||
|
|
"grad_norm": 0.9375,
|
||
|
|
"learning_rate": 0.0003185486303114436,
|
||
|
|
"loss": 5.4876,
|
||
|
|
"mean_token_accuracy": 0.179176065325737,
|
||
|
|
"num_tokens": 5585599.0,
|
||
|
|
"step": 2315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.620445775985718,
|
||
|
|
"epoch": 0.14916736320967017,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0003173922186030409,
|
||
|
|
"loss": 5.4921,
|
||
|
|
"mean_token_accuracy": 0.1792708784341812,
|
||
|
|
"num_tokens": 5597229.0,
|
||
|
|
"step": 2320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.543314599990845,
|
||
|
|
"epoch": 0.1494888445958979,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 0.000316234644690551,
|
||
|
|
"loss": 5.51,
|
||
|
|
"mean_token_accuracy": 0.17907462865114213,
|
||
|
|
"num_tokens": 5609233.0,
|
||
|
|
"step": 2325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.547998523712158,
|
||
|
|
"epoch": 0.14981032598212563,
|
||
|
|
"grad_norm": 0.92578125,
|
||
|
|
"learning_rate": 0.0003150759403094473,
|
||
|
|
"loss": 5.4182,
|
||
|
|
"mean_token_accuracy": 0.1837028071284294,
|
||
|
|
"num_tokens": 5621557.0,
|
||
|
|
"step": 2330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5903764247894285,
|
||
|
|
"epoch": 0.15013180736835338,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00031391613722619587,
|
||
|
|
"loss": 5.4978,
|
||
|
|
"mean_token_accuracy": 0.18165379613637925,
|
||
|
|
"num_tokens": 5632661.0,
|
||
|
|
"step": 2335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.51077823638916,
|
||
|
|
"epoch": 0.1504532887545811,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.000312755267237384,
|
||
|
|
"loss": 5.4097,
|
||
|
|
"mean_token_accuracy": 0.18800128847360612,
|
||
|
|
"num_tokens": 5643904.0,
|
||
|
|
"step": 2340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4778283596038815,
|
||
|
|
"epoch": 0.15077477014080884,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0003115933621688488,
|
||
|
|
"loss": 5.3577,
|
||
|
|
"mean_token_accuracy": 0.18820761144161224,
|
||
|
|
"num_tokens": 5655099.0,
|
||
|
|
"step": 2345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5034808158874515,
|
||
|
|
"epoch": 0.1510962515270366,
|
||
|
|
"grad_norm": 0.90625,
|
||
|
|
"learning_rate": 0.00031043045387480487,
|
||
|
|
"loss": 5.4609,
|
||
|
|
"mean_token_accuracy": 0.18469659090042115,
|
||
|
|
"num_tokens": 5669107.0,
|
||
|
|
"step": 2350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.676184177398682,
|
||
|
|
"epoch": 0.15141773291326432,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0003092665742369703,
|
||
|
|
"loss": 5.5071,
|
||
|
|
"mean_token_accuracy": 0.18271622508764268,
|
||
|
|
"num_tokens": 5679889.0,
|
||
|
|
"step": 2355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.519137382507324,
|
||
|
|
"epoch": 0.15173921429949205,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00030810175516369343,
|
||
|
|
"loss": 5.4453,
|
||
|
|
"mean_token_accuracy": 0.18248492926359178,
|
||
|
|
"num_tokens": 5692779.0,
|
||
|
|
"step": 2360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.672745704650879,
|
||
|
|
"epoch": 0.1520606956857198,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0003069360285890775,
|
||
|
|
"loss": 5.5394,
|
||
|
|
"mean_token_accuracy": 0.1824436902999878,
|
||
|
|
"num_tokens": 5704012.0,
|
||
|
|
"step": 2365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.600694465637207,
|
||
|
|
"epoch": 0.15238217707194754,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00030576942647210547,
|
||
|
|
"loss": 5.5779,
|
||
|
|
"mean_token_accuracy": 0.17723387926816941,
|
||
|
|
"num_tokens": 5716863.0,
|
||
|
|
"step": 2370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.55698299407959,
|
||
|
|
"epoch": 0.15270365845817527,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.00030460198079576355,
|
||
|
|
"loss": 5.432,
|
||
|
|
"mean_token_accuracy": 0.18596912622451783,
|
||
|
|
"num_tokens": 5729237.0,
|
||
|
|
"step": 2375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.590260410308838,
|
||
|
|
"epoch": 0.153025139844403,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0003034337235661648,
|
||
|
|
"loss": 5.4391,
|
||
|
|
"mean_token_accuracy": 0.18576156347990036,
|
||
|
|
"num_tokens": 5741117.0,
|
||
|
|
"step": 2380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.568508291244507,
|
||
|
|
"epoch": 0.15334662123063075,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0003022646868116714,
|
||
|
|
"loss": 5.5124,
|
||
|
|
"mean_token_accuracy": 0.1829720675945282,
|
||
|
|
"num_tokens": 5752290.0,
|
||
|
|
"step": 2385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.62330436706543,
|
||
|
|
"epoch": 0.15366810261685848,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0003010949025820163,
|
||
|
|
"loss": 5.4376,
|
||
|
|
"mean_token_accuracy": 0.1905922070145607,
|
||
|
|
"num_tokens": 5764936.0,
|
||
|
|
"step": 2390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.434818315505981,
|
||
|
|
"epoch": 0.1539895840030862,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.0002999244029474252,
|
||
|
|
"loss": 5.3857,
|
||
|
|
"mean_token_accuracy": 0.19055279344320297,
|
||
|
|
"num_tokens": 5777179.0,
|
||
|
|
"step": 2395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.635022735595703,
|
||
|
|
"epoch": 0.15431106538931397,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00029875321999773684,
|
||
|
|
"loss": 5.5071,
|
||
|
|
"mean_token_accuracy": 0.17543855607509612,
|
||
|
|
"num_tokens": 5788840.0,
|
||
|
|
"step": 2400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.496736335754394,
|
||
|
|
"epoch": 0.1546325467755417,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00029758138584152333,
|
||
|
|
"loss": 5.4209,
|
||
|
|
"mean_token_accuracy": 0.181205914914608,
|
||
|
|
"num_tokens": 5800614.0,
|
||
|
|
"step": 2405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.500531196594238,
|
||
|
|
"epoch": 0.15495402816176942,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.0002964089326052102,
|
||
|
|
"loss": 5.3776,
|
||
|
|
"mean_token_accuracy": 0.19317713230848313,
|
||
|
|
"num_tokens": 5812293.0,
|
||
|
|
"step": 2410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.54772915840149,
|
||
|
|
"epoch": 0.15527550954799718,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0002952358924321949,
|
||
|
|
"loss": 5.4552,
|
||
|
|
"mean_token_accuracy": 0.1877766042947769,
|
||
|
|
"num_tokens": 5823308.0,
|
||
|
|
"step": 2415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5276360511779785,
|
||
|
|
"epoch": 0.1555969909342249,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00029406229748196657,
|
||
|
|
"loss": 5.3763,
|
||
|
|
"mean_token_accuracy": 0.18750981837511063,
|
||
|
|
"num_tokens": 5836259.0,
|
||
|
|
"step": 2420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.430213403701782,
|
||
|
|
"epoch": 0.15591847232045264,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0002928881799292235,
|
||
|
|
"loss": 5.2874,
|
||
|
|
"mean_token_accuracy": 0.19142003059387208,
|
||
|
|
"num_tokens": 5848261.0,
|
||
|
|
"step": 2425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5073686122894285,
|
||
|
|
"epoch": 0.1562399537066804,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00029171357196299154,
|
||
|
|
"loss": 5.3811,
|
||
|
|
"mean_token_accuracy": 0.1990845635533333,
|
||
|
|
"num_tokens": 5859534.0,
|
||
|
|
"step": 2430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5356865406036375,
|
||
|
|
"epoch": 0.15656143509290812,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.0002905385057857414,
|
||
|
|
"loss": 5.5431,
|
||
|
|
"mean_token_accuracy": 0.1753764271736145,
|
||
|
|
"num_tokens": 5873765.0,
|
||
|
|
"step": 2435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.601324224472046,
|
||
|
|
"epoch": 0.15688291647913585,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0002893630136125058,
|
||
|
|
"loss": 5.5082,
|
||
|
|
"mean_token_accuracy": 0.17669638693332673,
|
||
|
|
"num_tokens": 5884865.0,
|
||
|
|
"step": 2440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4812768459320065,
|
||
|
|
"epoch": 0.15720439786536358,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0002881871276699967,
|
||
|
|
"loss": 5.3895,
|
||
|
|
"mean_token_accuracy": 0.19194074273109435,
|
||
|
|
"num_tokens": 5896364.0,
|
||
|
|
"step": 2445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.431364917755127,
|
||
|
|
"epoch": 0.15752587925159134,
|
||
|
|
"grad_norm": 0.95703125,
|
||
|
|
"learning_rate": 0.00028701088019572114,
|
||
|
|
"loss": 5.3182,
|
||
|
|
"mean_token_accuracy": 0.19467305094003678,
|
||
|
|
"num_tokens": 5907605.0,
|
||
|
|
"step": 2450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.577045106887818,
|
||
|
|
"epoch": 0.15784736063781907,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0002858343034370977,
|
||
|
|
"loss": 5.4168,
|
||
|
|
"mean_token_accuracy": 0.1935096874833107,
|
||
|
|
"num_tokens": 5919018.0,
|
||
|
|
"step": 2455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.531840801239014,
|
||
|
|
"epoch": 0.1581688420240468,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00028465742965057267,
|
||
|
|
"loss": 5.402,
|
||
|
|
"mean_token_accuracy": 0.19550360292196273,
|
||
|
|
"num_tokens": 5930821.0,
|
||
|
|
"step": 2460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.462942028045655,
|
||
|
|
"epoch": 0.15849032341027455,
|
||
|
|
"grad_norm": 0.921875,
|
||
|
|
"learning_rate": 0.00028348029110073533,
|
||
|
|
"loss": 5.4335,
|
||
|
|
"mean_token_accuracy": 0.18216366767883302,
|
||
|
|
"num_tokens": 5944101.0,
|
||
|
|
"step": 2465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.7161705493927,
|
||
|
|
"epoch": 0.15881180479650228,
|
||
|
|
"grad_norm": 0.87890625,
|
||
|
|
"learning_rate": 0.00028230292005943365,
|
||
|
|
"loss": 5.5015,
|
||
|
|
"mean_token_accuracy": 0.1746315985918045,
|
||
|
|
"num_tokens": 5955728.0,
|
||
|
|
"step": 2470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.555997085571289,
|
||
|
|
"epoch": 0.15913328618273,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.00028112534880488945,
|
||
|
|
"loss": 5.3832,
|
||
|
|
"mean_token_accuracy": 0.19119613766670226,
|
||
|
|
"num_tokens": 5968479.0,
|
||
|
|
"step": 2475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.424562692642212,
|
||
|
|
"epoch": 0.15945476756895777,
|
||
|
|
"grad_norm": 0.9140625,
|
||
|
|
"learning_rate": 0.0002799476096208137,
|
||
|
|
"loss": 5.3509,
|
||
|
|
"mean_token_accuracy": 0.18964437991380692,
|
||
|
|
"num_tokens": 5981093.0,
|
||
|
|
"step": 2480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.569749069213867,
|
||
|
|
"epoch": 0.1597762489551855,
|
||
|
|
"grad_norm": 0.91796875,
|
||
|
|
"learning_rate": 0.00027876973479552087,
|
||
|
|
"loss": 5.4489,
|
||
|
|
"mean_token_accuracy": 0.18363112956285477,
|
||
|
|
"num_tokens": 5993199.0,
|
||
|
|
"step": 2485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.629951524734497,
|
||
|
|
"epoch": 0.16009773034141322,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00027759175662104424,
|
||
|
|
"loss": 5.492,
|
||
|
|
"mean_token_accuracy": 0.17685772627592086,
|
||
|
|
"num_tokens": 6006612.0,
|
||
|
|
"step": 2490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.487773418426514,
|
||
|
|
"epoch": 0.16041921172764098,
|
||
|
|
"grad_norm": 0.9453125,
|
||
|
|
"learning_rate": 0.0002764137073922508,
|
||
|
|
"loss": 5.3931,
|
||
|
|
"mean_token_accuracy": 0.18754769265651702,
|
||
|
|
"num_tokens": 6019080.0,
|
||
|
|
"step": 2495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.497006034851074,
|
||
|
|
"epoch": 0.1607406931138687,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00027523561940595505,
|
||
|
|
"loss": 5.4023,
|
||
|
|
"mean_token_accuracy": 0.19448343366384507,
|
||
|
|
"num_tokens": 6030566.0,
|
||
|
|
"step": 2500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.434673929214478,
|
||
|
|
"epoch": 0.16106217450009644,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0002740575249600342,
|
||
|
|
"loss": 5.3226,
|
||
|
|
"mean_token_accuracy": 0.19484579265117646,
|
||
|
|
"num_tokens": 6042125.0,
|
||
|
|
"step": 2505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.562820482254028,
|
||
|
|
"epoch": 0.1613836558863242,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.00027287945635254263,
|
||
|
|
"loss": 5.4264,
|
||
|
|
"mean_token_accuracy": 0.18023423552513124,
|
||
|
|
"num_tokens": 6054520.0,
|
||
|
|
"step": 2510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.467298984527588,
|
||
|
|
"epoch": 0.16170513727255192,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.00027170144588082635,
|
||
|
|
"loss": 5.2968,
|
||
|
|
"mean_token_accuracy": 0.19384915083646775,
|
||
|
|
"num_tokens": 6065637.0,
|
||
|
|
"step": 2515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5037695407867435,
|
||
|
|
"epoch": 0.16202661865877965,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00027052352584063763,
|
||
|
|
"loss": 5.4203,
|
||
|
|
"mean_token_accuracy": 0.19034665822982788,
|
||
|
|
"num_tokens": 6076829.0,
|
||
|
|
"step": 2520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.546562194824219,
|
||
|
|
"epoch": 0.16234810004500738,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00026934572852524907,
|
||
|
|
"loss": 5.4011,
|
||
|
|
"mean_token_accuracy": 0.1914973571896553,
|
||
|
|
"num_tokens": 6089695.0,
|
||
|
|
"step": 2525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.526164484024048,
|
||
|
|
"epoch": 0.16266958143123514,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00026816808622456937,
|
||
|
|
"loss": 5.4052,
|
||
|
|
"mean_token_accuracy": 0.19416888058185577,
|
||
|
|
"num_tokens": 6100758.0,
|
||
|
|
"step": 2530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.636290836334228,
|
||
|
|
"epoch": 0.16299106281746287,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.0002669906312242569,
|
||
|
|
"loss": 5.5066,
|
||
|
|
"mean_token_accuracy": 0.18335069864988326,
|
||
|
|
"num_tokens": 6112447.0,
|
||
|
|
"step": 2535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.53795018196106,
|
||
|
|
"epoch": 0.1633125442036906,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00026581339580483525,
|
||
|
|
"loss": 5.4208,
|
||
|
|
"mean_token_accuracy": 0.18381305038928986,
|
||
|
|
"num_tokens": 6124152.0,
|
||
|
|
"step": 2540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.554101514816284,
|
||
|
|
"epoch": 0.16363402558991835,
|
||
|
|
"grad_norm": 0.95703125,
|
||
|
|
"learning_rate": 0.0002646364122408082,
|
||
|
|
"loss": 5.4114,
|
||
|
|
"mean_token_accuracy": 0.18754277229309083,
|
||
|
|
"num_tokens": 6136612.0,
|
||
|
|
"step": 2545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.651884269714356,
|
||
|
|
"epoch": 0.16395550697614608,
|
||
|
|
"grad_norm": 0.95703125,
|
||
|
|
"learning_rate": 0.0002634597127997749,
|
||
|
|
"loss": 5.5602,
|
||
|
|
"mean_token_accuracy": 0.1776297941803932,
|
||
|
|
"num_tokens": 6149423.0,
|
||
|
|
"step": 2550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.51879358291626,
|
||
|
|
"epoch": 0.1642769883623738,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0002622833297415445,
|
||
|
|
"loss": 5.302,
|
||
|
|
"mean_token_accuracy": 0.1965479463338852,
|
||
|
|
"num_tokens": 6161156.0,
|
||
|
|
"step": 2555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.69025821685791,
|
||
|
|
"epoch": 0.16459846974860157,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0002611072953172531,
|
||
|
|
"loss": 5.5933,
|
||
|
|
"mean_token_accuracy": 0.18170697689056398,
|
||
|
|
"num_tokens": 6172953.0,
|
||
|
|
"step": 2560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.544156694412232,
|
||
|
|
"epoch": 0.1649199511348293,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.00025993164176847845,
|
||
|
|
"loss": 5.4097,
|
||
|
|
"mean_token_accuracy": 0.18657196015119554,
|
||
|
|
"num_tokens": 6186432.0,
|
||
|
|
"step": 2565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5111260414123535,
|
||
|
|
"epoch": 0.16524143252105702,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0002587564013263564,
|
||
|
|
"loss": 5.3003,
|
||
|
|
"mean_token_accuracy": 0.19230718165636063,
|
||
|
|
"num_tokens": 6197690.0,
|
||
|
|
"step": 2570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.482316350936889,
|
||
|
|
"epoch": 0.16556291390728478,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0002575816062106974,
|
||
|
|
"loss": 5.2941,
|
||
|
|
"mean_token_accuracy": 0.19686751067638397,
|
||
|
|
"num_tokens": 6208591.0,
|
||
|
|
"step": 2575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.471880626678467,
|
||
|
|
"epoch": 0.1658843952935125,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00025640728862910293,
|
||
|
|
"loss": 5.4012,
|
||
|
|
"mean_token_accuracy": 0.18286722898483276,
|
||
|
|
"num_tokens": 6221017.0,
|
||
|
|
"step": 2580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.48270173072815,
|
||
|
|
"epoch": 0.16620587667974024,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00025523348077608285,
|
||
|
|
"loss": 5.4537,
|
||
|
|
"mean_token_accuracy": 0.17893612682819365,
|
||
|
|
"num_tokens": 6232652.0,
|
||
|
|
"step": 2585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.562059688568115,
|
||
|
|
"epoch": 0.16652735806596797,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00025406021483217225,
|
||
|
|
"loss": 5.3588,
|
||
|
|
"mean_token_accuracy": 0.19150826334953308,
|
||
|
|
"num_tokens": 6244618.0,
|
||
|
|
"step": 2590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.47032904624939,
|
||
|
|
"epoch": 0.16684883945219572,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00025288752296304963,
|
||
|
|
"loss": 5.233,
|
||
|
|
"mean_token_accuracy": 0.20394995659589768,
|
||
|
|
"num_tokens": 6255576.0,
|
||
|
|
"step": 2595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4605467319488525,
|
||
|
|
"epoch": 0.16717032083842345,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.000251715437318655,
|
||
|
|
"loss": 5.3559,
|
||
|
|
"mean_token_accuracy": 0.19232839345932007,
|
||
|
|
"num_tokens": 6268190.0,
|
||
|
|
"step": 2600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.491960906982422,
|
||
|
|
"epoch": 0.16749180222465118,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0002505439900323084,
|
||
|
|
"loss": 5.3624,
|
||
|
|
"mean_token_accuracy": 0.18874482214450836,
|
||
|
|
"num_tokens": 6279646.0,
|
||
|
|
"step": 2605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.613111972808838,
|
||
|
|
"epoch": 0.16781328361087894,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00024937321321982894,
|
||
|
|
"loss": 5.4934,
|
||
|
|
"mean_token_accuracy": 0.17968523055315017,
|
||
|
|
"num_tokens": 6291057.0,
|
||
|
|
"step": 2610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.51639575958252,
|
||
|
|
"epoch": 0.16813476499710667,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.00024820313897865433,
|
||
|
|
"loss": 5.3338,
|
||
|
|
"mean_token_accuracy": 0.19352587461471557,
|
||
|
|
"num_tokens": 6302198.0,
|
||
|
|
"step": 2615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.475995254516602,
|
||
|
|
"epoch": 0.1684562463833344,
|
||
|
|
"grad_norm": 0.8828125,
|
||
|
|
"learning_rate": 0.00024703379938696105,
|
||
|
|
"loss": 5.3475,
|
||
|
|
"mean_token_accuracy": 0.1939903661608696,
|
||
|
|
"num_tokens": 6314560.0,
|
||
|
|
"step": 2620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.504677724838257,
|
||
|
|
"epoch": 0.16877772776956215,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00024586522650278447,
|
||
|
|
"loss": 5.3627,
|
||
|
|
"mean_token_accuracy": 0.19144565463066102,
|
||
|
|
"num_tokens": 6326026.0,
|
||
|
|
"step": 2625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.605600261688233,
|
||
|
|
"epoch": 0.16909920915578988,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00024469745236314064,
|
||
|
|
"loss": 5.5017,
|
||
|
|
"mean_token_accuracy": 0.17611012607812881,
|
||
|
|
"num_tokens": 6339344.0,
|
||
|
|
"step": 2630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.524125099182129,
|
||
|
|
"epoch": 0.1694206905420176,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00024353050898314767,
|
||
|
|
"loss": 5.4435,
|
||
|
|
"mean_token_accuracy": 0.1892185166478157,
|
||
|
|
"num_tokens": 6351246.0,
|
||
|
|
"step": 2635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.534309577941895,
|
||
|
|
"epoch": 0.16974217192824537,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00024236442835514743,
|
||
|
|
"loss": 5.3798,
|
||
|
|
"mean_token_accuracy": 0.1884256437420845,
|
||
|
|
"num_tokens": 6362424.0,
|
||
|
|
"step": 2640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.644014453887939,
|
||
|
|
"epoch": 0.1700636533144731,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00024119924244782965,
|
||
|
|
"loss": 5.5225,
|
||
|
|
"mean_token_accuracy": 0.17400314956903457,
|
||
|
|
"num_tokens": 6374646.0,
|
||
|
|
"step": 2645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.500179195404053,
|
||
|
|
"epoch": 0.17038513470070082,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.00024003498320535462,
|
||
|
|
"loss": 5.3203,
|
||
|
|
"mean_token_accuracy": 0.193774776160717,
|
||
|
|
"num_tokens": 6386117.0,
|
||
|
|
"step": 2650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.469301700592041,
|
||
|
|
"epoch": 0.17070661608692855,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00023887168254647727,
|
||
|
|
"loss": 5.3374,
|
||
|
|
"mean_token_accuracy": 0.18408911377191545,
|
||
|
|
"num_tokens": 6397005.0,
|
||
|
|
"step": 2655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.520926666259766,
|
||
|
|
"epoch": 0.1710280974731563,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00023770937236367308,
|
||
|
|
"loss": 5.336,
|
||
|
|
"mean_token_accuracy": 0.19018044024705888,
|
||
|
|
"num_tokens": 6410268.0,
|
||
|
|
"step": 2660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.545115423202515,
|
||
|
|
"epoch": 0.17134957885938404,
|
||
|
|
"grad_norm": 0.95703125,
|
||
|
|
"learning_rate": 0.00023654808452226278,
|
||
|
|
"loss": 5.3928,
|
||
|
|
"mean_token_accuracy": 0.18929932415485382,
|
||
|
|
"num_tokens": 6422787.0,
|
||
|
|
"step": 2665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.50922589302063,
|
||
|
|
"epoch": 0.17167106024561177,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.00023538785085953912,
|
||
|
|
"loss": 5.4144,
|
||
|
|
"mean_token_accuracy": 0.18407532274723054,
|
||
|
|
"num_tokens": 6435384.0,
|
||
|
|
"step": 2670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.547439908981323,
|
||
|
|
"epoch": 0.17199254163183952,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00023422870318389404,
|
||
|
|
"loss": 5.409,
|
||
|
|
"mean_token_accuracy": 0.18776395171880722,
|
||
|
|
"num_tokens": 6447335.0,
|
||
|
|
"step": 2675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.398316049575806,
|
||
|
|
"epoch": 0.17231402301806725,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0002330706732739468,
|
||
|
|
"loss": 5.1381,
|
||
|
|
"mean_token_accuracy": 0.2029879465699196,
|
||
|
|
"num_tokens": 6457989.0,
|
||
|
|
"step": 2680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.425315523147583,
|
||
|
|
"epoch": 0.17263550440429498,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.00023191379287767211,
|
||
|
|
"loss": 5.2893,
|
||
|
|
"mean_token_accuracy": 0.1935541734099388,
|
||
|
|
"num_tokens": 6468775.0,
|
||
|
|
"step": 2685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.371531057357788,
|
||
|
|
"epoch": 0.17295698579052274,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.0002307580937115305,
|
||
|
|
"loss": 5.2409,
|
||
|
|
"mean_token_accuracy": 0.1956937864422798,
|
||
|
|
"num_tokens": 6481561.0,
|
||
|
|
"step": 2690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.43153944015503,
|
||
|
|
"epoch": 0.17327846717675047,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00022960360745959846,
|
||
|
|
"loss": 5.3207,
|
||
|
|
"mean_token_accuracy": 0.19398647546768188,
|
||
|
|
"num_tokens": 6492677.0,
|
||
|
|
"step": 2695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.504358577728271,
|
||
|
|
"epoch": 0.1735999485629782,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00022845036577269972,
|
||
|
|
"loss": 5.3564,
|
||
|
|
"mean_token_accuracy": 0.19392422437667847,
|
||
|
|
"num_tokens": 6504798.0,
|
||
|
|
"step": 2700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.514374160766602,
|
||
|
|
"epoch": 0.17392142994920595,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00022729840026753777,
|
||
|
|
"loss": 5.395,
|
||
|
|
"mean_token_accuracy": 0.1902625486254692,
|
||
|
|
"num_tokens": 6516659.0,
|
||
|
|
"step": 2705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4747758388519285,
|
||
|
|
"epoch": 0.17424291133543368,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0002261477425258287,
|
||
|
|
"loss": 5.2727,
|
||
|
|
"mean_token_accuracy": 0.19142758399248122,
|
||
|
|
"num_tokens": 6528717.0,
|
||
|
|
"step": 2710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.474758291244507,
|
||
|
|
"epoch": 0.1745643927216614,
|
||
|
|
"grad_norm": 0.890625,
|
||
|
|
"learning_rate": 0.0002249984240934358,
|
||
|
|
"loss": 5.3424,
|
||
|
|
"mean_token_accuracy": 0.19446262270212172,
|
||
|
|
"num_tokens": 6541624.0,
|
||
|
|
"step": 2715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.49737057685852,
|
||
|
|
"epoch": 0.17488587410788917,
|
||
|
|
"grad_norm": 0.96484375,
|
||
|
|
"learning_rate": 0.00022385047647950464,
|
||
|
|
"loss": 5.2696,
|
||
|
|
"mean_token_accuracy": 0.19792366921901702,
|
||
|
|
"num_tokens": 6553716.0,
|
||
|
|
"step": 2720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.428974390029907,
|
||
|
|
"epoch": 0.1752073554941169,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0002227039311555986,
|
||
|
|
"loss": 5.2765,
|
||
|
|
"mean_token_accuracy": 0.19663549661636354,
|
||
|
|
"num_tokens": 6565685.0,
|
||
|
|
"step": 2725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.521430015563965,
|
||
|
|
"epoch": 0.17552883688034462,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0002215588195548372,
|
||
|
|
"loss": 5.4356,
|
||
|
|
"mean_token_accuracy": 0.18882615268230438,
|
||
|
|
"num_tokens": 6578965.0,
|
||
|
|
"step": 2730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.467400169372558,
|
||
|
|
"epoch": 0.17585031826657235,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00022041517307103337,
|
||
|
|
"loss": 5.2215,
|
||
|
|
"mean_token_accuracy": 0.20142196565866471,
|
||
|
|
"num_tokens": 6590317.0,
|
||
|
|
"step": 2735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5123964786529545,
|
||
|
|
"epoch": 0.1761717996528001,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0002192730230578331,
|
||
|
|
"loss": 5.4084,
|
||
|
|
"mean_token_accuracy": 0.19268880635499955,
|
||
|
|
"num_tokens": 6601509.0,
|
||
|
|
"step": 2740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.525536012649536,
|
||
|
|
"epoch": 0.17649328103902784,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.0002181324008278559,
|
||
|
|
"loss": 5.4203,
|
||
|
|
"mean_token_accuracy": 0.18903424888849257,
|
||
|
|
"num_tokens": 6612613.0,
|
||
|
|
"step": 2745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.505003118515015,
|
||
|
|
"epoch": 0.17681476242525557,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00021699333765183655,
|
||
|
|
"loss": 5.2796,
|
||
|
|
"mean_token_accuracy": 0.1923887923359871,
|
||
|
|
"num_tokens": 6623818.0,
|
||
|
|
"step": 2750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.443672180175781,
|
||
|
|
"epoch": 0.17713624381148332,
|
||
|
|
"grad_norm": 0.90234375,
|
||
|
|
"learning_rate": 0.0002158558647577673,
|
||
|
|
"loss": 5.24,
|
||
|
|
"mean_token_accuracy": 0.196689735352993,
|
||
|
|
"num_tokens": 6636463.0,
|
||
|
|
"step": 2755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.486599159240723,
|
||
|
|
"epoch": 0.17745772519771105,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00021472001333004215,
|
||
|
|
"loss": 5.3626,
|
||
|
|
"mean_token_accuracy": 0.19338621944189072,
|
||
|
|
"num_tokens": 6648506.0,
|
||
|
|
"step": 2760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.525889110565186,
|
||
|
|
"epoch": 0.17777920658393878,
|
||
|
|
"grad_norm": 0.890625,
|
||
|
|
"learning_rate": 0.00021358581450860186,
|
||
|
|
"loss": 5.3489,
|
||
|
|
"mean_token_accuracy": 0.19586251229047774,
|
||
|
|
"num_tokens": 6661558.0,
|
||
|
|
"step": 2765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.504775953292847,
|
||
|
|
"epoch": 0.17810068797016654,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.0002124532993880799,
|
||
|
|
"loss": 5.2956,
|
||
|
|
"mean_token_accuracy": 0.19997536540031433,
|
||
|
|
"num_tokens": 6673998.0,
|
||
|
|
"step": 2770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.474074983596802,
|
||
|
|
"epoch": 0.17842216935639427,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00021132249901695044,
|
||
|
|
"loss": 5.387,
|
||
|
|
"mean_token_accuracy": 0.1927694335579872,
|
||
|
|
"num_tokens": 6685906.0,
|
||
|
|
"step": 2775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4691243171691895,
|
||
|
|
"epoch": 0.178743650742622,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.00021019344439667705,
|
||
|
|
"loss": 5.3831,
|
||
|
|
"mean_token_accuracy": 0.19786081165075303,
|
||
|
|
"num_tokens": 6698593.0,
|
||
|
|
"step": 2780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.514200830459595,
|
||
|
|
"epoch": 0.17906513212884975,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00020906616648086213,
|
||
|
|
"loss": 5.2921,
|
||
|
|
"mean_token_accuracy": 0.19582349956035613,
|
||
|
|
"num_tokens": 6709506.0,
|
||
|
|
"step": 2785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.543369722366333,
|
||
|
|
"epoch": 0.17938661351507748,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00020794069617439942,
|
||
|
|
"loss": 5.3204,
|
||
|
|
"mean_token_accuracy": 0.20135533213615417,
|
||
|
|
"num_tokens": 6720495.0,
|
||
|
|
"step": 2790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.450494956970215,
|
||
|
|
"epoch": 0.1797080949013052,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00020681706433262593,
|
||
|
|
"loss": 5.3484,
|
||
|
|
"mean_token_accuracy": 0.18967305123806,
|
||
|
|
"num_tokens": 6732306.0,
|
||
|
|
"step": 2795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.405582475662231,
|
||
|
|
"epoch": 0.18002957628753294,
|
||
|
|
"grad_norm": 0.92578125,
|
||
|
|
"learning_rate": 0.00020569530176047602,
|
||
|
|
"loss": 5.259,
|
||
|
|
"mean_token_accuracy": 0.19685706198215486,
|
||
|
|
"num_tokens": 6744920.0,
|
||
|
|
"step": 2800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.423574590682984,
|
||
|
|
"epoch": 0.1803510576737607,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0002045754392116374,
|
||
|
|
"loss": 5.3057,
|
||
|
|
"mean_token_accuracy": 0.1885216489434242,
|
||
|
|
"num_tokens": 6756294.0,
|
||
|
|
"step": 2805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.584844017028809,
|
||
|
|
"epoch": 0.18067253905998842,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00020345750738770757,
|
||
|
|
"loss": 5.3903,
|
||
|
|
"mean_token_accuracy": 0.19385518431663512,
|
||
|
|
"num_tokens": 6767593.0,
|
||
|
|
"step": 2810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.587840270996094,
|
||
|
|
"epoch": 0.18099402044621615,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.00020234153693735214,
|
||
|
|
"loss": 5.434,
|
||
|
|
"mean_token_accuracy": 0.18844165354967118,
|
||
|
|
"num_tokens": 6779113.0,
|
||
|
|
"step": 2815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4484680652618405,
|
||
|
|
"epoch": 0.1813155018324439,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.0002012275584554647,
|
||
|
|
"loss": 5.3135,
|
||
|
|
"mean_token_accuracy": 0.19167429506778716,
|
||
|
|
"num_tokens": 6790590.0,
|
||
|
|
"step": 2820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.406166505813599,
|
||
|
|
"epoch": 0.18163698321867164,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00020011560248232803,
|
||
|
|
"loss": 5.2432,
|
||
|
|
"mean_token_accuracy": 0.19454890638589858,
|
||
|
|
"num_tokens": 6801938.0,
|
||
|
|
"step": 2825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.521785736083984,
|
||
|
|
"epoch": 0.18195846460489937,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00019900569950277692,
|
||
|
|
"loss": 5.3855,
|
||
|
|
"mean_token_accuracy": 0.18262381106615067,
|
||
|
|
"num_tokens": 6815376.0,
|
||
|
|
"step": 2830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.574881553649902,
|
||
|
|
"epoch": 0.18227994599112712,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.00019789787994536228,
|
||
|
|
"loss": 5.3654,
|
||
|
|
"mean_token_accuracy": 0.19725956469774247,
|
||
|
|
"num_tokens": 6827030.0,
|
||
|
|
"step": 2835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.424269962310791,
|
||
|
|
"epoch": 0.18260142737735485,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00019679217418151667,
|
||
|
|
"loss": 5.2457,
|
||
|
|
"mean_token_accuracy": 0.19444329142570496,
|
||
|
|
"num_tokens": 6838576.0,
|
||
|
|
"step": 2840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.426975297927856,
|
||
|
|
"epoch": 0.18292290876358258,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00019568861252472236,
|
||
|
|
"loss": 5.2842,
|
||
|
|
"mean_token_accuracy": 0.1930141344666481,
|
||
|
|
"num_tokens": 6850562.0,
|
||
|
|
"step": 2845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.534057855606079,
|
||
|
|
"epoch": 0.18324439014981034,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00019458722522967952,
|
||
|
|
"loss": 5.4126,
|
||
|
|
"mean_token_accuracy": 0.18607359528541564,
|
||
|
|
"num_tokens": 6862733.0,
|
||
|
|
"step": 2850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.460376596450805,
|
||
|
|
"epoch": 0.18356587153603807,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00019348804249147723,
|
||
|
|
"loss": 5.2659,
|
||
|
|
"mean_token_accuracy": 0.20191334187984467,
|
||
|
|
"num_tokens": 6874360.0,
|
||
|
|
"step": 2855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.47740330696106,
|
||
|
|
"epoch": 0.1838873529222658,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0001923910944447655,
|
||
|
|
"loss": 5.3113,
|
||
|
|
"mean_token_accuracy": 0.19145590364933013,
|
||
|
|
"num_tokens": 6886210.0,
|
||
|
|
"step": 2860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.497873449325562,
|
||
|
|
"epoch": 0.18420883430849355,
|
||
|
|
"grad_norm": 0.87890625,
|
||
|
|
"learning_rate": 0.00019129641116292928,
|
||
|
|
"loss": 5.3577,
|
||
|
|
"mean_token_accuracy": 0.18811868131160736,
|
||
|
|
"num_tokens": 6898798.0,
|
||
|
|
"step": 2865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5115156173706055,
|
||
|
|
"epoch": 0.18453031569472128,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00019020402265726343,
|
||
|
|
"loss": 5.3291,
|
||
|
|
"mean_token_accuracy": 0.18956609815359116,
|
||
|
|
"num_tokens": 6911228.0,
|
||
|
|
"step": 2870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.510313415527344,
|
||
|
|
"epoch": 0.184851797080949,
|
||
|
|
"grad_norm": 0.91015625,
|
||
|
|
"learning_rate": 0.0001891139588761509,
|
||
|
|
"loss": 5.3762,
|
||
|
|
"mean_token_accuracy": 0.18967971652746202,
|
||
|
|
"num_tokens": 6923442.0,
|
||
|
|
"step": 2875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.529934883117676,
|
||
|
|
"epoch": 0.18517327846717674,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00018802624970424076,
|
||
|
|
"loss": 5.3997,
|
||
|
|
"mean_token_accuracy": 0.19401466548442842,
|
||
|
|
"num_tokens": 6935365.0,
|
||
|
|
"step": 2880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.506960248947143,
|
||
|
|
"epoch": 0.1854947598534045,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00018694092496162945,
|
||
|
|
"loss": 5.3776,
|
||
|
|
"mean_token_accuracy": 0.18801408410072326,
|
||
|
|
"num_tokens": 6946349.0,
|
||
|
|
"step": 2885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.454153728485108,
|
||
|
|
"epoch": 0.18581624123963222,
|
||
|
|
"grad_norm": 0.95703125,
|
||
|
|
"learning_rate": 0.00018585801440304306,
|
||
|
|
"loss": 5.3204,
|
||
|
|
"mean_token_accuracy": 0.19200208485126496,
|
||
|
|
"num_tokens": 6958656.0,
|
||
|
|
"step": 2890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.462296009063721,
|
||
|
|
"epoch": 0.18613772262585995,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00018477754771702165,
|
||
|
|
"loss": 5.252,
|
||
|
|
"mean_token_accuracy": 0.19284357577562333,
|
||
|
|
"num_tokens": 6970435.0,
|
||
|
|
"step": 2895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.453213739395141,
|
||
|
|
"epoch": 0.1864592040120877,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00018369955452510506,
|
||
|
|
"loss": 5.3893,
|
||
|
|
"mean_token_accuracy": 0.1904047518968582,
|
||
|
|
"num_tokens": 6983129.0,
|
||
|
|
"step": 2900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.6055694103240965,
|
||
|
|
"epoch": 0.18678068539831544,
|
||
|
|
"grad_norm": 0.8984375,
|
||
|
|
"learning_rate": 0.0001826240643810212,
|
||
|
|
"loss": 5.3981,
|
||
|
|
"mean_token_accuracy": 0.18540676385164262,
|
||
|
|
"num_tokens": 6995904.0,
|
||
|
|
"step": 2905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.519491720199585,
|
||
|
|
"epoch": 0.18710216678454317,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0001815511067698758,
|
||
|
|
"loss": 5.3346,
|
||
|
|
"mean_token_accuracy": 0.19957497268915175,
|
||
|
|
"num_tokens": 7007688.0,
|
||
|
|
"step": 2910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.526347637176514,
|
||
|
|
"epoch": 0.18742364817077092,
|
||
|
|
"grad_norm": 0.88671875,
|
||
|
|
"learning_rate": 0.0001804807111073436,
|
||
|
|
"loss": 5.4152,
|
||
|
|
"mean_token_accuracy": 0.18391841650009155,
|
||
|
|
"num_tokens": 7021596.0,
|
||
|
|
"step": 2915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.476921653747558,
|
||
|
|
"epoch": 0.18774512955699865,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.0001794129067388625,
|
||
|
|
"loss": 5.3043,
|
||
|
|
"mean_token_accuracy": 0.18943013697862626,
|
||
|
|
"num_tokens": 7034619.0,
|
||
|
|
"step": 2920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.468883848190307,
|
||
|
|
"epoch": 0.18806661094322638,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00017834772293882868,
|
||
|
|
"loss": 5.2943,
|
||
|
|
"mean_token_accuracy": 0.19616567343473434,
|
||
|
|
"num_tokens": 7046208.0,
|
||
|
|
"step": 2925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.516259384155274,
|
||
|
|
"epoch": 0.18838809232945414,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000177285188909794,
|
||
|
|
"loss": 5.3332,
|
||
|
|
"mean_token_accuracy": 0.1994587317109108,
|
||
|
|
"num_tokens": 7056963.0,
|
||
|
|
"step": 2930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.533030843734741,
|
||
|
|
"epoch": 0.18870957371568187,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0001762253337816656,
|
||
|
|
"loss": 5.3106,
|
||
|
|
"mean_token_accuracy": 0.19521999210119248,
|
||
|
|
"num_tokens": 7068797.0,
|
||
|
|
"step": 2935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.557912969589234,
|
||
|
|
"epoch": 0.1890310551019096,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00017516818661090738,
|
||
|
|
"loss": 5.3636,
|
||
|
|
"mean_token_accuracy": 0.19936135709285735,
|
||
|
|
"num_tokens": 7080806.0,
|
||
|
|
"step": 2940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.530676031112671,
|
||
|
|
"epoch": 0.18935253648813732,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0001741137763797428,
|
||
|
|
"loss": 5.3636,
|
||
|
|
"mean_token_accuracy": 0.18777301013469697,
|
||
|
|
"num_tokens": 7092082.0,
|
||
|
|
"step": 2945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.44344048500061,
|
||
|
|
"epoch": 0.18967401787436508,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00017306213199536115,
|
||
|
|
"loss": 5.3129,
|
||
|
|
"mean_token_accuracy": 0.19371072202920914,
|
||
|
|
"num_tokens": 7103789.0,
|
||
|
|
"step": 2950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.356809043884278,
|
||
|
|
"epoch": 0.1899954992605928,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0001720132822891243,
|
||
|
|
"loss": 5.1133,
|
||
|
|
"mean_token_accuracy": 0.21682160049676896,
|
||
|
|
"num_tokens": 7114372.0,
|
||
|
|
"step": 2955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.503632354736328,
|
||
|
|
"epoch": 0.19031698064682054,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.0001709672560157769,
|
||
|
|
"loss": 5.3816,
|
||
|
|
"mean_token_accuracy": 0.1899361565709114,
|
||
|
|
"num_tokens": 7126312.0,
|
||
|
|
"step": 2960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.502098608016968,
|
||
|
|
"epoch": 0.1906384620330483,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00016992408185265758,
|
||
|
|
"loss": 5.3235,
|
||
|
|
"mean_token_accuracy": 0.19690466076135635,
|
||
|
|
"num_tokens": 7139261.0,
|
||
|
|
"step": 2965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.458429908752441,
|
||
|
|
"epoch": 0.19095994341927602,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00016888378839891298,
|
||
|
|
"loss": 5.241,
|
||
|
|
"mean_token_accuracy": 0.20116536170244217,
|
||
|
|
"num_tokens": 7149771.0,
|
||
|
|
"step": 2970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.521752405166626,
|
||
|
|
"epoch": 0.19128142480550375,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.0001678464041747137,
|
||
|
|
"loss": 5.4291,
|
||
|
|
"mean_token_accuracy": 0.1944451317191124,
|
||
|
|
"num_tokens": 7162090.0,
|
||
|
|
"step": 2975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.464722633361816,
|
||
|
|
"epoch": 0.1916029061917315,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.00016681195762047223,
|
||
|
|
"loss": 5.3102,
|
||
|
|
"mean_token_accuracy": 0.1903044894337654,
|
||
|
|
"num_tokens": 7173412.0,
|
||
|
|
"step": 2980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.440432024002075,
|
||
|
|
"epoch": 0.19192438757795924,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00016578047709606337,
|
||
|
|
"loss": 5.3092,
|
||
|
|
"mean_token_accuracy": 0.19523194879293443,
|
||
|
|
"num_tokens": 7186390.0,
|
||
|
|
"step": 2985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.466923999786377,
|
||
|
|
"epoch": 0.19224586896418697,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00016475199088004678,
|
||
|
|
"loss": 5.3062,
|
||
|
|
"mean_token_accuracy": 0.1943998321890831,
|
||
|
|
"num_tokens": 7198134.0,
|
||
|
|
"step": 2990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.422802877426148,
|
||
|
|
"epoch": 0.19256735035041472,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00016372652716889163,
|
||
|
|
"loss": 5.1347,
|
||
|
|
"mean_token_accuracy": 0.20232093930244446,
|
||
|
|
"num_tokens": 7209836.0,
|
||
|
|
"step": 2995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.457040119171142,
|
||
|
|
"epoch": 0.19288883173664245,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0001627041140762035,
|
||
|
|
"loss": 5.3187,
|
||
|
|
"mean_token_accuracy": 0.20426255613565444,
|
||
|
|
"num_tokens": 7220880.0,
|
||
|
|
"step": 3000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.490808534622192,
|
||
|
|
"epoch": 0.19321031312287018,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00016168477963195382,
|
||
|
|
"loss": 5.3387,
|
||
|
|
"mean_token_accuracy": 0.19551098495721816,
|
||
|
|
"num_tokens": 7233437.0,
|
||
|
|
"step": 3005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5793431282043455,
|
||
|
|
"epoch": 0.1935317945090979,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0001606685517817114,
|
||
|
|
"loss": 5.3369,
|
||
|
|
"mean_token_accuracy": 0.19009050577878953,
|
||
|
|
"num_tokens": 7244402.0,
|
||
|
|
"step": 3010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.491316461563111,
|
||
|
|
"epoch": 0.19385327589532567,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00015965545838587592,
|
||
|
|
"loss": 5.3296,
|
||
|
|
"mean_token_accuracy": 0.19164009392261505,
|
||
|
|
"num_tokens": 7257355.0,
|
||
|
|
"step": 3015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.501431035995483,
|
||
|
|
"epoch": 0.1941747572815534,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00015864552721891467,
|
||
|
|
"loss": 5.3385,
|
||
|
|
"mean_token_accuracy": 0.19362592697143555,
|
||
|
|
"num_tokens": 7269427.0,
|
||
|
|
"step": 3020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.485341882705688,
|
||
|
|
"epoch": 0.19449623866778112,
|
||
|
|
"grad_norm": 0.95703125,
|
||
|
|
"learning_rate": 0.00015763878596860076,
|
||
|
|
"loss": 5.3203,
|
||
|
|
"mean_token_accuracy": 0.19275521188974382,
|
||
|
|
"num_tokens": 7281409.0,
|
||
|
|
"step": 3025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.503916883468628,
|
||
|
|
"epoch": 0.19481772005400888,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00015663526223525412,
|
||
|
|
"loss": 5.3621,
|
||
|
|
"mean_token_accuracy": 0.19350071847438813,
|
||
|
|
"num_tokens": 7293730.0,
|
||
|
|
"step": 3030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5412435054779055,
|
||
|
|
"epoch": 0.1951392014402366,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.0001556349835309848,
|
||
|
|
"loss": 5.2915,
|
||
|
|
"mean_token_accuracy": 0.19483343362808228,
|
||
|
|
"num_tokens": 7306878.0,
|
||
|
|
"step": 3035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.541359710693359,
|
||
|
|
"epoch": 0.19546068282646434,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0001546379772789389,
|
||
|
|
"loss": 5.3823,
|
||
|
|
"mean_token_accuracy": 0.19119008034467697,
|
||
|
|
"num_tokens": 7319978.0,
|
||
|
|
"step": 3040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.508396244049072,
|
||
|
|
"epoch": 0.1957821642126921,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00015364427081254622,
|
||
|
|
"loss": 5.3236,
|
||
|
|
"mean_token_accuracy": 0.19622999280691147,
|
||
|
|
"num_tokens": 7331830.0,
|
||
|
|
"step": 3045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.370055055618286,
|
||
|
|
"epoch": 0.19610364559891982,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.00015265389137477165,
|
||
|
|
"loss": 5.2352,
|
||
|
|
"mean_token_accuracy": 0.19576351195573807,
|
||
|
|
"num_tokens": 7344372.0,
|
||
|
|
"step": 3050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.463089370727539,
|
||
|
|
"epoch": 0.19642512698514755,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00015166686611736786,
|
||
|
|
"loss": 5.3172,
|
||
|
|
"mean_token_accuracy": 0.19152648150920867,
|
||
|
|
"num_tokens": 7356393.0,
|
||
|
|
"step": 3055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.610896587371826,
|
||
|
|
"epoch": 0.1967466083713753,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00015068322210013064,
|
||
|
|
"loss": 5.4313,
|
||
|
|
"mean_token_accuracy": 0.1880741834640503,
|
||
|
|
"num_tokens": 7367601.0,
|
||
|
|
"step": 3060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.512559652328491,
|
||
|
|
"epoch": 0.19706808975760304,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0001497029862901578,
|
||
|
|
"loss": 5.3242,
|
||
|
|
"mean_token_accuracy": 0.19347705245018004,
|
||
|
|
"num_tokens": 7380426.0,
|
||
|
|
"step": 3065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.40659728050232,
|
||
|
|
"epoch": 0.19738957114383077,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.00014872618556110905,
|
||
|
|
"loss": 5.1464,
|
||
|
|
"mean_token_accuracy": 0.20574141144752503,
|
||
|
|
"num_tokens": 7392007.0,
|
||
|
|
"step": 3070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.468534994125366,
|
||
|
|
"epoch": 0.19771105253005852,
|
||
|
|
"grad_norm": 0.87890625,
|
||
|
|
"learning_rate": 0.00014775284669246992,
|
||
|
|
"loss": 5.3652,
|
||
|
|
"mean_token_accuracy": 0.1934175446629524,
|
||
|
|
"num_tokens": 7406101.0,
|
||
|
|
"step": 3075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4620081901550295,
|
||
|
|
"epoch": 0.19803253391628625,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00014678299636881716,
|
||
|
|
"loss": 5.2694,
|
||
|
|
"mean_token_accuracy": 0.201640847325325,
|
||
|
|
"num_tokens": 7417997.0,
|
||
|
|
"step": 3080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.494368076324463,
|
||
|
|
"epoch": 0.19835401530251398,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0001458166611790873,
|
||
|
|
"loss": 5.3172,
|
||
|
|
"mean_token_accuracy": 0.19228555560111998,
|
||
|
|
"num_tokens": 7429390.0,
|
||
|
|
"step": 3085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.419237279891968,
|
||
|
|
"epoch": 0.1986754966887417,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00014485386761584773,
|
||
|
|
"loss": 5.1612,
|
||
|
|
"mean_token_accuracy": 0.20953599363565445,
|
||
|
|
"num_tokens": 7441903.0,
|
||
|
|
"step": 3090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.466622257232666,
|
||
|
|
"epoch": 0.19899697807496947,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00014389464207457042,
|
||
|
|
"loss": 5.3048,
|
||
|
|
"mean_token_accuracy": 0.19135852456092833,
|
||
|
|
"num_tokens": 7453507.0,
|
||
|
|
"step": 3095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.413507652282715,
|
||
|
|
"epoch": 0.1993184594611972,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00014293901085290795,
|
||
|
|
"loss": 5.272,
|
||
|
|
"mean_token_accuracy": 0.20123399049043655,
|
||
|
|
"num_tokens": 7464585.0,
|
||
|
|
"step": 3100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.431730699539185,
|
||
|
|
"epoch": 0.19963994084742492,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.00014198700014997307,
|
||
|
|
"loss": 5.2053,
|
||
|
|
"mean_token_accuracy": 0.19521358162164687,
|
||
|
|
"num_tokens": 7477105.0,
|
||
|
|
"step": 3105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.496017217636108,
|
||
|
|
"epoch": 0.19996142223365268,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 0.00014103863606562016,
|
||
|
|
"loss": 5.3624,
|
||
|
|
"mean_token_accuracy": 0.1895827665925026,
|
||
|
|
"num_tokens": 7489253.0,
|
||
|
|
"step": 3110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.483079624176026,
|
||
|
|
"epoch": 0.2002829036198804,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00014009394459972964,
|
||
|
|
"loss": 5.2398,
|
||
|
|
"mean_token_accuracy": 0.1979812428355217,
|
||
|
|
"num_tokens": 7501087.0,
|
||
|
|
"step": 3115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5268463611602785,
|
||
|
|
"epoch": 0.20060438500610814,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00013915295165149513,
|
||
|
|
"loss": 5.2986,
|
||
|
|
"mean_token_accuracy": 0.19447654187679292,
|
||
|
|
"num_tokens": 7512942.0,
|
||
|
|
"step": 3120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.433060979843139,
|
||
|
|
"epoch": 0.2009258663923359,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.00013821568301871384,
|
||
|
|
"loss": 5.2552,
|
||
|
|
"mean_token_accuracy": 0.19375841915607453,
|
||
|
|
"num_tokens": 7523422.0,
|
||
|
|
"step": 3125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.53105092048645,
|
||
|
|
"epoch": 0.20124734777856362,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.00013728216439707862,
|
||
|
|
"loss": 5.3843,
|
||
|
|
"mean_token_accuracy": 0.18820478469133378,
|
||
|
|
"num_tokens": 7535241.0,
|
||
|
|
"step": 3130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.519726848602295,
|
||
|
|
"epoch": 0.20156882916479135,
|
||
|
|
"grad_norm": 0.97265625,
|
||
|
|
"learning_rate": 0.00013635242137947419,
|
||
|
|
"loss": 5.3842,
|
||
|
|
"mean_token_accuracy": 0.19525212794542313,
|
||
|
|
"num_tokens": 7547247.0,
|
||
|
|
"step": 3135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.508855247497559,
|
||
|
|
"epoch": 0.2018903105510191,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.00013542647945527498,
|
||
|
|
"loss": 5.358,
|
||
|
|
"mean_token_accuracy": 0.19906590580940248,
|
||
|
|
"num_tokens": 7560608.0,
|
||
|
|
"step": 3140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5089140892028805,
|
||
|
|
"epoch": 0.20221179193724684,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.0001345043640096465,
|
||
|
|
"loss": 5.3375,
|
||
|
|
"mean_token_accuracy": 0.1912871778011322,
|
||
|
|
"num_tokens": 7574058.0,
|
||
|
|
"step": 3145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.470392417907715,
|
||
|
|
"epoch": 0.20253327332347457,
|
||
|
|
"grad_norm": 0.9140625,
|
||
|
|
"learning_rate": 0.00013358610032284957,
|
||
|
|
"loss": 5.2778,
|
||
|
|
"mean_token_accuracy": 0.19387194365262986,
|
||
|
|
"num_tokens": 7586832.0,
|
||
|
|
"step": 3150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.436352062225342,
|
||
|
|
"epoch": 0.2028547547097023,
|
||
|
|
"grad_norm": 0.890625,
|
||
|
|
"learning_rate": 0.000132671713569547,
|
||
|
|
"loss": 5.2204,
|
||
|
|
"mean_token_accuracy": 0.20230866223573685,
|
||
|
|
"num_tokens": 7599562.0,
|
||
|
|
"step": 3155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.463894891738891,
|
||
|
|
"epoch": 0.20317623609593005,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0001317612288181136,
|
||
|
|
"loss": 5.2853,
|
||
|
|
"mean_token_accuracy": 0.19479794055223465,
|
||
|
|
"num_tokens": 7612024.0,
|
||
|
|
"step": 3160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5133569717407225,
|
||
|
|
"epoch": 0.20349771748215778,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.00013085467102994864,
|
||
|
|
"loss": 5.2754,
|
||
|
|
"mean_token_accuracy": 0.19782915860414504,
|
||
|
|
"num_tokens": 7624538.0,
|
||
|
|
"step": 3165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.455456304550171,
|
||
|
|
"epoch": 0.2038191988683855,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00012995206505879198,
|
||
|
|
"loss": 5.262,
|
||
|
|
"mean_token_accuracy": 0.19960153996944427,
|
||
|
|
"num_tokens": 7635731.0,
|
||
|
|
"step": 3170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.60815577507019,
|
||
|
|
"epoch": 0.20414068025461327,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0001290534356500421,
|
||
|
|
"loss": 5.4904,
|
||
|
|
"mean_token_accuracy": 0.18444685786962509,
|
||
|
|
"num_tokens": 7647339.0,
|
||
|
|
"step": 3175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.515786218643188,
|
||
|
|
"epoch": 0.204462161640841,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 0.00012815880744007827,
|
||
|
|
"loss": 5.3778,
|
||
|
|
"mean_token_accuracy": 0.18531815707683563,
|
||
|
|
"num_tokens": 7659043.0,
|
||
|
|
"step": 3180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.464166116714478,
|
||
|
|
"epoch": 0.20478364302706872,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00012726820495558483,
|
||
|
|
"loss": 5.2007,
|
||
|
|
"mean_token_accuracy": 0.2022552639245987,
|
||
|
|
"num_tokens": 7670747.0,
|
||
|
|
"step": 3185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.513610553741455,
|
||
|
|
"epoch": 0.20510512441329648,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00012638165261287868,
|
||
|
|
"loss": 5.3498,
|
||
|
|
"mean_token_accuracy": 0.19857844561338425,
|
||
|
|
"num_tokens": 7683222.0,
|
||
|
|
"step": 3190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4384397029876705,
|
||
|
|
"epoch": 0.2054266057995242,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0001254991747172402,
|
||
|
|
"loss": 5.2579,
|
||
|
|
"mean_token_accuracy": 0.1951031506061554,
|
||
|
|
"num_tokens": 7696243.0,
|
||
|
|
"step": 3195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4882848262786865,
|
||
|
|
"epoch": 0.20574808718575194,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 0.00012462079546224662,
|
||
|
|
"loss": 5.3634,
|
||
|
|
"mean_token_accuracy": 0.19239961504936218,
|
||
|
|
"num_tokens": 7710145.0,
|
||
|
|
"step": 3200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4887792587280275,
|
||
|
|
"epoch": 0.2060695685719797,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00012374653892910896,
|
||
|
|
"loss": 5.3515,
|
||
|
|
"mean_token_accuracy": 0.18954517990350722,
|
||
|
|
"num_tokens": 7722678.0,
|
||
|
|
"step": 3205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.489811277389526,
|
||
|
|
"epoch": 0.20639104995820742,
|
||
|
|
"grad_norm": 0.92578125,
|
||
|
|
"learning_rate": 0.00012287642908601166,
|
||
|
|
"loss": 5.2243,
|
||
|
|
"mean_token_accuracy": 0.2016367495059967,
|
||
|
|
"num_tokens": 7736452.0,
|
||
|
|
"step": 3210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.520501232147216,
|
||
|
|
"epoch": 0.20671253134443515,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00012201048978745569,
|
||
|
|
"loss": 5.2578,
|
||
|
|
"mean_token_accuracy": 0.19635124802589415,
|
||
|
|
"num_tokens": 7746929.0,
|
||
|
|
"step": 3215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.585505867004395,
|
||
|
|
"epoch": 0.20703401273066288,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00012114874477360427,
|
||
|
|
"loss": 5.536,
|
||
|
|
"mean_token_accuracy": 0.17402558028697968,
|
||
|
|
"num_tokens": 7759560.0,
|
||
|
|
"step": 3220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.504039478302002,
|
||
|
|
"epoch": 0.20735549411689064,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00012029121766963236,
|
||
|
|
"loss": 5.2802,
|
||
|
|
"mean_token_accuracy": 0.19737469553947448,
|
||
|
|
"num_tokens": 7771820.0,
|
||
|
|
"step": 3225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.464030504226685,
|
||
|
|
"epoch": 0.20767697550311837,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00011943793198507858,
|
||
|
|
"loss": 5.1875,
|
||
|
|
"mean_token_accuracy": 0.20668047815561294,
|
||
|
|
"num_tokens": 7783640.0,
|
||
|
|
"step": 3230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.47445330619812,
|
||
|
|
"epoch": 0.2079984568893461,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00011858891111320104,
|
||
|
|
"loss": 5.2462,
|
||
|
|
"mean_token_accuracy": 0.1984443560242653,
|
||
|
|
"num_tokens": 7795068.0,
|
||
|
|
"step": 3235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.451669836044312,
|
||
|
|
"epoch": 0.20831993827557385,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 0.0001177441783303359,
|
||
|
|
"loss": 5.293,
|
||
|
|
"mean_token_accuracy": 0.18701696395874023,
|
||
|
|
"num_tokens": 7806635.0,
|
||
|
|
"step": 3240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.397342824935913,
|
||
|
|
"epoch": 0.20864141966180158,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00011690375679525896,
|
||
|
|
"loss": 5.1662,
|
||
|
|
"mean_token_accuracy": 0.20416541397571564,
|
||
|
|
"num_tokens": 7818941.0,
|
||
|
|
"step": 3245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.424210691452027,
|
||
|
|
"epoch": 0.2089629010480293,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.00011606766954855124,
|
||
|
|
"loss": 5.2533,
|
||
|
|
"mean_token_accuracy": 0.2030928760766983,
|
||
|
|
"num_tokens": 7830147.0,
|
||
|
|
"step": 3250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.422340250015258,
|
||
|
|
"epoch": 0.20928438243425707,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 0.00011523593951196702,
|
||
|
|
"loss": 5.2194,
|
||
|
|
"mean_token_accuracy": 0.19935172647237778,
|
||
|
|
"num_tokens": 7842400.0,
|
||
|
|
"step": 3255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.431458187103272,
|
||
|
|
"epoch": 0.2096058638204848,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00011440858948780523,
|
||
|
|
"loss": 5.2657,
|
||
|
|
"mean_token_accuracy": 0.20139424949884416,
|
||
|
|
"num_tokens": 7853305.0,
|
||
|
|
"step": 3260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.48256778717041,
|
||
|
|
"epoch": 0.20992734520671252,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 0.00011358564215828484,
|
||
|
|
"loss": 5.2738,
|
||
|
|
"mean_token_accuracy": 0.19783631712198257,
|
||
|
|
"num_tokens": 7865386.0,
|
||
|
|
"step": 3265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.466767454147339,
|
||
|
|
"epoch": 0.21024882659294028,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00011276712008492254,
|
||
|
|
"loss": 5.2809,
|
||
|
|
"mean_token_accuracy": 0.1959988608956337,
|
||
|
|
"num_tokens": 7876211.0,
|
||
|
|
"step": 3270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.492114400863647,
|
||
|
|
"epoch": 0.210570307979168,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 0.00011195304570791451,
|
||
|
|
"loss": 5.3006,
|
||
|
|
"mean_token_accuracy": 0.19473039209842682,
|
||
|
|
"num_tokens": 7888120.0,
|
||
|
|
"step": 3275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.500993871688843,
|
||
|
|
"epoch": 0.21089178936539574,
|
||
|
|
"grad_norm": 0.93359375,
|
||
|
|
"learning_rate": 0.00011114344134552094,
|
||
|
|
"loss": 5.2838,
|
||
|
|
"mean_token_accuracy": 0.1949907973408699,
|
||
|
|
"num_tokens": 7900238.0,
|
||
|
|
"step": 3280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5408600807189945,
|
||
|
|
"epoch": 0.2112132707516235,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0001103383291934545,
|
||
|
|
"loss": 5.288,
|
||
|
|
"mean_token_accuracy": 0.2017856866121292,
|
||
|
|
"num_tokens": 7911703.0,
|
||
|
|
"step": 3285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.496693801879883,
|
||
|
|
"epoch": 0.21153475213785122,
|
||
|
|
"grad_norm": 0.9375,
|
||
|
|
"learning_rate": 0.00010953773132427141,
|
||
|
|
"loss": 5.3144,
|
||
|
|
"mean_token_accuracy": 0.19685059487819673,
|
||
|
|
"num_tokens": 7923388.0,
|
||
|
|
"step": 3290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.42819356918335,
|
||
|
|
"epoch": 0.21185623352407895,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00010874166968676677,
|
||
|
|
"loss": 5.2241,
|
||
|
|
"mean_token_accuracy": 0.2002215251326561,
|
||
|
|
"num_tokens": 7933935.0,
|
||
|
|
"step": 3295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.477627182006836,
|
||
|
|
"epoch": 0.21217771491030668,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00010795016610537251,
|
||
|
|
"loss": 5.3301,
|
||
|
|
"mean_token_accuracy": 0.19559485465288162,
|
||
|
|
"num_tokens": 7945858.0,
|
||
|
|
"step": 3300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.486404800415039,
|
||
|
|
"epoch": 0.21249919629653444,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00010716324227955904,
|
||
|
|
"loss": 5.3321,
|
||
|
|
"mean_token_accuracy": 0.19866175800561905,
|
||
|
|
"num_tokens": 7957358.0,
|
||
|
|
"step": 3305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.510744285583496,
|
||
|
|
"epoch": 0.21282067768276217,
|
||
|
|
"grad_norm": 0.90234375,
|
||
|
|
"learning_rate": 0.0001063809197832406,
|
||
|
|
"loss": 5.3138,
|
||
|
|
"mean_token_accuracy": 0.19266012012958528,
|
||
|
|
"num_tokens": 7971167.0,
|
||
|
|
"step": 3310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.505078935623169,
|
||
|
|
"epoch": 0.2131421590689899,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00010560322006418368,
|
||
|
|
"loss": 5.2874,
|
||
|
|
"mean_token_accuracy": 0.1954144701361656,
|
||
|
|
"num_tokens": 7982605.0,
|
||
|
|
"step": 3315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.434276437759399,
|
||
|
|
"epoch": 0.21346364045521765,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00010483016444341887,
|
||
|
|
"loss": 5.2547,
|
||
|
|
"mean_token_accuracy": 0.20593397468328475,
|
||
|
|
"num_tokens": 7994261.0,
|
||
|
|
"step": 3320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.516788196563721,
|
||
|
|
"epoch": 0.21378512184144538,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00010406177411465654,
|
||
|
|
"loss": 5.3316,
|
||
|
|
"mean_token_accuracy": 0.19923045784235,
|
||
|
|
"num_tokens": 8006372.0,
|
||
|
|
"step": 3325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.52082142829895,
|
||
|
|
"epoch": 0.2141066032276731,
|
||
|
|
"grad_norm": 0.89453125,
|
||
|
|
"learning_rate": 0.00010329807014370562,
|
||
|
|
"loss": 5.2872,
|
||
|
|
"mean_token_accuracy": 0.1983992800116539,
|
||
|
|
"num_tokens": 8019307.0,
|
||
|
|
"step": 3330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5175800800323485,
|
||
|
|
"epoch": 0.21442808461390087,
|
||
|
|
"grad_norm": 0.953125,
|
||
|
|
"learning_rate": 0.00010253907346789632,
|
||
|
|
"loss": 5.2578,
|
||
|
|
"mean_token_accuracy": 0.19190946519374846,
|
||
|
|
"num_tokens": 8030790.0,
|
||
|
|
"step": 3335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.478224611282348,
|
||
|
|
"epoch": 0.2147495660001286,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00010178480489550596,
|
||
|
|
"loss": 5.3404,
|
||
|
|
"mean_token_accuracy": 0.19843607395887375,
|
||
|
|
"num_tokens": 8041907.0,
|
||
|
|
"step": 3340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.457638168334961,
|
||
|
|
"epoch": 0.21507104738635632,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00010103528510518836,
|
||
|
|
"loss": 5.2312,
|
||
|
|
"mean_token_accuracy": 0.20871246606111526,
|
||
|
|
"num_tokens": 8054704.0,
|
||
|
|
"step": 3345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.49135012626648,
|
||
|
|
"epoch": 0.21539252877258408,
|
||
|
|
"grad_norm": 0.9296875,
|
||
|
|
"learning_rate": 0.0001002905346454073,
|
||
|
|
"loss": 5.3577,
|
||
|
|
"mean_token_accuracy": 0.18614790141582488,
|
||
|
|
"num_tokens": 8068688.0,
|
||
|
|
"step": 3350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.544287586212159,
|
||
|
|
"epoch": 0.2157140101588118,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 9.955057393387285e-05,
|
||
|
|
"loss": 5.2903,
|
||
|
|
"mean_token_accuracy": 0.1966574490070343,
|
||
|
|
"num_tokens": 8080907.0,
|
||
|
|
"step": 3355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.515115594863891,
|
||
|
|
"epoch": 0.21603549154503954,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 9.88154232569816e-05,
|
||
|
|
"loss": 5.2539,
|
||
|
|
"mean_token_accuracy": 0.20255785435438156,
|
||
|
|
"num_tokens": 8093811.0,
|
||
|
|
"step": 3360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.477157163619995,
|
||
|
|
"epoch": 0.21635697293126727,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 9.808510276926075e-05,
|
||
|
|
"loss": 5.2934,
|
||
|
|
"mean_token_accuracy": 0.1975797325372696,
|
||
|
|
"num_tokens": 8105319.0,
|
||
|
|
"step": 3365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.409259366989136,
|
||
|
|
"epoch": 0.21667845431749502,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 9.735963249281549e-05,
|
||
|
|
"loss": 5.2656,
|
||
|
|
"mean_token_accuracy": 0.1965710386633873,
|
||
|
|
"num_tokens": 8116808.0,
|
||
|
|
"step": 3370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.521623754501343,
|
||
|
|
"epoch": 0.21699993570372275,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 9.663903231677974e-05,
|
||
|
|
"loss": 5.3035,
|
||
|
|
"mean_token_accuracy": 0.19653253257274628,
|
||
|
|
"num_tokens": 8127679.0,
|
||
|
|
"step": 3375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.430962419509887,
|
||
|
|
"epoch": 0.21732141708995048,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 9.592332199677145e-05,
|
||
|
|
"loss": 5.2222,
|
||
|
|
"mean_token_accuracy": 0.20152106136083603,
|
||
|
|
"num_tokens": 8139504.0,
|
||
|
|
"step": 3380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.47936487197876,
|
||
|
|
"epoch": 0.21764289847617824,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 9.521252115435061e-05,
|
||
|
|
"loss": 5.3877,
|
||
|
|
"mean_token_accuracy": 0.19171006381511688,
|
||
|
|
"num_tokens": 8151817.0,
|
||
|
|
"step": 3385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.528270483016968,
|
||
|
|
"epoch": 0.21796437986240597,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 9.450664927648126e-05,
|
||
|
|
"loss": 5.3189,
|
||
|
|
"mean_token_accuracy": 0.19624026268720626,
|
||
|
|
"num_tokens": 8164495.0,
|
||
|
|
"step": 3390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.482377910614014,
|
||
|
|
"epoch": 0.2182858612486337,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 9.380572571499758e-05,
|
||
|
|
"loss": 5.1758,
|
||
|
|
"mean_token_accuracy": 0.2058483451604843,
|
||
|
|
"num_tokens": 8176135.0,
|
||
|
|
"step": 3395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.535102224349975,
|
||
|
|
"epoch": 0.21860734263486145,
|
||
|
|
"grad_norm": 0.90234375,
|
||
|
|
"learning_rate": 9.310976968607307e-05,
|
||
|
|
"loss": 5.3587,
|
||
|
|
"mean_token_accuracy": 0.1898955687880516,
|
||
|
|
"num_tokens": 8188042.0,
|
||
|
|
"step": 3400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.474212646484375,
|
||
|
|
"epoch": 0.21892882402108918,
|
||
|
|
"grad_norm": 0.91015625,
|
||
|
|
"learning_rate": 9.241880026969381e-05,
|
||
|
|
"loss": 5.244,
|
||
|
|
"mean_token_accuracy": 0.1993577554821968,
|
||
|
|
"num_tokens": 8200448.0,
|
||
|
|
"step": 3405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.477056455612183,
|
||
|
|
"epoch": 0.2192503054073169,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 9.173283640913537e-05,
|
||
|
|
"loss": 5.2872,
|
||
|
|
"mean_token_accuracy": 0.19192899018526077,
|
||
|
|
"num_tokens": 8212485.0,
|
||
|
|
"step": 3410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.454643630981446,
|
||
|
|
"epoch": 0.21957178679354467,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 9.10518969104436e-05,
|
||
|
|
"loss": 5.2418,
|
||
|
|
"mean_token_accuracy": 0.20126388669013978,
|
||
|
|
"num_tokens": 8224265.0,
|
||
|
|
"step": 3415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.490573787689209,
|
||
|
|
"epoch": 0.2198932681797724,
|
||
|
|
"grad_norm": 0.98046875,
|
||
|
|
"learning_rate": 9.037600044191868e-05,
|
||
|
|
"loss": 5.2704,
|
||
|
|
"mean_token_accuracy": 0.19903221130371093,
|
||
|
|
"num_tokens": 8236843.0,
|
||
|
|
"step": 3420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.554587411880493,
|
||
|
|
"epoch": 0.22021474956600012,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 8.970516553360383e-05,
|
||
|
|
"loss": 5.3719,
|
||
|
|
"mean_token_accuracy": 0.198140449821949,
|
||
|
|
"num_tokens": 8248003.0,
|
||
|
|
"step": 3425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.496385669708252,
|
||
|
|
"epoch": 0.22053623095222788,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 8.903941057677692e-05,
|
||
|
|
"loss": 5.2527,
|
||
|
|
"mean_token_accuracy": 0.20009055286645888,
|
||
|
|
"num_tokens": 8261204.0,
|
||
|
|
"step": 3430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.422682285308838,
|
||
|
|
"epoch": 0.2208577123384556,
|
||
|
|
"grad_norm": 0.921875,
|
||
|
|
"learning_rate": 8.837875382344635e-05,
|
||
|
|
"loss": 5.0874,
|
||
|
|
"mean_token_accuracy": 0.20741898864507674,
|
||
|
|
"num_tokens": 8272638.0,
|
||
|
|
"step": 3435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.414108419418335,
|
||
|
|
"epoch": 0.22117919372468334,
|
||
|
|
"grad_norm": 0.8984375,
|
||
|
|
"learning_rate": 8.772321338585076e-05,
|
||
|
|
"loss": 5.1522,
|
||
|
|
"mean_token_accuracy": 0.2065318912267685,
|
||
|
|
"num_tokens": 8284667.0,
|
||
|
|
"step": 3440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.45392484664917,
|
||
|
|
"epoch": 0.22150067511091107,
|
||
|
|
"grad_norm": 0.94140625,
|
||
|
|
"learning_rate": 8.707280723596242e-05,
|
||
|
|
"loss": 5.3468,
|
||
|
|
"mean_token_accuracy": 0.19762711524963378,
|
||
|
|
"num_tokens": 8297345.0,
|
||
|
|
"step": 3445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.412027168273926,
|
||
|
|
"epoch": 0.22182215649713882,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 8.64275532049944e-05,
|
||
|
|
"loss": 5.2085,
|
||
|
|
"mean_token_accuracy": 0.20252636224031448,
|
||
|
|
"num_tokens": 8307630.0,
|
||
|
|
"step": 3450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.553789281845093,
|
||
|
|
"epoch": 0.22214363788336655,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 8.578746898291198e-05,
|
||
|
|
"loss": 5.337,
|
||
|
|
"mean_token_accuracy": 0.193049792945385,
|
||
|
|
"num_tokens": 8318876.0,
|
||
|
|
"step": 3455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.408725070953369,
|
||
|
|
"epoch": 0.22246511926959428,
|
||
|
|
"grad_norm": 0.98828125,
|
||
|
|
"learning_rate": 8.515257211794742e-05,
|
||
|
|
"loss": 5.1892,
|
||
|
|
"mean_token_accuracy": 0.20368766337633132,
|
||
|
|
"num_tokens": 8331338.0,
|
||
|
|
"step": 3460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.479277563095093,
|
||
|
|
"epoch": 0.22278660065582204,
|
||
|
|
"grad_norm": 0.8828125,
|
||
|
|
"learning_rate": 8.452288001611896e-05,
|
||
|
|
"loss": 5.2534,
|
||
|
|
"mean_token_accuracy": 0.20291202068328856,
|
||
|
|
"num_tokens": 8344429.0,
|
||
|
|
"step": 3465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.393316745758057,
|
||
|
|
"epoch": 0.22310808204204977,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 8.389840994075379e-05,
|
||
|
|
"loss": 5.228,
|
||
|
|
"mean_token_accuracy": 0.20085124671459198,
|
||
|
|
"num_tokens": 8356170.0,
|
||
|
|
"step": 3470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.5489006519317625,
|
||
|
|
"epoch": 0.2234295634282775,
|
||
|
|
"grad_norm": 0.96875,
|
||
|
|
"learning_rate": 8.327917901201435e-05,
|
||
|
|
"loss": 5.3576,
|
||
|
|
"mean_token_accuracy": 0.19037888199090958,
|
||
|
|
"num_tokens": 8368349.0,
|
||
|
|
"step": 3475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.439195537567139,
|
||
|
|
"epoch": 0.22375104481450525,
|
||
|
|
"grad_norm": 0.9921875,
|
||
|
|
"learning_rate": 8.266520420642931e-05,
|
||
|
|
"loss": 5.1908,
|
||
|
|
"mean_token_accuracy": 0.21016787886619567,
|
||
|
|
"num_tokens": 8379372.0,
|
||
|
|
"step": 3480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.483846139907837,
|
||
|
|
"epoch": 0.22407252620073298,
|
||
|
|
"grad_norm": 0.9765625,
|
||
|
|
"learning_rate": 8.205650235642828e-05,
|
||
|
|
"loss": 5.2104,
|
||
|
|
"mean_token_accuracy": 0.20541305989027023,
|
||
|
|
"num_tokens": 8391137.0,
|
||
|
|
"step": 3485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.507030582427978,
|
||
|
|
"epoch": 0.2243940075869607,
|
||
|
|
"grad_norm": 0.9609375,
|
||
|
|
"learning_rate": 8.145309014987978e-05,
|
||
|
|
"loss": 5.2691,
|
||
|
|
"mean_token_accuracy": 0.1972100168466568,
|
||
|
|
"num_tokens": 8403052.0,
|
||
|
|
"step": 3490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.369836902618408,
|
||
|
|
"epoch": 0.22471548897318847,
|
||
|
|
"grad_norm": 1.0,
|
||
|
|
"learning_rate": 8.085498412963437e-05,
|
||
|
|
"loss": 5.1566,
|
||
|
|
"mean_token_accuracy": 0.2019127532839775,
|
||
|
|
"num_tokens": 8414679.0,
|
||
|
|
"step": 3495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 5.4916956424713135,
|
||
|
|
"epoch": 0.2250369703594162,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 8.026220069307078e-05,
|
||
|
|
"loss": 5.3165,
|
||
|
|
"mean_token_accuracy": 0.19869666695594787,
|
||
|
|
"num_tokens": 8427874.0,
|
||
|
|
"step": 3500
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 5,
|
||
|
|
"max_steps": 4000,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 1,
|
||
|
|
"save_steps": 500,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 1.2848390608896e+16,
|
||
|
|
"train_batch_size": 16,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|