7035 lines
191 KiB
JSON
7035 lines
191 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.2066481667355494,
|
|
"eval_steps": 500,
|
|
"global_step": 3500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.691952991485596,
|
|
"epoch": 0.00029521166676507054,
|
|
"grad_norm": 13.5,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8063,
|
|
"mean_token_accuracy": 0.00022093121660873293,
|
|
"num_tokens": 9044.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691949939727783,
|
|
"epoch": 0.0005904233335301411,
|
|
"grad_norm": 12.3125,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7746,
|
|
"mean_token_accuracy": 0.00021052630618214607,
|
|
"num_tokens": 20049.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.691005229949951,
|
|
"epoch": 0.0008856350002952116,
|
|
"grad_norm": 10.5,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.5243,
|
|
"mean_token_accuracy": 0.02576384658459574,
|
|
"num_tokens": 30441.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.681586647033692,
|
|
"epoch": 0.0011808466670602822,
|
|
"grad_norm": 6.03125,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.1811,
|
|
"mean_token_accuracy": 0.04208611287176609,
|
|
"num_tokens": 41245.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.640601921081544,
|
|
"epoch": 0.0014760583338253527,
|
|
"grad_norm": 4.0625,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.9191,
|
|
"mean_token_accuracy": 0.041578793339431284,
|
|
"num_tokens": 51815.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.59462308883667,
|
|
"epoch": 0.0017712700005904232,
|
|
"grad_norm": 3.203125,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.7236,
|
|
"mean_token_accuracy": 0.046854367852211,
|
|
"num_tokens": 62291.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.566697216033935,
|
|
"epoch": 0.002066481667355494,
|
|
"grad_norm": 2.765625,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.6479,
|
|
"mean_token_accuracy": 0.04647400453686714,
|
|
"num_tokens": 72859.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.56708059310913,
|
|
"epoch": 0.0023616933341205643,
|
|
"grad_norm": 2.609375,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.6398,
|
|
"mean_token_accuracy": 0.04794426709413528,
|
|
"num_tokens": 83349.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.572033309936524,
|
|
"epoch": 0.002656905000885635,
|
|
"grad_norm": 2.46875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.6101,
|
|
"mean_token_accuracy": 0.04311534278094768,
|
|
"num_tokens": 93550.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.580781936645508,
|
|
"epoch": 0.0029521166676507054,
|
|
"grad_norm": 2.375,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.5518,
|
|
"mean_token_accuracy": 0.0487774446606636,
|
|
"num_tokens": 104354.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.563411712646484,
|
|
"epoch": 0.003247328334415776,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.4688,
|
|
"mean_token_accuracy": 0.05522352792322636,
|
|
"num_tokens": 114901.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.49093132019043,
|
|
"epoch": 0.0035425400011808465,
|
|
"grad_norm": 2.453125,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.3461,
|
|
"mean_token_accuracy": 0.05991581827402115,
|
|
"num_tokens": 125378.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.3884859085083,
|
|
"epoch": 0.0038377516679459172,
|
|
"grad_norm": 2.28125,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.2938,
|
|
"mean_token_accuracy": 0.05960136093199253,
|
|
"num_tokens": 136074.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.436979675292969,
|
|
"epoch": 0.004132963334710988,
|
|
"grad_norm": 2.21875,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.1677,
|
|
"mean_token_accuracy": 0.06536128893494605,
|
|
"num_tokens": 147517.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.378404426574708,
|
|
"epoch": 0.004428175001476058,
|
|
"grad_norm": 2.34375,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.0427,
|
|
"mean_token_accuracy": 0.07047605030238628,
|
|
"num_tokens": 158398.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.407978820800782,
|
|
"epoch": 0.004723386668241129,
|
|
"grad_norm": 2.359375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 8.9631,
|
|
"mean_token_accuracy": 0.07082438990473747,
|
|
"num_tokens": 168721.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.277961730957031,
|
|
"epoch": 0.0050185983350062,
|
|
"grad_norm": 2.453125,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.9505,
|
|
"mean_token_accuracy": 0.06753718703985215,
|
|
"num_tokens": 179053.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.263121604919434,
|
|
"epoch": 0.00531381000177127,
|
|
"grad_norm": 2.1875,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.81,
|
|
"mean_token_accuracy": 0.06845465488731861,
|
|
"num_tokens": 189377.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.137414455413818,
|
|
"epoch": 0.0056090216685363405,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.6659,
|
|
"mean_token_accuracy": 0.08077330142259598,
|
|
"num_tokens": 199316.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.143539524078369,
|
|
"epoch": 0.005904233335301411,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.5703,
|
|
"mean_token_accuracy": 0.07332179993391037,
|
|
"num_tokens": 209735.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.063137626647949,
|
|
"epoch": 0.006199445002066482,
|
|
"grad_norm": 1.9296875,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.5061,
|
|
"mean_token_accuracy": 0.07544220425188541,
|
|
"num_tokens": 220153.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.078357124328614,
|
|
"epoch": 0.006494656668831552,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.4012,
|
|
"mean_token_accuracy": 0.07546676695346832,
|
|
"num_tokens": 231226.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.911471176147462,
|
|
"epoch": 0.006789868335596623,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.2365,
|
|
"mean_token_accuracy": 0.07300828918814659,
|
|
"num_tokens": 241715.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.870896339416504,
|
|
"epoch": 0.007085080002361693,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.122,
|
|
"mean_token_accuracy": 0.07934067547321319,
|
|
"num_tokens": 253683.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.708064746856689,
|
|
"epoch": 0.007380291669126764,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 7.9982,
|
|
"mean_token_accuracy": 0.07759345918893815,
|
|
"num_tokens": 262863.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.583840370178223,
|
|
"epoch": 0.0076755033358918345,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.9066,
|
|
"mean_token_accuracy": 0.07621643394231796,
|
|
"num_tokens": 273237.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.455964183807373,
|
|
"epoch": 0.007970715002656906,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.8192,
|
|
"mean_token_accuracy": 0.0756739940494299,
|
|
"num_tokens": 283772.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.128956699371338,
|
|
"epoch": 0.008265926669421976,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.686,
|
|
"mean_token_accuracy": 0.08342597484588624,
|
|
"num_tokens": 294776.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 8.970587921142577,
|
|
"epoch": 0.008561138336187046,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.6361,
|
|
"mean_token_accuracy": 0.07761476486921311,
|
|
"num_tokens": 305244.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.766981601715088,
|
|
"epoch": 0.008856350002952117,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.5218,
|
|
"mean_token_accuracy": 0.08236418589949608,
|
|
"num_tokens": 315175.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.568089389801026,
|
|
"epoch": 0.009151561669717187,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.444,
|
|
"mean_token_accuracy": 0.07824666872620582,
|
|
"num_tokens": 326648.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.377489757537841,
|
|
"epoch": 0.009446773336482257,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.4133,
|
|
"mean_token_accuracy": 0.07897001653909683,
|
|
"num_tokens": 336905.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.255996799468994,
|
|
"epoch": 0.009741985003247328,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.3357,
|
|
"mean_token_accuracy": 0.08415433838963508,
|
|
"num_tokens": 348163.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.156648921966553,
|
|
"epoch": 0.0100371966700124,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.3681,
|
|
"mean_token_accuracy": 0.08406007140874863,
|
|
"num_tokens": 359420.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.059180402755738,
|
|
"epoch": 0.01033240833677747,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.2938,
|
|
"mean_token_accuracy": 0.08481760621070862,
|
|
"num_tokens": 369712.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 7.922717761993408,
|
|
"epoch": 0.01062762000354254,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.2317,
|
|
"mean_token_accuracy": 0.08849364891648293,
|
|
"num_tokens": 380413.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.878174924850464,
|
|
"epoch": 0.01092283167030761,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.2576,
|
|
"mean_token_accuracy": 0.08616138696670532,
|
|
"num_tokens": 391428.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.907813787460327,
|
|
"epoch": 0.011218043337072681,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.1902,
|
|
"mean_token_accuracy": 0.08708868958055974,
|
|
"num_tokens": 402383.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.741433143615723,
|
|
"epoch": 0.011513255003837751,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.2219,
|
|
"mean_token_accuracy": 0.08469741642475129,
|
|
"num_tokens": 412692.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.7598718166351315,
|
|
"epoch": 0.011808466670602822,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.1954,
|
|
"mean_token_accuracy": 0.08851397931575775,
|
|
"num_tokens": 423175.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.6599428176879885,
|
|
"epoch": 0.012103678337367892,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.164,
|
|
"mean_token_accuracy": 0.08638672009110451,
|
|
"num_tokens": 433076.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.721544361114502,
|
|
"epoch": 0.012398890004132964,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.1491,
|
|
"mean_token_accuracy": 0.08772207424044609,
|
|
"num_tokens": 443338.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.719466781616211,
|
|
"epoch": 0.012694101670898034,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.0918,
|
|
"mean_token_accuracy": 0.08484251573681831,
|
|
"num_tokens": 453674.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.642396736145019,
|
|
"epoch": 0.012989313337663105,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.112,
|
|
"mean_token_accuracy": 0.0881990872323513,
|
|
"num_tokens": 464660.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.623027515411377,
|
|
"epoch": 0.013284525004428175,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.135,
|
|
"mean_token_accuracy": 0.08962138071656227,
|
|
"num_tokens": 475478.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.573812961578369,
|
|
"epoch": 0.013579736671193245,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.0507,
|
|
"mean_token_accuracy": 0.0912325844168663,
|
|
"num_tokens": 486279.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.559884262084961,
|
|
"epoch": 0.013874948337958316,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.1265,
|
|
"mean_token_accuracy": 0.08900480046868324,
|
|
"num_tokens": 497947.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.493877267837524,
|
|
"epoch": 0.014170160004723386,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 6.948,
|
|
"mean_token_accuracy": 0.09850702658295632,
|
|
"num_tokens": 508492.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.5359265327453615,
|
|
"epoch": 0.014465371671488458,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.034,
|
|
"mean_token_accuracy": 0.09341262727975845,
|
|
"num_tokens": 519231.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.547327709197998,
|
|
"epoch": 0.014760583338253528,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.0388,
|
|
"mean_token_accuracy": 0.08856186792254447,
|
|
"num_tokens": 529936.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.387069749832153,
|
|
"epoch": 0.015055795005018599,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.0339,
|
|
"mean_token_accuracy": 0.09349972456693649,
|
|
"num_tokens": 540315.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.444060134887695,
|
|
"epoch": 0.015351006671783669,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 6.9648,
|
|
"mean_token_accuracy": 0.097850751131773,
|
|
"num_tokens": 551587.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.412183332443237,
|
|
"epoch": 0.01564621833854874,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000132,
|
|
"loss": 6.9316,
|
|
"mean_token_accuracy": 0.09379192665219308,
|
|
"num_tokens": 561857.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.429265975952148,
|
|
"epoch": 0.01594143000531381,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 6.9717,
|
|
"mean_token_accuracy": 0.09063394144177436,
|
|
"num_tokens": 571784.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.434524583816528,
|
|
"epoch": 0.01623664167207888,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.0056,
|
|
"mean_token_accuracy": 0.09408731907606124,
|
|
"num_tokens": 583475.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.450810766220092,
|
|
"epoch": 0.016531853338843952,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.9856,
|
|
"mean_token_accuracy": 0.08944389000535011,
|
|
"num_tokens": 594752.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.2732994556427,
|
|
"epoch": 0.016827065005609022,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.9268,
|
|
"mean_token_accuracy": 0.09354007542133332,
|
|
"num_tokens": 604459.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.404242277145386,
|
|
"epoch": 0.017122276672374093,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.9605,
|
|
"mean_token_accuracy": 0.09190556928515434,
|
|
"num_tokens": 615477.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.318359518051148,
|
|
"epoch": 0.017417488339139163,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000147,
|
|
"loss": 6.9085,
|
|
"mean_token_accuracy": 0.09038040712475777,
|
|
"num_tokens": 626527.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.3704808235168455,
|
|
"epoch": 0.017712700005904233,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.9326,
|
|
"mean_token_accuracy": 0.08688042685389519,
|
|
"num_tokens": 638236.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.292983913421631,
|
|
"epoch": 0.018007911672669304,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.9029,
|
|
"mean_token_accuracy": 0.0930778980255127,
|
|
"num_tokens": 648836.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.261309051513672,
|
|
"epoch": 0.018303123339434374,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.8546,
|
|
"mean_token_accuracy": 0.09702132865786553,
|
|
"num_tokens": 659610.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.29406886100769,
|
|
"epoch": 0.018598335006199444,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.9224,
|
|
"mean_token_accuracy": 0.0894104540348053,
|
|
"num_tokens": 671423.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.343613338470459,
|
|
"epoch": 0.018893546672964515,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.8996,
|
|
"mean_token_accuracy": 0.08960375934839249,
|
|
"num_tokens": 682645.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.207725191116333,
|
|
"epoch": 0.019188758339729585,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.8131,
|
|
"mean_token_accuracy": 0.09437809884548187,
|
|
"num_tokens": 692315.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.3380321025848385,
|
|
"epoch": 0.019483970006494655,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.8965,
|
|
"mean_token_accuracy": 0.09695785492658615,
|
|
"num_tokens": 702973.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.216346549987793,
|
|
"epoch": 0.019779181673259726,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.8629,
|
|
"mean_token_accuracy": 0.0920400932431221,
|
|
"num_tokens": 713787.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.180256462097168,
|
|
"epoch": 0.0200743933400248,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.7804,
|
|
"mean_token_accuracy": 0.09937777146697044,
|
|
"num_tokens": 725357.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.094199705123901,
|
|
"epoch": 0.02036960500678987,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.7488,
|
|
"mean_token_accuracy": 0.10237349718809127,
|
|
"num_tokens": 735003.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.314488554000855,
|
|
"epoch": 0.02066481667355494,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.8222,
|
|
"mean_token_accuracy": 0.09937268868088722,
|
|
"num_tokens": 747278.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.053475475311279,
|
|
"epoch": 0.02096002834032001,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.8199,
|
|
"mean_token_accuracy": 0.0992422841489315,
|
|
"num_tokens": 757974.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.2850106716156,
|
|
"epoch": 0.02125524000708508,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.8103,
|
|
"mean_token_accuracy": 0.09952985718846322,
|
|
"num_tokens": 767584.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.131100606918335,
|
|
"epoch": 0.02155045167385015,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.7109,
|
|
"mean_token_accuracy": 0.09645930156111718,
|
|
"num_tokens": 777397.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.148231458663941,
|
|
"epoch": 0.02184566334061522,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.7905,
|
|
"mean_token_accuracy": 0.09331258609890938,
|
|
"num_tokens": 788227.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.114551830291748,
|
|
"epoch": 0.02214087500738029,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.7458,
|
|
"mean_token_accuracy": 0.09811887294054031,
|
|
"num_tokens": 799168.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.097161912918091,
|
|
"epoch": 0.022436086674145362,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.7355,
|
|
"mean_token_accuracy": 0.10040534660220146,
|
|
"num_tokens": 810199.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.139192867279053,
|
|
"epoch": 0.022731298340910432,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.7409,
|
|
"mean_token_accuracy": 0.09671718701720237,
|
|
"num_tokens": 822391.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.088096618652344,
|
|
"epoch": 0.023026510007675503,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.8565,
|
|
"mean_token_accuracy": 0.09625174552202224,
|
|
"num_tokens": 834350.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.0904669761657715,
|
|
"epoch": 0.023321721674440573,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.7523,
|
|
"mean_token_accuracy": 0.09790571630001069,
|
|
"num_tokens": 845709.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 6.981272554397583,
|
|
"epoch": 0.023616933341205643,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.7085,
|
|
"mean_token_accuracy": 0.10158270671963691,
|
|
"num_tokens": 855092.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.02293906211853,
|
|
"epoch": 0.023912145007970714,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.7193,
|
|
"mean_token_accuracy": 0.08962539583444595,
|
|
"num_tokens": 865943.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.03565149307251,
|
|
"epoch": 0.024207356674735784,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.647,
|
|
"mean_token_accuracy": 0.09619486778974533,
|
|
"num_tokens": 876649.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.996511030197143,
|
|
"epoch": 0.024502568341500858,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.6861,
|
|
"mean_token_accuracy": 0.10710784569382667,
|
|
"num_tokens": 886221.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.017127513885498,
|
|
"epoch": 0.024797780008265928,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.7047,
|
|
"mean_token_accuracy": 0.10007574260234833,
|
|
"num_tokens": 896234.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 6.983069896697998,
|
|
"epoch": 0.025092991675031,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.6479,
|
|
"mean_token_accuracy": 0.09976074621081352,
|
|
"num_tokens": 907198.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.8837158203125,
|
|
"epoch": 0.02538820334179607,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.702,
|
|
"mean_token_accuracy": 0.10629369989037514,
|
|
"num_tokens": 917579.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.978274822235107,
|
|
"epoch": 0.02568341500856114,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.6347,
|
|
"mean_token_accuracy": 0.10065946727991104,
|
|
"num_tokens": 928763.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.867664194107055,
|
|
"epoch": 0.02597862667532621,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.6455,
|
|
"mean_token_accuracy": 0.1076437845826149,
|
|
"num_tokens": 939383.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.063400411605835,
|
|
"epoch": 0.02627383834209128,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.7118,
|
|
"mean_token_accuracy": 0.09779355004429817,
|
|
"num_tokens": 949967.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.977987289428711,
|
|
"epoch": 0.02656905000885635,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.7177,
|
|
"mean_token_accuracy": 0.09856124073266984,
|
|
"num_tokens": 960438.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.9721705436706545,
|
|
"epoch": 0.02686426167562142,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.678,
|
|
"mean_token_accuracy": 0.1020229034125805,
|
|
"num_tokens": 971771.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.0487203121185305,
|
|
"epoch": 0.02715947334238649,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.7437,
|
|
"mean_token_accuracy": 0.09785925075411797,
|
|
"num_tokens": 982431.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.8306797504425045,
|
|
"epoch": 0.02745468500915156,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.69,
|
|
"mean_token_accuracy": 0.09700809046626091,
|
|
"num_tokens": 992763.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.909020566940308,
|
|
"epoch": 0.02774989667591663,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.6022,
|
|
"mean_token_accuracy": 0.107904601842165,
|
|
"num_tokens": 1002977.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.922635841369629,
|
|
"epoch": 0.0280451083426817,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.6653,
|
|
"mean_token_accuracy": 0.10020340532064438,
|
|
"num_tokens": 1014211.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.923598337173462,
|
|
"epoch": 0.028340320009446772,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.6715,
|
|
"mean_token_accuracy": 0.10355789959430695,
|
|
"num_tokens": 1025625.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.909690856933594,
|
|
"epoch": 0.028635531676211842,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.686,
|
|
"mean_token_accuracy": 0.10261352136731147,
|
|
"num_tokens": 1036430.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.986854982376099,
|
|
"epoch": 0.028930743342976916,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.7083,
|
|
"mean_token_accuracy": 0.10415773317217827,
|
|
"num_tokens": 1047246.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.8165546417236325,
|
|
"epoch": 0.029225955009741986,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.5998,
|
|
"mean_token_accuracy": 0.10099067613482475,
|
|
"num_tokens": 1057004.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.876231527328491,
|
|
"epoch": 0.029521166676507057,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.6397,
|
|
"mean_token_accuracy": 0.1102587789297104,
|
|
"num_tokens": 1067224.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 6.866609764099121,
|
|
"epoch": 0.029816378343272127,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.6158,
|
|
"mean_token_accuracy": 0.1031361848115921,
|
|
"num_tokens": 1077523.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 6.851018238067627,
|
|
"epoch": 0.030111590010037197,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.5845,
|
|
"mean_token_accuracy": 0.1057098388671875,
|
|
"num_tokens": 1088591.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.780634880065918,
|
|
"epoch": 0.030406801676802268,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.6068,
|
|
"mean_token_accuracy": 0.10300912559032441,
|
|
"num_tokens": 1100634.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.772457027435303,
|
|
"epoch": 0.030702013343567338,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.5604,
|
|
"mean_token_accuracy": 0.10456541404128075,
|
|
"num_tokens": 1111231.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 6.864635372161866,
|
|
"epoch": 0.03099722501033241,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.5368,
|
|
"mean_token_accuracy": 0.11013480946421624,
|
|
"num_tokens": 1121112.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.817177820205688,
|
|
"epoch": 0.03129243667709748,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.6807,
|
|
"mean_token_accuracy": 0.10330734625458718,
|
|
"num_tokens": 1130803.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.852666234970092,
|
|
"epoch": 0.03158764834386255,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.6568,
|
|
"mean_token_accuracy": 0.09623496234416962,
|
|
"num_tokens": 1141621.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.851540040969849,
|
|
"epoch": 0.03188286001062762,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.6752,
|
|
"mean_token_accuracy": 0.10156160518527031,
|
|
"num_tokens": 1152860.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.910813045501709,
|
|
"epoch": 0.03217807167739269,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.5423,
|
|
"mean_token_accuracy": 0.10722377449274063,
|
|
"num_tokens": 1162958.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.7858928680419925,
|
|
"epoch": 0.03247328334415776,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.6395,
|
|
"mean_token_accuracy": 0.10390800461173058,
|
|
"num_tokens": 1174205.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.813560676574707,
|
|
"epoch": 0.032768495010922834,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.5218,
|
|
"mean_token_accuracy": 0.10657795593142509,
|
|
"num_tokens": 1184336.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.759924650192261,
|
|
"epoch": 0.033063706677687904,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.5285,
|
|
"mean_token_accuracy": 0.11047871261835099,
|
|
"num_tokens": 1194696.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 6.675027894973755,
|
|
"epoch": 0.033358918344452974,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.4689,
|
|
"mean_token_accuracy": 0.10344288945198059,
|
|
"num_tokens": 1206440.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.843683671951294,
|
|
"epoch": 0.033654130011218045,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.545,
|
|
"mean_token_accuracy": 0.10641451999545097,
|
|
"num_tokens": 1216229.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.739560270309449,
|
|
"epoch": 0.033949341677983115,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.6295,
|
|
"mean_token_accuracy": 0.1049153484404087,
|
|
"num_tokens": 1228077.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.755360412597656,
|
|
"epoch": 0.034244553344748185,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.6024,
|
|
"mean_token_accuracy": 0.10700471252202988,
|
|
"num_tokens": 1239047.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 6.835167455673218,
|
|
"epoch": 0.034539765011513256,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.5143,
|
|
"mean_token_accuracy": 0.11052370145916939,
|
|
"num_tokens": 1249633.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.736393117904663,
|
|
"epoch": 0.034834976678278326,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.5858,
|
|
"mean_token_accuracy": 0.10385486260056495,
|
|
"num_tokens": 1261085.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.705540657043457,
|
|
"epoch": 0.035130188345043396,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.4767,
|
|
"mean_token_accuracy": 0.11535756587982178,
|
|
"num_tokens": 1271161.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.711465167999267,
|
|
"epoch": 0.03542540001180847,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.5664,
|
|
"mean_token_accuracy": 0.1055572934448719,
|
|
"num_tokens": 1281776.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.741065502166748,
|
|
"epoch": 0.03572061167857354,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.5441,
|
|
"mean_token_accuracy": 0.10771351680159569,
|
|
"num_tokens": 1291759.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.709814834594726,
|
|
"epoch": 0.03601582334533861,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.4237,
|
|
"mean_token_accuracy": 0.1066345103085041,
|
|
"num_tokens": 1301783.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.701594305038452,
|
|
"epoch": 0.03631103501210368,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.5523,
|
|
"mean_token_accuracy": 0.10823088437318802,
|
|
"num_tokens": 1312442.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.710081911087036,
|
|
"epoch": 0.03660624667886875,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.5222,
|
|
"mean_token_accuracy": 0.11155530214309692,
|
|
"num_tokens": 1321787.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.720113277435303,
|
|
"epoch": 0.03690145834563382,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.522,
|
|
"mean_token_accuracy": 0.10557924285531044,
|
|
"num_tokens": 1331724.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.668059158325195,
|
|
"epoch": 0.03719667001239889,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.5261,
|
|
"mean_token_accuracy": 0.10685517415404319,
|
|
"num_tokens": 1342272.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.737295341491699,
|
|
"epoch": 0.03749188167916396,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.5756,
|
|
"mean_token_accuracy": 0.10473631396889686,
|
|
"num_tokens": 1352806.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.6583808898925785,
|
|
"epoch": 0.03778709334592903,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.4683,
|
|
"mean_token_accuracy": 0.10982004255056381,
|
|
"num_tokens": 1363668.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.669088649749756,
|
|
"epoch": 0.0380823050126941,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.5768,
|
|
"mean_token_accuracy": 0.10401294007897377,
|
|
"num_tokens": 1376374.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.727249479293823,
|
|
"epoch": 0.03837751667945917,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.5341,
|
|
"mean_token_accuracy": 0.10710064172744752,
|
|
"num_tokens": 1387332.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.656798219680786,
|
|
"epoch": 0.03867272834622424,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.4362,
|
|
"mean_token_accuracy": 0.103745087236166,
|
|
"num_tokens": 1398761.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.517245817184448,
|
|
"epoch": 0.03896794001298931,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.4851,
|
|
"mean_token_accuracy": 0.11338173747062683,
|
|
"num_tokens": 1409818.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.730355882644654,
|
|
"epoch": 0.03926315167975438,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.504,
|
|
"mean_token_accuracy": 0.10808097869157791,
|
|
"num_tokens": 1420839.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.628807258605957,
|
|
"epoch": 0.03955836334651945,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.5066,
|
|
"mean_token_accuracy": 0.10702955350279808,
|
|
"num_tokens": 1434314.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.578580474853515,
|
|
"epoch": 0.03985357501328453,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.4204,
|
|
"mean_token_accuracy": 0.11155755072832108,
|
|
"num_tokens": 1445404.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.606809616088867,
|
|
"epoch": 0.0401487866800496,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.555,
|
|
"mean_token_accuracy": 0.11048336997628212,
|
|
"num_tokens": 1456860.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.589565467834473,
|
|
"epoch": 0.04044399834681467,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.4932,
|
|
"mean_token_accuracy": 0.11120514348149299,
|
|
"num_tokens": 1467597.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.696408987045288,
|
|
"epoch": 0.04073921001357974,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.4581,
|
|
"mean_token_accuracy": 0.11563440561294555,
|
|
"num_tokens": 1478093.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.656173992156982,
|
|
"epoch": 0.04103442168034481,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.5137,
|
|
"mean_token_accuracy": 0.11482275947928429,
|
|
"num_tokens": 1488527.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.550519704818726,
|
|
"epoch": 0.04132963334710988,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.3829,
|
|
"mean_token_accuracy": 0.11443194523453712,
|
|
"num_tokens": 1499370.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.566233539581299,
|
|
"epoch": 0.04162484501387495,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.4064,
|
|
"mean_token_accuracy": 0.11202551424503326,
|
|
"num_tokens": 1510518.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.535747432708741,
|
|
"epoch": 0.04192005668064002,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.4342,
|
|
"mean_token_accuracy": 0.11363685354590417,
|
|
"num_tokens": 1520791.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.632448720932007,
|
|
"epoch": 0.04221526834740509,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.5126,
|
|
"mean_token_accuracy": 0.10954305157065392,
|
|
"num_tokens": 1532122.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.5457751750946045,
|
|
"epoch": 0.04251048001417016,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.3958,
|
|
"mean_token_accuracy": 0.11548751443624497,
|
|
"num_tokens": 1542719.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.563694810867309,
|
|
"epoch": 0.04280569168093523,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.4559,
|
|
"mean_token_accuracy": 0.11078683212399483,
|
|
"num_tokens": 1553397.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.572269773483276,
|
|
"epoch": 0.0431009033477003,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.4017,
|
|
"mean_token_accuracy": 0.11554159820079804,
|
|
"num_tokens": 1563952.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.650298690795898,
|
|
"epoch": 0.04339611501446537,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.4341,
|
|
"mean_token_accuracy": 0.11468867510557175,
|
|
"num_tokens": 1574248.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.517534494400024,
|
|
"epoch": 0.04369132668123044,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.4001,
|
|
"mean_token_accuracy": 0.11306158527731895,
|
|
"num_tokens": 1584325.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.510380697250366,
|
|
"epoch": 0.04398653834799551,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.3622,
|
|
"mean_token_accuracy": 0.1204331710934639,
|
|
"num_tokens": 1593737.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.5366417407989506,
|
|
"epoch": 0.04428175001476058,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.42,
|
|
"mean_token_accuracy": 0.11730596050620079,
|
|
"num_tokens": 1604161.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.487906742095947,
|
|
"epoch": 0.044576961681525654,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.3659,
|
|
"mean_token_accuracy": 0.11893260702490807,
|
|
"num_tokens": 1614719.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.4263794898986815,
|
|
"epoch": 0.044872173348290724,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.3783,
|
|
"mean_token_accuracy": 0.11692238673567772,
|
|
"num_tokens": 1626450.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.564861059188843,
|
|
"epoch": 0.045167385015055794,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.444,
|
|
"mean_token_accuracy": 0.10918903425335884,
|
|
"num_tokens": 1638297.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.559746789932251,
|
|
"epoch": 0.045462596681820865,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.4014,
|
|
"mean_token_accuracy": 0.11586136147379875,
|
|
"num_tokens": 1648744.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.450838375091553,
|
|
"epoch": 0.045757808348585935,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.3877,
|
|
"mean_token_accuracy": 0.11436291560530662,
|
|
"num_tokens": 1660291.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.512089347839355,
|
|
"epoch": 0.046053020015351005,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.3968,
|
|
"mean_token_accuracy": 0.12081583142280579,
|
|
"num_tokens": 1670425.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.560306644439697,
|
|
"epoch": 0.046348231682116076,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.3979,
|
|
"mean_token_accuracy": 0.11076491773128509,
|
|
"num_tokens": 1681390.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.450212621688843,
|
|
"epoch": 0.046643443348881146,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.4569,
|
|
"mean_token_accuracy": 0.11279196292161942,
|
|
"num_tokens": 1690856.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.431796646118164,
|
|
"epoch": 0.046938655015646216,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.3975,
|
|
"mean_token_accuracy": 0.11749225705862046,
|
|
"num_tokens": 1701985.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.531089401245117,
|
|
"epoch": 0.04723386668241129,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.33,
|
|
"mean_token_accuracy": 0.1177647665143013,
|
|
"num_tokens": 1713125.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.485761880874634,
|
|
"epoch": 0.04752907834917636,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.4297,
|
|
"mean_token_accuracy": 0.11685430556535721,
|
|
"num_tokens": 1725409.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.4987870216369625,
|
|
"epoch": 0.04782429001594143,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.4797,
|
|
"mean_token_accuracy": 0.11249323934316635,
|
|
"num_tokens": 1736579.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.412155485153198,
|
|
"epoch": 0.0481195016827065,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.3084,
|
|
"mean_token_accuracy": 0.11493954733014107,
|
|
"num_tokens": 1747029.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.421283435821533,
|
|
"epoch": 0.04841471334947157,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.2559,
|
|
"mean_token_accuracy": 0.11367330402135849,
|
|
"num_tokens": 1757444.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.466654539108276,
|
|
"epoch": 0.048709925016236645,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.4014,
|
|
"mean_token_accuracy": 0.11653372645378113,
|
|
"num_tokens": 1767576.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.4442650318145756,
|
|
"epoch": 0.049005136683001715,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.4257,
|
|
"mean_token_accuracy": 0.11447887197136879,
|
|
"num_tokens": 1777714.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.418978452682495,
|
|
"epoch": 0.049300348349766786,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.4399,
|
|
"mean_token_accuracy": 0.11199806556105614,
|
|
"num_tokens": 1788857.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.483746528625488,
|
|
"epoch": 0.049595560016531856,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.3862,
|
|
"mean_token_accuracy": 0.11579035371541976,
|
|
"num_tokens": 1800743.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.482276964187622,
|
|
"epoch": 0.049890771683296926,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.3287,
|
|
"mean_token_accuracy": 0.11087024435400963,
|
|
"num_tokens": 1810477.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.3517107486724855,
|
|
"epoch": 0.050185983350062,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.3575,
|
|
"mean_token_accuracy": 0.11524266377091408,
|
|
"num_tokens": 1821516.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.587709379196167,
|
|
"epoch": 0.05048119501682707,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.4653,
|
|
"mean_token_accuracy": 0.11049215123057365,
|
|
"num_tokens": 1832784.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.34732494354248,
|
|
"epoch": 0.05077640668359214,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.2728,
|
|
"mean_token_accuracy": 0.1179530993103981,
|
|
"num_tokens": 1843737.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.438384008407593,
|
|
"epoch": 0.05107161835035721,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.3462,
|
|
"mean_token_accuracy": 0.12044489830732345,
|
|
"num_tokens": 1854215.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.3278967380523685,
|
|
"epoch": 0.05136683001712228,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.3059,
|
|
"mean_token_accuracy": 0.1170185461640358,
|
|
"num_tokens": 1864813.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.467825937271118,
|
|
"epoch": 0.05166204168388735,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.364,
|
|
"mean_token_accuracy": 0.11428075954318047,
|
|
"num_tokens": 1874962.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.507443571090699,
|
|
"epoch": 0.05195725335065242,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.4321,
|
|
"mean_token_accuracy": 0.1131198450922966,
|
|
"num_tokens": 1886476.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.3558813571929935,
|
|
"epoch": 0.05225246501741749,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.3187,
|
|
"mean_token_accuracy": 0.12074669077992439,
|
|
"num_tokens": 1896860.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.31374831199646,
|
|
"epoch": 0.05254767668418256,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.3,
|
|
"mean_token_accuracy": 0.12395407184958458,
|
|
"num_tokens": 1908727.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.462383651733399,
|
|
"epoch": 0.05284288835094763,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.3968,
|
|
"mean_token_accuracy": 0.11613713800907136,
|
|
"num_tokens": 1920175.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.438568925857544,
|
|
"epoch": 0.0531381000177127,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.3363,
|
|
"mean_token_accuracy": 0.12365170270204544,
|
|
"num_tokens": 1930267.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.340644979476929,
|
|
"epoch": 0.05343331168447777,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.3596,
|
|
"mean_token_accuracy": 0.12366607934236526,
|
|
"num_tokens": 1940527.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.441576862335205,
|
|
"epoch": 0.05372852335124284,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.4129,
|
|
"mean_token_accuracy": 0.11123256385326385,
|
|
"num_tokens": 1952557.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.354656839370728,
|
|
"epoch": 0.05402373501800791,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.272,
|
|
"mean_token_accuracy": 0.11737576723098755,
|
|
"num_tokens": 1962858.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.502988862991333,
|
|
"epoch": 0.05431894668477298,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.4562,
|
|
"mean_token_accuracy": 0.10999115817248821,
|
|
"num_tokens": 1974579.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.265300655364991,
|
|
"epoch": 0.05461415835153805,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.2954,
|
|
"mean_token_accuracy": 0.129633379727602,
|
|
"num_tokens": 1984937.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.484027338027954,
|
|
"epoch": 0.05490937001830312,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.3673,
|
|
"mean_token_accuracy": 0.11584793254733086,
|
|
"num_tokens": 1995046.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.3297584533691404,
|
|
"epoch": 0.05520458168506819,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.3379,
|
|
"mean_token_accuracy": 0.12105886042118072,
|
|
"num_tokens": 2006261.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.4803060531616214,
|
|
"epoch": 0.05549979335183326,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.3509,
|
|
"mean_token_accuracy": 0.11742576733231544,
|
|
"num_tokens": 2017470.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.31043176651001,
|
|
"epoch": 0.05579500501859833,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.3327,
|
|
"mean_token_accuracy": 0.12294093891978264,
|
|
"num_tokens": 2028104.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.356010007858276,
|
|
"epoch": 0.0560902166853634,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.3971,
|
|
"mean_token_accuracy": 0.11537264212965966,
|
|
"num_tokens": 2039347.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.297523021697998,
|
|
"epoch": 0.056385428352128474,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.2869,
|
|
"mean_token_accuracy": 0.11124283596873283,
|
|
"num_tokens": 2050464.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.3561155796051025,
|
|
"epoch": 0.056680640018893544,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.2763,
|
|
"mean_token_accuracy": 0.12250063344836234,
|
|
"num_tokens": 2061554.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.351288223266602,
|
|
"epoch": 0.056975851685658614,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.3241,
|
|
"mean_token_accuracy": 0.11924508661031723,
|
|
"num_tokens": 2072217.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.317080402374268,
|
|
"epoch": 0.057271063352423685,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.2585,
|
|
"mean_token_accuracy": 0.12346376478672028,
|
|
"num_tokens": 2082088.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.334501934051514,
|
|
"epoch": 0.05756627501918876,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.333,
|
|
"mean_token_accuracy": 0.11622191295027733,
|
|
"num_tokens": 2091959.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.329196119308472,
|
|
"epoch": 0.05786148668595383,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.2826,
|
|
"mean_token_accuracy": 0.12484293133020401,
|
|
"num_tokens": 2102907.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.299886989593506,
|
|
"epoch": 0.0581566983527189,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.3273,
|
|
"mean_token_accuracy": 0.1229906715452671,
|
|
"num_tokens": 2112818.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.340411424636841,
|
|
"epoch": 0.05845191001948397,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.2827,
|
|
"mean_token_accuracy": 0.12152156233787537,
|
|
"num_tokens": 2122847.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.255873918533325,
|
|
"epoch": 0.05874712168624904,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.2182,
|
|
"mean_token_accuracy": 0.12108674049377441,
|
|
"num_tokens": 2133317.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.304410934448242,
|
|
"epoch": 0.05904233335301411,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.3561,
|
|
"mean_token_accuracy": 0.11512539386749268,
|
|
"num_tokens": 2144568.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.3178955078125,
|
|
"epoch": 0.059337545019779184,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000499998026082006,
|
|
"loss": 6.2824,
|
|
"mean_token_accuracy": 0.123703832924366,
|
|
"num_tokens": 2154869.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.275319528579712,
|
|
"epoch": 0.059632756686544254,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999900070995136,
|
|
"loss": 6.2407,
|
|
"mean_token_accuracy": 0.12574376314878463,
|
|
"num_tokens": 2165543.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.303437566757202,
|
|
"epoch": 0.059927968353309324,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999758199023239,
|
|
"loss": 6.2772,
|
|
"mean_token_accuracy": 0.12176102846860885,
|
|
"num_tokens": 2175873.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.239206266403198,
|
|
"epoch": 0.060223180020074395,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004999554648793858,
|
|
"loss": 6.308,
|
|
"mean_token_accuracy": 0.1178464025259018,
|
|
"num_tokens": 2187968.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.357020711898803,
|
|
"epoch": 0.060518391686839465,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004999289425887425,
|
|
"loss": 6.306,
|
|
"mean_token_accuracy": 0.1196315847337246,
|
|
"num_tokens": 2199153.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.238584899902344,
|
|
"epoch": 0.060813603353604535,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004998962537575161,
|
|
"loss": 6.2466,
|
|
"mean_token_accuracy": 0.12366516292095184,
|
|
"num_tokens": 2210069.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.265579509735107,
|
|
"epoch": 0.061108815020369606,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004998573992818874,
|
|
"loss": 6.239,
|
|
"mean_token_accuracy": 0.1157471477985382,
|
|
"num_tokens": 2221635.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.212556266784668,
|
|
"epoch": 0.061404026687134676,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004998123802270715,
|
|
"loss": 6.302,
|
|
"mean_token_accuracy": 0.12124627754092217,
|
|
"num_tokens": 2232272.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.408636903762817,
|
|
"epoch": 0.061699238353899746,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004997611978272886,
|
|
"loss": 6.3054,
|
|
"mean_token_accuracy": 0.12193002700805664,
|
|
"num_tokens": 2243504.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.175132989883423,
|
|
"epoch": 0.06199445002066482,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997038534857298,
|
|
"loss": 6.227,
|
|
"mean_token_accuracy": 0.11970143839716911,
|
|
"num_tokens": 2253774.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.274414110183716,
|
|
"epoch": 0.06228966168742989,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004996403487745194,
|
|
"loss": 6.2259,
|
|
"mean_token_accuracy": 0.11766009405255318,
|
|
"num_tokens": 2264408.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.266839647293091,
|
|
"epoch": 0.06258487335419496,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000499570685434671,
|
|
"loss": 6.1665,
|
|
"mean_token_accuracy": 0.12115408554673195,
|
|
"num_tokens": 2274361.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.235118722915649,
|
|
"epoch": 0.06288008502096003,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004994948653760405,
|
|
"loss": 6.2513,
|
|
"mean_token_accuracy": 0.12207862734794617,
|
|
"num_tokens": 2284811.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.306531000137329,
|
|
"epoch": 0.0631752966877251,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004994128906772729,
|
|
"loss": 6.2779,
|
|
"mean_token_accuracy": 0.11769364327192307,
|
|
"num_tokens": 2295548.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.2641833305358885,
|
|
"epoch": 0.06347050835449017,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.000499324763585746,
|
|
"loss": 6.2362,
|
|
"mean_token_accuracy": 0.12173673734068871,
|
|
"num_tokens": 2306185.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.290108299255371,
|
|
"epoch": 0.06376572002125525,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004992304865175085,
|
|
"loss": 6.2358,
|
|
"mean_token_accuracy": 0.12764014080166816,
|
|
"num_tokens": 2317057.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.204243850708008,
|
|
"epoch": 0.06406093168802031,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004991300620572138,
|
|
"loss": 6.2425,
|
|
"mean_token_accuracy": 0.12284323722124099,
|
|
"num_tokens": 2327066.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.2375068187713625,
|
|
"epoch": 0.06435614335478539,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004990234929580494,
|
|
"loss": 6.1871,
|
|
"mean_token_accuracy": 0.1312653213739395,
|
|
"num_tokens": 2337920.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 6.235481595993042,
|
|
"epoch": 0.06465135502155045,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004989107821416609,
|
|
"loss": 6.179,
|
|
"mean_token_accuracy": 0.12998321577906607,
|
|
"num_tokens": 2348234.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.154482316970825,
|
|
"epoch": 0.06494656668831553,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004987919326980723,
|
|
"loss": 6.2029,
|
|
"mean_token_accuracy": 0.12362807467579842,
|
|
"num_tokens": 2359112.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.2241229057312015,
|
|
"epoch": 0.06524177835508059,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.0004986669478856011,
|
|
"loss": 6.1887,
|
|
"mean_token_accuracy": 0.1307649426162243,
|
|
"num_tokens": 2370207.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.182603406906128,
|
|
"epoch": 0.06553699002184567,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004985358311307688,
|
|
"loss": 6.2972,
|
|
"mean_token_accuracy": 0.1216890573501587,
|
|
"num_tokens": 2381892.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.266233348846436,
|
|
"epoch": 0.06583220168861073,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004983985860282081,
|
|
"loss": 6.1947,
|
|
"mean_token_accuracy": 0.12289397418498993,
|
|
"num_tokens": 2391898.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.2191582202911375,
|
|
"epoch": 0.06612741335537581,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004982552163405623,
|
|
"loss": 6.225,
|
|
"mean_token_accuracy": 0.12616347894072533,
|
|
"num_tokens": 2402864.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.184364604949951,
|
|
"epoch": 0.06642262502214087,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004981057259983839,
|
|
"loss": 6.2268,
|
|
"mean_token_accuracy": 0.12599567249417304,
|
|
"num_tokens": 2413550.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.317190837860108,
|
|
"epoch": 0.06671783668890595,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004979501191000262,
|
|
"loss": 6.2299,
|
|
"mean_token_accuracy": 0.12873752564191818,
|
|
"num_tokens": 2423614.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.164299440383911,
|
|
"epoch": 0.06701304835567101,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004977883999115311,
|
|
"loss": 6.2196,
|
|
"mean_token_accuracy": 0.12582850828766823,
|
|
"num_tokens": 2434825.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.226464891433716,
|
|
"epoch": 0.06730826002243609,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004976205728665113,
|
|
"loss": 6.2104,
|
|
"mean_token_accuracy": 0.1259925462305546,
|
|
"num_tokens": 2447062.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 6.243313789367676,
|
|
"epoch": 0.06760347168920115,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004974466425660307,
|
|
"loss": 6.2953,
|
|
"mean_token_accuracy": 0.11829956993460655,
|
|
"num_tokens": 2458795.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.175207901000976,
|
|
"epoch": 0.06789868335596623,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004972666137784759,
|
|
"loss": 6.2034,
|
|
"mean_token_accuracy": 0.11987875550985336,
|
|
"num_tokens": 2468563.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.222134208679199,
|
|
"epoch": 0.0681938950227313,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004970804914394271,
|
|
"loss": 6.2674,
|
|
"mean_token_accuracy": 0.12158862352371216,
|
|
"num_tokens": 2479407.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.2589446067810055,
|
|
"epoch": 0.06848910668949637,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004968882806515225,
|
|
"loss": 6.1892,
|
|
"mean_token_accuracy": 0.11877380311489105,
|
|
"num_tokens": 2491790.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.106157493591309,
|
|
"epoch": 0.06878431835626143,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004966899866843177,
|
|
"loss": 6.1038,
|
|
"mean_token_accuracy": 0.13081091716885568,
|
|
"num_tokens": 2501006.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.112197923660278,
|
|
"epoch": 0.06907953002302651,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000496485614974142,
|
|
"loss": 6.0207,
|
|
"mean_token_accuracy": 0.14026050567626952,
|
|
"num_tokens": 2510831.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.15854549407959,
|
|
"epoch": 0.06937474168979157,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004962751711239492,
|
|
"loss": 6.2307,
|
|
"mean_token_accuracy": 0.1229746699333191,
|
|
"num_tokens": 2522270.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.273019552230835,
|
|
"epoch": 0.06966995335655665,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004960586609031636,
|
|
"loss": 6.2534,
|
|
"mean_token_accuracy": 0.13002387955784797,
|
|
"num_tokens": 2532997.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.171327447891235,
|
|
"epoch": 0.06996516502332172,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004958360902475224,
|
|
"loss": 6.2381,
|
|
"mean_token_accuracy": 0.12486061081290245,
|
|
"num_tokens": 2543717.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.239405155181885,
|
|
"epoch": 0.07026037669008679,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004956074652589125,
|
|
"loss": 6.1521,
|
|
"mean_token_accuracy": 0.12982202172279358,
|
|
"num_tokens": 2554538.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.090667629241944,
|
|
"epoch": 0.07055558835685186,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004953727922052035,
|
|
"loss": 6.1565,
|
|
"mean_token_accuracy": 0.12723496705293655,
|
|
"num_tokens": 2564891.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.208614540100098,
|
|
"epoch": 0.07085080002361693,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004951320775200756,
|
|
"loss": 6.1242,
|
|
"mean_token_accuracy": 0.1281391814351082,
|
|
"num_tokens": 2575883.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.09900484085083,
|
|
"epoch": 0.07114601169038201,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004948853278028436,
|
|
"loss": 6.1945,
|
|
"mean_token_accuracy": 0.12702925950288774,
|
|
"num_tokens": 2588125.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.176623964309693,
|
|
"epoch": 0.07144122335714707,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004946325498182755,
|
|
"loss": 6.1666,
|
|
"mean_token_accuracy": 0.12884261831641197,
|
|
"num_tokens": 2598389.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 6.238792133331299,
|
|
"epoch": 0.07173643502391215,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004943737504964076,
|
|
"loss": 6.2851,
|
|
"mean_token_accuracy": 0.12441871240735054,
|
|
"num_tokens": 2609797.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 6.220934152603149,
|
|
"epoch": 0.07203164669067721,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000494108936932354,
|
|
"loss": 6.2374,
|
|
"mean_token_accuracy": 0.1285350039601326,
|
|
"num_tokens": 2622106.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.068195247650147,
|
|
"epoch": 0.07232685835744229,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004938381163861124,
|
|
"loss": 5.9866,
|
|
"mean_token_accuracy": 0.13788015022873878,
|
|
"num_tokens": 2632278.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.202727603912353,
|
|
"epoch": 0.07262207002420736,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004935612962823645,
|
|
"loss": 6.1787,
|
|
"mean_token_accuracy": 0.12711300998926162,
|
|
"num_tokens": 2642145.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.107152271270752,
|
|
"epoch": 0.07291728169097243,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004932784842102739,
|
|
"loss": 6.1096,
|
|
"mean_token_accuracy": 0.13203658685088157,
|
|
"num_tokens": 2653066.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.20755410194397,
|
|
"epoch": 0.0732124933577375,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004929896879232758,
|
|
"loss": 6.2229,
|
|
"mean_token_accuracy": 0.13365396112203598,
|
|
"num_tokens": 2662617.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.1612598419189455,
|
|
"epoch": 0.07350770502450257,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004926949153388668,
|
|
"loss": 6.0693,
|
|
"mean_token_accuracy": 0.13576316982507705,
|
|
"num_tokens": 2672968.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.090233898162841,
|
|
"epoch": 0.07380291669126764,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004923941745383859,
|
|
"loss": 6.1326,
|
|
"mean_token_accuracy": 0.12741539999842644,
|
|
"num_tokens": 2683021.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.147735118865967,
|
|
"epoch": 0.07409812835803271,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000492087473766794,
|
|
"loss": 6.1772,
|
|
"mean_token_accuracy": 0.12292596101760864,
|
|
"num_tokens": 2692942.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.074502658843994,
|
|
"epoch": 0.07439334002479778,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000491774821432448,
|
|
"loss": 6.0631,
|
|
"mean_token_accuracy": 0.1280621863901615,
|
|
"num_tokens": 2703208.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.130913639068604,
|
|
"epoch": 0.07468855169156285,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004914562261068693,
|
|
"loss": 6.1887,
|
|
"mean_token_accuracy": 0.1308736138045788,
|
|
"num_tokens": 2714535.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.153866815567016,
|
|
"epoch": 0.07498376335832792,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004911316965245098,
|
|
"loss": 6.1732,
|
|
"mean_token_accuracy": 0.12706683427095414,
|
|
"num_tokens": 2725646.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.082538604736328,
|
|
"epoch": 0.075278975025093,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000490801241582512,
|
|
"loss": 6.0147,
|
|
"mean_token_accuracy": 0.14108175337314605,
|
|
"num_tokens": 2734884.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.047293281555175,
|
|
"epoch": 0.07557418669185806,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.000490464870340465,
|
|
"loss": 6.1083,
|
|
"mean_token_accuracy": 0.12774249389767647,
|
|
"num_tokens": 2745254.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.279677200317383,
|
|
"epoch": 0.07586939835862314,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004901225920201563,
|
|
"loss": 6.2694,
|
|
"mean_token_accuracy": 0.1227074109017849,
|
|
"num_tokens": 2756299.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.141456747055054,
|
|
"epoch": 0.0761646100253882,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.000489774416005319,
|
|
"loss": 6.092,
|
|
"mean_token_accuracy": 0.1252087853848934,
|
|
"num_tokens": 2766796.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.08054838180542,
|
|
"epoch": 0.07645982169215328,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004894203518413742,
|
|
"loss": 6.1348,
|
|
"mean_token_accuracy": 0.1298709914088249,
|
|
"num_tokens": 2778542.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 6.206808567047119,
|
|
"epoch": 0.07675503335891834,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004890604092351701,
|
|
"loss": 6.1068,
|
|
"mean_token_accuracy": 0.1335411436855793,
|
|
"num_tokens": 2789065.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 6.104327201843262,
|
|
"epoch": 0.07705024502568342,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000488694598054715,
|
|
"loss": 6.1255,
|
|
"mean_token_accuracy": 0.1259346254169941,
|
|
"num_tokens": 2800217.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 6.1008704662322994,
|
|
"epoch": 0.07734545669244848,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004883229283289071,
|
|
"loss": 6.1793,
|
|
"mean_token_accuracy": 0.1286480575799942,
|
|
"num_tokens": 2810770.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.196523761749267,
|
|
"epoch": 0.07764066835921356,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048794541024725993,
|
|
"loss": 6.1347,
|
|
"mean_token_accuracy": 0.13080908134579658,
|
|
"num_tokens": 2821912.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.083820390701294,
|
|
"epoch": 0.07793588002597862,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004875620541596221,
|
|
"loss": 6.1511,
|
|
"mean_token_accuracy": 0.13275840133428574,
|
|
"num_tokens": 2832023.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.151384973526001,
|
|
"epoch": 0.0782310916927437,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00048717287057589454,
|
|
"loss": 6.0937,
|
|
"mean_token_accuracy": 0.1350390985608101,
|
|
"num_tokens": 2843568.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 6.052801275253296,
|
|
"epoch": 0.07852630335950876,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004867778701657417,
|
|
"loss": 6.0963,
|
|
"mean_token_accuracy": 0.12285801768302917,
|
|
"num_tokens": 2854135.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.16489896774292,
|
|
"epoch": 0.07882151502627384,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048637706375829955,
|
|
"loss": 6.1121,
|
|
"mean_token_accuracy": 0.1272979386150837,
|
|
"num_tokens": 2865359.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 6.000171232223511,
|
|
"epoch": 0.0791167266930389,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000485970462341878,
|
|
"loss": 6.0949,
|
|
"mean_token_accuracy": 0.12831125780940056,
|
|
"num_tokens": 2876417.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.137427186965942,
|
|
"epoch": 0.07941193835980398,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048555807706366044,
|
|
"loss": 6.1143,
|
|
"mean_token_accuracy": 0.13167017474770545,
|
|
"num_tokens": 2886893.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.134990930557251,
|
|
"epoch": 0.07970715002656906,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00048513991922939756,
|
|
"loss": 6.1247,
|
|
"mean_token_accuracy": 0.12959954217076303,
|
|
"num_tokens": 2897020.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 6.113159084320069,
|
|
"epoch": 0.08000236169333412,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00048471600030309744,
|
|
"loss": 6.0958,
|
|
"mean_token_accuracy": 0.12387151196599007,
|
|
"num_tokens": 2907587.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.174454307556152,
|
|
"epoch": 0.0802975733600992,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048428633190671186,
|
|
"loss": 6.1923,
|
|
"mean_token_accuracy": 0.12944753468036652,
|
|
"num_tokens": 2918571.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.268069934844971,
|
|
"epoch": 0.08059278502686426,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004838509258198167,
|
|
"loss": 6.1705,
|
|
"mean_token_accuracy": 0.12942629233002662,
|
|
"num_tokens": 2930114.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 5.925813770294189,
|
|
"epoch": 0.08088799669362934,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048340979397929,
|
|
"loss": 6.0308,
|
|
"mean_token_accuracy": 0.1300771601498127,
|
|
"num_tokens": 2941553.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.137379360198975,
|
|
"epoch": 0.0811832083603944,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048296294847898386,
|
|
"loss": 6.1542,
|
|
"mean_token_accuracy": 0.12957529947161675,
|
|
"num_tokens": 2952973.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.083988285064697,
|
|
"epoch": 0.08147842002715948,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004825104015693934,
|
|
"loss": 6.0894,
|
|
"mean_token_accuracy": 0.12802857980132104,
|
|
"num_tokens": 2963351.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.117639541625977,
|
|
"epoch": 0.08177363169392454,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004820521656573208,
|
|
"loss": 6.1069,
|
|
"mean_token_accuracy": 0.12783970609307288,
|
|
"num_tokens": 2975456.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 6.201921701431274,
|
|
"epoch": 0.08206884336068962,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00048158825330553505,
|
|
"loss": 6.1909,
|
|
"mean_token_accuracy": 0.12405910715460777,
|
|
"num_tokens": 2986454.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.006986284255982,
|
|
"epoch": 0.08236405502745468,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00048111867723242763,
|
|
"loss": 6.0643,
|
|
"mean_token_accuracy": 0.12654304653406143,
|
|
"num_tokens": 2997893.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 6.1468892097473145,
|
|
"epoch": 0.08265926669421976,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004806434503116637,
|
|
"loss": 5.9938,
|
|
"mean_token_accuracy": 0.13587316051125525,
|
|
"num_tokens": 3008866.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 6.054237937927246,
|
|
"epoch": 0.08295447836098482,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004801625855718296,
|
|
"loss": 6.1694,
|
|
"mean_token_accuracy": 0.1326708622276783,
|
|
"num_tokens": 3020017.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 6.010798788070678,
|
|
"epoch": 0.0832496900277499,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00047967609619607477,
|
|
"loss": 5.9746,
|
|
"mean_token_accuracy": 0.13155399784445762,
|
|
"num_tokens": 3030707.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.1784576892852785,
|
|
"epoch": 0.08354490169451496,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004791839955217513,
|
|
"loss": 6.0924,
|
|
"mean_token_accuracy": 0.1290546603500843,
|
|
"num_tokens": 3041305.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.029217767715454,
|
|
"epoch": 0.08384011336128004,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047868629704004786,
|
|
"loss": 6.1692,
|
|
"mean_token_accuracy": 0.1270539216697216,
|
|
"num_tokens": 3052952.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 6.17234206199646,
|
|
"epoch": 0.0841353250280451,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00047818301439561965,
|
|
"loss": 6.0294,
|
|
"mean_token_accuracy": 0.13541628271341324,
|
|
"num_tokens": 3063604.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 5.994857454299927,
|
|
"epoch": 0.08443053669481018,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047767416138621454,
|
|
"loss": 6.106,
|
|
"mean_token_accuracy": 0.13280996158719063,
|
|
"num_tokens": 3074199.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.197816705703735,
|
|
"epoch": 0.08472574836157525,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000477159751962295,
|
|
"loss": 6.0778,
|
|
"mean_token_accuracy": 0.1278144374489784,
|
|
"num_tokens": 3084811.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.100957155227661,
|
|
"epoch": 0.08502096002834032,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00047663980022665507,
|
|
"loss": 6.1508,
|
|
"mean_token_accuracy": 0.13362270593643188,
|
|
"num_tokens": 3095934.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 6.144081687927246,
|
|
"epoch": 0.08531617169510539,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00047611432043403437,
|
|
"loss": 6.0093,
|
|
"mean_token_accuracy": 0.1304073341190815,
|
|
"num_tokens": 3106469.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 6.062932109832763,
|
|
"epoch": 0.08561138336187046,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004755833269907267,
|
|
"loss": 6.2009,
|
|
"mean_token_accuracy": 0.1269908919930458,
|
|
"num_tokens": 3117860.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.200025177001953,
|
|
"epoch": 0.08590659502863553,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004750468344541857,
|
|
"loss": 6.1303,
|
|
"mean_token_accuracy": 0.1287964791059494,
|
|
"num_tokens": 3127983.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 6.026769542694092,
|
|
"epoch": 0.0862018066954006,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00047450485753262525,
|
|
"loss": 6.0796,
|
|
"mean_token_accuracy": 0.13652199730277062,
|
|
"num_tokens": 3138705.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.097449016571045,
|
|
"epoch": 0.08649701836216567,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00047395741108461633,
|
|
"loss": 6.0427,
|
|
"mean_token_accuracy": 0.13442591875791549,
|
|
"num_tokens": 3150079.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 5.980276203155517,
|
|
"epoch": 0.08679223002893074,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00047340451011867985,
|
|
"loss": 6.0421,
|
|
"mean_token_accuracy": 0.13306428194046022,
|
|
"num_tokens": 3160261.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 5.978704452514648,
|
|
"epoch": 0.08708744169569581,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00047284616979287515,
|
|
"loss": 5.9897,
|
|
"mean_token_accuracy": 0.1374903328716755,
|
|
"num_tokens": 3169779.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.020472669601441,
|
|
"epoch": 0.08738265336246089,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047228240541438433,
|
|
"loss": 6.0162,
|
|
"mean_token_accuracy": 0.13789537474513053,
|
|
"num_tokens": 3180400.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 6.140784788131714,
|
|
"epoch": 0.08767786502922595,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00047171323243909257,
|
|
"loss": 6.0684,
|
|
"mean_token_accuracy": 0.13254758790135385,
|
|
"num_tokens": 3191546.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 6.07828917503357,
|
|
"epoch": 0.08797307669599103,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047113866647116457,
|
|
"loss": 6.0377,
|
|
"mean_token_accuracy": 0.13490098640322684,
|
|
"num_tokens": 3202222.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 5.974679851531983,
|
|
"epoch": 0.08826828836275609,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004705587232626164,
|
|
"loss": 6.0031,
|
|
"mean_token_accuracy": 0.13679205402731895,
|
|
"num_tokens": 3212973.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 6.074326848983764,
|
|
"epoch": 0.08856350002952117,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00046997341871288424,
|
|
"loss": 6.0159,
|
|
"mean_token_accuracy": 0.13410410583019255,
|
|
"num_tokens": 3224661.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 6.04751615524292,
|
|
"epoch": 0.08885871169628624,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004693827688683879,
|
|
"loss": 6.1216,
|
|
"mean_token_accuracy": 0.13102777674794197,
|
|
"num_tokens": 3235629.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 6.056356430053711,
|
|
"epoch": 0.08915392336305131,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004687867899220914,
|
|
"loss": 6.0095,
|
|
"mean_token_accuracy": 0.1373201921582222,
|
|
"num_tokens": 3246016.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 5.955541944503784,
|
|
"epoch": 0.08944913502981638,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046818549821305846,
|
|
"loss": 5.9698,
|
|
"mean_token_accuracy": 0.1393904373049736,
|
|
"num_tokens": 3255875.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 6.11029281616211,
|
|
"epoch": 0.08974434669658145,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046757891022600494,
|
|
"loss": 6.0744,
|
|
"mean_token_accuracy": 0.13373544216156005,
|
|
"num_tokens": 3266783.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.076243829727173,
|
|
"epoch": 0.09003955836334653,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004669670425908471,
|
|
"loss": 6.0769,
|
|
"mean_token_accuracy": 0.13891345784068107,
|
|
"num_tokens": 3277949.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 6.02083101272583,
|
|
"epoch": 0.09033477003011159,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004663499120822451,
|
|
"loss": 6.0448,
|
|
"mean_token_accuracy": 0.13696586415171624,
|
|
"num_tokens": 3288225.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 5.9968249797821045,
|
|
"epoch": 0.09062998169687667,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004657275356191437,
|
|
"loss": 5.9192,
|
|
"mean_token_accuracy": 0.1334097608923912,
|
|
"num_tokens": 3298877.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 5.955824184417724,
|
|
"epoch": 0.09092519336364173,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00046509993026430804,
|
|
"loss": 5.9731,
|
|
"mean_token_accuracy": 0.13175629526376725,
|
|
"num_tokens": 3308094.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 6.100501203536988,
|
|
"epoch": 0.0912204050304068,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004644671132238558,
|
|
"loss": 6.0481,
|
|
"mean_token_accuracy": 0.1411367565393448,
|
|
"num_tokens": 3319367.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.0393892288208,
|
|
"epoch": 0.09151561669717187,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00046382910184678585,
|
|
"loss": 5.951,
|
|
"mean_token_accuracy": 0.14005291908979417,
|
|
"num_tokens": 3328807.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 5.946415185928345,
|
|
"epoch": 0.09181082836393695,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004631859136245025,
|
|
"loss": 6.0224,
|
|
"mean_token_accuracy": 0.13421571403741836,
|
|
"num_tokens": 3339377.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 6.116823434829712,
|
|
"epoch": 0.09210604003070201,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004625375661903357,
|
|
"loss": 6.068,
|
|
"mean_token_accuracy": 0.13405861109495162,
|
|
"num_tokens": 3349555.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.04711422920227,
|
|
"epoch": 0.09240125169746709,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00046188407731905787,
|
|
"loss": 6.0327,
|
|
"mean_token_accuracy": 0.1323117010295391,
|
|
"num_tokens": 3360187.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.006165599822998,
|
|
"epoch": 0.09269646336423215,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00046122546492639643,
|
|
"loss": 5.9497,
|
|
"mean_token_accuracy": 0.1417209431529045,
|
|
"num_tokens": 3370702.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.042462253570557,
|
|
"epoch": 0.09299167503099723,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000460561747068543,
|
|
"loss": 6.0761,
|
|
"mean_token_accuracy": 0.12965757995843888,
|
|
"num_tokens": 3381944.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 6.071602487564087,
|
|
"epoch": 0.09328688669776229,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004598929419416578,
|
|
"loss": 5.9718,
|
|
"mean_token_accuracy": 0.13460363522171975,
|
|
"num_tokens": 3392376.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 5.9583460807800295,
|
|
"epoch": 0.09358209836452737,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00045921906788137123,
|
|
"loss": 5.9224,
|
|
"mean_token_accuracy": 0.1380501091480255,
|
|
"num_tokens": 3403048.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 5.977456855773926,
|
|
"epoch": 0.09387731003129243,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00045854014336228115,
|
|
"loss": 6.0307,
|
|
"mean_token_accuracy": 0.12758268117904664,
|
|
"num_tokens": 3413553.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.032625532150268,
|
|
"epoch": 0.09417252169805751,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00045785618699744615,
|
|
"loss": 5.9238,
|
|
"mean_token_accuracy": 0.13623402193188666,
|
|
"num_tokens": 3424295.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 5.985020351409912,
|
|
"epoch": 0.09446773336482257,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045716721753787543,
|
|
"loss": 5.9476,
|
|
"mean_token_accuracy": 0.13396428748965264,
|
|
"num_tokens": 3434449.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 5.971049022674561,
|
|
"epoch": 0.09476294503158765,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004564732538720148,
|
|
"loss": 5.9766,
|
|
"mean_token_accuracy": 0.14037723690271378,
|
|
"num_tokens": 3444601.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 6.03154559135437,
|
|
"epoch": 0.09505815669835271,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00045577431502522877,
|
|
"loss": 5.956,
|
|
"mean_token_accuracy": 0.13928258866071702,
|
|
"num_tokens": 3455052.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 6.047151565551758,
|
|
"epoch": 0.09535336836511779,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004550704201592787,
|
|
"loss": 5.9694,
|
|
"mean_token_accuracy": 0.13797362372279168,
|
|
"num_tokens": 3466129.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.001207876205444,
|
|
"epoch": 0.09564858003188285,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004543615885717981,
|
|
"loss": 6.0408,
|
|
"mean_token_accuracy": 0.13441915214061737,
|
|
"num_tokens": 3476225.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 5.993210792541504,
|
|
"epoch": 0.09594379169864793,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045364783969576296,
|
|
"loss": 5.9967,
|
|
"mean_token_accuracy": 0.13255249112844467,
|
|
"num_tokens": 3487140.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 5.97896409034729,
|
|
"epoch": 0.096239003365413,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004529291930989592,
|
|
"loss": 5.9137,
|
|
"mean_token_accuracy": 0.13355278670787812,
|
|
"num_tokens": 3497725.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 5.922145891189575,
|
|
"epoch": 0.09653421503217807,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004522056684834464,
|
|
"loss": 6.0266,
|
|
"mean_token_accuracy": 0.12917877361178398,
|
|
"num_tokens": 3509360.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.056468343734741,
|
|
"epoch": 0.09682942669894314,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004514772856850173,
|
|
"loss": 5.96,
|
|
"mean_token_accuracy": 0.1380475141108036,
|
|
"num_tokens": 3519919.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 6.010870742797851,
|
|
"epoch": 0.09712463836570821,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004507440646726542,
|
|
"loss": 6.0126,
|
|
"mean_token_accuracy": 0.13415253460407256,
|
|
"num_tokens": 3530277.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 5.949351453781128,
|
|
"epoch": 0.09741985003247329,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004500060255479818,
|
|
"loss": 5.9733,
|
|
"mean_token_accuracy": 0.13921516239643097,
|
|
"num_tokens": 3540641.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 6.150185585021973,
|
|
"epoch": 0.09771506169923835,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004492631885447151,
|
|
"loss": 6.0799,
|
|
"mean_token_accuracy": 0.13410310819745064,
|
|
"num_tokens": 3550069.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 5.998241806030274,
|
|
"epoch": 0.09801027336600343,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044851557402810616,
|
|
"loss": 5.9941,
|
|
"mean_token_accuracy": 0.13666213899850846,
|
|
"num_tokens": 3560980.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 6.000314521789551,
|
|
"epoch": 0.0983054850327685,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044776320249438444,
|
|
"loss": 5.9014,
|
|
"mean_token_accuracy": 0.1379874236881733,
|
|
"num_tokens": 3572352.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 5.864667844772339,
|
|
"epoch": 0.09860069669953357,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044700609457019565,
|
|
"loss": 5.8057,
|
|
"mean_token_accuracy": 0.14547686278820038,
|
|
"num_tokens": 3582414.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 5.913028717041016,
|
|
"epoch": 0.09889590836629863,
|
|
"grad_norm": 0.9296875,
|
|
"learning_rate": 0.0004462442710120359,
|
|
"loss": 5.9267,
|
|
"mean_token_accuracy": 0.1374290555715561,
|
|
"num_tokens": 3593655.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 6.0694255352020265,
|
|
"epoch": 0.09919112003306371,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000445477752705683,
|
|
"loss": 5.976,
|
|
"mean_token_accuracy": 0.14330636113882064,
|
|
"num_tokens": 3603784.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 5.914968252182007,
|
|
"epoch": 0.09948633169982878,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044470656066562336,
|
|
"loss": 5.9023,
|
|
"mean_token_accuracy": 0.1387188106775284,
|
|
"num_tokens": 3613955.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 5.958784723281861,
|
|
"epoch": 0.09978154336659385,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004439307160344765,
|
|
"loss": 5.9596,
|
|
"mean_token_accuracy": 0.13545051887631415,
|
|
"num_tokens": 3624421.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 5.906978559494019,
|
|
"epoch": 0.10007675503335892,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044315024008241473,
|
|
"loss": 5.9132,
|
|
"mean_token_accuracy": 0.14482396841049194,
|
|
"num_tokens": 3633782.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 5.976182460784912,
|
|
"epoch": 0.100371966700124,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004423651542065806,
|
|
"loss": 5.9933,
|
|
"mean_token_accuracy": 0.13364353850483895,
|
|
"num_tokens": 3644560.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 5.938481664657592,
|
|
"epoch": 0.10066717836688906,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.00044157547993050006,
|
|
"loss": 5.9719,
|
|
"mean_token_accuracy": 0.1391169995069504,
|
|
"num_tokens": 3655434.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 6.016226863861084,
|
|
"epoch": 0.10096239003365413,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044078123890349227,
|
|
"loss": 5.8969,
|
|
"mean_token_accuracy": 0.14098571836948395,
|
|
"num_tokens": 3665628.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 5.949463367462158,
|
|
"epoch": 0.1012576017004192,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00043998245290007606,
|
|
"loss": 5.9951,
|
|
"mean_token_accuracy": 0.13202026411890982,
|
|
"num_tokens": 3676483.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 6.087437105178833,
|
|
"epoch": 0.10155281336718427,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043917914381937323,
|
|
"loss": 5.9868,
|
|
"mean_token_accuracy": 0.13543638065457345,
|
|
"num_tokens": 3687299.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 5.952702236175537,
|
|
"epoch": 0.10184802503394934,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00043837133368450815,
|
|
"loss": 5.9212,
|
|
"mean_token_accuracy": 0.1348453126847744,
|
|
"num_tokens": 3698068.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 6.064343881607056,
|
|
"epoch": 0.10214323670071442,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004375590446420037,
|
|
"loss": 5.976,
|
|
"mean_token_accuracy": 0.1393336459994316,
|
|
"num_tokens": 3708004.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 5.993683958053589,
|
|
"epoch": 0.10243844836747948,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004367422989611743,
|
|
"loss": 6.0219,
|
|
"mean_token_accuracy": 0.13565473407506942,
|
|
"num_tokens": 3718845.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 5.993088483810425,
|
|
"epoch": 0.10273366003424456,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004359211190335153,
|
|
"loss": 5.8671,
|
|
"mean_token_accuracy": 0.143757364153862,
|
|
"num_tokens": 3729532.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 5.85788049697876,
|
|
"epoch": 0.10302887170100962,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00043509552737208923,
|
|
"loss": 5.9378,
|
|
"mean_token_accuracy": 0.13778024390339852,
|
|
"num_tokens": 3740596.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.01426477432251,
|
|
"epoch": 0.1033240833677747,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043426554661090853,
|
|
"loss": 5.9339,
|
|
"mean_token_accuracy": 0.1473975345492363,
|
|
"num_tokens": 3751144.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 5.970757246017456,
|
|
"epoch": 0.10361929503453976,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043343119950431516,
|
|
"loss": 5.9217,
|
|
"mean_token_accuracy": 0.14652103036642075,
|
|
"num_tokens": 3762243.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 5.988554239273071,
|
|
"epoch": 0.10391450670130484,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043259250892635644,
|
|
"loss": 5.9527,
|
|
"mean_token_accuracy": 0.13955445364117622,
|
|
"num_tokens": 3772099.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 5.956176042556763,
|
|
"epoch": 0.1042097183680699,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004317494978701582,
|
|
"loss": 5.9312,
|
|
"mean_token_accuracy": 0.1413627102971077,
|
|
"num_tokens": 3782670.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 5.960332298278809,
|
|
"epoch": 0.10450493003483498,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004309021894472943,
|
|
"loss": 5.9411,
|
|
"mean_token_accuracy": 0.14020357206463813,
|
|
"num_tokens": 3792569.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 5.945288133621216,
|
|
"epoch": 0.10480014170160004,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004300506068871534,
|
|
"loss": 5.8895,
|
|
"mean_token_accuracy": 0.14070242494344712,
|
|
"num_tokens": 3802954.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 5.972039985656738,
|
|
"epoch": 0.10509535336836512,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042919477353630135,
|
|
"loss": 5.9133,
|
|
"mean_token_accuracy": 0.13573219552636145,
|
|
"num_tokens": 3813529.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 5.870369863510132,
|
|
"epoch": 0.10539056503513018,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000428334712857842,
|
|
"loss": 5.9186,
|
|
"mean_token_accuracy": 0.1356649711728096,
|
|
"num_tokens": 3823603.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 5.912766456604004,
|
|
"epoch": 0.10568577670189526,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042747044843077304,
|
|
"loss": 5.8746,
|
|
"mean_token_accuracy": 0.14842769429087638,
|
|
"num_tokens": 3833831.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 5.970458984375,
|
|
"epoch": 0.10598098836866032,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042660200394934047,
|
|
"loss": 5.8865,
|
|
"mean_token_accuracy": 0.1426880329847336,
|
|
"num_tokens": 3844282.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 5.995832252502441,
|
|
"epoch": 0.1062762000354254,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042572940322238844,
|
|
"loss": 5.9336,
|
|
"mean_token_accuracy": 0.13592784032225608,
|
|
"num_tokens": 3856018.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.016539716720581,
|
|
"epoch": 0.10657141170219048,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042485267017270664,
|
|
"loss": 5.9671,
|
|
"mean_token_accuracy": 0.13218472227454187,
|
|
"num_tokens": 3867545.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 5.93374195098877,
|
|
"epoch": 0.10686662336895554,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004239718288363745,
|
|
"loss": 5.8434,
|
|
"mean_token_accuracy": 0.1460932120680809,
|
|
"num_tokens": 3878215.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 5.9325737953186035,
|
|
"epoch": 0.10716183503572062,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004230869033621023,
|
|
"loss": 5.9142,
|
|
"mean_token_accuracy": 0.13958162665367127,
|
|
"num_tokens": 3888172.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 5.992139291763306,
|
|
"epoch": 0.10745704670248568,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004221979180105688,
|
|
"loss": 5.991,
|
|
"mean_token_accuracy": 0.13233617097139358,
|
|
"num_tokens": 3899482.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.027761936187744,
|
|
"epoch": 0.10775225836925076,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042130489715375645,
|
|
"loss": 5.9591,
|
|
"mean_token_accuracy": 0.13765794709324836,
|
|
"num_tokens": 3909464.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 5.881091165542602,
|
|
"epoch": 0.10804747003601582,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042040786527428335,
|
|
"loss": 5.8755,
|
|
"mean_token_accuracy": 0.1399849072098732,
|
|
"num_tokens": 3919656.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 5.987238645553589,
|
|
"epoch": 0.1083426817027809,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004195068469647315,
|
|
"loss": 5.935,
|
|
"mean_token_accuracy": 0.1402907982468605,
|
|
"num_tokens": 3930420.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 5.9825396060943605,
|
|
"epoch": 0.10863789336954596,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041860186692697297,
|
|
"loss": 5.9339,
|
|
"mean_token_accuracy": 0.1349881947040558,
|
|
"num_tokens": 3941670.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 5.956534337997437,
|
|
"epoch": 0.10893310503631104,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041769294997149264,
|
|
"loss": 5.9098,
|
|
"mean_token_accuracy": 0.1411547601222992,
|
|
"num_tokens": 3952550.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 5.965771055221557,
|
|
"epoch": 0.1092283167030761,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004167801210167081,
|
|
"loss": 5.9172,
|
|
"mean_token_accuracy": 0.1462905302643776,
|
|
"num_tokens": 3963316.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 5.914458608627319,
|
|
"epoch": 0.10952352836984118,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004158634050882861,
|
|
"loss": 5.9136,
|
|
"mean_token_accuracy": 0.13789980560541154,
|
|
"num_tokens": 3974213.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 5.990167331695557,
|
|
"epoch": 0.10981874003660624,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004149428273184569,
|
|
"loss": 5.8843,
|
|
"mean_token_accuracy": 0.14071305990219116,
|
|
"num_tokens": 3985490.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 5.925612258911133,
|
|
"epoch": 0.11011395170337132,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004140184129453253,
|
|
"loss": 5.9623,
|
|
"mean_token_accuracy": 0.13739006742835044,
|
|
"num_tokens": 3996859.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 5.9599072456359865,
|
|
"epoch": 0.11040916337013638,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000413090187312178,
|
|
"loss": 5.9094,
|
|
"mean_token_accuracy": 0.1436771422624588,
|
|
"num_tokens": 4007177.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 5.916435241699219,
|
|
"epoch": 0.11070437503690146,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004121581758667898,
|
|
"loss": 5.841,
|
|
"mean_token_accuracy": 0.13843855261802673,
|
|
"num_tokens": 4017976.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 5.848360681533814,
|
|
"epoch": 0.11099958670366653,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00041122240416072533,
|
|
"loss": 5.8013,
|
|
"mean_token_accuracy": 0.1479976147413254,
|
|
"num_tokens": 4028925.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 5.91417384147644,
|
|
"epoch": 0.1112947983704316,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004102828978486385,
|
|
"loss": 5.8587,
|
|
"mean_token_accuracy": 0.14406538307666777,
|
|
"num_tokens": 4040458.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 5.935881662368774,
|
|
"epoch": 0.11159001003719667,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004093396826875695,
|
|
"loss": 5.9524,
|
|
"mean_token_accuracy": 0.14116467982530595,
|
|
"num_tokens": 4051787.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 5.996190929412842,
|
|
"epoch": 0.11188522170396174,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.00040839278453623837,
|
|
"loss": 5.9463,
|
|
"mean_token_accuracy": 0.14074928015470506,
|
|
"num_tokens": 4062476.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.024869632720947,
|
|
"epoch": 0.1121804333707268,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004074422293543363,
|
|
"loss": 6.0117,
|
|
"mean_token_accuracy": 0.13238218873739244,
|
|
"num_tokens": 4073843.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 5.916808605194092,
|
|
"epoch": 0.11247564503749188,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004064880432018137,
|
|
"loss": 5.8341,
|
|
"mean_token_accuracy": 0.14415794909000396,
|
|
"num_tokens": 4084102.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 5.880737257003784,
|
|
"epoch": 0.11277085670425695,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00040553025223816615,
|
|
"loss": 5.9033,
|
|
"mean_token_accuracy": 0.14525620341300965,
|
|
"num_tokens": 4094418.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 5.964789915084839,
|
|
"epoch": 0.11306606837102202,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00040456888272171653,
|
|
"loss": 5.885,
|
|
"mean_token_accuracy": 0.14050159752368926,
|
|
"num_tokens": 4105189.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 5.889213705062867,
|
|
"epoch": 0.11336128003778709,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040360396100889577,
|
|
"loss": 5.871,
|
|
"mean_token_accuracy": 0.149219286441803,
|
|
"num_tokens": 4116368.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 5.976749038696289,
|
|
"epoch": 0.11365649170455216,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004026355135535202,
|
|
"loss": 5.8981,
|
|
"mean_token_accuracy": 0.13695148453116418,
|
|
"num_tokens": 4126472.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 5.97646541595459,
|
|
"epoch": 0.11395170337131723,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000401663566906066,
|
|
"loss": 5.8212,
|
|
"mean_token_accuracy": 0.14775698632001877,
|
|
"num_tokens": 4137875.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 5.871037244796753,
|
|
"epoch": 0.1142469150380823,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00040068814771294134,
|
|
"loss": 5.872,
|
|
"mean_token_accuracy": 0.14493257254362107,
|
|
"num_tokens": 4147555.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 5.897066640853882,
|
|
"epoch": 0.11454212670484737,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0003997092827157562,
|
|
"loss": 5.8789,
|
|
"mean_token_accuracy": 0.14204722344875337,
|
|
"num_tokens": 4159469.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 5.976615333557129,
|
|
"epoch": 0.11483733837161245,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000398726998750589,
|
|
"loss": 5.8292,
|
|
"mean_token_accuracy": 0.1409693591296673,
|
|
"num_tokens": 4170049.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 5.792118501663208,
|
|
"epoch": 0.11513255003837752,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00039774132274725076,
|
|
"loss": 5.8178,
|
|
"mean_token_accuracy": 0.14296735152602197,
|
|
"num_tokens": 4180933.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 5.834021520614624,
|
|
"epoch": 0.11542776170514259,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00039675228172854707,
|
|
"loss": 5.8922,
|
|
"mean_token_accuracy": 0.1392677716910839,
|
|
"num_tokens": 4191883.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.045830583572387,
|
|
"epoch": 0.11572297337190766,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003957599028095371,
|
|
"loss": 5.9612,
|
|
"mean_token_accuracy": 0.1446747064590454,
|
|
"num_tokens": 4202265.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 5.915384101867676,
|
|
"epoch": 0.11601818503867273,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00039476421319679017,
|
|
"loss": 5.8879,
|
|
"mean_token_accuracy": 0.13635574281215668,
|
|
"num_tokens": 4212760.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.001104831695557,
|
|
"epoch": 0.1163133967054378,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00039376524018764,
|
|
"loss": 5.9018,
|
|
"mean_token_accuracy": 0.14595609679818153,
|
|
"num_tokens": 4222739.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 5.93096809387207,
|
|
"epoch": 0.11660860837220287,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00039276301116943616,
|
|
"loss": 5.8194,
|
|
"mean_token_accuracy": 0.1551318235695362,
|
|
"num_tokens": 4232886.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.026076221466065,
|
|
"epoch": 0.11690382003896795,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003917575536187936,
|
|
"loss": 6.0242,
|
|
"mean_token_accuracy": 0.13150568827986717,
|
|
"num_tokens": 4243196.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 5.901855039596557,
|
|
"epoch": 0.11719903170573301,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039074889510083894,
|
|
"loss": 5.8645,
|
|
"mean_token_accuracy": 0.14477338045835494,
|
|
"num_tokens": 4254301.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 5.965902423858642,
|
|
"epoch": 0.11749424337249809,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00038973706326845495,
|
|
"loss": 5.9498,
|
|
"mean_token_accuracy": 0.13250884115695954,
|
|
"num_tokens": 4264233.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 5.929144954681396,
|
|
"epoch": 0.11778945503926315,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003887220858615225,
|
|
"loss": 5.8727,
|
|
"mean_token_accuracy": 0.14213800951838493,
|
|
"num_tokens": 4274865.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 5.892509651184082,
|
|
"epoch": 0.11808466670602823,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003877039907061597,
|
|
"loss": 5.833,
|
|
"mean_token_accuracy": 0.14505684971809388,
|
|
"num_tokens": 4285138.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 5.966263294219971,
|
|
"epoch": 0.11837987837279329,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003866828057139598,
|
|
"loss": 5.899,
|
|
"mean_token_accuracy": 0.14154433310031891,
|
|
"num_tokens": 4294984.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 5.949433088302612,
|
|
"epoch": 0.11867509003955837,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00038565855888122503,
|
|
"loss": 5.7642,
|
|
"mean_token_accuracy": 0.1523885101079941,
|
|
"num_tokens": 4305417.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 5.817267990112304,
|
|
"epoch": 0.11897030170632343,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00038463127828819975,
|
|
"loss": 5.7833,
|
|
"mean_token_accuracy": 0.14343267902731896,
|
|
"num_tokens": 4316510.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 5.896286296844482,
|
|
"epoch": 0.11926551337308851,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00038360099209830043,
|
|
"loss": 5.8286,
|
|
"mean_token_accuracy": 0.1433262437582016,
|
|
"num_tokens": 4325938.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 5.8890282154083256,
|
|
"epoch": 0.11956072503985357,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003825677285573433,
|
|
"loss": 5.8785,
|
|
"mean_token_accuracy": 0.14733124971389772,
|
|
"num_tokens": 4336075.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 5.935479640960693,
|
|
"epoch": 0.11985593670661865,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00038153151599277027,
|
|
"loss": 5.8451,
|
|
"mean_token_accuracy": 0.14356617033481597,
|
|
"num_tokens": 4346182.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 5.82189826965332,
|
|
"epoch": 0.12015114837338371,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003804923828128723,
|
|
"loss": 5.787,
|
|
"mean_token_accuracy": 0.14910677671432496,
|
|
"num_tokens": 4355312.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 5.909171390533447,
|
|
"epoch": 0.12044636004014879,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0003794503575060104,
|
|
"loss": 5.877,
|
|
"mean_token_accuracy": 0.14962176233530045,
|
|
"num_tokens": 4365764.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 5.955221271514892,
|
|
"epoch": 0.12074157170691385,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00037840546863983484,
|
|
"loss": 5.7949,
|
|
"mean_token_accuracy": 0.14844022542238236,
|
|
"num_tokens": 4375786.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 5.89266791343689,
|
|
"epoch": 0.12103678337367893,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003773577448605015,
|
|
"loss": 5.9267,
|
|
"mean_token_accuracy": 0.14508458599448204,
|
|
"num_tokens": 4385699.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 5.89232029914856,
|
|
"epoch": 0.121331995040444,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003763072148918872,
|
|
"loss": 5.8008,
|
|
"mean_token_accuracy": 0.141511669754982,
|
|
"num_tokens": 4395672.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 5.823759508132935,
|
|
"epoch": 0.12162720670720907,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003752539075348017,
|
|
"loss": 5.8079,
|
|
"mean_token_accuracy": 0.1507662519812584,
|
|
"num_tokens": 4406387.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 5.913642120361328,
|
|
"epoch": 0.12192241837397413,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00037419785166619817,
|
|
"loss": 5.8565,
|
|
"mean_token_accuracy": 0.14292775765061377,
|
|
"num_tokens": 4417239.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 5.8714563846588135,
|
|
"epoch": 0.12221763004073921,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003731390762383818,
|
|
"loss": 5.811,
|
|
"mean_token_accuracy": 0.14093895107507706,
|
|
"num_tokens": 4427155.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 5.961601066589355,
|
|
"epoch": 0.12251284170750427,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003720776102782158,
|
|
"loss": 5.8581,
|
|
"mean_token_accuracy": 0.13782701194286345,
|
|
"num_tokens": 4438779.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 5.859524154663086,
|
|
"epoch": 0.12280805337426935,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00037101348288632555,
|
|
"loss": 5.7126,
|
|
"mean_token_accuracy": 0.15596050918102264,
|
|
"num_tokens": 4448937.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 5.804517507553101,
|
|
"epoch": 0.12310326504103442,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003699467232363012,
|
|
"loss": 5.9346,
|
|
"mean_token_accuracy": 0.1424793243408203,
|
|
"num_tokens": 4460645.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 5.971078586578369,
|
|
"epoch": 0.12339847670779949,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003688773605738973,
|
|
"loss": 5.8466,
|
|
"mean_token_accuracy": 0.1435117557644844,
|
|
"num_tokens": 4471434.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 5.9637617588043215,
|
|
"epoch": 0.12369368837456456,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00036780542421623134,
|
|
"loss": 5.8191,
|
|
"mean_token_accuracy": 0.14429301768541336,
|
|
"num_tokens": 4482000.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 5.832648849487304,
|
|
"epoch": 0.12398890004132963,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003667309435509802,
|
|
"loss": 5.7424,
|
|
"mean_token_accuracy": 0.15317422747612,
|
|
"num_tokens": 4492078.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 5.813098287582397,
|
|
"epoch": 0.12428411170809471,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003656539480355741,
|
|
"loss": 5.7981,
|
|
"mean_token_accuracy": 0.14740514755249023,
|
|
"num_tokens": 4502589.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 5.864100170135498,
|
|
"epoch": 0.12457932337485977,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003645744671963891,
|
|
"loss": 5.7701,
|
|
"mean_token_accuracy": 0.1520040139555931,
|
|
"num_tokens": 4512112.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 5.884814310073852,
|
|
"epoch": 0.12487453504162485,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0003634925306279376,
|
|
"loss": 5.7867,
|
|
"mean_token_accuracy": 0.14508701711893082,
|
|
"num_tokens": 4523252.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 5.873885583877564,
|
|
"epoch": 0.12516974670838993,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003624081679920574,
|
|
"loss": 5.8114,
|
|
"mean_token_accuracy": 0.14475829750299454,
|
|
"num_tokens": 4534074.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 5.883981084823608,
|
|
"epoch": 0.12546495837515498,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003613214090170977,
|
|
"loss": 5.7333,
|
|
"mean_token_accuracy": 0.14499624371528624,
|
|
"num_tokens": 4544742.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 5.782408142089844,
|
|
"epoch": 0.12576017004192006,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0003602322834971048,
|
|
"loss": 5.7264,
|
|
"mean_token_accuracy": 0.14728159606456756,
|
|
"num_tokens": 4554448.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 5.888982105255127,
|
|
"epoch": 0.12605538170868513,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003591408212910051,
|
|
"loss": 5.7808,
|
|
"mean_token_accuracy": 0.15005627870559693,
|
|
"num_tokens": 4564662.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 5.908775424957275,
|
|
"epoch": 0.1263505933754502,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003580470523217863,
|
|
"loss": 5.8542,
|
|
"mean_token_accuracy": 0.15015560686588286,
|
|
"num_tokens": 4574656.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 5.906300067901611,
|
|
"epoch": 0.12664580504221526,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003569510065756771,
|
|
"loss": 5.9339,
|
|
"mean_token_accuracy": 0.13543790951371193,
|
|
"num_tokens": 4586463.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 5.979663324356079,
|
|
"epoch": 0.12694101670898034,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003558527141013254,
|
|
"loss": 5.8743,
|
|
"mean_token_accuracy": 0.1425904266536236,
|
|
"num_tokens": 4597989.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 5.954431581497192,
|
|
"epoch": 0.1272362283757454,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003547522050089742,
|
|
"loss": 5.8898,
|
|
"mean_token_accuracy": 0.14925199002027512,
|
|
"num_tokens": 4609742.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 5.823591804504394,
|
|
"epoch": 0.1275314400425105,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00035364950946963606,
|
|
"loss": 5.7992,
|
|
"mean_token_accuracy": 0.15304441154003143,
|
|
"num_tokens": 4620232.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 5.911283540725708,
|
|
"epoch": 0.12782665170927554,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003525446577142663,
|
|
"loss": 5.9013,
|
|
"mean_token_accuracy": 0.13929763659834862,
|
|
"num_tokens": 4630346.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 5.955197858810425,
|
|
"epoch": 0.12812186337604062,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00035143768003293395,
|
|
"loss": 5.8595,
|
|
"mean_token_accuracy": 0.14659899696707726,
|
|
"num_tokens": 4641781.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 5.770715284347534,
|
|
"epoch": 0.1284170750428057,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003503286067739913,
|
|
"loss": 5.7786,
|
|
"mean_token_accuracy": 0.15170082300901414,
|
|
"num_tokens": 4652075.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 5.892459154129028,
|
|
"epoch": 0.12871228670957077,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00034921746834324193,
|
|
"loss": 5.882,
|
|
"mean_token_accuracy": 0.1390429399907589,
|
|
"num_tokens": 4663696.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 5.901846647262573,
|
|
"epoch": 0.12900749837633582,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003481042952031072,
|
|
"loss": 5.7873,
|
|
"mean_token_accuracy": 0.14458485394716264,
|
|
"num_tokens": 4674690.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 5.8988055229187015,
|
|
"epoch": 0.1293027100431009,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003469891178717911,
|
|
"loss": 5.7974,
|
|
"mean_token_accuracy": 0.14695438668131827,
|
|
"num_tokens": 4686148.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 5.875628900527954,
|
|
"epoch": 0.12959792170986598,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003458719669224436,
|
|
"loss": 5.7993,
|
|
"mean_token_accuracy": 0.14585750550031662,
|
|
"num_tokens": 4697138.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 5.810586833953858,
|
|
"epoch": 0.12989313337663105,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0003447528729823221,
|
|
"loss": 5.7619,
|
|
"mean_token_accuracy": 0.14688076227903366,
|
|
"num_tokens": 4707543.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 5.867088079452515,
|
|
"epoch": 0.1301883450433961,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0003436318667319525,
|
|
"loss": 5.7839,
|
|
"mean_token_accuracy": 0.145295587182045,
|
|
"num_tokens": 4717443.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 5.938798618316651,
|
|
"epoch": 0.13048355671016118,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00034250897890428716,
|
|
"loss": 5.7914,
|
|
"mean_token_accuracy": 0.14703379794955254,
|
|
"num_tokens": 4727680.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 5.909167146682739,
|
|
"epoch": 0.13077876837692626,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003413842402838633,
|
|
"loss": 5.8818,
|
|
"mean_token_accuracy": 0.14247161746025086,
|
|
"num_tokens": 4738389.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 5.8443629264831545,
|
|
"epoch": 0.13107398004369133,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00034025768170595834,
|
|
"loss": 5.8249,
|
|
"mean_token_accuracy": 0.14253287389874458,
|
|
"num_tokens": 4749039.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 5.872201061248779,
|
|
"epoch": 0.13136919171045638,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0003391293340557446,
|
|
"loss": 5.9037,
|
|
"mean_token_accuracy": 0.14043543711304665,
|
|
"num_tokens": 4761218.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 5.934078788757324,
|
|
"epoch": 0.13166440337722146,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003379992282674431,
|
|
"loss": 5.7736,
|
|
"mean_token_accuracy": 0.1457185313105583,
|
|
"num_tokens": 4772451.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 5.806709623336792,
|
|
"epoch": 0.13195961504398654,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003368673953234749,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.14604384377598761,
|
|
"num_tokens": 4783080.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 5.894023513793945,
|
|
"epoch": 0.13225482671075162,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00033573386625361176,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.1513105571269989,
|
|
"num_tokens": 4793243.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 5.8049946308135985,
|
|
"epoch": 0.13255003837751667,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00033459867213412567,
|
|
"loss": 5.8058,
|
|
"mean_token_accuracy": 0.14890436828136444,
|
|
"num_tokens": 4805250.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 5.858459043502807,
|
|
"epoch": 0.13284525004428174,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000333461844086937,
|
|
"loss": 5.7693,
|
|
"mean_token_accuracy": 0.14883797466754914,
|
|
"num_tokens": 4816060.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 5.879310941696167,
|
|
"epoch": 0.13314046171104682,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00033232341327876097,
|
|
"loss": 5.7443,
|
|
"mean_token_accuracy": 0.15323535203933716,
|
|
"num_tokens": 4826150.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 5.795564603805542,
|
|
"epoch": 0.1334356733778119,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003311834109202531,
|
|
"loss": 5.7619,
|
|
"mean_token_accuracy": 0.1516168311238289,
|
|
"num_tokens": 4837528.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 5.886122226715088,
|
|
"epoch": 0.13373088504457697,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00033004186826515416,
|
|
"loss": 5.7868,
|
|
"mean_token_accuracy": 0.1463622659444809,
|
|
"num_tokens": 4848181.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 5.891754627227783,
|
|
"epoch": 0.13402609671134202,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003288988166094324,
|
|
"loss": 5.8462,
|
|
"mean_token_accuracy": 0.14468487724661827,
|
|
"num_tokens": 4859531.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 5.911609315872193,
|
|
"epoch": 0.1343213083781071,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00032775428729042656,
|
|
"loss": 5.8052,
|
|
"mean_token_accuracy": 0.14124192222952842,
|
|
"num_tokens": 4870761.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 5.876316499710083,
|
|
"epoch": 0.13461652004487218,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000326608311685986,
|
|
"loss": 5.8135,
|
|
"mean_token_accuracy": 0.14899191111326218,
|
|
"num_tokens": 4881896.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 5.885510730743408,
|
|
"epoch": 0.13491173171163726,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003254609212136108,
|
|
"loss": 5.7858,
|
|
"mean_token_accuracy": 0.15451270043849946,
|
|
"num_tokens": 4891829.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 5.84549469947815,
|
|
"epoch": 0.1352069433784023,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00032431214732959036,
|
|
"loss": 5.8062,
|
|
"mean_token_accuracy": 0.14645825028419496,
|
|
"num_tokens": 4902206.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 5.84327974319458,
|
|
"epoch": 0.13550215504516738,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000323162021528141,
|
|
"loss": 5.7504,
|
|
"mean_token_accuracy": 0.1477378398180008,
|
|
"num_tokens": 4912784.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 5.82833833694458,
|
|
"epoch": 0.13579736671193246,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00032201057534054264,
|
|
"loss": 5.6979,
|
|
"mean_token_accuracy": 0.152939635515213,
|
|
"num_tokens": 4923035.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 5.847175407409668,
|
|
"epoch": 0.13609257837869754,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00032085784033427414,
|
|
"loss": 5.7478,
|
|
"mean_token_accuracy": 0.15417536497116088,
|
|
"num_tokens": 4933474.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 5.933764266967773,
|
|
"epoch": 0.1363877900454626,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003197038481121478,
|
|
"loss": 5.8776,
|
|
"mean_token_accuracy": 0.14427000135183335,
|
|
"num_tokens": 4944179.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 5.751679754257202,
|
|
"epoch": 0.13668300171222766,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003185486303114436,
|
|
"loss": 5.6521,
|
|
"mean_token_accuracy": 0.1544719710946083,
|
|
"num_tokens": 4955176.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 5.7910185813903805,
|
|
"epoch": 0.13697821337899274,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003173922186030409,
|
|
"loss": 5.713,
|
|
"mean_token_accuracy": 0.14861554875969887,
|
|
"num_tokens": 4966857.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 5.8281644821167,
|
|
"epoch": 0.13727342504575782,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000316234644690551,
|
|
"loss": 5.8391,
|
|
"mean_token_accuracy": 0.14714918956160544,
|
|
"num_tokens": 4977481.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 5.8240519046783445,
|
|
"epoch": 0.13756863671252287,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003150759403094473,
|
|
"loss": 5.7206,
|
|
"mean_token_accuracy": 0.15181378722190858,
|
|
"num_tokens": 4988931.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 5.85668978691101,
|
|
"epoch": 0.13786384837928795,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00031391613722619587,
|
|
"loss": 5.6936,
|
|
"mean_token_accuracy": 0.15325831174850463,
|
|
"num_tokens": 4999361.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 5.812391138076782,
|
|
"epoch": 0.13815906004605302,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000312755267237384,
|
|
"loss": 5.8278,
|
|
"mean_token_accuracy": 0.152971313893795,
|
|
"num_tokens": 5010280.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 5.832374191284179,
|
|
"epoch": 0.1384542717128181,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0003115933621688488,
|
|
"loss": 5.7548,
|
|
"mean_token_accuracy": 0.15076140612363814,
|
|
"num_tokens": 5021445.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 5.849080181121826,
|
|
"epoch": 0.13874948337958315,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00031043045387480487,
|
|
"loss": 5.7376,
|
|
"mean_token_accuracy": 0.15598152428865433,
|
|
"num_tokens": 5031250.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 5.908837890625,
|
|
"epoch": 0.13904469504634823,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003092665742369703,
|
|
"loss": 5.7956,
|
|
"mean_token_accuracy": 0.14830169528722764,
|
|
"num_tokens": 5042110.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 5.911416530609131,
|
|
"epoch": 0.1393399067131133,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00030810175516369343,
|
|
"loss": 5.7971,
|
|
"mean_token_accuracy": 0.14944512099027635,
|
|
"num_tokens": 5053137.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 5.706521892547608,
|
|
"epoch": 0.13963511837987838,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003069360285890775,
|
|
"loss": 5.6795,
|
|
"mean_token_accuracy": 0.15750223398208618,
|
|
"num_tokens": 5064089.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 5.802316379547119,
|
|
"epoch": 0.13993033004664343,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00030576942647210547,
|
|
"loss": 5.737,
|
|
"mean_token_accuracy": 0.14698919281363487,
|
|
"num_tokens": 5074003.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 5.884746646881103,
|
|
"epoch": 0.1402255417134085,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00030460198079576355,
|
|
"loss": 5.7325,
|
|
"mean_token_accuracy": 0.14573131501674652,
|
|
"num_tokens": 5085557.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 5.825074052810669,
|
|
"epoch": 0.14052075338017359,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0003034337235661648,
|
|
"loss": 5.7212,
|
|
"mean_token_accuracy": 0.14746077507734298,
|
|
"num_tokens": 5095255.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 5.902310514450074,
|
|
"epoch": 0.14081596504693866,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003022646868116714,
|
|
"loss": 5.8564,
|
|
"mean_token_accuracy": 0.14528988003730775,
|
|
"num_tokens": 5106763.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 5.908555316925049,
|
|
"epoch": 0.1411111767137037,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003010949025820163,
|
|
"loss": 5.8186,
|
|
"mean_token_accuracy": 0.14972189366817473,
|
|
"num_tokens": 5117077.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 5.88707275390625,
|
|
"epoch": 0.1414063883804688,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002999244029474252,
|
|
"loss": 5.7466,
|
|
"mean_token_accuracy": 0.15173358470201492,
|
|
"num_tokens": 5127448.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 5.891510725021362,
|
|
"epoch": 0.14170160004723387,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00029875321999773684,
|
|
"loss": 5.8615,
|
|
"mean_token_accuracy": 0.14978691190481186,
|
|
"num_tokens": 5137773.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 5.867310285568237,
|
|
"epoch": 0.14199681171399894,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00029758138584152333,
|
|
"loss": 5.7237,
|
|
"mean_token_accuracy": 0.15724016577005387,
|
|
"num_tokens": 5148238.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 5.818504667282104,
|
|
"epoch": 0.14229202338076402,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002964089326052102,
|
|
"loss": 5.7473,
|
|
"mean_token_accuracy": 0.1468193218111992,
|
|
"num_tokens": 5158278.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 5.7910181999206545,
|
|
"epoch": 0.14258723504752907,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0002952358924321949,
|
|
"loss": 5.6366,
|
|
"mean_token_accuracy": 0.15759154111146928,
|
|
"num_tokens": 5169125.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 5.840108966827392,
|
|
"epoch": 0.14288244671429415,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00029406229748196657,
|
|
"loss": 5.8122,
|
|
"mean_token_accuracy": 0.14533981755375863,
|
|
"num_tokens": 5179985.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 5.895187139511108,
|
|
"epoch": 0.14317765838105923,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0002928881799292235,
|
|
"loss": 5.7921,
|
|
"mean_token_accuracy": 0.14473017528653145,
|
|
"num_tokens": 5192212.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 5.8213982582092285,
|
|
"epoch": 0.1434728700478243,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00029171357196299154,
|
|
"loss": 5.718,
|
|
"mean_token_accuracy": 0.16044561117887496,
|
|
"num_tokens": 5202231.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 5.81967396736145,
|
|
"epoch": 0.14376808171458935,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002905385057857414,
|
|
"loss": 5.7558,
|
|
"mean_token_accuracy": 0.14933729618787767,
|
|
"num_tokens": 5212172.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 5.905748891830444,
|
|
"epoch": 0.14406329338135443,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0002893630136125058,
|
|
"loss": 5.7867,
|
|
"mean_token_accuracy": 0.1405153028666973,
|
|
"num_tokens": 5222701.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 5.904868745803833,
|
|
"epoch": 0.1443585050481195,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002881871276699967,
|
|
"loss": 5.7779,
|
|
"mean_token_accuracy": 0.14894871413707733,
|
|
"num_tokens": 5233791.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 5.870218658447266,
|
|
"epoch": 0.14465371671488458,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.00028701088019572114,
|
|
"loss": 5.7546,
|
|
"mean_token_accuracy": 0.1479785457253456,
|
|
"num_tokens": 5245176.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 5.801178073883056,
|
|
"epoch": 0.14494892838164963,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002858343034370977,
|
|
"loss": 5.6545,
|
|
"mean_token_accuracy": 0.15056182295084,
|
|
"num_tokens": 5256396.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 5.700835084915161,
|
|
"epoch": 0.1452441400484147,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00028465742965057267,
|
|
"loss": 5.6605,
|
|
"mean_token_accuracy": 0.14991683661937713,
|
|
"num_tokens": 5267609.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 5.8303018569946286,
|
|
"epoch": 0.1455393517151798,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00028348029110073533,
|
|
"loss": 5.7595,
|
|
"mean_token_accuracy": 0.14767585843801498,
|
|
"num_tokens": 5278694.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 5.780443429946899,
|
|
"epoch": 0.14583456338194487,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00028230292005943365,
|
|
"loss": 5.658,
|
|
"mean_token_accuracy": 0.1536046400666237,
|
|
"num_tokens": 5288632.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 5.869033002853394,
|
|
"epoch": 0.14612977504870991,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00028112534880488945,
|
|
"loss": 5.722,
|
|
"mean_token_accuracy": 0.14815740734338761,
|
|
"num_tokens": 5299683.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 5.911976480484009,
|
|
"epoch": 0.146424986715475,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002799476096208137,
|
|
"loss": 5.8581,
|
|
"mean_token_accuracy": 0.1439642757177353,
|
|
"num_tokens": 5311283.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 5.890473794937134,
|
|
"epoch": 0.14672019838224007,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00027876973479552087,
|
|
"loss": 5.7361,
|
|
"mean_token_accuracy": 0.15374464988708497,
|
|
"num_tokens": 5321032.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 5.773164701461792,
|
|
"epoch": 0.14701541004900515,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00027759175662104424,
|
|
"loss": 5.7137,
|
|
"mean_token_accuracy": 0.15318229794502258,
|
|
"num_tokens": 5331540.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 5.763066816329956,
|
|
"epoch": 0.1473106217157702,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0002764137073922508,
|
|
"loss": 5.65,
|
|
"mean_token_accuracy": 0.1567002519965172,
|
|
"num_tokens": 5341644.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 5.8555888652801515,
|
|
"epoch": 0.14760583338253527,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00027523561940595505,
|
|
"loss": 5.7445,
|
|
"mean_token_accuracy": 0.15136282593011857,
|
|
"num_tokens": 5351455.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 5.794910717010498,
|
|
"epoch": 0.14790104504930035,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0002740575249600342,
|
|
"loss": 5.711,
|
|
"mean_token_accuracy": 0.1478429540991783,
|
|
"num_tokens": 5362773.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 5.7490335464477536,
|
|
"epoch": 0.14819625671606543,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00027287945635254263,
|
|
"loss": 5.6492,
|
|
"mean_token_accuracy": 0.15340866893529892,
|
|
"num_tokens": 5373721.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 5.873322153091431,
|
|
"epoch": 0.14849146838283048,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00027170144588082635,
|
|
"loss": 5.761,
|
|
"mean_token_accuracy": 0.15050134509801866,
|
|
"num_tokens": 5384844.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 5.832914209365844,
|
|
"epoch": 0.14878668004959555,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00027052352584063763,
|
|
"loss": 5.6984,
|
|
"mean_token_accuracy": 0.14993241876363755,
|
|
"num_tokens": 5394833.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 5.84977126121521,
|
|
"epoch": 0.14908189171636063,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00026934572852524907,
|
|
"loss": 5.7222,
|
|
"mean_token_accuracy": 0.15175193846225737,
|
|
"num_tokens": 5405851.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 5.856116485595703,
|
|
"epoch": 0.1493771033831257,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00026816808622456937,
|
|
"loss": 5.743,
|
|
"mean_token_accuracy": 0.15306083410978316,
|
|
"num_tokens": 5415900.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 5.827798318862915,
|
|
"epoch": 0.14967231504989076,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002669906312242569,
|
|
"loss": 5.732,
|
|
"mean_token_accuracy": 0.1518265798687935,
|
|
"num_tokens": 5426377.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 5.802604866027832,
|
|
"epoch": 0.14996752671665584,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00026581339580483525,
|
|
"loss": 5.6975,
|
|
"mean_token_accuracy": 0.14978732466697692,
|
|
"num_tokens": 5437521.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 5.712619066238403,
|
|
"epoch": 0.1502627383834209,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002646364122408082,
|
|
"loss": 5.6058,
|
|
"mean_token_accuracy": 0.16219503283500672,
|
|
"num_tokens": 5447451.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 5.805732870101929,
|
|
"epoch": 0.150557950050186,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0002634597127997749,
|
|
"loss": 5.6958,
|
|
"mean_token_accuracy": 0.15229946225881577,
|
|
"num_tokens": 5458374.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 5.822914361953735,
|
|
"epoch": 0.15085316171695107,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0002622833297415445,
|
|
"loss": 5.7142,
|
|
"mean_token_accuracy": 0.15656827986240388,
|
|
"num_tokens": 5468538.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 5.838310861587525,
|
|
"epoch": 0.15114837338371612,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002611072953172531,
|
|
"loss": 5.8234,
|
|
"mean_token_accuracy": 0.14527885913848876,
|
|
"num_tokens": 5480167.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 5.844251585006714,
|
|
"epoch": 0.1514435850504812,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00025993164176847845,
|
|
"loss": 5.7593,
|
|
"mean_token_accuracy": 0.15021870881319047,
|
|
"num_tokens": 5490480.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 5.982595682144165,
|
|
"epoch": 0.15173879671724627,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002587564013263564,
|
|
"loss": 5.8122,
|
|
"mean_token_accuracy": 0.15911878421902656,
|
|
"num_tokens": 5500922.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 5.777032136917114,
|
|
"epoch": 0.15203400838401135,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002575816062106974,
|
|
"loss": 5.7366,
|
|
"mean_token_accuracy": 0.15219781100749968,
|
|
"num_tokens": 5511559.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 5.783867979049683,
|
|
"epoch": 0.1523292200507764,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00025640728862910293,
|
|
"loss": 5.6984,
|
|
"mean_token_accuracy": 0.16286050006747246,
|
|
"num_tokens": 5522905.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 5.9404762268066404,
|
|
"epoch": 0.15262443171754148,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00025523348077608285,
|
|
"loss": 5.7986,
|
|
"mean_token_accuracy": 0.15127443820238112,
|
|
"num_tokens": 5533399.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 5.857164478302002,
|
|
"epoch": 0.15291964338430655,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00025406021483217225,
|
|
"loss": 5.6573,
|
|
"mean_token_accuracy": 0.15032891780138016,
|
|
"num_tokens": 5543629.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 5.788156652450562,
|
|
"epoch": 0.15321485505107163,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00025288752296304963,
|
|
"loss": 5.6862,
|
|
"mean_token_accuracy": 0.15861913412809373,
|
|
"num_tokens": 5553425.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 5.804111576080322,
|
|
"epoch": 0.15351006671783668,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000251715437318655,
|
|
"loss": 5.7125,
|
|
"mean_token_accuracy": 0.1538176417350769,
|
|
"num_tokens": 5564118.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 5.835002756118774,
|
|
"epoch": 0.15380527838460176,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002505439900323084,
|
|
"loss": 5.637,
|
|
"mean_token_accuracy": 0.15686066150665284,
|
|
"num_tokens": 5574987.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 5.777936553955078,
|
|
"epoch": 0.15410049005136683,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00024937321321982894,
|
|
"loss": 5.6827,
|
|
"mean_token_accuracy": 0.15496653467416763,
|
|
"num_tokens": 5585420.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 5.732548761367798,
|
|
"epoch": 0.1543957017181319,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00024820313897865433,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.1607084184885025,
|
|
"num_tokens": 5595571.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 5.817372417449951,
|
|
"epoch": 0.15469091338489696,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00024703379938696105,
|
|
"loss": 5.7128,
|
|
"mean_token_accuracy": 0.14940359741449355,
|
|
"num_tokens": 5606250.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 5.791840982437134,
|
|
"epoch": 0.15498612505166204,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00024586522650278447,
|
|
"loss": 5.6609,
|
|
"mean_token_accuracy": 0.1573047861456871,
|
|
"num_tokens": 5616550.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 5.794824409484863,
|
|
"epoch": 0.15528133671842712,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00024469745236314064,
|
|
"loss": 5.7016,
|
|
"mean_token_accuracy": 0.15455534756183625,
|
|
"num_tokens": 5627814.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 5.787220430374146,
|
|
"epoch": 0.1555765483851922,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00024353050898314767,
|
|
"loss": 5.6502,
|
|
"mean_token_accuracy": 0.15196960419416428,
|
|
"num_tokens": 5639046.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 5.86609206199646,
|
|
"epoch": 0.15587176005195724,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00024236442835514743,
|
|
"loss": 5.7521,
|
|
"mean_token_accuracy": 0.14734504669904708,
|
|
"num_tokens": 5649405.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 5.838798141479492,
|
|
"epoch": 0.15616697171872232,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00024119924244782965,
|
|
"loss": 5.7396,
|
|
"mean_token_accuracy": 0.15511633157730104,
|
|
"num_tokens": 5659415.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 5.7837542533874515,
|
|
"epoch": 0.1564621833854874,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00024003498320535462,
|
|
"loss": 5.6552,
|
|
"mean_token_accuracy": 0.15822857320308686,
|
|
"num_tokens": 5670216.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 5.789451837539673,
|
|
"epoch": 0.15675739505225247,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00023887168254647727,
|
|
"loss": 5.6434,
|
|
"mean_token_accuracy": 0.1548759788274765,
|
|
"num_tokens": 5680522.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 5.869673490524292,
|
|
"epoch": 0.15705260671901752,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00023770937236367308,
|
|
"loss": 5.6665,
|
|
"mean_token_accuracy": 0.15874808877706528,
|
|
"num_tokens": 5690967.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 5.803036069869995,
|
|
"epoch": 0.1573478183857826,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00023654808452226278,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.15862036496400833,
|
|
"num_tokens": 5701399.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 5.782123565673828,
|
|
"epoch": 0.15764303005254768,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00023538785085953912,
|
|
"loss": 5.6823,
|
|
"mean_token_accuracy": 0.15496397167444229,
|
|
"num_tokens": 5712831.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 5.744446802139282,
|
|
"epoch": 0.15793824171931276,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00023422870318389404,
|
|
"loss": 5.7217,
|
|
"mean_token_accuracy": 0.14872229248285293,
|
|
"num_tokens": 5723302.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 5.810635137557983,
|
|
"epoch": 0.1582334533860778,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002330706732739468,
|
|
"loss": 5.6666,
|
|
"mean_token_accuracy": 0.15569144636392593,
|
|
"num_tokens": 5733477.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 5.802335262298584,
|
|
"epoch": 0.15852866505284288,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00023191379287767211,
|
|
"loss": 5.5859,
|
|
"mean_token_accuracy": 0.1629209041595459,
|
|
"num_tokens": 5742939.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 5.734919500350952,
|
|
"epoch": 0.15882387671960796,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002307580937115305,
|
|
"loss": 5.614,
|
|
"mean_token_accuracy": 0.16498201638460158,
|
|
"num_tokens": 5752274.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 5.816423034667968,
|
|
"epoch": 0.15911908838637304,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00022960360745959846,
|
|
"loss": 5.7505,
|
|
"mean_token_accuracy": 0.1515976034104824,
|
|
"num_tokens": 5762924.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 5.842073917388916,
|
|
"epoch": 0.1594143000531381,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00022845036577269972,
|
|
"loss": 5.6588,
|
|
"mean_token_accuracy": 0.1582637369632721,
|
|
"num_tokens": 5773006.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 5.874047183990479,
|
|
"epoch": 0.15970951171990316,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00022729840026753777,
|
|
"loss": 5.8265,
|
|
"mean_token_accuracy": 0.14802422523498535,
|
|
"num_tokens": 5784285.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 5.843439388275146,
|
|
"epoch": 0.16000472338666824,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002261477425258287,
|
|
"loss": 5.6955,
|
|
"mean_token_accuracy": 0.1497537225484848,
|
|
"num_tokens": 5794836.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 5.8394866466522215,
|
|
"epoch": 0.16029993505343332,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0002249984240934358,
|
|
"loss": 5.6326,
|
|
"mean_token_accuracy": 0.16427593678236008,
|
|
"num_tokens": 5804978.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 5.827301073074341,
|
|
"epoch": 0.1605951467201984,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00022385047647950464,
|
|
"loss": 5.721,
|
|
"mean_token_accuracy": 0.15382598489522933,
|
|
"num_tokens": 5815573.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 5.724962139129639,
|
|
"epoch": 0.16089035838696344,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0002227039311555986,
|
|
"loss": 5.6226,
|
|
"mean_token_accuracy": 0.15451890230178833,
|
|
"num_tokens": 5826132.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 5.7100766658782955,
|
|
"epoch": 0.16118557005372852,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002215588195548372,
|
|
"loss": 5.6256,
|
|
"mean_token_accuracy": 0.1617357313632965,
|
|
"num_tokens": 5836196.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 5.768064165115357,
|
|
"epoch": 0.1614807817204936,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00022041517307103337,
|
|
"loss": 5.6505,
|
|
"mean_token_accuracy": 0.15782103538513184,
|
|
"num_tokens": 5847387.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 5.784198904037476,
|
|
"epoch": 0.16177599338725868,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002192730230578331,
|
|
"loss": 5.6583,
|
|
"mean_token_accuracy": 0.16049279570579528,
|
|
"num_tokens": 5858970.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 5.818168354034424,
|
|
"epoch": 0.16207120505402373,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0002181324008278559,
|
|
"loss": 5.708,
|
|
"mean_token_accuracy": 0.1594376742839813,
|
|
"num_tokens": 5870124.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 5.781637144088745,
|
|
"epoch": 0.1623664167207888,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00021699333765183655,
|
|
"loss": 5.7065,
|
|
"mean_token_accuracy": 0.1529950052499771,
|
|
"num_tokens": 5880367.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 5.8289731502532955,
|
|
"epoch": 0.16266162838755388,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0002158558647577673,
|
|
"loss": 5.6951,
|
|
"mean_token_accuracy": 0.15623730272054673,
|
|
"num_tokens": 5891254.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 5.772958135604858,
|
|
"epoch": 0.16295684005431896,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00021472001333004215,
|
|
"loss": 5.5253,
|
|
"mean_token_accuracy": 0.16826050877571105,
|
|
"num_tokens": 5901224.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 5.820578002929688,
|
|
"epoch": 0.163252051721084,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00021358581450860186,
|
|
"loss": 5.6608,
|
|
"mean_token_accuracy": 0.15363723188638687,
|
|
"num_tokens": 5911657.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 5.734474134445191,
|
|
"epoch": 0.16354726338784908,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002124532993880799,
|
|
"loss": 5.7127,
|
|
"mean_token_accuracy": 0.1486969083547592,
|
|
"num_tokens": 5923265.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 5.763734340667725,
|
|
"epoch": 0.16384247505461416,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00021132249901695044,
|
|
"loss": 5.5889,
|
|
"mean_token_accuracy": 0.15693474411964417,
|
|
"num_tokens": 5932856.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 5.841007566452026,
|
|
"epoch": 0.16413768672137924,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00021019344439667705,
|
|
"loss": 5.7026,
|
|
"mean_token_accuracy": 0.15034423619508744,
|
|
"num_tokens": 5943835.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 5.82686595916748,
|
|
"epoch": 0.1644328983881443,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00020906616648086213,
|
|
"loss": 5.6219,
|
|
"mean_token_accuracy": 0.15743485391139983,
|
|
"num_tokens": 5953803.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 5.758174037933349,
|
|
"epoch": 0.16472811005490937,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00020794069617439942,
|
|
"loss": 5.609,
|
|
"mean_token_accuracy": 0.15583681166172028,
|
|
"num_tokens": 5964286.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 5.758541536331177,
|
|
"epoch": 0.16502332172167444,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00020681706433262593,
|
|
"loss": 5.6519,
|
|
"mean_token_accuracy": 0.15682099312543868,
|
|
"num_tokens": 5974213.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 5.857257890701294,
|
|
"epoch": 0.16531853338843952,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00020569530176047602,
|
|
"loss": 5.7086,
|
|
"mean_token_accuracy": 0.15752365440130234,
|
|
"num_tokens": 5985226.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 5.825340986251831,
|
|
"epoch": 0.16561374505520457,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002045754392116374,
|
|
"loss": 5.6536,
|
|
"mean_token_accuracy": 0.15613983720541,
|
|
"num_tokens": 5995633.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 5.744762229919433,
|
|
"epoch": 0.16590895672196965,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00020345750738770757,
|
|
"loss": 5.6047,
|
|
"mean_token_accuracy": 0.1547197386622429,
|
|
"num_tokens": 6005417.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 5.819397783279419,
|
|
"epoch": 0.16620416838873472,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00020234153693735214,
|
|
"loss": 5.6369,
|
|
"mean_token_accuracy": 0.15287786424160005,
|
|
"num_tokens": 6016492.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 5.784248542785645,
|
|
"epoch": 0.1664993800554998,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0002012275584554647,
|
|
"loss": 5.615,
|
|
"mean_token_accuracy": 0.16463642716407775,
|
|
"num_tokens": 6026695.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 5.786743402481079,
|
|
"epoch": 0.16679459172226485,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00020011560248232803,
|
|
"loss": 5.5806,
|
|
"mean_token_accuracy": 0.16285499185323715,
|
|
"num_tokens": 6037840.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 5.844322681427002,
|
|
"epoch": 0.16708980338902993,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00019900569950277692,
|
|
"loss": 5.773,
|
|
"mean_token_accuracy": 0.15636565610766412,
|
|
"num_tokens": 6048459.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 5.809803915023804,
|
|
"epoch": 0.167385015055795,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00019789787994536228,
|
|
"loss": 5.6601,
|
|
"mean_token_accuracy": 0.1659025490283966,
|
|
"num_tokens": 6058927.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 5.763745212554932,
|
|
"epoch": 0.16768022672256008,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00019679217418151667,
|
|
"loss": 5.6325,
|
|
"mean_token_accuracy": 0.15508972555398942,
|
|
"num_tokens": 6070676.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 5.82304425239563,
|
|
"epoch": 0.16797543838932513,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00019568861252472236,
|
|
"loss": 5.7489,
|
|
"mean_token_accuracy": 0.15482137054204942,
|
|
"num_tokens": 6081599.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 5.7937483310699465,
|
|
"epoch": 0.1682706500560902,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00019458722522967952,
|
|
"loss": 5.5474,
|
|
"mean_token_accuracy": 0.16606338769197465,
|
|
"num_tokens": 6091820.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 5.786717891693115,
|
|
"epoch": 0.1685658617228553,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00019348804249147723,
|
|
"loss": 5.6855,
|
|
"mean_token_accuracy": 0.15746957659721375,
|
|
"num_tokens": 6104233.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 5.7802019119262695,
|
|
"epoch": 0.16886107338962036,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0001923910944447655,
|
|
"loss": 5.7361,
|
|
"mean_token_accuracy": 0.15136646330356598,
|
|
"num_tokens": 6115241.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 5.811636686325073,
|
|
"epoch": 0.16915628505638544,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00019129641116292928,
|
|
"loss": 5.633,
|
|
"mean_token_accuracy": 0.15820270478725434,
|
|
"num_tokens": 6124994.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 5.773607349395752,
|
|
"epoch": 0.1694514967231505,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00019020402265726343,
|
|
"loss": 5.6579,
|
|
"mean_token_accuracy": 0.16287655085325242,
|
|
"num_tokens": 6135777.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 5.727730798721313,
|
|
"epoch": 0.16974670838991557,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0001891139588761509,
|
|
"loss": 5.5317,
|
|
"mean_token_accuracy": 0.16074223220348358,
|
|
"num_tokens": 6145343.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 5.758039855957032,
|
|
"epoch": 0.17004192005668065,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00018802624970424076,
|
|
"loss": 5.5166,
|
|
"mean_token_accuracy": 0.1578818827867508,
|
|
"num_tokens": 6154796.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 5.768032693862915,
|
|
"epoch": 0.17033713172344572,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00018694092496162945,
|
|
"loss": 5.6076,
|
|
"mean_token_accuracy": 0.15405483096837996,
|
|
"num_tokens": 6165819.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 5.762860345840454,
|
|
"epoch": 0.17063234339021077,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00018585801440304306,
|
|
"loss": 5.6827,
|
|
"mean_token_accuracy": 0.15319141000509262,
|
|
"num_tokens": 6176253.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 5.794716691970825,
|
|
"epoch": 0.17092755505697585,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00018477754771702165,
|
|
"loss": 5.6287,
|
|
"mean_token_accuracy": 0.15623776614665985,
|
|
"num_tokens": 6186948.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 5.772610378265381,
|
|
"epoch": 0.17122276672374093,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00018369955452510506,
|
|
"loss": 5.6547,
|
|
"mean_token_accuracy": 0.15749662965536118,
|
|
"num_tokens": 6198216.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 5.717506265640258,
|
|
"epoch": 0.171517978390506,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0001826240643810212,
|
|
"loss": 5.6155,
|
|
"mean_token_accuracy": 0.16130925416946412,
|
|
"num_tokens": 6208523.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 5.749411630630493,
|
|
"epoch": 0.17181319005727105,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0001815511067698758,
|
|
"loss": 5.5892,
|
|
"mean_token_accuracy": 0.1641666054725647,
|
|
"num_tokens": 6218386.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 5.800030279159546,
|
|
"epoch": 0.17210840172403613,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001804807111073436,
|
|
"loss": 5.6282,
|
|
"mean_token_accuracy": 0.15752959698438646,
|
|
"num_tokens": 6229303.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 5.807927179336548,
|
|
"epoch": 0.1724036133908012,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001794129067388625,
|
|
"loss": 5.663,
|
|
"mean_token_accuracy": 0.15455908179283143,
|
|
"num_tokens": 6239741.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 5.804432106018067,
|
|
"epoch": 0.17269882505756629,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00017834772293882868,
|
|
"loss": 5.7207,
|
|
"mean_token_accuracy": 0.15265603810548783,
|
|
"num_tokens": 6250858.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 5.842693328857422,
|
|
"epoch": 0.17299403672433133,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000177285188909794,
|
|
"loss": 5.7186,
|
|
"mean_token_accuracy": 0.15164154022932053,
|
|
"num_tokens": 6261421.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 5.843882703781128,
|
|
"epoch": 0.1732892483910964,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001762253337816656,
|
|
"loss": 5.6965,
|
|
"mean_token_accuracy": 0.15882311016321182,
|
|
"num_tokens": 6272363.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 5.7231823921203615,
|
|
"epoch": 0.1735844600578615,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00017516818661090738,
|
|
"loss": 5.5607,
|
|
"mean_token_accuracy": 0.1549238920211792,
|
|
"num_tokens": 6281979.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 5.799956035614014,
|
|
"epoch": 0.17387967172462657,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0001741137763797428,
|
|
"loss": 5.6065,
|
|
"mean_token_accuracy": 0.16033869832754136,
|
|
"num_tokens": 6293105.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 5.742867422103882,
|
|
"epoch": 0.17417488339139162,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00017306213199536115,
|
|
"loss": 5.587,
|
|
"mean_token_accuracy": 0.1575272262096405,
|
|
"num_tokens": 6303282.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 5.683079767227173,
|
|
"epoch": 0.1744700950581567,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0001720132822891243,
|
|
"loss": 5.508,
|
|
"mean_token_accuracy": 0.16477754712104797,
|
|
"num_tokens": 6312509.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 5.733345556259155,
|
|
"epoch": 0.17476530672492177,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0001709672560157769,
|
|
"loss": 5.6649,
|
|
"mean_token_accuracy": 0.15566102415323257,
|
|
"num_tokens": 6323735.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 5.779466152191162,
|
|
"epoch": 0.17506051839168685,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00016992408185265758,
|
|
"loss": 5.5878,
|
|
"mean_token_accuracy": 0.1580200031399727,
|
|
"num_tokens": 6333470.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 5.80308084487915,
|
|
"epoch": 0.1753557300584519,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00016888378839891298,
|
|
"loss": 5.6653,
|
|
"mean_token_accuracy": 0.15630450546741487,
|
|
"num_tokens": 6345259.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 5.827920007705688,
|
|
"epoch": 0.17565094172521697,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001678464041747137,
|
|
"loss": 5.6184,
|
|
"mean_token_accuracy": 0.15748694986104966,
|
|
"num_tokens": 6355487.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 5.760254335403443,
|
|
"epoch": 0.17594615339198205,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00016681195762047223,
|
|
"loss": 5.597,
|
|
"mean_token_accuracy": 0.16247099339962007,
|
|
"num_tokens": 6365745.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 5.7956842422485355,
|
|
"epoch": 0.17624136505874713,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00016578047709606337,
|
|
"loss": 5.654,
|
|
"mean_token_accuracy": 0.1590045779943466,
|
|
"num_tokens": 6376067.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 5.819021606445313,
|
|
"epoch": 0.17653657672551218,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00016475199088004678,
|
|
"loss": 5.618,
|
|
"mean_token_accuracy": 0.16036798804998398,
|
|
"num_tokens": 6386554.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 5.841303014755249,
|
|
"epoch": 0.17683178839227726,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00016372652716889163,
|
|
"loss": 5.6978,
|
|
"mean_token_accuracy": 0.15550578981637955,
|
|
"num_tokens": 6398025.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 5.677389764785767,
|
|
"epoch": 0.17712700005904233,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0001627041140762035,
|
|
"loss": 5.5132,
|
|
"mean_token_accuracy": 0.16567019671201705,
|
|
"num_tokens": 6408721.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 5.734618282318115,
|
|
"epoch": 0.1774222117258074,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00016168477963195382,
|
|
"loss": 5.5756,
|
|
"mean_token_accuracy": 0.1624857246875763,
|
|
"num_tokens": 6419577.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 5.810021591186524,
|
|
"epoch": 0.1777174233925725,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001606685517817114,
|
|
"loss": 5.5276,
|
|
"mean_token_accuracy": 0.16408525556325912,
|
|
"num_tokens": 6430479.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 5.7845429420471195,
|
|
"epoch": 0.17801263505933754,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00015965545838587592,
|
|
"loss": 5.5481,
|
|
"mean_token_accuracy": 0.15705396384000778,
|
|
"num_tokens": 6440794.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 5.633224964141846,
|
|
"epoch": 0.17830784672610261,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00015864552721891467,
|
|
"loss": 5.5336,
|
|
"mean_token_accuracy": 0.16165570467710494,
|
|
"num_tokens": 6450720.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.772348356246948,
|
|
"epoch": 0.1786030583928677,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00015763878596860076,
|
|
"loss": 5.6867,
|
|
"mean_token_accuracy": 0.15400478690862657,
|
|
"num_tokens": 6461473.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 5.767057180404663,
|
|
"epoch": 0.17889827005963277,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00015663526223525412,
|
|
"loss": 5.5819,
|
|
"mean_token_accuracy": 0.16159267872571945,
|
|
"num_tokens": 6472646.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 5.782819986343384,
|
|
"epoch": 0.17919348172639782,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0001556349835309848,
|
|
"loss": 5.6235,
|
|
"mean_token_accuracy": 0.15272486656904222,
|
|
"num_tokens": 6483460.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 5.799853086471558,
|
|
"epoch": 0.1794886933931629,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001546379772789389,
|
|
"loss": 5.6168,
|
|
"mean_token_accuracy": 0.16266586929559707,
|
|
"num_tokens": 6493785.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 5.686642217636108,
|
|
"epoch": 0.17978390505992797,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00015364427081254622,
|
|
"loss": 5.5398,
|
|
"mean_token_accuracy": 0.15694752633571624,
|
|
"num_tokens": 6503884.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 5.75599775314331,
|
|
"epoch": 0.18007911672669305,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00015265389137477165,
|
|
"loss": 5.6437,
|
|
"mean_token_accuracy": 0.1586132287979126,
|
|
"num_tokens": 6515390.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 5.8083165168762205,
|
|
"epoch": 0.1803743283934581,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00015166686611736786,
|
|
"loss": 5.6607,
|
|
"mean_token_accuracy": 0.16055876314640044,
|
|
"num_tokens": 6526547.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.801623010635376,
|
|
"epoch": 0.18066954006022318,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00015068322210013064,
|
|
"loss": 5.6771,
|
|
"mean_token_accuracy": 0.15876749902963638,
|
|
"num_tokens": 6537074.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 5.824917411804199,
|
|
"epoch": 0.18096475172698825,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0001497029862901578,
|
|
"loss": 5.583,
|
|
"mean_token_accuracy": 0.1577269583940506,
|
|
"num_tokens": 6546654.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 5.841225910186767,
|
|
"epoch": 0.18125996339375333,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00014872618556110905,
|
|
"loss": 5.6532,
|
|
"mean_token_accuracy": 0.1564357563853264,
|
|
"num_tokens": 6557763.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 5.799820899963379,
|
|
"epoch": 0.18155517506051838,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00014775284669246992,
|
|
"loss": 5.5784,
|
|
"mean_token_accuracy": 0.16481314301490785,
|
|
"num_tokens": 6567903.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 5.829608201980591,
|
|
"epoch": 0.18185038672728346,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00014678299636881716,
|
|
"loss": 5.6184,
|
|
"mean_token_accuracy": 0.1538312777876854,
|
|
"num_tokens": 6579161.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 5.706149101257324,
|
|
"epoch": 0.18214559839404854,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001458166611790873,
|
|
"loss": 5.5572,
|
|
"mean_token_accuracy": 0.15872241407632828,
|
|
"num_tokens": 6589469.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 5.7125349044799805,
|
|
"epoch": 0.1824408100608136,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00014485386761584773,
|
|
"loss": 5.5595,
|
|
"mean_token_accuracy": 0.16113739609718322,
|
|
"num_tokens": 6600362.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.7726891994476315,
|
|
"epoch": 0.18273602172757866,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00014389464207457042,
|
|
"loss": 5.6015,
|
|
"mean_token_accuracy": 0.1582837775349617,
|
|
"num_tokens": 6611418.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 5.808093118667602,
|
|
"epoch": 0.18303123339434374,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00014293901085290795,
|
|
"loss": 5.5714,
|
|
"mean_token_accuracy": 0.1655123710632324,
|
|
"num_tokens": 6621836.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 5.718087911605835,
|
|
"epoch": 0.18332644506110882,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00014198700014997307,
|
|
"loss": 5.5396,
|
|
"mean_token_accuracy": 0.1658376559615135,
|
|
"num_tokens": 6631791.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 5.728456830978393,
|
|
"epoch": 0.1836216567278739,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00014103863606562016,
|
|
"loss": 5.5806,
|
|
"mean_token_accuracy": 0.16788130402565002,
|
|
"num_tokens": 6642842.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 5.772354698181152,
|
|
"epoch": 0.18391686839463894,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00014009394459972964,
|
|
"loss": 5.6063,
|
|
"mean_token_accuracy": 0.15932363122701645,
|
|
"num_tokens": 6652342.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 5.844732236862183,
|
|
"epoch": 0.18421208006140402,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00013915295165149513,
|
|
"loss": 5.7174,
|
|
"mean_token_accuracy": 0.15102511942386626,
|
|
"num_tokens": 6663686.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 5.783023691177368,
|
|
"epoch": 0.1845072917281691,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00013821568301871384,
|
|
"loss": 5.6258,
|
|
"mean_token_accuracy": 0.1576993227005005,
|
|
"num_tokens": 6675024.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 5.800585174560547,
|
|
"epoch": 0.18480250339493418,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00013728216439707862,
|
|
"loss": 5.5729,
|
|
"mean_token_accuracy": 0.16412348449230194,
|
|
"num_tokens": 6685895.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 5.787184476852417,
|
|
"epoch": 0.18509771506169923,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00013635242137947419,
|
|
"loss": 5.6089,
|
|
"mean_token_accuracy": 0.16088414937257767,
|
|
"num_tokens": 6697743.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 5.7740270614624025,
|
|
"epoch": 0.1853929267284643,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00013542647945527498,
|
|
"loss": 5.6753,
|
|
"mean_token_accuracy": 0.1611410617828369,
|
|
"num_tokens": 6708218.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 5.740993070602417,
|
|
"epoch": 0.18568813839522938,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0001345043640096465,
|
|
"loss": 5.5008,
|
|
"mean_token_accuracy": 0.16368168592453003,
|
|
"num_tokens": 6718721.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 5.799624347686768,
|
|
"epoch": 0.18598335006199446,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00013358610032284957,
|
|
"loss": 5.5314,
|
|
"mean_token_accuracy": 0.17233487963676453,
|
|
"num_tokens": 6727954.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 5.787466764450073,
|
|
"epoch": 0.18627856172875953,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000132671713569547,
|
|
"loss": 5.6326,
|
|
"mean_token_accuracy": 0.16061407178640366,
|
|
"num_tokens": 6738430.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 5.719506311416626,
|
|
"epoch": 0.18657377339552458,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001317612288181136,
|
|
"loss": 5.61,
|
|
"mean_token_accuracy": 0.15734632611274718,
|
|
"num_tokens": 6748997.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 5.819878435134887,
|
|
"epoch": 0.18686898506228966,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00013085467102994864,
|
|
"loss": 5.5918,
|
|
"mean_token_accuracy": 0.1591557890176773,
|
|
"num_tokens": 6759072.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 5.772885704040528,
|
|
"epoch": 0.18716419672905474,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00012995206505879198,
|
|
"loss": 5.6223,
|
|
"mean_token_accuracy": 0.1591620162129402,
|
|
"num_tokens": 6769610.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 5.8425580024719235,
|
|
"epoch": 0.18745940839581982,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0001290534356500421,
|
|
"loss": 5.6084,
|
|
"mean_token_accuracy": 0.16121646612882615,
|
|
"num_tokens": 6780782.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 5.762476205825806,
|
|
"epoch": 0.18775462006258486,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00012815880744007827,
|
|
"loss": 5.5463,
|
|
"mean_token_accuracy": 0.16043894737958908,
|
|
"num_tokens": 6790851.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 5.7370658874511715,
|
|
"epoch": 0.18804983172934994,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00012726820495558483,
|
|
"loss": 5.5678,
|
|
"mean_token_accuracy": 0.16272690892219543,
|
|
"num_tokens": 6801589.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 5.6564442157745365,
|
|
"epoch": 0.18834504339611502,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00012638165261287868,
|
|
"loss": 5.4688,
|
|
"mean_token_accuracy": 0.1697412222623825,
|
|
"num_tokens": 6811138.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 5.768909311294555,
|
|
"epoch": 0.1886402550628801,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0001254991747172402,
|
|
"loss": 5.6257,
|
|
"mean_token_accuracy": 0.16441744118928908,
|
|
"num_tokens": 6821717.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 5.774107789993286,
|
|
"epoch": 0.18893546672964515,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00012462079546224662,
|
|
"loss": 5.616,
|
|
"mean_token_accuracy": 0.1642047420144081,
|
|
"num_tokens": 6831443.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 5.853254556655884,
|
|
"epoch": 0.18923067839641022,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00012374653892910896,
|
|
"loss": 5.7555,
|
|
"mean_token_accuracy": 0.15568666756153107,
|
|
"num_tokens": 6842463.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 5.782673931121826,
|
|
"epoch": 0.1895258900631753,
|
|
"grad_norm": 0.95703125,
|
|
"learning_rate": 0.00012287642908601166,
|
|
"loss": 5.5711,
|
|
"mean_token_accuracy": 0.16274176985025407,
|
|
"num_tokens": 6852733.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 5.77946367263794,
|
|
"epoch": 0.18982110172994038,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00012201048978745569,
|
|
"loss": 5.5899,
|
|
"mean_token_accuracy": 0.1607750117778778,
|
|
"num_tokens": 6862935.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 5.743497610092163,
|
|
"epoch": 0.19011631339670543,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00012114874477360427,
|
|
"loss": 5.5381,
|
|
"mean_token_accuracy": 0.16284307539463044,
|
|
"num_tokens": 6872453.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 5.839700651168823,
|
|
"epoch": 0.1904115250634705,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00012029121766963236,
|
|
"loss": 5.6595,
|
|
"mean_token_accuracy": 0.156102254986763,
|
|
"num_tokens": 6883666.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 5.766724395751953,
|
|
"epoch": 0.19070673673023558,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00011943793198507858,
|
|
"loss": 5.5328,
|
|
"mean_token_accuracy": 0.167246013879776,
|
|
"num_tokens": 6894426.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 5.764341545104981,
|
|
"epoch": 0.19100194839700066,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00011858891111320104,
|
|
"loss": 5.504,
|
|
"mean_token_accuracy": 0.16147956848144532,
|
|
"num_tokens": 6904377.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 5.798256063461304,
|
|
"epoch": 0.1912971600637657,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0001177441783303359,
|
|
"loss": 5.6677,
|
|
"mean_token_accuracy": 0.1521006077528,
|
|
"num_tokens": 6915562.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 5.80191068649292,
|
|
"epoch": 0.19159237173053079,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00011690375679525896,
|
|
"loss": 5.6489,
|
|
"mean_token_accuracy": 0.15743727684020997,
|
|
"num_tokens": 6926457.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 5.824286651611328,
|
|
"epoch": 0.19188758339729586,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00011606766954855124,
|
|
"loss": 5.6384,
|
|
"mean_token_accuracy": 0.15823860168457032,
|
|
"num_tokens": 6936334.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 5.7962206363677975,
|
|
"epoch": 0.19218279506406094,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00011523593951196702,
|
|
"loss": 5.5782,
|
|
"mean_token_accuracy": 0.1636389061808586,
|
|
"num_tokens": 6946042.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 5.74395170211792,
|
|
"epoch": 0.192478006730826,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00011440858948780523,
|
|
"loss": 5.4923,
|
|
"mean_token_accuracy": 0.17038260251283646,
|
|
"num_tokens": 6956938.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 5.757673835754394,
|
|
"epoch": 0.19277321839759107,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00011358564215828484,
|
|
"loss": 5.6156,
|
|
"mean_token_accuracy": 0.16025436371564866,
|
|
"num_tokens": 6966991.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 5.746864223480225,
|
|
"epoch": 0.19306843006435614,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00011276712008492254,
|
|
"loss": 5.5832,
|
|
"mean_token_accuracy": 0.16274152547121049,
|
|
"num_tokens": 6977886.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 5.7385866165161135,
|
|
"epoch": 0.19336364173112122,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00011195304570791451,
|
|
"loss": 5.5693,
|
|
"mean_token_accuracy": 0.1635870635509491,
|
|
"num_tokens": 6988573.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 5.820888233184815,
|
|
"epoch": 0.19365885339788627,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00011114344134552094,
|
|
"loss": 5.6058,
|
|
"mean_token_accuracy": 0.15930417329072952,
|
|
"num_tokens": 6999580.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 5.859188461303711,
|
|
"epoch": 0.19395406506465135,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0001103383291934545,
|
|
"loss": 5.6229,
|
|
"mean_token_accuracy": 0.1623999670147896,
|
|
"num_tokens": 7010134.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 5.767258930206299,
|
|
"epoch": 0.19424927673141643,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00010953773132427141,
|
|
"loss": 5.5683,
|
|
"mean_token_accuracy": 0.1686312139034271,
|
|
"num_tokens": 7021261.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 5.800924062728882,
|
|
"epoch": 0.1945444883981815,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00010874166968676677,
|
|
"loss": 5.661,
|
|
"mean_token_accuracy": 0.15775408297777177,
|
|
"num_tokens": 7032453.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 5.803249359130859,
|
|
"epoch": 0.19483970006494658,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00010795016610537251,
|
|
"loss": 5.5798,
|
|
"mean_token_accuracy": 0.163589771091938,
|
|
"num_tokens": 7042857.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 5.765978288650513,
|
|
"epoch": 0.19513491173171163,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00010716324227955904,
|
|
"loss": 5.5523,
|
|
"mean_token_accuracy": 0.16243090629577636,
|
|
"num_tokens": 7053225.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 5.756082010269165,
|
|
"epoch": 0.1954301233984767,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0001063809197832406,
|
|
"loss": 5.5568,
|
|
"mean_token_accuracy": 0.16806828528642653,
|
|
"num_tokens": 7063801.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 5.7724522113800045,
|
|
"epoch": 0.19572533506524178,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00010560322006418368,
|
|
"loss": 5.5896,
|
|
"mean_token_accuracy": 0.16277208775281907,
|
|
"num_tokens": 7074445.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 5.766079092025757,
|
|
"epoch": 0.19602054673200686,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00010483016444341887,
|
|
"loss": 5.5749,
|
|
"mean_token_accuracy": 0.16487774401903152,
|
|
"num_tokens": 7084701.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 5.702593231201172,
|
|
"epoch": 0.1963157583987719,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00010406177411465654,
|
|
"loss": 5.4887,
|
|
"mean_token_accuracy": 0.1718355655670166,
|
|
"num_tokens": 7093917.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 5.7620926856994625,
|
|
"epoch": 0.196610970065537,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00010329807014370562,
|
|
"loss": 5.5467,
|
|
"mean_token_accuracy": 0.16522724702954292,
|
|
"num_tokens": 7104132.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 5.7427873611450195,
|
|
"epoch": 0.19690618173230207,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00010253907346789632,
|
|
"loss": 5.6448,
|
|
"mean_token_accuracy": 0.15986778140068053,
|
|
"num_tokens": 7115452.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 5.746223115921021,
|
|
"epoch": 0.19720139339906714,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00010178480489550596,
|
|
"loss": 5.5894,
|
|
"mean_token_accuracy": 0.16073795408010483,
|
|
"num_tokens": 7126787.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 5.769065189361572,
|
|
"epoch": 0.1974966050658322,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00010103528510518836,
|
|
"loss": 5.5329,
|
|
"mean_token_accuracy": 0.16466716676950455,
|
|
"num_tokens": 7137360.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 5.810501766204834,
|
|
"epoch": 0.19779181673259727,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001002905346454073,
|
|
"loss": 5.521,
|
|
"mean_token_accuracy": 0.16664088517427444,
|
|
"num_tokens": 7147710.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 5.756278705596924,
|
|
"epoch": 0.19808702839936235,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 9.955057393387285e-05,
|
|
"loss": 5.5564,
|
|
"mean_token_accuracy": 0.16128555834293365,
|
|
"num_tokens": 7158220.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 5.745175886154175,
|
|
"epoch": 0.19838224006612742,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 9.88154232569816e-05,
|
|
"loss": 5.6594,
|
|
"mean_token_accuracy": 0.15377673804759978,
|
|
"num_tokens": 7169548.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.737645101547241,
|
|
"epoch": 0.19867745173289247,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 9.808510276926075e-05,
|
|
"loss": 5.5366,
|
|
"mean_token_accuracy": 0.16276393085718155,
|
|
"num_tokens": 7179460.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 5.72011981010437,
|
|
"epoch": 0.19897266339965755,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 9.735963249281549e-05,
|
|
"loss": 5.5491,
|
|
"mean_token_accuracy": 0.1626262381672859,
|
|
"num_tokens": 7190760.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 5.7490214824676515,
|
|
"epoch": 0.19926787506642263,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 9.663903231677974e-05,
|
|
"loss": 5.5989,
|
|
"mean_token_accuracy": 0.16210578083992006,
|
|
"num_tokens": 7201893.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 5.782834386825561,
|
|
"epoch": 0.1995630867331877,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 9.592332199677145e-05,
|
|
"loss": 5.6247,
|
|
"mean_token_accuracy": 0.15719615519046784,
|
|
"num_tokens": 7213177.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 5.778950214385986,
|
|
"epoch": 0.19985829839995276,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 9.521252115435061e-05,
|
|
"loss": 5.5313,
|
|
"mean_token_accuracy": 0.16254035830497743,
|
|
"num_tokens": 7223897.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 5.792777395248413,
|
|
"epoch": 0.20015351006671783,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 9.450664927648126e-05,
|
|
"loss": 5.6209,
|
|
"mean_token_accuracy": 0.1655363291501999,
|
|
"num_tokens": 7233857.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 5.791078853607178,
|
|
"epoch": 0.2004487217334829,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 9.380572571499758e-05,
|
|
"loss": 5.6202,
|
|
"mean_token_accuracy": 0.16208566278219222,
|
|
"num_tokens": 7243683.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 5.796296072006226,
|
|
"epoch": 0.200743933400248,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 9.310976968607307e-05,
|
|
"loss": 5.5878,
|
|
"mean_token_accuracy": 0.16011579632759093,
|
|
"num_tokens": 7253776.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 5.765210294723511,
|
|
"epoch": 0.20103914506701304,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 9.241880026969381e-05,
|
|
"loss": 5.5084,
|
|
"mean_token_accuracy": 0.16919710636138915,
|
|
"num_tokens": 7264403.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 5.732938146591186,
|
|
"epoch": 0.2013343567337781,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 9.173283640913537e-05,
|
|
"loss": 5.4704,
|
|
"mean_token_accuracy": 0.17303107380867006,
|
|
"num_tokens": 7275004.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 5.736631631851196,
|
|
"epoch": 0.2016295684005432,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 9.10518969104436e-05,
|
|
"loss": 5.567,
|
|
"mean_token_accuracy": 0.16141535341739655,
|
|
"num_tokens": 7286376.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 5.779485654830933,
|
|
"epoch": 0.20192478006730827,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 9.037600044191868e-05,
|
|
"loss": 5.5828,
|
|
"mean_token_accuracy": 0.16555774658918382,
|
|
"num_tokens": 7297794.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 5.776053237915039,
|
|
"epoch": 0.20221999173407332,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 8.970516553360383e-05,
|
|
"loss": 5.5545,
|
|
"mean_token_accuracy": 0.15885981172323227,
|
|
"num_tokens": 7308915.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 5.797372341156006,
|
|
"epoch": 0.2025152034008384,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 8.903941057677692e-05,
|
|
"loss": 5.5524,
|
|
"mean_token_accuracy": 0.1660393789410591,
|
|
"num_tokens": 7319904.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 5.741476202011109,
|
|
"epoch": 0.20281041506760347,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 8.837875382344635e-05,
|
|
"loss": 5.5347,
|
|
"mean_token_accuracy": 0.16487182527780533,
|
|
"num_tokens": 7330532.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 5.83712248802185,
|
|
"epoch": 0.20310562673436855,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 8.772321338585076e-05,
|
|
"loss": 5.5917,
|
|
"mean_token_accuracy": 0.15676416531205178,
|
|
"num_tokens": 7341939.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 5.775734186172485,
|
|
"epoch": 0.2034008384011336,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 8.707280723596242e-05,
|
|
"loss": 5.5978,
|
|
"mean_token_accuracy": 0.1582491874694824,
|
|
"num_tokens": 7352751.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 5.7841394424438475,
|
|
"epoch": 0.20369605006789868,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 8.64275532049944e-05,
|
|
"loss": 5.5153,
|
|
"mean_token_accuracy": 0.15810773521661758,
|
|
"num_tokens": 7362920.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 5.7496765613555905,
|
|
"epoch": 0.20399126173466375,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 8.578746898291198e-05,
|
|
"loss": 5.595,
|
|
"mean_token_accuracy": 0.15635207593441008,
|
|
"num_tokens": 7373914.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 5.806713342666626,
|
|
"epoch": 0.20428647340142883,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 8.515257211794742e-05,
|
|
"loss": 5.5881,
|
|
"mean_token_accuracy": 0.16159606873989105,
|
|
"num_tokens": 7384349.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 5.759683752059937,
|
|
"epoch": 0.2045816850681939,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 8.452288001611896e-05,
|
|
"loss": 5.6262,
|
|
"mean_token_accuracy": 0.16655662655830383,
|
|
"num_tokens": 7396316.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 5.787339496612549,
|
|
"epoch": 0.20487689673495896,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 8.389840994075379e-05,
|
|
"loss": 5.5704,
|
|
"mean_token_accuracy": 0.1541933573782444,
|
|
"num_tokens": 7405908.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 5.77188081741333,
|
|
"epoch": 0.20517210840172403,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 8.327917901201435e-05,
|
|
"loss": 5.5183,
|
|
"mean_token_accuracy": 0.1670460060238838,
|
|
"num_tokens": 7415857.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.729412412643432,
|
|
"epoch": 0.2054673200684891,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 8.266520420642931e-05,
|
|
"loss": 5.5365,
|
|
"mean_token_accuracy": 0.16095506846904756,
|
|
"num_tokens": 7426512.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 5.747371482849121,
|
|
"epoch": 0.2057625317352542,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 8.205650235642828e-05,
|
|
"loss": 5.6519,
|
|
"mean_token_accuracy": 0.15504808723926544,
|
|
"num_tokens": 7438694.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 5.800349187850952,
|
|
"epoch": 0.20605774340201924,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 8.145309014987978e-05,
|
|
"loss": 5.6495,
|
|
"mean_token_accuracy": 0.15608270317316056,
|
|
"num_tokens": 7450022.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 5.765336561203003,
|
|
"epoch": 0.20635295506878432,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 8.085498412963437e-05,
|
|
"loss": 5.5251,
|
|
"mean_token_accuracy": 0.1632489189505577,
|
|
"num_tokens": 7460227.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 5.806002140045166,
|
|
"epoch": 0.2066481667355494,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 8.026220069307078e-05,
|
|
"loss": 5.666,
|
|
"mean_token_accuracy": 0.15650010854005814,
|
|
"num_tokens": 7470958.0,
|
|
"step": 3500
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.090657437696e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|